port: 11434 gpu: enabled: true nodeRoleKey: node-role.deckhouse.io/worker tolerationKey: dedicated tolerationValue: "" nvidiaResource: "nvidia.com/gpu" env: OLLAMA_MULTIUSER_CACHE: true OLLAMA_FLASH_ATTENTION: true OLLAMA_NOHISTORY: true OLLAMA_NEW_ENGINE: true OLLAMA_NUM_PARALLEL: 4 OLLAMA_KEEP_ALIVE: -1 OLLAMA_DEBUG: "1" OLLAMA_CONTEXT_LENGTH: "32000" models: #pull: #- gemma3:12b run: - alibayram/Qwen3-30B-A3B-Instruct-2507:latest clean: false insecure: false resources: _default: requests: memory: "10Gi" limits: memory: "12Gi" nvidia.com/gpu: 1 preprod: requests: cpu: "1" memory: "10Gi" limits: memory: "12Gi" nvidia.com/gpu: 1 prod: requests: cpu: "1" memory: "10Gi" limits: memory: "12Gi" nvidia.com/gpu: 1 storage: size: _default: 10Gi class: _default: local-storage-class-worker ingress: className: _default: nginx host: _default: ollama.pro.lukoil.com preprod: ollama.preprod.pro.lukoil.com prod: ollama.prod.pro.lukoil.com secretName: _default: ollama-tls