66 lines
1.1 KiB
YAML
66 lines
1.1 KiB
YAML
|
|
port: 11434
|
||
|
|
|
||
|
|
gpu:
|
||
|
|
enabled: true
|
||
|
|
nodeRoleKey: node-role.deckhouse.io/worker
|
||
|
|
tolerationKey: dedicated
|
||
|
|
tolerationValue: ""
|
||
|
|
nvidiaResource: "nvidia.com/gpu"
|
||
|
|
|
||
|
|
env:
|
||
|
|
OLLAMA_MULTIUSER_CACHE: true
|
||
|
|
OLLAMA_FLASH_ATTENTION: true
|
||
|
|
OLLAMA_NOHISTORY: true
|
||
|
|
OLLAMA_NEW_ENGINE: true
|
||
|
|
OLLAMA_NUM_PARALLEL: 4
|
||
|
|
OLLAMA_KEEP_ALIVE: -1
|
||
|
|
OLLAMA_DEBUG: "1"
|
||
|
|
OLLAMA_CONTEXT_LENGTH: "32000"
|
||
|
|
|
||
|
|
models:
|
||
|
|
#pull:
|
||
|
|
#- gemma3:12b
|
||
|
|
run:
|
||
|
|
- alibayram/Qwen3-30B-A3B-Instruct-2507:latest
|
||
|
|
clean: false
|
||
|
|
|
||
|
|
insecure: false
|
||
|
|
|
||
|
|
resources:
|
||
|
|
_default:
|
||
|
|
requests:
|
||
|
|
memory: "10Gi"
|
||
|
|
limits:
|
||
|
|
memory: "12Gi"
|
||
|
|
nvidia.com/gpu: 1
|
||
|
|
preprod:
|
||
|
|
requests:
|
||
|
|
cpu: "1"
|
||
|
|
memory: "10Gi"
|
||
|
|
limits:
|
||
|
|
memory: "12Gi"
|
||
|
|
nvidia.com/gpu: 1
|
||
|
|
prod:
|
||
|
|
requests:
|
||
|
|
cpu: "1"
|
||
|
|
memory: "10Gi"
|
||
|
|
limits:
|
||
|
|
memory: "12Gi"
|
||
|
|
nvidia.com/gpu: 1
|
||
|
|
|
||
|
|
storage:
|
||
|
|
size:
|
||
|
|
_default: 10Gi
|
||
|
|
class:
|
||
|
|
_default: local-storage-class-worker
|
||
|
|
|
||
|
|
ingress:
|
||
|
|
className:
|
||
|
|
_default: nginx
|
||
|
|
host:
|
||
|
|
_default: ollama.pro.lukoil.com
|
||
|
|
preprod: ollama.preprod.pro.lukoil.com
|
||
|
|
prod: ollama.prod.pro.lukoil.com
|
||
|
|
secretName:
|
||
|
|
_default: ollama-tls
|