77 lines
1.3 KiB
YAML
77 lines
1.3 KiB
YAML
global:
|
|
cluster: ""
|
|
|
|
env: dev
|
|
|
|
imagePullSecrets:
|
|
- name: registrysecret
|
|
|
|
image:
|
|
ollama: 192.168.10.68:5000/ollama/ollama:0.30.11
|
|
|
|
port: 11434
|
|
|
|
gpu:
|
|
enabled: true
|
|
nodeSelector:
|
|
node-role.deckhouse.io/cuda-worker: ""
|
|
tolerations:
|
|
- key: dedicated.deckhouse.io
|
|
operator: Equal
|
|
value: cuda-worker
|
|
effect: NoExecute
|
|
nvidiaResource: "nvidia.com/gpu"
|
|
|
|
envVars:
|
|
OLLAMA_MULTIUSER_CACHE: true
|
|
OLLAMA_FLASH_ATTENTION: true
|
|
OLLAMA_NOHISTORY: true
|
|
OLLAMA_NEW_ENGINE: true
|
|
OLLAMA_NUM_PARALLEL: 4
|
|
OLLAMA_KEEP_ALIVE: -1
|
|
OLLAMA_DEBUG: "1"
|
|
OLLAMA_CONTEXT_LENGTH: "32000"
|
|
|
|
models:
|
|
run:
|
|
- alibayram/Qwen3-30B-A3B-Instruct-2507:latest
|
|
clean: false
|
|
|
|
insecure: false
|
|
|
|
resources:
|
|
_default:
|
|
requests:
|
|
memory: "10Gi"
|
|
limits:
|
|
memory: "12Gi"
|
|
nvidia.com/gpu: 1
|
|
preprod:
|
|
requests:
|
|
cpu: "1"
|
|
memory: "10Gi"
|
|
limits:
|
|
memory: "12Gi"
|
|
nvidia.com/gpu: 1
|
|
prod:
|
|
requests:
|
|
cpu: "1"
|
|
memory: "10Gi"
|
|
limits:
|
|
memory: "12Gi"
|
|
nvidia.com/gpu: 1
|
|
|
|
storage:
|
|
size:
|
|
_default: 10Gi
|
|
class:
|
|
_default: localpath
|
|
|
|
ingress:
|
|
className:
|
|
_default: nginx
|
|
host:
|
|
_default: ollama.valdemorte.online
|
|
preprod: ollama.preprod.valdemorte.online
|
|
prod: ollama.prod.valdemorte.online
|