port: 8004 env: VLLM_MODEL: kristaller486/dots.ocr-1.5 VLLM_MAX_TOKENS: 24000 VLLM_TEMPERATURE: 0.2 VLLM_TOP_P: 0.9 VLLM_REQUEST_TIMEOUT: 3000.0 VLLM_MAX_MODEL_LEN: 32768 VLLM_WORKER_MULTIPROC_METHOD: spawn VLLM_LOGGING_LEVEL: INFO HF_HUB_ENABLE_HF_TRANSFER: 1 HF_HOME: /root/.cache/huggingface VLLM_DOWNLOAD_DIR: /root/.cache/huggingface CUDA_LAUNCH_BLOCKING: 0 LOG_LEVEL: INFO VLLM_PORT: 8005 TRANSFORMERS_OFFLINE: 1 gpu: enabled: true nodeSelector: node-role.deckhouse.io/cuda-worker: "" tolerations: - key: dedicated.deckhouse.io operator: Equal value: cuda-worker effect: NoExecute resources: _default: requests: cpu: "1" memory: "10Gi" limits: memory: "10Gi" nvidia.com/gpu: 1 storage: size: _default: 10Gi class: _default: local-storage-class-worker ingress: className: _default: nginx host: _default: vllm.pro.lukoil.com preprod: vllm.preprod.pro.lukoil.com prod: vllm.prod.pro.lukoil.com secretName: _default: vllm-tls