53 lines
1.1 KiB
YAML
53 lines
1.1 KiB
YAML
port: 8004
|
|
env:
|
|
VLLM_MODEL: kristaller486/dots.ocr-1.5
|
|
VLLM_MAX_TOKENS: 24000
|
|
VLLM_TEMPERATURE: 0.2
|
|
VLLM_TOP_P: 0.9
|
|
VLLM_REQUEST_TIMEOUT: 3000.0
|
|
VLLM_MAX_MODEL_LEN: 32768
|
|
VLLM_WORKER_MULTIPROC_METHOD: spawn
|
|
VLLM_LOGGING_LEVEL: INFO
|
|
HF_HUB_ENABLE_HF_TRANSFER: 1
|
|
HF_HOME: /root/.cache/huggingface
|
|
VLLM_DOWNLOAD_DIR: /root/.cache/huggingface
|
|
CUDA_LAUNCH_BLOCKING: 0
|
|
LOG_LEVEL: INFO
|
|
VLLM_PORT: 8005
|
|
TRANSFORMERS_OFFLINE: 1
|
|
|
|
gpu:
|
|
enabled: true
|
|
nodeSelector:
|
|
node-role.deckhouse.io/cuda-worker: ""
|
|
tolerations:
|
|
- key: dedicated.deckhouse.io
|
|
operator: Equal
|
|
value: cuda-worker
|
|
effect: NoExecute
|
|
|
|
resources:
|
|
_default:
|
|
requests:
|
|
cpu: "1"
|
|
memory: "10Gi"
|
|
limits:
|
|
memory: "10Gi"
|
|
nvidia.com/gpu: 1
|
|
|
|
storage:
|
|
size:
|
|
_default: 10Gi
|
|
class:
|
|
_default: local-storage-class-worker
|
|
|
|
ingress:
|
|
className:
|
|
_default: nginx
|
|
host:
|
|
_default: vllm.pro.lukoil.com
|
|
preprod: vllm.preprod.pro.lukoil.com
|
|
prod: vllm.prod.pro.lukoil.com
|
|
secretName:
|
|
_default: vllm-tls
|