48 lines
1012 B
YAML
48 lines
1012 B
YAML
|
|
port: 8004
|
||
|
|
env:
|
||
|
|
VLLM_MODEL: kristaller486/dots.ocr-1.5
|
||
|
|
VLLM_MAX_TOKENS: 24000
|
||
|
|
VLLM_TEMPERATURE: 0.2
|
||
|
|
VLLM_TOP_P: 0.9
|
||
|
|
VLLM_REQUEST_TIMEOUT: 3000.0
|
||
|
|
VLLM_MAX_MODEL_LEN: 32768
|
||
|
|
VLLM_WORKER_MULTIPROC_METHOD: spawn
|
||
|
|
VLLM_LOGGING_LEVEL: INFO
|
||
|
|
HF_HUB_ENABLE_HF_TRANSFER: 1
|
||
|
|
HF_HOME: /root/.cache/huggingface
|
||
|
|
VLLM_DOWNLOAD_DIR: /root/.cache/huggingface
|
||
|
|
CUDA_LAUNCH_BLOCKING: 0
|
||
|
|
LOG_LEVEL: INFO
|
||
|
|
VLLM_PORT: 8005
|
||
|
|
TRANSFORMERS_OFFLINE: 1
|
||
|
|
|
||
|
|
gpu:
|
||
|
|
nodeRoleKey: node-role.deckhouse.io/worker
|
||
|
|
tolerationKey: dedicated
|
||
|
|
tolerationValue: ""
|
||
|
|
|
||
|
|
resources:
|
||
|
|
_default:
|
||
|
|
requests:
|
||
|
|
cpu: "1"
|
||
|
|
memory: "10Gi"
|
||
|
|
limits:
|
||
|
|
memory: "10Gi"
|
||
|
|
nvidia.com/gpu: 1
|
||
|
|
|
||
|
|
storage:
|
||
|
|
size:
|
||
|
|
_default: 10Gi
|
||
|
|
class:
|
||
|
|
_default: local-storage-class-worker
|
||
|
|
|
||
|
|
ingress:
|
||
|
|
className:
|
||
|
|
_default: nginx
|
||
|
|
host:
|
||
|
|
_default: vllm.pro.lukoil.com
|
||
|
|
preprod: vllm.preprod.pro.lukoil.com
|
||
|
|
prod: vllm.prod.pro.lukoil.com
|
||
|
|
secretName:
|
||
|
|
_default: vllm-tls
|