fix(yaml): align launch params with comp 168 proven config
- max_model_len: 80000 → 256000 (comp 168 value) - gpu_memory_utilization: 0.9 → 0.95 - Added: --max-num-batched-tokens 4096, --enable-chunked-prefill - Removed: VLLM_COREX_*_LIBRARY env vars (those .so don't exist in base image) - Added ixformer dir to LD_LIBRARY_PATH for runtime symbol resolution
This commit is contained in:
@@ -8,14 +8,17 @@ command:
|
|||||||
- --served-model-name
|
- --served-model-name
|
||||||
- llm
|
- llm
|
||||||
- --max-model-len
|
- --max-model-len
|
||||||
- '80000'
|
- '256000'
|
||||||
- --gpu-memory-utilization
|
- --gpu-memory-utilization
|
||||||
- '0.9'
|
- '0.95'
|
||||||
- --trust-remote-code
|
- --trust-remote-code
|
||||||
- -tp
|
- -tp
|
||||||
- '4'
|
- '4'
|
||||||
- --max-num-seqs
|
- --max-num-seqs
|
||||||
- '2'
|
- '2'
|
||||||
|
- --max-num-batched-tokens
|
||||||
|
- '4096'
|
||||||
|
- --enable-chunked-prefill
|
||||||
- --disable-log-requests
|
- --disable-log-requests
|
||||||
- --disable-frontend-multiprocessing
|
- --disable-frontend-multiprocessing
|
||||||
- --enforce-eager
|
- --enforce-eager
|
||||||
@@ -39,17 +42,7 @@ env:
|
|||||||
- name: PYTHONPATH
|
- name: PYTHONPATH
|
||||||
value: /usr/local/corex/lib/python3/dist-packages:/usr/local/corex/lib64/python3/dist-packages
|
value: /usr/local/corex/lib/python3/dist-packages:/usr/local/corex/lib64/python3/dist-packages
|
||||||
- name: LD_LIBRARY_PATH
|
- name: LD_LIBRARY_PATH
|
||||||
value: /usr/local/corex/lib64:/usr/local/openmpi/lib
|
value: /usr/local/corex/lib64:/usr/local/openmpi/lib:/usr/local/corex/lib64/python3/dist-packages/ixformer
|
||||||
- name: VLLM_COREX_FA2_LIBRARY
|
|
||||||
value: /usr/local/corex/lib64/libcorex_fa2.so
|
|
||||||
- name: VLLM_COREX_GDN_LIBRARY
|
|
||||||
value: /usr/local/corex/lib64/libcorex_gdn.so
|
|
||||||
- name: VLLM_COREX_MOE_LIBRARY
|
|
||||||
value: /usr/local/corex/lib64/libcorex_moe.so
|
|
||||||
- name: VLLM_REQUEST_METRICS_FILE
|
|
||||||
value: /tmp/vllm-request-metrics.jsonl
|
|
||||||
- name: VLLM_CACHE_BLOCK_SIZE
|
|
||||||
value: '16'
|
|
||||||
- name: PYTORCH_CUDA_ALLOC_CONF
|
- name: PYTORCH_CUDA_ALLOC_CONF
|
||||||
value: max_split_size_mb:512
|
value: max_split_size_mb:512
|
||||||
- name: OMP_NUM_THREADS
|
- name: OMP_NUM_THREADS
|
||||||
|
|||||||
Reference in New Issue
Block a user