fix perforence
This commit is contained in:
@@ -8,7 +8,7 @@ command:
|
||||
- --served-model-name
|
||||
- llm
|
||||
- --max-model-len
|
||||
- '100000'
|
||||
- '245000'
|
||||
- --gpu-memory-utilization
|
||||
- '0.9'
|
||||
- --trust-remote-code
|
||||
@@ -19,16 +19,40 @@ command:
|
||||
- --disable-log-requests
|
||||
- --disable-frontend-multiprocessing
|
||||
- --max-num-batched-tokens
|
||||
- '8192'
|
||||
- '16384'
|
||||
- --enable-chunked-prefill
|
||||
- --max-seq-len-to-capture
|
||||
- '32768'
|
||||
- '245000'
|
||||
- --enable-auto-tool-choice
|
||||
- --tool-call-parser
|
||||
- qwen3_coder
|
||||
- --reasoning-parser
|
||||
- qwen3
|
||||
- --enable-prefix-caching
|
||||
# multi_system 兼容: 合并多/乱序 system 消息到首位, 消除 "System message must
|
||||
# be at the beginning" 4xx (数据集 34 条多 system 请求, 原模板 raise 致 15 条 4xx)。
|
||||
# 模型目录只读, patch_ops.sh 把改后模板部署到 /workspace/ (见 Dockerfile WORKDIR)。
|
||||
- --chat-template
|
||||
- /workspace/chat_template_multi_system.jinja
|
||||
env:
|
||||
- name: VLLM_ENGINE_ITERATION_TIMEOUT_S
|
||||
value: 3600
|
||||
# corex runtime paths (must match patch_ops.sh)
|
||||
- name: PYTHONPATH
|
||||
value: /usr/local/corex/lib64/python3/dist-packages
|
||||
- name: LD_LIBRARY_PATH
|
||||
value: /usr/local/corex/lib64:/usr/local/iluvatar/lib64:/usr/local/openmpi/lib
|
||||
- name: PATH
|
||||
value: /usr/local/corex/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin:/usr/local/openmpi/bin
|
||||
# five GatedDeltaNet/MoE/attention optimizations (default ON; =0 to disable)
|
||||
- name: MOE_NATIVE
|
||||
value: '1'
|
||||
- name: CHUNK_PARALLEL
|
||||
value: '1'
|
||||
- name: PREFIX_FLASH
|
||||
value: '1'
|
||||
- name: RMSNORM_NATIVE
|
||||
value: '1'
|
||||
- name: LOOP1_NATIVE
|
||||
value: '1'
|
||||
|
||||
|
||||
Reference in New Issue
Block a user