concurrency: 1 command: - python3 - -m - vllm.entrypoints.openai.api_server - --model - /model - --served-model-name - llm - --max-model-len - '245000' - --gpu-memory-utilization - '0.9' - --trust-remote-code - -tp - '4' - --max-num-seqs - '1' - --disable-log-requests - --disable-frontend-multiprocessing - --max-num-batched-tokens - '16384' - --enable-chunked-prefill - --max-seq-len-to-capture - '245000' - --enable-auto-tool-choice - --tool-call-parser - qwen3_coder - --reasoning-parser - qwen3 - --enable-prefix-caching # multi_system 兼容: 合并多/乱序 system 消息到首位, 消除 "System message must # be at the beginning" 4xx (数据集 34 条多 system 请求, 原模板 raise 致 15 条 4xx)。 # 模型目录只读, patch_ops.sh 把改后模板部署到 /workspace/ (见 Dockerfile WORKDIR)。 - --chat-template - /workspace/chat_template_multi_system.jinja env: - name: VLLM_ENGINE_ITERATION_TIMEOUT_S value: 3600 # corex runtime paths (must match patch_ops.sh) - name: PYTHONPATH value: /usr/local/corex/lib64/python3/dist-packages - name: LD_LIBRARY_PATH value: /usr/local/corex/lib64:/usr/local/iluvatar/lib64:/usr/local/openmpi/lib - name: PATH value: /usr/local/corex/bin:/usr/local/sbin:/usr/local/bin:/usr/sbin:/usr/bin:/sbin:/bin:/usr/local/openmpi/bin # five GatedDeltaNet/MoE/attention optimizations (default ON; =0 to disable) - name: MOE_NATIVE value: '1' - name: CHUNK_PARALLEL value: '1' - name: PREFIX_FLASH value: '1' - name: RMSNORM_NATIVE value: '1' - name: LOOP1_NATIVE value: '1'