# enginex-bi100-compat 的启动配置 # # 与平台 bi-100 × vllm × text-generation 的原生 build-config 逐项一致, # 只把 command 换成「先过 preflight 再 exec 原命令」: # python3 /workspace/compat/serve.py -- <原 command...> # # 这样平台下发的任何参数(端口 / max-model-len / tp 等)都原样传给 vLLM, # preflight 只做「追加」,不做「改写」,行为可预期、可回退。 concurrency: 1 command: - python3 - /workspace/compat/serve.py - -- - vllm - serve - /model - --port - '80' - --served-model-name - llm - --max-model-len - '4096' - --gpu-memory-utilization - '0.9' - --enforce-eager - --trust-remote-code - -tp - '1' env: - name: PYTHONPATH value: /workspace/compat/shims:/workspace/compat