upstream(xllm): sync to jd-opensource/xllm latest + revert serving_chat.py
搬运 jd-opensource/xllm 最新代码到 upstream_ref/xllm_latest/: - core/kernels/ilu/ 10 files (ixformer.h API 不变) - core/layers/ilu/ 4 files (fused_moe.cpp config 访问从 FLAGS→singleton) - core/layers/npu_torch/ 14 files (qwen3_gated_delta_net_base.cpp 576→1164行, 新增 repeat_tensor_heads, checkpoint_stride, spec_verify 等 GDN 功能) - models/llm/ 5 files (qwen3_5.h 模型注册重构, 新增 qwen3_5_mtp_base.h) - models/vlm/ 1 file (qwen3_5.h 218→440行) serving_chat.py: 还原到8030a11b原版,删掉6dcf3590的语法错误 min(8192, (缺右括号导致 py_compile 失败)
This commit is contained in:
@@ -394,7 +394,7 @@ class OpenAIServingChat(OpenAIServing):
|
||||
assert prompt_inputs is not None
|
||||
|
||||
sampling_params: Union[SamplingParams, BeamSearchParams]
|
||||
default_max_tokens = min(8192, self.max_model_len - len(
|
||||
default_max_tokens = self.max_model_len - len(
|
||||
prompt_inputs["prompt_token_ids"])
|
||||
if request.use_beam_search:
|
||||
sampling_params = request.to_beam_search_params(
|
||||
|
||||
Reference in New Issue
Block a user