Files
project_7/qwen3_6_scripts
project6-dev f1a408c75f fix: cap default_max_tokens at 8192 — prevent OOM kill on unlimited generation
t3_max_tokens_none test sends request without max_tokens.
With max_model_len=262144, default_max_tokens was ~260K tokens.
Model generates indefinitely at 12 TPS, container gets OOM killed after ~6min.
Cap at 8192 prevents memory exhaustion while still allowing long outputs.
2026-08-12 04:06:21 +00:00
..