project6-dev f1a408c75f fix: cap default_max_tokens at 8192 — prevent OOM kill on unlimited generation
t3_max_tokens_none test sends request without max_tokens.
With max_model_len=262144, default_max_tokens was ~260K tokens.
Model generates indefinitely at 12 TPS, container gets OOM killed after ~6min.
Cap at 8192 prevents memory exhaustion while still allowing long outputs.
2026-08-12 04:06:21 +00:00
Description
No description provided
15 MiB
Languages
Python 88.5%
Cuda 9.2%
Shell 2.3%