name: think_baseline base_model: Qwen3-4B-Base method: full SFT (ZeRO-3) dataset: think_all template: qwen3 epochs: 2 seed: 42 cutoff_len: 24576 learning_rate: 2e-5 train_loss: 0.6698 train_steps: 838 finished_at: 2026-06-08 00:22 CST