name: think_s1_ep23 base_model: Qwen3-4B-Base (continued from checkpoint-302) method: full SFT (ZeRO-3) dataset: ocr_think_50k template: qwen3 epochs: 2 seed: 42 cutoff_len: 24576 packing: true neat_packing: false per_device_train_batch_size: 1 gradient_accumulation_steps: 16 effective_batch_size: 64 learning_rate: 5e-5 train_loss: 0.5416 train_steps: 604 finished_at: 2026-06-10 05:23 CST