18 lines
392 B
Plaintext
18 lines
392 B
Plaintext
name: think_s1_ep23
|
|
base_model: Qwen3-4B-Base (continued from checkpoint-302)
|
|
method: full SFT (ZeRO-3)
|
|
dataset: ocr_think_50k
|
|
template: qwen3
|
|
epochs: 2
|
|
seed: 42
|
|
cutoff_len: 24576
|
|
packing: true
|
|
neat_packing: false
|
|
per_device_train_batch_size: 1
|
|
gradient_accumulation_steps: 16
|
|
effective_batch_size: 64
|
|
learning_rate: 5e-5
|
|
train_loss: 0.5416
|
|
train_steps: 604
|
|
finished_at: 2026-06-10 05:23 CST
|