{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 4.0, "eval_steps": 100, "global_step": 644, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.12422360248447205, "grad_norm": 15.3125, "learning_rate": 7.755102040816327e-06, "loss": 3.1538, "step": 20 }, { "epoch": 0.2484472049689441, "grad_norm": 4.21875, "learning_rate": 1.5918367346938776e-05, "loss": 0.3551, "step": 40 }, { "epoch": 0.37267080745341613, "grad_norm": 4.4375, "learning_rate": 1.9994132020337718e-05, "loss": 0.3427, "step": 60 }, { "epoch": 0.4968944099378882, "grad_norm": 3.703125, "learning_rate": 1.99472294947797e-05, "loss": 0.3533, "step": 80 }, { "epoch": 0.6211180124223602, "grad_norm": 4.28125, "learning_rate": 1.98536445575164e-05, "loss": 0.3258, "step": 100 }, { "epoch": 0.6211180124223602, "eval_loss": 0.3044624626636505, "eval_runtime": 46.1922, "eval_samples_per_second": 14.007, "eval_steps_per_second": 7.014, "step": 100 }, { "epoch": 0.7453416149068323, "grad_norm": 4.34375, "learning_rate": 1.971381640325756e-05, "loss": 0.3598, "step": 120 }, { "epoch": 0.8695652173913043, "grad_norm": 2.875, "learning_rate": 1.952840124642636e-05, "loss": 0.3572, "step": 140 }, { "epoch": 0.9937888198757764, "grad_norm": 3.359375, "learning_rate": 1.9298269241540908e-05, "loss": 0.3251, "step": 160 }, { "epoch": 1.1180124223602483, "grad_norm": 2.875, "learning_rate": 1.9024500399573536e-05, "loss": 0.3263, "step": 180 }, { "epoch": 1.2422360248447206, "grad_norm": 3.515625, "learning_rate": 1.8708379519452372e-05, "loss": 0.326, "step": 200 }, { "epoch": 1.2422360248447206, "eval_loss": 0.2889421284198761, "eval_runtime": 46.0702, "eval_samples_per_second": 14.044, "eval_steps_per_second": 7.033, "step": 200 }, { "epoch": 1.3664596273291925, "grad_norm": 2.4375, "learning_rate": 1.835139015849177e-05, "loss": 0.3128, "step": 220 }, { "epoch": 1.4906832298136645, "grad_norm": 2.65625, "learning_rate": 1.7955207670048306e-05, "loss": 0.3101, "step": 240 }, { "epoch": 1.6149068322981366, "grad_norm": 4.0625, "learning_rate": 1.7521691341076774e-05, "loss": 0.347, "step": 260 }, { "epoch": 1.7391304347826086, "grad_norm": 2.984375, "learning_rate": 1.7052875666484584e-05, "loss": 0.3063, "step": 280 }, { "epoch": 1.8633540372670807, "grad_norm": 3.015625, "learning_rate": 1.6550960801234152e-05, "loss": 0.3115, "step": 300 }, { "epoch": 1.8633540372670807, "eval_loss": 0.2829993963241577, "eval_runtime": 46.2888, "eval_samples_per_second": 13.977, "eval_steps_per_second": 7.0, "step": 300 }, { "epoch": 1.9875776397515528, "grad_norm": 2.46875, "learning_rate": 1.601830223500156e-05, "loss": 0.3225, "step": 320 }, { "epoch": 2.111801242236025, "grad_norm": 4.40625, "learning_rate": 1.5457399737848445e-05, "loss": 0.2985, "step": 340 }, { "epoch": 2.2360248447204967, "grad_norm": 2.828125, "learning_rate": 1.4870885628785075e-05, "loss": 0.2862, "step": 360 }, { "epoch": 2.360248447204969, "grad_norm": 2.40625, "learning_rate": 1.426151242228039e-05, "loss": 0.2951, "step": 380 }, { "epoch": 2.4844720496894412, "grad_norm": 3.015625, "learning_rate": 1.3632139910693971e-05, "loss": 0.2743, "step": 400 }, { "epoch": 2.4844720496894412, "eval_loss": 0.27418315410614014, "eval_runtime": 46.3638, "eval_samples_per_second": 13.955, "eval_steps_per_second": 6.988, "step": 400 }, { "epoch": 2.608695652173913, "grad_norm": 2.28125, "learning_rate": 1.2985721743252206e-05, "loss": 0.3003, "step": 420 }, { "epoch": 2.732919254658385, "grad_norm": 2.53125, "learning_rate": 1.232529156455353e-05, "loss": 0.272, "step": 440 }, { "epoch": 2.857142857142857, "grad_norm": 2.796875, "learning_rate": 1.1653948777654925e-05, "loss": 0.2959, "step": 460 }, { "epoch": 2.981366459627329, "grad_norm": 2.390625, "learning_rate": 1.097484399855352e-05, "loss": 0.2921, "step": 480 }, { "epoch": 3.1055900621118013, "grad_norm": 5.0625, "learning_rate": 1.029116427032555e-05, "loss": 0.2574, "step": 500 }, { "epoch": 3.1055900621118013, "eval_loss": 0.27571436762809753, "eval_runtime": 46.2058, "eval_samples_per_second": 14.003, "eval_steps_per_second": 7.012, "step": 500 }, { "epoch": 3.229813664596273, "grad_norm": 3.625, "learning_rate": 9.606118106312788e-06, "loss": 0.2499, "step": 520 }, { "epoch": 3.3540372670807455, "grad_norm": 4.875, "learning_rate": 8.922920432548891e-06, "loss": 0.2531, "step": 540 }, { "epoch": 3.4782608695652173, "grad_norm": 4.59375, "learning_rate": 8.24477750009095e-06, "loss": 0.2449, "step": 560 }, { "epoch": 3.6024844720496896, "grad_norm": 3.390625, "learning_rate": 7.574871838062751e-06, "loss": 0.2618, "step": 580 }, { "epoch": 3.7267080745341614, "grad_norm": 5.375, "learning_rate": 6.916347318025194e-06, "loss": 0.2613, "step": 600 }, { "epoch": 3.7267080745341614, "eval_loss": 0.26501935720443726, "eval_runtime": 46.1464, "eval_samples_per_second": 14.021, "eval_steps_per_second": 7.021, "step": 600 }, { "epoch": 3.8509316770186337, "grad_norm": 2.84375, "learning_rate": 6.2722943997669695e-06, "loss": 0.2476, "step": 620 }, { "epoch": 3.9751552795031055, "grad_norm": 5.34375, "learning_rate": 5.645735627756951e-06, "loss": 0.247, "step": 640 } ], "logging_steps": 20, "max_steps": 966, "num_input_tokens_seen": 0, "num_train_epochs": 6, "save_steps": 161, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6.782602179417293e+16, "train_batch_size": 2, "trial_name": null, "trial_params": null }