{ "best_metric": null, "best_model_checkpoint": null, "epoch": 4.977777777777778, "eval_steps": 500, "global_step": 560, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.044444444444444446, "grad_norm": 40.8252015336812, "learning_rate": 4.4642857142857147e-07, "loss": 2.7614, "step": 5 }, { "epoch": 0.08888888888888889, "grad_norm": 41.40766383255297, "learning_rate": 8.928571428571429e-07, "loss": 2.5209, "step": 10 }, { "epoch": 0.13333333333333333, "grad_norm": 19.36067123800515, "learning_rate": 1.3392857142857143e-06, "loss": 2.3634, "step": 15 }, { "epoch": 0.17777777777777778, "grad_norm": 13.847149981096214, "learning_rate": 1.7857142857142859e-06, "loss": 2.1595, "step": 20 }, { "epoch": 0.2222222222222222, "grad_norm": 9.243065607906033, "learning_rate": 2.2321428571428573e-06, "loss": 1.8998, "step": 25 }, { "epoch": 0.26666666666666666, "grad_norm": 9.15946624628624, "learning_rate": 2.6785714285714285e-06, "loss": 1.8978, "step": 30 }, { "epoch": 0.3111111111111111, "grad_norm": 7.049829158102999, "learning_rate": 3.125e-06, "loss": 1.8639, "step": 35 }, { "epoch": 0.35555555555555557, "grad_norm": 7.076253631073926, "learning_rate": 3.5714285714285718e-06, "loss": 1.7955, "step": 40 }, { "epoch": 0.4, "grad_norm": 7.057673864442862, "learning_rate": 4.017857142857143e-06, "loss": 1.7781, "step": 45 }, { "epoch": 0.4444444444444444, "grad_norm": 5.958183563465681, "learning_rate": 4.464285714285715e-06, "loss": 1.7338, "step": 50 }, { "epoch": 0.4888888888888889, "grad_norm": 5.866897144123113, "learning_rate": 4.910714285714286e-06, "loss": 1.67, "step": 55 }, { "epoch": 0.5333333333333333, "grad_norm": 5.869994369951594, "learning_rate": 5.357142857142857e-06, "loss": 1.6055, "step": 60 }, { "epoch": 0.5777777777777777, "grad_norm": 5.544599606757217, "learning_rate": 5.8035714285714295e-06, "loss": 1.621, "step": 65 }, { "epoch": 0.6222222222222222, "grad_norm": 5.922951541902071, "learning_rate": 6.25e-06, "loss": 1.5503, "step": 70 }, { "epoch": 0.6666666666666666, "grad_norm": 5.660948616961859, "learning_rate": 6.696428571428571e-06, "loss": 1.5419, "step": 75 }, { "epoch": 0.7111111111111111, "grad_norm": 5.515037072569432, "learning_rate": 7.1428571428571436e-06, "loss": 1.6159, "step": 80 }, { "epoch": 0.7555555555555555, "grad_norm": 5.558602833573966, "learning_rate": 7.589285714285714e-06, "loss": 1.5742, "step": 85 }, { "epoch": 0.8, "grad_norm": 5.305700239963537, "learning_rate": 8.035714285714286e-06, "loss": 1.5467, "step": 90 }, { "epoch": 0.8444444444444444, "grad_norm": 5.004136205117595, "learning_rate": 8.482142857142858e-06, "loss": 1.5673, "step": 95 }, { "epoch": 0.8888888888888888, "grad_norm": 5.1781341363875875, "learning_rate": 8.92857142857143e-06, "loss": 1.5419, "step": 100 }, { "epoch": 0.9333333333333333, "grad_norm": 5.2348081332809855, "learning_rate": 9.375000000000001e-06, "loss": 1.5291, "step": 105 }, { "epoch": 0.9777777777777777, "grad_norm": 5.599326305182384, "learning_rate": 9.821428571428573e-06, "loss": 1.4805, "step": 110 }, { "epoch": 1.0222222222222221, "grad_norm": 4.95489443166838, "learning_rate": 9.933035714285715e-06, "loss": 1.4025, "step": 115 }, { "epoch": 1.0666666666666667, "grad_norm": 5.441338497159552, "learning_rate": 9.821428571428573e-06, "loss": 1.2921, "step": 120 }, { "epoch": 1.1111111111111112, "grad_norm": 4.920817976988318, "learning_rate": 9.70982142857143e-06, "loss": 1.3219, "step": 125 }, { "epoch": 1.1555555555555554, "grad_norm": 5.939277340856136, "learning_rate": 9.598214285714287e-06, "loss": 1.242, "step": 130 }, { "epoch": 1.2, "grad_norm": 5.335319671954436, "learning_rate": 9.486607142857144e-06, "loss": 1.2232, "step": 135 }, { "epoch": 1.2444444444444445, "grad_norm": 6.183455759561233, "learning_rate": 9.375000000000001e-06, "loss": 1.2734, "step": 140 }, { "epoch": 1.2888888888888888, "grad_norm": 6.122390387016121, "learning_rate": 9.263392857142858e-06, "loss": 1.2504, "step": 145 }, { "epoch": 1.3333333333333333, "grad_norm": 5.649941977788642, "learning_rate": 9.151785714285715e-06, "loss": 1.2913, "step": 150 }, { "epoch": 1.3777777777777778, "grad_norm": 6.2118082348430335, "learning_rate": 9.040178571428572e-06, "loss": 1.1898, "step": 155 }, { "epoch": 1.4222222222222223, "grad_norm": 6.125925282923714, "learning_rate": 8.92857142857143e-06, "loss": 1.2446, "step": 160 }, { "epoch": 1.4666666666666668, "grad_norm": 5.882840215119527, "learning_rate": 8.816964285714286e-06, "loss": 1.2967, "step": 165 }, { "epoch": 1.511111111111111, "grad_norm": 6.244265409736289, "learning_rate": 8.705357142857143e-06, "loss": 1.2507, "step": 170 }, { "epoch": 1.5555555555555556, "grad_norm": 6.021345396953319, "learning_rate": 8.59375e-06, "loss": 1.2116, "step": 175 }, { "epoch": 1.6, "grad_norm": 6.289159755622968, "learning_rate": 8.482142857142858e-06, "loss": 1.2572, "step": 180 }, { "epoch": 1.6444444444444444, "grad_norm": 5.60112064803209, "learning_rate": 8.370535714285715e-06, "loss": 1.2467, "step": 185 }, { "epoch": 1.6888888888888889, "grad_norm": 5.766305702978478, "learning_rate": 8.258928571428572e-06, "loss": 1.2423, "step": 190 }, { "epoch": 1.7333333333333334, "grad_norm": 6.535746848002774, "learning_rate": 8.147321428571429e-06, "loss": 1.1516, "step": 195 }, { "epoch": 1.7777777777777777, "grad_norm": 5.8246000440527, "learning_rate": 8.035714285714286e-06, "loss": 1.2577, "step": 200 }, { "epoch": 1.8222222222222222, "grad_norm": 5.708942474707697, "learning_rate": 7.924107142857143e-06, "loss": 1.2754, "step": 205 }, { "epoch": 1.8666666666666667, "grad_norm": 5.561728988256993, "learning_rate": 7.8125e-06, "loss": 1.2149, "step": 210 }, { "epoch": 1.911111111111111, "grad_norm": 5.5782199002239565, "learning_rate": 7.700892857142857e-06, "loss": 1.2308, "step": 215 }, { "epoch": 1.9555555555555557, "grad_norm": 5.39044075769101, "learning_rate": 7.589285714285714e-06, "loss": 1.2042, "step": 220 }, { "epoch": 2.0, "grad_norm": 6.532219423056963, "learning_rate": 7.4776785714285714e-06, "loss": 1.2174, "step": 225 }, { "epoch": 2.0444444444444443, "grad_norm": 4.883317970060585, "learning_rate": 7.366071428571429e-06, "loss": 0.8016, "step": 230 }, { "epoch": 2.088888888888889, "grad_norm": 6.16427200874355, "learning_rate": 7.2544642857142865e-06, "loss": 0.7494, "step": 235 }, { "epoch": 2.1333333333333333, "grad_norm": 6.874292360395087, "learning_rate": 7.1428571428571436e-06, "loss": 0.7405, "step": 240 }, { "epoch": 2.1777777777777776, "grad_norm": 7.121149956084331, "learning_rate": 7.031250000000001e-06, "loss": 0.7379, "step": 245 }, { "epoch": 2.2222222222222223, "grad_norm": 5.81637228279681, "learning_rate": 6.919642857142858e-06, "loss": 0.7584, "step": 250 }, { "epoch": 2.2666666666666666, "grad_norm": 5.754815424689757, "learning_rate": 6.808035714285715e-06, "loss": 0.7425, "step": 255 }, { "epoch": 2.311111111111111, "grad_norm": 7.091048722340656, "learning_rate": 6.696428571428571e-06, "loss": 0.7495, "step": 260 }, { "epoch": 2.3555555555555556, "grad_norm": 6.094106982847032, "learning_rate": 6.58482142857143e-06, "loss": 0.7427, "step": 265 }, { "epoch": 2.4, "grad_norm": 6.414692728098821, "learning_rate": 6.473214285714287e-06, "loss": 0.7319, "step": 270 }, { "epoch": 2.4444444444444446, "grad_norm": 6.708504578115011, "learning_rate": 6.361607142857143e-06, "loss": 0.7342, "step": 275 }, { "epoch": 2.488888888888889, "grad_norm": 7.165696647143685, "learning_rate": 6.25e-06, "loss": 0.787, "step": 280 }, { "epoch": 2.533333333333333, "grad_norm": 5.95046471694673, "learning_rate": 6.138392857142857e-06, "loss": 0.685, "step": 285 }, { "epoch": 2.5777777777777775, "grad_norm": 6.168087419964014, "learning_rate": 6.0267857142857145e-06, "loss": 0.7947, "step": 290 }, { "epoch": 2.6222222222222222, "grad_norm": 8.12776947225484, "learning_rate": 5.9151785714285716e-06, "loss": 0.7513, "step": 295 }, { "epoch": 2.6666666666666665, "grad_norm": 6.433781125784366, "learning_rate": 5.8035714285714295e-06, "loss": 0.7135, "step": 300 }, { "epoch": 2.7111111111111112, "grad_norm": 6.384935891420059, "learning_rate": 5.691964285714287e-06, "loss": 0.7493, "step": 305 }, { "epoch": 2.7555555555555555, "grad_norm": 6.433040870475973, "learning_rate": 5.580357142857144e-06, "loss": 0.727, "step": 310 }, { "epoch": 2.8, "grad_norm": 6.571634780231645, "learning_rate": 5.468750000000001e-06, "loss": 0.7117, "step": 315 }, { "epoch": 2.8444444444444446, "grad_norm": 6.181645383932599, "learning_rate": 5.357142857142857e-06, "loss": 0.7814, "step": 320 }, { "epoch": 2.888888888888889, "grad_norm": 5.993415912788299, "learning_rate": 5.245535714285714e-06, "loss": 0.7382, "step": 325 }, { "epoch": 2.9333333333333336, "grad_norm": 7.296220837415293, "learning_rate": 5.133928571428571e-06, "loss": 0.7704, "step": 330 }, { "epoch": 2.977777777777778, "grad_norm": 6.26275860113005, "learning_rate": 5.022321428571429e-06, "loss": 0.7475, "step": 335 }, { "epoch": 3.022222222222222, "grad_norm": 5.547644012720461, "learning_rate": 4.910714285714286e-06, "loss": 0.5714, "step": 340 }, { "epoch": 3.066666666666667, "grad_norm": 7.45609250503262, "learning_rate": 4.799107142857143e-06, "loss": 0.3736, "step": 345 }, { "epoch": 3.111111111111111, "grad_norm": 9.220779587965055, "learning_rate": 4.6875000000000004e-06, "loss": 0.379, "step": 350 }, { "epoch": 3.1555555555555554, "grad_norm": 5.903988909331705, "learning_rate": 4.5758928571428575e-06, "loss": 0.3091, "step": 355 }, { "epoch": 3.2, "grad_norm": 6.770193918782061, "learning_rate": 4.464285714285715e-06, "loss": 0.333, "step": 360 }, { "epoch": 3.2444444444444445, "grad_norm": 6.276791425358006, "learning_rate": 4.352678571428572e-06, "loss": 0.3177, "step": 365 }, { "epoch": 3.2888888888888888, "grad_norm": 7.193401410169643, "learning_rate": 4.241071428571429e-06, "loss": 0.3509, "step": 370 }, { "epoch": 3.3333333333333335, "grad_norm": 7.049225730521727, "learning_rate": 4.129464285714286e-06, "loss": 0.3327, "step": 375 }, { "epoch": 3.3777777777777778, "grad_norm": 6.890952439455029, "learning_rate": 4.017857142857143e-06, "loss": 0.3014, "step": 380 }, { "epoch": 3.422222222222222, "grad_norm": 6.450392876649866, "learning_rate": 3.90625e-06, "loss": 0.3134, "step": 385 }, { "epoch": 3.466666666666667, "grad_norm": 6.50857632933258, "learning_rate": 3.794642857142857e-06, "loss": 0.3281, "step": 390 }, { "epoch": 3.511111111111111, "grad_norm": 7.00409851180514, "learning_rate": 3.6830357142857147e-06, "loss": 0.3032, "step": 395 }, { "epoch": 3.5555555555555554, "grad_norm": 7.985948331505739, "learning_rate": 3.5714285714285718e-06, "loss": 0.3148, "step": 400 }, { "epoch": 3.6, "grad_norm": 7.300806552749991, "learning_rate": 3.459821428571429e-06, "loss": 0.3393, "step": 405 }, { "epoch": 3.6444444444444444, "grad_norm": 6.768267789836914, "learning_rate": 3.3482142857142855e-06, "loss": 0.3094, "step": 410 }, { "epoch": 3.688888888888889, "grad_norm": 6.849516994792115, "learning_rate": 3.2366071428571435e-06, "loss": 0.308, "step": 415 }, { "epoch": 3.7333333333333334, "grad_norm": 6.895514738982963, "learning_rate": 3.125e-06, "loss": 0.3151, "step": 420 }, { "epoch": 3.7777777777777777, "grad_norm": 7.278283240180865, "learning_rate": 3.0133928571428572e-06, "loss": 0.311, "step": 425 }, { "epoch": 3.822222222222222, "grad_norm": 7.770700236659141, "learning_rate": 2.9017857142857148e-06, "loss": 0.3261, "step": 430 }, { "epoch": 3.8666666666666667, "grad_norm": 6.82699249519738, "learning_rate": 2.790178571428572e-06, "loss": 0.3286, "step": 435 }, { "epoch": 3.911111111111111, "grad_norm": 6.058725073774486, "learning_rate": 2.6785714285714285e-06, "loss": 0.3055, "step": 440 }, { "epoch": 3.9555555555555557, "grad_norm": 7.923771994803603, "learning_rate": 2.5669642857142856e-06, "loss": 0.3475, "step": 445 }, { "epoch": 4.0, "grad_norm": 8.583308434767343, "learning_rate": 2.455357142857143e-06, "loss": 0.3072, "step": 450 }, { "epoch": 4.044444444444444, "grad_norm": 4.888668375327939, "learning_rate": 2.3437500000000002e-06, "loss": 0.123, "step": 455 }, { "epoch": 4.088888888888889, "grad_norm": 5.30026249113343, "learning_rate": 2.2321428571428573e-06, "loss": 0.1172, "step": 460 }, { "epoch": 4.133333333333334, "grad_norm": 5.7543964521851185, "learning_rate": 2.1205357142857144e-06, "loss": 0.1063, "step": 465 }, { "epoch": 4.177777777777778, "grad_norm": 6.961825045250998, "learning_rate": 2.0089285714285715e-06, "loss": 0.0987, "step": 470 }, { "epoch": 4.222222222222222, "grad_norm": 6.441588539096942, "learning_rate": 1.8973214285714286e-06, "loss": 0.0938, "step": 475 }, { "epoch": 4.266666666666667, "grad_norm": 4.658464773050257, "learning_rate": 1.7857142857142859e-06, "loss": 0.0875, "step": 480 }, { "epoch": 4.311111111111111, "grad_norm": 6.424114535270574, "learning_rate": 1.6741071428571428e-06, "loss": 0.1084, "step": 485 }, { "epoch": 4.355555555555555, "grad_norm": 4.590840131788235, "learning_rate": 1.5625e-06, "loss": 0.0878, "step": 490 }, { "epoch": 4.4, "grad_norm": 4.87276433451291, "learning_rate": 1.4508928571428574e-06, "loss": 0.0934, "step": 495 }, { "epoch": 4.444444444444445, "grad_norm": 5.392164301915455, "learning_rate": 1.3392857142857143e-06, "loss": 0.1087, "step": 500 }, { "epoch": 4.488888888888889, "grad_norm": 4.187721869186243, "learning_rate": 1.2276785714285716e-06, "loss": 0.088, "step": 505 }, { "epoch": 4.533333333333333, "grad_norm": 5.2715420146235665, "learning_rate": 1.1160714285714287e-06, "loss": 0.1148, "step": 510 }, { "epoch": 4.5777777777777775, "grad_norm": 5.618347246851232, "learning_rate": 1.0044642857142857e-06, "loss": 0.0956, "step": 515 }, { "epoch": 4.622222222222222, "grad_norm": 6.752957019393521, "learning_rate": 8.928571428571429e-07, "loss": 0.1017, "step": 520 }, { "epoch": 4.666666666666667, "grad_norm": 4.927856784257147, "learning_rate": 7.8125e-07, "loss": 0.1014, "step": 525 }, { "epoch": 4.711111111111111, "grad_norm": 5.446418154433167, "learning_rate": 6.696428571428571e-07, "loss": 0.101, "step": 530 }, { "epoch": 4.7555555555555555, "grad_norm": 5.965809303232395, "learning_rate": 5.580357142857143e-07, "loss": 0.0991, "step": 535 }, { "epoch": 4.8, "grad_norm": 6.186953872684265, "learning_rate": 4.4642857142857147e-07, "loss": 0.0835, "step": 540 }, { "epoch": 4.844444444444444, "grad_norm": 5.017392231671649, "learning_rate": 3.3482142857142856e-07, "loss": 0.0863, "step": 545 }, { "epoch": 4.888888888888889, "grad_norm": 5.0701043320958625, "learning_rate": 2.2321428571428574e-07, "loss": 0.1016, "step": 550 }, { "epoch": 4.933333333333334, "grad_norm": 4.872193534628404, "learning_rate": 1.1160714285714287e-07, "loss": 0.0958, "step": 555 }, { "epoch": 4.977777777777778, "grad_norm": 6.017534872316958, "learning_rate": 0.0, "loss": 0.0917, "step": 560 }, { "epoch": 4.977777777777778, "step": 560, "total_flos": 1995521605632.0, "train_loss": 0.8461004374814886, "train_runtime": 1804.2136, "train_samples_per_second": 9.977, "train_steps_per_second": 0.31 } ], "logging_steps": 5, "max_steps": 560, "num_input_tokens_seen": 0, "num_train_epochs": 5, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1995521605632.0, "train_batch_size": 4, "trial_name": null, "trial_params": null }