{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.0, "eval_steps": 500, "global_step": 764, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.01309328968903437, "grad_norm": 4.5625, "learning_rate": 1.5652173913043477e-07, "loss": 1.7698013305664062, "step": 10 }, { "epoch": 0.02618657937806874, "grad_norm": 4.75, "learning_rate": 3.304347826086956e-07, "loss": 1.8119827270507813, "step": 20 }, { "epoch": 0.03927986906710311, "grad_norm": 8.6875, "learning_rate": 3.9993529431919234e-07, "loss": 1.6693140029907227, "step": 30 }, { "epoch": 0.05237315875613748, "grad_norm": 7.59375, "learning_rate": 3.995400223257334e-07, "loss": 1.6907798767089843, "step": 40 }, { "epoch": 0.06546644844517185, "grad_norm": 6.5, "learning_rate": 3.9878613546358986e-07, "loss": 1.6979778289794922, "step": 50 }, { "epoch": 0.07855973813420622, "grad_norm": 5.84375, "learning_rate": 3.9767498862405076e-07, "loss": 1.8435844421386718, "step": 60 }, { "epoch": 0.09165302782324058, "grad_norm": 4.9375, "learning_rate": 3.9620857876879474e-07, "loss": 1.7747735977172852, "step": 70 }, { "epoch": 0.10474631751227496, "grad_norm": 6.5, "learning_rate": 3.943895413409353e-07, "loss": 1.5791229248046874, "step": 80 }, { "epoch": 0.11783960720130933, "grad_norm": 4.84375, "learning_rate": 3.9222114552858167e-07, "loss": 1.7737991333007812, "step": 90 }, { "epoch": 0.1309328968903437, "grad_norm": 4.4375, "learning_rate": 3.8970728838942903e-07, "loss": 1.6754600524902343, "step": 100 }, { "epoch": 0.14402618657937807, "grad_norm": 14.0625, "learning_rate": 3.8685248784693646e-07, "loss": 1.663345718383789, "step": 110 }, { "epoch": 0.15711947626841244, "grad_norm": 5.0, "learning_rate": 3.8366187457067924e-07, "loss": 1.7084470748901368, "step": 120 }, { "epoch": 0.1702127659574468, "grad_norm": 4.375, "learning_rate": 3.8014118275547113e-07, "loss": 1.6630699157714843, "step": 130 }, { "epoch": 0.18330605564648117, "grad_norm": 4.15625, "learning_rate": 3.7629673981582394e-07, "loss": 1.7131948471069336, "step": 140 }, { "epoch": 0.19639934533551553, "grad_norm": 5.03125, "learning_rate": 3.7213545501427004e-07, "loss": 1.707387351989746, "step": 150 }, { "epoch": 0.20949263502454993, "grad_norm": 5.0, "learning_rate": 3.676648070439823e-07, "loss": 1.6667047500610352, "step": 160 }, { "epoch": 0.2225859247135843, "grad_norm": 5.28125, "learning_rate": 3.628928305880089e-07, "loss": 1.6005857467651368, "step": 170 }, { "epoch": 0.23567921440261866, "grad_norm": 5.28125, "learning_rate": 3.578281018792787e-07, "loss": 1.7023710250854491, "step": 180 }, { "epoch": 0.24877250409165302, "grad_norm": 5.84375, "learning_rate": 3.524797232873297e-07, "loss": 1.7205501556396485, "step": 190 }, { "epoch": 0.2618657937806874, "grad_norm": 4.5, "learning_rate": 3.4685730695945973e-07, "loss": 1.7906591415405273, "step": 200 }, { "epoch": 0.27495908346972175, "grad_norm": 4.6875, "learning_rate": 3.409709575457015e-07, "loss": 1.7032752990722657, "step": 210 }, { "epoch": 0.28805237315875615, "grad_norm": 4.71875, "learning_rate": 3.348312540386673e-07, "loss": 1.767839241027832, "step": 220 }, { "epoch": 0.3011456628477905, "grad_norm": 4.375, "learning_rate": 3.28449230760902e-07, "loss": 1.6559026718139649, "step": 230 }, { "epoch": 0.3142389525368249, "grad_norm": 4.0625, "learning_rate": 3.218363575339131e-07, "loss": 1.7474025726318358, "step": 240 }, { "epoch": 0.32733224222585927, "grad_norm": 4.71875, "learning_rate": 3.1500451906451933e-07, "loss": 1.7392288208007813, "step": 250 }, { "epoch": 0.3404255319148936, "grad_norm": 4.6875, "learning_rate": 3.079659935855634e-07, "loss": 1.7795156478881835, "step": 260 }, { "epoch": 0.353518821603928, "grad_norm": 6.6875, "learning_rate": 3.0073343078937755e-07, "loss": 1.6928770065307617, "step": 270 }, { "epoch": 0.36661211129296234, "grad_norm": 5.28125, "learning_rate": 2.9331982909365844e-07, "loss": 1.7049606323242188, "step": 280 }, { "epoch": 0.37970540098199673, "grad_norm": 5.375, "learning_rate": 2.857385122806108e-07, "loss": 1.7637083053588867, "step": 290 }, { "epoch": 0.39279869067103107, "grad_norm": 4.28125, "learning_rate": 2.7800310555134313e-07, "loss": 1.7917778015136718, "step": 300 }, { "epoch": 0.40589198036006546, "grad_norm": 6.09375, "learning_rate": 2.7012751103855087e-07, "loss": 1.6547735214233399, "step": 310 }, { "epoch": 0.41898527004909986, "grad_norm": 4.78125, "learning_rate": 2.6212588282149646e-07, "loss": 1.718545913696289, "step": 320 }, { "epoch": 0.4320785597381342, "grad_norm": 5.40625, "learning_rate": 2.5401260148818855e-07, "loss": 1.7531944274902345, "step": 330 }, { "epoch": 0.4451718494271686, "grad_norm": 7.75, "learning_rate": 2.458022482904785e-07, "loss": 1.8378955841064453, "step": 340 }, { "epoch": 0.4582651391162029, "grad_norm": 4.21875, "learning_rate": 2.3750957893852184e-07, "loss": 1.7262359619140626, "step": 350 }, { "epoch": 0.4713584288052373, "grad_norm": 4.3125, "learning_rate": 2.2914949708170187e-07, "loss": 1.7179519653320312, "step": 360 }, { "epoch": 0.4844517184942717, "grad_norm": 4.34375, "learning_rate": 2.2073702752367623e-07, "loss": 1.6968917846679688, "step": 370 }, { "epoch": 0.49754500818330605, "grad_norm": 4.1875, "learning_rate": 2.1228728921968352e-07, "loss": 1.7417394638061523, "step": 380 }, { "epoch": 0.5106382978723404, "grad_norm": 4.5, "learning_rate": 2.0381546810464044e-07, "loss": 1.6095331192016602, "step": 390 }, { "epoch": 0.5237315875613748, "grad_norm": 5.3125, "learning_rate": 1.9533678980086213e-07, "loss": 1.675015640258789, "step": 400 }, { "epoch": 0.5368248772504092, "grad_norm": 6.15625, "learning_rate": 1.8686649225445636e-07, "loss": 1.8056396484375, "step": 410 }, { "epoch": 0.5499181669394435, "grad_norm": 4.8125, "learning_rate": 1.784197983495689e-07, "loss": 1.7800405502319336, "step": 420 }, { "epoch": 0.563011456628478, "grad_norm": 5.09375, "learning_rate": 1.700118885496989e-07, "loss": 1.7622718811035156, "step": 430 }, { "epoch": 0.5761047463175123, "grad_norm": 4.84375, "learning_rate": 1.6165787361525235e-07, "loss": 1.738749885559082, "step": 440 }, { "epoch": 0.5891980360065466, "grad_norm": 4.375, "learning_rate": 1.5337276744636715e-07, "loss": 1.6596288681030273, "step": 450 }, { "epoch": 0.602291325695581, "grad_norm": 8.625, "learning_rate": 1.4517146009981576e-07, "loss": 1.5231310844421386, "step": 460 }, { "epoch": 0.6153846153846154, "grad_norm": 8.0, "learning_rate": 1.3706869102847999e-07, "loss": 1.6872207641601562, "step": 470 }, { "epoch": 0.6284779050736498, "grad_norm": 4.125, "learning_rate": 1.2907902259149286e-07, "loss": 1.7282188415527344, "step": 480 }, { "epoch": 0.6415711947626841, "grad_norm": 5.4375, "learning_rate": 1.2121681388265402e-07, "loss": 1.6931528091430663, "step": 490 }, { "epoch": 0.6546644844517185, "grad_norm": 6.84375, "learning_rate": 1.1349619492415559e-07, "loss": 1.7433677673339845, "step": 500 }, { "epoch": 0.6677577741407529, "grad_norm": 4.5, "learning_rate": 1.0593104127199734e-07, "loss": 1.7254501342773438, "step": 510 }, { "epoch": 0.6808510638297872, "grad_norm": 4.96875, "learning_rate": 9.853494907873017e-08, "loss": 1.6848495483398438, "step": 520 }, { "epoch": 0.6939443535188216, "grad_norm": 4.8125, "learning_rate": 9.132121065834575e-08, "loss": 1.7002685546875, "step": 530 }, { "epoch": 0.707037643207856, "grad_norm": 5.15625, "learning_rate": 8.430279059722733e-08, "loss": 1.7304063796997071, "step": 540 }, { "epoch": 0.7201309328968903, "grad_norm": 7.09375, "learning_rate": 7.74923024540949e-08, "loss": 1.690472412109375, "step": 550 }, { "epoch": 0.7332242225859247, "grad_norm": 4.40625, "learning_rate": 7.090198609081998e-08, "loss": 1.6513166427612305, "step": 560 }, { "epoch": 0.7463175122749591, "grad_norm": 4.9375, "learning_rate": 6.454368567485182e-08, "loss": 1.827246856689453, "step": 570 }, { "epoch": 0.7594108019639935, "grad_norm": 4.59375, "learning_rate": 5.84288283927874e-08, "loss": 1.6964548110961915, "step": 580 }, { "epoch": 0.7725040916530278, "grad_norm": 6.625, "learning_rate": 5.2568403913344275e-08, "loss": 1.660973358154297, "step": 590 }, { "epoch": 0.7855973813420621, "grad_norm": 4.71875, "learning_rate": 4.697294463664261e-08, "loss": 1.725875473022461, "step": 600 }, { "epoch": 0.7986906710310966, "grad_norm": 4.0625, "learning_rate": 4.165250676529466e-08, "loss": 1.63555965423584, "step": 610 }, { "epoch": 0.8117839607201309, "grad_norm": 3.796875, "learning_rate": 3.6616652231319514e-08, "loss": 1.6531944274902344, "step": 620 }, { "epoch": 0.8248772504091653, "grad_norm": 5.5625, "learning_rate": 3.187443151136533e-08, "loss": 1.6328155517578125, "step": 630 }, { "epoch": 0.8379705400981997, "grad_norm": 5.25, "learning_rate": 2.7434367361122502e-08, "loss": 1.6354242324829102, "step": 640 }, { "epoch": 0.851063829787234, "grad_norm": 4.40625, "learning_rate": 2.3304439498161632e-08, "loss": 1.7544931411743163, "step": 650 }, { "epoch": 0.8641571194762684, "grad_norm": 4.34375, "learning_rate": 1.949207026072348e-08, "loss": 1.6700428009033204, "step": 660 }, { "epoch": 0.8772504091653028, "grad_norm": 5.25, "learning_rate": 1.6004111268235156e-08, "loss": 1.6820402145385742, "step": 670 }, { "epoch": 0.8903436988543372, "grad_norm": 5.25, "learning_rate": 1.2846831107526956e-08, "loss": 1.7066337585449218, "step": 680 }, { "epoch": 0.9034369885433715, "grad_norm": 4.875, "learning_rate": 1.0025904066879687e-08, "loss": 1.7003616333007812, "step": 690 }, { "epoch": 0.9165302782324058, "grad_norm": 4.25, "learning_rate": 7.546399938149916e-09, "loss": 1.6916650772094726, "step": 700 }, { "epoch": 0.9296235679214403, "grad_norm": 4.5, "learning_rate": 5.412774905300987e-09, "loss": 1.6705923080444336, "step": 710 }, { "epoch": 0.9427168576104746, "grad_norm": 4.90625, "learning_rate": 3.628863535714699e-09, "loss": 1.7059362411499024, "step": 720 }, { "epoch": 0.955810147299509, "grad_norm": 4.90625, "learning_rate": 2.1978718886772608e-09, "loss": 1.783282470703125, "step": 730 }, { "epoch": 0.9689034369885434, "grad_norm": 4.5625, "learning_rate": 1.1223717534248001e-09, "loss": 1.7798967361450195, "step": 740 }, { "epoch": 0.9819967266775778, "grad_norm": 4.1875, "learning_rate": 4.0429602710385646e-10, "loss": 1.7239389419555664, "step": 750 }, { "epoch": 0.9950900163666121, "grad_norm": 4.40625, "learning_rate": 4.4935240953702935e-11, "loss": 1.678044319152832, "step": 760 }, { "epoch": 1.0, "step": 764, "total_flos": 3.68251671698516e+17, "train_loss": 1.7103283592543677, "train_runtime": 6160.8721, "train_samples_per_second": 0.496, "train_steps_per_second": 0.124 } ], "logging_steps": 10, "max_steps": 764, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.68251671698516e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }