{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 1.5002627430373097, "eval_steps": 500, "global_step": 714, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.021019442984760904, "grad_norm": 9.625, "learning_rate": 1.0227272727272728e-07, "loss": 1.8086944580078126, "step": 10 }, { "epoch": 0.04203888596952181, "grad_norm": 10.5625, "learning_rate": 2.159090909090909e-07, "loss": 1.9563072204589844, "step": 20 }, { "epoch": 0.0630583289542827, "grad_norm": 8.375, "learning_rate": 2.4993688579681983e-07, "loss": 1.9191463470458985, "step": 30 }, { "epoch": 0.08407777193904362, "grad_norm": 5.21875, "learning_rate": 2.496279084257832e-07, "loss": 1.8105619430541993, "step": 40 }, { "epoch": 0.10509721492380451, "grad_norm": 7.15625, "learning_rate": 2.490621113927919e-07, "loss": 1.9305204391479491, "step": 50 }, { "epoch": 0.1261166579085654, "grad_norm": 5.21875, "learning_rate": 2.4824066063093887e-07, "loss": 1.9595895767211915, "step": 60 }, { "epoch": 0.14713610089332632, "grad_norm": 15.875, "learning_rate": 2.4716524889676334e-07, "loss": 1.9885068893432618, "step": 70 }, { "epoch": 0.16815554387808723, "grad_norm": 11.6875, "learning_rate": 2.458380922820022e-07, "loss": 1.9129520416259767, "step": 80 }, { "epoch": 0.18917498686284814, "grad_norm": 7.375, "learning_rate": 2.442619256469084e-07, "loss": 1.9894475936889648, "step": 90 }, { "epoch": 0.21019442984760903, "grad_norm": 9.25, "learning_rate": 2.42439996984548e-07, "loss": 1.8159450531005858, "step": 100 }, { "epoch": 0.23121387283236994, "grad_norm": 5.4375, "learning_rate": 2.403760607276888e-07, "loss": 1.9744218826293944, "step": 110 }, { "epoch": 0.2522333158171308, "grad_norm": 8.375, "learning_rate": 2.3807437001207282e-07, "loss": 1.8607925415039062, "step": 120 }, { "epoch": 0.27325275880189176, "grad_norm": 6.40625, "learning_rate": 2.3553966791201608e-07, "loss": 1.9678337097167968, "step": 130 }, { "epoch": 0.29427220178665264, "grad_norm": 7.84375, "learning_rate": 2.3277717766639592e-07, "loss": 1.905088233947754, "step": 140 }, { "epoch": 0.3152916447714136, "grad_norm": 8.1875, "learning_rate": 2.297925919151675e-07, "loss": 1.8011585235595704, "step": 150 }, { "epoch": 0.33631108775617446, "grad_norm": 5.6875, "learning_rate": 2.265920609685895e-07, "loss": 1.847894287109375, "step": 160 }, { "epoch": 0.35733053074093535, "grad_norm": 4.625, "learning_rate": 2.2318218013333245e-07, "loss": 1.8336673736572267, "step": 170 }, { "epoch": 0.3783499737256963, "grad_norm": 15.375, "learning_rate": 2.1956997612158683e-07, "loss": 1.9188970565795898, "step": 180 }, { "epoch": 0.39936941671045717, "grad_norm": 5.1875, "learning_rate": 2.157628925711777e-07, "loss": 1.9967548370361328, "step": 190 }, { "epoch": 0.42038885969521805, "grad_norm": 6.84375, "learning_rate": 2.117687747065239e-07, "loss": 1.9001514434814453, "step": 200 }, { "epoch": 0.441408302679979, "grad_norm": 5.84375, "learning_rate": 2.0759585317205137e-07, "loss": 1.939328956604004, "step": 210 }, { "epoch": 0.4624277456647399, "grad_norm": 12.3125, "learning_rate": 2.0325272707137493e-07, "loss": 1.9735946655273438, "step": 220 }, { "epoch": 0.4834471886495008, "grad_norm": 5.34375, "learning_rate": 1.9874834624719906e-07, "loss": 1.8626848220825196, "step": 230 }, { "epoch": 0.5044666316342616, "grad_norm": 6.4375, "learning_rate": 1.9409199283845392e-07, "loss": 1.746560287475586, "step": 240 }, { "epoch": 0.5254860746190226, "grad_norm": 6.4375, "learning_rate": 1.892932621526712e-07, "loss": 1.920944595336914, "step": 250 }, { "epoch": 0.5465055176037835, "grad_norm": 8.125, "learning_rate": 1.8436204289301616e-07, "loss": 1.9723596572875977, "step": 260 }, { "epoch": 0.5675249605885444, "grad_norm": 5.8125, "learning_rate": 1.79308496780722e-07, "loss": 1.8008295059204102, "step": 270 }, { "epoch": 0.5885444035733053, "grad_norm": 6.5, "learning_rate": 1.7414303761491778e-07, "loss": 1.8942089080810547, "step": 280 }, { "epoch": 0.6095638465580662, "grad_norm": 7.25, "learning_rate": 1.6887630981300217e-07, "loss": 1.9562250137329102, "step": 290 }, { "epoch": 0.6305832895428272, "grad_norm": 4.5, "learning_rate": 1.6351916647578366e-07, "loss": 1.8874702453613281, "step": 300 }, { "epoch": 0.651602732527588, "grad_norm": 20.5, "learning_rate": 1.5808264702258885e-07, "loss": 1.82128849029541, "step": 310 }, { "epoch": 0.6726221755123489, "grad_norm": 4.59375, "learning_rate": 1.5257795444242566e-07, "loss": 1.9460525512695312, "step": 320 }, { "epoch": 0.6936416184971098, "grad_norm": 12.875, "learning_rate": 1.4701643220808016e-07, "loss": 1.9333660125732421, "step": 330 }, { "epoch": 0.7146610614818707, "grad_norm": 9.625, "learning_rate": 1.414095409007192e-07, "loss": 1.8776426315307617, "step": 340 }, { "epoch": 0.7356805044666316, "grad_norm": 9.875, "learning_rate": 1.3576883459316937e-07, "loss": 1.8990169525146485, "step": 350 }, { "epoch": 0.7566999474513926, "grad_norm": 6.15625, "learning_rate": 1.3010593704053815e-07, "loss": 1.9327930450439452, "step": 360 }, { "epoch": 0.7777193904361535, "grad_norm": 5.65625, "learning_rate": 1.2443251772724124e-07, "loss": 1.9645748138427734, "step": 370 }, { "epoch": 0.7987388334209143, "grad_norm": 15.25, "learning_rate": 1.1876026781979653e-07, "loss": 1.9750782012939454, "step": 380 }, { "epoch": 0.8197582764056752, "grad_norm": 9.3125, "learning_rate": 1.1310087607493711e-07, "loss": 1.9279960632324218, "step": 390 }, { "epoch": 0.8407777193904361, "grad_norm": 9.1875, "learning_rate": 1.0746600475269085e-07, "loss": 1.9484302520751953, "step": 400 }, { "epoch": 0.8617971623751971, "grad_norm": 4.53125, "learning_rate": 1.0186726558406097e-07, "loss": 1.9229631423950195, "step": 410 }, { "epoch": 0.882816605359958, "grad_norm": 7.96875, "learning_rate": 9.631619584283176e-08, "loss": 1.9820945739746094, "step": 420 }, { "epoch": 0.9038360483447189, "grad_norm": 6.1875, "learning_rate": 9.08242345708071e-08, "loss": 2.0028038024902344, "step": 430 }, { "epoch": 0.9248554913294798, "grad_norm": 6.28125, "learning_rate": 8.540269900547556e-08, "loss": 1.9427295684814454, "step": 440 }, { "epoch": 0.9458749343142406, "grad_norm": 5.03125, "learning_rate": 8.00627612586759e-08, "loss": 1.8801141738891602, "step": 450 }, { "epoch": 0.9668943772990016, "grad_norm": 12.5, "learning_rate": 7.48154252943221e-08, "loss": 1.7729660034179688, "step": 460 }, { "epoch": 0.9879138202837625, "grad_norm": 6.3125, "learning_rate": 6.967150425262934e-08, "loss": 2.0267822265625, "step": 470 }, { "epoch": 1.0084077771939044, "grad_norm": 7.25, "learning_rate": 6.464159816756865e-08, "loss": 1.847897720336914, "step": 480 }, { "epoch": 1.0294272201786652, "grad_norm": 6.46875, "learning_rate": 5.973607212346771e-08, "loss": 1.7879396438598634, "step": 490 }, { "epoch": 1.0504466631634262, "grad_norm": 10.0625, "learning_rate": 5.496503489577081e-08, "loss": 2.006256675720215, "step": 500 }, { "epoch": 1.0714661061481872, "grad_norm": 19.125, "learning_rate": 5.033831811997166e-08, "loss": 1.9164451599121093, "step": 510 }, { "epoch": 1.092485549132948, "grad_norm": 5.34375, "learning_rate": 4.5865456031646654e-08, "loss": 1.7832933425903321, "step": 520 }, { "epoch": 1.113504992117709, "grad_norm": 5.75, "learning_rate": 4.1555665819337293e-08, "loss": 1.8139366149902343, "step": 530 }, { "epoch": 1.1345244351024697, "grad_norm": 5.84375, "learning_rate": 3.7417828630768835e-08, "loss": 1.869268798828125, "step": 540 }, { "epoch": 1.1555438780872307, "grad_norm": 6.46875, "learning_rate": 3.346047127154539e-08, "loss": 1.878763771057129, "step": 550 }, { "epoch": 1.1765633210719917, "grad_norm": 10.0625, "learning_rate": 2.9691748634034702e-08, "loss": 1.8553329467773438, "step": 560 }, { "epoch": 1.1975827640567525, "grad_norm": 13.3125, "learning_rate": 2.6119426892651426e-08, "loss": 1.8416221618652344, "step": 570 }, { "epoch": 1.2186022070415135, "grad_norm": 7.03125, "learning_rate": 2.275086750016812e-08, "loss": 1.9319948196411132, "step": 580 }, { "epoch": 1.2396216500262742, "grad_norm": 5.53125, "learning_rate": 1.959301201803254e-08, "loss": 1.7423213958740233, "step": 590 }, { "epoch": 1.2606410930110352, "grad_norm": 6.28125, "learning_rate": 1.6652367811951715e-08, "loss": 1.9869190216064454, "step": 600 }, { "epoch": 1.2816605359957962, "grad_norm": 14.75, "learning_rate": 1.3934994642219104e-08, "loss": 1.8976511001586913, "step": 610 }, { "epoch": 1.302679978980557, "grad_norm": 9.375, "learning_rate": 1.1446492176418563e-08, "loss": 1.9856376647949219, "step": 620 }, { "epoch": 1.323699421965318, "grad_norm": 5.125, "learning_rate": 9.191988450237387e-09, "loss": 2.0055776596069337, "step": 630 }, { "epoch": 1.3447188649500788, "grad_norm": 9.25, "learning_rate": 7.1761293001671855e-09, "loss": 1.9813310623168945, "step": 640 }, { "epoch": 1.3657383079348397, "grad_norm": 7.1875, "learning_rate": 5.403068789868334e-09, "loss": 1.9645788192749023, "step": 650 }, { "epoch": 1.3867577509196005, "grad_norm": 4.21875, "learning_rate": 3.8764606499268606e-09, "loss": 1.9697418212890625, "step": 660 }, { "epoch": 1.4077771939043615, "grad_norm": 5.15625, "learning_rate": 2.599450748642956e-09, "loss": 1.8822681427001953, "step": 670 }, { "epoch": 1.4287966368891225, "grad_norm": 6.9375, "learning_rate": 1.5746706093672235e-09, "loss": 1.9432037353515625, "step": 680 }, { "epoch": 1.4498160798738833, "grad_norm": 7.09375, "learning_rate": 8.042319877430981e-10, "loss": 1.8227525711059571, "step": 690 }, { "epoch": 1.4708355228586443, "grad_norm": 6.875, "learning_rate": 2.897225200300807e-10, "loss": 1.9617921829223632, "step": 700 }, { "epoch": 1.4918549658434053, "grad_norm": 11.1875, "learning_rate": 3.220245147531053e-11, "loss": 1.9124065399169923, "step": 710 }, { "epoch": 1.5002627430373097, "step": 714, "total_flos": 3.414600284463329e+17, "train_loss": 1.907181319736299, "train_runtime": 5553.447, "train_samples_per_second": 0.514, "train_steps_per_second": 0.129 } ], "logging_steps": 10, "max_steps": 714, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": false, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3.414600284463329e+17, "train_batch_size": 1, "trial_name": null, "trial_params": null }