{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 2.0, "eval_steps": 500, "global_step": 874, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "epoch": 0.02288329519450801, "grad_norm": 6.273149490356445, "learning_rate": 1.0227272727272729e-06, "loss": 0.9488, "step": 10 }, { "epoch": 0.04576659038901602, "grad_norm": 1.8167459964752197, "learning_rate": 2.1590909090909092e-06, "loss": 0.8935, "step": 20 }, { "epoch": 0.06864988558352403, "grad_norm": 1.2105071544647217, "learning_rate": 3.2954545454545456e-06, "loss": 0.8345, "step": 30 }, { "epoch": 0.09153318077803203, "grad_norm": 1.0105230808258057, "learning_rate": 4.4318181818181824e-06, "loss": 0.7483, "step": 40 }, { "epoch": 0.11441647597254005, "grad_norm": 0.6374103426933289, "learning_rate": 5.568181818181818e-06, "loss": 0.7619, "step": 50 }, { "epoch": 0.13729977116704806, "grad_norm": 0.6305025219917297, "learning_rate": 6.704545454545454e-06, "loss": 0.7492, "step": 60 }, { "epoch": 0.16018306636155608, "grad_norm": 0.7204020023345947, "learning_rate": 7.840909090909091e-06, "loss": 0.7519, "step": 70 }, { "epoch": 0.18306636155606407, "grad_norm": 0.5683720707893372, "learning_rate": 8.977272727272727e-06, "loss": 0.7103, "step": 80 }, { "epoch": 0.20594965675057209, "grad_norm": 0.5563637018203735, "learning_rate": 9.999960061285353e-06, "loss": 0.7069, "step": 90 }, { "epoch": 0.2288329519450801, "grad_norm": 0.5850629806518555, "learning_rate": 9.995168187508393e-06, "loss": 0.7032, "step": 100 }, { "epoch": 0.2517162471395881, "grad_norm": 0.5742172598838806, "learning_rate": 9.98239734155262e-06, "loss": 0.7216, "step": 110 }, { "epoch": 0.2745995423340961, "grad_norm": 0.5447644591331482, "learning_rate": 9.961667922776125e-06, "loss": 0.7085, "step": 120 }, { "epoch": 0.2974828375286041, "grad_norm": 0.6290788054466248, "learning_rate": 9.93301304306814e-06, "loss": 0.7104, "step": 130 }, { "epoch": 0.32036613272311215, "grad_norm": 0.5978163480758667, "learning_rate": 9.896478473958147e-06, "loss": 0.6963, "step": 140 }, { "epoch": 0.34324942791762014, "grad_norm": 0.5672498345375061, "learning_rate": 9.852122573503283e-06, "loss": 0.6751, "step": 150 }, { "epoch": 0.36613272311212813, "grad_norm": 0.6535360217094421, "learning_rate": 9.800016193070789e-06, "loss": 0.6757, "step": 160 }, { "epoch": 0.3890160183066362, "grad_norm": 0.5888985395431519, "learning_rate": 9.740242564164433e-06, "loss": 0.7119, "step": 170 }, { "epoch": 0.41189931350114417, "grad_norm": 0.5517858862876892, "learning_rate": 9.672897165475657e-06, "loss": 0.6598, "step": 180 }, { "epoch": 0.43478260869565216, "grad_norm": 0.5883446931838989, "learning_rate": 9.59808757037183e-06, "loss": 0.713, "step": 190 }, { "epoch": 0.4576659038901602, "grad_norm": 0.5446991920471191, "learning_rate": 9.515933275065218e-06, "loss": 0.6708, "step": 200 }, { "epoch": 0.4805491990846682, "grad_norm": 0.5323174595832825, "learning_rate": 9.426565507737139e-06, "loss": 0.6929, "step": 210 }, { "epoch": 0.5034324942791762, "grad_norm": 0.5511642098426819, "learning_rate": 9.330127018922195e-06, "loss": 0.6417, "step": 220 }, { "epoch": 0.5263157894736842, "grad_norm": 0.5513615608215332, "learning_rate": 9.226771853487411e-06, "loss": 0.6499, "step": 230 }, { "epoch": 0.5491990846681922, "grad_norm": 0.6379931569099426, "learning_rate": 9.116665104570513e-06, "loss": 0.6627, "step": 240 }, { "epoch": 0.5720823798627003, "grad_norm": 0.5682238340377808, "learning_rate": 8.999982649870377e-06, "loss": 0.6766, "step": 250 }, { "epoch": 0.5949656750572082, "grad_norm": 0.6159243583679199, "learning_rate": 8.876910870710885e-06, "loss": 0.6843, "step": 260 }, { "epoch": 0.6178489702517163, "grad_norm": 0.6061480641365051, "learning_rate": 8.747646354326948e-06, "loss": 0.6844, "step": 270 }, { "epoch": 0.6407322654462243, "grad_norm": 0.5296269059181213, "learning_rate": 8.612395579848244e-06, "loss": 0.6511, "step": 280 }, { "epoch": 0.6636155606407322, "grad_norm": 0.6145397424697876, "learning_rate": 8.47137458848224e-06, "loss": 0.6631, "step": 290 }, { "epoch": 0.6864988558352403, "grad_norm": 0.7743079662322998, "learning_rate": 8.324808638423353e-06, "loss": 0.6871, "step": 300 }, { "epoch": 0.7093821510297483, "grad_norm": 0.5358887314796448, "learning_rate": 8.172931845039471e-06, "loss": 0.6249, "step": 310 }, { "epoch": 0.7322654462242563, "grad_norm": 0.5243068933486938, "learning_rate": 8.01598680691057e-06, "loss": 0.6492, "step": 320 }, { "epoch": 0.7551487414187643, "grad_norm": 0.543357789516449, "learning_rate": 7.854224218316761e-06, "loss": 0.6619, "step": 330 }, { "epoch": 0.7780320366132724, "grad_norm": 0.6806201338768005, "learning_rate": 7.687902468794803e-06, "loss": 0.6729, "step": 340 }, { "epoch": 0.8009153318077803, "grad_norm": 0.5173719525337219, "learning_rate": 7.517287230402639e-06, "loss": 0.631, "step": 350 }, { "epoch": 0.8237986270022883, "grad_norm": 0.5824826955795288, "learning_rate": 7.342651033351325e-06, "loss": 0.6195, "step": 360 }, { "epoch": 0.8466819221967964, "grad_norm": 0.5261944532394409, "learning_rate": 7.164272830682161e-06, "loss": 0.6352, "step": 370 }, { "epoch": 0.8695652173913043, "grad_norm": 0.5619760751724243, "learning_rate": 6.9824375526843705e-06, "loss": 0.6549, "step": 380 }, { "epoch": 0.8924485125858124, "grad_norm": 0.7826661467552185, "learning_rate": 6.797435651765123e-06, "loss": 0.6593, "step": 390 }, { "epoch": 0.9153318077803204, "grad_norm": 0.5557212829589844, "learning_rate": 6.609562638498845e-06, "loss": 0.6141, "step": 400 }, { "epoch": 0.9382151029748284, "grad_norm": 0.5369032621383667, "learning_rate": 6.419118609596948e-06, "loss": 0.6194, "step": 410 }, { "epoch": 0.9610983981693364, "grad_norm": 0.636508584022522, "learning_rate": 6.2264077685519246e-06, "loss": 0.6406, "step": 420 }, { "epoch": 0.9839816933638444, "grad_norm": 0.6025350689888, "learning_rate": 6.031737939721538e-06, "loss": 0.6515, "step": 430 }, { "epoch": 1.0068649885583525, "grad_norm": 0.7006174325942993, "learning_rate": 5.835420076629273e-06, "loss": 0.6155, "step": 440 }, { "epoch": 1.0297482837528604, "grad_norm": 0.5530907511711121, "learning_rate": 5.6377677652664345e-06, "loss": 0.4827, "step": 450 }, { "epoch": 1.0526315789473684, "grad_norm": 0.5725921988487244, "learning_rate": 5.439096723189316e-06, "loss": 0.5285, "step": 460 }, { "epoch": 1.0755148741418765, "grad_norm": 0.5810708403587341, "learning_rate": 5.239724295211541e-06, "loss": 0.4976, "step": 470 }, { "epoch": 1.0983981693363845, "grad_norm": 0.49420347809791565, "learning_rate": 5.03996894649711e-06, "loss": 0.4919, "step": 480 }, { "epoch": 1.1212814645308924, "grad_norm": 0.5970099568367004, "learning_rate": 4.840149753863887e-06, "loss": 0.4691, "step": 490 }, { "epoch": 1.1441647597254005, "grad_norm": 0.5820793509483337, "learning_rate": 4.640585896110054e-06, "loss": 0.4929, "step": 500 }, { "epoch": 1.1670480549199085, "grad_norm": 0.5207763314247131, "learning_rate": 4.441596144177681e-06, "loss": 0.4885, "step": 510 }, { "epoch": 1.1899313501144164, "grad_norm": 0.5545329451560974, "learning_rate": 4.243498351967761e-06, "loss": 0.4682, "step": 520 }, { "epoch": 1.2128146453089246, "grad_norm": 0.6203777194023132, "learning_rate": 4.046608948620098e-06, "loss": 0.4791, "step": 530 }, { "epoch": 1.2356979405034325, "grad_norm": 0.592488706111908, "learning_rate": 3.8512424330689855e-06, "loss": 0.4732, "step": 540 }, { "epoch": 1.2585812356979404, "grad_norm": 0.643437922000885, "learning_rate": 3.657710871682115e-06, "loss": 0.4849, "step": 550 }, { "epoch": 1.2814645308924484, "grad_norm": 0.5146209597587585, "learning_rate": 3.466323399785072e-06, "loss": 0.4804, "step": 560 }, { "epoch": 1.3043478260869565, "grad_norm": 0.5695487856864929, "learning_rate": 3.2773857278677414e-06, "loss": 0.4926, "step": 570 }, { "epoch": 1.3272311212814645, "grad_norm": 0.6413753032684326, "learning_rate": 3.0911996532612966e-06, "loss": 0.5041, "step": 580 }, { "epoch": 1.3501144164759724, "grad_norm": 0.6373730897903442, "learning_rate": 2.9080625780658455e-06, "loss": 0.473, "step": 590 }, { "epoch": 1.3729977116704806, "grad_norm": 0.5488091111183167, "learning_rate": 2.7282670340987465e-06, "loss": 0.4664, "step": 600 }, { "epoch": 1.3958810068649885, "grad_norm": 0.6199346780776978, "learning_rate": 2.552100215622401e-06, "loss": 0.4872, "step": 610 }, { "epoch": 1.4187643020594964, "grad_norm": 0.6668885350227356, "learning_rate": 2.379843520597937e-06, "loss": 0.5043, "step": 620 }, { "epoch": 1.4416475972540046, "grad_norm": 0.5706750154495239, "learning_rate": 2.2117721011975366e-06, "loss": 0.5273, "step": 630 }, { "epoch": 1.4645308924485125, "grad_norm": 0.5967586040496826, "learning_rate": 2.0481544242934105e-06, "loss": 0.4862, "step": 640 }, { "epoch": 1.4874141876430205, "grad_norm": 0.5441915988922119, "learning_rate": 1.8892518426254363e-06, "loss": 0.4729, "step": 650 }, { "epoch": 1.5102974828375286, "grad_norm": 0.6105183362960815, "learning_rate": 1.735318177332503e-06, "loss": 0.5103, "step": 660 }, { "epoch": 1.5331807780320366, "grad_norm": 0.6279262900352478, "learning_rate": 1.5865993125143297e-06, "loss": 0.4903, "step": 670 }, { "epoch": 1.5560640732265445, "grad_norm": 0.571307897567749, "learning_rate": 1.4433328024714583e-06, "loss": 0.4755, "step": 680 }, { "epoch": 1.5789473684210527, "grad_norm": 0.546181857585907, "learning_rate": 1.3057474922507124e-06, "loss": 0.4482, "step": 690 }, { "epoch": 1.6018306636155606, "grad_norm": 0.6069242358207703, "learning_rate": 1.1740631521023176e-06, "loss": 0.4944, "step": 700 }, { "epoch": 1.6247139588100685, "grad_norm": 0.6299660205841064, "learning_rate": 1.0484901264325026e-06, "loss": 0.4975, "step": 710 }, { "epoch": 1.6475972540045767, "grad_norm": 0.5508016347885132, "learning_rate": 9.292289978123892e-07, "loss": 0.4457, "step": 720 }, { "epoch": 1.6704805491990846, "grad_norm": 0.6158504486083984, "learning_rate": 8.16470266579813e-07, "loss": 0.4953, "step": 730 }, { "epoch": 1.6933638443935926, "grad_norm": 0.5822216868400574, "learning_rate": 7.103940465458936e-07, "loss": 0.4719, "step": 740 }, { "epoch": 1.7162471395881007, "grad_norm": 0.6294801831245422, "learning_rate": 6.111697772923836e-07, "loss": 0.4789, "step": 750 }, { "epoch": 1.7391304347826086, "grad_norm": 0.5460816621780396, "learning_rate": 5.189559535193839e-07, "loss": 0.4781, "step": 760 }, { "epoch": 1.7620137299771166, "grad_norm": 0.6677026748657227, "learning_rate": 4.338998718757315e-07, "loss": 0.4713, "step": 770 }, { "epoch": 1.7848970251716247, "grad_norm": 0.6107152700424194, "learning_rate": 3.5613739567645246e-07, "loss": 0.5064, "step": 780 }, { "epoch": 1.8077803203661327, "grad_norm": 0.5857329964637756, "learning_rate": 2.8579273788312433e-07, "loss": 0.4907, "step": 790 }, { "epoch": 1.8306636155606406, "grad_norm": 0.5900473594665527, "learning_rate": 2.2297826269378653e-07, "loss": 0.4547, "step": 800 }, { "epoch": 1.8535469107551488, "grad_norm": 0.5375809669494629, "learning_rate": 1.6779430605933233e-07, "loss": 0.4939, "step": 810 }, { "epoch": 1.8764302059496567, "grad_norm": 0.5968102812767029, "learning_rate": 1.203290154130754e-07, "loss": 0.5068, "step": 820 }, { "epoch": 1.8993135011441646, "grad_norm": 0.5544958710670471, "learning_rate": 8.065820886950404e-08, "loss": 0.4447, "step": 830 }, { "epoch": 1.9221967963386728, "grad_norm": 0.5510764718055725, "learning_rate": 4.8845254117120265e-08, "loss": 0.4844, "step": 840 }, { "epoch": 1.9450800915331807, "grad_norm": 0.6316992044448853, "learning_rate": 2.4940967198821553e-08, "loss": 0.4735, "step": 850 }, { "epoch": 1.9679633867276887, "grad_norm": 0.5907024145126343, "learning_rate": 8.983531341500984e-09, "loss": 0.457, "step": 860 }, { "epoch": 1.9908466819221968, "grad_norm": 0.6300244927406311, "learning_rate": 9.984359645276443e-10, "loss": 0.4556, "step": 870 }, { "epoch": 2.0, "step": 874, "total_flos": 1.3931784786122113e+19, "train_loss": 0.5872682382094778, "train_runtime": 12619.0484, "train_samples_per_second": 8.865, "train_steps_per_second": 0.069 } ], "logging_steps": 10, "max_steps": 874, "num_input_tokens_seen": 0, "num_train_epochs": 2, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1.3931784786122113e+19, "train_batch_size": 4, "trial_name": null, "trial_params": null }