{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.027977506085107573, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691998958587646, "epoch": 0.0002797750608510757, "grad_norm": 15.75, "learning_rate": 2e-06, "loss": 10.7863, "mean_token_accuracy": 0.0001396648003719747, "num_tokens": 8714.0, "step": 5 }, { "entropy": 10.691917991638183, "epoch": 0.0005595501217021514, "grad_norm": 12.6875, "learning_rate": 4.5e-06, "loss": 10.7427, "mean_token_accuracy": 6.393861840479076e-05, "num_tokens": 18630.0, "step": 10 }, { "entropy": 10.690977668762207, "epoch": 0.0008393251825532272, "grad_norm": 9.8125, "learning_rate": 7e-06, "loss": 10.4865, "mean_token_accuracy": 0.026551677379757166, "num_tokens": 28134.0, "step": 15 }, { "entropy": 10.678603363037109, "epoch": 0.0011191002434043028, "grad_norm": 6.4375, "learning_rate": 9.5e-06, "loss": 10.188, "mean_token_accuracy": 0.04146423395723105, "num_tokens": 37326.0, "step": 20 }, { "entropy": 10.619599628448487, "epoch": 0.0013988753042553786, "grad_norm": 4.15625, "learning_rate": 1.2e-05, "loss": 9.8709, "mean_token_accuracy": 0.04364684820175171, "num_tokens": 45813.0, "step": 25 }, { "entropy": 10.597146987915039, "epoch": 0.0016786503651064545, "grad_norm": 3.265625, "learning_rate": 1.4500000000000002e-05, "loss": 9.7719, "mean_token_accuracy": 0.03872578963637352, "num_tokens": 54746.0, "step": 30 }, { "entropy": 10.614226627349854, "epoch": 0.0019584254259575303, "grad_norm": 2.734375, "learning_rate": 1.7000000000000003e-05, "loss": 9.6616, "mean_token_accuracy": 0.04101139903068542, "num_tokens": 64386.0, "step": 35 }, { "entropy": 10.594823837280273, "epoch": 0.0022382004868086057, "grad_norm": 2.71875, "learning_rate": 1.95e-05, "loss": 9.6762, "mean_token_accuracy": 0.03911035992205143, "num_tokens": 73648.0, "step": 40 }, { "entropy": 10.59369068145752, "epoch": 0.0025179755476596815, "grad_norm": 2.546875, "learning_rate": 2.2e-05, "loss": 9.5708, "mean_token_accuracy": 0.04052439667284489, "num_tokens": 82108.0, "step": 45 }, { "entropy": 10.583232975006103, "epoch": 0.0027977506085107573, "grad_norm": 2.546875, "learning_rate": 2.4500000000000003e-05, "loss": 9.5017, "mean_token_accuracy": 0.047141891345381735, "num_tokens": 92109.0, "step": 50 }, { "entropy": 10.565110969543458, "epoch": 0.003077525669361833, "grad_norm": 2.703125, "learning_rate": 2.7e-05, "loss": 9.4323, "mean_token_accuracy": 0.052879580110311505, "num_tokens": 101365.0, "step": 55 }, { "entropy": 10.425063991546631, "epoch": 0.003357300730212909, "grad_norm": 2.546875, "learning_rate": 2.95e-05, "loss": 9.3995, "mean_token_accuracy": 0.05232988931238651, "num_tokens": 110432.0, "step": 60 }, { "entropy": 10.407742786407471, "epoch": 0.0036370757910639847, "grad_norm": 2.34375, "learning_rate": 3.2e-05, "loss": 9.3122, "mean_token_accuracy": 0.051964789256453515, "num_tokens": 120191.0, "step": 65 }, { "entropy": 10.429958152770997, "epoch": 0.0039168508519150606, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1579, "mean_token_accuracy": 0.06370341181755065, "num_tokens": 129580.0, "step": 70 }, { "entropy": 10.423612117767334, "epoch": 0.004196625912766136, "grad_norm": 2.375, "learning_rate": 3.7e-05, "loss": 9.1589, "mean_token_accuracy": 0.05433790199458599, "num_tokens": 139083.0, "step": 75 }, { "entropy": 10.42996587753296, "epoch": 0.004476400973617211, "grad_norm": 2.359375, "learning_rate": 3.95e-05, "loss": 8.9628, "mean_token_accuracy": 0.05919392295181751, "num_tokens": 148183.0, "step": 80 }, { "entropy": 10.377639865875244, "epoch": 0.004756176034468288, "grad_norm": 2.359375, "learning_rate": 4.2000000000000004e-05, "loss": 8.8812, "mean_token_accuracy": 0.060510285571217536, "num_tokens": 157015.0, "step": 85 }, { "entropy": 10.363342475891113, "epoch": 0.005035951095319363, "grad_norm": 2.921875, "learning_rate": 4.45e-05, "loss": 8.8142, "mean_token_accuracy": 0.06536102406680584, "num_tokens": 166314.0, "step": 90 }, { "entropy": 10.275917053222656, "epoch": 0.005315726156170439, "grad_norm": 2.203125, "learning_rate": 4.7000000000000004e-05, "loss": 8.6269, "mean_token_accuracy": 0.07039711400866508, "num_tokens": 175975.0, "step": 95 }, { "entropy": 10.235202980041503, "epoch": 0.005595501217021515, "grad_norm": 2.734375, "learning_rate": 4.9500000000000004e-05, "loss": 8.574, "mean_token_accuracy": 0.06645569279789924, "num_tokens": 185976.0, "step": 100 }, { "entropy": 10.220190620422363, "epoch": 0.005875276277872591, "grad_norm": 2.171875, "learning_rate": 5.2e-05, "loss": 8.4802, "mean_token_accuracy": 0.06686681807041168, "num_tokens": 195112.0, "step": 105 }, { "entropy": 10.113536167144776, "epoch": 0.006155051338723666, "grad_norm": 1.984375, "learning_rate": 5.45e-05, "loss": 8.4636, "mean_token_accuracy": 0.05900593213737011, "num_tokens": 205951.0, "step": 110 }, { "entropy": 10.075279331207275, "epoch": 0.006434826399574742, "grad_norm": 2.25, "learning_rate": 5.7e-05, "loss": 8.294, "mean_token_accuracy": 0.07148804180324078, "num_tokens": 214744.0, "step": 115 }, { "entropy": 9.955604076385498, "epoch": 0.006714601460425818, "grad_norm": 2.25, "learning_rate": 5.9499999999999996e-05, "loss": 8.1343, "mean_token_accuracy": 0.0751000139862299, "num_tokens": 223279.0, "step": 120 }, { "entropy": 9.898994541168213, "epoch": 0.006994376521276893, "grad_norm": 1.796875, "learning_rate": 6.2e-05, "loss": 8.0915, "mean_token_accuracy": 0.07411009185016156, "num_tokens": 232677.0, "step": 125 }, { "entropy": 9.685633563995362, "epoch": 0.0072741515821279695, "grad_norm": 2.015625, "learning_rate": 6.450000000000001e-05, "loss": 7.9322, "mean_token_accuracy": 0.07425446137785911, "num_tokens": 242890.0, "step": 130 }, { "entropy": 9.561828994750977, "epoch": 0.007553926642979045, "grad_norm": 1.78125, "learning_rate": 6.7e-05, "loss": 7.7431, "mean_token_accuracy": 0.07636365555226803, "num_tokens": 252490.0, "step": 135 }, { "entropy": 9.356704235076904, "epoch": 0.007833701703830121, "grad_norm": 1.5703125, "learning_rate": 6.950000000000001e-05, "loss": 7.6948, "mean_token_accuracy": 0.08176706209778786, "num_tokens": 261280.0, "step": 140 }, { "entropy": 9.167966556549072, "epoch": 0.008113476764681197, "grad_norm": 1.65625, "learning_rate": 7.2e-05, "loss": 7.65, "mean_token_accuracy": 0.08069443143904209, "num_tokens": 270000.0, "step": 145 }, { "entropy": 8.9812726020813, "epoch": 0.008393251825532272, "grad_norm": 2.453125, "learning_rate": 7.45e-05, "loss": 7.458, "mean_token_accuracy": 0.08502581343054771, "num_tokens": 279709.0, "step": 150 }, { "entropy": 8.729528427124023, "epoch": 0.008673026886383347, "grad_norm": 1.4453125, "learning_rate": 7.7e-05, "loss": 7.5225, "mean_token_accuracy": 0.082467582821846, "num_tokens": 288343.0, "step": 155 }, { "entropy": 8.595497226715088, "epoch": 0.008952801947234423, "grad_norm": 1.5234375, "learning_rate": 7.950000000000001e-05, "loss": 7.3566, "mean_token_accuracy": 0.08212127052247524, "num_tokens": 297387.0, "step": 160 }, { "entropy": 8.476513195037843, "epoch": 0.0092325770080855, "grad_norm": 1.625, "learning_rate": 8.2e-05, "loss": 7.3103, "mean_token_accuracy": 0.08278237357735634, "num_tokens": 307175.0, "step": 165 }, { "entropy": 8.29503517150879, "epoch": 0.009512352068936575, "grad_norm": 1.53125, "learning_rate": 8.450000000000001e-05, "loss": 7.2308, "mean_token_accuracy": 0.08270871713757515, "num_tokens": 316033.0, "step": 170 }, { "entropy": 8.15572385787964, "epoch": 0.00979212712978765, "grad_norm": 1.3984375, "learning_rate": 8.7e-05, "loss": 7.3076, "mean_token_accuracy": 0.08210290595889091, "num_tokens": 325740.0, "step": 175 }, { "entropy": 8.114148664474488, "epoch": 0.010071902190638726, "grad_norm": 1.375, "learning_rate": 8.95e-05, "loss": 7.2221, "mean_token_accuracy": 0.09068928360939026, "num_tokens": 334637.0, "step": 180 }, { "entropy": 8.006746578216553, "epoch": 0.010351677251489803, "grad_norm": 1.765625, "learning_rate": 9.2e-05, "loss": 7.2562, "mean_token_accuracy": 0.0831844873726368, "num_tokens": 344020.0, "step": 185 }, { "entropy": 7.939169883728027, "epoch": 0.010631452312340878, "grad_norm": 1.5703125, "learning_rate": 9.45e-05, "loss": 7.1292, "mean_token_accuracy": 0.09121446087956428, "num_tokens": 352924.0, "step": 190 }, { "entropy": 7.8939591407775875, "epoch": 0.010911227373191954, "grad_norm": 1.390625, "learning_rate": 9.7e-05, "loss": 7.149, "mean_token_accuracy": 0.08797023706138134, "num_tokens": 361755.0, "step": 195 }, { "entropy": 7.845557069778442, "epoch": 0.01119100243404303, "grad_norm": 1.2265625, "learning_rate": 9.95e-05, "loss": 7.1833, "mean_token_accuracy": 0.08474454060196876, "num_tokens": 370605.0, "step": 200 }, { "entropy": 7.757431316375732, "epoch": 0.011470777494894105, "grad_norm": 1.8125, "learning_rate": 0.000102, "loss": 7.0648, "mean_token_accuracy": 0.08956050127744675, "num_tokens": 379723.0, "step": 205 }, { "entropy": 7.683956050872803, "epoch": 0.011750552555745182, "grad_norm": 1.4140625, "learning_rate": 0.00010449999999999999, "loss": 7.0111, "mean_token_accuracy": 0.09118850380182267, "num_tokens": 389502.0, "step": 210 }, { "entropy": 7.613946056365966, "epoch": 0.012030327616596257, "grad_norm": 1.375, "learning_rate": 0.000107, "loss": 6.9865, "mean_token_accuracy": 0.09210970029234886, "num_tokens": 399116.0, "step": 215 }, { "entropy": 7.6888175964355465, "epoch": 0.012310102677447332, "grad_norm": 1.5390625, "learning_rate": 0.0001095, "loss": 7.0522, "mean_token_accuracy": 0.08312384895980358, "num_tokens": 408239.0, "step": 220 }, { "entropy": 7.582952213287354, "epoch": 0.012589877738298408, "grad_norm": 1.2109375, "learning_rate": 0.000112, "loss": 7.0558, "mean_token_accuracy": 0.08601429760456085, "num_tokens": 418801.0, "step": 225 }, { "entropy": 7.63437852859497, "epoch": 0.012869652799149483, "grad_norm": 1.3359375, "learning_rate": 0.0001145, "loss": 7.0975, "mean_token_accuracy": 0.08165879175066948, "num_tokens": 427584.0, "step": 230 }, { "entropy": 7.647107696533203, "epoch": 0.01314942786000056, "grad_norm": 1.4453125, "learning_rate": 0.00011700000000000001, "loss": 7.0398, "mean_token_accuracy": 0.08437106013298035, "num_tokens": 437345.0, "step": 235 }, { "entropy": 7.595585727691651, "epoch": 0.013429202920851636, "grad_norm": 1.4453125, "learning_rate": 0.00011949999999999999, "loss": 7.0693, "mean_token_accuracy": 0.09033490121364593, "num_tokens": 446550.0, "step": 240 }, { "entropy": 7.530496215820312, "epoch": 0.013708977981702711, "grad_norm": 1.1875, "learning_rate": 0.000122, "loss": 7.0332, "mean_token_accuracy": 0.08355908021330834, "num_tokens": 456394.0, "step": 245 }, { "entropy": 7.545537424087525, "epoch": 0.013988753042553786, "grad_norm": 1.3671875, "learning_rate": 0.0001245, "loss": 6.9254, "mean_token_accuracy": 0.09105066359043121, "num_tokens": 465467.0, "step": 250 }, { "entropy": 7.4903782367706295, "epoch": 0.014268528103404862, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 6.9994, "mean_token_accuracy": 0.09321118667721748, "num_tokens": 474838.0, "step": 255 }, { "entropy": 7.407280015945434, "epoch": 0.014548303164255939, "grad_norm": 1.2109375, "learning_rate": 0.0001295, "loss": 6.8929, "mean_token_accuracy": 0.09139523953199387, "num_tokens": 483414.0, "step": 260 }, { "entropy": 7.481622314453125, "epoch": 0.014828078225107014, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 6.9248, "mean_token_accuracy": 0.08975184708833694, "num_tokens": 491802.0, "step": 265 }, { "entropy": 7.453138542175293, "epoch": 0.01510785328595809, "grad_norm": 1.2734375, "learning_rate": 0.00013450000000000002, "loss": 6.9211, "mean_token_accuracy": 0.08993491381406785, "num_tokens": 502007.0, "step": 270 }, { "entropy": 7.3567157745361325, "epoch": 0.015387628346809165, "grad_norm": 1.328125, "learning_rate": 0.00013700000000000002, "loss": 6.9517, "mean_token_accuracy": 0.09103975892066955, "num_tokens": 510806.0, "step": 275 }, { "entropy": 7.387433815002441, "epoch": 0.015667403407660242, "grad_norm": 1.3203125, "learning_rate": 0.0001395, "loss": 6.8927, "mean_token_accuracy": 0.09123391136527062, "num_tokens": 519526.0, "step": 280 }, { "entropy": 7.356798839569092, "epoch": 0.015947178468511316, "grad_norm": 1.2109375, "learning_rate": 0.00014199999999999998, "loss": 6.8069, "mean_token_accuracy": 0.09702679142355919, "num_tokens": 529036.0, "step": 285 }, { "entropy": 7.348542070388794, "epoch": 0.016226953529362393, "grad_norm": 1.53125, "learning_rate": 0.0001445, "loss": 6.8877, "mean_token_accuracy": 0.09220745116472244, "num_tokens": 537758.0, "step": 290 }, { "entropy": 7.252509832382202, "epoch": 0.016506728590213467, "grad_norm": 1.25, "learning_rate": 0.000147, "loss": 6.797, "mean_token_accuracy": 0.0996977336704731, "num_tokens": 546401.0, "step": 295 }, { "entropy": 7.282312059402466, "epoch": 0.016786503651064544, "grad_norm": 1.1796875, "learning_rate": 0.0001495, "loss": 6.8229, "mean_token_accuracy": 0.09258124381303787, "num_tokens": 555839.0, "step": 300 }, { "entropy": 7.447148847579956, "epoch": 0.01706627871191562, "grad_norm": 1.6875, "learning_rate": 0.000152, "loss": 6.9703, "mean_token_accuracy": 0.09544998183846473, "num_tokens": 565150.0, "step": 305 }, { "entropy": 7.174850606918335, "epoch": 0.017346053772766695, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.8185, "mean_token_accuracy": 0.09337743893265724, "num_tokens": 574376.0, "step": 310 }, { "entropy": 7.367434978485107, "epoch": 0.01762582883361777, "grad_norm": 1.2890625, "learning_rate": 0.000157, "loss": 6.9439, "mean_token_accuracy": 0.09078950360417366, "num_tokens": 583075.0, "step": 315 }, { "entropy": 7.410228586196899, "epoch": 0.017905603894468845, "grad_norm": 1.234375, "learning_rate": 0.0001595, "loss": 6.9607, "mean_token_accuracy": 0.09146012365818024, "num_tokens": 593003.0, "step": 320 }, { "entropy": 7.167853116989136, "epoch": 0.018185378955319922, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 6.7824, "mean_token_accuracy": 0.10193281322717666, "num_tokens": 602273.0, "step": 325 }, { "entropy": 7.272089242935181, "epoch": 0.018465154016171, "grad_norm": 1.3671875, "learning_rate": 0.00016450000000000001, "loss": 6.7087, "mean_token_accuracy": 0.09642531052231788, "num_tokens": 610364.0, "step": 330 }, { "entropy": 7.081447410583496, "epoch": 0.018744929077022073, "grad_norm": 1.4140625, "learning_rate": 0.00016700000000000002, "loss": 6.7188, "mean_token_accuracy": 0.0957895465195179, "num_tokens": 618753.0, "step": 335 }, { "entropy": 7.264566278457641, "epoch": 0.01902470413787315, "grad_norm": 1.421875, "learning_rate": 0.00016950000000000003, "loss": 6.8352, "mean_token_accuracy": 0.0967351920902729, "num_tokens": 627697.0, "step": 340 }, { "entropy": 7.207143497467041, "epoch": 0.019304479198724227, "grad_norm": 1.4296875, "learning_rate": 0.00017199999999999998, "loss": 6.7869, "mean_token_accuracy": 0.093389343470335, "num_tokens": 636499.0, "step": 345 }, { "entropy": 7.1959278106689455, "epoch": 0.0195842542595753, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.8033, "mean_token_accuracy": 0.08842543438076973, "num_tokens": 646426.0, "step": 350 }, { "entropy": 7.133398866653442, "epoch": 0.019864029320426378, "grad_norm": 1.125, "learning_rate": 0.000177, "loss": 6.7289, "mean_token_accuracy": 0.09562224373221398, "num_tokens": 656593.0, "step": 355 }, { "entropy": 7.104539823532105, "epoch": 0.020143804381277452, "grad_norm": 1.265625, "learning_rate": 0.0001795, "loss": 6.7823, "mean_token_accuracy": 0.0965128093957901, "num_tokens": 665631.0, "step": 360 }, { "entropy": 7.133638668060303, "epoch": 0.02042357944212853, "grad_norm": 1.21875, "learning_rate": 0.000182, "loss": 6.6893, "mean_token_accuracy": 0.09800055772066116, "num_tokens": 674943.0, "step": 365 }, { "entropy": 6.991700029373169, "epoch": 0.020703354502979606, "grad_norm": 1.4375, "learning_rate": 0.0001845, "loss": 6.6059, "mean_token_accuracy": 0.10655041188001632, "num_tokens": 683500.0, "step": 370 }, { "entropy": 7.158477783203125, "epoch": 0.02098312956383068, "grad_norm": 1.3359375, "learning_rate": 0.000187, "loss": 6.7946, "mean_token_accuracy": 0.09516055136919022, "num_tokens": 692147.0, "step": 375 }, { "entropy": 7.127016592025757, "epoch": 0.021262904624681757, "grad_norm": 1.328125, "learning_rate": 0.0001895, "loss": 6.7322, "mean_token_accuracy": 0.09688446819782257, "num_tokens": 701226.0, "step": 380 }, { "entropy": 7.150118589401245, "epoch": 0.02154267968553283, "grad_norm": 1.421875, "learning_rate": 0.000192, "loss": 6.7553, "mean_token_accuracy": 0.10244472473859786, "num_tokens": 710886.0, "step": 385 }, { "entropy": 7.099573230743408, "epoch": 0.021822454746383908, "grad_norm": 1.5078125, "learning_rate": 0.0001945, "loss": 6.6973, "mean_token_accuracy": 0.09484406411647797, "num_tokens": 719209.0, "step": 390 }, { "entropy": 6.925067281723022, "epoch": 0.022102229807234985, "grad_norm": 1.3046875, "learning_rate": 0.00019700000000000002, "loss": 6.5703, "mean_token_accuracy": 0.10873782187700272, "num_tokens": 728376.0, "step": 395 }, { "entropy": 7.04664626121521, "epoch": 0.02238200486808606, "grad_norm": 1.1171875, "learning_rate": 0.00019950000000000002, "loss": 6.6328, "mean_token_accuracy": 0.09875192418694496, "num_tokens": 737110.0, "step": 400 }, { "entropy": 7.108943176269531, "epoch": 0.022661779928937135, "grad_norm": 1.3984375, "learning_rate": 0.000202, "loss": 6.6957, "mean_token_accuracy": 0.09161964356899262, "num_tokens": 746133.0, "step": 405 }, { "entropy": 6.9601562976837155, "epoch": 0.02294155498978821, "grad_norm": 1.296875, "learning_rate": 0.00020449999999999998, "loss": 6.6511, "mean_token_accuracy": 0.10639781132340431, "num_tokens": 755994.0, "step": 410 }, { "entropy": 6.884982681274414, "epoch": 0.023221330050639286, "grad_norm": 1.296875, "learning_rate": 0.000207, "loss": 6.5945, "mean_token_accuracy": 0.10252679362893105, "num_tokens": 764630.0, "step": 415 }, { "entropy": 7.020522737503052, "epoch": 0.023501105111490363, "grad_norm": 1.28125, "learning_rate": 0.0002095, "loss": 6.6171, "mean_token_accuracy": 0.10485479906201363, "num_tokens": 773577.0, "step": 420 }, { "entropy": 6.976370239257813, "epoch": 0.023780880172341437, "grad_norm": 1.234375, "learning_rate": 0.000212, "loss": 6.5175, "mean_token_accuracy": 0.10637958571314812, "num_tokens": 782405.0, "step": 425 }, { "entropy": 6.990795373916626, "epoch": 0.024060655233192514, "grad_norm": 1.2109375, "learning_rate": 0.0002145, "loss": 6.679, "mean_token_accuracy": 0.1029113069176674, "num_tokens": 790940.0, "step": 430 }, { "entropy": 6.904673862457275, "epoch": 0.024340430294043588, "grad_norm": 1.359375, "learning_rate": 0.00021700000000000002, "loss": 6.6626, "mean_token_accuracy": 0.09815835878252983, "num_tokens": 800023.0, "step": 435 }, { "entropy": 7.0055601596832275, "epoch": 0.024620205354894665, "grad_norm": 1.203125, "learning_rate": 0.0002195, "loss": 6.5512, "mean_token_accuracy": 0.11006631255149842, "num_tokens": 809146.0, "step": 440 }, { "entropy": 6.848315715789795, "epoch": 0.024899980415745742, "grad_norm": 1.2265625, "learning_rate": 0.000222, "loss": 6.5253, "mean_token_accuracy": 0.10747256800532341, "num_tokens": 818300.0, "step": 445 }, { "entropy": 6.93147349357605, "epoch": 0.025179755476596816, "grad_norm": 1.2421875, "learning_rate": 0.0002245, "loss": 6.5748, "mean_token_accuracy": 0.10701234936714173, "num_tokens": 826991.0, "step": 450 }, { "entropy": 6.828905248641968, "epoch": 0.025459530537447893, "grad_norm": 1.265625, "learning_rate": 0.00022700000000000002, "loss": 6.5695, "mean_token_accuracy": 0.10557045862078666, "num_tokens": 836530.0, "step": 455 }, { "entropy": 6.996236515045166, "epoch": 0.025739305598298966, "grad_norm": 1.1953125, "learning_rate": 0.00022950000000000002, "loss": 6.6996, "mean_token_accuracy": 0.10405678376555443, "num_tokens": 845754.0, "step": 460 }, { "entropy": 6.909709072113037, "epoch": 0.026019080659150044, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 6.5825, "mean_token_accuracy": 0.10672992318868638, "num_tokens": 854778.0, "step": 465 }, { "entropy": 6.931979942321777, "epoch": 0.02629885572000112, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 6.5878, "mean_token_accuracy": 0.10348478704690933, "num_tokens": 863057.0, "step": 470 }, { "entropy": 6.977036380767823, "epoch": 0.026578630780852194, "grad_norm": 1.3125, "learning_rate": 0.000237, "loss": 6.6828, "mean_token_accuracy": 0.10146789252758026, "num_tokens": 872781.0, "step": 475 }, { "entropy": 6.804804468154908, "epoch": 0.02685840584170327, "grad_norm": 1.3125, "learning_rate": 0.0002395, "loss": 6.4354, "mean_token_accuracy": 0.10844895020127296, "num_tokens": 881815.0, "step": 480 }, { "entropy": 6.778733253479004, "epoch": 0.027138180902554345, "grad_norm": 1.2109375, "learning_rate": 0.000242, "loss": 6.5231, "mean_token_accuracy": 0.10757277086377144, "num_tokens": 890745.0, "step": 485 }, { "entropy": 6.819875049591064, "epoch": 0.027417955963405422, "grad_norm": 1.1171875, "learning_rate": 0.0002445, "loss": 6.5657, "mean_token_accuracy": 0.10660690292716027, "num_tokens": 900315.0, "step": 490 }, { "entropy": 6.791854763031006, "epoch": 0.0276977310242565, "grad_norm": 1.2734375, "learning_rate": 0.000247, "loss": 6.5405, "mean_token_accuracy": 0.10886701792478562, "num_tokens": 909367.0, "step": 495 }, { "entropy": 6.921594429016113, "epoch": 0.027977506085107573, "grad_norm": 1.234375, "learning_rate": 0.0002495, "loss": 6.6413, "mean_token_accuracy": 0.10079527497291565, "num_tokens": 919180.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1366924769280000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }