{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.055955012170215146, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691998958587646, "epoch": 0.0002797750608510757, "grad_norm": 15.75, "learning_rate": 2e-06, "loss": 10.7863, "mean_token_accuracy": 0.0001396648003719747, "num_tokens": 8714.0, "step": 5 }, { "entropy": 10.691917991638183, "epoch": 0.0005595501217021514, "grad_norm": 12.6875, "learning_rate": 4.5e-06, "loss": 10.7427, "mean_token_accuracy": 6.393861840479076e-05, "num_tokens": 18630.0, "step": 10 }, { "entropy": 10.690977668762207, "epoch": 0.0008393251825532272, "grad_norm": 9.8125, "learning_rate": 7e-06, "loss": 10.4865, "mean_token_accuracy": 0.026551677379757166, "num_tokens": 28134.0, "step": 15 }, { "entropy": 10.678603363037109, "epoch": 0.0011191002434043028, "grad_norm": 6.4375, "learning_rate": 9.5e-06, "loss": 10.188, "mean_token_accuracy": 0.04146423395723105, "num_tokens": 37326.0, "step": 20 }, { "entropy": 10.619599628448487, "epoch": 0.0013988753042553786, "grad_norm": 4.15625, "learning_rate": 1.2e-05, "loss": 9.8709, "mean_token_accuracy": 0.04364684820175171, "num_tokens": 45813.0, "step": 25 }, { "entropy": 10.597146987915039, "epoch": 0.0016786503651064545, "grad_norm": 3.265625, "learning_rate": 1.4500000000000002e-05, "loss": 9.7719, "mean_token_accuracy": 0.03872578963637352, "num_tokens": 54746.0, "step": 30 }, { "entropy": 10.614226627349854, "epoch": 0.0019584254259575303, "grad_norm": 2.734375, "learning_rate": 1.7000000000000003e-05, "loss": 9.6616, "mean_token_accuracy": 0.04101139903068542, "num_tokens": 64386.0, "step": 35 }, { "entropy": 10.594823837280273, "epoch": 0.0022382004868086057, "grad_norm": 2.71875, "learning_rate": 1.95e-05, "loss": 9.6762, "mean_token_accuracy": 0.03911035992205143, "num_tokens": 73648.0, "step": 40 }, { "entropy": 10.59369068145752, "epoch": 0.0025179755476596815, "grad_norm": 2.546875, "learning_rate": 2.2e-05, "loss": 9.5708, "mean_token_accuracy": 0.04052439667284489, "num_tokens": 82108.0, "step": 45 }, { "entropy": 10.583232975006103, "epoch": 0.0027977506085107573, "grad_norm": 2.546875, "learning_rate": 2.4500000000000003e-05, "loss": 9.5017, "mean_token_accuracy": 0.047141891345381735, "num_tokens": 92109.0, "step": 50 }, { "entropy": 10.565110969543458, "epoch": 0.003077525669361833, "grad_norm": 2.703125, "learning_rate": 2.7e-05, "loss": 9.4323, "mean_token_accuracy": 0.052879580110311505, "num_tokens": 101365.0, "step": 55 }, { "entropy": 10.425063991546631, "epoch": 0.003357300730212909, "grad_norm": 2.546875, "learning_rate": 2.95e-05, "loss": 9.3995, "mean_token_accuracy": 0.05232988931238651, "num_tokens": 110432.0, "step": 60 }, { "entropy": 10.407742786407471, "epoch": 0.0036370757910639847, "grad_norm": 2.34375, "learning_rate": 3.2e-05, "loss": 9.3122, "mean_token_accuracy": 0.051964789256453515, "num_tokens": 120191.0, "step": 65 }, { "entropy": 10.429958152770997, "epoch": 0.0039168508519150606, "grad_norm": 2.3125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1579, "mean_token_accuracy": 0.06370341181755065, "num_tokens": 129580.0, "step": 70 }, { "entropy": 10.423612117767334, "epoch": 0.004196625912766136, "grad_norm": 2.375, "learning_rate": 3.7e-05, "loss": 9.1589, "mean_token_accuracy": 0.05433790199458599, "num_tokens": 139083.0, "step": 75 }, { "entropy": 10.42996587753296, "epoch": 0.004476400973617211, "grad_norm": 2.359375, "learning_rate": 3.95e-05, "loss": 8.9628, "mean_token_accuracy": 0.05919392295181751, "num_tokens": 148183.0, "step": 80 }, { "entropy": 10.377639865875244, "epoch": 0.004756176034468288, "grad_norm": 2.359375, "learning_rate": 4.2000000000000004e-05, "loss": 8.8812, "mean_token_accuracy": 0.060510285571217536, "num_tokens": 157015.0, "step": 85 }, { "entropy": 10.363342475891113, "epoch": 0.005035951095319363, "grad_norm": 2.921875, "learning_rate": 4.45e-05, "loss": 8.8142, "mean_token_accuracy": 0.06536102406680584, "num_tokens": 166314.0, "step": 90 }, { "entropy": 10.275917053222656, "epoch": 0.005315726156170439, "grad_norm": 2.203125, "learning_rate": 4.7000000000000004e-05, "loss": 8.6269, "mean_token_accuracy": 0.07039711400866508, "num_tokens": 175975.0, "step": 95 }, { "entropy": 10.235202980041503, "epoch": 0.005595501217021515, "grad_norm": 2.734375, "learning_rate": 4.9500000000000004e-05, "loss": 8.574, "mean_token_accuracy": 0.06645569279789924, "num_tokens": 185976.0, "step": 100 }, { "entropy": 10.220190620422363, "epoch": 0.005875276277872591, "grad_norm": 2.171875, "learning_rate": 5.2e-05, "loss": 8.4802, "mean_token_accuracy": 0.06686681807041168, "num_tokens": 195112.0, "step": 105 }, { "entropy": 10.113536167144776, "epoch": 0.006155051338723666, "grad_norm": 1.984375, "learning_rate": 5.45e-05, "loss": 8.4636, "mean_token_accuracy": 0.05900593213737011, "num_tokens": 205951.0, "step": 110 }, { "entropy": 10.075279331207275, "epoch": 0.006434826399574742, "grad_norm": 2.25, "learning_rate": 5.7e-05, "loss": 8.294, "mean_token_accuracy": 0.07148804180324078, "num_tokens": 214744.0, "step": 115 }, { "entropy": 9.955604076385498, "epoch": 0.006714601460425818, "grad_norm": 2.25, "learning_rate": 5.9499999999999996e-05, "loss": 8.1343, "mean_token_accuracy": 0.0751000139862299, "num_tokens": 223279.0, "step": 120 }, { "entropy": 9.898994541168213, "epoch": 0.006994376521276893, "grad_norm": 1.796875, "learning_rate": 6.2e-05, "loss": 8.0915, "mean_token_accuracy": 0.07411009185016156, "num_tokens": 232677.0, "step": 125 }, { "entropy": 9.685633563995362, "epoch": 0.0072741515821279695, "grad_norm": 2.015625, "learning_rate": 6.450000000000001e-05, "loss": 7.9322, "mean_token_accuracy": 0.07425446137785911, "num_tokens": 242890.0, "step": 130 }, { "entropy": 9.561828994750977, "epoch": 0.007553926642979045, "grad_norm": 1.78125, "learning_rate": 6.7e-05, "loss": 7.7431, "mean_token_accuracy": 0.07636365555226803, "num_tokens": 252490.0, "step": 135 }, { "entropy": 9.356704235076904, "epoch": 0.007833701703830121, "grad_norm": 1.5703125, "learning_rate": 6.950000000000001e-05, "loss": 7.6948, "mean_token_accuracy": 0.08176706209778786, "num_tokens": 261280.0, "step": 140 }, { "entropy": 9.167966556549072, "epoch": 0.008113476764681197, "grad_norm": 1.65625, "learning_rate": 7.2e-05, "loss": 7.65, "mean_token_accuracy": 0.08069443143904209, "num_tokens": 270000.0, "step": 145 }, { "entropy": 8.9812726020813, "epoch": 0.008393251825532272, "grad_norm": 2.453125, "learning_rate": 7.45e-05, "loss": 7.458, "mean_token_accuracy": 0.08502581343054771, "num_tokens": 279709.0, "step": 150 }, { "entropy": 8.729528427124023, "epoch": 0.008673026886383347, "grad_norm": 1.4453125, "learning_rate": 7.7e-05, "loss": 7.5225, "mean_token_accuracy": 0.082467582821846, "num_tokens": 288343.0, "step": 155 }, { "entropy": 8.595497226715088, "epoch": 0.008952801947234423, "grad_norm": 1.5234375, "learning_rate": 7.950000000000001e-05, "loss": 7.3566, "mean_token_accuracy": 0.08212127052247524, "num_tokens": 297387.0, "step": 160 }, { "entropy": 8.476513195037843, "epoch": 0.0092325770080855, "grad_norm": 1.625, "learning_rate": 8.2e-05, "loss": 7.3103, "mean_token_accuracy": 0.08278237357735634, "num_tokens": 307175.0, "step": 165 }, { "entropy": 8.29503517150879, "epoch": 0.009512352068936575, "grad_norm": 1.53125, "learning_rate": 8.450000000000001e-05, "loss": 7.2308, "mean_token_accuracy": 0.08270871713757515, "num_tokens": 316033.0, "step": 170 }, { "entropy": 8.15572385787964, "epoch": 0.00979212712978765, "grad_norm": 1.3984375, "learning_rate": 8.7e-05, "loss": 7.3076, "mean_token_accuracy": 0.08210290595889091, "num_tokens": 325740.0, "step": 175 }, { "entropy": 8.114148664474488, "epoch": 0.010071902190638726, "grad_norm": 1.375, "learning_rate": 8.95e-05, "loss": 7.2221, "mean_token_accuracy": 0.09068928360939026, "num_tokens": 334637.0, "step": 180 }, { "entropy": 8.006746578216553, "epoch": 0.010351677251489803, "grad_norm": 1.765625, "learning_rate": 9.2e-05, "loss": 7.2562, "mean_token_accuracy": 0.0831844873726368, "num_tokens": 344020.0, "step": 185 }, { "entropy": 7.939169883728027, "epoch": 0.010631452312340878, "grad_norm": 1.5703125, "learning_rate": 9.45e-05, "loss": 7.1292, "mean_token_accuracy": 0.09121446087956428, "num_tokens": 352924.0, "step": 190 }, { "entropy": 7.8939591407775875, "epoch": 0.010911227373191954, "grad_norm": 1.390625, "learning_rate": 9.7e-05, "loss": 7.149, "mean_token_accuracy": 0.08797023706138134, "num_tokens": 361755.0, "step": 195 }, { "entropy": 7.845557069778442, "epoch": 0.01119100243404303, "grad_norm": 1.2265625, "learning_rate": 9.95e-05, "loss": 7.1833, "mean_token_accuracy": 0.08474454060196876, "num_tokens": 370605.0, "step": 200 }, { "entropy": 7.757431316375732, "epoch": 0.011470777494894105, "grad_norm": 1.8125, "learning_rate": 0.000102, "loss": 7.0648, "mean_token_accuracy": 0.08956050127744675, "num_tokens": 379723.0, "step": 205 }, { "entropy": 7.683956050872803, "epoch": 0.011750552555745182, "grad_norm": 1.4140625, "learning_rate": 0.00010449999999999999, "loss": 7.0111, "mean_token_accuracy": 0.09118850380182267, "num_tokens": 389502.0, "step": 210 }, { "entropy": 7.613946056365966, "epoch": 0.012030327616596257, "grad_norm": 1.375, "learning_rate": 0.000107, "loss": 6.9865, "mean_token_accuracy": 0.09210970029234886, "num_tokens": 399116.0, "step": 215 }, { "entropy": 7.6888175964355465, "epoch": 0.012310102677447332, "grad_norm": 1.5390625, "learning_rate": 0.0001095, "loss": 7.0522, "mean_token_accuracy": 0.08312384895980358, "num_tokens": 408239.0, "step": 220 }, { "entropy": 7.582952213287354, "epoch": 0.012589877738298408, "grad_norm": 1.2109375, "learning_rate": 0.000112, "loss": 7.0558, "mean_token_accuracy": 0.08601429760456085, "num_tokens": 418801.0, "step": 225 }, { "entropy": 7.63437852859497, "epoch": 0.012869652799149483, "grad_norm": 1.3359375, "learning_rate": 0.0001145, "loss": 7.0975, "mean_token_accuracy": 0.08165879175066948, "num_tokens": 427584.0, "step": 230 }, { "entropy": 7.647107696533203, "epoch": 0.01314942786000056, "grad_norm": 1.4453125, "learning_rate": 0.00011700000000000001, "loss": 7.0398, "mean_token_accuracy": 0.08437106013298035, "num_tokens": 437345.0, "step": 235 }, { "entropy": 7.595585727691651, "epoch": 0.013429202920851636, "grad_norm": 1.4453125, "learning_rate": 0.00011949999999999999, "loss": 7.0693, "mean_token_accuracy": 0.09033490121364593, "num_tokens": 446550.0, "step": 240 }, { "entropy": 7.530496215820312, "epoch": 0.013708977981702711, "grad_norm": 1.1875, "learning_rate": 0.000122, "loss": 7.0332, "mean_token_accuracy": 0.08355908021330834, "num_tokens": 456394.0, "step": 245 }, { "entropy": 7.545537424087525, "epoch": 0.013988753042553786, "grad_norm": 1.3671875, "learning_rate": 0.0001245, "loss": 6.9254, "mean_token_accuracy": 0.09105066359043121, "num_tokens": 465467.0, "step": 250 }, { "entropy": 7.4903782367706295, "epoch": 0.014268528103404862, "grad_norm": 1.296875, "learning_rate": 0.000127, "loss": 6.9994, "mean_token_accuracy": 0.09321118667721748, "num_tokens": 474838.0, "step": 255 }, { "entropy": 7.407280015945434, "epoch": 0.014548303164255939, "grad_norm": 1.2109375, "learning_rate": 0.0001295, "loss": 6.8929, "mean_token_accuracy": 0.09139523953199387, "num_tokens": 483414.0, "step": 260 }, { "entropy": 7.481622314453125, "epoch": 0.014828078225107014, "grad_norm": 1.2578125, "learning_rate": 0.000132, "loss": 6.9248, "mean_token_accuracy": 0.08975184708833694, "num_tokens": 491802.0, "step": 265 }, { "entropy": 7.453138542175293, "epoch": 0.01510785328595809, "grad_norm": 1.2734375, "learning_rate": 0.00013450000000000002, "loss": 6.9211, "mean_token_accuracy": 0.08993491381406785, "num_tokens": 502007.0, "step": 270 }, { "entropy": 7.3567157745361325, "epoch": 0.015387628346809165, "grad_norm": 1.328125, "learning_rate": 0.00013700000000000002, "loss": 6.9517, "mean_token_accuracy": 0.09103975892066955, "num_tokens": 510806.0, "step": 275 }, { "entropy": 7.387433815002441, "epoch": 0.015667403407660242, "grad_norm": 1.3203125, "learning_rate": 0.0001395, "loss": 6.8927, "mean_token_accuracy": 0.09123391136527062, "num_tokens": 519526.0, "step": 280 }, { "entropy": 7.356798839569092, "epoch": 0.015947178468511316, "grad_norm": 1.2109375, "learning_rate": 0.00014199999999999998, "loss": 6.8069, "mean_token_accuracy": 0.09702679142355919, "num_tokens": 529036.0, "step": 285 }, { "entropy": 7.348542070388794, "epoch": 0.016226953529362393, "grad_norm": 1.53125, "learning_rate": 0.0001445, "loss": 6.8877, "mean_token_accuracy": 0.09220745116472244, "num_tokens": 537758.0, "step": 290 }, { "entropy": 7.252509832382202, "epoch": 0.016506728590213467, "grad_norm": 1.25, "learning_rate": 0.000147, "loss": 6.797, "mean_token_accuracy": 0.0996977336704731, "num_tokens": 546401.0, "step": 295 }, { "entropy": 7.282312059402466, "epoch": 0.016786503651064544, "grad_norm": 1.1796875, "learning_rate": 0.0001495, "loss": 6.8229, "mean_token_accuracy": 0.09258124381303787, "num_tokens": 555839.0, "step": 300 }, { "entropy": 7.447148847579956, "epoch": 0.01706627871191562, "grad_norm": 1.6875, "learning_rate": 0.000152, "loss": 6.9703, "mean_token_accuracy": 0.09544998183846473, "num_tokens": 565150.0, "step": 305 }, { "entropy": 7.174850606918335, "epoch": 0.017346053772766695, "grad_norm": 1.3984375, "learning_rate": 0.00015450000000000001, "loss": 6.8185, "mean_token_accuracy": 0.09337743893265724, "num_tokens": 574376.0, "step": 310 }, { "entropy": 7.367434978485107, "epoch": 0.01762582883361777, "grad_norm": 1.2890625, "learning_rate": 0.000157, "loss": 6.9439, "mean_token_accuracy": 0.09078950360417366, "num_tokens": 583075.0, "step": 315 }, { "entropy": 7.410228586196899, "epoch": 0.017905603894468845, "grad_norm": 1.234375, "learning_rate": 0.0001595, "loss": 6.9607, "mean_token_accuracy": 0.09146012365818024, "num_tokens": 593003.0, "step": 320 }, { "entropy": 7.167853116989136, "epoch": 0.018185378955319922, "grad_norm": 1.3515625, "learning_rate": 0.000162, "loss": 6.7824, "mean_token_accuracy": 0.10193281322717666, "num_tokens": 602273.0, "step": 325 }, { "entropy": 7.272089242935181, "epoch": 0.018465154016171, "grad_norm": 1.3671875, "learning_rate": 0.00016450000000000001, "loss": 6.7087, "mean_token_accuracy": 0.09642531052231788, "num_tokens": 610364.0, "step": 330 }, { "entropy": 7.081447410583496, "epoch": 0.018744929077022073, "grad_norm": 1.4140625, "learning_rate": 0.00016700000000000002, "loss": 6.7188, "mean_token_accuracy": 0.0957895465195179, "num_tokens": 618753.0, "step": 335 }, { "entropy": 7.264566278457641, "epoch": 0.01902470413787315, "grad_norm": 1.421875, "learning_rate": 0.00016950000000000003, "loss": 6.8352, "mean_token_accuracy": 0.0967351920902729, "num_tokens": 627697.0, "step": 340 }, { "entropy": 7.207143497467041, "epoch": 0.019304479198724227, "grad_norm": 1.4296875, "learning_rate": 0.00017199999999999998, "loss": 6.7869, "mean_token_accuracy": 0.093389343470335, "num_tokens": 636499.0, "step": 345 }, { "entropy": 7.1959278106689455, "epoch": 0.0195842542595753, "grad_norm": 1.2890625, "learning_rate": 0.00017449999999999999, "loss": 6.8033, "mean_token_accuracy": 0.08842543438076973, "num_tokens": 646426.0, "step": 350 }, { "entropy": 7.133398866653442, "epoch": 0.019864029320426378, "grad_norm": 1.125, "learning_rate": 0.000177, "loss": 6.7289, "mean_token_accuracy": 0.09562224373221398, "num_tokens": 656593.0, "step": 355 }, { "entropy": 7.104539823532105, "epoch": 0.020143804381277452, "grad_norm": 1.265625, "learning_rate": 0.0001795, "loss": 6.7823, "mean_token_accuracy": 0.0965128093957901, "num_tokens": 665631.0, "step": 360 }, { "entropy": 7.133638668060303, "epoch": 0.02042357944212853, "grad_norm": 1.21875, "learning_rate": 0.000182, "loss": 6.6893, "mean_token_accuracy": 0.09800055772066116, "num_tokens": 674943.0, "step": 365 }, { "entropy": 6.991700029373169, "epoch": 0.020703354502979606, "grad_norm": 1.4375, "learning_rate": 0.0001845, "loss": 6.6059, "mean_token_accuracy": 0.10655041188001632, "num_tokens": 683500.0, "step": 370 }, { "entropy": 7.158477783203125, "epoch": 0.02098312956383068, "grad_norm": 1.3359375, "learning_rate": 0.000187, "loss": 6.7946, "mean_token_accuracy": 0.09516055136919022, "num_tokens": 692147.0, "step": 375 }, { "entropy": 7.127016592025757, "epoch": 0.021262904624681757, "grad_norm": 1.328125, "learning_rate": 0.0001895, "loss": 6.7322, "mean_token_accuracy": 0.09688446819782257, "num_tokens": 701226.0, "step": 380 }, { "entropy": 7.150118589401245, "epoch": 0.02154267968553283, "grad_norm": 1.421875, "learning_rate": 0.000192, "loss": 6.7553, "mean_token_accuracy": 0.10244472473859786, "num_tokens": 710886.0, "step": 385 }, { "entropy": 7.099573230743408, "epoch": 0.021822454746383908, "grad_norm": 1.5078125, "learning_rate": 0.0001945, "loss": 6.6973, "mean_token_accuracy": 0.09484406411647797, "num_tokens": 719209.0, "step": 390 }, { "entropy": 6.925067281723022, "epoch": 0.022102229807234985, "grad_norm": 1.3046875, "learning_rate": 0.00019700000000000002, "loss": 6.5703, "mean_token_accuracy": 0.10873782187700272, "num_tokens": 728376.0, "step": 395 }, { "entropy": 7.04664626121521, "epoch": 0.02238200486808606, "grad_norm": 1.1171875, "learning_rate": 0.00019950000000000002, "loss": 6.6328, "mean_token_accuracy": 0.09875192418694496, "num_tokens": 737110.0, "step": 400 }, { "entropy": 7.108943176269531, "epoch": 0.022661779928937135, "grad_norm": 1.3984375, "learning_rate": 0.000202, "loss": 6.6957, "mean_token_accuracy": 0.09161964356899262, "num_tokens": 746133.0, "step": 405 }, { "entropy": 6.9601562976837155, "epoch": 0.02294155498978821, "grad_norm": 1.296875, "learning_rate": 0.00020449999999999998, "loss": 6.6511, "mean_token_accuracy": 0.10639781132340431, "num_tokens": 755994.0, "step": 410 }, { "entropy": 6.884982681274414, "epoch": 0.023221330050639286, "grad_norm": 1.296875, "learning_rate": 0.000207, "loss": 6.5945, "mean_token_accuracy": 0.10252679362893105, "num_tokens": 764630.0, "step": 415 }, { "entropy": 7.020522737503052, "epoch": 0.023501105111490363, "grad_norm": 1.28125, "learning_rate": 0.0002095, "loss": 6.6171, "mean_token_accuracy": 0.10485479906201363, "num_tokens": 773577.0, "step": 420 }, { "entropy": 6.976370239257813, "epoch": 0.023780880172341437, "grad_norm": 1.234375, "learning_rate": 0.000212, "loss": 6.5175, "mean_token_accuracy": 0.10637958571314812, "num_tokens": 782405.0, "step": 425 }, { "entropy": 6.990795373916626, "epoch": 0.024060655233192514, "grad_norm": 1.2109375, "learning_rate": 0.0002145, "loss": 6.679, "mean_token_accuracy": 0.1029113069176674, "num_tokens": 790940.0, "step": 430 }, { "entropy": 6.904673862457275, "epoch": 0.024340430294043588, "grad_norm": 1.359375, "learning_rate": 0.00021700000000000002, "loss": 6.6626, "mean_token_accuracy": 0.09815835878252983, "num_tokens": 800023.0, "step": 435 }, { "entropy": 7.0055601596832275, "epoch": 0.024620205354894665, "grad_norm": 1.203125, "learning_rate": 0.0002195, "loss": 6.5512, "mean_token_accuracy": 0.11006631255149842, "num_tokens": 809146.0, "step": 440 }, { "entropy": 6.848315715789795, "epoch": 0.024899980415745742, "grad_norm": 1.2265625, "learning_rate": 0.000222, "loss": 6.5253, "mean_token_accuracy": 0.10747256800532341, "num_tokens": 818300.0, "step": 445 }, { "entropy": 6.93147349357605, "epoch": 0.025179755476596816, "grad_norm": 1.2421875, "learning_rate": 0.0002245, "loss": 6.5748, "mean_token_accuracy": 0.10701234936714173, "num_tokens": 826991.0, "step": 450 }, { "entropy": 6.828905248641968, "epoch": 0.025459530537447893, "grad_norm": 1.265625, "learning_rate": 0.00022700000000000002, "loss": 6.5695, "mean_token_accuracy": 0.10557045862078666, "num_tokens": 836530.0, "step": 455 }, { "entropy": 6.996236515045166, "epoch": 0.025739305598298966, "grad_norm": 1.1953125, "learning_rate": 0.00022950000000000002, "loss": 6.6996, "mean_token_accuracy": 0.10405678376555443, "num_tokens": 845754.0, "step": 460 }, { "entropy": 6.909709072113037, "epoch": 0.026019080659150044, "grad_norm": 1.234375, "learning_rate": 0.00023200000000000003, "loss": 6.5825, "mean_token_accuracy": 0.10672992318868638, "num_tokens": 854778.0, "step": 465 }, { "entropy": 6.931979942321777, "epoch": 0.02629885572000112, "grad_norm": 1.328125, "learning_rate": 0.00023449999999999998, "loss": 6.5878, "mean_token_accuracy": 0.10348478704690933, "num_tokens": 863057.0, "step": 470 }, { "entropy": 6.977036380767823, "epoch": 0.026578630780852194, "grad_norm": 1.3125, "learning_rate": 0.000237, "loss": 6.6828, "mean_token_accuracy": 0.10146789252758026, "num_tokens": 872781.0, "step": 475 }, { "entropy": 6.804804468154908, "epoch": 0.02685840584170327, "grad_norm": 1.3125, "learning_rate": 0.0002395, "loss": 6.4354, "mean_token_accuracy": 0.10844895020127296, "num_tokens": 881815.0, "step": 480 }, { "entropy": 6.778733253479004, "epoch": 0.027138180902554345, "grad_norm": 1.2109375, "learning_rate": 0.000242, "loss": 6.5231, "mean_token_accuracy": 0.10757277086377144, "num_tokens": 890745.0, "step": 485 }, { "entropy": 6.819875049591064, "epoch": 0.027417955963405422, "grad_norm": 1.1171875, "learning_rate": 0.0002445, "loss": 6.5657, "mean_token_accuracy": 0.10660690292716027, "num_tokens": 900315.0, "step": 490 }, { "entropy": 6.791854763031006, "epoch": 0.0276977310242565, "grad_norm": 1.2734375, "learning_rate": 0.000247, "loss": 6.5405, "mean_token_accuracy": 0.10886701792478562, "num_tokens": 909367.0, "step": 495 }, { "entropy": 6.921594429016113, "epoch": 0.027977506085107573, "grad_norm": 1.234375, "learning_rate": 0.0002495, "loss": 6.6413, "mean_token_accuracy": 0.10079527497291565, "num_tokens": 919180.0, "step": 500 }, { "entropy": 6.830562448501587, "epoch": 0.02825728114595865, "grad_norm": 1.2734375, "learning_rate": 0.000252, "loss": 6.5006, "mean_token_accuracy": 0.11153338849544525, "num_tokens": 928619.0, "step": 505 }, { "entropy": 6.770093488693237, "epoch": 0.028537056206809724, "grad_norm": 1.34375, "learning_rate": 0.0002545, "loss": 6.5084, "mean_token_accuracy": 0.10852807909250259, "num_tokens": 938419.0, "step": 510 }, { "entropy": 6.805925559997559, "epoch": 0.0288168312676608, "grad_norm": 1.1796875, "learning_rate": 0.000257, "loss": 6.5576, "mean_token_accuracy": 0.10293798074126244, "num_tokens": 947852.0, "step": 515 }, { "entropy": 6.79404993057251, "epoch": 0.029096606328511878, "grad_norm": 1.3828125, "learning_rate": 0.0002595, "loss": 6.453, "mean_token_accuracy": 0.11094750836491585, "num_tokens": 956202.0, "step": 520 }, { "entropy": 6.7460289478302, "epoch": 0.02937638138936295, "grad_norm": 1.3515625, "learning_rate": 0.000262, "loss": 6.5059, "mean_token_accuracy": 0.11226325705647469, "num_tokens": 965045.0, "step": 525 }, { "entropy": 6.691509819030761, "epoch": 0.02965615645021403, "grad_norm": 1.2421875, "learning_rate": 0.00026450000000000003, "loss": 6.4299, "mean_token_accuracy": 0.11053601801395416, "num_tokens": 974100.0, "step": 530 }, { "entropy": 6.774121332168579, "epoch": 0.029935931511065102, "grad_norm": 1.34375, "learning_rate": 0.00026700000000000004, "loss": 6.6318, "mean_token_accuracy": 0.10233537256717681, "num_tokens": 983177.0, "step": 535 }, { "entropy": 6.8688215732574465, "epoch": 0.03021570657191618, "grad_norm": 1.234375, "learning_rate": 0.00026950000000000005, "loss": 6.5507, "mean_token_accuracy": 0.10545486286282539, "num_tokens": 991945.0, "step": 540 }, { "entropy": 6.710129165649414, "epoch": 0.030495481632767257, "grad_norm": 1.1796875, "learning_rate": 0.00027200000000000005, "loss": 6.4721, "mean_token_accuracy": 0.1087389424443245, "num_tokens": 1000987.0, "step": 545 }, { "entropy": 6.800864505767822, "epoch": 0.03077525669361833, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 6.4643, "mean_token_accuracy": 0.10743949860334397, "num_tokens": 1010531.0, "step": 550 }, { "entropy": 6.696709108352661, "epoch": 0.031055031754469407, "grad_norm": 1.3828125, "learning_rate": 0.000277, "loss": 6.5063, "mean_token_accuracy": 0.1075245812535286, "num_tokens": 1018854.0, "step": 555 }, { "entropy": 6.655027151107788, "epoch": 0.031334806815320485, "grad_norm": 1.4296875, "learning_rate": 0.0002795, "loss": 6.548, "mean_token_accuracy": 0.1032408431172371, "num_tokens": 1028972.0, "step": 560 }, { "entropy": 6.847776794433594, "epoch": 0.031614581876171555, "grad_norm": 1.28125, "learning_rate": 0.00028199999999999997, "loss": 6.5906, "mean_token_accuracy": 0.10243177711963654, "num_tokens": 1038730.0, "step": 565 }, { "entropy": 6.837841749191284, "epoch": 0.03189435693702263, "grad_norm": 1.2109375, "learning_rate": 0.0002845, "loss": 6.5264, "mean_token_accuracy": 0.10695758983492851, "num_tokens": 1048084.0, "step": 570 }, { "entropy": 6.699676752090454, "epoch": 0.03217413199787371, "grad_norm": 1.234375, "learning_rate": 0.000287, "loss": 6.4611, "mean_token_accuracy": 0.11191356033086777, "num_tokens": 1056977.0, "step": 575 }, { "entropy": 6.561819696426392, "epoch": 0.032453907058724786, "grad_norm": 1.2734375, "learning_rate": 0.0002895, "loss": 6.3217, "mean_token_accuracy": 0.11810181066393852, "num_tokens": 1065806.0, "step": 580 }, { "entropy": 6.624036598205566, "epoch": 0.03273368211957586, "grad_norm": 1.1875, "learning_rate": 0.000292, "loss": 6.3256, "mean_token_accuracy": 0.11459934562444687, "num_tokens": 1075131.0, "step": 585 }, { "entropy": 6.6630463123321535, "epoch": 0.03301345718042693, "grad_norm": 1.328125, "learning_rate": 0.0002945, "loss": 6.4097, "mean_token_accuracy": 0.11841127201914788, "num_tokens": 1083924.0, "step": 590 }, { "entropy": 6.601504135131836, "epoch": 0.03329323224127801, "grad_norm": 1.234375, "learning_rate": 0.000297, "loss": 6.3862, "mean_token_accuracy": 0.11470304578542709, "num_tokens": 1093113.0, "step": 595 }, { "entropy": 6.64865255355835, "epoch": 0.03357300730212909, "grad_norm": 1.1953125, "learning_rate": 0.0002995, "loss": 6.5657, "mean_token_accuracy": 0.10640456900000572, "num_tokens": 1102300.0, "step": 600 }, { "entropy": 6.638816690444946, "epoch": 0.033852782362980165, "grad_norm": 1.4609375, "learning_rate": 0.000302, "loss": 6.428, "mean_token_accuracy": 0.10878462493419647, "num_tokens": 1111202.0, "step": 605 }, { "entropy": 6.702850008010865, "epoch": 0.03413255742383124, "grad_norm": 1.25, "learning_rate": 0.0003045, "loss": 6.4169, "mean_token_accuracy": 0.11105761155486107, "num_tokens": 1120478.0, "step": 610 }, { "entropy": 6.571131038665771, "epoch": 0.03441233248468231, "grad_norm": 1.1484375, "learning_rate": 0.000307, "loss": 6.4164, "mean_token_accuracy": 0.10687699913978577, "num_tokens": 1130469.0, "step": 615 }, { "entropy": 6.731548213958741, "epoch": 0.03469210754553339, "grad_norm": 1.3046875, "learning_rate": 0.0003095, "loss": 6.4974, "mean_token_accuracy": 0.1069604717195034, "num_tokens": 1140612.0, "step": 620 }, { "entropy": 6.594935464859009, "epoch": 0.034971882606384466, "grad_norm": 1.3046875, "learning_rate": 0.000312, "loss": 6.4248, "mean_token_accuracy": 0.12048774287104606, "num_tokens": 1148798.0, "step": 625 }, { "entropy": 6.648222637176514, "epoch": 0.03525165766723554, "grad_norm": 1.3125, "learning_rate": 0.0003145, "loss": 6.4101, "mean_token_accuracy": 0.11359511390328407, "num_tokens": 1157445.0, "step": 630 }, { "entropy": 6.539268827438354, "epoch": 0.03553143272808662, "grad_norm": 1.3671875, "learning_rate": 0.000317, "loss": 6.4647, "mean_token_accuracy": 0.11291300356388093, "num_tokens": 1166407.0, "step": 635 }, { "entropy": 6.767864990234375, "epoch": 0.03581120778893769, "grad_norm": 1.3515625, "learning_rate": 0.0003195, "loss": 6.5337, "mean_token_accuracy": 0.10441585406661033, "num_tokens": 1175127.0, "step": 640 }, { "entropy": 6.594341659545899, "epoch": 0.03609098284978877, "grad_norm": 1.2421875, "learning_rate": 0.000322, "loss": 6.442, "mean_token_accuracy": 0.11554119363427162, "num_tokens": 1184385.0, "step": 645 }, { "entropy": 6.585985898971558, "epoch": 0.036370757910639845, "grad_norm": 1.1953125, "learning_rate": 0.00032450000000000003, "loss": 6.358, "mean_token_accuracy": 0.11490959599614144, "num_tokens": 1193463.0, "step": 650 }, { "entropy": 6.626502561569214, "epoch": 0.03665053297149092, "grad_norm": 1.28125, "learning_rate": 0.00032700000000000003, "loss": 6.4127, "mean_token_accuracy": 0.11384888887405395, "num_tokens": 1201996.0, "step": 655 }, { "entropy": 6.5213230609893795, "epoch": 0.036930308032342, "grad_norm": 1.2265625, "learning_rate": 0.00032950000000000004, "loss": 6.3467, "mean_token_accuracy": 0.11206159815192222, "num_tokens": 1211489.0, "step": 660 }, { "entropy": 6.517415475845337, "epoch": 0.037210083093193076, "grad_norm": 1.234375, "learning_rate": 0.00033200000000000005, "loss": 6.3471, "mean_token_accuracy": 0.12239813059568405, "num_tokens": 1221201.0, "step": 665 }, { "entropy": 6.4704029083251955, "epoch": 0.037489858154044146, "grad_norm": 1.296875, "learning_rate": 0.00033450000000000005, "loss": 6.3499, "mean_token_accuracy": 0.1122575543820858, "num_tokens": 1229578.0, "step": 670 }, { "entropy": 6.515661096572876, "epoch": 0.037769633214895224, "grad_norm": 1.2734375, "learning_rate": 0.000337, "loss": 6.3019, "mean_token_accuracy": 0.11475893035531044, "num_tokens": 1238017.0, "step": 675 }, { "entropy": 6.505735158920288, "epoch": 0.0380494082757463, "grad_norm": 1.140625, "learning_rate": 0.0003395, "loss": 6.3619, "mean_token_accuracy": 0.11612248569726943, "num_tokens": 1246817.0, "step": 680 }, { "entropy": 6.607122898101807, "epoch": 0.03832918333659738, "grad_norm": 1.25, "learning_rate": 0.000342, "loss": 6.4622, "mean_token_accuracy": 0.11365066468715668, "num_tokens": 1255598.0, "step": 685 }, { "entropy": 6.572498512268067, "epoch": 0.038608958397448455, "grad_norm": 1.3984375, "learning_rate": 0.00034449999999999997, "loss": 6.3592, "mean_token_accuracy": 0.119878139346838, "num_tokens": 1264197.0, "step": 690 }, { "entropy": 6.447942590713501, "epoch": 0.038888733458299525, "grad_norm": 1.1953125, "learning_rate": 0.000347, "loss": 6.3071, "mean_token_accuracy": 0.11660419553518295, "num_tokens": 1273711.0, "step": 695 }, { "entropy": 6.46368556022644, "epoch": 0.0391685085191506, "grad_norm": 1.1875, "learning_rate": 0.0003495, "loss": 6.3266, "mean_token_accuracy": 0.1126562386751175, "num_tokens": 1283293.0, "step": 700 }, { "entropy": 6.579007863998413, "epoch": 0.03944828358000168, "grad_norm": 1.2578125, "learning_rate": 0.000352, "loss": 6.3279, "mean_token_accuracy": 0.11288972720503807, "num_tokens": 1292425.0, "step": 705 }, { "entropy": 6.375118112564087, "epoch": 0.039728058640852756, "grad_norm": 1.2109375, "learning_rate": 0.0003545, "loss": 6.3529, "mean_token_accuracy": 0.1110106885433197, "num_tokens": 1302168.0, "step": 710 }, { "entropy": 6.491702222824097, "epoch": 0.040007833701703834, "grad_norm": 1.1640625, "learning_rate": 0.000357, "loss": 6.319, "mean_token_accuracy": 0.11627506762742996, "num_tokens": 1310463.0, "step": 715 }, { "entropy": 6.47831015586853, "epoch": 0.040287608762554904, "grad_norm": 1.1953125, "learning_rate": 0.0003595, "loss": 6.2763, "mean_token_accuracy": 0.12363684177398682, "num_tokens": 1319161.0, "step": 720 }, { "entropy": 6.397577905654908, "epoch": 0.04056738382340598, "grad_norm": 1.1953125, "learning_rate": 0.000362, "loss": 6.2375, "mean_token_accuracy": 0.11746156364679336, "num_tokens": 1328504.0, "step": 725 }, { "entropy": 6.565845918655396, "epoch": 0.04084715888425706, "grad_norm": 1.28125, "learning_rate": 0.0003645, "loss": 6.4749, "mean_token_accuracy": 0.11466470956802369, "num_tokens": 1338246.0, "step": 730 }, { "entropy": 6.520300817489624, "epoch": 0.041126933945108135, "grad_norm": 1.0859375, "learning_rate": 0.000367, "loss": 6.4025, "mean_token_accuracy": 0.11708130165934563, "num_tokens": 1347338.0, "step": 735 }, { "entropy": 6.482167720794678, "epoch": 0.04140670900595921, "grad_norm": 1.234375, "learning_rate": 0.0003695, "loss": 6.4618, "mean_token_accuracy": 0.12073256149888038, "num_tokens": 1356687.0, "step": 740 }, { "entropy": 6.528582620620727, "epoch": 0.04168648406681028, "grad_norm": 1.1796875, "learning_rate": 0.000372, "loss": 6.3314, "mean_token_accuracy": 0.11828168481588364, "num_tokens": 1366039.0, "step": 745 }, { "entropy": 6.514997148513794, "epoch": 0.04196625912766136, "grad_norm": 1.1328125, "learning_rate": 0.0003745, "loss": 6.3703, "mean_token_accuracy": 0.12007363438606262, "num_tokens": 1375022.0, "step": 750 }, { "entropy": 6.558941888809204, "epoch": 0.04224603418851244, "grad_norm": 1.171875, "learning_rate": 0.000377, "loss": 6.3302, "mean_token_accuracy": 0.12099939808249474, "num_tokens": 1383362.0, "step": 755 }, { "entropy": 6.420841073989868, "epoch": 0.042525809249363514, "grad_norm": 1.1484375, "learning_rate": 0.0003795, "loss": 6.357, "mean_token_accuracy": 0.12097687721252441, "num_tokens": 1392759.0, "step": 760 }, { "entropy": 6.417665243148804, "epoch": 0.04280558431021459, "grad_norm": 1.1015625, "learning_rate": 0.000382, "loss": 6.354, "mean_token_accuracy": 0.1138949602842331, "num_tokens": 1402396.0, "step": 765 }, { "entropy": 6.445731592178345, "epoch": 0.04308535937106566, "grad_norm": 1.2421875, "learning_rate": 0.0003845, "loss": 6.3612, "mean_token_accuracy": 0.12402707412838936, "num_tokens": 1412376.0, "step": 770 }, { "entropy": 6.5388038635253904, "epoch": 0.04336513443191674, "grad_norm": 1.171875, "learning_rate": 0.00038700000000000003, "loss": 6.351, "mean_token_accuracy": 0.12133746147155762, "num_tokens": 1422101.0, "step": 775 }, { "entropy": 6.427302026748658, "epoch": 0.043644909492767815, "grad_norm": 1.2109375, "learning_rate": 0.00038950000000000003, "loss": 6.3701, "mean_token_accuracy": 0.11939814165234566, "num_tokens": 1431494.0, "step": 780 }, { "entropy": 6.348874950408936, "epoch": 0.04392468455361889, "grad_norm": 1.265625, "learning_rate": 0.00039200000000000004, "loss": 6.2279, "mean_token_accuracy": 0.12000525146722793, "num_tokens": 1440444.0, "step": 785 }, { "entropy": 6.335124874114991, "epoch": 0.04420445961446997, "grad_norm": 1.203125, "learning_rate": 0.00039450000000000005, "loss": 6.1876, "mean_token_accuracy": 0.12222216054797172, "num_tokens": 1448882.0, "step": 790 }, { "entropy": 6.43249545097351, "epoch": 0.04448423467532104, "grad_norm": 1.140625, "learning_rate": 0.00039700000000000005, "loss": 6.2684, "mean_token_accuracy": 0.12162192389369011, "num_tokens": 1457730.0, "step": 795 }, { "entropy": 6.388329219818115, "epoch": 0.04476400973617212, "grad_norm": 1.171875, "learning_rate": 0.0003995, "loss": 6.2851, "mean_token_accuracy": 0.12025910690426826, "num_tokens": 1466148.0, "step": 800 }, { "entropy": 6.339116954803467, "epoch": 0.045043784797023194, "grad_norm": 1.1796875, "learning_rate": 0.000402, "loss": 6.2755, "mean_token_accuracy": 0.12411149218678474, "num_tokens": 1475057.0, "step": 805 }, { "entropy": 6.443486499786377, "epoch": 0.04532355985787427, "grad_norm": 1.1640625, "learning_rate": 0.0004045, "loss": 6.3132, "mean_token_accuracy": 0.1179264523088932, "num_tokens": 1484620.0, "step": 810 }, { "entropy": 6.4343949317932125, "epoch": 0.04560333491872535, "grad_norm": 1.1484375, "learning_rate": 0.00040699999999999997, "loss": 6.3047, "mean_token_accuracy": 0.12113796547055244, "num_tokens": 1493122.0, "step": 815 }, { "entropy": 6.388117790222168, "epoch": 0.04588310997957642, "grad_norm": 1.0859375, "learning_rate": 0.0004095, "loss": 6.295, "mean_token_accuracy": 0.11858351081609726, "num_tokens": 1502040.0, "step": 820 }, { "entropy": 6.285999011993408, "epoch": 0.046162885040427495, "grad_norm": 1.109375, "learning_rate": 0.000412, "loss": 6.2361, "mean_token_accuracy": 0.1263887993991375, "num_tokens": 1511366.0, "step": 825 }, { "entropy": 6.496093702316284, "epoch": 0.04644266010127857, "grad_norm": 1.15625, "learning_rate": 0.0004145, "loss": 6.2927, "mean_token_accuracy": 0.128447774797678, "num_tokens": 1520323.0, "step": 830 }, { "entropy": 6.367697906494141, "epoch": 0.04672243516212965, "grad_norm": 1.2578125, "learning_rate": 0.000417, "loss": 6.3751, "mean_token_accuracy": 0.11920144334435463, "num_tokens": 1529395.0, "step": 835 }, { "entropy": 6.348806762695313, "epoch": 0.04700221022298073, "grad_norm": 1.0546875, "learning_rate": 0.0004195, "loss": 6.2316, "mean_token_accuracy": 0.12247003018856048, "num_tokens": 1538683.0, "step": 840 }, { "entropy": 6.338663005828858, "epoch": 0.0472819852838318, "grad_norm": 1.2109375, "learning_rate": 0.000422, "loss": 6.154, "mean_token_accuracy": 0.13075604513287545, "num_tokens": 1547812.0, "step": 845 }, { "entropy": 6.3082603931427, "epoch": 0.047561760344682874, "grad_norm": 1.1328125, "learning_rate": 0.0004245, "loss": 6.273, "mean_token_accuracy": 0.12150180563330651, "num_tokens": 1557932.0, "step": 850 }, { "entropy": 6.31761679649353, "epoch": 0.04784153540553395, "grad_norm": 1.1171875, "learning_rate": 0.000427, "loss": 6.3218, "mean_token_accuracy": 0.11715059727430344, "num_tokens": 1567775.0, "step": 855 }, { "entropy": 6.289759969711303, "epoch": 0.04812131046638503, "grad_norm": 1.0625, "learning_rate": 0.0004295, "loss": 6.2692, "mean_token_accuracy": 0.11850202679634095, "num_tokens": 1577707.0, "step": 860 }, { "entropy": 6.4301290035247805, "epoch": 0.048401085527236105, "grad_norm": 1.21875, "learning_rate": 0.000432, "loss": 6.2371, "mean_token_accuracy": 0.12808190882205964, "num_tokens": 1586114.0, "step": 865 }, { "entropy": 6.2476832389831545, "epoch": 0.048680860588087176, "grad_norm": 1.1875, "learning_rate": 0.0004345, "loss": 6.2356, "mean_token_accuracy": 0.12776880636811255, "num_tokens": 1595172.0, "step": 870 }, { "entropy": 6.332582092285156, "epoch": 0.04896063564893825, "grad_norm": 1.265625, "learning_rate": 0.000437, "loss": 6.1941, "mean_token_accuracy": 0.12674442008137704, "num_tokens": 1604025.0, "step": 875 }, { "entropy": 6.378393983840942, "epoch": 0.04924041070978933, "grad_norm": 1.1015625, "learning_rate": 0.0004395, "loss": 6.3774, "mean_token_accuracy": 0.12179499417543412, "num_tokens": 1612890.0, "step": 880 }, { "entropy": 6.334475088119507, "epoch": 0.04952018577064041, "grad_norm": 1.265625, "learning_rate": 0.000442, "loss": 6.2375, "mean_token_accuracy": 0.11860106736421586, "num_tokens": 1622153.0, "step": 885 }, { "entropy": 6.3245104312896725, "epoch": 0.049799960831491484, "grad_norm": 1.109375, "learning_rate": 0.0004445, "loss": 6.2902, "mean_token_accuracy": 0.12127727717161178, "num_tokens": 1631687.0, "step": 890 }, { "entropy": 6.444584751129151, "epoch": 0.050079735892342554, "grad_norm": 1.265625, "learning_rate": 0.000447, "loss": 6.363, "mean_token_accuracy": 0.11959558203816414, "num_tokens": 1641062.0, "step": 895 }, { "entropy": 6.220570611953735, "epoch": 0.05035951095319363, "grad_norm": 1.203125, "learning_rate": 0.00044950000000000003, "loss": 6.268, "mean_token_accuracy": 0.11896927058696746, "num_tokens": 1650291.0, "step": 900 }, { "entropy": 6.363810300827026, "epoch": 0.05063928601404471, "grad_norm": 1.3203125, "learning_rate": 0.00045200000000000004, "loss": 6.1853, "mean_token_accuracy": 0.12382128313183785, "num_tokens": 1659102.0, "step": 905 }, { "entropy": 6.265335369110107, "epoch": 0.050919061074895786, "grad_norm": 1.1953125, "learning_rate": 0.00045450000000000004, "loss": 6.1083, "mean_token_accuracy": 0.12587042823433875, "num_tokens": 1667835.0, "step": 910 }, { "entropy": 6.241576528549194, "epoch": 0.05119883613574686, "grad_norm": 1.2265625, "learning_rate": 0.00045700000000000005, "loss": 6.2574, "mean_token_accuracy": 0.12526341378688813, "num_tokens": 1676619.0, "step": 915 }, { "entropy": 6.208951044082641, "epoch": 0.05147861119659793, "grad_norm": 1.1875, "learning_rate": 0.00045950000000000006, "loss": 6.2091, "mean_token_accuracy": 0.12771726846694947, "num_tokens": 1686145.0, "step": 920 }, { "entropy": 6.403143787384034, "epoch": 0.05175838625744901, "grad_norm": 1.3046875, "learning_rate": 0.000462, "loss": 6.3385, "mean_token_accuracy": 0.1172799788415432, "num_tokens": 1695667.0, "step": 925 }, { "entropy": 6.366543626785278, "epoch": 0.05203816131830009, "grad_norm": 1.2890625, "learning_rate": 0.0004645, "loss": 6.2425, "mean_token_accuracy": 0.11943399086594582, "num_tokens": 1704269.0, "step": 930 }, { "entropy": 6.236631679534912, "epoch": 0.052317936379151164, "grad_norm": 1.1328125, "learning_rate": 0.000467, "loss": 6.2598, "mean_token_accuracy": 0.12105512395501136, "num_tokens": 1713185.0, "step": 935 }, { "entropy": 6.354249143600464, "epoch": 0.05259771144000224, "grad_norm": 1.1796875, "learning_rate": 0.0004695, "loss": 6.2887, "mean_token_accuracy": 0.12139227539300919, "num_tokens": 1722433.0, "step": 940 }, { "entropy": 6.341638278961182, "epoch": 0.05287748650085331, "grad_norm": 1.15625, "learning_rate": 0.000472, "loss": 6.2594, "mean_token_accuracy": 0.12757667824625968, "num_tokens": 1731763.0, "step": 945 }, { "entropy": 6.205323266983032, "epoch": 0.05315726156170439, "grad_norm": 1.1796875, "learning_rate": 0.0004745, "loss": 6.2029, "mean_token_accuracy": 0.12266376763582229, "num_tokens": 1741470.0, "step": 950 }, { "entropy": 6.175953912734985, "epoch": 0.053437036622555466, "grad_norm": 1.140625, "learning_rate": 0.000477, "loss": 6.0959, "mean_token_accuracy": 0.12836336940526963, "num_tokens": 1751099.0, "step": 955 }, { "entropy": 6.2856032371521, "epoch": 0.05371681168340654, "grad_norm": 1.171875, "learning_rate": 0.0004795, "loss": 6.2235, "mean_token_accuracy": 0.12410176768898964, "num_tokens": 1760296.0, "step": 960 }, { "entropy": 6.204359102249145, "epoch": 0.05399658674425762, "grad_norm": 1.1875, "learning_rate": 0.000482, "loss": 6.2335, "mean_token_accuracy": 0.11641522720456124, "num_tokens": 1768728.0, "step": 965 }, { "entropy": 6.363514423370361, "epoch": 0.05427636180510869, "grad_norm": 1.1953125, "learning_rate": 0.0004845, "loss": 6.1788, "mean_token_accuracy": 0.12237933203577996, "num_tokens": 1778413.0, "step": 970 }, { "entropy": 6.113896322250366, "epoch": 0.05455613686595977, "grad_norm": 1.2421875, "learning_rate": 0.000487, "loss": 6.1779, "mean_token_accuracy": 0.12829331532120705, "num_tokens": 1787604.0, "step": 975 }, { "entropy": 6.2251220703125, "epoch": 0.054835911926810844, "grad_norm": 1.2421875, "learning_rate": 0.0004895, "loss": 6.1367, "mean_token_accuracy": 0.13013790622353555, "num_tokens": 1796633.0, "step": 980 }, { "entropy": 6.2790031909942625, "epoch": 0.05511568698766192, "grad_norm": 1.234375, "learning_rate": 0.000492, "loss": 6.2145, "mean_token_accuracy": 0.1300550229847431, "num_tokens": 1805275.0, "step": 985 }, { "entropy": 6.169535732269287, "epoch": 0.055395462048513, "grad_norm": 1.21875, "learning_rate": 0.0004945, "loss": 6.1657, "mean_token_accuracy": 0.12985724806785584, "num_tokens": 1813640.0, "step": 990 }, { "entropy": 6.210285711288452, "epoch": 0.05567523710936407, "grad_norm": 1.21875, "learning_rate": 0.000497, "loss": 6.1682, "mean_token_accuracy": 0.12482047080993652, "num_tokens": 1822524.0, "step": 995 }, { "entropy": 6.18486385345459, "epoch": 0.055955012170215146, "grad_norm": 1.09375, "learning_rate": 0.0004995, "loss": 6.1837, "mean_token_accuracy": 0.12522482872009277, "num_tokens": 1832799.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2689797335040000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }