{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.021737240239979132, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692033958435058, "epoch": 0.00010868620119989566, "grad_norm": 14.125, "learning_rate": 2e-06, "loss": 10.7755, "mean_token_accuracy": 0.0, "num_tokens": 7936.0, "step": 5 }, { "entropy": 10.691999912261963, "epoch": 0.00021737240239979132, "grad_norm": 15.1875, "learning_rate": 4.5e-06, "loss": 10.6915, "mean_token_accuracy": 0.0, "num_tokens": 15561.0, "step": 10 }, { "entropy": 10.690576362609864, "epoch": 0.000326058603599687, "grad_norm": 10.0, "learning_rate": 7e-06, "loss": 10.4237, "mean_token_accuracy": 0.03714140746742487, "num_tokens": 23101.0, "step": 15 }, { "entropy": 10.662552452087402, "epoch": 0.00043474480479958265, "grad_norm": 6.4375, "learning_rate": 9.5e-06, "loss": 10.13, "mean_token_accuracy": 0.053733503073453905, "num_tokens": 31122.0, "step": 20 }, { "entropy": 10.53134651184082, "epoch": 0.0005434310059994783, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 9.8666, "mean_token_accuracy": 0.049097494408488276, "num_tokens": 39424.0, "step": 25 }, { "entropy": 10.499347591400147, "epoch": 0.000652117207199374, "grad_norm": 3.40625, "learning_rate": 1.4500000000000002e-05, "loss": 9.6573, "mean_token_accuracy": 0.05333031602203846, "num_tokens": 46113.0, "step": 30 }, { "entropy": 10.45414752960205, "epoch": 0.0007608034083992696, "grad_norm": 4.03125, "learning_rate": 1.7000000000000003e-05, "loss": 9.5644, "mean_token_accuracy": 0.050568538904190066, "num_tokens": 53459.0, "step": 35 }, { "entropy": 10.488454818725586, "epoch": 0.0008694896095991653, "grad_norm": 2.875, "learning_rate": 1.95e-05, "loss": 9.5746, "mean_token_accuracy": 0.054808919131755826, "num_tokens": 61325.0, "step": 40 }, { "entropy": 10.44335298538208, "epoch": 0.0009781758107990609, "grad_norm": 2.578125, "learning_rate": 2.2e-05, "loss": 9.5243, "mean_token_accuracy": 0.05896916501224041, "num_tokens": 68741.0, "step": 45 }, { "entropy": 10.389917469024658, "epoch": 0.0010868620119989566, "grad_norm": 2.703125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4498, "mean_token_accuracy": 0.07500801645219327, "num_tokens": 76827.0, "step": 50 }, { "entropy": 10.32972011566162, "epoch": 0.0011955482131988523, "grad_norm": 2.28125, "learning_rate": 2.7e-05, "loss": 9.4108, "mean_token_accuracy": 0.06764259599149228, "num_tokens": 84543.0, "step": 55 }, { "entropy": 10.223662376403809, "epoch": 0.001304234414398748, "grad_norm": 2.1875, "learning_rate": 2.95e-05, "loss": 9.3763, "mean_token_accuracy": 0.06775642447173595, "num_tokens": 92505.0, "step": 60 }, { "entropy": 10.253492069244384, "epoch": 0.0014129206155986437, "grad_norm": 2.046875, "learning_rate": 3.2e-05, "loss": 9.292, "mean_token_accuracy": 0.07278058938682079, "num_tokens": 100004.0, "step": 65 }, { "entropy": 10.179506492614745, "epoch": 0.0015216068167985392, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1464, "mean_token_accuracy": 0.07609819024801254, "num_tokens": 106865.0, "step": 70 }, { "entropy": 10.167201709747314, "epoch": 0.0016302930179984349, "grad_norm": 1.828125, "learning_rate": 3.7e-05, "loss": 9.184, "mean_token_accuracy": 0.07288527600467205, "num_tokens": 115745.0, "step": 75 }, { "entropy": 10.253772735595703, "epoch": 0.0017389792191983306, "grad_norm": 1.9609375, "learning_rate": 3.95e-05, "loss": 9.1019, "mean_token_accuracy": 0.07272576205432416, "num_tokens": 124724.0, "step": 80 }, { "entropy": 10.141531181335449, "epoch": 0.0018476654203982263, "grad_norm": 1.921875, "learning_rate": 4.2000000000000004e-05, "loss": 8.9728, "mean_token_accuracy": 0.07559517920017242, "num_tokens": 131933.0, "step": 85 }, { "entropy": 10.05212688446045, "epoch": 0.0019563516215981218, "grad_norm": 2.125, "learning_rate": 4.45e-05, "loss": 8.9554, "mean_token_accuracy": 0.07529733926057816, "num_tokens": 139726.0, "step": 90 }, { "entropy": 10.118945980072022, "epoch": 0.0020650378227980177, "grad_norm": 1.9453125, "learning_rate": 4.7000000000000004e-05, "loss": 8.8937, "mean_token_accuracy": 0.07433236017823219, "num_tokens": 147276.0, "step": 95 }, { "entropy": 10.070981788635255, "epoch": 0.002173724023997913, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 8.8032, "mean_token_accuracy": 0.07382776252925397, "num_tokens": 155449.0, "step": 100 }, { "entropy": 9.931837844848634, "epoch": 0.002282410225197809, "grad_norm": 1.828125, "learning_rate": 5.2e-05, "loss": 8.6788, "mean_token_accuracy": 0.06880230605602264, "num_tokens": 163547.0, "step": 105 }, { "entropy": 9.92315607070923, "epoch": 0.0023910964263977046, "grad_norm": 1.71875, "learning_rate": 5.45e-05, "loss": 8.5975, "mean_token_accuracy": 0.0769424244761467, "num_tokens": 171777.0, "step": 110 }, { "entropy": 9.855748653411865, "epoch": 0.0024997826275976, "grad_norm": 1.671875, "learning_rate": 5.7e-05, "loss": 8.4659, "mean_token_accuracy": 0.0743311032652855, "num_tokens": 179337.0, "step": 115 }, { "entropy": 9.745928478240966, "epoch": 0.002608468828797496, "grad_norm": 1.796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.3905, "mean_token_accuracy": 0.07685245871543885, "num_tokens": 186939.0, "step": 120 }, { "entropy": 9.60959987640381, "epoch": 0.0027171550299973915, "grad_norm": 1.3125, "learning_rate": 6.2e-05, "loss": 8.2612, "mean_token_accuracy": 0.07991581708192826, "num_tokens": 194755.0, "step": 125 }, { "entropy": 9.507084274291993, "epoch": 0.0028258412311972874, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.1596, "mean_token_accuracy": 0.07951611280441284, "num_tokens": 202610.0, "step": 130 }, { "entropy": 9.229420471191407, "epoch": 0.002934527432397183, "grad_norm": 1.546875, "learning_rate": 6.7e-05, "loss": 8.0589, "mean_token_accuracy": 0.07813627794384956, "num_tokens": 211305.0, "step": 135 }, { "entropy": 9.083441066741944, "epoch": 0.0030432136335970784, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.9516, "mean_token_accuracy": 0.07972251251339912, "num_tokens": 218447.0, "step": 140 }, { "entropy": 8.977557182312012, "epoch": 0.0031518998347969743, "grad_norm": 1.328125, "learning_rate": 7.2e-05, "loss": 7.9735, "mean_token_accuracy": 0.07708753384649754, "num_tokens": 226108.0, "step": 145 }, { "entropy": 8.854303741455078, "epoch": 0.0032605860359968698, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 7.9018, "mean_token_accuracy": 0.0749433733522892, "num_tokens": 233213.0, "step": 150 }, { "entropy": 8.737026977539063, "epoch": 0.0033692722371967657, "grad_norm": 1.34375, "learning_rate": 7.7e-05, "loss": 7.9657, "mean_token_accuracy": 0.07061286456882954, "num_tokens": 241483.0, "step": 155 }, { "entropy": 8.660515594482423, "epoch": 0.003477958438396661, "grad_norm": 1.28125, "learning_rate": 7.950000000000001e-05, "loss": 7.8216, "mean_token_accuracy": 0.08022509105503559, "num_tokens": 249537.0, "step": 160 }, { "entropy": 8.48324089050293, "epoch": 0.0035866446395965567, "grad_norm": 1.1484375, "learning_rate": 8.2e-05, "loss": 7.7574, "mean_token_accuracy": 0.08265799134969712, "num_tokens": 256775.0, "step": 165 }, { "entropy": 8.382307147979736, "epoch": 0.0036953308407964526, "grad_norm": 1.40625, "learning_rate": 8.450000000000001e-05, "loss": 7.7628, "mean_token_accuracy": 0.08266141265630722, "num_tokens": 263931.0, "step": 170 }, { "entropy": 8.312588787078857, "epoch": 0.003804017041996348, "grad_norm": 1.1953125, "learning_rate": 8.7e-05, "loss": 7.7557, "mean_token_accuracy": 0.08323334604501724, "num_tokens": 272293.0, "step": 175 }, { "entropy": 8.368490505218507, "epoch": 0.0039127032431962435, "grad_norm": 1.390625, "learning_rate": 8.95e-05, "loss": 7.7964, "mean_token_accuracy": 0.07600408792495728, "num_tokens": 280599.0, "step": 180 }, { "entropy": 8.208444499969483, "epoch": 0.00402138944439614, "grad_norm": 1.4921875, "learning_rate": 9.2e-05, "loss": 7.7604, "mean_token_accuracy": 0.07719066366553307, "num_tokens": 287961.0, "step": 185 }, { "entropy": 8.142381763458252, "epoch": 0.004130075645596035, "grad_norm": 1.8671875, "learning_rate": 9.45e-05, "loss": 7.684, "mean_token_accuracy": 0.08424306884407998, "num_tokens": 297280.0, "step": 190 }, { "entropy": 8.162713718414306, "epoch": 0.004238761846795931, "grad_norm": 1.2421875, "learning_rate": 9.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08235807195305825, "num_tokens": 304699.0, "step": 195 }, { "entropy": 8.149117755889893, "epoch": 0.004347448047995826, "grad_norm": 1.125, "learning_rate": 9.95e-05, "loss": 7.6864, "mean_token_accuracy": 0.08296664133667946, "num_tokens": 313026.0, "step": 200 }, { "entropy": 8.115727186203003, "epoch": 0.004456134249195722, "grad_norm": 1.140625, "learning_rate": 0.000102, "loss": 7.7092, "mean_token_accuracy": 0.08166395723819733, "num_tokens": 320738.0, "step": 205 }, { "entropy": 8.076230096817017, "epoch": 0.004564820450395618, "grad_norm": 1.2265625, "learning_rate": 0.00010449999999999999, "loss": 7.6861, "mean_token_accuracy": 0.07836256250739097, "num_tokens": 328740.0, "step": 210 }, { "entropy": 8.025853300094605, "epoch": 0.004673506651595514, "grad_norm": 1.09375, "learning_rate": 0.000107, "loss": 7.6627, "mean_token_accuracy": 0.08186743408441544, "num_tokens": 336819.0, "step": 215 }, { "entropy": 8.132151794433593, "epoch": 0.004782192852795409, "grad_norm": 1.234375, "learning_rate": 0.0001095, "loss": 7.5969, "mean_token_accuracy": 0.08840056881308556, "num_tokens": 343978.0, "step": 220 }, { "entropy": 8.009299278259277, "epoch": 0.004890879053995305, "grad_norm": 1.2265625, "learning_rate": 0.000112, "loss": 7.6897, "mean_token_accuracy": 0.07886088080704212, "num_tokens": 353783.0, "step": 225 }, { "entropy": 7.969748306274414, "epoch": 0.0049995652551952, "grad_norm": 1.34375, "learning_rate": 0.0001145, "loss": 7.5909, "mean_token_accuracy": 0.08582306802272796, "num_tokens": 361371.0, "step": 230 }, { "entropy": 7.9828167915344235, "epoch": 0.0051082514563950965, "grad_norm": 1.3984375, "learning_rate": 0.00011700000000000001, "loss": 7.6185, "mean_token_accuracy": 0.07745145447552204, "num_tokens": 367717.0, "step": 235 }, { "entropy": 8.051587057113647, "epoch": 0.005216937657594992, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.6177, "mean_token_accuracy": 0.08022010251879692, "num_tokens": 375529.0, "step": 240 }, { "entropy": 7.905487108230591, "epoch": 0.0053256238587948874, "grad_norm": 1.1640625, "learning_rate": 0.000122, "loss": 7.5073, "mean_token_accuracy": 0.08242316544055939, "num_tokens": 383031.0, "step": 245 }, { "entropy": 7.966064023971557, "epoch": 0.005434310059994783, "grad_norm": 1.1953125, "learning_rate": 0.0001245, "loss": 7.6472, "mean_token_accuracy": 0.0840654157102108, "num_tokens": 391914.0, "step": 250 }, { "entropy": 7.939682960510254, "epoch": 0.005542996261194678, "grad_norm": 1.34375, "learning_rate": 0.000127, "loss": 7.6111, "mean_token_accuracy": 0.08445862084627151, "num_tokens": 399447.0, "step": 255 }, { "entropy": 7.95916223526001, "epoch": 0.005651682462394575, "grad_norm": 1.5078125, "learning_rate": 0.0001295, "loss": 7.6053, "mean_token_accuracy": 0.08623345196247101, "num_tokens": 407636.0, "step": 260 }, { "entropy": 7.863192081451416, "epoch": 0.00576036866359447, "grad_norm": 1.25, "learning_rate": 0.000132, "loss": 7.5498, "mean_token_accuracy": 0.08252564668655396, "num_tokens": 416650.0, "step": 265 }, { "entropy": 7.940821886062622, "epoch": 0.005869054864794366, "grad_norm": 1.71875, "learning_rate": 0.00013450000000000002, "loss": 7.4851, "mean_token_accuracy": 0.08535419404506683, "num_tokens": 424619.0, "step": 270 }, { "entropy": 7.923966264724731, "epoch": 0.005977741065994261, "grad_norm": 1.5546875, "learning_rate": 0.00013700000000000002, "loss": 7.5731, "mean_token_accuracy": 0.08694756105542183, "num_tokens": 432854.0, "step": 275 }, { "entropy": 7.861378288269043, "epoch": 0.006086427267194157, "grad_norm": 1.3515625, "learning_rate": 0.0001395, "loss": 7.5646, "mean_token_accuracy": 0.08049703910946845, "num_tokens": 440472.0, "step": 280 }, { "entropy": 7.979065895080566, "epoch": 0.006195113468394053, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.4921, "mean_token_accuracy": 0.08637023121118545, "num_tokens": 447843.0, "step": 285 }, { "entropy": 7.926018571853637, "epoch": 0.0063037996695939486, "grad_norm": 1.4921875, "learning_rate": 0.0001445, "loss": 7.6005, "mean_token_accuracy": 0.08329573571681977, "num_tokens": 455272.0, "step": 290 }, { "entropy": 7.811395597457886, "epoch": 0.006412485870793844, "grad_norm": 1.3359375, "learning_rate": 0.000147, "loss": 7.4287, "mean_token_accuracy": 0.08994799107313156, "num_tokens": 462190.0, "step": 295 }, { "entropy": 7.937566328048706, "epoch": 0.0065211720719937395, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 7.5291, "mean_token_accuracy": 0.08383448868989944, "num_tokens": 470562.0, "step": 300 }, { "entropy": 7.770080280303955, "epoch": 0.006629858273193635, "grad_norm": 1.140625, "learning_rate": 0.000152, "loss": 7.433, "mean_token_accuracy": 0.09061657935380936, "num_tokens": 478523.0, "step": 305 }, { "entropy": 7.844554090499878, "epoch": 0.006738544474393531, "grad_norm": 1.3359375, "learning_rate": 0.00015450000000000001, "loss": 7.517, "mean_token_accuracy": 0.08662905022501946, "num_tokens": 486759.0, "step": 310 }, { "entropy": 7.828848934173584, "epoch": 0.006847230675593427, "grad_norm": 1.2421875, "learning_rate": 0.000157, "loss": 7.5283, "mean_token_accuracy": 0.08165703043341636, "num_tokens": 495168.0, "step": 315 }, { "entropy": 7.823043441772461, "epoch": 0.006955916876793322, "grad_norm": 1.2421875, "learning_rate": 0.0001595, "loss": 7.4207, "mean_token_accuracy": 0.08956636488437653, "num_tokens": 503490.0, "step": 320 }, { "entropy": 7.771451330184936, "epoch": 0.007064603077993218, "grad_norm": 1.171875, "learning_rate": 0.000162, "loss": 7.5539, "mean_token_accuracy": 0.08244621530175208, "num_tokens": 512522.0, "step": 325 }, { "entropy": 7.877453756332398, "epoch": 0.007173289279193113, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 7.4913, "mean_token_accuracy": 0.08120876513421535, "num_tokens": 521100.0, "step": 330 }, { "entropy": 7.771992826461792, "epoch": 0.00728197548039301, "grad_norm": 1.1875, "learning_rate": 0.00016700000000000002, "loss": 7.396, "mean_token_accuracy": 0.0948154278099537, "num_tokens": 528027.0, "step": 335 }, { "entropy": 7.7505473613739015, "epoch": 0.007390661681592905, "grad_norm": 1.390625, "learning_rate": 0.00016950000000000003, "loss": 7.3994, "mean_token_accuracy": 0.08797064200043678, "num_tokens": 535541.0, "step": 340 }, { "entropy": 7.820106267929077, "epoch": 0.007499347882792801, "grad_norm": 1.1484375, "learning_rate": 0.00017199999999999998, "loss": 7.4177, "mean_token_accuracy": 0.08866829052567482, "num_tokens": 543253.0, "step": 345 }, { "entropy": 7.8131262302398685, "epoch": 0.007608034083992696, "grad_norm": 1.515625, "learning_rate": 0.00017449999999999999, "loss": 7.4312, "mean_token_accuracy": 0.08869538456201553, "num_tokens": 550414.0, "step": 350 }, { "entropy": 7.678452491760254, "epoch": 0.007716720285192592, "grad_norm": 1.2265625, "learning_rate": 0.000177, "loss": 7.4866, "mean_token_accuracy": 0.08567069470882416, "num_tokens": 558554.0, "step": 355 }, { "entropy": 7.860786962509155, "epoch": 0.007825406486392487, "grad_norm": 1.1640625, "learning_rate": 0.0001795, "loss": 7.4562, "mean_token_accuracy": 0.0866042397916317, "num_tokens": 566297.0, "step": 360 }, { "entropy": 7.691314792633056, "epoch": 0.007934092687592383, "grad_norm": 1.3359375, "learning_rate": 0.000182, "loss": 7.399, "mean_token_accuracy": 0.09093262627720833, "num_tokens": 574600.0, "step": 365 }, { "entropy": 7.761751461029053, "epoch": 0.00804277888879228, "grad_norm": 1.03125, "learning_rate": 0.0001845, "loss": 7.4278, "mean_token_accuracy": 0.08792822286486626, "num_tokens": 583349.0, "step": 370 }, { "entropy": 7.841218614578247, "epoch": 0.008151465089992175, "grad_norm": 1.3671875, "learning_rate": 0.000187, "loss": 7.3269, "mean_token_accuracy": 0.08868191167712211, "num_tokens": 590169.0, "step": 375 }, { "entropy": 7.639244318008423, "epoch": 0.00826015129119207, "grad_norm": 1.296875, "learning_rate": 0.0001895, "loss": 7.2957, "mean_token_accuracy": 0.09457754641771317, "num_tokens": 597508.0, "step": 380 }, { "entropy": 7.685401201248169, "epoch": 0.008368837492391966, "grad_norm": 1.1640625, "learning_rate": 0.000192, "loss": 7.375, "mean_token_accuracy": 0.09122001230716706, "num_tokens": 605412.0, "step": 385 }, { "entropy": 7.795647668838501, "epoch": 0.008477523693591862, "grad_norm": 1.3359375, "learning_rate": 0.0001945, "loss": 7.3872, "mean_token_accuracy": 0.09148699790239334, "num_tokens": 613512.0, "step": 390 }, { "entropy": 7.641701507568359, "epoch": 0.008586209894791757, "grad_norm": 1.078125, "learning_rate": 0.00019700000000000002, "loss": 7.3275, "mean_token_accuracy": 0.09618531838059426, "num_tokens": 621117.0, "step": 395 }, { "entropy": 7.689551591873169, "epoch": 0.008694896095991653, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 7.3832, "mean_token_accuracy": 0.08407204449176789, "num_tokens": 629970.0, "step": 400 }, { "entropy": 7.637691450119019, "epoch": 0.008803582297191548, "grad_norm": 1.375, "learning_rate": 0.000202, "loss": 7.3219, "mean_token_accuracy": 0.09131594821810722, "num_tokens": 638184.0, "step": 405 }, { "entropy": 7.5977555274963375, "epoch": 0.008912268498391444, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 7.2837, "mean_token_accuracy": 0.08929966911673545, "num_tokens": 645953.0, "step": 410 }, { "entropy": 7.6464704990386965, "epoch": 0.00902095469959134, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 7.3305, "mean_token_accuracy": 0.08722574934363365, "num_tokens": 654291.0, "step": 415 }, { "entropy": 7.672793436050415, "epoch": 0.009129640900791236, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 7.3299, "mean_token_accuracy": 0.08851959705352783, "num_tokens": 661393.0, "step": 420 }, { "entropy": 7.531088209152221, "epoch": 0.009238327101991132, "grad_norm": 1.4296875, "learning_rate": 0.000212, "loss": 7.3139, "mean_token_accuracy": 0.0963095597922802, "num_tokens": 669913.0, "step": 425 }, { "entropy": 7.74607515335083, "epoch": 0.009347013303191027, "grad_norm": 1.1953125, "learning_rate": 0.0002145, "loss": 7.3663, "mean_token_accuracy": 0.09074652194976807, "num_tokens": 678745.0, "step": 430 }, { "entropy": 7.417545986175537, "epoch": 0.009455699504390923, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.2468, "mean_token_accuracy": 0.09117906540632248, "num_tokens": 686191.0, "step": 435 }, { "entropy": 7.690976524353028, "epoch": 0.009564385705590818, "grad_norm": 2.109375, "learning_rate": 0.0002195, "loss": 7.2921, "mean_token_accuracy": 0.08830784261226654, "num_tokens": 694776.0, "step": 440 }, { "entropy": 7.471565675735474, "epoch": 0.009673071906790714, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 7.2498, "mean_token_accuracy": 0.08958808556199074, "num_tokens": 702481.0, "step": 445 }, { "entropy": 7.601398086547851, "epoch": 0.00978175810799061, "grad_norm": 1.265625, "learning_rate": 0.0002245, "loss": 7.2892, "mean_token_accuracy": 0.08943363651633263, "num_tokens": 710304.0, "step": 450 }, { "entropy": 7.6107948303222654, "epoch": 0.009890444309190505, "grad_norm": 1.2734375, "learning_rate": 0.00022700000000000002, "loss": 7.2655, "mean_token_accuracy": 0.0950858935713768, "num_tokens": 718462.0, "step": 455 }, { "entropy": 7.4872644424438475, "epoch": 0.0099991305103904, "grad_norm": 1.0625, "learning_rate": 0.00022950000000000002, "loss": 7.2699, "mean_token_accuracy": 0.09967489093542099, "num_tokens": 726798.0, "step": 460 }, { "entropy": 7.636318254470825, "epoch": 0.010107816711590296, "grad_norm": 1.1328125, "learning_rate": 0.00023200000000000003, "loss": 7.2289, "mean_token_accuracy": 0.09415075033903123, "num_tokens": 735054.0, "step": 465 }, { "entropy": 7.467661046981812, "epoch": 0.010216502912790193, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 7.2689, "mean_token_accuracy": 0.08854644820094108, "num_tokens": 743701.0, "step": 470 }, { "entropy": 7.5553264141082765, "epoch": 0.010325189113990088, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.3436, "mean_token_accuracy": 0.08918146193027496, "num_tokens": 751548.0, "step": 475 }, { "entropy": 7.606575393676758, "epoch": 0.010433875315189984, "grad_norm": 1.359375, "learning_rate": 0.0002395, "loss": 7.1245, "mean_token_accuracy": 0.09939143806695938, "num_tokens": 758580.0, "step": 480 }, { "entropy": 7.376218938827515, "epoch": 0.01054256151638988, "grad_norm": 1.375, "learning_rate": 0.000242, "loss": 7.1472, "mean_token_accuracy": 0.09824580624699593, "num_tokens": 766240.0, "step": 485 }, { "entropy": 7.460130596160889, "epoch": 0.010651247717589775, "grad_norm": 1.3125, "learning_rate": 0.0002445, "loss": 7.1908, "mean_token_accuracy": 0.09887742102146149, "num_tokens": 774206.0, "step": 490 }, { "entropy": 7.499665117263794, "epoch": 0.01075993391878967, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 7.135, "mean_token_accuracy": 0.10001260414719582, "num_tokens": 782005.0, "step": 495 }, { "entropy": 7.313957262039184, "epoch": 0.010868620119989566, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.1614, "mean_token_accuracy": 0.10134897753596306, "num_tokens": 790043.0, "step": 500 }, { "entropy": 7.518388891220093, "epoch": 0.010977306321189461, "grad_norm": 1.21875, "learning_rate": 0.000252, "loss": 7.1951, "mean_token_accuracy": 0.10190339386463165, "num_tokens": 798248.0, "step": 505 }, { "entropy": 7.401588821411133, "epoch": 0.011085992522389357, "grad_norm": 1.203125, "learning_rate": 0.0002545, "loss": 7.1494, "mean_token_accuracy": 0.10203814506530762, "num_tokens": 806023.0, "step": 510 }, { "entropy": 7.4617040157318115, "epoch": 0.011194678723589252, "grad_norm": 1.3359375, "learning_rate": 0.000257, "loss": 7.26, "mean_token_accuracy": 0.08982759192585946, "num_tokens": 813719.0, "step": 515 }, { "entropy": 7.584583950042725, "epoch": 0.01130336492478915, "grad_norm": 1.296875, "learning_rate": 0.0002595, "loss": 7.2398, "mean_token_accuracy": 0.09505607783794404, "num_tokens": 821938.0, "step": 520 }, { "entropy": 7.490258741378784, "epoch": 0.011412051125989045, "grad_norm": 1.1953125, "learning_rate": 0.000262, "loss": 7.1423, "mean_token_accuracy": 0.09996162354946136, "num_tokens": 830263.0, "step": 525 }, { "entropy": 7.332801628112793, "epoch": 0.01152073732718894, "grad_norm": 1.34375, "learning_rate": 0.00026450000000000003, "loss": 7.1478, "mean_token_accuracy": 0.10072804763913154, "num_tokens": 838040.0, "step": 530 }, { "entropy": 7.352591896057129, "epoch": 0.011629423528388836, "grad_norm": 1.234375, "learning_rate": 0.00026700000000000004, "loss": 7.1318, "mean_token_accuracy": 0.09845451191067696, "num_tokens": 846265.0, "step": 535 }, { "entropy": 7.524213409423828, "epoch": 0.011738109729588731, "grad_norm": 1.625, "learning_rate": 0.00026950000000000005, "loss": 7.2088, "mean_token_accuracy": 0.09776617884635926, "num_tokens": 853815.0, "step": 540 }, { "entropy": 7.406747961044312, "epoch": 0.011846795930788627, "grad_norm": 1.3046875, "learning_rate": 0.00027200000000000005, "loss": 7.1712, "mean_token_accuracy": 0.1003396026790142, "num_tokens": 861186.0, "step": 545 }, { "entropy": 7.5143406867980955, "epoch": 0.011955482131988522, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 7.1261, "mean_token_accuracy": 0.09955452755093575, "num_tokens": 868619.0, "step": 550 }, { "entropy": 7.397789716720581, "epoch": 0.012064168333188418, "grad_norm": 1.203125, "learning_rate": 0.000277, "loss": 7.1921, "mean_token_accuracy": 0.1024585336446762, "num_tokens": 876521.0, "step": 555 }, { "entropy": 7.418723487854004, "epoch": 0.012172854534388313, "grad_norm": 1.46875, "learning_rate": 0.0002795, "loss": 7.1915, "mean_token_accuracy": 0.09342663809657097, "num_tokens": 884060.0, "step": 560 }, { "entropy": 7.401181697845459, "epoch": 0.012281540735588209, "grad_norm": 1.296875, "learning_rate": 0.00028199999999999997, "loss": 7.1436, "mean_token_accuracy": 0.09810893088579178, "num_tokens": 892218.0, "step": 565 }, { "entropy": 7.3739972591400145, "epoch": 0.012390226936788106, "grad_norm": 1.40625, "learning_rate": 0.0002845, "loss": 7.153, "mean_token_accuracy": 0.09526406824588776, "num_tokens": 899472.0, "step": 570 }, { "entropy": 7.431902933120727, "epoch": 0.012498913137988002, "grad_norm": 1.3046875, "learning_rate": 0.000287, "loss": 7.1138, "mean_token_accuracy": 0.10175292342901229, "num_tokens": 907371.0, "step": 575 }, { "entropy": 7.30218768119812, "epoch": 0.012607599339187897, "grad_norm": 1.40625, "learning_rate": 0.0002895, "loss": 7.118, "mean_token_accuracy": 0.10189053043723106, "num_tokens": 914376.0, "step": 580 }, { "entropy": 7.398109769821167, "epoch": 0.012716285540387793, "grad_norm": 1.3359375, "learning_rate": 0.000292, "loss": 7.1022, "mean_token_accuracy": 0.09777733609080315, "num_tokens": 921992.0, "step": 585 }, { "entropy": 7.318228054046631, "epoch": 0.012824971741587688, "grad_norm": 1.1484375, "learning_rate": 0.0002945, "loss": 7.1565, "mean_token_accuracy": 0.10031871050596237, "num_tokens": 929966.0, "step": 590 }, { "entropy": 7.380307865142822, "epoch": 0.012933657942787584, "grad_norm": 1.25, "learning_rate": 0.000297, "loss": 7.0322, "mean_token_accuracy": 0.10295850262045861, "num_tokens": 936500.0, "step": 595 }, { "entropy": 7.2398364543914795, "epoch": 0.013042344143987479, "grad_norm": 1.2578125, "learning_rate": 0.0002995, "loss": 7.0636, "mean_token_accuracy": 0.10201629102230073, "num_tokens": 944685.0, "step": 600 }, { "entropy": 7.3245521068573, "epoch": 0.013151030345187375, "grad_norm": 1.40625, "learning_rate": 0.000302, "loss": 7.09, "mean_token_accuracy": 0.10841693356633186, "num_tokens": 952379.0, "step": 605 }, { "entropy": 7.226641845703125, "epoch": 0.01325971654638727, "grad_norm": 1.296875, "learning_rate": 0.0003045, "loss": 7.0067, "mean_token_accuracy": 0.10042177364230156, "num_tokens": 960310.0, "step": 610 }, { "entropy": 7.356974458694458, "epoch": 0.013368402747587165, "grad_norm": 1.1875, "learning_rate": 0.000307, "loss": 7.1009, "mean_token_accuracy": 0.09788779467344284, "num_tokens": 967581.0, "step": 615 }, { "entropy": 7.381576633453369, "epoch": 0.013477088948787063, "grad_norm": 1.34375, "learning_rate": 0.0003095, "loss": 7.0731, "mean_token_accuracy": 0.10214511007070541, "num_tokens": 975351.0, "step": 620 }, { "entropy": 7.133514547348023, "epoch": 0.013585775149986958, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 7.0016, "mean_token_accuracy": 0.10031676739454269, "num_tokens": 982962.0, "step": 625 }, { "entropy": 7.36269965171814, "epoch": 0.013694461351186854, "grad_norm": 1.3203125, "learning_rate": 0.0003145, "loss": 7.0818, "mean_token_accuracy": 0.0940178707242012, "num_tokens": 991081.0, "step": 630 }, { "entropy": 7.196866226196289, "epoch": 0.01380314755238675, "grad_norm": 1.265625, "learning_rate": 0.000317, "loss": 7.0304, "mean_token_accuracy": 0.0977426715195179, "num_tokens": 999169.0, "step": 635 }, { "entropy": 7.23091402053833, "epoch": 0.013911833753586645, "grad_norm": 1.3203125, "learning_rate": 0.0003195, "loss": 7.0051, "mean_token_accuracy": 0.10395268872380256, "num_tokens": 1007086.0, "step": 640 }, { "entropy": 7.237727499008178, "epoch": 0.01402051995478654, "grad_norm": 1.34375, "learning_rate": 0.000322, "loss": 7.0415, "mean_token_accuracy": 0.10429325178265572, "num_tokens": 1014937.0, "step": 645 }, { "entropy": 7.289627265930176, "epoch": 0.014129206155986436, "grad_norm": 1.265625, "learning_rate": 0.00032450000000000003, "loss": 7.0527, "mean_token_accuracy": 0.10648775473237038, "num_tokens": 1022271.0, "step": 650 }, { "entropy": 7.281875371932983, "epoch": 0.014237892357186331, "grad_norm": 1.1953125, "learning_rate": 0.00032700000000000003, "loss": 7.0394, "mean_token_accuracy": 0.09872807115316391, "num_tokens": 1029946.0, "step": 655 }, { "entropy": 7.201374578475952, "epoch": 0.014346578558386227, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 7.0564, "mean_token_accuracy": 0.09937692657113076, "num_tokens": 1037659.0, "step": 660 }, { "entropy": 7.247886657714844, "epoch": 0.014455264759586122, "grad_norm": 1.6015625, "learning_rate": 0.00033200000000000005, "loss": 7.0678, "mean_token_accuracy": 0.10430879592895508, "num_tokens": 1045420.0, "step": 665 }, { "entropy": 7.278404426574707, "epoch": 0.01456395096078602, "grad_norm": 1.1484375, "learning_rate": 0.00033450000000000005, "loss": 7.0594, "mean_token_accuracy": 0.10522538945078849, "num_tokens": 1052681.0, "step": 670 }, { "entropy": 7.258583641052246, "epoch": 0.014672637161985915, "grad_norm": 1.2109375, "learning_rate": 0.000337, "loss": 6.9977, "mean_token_accuracy": 0.10505606159567833, "num_tokens": 1060114.0, "step": 675 }, { "entropy": 7.2787620544433596, "epoch": 0.01478132336318581, "grad_norm": 1.234375, "learning_rate": 0.0003395, "loss": 7.0666, "mean_token_accuracy": 0.10130468308925629, "num_tokens": 1068833.0, "step": 680 }, { "entropy": 7.07578821182251, "epoch": 0.014890009564385706, "grad_norm": 1.25, "learning_rate": 0.000342, "loss": 7.0062, "mean_token_accuracy": 0.10653988644480705, "num_tokens": 1075850.0, "step": 685 }, { "entropy": 7.184060382843017, "epoch": 0.014998695765585601, "grad_norm": 1.3671875, "learning_rate": 0.00034449999999999997, "loss": 6.9698, "mean_token_accuracy": 0.10846218839287758, "num_tokens": 1083956.0, "step": 690 }, { "entropy": 7.173658752441407, "epoch": 0.015107381966785497, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 7.003, "mean_token_accuracy": 0.09950482398271561, "num_tokens": 1091744.0, "step": 695 }, { "entropy": 7.154714155197143, "epoch": 0.015216068167985392, "grad_norm": 1.421875, "learning_rate": 0.0003495, "loss": 6.9642, "mean_token_accuracy": 0.10058322846889496, "num_tokens": 1099029.0, "step": 700 }, { "entropy": 7.211764144897461, "epoch": 0.015324754369185288, "grad_norm": 1.234375, "learning_rate": 0.000352, "loss": 7.0826, "mean_token_accuracy": 0.10248045325279236, "num_tokens": 1106329.0, "step": 705 }, { "entropy": 7.2008462905883786, "epoch": 0.015433440570385183, "grad_norm": 1.296875, "learning_rate": 0.0003545, "loss": 7.0031, "mean_token_accuracy": 0.10641120374202728, "num_tokens": 1114672.0, "step": 710 }, { "entropy": 7.307254886627197, "epoch": 0.01554212677158508, "grad_norm": 1.09375, "learning_rate": 0.000357, "loss": 7.122, "mean_token_accuracy": 0.09702686741948127, "num_tokens": 1123782.0, "step": 715 }, { "entropy": 7.048694181442261, "epoch": 0.015650812972784974, "grad_norm": 1.3828125, "learning_rate": 0.0003595, "loss": 6.9479, "mean_token_accuracy": 0.10803859531879426, "num_tokens": 1131211.0, "step": 720 }, { "entropy": 7.091199684143066, "epoch": 0.01575949917398487, "grad_norm": 1.171875, "learning_rate": 0.000362, "loss": 6.9317, "mean_token_accuracy": 0.10954350158572197, "num_tokens": 1138955.0, "step": 725 }, { "entropy": 7.106390285491943, "epoch": 0.015868185375184765, "grad_norm": 1.125, "learning_rate": 0.0003645, "loss": 6.9803, "mean_token_accuracy": 0.10243654400110244, "num_tokens": 1147376.0, "step": 730 }, { "entropy": 7.204882383346558, "epoch": 0.015976871576384662, "grad_norm": 1.1015625, "learning_rate": 0.000367, "loss": 6.9549, "mean_token_accuracy": 0.10707944706082344, "num_tokens": 1155196.0, "step": 735 }, { "entropy": 7.020097827911377, "epoch": 0.01608555777758456, "grad_norm": 1.2421875, "learning_rate": 0.0003695, "loss": 6.9581, "mean_token_accuracy": 0.10678377524018287, "num_tokens": 1162503.0, "step": 740 }, { "entropy": 7.215338659286499, "epoch": 0.016194243978784453, "grad_norm": 1.296875, "learning_rate": 0.000372, "loss": 7.006, "mean_token_accuracy": 0.10291345119476318, "num_tokens": 1170387.0, "step": 745 }, { "entropy": 6.980220603942871, "epoch": 0.01630293017998435, "grad_norm": 1.2109375, "learning_rate": 0.0003745, "loss": 6.8741, "mean_token_accuracy": 0.11537401303648949, "num_tokens": 1176921.0, "step": 750 }, { "entropy": 7.128726530075073, "epoch": 0.016411616381184244, "grad_norm": 1.0703125, "learning_rate": 0.000377, "loss": 7.0252, "mean_token_accuracy": 0.1050336092710495, "num_tokens": 1185063.0, "step": 755 }, { "entropy": 7.0691938400268555, "epoch": 0.01652030258238414, "grad_norm": 1.109375, "learning_rate": 0.0003795, "loss": 6.9361, "mean_token_accuracy": 0.1111590951681137, "num_tokens": 1193008.0, "step": 760 }, { "entropy": 7.12714900970459, "epoch": 0.016628988783584035, "grad_norm": 1.109375, "learning_rate": 0.000382, "loss": 6.9554, "mean_token_accuracy": 0.1107974775135517, "num_tokens": 1200868.0, "step": 765 }, { "entropy": 7.084636926651001, "epoch": 0.016737674984783932, "grad_norm": 1.15625, "learning_rate": 0.0003845, "loss": 6.9061, "mean_token_accuracy": 0.11364880874752999, "num_tokens": 1208687.0, "step": 770 }, { "entropy": 7.034700918197632, "epoch": 0.016846361185983826, "grad_norm": 1.046875, "learning_rate": 0.00038700000000000003, "loss": 6.9637, "mean_token_accuracy": 0.10925066992640495, "num_tokens": 1216804.0, "step": 775 }, { "entropy": 7.038867473602295, "epoch": 0.016955047387183723, "grad_norm": 1.2578125, "learning_rate": 0.00038950000000000003, "loss": 6.8871, "mean_token_accuracy": 0.11413683071732521, "num_tokens": 1224505.0, "step": 780 }, { "entropy": 6.978211402893066, "epoch": 0.017063733588383617, "grad_norm": 1.0234375, "learning_rate": 0.00039200000000000004, "loss": 6.8853, "mean_token_accuracy": 0.11565895602107049, "num_tokens": 1232706.0, "step": 785 }, { "entropy": 7.117547416687012, "epoch": 0.017172419789583514, "grad_norm": 1.2421875, "learning_rate": 0.00039450000000000005, "loss": 6.8904, "mean_token_accuracy": 0.11539890021085739, "num_tokens": 1239551.0, "step": 790 }, { "entropy": 6.993913698196411, "epoch": 0.01728110599078341, "grad_norm": 1.40625, "learning_rate": 0.00039700000000000005, "loss": 6.8834, "mean_token_accuracy": 0.11389343962073326, "num_tokens": 1247909.0, "step": 795 }, { "entropy": 7.153699827194214, "epoch": 0.017389792191983305, "grad_norm": 1.1875, "learning_rate": 0.0003995, "loss": 7.0588, "mean_token_accuracy": 0.10906191244721412, "num_tokens": 1256523.0, "step": 800 }, { "entropy": 7.072479391098023, "epoch": 0.017498478393183203, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.8826, "mean_token_accuracy": 0.11302874237298965, "num_tokens": 1263879.0, "step": 805 }, { "entropy": 7.110428047180176, "epoch": 0.017607164594383096, "grad_norm": 1.2109375, "learning_rate": 0.0004045, "loss": 6.9637, "mean_token_accuracy": 0.1068289540708065, "num_tokens": 1271287.0, "step": 810 }, { "entropy": 6.977171850204468, "epoch": 0.017715850795582994, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.8514, "mean_token_accuracy": 0.1114407129585743, "num_tokens": 1278828.0, "step": 815 }, { "entropy": 7.056746530532837, "epoch": 0.017824536996782887, "grad_norm": 1.125, "learning_rate": 0.0004095, "loss": 6.9732, "mean_token_accuracy": 0.10797528550028801, "num_tokens": 1286827.0, "step": 820 }, { "entropy": 7.063602304458618, "epoch": 0.017933223197982785, "grad_norm": 1.21875, "learning_rate": 0.000412, "loss": 6.9201, "mean_token_accuracy": 0.10415855050086975, "num_tokens": 1294546.0, "step": 825 }, { "entropy": 6.962296867370606, "epoch": 0.01804190939918268, "grad_norm": 1.359375, "learning_rate": 0.0004145, "loss": 6.8398, "mean_token_accuracy": 0.1096323385834694, "num_tokens": 1301574.0, "step": 830 }, { "entropy": 7.106445598602295, "epoch": 0.018150595600382576, "grad_norm": 1.28125, "learning_rate": 0.000417, "loss": 6.8577, "mean_token_accuracy": 0.11122734472155571, "num_tokens": 1308224.0, "step": 835 }, { "entropy": 6.868801546096802, "epoch": 0.018259281801582473, "grad_norm": 1.0703125, "learning_rate": 0.0004195, "loss": 6.923, "mean_token_accuracy": 0.10960033088922501, "num_tokens": 1317335.0, "step": 840 }, { "entropy": 7.096353387832641, "epoch": 0.018367968002782366, "grad_norm": 1.125, "learning_rate": 0.000422, "loss": 6.8735, "mean_token_accuracy": 0.10573652610182763, "num_tokens": 1324825.0, "step": 845 }, { "entropy": 6.913944911956787, "epoch": 0.018476654203982264, "grad_norm": 1.1953125, "learning_rate": 0.0004245, "loss": 6.9635, "mean_token_accuracy": 0.10770962685346604, "num_tokens": 1332818.0, "step": 850 }, { "entropy": 6.95415940284729, "epoch": 0.018585340405182157, "grad_norm": 1.1640625, "learning_rate": 0.000427, "loss": 6.769, "mean_token_accuracy": 0.12482169717550277, "num_tokens": 1339858.0, "step": 855 }, { "entropy": 6.976625156402588, "epoch": 0.018694026606382055, "grad_norm": 1.09375, "learning_rate": 0.0004295, "loss": 6.9342, "mean_token_accuracy": 0.10149514004588127, "num_tokens": 1348542.0, "step": 860 }, { "entropy": 6.979064416885376, "epoch": 0.01880271280758195, "grad_norm": 1.125, "learning_rate": 0.000432, "loss": 6.8578, "mean_token_accuracy": 0.11146032214164733, "num_tokens": 1355851.0, "step": 865 }, { "entropy": 6.964614057540894, "epoch": 0.018911399008781846, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.867, "mean_token_accuracy": 0.11173160448670387, "num_tokens": 1363844.0, "step": 870 }, { "entropy": 7.057435846328735, "epoch": 0.01902008520998174, "grad_norm": 1.125, "learning_rate": 0.000437, "loss": 6.8731, "mean_token_accuracy": 0.11148432195186615, "num_tokens": 1372525.0, "step": 875 }, { "entropy": 6.942585229873657, "epoch": 0.019128771411181637, "grad_norm": 1.109375, "learning_rate": 0.0004395, "loss": 6.9121, "mean_token_accuracy": 0.10839233919978142, "num_tokens": 1381371.0, "step": 880 }, { "entropy": 6.933096694946289, "epoch": 0.01923745761238153, "grad_norm": 1.21875, "learning_rate": 0.000442, "loss": 6.8116, "mean_token_accuracy": 0.11815176531672478, "num_tokens": 1389140.0, "step": 885 }, { "entropy": 6.891059732437133, "epoch": 0.019346143813581428, "grad_norm": 1.1015625, "learning_rate": 0.0004445, "loss": 6.8372, "mean_token_accuracy": 0.11450439095497131, "num_tokens": 1396397.0, "step": 890 }, { "entropy": 6.9327497482299805, "epoch": 0.019454830014781325, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.9194, "mean_token_accuracy": 0.11007297709584236, "num_tokens": 1404600.0, "step": 895 }, { "entropy": 6.999571323394775, "epoch": 0.01956351621598122, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.8758, "mean_token_accuracy": 0.11412210613489152, "num_tokens": 1413063.0, "step": 900 }, { "entropy": 6.883196830749512, "epoch": 0.019672202417181116, "grad_norm": 1.109375, "learning_rate": 0.00045200000000000004, "loss": 6.7573, "mean_token_accuracy": 0.11876690089702606, "num_tokens": 1419875.0, "step": 905 }, { "entropy": 6.874788761138916, "epoch": 0.01978088861838101, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.8001, "mean_token_accuracy": 0.10891184434294701, "num_tokens": 1427405.0, "step": 910 }, { "entropy": 6.950111055374146, "epoch": 0.019889574819580907, "grad_norm": 1.1640625, "learning_rate": 0.00045700000000000005, "loss": 6.9241, "mean_token_accuracy": 0.10468844398856163, "num_tokens": 1435721.0, "step": 915 }, { "entropy": 6.985974359512329, "epoch": 0.0199982610207808, "grad_norm": 1.0859375, "learning_rate": 0.00045950000000000006, "loss": 6.8313, "mean_token_accuracy": 0.10862488150596619, "num_tokens": 1443091.0, "step": 920 }, { "entropy": 6.866302967071533, "epoch": 0.020106947221980698, "grad_norm": 1.0859375, "learning_rate": 0.000462, "loss": 6.8088, "mean_token_accuracy": 0.1172551192343235, "num_tokens": 1450452.0, "step": 925 }, { "entropy": 6.967225980758667, "epoch": 0.02021563342318059, "grad_norm": 1.046875, "learning_rate": 0.0004645, "loss": 6.9108, "mean_token_accuracy": 0.11415560767054558, "num_tokens": 1459130.0, "step": 930 }, { "entropy": 6.973930406570434, "epoch": 0.02032431962438049, "grad_norm": 1.2890625, "learning_rate": 0.000467, "loss": 6.8542, "mean_token_accuracy": 0.10872401073575019, "num_tokens": 1466950.0, "step": 935 }, { "entropy": 6.964308834075927, "epoch": 0.020433005825580386, "grad_norm": 1.2265625, "learning_rate": 0.0004695, "loss": 6.9507, "mean_token_accuracy": 0.10664009302854538, "num_tokens": 1476679.0, "step": 940 }, { "entropy": 6.870850515365601, "epoch": 0.02054169202678028, "grad_norm": 1.1640625, "learning_rate": 0.000472, "loss": 6.7456, "mean_token_accuracy": 0.11636312678456306, "num_tokens": 1484000.0, "step": 945 }, { "entropy": 6.836710262298584, "epoch": 0.020650378227980177, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.8694, "mean_token_accuracy": 0.11150090396404266, "num_tokens": 1491563.0, "step": 950 }, { "entropy": 6.927568483352661, "epoch": 0.02075906442918007, "grad_norm": 1.0234375, "learning_rate": 0.000477, "loss": 6.8676, "mean_token_accuracy": 0.1152837723493576, "num_tokens": 1499879.0, "step": 955 }, { "entropy": 6.948094701766967, "epoch": 0.020867750630379968, "grad_norm": 1.125, "learning_rate": 0.0004795, "loss": 6.8011, "mean_token_accuracy": 0.1114250123500824, "num_tokens": 1507764.0, "step": 960 }, { "entropy": 6.80685830116272, "epoch": 0.02097643683157986, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.8263, "mean_token_accuracy": 0.1110868975520134, "num_tokens": 1516098.0, "step": 965 }, { "entropy": 6.883790922164917, "epoch": 0.02108512303277976, "grad_norm": 1.21875, "learning_rate": 0.0004845, "loss": 6.7996, "mean_token_accuracy": 0.11565712839365005, "num_tokens": 1523800.0, "step": 970 }, { "entropy": 6.985372495651245, "epoch": 0.021193809233979653, "grad_norm": 1.1015625, "learning_rate": 0.000487, "loss": 6.9104, "mean_token_accuracy": 0.10778488591313362, "num_tokens": 1531435.0, "step": 975 }, { "entropy": 6.863921737670898, "epoch": 0.02130249543517955, "grad_norm": 1.1328125, "learning_rate": 0.0004895, "loss": 6.797, "mean_token_accuracy": 0.11670528054237365, "num_tokens": 1539757.0, "step": 980 }, { "entropy": 6.790615463256836, "epoch": 0.021411181636379444, "grad_norm": 1.2421875, "learning_rate": 0.000492, "loss": 6.7501, "mean_token_accuracy": 0.11390289589762688, "num_tokens": 1547272.0, "step": 985 }, { "entropy": 6.816875362396241, "epoch": 0.02151986783757934, "grad_norm": 1.2421875, "learning_rate": 0.0004945, "loss": 6.7661, "mean_token_accuracy": 0.11140070185065269, "num_tokens": 1555286.0, "step": 990 }, { "entropy": 6.8604302406311035, "epoch": 0.021628554038779238, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 6.7601, "mean_token_accuracy": 0.11161275953054428, "num_tokens": 1563762.0, "step": 995 }, { "entropy": 6.862444543838501, "epoch": 0.021737240239979132, "grad_norm": 1.1796875, "learning_rate": 0.0004995, "loss": 6.8113, "mean_token_accuracy": 0.10896943360567093, "num_tokens": 1572996.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2577939849216000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }