{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.0326058603599687, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692033958435058, "epoch": 0.00010868620119989566, "grad_norm": 14.125, "learning_rate": 2e-06, "loss": 10.7755, "mean_token_accuracy": 0.0, "num_tokens": 7936.0, "step": 5 }, { "entropy": 10.691999912261963, "epoch": 0.00021737240239979132, "grad_norm": 15.1875, "learning_rate": 4.5e-06, "loss": 10.6915, "mean_token_accuracy": 0.0, "num_tokens": 15561.0, "step": 10 }, { "entropy": 10.690576362609864, "epoch": 0.000326058603599687, "grad_norm": 10.0, "learning_rate": 7e-06, "loss": 10.4237, "mean_token_accuracy": 0.03714140746742487, "num_tokens": 23101.0, "step": 15 }, { "entropy": 10.662552452087402, "epoch": 0.00043474480479958265, "grad_norm": 6.4375, "learning_rate": 9.5e-06, "loss": 10.13, "mean_token_accuracy": 0.053733503073453905, "num_tokens": 31122.0, "step": 20 }, { "entropy": 10.53134651184082, "epoch": 0.0005434310059994783, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 9.8666, "mean_token_accuracy": 0.049097494408488276, "num_tokens": 39424.0, "step": 25 }, { "entropy": 10.499347591400147, "epoch": 0.000652117207199374, "grad_norm": 3.40625, "learning_rate": 1.4500000000000002e-05, "loss": 9.6573, "mean_token_accuracy": 0.05333031602203846, "num_tokens": 46113.0, "step": 30 }, { "entropy": 10.45414752960205, "epoch": 0.0007608034083992696, "grad_norm": 4.03125, "learning_rate": 1.7000000000000003e-05, "loss": 9.5644, "mean_token_accuracy": 0.050568538904190066, "num_tokens": 53459.0, "step": 35 }, { "entropy": 10.488454818725586, "epoch": 0.0008694896095991653, "grad_norm": 2.875, "learning_rate": 1.95e-05, "loss": 9.5746, "mean_token_accuracy": 0.054808919131755826, "num_tokens": 61325.0, "step": 40 }, { "entropy": 10.44335298538208, "epoch": 0.0009781758107990609, "grad_norm": 2.578125, "learning_rate": 2.2e-05, "loss": 9.5243, "mean_token_accuracy": 0.05896916501224041, "num_tokens": 68741.0, "step": 45 }, { "entropy": 10.389917469024658, "epoch": 0.0010868620119989566, "grad_norm": 2.703125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4498, "mean_token_accuracy": 0.07500801645219327, "num_tokens": 76827.0, "step": 50 }, { "entropy": 10.32972011566162, "epoch": 0.0011955482131988523, "grad_norm": 2.28125, "learning_rate": 2.7e-05, "loss": 9.4108, "mean_token_accuracy": 0.06764259599149228, "num_tokens": 84543.0, "step": 55 }, { "entropy": 10.223662376403809, "epoch": 0.001304234414398748, "grad_norm": 2.1875, "learning_rate": 2.95e-05, "loss": 9.3763, "mean_token_accuracy": 0.06775642447173595, "num_tokens": 92505.0, "step": 60 }, { "entropy": 10.253492069244384, "epoch": 0.0014129206155986437, "grad_norm": 2.046875, "learning_rate": 3.2e-05, "loss": 9.292, "mean_token_accuracy": 0.07278058938682079, "num_tokens": 100004.0, "step": 65 }, { "entropy": 10.179506492614745, "epoch": 0.0015216068167985392, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1464, "mean_token_accuracy": 0.07609819024801254, "num_tokens": 106865.0, "step": 70 }, { "entropy": 10.167201709747314, "epoch": 0.0016302930179984349, "grad_norm": 1.828125, "learning_rate": 3.7e-05, "loss": 9.184, "mean_token_accuracy": 0.07288527600467205, "num_tokens": 115745.0, "step": 75 }, { "entropy": 10.253772735595703, "epoch": 0.0017389792191983306, "grad_norm": 1.9609375, "learning_rate": 3.95e-05, "loss": 9.1019, "mean_token_accuracy": 0.07272576205432416, "num_tokens": 124724.0, "step": 80 }, { "entropy": 10.141531181335449, "epoch": 0.0018476654203982263, "grad_norm": 1.921875, "learning_rate": 4.2000000000000004e-05, "loss": 8.9728, "mean_token_accuracy": 0.07559517920017242, "num_tokens": 131933.0, "step": 85 }, { "entropy": 10.05212688446045, "epoch": 0.0019563516215981218, "grad_norm": 2.125, "learning_rate": 4.45e-05, "loss": 8.9554, "mean_token_accuracy": 0.07529733926057816, "num_tokens": 139726.0, "step": 90 }, { "entropy": 10.118945980072022, "epoch": 0.0020650378227980177, "grad_norm": 1.9453125, "learning_rate": 4.7000000000000004e-05, "loss": 8.8937, "mean_token_accuracy": 0.07433236017823219, "num_tokens": 147276.0, "step": 95 }, { "entropy": 10.070981788635255, "epoch": 0.002173724023997913, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 8.8032, "mean_token_accuracy": 0.07382776252925397, "num_tokens": 155449.0, "step": 100 }, { "entropy": 9.931837844848634, "epoch": 0.002282410225197809, "grad_norm": 1.828125, "learning_rate": 5.2e-05, "loss": 8.6788, "mean_token_accuracy": 0.06880230605602264, "num_tokens": 163547.0, "step": 105 }, { "entropy": 9.92315607070923, "epoch": 0.0023910964263977046, "grad_norm": 1.71875, "learning_rate": 5.45e-05, "loss": 8.5975, "mean_token_accuracy": 0.0769424244761467, "num_tokens": 171777.0, "step": 110 }, { "entropy": 9.855748653411865, "epoch": 0.0024997826275976, "grad_norm": 1.671875, "learning_rate": 5.7e-05, "loss": 8.4659, "mean_token_accuracy": 0.0743311032652855, "num_tokens": 179337.0, "step": 115 }, { "entropy": 9.745928478240966, "epoch": 0.002608468828797496, "grad_norm": 1.796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.3905, "mean_token_accuracy": 0.07685245871543885, "num_tokens": 186939.0, "step": 120 }, { "entropy": 9.60959987640381, "epoch": 0.0027171550299973915, "grad_norm": 1.3125, "learning_rate": 6.2e-05, "loss": 8.2612, "mean_token_accuracy": 0.07991581708192826, "num_tokens": 194755.0, "step": 125 }, { "entropy": 9.507084274291993, "epoch": 0.0028258412311972874, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.1596, "mean_token_accuracy": 0.07951611280441284, "num_tokens": 202610.0, "step": 130 }, { "entropy": 9.229420471191407, "epoch": 0.002934527432397183, "grad_norm": 1.546875, "learning_rate": 6.7e-05, "loss": 8.0589, "mean_token_accuracy": 0.07813627794384956, "num_tokens": 211305.0, "step": 135 }, { "entropy": 9.083441066741944, "epoch": 0.0030432136335970784, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.9516, "mean_token_accuracy": 0.07972251251339912, "num_tokens": 218447.0, "step": 140 }, { "entropy": 8.977557182312012, "epoch": 0.0031518998347969743, "grad_norm": 1.328125, "learning_rate": 7.2e-05, "loss": 7.9735, "mean_token_accuracy": 0.07708753384649754, "num_tokens": 226108.0, "step": 145 }, { "entropy": 8.854303741455078, "epoch": 0.0032605860359968698, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 7.9018, "mean_token_accuracy": 0.0749433733522892, "num_tokens": 233213.0, "step": 150 }, { "entropy": 8.737026977539063, "epoch": 0.0033692722371967657, "grad_norm": 1.34375, "learning_rate": 7.7e-05, "loss": 7.9657, "mean_token_accuracy": 0.07061286456882954, "num_tokens": 241483.0, "step": 155 }, { "entropy": 8.660515594482423, "epoch": 0.003477958438396661, "grad_norm": 1.28125, "learning_rate": 7.950000000000001e-05, "loss": 7.8216, "mean_token_accuracy": 0.08022509105503559, "num_tokens": 249537.0, "step": 160 }, { "entropy": 8.48324089050293, "epoch": 0.0035866446395965567, "grad_norm": 1.1484375, "learning_rate": 8.2e-05, "loss": 7.7574, "mean_token_accuracy": 0.08265799134969712, "num_tokens": 256775.0, "step": 165 }, { "entropy": 8.382307147979736, "epoch": 0.0036953308407964526, "grad_norm": 1.40625, "learning_rate": 8.450000000000001e-05, "loss": 7.7628, "mean_token_accuracy": 0.08266141265630722, "num_tokens": 263931.0, "step": 170 }, { "entropy": 8.312588787078857, "epoch": 0.003804017041996348, "grad_norm": 1.1953125, "learning_rate": 8.7e-05, "loss": 7.7557, "mean_token_accuracy": 0.08323334604501724, "num_tokens": 272293.0, "step": 175 }, { "entropy": 8.368490505218507, "epoch": 0.0039127032431962435, "grad_norm": 1.390625, "learning_rate": 8.95e-05, "loss": 7.7964, "mean_token_accuracy": 0.07600408792495728, "num_tokens": 280599.0, "step": 180 }, { "entropy": 8.208444499969483, "epoch": 0.00402138944439614, "grad_norm": 1.4921875, "learning_rate": 9.2e-05, "loss": 7.7604, "mean_token_accuracy": 0.07719066366553307, "num_tokens": 287961.0, "step": 185 }, { "entropy": 8.142381763458252, "epoch": 0.004130075645596035, "grad_norm": 1.8671875, "learning_rate": 9.45e-05, "loss": 7.684, "mean_token_accuracy": 0.08424306884407998, "num_tokens": 297280.0, "step": 190 }, { "entropy": 8.162713718414306, "epoch": 0.004238761846795931, "grad_norm": 1.2421875, "learning_rate": 9.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08235807195305825, "num_tokens": 304699.0, "step": 195 }, { "entropy": 8.149117755889893, "epoch": 0.004347448047995826, "grad_norm": 1.125, "learning_rate": 9.95e-05, "loss": 7.6864, "mean_token_accuracy": 0.08296664133667946, "num_tokens": 313026.0, "step": 200 }, { "entropy": 8.115727186203003, "epoch": 0.004456134249195722, "grad_norm": 1.140625, "learning_rate": 0.000102, "loss": 7.7092, "mean_token_accuracy": 0.08166395723819733, "num_tokens": 320738.0, "step": 205 }, { "entropy": 8.076230096817017, "epoch": 0.004564820450395618, "grad_norm": 1.2265625, "learning_rate": 0.00010449999999999999, "loss": 7.6861, "mean_token_accuracy": 0.07836256250739097, "num_tokens": 328740.0, "step": 210 }, { "entropy": 8.025853300094605, "epoch": 0.004673506651595514, "grad_norm": 1.09375, "learning_rate": 0.000107, "loss": 7.6627, "mean_token_accuracy": 0.08186743408441544, "num_tokens": 336819.0, "step": 215 }, { "entropy": 8.132151794433593, "epoch": 0.004782192852795409, "grad_norm": 1.234375, "learning_rate": 0.0001095, "loss": 7.5969, "mean_token_accuracy": 0.08840056881308556, "num_tokens": 343978.0, "step": 220 }, { "entropy": 8.009299278259277, "epoch": 0.004890879053995305, "grad_norm": 1.2265625, "learning_rate": 0.000112, "loss": 7.6897, "mean_token_accuracy": 0.07886088080704212, "num_tokens": 353783.0, "step": 225 }, { "entropy": 7.969748306274414, "epoch": 0.0049995652551952, "grad_norm": 1.34375, "learning_rate": 0.0001145, "loss": 7.5909, "mean_token_accuracy": 0.08582306802272796, "num_tokens": 361371.0, "step": 230 }, { "entropy": 7.9828167915344235, "epoch": 0.0051082514563950965, "grad_norm": 1.3984375, "learning_rate": 0.00011700000000000001, "loss": 7.6185, "mean_token_accuracy": 0.07745145447552204, "num_tokens": 367717.0, "step": 235 }, { "entropy": 8.051587057113647, "epoch": 0.005216937657594992, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.6177, "mean_token_accuracy": 0.08022010251879692, "num_tokens": 375529.0, "step": 240 }, { "entropy": 7.905487108230591, "epoch": 0.0053256238587948874, "grad_norm": 1.1640625, "learning_rate": 0.000122, "loss": 7.5073, "mean_token_accuracy": 0.08242316544055939, "num_tokens": 383031.0, "step": 245 }, { "entropy": 7.966064023971557, "epoch": 0.005434310059994783, "grad_norm": 1.1953125, "learning_rate": 0.0001245, "loss": 7.6472, "mean_token_accuracy": 0.0840654157102108, "num_tokens": 391914.0, "step": 250 }, { "entropy": 7.939682960510254, "epoch": 0.005542996261194678, "grad_norm": 1.34375, "learning_rate": 0.000127, "loss": 7.6111, "mean_token_accuracy": 0.08445862084627151, "num_tokens": 399447.0, "step": 255 }, { "entropy": 7.95916223526001, "epoch": 0.005651682462394575, "grad_norm": 1.5078125, "learning_rate": 0.0001295, "loss": 7.6053, "mean_token_accuracy": 0.08623345196247101, "num_tokens": 407636.0, "step": 260 }, { "entropy": 7.863192081451416, "epoch": 0.00576036866359447, "grad_norm": 1.25, "learning_rate": 0.000132, "loss": 7.5498, "mean_token_accuracy": 0.08252564668655396, "num_tokens": 416650.0, "step": 265 }, { "entropy": 7.940821886062622, "epoch": 0.005869054864794366, "grad_norm": 1.71875, "learning_rate": 0.00013450000000000002, "loss": 7.4851, "mean_token_accuracy": 0.08535419404506683, "num_tokens": 424619.0, "step": 270 }, { "entropy": 7.923966264724731, "epoch": 0.005977741065994261, "grad_norm": 1.5546875, "learning_rate": 0.00013700000000000002, "loss": 7.5731, "mean_token_accuracy": 0.08694756105542183, "num_tokens": 432854.0, "step": 275 }, { "entropy": 7.861378288269043, "epoch": 0.006086427267194157, "grad_norm": 1.3515625, "learning_rate": 0.0001395, "loss": 7.5646, "mean_token_accuracy": 0.08049703910946845, "num_tokens": 440472.0, "step": 280 }, { "entropy": 7.979065895080566, "epoch": 0.006195113468394053, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.4921, "mean_token_accuracy": 0.08637023121118545, "num_tokens": 447843.0, "step": 285 }, { "entropy": 7.926018571853637, "epoch": 0.0063037996695939486, "grad_norm": 1.4921875, "learning_rate": 0.0001445, "loss": 7.6005, "mean_token_accuracy": 0.08329573571681977, "num_tokens": 455272.0, "step": 290 }, { "entropy": 7.811395597457886, "epoch": 0.006412485870793844, "grad_norm": 1.3359375, "learning_rate": 0.000147, "loss": 7.4287, "mean_token_accuracy": 0.08994799107313156, "num_tokens": 462190.0, "step": 295 }, { "entropy": 7.937566328048706, "epoch": 0.0065211720719937395, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 7.5291, "mean_token_accuracy": 0.08383448868989944, "num_tokens": 470562.0, "step": 300 }, { "entropy": 7.770080280303955, "epoch": 0.006629858273193635, "grad_norm": 1.140625, "learning_rate": 0.000152, "loss": 7.433, "mean_token_accuracy": 0.09061657935380936, "num_tokens": 478523.0, "step": 305 }, { "entropy": 7.844554090499878, "epoch": 0.006738544474393531, "grad_norm": 1.3359375, "learning_rate": 0.00015450000000000001, "loss": 7.517, "mean_token_accuracy": 0.08662905022501946, "num_tokens": 486759.0, "step": 310 }, { "entropy": 7.828848934173584, "epoch": 0.006847230675593427, "grad_norm": 1.2421875, "learning_rate": 0.000157, "loss": 7.5283, "mean_token_accuracy": 0.08165703043341636, "num_tokens": 495168.0, "step": 315 }, { "entropy": 7.823043441772461, "epoch": 0.006955916876793322, "grad_norm": 1.2421875, "learning_rate": 0.0001595, "loss": 7.4207, "mean_token_accuracy": 0.08956636488437653, "num_tokens": 503490.0, "step": 320 }, { "entropy": 7.771451330184936, "epoch": 0.007064603077993218, "grad_norm": 1.171875, "learning_rate": 0.000162, "loss": 7.5539, "mean_token_accuracy": 0.08244621530175208, "num_tokens": 512522.0, "step": 325 }, { "entropy": 7.877453756332398, "epoch": 0.007173289279193113, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 7.4913, "mean_token_accuracy": 0.08120876513421535, "num_tokens": 521100.0, "step": 330 }, { "entropy": 7.771992826461792, "epoch": 0.00728197548039301, "grad_norm": 1.1875, "learning_rate": 0.00016700000000000002, "loss": 7.396, "mean_token_accuracy": 0.0948154278099537, "num_tokens": 528027.0, "step": 335 }, { "entropy": 7.7505473613739015, "epoch": 0.007390661681592905, "grad_norm": 1.390625, "learning_rate": 0.00016950000000000003, "loss": 7.3994, "mean_token_accuracy": 0.08797064200043678, "num_tokens": 535541.0, "step": 340 }, { "entropy": 7.820106267929077, "epoch": 0.007499347882792801, "grad_norm": 1.1484375, "learning_rate": 0.00017199999999999998, "loss": 7.4177, "mean_token_accuracy": 0.08866829052567482, "num_tokens": 543253.0, "step": 345 }, { "entropy": 7.8131262302398685, "epoch": 0.007608034083992696, "grad_norm": 1.515625, "learning_rate": 0.00017449999999999999, "loss": 7.4312, "mean_token_accuracy": 0.08869538456201553, "num_tokens": 550414.0, "step": 350 }, { "entropy": 7.678452491760254, "epoch": 0.007716720285192592, "grad_norm": 1.2265625, "learning_rate": 0.000177, "loss": 7.4866, "mean_token_accuracy": 0.08567069470882416, "num_tokens": 558554.0, "step": 355 }, { "entropy": 7.860786962509155, "epoch": 0.007825406486392487, "grad_norm": 1.1640625, "learning_rate": 0.0001795, "loss": 7.4562, "mean_token_accuracy": 0.0866042397916317, "num_tokens": 566297.0, "step": 360 }, { "entropy": 7.691314792633056, "epoch": 0.007934092687592383, "grad_norm": 1.3359375, "learning_rate": 0.000182, "loss": 7.399, "mean_token_accuracy": 0.09093262627720833, "num_tokens": 574600.0, "step": 365 }, { "entropy": 7.761751461029053, "epoch": 0.00804277888879228, "grad_norm": 1.03125, "learning_rate": 0.0001845, "loss": 7.4278, "mean_token_accuracy": 0.08792822286486626, "num_tokens": 583349.0, "step": 370 }, { "entropy": 7.841218614578247, "epoch": 0.008151465089992175, "grad_norm": 1.3671875, "learning_rate": 0.000187, "loss": 7.3269, "mean_token_accuracy": 0.08868191167712211, "num_tokens": 590169.0, "step": 375 }, { "entropy": 7.639244318008423, "epoch": 0.00826015129119207, "grad_norm": 1.296875, "learning_rate": 0.0001895, "loss": 7.2957, "mean_token_accuracy": 0.09457754641771317, "num_tokens": 597508.0, "step": 380 }, { "entropy": 7.685401201248169, "epoch": 0.008368837492391966, "grad_norm": 1.1640625, "learning_rate": 0.000192, "loss": 7.375, "mean_token_accuracy": 0.09122001230716706, "num_tokens": 605412.0, "step": 385 }, { "entropy": 7.795647668838501, "epoch": 0.008477523693591862, "grad_norm": 1.3359375, "learning_rate": 0.0001945, "loss": 7.3872, "mean_token_accuracy": 0.09148699790239334, "num_tokens": 613512.0, "step": 390 }, { "entropy": 7.641701507568359, "epoch": 0.008586209894791757, "grad_norm": 1.078125, "learning_rate": 0.00019700000000000002, "loss": 7.3275, "mean_token_accuracy": 0.09618531838059426, "num_tokens": 621117.0, "step": 395 }, { "entropy": 7.689551591873169, "epoch": 0.008694896095991653, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 7.3832, "mean_token_accuracy": 0.08407204449176789, "num_tokens": 629970.0, "step": 400 }, { "entropy": 7.637691450119019, "epoch": 0.008803582297191548, "grad_norm": 1.375, "learning_rate": 0.000202, "loss": 7.3219, "mean_token_accuracy": 0.09131594821810722, "num_tokens": 638184.0, "step": 405 }, { "entropy": 7.5977555274963375, "epoch": 0.008912268498391444, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 7.2837, "mean_token_accuracy": 0.08929966911673545, "num_tokens": 645953.0, "step": 410 }, { "entropy": 7.6464704990386965, "epoch": 0.00902095469959134, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 7.3305, "mean_token_accuracy": 0.08722574934363365, "num_tokens": 654291.0, "step": 415 }, { "entropy": 7.672793436050415, "epoch": 0.009129640900791236, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 7.3299, "mean_token_accuracy": 0.08851959705352783, "num_tokens": 661393.0, "step": 420 }, { "entropy": 7.531088209152221, "epoch": 0.009238327101991132, "grad_norm": 1.4296875, "learning_rate": 0.000212, "loss": 7.3139, "mean_token_accuracy": 0.0963095597922802, "num_tokens": 669913.0, "step": 425 }, { "entropy": 7.74607515335083, "epoch": 0.009347013303191027, "grad_norm": 1.1953125, "learning_rate": 0.0002145, "loss": 7.3663, "mean_token_accuracy": 0.09074652194976807, "num_tokens": 678745.0, "step": 430 }, { "entropy": 7.417545986175537, "epoch": 0.009455699504390923, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.2468, "mean_token_accuracy": 0.09117906540632248, "num_tokens": 686191.0, "step": 435 }, { "entropy": 7.690976524353028, "epoch": 0.009564385705590818, "grad_norm": 2.109375, "learning_rate": 0.0002195, "loss": 7.2921, "mean_token_accuracy": 0.08830784261226654, "num_tokens": 694776.0, "step": 440 }, { "entropy": 7.471565675735474, "epoch": 0.009673071906790714, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 7.2498, "mean_token_accuracy": 0.08958808556199074, "num_tokens": 702481.0, "step": 445 }, { "entropy": 7.601398086547851, "epoch": 0.00978175810799061, "grad_norm": 1.265625, "learning_rate": 0.0002245, "loss": 7.2892, "mean_token_accuracy": 0.08943363651633263, "num_tokens": 710304.0, "step": 450 }, { "entropy": 7.6107948303222654, "epoch": 0.009890444309190505, "grad_norm": 1.2734375, "learning_rate": 0.00022700000000000002, "loss": 7.2655, "mean_token_accuracy": 0.0950858935713768, "num_tokens": 718462.0, "step": 455 }, { "entropy": 7.4872644424438475, "epoch": 0.0099991305103904, "grad_norm": 1.0625, "learning_rate": 0.00022950000000000002, "loss": 7.2699, "mean_token_accuracy": 0.09967489093542099, "num_tokens": 726798.0, "step": 460 }, { "entropy": 7.636318254470825, "epoch": 0.010107816711590296, "grad_norm": 1.1328125, "learning_rate": 0.00023200000000000003, "loss": 7.2289, "mean_token_accuracy": 0.09415075033903123, "num_tokens": 735054.0, "step": 465 }, { "entropy": 7.467661046981812, "epoch": 0.010216502912790193, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 7.2689, "mean_token_accuracy": 0.08854644820094108, "num_tokens": 743701.0, "step": 470 }, { "entropy": 7.5553264141082765, "epoch": 0.010325189113990088, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.3436, "mean_token_accuracy": 0.08918146193027496, "num_tokens": 751548.0, "step": 475 }, { "entropy": 7.606575393676758, "epoch": 0.010433875315189984, "grad_norm": 1.359375, "learning_rate": 0.0002395, "loss": 7.1245, "mean_token_accuracy": 0.09939143806695938, "num_tokens": 758580.0, "step": 480 }, { "entropy": 7.376218938827515, "epoch": 0.01054256151638988, "grad_norm": 1.375, "learning_rate": 0.000242, "loss": 7.1472, "mean_token_accuracy": 0.09824580624699593, "num_tokens": 766240.0, "step": 485 }, { "entropy": 7.460130596160889, "epoch": 0.010651247717589775, "grad_norm": 1.3125, "learning_rate": 0.0002445, "loss": 7.1908, "mean_token_accuracy": 0.09887742102146149, "num_tokens": 774206.0, "step": 490 }, { "entropy": 7.499665117263794, "epoch": 0.01075993391878967, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 7.135, "mean_token_accuracy": 0.10001260414719582, "num_tokens": 782005.0, "step": 495 }, { "entropy": 7.313957262039184, "epoch": 0.010868620119989566, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.1614, "mean_token_accuracy": 0.10134897753596306, "num_tokens": 790043.0, "step": 500 }, { "entropy": 7.518388891220093, "epoch": 0.010977306321189461, "grad_norm": 1.21875, "learning_rate": 0.000252, "loss": 7.1951, "mean_token_accuracy": 0.10190339386463165, "num_tokens": 798248.0, "step": 505 }, { "entropy": 7.401588821411133, "epoch": 0.011085992522389357, "grad_norm": 1.203125, "learning_rate": 0.0002545, "loss": 7.1494, "mean_token_accuracy": 0.10203814506530762, "num_tokens": 806023.0, "step": 510 }, { "entropy": 7.4617040157318115, "epoch": 0.011194678723589252, "grad_norm": 1.3359375, "learning_rate": 0.000257, "loss": 7.26, "mean_token_accuracy": 0.08982759192585946, "num_tokens": 813719.0, "step": 515 }, { "entropy": 7.584583950042725, "epoch": 0.01130336492478915, "grad_norm": 1.296875, "learning_rate": 0.0002595, "loss": 7.2398, "mean_token_accuracy": 0.09505607783794404, "num_tokens": 821938.0, "step": 520 }, { "entropy": 7.490258741378784, "epoch": 0.011412051125989045, "grad_norm": 1.1953125, "learning_rate": 0.000262, "loss": 7.1423, "mean_token_accuracy": 0.09996162354946136, "num_tokens": 830263.0, "step": 525 }, { "entropy": 7.332801628112793, "epoch": 0.01152073732718894, "grad_norm": 1.34375, "learning_rate": 0.00026450000000000003, "loss": 7.1478, "mean_token_accuracy": 0.10072804763913154, "num_tokens": 838040.0, "step": 530 }, { "entropy": 7.352591896057129, "epoch": 0.011629423528388836, "grad_norm": 1.234375, "learning_rate": 0.00026700000000000004, "loss": 7.1318, "mean_token_accuracy": 0.09845451191067696, "num_tokens": 846265.0, "step": 535 }, { "entropy": 7.524213409423828, "epoch": 0.011738109729588731, "grad_norm": 1.625, "learning_rate": 0.00026950000000000005, "loss": 7.2088, "mean_token_accuracy": 0.09776617884635926, "num_tokens": 853815.0, "step": 540 }, { "entropy": 7.406747961044312, "epoch": 0.011846795930788627, "grad_norm": 1.3046875, "learning_rate": 0.00027200000000000005, "loss": 7.1712, "mean_token_accuracy": 0.1003396026790142, "num_tokens": 861186.0, "step": 545 }, { "entropy": 7.5143406867980955, "epoch": 0.011955482131988522, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 7.1261, "mean_token_accuracy": 0.09955452755093575, "num_tokens": 868619.0, "step": 550 }, { "entropy": 7.397789716720581, "epoch": 0.012064168333188418, "grad_norm": 1.203125, "learning_rate": 0.000277, "loss": 7.1921, "mean_token_accuracy": 0.1024585336446762, "num_tokens": 876521.0, "step": 555 }, { "entropy": 7.418723487854004, "epoch": 0.012172854534388313, "grad_norm": 1.46875, "learning_rate": 0.0002795, "loss": 7.1915, "mean_token_accuracy": 0.09342663809657097, "num_tokens": 884060.0, "step": 560 }, { "entropy": 7.401181697845459, "epoch": 0.012281540735588209, "grad_norm": 1.296875, "learning_rate": 0.00028199999999999997, "loss": 7.1436, "mean_token_accuracy": 0.09810893088579178, "num_tokens": 892218.0, "step": 565 }, { "entropy": 7.3739972591400145, "epoch": 0.012390226936788106, "grad_norm": 1.40625, "learning_rate": 0.0002845, "loss": 7.153, "mean_token_accuracy": 0.09526406824588776, "num_tokens": 899472.0, "step": 570 }, { "entropy": 7.431902933120727, "epoch": 0.012498913137988002, "grad_norm": 1.3046875, "learning_rate": 0.000287, "loss": 7.1138, "mean_token_accuracy": 0.10175292342901229, "num_tokens": 907371.0, "step": 575 }, { "entropy": 7.30218768119812, "epoch": 0.012607599339187897, "grad_norm": 1.40625, "learning_rate": 0.0002895, "loss": 7.118, "mean_token_accuracy": 0.10189053043723106, "num_tokens": 914376.0, "step": 580 }, { "entropy": 7.398109769821167, "epoch": 0.012716285540387793, "grad_norm": 1.3359375, "learning_rate": 0.000292, "loss": 7.1022, "mean_token_accuracy": 0.09777733609080315, "num_tokens": 921992.0, "step": 585 }, { "entropy": 7.318228054046631, "epoch": 0.012824971741587688, "grad_norm": 1.1484375, "learning_rate": 0.0002945, "loss": 7.1565, "mean_token_accuracy": 0.10031871050596237, "num_tokens": 929966.0, "step": 590 }, { "entropy": 7.380307865142822, "epoch": 0.012933657942787584, "grad_norm": 1.25, "learning_rate": 0.000297, "loss": 7.0322, "mean_token_accuracy": 0.10295850262045861, "num_tokens": 936500.0, "step": 595 }, { "entropy": 7.2398364543914795, "epoch": 0.013042344143987479, "grad_norm": 1.2578125, "learning_rate": 0.0002995, "loss": 7.0636, "mean_token_accuracy": 0.10201629102230073, "num_tokens": 944685.0, "step": 600 }, { "entropy": 7.3245521068573, "epoch": 0.013151030345187375, "grad_norm": 1.40625, "learning_rate": 0.000302, "loss": 7.09, "mean_token_accuracy": 0.10841693356633186, "num_tokens": 952379.0, "step": 605 }, { "entropy": 7.226641845703125, "epoch": 0.01325971654638727, "grad_norm": 1.296875, "learning_rate": 0.0003045, "loss": 7.0067, "mean_token_accuracy": 0.10042177364230156, "num_tokens": 960310.0, "step": 610 }, { "entropy": 7.356974458694458, "epoch": 0.013368402747587165, "grad_norm": 1.1875, "learning_rate": 0.000307, "loss": 7.1009, "mean_token_accuracy": 0.09788779467344284, "num_tokens": 967581.0, "step": 615 }, { "entropy": 7.381576633453369, "epoch": 0.013477088948787063, "grad_norm": 1.34375, "learning_rate": 0.0003095, "loss": 7.0731, "mean_token_accuracy": 0.10214511007070541, "num_tokens": 975351.0, "step": 620 }, { "entropy": 7.133514547348023, "epoch": 0.013585775149986958, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 7.0016, "mean_token_accuracy": 0.10031676739454269, "num_tokens": 982962.0, "step": 625 }, { "entropy": 7.36269965171814, "epoch": 0.013694461351186854, "grad_norm": 1.3203125, "learning_rate": 0.0003145, "loss": 7.0818, "mean_token_accuracy": 0.0940178707242012, "num_tokens": 991081.0, "step": 630 }, { "entropy": 7.196866226196289, "epoch": 0.01380314755238675, "grad_norm": 1.265625, "learning_rate": 0.000317, "loss": 7.0304, "mean_token_accuracy": 0.0977426715195179, "num_tokens": 999169.0, "step": 635 }, { "entropy": 7.23091402053833, "epoch": 0.013911833753586645, "grad_norm": 1.3203125, "learning_rate": 0.0003195, "loss": 7.0051, "mean_token_accuracy": 0.10395268872380256, "num_tokens": 1007086.0, "step": 640 }, { "entropy": 7.237727499008178, "epoch": 0.01402051995478654, "grad_norm": 1.34375, "learning_rate": 0.000322, "loss": 7.0415, "mean_token_accuracy": 0.10429325178265572, "num_tokens": 1014937.0, "step": 645 }, { "entropy": 7.289627265930176, "epoch": 0.014129206155986436, "grad_norm": 1.265625, "learning_rate": 0.00032450000000000003, "loss": 7.0527, "mean_token_accuracy": 0.10648775473237038, "num_tokens": 1022271.0, "step": 650 }, { "entropy": 7.281875371932983, "epoch": 0.014237892357186331, "grad_norm": 1.1953125, "learning_rate": 0.00032700000000000003, "loss": 7.0394, "mean_token_accuracy": 0.09872807115316391, "num_tokens": 1029946.0, "step": 655 }, { "entropy": 7.201374578475952, "epoch": 0.014346578558386227, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 7.0564, "mean_token_accuracy": 0.09937692657113076, "num_tokens": 1037659.0, "step": 660 }, { "entropy": 7.247886657714844, "epoch": 0.014455264759586122, "grad_norm": 1.6015625, "learning_rate": 0.00033200000000000005, "loss": 7.0678, "mean_token_accuracy": 0.10430879592895508, "num_tokens": 1045420.0, "step": 665 }, { "entropy": 7.278404426574707, "epoch": 0.01456395096078602, "grad_norm": 1.1484375, "learning_rate": 0.00033450000000000005, "loss": 7.0594, "mean_token_accuracy": 0.10522538945078849, "num_tokens": 1052681.0, "step": 670 }, { "entropy": 7.258583641052246, "epoch": 0.014672637161985915, "grad_norm": 1.2109375, "learning_rate": 0.000337, "loss": 6.9977, "mean_token_accuracy": 0.10505606159567833, "num_tokens": 1060114.0, "step": 675 }, { "entropy": 7.2787620544433596, "epoch": 0.01478132336318581, "grad_norm": 1.234375, "learning_rate": 0.0003395, "loss": 7.0666, "mean_token_accuracy": 0.10130468308925629, "num_tokens": 1068833.0, "step": 680 }, { "entropy": 7.07578821182251, "epoch": 0.014890009564385706, "grad_norm": 1.25, "learning_rate": 0.000342, "loss": 7.0062, "mean_token_accuracy": 0.10653988644480705, "num_tokens": 1075850.0, "step": 685 }, { "entropy": 7.184060382843017, "epoch": 0.014998695765585601, "grad_norm": 1.3671875, "learning_rate": 0.00034449999999999997, "loss": 6.9698, "mean_token_accuracy": 0.10846218839287758, "num_tokens": 1083956.0, "step": 690 }, { "entropy": 7.173658752441407, "epoch": 0.015107381966785497, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 7.003, "mean_token_accuracy": 0.09950482398271561, "num_tokens": 1091744.0, "step": 695 }, { "entropy": 7.154714155197143, "epoch": 0.015216068167985392, "grad_norm": 1.421875, "learning_rate": 0.0003495, "loss": 6.9642, "mean_token_accuracy": 0.10058322846889496, "num_tokens": 1099029.0, "step": 700 }, { "entropy": 7.211764144897461, "epoch": 0.015324754369185288, "grad_norm": 1.234375, "learning_rate": 0.000352, "loss": 7.0826, "mean_token_accuracy": 0.10248045325279236, "num_tokens": 1106329.0, "step": 705 }, { "entropy": 7.2008462905883786, "epoch": 0.015433440570385183, "grad_norm": 1.296875, "learning_rate": 0.0003545, "loss": 7.0031, "mean_token_accuracy": 0.10641120374202728, "num_tokens": 1114672.0, "step": 710 }, { "entropy": 7.307254886627197, "epoch": 0.01554212677158508, "grad_norm": 1.09375, "learning_rate": 0.000357, "loss": 7.122, "mean_token_accuracy": 0.09702686741948127, "num_tokens": 1123782.0, "step": 715 }, { "entropy": 7.048694181442261, "epoch": 0.015650812972784974, "grad_norm": 1.3828125, "learning_rate": 0.0003595, "loss": 6.9479, "mean_token_accuracy": 0.10803859531879426, "num_tokens": 1131211.0, "step": 720 }, { "entropy": 7.091199684143066, "epoch": 0.01575949917398487, "grad_norm": 1.171875, "learning_rate": 0.000362, "loss": 6.9317, "mean_token_accuracy": 0.10954350158572197, "num_tokens": 1138955.0, "step": 725 }, { "entropy": 7.106390285491943, "epoch": 0.015868185375184765, "grad_norm": 1.125, "learning_rate": 0.0003645, "loss": 6.9803, "mean_token_accuracy": 0.10243654400110244, "num_tokens": 1147376.0, "step": 730 }, { "entropy": 7.204882383346558, "epoch": 0.015976871576384662, "grad_norm": 1.1015625, "learning_rate": 0.000367, "loss": 6.9549, "mean_token_accuracy": 0.10707944706082344, "num_tokens": 1155196.0, "step": 735 }, { "entropy": 7.020097827911377, "epoch": 0.01608555777758456, "grad_norm": 1.2421875, "learning_rate": 0.0003695, "loss": 6.9581, "mean_token_accuracy": 0.10678377524018287, "num_tokens": 1162503.0, "step": 740 }, { "entropy": 7.215338659286499, "epoch": 0.016194243978784453, "grad_norm": 1.296875, "learning_rate": 0.000372, "loss": 7.006, "mean_token_accuracy": 0.10291345119476318, "num_tokens": 1170387.0, "step": 745 }, { "entropy": 6.980220603942871, "epoch": 0.01630293017998435, "grad_norm": 1.2109375, "learning_rate": 0.0003745, "loss": 6.8741, "mean_token_accuracy": 0.11537401303648949, "num_tokens": 1176921.0, "step": 750 }, { "entropy": 7.128726530075073, "epoch": 0.016411616381184244, "grad_norm": 1.0703125, "learning_rate": 0.000377, "loss": 7.0252, "mean_token_accuracy": 0.1050336092710495, "num_tokens": 1185063.0, "step": 755 }, { "entropy": 7.0691938400268555, "epoch": 0.01652030258238414, "grad_norm": 1.109375, "learning_rate": 0.0003795, "loss": 6.9361, "mean_token_accuracy": 0.1111590951681137, "num_tokens": 1193008.0, "step": 760 }, { "entropy": 7.12714900970459, "epoch": 0.016628988783584035, "grad_norm": 1.109375, "learning_rate": 0.000382, "loss": 6.9554, "mean_token_accuracy": 0.1107974775135517, "num_tokens": 1200868.0, "step": 765 }, { "entropy": 7.084636926651001, "epoch": 0.016737674984783932, "grad_norm": 1.15625, "learning_rate": 0.0003845, "loss": 6.9061, "mean_token_accuracy": 0.11364880874752999, "num_tokens": 1208687.0, "step": 770 }, { "entropy": 7.034700918197632, "epoch": 0.016846361185983826, "grad_norm": 1.046875, "learning_rate": 0.00038700000000000003, "loss": 6.9637, "mean_token_accuracy": 0.10925066992640495, "num_tokens": 1216804.0, "step": 775 }, { "entropy": 7.038867473602295, "epoch": 0.016955047387183723, "grad_norm": 1.2578125, "learning_rate": 0.00038950000000000003, "loss": 6.8871, "mean_token_accuracy": 0.11413683071732521, "num_tokens": 1224505.0, "step": 780 }, { "entropy": 6.978211402893066, "epoch": 0.017063733588383617, "grad_norm": 1.0234375, "learning_rate": 0.00039200000000000004, "loss": 6.8853, "mean_token_accuracy": 0.11565895602107049, "num_tokens": 1232706.0, "step": 785 }, { "entropy": 7.117547416687012, "epoch": 0.017172419789583514, "grad_norm": 1.2421875, "learning_rate": 0.00039450000000000005, "loss": 6.8904, "mean_token_accuracy": 0.11539890021085739, "num_tokens": 1239551.0, "step": 790 }, { "entropy": 6.993913698196411, "epoch": 0.01728110599078341, "grad_norm": 1.40625, "learning_rate": 0.00039700000000000005, "loss": 6.8834, "mean_token_accuracy": 0.11389343962073326, "num_tokens": 1247909.0, "step": 795 }, { "entropy": 7.153699827194214, "epoch": 0.017389792191983305, "grad_norm": 1.1875, "learning_rate": 0.0003995, "loss": 7.0588, "mean_token_accuracy": 0.10906191244721412, "num_tokens": 1256523.0, "step": 800 }, { "entropy": 7.072479391098023, "epoch": 0.017498478393183203, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.8826, "mean_token_accuracy": 0.11302874237298965, "num_tokens": 1263879.0, "step": 805 }, { "entropy": 7.110428047180176, "epoch": 0.017607164594383096, "grad_norm": 1.2109375, "learning_rate": 0.0004045, "loss": 6.9637, "mean_token_accuracy": 0.1068289540708065, "num_tokens": 1271287.0, "step": 810 }, { "entropy": 6.977171850204468, "epoch": 0.017715850795582994, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.8514, "mean_token_accuracy": 0.1114407129585743, "num_tokens": 1278828.0, "step": 815 }, { "entropy": 7.056746530532837, "epoch": 0.017824536996782887, "grad_norm": 1.125, "learning_rate": 0.0004095, "loss": 6.9732, "mean_token_accuracy": 0.10797528550028801, "num_tokens": 1286827.0, "step": 820 }, { "entropy": 7.063602304458618, "epoch": 0.017933223197982785, "grad_norm": 1.21875, "learning_rate": 0.000412, "loss": 6.9201, "mean_token_accuracy": 0.10415855050086975, "num_tokens": 1294546.0, "step": 825 }, { "entropy": 6.962296867370606, "epoch": 0.01804190939918268, "grad_norm": 1.359375, "learning_rate": 0.0004145, "loss": 6.8398, "mean_token_accuracy": 0.1096323385834694, "num_tokens": 1301574.0, "step": 830 }, { "entropy": 7.106445598602295, "epoch": 0.018150595600382576, "grad_norm": 1.28125, "learning_rate": 0.000417, "loss": 6.8577, "mean_token_accuracy": 0.11122734472155571, "num_tokens": 1308224.0, "step": 835 }, { "entropy": 6.868801546096802, "epoch": 0.018259281801582473, "grad_norm": 1.0703125, "learning_rate": 0.0004195, "loss": 6.923, "mean_token_accuracy": 0.10960033088922501, "num_tokens": 1317335.0, "step": 840 }, { "entropy": 7.096353387832641, "epoch": 0.018367968002782366, "grad_norm": 1.125, "learning_rate": 0.000422, "loss": 6.8735, "mean_token_accuracy": 0.10573652610182763, "num_tokens": 1324825.0, "step": 845 }, { "entropy": 6.913944911956787, "epoch": 0.018476654203982264, "grad_norm": 1.1953125, "learning_rate": 0.0004245, "loss": 6.9635, "mean_token_accuracy": 0.10770962685346604, "num_tokens": 1332818.0, "step": 850 }, { "entropy": 6.95415940284729, "epoch": 0.018585340405182157, "grad_norm": 1.1640625, "learning_rate": 0.000427, "loss": 6.769, "mean_token_accuracy": 0.12482169717550277, "num_tokens": 1339858.0, "step": 855 }, { "entropy": 6.976625156402588, "epoch": 0.018694026606382055, "grad_norm": 1.09375, "learning_rate": 0.0004295, "loss": 6.9342, "mean_token_accuracy": 0.10149514004588127, "num_tokens": 1348542.0, "step": 860 }, { "entropy": 6.979064416885376, "epoch": 0.01880271280758195, "grad_norm": 1.125, "learning_rate": 0.000432, "loss": 6.8578, "mean_token_accuracy": 0.11146032214164733, "num_tokens": 1355851.0, "step": 865 }, { "entropy": 6.964614057540894, "epoch": 0.018911399008781846, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.867, "mean_token_accuracy": 0.11173160448670387, "num_tokens": 1363844.0, "step": 870 }, { "entropy": 7.057435846328735, "epoch": 0.01902008520998174, "grad_norm": 1.125, "learning_rate": 0.000437, "loss": 6.8731, "mean_token_accuracy": 0.11148432195186615, "num_tokens": 1372525.0, "step": 875 }, { "entropy": 6.942585229873657, "epoch": 0.019128771411181637, "grad_norm": 1.109375, "learning_rate": 0.0004395, "loss": 6.9121, "mean_token_accuracy": 0.10839233919978142, "num_tokens": 1381371.0, "step": 880 }, { "entropy": 6.933096694946289, "epoch": 0.01923745761238153, "grad_norm": 1.21875, "learning_rate": 0.000442, "loss": 6.8116, "mean_token_accuracy": 0.11815176531672478, "num_tokens": 1389140.0, "step": 885 }, { "entropy": 6.891059732437133, "epoch": 0.019346143813581428, "grad_norm": 1.1015625, "learning_rate": 0.0004445, "loss": 6.8372, "mean_token_accuracy": 0.11450439095497131, "num_tokens": 1396397.0, "step": 890 }, { "entropy": 6.9327497482299805, "epoch": 0.019454830014781325, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.9194, "mean_token_accuracy": 0.11007297709584236, "num_tokens": 1404600.0, "step": 895 }, { "entropy": 6.999571323394775, "epoch": 0.01956351621598122, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.8758, "mean_token_accuracy": 0.11412210613489152, "num_tokens": 1413063.0, "step": 900 }, { "entropy": 6.883196830749512, "epoch": 0.019672202417181116, "grad_norm": 1.109375, "learning_rate": 0.00045200000000000004, "loss": 6.7573, "mean_token_accuracy": 0.11876690089702606, "num_tokens": 1419875.0, "step": 905 }, { "entropy": 6.874788761138916, "epoch": 0.01978088861838101, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.8001, "mean_token_accuracy": 0.10891184434294701, "num_tokens": 1427405.0, "step": 910 }, { "entropy": 6.950111055374146, "epoch": 0.019889574819580907, "grad_norm": 1.1640625, "learning_rate": 0.00045700000000000005, "loss": 6.9241, "mean_token_accuracy": 0.10468844398856163, "num_tokens": 1435721.0, "step": 915 }, { "entropy": 6.985974359512329, "epoch": 0.0199982610207808, "grad_norm": 1.0859375, "learning_rate": 0.00045950000000000006, "loss": 6.8313, "mean_token_accuracy": 0.10862488150596619, "num_tokens": 1443091.0, "step": 920 }, { "entropy": 6.866302967071533, "epoch": 0.020106947221980698, "grad_norm": 1.0859375, "learning_rate": 0.000462, "loss": 6.8088, "mean_token_accuracy": 0.1172551192343235, "num_tokens": 1450452.0, "step": 925 }, { "entropy": 6.967225980758667, "epoch": 0.02021563342318059, "grad_norm": 1.046875, "learning_rate": 0.0004645, "loss": 6.9108, "mean_token_accuracy": 0.11415560767054558, "num_tokens": 1459130.0, "step": 930 }, { "entropy": 6.973930406570434, "epoch": 0.02032431962438049, "grad_norm": 1.2890625, "learning_rate": 0.000467, "loss": 6.8542, "mean_token_accuracy": 0.10872401073575019, "num_tokens": 1466950.0, "step": 935 }, { "entropy": 6.964308834075927, "epoch": 0.020433005825580386, "grad_norm": 1.2265625, "learning_rate": 0.0004695, "loss": 6.9507, "mean_token_accuracy": 0.10664009302854538, "num_tokens": 1476679.0, "step": 940 }, { "entropy": 6.870850515365601, "epoch": 0.02054169202678028, "grad_norm": 1.1640625, "learning_rate": 0.000472, "loss": 6.7456, "mean_token_accuracy": 0.11636312678456306, "num_tokens": 1484000.0, "step": 945 }, { "entropy": 6.836710262298584, "epoch": 0.020650378227980177, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.8694, "mean_token_accuracy": 0.11150090396404266, "num_tokens": 1491563.0, "step": 950 }, { "entropy": 6.927568483352661, "epoch": 0.02075906442918007, "grad_norm": 1.0234375, "learning_rate": 0.000477, "loss": 6.8676, "mean_token_accuracy": 0.1152837723493576, "num_tokens": 1499879.0, "step": 955 }, { "entropy": 6.948094701766967, "epoch": 0.020867750630379968, "grad_norm": 1.125, "learning_rate": 0.0004795, "loss": 6.8011, "mean_token_accuracy": 0.1114250123500824, "num_tokens": 1507764.0, "step": 960 }, { "entropy": 6.80685830116272, "epoch": 0.02097643683157986, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.8263, "mean_token_accuracy": 0.1110868975520134, "num_tokens": 1516098.0, "step": 965 }, { "entropy": 6.883790922164917, "epoch": 0.02108512303277976, "grad_norm": 1.21875, "learning_rate": 0.0004845, "loss": 6.7996, "mean_token_accuracy": 0.11565712839365005, "num_tokens": 1523800.0, "step": 970 }, { "entropy": 6.985372495651245, "epoch": 0.021193809233979653, "grad_norm": 1.1015625, "learning_rate": 0.000487, "loss": 6.9104, "mean_token_accuracy": 0.10778488591313362, "num_tokens": 1531435.0, "step": 975 }, { "entropy": 6.863921737670898, "epoch": 0.02130249543517955, "grad_norm": 1.1328125, "learning_rate": 0.0004895, "loss": 6.797, "mean_token_accuracy": 0.11670528054237365, "num_tokens": 1539757.0, "step": 980 }, { "entropy": 6.790615463256836, "epoch": 0.021411181636379444, "grad_norm": 1.2421875, "learning_rate": 0.000492, "loss": 6.7501, "mean_token_accuracy": 0.11390289589762688, "num_tokens": 1547272.0, "step": 985 }, { "entropy": 6.816875362396241, "epoch": 0.02151986783757934, "grad_norm": 1.2421875, "learning_rate": 0.0004945, "loss": 6.7661, "mean_token_accuracy": 0.11140070185065269, "num_tokens": 1555286.0, "step": 990 }, { "entropy": 6.8604302406311035, "epoch": 0.021628554038779238, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 6.7601, "mean_token_accuracy": 0.11161275953054428, "num_tokens": 1563762.0, "step": 995 }, { "entropy": 6.862444543838501, "epoch": 0.021737240239979132, "grad_norm": 1.1796875, "learning_rate": 0.0004995, "loss": 6.8113, "mean_token_accuracy": 0.10896943360567093, "num_tokens": 1572996.0, "step": 1000 }, { "entropy": 6.944311189651489, "epoch": 0.02184592644117903, "grad_norm": 1.1875, "learning_rate": 0.000499998026082006, "loss": 6.8662, "mean_token_accuracy": 0.10712903067469597, "num_tokens": 1581009.0, "step": 1005 }, { "entropy": 6.861703729629516, "epoch": 0.021954612642378923, "grad_norm": 1.1015625, "learning_rate": 0.0004999900070995136, "loss": 6.839, "mean_token_accuracy": 0.11141621619462967, "num_tokens": 1589133.0, "step": 1010 }, { "entropy": 6.793341779708863, "epoch": 0.02206329884357882, "grad_norm": 1.15625, "learning_rate": 0.0004999758199023239, "loss": 6.7883, "mean_token_accuracy": 0.1176340863108635, "num_tokens": 1596843.0, "step": 1015 }, { "entropy": 6.771137332916259, "epoch": 0.022171985044778714, "grad_norm": 1.109375, "learning_rate": 0.0004999554648793858, "loss": 6.6697, "mean_token_accuracy": 0.12174412459135056, "num_tokens": 1604287.0, "step": 1020 }, { "entropy": 6.842767333984375, "epoch": 0.02228067124597861, "grad_norm": 1.1328125, "learning_rate": 0.0004999289425887425, "loss": 6.7256, "mean_token_accuracy": 0.11848887726664543, "num_tokens": 1612995.0, "step": 1025 }, { "entropy": 6.747415065765381, "epoch": 0.022389357447178505, "grad_norm": 1.0390625, "learning_rate": 0.0004998962537575161, "loss": 6.7856, "mean_token_accuracy": 0.11309662461280823, "num_tokens": 1622090.0, "step": 1030 }, { "entropy": 6.809288883209229, "epoch": 0.022498043648378402, "grad_norm": 1.1796875, "learning_rate": 0.0004998573992818874, "loss": 6.7228, "mean_token_accuracy": 0.1198489598929882, "num_tokens": 1630697.0, "step": 1035 }, { "entropy": 6.7372705936431885, "epoch": 0.0226067298495783, "grad_norm": 1.0859375, "learning_rate": 0.0004998123802270715, "loss": 6.7425, "mean_token_accuracy": 0.11601528003811837, "num_tokens": 1638711.0, "step": 1040 }, { "entropy": 6.753994655609131, "epoch": 0.022715416050778193, "grad_norm": 1.125, "learning_rate": 0.0004997611978272886, "loss": 6.6434, "mean_token_accuracy": 0.12457199022173882, "num_tokens": 1646536.0, "step": 1045 }, { "entropy": 6.740097522735596, "epoch": 0.02282410225197809, "grad_norm": 1.046875, "learning_rate": 0.0004997038534857298, "loss": 6.7043, "mean_token_accuracy": 0.11510038226842881, "num_tokens": 1654633.0, "step": 1050 }, { "entropy": 6.73102216720581, "epoch": 0.022932788453177984, "grad_norm": 1.0859375, "learning_rate": 0.0004996403487745194, "loss": 6.7956, "mean_token_accuracy": 0.11422985568642616, "num_tokens": 1662844.0, "step": 1055 }, { "entropy": 6.789561605453491, "epoch": 0.02304147465437788, "grad_norm": 1.0703125, "learning_rate": 0.000499570685434671, "loss": 6.7318, "mean_token_accuracy": 0.12340603768825531, "num_tokens": 1670771.0, "step": 1060 }, { "entropy": 6.733522748947143, "epoch": 0.023150160855577775, "grad_norm": 1.1015625, "learning_rate": 0.0004994948653760405, "loss": 6.6846, "mean_token_accuracy": 0.11971172913908959, "num_tokens": 1678136.0, "step": 1065 }, { "entropy": 6.7756870746612545, "epoch": 0.023258847056777672, "grad_norm": 1.1875, "learning_rate": 0.0004994128906772729, "loss": 6.6925, "mean_token_accuracy": 0.11457556933164596, "num_tokens": 1686262.0, "step": 1070 }, { "entropy": 6.733363199234009, "epoch": 0.023367533257977566, "grad_norm": 1.171875, "learning_rate": 0.000499324763585746, "loss": 6.7026, "mean_token_accuracy": 0.12492116540670395, "num_tokens": 1693674.0, "step": 1075 }, { "entropy": 6.771343755722046, "epoch": 0.023476219459177463, "grad_norm": 1.046875, "learning_rate": 0.0004992304865175085, "loss": 6.7377, "mean_token_accuracy": 0.11399596929550171, "num_tokens": 1701470.0, "step": 1080 }, { "entropy": 6.687263298034668, "epoch": 0.02358490566037736, "grad_norm": 1.421875, "learning_rate": 0.0004991300620572138, "loss": 6.6237, "mean_token_accuracy": 0.12396905422210694, "num_tokens": 1708849.0, "step": 1085 }, { "entropy": 6.770354318618774, "epoch": 0.023693591861577254, "grad_norm": 1.2109375, "learning_rate": 0.0004990234929580494, "loss": 6.6882, "mean_token_accuracy": 0.12379547283053398, "num_tokens": 1716360.0, "step": 1090 }, { "entropy": 6.719215774536133, "epoch": 0.02380227806277715, "grad_norm": 1.0859375, "learning_rate": 0.0004989107821416609, "loss": 6.7194, "mean_token_accuracy": 0.11905450150370597, "num_tokens": 1724218.0, "step": 1095 }, { "entropy": 6.804384231567383, "epoch": 0.023910964263977045, "grad_norm": 1.0625, "learning_rate": 0.0004987919326980723, "loss": 6.7272, "mean_token_accuracy": 0.11393096148967743, "num_tokens": 1732431.0, "step": 1100 }, { "entropy": 6.6787989139556885, "epoch": 0.024019650465176942, "grad_norm": 1.0390625, "learning_rate": 0.0004986669478856011, "loss": 6.7156, "mean_token_accuracy": 0.11123198568820954, "num_tokens": 1740466.0, "step": 1105 }, { "entropy": 6.843336868286133, "epoch": 0.024128336666376836, "grad_norm": 1.2265625, "learning_rate": 0.0004985358311307688, "loss": 6.7396, "mean_token_accuracy": 0.1168380431830883, "num_tokens": 1747952.0, "step": 1110 }, { "entropy": 6.669610834121704, "epoch": 0.024237022867576733, "grad_norm": 1.125, "learning_rate": 0.0004983985860282081, "loss": 6.7167, "mean_token_accuracy": 0.12077742591500282, "num_tokens": 1755903.0, "step": 1115 }, { "entropy": 6.817348575592041, "epoch": 0.024345709068776627, "grad_norm": 1.0234375, "learning_rate": 0.0004982552163405623, "loss": 6.8025, "mean_token_accuracy": 0.11085736006498337, "num_tokens": 1764451.0, "step": 1120 }, { "entropy": 6.821982717514038, "epoch": 0.024454395269976524, "grad_norm": 0.9921875, "learning_rate": 0.0004981057259983839, "loss": 6.8682, "mean_token_accuracy": 0.11098600178956985, "num_tokens": 1773573.0, "step": 1125 }, { "entropy": 6.814310121536255, "epoch": 0.024563081471176418, "grad_norm": 1.0390625, "learning_rate": 0.0004979501191000262, "loss": 6.7621, "mean_token_accuracy": 0.11357782185077667, "num_tokens": 1781176.0, "step": 1130 }, { "entropy": 6.854786062240601, "epoch": 0.024671767672376315, "grad_norm": 1.1640625, "learning_rate": 0.0004977883999115311, "loss": 6.7348, "mean_token_accuracy": 0.11998602896928787, "num_tokens": 1788118.0, "step": 1135 }, { "entropy": 6.704822015762329, "epoch": 0.024780453873576212, "grad_norm": 1.0703125, "learning_rate": 0.0004976205728665113, "loss": 6.7596, "mean_token_accuracy": 0.12081285044550896, "num_tokens": 1797245.0, "step": 1140 }, { "entropy": 6.7488603591918945, "epoch": 0.024889140074776106, "grad_norm": 1.1015625, "learning_rate": 0.0004974466425660307, "loss": 6.7508, "mean_token_accuracy": 0.10823504626750946, "num_tokens": 1806358.0, "step": 1145 }, { "entropy": 6.78481707572937, "epoch": 0.024997826275976003, "grad_norm": 1.0078125, "learning_rate": 0.0004972666137784759, "loss": 6.7131, "mean_token_accuracy": 0.12163210511207581, "num_tokens": 1814500.0, "step": 1150 }, { "entropy": 6.817404508590698, "epoch": 0.025106512477175897, "grad_norm": 1.171875, "learning_rate": 0.0004970804914394271, "loss": 6.7377, "mean_token_accuracy": 0.11625442504882813, "num_tokens": 1821983.0, "step": 1155 }, { "entropy": 6.750685548782348, "epoch": 0.025215198678375794, "grad_norm": 1.1015625, "learning_rate": 0.0004968882806515225, "loss": 6.7311, "mean_token_accuracy": 0.11820982620120049, "num_tokens": 1829416.0, "step": 1160 }, { "entropy": 6.63856954574585, "epoch": 0.025323884879575688, "grad_norm": 1.28125, "learning_rate": 0.0004966899866843177, "loss": 6.6535, "mean_token_accuracy": 0.12064194157719613, "num_tokens": 1836888.0, "step": 1165 }, { "entropy": 6.7434063911437985, "epoch": 0.025432571080775585, "grad_norm": 1.0390625, "learning_rate": 0.000496485614974142, "loss": 6.6959, "mean_token_accuracy": 0.11727289259433746, "num_tokens": 1845318.0, "step": 1170 }, { "entropy": 6.721282291412353, "epoch": 0.02554125728197548, "grad_norm": 1.0859375, "learning_rate": 0.0004962751711239492, "loss": 6.7254, "mean_token_accuracy": 0.11171131953597069, "num_tokens": 1855005.0, "step": 1175 }, { "entropy": 6.7714166164398195, "epoch": 0.025649943483175376, "grad_norm": 1.1015625, "learning_rate": 0.0004960586609031636, "loss": 6.6286, "mean_token_accuracy": 0.11785526797175408, "num_tokens": 1863104.0, "step": 1180 }, { "entropy": 6.647221803665161, "epoch": 0.025758629684375273, "grad_norm": 1.109375, "learning_rate": 0.0004958360902475224, "loss": 6.7371, "mean_token_accuracy": 0.12050389349460602, "num_tokens": 1870833.0, "step": 1185 }, { "entropy": 6.822182941436767, "epoch": 0.025867315885575167, "grad_norm": 1.1171875, "learning_rate": 0.0004956074652589125, "loss": 6.6016, "mean_token_accuracy": 0.12365994974970818, "num_tokens": 1877812.0, "step": 1190 }, { "entropy": 6.610793733596802, "epoch": 0.025976002086775064, "grad_norm": 1.0546875, "learning_rate": 0.0004953727922052035, "loss": 6.6732, "mean_token_accuracy": 0.12029042765498162, "num_tokens": 1886265.0, "step": 1195 }, { "entropy": 6.711217069625855, "epoch": 0.026084688287974958, "grad_norm": 1.109375, "learning_rate": 0.0004951320775200756, "loss": 6.6321, "mean_token_accuracy": 0.12245473191142082, "num_tokens": 1894378.0, "step": 1200 }, { "entropy": 6.634425687789917, "epoch": 0.026193374489174855, "grad_norm": 1.0703125, "learning_rate": 0.0004948853278028436, "loss": 6.5894, "mean_token_accuracy": 0.12096654176712036, "num_tokens": 1902298.0, "step": 1205 }, { "entropy": 6.674074411392212, "epoch": 0.02630206069037475, "grad_norm": 1.15625, "learning_rate": 0.0004946325498182755, "loss": 6.7116, "mean_token_accuracy": 0.1144709900021553, "num_tokens": 1909320.0, "step": 1210 }, { "entropy": 6.827318143844605, "epoch": 0.026410746891574646, "grad_norm": 1.15625, "learning_rate": 0.0004943737504964076, "loss": 6.6938, "mean_token_accuracy": 0.119134671241045, "num_tokens": 1917053.0, "step": 1215 }, { "entropy": 6.668541002273559, "epoch": 0.02651943309277454, "grad_norm": 1.0390625, "learning_rate": 0.000494108936932354, "loss": 6.6332, "mean_token_accuracy": 0.12302515879273415, "num_tokens": 1925725.0, "step": 1220 }, { "entropy": 6.772843980789185, "epoch": 0.026628119293974437, "grad_norm": 1.1796875, "learning_rate": 0.0004938381163861124, "loss": 6.666, "mean_token_accuracy": 0.1218823440372944, "num_tokens": 1933317.0, "step": 1225 }, { "entropy": 6.60233359336853, "epoch": 0.02673680549517433, "grad_norm": 1.2421875, "learning_rate": 0.0004935612962823645, "loss": 6.7042, "mean_token_accuracy": 0.11369993463158608, "num_tokens": 1941273.0, "step": 1230 }, { "entropy": 6.729761362075806, "epoch": 0.026845491696374228, "grad_norm": 0.9921875, "learning_rate": 0.0004932784842102739, "loss": 6.671, "mean_token_accuracy": 0.1214449904859066, "num_tokens": 1950474.0, "step": 1235 }, { "entropy": 6.670256090164185, "epoch": 0.026954177897574125, "grad_norm": 1.0234375, "learning_rate": 0.0004929896879232758, "loss": 6.7009, "mean_token_accuracy": 0.11673137396574021, "num_tokens": 1959019.0, "step": 1240 }, { "entropy": 6.690532398223877, "epoch": 0.02706286409877402, "grad_norm": 0.9921875, "learning_rate": 0.0004926949153388668, "loss": 6.568, "mean_token_accuracy": 0.12435560747981071, "num_tokens": 1967265.0, "step": 1245 }, { "entropy": 6.617759323120117, "epoch": 0.027171550299973916, "grad_norm": 1.265625, "learning_rate": 0.0004923941745383859, "loss": 6.5434, "mean_token_accuracy": 0.12447248473763466, "num_tokens": 1974239.0, "step": 1250 }, { "entropy": 6.75258617401123, "epoch": 0.02728023650117381, "grad_norm": 1.1796875, "learning_rate": 0.000492087473766794, "loss": 6.6743, "mean_token_accuracy": 0.1195609726011753, "num_tokens": 1981982.0, "step": 1255 }, { "entropy": 6.5735856056213375, "epoch": 0.027388922702373707, "grad_norm": 1.125, "learning_rate": 0.000491774821432448, "loss": 6.5964, "mean_token_accuracy": 0.12709427028894424, "num_tokens": 1989488.0, "step": 1260 }, { "entropy": 6.660828065872193, "epoch": 0.0274976089035736, "grad_norm": 0.99609375, "learning_rate": 0.0004914562261068693, "loss": 6.6906, "mean_token_accuracy": 0.11730890870094299, "num_tokens": 1997447.0, "step": 1265 }, { "entropy": 6.7316429138183596, "epoch": 0.0276062951047735, "grad_norm": 1.078125, "learning_rate": 0.0004911316965245098, "loss": 6.7033, "mean_token_accuracy": 0.1155233234167099, "num_tokens": 2006443.0, "step": 1270 }, { "entropy": 6.715520000457763, "epoch": 0.027714981305973392, "grad_norm": 1.0390625, "learning_rate": 0.000490801241582512, "loss": 6.6559, "mean_token_accuracy": 0.11586152538657188, "num_tokens": 2015339.0, "step": 1275 }, { "entropy": 6.641583824157715, "epoch": 0.02782366750717329, "grad_norm": 1.140625, "learning_rate": 0.000490464870340465, "loss": 6.5521, "mean_token_accuracy": 0.12834264934062958, "num_tokens": 2022976.0, "step": 1280 }, { "entropy": 6.611687469482422, "epoch": 0.027932353708373187, "grad_norm": 0.9453125, "learning_rate": 0.0004901225920201563, "loss": 6.6215, "mean_token_accuracy": 0.12682543843984603, "num_tokens": 2031252.0, "step": 1285 }, { "entropy": 6.703845119476318, "epoch": 0.02804103990957308, "grad_norm": 1.0625, "learning_rate": 0.000489774416005319, "loss": 6.611, "mean_token_accuracy": 0.1212866634130478, "num_tokens": 2038465.0, "step": 1290 }, { "entropy": 6.586824417114258, "epoch": 0.028149726110772978, "grad_norm": 1.046875, "learning_rate": 0.0004894203518413742, "loss": 6.5856, "mean_token_accuracy": 0.12294368520379066, "num_tokens": 2045921.0, "step": 1295 }, { "entropy": 6.655889320373535, "epoch": 0.02825841231197287, "grad_norm": 1.1640625, "learning_rate": 0.0004890604092351701, "loss": 6.5343, "mean_token_accuracy": 0.1270897440612316, "num_tokens": 2054127.0, "step": 1300 }, { "entropy": 6.691068410873413, "epoch": 0.02836709851317277, "grad_norm": 1.15625, "learning_rate": 0.000488694598054715, "loss": 6.6147, "mean_token_accuracy": 0.12068610191345215, "num_tokens": 2061889.0, "step": 1305 }, { "entropy": 6.5537497997283936, "epoch": 0.028475784714372662, "grad_norm": 1.1484375, "learning_rate": 0.0004883229283289071, "loss": 6.5846, "mean_token_accuracy": 0.12348945364356041, "num_tokens": 2069620.0, "step": 1310 }, { "entropy": 6.72159972190857, "epoch": 0.02858447091557256, "grad_norm": 1.0078125, "learning_rate": 0.00048794541024725993, "loss": 6.5326, "mean_token_accuracy": 0.13243458196520805, "num_tokens": 2077371.0, "step": 1315 }, { "entropy": 6.541279745101929, "epoch": 0.028693157116772453, "grad_norm": 1.0703125, "learning_rate": 0.0004875620541596221, "loss": 6.6154, "mean_token_accuracy": 0.12915401235222818, "num_tokens": 2085727.0, "step": 1320 }, { "entropy": 6.756937503814697, "epoch": 0.02880184331797235, "grad_norm": 1.03125, "learning_rate": 0.00048717287057589454, "loss": 6.6528, "mean_token_accuracy": 0.12067537754774094, "num_tokens": 2093858.0, "step": 1325 }, { "entropy": 6.603250503540039, "epoch": 0.028910529519172244, "grad_norm": 1.03125, "learning_rate": 0.0004867778701657417, "loss": 6.6029, "mean_token_accuracy": 0.12590081617236137, "num_tokens": 2101776.0, "step": 1330 }, { "entropy": 6.552526473999023, "epoch": 0.02901921572037214, "grad_norm": 1.171875, "learning_rate": 0.00048637706375829955, "loss": 6.5071, "mean_token_accuracy": 0.12628837302327156, "num_tokens": 2108932.0, "step": 1335 }, { "entropy": 6.61759204864502, "epoch": 0.02912790192157204, "grad_norm": 1.109375, "learning_rate": 0.000485970462341878, "loss": 6.5878, "mean_token_accuracy": 0.12770043164491654, "num_tokens": 2116786.0, "step": 1340 }, { "entropy": 6.6530732154846195, "epoch": 0.029236588122771932, "grad_norm": 1.0234375, "learning_rate": 0.00048555807706366044, "loss": 6.6136, "mean_token_accuracy": 0.11667786464095116, "num_tokens": 2124884.0, "step": 1345 }, { "entropy": 6.576787042617798, "epoch": 0.02934527432397183, "grad_norm": 1.0703125, "learning_rate": 0.00048513991922939756, "loss": 6.6245, "mean_token_accuracy": 0.12192277386784553, "num_tokens": 2132173.0, "step": 1350 }, { "entropy": 6.7595985412597654, "epoch": 0.029453960525171723, "grad_norm": 1.0390625, "learning_rate": 0.00048471600030309744, "loss": 6.5765, "mean_token_accuracy": 0.12141433283686638, "num_tokens": 2140554.0, "step": 1355 }, { "entropy": 6.474835062026978, "epoch": 0.02956264672637162, "grad_norm": 1.09375, "learning_rate": 0.00048428633190671186, "loss": 6.5187, "mean_token_accuracy": 0.12662884443998337, "num_tokens": 2148350.0, "step": 1360 }, { "entropy": 6.634714126586914, "epoch": 0.029671332927571514, "grad_norm": 1.0859375, "learning_rate": 0.0004838509258198167, "loss": 6.5471, "mean_token_accuracy": 0.1328614644706249, "num_tokens": 2156652.0, "step": 1365 }, { "entropy": 6.579633331298828, "epoch": 0.02978001912877141, "grad_norm": 1.1640625, "learning_rate": 0.00048340979397929, "loss": 6.6294, "mean_token_accuracy": 0.11975409835577011, "num_tokens": 2165406.0, "step": 1370 }, { "entropy": 6.649616336822509, "epoch": 0.029888705329971305, "grad_norm": 0.984375, "learning_rate": 0.00048296294847898386, "loss": 6.5915, "mean_token_accuracy": 0.1256055273115635, "num_tokens": 2173663.0, "step": 1375 }, { "entropy": 6.660815572738647, "epoch": 0.029997391531171202, "grad_norm": 1.1015625, "learning_rate": 0.0004825104015693934, "loss": 6.5002, "mean_token_accuracy": 0.12725673615932465, "num_tokens": 2181042.0, "step": 1380 }, { "entropy": 6.612697267532349, "epoch": 0.0301060777323711, "grad_norm": 1.1328125, "learning_rate": 0.0004820521656573208, "loss": 6.6187, "mean_token_accuracy": 0.11868590340018273, "num_tokens": 2189686.0, "step": 1385 }, { "entropy": 6.637413787841797, "epoch": 0.030214763933570993, "grad_norm": 0.95703125, "learning_rate": 0.00048158825330553505, "loss": 6.6813, "mean_token_accuracy": 0.12129974663257599, "num_tokens": 2198924.0, "step": 1390 }, { "entropy": 6.662744569778442, "epoch": 0.03032345013477089, "grad_norm": 1.0625, "learning_rate": 0.00048111867723242763, "loss": 6.6561, "mean_token_accuracy": 0.11987720131874084, "num_tokens": 2206770.0, "step": 1395 }, { "entropy": 6.626357221603394, "epoch": 0.030432136335970784, "grad_norm": 1.265625, "learning_rate": 0.0004806434503116637, "loss": 6.5734, "mean_token_accuracy": 0.12084893509745598, "num_tokens": 2214398.0, "step": 1400 }, { "entropy": 6.651124620437622, "epoch": 0.03054082253717068, "grad_norm": 1.03125, "learning_rate": 0.0004801625855718296, "loss": 6.5953, "mean_token_accuracy": 0.12142176851630211, "num_tokens": 2222338.0, "step": 1405 }, { "entropy": 6.602102756500244, "epoch": 0.030649508738370575, "grad_norm": 1.2421875, "learning_rate": 0.00047967609619607477, "loss": 6.5087, "mean_token_accuracy": 0.13247907012701035, "num_tokens": 2229815.0, "step": 1410 }, { "entropy": 6.539565515518189, "epoch": 0.030758194939570473, "grad_norm": 1.046875, "learning_rate": 0.0004791839955217513, "loss": 6.4888, "mean_token_accuracy": 0.1223328985273838, "num_tokens": 2237663.0, "step": 1415 }, { "entropy": 6.608070755004883, "epoch": 0.030866881140770366, "grad_norm": 1.1875, "learning_rate": 0.00047868629704004786, "loss": 6.5472, "mean_token_accuracy": 0.13164723366498948, "num_tokens": 2245703.0, "step": 1420 }, { "entropy": 6.681449699401855, "epoch": 0.030975567341970264, "grad_norm": 1.09375, "learning_rate": 0.00047818301439561965, "loss": 6.5276, "mean_token_accuracy": 0.12454903274774551, "num_tokens": 2253178.0, "step": 1425 }, { "entropy": 6.496039152145386, "epoch": 0.03108425354317016, "grad_norm": 1.0859375, "learning_rate": 0.00047767416138621454, "loss": 6.5428, "mean_token_accuracy": 0.12364711612462997, "num_tokens": 2260564.0, "step": 1430 }, { "entropy": 6.588859939575196, "epoch": 0.031192939744370055, "grad_norm": 1.0859375, "learning_rate": 0.000477159751962295, "loss": 6.5566, "mean_token_accuracy": 0.11912669464945794, "num_tokens": 2268988.0, "step": 1435 }, { "entropy": 6.649993419647217, "epoch": 0.03130162594556995, "grad_norm": 1.0703125, "learning_rate": 0.00047663980022665507, "loss": 6.508, "mean_token_accuracy": 0.12953050956130027, "num_tokens": 2276400.0, "step": 1440 }, { "entropy": 6.583322143554687, "epoch": 0.03141031214676985, "grad_norm": 1.0859375, "learning_rate": 0.00047611432043403437, "loss": 6.5249, "mean_token_accuracy": 0.1304257981479168, "num_tokens": 2284540.0, "step": 1445 }, { "entropy": 6.596342277526856, "epoch": 0.03151899834796974, "grad_norm": 0.99609375, "learning_rate": 0.0004755833269907267, "loss": 6.5765, "mean_token_accuracy": 0.12414052039384842, "num_tokens": 2293655.0, "step": 1450 }, { "entropy": 6.667462110519409, "epoch": 0.031627684549169637, "grad_norm": 0.953125, "learning_rate": 0.0004750468344541857, "loss": 6.5642, "mean_token_accuracy": 0.1251768171787262, "num_tokens": 2302647.0, "step": 1455 }, { "entropy": 6.515790939331055, "epoch": 0.03173637075036953, "grad_norm": 0.94140625, "learning_rate": 0.00047450485753262525, "loss": 6.5314, "mean_token_accuracy": 0.12692836448550224, "num_tokens": 2311064.0, "step": 1460 }, { "entropy": 6.6385047912597654, "epoch": 0.03184505695156943, "grad_norm": 1.015625, "learning_rate": 0.00047395741108461633, "loss": 6.5232, "mean_token_accuracy": 0.13005399256944655, "num_tokens": 2318608.0, "step": 1465 }, { "entropy": 6.426021480560303, "epoch": 0.031953743152769325, "grad_norm": 1.265625, "learning_rate": 0.00047340451011867985, "loss": 6.4206, "mean_token_accuracy": 0.1302155315876007, "num_tokens": 2326806.0, "step": 1470 }, { "entropy": 6.695640182495117, "epoch": 0.03206242935396922, "grad_norm": 1.2578125, "learning_rate": 0.00047284616979287515, "loss": 6.5783, "mean_token_accuracy": 0.12959000319242478, "num_tokens": 2334568.0, "step": 1475 }, { "entropy": 6.571360015869141, "epoch": 0.03217111555516912, "grad_norm": 1.109375, "learning_rate": 0.00047228240541438433, "loss": 6.5223, "mean_token_accuracy": 0.12900073900818826, "num_tokens": 2342361.0, "step": 1480 }, { "entropy": 6.571485424041748, "epoch": 0.03227980175636901, "grad_norm": 1.1796875, "learning_rate": 0.00047171323243909257, "loss": 6.4626, "mean_token_accuracy": 0.13145333901047707, "num_tokens": 2349593.0, "step": 1485 }, { "entropy": 6.519814300537109, "epoch": 0.03238848795756891, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.5831, "mean_token_accuracy": 0.12430679574608802, "num_tokens": 2357192.0, "step": 1490 }, { "entropy": 6.629279899597168, "epoch": 0.0324971741587688, "grad_norm": 1.1796875, "learning_rate": 0.0004705587232626164, "loss": 6.4638, "mean_token_accuracy": 0.12320095226168633, "num_tokens": 2365248.0, "step": 1495 }, { "entropy": 6.538986921310425, "epoch": 0.0326058603599687, "grad_norm": 1.046875, "learning_rate": 0.00046997341871288424, "loss": 6.4738, "mean_token_accuracy": 0.12518679574131966, "num_tokens": 2373505.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 3908324560896000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }