{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.05434310059994783, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.692033958435058, "epoch": 0.00010868620119989566, "grad_norm": 14.125, "learning_rate": 2e-06, "loss": 10.7755, "mean_token_accuracy": 0.0, "num_tokens": 7936.0, "step": 5 }, { "entropy": 10.691999912261963, "epoch": 0.00021737240239979132, "grad_norm": 15.1875, "learning_rate": 4.5e-06, "loss": 10.6915, "mean_token_accuracy": 0.0, "num_tokens": 15561.0, "step": 10 }, { "entropy": 10.690576362609864, "epoch": 0.000326058603599687, "grad_norm": 10.0, "learning_rate": 7e-06, "loss": 10.4237, "mean_token_accuracy": 0.03714140746742487, "num_tokens": 23101.0, "step": 15 }, { "entropy": 10.662552452087402, "epoch": 0.00043474480479958265, "grad_norm": 6.4375, "learning_rate": 9.5e-06, "loss": 10.13, "mean_token_accuracy": 0.053733503073453905, "num_tokens": 31122.0, "step": 20 }, { "entropy": 10.53134651184082, "epoch": 0.0005434310059994783, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 9.8666, "mean_token_accuracy": 0.049097494408488276, "num_tokens": 39424.0, "step": 25 }, { "entropy": 10.499347591400147, "epoch": 0.000652117207199374, "grad_norm": 3.40625, "learning_rate": 1.4500000000000002e-05, "loss": 9.6573, "mean_token_accuracy": 0.05333031602203846, "num_tokens": 46113.0, "step": 30 }, { "entropy": 10.45414752960205, "epoch": 0.0007608034083992696, "grad_norm": 4.03125, "learning_rate": 1.7000000000000003e-05, "loss": 9.5644, "mean_token_accuracy": 0.050568538904190066, "num_tokens": 53459.0, "step": 35 }, { "entropy": 10.488454818725586, "epoch": 0.0008694896095991653, "grad_norm": 2.875, "learning_rate": 1.95e-05, "loss": 9.5746, "mean_token_accuracy": 0.054808919131755826, "num_tokens": 61325.0, "step": 40 }, { "entropy": 10.44335298538208, "epoch": 0.0009781758107990609, "grad_norm": 2.578125, "learning_rate": 2.2e-05, "loss": 9.5243, "mean_token_accuracy": 0.05896916501224041, "num_tokens": 68741.0, "step": 45 }, { "entropy": 10.389917469024658, "epoch": 0.0010868620119989566, "grad_norm": 2.703125, "learning_rate": 2.4500000000000003e-05, "loss": 9.4498, "mean_token_accuracy": 0.07500801645219327, "num_tokens": 76827.0, "step": 50 }, { "entropy": 10.32972011566162, "epoch": 0.0011955482131988523, "grad_norm": 2.28125, "learning_rate": 2.7e-05, "loss": 9.4108, "mean_token_accuracy": 0.06764259599149228, "num_tokens": 84543.0, "step": 55 }, { "entropy": 10.223662376403809, "epoch": 0.001304234414398748, "grad_norm": 2.1875, "learning_rate": 2.95e-05, "loss": 9.3763, "mean_token_accuracy": 0.06775642447173595, "num_tokens": 92505.0, "step": 60 }, { "entropy": 10.253492069244384, "epoch": 0.0014129206155986437, "grad_norm": 2.046875, "learning_rate": 3.2e-05, "loss": 9.292, "mean_token_accuracy": 0.07278058938682079, "num_tokens": 100004.0, "step": 65 }, { "entropy": 10.179506492614745, "epoch": 0.0015216068167985392, "grad_norm": 2.125, "learning_rate": 3.4500000000000005e-05, "loss": 9.1464, "mean_token_accuracy": 0.07609819024801254, "num_tokens": 106865.0, "step": 70 }, { "entropy": 10.167201709747314, "epoch": 0.0016302930179984349, "grad_norm": 1.828125, "learning_rate": 3.7e-05, "loss": 9.184, "mean_token_accuracy": 0.07288527600467205, "num_tokens": 115745.0, "step": 75 }, { "entropy": 10.253772735595703, "epoch": 0.0017389792191983306, "grad_norm": 1.9609375, "learning_rate": 3.95e-05, "loss": 9.1019, "mean_token_accuracy": 0.07272576205432416, "num_tokens": 124724.0, "step": 80 }, { "entropy": 10.141531181335449, "epoch": 0.0018476654203982263, "grad_norm": 1.921875, "learning_rate": 4.2000000000000004e-05, "loss": 8.9728, "mean_token_accuracy": 0.07559517920017242, "num_tokens": 131933.0, "step": 85 }, { "entropy": 10.05212688446045, "epoch": 0.0019563516215981218, "grad_norm": 2.125, "learning_rate": 4.45e-05, "loss": 8.9554, "mean_token_accuracy": 0.07529733926057816, "num_tokens": 139726.0, "step": 90 }, { "entropy": 10.118945980072022, "epoch": 0.0020650378227980177, "grad_norm": 1.9453125, "learning_rate": 4.7000000000000004e-05, "loss": 8.8937, "mean_token_accuracy": 0.07433236017823219, "num_tokens": 147276.0, "step": 95 }, { "entropy": 10.070981788635255, "epoch": 0.002173724023997913, "grad_norm": 1.671875, "learning_rate": 4.9500000000000004e-05, "loss": 8.8032, "mean_token_accuracy": 0.07382776252925397, "num_tokens": 155449.0, "step": 100 }, { "entropy": 9.931837844848634, "epoch": 0.002282410225197809, "grad_norm": 1.828125, "learning_rate": 5.2e-05, "loss": 8.6788, "mean_token_accuracy": 0.06880230605602264, "num_tokens": 163547.0, "step": 105 }, { "entropy": 9.92315607070923, "epoch": 0.0023910964263977046, "grad_norm": 1.71875, "learning_rate": 5.45e-05, "loss": 8.5975, "mean_token_accuracy": 0.0769424244761467, "num_tokens": 171777.0, "step": 110 }, { "entropy": 9.855748653411865, "epoch": 0.0024997826275976, "grad_norm": 1.671875, "learning_rate": 5.7e-05, "loss": 8.4659, "mean_token_accuracy": 0.0743311032652855, "num_tokens": 179337.0, "step": 115 }, { "entropy": 9.745928478240966, "epoch": 0.002608468828797496, "grad_norm": 1.796875, "learning_rate": 5.9499999999999996e-05, "loss": 8.3905, "mean_token_accuracy": 0.07685245871543885, "num_tokens": 186939.0, "step": 120 }, { "entropy": 9.60959987640381, "epoch": 0.0027171550299973915, "grad_norm": 1.3125, "learning_rate": 6.2e-05, "loss": 8.2612, "mean_token_accuracy": 0.07991581708192826, "num_tokens": 194755.0, "step": 125 }, { "entropy": 9.507084274291993, "epoch": 0.0028258412311972874, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.1596, "mean_token_accuracy": 0.07951611280441284, "num_tokens": 202610.0, "step": 130 }, { "entropy": 9.229420471191407, "epoch": 0.002934527432397183, "grad_norm": 1.546875, "learning_rate": 6.7e-05, "loss": 8.0589, "mean_token_accuracy": 0.07813627794384956, "num_tokens": 211305.0, "step": 135 }, { "entropy": 9.083441066741944, "epoch": 0.0030432136335970784, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 7.9516, "mean_token_accuracy": 0.07972251251339912, "num_tokens": 218447.0, "step": 140 }, { "entropy": 8.977557182312012, "epoch": 0.0031518998347969743, "grad_norm": 1.328125, "learning_rate": 7.2e-05, "loss": 7.9735, "mean_token_accuracy": 0.07708753384649754, "num_tokens": 226108.0, "step": 145 }, { "entropy": 8.854303741455078, "epoch": 0.0032605860359968698, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 7.9018, "mean_token_accuracy": 0.0749433733522892, "num_tokens": 233213.0, "step": 150 }, { "entropy": 8.737026977539063, "epoch": 0.0033692722371967657, "grad_norm": 1.34375, "learning_rate": 7.7e-05, "loss": 7.9657, "mean_token_accuracy": 0.07061286456882954, "num_tokens": 241483.0, "step": 155 }, { "entropy": 8.660515594482423, "epoch": 0.003477958438396661, "grad_norm": 1.28125, "learning_rate": 7.950000000000001e-05, "loss": 7.8216, "mean_token_accuracy": 0.08022509105503559, "num_tokens": 249537.0, "step": 160 }, { "entropy": 8.48324089050293, "epoch": 0.0035866446395965567, "grad_norm": 1.1484375, "learning_rate": 8.2e-05, "loss": 7.7574, "mean_token_accuracy": 0.08265799134969712, "num_tokens": 256775.0, "step": 165 }, { "entropy": 8.382307147979736, "epoch": 0.0036953308407964526, "grad_norm": 1.40625, "learning_rate": 8.450000000000001e-05, "loss": 7.7628, "mean_token_accuracy": 0.08266141265630722, "num_tokens": 263931.0, "step": 170 }, { "entropy": 8.312588787078857, "epoch": 0.003804017041996348, "grad_norm": 1.1953125, "learning_rate": 8.7e-05, "loss": 7.7557, "mean_token_accuracy": 0.08323334604501724, "num_tokens": 272293.0, "step": 175 }, { "entropy": 8.368490505218507, "epoch": 0.0039127032431962435, "grad_norm": 1.390625, "learning_rate": 8.95e-05, "loss": 7.7964, "mean_token_accuracy": 0.07600408792495728, "num_tokens": 280599.0, "step": 180 }, { "entropy": 8.208444499969483, "epoch": 0.00402138944439614, "grad_norm": 1.4921875, "learning_rate": 9.2e-05, "loss": 7.7604, "mean_token_accuracy": 0.07719066366553307, "num_tokens": 287961.0, "step": 185 }, { "entropy": 8.142381763458252, "epoch": 0.004130075645596035, "grad_norm": 1.8671875, "learning_rate": 9.45e-05, "loss": 7.684, "mean_token_accuracy": 0.08424306884407998, "num_tokens": 297280.0, "step": 190 }, { "entropy": 8.162713718414306, "epoch": 0.004238761846795931, "grad_norm": 1.2421875, "learning_rate": 9.7e-05, "loss": 7.7526, "mean_token_accuracy": 0.08235807195305825, "num_tokens": 304699.0, "step": 195 }, { "entropy": 8.149117755889893, "epoch": 0.004347448047995826, "grad_norm": 1.125, "learning_rate": 9.95e-05, "loss": 7.6864, "mean_token_accuracy": 0.08296664133667946, "num_tokens": 313026.0, "step": 200 }, { "entropy": 8.115727186203003, "epoch": 0.004456134249195722, "grad_norm": 1.140625, "learning_rate": 0.000102, "loss": 7.7092, "mean_token_accuracy": 0.08166395723819733, "num_tokens": 320738.0, "step": 205 }, { "entropy": 8.076230096817017, "epoch": 0.004564820450395618, "grad_norm": 1.2265625, "learning_rate": 0.00010449999999999999, "loss": 7.6861, "mean_token_accuracy": 0.07836256250739097, "num_tokens": 328740.0, "step": 210 }, { "entropy": 8.025853300094605, "epoch": 0.004673506651595514, "grad_norm": 1.09375, "learning_rate": 0.000107, "loss": 7.6627, "mean_token_accuracy": 0.08186743408441544, "num_tokens": 336819.0, "step": 215 }, { "entropy": 8.132151794433593, "epoch": 0.004782192852795409, "grad_norm": 1.234375, "learning_rate": 0.0001095, "loss": 7.5969, "mean_token_accuracy": 0.08840056881308556, "num_tokens": 343978.0, "step": 220 }, { "entropy": 8.009299278259277, "epoch": 0.004890879053995305, "grad_norm": 1.2265625, "learning_rate": 0.000112, "loss": 7.6897, "mean_token_accuracy": 0.07886088080704212, "num_tokens": 353783.0, "step": 225 }, { "entropy": 7.969748306274414, "epoch": 0.0049995652551952, "grad_norm": 1.34375, "learning_rate": 0.0001145, "loss": 7.5909, "mean_token_accuracy": 0.08582306802272796, "num_tokens": 361371.0, "step": 230 }, { "entropy": 7.9828167915344235, "epoch": 0.0051082514563950965, "grad_norm": 1.3984375, "learning_rate": 0.00011700000000000001, "loss": 7.6185, "mean_token_accuracy": 0.07745145447552204, "num_tokens": 367717.0, "step": 235 }, { "entropy": 8.051587057113647, "epoch": 0.005216937657594992, "grad_norm": 1.203125, "learning_rate": 0.00011949999999999999, "loss": 7.6177, "mean_token_accuracy": 0.08022010251879692, "num_tokens": 375529.0, "step": 240 }, { "entropy": 7.905487108230591, "epoch": 0.0053256238587948874, "grad_norm": 1.1640625, "learning_rate": 0.000122, "loss": 7.5073, "mean_token_accuracy": 0.08242316544055939, "num_tokens": 383031.0, "step": 245 }, { "entropy": 7.966064023971557, "epoch": 0.005434310059994783, "grad_norm": 1.1953125, "learning_rate": 0.0001245, "loss": 7.6472, "mean_token_accuracy": 0.0840654157102108, "num_tokens": 391914.0, "step": 250 }, { "entropy": 7.939682960510254, "epoch": 0.005542996261194678, "grad_norm": 1.34375, "learning_rate": 0.000127, "loss": 7.6111, "mean_token_accuracy": 0.08445862084627151, "num_tokens": 399447.0, "step": 255 }, { "entropy": 7.95916223526001, "epoch": 0.005651682462394575, "grad_norm": 1.5078125, "learning_rate": 0.0001295, "loss": 7.6053, "mean_token_accuracy": 0.08623345196247101, "num_tokens": 407636.0, "step": 260 }, { "entropy": 7.863192081451416, "epoch": 0.00576036866359447, "grad_norm": 1.25, "learning_rate": 0.000132, "loss": 7.5498, "mean_token_accuracy": 0.08252564668655396, "num_tokens": 416650.0, "step": 265 }, { "entropy": 7.940821886062622, "epoch": 0.005869054864794366, "grad_norm": 1.71875, "learning_rate": 0.00013450000000000002, "loss": 7.4851, "mean_token_accuracy": 0.08535419404506683, "num_tokens": 424619.0, "step": 270 }, { "entropy": 7.923966264724731, "epoch": 0.005977741065994261, "grad_norm": 1.5546875, "learning_rate": 0.00013700000000000002, "loss": 7.5731, "mean_token_accuracy": 0.08694756105542183, "num_tokens": 432854.0, "step": 275 }, { "entropy": 7.861378288269043, "epoch": 0.006086427267194157, "grad_norm": 1.3515625, "learning_rate": 0.0001395, "loss": 7.5646, "mean_token_accuracy": 0.08049703910946845, "num_tokens": 440472.0, "step": 280 }, { "entropy": 7.979065895080566, "epoch": 0.006195113468394053, "grad_norm": 1.1953125, "learning_rate": 0.00014199999999999998, "loss": 7.4921, "mean_token_accuracy": 0.08637023121118545, "num_tokens": 447843.0, "step": 285 }, { "entropy": 7.926018571853637, "epoch": 0.0063037996695939486, "grad_norm": 1.4921875, "learning_rate": 0.0001445, "loss": 7.6005, "mean_token_accuracy": 0.08329573571681977, "num_tokens": 455272.0, "step": 290 }, { "entropy": 7.811395597457886, "epoch": 0.006412485870793844, "grad_norm": 1.3359375, "learning_rate": 0.000147, "loss": 7.4287, "mean_token_accuracy": 0.08994799107313156, "num_tokens": 462190.0, "step": 295 }, { "entropy": 7.937566328048706, "epoch": 0.0065211720719937395, "grad_norm": 1.2578125, "learning_rate": 0.0001495, "loss": 7.5291, "mean_token_accuracy": 0.08383448868989944, "num_tokens": 470562.0, "step": 300 }, { "entropy": 7.770080280303955, "epoch": 0.006629858273193635, "grad_norm": 1.140625, "learning_rate": 0.000152, "loss": 7.433, "mean_token_accuracy": 0.09061657935380936, "num_tokens": 478523.0, "step": 305 }, { "entropy": 7.844554090499878, "epoch": 0.006738544474393531, "grad_norm": 1.3359375, "learning_rate": 0.00015450000000000001, "loss": 7.517, "mean_token_accuracy": 0.08662905022501946, "num_tokens": 486759.0, "step": 310 }, { "entropy": 7.828848934173584, "epoch": 0.006847230675593427, "grad_norm": 1.2421875, "learning_rate": 0.000157, "loss": 7.5283, "mean_token_accuracy": 0.08165703043341636, "num_tokens": 495168.0, "step": 315 }, { "entropy": 7.823043441772461, "epoch": 0.006955916876793322, "grad_norm": 1.2421875, "learning_rate": 0.0001595, "loss": 7.4207, "mean_token_accuracy": 0.08956636488437653, "num_tokens": 503490.0, "step": 320 }, { "entropy": 7.771451330184936, "epoch": 0.007064603077993218, "grad_norm": 1.171875, "learning_rate": 0.000162, "loss": 7.5539, "mean_token_accuracy": 0.08244621530175208, "num_tokens": 512522.0, "step": 325 }, { "entropy": 7.877453756332398, "epoch": 0.007173289279193113, "grad_norm": 1.2578125, "learning_rate": 0.00016450000000000001, "loss": 7.4913, "mean_token_accuracy": 0.08120876513421535, "num_tokens": 521100.0, "step": 330 }, { "entropy": 7.771992826461792, "epoch": 0.00728197548039301, "grad_norm": 1.1875, "learning_rate": 0.00016700000000000002, "loss": 7.396, "mean_token_accuracy": 0.0948154278099537, "num_tokens": 528027.0, "step": 335 }, { "entropy": 7.7505473613739015, "epoch": 0.007390661681592905, "grad_norm": 1.390625, "learning_rate": 0.00016950000000000003, "loss": 7.3994, "mean_token_accuracy": 0.08797064200043678, "num_tokens": 535541.0, "step": 340 }, { "entropy": 7.820106267929077, "epoch": 0.007499347882792801, "grad_norm": 1.1484375, "learning_rate": 0.00017199999999999998, "loss": 7.4177, "mean_token_accuracy": 0.08866829052567482, "num_tokens": 543253.0, "step": 345 }, { "entropy": 7.8131262302398685, "epoch": 0.007608034083992696, "grad_norm": 1.515625, "learning_rate": 0.00017449999999999999, "loss": 7.4312, "mean_token_accuracy": 0.08869538456201553, "num_tokens": 550414.0, "step": 350 }, { "entropy": 7.678452491760254, "epoch": 0.007716720285192592, "grad_norm": 1.2265625, "learning_rate": 0.000177, "loss": 7.4866, "mean_token_accuracy": 0.08567069470882416, "num_tokens": 558554.0, "step": 355 }, { "entropy": 7.860786962509155, "epoch": 0.007825406486392487, "grad_norm": 1.1640625, "learning_rate": 0.0001795, "loss": 7.4562, "mean_token_accuracy": 0.0866042397916317, "num_tokens": 566297.0, "step": 360 }, { "entropy": 7.691314792633056, "epoch": 0.007934092687592383, "grad_norm": 1.3359375, "learning_rate": 0.000182, "loss": 7.399, "mean_token_accuracy": 0.09093262627720833, "num_tokens": 574600.0, "step": 365 }, { "entropy": 7.761751461029053, "epoch": 0.00804277888879228, "grad_norm": 1.03125, "learning_rate": 0.0001845, "loss": 7.4278, "mean_token_accuracy": 0.08792822286486626, "num_tokens": 583349.0, "step": 370 }, { "entropy": 7.841218614578247, "epoch": 0.008151465089992175, "grad_norm": 1.3671875, "learning_rate": 0.000187, "loss": 7.3269, "mean_token_accuracy": 0.08868191167712211, "num_tokens": 590169.0, "step": 375 }, { "entropy": 7.639244318008423, "epoch": 0.00826015129119207, "grad_norm": 1.296875, "learning_rate": 0.0001895, "loss": 7.2957, "mean_token_accuracy": 0.09457754641771317, "num_tokens": 597508.0, "step": 380 }, { "entropy": 7.685401201248169, "epoch": 0.008368837492391966, "grad_norm": 1.1640625, "learning_rate": 0.000192, "loss": 7.375, "mean_token_accuracy": 0.09122001230716706, "num_tokens": 605412.0, "step": 385 }, { "entropy": 7.795647668838501, "epoch": 0.008477523693591862, "grad_norm": 1.3359375, "learning_rate": 0.0001945, "loss": 7.3872, "mean_token_accuracy": 0.09148699790239334, "num_tokens": 613512.0, "step": 390 }, { "entropy": 7.641701507568359, "epoch": 0.008586209894791757, "grad_norm": 1.078125, "learning_rate": 0.00019700000000000002, "loss": 7.3275, "mean_token_accuracy": 0.09618531838059426, "num_tokens": 621117.0, "step": 395 }, { "entropy": 7.689551591873169, "epoch": 0.008694896095991653, "grad_norm": 1.1328125, "learning_rate": 0.00019950000000000002, "loss": 7.3832, "mean_token_accuracy": 0.08407204449176789, "num_tokens": 629970.0, "step": 400 }, { "entropy": 7.637691450119019, "epoch": 0.008803582297191548, "grad_norm": 1.375, "learning_rate": 0.000202, "loss": 7.3219, "mean_token_accuracy": 0.09131594821810722, "num_tokens": 638184.0, "step": 405 }, { "entropy": 7.5977555274963375, "epoch": 0.008912268498391444, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 7.2837, "mean_token_accuracy": 0.08929966911673545, "num_tokens": 645953.0, "step": 410 }, { "entropy": 7.6464704990386965, "epoch": 0.00902095469959134, "grad_norm": 1.25, "learning_rate": 0.000207, "loss": 7.3305, "mean_token_accuracy": 0.08722574934363365, "num_tokens": 654291.0, "step": 415 }, { "entropy": 7.672793436050415, "epoch": 0.009129640900791236, "grad_norm": 1.21875, "learning_rate": 0.0002095, "loss": 7.3299, "mean_token_accuracy": 0.08851959705352783, "num_tokens": 661393.0, "step": 420 }, { "entropy": 7.531088209152221, "epoch": 0.009238327101991132, "grad_norm": 1.4296875, "learning_rate": 0.000212, "loss": 7.3139, "mean_token_accuracy": 0.0963095597922802, "num_tokens": 669913.0, "step": 425 }, { "entropy": 7.74607515335083, "epoch": 0.009347013303191027, "grad_norm": 1.1953125, "learning_rate": 0.0002145, "loss": 7.3663, "mean_token_accuracy": 0.09074652194976807, "num_tokens": 678745.0, "step": 430 }, { "entropy": 7.417545986175537, "epoch": 0.009455699504390923, "grad_norm": 1.265625, "learning_rate": 0.00021700000000000002, "loss": 7.2468, "mean_token_accuracy": 0.09117906540632248, "num_tokens": 686191.0, "step": 435 }, { "entropy": 7.690976524353028, "epoch": 0.009564385705590818, "grad_norm": 2.109375, "learning_rate": 0.0002195, "loss": 7.2921, "mean_token_accuracy": 0.08830784261226654, "num_tokens": 694776.0, "step": 440 }, { "entropy": 7.471565675735474, "epoch": 0.009673071906790714, "grad_norm": 1.1953125, "learning_rate": 0.000222, "loss": 7.2498, "mean_token_accuracy": 0.08958808556199074, "num_tokens": 702481.0, "step": 445 }, { "entropy": 7.601398086547851, "epoch": 0.00978175810799061, "grad_norm": 1.265625, "learning_rate": 0.0002245, "loss": 7.2892, "mean_token_accuracy": 0.08943363651633263, "num_tokens": 710304.0, "step": 450 }, { "entropy": 7.6107948303222654, "epoch": 0.009890444309190505, "grad_norm": 1.2734375, "learning_rate": 0.00022700000000000002, "loss": 7.2655, "mean_token_accuracy": 0.0950858935713768, "num_tokens": 718462.0, "step": 455 }, { "entropy": 7.4872644424438475, "epoch": 0.0099991305103904, "grad_norm": 1.0625, "learning_rate": 0.00022950000000000002, "loss": 7.2699, "mean_token_accuracy": 0.09967489093542099, "num_tokens": 726798.0, "step": 460 }, { "entropy": 7.636318254470825, "epoch": 0.010107816711590296, "grad_norm": 1.1328125, "learning_rate": 0.00023200000000000003, "loss": 7.2289, "mean_token_accuracy": 0.09415075033903123, "num_tokens": 735054.0, "step": 465 }, { "entropy": 7.467661046981812, "epoch": 0.010216502912790193, "grad_norm": 1.34375, "learning_rate": 0.00023449999999999998, "loss": 7.2689, "mean_token_accuracy": 0.08854644820094108, "num_tokens": 743701.0, "step": 470 }, { "entropy": 7.5553264141082765, "epoch": 0.010325189113990088, "grad_norm": 1.2421875, "learning_rate": 0.000237, "loss": 7.3436, "mean_token_accuracy": 0.08918146193027496, "num_tokens": 751548.0, "step": 475 }, { "entropy": 7.606575393676758, "epoch": 0.010433875315189984, "grad_norm": 1.359375, "learning_rate": 0.0002395, "loss": 7.1245, "mean_token_accuracy": 0.09939143806695938, "num_tokens": 758580.0, "step": 480 }, { "entropy": 7.376218938827515, "epoch": 0.01054256151638988, "grad_norm": 1.375, "learning_rate": 0.000242, "loss": 7.1472, "mean_token_accuracy": 0.09824580624699593, "num_tokens": 766240.0, "step": 485 }, { "entropy": 7.460130596160889, "epoch": 0.010651247717589775, "grad_norm": 1.3125, "learning_rate": 0.0002445, "loss": 7.1908, "mean_token_accuracy": 0.09887742102146149, "num_tokens": 774206.0, "step": 490 }, { "entropy": 7.499665117263794, "epoch": 0.01075993391878967, "grad_norm": 1.15625, "learning_rate": 0.000247, "loss": 7.135, "mean_token_accuracy": 0.10001260414719582, "num_tokens": 782005.0, "step": 495 }, { "entropy": 7.313957262039184, "epoch": 0.010868620119989566, "grad_norm": 1.1484375, "learning_rate": 0.0002495, "loss": 7.1614, "mean_token_accuracy": 0.10134897753596306, "num_tokens": 790043.0, "step": 500 }, { "entropy": 7.518388891220093, "epoch": 0.010977306321189461, "grad_norm": 1.21875, "learning_rate": 0.000252, "loss": 7.1951, "mean_token_accuracy": 0.10190339386463165, "num_tokens": 798248.0, "step": 505 }, { "entropy": 7.401588821411133, "epoch": 0.011085992522389357, "grad_norm": 1.203125, "learning_rate": 0.0002545, "loss": 7.1494, "mean_token_accuracy": 0.10203814506530762, "num_tokens": 806023.0, "step": 510 }, { "entropy": 7.4617040157318115, "epoch": 0.011194678723589252, "grad_norm": 1.3359375, "learning_rate": 0.000257, "loss": 7.26, "mean_token_accuracy": 0.08982759192585946, "num_tokens": 813719.0, "step": 515 }, { "entropy": 7.584583950042725, "epoch": 0.01130336492478915, "grad_norm": 1.296875, "learning_rate": 0.0002595, "loss": 7.2398, "mean_token_accuracy": 0.09505607783794404, "num_tokens": 821938.0, "step": 520 }, { "entropy": 7.490258741378784, "epoch": 0.011412051125989045, "grad_norm": 1.1953125, "learning_rate": 0.000262, "loss": 7.1423, "mean_token_accuracy": 0.09996162354946136, "num_tokens": 830263.0, "step": 525 }, { "entropy": 7.332801628112793, "epoch": 0.01152073732718894, "grad_norm": 1.34375, "learning_rate": 0.00026450000000000003, "loss": 7.1478, "mean_token_accuracy": 0.10072804763913154, "num_tokens": 838040.0, "step": 530 }, { "entropy": 7.352591896057129, "epoch": 0.011629423528388836, "grad_norm": 1.234375, "learning_rate": 0.00026700000000000004, "loss": 7.1318, "mean_token_accuracy": 0.09845451191067696, "num_tokens": 846265.0, "step": 535 }, { "entropy": 7.524213409423828, "epoch": 0.011738109729588731, "grad_norm": 1.625, "learning_rate": 0.00026950000000000005, "loss": 7.2088, "mean_token_accuracy": 0.09776617884635926, "num_tokens": 853815.0, "step": 540 }, { "entropy": 7.406747961044312, "epoch": 0.011846795930788627, "grad_norm": 1.3046875, "learning_rate": 0.00027200000000000005, "loss": 7.1712, "mean_token_accuracy": 0.1003396026790142, "num_tokens": 861186.0, "step": 545 }, { "entropy": 7.5143406867980955, "epoch": 0.011955482131988522, "grad_norm": 1.2421875, "learning_rate": 0.0002745, "loss": 7.1261, "mean_token_accuracy": 0.09955452755093575, "num_tokens": 868619.0, "step": 550 }, { "entropy": 7.397789716720581, "epoch": 0.012064168333188418, "grad_norm": 1.203125, "learning_rate": 0.000277, "loss": 7.1921, "mean_token_accuracy": 0.1024585336446762, "num_tokens": 876521.0, "step": 555 }, { "entropy": 7.418723487854004, "epoch": 0.012172854534388313, "grad_norm": 1.46875, "learning_rate": 0.0002795, "loss": 7.1915, "mean_token_accuracy": 0.09342663809657097, "num_tokens": 884060.0, "step": 560 }, { "entropy": 7.401181697845459, "epoch": 0.012281540735588209, "grad_norm": 1.296875, "learning_rate": 0.00028199999999999997, "loss": 7.1436, "mean_token_accuracy": 0.09810893088579178, "num_tokens": 892218.0, "step": 565 }, { "entropy": 7.3739972591400145, "epoch": 0.012390226936788106, "grad_norm": 1.40625, "learning_rate": 0.0002845, "loss": 7.153, "mean_token_accuracy": 0.09526406824588776, "num_tokens": 899472.0, "step": 570 }, { "entropy": 7.431902933120727, "epoch": 0.012498913137988002, "grad_norm": 1.3046875, "learning_rate": 0.000287, "loss": 7.1138, "mean_token_accuracy": 0.10175292342901229, "num_tokens": 907371.0, "step": 575 }, { "entropy": 7.30218768119812, "epoch": 0.012607599339187897, "grad_norm": 1.40625, "learning_rate": 0.0002895, "loss": 7.118, "mean_token_accuracy": 0.10189053043723106, "num_tokens": 914376.0, "step": 580 }, { "entropy": 7.398109769821167, "epoch": 0.012716285540387793, "grad_norm": 1.3359375, "learning_rate": 0.000292, "loss": 7.1022, "mean_token_accuracy": 0.09777733609080315, "num_tokens": 921992.0, "step": 585 }, { "entropy": 7.318228054046631, "epoch": 0.012824971741587688, "grad_norm": 1.1484375, "learning_rate": 0.0002945, "loss": 7.1565, "mean_token_accuracy": 0.10031871050596237, "num_tokens": 929966.0, "step": 590 }, { "entropy": 7.380307865142822, "epoch": 0.012933657942787584, "grad_norm": 1.25, "learning_rate": 0.000297, "loss": 7.0322, "mean_token_accuracy": 0.10295850262045861, "num_tokens": 936500.0, "step": 595 }, { "entropy": 7.2398364543914795, "epoch": 0.013042344143987479, "grad_norm": 1.2578125, "learning_rate": 0.0002995, "loss": 7.0636, "mean_token_accuracy": 0.10201629102230073, "num_tokens": 944685.0, "step": 600 }, { "entropy": 7.3245521068573, "epoch": 0.013151030345187375, "grad_norm": 1.40625, "learning_rate": 0.000302, "loss": 7.09, "mean_token_accuracy": 0.10841693356633186, "num_tokens": 952379.0, "step": 605 }, { "entropy": 7.226641845703125, "epoch": 0.01325971654638727, "grad_norm": 1.296875, "learning_rate": 0.0003045, "loss": 7.0067, "mean_token_accuracy": 0.10042177364230156, "num_tokens": 960310.0, "step": 610 }, { "entropy": 7.356974458694458, "epoch": 0.013368402747587165, "grad_norm": 1.1875, "learning_rate": 0.000307, "loss": 7.1009, "mean_token_accuracy": 0.09788779467344284, "num_tokens": 967581.0, "step": 615 }, { "entropy": 7.381576633453369, "epoch": 0.013477088948787063, "grad_norm": 1.34375, "learning_rate": 0.0003095, "loss": 7.0731, "mean_token_accuracy": 0.10214511007070541, "num_tokens": 975351.0, "step": 620 }, { "entropy": 7.133514547348023, "epoch": 0.013585775149986958, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 7.0016, "mean_token_accuracy": 0.10031676739454269, "num_tokens": 982962.0, "step": 625 }, { "entropy": 7.36269965171814, "epoch": 0.013694461351186854, "grad_norm": 1.3203125, "learning_rate": 0.0003145, "loss": 7.0818, "mean_token_accuracy": 0.0940178707242012, "num_tokens": 991081.0, "step": 630 }, { "entropy": 7.196866226196289, "epoch": 0.01380314755238675, "grad_norm": 1.265625, "learning_rate": 0.000317, "loss": 7.0304, "mean_token_accuracy": 0.0977426715195179, "num_tokens": 999169.0, "step": 635 }, { "entropy": 7.23091402053833, "epoch": 0.013911833753586645, "grad_norm": 1.3203125, "learning_rate": 0.0003195, "loss": 7.0051, "mean_token_accuracy": 0.10395268872380256, "num_tokens": 1007086.0, "step": 640 }, { "entropy": 7.237727499008178, "epoch": 0.01402051995478654, "grad_norm": 1.34375, "learning_rate": 0.000322, "loss": 7.0415, "mean_token_accuracy": 0.10429325178265572, "num_tokens": 1014937.0, "step": 645 }, { "entropy": 7.289627265930176, "epoch": 0.014129206155986436, "grad_norm": 1.265625, "learning_rate": 0.00032450000000000003, "loss": 7.0527, "mean_token_accuracy": 0.10648775473237038, "num_tokens": 1022271.0, "step": 650 }, { "entropy": 7.281875371932983, "epoch": 0.014237892357186331, "grad_norm": 1.1953125, "learning_rate": 0.00032700000000000003, "loss": 7.0394, "mean_token_accuracy": 0.09872807115316391, "num_tokens": 1029946.0, "step": 655 }, { "entropy": 7.201374578475952, "epoch": 0.014346578558386227, "grad_norm": 1.2421875, "learning_rate": 0.00032950000000000004, "loss": 7.0564, "mean_token_accuracy": 0.09937692657113076, "num_tokens": 1037659.0, "step": 660 }, { "entropy": 7.247886657714844, "epoch": 0.014455264759586122, "grad_norm": 1.6015625, "learning_rate": 0.00033200000000000005, "loss": 7.0678, "mean_token_accuracy": 0.10430879592895508, "num_tokens": 1045420.0, "step": 665 }, { "entropy": 7.278404426574707, "epoch": 0.01456395096078602, "grad_norm": 1.1484375, "learning_rate": 0.00033450000000000005, "loss": 7.0594, "mean_token_accuracy": 0.10522538945078849, "num_tokens": 1052681.0, "step": 670 }, { "entropy": 7.258583641052246, "epoch": 0.014672637161985915, "grad_norm": 1.2109375, "learning_rate": 0.000337, "loss": 6.9977, "mean_token_accuracy": 0.10505606159567833, "num_tokens": 1060114.0, "step": 675 }, { "entropy": 7.2787620544433596, "epoch": 0.01478132336318581, "grad_norm": 1.234375, "learning_rate": 0.0003395, "loss": 7.0666, "mean_token_accuracy": 0.10130468308925629, "num_tokens": 1068833.0, "step": 680 }, { "entropy": 7.07578821182251, "epoch": 0.014890009564385706, "grad_norm": 1.25, "learning_rate": 0.000342, "loss": 7.0062, "mean_token_accuracy": 0.10653988644480705, "num_tokens": 1075850.0, "step": 685 }, { "entropy": 7.184060382843017, "epoch": 0.014998695765585601, "grad_norm": 1.3671875, "learning_rate": 0.00034449999999999997, "loss": 6.9698, "mean_token_accuracy": 0.10846218839287758, "num_tokens": 1083956.0, "step": 690 }, { "entropy": 7.173658752441407, "epoch": 0.015107381966785497, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 7.003, "mean_token_accuracy": 0.09950482398271561, "num_tokens": 1091744.0, "step": 695 }, { "entropy": 7.154714155197143, "epoch": 0.015216068167985392, "grad_norm": 1.421875, "learning_rate": 0.0003495, "loss": 6.9642, "mean_token_accuracy": 0.10058322846889496, "num_tokens": 1099029.0, "step": 700 }, { "entropy": 7.211764144897461, "epoch": 0.015324754369185288, "grad_norm": 1.234375, "learning_rate": 0.000352, "loss": 7.0826, "mean_token_accuracy": 0.10248045325279236, "num_tokens": 1106329.0, "step": 705 }, { "entropy": 7.2008462905883786, "epoch": 0.015433440570385183, "grad_norm": 1.296875, "learning_rate": 0.0003545, "loss": 7.0031, "mean_token_accuracy": 0.10641120374202728, "num_tokens": 1114672.0, "step": 710 }, { "entropy": 7.307254886627197, "epoch": 0.01554212677158508, "grad_norm": 1.09375, "learning_rate": 0.000357, "loss": 7.122, "mean_token_accuracy": 0.09702686741948127, "num_tokens": 1123782.0, "step": 715 }, { "entropy": 7.048694181442261, "epoch": 0.015650812972784974, "grad_norm": 1.3828125, "learning_rate": 0.0003595, "loss": 6.9479, "mean_token_accuracy": 0.10803859531879426, "num_tokens": 1131211.0, "step": 720 }, { "entropy": 7.091199684143066, "epoch": 0.01575949917398487, "grad_norm": 1.171875, "learning_rate": 0.000362, "loss": 6.9317, "mean_token_accuracy": 0.10954350158572197, "num_tokens": 1138955.0, "step": 725 }, { "entropy": 7.106390285491943, "epoch": 0.015868185375184765, "grad_norm": 1.125, "learning_rate": 0.0003645, "loss": 6.9803, "mean_token_accuracy": 0.10243654400110244, "num_tokens": 1147376.0, "step": 730 }, { "entropy": 7.204882383346558, "epoch": 0.015976871576384662, "grad_norm": 1.1015625, "learning_rate": 0.000367, "loss": 6.9549, "mean_token_accuracy": 0.10707944706082344, "num_tokens": 1155196.0, "step": 735 }, { "entropy": 7.020097827911377, "epoch": 0.01608555777758456, "grad_norm": 1.2421875, "learning_rate": 0.0003695, "loss": 6.9581, "mean_token_accuracy": 0.10678377524018287, "num_tokens": 1162503.0, "step": 740 }, { "entropy": 7.215338659286499, "epoch": 0.016194243978784453, "grad_norm": 1.296875, "learning_rate": 0.000372, "loss": 7.006, "mean_token_accuracy": 0.10291345119476318, "num_tokens": 1170387.0, "step": 745 }, { "entropy": 6.980220603942871, "epoch": 0.01630293017998435, "grad_norm": 1.2109375, "learning_rate": 0.0003745, "loss": 6.8741, "mean_token_accuracy": 0.11537401303648949, "num_tokens": 1176921.0, "step": 750 }, { "entropy": 7.128726530075073, "epoch": 0.016411616381184244, "grad_norm": 1.0703125, "learning_rate": 0.000377, "loss": 7.0252, "mean_token_accuracy": 0.1050336092710495, "num_tokens": 1185063.0, "step": 755 }, { "entropy": 7.0691938400268555, "epoch": 0.01652030258238414, "grad_norm": 1.109375, "learning_rate": 0.0003795, "loss": 6.9361, "mean_token_accuracy": 0.1111590951681137, "num_tokens": 1193008.0, "step": 760 }, { "entropy": 7.12714900970459, "epoch": 0.016628988783584035, "grad_norm": 1.109375, "learning_rate": 0.000382, "loss": 6.9554, "mean_token_accuracy": 0.1107974775135517, "num_tokens": 1200868.0, "step": 765 }, { "entropy": 7.084636926651001, "epoch": 0.016737674984783932, "grad_norm": 1.15625, "learning_rate": 0.0003845, "loss": 6.9061, "mean_token_accuracy": 0.11364880874752999, "num_tokens": 1208687.0, "step": 770 }, { "entropy": 7.034700918197632, "epoch": 0.016846361185983826, "grad_norm": 1.046875, "learning_rate": 0.00038700000000000003, "loss": 6.9637, "mean_token_accuracy": 0.10925066992640495, "num_tokens": 1216804.0, "step": 775 }, { "entropy": 7.038867473602295, "epoch": 0.016955047387183723, "grad_norm": 1.2578125, "learning_rate": 0.00038950000000000003, "loss": 6.8871, "mean_token_accuracy": 0.11413683071732521, "num_tokens": 1224505.0, "step": 780 }, { "entropy": 6.978211402893066, "epoch": 0.017063733588383617, "grad_norm": 1.0234375, "learning_rate": 0.00039200000000000004, "loss": 6.8853, "mean_token_accuracy": 0.11565895602107049, "num_tokens": 1232706.0, "step": 785 }, { "entropy": 7.117547416687012, "epoch": 0.017172419789583514, "grad_norm": 1.2421875, "learning_rate": 0.00039450000000000005, "loss": 6.8904, "mean_token_accuracy": 0.11539890021085739, "num_tokens": 1239551.0, "step": 790 }, { "entropy": 6.993913698196411, "epoch": 0.01728110599078341, "grad_norm": 1.40625, "learning_rate": 0.00039700000000000005, "loss": 6.8834, "mean_token_accuracy": 0.11389343962073326, "num_tokens": 1247909.0, "step": 795 }, { "entropy": 7.153699827194214, "epoch": 0.017389792191983305, "grad_norm": 1.1875, "learning_rate": 0.0003995, "loss": 7.0588, "mean_token_accuracy": 0.10906191244721412, "num_tokens": 1256523.0, "step": 800 }, { "entropy": 7.072479391098023, "epoch": 0.017498478393183203, "grad_norm": 1.15625, "learning_rate": 0.000402, "loss": 6.8826, "mean_token_accuracy": 0.11302874237298965, "num_tokens": 1263879.0, "step": 805 }, { "entropy": 7.110428047180176, "epoch": 0.017607164594383096, "grad_norm": 1.2109375, "learning_rate": 0.0004045, "loss": 6.9637, "mean_token_accuracy": 0.1068289540708065, "num_tokens": 1271287.0, "step": 810 }, { "entropy": 6.977171850204468, "epoch": 0.017715850795582994, "grad_norm": 1.125, "learning_rate": 0.00040699999999999997, "loss": 6.8514, "mean_token_accuracy": 0.1114407129585743, "num_tokens": 1278828.0, "step": 815 }, { "entropy": 7.056746530532837, "epoch": 0.017824536996782887, "grad_norm": 1.125, "learning_rate": 0.0004095, "loss": 6.9732, "mean_token_accuracy": 0.10797528550028801, "num_tokens": 1286827.0, "step": 820 }, { "entropy": 7.063602304458618, "epoch": 0.017933223197982785, "grad_norm": 1.21875, "learning_rate": 0.000412, "loss": 6.9201, "mean_token_accuracy": 0.10415855050086975, "num_tokens": 1294546.0, "step": 825 }, { "entropy": 6.962296867370606, "epoch": 0.01804190939918268, "grad_norm": 1.359375, "learning_rate": 0.0004145, "loss": 6.8398, "mean_token_accuracy": 0.1096323385834694, "num_tokens": 1301574.0, "step": 830 }, { "entropy": 7.106445598602295, "epoch": 0.018150595600382576, "grad_norm": 1.28125, "learning_rate": 0.000417, "loss": 6.8577, "mean_token_accuracy": 0.11122734472155571, "num_tokens": 1308224.0, "step": 835 }, { "entropy": 6.868801546096802, "epoch": 0.018259281801582473, "grad_norm": 1.0703125, "learning_rate": 0.0004195, "loss": 6.923, "mean_token_accuracy": 0.10960033088922501, "num_tokens": 1317335.0, "step": 840 }, { "entropy": 7.096353387832641, "epoch": 0.018367968002782366, "grad_norm": 1.125, "learning_rate": 0.000422, "loss": 6.8735, "mean_token_accuracy": 0.10573652610182763, "num_tokens": 1324825.0, "step": 845 }, { "entropy": 6.913944911956787, "epoch": 0.018476654203982264, "grad_norm": 1.1953125, "learning_rate": 0.0004245, "loss": 6.9635, "mean_token_accuracy": 0.10770962685346604, "num_tokens": 1332818.0, "step": 850 }, { "entropy": 6.95415940284729, "epoch": 0.018585340405182157, "grad_norm": 1.1640625, "learning_rate": 0.000427, "loss": 6.769, "mean_token_accuracy": 0.12482169717550277, "num_tokens": 1339858.0, "step": 855 }, { "entropy": 6.976625156402588, "epoch": 0.018694026606382055, "grad_norm": 1.09375, "learning_rate": 0.0004295, "loss": 6.9342, "mean_token_accuracy": 0.10149514004588127, "num_tokens": 1348542.0, "step": 860 }, { "entropy": 6.979064416885376, "epoch": 0.01880271280758195, "grad_norm": 1.125, "learning_rate": 0.000432, "loss": 6.8578, "mean_token_accuracy": 0.11146032214164733, "num_tokens": 1355851.0, "step": 865 }, { "entropy": 6.964614057540894, "epoch": 0.018911399008781846, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.867, "mean_token_accuracy": 0.11173160448670387, "num_tokens": 1363844.0, "step": 870 }, { "entropy": 7.057435846328735, "epoch": 0.01902008520998174, "grad_norm": 1.125, "learning_rate": 0.000437, "loss": 6.8731, "mean_token_accuracy": 0.11148432195186615, "num_tokens": 1372525.0, "step": 875 }, { "entropy": 6.942585229873657, "epoch": 0.019128771411181637, "grad_norm": 1.109375, "learning_rate": 0.0004395, "loss": 6.9121, "mean_token_accuracy": 0.10839233919978142, "num_tokens": 1381371.0, "step": 880 }, { "entropy": 6.933096694946289, "epoch": 0.01923745761238153, "grad_norm": 1.21875, "learning_rate": 0.000442, "loss": 6.8116, "mean_token_accuracy": 0.11815176531672478, "num_tokens": 1389140.0, "step": 885 }, { "entropy": 6.891059732437133, "epoch": 0.019346143813581428, "grad_norm": 1.1015625, "learning_rate": 0.0004445, "loss": 6.8372, "mean_token_accuracy": 0.11450439095497131, "num_tokens": 1396397.0, "step": 890 }, { "entropy": 6.9327497482299805, "epoch": 0.019454830014781325, "grad_norm": 1.140625, "learning_rate": 0.000447, "loss": 6.9194, "mean_token_accuracy": 0.11007297709584236, "num_tokens": 1404600.0, "step": 895 }, { "entropy": 6.999571323394775, "epoch": 0.01956351621598122, "grad_norm": 1.0859375, "learning_rate": 0.00044950000000000003, "loss": 6.8758, "mean_token_accuracy": 0.11412210613489152, "num_tokens": 1413063.0, "step": 900 }, { "entropy": 6.883196830749512, "epoch": 0.019672202417181116, "grad_norm": 1.109375, "learning_rate": 0.00045200000000000004, "loss": 6.7573, "mean_token_accuracy": 0.11876690089702606, "num_tokens": 1419875.0, "step": 905 }, { "entropy": 6.874788761138916, "epoch": 0.01978088861838101, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.8001, "mean_token_accuracy": 0.10891184434294701, "num_tokens": 1427405.0, "step": 910 }, { "entropy": 6.950111055374146, "epoch": 0.019889574819580907, "grad_norm": 1.1640625, "learning_rate": 0.00045700000000000005, "loss": 6.9241, "mean_token_accuracy": 0.10468844398856163, "num_tokens": 1435721.0, "step": 915 }, { "entropy": 6.985974359512329, "epoch": 0.0199982610207808, "grad_norm": 1.0859375, "learning_rate": 0.00045950000000000006, "loss": 6.8313, "mean_token_accuracy": 0.10862488150596619, "num_tokens": 1443091.0, "step": 920 }, { "entropy": 6.866302967071533, "epoch": 0.020106947221980698, "grad_norm": 1.0859375, "learning_rate": 0.000462, "loss": 6.8088, "mean_token_accuracy": 0.1172551192343235, "num_tokens": 1450452.0, "step": 925 }, { "entropy": 6.967225980758667, "epoch": 0.02021563342318059, "grad_norm": 1.046875, "learning_rate": 0.0004645, "loss": 6.9108, "mean_token_accuracy": 0.11415560767054558, "num_tokens": 1459130.0, "step": 930 }, { "entropy": 6.973930406570434, "epoch": 0.02032431962438049, "grad_norm": 1.2890625, "learning_rate": 0.000467, "loss": 6.8542, "mean_token_accuracy": 0.10872401073575019, "num_tokens": 1466950.0, "step": 935 }, { "entropy": 6.964308834075927, "epoch": 0.020433005825580386, "grad_norm": 1.2265625, "learning_rate": 0.0004695, "loss": 6.9507, "mean_token_accuracy": 0.10664009302854538, "num_tokens": 1476679.0, "step": 940 }, { "entropy": 6.870850515365601, "epoch": 0.02054169202678028, "grad_norm": 1.1640625, "learning_rate": 0.000472, "loss": 6.7456, "mean_token_accuracy": 0.11636312678456306, "num_tokens": 1484000.0, "step": 945 }, { "entropy": 6.836710262298584, "epoch": 0.020650378227980177, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.8694, "mean_token_accuracy": 0.11150090396404266, "num_tokens": 1491563.0, "step": 950 }, { "entropy": 6.927568483352661, "epoch": 0.02075906442918007, "grad_norm": 1.0234375, "learning_rate": 0.000477, "loss": 6.8676, "mean_token_accuracy": 0.1152837723493576, "num_tokens": 1499879.0, "step": 955 }, { "entropy": 6.948094701766967, "epoch": 0.020867750630379968, "grad_norm": 1.125, "learning_rate": 0.0004795, "loss": 6.8011, "mean_token_accuracy": 0.1114250123500824, "num_tokens": 1507764.0, "step": 960 }, { "entropy": 6.80685830116272, "epoch": 0.02097643683157986, "grad_norm": 1.0625, "learning_rate": 0.000482, "loss": 6.8263, "mean_token_accuracy": 0.1110868975520134, "num_tokens": 1516098.0, "step": 965 }, { "entropy": 6.883790922164917, "epoch": 0.02108512303277976, "grad_norm": 1.21875, "learning_rate": 0.0004845, "loss": 6.7996, "mean_token_accuracy": 0.11565712839365005, "num_tokens": 1523800.0, "step": 970 }, { "entropy": 6.985372495651245, "epoch": 0.021193809233979653, "grad_norm": 1.1015625, "learning_rate": 0.000487, "loss": 6.9104, "mean_token_accuracy": 0.10778488591313362, "num_tokens": 1531435.0, "step": 975 }, { "entropy": 6.863921737670898, "epoch": 0.02130249543517955, "grad_norm": 1.1328125, "learning_rate": 0.0004895, "loss": 6.797, "mean_token_accuracy": 0.11670528054237365, "num_tokens": 1539757.0, "step": 980 }, { "entropy": 6.790615463256836, "epoch": 0.021411181636379444, "grad_norm": 1.2421875, "learning_rate": 0.000492, "loss": 6.7501, "mean_token_accuracy": 0.11390289589762688, "num_tokens": 1547272.0, "step": 985 }, { "entropy": 6.816875362396241, "epoch": 0.02151986783757934, "grad_norm": 1.2421875, "learning_rate": 0.0004945, "loss": 6.7661, "mean_token_accuracy": 0.11140070185065269, "num_tokens": 1555286.0, "step": 990 }, { "entropy": 6.8604302406311035, "epoch": 0.021628554038779238, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 6.7601, "mean_token_accuracy": 0.11161275953054428, "num_tokens": 1563762.0, "step": 995 }, { "entropy": 6.862444543838501, "epoch": 0.021737240239979132, "grad_norm": 1.1796875, "learning_rate": 0.0004995, "loss": 6.8113, "mean_token_accuracy": 0.10896943360567093, "num_tokens": 1572996.0, "step": 1000 }, { "entropy": 6.944311189651489, "epoch": 0.02184592644117903, "grad_norm": 1.1875, "learning_rate": 0.000499998026082006, "loss": 6.8662, "mean_token_accuracy": 0.10712903067469597, "num_tokens": 1581009.0, "step": 1005 }, { "entropy": 6.861703729629516, "epoch": 0.021954612642378923, "grad_norm": 1.1015625, "learning_rate": 0.0004999900070995136, "loss": 6.839, "mean_token_accuracy": 0.11141621619462967, "num_tokens": 1589133.0, "step": 1010 }, { "entropy": 6.793341779708863, "epoch": 0.02206329884357882, "grad_norm": 1.15625, "learning_rate": 0.0004999758199023239, "loss": 6.7883, "mean_token_accuracy": 0.1176340863108635, "num_tokens": 1596843.0, "step": 1015 }, { "entropy": 6.771137332916259, "epoch": 0.022171985044778714, "grad_norm": 1.109375, "learning_rate": 0.0004999554648793858, "loss": 6.6697, "mean_token_accuracy": 0.12174412459135056, "num_tokens": 1604287.0, "step": 1020 }, { "entropy": 6.842767333984375, "epoch": 0.02228067124597861, "grad_norm": 1.1328125, "learning_rate": 0.0004999289425887425, "loss": 6.7256, "mean_token_accuracy": 0.11848887726664543, "num_tokens": 1612995.0, "step": 1025 }, { "entropy": 6.747415065765381, "epoch": 0.022389357447178505, "grad_norm": 1.0390625, "learning_rate": 0.0004998962537575161, "loss": 6.7856, "mean_token_accuracy": 0.11309662461280823, "num_tokens": 1622090.0, "step": 1030 }, { "entropy": 6.809288883209229, "epoch": 0.022498043648378402, "grad_norm": 1.1796875, "learning_rate": 0.0004998573992818874, "loss": 6.7228, "mean_token_accuracy": 0.1198489598929882, "num_tokens": 1630697.0, "step": 1035 }, { "entropy": 6.7372705936431885, "epoch": 0.0226067298495783, "grad_norm": 1.0859375, "learning_rate": 0.0004998123802270715, "loss": 6.7425, "mean_token_accuracy": 0.11601528003811837, "num_tokens": 1638711.0, "step": 1040 }, { "entropy": 6.753994655609131, "epoch": 0.022715416050778193, "grad_norm": 1.125, "learning_rate": 0.0004997611978272886, "loss": 6.6434, "mean_token_accuracy": 0.12457199022173882, "num_tokens": 1646536.0, "step": 1045 }, { "entropy": 6.740097522735596, "epoch": 0.02282410225197809, "grad_norm": 1.046875, "learning_rate": 0.0004997038534857298, "loss": 6.7043, "mean_token_accuracy": 0.11510038226842881, "num_tokens": 1654633.0, "step": 1050 }, { "entropy": 6.73102216720581, "epoch": 0.022932788453177984, "grad_norm": 1.0859375, "learning_rate": 0.0004996403487745194, "loss": 6.7956, "mean_token_accuracy": 0.11422985568642616, "num_tokens": 1662844.0, "step": 1055 }, { "entropy": 6.789561605453491, "epoch": 0.02304147465437788, "grad_norm": 1.0703125, "learning_rate": 0.000499570685434671, "loss": 6.7318, "mean_token_accuracy": 0.12340603768825531, "num_tokens": 1670771.0, "step": 1060 }, { "entropy": 6.733522748947143, "epoch": 0.023150160855577775, "grad_norm": 1.1015625, "learning_rate": 0.0004994948653760405, "loss": 6.6846, "mean_token_accuracy": 0.11971172913908959, "num_tokens": 1678136.0, "step": 1065 }, { "entropy": 6.7756870746612545, "epoch": 0.023258847056777672, "grad_norm": 1.1875, "learning_rate": 0.0004994128906772729, "loss": 6.6925, "mean_token_accuracy": 0.11457556933164596, "num_tokens": 1686262.0, "step": 1070 }, { "entropy": 6.733363199234009, "epoch": 0.023367533257977566, "grad_norm": 1.171875, "learning_rate": 0.000499324763585746, "loss": 6.7026, "mean_token_accuracy": 0.12492116540670395, "num_tokens": 1693674.0, "step": 1075 }, { "entropy": 6.771343755722046, "epoch": 0.023476219459177463, "grad_norm": 1.046875, "learning_rate": 0.0004992304865175085, "loss": 6.7377, "mean_token_accuracy": 0.11399596929550171, "num_tokens": 1701470.0, "step": 1080 }, { "entropy": 6.687263298034668, "epoch": 0.02358490566037736, "grad_norm": 1.421875, "learning_rate": 0.0004991300620572138, "loss": 6.6237, "mean_token_accuracy": 0.12396905422210694, "num_tokens": 1708849.0, "step": 1085 }, { "entropy": 6.770354318618774, "epoch": 0.023693591861577254, "grad_norm": 1.2109375, "learning_rate": 0.0004990234929580494, "loss": 6.6882, "mean_token_accuracy": 0.12379547283053398, "num_tokens": 1716360.0, "step": 1090 }, { "entropy": 6.719215774536133, "epoch": 0.02380227806277715, "grad_norm": 1.0859375, "learning_rate": 0.0004989107821416609, "loss": 6.7194, "mean_token_accuracy": 0.11905450150370597, "num_tokens": 1724218.0, "step": 1095 }, { "entropy": 6.804384231567383, "epoch": 0.023910964263977045, "grad_norm": 1.0625, "learning_rate": 0.0004987919326980723, "loss": 6.7272, "mean_token_accuracy": 0.11393096148967743, "num_tokens": 1732431.0, "step": 1100 }, { "entropy": 6.6787989139556885, "epoch": 0.024019650465176942, "grad_norm": 1.0390625, "learning_rate": 0.0004986669478856011, "loss": 6.7156, "mean_token_accuracy": 0.11123198568820954, "num_tokens": 1740466.0, "step": 1105 }, { "entropy": 6.843336868286133, "epoch": 0.024128336666376836, "grad_norm": 1.2265625, "learning_rate": 0.0004985358311307688, "loss": 6.7396, "mean_token_accuracy": 0.1168380431830883, "num_tokens": 1747952.0, "step": 1110 }, { "entropy": 6.669610834121704, "epoch": 0.024237022867576733, "grad_norm": 1.125, "learning_rate": 0.0004983985860282081, "loss": 6.7167, "mean_token_accuracy": 0.12077742591500282, "num_tokens": 1755903.0, "step": 1115 }, { "entropy": 6.817348575592041, "epoch": 0.024345709068776627, "grad_norm": 1.0234375, "learning_rate": 0.0004982552163405623, "loss": 6.8025, "mean_token_accuracy": 0.11085736006498337, "num_tokens": 1764451.0, "step": 1120 }, { "entropy": 6.821982717514038, "epoch": 0.024454395269976524, "grad_norm": 0.9921875, "learning_rate": 0.0004981057259983839, "loss": 6.8682, "mean_token_accuracy": 0.11098600178956985, "num_tokens": 1773573.0, "step": 1125 }, { "entropy": 6.814310121536255, "epoch": 0.024563081471176418, "grad_norm": 1.0390625, "learning_rate": 0.0004979501191000262, "loss": 6.7621, "mean_token_accuracy": 0.11357782185077667, "num_tokens": 1781176.0, "step": 1130 }, { "entropy": 6.854786062240601, "epoch": 0.024671767672376315, "grad_norm": 1.1640625, "learning_rate": 0.0004977883999115311, "loss": 6.7348, "mean_token_accuracy": 0.11998602896928787, "num_tokens": 1788118.0, "step": 1135 }, { "entropy": 6.704822015762329, "epoch": 0.024780453873576212, "grad_norm": 1.0703125, "learning_rate": 0.0004976205728665113, "loss": 6.7596, "mean_token_accuracy": 0.12081285044550896, "num_tokens": 1797245.0, "step": 1140 }, { "entropy": 6.7488603591918945, "epoch": 0.024889140074776106, "grad_norm": 1.1015625, "learning_rate": 0.0004974466425660307, "loss": 6.7508, "mean_token_accuracy": 0.10823504626750946, "num_tokens": 1806358.0, "step": 1145 }, { "entropy": 6.78481707572937, "epoch": 0.024997826275976003, "grad_norm": 1.0078125, "learning_rate": 0.0004972666137784759, "loss": 6.7131, "mean_token_accuracy": 0.12163210511207581, "num_tokens": 1814500.0, "step": 1150 }, { "entropy": 6.817404508590698, "epoch": 0.025106512477175897, "grad_norm": 1.171875, "learning_rate": 0.0004970804914394271, "loss": 6.7377, "mean_token_accuracy": 0.11625442504882813, "num_tokens": 1821983.0, "step": 1155 }, { "entropy": 6.750685548782348, "epoch": 0.025215198678375794, "grad_norm": 1.1015625, "learning_rate": 0.0004968882806515225, "loss": 6.7311, "mean_token_accuracy": 0.11820982620120049, "num_tokens": 1829416.0, "step": 1160 }, { "entropy": 6.63856954574585, "epoch": 0.025323884879575688, "grad_norm": 1.28125, "learning_rate": 0.0004966899866843177, "loss": 6.6535, "mean_token_accuracy": 0.12064194157719613, "num_tokens": 1836888.0, "step": 1165 }, { "entropy": 6.7434063911437985, "epoch": 0.025432571080775585, "grad_norm": 1.0390625, "learning_rate": 0.000496485614974142, "loss": 6.6959, "mean_token_accuracy": 0.11727289259433746, "num_tokens": 1845318.0, "step": 1170 }, { "entropy": 6.721282291412353, "epoch": 0.02554125728197548, "grad_norm": 1.0859375, "learning_rate": 0.0004962751711239492, "loss": 6.7254, "mean_token_accuracy": 0.11171131953597069, "num_tokens": 1855005.0, "step": 1175 }, { "entropy": 6.7714166164398195, "epoch": 0.025649943483175376, "grad_norm": 1.1015625, "learning_rate": 0.0004960586609031636, "loss": 6.6286, "mean_token_accuracy": 0.11785526797175408, "num_tokens": 1863104.0, "step": 1180 }, { "entropy": 6.647221803665161, "epoch": 0.025758629684375273, "grad_norm": 1.109375, "learning_rate": 0.0004958360902475224, "loss": 6.7371, "mean_token_accuracy": 0.12050389349460602, "num_tokens": 1870833.0, "step": 1185 }, { "entropy": 6.822182941436767, "epoch": 0.025867315885575167, "grad_norm": 1.1171875, "learning_rate": 0.0004956074652589125, "loss": 6.6016, "mean_token_accuracy": 0.12365994974970818, "num_tokens": 1877812.0, "step": 1190 }, { "entropy": 6.610793733596802, "epoch": 0.025976002086775064, "grad_norm": 1.0546875, "learning_rate": 0.0004953727922052035, "loss": 6.6732, "mean_token_accuracy": 0.12029042765498162, "num_tokens": 1886265.0, "step": 1195 }, { "entropy": 6.711217069625855, "epoch": 0.026084688287974958, "grad_norm": 1.109375, "learning_rate": 0.0004951320775200756, "loss": 6.6321, "mean_token_accuracy": 0.12245473191142082, "num_tokens": 1894378.0, "step": 1200 }, { "entropy": 6.634425687789917, "epoch": 0.026193374489174855, "grad_norm": 1.0703125, "learning_rate": 0.0004948853278028436, "loss": 6.5894, "mean_token_accuracy": 0.12096654176712036, "num_tokens": 1902298.0, "step": 1205 }, { "entropy": 6.674074411392212, "epoch": 0.02630206069037475, "grad_norm": 1.15625, "learning_rate": 0.0004946325498182755, "loss": 6.7116, "mean_token_accuracy": 0.1144709900021553, "num_tokens": 1909320.0, "step": 1210 }, { "entropy": 6.827318143844605, "epoch": 0.026410746891574646, "grad_norm": 1.15625, "learning_rate": 0.0004943737504964076, "loss": 6.6938, "mean_token_accuracy": 0.119134671241045, "num_tokens": 1917053.0, "step": 1215 }, { "entropy": 6.668541002273559, "epoch": 0.02651943309277454, "grad_norm": 1.0390625, "learning_rate": 0.000494108936932354, "loss": 6.6332, "mean_token_accuracy": 0.12302515879273415, "num_tokens": 1925725.0, "step": 1220 }, { "entropy": 6.772843980789185, "epoch": 0.026628119293974437, "grad_norm": 1.1796875, "learning_rate": 0.0004938381163861124, "loss": 6.666, "mean_token_accuracy": 0.1218823440372944, "num_tokens": 1933317.0, "step": 1225 }, { "entropy": 6.60233359336853, "epoch": 0.02673680549517433, "grad_norm": 1.2421875, "learning_rate": 0.0004935612962823645, "loss": 6.7042, "mean_token_accuracy": 0.11369993463158608, "num_tokens": 1941273.0, "step": 1230 }, { "entropy": 6.729761362075806, "epoch": 0.026845491696374228, "grad_norm": 0.9921875, "learning_rate": 0.0004932784842102739, "loss": 6.671, "mean_token_accuracy": 0.1214449904859066, "num_tokens": 1950474.0, "step": 1235 }, { "entropy": 6.670256090164185, "epoch": 0.026954177897574125, "grad_norm": 1.0234375, "learning_rate": 0.0004929896879232758, "loss": 6.7009, "mean_token_accuracy": 0.11673137396574021, "num_tokens": 1959019.0, "step": 1240 }, { "entropy": 6.690532398223877, "epoch": 0.02706286409877402, "grad_norm": 0.9921875, "learning_rate": 0.0004926949153388668, "loss": 6.568, "mean_token_accuracy": 0.12435560747981071, "num_tokens": 1967265.0, "step": 1245 }, { "entropy": 6.617759323120117, "epoch": 0.027171550299973916, "grad_norm": 1.265625, "learning_rate": 0.0004923941745383859, "loss": 6.5434, "mean_token_accuracy": 0.12447248473763466, "num_tokens": 1974239.0, "step": 1250 }, { "entropy": 6.75258617401123, "epoch": 0.02728023650117381, "grad_norm": 1.1796875, "learning_rate": 0.000492087473766794, "loss": 6.6743, "mean_token_accuracy": 0.1195609726011753, "num_tokens": 1981982.0, "step": 1255 }, { "entropy": 6.5735856056213375, "epoch": 0.027388922702373707, "grad_norm": 1.125, "learning_rate": 0.000491774821432448, "loss": 6.5964, "mean_token_accuracy": 0.12709427028894424, "num_tokens": 1989488.0, "step": 1260 }, { "entropy": 6.660828065872193, "epoch": 0.0274976089035736, "grad_norm": 0.99609375, "learning_rate": 0.0004914562261068693, "loss": 6.6906, "mean_token_accuracy": 0.11730890870094299, "num_tokens": 1997447.0, "step": 1265 }, { "entropy": 6.7316429138183596, "epoch": 0.0276062951047735, "grad_norm": 1.078125, "learning_rate": 0.0004911316965245098, "loss": 6.7033, "mean_token_accuracy": 0.1155233234167099, "num_tokens": 2006443.0, "step": 1270 }, { "entropy": 6.715520000457763, "epoch": 0.027714981305973392, "grad_norm": 1.0390625, "learning_rate": 0.000490801241582512, "loss": 6.6559, "mean_token_accuracy": 0.11586152538657188, "num_tokens": 2015339.0, "step": 1275 }, { "entropy": 6.641583824157715, "epoch": 0.02782366750717329, "grad_norm": 1.140625, "learning_rate": 0.000490464870340465, "loss": 6.5521, "mean_token_accuracy": 0.12834264934062958, "num_tokens": 2022976.0, "step": 1280 }, { "entropy": 6.611687469482422, "epoch": 0.027932353708373187, "grad_norm": 0.9453125, "learning_rate": 0.0004901225920201563, "loss": 6.6215, "mean_token_accuracy": 0.12682543843984603, "num_tokens": 2031252.0, "step": 1285 }, { "entropy": 6.703845119476318, "epoch": 0.02804103990957308, "grad_norm": 1.0625, "learning_rate": 0.000489774416005319, "loss": 6.611, "mean_token_accuracy": 0.1212866634130478, "num_tokens": 2038465.0, "step": 1290 }, { "entropy": 6.586824417114258, "epoch": 0.028149726110772978, "grad_norm": 1.046875, "learning_rate": 0.0004894203518413742, "loss": 6.5856, "mean_token_accuracy": 0.12294368520379066, "num_tokens": 2045921.0, "step": 1295 }, { "entropy": 6.655889320373535, "epoch": 0.02825841231197287, "grad_norm": 1.1640625, "learning_rate": 0.0004890604092351701, "loss": 6.5343, "mean_token_accuracy": 0.1270897440612316, "num_tokens": 2054127.0, "step": 1300 }, { "entropy": 6.691068410873413, "epoch": 0.02836709851317277, "grad_norm": 1.15625, "learning_rate": 0.000488694598054715, "loss": 6.6147, "mean_token_accuracy": 0.12068610191345215, "num_tokens": 2061889.0, "step": 1305 }, { "entropy": 6.5537497997283936, "epoch": 0.028475784714372662, "grad_norm": 1.1484375, "learning_rate": 0.0004883229283289071, "loss": 6.5846, "mean_token_accuracy": 0.12348945364356041, "num_tokens": 2069620.0, "step": 1310 }, { "entropy": 6.72159972190857, "epoch": 0.02858447091557256, "grad_norm": 1.0078125, "learning_rate": 0.00048794541024725993, "loss": 6.5326, "mean_token_accuracy": 0.13243458196520805, "num_tokens": 2077371.0, "step": 1315 }, { "entropy": 6.541279745101929, "epoch": 0.028693157116772453, "grad_norm": 1.0703125, "learning_rate": 0.0004875620541596221, "loss": 6.6154, "mean_token_accuracy": 0.12915401235222818, "num_tokens": 2085727.0, "step": 1320 }, { "entropy": 6.756937503814697, "epoch": 0.02880184331797235, "grad_norm": 1.03125, "learning_rate": 0.00048717287057589454, "loss": 6.6528, "mean_token_accuracy": 0.12067537754774094, "num_tokens": 2093858.0, "step": 1325 }, { "entropy": 6.603250503540039, "epoch": 0.028910529519172244, "grad_norm": 1.03125, "learning_rate": 0.0004867778701657417, "loss": 6.6029, "mean_token_accuracy": 0.12590081617236137, "num_tokens": 2101776.0, "step": 1330 }, { "entropy": 6.552526473999023, "epoch": 0.02901921572037214, "grad_norm": 1.171875, "learning_rate": 0.00048637706375829955, "loss": 6.5071, "mean_token_accuracy": 0.12628837302327156, "num_tokens": 2108932.0, "step": 1335 }, { "entropy": 6.61759204864502, "epoch": 0.02912790192157204, "grad_norm": 1.109375, "learning_rate": 0.000485970462341878, "loss": 6.5878, "mean_token_accuracy": 0.12770043164491654, "num_tokens": 2116786.0, "step": 1340 }, { "entropy": 6.6530732154846195, "epoch": 0.029236588122771932, "grad_norm": 1.0234375, "learning_rate": 0.00048555807706366044, "loss": 6.6136, "mean_token_accuracy": 0.11667786464095116, "num_tokens": 2124884.0, "step": 1345 }, { "entropy": 6.576787042617798, "epoch": 0.02934527432397183, "grad_norm": 1.0703125, "learning_rate": 0.00048513991922939756, "loss": 6.6245, "mean_token_accuracy": 0.12192277386784553, "num_tokens": 2132173.0, "step": 1350 }, { "entropy": 6.7595985412597654, "epoch": 0.029453960525171723, "grad_norm": 1.0390625, "learning_rate": 0.00048471600030309744, "loss": 6.5765, "mean_token_accuracy": 0.12141433283686638, "num_tokens": 2140554.0, "step": 1355 }, { "entropy": 6.474835062026978, "epoch": 0.02956264672637162, "grad_norm": 1.09375, "learning_rate": 0.00048428633190671186, "loss": 6.5187, "mean_token_accuracy": 0.12662884443998337, "num_tokens": 2148350.0, "step": 1360 }, { "entropy": 6.634714126586914, "epoch": 0.029671332927571514, "grad_norm": 1.0859375, "learning_rate": 0.0004838509258198167, "loss": 6.5471, "mean_token_accuracy": 0.1328614644706249, "num_tokens": 2156652.0, "step": 1365 }, { "entropy": 6.579633331298828, "epoch": 0.02978001912877141, "grad_norm": 1.1640625, "learning_rate": 0.00048340979397929, "loss": 6.6294, "mean_token_accuracy": 0.11975409835577011, "num_tokens": 2165406.0, "step": 1370 }, { "entropy": 6.649616336822509, "epoch": 0.029888705329971305, "grad_norm": 0.984375, "learning_rate": 0.00048296294847898386, "loss": 6.5915, "mean_token_accuracy": 0.1256055273115635, "num_tokens": 2173663.0, "step": 1375 }, { "entropy": 6.660815572738647, "epoch": 0.029997391531171202, "grad_norm": 1.1015625, "learning_rate": 0.0004825104015693934, "loss": 6.5002, "mean_token_accuracy": 0.12725673615932465, "num_tokens": 2181042.0, "step": 1380 }, { "entropy": 6.612697267532349, "epoch": 0.0301060777323711, "grad_norm": 1.1328125, "learning_rate": 0.0004820521656573208, "loss": 6.6187, "mean_token_accuracy": 0.11868590340018273, "num_tokens": 2189686.0, "step": 1385 }, { "entropy": 6.637413787841797, "epoch": 0.030214763933570993, "grad_norm": 0.95703125, "learning_rate": 0.00048158825330553505, "loss": 6.6813, "mean_token_accuracy": 0.12129974663257599, "num_tokens": 2198924.0, "step": 1390 }, { "entropy": 6.662744569778442, "epoch": 0.03032345013477089, "grad_norm": 1.0625, "learning_rate": 0.00048111867723242763, "loss": 6.6561, "mean_token_accuracy": 0.11987720131874084, "num_tokens": 2206770.0, "step": 1395 }, { "entropy": 6.626357221603394, "epoch": 0.030432136335970784, "grad_norm": 1.265625, "learning_rate": 0.0004806434503116637, "loss": 6.5734, "mean_token_accuracy": 0.12084893509745598, "num_tokens": 2214398.0, "step": 1400 }, { "entropy": 6.651124620437622, "epoch": 0.03054082253717068, "grad_norm": 1.03125, "learning_rate": 0.0004801625855718296, "loss": 6.5953, "mean_token_accuracy": 0.12142176851630211, "num_tokens": 2222338.0, "step": 1405 }, { "entropy": 6.602102756500244, "epoch": 0.030649508738370575, "grad_norm": 1.2421875, "learning_rate": 0.00047967609619607477, "loss": 6.5087, "mean_token_accuracy": 0.13247907012701035, "num_tokens": 2229815.0, "step": 1410 }, { "entropy": 6.539565515518189, "epoch": 0.030758194939570473, "grad_norm": 1.046875, "learning_rate": 0.0004791839955217513, "loss": 6.4888, "mean_token_accuracy": 0.1223328985273838, "num_tokens": 2237663.0, "step": 1415 }, { "entropy": 6.608070755004883, "epoch": 0.030866881140770366, "grad_norm": 1.1875, "learning_rate": 0.00047868629704004786, "loss": 6.5472, "mean_token_accuracy": 0.13164723366498948, "num_tokens": 2245703.0, "step": 1420 }, { "entropy": 6.681449699401855, "epoch": 0.030975567341970264, "grad_norm": 1.09375, "learning_rate": 0.00047818301439561965, "loss": 6.5276, "mean_token_accuracy": 0.12454903274774551, "num_tokens": 2253178.0, "step": 1425 }, { "entropy": 6.496039152145386, "epoch": 0.03108425354317016, "grad_norm": 1.0859375, "learning_rate": 0.00047767416138621454, "loss": 6.5428, "mean_token_accuracy": 0.12364711612462997, "num_tokens": 2260564.0, "step": 1430 }, { "entropy": 6.588859939575196, "epoch": 0.031192939744370055, "grad_norm": 1.0859375, "learning_rate": 0.000477159751962295, "loss": 6.5566, "mean_token_accuracy": 0.11912669464945794, "num_tokens": 2268988.0, "step": 1435 }, { "entropy": 6.649993419647217, "epoch": 0.03130162594556995, "grad_norm": 1.0703125, "learning_rate": 0.00047663980022665507, "loss": 6.508, "mean_token_accuracy": 0.12953050956130027, "num_tokens": 2276400.0, "step": 1440 }, { "entropy": 6.583322143554687, "epoch": 0.03141031214676985, "grad_norm": 1.0859375, "learning_rate": 0.00047611432043403437, "loss": 6.5249, "mean_token_accuracy": 0.1304257981479168, "num_tokens": 2284540.0, "step": 1445 }, { "entropy": 6.596342277526856, "epoch": 0.03151899834796974, "grad_norm": 0.99609375, "learning_rate": 0.0004755833269907267, "loss": 6.5765, "mean_token_accuracy": 0.12414052039384842, "num_tokens": 2293655.0, "step": 1450 }, { "entropy": 6.667462110519409, "epoch": 0.031627684549169637, "grad_norm": 0.953125, "learning_rate": 0.0004750468344541857, "loss": 6.5642, "mean_token_accuracy": 0.1251768171787262, "num_tokens": 2302647.0, "step": 1455 }, { "entropy": 6.515790939331055, "epoch": 0.03173637075036953, "grad_norm": 0.94140625, "learning_rate": 0.00047450485753262525, "loss": 6.5314, "mean_token_accuracy": 0.12692836448550224, "num_tokens": 2311064.0, "step": 1460 }, { "entropy": 6.6385047912597654, "epoch": 0.03184505695156943, "grad_norm": 1.015625, "learning_rate": 0.00047395741108461633, "loss": 6.5232, "mean_token_accuracy": 0.13005399256944655, "num_tokens": 2318608.0, "step": 1465 }, { "entropy": 6.426021480560303, "epoch": 0.031953743152769325, "grad_norm": 1.265625, "learning_rate": 0.00047340451011867985, "loss": 6.4206, "mean_token_accuracy": 0.1302155315876007, "num_tokens": 2326806.0, "step": 1470 }, { "entropy": 6.695640182495117, "epoch": 0.03206242935396922, "grad_norm": 1.2578125, "learning_rate": 0.00047284616979287515, "loss": 6.5783, "mean_token_accuracy": 0.12959000319242478, "num_tokens": 2334568.0, "step": 1475 }, { "entropy": 6.571360015869141, "epoch": 0.03217111555516912, "grad_norm": 1.109375, "learning_rate": 0.00047228240541438433, "loss": 6.5223, "mean_token_accuracy": 0.12900073900818826, "num_tokens": 2342361.0, "step": 1480 }, { "entropy": 6.571485424041748, "epoch": 0.03227980175636901, "grad_norm": 1.1796875, "learning_rate": 0.00047171323243909257, "loss": 6.4626, "mean_token_accuracy": 0.13145333901047707, "num_tokens": 2349593.0, "step": 1485 }, { "entropy": 6.519814300537109, "epoch": 0.03238848795756891, "grad_norm": 1.078125, "learning_rate": 0.00047113866647116457, "loss": 6.5831, "mean_token_accuracy": 0.12430679574608802, "num_tokens": 2357192.0, "step": 1490 }, { "entropy": 6.629279899597168, "epoch": 0.0324971741587688, "grad_norm": 1.1796875, "learning_rate": 0.0004705587232626164, "loss": 6.4638, "mean_token_accuracy": 0.12320095226168633, "num_tokens": 2365248.0, "step": 1495 }, { "entropy": 6.538986921310425, "epoch": 0.0326058603599687, "grad_norm": 1.046875, "learning_rate": 0.00046997341871288424, "loss": 6.4738, "mean_token_accuracy": 0.12518679574131966, "num_tokens": 2373505.0, "step": 1500 }, { "entropy": 6.536040925979615, "epoch": 0.032714546561168595, "grad_norm": 0.90234375, "learning_rate": 0.0004693827688683879, "loss": 6.5423, "mean_token_accuracy": 0.1335771270096302, "num_tokens": 2382949.0, "step": 1505 }, { "entropy": 6.558509492874146, "epoch": 0.03282323276236849, "grad_norm": 1.1015625, "learning_rate": 0.0004687867899220914, "loss": 6.4999, "mean_token_accuracy": 0.1334672413766384, "num_tokens": 2390134.0, "step": 1510 }, { "entropy": 6.495549535751342, "epoch": 0.03293191896356838, "grad_norm": 1.0546875, "learning_rate": 0.00046818549821305846, "loss": 6.4612, "mean_token_accuracy": 0.1316902793943882, "num_tokens": 2397742.0, "step": 1515 }, { "entropy": 6.587743139266967, "epoch": 0.03304060516476828, "grad_norm": 1.0625, "learning_rate": 0.00046757891022600494, "loss": 6.5267, "mean_token_accuracy": 0.12813749685883521, "num_tokens": 2405223.0, "step": 1520 }, { "entropy": 6.575222682952881, "epoch": 0.03314929136596818, "grad_norm": 1.03125, "learning_rate": 0.0004669670425908471, "loss": 6.533, "mean_token_accuracy": 0.13205342888832092, "num_tokens": 2413308.0, "step": 1525 }, { "entropy": 6.633901071548462, "epoch": 0.03325797756716807, "grad_norm": 1.09375, "learning_rate": 0.0004663499120822451, "loss": 6.567, "mean_token_accuracy": 0.11793626993894576, "num_tokens": 2420808.0, "step": 1530 }, { "entropy": 6.5440003871917725, "epoch": 0.03336666376836797, "grad_norm": 1.015625, "learning_rate": 0.0004657275356191437, "loss": 6.5334, "mean_token_accuracy": 0.12041784524917602, "num_tokens": 2429640.0, "step": 1535 }, { "entropy": 6.689853143692017, "epoch": 0.033475349969567865, "grad_norm": 1.1875, "learning_rate": 0.00046509993026430804, "loss": 6.5633, "mean_token_accuracy": 0.1279229164123535, "num_tokens": 2437328.0, "step": 1540 }, { "entropy": 6.499489879608154, "epoch": 0.03358403617076776, "grad_norm": 1.03125, "learning_rate": 0.0004644671132238558, "loss": 6.5067, "mean_token_accuracy": 0.1295216828584671, "num_tokens": 2445244.0, "step": 1545 }, { "entropy": 6.620385551452637, "epoch": 0.03369272237196765, "grad_norm": 0.98828125, "learning_rate": 0.00046382910184678585, "loss": 6.4369, "mean_token_accuracy": 0.1301434338092804, "num_tokens": 2453572.0, "step": 1550 }, { "entropy": 6.366896629333496, "epoch": 0.03380140857316755, "grad_norm": 1.140625, "learning_rate": 0.0004631859136245025, "loss": 6.4015, "mean_token_accuracy": 0.13501286879181862, "num_tokens": 2460485.0, "step": 1555 }, { "entropy": 6.632570362091064, "epoch": 0.03391009477436745, "grad_norm": 1.09375, "learning_rate": 0.0004625375661903357, "loss": 6.405, "mean_token_accuracy": 0.12899469584226608, "num_tokens": 2467370.0, "step": 1560 }, { "entropy": 6.527682161331176, "epoch": 0.03401878097556734, "grad_norm": 1.0546875, "learning_rate": 0.00046188407731905787, "loss": 6.5547, "mean_token_accuracy": 0.1285148099064827, "num_tokens": 2476221.0, "step": 1565 }, { "entropy": 6.6062336444854735, "epoch": 0.034127467176767234, "grad_norm": 1.109375, "learning_rate": 0.00046122546492639643, "loss": 6.5629, "mean_token_accuracy": 0.12118729501962662, "num_tokens": 2483971.0, "step": 1570 }, { "entropy": 6.520406293869018, "epoch": 0.034236153377967135, "grad_norm": 1.171875, "learning_rate": 0.000460561747068543, "loss": 6.4336, "mean_token_accuracy": 0.13079387471079826, "num_tokens": 2491462.0, "step": 1575 }, { "entropy": 6.47422046661377, "epoch": 0.03434483957916703, "grad_norm": 1.1640625, "learning_rate": 0.0004598929419416578, "loss": 6.4056, "mean_token_accuracy": 0.1340803399682045, "num_tokens": 2499577.0, "step": 1580 }, { "entropy": 6.574036169052124, "epoch": 0.03445352578036692, "grad_norm": 1.046875, "learning_rate": 0.00045921906788137123, "loss": 6.4668, "mean_token_accuracy": 0.13153123632073402, "num_tokens": 2508442.0, "step": 1585 }, { "entropy": 6.568566417694091, "epoch": 0.03456221198156682, "grad_norm": 1.015625, "learning_rate": 0.00045854014336228115, "loss": 6.649, "mean_token_accuracy": 0.1157750979065895, "num_tokens": 2517291.0, "step": 1590 }, { "entropy": 6.581708860397339, "epoch": 0.03467089818276672, "grad_norm": 1.1875, "learning_rate": 0.00045785618699744615, "loss": 6.4364, "mean_token_accuracy": 0.13571289256215097, "num_tokens": 2523844.0, "step": 1595 }, { "entropy": 6.505489349365234, "epoch": 0.03477958438396661, "grad_norm": 1.078125, "learning_rate": 0.00045716721753787543, "loss": 6.5653, "mean_token_accuracy": 0.12564576417207718, "num_tokens": 2532061.0, "step": 1600 }, { "entropy": 6.633800792694092, "epoch": 0.034888270585166505, "grad_norm": 1.1953125, "learning_rate": 0.0004564732538720148, "loss": 6.4121, "mean_token_accuracy": 0.13259042352437972, "num_tokens": 2539795.0, "step": 1605 }, { "entropy": 6.473930311203003, "epoch": 0.034996956786366405, "grad_norm": 1.1171875, "learning_rate": 0.00045577431502522877, "loss": 6.4229, "mean_token_accuracy": 0.12699868008494378, "num_tokens": 2547627.0, "step": 1610 }, { "entropy": 6.554611539840698, "epoch": 0.0351056429875663, "grad_norm": 1.1171875, "learning_rate": 0.0004550704201592787, "loss": 6.379, "mean_token_accuracy": 0.13499154895544052, "num_tokens": 2555532.0, "step": 1615 }, { "entropy": 6.449095153808594, "epoch": 0.03521432918876619, "grad_norm": 1.2109375, "learning_rate": 0.0004543615885717981, "loss": 6.3399, "mean_token_accuracy": 0.1383037745952606, "num_tokens": 2563568.0, "step": 1620 }, { "entropy": 6.513947772979736, "epoch": 0.035323015389966086, "grad_norm": 1.109375, "learning_rate": 0.00045364783969576296, "loss": 6.4384, "mean_token_accuracy": 0.13582201898097992, "num_tokens": 2571599.0, "step": 1625 }, { "entropy": 6.5380042552947994, "epoch": 0.03543170159116599, "grad_norm": 0.96484375, "learning_rate": 0.0004529291930989592, "loss": 6.4308, "mean_token_accuracy": 0.13048155084252358, "num_tokens": 2579417.0, "step": 1630 }, { "entropy": 6.477106666564941, "epoch": 0.03554038779236588, "grad_norm": 0.98046875, "learning_rate": 0.0004522056684834464, "loss": 6.4597, "mean_token_accuracy": 0.13081906735897064, "num_tokens": 2587935.0, "step": 1635 }, { "entropy": 6.538247537612915, "epoch": 0.035649073993565775, "grad_norm": 1.109375, "learning_rate": 0.0004514772856850173, "loss": 6.3801, "mean_token_accuracy": 0.12998153120279313, "num_tokens": 2595076.0, "step": 1640 }, { "entropy": 6.523086023330689, "epoch": 0.035757760194765675, "grad_norm": 1.109375, "learning_rate": 0.0004507440646726542, "loss": 6.421, "mean_token_accuracy": 0.13086821809411048, "num_tokens": 2602716.0, "step": 1645 }, { "entropy": 6.460543966293335, "epoch": 0.03586644639596557, "grad_norm": 1.015625, "learning_rate": 0.0004500060255479818, "loss": 6.4638, "mean_token_accuracy": 0.1328990265727043, "num_tokens": 2610457.0, "step": 1650 }, { "entropy": 6.583772754669189, "epoch": 0.03597513259716546, "grad_norm": 1.140625, "learning_rate": 0.0004492631885447151, "loss": 6.4479, "mean_token_accuracy": 0.13444233164191247, "num_tokens": 2618399.0, "step": 1655 }, { "entropy": 6.464978981018066, "epoch": 0.03608381879836536, "grad_norm": 1.1015625, "learning_rate": 0.00044851557402810616, "loss": 6.4389, "mean_token_accuracy": 0.13300132974982262, "num_tokens": 2625975.0, "step": 1660 }, { "entropy": 6.520250415802002, "epoch": 0.03619250499956526, "grad_norm": 1.0859375, "learning_rate": 0.00044776320249438444, "loss": 6.3903, "mean_token_accuracy": 0.1342037595808506, "num_tokens": 2633861.0, "step": 1665 }, { "entropy": 6.428459119796753, "epoch": 0.03630119120076515, "grad_norm": 1.1015625, "learning_rate": 0.00044700609457019565, "loss": 6.351, "mean_token_accuracy": 0.135555599629879, "num_tokens": 2641478.0, "step": 1670 }, { "entropy": 6.458524894714356, "epoch": 0.036409877401965045, "grad_norm": 1.1640625, "learning_rate": 0.0004462442710120359, "loss": 6.3658, "mean_token_accuracy": 0.1361924558877945, "num_tokens": 2649282.0, "step": 1675 }, { "entropy": 6.466368627548218, "epoch": 0.036518563603164945, "grad_norm": 1.1875, "learning_rate": 0.000445477752705683, "loss": 6.2352, "mean_token_accuracy": 0.14827430844306946, "num_tokens": 2656129.0, "step": 1680 }, { "entropy": 6.3706169605255125, "epoch": 0.03662724980436484, "grad_norm": 1.078125, "learning_rate": 0.00044470656066562336, "loss": 6.4333, "mean_token_accuracy": 0.1218526192009449, "num_tokens": 2663070.0, "step": 1685 }, { "entropy": 6.563682889938354, "epoch": 0.03673593600556473, "grad_norm": 0.9921875, "learning_rate": 0.0004439307160344765, "loss": 6.354, "mean_token_accuracy": 0.13783733993768693, "num_tokens": 2670167.0, "step": 1690 }, { "entropy": 6.5183515548706055, "epoch": 0.03684462220676463, "grad_norm": 1.0390625, "learning_rate": 0.00044315024008241473, "loss": 6.484, "mean_token_accuracy": 0.12654226571321486, "num_tokens": 2677920.0, "step": 1695 }, { "entropy": 6.550176572799683, "epoch": 0.03695330840796453, "grad_norm": 1.1484375, "learning_rate": 0.0004423651542065806, "loss": 6.3382, "mean_token_accuracy": 0.13361814990639687, "num_tokens": 2684388.0, "step": 1700 }, { "entropy": 6.384865379333496, "epoch": 0.03706199460916442, "grad_norm": 1.1015625, "learning_rate": 0.00044157547993050006, "loss": 6.3741, "mean_token_accuracy": 0.1353348322212696, "num_tokens": 2692231.0, "step": 1705 }, { "entropy": 6.443640995025635, "epoch": 0.037170680810364315, "grad_norm": 1.03125, "learning_rate": 0.00044078123890349227, "loss": 6.4508, "mean_token_accuracy": 0.13217496126890182, "num_tokens": 2700075.0, "step": 1710 }, { "entropy": 6.5465617179870605, "epoch": 0.03727936701156421, "grad_norm": 0.94921875, "learning_rate": 0.00043998245290007606, "loss": 6.4546, "mean_token_accuracy": 0.1277106761932373, "num_tokens": 2708951.0, "step": 1715 }, { "entropy": 6.462393426895142, "epoch": 0.03738805321276411, "grad_norm": 1.171875, "learning_rate": 0.00043917914381937323, "loss": 6.4102, "mean_token_accuracy": 0.13752326667308806, "num_tokens": 2716294.0, "step": 1720 }, { "entropy": 6.569583129882813, "epoch": 0.037496739413964, "grad_norm": 1.0703125, "learning_rate": 0.00043837133368450815, "loss": 6.4967, "mean_token_accuracy": 0.12161010652780532, "num_tokens": 2724093.0, "step": 1725 }, { "entropy": 6.513576364517212, "epoch": 0.0376054256151639, "grad_norm": 1.1484375, "learning_rate": 0.0004375590446420037, "loss": 6.3602, "mean_token_accuracy": 0.13403671607375145, "num_tokens": 2731710.0, "step": 1730 }, { "entropy": 6.401008653640747, "epoch": 0.0377141118163638, "grad_norm": 1.09375, "learning_rate": 0.0004367422989611743, "loss": 6.4097, "mean_token_accuracy": 0.13267221450805664, "num_tokens": 2740007.0, "step": 1735 }, { "entropy": 6.472448682785034, "epoch": 0.03782279801756369, "grad_norm": 1.1171875, "learning_rate": 0.0004359211190335153, "loss": 6.4079, "mean_token_accuracy": 0.12942041605710983, "num_tokens": 2747257.0, "step": 1740 }, { "entropy": 6.5088489055633545, "epoch": 0.037931484218763585, "grad_norm": 1.1796875, "learning_rate": 0.00043509552737208923, "loss": 6.48, "mean_token_accuracy": 0.12736652791500092, "num_tokens": 2755932.0, "step": 1745 }, { "entropy": 6.545922040939331, "epoch": 0.03804017041996348, "grad_norm": 1.0234375, "learning_rate": 0.00043426554661090853, "loss": 6.4148, "mean_token_accuracy": 0.132827740162611, "num_tokens": 2764215.0, "step": 1750 }, { "entropy": 6.4098350524902346, "epoch": 0.03814885662116338, "grad_norm": 1.0859375, "learning_rate": 0.00043343119950431516, "loss": 6.3495, "mean_token_accuracy": 0.13987976163625718, "num_tokens": 2771756.0, "step": 1755 }, { "entropy": 6.4801195621490475, "epoch": 0.03825754282236327, "grad_norm": 1.109375, "learning_rate": 0.00043259250892635644, "loss": 6.4278, "mean_token_accuracy": 0.1352240838110447, "num_tokens": 2779545.0, "step": 1760 }, { "entropy": 6.543670701980591, "epoch": 0.03836622902356317, "grad_norm": 1.1015625, "learning_rate": 0.0004317494978701582, "loss": 6.4494, "mean_token_accuracy": 0.13165312260389328, "num_tokens": 2787709.0, "step": 1765 }, { "entropy": 6.437568712234497, "epoch": 0.03847491522476306, "grad_norm": 1.1484375, "learning_rate": 0.0004309021894472943, "loss": 6.3888, "mean_token_accuracy": 0.1326165869832039, "num_tokens": 2795822.0, "step": 1770 }, { "entropy": 6.432380104064942, "epoch": 0.03858360142596296, "grad_norm": 0.96875, "learning_rate": 0.0004300506068871534, "loss": 6.3875, "mean_token_accuracy": 0.13581312224268913, "num_tokens": 2804438.0, "step": 1775 }, { "entropy": 6.4600687503814695, "epoch": 0.038692287627162855, "grad_norm": 1.0390625, "learning_rate": 0.00042919477353630135, "loss": 6.3309, "mean_token_accuracy": 0.13892574086785317, "num_tokens": 2812051.0, "step": 1780 }, { "entropy": 6.426763820648193, "epoch": 0.03880097382836275, "grad_norm": 1.125, "learning_rate": 0.000428334712857842, "loss": 6.3632, "mean_token_accuracy": 0.13622673973441124, "num_tokens": 2820478.0, "step": 1785 }, { "entropy": 6.482985639572144, "epoch": 0.03890966002956265, "grad_norm": 1.046875, "learning_rate": 0.00042747044843077304, "loss": 6.3994, "mean_token_accuracy": 0.13121038153767586, "num_tokens": 2828756.0, "step": 1790 }, { "entropy": 6.399754571914673, "epoch": 0.03901834623076254, "grad_norm": 1.125, "learning_rate": 0.00042660200394934047, "loss": 6.3088, "mean_token_accuracy": 0.14511832892894744, "num_tokens": 2836163.0, "step": 1795 }, { "entropy": 6.380357122421264, "epoch": 0.03912703243196244, "grad_norm": 1.0859375, "learning_rate": 0.00042572940322238844, "loss": 6.381, "mean_token_accuracy": 0.13844038397073746, "num_tokens": 2844323.0, "step": 1800 }, { "entropy": 6.459079074859619, "epoch": 0.03923571863316233, "grad_norm": 1.046875, "learning_rate": 0.00042485267017270664, "loss": 6.3475, "mean_token_accuracy": 0.13634610474109649, "num_tokens": 2852158.0, "step": 1805 }, { "entropy": 6.420756530761719, "epoch": 0.03934440483436223, "grad_norm": 1.09375, "learning_rate": 0.0004239718288363745, "loss": 6.3166, "mean_token_accuracy": 0.13739913552999497, "num_tokens": 2859418.0, "step": 1810 }, { "entropy": 6.426111793518066, "epoch": 0.039453091035562125, "grad_norm": 1.0546875, "learning_rate": 0.0004230869033621023, "loss": 6.4268, "mean_token_accuracy": 0.12757971361279488, "num_tokens": 2866993.0, "step": 1815 }, { "entropy": 6.48082594871521, "epoch": 0.03956177723676202, "grad_norm": 1.1015625, "learning_rate": 0.0004221979180105688, "loss": 6.2442, "mean_token_accuracy": 0.14385330006480218, "num_tokens": 2874341.0, "step": 1820 }, { "entropy": 6.469588851928711, "epoch": 0.03967046343796192, "grad_norm": 1.2109375, "learning_rate": 0.00042130489715375645, "loss": 6.4488, "mean_token_accuracy": 0.1317708507180214, "num_tokens": 2882332.0, "step": 1825 }, { "entropy": 6.4172779560089115, "epoch": 0.039779149639161814, "grad_norm": 1.0859375, "learning_rate": 0.00042040786527428335, "loss": 6.3017, "mean_token_accuracy": 0.14140139743685723, "num_tokens": 2889901.0, "step": 1830 }, { "entropy": 6.5247608661651615, "epoch": 0.03988783584036171, "grad_norm": 1.6328125, "learning_rate": 0.0004195068469647315, "loss": 6.429, "mean_token_accuracy": 0.12834445238113404, "num_tokens": 2897732.0, "step": 1835 }, { "entropy": 6.410207319259643, "epoch": 0.0399965220415616, "grad_norm": 1.0078125, "learning_rate": 0.00041860186692697297, "loss": 6.3051, "mean_token_accuracy": 0.13572658076882363, "num_tokens": 2906036.0, "step": 1840 }, { "entropy": 6.344397115707397, "epoch": 0.0401052082427615, "grad_norm": 1.125, "learning_rate": 0.00041769294997149264, "loss": 6.336, "mean_token_accuracy": 0.13653432950377464, "num_tokens": 2913406.0, "step": 1845 }, { "entropy": 6.4600622177124025, "epoch": 0.040213894443961395, "grad_norm": 1.1015625, "learning_rate": 0.0004167801210167081, "loss": 6.3678, "mean_token_accuracy": 0.13492351323366164, "num_tokens": 2921468.0, "step": 1850 }, { "entropy": 6.381730365753174, "epoch": 0.04032258064516129, "grad_norm": 1.03125, "learning_rate": 0.0004158634050882861, "loss": 6.2972, "mean_token_accuracy": 0.1388672910630703, "num_tokens": 2929220.0, "step": 1855 }, { "entropy": 6.502804088592529, "epoch": 0.04043126684636118, "grad_norm": 1.1484375, "learning_rate": 0.0004149428273184569, "loss": 6.4621, "mean_token_accuracy": 0.13003402724862098, "num_tokens": 2937452.0, "step": 1860 }, { "entropy": 6.5060210704803465, "epoch": 0.040539953047561084, "grad_norm": 1.0, "learning_rate": 0.0004140184129453253, "loss": 6.3967, "mean_token_accuracy": 0.13554264083504677, "num_tokens": 2946157.0, "step": 1865 }, { "entropy": 6.35983681678772, "epoch": 0.04064863924876098, "grad_norm": 1.046875, "learning_rate": 0.000413090187312178, "loss": 6.2866, "mean_token_accuracy": 0.13986295610666274, "num_tokens": 2953445.0, "step": 1870 }, { "entropy": 6.422707271575928, "epoch": 0.04075732544996087, "grad_norm": 1.1640625, "learning_rate": 0.0004121581758667898, "loss": 6.3382, "mean_token_accuracy": 0.13599542155861855, "num_tokens": 2961818.0, "step": 1875 }, { "entropy": 6.40128526687622, "epoch": 0.04086601165116077, "grad_norm": 1.0703125, "learning_rate": 0.00041122240416072533, "loss": 6.335, "mean_token_accuracy": 0.13727616444230079, "num_tokens": 2969811.0, "step": 1880 }, { "entropy": 6.453525066375732, "epoch": 0.040974697852360666, "grad_norm": 0.96875, "learning_rate": 0.0004102828978486385, "loss": 6.3521, "mean_token_accuracy": 0.13766252547502517, "num_tokens": 2978291.0, "step": 1885 }, { "entropy": 6.41055645942688, "epoch": 0.04108338405356056, "grad_norm": 1.1875, "learning_rate": 0.0004093396826875695, "loss": 6.317, "mean_token_accuracy": 0.13951440081000327, "num_tokens": 2985624.0, "step": 1890 }, { "entropy": 6.40109486579895, "epoch": 0.04119207025476045, "grad_norm": 1.1953125, "learning_rate": 0.00040839278453623837, "loss": 6.3304, "mean_token_accuracy": 0.13785064667463304, "num_tokens": 2993078.0, "step": 1895 }, { "entropy": 6.453061771392822, "epoch": 0.041300756455960354, "grad_norm": 0.96875, "learning_rate": 0.0004074422293543363, "loss": 6.3396, "mean_token_accuracy": 0.14081092923879623, "num_tokens": 3001208.0, "step": 1900 }, { "entropy": 6.355777645111084, "epoch": 0.04140944265716025, "grad_norm": 1.125, "learning_rate": 0.0004064880432018137, "loss": 6.2945, "mean_token_accuracy": 0.13765922859311103, "num_tokens": 3008721.0, "step": 1905 }, { "entropy": 6.405518579483032, "epoch": 0.04151812885836014, "grad_norm": 1.0078125, "learning_rate": 0.00040553025223816615, "loss": 6.3345, "mean_token_accuracy": 0.13959560170769691, "num_tokens": 3016895.0, "step": 1910 }, { "entropy": 6.4162850856781, "epoch": 0.041626815059560035, "grad_norm": 1.1640625, "learning_rate": 0.00040456888272171653, "loss": 6.2956, "mean_token_accuracy": 0.14023387357592582, "num_tokens": 3024525.0, "step": 1915 }, { "entropy": 6.41334981918335, "epoch": 0.041735501260759936, "grad_norm": 1.0, "learning_rate": 0.00040360396100889577, "loss": 6.3748, "mean_token_accuracy": 0.1350133463740349, "num_tokens": 3032628.0, "step": 1920 }, { "entropy": 6.421497774124146, "epoch": 0.04184418746195983, "grad_norm": 1.09375, "learning_rate": 0.0004026355135535202, "loss": 6.2696, "mean_token_accuracy": 0.13667341843247413, "num_tokens": 3041123.0, "step": 1925 }, { "entropy": 6.2926805973052975, "epoch": 0.04195287366315972, "grad_norm": 1.0390625, "learning_rate": 0.000401663566906066, "loss": 6.2008, "mean_token_accuracy": 0.14734140411019325, "num_tokens": 3048367.0, "step": 1930 }, { "entropy": 6.407898807525635, "epoch": 0.042061559864359624, "grad_norm": 1.0859375, "learning_rate": 0.00040068814771294134, "loss": 6.3414, "mean_token_accuracy": 0.13200511485338212, "num_tokens": 3057257.0, "step": 1935 }, { "entropy": 6.4973756790161135, "epoch": 0.04217024606555952, "grad_norm": 1.0859375, "learning_rate": 0.0003997092827157562, "loss": 6.3839, "mean_token_accuracy": 0.13520105555653572, "num_tokens": 3065538.0, "step": 1940 }, { "entropy": 6.375053262710571, "epoch": 0.04227893226675941, "grad_norm": 1.125, "learning_rate": 0.000398726998750589, "loss": 6.3181, "mean_token_accuracy": 0.14364981800317764, "num_tokens": 3073215.0, "step": 1945 }, { "entropy": 6.431594753265381, "epoch": 0.042387618467959305, "grad_norm": 1.21875, "learning_rate": 0.00039774132274725076, "loss": 6.3236, "mean_token_accuracy": 0.14194342046976088, "num_tokens": 3080713.0, "step": 1950 }, { "entropy": 6.475106859207154, "epoch": 0.042496304669159206, "grad_norm": 0.95703125, "learning_rate": 0.00039675228172854707, "loss": 6.4159, "mean_token_accuracy": 0.1319071814417839, "num_tokens": 3089339.0, "step": 1955 }, { "entropy": 6.373333311080932, "epoch": 0.0426049908703591, "grad_norm": 1.0390625, "learning_rate": 0.0003957599028095371, "loss": 6.3513, "mean_token_accuracy": 0.14044444710016252, "num_tokens": 3097315.0, "step": 1960 }, { "entropy": 6.446169137954712, "epoch": 0.04271367707155899, "grad_norm": 1.0390625, "learning_rate": 0.00039476421319679017, "loss": 6.3213, "mean_token_accuracy": 0.13605728298425673, "num_tokens": 3104924.0, "step": 1965 }, { "entropy": 6.359133243560791, "epoch": 0.04282236327275889, "grad_norm": 0.9921875, "learning_rate": 0.00039376524018764, "loss": 6.2606, "mean_token_accuracy": 0.14185562431812287, "num_tokens": 3113107.0, "step": 1970 }, { "entropy": 6.3946362972259525, "epoch": 0.04293104947395879, "grad_norm": 1.0703125, "learning_rate": 0.00039276301116943616, "loss": 6.3506, "mean_token_accuracy": 0.13473108187317848, "num_tokens": 3121410.0, "step": 1975 }, { "entropy": 6.389178657531739, "epoch": 0.04303973567515868, "grad_norm": 1.125, "learning_rate": 0.0003917575536187936, "loss": 6.3093, "mean_token_accuracy": 0.1421495869755745, "num_tokens": 3129020.0, "step": 1980 }, { "entropy": 6.429538202285767, "epoch": 0.043148421876358575, "grad_norm": 1.1875, "learning_rate": 0.00039074889510083894, "loss": 6.2758, "mean_token_accuracy": 0.13987535163760184, "num_tokens": 3136934.0, "step": 1985 }, { "entropy": 6.408135843276978, "epoch": 0.043257108077558476, "grad_norm": 1.1171875, "learning_rate": 0.00038973706326845495, "loss": 6.3525, "mean_token_accuracy": 0.13694941774010658, "num_tokens": 3144742.0, "step": 1990 }, { "entropy": 6.473373699188232, "epoch": 0.04336579427875837, "grad_norm": 1.109375, "learning_rate": 0.0003887220858615225, "loss": 6.319, "mean_token_accuracy": 0.1362934321165085, "num_tokens": 3151731.0, "step": 1995 }, { "entropy": 6.4309955596923825, "epoch": 0.043474480479958263, "grad_norm": 1.0625, "learning_rate": 0.0003877039907061597, "loss": 6.3891, "mean_token_accuracy": 0.13514773100614547, "num_tokens": 3159781.0, "step": 2000 }, { "entropy": 6.431392335891724, "epoch": 0.04358316668115816, "grad_norm": 1.1015625, "learning_rate": 0.0003866828057139598, "loss": 6.3403, "mean_token_accuracy": 0.13589958250522613, "num_tokens": 3167896.0, "step": 2005 }, { "entropy": 6.383094835281372, "epoch": 0.04369185288235806, "grad_norm": 1.203125, "learning_rate": 0.00038565855888122503, "loss": 6.3414, "mean_token_accuracy": 0.1376558393239975, "num_tokens": 3176573.0, "step": 2010 }, { "entropy": 6.377293491363526, "epoch": 0.04380053908355795, "grad_norm": 1.03125, "learning_rate": 0.00038463127828819975, "loss": 6.1985, "mean_token_accuracy": 0.1522999309003353, "num_tokens": 3184935.0, "step": 2015 }, { "entropy": 6.331845140457153, "epoch": 0.043909225284757845, "grad_norm": 1.1328125, "learning_rate": 0.00038360099209830043, "loss": 6.264, "mean_token_accuracy": 0.1453753650188446, "num_tokens": 3192220.0, "step": 2020 }, { "entropy": 6.460266923904419, "epoch": 0.044017911485957746, "grad_norm": 0.96875, "learning_rate": 0.0003825677285573433, "loss": 6.2932, "mean_token_accuracy": 0.14447869211435319, "num_tokens": 3200330.0, "step": 2025 }, { "entropy": 6.3918225288391115, "epoch": 0.04412659768715764, "grad_norm": 1.0234375, "learning_rate": 0.00038153151599277027, "loss": 6.328, "mean_token_accuracy": 0.1438807040452957, "num_tokens": 3208076.0, "step": 2030 }, { "entropy": 6.434448146820069, "epoch": 0.044235283888357534, "grad_norm": 1.0703125, "learning_rate": 0.0003804923828128723, "loss": 6.2808, "mean_token_accuracy": 0.1417445071041584, "num_tokens": 3216326.0, "step": 2035 }, { "entropy": 6.358164215087891, "epoch": 0.04434397008955743, "grad_norm": 1.015625, "learning_rate": 0.0003794503575060104, "loss": 6.3514, "mean_token_accuracy": 0.13139131888747216, "num_tokens": 3224322.0, "step": 2040 }, { "entropy": 6.407972049713135, "epoch": 0.04445265629075733, "grad_norm": 1.1640625, "learning_rate": 0.00037840546863983484, "loss": 6.2797, "mean_token_accuracy": 0.1365787222981453, "num_tokens": 3231766.0, "step": 2045 }, { "entropy": 6.426673221588135, "epoch": 0.04456134249195722, "grad_norm": 0.96875, "learning_rate": 0.0003773577448605015, "loss": 6.3085, "mean_token_accuracy": 0.136894803494215, "num_tokens": 3239936.0, "step": 2050 }, { "entropy": 6.341384601593018, "epoch": 0.044670028693157116, "grad_norm": 1.0625, "learning_rate": 0.0003763072148918872, "loss": 6.2338, "mean_token_accuracy": 0.13770833760499954, "num_tokens": 3248185.0, "step": 2055 }, { "entropy": 6.430909919738769, "epoch": 0.04477871489435701, "grad_norm": 1.125, "learning_rate": 0.0003752539075348017, "loss": 6.2252, "mean_token_accuracy": 0.14265335500240325, "num_tokens": 3256051.0, "step": 2060 }, { "entropy": 6.481796169281006, "epoch": 0.04488740109555691, "grad_norm": 1.0546875, "learning_rate": 0.00037419785166619817, "loss": 6.3142, "mean_token_accuracy": 0.13447861969470978, "num_tokens": 3264128.0, "step": 2065 }, { "entropy": 6.342309761047363, "epoch": 0.044996087296756804, "grad_norm": 1.109375, "learning_rate": 0.0003731390762383818, "loss": 6.383, "mean_token_accuracy": 0.13557247668504716, "num_tokens": 3272633.0, "step": 2070 }, { "entropy": 6.4529866695404055, "epoch": 0.0451047734979567, "grad_norm": 1.140625, "learning_rate": 0.0003720776102782158, "loss": 6.386, "mean_token_accuracy": 0.142952311784029, "num_tokens": 3281139.0, "step": 2075 }, { "entropy": 6.303681421279907, "epoch": 0.0452134596991566, "grad_norm": 0.95703125, "learning_rate": 0.00037101348288632555, "loss": 6.1852, "mean_token_accuracy": 0.1471434824168682, "num_tokens": 3289384.0, "step": 2080 }, { "entropy": 6.332111644744873, "epoch": 0.04532214590035649, "grad_norm": 1.1015625, "learning_rate": 0.0003699467232363012, "loss": 6.272, "mean_token_accuracy": 0.14111893102526665, "num_tokens": 3297103.0, "step": 2085 }, { "entropy": 6.413033151626587, "epoch": 0.045430832101556386, "grad_norm": 1.1015625, "learning_rate": 0.0003688773605738973, "loss": 6.2727, "mean_token_accuracy": 0.14211916625499726, "num_tokens": 3304497.0, "step": 2090 }, { "entropy": 6.440083169937134, "epoch": 0.04553951830275628, "grad_norm": 1.109375, "learning_rate": 0.00036780542421623134, "loss": 6.3613, "mean_token_accuracy": 0.13257155790925026, "num_tokens": 3311691.0, "step": 2095 }, { "entropy": 6.319086742401123, "epoch": 0.04564820450395618, "grad_norm": 1.3203125, "learning_rate": 0.0003667309435509802, "loss": 6.2465, "mean_token_accuracy": 0.14056456089019775, "num_tokens": 3320547.0, "step": 2100 }, { "entropy": 6.4411708354949955, "epoch": 0.045756890705156074, "grad_norm": 1.21875, "learning_rate": 0.0003656539480355741, "loss": 6.2822, "mean_token_accuracy": 0.13730876967310907, "num_tokens": 3328629.0, "step": 2105 }, { "entropy": 6.42737603187561, "epoch": 0.04586557690635597, "grad_norm": 1.203125, "learning_rate": 0.0003645744671963891, "loss": 6.3231, "mean_token_accuracy": 0.14296908006072045, "num_tokens": 3336050.0, "step": 2110 }, { "entropy": 6.277024555206299, "epoch": 0.04597426310755586, "grad_norm": 1.171875, "learning_rate": 0.0003634925306279376, "loss": 6.1642, "mean_token_accuracy": 0.14555428475141524, "num_tokens": 3343736.0, "step": 2115 }, { "entropy": 6.362267398834229, "epoch": 0.04608294930875576, "grad_norm": 1.109375, "learning_rate": 0.0003624081679920574, "loss": 6.2673, "mean_token_accuracy": 0.13701179027557372, "num_tokens": 3350841.0, "step": 2120 }, { "entropy": 6.399694347381592, "epoch": 0.046191635509955656, "grad_norm": 1.0078125, "learning_rate": 0.0003613214090170977, "loss": 6.4041, "mean_token_accuracy": 0.1311640538275242, "num_tokens": 3359792.0, "step": 2125 }, { "entropy": 6.386282014846802, "epoch": 0.04630032171115555, "grad_norm": 1.34375, "learning_rate": 0.0003602322834971048, "loss": 6.2087, "mean_token_accuracy": 0.14746672958135604, "num_tokens": 3366959.0, "step": 2130 }, { "entropy": 6.345727109909058, "epoch": 0.04640900791235545, "grad_norm": 1.125, "learning_rate": 0.0003591408212910051, "loss": 6.3342, "mean_token_accuracy": 0.13067435547709466, "num_tokens": 3375243.0, "step": 2135 }, { "entropy": 6.332585048675537, "epoch": 0.046517694113555344, "grad_norm": 1.109375, "learning_rate": 0.0003580470523217863, "loss": 6.1901, "mean_token_accuracy": 0.14754107296466829, "num_tokens": 3382735.0, "step": 2140 }, { "entropy": 6.329954290390015, "epoch": 0.04662638031475524, "grad_norm": 1.109375, "learning_rate": 0.0003569510065756771, "loss": 6.2346, "mean_token_accuracy": 0.14045259580016137, "num_tokens": 3390041.0, "step": 2145 }, { "entropy": 6.354192924499512, "epoch": 0.04673506651595513, "grad_norm": 1.0078125, "learning_rate": 0.0003558527141013254, "loss": 6.2207, "mean_token_accuracy": 0.14744865596294404, "num_tokens": 3397385.0, "step": 2150 }, { "entropy": 6.311786699295044, "epoch": 0.04684375271715503, "grad_norm": 1.078125, "learning_rate": 0.0003547522050089742, "loss": 6.2298, "mean_token_accuracy": 0.1454736463725567, "num_tokens": 3404499.0, "step": 2155 }, { "entropy": 6.40657868385315, "epoch": 0.046952438918354926, "grad_norm": 1.0390625, "learning_rate": 0.00035364950946963606, "loss": 6.2401, "mean_token_accuracy": 0.14431775584816933, "num_tokens": 3412650.0, "step": 2160 }, { "entropy": 6.263350868225098, "epoch": 0.04706112511955482, "grad_norm": 1.0859375, "learning_rate": 0.0003525446577142663, "loss": 6.2667, "mean_token_accuracy": 0.1401475727558136, "num_tokens": 3420282.0, "step": 2165 }, { "entropy": 6.392113447189331, "epoch": 0.04716981132075472, "grad_norm": 1.1796875, "learning_rate": 0.00035143768003293395, "loss": 6.2028, "mean_token_accuracy": 0.14057230800390244, "num_tokens": 3427706.0, "step": 2170 }, { "entropy": 6.307991933822632, "epoch": 0.047278497521954614, "grad_norm": 1.0, "learning_rate": 0.0003503286067739913, "loss": 6.3039, "mean_token_accuracy": 0.1375028222799301, "num_tokens": 3436088.0, "step": 2175 }, { "entropy": 6.364810371398926, "epoch": 0.04738718372315451, "grad_norm": 1.0546875, "learning_rate": 0.00034921746834324193, "loss": 6.1777, "mean_token_accuracy": 0.15691623613238334, "num_tokens": 3444200.0, "step": 2180 }, { "entropy": 6.327755641937256, "epoch": 0.0474958699243544, "grad_norm": 1.0546875, "learning_rate": 0.0003481042952031072, "loss": 6.2187, "mean_token_accuracy": 0.143999794870615, "num_tokens": 3452684.0, "step": 2185 }, { "entropy": 6.2792760848999025, "epoch": 0.0476045561255543, "grad_norm": 1.15625, "learning_rate": 0.0003469891178717911, "loss": 6.1575, "mean_token_accuracy": 0.14571396857500077, "num_tokens": 3460347.0, "step": 2190 }, { "entropy": 6.320020341873169, "epoch": 0.047713242326754196, "grad_norm": 1.078125, "learning_rate": 0.0003458719669224436, "loss": 6.2914, "mean_token_accuracy": 0.13896366208791733, "num_tokens": 3467956.0, "step": 2195 }, { "entropy": 6.35538878440857, "epoch": 0.04782192852795409, "grad_norm": 1.140625, "learning_rate": 0.0003447528729823221, "loss": 6.175, "mean_token_accuracy": 0.1493356004357338, "num_tokens": 3474803.0, "step": 2200 }, { "entropy": 6.3529205322265625, "epoch": 0.047930614729153984, "grad_norm": 1.171875, "learning_rate": 0.0003436318667319525, "loss": 6.2878, "mean_token_accuracy": 0.13683823347091675, "num_tokens": 3482390.0, "step": 2205 }, { "entropy": 6.39755654335022, "epoch": 0.048039300930353884, "grad_norm": 1.015625, "learning_rate": 0.00034250897890428716, "loss": 6.2117, "mean_token_accuracy": 0.14897590279579162, "num_tokens": 3489742.0, "step": 2210 }, { "entropy": 6.369425535202026, "epoch": 0.04814798713155378, "grad_norm": 1.078125, "learning_rate": 0.0003413842402838633, "loss": 6.2722, "mean_token_accuracy": 0.14080924764275551, "num_tokens": 3497257.0, "step": 2215 }, { "entropy": 6.442922210693359, "epoch": 0.04825667333275367, "grad_norm": 1.1015625, "learning_rate": 0.00034025768170595834, "loss": 6.3458, "mean_token_accuracy": 0.130158282071352, "num_tokens": 3506258.0, "step": 2220 }, { "entropy": 6.398208045959473, "epoch": 0.04836535953395357, "grad_norm": 0.99609375, "learning_rate": 0.0003391293340557446, "loss": 6.2848, "mean_token_accuracy": 0.14103573709726333, "num_tokens": 3514109.0, "step": 2225 }, { "entropy": 6.347044658660889, "epoch": 0.048474045735153466, "grad_norm": 1.1328125, "learning_rate": 0.0003379992282674431, "loss": 6.1916, "mean_token_accuracy": 0.14575656726956368, "num_tokens": 3521654.0, "step": 2230 }, { "entropy": 6.344361257553101, "epoch": 0.04858273193635336, "grad_norm": 1.0546875, "learning_rate": 0.0003368673953234749, "loss": 6.1765, "mean_token_accuracy": 0.14519614577293397, "num_tokens": 3528943.0, "step": 2235 }, { "entropy": 6.325352907180786, "epoch": 0.048691418137553254, "grad_norm": 1.1328125, "learning_rate": 0.00033573386625361176, "loss": 6.1874, "mean_token_accuracy": 0.1502646818757057, "num_tokens": 3536182.0, "step": 2240 }, { "entropy": 6.360516691207886, "epoch": 0.048800104338753154, "grad_norm": 1.1171875, "learning_rate": 0.00033459867213412567, "loss": 6.1989, "mean_token_accuracy": 0.1458291694521904, "num_tokens": 3543446.0, "step": 2245 }, { "entropy": 6.3320952415466305, "epoch": 0.04890879053995305, "grad_norm": 1.1484375, "learning_rate": 0.000333461844086937, "loss": 6.3055, "mean_token_accuracy": 0.1307961642742157, "num_tokens": 3550418.0, "step": 2250 }, { "entropy": 6.3693479061126705, "epoch": 0.04901747674115294, "grad_norm": 1.0625, "learning_rate": 0.00033232341327876097, "loss": 6.2303, "mean_token_accuracy": 0.14581648483872414, "num_tokens": 3558403.0, "step": 2255 }, { "entropy": 6.360597085952759, "epoch": 0.049126162942352836, "grad_norm": 1.0, "learning_rate": 0.0003311834109202531, "loss": 6.2327, "mean_token_accuracy": 0.14444623440504073, "num_tokens": 3566365.0, "step": 2260 }, { "entropy": 6.362605428695678, "epoch": 0.049234849143552736, "grad_norm": 1.046875, "learning_rate": 0.00033004186826515416, "loss": 6.254, "mean_token_accuracy": 0.14103433042764663, "num_tokens": 3574648.0, "step": 2265 }, { "entropy": 6.3952125072479244, "epoch": 0.04934353534475263, "grad_norm": 1.125, "learning_rate": 0.0003288988166094324, "loss": 6.2518, "mean_token_accuracy": 0.1349252924323082, "num_tokens": 3581993.0, "step": 2270 }, { "entropy": 6.285873746871948, "epoch": 0.049452221545952524, "grad_norm": 1.171875, "learning_rate": 0.00032775428729042656, "loss": 6.0713, "mean_token_accuracy": 0.14827482253313065, "num_tokens": 3589229.0, "step": 2275 }, { "entropy": 6.245410346984864, "epoch": 0.049560907747152425, "grad_norm": 1.046875, "learning_rate": 0.000326608311685986, "loss": 6.1994, "mean_token_accuracy": 0.14884500652551652, "num_tokens": 3597560.0, "step": 2280 }, { "entropy": 6.373068618774414, "epoch": 0.04966959394835232, "grad_norm": 1.1484375, "learning_rate": 0.0003254609212136108, "loss": 6.1644, "mean_token_accuracy": 0.14538974687457085, "num_tokens": 3605558.0, "step": 2285 }, { "entropy": 6.245131349563598, "epoch": 0.04977828014955221, "grad_norm": 1.0703125, "learning_rate": 0.00032431214732959036, "loss": 6.1659, "mean_token_accuracy": 0.15103522837162017, "num_tokens": 3613080.0, "step": 2290 }, { "entropy": 6.331179475784301, "epoch": 0.049886966350752106, "grad_norm": 1.203125, "learning_rate": 0.000323162021528141, "loss": 6.3188, "mean_token_accuracy": 0.14189708456397057, "num_tokens": 3620907.0, "step": 2295 }, { "entropy": 6.475124979019165, "epoch": 0.049995652551952006, "grad_norm": 1.09375, "learning_rate": 0.00032201057534054264, "loss": 6.2626, "mean_token_accuracy": 0.13620245233178138, "num_tokens": 3630046.0, "step": 2300 }, { "entropy": 6.352400922775269, "epoch": 0.0501043387531519, "grad_norm": 1.15625, "learning_rate": 0.00032085784033427414, "loss": 6.1488, "mean_token_accuracy": 0.145827666670084, "num_tokens": 3637492.0, "step": 2305 }, { "entropy": 6.361015510559082, "epoch": 0.050213024954351794, "grad_norm": 1.109375, "learning_rate": 0.0003197038481121478, "loss": 6.2743, "mean_token_accuracy": 0.14036672934889793, "num_tokens": 3645770.0, "step": 2310 }, { "entropy": 6.382439994812012, "epoch": 0.05032171115555169, "grad_norm": 1.2734375, "learning_rate": 0.0003185486303114436, "loss": 6.2207, "mean_token_accuracy": 0.13502092361450196, "num_tokens": 3654171.0, "step": 2315 }, { "entropy": 6.313130712509155, "epoch": 0.05043039735675159, "grad_norm": 1.125, "learning_rate": 0.0003173922186030409, "loss": 6.1364, "mean_token_accuracy": 0.15124589800834656, "num_tokens": 3661158.0, "step": 2320 }, { "entropy": 6.174329662322998, "epoch": 0.05053908355795148, "grad_norm": 1.171875, "learning_rate": 0.000316234644690551, "loss": 6.1544, "mean_token_accuracy": 0.14774754047393798, "num_tokens": 3669247.0, "step": 2325 }, { "entropy": 6.351832914352417, "epoch": 0.050647769759151376, "grad_norm": 1.046875, "learning_rate": 0.0003150759403094473, "loss": 6.2254, "mean_token_accuracy": 0.14423187524080278, "num_tokens": 3676917.0, "step": 2330 }, { "entropy": 6.440951728820801, "epoch": 0.05075645596035128, "grad_norm": 1.0625, "learning_rate": 0.00031391613722619587, "loss": 6.2574, "mean_token_accuracy": 0.14545449316501619, "num_tokens": 3684664.0, "step": 2335 }, { "entropy": 6.275143241882324, "epoch": 0.05086514216155117, "grad_norm": 1.0546875, "learning_rate": 0.000312755267237384, "loss": 6.1038, "mean_token_accuracy": 0.14968376085162163, "num_tokens": 3691938.0, "step": 2340 }, { "entropy": 6.226733779907226, "epoch": 0.050973828362751064, "grad_norm": 1.0859375, "learning_rate": 0.0003115933621688488, "loss": 6.2031, "mean_token_accuracy": 0.13864690586924552, "num_tokens": 3699489.0, "step": 2345 }, { "entropy": 6.331015968322754, "epoch": 0.05108251456395096, "grad_norm": 2.390625, "learning_rate": 0.00031043045387480487, "loss": 6.1655, "mean_token_accuracy": 0.15013981610536575, "num_tokens": 3707804.0, "step": 2350 }, { "entropy": 6.322420215606689, "epoch": 0.05119120076515086, "grad_norm": 1.078125, "learning_rate": 0.0003092665742369703, "loss": 6.2085, "mean_token_accuracy": 0.13792425468564035, "num_tokens": 3715175.0, "step": 2355 }, { "entropy": 6.352394914627075, "epoch": 0.05129988696635075, "grad_norm": 1.1484375, "learning_rate": 0.00030810175516369343, "loss": 6.1127, "mean_token_accuracy": 0.14395364746451378, "num_tokens": 3722468.0, "step": 2360 }, { "entropy": 6.23946738243103, "epoch": 0.051408573167550646, "grad_norm": 1.046875, "learning_rate": 0.0003069360285890775, "loss": 6.0647, "mean_token_accuracy": 0.16229498982429505, "num_tokens": 3729029.0, "step": 2365 }, { "entropy": 6.157553577423096, "epoch": 0.05151725936875055, "grad_norm": 1.109375, "learning_rate": 0.00030576942647210547, "loss": 6.1303, "mean_token_accuracy": 0.14998419880867003, "num_tokens": 3736292.0, "step": 2370 }, { "entropy": 6.257620859146118, "epoch": 0.05162594556995044, "grad_norm": 1.03125, "learning_rate": 0.00030460198079576355, "loss": 6.1493, "mean_token_accuracy": 0.1474681794643402, "num_tokens": 3744264.0, "step": 2375 }, { "entropy": 6.428153324127197, "epoch": 0.051734631771150334, "grad_norm": 1.0859375, "learning_rate": 0.0003034337235661648, "loss": 6.189, "mean_token_accuracy": 0.14731017872691154, "num_tokens": 3751732.0, "step": 2380 }, { "entropy": 6.319741821289062, "epoch": 0.05184331797235023, "grad_norm": 1.015625, "learning_rate": 0.0003022646868116714, "loss": 6.1513, "mean_token_accuracy": 0.1528203696012497, "num_tokens": 3759273.0, "step": 2385 }, { "entropy": 6.320394086837768, "epoch": 0.05195200417355013, "grad_norm": 1.015625, "learning_rate": 0.0003010949025820163, "loss": 6.1181, "mean_token_accuracy": 0.14740897715091705, "num_tokens": 3766929.0, "step": 2390 }, { "entropy": 6.296305561065674, "epoch": 0.05206069037475002, "grad_norm": 1.1171875, "learning_rate": 0.0002999244029474252, "loss": 6.1932, "mean_token_accuracy": 0.14625833109021186, "num_tokens": 3774453.0, "step": 2395 }, { "entropy": 6.293846559524536, "epoch": 0.052169376575949916, "grad_norm": 1.0703125, "learning_rate": 0.00029875321999773684, "loss": 6.2742, "mean_token_accuracy": 0.14566972702741623, "num_tokens": 3783329.0, "step": 2400 }, { "entropy": 6.346486234664917, "epoch": 0.05227806277714981, "grad_norm": 1.1484375, "learning_rate": 0.00029758138584152333, "loss": 6.1299, "mean_token_accuracy": 0.1495580941438675, "num_tokens": 3791201.0, "step": 2405 }, { "entropy": 6.227714109420776, "epoch": 0.05238674897834971, "grad_norm": 1.078125, "learning_rate": 0.0002964089326052102, "loss": 6.121, "mean_token_accuracy": 0.14442274942994118, "num_tokens": 3799088.0, "step": 2410 }, { "entropy": 6.392905378341675, "epoch": 0.052495435179549604, "grad_norm": 1.15625, "learning_rate": 0.0002952358924321949, "loss": 6.2871, "mean_token_accuracy": 0.13784987702965737, "num_tokens": 3807156.0, "step": 2415 }, { "entropy": 6.408941173553467, "epoch": 0.0526041213807495, "grad_norm": 1.171875, "learning_rate": 0.00029406229748196657, "loss": 6.1201, "mean_token_accuracy": 0.15032362788915635, "num_tokens": 3814121.0, "step": 2420 }, { "entropy": 6.283007287979126, "epoch": 0.0527128075819494, "grad_norm": 1.1953125, "learning_rate": 0.0002928881799292235, "loss": 6.1984, "mean_token_accuracy": 0.1452282190322876, "num_tokens": 3821502.0, "step": 2425 }, { "entropy": 6.33258056640625, "epoch": 0.05282149378314929, "grad_norm": 1.078125, "learning_rate": 0.00029171357196299154, "loss": 6.2369, "mean_token_accuracy": 0.14194708019495011, "num_tokens": 3830907.0, "step": 2430 }, { "entropy": 6.310719108581543, "epoch": 0.052930179984349186, "grad_norm": 1.109375, "learning_rate": 0.0002905385057857414, "loss": 6.2992, "mean_token_accuracy": 0.13263836950063707, "num_tokens": 3838643.0, "step": 2435 }, { "entropy": 6.362523603439331, "epoch": 0.05303886618554908, "grad_norm": 1.1875, "learning_rate": 0.0002893630136125058, "loss": 6.2052, "mean_token_accuracy": 0.14495603367686272, "num_tokens": 3846950.0, "step": 2440 }, { "entropy": 6.364418840408325, "epoch": 0.05314755238674898, "grad_norm": 1.109375, "learning_rate": 0.0002881871276699967, "loss": 6.234, "mean_token_accuracy": 0.15189555883407593, "num_tokens": 3855373.0, "step": 2445 }, { "entropy": 6.281556272506714, "epoch": 0.053256238587948874, "grad_norm": 1.0390625, "learning_rate": 0.00028701088019572114, "loss": 6.1334, "mean_token_accuracy": 0.1457263521850109, "num_tokens": 3862973.0, "step": 2450 }, { "entropy": 6.234706211090088, "epoch": 0.05336492478914877, "grad_norm": 0.96875, "learning_rate": 0.0002858343034370977, "loss": 6.0761, "mean_token_accuracy": 0.15153853297233583, "num_tokens": 3870713.0, "step": 2455 }, { "entropy": 6.313697624206543, "epoch": 0.05347361099034866, "grad_norm": 1.015625, "learning_rate": 0.00028465742965057267, "loss": 6.1607, "mean_token_accuracy": 0.1522718347609043, "num_tokens": 3878696.0, "step": 2460 }, { "entropy": 6.309638118743896, "epoch": 0.05358229719154856, "grad_norm": 1.109375, "learning_rate": 0.00028348029110073533, "loss": 6.1553, "mean_token_accuracy": 0.1505454257130623, "num_tokens": 3886072.0, "step": 2465 }, { "entropy": 6.325492429733276, "epoch": 0.053690983392748456, "grad_norm": 1.03125, "learning_rate": 0.00028230292005943365, "loss": 6.1877, "mean_token_accuracy": 0.1469157561659813, "num_tokens": 3893970.0, "step": 2470 }, { "entropy": 6.351982879638672, "epoch": 0.05379966959394835, "grad_norm": 1.2265625, "learning_rate": 0.00028112534880488945, "loss": 6.1673, "mean_token_accuracy": 0.1419338807463646, "num_tokens": 3902017.0, "step": 2475 }, { "entropy": 6.343962669372559, "epoch": 0.05390835579514825, "grad_norm": 0.97265625, "learning_rate": 0.0002799476096208137, "loss": 6.2655, "mean_token_accuracy": 0.1384866639971733, "num_tokens": 3910665.0, "step": 2480 }, { "entropy": 6.423051500320435, "epoch": 0.054017041996348145, "grad_norm": 1.109375, "learning_rate": 0.00027876973479552087, "loss": 6.2664, "mean_token_accuracy": 0.14044074714183807, "num_tokens": 3918593.0, "step": 2485 }, { "entropy": 6.360489845275879, "epoch": 0.05412572819754804, "grad_norm": 1.140625, "learning_rate": 0.00027759175662104424, "loss": 6.0691, "mean_token_accuracy": 0.14841551929712296, "num_tokens": 3925687.0, "step": 2490 }, { "entropy": 6.26637830734253, "epoch": 0.05423441439874793, "grad_norm": 1.109375, "learning_rate": 0.0002764137073922508, "loss": 6.2016, "mean_token_accuracy": 0.15307127833366393, "num_tokens": 3932641.0, "step": 2495 }, { "entropy": 6.261042737960816, "epoch": 0.05434310059994783, "grad_norm": 0.9765625, "learning_rate": 0.00027523561940595505, "loss": 6.2238, "mean_token_accuracy": 0.1425244577229023, "num_tokens": 3941158.0, "step": 2500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 6447152259072000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }