{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.23412350014632718, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742143154144287, "epoch": 0.000292654375182909, "grad_norm": 5.34375, "learning_rate": 2e-06, "loss": 10.7851, "mean_token_accuracy": 7.092198356986045e-05, "num_tokens": 10253.0, "step": 5 }, { "entropy": 10.742099285125732, "epoch": 0.000585308750365818, "grad_norm": 5.09375, "learning_rate": 4.5e-06, "loss": 10.7585, "mean_token_accuracy": 7.072135922499001e-05, "num_tokens": 19586.0, "step": 10 }, { "entropy": 10.742091464996339, "epoch": 0.000877963125548727, "grad_norm": 5.71875, "learning_rate": 7e-06, "loss": 10.7338, "mean_token_accuracy": 0.0, "num_tokens": 28743.0, "step": 15 }, { "entropy": 10.742110919952392, "epoch": 0.001170617500731636, "grad_norm": 4.75, "learning_rate": 9.5e-06, "loss": 10.702, "mean_token_accuracy": 7.518797065131366e-05, "num_tokens": 39263.0, "step": 20 }, { "entropy": 10.7420015335083, "epoch": 0.0014632718759145448, "grad_norm": 5.0625, "learning_rate": 1.2e-05, "loss": 10.6176, "mean_token_accuracy": 0.00650847667711787, "num_tokens": 50195.0, "step": 25 }, { "entropy": 10.741524696350098, "epoch": 0.001755926251097454, "grad_norm": 4.5, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.04643158838152885, "num_tokens": 58982.0, "step": 30 }, { "entropy": 10.739701747894287, "epoch": 0.002048580626280363, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3385, "mean_token_accuracy": 0.04858696423470974, "num_tokens": 68619.0, "step": 35 }, { "entropy": 10.733176803588867, "epoch": 0.002341235001463272, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 10.1755, "mean_token_accuracy": 0.054676258191466334, "num_tokens": 78276.0, "step": 40 }, { "entropy": 10.719074249267578, "epoch": 0.0026338893766461808, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.085, "mean_token_accuracy": 0.05106211043894291, "num_tokens": 87977.0, "step": 45 }, { "entropy": 10.702382278442382, "epoch": 0.0029265437518290896, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.007, "mean_token_accuracy": 0.05418388731777668, "num_tokens": 97168.0, "step": 50 }, { "entropy": 10.688697719573975, "epoch": 0.003219198127011999, "grad_norm": 1.984375, "learning_rate": 2.7e-05, "loss": 9.978, "mean_token_accuracy": 0.0560054711997509, "num_tokens": 108162.0, "step": 55 }, { "entropy": 10.677631187438966, "epoch": 0.003511852502194908, "grad_norm": 1.9375, "learning_rate": 2.95e-05, "loss": 9.8907, "mean_token_accuracy": 0.05185089595615864, "num_tokens": 117963.0, "step": 60 }, { "entropy": 10.672104358673096, "epoch": 0.0038045068773778167, "grad_norm": 1.78125, "learning_rate": 3.2e-05, "loss": 9.8844, "mean_token_accuracy": 0.05049301944673061, "num_tokens": 128067.0, "step": 65 }, { "entropy": 10.665418434143067, "epoch": 0.004097161252560726, "grad_norm": 1.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8046, "mean_token_accuracy": 0.05261277854442596, "num_tokens": 138347.0, "step": 70 }, { "entropy": 10.655702877044678, "epoch": 0.004389815627743635, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7713, "mean_token_accuracy": 0.05200894549489021, "num_tokens": 148883.0, "step": 75 }, { "entropy": 10.648012065887452, "epoch": 0.004682470002926544, "grad_norm": 1.7734375, "learning_rate": 3.95e-05, "loss": 9.7304, "mean_token_accuracy": 0.053603590652346614, "num_tokens": 158416.0, "step": 80 }, { "entropy": 10.638986778259277, "epoch": 0.004975124378109453, "grad_norm": 1.8125, "learning_rate": 4.2000000000000004e-05, "loss": 9.624, "mean_token_accuracy": 0.056516367569565774, "num_tokens": 168380.0, "step": 85 }, { "entropy": 10.622650527954102, "epoch": 0.0052677787532923615, "grad_norm": 1.9375, "learning_rate": 4.45e-05, "loss": 9.5594, "mean_token_accuracy": 0.058524899929761884, "num_tokens": 178623.0, "step": 90 }, { "entropy": 10.598152160644531, "epoch": 0.00556043312847527, "grad_norm": 1.7421875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5209, "mean_token_accuracy": 0.05661297850310802, "num_tokens": 189058.0, "step": 95 }, { "entropy": 10.577679920196534, "epoch": 0.005853087503658179, "grad_norm": 1.6796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4548, "mean_token_accuracy": 0.056520416587591174, "num_tokens": 199465.0, "step": 100 }, { "entropy": 10.56387767791748, "epoch": 0.006145741878841089, "grad_norm": 1.6015625, "learning_rate": 5.2e-05, "loss": 9.4, "mean_token_accuracy": 0.054618718847632405, "num_tokens": 208712.0, "step": 105 }, { "entropy": 10.543546962738038, "epoch": 0.006438396254023998, "grad_norm": 1.484375, "learning_rate": 5.45e-05, "loss": 9.3224, "mean_token_accuracy": 0.05899658054113388, "num_tokens": 218557.0, "step": 110 }, { "entropy": 10.48940305709839, "epoch": 0.006731050629206907, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.2068, "mean_token_accuracy": 0.06870373338460922, "num_tokens": 228961.0, "step": 115 }, { "entropy": 10.402587509155273, "epoch": 0.007023705004389816, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 9.1227, "mean_token_accuracy": 0.06810536533594132, "num_tokens": 238987.0, "step": 120 }, { "entropy": 10.348681640625, "epoch": 0.0073163593795727245, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.0633, "mean_token_accuracy": 0.0605758685618639, "num_tokens": 249600.0, "step": 125 }, { "entropy": 10.30824089050293, "epoch": 0.007609013754755633, "grad_norm": 1.578125, "learning_rate": 6.450000000000001e-05, "loss": 8.8758, "mean_token_accuracy": 0.07409285828471183, "num_tokens": 259215.0, "step": 130 }, { "entropy": 10.212008476257324, "epoch": 0.007901668129938543, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.8303, "mean_token_accuracy": 0.06557713933289051, "num_tokens": 268888.0, "step": 135 }, { "entropy": 10.150605010986329, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.74, "mean_token_accuracy": 0.06668962053954601, "num_tokens": 278451.0, "step": 140 }, { "entropy": 10.055028533935547, "epoch": 0.008486976880304361, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.7012, "mean_token_accuracy": 0.06709126047790051, "num_tokens": 289577.0, "step": 145 }, { "entropy": 9.99300413131714, "epoch": 0.00877963125548727, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 8.5708, "mean_token_accuracy": 0.06588217578828334, "num_tokens": 299057.0, "step": 150 }, { "entropy": 9.817628383636475, "epoch": 0.009072285630670179, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.4885, "mean_token_accuracy": 0.06879487000405789, "num_tokens": 308802.0, "step": 155 }, { "entropy": 9.719903469085693, "epoch": 0.009364940005853088, "grad_norm": 0.98046875, "learning_rate": 7.950000000000001e-05, "loss": 8.3738, "mean_token_accuracy": 0.07012738101184368, "num_tokens": 317365.0, "step": 160 }, { "entropy": 9.5343448638916, "epoch": 0.009657594381035996, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.3035, "mean_token_accuracy": 0.07032971270382404, "num_tokens": 326927.0, "step": 165 }, { "entropy": 9.404919242858886, "epoch": 0.009950248756218905, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 8.317, "mean_token_accuracy": 0.06643726415932179, "num_tokens": 337408.0, "step": 170 }, { "entropy": 9.28181962966919, "epoch": 0.010242903131401814, "grad_norm": 0.79296875, "learning_rate": 8.7e-05, "loss": 8.2328, "mean_token_accuracy": 0.06949336491525174, "num_tokens": 348282.0, "step": 175 }, { "entropy": 9.099757957458497, "epoch": 0.010535557506584723, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 8.1847, "mean_token_accuracy": 0.06538042239844799, "num_tokens": 357767.0, "step": 180 }, { "entropy": 8.947648048400879, "epoch": 0.010828211881767632, "grad_norm": 0.77734375, "learning_rate": 9.2e-05, "loss": 8.1401, "mean_token_accuracy": 0.07173748835921287, "num_tokens": 368665.0, "step": 185 }, { "entropy": 8.832690525054932, "epoch": 0.01112086625695054, "grad_norm": 1.1015625, "learning_rate": 9.45e-05, "loss": 8.125, "mean_token_accuracy": 0.0688393272459507, "num_tokens": 378741.0, "step": 190 }, { "entropy": 8.722904491424561, "epoch": 0.01141352063213345, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.1228, "mean_token_accuracy": 0.07389259040355682, "num_tokens": 388324.0, "step": 195 }, { "entropy": 8.738927555084228, "epoch": 0.011706175007316359, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 8.1796, "mean_token_accuracy": 0.06952995508909225, "num_tokens": 398450.0, "step": 200 }, { "entropy": 8.615283966064453, "epoch": 0.01199882938249927, "grad_norm": 0.8203125, "learning_rate": 0.000102, "loss": 8.0899, "mean_token_accuracy": 0.07332116328179836, "num_tokens": 408961.0, "step": 205 }, { "entropy": 8.581227874755859, "epoch": 0.012291483757682178, "grad_norm": 1.078125, "learning_rate": 0.00010449999999999999, "loss": 8.1226, "mean_token_accuracy": 0.0683289546519518, "num_tokens": 418517.0, "step": 210 }, { "entropy": 8.532517910003662, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.035, "mean_token_accuracy": 0.07064232043921947, "num_tokens": 428059.0, "step": 215 }, { "entropy": 8.60868797302246, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.0513, "mean_token_accuracy": 0.06911276690661908, "num_tokens": 438499.0, "step": 220 }, { "entropy": 8.50686674118042, "epoch": 0.013169446883230905, "grad_norm": 0.73046875, "learning_rate": 0.000112, "loss": 8.0542, "mean_token_accuracy": 0.06983353272080421, "num_tokens": 448761.0, "step": 225 }, { "entropy": 8.424305152893066, "epoch": 0.013462101258413814, "grad_norm": 0.77734375, "learning_rate": 0.0001145, "loss": 8.0471, "mean_token_accuracy": 0.07090565152466297, "num_tokens": 458386.0, "step": 230 }, { "entropy": 8.447117614746094, "epoch": 0.013754755633596722, "grad_norm": 0.765625, "learning_rate": 0.00011700000000000001, "loss": 7.991, "mean_token_accuracy": 0.06929317899048329, "num_tokens": 468198.0, "step": 235 }, { "entropy": 8.46488447189331, "epoch": 0.014047410008779631, "grad_norm": 0.7265625, "learning_rate": 0.00011949999999999999, "loss": 8.0203, "mean_token_accuracy": 0.07129090093076229, "num_tokens": 480142.0, "step": 240 }, { "entropy": 8.370715618133545, "epoch": 0.01434006438396254, "grad_norm": 0.79296875, "learning_rate": 0.000122, "loss": 7.8998, "mean_token_accuracy": 0.08097687140107154, "num_tokens": 490686.0, "step": 245 }, { "entropy": 8.408738231658935, "epoch": 0.014632718759145449, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 7.9758, "mean_token_accuracy": 0.07468959763646126, "num_tokens": 500099.0, "step": 250 }, { "entropy": 8.416247749328614, "epoch": 0.014925373134328358, "grad_norm": 0.8515625, "learning_rate": 0.000127, "loss": 7.9005, "mean_token_accuracy": 0.07769993916153908, "num_tokens": 509525.0, "step": 255 }, { "entropy": 8.347339820861816, "epoch": 0.015218027509511267, "grad_norm": 0.7421875, "learning_rate": 0.0001295, "loss": 7.8978, "mean_token_accuracy": 0.07274740003049374, "num_tokens": 520141.0, "step": 260 }, { "entropy": 8.357079029083252, "epoch": 0.015510681884694176, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 8.0384, "mean_token_accuracy": 0.06597915887832642, "num_tokens": 531645.0, "step": 265 }, { "entropy": 8.3228253364563, "epoch": 0.015803336259877086, "grad_norm": 0.8203125, "learning_rate": 0.00013450000000000002, "loss": 7.9109, "mean_token_accuracy": 0.07127318009734154, "num_tokens": 541779.0, "step": 270 }, { "entropy": 8.300227451324464, "epoch": 0.016095990635059995, "grad_norm": 0.82421875, "learning_rate": 0.00013700000000000002, "loss": 7.8871, "mean_token_accuracy": 0.07985152080655097, "num_tokens": 551770.0, "step": 275 }, { "entropy": 8.360063171386718, "epoch": 0.016388645010242904, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 7.8829, "mean_token_accuracy": 0.0752606987953186, "num_tokens": 561814.0, "step": 280 }, { "entropy": 8.235567474365235, "epoch": 0.016681299385425813, "grad_norm": 0.82421875, "learning_rate": 0.00014199999999999998, "loss": 7.9551, "mean_token_accuracy": 0.06852101050317287, "num_tokens": 571988.0, "step": 285 }, { "entropy": 8.42728681564331, "epoch": 0.016973953760608722, "grad_norm": 0.7109375, "learning_rate": 0.0001445, "loss": 7.9876, "mean_token_accuracy": 0.07176770456135273, "num_tokens": 582814.0, "step": 290 }, { "entropy": 8.26517457962036, "epoch": 0.01726660813579163, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 7.9178, "mean_token_accuracy": 0.07443804480135441, "num_tokens": 592301.0, "step": 295 }, { "entropy": 8.199700450897216, "epoch": 0.01755926251097454, "grad_norm": 0.80859375, "learning_rate": 0.0001495, "loss": 7.8119, "mean_token_accuracy": 0.077539586648345, "num_tokens": 602898.0, "step": 300 }, { "entropy": 8.289494514465332, "epoch": 0.01785191688615745, "grad_norm": 1.0546875, "learning_rate": 0.000152, "loss": 7.8914, "mean_token_accuracy": 0.07545375041663646, "num_tokens": 612731.0, "step": 305 }, { "entropy": 8.186264896392823, "epoch": 0.018144571261340357, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 7.843, "mean_token_accuracy": 0.07743252031505107, "num_tokens": 623067.0, "step": 310 }, { "entropy": 8.256502819061279, "epoch": 0.018437225636523266, "grad_norm": 0.76171875, "learning_rate": 0.000157, "loss": 7.8317, "mean_token_accuracy": 0.08097588121891022, "num_tokens": 633538.0, "step": 315 }, { "entropy": 8.319536399841308, "epoch": 0.018729880011706175, "grad_norm": 1.6484375, "learning_rate": 0.0001595, "loss": 7.8898, "mean_token_accuracy": 0.07923161759972572, "num_tokens": 643704.0, "step": 320 }, { "entropy": 8.158168601989747, "epoch": 0.019022534386889084, "grad_norm": 0.84375, "learning_rate": 0.000162, "loss": 7.9204, "mean_token_accuracy": 0.07442782260477543, "num_tokens": 653766.0, "step": 325 }, { "entropy": 8.432480907440185, "epoch": 0.019315188762071993, "grad_norm": 0.921875, "learning_rate": 0.00016450000000000001, "loss": 7.9175, "mean_token_accuracy": 0.07209107242524623, "num_tokens": 663289.0, "step": 330 }, { "entropy": 8.145325660705566, "epoch": 0.0196078431372549, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 7.8214, "mean_token_accuracy": 0.07566024884581565, "num_tokens": 673196.0, "step": 335 }, { "entropy": 8.328914070129395, "epoch": 0.01990049751243781, "grad_norm": 0.98046875, "learning_rate": 0.00016950000000000003, "loss": 7.8481, "mean_token_accuracy": 0.0807725053280592, "num_tokens": 682694.0, "step": 340 }, { "entropy": 8.15658712387085, "epoch": 0.02019315188762072, "grad_norm": 0.85546875, "learning_rate": 0.00017199999999999998, "loss": 7.8414, "mean_token_accuracy": 0.07744252718985081, "num_tokens": 692880.0, "step": 345 }, { "entropy": 8.265804481506347, "epoch": 0.02048580626280363, "grad_norm": 1.2109375, "learning_rate": 0.00017449999999999999, "loss": 7.9339, "mean_token_accuracy": 0.07408964931964875, "num_tokens": 703972.0, "step": 350 }, { "entropy": 8.137424850463868, "epoch": 0.020778460637986537, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 7.7467, "mean_token_accuracy": 0.07930146306753158, "num_tokens": 713571.0, "step": 355 }, { "entropy": 8.209496688842773, "epoch": 0.021071115013169446, "grad_norm": 0.93359375, "learning_rate": 0.0001795, "loss": 7.8355, "mean_token_accuracy": 0.08222270905971527, "num_tokens": 723642.0, "step": 360 }, { "entropy": 8.136897945404053, "epoch": 0.021363769388352355, "grad_norm": 0.9453125, "learning_rate": 0.000182, "loss": 7.8793, "mean_token_accuracy": 0.07310881391167641, "num_tokens": 733848.0, "step": 365 }, { "entropy": 8.176177358627319, "epoch": 0.021656423763535264, "grad_norm": 0.7265625, "learning_rate": 0.0001845, "loss": 7.6089, "mean_token_accuracy": 0.10752813518047333, "num_tokens": 743752.0, "step": 370 }, { "entropy": 8.144378280639648, "epoch": 0.021949078138718173, "grad_norm": 0.91796875, "learning_rate": 0.000187, "loss": 7.8031, "mean_token_accuracy": 0.08254543766379356, "num_tokens": 754145.0, "step": 375 }, { "entropy": 8.118795394897461, "epoch": 0.02224173251390108, "grad_norm": 0.765625, "learning_rate": 0.0001895, "loss": 7.766, "mean_token_accuracy": 0.07592462375760078, "num_tokens": 763930.0, "step": 380 }, { "entropy": 8.178821086883545, "epoch": 0.02253438688908399, "grad_norm": 1.015625, "learning_rate": 0.000192, "loss": 7.7934, "mean_token_accuracy": 0.08122270852327347, "num_tokens": 774851.0, "step": 385 }, { "entropy": 8.122542095184325, "epoch": 0.0228270412642669, "grad_norm": 0.80859375, "learning_rate": 0.0001945, "loss": 7.7915, "mean_token_accuracy": 0.07377454079687595, "num_tokens": 784251.0, "step": 390 }, { "entropy": 8.100419902801514, "epoch": 0.023119695639449808, "grad_norm": 0.92578125, "learning_rate": 0.00019700000000000002, "loss": 7.8395, "mean_token_accuracy": 0.0817381426692009, "num_tokens": 794089.0, "step": 395 }, { "entropy": 8.19840030670166, "epoch": 0.023412350014632717, "grad_norm": 0.8671875, "learning_rate": 0.00019950000000000002, "loss": 7.8242, "mean_token_accuracy": 0.07439705729484558, "num_tokens": 805274.0, "step": 400 }, { "entropy": 8.17535228729248, "epoch": 0.02370500438981563, "grad_norm": 0.8515625, "learning_rate": 0.000202, "loss": 7.7672, "mean_token_accuracy": 0.07779609337449074, "num_tokens": 816036.0, "step": 405 }, { "entropy": 8.004063892364503, "epoch": 0.02399765876499854, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.7613, "mean_token_accuracy": 0.07725987881422043, "num_tokens": 826393.0, "step": 410 }, { "entropy": 8.159784364700318, "epoch": 0.024290313140181447, "grad_norm": 0.87109375, "learning_rate": 0.000207, "loss": 7.7542, "mean_token_accuracy": 0.0782277960330248, "num_tokens": 836456.0, "step": 415 }, { "entropy": 8.072831869125366, "epoch": 0.024582967515364356, "grad_norm": 0.8125, "learning_rate": 0.0002095, "loss": 7.759, "mean_token_accuracy": 0.07723330594599247, "num_tokens": 846493.0, "step": 420 }, { "entropy": 8.16247329711914, "epoch": 0.024875621890547265, "grad_norm": 0.8125, "learning_rate": 0.000212, "loss": 7.7584, "mean_token_accuracy": 0.07505144067108631, "num_tokens": 857041.0, "step": 425 }, { "entropy": 7.9756200313568115, "epoch": 0.025168276265730174, "grad_norm": 0.92578125, "learning_rate": 0.0002145, "loss": 7.6788, "mean_token_accuracy": 0.08394450098276138, "num_tokens": 867053.0, "step": 430 }, { "entropy": 8.086863994598389, "epoch": 0.025460930640913083, "grad_norm": 0.9921875, "learning_rate": 0.00021700000000000002, "loss": 7.7398, "mean_token_accuracy": 0.0781655989587307, "num_tokens": 876944.0, "step": 435 }, { "entropy": 8.080809020996094, "epoch": 0.02575358501609599, "grad_norm": 0.828125, "learning_rate": 0.0002195, "loss": 7.6902, "mean_token_accuracy": 0.08105823285877704, "num_tokens": 887257.0, "step": 440 }, { "entropy": 8.091656923294067, "epoch": 0.0260462393912789, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 7.7086, "mean_token_accuracy": 0.0815083347260952, "num_tokens": 896877.0, "step": 445 }, { "entropy": 8.037679195404053, "epoch": 0.02633889376646181, "grad_norm": 0.83203125, "learning_rate": 0.0002245, "loss": 7.6096, "mean_token_accuracy": 0.08536934405565262, "num_tokens": 906930.0, "step": 450 }, { "entropy": 8.04052267074585, "epoch": 0.026631548141644718, "grad_norm": 0.8515625, "learning_rate": 0.00022700000000000002, "loss": 7.7471, "mean_token_accuracy": 0.07020874097943305, "num_tokens": 916841.0, "step": 455 }, { "entropy": 8.061063146591186, "epoch": 0.026924202516827627, "grad_norm": 0.7890625, "learning_rate": 0.00022950000000000002, "loss": 7.6914, "mean_token_accuracy": 0.07996720150113105, "num_tokens": 927024.0, "step": 460 }, { "entropy": 8.085123777389526, "epoch": 0.027216856892010536, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.7227, "mean_token_accuracy": 0.07815472632646561, "num_tokens": 935786.0, "step": 465 }, { "entropy": 7.955375385284424, "epoch": 0.027509511267193445, "grad_norm": 0.8359375, "learning_rate": 0.00023449999999999998, "loss": 7.6349, "mean_token_accuracy": 0.08305523693561553, "num_tokens": 946819.0, "step": 470 }, { "entropy": 8.01088285446167, "epoch": 0.027802165642376354, "grad_norm": 0.84375, "learning_rate": 0.000237, "loss": 7.6793, "mean_token_accuracy": 0.08371292352676392, "num_tokens": 957876.0, "step": 475 }, { "entropy": 8.070115327835083, "epoch": 0.028094820017559263, "grad_norm": 0.9765625, "learning_rate": 0.0002395, "loss": 7.7627, "mean_token_accuracy": 0.07754282280802727, "num_tokens": 969211.0, "step": 480 }, { "entropy": 8.086713933944703, "epoch": 0.02838747439274217, "grad_norm": 0.89453125, "learning_rate": 0.000242, "loss": 7.7091, "mean_token_accuracy": 0.07998017743229865, "num_tokens": 979090.0, "step": 485 }, { "entropy": 8.120463180541993, "epoch": 0.02868012876792508, "grad_norm": 0.8984375, "learning_rate": 0.0002445, "loss": 7.7649, "mean_token_accuracy": 0.07725568227469921, "num_tokens": 990510.0, "step": 490 }, { "entropy": 8.065446138381958, "epoch": 0.02897278314310799, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.6837, "mean_token_accuracy": 0.07927028760313988, "num_tokens": 1000890.0, "step": 495 }, { "entropy": 7.89040241241455, "epoch": 0.029265437518290898, "grad_norm": 0.9296875, "learning_rate": 0.0002495, "loss": 7.633, "mean_token_accuracy": 0.08539719134569168, "num_tokens": 1011019.0, "step": 500 }, { "entropy": 8.053290367126465, "epoch": 0.029558091893473807, "grad_norm": 0.9296875, "learning_rate": 0.000252, "loss": 7.5976, "mean_token_accuracy": 0.0852201983332634, "num_tokens": 1020703.0, "step": 505 }, { "entropy": 7.924099731445312, "epoch": 0.029850746268656716, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.6144, "mean_token_accuracy": 0.08518284186720848, "num_tokens": 1030539.0, "step": 510 }, { "entropy": 7.876818609237671, "epoch": 0.030143400643839625, "grad_norm": 0.8984375, "learning_rate": 0.000257, "loss": 7.6173, "mean_token_accuracy": 0.07879232838749886, "num_tokens": 1040977.0, "step": 515 }, { "entropy": 7.9826685905456545, "epoch": 0.030436055019022534, "grad_norm": 1.0234375, "learning_rate": 0.0002595, "loss": 7.5867, "mean_token_accuracy": 0.08224296122789383, "num_tokens": 1050382.0, "step": 520 }, { "entropy": 7.914853572845459, "epoch": 0.030728709394205442, "grad_norm": 0.8984375, "learning_rate": 0.000262, "loss": 7.5776, "mean_token_accuracy": 0.08655883669853211, "num_tokens": 1062287.0, "step": 525 }, { "entropy": 7.873267793655396, "epoch": 0.03102136376938835, "grad_norm": 0.98828125, "learning_rate": 0.00026450000000000003, "loss": 7.5624, "mean_token_accuracy": 0.0834833487868309, "num_tokens": 1072138.0, "step": 530 }, { "entropy": 8.053305435180665, "epoch": 0.031314018144571264, "grad_norm": 0.9453125, "learning_rate": 0.00026700000000000004, "loss": 7.5478, "mean_token_accuracy": 0.08701685890555381, "num_tokens": 1082730.0, "step": 535 }, { "entropy": 7.881413888931275, "epoch": 0.03160667251975417, "grad_norm": 1.0546875, "learning_rate": 0.00026950000000000005, "loss": 7.5191, "mean_token_accuracy": 0.08792314156889916, "num_tokens": 1093409.0, "step": 540 }, { "entropy": 7.940295267105102, "epoch": 0.03189932689493708, "grad_norm": 0.890625, "learning_rate": 0.00027200000000000005, "loss": 7.6596, "mean_token_accuracy": 0.08377403020858765, "num_tokens": 1103817.0, "step": 545 }, { "entropy": 7.939820003509522, "epoch": 0.03219198127011999, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.6265, "mean_token_accuracy": 0.07738926894962787, "num_tokens": 1114392.0, "step": 550 }, { "entropy": 7.96156415939331, "epoch": 0.0324846356453029, "grad_norm": 1.015625, "learning_rate": 0.000277, "loss": 7.5224, "mean_token_accuracy": 0.08881102874875069, "num_tokens": 1124539.0, "step": 555 }, { "entropy": 7.832987546920776, "epoch": 0.03277729002048581, "grad_norm": 1.171875, "learning_rate": 0.0002795, "loss": 7.5564, "mean_token_accuracy": 0.08254684880375862, "num_tokens": 1135110.0, "step": 560 }, { "entropy": 7.855937910079956, "epoch": 0.03306994439566872, "grad_norm": 1.03125, "learning_rate": 0.00028199999999999997, "loss": 7.5979, "mean_token_accuracy": 0.08505113944411277, "num_tokens": 1145458.0, "step": 565 }, { "entropy": 7.951333904266358, "epoch": 0.033362598770851626, "grad_norm": 0.98046875, "learning_rate": 0.0002845, "loss": 7.5383, "mean_token_accuracy": 0.08062238246202469, "num_tokens": 1155754.0, "step": 570 }, { "entropy": 7.8793701171875, "epoch": 0.033655253146034535, "grad_norm": 0.8984375, "learning_rate": 0.000287, "loss": 7.5816, "mean_token_accuracy": 0.082074723392725, "num_tokens": 1165771.0, "step": 575 }, { "entropy": 7.901887035369873, "epoch": 0.033947907521217444, "grad_norm": 1.015625, "learning_rate": 0.0002895, "loss": 7.534, "mean_token_accuracy": 0.08429761826992035, "num_tokens": 1175785.0, "step": 580 }, { "entropy": 7.887288761138916, "epoch": 0.03424056189640035, "grad_norm": 0.9375, "learning_rate": 0.000292, "loss": 7.5557, "mean_token_accuracy": 0.08287644758820534, "num_tokens": 1186252.0, "step": 585 }, { "entropy": 7.767520141601563, "epoch": 0.03453321627158326, "grad_norm": 0.890625, "learning_rate": 0.0002945, "loss": 7.5037, "mean_token_accuracy": 0.08624404892325402, "num_tokens": 1196800.0, "step": 590 }, { "entropy": 7.92415132522583, "epoch": 0.03482587064676617, "grad_norm": 0.86328125, "learning_rate": 0.000297, "loss": 7.4895, "mean_token_accuracy": 0.08825775608420372, "num_tokens": 1207794.0, "step": 595 }, { "entropy": 7.7734299659729, "epoch": 0.03511852502194908, "grad_norm": 0.9453125, "learning_rate": 0.0002995, "loss": 7.4153, "mean_token_accuracy": 0.08845552653074265, "num_tokens": 1217029.0, "step": 600 }, { "entropy": 7.832931613922119, "epoch": 0.03541117939713199, "grad_norm": 1.0625, "learning_rate": 0.000302, "loss": 7.3933, "mean_token_accuracy": 0.09399922043085099, "num_tokens": 1227917.0, "step": 605 }, { "entropy": 7.771529722213745, "epoch": 0.0357038337723149, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 7.4464, "mean_token_accuracy": 0.08992072939872742, "num_tokens": 1238495.0, "step": 610 }, { "entropy": 7.831154489517212, "epoch": 0.035996488147497806, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.4915, "mean_token_accuracy": 0.08896522894501686, "num_tokens": 1249649.0, "step": 615 }, { "entropy": 7.815850448608399, "epoch": 0.036289142522680715, "grad_norm": 0.9296875, "learning_rate": 0.0003095, "loss": 7.5417, "mean_token_accuracy": 0.08101370558142662, "num_tokens": 1260937.0, "step": 620 }, { "entropy": 7.813495063781739, "epoch": 0.036581796897863623, "grad_norm": 0.96484375, "learning_rate": 0.000312, "loss": 7.3702, "mean_token_accuracy": 0.09065580368041992, "num_tokens": 1270751.0, "step": 625 }, { "entropy": 7.818518209457397, "epoch": 0.03687445127304653, "grad_norm": 0.8671875, "learning_rate": 0.0003145, "loss": 7.4965, "mean_token_accuracy": 0.0885044053196907, "num_tokens": 1282383.0, "step": 630 }, { "entropy": 7.83252854347229, "epoch": 0.03716710564822944, "grad_norm": 0.96484375, "learning_rate": 0.000317, "loss": 7.3179, "mean_token_accuracy": 0.1026477910578251, "num_tokens": 1292320.0, "step": 635 }, { "entropy": 7.6734686374664305, "epoch": 0.03745976002341235, "grad_norm": 0.91796875, "learning_rate": 0.0003195, "loss": 7.4792, "mean_token_accuracy": 0.08322202041745186, "num_tokens": 1303054.0, "step": 640 }, { "entropy": 7.8633969783782955, "epoch": 0.03775241439859526, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 7.4465, "mean_token_accuracy": 0.08914806470274925, "num_tokens": 1311607.0, "step": 645 }, { "entropy": 7.689844703674316, "epoch": 0.03804506877377817, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.4234, "mean_token_accuracy": 0.08909434452652931, "num_tokens": 1321930.0, "step": 650 }, { "entropy": 7.8022431373596195, "epoch": 0.03833772314896108, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 7.4465, "mean_token_accuracy": 0.08396812826395035, "num_tokens": 1331533.0, "step": 655 }, { "entropy": 7.769197797775268, "epoch": 0.038630377524143986, "grad_norm": 0.87890625, "learning_rate": 0.00032950000000000004, "loss": 7.4086, "mean_token_accuracy": 0.08934582769870758, "num_tokens": 1341961.0, "step": 660 }, { "entropy": 7.769333171844482, "epoch": 0.038923031899326895, "grad_norm": 0.984375, "learning_rate": 0.00033200000000000005, "loss": 7.4375, "mean_token_accuracy": 0.08935849741101265, "num_tokens": 1352741.0, "step": 665 }, { "entropy": 7.791517686843872, "epoch": 0.0392156862745098, "grad_norm": 0.96875, "learning_rate": 0.00033450000000000005, "loss": 7.432, "mean_token_accuracy": 0.08128280714154243, "num_tokens": 1363467.0, "step": 670 }, { "entropy": 7.691935110092163, "epoch": 0.03950834064969271, "grad_norm": 0.984375, "learning_rate": 0.000337, "loss": 7.3877, "mean_token_accuracy": 0.09103676527738572, "num_tokens": 1372759.0, "step": 675 }, { "entropy": 7.6941760063171385, "epoch": 0.03980099502487562, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.3855, "mean_token_accuracy": 0.09363519176840782, "num_tokens": 1382785.0, "step": 680 }, { "entropy": 7.757591485977173, "epoch": 0.04009364940005853, "grad_norm": 0.94140625, "learning_rate": 0.000342, "loss": 7.4335, "mean_token_accuracy": 0.0862673670053482, "num_tokens": 1392748.0, "step": 685 }, { "entropy": 7.777906894683838, "epoch": 0.04038630377524144, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 7.4677, "mean_token_accuracy": 0.08610242903232575, "num_tokens": 1402473.0, "step": 690 }, { "entropy": 7.787166547775269, "epoch": 0.04067895815042435, "grad_norm": 0.84765625, "learning_rate": 0.000347, "loss": 7.439, "mean_token_accuracy": 0.08554250001907349, "num_tokens": 1413921.0, "step": 695 }, { "entropy": 7.736286449432373, "epoch": 0.04097161252560726, "grad_norm": 0.94140625, "learning_rate": 0.0003495, "loss": 7.4369, "mean_token_accuracy": 0.0805517353117466, "num_tokens": 1424687.0, "step": 700 }, { "entropy": 7.767450380325317, "epoch": 0.041264266900790166, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.4388, "mean_token_accuracy": 0.08601183965802192, "num_tokens": 1435153.0, "step": 705 }, { "entropy": 7.794674873352051, "epoch": 0.041556921275973074, "grad_norm": 0.8828125, "learning_rate": 0.0003545, "loss": 7.4462, "mean_token_accuracy": 0.0846464328467846, "num_tokens": 1446187.0, "step": 710 }, { "entropy": 7.755715560913086, "epoch": 0.04184957565115598, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.396, "mean_token_accuracy": 0.08824568465352059, "num_tokens": 1456299.0, "step": 715 }, { "entropy": 7.5965576171875, "epoch": 0.04214223002633889, "grad_norm": 1.0703125, "learning_rate": 0.0003595, "loss": 7.3017, "mean_token_accuracy": 0.09606124758720398, "num_tokens": 1465654.0, "step": 720 }, { "entropy": 7.70619683265686, "epoch": 0.0424348844015218, "grad_norm": 1.078125, "learning_rate": 0.000362, "loss": 7.3563, "mean_token_accuracy": 0.09394391924142838, "num_tokens": 1475248.0, "step": 725 }, { "entropy": 7.698731327056885, "epoch": 0.04272753877670471, "grad_norm": 0.9296875, "learning_rate": 0.0003645, "loss": 7.4247, "mean_token_accuracy": 0.08578455671668053, "num_tokens": 1485570.0, "step": 730 }, { "entropy": 7.636994504928589, "epoch": 0.04302019315188762, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.3294, "mean_token_accuracy": 0.09238605126738549, "num_tokens": 1495257.0, "step": 735 }, { "entropy": 7.687747764587402, "epoch": 0.04331284752707053, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.3467, "mean_token_accuracy": 0.08985281139612197, "num_tokens": 1504882.0, "step": 740 }, { "entropy": 7.706828022003174, "epoch": 0.043605501902253437, "grad_norm": 0.83203125, "learning_rate": 0.000372, "loss": 7.3918, "mean_token_accuracy": 0.08691600039601326, "num_tokens": 1515791.0, "step": 745 }, { "entropy": 7.595960521697998, "epoch": 0.043898156277436345, "grad_norm": 0.87109375, "learning_rate": 0.0003745, "loss": 7.3055, "mean_token_accuracy": 0.09265599772334099, "num_tokens": 1527837.0, "step": 750 }, { "entropy": 7.674931144714355, "epoch": 0.044190810652619254, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 7.3197, "mean_token_accuracy": 0.09090850502252579, "num_tokens": 1538357.0, "step": 755 }, { "entropy": 7.597537708282471, "epoch": 0.04448346502780216, "grad_norm": 1.1953125, "learning_rate": 0.0003795, "loss": 7.318, "mean_token_accuracy": 0.09620778560638428, "num_tokens": 1548140.0, "step": 760 }, { "entropy": 7.655205726623535, "epoch": 0.04477611940298507, "grad_norm": 0.828125, "learning_rate": 0.000382, "loss": 7.3052, "mean_token_accuracy": 0.09487425237894058, "num_tokens": 1558723.0, "step": 765 }, { "entropy": 7.604353332519532, "epoch": 0.04506877377816798, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.3288, "mean_token_accuracy": 0.08416497483849525, "num_tokens": 1568519.0, "step": 770 }, { "entropy": 7.608450269699096, "epoch": 0.04536142815335089, "grad_norm": 1.1171875, "learning_rate": 0.00038700000000000003, "loss": 7.2961, "mean_token_accuracy": 0.09094355553388596, "num_tokens": 1578788.0, "step": 775 }, { "entropy": 7.620551347732544, "epoch": 0.0456540825285338, "grad_norm": 1.0234375, "learning_rate": 0.00038950000000000003, "loss": 7.2536, "mean_token_accuracy": 0.09547285735607147, "num_tokens": 1588593.0, "step": 780 }, { "entropy": 7.534824514389038, "epoch": 0.04594673690371671, "grad_norm": 0.9609375, "learning_rate": 0.00039200000000000004, "loss": 7.2914, "mean_token_accuracy": 0.08960797935724259, "num_tokens": 1598657.0, "step": 785 }, { "entropy": 7.504811525344849, "epoch": 0.046239391278899616, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.2001, "mean_token_accuracy": 0.09868146777153015, "num_tokens": 1608825.0, "step": 790 }, { "entropy": 7.5206996440887455, "epoch": 0.046532045654082525, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 7.2045, "mean_token_accuracy": 0.09371785670518876, "num_tokens": 1618733.0, "step": 795 }, { "entropy": 7.602302169799804, "epoch": 0.046824700029265434, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 7.2273, "mean_token_accuracy": 0.09687273427844048, "num_tokens": 1628728.0, "step": 800 }, { "entropy": 7.53294186592102, "epoch": 0.04711735440444834, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 7.3064, "mean_token_accuracy": 0.0901516005396843, "num_tokens": 1639016.0, "step": 805 }, { "entropy": 7.574016046524048, "epoch": 0.04741000877963126, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.297, "mean_token_accuracy": 0.0918840229511261, "num_tokens": 1649386.0, "step": 810 }, { "entropy": 7.666880130767822, "epoch": 0.04770266315481417, "grad_norm": 0.98828125, "learning_rate": 0.00040699999999999997, "loss": 7.2977, "mean_token_accuracy": 0.09063222482800484, "num_tokens": 1659949.0, "step": 815 }, { "entropy": 7.555622291564942, "epoch": 0.04799531752999708, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 7.2765, "mean_token_accuracy": 0.09335207715630531, "num_tokens": 1670035.0, "step": 820 }, { "entropy": 7.611965894699097, "epoch": 0.048287971905179985, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.2132, "mean_token_accuracy": 0.08826020434498787, "num_tokens": 1679579.0, "step": 825 }, { "entropy": 7.441506242752075, "epoch": 0.048580626280362894, "grad_norm": 1.0625, "learning_rate": 0.0004145, "loss": 7.196, "mean_token_accuracy": 0.09741625487804413, "num_tokens": 1689900.0, "step": 830 }, { "entropy": 7.5691015243530275, "epoch": 0.0488732806555458, "grad_norm": 0.953125, "learning_rate": 0.000417, "loss": 7.2469, "mean_token_accuracy": 0.09050429165363312, "num_tokens": 1700534.0, "step": 835 }, { "entropy": 7.547771167755127, "epoch": 0.04916593503072871, "grad_norm": 0.90234375, "learning_rate": 0.0004195, "loss": 7.1963, "mean_token_accuracy": 0.09931469187140465, "num_tokens": 1710969.0, "step": 840 }, { "entropy": 7.454426383972168, "epoch": 0.04945858940591162, "grad_norm": 1.0234375, "learning_rate": 0.000422, "loss": 7.2267, "mean_token_accuracy": 0.09168547242879868, "num_tokens": 1721024.0, "step": 845 }, { "entropy": 7.430084466934204, "epoch": 0.04975124378109453, "grad_norm": 1.0859375, "learning_rate": 0.0004245, "loss": 7.1318, "mean_token_accuracy": 0.09713169336318969, "num_tokens": 1730197.0, "step": 850 }, { "entropy": 7.452590370178223, "epoch": 0.05004389815627744, "grad_norm": 1.125, "learning_rate": 0.000427, "loss": 7.1541, "mean_token_accuracy": 0.09219018146395683, "num_tokens": 1741132.0, "step": 855 }, { "entropy": 7.521068334579468, "epoch": 0.05033655253146035, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 7.2637, "mean_token_accuracy": 0.08954514041543007, "num_tokens": 1751757.0, "step": 860 }, { "entropy": 7.495842170715332, "epoch": 0.050629206906643257, "grad_norm": 0.9921875, "learning_rate": 0.000432, "loss": 7.1582, "mean_token_accuracy": 0.09514842405915261, "num_tokens": 1762779.0, "step": 865 }, { "entropy": 7.475547981262207, "epoch": 0.050921861281826165, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 7.1182, "mean_token_accuracy": 0.09630650877952576, "num_tokens": 1772353.0, "step": 870 }, { "entropy": 7.352218437194824, "epoch": 0.051214515657009074, "grad_norm": 0.94140625, "learning_rate": 0.000437, "loss": 7.145, "mean_token_accuracy": 0.09995641633868217, "num_tokens": 1782648.0, "step": 875 }, { "entropy": 7.392671585083008, "epoch": 0.05150717003219198, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 7.1484, "mean_token_accuracy": 0.09772149994969367, "num_tokens": 1792275.0, "step": 880 }, { "entropy": 7.387517881393433, "epoch": 0.05179982440737489, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 7.1486, "mean_token_accuracy": 0.09331418126821518, "num_tokens": 1803244.0, "step": 885 }, { "entropy": 7.4635416030883786, "epoch": 0.0520924787825578, "grad_norm": 0.86328125, "learning_rate": 0.0004445, "loss": 7.1907, "mean_token_accuracy": 0.09984328448772431, "num_tokens": 1814331.0, "step": 890 }, { "entropy": 7.442190837860108, "epoch": 0.05238513315774071, "grad_norm": 0.9921875, "learning_rate": 0.000447, "loss": 7.1557, "mean_token_accuracy": 0.09669465869665146, "num_tokens": 1823022.0, "step": 895 }, { "entropy": 7.4167015075683596, "epoch": 0.05267778753292362, "grad_norm": 0.9453125, "learning_rate": 0.00044950000000000003, "loss": 7.2017, "mean_token_accuracy": 0.09253377318382264, "num_tokens": 1834416.0, "step": 900 }, { "entropy": 7.530139684677124, "epoch": 0.05297044190810653, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.1951, "mean_token_accuracy": 0.09366482645273208, "num_tokens": 1843507.0, "step": 905 }, { "entropy": 7.3420909404754635, "epoch": 0.053263096283289436, "grad_norm": 0.98828125, "learning_rate": 0.00045450000000000004, "loss": 7.0998, "mean_token_accuracy": 0.09217809438705445, "num_tokens": 1854149.0, "step": 910 }, { "entropy": 7.416664695739746, "epoch": 0.053555750658472345, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 7.1686, "mean_token_accuracy": 0.09251093789935112, "num_tokens": 1864257.0, "step": 915 }, { "entropy": 7.437055015563965, "epoch": 0.053848405033655254, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.1707, "mean_token_accuracy": 0.09187378212809563, "num_tokens": 1873353.0, "step": 920 }, { "entropy": 7.3977635383605955, "epoch": 0.05414105940883816, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 7.1196, "mean_token_accuracy": 0.09563436955213547, "num_tokens": 1884465.0, "step": 925 }, { "entropy": 7.365432357788086, "epoch": 0.05443371378402107, "grad_norm": 0.96875, "learning_rate": 0.0004645, "loss": 7.1528, "mean_token_accuracy": 0.09838449805974961, "num_tokens": 1894872.0, "step": 930 }, { "entropy": 7.34838981628418, "epoch": 0.05472636815920398, "grad_norm": 1.0390625, "learning_rate": 0.000467, "loss": 7.0706, "mean_token_accuracy": 0.10180790275335312, "num_tokens": 1905440.0, "step": 935 }, { "entropy": 7.341986465454101, "epoch": 0.05501902253438689, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.1291, "mean_token_accuracy": 0.09645774215459824, "num_tokens": 1916861.0, "step": 940 }, { "entropy": 7.406238269805908, "epoch": 0.0553116769095698, "grad_norm": 1.1015625, "learning_rate": 0.000472, "loss": 7.0654, "mean_token_accuracy": 0.10491539835929871, "num_tokens": 1927144.0, "step": 945 }, { "entropy": 7.35713381767273, "epoch": 0.05560433128475271, "grad_norm": 0.88671875, "learning_rate": 0.0004745, "loss": 7.138, "mean_token_accuracy": 0.0931523747742176, "num_tokens": 1937174.0, "step": 950 }, { "entropy": 7.403324699401855, "epoch": 0.055896985659935616, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 7.0506, "mean_token_accuracy": 0.11088272705674171, "num_tokens": 1947510.0, "step": 955 }, { "entropy": 7.305504369735718, "epoch": 0.056189640035118525, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 7.1238, "mean_token_accuracy": 0.09536927789449692, "num_tokens": 1957894.0, "step": 960 }, { "entropy": 7.445551156997681, "epoch": 0.056482294410301434, "grad_norm": 0.95703125, "learning_rate": 0.000482, "loss": 7.1862, "mean_token_accuracy": 0.09522910863161087, "num_tokens": 1968670.0, "step": 965 }, { "entropy": 7.351961517333985, "epoch": 0.05677494878548434, "grad_norm": 0.8828125, "learning_rate": 0.0004845, "loss": 7.1451, "mean_token_accuracy": 0.09402441680431366, "num_tokens": 1979678.0, "step": 970 }, { "entropy": 7.329155683517456, "epoch": 0.05706760316066725, "grad_norm": 0.9296875, "learning_rate": 0.000487, "loss": 7.0501, "mean_token_accuracy": 0.10141415372490883, "num_tokens": 1990161.0, "step": 975 }, { "entropy": 7.408869028091431, "epoch": 0.05736025753585016, "grad_norm": 0.98046875, "learning_rate": 0.0004895, "loss": 7.1421, "mean_token_accuracy": 0.09915417581796646, "num_tokens": 2000298.0, "step": 980 }, { "entropy": 7.386150693893432, "epoch": 0.05765291191103307, "grad_norm": 1.109375, "learning_rate": 0.000492, "loss": 7.101, "mean_token_accuracy": 0.0987740397453308, "num_tokens": 2009946.0, "step": 985 }, { "entropy": 7.297941255569458, "epoch": 0.05794556628621598, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 7.064, "mean_token_accuracy": 0.09957554042339326, "num_tokens": 2019192.0, "step": 990 }, { "entropy": 7.343301391601562, "epoch": 0.05823822066139889, "grad_norm": 0.9140625, "learning_rate": 0.000497, "loss": 7.1112, "mean_token_accuracy": 0.09475254267454147, "num_tokens": 2029066.0, "step": 995 }, { "entropy": 7.356789922714233, "epoch": 0.058530875036581796, "grad_norm": 0.94921875, "learning_rate": 0.0004995, "loss": 7.1051, "mean_token_accuracy": 0.09616579562425613, "num_tokens": 2040610.0, "step": 1000 }, { "entropy": 7.330273389816284, "epoch": 0.058823529411764705, "grad_norm": 1.1171875, "learning_rate": 0.000499998026082006, "loss": 7.105, "mean_token_accuracy": 0.0943969689309597, "num_tokens": 2049867.0, "step": 1005 }, { "entropy": 7.243909168243408, "epoch": 0.059116183786947614, "grad_norm": 0.98046875, "learning_rate": 0.0004999900070995136, "loss": 7.0949, "mean_token_accuracy": 0.09849751815199852, "num_tokens": 2059335.0, "step": 1010 }, { "entropy": 7.482809591293335, "epoch": 0.05940883816213052, "grad_norm": 1.15625, "learning_rate": 0.0004999758199023239, "loss": 7.0991, "mean_token_accuracy": 0.09777801483869553, "num_tokens": 2069498.0, "step": 1015 }, { "entropy": 7.322924661636352, "epoch": 0.05970149253731343, "grad_norm": 1.0703125, "learning_rate": 0.0004999554648793858, "loss": 7.1122, "mean_token_accuracy": 0.10163608714938163, "num_tokens": 2080077.0, "step": 1020 }, { "entropy": 7.265040874481201, "epoch": 0.05999414691249634, "grad_norm": 0.9296875, "learning_rate": 0.0004999289425887425, "loss": 7.0334, "mean_token_accuracy": 0.10056126862764359, "num_tokens": 2089699.0, "step": 1025 }, { "entropy": 7.259469652175904, "epoch": 0.06028680128767925, "grad_norm": 1.578125, "learning_rate": 0.0004998962537575161, "loss": 7.0509, "mean_token_accuracy": 0.09879743158817292, "num_tokens": 2099219.0, "step": 1030 }, { "entropy": 7.274491453170777, "epoch": 0.06057945566286216, "grad_norm": 0.91796875, "learning_rate": 0.0004998573992818874, "loss": 7.0268, "mean_token_accuracy": 0.10193772837519646, "num_tokens": 2109218.0, "step": 1035 }, { "entropy": 7.383116436004639, "epoch": 0.06087211003804507, "grad_norm": 1.0078125, "learning_rate": 0.0004998123802270715, "loss": 7.0793, "mean_token_accuracy": 0.09875930175185203, "num_tokens": 2118384.0, "step": 1040 }, { "entropy": 7.2731462001800535, "epoch": 0.061164764413227976, "grad_norm": 1.046875, "learning_rate": 0.0004997611978272886, "loss": 7.0464, "mean_token_accuracy": 0.10151882916688919, "num_tokens": 2127017.0, "step": 1045 }, { "entropy": 7.3074544906616214, "epoch": 0.061457418788410885, "grad_norm": 0.98046875, "learning_rate": 0.0004997038534857298, "loss": 7.1195, "mean_token_accuracy": 0.09616761356592178, "num_tokens": 2137568.0, "step": 1050 }, { "entropy": 7.266034030914307, "epoch": 0.061750073163593794, "grad_norm": 0.9609375, "learning_rate": 0.0004996403487745194, "loss": 7.0254, "mean_token_accuracy": 0.09843881577253341, "num_tokens": 2147063.0, "step": 1055 }, { "entropy": 7.276236915588379, "epoch": 0.0620427275387767, "grad_norm": 0.94921875, "learning_rate": 0.000499570685434671, "loss": 7.0445, "mean_token_accuracy": 0.10075422823429107, "num_tokens": 2156525.0, "step": 1060 }, { "entropy": 7.229153347015381, "epoch": 0.06233538191395961, "grad_norm": 0.921875, "learning_rate": 0.0004994948653760405, "loss": 7.0588, "mean_token_accuracy": 0.09751596227288246, "num_tokens": 2167294.0, "step": 1065 }, { "entropy": 7.209919691085815, "epoch": 0.06262803628914253, "grad_norm": 0.96875, "learning_rate": 0.0004994128906772729, "loss": 6.9627, "mean_token_accuracy": 0.1035116158425808, "num_tokens": 2177341.0, "step": 1070 }, { "entropy": 7.297941446304321, "epoch": 0.06292069066432543, "grad_norm": 0.94921875, "learning_rate": 0.000499324763585746, "loss": 7.0098, "mean_token_accuracy": 0.09901509582996368, "num_tokens": 2188044.0, "step": 1075 }, { "entropy": 7.183123016357422, "epoch": 0.06321334503950835, "grad_norm": 0.9140625, "learning_rate": 0.0004992304865175085, "loss": 7.0293, "mean_token_accuracy": 0.10036754310131073, "num_tokens": 2197612.0, "step": 1080 }, { "entropy": 7.282407426834107, "epoch": 0.06350599941469125, "grad_norm": 1.0078125, "learning_rate": 0.0004991300620572138, "loss": 7.0087, "mean_token_accuracy": 0.09982658997178077, "num_tokens": 2207638.0, "step": 1085 }, { "entropy": 7.160094165802002, "epoch": 0.06379865378987416, "grad_norm": 0.96875, "learning_rate": 0.0004990234929580494, "loss": 6.9333, "mean_token_accuracy": 0.10349727869033813, "num_tokens": 2216714.0, "step": 1090 }, { "entropy": 7.322865962982178, "epoch": 0.06409130816505706, "grad_norm": 0.9375, "learning_rate": 0.0004989107821416609, "loss": 7.0544, "mean_token_accuracy": 0.09982285872101784, "num_tokens": 2225900.0, "step": 1095 }, { "entropy": 7.1447443008422855, "epoch": 0.06438396254023998, "grad_norm": 0.9765625, "learning_rate": 0.0004987919326980723, "loss": 6.9718, "mean_token_accuracy": 0.10523544400930404, "num_tokens": 2235896.0, "step": 1100 }, { "entropy": 7.2013531684875485, "epoch": 0.06467661691542288, "grad_norm": 1.03125, "learning_rate": 0.0004986669478856011, "loss": 6.94, "mean_token_accuracy": 0.10068488419055939, "num_tokens": 2246083.0, "step": 1105 }, { "entropy": 7.246619081497192, "epoch": 0.0649692712906058, "grad_norm": 1.03125, "learning_rate": 0.0004985358311307688, "loss": 6.9572, "mean_token_accuracy": 0.10323750525712967, "num_tokens": 2256941.0, "step": 1110 }, { "entropy": 7.160521936416626, "epoch": 0.0652619256657887, "grad_norm": 1.109375, "learning_rate": 0.0004983985860282081, "loss": 6.9737, "mean_token_accuracy": 0.10002864897251129, "num_tokens": 2266694.0, "step": 1115 }, { "entropy": 7.155581760406494, "epoch": 0.06555458004097162, "grad_norm": 0.9921875, "learning_rate": 0.0004982552163405623, "loss": 6.9638, "mean_token_accuracy": 0.09659243822097778, "num_tokens": 2276826.0, "step": 1120 }, { "entropy": 7.222516393661499, "epoch": 0.06584723441615452, "grad_norm": 0.9765625, "learning_rate": 0.0004981057259983839, "loss": 6.9739, "mean_token_accuracy": 0.10149327889084817, "num_tokens": 2287895.0, "step": 1125 }, { "entropy": 7.083696699142456, "epoch": 0.06613988879133743, "grad_norm": 1.03125, "learning_rate": 0.0004979501191000262, "loss": 6.9513, "mean_token_accuracy": 0.10140683799982071, "num_tokens": 2297501.0, "step": 1130 }, { "entropy": 7.255348253250122, "epoch": 0.06643254316652034, "grad_norm": 0.9921875, "learning_rate": 0.0004977883999115311, "loss": 6.8291, "mean_token_accuracy": 0.10531161874532699, "num_tokens": 2306851.0, "step": 1135 }, { "entropy": 7.172169923782349, "epoch": 0.06672519754170325, "grad_norm": 1.0859375, "learning_rate": 0.0004976205728665113, "loss": 7.006, "mean_token_accuracy": 0.09792810827493667, "num_tokens": 2315710.0, "step": 1140 }, { "entropy": 7.135481214523315, "epoch": 0.06701785191688615, "grad_norm": 0.93359375, "learning_rate": 0.0004974466425660307, "loss": 6.9146, "mean_token_accuracy": 0.10404545590281486, "num_tokens": 2326144.0, "step": 1145 }, { "entropy": 7.1948600769042965, "epoch": 0.06731050629206907, "grad_norm": 0.96484375, "learning_rate": 0.0004972666137784759, "loss": 6.9143, "mean_token_accuracy": 0.10875528082251548, "num_tokens": 2335756.0, "step": 1150 }, { "entropy": 7.106131458282471, "epoch": 0.06760316066725197, "grad_norm": 0.93359375, "learning_rate": 0.0004970804914394271, "loss": 6.9304, "mean_token_accuracy": 0.10725896134972572, "num_tokens": 2345660.0, "step": 1155 }, { "entropy": 7.166688919067383, "epoch": 0.06789581504243489, "grad_norm": 0.9609375, "learning_rate": 0.0004968882806515225, "loss": 6.9403, "mean_token_accuracy": 0.10006137192249298, "num_tokens": 2355252.0, "step": 1160 }, { "entropy": 7.153073406219482, "epoch": 0.06818846941761779, "grad_norm": 0.98046875, "learning_rate": 0.0004966899866843177, "loss": 6.9305, "mean_token_accuracy": 0.10227609500288963, "num_tokens": 2364983.0, "step": 1165 }, { "entropy": 7.1287861347198485, "epoch": 0.0684811237928007, "grad_norm": 1.1171875, "learning_rate": 0.000496485614974142, "loss": 6.9048, "mean_token_accuracy": 0.10142005532979965, "num_tokens": 2375505.0, "step": 1170 }, { "entropy": 7.152293968200683, "epoch": 0.0687737781679836, "grad_norm": 1.015625, "learning_rate": 0.0004962751711239492, "loss": 6.9587, "mean_token_accuracy": 0.10323912650346756, "num_tokens": 2385300.0, "step": 1175 }, { "entropy": 7.039838171005249, "epoch": 0.06906643254316652, "grad_norm": 0.95703125, "learning_rate": 0.0004960586609031636, "loss": 6.9443, "mean_token_accuracy": 0.10556500256061555, "num_tokens": 2395966.0, "step": 1180 }, { "entropy": 7.262147569656372, "epoch": 0.06935908691834942, "grad_norm": 0.96484375, "learning_rate": 0.0004958360902475224, "loss": 6.9281, "mean_token_accuracy": 0.10152315646409989, "num_tokens": 2405429.0, "step": 1185 }, { "entropy": 7.163443088531494, "epoch": 0.06965174129353234, "grad_norm": 1.109375, "learning_rate": 0.0004956074652589125, "loss": 6.9202, "mean_token_accuracy": 0.10446830168366432, "num_tokens": 2415362.0, "step": 1190 }, { "entropy": 7.095344686508179, "epoch": 0.06994439566871524, "grad_norm": 1.0546875, "learning_rate": 0.0004953727922052035, "loss": 6.8784, "mean_token_accuracy": 0.10187279507517814, "num_tokens": 2425998.0, "step": 1195 }, { "entropy": 7.126546478271484, "epoch": 0.07023705004389816, "grad_norm": 0.90234375, "learning_rate": 0.0004951320775200756, "loss": 6.9491, "mean_token_accuracy": 0.09673603773117065, "num_tokens": 2436226.0, "step": 1200 }, { "entropy": 7.202165269851685, "epoch": 0.07052970441908106, "grad_norm": 0.94921875, "learning_rate": 0.0004948853278028436, "loss": 6.8387, "mean_token_accuracy": 0.10797644704580307, "num_tokens": 2445296.0, "step": 1205 }, { "entropy": 7.082312726974488, "epoch": 0.07082235879426398, "grad_norm": 0.90625, "learning_rate": 0.0004946325498182755, "loss": 6.8589, "mean_token_accuracy": 0.11134556159377099, "num_tokens": 2455743.0, "step": 1210 }, { "entropy": 7.09007248878479, "epoch": 0.07111501316944688, "grad_norm": 1.03125, "learning_rate": 0.0004943737504964076, "loss": 6.9405, "mean_token_accuracy": 0.1020224578678608, "num_tokens": 2465239.0, "step": 1215 }, { "entropy": 7.164793825149536, "epoch": 0.0714076675446298, "grad_norm": 1.03125, "learning_rate": 0.000494108936932354, "loss": 6.922, "mean_token_accuracy": 0.10908990055322647, "num_tokens": 2474472.0, "step": 1220 }, { "entropy": 6.9930988311767575, "epoch": 0.0717003219198127, "grad_norm": 0.94921875, "learning_rate": 0.0004938381163861124, "loss": 6.7943, "mean_token_accuracy": 0.11290957406163216, "num_tokens": 2483549.0, "step": 1225 }, { "entropy": 7.140143394470215, "epoch": 0.07199297629499561, "grad_norm": 0.875, "learning_rate": 0.0004935612962823645, "loss": 6.8657, "mean_token_accuracy": 0.10449625924229622, "num_tokens": 2495699.0, "step": 1230 }, { "entropy": 7.029150915145874, "epoch": 0.07228563067017851, "grad_norm": 0.94921875, "learning_rate": 0.0004932784842102739, "loss": 6.9746, "mean_token_accuracy": 0.10025271028280258, "num_tokens": 2507612.0, "step": 1235 }, { "entropy": 7.133029508590698, "epoch": 0.07257828504536143, "grad_norm": 0.94140625, "learning_rate": 0.0004929896879232758, "loss": 6.8438, "mean_token_accuracy": 0.10679830834269524, "num_tokens": 2517281.0, "step": 1240 }, { "entropy": 7.167627429962158, "epoch": 0.07287093942054433, "grad_norm": 1.046875, "learning_rate": 0.0004926949153388668, "loss": 6.8234, "mean_token_accuracy": 0.10795086920261383, "num_tokens": 2526570.0, "step": 1245 }, { "entropy": 7.026937675476074, "epoch": 0.07316359379572725, "grad_norm": 0.96875, "learning_rate": 0.0004923941745383859, "loss": 6.8455, "mean_token_accuracy": 0.10278113707900047, "num_tokens": 2535813.0, "step": 1250 }, { "entropy": 7.024099922180175, "epoch": 0.07345624817091015, "grad_norm": 1.09375, "learning_rate": 0.000492087473766794, "loss": 6.7853, "mean_token_accuracy": 0.11688904613256454, "num_tokens": 2544828.0, "step": 1255 }, { "entropy": 7.1756445407867435, "epoch": 0.07374890254609306, "grad_norm": 0.9375, "learning_rate": 0.000491774821432448, "loss": 6.9021, "mean_token_accuracy": 0.10272038280963898, "num_tokens": 2554612.0, "step": 1260 }, { "entropy": 6.887376928329468, "epoch": 0.07404155692127597, "grad_norm": 0.84765625, "learning_rate": 0.0004914562261068693, "loss": 6.8311, "mean_token_accuracy": 0.11283649727702141, "num_tokens": 2565395.0, "step": 1265 }, { "entropy": 7.175661230087281, "epoch": 0.07433421129645888, "grad_norm": 1.0390625, "learning_rate": 0.0004911316965245098, "loss": 6.966, "mean_token_accuracy": 0.1015208400785923, "num_tokens": 2576520.0, "step": 1270 }, { "entropy": 7.063946008682251, "epoch": 0.07462686567164178, "grad_norm": 0.89453125, "learning_rate": 0.000490801241582512, "loss": 6.8779, "mean_token_accuracy": 0.10767215564846992, "num_tokens": 2586093.0, "step": 1275 }, { "entropy": 7.0348388195037845, "epoch": 0.0749195200468247, "grad_norm": 0.875, "learning_rate": 0.000490464870340465, "loss": 6.8673, "mean_token_accuracy": 0.11059194058179855, "num_tokens": 2596165.0, "step": 1280 }, { "entropy": 7.263307380676269, "epoch": 0.0752121744220076, "grad_norm": 0.953125, "learning_rate": 0.0004901225920201563, "loss": 6.981, "mean_token_accuracy": 0.09260072112083435, "num_tokens": 2607108.0, "step": 1285 }, { "entropy": 6.985970163345337, "epoch": 0.07550482879719052, "grad_norm": 0.98046875, "learning_rate": 0.000489774416005319, "loss": 6.8579, "mean_token_accuracy": 0.10567844063043594, "num_tokens": 2617313.0, "step": 1290 }, { "entropy": 7.193155908584595, "epoch": 0.07579748317237343, "grad_norm": 1.0078125, "learning_rate": 0.0004894203518413742, "loss": 6.942, "mean_token_accuracy": 0.1037025772035122, "num_tokens": 2628065.0, "step": 1295 }, { "entropy": 7.068187236785889, "epoch": 0.07609013754755634, "grad_norm": 1.015625, "learning_rate": 0.0004890604092351701, "loss": 6.9342, "mean_token_accuracy": 0.09517190679907798, "num_tokens": 2638052.0, "step": 1300 }, { "entropy": 7.106878709793091, "epoch": 0.07638279192273925, "grad_norm": 0.9765625, "learning_rate": 0.000488694598054715, "loss": 6.8695, "mean_token_accuracy": 0.10798671543598175, "num_tokens": 2648242.0, "step": 1305 }, { "entropy": 7.1013659000396725, "epoch": 0.07667544629792215, "grad_norm": 1.0078125, "learning_rate": 0.0004883229283289071, "loss": 6.8159, "mean_token_accuracy": 0.10844166055321694, "num_tokens": 2657824.0, "step": 1310 }, { "entropy": 6.991985273361206, "epoch": 0.07696810067310507, "grad_norm": 0.98828125, "learning_rate": 0.00048794541024725993, "loss": 6.7952, "mean_token_accuracy": 0.10927849039435386, "num_tokens": 2667774.0, "step": 1315 }, { "entropy": 7.040319395065308, "epoch": 0.07726075504828797, "grad_norm": 0.95703125, "learning_rate": 0.0004875620541596221, "loss": 6.7604, "mean_token_accuracy": 0.1062987856566906, "num_tokens": 2677697.0, "step": 1320 }, { "entropy": 7.020246982574463, "epoch": 0.07755340942347089, "grad_norm": 1.0234375, "learning_rate": 0.00048717287057589454, "loss": 6.8529, "mean_token_accuracy": 0.10597260296344757, "num_tokens": 2688553.0, "step": 1325 }, { "entropy": 7.039525413513184, "epoch": 0.07784606379865379, "grad_norm": 0.9921875, "learning_rate": 0.0004867778701657417, "loss": 6.7872, "mean_token_accuracy": 0.1075766459107399, "num_tokens": 2698704.0, "step": 1330 }, { "entropy": 7.057392406463623, "epoch": 0.0781387181738367, "grad_norm": 0.9296875, "learning_rate": 0.00048637706375829955, "loss": 6.856, "mean_token_accuracy": 0.10357561856508254, "num_tokens": 2709257.0, "step": 1335 }, { "entropy": 7.129636335372925, "epoch": 0.0784313725490196, "grad_norm": 1.015625, "learning_rate": 0.000485970462341878, "loss": 6.8684, "mean_token_accuracy": 0.10322815775871277, "num_tokens": 2719860.0, "step": 1340 }, { "entropy": 6.990602445602417, "epoch": 0.07872402692420252, "grad_norm": 0.9609375, "learning_rate": 0.00048555807706366044, "loss": 6.8517, "mean_token_accuracy": 0.1050374872982502, "num_tokens": 2730134.0, "step": 1345 }, { "entropy": 6.978021669387817, "epoch": 0.07901668129938542, "grad_norm": 1.0078125, "learning_rate": 0.00048513991922939756, "loss": 6.6989, "mean_token_accuracy": 0.1164980985224247, "num_tokens": 2739661.0, "step": 1350 }, { "entropy": 6.976407098770141, "epoch": 0.07930933567456834, "grad_norm": 0.98828125, "learning_rate": 0.00048471600030309744, "loss": 6.8151, "mean_token_accuracy": 0.10699095502495766, "num_tokens": 2749532.0, "step": 1355 }, { "entropy": 7.110589075088501, "epoch": 0.07960199004975124, "grad_norm": 0.984375, "learning_rate": 0.00048428633190671186, "loss": 6.8471, "mean_token_accuracy": 0.10450146123766899, "num_tokens": 2759652.0, "step": 1360 }, { "entropy": 6.953937816619873, "epoch": 0.07989464442493416, "grad_norm": 0.86328125, "learning_rate": 0.0004838509258198167, "loss": 6.7311, "mean_token_accuracy": 0.11042979061603546, "num_tokens": 2770122.0, "step": 1365 }, { "entropy": 6.970408010482788, "epoch": 0.08018729880011706, "grad_norm": 1.0546875, "learning_rate": 0.00048340979397929, "loss": 6.8092, "mean_token_accuracy": 0.10888475328683853, "num_tokens": 2779788.0, "step": 1370 }, { "entropy": 7.0338794708251955, "epoch": 0.08047995317529998, "grad_norm": 1.015625, "learning_rate": 0.00048296294847898386, "loss": 6.805, "mean_token_accuracy": 0.10510503351688386, "num_tokens": 2790149.0, "step": 1375 }, { "entropy": 7.031380653381348, "epoch": 0.08077260755048288, "grad_norm": 0.98828125, "learning_rate": 0.0004825104015693934, "loss": 6.7248, "mean_token_accuracy": 0.11531992107629777, "num_tokens": 2799378.0, "step": 1380 }, { "entropy": 6.92920618057251, "epoch": 0.0810652619256658, "grad_norm": 1.09375, "learning_rate": 0.0004820521656573208, "loss": 6.8058, "mean_token_accuracy": 0.11184522807598114, "num_tokens": 2809573.0, "step": 1385 }, { "entropy": 6.951801586151123, "epoch": 0.0813579163008487, "grad_norm": 0.92578125, "learning_rate": 0.00048158825330553505, "loss": 6.7261, "mean_token_accuracy": 0.11088547632098197, "num_tokens": 2819816.0, "step": 1390 }, { "entropy": 7.114043664932251, "epoch": 0.08165057067603161, "grad_norm": 0.9765625, "learning_rate": 0.00048111867723242763, "loss": 6.8456, "mean_token_accuracy": 0.1005843736231327, "num_tokens": 2830606.0, "step": 1395 }, { "entropy": 6.9624059200286865, "epoch": 0.08194322505121451, "grad_norm": 0.98828125, "learning_rate": 0.0004806434503116637, "loss": 6.8289, "mean_token_accuracy": 0.10612485110759735, "num_tokens": 2840925.0, "step": 1400 }, { "entropy": 6.966361713409424, "epoch": 0.08223587942639743, "grad_norm": 0.89453125, "learning_rate": 0.0004801625855718296, "loss": 6.7518, "mean_token_accuracy": 0.11064208373427391, "num_tokens": 2850697.0, "step": 1405 }, { "entropy": 6.990543603897095, "epoch": 0.08252853380158033, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.8402, "mean_token_accuracy": 0.10857592597603798, "num_tokens": 2861001.0, "step": 1410 }, { "entropy": 7.022043466567993, "epoch": 0.08282118817676325, "grad_norm": 1.015625, "learning_rate": 0.0004791839955217513, "loss": 6.7625, "mean_token_accuracy": 0.11597265005111694, "num_tokens": 2869959.0, "step": 1415 }, { "entropy": 6.995840072631836, "epoch": 0.08311384255194615, "grad_norm": 0.9375, "learning_rate": 0.00047868629704004786, "loss": 6.728, "mean_token_accuracy": 0.11714338809251786, "num_tokens": 2878998.0, "step": 1420 }, { "entropy": 6.972711563110352, "epoch": 0.08340649692712906, "grad_norm": 0.93359375, "learning_rate": 0.00047818301439561965, "loss": 6.7609, "mean_token_accuracy": 0.10615370124578476, "num_tokens": 2888870.0, "step": 1425 }, { "entropy": 6.923924589157105, "epoch": 0.08369915130231197, "grad_norm": 0.953125, "learning_rate": 0.00047767416138621454, "loss": 6.6755, "mean_token_accuracy": 0.11179826408624649, "num_tokens": 2898549.0, "step": 1430 }, { "entropy": 6.9445459842681885, "epoch": 0.08399180567749488, "grad_norm": 0.84375, "learning_rate": 0.000477159751962295, "loss": 6.7235, "mean_token_accuracy": 0.11873029172420502, "num_tokens": 2908614.0, "step": 1435 }, { "entropy": 6.906632804870606, "epoch": 0.08428446005267778, "grad_norm": 1.0078125, "learning_rate": 0.00047663980022665507, "loss": 6.7154, "mean_token_accuracy": 0.1131787732243538, "num_tokens": 2917845.0, "step": 1440 }, { "entropy": 7.026270580291748, "epoch": 0.0845771144278607, "grad_norm": 0.91015625, "learning_rate": 0.00047611432043403437, "loss": 6.8334, "mean_token_accuracy": 0.10297970846295357, "num_tokens": 2929234.0, "step": 1445 }, { "entropy": 6.907474088668823, "epoch": 0.0848697688030436, "grad_norm": 0.94921875, "learning_rate": 0.0004755833269907267, "loss": 6.7675, "mean_token_accuracy": 0.10896839275956154, "num_tokens": 2939011.0, "step": 1450 }, { "entropy": 7.063915395736695, "epoch": 0.08516242317822652, "grad_norm": 0.95703125, "learning_rate": 0.0004750468344541857, "loss": 6.7726, "mean_token_accuracy": 0.10877819880843162, "num_tokens": 2948796.0, "step": 1455 }, { "entropy": 6.904459810256958, "epoch": 0.08545507755340942, "grad_norm": 0.94921875, "learning_rate": 0.00047450485753262525, "loss": 6.8066, "mean_token_accuracy": 0.10255414545536042, "num_tokens": 2960938.0, "step": 1460 }, { "entropy": 6.976855278015137, "epoch": 0.08574773192859234, "grad_norm": 0.9375, "learning_rate": 0.00047395741108461633, "loss": 6.7148, "mean_token_accuracy": 0.11121275797486305, "num_tokens": 2969964.0, "step": 1465 }, { "entropy": 6.9436931133270265, "epoch": 0.08604038630377524, "grad_norm": 0.98046875, "learning_rate": 0.00047340451011867985, "loss": 6.7419, "mean_token_accuracy": 0.10835531502962112, "num_tokens": 2980562.0, "step": 1470 }, { "entropy": 6.976116418838501, "epoch": 0.08633304067895815, "grad_norm": 0.96484375, "learning_rate": 0.00047284616979287515, "loss": 6.6753, "mean_token_accuracy": 0.11625185832381249, "num_tokens": 2990759.0, "step": 1475 }, { "entropy": 6.905919122695923, "epoch": 0.08662569505414106, "grad_norm": 1.0546875, "learning_rate": 0.00047228240541438433, "loss": 6.7076, "mean_token_accuracy": 0.11023089289665222, "num_tokens": 3000719.0, "step": 1480 }, { "entropy": 6.928934144973755, "epoch": 0.08691834942932397, "grad_norm": 0.96484375, "learning_rate": 0.00047171323243909257, "loss": 6.7253, "mean_token_accuracy": 0.11021335422992706, "num_tokens": 3011584.0, "step": 1485 }, { "entropy": 6.850312614440918, "epoch": 0.08721100380450687, "grad_norm": 1.1328125, "learning_rate": 0.00047113866647116457, "loss": 6.6914, "mean_token_accuracy": 0.11205545589327812, "num_tokens": 3021933.0, "step": 1490 }, { "entropy": 7.0218939781188965, "epoch": 0.08750365817968979, "grad_norm": 1.0390625, "learning_rate": 0.0004705587232626164, "loss": 6.7541, "mean_token_accuracy": 0.10549476444721222, "num_tokens": 3032533.0, "step": 1495 }, { "entropy": 6.886258840560913, "epoch": 0.08779631255487269, "grad_norm": 0.98046875, "learning_rate": 0.00046997341871288424, "loss": 6.6657, "mean_token_accuracy": 0.11410991847515106, "num_tokens": 3041556.0, "step": 1500 }, { "entropy": 6.93623046875, "epoch": 0.0880889669300556, "grad_norm": 1.09375, "learning_rate": 0.0004693827688683879, "loss": 6.7447, "mean_token_accuracy": 0.10976714193820954, "num_tokens": 3052030.0, "step": 1505 }, { "entropy": 6.86750373840332, "epoch": 0.08838162130523851, "grad_norm": 0.9375, "learning_rate": 0.0004687867899220914, "loss": 6.6783, "mean_token_accuracy": 0.10968335196375847, "num_tokens": 3062267.0, "step": 1510 }, { "entropy": 6.955923652648925, "epoch": 0.08867427568042142, "grad_norm": 0.91015625, "learning_rate": 0.00046818549821305846, "loss": 6.643, "mean_token_accuracy": 0.11466655507683754, "num_tokens": 3073357.0, "step": 1515 }, { "entropy": 6.84696593284607, "epoch": 0.08896693005560433, "grad_norm": 0.98828125, "learning_rate": 0.00046757891022600494, "loss": 6.7323, "mean_token_accuracy": 0.11122780367732048, "num_tokens": 3083250.0, "step": 1520 }, { "entropy": 6.95814471244812, "epoch": 0.08925958443078724, "grad_norm": 1.0, "learning_rate": 0.0004669670425908471, "loss": 6.6353, "mean_token_accuracy": 0.11299381777644157, "num_tokens": 3093144.0, "step": 1525 }, { "entropy": 6.820744323730469, "epoch": 0.08955223880597014, "grad_norm": 0.9375, "learning_rate": 0.0004663499120822451, "loss": 6.6688, "mean_token_accuracy": 0.11378093957901, "num_tokens": 3103731.0, "step": 1530 }, { "entropy": 6.915271520614624, "epoch": 0.08984489318115306, "grad_norm": 0.953125, "learning_rate": 0.0004657275356191437, "loss": 6.7017, "mean_token_accuracy": 0.11074108928442002, "num_tokens": 3114113.0, "step": 1535 }, { "entropy": 6.886846303939819, "epoch": 0.09013754755633596, "grad_norm": 0.8828125, "learning_rate": 0.00046509993026430804, "loss": 6.653, "mean_token_accuracy": 0.11144338846206665, "num_tokens": 3124167.0, "step": 1540 }, { "entropy": 6.852968740463257, "epoch": 0.09043020193151888, "grad_norm": 0.92578125, "learning_rate": 0.0004644671132238558, "loss": 6.5614, "mean_token_accuracy": 0.12301889657974244, "num_tokens": 3134751.0, "step": 1545 }, { "entropy": 6.885099744796753, "epoch": 0.09072285630670178, "grad_norm": 1.015625, "learning_rate": 0.00046382910184678585, "loss": 6.6554, "mean_token_accuracy": 0.11772447004914284, "num_tokens": 3144084.0, "step": 1550 }, { "entropy": 6.754053544998169, "epoch": 0.0910155106818847, "grad_norm": 1.0234375, "learning_rate": 0.0004631859136245025, "loss": 6.6136, "mean_token_accuracy": 0.11398938149213791, "num_tokens": 3153156.0, "step": 1555 }, { "entropy": 6.984991645812988, "epoch": 0.0913081650570676, "grad_norm": 0.9375, "learning_rate": 0.0004625375661903357, "loss": 6.6408, "mean_token_accuracy": 0.11836520209908485, "num_tokens": 3163098.0, "step": 1560 }, { "entropy": 6.801419591903686, "epoch": 0.09160081943225051, "grad_norm": 0.9375, "learning_rate": 0.00046188407731905787, "loss": 6.6727, "mean_token_accuracy": 0.11261920407414436, "num_tokens": 3172623.0, "step": 1565 }, { "entropy": 6.9145081520080565, "epoch": 0.09189347380743342, "grad_norm": 1.0078125, "learning_rate": 0.00046122546492639643, "loss": 6.6369, "mean_token_accuracy": 0.11749240681529045, "num_tokens": 3182610.0, "step": 1570 }, { "entropy": 6.80106897354126, "epoch": 0.09218612818261633, "grad_norm": 0.93359375, "learning_rate": 0.000460561747068543, "loss": 6.6364, "mean_token_accuracy": 0.108591927587986, "num_tokens": 3192978.0, "step": 1575 }, { "entropy": 6.943644762039185, "epoch": 0.09247878255779923, "grad_norm": 0.98828125, "learning_rate": 0.0004598929419416578, "loss": 6.6731, "mean_token_accuracy": 0.11072808504104614, "num_tokens": 3202791.0, "step": 1580 }, { "entropy": 6.783168792724609, "epoch": 0.09277143693298215, "grad_norm": 1.0625, "learning_rate": 0.00045921906788137123, "loss": 6.6412, "mean_token_accuracy": 0.11365418583154678, "num_tokens": 3212408.0, "step": 1585 }, { "entropy": 6.906521463394165, "epoch": 0.09306409130816505, "grad_norm": 0.9140625, "learning_rate": 0.00045854014336228115, "loss": 6.6733, "mean_token_accuracy": 0.11501292213797569, "num_tokens": 3222182.0, "step": 1590 }, { "entropy": 6.849865865707398, "epoch": 0.09335674568334797, "grad_norm": 0.95703125, "learning_rate": 0.00045785618699744615, "loss": 6.6344, "mean_token_accuracy": 0.11746996641159058, "num_tokens": 3233058.0, "step": 1595 }, { "entropy": 6.8446972370147705, "epoch": 0.09364940005853087, "grad_norm": 0.9765625, "learning_rate": 0.00045716721753787543, "loss": 6.6006, "mean_token_accuracy": 0.11764349192380905, "num_tokens": 3243412.0, "step": 1600 }, { "entropy": 6.802833318710327, "epoch": 0.09394205443371378, "grad_norm": 1.09375, "learning_rate": 0.0004564732538720148, "loss": 6.7006, "mean_token_accuracy": 0.11396326944231987, "num_tokens": 3254511.0, "step": 1605 }, { "entropy": 6.9019934177398685, "epoch": 0.09423470880889669, "grad_norm": 1.0078125, "learning_rate": 0.00045577431502522877, "loss": 6.5915, "mean_token_accuracy": 0.11526288017630577, "num_tokens": 3264949.0, "step": 1610 }, { "entropy": 6.764813375473023, "epoch": 0.0945273631840796, "grad_norm": 0.96484375, "learning_rate": 0.0004550704201592787, "loss": 6.6396, "mean_token_accuracy": 0.10926437377929688, "num_tokens": 3275014.0, "step": 1615 }, { "entropy": 6.861340761184692, "epoch": 0.09482001755926252, "grad_norm": 1.09375, "learning_rate": 0.0004543615885717981, "loss": 6.6634, "mean_token_accuracy": 0.11290878355503083, "num_tokens": 3285446.0, "step": 1620 }, { "entropy": 6.844233989715576, "epoch": 0.09511267193444542, "grad_norm": 0.984375, "learning_rate": 0.00045364783969576296, "loss": 6.5346, "mean_token_accuracy": 0.1263396829366684, "num_tokens": 3295383.0, "step": 1625 }, { "entropy": 6.765133380889893, "epoch": 0.09540532630962834, "grad_norm": 0.99609375, "learning_rate": 0.0004529291930989592, "loss": 6.6189, "mean_token_accuracy": 0.11274374797940254, "num_tokens": 3305263.0, "step": 1630 }, { "entropy": 6.842666339874268, "epoch": 0.09569798068481124, "grad_norm": 0.984375, "learning_rate": 0.0004522056684834464, "loss": 6.6083, "mean_token_accuracy": 0.1211700364947319, "num_tokens": 3315434.0, "step": 1635 }, { "entropy": 6.784665536880493, "epoch": 0.09599063505999415, "grad_norm": 1.03125, "learning_rate": 0.0004514772856850173, "loss": 6.5348, "mean_token_accuracy": 0.12217146530747414, "num_tokens": 3324908.0, "step": 1640 }, { "entropy": 6.831562328338623, "epoch": 0.09628328943517706, "grad_norm": 0.9765625, "learning_rate": 0.0004507440646726542, "loss": 6.6054, "mean_token_accuracy": 0.12192678451538086, "num_tokens": 3335987.0, "step": 1645 }, { "entropy": 6.853379344940185, "epoch": 0.09657594381035997, "grad_norm": 0.99609375, "learning_rate": 0.0004500060255479818, "loss": 6.561, "mean_token_accuracy": 0.1174039103090763, "num_tokens": 3345502.0, "step": 1650 }, { "entropy": 6.778363132476807, "epoch": 0.09686859818554287, "grad_norm": 0.93359375, "learning_rate": 0.0004492631885447151, "loss": 6.5545, "mean_token_accuracy": 0.11502353250980377, "num_tokens": 3355237.0, "step": 1655 }, { "entropy": 6.812596559524536, "epoch": 0.09716125256072579, "grad_norm": 0.94921875, "learning_rate": 0.00044851557402810616, "loss": 6.6318, "mean_token_accuracy": 0.11809700429439544, "num_tokens": 3366166.0, "step": 1660 }, { "entropy": 6.858366012573242, "epoch": 0.09745390693590869, "grad_norm": 0.94921875, "learning_rate": 0.00044776320249438444, "loss": 6.5995, "mean_token_accuracy": 0.11467723920941353, "num_tokens": 3375931.0, "step": 1665 }, { "entropy": 6.782172203063965, "epoch": 0.0977465613110916, "grad_norm": 0.9296875, "learning_rate": 0.00044700609457019565, "loss": 6.5999, "mean_token_accuracy": 0.12378341481089591, "num_tokens": 3386728.0, "step": 1670 }, { "entropy": 6.759363842010498, "epoch": 0.09803921568627451, "grad_norm": 0.9375, "learning_rate": 0.0004462442710120359, "loss": 6.5791, "mean_token_accuracy": 0.1205291859805584, "num_tokens": 3396795.0, "step": 1675 }, { "entropy": 6.835077142715454, "epoch": 0.09833187006145742, "grad_norm": 0.9140625, "learning_rate": 0.000445477752705683, "loss": 6.5568, "mean_token_accuracy": 0.1181432493031025, "num_tokens": 3406310.0, "step": 1680 }, { "entropy": 6.776544427871704, "epoch": 0.09862452443664033, "grad_norm": 0.90234375, "learning_rate": 0.00044470656066562336, "loss": 6.6114, "mean_token_accuracy": 0.11417201384902001, "num_tokens": 3418110.0, "step": 1685 }, { "entropy": 6.792936897277832, "epoch": 0.09891717881182324, "grad_norm": 1.109375, "learning_rate": 0.0004439307160344765, "loss": 6.5952, "mean_token_accuracy": 0.11885511875152588, "num_tokens": 3428122.0, "step": 1690 }, { "entropy": 6.801793384552002, "epoch": 0.09920983318700614, "grad_norm": 0.9765625, "learning_rate": 0.00044315024008241473, "loss": 6.6457, "mean_token_accuracy": 0.11425484046339988, "num_tokens": 3438514.0, "step": 1695 }, { "entropy": 6.8519859790802, "epoch": 0.09950248756218906, "grad_norm": 1.0, "learning_rate": 0.0004423651542065806, "loss": 6.6262, "mean_token_accuracy": 0.1146598532795906, "num_tokens": 3449040.0, "step": 1700 }, { "entropy": 6.8020600318908695, "epoch": 0.09979514193737196, "grad_norm": 1.0234375, "learning_rate": 0.00044157547993050006, "loss": 6.5487, "mean_token_accuracy": 0.12066433876752854, "num_tokens": 3459244.0, "step": 1705 }, { "entropy": 6.881866407394409, "epoch": 0.10008779631255488, "grad_norm": 1.078125, "learning_rate": 0.00044078123890349227, "loss": 6.6118, "mean_token_accuracy": 0.11424820944666862, "num_tokens": 3469270.0, "step": 1710 }, { "entropy": 6.784549045562744, "epoch": 0.10038045068773778, "grad_norm": 1.0703125, "learning_rate": 0.00043998245290007606, "loss": 6.592, "mean_token_accuracy": 0.11819150224328041, "num_tokens": 3480113.0, "step": 1715 }, { "entropy": 6.802189111709595, "epoch": 0.1006731050629207, "grad_norm": 1.015625, "learning_rate": 0.00043917914381937323, "loss": 6.5813, "mean_token_accuracy": 0.11734010130167008, "num_tokens": 3490451.0, "step": 1720 }, { "entropy": 6.809964227676391, "epoch": 0.1009657594381036, "grad_norm": 0.87109375, "learning_rate": 0.00043837133368450815, "loss": 6.5405, "mean_token_accuracy": 0.11609668955206871, "num_tokens": 3501107.0, "step": 1725 }, { "entropy": 6.71238145828247, "epoch": 0.10125841381328651, "grad_norm": 0.984375, "learning_rate": 0.0004375590446420037, "loss": 6.5099, "mean_token_accuracy": 0.13233423829078675, "num_tokens": 3510731.0, "step": 1730 }, { "entropy": 6.739808130264282, "epoch": 0.10155106818846941, "grad_norm": 0.953125, "learning_rate": 0.0004367422989611743, "loss": 6.4388, "mean_token_accuracy": 0.12671404406428338, "num_tokens": 3520843.0, "step": 1735 }, { "entropy": 6.837344312667847, "epoch": 0.10184372256365233, "grad_norm": 0.8984375, "learning_rate": 0.0004359211190335153, "loss": 6.6177, "mean_token_accuracy": 0.11465101763606071, "num_tokens": 3530668.0, "step": 1740 }, { "entropy": 6.749877786636352, "epoch": 0.10213637693883523, "grad_norm": 0.9921875, "learning_rate": 0.00043509552737208923, "loss": 6.5428, "mean_token_accuracy": 0.12134164273738861, "num_tokens": 3540252.0, "step": 1745 }, { "entropy": 6.7890314102172855, "epoch": 0.10242903131401815, "grad_norm": 0.96875, "learning_rate": 0.00043426554661090853, "loss": 6.5481, "mean_token_accuracy": 0.11811421886086464, "num_tokens": 3549069.0, "step": 1750 }, { "entropy": 6.757550573348999, "epoch": 0.10272168568920105, "grad_norm": 0.8984375, "learning_rate": 0.00043343119950431516, "loss": 6.58, "mean_token_accuracy": 0.11727841719985008, "num_tokens": 3559988.0, "step": 1755 }, { "entropy": 6.787223291397095, "epoch": 0.10301434006438397, "grad_norm": 0.98828125, "learning_rate": 0.00043259250892635644, "loss": 6.4955, "mean_token_accuracy": 0.1283750705420971, "num_tokens": 3569829.0, "step": 1760 }, { "entropy": 6.687646579742432, "epoch": 0.10330699443956687, "grad_norm": 0.9375, "learning_rate": 0.0004317494978701582, "loss": 6.4395, "mean_token_accuracy": 0.1254482589662075, "num_tokens": 3578958.0, "step": 1765 }, { "entropy": 6.786183023452759, "epoch": 0.10359964881474978, "grad_norm": 0.9375, "learning_rate": 0.0004309021894472943, "loss": 6.5076, "mean_token_accuracy": 0.12173920199275017, "num_tokens": 3588844.0, "step": 1770 }, { "entropy": 6.71337513923645, "epoch": 0.10389230318993269, "grad_norm": 1.0, "learning_rate": 0.0004300506068871534, "loss": 6.5819, "mean_token_accuracy": 0.11760919094085694, "num_tokens": 3599047.0, "step": 1775 }, { "entropy": 6.7201086521148685, "epoch": 0.1041849575651156, "grad_norm": 0.9609375, "learning_rate": 0.00042919477353630135, "loss": 6.4735, "mean_token_accuracy": 0.1287480928003788, "num_tokens": 3608416.0, "step": 1780 }, { "entropy": 6.780730867385865, "epoch": 0.1044776119402985, "grad_norm": 1.1171875, "learning_rate": 0.000428334712857842, "loss": 6.5059, "mean_token_accuracy": 0.11816626787185669, "num_tokens": 3618460.0, "step": 1785 }, { "entropy": 6.67847204208374, "epoch": 0.10477026631548142, "grad_norm": 1.0234375, "learning_rate": 0.00042747044843077304, "loss": 6.5474, "mean_token_accuracy": 0.12268414348363876, "num_tokens": 3628795.0, "step": 1790 }, { "entropy": 6.735287475585937, "epoch": 0.10506292069066432, "grad_norm": 1.0859375, "learning_rate": 0.00042660200394934047, "loss": 6.5558, "mean_token_accuracy": 0.11583011224865913, "num_tokens": 3640278.0, "step": 1795 }, { "entropy": 6.766513156890869, "epoch": 0.10535557506584724, "grad_norm": 0.9296875, "learning_rate": 0.00042572940322238844, "loss": 6.5482, "mean_token_accuracy": 0.12088547199964524, "num_tokens": 3650497.0, "step": 1800 }, { "entropy": 6.722351598739624, "epoch": 0.10564822944103014, "grad_norm": 0.9453125, "learning_rate": 0.00042485267017270664, "loss": 6.5984, "mean_token_accuracy": 0.1228600986301899, "num_tokens": 3661101.0, "step": 1805 }, { "entropy": 6.922651243209839, "epoch": 0.10594088381621306, "grad_norm": 0.9921875, "learning_rate": 0.0004239718288363745, "loss": 6.5561, "mean_token_accuracy": 0.1192373014986515, "num_tokens": 3670698.0, "step": 1810 }, { "entropy": 6.736356639862061, "epoch": 0.10623353819139596, "grad_norm": 1.1328125, "learning_rate": 0.0004230869033621023, "loss": 6.5585, "mean_token_accuracy": 0.11428969204425812, "num_tokens": 3679723.0, "step": 1815 }, { "entropy": 6.864965009689331, "epoch": 0.10652619256657887, "grad_norm": 0.93359375, "learning_rate": 0.0004221979180105688, "loss": 6.5512, "mean_token_accuracy": 0.11349868997931481, "num_tokens": 3690362.0, "step": 1820 }, { "entropy": 6.747930908203125, "epoch": 0.10681884694176177, "grad_norm": 0.96484375, "learning_rate": 0.00042130489715375645, "loss": 6.5085, "mean_token_accuracy": 0.12559529766440392, "num_tokens": 3700087.0, "step": 1825 }, { "entropy": 6.717715930938721, "epoch": 0.10711150131694469, "grad_norm": 0.96875, "learning_rate": 0.00042040786527428335, "loss": 6.5049, "mean_token_accuracy": 0.12355283051729202, "num_tokens": 3710086.0, "step": 1830 }, { "entropy": 6.7144248485565186, "epoch": 0.10740415569212759, "grad_norm": 0.95703125, "learning_rate": 0.0004195068469647315, "loss": 6.4642, "mean_token_accuracy": 0.12195742204785347, "num_tokens": 3720292.0, "step": 1835 }, { "entropy": 6.729002285003662, "epoch": 0.10769681006731051, "grad_norm": 0.93359375, "learning_rate": 0.00041860186692697297, "loss": 6.5342, "mean_token_accuracy": 0.11787921264767647, "num_tokens": 3730980.0, "step": 1840 }, { "entropy": 6.749273777008057, "epoch": 0.10798946444249341, "grad_norm": 1.0390625, "learning_rate": 0.00041769294997149264, "loss": 6.5779, "mean_token_accuracy": 0.11964235603809356, "num_tokens": 3741244.0, "step": 1845 }, { "entropy": 6.732828664779663, "epoch": 0.10828211881767633, "grad_norm": 0.97265625, "learning_rate": 0.0004167801210167081, "loss": 6.5632, "mean_token_accuracy": 0.11899603232741356, "num_tokens": 3751841.0, "step": 1850 }, { "entropy": 6.836530923843384, "epoch": 0.10857477319285923, "grad_norm": 0.9765625, "learning_rate": 0.0004158634050882861, "loss": 6.5206, "mean_token_accuracy": 0.12107773423194886, "num_tokens": 3762571.0, "step": 1855 }, { "entropy": 6.6559099674224855, "epoch": 0.10886742756804214, "grad_norm": 1.0625, "learning_rate": 0.0004149428273184569, "loss": 6.5158, "mean_token_accuracy": 0.12190034389495849, "num_tokens": 3771778.0, "step": 1860 }, { "entropy": 6.7532881736755375, "epoch": 0.10916008194322505, "grad_norm": 0.95703125, "learning_rate": 0.0004140184129453253, "loss": 6.4896, "mean_token_accuracy": 0.12468724176287652, "num_tokens": 3781712.0, "step": 1865 }, { "entropy": 6.647825574874878, "epoch": 0.10945273631840796, "grad_norm": 0.984375, "learning_rate": 0.000413090187312178, "loss": 6.3472, "mean_token_accuracy": 0.13525793552398682, "num_tokens": 3790711.0, "step": 1870 }, { "entropy": 6.663978242874146, "epoch": 0.10974539069359086, "grad_norm": 0.91015625, "learning_rate": 0.0004121581758667898, "loss": 6.473, "mean_token_accuracy": 0.1203851766884327, "num_tokens": 3801271.0, "step": 1875 }, { "entropy": 6.769151782989502, "epoch": 0.11003804506877378, "grad_norm": 0.8671875, "learning_rate": 0.00041122240416072533, "loss": 6.4856, "mean_token_accuracy": 0.12278474420309067, "num_tokens": 3811518.0, "step": 1880 }, { "entropy": 6.705088186264038, "epoch": 0.11033069944395668, "grad_norm": 0.90625, "learning_rate": 0.0004102828978486385, "loss": 6.5151, "mean_token_accuracy": 0.1212370365858078, "num_tokens": 3821454.0, "step": 1885 }, { "entropy": 6.742790365219117, "epoch": 0.1106233538191396, "grad_norm": 0.88671875, "learning_rate": 0.0004093396826875695, "loss": 6.5606, "mean_token_accuracy": 0.11982747986912727, "num_tokens": 3831886.0, "step": 1890 }, { "entropy": 6.7166282653808596, "epoch": 0.1109160081943225, "grad_norm": 0.94921875, "learning_rate": 0.00040839278453623837, "loss": 6.4898, "mean_token_accuracy": 0.1260741837322712, "num_tokens": 3841723.0, "step": 1895 }, { "entropy": 6.7906341552734375, "epoch": 0.11120866256950541, "grad_norm": 1.0703125, "learning_rate": 0.0004074422293543363, "loss": 6.4533, "mean_token_accuracy": 0.1258271798491478, "num_tokens": 3851374.0, "step": 1900 }, { "entropy": 6.740607738494873, "epoch": 0.11150131694468832, "grad_norm": 0.95703125, "learning_rate": 0.0004064880432018137, "loss": 6.4903, "mean_token_accuracy": 0.12274285033345222, "num_tokens": 3862627.0, "step": 1905 }, { "entropy": 6.659914445877075, "epoch": 0.11179397131987123, "grad_norm": 1.03125, "learning_rate": 0.00040553025223816615, "loss": 6.4784, "mean_token_accuracy": 0.12452571094036102, "num_tokens": 3872344.0, "step": 1910 }, { "entropy": 6.735513925552368, "epoch": 0.11208662569505413, "grad_norm": 0.890625, "learning_rate": 0.00040456888272171653, "loss": 6.5453, "mean_token_accuracy": 0.11647359281778336, "num_tokens": 3882896.0, "step": 1915 }, { "entropy": 6.713681602478028, "epoch": 0.11237928007023705, "grad_norm": 0.91015625, "learning_rate": 0.00040360396100889577, "loss": 6.4595, "mean_token_accuracy": 0.12801918759942055, "num_tokens": 3893773.0, "step": 1920 }, { "entropy": 6.6865918159484865, "epoch": 0.11267193444541995, "grad_norm": 0.95703125, "learning_rate": 0.0004026355135535202, "loss": 6.4424, "mean_token_accuracy": 0.12188205718994141, "num_tokens": 3905057.0, "step": 1925 }, { "entropy": 6.726850271224976, "epoch": 0.11296458882060287, "grad_norm": 0.91796875, "learning_rate": 0.000401663566906066, "loss": 6.4427, "mean_token_accuracy": 0.12147087454795838, "num_tokens": 3914306.0, "step": 1930 }, { "entropy": 6.700537204742432, "epoch": 0.11325724319578578, "grad_norm": 0.9375, "learning_rate": 0.00040068814771294134, "loss": 6.4905, "mean_token_accuracy": 0.12801681384444236, "num_tokens": 3924168.0, "step": 1935 }, { "entropy": 6.674844408035279, "epoch": 0.11354989757096869, "grad_norm": 0.99609375, "learning_rate": 0.0003997092827157562, "loss": 6.4243, "mean_token_accuracy": 0.12779392600059508, "num_tokens": 3934603.0, "step": 1940 }, { "entropy": 6.662173557281494, "epoch": 0.1138425519461516, "grad_norm": 0.875, "learning_rate": 0.000398726998750589, "loss": 6.575, "mean_token_accuracy": 0.12289680615067482, "num_tokens": 3946181.0, "step": 1945 }, { "entropy": 6.859195804595947, "epoch": 0.1141352063213345, "grad_norm": 1.0, "learning_rate": 0.00039774132274725076, "loss": 6.4832, "mean_token_accuracy": 0.12466611191630364, "num_tokens": 3955732.0, "step": 1950 }, { "entropy": 6.668773794174195, "epoch": 0.11442786069651742, "grad_norm": 1.015625, "learning_rate": 0.00039675228172854707, "loss": 6.4042, "mean_token_accuracy": 0.12757309898734093, "num_tokens": 3965569.0, "step": 1955 }, { "entropy": 6.693961477279663, "epoch": 0.11472051507170032, "grad_norm": 0.9765625, "learning_rate": 0.0003957599028095371, "loss": 6.664, "mean_token_accuracy": 0.10505481734871865, "num_tokens": 3976020.0, "step": 1960 }, { "entropy": 6.842778825759888, "epoch": 0.11501316944688324, "grad_norm": 0.9765625, "learning_rate": 0.00039476421319679017, "loss": 6.4668, "mean_token_accuracy": 0.12651116624474526, "num_tokens": 3986642.0, "step": 1965 }, { "entropy": 6.6270751953125, "epoch": 0.11530582382206614, "grad_norm": 0.984375, "learning_rate": 0.00039376524018764, "loss": 6.4971, "mean_token_accuracy": 0.12009134292602539, "num_tokens": 3997343.0, "step": 1970 }, { "entropy": 6.695995426177978, "epoch": 0.11559847819724905, "grad_norm": 0.96875, "learning_rate": 0.00039276301116943616, "loss": 6.417, "mean_token_accuracy": 0.12686994075775146, "num_tokens": 4007715.0, "step": 1975 }, { "entropy": 6.663046932220459, "epoch": 0.11589113257243196, "grad_norm": 0.90234375, "learning_rate": 0.0003917575536187936, "loss": 6.5211, "mean_token_accuracy": 0.1214706502854824, "num_tokens": 4018268.0, "step": 1980 }, { "entropy": 6.7626746654510494, "epoch": 0.11618378694761487, "grad_norm": 0.87109375, "learning_rate": 0.00039074889510083894, "loss": 6.4082, "mean_token_accuracy": 0.12497928068041801, "num_tokens": 4028539.0, "step": 1985 }, { "entropy": 6.682868528366089, "epoch": 0.11647644132279777, "grad_norm": 0.91796875, "learning_rate": 0.00038973706326845495, "loss": 6.4965, "mean_token_accuracy": 0.12758915945887567, "num_tokens": 4039300.0, "step": 1990 }, { "entropy": 6.666601848602295, "epoch": 0.11676909569798069, "grad_norm": 1.0078125, "learning_rate": 0.0003887220858615225, "loss": 6.5343, "mean_token_accuracy": 0.11495309770107269, "num_tokens": 4048471.0, "step": 1995 }, { "entropy": 6.751353979110718, "epoch": 0.11706175007316359, "grad_norm": 0.91796875, "learning_rate": 0.0003877039907061597, "loss": 6.3476, "mean_token_accuracy": 0.1322360999882221, "num_tokens": 4058221.0, "step": 2000 }, { "entropy": 6.626428461074829, "epoch": 0.11735440444834651, "grad_norm": 0.9140625, "learning_rate": 0.0003866828057139598, "loss": 6.4286, "mean_token_accuracy": 0.13097614645957947, "num_tokens": 4067617.0, "step": 2005 }, { "entropy": 6.727088737487793, "epoch": 0.11764705882352941, "grad_norm": 1.0859375, "learning_rate": 0.00038565855888122503, "loss": 6.4454, "mean_token_accuracy": 0.12304920554161072, "num_tokens": 4076530.0, "step": 2010 }, { "entropy": 6.606106758117676, "epoch": 0.11793971319871233, "grad_norm": 0.875, "learning_rate": 0.00038463127828819975, "loss": 6.4303, "mean_token_accuracy": 0.12969082817435265, "num_tokens": 4087081.0, "step": 2015 }, { "entropy": 6.735717344284057, "epoch": 0.11823236757389523, "grad_norm": 0.8671875, "learning_rate": 0.00038360099209830043, "loss": 6.4965, "mean_token_accuracy": 0.12473658993840217, "num_tokens": 4098289.0, "step": 2020 }, { "entropy": 6.674237775802612, "epoch": 0.11852502194907814, "grad_norm": 0.9140625, "learning_rate": 0.0003825677285573433, "loss": 6.4984, "mean_token_accuracy": 0.12176326215267182, "num_tokens": 4109023.0, "step": 2025 }, { "entropy": 6.659593296051026, "epoch": 0.11881767632426105, "grad_norm": 0.953125, "learning_rate": 0.00038153151599277027, "loss": 6.4003, "mean_token_accuracy": 0.12995235100388527, "num_tokens": 4118622.0, "step": 2030 }, { "entropy": 6.662193441390992, "epoch": 0.11911033069944396, "grad_norm": 0.8984375, "learning_rate": 0.0003804923828128723, "loss": 6.4167, "mean_token_accuracy": 0.12718778625130653, "num_tokens": 4129117.0, "step": 2035 }, { "entropy": 6.673795127868653, "epoch": 0.11940298507462686, "grad_norm": 0.98046875, "learning_rate": 0.0003794503575060104, "loss": 6.501, "mean_token_accuracy": 0.1230692744255066, "num_tokens": 4139979.0, "step": 2040 }, { "entropy": 6.691799020767212, "epoch": 0.11969563944980978, "grad_norm": 0.83203125, "learning_rate": 0.00037840546863983484, "loss": 6.4137, "mean_token_accuracy": 0.12930611968040467, "num_tokens": 4151445.0, "step": 2045 }, { "entropy": 6.621114921569824, "epoch": 0.11998829382499268, "grad_norm": 0.95703125, "learning_rate": 0.0003773577448605015, "loss": 6.4167, "mean_token_accuracy": 0.12460907250642776, "num_tokens": 4162457.0, "step": 2050 }, { "entropy": 6.685143518447876, "epoch": 0.1202809482001756, "grad_norm": 1.0234375, "learning_rate": 0.0003763072148918872, "loss": 6.381, "mean_token_accuracy": 0.1308208040893078, "num_tokens": 4172204.0, "step": 2055 }, { "entropy": 6.650257015228272, "epoch": 0.1205736025753585, "grad_norm": 0.8984375, "learning_rate": 0.0003752539075348017, "loss": 6.4169, "mean_token_accuracy": 0.12551707699894904, "num_tokens": 4182219.0, "step": 2060 }, { "entropy": 6.686775350570679, "epoch": 0.12086625695054141, "grad_norm": 0.9375, "learning_rate": 0.00037419785166619817, "loss": 6.4207, "mean_token_accuracy": 0.12680845633149146, "num_tokens": 4194192.0, "step": 2065 }, { "entropy": 6.645538425445556, "epoch": 0.12115891132572432, "grad_norm": 1.0234375, "learning_rate": 0.0003731390762383818, "loss": 6.4217, "mean_token_accuracy": 0.1262901932001114, "num_tokens": 4204461.0, "step": 2070 }, { "entropy": 6.6539043426513675, "epoch": 0.12145156570090723, "grad_norm": 1.0, "learning_rate": 0.0003720776102782158, "loss": 6.4641, "mean_token_accuracy": 0.12074286341667176, "num_tokens": 4214317.0, "step": 2075 }, { "entropy": 6.769407320022583, "epoch": 0.12174422007609013, "grad_norm": 0.95703125, "learning_rate": 0.00037101348288632555, "loss": 6.4226, "mean_token_accuracy": 0.12740262746810913, "num_tokens": 4225507.0, "step": 2080 }, { "entropy": 6.643149042129517, "epoch": 0.12203687445127305, "grad_norm": 0.83984375, "learning_rate": 0.0003699467232363012, "loss": 6.459, "mean_token_accuracy": 0.12595532685518265, "num_tokens": 4235836.0, "step": 2085 }, { "entropy": 6.66497015953064, "epoch": 0.12232952882645595, "grad_norm": 0.90234375, "learning_rate": 0.0003688773605738973, "loss": 6.4019, "mean_token_accuracy": 0.12867318093776703, "num_tokens": 4246797.0, "step": 2090 }, { "entropy": 6.679510068893433, "epoch": 0.12262218320163887, "grad_norm": 0.87109375, "learning_rate": 0.00036780542421623134, "loss": 6.3874, "mean_token_accuracy": 0.12614520490169526, "num_tokens": 4258084.0, "step": 2095 }, { "entropy": 6.631268167495728, "epoch": 0.12291483757682177, "grad_norm": 0.94921875, "learning_rate": 0.0003667309435509802, "loss": 6.4642, "mean_token_accuracy": 0.12479421123862267, "num_tokens": 4267756.0, "step": 2100 }, { "entropy": 6.686967182159424, "epoch": 0.12320749195200469, "grad_norm": 0.87890625, "learning_rate": 0.0003656539480355741, "loss": 6.3988, "mean_token_accuracy": 0.12740305736660956, "num_tokens": 4278888.0, "step": 2105 }, { "entropy": 6.60836615562439, "epoch": 0.12350014632718759, "grad_norm": 0.984375, "learning_rate": 0.0003645744671963891, "loss": 6.4196, "mean_token_accuracy": 0.12640116214752198, "num_tokens": 4289787.0, "step": 2110 }, { "entropy": 6.730862092971802, "epoch": 0.1237928007023705, "grad_norm": 0.99609375, "learning_rate": 0.0003634925306279376, "loss": 6.3724, "mean_token_accuracy": 0.1258112333714962, "num_tokens": 4299951.0, "step": 2115 }, { "entropy": 6.61127495765686, "epoch": 0.1240854550775534, "grad_norm": 1.03125, "learning_rate": 0.0003624081679920574, "loss": 6.4036, "mean_token_accuracy": 0.12645921409130095, "num_tokens": 4309143.0, "step": 2120 }, { "entropy": 6.6258745193481445, "epoch": 0.12437810945273632, "grad_norm": 1.0703125, "learning_rate": 0.0003613214090170977, "loss": 6.3417, "mean_token_accuracy": 0.13214187398552896, "num_tokens": 4319121.0, "step": 2125 }, { "entropy": 6.667118978500366, "epoch": 0.12467076382791922, "grad_norm": 0.875, "learning_rate": 0.0003602322834971048, "loss": 6.3238, "mean_token_accuracy": 0.134113297611475, "num_tokens": 4329031.0, "step": 2130 }, { "entropy": 6.549208688735962, "epoch": 0.12496341820310214, "grad_norm": 0.92578125, "learning_rate": 0.0003591408212910051, "loss": 6.4242, "mean_token_accuracy": 0.12980442717671395, "num_tokens": 4339255.0, "step": 2135 }, { "entropy": 6.63796215057373, "epoch": 0.12525607257828505, "grad_norm": 0.95703125, "learning_rate": 0.0003580470523217863, "loss": 6.3766, "mean_token_accuracy": 0.13202663511037827, "num_tokens": 4348993.0, "step": 2140 }, { "entropy": 6.635591173171997, "epoch": 0.12554872695346794, "grad_norm": 0.90234375, "learning_rate": 0.0003569510065756771, "loss": 6.3601, "mean_token_accuracy": 0.1303073823451996, "num_tokens": 4359614.0, "step": 2145 }, { "entropy": 6.671686458587646, "epoch": 0.12584138132865086, "grad_norm": 1.0234375, "learning_rate": 0.0003558527141013254, "loss": 6.4148, "mean_token_accuracy": 0.1251296579837799, "num_tokens": 4369385.0, "step": 2150 }, { "entropy": 6.61700553894043, "epoch": 0.12613403570383377, "grad_norm": 1.0234375, "learning_rate": 0.0003547522050089742, "loss": 6.2875, "mean_token_accuracy": 0.12825888618826867, "num_tokens": 4378812.0, "step": 2155 }, { "entropy": 6.603330373764038, "epoch": 0.1264266900790167, "grad_norm": 0.9296875, "learning_rate": 0.00035364950946963606, "loss": 6.3623, "mean_token_accuracy": 0.12848870530724527, "num_tokens": 4389505.0, "step": 2160 }, { "entropy": 6.6235908508300785, "epoch": 0.12671934445419958, "grad_norm": 0.8828125, "learning_rate": 0.0003525446577142663, "loss": 6.3429, "mean_token_accuracy": 0.13325420394539833, "num_tokens": 4399286.0, "step": 2165 }, { "entropy": 6.552273988723755, "epoch": 0.1270119988293825, "grad_norm": 0.828125, "learning_rate": 0.00035143768003293395, "loss": 6.3587, "mean_token_accuracy": 0.1344788283109665, "num_tokens": 4410193.0, "step": 2170 }, { "entropy": 6.6747089385986325, "epoch": 0.1273046532045654, "grad_norm": 0.85546875, "learning_rate": 0.0003503286067739913, "loss": 6.5479, "mean_token_accuracy": 0.11597675085067749, "num_tokens": 4420387.0, "step": 2175 }, { "entropy": 6.71555118560791, "epoch": 0.12759730757974833, "grad_norm": 0.890625, "learning_rate": 0.00034921746834324193, "loss": 6.3986, "mean_token_accuracy": 0.12882070094347, "num_tokens": 4430638.0, "step": 2180 }, { "entropy": 6.588705921173096, "epoch": 0.12788996195493121, "grad_norm": 0.82421875, "learning_rate": 0.0003481042952031072, "loss": 6.3764, "mean_token_accuracy": 0.13474897891283036, "num_tokens": 4442303.0, "step": 2185 }, { "entropy": 6.620761775970459, "epoch": 0.12818261633011413, "grad_norm": 0.953125, "learning_rate": 0.0003469891178717911, "loss": 6.3192, "mean_token_accuracy": 0.13396589383482932, "num_tokens": 4452080.0, "step": 2190 }, { "entropy": 6.566491794586182, "epoch": 0.12847527070529705, "grad_norm": 0.8671875, "learning_rate": 0.0003458719669224436, "loss": 6.3077, "mean_token_accuracy": 0.13419256508350372, "num_tokens": 4461709.0, "step": 2195 }, { "entropy": 6.61617431640625, "epoch": 0.12876792508047996, "grad_norm": 0.9921875, "learning_rate": 0.0003447528729823221, "loss": 6.4302, "mean_token_accuracy": 0.1304625764489174, "num_tokens": 4470778.0, "step": 2200 }, { "entropy": 6.670851564407348, "epoch": 0.12906057945566285, "grad_norm": 0.91796875, "learning_rate": 0.0003436318667319525, "loss": 6.3604, "mean_token_accuracy": 0.12824845388531686, "num_tokens": 4481329.0, "step": 2205 }, { "entropy": 6.637941455841064, "epoch": 0.12935323383084577, "grad_norm": 0.8359375, "learning_rate": 0.00034250897890428716, "loss": 6.4174, "mean_token_accuracy": 0.12477430030703544, "num_tokens": 4492159.0, "step": 2210 }, { "entropy": 6.613152647018433, "epoch": 0.12964588820602868, "grad_norm": 0.87890625, "learning_rate": 0.0003413842402838633, "loss": 6.2514, "mean_token_accuracy": 0.14181035682559012, "num_tokens": 4501842.0, "step": 2215 }, { "entropy": 6.536275053024292, "epoch": 0.1299385425812116, "grad_norm": 0.98828125, "learning_rate": 0.00034025768170595834, "loss": 6.3601, "mean_token_accuracy": 0.13193768858909607, "num_tokens": 4511398.0, "step": 2220 }, { "entropy": 6.626315975189209, "epoch": 0.13023119695639448, "grad_norm": 0.98828125, "learning_rate": 0.0003391293340557446, "loss": 6.3706, "mean_token_accuracy": 0.12933078706264495, "num_tokens": 4521061.0, "step": 2225 }, { "entropy": 6.640750551223755, "epoch": 0.1305238513315774, "grad_norm": 0.88671875, "learning_rate": 0.0003379992282674431, "loss": 6.3861, "mean_token_accuracy": 0.1284594379365444, "num_tokens": 4532242.0, "step": 2230 }, { "entropy": 6.626450490951538, "epoch": 0.13081650570676032, "grad_norm": 0.93359375, "learning_rate": 0.0003368673953234749, "loss": 6.3534, "mean_token_accuracy": 0.13135328367352486, "num_tokens": 4542399.0, "step": 2235 }, { "entropy": 6.593724727630615, "epoch": 0.13110916008194323, "grad_norm": 0.953125, "learning_rate": 0.00033573386625361176, "loss": 6.2935, "mean_token_accuracy": 0.13625863939523697, "num_tokens": 4552466.0, "step": 2240 }, { "entropy": 6.692444801330566, "epoch": 0.13140181445712612, "grad_norm": 0.98046875, "learning_rate": 0.00033459867213412567, "loss": 6.3805, "mean_token_accuracy": 0.13012552857398987, "num_tokens": 4562095.0, "step": 2245 }, { "entropy": 6.56951789855957, "epoch": 0.13169446883230904, "grad_norm": 0.953125, "learning_rate": 0.000333461844086937, "loss": 6.344, "mean_token_accuracy": 0.13196654096245766, "num_tokens": 4572304.0, "step": 2250 }, { "entropy": 6.572604179382324, "epoch": 0.13198712320749195, "grad_norm": 0.92578125, "learning_rate": 0.00033232341327876097, "loss": 6.3112, "mean_token_accuracy": 0.1351053647696972, "num_tokens": 4582255.0, "step": 2255 }, { "entropy": 6.682241487503052, "epoch": 0.13227977758267487, "grad_norm": 0.921875, "learning_rate": 0.0003311834109202531, "loss": 6.3882, "mean_token_accuracy": 0.13199552297592163, "num_tokens": 4593315.0, "step": 2260 }, { "entropy": 6.572966384887695, "epoch": 0.13257243195785778, "grad_norm": 0.953125, "learning_rate": 0.00033004186826515416, "loss": 6.3876, "mean_token_accuracy": 0.1297772228717804, "num_tokens": 4604635.0, "step": 2265 }, { "entropy": 6.5704100131988525, "epoch": 0.13286508633304067, "grad_norm": 0.86328125, "learning_rate": 0.0003288988166094324, "loss": 6.3848, "mean_token_accuracy": 0.13028332516551017, "num_tokens": 4616097.0, "step": 2270 }, { "entropy": 6.675870656967163, "epoch": 0.1331577407082236, "grad_norm": 0.96484375, "learning_rate": 0.00032775428729042656, "loss": 6.3909, "mean_token_accuracy": 0.13196725845336915, "num_tokens": 4626163.0, "step": 2275 }, { "entropy": 6.585020303726196, "epoch": 0.1334503950834065, "grad_norm": 1.078125, "learning_rate": 0.000326608311685986, "loss": 6.3564, "mean_token_accuracy": 0.1344081051647663, "num_tokens": 4637141.0, "step": 2280 }, { "entropy": 6.638718938827514, "epoch": 0.13374304945858942, "grad_norm": 0.9140625, "learning_rate": 0.0003254609212136108, "loss": 6.3177, "mean_token_accuracy": 0.1317195251584053, "num_tokens": 4646832.0, "step": 2285 }, { "entropy": 6.591185808181763, "epoch": 0.1340357038337723, "grad_norm": 0.94140625, "learning_rate": 0.00032431214732959036, "loss": 6.3363, "mean_token_accuracy": 0.12970326319336892, "num_tokens": 4656477.0, "step": 2290 }, { "entropy": 6.58276629447937, "epoch": 0.13432835820895522, "grad_norm": 0.94921875, "learning_rate": 0.000323162021528141, "loss": 6.3449, "mean_token_accuracy": 0.12856401205062867, "num_tokens": 4666682.0, "step": 2295 }, { "entropy": 6.571887540817261, "epoch": 0.13462101258413814, "grad_norm": 0.9375, "learning_rate": 0.00032201057534054264, "loss": 6.3592, "mean_token_accuracy": 0.1295217268168926, "num_tokens": 4677486.0, "step": 2300 }, { "entropy": 6.6181275844573975, "epoch": 0.13491366695932105, "grad_norm": 0.8828125, "learning_rate": 0.00032085784033427414, "loss": 6.3636, "mean_token_accuracy": 0.1326647162437439, "num_tokens": 4689129.0, "step": 2305 }, { "entropy": 6.634070110321045, "epoch": 0.13520632133450394, "grad_norm": 0.921875, "learning_rate": 0.0003197038481121478, "loss": 6.3965, "mean_token_accuracy": 0.12682358771562577, "num_tokens": 4699820.0, "step": 2310 }, { "entropy": 6.519108438491822, "epoch": 0.13549897570968686, "grad_norm": 0.953125, "learning_rate": 0.0003185486303114436, "loss": 6.3451, "mean_token_accuracy": 0.13321323022246362, "num_tokens": 4710080.0, "step": 2315 }, { "entropy": 6.661201143264771, "epoch": 0.13579163008486977, "grad_norm": 1.046875, "learning_rate": 0.0003173922186030409, "loss": 6.3158, "mean_token_accuracy": 0.13595361337065698, "num_tokens": 4719941.0, "step": 2320 }, { "entropy": 6.571690034866333, "epoch": 0.1360842844600527, "grad_norm": 0.94140625, "learning_rate": 0.000316234644690551, "loss": 6.321, "mean_token_accuracy": 0.13446008861064912, "num_tokens": 4730529.0, "step": 2325 }, { "entropy": 6.571829795837402, "epoch": 0.13637693883523558, "grad_norm": 0.87890625, "learning_rate": 0.0003150759403094473, "loss": 6.3642, "mean_token_accuracy": 0.12646636441349984, "num_tokens": 4740643.0, "step": 2330 }, { "entropy": 6.626566600799561, "epoch": 0.1366695932104185, "grad_norm": 0.9453125, "learning_rate": 0.00031391613722619587, "loss": 6.3391, "mean_token_accuracy": 0.13109509497880936, "num_tokens": 4751079.0, "step": 2335 }, { "entropy": 6.638620090484619, "epoch": 0.1369622475856014, "grad_norm": 0.84375, "learning_rate": 0.000312755267237384, "loss": 6.2545, "mean_token_accuracy": 0.132995867729187, "num_tokens": 4762110.0, "step": 2340 }, { "entropy": 6.604851627349854, "epoch": 0.13725490196078433, "grad_norm": 0.859375, "learning_rate": 0.0003115933621688488, "loss": 6.2205, "mean_token_accuracy": 0.1372155912220478, "num_tokens": 4771663.0, "step": 2345 }, { "entropy": 6.5505592823028564, "epoch": 0.1375475563359672, "grad_norm": 0.91015625, "learning_rate": 0.00031043045387480487, "loss": 6.3195, "mean_token_accuracy": 0.12606247812509536, "num_tokens": 4783371.0, "step": 2350 }, { "entropy": 6.547402954101562, "epoch": 0.13784021071115013, "grad_norm": 0.9140625, "learning_rate": 0.0003092665742369703, "loss": 6.2345, "mean_token_accuracy": 0.14305853918194772, "num_tokens": 4792783.0, "step": 2355 }, { "entropy": 6.582607078552246, "epoch": 0.13813286508633305, "grad_norm": 0.98828125, "learning_rate": 0.00030810175516369343, "loss": 6.2821, "mean_token_accuracy": 0.129033812135458, "num_tokens": 4802868.0, "step": 2360 }, { "entropy": 6.554081535339355, "epoch": 0.13842551946151596, "grad_norm": 0.9609375, "learning_rate": 0.0003069360285890775, "loss": 6.3168, "mean_token_accuracy": 0.1346677489578724, "num_tokens": 4812456.0, "step": 2365 }, { "entropy": 6.716797685623169, "epoch": 0.13871817383669885, "grad_norm": 0.96875, "learning_rate": 0.00030576942647210547, "loss": 6.3953, "mean_token_accuracy": 0.13068155571818352, "num_tokens": 4822706.0, "step": 2370 }, { "entropy": 6.6018290519714355, "epoch": 0.13901082821188177, "grad_norm": 1.109375, "learning_rate": 0.00030460198079576355, "loss": 6.3315, "mean_token_accuracy": 0.12894112542271613, "num_tokens": 4832573.0, "step": 2375 }, { "entropy": 6.542349767684937, "epoch": 0.13930348258706468, "grad_norm": 0.96875, "learning_rate": 0.0003034337235661648, "loss": 6.342, "mean_token_accuracy": 0.13533625453710557, "num_tokens": 4842097.0, "step": 2380 }, { "entropy": 6.598580312728882, "epoch": 0.1395961369622476, "grad_norm": 1.0234375, "learning_rate": 0.0003022646868116714, "loss": 6.3095, "mean_token_accuracy": 0.13526476547122002, "num_tokens": 4851986.0, "step": 2385 }, { "entropy": 6.5494890213012695, "epoch": 0.13988879133743048, "grad_norm": 0.984375, "learning_rate": 0.0003010949025820163, "loss": 6.2412, "mean_token_accuracy": 0.13428325429558755, "num_tokens": 4861973.0, "step": 2390 }, { "entropy": 6.5741476058959964, "epoch": 0.1401814457126134, "grad_norm": 0.99609375, "learning_rate": 0.0002999244029474252, "loss": 6.2878, "mean_token_accuracy": 0.1243141733109951, "num_tokens": 4871376.0, "step": 2395 }, { "entropy": 6.514613056182862, "epoch": 0.14047410008779632, "grad_norm": 0.93359375, "learning_rate": 0.00029875321999773684, "loss": 6.2938, "mean_token_accuracy": 0.1365303985774517, "num_tokens": 4881777.0, "step": 2400 }, { "entropy": 6.535431003570556, "epoch": 0.14076675446297923, "grad_norm": 0.97265625, "learning_rate": 0.00029758138584152333, "loss": 6.2778, "mean_token_accuracy": 0.13786163926124573, "num_tokens": 4892044.0, "step": 2405 }, { "entropy": 6.535160064697266, "epoch": 0.14105940883816212, "grad_norm": 0.96875, "learning_rate": 0.0002964089326052102, "loss": 6.2575, "mean_token_accuracy": 0.13284377455711366, "num_tokens": 4902851.0, "step": 2410 }, { "entropy": 6.588398790359497, "epoch": 0.14135206321334504, "grad_norm": 0.91015625, "learning_rate": 0.0002952358924321949, "loss": 6.2731, "mean_token_accuracy": 0.13292827159166337, "num_tokens": 4912567.0, "step": 2415 }, { "entropy": 6.61859164237976, "epoch": 0.14164471758852795, "grad_norm": 1.0078125, "learning_rate": 0.00029406229748196657, "loss": 6.3235, "mean_token_accuracy": 0.13645606413483619, "num_tokens": 4923506.0, "step": 2420 }, { "entropy": 6.613209962844849, "epoch": 0.14193737196371087, "grad_norm": 1.0234375, "learning_rate": 0.0002928881799292235, "loss": 6.3552, "mean_token_accuracy": 0.13131646066904068, "num_tokens": 4933229.0, "step": 2425 }, { "entropy": 6.630974626541137, "epoch": 0.14223002633889376, "grad_norm": 0.953125, "learning_rate": 0.00029171357196299154, "loss": 6.3079, "mean_token_accuracy": 0.1362503670156002, "num_tokens": 4943845.0, "step": 2430 }, { "entropy": 6.498490715026856, "epoch": 0.14252268071407667, "grad_norm": 0.96484375, "learning_rate": 0.0002905385057857414, "loss": 6.1914, "mean_token_accuracy": 0.13855512589216232, "num_tokens": 4953453.0, "step": 2435 }, { "entropy": 6.618788242340088, "epoch": 0.1428153350892596, "grad_norm": 0.9609375, "learning_rate": 0.0002893630136125058, "loss": 6.2676, "mean_token_accuracy": 0.13731593489646912, "num_tokens": 4962662.0, "step": 2440 }, { "entropy": 6.614573764801025, "epoch": 0.1431079894644425, "grad_norm": 0.8359375, "learning_rate": 0.0002881871276699967, "loss": 6.3238, "mean_token_accuracy": 0.13058529421687126, "num_tokens": 4973256.0, "step": 2445 }, { "entropy": 6.581136035919189, "epoch": 0.1434006438396254, "grad_norm": 1.0546875, "learning_rate": 0.00028701088019572114, "loss": 6.3168, "mean_token_accuracy": 0.13196835592389106, "num_tokens": 4983569.0, "step": 2450 }, { "entropy": 6.557302951812744, "epoch": 0.1436932982148083, "grad_norm": 1.0234375, "learning_rate": 0.0002858343034370977, "loss": 6.207, "mean_token_accuracy": 0.14453484937548639, "num_tokens": 4992163.0, "step": 2455 }, { "entropy": 6.532128620147705, "epoch": 0.14398595258999122, "grad_norm": 0.84765625, "learning_rate": 0.00028465742965057267, "loss": 6.3026, "mean_token_accuracy": 0.1332960121333599, "num_tokens": 5002952.0, "step": 2460 }, { "entropy": 6.549730396270752, "epoch": 0.14427860696517414, "grad_norm": 1.0078125, "learning_rate": 0.00028348029110073533, "loss": 6.3004, "mean_token_accuracy": 0.13769194781780242, "num_tokens": 5012954.0, "step": 2465 }, { "entropy": 6.593349933624268, "epoch": 0.14457126134035703, "grad_norm": 0.9296875, "learning_rate": 0.00028230292005943365, "loss": 6.2794, "mean_token_accuracy": 0.13775826916098594, "num_tokens": 5022845.0, "step": 2470 }, { "entropy": 6.5862006664276125, "epoch": 0.14486391571553994, "grad_norm": 0.94140625, "learning_rate": 0.00028112534880488945, "loss": 6.3463, "mean_token_accuracy": 0.13272640109062195, "num_tokens": 5033149.0, "step": 2475 }, { "entropy": 6.484812211990357, "epoch": 0.14515657009072286, "grad_norm": 0.89453125, "learning_rate": 0.0002799476096208137, "loss": 6.3181, "mean_token_accuracy": 0.13179948031902314, "num_tokens": 5044129.0, "step": 2480 }, { "entropy": 6.560931062698364, "epoch": 0.14544922446590577, "grad_norm": 0.84765625, "learning_rate": 0.00027876973479552087, "loss": 6.3018, "mean_token_accuracy": 0.13927531391382217, "num_tokens": 5054165.0, "step": 2485 }, { "entropy": 6.667717742919922, "epoch": 0.14574187884108866, "grad_norm": 1.0390625, "learning_rate": 0.00027759175662104424, "loss": 6.3385, "mean_token_accuracy": 0.1275913529098034, "num_tokens": 5064974.0, "step": 2490 }, { "entropy": 6.605099773406982, "epoch": 0.14603453321627158, "grad_norm": 1.0859375, "learning_rate": 0.0002764137073922508, "loss": 6.223, "mean_token_accuracy": 0.13924818709492684, "num_tokens": 5075929.0, "step": 2495 }, { "entropy": 6.5237668514251705, "epoch": 0.1463271875914545, "grad_norm": 0.9609375, "learning_rate": 0.00027523561940595505, "loss": 6.2204, "mean_token_accuracy": 0.13466374427080155, "num_tokens": 5086043.0, "step": 2500 }, { "entropy": 6.543189954757691, "epoch": 0.1466198419666374, "grad_norm": 1.0078125, "learning_rate": 0.0002740575249600342, "loss": 6.2998, "mean_token_accuracy": 0.133786079287529, "num_tokens": 5096706.0, "step": 2505 }, { "entropy": 6.644468879699707, "epoch": 0.1469124963418203, "grad_norm": 0.9765625, "learning_rate": 0.00027287945635254263, "loss": 6.3722, "mean_token_accuracy": 0.12882938534021376, "num_tokens": 5107301.0, "step": 2510 }, { "entropy": 6.59978609085083, "epoch": 0.1472051507170032, "grad_norm": 0.90625, "learning_rate": 0.00027170144588082635, "loss": 6.2677, "mean_token_accuracy": 0.14094802588224412, "num_tokens": 5117420.0, "step": 2515 }, { "entropy": 6.5375994682312015, "epoch": 0.14749780509218613, "grad_norm": 0.98828125, "learning_rate": 0.00027052352584063763, "loss": 6.1408, "mean_token_accuracy": 0.14534125626087188, "num_tokens": 5126637.0, "step": 2520 }, { "entropy": 6.5622704982757565, "epoch": 0.14779045946736905, "grad_norm": 0.85546875, "learning_rate": 0.00026934572852524907, "loss": 6.1739, "mean_token_accuracy": 0.14493270441889763, "num_tokens": 5136591.0, "step": 2525 }, { "entropy": 6.587195777893067, "epoch": 0.14808311384255193, "grad_norm": 0.95703125, "learning_rate": 0.00026816808622456937, "loss": 6.2584, "mean_token_accuracy": 0.13577966690063475, "num_tokens": 5146254.0, "step": 2530 }, { "entropy": 6.565539360046387, "epoch": 0.14837576821773485, "grad_norm": 0.9296875, "learning_rate": 0.0002669906312242569, "loss": 6.3703, "mean_token_accuracy": 0.13128052577376365, "num_tokens": 5157360.0, "step": 2535 }, { "entropy": 6.5541015625, "epoch": 0.14866842259291776, "grad_norm": 0.94921875, "learning_rate": 0.00026581339580483525, "loss": 6.2741, "mean_token_accuracy": 0.13503245040774345, "num_tokens": 5167775.0, "step": 2540 }, { "entropy": 6.557196617126465, "epoch": 0.14896107696810068, "grad_norm": 0.8515625, "learning_rate": 0.0002646364122408082, "loss": 6.2356, "mean_token_accuracy": 0.1360543005168438, "num_tokens": 5177990.0, "step": 2545 }, { "entropy": 6.580082654953003, "epoch": 0.14925373134328357, "grad_norm": 0.9765625, "learning_rate": 0.0002634597127997749, "loss": 6.2266, "mean_token_accuracy": 0.139044576138258, "num_tokens": 5187098.0, "step": 2550 }, { "entropy": 6.485968780517578, "epoch": 0.14954638571846648, "grad_norm": 0.9765625, "learning_rate": 0.0002622833297415445, "loss": 6.2018, "mean_token_accuracy": 0.14275476485490798, "num_tokens": 5196381.0, "step": 2555 }, { "entropy": 6.508991670608521, "epoch": 0.1498390400936494, "grad_norm": 1.0859375, "learning_rate": 0.0002611072953172531, "loss": 6.217, "mean_token_accuracy": 0.13808079287409783, "num_tokens": 5205948.0, "step": 2560 }, { "entropy": 6.555392408370972, "epoch": 0.15013169446883232, "grad_norm": 1.0078125, "learning_rate": 0.00025993164176847845, "loss": 6.2543, "mean_token_accuracy": 0.14129054993391038, "num_tokens": 5215986.0, "step": 2565 }, { "entropy": 6.556317567825317, "epoch": 0.1504243488440152, "grad_norm": 0.89453125, "learning_rate": 0.0002587564013263564, "loss": 6.2267, "mean_token_accuracy": 0.13913317769765854, "num_tokens": 5225456.0, "step": 2570 }, { "entropy": 6.496306562423706, "epoch": 0.15071700321919812, "grad_norm": 0.89453125, "learning_rate": 0.0002575816062106974, "loss": 6.2441, "mean_token_accuracy": 0.13501543253660203, "num_tokens": 5236615.0, "step": 2575 }, { "entropy": 6.482434940338135, "epoch": 0.15100965759438104, "grad_norm": 0.87109375, "learning_rate": 0.00025640728862910293, "loss": 6.1802, "mean_token_accuracy": 0.14192271158099173, "num_tokens": 5246557.0, "step": 2580 }, { "entropy": 6.484745883941651, "epoch": 0.15130231196956395, "grad_norm": 0.83984375, "learning_rate": 0.00025523348077608285, "loss": 6.1694, "mean_token_accuracy": 0.14211384803056717, "num_tokens": 5256692.0, "step": 2585 }, { "entropy": 6.553393745422364, "epoch": 0.15159496634474687, "grad_norm": 0.9296875, "learning_rate": 0.00025406021483217225, "loss": 6.2248, "mean_token_accuracy": 0.1350661352276802, "num_tokens": 5266637.0, "step": 2590 }, { "entropy": 6.563928937911987, "epoch": 0.15188762071992976, "grad_norm": 0.94140625, "learning_rate": 0.00025288752296304963, "loss": 6.2597, "mean_token_accuracy": 0.13457316160202026, "num_tokens": 5276549.0, "step": 2595 }, { "entropy": 6.507853937149048, "epoch": 0.15218027509511267, "grad_norm": 1.015625, "learning_rate": 0.000251715437318655, "loss": 6.205, "mean_token_accuracy": 0.14360155612230302, "num_tokens": 5286747.0, "step": 2600 }, { "entropy": 6.470801210403442, "epoch": 0.1524729294702956, "grad_norm": 0.82421875, "learning_rate": 0.0002505439900323084, "loss": 6.227, "mean_token_accuracy": 0.13453298360109328, "num_tokens": 5297623.0, "step": 2605 }, { "entropy": 6.477011060714721, "epoch": 0.1527655838454785, "grad_norm": 0.953125, "learning_rate": 0.00024937321321982894, "loss": 6.2244, "mean_token_accuracy": 0.13981337025761603, "num_tokens": 5307281.0, "step": 2610 }, { "entropy": 6.563910579681396, "epoch": 0.1530582382206614, "grad_norm": 0.91015625, "learning_rate": 0.00024820313897865433, "loss": 6.2464, "mean_token_accuracy": 0.13410933464765548, "num_tokens": 5317908.0, "step": 2615 }, { "entropy": 6.533686399459839, "epoch": 0.1533508925958443, "grad_norm": 0.87890625, "learning_rate": 0.00024703379938696105, "loss": 6.2551, "mean_token_accuracy": 0.13540789857506752, "num_tokens": 5328263.0, "step": 2620 }, { "entropy": 6.6188063621521, "epoch": 0.15364354697102722, "grad_norm": 0.95703125, "learning_rate": 0.00024586522650278447, "loss": 6.3039, "mean_token_accuracy": 0.1347327299416065, "num_tokens": 5338320.0, "step": 2625 }, { "entropy": 6.533732938766479, "epoch": 0.15393620134621014, "grad_norm": 1.0078125, "learning_rate": 0.00024469745236314064, "loss": 6.2127, "mean_token_accuracy": 0.146664909273386, "num_tokens": 5348530.0, "step": 2630 }, { "entropy": 6.499366760253906, "epoch": 0.15422885572139303, "grad_norm": 0.921875, "learning_rate": 0.00024353050898314767, "loss": 6.2532, "mean_token_accuracy": 0.14155993312597276, "num_tokens": 5359019.0, "step": 2635 }, { "entropy": 6.532890844345093, "epoch": 0.15452151009657594, "grad_norm": 0.9140625, "learning_rate": 0.00024236442835514743, "loss": 6.1813, "mean_token_accuracy": 0.14301421344280243, "num_tokens": 5368728.0, "step": 2640 }, { "entropy": 6.561751651763916, "epoch": 0.15481416447175886, "grad_norm": 0.9375, "learning_rate": 0.00024119924244782965, "loss": 6.2424, "mean_token_accuracy": 0.13430066108703614, "num_tokens": 5379941.0, "step": 2645 }, { "entropy": 6.56638011932373, "epoch": 0.15510681884694177, "grad_norm": 1.015625, "learning_rate": 0.00024003498320535462, "loss": 6.2315, "mean_token_accuracy": 0.13989165276288987, "num_tokens": 5389120.0, "step": 2650 }, { "entropy": 6.558014535903931, "epoch": 0.15539947322212466, "grad_norm": 0.98828125, "learning_rate": 0.00023887168254647727, "loss": 6.2807, "mean_token_accuracy": 0.13791248202323914, "num_tokens": 5398705.0, "step": 2655 }, { "entropy": 6.51059045791626, "epoch": 0.15569212759730758, "grad_norm": 0.91015625, "learning_rate": 0.00023770937236367308, "loss": 6.203, "mean_token_accuracy": 0.1383495733141899, "num_tokens": 5409564.0, "step": 2660 }, { "entropy": 6.565548896789551, "epoch": 0.1559847819724905, "grad_norm": 0.9453125, "learning_rate": 0.00023654808452226278, "loss": 6.2205, "mean_token_accuracy": 0.13802594617009162, "num_tokens": 5418903.0, "step": 2665 }, { "entropy": 6.5598227977752686, "epoch": 0.1562774363476734, "grad_norm": 0.875, "learning_rate": 0.00023538785085953912, "loss": 6.1856, "mean_token_accuracy": 0.1424265533685684, "num_tokens": 5429571.0, "step": 2670 }, { "entropy": 6.547902584075928, "epoch": 0.1565700907228563, "grad_norm": 0.984375, "learning_rate": 0.00023422870318389404, "loss": 6.2278, "mean_token_accuracy": 0.13900026082992553, "num_tokens": 5438692.0, "step": 2675 }, { "entropy": 6.485255289077759, "epoch": 0.1568627450980392, "grad_norm": 0.984375, "learning_rate": 0.0002330706732739468, "loss": 6.1885, "mean_token_accuracy": 0.1391908533871174, "num_tokens": 5449276.0, "step": 2680 }, { "entropy": 6.549315547943115, "epoch": 0.15715539947322213, "grad_norm": 0.9609375, "learning_rate": 0.00023191379287767211, "loss": 6.2524, "mean_token_accuracy": 0.14197998046875, "num_tokens": 5459831.0, "step": 2685 }, { "entropy": 6.614502668380737, "epoch": 0.15744805384840505, "grad_norm": 1.015625, "learning_rate": 0.0002307580937115305, "loss": 6.3464, "mean_token_accuracy": 0.1267390377819538, "num_tokens": 5471577.0, "step": 2690 }, { "entropy": 6.550572299957276, "epoch": 0.15774070822358793, "grad_norm": 0.91015625, "learning_rate": 0.00022960360745959846, "loss": 6.2289, "mean_token_accuracy": 0.13965948596596717, "num_tokens": 5482299.0, "step": 2695 }, { "entropy": 6.55780029296875, "epoch": 0.15803336259877085, "grad_norm": 0.93359375, "learning_rate": 0.00022845036577269972, "loss": 6.2583, "mean_token_accuracy": 0.13381334021687508, "num_tokens": 5492298.0, "step": 2700 }, { "entropy": 6.520327806472778, "epoch": 0.15832601697395376, "grad_norm": 0.9140625, "learning_rate": 0.00022729840026753777, "loss": 6.1768, "mean_token_accuracy": 0.14374976530671119, "num_tokens": 5502727.0, "step": 2705 }, { "entropy": 6.534080123901367, "epoch": 0.15861867134913668, "grad_norm": 0.90234375, "learning_rate": 0.0002261477425258287, "loss": 6.1576, "mean_token_accuracy": 0.14108413830399513, "num_tokens": 5512321.0, "step": 2710 }, { "entropy": 6.4830296516418455, "epoch": 0.15891132572431957, "grad_norm": 0.92578125, "learning_rate": 0.0002249984240934358, "loss": 6.2033, "mean_token_accuracy": 0.14314679950475692, "num_tokens": 5522265.0, "step": 2715 }, { "entropy": 6.547088575363159, "epoch": 0.15920398009950248, "grad_norm": 1.0546875, "learning_rate": 0.00022385047647950464, "loss": 6.3057, "mean_token_accuracy": 0.1338900499045849, "num_tokens": 5532628.0, "step": 2720 }, { "entropy": 6.634050512313843, "epoch": 0.1594966344746854, "grad_norm": 0.92578125, "learning_rate": 0.0002227039311555986, "loss": 6.1934, "mean_token_accuracy": 0.1390744499862194, "num_tokens": 5543307.0, "step": 2725 }, { "entropy": 6.529575347900391, "epoch": 0.15978928884986832, "grad_norm": 0.8984375, "learning_rate": 0.0002215588195548372, "loss": 6.2631, "mean_token_accuracy": 0.13185127526521684, "num_tokens": 5554248.0, "step": 2730 }, { "entropy": 6.4312415599823, "epoch": 0.1600819432250512, "grad_norm": 0.99609375, "learning_rate": 0.00022041517307103337, "loss": 6.1443, "mean_token_accuracy": 0.14239867702126502, "num_tokens": 5564321.0, "step": 2735 }, { "entropy": 6.527017831802368, "epoch": 0.16037459760023412, "grad_norm": 0.91796875, "learning_rate": 0.0002192730230578331, "loss": 6.2115, "mean_token_accuracy": 0.13895939216017722, "num_tokens": 5573852.0, "step": 2740 }, { "entropy": 6.5560023307800295, "epoch": 0.16066725197541704, "grad_norm": 0.92578125, "learning_rate": 0.0002181324008278559, "loss": 6.2582, "mean_token_accuracy": 0.13502655327320098, "num_tokens": 5584202.0, "step": 2745 }, { "entropy": 6.544650459289551, "epoch": 0.16095990635059995, "grad_norm": 1.0234375, "learning_rate": 0.00021699333765183655, "loss": 6.1976, "mean_token_accuracy": 0.14429980814456939, "num_tokens": 5594086.0, "step": 2750 }, { "entropy": 6.558902597427368, "epoch": 0.16125256072578284, "grad_norm": 0.87890625, "learning_rate": 0.0002158558647577673, "loss": 6.1578, "mean_token_accuracy": 0.14210355430841445, "num_tokens": 5604050.0, "step": 2755 }, { "entropy": 6.535611391067505, "epoch": 0.16154521510096576, "grad_norm": 0.9375, "learning_rate": 0.00021472001333004215, "loss": 6.2387, "mean_token_accuracy": 0.14314470887184144, "num_tokens": 5614136.0, "step": 2760 }, { "entropy": 6.537288236618042, "epoch": 0.16183786947614867, "grad_norm": 0.953125, "learning_rate": 0.00021358581450860186, "loss": 6.3211, "mean_token_accuracy": 0.12838149443268776, "num_tokens": 5624986.0, "step": 2765 }, { "entropy": 6.50725793838501, "epoch": 0.1621305238513316, "grad_norm": 0.90234375, "learning_rate": 0.0002124532993880799, "loss": 6.1906, "mean_token_accuracy": 0.14175716713070868, "num_tokens": 5635698.0, "step": 2770 }, { "entropy": 6.549154043197632, "epoch": 0.16242317822651448, "grad_norm": 0.96875, "learning_rate": 0.00021132249901695044, "loss": 6.168, "mean_token_accuracy": 0.14407571256160737, "num_tokens": 5645257.0, "step": 2775 }, { "entropy": 6.495343446731567, "epoch": 0.1627158326016974, "grad_norm": 1.0078125, "learning_rate": 0.00021019344439667705, "loss": 6.2282, "mean_token_accuracy": 0.1422564759850502, "num_tokens": 5656053.0, "step": 2780 }, { "entropy": 6.535295248031616, "epoch": 0.1630084869768803, "grad_norm": 0.9453125, "learning_rate": 0.00020906616648086213, "loss": 6.233, "mean_token_accuracy": 0.1346354976296425, "num_tokens": 5667058.0, "step": 2785 }, { "entropy": 6.53308801651001, "epoch": 0.16330114135206322, "grad_norm": 0.98828125, "learning_rate": 0.00020794069617439942, "loss": 6.1279, "mean_token_accuracy": 0.13937866687774658, "num_tokens": 5676709.0, "step": 2790 }, { "entropy": 6.471915292739868, "epoch": 0.1635937957272461, "grad_norm": 1.0234375, "learning_rate": 0.00020681706433262593, "loss": 6.1771, "mean_token_accuracy": 0.14254669696092606, "num_tokens": 5686385.0, "step": 2795 }, { "entropy": 6.472246360778809, "epoch": 0.16388645010242903, "grad_norm": 1.015625, "learning_rate": 0.00020569530176047602, "loss": 6.2145, "mean_token_accuracy": 0.13524642288684846, "num_tokens": 5696205.0, "step": 2800 }, { "entropy": 6.578249311447143, "epoch": 0.16417910447761194, "grad_norm": 1.109375, "learning_rate": 0.0002045754392116374, "loss": 6.2137, "mean_token_accuracy": 0.13581515476107597, "num_tokens": 5705098.0, "step": 2805 }, { "entropy": 6.552724933624267, "epoch": 0.16447175885279486, "grad_norm": 1.03125, "learning_rate": 0.00020345750738770757, "loss": 6.216, "mean_token_accuracy": 0.13807876855134965, "num_tokens": 5715230.0, "step": 2810 }, { "entropy": 6.521187210083008, "epoch": 0.16476441322797775, "grad_norm": 1.0546875, "learning_rate": 0.00020234153693735214, "loss": 6.2886, "mean_token_accuracy": 0.13280558511614798, "num_tokens": 5724659.0, "step": 2815 }, { "entropy": 6.476500940322876, "epoch": 0.16505706760316066, "grad_norm": 0.94921875, "learning_rate": 0.0002012275584554647, "loss": 6.0716, "mean_token_accuracy": 0.15525753051042557, "num_tokens": 5734203.0, "step": 2820 }, { "entropy": 6.5196754932403564, "epoch": 0.16534972197834358, "grad_norm": 0.97265625, "learning_rate": 0.00020011560248232803, "loss": 6.1574, "mean_token_accuracy": 0.14328333213925362, "num_tokens": 5743998.0, "step": 2825 }, { "entropy": 6.475966596603394, "epoch": 0.1656423763535265, "grad_norm": 0.89453125, "learning_rate": 0.00019900569950277692, "loss": 6.2404, "mean_token_accuracy": 0.13377273231744766, "num_tokens": 5755637.0, "step": 2830 }, { "entropy": 6.552825975418091, "epoch": 0.16593503072870938, "grad_norm": 0.890625, "learning_rate": 0.00019789787994536228, "loss": 6.2729, "mean_token_accuracy": 0.1340258985757828, "num_tokens": 5767045.0, "step": 2835 }, { "entropy": 6.5837178230285645, "epoch": 0.1662276851038923, "grad_norm": 1.09375, "learning_rate": 0.00019679217418151667, "loss": 6.1609, "mean_token_accuracy": 0.14507486745715142, "num_tokens": 5777435.0, "step": 2840 }, { "entropy": 6.539376640319825, "epoch": 0.1665203394790752, "grad_norm": 0.98046875, "learning_rate": 0.00019568861252472236, "loss": 6.1995, "mean_token_accuracy": 0.14176033735275267, "num_tokens": 5787558.0, "step": 2845 }, { "entropy": 6.521344947814941, "epoch": 0.16681299385425813, "grad_norm": 0.8828125, "learning_rate": 0.00019458722522967952, "loss": 6.2897, "mean_token_accuracy": 0.12934364154934883, "num_tokens": 5798902.0, "step": 2850 }, { "entropy": 6.558686590194702, "epoch": 0.16710564822944102, "grad_norm": 0.90625, "learning_rate": 0.00019348804249147723, "loss": 6.2245, "mean_token_accuracy": 0.13471300080418586, "num_tokens": 5809852.0, "step": 2855 }, { "entropy": 6.607994651794433, "epoch": 0.16739830260462393, "grad_norm": 0.95703125, "learning_rate": 0.0001923910944447655, "loss": 6.2651, "mean_token_accuracy": 0.13732294067740441, "num_tokens": 5820937.0, "step": 2860 }, { "entropy": 6.527199077606201, "epoch": 0.16769095697980685, "grad_norm": 1.015625, "learning_rate": 0.00019129641116292928, "loss": 6.1135, "mean_token_accuracy": 0.14256200566887856, "num_tokens": 5830898.0, "step": 2865 }, { "entropy": 6.453168725967407, "epoch": 0.16798361135498976, "grad_norm": 0.921875, "learning_rate": 0.00019020402265726343, "loss": 6.2076, "mean_token_accuracy": 0.14136819988489152, "num_tokens": 5841182.0, "step": 2870 }, { "entropy": 6.528485536575317, "epoch": 0.16827626573017265, "grad_norm": 0.92578125, "learning_rate": 0.0001891139588761509, "loss": 6.1761, "mean_token_accuracy": 0.14104376435279847, "num_tokens": 5851556.0, "step": 2875 }, { "entropy": 6.525482702255249, "epoch": 0.16856892010535557, "grad_norm": 0.94921875, "learning_rate": 0.00018802624970424076, "loss": 6.192, "mean_token_accuracy": 0.14138480871915818, "num_tokens": 5862094.0, "step": 2880 }, { "entropy": 6.459352779388428, "epoch": 0.16886157448053848, "grad_norm": 0.87890625, "learning_rate": 0.00018694092496162945, "loss": 6.1138, "mean_token_accuracy": 0.1471209093928337, "num_tokens": 5871995.0, "step": 2885 }, { "entropy": 6.509467220306396, "epoch": 0.1691542288557214, "grad_norm": 0.98046875, "learning_rate": 0.00018585801440304306, "loss": 6.2937, "mean_token_accuracy": 0.13243095427751542, "num_tokens": 5882844.0, "step": 2890 }, { "entropy": 6.540257596969605, "epoch": 0.1694468832309043, "grad_norm": 0.984375, "learning_rate": 0.00018477754771702165, "loss": 6.2217, "mean_token_accuracy": 0.13977270796895028, "num_tokens": 5893326.0, "step": 2895 }, { "entropy": 6.585920953750611, "epoch": 0.1697395376060872, "grad_norm": 0.890625, "learning_rate": 0.00018369955452510506, "loss": 6.2789, "mean_token_accuracy": 0.13316548839211464, "num_tokens": 5903428.0, "step": 2900 }, { "entropy": 6.604809427261353, "epoch": 0.17003219198127012, "grad_norm": 0.91796875, "learning_rate": 0.0001826240643810212, "loss": 6.258, "mean_token_accuracy": 0.13789111375808716, "num_tokens": 5913454.0, "step": 2905 }, { "entropy": 6.495929813385009, "epoch": 0.17032484635645304, "grad_norm": 1.0234375, "learning_rate": 0.0001815511067698758, "loss": 6.0709, "mean_token_accuracy": 0.15094600319862367, "num_tokens": 5922871.0, "step": 2910 }, { "entropy": 6.528694438934326, "epoch": 0.17061750073163595, "grad_norm": 1.015625, "learning_rate": 0.0001804807111073436, "loss": 6.1743, "mean_token_accuracy": 0.14280690103769303, "num_tokens": 5933469.0, "step": 2915 }, { "entropy": 6.5062483787536625, "epoch": 0.17091015510681884, "grad_norm": 1.03125, "learning_rate": 0.0001794129067388625, "loss": 6.142, "mean_token_accuracy": 0.14863498210906984, "num_tokens": 5942866.0, "step": 2920 }, { "entropy": 6.526878786087036, "epoch": 0.17120280948200176, "grad_norm": 0.859375, "learning_rate": 0.00017834772293882868, "loss": 6.1581, "mean_token_accuracy": 0.14312298819422722, "num_tokens": 5953442.0, "step": 2925 }, { "entropy": 6.497909736633301, "epoch": 0.17149546385718467, "grad_norm": 0.99609375, "learning_rate": 0.000177285188909794, "loss": 6.1541, "mean_token_accuracy": 0.1411077469587326, "num_tokens": 5963164.0, "step": 2930 }, { "entropy": 6.489312267303466, "epoch": 0.1717881182323676, "grad_norm": 0.90234375, "learning_rate": 0.0001762253337816656, "loss": 6.1448, "mean_token_accuracy": 0.1520187921822071, "num_tokens": 5973456.0, "step": 2935 }, { "entropy": 6.503576850891113, "epoch": 0.17208077260755048, "grad_norm": 0.921875, "learning_rate": 0.00017516818661090738, "loss": 6.1486, "mean_token_accuracy": 0.14401473551988603, "num_tokens": 5983826.0, "step": 2940 }, { "entropy": 6.521322727203369, "epoch": 0.1723734269827334, "grad_norm": 0.94140625, "learning_rate": 0.0001741137763797428, "loss": 6.0883, "mean_token_accuracy": 0.14583360701799392, "num_tokens": 5994250.0, "step": 2945 }, { "entropy": 6.497500991821289, "epoch": 0.1726660813579163, "grad_norm": 0.8515625, "learning_rate": 0.00017306213199536115, "loss": 6.2539, "mean_token_accuracy": 0.13612900525331498, "num_tokens": 6004898.0, "step": 2950 }, { "entropy": 6.528212928771973, "epoch": 0.17295873573309922, "grad_norm": 0.96484375, "learning_rate": 0.0001720132822891243, "loss": 6.1698, "mean_token_accuracy": 0.14160617738962172, "num_tokens": 6015229.0, "step": 2955 }, { "entropy": 6.527840805053711, "epoch": 0.1732513901082821, "grad_norm": 0.98828125, "learning_rate": 0.0001709672560157769, "loss": 6.1979, "mean_token_accuracy": 0.1367964804172516, "num_tokens": 6024915.0, "step": 2960 }, { "entropy": 6.48720006942749, "epoch": 0.17354404448346503, "grad_norm": 1.015625, "learning_rate": 0.00016992408185265758, "loss": 6.1666, "mean_token_accuracy": 0.14386114180088044, "num_tokens": 6034639.0, "step": 2965 }, { "entropy": 6.505798053741455, "epoch": 0.17383669885864794, "grad_norm": 1.078125, "learning_rate": 0.00016888378839891298, "loss": 6.2205, "mean_token_accuracy": 0.14749545753002166, "num_tokens": 6046290.0, "step": 2970 }, { "entropy": 6.570685768127442, "epoch": 0.17412935323383086, "grad_norm": 0.91796875, "learning_rate": 0.0001678464041747137, "loss": 6.149, "mean_token_accuracy": 0.14346007406711578, "num_tokens": 6056193.0, "step": 2975 }, { "entropy": 6.538094758987427, "epoch": 0.17442200760901375, "grad_norm": 0.90625, "learning_rate": 0.00016681195762047223, "loss": 6.1956, "mean_token_accuracy": 0.14101211577653885, "num_tokens": 6066056.0, "step": 2980 }, { "entropy": 6.520820093154907, "epoch": 0.17471466198419666, "grad_norm": 0.9375, "learning_rate": 0.00016578047709606337, "loss": 6.2644, "mean_token_accuracy": 0.132436902821064, "num_tokens": 6077051.0, "step": 2985 }, { "entropy": 6.585749530792237, "epoch": 0.17500731635937958, "grad_norm": 1.0390625, "learning_rate": 0.00016475199088004678, "loss": 6.2093, "mean_token_accuracy": 0.14285393804311752, "num_tokens": 6087005.0, "step": 2990 }, { "entropy": 6.530379581451416, "epoch": 0.1752999707345625, "grad_norm": 0.90234375, "learning_rate": 0.00016372652716889163, "loss": 6.1966, "mean_token_accuracy": 0.14196499586105346, "num_tokens": 6096910.0, "step": 2995 }, { "entropy": 6.542305946350098, "epoch": 0.17559262510974538, "grad_norm": 1.046875, "learning_rate": 0.0001627041140762035, "loss": 6.1943, "mean_token_accuracy": 0.14292609095573425, "num_tokens": 6106965.0, "step": 3000 }, { "entropy": 6.525618028640747, "epoch": 0.1758852794849283, "grad_norm": 0.85546875, "learning_rate": 0.00016168477963195382, "loss": 6.2528, "mean_token_accuracy": 0.13963432088494301, "num_tokens": 6118566.0, "step": 3005 }, { "entropy": 6.548830842971801, "epoch": 0.1761779338601112, "grad_norm": 1.0, "learning_rate": 0.0001606685517817114, "loss": 6.1809, "mean_token_accuracy": 0.1348876968026161, "num_tokens": 6129288.0, "step": 3010 }, { "entropy": 6.478287220001221, "epoch": 0.17647058823529413, "grad_norm": 0.9609375, "learning_rate": 0.00015965545838587592, "loss": 6.0684, "mean_token_accuracy": 0.15615486204624177, "num_tokens": 6139542.0, "step": 3015 }, { "entropy": 6.536929559707642, "epoch": 0.17676324261047702, "grad_norm": 0.96875, "learning_rate": 0.00015864552721891467, "loss": 6.1301, "mean_token_accuracy": 0.1455008305609226, "num_tokens": 6150039.0, "step": 3020 }, { "entropy": 6.499018716812134, "epoch": 0.17705589698565993, "grad_norm": 0.96875, "learning_rate": 0.00015763878596860076, "loss": 6.1994, "mean_token_accuracy": 0.14522527605295182, "num_tokens": 6161008.0, "step": 3025 }, { "entropy": 6.522494983673096, "epoch": 0.17734855136084285, "grad_norm": 0.95703125, "learning_rate": 0.00015663526223525412, "loss": 6.1707, "mean_token_accuracy": 0.1412256196141243, "num_tokens": 6171183.0, "step": 3030 }, { "entropy": 6.5229248046875, "epoch": 0.17764120573602576, "grad_norm": 0.9609375, "learning_rate": 0.0001556349835309848, "loss": 6.1232, "mean_token_accuracy": 0.153842756152153, "num_tokens": 6180410.0, "step": 3035 }, { "entropy": 6.483042669296265, "epoch": 0.17793386011120865, "grad_norm": 0.96484375, "learning_rate": 0.0001546379772789389, "loss": 6.1171, "mean_token_accuracy": 0.14183026626706124, "num_tokens": 6190081.0, "step": 3040 }, { "entropy": 6.514488172531128, "epoch": 0.17822651448639157, "grad_norm": 0.9765625, "learning_rate": 0.00015364427081254622, "loss": 6.2013, "mean_token_accuracy": 0.14329656809568406, "num_tokens": 6200716.0, "step": 3045 }, { "entropy": 6.515033197402954, "epoch": 0.17851916886157448, "grad_norm": 0.95703125, "learning_rate": 0.00015265389137477165, "loss": 6.1998, "mean_token_accuracy": 0.14804380536079406, "num_tokens": 6211273.0, "step": 3050 }, { "entropy": 6.568209886550903, "epoch": 0.1788118232367574, "grad_norm": 0.9375, "learning_rate": 0.00015166686611736786, "loss": 6.1716, "mean_token_accuracy": 0.14236095771193505, "num_tokens": 6220012.0, "step": 3055 }, { "entropy": 6.5015863418579105, "epoch": 0.1791044776119403, "grad_norm": 1.0390625, "learning_rate": 0.00015068322210013064, "loss": 6.1026, "mean_token_accuracy": 0.14391629323363303, "num_tokens": 6229880.0, "step": 3060 }, { "entropy": 6.511216020584106, "epoch": 0.1793971319871232, "grad_norm": 1.0234375, "learning_rate": 0.0001497029862901578, "loss": 6.0975, "mean_token_accuracy": 0.1441588044166565, "num_tokens": 6239352.0, "step": 3065 }, { "entropy": 6.549962091445923, "epoch": 0.17968978636230612, "grad_norm": 0.92578125, "learning_rate": 0.00014872618556110905, "loss": 6.1409, "mean_token_accuracy": 0.14189732372760772, "num_tokens": 6249236.0, "step": 3070 }, { "entropy": 6.491227531433106, "epoch": 0.17998244073748904, "grad_norm": 0.984375, "learning_rate": 0.00014775284669246992, "loss": 6.1303, "mean_token_accuracy": 0.14808845818042754, "num_tokens": 6258811.0, "step": 3075 }, { "entropy": 6.428884792327881, "epoch": 0.18027509511267192, "grad_norm": 0.87890625, "learning_rate": 0.00014678299636881716, "loss": 6.0516, "mean_token_accuracy": 0.15069491416215897, "num_tokens": 6270109.0, "step": 3080 }, { "entropy": 6.562840795516967, "epoch": 0.18056774948785484, "grad_norm": 1.03125, "learning_rate": 0.0001458166611790873, "loss": 6.1414, "mean_token_accuracy": 0.13628481179475785, "num_tokens": 6280013.0, "step": 3085 }, { "entropy": 6.544111537933349, "epoch": 0.18086040386303776, "grad_norm": 0.90234375, "learning_rate": 0.00014485386761584773, "loss": 6.2249, "mean_token_accuracy": 0.13783016949892044, "num_tokens": 6290308.0, "step": 3090 }, { "entropy": 6.559813976287842, "epoch": 0.18115305823822067, "grad_norm": 0.9140625, "learning_rate": 0.00014389464207457042, "loss": 6.1706, "mean_token_accuracy": 0.13924323990941048, "num_tokens": 6301461.0, "step": 3095 }, { "entropy": 6.547021818161011, "epoch": 0.18144571261340356, "grad_norm": 0.953125, "learning_rate": 0.00014293901085290795, "loss": 6.1742, "mean_token_accuracy": 0.1429192081093788, "num_tokens": 6311522.0, "step": 3100 }, { "entropy": 6.5111688613891605, "epoch": 0.18173836698858647, "grad_norm": 0.984375, "learning_rate": 0.00014198700014997307, "loss": 6.1247, "mean_token_accuracy": 0.14549821019172668, "num_tokens": 6321214.0, "step": 3105 }, { "entropy": 6.476716661453247, "epoch": 0.1820310213637694, "grad_norm": 1.0078125, "learning_rate": 0.00014103863606562016, "loss": 6.1697, "mean_token_accuracy": 0.14285324662923812, "num_tokens": 6331519.0, "step": 3110 }, { "entropy": 6.502555799484253, "epoch": 0.1823236757389523, "grad_norm": 1.0078125, "learning_rate": 0.00014009394459972964, "loss": 6.1918, "mean_token_accuracy": 0.1411581166088581, "num_tokens": 6341813.0, "step": 3115 }, { "entropy": 6.503493881225586, "epoch": 0.1826163301141352, "grad_norm": 0.94921875, "learning_rate": 0.00013915295165149513, "loss": 6.1169, "mean_token_accuracy": 0.14775150120258332, "num_tokens": 6351702.0, "step": 3120 }, { "entropy": 6.542804908752442, "epoch": 0.1829089844893181, "grad_norm": 0.921875, "learning_rate": 0.00013821568301871384, "loss": 6.2016, "mean_token_accuracy": 0.14204149842262268, "num_tokens": 6360911.0, "step": 3125 }, { "entropy": 6.503798627853394, "epoch": 0.18320163886450103, "grad_norm": 1.046875, "learning_rate": 0.00013728216439707862, "loss": 6.1639, "mean_token_accuracy": 0.1511763021349907, "num_tokens": 6370746.0, "step": 3130 }, { "entropy": 6.545259237289429, "epoch": 0.18349429323968394, "grad_norm": 0.93359375, "learning_rate": 0.00013635242137947419, "loss": 6.1848, "mean_token_accuracy": 0.14381610006093978, "num_tokens": 6380625.0, "step": 3135 }, { "entropy": 6.497043609619141, "epoch": 0.18378694761486683, "grad_norm": 0.875, "learning_rate": 0.00013542647945527498, "loss": 6.1153, "mean_token_accuracy": 0.14465947449207306, "num_tokens": 6390178.0, "step": 3140 }, { "entropy": 6.557563781738281, "epoch": 0.18407960199004975, "grad_norm": 0.9921875, "learning_rate": 0.0001345043640096465, "loss": 6.1446, "mean_token_accuracy": 0.1392044946551323, "num_tokens": 6400848.0, "step": 3145 }, { "entropy": 6.536911964416504, "epoch": 0.18437225636523266, "grad_norm": 0.98046875, "learning_rate": 0.00013358610032284957, "loss": 6.0773, "mean_token_accuracy": 0.15444280654191972, "num_tokens": 6410227.0, "step": 3150 }, { "entropy": 6.668428421020508, "epoch": 0.18466491074041558, "grad_norm": 0.9453125, "learning_rate": 0.000132671713569547, "loss": 6.2585, "mean_token_accuracy": 0.13642899543046952, "num_tokens": 6420789.0, "step": 3155 }, { "entropy": 6.531793737411499, "epoch": 0.18495756511559847, "grad_norm": 0.9765625, "learning_rate": 0.0001317612288181136, "loss": 6.1321, "mean_token_accuracy": 0.14091505408287047, "num_tokens": 6432231.0, "step": 3160 }, { "entropy": 6.50133957862854, "epoch": 0.18525021949078138, "grad_norm": 0.91015625, "learning_rate": 0.00013085467102994864, "loss": 6.1346, "mean_token_accuracy": 0.143214550614357, "num_tokens": 6442908.0, "step": 3165 }, { "entropy": 6.454491424560547, "epoch": 0.1855428738659643, "grad_norm": 0.9765625, "learning_rate": 0.00012995206505879198, "loss": 5.9835, "mean_token_accuracy": 0.15929021015763284, "num_tokens": 6453080.0, "step": 3170 }, { "entropy": 6.499005126953125, "epoch": 0.1858355282411472, "grad_norm": 0.93359375, "learning_rate": 0.0001290534356500421, "loss": 6.05, "mean_token_accuracy": 0.15089300721883775, "num_tokens": 6462666.0, "step": 3175 }, { "entropy": 6.4862060546875, "epoch": 0.1861281826163301, "grad_norm": 0.9296875, "learning_rate": 0.00012815880744007827, "loss": 6.0655, "mean_token_accuracy": 0.14950303733348846, "num_tokens": 6471852.0, "step": 3180 }, { "entropy": 6.5087827205657955, "epoch": 0.18642083699151302, "grad_norm": 0.9296875, "learning_rate": 0.00012726820495558483, "loss": 6.1372, "mean_token_accuracy": 0.13694501370191575, "num_tokens": 6482040.0, "step": 3185 }, { "entropy": 6.491412544250489, "epoch": 0.18671349136669593, "grad_norm": 0.98046875, "learning_rate": 0.00012638165261287868, "loss": 6.1892, "mean_token_accuracy": 0.1441599428653717, "num_tokens": 6492011.0, "step": 3190 }, { "entropy": 6.527288341522217, "epoch": 0.18700614574187885, "grad_norm": 0.9765625, "learning_rate": 0.0001254991747172402, "loss": 6.0451, "mean_token_accuracy": 0.1534967005252838, "num_tokens": 6501865.0, "step": 3195 }, { "entropy": 6.526633882522583, "epoch": 0.18729880011706174, "grad_norm": 1.03125, "learning_rate": 0.00012462079546224662, "loss": 6.1959, "mean_token_accuracy": 0.13465647250413895, "num_tokens": 6511366.0, "step": 3200 }, { "entropy": 6.481320762634278, "epoch": 0.18759145449224465, "grad_norm": 0.96875, "learning_rate": 0.00012374653892910896, "loss": 6.1612, "mean_token_accuracy": 0.1427885577082634, "num_tokens": 6522043.0, "step": 3205 }, { "entropy": 6.448639822006226, "epoch": 0.18788410886742757, "grad_norm": 0.9609375, "learning_rate": 0.00012287642908601166, "loss": 6.0795, "mean_token_accuracy": 0.15226924270391465, "num_tokens": 6531370.0, "step": 3210 }, { "entropy": 6.510616779327393, "epoch": 0.18817676324261048, "grad_norm": 0.9609375, "learning_rate": 0.00012201048978745569, "loss": 6.2082, "mean_token_accuracy": 0.13765064626932144, "num_tokens": 6541591.0, "step": 3215 }, { "entropy": 6.553675937652588, "epoch": 0.18846941761779337, "grad_norm": 1.046875, "learning_rate": 0.00012114874477360427, "loss": 6.1576, "mean_token_accuracy": 0.14889416396617888, "num_tokens": 6551822.0, "step": 3220 }, { "entropy": 6.5613843441009525, "epoch": 0.1887620719929763, "grad_norm": 1.0703125, "learning_rate": 0.00012029121766963236, "loss": 6.1679, "mean_token_accuracy": 0.13998883217573166, "num_tokens": 6562274.0, "step": 3225 }, { "entropy": 6.5364524841308596, "epoch": 0.1890547263681592, "grad_norm": 0.98828125, "learning_rate": 0.00011943793198507858, "loss": 6.0816, "mean_token_accuracy": 0.1528732806444168, "num_tokens": 6571825.0, "step": 3230 }, { "entropy": 6.508966112136841, "epoch": 0.18934738074334212, "grad_norm": 0.8828125, "learning_rate": 0.00011858891111320104, "loss": 6.1761, "mean_token_accuracy": 0.14219273403286933, "num_tokens": 6583320.0, "step": 3235 }, { "entropy": 6.479587173461914, "epoch": 0.18964003511852504, "grad_norm": 0.94140625, "learning_rate": 0.0001177441783303359, "loss": 6.169, "mean_token_accuracy": 0.14314228296279907, "num_tokens": 6592956.0, "step": 3240 }, { "entropy": 6.519537544250488, "epoch": 0.18993268949370792, "grad_norm": 0.94140625, "learning_rate": 0.00011690375679525896, "loss": 6.1241, "mean_token_accuracy": 0.1436382383108139, "num_tokens": 6602720.0, "step": 3245 }, { "entropy": 6.515391302108765, "epoch": 0.19022534386889084, "grad_norm": 0.91015625, "learning_rate": 0.00011606766954855124, "loss": 6.1244, "mean_token_accuracy": 0.1437808483839035, "num_tokens": 6612903.0, "step": 3250 }, { "entropy": 6.511262845993042, "epoch": 0.19051799824407376, "grad_norm": 1.109375, "learning_rate": 0.00011523593951196702, "loss": 6.1028, "mean_token_accuracy": 0.14446855187416077, "num_tokens": 6622332.0, "step": 3255 }, { "entropy": 6.516188478469848, "epoch": 0.19081065261925667, "grad_norm": 1.0, "learning_rate": 0.00011440858948780523, "loss": 6.1191, "mean_token_accuracy": 0.14798277914524077, "num_tokens": 6632318.0, "step": 3260 }, { "entropy": 6.5054370880126955, "epoch": 0.19110330699443956, "grad_norm": 0.984375, "learning_rate": 0.00011358564215828484, "loss": 6.0584, "mean_token_accuracy": 0.15622793436050414, "num_tokens": 6641570.0, "step": 3265 }, { "entropy": 6.479650688171387, "epoch": 0.19139596136962247, "grad_norm": 1.0625, "learning_rate": 0.00011276712008492254, "loss": 6.0876, "mean_token_accuracy": 0.15159723907709122, "num_tokens": 6651005.0, "step": 3270 }, { "entropy": 6.474793434143066, "epoch": 0.1916886157448054, "grad_norm": 0.984375, "learning_rate": 0.00011195304570791451, "loss": 6.0911, "mean_token_accuracy": 0.1451455034315586, "num_tokens": 6661120.0, "step": 3275 }, { "entropy": 6.420806169509888, "epoch": 0.1919812701199883, "grad_norm": 1.0234375, "learning_rate": 0.00011114344134552094, "loss": 6.0485, "mean_token_accuracy": 0.1483992077410221, "num_tokens": 6671050.0, "step": 3280 }, { "entropy": 6.546811485290528, "epoch": 0.1922739244951712, "grad_norm": 1.0, "learning_rate": 0.0001103383291934545, "loss": 6.1364, "mean_token_accuracy": 0.14277217537164688, "num_tokens": 6679971.0, "step": 3285 }, { "entropy": 6.501455211639405, "epoch": 0.1925665788703541, "grad_norm": 1.0234375, "learning_rate": 0.00010953773132427141, "loss": 6.0993, "mean_token_accuracy": 0.1467346504330635, "num_tokens": 6689624.0, "step": 3290 }, { "entropy": 6.507057571411133, "epoch": 0.19285923324553703, "grad_norm": 0.93359375, "learning_rate": 0.00010874166968676677, "loss": 6.081, "mean_token_accuracy": 0.14926030859351158, "num_tokens": 6699367.0, "step": 3295 }, { "entropy": 6.511276054382324, "epoch": 0.19315188762071994, "grad_norm": 0.9375, "learning_rate": 0.00010795016610537251, "loss": 6.1955, "mean_token_accuracy": 0.14719147533178328, "num_tokens": 6710264.0, "step": 3300 }, { "entropy": 6.542513370513916, "epoch": 0.19344454199590283, "grad_norm": 0.98046875, "learning_rate": 0.00010716324227955904, "loss": 6.113, "mean_token_accuracy": 0.14830136448144912, "num_tokens": 6719647.0, "step": 3305 }, { "entropy": 6.521778774261475, "epoch": 0.19373719637108575, "grad_norm": 1.3359375, "learning_rate": 0.0001063809197832406, "loss": 6.1055, "mean_token_accuracy": 0.14030593782663345, "num_tokens": 6730484.0, "step": 3310 }, { "entropy": 6.512838506698609, "epoch": 0.19402985074626866, "grad_norm": 0.92578125, "learning_rate": 0.00010560322006418368, "loss": 6.1923, "mean_token_accuracy": 0.14022092297673225, "num_tokens": 6741024.0, "step": 3315 }, { "entropy": 6.491540622711182, "epoch": 0.19432250512145158, "grad_norm": 0.92578125, "learning_rate": 0.00010483016444341887, "loss": 6.1765, "mean_token_accuracy": 0.14594444930553435, "num_tokens": 6752595.0, "step": 3320 }, { "entropy": 6.510129499435425, "epoch": 0.19461515949663447, "grad_norm": 0.87109375, "learning_rate": 0.00010406177411465654, "loss": 6.125, "mean_token_accuracy": 0.1474726304411888, "num_tokens": 6763232.0, "step": 3325 }, { "entropy": 6.57515778541565, "epoch": 0.19490781387181738, "grad_norm": 0.96875, "learning_rate": 0.00010329807014370562, "loss": 6.1991, "mean_token_accuracy": 0.1412241131067276, "num_tokens": 6773833.0, "step": 3330 }, { "entropy": 6.518423748016358, "epoch": 0.1952004682470003, "grad_norm": 0.94921875, "learning_rate": 0.00010253907346789632, "loss": 6.1288, "mean_token_accuracy": 0.14420404881238938, "num_tokens": 6783890.0, "step": 3335 }, { "entropy": 6.516356515884399, "epoch": 0.1954931226221832, "grad_norm": 0.84765625, "learning_rate": 0.00010178480489550596, "loss": 6.1342, "mean_token_accuracy": 0.14699260592460633, "num_tokens": 6794714.0, "step": 3340 }, { "entropy": 6.491269969940186, "epoch": 0.1957857769973661, "grad_norm": 0.91015625, "learning_rate": 0.00010103528510518836, "loss": 6.1033, "mean_token_accuracy": 0.15203306525945665, "num_tokens": 6804830.0, "step": 3345 }, { "entropy": 6.508249235153198, "epoch": 0.19607843137254902, "grad_norm": 0.85546875, "learning_rate": 0.0001002905346454073, "loss": 6.1381, "mean_token_accuracy": 0.1456788145005703, "num_tokens": 6815688.0, "step": 3350 }, { "entropy": 6.476333332061768, "epoch": 0.19637108574773193, "grad_norm": 0.953125, "learning_rate": 9.955057393387285e-05, "loss": 6.1283, "mean_token_accuracy": 0.14342557340860368, "num_tokens": 6825779.0, "step": 3355 }, { "entropy": 6.591718149185181, "epoch": 0.19666374012291485, "grad_norm": 1.046875, "learning_rate": 9.88154232569816e-05, "loss": 6.1407, "mean_token_accuracy": 0.143812657892704, "num_tokens": 6835470.0, "step": 3360 }, { "entropy": 6.56011176109314, "epoch": 0.19695639449809774, "grad_norm": 1.0, "learning_rate": 9.808510276926075e-05, "loss": 6.1309, "mean_token_accuracy": 0.14341106861829758, "num_tokens": 6845156.0, "step": 3365 }, { "entropy": 6.534071922302246, "epoch": 0.19724904887328065, "grad_norm": 0.984375, "learning_rate": 9.735963249281549e-05, "loss": 6.1101, "mean_token_accuracy": 0.138117728382349, "num_tokens": 6854510.0, "step": 3370 }, { "entropy": 6.526515531539917, "epoch": 0.19754170324846357, "grad_norm": 1.0390625, "learning_rate": 9.663903231677974e-05, "loss": 6.1068, "mean_token_accuracy": 0.14847509413957596, "num_tokens": 6864039.0, "step": 3375 }, { "entropy": 6.563806867599487, "epoch": 0.19783435762364648, "grad_norm": 1.5078125, "learning_rate": 9.592332199677145e-05, "loss": 6.1719, "mean_token_accuracy": 0.1439742773771286, "num_tokens": 6874337.0, "step": 3380 }, { "entropy": 6.52997522354126, "epoch": 0.19812701199882937, "grad_norm": 0.8828125, "learning_rate": 9.521252115435061e-05, "loss": 6.1098, "mean_token_accuracy": 0.14916539639234544, "num_tokens": 6884549.0, "step": 3385 }, { "entropy": 6.506438112258911, "epoch": 0.1984196663740123, "grad_norm": 0.9921875, "learning_rate": 9.450664927648126e-05, "loss": 6.1249, "mean_token_accuracy": 0.14378809109330176, "num_tokens": 6894764.0, "step": 3390 }, { "entropy": 6.538644599914551, "epoch": 0.1987123207491952, "grad_norm": 0.92578125, "learning_rate": 9.380572571499758e-05, "loss": 6.1651, "mean_token_accuracy": 0.13734800070524217, "num_tokens": 6905172.0, "step": 3395 }, { "entropy": 6.545459842681884, "epoch": 0.19900497512437812, "grad_norm": 0.97265625, "learning_rate": 9.310976968607307e-05, "loss": 6.1154, "mean_token_accuracy": 0.1441711589694023, "num_tokens": 6915377.0, "step": 3400 }, { "entropy": 6.505397319793701, "epoch": 0.199297629499561, "grad_norm": 0.94921875, "learning_rate": 9.241880026969381e-05, "loss": 6.131, "mean_token_accuracy": 0.14213315546512603, "num_tokens": 6925021.0, "step": 3405 }, { "entropy": 6.524601411819458, "epoch": 0.19959028387474392, "grad_norm": 1.0078125, "learning_rate": 9.173283640913537e-05, "loss": 6.1255, "mean_token_accuracy": 0.15131098926067352, "num_tokens": 6935064.0, "step": 3410 }, { "entropy": 6.554570960998535, "epoch": 0.19988293824992684, "grad_norm": 0.9921875, "learning_rate": 9.10518969104436e-05, "loss": 6.1147, "mean_token_accuracy": 0.13965613767504692, "num_tokens": 6944497.0, "step": 3415 }, { "entropy": 6.481611728668213, "epoch": 0.20017559262510976, "grad_norm": 0.953125, "learning_rate": 9.037600044191868e-05, "loss": 6.0711, "mean_token_accuracy": 0.14768997728824615, "num_tokens": 6955077.0, "step": 3420 }, { "entropy": 6.5337316513061525, "epoch": 0.20046824700029264, "grad_norm": 0.91015625, "learning_rate": 8.970516553360383e-05, "loss": 6.0379, "mean_token_accuracy": 0.15110457688570023, "num_tokens": 6964920.0, "step": 3425 }, { "entropy": 6.542189884185791, "epoch": 0.20076090137547556, "grad_norm": 0.93359375, "learning_rate": 8.903941057677692e-05, "loss": 6.1111, "mean_token_accuracy": 0.1465953290462494, "num_tokens": 6975885.0, "step": 3430 }, { "entropy": 6.510104131698609, "epoch": 0.20105355575065847, "grad_norm": 0.98046875, "learning_rate": 8.837875382344635e-05, "loss": 6.0954, "mean_token_accuracy": 0.1429012708365917, "num_tokens": 6985815.0, "step": 3435 }, { "entropy": 6.4639991283416744, "epoch": 0.2013462101258414, "grad_norm": 1.0234375, "learning_rate": 8.772321338585076e-05, "loss": 6.2238, "mean_token_accuracy": 0.14011383652687073, "num_tokens": 6997428.0, "step": 3440 }, { "entropy": 6.470316791534424, "epoch": 0.20163886450102428, "grad_norm": 1.0078125, "learning_rate": 8.707280723596242e-05, "loss": 6.053, "mean_token_accuracy": 0.15449999421834945, "num_tokens": 7006843.0, "step": 3445 }, { "entropy": 6.562495326995849, "epoch": 0.2019315188762072, "grad_norm": 1.0078125, "learning_rate": 8.64275532049944e-05, "loss": 6.0772, "mean_token_accuracy": 0.14717888385057448, "num_tokens": 7016771.0, "step": 3450 }, { "entropy": 6.529797554016113, "epoch": 0.2022241732513901, "grad_norm": 0.91015625, "learning_rate": 8.578746898291198e-05, "loss": 6.091, "mean_token_accuracy": 0.1471193552017212, "num_tokens": 7026954.0, "step": 3455 }, { "entropy": 6.50721116065979, "epoch": 0.20251682762657303, "grad_norm": 0.921875, "learning_rate": 8.515257211794742e-05, "loss": 6.0601, "mean_token_accuracy": 0.14560007080435752, "num_tokens": 7036738.0, "step": 3460 }, { "entropy": 6.502740859985352, "epoch": 0.20280948200175591, "grad_norm": 0.9765625, "learning_rate": 8.452288001611896e-05, "loss": 6.1563, "mean_token_accuracy": 0.1449129030108452, "num_tokens": 7047170.0, "step": 3465 }, { "entropy": 6.510188436508178, "epoch": 0.20310213637693883, "grad_norm": 0.9609375, "learning_rate": 8.389840994075379e-05, "loss": 6.1234, "mean_token_accuracy": 0.14440898299217225, "num_tokens": 7057781.0, "step": 3470 }, { "entropy": 6.506147575378418, "epoch": 0.20339479075212175, "grad_norm": 0.953125, "learning_rate": 8.327917901201435e-05, "loss": 6.137, "mean_token_accuracy": 0.14018382877111435, "num_tokens": 7069164.0, "step": 3475 }, { "entropy": 6.499817657470703, "epoch": 0.20368744512730466, "grad_norm": 0.87890625, "learning_rate": 8.266520420642931e-05, "loss": 6.1512, "mean_token_accuracy": 0.14485890790820122, "num_tokens": 7079257.0, "step": 3480 }, { "entropy": 6.525219678878784, "epoch": 0.20398009950248755, "grad_norm": 0.93359375, "learning_rate": 8.205650235642828e-05, "loss": 6.1295, "mean_token_accuracy": 0.14052784591913223, "num_tokens": 7089561.0, "step": 3485 }, { "entropy": 6.4985270500183105, "epoch": 0.20427275387767047, "grad_norm": 0.96484375, "learning_rate": 8.145309014987978e-05, "loss": 6.0833, "mean_token_accuracy": 0.14657906740903853, "num_tokens": 7098991.0, "step": 3490 }, { "entropy": 6.494947195053101, "epoch": 0.20456540825285338, "grad_norm": 1.015625, "learning_rate": 8.085498412963437e-05, "loss": 6.1097, "mean_token_accuracy": 0.15176880955696107, "num_tokens": 7109236.0, "step": 3495 }, { "entropy": 6.47788143157959, "epoch": 0.2048580626280363, "grad_norm": 0.96875, "learning_rate": 8.026220069307078e-05, "loss": 6.1197, "mean_token_accuracy": 0.1460615649819374, "num_tokens": 7119806.0, "step": 3500 }, { "entropy": 6.49668779373169, "epoch": 0.20515071700321919, "grad_norm": 0.92578125, "learning_rate": 7.967475609164621e-05, "loss": 6.0805, "mean_token_accuracy": 0.15554071813821793, "num_tokens": 7130121.0, "step": 3505 }, { "entropy": 6.5026407718658445, "epoch": 0.2054433713784021, "grad_norm": 0.93359375, "learning_rate": 7.909266643045124e-05, "loss": 6.1704, "mean_token_accuracy": 0.14418810307979585, "num_tokens": 7140886.0, "step": 3510 }, { "entropy": 6.5382771492004395, "epoch": 0.20573602575358502, "grad_norm": 0.98046875, "learning_rate": 7.851594766776802e-05, "loss": 6.1213, "mean_token_accuracy": 0.1487508624792099, "num_tokens": 7151549.0, "step": 3515 }, { "entropy": 6.557380247116089, "epoch": 0.20602868012876793, "grad_norm": 1.015625, "learning_rate": 7.794461561463265e-05, "loss": 6.0846, "mean_token_accuracy": 0.14515642523765565, "num_tokens": 7161137.0, "step": 3520 }, { "entropy": 6.538903284072876, "epoch": 0.20632133450395082, "grad_norm": 0.98046875, "learning_rate": 7.7378685934402e-05, "loss": 6.1042, "mean_token_accuracy": 0.14849655479192733, "num_tokens": 7170984.0, "step": 3525 }, { "entropy": 6.501808071136475, "epoch": 0.20661398887913374, "grad_norm": 0.8671875, "learning_rate": 7.68181741423242e-05, "loss": 6.1186, "mean_token_accuracy": 0.14240872412919997, "num_tokens": 7180895.0, "step": 3530 }, { "entropy": 6.474981355667114, "epoch": 0.20690664325431665, "grad_norm": 0.8984375, "learning_rate": 7.626309560511313e-05, "loss": 6.0557, "mean_token_accuracy": 0.15063221827149392, "num_tokens": 7190645.0, "step": 3535 }, { "entropy": 6.502190160751343, "epoch": 0.20719929762949957, "grad_norm": 0.8828125, "learning_rate": 7.571346554052724e-05, "loss": 6.1703, "mean_token_accuracy": 0.14260774701833726, "num_tokens": 7201748.0, "step": 3540 }, { "entropy": 6.505003309249878, "epoch": 0.20749195200468246, "grad_norm": 0.890625, "learning_rate": 7.516929901695249e-05, "loss": 6.0955, "mean_token_accuracy": 0.14398877024650575, "num_tokens": 7212003.0, "step": 3545 }, { "entropy": 6.471632432937622, "epoch": 0.20778460637986537, "grad_norm": 1.0625, "learning_rate": 7.463061095298893e-05, "loss": 6.0251, "mean_token_accuracy": 0.15230228900909423, "num_tokens": 7222360.0, "step": 3550 }, { "entropy": 6.465027904510498, "epoch": 0.2080772607550483, "grad_norm": 0.953125, "learning_rate": 7.409741611704198e-05, "loss": 6.1278, "mean_token_accuracy": 0.14973394051194192, "num_tokens": 7233010.0, "step": 3555 }, { "entropy": 6.476969814300537, "epoch": 0.2083699151302312, "grad_norm": 0.953125, "learning_rate": 7.35697291269174e-05, "loss": 6.0778, "mean_token_accuracy": 0.14621633887290955, "num_tokens": 7243203.0, "step": 3560 }, { "entropy": 6.487559461593628, "epoch": 0.20866256950541412, "grad_norm": 0.9375, "learning_rate": 7.304756444942056e-05, "loss": 6.0249, "mean_token_accuracy": 0.14982281923294066, "num_tokens": 7252932.0, "step": 3565 }, { "entropy": 6.548482608795166, "epoch": 0.208955223880597, "grad_norm": 0.94140625, "learning_rate": 7.253093639995994e-05, "loss": 6.1576, "mean_token_accuracy": 0.13707507625222207, "num_tokens": 7263740.0, "step": 3570 }, { "entropy": 6.537335729598999, "epoch": 0.20924787825577992, "grad_norm": 0.90625, "learning_rate": 7.20198591421544e-05, "loss": 6.1645, "mean_token_accuracy": 0.14378871843218805, "num_tokens": 7275250.0, "step": 3575 }, { "entropy": 6.515637826919556, "epoch": 0.20954053263096284, "grad_norm": 0.96875, "learning_rate": 7.151434668744517e-05, "loss": 6.088, "mean_token_accuracy": 0.14651051312685012, "num_tokens": 7284931.0, "step": 3580 }, { "entropy": 6.5285032272338865, "epoch": 0.20983318700614575, "grad_norm": 0.96875, "learning_rate": 7.101441289471153e-05, "loss": 6.0994, "mean_token_accuracy": 0.1424126997590065, "num_tokens": 7294001.0, "step": 3585 }, { "entropy": 6.491058969497681, "epoch": 0.21012584138132864, "grad_norm": 0.94140625, "learning_rate": 7.052007146989098e-05, "loss": 6.1505, "mean_token_accuracy": 0.14745633006095887, "num_tokens": 7303936.0, "step": 3590 }, { "entropy": 6.518863821029663, "epoch": 0.21041849575651156, "grad_norm": 0.96875, "learning_rate": 7.003133596560341e-05, "loss": 6.1389, "mean_token_accuracy": 0.14464670270681382, "num_tokens": 7313291.0, "step": 3595 }, { "entropy": 6.492536973953247, "epoch": 0.21071115013169447, "grad_norm": 1.0390625, "learning_rate": 6.954821978077952e-05, "loss": 6.0968, "mean_token_accuracy": 0.15085001140832902, "num_tokens": 7323756.0, "step": 3600 }, { "entropy": 6.54294900894165, "epoch": 0.2110038045068774, "grad_norm": 0.890625, "learning_rate": 6.907073616029356e-05, "loss": 6.1367, "mean_token_accuracy": 0.14181474447250367, "num_tokens": 7334082.0, "step": 3605 }, { "entropy": 6.530097341537475, "epoch": 0.21129645888206028, "grad_norm": 0.95703125, "learning_rate": 6.85988981946002e-05, "loss": 6.115, "mean_token_accuracy": 0.14248115792870522, "num_tokens": 7343943.0, "step": 3610 }, { "entropy": 6.479027366638183, "epoch": 0.2115891132572432, "grad_norm": 1.0390625, "learning_rate": 6.813271881937564e-05, "loss": 6.1444, "mean_token_accuracy": 0.14788323938846587, "num_tokens": 7354287.0, "step": 3615 }, { "entropy": 6.507117223739624, "epoch": 0.2118817676324261, "grad_norm": 0.984375, "learning_rate": 6.767221081516286e-05, "loss": 6.1253, "mean_token_accuracy": 0.14719715863466262, "num_tokens": 7363912.0, "step": 3620 }, { "entropy": 6.475336933135987, "epoch": 0.21217442200760903, "grad_norm": 0.89453125, "learning_rate": 6.72173868070215e-05, "loss": 6.1518, "mean_token_accuracy": 0.1445387363433838, "num_tokens": 7374154.0, "step": 3625 }, { "entropy": 6.499212265014648, "epoch": 0.21246707638279191, "grad_norm": 0.953125, "learning_rate": 6.676825926418149e-05, "loss": 6.1431, "mean_token_accuracy": 0.15224189609289168, "num_tokens": 7384541.0, "step": 3630 }, { "entropy": 6.532063102722168, "epoch": 0.21275973075797483, "grad_norm": 0.97265625, "learning_rate": 6.632484049970122e-05, "loss": 6.0503, "mean_token_accuracy": 0.14785742834210397, "num_tokens": 7394448.0, "step": 3635 }, { "entropy": 6.534755611419678, "epoch": 0.21305238513315775, "grad_norm": 0.9921875, "learning_rate": 6.588714267013019e-05, "loss": 6.0705, "mean_token_accuracy": 0.15284654051065444, "num_tokens": 7404213.0, "step": 3640 }, { "entropy": 6.493775272369385, "epoch": 0.21334503950834066, "grad_norm": 1.0703125, "learning_rate": 6.545517777517544e-05, "loss": 6.0491, "mean_token_accuracy": 0.14635820984840392, "num_tokens": 7413207.0, "step": 3645 }, { "entropy": 6.464639663696289, "epoch": 0.21363769388352355, "grad_norm": 0.9921875, "learning_rate": 6.502895765737281e-05, "loss": 6.0739, "mean_token_accuracy": 0.14970591366291047, "num_tokens": 7422559.0, "step": 3650 }, { "entropy": 6.46453104019165, "epoch": 0.21393034825870647, "grad_norm": 0.91015625, "learning_rate": 6.460849400176212e-05, "loss": 6.0917, "mean_token_accuracy": 0.15067594796419143, "num_tokens": 7432285.0, "step": 3655 }, { "entropy": 6.469953298568726, "epoch": 0.21422300263388938, "grad_norm": 0.9375, "learning_rate": 6.419379833556694e-05, "loss": 6.0642, "mean_token_accuracy": 0.15182625353336335, "num_tokens": 7440953.0, "step": 3660 }, { "entropy": 6.5017272472381595, "epoch": 0.2145156570090723, "grad_norm": 0.98828125, "learning_rate": 6.378488202787835e-05, "loss": 6.1053, "mean_token_accuracy": 0.1463750459253788, "num_tokens": 7451895.0, "step": 3665 }, { "entropy": 6.419353771209717, "epoch": 0.21480831138425519, "grad_norm": 0.9765625, "learning_rate": 6.33817562893435e-05, "loss": 6.0367, "mean_token_accuracy": 0.1561209313571453, "num_tokens": 7462493.0, "step": 3670 }, { "entropy": 6.495792293548584, "epoch": 0.2151009657594381, "grad_norm": 0.90234375, "learning_rate": 6.29844321718582e-05, "loss": 6.1346, "mean_token_accuracy": 0.14416173994541168, "num_tokens": 7473536.0, "step": 3675 }, { "entropy": 6.538217687606812, "epoch": 0.21539362013462102, "grad_norm": 1.03125, "learning_rate": 6.259292056826383e-05, "loss": 6.0831, "mean_token_accuracy": 0.14800039380788804, "num_tokens": 7483380.0, "step": 3680 }, { "entropy": 6.573997592926025, "epoch": 0.21568627450980393, "grad_norm": 0.9453125, "learning_rate": 6.220723221204873e-05, "loss": 6.0588, "mean_token_accuracy": 0.14316221177577973, "num_tokens": 7494238.0, "step": 3685 }, { "entropy": 6.507421684265137, "epoch": 0.21597892888498682, "grad_norm": 0.87109375, "learning_rate": 6.182737767705406e-05, "loss": 6.129, "mean_token_accuracy": 0.14178816527128218, "num_tokens": 7505565.0, "step": 3690 }, { "entropy": 6.531171178817749, "epoch": 0.21627158326016974, "grad_norm": 0.87109375, "learning_rate": 6.145336737718375e-05, "loss": 6.1377, "mean_token_accuracy": 0.14357076734304428, "num_tokens": 7515894.0, "step": 3695 }, { "entropy": 6.514312887191773, "epoch": 0.21656423763535265, "grad_norm": 0.99609375, "learning_rate": 6.10852115661191e-05, "loss": 6.1553, "mean_token_accuracy": 0.14516704380512238, "num_tokens": 7525460.0, "step": 3700 }, { "entropy": 6.511424446105957, "epoch": 0.21685689201053557, "grad_norm": 0.953125, "learning_rate": 6.072292033703766e-05, "loss": 6.0921, "mean_token_accuracy": 0.15139335244894028, "num_tokens": 7535624.0, "step": 3705 }, { "entropy": 6.521893453598023, "epoch": 0.21714954638571846, "grad_norm": 0.94921875, "learning_rate": 6.036650362233648e-05, "loss": 6.0823, "mean_token_accuracy": 0.14551323726773263, "num_tokens": 7544709.0, "step": 3710 }, { "entropy": 6.509437227249146, "epoch": 0.21744220076090137, "grad_norm": 0.953125, "learning_rate": 6.0015971193359824e-05, "loss": 6.076, "mean_token_accuracy": 0.1517314374446869, "num_tokens": 7553581.0, "step": 3715 }, { "entropy": 6.507831144332886, "epoch": 0.2177348551360843, "grad_norm": 0.9921875, "learning_rate": 5.9671332660131306e-05, "loss": 6.0573, "mean_token_accuracy": 0.14443017840385436, "num_tokens": 7563845.0, "step": 3720 }, { "entropy": 6.518702983856201, "epoch": 0.2180275095112672, "grad_norm": 0.8671875, "learning_rate": 5.933259747109042e-05, "loss": 6.1909, "mean_token_accuracy": 0.14262843281030654, "num_tokens": 7574498.0, "step": 3725 }, { "entropy": 6.538387727737427, "epoch": 0.2183201638864501, "grad_norm": 0.96875, "learning_rate": 5.899977491283351e-05, "loss": 6.1284, "mean_token_accuracy": 0.13924877867102622, "num_tokens": 7583933.0, "step": 3730 }, { "entropy": 6.520901107788086, "epoch": 0.218612818261633, "grad_norm": 0.96484375, "learning_rate": 5.867287410985908e-05, "loss": 6.1369, "mean_token_accuracy": 0.1502170220017433, "num_tokens": 7594103.0, "step": 3735 }, { "entropy": 6.504067897796631, "epoch": 0.21890547263681592, "grad_norm": 0.95703125, "learning_rate": 5.835190402431779e-05, "loss": 6.0868, "mean_token_accuracy": 0.14680576846003532, "num_tokens": 7603288.0, "step": 3740 }, { "entropy": 6.535769319534301, "epoch": 0.21919812701199884, "grad_norm": 1.03125, "learning_rate": 5.803687345576673e-05, "loss": 6.1862, "mean_token_accuracy": 0.1481730043888092, "num_tokens": 7613082.0, "step": 3745 }, { "entropy": 6.5248730182647705, "epoch": 0.21949078138718173, "grad_norm": 0.9453125, "learning_rate": 5.7727791040927977e-05, "loss": 6.0713, "mean_token_accuracy": 0.15004510581493377, "num_tokens": 7623318.0, "step": 3750 }, { "entropy": 6.5283208847045895, "epoch": 0.21978343576236464, "grad_norm": 0.96875, "learning_rate": 5.742466525345213e-05, "loss": 6.0884, "mean_token_accuracy": 0.14491992220282554, "num_tokens": 7633485.0, "step": 3755 }, { "entropy": 6.501487684249878, "epoch": 0.22007609013754756, "grad_norm": 0.9453125, "learning_rate": 5.7127504403685775e-05, "loss": 6.0569, "mean_token_accuracy": 0.150742207467556, "num_tokens": 7643008.0, "step": 3760 }, { "entropy": 6.505180692672729, "epoch": 0.22036874451273047, "grad_norm": 1.0703125, "learning_rate": 5.6836316638443664e-05, "loss": 6.1376, "mean_token_accuracy": 0.13706468939781188, "num_tokens": 7653276.0, "step": 3765 }, { "entropy": 6.5070442199707035, "epoch": 0.22066139888791336, "grad_norm": 0.90625, "learning_rate": 5.655110994078553e-05, "loss": 6.1957, "mean_token_accuracy": 0.1418207749724388, "num_tokens": 7664710.0, "step": 3770 }, { "entropy": 6.514568758010864, "epoch": 0.22095405326309628, "grad_norm": 0.890625, "learning_rate": 5.6271892129797056e-05, "loss": 6.0888, "mean_token_accuracy": 0.14937056303024293, "num_tokens": 7675434.0, "step": 3775 }, { "entropy": 6.5285614967346195, "epoch": 0.2212467076382792, "grad_norm": 0.93359375, "learning_rate": 5.599867086037556e-05, "loss": 6.0904, "mean_token_accuracy": 0.14905666410923005, "num_tokens": 7686649.0, "step": 3780 }, { "entropy": 6.491574096679687, "epoch": 0.2215393620134621, "grad_norm": 0.83984375, "learning_rate": 5.573145362302012e-05, "loss": 6.1189, "mean_token_accuracy": 0.14480524510145187, "num_tokens": 7697561.0, "step": 3785 }, { "entropy": 6.516961669921875, "epoch": 0.221832016388645, "grad_norm": 0.91015625, "learning_rate": 5.5470247743626404e-05, "loss": 6.1459, "mean_token_accuracy": 0.1418006770312786, "num_tokens": 7708454.0, "step": 3790 }, { "entropy": 6.495875835418701, "epoch": 0.2221246707638279, "grad_norm": 1.09375, "learning_rate": 5.5215060383285414e-05, "loss": 6.0762, "mean_token_accuracy": 0.15612278282642364, "num_tokens": 7717796.0, "step": 3795 }, { "entropy": 6.492186689376831, "epoch": 0.22241732513901083, "grad_norm": 0.9765625, "learning_rate": 5.496589853808759e-05, "loss": 6.1059, "mean_token_accuracy": 0.1479303777217865, "num_tokens": 7729141.0, "step": 3800 }, { "entropy": 6.483253526687622, "epoch": 0.22270997951419375, "grad_norm": 0.94921875, "learning_rate": 5.47227690389308e-05, "loss": 6.053, "mean_token_accuracy": 0.15191978812217713, "num_tokens": 7740073.0, "step": 3805 }, { "entropy": 6.491347599029541, "epoch": 0.22300263388937663, "grad_norm": 1.078125, "learning_rate": 5.448567855133306e-05, "loss": 6.1184, "mean_token_accuracy": 0.15107756853103638, "num_tokens": 7749953.0, "step": 3810 }, { "entropy": 6.523360633850098, "epoch": 0.22329528826455955, "grad_norm": 0.921875, "learning_rate": 5.425463357524986e-05, "loss": 6.0866, "mean_token_accuracy": 0.1515983447432518, "num_tokens": 7760635.0, "step": 3815 }, { "entropy": 6.5049408912658695, "epoch": 0.22358794263974247, "grad_norm": 0.94921875, "learning_rate": 5.402964044489591e-05, "loss": 6.1779, "mean_token_accuracy": 0.1399427704513073, "num_tokens": 7770180.0, "step": 3820 }, { "entropy": 6.5423120021820065, "epoch": 0.22388059701492538, "grad_norm": 1.03125, "learning_rate": 5.381070532857153e-05, "loss": 6.1184, "mean_token_accuracy": 0.1484750360250473, "num_tokens": 7779785.0, "step": 3825 }, { "entropy": 6.497373342514038, "epoch": 0.22417325139010827, "grad_norm": 1.0390625, "learning_rate": 5.359783422849357e-05, "loss": 6.0848, "mean_token_accuracy": 0.1474147319793701, "num_tokens": 7788991.0, "step": 3830 }, { "entropy": 6.54995436668396, "epoch": 0.22446590576529118, "grad_norm": 0.9140625, "learning_rate": 5.3391032980630736e-05, "loss": 6.1841, "mean_token_accuracy": 0.14122720658779145, "num_tokens": 7799819.0, "step": 3835 }, { "entropy": 6.51366024017334, "epoch": 0.2247585601404741, "grad_norm": 1.046875, "learning_rate": 5.31903072545437e-05, "loss": 6.0987, "mean_token_accuracy": 0.15322458744049072, "num_tokens": 7809819.0, "step": 3840 }, { "entropy": 6.534890222549438, "epoch": 0.22505121451565702, "grad_norm": 0.91796875, "learning_rate": 5.29956625532297e-05, "loss": 6.0787, "mean_token_accuracy": 0.1449745550751686, "num_tokens": 7820759.0, "step": 3845 }, { "entropy": 6.505971431732178, "epoch": 0.2253438688908399, "grad_norm": 0.95703125, "learning_rate": 5.280710421297146e-05, "loss": 6.0876, "mean_token_accuracy": 0.14907216131687165, "num_tokens": 7831305.0, "step": 3850 }, { "entropy": 6.554799747467041, "epoch": 0.22563652326602282, "grad_norm": 0.94921875, "learning_rate": 5.2624637403191165e-05, "loss": 6.1506, "mean_token_accuracy": 0.144401141256094, "num_tokens": 7840696.0, "step": 3855 }, { "entropy": 6.490703153610229, "epoch": 0.22592917764120574, "grad_norm": 0.96875, "learning_rate": 5.2448267126308605e-05, "loss": 6.0567, "mean_token_accuracy": 0.1477527178823948, "num_tokens": 7849841.0, "step": 3860 }, { "entropy": 6.486115646362305, "epoch": 0.22622183201638865, "grad_norm": 1.0, "learning_rate": 5.2277998217603954e-05, "loss": 6.0567, "mean_token_accuracy": 0.15079898089170457, "num_tokens": 7859288.0, "step": 3865 }, { "entropy": 6.461398696899414, "epoch": 0.22651448639157157, "grad_norm": 0.97265625, "learning_rate": 5.211383534508541e-05, "loss": 6.1398, "mean_token_accuracy": 0.1455684170126915, "num_tokens": 7869486.0, "step": 3870 }, { "entropy": 6.478337383270263, "epoch": 0.22680714076675446, "grad_norm": 1.0625, "learning_rate": 5.1955783009361044e-05, "loss": 6.0108, "mean_token_accuracy": 0.15290409326553345, "num_tokens": 7878965.0, "step": 3875 }, { "entropy": 6.51535267829895, "epoch": 0.22709979514193737, "grad_norm": 1.0546875, "learning_rate": 5.180384554351543e-05, "loss": 6.0855, "mean_token_accuracy": 0.1477866642177105, "num_tokens": 7889217.0, "step": 3880 }, { "entropy": 6.525639963150025, "epoch": 0.2273924495171203, "grad_norm": 0.96875, "learning_rate": 5.1658027112990976e-05, "loss": 6.1357, "mean_token_accuracy": 0.1428680181503296, "num_tokens": 7901529.0, "step": 3885 }, { "entropy": 6.520000076293945, "epoch": 0.2276851038923032, "grad_norm": 1.03125, "learning_rate": 5.151833171547365e-05, "loss": 6.0581, "mean_token_accuracy": 0.15337249785661697, "num_tokens": 7911450.0, "step": 3890 }, { "entropy": 6.547474813461304, "epoch": 0.2279777582674861, "grad_norm": 1.0, "learning_rate": 5.1384763180783274e-05, "loss": 6.1113, "mean_token_accuracy": 0.14152408987283707, "num_tokens": 7921818.0, "step": 3895 }, { "entropy": 6.514422035217285, "epoch": 0.228270412642669, "grad_norm": 1.0546875, "learning_rate": 5.125732517076876e-05, "loss": 6.122, "mean_token_accuracy": 0.147258897125721, "num_tokens": 7932536.0, "step": 3900 }, { "entropy": 6.548322486877441, "epoch": 0.22856306701785192, "grad_norm": 0.92578125, "learning_rate": 5.113602117920747e-05, "loss": 6.0707, "mean_token_accuracy": 0.14353156685829163, "num_tokens": 7942670.0, "step": 3905 }, { "entropy": 6.488602018356323, "epoch": 0.22885572139303484, "grad_norm": 0.9140625, "learning_rate": 5.102085453170966e-05, "loss": 6.0588, "mean_token_accuracy": 0.15014715492725372, "num_tokens": 7953062.0, "step": 3910 }, { "entropy": 6.523296976089478, "epoch": 0.22914837576821773, "grad_norm": 0.94140625, "learning_rate": 5.091182838562709e-05, "loss": 6.0805, "mean_token_accuracy": 0.14354970976710318, "num_tokens": 7962662.0, "step": 3915 }, { "entropy": 6.518740224838257, "epoch": 0.22944103014340064, "grad_norm": 1.2578125, "learning_rate": 5.0808945729966716e-05, "loss": 6.1318, "mean_token_accuracy": 0.14812341034412385, "num_tokens": 7973056.0, "step": 3920 }, { "entropy": 6.492286205291748, "epoch": 0.22973368451858356, "grad_norm": 0.89453125, "learning_rate": 5.071220938530844e-05, "loss": 6.1913, "mean_token_accuracy": 0.1373046778142452, "num_tokens": 7984505.0, "step": 3925 }, { "entropy": 6.5712145328521725, "epoch": 0.23002633889376647, "grad_norm": 0.91015625, "learning_rate": 5.0621622003728026e-05, "loss": 6.1644, "mean_token_accuracy": 0.14012085124850274, "num_tokens": 7995214.0, "step": 3930 }, { "entropy": 6.585851430892944, "epoch": 0.23031899326894936, "grad_norm": 1.0234375, "learning_rate": 5.053718606872433e-05, "loss": 6.1835, "mean_token_accuracy": 0.13805864304304122, "num_tokens": 8005182.0, "step": 3935 }, { "entropy": 6.494110155105591, "epoch": 0.23061164764413228, "grad_norm": 0.875, "learning_rate": 5.0458903895151134e-05, "loss": 6.0789, "mean_token_accuracy": 0.14953414350748062, "num_tokens": 8015254.0, "step": 3940 }, { "entropy": 6.510751438140869, "epoch": 0.2309043020193152, "grad_norm": 0.9453125, "learning_rate": 5.038677762915381e-05, "loss": 6.0849, "mean_token_accuracy": 0.14497241526842117, "num_tokens": 8024969.0, "step": 3945 }, { "entropy": 6.4949976921081545, "epoch": 0.2311969563944981, "grad_norm": 0.9296875, "learning_rate": 5.032080924811033e-05, "loss": 6.0497, "mean_token_accuracy": 0.1528663694858551, "num_tokens": 8035196.0, "step": 3950 }, { "entropy": 6.503396224975586, "epoch": 0.231489610769681, "grad_norm": 0.9453125, "learning_rate": 5.026100056057718e-05, "loss": 5.9887, "mean_token_accuracy": 0.15598313584923745, "num_tokens": 8045173.0, "step": 3955 }, { "entropy": 6.500377941131592, "epoch": 0.2317822651448639, "grad_norm": 0.953125, "learning_rate": 5.0207353206239764e-05, "loss": 6.0021, "mean_token_accuracy": 0.15352306067943572, "num_tokens": 8054869.0, "step": 3960 }, { "entropy": 6.501126766204834, "epoch": 0.23207491952004683, "grad_norm": 0.90625, "learning_rate": 5.0159868655867436e-05, "loss": 6.139, "mean_token_accuracy": 0.1440998926758766, "num_tokens": 8065270.0, "step": 3965 }, { "entropy": 6.479627227783203, "epoch": 0.23236757389522975, "grad_norm": 1.015625, "learning_rate": 5.011854821127305e-05, "loss": 6.0968, "mean_token_accuracy": 0.15294173657894133, "num_tokens": 8076055.0, "step": 3970 }, { "entropy": 6.47863130569458, "epoch": 0.23266022827041263, "grad_norm": 0.953125, "learning_rate": 5.008339300527755e-05, "loss": 6.1103, "mean_token_accuracy": 0.14341337084770203, "num_tokens": 8086475.0, "step": 3975 }, { "entropy": 6.516302585601807, "epoch": 0.23295288264559555, "grad_norm": 1.0859375, "learning_rate": 5.005440400167859e-05, "loss": 6.0488, "mean_token_accuracy": 0.15071912258863449, "num_tokens": 8096329.0, "step": 3980 }, { "entropy": 6.499236059188843, "epoch": 0.23324553702077847, "grad_norm": 1.015625, "learning_rate": 5.003158199522442e-05, "loss": 6.0773, "mean_token_accuracy": 0.15228374749422074, "num_tokens": 8105828.0, "step": 3985 }, { "entropy": 6.504601383209229, "epoch": 0.23353819139596138, "grad_norm": 0.953125, "learning_rate": 5.0014927611591806e-05, "loss": 6.1655, "mean_token_accuracy": 0.14542120695114136, "num_tokens": 8116571.0, "step": 3990 }, { "entropy": 6.496879577636719, "epoch": 0.23383084577114427, "grad_norm": 1.0078125, "learning_rate": 5.000444130736916e-05, "loss": 6.0354, "mean_token_accuracy": 0.14901444911956788, "num_tokens": 8126615.0, "step": 3995 }, { "entropy": 6.509141159057617, "epoch": 0.23412350014632718, "grad_norm": 0.94140625, "learning_rate": 5.0000123370043736e-05, "loss": 6.1338, "mean_token_accuracy": 0.14680708646774293, "num_tokens": 8137367.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 1789578895196160.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }