{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.17559262510974538, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742143154144287, "epoch": 0.000292654375182909, "grad_norm": 5.34375, "learning_rate": 2e-06, "loss": 10.7851, "mean_token_accuracy": 7.092198356986045e-05, "num_tokens": 10253.0, "step": 5 }, { "entropy": 10.742099285125732, "epoch": 0.000585308750365818, "grad_norm": 5.09375, "learning_rate": 4.5e-06, "loss": 10.7585, "mean_token_accuracy": 7.072135922499001e-05, "num_tokens": 19586.0, "step": 10 }, { "entropy": 10.742091464996339, "epoch": 0.000877963125548727, "grad_norm": 5.71875, "learning_rate": 7e-06, "loss": 10.7338, "mean_token_accuracy": 0.0, "num_tokens": 28743.0, "step": 15 }, { "entropy": 10.742110919952392, "epoch": 0.001170617500731636, "grad_norm": 4.75, "learning_rate": 9.5e-06, "loss": 10.702, "mean_token_accuracy": 7.518797065131366e-05, "num_tokens": 39263.0, "step": 20 }, { "entropy": 10.7420015335083, "epoch": 0.0014632718759145448, "grad_norm": 5.0625, "learning_rate": 1.2e-05, "loss": 10.6176, "mean_token_accuracy": 0.00650847667711787, "num_tokens": 50195.0, "step": 25 }, { "entropy": 10.741524696350098, "epoch": 0.001755926251097454, "grad_norm": 4.5, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.04643158838152885, "num_tokens": 58982.0, "step": 30 }, { "entropy": 10.739701747894287, "epoch": 0.002048580626280363, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3385, "mean_token_accuracy": 0.04858696423470974, "num_tokens": 68619.0, "step": 35 }, { "entropy": 10.733176803588867, "epoch": 0.002341235001463272, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 10.1755, "mean_token_accuracy": 0.054676258191466334, "num_tokens": 78276.0, "step": 40 }, { "entropy": 10.719074249267578, "epoch": 0.0026338893766461808, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.085, "mean_token_accuracy": 0.05106211043894291, "num_tokens": 87977.0, "step": 45 }, { "entropy": 10.702382278442382, "epoch": 0.0029265437518290896, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.007, "mean_token_accuracy": 0.05418388731777668, "num_tokens": 97168.0, "step": 50 }, { "entropy": 10.688697719573975, "epoch": 0.003219198127011999, "grad_norm": 1.984375, "learning_rate": 2.7e-05, "loss": 9.978, "mean_token_accuracy": 0.0560054711997509, "num_tokens": 108162.0, "step": 55 }, { "entropy": 10.677631187438966, "epoch": 0.003511852502194908, "grad_norm": 1.9375, "learning_rate": 2.95e-05, "loss": 9.8907, "mean_token_accuracy": 0.05185089595615864, "num_tokens": 117963.0, "step": 60 }, { "entropy": 10.672104358673096, "epoch": 0.0038045068773778167, "grad_norm": 1.78125, "learning_rate": 3.2e-05, "loss": 9.8844, "mean_token_accuracy": 0.05049301944673061, "num_tokens": 128067.0, "step": 65 }, { "entropy": 10.665418434143067, "epoch": 0.004097161252560726, "grad_norm": 1.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8046, "mean_token_accuracy": 0.05261277854442596, "num_tokens": 138347.0, "step": 70 }, { "entropy": 10.655702877044678, "epoch": 0.004389815627743635, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7713, "mean_token_accuracy": 0.05200894549489021, "num_tokens": 148883.0, "step": 75 }, { "entropy": 10.648012065887452, "epoch": 0.004682470002926544, "grad_norm": 1.7734375, "learning_rate": 3.95e-05, "loss": 9.7304, "mean_token_accuracy": 0.053603590652346614, "num_tokens": 158416.0, "step": 80 }, { "entropy": 10.638986778259277, "epoch": 0.004975124378109453, "grad_norm": 1.8125, "learning_rate": 4.2000000000000004e-05, "loss": 9.624, "mean_token_accuracy": 0.056516367569565774, "num_tokens": 168380.0, "step": 85 }, { "entropy": 10.622650527954102, "epoch": 0.0052677787532923615, "grad_norm": 1.9375, "learning_rate": 4.45e-05, "loss": 9.5594, "mean_token_accuracy": 0.058524899929761884, "num_tokens": 178623.0, "step": 90 }, { "entropy": 10.598152160644531, "epoch": 0.00556043312847527, "grad_norm": 1.7421875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5209, "mean_token_accuracy": 0.05661297850310802, "num_tokens": 189058.0, "step": 95 }, { "entropy": 10.577679920196534, "epoch": 0.005853087503658179, "grad_norm": 1.6796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4548, "mean_token_accuracy": 0.056520416587591174, "num_tokens": 199465.0, "step": 100 }, { "entropy": 10.56387767791748, "epoch": 0.006145741878841089, "grad_norm": 1.6015625, "learning_rate": 5.2e-05, "loss": 9.4, "mean_token_accuracy": 0.054618718847632405, "num_tokens": 208712.0, "step": 105 }, { "entropy": 10.543546962738038, "epoch": 0.006438396254023998, "grad_norm": 1.484375, "learning_rate": 5.45e-05, "loss": 9.3224, "mean_token_accuracy": 0.05899658054113388, "num_tokens": 218557.0, "step": 110 }, { "entropy": 10.48940305709839, "epoch": 0.006731050629206907, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.2068, "mean_token_accuracy": 0.06870373338460922, "num_tokens": 228961.0, "step": 115 }, { "entropy": 10.402587509155273, "epoch": 0.007023705004389816, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 9.1227, "mean_token_accuracy": 0.06810536533594132, "num_tokens": 238987.0, "step": 120 }, { "entropy": 10.348681640625, "epoch": 0.0073163593795727245, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.0633, "mean_token_accuracy": 0.0605758685618639, "num_tokens": 249600.0, "step": 125 }, { "entropy": 10.30824089050293, "epoch": 0.007609013754755633, "grad_norm": 1.578125, "learning_rate": 6.450000000000001e-05, "loss": 8.8758, "mean_token_accuracy": 0.07409285828471183, "num_tokens": 259215.0, "step": 130 }, { "entropy": 10.212008476257324, "epoch": 0.007901668129938543, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.8303, "mean_token_accuracy": 0.06557713933289051, "num_tokens": 268888.0, "step": 135 }, { "entropy": 10.150605010986329, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.74, "mean_token_accuracy": 0.06668962053954601, "num_tokens": 278451.0, "step": 140 }, { "entropy": 10.055028533935547, "epoch": 0.008486976880304361, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.7012, "mean_token_accuracy": 0.06709126047790051, "num_tokens": 289577.0, "step": 145 }, { "entropy": 9.99300413131714, "epoch": 0.00877963125548727, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 8.5708, "mean_token_accuracy": 0.06588217578828334, "num_tokens": 299057.0, "step": 150 }, { "entropy": 9.817628383636475, "epoch": 0.009072285630670179, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.4885, "mean_token_accuracy": 0.06879487000405789, "num_tokens": 308802.0, "step": 155 }, { "entropy": 9.719903469085693, "epoch": 0.009364940005853088, "grad_norm": 0.98046875, "learning_rate": 7.950000000000001e-05, "loss": 8.3738, "mean_token_accuracy": 0.07012738101184368, "num_tokens": 317365.0, "step": 160 }, { "entropy": 9.5343448638916, "epoch": 0.009657594381035996, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.3035, "mean_token_accuracy": 0.07032971270382404, "num_tokens": 326927.0, "step": 165 }, { "entropy": 9.404919242858886, "epoch": 0.009950248756218905, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 8.317, "mean_token_accuracy": 0.06643726415932179, "num_tokens": 337408.0, "step": 170 }, { "entropy": 9.28181962966919, "epoch": 0.010242903131401814, "grad_norm": 0.79296875, "learning_rate": 8.7e-05, "loss": 8.2328, "mean_token_accuracy": 0.06949336491525174, "num_tokens": 348282.0, "step": 175 }, { "entropy": 9.099757957458497, "epoch": 0.010535557506584723, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 8.1847, "mean_token_accuracy": 0.06538042239844799, "num_tokens": 357767.0, "step": 180 }, { "entropy": 8.947648048400879, "epoch": 0.010828211881767632, "grad_norm": 0.77734375, "learning_rate": 9.2e-05, "loss": 8.1401, "mean_token_accuracy": 0.07173748835921287, "num_tokens": 368665.0, "step": 185 }, { "entropy": 8.832690525054932, "epoch": 0.01112086625695054, "grad_norm": 1.1015625, "learning_rate": 9.45e-05, "loss": 8.125, "mean_token_accuracy": 0.0688393272459507, "num_tokens": 378741.0, "step": 190 }, { "entropy": 8.722904491424561, "epoch": 0.01141352063213345, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.1228, "mean_token_accuracy": 0.07389259040355682, "num_tokens": 388324.0, "step": 195 }, { "entropy": 8.738927555084228, "epoch": 0.011706175007316359, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 8.1796, "mean_token_accuracy": 0.06952995508909225, "num_tokens": 398450.0, "step": 200 }, { "entropy": 8.615283966064453, "epoch": 0.01199882938249927, "grad_norm": 0.8203125, "learning_rate": 0.000102, "loss": 8.0899, "mean_token_accuracy": 0.07332116328179836, "num_tokens": 408961.0, "step": 205 }, { "entropy": 8.581227874755859, "epoch": 0.012291483757682178, "grad_norm": 1.078125, "learning_rate": 0.00010449999999999999, "loss": 8.1226, "mean_token_accuracy": 0.0683289546519518, "num_tokens": 418517.0, "step": 210 }, { "entropy": 8.532517910003662, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.035, "mean_token_accuracy": 0.07064232043921947, "num_tokens": 428059.0, "step": 215 }, { "entropy": 8.60868797302246, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.0513, "mean_token_accuracy": 0.06911276690661908, "num_tokens": 438499.0, "step": 220 }, { "entropy": 8.50686674118042, "epoch": 0.013169446883230905, "grad_norm": 0.73046875, "learning_rate": 0.000112, "loss": 8.0542, "mean_token_accuracy": 0.06983353272080421, "num_tokens": 448761.0, "step": 225 }, { "entropy": 8.424305152893066, "epoch": 0.013462101258413814, "grad_norm": 0.77734375, "learning_rate": 0.0001145, "loss": 8.0471, "mean_token_accuracy": 0.07090565152466297, "num_tokens": 458386.0, "step": 230 }, { "entropy": 8.447117614746094, "epoch": 0.013754755633596722, "grad_norm": 0.765625, "learning_rate": 0.00011700000000000001, "loss": 7.991, "mean_token_accuracy": 0.06929317899048329, "num_tokens": 468198.0, "step": 235 }, { "entropy": 8.46488447189331, "epoch": 0.014047410008779631, "grad_norm": 0.7265625, "learning_rate": 0.00011949999999999999, "loss": 8.0203, "mean_token_accuracy": 0.07129090093076229, "num_tokens": 480142.0, "step": 240 }, { "entropy": 8.370715618133545, "epoch": 0.01434006438396254, "grad_norm": 0.79296875, "learning_rate": 0.000122, "loss": 7.8998, "mean_token_accuracy": 0.08097687140107154, "num_tokens": 490686.0, "step": 245 }, { "entropy": 8.408738231658935, "epoch": 0.014632718759145449, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 7.9758, "mean_token_accuracy": 0.07468959763646126, "num_tokens": 500099.0, "step": 250 }, { "entropy": 8.416247749328614, "epoch": 0.014925373134328358, "grad_norm": 0.8515625, "learning_rate": 0.000127, "loss": 7.9005, "mean_token_accuracy": 0.07769993916153908, "num_tokens": 509525.0, "step": 255 }, { "entropy": 8.347339820861816, "epoch": 0.015218027509511267, "grad_norm": 0.7421875, "learning_rate": 0.0001295, "loss": 7.8978, "mean_token_accuracy": 0.07274740003049374, "num_tokens": 520141.0, "step": 260 }, { "entropy": 8.357079029083252, "epoch": 0.015510681884694176, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 8.0384, "mean_token_accuracy": 0.06597915887832642, "num_tokens": 531645.0, "step": 265 }, { "entropy": 8.3228253364563, "epoch": 0.015803336259877086, "grad_norm": 0.8203125, "learning_rate": 0.00013450000000000002, "loss": 7.9109, "mean_token_accuracy": 0.07127318009734154, "num_tokens": 541779.0, "step": 270 }, { "entropy": 8.300227451324464, "epoch": 0.016095990635059995, "grad_norm": 0.82421875, "learning_rate": 0.00013700000000000002, "loss": 7.8871, "mean_token_accuracy": 0.07985152080655097, "num_tokens": 551770.0, "step": 275 }, { "entropy": 8.360063171386718, "epoch": 0.016388645010242904, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 7.8829, "mean_token_accuracy": 0.0752606987953186, "num_tokens": 561814.0, "step": 280 }, { "entropy": 8.235567474365235, "epoch": 0.016681299385425813, "grad_norm": 0.82421875, "learning_rate": 0.00014199999999999998, "loss": 7.9551, "mean_token_accuracy": 0.06852101050317287, "num_tokens": 571988.0, "step": 285 }, { "entropy": 8.42728681564331, "epoch": 0.016973953760608722, "grad_norm": 0.7109375, "learning_rate": 0.0001445, "loss": 7.9876, "mean_token_accuracy": 0.07176770456135273, "num_tokens": 582814.0, "step": 290 }, { "entropy": 8.26517457962036, "epoch": 0.01726660813579163, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 7.9178, "mean_token_accuracy": 0.07443804480135441, "num_tokens": 592301.0, "step": 295 }, { "entropy": 8.199700450897216, "epoch": 0.01755926251097454, "grad_norm": 0.80859375, "learning_rate": 0.0001495, "loss": 7.8119, "mean_token_accuracy": 0.077539586648345, "num_tokens": 602898.0, "step": 300 }, { "entropy": 8.289494514465332, "epoch": 0.01785191688615745, "grad_norm": 1.0546875, "learning_rate": 0.000152, "loss": 7.8914, "mean_token_accuracy": 0.07545375041663646, "num_tokens": 612731.0, "step": 305 }, { "entropy": 8.186264896392823, "epoch": 0.018144571261340357, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 7.843, "mean_token_accuracy": 0.07743252031505107, "num_tokens": 623067.0, "step": 310 }, { "entropy": 8.256502819061279, "epoch": 0.018437225636523266, "grad_norm": 0.76171875, "learning_rate": 0.000157, "loss": 7.8317, "mean_token_accuracy": 0.08097588121891022, "num_tokens": 633538.0, "step": 315 }, { "entropy": 8.319536399841308, "epoch": 0.018729880011706175, "grad_norm": 1.6484375, "learning_rate": 0.0001595, "loss": 7.8898, "mean_token_accuracy": 0.07923161759972572, "num_tokens": 643704.0, "step": 320 }, { "entropy": 8.158168601989747, "epoch": 0.019022534386889084, "grad_norm": 0.84375, "learning_rate": 0.000162, "loss": 7.9204, "mean_token_accuracy": 0.07442782260477543, "num_tokens": 653766.0, "step": 325 }, { "entropy": 8.432480907440185, "epoch": 0.019315188762071993, "grad_norm": 0.921875, "learning_rate": 0.00016450000000000001, "loss": 7.9175, "mean_token_accuracy": 0.07209107242524623, "num_tokens": 663289.0, "step": 330 }, { "entropy": 8.145325660705566, "epoch": 0.0196078431372549, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 7.8214, "mean_token_accuracy": 0.07566024884581565, "num_tokens": 673196.0, "step": 335 }, { "entropy": 8.328914070129395, "epoch": 0.01990049751243781, "grad_norm": 0.98046875, "learning_rate": 0.00016950000000000003, "loss": 7.8481, "mean_token_accuracy": 0.0807725053280592, "num_tokens": 682694.0, "step": 340 }, { "entropy": 8.15658712387085, "epoch": 0.02019315188762072, "grad_norm": 0.85546875, "learning_rate": 0.00017199999999999998, "loss": 7.8414, "mean_token_accuracy": 0.07744252718985081, "num_tokens": 692880.0, "step": 345 }, { "entropy": 8.265804481506347, "epoch": 0.02048580626280363, "grad_norm": 1.2109375, "learning_rate": 0.00017449999999999999, "loss": 7.9339, "mean_token_accuracy": 0.07408964931964875, "num_tokens": 703972.0, "step": 350 }, { "entropy": 8.137424850463868, "epoch": 0.020778460637986537, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 7.7467, "mean_token_accuracy": 0.07930146306753158, "num_tokens": 713571.0, "step": 355 }, { "entropy": 8.209496688842773, "epoch": 0.021071115013169446, "grad_norm": 0.93359375, "learning_rate": 0.0001795, "loss": 7.8355, "mean_token_accuracy": 0.08222270905971527, "num_tokens": 723642.0, "step": 360 }, { "entropy": 8.136897945404053, "epoch": 0.021363769388352355, "grad_norm": 0.9453125, "learning_rate": 0.000182, "loss": 7.8793, "mean_token_accuracy": 0.07310881391167641, "num_tokens": 733848.0, "step": 365 }, { "entropy": 8.176177358627319, "epoch": 0.021656423763535264, "grad_norm": 0.7265625, "learning_rate": 0.0001845, "loss": 7.6089, "mean_token_accuracy": 0.10752813518047333, "num_tokens": 743752.0, "step": 370 }, { "entropy": 8.144378280639648, "epoch": 0.021949078138718173, "grad_norm": 0.91796875, "learning_rate": 0.000187, "loss": 7.8031, "mean_token_accuracy": 0.08254543766379356, "num_tokens": 754145.0, "step": 375 }, { "entropy": 8.118795394897461, "epoch": 0.02224173251390108, "grad_norm": 0.765625, "learning_rate": 0.0001895, "loss": 7.766, "mean_token_accuracy": 0.07592462375760078, "num_tokens": 763930.0, "step": 380 }, { "entropy": 8.178821086883545, "epoch": 0.02253438688908399, "grad_norm": 1.015625, "learning_rate": 0.000192, "loss": 7.7934, "mean_token_accuracy": 0.08122270852327347, "num_tokens": 774851.0, "step": 385 }, { "entropy": 8.122542095184325, "epoch": 0.0228270412642669, "grad_norm": 0.80859375, "learning_rate": 0.0001945, "loss": 7.7915, "mean_token_accuracy": 0.07377454079687595, "num_tokens": 784251.0, "step": 390 }, { "entropy": 8.100419902801514, "epoch": 0.023119695639449808, "grad_norm": 0.92578125, "learning_rate": 0.00019700000000000002, "loss": 7.8395, "mean_token_accuracy": 0.0817381426692009, "num_tokens": 794089.0, "step": 395 }, { "entropy": 8.19840030670166, "epoch": 0.023412350014632717, "grad_norm": 0.8671875, "learning_rate": 0.00019950000000000002, "loss": 7.8242, "mean_token_accuracy": 0.07439705729484558, "num_tokens": 805274.0, "step": 400 }, { "entropy": 8.17535228729248, "epoch": 0.02370500438981563, "grad_norm": 0.8515625, "learning_rate": 0.000202, "loss": 7.7672, "mean_token_accuracy": 0.07779609337449074, "num_tokens": 816036.0, "step": 405 }, { "entropy": 8.004063892364503, "epoch": 0.02399765876499854, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.7613, "mean_token_accuracy": 0.07725987881422043, "num_tokens": 826393.0, "step": 410 }, { "entropy": 8.159784364700318, "epoch": 0.024290313140181447, "grad_norm": 0.87109375, "learning_rate": 0.000207, "loss": 7.7542, "mean_token_accuracy": 0.0782277960330248, "num_tokens": 836456.0, "step": 415 }, { "entropy": 8.072831869125366, "epoch": 0.024582967515364356, "grad_norm": 0.8125, "learning_rate": 0.0002095, "loss": 7.759, "mean_token_accuracy": 0.07723330594599247, "num_tokens": 846493.0, "step": 420 }, { "entropy": 8.16247329711914, "epoch": 0.024875621890547265, "grad_norm": 0.8125, "learning_rate": 0.000212, "loss": 7.7584, "mean_token_accuracy": 0.07505144067108631, "num_tokens": 857041.0, "step": 425 }, { "entropy": 7.9756200313568115, "epoch": 0.025168276265730174, "grad_norm": 0.92578125, "learning_rate": 0.0002145, "loss": 7.6788, "mean_token_accuracy": 0.08394450098276138, "num_tokens": 867053.0, "step": 430 }, { "entropy": 8.086863994598389, "epoch": 0.025460930640913083, "grad_norm": 0.9921875, "learning_rate": 0.00021700000000000002, "loss": 7.7398, "mean_token_accuracy": 0.0781655989587307, "num_tokens": 876944.0, "step": 435 }, { "entropy": 8.080809020996094, "epoch": 0.02575358501609599, "grad_norm": 0.828125, "learning_rate": 0.0002195, "loss": 7.6902, "mean_token_accuracy": 0.08105823285877704, "num_tokens": 887257.0, "step": 440 }, { "entropy": 8.091656923294067, "epoch": 0.0260462393912789, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 7.7086, "mean_token_accuracy": 0.0815083347260952, "num_tokens": 896877.0, "step": 445 }, { "entropy": 8.037679195404053, "epoch": 0.02633889376646181, "grad_norm": 0.83203125, "learning_rate": 0.0002245, "loss": 7.6096, "mean_token_accuracy": 0.08536934405565262, "num_tokens": 906930.0, "step": 450 }, { "entropy": 8.04052267074585, "epoch": 0.026631548141644718, "grad_norm": 0.8515625, "learning_rate": 0.00022700000000000002, "loss": 7.7471, "mean_token_accuracy": 0.07020874097943305, "num_tokens": 916841.0, "step": 455 }, { "entropy": 8.061063146591186, "epoch": 0.026924202516827627, "grad_norm": 0.7890625, "learning_rate": 0.00022950000000000002, "loss": 7.6914, "mean_token_accuracy": 0.07996720150113105, "num_tokens": 927024.0, "step": 460 }, { "entropy": 8.085123777389526, "epoch": 0.027216856892010536, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.7227, "mean_token_accuracy": 0.07815472632646561, "num_tokens": 935786.0, "step": 465 }, { "entropy": 7.955375385284424, "epoch": 0.027509511267193445, "grad_norm": 0.8359375, "learning_rate": 0.00023449999999999998, "loss": 7.6349, "mean_token_accuracy": 0.08305523693561553, "num_tokens": 946819.0, "step": 470 }, { "entropy": 8.01088285446167, "epoch": 0.027802165642376354, "grad_norm": 0.84375, "learning_rate": 0.000237, "loss": 7.6793, "mean_token_accuracy": 0.08371292352676392, "num_tokens": 957876.0, "step": 475 }, { "entropy": 8.070115327835083, "epoch": 0.028094820017559263, "grad_norm": 0.9765625, "learning_rate": 0.0002395, "loss": 7.7627, "mean_token_accuracy": 0.07754282280802727, "num_tokens": 969211.0, "step": 480 }, { "entropy": 8.086713933944703, "epoch": 0.02838747439274217, "grad_norm": 0.89453125, "learning_rate": 0.000242, "loss": 7.7091, "mean_token_accuracy": 0.07998017743229865, "num_tokens": 979090.0, "step": 485 }, { "entropy": 8.120463180541993, "epoch": 0.02868012876792508, "grad_norm": 0.8984375, "learning_rate": 0.0002445, "loss": 7.7649, "mean_token_accuracy": 0.07725568227469921, "num_tokens": 990510.0, "step": 490 }, { "entropy": 8.065446138381958, "epoch": 0.02897278314310799, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.6837, "mean_token_accuracy": 0.07927028760313988, "num_tokens": 1000890.0, "step": 495 }, { "entropy": 7.89040241241455, "epoch": 0.029265437518290898, "grad_norm": 0.9296875, "learning_rate": 0.0002495, "loss": 7.633, "mean_token_accuracy": 0.08539719134569168, "num_tokens": 1011019.0, "step": 500 }, { "entropy": 8.053290367126465, "epoch": 0.029558091893473807, "grad_norm": 0.9296875, "learning_rate": 0.000252, "loss": 7.5976, "mean_token_accuracy": 0.0852201983332634, "num_tokens": 1020703.0, "step": 505 }, { "entropy": 7.924099731445312, "epoch": 0.029850746268656716, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.6144, "mean_token_accuracy": 0.08518284186720848, "num_tokens": 1030539.0, "step": 510 }, { "entropy": 7.876818609237671, "epoch": 0.030143400643839625, "grad_norm": 0.8984375, "learning_rate": 0.000257, "loss": 7.6173, "mean_token_accuracy": 0.07879232838749886, "num_tokens": 1040977.0, "step": 515 }, { "entropy": 7.9826685905456545, "epoch": 0.030436055019022534, "grad_norm": 1.0234375, "learning_rate": 0.0002595, "loss": 7.5867, "mean_token_accuracy": 0.08224296122789383, "num_tokens": 1050382.0, "step": 520 }, { "entropy": 7.914853572845459, "epoch": 0.030728709394205442, "grad_norm": 0.8984375, "learning_rate": 0.000262, "loss": 7.5776, "mean_token_accuracy": 0.08655883669853211, "num_tokens": 1062287.0, "step": 525 }, { "entropy": 7.873267793655396, "epoch": 0.03102136376938835, "grad_norm": 0.98828125, "learning_rate": 0.00026450000000000003, "loss": 7.5624, "mean_token_accuracy": 0.0834833487868309, "num_tokens": 1072138.0, "step": 530 }, { "entropy": 8.053305435180665, "epoch": 0.031314018144571264, "grad_norm": 0.9453125, "learning_rate": 0.00026700000000000004, "loss": 7.5478, "mean_token_accuracy": 0.08701685890555381, "num_tokens": 1082730.0, "step": 535 }, { "entropy": 7.881413888931275, "epoch": 0.03160667251975417, "grad_norm": 1.0546875, "learning_rate": 0.00026950000000000005, "loss": 7.5191, "mean_token_accuracy": 0.08792314156889916, "num_tokens": 1093409.0, "step": 540 }, { "entropy": 7.940295267105102, "epoch": 0.03189932689493708, "grad_norm": 0.890625, "learning_rate": 0.00027200000000000005, "loss": 7.6596, "mean_token_accuracy": 0.08377403020858765, "num_tokens": 1103817.0, "step": 545 }, { "entropy": 7.939820003509522, "epoch": 0.03219198127011999, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.6265, "mean_token_accuracy": 0.07738926894962787, "num_tokens": 1114392.0, "step": 550 }, { "entropy": 7.96156415939331, "epoch": 0.0324846356453029, "grad_norm": 1.015625, "learning_rate": 0.000277, "loss": 7.5224, "mean_token_accuracy": 0.08881102874875069, "num_tokens": 1124539.0, "step": 555 }, { "entropy": 7.832987546920776, "epoch": 0.03277729002048581, "grad_norm": 1.171875, "learning_rate": 0.0002795, "loss": 7.5564, "mean_token_accuracy": 0.08254684880375862, "num_tokens": 1135110.0, "step": 560 }, { "entropy": 7.855937910079956, "epoch": 0.03306994439566872, "grad_norm": 1.03125, "learning_rate": 0.00028199999999999997, "loss": 7.5979, "mean_token_accuracy": 0.08505113944411277, "num_tokens": 1145458.0, "step": 565 }, { "entropy": 7.951333904266358, "epoch": 0.033362598770851626, "grad_norm": 0.98046875, "learning_rate": 0.0002845, "loss": 7.5383, "mean_token_accuracy": 0.08062238246202469, "num_tokens": 1155754.0, "step": 570 }, { "entropy": 7.8793701171875, "epoch": 0.033655253146034535, "grad_norm": 0.8984375, "learning_rate": 0.000287, "loss": 7.5816, "mean_token_accuracy": 0.082074723392725, "num_tokens": 1165771.0, "step": 575 }, { "entropy": 7.901887035369873, "epoch": 0.033947907521217444, "grad_norm": 1.015625, "learning_rate": 0.0002895, "loss": 7.534, "mean_token_accuracy": 0.08429761826992035, "num_tokens": 1175785.0, "step": 580 }, { "entropy": 7.887288761138916, "epoch": 0.03424056189640035, "grad_norm": 0.9375, "learning_rate": 0.000292, "loss": 7.5557, "mean_token_accuracy": 0.08287644758820534, "num_tokens": 1186252.0, "step": 585 }, { "entropy": 7.767520141601563, "epoch": 0.03453321627158326, "grad_norm": 0.890625, "learning_rate": 0.0002945, "loss": 7.5037, "mean_token_accuracy": 0.08624404892325402, "num_tokens": 1196800.0, "step": 590 }, { "entropy": 7.92415132522583, "epoch": 0.03482587064676617, "grad_norm": 0.86328125, "learning_rate": 0.000297, "loss": 7.4895, "mean_token_accuracy": 0.08825775608420372, "num_tokens": 1207794.0, "step": 595 }, { "entropy": 7.7734299659729, "epoch": 0.03511852502194908, "grad_norm": 0.9453125, "learning_rate": 0.0002995, "loss": 7.4153, "mean_token_accuracy": 0.08845552653074265, "num_tokens": 1217029.0, "step": 600 }, { "entropy": 7.832931613922119, "epoch": 0.03541117939713199, "grad_norm": 1.0625, "learning_rate": 0.000302, "loss": 7.3933, "mean_token_accuracy": 0.09399922043085099, "num_tokens": 1227917.0, "step": 605 }, { "entropy": 7.771529722213745, "epoch": 0.0357038337723149, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 7.4464, "mean_token_accuracy": 0.08992072939872742, "num_tokens": 1238495.0, "step": 610 }, { "entropy": 7.831154489517212, "epoch": 0.035996488147497806, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.4915, "mean_token_accuracy": 0.08896522894501686, "num_tokens": 1249649.0, "step": 615 }, { "entropy": 7.815850448608399, "epoch": 0.036289142522680715, "grad_norm": 0.9296875, "learning_rate": 0.0003095, "loss": 7.5417, "mean_token_accuracy": 0.08101370558142662, "num_tokens": 1260937.0, "step": 620 }, { "entropy": 7.813495063781739, "epoch": 0.036581796897863623, "grad_norm": 0.96484375, "learning_rate": 0.000312, "loss": 7.3702, "mean_token_accuracy": 0.09065580368041992, "num_tokens": 1270751.0, "step": 625 }, { "entropy": 7.818518209457397, "epoch": 0.03687445127304653, "grad_norm": 0.8671875, "learning_rate": 0.0003145, "loss": 7.4965, "mean_token_accuracy": 0.0885044053196907, "num_tokens": 1282383.0, "step": 630 }, { "entropy": 7.83252854347229, "epoch": 0.03716710564822944, "grad_norm": 0.96484375, "learning_rate": 0.000317, "loss": 7.3179, "mean_token_accuracy": 0.1026477910578251, "num_tokens": 1292320.0, "step": 635 }, { "entropy": 7.6734686374664305, "epoch": 0.03745976002341235, "grad_norm": 0.91796875, "learning_rate": 0.0003195, "loss": 7.4792, "mean_token_accuracy": 0.08322202041745186, "num_tokens": 1303054.0, "step": 640 }, { "entropy": 7.8633969783782955, "epoch": 0.03775241439859526, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 7.4465, "mean_token_accuracy": 0.08914806470274925, "num_tokens": 1311607.0, "step": 645 }, { "entropy": 7.689844703674316, "epoch": 0.03804506877377817, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.4234, "mean_token_accuracy": 0.08909434452652931, "num_tokens": 1321930.0, "step": 650 }, { "entropy": 7.8022431373596195, "epoch": 0.03833772314896108, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 7.4465, "mean_token_accuracy": 0.08396812826395035, "num_tokens": 1331533.0, "step": 655 }, { "entropy": 7.769197797775268, "epoch": 0.038630377524143986, "grad_norm": 0.87890625, "learning_rate": 0.00032950000000000004, "loss": 7.4086, "mean_token_accuracy": 0.08934582769870758, "num_tokens": 1341961.0, "step": 660 }, { "entropy": 7.769333171844482, "epoch": 0.038923031899326895, "grad_norm": 0.984375, "learning_rate": 0.00033200000000000005, "loss": 7.4375, "mean_token_accuracy": 0.08935849741101265, "num_tokens": 1352741.0, "step": 665 }, { "entropy": 7.791517686843872, "epoch": 0.0392156862745098, "grad_norm": 0.96875, "learning_rate": 0.00033450000000000005, "loss": 7.432, "mean_token_accuracy": 0.08128280714154243, "num_tokens": 1363467.0, "step": 670 }, { "entropy": 7.691935110092163, "epoch": 0.03950834064969271, "grad_norm": 0.984375, "learning_rate": 0.000337, "loss": 7.3877, "mean_token_accuracy": 0.09103676527738572, "num_tokens": 1372759.0, "step": 675 }, { "entropy": 7.6941760063171385, "epoch": 0.03980099502487562, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.3855, "mean_token_accuracy": 0.09363519176840782, "num_tokens": 1382785.0, "step": 680 }, { "entropy": 7.757591485977173, "epoch": 0.04009364940005853, "grad_norm": 0.94140625, "learning_rate": 0.000342, "loss": 7.4335, "mean_token_accuracy": 0.0862673670053482, "num_tokens": 1392748.0, "step": 685 }, { "entropy": 7.777906894683838, "epoch": 0.04038630377524144, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 7.4677, "mean_token_accuracy": 0.08610242903232575, "num_tokens": 1402473.0, "step": 690 }, { "entropy": 7.787166547775269, "epoch": 0.04067895815042435, "grad_norm": 0.84765625, "learning_rate": 0.000347, "loss": 7.439, "mean_token_accuracy": 0.08554250001907349, "num_tokens": 1413921.0, "step": 695 }, { "entropy": 7.736286449432373, "epoch": 0.04097161252560726, "grad_norm": 0.94140625, "learning_rate": 0.0003495, "loss": 7.4369, "mean_token_accuracy": 0.0805517353117466, "num_tokens": 1424687.0, "step": 700 }, { "entropy": 7.767450380325317, "epoch": 0.041264266900790166, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.4388, "mean_token_accuracy": 0.08601183965802192, "num_tokens": 1435153.0, "step": 705 }, { "entropy": 7.794674873352051, "epoch": 0.041556921275973074, "grad_norm": 0.8828125, "learning_rate": 0.0003545, "loss": 7.4462, "mean_token_accuracy": 0.0846464328467846, "num_tokens": 1446187.0, "step": 710 }, { "entropy": 7.755715560913086, "epoch": 0.04184957565115598, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.396, "mean_token_accuracy": 0.08824568465352059, "num_tokens": 1456299.0, "step": 715 }, { "entropy": 7.5965576171875, "epoch": 0.04214223002633889, "grad_norm": 1.0703125, "learning_rate": 0.0003595, "loss": 7.3017, "mean_token_accuracy": 0.09606124758720398, "num_tokens": 1465654.0, "step": 720 }, { "entropy": 7.70619683265686, "epoch": 0.0424348844015218, "grad_norm": 1.078125, "learning_rate": 0.000362, "loss": 7.3563, "mean_token_accuracy": 0.09394391924142838, "num_tokens": 1475248.0, "step": 725 }, { "entropy": 7.698731327056885, "epoch": 0.04272753877670471, "grad_norm": 0.9296875, "learning_rate": 0.0003645, "loss": 7.4247, "mean_token_accuracy": 0.08578455671668053, "num_tokens": 1485570.0, "step": 730 }, { "entropy": 7.636994504928589, "epoch": 0.04302019315188762, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.3294, "mean_token_accuracy": 0.09238605126738549, "num_tokens": 1495257.0, "step": 735 }, { "entropy": 7.687747764587402, "epoch": 0.04331284752707053, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.3467, "mean_token_accuracy": 0.08985281139612197, "num_tokens": 1504882.0, "step": 740 }, { "entropy": 7.706828022003174, "epoch": 0.043605501902253437, "grad_norm": 0.83203125, "learning_rate": 0.000372, "loss": 7.3918, "mean_token_accuracy": 0.08691600039601326, "num_tokens": 1515791.0, "step": 745 }, { "entropy": 7.595960521697998, "epoch": 0.043898156277436345, "grad_norm": 0.87109375, "learning_rate": 0.0003745, "loss": 7.3055, "mean_token_accuracy": 0.09265599772334099, "num_tokens": 1527837.0, "step": 750 }, { "entropy": 7.674931144714355, "epoch": 0.044190810652619254, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 7.3197, "mean_token_accuracy": 0.09090850502252579, "num_tokens": 1538357.0, "step": 755 }, { "entropy": 7.597537708282471, "epoch": 0.04448346502780216, "grad_norm": 1.1953125, "learning_rate": 0.0003795, "loss": 7.318, "mean_token_accuracy": 0.09620778560638428, "num_tokens": 1548140.0, "step": 760 }, { "entropy": 7.655205726623535, "epoch": 0.04477611940298507, "grad_norm": 0.828125, "learning_rate": 0.000382, "loss": 7.3052, "mean_token_accuracy": 0.09487425237894058, "num_tokens": 1558723.0, "step": 765 }, { "entropy": 7.604353332519532, "epoch": 0.04506877377816798, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.3288, "mean_token_accuracy": 0.08416497483849525, "num_tokens": 1568519.0, "step": 770 }, { "entropy": 7.608450269699096, "epoch": 0.04536142815335089, "grad_norm": 1.1171875, "learning_rate": 0.00038700000000000003, "loss": 7.2961, "mean_token_accuracy": 0.09094355553388596, "num_tokens": 1578788.0, "step": 775 }, { "entropy": 7.620551347732544, "epoch": 0.0456540825285338, "grad_norm": 1.0234375, "learning_rate": 0.00038950000000000003, "loss": 7.2536, "mean_token_accuracy": 0.09547285735607147, "num_tokens": 1588593.0, "step": 780 }, { "entropy": 7.534824514389038, "epoch": 0.04594673690371671, "grad_norm": 0.9609375, "learning_rate": 0.00039200000000000004, "loss": 7.2914, "mean_token_accuracy": 0.08960797935724259, "num_tokens": 1598657.0, "step": 785 }, { "entropy": 7.504811525344849, "epoch": 0.046239391278899616, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.2001, "mean_token_accuracy": 0.09868146777153015, "num_tokens": 1608825.0, "step": 790 }, { "entropy": 7.5206996440887455, "epoch": 0.046532045654082525, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 7.2045, "mean_token_accuracy": 0.09371785670518876, "num_tokens": 1618733.0, "step": 795 }, { "entropy": 7.602302169799804, "epoch": 0.046824700029265434, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 7.2273, "mean_token_accuracy": 0.09687273427844048, "num_tokens": 1628728.0, "step": 800 }, { "entropy": 7.53294186592102, "epoch": 0.04711735440444834, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 7.3064, "mean_token_accuracy": 0.0901516005396843, "num_tokens": 1639016.0, "step": 805 }, { "entropy": 7.574016046524048, "epoch": 0.04741000877963126, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.297, "mean_token_accuracy": 0.0918840229511261, "num_tokens": 1649386.0, "step": 810 }, { "entropy": 7.666880130767822, "epoch": 0.04770266315481417, "grad_norm": 0.98828125, "learning_rate": 0.00040699999999999997, "loss": 7.2977, "mean_token_accuracy": 0.09063222482800484, "num_tokens": 1659949.0, "step": 815 }, { "entropy": 7.555622291564942, "epoch": 0.04799531752999708, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 7.2765, "mean_token_accuracy": 0.09335207715630531, "num_tokens": 1670035.0, "step": 820 }, { "entropy": 7.611965894699097, "epoch": 0.048287971905179985, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.2132, "mean_token_accuracy": 0.08826020434498787, "num_tokens": 1679579.0, "step": 825 }, { "entropy": 7.441506242752075, "epoch": 0.048580626280362894, "grad_norm": 1.0625, "learning_rate": 0.0004145, "loss": 7.196, "mean_token_accuracy": 0.09741625487804413, "num_tokens": 1689900.0, "step": 830 }, { "entropy": 7.5691015243530275, "epoch": 0.0488732806555458, "grad_norm": 0.953125, "learning_rate": 0.000417, "loss": 7.2469, "mean_token_accuracy": 0.09050429165363312, "num_tokens": 1700534.0, "step": 835 }, { "entropy": 7.547771167755127, "epoch": 0.04916593503072871, "grad_norm": 0.90234375, "learning_rate": 0.0004195, "loss": 7.1963, "mean_token_accuracy": 0.09931469187140465, "num_tokens": 1710969.0, "step": 840 }, { "entropy": 7.454426383972168, "epoch": 0.04945858940591162, "grad_norm": 1.0234375, "learning_rate": 0.000422, "loss": 7.2267, "mean_token_accuracy": 0.09168547242879868, "num_tokens": 1721024.0, "step": 845 }, { "entropy": 7.430084466934204, "epoch": 0.04975124378109453, "grad_norm": 1.0859375, "learning_rate": 0.0004245, "loss": 7.1318, "mean_token_accuracy": 0.09713169336318969, "num_tokens": 1730197.0, "step": 850 }, { "entropy": 7.452590370178223, "epoch": 0.05004389815627744, "grad_norm": 1.125, "learning_rate": 0.000427, "loss": 7.1541, "mean_token_accuracy": 0.09219018146395683, "num_tokens": 1741132.0, "step": 855 }, { "entropy": 7.521068334579468, "epoch": 0.05033655253146035, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 7.2637, "mean_token_accuracy": 0.08954514041543007, "num_tokens": 1751757.0, "step": 860 }, { "entropy": 7.495842170715332, "epoch": 0.050629206906643257, "grad_norm": 0.9921875, "learning_rate": 0.000432, "loss": 7.1582, "mean_token_accuracy": 0.09514842405915261, "num_tokens": 1762779.0, "step": 865 }, { "entropy": 7.475547981262207, "epoch": 0.050921861281826165, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 7.1182, "mean_token_accuracy": 0.09630650877952576, "num_tokens": 1772353.0, "step": 870 }, { "entropy": 7.352218437194824, "epoch": 0.051214515657009074, "grad_norm": 0.94140625, "learning_rate": 0.000437, "loss": 7.145, "mean_token_accuracy": 0.09995641633868217, "num_tokens": 1782648.0, "step": 875 }, { "entropy": 7.392671585083008, "epoch": 0.05150717003219198, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 7.1484, "mean_token_accuracy": 0.09772149994969367, "num_tokens": 1792275.0, "step": 880 }, { "entropy": 7.387517881393433, "epoch": 0.05179982440737489, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 7.1486, "mean_token_accuracy": 0.09331418126821518, "num_tokens": 1803244.0, "step": 885 }, { "entropy": 7.4635416030883786, "epoch": 0.0520924787825578, "grad_norm": 0.86328125, "learning_rate": 0.0004445, "loss": 7.1907, "mean_token_accuracy": 0.09984328448772431, "num_tokens": 1814331.0, "step": 890 }, { "entropy": 7.442190837860108, "epoch": 0.05238513315774071, "grad_norm": 0.9921875, "learning_rate": 0.000447, "loss": 7.1557, "mean_token_accuracy": 0.09669465869665146, "num_tokens": 1823022.0, "step": 895 }, { "entropy": 7.4167015075683596, "epoch": 0.05267778753292362, "grad_norm": 0.9453125, "learning_rate": 0.00044950000000000003, "loss": 7.2017, "mean_token_accuracy": 0.09253377318382264, "num_tokens": 1834416.0, "step": 900 }, { "entropy": 7.530139684677124, "epoch": 0.05297044190810653, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.1951, "mean_token_accuracy": 0.09366482645273208, "num_tokens": 1843507.0, "step": 905 }, { "entropy": 7.3420909404754635, "epoch": 0.053263096283289436, "grad_norm": 0.98828125, "learning_rate": 0.00045450000000000004, "loss": 7.0998, "mean_token_accuracy": 0.09217809438705445, "num_tokens": 1854149.0, "step": 910 }, { "entropy": 7.416664695739746, "epoch": 0.053555750658472345, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 7.1686, "mean_token_accuracy": 0.09251093789935112, "num_tokens": 1864257.0, "step": 915 }, { "entropy": 7.437055015563965, "epoch": 0.053848405033655254, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.1707, "mean_token_accuracy": 0.09187378212809563, "num_tokens": 1873353.0, "step": 920 }, { "entropy": 7.3977635383605955, "epoch": 0.05414105940883816, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 7.1196, "mean_token_accuracy": 0.09563436955213547, "num_tokens": 1884465.0, "step": 925 }, { "entropy": 7.365432357788086, "epoch": 0.05443371378402107, "grad_norm": 0.96875, "learning_rate": 0.0004645, "loss": 7.1528, "mean_token_accuracy": 0.09838449805974961, "num_tokens": 1894872.0, "step": 930 }, { "entropy": 7.34838981628418, "epoch": 0.05472636815920398, "grad_norm": 1.0390625, "learning_rate": 0.000467, "loss": 7.0706, "mean_token_accuracy": 0.10180790275335312, "num_tokens": 1905440.0, "step": 935 }, { "entropy": 7.341986465454101, "epoch": 0.05501902253438689, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.1291, "mean_token_accuracy": 0.09645774215459824, "num_tokens": 1916861.0, "step": 940 }, { "entropy": 7.406238269805908, "epoch": 0.0553116769095698, "grad_norm": 1.1015625, "learning_rate": 0.000472, "loss": 7.0654, "mean_token_accuracy": 0.10491539835929871, "num_tokens": 1927144.0, "step": 945 }, { "entropy": 7.35713381767273, "epoch": 0.05560433128475271, "grad_norm": 0.88671875, "learning_rate": 0.0004745, "loss": 7.138, "mean_token_accuracy": 0.0931523747742176, "num_tokens": 1937174.0, "step": 950 }, { "entropy": 7.403324699401855, "epoch": 0.055896985659935616, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 7.0506, "mean_token_accuracy": 0.11088272705674171, "num_tokens": 1947510.0, "step": 955 }, { "entropy": 7.305504369735718, "epoch": 0.056189640035118525, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 7.1238, "mean_token_accuracy": 0.09536927789449692, "num_tokens": 1957894.0, "step": 960 }, { "entropy": 7.445551156997681, "epoch": 0.056482294410301434, "grad_norm": 0.95703125, "learning_rate": 0.000482, "loss": 7.1862, "mean_token_accuracy": 0.09522910863161087, "num_tokens": 1968670.0, "step": 965 }, { "entropy": 7.351961517333985, "epoch": 0.05677494878548434, "grad_norm": 0.8828125, "learning_rate": 0.0004845, "loss": 7.1451, "mean_token_accuracy": 0.09402441680431366, "num_tokens": 1979678.0, "step": 970 }, { "entropy": 7.329155683517456, "epoch": 0.05706760316066725, "grad_norm": 0.9296875, "learning_rate": 0.000487, "loss": 7.0501, "mean_token_accuracy": 0.10141415372490883, "num_tokens": 1990161.0, "step": 975 }, { "entropy": 7.408869028091431, "epoch": 0.05736025753585016, "grad_norm": 0.98046875, "learning_rate": 0.0004895, "loss": 7.1421, "mean_token_accuracy": 0.09915417581796646, "num_tokens": 2000298.0, "step": 980 }, { "entropy": 7.386150693893432, "epoch": 0.05765291191103307, "grad_norm": 1.109375, "learning_rate": 0.000492, "loss": 7.101, "mean_token_accuracy": 0.0987740397453308, "num_tokens": 2009946.0, "step": 985 }, { "entropy": 7.297941255569458, "epoch": 0.05794556628621598, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 7.064, "mean_token_accuracy": 0.09957554042339326, "num_tokens": 2019192.0, "step": 990 }, { "entropy": 7.343301391601562, "epoch": 0.05823822066139889, "grad_norm": 0.9140625, "learning_rate": 0.000497, "loss": 7.1112, "mean_token_accuracy": 0.09475254267454147, "num_tokens": 2029066.0, "step": 995 }, { "entropy": 7.356789922714233, "epoch": 0.058530875036581796, "grad_norm": 0.94921875, "learning_rate": 0.0004995, "loss": 7.1051, "mean_token_accuracy": 0.09616579562425613, "num_tokens": 2040610.0, "step": 1000 }, { "entropy": 7.330273389816284, "epoch": 0.058823529411764705, "grad_norm": 1.1171875, "learning_rate": 0.000499998026082006, "loss": 7.105, "mean_token_accuracy": 0.0943969689309597, "num_tokens": 2049867.0, "step": 1005 }, { "entropy": 7.243909168243408, "epoch": 0.059116183786947614, "grad_norm": 0.98046875, "learning_rate": 0.0004999900070995136, "loss": 7.0949, "mean_token_accuracy": 0.09849751815199852, "num_tokens": 2059335.0, "step": 1010 }, { "entropy": 7.482809591293335, "epoch": 0.05940883816213052, "grad_norm": 1.15625, "learning_rate": 0.0004999758199023239, "loss": 7.0991, "mean_token_accuracy": 0.09777801483869553, "num_tokens": 2069498.0, "step": 1015 }, { "entropy": 7.322924661636352, "epoch": 0.05970149253731343, "grad_norm": 1.0703125, "learning_rate": 0.0004999554648793858, "loss": 7.1122, "mean_token_accuracy": 0.10163608714938163, "num_tokens": 2080077.0, "step": 1020 }, { "entropy": 7.265040874481201, "epoch": 0.05999414691249634, "grad_norm": 0.9296875, "learning_rate": 0.0004999289425887425, "loss": 7.0334, "mean_token_accuracy": 0.10056126862764359, "num_tokens": 2089699.0, "step": 1025 }, { "entropy": 7.259469652175904, "epoch": 0.06028680128767925, "grad_norm": 1.578125, "learning_rate": 0.0004998962537575161, "loss": 7.0509, "mean_token_accuracy": 0.09879743158817292, "num_tokens": 2099219.0, "step": 1030 }, { "entropy": 7.274491453170777, "epoch": 0.06057945566286216, "grad_norm": 0.91796875, "learning_rate": 0.0004998573992818874, "loss": 7.0268, "mean_token_accuracy": 0.10193772837519646, "num_tokens": 2109218.0, "step": 1035 }, { "entropy": 7.383116436004639, "epoch": 0.06087211003804507, "grad_norm": 1.0078125, "learning_rate": 0.0004998123802270715, "loss": 7.0793, "mean_token_accuracy": 0.09875930175185203, "num_tokens": 2118384.0, "step": 1040 }, { "entropy": 7.2731462001800535, "epoch": 0.061164764413227976, "grad_norm": 1.046875, "learning_rate": 0.0004997611978272886, "loss": 7.0464, "mean_token_accuracy": 0.10151882916688919, "num_tokens": 2127017.0, "step": 1045 }, { "entropy": 7.3074544906616214, "epoch": 0.061457418788410885, "grad_norm": 0.98046875, "learning_rate": 0.0004997038534857298, "loss": 7.1195, "mean_token_accuracy": 0.09616761356592178, "num_tokens": 2137568.0, "step": 1050 }, { "entropy": 7.266034030914307, "epoch": 0.061750073163593794, "grad_norm": 0.9609375, "learning_rate": 0.0004996403487745194, "loss": 7.0254, "mean_token_accuracy": 0.09843881577253341, "num_tokens": 2147063.0, "step": 1055 }, { "entropy": 7.276236915588379, "epoch": 0.0620427275387767, "grad_norm": 0.94921875, "learning_rate": 0.000499570685434671, "loss": 7.0445, "mean_token_accuracy": 0.10075422823429107, "num_tokens": 2156525.0, "step": 1060 }, { "entropy": 7.229153347015381, "epoch": 0.06233538191395961, "grad_norm": 0.921875, "learning_rate": 0.0004994948653760405, "loss": 7.0588, "mean_token_accuracy": 0.09751596227288246, "num_tokens": 2167294.0, "step": 1065 }, { "entropy": 7.209919691085815, "epoch": 0.06262803628914253, "grad_norm": 0.96875, "learning_rate": 0.0004994128906772729, "loss": 6.9627, "mean_token_accuracy": 0.1035116158425808, "num_tokens": 2177341.0, "step": 1070 }, { "entropy": 7.297941446304321, "epoch": 0.06292069066432543, "grad_norm": 0.94921875, "learning_rate": 0.000499324763585746, "loss": 7.0098, "mean_token_accuracy": 0.09901509582996368, "num_tokens": 2188044.0, "step": 1075 }, { "entropy": 7.183123016357422, "epoch": 0.06321334503950835, "grad_norm": 0.9140625, "learning_rate": 0.0004992304865175085, "loss": 7.0293, "mean_token_accuracy": 0.10036754310131073, "num_tokens": 2197612.0, "step": 1080 }, { "entropy": 7.282407426834107, "epoch": 0.06350599941469125, "grad_norm": 1.0078125, "learning_rate": 0.0004991300620572138, "loss": 7.0087, "mean_token_accuracy": 0.09982658997178077, "num_tokens": 2207638.0, "step": 1085 }, { "entropy": 7.160094165802002, "epoch": 0.06379865378987416, "grad_norm": 0.96875, "learning_rate": 0.0004990234929580494, "loss": 6.9333, "mean_token_accuracy": 0.10349727869033813, "num_tokens": 2216714.0, "step": 1090 }, { "entropy": 7.322865962982178, "epoch": 0.06409130816505706, "grad_norm": 0.9375, "learning_rate": 0.0004989107821416609, "loss": 7.0544, "mean_token_accuracy": 0.09982285872101784, "num_tokens": 2225900.0, "step": 1095 }, { "entropy": 7.1447443008422855, "epoch": 0.06438396254023998, "grad_norm": 0.9765625, "learning_rate": 0.0004987919326980723, "loss": 6.9718, "mean_token_accuracy": 0.10523544400930404, "num_tokens": 2235896.0, "step": 1100 }, { "entropy": 7.2013531684875485, "epoch": 0.06467661691542288, "grad_norm": 1.03125, "learning_rate": 0.0004986669478856011, "loss": 6.94, "mean_token_accuracy": 0.10068488419055939, "num_tokens": 2246083.0, "step": 1105 }, { "entropy": 7.246619081497192, "epoch": 0.0649692712906058, "grad_norm": 1.03125, "learning_rate": 0.0004985358311307688, "loss": 6.9572, "mean_token_accuracy": 0.10323750525712967, "num_tokens": 2256941.0, "step": 1110 }, { "entropy": 7.160521936416626, "epoch": 0.0652619256657887, "grad_norm": 1.109375, "learning_rate": 0.0004983985860282081, "loss": 6.9737, "mean_token_accuracy": 0.10002864897251129, "num_tokens": 2266694.0, "step": 1115 }, { "entropy": 7.155581760406494, "epoch": 0.06555458004097162, "grad_norm": 0.9921875, "learning_rate": 0.0004982552163405623, "loss": 6.9638, "mean_token_accuracy": 0.09659243822097778, "num_tokens": 2276826.0, "step": 1120 }, { "entropy": 7.222516393661499, "epoch": 0.06584723441615452, "grad_norm": 0.9765625, "learning_rate": 0.0004981057259983839, "loss": 6.9739, "mean_token_accuracy": 0.10149327889084817, "num_tokens": 2287895.0, "step": 1125 }, { "entropy": 7.083696699142456, "epoch": 0.06613988879133743, "grad_norm": 1.03125, "learning_rate": 0.0004979501191000262, "loss": 6.9513, "mean_token_accuracy": 0.10140683799982071, "num_tokens": 2297501.0, "step": 1130 }, { "entropy": 7.255348253250122, "epoch": 0.06643254316652034, "grad_norm": 0.9921875, "learning_rate": 0.0004977883999115311, "loss": 6.8291, "mean_token_accuracy": 0.10531161874532699, "num_tokens": 2306851.0, "step": 1135 }, { "entropy": 7.172169923782349, "epoch": 0.06672519754170325, "grad_norm": 1.0859375, "learning_rate": 0.0004976205728665113, "loss": 7.006, "mean_token_accuracy": 0.09792810827493667, "num_tokens": 2315710.0, "step": 1140 }, { "entropy": 7.135481214523315, "epoch": 0.06701785191688615, "grad_norm": 0.93359375, "learning_rate": 0.0004974466425660307, "loss": 6.9146, "mean_token_accuracy": 0.10404545590281486, "num_tokens": 2326144.0, "step": 1145 }, { "entropy": 7.1948600769042965, "epoch": 0.06731050629206907, "grad_norm": 0.96484375, "learning_rate": 0.0004972666137784759, "loss": 6.9143, "mean_token_accuracy": 0.10875528082251548, "num_tokens": 2335756.0, "step": 1150 }, { "entropy": 7.106131458282471, "epoch": 0.06760316066725197, "grad_norm": 0.93359375, "learning_rate": 0.0004970804914394271, "loss": 6.9304, "mean_token_accuracy": 0.10725896134972572, "num_tokens": 2345660.0, "step": 1155 }, { "entropy": 7.166688919067383, "epoch": 0.06789581504243489, "grad_norm": 0.9609375, "learning_rate": 0.0004968882806515225, "loss": 6.9403, "mean_token_accuracy": 0.10006137192249298, "num_tokens": 2355252.0, "step": 1160 }, { "entropy": 7.153073406219482, "epoch": 0.06818846941761779, "grad_norm": 0.98046875, "learning_rate": 0.0004966899866843177, "loss": 6.9305, "mean_token_accuracy": 0.10227609500288963, "num_tokens": 2364983.0, "step": 1165 }, { "entropy": 7.1287861347198485, "epoch": 0.0684811237928007, "grad_norm": 1.1171875, "learning_rate": 0.000496485614974142, "loss": 6.9048, "mean_token_accuracy": 0.10142005532979965, "num_tokens": 2375505.0, "step": 1170 }, { "entropy": 7.152293968200683, "epoch": 0.0687737781679836, "grad_norm": 1.015625, "learning_rate": 0.0004962751711239492, "loss": 6.9587, "mean_token_accuracy": 0.10323912650346756, "num_tokens": 2385300.0, "step": 1175 }, { "entropy": 7.039838171005249, "epoch": 0.06906643254316652, "grad_norm": 0.95703125, "learning_rate": 0.0004960586609031636, "loss": 6.9443, "mean_token_accuracy": 0.10556500256061555, "num_tokens": 2395966.0, "step": 1180 }, { "entropy": 7.262147569656372, "epoch": 0.06935908691834942, "grad_norm": 0.96484375, "learning_rate": 0.0004958360902475224, "loss": 6.9281, "mean_token_accuracy": 0.10152315646409989, "num_tokens": 2405429.0, "step": 1185 }, { "entropy": 7.163443088531494, "epoch": 0.06965174129353234, "grad_norm": 1.109375, "learning_rate": 0.0004956074652589125, "loss": 6.9202, "mean_token_accuracy": 0.10446830168366432, "num_tokens": 2415362.0, "step": 1190 }, { "entropy": 7.095344686508179, "epoch": 0.06994439566871524, "grad_norm": 1.0546875, "learning_rate": 0.0004953727922052035, "loss": 6.8784, "mean_token_accuracy": 0.10187279507517814, "num_tokens": 2425998.0, "step": 1195 }, { "entropy": 7.126546478271484, "epoch": 0.07023705004389816, "grad_norm": 0.90234375, "learning_rate": 0.0004951320775200756, "loss": 6.9491, "mean_token_accuracy": 0.09673603773117065, "num_tokens": 2436226.0, "step": 1200 }, { "entropy": 7.202165269851685, "epoch": 0.07052970441908106, "grad_norm": 0.94921875, "learning_rate": 0.0004948853278028436, "loss": 6.8387, "mean_token_accuracy": 0.10797644704580307, "num_tokens": 2445296.0, "step": 1205 }, { "entropy": 7.082312726974488, "epoch": 0.07082235879426398, "grad_norm": 0.90625, "learning_rate": 0.0004946325498182755, "loss": 6.8589, "mean_token_accuracy": 0.11134556159377099, "num_tokens": 2455743.0, "step": 1210 }, { "entropy": 7.09007248878479, "epoch": 0.07111501316944688, "grad_norm": 1.03125, "learning_rate": 0.0004943737504964076, "loss": 6.9405, "mean_token_accuracy": 0.1020224578678608, "num_tokens": 2465239.0, "step": 1215 }, { "entropy": 7.164793825149536, "epoch": 0.0714076675446298, "grad_norm": 1.03125, "learning_rate": 0.000494108936932354, "loss": 6.922, "mean_token_accuracy": 0.10908990055322647, "num_tokens": 2474472.0, "step": 1220 }, { "entropy": 6.9930988311767575, "epoch": 0.0717003219198127, "grad_norm": 0.94921875, "learning_rate": 0.0004938381163861124, "loss": 6.7943, "mean_token_accuracy": 0.11290957406163216, "num_tokens": 2483549.0, "step": 1225 }, { "entropy": 7.140143394470215, "epoch": 0.07199297629499561, "grad_norm": 0.875, "learning_rate": 0.0004935612962823645, "loss": 6.8657, "mean_token_accuracy": 0.10449625924229622, "num_tokens": 2495699.0, "step": 1230 }, { "entropy": 7.029150915145874, "epoch": 0.07228563067017851, "grad_norm": 0.94921875, "learning_rate": 0.0004932784842102739, "loss": 6.9746, "mean_token_accuracy": 0.10025271028280258, "num_tokens": 2507612.0, "step": 1235 }, { "entropy": 7.133029508590698, "epoch": 0.07257828504536143, "grad_norm": 0.94140625, "learning_rate": 0.0004929896879232758, "loss": 6.8438, "mean_token_accuracy": 0.10679830834269524, "num_tokens": 2517281.0, "step": 1240 }, { "entropy": 7.167627429962158, "epoch": 0.07287093942054433, "grad_norm": 1.046875, "learning_rate": 0.0004926949153388668, "loss": 6.8234, "mean_token_accuracy": 0.10795086920261383, "num_tokens": 2526570.0, "step": 1245 }, { "entropy": 7.026937675476074, "epoch": 0.07316359379572725, "grad_norm": 0.96875, "learning_rate": 0.0004923941745383859, "loss": 6.8455, "mean_token_accuracy": 0.10278113707900047, "num_tokens": 2535813.0, "step": 1250 }, { "entropy": 7.024099922180175, "epoch": 0.07345624817091015, "grad_norm": 1.09375, "learning_rate": 0.000492087473766794, "loss": 6.7853, "mean_token_accuracy": 0.11688904613256454, "num_tokens": 2544828.0, "step": 1255 }, { "entropy": 7.1756445407867435, "epoch": 0.07374890254609306, "grad_norm": 0.9375, "learning_rate": 0.000491774821432448, "loss": 6.9021, "mean_token_accuracy": 0.10272038280963898, "num_tokens": 2554612.0, "step": 1260 }, { "entropy": 6.887376928329468, "epoch": 0.07404155692127597, "grad_norm": 0.84765625, "learning_rate": 0.0004914562261068693, "loss": 6.8311, "mean_token_accuracy": 0.11283649727702141, "num_tokens": 2565395.0, "step": 1265 }, { "entropy": 7.175661230087281, "epoch": 0.07433421129645888, "grad_norm": 1.0390625, "learning_rate": 0.0004911316965245098, "loss": 6.966, "mean_token_accuracy": 0.1015208400785923, "num_tokens": 2576520.0, "step": 1270 }, { "entropy": 7.063946008682251, "epoch": 0.07462686567164178, "grad_norm": 0.89453125, "learning_rate": 0.000490801241582512, "loss": 6.8779, "mean_token_accuracy": 0.10767215564846992, "num_tokens": 2586093.0, "step": 1275 }, { "entropy": 7.0348388195037845, "epoch": 0.0749195200468247, "grad_norm": 0.875, "learning_rate": 0.000490464870340465, "loss": 6.8673, "mean_token_accuracy": 0.11059194058179855, "num_tokens": 2596165.0, "step": 1280 }, { "entropy": 7.263307380676269, "epoch": 0.0752121744220076, "grad_norm": 0.953125, "learning_rate": 0.0004901225920201563, "loss": 6.981, "mean_token_accuracy": 0.09260072112083435, "num_tokens": 2607108.0, "step": 1285 }, { "entropy": 6.985970163345337, "epoch": 0.07550482879719052, "grad_norm": 0.98046875, "learning_rate": 0.000489774416005319, "loss": 6.8579, "mean_token_accuracy": 0.10567844063043594, "num_tokens": 2617313.0, "step": 1290 }, { "entropy": 7.193155908584595, "epoch": 0.07579748317237343, "grad_norm": 1.0078125, "learning_rate": 0.0004894203518413742, "loss": 6.942, "mean_token_accuracy": 0.1037025772035122, "num_tokens": 2628065.0, "step": 1295 }, { "entropy": 7.068187236785889, "epoch": 0.07609013754755634, "grad_norm": 1.015625, "learning_rate": 0.0004890604092351701, "loss": 6.9342, "mean_token_accuracy": 0.09517190679907798, "num_tokens": 2638052.0, "step": 1300 }, { "entropy": 7.106878709793091, "epoch": 0.07638279192273925, "grad_norm": 0.9765625, "learning_rate": 0.000488694598054715, "loss": 6.8695, "mean_token_accuracy": 0.10798671543598175, "num_tokens": 2648242.0, "step": 1305 }, { "entropy": 7.1013659000396725, "epoch": 0.07667544629792215, "grad_norm": 1.0078125, "learning_rate": 0.0004883229283289071, "loss": 6.8159, "mean_token_accuracy": 0.10844166055321694, "num_tokens": 2657824.0, "step": 1310 }, { "entropy": 6.991985273361206, "epoch": 0.07696810067310507, "grad_norm": 0.98828125, "learning_rate": 0.00048794541024725993, "loss": 6.7952, "mean_token_accuracy": 0.10927849039435386, "num_tokens": 2667774.0, "step": 1315 }, { "entropy": 7.040319395065308, "epoch": 0.07726075504828797, "grad_norm": 0.95703125, "learning_rate": 0.0004875620541596221, "loss": 6.7604, "mean_token_accuracy": 0.1062987856566906, "num_tokens": 2677697.0, "step": 1320 }, { "entropy": 7.020246982574463, "epoch": 0.07755340942347089, "grad_norm": 1.0234375, "learning_rate": 0.00048717287057589454, "loss": 6.8529, "mean_token_accuracy": 0.10597260296344757, "num_tokens": 2688553.0, "step": 1325 }, { "entropy": 7.039525413513184, "epoch": 0.07784606379865379, "grad_norm": 0.9921875, "learning_rate": 0.0004867778701657417, "loss": 6.7872, "mean_token_accuracy": 0.1075766459107399, "num_tokens": 2698704.0, "step": 1330 }, { "entropy": 7.057392406463623, "epoch": 0.0781387181738367, "grad_norm": 0.9296875, "learning_rate": 0.00048637706375829955, "loss": 6.856, "mean_token_accuracy": 0.10357561856508254, "num_tokens": 2709257.0, "step": 1335 }, { "entropy": 7.129636335372925, "epoch": 0.0784313725490196, "grad_norm": 1.015625, "learning_rate": 0.000485970462341878, "loss": 6.8684, "mean_token_accuracy": 0.10322815775871277, "num_tokens": 2719860.0, "step": 1340 }, { "entropy": 6.990602445602417, "epoch": 0.07872402692420252, "grad_norm": 0.9609375, "learning_rate": 0.00048555807706366044, "loss": 6.8517, "mean_token_accuracy": 0.1050374872982502, "num_tokens": 2730134.0, "step": 1345 }, { "entropy": 6.978021669387817, "epoch": 0.07901668129938542, "grad_norm": 1.0078125, "learning_rate": 0.00048513991922939756, "loss": 6.6989, "mean_token_accuracy": 0.1164980985224247, "num_tokens": 2739661.0, "step": 1350 }, { "entropy": 6.976407098770141, "epoch": 0.07930933567456834, "grad_norm": 0.98828125, "learning_rate": 0.00048471600030309744, "loss": 6.8151, "mean_token_accuracy": 0.10699095502495766, "num_tokens": 2749532.0, "step": 1355 }, { "entropy": 7.110589075088501, "epoch": 0.07960199004975124, "grad_norm": 0.984375, "learning_rate": 0.00048428633190671186, "loss": 6.8471, "mean_token_accuracy": 0.10450146123766899, "num_tokens": 2759652.0, "step": 1360 }, { "entropy": 6.953937816619873, "epoch": 0.07989464442493416, "grad_norm": 0.86328125, "learning_rate": 0.0004838509258198167, "loss": 6.7311, "mean_token_accuracy": 0.11042979061603546, "num_tokens": 2770122.0, "step": 1365 }, { "entropy": 6.970408010482788, "epoch": 0.08018729880011706, "grad_norm": 1.0546875, "learning_rate": 0.00048340979397929, "loss": 6.8092, "mean_token_accuracy": 0.10888475328683853, "num_tokens": 2779788.0, "step": 1370 }, { "entropy": 7.0338794708251955, "epoch": 0.08047995317529998, "grad_norm": 1.015625, "learning_rate": 0.00048296294847898386, "loss": 6.805, "mean_token_accuracy": 0.10510503351688386, "num_tokens": 2790149.0, "step": 1375 }, { "entropy": 7.031380653381348, "epoch": 0.08077260755048288, "grad_norm": 0.98828125, "learning_rate": 0.0004825104015693934, "loss": 6.7248, "mean_token_accuracy": 0.11531992107629777, "num_tokens": 2799378.0, "step": 1380 }, { "entropy": 6.92920618057251, "epoch": 0.0810652619256658, "grad_norm": 1.09375, "learning_rate": 0.0004820521656573208, "loss": 6.8058, "mean_token_accuracy": 0.11184522807598114, "num_tokens": 2809573.0, "step": 1385 }, { "entropy": 6.951801586151123, "epoch": 0.0813579163008487, "grad_norm": 0.92578125, "learning_rate": 0.00048158825330553505, "loss": 6.7261, "mean_token_accuracy": 0.11088547632098197, "num_tokens": 2819816.0, "step": 1390 }, { "entropy": 7.114043664932251, "epoch": 0.08165057067603161, "grad_norm": 0.9765625, "learning_rate": 0.00048111867723242763, "loss": 6.8456, "mean_token_accuracy": 0.1005843736231327, "num_tokens": 2830606.0, "step": 1395 }, { "entropy": 6.9624059200286865, "epoch": 0.08194322505121451, "grad_norm": 0.98828125, "learning_rate": 0.0004806434503116637, "loss": 6.8289, "mean_token_accuracy": 0.10612485110759735, "num_tokens": 2840925.0, "step": 1400 }, { "entropy": 6.966361713409424, "epoch": 0.08223587942639743, "grad_norm": 0.89453125, "learning_rate": 0.0004801625855718296, "loss": 6.7518, "mean_token_accuracy": 0.11064208373427391, "num_tokens": 2850697.0, "step": 1405 }, { "entropy": 6.990543603897095, "epoch": 0.08252853380158033, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.8402, "mean_token_accuracy": 0.10857592597603798, "num_tokens": 2861001.0, "step": 1410 }, { "entropy": 7.022043466567993, "epoch": 0.08282118817676325, "grad_norm": 1.015625, "learning_rate": 0.0004791839955217513, "loss": 6.7625, "mean_token_accuracy": 0.11597265005111694, "num_tokens": 2869959.0, "step": 1415 }, { "entropy": 6.995840072631836, "epoch": 0.08311384255194615, "grad_norm": 0.9375, "learning_rate": 0.00047868629704004786, "loss": 6.728, "mean_token_accuracy": 0.11714338809251786, "num_tokens": 2878998.0, "step": 1420 }, { "entropy": 6.972711563110352, "epoch": 0.08340649692712906, "grad_norm": 0.93359375, "learning_rate": 0.00047818301439561965, "loss": 6.7609, "mean_token_accuracy": 0.10615370124578476, "num_tokens": 2888870.0, "step": 1425 }, { "entropy": 6.923924589157105, "epoch": 0.08369915130231197, "grad_norm": 0.953125, "learning_rate": 0.00047767416138621454, "loss": 6.6755, "mean_token_accuracy": 0.11179826408624649, "num_tokens": 2898549.0, "step": 1430 }, { "entropy": 6.9445459842681885, "epoch": 0.08399180567749488, "grad_norm": 0.84375, "learning_rate": 0.000477159751962295, "loss": 6.7235, "mean_token_accuracy": 0.11873029172420502, "num_tokens": 2908614.0, "step": 1435 }, { "entropy": 6.906632804870606, "epoch": 0.08428446005267778, "grad_norm": 1.0078125, "learning_rate": 0.00047663980022665507, "loss": 6.7154, "mean_token_accuracy": 0.1131787732243538, "num_tokens": 2917845.0, "step": 1440 }, { "entropy": 7.026270580291748, "epoch": 0.0845771144278607, "grad_norm": 0.91015625, "learning_rate": 0.00047611432043403437, "loss": 6.8334, "mean_token_accuracy": 0.10297970846295357, "num_tokens": 2929234.0, "step": 1445 }, { "entropy": 6.907474088668823, "epoch": 0.0848697688030436, "grad_norm": 0.94921875, "learning_rate": 0.0004755833269907267, "loss": 6.7675, "mean_token_accuracy": 0.10896839275956154, "num_tokens": 2939011.0, "step": 1450 }, { "entropy": 7.063915395736695, "epoch": 0.08516242317822652, "grad_norm": 0.95703125, "learning_rate": 0.0004750468344541857, "loss": 6.7726, "mean_token_accuracy": 0.10877819880843162, "num_tokens": 2948796.0, "step": 1455 }, { "entropy": 6.904459810256958, "epoch": 0.08545507755340942, "grad_norm": 0.94921875, "learning_rate": 0.00047450485753262525, "loss": 6.8066, "mean_token_accuracy": 0.10255414545536042, "num_tokens": 2960938.0, "step": 1460 }, { "entropy": 6.976855278015137, "epoch": 0.08574773192859234, "grad_norm": 0.9375, "learning_rate": 0.00047395741108461633, "loss": 6.7148, "mean_token_accuracy": 0.11121275797486305, "num_tokens": 2969964.0, "step": 1465 }, { "entropy": 6.9436931133270265, "epoch": 0.08604038630377524, "grad_norm": 0.98046875, "learning_rate": 0.00047340451011867985, "loss": 6.7419, "mean_token_accuracy": 0.10835531502962112, "num_tokens": 2980562.0, "step": 1470 }, { "entropy": 6.976116418838501, "epoch": 0.08633304067895815, "grad_norm": 0.96484375, "learning_rate": 0.00047284616979287515, "loss": 6.6753, "mean_token_accuracy": 0.11625185832381249, "num_tokens": 2990759.0, "step": 1475 }, { "entropy": 6.905919122695923, "epoch": 0.08662569505414106, "grad_norm": 1.0546875, "learning_rate": 0.00047228240541438433, "loss": 6.7076, "mean_token_accuracy": 0.11023089289665222, "num_tokens": 3000719.0, "step": 1480 }, { "entropy": 6.928934144973755, "epoch": 0.08691834942932397, "grad_norm": 0.96484375, "learning_rate": 0.00047171323243909257, "loss": 6.7253, "mean_token_accuracy": 0.11021335422992706, "num_tokens": 3011584.0, "step": 1485 }, { "entropy": 6.850312614440918, "epoch": 0.08721100380450687, "grad_norm": 1.1328125, "learning_rate": 0.00047113866647116457, "loss": 6.6914, "mean_token_accuracy": 0.11205545589327812, "num_tokens": 3021933.0, "step": 1490 }, { "entropy": 7.0218939781188965, "epoch": 0.08750365817968979, "grad_norm": 1.0390625, "learning_rate": 0.0004705587232626164, "loss": 6.7541, "mean_token_accuracy": 0.10549476444721222, "num_tokens": 3032533.0, "step": 1495 }, { "entropy": 6.886258840560913, "epoch": 0.08779631255487269, "grad_norm": 0.98046875, "learning_rate": 0.00046997341871288424, "loss": 6.6657, "mean_token_accuracy": 0.11410991847515106, "num_tokens": 3041556.0, "step": 1500 }, { "entropy": 6.93623046875, "epoch": 0.0880889669300556, "grad_norm": 1.09375, "learning_rate": 0.0004693827688683879, "loss": 6.7447, "mean_token_accuracy": 0.10976714193820954, "num_tokens": 3052030.0, "step": 1505 }, { "entropy": 6.86750373840332, "epoch": 0.08838162130523851, "grad_norm": 0.9375, "learning_rate": 0.0004687867899220914, "loss": 6.6783, "mean_token_accuracy": 0.10968335196375847, "num_tokens": 3062267.0, "step": 1510 }, { "entropy": 6.955923652648925, "epoch": 0.08867427568042142, "grad_norm": 0.91015625, "learning_rate": 0.00046818549821305846, "loss": 6.643, "mean_token_accuracy": 0.11466655507683754, "num_tokens": 3073357.0, "step": 1515 }, { "entropy": 6.84696593284607, "epoch": 0.08896693005560433, "grad_norm": 0.98828125, "learning_rate": 0.00046757891022600494, "loss": 6.7323, "mean_token_accuracy": 0.11122780367732048, "num_tokens": 3083250.0, "step": 1520 }, { "entropy": 6.95814471244812, "epoch": 0.08925958443078724, "grad_norm": 1.0, "learning_rate": 0.0004669670425908471, "loss": 6.6353, "mean_token_accuracy": 0.11299381777644157, "num_tokens": 3093144.0, "step": 1525 }, { "entropy": 6.820744323730469, "epoch": 0.08955223880597014, "grad_norm": 0.9375, "learning_rate": 0.0004663499120822451, "loss": 6.6688, "mean_token_accuracy": 0.11378093957901, "num_tokens": 3103731.0, "step": 1530 }, { "entropy": 6.915271520614624, "epoch": 0.08984489318115306, "grad_norm": 0.953125, "learning_rate": 0.0004657275356191437, "loss": 6.7017, "mean_token_accuracy": 0.11074108928442002, "num_tokens": 3114113.0, "step": 1535 }, { "entropy": 6.886846303939819, "epoch": 0.09013754755633596, "grad_norm": 0.8828125, "learning_rate": 0.00046509993026430804, "loss": 6.653, "mean_token_accuracy": 0.11144338846206665, "num_tokens": 3124167.0, "step": 1540 }, { "entropy": 6.852968740463257, "epoch": 0.09043020193151888, "grad_norm": 0.92578125, "learning_rate": 0.0004644671132238558, "loss": 6.5614, "mean_token_accuracy": 0.12301889657974244, "num_tokens": 3134751.0, "step": 1545 }, { "entropy": 6.885099744796753, "epoch": 0.09072285630670178, "grad_norm": 1.015625, "learning_rate": 0.00046382910184678585, "loss": 6.6554, "mean_token_accuracy": 0.11772447004914284, "num_tokens": 3144084.0, "step": 1550 }, { "entropy": 6.754053544998169, "epoch": 0.0910155106818847, "grad_norm": 1.0234375, "learning_rate": 0.0004631859136245025, "loss": 6.6136, "mean_token_accuracy": 0.11398938149213791, "num_tokens": 3153156.0, "step": 1555 }, { "entropy": 6.984991645812988, "epoch": 0.0913081650570676, "grad_norm": 0.9375, "learning_rate": 0.0004625375661903357, "loss": 6.6408, "mean_token_accuracy": 0.11836520209908485, "num_tokens": 3163098.0, "step": 1560 }, { "entropy": 6.801419591903686, "epoch": 0.09160081943225051, "grad_norm": 0.9375, "learning_rate": 0.00046188407731905787, "loss": 6.6727, "mean_token_accuracy": 0.11261920407414436, "num_tokens": 3172623.0, "step": 1565 }, { "entropy": 6.9145081520080565, "epoch": 0.09189347380743342, "grad_norm": 1.0078125, "learning_rate": 0.00046122546492639643, "loss": 6.6369, "mean_token_accuracy": 0.11749240681529045, "num_tokens": 3182610.0, "step": 1570 }, { "entropy": 6.80106897354126, "epoch": 0.09218612818261633, "grad_norm": 0.93359375, "learning_rate": 0.000460561747068543, "loss": 6.6364, "mean_token_accuracy": 0.108591927587986, "num_tokens": 3192978.0, "step": 1575 }, { "entropy": 6.943644762039185, "epoch": 0.09247878255779923, "grad_norm": 0.98828125, "learning_rate": 0.0004598929419416578, "loss": 6.6731, "mean_token_accuracy": 0.11072808504104614, "num_tokens": 3202791.0, "step": 1580 }, { "entropy": 6.783168792724609, "epoch": 0.09277143693298215, "grad_norm": 1.0625, "learning_rate": 0.00045921906788137123, "loss": 6.6412, "mean_token_accuracy": 0.11365418583154678, "num_tokens": 3212408.0, "step": 1585 }, { "entropy": 6.906521463394165, "epoch": 0.09306409130816505, "grad_norm": 0.9140625, "learning_rate": 0.00045854014336228115, "loss": 6.6733, "mean_token_accuracy": 0.11501292213797569, "num_tokens": 3222182.0, "step": 1590 }, { "entropy": 6.849865865707398, "epoch": 0.09335674568334797, "grad_norm": 0.95703125, "learning_rate": 0.00045785618699744615, "loss": 6.6344, "mean_token_accuracy": 0.11746996641159058, "num_tokens": 3233058.0, "step": 1595 }, { "entropy": 6.8446972370147705, "epoch": 0.09364940005853087, "grad_norm": 0.9765625, "learning_rate": 0.00045716721753787543, "loss": 6.6006, "mean_token_accuracy": 0.11764349192380905, "num_tokens": 3243412.0, "step": 1600 }, { "entropy": 6.802833318710327, "epoch": 0.09394205443371378, "grad_norm": 1.09375, "learning_rate": 0.0004564732538720148, "loss": 6.7006, "mean_token_accuracy": 0.11396326944231987, "num_tokens": 3254511.0, "step": 1605 }, { "entropy": 6.9019934177398685, "epoch": 0.09423470880889669, "grad_norm": 1.0078125, "learning_rate": 0.00045577431502522877, "loss": 6.5915, "mean_token_accuracy": 0.11526288017630577, "num_tokens": 3264949.0, "step": 1610 }, { "entropy": 6.764813375473023, "epoch": 0.0945273631840796, "grad_norm": 0.96484375, "learning_rate": 0.0004550704201592787, "loss": 6.6396, "mean_token_accuracy": 0.10926437377929688, "num_tokens": 3275014.0, "step": 1615 }, { "entropy": 6.861340761184692, "epoch": 0.09482001755926252, "grad_norm": 1.09375, "learning_rate": 0.0004543615885717981, "loss": 6.6634, "mean_token_accuracy": 0.11290878355503083, "num_tokens": 3285446.0, "step": 1620 }, { "entropy": 6.844233989715576, "epoch": 0.09511267193444542, "grad_norm": 0.984375, "learning_rate": 0.00045364783969576296, "loss": 6.5346, "mean_token_accuracy": 0.1263396829366684, "num_tokens": 3295383.0, "step": 1625 }, { "entropy": 6.765133380889893, "epoch": 0.09540532630962834, "grad_norm": 0.99609375, "learning_rate": 0.0004529291930989592, "loss": 6.6189, "mean_token_accuracy": 0.11274374797940254, "num_tokens": 3305263.0, "step": 1630 }, { "entropy": 6.842666339874268, "epoch": 0.09569798068481124, "grad_norm": 0.984375, "learning_rate": 0.0004522056684834464, "loss": 6.6083, "mean_token_accuracy": 0.1211700364947319, "num_tokens": 3315434.0, "step": 1635 }, { "entropy": 6.784665536880493, "epoch": 0.09599063505999415, "grad_norm": 1.03125, "learning_rate": 0.0004514772856850173, "loss": 6.5348, "mean_token_accuracy": 0.12217146530747414, "num_tokens": 3324908.0, "step": 1640 }, { "entropy": 6.831562328338623, "epoch": 0.09628328943517706, "grad_norm": 0.9765625, "learning_rate": 0.0004507440646726542, "loss": 6.6054, "mean_token_accuracy": 0.12192678451538086, "num_tokens": 3335987.0, "step": 1645 }, { "entropy": 6.853379344940185, "epoch": 0.09657594381035997, "grad_norm": 0.99609375, "learning_rate": 0.0004500060255479818, "loss": 6.561, "mean_token_accuracy": 0.1174039103090763, "num_tokens": 3345502.0, "step": 1650 }, { "entropy": 6.778363132476807, "epoch": 0.09686859818554287, "grad_norm": 0.93359375, "learning_rate": 0.0004492631885447151, "loss": 6.5545, "mean_token_accuracy": 0.11502353250980377, "num_tokens": 3355237.0, "step": 1655 }, { "entropy": 6.812596559524536, "epoch": 0.09716125256072579, "grad_norm": 0.94921875, "learning_rate": 0.00044851557402810616, "loss": 6.6318, "mean_token_accuracy": 0.11809700429439544, "num_tokens": 3366166.0, "step": 1660 }, { "entropy": 6.858366012573242, "epoch": 0.09745390693590869, "grad_norm": 0.94921875, "learning_rate": 0.00044776320249438444, "loss": 6.5995, "mean_token_accuracy": 0.11467723920941353, "num_tokens": 3375931.0, "step": 1665 }, { "entropy": 6.782172203063965, "epoch": 0.0977465613110916, "grad_norm": 0.9296875, "learning_rate": 0.00044700609457019565, "loss": 6.5999, "mean_token_accuracy": 0.12378341481089591, "num_tokens": 3386728.0, "step": 1670 }, { "entropy": 6.759363842010498, "epoch": 0.09803921568627451, "grad_norm": 0.9375, "learning_rate": 0.0004462442710120359, "loss": 6.5791, "mean_token_accuracy": 0.1205291859805584, "num_tokens": 3396795.0, "step": 1675 }, { "entropy": 6.835077142715454, "epoch": 0.09833187006145742, "grad_norm": 0.9140625, "learning_rate": 0.000445477752705683, "loss": 6.5568, "mean_token_accuracy": 0.1181432493031025, "num_tokens": 3406310.0, "step": 1680 }, { "entropy": 6.776544427871704, "epoch": 0.09862452443664033, "grad_norm": 0.90234375, "learning_rate": 0.00044470656066562336, "loss": 6.6114, "mean_token_accuracy": 0.11417201384902001, "num_tokens": 3418110.0, "step": 1685 }, { "entropy": 6.792936897277832, "epoch": 0.09891717881182324, "grad_norm": 1.109375, "learning_rate": 0.0004439307160344765, "loss": 6.5952, "mean_token_accuracy": 0.11885511875152588, "num_tokens": 3428122.0, "step": 1690 }, { "entropy": 6.801793384552002, "epoch": 0.09920983318700614, "grad_norm": 0.9765625, "learning_rate": 0.00044315024008241473, "loss": 6.6457, "mean_token_accuracy": 0.11425484046339988, "num_tokens": 3438514.0, "step": 1695 }, { "entropy": 6.8519859790802, "epoch": 0.09950248756218906, "grad_norm": 1.0, "learning_rate": 0.0004423651542065806, "loss": 6.6262, "mean_token_accuracy": 0.1146598532795906, "num_tokens": 3449040.0, "step": 1700 }, { "entropy": 6.8020600318908695, "epoch": 0.09979514193737196, "grad_norm": 1.0234375, "learning_rate": 0.00044157547993050006, "loss": 6.5487, "mean_token_accuracy": 0.12066433876752854, "num_tokens": 3459244.0, "step": 1705 }, { "entropy": 6.881866407394409, "epoch": 0.10008779631255488, "grad_norm": 1.078125, "learning_rate": 0.00044078123890349227, "loss": 6.6118, "mean_token_accuracy": 0.11424820944666862, "num_tokens": 3469270.0, "step": 1710 }, { "entropy": 6.784549045562744, "epoch": 0.10038045068773778, "grad_norm": 1.0703125, "learning_rate": 0.00043998245290007606, "loss": 6.592, "mean_token_accuracy": 0.11819150224328041, "num_tokens": 3480113.0, "step": 1715 }, { "entropy": 6.802189111709595, "epoch": 0.1006731050629207, "grad_norm": 1.015625, "learning_rate": 0.00043917914381937323, "loss": 6.5813, "mean_token_accuracy": 0.11734010130167008, "num_tokens": 3490451.0, "step": 1720 }, { "entropy": 6.809964227676391, "epoch": 0.1009657594381036, "grad_norm": 0.87109375, "learning_rate": 0.00043837133368450815, "loss": 6.5405, "mean_token_accuracy": 0.11609668955206871, "num_tokens": 3501107.0, "step": 1725 }, { "entropy": 6.71238145828247, "epoch": 0.10125841381328651, "grad_norm": 0.984375, "learning_rate": 0.0004375590446420037, "loss": 6.5099, "mean_token_accuracy": 0.13233423829078675, "num_tokens": 3510731.0, "step": 1730 }, { "entropy": 6.739808130264282, "epoch": 0.10155106818846941, "grad_norm": 0.953125, "learning_rate": 0.0004367422989611743, "loss": 6.4388, "mean_token_accuracy": 0.12671404406428338, "num_tokens": 3520843.0, "step": 1735 }, { "entropy": 6.837344312667847, "epoch": 0.10184372256365233, "grad_norm": 0.8984375, "learning_rate": 0.0004359211190335153, "loss": 6.6177, "mean_token_accuracy": 0.11465101763606071, "num_tokens": 3530668.0, "step": 1740 }, { "entropy": 6.749877786636352, "epoch": 0.10213637693883523, "grad_norm": 0.9921875, "learning_rate": 0.00043509552737208923, "loss": 6.5428, "mean_token_accuracy": 0.12134164273738861, "num_tokens": 3540252.0, "step": 1745 }, { "entropy": 6.7890314102172855, "epoch": 0.10242903131401815, "grad_norm": 0.96875, "learning_rate": 0.00043426554661090853, "loss": 6.5481, "mean_token_accuracy": 0.11811421886086464, "num_tokens": 3549069.0, "step": 1750 }, { "entropy": 6.757550573348999, "epoch": 0.10272168568920105, "grad_norm": 0.8984375, "learning_rate": 0.00043343119950431516, "loss": 6.58, "mean_token_accuracy": 0.11727841719985008, "num_tokens": 3559988.0, "step": 1755 }, { "entropy": 6.787223291397095, "epoch": 0.10301434006438397, "grad_norm": 0.98828125, "learning_rate": 0.00043259250892635644, "loss": 6.4955, "mean_token_accuracy": 0.1283750705420971, "num_tokens": 3569829.0, "step": 1760 }, { "entropy": 6.687646579742432, "epoch": 0.10330699443956687, "grad_norm": 0.9375, "learning_rate": 0.0004317494978701582, "loss": 6.4395, "mean_token_accuracy": 0.1254482589662075, "num_tokens": 3578958.0, "step": 1765 }, { "entropy": 6.786183023452759, "epoch": 0.10359964881474978, "grad_norm": 0.9375, "learning_rate": 0.0004309021894472943, "loss": 6.5076, "mean_token_accuracy": 0.12173920199275017, "num_tokens": 3588844.0, "step": 1770 }, { "entropy": 6.71337513923645, "epoch": 0.10389230318993269, "grad_norm": 1.0, "learning_rate": 0.0004300506068871534, "loss": 6.5819, "mean_token_accuracy": 0.11760919094085694, "num_tokens": 3599047.0, "step": 1775 }, { "entropy": 6.7201086521148685, "epoch": 0.1041849575651156, "grad_norm": 0.9609375, "learning_rate": 0.00042919477353630135, "loss": 6.4735, "mean_token_accuracy": 0.1287480928003788, "num_tokens": 3608416.0, "step": 1780 }, { "entropy": 6.780730867385865, "epoch": 0.1044776119402985, "grad_norm": 1.1171875, "learning_rate": 0.000428334712857842, "loss": 6.5059, "mean_token_accuracy": 0.11816626787185669, "num_tokens": 3618460.0, "step": 1785 }, { "entropy": 6.67847204208374, "epoch": 0.10477026631548142, "grad_norm": 1.0234375, "learning_rate": 0.00042747044843077304, "loss": 6.5474, "mean_token_accuracy": 0.12268414348363876, "num_tokens": 3628795.0, "step": 1790 }, { "entropy": 6.735287475585937, "epoch": 0.10506292069066432, "grad_norm": 1.0859375, "learning_rate": 0.00042660200394934047, "loss": 6.5558, "mean_token_accuracy": 0.11583011224865913, "num_tokens": 3640278.0, "step": 1795 }, { "entropy": 6.766513156890869, "epoch": 0.10535557506584724, "grad_norm": 0.9296875, "learning_rate": 0.00042572940322238844, "loss": 6.5482, "mean_token_accuracy": 0.12088547199964524, "num_tokens": 3650497.0, "step": 1800 }, { "entropy": 6.722351598739624, "epoch": 0.10564822944103014, "grad_norm": 0.9453125, "learning_rate": 0.00042485267017270664, "loss": 6.5984, "mean_token_accuracy": 0.1228600986301899, "num_tokens": 3661101.0, "step": 1805 }, { "entropy": 6.922651243209839, "epoch": 0.10594088381621306, "grad_norm": 0.9921875, "learning_rate": 0.0004239718288363745, "loss": 6.5561, "mean_token_accuracy": 0.1192373014986515, "num_tokens": 3670698.0, "step": 1810 }, { "entropy": 6.736356639862061, "epoch": 0.10623353819139596, "grad_norm": 1.1328125, "learning_rate": 0.0004230869033621023, "loss": 6.5585, "mean_token_accuracy": 0.11428969204425812, "num_tokens": 3679723.0, "step": 1815 }, { "entropy": 6.864965009689331, "epoch": 0.10652619256657887, "grad_norm": 0.93359375, "learning_rate": 0.0004221979180105688, "loss": 6.5512, "mean_token_accuracy": 0.11349868997931481, "num_tokens": 3690362.0, "step": 1820 }, { "entropy": 6.747930908203125, "epoch": 0.10681884694176177, "grad_norm": 0.96484375, "learning_rate": 0.00042130489715375645, "loss": 6.5085, "mean_token_accuracy": 0.12559529766440392, "num_tokens": 3700087.0, "step": 1825 }, { "entropy": 6.717715930938721, "epoch": 0.10711150131694469, "grad_norm": 0.96875, "learning_rate": 0.00042040786527428335, "loss": 6.5049, "mean_token_accuracy": 0.12355283051729202, "num_tokens": 3710086.0, "step": 1830 }, { "entropy": 6.7144248485565186, "epoch": 0.10740415569212759, "grad_norm": 0.95703125, "learning_rate": 0.0004195068469647315, "loss": 6.4642, "mean_token_accuracy": 0.12195742204785347, "num_tokens": 3720292.0, "step": 1835 }, { "entropy": 6.729002285003662, "epoch": 0.10769681006731051, "grad_norm": 0.93359375, "learning_rate": 0.00041860186692697297, "loss": 6.5342, "mean_token_accuracy": 0.11787921264767647, "num_tokens": 3730980.0, "step": 1840 }, { "entropy": 6.749273777008057, "epoch": 0.10798946444249341, "grad_norm": 1.0390625, "learning_rate": 0.00041769294997149264, "loss": 6.5779, "mean_token_accuracy": 0.11964235603809356, "num_tokens": 3741244.0, "step": 1845 }, { "entropy": 6.732828664779663, "epoch": 0.10828211881767633, "grad_norm": 0.97265625, "learning_rate": 0.0004167801210167081, "loss": 6.5632, "mean_token_accuracy": 0.11899603232741356, "num_tokens": 3751841.0, "step": 1850 }, { "entropy": 6.836530923843384, "epoch": 0.10857477319285923, "grad_norm": 0.9765625, "learning_rate": 0.0004158634050882861, "loss": 6.5206, "mean_token_accuracy": 0.12107773423194886, "num_tokens": 3762571.0, "step": 1855 }, { "entropy": 6.6559099674224855, "epoch": 0.10886742756804214, "grad_norm": 1.0625, "learning_rate": 0.0004149428273184569, "loss": 6.5158, "mean_token_accuracy": 0.12190034389495849, "num_tokens": 3771778.0, "step": 1860 }, { "entropy": 6.7532881736755375, "epoch": 0.10916008194322505, "grad_norm": 0.95703125, "learning_rate": 0.0004140184129453253, "loss": 6.4896, "mean_token_accuracy": 0.12468724176287652, "num_tokens": 3781712.0, "step": 1865 }, { "entropy": 6.647825574874878, "epoch": 0.10945273631840796, "grad_norm": 0.984375, "learning_rate": 0.000413090187312178, "loss": 6.3472, "mean_token_accuracy": 0.13525793552398682, "num_tokens": 3790711.0, "step": 1870 }, { "entropy": 6.663978242874146, "epoch": 0.10974539069359086, "grad_norm": 0.91015625, "learning_rate": 0.0004121581758667898, "loss": 6.473, "mean_token_accuracy": 0.1203851766884327, "num_tokens": 3801271.0, "step": 1875 }, { "entropy": 6.769151782989502, "epoch": 0.11003804506877378, "grad_norm": 0.8671875, "learning_rate": 0.00041122240416072533, "loss": 6.4856, "mean_token_accuracy": 0.12278474420309067, "num_tokens": 3811518.0, "step": 1880 }, { "entropy": 6.705088186264038, "epoch": 0.11033069944395668, "grad_norm": 0.90625, "learning_rate": 0.0004102828978486385, "loss": 6.5151, "mean_token_accuracy": 0.1212370365858078, "num_tokens": 3821454.0, "step": 1885 }, { "entropy": 6.742790365219117, "epoch": 0.1106233538191396, "grad_norm": 0.88671875, "learning_rate": 0.0004093396826875695, "loss": 6.5606, "mean_token_accuracy": 0.11982747986912727, "num_tokens": 3831886.0, "step": 1890 }, { "entropy": 6.7166282653808596, "epoch": 0.1109160081943225, "grad_norm": 0.94921875, "learning_rate": 0.00040839278453623837, "loss": 6.4898, "mean_token_accuracy": 0.1260741837322712, "num_tokens": 3841723.0, "step": 1895 }, { "entropy": 6.7906341552734375, "epoch": 0.11120866256950541, "grad_norm": 1.0703125, "learning_rate": 0.0004074422293543363, "loss": 6.4533, "mean_token_accuracy": 0.1258271798491478, "num_tokens": 3851374.0, "step": 1900 }, { "entropy": 6.740607738494873, "epoch": 0.11150131694468832, "grad_norm": 0.95703125, "learning_rate": 0.0004064880432018137, "loss": 6.4903, "mean_token_accuracy": 0.12274285033345222, "num_tokens": 3862627.0, "step": 1905 }, { "entropy": 6.659914445877075, "epoch": 0.11179397131987123, "grad_norm": 1.03125, "learning_rate": 0.00040553025223816615, "loss": 6.4784, "mean_token_accuracy": 0.12452571094036102, "num_tokens": 3872344.0, "step": 1910 }, { "entropy": 6.735513925552368, "epoch": 0.11208662569505413, "grad_norm": 0.890625, "learning_rate": 0.00040456888272171653, "loss": 6.5453, "mean_token_accuracy": 0.11647359281778336, "num_tokens": 3882896.0, "step": 1915 }, { "entropy": 6.713681602478028, "epoch": 0.11237928007023705, "grad_norm": 0.91015625, "learning_rate": 0.00040360396100889577, "loss": 6.4595, "mean_token_accuracy": 0.12801918759942055, "num_tokens": 3893773.0, "step": 1920 }, { "entropy": 6.6865918159484865, "epoch": 0.11267193444541995, "grad_norm": 0.95703125, "learning_rate": 0.0004026355135535202, "loss": 6.4424, "mean_token_accuracy": 0.12188205718994141, "num_tokens": 3905057.0, "step": 1925 }, { "entropy": 6.726850271224976, "epoch": 0.11296458882060287, "grad_norm": 0.91796875, "learning_rate": 0.000401663566906066, "loss": 6.4427, "mean_token_accuracy": 0.12147087454795838, "num_tokens": 3914306.0, "step": 1930 }, { "entropy": 6.700537204742432, "epoch": 0.11325724319578578, "grad_norm": 0.9375, "learning_rate": 0.00040068814771294134, "loss": 6.4905, "mean_token_accuracy": 0.12801681384444236, "num_tokens": 3924168.0, "step": 1935 }, { "entropy": 6.674844408035279, "epoch": 0.11354989757096869, "grad_norm": 0.99609375, "learning_rate": 0.0003997092827157562, "loss": 6.4243, "mean_token_accuracy": 0.12779392600059508, "num_tokens": 3934603.0, "step": 1940 }, { "entropy": 6.662173557281494, "epoch": 0.1138425519461516, "grad_norm": 0.875, "learning_rate": 0.000398726998750589, "loss": 6.575, "mean_token_accuracy": 0.12289680615067482, "num_tokens": 3946181.0, "step": 1945 }, { "entropy": 6.859195804595947, "epoch": 0.1141352063213345, "grad_norm": 1.0, "learning_rate": 0.00039774132274725076, "loss": 6.4832, "mean_token_accuracy": 0.12466611191630364, "num_tokens": 3955732.0, "step": 1950 }, { "entropy": 6.668773794174195, "epoch": 0.11442786069651742, "grad_norm": 1.015625, "learning_rate": 0.00039675228172854707, "loss": 6.4042, "mean_token_accuracy": 0.12757309898734093, "num_tokens": 3965569.0, "step": 1955 }, { "entropy": 6.693961477279663, "epoch": 0.11472051507170032, "grad_norm": 0.9765625, "learning_rate": 0.0003957599028095371, "loss": 6.664, "mean_token_accuracy": 0.10505481734871865, "num_tokens": 3976020.0, "step": 1960 }, { "entropy": 6.842778825759888, "epoch": 0.11501316944688324, "grad_norm": 0.9765625, "learning_rate": 0.00039476421319679017, "loss": 6.4668, "mean_token_accuracy": 0.12651116624474526, "num_tokens": 3986642.0, "step": 1965 }, { "entropy": 6.6270751953125, "epoch": 0.11530582382206614, "grad_norm": 0.984375, "learning_rate": 0.00039376524018764, "loss": 6.4971, "mean_token_accuracy": 0.12009134292602539, "num_tokens": 3997343.0, "step": 1970 }, { "entropy": 6.695995426177978, "epoch": 0.11559847819724905, "grad_norm": 0.96875, "learning_rate": 0.00039276301116943616, "loss": 6.417, "mean_token_accuracy": 0.12686994075775146, "num_tokens": 4007715.0, "step": 1975 }, { "entropy": 6.663046932220459, "epoch": 0.11589113257243196, "grad_norm": 0.90234375, "learning_rate": 0.0003917575536187936, "loss": 6.5211, "mean_token_accuracy": 0.1214706502854824, "num_tokens": 4018268.0, "step": 1980 }, { "entropy": 6.7626746654510494, "epoch": 0.11618378694761487, "grad_norm": 0.87109375, "learning_rate": 0.00039074889510083894, "loss": 6.4082, "mean_token_accuracy": 0.12497928068041801, "num_tokens": 4028539.0, "step": 1985 }, { "entropy": 6.682868528366089, "epoch": 0.11647644132279777, "grad_norm": 0.91796875, "learning_rate": 0.00038973706326845495, "loss": 6.4965, "mean_token_accuracy": 0.12758915945887567, "num_tokens": 4039300.0, "step": 1990 }, { "entropy": 6.666601848602295, "epoch": 0.11676909569798069, "grad_norm": 1.0078125, "learning_rate": 0.0003887220858615225, "loss": 6.5343, "mean_token_accuracy": 0.11495309770107269, "num_tokens": 4048471.0, "step": 1995 }, { "entropy": 6.751353979110718, "epoch": 0.11706175007316359, "grad_norm": 0.91796875, "learning_rate": 0.0003877039907061597, "loss": 6.3476, "mean_token_accuracy": 0.1322360999882221, "num_tokens": 4058221.0, "step": 2000 }, { "entropy": 6.626428461074829, "epoch": 0.11735440444834651, "grad_norm": 0.9140625, "learning_rate": 0.0003866828057139598, "loss": 6.4286, "mean_token_accuracy": 0.13097614645957947, "num_tokens": 4067617.0, "step": 2005 }, { "entropy": 6.727088737487793, "epoch": 0.11764705882352941, "grad_norm": 1.0859375, "learning_rate": 0.00038565855888122503, "loss": 6.4454, "mean_token_accuracy": 0.12304920554161072, "num_tokens": 4076530.0, "step": 2010 }, { "entropy": 6.606106758117676, "epoch": 0.11793971319871233, "grad_norm": 0.875, "learning_rate": 0.00038463127828819975, "loss": 6.4303, "mean_token_accuracy": 0.12969082817435265, "num_tokens": 4087081.0, "step": 2015 }, { "entropy": 6.735717344284057, "epoch": 0.11823236757389523, "grad_norm": 0.8671875, "learning_rate": 0.00038360099209830043, "loss": 6.4965, "mean_token_accuracy": 0.12473658993840217, "num_tokens": 4098289.0, "step": 2020 }, { "entropy": 6.674237775802612, "epoch": 0.11852502194907814, "grad_norm": 0.9140625, "learning_rate": 0.0003825677285573433, "loss": 6.4984, "mean_token_accuracy": 0.12176326215267182, "num_tokens": 4109023.0, "step": 2025 }, { "entropy": 6.659593296051026, "epoch": 0.11881767632426105, "grad_norm": 0.953125, "learning_rate": 0.00038153151599277027, "loss": 6.4003, "mean_token_accuracy": 0.12995235100388527, "num_tokens": 4118622.0, "step": 2030 }, { "entropy": 6.662193441390992, "epoch": 0.11911033069944396, "grad_norm": 0.8984375, "learning_rate": 0.0003804923828128723, "loss": 6.4167, "mean_token_accuracy": 0.12718778625130653, "num_tokens": 4129117.0, "step": 2035 }, { "entropy": 6.673795127868653, "epoch": 0.11940298507462686, "grad_norm": 0.98046875, "learning_rate": 0.0003794503575060104, "loss": 6.501, "mean_token_accuracy": 0.1230692744255066, "num_tokens": 4139979.0, "step": 2040 }, { "entropy": 6.691799020767212, "epoch": 0.11969563944980978, "grad_norm": 0.83203125, "learning_rate": 0.00037840546863983484, "loss": 6.4137, "mean_token_accuracy": 0.12930611968040467, "num_tokens": 4151445.0, "step": 2045 }, { "entropy": 6.621114921569824, "epoch": 0.11998829382499268, "grad_norm": 0.95703125, "learning_rate": 0.0003773577448605015, "loss": 6.4167, "mean_token_accuracy": 0.12460907250642776, "num_tokens": 4162457.0, "step": 2050 }, { "entropy": 6.685143518447876, "epoch": 0.1202809482001756, "grad_norm": 1.0234375, "learning_rate": 0.0003763072148918872, "loss": 6.381, "mean_token_accuracy": 0.1308208040893078, "num_tokens": 4172204.0, "step": 2055 }, { "entropy": 6.650257015228272, "epoch": 0.1205736025753585, "grad_norm": 0.8984375, "learning_rate": 0.0003752539075348017, "loss": 6.4169, "mean_token_accuracy": 0.12551707699894904, "num_tokens": 4182219.0, "step": 2060 }, { "entropy": 6.686775350570679, "epoch": 0.12086625695054141, "grad_norm": 0.9375, "learning_rate": 0.00037419785166619817, "loss": 6.4207, "mean_token_accuracy": 0.12680845633149146, "num_tokens": 4194192.0, "step": 2065 }, { "entropy": 6.645538425445556, "epoch": 0.12115891132572432, "grad_norm": 1.0234375, "learning_rate": 0.0003731390762383818, "loss": 6.4217, "mean_token_accuracy": 0.1262901932001114, "num_tokens": 4204461.0, "step": 2070 }, { "entropy": 6.6539043426513675, "epoch": 0.12145156570090723, "grad_norm": 1.0, "learning_rate": 0.0003720776102782158, "loss": 6.4641, "mean_token_accuracy": 0.12074286341667176, "num_tokens": 4214317.0, "step": 2075 }, { "entropy": 6.769407320022583, "epoch": 0.12174422007609013, "grad_norm": 0.95703125, "learning_rate": 0.00037101348288632555, "loss": 6.4226, "mean_token_accuracy": 0.12740262746810913, "num_tokens": 4225507.0, "step": 2080 }, { "entropy": 6.643149042129517, "epoch": 0.12203687445127305, "grad_norm": 0.83984375, "learning_rate": 0.0003699467232363012, "loss": 6.459, "mean_token_accuracy": 0.12595532685518265, "num_tokens": 4235836.0, "step": 2085 }, { "entropy": 6.66497015953064, "epoch": 0.12232952882645595, "grad_norm": 0.90234375, "learning_rate": 0.0003688773605738973, "loss": 6.4019, "mean_token_accuracy": 0.12867318093776703, "num_tokens": 4246797.0, "step": 2090 }, { "entropy": 6.679510068893433, "epoch": 0.12262218320163887, "grad_norm": 0.87109375, "learning_rate": 0.00036780542421623134, "loss": 6.3874, "mean_token_accuracy": 0.12614520490169526, "num_tokens": 4258084.0, "step": 2095 }, { "entropy": 6.631268167495728, "epoch": 0.12291483757682177, "grad_norm": 0.94921875, "learning_rate": 0.0003667309435509802, "loss": 6.4642, "mean_token_accuracy": 0.12479421123862267, "num_tokens": 4267756.0, "step": 2100 }, { "entropy": 6.686967182159424, "epoch": 0.12320749195200469, "grad_norm": 0.87890625, "learning_rate": 0.0003656539480355741, "loss": 6.3988, "mean_token_accuracy": 0.12740305736660956, "num_tokens": 4278888.0, "step": 2105 }, { "entropy": 6.60836615562439, "epoch": 0.12350014632718759, "grad_norm": 0.984375, "learning_rate": 0.0003645744671963891, "loss": 6.4196, "mean_token_accuracy": 0.12640116214752198, "num_tokens": 4289787.0, "step": 2110 }, { "entropy": 6.730862092971802, "epoch": 0.1237928007023705, "grad_norm": 0.99609375, "learning_rate": 0.0003634925306279376, "loss": 6.3724, "mean_token_accuracy": 0.1258112333714962, "num_tokens": 4299951.0, "step": 2115 }, { "entropy": 6.61127495765686, "epoch": 0.1240854550775534, "grad_norm": 1.03125, "learning_rate": 0.0003624081679920574, "loss": 6.4036, "mean_token_accuracy": 0.12645921409130095, "num_tokens": 4309143.0, "step": 2120 }, { "entropy": 6.6258745193481445, "epoch": 0.12437810945273632, "grad_norm": 1.0703125, "learning_rate": 0.0003613214090170977, "loss": 6.3417, "mean_token_accuracy": 0.13214187398552896, "num_tokens": 4319121.0, "step": 2125 }, { "entropy": 6.667118978500366, "epoch": 0.12467076382791922, "grad_norm": 0.875, "learning_rate": 0.0003602322834971048, "loss": 6.3238, "mean_token_accuracy": 0.134113297611475, "num_tokens": 4329031.0, "step": 2130 }, { "entropy": 6.549208688735962, "epoch": 0.12496341820310214, "grad_norm": 0.92578125, "learning_rate": 0.0003591408212910051, "loss": 6.4242, "mean_token_accuracy": 0.12980442717671395, "num_tokens": 4339255.0, "step": 2135 }, { "entropy": 6.63796215057373, "epoch": 0.12525607257828505, "grad_norm": 0.95703125, "learning_rate": 0.0003580470523217863, "loss": 6.3766, "mean_token_accuracy": 0.13202663511037827, "num_tokens": 4348993.0, "step": 2140 }, { "entropy": 6.635591173171997, "epoch": 0.12554872695346794, "grad_norm": 0.90234375, "learning_rate": 0.0003569510065756771, "loss": 6.3601, "mean_token_accuracy": 0.1303073823451996, "num_tokens": 4359614.0, "step": 2145 }, { "entropy": 6.671686458587646, "epoch": 0.12584138132865086, "grad_norm": 1.0234375, "learning_rate": 0.0003558527141013254, "loss": 6.4148, "mean_token_accuracy": 0.1251296579837799, "num_tokens": 4369385.0, "step": 2150 }, { "entropy": 6.61700553894043, "epoch": 0.12613403570383377, "grad_norm": 1.0234375, "learning_rate": 0.0003547522050089742, "loss": 6.2875, "mean_token_accuracy": 0.12825888618826867, "num_tokens": 4378812.0, "step": 2155 }, { "entropy": 6.603330373764038, "epoch": 0.1264266900790167, "grad_norm": 0.9296875, "learning_rate": 0.00035364950946963606, "loss": 6.3623, "mean_token_accuracy": 0.12848870530724527, "num_tokens": 4389505.0, "step": 2160 }, { "entropy": 6.6235908508300785, "epoch": 0.12671934445419958, "grad_norm": 0.8828125, "learning_rate": 0.0003525446577142663, "loss": 6.3429, "mean_token_accuracy": 0.13325420394539833, "num_tokens": 4399286.0, "step": 2165 }, { "entropy": 6.552273988723755, "epoch": 0.1270119988293825, "grad_norm": 0.828125, "learning_rate": 0.00035143768003293395, "loss": 6.3587, "mean_token_accuracy": 0.1344788283109665, "num_tokens": 4410193.0, "step": 2170 }, { "entropy": 6.6747089385986325, "epoch": 0.1273046532045654, "grad_norm": 0.85546875, "learning_rate": 0.0003503286067739913, "loss": 6.5479, "mean_token_accuracy": 0.11597675085067749, "num_tokens": 4420387.0, "step": 2175 }, { "entropy": 6.71555118560791, "epoch": 0.12759730757974833, "grad_norm": 0.890625, "learning_rate": 0.00034921746834324193, "loss": 6.3986, "mean_token_accuracy": 0.12882070094347, "num_tokens": 4430638.0, "step": 2180 }, { "entropy": 6.588705921173096, "epoch": 0.12788996195493121, "grad_norm": 0.82421875, "learning_rate": 0.0003481042952031072, "loss": 6.3764, "mean_token_accuracy": 0.13474897891283036, "num_tokens": 4442303.0, "step": 2185 }, { "entropy": 6.620761775970459, "epoch": 0.12818261633011413, "grad_norm": 0.953125, "learning_rate": 0.0003469891178717911, "loss": 6.3192, "mean_token_accuracy": 0.13396589383482932, "num_tokens": 4452080.0, "step": 2190 }, { "entropy": 6.566491794586182, "epoch": 0.12847527070529705, "grad_norm": 0.8671875, "learning_rate": 0.0003458719669224436, "loss": 6.3077, "mean_token_accuracy": 0.13419256508350372, "num_tokens": 4461709.0, "step": 2195 }, { "entropy": 6.61617431640625, "epoch": 0.12876792508047996, "grad_norm": 0.9921875, "learning_rate": 0.0003447528729823221, "loss": 6.4302, "mean_token_accuracy": 0.1304625764489174, "num_tokens": 4470778.0, "step": 2200 }, { "entropy": 6.670851564407348, "epoch": 0.12906057945566285, "grad_norm": 0.91796875, "learning_rate": 0.0003436318667319525, "loss": 6.3604, "mean_token_accuracy": 0.12824845388531686, "num_tokens": 4481329.0, "step": 2205 }, { "entropy": 6.637941455841064, "epoch": 0.12935323383084577, "grad_norm": 0.8359375, "learning_rate": 0.00034250897890428716, "loss": 6.4174, "mean_token_accuracy": 0.12477430030703544, "num_tokens": 4492159.0, "step": 2210 }, { "entropy": 6.613152647018433, "epoch": 0.12964588820602868, "grad_norm": 0.87890625, "learning_rate": 0.0003413842402838633, "loss": 6.2514, "mean_token_accuracy": 0.14181035682559012, "num_tokens": 4501842.0, "step": 2215 }, { "entropy": 6.536275053024292, "epoch": 0.1299385425812116, "grad_norm": 0.98828125, "learning_rate": 0.00034025768170595834, "loss": 6.3601, "mean_token_accuracy": 0.13193768858909607, "num_tokens": 4511398.0, "step": 2220 }, { "entropy": 6.626315975189209, "epoch": 0.13023119695639448, "grad_norm": 0.98828125, "learning_rate": 0.0003391293340557446, "loss": 6.3706, "mean_token_accuracy": 0.12933078706264495, "num_tokens": 4521061.0, "step": 2225 }, { "entropy": 6.640750551223755, "epoch": 0.1305238513315774, "grad_norm": 0.88671875, "learning_rate": 0.0003379992282674431, "loss": 6.3861, "mean_token_accuracy": 0.1284594379365444, "num_tokens": 4532242.0, "step": 2230 }, { "entropy": 6.626450490951538, "epoch": 0.13081650570676032, "grad_norm": 0.93359375, "learning_rate": 0.0003368673953234749, "loss": 6.3534, "mean_token_accuracy": 0.13135328367352486, "num_tokens": 4542399.0, "step": 2235 }, { "entropy": 6.593724727630615, "epoch": 0.13110916008194323, "grad_norm": 0.953125, "learning_rate": 0.00033573386625361176, "loss": 6.2935, "mean_token_accuracy": 0.13625863939523697, "num_tokens": 4552466.0, "step": 2240 }, { "entropy": 6.692444801330566, "epoch": 0.13140181445712612, "grad_norm": 0.98046875, "learning_rate": 0.00033459867213412567, "loss": 6.3805, "mean_token_accuracy": 0.13012552857398987, "num_tokens": 4562095.0, "step": 2245 }, { "entropy": 6.56951789855957, "epoch": 0.13169446883230904, "grad_norm": 0.953125, "learning_rate": 0.000333461844086937, "loss": 6.344, "mean_token_accuracy": 0.13196654096245766, "num_tokens": 4572304.0, "step": 2250 }, { "entropy": 6.572604179382324, "epoch": 0.13198712320749195, "grad_norm": 0.92578125, "learning_rate": 0.00033232341327876097, "loss": 6.3112, "mean_token_accuracy": 0.1351053647696972, "num_tokens": 4582255.0, "step": 2255 }, { "entropy": 6.682241487503052, "epoch": 0.13227977758267487, "grad_norm": 0.921875, "learning_rate": 0.0003311834109202531, "loss": 6.3882, "mean_token_accuracy": 0.13199552297592163, "num_tokens": 4593315.0, "step": 2260 }, { "entropy": 6.572966384887695, "epoch": 0.13257243195785778, "grad_norm": 0.953125, "learning_rate": 0.00033004186826515416, "loss": 6.3876, "mean_token_accuracy": 0.1297772228717804, "num_tokens": 4604635.0, "step": 2265 }, { "entropy": 6.5704100131988525, "epoch": 0.13286508633304067, "grad_norm": 0.86328125, "learning_rate": 0.0003288988166094324, "loss": 6.3848, "mean_token_accuracy": 0.13028332516551017, "num_tokens": 4616097.0, "step": 2270 }, { "entropy": 6.675870656967163, "epoch": 0.1331577407082236, "grad_norm": 0.96484375, "learning_rate": 0.00032775428729042656, "loss": 6.3909, "mean_token_accuracy": 0.13196725845336915, "num_tokens": 4626163.0, "step": 2275 }, { "entropy": 6.585020303726196, "epoch": 0.1334503950834065, "grad_norm": 1.078125, "learning_rate": 0.000326608311685986, "loss": 6.3564, "mean_token_accuracy": 0.1344081051647663, "num_tokens": 4637141.0, "step": 2280 }, { "entropy": 6.638718938827514, "epoch": 0.13374304945858942, "grad_norm": 0.9140625, "learning_rate": 0.0003254609212136108, "loss": 6.3177, "mean_token_accuracy": 0.1317195251584053, "num_tokens": 4646832.0, "step": 2285 }, { "entropy": 6.591185808181763, "epoch": 0.1340357038337723, "grad_norm": 0.94140625, "learning_rate": 0.00032431214732959036, "loss": 6.3363, "mean_token_accuracy": 0.12970326319336892, "num_tokens": 4656477.0, "step": 2290 }, { "entropy": 6.58276629447937, "epoch": 0.13432835820895522, "grad_norm": 0.94921875, "learning_rate": 0.000323162021528141, "loss": 6.3449, "mean_token_accuracy": 0.12856401205062867, "num_tokens": 4666682.0, "step": 2295 }, { "entropy": 6.571887540817261, "epoch": 0.13462101258413814, "grad_norm": 0.9375, "learning_rate": 0.00032201057534054264, "loss": 6.3592, "mean_token_accuracy": 0.1295217268168926, "num_tokens": 4677486.0, "step": 2300 }, { "entropy": 6.6181275844573975, "epoch": 0.13491366695932105, "grad_norm": 0.8828125, "learning_rate": 0.00032085784033427414, "loss": 6.3636, "mean_token_accuracy": 0.1326647162437439, "num_tokens": 4689129.0, "step": 2305 }, { "entropy": 6.634070110321045, "epoch": 0.13520632133450394, "grad_norm": 0.921875, "learning_rate": 0.0003197038481121478, "loss": 6.3965, "mean_token_accuracy": 0.12682358771562577, "num_tokens": 4699820.0, "step": 2310 }, { "entropy": 6.519108438491822, "epoch": 0.13549897570968686, "grad_norm": 0.953125, "learning_rate": 0.0003185486303114436, "loss": 6.3451, "mean_token_accuracy": 0.13321323022246362, "num_tokens": 4710080.0, "step": 2315 }, { "entropy": 6.661201143264771, "epoch": 0.13579163008486977, "grad_norm": 1.046875, "learning_rate": 0.0003173922186030409, "loss": 6.3158, "mean_token_accuracy": 0.13595361337065698, "num_tokens": 4719941.0, "step": 2320 }, { "entropy": 6.571690034866333, "epoch": 0.1360842844600527, "grad_norm": 0.94140625, "learning_rate": 0.000316234644690551, "loss": 6.321, "mean_token_accuracy": 0.13446008861064912, "num_tokens": 4730529.0, "step": 2325 }, { "entropy": 6.571829795837402, "epoch": 0.13637693883523558, "grad_norm": 0.87890625, "learning_rate": 0.0003150759403094473, "loss": 6.3642, "mean_token_accuracy": 0.12646636441349984, "num_tokens": 4740643.0, "step": 2330 }, { "entropy": 6.626566600799561, "epoch": 0.1366695932104185, "grad_norm": 0.9453125, "learning_rate": 0.00031391613722619587, "loss": 6.3391, "mean_token_accuracy": 0.13109509497880936, "num_tokens": 4751079.0, "step": 2335 }, { "entropy": 6.638620090484619, "epoch": 0.1369622475856014, "grad_norm": 0.84375, "learning_rate": 0.000312755267237384, "loss": 6.2545, "mean_token_accuracy": 0.132995867729187, "num_tokens": 4762110.0, "step": 2340 }, { "entropy": 6.604851627349854, "epoch": 0.13725490196078433, "grad_norm": 0.859375, "learning_rate": 0.0003115933621688488, "loss": 6.2205, "mean_token_accuracy": 0.1372155912220478, "num_tokens": 4771663.0, "step": 2345 }, { "entropy": 6.5505592823028564, "epoch": 0.1375475563359672, "grad_norm": 0.91015625, "learning_rate": 0.00031043045387480487, "loss": 6.3195, "mean_token_accuracy": 0.12606247812509536, "num_tokens": 4783371.0, "step": 2350 }, { "entropy": 6.547402954101562, "epoch": 0.13784021071115013, "grad_norm": 0.9140625, "learning_rate": 0.0003092665742369703, "loss": 6.2345, "mean_token_accuracy": 0.14305853918194772, "num_tokens": 4792783.0, "step": 2355 }, { "entropy": 6.582607078552246, "epoch": 0.13813286508633305, "grad_norm": 0.98828125, "learning_rate": 0.00030810175516369343, "loss": 6.2821, "mean_token_accuracy": 0.129033812135458, "num_tokens": 4802868.0, "step": 2360 }, { "entropy": 6.554081535339355, "epoch": 0.13842551946151596, "grad_norm": 0.9609375, "learning_rate": 0.0003069360285890775, "loss": 6.3168, "mean_token_accuracy": 0.1346677489578724, "num_tokens": 4812456.0, "step": 2365 }, { "entropy": 6.716797685623169, "epoch": 0.13871817383669885, "grad_norm": 0.96875, "learning_rate": 0.00030576942647210547, "loss": 6.3953, "mean_token_accuracy": 0.13068155571818352, "num_tokens": 4822706.0, "step": 2370 }, { "entropy": 6.6018290519714355, "epoch": 0.13901082821188177, "grad_norm": 1.109375, "learning_rate": 0.00030460198079576355, "loss": 6.3315, "mean_token_accuracy": 0.12894112542271613, "num_tokens": 4832573.0, "step": 2375 }, { "entropy": 6.542349767684937, "epoch": 0.13930348258706468, "grad_norm": 0.96875, "learning_rate": 0.0003034337235661648, "loss": 6.342, "mean_token_accuracy": 0.13533625453710557, "num_tokens": 4842097.0, "step": 2380 }, { "entropy": 6.598580312728882, "epoch": 0.1395961369622476, "grad_norm": 1.0234375, "learning_rate": 0.0003022646868116714, "loss": 6.3095, "mean_token_accuracy": 0.13526476547122002, "num_tokens": 4851986.0, "step": 2385 }, { "entropy": 6.5494890213012695, "epoch": 0.13988879133743048, "grad_norm": 0.984375, "learning_rate": 0.0003010949025820163, "loss": 6.2412, "mean_token_accuracy": 0.13428325429558755, "num_tokens": 4861973.0, "step": 2390 }, { "entropy": 6.5741476058959964, "epoch": 0.1401814457126134, "grad_norm": 0.99609375, "learning_rate": 0.0002999244029474252, "loss": 6.2878, "mean_token_accuracy": 0.1243141733109951, "num_tokens": 4871376.0, "step": 2395 }, { "entropy": 6.514613056182862, "epoch": 0.14047410008779632, "grad_norm": 0.93359375, "learning_rate": 0.00029875321999773684, "loss": 6.2938, "mean_token_accuracy": 0.1365303985774517, "num_tokens": 4881777.0, "step": 2400 }, { "entropy": 6.535431003570556, "epoch": 0.14076675446297923, "grad_norm": 0.97265625, "learning_rate": 0.00029758138584152333, "loss": 6.2778, "mean_token_accuracy": 0.13786163926124573, "num_tokens": 4892044.0, "step": 2405 }, { "entropy": 6.535160064697266, "epoch": 0.14105940883816212, "grad_norm": 0.96875, "learning_rate": 0.0002964089326052102, "loss": 6.2575, "mean_token_accuracy": 0.13284377455711366, "num_tokens": 4902851.0, "step": 2410 }, { "entropy": 6.588398790359497, "epoch": 0.14135206321334504, "grad_norm": 0.91015625, "learning_rate": 0.0002952358924321949, "loss": 6.2731, "mean_token_accuracy": 0.13292827159166337, "num_tokens": 4912567.0, "step": 2415 }, { "entropy": 6.61859164237976, "epoch": 0.14164471758852795, "grad_norm": 1.0078125, "learning_rate": 0.00029406229748196657, "loss": 6.3235, "mean_token_accuracy": 0.13645606413483619, "num_tokens": 4923506.0, "step": 2420 }, { "entropy": 6.613209962844849, "epoch": 0.14193737196371087, "grad_norm": 1.0234375, "learning_rate": 0.0002928881799292235, "loss": 6.3552, "mean_token_accuracy": 0.13131646066904068, "num_tokens": 4933229.0, "step": 2425 }, { "entropy": 6.630974626541137, "epoch": 0.14223002633889376, "grad_norm": 0.953125, "learning_rate": 0.00029171357196299154, "loss": 6.3079, "mean_token_accuracy": 0.1362503670156002, "num_tokens": 4943845.0, "step": 2430 }, { "entropy": 6.498490715026856, "epoch": 0.14252268071407667, "grad_norm": 0.96484375, "learning_rate": 0.0002905385057857414, "loss": 6.1914, "mean_token_accuracy": 0.13855512589216232, "num_tokens": 4953453.0, "step": 2435 }, { "entropy": 6.618788242340088, "epoch": 0.1428153350892596, "grad_norm": 0.9609375, "learning_rate": 0.0002893630136125058, "loss": 6.2676, "mean_token_accuracy": 0.13731593489646912, "num_tokens": 4962662.0, "step": 2440 }, { "entropy": 6.614573764801025, "epoch": 0.1431079894644425, "grad_norm": 0.8359375, "learning_rate": 0.0002881871276699967, "loss": 6.3238, "mean_token_accuracy": 0.13058529421687126, "num_tokens": 4973256.0, "step": 2445 }, { "entropy": 6.581136035919189, "epoch": 0.1434006438396254, "grad_norm": 1.0546875, "learning_rate": 0.00028701088019572114, "loss": 6.3168, "mean_token_accuracy": 0.13196835592389106, "num_tokens": 4983569.0, "step": 2450 }, { "entropy": 6.557302951812744, "epoch": 0.1436932982148083, "grad_norm": 1.0234375, "learning_rate": 0.0002858343034370977, "loss": 6.207, "mean_token_accuracy": 0.14453484937548639, "num_tokens": 4992163.0, "step": 2455 }, { "entropy": 6.532128620147705, "epoch": 0.14398595258999122, "grad_norm": 0.84765625, "learning_rate": 0.00028465742965057267, "loss": 6.3026, "mean_token_accuracy": 0.1332960121333599, "num_tokens": 5002952.0, "step": 2460 }, { "entropy": 6.549730396270752, "epoch": 0.14427860696517414, "grad_norm": 1.0078125, "learning_rate": 0.00028348029110073533, "loss": 6.3004, "mean_token_accuracy": 0.13769194781780242, "num_tokens": 5012954.0, "step": 2465 }, { "entropy": 6.593349933624268, "epoch": 0.14457126134035703, "grad_norm": 0.9296875, "learning_rate": 0.00028230292005943365, "loss": 6.2794, "mean_token_accuracy": 0.13775826916098594, "num_tokens": 5022845.0, "step": 2470 }, { "entropy": 6.5862006664276125, "epoch": 0.14486391571553994, "grad_norm": 0.94140625, "learning_rate": 0.00028112534880488945, "loss": 6.3463, "mean_token_accuracy": 0.13272640109062195, "num_tokens": 5033149.0, "step": 2475 }, { "entropy": 6.484812211990357, "epoch": 0.14515657009072286, "grad_norm": 0.89453125, "learning_rate": 0.0002799476096208137, "loss": 6.3181, "mean_token_accuracy": 0.13179948031902314, "num_tokens": 5044129.0, "step": 2480 }, { "entropy": 6.560931062698364, "epoch": 0.14544922446590577, "grad_norm": 0.84765625, "learning_rate": 0.00027876973479552087, "loss": 6.3018, "mean_token_accuracy": 0.13927531391382217, "num_tokens": 5054165.0, "step": 2485 }, { "entropy": 6.667717742919922, "epoch": 0.14574187884108866, "grad_norm": 1.0390625, "learning_rate": 0.00027759175662104424, "loss": 6.3385, "mean_token_accuracy": 0.1275913529098034, "num_tokens": 5064974.0, "step": 2490 }, { "entropy": 6.605099773406982, "epoch": 0.14603453321627158, "grad_norm": 1.0859375, "learning_rate": 0.0002764137073922508, "loss": 6.223, "mean_token_accuracy": 0.13924818709492684, "num_tokens": 5075929.0, "step": 2495 }, { "entropy": 6.5237668514251705, "epoch": 0.1463271875914545, "grad_norm": 0.9609375, "learning_rate": 0.00027523561940595505, "loss": 6.2204, "mean_token_accuracy": 0.13466374427080155, "num_tokens": 5086043.0, "step": 2500 }, { "entropy": 6.543189954757691, "epoch": 0.1466198419666374, "grad_norm": 1.0078125, "learning_rate": 0.0002740575249600342, "loss": 6.2998, "mean_token_accuracy": 0.133786079287529, "num_tokens": 5096706.0, "step": 2505 }, { "entropy": 6.644468879699707, "epoch": 0.1469124963418203, "grad_norm": 0.9765625, "learning_rate": 0.00027287945635254263, "loss": 6.3722, "mean_token_accuracy": 0.12882938534021376, "num_tokens": 5107301.0, "step": 2510 }, { "entropy": 6.59978609085083, "epoch": 0.1472051507170032, "grad_norm": 0.90625, "learning_rate": 0.00027170144588082635, "loss": 6.2677, "mean_token_accuracy": 0.14094802588224412, "num_tokens": 5117420.0, "step": 2515 }, { "entropy": 6.5375994682312015, "epoch": 0.14749780509218613, "grad_norm": 0.98828125, "learning_rate": 0.00027052352584063763, "loss": 6.1408, "mean_token_accuracy": 0.14534125626087188, "num_tokens": 5126637.0, "step": 2520 }, { "entropy": 6.5622704982757565, "epoch": 0.14779045946736905, "grad_norm": 0.85546875, "learning_rate": 0.00026934572852524907, "loss": 6.1739, "mean_token_accuracy": 0.14493270441889763, "num_tokens": 5136591.0, "step": 2525 }, { "entropy": 6.587195777893067, "epoch": 0.14808311384255193, "grad_norm": 0.95703125, "learning_rate": 0.00026816808622456937, "loss": 6.2584, "mean_token_accuracy": 0.13577966690063475, "num_tokens": 5146254.0, "step": 2530 }, { "entropy": 6.565539360046387, "epoch": 0.14837576821773485, "grad_norm": 0.9296875, "learning_rate": 0.0002669906312242569, "loss": 6.3703, "mean_token_accuracy": 0.13128052577376365, "num_tokens": 5157360.0, "step": 2535 }, { "entropy": 6.5541015625, "epoch": 0.14866842259291776, "grad_norm": 0.94921875, "learning_rate": 0.00026581339580483525, "loss": 6.2741, "mean_token_accuracy": 0.13503245040774345, "num_tokens": 5167775.0, "step": 2540 }, { "entropy": 6.557196617126465, "epoch": 0.14896107696810068, "grad_norm": 0.8515625, "learning_rate": 0.0002646364122408082, "loss": 6.2356, "mean_token_accuracy": 0.1360543005168438, "num_tokens": 5177990.0, "step": 2545 }, { "entropy": 6.580082654953003, "epoch": 0.14925373134328357, "grad_norm": 0.9765625, "learning_rate": 0.0002634597127997749, "loss": 6.2266, "mean_token_accuracy": 0.139044576138258, "num_tokens": 5187098.0, "step": 2550 }, { "entropy": 6.485968780517578, "epoch": 0.14954638571846648, "grad_norm": 0.9765625, "learning_rate": 0.0002622833297415445, "loss": 6.2018, "mean_token_accuracy": 0.14275476485490798, "num_tokens": 5196381.0, "step": 2555 }, { "entropy": 6.508991670608521, "epoch": 0.1498390400936494, "grad_norm": 1.0859375, "learning_rate": 0.0002611072953172531, "loss": 6.217, "mean_token_accuracy": 0.13808079287409783, "num_tokens": 5205948.0, "step": 2560 }, { "entropy": 6.555392408370972, "epoch": 0.15013169446883232, "grad_norm": 1.0078125, "learning_rate": 0.00025993164176847845, "loss": 6.2543, "mean_token_accuracy": 0.14129054993391038, "num_tokens": 5215986.0, "step": 2565 }, { "entropy": 6.556317567825317, "epoch": 0.1504243488440152, "grad_norm": 0.89453125, "learning_rate": 0.0002587564013263564, "loss": 6.2267, "mean_token_accuracy": 0.13913317769765854, "num_tokens": 5225456.0, "step": 2570 }, { "entropy": 6.496306562423706, "epoch": 0.15071700321919812, "grad_norm": 0.89453125, "learning_rate": 0.0002575816062106974, "loss": 6.2441, "mean_token_accuracy": 0.13501543253660203, "num_tokens": 5236615.0, "step": 2575 }, { "entropy": 6.482434940338135, "epoch": 0.15100965759438104, "grad_norm": 0.87109375, "learning_rate": 0.00025640728862910293, "loss": 6.1802, "mean_token_accuracy": 0.14192271158099173, "num_tokens": 5246557.0, "step": 2580 }, { "entropy": 6.484745883941651, "epoch": 0.15130231196956395, "grad_norm": 0.83984375, "learning_rate": 0.00025523348077608285, "loss": 6.1694, "mean_token_accuracy": 0.14211384803056717, "num_tokens": 5256692.0, "step": 2585 }, { "entropy": 6.553393745422364, "epoch": 0.15159496634474687, "grad_norm": 0.9296875, "learning_rate": 0.00025406021483217225, "loss": 6.2248, "mean_token_accuracy": 0.1350661352276802, "num_tokens": 5266637.0, "step": 2590 }, { "entropy": 6.563928937911987, "epoch": 0.15188762071992976, "grad_norm": 0.94140625, "learning_rate": 0.00025288752296304963, "loss": 6.2597, "mean_token_accuracy": 0.13457316160202026, "num_tokens": 5276549.0, "step": 2595 }, { "entropy": 6.507853937149048, "epoch": 0.15218027509511267, "grad_norm": 1.015625, "learning_rate": 0.000251715437318655, "loss": 6.205, "mean_token_accuracy": 0.14360155612230302, "num_tokens": 5286747.0, "step": 2600 }, { "entropy": 6.470801210403442, "epoch": 0.1524729294702956, "grad_norm": 0.82421875, "learning_rate": 0.0002505439900323084, "loss": 6.227, "mean_token_accuracy": 0.13453298360109328, "num_tokens": 5297623.0, "step": 2605 }, { "entropy": 6.477011060714721, "epoch": 0.1527655838454785, "grad_norm": 0.953125, "learning_rate": 0.00024937321321982894, "loss": 6.2244, "mean_token_accuracy": 0.13981337025761603, "num_tokens": 5307281.0, "step": 2610 }, { "entropy": 6.563910579681396, "epoch": 0.1530582382206614, "grad_norm": 0.91015625, "learning_rate": 0.00024820313897865433, "loss": 6.2464, "mean_token_accuracy": 0.13410933464765548, "num_tokens": 5317908.0, "step": 2615 }, { "entropy": 6.533686399459839, "epoch": 0.1533508925958443, "grad_norm": 0.87890625, "learning_rate": 0.00024703379938696105, "loss": 6.2551, "mean_token_accuracy": 0.13540789857506752, "num_tokens": 5328263.0, "step": 2620 }, { "entropy": 6.6188063621521, "epoch": 0.15364354697102722, "grad_norm": 0.95703125, "learning_rate": 0.00024586522650278447, "loss": 6.3039, "mean_token_accuracy": 0.1347327299416065, "num_tokens": 5338320.0, "step": 2625 }, { "entropy": 6.533732938766479, "epoch": 0.15393620134621014, "grad_norm": 1.0078125, "learning_rate": 0.00024469745236314064, "loss": 6.2127, "mean_token_accuracy": 0.146664909273386, "num_tokens": 5348530.0, "step": 2630 }, { "entropy": 6.499366760253906, "epoch": 0.15422885572139303, "grad_norm": 0.921875, "learning_rate": 0.00024353050898314767, "loss": 6.2532, "mean_token_accuracy": 0.14155993312597276, "num_tokens": 5359019.0, "step": 2635 }, { "entropy": 6.532890844345093, "epoch": 0.15452151009657594, "grad_norm": 0.9140625, "learning_rate": 0.00024236442835514743, "loss": 6.1813, "mean_token_accuracy": 0.14301421344280243, "num_tokens": 5368728.0, "step": 2640 }, { "entropy": 6.561751651763916, "epoch": 0.15481416447175886, "grad_norm": 0.9375, "learning_rate": 0.00024119924244782965, "loss": 6.2424, "mean_token_accuracy": 0.13430066108703614, "num_tokens": 5379941.0, "step": 2645 }, { "entropy": 6.56638011932373, "epoch": 0.15510681884694177, "grad_norm": 1.015625, "learning_rate": 0.00024003498320535462, "loss": 6.2315, "mean_token_accuracy": 0.13989165276288987, "num_tokens": 5389120.0, "step": 2650 }, { "entropy": 6.558014535903931, "epoch": 0.15539947322212466, "grad_norm": 0.98828125, "learning_rate": 0.00023887168254647727, "loss": 6.2807, "mean_token_accuracy": 0.13791248202323914, "num_tokens": 5398705.0, "step": 2655 }, { "entropy": 6.51059045791626, "epoch": 0.15569212759730758, "grad_norm": 0.91015625, "learning_rate": 0.00023770937236367308, "loss": 6.203, "mean_token_accuracy": 0.1383495733141899, "num_tokens": 5409564.0, "step": 2660 }, { "entropy": 6.565548896789551, "epoch": 0.1559847819724905, "grad_norm": 0.9453125, "learning_rate": 0.00023654808452226278, "loss": 6.2205, "mean_token_accuracy": 0.13802594617009162, "num_tokens": 5418903.0, "step": 2665 }, { "entropy": 6.5598227977752686, "epoch": 0.1562774363476734, "grad_norm": 0.875, "learning_rate": 0.00023538785085953912, "loss": 6.1856, "mean_token_accuracy": 0.1424265533685684, "num_tokens": 5429571.0, "step": 2670 }, { "entropy": 6.547902584075928, "epoch": 0.1565700907228563, "grad_norm": 0.984375, "learning_rate": 0.00023422870318389404, "loss": 6.2278, "mean_token_accuracy": 0.13900026082992553, "num_tokens": 5438692.0, "step": 2675 }, { "entropy": 6.485255289077759, "epoch": 0.1568627450980392, "grad_norm": 0.984375, "learning_rate": 0.0002330706732739468, "loss": 6.1885, "mean_token_accuracy": 0.1391908533871174, "num_tokens": 5449276.0, "step": 2680 }, { "entropy": 6.549315547943115, "epoch": 0.15715539947322213, "grad_norm": 0.9609375, "learning_rate": 0.00023191379287767211, "loss": 6.2524, "mean_token_accuracy": 0.14197998046875, "num_tokens": 5459831.0, "step": 2685 }, { "entropy": 6.614502668380737, "epoch": 0.15744805384840505, "grad_norm": 1.015625, "learning_rate": 0.0002307580937115305, "loss": 6.3464, "mean_token_accuracy": 0.1267390377819538, "num_tokens": 5471577.0, "step": 2690 }, { "entropy": 6.550572299957276, "epoch": 0.15774070822358793, "grad_norm": 0.91015625, "learning_rate": 0.00022960360745959846, "loss": 6.2289, "mean_token_accuracy": 0.13965948596596717, "num_tokens": 5482299.0, "step": 2695 }, { "entropy": 6.55780029296875, "epoch": 0.15803336259877085, "grad_norm": 0.93359375, "learning_rate": 0.00022845036577269972, "loss": 6.2583, "mean_token_accuracy": 0.13381334021687508, "num_tokens": 5492298.0, "step": 2700 }, { "entropy": 6.520327806472778, "epoch": 0.15832601697395376, "grad_norm": 0.9140625, "learning_rate": 0.00022729840026753777, "loss": 6.1768, "mean_token_accuracy": 0.14374976530671119, "num_tokens": 5502727.0, "step": 2705 }, { "entropy": 6.534080123901367, "epoch": 0.15861867134913668, "grad_norm": 0.90234375, "learning_rate": 0.0002261477425258287, "loss": 6.1576, "mean_token_accuracy": 0.14108413830399513, "num_tokens": 5512321.0, "step": 2710 }, { "entropy": 6.4830296516418455, "epoch": 0.15891132572431957, "grad_norm": 0.92578125, "learning_rate": 0.0002249984240934358, "loss": 6.2033, "mean_token_accuracy": 0.14314679950475692, "num_tokens": 5522265.0, "step": 2715 }, { "entropy": 6.547088575363159, "epoch": 0.15920398009950248, "grad_norm": 1.0546875, "learning_rate": 0.00022385047647950464, "loss": 6.3057, "mean_token_accuracy": 0.1338900499045849, "num_tokens": 5532628.0, "step": 2720 }, { "entropy": 6.634050512313843, "epoch": 0.1594966344746854, "grad_norm": 0.92578125, "learning_rate": 0.0002227039311555986, "loss": 6.1934, "mean_token_accuracy": 0.1390744499862194, "num_tokens": 5543307.0, "step": 2725 }, { "entropy": 6.529575347900391, "epoch": 0.15978928884986832, "grad_norm": 0.8984375, "learning_rate": 0.0002215588195548372, "loss": 6.2631, "mean_token_accuracy": 0.13185127526521684, "num_tokens": 5554248.0, "step": 2730 }, { "entropy": 6.4312415599823, "epoch": 0.1600819432250512, "grad_norm": 0.99609375, "learning_rate": 0.00022041517307103337, "loss": 6.1443, "mean_token_accuracy": 0.14239867702126502, "num_tokens": 5564321.0, "step": 2735 }, { "entropy": 6.527017831802368, "epoch": 0.16037459760023412, "grad_norm": 0.91796875, "learning_rate": 0.0002192730230578331, "loss": 6.2115, "mean_token_accuracy": 0.13895939216017722, "num_tokens": 5573852.0, "step": 2740 }, { "entropy": 6.5560023307800295, "epoch": 0.16066725197541704, "grad_norm": 0.92578125, "learning_rate": 0.0002181324008278559, "loss": 6.2582, "mean_token_accuracy": 0.13502655327320098, "num_tokens": 5584202.0, "step": 2745 }, { "entropy": 6.544650459289551, "epoch": 0.16095990635059995, "grad_norm": 1.0234375, "learning_rate": 0.00021699333765183655, "loss": 6.1976, "mean_token_accuracy": 0.14429980814456939, "num_tokens": 5594086.0, "step": 2750 }, { "entropy": 6.558902597427368, "epoch": 0.16125256072578284, "grad_norm": 0.87890625, "learning_rate": 0.0002158558647577673, "loss": 6.1578, "mean_token_accuracy": 0.14210355430841445, "num_tokens": 5604050.0, "step": 2755 }, { "entropy": 6.535611391067505, "epoch": 0.16154521510096576, "grad_norm": 0.9375, "learning_rate": 0.00021472001333004215, "loss": 6.2387, "mean_token_accuracy": 0.14314470887184144, "num_tokens": 5614136.0, "step": 2760 }, { "entropy": 6.537288236618042, "epoch": 0.16183786947614867, "grad_norm": 0.953125, "learning_rate": 0.00021358581450860186, "loss": 6.3211, "mean_token_accuracy": 0.12838149443268776, "num_tokens": 5624986.0, "step": 2765 }, { "entropy": 6.50725793838501, "epoch": 0.1621305238513316, "grad_norm": 0.90234375, "learning_rate": 0.0002124532993880799, "loss": 6.1906, "mean_token_accuracy": 0.14175716713070868, "num_tokens": 5635698.0, "step": 2770 }, { "entropy": 6.549154043197632, "epoch": 0.16242317822651448, "grad_norm": 0.96875, "learning_rate": 0.00021132249901695044, "loss": 6.168, "mean_token_accuracy": 0.14407571256160737, "num_tokens": 5645257.0, "step": 2775 }, { "entropy": 6.495343446731567, "epoch": 0.1627158326016974, "grad_norm": 1.0078125, "learning_rate": 0.00021019344439667705, "loss": 6.2282, "mean_token_accuracy": 0.1422564759850502, "num_tokens": 5656053.0, "step": 2780 }, { "entropy": 6.535295248031616, "epoch": 0.1630084869768803, "grad_norm": 0.9453125, "learning_rate": 0.00020906616648086213, "loss": 6.233, "mean_token_accuracy": 0.1346354976296425, "num_tokens": 5667058.0, "step": 2785 }, { "entropy": 6.53308801651001, "epoch": 0.16330114135206322, "grad_norm": 0.98828125, "learning_rate": 0.00020794069617439942, "loss": 6.1279, "mean_token_accuracy": 0.13937866687774658, "num_tokens": 5676709.0, "step": 2790 }, { "entropy": 6.471915292739868, "epoch": 0.1635937957272461, "grad_norm": 1.0234375, "learning_rate": 0.00020681706433262593, "loss": 6.1771, "mean_token_accuracy": 0.14254669696092606, "num_tokens": 5686385.0, "step": 2795 }, { "entropy": 6.472246360778809, "epoch": 0.16388645010242903, "grad_norm": 1.015625, "learning_rate": 0.00020569530176047602, "loss": 6.2145, "mean_token_accuracy": 0.13524642288684846, "num_tokens": 5696205.0, "step": 2800 }, { "entropy": 6.578249311447143, "epoch": 0.16417910447761194, "grad_norm": 1.109375, "learning_rate": 0.0002045754392116374, "loss": 6.2137, "mean_token_accuracy": 0.13581515476107597, "num_tokens": 5705098.0, "step": 2805 }, { "entropy": 6.552724933624267, "epoch": 0.16447175885279486, "grad_norm": 1.03125, "learning_rate": 0.00020345750738770757, "loss": 6.216, "mean_token_accuracy": 0.13807876855134965, "num_tokens": 5715230.0, "step": 2810 }, { "entropy": 6.521187210083008, "epoch": 0.16476441322797775, "grad_norm": 1.0546875, "learning_rate": 0.00020234153693735214, "loss": 6.2886, "mean_token_accuracy": 0.13280558511614798, "num_tokens": 5724659.0, "step": 2815 }, { "entropy": 6.476500940322876, "epoch": 0.16505706760316066, "grad_norm": 0.94921875, "learning_rate": 0.0002012275584554647, "loss": 6.0716, "mean_token_accuracy": 0.15525753051042557, "num_tokens": 5734203.0, "step": 2820 }, { "entropy": 6.5196754932403564, "epoch": 0.16534972197834358, "grad_norm": 0.97265625, "learning_rate": 0.00020011560248232803, "loss": 6.1574, "mean_token_accuracy": 0.14328333213925362, "num_tokens": 5743998.0, "step": 2825 }, { "entropy": 6.475966596603394, "epoch": 0.1656423763535265, "grad_norm": 0.89453125, "learning_rate": 0.00019900569950277692, "loss": 6.2404, "mean_token_accuracy": 0.13377273231744766, "num_tokens": 5755637.0, "step": 2830 }, { "entropy": 6.552825975418091, "epoch": 0.16593503072870938, "grad_norm": 0.890625, "learning_rate": 0.00019789787994536228, "loss": 6.2729, "mean_token_accuracy": 0.1340258985757828, "num_tokens": 5767045.0, "step": 2835 }, { "entropy": 6.5837178230285645, "epoch": 0.1662276851038923, "grad_norm": 1.09375, "learning_rate": 0.00019679217418151667, "loss": 6.1609, "mean_token_accuracy": 0.14507486745715142, "num_tokens": 5777435.0, "step": 2840 }, { "entropy": 6.539376640319825, "epoch": 0.1665203394790752, "grad_norm": 0.98046875, "learning_rate": 0.00019568861252472236, "loss": 6.1995, "mean_token_accuracy": 0.14176033735275267, "num_tokens": 5787558.0, "step": 2845 }, { "entropy": 6.521344947814941, "epoch": 0.16681299385425813, "grad_norm": 0.8828125, "learning_rate": 0.00019458722522967952, "loss": 6.2897, "mean_token_accuracy": 0.12934364154934883, "num_tokens": 5798902.0, "step": 2850 }, { "entropy": 6.558686590194702, "epoch": 0.16710564822944102, "grad_norm": 0.90625, "learning_rate": 0.00019348804249147723, "loss": 6.2245, "mean_token_accuracy": 0.13471300080418586, "num_tokens": 5809852.0, "step": 2855 }, { "entropy": 6.607994651794433, "epoch": 0.16739830260462393, "grad_norm": 0.95703125, "learning_rate": 0.0001923910944447655, "loss": 6.2651, "mean_token_accuracy": 0.13732294067740441, "num_tokens": 5820937.0, "step": 2860 }, { "entropy": 6.527199077606201, "epoch": 0.16769095697980685, "grad_norm": 1.015625, "learning_rate": 0.00019129641116292928, "loss": 6.1135, "mean_token_accuracy": 0.14256200566887856, "num_tokens": 5830898.0, "step": 2865 }, { "entropy": 6.453168725967407, "epoch": 0.16798361135498976, "grad_norm": 0.921875, "learning_rate": 0.00019020402265726343, "loss": 6.2076, "mean_token_accuracy": 0.14136819988489152, "num_tokens": 5841182.0, "step": 2870 }, { "entropy": 6.528485536575317, "epoch": 0.16827626573017265, "grad_norm": 0.92578125, "learning_rate": 0.0001891139588761509, "loss": 6.1761, "mean_token_accuracy": 0.14104376435279847, "num_tokens": 5851556.0, "step": 2875 }, { "entropy": 6.525482702255249, "epoch": 0.16856892010535557, "grad_norm": 0.94921875, "learning_rate": 0.00018802624970424076, "loss": 6.192, "mean_token_accuracy": 0.14138480871915818, "num_tokens": 5862094.0, "step": 2880 }, { "entropy": 6.459352779388428, "epoch": 0.16886157448053848, "grad_norm": 0.87890625, "learning_rate": 0.00018694092496162945, "loss": 6.1138, "mean_token_accuracy": 0.1471209093928337, "num_tokens": 5871995.0, "step": 2885 }, { "entropy": 6.509467220306396, "epoch": 0.1691542288557214, "grad_norm": 0.98046875, "learning_rate": 0.00018585801440304306, "loss": 6.2937, "mean_token_accuracy": 0.13243095427751542, "num_tokens": 5882844.0, "step": 2890 }, { "entropy": 6.540257596969605, "epoch": 0.1694468832309043, "grad_norm": 0.984375, "learning_rate": 0.00018477754771702165, "loss": 6.2217, "mean_token_accuracy": 0.13977270796895028, "num_tokens": 5893326.0, "step": 2895 }, { "entropy": 6.585920953750611, "epoch": 0.1697395376060872, "grad_norm": 0.890625, "learning_rate": 0.00018369955452510506, "loss": 6.2789, "mean_token_accuracy": 0.13316548839211464, "num_tokens": 5903428.0, "step": 2900 }, { "entropy": 6.604809427261353, "epoch": 0.17003219198127012, "grad_norm": 0.91796875, "learning_rate": 0.0001826240643810212, "loss": 6.258, "mean_token_accuracy": 0.13789111375808716, "num_tokens": 5913454.0, "step": 2905 }, { "entropy": 6.495929813385009, "epoch": 0.17032484635645304, "grad_norm": 1.0234375, "learning_rate": 0.0001815511067698758, "loss": 6.0709, "mean_token_accuracy": 0.15094600319862367, "num_tokens": 5922871.0, "step": 2910 }, { "entropy": 6.528694438934326, "epoch": 0.17061750073163595, "grad_norm": 1.015625, "learning_rate": 0.0001804807111073436, "loss": 6.1743, "mean_token_accuracy": 0.14280690103769303, "num_tokens": 5933469.0, "step": 2915 }, { "entropy": 6.5062483787536625, "epoch": 0.17091015510681884, "grad_norm": 1.03125, "learning_rate": 0.0001794129067388625, "loss": 6.142, "mean_token_accuracy": 0.14863498210906984, "num_tokens": 5942866.0, "step": 2920 }, { "entropy": 6.526878786087036, "epoch": 0.17120280948200176, "grad_norm": 0.859375, "learning_rate": 0.00017834772293882868, "loss": 6.1581, "mean_token_accuracy": 0.14312298819422722, "num_tokens": 5953442.0, "step": 2925 }, { "entropy": 6.497909736633301, "epoch": 0.17149546385718467, "grad_norm": 0.99609375, "learning_rate": 0.000177285188909794, "loss": 6.1541, "mean_token_accuracy": 0.1411077469587326, "num_tokens": 5963164.0, "step": 2930 }, { "entropy": 6.489312267303466, "epoch": 0.1717881182323676, "grad_norm": 0.90234375, "learning_rate": 0.0001762253337816656, "loss": 6.1448, "mean_token_accuracy": 0.1520187921822071, "num_tokens": 5973456.0, "step": 2935 }, { "entropy": 6.503576850891113, "epoch": 0.17208077260755048, "grad_norm": 0.921875, "learning_rate": 0.00017516818661090738, "loss": 6.1486, "mean_token_accuracy": 0.14401473551988603, "num_tokens": 5983826.0, "step": 2940 }, { "entropy": 6.521322727203369, "epoch": 0.1723734269827334, "grad_norm": 0.94140625, "learning_rate": 0.0001741137763797428, "loss": 6.0883, "mean_token_accuracy": 0.14583360701799392, "num_tokens": 5994250.0, "step": 2945 }, { "entropy": 6.497500991821289, "epoch": 0.1726660813579163, "grad_norm": 0.8515625, "learning_rate": 0.00017306213199536115, "loss": 6.2539, "mean_token_accuracy": 0.13612900525331498, "num_tokens": 6004898.0, "step": 2950 }, { "entropy": 6.528212928771973, "epoch": 0.17295873573309922, "grad_norm": 0.96484375, "learning_rate": 0.0001720132822891243, "loss": 6.1698, "mean_token_accuracy": 0.14160617738962172, "num_tokens": 6015229.0, "step": 2955 }, { "entropy": 6.527840805053711, "epoch": 0.1732513901082821, "grad_norm": 0.98828125, "learning_rate": 0.0001709672560157769, "loss": 6.1979, "mean_token_accuracy": 0.1367964804172516, "num_tokens": 6024915.0, "step": 2960 }, { "entropy": 6.48720006942749, "epoch": 0.17354404448346503, "grad_norm": 1.015625, "learning_rate": 0.00016992408185265758, "loss": 6.1666, "mean_token_accuracy": 0.14386114180088044, "num_tokens": 6034639.0, "step": 2965 }, { "entropy": 6.505798053741455, "epoch": 0.17383669885864794, "grad_norm": 1.078125, "learning_rate": 0.00016888378839891298, "loss": 6.2205, "mean_token_accuracy": 0.14749545753002166, "num_tokens": 6046290.0, "step": 2970 }, { "entropy": 6.570685768127442, "epoch": 0.17412935323383086, "grad_norm": 0.91796875, "learning_rate": 0.0001678464041747137, "loss": 6.149, "mean_token_accuracy": 0.14346007406711578, "num_tokens": 6056193.0, "step": 2975 }, { "entropy": 6.538094758987427, "epoch": 0.17442200760901375, "grad_norm": 0.90625, "learning_rate": 0.00016681195762047223, "loss": 6.1956, "mean_token_accuracy": 0.14101211577653885, "num_tokens": 6066056.0, "step": 2980 }, { "entropy": 6.520820093154907, "epoch": 0.17471466198419666, "grad_norm": 0.9375, "learning_rate": 0.00016578047709606337, "loss": 6.2644, "mean_token_accuracy": 0.132436902821064, "num_tokens": 6077051.0, "step": 2985 }, { "entropy": 6.585749530792237, "epoch": 0.17500731635937958, "grad_norm": 1.0390625, "learning_rate": 0.00016475199088004678, "loss": 6.2093, "mean_token_accuracy": 0.14285393804311752, "num_tokens": 6087005.0, "step": 2990 }, { "entropy": 6.530379581451416, "epoch": 0.1752999707345625, "grad_norm": 0.90234375, "learning_rate": 0.00016372652716889163, "loss": 6.1966, "mean_token_accuracy": 0.14196499586105346, "num_tokens": 6096910.0, "step": 2995 }, { "entropy": 6.542305946350098, "epoch": 0.17559262510974538, "grad_norm": 1.046875, "learning_rate": 0.0001627041140762035, "loss": 6.1943, "mean_token_accuracy": 0.14292609095573425, "num_tokens": 6106965.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1344990676746240.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }