{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.11706175007316359, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742143154144287, "epoch": 0.000292654375182909, "grad_norm": 5.34375, "learning_rate": 2e-06, "loss": 10.7851, "mean_token_accuracy": 7.092198356986045e-05, "num_tokens": 10253.0, "step": 5 }, { "entropy": 10.742099285125732, "epoch": 0.000585308750365818, "grad_norm": 5.09375, "learning_rate": 4.5e-06, "loss": 10.7585, "mean_token_accuracy": 7.072135922499001e-05, "num_tokens": 19586.0, "step": 10 }, { "entropy": 10.742091464996339, "epoch": 0.000877963125548727, "grad_norm": 5.71875, "learning_rate": 7e-06, "loss": 10.7338, "mean_token_accuracy": 0.0, "num_tokens": 28743.0, "step": 15 }, { "entropy": 10.742110919952392, "epoch": 0.001170617500731636, "grad_norm": 4.75, "learning_rate": 9.5e-06, "loss": 10.702, "mean_token_accuracy": 7.518797065131366e-05, "num_tokens": 39263.0, "step": 20 }, { "entropy": 10.7420015335083, "epoch": 0.0014632718759145448, "grad_norm": 5.0625, "learning_rate": 1.2e-05, "loss": 10.6176, "mean_token_accuracy": 0.00650847667711787, "num_tokens": 50195.0, "step": 25 }, { "entropy": 10.741524696350098, "epoch": 0.001755926251097454, "grad_norm": 4.5, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.04643158838152885, "num_tokens": 58982.0, "step": 30 }, { "entropy": 10.739701747894287, "epoch": 0.002048580626280363, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3385, "mean_token_accuracy": 0.04858696423470974, "num_tokens": 68619.0, "step": 35 }, { "entropy": 10.733176803588867, "epoch": 0.002341235001463272, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 10.1755, "mean_token_accuracy": 0.054676258191466334, "num_tokens": 78276.0, "step": 40 }, { "entropy": 10.719074249267578, "epoch": 0.0026338893766461808, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.085, "mean_token_accuracy": 0.05106211043894291, "num_tokens": 87977.0, "step": 45 }, { "entropy": 10.702382278442382, "epoch": 0.0029265437518290896, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.007, "mean_token_accuracy": 0.05418388731777668, "num_tokens": 97168.0, "step": 50 }, { "entropy": 10.688697719573975, "epoch": 0.003219198127011999, "grad_norm": 1.984375, "learning_rate": 2.7e-05, "loss": 9.978, "mean_token_accuracy": 0.0560054711997509, "num_tokens": 108162.0, "step": 55 }, { "entropy": 10.677631187438966, "epoch": 0.003511852502194908, "grad_norm": 1.9375, "learning_rate": 2.95e-05, "loss": 9.8907, "mean_token_accuracy": 0.05185089595615864, "num_tokens": 117963.0, "step": 60 }, { "entropy": 10.672104358673096, "epoch": 0.0038045068773778167, "grad_norm": 1.78125, "learning_rate": 3.2e-05, "loss": 9.8844, "mean_token_accuracy": 0.05049301944673061, "num_tokens": 128067.0, "step": 65 }, { "entropy": 10.665418434143067, "epoch": 0.004097161252560726, "grad_norm": 1.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8046, "mean_token_accuracy": 0.05261277854442596, "num_tokens": 138347.0, "step": 70 }, { "entropy": 10.655702877044678, "epoch": 0.004389815627743635, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7713, "mean_token_accuracy": 0.05200894549489021, "num_tokens": 148883.0, "step": 75 }, { "entropy": 10.648012065887452, "epoch": 0.004682470002926544, "grad_norm": 1.7734375, "learning_rate": 3.95e-05, "loss": 9.7304, "mean_token_accuracy": 0.053603590652346614, "num_tokens": 158416.0, "step": 80 }, { "entropy": 10.638986778259277, "epoch": 0.004975124378109453, "grad_norm": 1.8125, "learning_rate": 4.2000000000000004e-05, "loss": 9.624, "mean_token_accuracy": 0.056516367569565774, "num_tokens": 168380.0, "step": 85 }, { "entropy": 10.622650527954102, "epoch": 0.0052677787532923615, "grad_norm": 1.9375, "learning_rate": 4.45e-05, "loss": 9.5594, "mean_token_accuracy": 0.058524899929761884, "num_tokens": 178623.0, "step": 90 }, { "entropy": 10.598152160644531, "epoch": 0.00556043312847527, "grad_norm": 1.7421875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5209, "mean_token_accuracy": 0.05661297850310802, "num_tokens": 189058.0, "step": 95 }, { "entropy": 10.577679920196534, "epoch": 0.005853087503658179, "grad_norm": 1.6796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4548, "mean_token_accuracy": 0.056520416587591174, "num_tokens": 199465.0, "step": 100 }, { "entropy": 10.56387767791748, "epoch": 0.006145741878841089, "grad_norm": 1.6015625, "learning_rate": 5.2e-05, "loss": 9.4, "mean_token_accuracy": 0.054618718847632405, "num_tokens": 208712.0, "step": 105 }, { "entropy": 10.543546962738038, "epoch": 0.006438396254023998, "grad_norm": 1.484375, "learning_rate": 5.45e-05, "loss": 9.3224, "mean_token_accuracy": 0.05899658054113388, "num_tokens": 218557.0, "step": 110 }, { "entropy": 10.48940305709839, "epoch": 0.006731050629206907, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.2068, "mean_token_accuracy": 0.06870373338460922, "num_tokens": 228961.0, "step": 115 }, { "entropy": 10.402587509155273, "epoch": 0.007023705004389816, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 9.1227, "mean_token_accuracy": 0.06810536533594132, "num_tokens": 238987.0, "step": 120 }, { "entropy": 10.348681640625, "epoch": 0.0073163593795727245, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.0633, "mean_token_accuracy": 0.0605758685618639, "num_tokens": 249600.0, "step": 125 }, { "entropy": 10.30824089050293, "epoch": 0.007609013754755633, "grad_norm": 1.578125, "learning_rate": 6.450000000000001e-05, "loss": 8.8758, "mean_token_accuracy": 0.07409285828471183, "num_tokens": 259215.0, "step": 130 }, { "entropy": 10.212008476257324, "epoch": 0.007901668129938543, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.8303, "mean_token_accuracy": 0.06557713933289051, "num_tokens": 268888.0, "step": 135 }, { "entropy": 10.150605010986329, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.74, "mean_token_accuracy": 0.06668962053954601, "num_tokens": 278451.0, "step": 140 }, { "entropy": 10.055028533935547, "epoch": 0.008486976880304361, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.7012, "mean_token_accuracy": 0.06709126047790051, "num_tokens": 289577.0, "step": 145 }, { "entropy": 9.99300413131714, "epoch": 0.00877963125548727, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 8.5708, "mean_token_accuracy": 0.06588217578828334, "num_tokens": 299057.0, "step": 150 }, { "entropy": 9.817628383636475, "epoch": 0.009072285630670179, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.4885, "mean_token_accuracy": 0.06879487000405789, "num_tokens": 308802.0, "step": 155 }, { "entropy": 9.719903469085693, "epoch": 0.009364940005853088, "grad_norm": 0.98046875, "learning_rate": 7.950000000000001e-05, "loss": 8.3738, "mean_token_accuracy": 0.07012738101184368, "num_tokens": 317365.0, "step": 160 }, { "entropy": 9.5343448638916, "epoch": 0.009657594381035996, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.3035, "mean_token_accuracy": 0.07032971270382404, "num_tokens": 326927.0, "step": 165 }, { "entropy": 9.404919242858886, "epoch": 0.009950248756218905, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 8.317, "mean_token_accuracy": 0.06643726415932179, "num_tokens": 337408.0, "step": 170 }, { "entropy": 9.28181962966919, "epoch": 0.010242903131401814, "grad_norm": 0.79296875, "learning_rate": 8.7e-05, "loss": 8.2328, "mean_token_accuracy": 0.06949336491525174, "num_tokens": 348282.0, "step": 175 }, { "entropy": 9.099757957458497, "epoch": 0.010535557506584723, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 8.1847, "mean_token_accuracy": 0.06538042239844799, "num_tokens": 357767.0, "step": 180 }, { "entropy": 8.947648048400879, "epoch": 0.010828211881767632, "grad_norm": 0.77734375, "learning_rate": 9.2e-05, "loss": 8.1401, "mean_token_accuracy": 0.07173748835921287, "num_tokens": 368665.0, "step": 185 }, { "entropy": 8.832690525054932, "epoch": 0.01112086625695054, "grad_norm": 1.1015625, "learning_rate": 9.45e-05, "loss": 8.125, "mean_token_accuracy": 0.0688393272459507, "num_tokens": 378741.0, "step": 190 }, { "entropy": 8.722904491424561, "epoch": 0.01141352063213345, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.1228, "mean_token_accuracy": 0.07389259040355682, "num_tokens": 388324.0, "step": 195 }, { "entropy": 8.738927555084228, "epoch": 0.011706175007316359, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 8.1796, "mean_token_accuracy": 0.06952995508909225, "num_tokens": 398450.0, "step": 200 }, { "entropy": 8.615283966064453, "epoch": 0.01199882938249927, "grad_norm": 0.8203125, "learning_rate": 0.000102, "loss": 8.0899, "mean_token_accuracy": 0.07332116328179836, "num_tokens": 408961.0, "step": 205 }, { "entropy": 8.581227874755859, "epoch": 0.012291483757682178, "grad_norm": 1.078125, "learning_rate": 0.00010449999999999999, "loss": 8.1226, "mean_token_accuracy": 0.0683289546519518, "num_tokens": 418517.0, "step": 210 }, { "entropy": 8.532517910003662, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.035, "mean_token_accuracy": 0.07064232043921947, "num_tokens": 428059.0, "step": 215 }, { "entropy": 8.60868797302246, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.0513, "mean_token_accuracy": 0.06911276690661908, "num_tokens": 438499.0, "step": 220 }, { "entropy": 8.50686674118042, "epoch": 0.013169446883230905, "grad_norm": 0.73046875, "learning_rate": 0.000112, "loss": 8.0542, "mean_token_accuracy": 0.06983353272080421, "num_tokens": 448761.0, "step": 225 }, { "entropy": 8.424305152893066, "epoch": 0.013462101258413814, "grad_norm": 0.77734375, "learning_rate": 0.0001145, "loss": 8.0471, "mean_token_accuracy": 0.07090565152466297, "num_tokens": 458386.0, "step": 230 }, { "entropy": 8.447117614746094, "epoch": 0.013754755633596722, "grad_norm": 0.765625, "learning_rate": 0.00011700000000000001, "loss": 7.991, "mean_token_accuracy": 0.06929317899048329, "num_tokens": 468198.0, "step": 235 }, { "entropy": 8.46488447189331, "epoch": 0.014047410008779631, "grad_norm": 0.7265625, "learning_rate": 0.00011949999999999999, "loss": 8.0203, "mean_token_accuracy": 0.07129090093076229, "num_tokens": 480142.0, "step": 240 }, { "entropy": 8.370715618133545, "epoch": 0.01434006438396254, "grad_norm": 0.79296875, "learning_rate": 0.000122, "loss": 7.8998, "mean_token_accuracy": 0.08097687140107154, "num_tokens": 490686.0, "step": 245 }, { "entropy": 8.408738231658935, "epoch": 0.014632718759145449, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 7.9758, "mean_token_accuracy": 0.07468959763646126, "num_tokens": 500099.0, "step": 250 }, { "entropy": 8.416247749328614, "epoch": 0.014925373134328358, "grad_norm": 0.8515625, "learning_rate": 0.000127, "loss": 7.9005, "mean_token_accuracy": 0.07769993916153908, "num_tokens": 509525.0, "step": 255 }, { "entropy": 8.347339820861816, "epoch": 0.015218027509511267, "grad_norm": 0.7421875, "learning_rate": 0.0001295, "loss": 7.8978, "mean_token_accuracy": 0.07274740003049374, "num_tokens": 520141.0, "step": 260 }, { "entropy": 8.357079029083252, "epoch": 0.015510681884694176, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 8.0384, "mean_token_accuracy": 0.06597915887832642, "num_tokens": 531645.0, "step": 265 }, { "entropy": 8.3228253364563, "epoch": 0.015803336259877086, "grad_norm": 0.8203125, "learning_rate": 0.00013450000000000002, "loss": 7.9109, "mean_token_accuracy": 0.07127318009734154, "num_tokens": 541779.0, "step": 270 }, { "entropy": 8.300227451324464, "epoch": 0.016095990635059995, "grad_norm": 0.82421875, "learning_rate": 0.00013700000000000002, "loss": 7.8871, "mean_token_accuracy": 0.07985152080655097, "num_tokens": 551770.0, "step": 275 }, { "entropy": 8.360063171386718, "epoch": 0.016388645010242904, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 7.8829, "mean_token_accuracy": 0.0752606987953186, "num_tokens": 561814.0, "step": 280 }, { "entropy": 8.235567474365235, "epoch": 0.016681299385425813, "grad_norm": 0.82421875, "learning_rate": 0.00014199999999999998, "loss": 7.9551, "mean_token_accuracy": 0.06852101050317287, "num_tokens": 571988.0, "step": 285 }, { "entropy": 8.42728681564331, "epoch": 0.016973953760608722, "grad_norm": 0.7109375, "learning_rate": 0.0001445, "loss": 7.9876, "mean_token_accuracy": 0.07176770456135273, "num_tokens": 582814.0, "step": 290 }, { "entropy": 8.26517457962036, "epoch": 0.01726660813579163, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 7.9178, "mean_token_accuracy": 0.07443804480135441, "num_tokens": 592301.0, "step": 295 }, { "entropy": 8.199700450897216, "epoch": 0.01755926251097454, "grad_norm": 0.80859375, "learning_rate": 0.0001495, "loss": 7.8119, "mean_token_accuracy": 0.077539586648345, "num_tokens": 602898.0, "step": 300 }, { "entropy": 8.289494514465332, "epoch": 0.01785191688615745, "grad_norm": 1.0546875, "learning_rate": 0.000152, "loss": 7.8914, "mean_token_accuracy": 0.07545375041663646, "num_tokens": 612731.0, "step": 305 }, { "entropy": 8.186264896392823, "epoch": 0.018144571261340357, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 7.843, "mean_token_accuracy": 0.07743252031505107, "num_tokens": 623067.0, "step": 310 }, { "entropy": 8.256502819061279, "epoch": 0.018437225636523266, "grad_norm": 0.76171875, "learning_rate": 0.000157, "loss": 7.8317, "mean_token_accuracy": 0.08097588121891022, "num_tokens": 633538.0, "step": 315 }, { "entropy": 8.319536399841308, "epoch": 0.018729880011706175, "grad_norm": 1.6484375, "learning_rate": 0.0001595, "loss": 7.8898, "mean_token_accuracy": 0.07923161759972572, "num_tokens": 643704.0, "step": 320 }, { "entropy": 8.158168601989747, "epoch": 0.019022534386889084, "grad_norm": 0.84375, "learning_rate": 0.000162, "loss": 7.9204, "mean_token_accuracy": 0.07442782260477543, "num_tokens": 653766.0, "step": 325 }, { "entropy": 8.432480907440185, "epoch": 0.019315188762071993, "grad_norm": 0.921875, "learning_rate": 0.00016450000000000001, "loss": 7.9175, "mean_token_accuracy": 0.07209107242524623, "num_tokens": 663289.0, "step": 330 }, { "entropy": 8.145325660705566, "epoch": 0.0196078431372549, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 7.8214, "mean_token_accuracy": 0.07566024884581565, "num_tokens": 673196.0, "step": 335 }, { "entropy": 8.328914070129395, "epoch": 0.01990049751243781, "grad_norm": 0.98046875, "learning_rate": 0.00016950000000000003, "loss": 7.8481, "mean_token_accuracy": 0.0807725053280592, "num_tokens": 682694.0, "step": 340 }, { "entropy": 8.15658712387085, "epoch": 0.02019315188762072, "grad_norm": 0.85546875, "learning_rate": 0.00017199999999999998, "loss": 7.8414, "mean_token_accuracy": 0.07744252718985081, "num_tokens": 692880.0, "step": 345 }, { "entropy": 8.265804481506347, "epoch": 0.02048580626280363, "grad_norm": 1.2109375, "learning_rate": 0.00017449999999999999, "loss": 7.9339, "mean_token_accuracy": 0.07408964931964875, "num_tokens": 703972.0, "step": 350 }, { "entropy": 8.137424850463868, "epoch": 0.020778460637986537, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 7.7467, "mean_token_accuracy": 0.07930146306753158, "num_tokens": 713571.0, "step": 355 }, { "entropy": 8.209496688842773, "epoch": 0.021071115013169446, "grad_norm": 0.93359375, "learning_rate": 0.0001795, "loss": 7.8355, "mean_token_accuracy": 0.08222270905971527, "num_tokens": 723642.0, "step": 360 }, { "entropy": 8.136897945404053, "epoch": 0.021363769388352355, "grad_norm": 0.9453125, "learning_rate": 0.000182, "loss": 7.8793, "mean_token_accuracy": 0.07310881391167641, "num_tokens": 733848.0, "step": 365 }, { "entropy": 8.176177358627319, "epoch": 0.021656423763535264, "grad_norm": 0.7265625, "learning_rate": 0.0001845, "loss": 7.6089, "mean_token_accuracy": 0.10752813518047333, "num_tokens": 743752.0, "step": 370 }, { "entropy": 8.144378280639648, "epoch": 0.021949078138718173, "grad_norm": 0.91796875, "learning_rate": 0.000187, "loss": 7.8031, "mean_token_accuracy": 0.08254543766379356, "num_tokens": 754145.0, "step": 375 }, { "entropy": 8.118795394897461, "epoch": 0.02224173251390108, "grad_norm": 0.765625, "learning_rate": 0.0001895, "loss": 7.766, "mean_token_accuracy": 0.07592462375760078, "num_tokens": 763930.0, "step": 380 }, { "entropy": 8.178821086883545, "epoch": 0.02253438688908399, "grad_norm": 1.015625, "learning_rate": 0.000192, "loss": 7.7934, "mean_token_accuracy": 0.08122270852327347, "num_tokens": 774851.0, "step": 385 }, { "entropy": 8.122542095184325, "epoch": 0.0228270412642669, "grad_norm": 0.80859375, "learning_rate": 0.0001945, "loss": 7.7915, "mean_token_accuracy": 0.07377454079687595, "num_tokens": 784251.0, "step": 390 }, { "entropy": 8.100419902801514, "epoch": 0.023119695639449808, "grad_norm": 0.92578125, "learning_rate": 0.00019700000000000002, "loss": 7.8395, "mean_token_accuracy": 0.0817381426692009, "num_tokens": 794089.0, "step": 395 }, { "entropy": 8.19840030670166, "epoch": 0.023412350014632717, "grad_norm": 0.8671875, "learning_rate": 0.00019950000000000002, "loss": 7.8242, "mean_token_accuracy": 0.07439705729484558, "num_tokens": 805274.0, "step": 400 }, { "entropy": 8.17535228729248, "epoch": 0.02370500438981563, "grad_norm": 0.8515625, "learning_rate": 0.000202, "loss": 7.7672, "mean_token_accuracy": 0.07779609337449074, "num_tokens": 816036.0, "step": 405 }, { "entropy": 8.004063892364503, "epoch": 0.02399765876499854, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.7613, "mean_token_accuracy": 0.07725987881422043, "num_tokens": 826393.0, "step": 410 }, { "entropy": 8.159784364700318, "epoch": 0.024290313140181447, "grad_norm": 0.87109375, "learning_rate": 0.000207, "loss": 7.7542, "mean_token_accuracy": 0.0782277960330248, "num_tokens": 836456.0, "step": 415 }, { "entropy": 8.072831869125366, "epoch": 0.024582967515364356, "grad_norm": 0.8125, "learning_rate": 0.0002095, "loss": 7.759, "mean_token_accuracy": 0.07723330594599247, "num_tokens": 846493.0, "step": 420 }, { "entropy": 8.16247329711914, "epoch": 0.024875621890547265, "grad_norm": 0.8125, "learning_rate": 0.000212, "loss": 7.7584, "mean_token_accuracy": 0.07505144067108631, "num_tokens": 857041.0, "step": 425 }, { "entropy": 7.9756200313568115, "epoch": 0.025168276265730174, "grad_norm": 0.92578125, "learning_rate": 0.0002145, "loss": 7.6788, "mean_token_accuracy": 0.08394450098276138, "num_tokens": 867053.0, "step": 430 }, { "entropy": 8.086863994598389, "epoch": 0.025460930640913083, "grad_norm": 0.9921875, "learning_rate": 0.00021700000000000002, "loss": 7.7398, "mean_token_accuracy": 0.0781655989587307, "num_tokens": 876944.0, "step": 435 }, { "entropy": 8.080809020996094, "epoch": 0.02575358501609599, "grad_norm": 0.828125, "learning_rate": 0.0002195, "loss": 7.6902, "mean_token_accuracy": 0.08105823285877704, "num_tokens": 887257.0, "step": 440 }, { "entropy": 8.091656923294067, "epoch": 0.0260462393912789, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 7.7086, "mean_token_accuracy": 0.0815083347260952, "num_tokens": 896877.0, "step": 445 }, { "entropy": 8.037679195404053, "epoch": 0.02633889376646181, "grad_norm": 0.83203125, "learning_rate": 0.0002245, "loss": 7.6096, "mean_token_accuracy": 0.08536934405565262, "num_tokens": 906930.0, "step": 450 }, { "entropy": 8.04052267074585, "epoch": 0.026631548141644718, "grad_norm": 0.8515625, "learning_rate": 0.00022700000000000002, "loss": 7.7471, "mean_token_accuracy": 0.07020874097943305, "num_tokens": 916841.0, "step": 455 }, { "entropy": 8.061063146591186, "epoch": 0.026924202516827627, "grad_norm": 0.7890625, "learning_rate": 0.00022950000000000002, "loss": 7.6914, "mean_token_accuracy": 0.07996720150113105, "num_tokens": 927024.0, "step": 460 }, { "entropy": 8.085123777389526, "epoch": 0.027216856892010536, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.7227, "mean_token_accuracy": 0.07815472632646561, "num_tokens": 935786.0, "step": 465 }, { "entropy": 7.955375385284424, "epoch": 0.027509511267193445, "grad_norm": 0.8359375, "learning_rate": 0.00023449999999999998, "loss": 7.6349, "mean_token_accuracy": 0.08305523693561553, "num_tokens": 946819.0, "step": 470 }, { "entropy": 8.01088285446167, "epoch": 0.027802165642376354, "grad_norm": 0.84375, "learning_rate": 0.000237, "loss": 7.6793, "mean_token_accuracy": 0.08371292352676392, "num_tokens": 957876.0, "step": 475 }, { "entropy": 8.070115327835083, "epoch": 0.028094820017559263, "grad_norm": 0.9765625, "learning_rate": 0.0002395, "loss": 7.7627, "mean_token_accuracy": 0.07754282280802727, "num_tokens": 969211.0, "step": 480 }, { "entropy": 8.086713933944703, "epoch": 0.02838747439274217, "grad_norm": 0.89453125, "learning_rate": 0.000242, "loss": 7.7091, "mean_token_accuracy": 0.07998017743229865, "num_tokens": 979090.0, "step": 485 }, { "entropy": 8.120463180541993, "epoch": 0.02868012876792508, "grad_norm": 0.8984375, "learning_rate": 0.0002445, "loss": 7.7649, "mean_token_accuracy": 0.07725568227469921, "num_tokens": 990510.0, "step": 490 }, { "entropy": 8.065446138381958, "epoch": 0.02897278314310799, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.6837, "mean_token_accuracy": 0.07927028760313988, "num_tokens": 1000890.0, "step": 495 }, { "entropy": 7.89040241241455, "epoch": 0.029265437518290898, "grad_norm": 0.9296875, "learning_rate": 0.0002495, "loss": 7.633, "mean_token_accuracy": 0.08539719134569168, "num_tokens": 1011019.0, "step": 500 }, { "entropy": 8.053290367126465, "epoch": 0.029558091893473807, "grad_norm": 0.9296875, "learning_rate": 0.000252, "loss": 7.5976, "mean_token_accuracy": 0.0852201983332634, "num_tokens": 1020703.0, "step": 505 }, { "entropy": 7.924099731445312, "epoch": 0.029850746268656716, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.6144, "mean_token_accuracy": 0.08518284186720848, "num_tokens": 1030539.0, "step": 510 }, { "entropy": 7.876818609237671, "epoch": 0.030143400643839625, "grad_norm": 0.8984375, "learning_rate": 0.000257, "loss": 7.6173, "mean_token_accuracy": 0.07879232838749886, "num_tokens": 1040977.0, "step": 515 }, { "entropy": 7.9826685905456545, "epoch": 0.030436055019022534, "grad_norm": 1.0234375, "learning_rate": 0.0002595, "loss": 7.5867, "mean_token_accuracy": 0.08224296122789383, "num_tokens": 1050382.0, "step": 520 }, { "entropy": 7.914853572845459, "epoch": 0.030728709394205442, "grad_norm": 0.8984375, "learning_rate": 0.000262, "loss": 7.5776, "mean_token_accuracy": 0.08655883669853211, "num_tokens": 1062287.0, "step": 525 }, { "entropy": 7.873267793655396, "epoch": 0.03102136376938835, "grad_norm": 0.98828125, "learning_rate": 0.00026450000000000003, "loss": 7.5624, "mean_token_accuracy": 0.0834833487868309, "num_tokens": 1072138.0, "step": 530 }, { "entropy": 8.053305435180665, "epoch": 0.031314018144571264, "grad_norm": 0.9453125, "learning_rate": 0.00026700000000000004, "loss": 7.5478, "mean_token_accuracy": 0.08701685890555381, "num_tokens": 1082730.0, "step": 535 }, { "entropy": 7.881413888931275, "epoch": 0.03160667251975417, "grad_norm": 1.0546875, "learning_rate": 0.00026950000000000005, "loss": 7.5191, "mean_token_accuracy": 0.08792314156889916, "num_tokens": 1093409.0, "step": 540 }, { "entropy": 7.940295267105102, "epoch": 0.03189932689493708, "grad_norm": 0.890625, "learning_rate": 0.00027200000000000005, "loss": 7.6596, "mean_token_accuracy": 0.08377403020858765, "num_tokens": 1103817.0, "step": 545 }, { "entropy": 7.939820003509522, "epoch": 0.03219198127011999, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.6265, "mean_token_accuracy": 0.07738926894962787, "num_tokens": 1114392.0, "step": 550 }, { "entropy": 7.96156415939331, "epoch": 0.0324846356453029, "grad_norm": 1.015625, "learning_rate": 0.000277, "loss": 7.5224, "mean_token_accuracy": 0.08881102874875069, "num_tokens": 1124539.0, "step": 555 }, { "entropy": 7.832987546920776, "epoch": 0.03277729002048581, "grad_norm": 1.171875, "learning_rate": 0.0002795, "loss": 7.5564, "mean_token_accuracy": 0.08254684880375862, "num_tokens": 1135110.0, "step": 560 }, { "entropy": 7.855937910079956, "epoch": 0.03306994439566872, "grad_norm": 1.03125, "learning_rate": 0.00028199999999999997, "loss": 7.5979, "mean_token_accuracy": 0.08505113944411277, "num_tokens": 1145458.0, "step": 565 }, { "entropy": 7.951333904266358, "epoch": 0.033362598770851626, "grad_norm": 0.98046875, "learning_rate": 0.0002845, "loss": 7.5383, "mean_token_accuracy": 0.08062238246202469, "num_tokens": 1155754.0, "step": 570 }, { "entropy": 7.8793701171875, "epoch": 0.033655253146034535, "grad_norm": 0.8984375, "learning_rate": 0.000287, "loss": 7.5816, "mean_token_accuracy": 0.082074723392725, "num_tokens": 1165771.0, "step": 575 }, { "entropy": 7.901887035369873, "epoch": 0.033947907521217444, "grad_norm": 1.015625, "learning_rate": 0.0002895, "loss": 7.534, "mean_token_accuracy": 0.08429761826992035, "num_tokens": 1175785.0, "step": 580 }, { "entropy": 7.887288761138916, "epoch": 0.03424056189640035, "grad_norm": 0.9375, "learning_rate": 0.000292, "loss": 7.5557, "mean_token_accuracy": 0.08287644758820534, "num_tokens": 1186252.0, "step": 585 }, { "entropy": 7.767520141601563, "epoch": 0.03453321627158326, "grad_norm": 0.890625, "learning_rate": 0.0002945, "loss": 7.5037, "mean_token_accuracy": 0.08624404892325402, "num_tokens": 1196800.0, "step": 590 }, { "entropy": 7.92415132522583, "epoch": 0.03482587064676617, "grad_norm": 0.86328125, "learning_rate": 0.000297, "loss": 7.4895, "mean_token_accuracy": 0.08825775608420372, "num_tokens": 1207794.0, "step": 595 }, { "entropy": 7.7734299659729, "epoch": 0.03511852502194908, "grad_norm": 0.9453125, "learning_rate": 0.0002995, "loss": 7.4153, "mean_token_accuracy": 0.08845552653074265, "num_tokens": 1217029.0, "step": 600 }, { "entropy": 7.832931613922119, "epoch": 0.03541117939713199, "grad_norm": 1.0625, "learning_rate": 0.000302, "loss": 7.3933, "mean_token_accuracy": 0.09399922043085099, "num_tokens": 1227917.0, "step": 605 }, { "entropy": 7.771529722213745, "epoch": 0.0357038337723149, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 7.4464, "mean_token_accuracy": 0.08992072939872742, "num_tokens": 1238495.0, "step": 610 }, { "entropy": 7.831154489517212, "epoch": 0.035996488147497806, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.4915, "mean_token_accuracy": 0.08896522894501686, "num_tokens": 1249649.0, "step": 615 }, { "entropy": 7.815850448608399, "epoch": 0.036289142522680715, "grad_norm": 0.9296875, "learning_rate": 0.0003095, "loss": 7.5417, "mean_token_accuracy": 0.08101370558142662, "num_tokens": 1260937.0, "step": 620 }, { "entropy": 7.813495063781739, "epoch": 0.036581796897863623, "grad_norm": 0.96484375, "learning_rate": 0.000312, "loss": 7.3702, "mean_token_accuracy": 0.09065580368041992, "num_tokens": 1270751.0, "step": 625 }, { "entropy": 7.818518209457397, "epoch": 0.03687445127304653, "grad_norm": 0.8671875, "learning_rate": 0.0003145, "loss": 7.4965, "mean_token_accuracy": 0.0885044053196907, "num_tokens": 1282383.0, "step": 630 }, { "entropy": 7.83252854347229, "epoch": 0.03716710564822944, "grad_norm": 0.96484375, "learning_rate": 0.000317, "loss": 7.3179, "mean_token_accuracy": 0.1026477910578251, "num_tokens": 1292320.0, "step": 635 }, { "entropy": 7.6734686374664305, "epoch": 0.03745976002341235, "grad_norm": 0.91796875, "learning_rate": 0.0003195, "loss": 7.4792, "mean_token_accuracy": 0.08322202041745186, "num_tokens": 1303054.0, "step": 640 }, { "entropy": 7.8633969783782955, "epoch": 0.03775241439859526, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 7.4465, "mean_token_accuracy": 0.08914806470274925, "num_tokens": 1311607.0, "step": 645 }, { "entropy": 7.689844703674316, "epoch": 0.03804506877377817, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.4234, "mean_token_accuracy": 0.08909434452652931, "num_tokens": 1321930.0, "step": 650 }, { "entropy": 7.8022431373596195, "epoch": 0.03833772314896108, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 7.4465, "mean_token_accuracy": 0.08396812826395035, "num_tokens": 1331533.0, "step": 655 }, { "entropy": 7.769197797775268, "epoch": 0.038630377524143986, "grad_norm": 0.87890625, "learning_rate": 0.00032950000000000004, "loss": 7.4086, "mean_token_accuracy": 0.08934582769870758, "num_tokens": 1341961.0, "step": 660 }, { "entropy": 7.769333171844482, "epoch": 0.038923031899326895, "grad_norm": 0.984375, "learning_rate": 0.00033200000000000005, "loss": 7.4375, "mean_token_accuracy": 0.08935849741101265, "num_tokens": 1352741.0, "step": 665 }, { "entropy": 7.791517686843872, "epoch": 0.0392156862745098, "grad_norm": 0.96875, "learning_rate": 0.00033450000000000005, "loss": 7.432, "mean_token_accuracy": 0.08128280714154243, "num_tokens": 1363467.0, "step": 670 }, { "entropy": 7.691935110092163, "epoch": 0.03950834064969271, "grad_norm": 0.984375, "learning_rate": 0.000337, "loss": 7.3877, "mean_token_accuracy": 0.09103676527738572, "num_tokens": 1372759.0, "step": 675 }, { "entropy": 7.6941760063171385, "epoch": 0.03980099502487562, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.3855, "mean_token_accuracy": 0.09363519176840782, "num_tokens": 1382785.0, "step": 680 }, { "entropy": 7.757591485977173, "epoch": 0.04009364940005853, "grad_norm": 0.94140625, "learning_rate": 0.000342, "loss": 7.4335, "mean_token_accuracy": 0.0862673670053482, "num_tokens": 1392748.0, "step": 685 }, { "entropy": 7.777906894683838, "epoch": 0.04038630377524144, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 7.4677, "mean_token_accuracy": 0.08610242903232575, "num_tokens": 1402473.0, "step": 690 }, { "entropy": 7.787166547775269, "epoch": 0.04067895815042435, "grad_norm": 0.84765625, "learning_rate": 0.000347, "loss": 7.439, "mean_token_accuracy": 0.08554250001907349, "num_tokens": 1413921.0, "step": 695 }, { "entropy": 7.736286449432373, "epoch": 0.04097161252560726, "grad_norm": 0.94140625, "learning_rate": 0.0003495, "loss": 7.4369, "mean_token_accuracy": 0.0805517353117466, "num_tokens": 1424687.0, "step": 700 }, { "entropy": 7.767450380325317, "epoch": 0.041264266900790166, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.4388, "mean_token_accuracy": 0.08601183965802192, "num_tokens": 1435153.0, "step": 705 }, { "entropy": 7.794674873352051, "epoch": 0.041556921275973074, "grad_norm": 0.8828125, "learning_rate": 0.0003545, "loss": 7.4462, "mean_token_accuracy": 0.0846464328467846, "num_tokens": 1446187.0, "step": 710 }, { "entropy": 7.755715560913086, "epoch": 0.04184957565115598, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.396, "mean_token_accuracy": 0.08824568465352059, "num_tokens": 1456299.0, "step": 715 }, { "entropy": 7.5965576171875, "epoch": 0.04214223002633889, "grad_norm": 1.0703125, "learning_rate": 0.0003595, "loss": 7.3017, "mean_token_accuracy": 0.09606124758720398, "num_tokens": 1465654.0, "step": 720 }, { "entropy": 7.70619683265686, "epoch": 0.0424348844015218, "grad_norm": 1.078125, "learning_rate": 0.000362, "loss": 7.3563, "mean_token_accuracy": 0.09394391924142838, "num_tokens": 1475248.0, "step": 725 }, { "entropy": 7.698731327056885, "epoch": 0.04272753877670471, "grad_norm": 0.9296875, "learning_rate": 0.0003645, "loss": 7.4247, "mean_token_accuracy": 0.08578455671668053, "num_tokens": 1485570.0, "step": 730 }, { "entropy": 7.636994504928589, "epoch": 0.04302019315188762, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.3294, "mean_token_accuracy": 0.09238605126738549, "num_tokens": 1495257.0, "step": 735 }, { "entropy": 7.687747764587402, "epoch": 0.04331284752707053, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.3467, "mean_token_accuracy": 0.08985281139612197, "num_tokens": 1504882.0, "step": 740 }, { "entropy": 7.706828022003174, "epoch": 0.043605501902253437, "grad_norm": 0.83203125, "learning_rate": 0.000372, "loss": 7.3918, "mean_token_accuracy": 0.08691600039601326, "num_tokens": 1515791.0, "step": 745 }, { "entropy": 7.595960521697998, "epoch": 0.043898156277436345, "grad_norm": 0.87109375, "learning_rate": 0.0003745, "loss": 7.3055, "mean_token_accuracy": 0.09265599772334099, "num_tokens": 1527837.0, "step": 750 }, { "entropy": 7.674931144714355, "epoch": 0.044190810652619254, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 7.3197, "mean_token_accuracy": 0.09090850502252579, "num_tokens": 1538357.0, "step": 755 }, { "entropy": 7.597537708282471, "epoch": 0.04448346502780216, "grad_norm": 1.1953125, "learning_rate": 0.0003795, "loss": 7.318, "mean_token_accuracy": 0.09620778560638428, "num_tokens": 1548140.0, "step": 760 }, { "entropy": 7.655205726623535, "epoch": 0.04477611940298507, "grad_norm": 0.828125, "learning_rate": 0.000382, "loss": 7.3052, "mean_token_accuracy": 0.09487425237894058, "num_tokens": 1558723.0, "step": 765 }, { "entropy": 7.604353332519532, "epoch": 0.04506877377816798, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.3288, "mean_token_accuracy": 0.08416497483849525, "num_tokens": 1568519.0, "step": 770 }, { "entropy": 7.608450269699096, "epoch": 0.04536142815335089, "grad_norm": 1.1171875, "learning_rate": 0.00038700000000000003, "loss": 7.2961, "mean_token_accuracy": 0.09094355553388596, "num_tokens": 1578788.0, "step": 775 }, { "entropy": 7.620551347732544, "epoch": 0.0456540825285338, "grad_norm": 1.0234375, "learning_rate": 0.00038950000000000003, "loss": 7.2536, "mean_token_accuracy": 0.09547285735607147, "num_tokens": 1588593.0, "step": 780 }, { "entropy": 7.534824514389038, "epoch": 0.04594673690371671, "grad_norm": 0.9609375, "learning_rate": 0.00039200000000000004, "loss": 7.2914, "mean_token_accuracy": 0.08960797935724259, "num_tokens": 1598657.0, "step": 785 }, { "entropy": 7.504811525344849, "epoch": 0.046239391278899616, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.2001, "mean_token_accuracy": 0.09868146777153015, "num_tokens": 1608825.0, "step": 790 }, { "entropy": 7.5206996440887455, "epoch": 0.046532045654082525, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 7.2045, "mean_token_accuracy": 0.09371785670518876, "num_tokens": 1618733.0, "step": 795 }, { "entropy": 7.602302169799804, "epoch": 0.046824700029265434, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 7.2273, "mean_token_accuracy": 0.09687273427844048, "num_tokens": 1628728.0, "step": 800 }, { "entropy": 7.53294186592102, "epoch": 0.04711735440444834, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 7.3064, "mean_token_accuracy": 0.0901516005396843, "num_tokens": 1639016.0, "step": 805 }, { "entropy": 7.574016046524048, "epoch": 0.04741000877963126, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.297, "mean_token_accuracy": 0.0918840229511261, "num_tokens": 1649386.0, "step": 810 }, { "entropy": 7.666880130767822, "epoch": 0.04770266315481417, "grad_norm": 0.98828125, "learning_rate": 0.00040699999999999997, "loss": 7.2977, "mean_token_accuracy": 0.09063222482800484, "num_tokens": 1659949.0, "step": 815 }, { "entropy": 7.555622291564942, "epoch": 0.04799531752999708, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 7.2765, "mean_token_accuracy": 0.09335207715630531, "num_tokens": 1670035.0, "step": 820 }, { "entropy": 7.611965894699097, "epoch": 0.048287971905179985, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.2132, "mean_token_accuracy": 0.08826020434498787, "num_tokens": 1679579.0, "step": 825 }, { "entropy": 7.441506242752075, "epoch": 0.048580626280362894, "grad_norm": 1.0625, "learning_rate": 0.0004145, "loss": 7.196, "mean_token_accuracy": 0.09741625487804413, "num_tokens": 1689900.0, "step": 830 }, { "entropy": 7.5691015243530275, "epoch": 0.0488732806555458, "grad_norm": 0.953125, "learning_rate": 0.000417, "loss": 7.2469, "mean_token_accuracy": 0.09050429165363312, "num_tokens": 1700534.0, "step": 835 }, { "entropy": 7.547771167755127, "epoch": 0.04916593503072871, "grad_norm": 0.90234375, "learning_rate": 0.0004195, "loss": 7.1963, "mean_token_accuracy": 0.09931469187140465, "num_tokens": 1710969.0, "step": 840 }, { "entropy": 7.454426383972168, "epoch": 0.04945858940591162, "grad_norm": 1.0234375, "learning_rate": 0.000422, "loss": 7.2267, "mean_token_accuracy": 0.09168547242879868, "num_tokens": 1721024.0, "step": 845 }, { "entropy": 7.430084466934204, "epoch": 0.04975124378109453, "grad_norm": 1.0859375, "learning_rate": 0.0004245, "loss": 7.1318, "mean_token_accuracy": 0.09713169336318969, "num_tokens": 1730197.0, "step": 850 }, { "entropy": 7.452590370178223, "epoch": 0.05004389815627744, "grad_norm": 1.125, "learning_rate": 0.000427, "loss": 7.1541, "mean_token_accuracy": 0.09219018146395683, "num_tokens": 1741132.0, "step": 855 }, { "entropy": 7.521068334579468, "epoch": 0.05033655253146035, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 7.2637, "mean_token_accuracy": 0.08954514041543007, "num_tokens": 1751757.0, "step": 860 }, { "entropy": 7.495842170715332, "epoch": 0.050629206906643257, "grad_norm": 0.9921875, "learning_rate": 0.000432, "loss": 7.1582, "mean_token_accuracy": 0.09514842405915261, "num_tokens": 1762779.0, "step": 865 }, { "entropy": 7.475547981262207, "epoch": 0.050921861281826165, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 7.1182, "mean_token_accuracy": 0.09630650877952576, "num_tokens": 1772353.0, "step": 870 }, { "entropy": 7.352218437194824, "epoch": 0.051214515657009074, "grad_norm": 0.94140625, "learning_rate": 0.000437, "loss": 7.145, "mean_token_accuracy": 0.09995641633868217, "num_tokens": 1782648.0, "step": 875 }, { "entropy": 7.392671585083008, "epoch": 0.05150717003219198, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 7.1484, "mean_token_accuracy": 0.09772149994969367, "num_tokens": 1792275.0, "step": 880 }, { "entropy": 7.387517881393433, "epoch": 0.05179982440737489, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 7.1486, "mean_token_accuracy": 0.09331418126821518, "num_tokens": 1803244.0, "step": 885 }, { "entropy": 7.4635416030883786, "epoch": 0.0520924787825578, "grad_norm": 0.86328125, "learning_rate": 0.0004445, "loss": 7.1907, "mean_token_accuracy": 0.09984328448772431, "num_tokens": 1814331.0, "step": 890 }, { "entropy": 7.442190837860108, "epoch": 0.05238513315774071, "grad_norm": 0.9921875, "learning_rate": 0.000447, "loss": 7.1557, "mean_token_accuracy": 0.09669465869665146, "num_tokens": 1823022.0, "step": 895 }, { "entropy": 7.4167015075683596, "epoch": 0.05267778753292362, "grad_norm": 0.9453125, "learning_rate": 0.00044950000000000003, "loss": 7.2017, "mean_token_accuracy": 0.09253377318382264, "num_tokens": 1834416.0, "step": 900 }, { "entropy": 7.530139684677124, "epoch": 0.05297044190810653, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.1951, "mean_token_accuracy": 0.09366482645273208, "num_tokens": 1843507.0, "step": 905 }, { "entropy": 7.3420909404754635, "epoch": 0.053263096283289436, "grad_norm": 0.98828125, "learning_rate": 0.00045450000000000004, "loss": 7.0998, "mean_token_accuracy": 0.09217809438705445, "num_tokens": 1854149.0, "step": 910 }, { "entropy": 7.416664695739746, "epoch": 0.053555750658472345, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 7.1686, "mean_token_accuracy": 0.09251093789935112, "num_tokens": 1864257.0, "step": 915 }, { "entropy": 7.437055015563965, "epoch": 0.053848405033655254, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.1707, "mean_token_accuracy": 0.09187378212809563, "num_tokens": 1873353.0, "step": 920 }, { "entropy": 7.3977635383605955, "epoch": 0.05414105940883816, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 7.1196, "mean_token_accuracy": 0.09563436955213547, "num_tokens": 1884465.0, "step": 925 }, { "entropy": 7.365432357788086, "epoch": 0.05443371378402107, "grad_norm": 0.96875, "learning_rate": 0.0004645, "loss": 7.1528, "mean_token_accuracy": 0.09838449805974961, "num_tokens": 1894872.0, "step": 930 }, { "entropy": 7.34838981628418, "epoch": 0.05472636815920398, "grad_norm": 1.0390625, "learning_rate": 0.000467, "loss": 7.0706, "mean_token_accuracy": 0.10180790275335312, "num_tokens": 1905440.0, "step": 935 }, { "entropy": 7.341986465454101, "epoch": 0.05501902253438689, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.1291, "mean_token_accuracy": 0.09645774215459824, "num_tokens": 1916861.0, "step": 940 }, { "entropy": 7.406238269805908, "epoch": 0.0553116769095698, "grad_norm": 1.1015625, "learning_rate": 0.000472, "loss": 7.0654, "mean_token_accuracy": 0.10491539835929871, "num_tokens": 1927144.0, "step": 945 }, { "entropy": 7.35713381767273, "epoch": 0.05560433128475271, "grad_norm": 0.88671875, "learning_rate": 0.0004745, "loss": 7.138, "mean_token_accuracy": 0.0931523747742176, "num_tokens": 1937174.0, "step": 950 }, { "entropy": 7.403324699401855, "epoch": 0.055896985659935616, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 7.0506, "mean_token_accuracy": 0.11088272705674171, "num_tokens": 1947510.0, "step": 955 }, { "entropy": 7.305504369735718, "epoch": 0.056189640035118525, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 7.1238, "mean_token_accuracy": 0.09536927789449692, "num_tokens": 1957894.0, "step": 960 }, { "entropy": 7.445551156997681, "epoch": 0.056482294410301434, "grad_norm": 0.95703125, "learning_rate": 0.000482, "loss": 7.1862, "mean_token_accuracy": 0.09522910863161087, "num_tokens": 1968670.0, "step": 965 }, { "entropy": 7.351961517333985, "epoch": 0.05677494878548434, "grad_norm": 0.8828125, "learning_rate": 0.0004845, "loss": 7.1451, "mean_token_accuracy": 0.09402441680431366, "num_tokens": 1979678.0, "step": 970 }, { "entropy": 7.329155683517456, "epoch": 0.05706760316066725, "grad_norm": 0.9296875, "learning_rate": 0.000487, "loss": 7.0501, "mean_token_accuracy": 0.10141415372490883, "num_tokens": 1990161.0, "step": 975 }, { "entropy": 7.408869028091431, "epoch": 0.05736025753585016, "grad_norm": 0.98046875, "learning_rate": 0.0004895, "loss": 7.1421, "mean_token_accuracy": 0.09915417581796646, "num_tokens": 2000298.0, "step": 980 }, { "entropy": 7.386150693893432, "epoch": 0.05765291191103307, "grad_norm": 1.109375, "learning_rate": 0.000492, "loss": 7.101, "mean_token_accuracy": 0.0987740397453308, "num_tokens": 2009946.0, "step": 985 }, { "entropy": 7.297941255569458, "epoch": 0.05794556628621598, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 7.064, "mean_token_accuracy": 0.09957554042339326, "num_tokens": 2019192.0, "step": 990 }, { "entropy": 7.343301391601562, "epoch": 0.05823822066139889, "grad_norm": 0.9140625, "learning_rate": 0.000497, "loss": 7.1112, "mean_token_accuracy": 0.09475254267454147, "num_tokens": 2029066.0, "step": 995 }, { "entropy": 7.356789922714233, "epoch": 0.058530875036581796, "grad_norm": 0.94921875, "learning_rate": 0.0004995, "loss": 7.1051, "mean_token_accuracy": 0.09616579562425613, "num_tokens": 2040610.0, "step": 1000 }, { "entropy": 7.330273389816284, "epoch": 0.058823529411764705, "grad_norm": 1.1171875, "learning_rate": 0.000499998026082006, "loss": 7.105, "mean_token_accuracy": 0.0943969689309597, "num_tokens": 2049867.0, "step": 1005 }, { "entropy": 7.243909168243408, "epoch": 0.059116183786947614, "grad_norm": 0.98046875, "learning_rate": 0.0004999900070995136, "loss": 7.0949, "mean_token_accuracy": 0.09849751815199852, "num_tokens": 2059335.0, "step": 1010 }, { "entropy": 7.482809591293335, "epoch": 0.05940883816213052, "grad_norm": 1.15625, "learning_rate": 0.0004999758199023239, "loss": 7.0991, "mean_token_accuracy": 0.09777801483869553, "num_tokens": 2069498.0, "step": 1015 }, { "entropy": 7.322924661636352, "epoch": 0.05970149253731343, "grad_norm": 1.0703125, "learning_rate": 0.0004999554648793858, "loss": 7.1122, "mean_token_accuracy": 0.10163608714938163, "num_tokens": 2080077.0, "step": 1020 }, { "entropy": 7.265040874481201, "epoch": 0.05999414691249634, "grad_norm": 0.9296875, "learning_rate": 0.0004999289425887425, "loss": 7.0334, "mean_token_accuracy": 0.10056126862764359, "num_tokens": 2089699.0, "step": 1025 }, { "entropy": 7.259469652175904, "epoch": 0.06028680128767925, "grad_norm": 1.578125, "learning_rate": 0.0004998962537575161, "loss": 7.0509, "mean_token_accuracy": 0.09879743158817292, "num_tokens": 2099219.0, "step": 1030 }, { "entropy": 7.274491453170777, "epoch": 0.06057945566286216, "grad_norm": 0.91796875, "learning_rate": 0.0004998573992818874, "loss": 7.0268, "mean_token_accuracy": 0.10193772837519646, "num_tokens": 2109218.0, "step": 1035 }, { "entropy": 7.383116436004639, "epoch": 0.06087211003804507, "grad_norm": 1.0078125, "learning_rate": 0.0004998123802270715, "loss": 7.0793, "mean_token_accuracy": 0.09875930175185203, "num_tokens": 2118384.0, "step": 1040 }, { "entropy": 7.2731462001800535, "epoch": 0.061164764413227976, "grad_norm": 1.046875, "learning_rate": 0.0004997611978272886, "loss": 7.0464, "mean_token_accuracy": 0.10151882916688919, "num_tokens": 2127017.0, "step": 1045 }, { "entropy": 7.3074544906616214, "epoch": 0.061457418788410885, "grad_norm": 0.98046875, "learning_rate": 0.0004997038534857298, "loss": 7.1195, "mean_token_accuracy": 0.09616761356592178, "num_tokens": 2137568.0, "step": 1050 }, { "entropy": 7.266034030914307, "epoch": 0.061750073163593794, "grad_norm": 0.9609375, "learning_rate": 0.0004996403487745194, "loss": 7.0254, "mean_token_accuracy": 0.09843881577253341, "num_tokens": 2147063.0, "step": 1055 }, { "entropy": 7.276236915588379, "epoch": 0.0620427275387767, "grad_norm": 0.94921875, "learning_rate": 0.000499570685434671, "loss": 7.0445, "mean_token_accuracy": 0.10075422823429107, "num_tokens": 2156525.0, "step": 1060 }, { "entropy": 7.229153347015381, "epoch": 0.06233538191395961, "grad_norm": 0.921875, "learning_rate": 0.0004994948653760405, "loss": 7.0588, "mean_token_accuracy": 0.09751596227288246, "num_tokens": 2167294.0, "step": 1065 }, { "entropy": 7.209919691085815, "epoch": 0.06262803628914253, "grad_norm": 0.96875, "learning_rate": 0.0004994128906772729, "loss": 6.9627, "mean_token_accuracy": 0.1035116158425808, "num_tokens": 2177341.0, "step": 1070 }, { "entropy": 7.297941446304321, "epoch": 0.06292069066432543, "grad_norm": 0.94921875, "learning_rate": 0.000499324763585746, "loss": 7.0098, "mean_token_accuracy": 0.09901509582996368, "num_tokens": 2188044.0, "step": 1075 }, { "entropy": 7.183123016357422, "epoch": 0.06321334503950835, "grad_norm": 0.9140625, "learning_rate": 0.0004992304865175085, "loss": 7.0293, "mean_token_accuracy": 0.10036754310131073, "num_tokens": 2197612.0, "step": 1080 }, { "entropy": 7.282407426834107, "epoch": 0.06350599941469125, "grad_norm": 1.0078125, "learning_rate": 0.0004991300620572138, "loss": 7.0087, "mean_token_accuracy": 0.09982658997178077, "num_tokens": 2207638.0, "step": 1085 }, { "entropy": 7.160094165802002, "epoch": 0.06379865378987416, "grad_norm": 0.96875, "learning_rate": 0.0004990234929580494, "loss": 6.9333, "mean_token_accuracy": 0.10349727869033813, "num_tokens": 2216714.0, "step": 1090 }, { "entropy": 7.322865962982178, "epoch": 0.06409130816505706, "grad_norm": 0.9375, "learning_rate": 0.0004989107821416609, "loss": 7.0544, "mean_token_accuracy": 0.09982285872101784, "num_tokens": 2225900.0, "step": 1095 }, { "entropy": 7.1447443008422855, "epoch": 0.06438396254023998, "grad_norm": 0.9765625, "learning_rate": 0.0004987919326980723, "loss": 6.9718, "mean_token_accuracy": 0.10523544400930404, "num_tokens": 2235896.0, "step": 1100 }, { "entropy": 7.2013531684875485, "epoch": 0.06467661691542288, "grad_norm": 1.03125, "learning_rate": 0.0004986669478856011, "loss": 6.94, "mean_token_accuracy": 0.10068488419055939, "num_tokens": 2246083.0, "step": 1105 }, { "entropy": 7.246619081497192, "epoch": 0.0649692712906058, "grad_norm": 1.03125, "learning_rate": 0.0004985358311307688, "loss": 6.9572, "mean_token_accuracy": 0.10323750525712967, "num_tokens": 2256941.0, "step": 1110 }, { "entropy": 7.160521936416626, "epoch": 0.0652619256657887, "grad_norm": 1.109375, "learning_rate": 0.0004983985860282081, "loss": 6.9737, "mean_token_accuracy": 0.10002864897251129, "num_tokens": 2266694.0, "step": 1115 }, { "entropy": 7.155581760406494, "epoch": 0.06555458004097162, "grad_norm": 0.9921875, "learning_rate": 0.0004982552163405623, "loss": 6.9638, "mean_token_accuracy": 0.09659243822097778, "num_tokens": 2276826.0, "step": 1120 }, { "entropy": 7.222516393661499, "epoch": 0.06584723441615452, "grad_norm": 0.9765625, "learning_rate": 0.0004981057259983839, "loss": 6.9739, "mean_token_accuracy": 0.10149327889084817, "num_tokens": 2287895.0, "step": 1125 }, { "entropy": 7.083696699142456, "epoch": 0.06613988879133743, "grad_norm": 1.03125, "learning_rate": 0.0004979501191000262, "loss": 6.9513, "mean_token_accuracy": 0.10140683799982071, "num_tokens": 2297501.0, "step": 1130 }, { "entropy": 7.255348253250122, "epoch": 0.06643254316652034, "grad_norm": 0.9921875, "learning_rate": 0.0004977883999115311, "loss": 6.8291, "mean_token_accuracy": 0.10531161874532699, "num_tokens": 2306851.0, "step": 1135 }, { "entropy": 7.172169923782349, "epoch": 0.06672519754170325, "grad_norm": 1.0859375, "learning_rate": 0.0004976205728665113, "loss": 7.006, "mean_token_accuracy": 0.09792810827493667, "num_tokens": 2315710.0, "step": 1140 }, { "entropy": 7.135481214523315, "epoch": 0.06701785191688615, "grad_norm": 0.93359375, "learning_rate": 0.0004974466425660307, "loss": 6.9146, "mean_token_accuracy": 0.10404545590281486, "num_tokens": 2326144.0, "step": 1145 }, { "entropy": 7.1948600769042965, "epoch": 0.06731050629206907, "grad_norm": 0.96484375, "learning_rate": 0.0004972666137784759, "loss": 6.9143, "mean_token_accuracy": 0.10875528082251548, "num_tokens": 2335756.0, "step": 1150 }, { "entropy": 7.106131458282471, "epoch": 0.06760316066725197, "grad_norm": 0.93359375, "learning_rate": 0.0004970804914394271, "loss": 6.9304, "mean_token_accuracy": 0.10725896134972572, "num_tokens": 2345660.0, "step": 1155 }, { "entropy": 7.166688919067383, "epoch": 0.06789581504243489, "grad_norm": 0.9609375, "learning_rate": 0.0004968882806515225, "loss": 6.9403, "mean_token_accuracy": 0.10006137192249298, "num_tokens": 2355252.0, "step": 1160 }, { "entropy": 7.153073406219482, "epoch": 0.06818846941761779, "grad_norm": 0.98046875, "learning_rate": 0.0004966899866843177, "loss": 6.9305, "mean_token_accuracy": 0.10227609500288963, "num_tokens": 2364983.0, "step": 1165 }, { "entropy": 7.1287861347198485, "epoch": 0.0684811237928007, "grad_norm": 1.1171875, "learning_rate": 0.000496485614974142, "loss": 6.9048, "mean_token_accuracy": 0.10142005532979965, "num_tokens": 2375505.0, "step": 1170 }, { "entropy": 7.152293968200683, "epoch": 0.0687737781679836, "grad_norm": 1.015625, "learning_rate": 0.0004962751711239492, "loss": 6.9587, "mean_token_accuracy": 0.10323912650346756, "num_tokens": 2385300.0, "step": 1175 }, { "entropy": 7.039838171005249, "epoch": 0.06906643254316652, "grad_norm": 0.95703125, "learning_rate": 0.0004960586609031636, "loss": 6.9443, "mean_token_accuracy": 0.10556500256061555, "num_tokens": 2395966.0, "step": 1180 }, { "entropy": 7.262147569656372, "epoch": 0.06935908691834942, "grad_norm": 0.96484375, "learning_rate": 0.0004958360902475224, "loss": 6.9281, "mean_token_accuracy": 0.10152315646409989, "num_tokens": 2405429.0, "step": 1185 }, { "entropy": 7.163443088531494, "epoch": 0.06965174129353234, "grad_norm": 1.109375, "learning_rate": 0.0004956074652589125, "loss": 6.9202, "mean_token_accuracy": 0.10446830168366432, "num_tokens": 2415362.0, "step": 1190 }, { "entropy": 7.095344686508179, "epoch": 0.06994439566871524, "grad_norm": 1.0546875, "learning_rate": 0.0004953727922052035, "loss": 6.8784, "mean_token_accuracy": 0.10187279507517814, "num_tokens": 2425998.0, "step": 1195 }, { "entropy": 7.126546478271484, "epoch": 0.07023705004389816, "grad_norm": 0.90234375, "learning_rate": 0.0004951320775200756, "loss": 6.9491, "mean_token_accuracy": 0.09673603773117065, "num_tokens": 2436226.0, "step": 1200 }, { "entropy": 7.202165269851685, "epoch": 0.07052970441908106, "grad_norm": 0.94921875, "learning_rate": 0.0004948853278028436, "loss": 6.8387, "mean_token_accuracy": 0.10797644704580307, "num_tokens": 2445296.0, "step": 1205 }, { "entropy": 7.082312726974488, "epoch": 0.07082235879426398, "grad_norm": 0.90625, "learning_rate": 0.0004946325498182755, "loss": 6.8589, "mean_token_accuracy": 0.11134556159377099, "num_tokens": 2455743.0, "step": 1210 }, { "entropy": 7.09007248878479, "epoch": 0.07111501316944688, "grad_norm": 1.03125, "learning_rate": 0.0004943737504964076, "loss": 6.9405, "mean_token_accuracy": 0.1020224578678608, "num_tokens": 2465239.0, "step": 1215 }, { "entropy": 7.164793825149536, "epoch": 0.0714076675446298, "grad_norm": 1.03125, "learning_rate": 0.000494108936932354, "loss": 6.922, "mean_token_accuracy": 0.10908990055322647, "num_tokens": 2474472.0, "step": 1220 }, { "entropy": 6.9930988311767575, "epoch": 0.0717003219198127, "grad_norm": 0.94921875, "learning_rate": 0.0004938381163861124, "loss": 6.7943, "mean_token_accuracy": 0.11290957406163216, "num_tokens": 2483549.0, "step": 1225 }, { "entropy": 7.140143394470215, "epoch": 0.07199297629499561, "grad_norm": 0.875, "learning_rate": 0.0004935612962823645, "loss": 6.8657, "mean_token_accuracy": 0.10449625924229622, "num_tokens": 2495699.0, "step": 1230 }, { "entropy": 7.029150915145874, "epoch": 0.07228563067017851, "grad_norm": 0.94921875, "learning_rate": 0.0004932784842102739, "loss": 6.9746, "mean_token_accuracy": 0.10025271028280258, "num_tokens": 2507612.0, "step": 1235 }, { "entropy": 7.133029508590698, "epoch": 0.07257828504536143, "grad_norm": 0.94140625, "learning_rate": 0.0004929896879232758, "loss": 6.8438, "mean_token_accuracy": 0.10679830834269524, "num_tokens": 2517281.0, "step": 1240 }, { "entropy": 7.167627429962158, "epoch": 0.07287093942054433, "grad_norm": 1.046875, "learning_rate": 0.0004926949153388668, "loss": 6.8234, "mean_token_accuracy": 0.10795086920261383, "num_tokens": 2526570.0, "step": 1245 }, { "entropy": 7.026937675476074, "epoch": 0.07316359379572725, "grad_norm": 0.96875, "learning_rate": 0.0004923941745383859, "loss": 6.8455, "mean_token_accuracy": 0.10278113707900047, "num_tokens": 2535813.0, "step": 1250 }, { "entropy": 7.024099922180175, "epoch": 0.07345624817091015, "grad_norm": 1.09375, "learning_rate": 0.000492087473766794, "loss": 6.7853, "mean_token_accuracy": 0.11688904613256454, "num_tokens": 2544828.0, "step": 1255 }, { "entropy": 7.1756445407867435, "epoch": 0.07374890254609306, "grad_norm": 0.9375, "learning_rate": 0.000491774821432448, "loss": 6.9021, "mean_token_accuracy": 0.10272038280963898, "num_tokens": 2554612.0, "step": 1260 }, { "entropy": 6.887376928329468, "epoch": 0.07404155692127597, "grad_norm": 0.84765625, "learning_rate": 0.0004914562261068693, "loss": 6.8311, "mean_token_accuracy": 0.11283649727702141, "num_tokens": 2565395.0, "step": 1265 }, { "entropy": 7.175661230087281, "epoch": 0.07433421129645888, "grad_norm": 1.0390625, "learning_rate": 0.0004911316965245098, "loss": 6.966, "mean_token_accuracy": 0.1015208400785923, "num_tokens": 2576520.0, "step": 1270 }, { "entropy": 7.063946008682251, "epoch": 0.07462686567164178, "grad_norm": 0.89453125, "learning_rate": 0.000490801241582512, "loss": 6.8779, "mean_token_accuracy": 0.10767215564846992, "num_tokens": 2586093.0, "step": 1275 }, { "entropy": 7.0348388195037845, "epoch": 0.0749195200468247, "grad_norm": 0.875, "learning_rate": 0.000490464870340465, "loss": 6.8673, "mean_token_accuracy": 0.11059194058179855, "num_tokens": 2596165.0, "step": 1280 }, { "entropy": 7.263307380676269, "epoch": 0.0752121744220076, "grad_norm": 0.953125, "learning_rate": 0.0004901225920201563, "loss": 6.981, "mean_token_accuracy": 0.09260072112083435, "num_tokens": 2607108.0, "step": 1285 }, { "entropy": 6.985970163345337, "epoch": 0.07550482879719052, "grad_norm": 0.98046875, "learning_rate": 0.000489774416005319, "loss": 6.8579, "mean_token_accuracy": 0.10567844063043594, "num_tokens": 2617313.0, "step": 1290 }, { "entropy": 7.193155908584595, "epoch": 0.07579748317237343, "grad_norm": 1.0078125, "learning_rate": 0.0004894203518413742, "loss": 6.942, "mean_token_accuracy": 0.1037025772035122, "num_tokens": 2628065.0, "step": 1295 }, { "entropy": 7.068187236785889, "epoch": 0.07609013754755634, "grad_norm": 1.015625, "learning_rate": 0.0004890604092351701, "loss": 6.9342, "mean_token_accuracy": 0.09517190679907798, "num_tokens": 2638052.0, "step": 1300 }, { "entropy": 7.106878709793091, "epoch": 0.07638279192273925, "grad_norm": 0.9765625, "learning_rate": 0.000488694598054715, "loss": 6.8695, "mean_token_accuracy": 0.10798671543598175, "num_tokens": 2648242.0, "step": 1305 }, { "entropy": 7.1013659000396725, "epoch": 0.07667544629792215, "grad_norm": 1.0078125, "learning_rate": 0.0004883229283289071, "loss": 6.8159, "mean_token_accuracy": 0.10844166055321694, "num_tokens": 2657824.0, "step": 1310 }, { "entropy": 6.991985273361206, "epoch": 0.07696810067310507, "grad_norm": 0.98828125, "learning_rate": 0.00048794541024725993, "loss": 6.7952, "mean_token_accuracy": 0.10927849039435386, "num_tokens": 2667774.0, "step": 1315 }, { "entropy": 7.040319395065308, "epoch": 0.07726075504828797, "grad_norm": 0.95703125, "learning_rate": 0.0004875620541596221, "loss": 6.7604, "mean_token_accuracy": 0.1062987856566906, "num_tokens": 2677697.0, "step": 1320 }, { "entropy": 7.020246982574463, "epoch": 0.07755340942347089, "grad_norm": 1.0234375, "learning_rate": 0.00048717287057589454, "loss": 6.8529, "mean_token_accuracy": 0.10597260296344757, "num_tokens": 2688553.0, "step": 1325 }, { "entropy": 7.039525413513184, "epoch": 0.07784606379865379, "grad_norm": 0.9921875, "learning_rate": 0.0004867778701657417, "loss": 6.7872, "mean_token_accuracy": 0.1075766459107399, "num_tokens": 2698704.0, "step": 1330 }, { "entropy": 7.057392406463623, "epoch": 0.0781387181738367, "grad_norm": 0.9296875, "learning_rate": 0.00048637706375829955, "loss": 6.856, "mean_token_accuracy": 0.10357561856508254, "num_tokens": 2709257.0, "step": 1335 }, { "entropy": 7.129636335372925, "epoch": 0.0784313725490196, "grad_norm": 1.015625, "learning_rate": 0.000485970462341878, "loss": 6.8684, "mean_token_accuracy": 0.10322815775871277, "num_tokens": 2719860.0, "step": 1340 }, { "entropy": 6.990602445602417, "epoch": 0.07872402692420252, "grad_norm": 0.9609375, "learning_rate": 0.00048555807706366044, "loss": 6.8517, "mean_token_accuracy": 0.1050374872982502, "num_tokens": 2730134.0, "step": 1345 }, { "entropy": 6.978021669387817, "epoch": 0.07901668129938542, "grad_norm": 1.0078125, "learning_rate": 0.00048513991922939756, "loss": 6.6989, "mean_token_accuracy": 0.1164980985224247, "num_tokens": 2739661.0, "step": 1350 }, { "entropy": 6.976407098770141, "epoch": 0.07930933567456834, "grad_norm": 0.98828125, "learning_rate": 0.00048471600030309744, "loss": 6.8151, "mean_token_accuracy": 0.10699095502495766, "num_tokens": 2749532.0, "step": 1355 }, { "entropy": 7.110589075088501, "epoch": 0.07960199004975124, "grad_norm": 0.984375, "learning_rate": 0.00048428633190671186, "loss": 6.8471, "mean_token_accuracy": 0.10450146123766899, "num_tokens": 2759652.0, "step": 1360 }, { "entropy": 6.953937816619873, "epoch": 0.07989464442493416, "grad_norm": 0.86328125, "learning_rate": 0.0004838509258198167, "loss": 6.7311, "mean_token_accuracy": 0.11042979061603546, "num_tokens": 2770122.0, "step": 1365 }, { "entropy": 6.970408010482788, "epoch": 0.08018729880011706, "grad_norm": 1.0546875, "learning_rate": 0.00048340979397929, "loss": 6.8092, "mean_token_accuracy": 0.10888475328683853, "num_tokens": 2779788.0, "step": 1370 }, { "entropy": 7.0338794708251955, "epoch": 0.08047995317529998, "grad_norm": 1.015625, "learning_rate": 0.00048296294847898386, "loss": 6.805, "mean_token_accuracy": 0.10510503351688386, "num_tokens": 2790149.0, "step": 1375 }, { "entropy": 7.031380653381348, "epoch": 0.08077260755048288, "grad_norm": 0.98828125, "learning_rate": 0.0004825104015693934, "loss": 6.7248, "mean_token_accuracy": 0.11531992107629777, "num_tokens": 2799378.0, "step": 1380 }, { "entropy": 6.92920618057251, "epoch": 0.0810652619256658, "grad_norm": 1.09375, "learning_rate": 0.0004820521656573208, "loss": 6.8058, "mean_token_accuracy": 0.11184522807598114, "num_tokens": 2809573.0, "step": 1385 }, { "entropy": 6.951801586151123, "epoch": 0.0813579163008487, "grad_norm": 0.92578125, "learning_rate": 0.00048158825330553505, "loss": 6.7261, "mean_token_accuracy": 0.11088547632098197, "num_tokens": 2819816.0, "step": 1390 }, { "entropy": 7.114043664932251, "epoch": 0.08165057067603161, "grad_norm": 0.9765625, "learning_rate": 0.00048111867723242763, "loss": 6.8456, "mean_token_accuracy": 0.1005843736231327, "num_tokens": 2830606.0, "step": 1395 }, { "entropy": 6.9624059200286865, "epoch": 0.08194322505121451, "grad_norm": 0.98828125, "learning_rate": 0.0004806434503116637, "loss": 6.8289, "mean_token_accuracy": 0.10612485110759735, "num_tokens": 2840925.0, "step": 1400 }, { "entropy": 6.966361713409424, "epoch": 0.08223587942639743, "grad_norm": 0.89453125, "learning_rate": 0.0004801625855718296, "loss": 6.7518, "mean_token_accuracy": 0.11064208373427391, "num_tokens": 2850697.0, "step": 1405 }, { "entropy": 6.990543603897095, "epoch": 0.08252853380158033, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.8402, "mean_token_accuracy": 0.10857592597603798, "num_tokens": 2861001.0, "step": 1410 }, { "entropy": 7.022043466567993, "epoch": 0.08282118817676325, "grad_norm": 1.015625, "learning_rate": 0.0004791839955217513, "loss": 6.7625, "mean_token_accuracy": 0.11597265005111694, "num_tokens": 2869959.0, "step": 1415 }, { "entropy": 6.995840072631836, "epoch": 0.08311384255194615, "grad_norm": 0.9375, "learning_rate": 0.00047868629704004786, "loss": 6.728, "mean_token_accuracy": 0.11714338809251786, "num_tokens": 2878998.0, "step": 1420 }, { "entropy": 6.972711563110352, "epoch": 0.08340649692712906, "grad_norm": 0.93359375, "learning_rate": 0.00047818301439561965, "loss": 6.7609, "mean_token_accuracy": 0.10615370124578476, "num_tokens": 2888870.0, "step": 1425 }, { "entropy": 6.923924589157105, "epoch": 0.08369915130231197, "grad_norm": 0.953125, "learning_rate": 0.00047767416138621454, "loss": 6.6755, "mean_token_accuracy": 0.11179826408624649, "num_tokens": 2898549.0, "step": 1430 }, { "entropy": 6.9445459842681885, "epoch": 0.08399180567749488, "grad_norm": 0.84375, "learning_rate": 0.000477159751962295, "loss": 6.7235, "mean_token_accuracy": 0.11873029172420502, "num_tokens": 2908614.0, "step": 1435 }, { "entropy": 6.906632804870606, "epoch": 0.08428446005267778, "grad_norm": 1.0078125, "learning_rate": 0.00047663980022665507, "loss": 6.7154, "mean_token_accuracy": 0.1131787732243538, "num_tokens": 2917845.0, "step": 1440 }, { "entropy": 7.026270580291748, "epoch": 0.0845771144278607, "grad_norm": 0.91015625, "learning_rate": 0.00047611432043403437, "loss": 6.8334, "mean_token_accuracy": 0.10297970846295357, "num_tokens": 2929234.0, "step": 1445 }, { "entropy": 6.907474088668823, "epoch": 0.0848697688030436, "grad_norm": 0.94921875, "learning_rate": 0.0004755833269907267, "loss": 6.7675, "mean_token_accuracy": 0.10896839275956154, "num_tokens": 2939011.0, "step": 1450 }, { "entropy": 7.063915395736695, "epoch": 0.08516242317822652, "grad_norm": 0.95703125, "learning_rate": 0.0004750468344541857, "loss": 6.7726, "mean_token_accuracy": 0.10877819880843162, "num_tokens": 2948796.0, "step": 1455 }, { "entropy": 6.904459810256958, "epoch": 0.08545507755340942, "grad_norm": 0.94921875, "learning_rate": 0.00047450485753262525, "loss": 6.8066, "mean_token_accuracy": 0.10255414545536042, "num_tokens": 2960938.0, "step": 1460 }, { "entropy": 6.976855278015137, "epoch": 0.08574773192859234, "grad_norm": 0.9375, "learning_rate": 0.00047395741108461633, "loss": 6.7148, "mean_token_accuracy": 0.11121275797486305, "num_tokens": 2969964.0, "step": 1465 }, { "entropy": 6.9436931133270265, "epoch": 0.08604038630377524, "grad_norm": 0.98046875, "learning_rate": 0.00047340451011867985, "loss": 6.7419, "mean_token_accuracy": 0.10835531502962112, "num_tokens": 2980562.0, "step": 1470 }, { "entropy": 6.976116418838501, "epoch": 0.08633304067895815, "grad_norm": 0.96484375, "learning_rate": 0.00047284616979287515, "loss": 6.6753, "mean_token_accuracy": 0.11625185832381249, "num_tokens": 2990759.0, "step": 1475 }, { "entropy": 6.905919122695923, "epoch": 0.08662569505414106, "grad_norm": 1.0546875, "learning_rate": 0.00047228240541438433, "loss": 6.7076, "mean_token_accuracy": 0.11023089289665222, "num_tokens": 3000719.0, "step": 1480 }, { "entropy": 6.928934144973755, "epoch": 0.08691834942932397, "grad_norm": 0.96484375, "learning_rate": 0.00047171323243909257, "loss": 6.7253, "mean_token_accuracy": 0.11021335422992706, "num_tokens": 3011584.0, "step": 1485 }, { "entropy": 6.850312614440918, "epoch": 0.08721100380450687, "grad_norm": 1.1328125, "learning_rate": 0.00047113866647116457, "loss": 6.6914, "mean_token_accuracy": 0.11205545589327812, "num_tokens": 3021933.0, "step": 1490 }, { "entropy": 7.0218939781188965, "epoch": 0.08750365817968979, "grad_norm": 1.0390625, "learning_rate": 0.0004705587232626164, "loss": 6.7541, "mean_token_accuracy": 0.10549476444721222, "num_tokens": 3032533.0, "step": 1495 }, { "entropy": 6.886258840560913, "epoch": 0.08779631255487269, "grad_norm": 0.98046875, "learning_rate": 0.00046997341871288424, "loss": 6.6657, "mean_token_accuracy": 0.11410991847515106, "num_tokens": 3041556.0, "step": 1500 }, { "entropy": 6.93623046875, "epoch": 0.0880889669300556, "grad_norm": 1.09375, "learning_rate": 0.0004693827688683879, "loss": 6.7447, "mean_token_accuracy": 0.10976714193820954, "num_tokens": 3052030.0, "step": 1505 }, { "entropy": 6.86750373840332, "epoch": 0.08838162130523851, "grad_norm": 0.9375, "learning_rate": 0.0004687867899220914, "loss": 6.6783, "mean_token_accuracy": 0.10968335196375847, "num_tokens": 3062267.0, "step": 1510 }, { "entropy": 6.955923652648925, "epoch": 0.08867427568042142, "grad_norm": 0.91015625, "learning_rate": 0.00046818549821305846, "loss": 6.643, "mean_token_accuracy": 0.11466655507683754, "num_tokens": 3073357.0, "step": 1515 }, { "entropy": 6.84696593284607, "epoch": 0.08896693005560433, "grad_norm": 0.98828125, "learning_rate": 0.00046757891022600494, "loss": 6.7323, "mean_token_accuracy": 0.11122780367732048, "num_tokens": 3083250.0, "step": 1520 }, { "entropy": 6.95814471244812, "epoch": 0.08925958443078724, "grad_norm": 1.0, "learning_rate": 0.0004669670425908471, "loss": 6.6353, "mean_token_accuracy": 0.11299381777644157, "num_tokens": 3093144.0, "step": 1525 }, { "entropy": 6.820744323730469, "epoch": 0.08955223880597014, "grad_norm": 0.9375, "learning_rate": 0.0004663499120822451, "loss": 6.6688, "mean_token_accuracy": 0.11378093957901, "num_tokens": 3103731.0, "step": 1530 }, { "entropy": 6.915271520614624, "epoch": 0.08984489318115306, "grad_norm": 0.953125, "learning_rate": 0.0004657275356191437, "loss": 6.7017, "mean_token_accuracy": 0.11074108928442002, "num_tokens": 3114113.0, "step": 1535 }, { "entropy": 6.886846303939819, "epoch": 0.09013754755633596, "grad_norm": 0.8828125, "learning_rate": 0.00046509993026430804, "loss": 6.653, "mean_token_accuracy": 0.11144338846206665, "num_tokens": 3124167.0, "step": 1540 }, { "entropy": 6.852968740463257, "epoch": 0.09043020193151888, "grad_norm": 0.92578125, "learning_rate": 0.0004644671132238558, "loss": 6.5614, "mean_token_accuracy": 0.12301889657974244, "num_tokens": 3134751.0, "step": 1545 }, { "entropy": 6.885099744796753, "epoch": 0.09072285630670178, "grad_norm": 1.015625, "learning_rate": 0.00046382910184678585, "loss": 6.6554, "mean_token_accuracy": 0.11772447004914284, "num_tokens": 3144084.0, "step": 1550 }, { "entropy": 6.754053544998169, "epoch": 0.0910155106818847, "grad_norm": 1.0234375, "learning_rate": 0.0004631859136245025, "loss": 6.6136, "mean_token_accuracy": 0.11398938149213791, "num_tokens": 3153156.0, "step": 1555 }, { "entropy": 6.984991645812988, "epoch": 0.0913081650570676, "grad_norm": 0.9375, "learning_rate": 0.0004625375661903357, "loss": 6.6408, "mean_token_accuracy": 0.11836520209908485, "num_tokens": 3163098.0, "step": 1560 }, { "entropy": 6.801419591903686, "epoch": 0.09160081943225051, "grad_norm": 0.9375, "learning_rate": 0.00046188407731905787, "loss": 6.6727, "mean_token_accuracy": 0.11261920407414436, "num_tokens": 3172623.0, "step": 1565 }, { "entropy": 6.9145081520080565, "epoch": 0.09189347380743342, "grad_norm": 1.0078125, "learning_rate": 0.00046122546492639643, "loss": 6.6369, "mean_token_accuracy": 0.11749240681529045, "num_tokens": 3182610.0, "step": 1570 }, { "entropy": 6.80106897354126, "epoch": 0.09218612818261633, "grad_norm": 0.93359375, "learning_rate": 0.000460561747068543, "loss": 6.6364, "mean_token_accuracy": 0.108591927587986, "num_tokens": 3192978.0, "step": 1575 }, { "entropy": 6.943644762039185, "epoch": 0.09247878255779923, "grad_norm": 0.98828125, "learning_rate": 0.0004598929419416578, "loss": 6.6731, "mean_token_accuracy": 0.11072808504104614, "num_tokens": 3202791.0, "step": 1580 }, { "entropy": 6.783168792724609, "epoch": 0.09277143693298215, "grad_norm": 1.0625, "learning_rate": 0.00045921906788137123, "loss": 6.6412, "mean_token_accuracy": 0.11365418583154678, "num_tokens": 3212408.0, "step": 1585 }, { "entropy": 6.906521463394165, "epoch": 0.09306409130816505, "grad_norm": 0.9140625, "learning_rate": 0.00045854014336228115, "loss": 6.6733, "mean_token_accuracy": 0.11501292213797569, "num_tokens": 3222182.0, "step": 1590 }, { "entropy": 6.849865865707398, "epoch": 0.09335674568334797, "grad_norm": 0.95703125, "learning_rate": 0.00045785618699744615, "loss": 6.6344, "mean_token_accuracy": 0.11746996641159058, "num_tokens": 3233058.0, "step": 1595 }, { "entropy": 6.8446972370147705, "epoch": 0.09364940005853087, "grad_norm": 0.9765625, "learning_rate": 0.00045716721753787543, "loss": 6.6006, "mean_token_accuracy": 0.11764349192380905, "num_tokens": 3243412.0, "step": 1600 }, { "entropy": 6.802833318710327, "epoch": 0.09394205443371378, "grad_norm": 1.09375, "learning_rate": 0.0004564732538720148, "loss": 6.7006, "mean_token_accuracy": 0.11396326944231987, "num_tokens": 3254511.0, "step": 1605 }, { "entropy": 6.9019934177398685, "epoch": 0.09423470880889669, "grad_norm": 1.0078125, "learning_rate": 0.00045577431502522877, "loss": 6.5915, "mean_token_accuracy": 0.11526288017630577, "num_tokens": 3264949.0, "step": 1610 }, { "entropy": 6.764813375473023, "epoch": 0.0945273631840796, "grad_norm": 0.96484375, "learning_rate": 0.0004550704201592787, "loss": 6.6396, "mean_token_accuracy": 0.10926437377929688, "num_tokens": 3275014.0, "step": 1615 }, { "entropy": 6.861340761184692, "epoch": 0.09482001755926252, "grad_norm": 1.09375, "learning_rate": 0.0004543615885717981, "loss": 6.6634, "mean_token_accuracy": 0.11290878355503083, "num_tokens": 3285446.0, "step": 1620 }, { "entropy": 6.844233989715576, "epoch": 0.09511267193444542, "grad_norm": 0.984375, "learning_rate": 0.00045364783969576296, "loss": 6.5346, "mean_token_accuracy": 0.1263396829366684, "num_tokens": 3295383.0, "step": 1625 }, { "entropy": 6.765133380889893, "epoch": 0.09540532630962834, "grad_norm": 0.99609375, "learning_rate": 0.0004529291930989592, "loss": 6.6189, "mean_token_accuracy": 0.11274374797940254, "num_tokens": 3305263.0, "step": 1630 }, { "entropy": 6.842666339874268, "epoch": 0.09569798068481124, "grad_norm": 0.984375, "learning_rate": 0.0004522056684834464, "loss": 6.6083, "mean_token_accuracy": 0.1211700364947319, "num_tokens": 3315434.0, "step": 1635 }, { "entropy": 6.784665536880493, "epoch": 0.09599063505999415, "grad_norm": 1.03125, "learning_rate": 0.0004514772856850173, "loss": 6.5348, "mean_token_accuracy": 0.12217146530747414, "num_tokens": 3324908.0, "step": 1640 }, { "entropy": 6.831562328338623, "epoch": 0.09628328943517706, "grad_norm": 0.9765625, "learning_rate": 0.0004507440646726542, "loss": 6.6054, "mean_token_accuracy": 0.12192678451538086, "num_tokens": 3335987.0, "step": 1645 }, { "entropy": 6.853379344940185, "epoch": 0.09657594381035997, "grad_norm": 0.99609375, "learning_rate": 0.0004500060255479818, "loss": 6.561, "mean_token_accuracy": 0.1174039103090763, "num_tokens": 3345502.0, "step": 1650 }, { "entropy": 6.778363132476807, "epoch": 0.09686859818554287, "grad_norm": 0.93359375, "learning_rate": 0.0004492631885447151, "loss": 6.5545, "mean_token_accuracy": 0.11502353250980377, "num_tokens": 3355237.0, "step": 1655 }, { "entropy": 6.812596559524536, "epoch": 0.09716125256072579, "grad_norm": 0.94921875, "learning_rate": 0.00044851557402810616, "loss": 6.6318, "mean_token_accuracy": 0.11809700429439544, "num_tokens": 3366166.0, "step": 1660 }, { "entropy": 6.858366012573242, "epoch": 0.09745390693590869, "grad_norm": 0.94921875, "learning_rate": 0.00044776320249438444, "loss": 6.5995, "mean_token_accuracy": 0.11467723920941353, "num_tokens": 3375931.0, "step": 1665 }, { "entropy": 6.782172203063965, "epoch": 0.0977465613110916, "grad_norm": 0.9296875, "learning_rate": 0.00044700609457019565, "loss": 6.5999, "mean_token_accuracy": 0.12378341481089591, "num_tokens": 3386728.0, "step": 1670 }, { "entropy": 6.759363842010498, "epoch": 0.09803921568627451, "grad_norm": 0.9375, "learning_rate": 0.0004462442710120359, "loss": 6.5791, "mean_token_accuracy": 0.1205291859805584, "num_tokens": 3396795.0, "step": 1675 }, { "entropy": 6.835077142715454, "epoch": 0.09833187006145742, "grad_norm": 0.9140625, "learning_rate": 0.000445477752705683, "loss": 6.5568, "mean_token_accuracy": 0.1181432493031025, "num_tokens": 3406310.0, "step": 1680 }, { "entropy": 6.776544427871704, "epoch": 0.09862452443664033, "grad_norm": 0.90234375, "learning_rate": 0.00044470656066562336, "loss": 6.6114, "mean_token_accuracy": 0.11417201384902001, "num_tokens": 3418110.0, "step": 1685 }, { "entropy": 6.792936897277832, "epoch": 0.09891717881182324, "grad_norm": 1.109375, "learning_rate": 0.0004439307160344765, "loss": 6.5952, "mean_token_accuracy": 0.11885511875152588, "num_tokens": 3428122.0, "step": 1690 }, { "entropy": 6.801793384552002, "epoch": 0.09920983318700614, "grad_norm": 0.9765625, "learning_rate": 0.00044315024008241473, "loss": 6.6457, "mean_token_accuracy": 0.11425484046339988, "num_tokens": 3438514.0, "step": 1695 }, { "entropy": 6.8519859790802, "epoch": 0.09950248756218906, "grad_norm": 1.0, "learning_rate": 0.0004423651542065806, "loss": 6.6262, "mean_token_accuracy": 0.1146598532795906, "num_tokens": 3449040.0, "step": 1700 }, { "entropy": 6.8020600318908695, "epoch": 0.09979514193737196, "grad_norm": 1.0234375, "learning_rate": 0.00044157547993050006, "loss": 6.5487, "mean_token_accuracy": 0.12066433876752854, "num_tokens": 3459244.0, "step": 1705 }, { "entropy": 6.881866407394409, "epoch": 0.10008779631255488, "grad_norm": 1.078125, "learning_rate": 0.00044078123890349227, "loss": 6.6118, "mean_token_accuracy": 0.11424820944666862, "num_tokens": 3469270.0, "step": 1710 }, { "entropy": 6.784549045562744, "epoch": 0.10038045068773778, "grad_norm": 1.0703125, "learning_rate": 0.00043998245290007606, "loss": 6.592, "mean_token_accuracy": 0.11819150224328041, "num_tokens": 3480113.0, "step": 1715 }, { "entropy": 6.802189111709595, "epoch": 0.1006731050629207, "grad_norm": 1.015625, "learning_rate": 0.00043917914381937323, "loss": 6.5813, "mean_token_accuracy": 0.11734010130167008, "num_tokens": 3490451.0, "step": 1720 }, { "entropy": 6.809964227676391, "epoch": 0.1009657594381036, "grad_norm": 0.87109375, "learning_rate": 0.00043837133368450815, "loss": 6.5405, "mean_token_accuracy": 0.11609668955206871, "num_tokens": 3501107.0, "step": 1725 }, { "entropy": 6.71238145828247, "epoch": 0.10125841381328651, "grad_norm": 0.984375, "learning_rate": 0.0004375590446420037, "loss": 6.5099, "mean_token_accuracy": 0.13233423829078675, "num_tokens": 3510731.0, "step": 1730 }, { "entropy": 6.739808130264282, "epoch": 0.10155106818846941, "grad_norm": 0.953125, "learning_rate": 0.0004367422989611743, "loss": 6.4388, "mean_token_accuracy": 0.12671404406428338, "num_tokens": 3520843.0, "step": 1735 }, { "entropy": 6.837344312667847, "epoch": 0.10184372256365233, "grad_norm": 0.8984375, "learning_rate": 0.0004359211190335153, "loss": 6.6177, "mean_token_accuracy": 0.11465101763606071, "num_tokens": 3530668.0, "step": 1740 }, { "entropy": 6.749877786636352, "epoch": 0.10213637693883523, "grad_norm": 0.9921875, "learning_rate": 0.00043509552737208923, "loss": 6.5428, "mean_token_accuracy": 0.12134164273738861, "num_tokens": 3540252.0, "step": 1745 }, { "entropy": 6.7890314102172855, "epoch": 0.10242903131401815, "grad_norm": 0.96875, "learning_rate": 0.00043426554661090853, "loss": 6.5481, "mean_token_accuracy": 0.11811421886086464, "num_tokens": 3549069.0, "step": 1750 }, { "entropy": 6.757550573348999, "epoch": 0.10272168568920105, "grad_norm": 0.8984375, "learning_rate": 0.00043343119950431516, "loss": 6.58, "mean_token_accuracy": 0.11727841719985008, "num_tokens": 3559988.0, "step": 1755 }, { "entropy": 6.787223291397095, "epoch": 0.10301434006438397, "grad_norm": 0.98828125, "learning_rate": 0.00043259250892635644, "loss": 6.4955, "mean_token_accuracy": 0.1283750705420971, "num_tokens": 3569829.0, "step": 1760 }, { "entropy": 6.687646579742432, "epoch": 0.10330699443956687, "grad_norm": 0.9375, "learning_rate": 0.0004317494978701582, "loss": 6.4395, "mean_token_accuracy": 0.1254482589662075, "num_tokens": 3578958.0, "step": 1765 }, { "entropy": 6.786183023452759, "epoch": 0.10359964881474978, "grad_norm": 0.9375, "learning_rate": 0.0004309021894472943, "loss": 6.5076, "mean_token_accuracy": 0.12173920199275017, "num_tokens": 3588844.0, "step": 1770 }, { "entropy": 6.71337513923645, "epoch": 0.10389230318993269, "grad_norm": 1.0, "learning_rate": 0.0004300506068871534, "loss": 6.5819, "mean_token_accuracy": 0.11760919094085694, "num_tokens": 3599047.0, "step": 1775 }, { "entropy": 6.7201086521148685, "epoch": 0.1041849575651156, "grad_norm": 0.9609375, "learning_rate": 0.00042919477353630135, "loss": 6.4735, "mean_token_accuracy": 0.1287480928003788, "num_tokens": 3608416.0, "step": 1780 }, { "entropy": 6.780730867385865, "epoch": 0.1044776119402985, "grad_norm": 1.1171875, "learning_rate": 0.000428334712857842, "loss": 6.5059, "mean_token_accuracy": 0.11816626787185669, "num_tokens": 3618460.0, "step": 1785 }, { "entropy": 6.67847204208374, "epoch": 0.10477026631548142, "grad_norm": 1.0234375, "learning_rate": 0.00042747044843077304, "loss": 6.5474, "mean_token_accuracy": 0.12268414348363876, "num_tokens": 3628795.0, "step": 1790 }, { "entropy": 6.735287475585937, "epoch": 0.10506292069066432, "grad_norm": 1.0859375, "learning_rate": 0.00042660200394934047, "loss": 6.5558, "mean_token_accuracy": 0.11583011224865913, "num_tokens": 3640278.0, "step": 1795 }, { "entropy": 6.766513156890869, "epoch": 0.10535557506584724, "grad_norm": 0.9296875, "learning_rate": 0.00042572940322238844, "loss": 6.5482, "mean_token_accuracy": 0.12088547199964524, "num_tokens": 3650497.0, "step": 1800 }, { "entropy": 6.722351598739624, "epoch": 0.10564822944103014, "grad_norm": 0.9453125, "learning_rate": 0.00042485267017270664, "loss": 6.5984, "mean_token_accuracy": 0.1228600986301899, "num_tokens": 3661101.0, "step": 1805 }, { "entropy": 6.922651243209839, "epoch": 0.10594088381621306, "grad_norm": 0.9921875, "learning_rate": 0.0004239718288363745, "loss": 6.5561, "mean_token_accuracy": 0.1192373014986515, "num_tokens": 3670698.0, "step": 1810 }, { "entropy": 6.736356639862061, "epoch": 0.10623353819139596, "grad_norm": 1.1328125, "learning_rate": 0.0004230869033621023, "loss": 6.5585, "mean_token_accuracy": 0.11428969204425812, "num_tokens": 3679723.0, "step": 1815 }, { "entropy": 6.864965009689331, "epoch": 0.10652619256657887, "grad_norm": 0.93359375, "learning_rate": 0.0004221979180105688, "loss": 6.5512, "mean_token_accuracy": 0.11349868997931481, "num_tokens": 3690362.0, "step": 1820 }, { "entropy": 6.747930908203125, "epoch": 0.10681884694176177, "grad_norm": 0.96484375, "learning_rate": 0.00042130489715375645, "loss": 6.5085, "mean_token_accuracy": 0.12559529766440392, "num_tokens": 3700087.0, "step": 1825 }, { "entropy": 6.717715930938721, "epoch": 0.10711150131694469, "grad_norm": 0.96875, "learning_rate": 0.00042040786527428335, "loss": 6.5049, "mean_token_accuracy": 0.12355283051729202, "num_tokens": 3710086.0, "step": 1830 }, { "entropy": 6.7144248485565186, "epoch": 0.10740415569212759, "grad_norm": 0.95703125, "learning_rate": 0.0004195068469647315, "loss": 6.4642, "mean_token_accuracy": 0.12195742204785347, "num_tokens": 3720292.0, "step": 1835 }, { "entropy": 6.729002285003662, "epoch": 0.10769681006731051, "grad_norm": 0.93359375, "learning_rate": 0.00041860186692697297, "loss": 6.5342, "mean_token_accuracy": 0.11787921264767647, "num_tokens": 3730980.0, "step": 1840 }, { "entropy": 6.749273777008057, "epoch": 0.10798946444249341, "grad_norm": 1.0390625, "learning_rate": 0.00041769294997149264, "loss": 6.5779, "mean_token_accuracy": 0.11964235603809356, "num_tokens": 3741244.0, "step": 1845 }, { "entropy": 6.732828664779663, "epoch": 0.10828211881767633, "grad_norm": 0.97265625, "learning_rate": 0.0004167801210167081, "loss": 6.5632, "mean_token_accuracy": 0.11899603232741356, "num_tokens": 3751841.0, "step": 1850 }, { "entropy": 6.836530923843384, "epoch": 0.10857477319285923, "grad_norm": 0.9765625, "learning_rate": 0.0004158634050882861, "loss": 6.5206, "mean_token_accuracy": 0.12107773423194886, "num_tokens": 3762571.0, "step": 1855 }, { "entropy": 6.6559099674224855, "epoch": 0.10886742756804214, "grad_norm": 1.0625, "learning_rate": 0.0004149428273184569, "loss": 6.5158, "mean_token_accuracy": 0.12190034389495849, "num_tokens": 3771778.0, "step": 1860 }, { "entropy": 6.7532881736755375, "epoch": 0.10916008194322505, "grad_norm": 0.95703125, "learning_rate": 0.0004140184129453253, "loss": 6.4896, "mean_token_accuracy": 0.12468724176287652, "num_tokens": 3781712.0, "step": 1865 }, { "entropy": 6.647825574874878, "epoch": 0.10945273631840796, "grad_norm": 0.984375, "learning_rate": 0.000413090187312178, "loss": 6.3472, "mean_token_accuracy": 0.13525793552398682, "num_tokens": 3790711.0, "step": 1870 }, { "entropy": 6.663978242874146, "epoch": 0.10974539069359086, "grad_norm": 0.91015625, "learning_rate": 0.0004121581758667898, "loss": 6.473, "mean_token_accuracy": 0.1203851766884327, "num_tokens": 3801271.0, "step": 1875 }, { "entropy": 6.769151782989502, "epoch": 0.11003804506877378, "grad_norm": 0.8671875, "learning_rate": 0.00041122240416072533, "loss": 6.4856, "mean_token_accuracy": 0.12278474420309067, "num_tokens": 3811518.0, "step": 1880 }, { "entropy": 6.705088186264038, "epoch": 0.11033069944395668, "grad_norm": 0.90625, "learning_rate": 0.0004102828978486385, "loss": 6.5151, "mean_token_accuracy": 0.1212370365858078, "num_tokens": 3821454.0, "step": 1885 }, { "entropy": 6.742790365219117, "epoch": 0.1106233538191396, "grad_norm": 0.88671875, "learning_rate": 0.0004093396826875695, "loss": 6.5606, "mean_token_accuracy": 0.11982747986912727, "num_tokens": 3831886.0, "step": 1890 }, { "entropy": 6.7166282653808596, "epoch": 0.1109160081943225, "grad_norm": 0.94921875, "learning_rate": 0.00040839278453623837, "loss": 6.4898, "mean_token_accuracy": 0.1260741837322712, "num_tokens": 3841723.0, "step": 1895 }, { "entropy": 6.7906341552734375, "epoch": 0.11120866256950541, "grad_norm": 1.0703125, "learning_rate": 0.0004074422293543363, "loss": 6.4533, "mean_token_accuracy": 0.1258271798491478, "num_tokens": 3851374.0, "step": 1900 }, { "entropy": 6.740607738494873, "epoch": 0.11150131694468832, "grad_norm": 0.95703125, "learning_rate": 0.0004064880432018137, "loss": 6.4903, "mean_token_accuracy": 0.12274285033345222, "num_tokens": 3862627.0, "step": 1905 }, { "entropy": 6.659914445877075, "epoch": 0.11179397131987123, "grad_norm": 1.03125, "learning_rate": 0.00040553025223816615, "loss": 6.4784, "mean_token_accuracy": 0.12452571094036102, "num_tokens": 3872344.0, "step": 1910 }, { "entropy": 6.735513925552368, "epoch": 0.11208662569505413, "grad_norm": 0.890625, "learning_rate": 0.00040456888272171653, "loss": 6.5453, "mean_token_accuracy": 0.11647359281778336, "num_tokens": 3882896.0, "step": 1915 }, { "entropy": 6.713681602478028, "epoch": 0.11237928007023705, "grad_norm": 0.91015625, "learning_rate": 0.00040360396100889577, "loss": 6.4595, "mean_token_accuracy": 0.12801918759942055, "num_tokens": 3893773.0, "step": 1920 }, { "entropy": 6.6865918159484865, "epoch": 0.11267193444541995, "grad_norm": 0.95703125, "learning_rate": 0.0004026355135535202, "loss": 6.4424, "mean_token_accuracy": 0.12188205718994141, "num_tokens": 3905057.0, "step": 1925 }, { "entropy": 6.726850271224976, "epoch": 0.11296458882060287, "grad_norm": 0.91796875, "learning_rate": 0.000401663566906066, "loss": 6.4427, "mean_token_accuracy": 0.12147087454795838, "num_tokens": 3914306.0, "step": 1930 }, { "entropy": 6.700537204742432, "epoch": 0.11325724319578578, "grad_norm": 0.9375, "learning_rate": 0.00040068814771294134, "loss": 6.4905, "mean_token_accuracy": 0.12801681384444236, "num_tokens": 3924168.0, "step": 1935 }, { "entropy": 6.674844408035279, "epoch": 0.11354989757096869, "grad_norm": 0.99609375, "learning_rate": 0.0003997092827157562, "loss": 6.4243, "mean_token_accuracy": 0.12779392600059508, "num_tokens": 3934603.0, "step": 1940 }, { "entropy": 6.662173557281494, "epoch": 0.1138425519461516, "grad_norm": 0.875, "learning_rate": 0.000398726998750589, "loss": 6.575, "mean_token_accuracy": 0.12289680615067482, "num_tokens": 3946181.0, "step": 1945 }, { "entropy": 6.859195804595947, "epoch": 0.1141352063213345, "grad_norm": 1.0, "learning_rate": 0.00039774132274725076, "loss": 6.4832, "mean_token_accuracy": 0.12466611191630364, "num_tokens": 3955732.0, "step": 1950 }, { "entropy": 6.668773794174195, "epoch": 0.11442786069651742, "grad_norm": 1.015625, "learning_rate": 0.00039675228172854707, "loss": 6.4042, "mean_token_accuracy": 0.12757309898734093, "num_tokens": 3965569.0, "step": 1955 }, { "entropy": 6.693961477279663, "epoch": 0.11472051507170032, "grad_norm": 0.9765625, "learning_rate": 0.0003957599028095371, "loss": 6.664, "mean_token_accuracy": 0.10505481734871865, "num_tokens": 3976020.0, "step": 1960 }, { "entropy": 6.842778825759888, "epoch": 0.11501316944688324, "grad_norm": 0.9765625, "learning_rate": 0.00039476421319679017, "loss": 6.4668, "mean_token_accuracy": 0.12651116624474526, "num_tokens": 3986642.0, "step": 1965 }, { "entropy": 6.6270751953125, "epoch": 0.11530582382206614, "grad_norm": 0.984375, "learning_rate": 0.00039376524018764, "loss": 6.4971, "mean_token_accuracy": 0.12009134292602539, "num_tokens": 3997343.0, "step": 1970 }, { "entropy": 6.695995426177978, "epoch": 0.11559847819724905, "grad_norm": 0.96875, "learning_rate": 0.00039276301116943616, "loss": 6.417, "mean_token_accuracy": 0.12686994075775146, "num_tokens": 4007715.0, "step": 1975 }, { "entropy": 6.663046932220459, "epoch": 0.11589113257243196, "grad_norm": 0.90234375, "learning_rate": 0.0003917575536187936, "loss": 6.5211, "mean_token_accuracy": 0.1214706502854824, "num_tokens": 4018268.0, "step": 1980 }, { "entropy": 6.7626746654510494, "epoch": 0.11618378694761487, "grad_norm": 0.87109375, "learning_rate": 0.00039074889510083894, "loss": 6.4082, "mean_token_accuracy": 0.12497928068041801, "num_tokens": 4028539.0, "step": 1985 }, { "entropy": 6.682868528366089, "epoch": 0.11647644132279777, "grad_norm": 0.91796875, "learning_rate": 0.00038973706326845495, "loss": 6.4965, "mean_token_accuracy": 0.12758915945887567, "num_tokens": 4039300.0, "step": 1990 }, { "entropy": 6.666601848602295, "epoch": 0.11676909569798069, "grad_norm": 1.0078125, "learning_rate": 0.0003887220858615225, "loss": 6.5343, "mean_token_accuracy": 0.11495309770107269, "num_tokens": 4048471.0, "step": 1995 }, { "entropy": 6.751353979110718, "epoch": 0.11706175007316359, "grad_norm": 0.91796875, "learning_rate": 0.0003877039907061597, "loss": 6.3476, "mean_token_accuracy": 0.1322360999882221, "num_tokens": 4058221.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 886039736647680.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }