{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.058530875036581796, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742143154144287, "epoch": 0.000292654375182909, "grad_norm": 5.34375, "learning_rate": 2e-06, "loss": 10.7851, "mean_token_accuracy": 7.092198356986045e-05, "num_tokens": 10253.0, "step": 5 }, { "entropy": 10.742099285125732, "epoch": 0.000585308750365818, "grad_norm": 5.09375, "learning_rate": 4.5e-06, "loss": 10.7585, "mean_token_accuracy": 7.072135922499001e-05, "num_tokens": 19586.0, "step": 10 }, { "entropy": 10.742091464996339, "epoch": 0.000877963125548727, "grad_norm": 5.71875, "learning_rate": 7e-06, "loss": 10.7338, "mean_token_accuracy": 0.0, "num_tokens": 28743.0, "step": 15 }, { "entropy": 10.742110919952392, "epoch": 0.001170617500731636, "grad_norm": 4.75, "learning_rate": 9.5e-06, "loss": 10.702, "mean_token_accuracy": 7.518797065131366e-05, "num_tokens": 39263.0, "step": 20 }, { "entropy": 10.7420015335083, "epoch": 0.0014632718759145448, "grad_norm": 5.0625, "learning_rate": 1.2e-05, "loss": 10.6176, "mean_token_accuracy": 0.00650847667711787, "num_tokens": 50195.0, "step": 25 }, { "entropy": 10.741524696350098, "epoch": 0.001755926251097454, "grad_norm": 4.5, "learning_rate": 1.4500000000000002e-05, "loss": 10.4398, "mean_token_accuracy": 0.04643158838152885, "num_tokens": 58982.0, "step": 30 }, { "entropy": 10.739701747894287, "epoch": 0.002048580626280363, "grad_norm": 3.375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3385, "mean_token_accuracy": 0.04858696423470974, "num_tokens": 68619.0, "step": 35 }, { "entropy": 10.733176803588867, "epoch": 0.002341235001463272, "grad_norm": 2.734375, "learning_rate": 1.95e-05, "loss": 10.1755, "mean_token_accuracy": 0.054676258191466334, "num_tokens": 78276.0, "step": 40 }, { "entropy": 10.719074249267578, "epoch": 0.0026338893766461808, "grad_norm": 2.1875, "learning_rate": 2.2e-05, "loss": 10.085, "mean_token_accuracy": 0.05106211043894291, "num_tokens": 87977.0, "step": 45 }, { "entropy": 10.702382278442382, "epoch": 0.0029265437518290896, "grad_norm": 2.140625, "learning_rate": 2.4500000000000003e-05, "loss": 10.007, "mean_token_accuracy": 0.05418388731777668, "num_tokens": 97168.0, "step": 50 }, { "entropy": 10.688697719573975, "epoch": 0.003219198127011999, "grad_norm": 1.984375, "learning_rate": 2.7e-05, "loss": 9.978, "mean_token_accuracy": 0.0560054711997509, "num_tokens": 108162.0, "step": 55 }, { "entropy": 10.677631187438966, "epoch": 0.003511852502194908, "grad_norm": 1.9375, "learning_rate": 2.95e-05, "loss": 9.8907, "mean_token_accuracy": 0.05185089595615864, "num_tokens": 117963.0, "step": 60 }, { "entropy": 10.672104358673096, "epoch": 0.0038045068773778167, "grad_norm": 1.78125, "learning_rate": 3.2e-05, "loss": 9.8844, "mean_token_accuracy": 0.05049301944673061, "num_tokens": 128067.0, "step": 65 }, { "entropy": 10.665418434143067, "epoch": 0.004097161252560726, "grad_norm": 1.8984375, "learning_rate": 3.4500000000000005e-05, "loss": 9.8046, "mean_token_accuracy": 0.05261277854442596, "num_tokens": 138347.0, "step": 70 }, { "entropy": 10.655702877044678, "epoch": 0.004389815627743635, "grad_norm": 1.7734375, "learning_rate": 3.7e-05, "loss": 9.7713, "mean_token_accuracy": 0.05200894549489021, "num_tokens": 148883.0, "step": 75 }, { "entropy": 10.648012065887452, "epoch": 0.004682470002926544, "grad_norm": 1.7734375, "learning_rate": 3.95e-05, "loss": 9.7304, "mean_token_accuracy": 0.053603590652346614, "num_tokens": 158416.0, "step": 80 }, { "entropy": 10.638986778259277, "epoch": 0.004975124378109453, "grad_norm": 1.8125, "learning_rate": 4.2000000000000004e-05, "loss": 9.624, "mean_token_accuracy": 0.056516367569565774, "num_tokens": 168380.0, "step": 85 }, { "entropy": 10.622650527954102, "epoch": 0.0052677787532923615, "grad_norm": 1.9375, "learning_rate": 4.45e-05, "loss": 9.5594, "mean_token_accuracy": 0.058524899929761884, "num_tokens": 178623.0, "step": 90 }, { "entropy": 10.598152160644531, "epoch": 0.00556043312847527, "grad_norm": 1.7421875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5209, "mean_token_accuracy": 0.05661297850310802, "num_tokens": 189058.0, "step": 95 }, { "entropy": 10.577679920196534, "epoch": 0.005853087503658179, "grad_norm": 1.6796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.4548, "mean_token_accuracy": 0.056520416587591174, "num_tokens": 199465.0, "step": 100 }, { "entropy": 10.56387767791748, "epoch": 0.006145741878841089, "grad_norm": 1.6015625, "learning_rate": 5.2e-05, "loss": 9.4, "mean_token_accuracy": 0.054618718847632405, "num_tokens": 208712.0, "step": 105 }, { "entropy": 10.543546962738038, "epoch": 0.006438396254023998, "grad_norm": 1.484375, "learning_rate": 5.45e-05, "loss": 9.3224, "mean_token_accuracy": 0.05899658054113388, "num_tokens": 218557.0, "step": 110 }, { "entropy": 10.48940305709839, "epoch": 0.006731050629206907, "grad_norm": 1.6015625, "learning_rate": 5.7e-05, "loss": 9.2068, "mean_token_accuracy": 0.06870373338460922, "num_tokens": 228961.0, "step": 115 }, { "entropy": 10.402587509155273, "epoch": 0.007023705004389816, "grad_norm": 1.4375, "learning_rate": 5.9499999999999996e-05, "loss": 9.1227, "mean_token_accuracy": 0.06810536533594132, "num_tokens": 238987.0, "step": 120 }, { "entropy": 10.348681640625, "epoch": 0.0073163593795727245, "grad_norm": 1.328125, "learning_rate": 6.2e-05, "loss": 9.0633, "mean_token_accuracy": 0.0605758685618639, "num_tokens": 249600.0, "step": 125 }, { "entropy": 10.30824089050293, "epoch": 0.007609013754755633, "grad_norm": 1.578125, "learning_rate": 6.450000000000001e-05, "loss": 8.8758, "mean_token_accuracy": 0.07409285828471183, "num_tokens": 259215.0, "step": 130 }, { "entropy": 10.212008476257324, "epoch": 0.007901668129938543, "grad_norm": 1.375, "learning_rate": 6.7e-05, "loss": 8.8303, "mean_token_accuracy": 0.06557713933289051, "num_tokens": 268888.0, "step": 135 }, { "entropy": 10.150605010986329, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.74, "mean_token_accuracy": 0.06668962053954601, "num_tokens": 278451.0, "step": 140 }, { "entropy": 10.055028533935547, "epoch": 0.008486976880304361, "grad_norm": 1.2578125, "learning_rate": 7.2e-05, "loss": 8.7012, "mean_token_accuracy": 0.06709126047790051, "num_tokens": 289577.0, "step": 145 }, { "entropy": 9.99300413131714, "epoch": 0.00877963125548727, "grad_norm": 1.1640625, "learning_rate": 7.45e-05, "loss": 8.5708, "mean_token_accuracy": 0.06588217578828334, "num_tokens": 299057.0, "step": 150 }, { "entropy": 9.817628383636475, "epoch": 0.009072285630670179, "grad_norm": 1.0703125, "learning_rate": 7.7e-05, "loss": 8.4885, "mean_token_accuracy": 0.06879487000405789, "num_tokens": 308802.0, "step": 155 }, { "entropy": 9.719903469085693, "epoch": 0.009364940005853088, "grad_norm": 0.98046875, "learning_rate": 7.950000000000001e-05, "loss": 8.3738, "mean_token_accuracy": 0.07012738101184368, "num_tokens": 317365.0, "step": 160 }, { "entropy": 9.5343448638916, "epoch": 0.009657594381035996, "grad_norm": 1.140625, "learning_rate": 8.2e-05, "loss": 8.3035, "mean_token_accuracy": 0.07032971270382404, "num_tokens": 326927.0, "step": 165 }, { "entropy": 9.404919242858886, "epoch": 0.009950248756218905, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 8.317, "mean_token_accuracy": 0.06643726415932179, "num_tokens": 337408.0, "step": 170 }, { "entropy": 9.28181962966919, "epoch": 0.010242903131401814, "grad_norm": 0.79296875, "learning_rate": 8.7e-05, "loss": 8.2328, "mean_token_accuracy": 0.06949336491525174, "num_tokens": 348282.0, "step": 175 }, { "entropy": 9.099757957458497, "epoch": 0.010535557506584723, "grad_norm": 0.8359375, "learning_rate": 8.95e-05, "loss": 8.1847, "mean_token_accuracy": 0.06538042239844799, "num_tokens": 357767.0, "step": 180 }, { "entropy": 8.947648048400879, "epoch": 0.010828211881767632, "grad_norm": 0.77734375, "learning_rate": 9.2e-05, "loss": 8.1401, "mean_token_accuracy": 0.07173748835921287, "num_tokens": 368665.0, "step": 185 }, { "entropy": 8.832690525054932, "epoch": 0.01112086625695054, "grad_norm": 1.1015625, "learning_rate": 9.45e-05, "loss": 8.125, "mean_token_accuracy": 0.0688393272459507, "num_tokens": 378741.0, "step": 190 }, { "entropy": 8.722904491424561, "epoch": 0.01141352063213345, "grad_norm": 0.8359375, "learning_rate": 9.7e-05, "loss": 8.1228, "mean_token_accuracy": 0.07389259040355682, "num_tokens": 388324.0, "step": 195 }, { "entropy": 8.738927555084228, "epoch": 0.011706175007316359, "grad_norm": 0.75390625, "learning_rate": 9.95e-05, "loss": 8.1796, "mean_token_accuracy": 0.06952995508909225, "num_tokens": 398450.0, "step": 200 }, { "entropy": 8.615283966064453, "epoch": 0.01199882938249927, "grad_norm": 0.8203125, "learning_rate": 0.000102, "loss": 8.0899, "mean_token_accuracy": 0.07332116328179836, "num_tokens": 408961.0, "step": 205 }, { "entropy": 8.581227874755859, "epoch": 0.012291483757682178, "grad_norm": 1.078125, "learning_rate": 0.00010449999999999999, "loss": 8.1226, "mean_token_accuracy": 0.0683289546519518, "num_tokens": 418517.0, "step": 210 }, { "entropy": 8.532517910003662, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.035, "mean_token_accuracy": 0.07064232043921947, "num_tokens": 428059.0, "step": 215 }, { "entropy": 8.60868797302246, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.0513, "mean_token_accuracy": 0.06911276690661908, "num_tokens": 438499.0, "step": 220 }, { "entropy": 8.50686674118042, "epoch": 0.013169446883230905, "grad_norm": 0.73046875, "learning_rate": 0.000112, "loss": 8.0542, "mean_token_accuracy": 0.06983353272080421, "num_tokens": 448761.0, "step": 225 }, { "entropy": 8.424305152893066, "epoch": 0.013462101258413814, "grad_norm": 0.77734375, "learning_rate": 0.0001145, "loss": 8.0471, "mean_token_accuracy": 0.07090565152466297, "num_tokens": 458386.0, "step": 230 }, { "entropy": 8.447117614746094, "epoch": 0.013754755633596722, "grad_norm": 0.765625, "learning_rate": 0.00011700000000000001, "loss": 7.991, "mean_token_accuracy": 0.06929317899048329, "num_tokens": 468198.0, "step": 235 }, { "entropy": 8.46488447189331, "epoch": 0.014047410008779631, "grad_norm": 0.7265625, "learning_rate": 0.00011949999999999999, "loss": 8.0203, "mean_token_accuracy": 0.07129090093076229, "num_tokens": 480142.0, "step": 240 }, { "entropy": 8.370715618133545, "epoch": 0.01434006438396254, "grad_norm": 0.79296875, "learning_rate": 0.000122, "loss": 7.8998, "mean_token_accuracy": 0.08097687140107154, "num_tokens": 490686.0, "step": 245 }, { "entropy": 8.408738231658935, "epoch": 0.014632718759145449, "grad_norm": 0.90234375, "learning_rate": 0.0001245, "loss": 7.9758, "mean_token_accuracy": 0.07468959763646126, "num_tokens": 500099.0, "step": 250 }, { "entropy": 8.416247749328614, "epoch": 0.014925373134328358, "grad_norm": 0.8515625, "learning_rate": 0.000127, "loss": 7.9005, "mean_token_accuracy": 0.07769993916153908, "num_tokens": 509525.0, "step": 255 }, { "entropy": 8.347339820861816, "epoch": 0.015218027509511267, "grad_norm": 0.7421875, "learning_rate": 0.0001295, "loss": 7.8978, "mean_token_accuracy": 0.07274740003049374, "num_tokens": 520141.0, "step": 260 }, { "entropy": 8.357079029083252, "epoch": 0.015510681884694176, "grad_norm": 1.015625, "learning_rate": 0.000132, "loss": 8.0384, "mean_token_accuracy": 0.06597915887832642, "num_tokens": 531645.0, "step": 265 }, { "entropy": 8.3228253364563, "epoch": 0.015803336259877086, "grad_norm": 0.8203125, "learning_rate": 0.00013450000000000002, "loss": 7.9109, "mean_token_accuracy": 0.07127318009734154, "num_tokens": 541779.0, "step": 270 }, { "entropy": 8.300227451324464, "epoch": 0.016095990635059995, "grad_norm": 0.82421875, "learning_rate": 0.00013700000000000002, "loss": 7.8871, "mean_token_accuracy": 0.07985152080655097, "num_tokens": 551770.0, "step": 275 }, { "entropy": 8.360063171386718, "epoch": 0.016388645010242904, "grad_norm": 0.90234375, "learning_rate": 0.0001395, "loss": 7.8829, "mean_token_accuracy": 0.0752606987953186, "num_tokens": 561814.0, "step": 280 }, { "entropy": 8.235567474365235, "epoch": 0.016681299385425813, "grad_norm": 0.82421875, "learning_rate": 0.00014199999999999998, "loss": 7.9551, "mean_token_accuracy": 0.06852101050317287, "num_tokens": 571988.0, "step": 285 }, { "entropy": 8.42728681564331, "epoch": 0.016973953760608722, "grad_norm": 0.7109375, "learning_rate": 0.0001445, "loss": 7.9876, "mean_token_accuracy": 0.07176770456135273, "num_tokens": 582814.0, "step": 290 }, { "entropy": 8.26517457962036, "epoch": 0.01726660813579163, "grad_norm": 0.90234375, "learning_rate": 0.000147, "loss": 7.9178, "mean_token_accuracy": 0.07443804480135441, "num_tokens": 592301.0, "step": 295 }, { "entropy": 8.199700450897216, "epoch": 0.01755926251097454, "grad_norm": 0.80859375, "learning_rate": 0.0001495, "loss": 7.8119, "mean_token_accuracy": 0.077539586648345, "num_tokens": 602898.0, "step": 300 }, { "entropy": 8.289494514465332, "epoch": 0.01785191688615745, "grad_norm": 1.0546875, "learning_rate": 0.000152, "loss": 7.8914, "mean_token_accuracy": 0.07545375041663646, "num_tokens": 612731.0, "step": 305 }, { "entropy": 8.186264896392823, "epoch": 0.018144571261340357, "grad_norm": 0.890625, "learning_rate": 0.00015450000000000001, "loss": 7.843, "mean_token_accuracy": 0.07743252031505107, "num_tokens": 623067.0, "step": 310 }, { "entropy": 8.256502819061279, "epoch": 0.018437225636523266, "grad_norm": 0.76171875, "learning_rate": 0.000157, "loss": 7.8317, "mean_token_accuracy": 0.08097588121891022, "num_tokens": 633538.0, "step": 315 }, { "entropy": 8.319536399841308, "epoch": 0.018729880011706175, "grad_norm": 1.6484375, "learning_rate": 0.0001595, "loss": 7.8898, "mean_token_accuracy": 0.07923161759972572, "num_tokens": 643704.0, "step": 320 }, { "entropy": 8.158168601989747, "epoch": 0.019022534386889084, "grad_norm": 0.84375, "learning_rate": 0.000162, "loss": 7.9204, "mean_token_accuracy": 0.07442782260477543, "num_tokens": 653766.0, "step": 325 }, { "entropy": 8.432480907440185, "epoch": 0.019315188762071993, "grad_norm": 0.921875, "learning_rate": 0.00016450000000000001, "loss": 7.9175, "mean_token_accuracy": 0.07209107242524623, "num_tokens": 663289.0, "step": 330 }, { "entropy": 8.145325660705566, "epoch": 0.0196078431372549, "grad_norm": 0.84765625, "learning_rate": 0.00016700000000000002, "loss": 7.8214, "mean_token_accuracy": 0.07566024884581565, "num_tokens": 673196.0, "step": 335 }, { "entropy": 8.328914070129395, "epoch": 0.01990049751243781, "grad_norm": 0.98046875, "learning_rate": 0.00016950000000000003, "loss": 7.8481, "mean_token_accuracy": 0.0807725053280592, "num_tokens": 682694.0, "step": 340 }, { "entropy": 8.15658712387085, "epoch": 0.02019315188762072, "grad_norm": 0.85546875, "learning_rate": 0.00017199999999999998, "loss": 7.8414, "mean_token_accuracy": 0.07744252718985081, "num_tokens": 692880.0, "step": 345 }, { "entropy": 8.265804481506347, "epoch": 0.02048580626280363, "grad_norm": 1.2109375, "learning_rate": 0.00017449999999999999, "loss": 7.9339, "mean_token_accuracy": 0.07408964931964875, "num_tokens": 703972.0, "step": 350 }, { "entropy": 8.137424850463868, "epoch": 0.020778460637986537, "grad_norm": 0.85546875, "learning_rate": 0.000177, "loss": 7.7467, "mean_token_accuracy": 0.07930146306753158, "num_tokens": 713571.0, "step": 355 }, { "entropy": 8.209496688842773, "epoch": 0.021071115013169446, "grad_norm": 0.93359375, "learning_rate": 0.0001795, "loss": 7.8355, "mean_token_accuracy": 0.08222270905971527, "num_tokens": 723642.0, "step": 360 }, { "entropy": 8.136897945404053, "epoch": 0.021363769388352355, "grad_norm": 0.9453125, "learning_rate": 0.000182, "loss": 7.8793, "mean_token_accuracy": 0.07310881391167641, "num_tokens": 733848.0, "step": 365 }, { "entropy": 8.176177358627319, "epoch": 0.021656423763535264, "grad_norm": 0.7265625, "learning_rate": 0.0001845, "loss": 7.6089, "mean_token_accuracy": 0.10752813518047333, "num_tokens": 743752.0, "step": 370 }, { "entropy": 8.144378280639648, "epoch": 0.021949078138718173, "grad_norm": 0.91796875, "learning_rate": 0.000187, "loss": 7.8031, "mean_token_accuracy": 0.08254543766379356, "num_tokens": 754145.0, "step": 375 }, { "entropy": 8.118795394897461, "epoch": 0.02224173251390108, "grad_norm": 0.765625, "learning_rate": 0.0001895, "loss": 7.766, "mean_token_accuracy": 0.07592462375760078, "num_tokens": 763930.0, "step": 380 }, { "entropy": 8.178821086883545, "epoch": 0.02253438688908399, "grad_norm": 1.015625, "learning_rate": 0.000192, "loss": 7.7934, "mean_token_accuracy": 0.08122270852327347, "num_tokens": 774851.0, "step": 385 }, { "entropy": 8.122542095184325, "epoch": 0.0228270412642669, "grad_norm": 0.80859375, "learning_rate": 0.0001945, "loss": 7.7915, "mean_token_accuracy": 0.07377454079687595, "num_tokens": 784251.0, "step": 390 }, { "entropy": 8.100419902801514, "epoch": 0.023119695639449808, "grad_norm": 0.92578125, "learning_rate": 0.00019700000000000002, "loss": 7.8395, "mean_token_accuracy": 0.0817381426692009, "num_tokens": 794089.0, "step": 395 }, { "entropy": 8.19840030670166, "epoch": 0.023412350014632717, "grad_norm": 0.8671875, "learning_rate": 0.00019950000000000002, "loss": 7.8242, "mean_token_accuracy": 0.07439705729484558, "num_tokens": 805274.0, "step": 400 }, { "entropy": 8.17535228729248, "epoch": 0.02370500438981563, "grad_norm": 0.8515625, "learning_rate": 0.000202, "loss": 7.7672, "mean_token_accuracy": 0.07779609337449074, "num_tokens": 816036.0, "step": 405 }, { "entropy": 8.004063892364503, "epoch": 0.02399765876499854, "grad_norm": 0.83203125, "learning_rate": 0.00020449999999999998, "loss": 7.7613, "mean_token_accuracy": 0.07725987881422043, "num_tokens": 826393.0, "step": 410 }, { "entropy": 8.159784364700318, "epoch": 0.024290313140181447, "grad_norm": 0.87109375, "learning_rate": 0.000207, "loss": 7.7542, "mean_token_accuracy": 0.0782277960330248, "num_tokens": 836456.0, "step": 415 }, { "entropy": 8.072831869125366, "epoch": 0.024582967515364356, "grad_norm": 0.8125, "learning_rate": 0.0002095, "loss": 7.759, "mean_token_accuracy": 0.07723330594599247, "num_tokens": 846493.0, "step": 420 }, { "entropy": 8.16247329711914, "epoch": 0.024875621890547265, "grad_norm": 0.8125, "learning_rate": 0.000212, "loss": 7.7584, "mean_token_accuracy": 0.07505144067108631, "num_tokens": 857041.0, "step": 425 }, { "entropy": 7.9756200313568115, "epoch": 0.025168276265730174, "grad_norm": 0.92578125, "learning_rate": 0.0002145, "loss": 7.6788, "mean_token_accuracy": 0.08394450098276138, "num_tokens": 867053.0, "step": 430 }, { "entropy": 8.086863994598389, "epoch": 0.025460930640913083, "grad_norm": 0.9921875, "learning_rate": 0.00021700000000000002, "loss": 7.7398, "mean_token_accuracy": 0.0781655989587307, "num_tokens": 876944.0, "step": 435 }, { "entropy": 8.080809020996094, "epoch": 0.02575358501609599, "grad_norm": 0.828125, "learning_rate": 0.0002195, "loss": 7.6902, "mean_token_accuracy": 0.08105823285877704, "num_tokens": 887257.0, "step": 440 }, { "entropy": 8.091656923294067, "epoch": 0.0260462393912789, "grad_norm": 0.8984375, "learning_rate": 0.000222, "loss": 7.7086, "mean_token_accuracy": 0.0815083347260952, "num_tokens": 896877.0, "step": 445 }, { "entropy": 8.037679195404053, "epoch": 0.02633889376646181, "grad_norm": 0.83203125, "learning_rate": 0.0002245, "loss": 7.6096, "mean_token_accuracy": 0.08536934405565262, "num_tokens": 906930.0, "step": 450 }, { "entropy": 8.04052267074585, "epoch": 0.026631548141644718, "grad_norm": 0.8515625, "learning_rate": 0.00022700000000000002, "loss": 7.7471, "mean_token_accuracy": 0.07020874097943305, "num_tokens": 916841.0, "step": 455 }, { "entropy": 8.061063146591186, "epoch": 0.026924202516827627, "grad_norm": 0.7890625, "learning_rate": 0.00022950000000000002, "loss": 7.6914, "mean_token_accuracy": 0.07996720150113105, "num_tokens": 927024.0, "step": 460 }, { "entropy": 8.085123777389526, "epoch": 0.027216856892010536, "grad_norm": 0.95703125, "learning_rate": 0.00023200000000000003, "loss": 7.7227, "mean_token_accuracy": 0.07815472632646561, "num_tokens": 935786.0, "step": 465 }, { "entropy": 7.955375385284424, "epoch": 0.027509511267193445, "grad_norm": 0.8359375, "learning_rate": 0.00023449999999999998, "loss": 7.6349, "mean_token_accuracy": 0.08305523693561553, "num_tokens": 946819.0, "step": 470 }, { "entropy": 8.01088285446167, "epoch": 0.027802165642376354, "grad_norm": 0.84375, "learning_rate": 0.000237, "loss": 7.6793, "mean_token_accuracy": 0.08371292352676392, "num_tokens": 957876.0, "step": 475 }, { "entropy": 8.070115327835083, "epoch": 0.028094820017559263, "grad_norm": 0.9765625, "learning_rate": 0.0002395, "loss": 7.7627, "mean_token_accuracy": 0.07754282280802727, "num_tokens": 969211.0, "step": 480 }, { "entropy": 8.086713933944703, "epoch": 0.02838747439274217, "grad_norm": 0.89453125, "learning_rate": 0.000242, "loss": 7.7091, "mean_token_accuracy": 0.07998017743229865, "num_tokens": 979090.0, "step": 485 }, { "entropy": 8.120463180541993, "epoch": 0.02868012876792508, "grad_norm": 0.8984375, "learning_rate": 0.0002445, "loss": 7.7649, "mean_token_accuracy": 0.07725568227469921, "num_tokens": 990510.0, "step": 490 }, { "entropy": 8.065446138381958, "epoch": 0.02897278314310799, "grad_norm": 1.046875, "learning_rate": 0.000247, "loss": 7.6837, "mean_token_accuracy": 0.07927028760313988, "num_tokens": 1000890.0, "step": 495 }, { "entropy": 7.89040241241455, "epoch": 0.029265437518290898, "grad_norm": 0.9296875, "learning_rate": 0.0002495, "loss": 7.633, "mean_token_accuracy": 0.08539719134569168, "num_tokens": 1011019.0, "step": 500 }, { "entropy": 8.053290367126465, "epoch": 0.029558091893473807, "grad_norm": 0.9296875, "learning_rate": 0.000252, "loss": 7.5976, "mean_token_accuracy": 0.0852201983332634, "num_tokens": 1020703.0, "step": 505 }, { "entropy": 7.924099731445312, "epoch": 0.029850746268656716, "grad_norm": 1.0, "learning_rate": 0.0002545, "loss": 7.6144, "mean_token_accuracy": 0.08518284186720848, "num_tokens": 1030539.0, "step": 510 }, { "entropy": 7.876818609237671, "epoch": 0.030143400643839625, "grad_norm": 0.8984375, "learning_rate": 0.000257, "loss": 7.6173, "mean_token_accuracy": 0.07879232838749886, "num_tokens": 1040977.0, "step": 515 }, { "entropy": 7.9826685905456545, "epoch": 0.030436055019022534, "grad_norm": 1.0234375, "learning_rate": 0.0002595, "loss": 7.5867, "mean_token_accuracy": 0.08224296122789383, "num_tokens": 1050382.0, "step": 520 }, { "entropy": 7.914853572845459, "epoch": 0.030728709394205442, "grad_norm": 0.8984375, "learning_rate": 0.000262, "loss": 7.5776, "mean_token_accuracy": 0.08655883669853211, "num_tokens": 1062287.0, "step": 525 }, { "entropy": 7.873267793655396, "epoch": 0.03102136376938835, "grad_norm": 0.98828125, "learning_rate": 0.00026450000000000003, "loss": 7.5624, "mean_token_accuracy": 0.0834833487868309, "num_tokens": 1072138.0, "step": 530 }, { "entropy": 8.053305435180665, "epoch": 0.031314018144571264, "grad_norm": 0.9453125, "learning_rate": 0.00026700000000000004, "loss": 7.5478, "mean_token_accuracy": 0.08701685890555381, "num_tokens": 1082730.0, "step": 535 }, { "entropy": 7.881413888931275, "epoch": 0.03160667251975417, "grad_norm": 1.0546875, "learning_rate": 0.00026950000000000005, "loss": 7.5191, "mean_token_accuracy": 0.08792314156889916, "num_tokens": 1093409.0, "step": 540 }, { "entropy": 7.940295267105102, "epoch": 0.03189932689493708, "grad_norm": 0.890625, "learning_rate": 0.00027200000000000005, "loss": 7.6596, "mean_token_accuracy": 0.08377403020858765, "num_tokens": 1103817.0, "step": 545 }, { "entropy": 7.939820003509522, "epoch": 0.03219198127011999, "grad_norm": 0.96484375, "learning_rate": 0.0002745, "loss": 7.6265, "mean_token_accuracy": 0.07738926894962787, "num_tokens": 1114392.0, "step": 550 }, { "entropy": 7.96156415939331, "epoch": 0.0324846356453029, "grad_norm": 1.015625, "learning_rate": 0.000277, "loss": 7.5224, "mean_token_accuracy": 0.08881102874875069, "num_tokens": 1124539.0, "step": 555 }, { "entropy": 7.832987546920776, "epoch": 0.03277729002048581, "grad_norm": 1.171875, "learning_rate": 0.0002795, "loss": 7.5564, "mean_token_accuracy": 0.08254684880375862, "num_tokens": 1135110.0, "step": 560 }, { "entropy": 7.855937910079956, "epoch": 0.03306994439566872, "grad_norm": 1.03125, "learning_rate": 0.00028199999999999997, "loss": 7.5979, "mean_token_accuracy": 0.08505113944411277, "num_tokens": 1145458.0, "step": 565 }, { "entropy": 7.951333904266358, "epoch": 0.033362598770851626, "grad_norm": 0.98046875, "learning_rate": 0.0002845, "loss": 7.5383, "mean_token_accuracy": 0.08062238246202469, "num_tokens": 1155754.0, "step": 570 }, { "entropy": 7.8793701171875, "epoch": 0.033655253146034535, "grad_norm": 0.8984375, "learning_rate": 0.000287, "loss": 7.5816, "mean_token_accuracy": 0.082074723392725, "num_tokens": 1165771.0, "step": 575 }, { "entropy": 7.901887035369873, "epoch": 0.033947907521217444, "grad_norm": 1.015625, "learning_rate": 0.0002895, "loss": 7.534, "mean_token_accuracy": 0.08429761826992035, "num_tokens": 1175785.0, "step": 580 }, { "entropy": 7.887288761138916, "epoch": 0.03424056189640035, "grad_norm": 0.9375, "learning_rate": 0.000292, "loss": 7.5557, "mean_token_accuracy": 0.08287644758820534, "num_tokens": 1186252.0, "step": 585 }, { "entropy": 7.767520141601563, "epoch": 0.03453321627158326, "grad_norm": 0.890625, "learning_rate": 0.0002945, "loss": 7.5037, "mean_token_accuracy": 0.08624404892325402, "num_tokens": 1196800.0, "step": 590 }, { "entropy": 7.92415132522583, "epoch": 0.03482587064676617, "grad_norm": 0.86328125, "learning_rate": 0.000297, "loss": 7.4895, "mean_token_accuracy": 0.08825775608420372, "num_tokens": 1207794.0, "step": 595 }, { "entropy": 7.7734299659729, "epoch": 0.03511852502194908, "grad_norm": 0.9453125, "learning_rate": 0.0002995, "loss": 7.4153, "mean_token_accuracy": 0.08845552653074265, "num_tokens": 1217029.0, "step": 600 }, { "entropy": 7.832931613922119, "epoch": 0.03541117939713199, "grad_norm": 1.0625, "learning_rate": 0.000302, "loss": 7.3933, "mean_token_accuracy": 0.09399922043085099, "num_tokens": 1227917.0, "step": 605 }, { "entropy": 7.771529722213745, "epoch": 0.0357038337723149, "grad_norm": 0.98046875, "learning_rate": 0.0003045, "loss": 7.4464, "mean_token_accuracy": 0.08992072939872742, "num_tokens": 1238495.0, "step": 610 }, { "entropy": 7.831154489517212, "epoch": 0.035996488147497806, "grad_norm": 0.92578125, "learning_rate": 0.000307, "loss": 7.4915, "mean_token_accuracy": 0.08896522894501686, "num_tokens": 1249649.0, "step": 615 }, { "entropy": 7.815850448608399, "epoch": 0.036289142522680715, "grad_norm": 0.9296875, "learning_rate": 0.0003095, "loss": 7.5417, "mean_token_accuracy": 0.08101370558142662, "num_tokens": 1260937.0, "step": 620 }, { "entropy": 7.813495063781739, "epoch": 0.036581796897863623, "grad_norm": 0.96484375, "learning_rate": 0.000312, "loss": 7.3702, "mean_token_accuracy": 0.09065580368041992, "num_tokens": 1270751.0, "step": 625 }, { "entropy": 7.818518209457397, "epoch": 0.03687445127304653, "grad_norm": 0.8671875, "learning_rate": 0.0003145, "loss": 7.4965, "mean_token_accuracy": 0.0885044053196907, "num_tokens": 1282383.0, "step": 630 }, { "entropy": 7.83252854347229, "epoch": 0.03716710564822944, "grad_norm": 0.96484375, "learning_rate": 0.000317, "loss": 7.3179, "mean_token_accuracy": 0.1026477910578251, "num_tokens": 1292320.0, "step": 635 }, { "entropy": 7.6734686374664305, "epoch": 0.03745976002341235, "grad_norm": 0.91796875, "learning_rate": 0.0003195, "loss": 7.4792, "mean_token_accuracy": 0.08322202041745186, "num_tokens": 1303054.0, "step": 640 }, { "entropy": 7.8633969783782955, "epoch": 0.03775241439859526, "grad_norm": 1.09375, "learning_rate": 0.000322, "loss": 7.4465, "mean_token_accuracy": 0.08914806470274925, "num_tokens": 1311607.0, "step": 645 }, { "entropy": 7.689844703674316, "epoch": 0.03804506877377817, "grad_norm": 1.046875, "learning_rate": 0.00032450000000000003, "loss": 7.4234, "mean_token_accuracy": 0.08909434452652931, "num_tokens": 1321930.0, "step": 650 }, { "entropy": 7.8022431373596195, "epoch": 0.03833772314896108, "grad_norm": 0.96875, "learning_rate": 0.00032700000000000003, "loss": 7.4465, "mean_token_accuracy": 0.08396812826395035, "num_tokens": 1331533.0, "step": 655 }, { "entropy": 7.769197797775268, "epoch": 0.038630377524143986, "grad_norm": 0.87890625, "learning_rate": 0.00032950000000000004, "loss": 7.4086, "mean_token_accuracy": 0.08934582769870758, "num_tokens": 1341961.0, "step": 660 }, { "entropy": 7.769333171844482, "epoch": 0.038923031899326895, "grad_norm": 0.984375, "learning_rate": 0.00033200000000000005, "loss": 7.4375, "mean_token_accuracy": 0.08935849741101265, "num_tokens": 1352741.0, "step": 665 }, { "entropy": 7.791517686843872, "epoch": 0.0392156862745098, "grad_norm": 0.96875, "learning_rate": 0.00033450000000000005, "loss": 7.432, "mean_token_accuracy": 0.08128280714154243, "num_tokens": 1363467.0, "step": 670 }, { "entropy": 7.691935110092163, "epoch": 0.03950834064969271, "grad_norm": 0.984375, "learning_rate": 0.000337, "loss": 7.3877, "mean_token_accuracy": 0.09103676527738572, "num_tokens": 1372759.0, "step": 675 }, { "entropy": 7.6941760063171385, "epoch": 0.03980099502487562, "grad_norm": 1.109375, "learning_rate": 0.0003395, "loss": 7.3855, "mean_token_accuracy": 0.09363519176840782, "num_tokens": 1382785.0, "step": 680 }, { "entropy": 7.757591485977173, "epoch": 0.04009364940005853, "grad_norm": 0.94140625, "learning_rate": 0.000342, "loss": 7.4335, "mean_token_accuracy": 0.0862673670053482, "num_tokens": 1392748.0, "step": 685 }, { "entropy": 7.777906894683838, "epoch": 0.04038630377524144, "grad_norm": 0.94921875, "learning_rate": 0.00034449999999999997, "loss": 7.4677, "mean_token_accuracy": 0.08610242903232575, "num_tokens": 1402473.0, "step": 690 }, { "entropy": 7.787166547775269, "epoch": 0.04067895815042435, "grad_norm": 0.84765625, "learning_rate": 0.000347, "loss": 7.439, "mean_token_accuracy": 0.08554250001907349, "num_tokens": 1413921.0, "step": 695 }, { "entropy": 7.736286449432373, "epoch": 0.04097161252560726, "grad_norm": 0.94140625, "learning_rate": 0.0003495, "loss": 7.4369, "mean_token_accuracy": 0.0805517353117466, "num_tokens": 1424687.0, "step": 700 }, { "entropy": 7.767450380325317, "epoch": 0.041264266900790166, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 7.4388, "mean_token_accuracy": 0.08601183965802192, "num_tokens": 1435153.0, "step": 705 }, { "entropy": 7.794674873352051, "epoch": 0.041556921275973074, "grad_norm": 0.8828125, "learning_rate": 0.0003545, "loss": 7.4462, "mean_token_accuracy": 0.0846464328467846, "num_tokens": 1446187.0, "step": 710 }, { "entropy": 7.755715560913086, "epoch": 0.04184957565115598, "grad_norm": 1.0078125, "learning_rate": 0.000357, "loss": 7.396, "mean_token_accuracy": 0.08824568465352059, "num_tokens": 1456299.0, "step": 715 }, { "entropy": 7.5965576171875, "epoch": 0.04214223002633889, "grad_norm": 1.0703125, "learning_rate": 0.0003595, "loss": 7.3017, "mean_token_accuracy": 0.09606124758720398, "num_tokens": 1465654.0, "step": 720 }, { "entropy": 7.70619683265686, "epoch": 0.0424348844015218, "grad_norm": 1.078125, "learning_rate": 0.000362, "loss": 7.3563, "mean_token_accuracy": 0.09394391924142838, "num_tokens": 1475248.0, "step": 725 }, { "entropy": 7.698731327056885, "epoch": 0.04272753877670471, "grad_norm": 0.9296875, "learning_rate": 0.0003645, "loss": 7.4247, "mean_token_accuracy": 0.08578455671668053, "num_tokens": 1485570.0, "step": 730 }, { "entropy": 7.636994504928589, "epoch": 0.04302019315188762, "grad_norm": 0.96484375, "learning_rate": 0.000367, "loss": 7.3294, "mean_token_accuracy": 0.09238605126738549, "num_tokens": 1495257.0, "step": 735 }, { "entropy": 7.687747764587402, "epoch": 0.04331284752707053, "grad_norm": 1.09375, "learning_rate": 0.0003695, "loss": 7.3467, "mean_token_accuracy": 0.08985281139612197, "num_tokens": 1504882.0, "step": 740 }, { "entropy": 7.706828022003174, "epoch": 0.043605501902253437, "grad_norm": 0.83203125, "learning_rate": 0.000372, "loss": 7.3918, "mean_token_accuracy": 0.08691600039601326, "num_tokens": 1515791.0, "step": 745 }, { "entropy": 7.595960521697998, "epoch": 0.043898156277436345, "grad_norm": 0.87109375, "learning_rate": 0.0003745, "loss": 7.3055, "mean_token_accuracy": 0.09265599772334099, "num_tokens": 1527837.0, "step": 750 }, { "entropy": 7.674931144714355, "epoch": 0.044190810652619254, "grad_norm": 1.15625, "learning_rate": 0.000377, "loss": 7.3197, "mean_token_accuracy": 0.09090850502252579, "num_tokens": 1538357.0, "step": 755 }, { "entropy": 7.597537708282471, "epoch": 0.04448346502780216, "grad_norm": 1.1953125, "learning_rate": 0.0003795, "loss": 7.318, "mean_token_accuracy": 0.09620778560638428, "num_tokens": 1548140.0, "step": 760 }, { "entropy": 7.655205726623535, "epoch": 0.04477611940298507, "grad_norm": 0.828125, "learning_rate": 0.000382, "loss": 7.3052, "mean_token_accuracy": 0.09487425237894058, "num_tokens": 1558723.0, "step": 765 }, { "entropy": 7.604353332519532, "epoch": 0.04506877377816798, "grad_norm": 1.015625, "learning_rate": 0.0003845, "loss": 7.3288, "mean_token_accuracy": 0.08416497483849525, "num_tokens": 1568519.0, "step": 770 }, { "entropy": 7.608450269699096, "epoch": 0.04536142815335089, "grad_norm": 1.1171875, "learning_rate": 0.00038700000000000003, "loss": 7.2961, "mean_token_accuracy": 0.09094355553388596, "num_tokens": 1578788.0, "step": 775 }, { "entropy": 7.620551347732544, "epoch": 0.0456540825285338, "grad_norm": 1.0234375, "learning_rate": 0.00038950000000000003, "loss": 7.2536, "mean_token_accuracy": 0.09547285735607147, "num_tokens": 1588593.0, "step": 780 }, { "entropy": 7.534824514389038, "epoch": 0.04594673690371671, "grad_norm": 0.9609375, "learning_rate": 0.00039200000000000004, "loss": 7.2914, "mean_token_accuracy": 0.08960797935724259, "num_tokens": 1598657.0, "step": 785 }, { "entropy": 7.504811525344849, "epoch": 0.046239391278899616, "grad_norm": 1.0078125, "learning_rate": 0.00039450000000000005, "loss": 7.2001, "mean_token_accuracy": 0.09868146777153015, "num_tokens": 1608825.0, "step": 790 }, { "entropy": 7.5206996440887455, "epoch": 0.046532045654082525, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 7.2045, "mean_token_accuracy": 0.09371785670518876, "num_tokens": 1618733.0, "step": 795 }, { "entropy": 7.602302169799804, "epoch": 0.046824700029265434, "grad_norm": 1.046875, "learning_rate": 0.0003995, "loss": 7.2273, "mean_token_accuracy": 0.09687273427844048, "num_tokens": 1628728.0, "step": 800 }, { "entropy": 7.53294186592102, "epoch": 0.04711735440444834, "grad_norm": 1.078125, "learning_rate": 0.000402, "loss": 7.3064, "mean_token_accuracy": 0.0901516005396843, "num_tokens": 1639016.0, "step": 805 }, { "entropy": 7.574016046524048, "epoch": 0.04741000877963126, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.297, "mean_token_accuracy": 0.0918840229511261, "num_tokens": 1649386.0, "step": 810 }, { "entropy": 7.666880130767822, "epoch": 0.04770266315481417, "grad_norm": 0.98828125, "learning_rate": 0.00040699999999999997, "loss": 7.2977, "mean_token_accuracy": 0.09063222482800484, "num_tokens": 1659949.0, "step": 815 }, { "entropy": 7.555622291564942, "epoch": 0.04799531752999708, "grad_norm": 1.0078125, "learning_rate": 0.0004095, "loss": 7.2765, "mean_token_accuracy": 0.09335207715630531, "num_tokens": 1670035.0, "step": 820 }, { "entropy": 7.611965894699097, "epoch": 0.048287971905179985, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.2132, "mean_token_accuracy": 0.08826020434498787, "num_tokens": 1679579.0, "step": 825 }, { "entropy": 7.441506242752075, "epoch": 0.048580626280362894, "grad_norm": 1.0625, "learning_rate": 0.0004145, "loss": 7.196, "mean_token_accuracy": 0.09741625487804413, "num_tokens": 1689900.0, "step": 830 }, { "entropy": 7.5691015243530275, "epoch": 0.0488732806555458, "grad_norm": 0.953125, "learning_rate": 0.000417, "loss": 7.2469, "mean_token_accuracy": 0.09050429165363312, "num_tokens": 1700534.0, "step": 835 }, { "entropy": 7.547771167755127, "epoch": 0.04916593503072871, "grad_norm": 0.90234375, "learning_rate": 0.0004195, "loss": 7.1963, "mean_token_accuracy": 0.09931469187140465, "num_tokens": 1710969.0, "step": 840 }, { "entropy": 7.454426383972168, "epoch": 0.04945858940591162, "grad_norm": 1.0234375, "learning_rate": 0.000422, "loss": 7.2267, "mean_token_accuracy": 0.09168547242879868, "num_tokens": 1721024.0, "step": 845 }, { "entropy": 7.430084466934204, "epoch": 0.04975124378109453, "grad_norm": 1.0859375, "learning_rate": 0.0004245, "loss": 7.1318, "mean_token_accuracy": 0.09713169336318969, "num_tokens": 1730197.0, "step": 850 }, { "entropy": 7.452590370178223, "epoch": 0.05004389815627744, "grad_norm": 1.125, "learning_rate": 0.000427, "loss": 7.1541, "mean_token_accuracy": 0.09219018146395683, "num_tokens": 1741132.0, "step": 855 }, { "entropy": 7.521068334579468, "epoch": 0.05033655253146035, "grad_norm": 0.98828125, "learning_rate": 0.0004295, "loss": 7.2637, "mean_token_accuracy": 0.08954514041543007, "num_tokens": 1751757.0, "step": 860 }, { "entropy": 7.495842170715332, "epoch": 0.050629206906643257, "grad_norm": 0.9921875, "learning_rate": 0.000432, "loss": 7.1582, "mean_token_accuracy": 0.09514842405915261, "num_tokens": 1762779.0, "step": 865 }, { "entropy": 7.475547981262207, "epoch": 0.050921861281826165, "grad_norm": 1.0234375, "learning_rate": 0.0004345, "loss": 7.1182, "mean_token_accuracy": 0.09630650877952576, "num_tokens": 1772353.0, "step": 870 }, { "entropy": 7.352218437194824, "epoch": 0.051214515657009074, "grad_norm": 0.94140625, "learning_rate": 0.000437, "loss": 7.145, "mean_token_accuracy": 0.09995641633868217, "num_tokens": 1782648.0, "step": 875 }, { "entropy": 7.392671585083008, "epoch": 0.05150717003219198, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 7.1484, "mean_token_accuracy": 0.09772149994969367, "num_tokens": 1792275.0, "step": 880 }, { "entropy": 7.387517881393433, "epoch": 0.05179982440737489, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 7.1486, "mean_token_accuracy": 0.09331418126821518, "num_tokens": 1803244.0, "step": 885 }, { "entropy": 7.4635416030883786, "epoch": 0.0520924787825578, "grad_norm": 0.86328125, "learning_rate": 0.0004445, "loss": 7.1907, "mean_token_accuracy": 0.09984328448772431, "num_tokens": 1814331.0, "step": 890 }, { "entropy": 7.442190837860108, "epoch": 0.05238513315774071, "grad_norm": 0.9921875, "learning_rate": 0.000447, "loss": 7.1557, "mean_token_accuracy": 0.09669465869665146, "num_tokens": 1823022.0, "step": 895 }, { "entropy": 7.4167015075683596, "epoch": 0.05267778753292362, "grad_norm": 0.9453125, "learning_rate": 0.00044950000000000003, "loss": 7.2017, "mean_token_accuracy": 0.09253377318382264, "num_tokens": 1834416.0, "step": 900 }, { "entropy": 7.530139684677124, "epoch": 0.05297044190810653, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.1951, "mean_token_accuracy": 0.09366482645273208, "num_tokens": 1843507.0, "step": 905 }, { "entropy": 7.3420909404754635, "epoch": 0.053263096283289436, "grad_norm": 0.98828125, "learning_rate": 0.00045450000000000004, "loss": 7.0998, "mean_token_accuracy": 0.09217809438705445, "num_tokens": 1854149.0, "step": 910 }, { "entropy": 7.416664695739746, "epoch": 0.053555750658472345, "grad_norm": 1.0546875, "learning_rate": 0.00045700000000000005, "loss": 7.1686, "mean_token_accuracy": 0.09251093789935112, "num_tokens": 1864257.0, "step": 915 }, { "entropy": 7.437055015563965, "epoch": 0.053848405033655254, "grad_norm": 1.0234375, "learning_rate": 0.00045950000000000006, "loss": 7.1707, "mean_token_accuracy": 0.09187378212809563, "num_tokens": 1873353.0, "step": 920 }, { "entropy": 7.3977635383605955, "epoch": 0.05414105940883816, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 7.1196, "mean_token_accuracy": 0.09563436955213547, "num_tokens": 1884465.0, "step": 925 }, { "entropy": 7.365432357788086, "epoch": 0.05443371378402107, "grad_norm": 0.96875, "learning_rate": 0.0004645, "loss": 7.1528, "mean_token_accuracy": 0.09838449805974961, "num_tokens": 1894872.0, "step": 930 }, { "entropy": 7.34838981628418, "epoch": 0.05472636815920398, "grad_norm": 1.0390625, "learning_rate": 0.000467, "loss": 7.0706, "mean_token_accuracy": 0.10180790275335312, "num_tokens": 1905440.0, "step": 935 }, { "entropy": 7.341986465454101, "epoch": 0.05501902253438689, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 7.1291, "mean_token_accuracy": 0.09645774215459824, "num_tokens": 1916861.0, "step": 940 }, { "entropy": 7.406238269805908, "epoch": 0.0553116769095698, "grad_norm": 1.1015625, "learning_rate": 0.000472, "loss": 7.0654, "mean_token_accuracy": 0.10491539835929871, "num_tokens": 1927144.0, "step": 945 }, { "entropy": 7.35713381767273, "epoch": 0.05560433128475271, "grad_norm": 0.88671875, "learning_rate": 0.0004745, "loss": 7.138, "mean_token_accuracy": 0.0931523747742176, "num_tokens": 1937174.0, "step": 950 }, { "entropy": 7.403324699401855, "epoch": 0.055896985659935616, "grad_norm": 0.98046875, "learning_rate": 0.000477, "loss": 7.0506, "mean_token_accuracy": 0.11088272705674171, "num_tokens": 1947510.0, "step": 955 }, { "entropy": 7.305504369735718, "epoch": 0.056189640035118525, "grad_norm": 1.015625, "learning_rate": 0.0004795, "loss": 7.1238, "mean_token_accuracy": 0.09536927789449692, "num_tokens": 1957894.0, "step": 960 }, { "entropy": 7.445551156997681, "epoch": 0.056482294410301434, "grad_norm": 0.95703125, "learning_rate": 0.000482, "loss": 7.1862, "mean_token_accuracy": 0.09522910863161087, "num_tokens": 1968670.0, "step": 965 }, { "entropy": 7.351961517333985, "epoch": 0.05677494878548434, "grad_norm": 0.8828125, "learning_rate": 0.0004845, "loss": 7.1451, "mean_token_accuracy": 0.09402441680431366, "num_tokens": 1979678.0, "step": 970 }, { "entropy": 7.329155683517456, "epoch": 0.05706760316066725, "grad_norm": 0.9296875, "learning_rate": 0.000487, "loss": 7.0501, "mean_token_accuracy": 0.10141415372490883, "num_tokens": 1990161.0, "step": 975 }, { "entropy": 7.408869028091431, "epoch": 0.05736025753585016, "grad_norm": 0.98046875, "learning_rate": 0.0004895, "loss": 7.1421, "mean_token_accuracy": 0.09915417581796646, "num_tokens": 2000298.0, "step": 980 }, { "entropy": 7.386150693893432, "epoch": 0.05765291191103307, "grad_norm": 1.109375, "learning_rate": 0.000492, "loss": 7.101, "mean_token_accuracy": 0.0987740397453308, "num_tokens": 2009946.0, "step": 985 }, { "entropy": 7.297941255569458, "epoch": 0.05794556628621598, "grad_norm": 1.0859375, "learning_rate": 0.0004945, "loss": 7.064, "mean_token_accuracy": 0.09957554042339326, "num_tokens": 2019192.0, "step": 990 }, { "entropy": 7.343301391601562, "epoch": 0.05823822066139889, "grad_norm": 0.9140625, "learning_rate": 0.000497, "loss": 7.1112, "mean_token_accuracy": 0.09475254267454147, "num_tokens": 2029066.0, "step": 995 }, { "entropy": 7.356789922714233, "epoch": 0.058530875036581796, "grad_norm": 0.94921875, "learning_rate": 0.0004995, "loss": 7.1051, "mean_token_accuracy": 0.09616579562425613, "num_tokens": 2040610.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 447947671633920.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }