{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.17559262510974538, "eval_steps": 500, "global_step": 3000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742569732666016, "epoch": 0.000292654375182909, "grad_norm": 4.8125, "learning_rate": 2e-06, "loss": 10.776, "mean_token_accuracy": 0.00037909409729763865, "num_tokens": 10517.0, "step": 5 }, { "entropy": 10.742593669891358, "epoch": 0.000585308750365818, "grad_norm": 4.78125, "learning_rate": 4.5e-06, "loss": 10.7562, "mean_token_accuracy": 0.0, "num_tokens": 20499.0, "step": 10 }, { "entropy": 10.74259843826294, "epoch": 0.000877963125548727, "grad_norm": 5.53125, "learning_rate": 7e-06, "loss": 10.7254, "mean_token_accuracy": 0.00031158956699073315, "num_tokens": 30396.0, "step": 15 }, { "entropy": 10.742587089538574, "epoch": 0.001170617500731636, "grad_norm": 5.21875, "learning_rate": 9.5e-06, "loss": 10.6813, "mean_token_accuracy": 0.0014116012142039835, "num_tokens": 40862.0, "step": 20 }, { "entropy": 10.742495727539062, "epoch": 0.0014632718759145448, "grad_norm": 4.46875, "learning_rate": 1.2e-05, "loss": 10.573, "mean_token_accuracy": 0.015958905406296253, "num_tokens": 50482.0, "step": 25 }, { "entropy": 10.74194974899292, "epoch": 0.001755926251097454, "grad_norm": 3.9375, "learning_rate": 1.4500000000000002e-05, "loss": 10.4277, "mean_token_accuracy": 0.046428434550762177, "num_tokens": 59557.0, "step": 30 }, { "entropy": 10.739844131469727, "epoch": 0.002048580626280363, "grad_norm": 3.4375, "learning_rate": 1.7000000000000003e-05, "loss": 10.3155, "mean_token_accuracy": 0.04745985008776188, "num_tokens": 69864.0, "step": 35 }, { "entropy": 10.732469940185547, "epoch": 0.002341235001463272, "grad_norm": 2.484375, "learning_rate": 1.95e-05, "loss": 10.1801, "mean_token_accuracy": 0.056155404448509215, "num_tokens": 80632.0, "step": 40 }, { "entropy": 10.719615936279297, "epoch": 0.0026338893766461808, "grad_norm": 2.21875, "learning_rate": 2.2e-05, "loss": 10.0892, "mean_token_accuracy": 0.049328677356243134, "num_tokens": 90889.0, "step": 45 }, { "entropy": 10.709369468688966, "epoch": 0.0029265437518290896, "grad_norm": 2.109375, "learning_rate": 2.4500000000000003e-05, "loss": 9.9839, "mean_token_accuracy": 0.05372027605772019, "num_tokens": 101136.0, "step": 50 }, { "entropy": 10.702022743225097, "epoch": 0.003219198127011999, "grad_norm": 2.046875, "learning_rate": 2.7e-05, "loss": 9.9529, "mean_token_accuracy": 0.05223828963935375, "num_tokens": 111743.0, "step": 55 }, { "entropy": 10.692447948455811, "epoch": 0.003511852502194908, "grad_norm": 1.8203125, "learning_rate": 2.95e-05, "loss": 9.9212, "mean_token_accuracy": 0.050166602805256845, "num_tokens": 121968.0, "step": 60 }, { "entropy": 10.686018753051759, "epoch": 0.0038045068773778167, "grad_norm": 1.75, "learning_rate": 3.2e-05, "loss": 9.8286, "mean_token_accuracy": 0.055526862666010854, "num_tokens": 131917.0, "step": 65 }, { "entropy": 10.676072120666504, "epoch": 0.004097161252560726, "grad_norm": 1.8359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7736, "mean_token_accuracy": 0.05640910603106022, "num_tokens": 141562.0, "step": 70 }, { "entropy": 10.663375949859619, "epoch": 0.004389815627743635, "grad_norm": 1.7109375, "learning_rate": 3.7e-05, "loss": 9.755, "mean_token_accuracy": 0.05814168080687523, "num_tokens": 152163.0, "step": 75 }, { "entropy": 10.652446174621582, "epoch": 0.004682470002926544, "grad_norm": 1.9609375, "learning_rate": 3.95e-05, "loss": 9.7531, "mean_token_accuracy": 0.05046718679368496, "num_tokens": 162684.0, "step": 80 }, { "entropy": 10.65147132873535, "epoch": 0.004975124378109453, "grad_norm": 1.8515625, "learning_rate": 4.2000000000000004e-05, "loss": 9.6277, "mean_token_accuracy": 0.055151918530464174, "num_tokens": 173234.0, "step": 85 }, { "entropy": 10.643102264404297, "epoch": 0.0052677787532923615, "grad_norm": 1.6953125, "learning_rate": 4.45e-05, "loss": 9.6174, "mean_token_accuracy": 0.05056312084197998, "num_tokens": 183645.0, "step": 90 }, { "entropy": 10.629851245880127, "epoch": 0.00556043312847527, "grad_norm": 1.671875, "learning_rate": 4.7000000000000004e-05, "loss": 9.5472, "mean_token_accuracy": 0.05371568165719509, "num_tokens": 193874.0, "step": 95 }, { "entropy": 10.60717601776123, "epoch": 0.005853087503658179, "grad_norm": 1.625, "learning_rate": 4.9500000000000004e-05, "loss": 9.4433, "mean_token_accuracy": 0.05704141147434712, "num_tokens": 203965.0, "step": 100 }, { "entropy": 10.582340145111084, "epoch": 0.006145741878841089, "grad_norm": 1.5625, "learning_rate": 5.2e-05, "loss": 9.3847, "mean_token_accuracy": 0.05947887413203716, "num_tokens": 214334.0, "step": 105 }, { "entropy": 10.55553674697876, "epoch": 0.006438396254023998, "grad_norm": 1.59375, "learning_rate": 5.45e-05, "loss": 9.3073, "mean_token_accuracy": 0.06609507203102112, "num_tokens": 225435.0, "step": 110 }, { "entropy": 10.51070203781128, "epoch": 0.006731050629206907, "grad_norm": 1.6328125, "learning_rate": 5.7e-05, "loss": 9.1764, "mean_token_accuracy": 0.06483110673725605, "num_tokens": 235107.0, "step": 115 }, { "entropy": 10.439863014221192, "epoch": 0.007023705004389816, "grad_norm": 1.5, "learning_rate": 5.9499999999999996e-05, "loss": 9.1014, "mean_token_accuracy": 0.06455096490681171, "num_tokens": 245660.0, "step": 120 }, { "entropy": 10.376344776153564, "epoch": 0.0073163593795727245, "grad_norm": 1.5625, "learning_rate": 6.2e-05, "loss": 9.0183, "mean_token_accuracy": 0.06346280165016652, "num_tokens": 256077.0, "step": 125 }, { "entropy": 10.332421588897706, "epoch": 0.007609013754755633, "grad_norm": 1.3359375, "learning_rate": 6.450000000000001e-05, "loss": 8.9453, "mean_token_accuracy": 0.0634394098073244, "num_tokens": 265702.0, "step": 130 }, { "entropy": 10.269437503814697, "epoch": 0.007901668129938543, "grad_norm": 1.5625, "learning_rate": 6.7e-05, "loss": 8.88, "mean_token_accuracy": 0.06306366845965386, "num_tokens": 276739.0, "step": 135 }, { "entropy": 10.201168727874755, "epoch": 0.008194322505121452, "grad_norm": 1.2734375, "learning_rate": 6.950000000000001e-05, "loss": 8.7255, "mean_token_accuracy": 0.06702562645077706, "num_tokens": 285370.0, "step": 140 }, { "entropy": 10.072903537750244, "epoch": 0.008486976880304361, "grad_norm": 1.1328125, "learning_rate": 7.2e-05, "loss": 8.6633, "mean_token_accuracy": 0.06559402719140053, "num_tokens": 295080.0, "step": 145 }, { "entropy": 9.988585090637207, "epoch": 0.00877963125548727, "grad_norm": 1.234375, "learning_rate": 7.45e-05, "loss": 8.5425, "mean_token_accuracy": 0.06815728284418583, "num_tokens": 304509.0, "step": 150 }, { "entropy": 9.857632827758788, "epoch": 0.009072285630670179, "grad_norm": 1.1171875, "learning_rate": 7.7e-05, "loss": 8.4977, "mean_token_accuracy": 0.06578324660658837, "num_tokens": 315214.0, "step": 155 }, { "entropy": 9.758829021453858, "epoch": 0.009364940005853088, "grad_norm": 1.0234375, "learning_rate": 7.950000000000001e-05, "loss": 8.4204, "mean_token_accuracy": 0.06578456349670887, "num_tokens": 325865.0, "step": 160 }, { "entropy": 9.577184200286865, "epoch": 0.009657594381035996, "grad_norm": 1.015625, "learning_rate": 8.2e-05, "loss": 8.3182, "mean_token_accuracy": 0.06833198070526122, "num_tokens": 335490.0, "step": 165 }, { "entropy": 9.448071479797363, "epoch": 0.009950248756218905, "grad_norm": 0.8828125, "learning_rate": 8.450000000000001e-05, "loss": 8.3465, "mean_token_accuracy": 0.0624022550880909, "num_tokens": 345507.0, "step": 170 }, { "entropy": 9.283161449432374, "epoch": 0.010242903131401814, "grad_norm": 0.83984375, "learning_rate": 8.7e-05, "loss": 8.2345, "mean_token_accuracy": 0.06619864143431187, "num_tokens": 355129.0, "step": 175 }, { "entropy": 9.061387634277343, "epoch": 0.010535557506584723, "grad_norm": 0.859375, "learning_rate": 8.95e-05, "loss": 8.1198, "mean_token_accuracy": 0.0754898265004158, "num_tokens": 364700.0, "step": 180 }, { "entropy": 8.924063873291015, "epoch": 0.010828211881767632, "grad_norm": 0.74609375, "learning_rate": 9.2e-05, "loss": 8.1966, "mean_token_accuracy": 0.07078267820179462, "num_tokens": 374920.0, "step": 185 }, { "entropy": 8.817254543304443, "epoch": 0.01112086625695054, "grad_norm": 0.83984375, "learning_rate": 9.45e-05, "loss": 7.9958, "mean_token_accuracy": 0.0730692483484745, "num_tokens": 384517.0, "step": 190 }, { "entropy": 8.686346626281738, "epoch": 0.01141352063213345, "grad_norm": 0.75390625, "learning_rate": 9.7e-05, "loss": 8.1191, "mean_token_accuracy": 0.07759304121136665, "num_tokens": 394118.0, "step": 195 }, { "entropy": 8.639398574829102, "epoch": 0.011706175007316359, "grad_norm": 0.8359375, "learning_rate": 9.95e-05, "loss": 8.1035, "mean_token_accuracy": 0.07444557547569275, "num_tokens": 404135.0, "step": 200 }, { "entropy": 8.65887680053711, "epoch": 0.01199882938249927, "grad_norm": 0.75, "learning_rate": 0.000102, "loss": 8.0896, "mean_token_accuracy": 0.07085032351315021, "num_tokens": 414198.0, "step": 205 }, { "entropy": 8.562304019927979, "epoch": 0.012291483757682178, "grad_norm": 0.62109375, "learning_rate": 0.00010449999999999999, "loss": 8.0473, "mean_token_accuracy": 0.07471234947443009, "num_tokens": 424747.0, "step": 210 }, { "entropy": 8.543915939331054, "epoch": 0.012584138132865087, "grad_norm": 0.74609375, "learning_rate": 0.000107, "loss": 8.0208, "mean_token_accuracy": 0.07326471023261547, "num_tokens": 435597.0, "step": 215 }, { "entropy": 8.513623428344726, "epoch": 0.012876792508047996, "grad_norm": 0.77734375, "learning_rate": 0.0001095, "loss": 8.064, "mean_token_accuracy": 0.07332713790237903, "num_tokens": 445262.0, "step": 220 }, { "entropy": 8.550195503234864, "epoch": 0.013169446883230905, "grad_norm": 1.1640625, "learning_rate": 0.000112, "loss": 8.094, "mean_token_accuracy": 0.0686261247843504, "num_tokens": 456455.0, "step": 225 }, { "entropy": 8.483574199676514, "epoch": 0.013462101258413814, "grad_norm": 0.91015625, "learning_rate": 0.0001145, "loss": 7.9287, "mean_token_accuracy": 0.07206557914614678, "num_tokens": 465696.0, "step": 230 }, { "entropy": 8.426221942901611, "epoch": 0.013754755633596722, "grad_norm": 0.9765625, "learning_rate": 0.00011700000000000001, "loss": 7.9791, "mean_token_accuracy": 0.07656441517174244, "num_tokens": 475171.0, "step": 235 }, { "entropy": 8.437851619720458, "epoch": 0.014047410008779631, "grad_norm": 0.8046875, "learning_rate": 0.00011949999999999999, "loss": 7.9953, "mean_token_accuracy": 0.07377254441380501, "num_tokens": 484852.0, "step": 240 }, { "entropy": 8.439754581451416, "epoch": 0.01434006438396254, "grad_norm": 0.765625, "learning_rate": 0.000122, "loss": 8.0016, "mean_token_accuracy": 0.07172177135944366, "num_tokens": 494539.0, "step": 245 }, { "entropy": 8.422525405883789, "epoch": 0.014632718759145449, "grad_norm": 0.73046875, "learning_rate": 0.0001245, "loss": 7.9657, "mean_token_accuracy": 0.06861439161002636, "num_tokens": 504406.0, "step": 250 }, { "entropy": 8.499318695068359, "epoch": 0.014925373134328358, "grad_norm": 0.8046875, "learning_rate": 0.000127, "loss": 7.9752, "mean_token_accuracy": 0.07367737665772438, "num_tokens": 514905.0, "step": 255 }, { "entropy": 8.41889181137085, "epoch": 0.015218027509511267, "grad_norm": 0.796875, "learning_rate": 0.0001295, "loss": 7.936, "mean_token_accuracy": 0.08054133653640747, "num_tokens": 524904.0, "step": 260 }, { "entropy": 8.374094104766845, "epoch": 0.015510681884694176, "grad_norm": 1.609375, "learning_rate": 0.000132, "loss": 7.9791, "mean_token_accuracy": 0.07328154221177101, "num_tokens": 534423.0, "step": 265 }, { "entropy": 8.391270446777344, "epoch": 0.015803336259877086, "grad_norm": 0.765625, "learning_rate": 0.00013450000000000002, "loss": 8.0123, "mean_token_accuracy": 0.06913212612271309, "num_tokens": 544468.0, "step": 270 }, { "entropy": 8.460853576660156, "epoch": 0.016095990635059995, "grad_norm": 0.87109375, "learning_rate": 0.00013700000000000002, "loss": 7.9631, "mean_token_accuracy": 0.07310855686664582, "num_tokens": 555873.0, "step": 275 }, { "entropy": 8.311201095581055, "epoch": 0.016388645010242904, "grad_norm": 0.69921875, "learning_rate": 0.0001395, "loss": 7.9352, "mean_token_accuracy": 0.07407794632017613, "num_tokens": 566228.0, "step": 280 }, { "entropy": 8.375296783447265, "epoch": 0.016681299385425813, "grad_norm": 0.8046875, "learning_rate": 0.00014199999999999998, "loss": 7.8366, "mean_token_accuracy": 0.07612851671874524, "num_tokens": 576087.0, "step": 285 }, { "entropy": 8.290613842010497, "epoch": 0.016973953760608722, "grad_norm": 1.1484375, "learning_rate": 0.0001445, "loss": 7.9593, "mean_token_accuracy": 0.07361815236508847, "num_tokens": 586768.0, "step": 290 }, { "entropy": 8.414975547790528, "epoch": 0.01726660813579163, "grad_norm": 0.9296875, "learning_rate": 0.000147, "loss": 7.9496, "mean_token_accuracy": 0.07182935290038586, "num_tokens": 597352.0, "step": 295 }, { "entropy": 8.286548233032226, "epoch": 0.01755926251097454, "grad_norm": 0.9609375, "learning_rate": 0.0001495, "loss": 7.8397, "mean_token_accuracy": 0.07391503937542439, "num_tokens": 607460.0, "step": 300 }, { "entropy": 8.280863857269287, "epoch": 0.01785191688615745, "grad_norm": 0.78125, "learning_rate": 0.000152, "loss": 7.8721, "mean_token_accuracy": 0.07399217337369919, "num_tokens": 618882.0, "step": 305 }, { "entropy": 8.382979774475098, "epoch": 0.018144571261340357, "grad_norm": 1.015625, "learning_rate": 0.00015450000000000001, "loss": 7.9746, "mean_token_accuracy": 0.06754698418080807, "num_tokens": 628378.0, "step": 310 }, { "entropy": 8.238453578948974, "epoch": 0.018437225636523266, "grad_norm": 1.140625, "learning_rate": 0.000157, "loss": 7.913, "mean_token_accuracy": 0.07458860278129578, "num_tokens": 637339.0, "step": 315 }, { "entropy": 8.266683578491211, "epoch": 0.018729880011706175, "grad_norm": 0.6953125, "learning_rate": 0.0001595, "loss": 7.9179, "mean_token_accuracy": 0.07612942159175873, "num_tokens": 648190.0, "step": 320 }, { "entropy": 8.325155258178711, "epoch": 0.019022534386889084, "grad_norm": 0.90234375, "learning_rate": 0.000162, "loss": 7.8386, "mean_token_accuracy": 0.07890116423368454, "num_tokens": 658704.0, "step": 325 }, { "entropy": 8.223814582824707, "epoch": 0.019315188762071993, "grad_norm": 0.8125, "learning_rate": 0.00016450000000000001, "loss": 7.835, "mean_token_accuracy": 0.0768560890108347, "num_tokens": 668888.0, "step": 330 }, { "entropy": 8.254367637634278, "epoch": 0.0196078431372549, "grad_norm": 0.79296875, "learning_rate": 0.00016700000000000002, "loss": 7.8646, "mean_token_accuracy": 0.07014993466436863, "num_tokens": 679294.0, "step": 335 }, { "entropy": 8.180438041687012, "epoch": 0.01990049751243781, "grad_norm": 0.9375, "learning_rate": 0.00016950000000000003, "loss": 7.8385, "mean_token_accuracy": 0.07648964524269104, "num_tokens": 689662.0, "step": 340 }, { "entropy": 8.204143142700195, "epoch": 0.02019315188762072, "grad_norm": 0.8671875, "learning_rate": 0.00017199999999999998, "loss": 7.8542, "mean_token_accuracy": 0.07869461253285408, "num_tokens": 700356.0, "step": 345 }, { "entropy": 8.173739433288574, "epoch": 0.02048580626280363, "grad_norm": 0.91015625, "learning_rate": 0.00017449999999999999, "loss": 7.7786, "mean_token_accuracy": 0.07795644551515579, "num_tokens": 710831.0, "step": 350 }, { "entropy": 8.16906099319458, "epoch": 0.020778460637986537, "grad_norm": 0.8671875, "learning_rate": 0.000177, "loss": 7.7646, "mean_token_accuracy": 0.07683240249752998, "num_tokens": 720445.0, "step": 355 }, { "entropy": 8.170342254638673, "epoch": 0.021071115013169446, "grad_norm": 1.0, "learning_rate": 0.0001795, "loss": 7.7871, "mean_token_accuracy": 0.08130665272474288, "num_tokens": 730355.0, "step": 360 }, { "entropy": 8.122212743759155, "epoch": 0.021363769388352355, "grad_norm": 0.80859375, "learning_rate": 0.000182, "loss": 7.7918, "mean_token_accuracy": 0.08222091645002365, "num_tokens": 740397.0, "step": 365 }, { "entropy": 8.200673866271973, "epoch": 0.021656423763535264, "grad_norm": 0.87109375, "learning_rate": 0.0001845, "loss": 7.7934, "mean_token_accuracy": 0.0756984956562519, "num_tokens": 750277.0, "step": 370 }, { "entropy": 8.109900617599488, "epoch": 0.021949078138718173, "grad_norm": 0.796875, "learning_rate": 0.000187, "loss": 7.7735, "mean_token_accuracy": 0.07954552099108696, "num_tokens": 759764.0, "step": 375 }, { "entropy": 8.258574295043946, "epoch": 0.02224173251390108, "grad_norm": 0.85546875, "learning_rate": 0.0001895, "loss": 7.8364, "mean_token_accuracy": 0.0779568761587143, "num_tokens": 769709.0, "step": 380 }, { "entropy": 8.177908420562744, "epoch": 0.02253438688908399, "grad_norm": 0.75390625, "learning_rate": 0.000192, "loss": 7.7721, "mean_token_accuracy": 0.0785105787217617, "num_tokens": 780267.0, "step": 385 }, { "entropy": 8.026059818267822, "epoch": 0.0228270412642669, "grad_norm": 0.83203125, "learning_rate": 0.0001945, "loss": 7.7254, "mean_token_accuracy": 0.0828751116991043, "num_tokens": 790184.0, "step": 390 }, { "entropy": 8.152198600769044, "epoch": 0.023119695639449808, "grad_norm": 0.8828125, "learning_rate": 0.00019700000000000002, "loss": 7.8261, "mean_token_accuracy": 0.07748916000127792, "num_tokens": 800645.0, "step": 395 }, { "entropy": 8.190797138214112, "epoch": 0.023412350014632717, "grad_norm": 0.85546875, "learning_rate": 0.00019950000000000002, "loss": 7.7524, "mean_token_accuracy": 0.08283478766679764, "num_tokens": 810873.0, "step": 400 }, { "entropy": 8.11506757736206, "epoch": 0.02370500438981563, "grad_norm": 0.82421875, "learning_rate": 0.000202, "loss": 7.7456, "mean_token_accuracy": 0.07929125241935253, "num_tokens": 821661.0, "step": 405 }, { "entropy": 8.140167808532714, "epoch": 0.02399765876499854, "grad_norm": 1.015625, "learning_rate": 0.00020449999999999998, "loss": 7.7449, "mean_token_accuracy": 0.07854388505220414, "num_tokens": 831818.0, "step": 410 }, { "entropy": 8.042124271392822, "epoch": 0.024290313140181447, "grad_norm": 0.78515625, "learning_rate": 0.000207, "loss": 7.7535, "mean_token_accuracy": 0.08163447454571723, "num_tokens": 843030.0, "step": 415 }, { "entropy": 8.099297571182252, "epoch": 0.024582967515364356, "grad_norm": 0.9140625, "learning_rate": 0.0002095, "loss": 7.7175, "mean_token_accuracy": 0.08631875067949295, "num_tokens": 852477.0, "step": 420 }, { "entropy": 8.106180906295776, "epoch": 0.024875621890547265, "grad_norm": 0.921875, "learning_rate": 0.000212, "loss": 7.7318, "mean_token_accuracy": 0.08200445771217346, "num_tokens": 863018.0, "step": 425 }, { "entropy": 8.047952270507812, "epoch": 0.025168276265730174, "grad_norm": 0.9375, "learning_rate": 0.0002145, "loss": 7.6688, "mean_token_accuracy": 0.082207240909338, "num_tokens": 872732.0, "step": 430 }, { "entropy": 8.055245399475098, "epoch": 0.025460930640913083, "grad_norm": 0.8671875, "learning_rate": 0.00021700000000000002, "loss": 7.7356, "mean_token_accuracy": 0.0770014464855194, "num_tokens": 883189.0, "step": 435 }, { "entropy": 8.050556993484497, "epoch": 0.02575358501609599, "grad_norm": 0.84375, "learning_rate": 0.0002195, "loss": 7.7489, "mean_token_accuracy": 0.0801065780222416, "num_tokens": 893874.0, "step": 440 }, { "entropy": 8.03118143081665, "epoch": 0.0260462393912789, "grad_norm": 0.92578125, "learning_rate": 0.000222, "loss": 7.6741, "mean_token_accuracy": 0.08284056335687637, "num_tokens": 904424.0, "step": 445 }, { "entropy": 8.11718683242798, "epoch": 0.02633889376646181, "grad_norm": 0.96875, "learning_rate": 0.0002245, "loss": 7.7431, "mean_token_accuracy": 0.07791092544794083, "num_tokens": 914601.0, "step": 450 }, { "entropy": 8.059693479537964, "epoch": 0.026631548141644718, "grad_norm": 0.91796875, "learning_rate": 0.00022700000000000002, "loss": 7.7462, "mean_token_accuracy": 0.07850845158100128, "num_tokens": 925162.0, "step": 455 }, { "entropy": 8.002055263519287, "epoch": 0.026924202516827627, "grad_norm": 1.109375, "learning_rate": 0.00022950000000000002, "loss": 7.6594, "mean_token_accuracy": 0.08002852946519852, "num_tokens": 935182.0, "step": 460 }, { "entropy": 8.099039840698243, "epoch": 0.027216856892010536, "grad_norm": 0.953125, "learning_rate": 0.00023200000000000003, "loss": 7.6897, "mean_token_accuracy": 0.08213006183505059, "num_tokens": 944812.0, "step": 465 }, { "entropy": 7.961377811431885, "epoch": 0.027509511267193445, "grad_norm": 0.9921875, "learning_rate": 0.00023449999999999998, "loss": 7.6964, "mean_token_accuracy": 0.07877071015536785, "num_tokens": 954532.0, "step": 470 }, { "entropy": 8.022741889953613, "epoch": 0.027802165642376354, "grad_norm": 1.0703125, "learning_rate": 0.000237, "loss": 7.639, "mean_token_accuracy": 0.08602378293871879, "num_tokens": 963611.0, "step": 475 }, { "entropy": 8.00587968826294, "epoch": 0.028094820017559263, "grad_norm": 0.92578125, "learning_rate": 0.0002395, "loss": 7.688, "mean_token_accuracy": 0.08180306293070316, "num_tokens": 973177.0, "step": 480 }, { "entropy": 8.030350875854491, "epoch": 0.02838747439274217, "grad_norm": 0.95703125, "learning_rate": 0.000242, "loss": 7.6898, "mean_token_accuracy": 0.0791365496814251, "num_tokens": 983623.0, "step": 485 }, { "entropy": 8.03669090270996, "epoch": 0.02868012876792508, "grad_norm": 0.82421875, "learning_rate": 0.0002445, "loss": 7.7472, "mean_token_accuracy": 0.08025188818573951, "num_tokens": 993810.0, "step": 490 }, { "entropy": 8.088376188278199, "epoch": 0.02897278314310799, "grad_norm": 0.8671875, "learning_rate": 0.000247, "loss": 7.6529, "mean_token_accuracy": 0.0789113201200962, "num_tokens": 1004155.0, "step": 495 }, { "entropy": 7.990477657318115, "epoch": 0.029265437518290898, "grad_norm": 0.8515625, "learning_rate": 0.0002495, "loss": 7.612, "mean_token_accuracy": 0.08940722271800042, "num_tokens": 1014896.0, "step": 500 }, { "entropy": 7.972944545745849, "epoch": 0.029558091893473807, "grad_norm": 1.046875, "learning_rate": 0.000252, "loss": 7.5516, "mean_token_accuracy": 0.0878017283976078, "num_tokens": 1024991.0, "step": 505 }, { "entropy": 7.899525737762451, "epoch": 0.029850746268656716, "grad_norm": 1.1484375, "learning_rate": 0.0002545, "loss": 7.5796, "mean_token_accuracy": 0.08802613019943237, "num_tokens": 1036697.0, "step": 510 }, { "entropy": 8.065279579162597, "epoch": 0.030143400643839625, "grad_norm": 1.125, "learning_rate": 0.000257, "loss": 7.6774, "mean_token_accuracy": 0.07723400816321373, "num_tokens": 1046245.0, "step": 515 }, { "entropy": 7.788718843460083, "epoch": 0.030436055019022534, "grad_norm": 1.0390625, "learning_rate": 0.0002595, "loss": 7.5633, "mean_token_accuracy": 0.08955003842711448, "num_tokens": 1056232.0, "step": 520 }, { "entropy": 7.821068525314331, "epoch": 0.030728709394205442, "grad_norm": 1.0546875, "learning_rate": 0.000262, "loss": 7.4477, "mean_token_accuracy": 0.09515074491500855, "num_tokens": 1065536.0, "step": 525 }, { "entropy": 8.05577802658081, "epoch": 0.03102136376938835, "grad_norm": 1.0859375, "learning_rate": 0.00026450000000000003, "loss": 7.5794, "mean_token_accuracy": 0.08964744806289673, "num_tokens": 1075135.0, "step": 530 }, { "entropy": 7.835528612136841, "epoch": 0.031314018144571264, "grad_norm": 0.96875, "learning_rate": 0.00026700000000000004, "loss": 7.5717, "mean_token_accuracy": 0.0826539345085621, "num_tokens": 1085498.0, "step": 535 }, { "entropy": 7.983124303817749, "epoch": 0.03160667251975417, "grad_norm": 0.85546875, "learning_rate": 0.00026950000000000005, "loss": 7.6005, "mean_token_accuracy": 0.08875111043453217, "num_tokens": 1095559.0, "step": 540 }, { "entropy": 7.931251287460327, "epoch": 0.03189932689493708, "grad_norm": 0.953125, "learning_rate": 0.00027200000000000005, "loss": 7.5456, "mean_token_accuracy": 0.08640314042568206, "num_tokens": 1105701.0, "step": 545 }, { "entropy": 7.889260959625244, "epoch": 0.03219198127011999, "grad_norm": 0.93359375, "learning_rate": 0.0002745, "loss": 7.5431, "mean_token_accuracy": 0.08784606605768204, "num_tokens": 1116455.0, "step": 550 }, { "entropy": 7.8568816661834715, "epoch": 0.0324846356453029, "grad_norm": 0.9140625, "learning_rate": 0.000277, "loss": 7.5697, "mean_token_accuracy": 0.08820039629936219, "num_tokens": 1126596.0, "step": 555 }, { "entropy": 7.986862754821777, "epoch": 0.03277729002048581, "grad_norm": 1.0390625, "learning_rate": 0.0002795, "loss": 7.5865, "mean_token_accuracy": 0.08685005903244018, "num_tokens": 1136969.0, "step": 560 }, { "entropy": 7.84932541847229, "epoch": 0.03306994439566872, "grad_norm": 1.0703125, "learning_rate": 0.00028199999999999997, "loss": 7.5699, "mean_token_accuracy": 0.08707550391554833, "num_tokens": 1147175.0, "step": 565 }, { "entropy": 7.847287702560425, "epoch": 0.033362598770851626, "grad_norm": 1.078125, "learning_rate": 0.0002845, "loss": 7.527, "mean_token_accuracy": 0.09069008976221085, "num_tokens": 1156539.0, "step": 570 }, { "entropy": 7.910270690917969, "epoch": 0.033655253146034535, "grad_norm": 0.921875, "learning_rate": 0.000287, "loss": 7.5107, "mean_token_accuracy": 0.0893574945628643, "num_tokens": 1166630.0, "step": 575 }, { "entropy": 7.857235383987427, "epoch": 0.033947907521217444, "grad_norm": 0.9296875, "learning_rate": 0.0002895, "loss": 7.5453, "mean_token_accuracy": 0.08516263216733932, "num_tokens": 1176279.0, "step": 580 }, { "entropy": 7.920040893554687, "epoch": 0.03424056189640035, "grad_norm": 0.984375, "learning_rate": 0.000292, "loss": 7.543, "mean_token_accuracy": 0.08200450427830219, "num_tokens": 1186321.0, "step": 585 }, { "entropy": 7.912441968917847, "epoch": 0.03453321627158326, "grad_norm": 0.8984375, "learning_rate": 0.0002945, "loss": 7.5193, "mean_token_accuracy": 0.08341860473155975, "num_tokens": 1198287.0, "step": 590 }, { "entropy": 7.7401360988616945, "epoch": 0.03482587064676617, "grad_norm": 1.125, "learning_rate": 0.000297, "loss": 7.5164, "mean_token_accuracy": 0.08626452758908272, "num_tokens": 1208618.0, "step": 595 }, { "entropy": 7.83452959060669, "epoch": 0.03511852502194908, "grad_norm": 1.0390625, "learning_rate": 0.0002995, "loss": 7.5024, "mean_token_accuracy": 0.08562399223446845, "num_tokens": 1217932.0, "step": 600 }, { "entropy": 8.012685871124267, "epoch": 0.03541117939713199, "grad_norm": 0.98046875, "learning_rate": 0.000302, "loss": 7.5414, "mean_token_accuracy": 0.08212736770510673, "num_tokens": 1227965.0, "step": 605 }, { "entropy": 7.799877643585205, "epoch": 0.0357038337723149, "grad_norm": 0.9765625, "learning_rate": 0.0003045, "loss": 7.485, "mean_token_accuracy": 0.08530130311846733, "num_tokens": 1237879.0, "step": 610 }, { "entropy": 7.793827056884766, "epoch": 0.035996488147497806, "grad_norm": 0.84375, "learning_rate": 0.000307, "loss": 7.4804, "mean_token_accuracy": 0.0855767272412777, "num_tokens": 1248547.0, "step": 615 }, { "entropy": 7.876594161987304, "epoch": 0.036289142522680715, "grad_norm": 0.90234375, "learning_rate": 0.0003095, "loss": 7.5034, "mean_token_accuracy": 0.08643778935074806, "num_tokens": 1259462.0, "step": 620 }, { "entropy": 7.922547101974487, "epoch": 0.036581796897863623, "grad_norm": 1.0078125, "learning_rate": 0.000312, "loss": 7.5425, "mean_token_accuracy": 0.0930032640695572, "num_tokens": 1270668.0, "step": 625 }, { "entropy": 7.821293497085572, "epoch": 0.03687445127304653, "grad_norm": 1.046875, "learning_rate": 0.0003145, "loss": 7.506, "mean_token_accuracy": 0.08481546565890312, "num_tokens": 1280459.0, "step": 630 }, { "entropy": 7.859448432922363, "epoch": 0.03716710564822944, "grad_norm": 0.90234375, "learning_rate": 0.000317, "loss": 7.4332, "mean_token_accuracy": 0.0836933895945549, "num_tokens": 1291114.0, "step": 635 }, { "entropy": 7.879277753829956, "epoch": 0.03745976002341235, "grad_norm": 0.96484375, "learning_rate": 0.0003195, "loss": 7.5801, "mean_token_accuracy": 0.07807724177837372, "num_tokens": 1301442.0, "step": 640 }, { "entropy": 7.79024305343628, "epoch": 0.03775241439859526, "grad_norm": 1.1484375, "learning_rate": 0.000322, "loss": 7.3892, "mean_token_accuracy": 0.09089659005403519, "num_tokens": 1311315.0, "step": 645 }, { "entropy": 7.697639131546021, "epoch": 0.03804506877377817, "grad_norm": 1.1015625, "learning_rate": 0.00032450000000000003, "loss": 7.4088, "mean_token_accuracy": 0.09008980989456176, "num_tokens": 1320962.0, "step": 650 }, { "entropy": 7.803319597244263, "epoch": 0.03833772314896108, "grad_norm": 1.046875, "learning_rate": 0.00032700000000000003, "loss": 7.4448, "mean_token_accuracy": 0.08984620422124863, "num_tokens": 1331006.0, "step": 655 }, { "entropy": 7.771277570724488, "epoch": 0.038630377524143986, "grad_norm": 1.28125, "learning_rate": 0.00032950000000000004, "loss": 7.425, "mean_token_accuracy": 0.08424968719482422, "num_tokens": 1341342.0, "step": 660 }, { "entropy": 7.751668787002563, "epoch": 0.038923031899326895, "grad_norm": 1.046875, "learning_rate": 0.00033200000000000005, "loss": 7.3853, "mean_token_accuracy": 0.08578916639089584, "num_tokens": 1350484.0, "step": 665 }, { "entropy": 7.757629871368408, "epoch": 0.0392156862745098, "grad_norm": 1.0, "learning_rate": 0.00033450000000000005, "loss": 7.4261, "mean_token_accuracy": 0.08848872929811477, "num_tokens": 1360422.0, "step": 670 }, { "entropy": 7.717638921737671, "epoch": 0.03950834064969271, "grad_norm": 0.9375, "learning_rate": 0.000337, "loss": 7.3313, "mean_token_accuracy": 0.0953003279864788, "num_tokens": 1370653.0, "step": 675 }, { "entropy": 7.675066566467285, "epoch": 0.03980099502487562, "grad_norm": 1.0546875, "learning_rate": 0.0003395, "loss": 7.4036, "mean_token_accuracy": 0.08738565891981125, "num_tokens": 1379904.0, "step": 680 }, { "entropy": 7.810481309890747, "epoch": 0.04009364940005853, "grad_norm": 1.2421875, "learning_rate": 0.000342, "loss": 7.3752, "mean_token_accuracy": 0.088729477673769, "num_tokens": 1390292.0, "step": 685 }, { "entropy": 7.815591716766358, "epoch": 0.04038630377524144, "grad_norm": 1.078125, "learning_rate": 0.00034449999999999997, "loss": 7.3868, "mean_token_accuracy": 0.09195382669568061, "num_tokens": 1400089.0, "step": 690 }, { "entropy": 7.60293927192688, "epoch": 0.04067895815042435, "grad_norm": 1.125, "learning_rate": 0.000347, "loss": 7.4062, "mean_token_accuracy": 0.08808108903467655, "num_tokens": 1409486.0, "step": 695 }, { "entropy": 7.7336822032928465, "epoch": 0.04097161252560726, "grad_norm": 1.0078125, "learning_rate": 0.0003495, "loss": 7.4036, "mean_token_accuracy": 0.09051820784807205, "num_tokens": 1419834.0, "step": 700 }, { "entropy": 7.825760173797607, "epoch": 0.041264266900790166, "grad_norm": 0.97265625, "learning_rate": 0.000352, "loss": 7.4213, "mean_token_accuracy": 0.08384566307067871, "num_tokens": 1430045.0, "step": 705 }, { "entropy": 7.65966100692749, "epoch": 0.041556921275973074, "grad_norm": 0.84375, "learning_rate": 0.0003545, "loss": 7.3022, "mean_token_accuracy": 0.09362379759550095, "num_tokens": 1439394.0, "step": 710 }, { "entropy": 7.688346433639526, "epoch": 0.04184957565115598, "grad_norm": 0.96875, "learning_rate": 0.000357, "loss": 7.4215, "mean_token_accuracy": 0.09055223762989044, "num_tokens": 1449768.0, "step": 715 }, { "entropy": 7.685902833938599, "epoch": 0.04214223002633889, "grad_norm": 0.8671875, "learning_rate": 0.0003595, "loss": 7.3477, "mean_token_accuracy": 0.09224402233958244, "num_tokens": 1460716.0, "step": 720 }, { "entropy": 7.657220983505249, "epoch": 0.0424348844015218, "grad_norm": 0.921875, "learning_rate": 0.000362, "loss": 7.3045, "mean_token_accuracy": 0.09458784088492393, "num_tokens": 1470447.0, "step": 725 }, { "entropy": 7.609696722030639, "epoch": 0.04272753877670471, "grad_norm": 0.94921875, "learning_rate": 0.0003645, "loss": 7.3177, "mean_token_accuracy": 0.09160968512296677, "num_tokens": 1481195.0, "step": 730 }, { "entropy": 7.631748199462891, "epoch": 0.04302019315188762, "grad_norm": 1.0703125, "learning_rate": 0.000367, "loss": 7.3056, "mean_token_accuracy": 0.0939846970140934, "num_tokens": 1491679.0, "step": 735 }, { "entropy": 7.620209503173828, "epoch": 0.04331284752707053, "grad_norm": 1.265625, "learning_rate": 0.0003695, "loss": 7.2829, "mean_token_accuracy": 0.09510877132415771, "num_tokens": 1501444.0, "step": 740 }, { "entropy": 7.611186599731445, "epoch": 0.043605501902253437, "grad_norm": 1.0078125, "learning_rate": 0.000372, "loss": 7.2859, "mean_token_accuracy": 0.09353157803416252, "num_tokens": 1511299.0, "step": 745 }, { "entropy": 7.654992341995239, "epoch": 0.043898156277436345, "grad_norm": 1.0, "learning_rate": 0.0003745, "loss": 7.3184, "mean_token_accuracy": 0.08825154900550843, "num_tokens": 1522389.0, "step": 750 }, { "entropy": 7.5400854587554935, "epoch": 0.044190810652619254, "grad_norm": 0.875, "learning_rate": 0.000377, "loss": 7.2799, "mean_token_accuracy": 0.08888843208551407, "num_tokens": 1533493.0, "step": 755 }, { "entropy": 7.710229063034058, "epoch": 0.04448346502780216, "grad_norm": 1.0859375, "learning_rate": 0.0003795, "loss": 7.3453, "mean_token_accuracy": 0.08668449223041534, "num_tokens": 1542668.0, "step": 760 }, { "entropy": 7.633497714996338, "epoch": 0.04477611940298507, "grad_norm": 1.140625, "learning_rate": 0.000382, "loss": 7.2267, "mean_token_accuracy": 0.09399316534399986, "num_tokens": 1552221.0, "step": 765 }, { "entropy": 7.639019966125488, "epoch": 0.04506877377816798, "grad_norm": 1.15625, "learning_rate": 0.0003845, "loss": 7.3691, "mean_token_accuracy": 0.08336025923490524, "num_tokens": 1562807.0, "step": 770 }, { "entropy": 7.568796062469483, "epoch": 0.04536142815335089, "grad_norm": 0.96875, "learning_rate": 0.00038700000000000003, "loss": 7.3082, "mean_token_accuracy": 0.08972151428461075, "num_tokens": 1572751.0, "step": 775 }, { "entropy": 7.611496067047119, "epoch": 0.0456540825285338, "grad_norm": 0.984375, "learning_rate": 0.00038950000000000003, "loss": 7.3434, "mean_token_accuracy": 0.08387525528669357, "num_tokens": 1582802.0, "step": 780 }, { "entropy": 7.618696594238282, "epoch": 0.04594673690371671, "grad_norm": 1.09375, "learning_rate": 0.00039200000000000004, "loss": 7.2633, "mean_token_accuracy": 0.0899326853454113, "num_tokens": 1593780.0, "step": 785 }, { "entropy": 7.53293023109436, "epoch": 0.046239391278899616, "grad_norm": 0.90625, "learning_rate": 0.00039450000000000005, "loss": 7.3148, "mean_token_accuracy": 0.09066571295261383, "num_tokens": 1604386.0, "step": 790 }, { "entropy": 7.6753880977630615, "epoch": 0.046532045654082525, "grad_norm": 1.0703125, "learning_rate": 0.00039700000000000005, "loss": 7.295, "mean_token_accuracy": 0.0937283106148243, "num_tokens": 1614359.0, "step": 795 }, { "entropy": 7.544372034072876, "epoch": 0.046824700029265434, "grad_norm": 0.87890625, "learning_rate": 0.0003995, "loss": 7.176, "mean_token_accuracy": 0.09263980463147163, "num_tokens": 1624389.0, "step": 800 }, { "entropy": 7.56023473739624, "epoch": 0.04711735440444834, "grad_norm": 0.90625, "learning_rate": 0.000402, "loss": 7.2833, "mean_token_accuracy": 0.09009978026151658, "num_tokens": 1634608.0, "step": 805 }, { "entropy": 7.455692481994629, "epoch": 0.04741000877963126, "grad_norm": 1.0078125, "learning_rate": 0.0004045, "loss": 7.2045, "mean_token_accuracy": 0.09845735877752304, "num_tokens": 1645723.0, "step": 810 }, { "entropy": 7.554573822021484, "epoch": 0.04770266315481417, "grad_norm": 0.9921875, "learning_rate": 0.00040699999999999997, "loss": 7.1817, "mean_token_accuracy": 0.10012574419379235, "num_tokens": 1655182.0, "step": 815 }, { "entropy": 7.52402024269104, "epoch": 0.04799531752999708, "grad_norm": 0.890625, "learning_rate": 0.0004095, "loss": 7.1881, "mean_token_accuracy": 0.09166754521429539, "num_tokens": 1664597.0, "step": 820 }, { "entropy": 7.551714515686035, "epoch": 0.048287971905179985, "grad_norm": 1.0078125, "learning_rate": 0.000412, "loss": 7.2815, "mean_token_accuracy": 0.09629782885313035, "num_tokens": 1674809.0, "step": 825 }, { "entropy": 7.4392908096313475, "epoch": 0.048580626280362894, "grad_norm": 0.8984375, "learning_rate": 0.0004145, "loss": 7.1535, "mean_token_accuracy": 0.09503219947218895, "num_tokens": 1684082.0, "step": 830 }, { "entropy": 7.506573343276978, "epoch": 0.0488732806555458, "grad_norm": 0.92578125, "learning_rate": 0.000417, "loss": 7.2511, "mean_token_accuracy": 0.09144405052065849, "num_tokens": 1695547.0, "step": 835 }, { "entropy": 7.713369989395142, "epoch": 0.04916593503072871, "grad_norm": 0.96875, "learning_rate": 0.0004195, "loss": 7.2906, "mean_token_accuracy": 0.097728531062603, "num_tokens": 1706434.0, "step": 840 }, { "entropy": 7.475108194351196, "epoch": 0.04945858940591162, "grad_norm": 0.99609375, "learning_rate": 0.000422, "loss": 7.226, "mean_token_accuracy": 0.0920279160141945, "num_tokens": 1718063.0, "step": 845 }, { "entropy": 7.463070058822632, "epoch": 0.04975124378109453, "grad_norm": 1.0078125, "learning_rate": 0.0004245, "loss": 7.2122, "mean_token_accuracy": 0.08780092373490334, "num_tokens": 1728594.0, "step": 850 }, { "entropy": 7.555836248397827, "epoch": 0.05004389815627744, "grad_norm": 0.91015625, "learning_rate": 0.000427, "loss": 7.2233, "mean_token_accuracy": 0.09364095106720924, "num_tokens": 1738879.0, "step": 855 }, { "entropy": 7.437271451950073, "epoch": 0.05033655253146035, "grad_norm": 0.953125, "learning_rate": 0.0004295, "loss": 7.1784, "mean_token_accuracy": 0.09283483177423477, "num_tokens": 1748850.0, "step": 860 }, { "entropy": 7.491488265991211, "epoch": 0.050629206906643257, "grad_norm": 1.046875, "learning_rate": 0.000432, "loss": 7.23, "mean_token_accuracy": 0.09758371859788895, "num_tokens": 1759992.0, "step": 865 }, { "entropy": 7.6118079662323, "epoch": 0.050921861281826165, "grad_norm": 1.015625, "learning_rate": 0.0004345, "loss": 7.2323, "mean_token_accuracy": 0.09015733227133751, "num_tokens": 1769879.0, "step": 870 }, { "entropy": 7.352298641204834, "epoch": 0.051214515657009074, "grad_norm": 0.9921875, "learning_rate": 0.000437, "loss": 7.1161, "mean_token_accuracy": 0.10056154727935791, "num_tokens": 1779429.0, "step": 875 }, { "entropy": 7.476632738113404, "epoch": 0.05150717003219198, "grad_norm": 0.98828125, "learning_rate": 0.0004395, "loss": 7.2185, "mean_token_accuracy": 0.08883849456906319, "num_tokens": 1788655.0, "step": 880 }, { "entropy": 7.499739456176758, "epoch": 0.05179982440737489, "grad_norm": 1.0, "learning_rate": 0.000442, "loss": 7.2176, "mean_token_accuracy": 0.0874781295657158, "num_tokens": 1798454.0, "step": 885 }, { "entropy": 7.425588893890381, "epoch": 0.0520924787825578, "grad_norm": 1.125, "learning_rate": 0.0004445, "loss": 7.1901, "mean_token_accuracy": 0.09141783937811851, "num_tokens": 1809016.0, "step": 890 }, { "entropy": 7.4348835945129395, "epoch": 0.05238513315774071, "grad_norm": 1.0, "learning_rate": 0.000447, "loss": 7.0729, "mean_token_accuracy": 0.10189558044075966, "num_tokens": 1819992.0, "step": 895 }, { "entropy": 7.461593580245972, "epoch": 0.05267778753292362, "grad_norm": 1.015625, "learning_rate": 0.00044950000000000003, "loss": 7.1446, "mean_token_accuracy": 0.0971047930419445, "num_tokens": 1829932.0, "step": 900 }, { "entropy": 7.391701364517212, "epoch": 0.05297044190810653, "grad_norm": 1.0546875, "learning_rate": 0.00045200000000000004, "loss": 7.106, "mean_token_accuracy": 0.09629447236657143, "num_tokens": 1839877.0, "step": 905 }, { "entropy": 7.366179513931274, "epoch": 0.053263096283289436, "grad_norm": 1.0390625, "learning_rate": 0.00045450000000000004, "loss": 7.1228, "mean_token_accuracy": 0.09160000830888748, "num_tokens": 1849619.0, "step": 910 }, { "entropy": 7.25721960067749, "epoch": 0.053555750658472345, "grad_norm": 0.98828125, "learning_rate": 0.00045700000000000005, "loss": 7.0871, "mean_token_accuracy": 0.10284551829099656, "num_tokens": 1859513.0, "step": 915 }, { "entropy": 7.4424947738647464, "epoch": 0.053848405033655254, "grad_norm": 1.09375, "learning_rate": 0.00045950000000000006, "loss": 7.0591, "mean_token_accuracy": 0.09884816706180573, "num_tokens": 1869849.0, "step": 920 }, { "entropy": 7.435005235671997, "epoch": 0.05414105940883816, "grad_norm": 1.078125, "learning_rate": 0.000462, "loss": 7.174, "mean_token_accuracy": 0.09173808693885803, "num_tokens": 1879385.0, "step": 925 }, { "entropy": 7.384939336776734, "epoch": 0.05443371378402107, "grad_norm": 0.97265625, "learning_rate": 0.0004645, "loss": 7.1714, "mean_token_accuracy": 0.0962887905538082, "num_tokens": 1889415.0, "step": 930 }, { "entropy": 7.449399948120117, "epoch": 0.05472636815920398, "grad_norm": 0.94921875, "learning_rate": 0.000467, "loss": 7.2205, "mean_token_accuracy": 0.09307129457592964, "num_tokens": 1901145.0, "step": 935 }, { "entropy": 7.3746397495269775, "epoch": 0.05501902253438689, "grad_norm": 0.99609375, "learning_rate": 0.0004695, "loss": 7.0894, "mean_token_accuracy": 0.10347672551870346, "num_tokens": 1910355.0, "step": 940 }, { "entropy": 7.481390714645386, "epoch": 0.0553116769095698, "grad_norm": 0.98828125, "learning_rate": 0.000472, "loss": 7.1573, "mean_token_accuracy": 0.09576819315552712, "num_tokens": 1920526.0, "step": 945 }, { "entropy": 7.3511247634887695, "epoch": 0.05560433128475271, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 7.1049, "mean_token_accuracy": 0.09833246991038322, "num_tokens": 1929884.0, "step": 950 }, { "entropy": 7.348301696777344, "epoch": 0.055896985659935616, "grad_norm": 0.94921875, "learning_rate": 0.000477, "loss": 7.1044, "mean_token_accuracy": 0.09435090646147729, "num_tokens": 1940707.0, "step": 955 }, { "entropy": 7.472948408126831, "epoch": 0.056189640035118525, "grad_norm": 0.984375, "learning_rate": 0.0004795, "loss": 7.1739, "mean_token_accuracy": 0.09039252474904061, "num_tokens": 1951024.0, "step": 960 }, { "entropy": 7.3457207679748535, "epoch": 0.056482294410301434, "grad_norm": 0.94921875, "learning_rate": 0.000482, "loss": 7.0498, "mean_token_accuracy": 0.09302077516913414, "num_tokens": 1961553.0, "step": 965 }, { "entropy": 7.3738847255706785, "epoch": 0.05677494878548434, "grad_norm": 1.046875, "learning_rate": 0.0004845, "loss": 7.1534, "mean_token_accuracy": 0.09500665068626404, "num_tokens": 1971297.0, "step": 970 }, { "entropy": 7.282409811019898, "epoch": 0.05706760316066725, "grad_norm": 0.98828125, "learning_rate": 0.000487, "loss": 7.0597, "mean_token_accuracy": 0.09678901359438896, "num_tokens": 1981753.0, "step": 975 }, { "entropy": 7.471026945114136, "epoch": 0.05736025753585016, "grad_norm": 1.0546875, "learning_rate": 0.0004895, "loss": 7.1558, "mean_token_accuracy": 0.10005593970417977, "num_tokens": 1992590.0, "step": 980 }, { "entropy": 7.350202465057373, "epoch": 0.05765291191103307, "grad_norm": 1.0546875, "learning_rate": 0.000492, "loss": 7.1311, "mean_token_accuracy": 0.09674226641654968, "num_tokens": 2001745.0, "step": 985 }, { "entropy": 7.262063264846802, "epoch": 0.05794556628621598, "grad_norm": 1.1171875, "learning_rate": 0.0004945, "loss": 7.0455, "mean_token_accuracy": 0.09895217716693878, "num_tokens": 2011171.0, "step": 990 }, { "entropy": 7.362540626525879, "epoch": 0.05823822066139889, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 7.0169, "mean_token_accuracy": 0.0997674971818924, "num_tokens": 2020732.0, "step": 995 }, { "entropy": 7.338001441955567, "epoch": 0.058530875036581796, "grad_norm": 0.93359375, "learning_rate": 0.0004995, "loss": 7.0761, "mean_token_accuracy": 0.09528696537017822, "num_tokens": 2030702.0, "step": 1000 }, { "entropy": 7.215022277832031, "epoch": 0.058823529411764705, "grad_norm": 1.046875, "learning_rate": 0.000499998026082006, "loss": 7.0855, "mean_token_accuracy": 0.09225433394312858, "num_tokens": 2040933.0, "step": 1005 }, { "entropy": 7.375273084640503, "epoch": 0.059116183786947614, "grad_norm": 1.015625, "learning_rate": 0.0004999900070995136, "loss": 7.1447, "mean_token_accuracy": 0.09505715742707252, "num_tokens": 2051083.0, "step": 1010 }, { "entropy": 7.354562759399414, "epoch": 0.05940883816213052, "grad_norm": 0.90234375, "learning_rate": 0.0004999758199023239, "loss": 7.0474, "mean_token_accuracy": 0.09751659147441387, "num_tokens": 2060290.0, "step": 1015 }, { "entropy": 7.2843845844268795, "epoch": 0.05970149253731343, "grad_norm": 1.2421875, "learning_rate": 0.0004999554648793858, "loss": 7.0758, "mean_token_accuracy": 0.10457687452435493, "num_tokens": 2070537.0, "step": 1020 }, { "entropy": 7.208773374557495, "epoch": 0.05999414691249634, "grad_norm": 0.984375, "learning_rate": 0.0004999289425887425, "loss": 7.0188, "mean_token_accuracy": 0.09619513675570487, "num_tokens": 2081020.0, "step": 1025 }, { "entropy": 7.309514284133911, "epoch": 0.06028680128767925, "grad_norm": 1.0, "learning_rate": 0.0004998962537575161, "loss": 7.0259, "mean_token_accuracy": 0.10205215588212013, "num_tokens": 2090731.0, "step": 1030 }, { "entropy": 7.4033431053161625, "epoch": 0.06057945566286216, "grad_norm": 1.1015625, "learning_rate": 0.0004998573992818874, "loss": 7.1142, "mean_token_accuracy": 0.09757147133350372, "num_tokens": 2100248.0, "step": 1035 }, { "entropy": 7.219016265869141, "epoch": 0.06087211003804507, "grad_norm": 1.015625, "learning_rate": 0.0004998123802270715, "loss": 7.0196, "mean_token_accuracy": 0.09904577806591988, "num_tokens": 2110518.0, "step": 1040 }, { "entropy": 7.363824844360352, "epoch": 0.061164764413227976, "grad_norm": 0.9765625, "learning_rate": 0.0004997611978272886, "loss": 7.0895, "mean_token_accuracy": 0.0941918708384037, "num_tokens": 2121424.0, "step": 1045 }, { "entropy": 7.209250974655151, "epoch": 0.061457418788410885, "grad_norm": 1.1484375, "learning_rate": 0.0004997038534857298, "loss": 7.0093, "mean_token_accuracy": 0.1055798962712288, "num_tokens": 2130904.0, "step": 1050 }, { "entropy": 7.318933916091919, "epoch": 0.061750073163593794, "grad_norm": 0.94921875, "learning_rate": 0.0004996403487745194, "loss": 7.0483, "mean_token_accuracy": 0.10186817795038224, "num_tokens": 2140710.0, "step": 1055 }, { "entropy": 7.373817396163941, "epoch": 0.0620427275387767, "grad_norm": 1.4765625, "learning_rate": 0.000499570685434671, "loss": 7.1132, "mean_token_accuracy": 0.0974596157670021, "num_tokens": 2150767.0, "step": 1060 }, { "entropy": 7.216788959503174, "epoch": 0.06233538191395961, "grad_norm": 1.0234375, "learning_rate": 0.0004994948653760405, "loss": 7.0526, "mean_token_accuracy": 0.09709591269493104, "num_tokens": 2161414.0, "step": 1065 }, { "entropy": 7.242707395553589, "epoch": 0.06262803628914253, "grad_norm": 1.0, "learning_rate": 0.0004994128906772729, "loss": 6.9802, "mean_token_accuracy": 0.10571711510419846, "num_tokens": 2171960.0, "step": 1070 }, { "entropy": 7.240592432022095, "epoch": 0.06292069066432543, "grad_norm": 1.046875, "learning_rate": 0.000499324763585746, "loss": 6.9542, "mean_token_accuracy": 0.09980396181344986, "num_tokens": 2182344.0, "step": 1075 }, { "entropy": 7.144010734558106, "epoch": 0.06321334503950835, "grad_norm": 0.859375, "learning_rate": 0.0004992304865175085, "loss": 6.9743, "mean_token_accuracy": 0.09961154088377952, "num_tokens": 2194829.0, "step": 1080 }, { "entropy": 7.1723168849945065, "epoch": 0.06350599941469125, "grad_norm": 0.984375, "learning_rate": 0.0004991300620572138, "loss": 6.9419, "mean_token_accuracy": 0.10114665776491165, "num_tokens": 2204662.0, "step": 1085 }, { "entropy": 7.227386426925659, "epoch": 0.06379865378987416, "grad_norm": 1.1171875, "learning_rate": 0.0004990234929580494, "loss": 6.9674, "mean_token_accuracy": 0.10895995870232582, "num_tokens": 2213815.0, "step": 1090 }, { "entropy": 7.223431777954102, "epoch": 0.06409130816505706, "grad_norm": 0.92578125, "learning_rate": 0.0004989107821416609, "loss": 6.9819, "mean_token_accuracy": 0.10199102833867073, "num_tokens": 2223026.0, "step": 1095 }, { "entropy": 7.193548965454101, "epoch": 0.06438396254023998, "grad_norm": 1.0078125, "learning_rate": 0.0004987919326980723, "loss": 7.0315, "mean_token_accuracy": 0.09989764392375947, "num_tokens": 2233575.0, "step": 1100 }, { "entropy": 7.221850919723511, "epoch": 0.06467661691542288, "grad_norm": 0.88671875, "learning_rate": 0.0004986669478856011, "loss": 6.9146, "mean_token_accuracy": 0.10782215669751168, "num_tokens": 2244171.0, "step": 1105 }, { "entropy": 7.2020580768585205, "epoch": 0.0649692712906058, "grad_norm": 1.125, "learning_rate": 0.0004985358311307688, "loss": 6.9815, "mean_token_accuracy": 0.0972609356045723, "num_tokens": 2253972.0, "step": 1110 }, { "entropy": 7.1520631313323975, "epoch": 0.0652619256657887, "grad_norm": 1.234375, "learning_rate": 0.0004983985860282081, "loss": 7.0108, "mean_token_accuracy": 0.10005398914217949, "num_tokens": 2264699.0, "step": 1115 }, { "entropy": 7.216694593429565, "epoch": 0.06555458004097162, "grad_norm": 0.91796875, "learning_rate": 0.0004982552163405623, "loss": 6.9772, "mean_token_accuracy": 0.10254745483398438, "num_tokens": 2274894.0, "step": 1120 }, { "entropy": 7.193087959289551, "epoch": 0.06584723441615452, "grad_norm": 0.87890625, "learning_rate": 0.0004981057259983839, "loss": 7.0038, "mean_token_accuracy": 0.09882058501243592, "num_tokens": 2285541.0, "step": 1125 }, { "entropy": 7.2195906162261965, "epoch": 0.06613988879133743, "grad_norm": 0.953125, "learning_rate": 0.0004979501191000262, "loss": 6.9395, "mean_token_accuracy": 0.10300094708800316, "num_tokens": 2295443.0, "step": 1130 }, { "entropy": 7.242094087600708, "epoch": 0.06643254316652034, "grad_norm": 1.0, "learning_rate": 0.0004977883999115311, "loss": 7.0233, "mean_token_accuracy": 0.09846225753426552, "num_tokens": 2306149.0, "step": 1135 }, { "entropy": 7.102969694137573, "epoch": 0.06672519754170325, "grad_norm": 0.96484375, "learning_rate": 0.0004976205728665113, "loss": 6.9776, "mean_token_accuracy": 0.09972455576062203, "num_tokens": 2316589.0, "step": 1140 }, { "entropy": 7.240374565124512, "epoch": 0.06701785191688615, "grad_norm": 0.99609375, "learning_rate": 0.0004974466425660307, "loss": 6.9679, "mean_token_accuracy": 0.10801631659269333, "num_tokens": 2326340.0, "step": 1145 }, { "entropy": 7.192791986465454, "epoch": 0.06731050629206907, "grad_norm": 0.9140625, "learning_rate": 0.0004972666137784759, "loss": 6.9389, "mean_token_accuracy": 0.10559422895312309, "num_tokens": 2336078.0, "step": 1150 }, { "entropy": 7.1362364292144775, "epoch": 0.06760316066725197, "grad_norm": 0.84765625, "learning_rate": 0.0004970804914394271, "loss": 6.8247, "mean_token_accuracy": 0.10476716533303261, "num_tokens": 2346017.0, "step": 1155 }, { "entropy": 7.143903064727783, "epoch": 0.06789581504243489, "grad_norm": 0.91015625, "learning_rate": 0.0004968882806515225, "loss": 6.9748, "mean_token_accuracy": 0.09448844268918037, "num_tokens": 2355970.0, "step": 1160 }, { "entropy": 7.164862585067749, "epoch": 0.06818846941761779, "grad_norm": 0.875, "learning_rate": 0.0004966899866843177, "loss": 6.9061, "mean_token_accuracy": 0.09887387901544571, "num_tokens": 2366010.0, "step": 1165 }, { "entropy": 7.173722934722901, "epoch": 0.0684811237928007, "grad_norm": 1.015625, "learning_rate": 0.000496485614974142, "loss": 6.9059, "mean_token_accuracy": 0.10019839331507682, "num_tokens": 2376431.0, "step": 1170 }, { "entropy": 7.145708847045898, "epoch": 0.0687737781679836, "grad_norm": 1.0390625, "learning_rate": 0.0004962751711239492, "loss": 6.9018, "mean_token_accuracy": 0.10499030724167824, "num_tokens": 2387027.0, "step": 1175 }, { "entropy": 7.116997337341308, "epoch": 0.06906643254316652, "grad_norm": 1.0625, "learning_rate": 0.0004960586609031636, "loss": 6.9054, "mean_token_accuracy": 0.10259901955723763, "num_tokens": 2396746.0, "step": 1180 }, { "entropy": 7.146070146560669, "epoch": 0.06935908691834942, "grad_norm": 0.9375, "learning_rate": 0.0004958360902475224, "loss": 6.917, "mean_token_accuracy": 0.10224924832582474, "num_tokens": 2406340.0, "step": 1185 }, { "entropy": 7.133272552490235, "epoch": 0.06965174129353234, "grad_norm": 0.85546875, "learning_rate": 0.0004956074652589125, "loss": 6.9518, "mean_token_accuracy": 0.10214994624257087, "num_tokens": 2417441.0, "step": 1190 }, { "entropy": 7.15489559173584, "epoch": 0.06994439566871524, "grad_norm": 0.98046875, "learning_rate": 0.0004953727922052035, "loss": 6.843, "mean_token_accuracy": 0.10828633531928063, "num_tokens": 2427365.0, "step": 1195 }, { "entropy": 7.020367860794067, "epoch": 0.07023705004389816, "grad_norm": 1.046875, "learning_rate": 0.0004951320775200756, "loss": 6.8627, "mean_token_accuracy": 0.10394505336880684, "num_tokens": 2437236.0, "step": 1200 }, { "entropy": 7.1537285327911375, "epoch": 0.07052970441908106, "grad_norm": 1.0, "learning_rate": 0.0004948853278028436, "loss": 6.9642, "mean_token_accuracy": 0.09915822148323059, "num_tokens": 2448000.0, "step": 1205 }, { "entropy": 7.071624374389648, "epoch": 0.07082235879426398, "grad_norm": 0.93359375, "learning_rate": 0.0004946325498182755, "loss": 6.8886, "mean_token_accuracy": 0.10841592401266098, "num_tokens": 2458627.0, "step": 1210 }, { "entropy": 7.154271030426026, "epoch": 0.07111501316944688, "grad_norm": 0.9296875, "learning_rate": 0.0004943737504964076, "loss": 6.8187, "mean_token_accuracy": 0.11104752346873284, "num_tokens": 2468110.0, "step": 1215 }, { "entropy": 7.091701221466065, "epoch": 0.0714076675446298, "grad_norm": 0.9140625, "learning_rate": 0.000494108936932354, "loss": 6.9753, "mean_token_accuracy": 0.09984883964061737, "num_tokens": 2479527.0, "step": 1220 }, { "entropy": 7.113129329681397, "epoch": 0.0717003219198127, "grad_norm": 0.92578125, "learning_rate": 0.0004938381163861124, "loss": 6.857, "mean_token_accuracy": 0.11230505779385566, "num_tokens": 2489856.0, "step": 1225 }, { "entropy": 7.067525911331177, "epoch": 0.07199297629499561, "grad_norm": 0.8984375, "learning_rate": 0.0004935612962823645, "loss": 6.9131, "mean_token_accuracy": 0.10126614049077035, "num_tokens": 2500164.0, "step": 1230 }, { "entropy": 7.203033304214477, "epoch": 0.07228563067017851, "grad_norm": 0.94140625, "learning_rate": 0.0004932784842102739, "loss": 6.9133, "mean_token_accuracy": 0.10488039031624793, "num_tokens": 2510535.0, "step": 1235 }, { "entropy": 7.032154607772827, "epoch": 0.07257828504536143, "grad_norm": 1.0078125, "learning_rate": 0.0004929896879232758, "loss": 6.8737, "mean_token_accuracy": 0.10379046872258187, "num_tokens": 2521334.0, "step": 1240 }, { "entropy": 7.104176473617554, "epoch": 0.07287093942054433, "grad_norm": 0.94140625, "learning_rate": 0.0004926949153388668, "loss": 6.8486, "mean_token_accuracy": 0.10444203391671181, "num_tokens": 2531990.0, "step": 1245 }, { "entropy": 7.063020420074463, "epoch": 0.07316359379572725, "grad_norm": 0.9921875, "learning_rate": 0.0004923941745383859, "loss": 6.9315, "mean_token_accuracy": 0.10278217419981957, "num_tokens": 2542418.0, "step": 1250 }, { "entropy": 7.165763187408447, "epoch": 0.07345624817091015, "grad_norm": 0.859375, "learning_rate": 0.000492087473766794, "loss": 6.9004, "mean_token_accuracy": 0.10728387162089348, "num_tokens": 2553944.0, "step": 1255 }, { "entropy": 7.088944149017334, "epoch": 0.07374890254609306, "grad_norm": 0.96484375, "learning_rate": 0.000491774821432448, "loss": 6.8639, "mean_token_accuracy": 0.10208542868494988, "num_tokens": 2564577.0, "step": 1260 }, { "entropy": 7.134335517883301, "epoch": 0.07404155692127597, "grad_norm": 1.0234375, "learning_rate": 0.0004914562261068693, "loss": 6.9696, "mean_token_accuracy": 0.09385665506124496, "num_tokens": 2574003.0, "step": 1265 }, { "entropy": 7.100490999221802, "epoch": 0.07433421129645888, "grad_norm": 0.88671875, "learning_rate": 0.0004911316965245098, "loss": 6.8053, "mean_token_accuracy": 0.10951183810830116, "num_tokens": 2585367.0, "step": 1270 }, { "entropy": 7.030397129058838, "epoch": 0.07462686567164178, "grad_norm": 0.95703125, "learning_rate": 0.000490801241582512, "loss": 6.7917, "mean_token_accuracy": 0.10875893980264664, "num_tokens": 2595282.0, "step": 1275 }, { "entropy": 7.015108489990235, "epoch": 0.0749195200468247, "grad_norm": 0.97265625, "learning_rate": 0.000490464870340465, "loss": 6.7653, "mean_token_accuracy": 0.11425828039646149, "num_tokens": 2605220.0, "step": 1280 }, { "entropy": 6.989345264434815, "epoch": 0.0752121744220076, "grad_norm": 1.1875, "learning_rate": 0.0004901225920201563, "loss": 6.8498, "mean_token_accuracy": 0.10785233229398727, "num_tokens": 2616492.0, "step": 1285 }, { "entropy": 7.082758522033691, "epoch": 0.07550482879719052, "grad_norm": 1.03125, "learning_rate": 0.000489774416005319, "loss": 6.8475, "mean_token_accuracy": 0.10241246297955513, "num_tokens": 2626133.0, "step": 1290 }, { "entropy": 6.978100776672363, "epoch": 0.07579748317237343, "grad_norm": 0.92578125, "learning_rate": 0.0004894203518413742, "loss": 6.8281, "mean_token_accuracy": 0.10710375010967255, "num_tokens": 2636661.0, "step": 1295 }, { "entropy": 7.118194580078125, "epoch": 0.07609013754755634, "grad_norm": 0.95703125, "learning_rate": 0.0004890604092351701, "loss": 6.8386, "mean_token_accuracy": 0.10455987602472305, "num_tokens": 2647598.0, "step": 1300 }, { "entropy": 7.000920104980469, "epoch": 0.07638279192273925, "grad_norm": 1.0078125, "learning_rate": 0.000488694598054715, "loss": 6.7492, "mean_token_accuracy": 0.10895679742097855, "num_tokens": 2657267.0, "step": 1305 }, { "entropy": 7.016765689849853, "epoch": 0.07667544629792215, "grad_norm": 1.0078125, "learning_rate": 0.0004883229283289071, "loss": 6.8488, "mean_token_accuracy": 0.11024482920765877, "num_tokens": 2667048.0, "step": 1310 }, { "entropy": 7.150480651855469, "epoch": 0.07696810067310507, "grad_norm": 1.078125, "learning_rate": 0.00048794541024725993, "loss": 6.8433, "mean_token_accuracy": 0.09998077973723411, "num_tokens": 2677386.0, "step": 1315 }, { "entropy": 6.942998266220092, "epoch": 0.07726075504828797, "grad_norm": 0.921875, "learning_rate": 0.0004875620541596221, "loss": 6.8162, "mean_token_accuracy": 0.10883545204997062, "num_tokens": 2687655.0, "step": 1320 }, { "entropy": 7.089137840270996, "epoch": 0.07755340942347089, "grad_norm": 1.078125, "learning_rate": 0.00048717287057589454, "loss": 6.8018, "mean_token_accuracy": 0.11154846027493477, "num_tokens": 2698098.0, "step": 1325 }, { "entropy": 7.039312267303467, "epoch": 0.07784606379865379, "grad_norm": 0.97265625, "learning_rate": 0.0004867778701657417, "loss": 6.7993, "mean_token_accuracy": 0.10543053150177002, "num_tokens": 2708119.0, "step": 1330 }, { "entropy": 7.011804723739624, "epoch": 0.0781387181738367, "grad_norm": 0.8984375, "learning_rate": 0.00048637706375829955, "loss": 6.7769, "mean_token_accuracy": 0.11111046820878982, "num_tokens": 2717036.0, "step": 1335 }, { "entropy": 7.052466917037964, "epoch": 0.0784313725490196, "grad_norm": 0.92578125, "learning_rate": 0.000485970462341878, "loss": 6.9079, "mean_token_accuracy": 0.10972103923559189, "num_tokens": 2728290.0, "step": 1340 }, { "entropy": 7.033558797836304, "epoch": 0.07872402692420252, "grad_norm": 0.9765625, "learning_rate": 0.00048555807706366044, "loss": 6.8055, "mean_token_accuracy": 0.1085546374320984, "num_tokens": 2738373.0, "step": 1345 }, { "entropy": 7.0267448902130125, "epoch": 0.07901668129938542, "grad_norm": 1.0859375, "learning_rate": 0.00048513991922939756, "loss": 6.8276, "mean_token_accuracy": 0.11423720940947532, "num_tokens": 2748232.0, "step": 1350 }, { "entropy": 7.0601318359375, "epoch": 0.07930933567456834, "grad_norm": 0.94921875, "learning_rate": 0.00048471600030309744, "loss": 6.8273, "mean_token_accuracy": 0.10952704623341561, "num_tokens": 2758138.0, "step": 1355 }, { "entropy": 7.004944372177124, "epoch": 0.07960199004975124, "grad_norm": 0.8984375, "learning_rate": 0.00048428633190671186, "loss": 6.7868, "mean_token_accuracy": 0.11433181166648865, "num_tokens": 2768497.0, "step": 1360 }, { "entropy": 6.992530298233032, "epoch": 0.07989464442493416, "grad_norm": 0.97265625, "learning_rate": 0.0004838509258198167, "loss": 6.8227, "mean_token_accuracy": 0.10943501815199852, "num_tokens": 2778956.0, "step": 1365 }, { "entropy": 7.0625303268432615, "epoch": 0.08018729880011706, "grad_norm": 0.8515625, "learning_rate": 0.00048340979397929, "loss": 6.7757, "mean_token_accuracy": 0.11099240705370902, "num_tokens": 2788295.0, "step": 1370 }, { "entropy": 7.017833948135376, "epoch": 0.08047995317529998, "grad_norm": 1.0078125, "learning_rate": 0.00048296294847898386, "loss": 6.7851, "mean_token_accuracy": 0.10521746203303337, "num_tokens": 2797736.0, "step": 1375 }, { "entropy": 6.936165142059326, "epoch": 0.08077260755048288, "grad_norm": 0.98046875, "learning_rate": 0.0004825104015693934, "loss": 6.6646, "mean_token_accuracy": 0.11661427244544029, "num_tokens": 2806933.0, "step": 1380 }, { "entropy": 6.9978080749511715, "epoch": 0.0810652619256658, "grad_norm": 1.0234375, "learning_rate": 0.0004820521656573208, "loss": 6.829, "mean_token_accuracy": 0.10937268137931824, "num_tokens": 2817471.0, "step": 1385 }, { "entropy": 7.003310823440552, "epoch": 0.0813579163008487, "grad_norm": 0.94140625, "learning_rate": 0.00048158825330553505, "loss": 6.9589, "mean_token_accuracy": 0.10846946313977242, "num_tokens": 2828016.0, "step": 1390 }, { "entropy": 7.050713396072387, "epoch": 0.08165057067603161, "grad_norm": 1.0625, "learning_rate": 0.00048111867723242763, "loss": 6.7987, "mean_token_accuracy": 0.10719454810023307, "num_tokens": 2838011.0, "step": 1395 }, { "entropy": 6.951278257369995, "epoch": 0.08194322505121451, "grad_norm": 0.96875, "learning_rate": 0.0004806434503116637, "loss": 6.68, "mean_token_accuracy": 0.11497046947479247, "num_tokens": 2848281.0, "step": 1400 }, { "entropy": 6.931306600570679, "epoch": 0.08223587942639743, "grad_norm": 0.9765625, "learning_rate": 0.0004801625855718296, "loss": 6.7977, "mean_token_accuracy": 0.11288361549377442, "num_tokens": 2859338.0, "step": 1405 }, { "entropy": 7.084950971603393, "epoch": 0.08252853380158033, "grad_norm": 1.015625, "learning_rate": 0.00047967609619607477, "loss": 6.7972, "mean_token_accuracy": 0.1125359758734703, "num_tokens": 2869238.0, "step": 1410 }, { "entropy": 6.982119035720825, "epoch": 0.08282118817676325, "grad_norm": 0.98046875, "learning_rate": 0.0004791839955217513, "loss": 6.7834, "mean_token_accuracy": 0.1123705931007862, "num_tokens": 2879312.0, "step": 1415 }, { "entropy": 6.892581462860107, "epoch": 0.08311384255194615, "grad_norm": 0.88671875, "learning_rate": 0.00047868629704004786, "loss": 6.7231, "mean_token_accuracy": 0.10808718279004097, "num_tokens": 2888974.0, "step": 1420 }, { "entropy": 7.027051877975464, "epoch": 0.08340649692712906, "grad_norm": 0.94140625, "learning_rate": 0.00047818301439561965, "loss": 6.7598, "mean_token_accuracy": 0.1084697999060154, "num_tokens": 2899501.0, "step": 1425 }, { "entropy": 6.986096715927124, "epoch": 0.08369915130231197, "grad_norm": 0.9921875, "learning_rate": 0.00047767416138621454, "loss": 6.7968, "mean_token_accuracy": 0.10647018775343894, "num_tokens": 2909210.0, "step": 1430 }, { "entropy": 6.951934385299682, "epoch": 0.08399180567749488, "grad_norm": 0.9765625, "learning_rate": 0.000477159751962295, "loss": 6.7246, "mean_token_accuracy": 0.10852879583835602, "num_tokens": 2919470.0, "step": 1435 }, { "entropy": 6.909590435028076, "epoch": 0.08428446005267778, "grad_norm": 0.9765625, "learning_rate": 0.00047663980022665507, "loss": 6.6972, "mean_token_accuracy": 0.1139543168246746, "num_tokens": 2929526.0, "step": 1440 }, { "entropy": 6.91973295211792, "epoch": 0.0845771144278607, "grad_norm": 1.078125, "learning_rate": 0.00047611432043403437, "loss": 6.7107, "mean_token_accuracy": 0.1111906498670578, "num_tokens": 2938944.0, "step": 1445 }, { "entropy": 7.030971336364746, "epoch": 0.0848697688030436, "grad_norm": 1.015625, "learning_rate": 0.0004755833269907267, "loss": 6.7415, "mean_token_accuracy": 0.11075187176465988, "num_tokens": 2948334.0, "step": 1450 }, { "entropy": 6.899282360076905, "epoch": 0.08516242317822652, "grad_norm": 1.0390625, "learning_rate": 0.0004750468344541857, "loss": 6.6948, "mean_token_accuracy": 0.11553604677319526, "num_tokens": 2957687.0, "step": 1455 }, { "entropy": 6.967754316329956, "epoch": 0.08545507755340942, "grad_norm": 1.0078125, "learning_rate": 0.00047450485753262525, "loss": 6.6961, "mean_token_accuracy": 0.11643371209502221, "num_tokens": 2968291.0, "step": 1460 }, { "entropy": 6.844262170791626, "epoch": 0.08574773192859234, "grad_norm": 1.015625, "learning_rate": 0.00047395741108461633, "loss": 6.6833, "mean_token_accuracy": 0.11676188111305237, "num_tokens": 2978809.0, "step": 1465 }, { "entropy": 7.051819658279419, "epoch": 0.08604038630377524, "grad_norm": 1.0625, "learning_rate": 0.00047340451011867985, "loss": 6.828, "mean_token_accuracy": 0.10943237319588661, "num_tokens": 2988839.0, "step": 1470 }, { "entropy": 6.964070463180542, "epoch": 0.08633304067895815, "grad_norm": 1.015625, "learning_rate": 0.00047284616979287515, "loss": 6.7741, "mean_token_accuracy": 0.11031899750232696, "num_tokens": 2999380.0, "step": 1475 }, { "entropy": 6.931664991378784, "epoch": 0.08662569505414106, "grad_norm": 0.91015625, "learning_rate": 0.00047228240541438433, "loss": 6.6807, "mean_token_accuracy": 0.11252299547195435, "num_tokens": 3009298.0, "step": 1480 }, { "entropy": 6.891529750823975, "epoch": 0.08691834942932397, "grad_norm": 0.96484375, "learning_rate": 0.00047171323243909257, "loss": 6.6839, "mean_token_accuracy": 0.11446837261319161, "num_tokens": 3019747.0, "step": 1485 }, { "entropy": 6.922841024398804, "epoch": 0.08721100380450687, "grad_norm": 0.984375, "learning_rate": 0.00047113866647116457, "loss": 6.6891, "mean_token_accuracy": 0.11496640294790268, "num_tokens": 3029777.0, "step": 1490 }, { "entropy": 6.863205766677856, "epoch": 0.08750365817968979, "grad_norm": 1.0, "learning_rate": 0.0004705587232626164, "loss": 6.8019, "mean_token_accuracy": 0.10379430875182152, "num_tokens": 3040184.0, "step": 1495 }, { "entropy": 7.04589695930481, "epoch": 0.08779631255487269, "grad_norm": 1.03125, "learning_rate": 0.00046997341871288424, "loss": 6.6707, "mean_token_accuracy": 0.1120702162384987, "num_tokens": 3049183.0, "step": 1500 }, { "entropy": 6.905271196365357, "epoch": 0.0880889669300556, "grad_norm": 0.87890625, "learning_rate": 0.0004693827688683879, "loss": 6.6779, "mean_token_accuracy": 0.11167440935969353, "num_tokens": 3059102.0, "step": 1505 }, { "entropy": 6.918920421600342, "epoch": 0.08838162130523851, "grad_norm": 0.93359375, "learning_rate": 0.0004687867899220914, "loss": 6.7624, "mean_token_accuracy": 0.10838631615042686, "num_tokens": 3069644.0, "step": 1510 }, { "entropy": 6.977838325500488, "epoch": 0.08867427568042142, "grad_norm": 0.9140625, "learning_rate": 0.00046818549821305846, "loss": 6.7574, "mean_token_accuracy": 0.10591690614819527, "num_tokens": 3079299.0, "step": 1515 }, { "entropy": 6.885261201858521, "epoch": 0.08896693005560433, "grad_norm": 0.93359375, "learning_rate": 0.00046757891022600494, "loss": 6.5884, "mean_token_accuracy": 0.1182774156332016, "num_tokens": 3088236.0, "step": 1520 }, { "entropy": 6.761987543106079, "epoch": 0.08925958443078724, "grad_norm": 0.890625, "learning_rate": 0.0004669670425908471, "loss": 6.6051, "mean_token_accuracy": 0.12321883291006089, "num_tokens": 3098657.0, "step": 1525 }, { "entropy": 6.878669929504395, "epoch": 0.08955223880597014, "grad_norm": 0.83984375, "learning_rate": 0.0004663499120822451, "loss": 6.7157, "mean_token_accuracy": 0.11686875000596046, "num_tokens": 3109579.0, "step": 1530 }, { "entropy": 6.951480770111084, "epoch": 0.08984489318115306, "grad_norm": 1.0, "learning_rate": 0.0004657275356191437, "loss": 6.6881, "mean_token_accuracy": 0.12061331272125245, "num_tokens": 3118464.0, "step": 1535 }, { "entropy": 6.888629722595215, "epoch": 0.09013754755633596, "grad_norm": 0.921875, "learning_rate": 0.00046509993026430804, "loss": 6.6855, "mean_token_accuracy": 0.1155958354473114, "num_tokens": 3128378.0, "step": 1540 }, { "entropy": 6.916952276229859, "epoch": 0.09043020193151888, "grad_norm": 1.046875, "learning_rate": 0.0004644671132238558, "loss": 6.6026, "mean_token_accuracy": 0.1169995129108429, "num_tokens": 3137334.0, "step": 1545 }, { "entropy": 6.800655460357666, "epoch": 0.09072285630670178, "grad_norm": 0.94140625, "learning_rate": 0.00046382910184678585, "loss": 6.6777, "mean_token_accuracy": 0.10771318525075912, "num_tokens": 3147173.0, "step": 1550 }, { "entropy": 7.041066694259643, "epoch": 0.0910155106818847, "grad_norm": 1.015625, "learning_rate": 0.0004631859136245025, "loss": 6.7158, "mean_token_accuracy": 0.11159913316369056, "num_tokens": 3158377.0, "step": 1555 }, { "entropy": 6.773977136611938, "epoch": 0.0913081650570676, "grad_norm": 0.99609375, "learning_rate": 0.0004625375661903357, "loss": 6.6389, "mean_token_accuracy": 0.11442811414599419, "num_tokens": 3168126.0, "step": 1560 }, { "entropy": 6.914021968841553, "epoch": 0.09160081943225051, "grad_norm": 1.0625, "learning_rate": 0.00046188407731905787, "loss": 6.6691, "mean_token_accuracy": 0.11170838549733161, "num_tokens": 3177517.0, "step": 1565 }, { "entropy": 6.850327825546264, "epoch": 0.09189347380743342, "grad_norm": 0.93359375, "learning_rate": 0.00046122546492639643, "loss": 6.6788, "mean_token_accuracy": 0.11249028444290161, "num_tokens": 3188695.0, "step": 1570 }, { "entropy": 6.923885011672974, "epoch": 0.09218612818261633, "grad_norm": 0.90625, "learning_rate": 0.000460561747068543, "loss": 6.6452, "mean_token_accuracy": 0.11729705110192298, "num_tokens": 3199112.0, "step": 1575 }, { "entropy": 6.860661792755127, "epoch": 0.09247878255779923, "grad_norm": 0.84765625, "learning_rate": 0.0004598929419416578, "loss": 6.7081, "mean_token_accuracy": 0.11345864906907081, "num_tokens": 3210806.0, "step": 1580 }, { "entropy": 6.947086048126221, "epoch": 0.09277143693298215, "grad_norm": 1.0546875, "learning_rate": 0.00045921906788137123, "loss": 6.6775, "mean_token_accuracy": 0.11352947279810906, "num_tokens": 3220492.0, "step": 1585 }, { "entropy": 6.790587997436523, "epoch": 0.09306409130816505, "grad_norm": 1.046875, "learning_rate": 0.00045854014336228115, "loss": 6.6172, "mean_token_accuracy": 0.12552082911133766, "num_tokens": 3231181.0, "step": 1590 }, { "entropy": 6.8179422378540036, "epoch": 0.09335674568334797, "grad_norm": 0.8828125, "learning_rate": 0.00045785618699744615, "loss": 6.6511, "mean_token_accuracy": 0.11615164056420327, "num_tokens": 3241774.0, "step": 1595 }, { "entropy": 6.899714183807373, "epoch": 0.09364940005853087, "grad_norm": 0.9296875, "learning_rate": 0.00045716721753787543, "loss": 6.6428, "mean_token_accuracy": 0.12186415120959282, "num_tokens": 3252893.0, "step": 1600 }, { "entropy": 6.8200184345245365, "epoch": 0.09394205443371378, "grad_norm": 0.98046875, "learning_rate": 0.0004564732538720148, "loss": 6.7214, "mean_token_accuracy": 0.11590429842472076, "num_tokens": 3263003.0, "step": 1605 }, { "entropy": 6.955989170074463, "epoch": 0.09423470880889669, "grad_norm": 0.98828125, "learning_rate": 0.00045577431502522877, "loss": 6.7006, "mean_token_accuracy": 0.11095896661281586, "num_tokens": 3273034.0, "step": 1610 }, { "entropy": 6.817434358596802, "epoch": 0.0945273631840796, "grad_norm": 0.98828125, "learning_rate": 0.0004550704201592787, "loss": 6.5645, "mean_token_accuracy": 0.12096277251839638, "num_tokens": 3282708.0, "step": 1615 }, { "entropy": 6.91120400428772, "epoch": 0.09482001755926252, "grad_norm": 0.9921875, "learning_rate": 0.0004543615885717981, "loss": 6.707, "mean_token_accuracy": 0.11070387437939644, "num_tokens": 3293339.0, "step": 1620 }, { "entropy": 6.8873271465301515, "epoch": 0.09511267193444542, "grad_norm": 0.96484375, "learning_rate": 0.00045364783969576296, "loss": 6.5973, "mean_token_accuracy": 0.12349895909428596, "num_tokens": 3303258.0, "step": 1625 }, { "entropy": 6.879426050186157, "epoch": 0.09540532630962834, "grad_norm": 0.95703125, "learning_rate": 0.0004529291930989592, "loss": 6.6385, "mean_token_accuracy": 0.11417820826172828, "num_tokens": 3314406.0, "step": 1630 }, { "entropy": 6.76143479347229, "epoch": 0.09569798068481124, "grad_norm": 0.93359375, "learning_rate": 0.0004522056684834464, "loss": 6.6133, "mean_token_accuracy": 0.12064159885048867, "num_tokens": 3324517.0, "step": 1635 }, { "entropy": 6.818144226074219, "epoch": 0.09599063505999415, "grad_norm": 0.9296875, "learning_rate": 0.0004514772856850173, "loss": 6.6235, "mean_token_accuracy": 0.11605716720223427, "num_tokens": 3334142.0, "step": 1640 }, { "entropy": 6.8202917098999025, "epoch": 0.09628328943517706, "grad_norm": 0.90625, "learning_rate": 0.0004507440646726542, "loss": 6.5914, "mean_token_accuracy": 0.12046833410859108, "num_tokens": 3343839.0, "step": 1645 }, { "entropy": 6.864968967437744, "epoch": 0.09657594381035997, "grad_norm": 1.0234375, "learning_rate": 0.0004500060255479818, "loss": 6.565, "mean_token_accuracy": 0.11778617948293686, "num_tokens": 3353343.0, "step": 1650 }, { "entropy": 6.857561302185059, "epoch": 0.09686859818554287, "grad_norm": 0.87890625, "learning_rate": 0.0004492631885447151, "loss": 6.6513, "mean_token_accuracy": 0.10677931159734726, "num_tokens": 3363998.0, "step": 1655 }, { "entropy": 6.783181810379029, "epoch": 0.09716125256072579, "grad_norm": 0.86328125, "learning_rate": 0.00044851557402810616, "loss": 6.5557, "mean_token_accuracy": 0.12009415850043297, "num_tokens": 3373359.0, "step": 1660 }, { "entropy": 6.807691192626953, "epoch": 0.09745390693590869, "grad_norm": 0.98046875, "learning_rate": 0.00044776320249438444, "loss": 6.6102, "mean_token_accuracy": 0.11330483928322792, "num_tokens": 3383590.0, "step": 1665 }, { "entropy": 6.794376420974731, "epoch": 0.0977465613110916, "grad_norm": 0.94921875, "learning_rate": 0.00044700609457019565, "loss": 6.588, "mean_token_accuracy": 0.11675243452191353, "num_tokens": 3394698.0, "step": 1670 }, { "entropy": 6.874130582809448, "epoch": 0.09803921568627451, "grad_norm": 1.015625, "learning_rate": 0.0004462442710120359, "loss": 6.6664, "mean_token_accuracy": 0.114612428098917, "num_tokens": 3404454.0, "step": 1675 }, { "entropy": 6.797354125976563, "epoch": 0.09833187006145742, "grad_norm": 0.9765625, "learning_rate": 0.000445477752705683, "loss": 6.574, "mean_token_accuracy": 0.11949797347187996, "num_tokens": 3413759.0, "step": 1680 }, { "entropy": 6.820459985733033, "epoch": 0.09862452443664033, "grad_norm": 0.91796875, "learning_rate": 0.00044470656066562336, "loss": 6.6051, "mean_token_accuracy": 0.11495016440749169, "num_tokens": 3424824.0, "step": 1685 }, { "entropy": 6.85875768661499, "epoch": 0.09891717881182324, "grad_norm": 0.96875, "learning_rate": 0.0004439307160344765, "loss": 6.6359, "mean_token_accuracy": 0.11889533028006553, "num_tokens": 3434735.0, "step": 1690 }, { "entropy": 6.809335947036743, "epoch": 0.09920983318700614, "grad_norm": 1.03125, "learning_rate": 0.00044315024008241473, "loss": 6.5877, "mean_token_accuracy": 0.12204827964305878, "num_tokens": 3443866.0, "step": 1695 }, { "entropy": 6.801813983917237, "epoch": 0.09950248756218906, "grad_norm": 0.9140625, "learning_rate": 0.0004423651542065806, "loss": 6.6343, "mean_token_accuracy": 0.11169317811727524, "num_tokens": 3454875.0, "step": 1700 }, { "entropy": 6.84343409538269, "epoch": 0.09979514193737196, "grad_norm": 0.95703125, "learning_rate": 0.00044157547993050006, "loss": 6.5097, "mean_token_accuracy": 0.11645138636231422, "num_tokens": 3465035.0, "step": 1705 }, { "entropy": 6.770152282714844, "epoch": 0.10008779631255488, "grad_norm": 0.94921875, "learning_rate": 0.00044078123890349227, "loss": 6.5561, "mean_token_accuracy": 0.11913573890924453, "num_tokens": 3475905.0, "step": 1710 }, { "entropy": 6.872724533081055, "epoch": 0.10038045068773778, "grad_norm": 1.0234375, "learning_rate": 0.00043998245290007606, "loss": 6.6297, "mean_token_accuracy": 0.11756439507007599, "num_tokens": 3486622.0, "step": 1715 }, { "entropy": 6.7361010074615475, "epoch": 0.1006731050629207, "grad_norm": 1.015625, "learning_rate": 0.00043917914381937323, "loss": 6.5647, "mean_token_accuracy": 0.11896469891071319, "num_tokens": 3496683.0, "step": 1720 }, { "entropy": 6.839031124114991, "epoch": 0.1009657594381036, "grad_norm": 0.81640625, "learning_rate": 0.00043837133368450815, "loss": 6.5267, "mean_token_accuracy": 0.12196119725704194, "num_tokens": 3507265.0, "step": 1725 }, { "entropy": 6.790427541732788, "epoch": 0.10125841381328651, "grad_norm": 1.1171875, "learning_rate": 0.0004375590446420037, "loss": 6.5435, "mean_token_accuracy": 0.11487171053886414, "num_tokens": 3516687.0, "step": 1730 }, { "entropy": 6.776448488235474, "epoch": 0.10155106818846941, "grad_norm": 1.0234375, "learning_rate": 0.0004367422989611743, "loss": 6.586, "mean_token_accuracy": 0.11656711176037789, "num_tokens": 3526257.0, "step": 1735 }, { "entropy": 6.787727308273316, "epoch": 0.10184372256365233, "grad_norm": 0.92578125, "learning_rate": 0.0004359211190335153, "loss": 6.5154, "mean_token_accuracy": 0.1232883483171463, "num_tokens": 3536467.0, "step": 1740 }, { "entropy": 6.754599905014038, "epoch": 0.10213637693883523, "grad_norm": 0.94921875, "learning_rate": 0.00043509552737208923, "loss": 6.5504, "mean_token_accuracy": 0.1269164949655533, "num_tokens": 3546852.0, "step": 1745 }, { "entropy": 6.800959062576294, "epoch": 0.10242903131401815, "grad_norm": 0.9765625, "learning_rate": 0.00043426554661090853, "loss": 6.6378, "mean_token_accuracy": 0.11459514498710632, "num_tokens": 3557519.0, "step": 1750 }, { "entropy": 6.921309089660644, "epoch": 0.10272168568920105, "grad_norm": 1.0234375, "learning_rate": 0.00043343119950431516, "loss": 6.6225, "mean_token_accuracy": 0.11688102856278419, "num_tokens": 3567905.0, "step": 1755 }, { "entropy": 6.786648559570312, "epoch": 0.10301434006438397, "grad_norm": 0.83984375, "learning_rate": 0.00043259250892635644, "loss": 6.5817, "mean_token_accuracy": 0.1215607538819313, "num_tokens": 3579529.0, "step": 1760 }, { "entropy": 6.802842855453491, "epoch": 0.10330699443956687, "grad_norm": 0.98828125, "learning_rate": 0.0004317494978701582, "loss": 6.5018, "mean_token_accuracy": 0.12014774978160858, "num_tokens": 3589075.0, "step": 1765 }, { "entropy": 6.729494094848633, "epoch": 0.10359964881474978, "grad_norm": 0.97265625, "learning_rate": 0.0004309021894472943, "loss": 6.5588, "mean_token_accuracy": 0.11801389381289482, "num_tokens": 3599093.0, "step": 1770 }, { "entropy": 6.733899641036987, "epoch": 0.10389230318993269, "grad_norm": 0.9453125, "learning_rate": 0.0004300506068871534, "loss": 6.5143, "mean_token_accuracy": 0.11827743500471115, "num_tokens": 3609587.0, "step": 1775 }, { "entropy": 6.725184535980224, "epoch": 0.1041849575651156, "grad_norm": 0.953125, "learning_rate": 0.00042919477353630135, "loss": 6.6055, "mean_token_accuracy": 0.11462670415639878, "num_tokens": 3620228.0, "step": 1780 }, { "entropy": 6.799921178817749, "epoch": 0.1044776119402985, "grad_norm": 0.921875, "learning_rate": 0.000428334712857842, "loss": 6.5223, "mean_token_accuracy": 0.12408804297447204, "num_tokens": 3630093.0, "step": 1785 }, { "entropy": 6.7759123802185055, "epoch": 0.10477026631548142, "grad_norm": 0.984375, "learning_rate": 0.00042747044843077304, "loss": 6.566, "mean_token_accuracy": 0.11505624055862426, "num_tokens": 3640405.0, "step": 1790 }, { "entropy": 6.689677095413208, "epoch": 0.10506292069066432, "grad_norm": 0.953125, "learning_rate": 0.00042660200394934047, "loss": 6.4802, "mean_token_accuracy": 0.11899327635765075, "num_tokens": 3651001.0, "step": 1795 }, { "entropy": 6.871759557723999, "epoch": 0.10535557506584724, "grad_norm": 0.9296875, "learning_rate": 0.00042572940322238844, "loss": 6.5688, "mean_token_accuracy": 0.12120393961668015, "num_tokens": 3661024.0, "step": 1800 }, { "entropy": 6.759112310409546, "epoch": 0.10564822944103014, "grad_norm": 0.8984375, "learning_rate": 0.00042485267017270664, "loss": 6.5589, "mean_token_accuracy": 0.11904018670320511, "num_tokens": 3671271.0, "step": 1805 }, { "entropy": 6.795577955245972, "epoch": 0.10594088381621306, "grad_norm": 0.88671875, "learning_rate": 0.0004239718288363745, "loss": 6.5798, "mean_token_accuracy": 0.11667552590370178, "num_tokens": 3682569.0, "step": 1810 }, { "entropy": 6.818081903457641, "epoch": 0.10623353819139596, "grad_norm": 1.0703125, "learning_rate": 0.0004230869033621023, "loss": 6.5103, "mean_token_accuracy": 0.12421332746744156, "num_tokens": 3692056.0, "step": 1815 }, { "entropy": 6.755850028991699, "epoch": 0.10652619256657887, "grad_norm": 0.984375, "learning_rate": 0.0004221979180105688, "loss": 6.5716, "mean_token_accuracy": 0.11862044930458068, "num_tokens": 3701828.0, "step": 1820 }, { "entropy": 6.827340888977051, "epoch": 0.10681884694176177, "grad_norm": 1.03125, "learning_rate": 0.00042130489715375645, "loss": 6.5095, "mean_token_accuracy": 0.1277923844754696, "num_tokens": 3711831.0, "step": 1825 }, { "entropy": 6.734691381454468, "epoch": 0.10711150131694469, "grad_norm": 1.0, "learning_rate": 0.00042040786527428335, "loss": 6.5942, "mean_token_accuracy": 0.11365615352988243, "num_tokens": 3722381.0, "step": 1830 }, { "entropy": 6.749592113494873, "epoch": 0.10740415569212759, "grad_norm": 0.91796875, "learning_rate": 0.0004195068469647315, "loss": 6.4872, "mean_token_accuracy": 0.1262812778353691, "num_tokens": 3732918.0, "step": 1835 }, { "entropy": 6.7778829574584964, "epoch": 0.10769681006731051, "grad_norm": 0.9375, "learning_rate": 0.00041860186692697297, "loss": 6.4948, "mean_token_accuracy": 0.12678161934018134, "num_tokens": 3743721.0, "step": 1840 }, { "entropy": 6.763736152648926, "epoch": 0.10798946444249341, "grad_norm": 0.96484375, "learning_rate": 0.00041769294997149264, "loss": 6.5414, "mean_token_accuracy": 0.11694241538643838, "num_tokens": 3754341.0, "step": 1845 }, { "entropy": 6.701714754104614, "epoch": 0.10828211881767633, "grad_norm": 0.890625, "learning_rate": 0.0004167801210167081, "loss": 6.5124, "mean_token_accuracy": 0.12937195897102355, "num_tokens": 3764461.0, "step": 1850 }, { "entropy": 6.889769124984741, "epoch": 0.10857477319285923, "grad_norm": 1.046875, "learning_rate": 0.0004158634050882861, "loss": 6.5552, "mean_token_accuracy": 0.12245087251067162, "num_tokens": 3774748.0, "step": 1855 }, { "entropy": 6.711971855163574, "epoch": 0.10886742756804214, "grad_norm": 1.0234375, "learning_rate": 0.0004149428273184569, "loss": 6.52, "mean_token_accuracy": 0.11850636452436447, "num_tokens": 3785444.0, "step": 1860 }, { "entropy": 6.649656295776367, "epoch": 0.10916008194322505, "grad_norm": 0.8671875, "learning_rate": 0.0004140184129453253, "loss": 6.4921, "mean_token_accuracy": 0.12511781528592109, "num_tokens": 3796097.0, "step": 1865 }, { "entropy": 6.758572959899903, "epoch": 0.10945273631840796, "grad_norm": 0.98828125, "learning_rate": 0.000413090187312178, "loss": 6.4889, "mean_token_accuracy": 0.12226529717445374, "num_tokens": 3806769.0, "step": 1870 }, { "entropy": 6.712545776367188, "epoch": 0.10974539069359086, "grad_norm": 0.90234375, "learning_rate": 0.0004121581758667898, "loss": 6.4858, "mean_token_accuracy": 0.12765528708696366, "num_tokens": 3816576.0, "step": 1875 }, { "entropy": 6.749814748764038, "epoch": 0.11003804506877378, "grad_norm": 0.85546875, "learning_rate": 0.00041122240416072533, "loss": 6.4622, "mean_token_accuracy": 0.12702202945947647, "num_tokens": 3826679.0, "step": 1880 }, { "entropy": 6.743882846832276, "epoch": 0.11033069944395668, "grad_norm": 0.890625, "learning_rate": 0.0004102828978486385, "loss": 6.4963, "mean_token_accuracy": 0.12285473719239234, "num_tokens": 3837511.0, "step": 1885 }, { "entropy": 6.729692125320435, "epoch": 0.1106233538191396, "grad_norm": 0.828125, "learning_rate": 0.0004093396826875695, "loss": 6.4645, "mean_token_accuracy": 0.11870746538043023, "num_tokens": 3847929.0, "step": 1890 }, { "entropy": 6.790079021453858, "epoch": 0.1109160081943225, "grad_norm": 1.0078125, "learning_rate": 0.00040839278453623837, "loss": 6.5163, "mean_token_accuracy": 0.12360096871852874, "num_tokens": 3857460.0, "step": 1895 }, { "entropy": 6.764287281036377, "epoch": 0.11120866256950541, "grad_norm": 0.89453125, "learning_rate": 0.0004074422293543363, "loss": 6.4899, "mean_token_accuracy": 0.12144630774855614, "num_tokens": 3868593.0, "step": 1900 }, { "entropy": 6.628063678741455, "epoch": 0.11150131694468832, "grad_norm": 1.015625, "learning_rate": 0.0004064880432018137, "loss": 6.4806, "mean_token_accuracy": 0.12284271195530891, "num_tokens": 3879316.0, "step": 1905 }, { "entropy": 6.735889911651611, "epoch": 0.11179397131987123, "grad_norm": 1.015625, "learning_rate": 0.00040553025223816615, "loss": 6.4028, "mean_token_accuracy": 0.12710621505975722, "num_tokens": 3888659.0, "step": 1910 }, { "entropy": 6.699985361099243, "epoch": 0.11208662569505413, "grad_norm": 1.0078125, "learning_rate": 0.00040456888272171653, "loss": 6.4641, "mean_token_accuracy": 0.11733812615275382, "num_tokens": 3899524.0, "step": 1915 }, { "entropy": 6.791746997833252, "epoch": 0.11237928007023705, "grad_norm": 0.87890625, "learning_rate": 0.00040360396100889577, "loss": 6.5622, "mean_token_accuracy": 0.11920542642474174, "num_tokens": 3910600.0, "step": 1920 }, { "entropy": 6.747242450714111, "epoch": 0.11267193444541995, "grad_norm": 0.984375, "learning_rate": 0.0004026355135535202, "loss": 6.5661, "mean_token_accuracy": 0.11491762548685074, "num_tokens": 3920779.0, "step": 1925 }, { "entropy": 6.702474117279053, "epoch": 0.11296458882060287, "grad_norm": 0.88671875, "learning_rate": 0.000401663566906066, "loss": 6.5071, "mean_token_accuracy": 0.11863285824656486, "num_tokens": 3930966.0, "step": 1930 }, { "entropy": 6.712709712982178, "epoch": 0.11325724319578578, "grad_norm": 0.95703125, "learning_rate": 0.00040068814771294134, "loss": 6.4858, "mean_token_accuracy": 0.1253066875040531, "num_tokens": 3941846.0, "step": 1935 }, { "entropy": 6.730831480026245, "epoch": 0.11354989757096869, "grad_norm": 0.984375, "learning_rate": 0.0003997092827157562, "loss": 6.5528, "mean_token_accuracy": 0.11424804329872132, "num_tokens": 3952029.0, "step": 1940 }, { "entropy": 6.798965406417847, "epoch": 0.1138425519461516, "grad_norm": 0.98828125, "learning_rate": 0.000398726998750589, "loss": 6.4762, "mean_token_accuracy": 0.1260433167219162, "num_tokens": 3962378.0, "step": 1945 }, { "entropy": 6.653168725967407, "epoch": 0.1141352063213345, "grad_norm": 0.95703125, "learning_rate": 0.00039774132274725076, "loss": 6.4222, "mean_token_accuracy": 0.13140382021665573, "num_tokens": 3972516.0, "step": 1950 }, { "entropy": 6.758973932266235, "epoch": 0.11442786069651742, "grad_norm": 0.9453125, "learning_rate": 0.00039675228172854707, "loss": 6.4358, "mean_token_accuracy": 0.13106181994080543, "num_tokens": 3982018.0, "step": 1955 }, { "entropy": 6.694025945663452, "epoch": 0.11472051507170032, "grad_norm": 0.953125, "learning_rate": 0.0003957599028095371, "loss": 6.4309, "mean_token_accuracy": 0.127551356703043, "num_tokens": 3991392.0, "step": 1960 }, { "entropy": 6.713197708129883, "epoch": 0.11501316944688324, "grad_norm": 0.9609375, "learning_rate": 0.00039476421319679017, "loss": 6.572, "mean_token_accuracy": 0.120946604013443, "num_tokens": 4001840.0, "step": 1965 }, { "entropy": 6.7711381912231445, "epoch": 0.11530582382206614, "grad_norm": 1.015625, "learning_rate": 0.00039376524018764, "loss": 6.4604, "mean_token_accuracy": 0.12467103376984597, "num_tokens": 4012352.0, "step": 1970 }, { "entropy": 6.632588720321655, "epoch": 0.11559847819724905, "grad_norm": 0.85546875, "learning_rate": 0.00039276301116943616, "loss": 6.4884, "mean_token_accuracy": 0.12170003205537797, "num_tokens": 4023696.0, "step": 1975 }, { "entropy": 6.738251638412476, "epoch": 0.11589113257243196, "grad_norm": 1.0, "learning_rate": 0.0003917575536187936, "loss": 6.4447, "mean_token_accuracy": 0.12842353954911231, "num_tokens": 4033293.0, "step": 1980 }, { "entropy": 6.665024137496948, "epoch": 0.11618378694761487, "grad_norm": 1.03125, "learning_rate": 0.00039074889510083894, "loss": 6.4416, "mean_token_accuracy": 0.13035320565104486, "num_tokens": 4042690.0, "step": 1985 }, { "entropy": 6.68208417892456, "epoch": 0.11647644132279777, "grad_norm": 1.0078125, "learning_rate": 0.00038973706326845495, "loss": 6.3884, "mean_token_accuracy": 0.12777606695890426, "num_tokens": 4053114.0, "step": 1990 }, { "entropy": 6.640972328186035, "epoch": 0.11676909569798069, "grad_norm": 0.9609375, "learning_rate": 0.0003887220858615225, "loss": 6.5054, "mean_token_accuracy": 0.11883352771401405, "num_tokens": 4063354.0, "step": 1995 }, { "entropy": 6.789265394210815, "epoch": 0.11706175007316359, "grad_norm": 0.8671875, "learning_rate": 0.0003877039907061597, "loss": 6.5019, "mean_token_accuracy": 0.1184429682791233, "num_tokens": 4073376.0, "step": 2000 }, { "entropy": 6.689146900177002, "epoch": 0.11735440444834651, "grad_norm": 1.03125, "learning_rate": 0.0003866828057139598, "loss": 6.5813, "mean_token_accuracy": 0.11173970699310302, "num_tokens": 4084980.0, "step": 2005 }, { "entropy": 6.754443883895874, "epoch": 0.11764705882352941, "grad_norm": 0.9921875, "learning_rate": 0.00038565855888122503, "loss": 6.4852, "mean_token_accuracy": 0.12186115011572837, "num_tokens": 4094011.0, "step": 2010 }, { "entropy": 6.764962863922119, "epoch": 0.11793971319871233, "grad_norm": 0.9296875, "learning_rate": 0.00038463127828819975, "loss": 6.5133, "mean_token_accuracy": 0.12561107128858567, "num_tokens": 4104993.0, "step": 2015 }, { "entropy": 6.692309808731079, "epoch": 0.11823236757389523, "grad_norm": 0.87109375, "learning_rate": 0.00038360099209830043, "loss": 6.4687, "mean_token_accuracy": 0.12259510681033134, "num_tokens": 4115639.0, "step": 2020 }, { "entropy": 6.732027530670166, "epoch": 0.11852502194907814, "grad_norm": 0.87890625, "learning_rate": 0.0003825677285573433, "loss": 6.4135, "mean_token_accuracy": 0.1265033908188343, "num_tokens": 4125787.0, "step": 2025 }, { "entropy": 6.63936071395874, "epoch": 0.11881767632426105, "grad_norm": 0.90234375, "learning_rate": 0.00038153151599277027, "loss": 6.4485, "mean_token_accuracy": 0.12343809232115746, "num_tokens": 4136375.0, "step": 2030 }, { "entropy": 6.671218156814575, "epoch": 0.11911033069944396, "grad_norm": 0.94921875, "learning_rate": 0.0003804923828128723, "loss": 6.4971, "mean_token_accuracy": 0.12380525693297387, "num_tokens": 4146380.0, "step": 2035 }, { "entropy": 6.698442792892456, "epoch": 0.11940298507462686, "grad_norm": 1.0078125, "learning_rate": 0.0003794503575060104, "loss": 6.4711, "mean_token_accuracy": 0.13062296956777572, "num_tokens": 4157131.0, "step": 2040 }, { "entropy": 6.722663831710816, "epoch": 0.11969563944980978, "grad_norm": 0.94921875, "learning_rate": 0.00037840546863983484, "loss": 6.4323, "mean_token_accuracy": 0.12796600833535193, "num_tokens": 4167104.0, "step": 2045 }, { "entropy": 6.761295175552368, "epoch": 0.11998829382499268, "grad_norm": 0.86328125, "learning_rate": 0.0003773577448605015, "loss": 6.4976, "mean_token_accuracy": 0.12016392797231674, "num_tokens": 4176862.0, "step": 2050 }, { "entropy": 6.666880655288696, "epoch": 0.1202809482001756, "grad_norm": 0.97265625, "learning_rate": 0.0003763072148918872, "loss": 6.3807, "mean_token_accuracy": 0.12986320927739142, "num_tokens": 4186019.0, "step": 2055 }, { "entropy": 6.699233484268189, "epoch": 0.1205736025753585, "grad_norm": 0.859375, "learning_rate": 0.0003752539075348017, "loss": 6.4914, "mean_token_accuracy": 0.12515649795532227, "num_tokens": 4196513.0, "step": 2060 }, { "entropy": 6.700495195388794, "epoch": 0.12086625695054141, "grad_norm": 0.88671875, "learning_rate": 0.00037419785166619817, "loss": 6.4784, "mean_token_accuracy": 0.12092648595571517, "num_tokens": 4207726.0, "step": 2065 }, { "entropy": 6.755660200119019, "epoch": 0.12115891132572432, "grad_norm": 0.8828125, "learning_rate": 0.0003731390762383818, "loss": 6.4877, "mean_token_accuracy": 0.12109851315617562, "num_tokens": 4217953.0, "step": 2070 }, { "entropy": 6.691427946090698, "epoch": 0.12145156570090723, "grad_norm": 0.94921875, "learning_rate": 0.0003720776102782158, "loss": 6.3912, "mean_token_accuracy": 0.12726705223321916, "num_tokens": 4227353.0, "step": 2075 }, { "entropy": 6.64779372215271, "epoch": 0.12174422007609013, "grad_norm": 1.0078125, "learning_rate": 0.00037101348288632555, "loss": 6.3456, "mean_token_accuracy": 0.13620738610625266, "num_tokens": 4237336.0, "step": 2080 }, { "entropy": 6.6663731098175045, "epoch": 0.12203687445127305, "grad_norm": 1.0078125, "learning_rate": 0.0003699467232363012, "loss": 6.4713, "mean_token_accuracy": 0.12634024024009705, "num_tokens": 4246768.0, "step": 2085 }, { "entropy": 6.781217622756958, "epoch": 0.12232952882645595, "grad_norm": 0.8828125, "learning_rate": 0.0003688773605738973, "loss": 6.387, "mean_token_accuracy": 0.12766596376895906, "num_tokens": 4256796.0, "step": 2090 }, { "entropy": 6.582059717178344, "epoch": 0.12262218320163887, "grad_norm": 1.0, "learning_rate": 0.00036780542421623134, "loss": 6.3327, "mean_token_accuracy": 0.14140671789646148, "num_tokens": 4265976.0, "step": 2095 }, { "entropy": 6.673408889770508, "epoch": 0.12291483757682177, "grad_norm": 0.95703125, "learning_rate": 0.0003667309435509802, "loss": 6.3816, "mean_token_accuracy": 0.1286499671638012, "num_tokens": 4275680.0, "step": 2100 }, { "entropy": 6.718602418899536, "epoch": 0.12320749195200469, "grad_norm": 0.93359375, "learning_rate": 0.0003656539480355741, "loss": 6.3998, "mean_token_accuracy": 0.1262201152741909, "num_tokens": 4285855.0, "step": 2105 }, { "entropy": 6.626631402969361, "epoch": 0.12350014632718759, "grad_norm": 0.9375, "learning_rate": 0.0003645744671963891, "loss": 6.4822, "mean_token_accuracy": 0.12650331631302833, "num_tokens": 4295939.0, "step": 2110 }, { "entropy": 6.623495578765869, "epoch": 0.1237928007023705, "grad_norm": 0.9921875, "learning_rate": 0.0003634925306279376, "loss": 6.3456, "mean_token_accuracy": 0.13147402703762054, "num_tokens": 4305457.0, "step": 2115 }, { "entropy": 6.6712672233581545, "epoch": 0.1240854550775534, "grad_norm": 1.015625, "learning_rate": 0.0003624081679920574, "loss": 6.4646, "mean_token_accuracy": 0.12995418161153793, "num_tokens": 4316447.0, "step": 2120 }, { "entropy": 6.725176286697388, "epoch": 0.12437810945273632, "grad_norm": 1.1484375, "learning_rate": 0.0003613214090170977, "loss": 6.4656, "mean_token_accuracy": 0.1237868271768093, "num_tokens": 4327063.0, "step": 2125 }, { "entropy": 6.730049705505371, "epoch": 0.12467076382791922, "grad_norm": 0.92578125, "learning_rate": 0.0003602322834971048, "loss": 6.4396, "mean_token_accuracy": 0.12165140211582184, "num_tokens": 4337226.0, "step": 2130 }, { "entropy": 6.66084623336792, "epoch": 0.12496341820310214, "grad_norm": 0.9921875, "learning_rate": 0.0003591408212910051, "loss": 6.4564, "mean_token_accuracy": 0.1257864184677601, "num_tokens": 4348076.0, "step": 2135 }, { "entropy": 6.652794361114502, "epoch": 0.12525607257828505, "grad_norm": 0.98828125, "learning_rate": 0.0003580470523217863, "loss": 6.4184, "mean_token_accuracy": 0.12144943475723266, "num_tokens": 4358259.0, "step": 2140 }, { "entropy": 6.76425518989563, "epoch": 0.12554872695346794, "grad_norm": 0.82421875, "learning_rate": 0.0003569510065756771, "loss": 6.4281, "mean_token_accuracy": 0.12907697334885598, "num_tokens": 4369058.0, "step": 2145 }, { "entropy": 6.601361560821533, "epoch": 0.12584138132865086, "grad_norm": 0.90234375, "learning_rate": 0.0003558527141013254, "loss": 6.3483, "mean_token_accuracy": 0.1359138384461403, "num_tokens": 4380135.0, "step": 2150 }, { "entropy": 6.653647613525391, "epoch": 0.12613403570383377, "grad_norm": 0.8984375, "learning_rate": 0.0003547522050089742, "loss": 6.388, "mean_token_accuracy": 0.1273554138839245, "num_tokens": 4389998.0, "step": 2155 }, { "entropy": 6.646863889694214, "epoch": 0.1264266900790167, "grad_norm": 0.8828125, "learning_rate": 0.00035364950946963606, "loss": 6.392, "mean_token_accuracy": 0.12970071211457251, "num_tokens": 4400677.0, "step": 2160 }, { "entropy": 6.700640773773193, "epoch": 0.12671934445419958, "grad_norm": 0.96484375, "learning_rate": 0.0003525446577142663, "loss": 6.3826, "mean_token_accuracy": 0.12550389319658278, "num_tokens": 4410491.0, "step": 2165 }, { "entropy": 6.686038970947266, "epoch": 0.1270119988293825, "grad_norm": 0.8515625, "learning_rate": 0.00035143768003293395, "loss": 6.3873, "mean_token_accuracy": 0.13036831542849542, "num_tokens": 4420367.0, "step": 2170 }, { "entropy": 6.635172033309937, "epoch": 0.1273046532045654, "grad_norm": 0.9296875, "learning_rate": 0.0003503286067739913, "loss": 6.3343, "mean_token_accuracy": 0.13271640241146088, "num_tokens": 4430499.0, "step": 2175 }, { "entropy": 6.688625764846802, "epoch": 0.12759730757974833, "grad_norm": 0.89453125, "learning_rate": 0.00034921746834324193, "loss": 6.3599, "mean_token_accuracy": 0.12575160786509515, "num_tokens": 4440667.0, "step": 2180 }, { "entropy": 6.673585891723633, "epoch": 0.12788996195493121, "grad_norm": 0.97265625, "learning_rate": 0.0003481042952031072, "loss": 6.4517, "mean_token_accuracy": 0.12898295149207115, "num_tokens": 4450598.0, "step": 2185 }, { "entropy": 6.696045923233032, "epoch": 0.12818261633011413, "grad_norm": 1.015625, "learning_rate": 0.0003469891178717911, "loss": 6.3704, "mean_token_accuracy": 0.1302775613963604, "num_tokens": 4460644.0, "step": 2190 }, { "entropy": 6.598845100402832, "epoch": 0.12847527070529705, "grad_norm": 1.0234375, "learning_rate": 0.0003458719669224436, "loss": 6.4408, "mean_token_accuracy": 0.12747587859630585, "num_tokens": 4470315.0, "step": 2195 }, { "entropy": 6.643047237396241, "epoch": 0.12876792508047996, "grad_norm": 0.95703125, "learning_rate": 0.0003447528729823221, "loss": 6.3008, "mean_token_accuracy": 0.13260431662201883, "num_tokens": 4480444.0, "step": 2200 }, { "entropy": 6.643319511413575, "epoch": 0.12906057945566285, "grad_norm": 0.97265625, "learning_rate": 0.0003436318667319525, "loss": 6.2865, "mean_token_accuracy": 0.13138291835784913, "num_tokens": 4490826.0, "step": 2205 }, { "entropy": 6.563979387283325, "epoch": 0.12935323383084577, "grad_norm": 0.96875, "learning_rate": 0.00034250897890428716, "loss": 6.3393, "mean_token_accuracy": 0.13606738969683646, "num_tokens": 4500534.0, "step": 2210 }, { "entropy": 6.6366644382476805, "epoch": 0.12964588820602868, "grad_norm": 0.9453125, "learning_rate": 0.0003413842402838633, "loss": 6.2993, "mean_token_accuracy": 0.13520264625549316, "num_tokens": 4510407.0, "step": 2215 }, { "entropy": 6.623635864257812, "epoch": 0.1299385425812116, "grad_norm": 1.0234375, "learning_rate": 0.00034025768170595834, "loss": 6.3841, "mean_token_accuracy": 0.13335896357893945, "num_tokens": 4519562.0, "step": 2220 }, { "entropy": 6.692249965667725, "epoch": 0.13023119695639448, "grad_norm": 0.8515625, "learning_rate": 0.0003391293340557446, "loss": 6.2956, "mean_token_accuracy": 0.13522055745124817, "num_tokens": 4530044.0, "step": 2225 }, { "entropy": 6.676627492904663, "epoch": 0.1305238513315774, "grad_norm": 1.03125, "learning_rate": 0.0003379992282674431, "loss": 6.3683, "mean_token_accuracy": 0.13091277852654457, "num_tokens": 4539910.0, "step": 2230 }, { "entropy": 6.616313171386719, "epoch": 0.13081650570676032, "grad_norm": 1.0078125, "learning_rate": 0.0003368673953234749, "loss": 6.4038, "mean_token_accuracy": 0.1315946489572525, "num_tokens": 4549054.0, "step": 2235 }, { "entropy": 6.638192558288575, "epoch": 0.13110916008194323, "grad_norm": 0.91015625, "learning_rate": 0.00033573386625361176, "loss": 6.5186, "mean_token_accuracy": 0.12304450571537018, "num_tokens": 4561420.0, "step": 2240 }, { "entropy": 6.724251842498779, "epoch": 0.13140181445712612, "grad_norm": 0.97265625, "learning_rate": 0.00033459867213412567, "loss": 6.4011, "mean_token_accuracy": 0.12729023545980453, "num_tokens": 4572249.0, "step": 2245 }, { "entropy": 6.636874341964722, "epoch": 0.13169446883230904, "grad_norm": 0.90234375, "learning_rate": 0.000333461844086937, "loss": 6.3486, "mean_token_accuracy": 0.13104709312319757, "num_tokens": 4582365.0, "step": 2250 }, { "entropy": 6.630363035202026, "epoch": 0.13198712320749195, "grad_norm": 0.91015625, "learning_rate": 0.00033232341327876097, "loss": 6.352, "mean_token_accuracy": 0.13636366948485373, "num_tokens": 4592518.0, "step": 2255 }, { "entropy": 6.620830345153808, "epoch": 0.13227977758267487, "grad_norm": 0.9140625, "learning_rate": 0.0003311834109202531, "loss": 6.4375, "mean_token_accuracy": 0.1285679928958416, "num_tokens": 4603405.0, "step": 2260 }, { "entropy": 6.591335248947144, "epoch": 0.13257243195785778, "grad_norm": 0.9765625, "learning_rate": 0.00033004186826515416, "loss": 6.3024, "mean_token_accuracy": 0.1358066976070404, "num_tokens": 4613134.0, "step": 2265 }, { "entropy": 6.6046994686126705, "epoch": 0.13286508633304067, "grad_norm": 1.015625, "learning_rate": 0.0003288988166094324, "loss": 6.307, "mean_token_accuracy": 0.134018661826849, "num_tokens": 4622769.0, "step": 2270 }, { "entropy": 6.6116033554077145, "epoch": 0.1331577407082236, "grad_norm": 0.92578125, "learning_rate": 0.00032775428729042656, "loss": 6.3069, "mean_token_accuracy": 0.13382299169898032, "num_tokens": 4632344.0, "step": 2275 }, { "entropy": 6.6585752964019775, "epoch": 0.1334503950834065, "grad_norm": 1.0625, "learning_rate": 0.000326608311685986, "loss": 6.3437, "mean_token_accuracy": 0.1316613644361496, "num_tokens": 4642336.0, "step": 2280 }, { "entropy": 6.593194913864136, "epoch": 0.13374304945858942, "grad_norm": 1.0390625, "learning_rate": 0.0003254609212136108, "loss": 6.3105, "mean_token_accuracy": 0.12656986117362976, "num_tokens": 4651292.0, "step": 2285 }, { "entropy": 6.609660530090332, "epoch": 0.1340357038337723, "grad_norm": 1.015625, "learning_rate": 0.00032431214732959036, "loss": 6.3466, "mean_token_accuracy": 0.12910948917269707, "num_tokens": 4661583.0, "step": 2290 }, { "entropy": 6.617812919616699, "epoch": 0.13432835820895522, "grad_norm": 1.0078125, "learning_rate": 0.000323162021528141, "loss": 6.354, "mean_token_accuracy": 0.12989597618579865, "num_tokens": 4672135.0, "step": 2295 }, { "entropy": 6.647702980041504, "epoch": 0.13462101258413814, "grad_norm": 0.9609375, "learning_rate": 0.00032201057534054264, "loss": 6.3766, "mean_token_accuracy": 0.12548863440752028, "num_tokens": 4682642.0, "step": 2300 }, { "entropy": 6.598292827606201, "epoch": 0.13491366695932105, "grad_norm": 0.94140625, "learning_rate": 0.00032085784033427414, "loss": 6.312, "mean_token_accuracy": 0.12743351757526397, "num_tokens": 4692265.0, "step": 2305 }, { "entropy": 6.580078792572022, "epoch": 0.13520632133450394, "grad_norm": 0.96875, "learning_rate": 0.0003197038481121478, "loss": 6.3324, "mean_token_accuracy": 0.13632925152778624, "num_tokens": 4701612.0, "step": 2310 }, { "entropy": 6.645194482803345, "epoch": 0.13549897570968686, "grad_norm": 0.90234375, "learning_rate": 0.0003185486303114436, "loss": 6.3568, "mean_token_accuracy": 0.1304594896733761, "num_tokens": 4712510.0, "step": 2315 }, { "entropy": 6.665656805038452, "epoch": 0.13579163008486977, "grad_norm": 0.88671875, "learning_rate": 0.0003173922186030409, "loss": 6.3915, "mean_token_accuracy": 0.1305775336921215, "num_tokens": 4724519.0, "step": 2320 }, { "entropy": 6.617322015762329, "epoch": 0.1360842844600527, "grad_norm": 0.9375, "learning_rate": 0.000316234644690551, "loss": 6.2818, "mean_token_accuracy": 0.1356732003390789, "num_tokens": 4735481.0, "step": 2325 }, { "entropy": 6.591895818710327, "epoch": 0.13637693883523558, "grad_norm": 0.99609375, "learning_rate": 0.0003150759403094473, "loss": 6.3447, "mean_token_accuracy": 0.1303927145898342, "num_tokens": 4746407.0, "step": 2330 }, { "entropy": 6.515862989425659, "epoch": 0.1366695932104185, "grad_norm": 1.0, "learning_rate": 0.00031391613722619587, "loss": 6.2192, "mean_token_accuracy": 0.1439518079161644, "num_tokens": 4755235.0, "step": 2335 }, { "entropy": 6.681423616409302, "epoch": 0.1369622475856014, "grad_norm": 0.9609375, "learning_rate": 0.000312755267237384, "loss": 6.3683, "mean_token_accuracy": 0.12859276309609413, "num_tokens": 4765490.0, "step": 2340 }, { "entropy": 6.6373199939727785, "epoch": 0.13725490196078433, "grad_norm": 0.94921875, "learning_rate": 0.0003115933621688488, "loss": 6.3857, "mean_token_accuracy": 0.13260382413864136, "num_tokens": 4775738.0, "step": 2345 }, { "entropy": 6.616128015518188, "epoch": 0.1375475563359672, "grad_norm": 0.99609375, "learning_rate": 0.00031043045387480487, "loss": 6.3049, "mean_token_accuracy": 0.12710103169083595, "num_tokens": 4786101.0, "step": 2350 }, { "entropy": 6.654890298843384, "epoch": 0.13784021071115013, "grad_norm": 0.984375, "learning_rate": 0.0003092665742369703, "loss": 6.4225, "mean_token_accuracy": 0.12488598376512527, "num_tokens": 4797083.0, "step": 2355 }, { "entropy": 6.519471883773804, "epoch": 0.13813286508633305, "grad_norm": 1.09375, "learning_rate": 0.00030810175516369343, "loss": 6.2972, "mean_token_accuracy": 0.13746514022350312, "num_tokens": 4806979.0, "step": 2360 }, { "entropy": 6.597585725784302, "epoch": 0.13842551946151596, "grad_norm": 0.89453125, "learning_rate": 0.0003069360285890775, "loss": 6.3586, "mean_token_accuracy": 0.1265510566532612, "num_tokens": 4817456.0, "step": 2365 }, { "entropy": 6.688738584518433, "epoch": 0.13871817383669885, "grad_norm": 1.0078125, "learning_rate": 0.00030576942647210547, "loss": 6.3485, "mean_token_accuracy": 0.13092773035168648, "num_tokens": 4829162.0, "step": 2370 }, { "entropy": 6.649426746368408, "epoch": 0.13901082821188177, "grad_norm": 1.0390625, "learning_rate": 0.00030460198079576355, "loss": 6.3262, "mean_token_accuracy": 0.13880319520831108, "num_tokens": 4840018.0, "step": 2375 }, { "entropy": 6.541487836837769, "epoch": 0.13930348258706468, "grad_norm": 1.0703125, "learning_rate": 0.0003034337235661648, "loss": 6.2363, "mean_token_accuracy": 0.13673475831747056, "num_tokens": 4849839.0, "step": 2380 }, { "entropy": 6.580998754501342, "epoch": 0.1395961369622476, "grad_norm": 0.96875, "learning_rate": 0.0003022646868116714, "loss": 6.3949, "mean_token_accuracy": 0.12793906554579734, "num_tokens": 4860300.0, "step": 2385 }, { "entropy": 6.703210926055908, "epoch": 0.13988879133743048, "grad_norm": 0.98828125, "learning_rate": 0.0003010949025820163, "loss": 6.3304, "mean_token_accuracy": 0.13649305254220961, "num_tokens": 4870237.0, "step": 2390 }, { "entropy": 6.590689945220947, "epoch": 0.1401814457126134, "grad_norm": 0.95703125, "learning_rate": 0.0002999244029474252, "loss": 6.4002, "mean_token_accuracy": 0.12530083060264588, "num_tokens": 4879954.0, "step": 2395 }, { "entropy": 6.548434066772461, "epoch": 0.14047410008779632, "grad_norm": 0.90625, "learning_rate": 0.00029875321999773684, "loss": 6.3316, "mean_token_accuracy": 0.133211962133646, "num_tokens": 4890297.0, "step": 2400 }, { "entropy": 6.679122495651245, "epoch": 0.14076675446297923, "grad_norm": 0.9296875, "learning_rate": 0.00029758138584152333, "loss": 6.2794, "mean_token_accuracy": 0.1352786011993885, "num_tokens": 4900429.0, "step": 2405 }, { "entropy": 6.608310890197754, "epoch": 0.14105940883816212, "grad_norm": 0.99609375, "learning_rate": 0.0002964089326052102, "loss": 6.277, "mean_token_accuracy": 0.13714320510625838, "num_tokens": 4910553.0, "step": 2410 }, { "entropy": 6.568372774124145, "epoch": 0.14135206321334504, "grad_norm": 0.96484375, "learning_rate": 0.0002952358924321949, "loss": 6.2367, "mean_token_accuracy": 0.13472286239266396, "num_tokens": 4920983.0, "step": 2415 }, { "entropy": 6.563381004333496, "epoch": 0.14164471758852795, "grad_norm": 0.9375, "learning_rate": 0.00029406229748196657, "loss": 6.365, "mean_token_accuracy": 0.12762125134468078, "num_tokens": 4932438.0, "step": 2420 }, { "entropy": 6.704500579833985, "epoch": 0.14193737196371087, "grad_norm": 1.0625, "learning_rate": 0.0002928881799292235, "loss": 6.2754, "mean_token_accuracy": 0.1386060632765293, "num_tokens": 4942239.0, "step": 2425 }, { "entropy": 6.550548553466797, "epoch": 0.14223002633889376, "grad_norm": 1.0078125, "learning_rate": 0.00029171357196299154, "loss": 6.3056, "mean_token_accuracy": 0.132572952657938, "num_tokens": 4951893.0, "step": 2430 }, { "entropy": 6.663923120498657, "epoch": 0.14252268071407667, "grad_norm": 0.96484375, "learning_rate": 0.0002905385057857414, "loss": 6.3186, "mean_token_accuracy": 0.1256115861237049, "num_tokens": 4961873.0, "step": 2435 }, { "entropy": 6.5535320281982425, "epoch": 0.1428153350892596, "grad_norm": 0.89453125, "learning_rate": 0.0002893630136125058, "loss": 6.2192, "mean_token_accuracy": 0.14415578544139862, "num_tokens": 4972103.0, "step": 2440 }, { "entropy": 6.513900184631348, "epoch": 0.1431079894644425, "grad_norm": 0.8984375, "learning_rate": 0.0002881871276699967, "loss": 6.3171, "mean_token_accuracy": 0.13082123920321465, "num_tokens": 4982937.0, "step": 2445 }, { "entropy": 6.6147575855255125, "epoch": 0.1434006438396254, "grad_norm": 1.09375, "learning_rate": 0.00028701088019572114, "loss": 6.2689, "mean_token_accuracy": 0.13370759263634682, "num_tokens": 4992173.0, "step": 2450 }, { "entropy": 6.583463954925537, "epoch": 0.1436932982148083, "grad_norm": 1.0703125, "learning_rate": 0.0002858343034370977, "loss": 6.2649, "mean_token_accuracy": 0.14038844481110574, "num_tokens": 5002156.0, "step": 2455 }, { "entropy": 6.596443367004395, "epoch": 0.14398595258999122, "grad_norm": 0.8984375, "learning_rate": 0.00028465742965057267, "loss": 6.2944, "mean_token_accuracy": 0.13622246980667113, "num_tokens": 5013341.0, "step": 2460 }, { "entropy": 6.544248056411743, "epoch": 0.14427860696517414, "grad_norm": 0.91015625, "learning_rate": 0.00028348029110073533, "loss": 6.2663, "mean_token_accuracy": 0.14084595143795015, "num_tokens": 5024212.0, "step": 2465 }, { "entropy": 6.565490102767944, "epoch": 0.14457126134035703, "grad_norm": 1.1015625, "learning_rate": 0.00028230292005943365, "loss": 6.2706, "mean_token_accuracy": 0.1421001598238945, "num_tokens": 5033854.0, "step": 2470 }, { "entropy": 6.629309463500976, "epoch": 0.14486391571553994, "grad_norm": 1.03125, "learning_rate": 0.00028112534880488945, "loss": 6.2248, "mean_token_accuracy": 0.14141243249177932, "num_tokens": 5043875.0, "step": 2475 }, { "entropy": 6.545979690551758, "epoch": 0.14515657009072286, "grad_norm": 0.98828125, "learning_rate": 0.0002799476096208137, "loss": 6.2425, "mean_token_accuracy": 0.13927025198936463, "num_tokens": 5054076.0, "step": 2480 }, { "entropy": 6.566827630996704, "epoch": 0.14544922446590577, "grad_norm": 1.0234375, "learning_rate": 0.00027876973479552087, "loss": 6.378, "mean_token_accuracy": 0.12588516920804976, "num_tokens": 5064285.0, "step": 2485 }, { "entropy": 6.623711252212525, "epoch": 0.14574187884108866, "grad_norm": 1.0703125, "learning_rate": 0.00027759175662104424, "loss": 6.3197, "mean_token_accuracy": 0.13403562009334563, "num_tokens": 5074693.0, "step": 2490 }, { "entropy": 6.633525037765503, "epoch": 0.14603453321627158, "grad_norm": 1.4140625, "learning_rate": 0.0002764137073922508, "loss": 6.3159, "mean_token_accuracy": 0.13227061480283736, "num_tokens": 5083771.0, "step": 2495 }, { "entropy": 6.566998767852783, "epoch": 0.1463271875914545, "grad_norm": 0.90234375, "learning_rate": 0.00027523561940595505, "loss": 6.3005, "mean_token_accuracy": 0.1315088652074337, "num_tokens": 5093913.0, "step": 2500 }, { "entropy": 6.643738174438477, "epoch": 0.1466198419666374, "grad_norm": 1.0, "learning_rate": 0.0002740575249600342, "loss": 6.2872, "mean_token_accuracy": 0.13545941188931465, "num_tokens": 5104670.0, "step": 2505 }, { "entropy": 6.588065147399902, "epoch": 0.1469124963418203, "grad_norm": 1.0703125, "learning_rate": 0.00027287945635254263, "loss": 6.2381, "mean_token_accuracy": 0.13420737609267236, "num_tokens": 5113616.0, "step": 2510 }, { "entropy": 6.552692508697509, "epoch": 0.1472051507170032, "grad_norm": 0.98828125, "learning_rate": 0.00027170144588082635, "loss": 6.2093, "mean_token_accuracy": 0.13239211663603784, "num_tokens": 5124368.0, "step": 2515 }, { "entropy": 6.682310914993286, "epoch": 0.14749780509218613, "grad_norm": 0.92578125, "learning_rate": 0.00027052352584063763, "loss": 6.3692, "mean_token_accuracy": 0.12207729667425156, "num_tokens": 5135647.0, "step": 2520 }, { "entropy": 6.620374870300293, "epoch": 0.14779045946736905, "grad_norm": 0.89453125, "learning_rate": 0.00026934572852524907, "loss": 6.2799, "mean_token_accuracy": 0.13331102058291436, "num_tokens": 5146052.0, "step": 2525 }, { "entropy": 6.506312036514283, "epoch": 0.14808311384255193, "grad_norm": 0.94921875, "learning_rate": 0.00026816808622456937, "loss": 6.2759, "mean_token_accuracy": 0.12836330756545067, "num_tokens": 5156498.0, "step": 2530 }, { "entropy": 6.614617729187012, "epoch": 0.14837576821773485, "grad_norm": 0.98828125, "learning_rate": 0.0002669906312242569, "loss": 6.2076, "mean_token_accuracy": 0.14526754841208459, "num_tokens": 5166043.0, "step": 2535 }, { "entropy": 6.542679643630981, "epoch": 0.14866842259291776, "grad_norm": 1.03125, "learning_rate": 0.00026581339580483525, "loss": 6.2132, "mean_token_accuracy": 0.14147503301501274, "num_tokens": 5176332.0, "step": 2540 }, { "entropy": 6.548535013198853, "epoch": 0.14896107696810068, "grad_norm": 0.89453125, "learning_rate": 0.0002646364122408082, "loss": 6.2746, "mean_token_accuracy": 0.1390418604016304, "num_tokens": 5186478.0, "step": 2545 }, { "entropy": 6.606277847290039, "epoch": 0.14925373134328357, "grad_norm": 1.3359375, "learning_rate": 0.0002634597127997749, "loss": 6.2389, "mean_token_accuracy": 0.14292193353176116, "num_tokens": 5197074.0, "step": 2550 }, { "entropy": 6.611769342422486, "epoch": 0.14954638571846648, "grad_norm": 0.94921875, "learning_rate": 0.0002622833297415445, "loss": 6.2426, "mean_token_accuracy": 0.13011746779084205, "num_tokens": 5207024.0, "step": 2555 }, { "entropy": 6.555798673629761, "epoch": 0.1498390400936494, "grad_norm": 1.015625, "learning_rate": 0.0002611072953172531, "loss": 6.2612, "mean_token_accuracy": 0.13632453754544258, "num_tokens": 5218362.0, "step": 2560 }, { "entropy": 6.495365476608276, "epoch": 0.15013169446883232, "grad_norm": 0.890625, "learning_rate": 0.00025993164176847845, "loss": 6.1768, "mean_token_accuracy": 0.14391684234142305, "num_tokens": 5228876.0, "step": 2565 }, { "entropy": 6.582877111434937, "epoch": 0.1504243488440152, "grad_norm": 1.0, "learning_rate": 0.0002587564013263564, "loss": 6.1715, "mean_token_accuracy": 0.14230633825063704, "num_tokens": 5238815.0, "step": 2570 }, { "entropy": 6.503869247436524, "epoch": 0.15071700321919812, "grad_norm": 0.953125, "learning_rate": 0.0002575816062106974, "loss": 6.2365, "mean_token_accuracy": 0.1408095084130764, "num_tokens": 5248719.0, "step": 2575 }, { "entropy": 6.604321527481079, "epoch": 0.15100965759438104, "grad_norm": 0.90625, "learning_rate": 0.00025640728862910293, "loss": 6.2896, "mean_token_accuracy": 0.12969041988253593, "num_tokens": 5259279.0, "step": 2580 }, { "entropy": 6.5290830612182615, "epoch": 0.15130231196956395, "grad_norm": 0.91015625, "learning_rate": 0.00025523348077608285, "loss": 6.17, "mean_token_accuracy": 0.1386630117893219, "num_tokens": 5268973.0, "step": 2585 }, { "entropy": 6.58136396408081, "epoch": 0.15159496634474687, "grad_norm": 0.94140625, "learning_rate": 0.00025406021483217225, "loss": 6.2357, "mean_token_accuracy": 0.1407373920083046, "num_tokens": 5279574.0, "step": 2590 }, { "entropy": 6.559312343597412, "epoch": 0.15188762071992976, "grad_norm": 1.0078125, "learning_rate": 0.00025288752296304963, "loss": 6.1901, "mean_token_accuracy": 0.14061311781406402, "num_tokens": 5289800.0, "step": 2595 }, { "entropy": 6.568912935256958, "epoch": 0.15218027509511267, "grad_norm": 0.9453125, "learning_rate": 0.000251715437318655, "loss": 6.2727, "mean_token_accuracy": 0.13524502292275428, "num_tokens": 5300347.0, "step": 2600 }, { "entropy": 6.569336652755737, "epoch": 0.1524729294702956, "grad_norm": 0.99609375, "learning_rate": 0.0002505439900323084, "loss": 6.1779, "mean_token_accuracy": 0.14502978920936585, "num_tokens": 5310522.0, "step": 2605 }, { "entropy": 6.596165657043457, "epoch": 0.1527655838454785, "grad_norm": 1.015625, "learning_rate": 0.00024937321321982894, "loss": 6.3082, "mean_token_accuracy": 0.13378702104091644, "num_tokens": 5319883.0, "step": 2610 }, { "entropy": 6.563585996627808, "epoch": 0.1530582382206614, "grad_norm": 1.2578125, "learning_rate": 0.00024820313897865433, "loss": 6.2447, "mean_token_accuracy": 0.13910910189151765, "num_tokens": 5329885.0, "step": 2615 }, { "entropy": 6.515380430221557, "epoch": 0.1533508925958443, "grad_norm": 0.8671875, "learning_rate": 0.00024703379938696105, "loss": 6.1585, "mean_token_accuracy": 0.13748904913663865, "num_tokens": 5340022.0, "step": 2620 }, { "entropy": 6.538485479354859, "epoch": 0.15364354697102722, "grad_norm": 1.2265625, "learning_rate": 0.00024586522650278447, "loss": 6.3003, "mean_token_accuracy": 0.12908684760332106, "num_tokens": 5349999.0, "step": 2625 }, { "entropy": 6.555411386489868, "epoch": 0.15393620134621014, "grad_norm": 1.0234375, "learning_rate": 0.00024469745236314064, "loss": 6.2629, "mean_token_accuracy": 0.13748588413000107, "num_tokens": 5359763.0, "step": 2630 }, { "entropy": 6.544770336151123, "epoch": 0.15422885572139303, "grad_norm": 0.96484375, "learning_rate": 0.00024353050898314767, "loss": 6.259, "mean_token_accuracy": 0.13663270324468613, "num_tokens": 5369868.0, "step": 2635 }, { "entropy": 6.634533214569092, "epoch": 0.15452151009657594, "grad_norm": 1.09375, "learning_rate": 0.00024236442835514743, "loss": 6.2407, "mean_token_accuracy": 0.13900253549218178, "num_tokens": 5379745.0, "step": 2640 }, { "entropy": 6.517221736907959, "epoch": 0.15481416447175886, "grad_norm": 1.0, "learning_rate": 0.00024119924244782965, "loss": 6.2349, "mean_token_accuracy": 0.13597667068243027, "num_tokens": 5389081.0, "step": 2645 }, { "entropy": 6.544792127609253, "epoch": 0.15510681884694177, "grad_norm": 1.03125, "learning_rate": 0.00024003498320535462, "loss": 6.1732, "mean_token_accuracy": 0.14294402599334716, "num_tokens": 5398022.0, "step": 2650 }, { "entropy": 6.563321924209594, "epoch": 0.15539947322212466, "grad_norm": 0.92578125, "learning_rate": 0.00023887168254647727, "loss": 6.2542, "mean_token_accuracy": 0.13828421756625175, "num_tokens": 5408737.0, "step": 2655 }, { "entropy": 6.582010221481323, "epoch": 0.15569212759730758, "grad_norm": 0.9296875, "learning_rate": 0.00023770937236367308, "loss": 6.2438, "mean_token_accuracy": 0.12681645080447196, "num_tokens": 5419427.0, "step": 2660 }, { "entropy": 6.563237524032592, "epoch": 0.1559847819724905, "grad_norm": 0.91796875, "learning_rate": 0.00023654808452226278, "loss": 6.2493, "mean_token_accuracy": 0.13405114859342576, "num_tokens": 5430804.0, "step": 2665 }, { "entropy": 6.540554094314575, "epoch": 0.1562774363476734, "grad_norm": 1.1796875, "learning_rate": 0.00023538785085953912, "loss": 6.2319, "mean_token_accuracy": 0.1424399085342884, "num_tokens": 5440875.0, "step": 2670 }, { "entropy": 6.515637540817261, "epoch": 0.1565700907228563, "grad_norm": 0.8828125, "learning_rate": 0.00023422870318389404, "loss": 6.2483, "mean_token_accuracy": 0.13843049928545953, "num_tokens": 5451566.0, "step": 2675 }, { "entropy": 6.609659481048584, "epoch": 0.1568627450980392, "grad_norm": 1.046875, "learning_rate": 0.0002330706732739468, "loss": 6.2541, "mean_token_accuracy": 0.13826142325997354, "num_tokens": 5462037.0, "step": 2680 }, { "entropy": 6.50597653388977, "epoch": 0.15715539947322213, "grad_norm": 1.0078125, "learning_rate": 0.00023191379287767211, "loss": 6.2511, "mean_token_accuracy": 0.14236056357622145, "num_tokens": 5471693.0, "step": 2685 }, { "entropy": 6.5095006942749025, "epoch": 0.15744805384840505, "grad_norm": 0.87890625, "learning_rate": 0.0002307580937115305, "loss": 6.221, "mean_token_accuracy": 0.14096224904060364, "num_tokens": 5482120.0, "step": 2690 }, { "entropy": 6.594853162765503, "epoch": 0.15774070822358793, "grad_norm": 0.90625, "learning_rate": 0.00022960360745959846, "loss": 6.1798, "mean_token_accuracy": 0.14528884068131448, "num_tokens": 5492801.0, "step": 2695 }, { "entropy": 6.555709552764893, "epoch": 0.15803336259877085, "grad_norm": 0.90625, "learning_rate": 0.00022845036577269972, "loss": 6.2376, "mean_token_accuracy": 0.13575117364525796, "num_tokens": 5503874.0, "step": 2700 }, { "entropy": 6.609086656570435, "epoch": 0.15832601697395376, "grad_norm": 0.9296875, "learning_rate": 0.00022729840026753777, "loss": 6.2636, "mean_token_accuracy": 0.13080462217330932, "num_tokens": 5514379.0, "step": 2705 }, { "entropy": 6.561835289001465, "epoch": 0.15861867134913668, "grad_norm": 0.921875, "learning_rate": 0.0002261477425258287, "loss": 6.2462, "mean_token_accuracy": 0.13595554530620574, "num_tokens": 5525992.0, "step": 2710 }, { "entropy": 6.523668527603149, "epoch": 0.15891132572431957, "grad_norm": 1.078125, "learning_rate": 0.0002249984240934358, "loss": 6.0784, "mean_token_accuracy": 0.15397015661001207, "num_tokens": 5536067.0, "step": 2715 }, { "entropy": 6.543307256698609, "epoch": 0.15920398009950248, "grad_norm": 1.09375, "learning_rate": 0.00022385047647950464, "loss": 6.1518, "mean_token_accuracy": 0.14711069613695144, "num_tokens": 5545504.0, "step": 2720 }, { "entropy": 6.477677965164185, "epoch": 0.1594966344746854, "grad_norm": 0.9296875, "learning_rate": 0.0002227039311555986, "loss": 6.2325, "mean_token_accuracy": 0.13340043202042579, "num_tokens": 5555585.0, "step": 2725 }, { "entropy": 6.524174594879151, "epoch": 0.15978928884986832, "grad_norm": 0.921875, "learning_rate": 0.0002215588195548372, "loss": 6.1949, "mean_token_accuracy": 0.14020482823252678, "num_tokens": 5566265.0, "step": 2730 }, { "entropy": 6.520068836212158, "epoch": 0.1600819432250512, "grad_norm": 1.015625, "learning_rate": 0.00022041517307103337, "loss": 6.2517, "mean_token_accuracy": 0.14020458310842515, "num_tokens": 5575987.0, "step": 2735 }, { "entropy": 6.568447494506836, "epoch": 0.16037459760023412, "grad_norm": 0.96484375, "learning_rate": 0.0002192730230578331, "loss": 6.2403, "mean_token_accuracy": 0.13768415600061418, "num_tokens": 5586966.0, "step": 2740 }, { "entropy": 6.574257278442383, "epoch": 0.16066725197541704, "grad_norm": 0.953125, "learning_rate": 0.0002181324008278559, "loss": 6.2305, "mean_token_accuracy": 0.14161389470100402, "num_tokens": 5597606.0, "step": 2745 }, { "entropy": 6.5560074806213375, "epoch": 0.16095990635059995, "grad_norm": 0.98828125, "learning_rate": 0.00021699333765183655, "loss": 6.2349, "mean_token_accuracy": 0.14064271673560141, "num_tokens": 5607025.0, "step": 2750 }, { "entropy": 6.589640760421753, "epoch": 0.16125256072578284, "grad_norm": 1.0234375, "learning_rate": 0.0002158558647577673, "loss": 6.1466, "mean_token_accuracy": 0.1412832483649254, "num_tokens": 5616731.0, "step": 2755 }, { "entropy": 6.508824443817138, "epoch": 0.16154521510096576, "grad_norm": 1.2734375, "learning_rate": 0.00021472001333004215, "loss": 6.1843, "mean_token_accuracy": 0.14442553371191025, "num_tokens": 5627656.0, "step": 2760 }, { "entropy": 6.592014741897583, "epoch": 0.16183786947614867, "grad_norm": 0.92578125, "learning_rate": 0.00021358581450860186, "loss": 6.2184, "mean_token_accuracy": 0.1367047280073166, "num_tokens": 5637736.0, "step": 2765 }, { "entropy": 6.565477514266968, "epoch": 0.1621305238513316, "grad_norm": 0.99609375, "learning_rate": 0.0002124532993880799, "loss": 6.1978, "mean_token_accuracy": 0.13717956468462944, "num_tokens": 5648385.0, "step": 2770 }, { "entropy": 6.481182193756103, "epoch": 0.16242317822651448, "grad_norm": 0.94921875, "learning_rate": 0.00021132249901695044, "loss": 6.2288, "mean_token_accuracy": 0.14161675423383713, "num_tokens": 5659095.0, "step": 2775 }, { "entropy": 6.441419792175293, "epoch": 0.1627158326016974, "grad_norm": 0.9375, "learning_rate": 0.00021019344439667705, "loss": 6.1517, "mean_token_accuracy": 0.14889734834432602, "num_tokens": 5669943.0, "step": 2780 }, { "entropy": 6.5382989883422855, "epoch": 0.1630084869768803, "grad_norm": 0.92578125, "learning_rate": 0.00020906616648086213, "loss": 6.234, "mean_token_accuracy": 0.13895118832588196, "num_tokens": 5680744.0, "step": 2785 }, { "entropy": 6.543001174926758, "epoch": 0.16330114135206322, "grad_norm": 0.96875, "learning_rate": 0.00020794069617439942, "loss": 6.1645, "mean_token_accuracy": 0.14277639836072922, "num_tokens": 5690576.0, "step": 2790 }, { "entropy": 6.557866382598877, "epoch": 0.1635937957272461, "grad_norm": 1.0390625, "learning_rate": 0.00020681706433262593, "loss": 6.2354, "mean_token_accuracy": 0.14037318527698517, "num_tokens": 5701543.0, "step": 2795 }, { "entropy": 6.5891295909881595, "epoch": 0.16388645010242903, "grad_norm": 0.98046875, "learning_rate": 0.00020569530176047602, "loss": 6.18, "mean_token_accuracy": 0.14461203068494796, "num_tokens": 5710679.0, "step": 2800 }, { "entropy": 6.563183069229126, "epoch": 0.16417910447761194, "grad_norm": 0.90234375, "learning_rate": 0.0002045754392116374, "loss": 6.1984, "mean_token_accuracy": 0.13799943327903746, "num_tokens": 5720905.0, "step": 2805 }, { "entropy": 6.492629766464233, "epoch": 0.16447175885279486, "grad_norm": 0.9609375, "learning_rate": 0.00020345750738770757, "loss": 6.1707, "mean_token_accuracy": 0.14493964090943337, "num_tokens": 5730535.0, "step": 2810 }, { "entropy": 6.549330949783325, "epoch": 0.16476441322797775, "grad_norm": 1.0, "learning_rate": 0.00020234153693735214, "loss": 6.2099, "mean_token_accuracy": 0.14195964187383653, "num_tokens": 5740164.0, "step": 2815 }, { "entropy": 6.561571788787842, "epoch": 0.16505706760316066, "grad_norm": 1.0703125, "learning_rate": 0.0002012275584554647, "loss": 6.1065, "mean_token_accuracy": 0.1453681021928787, "num_tokens": 5750135.0, "step": 2820 }, { "entropy": 6.53393874168396, "epoch": 0.16534972197834358, "grad_norm": 0.9765625, "learning_rate": 0.00020011560248232803, "loss": 6.1865, "mean_token_accuracy": 0.14639652520418167, "num_tokens": 5760178.0, "step": 2825 }, { "entropy": 6.491664886474609, "epoch": 0.1656423763535265, "grad_norm": 1.0546875, "learning_rate": 0.00019900569950277692, "loss": 6.1992, "mean_token_accuracy": 0.1388210326433182, "num_tokens": 5769526.0, "step": 2830 }, { "entropy": 6.5162426948547365, "epoch": 0.16593503072870938, "grad_norm": 1.015625, "learning_rate": 0.00019789787994536228, "loss": 6.1214, "mean_token_accuracy": 0.1437770828604698, "num_tokens": 5779845.0, "step": 2835 }, { "entropy": 6.5152748107910154, "epoch": 0.1662276851038923, "grad_norm": 0.98828125, "learning_rate": 0.00019679217418151667, "loss": 6.2279, "mean_token_accuracy": 0.14030210599303244, "num_tokens": 5789933.0, "step": 2840 }, { "entropy": 6.581371164321899, "epoch": 0.1665203394790752, "grad_norm": 1.0234375, "learning_rate": 0.00019568861252472236, "loss": 6.1639, "mean_token_accuracy": 0.14704412817955018, "num_tokens": 5800328.0, "step": 2845 }, { "entropy": 6.559475040435791, "epoch": 0.16681299385425813, "grad_norm": 0.94140625, "learning_rate": 0.00019458722522967952, "loss": 6.138, "mean_token_accuracy": 0.14048488736152648, "num_tokens": 5810251.0, "step": 2850 }, { "entropy": 6.540503358840942, "epoch": 0.16710564822944102, "grad_norm": 1.0234375, "learning_rate": 0.00019348804249147723, "loss": 6.1713, "mean_token_accuracy": 0.1412585958838463, "num_tokens": 5820553.0, "step": 2855 }, { "entropy": 6.523101282119751, "epoch": 0.16739830260462393, "grad_norm": 1.015625, "learning_rate": 0.0001923910944447655, "loss": 6.2363, "mean_token_accuracy": 0.14285853803157805, "num_tokens": 5830417.0, "step": 2860 }, { "entropy": 6.514103603363037, "epoch": 0.16769095697980685, "grad_norm": 0.99609375, "learning_rate": 0.00019129641116292928, "loss": 6.1715, "mean_token_accuracy": 0.14546340107917785, "num_tokens": 5840247.0, "step": 2865 }, { "entropy": 6.554553127288818, "epoch": 0.16798361135498976, "grad_norm": 0.9921875, "learning_rate": 0.00019020402265726343, "loss": 6.2257, "mean_token_accuracy": 0.14189708530902861, "num_tokens": 5851642.0, "step": 2870 }, { "entropy": 6.61158709526062, "epoch": 0.16827626573017265, "grad_norm": 0.92578125, "learning_rate": 0.0001891139588761509, "loss": 6.1718, "mean_token_accuracy": 0.1385297231376171, "num_tokens": 5861097.0, "step": 2875 }, { "entropy": 6.543722200393677, "epoch": 0.16856892010535557, "grad_norm": 1.015625, "learning_rate": 0.00018802624970424076, "loss": 6.2754, "mean_token_accuracy": 0.14373085647821426, "num_tokens": 5871571.0, "step": 2880 }, { "entropy": 6.492821073532104, "epoch": 0.16886157448053848, "grad_norm": 1.1015625, "learning_rate": 0.00018694092496162945, "loss": 6.0871, "mean_token_accuracy": 0.15522033274173735, "num_tokens": 5880963.0, "step": 2885 }, { "entropy": 6.523477935791016, "epoch": 0.1691542288557214, "grad_norm": 0.9921875, "learning_rate": 0.00018585801440304306, "loss": 6.1977, "mean_token_accuracy": 0.14202016219496727, "num_tokens": 5890412.0, "step": 2890 }, { "entropy": 6.576770210266114, "epoch": 0.1694468832309043, "grad_norm": 0.921875, "learning_rate": 0.00018477754771702165, "loss": 6.2478, "mean_token_accuracy": 0.13902766183018683, "num_tokens": 5900562.0, "step": 2895 }, { "entropy": 6.5775594234466555, "epoch": 0.1697395376060872, "grad_norm": 0.9453125, "learning_rate": 0.00018369955452510506, "loss": 6.2034, "mean_token_accuracy": 0.1432963989675045, "num_tokens": 5910559.0, "step": 2900 }, { "entropy": 6.540433025360107, "epoch": 0.17003219198127012, "grad_norm": 1.1484375, "learning_rate": 0.0001826240643810212, "loss": 6.1683, "mean_token_accuracy": 0.14233635291457175, "num_tokens": 5920053.0, "step": 2905 }, { "entropy": 6.552840805053711, "epoch": 0.17032484635645304, "grad_norm": 1.0, "learning_rate": 0.0001815511067698758, "loss": 6.2065, "mean_token_accuracy": 0.14341727942228316, "num_tokens": 5929609.0, "step": 2910 }, { "entropy": 6.512862491607666, "epoch": 0.17061750073163595, "grad_norm": 0.99609375, "learning_rate": 0.0001804807111073436, "loss": 6.146, "mean_token_accuracy": 0.1410912036895752, "num_tokens": 5938476.0, "step": 2915 }, { "entropy": 6.538678359985352, "epoch": 0.17091015510681884, "grad_norm": 0.9609375, "learning_rate": 0.0001794129067388625, "loss": 6.2291, "mean_token_accuracy": 0.13625446036458017, "num_tokens": 5948937.0, "step": 2920 }, { "entropy": 6.591725206375122, "epoch": 0.17120280948200176, "grad_norm": 0.98046875, "learning_rate": 0.00017834772293882868, "loss": 6.1844, "mean_token_accuracy": 0.14061932265758514, "num_tokens": 5959676.0, "step": 2925 }, { "entropy": 6.602462911605835, "epoch": 0.17149546385718467, "grad_norm": 1.0, "learning_rate": 0.000177285188909794, "loss": 6.2164, "mean_token_accuracy": 0.13685814663767815, "num_tokens": 5970374.0, "step": 2930 }, { "entropy": 6.558568000793457, "epoch": 0.1717881182323676, "grad_norm": 1.0703125, "learning_rate": 0.0001762253337816656, "loss": 6.2452, "mean_token_accuracy": 0.13835704773664476, "num_tokens": 5980871.0, "step": 2935 }, { "entropy": 6.527994441986084, "epoch": 0.17208077260755048, "grad_norm": 0.91796875, "learning_rate": 0.00017516818661090738, "loss": 6.191, "mean_token_accuracy": 0.143326635658741, "num_tokens": 5991834.0, "step": 2940 }, { "entropy": 6.54395055770874, "epoch": 0.1723734269827334, "grad_norm": 1.015625, "learning_rate": 0.0001741137763797428, "loss": 6.1742, "mean_token_accuracy": 0.13280976191163063, "num_tokens": 6002940.0, "step": 2945 }, { "entropy": 6.510257530212402, "epoch": 0.1726660813579163, "grad_norm": 1.015625, "learning_rate": 0.00017306213199536115, "loss": 6.1959, "mean_token_accuracy": 0.14354807138442993, "num_tokens": 6014321.0, "step": 2950 }, { "entropy": 6.5832277774810795, "epoch": 0.17295873573309922, "grad_norm": 1.0078125, "learning_rate": 0.0001720132822891243, "loss": 6.1143, "mean_token_accuracy": 0.1487345390021801, "num_tokens": 6023676.0, "step": 2955 }, { "entropy": 6.539546060562134, "epoch": 0.1732513901082821, "grad_norm": 1.0390625, "learning_rate": 0.0001709672560157769, "loss": 6.2143, "mean_token_accuracy": 0.14421654716134072, "num_tokens": 6033964.0, "step": 2960 }, { "entropy": 6.515758275985718, "epoch": 0.17354404448346503, "grad_norm": 0.90234375, "learning_rate": 0.00016992408185265758, "loss": 6.1897, "mean_token_accuracy": 0.1415265567600727, "num_tokens": 6043628.0, "step": 2965 }, { "entropy": 6.565539932250976, "epoch": 0.17383669885864794, "grad_norm": 1.0390625, "learning_rate": 0.00016888378839891298, "loss": 6.1572, "mean_token_accuracy": 0.13887002915143967, "num_tokens": 6053149.0, "step": 2970 }, { "entropy": 6.514090728759766, "epoch": 0.17412935323383086, "grad_norm": 1.0390625, "learning_rate": 0.0001678464041747137, "loss": 6.208, "mean_token_accuracy": 0.13517674133181573, "num_tokens": 6062889.0, "step": 2975 }, { "entropy": 6.544496774673462, "epoch": 0.17442200760901375, "grad_norm": 0.87109375, "learning_rate": 0.00016681195762047223, "loss": 6.2034, "mean_token_accuracy": 0.13485102504491805, "num_tokens": 6073662.0, "step": 2980 }, { "entropy": 6.579607248306274, "epoch": 0.17471466198419666, "grad_norm": 0.94921875, "learning_rate": 0.00016578047709606337, "loss": 6.22, "mean_token_accuracy": 0.139206163585186, "num_tokens": 6084039.0, "step": 2985 }, { "entropy": 6.57672085762024, "epoch": 0.17500731635937958, "grad_norm": 1.015625, "learning_rate": 0.00016475199088004678, "loss": 6.209, "mean_token_accuracy": 0.14772867262363434, "num_tokens": 6093929.0, "step": 2990 }, { "entropy": 6.504447555541992, "epoch": 0.1752999707345625, "grad_norm": 0.99609375, "learning_rate": 0.00016372652716889163, "loss": 6.1379, "mean_token_accuracy": 0.1399600587785244, "num_tokens": 6104472.0, "step": 2995 }, { "entropy": 6.562633895874024, "epoch": 0.17559262510974538, "grad_norm": 1.0625, "learning_rate": 0.0001627041140762035, "loss": 6.1841, "mean_token_accuracy": 0.1357189230620861, "num_tokens": 6114233.0, "step": 3000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1345065734799360.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }