{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 5.338078291814947, "eval_steps": 3000, "global_step": 54000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.469703674316406, "epoch": 0.0004942665085013839, "grad_norm": 0.89453125, "learning_rate": 2e-06, "loss": 7.3039, "mean_token_accuracy": 0.08914985954761505, "num_tokens": 11289.0, "step": 5 }, { "entropy": 7.451202011108398, "epoch": 0.0009885330170027679, "grad_norm": 0.90625, "learning_rate": 4.5e-06, "loss": 7.2923, "mean_token_accuracy": 0.09169483110308647, "num_tokens": 21541.0, "step": 10 }, { "entropy": 7.475129747390747, "epoch": 0.0014827995255041518, "grad_norm": 0.91015625, "learning_rate": 7e-06, "loss": 7.2709, "mean_token_accuracy": 0.09598705545067787, "num_tokens": 32257.0, "step": 15 }, { "entropy": 7.492884302139283, "epoch": 0.0019770660340055358, "grad_norm": 0.85546875, "learning_rate": 9.5e-06, "loss": 7.2938, "mean_token_accuracy": 0.09161478653550148, "num_tokens": 44176.0, "step": 20 }, { "entropy": 7.503809309005737, "epoch": 0.0024713325425069197, "grad_norm": 0.84375, "learning_rate": 1.2e-05, "loss": 7.2106, "mean_token_accuracy": 0.0929027833044529, "num_tokens": 56115.0, "step": 25 }, { "entropy": 7.537404775619507, "epoch": 0.0029655990510083037, "grad_norm": 0.8046875, "learning_rate": 1.4500000000000002e-05, "loss": 7.267, "mean_token_accuracy": 0.0948231890797615, "num_tokens": 68828.0, "step": 30 }, { "entropy": 7.524669170379639, "epoch": 0.0034598655595096876, "grad_norm": 0.83984375, "learning_rate": 1.7000000000000003e-05, "loss": 7.2556, "mean_token_accuracy": 0.09147608950734139, "num_tokens": 80097.0, "step": 35 }, { "entropy": 7.5563098907470705, "epoch": 0.0039541320680110716, "grad_norm": 0.76171875, "learning_rate": 1.95e-05, "loss": 7.2372, "mean_token_accuracy": 0.09377887398004532, "num_tokens": 91510.0, "step": 40 }, { "entropy": 7.577905559539795, "epoch": 0.004448398576512456, "grad_norm": 0.75390625, "learning_rate": 2.2e-05, "loss": 7.2791, "mean_token_accuracy": 0.09560152813792229, "num_tokens": 103443.0, "step": 45 }, { "entropy": 7.562246513366699, "epoch": 0.0049426650850138395, "grad_norm": 0.81640625, "learning_rate": 2.4500000000000003e-05, "loss": 7.3081, "mean_token_accuracy": 0.08996103182435036, "num_tokens": 114629.0, "step": 50 }, { "entropy": 7.533729696273804, "epoch": 0.005436931593515224, "grad_norm": 0.7890625, "learning_rate": 2.7e-05, "loss": 7.306, "mean_token_accuracy": 0.09244225695729255, "num_tokens": 125012.0, "step": 55 }, { "entropy": 7.58353476524353, "epoch": 0.005931198102016607, "grad_norm": 0.83984375, "learning_rate": 2.95e-05, "loss": 7.2392, "mean_token_accuracy": 0.09736663252115249, "num_tokens": 135834.0, "step": 60 }, { "entropy": 7.575706529617309, "epoch": 0.006425464610517992, "grad_norm": 0.80859375, "learning_rate": 3.2e-05, "loss": 7.1391, "mean_token_accuracy": 0.10104931369423867, "num_tokens": 147413.0, "step": 65 }, { "entropy": 7.567987012863159, "epoch": 0.006919731119019375, "grad_norm": 0.8515625, "learning_rate": 3.4500000000000005e-05, "loss": 7.328, "mean_token_accuracy": 0.09703772887587547, "num_tokens": 158046.0, "step": 70 }, { "entropy": 7.553958082199097, "epoch": 0.00741399762752076, "grad_norm": 0.8984375, "learning_rate": 3.7e-05, "loss": 7.2398, "mean_token_accuracy": 0.09700576439499856, "num_tokens": 168564.0, "step": 75 }, { "entropy": 7.556397438049316, "epoch": 0.007908264136022143, "grad_norm": 0.7734375, "learning_rate": 3.95e-05, "loss": 7.2517, "mean_token_accuracy": 0.09499543234705925, "num_tokens": 181168.0, "step": 80 }, { "entropy": 7.5417234897613525, "epoch": 0.008402530644523527, "grad_norm": 0.859375, "learning_rate": 4.2000000000000004e-05, "loss": 7.2216, "mean_token_accuracy": 0.0979242317378521, "num_tokens": 192666.0, "step": 85 }, { "entropy": 7.562561988830566, "epoch": 0.008896797153024912, "grad_norm": 0.76953125, "learning_rate": 4.45e-05, "loss": 7.2863, "mean_token_accuracy": 0.09055893197655678, "num_tokens": 203688.0, "step": 90 }, { "entropy": 7.481156682968139, "epoch": 0.009391063661526295, "grad_norm": 0.8125, "learning_rate": 4.7000000000000004e-05, "loss": 7.1426, "mean_token_accuracy": 0.10065646544098854, "num_tokens": 214399.0, "step": 95 }, { "entropy": 7.469635391235352, "epoch": 0.009885330170027679, "grad_norm": 0.703125, "learning_rate": 4.9500000000000004e-05, "loss": 7.2347, "mean_token_accuracy": 0.09190195500850677, "num_tokens": 227549.0, "step": 100 }, { "entropy": 7.503566455841065, "epoch": 0.010379596678529062, "grad_norm": 0.75, "learning_rate": 5.2e-05, "loss": 7.1392, "mean_token_accuracy": 0.10797618925571442, "num_tokens": 239612.0, "step": 105 }, { "entropy": 7.572363758087159, "epoch": 0.010873863187030448, "grad_norm": 0.83984375, "learning_rate": 5.45e-05, "loss": 7.2757, "mean_token_accuracy": 0.09476120248436928, "num_tokens": 251163.0, "step": 110 }, { "entropy": 7.461998224258423, "epoch": 0.011368129695531831, "grad_norm": 0.80078125, "learning_rate": 5.7e-05, "loss": 7.1332, "mean_token_accuracy": 0.1059160701930523, "num_tokens": 263995.0, "step": 115 }, { "entropy": 7.588790702819824, "epoch": 0.011862396204033215, "grad_norm": 0.8984375, "learning_rate": 5.9499999999999996e-05, "loss": 7.3141, "mean_token_accuracy": 0.08305804803967476, "num_tokens": 275103.0, "step": 120 }, { "entropy": 7.536360836029052, "epoch": 0.012356662712534598, "grad_norm": 0.74609375, "learning_rate": 6.2e-05, "loss": 7.2092, "mean_token_accuracy": 0.09603819251060486, "num_tokens": 286838.0, "step": 125 }, { "entropy": 7.514512634277343, "epoch": 0.012850929221035983, "grad_norm": 0.93359375, "learning_rate": 6.450000000000001e-05, "loss": 7.237, "mean_token_accuracy": 0.0946768917143345, "num_tokens": 298750.0, "step": 130 }, { "entropy": 7.4676471710205075, "epoch": 0.013345195729537367, "grad_norm": 0.79296875, "learning_rate": 6.7e-05, "loss": 7.1196, "mean_token_accuracy": 0.10568102300167084, "num_tokens": 310451.0, "step": 135 }, { "entropy": 7.508374309539795, "epoch": 0.01383946223803875, "grad_norm": 0.79296875, "learning_rate": 6.950000000000001e-05, "loss": 7.2575, "mean_token_accuracy": 0.09567514508962631, "num_tokens": 321232.0, "step": 140 }, { "entropy": 7.625961065292358, "epoch": 0.014333728746540134, "grad_norm": 0.796875, "learning_rate": 7.2e-05, "loss": 7.1811, "mean_token_accuracy": 0.09812303707003593, "num_tokens": 332531.0, "step": 145 }, { "entropy": 7.4815513610839846, "epoch": 0.01482799525504152, "grad_norm": 0.78515625, "learning_rate": 7.45e-05, "loss": 7.1754, "mean_token_accuracy": 0.09771352261304855, "num_tokens": 346002.0, "step": 150 }, { "entropy": 7.486629390716553, "epoch": 0.015322261763542903, "grad_norm": 0.92578125, "learning_rate": 7.7e-05, "loss": 7.1493, "mean_token_accuracy": 0.09570263773202896, "num_tokens": 356691.0, "step": 155 }, { "entropy": 7.513840389251709, "epoch": 0.015816528272044286, "grad_norm": 0.87109375, "learning_rate": 7.950000000000001e-05, "loss": 7.1711, "mean_token_accuracy": 0.09991738945245743, "num_tokens": 368749.0, "step": 160 }, { "entropy": 7.455194139480591, "epoch": 0.01631079478054567, "grad_norm": 0.8828125, "learning_rate": 8.2e-05, "loss": 7.1046, "mean_token_accuracy": 0.10521886423230171, "num_tokens": 379484.0, "step": 165 }, { "entropy": 7.511811923980713, "epoch": 0.016805061289047053, "grad_norm": 0.890625, "learning_rate": 8.450000000000001e-05, "loss": 7.1474, "mean_token_accuracy": 0.09446320682764053, "num_tokens": 389751.0, "step": 170 }, { "entropy": 7.460206699371338, "epoch": 0.017299327797548437, "grad_norm": 0.91796875, "learning_rate": 8.7e-05, "loss": 7.1648, "mean_token_accuracy": 0.09561898037791253, "num_tokens": 400771.0, "step": 175 }, { "entropy": 7.551068878173828, "epoch": 0.017793594306049824, "grad_norm": 0.8125, "learning_rate": 8.95e-05, "loss": 7.1854, "mean_token_accuracy": 0.09663412421941757, "num_tokens": 413575.0, "step": 180 }, { "entropy": 7.459692096710205, "epoch": 0.018287860814551207, "grad_norm": 0.85546875, "learning_rate": 9.2e-05, "loss": 7.1186, "mean_token_accuracy": 0.09810871481895447, "num_tokens": 424825.0, "step": 185 }, { "entropy": 7.612393522262574, "epoch": 0.01878212732305259, "grad_norm": 0.81640625, "learning_rate": 9.45e-05, "loss": 7.1832, "mean_token_accuracy": 0.10366637259721756, "num_tokens": 435610.0, "step": 190 }, { "entropy": 7.4823657989501955, "epoch": 0.019276393831553974, "grad_norm": 1.0078125, "learning_rate": 9.7e-05, "loss": 7.1995, "mean_token_accuracy": 0.09689589515328408, "num_tokens": 445855.0, "step": 195 }, { "entropy": 7.4008557319641115, "epoch": 0.019770660340055358, "grad_norm": 0.90234375, "learning_rate": 9.95e-05, "loss": 7.078, "mean_token_accuracy": 0.10040710046887398, "num_tokens": 456895.0, "step": 200 }, { "entropy": 7.558928728103638, "epoch": 0.02026492684855674, "grad_norm": 1.109375, "learning_rate": 0.000102, "loss": 7.226, "mean_token_accuracy": 0.09527792558073997, "num_tokens": 467446.0, "step": 205 }, { "entropy": 7.542035818099976, "epoch": 0.020759193357058125, "grad_norm": 0.82421875, "learning_rate": 0.00010449999999999999, "loss": 7.1408, "mean_token_accuracy": 0.09867265969514846, "num_tokens": 478988.0, "step": 210 }, { "entropy": 7.445913553237915, "epoch": 0.02125345986555951, "grad_norm": 0.90625, "learning_rate": 0.000107, "loss": 7.1245, "mean_token_accuracy": 0.10041875392198563, "num_tokens": 491053.0, "step": 215 }, { "entropy": 7.589331150054932, "epoch": 0.021747726374060895, "grad_norm": 1.0703125, "learning_rate": 0.0001095, "loss": 7.2108, "mean_token_accuracy": 0.09277821779251098, "num_tokens": 502279.0, "step": 220 }, { "entropy": 7.351877689361572, "epoch": 0.02224199288256228, "grad_norm": 0.91015625, "learning_rate": 0.000112, "loss": 7.0907, "mean_token_accuracy": 0.10218187943100929, "num_tokens": 513470.0, "step": 225 }, { "entropy": 7.563132953643799, "epoch": 0.022736259391063662, "grad_norm": 0.91015625, "learning_rate": 0.0001145, "loss": 7.1604, "mean_token_accuracy": 0.09525467976927757, "num_tokens": 524380.0, "step": 230 }, { "entropy": 7.478720617294312, "epoch": 0.023230525899565046, "grad_norm": 1.046875, "learning_rate": 0.00011700000000000001, "loss": 7.1638, "mean_token_accuracy": 0.09922493025660514, "num_tokens": 535798.0, "step": 235 }, { "entropy": 7.49151644706726, "epoch": 0.02372479240806643, "grad_norm": 0.93359375, "learning_rate": 0.00011949999999999999, "loss": 7.1082, "mean_token_accuracy": 0.10218137353658677, "num_tokens": 545720.0, "step": 240 }, { "entropy": 7.510548734664917, "epoch": 0.024219058916567813, "grad_norm": 1.0390625, "learning_rate": 0.000122, "loss": 7.1354, "mean_token_accuracy": 0.10085964500904084, "num_tokens": 557110.0, "step": 245 }, { "entropy": 7.368914556503296, "epoch": 0.024713325425069196, "grad_norm": 0.8828125, "learning_rate": 0.0001245, "loss": 7.0898, "mean_token_accuracy": 0.10415727794170379, "num_tokens": 568966.0, "step": 250 }, { "entropy": 7.4961333751678465, "epoch": 0.02520759193357058, "grad_norm": 0.9375, "learning_rate": 0.000127, "loss": 7.1273, "mean_token_accuracy": 0.10322419255971908, "num_tokens": 580441.0, "step": 255 }, { "entropy": 7.495905208587646, "epoch": 0.025701858442071967, "grad_norm": 0.94140625, "learning_rate": 0.0001295, "loss": 7.1237, "mean_token_accuracy": 0.09592118486762047, "num_tokens": 592698.0, "step": 260 }, { "entropy": 7.46055006980896, "epoch": 0.02619612495057335, "grad_norm": 0.890625, "learning_rate": 0.000132, "loss": 7.1033, "mean_token_accuracy": 0.10308752283453941, "num_tokens": 604787.0, "step": 265 }, { "entropy": 7.470848751068115, "epoch": 0.026690391459074734, "grad_norm": 0.8984375, "learning_rate": 0.00013450000000000002, "loss": 7.0865, "mean_token_accuracy": 0.0982378177344799, "num_tokens": 616445.0, "step": 270 }, { "entropy": 7.464596509933472, "epoch": 0.027184657967576117, "grad_norm": 0.921875, "learning_rate": 0.00013700000000000002, "loss": 7.1405, "mean_token_accuracy": 0.10080643817782402, "num_tokens": 627723.0, "step": 275 }, { "entropy": 7.526458120346069, "epoch": 0.0276789244760775, "grad_norm": 0.953125, "learning_rate": 0.0001395, "loss": 7.1866, "mean_token_accuracy": 0.09936180636286736, "num_tokens": 638987.0, "step": 280 }, { "entropy": 7.4703020572662355, "epoch": 0.028173190984578884, "grad_norm": 1.2734375, "learning_rate": 0.00014199999999999998, "loss": 7.0148, "mean_token_accuracy": 0.10166787654161454, "num_tokens": 650626.0, "step": 285 }, { "entropy": 7.38916015625, "epoch": 0.028667457493080268, "grad_norm": 1.0234375, "learning_rate": 0.0001445, "loss": 7.0269, "mean_token_accuracy": 0.1108930952847004, "num_tokens": 661911.0, "step": 290 }, { "entropy": 7.406114387512207, "epoch": 0.02916172400158165, "grad_norm": 0.9765625, "learning_rate": 0.000147, "loss": 7.0953, "mean_token_accuracy": 0.1046306237578392, "num_tokens": 674298.0, "step": 295 }, { "entropy": 7.434783887863159, "epoch": 0.02965599051008304, "grad_norm": 0.94921875, "learning_rate": 0.0001495, "loss": 7.0246, "mean_token_accuracy": 0.1099107675254345, "num_tokens": 686000.0, "step": 300 }, { "entropy": 7.457195472717285, "epoch": 0.030150257018584422, "grad_norm": 0.97265625, "learning_rate": 0.000152, "loss": 7.0606, "mean_token_accuracy": 0.10334300473332406, "num_tokens": 698464.0, "step": 305 }, { "entropy": 7.388035774230957, "epoch": 0.030644523527085805, "grad_norm": 1.0625, "learning_rate": 0.00015450000000000001, "loss": 7.0749, "mean_token_accuracy": 0.10073440000414849, "num_tokens": 709702.0, "step": 310 }, { "entropy": 7.647989797592163, "epoch": 0.03113879003558719, "grad_norm": 1.4296875, "learning_rate": 0.000157, "loss": 7.1756, "mean_token_accuracy": 0.09775948747992516, "num_tokens": 722234.0, "step": 315 }, { "entropy": 7.324582767486572, "epoch": 0.03163305654408857, "grad_norm": 0.95703125, "learning_rate": 0.0001595, "loss": 7.1208, "mean_token_accuracy": 0.10032215490937232, "num_tokens": 733001.0, "step": 320 }, { "entropy": 7.522441816329956, "epoch": 0.03212732305258996, "grad_norm": 1.0390625, "learning_rate": 0.000162, "loss": 7.0869, "mean_token_accuracy": 0.1011140413582325, "num_tokens": 743315.0, "step": 325 }, { "entropy": 7.429833459854126, "epoch": 0.03262158956109134, "grad_norm": 1.0, "learning_rate": 0.00016450000000000001, "loss": 7.0304, "mean_token_accuracy": 0.10157204046845436, "num_tokens": 754386.0, "step": 330 }, { "entropy": 7.433870887756347, "epoch": 0.033115856069592726, "grad_norm": 1.0078125, "learning_rate": 0.00016700000000000002, "loss": 7.1433, "mean_token_accuracy": 0.10339019373059273, "num_tokens": 766504.0, "step": 335 }, { "entropy": 7.289975929260254, "epoch": 0.033610122578094107, "grad_norm": 1.1171875, "learning_rate": 0.00016950000000000003, "loss": 6.9711, "mean_token_accuracy": 0.11004318147897721, "num_tokens": 777039.0, "step": 340 }, { "entropy": 7.508639812469482, "epoch": 0.034104389086595494, "grad_norm": 1.03125, "learning_rate": 0.00017199999999999998, "loss": 7.0737, "mean_token_accuracy": 0.10165267884731292, "num_tokens": 787890.0, "step": 345 }, { "entropy": 7.268938064575195, "epoch": 0.034598655595096874, "grad_norm": 0.99609375, "learning_rate": 0.00017449999999999999, "loss": 7.0296, "mean_token_accuracy": 0.10082691311836242, "num_tokens": 800129.0, "step": 350 }, { "entropy": 7.4750524997711185, "epoch": 0.03509292210359826, "grad_norm": 0.82421875, "learning_rate": 0.000177, "loss": 7.1229, "mean_token_accuracy": 0.09419984817504883, "num_tokens": 812517.0, "step": 355 }, { "entropy": 7.386541795730591, "epoch": 0.03558718861209965, "grad_norm": 0.88671875, "learning_rate": 0.0001795, "loss": 7.0536, "mean_token_accuracy": 0.10280298069119453, "num_tokens": 824570.0, "step": 360 }, { "entropy": 7.37411732673645, "epoch": 0.03608145512060103, "grad_norm": 0.828125, "learning_rate": 0.000182, "loss": 7.0507, "mean_token_accuracy": 0.10352159217000008, "num_tokens": 836506.0, "step": 365 }, { "entropy": 7.47959794998169, "epoch": 0.036575721629102415, "grad_norm": 0.84375, "learning_rate": 0.0001845, "loss": 7.0444, "mean_token_accuracy": 0.10556175038218499, "num_tokens": 846841.0, "step": 370 }, { "entropy": 7.415268468856811, "epoch": 0.037069988137603795, "grad_norm": 1.078125, "learning_rate": 0.000187, "loss": 7.0936, "mean_token_accuracy": 0.10685667470097542, "num_tokens": 858770.0, "step": 375 }, { "entropy": 7.34727110862732, "epoch": 0.03756425464610518, "grad_norm": 1.0234375, "learning_rate": 0.0001895, "loss": 6.944, "mean_token_accuracy": 0.10581078305840493, "num_tokens": 870184.0, "step": 380 }, { "entropy": 7.387606573104859, "epoch": 0.03805852115460656, "grad_norm": 0.984375, "learning_rate": 0.000192, "loss": 6.996, "mean_token_accuracy": 0.10772442370653153, "num_tokens": 881843.0, "step": 385 }, { "entropy": 7.415964269638062, "epoch": 0.03855278766310795, "grad_norm": 0.921875, "learning_rate": 0.0001945, "loss": 7.0285, "mean_token_accuracy": 0.10454590618610382, "num_tokens": 893453.0, "step": 390 }, { "entropy": 7.4321942806243895, "epoch": 0.03904705417160933, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 7.0785, "mean_token_accuracy": 0.09805944114923477, "num_tokens": 904417.0, "step": 395 }, { "entropy": 7.339347553253174, "epoch": 0.039541320680110716, "grad_norm": 1.125, "learning_rate": 0.00019950000000000002, "loss": 7.0135, "mean_token_accuracy": 0.10153622105717659, "num_tokens": 915134.0, "step": 400 }, { "entropy": 7.397016334533691, "epoch": 0.0400355871886121, "grad_norm": 0.94140625, "learning_rate": 0.000202, "loss": 7.0317, "mean_token_accuracy": 0.10312987342476845, "num_tokens": 926361.0, "step": 405 }, { "entropy": 7.307787704467773, "epoch": 0.04052985369711348, "grad_norm": 0.9921875, "learning_rate": 0.00020449999999999998, "loss": 6.9558, "mean_token_accuracy": 0.10188485085964202, "num_tokens": 937474.0, "step": 410 }, { "entropy": 7.432948350906372, "epoch": 0.04102412020561487, "grad_norm": 1.09375, "learning_rate": 0.000207, "loss": 7.021, "mean_token_accuracy": 0.1049279622733593, "num_tokens": 948897.0, "step": 415 }, { "entropy": 7.335451555252075, "epoch": 0.04151838671411625, "grad_norm": 1.1796875, "learning_rate": 0.0002095, "loss": 7.0438, "mean_token_accuracy": 0.10066490024328231, "num_tokens": 960669.0, "step": 420 }, { "entropy": 7.3269850730896, "epoch": 0.04201265322261764, "grad_norm": 1.1015625, "learning_rate": 0.000212, "loss": 6.8868, "mean_token_accuracy": 0.10576090738177299, "num_tokens": 973001.0, "step": 425 }, { "entropy": 7.289369392395019, "epoch": 0.04250691973111902, "grad_norm": 1.171875, "learning_rate": 0.0002145, "loss": 6.957, "mean_token_accuracy": 0.10359662398695946, "num_tokens": 986214.0, "step": 430 }, { "entropy": 7.209768915176392, "epoch": 0.043001186239620404, "grad_norm": 1.0390625, "learning_rate": 0.00021700000000000002, "loss": 6.9765, "mean_token_accuracy": 0.10080774426460266, "num_tokens": 997363.0, "step": 435 }, { "entropy": 7.378287410736084, "epoch": 0.04349545274812179, "grad_norm": 0.9453125, "learning_rate": 0.0002195, "loss": 6.89, "mean_token_accuracy": 0.11189188435673714, "num_tokens": 1009543.0, "step": 440 }, { "entropy": 7.301484727859497, "epoch": 0.04398971925662317, "grad_norm": 0.94140625, "learning_rate": 0.000222, "loss": 6.984, "mean_token_accuracy": 0.10262056440114975, "num_tokens": 1020561.0, "step": 445 }, { "entropy": 7.333764362335205, "epoch": 0.04448398576512456, "grad_norm": 0.8984375, "learning_rate": 0.0002245, "loss": 6.9396, "mean_token_accuracy": 0.1044077455997467, "num_tokens": 1032587.0, "step": 450 }, { "entropy": 7.36834979057312, "epoch": 0.04497825227362594, "grad_norm": 0.96875, "learning_rate": 0.00022700000000000002, "loss": 6.949, "mean_token_accuracy": 0.10236429199576377, "num_tokens": 1044249.0, "step": 455 }, { "entropy": 7.328242921829224, "epoch": 0.045472518782127325, "grad_norm": 1.25, "learning_rate": 0.00022950000000000002, "loss": 6.9932, "mean_token_accuracy": 0.10464346408843994, "num_tokens": 1055415.0, "step": 460 }, { "entropy": 7.299544954299927, "epoch": 0.045966785290628705, "grad_norm": 1.0703125, "learning_rate": 0.00023200000000000003, "loss": 6.9773, "mean_token_accuracy": 0.10330140814185143, "num_tokens": 1066593.0, "step": 465 }, { "entropy": 7.335889530181885, "epoch": 0.04646105179913009, "grad_norm": 1.046875, "learning_rate": 0.00023449999999999998, "loss": 6.9728, "mean_token_accuracy": 0.1081781692802906, "num_tokens": 1076966.0, "step": 470 }, { "entropy": 7.278144025802613, "epoch": 0.04695531830763147, "grad_norm": 0.93359375, "learning_rate": 0.000237, "loss": 7.0076, "mean_token_accuracy": 0.10260550826787948, "num_tokens": 1089927.0, "step": 475 }, { "entropy": 7.320434522628784, "epoch": 0.04744958481613286, "grad_norm": 0.89453125, "learning_rate": 0.0002395, "loss": 6.9523, "mean_token_accuracy": 0.10259445980191231, "num_tokens": 1101920.0, "step": 480 }, { "entropy": 7.355521011352539, "epoch": 0.047943851324634246, "grad_norm": 1.125, "learning_rate": 0.000242, "loss": 7.0105, "mean_token_accuracy": 0.10701147764921189, "num_tokens": 1115078.0, "step": 485 }, { "entropy": 7.400402402877807, "epoch": 0.048438117833135626, "grad_norm": 1.0, "learning_rate": 0.0002445, "loss": 7.0944, "mean_token_accuracy": 0.0997918725013733, "num_tokens": 1127138.0, "step": 490 }, { "entropy": 7.240495920181274, "epoch": 0.04893238434163701, "grad_norm": 1.0234375, "learning_rate": 0.000247, "loss": 6.8923, "mean_token_accuracy": 0.1018766038119793, "num_tokens": 1138390.0, "step": 495 }, { "entropy": 7.1997147560119625, "epoch": 0.04942665085013839, "grad_norm": 0.9921875, "learning_rate": 0.0002495, "loss": 6.8512, "mean_token_accuracy": 0.11121880635619164, "num_tokens": 1149124.0, "step": 500 }, { "entropy": 7.302788877487183, "epoch": 0.04992091735863978, "grad_norm": 1.0078125, "learning_rate": 0.000252, "loss": 6.9238, "mean_token_accuracy": 0.1091496266424656, "num_tokens": 1161091.0, "step": 505 }, { "entropy": 7.353948354721069, "epoch": 0.05041518386714116, "grad_norm": 0.96484375, "learning_rate": 0.0002545, "loss": 6.893, "mean_token_accuracy": 0.10641072243452072, "num_tokens": 1171919.0, "step": 510 }, { "entropy": 7.2228254795074465, "epoch": 0.05090945037564255, "grad_norm": 1.0, "learning_rate": 0.000257, "loss": 6.9246, "mean_token_accuracy": 0.10590804591774941, "num_tokens": 1183688.0, "step": 515 }, { "entropy": 7.212153196334839, "epoch": 0.051403716884143934, "grad_norm": 1.046875, "learning_rate": 0.0002595, "loss": 6.8462, "mean_token_accuracy": 0.10454064607620239, "num_tokens": 1195323.0, "step": 520 }, { "entropy": 7.319693851470947, "epoch": 0.051897983392645314, "grad_norm": 0.9921875, "learning_rate": 0.000262, "loss": 6.9631, "mean_token_accuracy": 0.10184277668595314, "num_tokens": 1206782.0, "step": 525 }, { "entropy": 7.154052352905273, "epoch": 0.0523922499011467, "grad_norm": 1.0546875, "learning_rate": 0.00026450000000000003, "loss": 6.8618, "mean_token_accuracy": 0.11248803958296776, "num_tokens": 1218102.0, "step": 530 }, { "entropy": 7.168608140945435, "epoch": 0.05288651640964808, "grad_norm": 1.1171875, "learning_rate": 0.00026700000000000004, "loss": 6.8305, "mean_token_accuracy": 0.11310576722025871, "num_tokens": 1230199.0, "step": 535 }, { "entropy": 7.333725214004517, "epoch": 0.05338078291814947, "grad_norm": 1.0078125, "learning_rate": 0.00026950000000000005, "loss": 6.9599, "mean_token_accuracy": 0.10180617794394493, "num_tokens": 1242127.0, "step": 540 }, { "entropy": 7.257206916809082, "epoch": 0.05387504942665085, "grad_norm": 1.265625, "learning_rate": 0.00027200000000000005, "loss": 6.8219, "mean_token_accuracy": 0.10760059282183647, "num_tokens": 1252329.0, "step": 545 }, { "entropy": 7.028431701660156, "epoch": 0.054369315935152235, "grad_norm": 1.015625, "learning_rate": 0.0002745, "loss": 6.8242, "mean_token_accuracy": 0.11318544000387191, "num_tokens": 1264832.0, "step": 550 }, { "entropy": 7.242120885848999, "epoch": 0.054863582443653615, "grad_norm": 1.046875, "learning_rate": 0.000277, "loss": 6.9013, "mean_token_accuracy": 0.1043594166636467, "num_tokens": 1276708.0, "step": 555 }, { "entropy": 7.267107915878296, "epoch": 0.055357848952155, "grad_norm": 1.5, "learning_rate": 0.0002795, "loss": 6.7969, "mean_token_accuracy": 0.11708691790699959, "num_tokens": 1288089.0, "step": 560 }, { "entropy": 7.195605134963989, "epoch": 0.05585211546065639, "grad_norm": 1.1484375, "learning_rate": 0.00028199999999999997, "loss": 6.9462, "mean_token_accuracy": 0.10276999175548554, "num_tokens": 1299411.0, "step": 565 }, { "entropy": 7.24189248085022, "epoch": 0.05634638196915777, "grad_norm": 0.89453125, "learning_rate": 0.0002845, "loss": 6.9311, "mean_token_accuracy": 0.10456405952572823, "num_tokens": 1311368.0, "step": 570 }, { "entropy": 7.220668077468872, "epoch": 0.056840648477659156, "grad_norm": 1.078125, "learning_rate": 0.000287, "loss": 6.8516, "mean_token_accuracy": 0.11227458119392394, "num_tokens": 1321962.0, "step": 575 }, { "entropy": 7.196398830413818, "epoch": 0.057334914986160536, "grad_norm": 0.98046875, "learning_rate": 0.0002895, "loss": 6.8289, "mean_token_accuracy": 0.11454056426882744, "num_tokens": 1335150.0, "step": 580 }, { "entropy": 7.223259687423706, "epoch": 0.05782918149466192, "grad_norm": 0.94921875, "learning_rate": 0.000292, "loss": 6.8781, "mean_token_accuracy": 0.11283383145928383, "num_tokens": 1346986.0, "step": 585 }, { "entropy": 7.1827106952667235, "epoch": 0.0583234480031633, "grad_norm": 1.1328125, "learning_rate": 0.0002945, "loss": 6.8096, "mean_token_accuracy": 0.11008091494441033, "num_tokens": 1357820.0, "step": 590 }, { "entropy": 7.12157974243164, "epoch": 0.05881771451166469, "grad_norm": 1.3203125, "learning_rate": 0.000297, "loss": 6.7996, "mean_token_accuracy": 0.11600334495306015, "num_tokens": 1368269.0, "step": 595 }, { "entropy": 7.093701171875, "epoch": 0.05931198102016608, "grad_norm": 0.96875, "learning_rate": 0.0002995, "loss": 6.8325, "mean_token_accuracy": 0.10474282503128052, "num_tokens": 1380364.0, "step": 600 }, { "entropy": 7.230424165725708, "epoch": 0.05980624752866746, "grad_norm": 1.15625, "learning_rate": 0.000302, "loss": 6.7834, "mean_token_accuracy": 0.11662303283810616, "num_tokens": 1390667.0, "step": 605 }, { "entropy": 7.1123291015625, "epoch": 0.060300514037168844, "grad_norm": 1.0546875, "learning_rate": 0.0003045, "loss": 6.74, "mean_token_accuracy": 0.11314672902226448, "num_tokens": 1401452.0, "step": 610 }, { "entropy": 7.08479061126709, "epoch": 0.060794780545670224, "grad_norm": 1.046875, "learning_rate": 0.000307, "loss": 6.738, "mean_token_accuracy": 0.10963475927710534, "num_tokens": 1412947.0, "step": 615 }, { "entropy": 7.127987480163574, "epoch": 0.06128904705417161, "grad_norm": 1.0390625, "learning_rate": 0.0003095, "loss": 6.8109, "mean_token_accuracy": 0.10360400006175041, "num_tokens": 1425123.0, "step": 620 }, { "entropy": 7.153063583374023, "epoch": 0.06178331356267299, "grad_norm": 0.99609375, "learning_rate": 0.000312, "loss": 6.7645, "mean_token_accuracy": 0.11070188730955124, "num_tokens": 1436538.0, "step": 625 }, { "entropy": 7.101979494094849, "epoch": 0.06227758007117438, "grad_norm": 0.984375, "learning_rate": 0.0003145, "loss": 6.8117, "mean_token_accuracy": 0.10509998053312301, "num_tokens": 1448269.0, "step": 630 }, { "entropy": 7.106948661804199, "epoch": 0.06277184657967576, "grad_norm": 1.0390625, "learning_rate": 0.000317, "loss": 6.788, "mean_token_accuracy": 0.11462685242295265, "num_tokens": 1459729.0, "step": 635 }, { "entropy": 7.1686571598052975, "epoch": 0.06326611308817714, "grad_norm": 1.0390625, "learning_rate": 0.0003195, "loss": 6.8043, "mean_token_accuracy": 0.11152929291129113, "num_tokens": 1470684.0, "step": 640 }, { "entropy": 7.013633441925049, "epoch": 0.06376037959667853, "grad_norm": 0.8359375, "learning_rate": 0.000322, "loss": 6.7587, "mean_token_accuracy": 0.1101705864071846, "num_tokens": 1483571.0, "step": 645 }, { "entropy": 7.109546422958374, "epoch": 0.06425464610517992, "grad_norm": 0.984375, "learning_rate": 0.00032450000000000003, "loss": 6.7362, "mean_token_accuracy": 0.11758828014135361, "num_tokens": 1494671.0, "step": 650 }, { "entropy": 7.0959288597106935, "epoch": 0.06474891261368129, "grad_norm": 1.2265625, "learning_rate": 0.00032700000000000003, "loss": 6.7585, "mean_token_accuracy": 0.11675207242369652, "num_tokens": 1505435.0, "step": 655 }, { "entropy": 7.204699468612671, "epoch": 0.06524317912218268, "grad_norm": 0.9921875, "learning_rate": 0.00032950000000000004, "loss": 6.8475, "mean_token_accuracy": 0.11172165870666503, "num_tokens": 1518510.0, "step": 660 }, { "entropy": 7.068896198272705, "epoch": 0.06573744563068407, "grad_norm": 1.0703125, "learning_rate": 0.00033200000000000005, "loss": 6.7641, "mean_token_accuracy": 0.11413847506046296, "num_tokens": 1530218.0, "step": 665 }, { "entropy": 7.1204170227050785, "epoch": 0.06623171213918545, "grad_norm": 1.015625, "learning_rate": 0.00033450000000000005, "loss": 6.8049, "mean_token_accuracy": 0.11596491858363152, "num_tokens": 1542486.0, "step": 670 }, { "entropy": 7.062425327301026, "epoch": 0.06672597864768683, "grad_norm": 0.96875, "learning_rate": 0.000337, "loss": 6.8047, "mean_token_accuracy": 0.1089675173163414, "num_tokens": 1553873.0, "step": 675 }, { "entropy": 7.1306592464447025, "epoch": 0.06722024515618821, "grad_norm": 0.9921875, "learning_rate": 0.0003395, "loss": 6.7547, "mean_token_accuracy": 0.11543979942798614, "num_tokens": 1565343.0, "step": 680 }, { "entropy": 7.066051483154297, "epoch": 0.0677145116646896, "grad_norm": 0.94921875, "learning_rate": 0.000342, "loss": 6.8026, "mean_token_accuracy": 0.11002968549728394, "num_tokens": 1577061.0, "step": 685 }, { "entropy": 7.14155158996582, "epoch": 0.06820877817319099, "grad_norm": 1.015625, "learning_rate": 0.00034449999999999997, "loss": 6.8113, "mean_token_accuracy": 0.1125007539987564, "num_tokens": 1588083.0, "step": 690 }, { "entropy": 7.073976802825928, "epoch": 0.06870304468169237, "grad_norm": 0.96875, "learning_rate": 0.000347, "loss": 6.7554, "mean_token_accuracy": 0.10692217722535133, "num_tokens": 1599796.0, "step": 695 }, { "entropy": 7.1110053062438965, "epoch": 0.06919731119019375, "grad_norm": 0.9765625, "learning_rate": 0.0003495, "loss": 6.8121, "mean_token_accuracy": 0.11048990935087204, "num_tokens": 1611994.0, "step": 700 }, { "entropy": 7.0139154434204105, "epoch": 0.06969157769869513, "grad_norm": 1.0390625, "learning_rate": 0.000352, "loss": 6.7507, "mean_token_accuracy": 0.10957834497094154, "num_tokens": 1623280.0, "step": 705 }, { "entropy": 7.106026649475098, "epoch": 0.07018584420719652, "grad_norm": 1.125, "learning_rate": 0.0003545, "loss": 6.808, "mean_token_accuracy": 0.11340730711817741, "num_tokens": 1634989.0, "step": 710 }, { "entropy": 7.131832885742187, "epoch": 0.07068011071569791, "grad_norm": 0.9609375, "learning_rate": 0.000357, "loss": 6.8305, "mean_token_accuracy": 0.10883578062057495, "num_tokens": 1647042.0, "step": 715 }, { "entropy": 7.011553001403809, "epoch": 0.0711743772241993, "grad_norm": 1.0, "learning_rate": 0.0003595, "loss": 6.7172, "mean_token_accuracy": 0.11980939731001854, "num_tokens": 1659245.0, "step": 720 }, { "entropy": 6.99677586555481, "epoch": 0.07166864373270067, "grad_norm": 1.0390625, "learning_rate": 0.000362, "loss": 6.7013, "mean_token_accuracy": 0.11443367972970009, "num_tokens": 1670271.0, "step": 725 }, { "entropy": 7.0444377899169925, "epoch": 0.07216291024120206, "grad_norm": 0.9609375, "learning_rate": 0.0003645, "loss": 6.7708, "mean_token_accuracy": 0.11387339234352112, "num_tokens": 1682648.0, "step": 730 }, { "entropy": 7.0597460746765135, "epoch": 0.07265717674970344, "grad_norm": 1.0234375, "learning_rate": 0.000367, "loss": 6.7893, "mean_token_accuracy": 0.10786014571785926, "num_tokens": 1694542.0, "step": 735 }, { "entropy": 7.062112951278687, "epoch": 0.07315144325820483, "grad_norm": 0.9375, "learning_rate": 0.0003695, "loss": 6.6807, "mean_token_accuracy": 0.11052479296922683, "num_tokens": 1705737.0, "step": 740 }, { "entropy": 7.024798059463501, "epoch": 0.0736457097667062, "grad_norm": 0.90625, "learning_rate": 0.000372, "loss": 6.7446, "mean_token_accuracy": 0.11467356607317924, "num_tokens": 1718474.0, "step": 745 }, { "entropy": 7.036571741104126, "epoch": 0.07413997627520759, "grad_norm": 1.0703125, "learning_rate": 0.0003745, "loss": 6.7323, "mean_token_accuracy": 0.11398957073688507, "num_tokens": 1729360.0, "step": 750 }, { "entropy": 6.9887631893157955, "epoch": 0.07463424278370898, "grad_norm": 1.015625, "learning_rate": 0.000377, "loss": 6.7255, "mean_token_accuracy": 0.11519158333539962, "num_tokens": 1739654.0, "step": 755 }, { "entropy": 7.033215522766113, "epoch": 0.07512850929221036, "grad_norm": 1.1640625, "learning_rate": 0.0003795, "loss": 6.7387, "mean_token_accuracy": 0.1136898435652256, "num_tokens": 1752158.0, "step": 760 }, { "entropy": 7.069390344619751, "epoch": 0.07562277580071175, "grad_norm": 1.0703125, "learning_rate": 0.000382, "loss": 6.7168, "mean_token_accuracy": 0.11647839024662972, "num_tokens": 1764545.0, "step": 765 }, { "entropy": 6.947335958480835, "epoch": 0.07611704230921312, "grad_norm": 1.234375, "learning_rate": 0.0003845, "loss": 6.7149, "mean_token_accuracy": 0.11350835710763932, "num_tokens": 1775422.0, "step": 770 }, { "entropy": 7.006612300872803, "epoch": 0.07661130881771451, "grad_norm": 0.8359375, "learning_rate": 0.00038700000000000003, "loss": 6.7434, "mean_token_accuracy": 0.10612287968397141, "num_tokens": 1787833.0, "step": 775 }, { "entropy": 6.998319816589356, "epoch": 0.0771055753262159, "grad_norm": 1.1328125, "learning_rate": 0.00038950000000000003, "loss": 6.6043, "mean_token_accuracy": 0.12429658696055412, "num_tokens": 1798508.0, "step": 780 }, { "entropy": 7.004573345184326, "epoch": 0.07759984183471728, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.659, "mean_token_accuracy": 0.1183803491294384, "num_tokens": 1809873.0, "step": 785 }, { "entropy": 7.007242250442505, "epoch": 0.07809410834321866, "grad_norm": 1.2734375, "learning_rate": 0.00039450000000000005, "loss": 6.7413, "mean_token_accuracy": 0.11312813088297843, "num_tokens": 1820876.0, "step": 790 }, { "entropy": 6.948212289810181, "epoch": 0.07858837485172004, "grad_norm": 0.9765625, "learning_rate": 0.00039700000000000005, "loss": 6.699, "mean_token_accuracy": 0.10882346406579017, "num_tokens": 1833233.0, "step": 795 }, { "entropy": 7.106487035751343, "epoch": 0.07908264136022143, "grad_norm": 1.0390625, "learning_rate": 0.0003995, "loss": 6.778, "mean_token_accuracy": 0.10910732001066208, "num_tokens": 1844520.0, "step": 800 }, { "entropy": 6.8816266536712645, "epoch": 0.07957690786872282, "grad_norm": 0.98046875, "learning_rate": 0.000402, "loss": 6.6648, "mean_token_accuracy": 0.12200288325548173, "num_tokens": 1856814.0, "step": 805 }, { "entropy": 6.97114930152893, "epoch": 0.0800711743772242, "grad_norm": 0.8671875, "learning_rate": 0.0004045, "loss": 6.6628, "mean_token_accuracy": 0.12218885123729706, "num_tokens": 1867581.0, "step": 810 }, { "entropy": 6.999241828918457, "epoch": 0.08056544088572558, "grad_norm": 1.3359375, "learning_rate": 0.00040699999999999997, "loss": 6.7072, "mean_token_accuracy": 0.10921736285090447, "num_tokens": 1879302.0, "step": 815 }, { "entropy": 6.969866561889648, "epoch": 0.08105970739422697, "grad_norm": 1.0390625, "learning_rate": 0.0004095, "loss": 6.6885, "mean_token_accuracy": 0.10975500419735909, "num_tokens": 1891697.0, "step": 820 }, { "entropy": 6.910426378250122, "epoch": 0.08155397390272835, "grad_norm": 1.0546875, "learning_rate": 0.000412, "loss": 6.6127, "mean_token_accuracy": 0.11688940823078156, "num_tokens": 1903544.0, "step": 825 }, { "entropy": 7.008802366256714, "epoch": 0.08204824041122974, "grad_norm": 1.1640625, "learning_rate": 0.0004145, "loss": 6.6874, "mean_token_accuracy": 0.11403921097517014, "num_tokens": 1915286.0, "step": 830 }, { "entropy": 6.882919025421143, "epoch": 0.08254250691973111, "grad_norm": 1.109375, "learning_rate": 0.000417, "loss": 6.566, "mean_token_accuracy": 0.11978555917739868, "num_tokens": 1926361.0, "step": 835 }, { "entropy": 6.969589138031006, "epoch": 0.0830367734282325, "grad_norm": 0.93359375, "learning_rate": 0.0004195, "loss": 6.6586, "mean_token_accuracy": 0.11664789393544198, "num_tokens": 1938540.0, "step": 840 }, { "entropy": 6.94748272895813, "epoch": 0.08353103993673389, "grad_norm": 0.9375, "learning_rate": 0.000422, "loss": 6.6722, "mean_token_accuracy": 0.1142181321978569, "num_tokens": 1950532.0, "step": 845 }, { "entropy": 7.009950017929077, "epoch": 0.08402530644523527, "grad_norm": 1.0234375, "learning_rate": 0.0004245, "loss": 6.688, "mean_token_accuracy": 0.11444820910692215, "num_tokens": 1960899.0, "step": 850 }, { "entropy": 6.877012252807617, "epoch": 0.08451957295373666, "grad_norm": 1.0625, "learning_rate": 0.000427, "loss": 6.6664, "mean_token_accuracy": 0.11932071298360825, "num_tokens": 1972278.0, "step": 855 }, { "entropy": 6.944576215744019, "epoch": 0.08501383946223803, "grad_norm": 0.984375, "learning_rate": 0.0004295, "loss": 6.6772, "mean_token_accuracy": 0.11343410313129425, "num_tokens": 1985079.0, "step": 860 }, { "entropy": 6.87914719581604, "epoch": 0.08550810597073942, "grad_norm": 1.0, "learning_rate": 0.000432, "loss": 6.717, "mean_token_accuracy": 0.10890110954642296, "num_tokens": 1996467.0, "step": 865 }, { "entropy": 7.0112952709198, "epoch": 0.08600237247924081, "grad_norm": 0.98828125, "learning_rate": 0.0004345, "loss": 6.5965, "mean_token_accuracy": 0.11732956543564796, "num_tokens": 2007339.0, "step": 870 }, { "entropy": 6.880322694778442, "epoch": 0.0864966389877422, "grad_norm": 1.03125, "learning_rate": 0.000437, "loss": 6.6191, "mean_token_accuracy": 0.12273732423782349, "num_tokens": 2019962.0, "step": 875 }, { "entropy": 6.9337687492370605, "epoch": 0.08699090549624358, "grad_norm": 1.109375, "learning_rate": 0.0004395, "loss": 6.5968, "mean_token_accuracy": 0.12427836582064629, "num_tokens": 2031251.0, "step": 880 }, { "entropy": 6.820502090454101, "epoch": 0.08748517200474495, "grad_norm": 0.95703125, "learning_rate": 0.000442, "loss": 6.6173, "mean_token_accuracy": 0.1142122581601143, "num_tokens": 2042412.0, "step": 885 }, { "entropy": 6.907873010635376, "epoch": 0.08797943851324634, "grad_norm": 1.015625, "learning_rate": 0.0004445, "loss": 6.6431, "mean_token_accuracy": 0.11822873800992965, "num_tokens": 2054423.0, "step": 890 }, { "entropy": 6.863052892684936, "epoch": 0.08847370502174773, "grad_norm": 1.0390625, "learning_rate": 0.000447, "loss": 6.6224, "mean_token_accuracy": 0.11389594078063965, "num_tokens": 2065657.0, "step": 895 }, { "entropy": 6.908948945999145, "epoch": 0.08896797153024912, "grad_norm": 0.99609375, "learning_rate": 0.00044950000000000003, "loss": 6.5882, "mean_token_accuracy": 0.12156546339392663, "num_tokens": 2076305.0, "step": 900 }, { "entropy": 6.855497550964356, "epoch": 0.08946223803875049, "grad_norm": 1.1328125, "learning_rate": 0.00045200000000000004, "loss": 6.6008, "mean_token_accuracy": 0.1167502075433731, "num_tokens": 2087734.0, "step": 905 }, { "entropy": 6.798408842086792, "epoch": 0.08995650454725188, "grad_norm": 0.98046875, "learning_rate": 0.00045450000000000004, "loss": 6.5, "mean_token_accuracy": 0.12408471554517746, "num_tokens": 2098016.0, "step": 910 }, { "entropy": 6.817918014526367, "epoch": 0.09045077105575326, "grad_norm": 0.9921875, "learning_rate": 0.00045700000000000005, "loss": 6.6752, "mean_token_accuracy": 0.11778675690293312, "num_tokens": 2110293.0, "step": 915 }, { "entropy": 6.892794036865235, "epoch": 0.09094503756425465, "grad_norm": 1.0078125, "learning_rate": 0.00045950000000000006, "loss": 6.4743, "mean_token_accuracy": 0.12243440523743629, "num_tokens": 2120441.0, "step": 920 }, { "entropy": 6.797029685974121, "epoch": 0.09143930407275604, "grad_norm": 1.0078125, "learning_rate": 0.000462, "loss": 6.5657, "mean_token_accuracy": 0.12534191459417343, "num_tokens": 2131520.0, "step": 925 }, { "entropy": 6.813828420639038, "epoch": 0.09193357058125741, "grad_norm": 0.8359375, "learning_rate": 0.0004645, "loss": 6.5991, "mean_token_accuracy": 0.11672990769147873, "num_tokens": 2145005.0, "step": 930 }, { "entropy": 6.872094964981079, "epoch": 0.0924278370897588, "grad_norm": 1.0, "learning_rate": 0.000467, "loss": 6.5506, "mean_token_accuracy": 0.12510338500142099, "num_tokens": 2156608.0, "step": 935 }, { "entropy": 6.760220718383789, "epoch": 0.09292210359826018, "grad_norm": 1.0390625, "learning_rate": 0.0004695, "loss": 6.5463, "mean_token_accuracy": 0.1284232459962368, "num_tokens": 2168341.0, "step": 940 }, { "entropy": 6.826963710784912, "epoch": 0.09341637010676157, "grad_norm": 1.0703125, "learning_rate": 0.000472, "loss": 6.5516, "mean_token_accuracy": 0.114336409419775, "num_tokens": 2178704.0, "step": 945 }, { "entropy": 6.916041135787964, "epoch": 0.09391063661526294, "grad_norm": 1.03125, "learning_rate": 0.0004745, "loss": 6.7081, "mean_token_accuracy": 0.11039185151457787, "num_tokens": 2190884.0, "step": 950 }, { "entropy": 6.903425168991089, "epoch": 0.09440490312376433, "grad_norm": 1.0234375, "learning_rate": 0.000477, "loss": 6.6124, "mean_token_accuracy": 0.11909380853176117, "num_tokens": 2201822.0, "step": 955 }, { "entropy": 6.817460918426514, "epoch": 0.09489916963226572, "grad_norm": 0.97265625, "learning_rate": 0.0004795, "loss": 6.6002, "mean_token_accuracy": 0.11638330668210983, "num_tokens": 2213362.0, "step": 960 }, { "entropy": 6.884056949615479, "epoch": 0.0953934361407671, "grad_norm": 0.9765625, "learning_rate": 0.000482, "loss": 6.6144, "mean_token_accuracy": 0.1184050552546978, "num_tokens": 2224366.0, "step": 965 }, { "entropy": 6.7438822269439695, "epoch": 0.09588770264926849, "grad_norm": 1.1015625, "learning_rate": 0.0004845, "loss": 6.4661, "mean_token_accuracy": 0.1230374664068222, "num_tokens": 2234645.0, "step": 970 }, { "entropy": 6.803455400466919, "epoch": 0.09638196915776986, "grad_norm": 1.0703125, "learning_rate": 0.000487, "loss": 6.5548, "mean_token_accuracy": 0.12610765993595124, "num_tokens": 2245904.0, "step": 975 }, { "entropy": 6.681088209152222, "epoch": 0.09687623566627125, "grad_norm": 0.98046875, "learning_rate": 0.0004895, "loss": 6.4954, "mean_token_accuracy": 0.12240897715091706, "num_tokens": 2257753.0, "step": 980 }, { "entropy": 6.754433631896973, "epoch": 0.09737050217477264, "grad_norm": 1.0, "learning_rate": 0.000492, "loss": 6.5155, "mean_token_accuracy": 0.12655969709157944, "num_tokens": 2269009.0, "step": 985 }, { "entropy": 6.843816947937012, "epoch": 0.09786476868327403, "grad_norm": 1.0, "learning_rate": 0.0004945, "loss": 6.558, "mean_token_accuracy": 0.11670292690396308, "num_tokens": 2279840.0, "step": 990 }, { "entropy": 6.755049037933349, "epoch": 0.0983590351917754, "grad_norm": 1.0703125, "learning_rate": 0.000497, "loss": 6.5349, "mean_token_accuracy": 0.11820845976471901, "num_tokens": 2290577.0, "step": 995 }, { "entropy": 6.765120506286621, "epoch": 0.09885330170027679, "grad_norm": 1.1171875, "learning_rate": 0.0004995, "loss": 6.5345, "mean_token_accuracy": 0.12245884612202644, "num_tokens": 2301341.0, "step": 1000 }, { "entropy": 6.746102571487427, "epoch": 0.09934756820877817, "grad_norm": 0.98046875, "learning_rate": 0.0004999999982287888, "loss": 6.5783, "mean_token_accuracy": 0.12232246473431588, "num_tokens": 2312505.0, "step": 1005 }, { "entropy": 6.866240930557251, "epoch": 0.09984183471727956, "grad_norm": 1.0234375, "learning_rate": 0.0004999999910332434, "loss": 6.5172, "mean_token_accuracy": 0.11665143966674804, "num_tokens": 2323443.0, "step": 1010 }, { "entropy": 6.745142984390259, "epoch": 0.10033610122578095, "grad_norm": 1.046875, "learning_rate": 0.0004999999783026635, "loss": 6.5361, "mean_token_accuracy": 0.11963617578148841, "num_tokens": 2335686.0, "step": 1015 }, { "entropy": 6.703868341445923, "epoch": 0.10083036773428232, "grad_norm": 1.0234375, "learning_rate": 0.0004999999600370491, "loss": 6.517, "mean_token_accuracy": 0.11855524033308029, "num_tokens": 2347273.0, "step": 1020 }, { "entropy": 6.730478429794312, "epoch": 0.1013246342427837, "grad_norm": 1.1015625, "learning_rate": 0.0004999999362364008, "loss": 6.4405, "mean_token_accuracy": 0.13110232651233672, "num_tokens": 2358011.0, "step": 1025 }, { "entropy": 6.7004495620727536, "epoch": 0.1018189007512851, "grad_norm": 0.99609375, "learning_rate": 0.0004999999069007191, "loss": 6.5822, "mean_token_accuracy": 0.1172802321612835, "num_tokens": 2371390.0, "step": 1030 }, { "entropy": 6.794222068786621, "epoch": 0.10231316725978648, "grad_norm": 1.1015625, "learning_rate": 0.0004999998720300048, "loss": 6.5474, "mean_token_accuracy": 0.12140254527330399, "num_tokens": 2381887.0, "step": 1035 }, { "entropy": 6.795210361480713, "epoch": 0.10280743376828787, "grad_norm": 0.86328125, "learning_rate": 0.0004999998316242589, "loss": 6.4809, "mean_token_accuracy": 0.12476008459925651, "num_tokens": 2393632.0, "step": 1040 }, { "entropy": 6.711300373077393, "epoch": 0.10330170027678924, "grad_norm": 1.0234375, "learning_rate": 0.0004999997856834821, "loss": 6.4915, "mean_token_accuracy": 0.12174365520477295, "num_tokens": 2405686.0, "step": 1045 }, { "entropy": 6.642526435852051, "epoch": 0.10379596678529063, "grad_norm": 0.92578125, "learning_rate": 0.0004999997342076757, "loss": 6.458, "mean_token_accuracy": 0.12098277881741523, "num_tokens": 2417459.0, "step": 1050 }, { "entropy": 6.810392236709594, "epoch": 0.10429023329379201, "grad_norm": 0.921875, "learning_rate": 0.0004999996771968408, "loss": 6.5135, "mean_token_accuracy": 0.12017063796520233, "num_tokens": 2428689.0, "step": 1055 }, { "entropy": 6.64630160331726, "epoch": 0.1047844998022934, "grad_norm": 1.0390625, "learning_rate": 0.0004999996146509791, "loss": 6.5336, "mean_token_accuracy": 0.11422798931598663, "num_tokens": 2439437.0, "step": 1060 }, { "entropy": 6.869584083557129, "epoch": 0.10527876631079477, "grad_norm": 0.96875, "learning_rate": 0.0004999995465700919, "loss": 6.5124, "mean_token_accuracy": 0.12146430611610412, "num_tokens": 2450576.0, "step": 1065 }, { "entropy": 6.80404257774353, "epoch": 0.10577303281929616, "grad_norm": 1.0, "learning_rate": 0.0004999994729541809, "loss": 6.6452, "mean_token_accuracy": 0.11663848459720612, "num_tokens": 2462684.0, "step": 1070 }, { "entropy": 6.779199504852295, "epoch": 0.10626729932779755, "grad_norm": 1.15625, "learning_rate": 0.0004999993938032481, "loss": 6.5343, "mean_token_accuracy": 0.12712442725896836, "num_tokens": 2474193.0, "step": 1075 }, { "entropy": 6.629879188537598, "epoch": 0.10676156583629894, "grad_norm": 0.93359375, "learning_rate": 0.0004999993091172952, "loss": 6.4598, "mean_token_accuracy": 0.12284933924674987, "num_tokens": 2486264.0, "step": 1080 }, { "entropy": 6.699342727661133, "epoch": 0.10725583234480032, "grad_norm": 0.99609375, "learning_rate": 0.0004999992188963245, "loss": 6.4663, "mean_token_accuracy": 0.1300704911351204, "num_tokens": 2497668.0, "step": 1085 }, { "entropy": 6.698151445388794, "epoch": 0.1077500988533017, "grad_norm": 0.96875, "learning_rate": 0.000499999123140338, "loss": 6.5149, "mean_token_accuracy": 0.11959851160645485, "num_tokens": 2509635.0, "step": 1090 }, { "entropy": 6.730442905426026, "epoch": 0.10824436536180308, "grad_norm": 1.0703125, "learning_rate": 0.0004999990218493382, "loss": 6.5092, "mean_token_accuracy": 0.12682930305600165, "num_tokens": 2521980.0, "step": 1095 }, { "entropy": 6.709285688400269, "epoch": 0.10873863187030447, "grad_norm": 0.90625, "learning_rate": 0.0004999989150233276, "loss": 6.476, "mean_token_accuracy": 0.12090066596865653, "num_tokens": 2533750.0, "step": 1100 }, { "entropy": 6.731018304824829, "epoch": 0.10923289837880586, "grad_norm": 0.96875, "learning_rate": 0.0004999988026623088, "loss": 6.5731, "mean_token_accuracy": 0.11578204408288002, "num_tokens": 2545620.0, "step": 1105 }, { "entropy": 6.651696014404297, "epoch": 0.10972716488730723, "grad_norm": 1.078125, "learning_rate": 0.0004999986847662843, "loss": 6.3392, "mean_token_accuracy": 0.13319482430815696, "num_tokens": 2556463.0, "step": 1110 }, { "entropy": 6.734298992156982, "epoch": 0.11022143139580862, "grad_norm": 1.0546875, "learning_rate": 0.0004999985613352576, "loss": 6.5389, "mean_token_accuracy": 0.12397273704409599, "num_tokens": 2567396.0, "step": 1115 }, { "entropy": 6.686400699615478, "epoch": 0.11071569790431, "grad_norm": 0.90234375, "learning_rate": 0.0004999984323692311, "loss": 6.4722, "mean_token_accuracy": 0.12991662919521332, "num_tokens": 2579208.0, "step": 1120 }, { "entropy": 6.661752843856812, "epoch": 0.11120996441281139, "grad_norm": 0.953125, "learning_rate": 0.0004999982978682085, "loss": 6.4304, "mean_token_accuracy": 0.12975354716181756, "num_tokens": 2590940.0, "step": 1125 }, { "entropy": 6.747511720657348, "epoch": 0.11170423092131278, "grad_norm": 0.90234375, "learning_rate": 0.0004999981578321927, "loss": 6.5076, "mean_token_accuracy": 0.1310792900621891, "num_tokens": 2602491.0, "step": 1130 }, { "entropy": 6.611108875274658, "epoch": 0.11219849742981415, "grad_norm": 1.2109375, "learning_rate": 0.0004999980122611874, "loss": 6.3471, "mean_token_accuracy": 0.1327824428677559, "num_tokens": 2612139.0, "step": 1135 }, { "entropy": 6.693927431106568, "epoch": 0.11269276393831554, "grad_norm": 0.984375, "learning_rate": 0.000499997861155196, "loss": 6.5011, "mean_token_accuracy": 0.1247858576476574, "num_tokens": 2624906.0, "step": 1140 }, { "entropy": 6.6354106903076175, "epoch": 0.11318703044681692, "grad_norm": 0.99609375, "learning_rate": 0.0004999977045142223, "loss": 6.4276, "mean_token_accuracy": 0.12271838635206223, "num_tokens": 2636046.0, "step": 1145 }, { "entropy": 6.691875314712524, "epoch": 0.11368129695531831, "grad_norm": 1.078125, "learning_rate": 0.0004999975423382703, "loss": 6.4263, "mean_token_accuracy": 0.13008476421236992, "num_tokens": 2645617.0, "step": 1150 }, { "entropy": 6.7659107685089115, "epoch": 0.11417556346381968, "grad_norm": 1.0, "learning_rate": 0.0004999973746273438, "loss": 6.4566, "mean_token_accuracy": 0.1254364877939224, "num_tokens": 2656780.0, "step": 1155 }, { "entropy": 6.659218263626099, "epoch": 0.11466982997232107, "grad_norm": 1.0078125, "learning_rate": 0.000499997201381447, "loss": 6.4534, "mean_token_accuracy": 0.1278814695775509, "num_tokens": 2668078.0, "step": 1160 }, { "entropy": 6.662109756469727, "epoch": 0.11516409648082246, "grad_norm": 1.0625, "learning_rate": 0.0004999970226005841, "loss": 6.5122, "mean_token_accuracy": 0.12168930992484092, "num_tokens": 2679049.0, "step": 1165 }, { "entropy": 6.731383752822876, "epoch": 0.11565836298932385, "grad_norm": 0.92578125, "learning_rate": 0.0004999968382847595, "loss": 6.4737, "mean_token_accuracy": 0.1280827172100544, "num_tokens": 2690165.0, "step": 1170 }, { "entropy": 6.73934531211853, "epoch": 0.11615262949782523, "grad_norm": 1.015625, "learning_rate": 0.0004999966484339778, "loss": 6.503, "mean_token_accuracy": 0.11856682375073432, "num_tokens": 2701965.0, "step": 1175 }, { "entropy": 6.5927499294281, "epoch": 0.1166468960063266, "grad_norm": 1.03125, "learning_rate": 0.0004999964530482437, "loss": 6.4146, "mean_token_accuracy": 0.12625361010432243, "num_tokens": 2713479.0, "step": 1180 }, { "entropy": 6.668395376205444, "epoch": 0.11714116251482799, "grad_norm": 1.0390625, "learning_rate": 0.0004999962521275619, "loss": 6.4271, "mean_token_accuracy": 0.12376236468553543, "num_tokens": 2725629.0, "step": 1185 }, { "entropy": 6.4717286109924315, "epoch": 0.11763542902332938, "grad_norm": 1.0234375, "learning_rate": 0.0004999960456719374, "loss": 6.3471, "mean_token_accuracy": 0.123749740421772, "num_tokens": 2736620.0, "step": 1190 }, { "entropy": 6.62722806930542, "epoch": 0.11812969553183077, "grad_norm": 1.1015625, "learning_rate": 0.0004999958336813753, "loss": 6.3332, "mean_token_accuracy": 0.13400673493742943, "num_tokens": 2747118.0, "step": 1195 }, { "entropy": 6.557834100723267, "epoch": 0.11862396204033215, "grad_norm": 1.0625, "learning_rate": 0.0004999956161558807, "loss": 6.3959, "mean_token_accuracy": 0.12897140979766847, "num_tokens": 2758371.0, "step": 1200 }, { "entropy": 6.586788654327393, "epoch": 0.11911822854883353, "grad_norm": 0.9765625, "learning_rate": 0.0004999953930954591, "loss": 6.392, "mean_token_accuracy": 0.12413987889885902, "num_tokens": 2770575.0, "step": 1205 }, { "entropy": 6.63907904624939, "epoch": 0.11961249505733491, "grad_norm": 0.99609375, "learning_rate": 0.0004999951645001159, "loss": 6.3487, "mean_token_accuracy": 0.12998759970068932, "num_tokens": 2783103.0, "step": 1210 }, { "entropy": 6.585193490982055, "epoch": 0.1201067615658363, "grad_norm": 0.828125, "learning_rate": 0.0004999949303698568, "loss": 6.4645, "mean_token_accuracy": 0.12690217643976212, "num_tokens": 2796636.0, "step": 1215 }, { "entropy": 6.638331365585327, "epoch": 0.12060102807433769, "grad_norm": 1.0078125, "learning_rate": 0.0004999946907046875, "loss": 6.3222, "mean_token_accuracy": 0.13736142292618753, "num_tokens": 2807798.0, "step": 1220 }, { "entropy": 6.535335206985474, "epoch": 0.12109529458283906, "grad_norm": 0.90234375, "learning_rate": 0.0004999944455046139, "loss": 6.4524, "mean_token_accuracy": 0.12832500115036966, "num_tokens": 2819255.0, "step": 1225 }, { "entropy": 6.663571977615357, "epoch": 0.12158956109134045, "grad_norm": 1.015625, "learning_rate": 0.000499994194769642, "loss": 6.3964, "mean_token_accuracy": 0.1270384594798088, "num_tokens": 2829952.0, "step": 1230 }, { "entropy": 6.701180505752563, "epoch": 0.12208382759984183, "grad_norm": 1.0234375, "learning_rate": 0.000499993938499778, "loss": 6.476, "mean_token_accuracy": 0.1340859904885292, "num_tokens": 2841056.0, "step": 1235 }, { "entropy": 6.587615871429444, "epoch": 0.12257809410834322, "grad_norm": 1.125, "learning_rate": 0.0004999936766950283, "loss": 6.3321, "mean_token_accuracy": 0.1331305004656315, "num_tokens": 2852045.0, "step": 1240 }, { "entropy": 6.603626489639282, "epoch": 0.12307236061684461, "grad_norm": 1.015625, "learning_rate": 0.0004999934093553992, "loss": 6.4274, "mean_token_accuracy": 0.1284114196896553, "num_tokens": 2863440.0, "step": 1245 }, { "entropy": 6.648584413528442, "epoch": 0.12356662712534598, "grad_norm": 0.98828125, "learning_rate": 0.0004999931364808972, "loss": 6.4389, "mean_token_accuracy": 0.12790528684854507, "num_tokens": 2874017.0, "step": 1250 }, { "entropy": 6.594161510467529, "epoch": 0.12406089363384737, "grad_norm": 1.046875, "learning_rate": 0.0004999928580715293, "loss": 6.3586, "mean_token_accuracy": 0.13108654990792273, "num_tokens": 2885677.0, "step": 1255 }, { "entropy": 6.574838018417358, "epoch": 0.12455516014234876, "grad_norm": 0.9375, "learning_rate": 0.000499992574127302, "loss": 6.4719, "mean_token_accuracy": 0.12673256024718285, "num_tokens": 2897825.0, "step": 1260 }, { "entropy": 6.713541269302368, "epoch": 0.12504942665085014, "grad_norm": 0.97265625, "learning_rate": 0.0004999922846482226, "loss": 6.5178, "mean_token_accuracy": 0.12139986976981162, "num_tokens": 2909304.0, "step": 1265 }, { "entropy": 6.6441412448883055, "epoch": 0.12554369315935152, "grad_norm": 0.98828125, "learning_rate": 0.0004999919896342981, "loss": 6.4497, "mean_token_accuracy": 0.12221642285585403, "num_tokens": 2920918.0, "step": 1270 }, { "entropy": 6.6605743885040285, "epoch": 0.12603795966785292, "grad_norm": 0.91015625, "learning_rate": 0.0004999916890855358, "loss": 6.394, "mean_token_accuracy": 0.12975434139370917, "num_tokens": 2932294.0, "step": 1275 }, { "entropy": 6.561512088775634, "epoch": 0.1265322261763543, "grad_norm": 1.015625, "learning_rate": 0.0004999913830019431, "loss": 6.3036, "mean_token_accuracy": 0.13787687346339225, "num_tokens": 2943372.0, "step": 1280 }, { "entropy": 6.464610910415649, "epoch": 0.12702649268485566, "grad_norm": 1.03125, "learning_rate": 0.0004999910713835272, "loss": 6.2922, "mean_token_accuracy": 0.1328001670539379, "num_tokens": 2953807.0, "step": 1285 }, { "entropy": 6.581829261779785, "epoch": 0.12752075919335706, "grad_norm": 1.0859375, "learning_rate": 0.0004999907542302962, "loss": 6.2408, "mean_token_accuracy": 0.14087910503149031, "num_tokens": 2964372.0, "step": 1290 }, { "entropy": 6.564945030212402, "epoch": 0.12801502570185844, "grad_norm": 1.0, "learning_rate": 0.0004999904315422577, "loss": 6.3464, "mean_token_accuracy": 0.1339232198894024, "num_tokens": 2975537.0, "step": 1295 }, { "entropy": 6.499995517730713, "epoch": 0.12850929221035984, "grad_norm": 1.0390625, "learning_rate": 0.0004999901033194198, "loss": 6.3155, "mean_token_accuracy": 0.12768632620573045, "num_tokens": 2986094.0, "step": 1300 }, { "entropy": 6.646216011047363, "epoch": 0.1290035587188612, "grad_norm": 1.09375, "learning_rate": 0.0004999897695617904, "loss": 6.4347, "mean_token_accuracy": 0.12920272648334502, "num_tokens": 2996023.0, "step": 1305 }, { "entropy": 6.6123514652252195, "epoch": 0.12949782522736258, "grad_norm": 0.97265625, "learning_rate": 0.0004999894302693778, "loss": 6.4184, "mean_token_accuracy": 0.1242698810994625, "num_tokens": 3007584.0, "step": 1310 }, { "entropy": 6.681271362304687, "epoch": 0.12999209173586398, "grad_norm": 1.1484375, "learning_rate": 0.0004999890854421902, "loss": 6.459, "mean_token_accuracy": 0.1226358100771904, "num_tokens": 3018995.0, "step": 1315 }, { "entropy": 6.480655765533447, "epoch": 0.13048635824436536, "grad_norm": 0.94140625, "learning_rate": 0.0004999887350802362, "loss": 6.2643, "mean_token_accuracy": 0.13495219945907594, "num_tokens": 3030576.0, "step": 1320 }, { "entropy": 6.501480150222778, "epoch": 0.13098062475286676, "grad_norm": 1.0546875, "learning_rate": 0.0004999883791835246, "loss": 6.3262, "mean_token_accuracy": 0.13001331686973572, "num_tokens": 3040765.0, "step": 1325 }, { "entropy": 6.589521598815918, "epoch": 0.13147489126136813, "grad_norm": 0.9140625, "learning_rate": 0.0004999880177520637, "loss": 6.3706, "mean_token_accuracy": 0.12722131982445717, "num_tokens": 3053912.0, "step": 1330 }, { "entropy": 6.452705240249633, "epoch": 0.1319691577698695, "grad_norm": 0.96484375, "learning_rate": 0.0004999876507858628, "loss": 6.3523, "mean_token_accuracy": 0.1288708493113518, "num_tokens": 3065921.0, "step": 1335 }, { "entropy": 6.664311170578003, "epoch": 0.1324634242783709, "grad_norm": 0.91015625, "learning_rate": 0.0004999872782849308, "loss": 6.3949, "mean_token_accuracy": 0.12616097629070283, "num_tokens": 3078643.0, "step": 1340 }, { "entropy": 6.459210395812988, "epoch": 0.13295769078687228, "grad_norm": 0.9765625, "learning_rate": 0.0004999869002492768, "loss": 6.3291, "mean_token_accuracy": 0.12967689260840415, "num_tokens": 3090300.0, "step": 1345 }, { "entropy": 6.512746524810791, "epoch": 0.13345195729537365, "grad_norm": 0.93359375, "learning_rate": 0.0004999865166789102, "loss": 6.2588, "mean_token_accuracy": 0.13676148131489754, "num_tokens": 3102307.0, "step": 1350 }, { "entropy": 6.59787917137146, "epoch": 0.13394622380387505, "grad_norm": 1.015625, "learning_rate": 0.0004999861275738404, "loss": 6.3986, "mean_token_accuracy": 0.12524239718914032, "num_tokens": 3113817.0, "step": 1355 }, { "entropy": 6.543708562850952, "epoch": 0.13444049031237643, "grad_norm": 1.0625, "learning_rate": 0.0004999857329340769, "loss": 6.2545, "mean_token_accuracy": 0.13055241033434867, "num_tokens": 3124719.0, "step": 1360 }, { "entropy": 6.411153316497803, "epoch": 0.13493475682087783, "grad_norm": 0.90234375, "learning_rate": 0.0004999853327596295, "loss": 6.2897, "mean_token_accuracy": 0.13201832994818688, "num_tokens": 3136136.0, "step": 1365 }, { "entropy": 6.56207914352417, "epoch": 0.1354290233293792, "grad_norm": 0.92578125, "learning_rate": 0.000499984927050508, "loss": 6.303, "mean_token_accuracy": 0.13325023874640465, "num_tokens": 3148977.0, "step": 1370 }, { "entropy": 6.551389932632446, "epoch": 0.13592328983788057, "grad_norm": 1.015625, "learning_rate": 0.0004999845158067223, "loss": 6.3633, "mean_token_accuracy": 0.12621287032961845, "num_tokens": 3160520.0, "step": 1375 }, { "entropy": 6.536664581298828, "epoch": 0.13641755634638197, "grad_norm": 0.9609375, "learning_rate": 0.0004999840990282828, "loss": 6.3349, "mean_token_accuracy": 0.13194907903671266, "num_tokens": 3172895.0, "step": 1380 }, { "entropy": 6.496895885467529, "epoch": 0.13691182285488335, "grad_norm": 1.03125, "learning_rate": 0.0004999836767151994, "loss": 6.3416, "mean_token_accuracy": 0.13204838037490846, "num_tokens": 3183960.0, "step": 1385 }, { "entropy": 6.522651672363281, "epoch": 0.13740608936338475, "grad_norm": 1.0703125, "learning_rate": 0.0004999832488674827, "loss": 6.3816, "mean_token_accuracy": 0.12837577536702155, "num_tokens": 3194276.0, "step": 1390 }, { "entropy": 6.513303756713867, "epoch": 0.13790035587188612, "grad_norm": 1.0, "learning_rate": 0.0004999828154851432, "loss": 6.2537, "mean_token_accuracy": 0.13473956882953644, "num_tokens": 3206084.0, "step": 1395 }, { "entropy": 6.524267959594726, "epoch": 0.1383946223803875, "grad_norm": 1.0234375, "learning_rate": 0.0004999823765681915, "loss": 6.2921, "mean_token_accuracy": 0.13728717863559722, "num_tokens": 3217941.0, "step": 1400 }, { "entropy": 6.480133390426635, "epoch": 0.1388888888888889, "grad_norm": 0.9140625, "learning_rate": 0.0004999819321166385, "loss": 6.2548, "mean_token_accuracy": 0.13228702992200853, "num_tokens": 3229088.0, "step": 1405 }, { "entropy": 6.4318465232849125, "epoch": 0.13938315539739027, "grad_norm": 0.9921875, "learning_rate": 0.000499981482130495, "loss": 6.2202, "mean_token_accuracy": 0.13228484094142914, "num_tokens": 3240708.0, "step": 1410 }, { "entropy": 6.46836485862732, "epoch": 0.13987742190589167, "grad_norm": 0.96875, "learning_rate": 0.0004999810266097721, "loss": 6.3368, "mean_token_accuracy": 0.12805040180683136, "num_tokens": 3251040.0, "step": 1415 }, { "entropy": 6.476617431640625, "epoch": 0.14037168841439304, "grad_norm": 1.0546875, "learning_rate": 0.0004999805655544811, "loss": 6.278, "mean_token_accuracy": 0.1379806451499462, "num_tokens": 3262655.0, "step": 1420 }, { "entropy": 6.446955060958862, "epoch": 0.14086595492289442, "grad_norm": 1.046875, "learning_rate": 0.0004999800989646333, "loss": 6.2337, "mean_token_accuracy": 0.13916653543710708, "num_tokens": 3273160.0, "step": 1425 }, { "entropy": 6.492981576919556, "epoch": 0.14136022143139582, "grad_norm": 1.03125, "learning_rate": 0.0004999796268402401, "loss": 6.2586, "mean_token_accuracy": 0.13187761902809142, "num_tokens": 3285932.0, "step": 1430 }, { "entropy": 6.438924407958984, "epoch": 0.1418544879398972, "grad_norm": 0.87109375, "learning_rate": 0.0004999791491813132, "loss": 6.295, "mean_token_accuracy": 0.1294438548386097, "num_tokens": 3298834.0, "step": 1435 }, { "entropy": 6.521294736862183, "epoch": 0.1423487544483986, "grad_norm": 1.03125, "learning_rate": 0.0004999786659878643, "loss": 6.2684, "mean_token_accuracy": 0.1286303736269474, "num_tokens": 3310473.0, "step": 1440 }, { "entropy": 6.372927856445313, "epoch": 0.14284302095689996, "grad_norm": 0.98828125, "learning_rate": 0.0004999781772599055, "loss": 6.2371, "mean_token_accuracy": 0.1356230579316616, "num_tokens": 3322662.0, "step": 1445 }, { "entropy": 6.60296220779419, "epoch": 0.14333728746540134, "grad_norm": 1.0078125, "learning_rate": 0.0004999776829974484, "loss": 6.343, "mean_token_accuracy": 0.13732139021158218, "num_tokens": 3334321.0, "step": 1450 }, { "entropy": 6.441670370101929, "epoch": 0.14383155397390274, "grad_norm": 1.0703125, "learning_rate": 0.0004999771832005055, "loss": 6.2298, "mean_token_accuracy": 0.13349530473351479, "num_tokens": 3345130.0, "step": 1455 }, { "entropy": 6.440216207504273, "epoch": 0.1443258204824041, "grad_norm": 1.015625, "learning_rate": 0.000499976677869089, "loss": 6.2368, "mean_token_accuracy": 0.1323176234960556, "num_tokens": 3355601.0, "step": 1460 }, { "entropy": 6.415243005752563, "epoch": 0.14482008699090548, "grad_norm": 0.9296875, "learning_rate": 0.0004999761670032115, "loss": 6.2209, "mean_token_accuracy": 0.13547109439969063, "num_tokens": 3367075.0, "step": 1465 }, { "entropy": 6.440726089477539, "epoch": 0.14531435349940688, "grad_norm": 0.92578125, "learning_rate": 0.0004999756506028851, "loss": 6.2086, "mean_token_accuracy": 0.13799653053283692, "num_tokens": 3378888.0, "step": 1470 }, { "entropy": 6.460967779159546, "epoch": 0.14580862000790826, "grad_norm": 0.9921875, "learning_rate": 0.0004999751286681229, "loss": 6.2398, "mean_token_accuracy": 0.13389106541872026, "num_tokens": 3390705.0, "step": 1475 }, { "entropy": 6.470330762863159, "epoch": 0.14630288651640966, "grad_norm": 0.953125, "learning_rate": 0.0004999746011989376, "loss": 6.2469, "mean_token_accuracy": 0.141701989620924, "num_tokens": 3401710.0, "step": 1480 }, { "entropy": 6.501716089248657, "epoch": 0.14679715302491103, "grad_norm": 1.0390625, "learning_rate": 0.0004999740681953422, "loss": 6.3595, "mean_token_accuracy": 0.12875558733940123, "num_tokens": 3413467.0, "step": 1485 }, { "entropy": 6.460022449493408, "epoch": 0.1472914195334124, "grad_norm": 1.0, "learning_rate": 0.0004999735296573499, "loss": 6.2957, "mean_token_accuracy": 0.14054137468338013, "num_tokens": 3425885.0, "step": 1490 }, { "entropy": 6.471263265609741, "epoch": 0.1477856860419138, "grad_norm": 0.8828125, "learning_rate": 0.0004999729855849738, "loss": 6.3169, "mean_token_accuracy": 0.12381748557090759, "num_tokens": 3437952.0, "step": 1495 }, { "entropy": 6.476200199127197, "epoch": 0.14827995255041518, "grad_norm": 0.921875, "learning_rate": 0.0004999724359782274, "loss": 6.1794, "mean_token_accuracy": 0.15090513229370117, "num_tokens": 3449680.0, "step": 1500 }, { "entropy": 6.451878356933594, "epoch": 0.14877421905891658, "grad_norm": 1.0390625, "learning_rate": 0.0004999718808371241, "loss": 6.3449, "mean_token_accuracy": 0.12572553679347037, "num_tokens": 3460699.0, "step": 1505 }, { "entropy": 6.50455265045166, "epoch": 0.14926848556741795, "grad_norm": 0.96484375, "learning_rate": 0.0004999713201616776, "loss": 6.211, "mean_token_accuracy": 0.13989587351679802, "num_tokens": 3471919.0, "step": 1510 }, { "entropy": 6.361866235733032, "epoch": 0.14976275207591933, "grad_norm": 1.0078125, "learning_rate": 0.000499970753951902, "loss": 6.3254, "mean_token_accuracy": 0.1308351695537567, "num_tokens": 3484110.0, "step": 1515 }, { "entropy": 6.533850765228271, "epoch": 0.15025701858442073, "grad_norm": 1.0859375, "learning_rate": 0.0004999701822078107, "loss": 6.2239, "mean_token_accuracy": 0.1353417955338955, "num_tokens": 3496103.0, "step": 1520 }, { "entropy": 6.473228120803833, "epoch": 0.1507512850929221, "grad_norm": 1.0703125, "learning_rate": 0.000499969604929418, "loss": 6.3057, "mean_token_accuracy": 0.13488239124417306, "num_tokens": 3507291.0, "step": 1525 }, { "entropy": 6.454948472976684, "epoch": 0.1512455516014235, "grad_norm": 0.9140625, "learning_rate": 0.0004999690221167382, "loss": 6.3017, "mean_token_accuracy": 0.12805337607860565, "num_tokens": 3519564.0, "step": 1530 }, { "entropy": 6.356312274932861, "epoch": 0.15173981810992487, "grad_norm": 0.96875, "learning_rate": 0.0004999684337697855, "loss": 6.1611, "mean_token_accuracy": 0.14256911277770995, "num_tokens": 3530679.0, "step": 1535 }, { "entropy": 6.445040559768676, "epoch": 0.15223408461842625, "grad_norm": 0.87890625, "learning_rate": 0.0004999678398885746, "loss": 6.218, "mean_token_accuracy": 0.13545068502426147, "num_tokens": 3542662.0, "step": 1540 }, { "entropy": 6.442259311676025, "epoch": 0.15272835112692765, "grad_norm": 0.8828125, "learning_rate": 0.0004999672404731197, "loss": 6.3408, "mean_token_accuracy": 0.13151721879839898, "num_tokens": 3554760.0, "step": 1545 }, { "entropy": 6.390431261062622, "epoch": 0.15322261763542902, "grad_norm": 1.0546875, "learning_rate": 0.000499966635523436, "loss": 6.1473, "mean_token_accuracy": 0.14151813611388206, "num_tokens": 3565604.0, "step": 1550 }, { "entropy": 6.489778709411621, "epoch": 0.1537168841439304, "grad_norm": 1.109375, "learning_rate": 0.0004999660250395381, "loss": 6.3114, "mean_token_accuracy": 0.13059073835611343, "num_tokens": 3577535.0, "step": 1555 }, { "entropy": 6.454697751998902, "epoch": 0.1542111506524318, "grad_norm": 0.98046875, "learning_rate": 0.000499965409021441, "loss": 6.3075, "mean_token_accuracy": 0.13098583221435547, "num_tokens": 3590458.0, "step": 1560 }, { "entropy": 6.460421705245972, "epoch": 0.15470541716093317, "grad_norm": 0.9453125, "learning_rate": 0.00049996478746916, "loss": 6.2659, "mean_token_accuracy": 0.13603687211871146, "num_tokens": 3600916.0, "step": 1565 }, { "entropy": 6.387070751190185, "epoch": 0.15519968366943457, "grad_norm": 0.953125, "learning_rate": 0.0004999641603827104, "loss": 6.2793, "mean_token_accuracy": 0.13124272525310515, "num_tokens": 3612794.0, "step": 1570 }, { "entropy": 6.422871780395508, "epoch": 0.15569395017793594, "grad_norm": 1.0390625, "learning_rate": 0.0004999635277621073, "loss": 6.203, "mean_token_accuracy": 0.14298698604106902, "num_tokens": 3624186.0, "step": 1575 }, { "entropy": 6.386454057693482, "epoch": 0.15618821668643731, "grad_norm": 0.9609375, "learning_rate": 0.0004999628896073668, "loss": 6.2294, "mean_token_accuracy": 0.13735796883702278, "num_tokens": 3636041.0, "step": 1580 }, { "entropy": 6.462503433227539, "epoch": 0.15668248319493872, "grad_norm": 1.1328125, "learning_rate": 0.0004999622459185042, "loss": 6.2907, "mean_token_accuracy": 0.13020889237523078, "num_tokens": 3646859.0, "step": 1585 }, { "entropy": 6.398414373397827, "epoch": 0.1571767497034401, "grad_norm": 0.9375, "learning_rate": 0.0004999615966955354, "loss": 6.1157, "mean_token_accuracy": 0.14551621302962303, "num_tokens": 3657853.0, "step": 1590 }, { "entropy": 6.463107538223267, "epoch": 0.1576710162119415, "grad_norm": 1.1328125, "learning_rate": 0.0004999609419384764, "loss": 6.2214, "mean_token_accuracy": 0.13310921415686608, "num_tokens": 3668341.0, "step": 1595 }, { "entropy": 6.392400121688842, "epoch": 0.15816528272044286, "grad_norm": 1.125, "learning_rate": 0.0004999602816473434, "loss": 6.2431, "mean_token_accuracy": 0.1410088613629341, "num_tokens": 3679020.0, "step": 1600 }, { "entropy": 6.408904552459717, "epoch": 0.15865954922894424, "grad_norm": 0.87890625, "learning_rate": 0.0004999596158221526, "loss": 6.1585, "mean_token_accuracy": 0.14006651043891907, "num_tokens": 3691121.0, "step": 1605 }, { "entropy": 6.385823917388916, "epoch": 0.15915381573744564, "grad_norm": 0.9765625, "learning_rate": 0.0004999589444629203, "loss": 6.2152, "mean_token_accuracy": 0.1411613941192627, "num_tokens": 3702584.0, "step": 1610 }, { "entropy": 6.3845240592956545, "epoch": 0.159648082245947, "grad_norm": 1.0234375, "learning_rate": 0.0004999582675696631, "loss": 6.1647, "mean_token_accuracy": 0.13805127739906312, "num_tokens": 3713085.0, "step": 1615 }, { "entropy": 6.46448073387146, "epoch": 0.1601423487544484, "grad_norm": 1.0234375, "learning_rate": 0.0004999575851423976, "loss": 6.2837, "mean_token_accuracy": 0.12872665300965308, "num_tokens": 3724318.0, "step": 1620 }, { "entropy": 6.464413785934449, "epoch": 0.16063661526294978, "grad_norm": 1.03125, "learning_rate": 0.0004999568971811407, "loss": 6.183, "mean_token_accuracy": 0.1430479533970356, "num_tokens": 3734288.0, "step": 1625 }, { "entropy": 6.328683185577392, "epoch": 0.16113088177145116, "grad_norm": 1.0078125, "learning_rate": 0.000499956203685909, "loss": 6.1966, "mean_token_accuracy": 0.13233742043375968, "num_tokens": 3744645.0, "step": 1630 }, { "entropy": 6.442096281051636, "epoch": 0.16162514827995256, "grad_norm": 1.1171875, "learning_rate": 0.00049995550465672, "loss": 6.1817, "mean_token_accuracy": 0.14003336429595947, "num_tokens": 3755660.0, "step": 1635 }, { "entropy": 6.326750326156616, "epoch": 0.16211941478845393, "grad_norm": 1.0078125, "learning_rate": 0.0004999548000935906, "loss": 6.1337, "mean_token_accuracy": 0.1436133176088333, "num_tokens": 3767614.0, "step": 1640 }, { "entropy": 6.386001491546631, "epoch": 0.16261368129695533, "grad_norm": 0.9765625, "learning_rate": 0.0004999540899965383, "loss": 6.2828, "mean_token_accuracy": 0.13778984621167184, "num_tokens": 3780750.0, "step": 1645 }, { "entropy": 6.425701570510864, "epoch": 0.1631079478054567, "grad_norm": 0.98046875, "learning_rate": 0.0004999533743655803, "loss": 6.2734, "mean_token_accuracy": 0.1312929518520832, "num_tokens": 3793195.0, "step": 1650 }, { "entropy": 6.375810956954956, "epoch": 0.16360221431395808, "grad_norm": 1.0859375, "learning_rate": 0.0004999526532007346, "loss": 6.2337, "mean_token_accuracy": 0.14021370857954024, "num_tokens": 3804256.0, "step": 1655 }, { "entropy": 6.400203657150269, "epoch": 0.16409648082245948, "grad_norm": 1.0234375, "learning_rate": 0.0004999519265020187, "loss": 6.211, "mean_token_accuracy": 0.13381656855344773, "num_tokens": 3815403.0, "step": 1660 }, { "entropy": 6.297303676605225, "epoch": 0.16459074733096085, "grad_norm": 1.0234375, "learning_rate": 0.0004999511942694504, "loss": 6.1146, "mean_token_accuracy": 0.1449520155787468, "num_tokens": 3826682.0, "step": 1665 }, { "entropy": 6.372660064697266, "epoch": 0.16508501383946222, "grad_norm": 0.94921875, "learning_rate": 0.0004999504565030479, "loss": 6.13, "mean_token_accuracy": 0.13841361403465272, "num_tokens": 3837780.0, "step": 1670 }, { "entropy": 6.417489624023437, "epoch": 0.16557928034796363, "grad_norm": 0.95703125, "learning_rate": 0.0004999497132028293, "loss": 6.1846, "mean_token_accuracy": 0.13504983931779863, "num_tokens": 3848782.0, "step": 1675 }, { "entropy": 6.337214994430542, "epoch": 0.166073546856465, "grad_norm": 1.015625, "learning_rate": 0.0004999489643688127, "loss": 6.137, "mean_token_accuracy": 0.14474000558257102, "num_tokens": 3859220.0, "step": 1680 }, { "entropy": 6.308086252212524, "epoch": 0.1665678133649664, "grad_norm": 1.0625, "learning_rate": 0.0004999482100010169, "loss": 6.0722, "mean_token_accuracy": 0.1455448277294636, "num_tokens": 3869794.0, "step": 1685 }, { "entropy": 6.305660057067871, "epoch": 0.16706207987346777, "grad_norm": 0.96875, "learning_rate": 0.0004999474500994601, "loss": 6.21, "mean_token_accuracy": 0.13534921333193778, "num_tokens": 3881133.0, "step": 1690 }, { "entropy": 6.372439575195313, "epoch": 0.16755634638196915, "grad_norm": 0.97265625, "learning_rate": 0.0004999466846641611, "loss": 6.1337, "mean_token_accuracy": 0.1381655864417553, "num_tokens": 3891600.0, "step": 1695 }, { "entropy": 6.324881887435913, "epoch": 0.16805061289047055, "grad_norm": 0.87890625, "learning_rate": 0.0004999459136951389, "loss": 6.2368, "mean_token_accuracy": 0.1343551091849804, "num_tokens": 3903287.0, "step": 1700 }, { "entropy": 6.367248630523681, "epoch": 0.16854487939897192, "grad_norm": 0.9921875, "learning_rate": 0.0004999451371924123, "loss": 6.1414, "mean_token_accuracy": 0.14270353838801383, "num_tokens": 3914497.0, "step": 1705 }, { "entropy": 6.32606315612793, "epoch": 0.16903914590747332, "grad_norm": 0.9453125, "learning_rate": 0.0004999443551560003, "loss": 6.1808, "mean_token_accuracy": 0.13897614777088166, "num_tokens": 3925536.0, "step": 1710 }, { "entropy": 6.3809061527252195, "epoch": 0.1695334124159747, "grad_norm": 0.9140625, "learning_rate": 0.0004999435675859224, "loss": 6.1316, "mean_token_accuracy": 0.1441777989268303, "num_tokens": 3936705.0, "step": 1715 }, { "entropy": 6.315342855453491, "epoch": 0.17002767892447607, "grad_norm": 1.09375, "learning_rate": 0.0004999427744821977, "loss": 6.0259, "mean_token_accuracy": 0.14600003734230996, "num_tokens": 3948422.0, "step": 1720 }, { "entropy": 6.263158702850342, "epoch": 0.17052194543297747, "grad_norm": 1.0234375, "learning_rate": 0.000499941975844846, "loss": 6.0986, "mean_token_accuracy": 0.14980924874544144, "num_tokens": 3958697.0, "step": 1725 }, { "entropy": 6.321331548690796, "epoch": 0.17101621194147884, "grad_norm": 0.890625, "learning_rate": 0.0004999411716738866, "loss": 6.1006, "mean_token_accuracy": 0.13610462471842766, "num_tokens": 3970255.0, "step": 1730 }, { "entropy": 6.3515236377716064, "epoch": 0.17151047844998024, "grad_norm": 1.109375, "learning_rate": 0.0004999403619693397, "loss": 6.1847, "mean_token_accuracy": 0.13452404960989953, "num_tokens": 3980892.0, "step": 1735 }, { "entropy": 6.215304851531982, "epoch": 0.17200474495848161, "grad_norm": 1.0078125, "learning_rate": 0.0004999395467312249, "loss": 6.121, "mean_token_accuracy": 0.13866710513830185, "num_tokens": 3991375.0, "step": 1740 }, { "entropy": 6.409534502029419, "epoch": 0.172499011466983, "grad_norm": 0.93359375, "learning_rate": 0.0004999387259595623, "loss": 6.2674, "mean_token_accuracy": 0.1355798661708832, "num_tokens": 4003352.0, "step": 1745 }, { "entropy": 6.323182249069214, "epoch": 0.1729932779754844, "grad_norm": 0.96875, "learning_rate": 0.0004999378996543723, "loss": 6.155, "mean_token_accuracy": 0.13970827013254167, "num_tokens": 4014429.0, "step": 1750 }, { "entropy": 6.331288051605225, "epoch": 0.17348754448398576, "grad_norm": 1.078125, "learning_rate": 0.0004999370678156749, "loss": 6.0876, "mean_token_accuracy": 0.14578365832567214, "num_tokens": 4025213.0, "step": 1755 }, { "entropy": 6.292533731460571, "epoch": 0.17398181099248716, "grad_norm": 1.078125, "learning_rate": 0.0004999362304434909, "loss": 6.0749, "mean_token_accuracy": 0.14500001072883606, "num_tokens": 4036244.0, "step": 1760 }, { "entropy": 6.346677541732788, "epoch": 0.17447607750098854, "grad_norm": 1.0234375, "learning_rate": 0.0004999353875378406, "loss": 6.1308, "mean_token_accuracy": 0.14193734377622605, "num_tokens": 4047944.0, "step": 1765 }, { "entropy": 6.283301496505738, "epoch": 0.1749703440094899, "grad_norm": 0.9453125, "learning_rate": 0.000499934539098745, "loss": 6.0993, "mean_token_accuracy": 0.14384573325514793, "num_tokens": 4058865.0, "step": 1770 }, { "entropy": 6.257331275939942, "epoch": 0.1754646105179913, "grad_norm": 0.99609375, "learning_rate": 0.0004999336851262247, "loss": 6.1444, "mean_token_accuracy": 0.1391538202762604, "num_tokens": 4070627.0, "step": 1775 }, { "entropy": 6.394286632537842, "epoch": 0.17595887702649268, "grad_norm": 0.8984375, "learning_rate": 0.0004999328256203009, "loss": 6.1895, "mean_token_accuracy": 0.1373151198029518, "num_tokens": 4081406.0, "step": 1780 }, { "entropy": 6.353554725646973, "epoch": 0.17645314353499406, "grad_norm": 0.94921875, "learning_rate": 0.0004999319605809947, "loss": 6.1527, "mean_token_accuracy": 0.13284853249788284, "num_tokens": 4092957.0, "step": 1785 }, { "entropy": 6.333940410614014, "epoch": 0.17694741004349546, "grad_norm": 0.984375, "learning_rate": 0.0004999310900083274, "loss": 6.1955, "mean_token_accuracy": 0.1371501013636589, "num_tokens": 4104381.0, "step": 1790 }, { "entropy": 6.325356578826904, "epoch": 0.17744167655199683, "grad_norm": 0.98828125, "learning_rate": 0.0004999302139023204, "loss": 6.1309, "mean_token_accuracy": 0.1423741340637207, "num_tokens": 4117190.0, "step": 1795 }, { "entropy": 6.260775136947632, "epoch": 0.17793594306049823, "grad_norm": 0.984375, "learning_rate": 0.0004999293322629951, "loss": 6.0563, "mean_token_accuracy": 0.14984049201011657, "num_tokens": 4127870.0, "step": 1800 }, { "entropy": 6.272122192382812, "epoch": 0.1784302095689996, "grad_norm": 0.98828125, "learning_rate": 0.0004999284450903736, "loss": 6.1048, "mean_token_accuracy": 0.1465057462453842, "num_tokens": 4139240.0, "step": 1805 }, { "entropy": 6.317811346054077, "epoch": 0.17892447607750098, "grad_norm": 1.0, "learning_rate": 0.0004999275523844772, "loss": 6.082, "mean_token_accuracy": 0.14482868909835817, "num_tokens": 4149885.0, "step": 1810 }, { "entropy": 6.389834928512573, "epoch": 0.17941874258600238, "grad_norm": 1.03125, "learning_rate": 0.0004999266541453283, "loss": 6.2447, "mean_token_accuracy": 0.13586108312010764, "num_tokens": 4161824.0, "step": 1815 }, { "entropy": 6.320416498184204, "epoch": 0.17991300909450375, "grad_norm": 0.953125, "learning_rate": 0.0004999257503729487, "loss": 6.2117, "mean_token_accuracy": 0.13344803750514983, "num_tokens": 4173581.0, "step": 1820 }, { "entropy": 6.351769924163818, "epoch": 0.18040727560300515, "grad_norm": 1.015625, "learning_rate": 0.0004999248410673607, "loss": 6.0812, "mean_token_accuracy": 0.1483595296740532, "num_tokens": 4184843.0, "step": 1825 }, { "entropy": 6.358120441436768, "epoch": 0.18090154211150652, "grad_norm": 1.03125, "learning_rate": 0.0004999239262285869, "loss": 6.1715, "mean_token_accuracy": 0.13489353209733962, "num_tokens": 4195016.0, "step": 1830 }, { "entropy": 6.332878112792969, "epoch": 0.1813958086200079, "grad_norm": 0.97265625, "learning_rate": 0.0004999230058566495, "loss": 6.1183, "mean_token_accuracy": 0.14574753791093825, "num_tokens": 4206798.0, "step": 1835 }, { "entropy": 6.3394999504089355, "epoch": 0.1818900751285093, "grad_norm": 0.94921875, "learning_rate": 0.0004999220799515713, "loss": 6.1039, "mean_token_accuracy": 0.13963396325707436, "num_tokens": 4218784.0, "step": 1840 }, { "entropy": 6.299774408340454, "epoch": 0.18238434163701067, "grad_norm": 0.90234375, "learning_rate": 0.000499921148513375, "loss": 6.1247, "mean_token_accuracy": 0.1387876182794571, "num_tokens": 4229875.0, "step": 1845 }, { "entropy": 6.221422624588013, "epoch": 0.18287860814551207, "grad_norm": 1.03125, "learning_rate": 0.0004999202115420836, "loss": 6.1101, "mean_token_accuracy": 0.1441081039607525, "num_tokens": 4241801.0, "step": 1850 }, { "entropy": 6.324825763702393, "epoch": 0.18337287465401345, "grad_norm": 1.09375, "learning_rate": 0.0004999192690377201, "loss": 6.0913, "mean_token_accuracy": 0.14329453259706498, "num_tokens": 4253168.0, "step": 1855 }, { "entropy": 6.309213781356812, "epoch": 0.18386714116251482, "grad_norm": 0.921875, "learning_rate": 0.0004999183210003076, "loss": 6.1192, "mean_token_accuracy": 0.13910027593374252, "num_tokens": 4264791.0, "step": 1860 }, { "entropy": 6.258148193359375, "epoch": 0.18436140767101622, "grad_norm": 1.1328125, "learning_rate": 0.0004999173674298696, "loss": 6.0608, "mean_token_accuracy": 0.14661507308483124, "num_tokens": 4275816.0, "step": 1865 }, { "entropy": 6.368045091629028, "epoch": 0.1848556741795176, "grad_norm": 1.0390625, "learning_rate": 0.0004999164083264294, "loss": 6.14, "mean_token_accuracy": 0.13778545409440995, "num_tokens": 4287806.0, "step": 1870 }, { "entropy": 6.267383623123169, "epoch": 0.185349940688019, "grad_norm": 0.98046875, "learning_rate": 0.0004999154436900108, "loss": 6.181, "mean_token_accuracy": 0.14197772592306138, "num_tokens": 4300319.0, "step": 1875 }, { "entropy": 6.316354417800904, "epoch": 0.18584420719652037, "grad_norm": 0.9453125, "learning_rate": 0.0004999144735206373, "loss": 6.1769, "mean_token_accuracy": 0.13574445396661758, "num_tokens": 4310987.0, "step": 1880 }, { "entropy": 6.323000907897949, "epoch": 0.18633847370502174, "grad_norm": 0.90234375, "learning_rate": 0.0004999134978183328, "loss": 6.1294, "mean_token_accuracy": 0.14480389952659606, "num_tokens": 4322438.0, "step": 1885 }, { "entropy": 6.3687646865844725, "epoch": 0.18683274021352314, "grad_norm": 1.125, "learning_rate": 0.0004999125165831215, "loss": 6.1741, "mean_token_accuracy": 0.14540814906358718, "num_tokens": 4333242.0, "step": 1890 }, { "entropy": 6.235511398315429, "epoch": 0.1873270067220245, "grad_norm": 1.0390625, "learning_rate": 0.0004999115298150273, "loss": 6.031, "mean_token_accuracy": 0.1450972318649292, "num_tokens": 4343660.0, "step": 1895 }, { "entropy": 6.31268277168274, "epoch": 0.1878212732305259, "grad_norm": 0.9921875, "learning_rate": 0.0004999105375140746, "loss": 6.1154, "mean_token_accuracy": 0.14088804945349692, "num_tokens": 4353382.0, "step": 1900 }, { "entropy": 6.274864387512207, "epoch": 0.1883155397390273, "grad_norm": 1.0078125, "learning_rate": 0.0004999095396802878, "loss": 6.0827, "mean_token_accuracy": 0.13407786786556244, "num_tokens": 4364614.0, "step": 1905 }, { "entropy": 6.314316892623902, "epoch": 0.18880980624752866, "grad_norm": 0.953125, "learning_rate": 0.0004999085363136913, "loss": 6.1375, "mean_token_accuracy": 0.13962836787104607, "num_tokens": 4376001.0, "step": 1910 }, { "entropy": 6.306294870376587, "epoch": 0.18930407275603006, "grad_norm": 1.015625, "learning_rate": 0.00049990752741431, "loss": 6.1602, "mean_token_accuracy": 0.13340804651379584, "num_tokens": 4387083.0, "step": 1915 }, { "entropy": 6.270431327819824, "epoch": 0.18979833926453143, "grad_norm": 0.8828125, "learning_rate": 0.0004999065129821687, "loss": 6.0994, "mean_token_accuracy": 0.14158050566911698, "num_tokens": 4399977.0, "step": 1920 }, { "entropy": 6.206098794937134, "epoch": 0.1902926057730328, "grad_norm": 0.85546875, "learning_rate": 0.0004999054930172923, "loss": 6.0363, "mean_token_accuracy": 0.14246447533369064, "num_tokens": 4411609.0, "step": 1925 }, { "entropy": 6.359363842010498, "epoch": 0.1907868722815342, "grad_norm": 1.0625, "learning_rate": 0.0004999044675197058, "loss": 6.1473, "mean_token_accuracy": 0.14360579550266267, "num_tokens": 4423567.0, "step": 1930 }, { "entropy": 6.191033506393433, "epoch": 0.19128113879003558, "grad_norm": 1.0703125, "learning_rate": 0.0004999034364894345, "loss": 6.1078, "mean_token_accuracy": 0.14449855983257293, "num_tokens": 4435410.0, "step": 1935 }, { "entropy": 6.402541160583496, "epoch": 0.19177540529853698, "grad_norm": 1.0078125, "learning_rate": 0.0004999023999265039, "loss": 6.135, "mean_token_accuracy": 0.14298228770494462, "num_tokens": 4445279.0, "step": 1940 }, { "entropy": 6.226133203506469, "epoch": 0.19226967180703836, "grad_norm": 1.0625, "learning_rate": 0.0004999013578309392, "loss": 6.0133, "mean_token_accuracy": 0.14651723206043243, "num_tokens": 4456017.0, "step": 1945 }, { "entropy": 6.2588560581207275, "epoch": 0.19276393831553973, "grad_norm": 1.0234375, "learning_rate": 0.0004999003102027663, "loss": 6.0097, "mean_token_accuracy": 0.14699807465076448, "num_tokens": 4466759.0, "step": 1950 }, { "entropy": 6.213010692596436, "epoch": 0.19325820482404113, "grad_norm": 0.98046875, "learning_rate": 0.000499899257042011, "loss": 6.0753, "mean_token_accuracy": 0.1432296924293041, "num_tokens": 4478316.0, "step": 1955 }, { "entropy": 6.35000696182251, "epoch": 0.1937524713325425, "grad_norm": 0.953125, "learning_rate": 0.0004998981983486988, "loss": 6.1573, "mean_token_accuracy": 0.13669586628675462, "num_tokens": 4490775.0, "step": 1960 }, { "entropy": 6.219941663742065, "epoch": 0.1942467378410439, "grad_norm": 0.96875, "learning_rate": 0.0004998971341228563, "loss": 6.0091, "mean_token_accuracy": 0.1470404416322708, "num_tokens": 4501622.0, "step": 1965 }, { "entropy": 6.287500047683716, "epoch": 0.19474100434954528, "grad_norm": 0.89453125, "learning_rate": 0.0004998960643645093, "loss": 6.1098, "mean_token_accuracy": 0.14525135159492492, "num_tokens": 4512279.0, "step": 1970 }, { "entropy": 6.271857500076294, "epoch": 0.19523527085804665, "grad_norm": 0.91796875, "learning_rate": 0.0004998949890736841, "loss": 6.0899, "mean_token_accuracy": 0.14391626492142678, "num_tokens": 4524087.0, "step": 1975 }, { "entropy": 6.265537738800049, "epoch": 0.19572953736654805, "grad_norm": 0.99609375, "learning_rate": 0.0004998939082504075, "loss": 6.078, "mean_token_accuracy": 0.1437728226184845, "num_tokens": 4534816.0, "step": 1980 }, { "entropy": 6.251546621322632, "epoch": 0.19622380387504942, "grad_norm": 0.94140625, "learning_rate": 0.0004998928218947057, "loss": 6.0475, "mean_token_accuracy": 0.1464489668607712, "num_tokens": 4545725.0, "step": 1985 }, { "entropy": 6.367499351501465, "epoch": 0.1967180703835508, "grad_norm": 1.0546875, "learning_rate": 0.0004998917300066056, "loss": 6.1585, "mean_token_accuracy": 0.13893528208136557, "num_tokens": 4557003.0, "step": 1990 }, { "entropy": 6.190875053405762, "epoch": 0.1972123368920522, "grad_norm": 0.92578125, "learning_rate": 0.0004998906325861342, "loss": 6.0656, "mean_token_accuracy": 0.14024949371814727, "num_tokens": 4568768.0, "step": 1995 }, { "entropy": 6.2134082317352295, "epoch": 0.19770660340055357, "grad_norm": 1.03125, "learning_rate": 0.0004998895296333183, "loss": 6.0249, "mean_token_accuracy": 0.15064804553985595, "num_tokens": 4581116.0, "step": 2000 }, { "entropy": 6.283394813537598, "epoch": 0.19820086990905497, "grad_norm": 1.0546875, "learning_rate": 0.000499888421148185, "loss": 6.1061, "mean_token_accuracy": 0.14467725306749343, "num_tokens": 4592660.0, "step": 2005 }, { "entropy": 6.260604429244995, "epoch": 0.19869513641755635, "grad_norm": 0.91796875, "learning_rate": 0.0004998873071307617, "loss": 6.0907, "mean_token_accuracy": 0.14113724008202552, "num_tokens": 4603057.0, "step": 2010 }, { "entropy": 6.200288867950439, "epoch": 0.19918940292605772, "grad_norm": 1.0703125, "learning_rate": 0.0004998861875810758, "loss": 5.9759, "mean_token_accuracy": 0.15196106284856797, "num_tokens": 4613546.0, "step": 2015 }, { "entropy": 6.246992015838623, "epoch": 0.19968366943455912, "grad_norm": 0.94140625, "learning_rate": 0.0004998850624991548, "loss": 6.0638, "mean_token_accuracy": 0.14428235441446305, "num_tokens": 4624613.0, "step": 2020 }, { "entropy": 6.230186557769775, "epoch": 0.2001779359430605, "grad_norm": 0.97265625, "learning_rate": 0.0004998839318850263, "loss": 6.0221, "mean_token_accuracy": 0.1460937425494194, "num_tokens": 4636004.0, "step": 2025 }, { "entropy": 6.193474054336548, "epoch": 0.2006722024515619, "grad_norm": 1.0546875, "learning_rate": 0.0004998827957387182, "loss": 6.0774, "mean_token_accuracy": 0.15042401626706123, "num_tokens": 4646450.0, "step": 2030 }, { "entropy": 6.244450569152832, "epoch": 0.20116646896006327, "grad_norm": 0.91015625, "learning_rate": 0.0004998816540602584, "loss": 6.0717, "mean_token_accuracy": 0.14856441468000411, "num_tokens": 4658928.0, "step": 2035 }, { "entropy": 6.227334880828858, "epoch": 0.20166073546856464, "grad_norm": 0.90234375, "learning_rate": 0.0004998805068496752, "loss": 6.0874, "mean_token_accuracy": 0.14230842441320418, "num_tokens": 4670392.0, "step": 2040 }, { "entropy": 6.30333456993103, "epoch": 0.20215500197706604, "grad_norm": 1.0703125, "learning_rate": 0.0004998793541069964, "loss": 6.0653, "mean_token_accuracy": 0.14288742393255233, "num_tokens": 4680605.0, "step": 2045 }, { "entropy": 6.180010843276977, "epoch": 0.2026492684855674, "grad_norm": 0.96875, "learning_rate": 0.0004998781958322507, "loss": 5.9854, "mean_token_accuracy": 0.14871413111686707, "num_tokens": 4694250.0, "step": 2050 }, { "entropy": 6.281947135925293, "epoch": 0.20314353499406881, "grad_norm": 0.94921875, "learning_rate": 0.0004998770320254666, "loss": 6.1297, "mean_token_accuracy": 0.14538564309477806, "num_tokens": 4705754.0, "step": 2055 }, { "entropy": 6.2580322265625, "epoch": 0.2036378015025702, "grad_norm": 0.984375, "learning_rate": 0.0004998758626866725, "loss": 6.0149, "mean_token_accuracy": 0.1483184352517128, "num_tokens": 4716393.0, "step": 2060 }, { "entropy": 6.154084968566894, "epoch": 0.20413206801107156, "grad_norm": 0.95703125, "learning_rate": 0.0004998746878158973, "loss": 6.0146, "mean_token_accuracy": 0.1491061344742775, "num_tokens": 4726894.0, "step": 2065 }, { "entropy": 6.207609033584594, "epoch": 0.20462633451957296, "grad_norm": 1.0078125, "learning_rate": 0.0004998735074131699, "loss": 6.0329, "mean_token_accuracy": 0.1427217200398445, "num_tokens": 4737488.0, "step": 2070 }, { "entropy": 6.279056692123413, "epoch": 0.20512060102807433, "grad_norm": 0.8984375, "learning_rate": 0.0004998723214785194, "loss": 6.119, "mean_token_accuracy": 0.1388081707060337, "num_tokens": 4749131.0, "step": 2075 }, { "entropy": 6.210673522949219, "epoch": 0.20561486753657574, "grad_norm": 0.97265625, "learning_rate": 0.0004998711300119749, "loss": 5.991, "mean_token_accuracy": 0.1441672131419182, "num_tokens": 4760503.0, "step": 2080 }, { "entropy": 6.266996288299561, "epoch": 0.2061091340450771, "grad_norm": 0.89453125, "learning_rate": 0.0004998699330135656, "loss": 6.1084, "mean_token_accuracy": 0.14080554991960526, "num_tokens": 4771965.0, "step": 2085 }, { "entropy": 6.194011402130127, "epoch": 0.20660340055357848, "grad_norm": 0.984375, "learning_rate": 0.0004998687304833212, "loss": 6.0904, "mean_token_accuracy": 0.14432893693447113, "num_tokens": 4784215.0, "step": 2090 }, { "entropy": 6.1993388652801515, "epoch": 0.20709766706207988, "grad_norm": 0.984375, "learning_rate": 0.000499867522421271, "loss": 6.012, "mean_token_accuracy": 0.14703067466616632, "num_tokens": 4796410.0, "step": 2095 }, { "entropy": 6.164281129837036, "epoch": 0.20759193357058126, "grad_norm": 1.0859375, "learning_rate": 0.000499866308827445, "loss": 6.0026, "mean_token_accuracy": 0.15248948186635972, "num_tokens": 4806990.0, "step": 2100 }, { "entropy": 6.228803062438965, "epoch": 0.20808620007908263, "grad_norm": 0.921875, "learning_rate": 0.0004998650897018729, "loss": 6.0377, "mean_token_accuracy": 0.1467735067009926, "num_tokens": 4818903.0, "step": 2105 }, { "entropy": 6.225046968460083, "epoch": 0.20858046658758403, "grad_norm": 1.0078125, "learning_rate": 0.0004998638650445847, "loss": 5.979, "mean_token_accuracy": 0.15080888271331788, "num_tokens": 4829130.0, "step": 2110 }, { "entropy": 6.200888967514038, "epoch": 0.2090747330960854, "grad_norm": 0.94921875, "learning_rate": 0.0004998626348556105, "loss": 6.0049, "mean_token_accuracy": 0.15483116656541823, "num_tokens": 4840424.0, "step": 2115 }, { "entropy": 6.197483348846435, "epoch": 0.2095689996045868, "grad_norm": 0.87890625, "learning_rate": 0.0004998613991349807, "loss": 6.011, "mean_token_accuracy": 0.1491863876581192, "num_tokens": 4851674.0, "step": 2120 }, { "entropy": 6.074605512619018, "epoch": 0.21006326611308818, "grad_norm": 0.984375, "learning_rate": 0.0004998601578827255, "loss": 5.941, "mean_token_accuracy": 0.1571485087275505, "num_tokens": 4863884.0, "step": 2125 }, { "entropy": 6.180933475494385, "epoch": 0.21055753262158955, "grad_norm": 0.953125, "learning_rate": 0.0004998589110988755, "loss": 6.0233, "mean_token_accuracy": 0.15155385658144951, "num_tokens": 4875582.0, "step": 2130 }, { "entropy": 6.2378441333770756, "epoch": 0.21105179913009095, "grad_norm": 0.9296875, "learning_rate": 0.0004998576587834614, "loss": 6.0372, "mean_token_accuracy": 0.14390906766057016, "num_tokens": 4888325.0, "step": 2135 }, { "entropy": 6.167991065979004, "epoch": 0.21154606563859232, "grad_norm": 1.0078125, "learning_rate": 0.000499856400936514, "loss": 6.0231, "mean_token_accuracy": 0.14813374429941178, "num_tokens": 4899631.0, "step": 2140 }, { "entropy": 6.222489881515503, "epoch": 0.21204033214709372, "grad_norm": 0.96484375, "learning_rate": 0.0004998551375580643, "loss": 6.0338, "mean_token_accuracy": 0.14445801451802254, "num_tokens": 4910954.0, "step": 2145 }, { "entropy": 6.200428104400634, "epoch": 0.2125345986555951, "grad_norm": 0.953125, "learning_rate": 0.0004998538686481435, "loss": 6.0265, "mean_token_accuracy": 0.14709079191088675, "num_tokens": 4921952.0, "step": 2150 }, { "entropy": 6.1896810054779055, "epoch": 0.21302886516409647, "grad_norm": 0.8984375, "learning_rate": 0.0004998525942067824, "loss": 5.9753, "mean_token_accuracy": 0.15096844732761383, "num_tokens": 4933984.0, "step": 2155 }, { "entropy": 6.227153158187866, "epoch": 0.21352313167259787, "grad_norm": 0.890625, "learning_rate": 0.0004998513142340128, "loss": 6.1197, "mean_token_accuracy": 0.14837369918823243, "num_tokens": 4945926.0, "step": 2160 }, { "entropy": 6.1681867122650145, "epoch": 0.21401739818109924, "grad_norm": 0.99609375, "learning_rate": 0.0004998500287298657, "loss": 6.023, "mean_token_accuracy": 0.15544141232967376, "num_tokens": 4958123.0, "step": 2165 }, { "entropy": 6.295369386672974, "epoch": 0.21451166468960065, "grad_norm": 0.921875, "learning_rate": 0.0004998487376943733, "loss": 6.1066, "mean_token_accuracy": 0.14306268021464347, "num_tokens": 4970409.0, "step": 2170 }, { "entropy": 6.205995368957519, "epoch": 0.21500593119810202, "grad_norm": 1.0546875, "learning_rate": 0.000499847441127567, "loss": 6.0043, "mean_token_accuracy": 0.14616703540086745, "num_tokens": 4980429.0, "step": 2175 }, { "entropy": 6.177132654190063, "epoch": 0.2155001977066034, "grad_norm": 0.96484375, "learning_rate": 0.0004998461390294787, "loss": 6.0208, "mean_token_accuracy": 0.14917071387171746, "num_tokens": 4991790.0, "step": 2180 }, { "entropy": 6.220096111297607, "epoch": 0.2159944642151048, "grad_norm": 0.8671875, "learning_rate": 0.0004998448314001405, "loss": 6.05, "mean_token_accuracy": 0.14717172235250472, "num_tokens": 5003611.0, "step": 2185 }, { "entropy": 6.254109907150268, "epoch": 0.21648873072360617, "grad_norm": 1.0390625, "learning_rate": 0.0004998435182395845, "loss": 6.1021, "mean_token_accuracy": 0.13986384347081185, "num_tokens": 5014824.0, "step": 2190 }, { "entropy": 6.227781105041504, "epoch": 0.21698299723210757, "grad_norm": 0.8984375, "learning_rate": 0.0004998421995478432, "loss": 6.0503, "mean_token_accuracy": 0.148946550488472, "num_tokens": 5026937.0, "step": 2195 }, { "entropy": 6.244038105010986, "epoch": 0.21747726374060894, "grad_norm": 0.96875, "learning_rate": 0.0004998408753249489, "loss": 6.0719, "mean_token_accuracy": 0.13694722205400467, "num_tokens": 5037996.0, "step": 2200 }, { "entropy": 6.237607145309449, "epoch": 0.2179715302491103, "grad_norm": 0.94140625, "learning_rate": 0.0004998395455709342, "loss": 6.0107, "mean_token_accuracy": 0.1504923239350319, "num_tokens": 5050944.0, "step": 2205 }, { "entropy": 6.243500423431397, "epoch": 0.2184657967576117, "grad_norm": 1.0078125, "learning_rate": 0.0004998382102858317, "loss": 6.0655, "mean_token_accuracy": 0.1380969375371933, "num_tokens": 5062129.0, "step": 2210 }, { "entropy": 6.214231157302857, "epoch": 0.2189600632661131, "grad_norm": 0.99609375, "learning_rate": 0.0004998368694696743, "loss": 6.0638, "mean_token_accuracy": 0.14710126519203187, "num_tokens": 5073318.0, "step": 2215 }, { "entropy": 6.157390117645264, "epoch": 0.21945432977461446, "grad_norm": 0.97265625, "learning_rate": 0.0004998355231224952, "loss": 6.0869, "mean_token_accuracy": 0.13977600187063216, "num_tokens": 5084607.0, "step": 2220 }, { "entropy": 6.260241842269897, "epoch": 0.21994859628311586, "grad_norm": 0.91015625, "learning_rate": 0.0004998341712443273, "loss": 5.9781, "mean_token_accuracy": 0.14976139664649962, "num_tokens": 5096004.0, "step": 2225 }, { "entropy": 6.157348537445069, "epoch": 0.22044286279161723, "grad_norm": 0.99609375, "learning_rate": 0.000499832813835204, "loss": 5.9775, "mean_token_accuracy": 0.14522008523344992, "num_tokens": 5107171.0, "step": 2230 }, { "entropy": 6.131589794158936, "epoch": 0.22093712930011863, "grad_norm": 0.87890625, "learning_rate": 0.0004998314508951584, "loss": 5.9398, "mean_token_accuracy": 0.15599283277988435, "num_tokens": 5119249.0, "step": 2235 }, { "entropy": 6.141232109069824, "epoch": 0.22143139580862, "grad_norm": 0.9453125, "learning_rate": 0.0004998300824242244, "loss": 5.9469, "mean_token_accuracy": 0.146238474547863, "num_tokens": 5130798.0, "step": 2240 }, { "entropy": 6.232096910476685, "epoch": 0.22192566231712138, "grad_norm": 1.09375, "learning_rate": 0.0004998287084224353, "loss": 6.1083, "mean_token_accuracy": 0.13696300685405732, "num_tokens": 5141376.0, "step": 2245 }, { "entropy": 6.146618509292603, "epoch": 0.22241992882562278, "grad_norm": 1.0234375, "learning_rate": 0.0004998273288898252, "loss": 5.9091, "mean_token_accuracy": 0.15360306277871133, "num_tokens": 5152888.0, "step": 2250 }, { "entropy": 6.065787649154663, "epoch": 0.22291419533412415, "grad_norm": 0.9375, "learning_rate": 0.000499825943826428, "loss": 6.0166, "mean_token_accuracy": 0.14354098588228226, "num_tokens": 5165720.0, "step": 2255 }, { "entropy": 6.176988172531128, "epoch": 0.22340846184262556, "grad_norm": 0.953125, "learning_rate": 0.0004998245532322776, "loss": 5.8962, "mean_token_accuracy": 0.15421061739325523, "num_tokens": 5177345.0, "step": 2260 }, { "entropy": 6.1588715553283695, "epoch": 0.22390272835112693, "grad_norm": 1.046875, "learning_rate": 0.0004998231571074083, "loss": 5.9117, "mean_token_accuracy": 0.1537886306643486, "num_tokens": 5187385.0, "step": 2265 }, { "entropy": 6.167546176910401, "epoch": 0.2243969948596283, "grad_norm": 0.97265625, "learning_rate": 0.0004998217554518545, "loss": 6.0285, "mean_token_accuracy": 0.14182861372828484, "num_tokens": 5199552.0, "step": 2270 }, { "entropy": 6.146705436706543, "epoch": 0.2248912613681297, "grad_norm": 0.98828125, "learning_rate": 0.0004998203482656507, "loss": 5.9863, "mean_token_accuracy": 0.15320322513580323, "num_tokens": 5210316.0, "step": 2275 }, { "entropy": 6.161525392532349, "epoch": 0.22538552787663108, "grad_norm": 1.0546875, "learning_rate": 0.0004998189355488314, "loss": 6.0483, "mean_token_accuracy": 0.15011645257472991, "num_tokens": 5221595.0, "step": 2280 }, { "entropy": 6.221466970443726, "epoch": 0.22587979438513248, "grad_norm": 1.015625, "learning_rate": 0.0004998175173014313, "loss": 6.0245, "mean_token_accuracy": 0.14501310810446738, "num_tokens": 5232882.0, "step": 2285 }, { "entropy": 6.196228265762329, "epoch": 0.22637406089363385, "grad_norm": 1.0078125, "learning_rate": 0.0004998160935234857, "loss": 6.1201, "mean_token_accuracy": 0.14222247898578644, "num_tokens": 5244841.0, "step": 2290 }, { "entropy": 6.162954092025757, "epoch": 0.22686832740213522, "grad_norm": 1.0234375, "learning_rate": 0.000499814664215029, "loss": 5.9404, "mean_token_accuracy": 0.1541356138885021, "num_tokens": 5256162.0, "step": 2295 }, { "entropy": 6.1496068954467775, "epoch": 0.22736259391063662, "grad_norm": 1.078125, "learning_rate": 0.0004998132293760968, "loss": 5.8578, "mean_token_accuracy": 0.1593697711825371, "num_tokens": 5267130.0, "step": 2300 }, { "entropy": 5.999020719528199, "epoch": 0.227856860419138, "grad_norm": 0.890625, "learning_rate": 0.0004998117890067243, "loss": 5.9811, "mean_token_accuracy": 0.1474272921681404, "num_tokens": 5279394.0, "step": 2305 }, { "entropy": 6.163106775283813, "epoch": 0.22835112692763937, "grad_norm": 0.98828125, "learning_rate": 0.0004998103431069469, "loss": 5.9497, "mean_token_accuracy": 0.15263054817914962, "num_tokens": 5291068.0, "step": 2310 }, { "entropy": 6.195495080947876, "epoch": 0.22884539343614077, "grad_norm": 1.0078125, "learning_rate": 0.0004998088916768002, "loss": 5.9027, "mean_token_accuracy": 0.15293610841035843, "num_tokens": 5300924.0, "step": 2315 }, { "entropy": 6.081633424758911, "epoch": 0.22933965994464214, "grad_norm": 0.9375, "learning_rate": 0.0004998074347163199, "loss": 5.9151, "mean_token_accuracy": 0.15552001297473908, "num_tokens": 5311998.0, "step": 2320 }, { "entropy": 6.198126602172851, "epoch": 0.22983392645314354, "grad_norm": 0.9453125, "learning_rate": 0.0004998059722255418, "loss": 5.959, "mean_token_accuracy": 0.1518368422985077, "num_tokens": 5322163.0, "step": 2325 }, { "entropy": 6.083274698257446, "epoch": 0.23032819296164492, "grad_norm": 1.0546875, "learning_rate": 0.0004998045042045019, "loss": 5.9524, "mean_token_accuracy": 0.15333037078380585, "num_tokens": 5331638.0, "step": 2330 }, { "entropy": 6.1572568893432615, "epoch": 0.2308224594701463, "grad_norm": 0.9765625, "learning_rate": 0.0004998030306532363, "loss": 5.948, "mean_token_accuracy": 0.15855043828487397, "num_tokens": 5342399.0, "step": 2335 }, { "entropy": 6.137854766845703, "epoch": 0.2313167259786477, "grad_norm": 0.9765625, "learning_rate": 0.0004998015515717813, "loss": 5.9965, "mean_token_accuracy": 0.14803121536970137, "num_tokens": 5353481.0, "step": 2340 }, { "entropy": 6.154527091979981, "epoch": 0.23181099248714906, "grad_norm": 1.0078125, "learning_rate": 0.0004998000669601733, "loss": 5.9314, "mean_token_accuracy": 0.15086086690425873, "num_tokens": 5365167.0, "step": 2345 }, { "entropy": 6.123769855499267, "epoch": 0.23230525899565047, "grad_norm": 0.92578125, "learning_rate": 0.0004997985768184488, "loss": 5.9469, "mean_token_accuracy": 0.15256110429763795, "num_tokens": 5375809.0, "step": 2350 }, { "entropy": 6.056447267532349, "epoch": 0.23279952550415184, "grad_norm": 0.92578125, "learning_rate": 0.0004997970811466443, "loss": 5.8548, "mean_token_accuracy": 0.15769713670015334, "num_tokens": 5387372.0, "step": 2355 }, { "entropy": 6.282668924331665, "epoch": 0.2332937920126532, "grad_norm": 1.0390625, "learning_rate": 0.0004997955799447969, "loss": 6.0441, "mean_token_accuracy": 0.14419636502861977, "num_tokens": 5399210.0, "step": 2360 }, { "entropy": 6.112582731246948, "epoch": 0.2337880585211546, "grad_norm": 0.96875, "learning_rate": 0.0004997940732129432, "loss": 5.9699, "mean_token_accuracy": 0.14607637226581574, "num_tokens": 5410969.0, "step": 2365 }, { "entropy": 6.07240662574768, "epoch": 0.23428232502965599, "grad_norm": 0.9921875, "learning_rate": 0.0004997925609511205, "loss": 5.9175, "mean_token_accuracy": 0.15724605768918992, "num_tokens": 5422569.0, "step": 2370 }, { "entropy": 6.12368426322937, "epoch": 0.2347765915381574, "grad_norm": 1.0859375, "learning_rate": 0.0004997910431593659, "loss": 5.9243, "mean_token_accuracy": 0.1551958680152893, "num_tokens": 5434592.0, "step": 2375 }, { "entropy": 6.1067907333374025, "epoch": 0.23527085804665876, "grad_norm": 0.90625, "learning_rate": 0.0004997895198377168, "loss": 5.9946, "mean_token_accuracy": 0.15322967916727065, "num_tokens": 5446525.0, "step": 2380 }, { "entropy": 6.143498849868775, "epoch": 0.23576512455516013, "grad_norm": 0.9140625, "learning_rate": 0.0004997879909862105, "loss": 5.9754, "mean_token_accuracy": 0.15008583962917327, "num_tokens": 5457327.0, "step": 2385 }, { "entropy": 6.232042026519776, "epoch": 0.23625939106366153, "grad_norm": 0.9921875, "learning_rate": 0.000499786456604885, "loss": 6.0161, "mean_token_accuracy": 0.14592731818556787, "num_tokens": 5468533.0, "step": 2390 }, { "entropy": 6.09161491394043, "epoch": 0.2367536575721629, "grad_norm": 0.828125, "learning_rate": 0.0004997849166937776, "loss": 5.8926, "mean_token_accuracy": 0.15270923376083373, "num_tokens": 5480652.0, "step": 2395 }, { "entropy": 6.1551309585571286, "epoch": 0.2372479240806643, "grad_norm": 0.98046875, "learning_rate": 0.0004997833712529265, "loss": 5.9233, "mean_token_accuracy": 0.1461702197790146, "num_tokens": 5491446.0, "step": 2400 }, { "entropy": 6.084803724288941, "epoch": 0.23774219058916568, "grad_norm": 0.91015625, "learning_rate": 0.0004997818202823695, "loss": 5.9255, "mean_token_accuracy": 0.15715935975313186, "num_tokens": 5502886.0, "step": 2405 }, { "entropy": 6.133616352081299, "epoch": 0.23823645709766705, "grad_norm": 1.0390625, "learning_rate": 0.0004997802637821449, "loss": 5.978, "mean_token_accuracy": 0.14540450945496558, "num_tokens": 5514305.0, "step": 2410 }, { "entropy": 6.08673734664917, "epoch": 0.23873072360616845, "grad_norm": 0.91015625, "learning_rate": 0.0004997787017522909, "loss": 5.8932, "mean_token_accuracy": 0.1596880927681923, "num_tokens": 5525913.0, "step": 2415 }, { "entropy": 6.006779384613037, "epoch": 0.23922499011466983, "grad_norm": 0.96484375, "learning_rate": 0.0004997771341928459, "loss": 5.8859, "mean_token_accuracy": 0.16061815544962882, "num_tokens": 5537069.0, "step": 2420 }, { "entropy": 6.104032278060913, "epoch": 0.2397192566231712, "grad_norm": 1.0859375, "learning_rate": 0.0004997755611038487, "loss": 5.9961, "mean_token_accuracy": 0.144280281662941, "num_tokens": 5547988.0, "step": 2425 }, { "entropy": 6.207238817214966, "epoch": 0.2402135231316726, "grad_norm": 0.890625, "learning_rate": 0.0004997739824853378, "loss": 6.0542, "mean_token_accuracy": 0.14740365296602248, "num_tokens": 5560400.0, "step": 2430 }, { "entropy": 6.095962429046631, "epoch": 0.24070778964017397, "grad_norm": 0.9375, "learning_rate": 0.0004997723983373519, "loss": 5.9177, "mean_token_accuracy": 0.1554897114634514, "num_tokens": 5572291.0, "step": 2435 }, { "entropy": 6.167290544509887, "epoch": 0.24120205614867538, "grad_norm": 0.93359375, "learning_rate": 0.0004997708086599303, "loss": 5.9469, "mean_token_accuracy": 0.1484512284398079, "num_tokens": 5583583.0, "step": 2440 }, { "entropy": 6.183183908462524, "epoch": 0.24169632265717675, "grad_norm": 0.88671875, "learning_rate": 0.0004997692134531119, "loss": 5.9602, "mean_token_accuracy": 0.14650021344423295, "num_tokens": 5595499.0, "step": 2445 }, { "entropy": 6.089758729934692, "epoch": 0.24219058916567812, "grad_norm": 0.984375, "learning_rate": 0.000499767612716936, "loss": 5.8875, "mean_token_accuracy": 0.16020604968070984, "num_tokens": 5606745.0, "step": 2450 }, { "entropy": 6.070741653442383, "epoch": 0.24268485567417952, "grad_norm": 0.9921875, "learning_rate": 0.0004997660064514419, "loss": 5.9726, "mean_token_accuracy": 0.14979561567306518, "num_tokens": 5618226.0, "step": 2455 }, { "entropy": 6.241481876373291, "epoch": 0.2431791221826809, "grad_norm": 0.91015625, "learning_rate": 0.0004997643946566691, "loss": 5.9884, "mean_token_accuracy": 0.14858949631452562, "num_tokens": 5628941.0, "step": 2460 }, { "entropy": 6.038295078277588, "epoch": 0.2436733886911823, "grad_norm": 0.9921875, "learning_rate": 0.0004997627773326574, "loss": 5.7919, "mean_token_accuracy": 0.16433235108852387, "num_tokens": 5641077.0, "step": 2465 }, { "entropy": 6.130333995819091, "epoch": 0.24416765519968367, "grad_norm": 1.0703125, "learning_rate": 0.0004997611544794465, "loss": 6.0855, "mean_token_accuracy": 0.14532085955142976, "num_tokens": 5652156.0, "step": 2470 }, { "entropy": 6.220878314971924, "epoch": 0.24466192170818504, "grad_norm": 0.9375, "learning_rate": 0.0004997595260970764, "loss": 6.0231, "mean_token_accuracy": 0.14606670886278153, "num_tokens": 5663988.0, "step": 2475 }, { "entropy": 6.095632934570313, "epoch": 0.24515618821668644, "grad_norm": 0.87890625, "learning_rate": 0.000499757892185587, "loss": 5.9439, "mean_token_accuracy": 0.15061840713024138, "num_tokens": 5676302.0, "step": 2480 }, { "entropy": 6.133012342453003, "epoch": 0.24565045472518782, "grad_norm": 0.984375, "learning_rate": 0.0004997562527450187, "loss": 5.9642, "mean_token_accuracy": 0.14953794404864312, "num_tokens": 5686686.0, "step": 2485 }, { "entropy": 6.10685167312622, "epoch": 0.24614472123368922, "grad_norm": 0.92578125, "learning_rate": 0.0004997546077754116, "loss": 5.8971, "mean_token_accuracy": 0.1646903246641159, "num_tokens": 5698379.0, "step": 2490 }, { "entropy": 6.1061577796936035, "epoch": 0.2466389877421906, "grad_norm": 0.9921875, "learning_rate": 0.0004997529572768063, "loss": 5.8997, "mean_token_accuracy": 0.1544343575835228, "num_tokens": 5708891.0, "step": 2495 }, { "entropy": 6.052794504165649, "epoch": 0.24713325425069196, "grad_norm": 1.0078125, "learning_rate": 0.0004997513012492434, "loss": 5.9395, "mean_token_accuracy": 0.15541503578424454, "num_tokens": 5720326.0, "step": 2500 }, { "entropy": 6.1182698726654055, "epoch": 0.24762752075919336, "grad_norm": 0.94140625, "learning_rate": 0.0004997496396927636, "loss": 5.8705, "mean_token_accuracy": 0.1567327544093132, "num_tokens": 5731121.0, "step": 2505 }, { "entropy": 6.115647983551026, "epoch": 0.24812178726769474, "grad_norm": 1.046875, "learning_rate": 0.0004997479726074077, "loss": 5.9047, "mean_token_accuracy": 0.1568905934691429, "num_tokens": 5741637.0, "step": 2510 }, { "entropy": 6.159960174560547, "epoch": 0.24861605377619614, "grad_norm": 0.984375, "learning_rate": 0.000499746299993217, "loss": 5.94, "mean_token_accuracy": 0.15289734974503516, "num_tokens": 5752659.0, "step": 2515 }, { "entropy": 6.045699405670166, "epoch": 0.2491103202846975, "grad_norm": 0.93359375, "learning_rate": 0.0004997446218502324, "loss": 5.924, "mean_token_accuracy": 0.15085340589284896, "num_tokens": 5763829.0, "step": 2520 }, { "entropy": 6.149063539505005, "epoch": 0.24960458679319888, "grad_norm": 0.95703125, "learning_rate": 0.0004997429381784952, "loss": 5.9927, "mean_token_accuracy": 0.14978117346763611, "num_tokens": 5775848.0, "step": 2525 }, { "entropy": 6.088855504989624, "epoch": 0.2500988533017003, "grad_norm": 1.0625, "learning_rate": 0.0004997412489780469, "loss": 5.9458, "mean_token_accuracy": 0.15962931662797927, "num_tokens": 5786595.0, "step": 2530 }, { "entropy": 6.095394515991211, "epoch": 0.25059311981020166, "grad_norm": 1.03125, "learning_rate": 0.000499739554248929, "loss": 5.8537, "mean_token_accuracy": 0.16231104359030724, "num_tokens": 5797841.0, "step": 2535 }, { "entropy": 6.014609241485596, "epoch": 0.25108738631870303, "grad_norm": 0.96484375, "learning_rate": 0.0004997378539911832, "loss": 5.8515, "mean_token_accuracy": 0.15764168053865432, "num_tokens": 5809106.0, "step": 2540 }, { "entropy": 6.036460590362549, "epoch": 0.2515816528272044, "grad_norm": 0.953125, "learning_rate": 0.0004997361482048513, "loss": 5.869, "mean_token_accuracy": 0.15573886185884475, "num_tokens": 5820316.0, "step": 2545 }, { "entropy": 6.130526161193847, "epoch": 0.25207591933570583, "grad_norm": 0.90234375, "learning_rate": 0.0004997344368899753, "loss": 5.9884, "mean_token_accuracy": 0.1489880457520485, "num_tokens": 5833137.0, "step": 2550 }, { "entropy": 6.140044546127319, "epoch": 0.2525701858442072, "grad_norm": 1.015625, "learning_rate": 0.0004997327200465972, "loss": 5.9078, "mean_token_accuracy": 0.1543002173304558, "num_tokens": 5844088.0, "step": 2555 }, { "entropy": 6.110529088973999, "epoch": 0.2530644523527086, "grad_norm": 0.8828125, "learning_rate": 0.0004997309976747594, "loss": 5.9042, "mean_token_accuracy": 0.1501915216445923, "num_tokens": 5854546.0, "step": 2560 }, { "entropy": 6.13458662033081, "epoch": 0.25355871886120995, "grad_norm": 1.109375, "learning_rate": 0.0004997292697745042, "loss": 5.9112, "mean_token_accuracy": 0.15691982805728913, "num_tokens": 5865326.0, "step": 2565 }, { "entropy": 6.1010185241699215, "epoch": 0.2540529853697113, "grad_norm": 0.9375, "learning_rate": 0.0004997275363458741, "loss": 5.8117, "mean_token_accuracy": 0.15828278064727783, "num_tokens": 5876487.0, "step": 2570 }, { "entropy": 5.987020254135132, "epoch": 0.25454725187821275, "grad_norm": 0.96484375, "learning_rate": 0.0004997257973889118, "loss": 5.9125, "mean_token_accuracy": 0.15327198207378387, "num_tokens": 5887846.0, "step": 2575 }, { "entropy": 6.149021959304809, "epoch": 0.25504151838671413, "grad_norm": 1.015625, "learning_rate": 0.0004997240529036599, "loss": 5.867, "mean_token_accuracy": 0.16193937510252, "num_tokens": 5898572.0, "step": 2580 }, { "entropy": 6.05965838432312, "epoch": 0.2555357848952155, "grad_norm": 1.015625, "learning_rate": 0.0004997223028901615, "loss": 5.9338, "mean_token_accuracy": 0.15329011231660844, "num_tokens": 5908927.0, "step": 2585 }, { "entropy": 6.08336501121521, "epoch": 0.2560300514037169, "grad_norm": 1.0546875, "learning_rate": 0.0004997205473484596, "loss": 5.8887, "mean_token_accuracy": 0.15567793250083922, "num_tokens": 5919807.0, "step": 2590 }, { "entropy": 6.05651478767395, "epoch": 0.25652431791221825, "grad_norm": 0.95703125, "learning_rate": 0.0004997187862785974, "loss": 5.912, "mean_token_accuracy": 0.15435239002108575, "num_tokens": 5931160.0, "step": 2595 }, { "entropy": 6.133126735687256, "epoch": 0.2570185844207197, "grad_norm": 0.92578125, "learning_rate": 0.0004997170196806181, "loss": 5.9697, "mean_token_accuracy": 0.14922844171524047, "num_tokens": 5943694.0, "step": 2600 }, { "entropy": 6.10101637840271, "epoch": 0.25751285092922105, "grad_norm": 0.98046875, "learning_rate": 0.0004997152475545652, "loss": 5.8622, "mean_token_accuracy": 0.1568847507238388, "num_tokens": 5954543.0, "step": 2605 }, { "entropy": 6.032856464385986, "epoch": 0.2580071174377224, "grad_norm": 0.9453125, "learning_rate": 0.0004997134699004825, "loss": 5.9138, "mean_token_accuracy": 0.15866148322820664, "num_tokens": 5965080.0, "step": 2610 }, { "entropy": 6.100453948974609, "epoch": 0.2585013839462238, "grad_norm": 0.9921875, "learning_rate": 0.0004997116867184136, "loss": 5.9046, "mean_token_accuracy": 0.1504710793495178, "num_tokens": 5975314.0, "step": 2615 }, { "entropy": 6.156487703323364, "epoch": 0.25899565045472517, "grad_norm": 1.046875, "learning_rate": 0.0004997098980084022, "loss": 5.9079, "mean_token_accuracy": 0.1572839215397835, "num_tokens": 5985927.0, "step": 2620 }, { "entropy": 6.053633785247802, "epoch": 0.2594899169632266, "grad_norm": 1.0234375, "learning_rate": 0.0004997081037704926, "loss": 5.9358, "mean_token_accuracy": 0.15075213015079497, "num_tokens": 5997311.0, "step": 2625 }, { "entropy": 6.047173976898193, "epoch": 0.25998418347172797, "grad_norm": 0.953125, "learning_rate": 0.0004997063040047288, "loss": 5.9646, "mean_token_accuracy": 0.14865972250699996, "num_tokens": 6008595.0, "step": 2630 }, { "entropy": 6.14096417427063, "epoch": 0.26047844998022934, "grad_norm": 1.1015625, "learning_rate": 0.0004997044987111548, "loss": 5.8857, "mean_token_accuracy": 0.15375734716653824, "num_tokens": 6019055.0, "step": 2635 }, { "entropy": 6.093348121643066, "epoch": 0.2609727164887307, "grad_norm": 0.95703125, "learning_rate": 0.0004997026878898155, "loss": 6.0106, "mean_token_accuracy": 0.14476267546415328, "num_tokens": 6030029.0, "step": 2640 }, { "entropy": 6.12502155303955, "epoch": 0.2614669829972321, "grad_norm": 0.9296875, "learning_rate": 0.0004997008715407552, "loss": 5.9671, "mean_token_accuracy": 0.1483074575662613, "num_tokens": 6041495.0, "step": 2645 }, { "entropy": 6.122032976150512, "epoch": 0.2619612495057335, "grad_norm": 0.89453125, "learning_rate": 0.0004996990496640185, "loss": 5.8544, "mean_token_accuracy": 0.1526714891195297, "num_tokens": 6052307.0, "step": 2650 }, { "entropy": 5.993034410476684, "epoch": 0.2624555160142349, "grad_norm": 0.921875, "learning_rate": 0.0004996972222596505, "loss": 5.8212, "mean_token_accuracy": 0.15812475681304933, "num_tokens": 6062550.0, "step": 2655 }, { "entropy": 5.990975999832154, "epoch": 0.26294978252273626, "grad_norm": 0.953125, "learning_rate": 0.0004996953893276958, "loss": 5.8603, "mean_token_accuracy": 0.15025542229413985, "num_tokens": 6074450.0, "step": 2660 }, { "entropy": 6.081708335876465, "epoch": 0.26344404903123764, "grad_norm": 0.859375, "learning_rate": 0.0004996935508681997, "loss": 5.9066, "mean_token_accuracy": 0.155532006919384, "num_tokens": 6085749.0, "step": 2665 }, { "entropy": 6.05987777709961, "epoch": 0.263938315539739, "grad_norm": 1.015625, "learning_rate": 0.0004996917068812075, "loss": 5.8233, "mean_token_accuracy": 0.16070664674043655, "num_tokens": 6096438.0, "step": 2670 }, { "entropy": 6.030507278442383, "epoch": 0.26443258204824044, "grad_norm": 0.9375, "learning_rate": 0.0004996898573667643, "loss": 5.8777, "mean_token_accuracy": 0.14768243730068206, "num_tokens": 6108386.0, "step": 2675 }, { "entropy": 6.0277626514434814, "epoch": 0.2649268485567418, "grad_norm": 0.98046875, "learning_rate": 0.0004996880023249158, "loss": 5.7815, "mean_token_accuracy": 0.16615237444639205, "num_tokens": 6118771.0, "step": 2680 }, { "entropy": 6.110533952713013, "epoch": 0.2654211150652432, "grad_norm": 0.92578125, "learning_rate": 0.0004996861417557076, "loss": 5.888, "mean_token_accuracy": 0.15228350311517716, "num_tokens": 6130718.0, "step": 2685 }, { "entropy": 6.002656650543213, "epoch": 0.26591538157374456, "grad_norm": 0.9296875, "learning_rate": 0.0004996842756591855, "loss": 5.9056, "mean_token_accuracy": 0.1509190857410431, "num_tokens": 6142086.0, "step": 2690 }, { "entropy": 6.003255558013916, "epoch": 0.26640964808224593, "grad_norm": 0.8671875, "learning_rate": 0.0004996824040353953, "loss": 5.8815, "mean_token_accuracy": 0.15629380643367768, "num_tokens": 6153857.0, "step": 2695 }, { "entropy": 6.225221776962281, "epoch": 0.2669039145907473, "grad_norm": 0.9609375, "learning_rate": 0.0004996805268843832, "loss": 6.0201, "mean_token_accuracy": 0.14962111189961433, "num_tokens": 6166796.0, "step": 2700 }, { "entropy": 6.044892978668213, "epoch": 0.26739818109924873, "grad_norm": 0.9375, "learning_rate": 0.0004996786442061952, "loss": 5.8382, "mean_token_accuracy": 0.15803508460521698, "num_tokens": 6178046.0, "step": 2705 }, { "entropy": 6.045975303649902, "epoch": 0.2678924476077501, "grad_norm": 0.8828125, "learning_rate": 0.0004996767560008777, "loss": 5.894, "mean_token_accuracy": 0.15712593793869017, "num_tokens": 6190455.0, "step": 2710 }, { "entropy": 6.0375689506530765, "epoch": 0.2683867141162515, "grad_norm": 0.9140625, "learning_rate": 0.0004996748622684771, "loss": 5.7902, "mean_token_accuracy": 0.16150919497013091, "num_tokens": 6201659.0, "step": 2715 }, { "entropy": 5.969774627685547, "epoch": 0.26888098062475285, "grad_norm": 0.87890625, "learning_rate": 0.0004996729630090401, "loss": 5.8917, "mean_token_accuracy": 0.15097161531448364, "num_tokens": 6213870.0, "step": 2720 }, { "entropy": 6.122914266586304, "epoch": 0.2693752471332542, "grad_norm": 0.9140625, "learning_rate": 0.0004996710582226133, "loss": 5.8313, "mean_token_accuracy": 0.16073371469974518, "num_tokens": 6224237.0, "step": 2725 }, { "entropy": 6.037442827224732, "epoch": 0.26986951364175565, "grad_norm": 1.046875, "learning_rate": 0.0004996691479092437, "loss": 5.8781, "mean_token_accuracy": 0.1519405834376812, "num_tokens": 6235868.0, "step": 2730 }, { "entropy": 6.088305044174194, "epoch": 0.270363780150257, "grad_norm": 0.94140625, "learning_rate": 0.0004996672320689782, "loss": 5.9361, "mean_token_accuracy": 0.15224603563547134, "num_tokens": 6247994.0, "step": 2735 }, { "entropy": 5.923361682891846, "epoch": 0.2708580466587584, "grad_norm": 0.890625, "learning_rate": 0.0004996653107018638, "loss": 5.7832, "mean_token_accuracy": 0.16427244246006012, "num_tokens": 6259654.0, "step": 2740 }, { "entropy": 6.050891637802124, "epoch": 0.2713523131672598, "grad_norm": 0.91015625, "learning_rate": 0.000499663383807948, "loss": 5.8383, "mean_token_accuracy": 0.1583833247423172, "num_tokens": 6270582.0, "step": 2745 }, { "entropy": 6.075754547119141, "epoch": 0.27184657967576115, "grad_norm": 0.98828125, "learning_rate": 0.0004996614513872781, "loss": 5.8355, "mean_token_accuracy": 0.15854936242103576, "num_tokens": 6281088.0, "step": 2750 }, { "entropy": 6.093008613586425, "epoch": 0.2723408461842626, "grad_norm": 1.03125, "learning_rate": 0.0004996595134399017, "loss": 5.9879, "mean_token_accuracy": 0.1467800997197628, "num_tokens": 6292920.0, "step": 2755 }, { "entropy": 6.052947187423706, "epoch": 0.27283511269276395, "grad_norm": 0.875, "learning_rate": 0.0004996575699658664, "loss": 5.8468, "mean_token_accuracy": 0.156585992872715, "num_tokens": 6304980.0, "step": 2760 }, { "entropy": 6.028429698944092, "epoch": 0.2733293792012653, "grad_norm": 0.93359375, "learning_rate": 0.0004996556209652199, "loss": 5.8238, "mean_token_accuracy": 0.16182130724191665, "num_tokens": 6316175.0, "step": 2765 }, { "entropy": 6.074451160430908, "epoch": 0.2738236457097667, "grad_norm": 0.9453125, "learning_rate": 0.0004996536664380104, "loss": 5.8763, "mean_token_accuracy": 0.159360608458519, "num_tokens": 6327590.0, "step": 2770 }, { "entropy": 6.015805959701538, "epoch": 0.27431791221826807, "grad_norm": 0.93359375, "learning_rate": 0.0004996517063842859, "loss": 5.9119, "mean_token_accuracy": 0.15416058599948884, "num_tokens": 6339066.0, "step": 2775 }, { "entropy": 6.061740112304688, "epoch": 0.2748121787267695, "grad_norm": 0.953125, "learning_rate": 0.0004996497408040944, "loss": 5.8339, "mean_token_accuracy": 0.15957537293434143, "num_tokens": 6349485.0, "step": 2780 }, { "entropy": 5.976840829849243, "epoch": 0.27530644523527087, "grad_norm": 0.9765625, "learning_rate": 0.0004996477696974845, "loss": 5.7903, "mean_token_accuracy": 0.16120934933423997, "num_tokens": 6360775.0, "step": 2785 }, { "entropy": 6.0038059711456295, "epoch": 0.27580071174377224, "grad_norm": 0.984375, "learning_rate": 0.0004996457930645046, "loss": 5.797, "mean_token_accuracy": 0.15618587732315065, "num_tokens": 6371645.0, "step": 2790 }, { "entropy": 5.965744543075561, "epoch": 0.2762949782522736, "grad_norm": 0.95703125, "learning_rate": 0.0004996438109052034, "loss": 5.8383, "mean_token_accuracy": 0.1584193930029869, "num_tokens": 6383877.0, "step": 2795 }, { "entropy": 6.05974178314209, "epoch": 0.276789244760775, "grad_norm": 0.97265625, "learning_rate": 0.0004996418232196296, "loss": 5.9205, "mean_token_accuracy": 0.14770453348755835, "num_tokens": 6394488.0, "step": 2800 }, { "entropy": 6.052662467956543, "epoch": 0.2772835112692764, "grad_norm": 0.9375, "learning_rate": 0.0004996398300078321, "loss": 5.8522, "mean_token_accuracy": 0.156643283367157, "num_tokens": 6404948.0, "step": 2805 }, { "entropy": 6.078036880493164, "epoch": 0.2777777777777778, "grad_norm": 0.89453125, "learning_rate": 0.0004996378312698598, "loss": 5.8659, "mean_token_accuracy": 0.15740013867616653, "num_tokens": 6416273.0, "step": 2810 }, { "entropy": 6.047493886947632, "epoch": 0.27827204428627916, "grad_norm": 1.0390625, "learning_rate": 0.0004996358270057622, "loss": 5.8886, "mean_token_accuracy": 0.15248379707336426, "num_tokens": 6427091.0, "step": 2815 }, { "entropy": 6.046441507339478, "epoch": 0.27876631079478054, "grad_norm": 0.96875, "learning_rate": 0.0004996338172155883, "loss": 5.8366, "mean_token_accuracy": 0.1569639503955841, "num_tokens": 6438254.0, "step": 2820 }, { "entropy": 5.973606586456299, "epoch": 0.2792605773032819, "grad_norm": 0.953125, "learning_rate": 0.0004996318018993876, "loss": 5.7572, "mean_token_accuracy": 0.1562727063894272, "num_tokens": 6450618.0, "step": 2825 }, { "entropy": 6.033926391601563, "epoch": 0.27975484381178334, "grad_norm": 0.8671875, "learning_rate": 0.0004996297810572098, "loss": 5.8175, "mean_token_accuracy": 0.15667466074228287, "num_tokens": 6462467.0, "step": 2830 }, { "entropy": 5.983758878707886, "epoch": 0.2802491103202847, "grad_norm": 0.84765625, "learning_rate": 0.0004996277546891045, "loss": 5.8044, "mean_token_accuracy": 0.16479460895061493, "num_tokens": 6474206.0, "step": 2835 }, { "entropy": 6.020964288711548, "epoch": 0.2807433768287861, "grad_norm": 0.96484375, "learning_rate": 0.0004996257227951216, "loss": 5.888, "mean_token_accuracy": 0.15300803631544113, "num_tokens": 6486405.0, "step": 2840 }, { "entropy": 6.05193862915039, "epoch": 0.28123764333728746, "grad_norm": 1.0078125, "learning_rate": 0.000499623685375311, "loss": 5.8497, "mean_token_accuracy": 0.15643176138401033, "num_tokens": 6496949.0, "step": 2845 }, { "entropy": 5.958805656433105, "epoch": 0.28173190984578883, "grad_norm": 0.94140625, "learning_rate": 0.000499621642429723, "loss": 5.8017, "mean_token_accuracy": 0.15794066339731216, "num_tokens": 6508913.0, "step": 2850 }, { "entropy": 6.015378046035766, "epoch": 0.28222617635429026, "grad_norm": 0.87109375, "learning_rate": 0.0004996195939584078, "loss": 5.8361, "mean_token_accuracy": 0.15706655457615853, "num_tokens": 6519837.0, "step": 2855 }, { "entropy": 6.01123013496399, "epoch": 0.28272044286279163, "grad_norm": 0.9140625, "learning_rate": 0.0004996175399614156, "loss": 5.7918, "mean_token_accuracy": 0.15670203119516374, "num_tokens": 6531409.0, "step": 2860 }, { "entropy": 6.018320989608765, "epoch": 0.283214709371293, "grad_norm": 0.86328125, "learning_rate": 0.0004996154804387972, "loss": 5.8399, "mean_token_accuracy": 0.15969696193933486, "num_tokens": 6543433.0, "step": 2865 }, { "entropy": 6.009840059280395, "epoch": 0.2837089758797944, "grad_norm": 0.9921875, "learning_rate": 0.000499613415390603, "loss": 5.9206, "mean_token_accuracy": 0.14991554468870164, "num_tokens": 6554511.0, "step": 2870 }, { "entropy": 6.046218013763427, "epoch": 0.28420324238829575, "grad_norm": 0.96875, "learning_rate": 0.000499611344816884, "loss": 5.8238, "mean_token_accuracy": 0.15823389291763307, "num_tokens": 6564591.0, "step": 2875 }, { "entropy": 6.01461706161499, "epoch": 0.2846975088967972, "grad_norm": 0.90625, "learning_rate": 0.000499609268717691, "loss": 5.8225, "mean_token_accuracy": 0.1623471572995186, "num_tokens": 6575684.0, "step": 2880 }, { "entropy": 6.017358875274658, "epoch": 0.28519177540529855, "grad_norm": 0.92578125, "learning_rate": 0.0004996071870930753, "loss": 5.9406, "mean_token_accuracy": 0.15425658077001572, "num_tokens": 6588504.0, "step": 2885 }, { "entropy": 5.959894227981567, "epoch": 0.2856860419137999, "grad_norm": 0.93359375, "learning_rate": 0.0004996050999430878, "loss": 5.7635, "mean_token_accuracy": 0.16143444627523423, "num_tokens": 6599969.0, "step": 2890 }, { "entropy": 6.0251145362854, "epoch": 0.2861803084223013, "grad_norm": 1.0390625, "learning_rate": 0.0004996030072677802, "loss": 5.8187, "mean_token_accuracy": 0.16413614600896836, "num_tokens": 6611430.0, "step": 2895 }, { "entropy": 5.97908205986023, "epoch": 0.2866745749308027, "grad_norm": 0.90625, "learning_rate": 0.0004996009090672037, "loss": 5.8278, "mean_token_accuracy": 0.1551106110215187, "num_tokens": 6623247.0, "step": 2900 }, { "entropy": 6.029708385467529, "epoch": 0.28716884143930405, "grad_norm": 0.875, "learning_rate": 0.0004995988053414098, "loss": 5.9552, "mean_token_accuracy": 0.149957475066185, "num_tokens": 6635508.0, "step": 2905 }, { "entropy": 5.988954877853393, "epoch": 0.2876631079478055, "grad_norm": 0.9453125, "learning_rate": 0.0004995966960904506, "loss": 5.8637, "mean_token_accuracy": 0.15391170904040335, "num_tokens": 6646020.0, "step": 2910 }, { "entropy": 6.052160787582397, "epoch": 0.28815737445630685, "grad_norm": 0.984375, "learning_rate": 0.0004995945813143778, "loss": 5.8785, "mean_token_accuracy": 0.1489527091383934, "num_tokens": 6658194.0, "step": 2915 }, { "entropy": 6.05843505859375, "epoch": 0.2886516409648082, "grad_norm": 0.92578125, "learning_rate": 0.0004995924610132435, "loss": 5.8498, "mean_token_accuracy": 0.158658966422081, "num_tokens": 6670582.0, "step": 2920 }, { "entropy": 6.010510683059692, "epoch": 0.2891459074733096, "grad_norm": 1.0390625, "learning_rate": 0.0004995903351870998, "loss": 5.7942, "mean_token_accuracy": 0.15778048932552338, "num_tokens": 6680836.0, "step": 2925 }, { "entropy": 6.075353288650513, "epoch": 0.28964017398181097, "grad_norm": 0.96484375, "learning_rate": 0.000499588203835999, "loss": 5.8909, "mean_token_accuracy": 0.15145400837063788, "num_tokens": 6693045.0, "step": 2930 }, { "entropy": 6.051756286621094, "epoch": 0.2901344404903124, "grad_norm": 1.0625, "learning_rate": 0.0004995860669599935, "loss": 5.8502, "mean_token_accuracy": 0.15376394540071486, "num_tokens": 6704006.0, "step": 2935 }, { "entropy": 5.9235528945922855, "epoch": 0.29062870699881377, "grad_norm": 0.87890625, "learning_rate": 0.000499583924559136, "loss": 5.8036, "mean_token_accuracy": 0.15702625140547752, "num_tokens": 6717027.0, "step": 2940 }, { "entropy": 6.067442607879639, "epoch": 0.29112297350731514, "grad_norm": 0.97265625, "learning_rate": 0.000499581776633479, "loss": 5.7958, "mean_token_accuracy": 0.1589622288942337, "num_tokens": 6728107.0, "step": 2945 }, { "entropy": 5.924325895309448, "epoch": 0.2916172400158165, "grad_norm": 1.0390625, "learning_rate": 0.0004995796231830756, "loss": 5.8265, "mean_token_accuracy": 0.15883112251758574, "num_tokens": 6738628.0, "step": 2950 }, { "entropy": 5.967429113388062, "epoch": 0.2921115065243179, "grad_norm": 1.015625, "learning_rate": 0.0004995774642079786, "loss": 5.7583, "mean_token_accuracy": 0.16689376384019852, "num_tokens": 6749416.0, "step": 2955 }, { "entropy": 5.94444088935852, "epoch": 0.2926057730328193, "grad_norm": 0.84765625, "learning_rate": 0.000499575299708241, "loss": 5.8774, "mean_token_accuracy": 0.14967955350875856, "num_tokens": 6761663.0, "step": 2960 }, { "entropy": 6.0701212882995605, "epoch": 0.2931000395413207, "grad_norm": 0.8984375, "learning_rate": 0.0004995731296839163, "loss": 5.8149, "mean_token_accuracy": 0.16118715405464173, "num_tokens": 6773557.0, "step": 2965 }, { "entropy": 5.85501708984375, "epoch": 0.29359430604982206, "grad_norm": 0.96484375, "learning_rate": 0.0004995709541350578, "loss": 5.7395, "mean_token_accuracy": 0.16694540828466414, "num_tokens": 6782832.0, "step": 2970 }, { "entropy": 6.010708570480347, "epoch": 0.29408857255832344, "grad_norm": 0.95703125, "learning_rate": 0.000499568773061719, "loss": 5.8681, "mean_token_accuracy": 0.15356052964925765, "num_tokens": 6795165.0, "step": 2975 }, { "entropy": 6.066813945770264, "epoch": 0.2945828390668248, "grad_norm": 0.921875, "learning_rate": 0.0004995665864639534, "loss": 5.876, "mean_token_accuracy": 0.15979506969451904, "num_tokens": 6807054.0, "step": 2980 }, { "entropy": 5.903352069854736, "epoch": 0.29507710557532624, "grad_norm": 0.94921875, "learning_rate": 0.0004995643943418149, "loss": 5.6685, "mean_token_accuracy": 0.16543218046426772, "num_tokens": 6817681.0, "step": 2985 }, { "entropy": 5.982229900360108, "epoch": 0.2955713720838276, "grad_norm": 0.90625, "learning_rate": 0.0004995621966953576, "loss": 5.8401, "mean_token_accuracy": 0.15782412886619568, "num_tokens": 6829387.0, "step": 2990 }, { "entropy": 5.967217683792114, "epoch": 0.296065638592329, "grad_norm": 0.796875, "learning_rate": 0.0004995599935246355, "loss": 5.8201, "mean_token_accuracy": 0.15736720860004424, "num_tokens": 6842023.0, "step": 2995 }, { "entropy": 5.993825960159302, "epoch": 0.29655990510083036, "grad_norm": 0.90625, "learning_rate": 0.0004995577848297026, "loss": 5.824, "mean_token_accuracy": 0.15770515501499177, "num_tokens": 6853189.0, "step": 3000 }, { "epoch": 0.29655990510083036, "eval_entropy": 5.832319829502082, "eval_loss": 5.858894348144531, "eval_mean_token_accuracy": 0.1635531999793953, "eval_num_tokens": 6853189.0, "eval_runtime": 20.5029, "eval_samples_per_second": 1585.78, "eval_steps_per_second": 198.265, "step": 3000 }, { "entropy": 6.054750585556031, "epoch": 0.29705417160933173, "grad_norm": 0.94140625, "learning_rate": 0.0004995555706106134, "loss": 5.8735, "mean_token_accuracy": 0.15223144441843034, "num_tokens": 6864338.0, "step": 3005 }, { "entropy": 5.968316173553466, "epoch": 0.29754843811783316, "grad_norm": 1.046875, "learning_rate": 0.0004995533508674223, "loss": 5.7514, "mean_token_accuracy": 0.16216484755277633, "num_tokens": 6875409.0, "step": 3010 }, { "entropy": 5.986220788955689, "epoch": 0.29804270462633453, "grad_norm": 1.015625, "learning_rate": 0.0004995511256001839, "loss": 5.7902, "mean_token_accuracy": 0.16563501954078674, "num_tokens": 6885757.0, "step": 3015 }, { "entropy": 5.96476936340332, "epoch": 0.2985369711348359, "grad_norm": 1.015625, "learning_rate": 0.000499548894808953, "loss": 5.835, "mean_token_accuracy": 0.1585961401462555, "num_tokens": 6896440.0, "step": 3020 }, { "entropy": 6.048309326171875, "epoch": 0.2990312376433373, "grad_norm": 0.96484375, "learning_rate": 0.0004995466584937846, "loss": 5.8523, "mean_token_accuracy": 0.1554264321923256, "num_tokens": 6907319.0, "step": 3025 }, { "entropy": 5.998583459854126, "epoch": 0.29952550415183865, "grad_norm": 0.9609375, "learning_rate": 0.0004995444166547333, "loss": 5.8146, "mean_token_accuracy": 0.155062672495842, "num_tokens": 6918683.0, "step": 3030 }, { "entropy": 5.952762413024902, "epoch": 0.3000197706603401, "grad_norm": 0.93359375, "learning_rate": 0.0004995421692918547, "loss": 5.787, "mean_token_accuracy": 0.15784311890602112, "num_tokens": 6929974.0, "step": 3035 }, { "entropy": 5.9712481021881105, "epoch": 0.30051403716884145, "grad_norm": 0.890625, "learning_rate": 0.0004995399164052038, "loss": 5.7975, "mean_token_accuracy": 0.1553229048848152, "num_tokens": 6941213.0, "step": 3040 }, { "entropy": 6.11203556060791, "epoch": 0.3010083036773428, "grad_norm": 1.015625, "learning_rate": 0.0004995376579948362, "loss": 5.8432, "mean_token_accuracy": 0.1563342347741127, "num_tokens": 6952880.0, "step": 3045 }, { "entropy": 5.992726516723633, "epoch": 0.3015025701858442, "grad_norm": 0.88671875, "learning_rate": 0.0004995353940608074, "loss": 5.8275, "mean_token_accuracy": 0.15914143919944762, "num_tokens": 6964344.0, "step": 3050 }, { "entropy": 5.907603931427002, "epoch": 0.30199683669434557, "grad_norm": 0.91796875, "learning_rate": 0.000499533124603173, "loss": 5.7647, "mean_token_accuracy": 0.16137944608926774, "num_tokens": 6976042.0, "step": 3055 }, { "entropy": 6.011988592147827, "epoch": 0.302491103202847, "grad_norm": 0.91015625, "learning_rate": 0.000499530849621989, "loss": 5.7438, "mean_token_accuracy": 0.1657906651496887, "num_tokens": 6988137.0, "step": 3060 }, { "entropy": 5.879757118225098, "epoch": 0.3029853697113484, "grad_norm": 0.9453125, "learning_rate": 0.0004995285691173111, "loss": 5.7652, "mean_token_accuracy": 0.16155530214309693, "num_tokens": 6999858.0, "step": 3065 }, { "entropy": 6.038882637023926, "epoch": 0.30347963621984975, "grad_norm": 0.86328125, "learning_rate": 0.0004995262830891957, "loss": 5.8327, "mean_token_accuracy": 0.16102459132671357, "num_tokens": 7012756.0, "step": 3070 }, { "entropy": 6.000944471359253, "epoch": 0.3039739027283511, "grad_norm": 0.92578125, "learning_rate": 0.0004995239915376988, "loss": 5.8376, "mean_token_accuracy": 0.15485122203826904, "num_tokens": 7024769.0, "step": 3075 }, { "entropy": 5.988115930557251, "epoch": 0.3044681692368525, "grad_norm": 0.95703125, "learning_rate": 0.0004995216944628769, "loss": 5.8421, "mean_token_accuracy": 0.1501378148794174, "num_tokens": 7035422.0, "step": 3080 }, { "entropy": 5.955748891830444, "epoch": 0.3049624357453539, "grad_norm": 0.9296875, "learning_rate": 0.0004995193918647865, "loss": 5.7592, "mean_token_accuracy": 0.16532133370637894, "num_tokens": 7046923.0, "step": 3085 }, { "entropy": 6.030281209945679, "epoch": 0.3054567022538553, "grad_norm": 0.8828125, "learning_rate": 0.0004995170837434844, "loss": 5.8103, "mean_token_accuracy": 0.1530565842986107, "num_tokens": 7058241.0, "step": 3090 }, { "entropy": 5.893657398223877, "epoch": 0.30595096876235667, "grad_norm": 0.93359375, "learning_rate": 0.0004995147700990269, "loss": 5.8291, "mean_token_accuracy": 0.15803710669279097, "num_tokens": 7070028.0, "step": 3095 }, { "entropy": 6.050175571441651, "epoch": 0.30644523527085804, "grad_norm": 1.015625, "learning_rate": 0.0004995124509314714, "loss": 5.8237, "mean_token_accuracy": 0.15725741237401963, "num_tokens": 7082641.0, "step": 3100 }, { "entropy": 5.984448003768921, "epoch": 0.3069395017793594, "grad_norm": 0.9921875, "learning_rate": 0.0004995101262408748, "loss": 5.8153, "mean_token_accuracy": 0.1589738368988037, "num_tokens": 7094462.0, "step": 3105 }, { "entropy": 5.956927728652954, "epoch": 0.3074337682878608, "grad_norm": 0.98046875, "learning_rate": 0.0004995077960272943, "loss": 5.7794, "mean_token_accuracy": 0.15726812779903412, "num_tokens": 7106598.0, "step": 3110 }, { "entropy": 5.94078631401062, "epoch": 0.3079280347963622, "grad_norm": 1.0625, "learning_rate": 0.0004995054602907871, "loss": 5.709, "mean_token_accuracy": 0.15569936633110046, "num_tokens": 7117006.0, "step": 3115 }, { "entropy": 5.851768827438354, "epoch": 0.3084223013048636, "grad_norm": 1.0, "learning_rate": 0.0004995031190314107, "loss": 5.7889, "mean_token_accuracy": 0.1594916731119156, "num_tokens": 7128071.0, "step": 3120 }, { "entropy": 6.035452508926392, "epoch": 0.30891656781336496, "grad_norm": 0.94140625, "learning_rate": 0.0004995007722492228, "loss": 5.7996, "mean_token_accuracy": 0.16208165585994722, "num_tokens": 7139896.0, "step": 3125 }, { "entropy": 5.922273349761963, "epoch": 0.30941083432186633, "grad_norm": 0.921875, "learning_rate": 0.0004994984199442811, "loss": 5.75, "mean_token_accuracy": 0.16801734119653702, "num_tokens": 7151479.0, "step": 3130 }, { "entropy": 6.012390232086181, "epoch": 0.3099051008303677, "grad_norm": 0.9375, "learning_rate": 0.0004994960621166434, "loss": 5.79, "mean_token_accuracy": 0.16099888533353807, "num_tokens": 7162942.0, "step": 3135 }, { "entropy": 5.887371778488159, "epoch": 0.31039936733886914, "grad_norm": 0.93359375, "learning_rate": 0.0004994936987663678, "loss": 5.7594, "mean_token_accuracy": 0.16757521778345108, "num_tokens": 7174572.0, "step": 3140 }, { "entropy": 5.979536628723144, "epoch": 0.3108936338473705, "grad_norm": 0.91796875, "learning_rate": 0.0004994913298935124, "loss": 5.8074, "mean_token_accuracy": 0.1602259784936905, "num_tokens": 7186352.0, "step": 3145 }, { "entropy": 5.97523865699768, "epoch": 0.3113879003558719, "grad_norm": 0.8828125, "learning_rate": 0.0004994889554981353, "loss": 5.7899, "mean_token_accuracy": 0.15793664157390594, "num_tokens": 7197849.0, "step": 3150 }, { "entropy": 5.88937520980835, "epoch": 0.31188216686437326, "grad_norm": 0.984375, "learning_rate": 0.0004994865755802953, "loss": 5.738, "mean_token_accuracy": 0.15789498537778854, "num_tokens": 7207897.0, "step": 3155 }, { "entropy": 6.035556411743164, "epoch": 0.31237643337287463, "grad_norm": 0.96484375, "learning_rate": 0.0004994841901400505, "loss": 5.8693, "mean_token_accuracy": 0.1593574956059456, "num_tokens": 7219148.0, "step": 3160 }, { "entropy": 6.119725894927979, "epoch": 0.31287069988137606, "grad_norm": 0.875, "learning_rate": 0.0004994817991774599, "loss": 5.9379, "mean_token_accuracy": 0.14732077568769456, "num_tokens": 7230690.0, "step": 3165 }, { "entropy": 6.032812929153442, "epoch": 0.31336496638987743, "grad_norm": 0.98046875, "learning_rate": 0.0004994794026925822, "loss": 5.793, "mean_token_accuracy": 0.1566063642501831, "num_tokens": 7240935.0, "step": 3170 }, { "entropy": 5.937824964523315, "epoch": 0.3138592328983788, "grad_norm": 0.86328125, "learning_rate": 0.0004994770006854763, "loss": 5.8406, "mean_token_accuracy": 0.15766705721616744, "num_tokens": 7253345.0, "step": 3175 }, { "entropy": 6.103414249420166, "epoch": 0.3143534994068802, "grad_norm": 1.015625, "learning_rate": 0.0004994745931562015, "loss": 5.8485, "mean_token_accuracy": 0.1582420289516449, "num_tokens": 7265355.0, "step": 3180 }, { "entropy": 5.804067373275757, "epoch": 0.31484776591538155, "grad_norm": 0.9140625, "learning_rate": 0.0004994721801048168, "loss": 5.7435, "mean_token_accuracy": 0.16501011997461318, "num_tokens": 7277355.0, "step": 3185 }, { "entropy": 5.960165309906006, "epoch": 0.315342032423883, "grad_norm": 0.92578125, "learning_rate": 0.0004994697615313817, "loss": 5.7999, "mean_token_accuracy": 0.1640367940068245, "num_tokens": 7288754.0, "step": 3190 }, { "entropy": 6.080531930923462, "epoch": 0.31583629893238435, "grad_norm": 0.921875, "learning_rate": 0.0004994673374359556, "loss": 5.8562, "mean_token_accuracy": 0.15231133252382278, "num_tokens": 7301158.0, "step": 3195 }, { "entropy": 5.955043125152588, "epoch": 0.3163305654408857, "grad_norm": 0.8984375, "learning_rate": 0.0004994649078185982, "loss": 5.8386, "mean_token_accuracy": 0.15667256116867065, "num_tokens": 7314420.0, "step": 3200 }, { "entropy": 5.962018060684204, "epoch": 0.3168248319493871, "grad_norm": 0.9375, "learning_rate": 0.0004994624726793693, "loss": 5.7824, "mean_token_accuracy": 0.15832739025354386, "num_tokens": 7325459.0, "step": 3205 }, { "entropy": 5.957371520996094, "epoch": 0.31731909845788847, "grad_norm": 1.1015625, "learning_rate": 0.0004994600320183286, "loss": 5.7494, "mean_token_accuracy": 0.15850538909435272, "num_tokens": 7336016.0, "step": 3210 }, { "entropy": 5.8942546367645265, "epoch": 0.3178133649663899, "grad_norm": 0.9921875, "learning_rate": 0.0004994575858355364, "loss": 5.7342, "mean_token_accuracy": 0.16328315138816835, "num_tokens": 7346716.0, "step": 3215 }, { "entropy": 6.067971706390381, "epoch": 0.3183076314748913, "grad_norm": 1.0234375, "learning_rate": 0.0004994551341310526, "loss": 5.8463, "mean_token_accuracy": 0.15799187272787094, "num_tokens": 7357246.0, "step": 3220 }, { "entropy": 5.974669790267944, "epoch": 0.31880189798339265, "grad_norm": 0.94140625, "learning_rate": 0.0004994526769049379, "loss": 5.8691, "mean_token_accuracy": 0.14865454882383347, "num_tokens": 7369173.0, "step": 3225 }, { "entropy": 6.0467792510986325, "epoch": 0.319296164491894, "grad_norm": 1.0390625, "learning_rate": 0.0004994502141572524, "loss": 5.8617, "mean_token_accuracy": 0.14867965131998062, "num_tokens": 7381118.0, "step": 3230 }, { "entropy": 5.9362719535827635, "epoch": 0.3197904310003954, "grad_norm": 0.93359375, "learning_rate": 0.0004994477458880568, "loss": 5.7077, "mean_token_accuracy": 0.17059717774391175, "num_tokens": 7391874.0, "step": 3235 }, { "entropy": 5.956166982650757, "epoch": 0.3202846975088968, "grad_norm": 1.03125, "learning_rate": 0.0004994452720974119, "loss": 5.7923, "mean_token_accuracy": 0.16450496315956115, "num_tokens": 7403474.0, "step": 3240 }, { "entropy": 5.9693482398986815, "epoch": 0.3207789640173982, "grad_norm": 0.88671875, "learning_rate": 0.0004994427927853785, "loss": 5.7055, "mean_token_accuracy": 0.16475337147712707, "num_tokens": 7415173.0, "step": 3245 }, { "entropy": 5.878284883499146, "epoch": 0.32127323052589957, "grad_norm": 0.84765625, "learning_rate": 0.0004994403079520175, "loss": 5.7257, "mean_token_accuracy": 0.16320813298225403, "num_tokens": 7426965.0, "step": 3250 }, { "entropy": 5.964143514633179, "epoch": 0.32176749703440094, "grad_norm": 0.9765625, "learning_rate": 0.0004994378175973902, "loss": 5.6962, "mean_token_accuracy": 0.1644366502761841, "num_tokens": 7438162.0, "step": 3255 }, { "entropy": 5.948713397979736, "epoch": 0.3222617635429023, "grad_norm": 0.953125, "learning_rate": 0.0004994353217215577, "loss": 5.7834, "mean_token_accuracy": 0.1569782555103302, "num_tokens": 7450241.0, "step": 3260 }, { "entropy": 6.038526821136474, "epoch": 0.32275603005140374, "grad_norm": 0.97265625, "learning_rate": 0.0004994328203245814, "loss": 5.8919, "mean_token_accuracy": 0.15084750354290008, "num_tokens": 7462236.0, "step": 3265 }, { "entropy": 5.948995304107666, "epoch": 0.3232502965599051, "grad_norm": 0.94921875, "learning_rate": 0.0004994303134065231, "loss": 5.7798, "mean_token_accuracy": 0.1564018540084362, "num_tokens": 7472811.0, "step": 3270 }, { "entropy": 5.925486850738525, "epoch": 0.3237445630684065, "grad_norm": 1.0390625, "learning_rate": 0.0004994278009674442, "loss": 5.6805, "mean_token_accuracy": 0.1692005217075348, "num_tokens": 7484837.0, "step": 3275 }, { "entropy": 5.958797121047974, "epoch": 0.32423882957690786, "grad_norm": 0.9140625, "learning_rate": 0.0004994252830074064, "loss": 5.7962, "mean_token_accuracy": 0.1593277335166931, "num_tokens": 7496712.0, "step": 3280 }, { "entropy": 5.903368425369263, "epoch": 0.32473309608540923, "grad_norm": 0.8984375, "learning_rate": 0.000499422759526472, "loss": 5.7869, "mean_token_accuracy": 0.15338947176933287, "num_tokens": 7508014.0, "step": 3285 }, { "entropy": 5.999322700500488, "epoch": 0.32522736259391066, "grad_norm": 0.96484375, "learning_rate": 0.0004994202305247029, "loss": 5.8263, "mean_token_accuracy": 0.15912134647369386, "num_tokens": 7519466.0, "step": 3290 }, { "entropy": 6.053624534606934, "epoch": 0.32572162910241204, "grad_norm": 0.828125, "learning_rate": 0.0004994176960021613, "loss": 5.8843, "mean_token_accuracy": 0.15303612649440765, "num_tokens": 7531661.0, "step": 3295 }, { "entropy": 5.980695629119873, "epoch": 0.3262158956109134, "grad_norm": 0.828125, "learning_rate": 0.0004994151559589095, "loss": 5.7958, "mean_token_accuracy": 0.161936454474926, "num_tokens": 7544096.0, "step": 3300 }, { "entropy": 5.926052808761597, "epoch": 0.3267101621194148, "grad_norm": 0.90625, "learning_rate": 0.0004994126103950101, "loss": 5.7711, "mean_token_accuracy": 0.15798719525337218, "num_tokens": 7556022.0, "step": 3305 }, { "entropy": 6.003690910339356, "epoch": 0.32720442862791616, "grad_norm": 0.9296875, "learning_rate": 0.0004994100593105257, "loss": 5.7502, "mean_token_accuracy": 0.1720753163099289, "num_tokens": 7567399.0, "step": 3310 }, { "entropy": 5.859436988830566, "epoch": 0.3276986951364176, "grad_norm": 0.875, "learning_rate": 0.0004994075027055189, "loss": 5.7919, "mean_token_accuracy": 0.16088175177574157, "num_tokens": 7580673.0, "step": 3315 }, { "entropy": 5.989814281463623, "epoch": 0.32819296164491896, "grad_norm": 0.984375, "learning_rate": 0.0004994049405800529, "loss": 5.7641, "mean_token_accuracy": 0.15499694943428038, "num_tokens": 7591799.0, "step": 3320 }, { "entropy": 5.977367401123047, "epoch": 0.32868722815342033, "grad_norm": 0.92578125, "learning_rate": 0.0004994023729341904, "loss": 5.7906, "mean_token_accuracy": 0.16022640615701675, "num_tokens": 7603663.0, "step": 3325 }, { "entropy": 5.915757036209106, "epoch": 0.3291814946619217, "grad_norm": 0.87890625, "learning_rate": 0.0004993997997679949, "loss": 5.7429, "mean_token_accuracy": 0.16712774634361266, "num_tokens": 7615651.0, "step": 3330 }, { "entropy": 5.842534112930298, "epoch": 0.3296757611704231, "grad_norm": 0.88671875, "learning_rate": 0.0004993972210815292, "loss": 5.7467, "mean_token_accuracy": 0.1679021716117859, "num_tokens": 7628033.0, "step": 3335 }, { "entropy": 6.08715672492981, "epoch": 0.33017002767892445, "grad_norm": 0.8515625, "learning_rate": 0.0004993946368748573, "loss": 5.8703, "mean_token_accuracy": 0.16015619188547134, "num_tokens": 7640227.0, "step": 3340 }, { "entropy": 5.935750913619995, "epoch": 0.3306642941874259, "grad_norm": 0.89453125, "learning_rate": 0.0004993920471480424, "loss": 5.7725, "mean_token_accuracy": 0.16384557485580445, "num_tokens": 7651684.0, "step": 3345 }, { "entropy": 5.978537750244141, "epoch": 0.33115856069592725, "grad_norm": 0.953125, "learning_rate": 0.0004993894519011484, "loss": 5.7898, "mean_token_accuracy": 0.16151873022317886, "num_tokens": 7662721.0, "step": 3350 }, { "entropy": 5.934241390228271, "epoch": 0.3316528272044286, "grad_norm": 0.83984375, "learning_rate": 0.0004993868511342391, "loss": 5.7447, "mean_token_accuracy": 0.16571061909198762, "num_tokens": 7674060.0, "step": 3355 }, { "entropy": 5.909103488922119, "epoch": 0.33214709371293, "grad_norm": 1.09375, "learning_rate": 0.0004993842448473783, "loss": 5.6915, "mean_token_accuracy": 0.16673399806022643, "num_tokens": 7685054.0, "step": 3360 }, { "entropy": 5.906066370010376, "epoch": 0.33264136022143137, "grad_norm": 0.93359375, "learning_rate": 0.0004993816330406304, "loss": 5.8218, "mean_token_accuracy": 0.1552596226334572, "num_tokens": 7696554.0, "step": 3365 }, { "entropy": 5.988926267623901, "epoch": 0.3331356267299328, "grad_norm": 0.93359375, "learning_rate": 0.0004993790157140595, "loss": 5.6937, "mean_token_accuracy": 0.16371029168367385, "num_tokens": 7707000.0, "step": 3370 }, { "entropy": 5.986670589447021, "epoch": 0.33362989323843417, "grad_norm": 0.89453125, "learning_rate": 0.0004993763928677299, "loss": 5.7737, "mean_token_accuracy": 0.1629856273531914, "num_tokens": 7718898.0, "step": 3375 }, { "entropy": 5.937011337280273, "epoch": 0.33412415974693555, "grad_norm": 0.9765625, "learning_rate": 0.0004993737645017064, "loss": 5.8115, "mean_token_accuracy": 0.1607807457447052, "num_tokens": 7730493.0, "step": 3380 }, { "entropy": 5.908415603637695, "epoch": 0.3346184262554369, "grad_norm": 0.94921875, "learning_rate": 0.0004993711306160534, "loss": 5.7191, "mean_token_accuracy": 0.16285421848297119, "num_tokens": 7742177.0, "step": 3385 }, { "entropy": 5.936457586288452, "epoch": 0.3351126927639383, "grad_norm": 0.953125, "learning_rate": 0.0004993684912108358, "loss": 5.7867, "mean_token_accuracy": 0.16387349218130112, "num_tokens": 7753386.0, "step": 3390 }, { "entropy": 5.901752138137818, "epoch": 0.3356069592724397, "grad_norm": 1.0, "learning_rate": 0.0004993658462861184, "loss": 5.7061, "mean_token_accuracy": 0.1637064903974533, "num_tokens": 7764259.0, "step": 3395 }, { "entropy": 5.9262011528015135, "epoch": 0.3361012257809411, "grad_norm": 0.95703125, "learning_rate": 0.0004993631958419666, "loss": 5.6822, "mean_token_accuracy": 0.16869139522314072, "num_tokens": 7775853.0, "step": 3400 }, { "entropy": 5.933384799957276, "epoch": 0.33659549228944247, "grad_norm": 0.91015625, "learning_rate": 0.0004993605398784451, "loss": 5.8191, "mean_token_accuracy": 0.15217963084578515, "num_tokens": 7787116.0, "step": 3405 }, { "entropy": 6.020944976806641, "epoch": 0.33708975879794384, "grad_norm": 0.875, "learning_rate": 0.0004993578783956198, "loss": 5.8408, "mean_token_accuracy": 0.1531720757484436, "num_tokens": 7799666.0, "step": 3410 }, { "entropy": 5.943038368225098, "epoch": 0.3375840253064452, "grad_norm": 0.91796875, "learning_rate": 0.0004993552113935557, "loss": 5.7398, "mean_token_accuracy": 0.16825398355722426, "num_tokens": 7812454.0, "step": 3415 }, { "entropy": 5.940898656845093, "epoch": 0.33807829181494664, "grad_norm": 0.90234375, "learning_rate": 0.0004993525388723186, "loss": 5.7729, "mean_token_accuracy": 0.16233767122030257, "num_tokens": 7824427.0, "step": 3420 }, { "entropy": 5.938141632080078, "epoch": 0.338572558323448, "grad_norm": 0.953125, "learning_rate": 0.0004993498608319742, "loss": 5.7837, "mean_token_accuracy": 0.16356806606054305, "num_tokens": 7835382.0, "step": 3425 }, { "entropy": 5.9362342834472654, "epoch": 0.3390668248319494, "grad_norm": 0.890625, "learning_rate": 0.0004993471772725886, "loss": 5.688, "mean_token_accuracy": 0.1716388076543808, "num_tokens": 7846618.0, "step": 3430 }, { "entropy": 5.907315015792847, "epoch": 0.33956109134045076, "grad_norm": 0.921875, "learning_rate": 0.0004993444881942274, "loss": 5.7336, "mean_token_accuracy": 0.16113698482513428, "num_tokens": 7859160.0, "step": 3435 }, { "entropy": 5.857381010055542, "epoch": 0.34005535784895213, "grad_norm": 0.859375, "learning_rate": 0.0004993417935969572, "loss": 5.7461, "mean_token_accuracy": 0.1615937903523445, "num_tokens": 7870628.0, "step": 3440 }, { "entropy": 5.972476005554199, "epoch": 0.34054962435745356, "grad_norm": 0.90625, "learning_rate": 0.000499339093480844, "loss": 5.7696, "mean_token_accuracy": 0.16259367018938065, "num_tokens": 7883016.0, "step": 3445 }, { "entropy": 5.946801471710205, "epoch": 0.34104389086595494, "grad_norm": 0.92578125, "learning_rate": 0.0004993363878459542, "loss": 5.7804, "mean_token_accuracy": 0.15578061193227768, "num_tokens": 7895940.0, "step": 3450 }, { "entropy": 5.9291047096252445, "epoch": 0.3415381573744563, "grad_norm": 0.8828125, "learning_rate": 0.0004993336766923546, "loss": 5.7908, "mean_token_accuracy": 0.15707747489213944, "num_tokens": 7907920.0, "step": 3455 }, { "entropy": 5.926029109954834, "epoch": 0.3420324238829577, "grad_norm": 0.984375, "learning_rate": 0.0004993309600201117, "loss": 5.7897, "mean_token_accuracy": 0.1633515626192093, "num_tokens": 7920181.0, "step": 3460 }, { "entropy": 5.912346887588501, "epoch": 0.34252669039145905, "grad_norm": 1.0, "learning_rate": 0.0004993282378292923, "loss": 5.7439, "mean_token_accuracy": 0.17050547748804093, "num_tokens": 7931135.0, "step": 3465 }, { "entropy": 5.964553689956665, "epoch": 0.3430209568999605, "grad_norm": 1.078125, "learning_rate": 0.0004993255101199635, "loss": 5.7203, "mean_token_accuracy": 0.16594656258821489, "num_tokens": 7941002.0, "step": 3470 }, { "entropy": 5.96255316734314, "epoch": 0.34351522340846186, "grad_norm": 1.0390625, "learning_rate": 0.0004993227768921924, "loss": 5.6919, "mean_token_accuracy": 0.1683175340294838, "num_tokens": 7950393.0, "step": 3475 }, { "entropy": 5.869276428222657, "epoch": 0.34400948991696323, "grad_norm": 0.8359375, "learning_rate": 0.0004993200381460461, "loss": 5.7275, "mean_token_accuracy": 0.16211515963077544, "num_tokens": 7961468.0, "step": 3480 }, { "entropy": 5.871631860733032, "epoch": 0.3445037564254646, "grad_norm": 0.8203125, "learning_rate": 0.0004993172938815922, "loss": 5.5577, "mean_token_accuracy": 0.17855503112077714, "num_tokens": 7973783.0, "step": 3485 }, { "entropy": 5.855233097076416, "epoch": 0.344998022933966, "grad_norm": 0.95703125, "learning_rate": 0.0004993145440988979, "loss": 5.6391, "mean_token_accuracy": 0.17340969145298005, "num_tokens": 7984099.0, "step": 3490 }, { "entropy": 5.994485330581665, "epoch": 0.3454922894424674, "grad_norm": 0.89453125, "learning_rate": 0.0004993117887980311, "loss": 5.7865, "mean_token_accuracy": 0.16144178062677383, "num_tokens": 7995115.0, "step": 3495 }, { "entropy": 5.906498622894287, "epoch": 0.3459865559509688, "grad_norm": 1.0546875, "learning_rate": 0.0004993090279790596, "loss": 5.7315, "mean_token_accuracy": 0.16343103647232055, "num_tokens": 8006103.0, "step": 3500 }, { "entropy": 5.833856010437012, "epoch": 0.34648082245947015, "grad_norm": 0.9140625, "learning_rate": 0.000499306261642051, "loss": 5.6891, "mean_token_accuracy": 0.16052100658416749, "num_tokens": 8018228.0, "step": 3505 }, { "entropy": 5.90078706741333, "epoch": 0.3469750889679715, "grad_norm": 0.9140625, "learning_rate": 0.0004993034897870737, "loss": 5.6648, "mean_token_accuracy": 0.1659534439444542, "num_tokens": 8029808.0, "step": 3510 }, { "entropy": 5.860544300079345, "epoch": 0.3474693554764729, "grad_norm": 0.87109375, "learning_rate": 0.0004993007124141958, "loss": 5.7393, "mean_token_accuracy": 0.1600656732916832, "num_tokens": 8041136.0, "step": 3515 }, { "entropy": 5.9545159339904785, "epoch": 0.3479636219849743, "grad_norm": 1.0078125, "learning_rate": 0.0004992979295234854, "loss": 5.7843, "mean_token_accuracy": 0.15851401537656784, "num_tokens": 8053013.0, "step": 3520 }, { "entropy": 5.909142589569091, "epoch": 0.3484578884934757, "grad_norm": 0.86328125, "learning_rate": 0.0004992951411150112, "loss": 5.7684, "mean_token_accuracy": 0.16275966316461563, "num_tokens": 8065139.0, "step": 3525 }, { "entropy": 5.880959463119507, "epoch": 0.34895215500197707, "grad_norm": 0.9921875, "learning_rate": 0.0004992923471888418, "loss": 5.6253, "mean_token_accuracy": 0.17183551341295242, "num_tokens": 8075719.0, "step": 3530 }, { "entropy": 5.899447393417359, "epoch": 0.34944642151047844, "grad_norm": 0.88671875, "learning_rate": 0.0004992895477450459, "loss": 5.7518, "mean_token_accuracy": 0.16490523517131805, "num_tokens": 8087821.0, "step": 3535 }, { "entropy": 5.869767475128174, "epoch": 0.3499406880189798, "grad_norm": 1.015625, "learning_rate": 0.0004992867427836923, "loss": 5.6271, "mean_token_accuracy": 0.16934036165475846, "num_tokens": 8099861.0, "step": 3540 }, { "entropy": 6.016390419006347, "epoch": 0.3504349545274812, "grad_norm": 0.96484375, "learning_rate": 0.0004992839323048501, "loss": 5.8802, "mean_token_accuracy": 0.1534687213599682, "num_tokens": 8111671.0, "step": 3545 }, { "entropy": 6.055253362655639, "epoch": 0.3509292210359826, "grad_norm": 1.0390625, "learning_rate": 0.0004992811163085882, "loss": 5.8287, "mean_token_accuracy": 0.15730856359004974, "num_tokens": 8123569.0, "step": 3550 }, { "entropy": 6.00129885673523, "epoch": 0.351423487544484, "grad_norm": 0.89453125, "learning_rate": 0.0004992782947949761, "loss": 5.834, "mean_token_accuracy": 0.15455945432186127, "num_tokens": 8135621.0, "step": 3555 }, { "entropy": 5.871588611602784, "epoch": 0.35191775405298537, "grad_norm": 0.99609375, "learning_rate": 0.0004992754677640831, "loss": 5.6922, "mean_token_accuracy": 0.16750261336565017, "num_tokens": 8147012.0, "step": 3560 }, { "entropy": 5.941411352157592, "epoch": 0.35241202056148674, "grad_norm": 1.0, "learning_rate": 0.0004992726352159789, "loss": 5.6866, "mean_token_accuracy": 0.16887724846601487, "num_tokens": 8158686.0, "step": 3565 }, { "entropy": 5.892278861999512, "epoch": 0.3529062870699881, "grad_norm": 0.9765625, "learning_rate": 0.0004992697971507331, "loss": 5.6676, "mean_token_accuracy": 0.1688147082924843, "num_tokens": 8170188.0, "step": 3570 }, { "entropy": 5.888853216171265, "epoch": 0.35340055357848954, "grad_norm": 0.859375, "learning_rate": 0.0004992669535684155, "loss": 5.7586, "mean_token_accuracy": 0.16212038993835448, "num_tokens": 8182467.0, "step": 3575 }, { "entropy": 6.009447479248047, "epoch": 0.3538948200869909, "grad_norm": 0.89453125, "learning_rate": 0.0004992641044690959, "loss": 5.8551, "mean_token_accuracy": 0.1583287924528122, "num_tokens": 8193433.0, "step": 3580 }, { "entropy": 5.907385587692261, "epoch": 0.3543890865954923, "grad_norm": 0.88671875, "learning_rate": 0.0004992612498528447, "loss": 5.6386, "mean_token_accuracy": 0.1663960576057434, "num_tokens": 8204220.0, "step": 3585 }, { "entropy": 5.798449420928955, "epoch": 0.35488335310399366, "grad_norm": 0.9609375, "learning_rate": 0.0004992583897197319, "loss": 5.654, "mean_token_accuracy": 0.17561966478824614, "num_tokens": 8214203.0, "step": 3590 }, { "entropy": 5.9734455108642575, "epoch": 0.35537761961249503, "grad_norm": 1.015625, "learning_rate": 0.0004992555240698279, "loss": 5.7923, "mean_token_accuracy": 0.1612005814909935, "num_tokens": 8225143.0, "step": 3595 }, { "entropy": 5.981592082977295, "epoch": 0.35587188612099646, "grad_norm": 0.8828125, "learning_rate": 0.0004992526529032032, "loss": 5.6697, "mean_token_accuracy": 0.17088547945022584, "num_tokens": 8237715.0, "step": 3600 }, { "entropy": 5.839101123809814, "epoch": 0.35636615262949783, "grad_norm": 0.83984375, "learning_rate": 0.0004992497762199285, "loss": 5.711, "mean_token_accuracy": 0.16858086735010147, "num_tokens": 8249645.0, "step": 3605 }, { "entropy": 5.925719165802002, "epoch": 0.3568604191379992, "grad_norm": 0.97265625, "learning_rate": 0.0004992468940200745, "loss": 5.6762, "mean_token_accuracy": 0.1701796442270279, "num_tokens": 8260624.0, "step": 3610 }, { "entropy": 5.938683414459229, "epoch": 0.3573546856465006, "grad_norm": 0.91015625, "learning_rate": 0.0004992440063037121, "loss": 5.7844, "mean_token_accuracy": 0.15771422386169434, "num_tokens": 8272526.0, "step": 3615 }, { "entropy": 5.825928401947022, "epoch": 0.35784895215500195, "grad_norm": 0.93359375, "learning_rate": 0.0004992411130709124, "loss": 5.6837, "mean_token_accuracy": 0.16699493378400804, "num_tokens": 8284270.0, "step": 3620 }, { "entropy": 6.0033622741699215, "epoch": 0.3583432186635034, "grad_norm": 0.890625, "learning_rate": 0.0004992382143217466, "loss": 5.7888, "mean_token_accuracy": 0.16136447638273238, "num_tokens": 8296407.0, "step": 3625 }, { "entropy": 5.879290056228638, "epoch": 0.35883748517200476, "grad_norm": 0.90625, "learning_rate": 0.0004992353100562858, "loss": 5.6965, "mean_token_accuracy": 0.17272357195615767, "num_tokens": 8307695.0, "step": 3630 }, { "entropy": 5.82924485206604, "epoch": 0.35933175168050613, "grad_norm": 0.93359375, "learning_rate": 0.0004992324002746016, "loss": 5.6784, "mean_token_accuracy": 0.1643420234322548, "num_tokens": 8319458.0, "step": 3635 }, { "entropy": 5.847436380386353, "epoch": 0.3598260181890075, "grad_norm": 0.8828125, "learning_rate": 0.0004992294849767656, "loss": 5.5796, "mean_token_accuracy": 0.17512751817703248, "num_tokens": 8330284.0, "step": 3640 }, { "entropy": 5.900366926193238, "epoch": 0.3603202846975089, "grad_norm": 0.92578125, "learning_rate": 0.0004992265641628495, "loss": 5.7115, "mean_token_accuracy": 0.165615913271904, "num_tokens": 8343622.0, "step": 3645 }, { "entropy": 5.901623678207398, "epoch": 0.3608145512060103, "grad_norm": 0.96484375, "learning_rate": 0.0004992236378329252, "loss": 5.672, "mean_token_accuracy": 0.1665194883942604, "num_tokens": 8354079.0, "step": 3650 }, { "entropy": 5.865346765518188, "epoch": 0.3613088177145117, "grad_norm": 0.93359375, "learning_rate": 0.0004992207059870645, "loss": 5.711, "mean_token_accuracy": 0.1649839922785759, "num_tokens": 8364876.0, "step": 3655 }, { "entropy": 5.966877841949463, "epoch": 0.36180308422301305, "grad_norm": 0.93359375, "learning_rate": 0.0004992177686253396, "loss": 5.6535, "mean_token_accuracy": 0.17188939601182937, "num_tokens": 8375095.0, "step": 3660 }, { "entropy": 5.845507860183716, "epoch": 0.3622973507315144, "grad_norm": 0.97265625, "learning_rate": 0.000499214825747823, "loss": 5.6517, "mean_token_accuracy": 0.1670224964618683, "num_tokens": 8385934.0, "step": 3665 }, { "entropy": 5.843030071258545, "epoch": 0.3627916172400158, "grad_norm": 0.86328125, "learning_rate": 0.0004992118773545868, "loss": 5.612, "mean_token_accuracy": 0.1732995480298996, "num_tokens": 8397018.0, "step": 3670 }, { "entropy": 5.859984111785889, "epoch": 0.3632858837485172, "grad_norm": 0.97265625, "learning_rate": 0.0004992089234457036, "loss": 5.6782, "mean_token_accuracy": 0.17082912623882293, "num_tokens": 8406668.0, "step": 3675 }, { "entropy": 5.922388696670533, "epoch": 0.3637801502570186, "grad_norm": 0.9765625, "learning_rate": 0.0004992059640212461, "loss": 5.7231, "mean_token_accuracy": 0.16309249848127366, "num_tokens": 8417471.0, "step": 3680 }, { "entropy": 5.8756935596466064, "epoch": 0.36427441676551997, "grad_norm": 0.87109375, "learning_rate": 0.0004992029990812872, "loss": 5.7848, "mean_token_accuracy": 0.15951351821422577, "num_tokens": 8430073.0, "step": 3685 }, { "entropy": 5.937635850906372, "epoch": 0.36476868327402134, "grad_norm": 0.89453125, "learning_rate": 0.0004992000286258997, "loss": 5.7005, "mean_token_accuracy": 0.16230473667383194, "num_tokens": 8442573.0, "step": 3690 }, { "entropy": 5.983772087097168, "epoch": 0.3652629497825227, "grad_norm": 0.9140625, "learning_rate": 0.0004991970526551567, "loss": 5.7469, "mean_token_accuracy": 0.16291342228651046, "num_tokens": 8453920.0, "step": 3695 }, { "entropy": 5.881690263748169, "epoch": 0.36575721629102415, "grad_norm": 0.8984375, "learning_rate": 0.0004991940711691314, "loss": 5.7754, "mean_token_accuracy": 0.16588612496852875, "num_tokens": 8466652.0, "step": 3700 }, { "entropy": 5.953763818740844, "epoch": 0.3662514827995255, "grad_norm": 0.875, "learning_rate": 0.0004991910841678972, "loss": 5.7888, "mean_token_accuracy": 0.1622040703892708, "num_tokens": 8480203.0, "step": 3705 }, { "entropy": 5.8867415428161625, "epoch": 0.3667457493080269, "grad_norm": 0.90234375, "learning_rate": 0.0004991880916515275, "loss": 5.6973, "mean_token_accuracy": 0.16245957762002944, "num_tokens": 8491396.0, "step": 3710 }, { "entropy": 5.9312187194824215, "epoch": 0.36724001581652826, "grad_norm": 1.046875, "learning_rate": 0.000499185093620096, "loss": 5.6699, "mean_token_accuracy": 0.1664442613720894, "num_tokens": 8501838.0, "step": 3715 }, { "entropy": 5.833083820343018, "epoch": 0.36773428232502964, "grad_norm": 1.0859375, "learning_rate": 0.0004991820900736765, "loss": 5.5622, "mean_token_accuracy": 0.17411092072725295, "num_tokens": 8512113.0, "step": 3720 }, { "entropy": 5.892808341979981, "epoch": 0.36822854883353107, "grad_norm": 0.91015625, "learning_rate": 0.0004991790810123427, "loss": 5.6572, "mean_token_accuracy": 0.1673700362443924, "num_tokens": 8523888.0, "step": 3725 }, { "entropy": 5.8269569873809814, "epoch": 0.36872281534203244, "grad_norm": 0.90625, "learning_rate": 0.0004991760664361688, "loss": 5.5684, "mean_token_accuracy": 0.1790203258395195, "num_tokens": 8536078.0, "step": 3730 }, { "entropy": 5.892239761352539, "epoch": 0.3692170818505338, "grad_norm": 0.93359375, "learning_rate": 0.0004991730463452288, "loss": 5.7134, "mean_token_accuracy": 0.1591755285859108, "num_tokens": 8547131.0, "step": 3735 }, { "entropy": 5.8254612445831295, "epoch": 0.3697113483590352, "grad_norm": 0.9765625, "learning_rate": 0.0004991700207395971, "loss": 5.5802, "mean_token_accuracy": 0.1787737637758255, "num_tokens": 8557269.0, "step": 3740 }, { "entropy": 5.9330181121826175, "epoch": 0.37020561486753656, "grad_norm": 0.9765625, "learning_rate": 0.0004991669896193482, "loss": 5.765, "mean_token_accuracy": 0.15813942551612853, "num_tokens": 8569193.0, "step": 3745 }, { "entropy": 5.85114221572876, "epoch": 0.370699881376038, "grad_norm": 0.9453125, "learning_rate": 0.0004991639529845565, "loss": 5.6425, "mean_token_accuracy": 0.16877837777137755, "num_tokens": 8580888.0, "step": 3750 }, { "entropy": 5.845303583145141, "epoch": 0.37119414788453936, "grad_norm": 0.93359375, "learning_rate": 0.0004991609108352968, "loss": 5.716, "mean_token_accuracy": 0.16477999836206436, "num_tokens": 8591868.0, "step": 3755 }, { "entropy": 5.870332288742065, "epoch": 0.37168841439304073, "grad_norm": 0.94140625, "learning_rate": 0.0004991578631716438, "loss": 5.6866, "mean_token_accuracy": 0.1691501185297966, "num_tokens": 8602338.0, "step": 3760 }, { "entropy": 5.902234268188477, "epoch": 0.3721826809015421, "grad_norm": 0.89453125, "learning_rate": 0.0004991548099936727, "loss": 5.615, "mean_token_accuracy": 0.17584475129842758, "num_tokens": 8611698.0, "step": 3765 }, { "entropy": 5.818107652664184, "epoch": 0.3726769474100435, "grad_norm": 0.92578125, "learning_rate": 0.0004991517513014585, "loss": 5.6143, "mean_token_accuracy": 0.16893157958984376, "num_tokens": 8623537.0, "step": 3770 }, { "entropy": 5.820996999740601, "epoch": 0.37317121391854485, "grad_norm": 0.9609375, "learning_rate": 0.0004991486870950765, "loss": 5.6816, "mean_token_accuracy": 0.1656678132712841, "num_tokens": 8634678.0, "step": 3775 }, { "entropy": 5.849688339233398, "epoch": 0.3736654804270463, "grad_norm": 0.97265625, "learning_rate": 0.0004991456173746021, "loss": 5.671, "mean_token_accuracy": 0.16995999366044998, "num_tokens": 8646207.0, "step": 3780 }, { "entropy": 5.968811321258545, "epoch": 0.37415974693554765, "grad_norm": 0.8828125, "learning_rate": 0.0004991425421401105, "loss": 5.7213, "mean_token_accuracy": 0.1660832494497299, "num_tokens": 8657069.0, "step": 3785 }, { "entropy": 5.783479976654053, "epoch": 0.374654013444049, "grad_norm": 0.875, "learning_rate": 0.0004991394613916777, "loss": 5.5922, "mean_token_accuracy": 0.17547424584627153, "num_tokens": 8668296.0, "step": 3790 }, { "entropy": 5.823474740982055, "epoch": 0.3751482799525504, "grad_norm": 0.8828125, "learning_rate": 0.0004991363751293795, "loss": 5.7501, "mean_token_accuracy": 0.16348499208688735, "num_tokens": 8680626.0, "step": 3795 }, { "entropy": 5.870781469345093, "epoch": 0.3756425464610518, "grad_norm": 0.87890625, "learning_rate": 0.0004991332833532915, "loss": 5.6509, "mean_token_accuracy": 0.16883147209882737, "num_tokens": 8691571.0, "step": 3800 }, { "entropy": 5.819311952590942, "epoch": 0.3761368129695532, "grad_norm": 0.9921875, "learning_rate": 0.00049913018606349, "loss": 5.6825, "mean_token_accuracy": 0.17045059949159622, "num_tokens": 8703262.0, "step": 3805 }, { "entropy": 5.913802719116211, "epoch": 0.3766310794780546, "grad_norm": 0.87109375, "learning_rate": 0.0004991270832600512, "loss": 5.7749, "mean_token_accuracy": 0.15400226563215255, "num_tokens": 8714799.0, "step": 3810 }, { "entropy": 5.971995782852173, "epoch": 0.37712534598655595, "grad_norm": 0.9765625, "learning_rate": 0.0004991239749430514, "loss": 5.7605, "mean_token_accuracy": 0.160916206240654, "num_tokens": 8726417.0, "step": 3815 }, { "entropy": 5.7569605827331545, "epoch": 0.3776196124950573, "grad_norm": 0.91796875, "learning_rate": 0.000499120861112567, "loss": 5.6334, "mean_token_accuracy": 0.17114915698766708, "num_tokens": 8738572.0, "step": 3820 }, { "entropy": 6.033152866363525, "epoch": 0.3781138790035587, "grad_norm": 0.8828125, "learning_rate": 0.0004991177417686747, "loss": 5.7999, "mean_token_accuracy": 0.15733451545238494, "num_tokens": 8750557.0, "step": 3825 }, { "entropy": 5.886162328720093, "epoch": 0.3786081455120601, "grad_norm": 0.91015625, "learning_rate": 0.0004991146169114511, "loss": 5.5872, "mean_token_accuracy": 0.16607448756694793, "num_tokens": 8761921.0, "step": 3830 }, { "entropy": 5.771987056732177, "epoch": 0.3791024120205615, "grad_norm": 0.9453125, "learning_rate": 0.0004991114865409732, "loss": 5.6709, "mean_token_accuracy": 0.1719615176320076, "num_tokens": 8772705.0, "step": 3835 }, { "entropy": 5.888619661331177, "epoch": 0.37959667852906287, "grad_norm": 0.9609375, "learning_rate": 0.000499108350657318, "loss": 5.7004, "mean_token_accuracy": 0.16091297268867494, "num_tokens": 8783563.0, "step": 3840 }, { "entropy": 5.800805521011353, "epoch": 0.38009094503756424, "grad_norm": 0.96875, "learning_rate": 0.0004991052092605627, "loss": 5.5721, "mean_token_accuracy": 0.17409331798553468, "num_tokens": 8794171.0, "step": 3845 }, { "entropy": 5.83490629196167, "epoch": 0.3805852115460656, "grad_norm": 0.98828125, "learning_rate": 0.0004991020623507842, "loss": 5.6894, "mean_token_accuracy": 0.1655197724699974, "num_tokens": 8806487.0, "step": 3850 }, { "entropy": 5.867008924484253, "epoch": 0.38107947805456704, "grad_norm": 0.875, "learning_rate": 0.0004990989099280604, "loss": 5.698, "mean_token_accuracy": 0.16811285316944122, "num_tokens": 8817819.0, "step": 3855 }, { "entropy": 5.908767414093018, "epoch": 0.3815737445630684, "grad_norm": 0.9453125, "learning_rate": 0.0004990957519924686, "loss": 5.6398, "mean_token_accuracy": 0.16685824394226073, "num_tokens": 8828485.0, "step": 3860 }, { "entropy": 5.825345230102539, "epoch": 0.3820680110715698, "grad_norm": 0.89453125, "learning_rate": 0.0004990925885440865, "loss": 5.7144, "mean_token_accuracy": 0.16649122387170792, "num_tokens": 8840179.0, "step": 3865 }, { "entropy": 5.855547523498535, "epoch": 0.38256227758007116, "grad_norm": 0.9453125, "learning_rate": 0.0004990894195829921, "loss": 5.7153, "mean_token_accuracy": 0.17356601655483245, "num_tokens": 8851813.0, "step": 3870 }, { "entropy": 5.850685119628906, "epoch": 0.38305654408857254, "grad_norm": 0.953125, "learning_rate": 0.0004990862451092631, "loss": 5.6481, "mean_token_accuracy": 0.16521792411804198, "num_tokens": 8863072.0, "step": 3875 }, { "entropy": 5.914801025390625, "epoch": 0.38355081059707397, "grad_norm": 0.953125, "learning_rate": 0.0004990830651229776, "loss": 5.6622, "mean_token_accuracy": 0.17067244797945022, "num_tokens": 8873510.0, "step": 3880 }, { "entropy": 5.787506246566773, "epoch": 0.38404507710557534, "grad_norm": 0.96875, "learning_rate": 0.0004990798796242142, "loss": 5.6045, "mean_token_accuracy": 0.1705389976501465, "num_tokens": 8884296.0, "step": 3885 }, { "entropy": 5.873062229156494, "epoch": 0.3845393436140767, "grad_norm": 0.91015625, "learning_rate": 0.0004990766886130508, "loss": 5.6556, "mean_token_accuracy": 0.17088765054941177, "num_tokens": 8894208.0, "step": 3890 }, { "entropy": 5.981917095184326, "epoch": 0.3850336101225781, "grad_norm": 0.9921875, "learning_rate": 0.0004990734920895662, "loss": 5.8356, "mean_token_accuracy": 0.1590656965970993, "num_tokens": 8905703.0, "step": 3895 }, { "entropy": 5.841706705093384, "epoch": 0.38552787663107946, "grad_norm": 0.87890625, "learning_rate": 0.0004990702900538388, "loss": 5.6406, "mean_token_accuracy": 0.16936296671628953, "num_tokens": 8918077.0, "step": 3900 }, { "entropy": 5.792620229721069, "epoch": 0.3860221431395809, "grad_norm": 0.8125, "learning_rate": 0.0004990670825059477, "loss": 5.5946, "mean_token_accuracy": 0.1669241353869438, "num_tokens": 8930240.0, "step": 3905 }, { "entropy": 5.876611137390137, "epoch": 0.38651640964808226, "grad_norm": 0.91015625, "learning_rate": 0.0004990638694459715, "loss": 5.6745, "mean_token_accuracy": 0.172709059715271, "num_tokens": 8941421.0, "step": 3910 }, { "entropy": 5.87284140586853, "epoch": 0.38701067615658363, "grad_norm": 0.9375, "learning_rate": 0.0004990606508739893, "loss": 5.6884, "mean_token_accuracy": 0.16478568613529204, "num_tokens": 8952296.0, "step": 3915 }, { "entropy": 5.840622138977051, "epoch": 0.387504942665085, "grad_norm": 0.92578125, "learning_rate": 0.0004990574267900804, "loss": 5.6988, "mean_token_accuracy": 0.1605827584862709, "num_tokens": 8963167.0, "step": 3920 }, { "entropy": 5.850691843032837, "epoch": 0.3879992091735864, "grad_norm": 0.95703125, "learning_rate": 0.0004990541971943241, "loss": 5.6613, "mean_token_accuracy": 0.17132709920406342, "num_tokens": 8974405.0, "step": 3925 }, { "entropy": 5.8156054496765135, "epoch": 0.3884934756820878, "grad_norm": 0.9453125, "learning_rate": 0.0004990509620867997, "loss": 5.5875, "mean_token_accuracy": 0.17515513002872468, "num_tokens": 8986012.0, "step": 3930 }, { "entropy": 5.744684791564941, "epoch": 0.3889877421905892, "grad_norm": 0.97265625, "learning_rate": 0.0004990477214675868, "loss": 5.5714, "mean_token_accuracy": 0.17034527361392976, "num_tokens": 8996759.0, "step": 3935 }, { "entropy": 5.8819811820983885, "epoch": 0.38948200869909055, "grad_norm": 0.95703125, "learning_rate": 0.0004990444753367653, "loss": 5.6877, "mean_token_accuracy": 0.16470410525798798, "num_tokens": 9007215.0, "step": 3940 }, { "entropy": 5.79785680770874, "epoch": 0.3899762752075919, "grad_norm": 0.91015625, "learning_rate": 0.0004990412236944149, "loss": 5.6099, "mean_token_accuracy": 0.17718676179647447, "num_tokens": 9018281.0, "step": 3945 }, { "entropy": 5.885517358779907, "epoch": 0.3904705417160933, "grad_norm": 0.859375, "learning_rate": 0.0004990379665406157, "loss": 5.7627, "mean_token_accuracy": 0.16322001814842224, "num_tokens": 9029312.0, "step": 3950 }, { "entropy": 5.9418707370758055, "epoch": 0.39096480822459473, "grad_norm": 1.0, "learning_rate": 0.0004990347038754477, "loss": 5.7259, "mean_token_accuracy": 0.1603141486644745, "num_tokens": 9040273.0, "step": 3955 }, { "entropy": 5.8697507858276365, "epoch": 0.3914590747330961, "grad_norm": 0.7890625, "learning_rate": 0.0004990314356989912, "loss": 5.6612, "mean_token_accuracy": 0.16203155219554902, "num_tokens": 9052571.0, "step": 3960 }, { "entropy": 5.769499731063843, "epoch": 0.3919533412415975, "grad_norm": 0.92578125, "learning_rate": 0.0004990281620113268, "loss": 5.6137, "mean_token_accuracy": 0.16850953549146652, "num_tokens": 9063531.0, "step": 3965 }, { "entropy": 5.889568710327149, "epoch": 0.39244760775009885, "grad_norm": 0.9921875, "learning_rate": 0.0004990248828125347, "loss": 5.6602, "mean_token_accuracy": 0.16463824063539506, "num_tokens": 9075404.0, "step": 3970 }, { "entropy": 5.788878726959228, "epoch": 0.3929418742586002, "grad_norm": 0.90625, "learning_rate": 0.0004990215981026958, "loss": 5.6769, "mean_token_accuracy": 0.1660008355975151, "num_tokens": 9086570.0, "step": 3975 }, { "entropy": 5.820216178894043, "epoch": 0.3934361407671016, "grad_norm": 0.85546875, "learning_rate": 0.0004990183078818908, "loss": 5.5637, "mean_token_accuracy": 0.17135565876960754, "num_tokens": 9097993.0, "step": 3980 }, { "entropy": 5.857799530029297, "epoch": 0.393930407275603, "grad_norm": 0.9296875, "learning_rate": 0.0004990150121502007, "loss": 5.631, "mean_token_accuracy": 0.1729619413614273, "num_tokens": 9108783.0, "step": 3985 }, { "entropy": 5.787160348892212, "epoch": 0.3944246737841044, "grad_norm": 0.94921875, "learning_rate": 0.0004990117109077066, "loss": 5.6895, "mean_token_accuracy": 0.16763761192560195, "num_tokens": 9120039.0, "step": 3990 }, { "entropy": 5.872583436965942, "epoch": 0.39491894029260577, "grad_norm": 0.9765625, "learning_rate": 0.0004990084041544895, "loss": 5.6447, "mean_token_accuracy": 0.1718740701675415, "num_tokens": 9131543.0, "step": 3995 }, { "entropy": 5.830124759674073, "epoch": 0.39541320680110714, "grad_norm": 0.859375, "learning_rate": 0.000499005091890631, "loss": 5.656, "mean_token_accuracy": 0.16724567413330077, "num_tokens": 9142968.0, "step": 4000 }, { "entropy": 5.793219661712646, "epoch": 0.3959074733096085, "grad_norm": 0.8359375, "learning_rate": 0.0004990017741162125, "loss": 5.7347, "mean_token_accuracy": 0.16510688811540603, "num_tokens": 9155705.0, "step": 4005 }, { "entropy": 5.889053916931152, "epoch": 0.39640173981810994, "grad_norm": 0.88671875, "learning_rate": 0.0004989984508313156, "loss": 5.7254, "mean_token_accuracy": 0.1608736991882324, "num_tokens": 9167575.0, "step": 4010 }, { "entropy": 5.828622198104858, "epoch": 0.3968960063266113, "grad_norm": 0.89453125, "learning_rate": 0.000498995122036022, "loss": 5.6898, "mean_token_accuracy": 0.16883498430252075, "num_tokens": 9178493.0, "step": 4015 }, { "entropy": 5.905095815658569, "epoch": 0.3973902728351127, "grad_norm": 0.95703125, "learning_rate": 0.0004989917877304138, "loss": 5.7603, "mean_token_accuracy": 0.15981398671865463, "num_tokens": 9189677.0, "step": 4020 }, { "entropy": 5.8420172214508055, "epoch": 0.39788453934361406, "grad_norm": 1.015625, "learning_rate": 0.0004989884479145727, "loss": 5.5931, "mean_token_accuracy": 0.17333310544490815, "num_tokens": 9199179.0, "step": 4025 }, { "entropy": 5.865707492828369, "epoch": 0.39837880585211544, "grad_norm": 0.9296875, "learning_rate": 0.0004989851025885812, "loss": 5.6565, "mean_token_accuracy": 0.16424668729305267, "num_tokens": 9210689.0, "step": 4030 }, { "entropy": 5.824964809417724, "epoch": 0.39887307236061686, "grad_norm": 0.9921875, "learning_rate": 0.0004989817517525212, "loss": 5.6203, "mean_token_accuracy": 0.17306457757949828, "num_tokens": 9221710.0, "step": 4035 }, { "entropy": 5.896170997619629, "epoch": 0.39936733886911824, "grad_norm": 0.921875, "learning_rate": 0.0004989783954064755, "loss": 5.727, "mean_token_accuracy": 0.16530784517526625, "num_tokens": 9234079.0, "step": 4040 }, { "entropy": 5.8151609897613525, "epoch": 0.3998616053776196, "grad_norm": 0.89453125, "learning_rate": 0.0004989750335505265, "loss": 5.6443, "mean_token_accuracy": 0.1714458391070366, "num_tokens": 9245050.0, "step": 4045 }, { "entropy": 5.914986038208008, "epoch": 0.400355871886121, "grad_norm": 0.9921875, "learning_rate": 0.0004989716661847571, "loss": 5.7297, "mean_token_accuracy": 0.16297087371349334, "num_tokens": 9256455.0, "step": 4050 }, { "entropy": 5.825174045562744, "epoch": 0.40085013839462236, "grad_norm": 0.91796875, "learning_rate": 0.0004989682933092497, "loss": 5.6209, "mean_token_accuracy": 0.17252285778522491, "num_tokens": 9267722.0, "step": 4055 }, { "entropy": 5.796307802200317, "epoch": 0.4013444049031238, "grad_norm": 1.046875, "learning_rate": 0.0004989649149240877, "loss": 5.6556, "mean_token_accuracy": 0.164555099606514, "num_tokens": 9277533.0, "step": 4060 }, { "entropy": 5.851642084121704, "epoch": 0.40183867141162516, "grad_norm": 0.87109375, "learning_rate": 0.000498961531029354, "loss": 5.6887, "mean_token_accuracy": 0.17196653932332992, "num_tokens": 9290052.0, "step": 4065 }, { "entropy": 5.895582151412964, "epoch": 0.40233293792012653, "grad_norm": 0.91015625, "learning_rate": 0.000498958141625132, "loss": 5.6814, "mean_token_accuracy": 0.17183603942394257, "num_tokens": 9302201.0, "step": 4070 }, { "entropy": 5.854503917694092, "epoch": 0.4028272044286279, "grad_norm": 1.0078125, "learning_rate": 0.0004989547467115047, "loss": 5.754, "mean_token_accuracy": 0.15988993793725967, "num_tokens": 9313215.0, "step": 4075 }, { "entropy": 5.911263132095337, "epoch": 0.4033214709371293, "grad_norm": 0.85546875, "learning_rate": 0.0004989513462885561, "loss": 5.7903, "mean_token_accuracy": 0.15529886931180953, "num_tokens": 9324098.0, "step": 4080 }, { "entropy": 5.93774299621582, "epoch": 0.4038157374456307, "grad_norm": 0.81640625, "learning_rate": 0.0004989479403563696, "loss": 5.6631, "mean_token_accuracy": 0.16660943776369094, "num_tokens": 9336048.0, "step": 4085 }, { "entropy": 5.827685832977295, "epoch": 0.4043100039541321, "grad_norm": 0.8515625, "learning_rate": 0.0004989445289150289, "loss": 5.6377, "mean_token_accuracy": 0.16572660058736802, "num_tokens": 9347723.0, "step": 4090 }, { "entropy": 5.811399459838867, "epoch": 0.40480427046263345, "grad_norm": 0.86328125, "learning_rate": 0.0004989411119646183, "loss": 5.6782, "mean_token_accuracy": 0.16103081852197648, "num_tokens": 9360588.0, "step": 4095 }, { "entropy": 5.867809820175171, "epoch": 0.4052985369711348, "grad_norm": 0.96875, "learning_rate": 0.0004989376895052214, "loss": 5.634, "mean_token_accuracy": 0.16817477941513062, "num_tokens": 9371798.0, "step": 4100 }, { "entropy": 5.8832377910614015, "epoch": 0.4057928034796362, "grad_norm": 0.9296875, "learning_rate": 0.0004989342615369226, "loss": 5.651, "mean_token_accuracy": 0.1734667092561722, "num_tokens": 9382421.0, "step": 4105 }, { "entropy": 5.853188705444336, "epoch": 0.40628706998813763, "grad_norm": 0.98828125, "learning_rate": 0.0004989308280598063, "loss": 5.5753, "mean_token_accuracy": 0.17374583184719086, "num_tokens": 9392832.0, "step": 4110 }, { "entropy": 5.732818651199341, "epoch": 0.406781336496639, "grad_norm": 0.8515625, "learning_rate": 0.0004989273890739569, "loss": 5.5887, "mean_token_accuracy": 0.16861679553985595, "num_tokens": 9405309.0, "step": 4115 }, { "entropy": 5.768270206451416, "epoch": 0.4072756030051404, "grad_norm": 0.91015625, "learning_rate": 0.000498923944579459, "loss": 5.5705, "mean_token_accuracy": 0.17978079319000245, "num_tokens": 9416707.0, "step": 4120 }, { "entropy": 5.82515664100647, "epoch": 0.40776986951364175, "grad_norm": 0.9765625, "learning_rate": 0.0004989204945763972, "loss": 5.7034, "mean_token_accuracy": 0.16809640377759932, "num_tokens": 9427684.0, "step": 4125 }, { "entropy": 5.8416100025177, "epoch": 0.4082641360221431, "grad_norm": 0.87109375, "learning_rate": 0.0004989170390648567, "loss": 5.6674, "mean_token_accuracy": 0.16924387067556382, "num_tokens": 9439073.0, "step": 4130 }, { "entropy": 5.822237873077393, "epoch": 0.40875840253064455, "grad_norm": 0.84375, "learning_rate": 0.0004989135780449222, "loss": 5.5922, "mean_token_accuracy": 0.17128507643938065, "num_tokens": 9450266.0, "step": 4135 }, { "entropy": 5.756419467926025, "epoch": 0.4092526690391459, "grad_norm": 0.94140625, "learning_rate": 0.0004989101115166789, "loss": 5.5921, "mean_token_accuracy": 0.1717158928513527, "num_tokens": 9462662.0, "step": 4140 }, { "entropy": 5.843273687362671, "epoch": 0.4097469355476473, "grad_norm": 0.8828125, "learning_rate": 0.0004989066394802122, "loss": 5.6782, "mean_token_accuracy": 0.16578489392995835, "num_tokens": 9474338.0, "step": 4145 }, { "entropy": 5.864294862747192, "epoch": 0.41024120205614867, "grad_norm": 0.8828125, "learning_rate": 0.0004989031619356074, "loss": 5.6685, "mean_token_accuracy": 0.17041880190372466, "num_tokens": 9486353.0, "step": 4150 }, { "entropy": 5.817152214050293, "epoch": 0.41073546856465004, "grad_norm": 0.84765625, "learning_rate": 0.00049889967888295, "loss": 5.6265, "mean_token_accuracy": 0.16392918080091476, "num_tokens": 9497464.0, "step": 4155 }, { "entropy": 5.8257345199584964, "epoch": 0.41122973507315147, "grad_norm": 0.92578125, "learning_rate": 0.0004988961903223258, "loss": 5.5939, "mean_token_accuracy": 0.17517293095588685, "num_tokens": 9508037.0, "step": 4160 }, { "entropy": 5.7433753490448, "epoch": 0.41172400158165284, "grad_norm": 0.953125, "learning_rate": 0.0004988926962538207, "loss": 5.6262, "mean_token_accuracy": 0.172930346429348, "num_tokens": 9518653.0, "step": 4165 }, { "entropy": 5.8265598773956295, "epoch": 0.4122182680901542, "grad_norm": 0.9453125, "learning_rate": 0.0004988891966775204, "loss": 5.636, "mean_token_accuracy": 0.17219978123903273, "num_tokens": 9529225.0, "step": 4170 }, { "entropy": 5.861594486236572, "epoch": 0.4127125345986556, "grad_norm": 1.0078125, "learning_rate": 0.0004988856915935112, "loss": 5.5999, "mean_token_accuracy": 0.16609014868736266, "num_tokens": 9541010.0, "step": 4175 }, { "entropy": 5.769639110565185, "epoch": 0.41320680110715696, "grad_norm": 0.98046875, "learning_rate": 0.0004988821810018791, "loss": 5.6904, "mean_token_accuracy": 0.16319281831383706, "num_tokens": 9552061.0, "step": 4180 }, { "entropy": 5.96462721824646, "epoch": 0.41370106761565834, "grad_norm": 0.94140625, "learning_rate": 0.0004988786649027108, "loss": 5.7798, "mean_token_accuracy": 0.15974751859903336, "num_tokens": 9563970.0, "step": 4185 }, { "entropy": 5.845090913772583, "epoch": 0.41419533412415976, "grad_norm": 0.87109375, "learning_rate": 0.0004988751432960926, "loss": 5.5574, "mean_token_accuracy": 0.17453519105911255, "num_tokens": 9575381.0, "step": 4190 }, { "entropy": 5.841922569274902, "epoch": 0.41468960063266114, "grad_norm": 0.90625, "learning_rate": 0.0004988716161821111, "loss": 5.6004, "mean_token_accuracy": 0.1759848952293396, "num_tokens": 9586821.0, "step": 4195 }, { "entropy": 5.840303087234497, "epoch": 0.4151838671411625, "grad_norm": 0.8828125, "learning_rate": 0.0004988680835608531, "loss": 5.6802, "mean_token_accuracy": 0.15982237756252288, "num_tokens": 9599580.0, "step": 4200 }, { "entropy": 5.771040582656861, "epoch": 0.4156781336496639, "grad_norm": 0.85546875, "learning_rate": 0.0004988645454324055, "loss": 5.6706, "mean_token_accuracy": 0.16638167053461075, "num_tokens": 9611495.0, "step": 4205 }, { "entropy": 5.898043870925903, "epoch": 0.41617240015816526, "grad_norm": 0.87109375, "learning_rate": 0.0004988610017968554, "loss": 5.6375, "mean_token_accuracy": 0.1717217206954956, "num_tokens": 9623713.0, "step": 4210 }, { "entropy": 5.821990585327148, "epoch": 0.4166666666666667, "grad_norm": 1.0078125, "learning_rate": 0.0004988574526542899, "loss": 5.6219, "mean_token_accuracy": 0.17570846527814865, "num_tokens": 9633922.0, "step": 4215 }, { "entropy": 5.805471134185791, "epoch": 0.41716093317516806, "grad_norm": 0.9296875, "learning_rate": 0.0004988538980047963, "loss": 5.7156, "mean_token_accuracy": 0.16862473040819168, "num_tokens": 9645641.0, "step": 4220 }, { "entropy": 5.798167276382446, "epoch": 0.41765519968366943, "grad_norm": 0.90625, "learning_rate": 0.0004988503378484622, "loss": 5.6197, "mean_token_accuracy": 0.17783726751804352, "num_tokens": 9656927.0, "step": 4225 }, { "entropy": 5.782315301895141, "epoch": 0.4181494661921708, "grad_norm": 0.91015625, "learning_rate": 0.000498846772185375, "loss": 5.5972, "mean_token_accuracy": 0.1739899545907974, "num_tokens": 9669148.0, "step": 4230 }, { "entropy": 5.873674964904785, "epoch": 0.4186437327006722, "grad_norm": 0.86328125, "learning_rate": 0.0004988432010156224, "loss": 5.7182, "mean_token_accuracy": 0.15645526051521302, "num_tokens": 9680620.0, "step": 4235 }, { "entropy": 5.904275035858154, "epoch": 0.4191379992091736, "grad_norm": 1.0, "learning_rate": 0.0004988396243392924, "loss": 5.6577, "mean_token_accuracy": 0.17048730999231337, "num_tokens": 9690984.0, "step": 4240 }, { "entropy": 5.82047929763794, "epoch": 0.419632265717675, "grad_norm": 0.89453125, "learning_rate": 0.000498836042156473, "loss": 5.6449, "mean_token_accuracy": 0.1739232435822487, "num_tokens": 9701561.0, "step": 4245 }, { "entropy": 5.845308494567871, "epoch": 0.42012653222617635, "grad_norm": 0.92578125, "learning_rate": 0.0004988324544672521, "loss": 5.6364, "mean_token_accuracy": 0.164578577876091, "num_tokens": 9712780.0, "step": 4250 }, { "entropy": 5.84295802116394, "epoch": 0.4206207987346777, "grad_norm": 0.984375, "learning_rate": 0.0004988288612717182, "loss": 5.6163, "mean_token_accuracy": 0.16297079473733903, "num_tokens": 9724547.0, "step": 4255 }, { "entropy": 5.789079236984253, "epoch": 0.4211150652431791, "grad_norm": 0.890625, "learning_rate": 0.0004988252625699594, "loss": 5.6587, "mean_token_accuracy": 0.1656541645526886, "num_tokens": 9736897.0, "step": 4260 }, { "entropy": 5.837785387039185, "epoch": 0.4216093317516805, "grad_norm": 0.89453125, "learning_rate": 0.0004988216583620647, "loss": 5.6353, "mean_token_accuracy": 0.16636367738246918, "num_tokens": 9748214.0, "step": 4265 }, { "entropy": 5.851439428329468, "epoch": 0.4221035982601819, "grad_norm": 0.94921875, "learning_rate": 0.0004988180486481223, "loss": 5.6509, "mean_token_accuracy": 0.16895006150007247, "num_tokens": 9759602.0, "step": 4270 }, { "entropy": 5.785959911346436, "epoch": 0.4225978647686833, "grad_norm": 0.984375, "learning_rate": 0.0004988144334282211, "loss": 5.6162, "mean_token_accuracy": 0.17231889218091964, "num_tokens": 9771645.0, "step": 4275 }, { "entropy": 5.825134229660034, "epoch": 0.42309213127718465, "grad_norm": 0.91015625, "learning_rate": 0.0004988108127024503, "loss": 5.6243, "mean_token_accuracy": 0.169831582903862, "num_tokens": 9783504.0, "step": 4280 }, { "entropy": 5.91628794670105, "epoch": 0.423586397785686, "grad_norm": 0.89453125, "learning_rate": 0.0004988071864708987, "loss": 5.7283, "mean_token_accuracy": 0.16804496794939042, "num_tokens": 9795572.0, "step": 4285 }, { "entropy": 5.795221900939941, "epoch": 0.42408066429418745, "grad_norm": 0.91015625, "learning_rate": 0.0004988035547336555, "loss": 5.614, "mean_token_accuracy": 0.16636184900999068, "num_tokens": 9806398.0, "step": 4290 }, { "entropy": 5.7780492305755615, "epoch": 0.4245749308026888, "grad_norm": 0.93359375, "learning_rate": 0.0004987999174908104, "loss": 5.5968, "mean_token_accuracy": 0.1680014193058014, "num_tokens": 9817171.0, "step": 4295 }, { "entropy": 5.89081392288208, "epoch": 0.4250691973111902, "grad_norm": 1.09375, "learning_rate": 0.0004987962747424524, "loss": 5.6383, "mean_token_accuracy": 0.16744885146617888, "num_tokens": 9827535.0, "step": 4300 }, { "entropy": 5.79629282951355, "epoch": 0.42556346381969157, "grad_norm": 0.88671875, "learning_rate": 0.0004987926264886713, "loss": 5.6265, "mean_token_accuracy": 0.16741034239530564, "num_tokens": 9839619.0, "step": 4305 }, { "entropy": 5.8393786430358885, "epoch": 0.42605773032819294, "grad_norm": 0.98046875, "learning_rate": 0.000498788972729557, "loss": 5.6245, "mean_token_accuracy": 0.167700919508934, "num_tokens": 9850100.0, "step": 4310 }, { "entropy": 5.879159069061279, "epoch": 0.42655199683669437, "grad_norm": 0.98046875, "learning_rate": 0.0004987853134651992, "loss": 5.6962, "mean_token_accuracy": 0.15956805497407914, "num_tokens": 9862228.0, "step": 4315 }, { "entropy": 5.798806858062744, "epoch": 0.42704626334519574, "grad_norm": 0.95703125, "learning_rate": 0.000498781648695688, "loss": 5.5943, "mean_token_accuracy": 0.1753179609775543, "num_tokens": 9873080.0, "step": 4320 }, { "entropy": 5.769570159912109, "epoch": 0.4275405298536971, "grad_norm": 0.9140625, "learning_rate": 0.0004987779784211135, "loss": 5.5973, "mean_token_accuracy": 0.1696781262755394, "num_tokens": 9884735.0, "step": 4325 }, { "entropy": 5.8618381977081295, "epoch": 0.4280347963621985, "grad_norm": 0.9609375, "learning_rate": 0.000498774302641566, "loss": 5.6304, "mean_token_accuracy": 0.16847547739744187, "num_tokens": 9895018.0, "step": 4330 }, { "entropy": 5.83386926651001, "epoch": 0.42852906287069986, "grad_norm": 0.9296875, "learning_rate": 0.0004987706213571359, "loss": 5.5935, "mean_token_accuracy": 0.17204622328281402, "num_tokens": 9906838.0, "step": 4335 }, { "entropy": 5.849230670928955, "epoch": 0.4290233293792013, "grad_norm": 0.953125, "learning_rate": 0.0004987669345679139, "loss": 5.6438, "mean_token_accuracy": 0.1677512049674988, "num_tokens": 9919556.0, "step": 4340 }, { "entropy": 5.813247966766357, "epoch": 0.42951759588770266, "grad_norm": 1.0234375, "learning_rate": 0.0004987632422739904, "loss": 5.5403, "mean_token_accuracy": 0.16926646530628203, "num_tokens": 9929783.0, "step": 4345 }, { "entropy": 5.755382299423218, "epoch": 0.43001186239620404, "grad_norm": 0.8515625, "learning_rate": 0.0004987595444754567, "loss": 5.5962, "mean_token_accuracy": 0.17513736933469773, "num_tokens": 9940894.0, "step": 4350 }, { "entropy": 5.792961549758911, "epoch": 0.4305061289047054, "grad_norm": 0.96875, "learning_rate": 0.0004987558411724032, "loss": 5.5845, "mean_token_accuracy": 0.17746544480323792, "num_tokens": 9951973.0, "step": 4355 }, { "entropy": 5.82807035446167, "epoch": 0.4310003954132068, "grad_norm": 0.88671875, "learning_rate": 0.0004987521323649215, "loss": 5.6372, "mean_token_accuracy": 0.16464631557464598, "num_tokens": 9963304.0, "step": 4360 }, { "entropy": 5.84600567817688, "epoch": 0.4314946619217082, "grad_norm": 0.97265625, "learning_rate": 0.0004987484180531026, "loss": 5.6464, "mean_token_accuracy": 0.1718866541981697, "num_tokens": 9973981.0, "step": 4365 }, { "entropy": 5.836547803878784, "epoch": 0.4319889284302096, "grad_norm": 0.91015625, "learning_rate": 0.0004987446982370379, "loss": 5.6862, "mean_token_accuracy": 0.1607399567961693, "num_tokens": 9986461.0, "step": 4370 }, { "entropy": 5.852586650848389, "epoch": 0.43248319493871096, "grad_norm": 0.90234375, "learning_rate": 0.000498740972916819, "loss": 5.6256, "mean_token_accuracy": 0.16716425120830536, "num_tokens": 9997973.0, "step": 4375 }, { "entropy": 5.804222917556762, "epoch": 0.43297746144721233, "grad_norm": 0.92578125, "learning_rate": 0.0004987372420925373, "loss": 5.6391, "mean_token_accuracy": 0.168254753947258, "num_tokens": 10009572.0, "step": 4380 }, { "entropy": 5.798716497421265, "epoch": 0.4334717279557137, "grad_norm": 1.03125, "learning_rate": 0.0004987335057642847, "loss": 5.5349, "mean_token_accuracy": 0.17944775074720382, "num_tokens": 10020437.0, "step": 4385 }, { "entropy": 5.762760734558105, "epoch": 0.43396599446421513, "grad_norm": 0.83203125, "learning_rate": 0.0004987297639321533, "loss": 5.6326, "mean_token_accuracy": 0.16913174390792846, "num_tokens": 10031827.0, "step": 4390 }, { "entropy": 5.749511480331421, "epoch": 0.4344602609727165, "grad_norm": 0.96484375, "learning_rate": 0.0004987260165962349, "loss": 5.6389, "mean_token_accuracy": 0.1687606692314148, "num_tokens": 10043833.0, "step": 4395 }, { "entropy": 5.855825424194336, "epoch": 0.4349545274812179, "grad_norm": 0.91015625, "learning_rate": 0.0004987222637566218, "loss": 5.5646, "mean_token_accuracy": 0.17352616637945176, "num_tokens": 10054645.0, "step": 4400 }, { "entropy": 5.750028944015503, "epoch": 0.43544879398971925, "grad_norm": 0.89453125, "learning_rate": 0.0004987185054134064, "loss": 5.5434, "mean_token_accuracy": 0.16734890192747115, "num_tokens": 10065178.0, "step": 4405 }, { "entropy": 5.770218849182129, "epoch": 0.4359430604982206, "grad_norm": 0.91796875, "learning_rate": 0.000498714741566681, "loss": 5.5613, "mean_token_accuracy": 0.17896326035261154, "num_tokens": 10076701.0, "step": 4410 }, { "entropy": 5.743519973754883, "epoch": 0.436437327006722, "grad_norm": 0.96875, "learning_rate": 0.0004987109722165383, "loss": 5.5729, "mean_token_accuracy": 0.1721585363149643, "num_tokens": 10087959.0, "step": 4415 }, { "entropy": 5.8488109588623045, "epoch": 0.4369315935152234, "grad_norm": 1.0078125, "learning_rate": 0.0004987071973630708, "loss": 5.5851, "mean_token_accuracy": 0.17124376744031905, "num_tokens": 10099463.0, "step": 4420 }, { "entropy": 5.760781335830688, "epoch": 0.4374258600237248, "grad_norm": 0.9609375, "learning_rate": 0.0004987034170063717, "loss": 5.6602, "mean_token_accuracy": 0.16942576915025712, "num_tokens": 10111384.0, "step": 4425 }, { "entropy": 5.75766339302063, "epoch": 0.4379201265322262, "grad_norm": 0.91015625, "learning_rate": 0.0004986996311465338, "loss": 5.5975, "mean_token_accuracy": 0.17252269387245178, "num_tokens": 10121838.0, "step": 4430 }, { "entropy": 5.812766599655151, "epoch": 0.43841439304072755, "grad_norm": 0.8671875, "learning_rate": 0.0004986958397836503, "loss": 5.5338, "mean_token_accuracy": 0.17768983393907548, "num_tokens": 10132225.0, "step": 4435 }, { "entropy": 5.775444412231446, "epoch": 0.4389086595492289, "grad_norm": 0.890625, "learning_rate": 0.0004986920429178144, "loss": 5.5311, "mean_token_accuracy": 0.16876962780952454, "num_tokens": 10143114.0, "step": 4440 }, { "entropy": 5.838538932800293, "epoch": 0.43940292605773035, "grad_norm": 0.86328125, "learning_rate": 0.0004986882405491195, "loss": 5.7326, "mean_token_accuracy": 0.15873998254537583, "num_tokens": 10155057.0, "step": 4445 }, { "entropy": 5.803744125366211, "epoch": 0.4398971925662317, "grad_norm": 0.85546875, "learning_rate": 0.0004986844326776593, "loss": 5.4938, "mean_token_accuracy": 0.18356605470180512, "num_tokens": 10166816.0, "step": 4450 }, { "entropy": 5.697732400894165, "epoch": 0.4403914590747331, "grad_norm": 0.83203125, "learning_rate": 0.0004986806193035272, "loss": 5.5533, "mean_token_accuracy": 0.18015453666448594, "num_tokens": 10179433.0, "step": 4455 }, { "entropy": 5.7718274116516115, "epoch": 0.44088572558323447, "grad_norm": 0.97265625, "learning_rate": 0.0004986768004268173, "loss": 5.5577, "mean_token_accuracy": 0.17817939668893815, "num_tokens": 10190784.0, "step": 4460 }, { "entropy": 5.833306169509887, "epoch": 0.44137999209173584, "grad_norm": 0.96484375, "learning_rate": 0.0004986729760476234, "loss": 5.6068, "mean_token_accuracy": 0.16729437410831452, "num_tokens": 10201941.0, "step": 4465 }, { "entropy": 5.779744625091553, "epoch": 0.44187425860023727, "grad_norm": 0.94921875, "learning_rate": 0.0004986691461660394, "loss": 5.5774, "mean_token_accuracy": 0.1768958881497383, "num_tokens": 10214029.0, "step": 4470 }, { "entropy": 5.769422149658203, "epoch": 0.44236852510873864, "grad_norm": 0.9375, "learning_rate": 0.0004986653107821599, "loss": 5.6064, "mean_token_accuracy": 0.17645433247089387, "num_tokens": 10225585.0, "step": 4475 }, { "entropy": 5.738273668289184, "epoch": 0.44286279161724, "grad_norm": 0.828125, "learning_rate": 0.0004986614698960789, "loss": 5.5621, "mean_token_accuracy": 0.17750981003046035, "num_tokens": 10237753.0, "step": 4480 }, { "entropy": 5.880168819427491, "epoch": 0.4433570581257414, "grad_norm": 0.92578125, "learning_rate": 0.0004986576235078913, "loss": 5.8086, "mean_token_accuracy": 0.15935082882642745, "num_tokens": 10251522.0, "step": 4485 }, { "entropy": 5.877189826965332, "epoch": 0.44385132463424276, "grad_norm": 0.98046875, "learning_rate": 0.0004986537716176912, "loss": 5.5092, "mean_token_accuracy": 0.1777046427130699, "num_tokens": 10263319.0, "step": 4490 }, { "entropy": 5.6753072261810305, "epoch": 0.4443455911427442, "grad_norm": 0.9296875, "learning_rate": 0.0004986499142255738, "loss": 5.5517, "mean_token_accuracy": 0.175779727101326, "num_tokens": 10274899.0, "step": 4495 }, { "entropy": 5.81341667175293, "epoch": 0.44483985765124556, "grad_norm": 1.09375, "learning_rate": 0.0004986460513316338, "loss": 5.5413, "mean_token_accuracy": 0.1794048771262169, "num_tokens": 10286110.0, "step": 4500 }, { "entropy": 5.802513265609742, "epoch": 0.44533412415974694, "grad_norm": 0.91015625, "learning_rate": 0.0004986421829359662, "loss": 5.6772, "mean_token_accuracy": 0.16680212020874025, "num_tokens": 10298870.0, "step": 4505 }, { "entropy": 5.79839448928833, "epoch": 0.4458283906682483, "grad_norm": 0.984375, "learning_rate": 0.0004986383090386661, "loss": 5.5995, "mean_token_accuracy": 0.1699310764670372, "num_tokens": 10310326.0, "step": 4510 }, { "entropy": 5.824851703643799, "epoch": 0.4463226571767497, "grad_norm": 0.953125, "learning_rate": 0.000498634429639829, "loss": 5.5243, "mean_token_accuracy": 0.1676243871450424, "num_tokens": 10320899.0, "step": 4515 }, { "entropy": 5.7993933200836185, "epoch": 0.4468169236852511, "grad_norm": 1.015625, "learning_rate": 0.0004986305447395502, "loss": 5.5911, "mean_token_accuracy": 0.17880626618862153, "num_tokens": 10331669.0, "step": 4520 }, { "entropy": 5.8021961688995365, "epoch": 0.4473111901937525, "grad_norm": 0.984375, "learning_rate": 0.0004986266543379254, "loss": 5.5701, "mean_token_accuracy": 0.1705687791109085, "num_tokens": 10343120.0, "step": 4525 }, { "entropy": 5.76211404800415, "epoch": 0.44780545670225386, "grad_norm": 0.91796875, "learning_rate": 0.0004986227584350501, "loss": 5.567, "mean_token_accuracy": 0.17529425472021104, "num_tokens": 10354806.0, "step": 4530 }, { "entropy": 5.826001596450806, "epoch": 0.44829972321075523, "grad_norm": 0.87890625, "learning_rate": 0.0004986188570310203, "loss": 5.5753, "mean_token_accuracy": 0.17302500158548356, "num_tokens": 10366453.0, "step": 4535 }, { "entropy": 5.806806755065918, "epoch": 0.4487939897192566, "grad_norm": 0.89453125, "learning_rate": 0.0004986149501259319, "loss": 5.6841, "mean_token_accuracy": 0.16710566282272338, "num_tokens": 10378095.0, "step": 4540 }, { "entropy": 5.725814342498779, "epoch": 0.44928825622775803, "grad_norm": 0.8984375, "learning_rate": 0.0004986110377198812, "loss": 5.551, "mean_token_accuracy": 0.17860638797283174, "num_tokens": 10389620.0, "step": 4545 }, { "entropy": 5.855662441253662, "epoch": 0.4497825227362594, "grad_norm": 0.99609375, "learning_rate": 0.000498607119812964, "loss": 5.6758, "mean_token_accuracy": 0.16436416655778885, "num_tokens": 10400166.0, "step": 4550 }, { "entropy": 5.8126898288726805, "epoch": 0.4502767892447608, "grad_norm": 1.03125, "learning_rate": 0.0004986031964052772, "loss": 5.575, "mean_token_accuracy": 0.1732827827334404, "num_tokens": 10411116.0, "step": 4555 }, { "entropy": 5.751502990722656, "epoch": 0.45077105575326215, "grad_norm": 0.93359375, "learning_rate": 0.0004985992674969169, "loss": 5.6151, "mean_token_accuracy": 0.16553460508584977, "num_tokens": 10423484.0, "step": 4560 }, { "entropy": 5.8134688377380375, "epoch": 0.4512653222617635, "grad_norm": 0.93359375, "learning_rate": 0.0004985953330879801, "loss": 5.6634, "mean_token_accuracy": 0.16407879441976547, "num_tokens": 10435636.0, "step": 4565 }, { "entropy": 5.848629188537598, "epoch": 0.45175958877026495, "grad_norm": 0.8984375, "learning_rate": 0.0004985913931785633, "loss": 5.5898, "mean_token_accuracy": 0.17904918193817138, "num_tokens": 10447586.0, "step": 4570 }, { "entropy": 5.735504198074341, "epoch": 0.4522538552787663, "grad_norm": 0.9375, "learning_rate": 0.0004985874477687636, "loss": 5.6399, "mean_token_accuracy": 0.16957639157772064, "num_tokens": 10460678.0, "step": 4575 }, { "entropy": 5.786015892028809, "epoch": 0.4527481217872677, "grad_norm": 0.9609375, "learning_rate": 0.0004985834968586779, "loss": 5.6063, "mean_token_accuracy": 0.17197471410036086, "num_tokens": 10472738.0, "step": 4580 }, { "entropy": 5.855681848526001, "epoch": 0.45324238829576907, "grad_norm": 0.890625, "learning_rate": 0.0004985795404484037, "loss": 5.4992, "mean_token_accuracy": 0.17736317962408066, "num_tokens": 10483716.0, "step": 4585 }, { "entropy": 5.82010703086853, "epoch": 0.45373665480427045, "grad_norm": 1.0859375, "learning_rate": 0.0004985755785380379, "loss": 5.6231, "mean_token_accuracy": 0.16516028642654418, "num_tokens": 10495287.0, "step": 4590 }, { "entropy": 5.766982316970825, "epoch": 0.4542309213127719, "grad_norm": 0.94921875, "learning_rate": 0.0004985716111276781, "loss": 5.5827, "mean_token_accuracy": 0.17489160150289534, "num_tokens": 10506332.0, "step": 4595 }, { "entropy": 5.80476565361023, "epoch": 0.45472518782127325, "grad_norm": 0.890625, "learning_rate": 0.0004985676382174223, "loss": 5.6195, "mean_token_accuracy": 0.16489279568195342, "num_tokens": 10517574.0, "step": 4600 }, { "entropy": 5.798285865783692, "epoch": 0.4552194543297746, "grad_norm": 0.921875, "learning_rate": 0.0004985636598073677, "loss": 5.5475, "mean_token_accuracy": 0.18024421185255052, "num_tokens": 10528998.0, "step": 4605 }, { "entropy": 5.785056924819946, "epoch": 0.455713720838276, "grad_norm": 0.86328125, "learning_rate": 0.0004985596758976125, "loss": 5.5985, "mean_token_accuracy": 0.16289158165454865, "num_tokens": 10539669.0, "step": 4610 }, { "entropy": 5.7674473285675045, "epoch": 0.45620798734677737, "grad_norm": 0.96484375, "learning_rate": 0.0004985556864882545, "loss": 5.5881, "mean_token_accuracy": 0.16923738420009612, "num_tokens": 10550005.0, "step": 4615 }, { "entropy": 5.746691179275513, "epoch": 0.45670225385527874, "grad_norm": 0.96875, "learning_rate": 0.000498551691579392, "loss": 5.5553, "mean_token_accuracy": 0.17508771419525146, "num_tokens": 10561122.0, "step": 4620 }, { "entropy": 5.822011709213257, "epoch": 0.45719652036378017, "grad_norm": 0.9765625, "learning_rate": 0.0004985476911711232, "loss": 5.5333, "mean_token_accuracy": 0.16915591657161713, "num_tokens": 10572081.0, "step": 4625 }, { "entropy": 5.67712173461914, "epoch": 0.45769078687228154, "grad_norm": 1.078125, "learning_rate": 0.0004985436852635465, "loss": 5.5167, "mean_token_accuracy": 0.18299848288297654, "num_tokens": 10582297.0, "step": 4630 }, { "entropy": 5.828481674194336, "epoch": 0.4581850533807829, "grad_norm": 0.97265625, "learning_rate": 0.0004985396738567604, "loss": 5.6211, "mean_token_accuracy": 0.16615634113550187, "num_tokens": 10593161.0, "step": 4635 }, { "entropy": 5.805247020721436, "epoch": 0.4586793198892843, "grad_norm": 0.91796875, "learning_rate": 0.0004985356569508638, "loss": 5.6293, "mean_token_accuracy": 0.1766362875699997, "num_tokens": 10603900.0, "step": 4640 }, { "entropy": 5.786256933212281, "epoch": 0.45917358639778566, "grad_norm": 0.8671875, "learning_rate": 0.0004985316345459551, "loss": 5.6221, "mean_token_accuracy": 0.1706064835190773, "num_tokens": 10614946.0, "step": 4645 }, { "entropy": 5.797493410110474, "epoch": 0.4596678529062871, "grad_norm": 0.97265625, "learning_rate": 0.0004985276066421338, "loss": 5.6066, "mean_token_accuracy": 0.16715189963579177, "num_tokens": 10625073.0, "step": 4650 }, { "entropy": 5.806329202651978, "epoch": 0.46016211941478846, "grad_norm": 0.9453125, "learning_rate": 0.0004985235732394986, "loss": 5.7086, "mean_token_accuracy": 0.16426503509283066, "num_tokens": 10636942.0, "step": 4655 }, { "entropy": 5.881540679931641, "epoch": 0.46065638592328984, "grad_norm": 1.0234375, "learning_rate": 0.0004985195343381487, "loss": 5.6471, "mean_token_accuracy": 0.16620967388153077, "num_tokens": 10647608.0, "step": 4660 }, { "entropy": 5.8583235263824465, "epoch": 0.4611506524317912, "grad_norm": 0.890625, "learning_rate": 0.0004985154899381837, "loss": 5.6973, "mean_token_accuracy": 0.1636795088648796, "num_tokens": 10659532.0, "step": 4665 }, { "entropy": 5.814082479476928, "epoch": 0.4616449189402926, "grad_norm": 0.8984375, "learning_rate": 0.0004985114400397029, "loss": 5.5976, "mean_token_accuracy": 0.1713384672999382, "num_tokens": 10670342.0, "step": 4670 }, { "entropy": 5.801158285140991, "epoch": 0.462139185448794, "grad_norm": 0.9453125, "learning_rate": 0.0004985073846428061, "loss": 5.651, "mean_token_accuracy": 0.17341475635766984, "num_tokens": 10682984.0, "step": 4675 }, { "entropy": 5.829035711288452, "epoch": 0.4626334519572954, "grad_norm": 0.87890625, "learning_rate": 0.0004985033237475929, "loss": 5.6425, "mean_token_accuracy": 0.16749223917722703, "num_tokens": 10694235.0, "step": 4680 }, { "entropy": 5.849024724960327, "epoch": 0.46312771846579676, "grad_norm": 0.9765625, "learning_rate": 0.0004984992573541633, "loss": 5.6558, "mean_token_accuracy": 0.1688708171248436, "num_tokens": 10704508.0, "step": 4685 }, { "entropy": 5.684304428100586, "epoch": 0.46362198497429813, "grad_norm": 0.8671875, "learning_rate": 0.0004984951854626173, "loss": 5.515, "mean_token_accuracy": 0.17683757543563844, "num_tokens": 10716927.0, "step": 4690 }, { "entropy": 5.755561256408692, "epoch": 0.4641162514827995, "grad_norm": 0.921875, "learning_rate": 0.0004984911080730551, "loss": 5.5659, "mean_token_accuracy": 0.1765031933784485, "num_tokens": 10728396.0, "step": 4695 }, { "entropy": 5.793044185638427, "epoch": 0.46461051799130093, "grad_norm": 0.8671875, "learning_rate": 0.0004984870251855769, "loss": 5.6344, "mean_token_accuracy": 0.17585518658161164, "num_tokens": 10739001.0, "step": 4700 }, { "entropy": 5.822147560119629, "epoch": 0.4651047844998023, "grad_norm": 1.015625, "learning_rate": 0.0004984829368002831, "loss": 5.5719, "mean_token_accuracy": 0.17421551048755646, "num_tokens": 10748768.0, "step": 4705 }, { "entropy": 5.812329339981079, "epoch": 0.4655990510083037, "grad_norm": 0.953125, "learning_rate": 0.0004984788429172745, "loss": 5.6229, "mean_token_accuracy": 0.16885091215372086, "num_tokens": 10760582.0, "step": 4710 }, { "entropy": 5.748940563201904, "epoch": 0.46609331751680505, "grad_norm": 0.890625, "learning_rate": 0.0004984747435366517, "loss": 5.5467, "mean_token_accuracy": 0.17982581704854966, "num_tokens": 10772537.0, "step": 4715 }, { "entropy": 5.796843767166138, "epoch": 0.4665875840253064, "grad_norm": 0.91015625, "learning_rate": 0.0004984706386585156, "loss": 5.4722, "mean_token_accuracy": 0.184302619099617, "num_tokens": 10783740.0, "step": 4720 }, { "entropy": 5.767619609832764, "epoch": 0.46708185053380785, "grad_norm": 0.890625, "learning_rate": 0.000498466528282967, "loss": 5.6193, "mean_token_accuracy": 0.1671496883034706, "num_tokens": 10794793.0, "step": 4725 }, { "entropy": 5.813214540481567, "epoch": 0.4675761170423092, "grad_norm": 0.88671875, "learning_rate": 0.0004984624124101072, "loss": 5.5918, "mean_token_accuracy": 0.1738986387848854, "num_tokens": 10805944.0, "step": 4730 }, { "entropy": 5.7991029739379885, "epoch": 0.4680703835508106, "grad_norm": 0.9609375, "learning_rate": 0.0004984582910400374, "loss": 5.6175, "mean_token_accuracy": 0.16903503686189653, "num_tokens": 10818362.0, "step": 4735 }, { "entropy": 5.775002574920654, "epoch": 0.46856465005931197, "grad_norm": 0.83203125, "learning_rate": 0.000498454164172859, "loss": 5.6019, "mean_token_accuracy": 0.17489873319864274, "num_tokens": 10831306.0, "step": 4740 }, { "entropy": 5.747839021682739, "epoch": 0.46905891656781334, "grad_norm": 0.9453125, "learning_rate": 0.0004984500318086733, "loss": 5.5579, "mean_token_accuracy": 0.17373376339673996, "num_tokens": 10841671.0, "step": 4745 }, { "entropy": 5.775403070449829, "epoch": 0.4695531830763148, "grad_norm": 0.9609375, "learning_rate": 0.0004984458939475824, "loss": 5.5271, "mean_token_accuracy": 0.17672319412231446, "num_tokens": 10852754.0, "step": 4750 }, { "entropy": 5.763035869598388, "epoch": 0.47004744958481615, "grad_norm": 0.91796875, "learning_rate": 0.0004984417505896877, "loss": 5.6006, "mean_token_accuracy": 0.17407994866371154, "num_tokens": 10864812.0, "step": 4755 }, { "entropy": 5.748392820358276, "epoch": 0.4705417160933175, "grad_norm": 0.91796875, "learning_rate": 0.0004984376017350913, "loss": 5.5956, "mean_token_accuracy": 0.17553993463516235, "num_tokens": 10875967.0, "step": 4760 }, { "entropy": 5.800142478942871, "epoch": 0.4710359826018189, "grad_norm": 0.86328125, "learning_rate": 0.0004984334473838953, "loss": 5.5684, "mean_token_accuracy": 0.17856498956680297, "num_tokens": 10889575.0, "step": 4765 }, { "entropy": 5.801490068435669, "epoch": 0.47153024911032027, "grad_norm": 0.9921875, "learning_rate": 0.0004984292875362018, "loss": 5.6609, "mean_token_accuracy": 0.17242039293050765, "num_tokens": 10900751.0, "step": 4770 }, { "entropy": 5.815169095993042, "epoch": 0.4720245156188217, "grad_norm": 0.8515625, "learning_rate": 0.0004984251221921131, "loss": 5.5933, "mean_token_accuracy": 0.17182137668132783, "num_tokens": 10912618.0, "step": 4775 }, { "entropy": 5.765395832061768, "epoch": 0.47251878212732307, "grad_norm": 0.96875, "learning_rate": 0.0004984209513517317, "loss": 5.5726, "mean_token_accuracy": 0.16780867278575898, "num_tokens": 10925286.0, "step": 4780 }, { "entropy": 5.790459060668946, "epoch": 0.47301304863582444, "grad_norm": 0.9140625, "learning_rate": 0.0004984167750151603, "loss": 5.5635, "mean_token_accuracy": 0.1712586909532547, "num_tokens": 10936033.0, "step": 4785 }, { "entropy": 5.791507434844971, "epoch": 0.4735073151443258, "grad_norm": 0.9765625, "learning_rate": 0.0004984125931825018, "loss": 5.5205, "mean_token_accuracy": 0.1807280510663986, "num_tokens": 10947055.0, "step": 4790 }, { "entropy": 5.782448720932007, "epoch": 0.4740015816528272, "grad_norm": 0.9921875, "learning_rate": 0.0004984084058538585, "loss": 5.5571, "mean_token_accuracy": 0.17012739777565003, "num_tokens": 10957468.0, "step": 4795 }, { "entropy": 5.836568164825439, "epoch": 0.4744958481613286, "grad_norm": 0.87109375, "learning_rate": 0.0004984042130293339, "loss": 5.6737, "mean_token_accuracy": 0.17129721343517304, "num_tokens": 10970273.0, "step": 4800 }, { "entropy": 5.834731483459473, "epoch": 0.47499011466983, "grad_norm": 0.90234375, "learning_rate": 0.0004984000147090311, "loss": 5.6496, "mean_token_accuracy": 0.16444314122200013, "num_tokens": 10981842.0, "step": 4805 }, { "entropy": 5.792039012908935, "epoch": 0.47548438117833136, "grad_norm": 0.953125, "learning_rate": 0.0004983958108930531, "loss": 5.5503, "mean_token_accuracy": 0.17451237738132477, "num_tokens": 10993615.0, "step": 4810 }, { "entropy": 5.800250148773193, "epoch": 0.47597864768683273, "grad_norm": 0.90625, "learning_rate": 0.0004983916015815036, "loss": 5.6462, "mean_token_accuracy": 0.16847752779722214, "num_tokens": 11004451.0, "step": 4815 }, { "entropy": 5.821297836303711, "epoch": 0.4764729141953341, "grad_norm": 0.93359375, "learning_rate": 0.000498387386774486, "loss": 5.5796, "mean_token_accuracy": 0.16798583269119263, "num_tokens": 11014834.0, "step": 4820 }, { "entropy": 5.740399646759033, "epoch": 0.4769671807038355, "grad_norm": 0.8828125, "learning_rate": 0.000498383166472104, "loss": 5.5345, "mean_token_accuracy": 0.1752157300710678, "num_tokens": 11026116.0, "step": 4825 }, { "entropy": 5.759796762466431, "epoch": 0.4774614472123369, "grad_norm": 0.984375, "learning_rate": 0.0004983789406744615, "loss": 5.5873, "mean_token_accuracy": 0.17430816143751143, "num_tokens": 11038780.0, "step": 4830 }, { "entropy": 5.836951875686646, "epoch": 0.4779557137208383, "grad_norm": 0.97265625, "learning_rate": 0.0004983747093816625, "loss": 5.6368, "mean_token_accuracy": 0.1705421045422554, "num_tokens": 11049824.0, "step": 4835 }, { "entropy": 5.744075107574463, "epoch": 0.47844998022933966, "grad_norm": 0.9453125, "learning_rate": 0.0004983704725938108, "loss": 5.5251, "mean_token_accuracy": 0.1815265029668808, "num_tokens": 11060863.0, "step": 4840 }, { "entropy": 5.706745386123657, "epoch": 0.47894424673784103, "grad_norm": 0.89453125, "learning_rate": 0.000498366230311011, "loss": 5.5334, "mean_token_accuracy": 0.18185854852199554, "num_tokens": 11072533.0, "step": 4845 }, { "entropy": 5.709492349624634, "epoch": 0.4794385132463424, "grad_norm": 0.95703125, "learning_rate": 0.0004983619825333671, "loss": 5.4676, "mean_token_accuracy": 0.17829244434833527, "num_tokens": 11083627.0, "step": 4850 }, { "entropy": 5.8475635051727295, "epoch": 0.47993277975484383, "grad_norm": 0.91015625, "learning_rate": 0.0004983577292609839, "loss": 5.6838, "mean_token_accuracy": 0.16682228595018386, "num_tokens": 11096421.0, "step": 4855 }, { "entropy": 5.724064445495605, "epoch": 0.4804270462633452, "grad_norm": 0.91015625, "learning_rate": 0.0004983534704939659, "loss": 5.5183, "mean_token_accuracy": 0.17276229560375214, "num_tokens": 11109053.0, "step": 4860 }, { "entropy": 5.740616321563721, "epoch": 0.4809213127718466, "grad_norm": 0.91015625, "learning_rate": 0.0004983492062324179, "loss": 5.4697, "mean_token_accuracy": 0.18121342360973358, "num_tokens": 11120431.0, "step": 4865 }, { "entropy": 5.73033595085144, "epoch": 0.48141557928034795, "grad_norm": 0.93359375, "learning_rate": 0.0004983449364764447, "loss": 5.5552, "mean_token_accuracy": 0.17504266351461412, "num_tokens": 11132767.0, "step": 4870 }, { "entropy": 5.683867883682251, "epoch": 0.4819098457888493, "grad_norm": 0.9609375, "learning_rate": 0.0004983406612261514, "loss": 5.5654, "mean_token_accuracy": 0.1710158482193947, "num_tokens": 11144508.0, "step": 4875 }, { "entropy": 5.733334159851074, "epoch": 0.48240411229735075, "grad_norm": 0.85546875, "learning_rate": 0.0004983363804816433, "loss": 5.5374, "mean_token_accuracy": 0.1752150237560272, "num_tokens": 11156905.0, "step": 4880 }, { "entropy": 5.777516317367554, "epoch": 0.4828983788058521, "grad_norm": 0.82421875, "learning_rate": 0.0004983320942430256, "loss": 5.5327, "mean_token_accuracy": 0.18036883771419526, "num_tokens": 11169383.0, "step": 4885 }, { "entropy": 5.7183574676513675, "epoch": 0.4833926453143535, "grad_norm": 0.9453125, "learning_rate": 0.0004983278025104036, "loss": 5.4744, "mean_token_accuracy": 0.18611738979816436, "num_tokens": 11179795.0, "step": 4890 }, { "entropy": 5.7164146423339846, "epoch": 0.48388691182285487, "grad_norm": 0.9140625, "learning_rate": 0.000498323505283883, "loss": 5.601, "mean_token_accuracy": 0.16721090525388718, "num_tokens": 11190783.0, "step": 4895 }, { "entropy": 5.816009187698365, "epoch": 0.48438117833135624, "grad_norm": 0.859375, "learning_rate": 0.0004983192025635698, "loss": 5.5541, "mean_token_accuracy": 0.17341194897890091, "num_tokens": 11203000.0, "step": 4900 }, { "entropy": 5.78576397895813, "epoch": 0.48487544483985767, "grad_norm": 0.9765625, "learning_rate": 0.0004983148943495693, "loss": 5.5608, "mean_token_accuracy": 0.17299710512161254, "num_tokens": 11213721.0, "step": 4905 }, { "entropy": 5.813729953765869, "epoch": 0.48536971134835905, "grad_norm": 0.953125, "learning_rate": 0.0004983105806419878, "loss": 5.6479, "mean_token_accuracy": 0.16635609567165374, "num_tokens": 11224490.0, "step": 4910 }, { "entropy": 5.748479127883911, "epoch": 0.4858639778568604, "grad_norm": 0.89453125, "learning_rate": 0.0004983062614409314, "loss": 5.523, "mean_token_accuracy": 0.17664245069026946, "num_tokens": 11235022.0, "step": 4915 }, { "entropy": 5.759830570220947, "epoch": 0.4863582443653618, "grad_norm": 0.875, "learning_rate": 0.0004983019367465064, "loss": 5.5633, "mean_token_accuracy": 0.17104150652885436, "num_tokens": 11247485.0, "step": 4920 }, { "entropy": 5.735758590698242, "epoch": 0.48685251087386316, "grad_norm": 1.0, "learning_rate": 0.000498297606558819, "loss": 5.4991, "mean_token_accuracy": 0.17710009217262268, "num_tokens": 11258488.0, "step": 4925 }, { "entropy": 5.715410327911377, "epoch": 0.4873467773823646, "grad_norm": 0.8359375, "learning_rate": 0.0004982932708779759, "loss": 5.5616, "mean_token_accuracy": 0.17926789522171022, "num_tokens": 11270786.0, "step": 4930 }, { "entropy": 5.856763744354248, "epoch": 0.48784104389086597, "grad_norm": 1.0078125, "learning_rate": 0.0004982889297040836, "loss": 5.5495, "mean_token_accuracy": 0.17286602407693863, "num_tokens": 11282434.0, "step": 4935 }, { "entropy": 5.778431510925293, "epoch": 0.48833531039936734, "grad_norm": 0.93359375, "learning_rate": 0.0004982845830372491, "loss": 5.5445, "mean_token_accuracy": 0.17494019716978074, "num_tokens": 11292406.0, "step": 4940 }, { "entropy": 5.812357473373413, "epoch": 0.4888295769078687, "grad_norm": 0.8984375, "learning_rate": 0.0004982802308775791, "loss": 5.6706, "mean_token_accuracy": 0.1673136219382286, "num_tokens": 11304491.0, "step": 4945 }, { "entropy": 5.812690114974975, "epoch": 0.4893238434163701, "grad_norm": 0.94921875, "learning_rate": 0.000498275873225181, "loss": 5.5992, "mean_token_accuracy": 0.1712377279996872, "num_tokens": 11317038.0, "step": 4950 }, { "entropy": 5.766361474990845, "epoch": 0.4898181099248715, "grad_norm": 0.84765625, "learning_rate": 0.0004982715100801616, "loss": 5.6097, "mean_token_accuracy": 0.1718221738934517, "num_tokens": 11329354.0, "step": 4955 }, { "entropy": 5.769640207290649, "epoch": 0.4903123764333729, "grad_norm": 0.9140625, "learning_rate": 0.0004982671414426285, "loss": 5.5918, "mean_token_accuracy": 0.17121500074863433, "num_tokens": 11340508.0, "step": 4960 }, { "entropy": 5.742819452285767, "epoch": 0.49080664294187426, "grad_norm": 0.9296875, "learning_rate": 0.0004982627673126889, "loss": 5.5651, "mean_token_accuracy": 0.17897188365459443, "num_tokens": 11352608.0, "step": 4965 }, { "entropy": 5.759057998657227, "epoch": 0.49130090945037563, "grad_norm": 1.03125, "learning_rate": 0.0004982583876904508, "loss": 5.5509, "mean_token_accuracy": 0.17809207290410994, "num_tokens": 11364089.0, "step": 4970 }, { "entropy": 5.724636840820312, "epoch": 0.491795175958877, "grad_norm": 1.015625, "learning_rate": 0.0004982540025760217, "loss": 5.4837, "mean_token_accuracy": 0.18001779913902283, "num_tokens": 11375521.0, "step": 4975 }, { "entropy": 5.758326387405395, "epoch": 0.49228944246737844, "grad_norm": 0.8828125, "learning_rate": 0.0004982496119695094, "loss": 5.5994, "mean_token_accuracy": 0.17620421350002288, "num_tokens": 11387721.0, "step": 4980 }, { "entropy": 5.819911050796509, "epoch": 0.4927837089758798, "grad_norm": 1.09375, "learning_rate": 0.000498245215871022, "loss": 5.6302, "mean_token_accuracy": 0.1708175465464592, "num_tokens": 11398688.0, "step": 4985 }, { "entropy": 5.731351041793824, "epoch": 0.4932779754843812, "grad_norm": 0.89453125, "learning_rate": 0.0004982408142806678, "loss": 5.5348, "mean_token_accuracy": 0.17261301428079606, "num_tokens": 11410420.0, "step": 4990 }, { "entropy": 5.713348722457885, "epoch": 0.49377224199288255, "grad_norm": 0.94140625, "learning_rate": 0.0004982364071985549, "loss": 5.4938, "mean_token_accuracy": 0.1787872165441513, "num_tokens": 11420521.0, "step": 4995 }, { "entropy": 5.80490460395813, "epoch": 0.4942665085013839, "grad_norm": 0.90234375, "learning_rate": 0.0004982319946247917, "loss": 5.5955, "mean_token_accuracy": 0.17211194783449174, "num_tokens": 11432550.0, "step": 5000 }, { "entropy": 5.811410617828369, "epoch": 0.49476077500988536, "grad_norm": 0.8984375, "learning_rate": 0.0004982275765594869, "loss": 5.5464, "mean_token_accuracy": 0.16959177404642106, "num_tokens": 11444602.0, "step": 5005 }, { "entropy": 5.692656469345093, "epoch": 0.49525504151838673, "grad_norm": 0.921875, "learning_rate": 0.0004982231530027489, "loss": 5.4008, "mean_token_accuracy": 0.18483435362577438, "num_tokens": 11456187.0, "step": 5010 }, { "entropy": 5.69083342552185, "epoch": 0.4957493080268881, "grad_norm": 0.875, "learning_rate": 0.0004982187239546868, "loss": 5.6299, "mean_token_accuracy": 0.1736504316329956, "num_tokens": 11468615.0, "step": 5015 }, { "entropy": 5.791458940505981, "epoch": 0.4962435745353895, "grad_norm": 0.95703125, "learning_rate": 0.0004982142894154095, "loss": 5.5123, "mean_token_accuracy": 0.17660565823316574, "num_tokens": 11480865.0, "step": 5020 }, { "entropy": 5.820317363739013, "epoch": 0.49673784104389085, "grad_norm": 0.9375, "learning_rate": 0.000498209849385026, "loss": 5.5831, "mean_token_accuracy": 0.16825225949287415, "num_tokens": 11492590.0, "step": 5025 }, { "entropy": 5.782691240310669, "epoch": 0.4972321075523923, "grad_norm": 0.92578125, "learning_rate": 0.0004982054038636456, "loss": 5.5801, "mean_token_accuracy": 0.17896081656217575, "num_tokens": 11503481.0, "step": 5030 }, { "entropy": 5.726967763900757, "epoch": 0.49772637406089365, "grad_norm": 0.8359375, "learning_rate": 0.0004982009528513776, "loss": 5.5048, "mean_token_accuracy": 0.17399763762950898, "num_tokens": 11515083.0, "step": 5035 }, { "entropy": 5.742146158218384, "epoch": 0.498220640569395, "grad_norm": 0.87890625, "learning_rate": 0.0004981964963483316, "loss": 5.5836, "mean_token_accuracy": 0.1686308577656746, "num_tokens": 11527923.0, "step": 5040 }, { "entropy": 5.817108964920044, "epoch": 0.4987149070778964, "grad_norm": 0.98828125, "learning_rate": 0.0004981920343546171, "loss": 5.5982, "mean_token_accuracy": 0.17374463826417924, "num_tokens": 11539456.0, "step": 5045 }, { "entropy": 5.787043190002441, "epoch": 0.49920917358639777, "grad_norm": 1.0390625, "learning_rate": 0.000498187566870344, "loss": 5.5112, "mean_token_accuracy": 0.1803647518157959, "num_tokens": 11550809.0, "step": 5050 }, { "entropy": 5.795387125015258, "epoch": 0.49970344009489914, "grad_norm": 1.1171875, "learning_rate": 0.0004981830938956221, "loss": 5.621, "mean_token_accuracy": 0.16986198872327804, "num_tokens": 11562545.0, "step": 5055 }, { "entropy": 5.665501546859741, "epoch": 0.5001977066034006, "grad_norm": 0.89453125, "learning_rate": 0.0004981786154305615, "loss": 5.5348, "mean_token_accuracy": 0.17491158545017244, "num_tokens": 11574479.0, "step": 5060 }, { "entropy": 5.798169088363648, "epoch": 0.500691973111902, "grad_norm": 1.078125, "learning_rate": 0.0004981741314752722, "loss": 5.4732, "mean_token_accuracy": 0.183668851852417, "num_tokens": 11583942.0, "step": 5065 }, { "entropy": 5.782756185531616, "epoch": 0.5011862396204033, "grad_norm": 0.89453125, "learning_rate": 0.0004981696420298647, "loss": 5.5714, "mean_token_accuracy": 0.17901098132133483, "num_tokens": 11596745.0, "step": 5070 }, { "entropy": 5.64297308921814, "epoch": 0.5016805061289047, "grad_norm": 0.8515625, "learning_rate": 0.0004981651470944495, "loss": 5.4585, "mean_token_accuracy": 0.17872023582458496, "num_tokens": 11608950.0, "step": 5075 }, { "entropy": 5.6742462635040285, "epoch": 0.5021747726374061, "grad_norm": 0.890625, "learning_rate": 0.000498160646669137, "loss": 5.5997, "mean_token_accuracy": 0.17821132242679597, "num_tokens": 11619996.0, "step": 5080 }, { "entropy": 5.752926206588745, "epoch": 0.5026690391459074, "grad_norm": 0.84375, "learning_rate": 0.0004981561407540379, "loss": 5.4977, "mean_token_accuracy": 0.1816351369023323, "num_tokens": 11632167.0, "step": 5085 }, { "entropy": 5.7322532653808596, "epoch": 0.5031633056544088, "grad_norm": 0.87890625, "learning_rate": 0.0004981516293492632, "loss": 5.5096, "mean_token_accuracy": 0.17805802524089814, "num_tokens": 11643722.0, "step": 5090 }, { "entropy": 5.721838426589966, "epoch": 0.5036575721629103, "grad_norm": 0.91796875, "learning_rate": 0.0004981471124549237, "loss": 5.5067, "mean_token_accuracy": 0.18212070763111116, "num_tokens": 11654890.0, "step": 5095 }, { "entropy": 5.7484557151794435, "epoch": 0.5041518386714117, "grad_norm": 0.96484375, "learning_rate": 0.0004981425900711308, "loss": 5.5551, "mean_token_accuracy": 0.1708276554942131, "num_tokens": 11665485.0, "step": 5100 }, { "entropy": 5.746714305877686, "epoch": 0.504646105179913, "grad_norm": 0.890625, "learning_rate": 0.0004981380621979954, "loss": 5.4557, "mean_token_accuracy": 0.18241646140813828, "num_tokens": 11676145.0, "step": 5105 }, { "entropy": 5.741047382354736, "epoch": 0.5051403716884144, "grad_norm": 0.92578125, "learning_rate": 0.0004981335288356291, "loss": 5.4747, "mean_token_accuracy": 0.17345170229673385, "num_tokens": 11687777.0, "step": 5110 }, { "entropy": 5.759751319885254, "epoch": 0.5056346381969158, "grad_norm": 0.9140625, "learning_rate": 0.0004981289899841434, "loss": 5.515, "mean_token_accuracy": 0.17931952476501464, "num_tokens": 11699703.0, "step": 5115 }, { "entropy": 5.766869449615479, "epoch": 0.5061289047054172, "grad_norm": 0.91796875, "learning_rate": 0.0004981244456436499, "loss": 5.6213, "mean_token_accuracy": 0.16381915807723998, "num_tokens": 11711632.0, "step": 5120 }, { "entropy": 5.789178991317749, "epoch": 0.5066231712139185, "grad_norm": 0.80078125, "learning_rate": 0.0004981198958142604, "loss": 5.6179, "mean_token_accuracy": 0.1705014854669571, "num_tokens": 11723763.0, "step": 5125 }, { "entropy": 5.774120235443116, "epoch": 0.5071174377224199, "grad_norm": 0.8046875, "learning_rate": 0.0004981153404960869, "loss": 5.606, "mean_token_accuracy": 0.17166277170181274, "num_tokens": 11736061.0, "step": 5130 }, { "entropy": 5.7177783966064455, "epoch": 0.5076117042309213, "grad_norm": 0.87890625, "learning_rate": 0.0004981107796892414, "loss": 5.622, "mean_token_accuracy": 0.17304158657789231, "num_tokens": 11749342.0, "step": 5135 }, { "entropy": 5.812070417404175, "epoch": 0.5081059707394227, "grad_norm": 0.86328125, "learning_rate": 0.0004981062133938361, "loss": 5.533, "mean_token_accuracy": 0.17936889976263046, "num_tokens": 11760441.0, "step": 5140 }, { "entropy": 5.665965461730957, "epoch": 0.508600237247924, "grad_norm": 0.890625, "learning_rate": 0.0004981016416099834, "loss": 5.4591, "mean_token_accuracy": 0.1776302859187126, "num_tokens": 11772191.0, "step": 5145 }, { "entropy": 5.835014390945434, "epoch": 0.5090945037564255, "grad_norm": 0.84375, "learning_rate": 0.0004980970643377956, "loss": 5.7144, "mean_token_accuracy": 0.16444751471281052, "num_tokens": 11786347.0, "step": 5150 }, { "entropy": 5.776389646530151, "epoch": 0.5095887702649269, "grad_norm": 0.90625, "learning_rate": 0.0004980924815773855, "loss": 5.4601, "mean_token_accuracy": 0.18136969208717346, "num_tokens": 11797741.0, "step": 5155 }, { "entropy": 5.718069839477539, "epoch": 0.5100830367734283, "grad_norm": 0.921875, "learning_rate": 0.0004980878933288657, "loss": 5.592, "mean_token_accuracy": 0.16690482646226884, "num_tokens": 11809728.0, "step": 5160 }, { "entropy": 5.766116428375244, "epoch": 0.5105773032819296, "grad_norm": 0.875, "learning_rate": 0.000498083299592349, "loss": 5.5415, "mean_token_accuracy": 0.16736383810639383, "num_tokens": 11822000.0, "step": 5165 }, { "entropy": 5.773698043823242, "epoch": 0.511071569790431, "grad_norm": 0.97265625, "learning_rate": 0.0004980787003679486, "loss": 5.5308, "mean_token_accuracy": 0.17277226448059083, "num_tokens": 11834059.0, "step": 5170 }, { "entropy": 5.64655442237854, "epoch": 0.5115658362989324, "grad_norm": 0.9765625, "learning_rate": 0.0004980740956557776, "loss": 5.4187, "mean_token_accuracy": 0.18754173666238785, "num_tokens": 11844001.0, "step": 5175 }, { "entropy": 5.706812381744385, "epoch": 0.5120601028074337, "grad_norm": 0.81640625, "learning_rate": 0.0004980694854559493, "loss": 5.5904, "mean_token_accuracy": 0.17244863212108613, "num_tokens": 11855991.0, "step": 5180 }, { "entropy": 5.807267904281616, "epoch": 0.5125543693159351, "grad_norm": 0.88671875, "learning_rate": 0.000498064869768577, "loss": 5.5616, "mean_token_accuracy": 0.17793460488319396, "num_tokens": 11867975.0, "step": 5185 }, { "entropy": 5.72734842300415, "epoch": 0.5130486358244365, "grad_norm": 0.9140625, "learning_rate": 0.0004980602485937743, "loss": 5.5276, "mean_token_accuracy": 0.17741968035697936, "num_tokens": 11880034.0, "step": 5190 }, { "entropy": 5.781388664245606, "epoch": 0.5135429023329379, "grad_norm": 0.91796875, "learning_rate": 0.0004980556219316549, "loss": 5.6011, "mean_token_accuracy": 0.17232607454061508, "num_tokens": 11891490.0, "step": 5195 }, { "entropy": 5.764000272750854, "epoch": 0.5140371688414394, "grad_norm": 0.94921875, "learning_rate": 0.0004980509897823326, "loss": 5.4871, "mean_token_accuracy": 0.18337249904870986, "num_tokens": 11902988.0, "step": 5200 }, { "entropy": 5.77319073677063, "epoch": 0.5145314353499407, "grad_norm": 0.8828125, "learning_rate": 0.0004980463521459212, "loss": 5.5425, "mean_token_accuracy": 0.173840893805027, "num_tokens": 11915088.0, "step": 5205 }, { "entropy": 5.669466352462768, "epoch": 0.5150257018584421, "grad_norm": 0.9765625, "learning_rate": 0.0004980417090225351, "loss": 5.5502, "mean_token_accuracy": 0.17958554476499558, "num_tokens": 11926789.0, "step": 5210 }, { "entropy": 5.802579021453857, "epoch": 0.5155199683669435, "grad_norm": 0.83203125, "learning_rate": 0.0004980370604122883, "loss": 5.6096, "mean_token_accuracy": 0.17139959186315537, "num_tokens": 11938876.0, "step": 5215 }, { "entropy": 5.769579315185547, "epoch": 0.5160142348754448, "grad_norm": 0.96484375, "learning_rate": 0.0004980324063152952, "loss": 5.5744, "mean_token_accuracy": 0.17452987730503083, "num_tokens": 11950099.0, "step": 5220 }, { "entropy": 5.773812627792358, "epoch": 0.5165085013839462, "grad_norm": 0.91015625, "learning_rate": 0.0004980277467316704, "loss": 5.6128, "mean_token_accuracy": 0.16850703209638596, "num_tokens": 11962585.0, "step": 5225 }, { "entropy": 5.762359142303467, "epoch": 0.5170027678924476, "grad_norm": 0.984375, "learning_rate": 0.0004980230816615282, "loss": 5.5356, "mean_token_accuracy": 0.1789001703262329, "num_tokens": 11972579.0, "step": 5230 }, { "entropy": 5.732519721984863, "epoch": 0.517497034400949, "grad_norm": 0.9609375, "learning_rate": 0.0004980184111049837, "loss": 5.4708, "mean_token_accuracy": 0.18551343828439712, "num_tokens": 11983337.0, "step": 5235 }, { "entropy": 5.737686634063721, "epoch": 0.5179913009094503, "grad_norm": 0.86328125, "learning_rate": 0.0004980137350621518, "loss": 5.5857, "mean_token_accuracy": 0.17297466844320297, "num_tokens": 11995086.0, "step": 5240 }, { "entropy": 5.774373626708984, "epoch": 0.5184855674179517, "grad_norm": 0.796875, "learning_rate": 0.0004980090535331473, "loss": 5.597, "mean_token_accuracy": 0.17898949831724167, "num_tokens": 12007814.0, "step": 5245 }, { "entropy": 5.6798008441925045, "epoch": 0.5189798339264532, "grad_norm": 0.79296875, "learning_rate": 0.0004980043665180857, "loss": 5.455, "mean_token_accuracy": 0.18679556250572205, "num_tokens": 12020714.0, "step": 5250 }, { "entropy": 5.716098117828369, "epoch": 0.5194741004349546, "grad_norm": 0.90625, "learning_rate": 0.0004979996740170819, "loss": 5.4558, "mean_token_accuracy": 0.17845480144023895, "num_tokens": 12031994.0, "step": 5255 }, { "entropy": 5.802161169052124, "epoch": 0.5199683669434559, "grad_norm": 0.84765625, "learning_rate": 0.0004979949760302515, "loss": 5.5024, "mean_token_accuracy": 0.1761628195643425, "num_tokens": 12042887.0, "step": 5260 }, { "entropy": 5.7668534278869625, "epoch": 0.5204626334519573, "grad_norm": 0.8671875, "learning_rate": 0.0004979902725577101, "loss": 5.5654, "mean_token_accuracy": 0.17906432300806047, "num_tokens": 12054426.0, "step": 5265 }, { "entropy": 5.751666736602783, "epoch": 0.5209568999604587, "grad_norm": 0.91796875, "learning_rate": 0.0004979855635995735, "loss": 5.557, "mean_token_accuracy": 0.17423335164785386, "num_tokens": 12066360.0, "step": 5270 }, { "entropy": 5.821256685256958, "epoch": 0.5214511664689601, "grad_norm": 0.90234375, "learning_rate": 0.0004979808491559573, "loss": 5.5937, "mean_token_accuracy": 0.16752250045537947, "num_tokens": 12076651.0, "step": 5275 }, { "entropy": 5.739269590377807, "epoch": 0.5219454329774614, "grad_norm": 0.90234375, "learning_rate": 0.0004979761292269778, "loss": 5.4844, "mean_token_accuracy": 0.17779142856597902, "num_tokens": 12087522.0, "step": 5280 }, { "entropy": 5.75598258972168, "epoch": 0.5224396994859628, "grad_norm": 0.91796875, "learning_rate": 0.0004979714038127508, "loss": 5.5303, "mean_token_accuracy": 0.17975754737854005, "num_tokens": 12097999.0, "step": 5285 }, { "entropy": 5.706361865997314, "epoch": 0.5229339659944642, "grad_norm": 1.03125, "learning_rate": 0.0004979666729133927, "loss": 5.4699, "mean_token_accuracy": 0.17258885353803635, "num_tokens": 12108080.0, "step": 5290 }, { "entropy": 5.8462605476379395, "epoch": 0.5234282325029656, "grad_norm": 0.8359375, "learning_rate": 0.0004979619365290199, "loss": 5.7151, "mean_token_accuracy": 0.1597973197698593, "num_tokens": 12122705.0, "step": 5295 }, { "entropy": 5.806183576583862, "epoch": 0.523922499011467, "grad_norm": 0.95703125, "learning_rate": 0.0004979571946597488, "loss": 5.5357, "mean_token_accuracy": 0.17758398056030272, "num_tokens": 12134000.0, "step": 5300 }, { "entropy": 5.680974435806275, "epoch": 0.5244167655199684, "grad_norm": 0.98046875, "learning_rate": 0.0004979524473056961, "loss": 5.5407, "mean_token_accuracy": 0.17283571660518646, "num_tokens": 12144825.0, "step": 5305 }, { "entropy": 5.816432809829712, "epoch": 0.5249110320284698, "grad_norm": 1.0234375, "learning_rate": 0.0004979476944669787, "loss": 5.631, "mean_token_accuracy": 0.17361755669116974, "num_tokens": 12156590.0, "step": 5310 }, { "entropy": 5.782773542404175, "epoch": 0.5254052985369712, "grad_norm": 0.94921875, "learning_rate": 0.0004979429361437134, "loss": 5.4513, "mean_token_accuracy": 0.18397860676050187, "num_tokens": 12167478.0, "step": 5315 }, { "entropy": 5.687792873382568, "epoch": 0.5258995650454725, "grad_norm": 0.88671875, "learning_rate": 0.0004979381723360173, "loss": 5.4731, "mean_token_accuracy": 0.17982307225465774, "num_tokens": 12178728.0, "step": 5320 }, { "entropy": 5.676830720901489, "epoch": 0.5263938315539739, "grad_norm": 0.921875, "learning_rate": 0.0004979334030440076, "loss": 5.4415, "mean_token_accuracy": 0.17359520643949508, "num_tokens": 12190061.0, "step": 5325 }, { "entropy": 5.720942544937134, "epoch": 0.5268880980624753, "grad_norm": 0.953125, "learning_rate": 0.0004979286282678015, "loss": 5.5568, "mean_token_accuracy": 0.175340935587883, "num_tokens": 12200867.0, "step": 5330 }, { "entropy": 5.7727423191070555, "epoch": 0.5273823645709766, "grad_norm": 0.78125, "learning_rate": 0.0004979238480075166, "loss": 5.5001, "mean_token_accuracy": 0.1753031298518181, "num_tokens": 12212681.0, "step": 5335 }, { "entropy": 5.671091604232788, "epoch": 0.527876631079478, "grad_norm": 0.953125, "learning_rate": 0.0004979190622632705, "loss": 5.5441, "mean_token_accuracy": 0.17394511252641678, "num_tokens": 12224279.0, "step": 5340 }, { "entropy": 5.64500093460083, "epoch": 0.5283708975879794, "grad_norm": 0.828125, "learning_rate": 0.0004979142710351809, "loss": 5.4032, "mean_token_accuracy": 0.19349775612354278, "num_tokens": 12235754.0, "step": 5345 }, { "entropy": 5.790648365020752, "epoch": 0.5288651640964809, "grad_norm": 0.94921875, "learning_rate": 0.0004979094743233656, "loss": 5.5535, "mean_token_accuracy": 0.17090488523244857, "num_tokens": 12246014.0, "step": 5350 }, { "entropy": 5.710861349105835, "epoch": 0.5293594306049823, "grad_norm": 0.97265625, "learning_rate": 0.0004979046721279426, "loss": 5.4871, "mean_token_accuracy": 0.17713912576436996, "num_tokens": 12257519.0, "step": 5355 }, { "entropy": 5.719026947021485, "epoch": 0.5298536971134836, "grad_norm": 0.83984375, "learning_rate": 0.0004978998644490302, "loss": 5.549, "mean_token_accuracy": 0.17404996156692504, "num_tokens": 12269806.0, "step": 5360 }, { "entropy": 5.724312019348145, "epoch": 0.530347963621985, "grad_norm": 0.8828125, "learning_rate": 0.0004978950512867465, "loss": 5.5428, "mean_token_accuracy": 0.17339142709970473, "num_tokens": 12281612.0, "step": 5365 }, { "entropy": 5.745225524902343, "epoch": 0.5308422301304864, "grad_norm": 1.0078125, "learning_rate": 0.0004978902326412099, "loss": 5.5212, "mean_token_accuracy": 0.17677129954099655, "num_tokens": 12293022.0, "step": 5370 }, { "entropy": 5.743794250488281, "epoch": 0.5313364966389877, "grad_norm": 0.92578125, "learning_rate": 0.000497885408512539, "loss": 5.5114, "mean_token_accuracy": 0.17500624507665635, "num_tokens": 12304414.0, "step": 5375 }, { "entropy": 5.843075942993164, "epoch": 0.5318307631474891, "grad_norm": 0.96484375, "learning_rate": 0.0004978805789008526, "loss": 5.6322, "mean_token_accuracy": 0.16461596935987471, "num_tokens": 12315618.0, "step": 5380 }, { "entropy": 5.732616376876831, "epoch": 0.5323250296559905, "grad_norm": 0.9296875, "learning_rate": 0.0004978757438062692, "loss": 5.4605, "mean_token_accuracy": 0.18622704446315766, "num_tokens": 12328026.0, "step": 5385 }, { "entropy": 5.698271560668945, "epoch": 0.5328192961644919, "grad_norm": 0.9140625, "learning_rate": 0.0004978709032289081, "loss": 5.5313, "mean_token_accuracy": 0.1751667484641075, "num_tokens": 12339441.0, "step": 5390 }, { "entropy": 5.832156324386597, "epoch": 0.5333135626729932, "grad_norm": 0.91015625, "learning_rate": 0.0004978660571688881, "loss": 5.571, "mean_token_accuracy": 0.1771231472492218, "num_tokens": 12351005.0, "step": 5395 }, { "entropy": 5.748641586303711, "epoch": 0.5338078291814946, "grad_norm": 0.90234375, "learning_rate": 0.0004978612056263286, "loss": 5.5737, "mean_token_accuracy": 0.17950807511806488, "num_tokens": 12363147.0, "step": 5400 }, { "entropy": 5.709125757217407, "epoch": 0.5343020956899961, "grad_norm": 0.88671875, "learning_rate": 0.0004978563486013488, "loss": 5.514, "mean_token_accuracy": 0.17716446220874787, "num_tokens": 12373446.0, "step": 5405 }, { "entropy": 5.685055494308472, "epoch": 0.5347963621984975, "grad_norm": 0.9453125, "learning_rate": 0.0004978514860940683, "loss": 5.4812, "mean_token_accuracy": 0.17974125891923903, "num_tokens": 12384591.0, "step": 5410 }, { "entropy": 5.702563190460205, "epoch": 0.5352906287069988, "grad_norm": 0.94140625, "learning_rate": 0.0004978466181046067, "loss": 5.4487, "mean_token_accuracy": 0.18445669412612914, "num_tokens": 12396117.0, "step": 5415 }, { "entropy": 5.71293797492981, "epoch": 0.5357848952155002, "grad_norm": 0.89453125, "learning_rate": 0.0004978417446330837, "loss": 5.5291, "mean_token_accuracy": 0.1834175780415535, "num_tokens": 12407400.0, "step": 5420 }, { "entropy": 5.71294264793396, "epoch": 0.5362791617240016, "grad_norm": 0.94140625, "learning_rate": 0.0004978368656796191, "loss": 5.4288, "mean_token_accuracy": 0.1889510452747345, "num_tokens": 12417629.0, "step": 5425 }, { "entropy": 5.631913089752198, "epoch": 0.536773428232503, "grad_norm": 0.94921875, "learning_rate": 0.0004978319812443331, "loss": 5.4586, "mean_token_accuracy": 0.1860121175646782, "num_tokens": 12428522.0, "step": 5430 }, { "entropy": 5.757750129699707, "epoch": 0.5372676947410043, "grad_norm": 1.0078125, "learning_rate": 0.0004978270913273458, "loss": 5.5667, "mean_token_accuracy": 0.1727421149611473, "num_tokens": 12440390.0, "step": 5435 }, { "entropy": 5.730445003509521, "epoch": 0.5377619612495057, "grad_norm": 1.0078125, "learning_rate": 0.0004978221959287775, "loss": 5.4657, "mean_token_accuracy": 0.17915254235267639, "num_tokens": 12451846.0, "step": 5440 }, { "entropy": 5.665342187881469, "epoch": 0.5382562277580071, "grad_norm": 0.984375, "learning_rate": 0.0004978172950487486, "loss": 5.4916, "mean_token_accuracy": 0.18083307892084122, "num_tokens": 12462051.0, "step": 5445 }, { "entropy": 5.705119943618774, "epoch": 0.5387504942665085, "grad_norm": 0.9296875, "learning_rate": 0.0004978123886873797, "loss": 5.4221, "mean_token_accuracy": 0.18838255405426024, "num_tokens": 12472730.0, "step": 5450 }, { "entropy": 5.705033636093139, "epoch": 0.5392447607750099, "grad_norm": 0.94921875, "learning_rate": 0.0004978074768447915, "loss": 5.4513, "mean_token_accuracy": 0.18405091762542725, "num_tokens": 12482719.0, "step": 5455 }, { "entropy": 5.72285475730896, "epoch": 0.5397390272835113, "grad_norm": 0.9140625, "learning_rate": 0.0004978025595211048, "loss": 5.4703, "mean_token_accuracy": 0.17987385988235474, "num_tokens": 12492659.0, "step": 5460 }, { "entropy": 5.776675271987915, "epoch": 0.5402332937920127, "grad_norm": 0.87109375, "learning_rate": 0.0004977976367164404, "loss": 5.5434, "mean_token_accuracy": 0.18172142505645753, "num_tokens": 12504381.0, "step": 5465 }, { "entropy": 5.701971054077148, "epoch": 0.540727560300514, "grad_norm": 0.91015625, "learning_rate": 0.0004977927084309198, "loss": 5.3873, "mean_token_accuracy": 0.191585510969162, "num_tokens": 12515041.0, "step": 5470 }, { "entropy": 5.719192409515381, "epoch": 0.5412218268090154, "grad_norm": 0.9453125, "learning_rate": 0.0004977877746646639, "loss": 5.5397, "mean_token_accuracy": 0.1773410603404045, "num_tokens": 12526313.0, "step": 5475 }, { "entropy": 5.758280801773071, "epoch": 0.5417160933175168, "grad_norm": 0.9453125, "learning_rate": 0.0004977828354177941, "loss": 5.6195, "mean_token_accuracy": 0.16871381402015687, "num_tokens": 12538268.0, "step": 5480 }, { "entropy": 5.79785270690918, "epoch": 0.5422103598260182, "grad_norm": 0.92578125, "learning_rate": 0.0004977778906904321, "loss": 5.5229, "mean_token_accuracy": 0.17907459586858748, "num_tokens": 12548365.0, "step": 5485 }, { "entropy": 5.798294639587402, "epoch": 0.5427046263345195, "grad_norm": 0.8515625, "learning_rate": 0.0004977729404826995, "loss": 5.6333, "mean_token_accuracy": 0.16580454260110855, "num_tokens": 12560652.0, "step": 5490 }, { "entropy": 5.666089153289795, "epoch": 0.5431988928430209, "grad_norm": 0.93359375, "learning_rate": 0.0004977679847947179, "loss": 5.4831, "mean_token_accuracy": 0.1793080151081085, "num_tokens": 12572079.0, "step": 5495 }, { "entropy": 5.695424509048462, "epoch": 0.5436931593515223, "grad_norm": 0.87109375, "learning_rate": 0.0004977630236266093, "loss": 5.3987, "mean_token_accuracy": 0.188468137383461, "num_tokens": 12582601.0, "step": 5500 }, { "entropy": 5.737460041046143, "epoch": 0.5441874258600238, "grad_norm": 0.921875, "learning_rate": 0.0004977580569784958, "loss": 5.5516, "mean_token_accuracy": 0.17371661216020584, "num_tokens": 12595176.0, "step": 5505 }, { "entropy": 5.763083600997925, "epoch": 0.5446816923685251, "grad_norm": 0.984375, "learning_rate": 0.0004977530848504994, "loss": 5.5283, "mean_token_accuracy": 0.1740500271320343, "num_tokens": 12608161.0, "step": 5510 }, { "entropy": 5.7201683044433596, "epoch": 0.5451759588770265, "grad_norm": 0.875, "learning_rate": 0.0004977481072427427, "loss": 5.5512, "mean_token_accuracy": 0.17325178980827333, "num_tokens": 12620109.0, "step": 5515 }, { "entropy": 5.750601816177368, "epoch": 0.5456702253855279, "grad_norm": 0.92578125, "learning_rate": 0.000497743124155348, "loss": 5.5619, "mean_token_accuracy": 0.17714622914791106, "num_tokens": 12630339.0, "step": 5520 }, { "entropy": 5.717771005630493, "epoch": 0.5461644918940293, "grad_norm": 1.015625, "learning_rate": 0.0004977381355884379, "loss": 5.5933, "mean_token_accuracy": 0.17526816725730895, "num_tokens": 12642101.0, "step": 5525 }, { "entropy": 5.8134345531463625, "epoch": 0.5466587584025306, "grad_norm": 0.80859375, "learning_rate": 0.0004977331415421351, "loss": 5.6494, "mean_token_accuracy": 0.1631540909409523, "num_tokens": 12655436.0, "step": 5530 }, { "entropy": 5.670326995849609, "epoch": 0.547153024911032, "grad_norm": 0.94140625, "learning_rate": 0.0004977281420165624, "loss": 5.328, "mean_token_accuracy": 0.18655091375112534, "num_tokens": 12667100.0, "step": 5535 }, { "entropy": 5.736252164840698, "epoch": 0.5476472914195334, "grad_norm": 0.921875, "learning_rate": 0.000497723137011843, "loss": 5.6026, "mean_token_accuracy": 0.1717616006731987, "num_tokens": 12678788.0, "step": 5540 }, { "entropy": 5.702353382110596, "epoch": 0.5481415579280348, "grad_norm": 0.84765625, "learning_rate": 0.0004977181265280997, "loss": 5.4943, "mean_token_accuracy": 0.1882707357406616, "num_tokens": 12690980.0, "step": 5545 }, { "entropy": 5.792353677749634, "epoch": 0.5486358244365361, "grad_norm": 0.98046875, "learning_rate": 0.000497713110565456, "loss": 5.6241, "mean_token_accuracy": 0.16960501074790954, "num_tokens": 12702642.0, "step": 5550 }, { "entropy": 5.667881774902344, "epoch": 0.5491300909450376, "grad_norm": 0.9375, "learning_rate": 0.0004977080891240352, "loss": 5.4124, "mean_token_accuracy": 0.18527184575796127, "num_tokens": 12712750.0, "step": 5555 }, { "entropy": 5.647262382507324, "epoch": 0.549624357453539, "grad_norm": 0.9375, "learning_rate": 0.000497703062203961, "loss": 5.4126, "mean_token_accuracy": 0.18373893201351166, "num_tokens": 12724464.0, "step": 5560 }, { "entropy": 5.662138175964356, "epoch": 0.5501186239620404, "grad_norm": 0.9140625, "learning_rate": 0.0004976980298053567, "loss": 5.4936, "mean_token_accuracy": 0.18040757030248641, "num_tokens": 12735419.0, "step": 5565 }, { "entropy": 5.7814513683319095, "epoch": 0.5506128904705417, "grad_norm": 0.97265625, "learning_rate": 0.0004976929919283465, "loss": 5.4964, "mean_token_accuracy": 0.17729845494031907, "num_tokens": 12746279.0, "step": 5570 }, { "entropy": 5.754790449142456, "epoch": 0.5511071569790431, "grad_norm": 0.87109375, "learning_rate": 0.0004976879485730541, "loss": 5.5933, "mean_token_accuracy": 0.17460487484931947, "num_tokens": 12758107.0, "step": 5575 }, { "entropy": 5.705501651763916, "epoch": 0.5516014234875445, "grad_norm": 0.96484375, "learning_rate": 0.0004976828997396036, "loss": 5.4942, "mean_token_accuracy": 0.18142490983009338, "num_tokens": 12769354.0, "step": 5580 }, { "entropy": 5.709550094604492, "epoch": 0.5520956899960459, "grad_norm": 1.0078125, "learning_rate": 0.0004976778454281193, "loss": 5.4783, "mean_token_accuracy": 0.17462583780288696, "num_tokens": 12780926.0, "step": 5585 }, { "entropy": 5.758620023727417, "epoch": 0.5525899565045472, "grad_norm": 0.9375, "learning_rate": 0.0004976727856387253, "loss": 5.4613, "mean_token_accuracy": 0.17859200537204742, "num_tokens": 12792423.0, "step": 5590 }, { "entropy": 5.650246620178223, "epoch": 0.5530842230130486, "grad_norm": 0.84765625, "learning_rate": 0.0004976677203715464, "loss": 5.4037, "mean_token_accuracy": 0.18654853850603104, "num_tokens": 12803688.0, "step": 5595 }, { "entropy": 5.6252978324890135, "epoch": 0.55357848952155, "grad_norm": 1.03125, "learning_rate": 0.000497662649626707, "loss": 5.4021, "mean_token_accuracy": 0.18218183666467666, "num_tokens": 12814617.0, "step": 5600 }, { "entropy": 5.671320056915283, "epoch": 0.5540727560300513, "grad_norm": 0.875, "learning_rate": 0.0004976575734043318, "loss": 5.4239, "mean_token_accuracy": 0.18155066221952437, "num_tokens": 12826027.0, "step": 5605 }, { "entropy": 5.70953106880188, "epoch": 0.5545670225385528, "grad_norm": 0.8984375, "learning_rate": 0.0004976524917045457, "loss": 5.5098, "mean_token_accuracy": 0.1751214250922203, "num_tokens": 12837454.0, "step": 5610 }, { "entropy": 5.6623170375823975, "epoch": 0.5550612890470542, "grad_norm": 0.984375, "learning_rate": 0.000497647404527474, "loss": 5.4079, "mean_token_accuracy": 0.17895466834306717, "num_tokens": 12848550.0, "step": 5615 }, { "entropy": 5.723525094985962, "epoch": 0.5555555555555556, "grad_norm": 0.921875, "learning_rate": 0.0004976423118732413, "loss": 5.4795, "mean_token_accuracy": 0.18420547246932983, "num_tokens": 12858270.0, "step": 5620 }, { "entropy": 5.637595891952515, "epoch": 0.556049822064057, "grad_norm": 0.92578125, "learning_rate": 0.0004976372137419733, "loss": 5.4277, "mean_token_accuracy": 0.1801848143339157, "num_tokens": 12869507.0, "step": 5625 }, { "entropy": 5.710002994537353, "epoch": 0.5565440885725583, "grad_norm": 0.921875, "learning_rate": 0.0004976321101337954, "loss": 5.4154, "mean_token_accuracy": 0.18490006327629088, "num_tokens": 12880097.0, "step": 5630 }, { "entropy": 5.647879981994629, "epoch": 0.5570383550810597, "grad_norm": 0.8828125, "learning_rate": 0.000497627001048833, "loss": 5.4178, "mean_token_accuracy": 0.1850220501422882, "num_tokens": 12891302.0, "step": 5635 }, { "entropy": 5.637676191329956, "epoch": 0.5575326215895611, "grad_norm": 0.84375, "learning_rate": 0.0004976218864872118, "loss": 5.418, "mean_token_accuracy": 0.19009962379932405, "num_tokens": 12903950.0, "step": 5640 }, { "entropy": 5.636033630371093, "epoch": 0.5580268880980624, "grad_norm": 0.9453125, "learning_rate": 0.0004976167664490576, "loss": 5.4677, "mean_token_accuracy": 0.17656199485063553, "num_tokens": 12915713.0, "step": 5645 }, { "entropy": 5.693882179260254, "epoch": 0.5585211546065638, "grad_norm": 0.94921875, "learning_rate": 0.0004976116409344966, "loss": 5.4232, "mean_token_accuracy": 0.1840524271130562, "num_tokens": 12926655.0, "step": 5650 }, { "entropy": 5.6743552684783936, "epoch": 0.5590154211150652, "grad_norm": 0.85546875, "learning_rate": 0.0004976065099436546, "loss": 5.4155, "mean_token_accuracy": 0.18222784250974655, "num_tokens": 12938144.0, "step": 5655 }, { "entropy": 5.738457775115966, "epoch": 0.5595096876235667, "grad_norm": 0.8828125, "learning_rate": 0.0004976013734766579, "loss": 5.5884, "mean_token_accuracy": 0.17793260514736176, "num_tokens": 12950486.0, "step": 5660 }, { "entropy": 5.697487115859985, "epoch": 0.560003954132068, "grad_norm": 0.9375, "learning_rate": 0.000497596231533633, "loss": 5.3371, "mean_token_accuracy": 0.19043521881103515, "num_tokens": 12960966.0, "step": 5665 }, { "entropy": 5.588744878768921, "epoch": 0.5604982206405694, "grad_norm": 0.95703125, "learning_rate": 0.000497591084114706, "loss": 5.4583, "mean_token_accuracy": 0.17657962292432786, "num_tokens": 12971960.0, "step": 5670 }, { "entropy": 5.694585466384888, "epoch": 0.5609924871490708, "grad_norm": 0.93359375, "learning_rate": 0.000497585931220004, "loss": 5.535, "mean_token_accuracy": 0.17528121024370194, "num_tokens": 12984186.0, "step": 5675 }, { "entropy": 5.718903541564941, "epoch": 0.5614867536575722, "grad_norm": 0.890625, "learning_rate": 0.0004975807728496535, "loss": 5.37, "mean_token_accuracy": 0.1933738648891449, "num_tokens": 12994205.0, "step": 5680 }, { "entropy": 5.743024158477783, "epoch": 0.5619810201660735, "grad_norm": 0.92578125, "learning_rate": 0.0004975756090037815, "loss": 5.5092, "mean_token_accuracy": 0.1797839641571045, "num_tokens": 13006143.0, "step": 5685 }, { "entropy": 5.75539927482605, "epoch": 0.5624752866745749, "grad_norm": 0.93359375, "learning_rate": 0.000497570439682515, "loss": 5.5432, "mean_token_accuracy": 0.1780344307422638, "num_tokens": 13017849.0, "step": 5690 }, { "entropy": 5.556363296508789, "epoch": 0.5629695531830763, "grad_norm": 0.9140625, "learning_rate": 0.000497565264885981, "loss": 5.416, "mean_token_accuracy": 0.1853431358933449, "num_tokens": 13030301.0, "step": 5695 }, { "entropy": 5.690979719161987, "epoch": 0.5634638196915777, "grad_norm": 0.98828125, "learning_rate": 0.0004975600846143072, "loss": 5.4672, "mean_token_accuracy": 0.18101324141025543, "num_tokens": 13040229.0, "step": 5700 }, { "entropy": 5.677075386047363, "epoch": 0.563958086200079, "grad_norm": 0.84375, "learning_rate": 0.0004975548988676206, "loss": 5.4072, "mean_token_accuracy": 0.18771886080503464, "num_tokens": 13050752.0, "step": 5705 }, { "entropy": 5.721929311752319, "epoch": 0.5644523527085805, "grad_norm": 0.8828125, "learning_rate": 0.0004975497076460491, "loss": 5.5929, "mean_token_accuracy": 0.169534532725811, "num_tokens": 13062003.0, "step": 5710 }, { "entropy": 5.724889516830444, "epoch": 0.5649466192170819, "grad_norm": 0.9609375, "learning_rate": 0.0004975445109497202, "loss": 5.5202, "mean_token_accuracy": 0.17212688624858857, "num_tokens": 13073746.0, "step": 5715 }, { "entropy": 5.751843976974487, "epoch": 0.5654408857255833, "grad_norm": 1.0390625, "learning_rate": 0.0004975393087787617, "loss": 5.6088, "mean_token_accuracy": 0.16963324397802354, "num_tokens": 13086068.0, "step": 5720 }, { "entropy": 5.731973648071289, "epoch": 0.5659351522340846, "grad_norm": 0.84375, "learning_rate": 0.0004975341011333019, "loss": 5.4971, "mean_token_accuracy": 0.175083190202713, "num_tokens": 13097078.0, "step": 5725 }, { "entropy": 5.712811279296875, "epoch": 0.566429418742586, "grad_norm": 0.96484375, "learning_rate": 0.0004975288880134685, "loss": 5.4857, "mean_token_accuracy": 0.17570012360811232, "num_tokens": 13108450.0, "step": 5730 }, { "entropy": 5.70791220664978, "epoch": 0.5669236852510874, "grad_norm": 0.953125, "learning_rate": 0.0004975236694193901, "loss": 5.5271, "mean_token_accuracy": 0.17499605864286422, "num_tokens": 13120216.0, "step": 5735 }, { "entropy": 5.728220748901367, "epoch": 0.5674179517595888, "grad_norm": 0.8515625, "learning_rate": 0.0004975184453511948, "loss": 5.4893, "mean_token_accuracy": 0.17223051935434341, "num_tokens": 13131214.0, "step": 5740 }, { "entropy": 5.752101993560791, "epoch": 0.5679122182680901, "grad_norm": 0.9296875, "learning_rate": 0.0004975132158090112, "loss": 5.5586, "mean_token_accuracy": 0.17313584983348845, "num_tokens": 13143792.0, "step": 5745 }, { "entropy": 5.643269109725952, "epoch": 0.5684064847765915, "grad_norm": 0.984375, "learning_rate": 0.000497507980792968, "loss": 5.5331, "mean_token_accuracy": 0.17834406197071076, "num_tokens": 13156022.0, "step": 5750 }, { "entropy": 5.720694828033447, "epoch": 0.5689007512850929, "grad_norm": 0.87890625, "learning_rate": 0.000497502740303194, "loss": 5.4584, "mean_token_accuracy": 0.18700699955224992, "num_tokens": 13167374.0, "step": 5755 }, { "entropy": 5.663321018218994, "epoch": 0.5693950177935944, "grad_norm": 0.9296875, "learning_rate": 0.000497497494339818, "loss": 5.4175, "mean_token_accuracy": 0.18547506779432296, "num_tokens": 13177662.0, "step": 5760 }, { "entropy": 5.675651741027832, "epoch": 0.5698892843020957, "grad_norm": 0.87890625, "learning_rate": 0.0004974922429029692, "loss": 5.4839, "mean_token_accuracy": 0.1828199788928032, "num_tokens": 13188375.0, "step": 5765 }, { "entropy": 5.721620750427246, "epoch": 0.5703835508105971, "grad_norm": 0.9765625, "learning_rate": 0.0004974869859927767, "loss": 5.3943, "mean_token_accuracy": 0.18473788499832153, "num_tokens": 13198988.0, "step": 5770 }, { "entropy": 5.722113418579101, "epoch": 0.5708778173190985, "grad_norm": 0.953125, "learning_rate": 0.0004974817236093697, "loss": 5.469, "mean_token_accuracy": 0.17077454924583435, "num_tokens": 13210699.0, "step": 5775 }, { "entropy": 5.607710933685302, "epoch": 0.5713720838275999, "grad_norm": 0.8828125, "learning_rate": 0.0004974764557528779, "loss": 5.4042, "mean_token_accuracy": 0.18515662103891373, "num_tokens": 13221925.0, "step": 5780 }, { "entropy": 5.692989730834961, "epoch": 0.5718663503361012, "grad_norm": 0.9453125, "learning_rate": 0.0004974711824234308, "loss": 5.5254, "mean_token_accuracy": 0.17651437073946, "num_tokens": 13233278.0, "step": 5785 }, { "entropy": 5.727219009399414, "epoch": 0.5723606168446026, "grad_norm": 0.88671875, "learning_rate": 0.000497465903621158, "loss": 5.4732, "mean_token_accuracy": 0.1833200767636299, "num_tokens": 13245423.0, "step": 5790 }, { "entropy": 5.7230048179626465, "epoch": 0.572854883353104, "grad_norm": 0.90234375, "learning_rate": 0.0004974606193461895, "loss": 5.5315, "mean_token_accuracy": 0.18311117738485336, "num_tokens": 13256312.0, "step": 5795 }, { "entropy": 5.674717283248901, "epoch": 0.5733491498616053, "grad_norm": 0.93359375, "learning_rate": 0.0004974553295986553, "loss": 5.4841, "mean_token_accuracy": 0.1801747724413872, "num_tokens": 13268158.0, "step": 5800 }, { "entropy": 5.697471714019775, "epoch": 0.5738434163701067, "grad_norm": 0.89453125, "learning_rate": 0.0004974500343786854, "loss": 5.4642, "mean_token_accuracy": 0.18450628817081452, "num_tokens": 13279625.0, "step": 5805 }, { "entropy": 5.742508745193481, "epoch": 0.5743376828786081, "grad_norm": 0.90625, "learning_rate": 0.0004974447336864102, "loss": 5.4833, "mean_token_accuracy": 0.1780957043170929, "num_tokens": 13291967.0, "step": 5810 }, { "entropy": 5.574592256546021, "epoch": 0.5748319493871096, "grad_norm": 0.90234375, "learning_rate": 0.00049743942752196, "loss": 5.3666, "mean_token_accuracy": 0.19336710274219512, "num_tokens": 13303641.0, "step": 5815 }, { "entropy": 5.680289697647095, "epoch": 0.575326215895611, "grad_norm": 0.9296875, "learning_rate": 0.0004974341158854654, "loss": 5.4224, "mean_token_accuracy": 0.18220524340867997, "num_tokens": 13314754.0, "step": 5820 }, { "entropy": 5.681327247619629, "epoch": 0.5758204824041123, "grad_norm": 0.953125, "learning_rate": 0.0004974287987770571, "loss": 5.5388, "mean_token_accuracy": 0.17182663530111314, "num_tokens": 13325574.0, "step": 5825 }, { "entropy": 5.655151844024658, "epoch": 0.5763147489126137, "grad_norm": 0.94921875, "learning_rate": 0.0004974234761968658, "loss": 5.4426, "mean_token_accuracy": 0.188499516248703, "num_tokens": 13335946.0, "step": 5830 }, { "entropy": 5.690153455734253, "epoch": 0.5768090154211151, "grad_norm": 0.87109375, "learning_rate": 0.0004974181481450224, "loss": 5.4548, "mean_token_accuracy": 0.18891586661338805, "num_tokens": 13347812.0, "step": 5835 }, { "entropy": 5.619996976852417, "epoch": 0.5773032819296164, "grad_norm": 0.9140625, "learning_rate": 0.0004974128146216581, "loss": 5.4065, "mean_token_accuracy": 0.18081191480159758, "num_tokens": 13358492.0, "step": 5840 }, { "entropy": 5.765320301055908, "epoch": 0.5777975484381178, "grad_norm": 0.8984375, "learning_rate": 0.0004974074756269042, "loss": 5.5595, "mean_token_accuracy": 0.17181968539953232, "num_tokens": 13370465.0, "step": 5845 }, { "entropy": 5.729849004745484, "epoch": 0.5782918149466192, "grad_norm": 0.8359375, "learning_rate": 0.0004974021311608917, "loss": 5.4265, "mean_token_accuracy": 0.1863820120692253, "num_tokens": 13382328.0, "step": 5850 }, { "entropy": 5.660841703414917, "epoch": 0.5787860814551206, "grad_norm": 0.93359375, "learning_rate": 0.0004973967812237523, "loss": 5.5331, "mean_token_accuracy": 0.17349311858415603, "num_tokens": 13393439.0, "step": 5855 }, { "entropy": 5.679994249343872, "epoch": 0.5792803479636219, "grad_norm": 0.93359375, "learning_rate": 0.0004973914258156177, "loss": 5.4725, "mean_token_accuracy": 0.18491232693195342, "num_tokens": 13404778.0, "step": 5860 }, { "entropy": 5.744904518127441, "epoch": 0.5797746144721234, "grad_norm": 0.8828125, "learning_rate": 0.0004973860649366195, "loss": 5.4609, "mean_token_accuracy": 0.18246472924947738, "num_tokens": 13417031.0, "step": 5865 }, { "entropy": 5.664391899108887, "epoch": 0.5802688809806248, "grad_norm": 0.96875, "learning_rate": 0.0004973806985868895, "loss": 5.4585, "mean_token_accuracy": 0.18145431876182555, "num_tokens": 13428030.0, "step": 5870 }, { "entropy": 5.6677357196807865, "epoch": 0.5807631474891262, "grad_norm": 0.98046875, "learning_rate": 0.0004973753267665599, "loss": 5.4636, "mean_token_accuracy": 0.188689661026001, "num_tokens": 13438934.0, "step": 5875 }, { "entropy": 5.685553646087646, "epoch": 0.5812574139976275, "grad_norm": 0.94921875, "learning_rate": 0.0004973699494757627, "loss": 5.4278, "mean_token_accuracy": 0.18000556230545045, "num_tokens": 13450542.0, "step": 5880 }, { "entropy": 5.636749935150147, "epoch": 0.5817516805061289, "grad_norm": 0.89453125, "learning_rate": 0.0004973645667146302, "loss": 5.4787, "mean_token_accuracy": 0.18343548178672792, "num_tokens": 13462382.0, "step": 5885 }, { "entropy": 5.690588045120239, "epoch": 0.5822459470146303, "grad_norm": 0.89453125, "learning_rate": 0.0004973591784832949, "loss": 5.4887, "mean_token_accuracy": 0.17925147712230682, "num_tokens": 13473852.0, "step": 5890 }, { "entropy": 5.772671127319336, "epoch": 0.5827402135231317, "grad_norm": 0.859375, "learning_rate": 0.0004973537847818894, "loss": 5.5209, "mean_token_accuracy": 0.17614968121051788, "num_tokens": 13485763.0, "step": 5895 }, { "entropy": 5.64776644706726, "epoch": 0.583234480031633, "grad_norm": 0.81640625, "learning_rate": 0.0004973483856105462, "loss": 5.48, "mean_token_accuracy": 0.17578526288270951, "num_tokens": 13498154.0, "step": 5900 }, { "entropy": 5.798301124572754, "epoch": 0.5837287465401344, "grad_norm": 0.83984375, "learning_rate": 0.0004973429809693983, "loss": 5.5125, "mean_token_accuracy": 0.1744379073381424, "num_tokens": 13510563.0, "step": 5905 }, { "entropy": 5.806843709945679, "epoch": 0.5842230130486358, "grad_norm": 0.94140625, "learning_rate": 0.0004973375708585785, "loss": 5.5322, "mean_token_accuracy": 0.1793620765209198, "num_tokens": 13521987.0, "step": 5910 }, { "entropy": 5.689712572097778, "epoch": 0.5847172795571373, "grad_norm": 0.94140625, "learning_rate": 0.0004973321552782201, "loss": 5.4969, "mean_token_accuracy": 0.17573654949665068, "num_tokens": 13534075.0, "step": 5915 }, { "entropy": 5.7232919216156, "epoch": 0.5852115460656386, "grad_norm": 0.91015625, "learning_rate": 0.000497326734228456, "loss": 5.641, "mean_token_accuracy": 0.1707701340317726, "num_tokens": 13546201.0, "step": 5920 }, { "entropy": 5.7440252780914305, "epoch": 0.58570581257414, "grad_norm": 0.875, "learning_rate": 0.0004973213077094199, "loss": 5.4482, "mean_token_accuracy": 0.18471860587596894, "num_tokens": 13556985.0, "step": 5925 }, { "entropy": 5.7353099346160885, "epoch": 0.5862000790826414, "grad_norm": 0.89453125, "learning_rate": 0.0004973158757212451, "loss": 5.4959, "mean_token_accuracy": 0.17943619042634965, "num_tokens": 13568617.0, "step": 5930 }, { "entropy": 5.669313764572143, "epoch": 0.5866943455911428, "grad_norm": 0.90625, "learning_rate": 0.0004973104382640652, "loss": 5.4241, "mean_token_accuracy": 0.18207190483808516, "num_tokens": 13581326.0, "step": 5935 }, { "entropy": 5.623838615417481, "epoch": 0.5871886120996441, "grad_norm": 0.92578125, "learning_rate": 0.0004973049953380141, "loss": 5.4447, "mean_token_accuracy": 0.18112152218818664, "num_tokens": 13591776.0, "step": 5940 }, { "entropy": 5.775270318984985, "epoch": 0.5876828786081455, "grad_norm": 0.94921875, "learning_rate": 0.0004972995469432256, "loss": 5.5734, "mean_token_accuracy": 0.17720313966274262, "num_tokens": 13603475.0, "step": 5945 }, { "entropy": 5.711223411560058, "epoch": 0.5881771451166469, "grad_norm": 0.8671875, "learning_rate": 0.0004972940930798338, "loss": 5.4885, "mean_token_accuracy": 0.18052901923656464, "num_tokens": 13615348.0, "step": 5950 }, { "entropy": 5.638391637802124, "epoch": 0.5886714116251482, "grad_norm": 0.9609375, "learning_rate": 0.0004972886337479727, "loss": 5.3523, "mean_token_accuracy": 0.18873538374900817, "num_tokens": 13625982.0, "step": 5955 }, { "entropy": 5.730290699005127, "epoch": 0.5891656781336496, "grad_norm": 0.85546875, "learning_rate": 0.0004972831689477768, "loss": 5.4956, "mean_token_accuracy": 0.1760983258485794, "num_tokens": 13637203.0, "step": 5960 }, { "entropy": 5.650530385971069, "epoch": 0.5896599446421511, "grad_norm": 0.87109375, "learning_rate": 0.0004972776986793806, "loss": 5.4075, "mean_token_accuracy": 0.1862584114074707, "num_tokens": 13648880.0, "step": 5965 }, { "entropy": 5.7312853813171385, "epoch": 0.5901542111506525, "grad_norm": 0.9140625, "learning_rate": 0.0004972722229429184, "loss": 5.5087, "mean_token_accuracy": 0.1798007532954216, "num_tokens": 13660266.0, "step": 5970 }, { "entropy": 5.822765874862671, "epoch": 0.5906484776591538, "grad_norm": 0.91796875, "learning_rate": 0.000497266741738525, "loss": 5.5688, "mean_token_accuracy": 0.16865714639425278, "num_tokens": 13672063.0, "step": 5975 }, { "entropy": 5.761362457275391, "epoch": 0.5911427441676552, "grad_norm": 0.99609375, "learning_rate": 0.0004972612550663353, "loss": 5.4652, "mean_token_accuracy": 0.1849730893969536, "num_tokens": 13683379.0, "step": 5980 }, { "entropy": 5.644468355178833, "epoch": 0.5916370106761566, "grad_norm": 0.84375, "learning_rate": 0.0004972557629264842, "loss": 5.405, "mean_token_accuracy": 0.1872525006532669, "num_tokens": 13694512.0, "step": 5985 }, { "entropy": 5.654037380218506, "epoch": 0.592131277184658, "grad_norm": 0.94140625, "learning_rate": 0.0004972502653191069, "loss": 5.4411, "mean_token_accuracy": 0.17873243540525435, "num_tokens": 13705642.0, "step": 5990 }, { "entropy": 5.607875728607178, "epoch": 0.5926255436931593, "grad_norm": 0.890625, "learning_rate": 0.0004972447622443387, "loss": 5.3403, "mean_token_accuracy": 0.1939103201031685, "num_tokens": 13717367.0, "step": 5995 }, { "entropy": 5.629198360443115, "epoch": 0.5931198102016607, "grad_norm": 0.98828125, "learning_rate": 0.0004972392537023147, "loss": 5.4434, "mean_token_accuracy": 0.18449512720108033, "num_tokens": 13728577.0, "step": 6000 }, { "epoch": 0.5931198102016607, "eval_entropy": 5.520838036484384, "eval_loss": 5.489232063293457, "eval_mean_token_accuracy": 0.18620092519644882, "eval_num_tokens": 13728577.0, "eval_runtime": 20.2589, "eval_samples_per_second": 1604.873, "eval_steps_per_second": 200.652, "step": 6000 }, { "entropy": 5.694039964675904, "epoch": 0.5936140767101621, "grad_norm": 1.0859375, "learning_rate": 0.0004972337396931707, "loss": 5.431, "mean_token_accuracy": 0.17898510843515397, "num_tokens": 13739016.0, "step": 6005 }, { "entropy": 5.698187971115113, "epoch": 0.5941083432186635, "grad_norm": 0.98046875, "learning_rate": 0.0004972282202170421, "loss": 5.4698, "mean_token_accuracy": 0.17413619458675383, "num_tokens": 13749971.0, "step": 6010 }, { "entropy": 5.720085525512696, "epoch": 0.5946026097271648, "grad_norm": 0.85546875, "learning_rate": 0.000497222695274065, "loss": 5.4976, "mean_token_accuracy": 0.18056531846523285, "num_tokens": 13760927.0, "step": 6015 }, { "entropy": 5.6857373237609865, "epoch": 0.5950968762356663, "grad_norm": 0.90625, "learning_rate": 0.0004972171648643749, "loss": 5.4658, "mean_token_accuracy": 0.1777636170387268, "num_tokens": 13772725.0, "step": 6020 }, { "entropy": 5.647058820724487, "epoch": 0.5955911427441677, "grad_norm": 0.84375, "learning_rate": 0.0004972116289881082, "loss": 5.4549, "mean_token_accuracy": 0.18431781679391862, "num_tokens": 13783427.0, "step": 6025 }, { "entropy": 5.626068735122681, "epoch": 0.5960854092526691, "grad_norm": 1.0234375, "learning_rate": 0.000497206087645401, "loss": 5.3603, "mean_token_accuracy": 0.1876608520746231, "num_tokens": 13794045.0, "step": 6030 }, { "entropy": 5.690873479843139, "epoch": 0.5965796757611704, "grad_norm": 0.9375, "learning_rate": 0.0004972005408363894, "loss": 5.4363, "mean_token_accuracy": 0.18243310153484343, "num_tokens": 13805629.0, "step": 6035 }, { "entropy": 5.695156860351562, "epoch": 0.5970739422696718, "grad_norm": 0.93359375, "learning_rate": 0.0004971949885612102, "loss": 5.5122, "mean_token_accuracy": 0.1755664363503456, "num_tokens": 13817526.0, "step": 6040 }, { "entropy": 5.721815538406372, "epoch": 0.5975682087781732, "grad_norm": 0.90625, "learning_rate": 0.0004971894308199997, "loss": 5.4449, "mean_token_accuracy": 0.18967705219984055, "num_tokens": 13828553.0, "step": 6045 }, { "entropy": 5.7002260208129885, "epoch": 0.5980624752866746, "grad_norm": 0.99609375, "learning_rate": 0.0004971838676128947, "loss": 5.4556, "mean_token_accuracy": 0.18237520903348922, "num_tokens": 13840323.0, "step": 6050 }, { "entropy": 5.62611494064331, "epoch": 0.5985567417951759, "grad_norm": 0.765625, "learning_rate": 0.0004971782989400323, "loss": 5.4345, "mean_token_accuracy": 0.18200478106737136, "num_tokens": 13853524.0, "step": 6055 }, { "entropy": 5.634366083145141, "epoch": 0.5990510083036773, "grad_norm": 0.88671875, "learning_rate": 0.0004971727248015491, "loss": 5.4057, "mean_token_accuracy": 0.1798626884818077, "num_tokens": 13864462.0, "step": 6060 }, { "entropy": 5.674392557144165, "epoch": 0.5995452748121787, "grad_norm": 0.9453125, "learning_rate": 0.0004971671451975823, "loss": 5.4432, "mean_token_accuracy": 0.18449902832508086, "num_tokens": 13876615.0, "step": 6065 }, { "entropy": 5.7029815196990965, "epoch": 0.6000395413206802, "grad_norm": 0.8984375, "learning_rate": 0.0004971615601282695, "loss": 5.5442, "mean_token_accuracy": 0.175985124707222, "num_tokens": 13887652.0, "step": 6070 }, { "entropy": 5.664801120758057, "epoch": 0.6005338078291815, "grad_norm": 0.859375, "learning_rate": 0.0004971559695937477, "loss": 5.4291, "mean_token_accuracy": 0.18552502244710922, "num_tokens": 13898961.0, "step": 6075 }, { "entropy": 5.732241821289063, "epoch": 0.6010280743376829, "grad_norm": 0.9375, "learning_rate": 0.0004971503735941547, "loss": 5.4845, "mean_token_accuracy": 0.18525396436452865, "num_tokens": 13909904.0, "step": 6080 }, { "entropy": 5.7483007431030275, "epoch": 0.6015223408461843, "grad_norm": 0.9140625, "learning_rate": 0.000497144772129628, "loss": 5.4935, "mean_token_accuracy": 0.17705144435167314, "num_tokens": 13921376.0, "step": 6085 }, { "entropy": 5.613857173919678, "epoch": 0.6020166073546857, "grad_norm": 0.890625, "learning_rate": 0.0004971391652003054, "loss": 5.4583, "mean_token_accuracy": 0.18400758653879165, "num_tokens": 13932925.0, "step": 6090 }, { "entropy": 5.653530693054199, "epoch": 0.602510873863187, "grad_norm": 0.9296875, "learning_rate": 0.000497133552806325, "loss": 5.4297, "mean_token_accuracy": 0.180366712808609, "num_tokens": 13945010.0, "step": 6095 }, { "entropy": 5.673624897003174, "epoch": 0.6030051403716884, "grad_norm": 0.9375, "learning_rate": 0.0004971279349478245, "loss": 5.4572, "mean_token_accuracy": 0.17002967447042466, "num_tokens": 13957710.0, "step": 6100 }, { "entropy": 5.637682723999023, "epoch": 0.6034994068801898, "grad_norm": 0.96875, "learning_rate": 0.0004971223116249424, "loss": 5.3453, "mean_token_accuracy": 0.19884619265794753, "num_tokens": 13967819.0, "step": 6105 }, { "entropy": 5.738822364807129, "epoch": 0.6039936733886911, "grad_norm": 0.87890625, "learning_rate": 0.0004971166828378172, "loss": 5.6379, "mean_token_accuracy": 0.1704862132668495, "num_tokens": 13980342.0, "step": 6110 }, { "entropy": 5.730433225631714, "epoch": 0.6044879398971925, "grad_norm": 0.87109375, "learning_rate": 0.000497111048586587, "loss": 5.5003, "mean_token_accuracy": 0.1814030796289444, "num_tokens": 13990370.0, "step": 6115 }, { "entropy": 5.719407176971435, "epoch": 0.604982206405694, "grad_norm": 1.1015625, "learning_rate": 0.0004971054088713905, "loss": 5.5054, "mean_token_accuracy": 0.18395653814077378, "num_tokens": 14001761.0, "step": 6120 }, { "entropy": 5.688090848922729, "epoch": 0.6054764729141954, "grad_norm": 0.94921875, "learning_rate": 0.0004970997636923665, "loss": 5.5086, "mean_token_accuracy": 0.17743084132671355, "num_tokens": 14012980.0, "step": 6125 }, { "entropy": 5.7234241485595705, "epoch": 0.6059707394226967, "grad_norm": 0.85546875, "learning_rate": 0.000497094113049654, "loss": 5.3792, "mean_token_accuracy": 0.17918495535850526, "num_tokens": 14023609.0, "step": 6130 }, { "entropy": 5.705080175399781, "epoch": 0.6064650059311981, "grad_norm": 0.94140625, "learning_rate": 0.0004970884569433917, "loss": 5.5525, "mean_token_accuracy": 0.17683068066835403, "num_tokens": 14036052.0, "step": 6135 }, { "entropy": 5.583223438262939, "epoch": 0.6069592724396995, "grad_norm": 0.82421875, "learning_rate": 0.000497082795373719, "loss": 5.3777, "mean_token_accuracy": 0.19433097392320633, "num_tokens": 14047932.0, "step": 6140 }, { "entropy": 5.691878032684326, "epoch": 0.6074535389482009, "grad_norm": 0.8984375, "learning_rate": 0.0004970771283407749, "loss": 5.4734, "mean_token_accuracy": 0.18248322904109954, "num_tokens": 14059674.0, "step": 6145 }, { "entropy": 5.7451056957244875, "epoch": 0.6079478054567022, "grad_norm": 0.84765625, "learning_rate": 0.0004970714558446992, "loss": 5.504, "mean_token_accuracy": 0.17891190350055694, "num_tokens": 14070753.0, "step": 6150 }, { "entropy": 5.705259323120117, "epoch": 0.6084420719652036, "grad_norm": 0.93359375, "learning_rate": 0.0004970657778856312, "loss": 5.4797, "mean_token_accuracy": 0.17718423306941986, "num_tokens": 14083565.0, "step": 6155 }, { "entropy": 5.768088483810425, "epoch": 0.608936338473705, "grad_norm": 0.88671875, "learning_rate": 0.0004970600944637106, "loss": 5.5555, "mean_token_accuracy": 0.17376272827386857, "num_tokens": 14095008.0, "step": 6160 }, { "entropy": 5.651238489151001, "epoch": 0.6094306049822064, "grad_norm": 0.9921875, "learning_rate": 0.0004970544055790772, "loss": 5.3293, "mean_token_accuracy": 0.1857001468539238, "num_tokens": 14106586.0, "step": 6165 }, { "entropy": 5.5644018173217775, "epoch": 0.6099248714907078, "grad_norm": 0.9453125, "learning_rate": 0.000497048711231871, "loss": 5.3349, "mean_token_accuracy": 0.19013680815696715, "num_tokens": 14117778.0, "step": 6170 }, { "entropy": 5.645483827590942, "epoch": 0.6104191379992092, "grad_norm": 0.97265625, "learning_rate": 0.0004970430114222319, "loss": 5.4138, "mean_token_accuracy": 0.18405671864748002, "num_tokens": 14129644.0, "step": 6175 }, { "entropy": 5.608224105834961, "epoch": 0.6109134045077106, "grad_norm": 0.9921875, "learning_rate": 0.0004970373061503005, "loss": 5.3801, "mean_token_accuracy": 0.18779513984918594, "num_tokens": 14141230.0, "step": 6180 }, { "entropy": 5.691171073913575, "epoch": 0.611407671016212, "grad_norm": 0.98828125, "learning_rate": 0.0004970315954162169, "loss": 5.5338, "mean_token_accuracy": 0.18076920807361602, "num_tokens": 14151622.0, "step": 6185 }, { "entropy": 5.729362678527832, "epoch": 0.6119019375247133, "grad_norm": 1.0234375, "learning_rate": 0.0004970258792201214, "loss": 5.4609, "mean_token_accuracy": 0.18297825753688812, "num_tokens": 14163641.0, "step": 6190 }, { "entropy": 5.6758159637451175, "epoch": 0.6123962040332147, "grad_norm": 0.96875, "learning_rate": 0.000497020157562155, "loss": 5.4225, "mean_token_accuracy": 0.18241576254367828, "num_tokens": 14175154.0, "step": 6195 }, { "entropy": 5.678399753570557, "epoch": 0.6128904705417161, "grad_norm": 1.0234375, "learning_rate": 0.0004970144304424582, "loss": 5.4348, "mean_token_accuracy": 0.18604173362255097, "num_tokens": 14185472.0, "step": 6200 }, { "entropy": 5.655495643615723, "epoch": 0.6133847370502175, "grad_norm": 0.9296875, "learning_rate": 0.000497008697861172, "loss": 5.4136, "mean_token_accuracy": 0.18471768200397493, "num_tokens": 14196992.0, "step": 6205 }, { "entropy": 5.6577808380126955, "epoch": 0.6138790035587188, "grad_norm": 0.90234375, "learning_rate": 0.0004970029598184375, "loss": 5.4043, "mean_token_accuracy": 0.18361602872610092, "num_tokens": 14207732.0, "step": 6210 }, { "entropy": 5.788011741638184, "epoch": 0.6143732700672202, "grad_norm": 0.9375, "learning_rate": 0.0004969972163143956, "loss": 5.5759, "mean_token_accuracy": 0.16790141612291337, "num_tokens": 14219164.0, "step": 6215 }, { "entropy": 5.754797697067261, "epoch": 0.6148675365757216, "grad_norm": 0.9140625, "learning_rate": 0.0004969914673491878, "loss": 5.5238, "mean_token_accuracy": 0.174917308986187, "num_tokens": 14231687.0, "step": 6220 }, { "entropy": 5.701521873474121, "epoch": 0.6153618030842231, "grad_norm": 1.0, "learning_rate": 0.0004969857129229555, "loss": 5.3709, "mean_token_accuracy": 0.18633836060762404, "num_tokens": 14243099.0, "step": 6225 }, { "entropy": 5.724573373794556, "epoch": 0.6158560695927244, "grad_norm": 0.9609375, "learning_rate": 0.0004969799530358402, "loss": 5.5558, "mean_token_accuracy": 0.17466307282447815, "num_tokens": 14255835.0, "step": 6230 }, { "entropy": 5.61751275062561, "epoch": 0.6163503361012258, "grad_norm": 0.95703125, "learning_rate": 0.0004969741876879835, "loss": 5.3902, "mean_token_accuracy": 0.1797702357172966, "num_tokens": 14266661.0, "step": 6235 }, { "entropy": 5.706689739227295, "epoch": 0.6168446026097272, "grad_norm": 1.0078125, "learning_rate": 0.0004969684168795275, "loss": 5.4719, "mean_token_accuracy": 0.17943569272756577, "num_tokens": 14278474.0, "step": 6240 }, { "entropy": 5.696401214599609, "epoch": 0.6173388691182286, "grad_norm": 0.984375, "learning_rate": 0.0004969626406106139, "loss": 5.423, "mean_token_accuracy": 0.18498812913894652, "num_tokens": 14289516.0, "step": 6245 }, { "entropy": 5.616736316680909, "epoch": 0.6178331356267299, "grad_norm": 0.953125, "learning_rate": 0.0004969568588813851, "loss": 5.4289, "mean_token_accuracy": 0.18524541556835175, "num_tokens": 14301312.0, "step": 6250 }, { "entropy": 5.7349471092224125, "epoch": 0.6183274021352313, "grad_norm": 0.84375, "learning_rate": 0.0004969510716919829, "loss": 5.4215, "mean_token_accuracy": 0.18772805780172347, "num_tokens": 14312009.0, "step": 6255 }, { "entropy": 5.651899433135986, "epoch": 0.6188216686437327, "grad_norm": 0.99609375, "learning_rate": 0.00049694527904255, "loss": 5.4707, "mean_token_accuracy": 0.1838291198015213, "num_tokens": 14322754.0, "step": 6260 }, { "entropy": 5.620483922958374, "epoch": 0.619315935152234, "grad_norm": 0.97265625, "learning_rate": 0.0004969394809332287, "loss": 5.3242, "mean_token_accuracy": 0.1873846858739853, "num_tokens": 14333939.0, "step": 6265 }, { "entropy": 5.685281229019165, "epoch": 0.6198102016607354, "grad_norm": 0.9375, "learning_rate": 0.0004969336773641619, "loss": 5.449, "mean_token_accuracy": 0.18313581347465516, "num_tokens": 14345987.0, "step": 6270 }, { "entropy": 5.70992751121521, "epoch": 0.6203044681692369, "grad_norm": 0.94140625, "learning_rate": 0.0004969278683354921, "loss": 5.4321, "mean_token_accuracy": 0.17262377291917802, "num_tokens": 14356974.0, "step": 6275 }, { "entropy": 5.669468879699707, "epoch": 0.6207987346777383, "grad_norm": 0.91796875, "learning_rate": 0.0004969220538473625, "loss": 5.4476, "mean_token_accuracy": 0.1783553659915924, "num_tokens": 14368175.0, "step": 6280 }, { "entropy": 5.710161781311035, "epoch": 0.6212930011862396, "grad_norm": 0.96875, "learning_rate": 0.0004969162338999157, "loss": 5.5359, "mean_token_accuracy": 0.17305552810430527, "num_tokens": 14379067.0, "step": 6285 }, { "entropy": 5.73663477897644, "epoch": 0.621787267694741, "grad_norm": 0.93359375, "learning_rate": 0.0004969104084932953, "loss": 5.4795, "mean_token_accuracy": 0.177034367620945, "num_tokens": 14390483.0, "step": 6290 }, { "entropy": 5.641278600692749, "epoch": 0.6222815342032424, "grad_norm": 0.94140625, "learning_rate": 0.0004969045776276443, "loss": 5.5042, "mean_token_accuracy": 0.18176504969596863, "num_tokens": 14402757.0, "step": 6295 }, { "entropy": 5.639428186416626, "epoch": 0.6227758007117438, "grad_norm": 0.9375, "learning_rate": 0.0004968987413031063, "loss": 5.4304, "mean_token_accuracy": 0.18551308512687684, "num_tokens": 14413829.0, "step": 6300 }, { "entropy": 5.742794179916382, "epoch": 0.6232700672202451, "grad_norm": 0.8671875, "learning_rate": 0.0004968928995198249, "loss": 5.5183, "mean_token_accuracy": 0.1757616013288498, "num_tokens": 14425165.0, "step": 6305 }, { "entropy": 5.751724624633789, "epoch": 0.6237643337287465, "grad_norm": 0.91796875, "learning_rate": 0.0004968870522779437, "loss": 5.4695, "mean_token_accuracy": 0.17993895709514618, "num_tokens": 14436264.0, "step": 6310 }, { "entropy": 5.631435441970825, "epoch": 0.6242586002372479, "grad_norm": 0.96484375, "learning_rate": 0.0004968811995776066, "loss": 5.4231, "mean_token_accuracy": 0.18555117547512054, "num_tokens": 14447384.0, "step": 6315 }, { "entropy": 5.750989866256714, "epoch": 0.6247528667457493, "grad_norm": 0.92578125, "learning_rate": 0.0004968753414189576, "loss": 5.5133, "mean_token_accuracy": 0.1763505682349205, "num_tokens": 14460013.0, "step": 6320 }, { "entropy": 5.70129508972168, "epoch": 0.6252471332542507, "grad_norm": 0.9375, "learning_rate": 0.0004968694778021408, "loss": 5.406, "mean_token_accuracy": 0.1815218910574913, "num_tokens": 14472452.0, "step": 6325 }, { "entropy": 5.648702383041382, "epoch": 0.6257413997627521, "grad_norm": 0.8125, "learning_rate": 0.0004968636087273003, "loss": 5.4518, "mean_token_accuracy": 0.17689984887838364, "num_tokens": 14484487.0, "step": 6330 }, { "entropy": 5.6673290729522705, "epoch": 0.6262356662712535, "grad_norm": 0.9140625, "learning_rate": 0.0004968577341945806, "loss": 5.3729, "mean_token_accuracy": 0.1912898153066635, "num_tokens": 14496043.0, "step": 6335 }, { "entropy": 5.678042268753051, "epoch": 0.6267299327797549, "grad_norm": 0.921875, "learning_rate": 0.0004968518542041264, "loss": 5.4801, "mean_token_accuracy": 0.18045878410339355, "num_tokens": 14508089.0, "step": 6340 }, { "entropy": 5.750748825073242, "epoch": 0.6272241992882562, "grad_norm": 1.0078125, "learning_rate": 0.000496845968756082, "loss": 5.5459, "mean_token_accuracy": 0.17275822311639785, "num_tokens": 14519480.0, "step": 6345 }, { "entropy": 5.68837194442749, "epoch": 0.6277184657967576, "grad_norm": 0.84765625, "learning_rate": 0.0004968400778505925, "loss": 5.4554, "mean_token_accuracy": 0.18545902371406556, "num_tokens": 14531214.0, "step": 6350 }, { "entropy": 5.728791666030884, "epoch": 0.628212732305259, "grad_norm": 0.78125, "learning_rate": 0.0004968341814878025, "loss": 5.5116, "mean_token_accuracy": 0.18025332391262056, "num_tokens": 14544118.0, "step": 6355 }, { "entropy": 5.712054967880249, "epoch": 0.6287069988137604, "grad_norm": 0.859375, "learning_rate": 0.0004968282796678573, "loss": 5.4402, "mean_token_accuracy": 0.1791952908039093, "num_tokens": 14555545.0, "step": 6360 }, { "entropy": 5.591178035736084, "epoch": 0.6292012653222617, "grad_norm": 0.90234375, "learning_rate": 0.000496822372390902, "loss": 5.4393, "mean_token_accuracy": 0.1820431798696518, "num_tokens": 14567157.0, "step": 6365 }, { "entropy": 5.630130577087402, "epoch": 0.6296955318307631, "grad_norm": 0.9140625, "learning_rate": 0.000496816459657082, "loss": 5.3824, "mean_token_accuracy": 0.18572291284799575, "num_tokens": 14577074.0, "step": 6370 }, { "entropy": 5.7315356731414795, "epoch": 0.6301897983392646, "grad_norm": 0.96484375, "learning_rate": 0.0004968105414665426, "loss": 5.463, "mean_token_accuracy": 0.18738443404436111, "num_tokens": 14589133.0, "step": 6375 }, { "entropy": 5.617154932022094, "epoch": 0.630684064847766, "grad_norm": 0.91015625, "learning_rate": 0.0004968046178194295, "loss": 5.4126, "mean_token_accuracy": 0.18410412222146988, "num_tokens": 14600985.0, "step": 6380 }, { "entropy": 5.626444673538208, "epoch": 0.6311783313562673, "grad_norm": 0.96875, "learning_rate": 0.0004967986887158884, "loss": 5.4166, "mean_token_accuracy": 0.18224202692508698, "num_tokens": 14612163.0, "step": 6385 }, { "entropy": 5.679624795913696, "epoch": 0.6316725978647687, "grad_norm": 0.8515625, "learning_rate": 0.0004967927541560651, "loss": 5.522, "mean_token_accuracy": 0.18442254662513732, "num_tokens": 14623045.0, "step": 6390 }, { "entropy": 5.749571847915649, "epoch": 0.6321668643732701, "grad_norm": 0.97265625, "learning_rate": 0.0004967868141401056, "loss": 5.4734, "mean_token_accuracy": 0.17739887833595275, "num_tokens": 14634696.0, "step": 6395 }, { "entropy": 5.7607465267181395, "epoch": 0.6326611308817714, "grad_norm": 0.9609375, "learning_rate": 0.0004967808686681562, "loss": 5.486, "mean_token_accuracy": 0.1749749004840851, "num_tokens": 14645589.0, "step": 6400 }, { "entropy": 5.686657333374024, "epoch": 0.6331553973902728, "grad_norm": 0.921875, "learning_rate": 0.0004967749177403629, "loss": 5.4144, "mean_token_accuracy": 0.179549640417099, "num_tokens": 14657199.0, "step": 6405 }, { "entropy": 5.694932556152343, "epoch": 0.6336496638987742, "grad_norm": 0.9296875, "learning_rate": 0.0004967689613568723, "loss": 5.4654, "mean_token_accuracy": 0.181937375664711, "num_tokens": 14668767.0, "step": 6410 }, { "entropy": 5.633897399902343, "epoch": 0.6341439304072756, "grad_norm": 0.8515625, "learning_rate": 0.0004967629995178309, "loss": 5.3769, "mean_token_accuracy": 0.18576575070619583, "num_tokens": 14680860.0, "step": 6415 }, { "entropy": 5.573486375808716, "epoch": 0.6346381969157769, "grad_norm": 0.89453125, "learning_rate": 0.0004967570322233852, "loss": 5.3352, "mean_token_accuracy": 0.18799678087234498, "num_tokens": 14692134.0, "step": 6420 }, { "entropy": 5.65862512588501, "epoch": 0.6351324634242784, "grad_norm": 0.8828125, "learning_rate": 0.0004967510594736822, "loss": 5.4492, "mean_token_accuracy": 0.18286152482032775, "num_tokens": 14703323.0, "step": 6425 }, { "entropy": 5.62370457649231, "epoch": 0.6356267299327798, "grad_norm": 0.9296875, "learning_rate": 0.0004967450812688686, "loss": 5.3656, "mean_token_accuracy": 0.18862025290727616, "num_tokens": 14714453.0, "step": 6430 }, { "entropy": 5.684353828430176, "epoch": 0.6361209964412812, "grad_norm": 0.9296875, "learning_rate": 0.0004967390976090917, "loss": 5.4697, "mean_token_accuracy": 0.18162885904312134, "num_tokens": 14726562.0, "step": 6435 }, { "entropy": 5.6323981285095215, "epoch": 0.6366152629497825, "grad_norm": 0.984375, "learning_rate": 0.0004967331084944986, "loss": 5.3051, "mean_token_accuracy": 0.19608130902051926, "num_tokens": 14738054.0, "step": 6440 }, { "entropy": 5.6152056694030765, "epoch": 0.6371095294582839, "grad_norm": 0.91015625, "learning_rate": 0.0004967271139252365, "loss": 5.4178, "mean_token_accuracy": 0.182883520424366, "num_tokens": 14749037.0, "step": 6445 }, { "entropy": 5.661227226257324, "epoch": 0.6376037959667853, "grad_norm": 0.98046875, "learning_rate": 0.0004967211139014531, "loss": 5.3902, "mean_token_accuracy": 0.1829350173473358, "num_tokens": 14759667.0, "step": 6450 }, { "entropy": 5.6420365333557125, "epoch": 0.6380980624752867, "grad_norm": 0.96875, "learning_rate": 0.000496715108423296, "loss": 5.4163, "mean_token_accuracy": 0.18451944440603257, "num_tokens": 14770866.0, "step": 6455 }, { "entropy": 5.6753006935119625, "epoch": 0.638592328983788, "grad_norm": 0.95703125, "learning_rate": 0.0004967090974909127, "loss": 5.4311, "mean_token_accuracy": 0.1837174341082573, "num_tokens": 14783095.0, "step": 6460 }, { "entropy": 5.704218482971191, "epoch": 0.6390865954922894, "grad_norm": 0.91015625, "learning_rate": 0.0004967030811044512, "loss": 5.4777, "mean_token_accuracy": 0.18018376529216767, "num_tokens": 14794046.0, "step": 6465 }, { "entropy": 5.642075872421264, "epoch": 0.6395808620007908, "grad_norm": 0.87109375, "learning_rate": 0.0004966970592640596, "loss": 5.4833, "mean_token_accuracy": 0.18182666897773742, "num_tokens": 14807295.0, "step": 6470 }, { "entropy": 5.673696565628052, "epoch": 0.6400751285092922, "grad_norm": 0.94921875, "learning_rate": 0.0004966910319698859, "loss": 5.4192, "mean_token_accuracy": 0.19166572093963624, "num_tokens": 14819109.0, "step": 6475 }, { "entropy": 5.633265447616577, "epoch": 0.6405693950177936, "grad_norm": 0.91015625, "learning_rate": 0.0004966849992220784, "loss": 5.3768, "mean_token_accuracy": 0.1831287294626236, "num_tokens": 14830719.0, "step": 6480 }, { "entropy": 5.654397678375244, "epoch": 0.641063661526295, "grad_norm": 1.03125, "learning_rate": 0.0004966789610207856, "loss": 5.4828, "mean_token_accuracy": 0.1823555901646614, "num_tokens": 14843392.0, "step": 6485 }, { "entropy": 5.673593997955322, "epoch": 0.6415579280347964, "grad_norm": 0.90234375, "learning_rate": 0.0004966729173661559, "loss": 5.3491, "mean_token_accuracy": 0.19026254266500472, "num_tokens": 14855745.0, "step": 6490 }, { "entropy": 5.712899541854858, "epoch": 0.6420521945432978, "grad_norm": 0.921875, "learning_rate": 0.000496666868258338, "loss": 5.4826, "mean_token_accuracy": 0.17762941271066665, "num_tokens": 14868053.0, "step": 6495 }, { "entropy": 5.633643627166748, "epoch": 0.6425464610517991, "grad_norm": 0.94140625, "learning_rate": 0.0004966608136974809, "loss": 5.4015, "mean_token_accuracy": 0.1873242288827896, "num_tokens": 14880095.0, "step": 6500 }, { "entropy": 5.741604137420654, "epoch": 0.6430407275603005, "grad_norm": 0.91015625, "learning_rate": 0.0004966547536837333, "loss": 5.4722, "mean_token_accuracy": 0.1732838675379753, "num_tokens": 14891013.0, "step": 6505 }, { "entropy": 5.696990442276001, "epoch": 0.6435349940688019, "grad_norm": 0.93359375, "learning_rate": 0.0004966486882172444, "loss": 5.3983, "mean_token_accuracy": 0.1848207026720047, "num_tokens": 14901875.0, "step": 6510 }, { "entropy": 5.658370113372802, "epoch": 0.6440292605773033, "grad_norm": 0.9609375, "learning_rate": 0.0004966426172981634, "loss": 5.4363, "mean_token_accuracy": 0.18247244656085967, "num_tokens": 14912620.0, "step": 6515 }, { "entropy": 5.608095693588257, "epoch": 0.6445235270858046, "grad_norm": 1.1953125, "learning_rate": 0.0004966365409266396, "loss": 5.4049, "mean_token_accuracy": 0.19223633855581285, "num_tokens": 14923128.0, "step": 6520 }, { "entropy": 5.668742895126343, "epoch": 0.645017793594306, "grad_norm": 0.9140625, "learning_rate": 0.0004966304591028225, "loss": 5.3935, "mean_token_accuracy": 0.18793380558490752, "num_tokens": 14933621.0, "step": 6525 }, { "entropy": 5.599980401992798, "epoch": 0.6455120601028075, "grad_norm": 0.96484375, "learning_rate": 0.0004966243718268617, "loss": 5.3749, "mean_token_accuracy": 0.19062525182962417, "num_tokens": 14943292.0, "step": 6530 }, { "entropy": 5.624884605407715, "epoch": 0.6460063266113089, "grad_norm": 0.93359375, "learning_rate": 0.000496618279098907, "loss": 5.4269, "mean_token_accuracy": 0.18043642938137056, "num_tokens": 14953998.0, "step": 6535 }, { "entropy": 5.733946657180786, "epoch": 0.6465005931198102, "grad_norm": 0.88671875, "learning_rate": 0.0004966121809191083, "loss": 5.4593, "mean_token_accuracy": 0.18526359498500825, "num_tokens": 14965430.0, "step": 6540 }, { "entropy": 5.659072542190552, "epoch": 0.6469948596283116, "grad_norm": 0.87890625, "learning_rate": 0.0004966060772876156, "loss": 5.3406, "mean_token_accuracy": 0.18633160293102263, "num_tokens": 14977124.0, "step": 6545 }, { "entropy": 5.626809883117676, "epoch": 0.647489126136813, "grad_norm": 1.0078125, "learning_rate": 0.0004965999682045788, "loss": 5.3577, "mean_token_accuracy": 0.18469508290290831, "num_tokens": 14987069.0, "step": 6550 }, { "entropy": 5.542923212051392, "epoch": 0.6479833926453143, "grad_norm": 1.0, "learning_rate": 0.0004965938536701486, "loss": 5.4274, "mean_token_accuracy": 0.19628507494926453, "num_tokens": 14997919.0, "step": 6555 }, { "entropy": 5.667957973480225, "epoch": 0.6484776591538157, "grad_norm": 0.90625, "learning_rate": 0.0004965877336844752, "loss": 5.4666, "mean_token_accuracy": 0.18661269992589952, "num_tokens": 15010042.0, "step": 6560 }, { "entropy": 5.673238039016724, "epoch": 0.6489719256623171, "grad_norm": 0.9453125, "learning_rate": 0.0004965816082477091, "loss": 5.3634, "mean_token_accuracy": 0.19180899858474731, "num_tokens": 15021166.0, "step": 6565 }, { "entropy": 5.657901859283447, "epoch": 0.6494661921708185, "grad_norm": 0.97265625, "learning_rate": 0.0004965754773600011, "loss": 5.4283, "mean_token_accuracy": 0.1834958612918854, "num_tokens": 15032182.0, "step": 6570 }, { "entropy": 5.635055160522461, "epoch": 0.6499604586793198, "grad_norm": 0.99609375, "learning_rate": 0.000496569341021502, "loss": 5.3962, "mean_token_accuracy": 0.18328681886196135, "num_tokens": 15043054.0, "step": 6575 }, { "entropy": 5.58140230178833, "epoch": 0.6504547251878213, "grad_norm": 0.91015625, "learning_rate": 0.0004965631992323628, "loss": 5.3237, "mean_token_accuracy": 0.19114499241113664, "num_tokens": 15055462.0, "step": 6580 }, { "entropy": 5.674931812286377, "epoch": 0.6509489916963227, "grad_norm": 0.99609375, "learning_rate": 0.0004965570519927345, "loss": 5.4358, "mean_token_accuracy": 0.1836880326271057, "num_tokens": 15066849.0, "step": 6585 }, { "entropy": 5.612647342681885, "epoch": 0.6514432582048241, "grad_norm": 0.91796875, "learning_rate": 0.0004965508993027682, "loss": 5.3886, "mean_token_accuracy": 0.18852711766958236, "num_tokens": 15078388.0, "step": 6590 }, { "entropy": 5.687802410125732, "epoch": 0.6519375247133254, "grad_norm": 0.88671875, "learning_rate": 0.0004965447411626156, "loss": 5.4351, "mean_token_accuracy": 0.17746506482362748, "num_tokens": 15090474.0, "step": 6595 }, { "entropy": 5.734937047958374, "epoch": 0.6524317912218268, "grad_norm": 0.9140625, "learning_rate": 0.0004965385775724279, "loss": 5.4331, "mean_token_accuracy": 0.17972189635038377, "num_tokens": 15101104.0, "step": 6600 }, { "entropy": 5.674316549301148, "epoch": 0.6529260577303282, "grad_norm": 0.96484375, "learning_rate": 0.0004965324085323569, "loss": 5.4356, "mean_token_accuracy": 0.17819103896617888, "num_tokens": 15112036.0, "step": 6605 }, { "entropy": 5.696061992645264, "epoch": 0.6534203242388296, "grad_norm": 0.94140625, "learning_rate": 0.0004965262340425541, "loss": 5.5726, "mean_token_accuracy": 0.1701563611626625, "num_tokens": 15124913.0, "step": 6610 }, { "entropy": 5.72771201133728, "epoch": 0.6539145907473309, "grad_norm": 0.921875, "learning_rate": 0.0004965200541031717, "loss": 5.4603, "mean_token_accuracy": 0.1849457859992981, "num_tokens": 15135555.0, "step": 6615 }, { "entropy": 5.741866827011108, "epoch": 0.6544088572558323, "grad_norm": 1.0546875, "learning_rate": 0.0004965138687143616, "loss": 5.5341, "mean_token_accuracy": 0.17379142493009567, "num_tokens": 15146646.0, "step": 6620 }, { "entropy": 5.706768560409546, "epoch": 0.6549031237643337, "grad_norm": 0.9140625, "learning_rate": 0.0004965076778762759, "loss": 5.425, "mean_token_accuracy": 0.18281069695949553, "num_tokens": 15157101.0, "step": 6625 }, { "entropy": 5.706532955169678, "epoch": 0.6553973902728352, "grad_norm": 0.8515625, "learning_rate": 0.0004965014815890671, "loss": 5.4157, "mean_token_accuracy": 0.1816703647375107, "num_tokens": 15169645.0, "step": 6630 }, { "entropy": 5.661654281616211, "epoch": 0.6558916567813365, "grad_norm": 0.93359375, "learning_rate": 0.0004964952798528874, "loss": 5.3294, "mean_token_accuracy": 0.18340978622436524, "num_tokens": 15181018.0, "step": 6635 }, { "entropy": 5.610451889038086, "epoch": 0.6563859232898379, "grad_norm": 0.92578125, "learning_rate": 0.0004964890726678894, "loss": 5.3999, "mean_token_accuracy": 0.18111667335033416, "num_tokens": 15191880.0, "step": 6640 }, { "entropy": 5.583183908462525, "epoch": 0.6568801897983393, "grad_norm": 0.9296875, "learning_rate": 0.0004964828600342259, "loss": 5.3839, "mean_token_accuracy": 0.18679492473602294, "num_tokens": 15203886.0, "step": 6645 }, { "entropy": 5.62922215461731, "epoch": 0.6573744563068407, "grad_norm": 0.8515625, "learning_rate": 0.0004964766419520497, "loss": 5.3528, "mean_token_accuracy": 0.19382699579000473, "num_tokens": 15215837.0, "step": 6650 }, { "entropy": 5.699456214904785, "epoch": 0.657868722815342, "grad_norm": 0.8984375, "learning_rate": 0.0004964704184215138, "loss": 5.4753, "mean_token_accuracy": 0.1755339801311493, "num_tokens": 15226833.0, "step": 6655 }, { "entropy": 5.676594066619873, "epoch": 0.6583629893238434, "grad_norm": 0.9140625, "learning_rate": 0.0004964641894427712, "loss": 5.5117, "mean_token_accuracy": 0.1752748057246208, "num_tokens": 15239312.0, "step": 6660 }, { "entropy": 5.669696998596192, "epoch": 0.6588572558323448, "grad_norm": 0.9921875, "learning_rate": 0.0004964579550159752, "loss": 5.3746, "mean_token_accuracy": 0.18241963535547256, "num_tokens": 15250348.0, "step": 6665 }, { "entropy": 5.649123239517212, "epoch": 0.6593515223408462, "grad_norm": 0.9921875, "learning_rate": 0.0004964517151412791, "loss": 5.4641, "mean_token_accuracy": 0.1885584056377411, "num_tokens": 15261445.0, "step": 6670 }, { "entropy": 5.671473979949951, "epoch": 0.6598457888493475, "grad_norm": 0.98046875, "learning_rate": 0.0004964454698188364, "loss": 5.3814, "mean_token_accuracy": 0.1833171933889389, "num_tokens": 15271606.0, "step": 6675 }, { "entropy": 5.651764392852783, "epoch": 0.6603400553578489, "grad_norm": 0.91796875, "learning_rate": 0.000496439219048801, "loss": 5.4424, "mean_token_accuracy": 0.18205137848854064, "num_tokens": 15283690.0, "step": 6680 }, { "entropy": 5.611808824539184, "epoch": 0.6608343218663504, "grad_norm": 0.90625, "learning_rate": 0.0004964329628313263, "loss": 5.42, "mean_token_accuracy": 0.18861618936061858, "num_tokens": 15294792.0, "step": 6685 }, { "entropy": 5.724461221694947, "epoch": 0.6613285883748518, "grad_norm": 0.953125, "learning_rate": 0.0004964267011665664, "loss": 5.4374, "mean_token_accuracy": 0.18207719475030898, "num_tokens": 15305636.0, "step": 6690 }, { "entropy": 5.626029205322266, "epoch": 0.6618228548833531, "grad_norm": 1.0234375, "learning_rate": 0.0004964204340546753, "loss": 5.4197, "mean_token_accuracy": 0.1838798001408577, "num_tokens": 15316495.0, "step": 6695 }, { "entropy": 5.647285318374633, "epoch": 0.6623171213918545, "grad_norm": 0.90234375, "learning_rate": 0.0004964141614958071, "loss": 5.4064, "mean_token_accuracy": 0.18682038486003877, "num_tokens": 15328246.0, "step": 6700 }, { "entropy": 5.723882627487183, "epoch": 0.6628113879003559, "grad_norm": 0.92578125, "learning_rate": 0.0004964078834901163, "loss": 5.3756, "mean_token_accuracy": 0.18958971947431563, "num_tokens": 15339229.0, "step": 6705 }, { "entropy": 5.619222784042359, "epoch": 0.6633056544088572, "grad_norm": 0.95703125, "learning_rate": 0.000496401600037757, "loss": 5.4207, "mean_token_accuracy": 0.18027045875787734, "num_tokens": 15350591.0, "step": 6710 }, { "entropy": 5.69599027633667, "epoch": 0.6637999209173586, "grad_norm": 0.796875, "learning_rate": 0.0004963953111388842, "loss": 5.5009, "mean_token_accuracy": 0.17615346908569335, "num_tokens": 15363726.0, "step": 6715 }, { "entropy": 5.6532830715179445, "epoch": 0.66429418742586, "grad_norm": 0.8359375, "learning_rate": 0.0004963890167936524, "loss": 5.3905, "mean_token_accuracy": 0.18660545647144317, "num_tokens": 15375569.0, "step": 6720 }, { "entropy": 5.644021654129029, "epoch": 0.6647884539343614, "grad_norm": 0.8828125, "learning_rate": 0.0004963827170022164, "loss": 5.4696, "mean_token_accuracy": 0.17118773311376573, "num_tokens": 15387323.0, "step": 6725 }, { "entropy": 5.6555647373199465, "epoch": 0.6652827204428627, "grad_norm": 1.046875, "learning_rate": 0.0004963764117647311, "loss": 5.3429, "mean_token_accuracy": 0.18348540663719176, "num_tokens": 15397912.0, "step": 6730 }, { "entropy": 5.556147289276123, "epoch": 0.6657769869513642, "grad_norm": 0.9453125, "learning_rate": 0.0004963701010813519, "loss": 5.2587, "mean_token_accuracy": 0.20026432126760482, "num_tokens": 15409469.0, "step": 6735 }, { "entropy": 5.574084806442261, "epoch": 0.6662712534598656, "grad_norm": 0.99609375, "learning_rate": 0.0004963637849522338, "loss": 5.3214, "mean_token_accuracy": 0.1894196540117264, "num_tokens": 15419681.0, "step": 6740 }, { "entropy": 5.702381420135498, "epoch": 0.666765519968367, "grad_norm": 0.8125, "learning_rate": 0.0004963574633775323, "loss": 5.4826, "mean_token_accuracy": 0.18080198317766188, "num_tokens": 15431237.0, "step": 6745 }, { "entropy": 5.655320310592652, "epoch": 0.6672597864768683, "grad_norm": 1.0390625, "learning_rate": 0.0004963511363574027, "loss": 5.4322, "mean_token_accuracy": 0.17954085320234298, "num_tokens": 15442366.0, "step": 6750 }, { "entropy": 5.66972918510437, "epoch": 0.6677540529853697, "grad_norm": 0.87890625, "learning_rate": 0.0004963448038920009, "loss": 5.3994, "mean_token_accuracy": 0.18284390568733216, "num_tokens": 15453121.0, "step": 6755 }, { "entropy": 5.643071508407592, "epoch": 0.6682483194938711, "grad_norm": 0.96875, "learning_rate": 0.0004963384659814827, "loss": 5.365, "mean_token_accuracy": 0.1887548014521599, "num_tokens": 15463489.0, "step": 6760 }, { "entropy": 5.6320898056030275, "epoch": 0.6687425860023725, "grad_norm": 0.86328125, "learning_rate": 0.0004963321226260038, "loss": 5.4278, "mean_token_accuracy": 0.17620297223329545, "num_tokens": 15475217.0, "step": 6765 }, { "entropy": 5.628102159500122, "epoch": 0.6692368525108738, "grad_norm": 0.96875, "learning_rate": 0.0004963257738257203, "loss": 5.4182, "mean_token_accuracy": 0.1859634056687355, "num_tokens": 15485844.0, "step": 6770 }, { "entropy": 5.604792547225952, "epoch": 0.6697311190193752, "grad_norm": 0.87109375, "learning_rate": 0.0004963194195807886, "loss": 5.4036, "mean_token_accuracy": 0.1840989112854004, "num_tokens": 15496835.0, "step": 6775 }, { "entropy": 5.657672452926636, "epoch": 0.6702253855278766, "grad_norm": 0.953125, "learning_rate": 0.0004963130598913646, "loss": 5.4297, "mean_token_accuracy": 0.18401821553707123, "num_tokens": 15508087.0, "step": 6780 }, { "entropy": 5.764063215255737, "epoch": 0.6707196520363781, "grad_norm": 0.93359375, "learning_rate": 0.0004963066947576051, "loss": 5.4357, "mean_token_accuracy": 0.17899666726589203, "num_tokens": 15519596.0, "step": 6785 }, { "entropy": 5.652105903625488, "epoch": 0.6712139185448794, "grad_norm": 0.890625, "learning_rate": 0.0004963003241796666, "loss": 5.4421, "mean_token_accuracy": 0.17562163919210433, "num_tokens": 15530830.0, "step": 6790 }, { "entropy": 5.606659364700318, "epoch": 0.6717081850533808, "grad_norm": 0.87109375, "learning_rate": 0.0004962939481577059, "loss": 5.336, "mean_token_accuracy": 0.20047769844532012, "num_tokens": 15543195.0, "step": 6795 }, { "entropy": 5.67443437576294, "epoch": 0.6722024515618822, "grad_norm": 0.90234375, "learning_rate": 0.0004962875666918796, "loss": 5.4376, "mean_token_accuracy": 0.1857440873980522, "num_tokens": 15554465.0, "step": 6800 }, { "entropy": 5.5999236583709715, "epoch": 0.6726967180703836, "grad_norm": 0.9453125, "learning_rate": 0.0004962811797823448, "loss": 5.4005, "mean_token_accuracy": 0.18363494127988816, "num_tokens": 15566016.0, "step": 6805 }, { "entropy": 5.690791845321655, "epoch": 0.6731909845788849, "grad_norm": 0.92578125, "learning_rate": 0.0004962747874292588, "loss": 5.5076, "mean_token_accuracy": 0.18160534799098968, "num_tokens": 15576843.0, "step": 6810 }, { "entropy": 5.686412668228149, "epoch": 0.6736852510873863, "grad_norm": 0.890625, "learning_rate": 0.0004962683896327786, "loss": 5.4336, "mean_token_accuracy": 0.17897631078958512, "num_tokens": 15588390.0, "step": 6815 }, { "entropy": 5.710813379287719, "epoch": 0.6741795175958877, "grad_norm": 0.9765625, "learning_rate": 0.0004962619863930616, "loss": 5.4966, "mean_token_accuracy": 0.17710331678390503, "num_tokens": 15600270.0, "step": 6820 }, { "entropy": 5.699760484695434, "epoch": 0.674673784104389, "grad_norm": 0.96875, "learning_rate": 0.0004962555777102656, "loss": 5.3533, "mean_token_accuracy": 0.18773166835308075, "num_tokens": 15611617.0, "step": 6825 }, { "entropy": 5.614778232574463, "epoch": 0.6751680506128904, "grad_norm": 0.9296875, "learning_rate": 0.000496249163584548, "loss": 5.4405, "mean_token_accuracy": 0.19098276197910308, "num_tokens": 15622128.0, "step": 6830 }, { "entropy": 5.7067420959472654, "epoch": 0.6756623171213919, "grad_norm": 0.95703125, "learning_rate": 0.0004962427440160665, "loss": 5.4389, "mean_token_accuracy": 0.1769686073064804, "num_tokens": 15635250.0, "step": 6835 }, { "entropy": 5.7560876369476315, "epoch": 0.6761565836298933, "grad_norm": 0.94140625, "learning_rate": 0.0004962363190049794, "loss": 5.5089, "mean_token_accuracy": 0.17909424602985383, "num_tokens": 15646535.0, "step": 6840 }, { "entropy": 5.660425758361816, "epoch": 0.6766508501383947, "grad_norm": 1.015625, "learning_rate": 0.0004962298885514444, "loss": 5.4663, "mean_token_accuracy": 0.18397617042064668, "num_tokens": 15658399.0, "step": 6845 }, { "entropy": 5.656533479690552, "epoch": 0.677145116646896, "grad_norm": 0.97265625, "learning_rate": 0.0004962234526556199, "loss": 5.4191, "mean_token_accuracy": 0.18738919943571092, "num_tokens": 15669321.0, "step": 6850 }, { "entropy": 5.654076433181762, "epoch": 0.6776393831553974, "grad_norm": 0.92578125, "learning_rate": 0.000496217011317664, "loss": 5.3992, "mean_token_accuracy": 0.18449482917785645, "num_tokens": 15681666.0, "step": 6855 }, { "entropy": 5.548627424240112, "epoch": 0.6781336496638988, "grad_norm": 0.8984375, "learning_rate": 0.0004962105645377354, "loss": 5.369, "mean_token_accuracy": 0.19015195965766907, "num_tokens": 15693432.0, "step": 6860 }, { "entropy": 5.638998937606812, "epoch": 0.6786279161724001, "grad_norm": 0.8671875, "learning_rate": 0.0004962041123159926, "loss": 5.3465, "mean_token_accuracy": 0.18897170424461365, "num_tokens": 15705151.0, "step": 6865 }, { "entropy": 5.628846263885498, "epoch": 0.6791221826809015, "grad_norm": 0.921875, "learning_rate": 0.0004961976546525943, "loss": 5.3358, "mean_token_accuracy": 0.1911967322230339, "num_tokens": 15716549.0, "step": 6870 }, { "entropy": 5.673652219772339, "epoch": 0.6796164491894029, "grad_norm": 0.92578125, "learning_rate": 0.0004961911915476994, "loss": 5.4709, "mean_token_accuracy": 0.18663897216320038, "num_tokens": 15727499.0, "step": 6875 }, { "entropy": 5.629086828231811, "epoch": 0.6801107156979043, "grad_norm": 0.91796875, "learning_rate": 0.0004961847230014668, "loss": 5.3987, "mean_token_accuracy": 0.18663089126348495, "num_tokens": 15739196.0, "step": 6880 }, { "entropy": 5.6247296810150145, "epoch": 0.6806049822064056, "grad_norm": 0.8359375, "learning_rate": 0.0004961782490140558, "loss": 5.3841, "mean_token_accuracy": 0.1874699428677559, "num_tokens": 15750890.0, "step": 6885 }, { "entropy": 5.655092000961304, "epoch": 0.6810992487149071, "grad_norm": 0.86328125, "learning_rate": 0.0004961717695856256, "loss": 5.4166, "mean_token_accuracy": 0.18998281061649322, "num_tokens": 15762366.0, "step": 6890 }, { "entropy": 5.620802211761474, "epoch": 0.6815935152234085, "grad_norm": 0.92578125, "learning_rate": 0.0004961652847163354, "loss": 5.3904, "mean_token_accuracy": 0.18460094928741455, "num_tokens": 15773962.0, "step": 6895 }, { "entropy": 5.584212160110473, "epoch": 0.6820877817319099, "grad_norm": 0.93359375, "learning_rate": 0.000496158794406345, "loss": 5.262, "mean_token_accuracy": 0.19707275927066803, "num_tokens": 15784563.0, "step": 6900 }, { "entropy": 5.602247667312622, "epoch": 0.6825820482404112, "grad_norm": 0.90625, "learning_rate": 0.0004961522986558139, "loss": 5.3842, "mean_token_accuracy": 0.1823934942483902, "num_tokens": 15796461.0, "step": 6905 }, { "entropy": 5.672640371322632, "epoch": 0.6830763147489126, "grad_norm": 0.875, "learning_rate": 0.000496145797464902, "loss": 5.4102, "mean_token_accuracy": 0.18323179632425307, "num_tokens": 15807303.0, "step": 6910 }, { "entropy": 5.585866975784302, "epoch": 0.683570581257414, "grad_norm": 1.0234375, "learning_rate": 0.0004961392908337691, "loss": 5.3311, "mean_token_accuracy": 0.19714407324790956, "num_tokens": 15818964.0, "step": 6915 }, { "entropy": 5.641585159301758, "epoch": 0.6840648477659154, "grad_norm": 0.8515625, "learning_rate": 0.0004961327787625754, "loss": 5.4727, "mean_token_accuracy": 0.18058772534132003, "num_tokens": 15831181.0, "step": 6920 }, { "entropy": 5.6128456592559814, "epoch": 0.6845591142744167, "grad_norm": 0.87890625, "learning_rate": 0.000496126261251481, "loss": 5.3555, "mean_token_accuracy": 0.18499982953071595, "num_tokens": 15842442.0, "step": 6925 }, { "entropy": 5.679995727539063, "epoch": 0.6850533807829181, "grad_norm": 1.015625, "learning_rate": 0.0004961197383006463, "loss": 5.4475, "mean_token_accuracy": 0.18255029171705245, "num_tokens": 15854755.0, "step": 6930 }, { "entropy": 5.563614368438721, "epoch": 0.6855476472914195, "grad_norm": 0.96484375, "learning_rate": 0.0004961132099102316, "loss": 5.3179, "mean_token_accuracy": 0.18753704726696013, "num_tokens": 15866300.0, "step": 6935 }, { "entropy": 5.586693954467774, "epoch": 0.686041913799921, "grad_norm": 0.95703125, "learning_rate": 0.0004961066760803978, "loss": 5.3272, "mean_token_accuracy": 0.19534488916397094, "num_tokens": 15877165.0, "step": 6940 }, { "entropy": 5.698647499084473, "epoch": 0.6865361803084223, "grad_norm": 0.93359375, "learning_rate": 0.0004961001368113054, "loss": 5.3935, "mean_token_accuracy": 0.18242558389902114, "num_tokens": 15888893.0, "step": 6945 }, { "entropy": 5.647640132904053, "epoch": 0.6870304468169237, "grad_norm": 0.91015625, "learning_rate": 0.0004960935921031153, "loss": 5.4305, "mean_token_accuracy": 0.1789771094918251, "num_tokens": 15899994.0, "step": 6950 }, { "entropy": 5.569144010543823, "epoch": 0.6875247133254251, "grad_norm": 0.94921875, "learning_rate": 0.0004960870419559887, "loss": 5.3458, "mean_token_accuracy": 0.19405293762683867, "num_tokens": 15911330.0, "step": 6955 }, { "entropy": 5.612390851974487, "epoch": 0.6880189798339265, "grad_norm": 0.98828125, "learning_rate": 0.0004960804863700864, "loss": 5.4092, "mean_token_accuracy": 0.19259232729673387, "num_tokens": 15922397.0, "step": 6960 }, { "entropy": 5.617695474624634, "epoch": 0.6885132463424278, "grad_norm": 0.91015625, "learning_rate": 0.0004960739253455699, "loss": 5.387, "mean_token_accuracy": 0.18649794310331344, "num_tokens": 15934628.0, "step": 6965 }, { "entropy": 5.576512384414673, "epoch": 0.6890075128509292, "grad_norm": 0.9609375, "learning_rate": 0.0004960673588826005, "loss": 5.3842, "mean_token_accuracy": 0.1887969046831131, "num_tokens": 15946599.0, "step": 6970 }, { "entropy": 5.65532865524292, "epoch": 0.6895017793594306, "grad_norm": 0.984375, "learning_rate": 0.0004960607869813398, "loss": 5.3914, "mean_token_accuracy": 0.18609391450881957, "num_tokens": 15957402.0, "step": 6975 }, { "entropy": 5.634889221191406, "epoch": 0.689996045867932, "grad_norm": 1.015625, "learning_rate": 0.0004960542096419494, "loss": 5.4458, "mean_token_accuracy": 0.1854567438364029, "num_tokens": 15968091.0, "step": 6980 }, { "entropy": 5.614648342132568, "epoch": 0.6904903123764333, "grad_norm": 0.92578125, "learning_rate": 0.0004960476268645912, "loss": 5.4326, "mean_token_accuracy": 0.18189410865306854, "num_tokens": 15980809.0, "step": 6985 }, { "entropy": 5.665391731262207, "epoch": 0.6909845788849348, "grad_norm": 0.90234375, "learning_rate": 0.0004960410386494271, "loss": 5.4118, "mean_token_accuracy": 0.18515439629554747, "num_tokens": 15992701.0, "step": 6990 }, { "entropy": 5.770775365829468, "epoch": 0.6914788453934362, "grad_norm": 0.87890625, "learning_rate": 0.0004960344449966191, "loss": 5.501, "mean_token_accuracy": 0.1789790004491806, "num_tokens": 16005871.0, "step": 6995 }, { "entropy": 5.726130676269531, "epoch": 0.6919731119019376, "grad_norm": 0.8515625, "learning_rate": 0.0004960278459063296, "loss": 5.4903, "mean_token_accuracy": 0.16945691108703614, "num_tokens": 16018126.0, "step": 7000 }, { "entropy": 5.57916841506958, "epoch": 0.6924673784104389, "grad_norm": 0.91015625, "learning_rate": 0.0004960212413787206, "loss": 5.3426, "mean_token_accuracy": 0.1889999806880951, "num_tokens": 16028694.0, "step": 7005 }, { "entropy": 5.622007608413696, "epoch": 0.6929616449189403, "grad_norm": 0.96484375, "learning_rate": 0.000496014631413955, "loss": 5.4495, "mean_token_accuracy": 0.17931499928236008, "num_tokens": 16040354.0, "step": 7010 }, { "entropy": 5.671247386932373, "epoch": 0.6934559114274417, "grad_norm": 0.8359375, "learning_rate": 0.0004960080160121951, "loss": 5.3869, "mean_token_accuracy": 0.18870963007211686, "num_tokens": 16051713.0, "step": 7015 }, { "entropy": 5.674233531951904, "epoch": 0.693950177935943, "grad_norm": 0.953125, "learning_rate": 0.0004960013951736036, "loss": 5.4664, "mean_token_accuracy": 0.1765458032488823, "num_tokens": 16064737.0, "step": 7020 }, { "entropy": 5.618309211730957, "epoch": 0.6944444444444444, "grad_norm": 0.9453125, "learning_rate": 0.0004959947688983436, "loss": 5.3411, "mean_token_accuracy": 0.19271097034215928, "num_tokens": 16075515.0, "step": 7025 }, { "entropy": 5.646278142929077, "epoch": 0.6949387109529458, "grad_norm": 0.8125, "learning_rate": 0.0004959881371865779, "loss": 5.4053, "mean_token_accuracy": 0.1821025863289833, "num_tokens": 16088702.0, "step": 7030 }, { "entropy": 5.631470680236816, "epoch": 0.6954329774614472, "grad_norm": 0.94921875, "learning_rate": 0.0004959815000384699, "loss": 5.329, "mean_token_accuracy": 0.18735811859369278, "num_tokens": 16101122.0, "step": 7035 }, { "entropy": 5.686137390136719, "epoch": 0.6959272439699487, "grad_norm": 0.84375, "learning_rate": 0.0004959748574541826, "loss": 5.4098, "mean_token_accuracy": 0.1845657482743263, "num_tokens": 16112817.0, "step": 7040 }, { "entropy": 5.6668354034423825, "epoch": 0.69642151047845, "grad_norm": 0.83984375, "learning_rate": 0.0004959682094338795, "loss": 5.4886, "mean_token_accuracy": 0.17400521039962769, "num_tokens": 16124827.0, "step": 7045 }, { "entropy": 5.645322370529175, "epoch": 0.6969157769869514, "grad_norm": 0.93359375, "learning_rate": 0.0004959615559777243, "loss": 5.3745, "mean_token_accuracy": 0.1897724226117134, "num_tokens": 16136940.0, "step": 7050 }, { "entropy": 5.646060228347778, "epoch": 0.6974100434954528, "grad_norm": 0.99609375, "learning_rate": 0.0004959548970858805, "loss": 5.3819, "mean_token_accuracy": 0.19086919128894805, "num_tokens": 16147541.0, "step": 7055 }, { "entropy": 5.590358543395996, "epoch": 0.6979043100039541, "grad_norm": 0.8984375, "learning_rate": 0.0004959482327585119, "loss": 5.3915, "mean_token_accuracy": 0.185109244287014, "num_tokens": 16157626.0, "step": 7060 }, { "entropy": 5.618498802185059, "epoch": 0.6983985765124555, "grad_norm": 0.81640625, "learning_rate": 0.0004959415629957824, "loss": 5.3616, "mean_token_accuracy": 0.19183777123689652, "num_tokens": 16168494.0, "step": 7065 }, { "entropy": 5.65130090713501, "epoch": 0.6988928430209569, "grad_norm": 0.875, "learning_rate": 0.0004959348877978563, "loss": 5.4591, "mean_token_accuracy": 0.18629186749458312, "num_tokens": 16180749.0, "step": 7070 }, { "entropy": 5.631079578399659, "epoch": 0.6993871095294583, "grad_norm": 0.90234375, "learning_rate": 0.0004959282071648977, "loss": 5.4156, "mean_token_accuracy": 0.18636199682950974, "num_tokens": 16193204.0, "step": 7075 }, { "entropy": 5.619907569885254, "epoch": 0.6998813760379596, "grad_norm": 0.93359375, "learning_rate": 0.000495921521097071, "loss": 5.3873, "mean_token_accuracy": 0.19847878962755203, "num_tokens": 16204303.0, "step": 7080 }, { "entropy": 5.6367161750793455, "epoch": 0.700375642546461, "grad_norm": 0.91015625, "learning_rate": 0.0004959148295945405, "loss": 5.3376, "mean_token_accuracy": 0.19122021794319152, "num_tokens": 16215261.0, "step": 7085 }, { "entropy": 5.6259839057922365, "epoch": 0.7008699090549624, "grad_norm": 0.83984375, "learning_rate": 0.0004959081326574708, "loss": 5.3578, "mean_token_accuracy": 0.18972133994102477, "num_tokens": 16226973.0, "step": 7090 }, { "entropy": 5.522922611236572, "epoch": 0.7013641755634639, "grad_norm": 0.921875, "learning_rate": 0.0004959014302860271, "loss": 5.2299, "mean_token_accuracy": 0.19976499080657958, "num_tokens": 16239152.0, "step": 7095 }, { "entropy": 5.626363945007324, "epoch": 0.7018584420719652, "grad_norm": 0.8125, "learning_rate": 0.0004958947224803737, "loss": 5.3613, "mean_token_accuracy": 0.18945557475090027, "num_tokens": 16251884.0, "step": 7100 }, { "entropy": 5.628907775878906, "epoch": 0.7023527085804666, "grad_norm": 0.90234375, "learning_rate": 0.0004958880092406759, "loss": 5.4318, "mean_token_accuracy": 0.17280466258525848, "num_tokens": 16262497.0, "step": 7105 }, { "entropy": 5.634242105484009, "epoch": 0.702846975088968, "grad_norm": 0.921875, "learning_rate": 0.0004958812905670988, "loss": 5.3806, "mean_token_accuracy": 0.19165094792842866, "num_tokens": 16274624.0, "step": 7110 }, { "entropy": 5.6900725841522215, "epoch": 0.7033412415974694, "grad_norm": 0.9921875, "learning_rate": 0.0004958745664598077, "loss": 5.3854, "mean_token_accuracy": 0.18566901087760926, "num_tokens": 16286096.0, "step": 7115 }, { "entropy": 5.5993482112884525, "epoch": 0.7038355081059707, "grad_norm": 0.8984375, "learning_rate": 0.0004958678369189679, "loss": 5.3104, "mean_token_accuracy": 0.19361240267753602, "num_tokens": 16297853.0, "step": 7120 }, { "entropy": 5.616055202484131, "epoch": 0.7043297746144721, "grad_norm": 0.92578125, "learning_rate": 0.0004958611019447452, "loss": 5.4688, "mean_token_accuracy": 0.18143843114376068, "num_tokens": 16310708.0, "step": 7125 }, { "entropy": 5.6702793598175045, "epoch": 0.7048240411229735, "grad_norm": 1.078125, "learning_rate": 0.0004958543615373051, "loss": 5.3841, "mean_token_accuracy": 0.18490921407938005, "num_tokens": 16321216.0, "step": 7130 }, { "entropy": 5.625423717498779, "epoch": 0.7053183076314749, "grad_norm": 1.046875, "learning_rate": 0.0004958476156968134, "loss": 5.3413, "mean_token_accuracy": 0.19103673696517945, "num_tokens": 16331982.0, "step": 7135 }, { "entropy": 5.618673944473267, "epoch": 0.7058125741399762, "grad_norm": 0.97265625, "learning_rate": 0.000495840864423436, "loss": 5.4361, "mean_token_accuracy": 0.18459590673446655, "num_tokens": 16343001.0, "step": 7140 }, { "entropy": 5.692372846603393, "epoch": 0.7063068406484777, "grad_norm": 0.8671875, "learning_rate": 0.0004958341077173392, "loss": 5.3794, "mean_token_accuracy": 0.1888151526451111, "num_tokens": 16355519.0, "step": 7145 }, { "entropy": 5.640481233596802, "epoch": 0.7068011071569791, "grad_norm": 0.95703125, "learning_rate": 0.0004958273455786892, "loss": 5.3659, "mean_token_accuracy": 0.18385522514581681, "num_tokens": 16366342.0, "step": 7150 }, { "entropy": 5.650845766067505, "epoch": 0.7072953736654805, "grad_norm": 0.8671875, "learning_rate": 0.0004958205780076521, "loss": 5.4507, "mean_token_accuracy": 0.17898534387350082, "num_tokens": 16378395.0, "step": 7155 }, { "entropy": 5.636904859542847, "epoch": 0.7077896401739818, "grad_norm": 0.89453125, "learning_rate": 0.0004958138050043945, "loss": 5.3344, "mean_token_accuracy": 0.18751446306705474, "num_tokens": 16388946.0, "step": 7160 }, { "entropy": 5.553534364700317, "epoch": 0.7082839066824832, "grad_norm": 0.99609375, "learning_rate": 0.0004958070265690831, "loss": 5.4068, "mean_token_accuracy": 0.1858491212129593, "num_tokens": 16399824.0, "step": 7165 }, { "entropy": 5.709564638137818, "epoch": 0.7087781731909846, "grad_norm": 1.0, "learning_rate": 0.0004958002427018845, "loss": 5.4064, "mean_token_accuracy": 0.18237158209085463, "num_tokens": 16411932.0, "step": 7170 }, { "entropy": 5.676246118545532, "epoch": 0.709272439699486, "grad_norm": 0.9296875, "learning_rate": 0.0004957934534029658, "loss": 5.3869, "mean_token_accuracy": 0.18361052870750427, "num_tokens": 16423634.0, "step": 7175 }, { "entropy": 5.68406343460083, "epoch": 0.7097667062079873, "grad_norm": 0.92578125, "learning_rate": 0.0004957866586724938, "loss": 5.4528, "mean_token_accuracy": 0.18455289155244828, "num_tokens": 16434700.0, "step": 7180 }, { "entropy": 5.69803204536438, "epoch": 0.7102609727164887, "grad_norm": 0.8984375, "learning_rate": 0.0004957798585106359, "loss": 5.4029, "mean_token_accuracy": 0.18741103559732436, "num_tokens": 16445829.0, "step": 7185 }, { "entropy": 5.57923731803894, "epoch": 0.7107552392249901, "grad_norm": 0.91796875, "learning_rate": 0.000495773052917559, "loss": 5.2827, "mean_token_accuracy": 0.20067219585180282, "num_tokens": 16456352.0, "step": 7190 }, { "entropy": 5.616693496704102, "epoch": 0.7112495057334915, "grad_norm": 0.984375, "learning_rate": 0.0004957662418934309, "loss": 5.341, "mean_token_accuracy": 0.18705075830221177, "num_tokens": 16467542.0, "step": 7195 }, { "entropy": 5.5467630386352536, "epoch": 0.7117437722419929, "grad_norm": 0.890625, "learning_rate": 0.0004957594254384189, "loss": 5.2815, "mean_token_accuracy": 0.2020015001296997, "num_tokens": 16478614.0, "step": 7200 }, { "entropy": 5.6093262195587155, "epoch": 0.7122380387504943, "grad_norm": 0.9296875, "learning_rate": 0.0004957526035526908, "loss": 5.3501, "mean_token_accuracy": 0.19108325242996216, "num_tokens": 16489929.0, "step": 7205 }, { "entropy": 5.733453750610352, "epoch": 0.7127323052589957, "grad_norm": 0.88671875, "learning_rate": 0.0004957457762364146, "loss": 5.4695, "mean_token_accuracy": 0.17702522575855256, "num_tokens": 16502532.0, "step": 7210 }, { "entropy": 5.709082984924317, "epoch": 0.713226571767497, "grad_norm": 0.90234375, "learning_rate": 0.0004957389434897578, "loss": 5.4924, "mean_token_accuracy": 0.18676265329122543, "num_tokens": 16513805.0, "step": 7215 }, { "entropy": 5.64899754524231, "epoch": 0.7137208382759984, "grad_norm": 0.96484375, "learning_rate": 0.0004957321053128889, "loss": 5.4688, "mean_token_accuracy": 0.17911719381809235, "num_tokens": 16525189.0, "step": 7220 }, { "entropy": 5.693631982803344, "epoch": 0.7142151047844998, "grad_norm": 0.9140625, "learning_rate": 0.0004957252617059759, "loss": 5.4584, "mean_token_accuracy": 0.17913497537374495, "num_tokens": 16538246.0, "step": 7225 }, { "entropy": 5.694340181350708, "epoch": 0.7147093712930012, "grad_norm": 0.89453125, "learning_rate": 0.0004957184126691873, "loss": 5.4392, "mean_token_accuracy": 0.18177661746740342, "num_tokens": 16550036.0, "step": 7230 }, { "entropy": 5.601723957061767, "epoch": 0.7152036378015025, "grad_norm": 0.91015625, "learning_rate": 0.0004957115582026915, "loss": 5.3812, "mean_token_accuracy": 0.1881149008870125, "num_tokens": 16562262.0, "step": 7235 }, { "entropy": 5.6396795272827145, "epoch": 0.7156979043100039, "grad_norm": 0.859375, "learning_rate": 0.000495704698306657, "loss": 5.3614, "mean_token_accuracy": 0.19193967431783676, "num_tokens": 16574213.0, "step": 7240 }, { "entropy": 5.672629308700562, "epoch": 0.7161921708185054, "grad_norm": 0.921875, "learning_rate": 0.0004956978329812528, "loss": 5.4221, "mean_token_accuracy": 0.1875819131731987, "num_tokens": 16586063.0, "step": 7245 }, { "entropy": 5.651843118667602, "epoch": 0.7166864373270068, "grad_norm": 0.8828125, "learning_rate": 0.0004956909622266476, "loss": 5.4428, "mean_token_accuracy": 0.18201903402805328, "num_tokens": 16598014.0, "step": 7250 }, { "entropy": 5.671795749664307, "epoch": 0.7171807038355081, "grad_norm": 0.9296875, "learning_rate": 0.0004956840860430104, "loss": 5.3988, "mean_token_accuracy": 0.1921023726463318, "num_tokens": 16609128.0, "step": 7255 }, { "entropy": 5.623970985412598, "epoch": 0.7176749703440095, "grad_norm": 0.9296875, "learning_rate": 0.0004956772044305106, "loss": 5.3313, "mean_token_accuracy": 0.19064279943704604, "num_tokens": 16620095.0, "step": 7260 }, { "entropy": 5.620648145675659, "epoch": 0.7181692368525109, "grad_norm": 0.9296875, "learning_rate": 0.0004956703173893173, "loss": 5.3452, "mean_token_accuracy": 0.18671971708536148, "num_tokens": 16630919.0, "step": 7265 }, { "entropy": 5.645144081115722, "epoch": 0.7186635033610123, "grad_norm": 1.0234375, "learning_rate": 0.0004956634249196001, "loss": 5.4323, "mean_token_accuracy": 0.1809956505894661, "num_tokens": 16642111.0, "step": 7270 }, { "entropy": 5.707012414932251, "epoch": 0.7191577698695136, "grad_norm": 0.8671875, "learning_rate": 0.0004956565270215282, "loss": 5.426, "mean_token_accuracy": 0.17877160757780075, "num_tokens": 16654805.0, "step": 7275 }, { "entropy": 5.7306663513183596, "epoch": 0.719652036378015, "grad_norm": 0.98828125, "learning_rate": 0.0004956496236952716, "loss": 5.4682, "mean_token_accuracy": 0.18021873086690904, "num_tokens": 16664735.0, "step": 7280 }, { "entropy": 5.6443336486816404, "epoch": 0.7201463028865164, "grad_norm": 1.0, "learning_rate": 0.000495642714941, "loss": 5.333, "mean_token_accuracy": 0.18511747419834138, "num_tokens": 16676163.0, "step": 7285 }, { "entropy": 5.748929595947265, "epoch": 0.7206405693950177, "grad_norm": 0.94140625, "learning_rate": 0.0004956358007588834, "loss": 5.5299, "mean_token_accuracy": 0.17496000975370407, "num_tokens": 16689683.0, "step": 7290 }, { "entropy": 5.727180767059326, "epoch": 0.7211348359035191, "grad_norm": 0.85546875, "learning_rate": 0.0004956288811490919, "loss": 5.4681, "mean_token_accuracy": 0.1759129658341408, "num_tokens": 16702193.0, "step": 7295 }, { "entropy": 5.556035900115967, "epoch": 0.7216291024120206, "grad_norm": 0.859375, "learning_rate": 0.0004956219561117955, "loss": 5.2556, "mean_token_accuracy": 0.19854270070791244, "num_tokens": 16713489.0, "step": 7300 }, { "entropy": 5.604660129547119, "epoch": 0.722123368920522, "grad_norm": 0.90234375, "learning_rate": 0.000495615025647165, "loss": 5.377, "mean_token_accuracy": 0.18506556898355483, "num_tokens": 16725103.0, "step": 7305 }, { "entropy": 5.617718458175659, "epoch": 0.7226176354290234, "grad_norm": 0.8515625, "learning_rate": 0.0004956080897553705, "loss": 5.3701, "mean_token_accuracy": 0.18173257559537886, "num_tokens": 16737056.0, "step": 7310 }, { "entropy": 5.6161576271057125, "epoch": 0.7231119019375247, "grad_norm": 0.91015625, "learning_rate": 0.0004956011484365829, "loss": 5.3165, "mean_token_accuracy": 0.19808637201786042, "num_tokens": 16747347.0, "step": 7315 }, { "entropy": 5.59601411819458, "epoch": 0.7236061684460261, "grad_norm": 0.96484375, "learning_rate": 0.0004955942016909728, "loss": 5.3376, "mean_token_accuracy": 0.19697173833847045, "num_tokens": 16758738.0, "step": 7320 }, { "entropy": 5.59306583404541, "epoch": 0.7241004349545275, "grad_norm": 0.953125, "learning_rate": 0.000495587249518711, "loss": 5.393, "mean_token_accuracy": 0.18150000721216203, "num_tokens": 16770867.0, "step": 7325 }, { "entropy": 5.678062820434571, "epoch": 0.7245947014630288, "grad_norm": 0.9375, "learning_rate": 0.0004955802919199687, "loss": 5.3392, "mean_token_accuracy": 0.191766719520092, "num_tokens": 16781537.0, "step": 7330 }, { "entropy": 5.66394076347351, "epoch": 0.7250889679715302, "grad_norm": 0.8984375, "learning_rate": 0.000495573328894917, "loss": 5.382, "mean_token_accuracy": 0.18313551992177962, "num_tokens": 16792250.0, "step": 7335 }, { "entropy": 5.581404447555542, "epoch": 0.7255832344800316, "grad_norm": 0.9296875, "learning_rate": 0.0004955663604437272, "loss": 5.3514, "mean_token_accuracy": 0.18616301715373992, "num_tokens": 16803673.0, "step": 7340 }, { "entropy": 5.653129053115845, "epoch": 0.726077500988533, "grad_norm": 0.8828125, "learning_rate": 0.0004955593865665707, "loss": 5.4437, "mean_token_accuracy": 0.18052296638488768, "num_tokens": 16815484.0, "step": 7345 }, { "entropy": 5.685440874099731, "epoch": 0.7265717674970344, "grad_norm": 0.83984375, "learning_rate": 0.000495552407263619, "loss": 5.3991, "mean_token_accuracy": 0.1836985781788826, "num_tokens": 16827097.0, "step": 7350 }, { "entropy": 5.707932758331299, "epoch": 0.7270660340055358, "grad_norm": 0.8828125, "learning_rate": 0.0004955454225350441, "loss": 5.3588, "mean_token_accuracy": 0.1861967071890831, "num_tokens": 16838235.0, "step": 7355 }, { "entropy": 5.636733818054199, "epoch": 0.7275603005140372, "grad_norm": 0.99609375, "learning_rate": 0.0004955384323810174, "loss": 5.3791, "mean_token_accuracy": 0.18858926743268967, "num_tokens": 16847831.0, "step": 7360 }, { "entropy": 5.652637672424317, "epoch": 0.7280545670225386, "grad_norm": 0.92578125, "learning_rate": 0.000495531436801711, "loss": 5.3855, "mean_token_accuracy": 0.17906744331121444, "num_tokens": 16859607.0, "step": 7365 }, { "entropy": 5.709359407424927, "epoch": 0.7285488335310399, "grad_norm": 0.9765625, "learning_rate": 0.0004955244357972972, "loss": 5.4519, "mean_token_accuracy": 0.17690177112817765, "num_tokens": 16869787.0, "step": 7370 }, { "entropy": 5.609931755065918, "epoch": 0.7290431000395413, "grad_norm": 0.99609375, "learning_rate": 0.000495517429367948, "loss": 5.3084, "mean_token_accuracy": 0.19051589518785478, "num_tokens": 16880819.0, "step": 7375 }, { "entropy": 5.691882133483887, "epoch": 0.7295373665480427, "grad_norm": 0.99609375, "learning_rate": 0.0004955104175138358, "loss": 5.4372, "mean_token_accuracy": 0.18292575925588608, "num_tokens": 16893247.0, "step": 7380 }, { "entropy": 5.650777673721313, "epoch": 0.7300316330565441, "grad_norm": 0.94921875, "learning_rate": 0.0004955034002351332, "loss": 5.3631, "mean_token_accuracy": 0.1871795192360878, "num_tokens": 16904469.0, "step": 7385 }, { "entropy": 5.640114116668701, "epoch": 0.7305258995650454, "grad_norm": 0.81640625, "learning_rate": 0.0004954963775320127, "loss": 5.5148, "mean_token_accuracy": 0.17951741963624954, "num_tokens": 16918433.0, "step": 7390 }, { "entropy": 5.670588541030884, "epoch": 0.7310201660735468, "grad_norm": 0.87890625, "learning_rate": 0.000495489349404647, "loss": 5.4193, "mean_token_accuracy": 0.18152516484260559, "num_tokens": 16930905.0, "step": 7395 }, { "entropy": 5.714716053009033, "epoch": 0.7315144325820483, "grad_norm": 0.8828125, "learning_rate": 0.0004954823158532093, "loss": 5.4449, "mean_token_accuracy": 0.179408660531044, "num_tokens": 16943461.0, "step": 7400 }, { "entropy": 5.60577244758606, "epoch": 0.7320086990905497, "grad_norm": 0.890625, "learning_rate": 0.0004954752768778723, "loss": 5.4063, "mean_token_accuracy": 0.1813630923628807, "num_tokens": 16955539.0, "step": 7405 }, { "entropy": 5.629944562911987, "epoch": 0.732502965599051, "grad_norm": 0.875, "learning_rate": 0.0004954682324788093, "loss": 5.3718, "mean_token_accuracy": 0.18606481850147247, "num_tokens": 16967508.0, "step": 7410 }, { "entropy": 5.631171083450317, "epoch": 0.7329972321075524, "grad_norm": 0.92578125, "learning_rate": 0.0004954611826561935, "loss": 5.3441, "mean_token_accuracy": 0.18730118572711946, "num_tokens": 16979033.0, "step": 7415 }, { "entropy": 5.618348455429077, "epoch": 0.7334914986160538, "grad_norm": 0.8359375, "learning_rate": 0.0004954541274101985, "loss": 5.3249, "mean_token_accuracy": 0.19124160408973695, "num_tokens": 16991874.0, "step": 7420 }, { "entropy": 5.679971408843994, "epoch": 0.7339857651245552, "grad_norm": 0.95703125, "learning_rate": 0.0004954470667409978, "loss": 5.4788, "mean_token_accuracy": 0.18305903524160386, "num_tokens": 17003160.0, "step": 7425 }, { "entropy": 5.655768489837646, "epoch": 0.7344800316330565, "grad_norm": 0.89453125, "learning_rate": 0.000495440000648765, "loss": 5.3463, "mean_token_accuracy": 0.18933854699134828, "num_tokens": 17014043.0, "step": 7430 }, { "entropy": 5.648313808441162, "epoch": 0.7349742981415579, "grad_norm": 0.921875, "learning_rate": 0.0004954329291336739, "loss": 5.3246, "mean_token_accuracy": 0.18792543560266495, "num_tokens": 17025117.0, "step": 7435 }, { "entropy": 5.600445652008057, "epoch": 0.7354685646500593, "grad_norm": 0.9453125, "learning_rate": 0.0004954258521958988, "loss": 5.3581, "mean_token_accuracy": 0.1867299497127533, "num_tokens": 17037366.0, "step": 7440 }, { "entropy": 5.6544536590576175, "epoch": 0.7359628311585606, "grad_norm": 0.84375, "learning_rate": 0.0004954187698356133, "loss": 5.4151, "mean_token_accuracy": 0.18628441244363786, "num_tokens": 17050683.0, "step": 7445 }, { "entropy": 5.546383380889893, "epoch": 0.7364570976670621, "grad_norm": 0.86328125, "learning_rate": 0.0004954116820529921, "loss": 5.3076, "mean_token_accuracy": 0.19968319088220596, "num_tokens": 17062403.0, "step": 7450 }, { "entropy": 5.603245067596435, "epoch": 0.7369513641755635, "grad_norm": 0.921875, "learning_rate": 0.0004954045888482091, "loss": 5.3234, "mean_token_accuracy": 0.19152262657880784, "num_tokens": 17072688.0, "step": 7455 }, { "entropy": 5.635401058197021, "epoch": 0.7374456306840649, "grad_norm": 0.98046875, "learning_rate": 0.0004953974902214391, "loss": 5.3693, "mean_token_accuracy": 0.1919065907597542, "num_tokens": 17084118.0, "step": 7460 }, { "entropy": 5.64586386680603, "epoch": 0.7379398971925663, "grad_norm": 0.94921875, "learning_rate": 0.0004953903861728567, "loss": 5.4066, "mean_token_accuracy": 0.18667644560337066, "num_tokens": 17095600.0, "step": 7465 }, { "entropy": 5.751896142959595, "epoch": 0.7384341637010676, "grad_norm": 0.90234375, "learning_rate": 0.0004953832767026365, "loss": 5.5098, "mean_token_accuracy": 0.18412562906742097, "num_tokens": 17107934.0, "step": 7470 }, { "entropy": 5.708953714370727, "epoch": 0.738928430209569, "grad_norm": 0.984375, "learning_rate": 0.0004953761618109535, "loss": 5.4422, "mean_token_accuracy": 0.1821732759475708, "num_tokens": 17119578.0, "step": 7475 }, { "entropy": 5.625956058502197, "epoch": 0.7394226967180704, "grad_norm": 1.0234375, "learning_rate": 0.0004953690414979828, "loss": 5.4305, "mean_token_accuracy": 0.18292962908744811, "num_tokens": 17129928.0, "step": 7480 }, { "entropy": 5.666420269012451, "epoch": 0.7399169632265717, "grad_norm": 0.94140625, "learning_rate": 0.0004953619157638995, "loss": 5.4178, "mean_token_accuracy": 0.18014979362487793, "num_tokens": 17141149.0, "step": 7485 }, { "entropy": 5.635677480697632, "epoch": 0.7404112297350731, "grad_norm": 0.9609375, "learning_rate": 0.0004953547846088789, "loss": 5.3328, "mean_token_accuracy": 0.18729939311742783, "num_tokens": 17152577.0, "step": 7490 }, { "entropy": 5.622769498825074, "epoch": 0.7409054962435745, "grad_norm": 0.91796875, "learning_rate": 0.0004953476480330964, "loss": 5.3314, "mean_token_accuracy": 0.18515427112579347, "num_tokens": 17163997.0, "step": 7495 }, { "entropy": 5.573915576934814, "epoch": 0.741399762752076, "grad_norm": 0.84375, "learning_rate": 0.0004953405060367276, "loss": 5.3017, "mean_token_accuracy": 0.1910776436328888, "num_tokens": 17175317.0, "step": 7500 }, { "entropy": 5.554392337799072, "epoch": 0.7418940292605773, "grad_norm": 0.91015625, "learning_rate": 0.0004953333586199481, "loss": 5.3889, "mean_token_accuracy": 0.19009806215763092, "num_tokens": 17185615.0, "step": 7505 }, { "entropy": 5.716742515563965, "epoch": 0.7423882957690787, "grad_norm": 0.89453125, "learning_rate": 0.0004953262057829338, "loss": 5.3896, "mean_token_accuracy": 0.17800748348236084, "num_tokens": 17198160.0, "step": 7510 }, { "entropy": 5.681596136093139, "epoch": 0.7428825622775801, "grad_norm": 0.9609375, "learning_rate": 0.0004953190475258607, "loss": 5.3613, "mean_token_accuracy": 0.1860250398516655, "num_tokens": 17209652.0, "step": 7515 }, { "entropy": 5.658831787109375, "epoch": 0.7433768287860815, "grad_norm": 0.98046875, "learning_rate": 0.0004953118838489049, "loss": 5.3704, "mean_token_accuracy": 0.18458689749240875, "num_tokens": 17220832.0, "step": 7520 }, { "entropy": 5.554180335998535, "epoch": 0.7438710952945828, "grad_norm": 0.953125, "learning_rate": 0.0004953047147522424, "loss": 5.3266, "mean_token_accuracy": 0.18533829599618912, "num_tokens": 17231952.0, "step": 7525 }, { "entropy": 5.577401971817016, "epoch": 0.7443653618030842, "grad_norm": 0.96484375, "learning_rate": 0.0004952975402360499, "loss": 5.3242, "mean_token_accuracy": 0.19227069467306138, "num_tokens": 17242705.0, "step": 7530 }, { "entropy": 5.740812826156616, "epoch": 0.7448596283115856, "grad_norm": 0.94140625, "learning_rate": 0.0004952903603005037, "loss": 5.4106, "mean_token_accuracy": 0.1806200325489044, "num_tokens": 17253946.0, "step": 7535 }, { "entropy": 5.670965099334717, "epoch": 0.745353894820087, "grad_norm": 0.95703125, "learning_rate": 0.0004952831749457804, "loss": 5.4374, "mean_token_accuracy": 0.1891773074865341, "num_tokens": 17265732.0, "step": 7540 }, { "entropy": 5.615409564971924, "epoch": 0.7458481613285883, "grad_norm": 0.93359375, "learning_rate": 0.0004952759841720569, "loss": 5.3481, "mean_token_accuracy": 0.1896295040845871, "num_tokens": 17277154.0, "step": 7545 }, { "entropy": 5.647601842880249, "epoch": 0.7463424278370897, "grad_norm": 0.97265625, "learning_rate": 0.0004952687879795101, "loss": 5.3933, "mean_token_accuracy": 0.1884130373597145, "num_tokens": 17288179.0, "step": 7550 }, { "entropy": 5.640401220321655, "epoch": 0.7468366943455912, "grad_norm": 0.91796875, "learning_rate": 0.0004952615863683167, "loss": 5.3685, "mean_token_accuracy": 0.18691795617341994, "num_tokens": 17299435.0, "step": 7555 }, { "entropy": 5.510975790023804, "epoch": 0.7473309608540926, "grad_norm": 0.9375, "learning_rate": 0.0004952543793386543, "loss": 5.2035, "mean_token_accuracy": 0.20728352069854736, "num_tokens": 17309442.0, "step": 7560 }, { "entropy": 5.666597747802735, "epoch": 0.7478252273625939, "grad_norm": 0.9609375, "learning_rate": 0.0004952471668906999, "loss": 5.4169, "mean_token_accuracy": 0.182900632917881, "num_tokens": 17322072.0, "step": 7565 }, { "entropy": 5.625790929794311, "epoch": 0.7483194938710953, "grad_norm": 0.9296875, "learning_rate": 0.0004952399490246311, "loss": 5.3389, "mean_token_accuracy": 0.18575433939695357, "num_tokens": 17333458.0, "step": 7570 }, { "entropy": 5.575311517715454, "epoch": 0.7488137603795967, "grad_norm": 0.8671875, "learning_rate": 0.0004952327257406253, "loss": 5.2998, "mean_token_accuracy": 0.19034653753042222, "num_tokens": 17344319.0, "step": 7575 }, { "entropy": 5.662009334564209, "epoch": 0.749308026888098, "grad_norm": 0.86328125, "learning_rate": 0.0004952254970388603, "loss": 5.4092, "mean_token_accuracy": 0.18748052269220353, "num_tokens": 17357016.0, "step": 7580 }, { "entropy": 5.578349685668945, "epoch": 0.7498022933965994, "grad_norm": 0.875, "learning_rate": 0.000495218262919514, "loss": 5.2992, "mean_token_accuracy": 0.192673023045063, "num_tokens": 17368574.0, "step": 7585 }, { "entropy": 5.561223030090332, "epoch": 0.7502965599051008, "grad_norm": 0.9375, "learning_rate": 0.0004952110233827642, "loss": 5.2655, "mean_token_accuracy": 0.19406563341617583, "num_tokens": 17379858.0, "step": 7590 }, { "entropy": 5.685211038589477, "epoch": 0.7507908264136022, "grad_norm": 0.86328125, "learning_rate": 0.0004952037784287891, "loss": 5.4083, "mean_token_accuracy": 0.18761044293642043, "num_tokens": 17391543.0, "step": 7595 }, { "entropy": 5.640193128585816, "epoch": 0.7512850929221035, "grad_norm": 0.921875, "learning_rate": 0.0004951965280577668, "loss": 5.356, "mean_token_accuracy": 0.19097713977098466, "num_tokens": 17403193.0, "step": 7600 }, { "entropy": 5.6451092720031735, "epoch": 0.751779359430605, "grad_norm": 0.92578125, "learning_rate": 0.0004951892722698759, "loss": 5.477, "mean_token_accuracy": 0.18541908264160156, "num_tokens": 17415866.0, "step": 7605 }, { "entropy": 5.59730076789856, "epoch": 0.7522736259391064, "grad_norm": 0.89453125, "learning_rate": 0.0004951820110652946, "loss": 5.3218, "mean_token_accuracy": 0.18783312141895295, "num_tokens": 17427880.0, "step": 7610 }, { "entropy": 5.614524459838867, "epoch": 0.7527678924476078, "grad_norm": 0.95703125, "learning_rate": 0.0004951747444442017, "loss": 5.3421, "mean_token_accuracy": 0.18902167677879333, "num_tokens": 17440295.0, "step": 7615 }, { "entropy": 5.592320156097412, "epoch": 0.7532621589561092, "grad_norm": 0.94140625, "learning_rate": 0.0004951674724067759, "loss": 5.3898, "mean_token_accuracy": 0.18864046186208724, "num_tokens": 17451636.0, "step": 7620 }, { "entropy": 5.670377159118653, "epoch": 0.7537564254646105, "grad_norm": 0.98828125, "learning_rate": 0.0004951601949531962, "loss": 5.4419, "mean_token_accuracy": 0.18559939861297609, "num_tokens": 17464376.0, "step": 7625 }, { "entropy": 5.613880634307861, "epoch": 0.7542506919731119, "grad_norm": 0.90625, "learning_rate": 0.0004951529120836416, "loss": 5.2935, "mean_token_accuracy": 0.18533819019794465, "num_tokens": 17475098.0, "step": 7630 }, { "entropy": 5.533512926101684, "epoch": 0.7547449584816133, "grad_norm": 0.90625, "learning_rate": 0.0004951456237982911, "loss": 5.2922, "mean_token_accuracy": 0.19040312767028808, "num_tokens": 17486176.0, "step": 7635 }, { "entropy": 5.579923915863037, "epoch": 0.7552392249901146, "grad_norm": 0.92578125, "learning_rate": 0.0004951383300973242, "loss": 5.359, "mean_token_accuracy": 0.19203363358974457, "num_tokens": 17498386.0, "step": 7640 }, { "entropy": 5.625037717819214, "epoch": 0.755733491498616, "grad_norm": 0.98828125, "learning_rate": 0.0004951310309809201, "loss": 5.4066, "mean_token_accuracy": 0.18550383448600768, "num_tokens": 17510409.0, "step": 7645 }, { "entropy": 5.609627103805542, "epoch": 0.7562277580071174, "grad_norm": 0.98046875, "learning_rate": 0.0004951237264492585, "loss": 5.328, "mean_token_accuracy": 0.1920852020382881, "num_tokens": 17521803.0, "step": 7650 }, { "entropy": 5.6035362720489506, "epoch": 0.7567220245156189, "grad_norm": 0.92578125, "learning_rate": 0.0004951164165025192, "loss": 5.3905, "mean_token_accuracy": 0.1891407772898674, "num_tokens": 17532974.0, "step": 7655 }, { "entropy": 5.63882303237915, "epoch": 0.7572162910241202, "grad_norm": 0.9453125, "learning_rate": 0.0004951091011408818, "loss": 5.369, "mean_token_accuracy": 0.19017153829336167, "num_tokens": 17544309.0, "step": 7660 }, { "entropy": 5.584759712219238, "epoch": 0.7577105575326216, "grad_norm": 0.91796875, "learning_rate": 0.0004951017803645264, "loss": 5.3019, "mean_token_accuracy": 0.1934806227684021, "num_tokens": 17555395.0, "step": 7665 }, { "entropy": 5.6065065383911135, "epoch": 0.758204824041123, "grad_norm": 0.99609375, "learning_rate": 0.000495094454173633, "loss": 5.2856, "mean_token_accuracy": 0.18975486606359482, "num_tokens": 17567434.0, "step": 7670 }, { "entropy": 5.701010847091675, "epoch": 0.7586990905496244, "grad_norm": 0.96484375, "learning_rate": 0.0004950871225683819, "loss": 5.4174, "mean_token_accuracy": 0.18519986867904664, "num_tokens": 17578381.0, "step": 7675 }, { "entropy": 5.62861123085022, "epoch": 0.7591933570581257, "grad_norm": 0.828125, "learning_rate": 0.0004950797855489535, "loss": 5.3663, "mean_token_accuracy": 0.18444519490003586, "num_tokens": 17589732.0, "step": 7680 }, { "entropy": 5.662878513336182, "epoch": 0.7596876235666271, "grad_norm": 0.97265625, "learning_rate": 0.0004950724431155283, "loss": 5.309, "mean_token_accuracy": 0.18932354003190993, "num_tokens": 17601092.0, "step": 7685 }, { "entropy": 5.583770656585694, "epoch": 0.7601818900751285, "grad_norm": 0.88671875, "learning_rate": 0.0004950650952682867, "loss": 5.4301, "mean_token_accuracy": 0.18962716013193132, "num_tokens": 17613268.0, "step": 7690 }, { "entropy": 5.6369586944580075, "epoch": 0.7606761565836299, "grad_norm": 0.9375, "learning_rate": 0.0004950577420074098, "loss": 5.3128, "mean_token_accuracy": 0.18609803766012192, "num_tokens": 17623500.0, "step": 7695 }, { "entropy": 5.686563491821289, "epoch": 0.7611704230921312, "grad_norm": 0.90625, "learning_rate": 0.0004950503833330781, "loss": 5.5244, "mean_token_accuracy": 0.17876177579164504, "num_tokens": 17636151.0, "step": 7700 }, { "entropy": 5.655415630340576, "epoch": 0.7616646896006327, "grad_norm": 0.92578125, "learning_rate": 0.0004950430192454729, "loss": 5.394, "mean_token_accuracy": 0.1838794082403183, "num_tokens": 17648392.0, "step": 7705 }, { "entropy": 5.638415193557739, "epoch": 0.7621589561091341, "grad_norm": 0.8984375, "learning_rate": 0.0004950356497447754, "loss": 5.3362, "mean_token_accuracy": 0.1847740277647972, "num_tokens": 17659777.0, "step": 7710 }, { "entropy": 5.664025926589966, "epoch": 0.7626532226176355, "grad_norm": 0.90234375, "learning_rate": 0.0004950282748311666, "loss": 5.4262, "mean_token_accuracy": 0.18258604556322097, "num_tokens": 17671986.0, "step": 7715 }, { "entropy": 5.615134811401367, "epoch": 0.7631474891261368, "grad_norm": 0.95703125, "learning_rate": 0.0004950208945048283, "loss": 5.3427, "mean_token_accuracy": 0.1897163137793541, "num_tokens": 17683740.0, "step": 7720 }, { "entropy": 5.64289026260376, "epoch": 0.7636417556346382, "grad_norm": 0.859375, "learning_rate": 0.0004950135087659417, "loss": 5.4287, "mean_token_accuracy": 0.1862667366862297, "num_tokens": 17696034.0, "step": 7725 }, { "entropy": 5.603719854354859, "epoch": 0.7641360221431396, "grad_norm": 0.875, "learning_rate": 0.0004950061176146887, "loss": 5.3584, "mean_token_accuracy": 0.19093922078609465, "num_tokens": 17707783.0, "step": 7730 }, { "entropy": 5.589991044998169, "epoch": 0.764630288651641, "grad_norm": 1.0078125, "learning_rate": 0.0004949987210512511, "loss": 5.321, "mean_token_accuracy": 0.19064203202724456, "num_tokens": 17718127.0, "step": 7735 }, { "entropy": 5.644371891021729, "epoch": 0.7651245551601423, "grad_norm": 0.9140625, "learning_rate": 0.0004949913190758109, "loss": 5.404, "mean_token_accuracy": 0.17706767320632935, "num_tokens": 17729798.0, "step": 7740 }, { "entropy": 5.6412557601928714, "epoch": 0.7656188216686437, "grad_norm": 0.89453125, "learning_rate": 0.0004949839116885499, "loss": 5.3605, "mean_token_accuracy": 0.1837826982140541, "num_tokens": 17741989.0, "step": 7745 }, { "entropy": 5.622970628738403, "epoch": 0.7661130881771451, "grad_norm": 0.9375, "learning_rate": 0.0004949764988896508, "loss": 5.3921, "mean_token_accuracy": 0.18503157943487167, "num_tokens": 17753737.0, "step": 7750 }, { "entropy": 5.574993324279785, "epoch": 0.7666073546856464, "grad_norm": 1.0, "learning_rate": 0.0004949690806792955, "loss": 5.2977, "mean_token_accuracy": 0.19420368671417237, "num_tokens": 17764158.0, "step": 7755 }, { "entropy": 5.658957290649414, "epoch": 0.7671016211941479, "grad_norm": 0.921875, "learning_rate": 0.0004949616570576668, "loss": 5.399, "mean_token_accuracy": 0.18692460805177688, "num_tokens": 17775878.0, "step": 7760 }, { "entropy": 5.6223523139953615, "epoch": 0.7675958877026493, "grad_norm": 1.015625, "learning_rate": 0.0004949542280249473, "loss": 5.3023, "mean_token_accuracy": 0.19324052482843398, "num_tokens": 17786107.0, "step": 7765 }, { "entropy": 5.583667802810669, "epoch": 0.7680901542111507, "grad_norm": 0.9140625, "learning_rate": 0.0004949467935813196, "loss": 5.37, "mean_token_accuracy": 0.18709104359149933, "num_tokens": 17798470.0, "step": 7770 }, { "entropy": 5.620779323577881, "epoch": 0.768584420719652, "grad_norm": 0.796875, "learning_rate": 0.0004949393537269666, "loss": 5.3673, "mean_token_accuracy": 0.1873188868165016, "num_tokens": 17811125.0, "step": 7775 }, { "entropy": 5.6143879890441895, "epoch": 0.7690786872281534, "grad_norm": 0.96484375, "learning_rate": 0.0004949319084620714, "loss": 5.2521, "mean_token_accuracy": 0.1914015978574753, "num_tokens": 17821535.0, "step": 7780 }, { "entropy": 5.6754443645477295, "epoch": 0.7695729537366548, "grad_norm": 1.0, "learning_rate": 0.000494924457786817, "loss": 5.4878, "mean_token_accuracy": 0.1810181051492691, "num_tokens": 17833493.0, "step": 7785 }, { "entropy": 5.719379329681397, "epoch": 0.7700672202451562, "grad_norm": 0.91796875, "learning_rate": 0.0004949170017013871, "loss": 5.4524, "mean_token_accuracy": 0.1836404100060463, "num_tokens": 17844705.0, "step": 7790 }, { "entropy": 5.6904033660888675, "epoch": 0.7705614867536575, "grad_norm": 0.96484375, "learning_rate": 0.0004949095402059646, "loss": 5.4407, "mean_token_accuracy": 0.1821795344352722, "num_tokens": 17856088.0, "step": 7795 }, { "entropy": 5.706732082366943, "epoch": 0.7710557532621589, "grad_norm": 0.9453125, "learning_rate": 0.0004949020733007334, "loss": 5.4064, "mean_token_accuracy": 0.18194716572761535, "num_tokens": 17867602.0, "step": 7800 }, { "entropy": 5.689646673202515, "epoch": 0.7715500197706603, "grad_norm": 0.8984375, "learning_rate": 0.000494894600985877, "loss": 5.46, "mean_token_accuracy": 0.1779428094625473, "num_tokens": 17880487.0, "step": 7805 }, { "entropy": 5.632900428771973, "epoch": 0.7720442862791618, "grad_norm": 0.90234375, "learning_rate": 0.0004948871232615794, "loss": 5.3897, "mean_token_accuracy": 0.18834273219108583, "num_tokens": 17891690.0, "step": 7810 }, { "entropy": 5.695949745178223, "epoch": 0.7725385527876631, "grad_norm": 1.0859375, "learning_rate": 0.0004948796401280244, "loss": 5.4364, "mean_token_accuracy": 0.1842002496123314, "num_tokens": 17903165.0, "step": 7815 }, { "entropy": 5.649667501449585, "epoch": 0.7730328192961645, "grad_norm": 0.95703125, "learning_rate": 0.0004948721515853962, "loss": 5.2706, "mean_token_accuracy": 0.19637836366891862, "num_tokens": 17914492.0, "step": 7820 }, { "entropy": 5.637302827835083, "epoch": 0.7735270858046659, "grad_norm": 0.953125, "learning_rate": 0.0004948646576338789, "loss": 5.3616, "mean_token_accuracy": 0.17770011723041534, "num_tokens": 17926231.0, "step": 7825 }, { "entropy": 5.618101119995117, "epoch": 0.7740213523131673, "grad_norm": 0.97265625, "learning_rate": 0.000494857158273657, "loss": 5.3274, "mean_token_accuracy": 0.19011891782283782, "num_tokens": 17937167.0, "step": 7830 }, { "entropy": 5.6176682472229, "epoch": 0.7745156188216686, "grad_norm": 0.890625, "learning_rate": 0.0004948496535049148, "loss": 5.4101, "mean_token_accuracy": 0.18628868758678435, "num_tokens": 17948939.0, "step": 7835 }, { "entropy": 5.603729629516602, "epoch": 0.77500988533017, "grad_norm": 0.98046875, "learning_rate": 0.000494842143327837, "loss": 5.2061, "mean_token_accuracy": 0.20121184289455413, "num_tokens": 17959250.0, "step": 7840 }, { "entropy": 5.602400016784668, "epoch": 0.7755041518386714, "grad_norm": 0.91796875, "learning_rate": 0.0004948346277426084, "loss": 5.4368, "mean_token_accuracy": 0.18265139162540436, "num_tokens": 17970191.0, "step": 7845 }, { "entropy": 5.665700626373291, "epoch": 0.7759984183471728, "grad_norm": 0.8984375, "learning_rate": 0.000494827106749414, "loss": 5.3456, "mean_token_accuracy": 0.189851775765419, "num_tokens": 17982114.0, "step": 7850 }, { "entropy": 5.754805660247802, "epoch": 0.7764926848556741, "grad_norm": 0.953125, "learning_rate": 0.0004948195803484385, "loss": 5.4383, "mean_token_accuracy": 0.18550963699817657, "num_tokens": 17994066.0, "step": 7855 }, { "entropy": 5.611971855163574, "epoch": 0.7769869513641756, "grad_norm": 0.9453125, "learning_rate": 0.0004948120485398673, "loss": 5.3695, "mean_token_accuracy": 0.18842156380414962, "num_tokens": 18005406.0, "step": 7860 }, { "entropy": 5.595920133590698, "epoch": 0.777481217872677, "grad_norm": 1.046875, "learning_rate": 0.0004948045113238856, "loss": 5.3744, "mean_token_accuracy": 0.18644328266382218, "num_tokens": 18016773.0, "step": 7865 }, { "entropy": 5.681191396713257, "epoch": 0.7779754843811784, "grad_norm": 0.86328125, "learning_rate": 0.0004947969687006787, "loss": 5.4236, "mean_token_accuracy": 0.18297782093286513, "num_tokens": 18028682.0, "step": 7870 }, { "entropy": 5.6787935256958, "epoch": 0.7784697508896797, "grad_norm": 0.8984375, "learning_rate": 0.0004947894206704324, "loss": 5.3808, "mean_token_accuracy": 0.18711536079645158, "num_tokens": 18039525.0, "step": 7875 }, { "entropy": 5.621923160552979, "epoch": 0.7789640173981811, "grad_norm": 0.9375, "learning_rate": 0.0004947818672333323, "loss": 5.362, "mean_token_accuracy": 0.18554842621088027, "num_tokens": 18049918.0, "step": 7880 }, { "entropy": 5.694091558456421, "epoch": 0.7794582839066825, "grad_norm": 0.9375, "learning_rate": 0.000494774308389564, "loss": 5.4094, "mean_token_accuracy": 0.1820623204112053, "num_tokens": 18061019.0, "step": 7885 }, { "entropy": 5.618366622924805, "epoch": 0.7799525504151839, "grad_norm": 0.98046875, "learning_rate": 0.0004947667441393138, "loss": 5.3493, "mean_token_accuracy": 0.1908293753862381, "num_tokens": 18072123.0, "step": 7890 }, { "entropy": 5.591029024124145, "epoch": 0.7804468169236852, "grad_norm": 0.93359375, "learning_rate": 0.0004947591744827674, "loss": 5.3542, "mean_token_accuracy": 0.17915802597999572, "num_tokens": 18083354.0, "step": 7895 }, { "entropy": 5.711638164520264, "epoch": 0.7809410834321866, "grad_norm": 1.0234375, "learning_rate": 0.0004947515994201113, "loss": 5.4747, "mean_token_accuracy": 0.18419132083654405, "num_tokens": 18094188.0, "step": 7900 }, { "entropy": 5.673106384277344, "epoch": 0.781435349940688, "grad_norm": 1.1171875, "learning_rate": 0.0004947440189515318, "loss": 5.3719, "mean_token_accuracy": 0.1856766924262047, "num_tokens": 18106198.0, "step": 7905 }, { "entropy": 5.643203496932983, "epoch": 0.7819296164491895, "grad_norm": 0.96484375, "learning_rate": 0.0004947364330772154, "loss": 5.3283, "mean_token_accuracy": 0.18897366821765899, "num_tokens": 18117137.0, "step": 7910 }, { "entropy": 5.587151050567627, "epoch": 0.7824238829576908, "grad_norm": 1.0625, "learning_rate": 0.0004947288417973486, "loss": 5.3878, "mean_token_accuracy": 0.1843805879354477, "num_tokens": 18127341.0, "step": 7915 }, { "entropy": 5.633343601226807, "epoch": 0.7829181494661922, "grad_norm": 0.96875, "learning_rate": 0.0004947212451121182, "loss": 5.3189, "mean_token_accuracy": 0.18572929352521897, "num_tokens": 18138333.0, "step": 7920 }, { "entropy": 5.704879856109619, "epoch": 0.7834124159746936, "grad_norm": 0.8984375, "learning_rate": 0.000494713643021711, "loss": 5.5817, "mean_token_accuracy": 0.17364790439605712, "num_tokens": 18150961.0, "step": 7925 }, { "entropy": 5.688880252838135, "epoch": 0.783906682483195, "grad_norm": 0.81640625, "learning_rate": 0.0004947060355263142, "loss": 5.391, "mean_token_accuracy": 0.18495674431324005, "num_tokens": 18162604.0, "step": 7930 }, { "entropy": 5.655614900588989, "epoch": 0.7844009489916963, "grad_norm": 0.88671875, "learning_rate": 0.0004946984226261149, "loss": 5.4101, "mean_token_accuracy": 0.18590252846479416, "num_tokens": 18174202.0, "step": 7935 }, { "entropy": 5.703915071487427, "epoch": 0.7848952155001977, "grad_norm": 1.0390625, "learning_rate": 0.0004946908043213001, "loss": 5.4156, "mean_token_accuracy": 0.18262964487075806, "num_tokens": 18185942.0, "step": 7940 }, { "entropy": 5.642177152633667, "epoch": 0.7853894820086991, "grad_norm": 0.91796875, "learning_rate": 0.0004946831806120576, "loss": 5.3359, "mean_token_accuracy": 0.18562852293252946, "num_tokens": 18198897.0, "step": 7945 }, { "entropy": 5.61653881072998, "epoch": 0.7858837485172004, "grad_norm": 0.91015625, "learning_rate": 0.0004946755514985748, "loss": 5.2644, "mean_token_accuracy": 0.19508497267961503, "num_tokens": 18211439.0, "step": 7950 }, { "entropy": 5.545697498321533, "epoch": 0.7863780150257018, "grad_norm": 0.95703125, "learning_rate": 0.0004946679169810392, "loss": 5.2939, "mean_token_accuracy": 0.19510289132595063, "num_tokens": 18221864.0, "step": 7955 }, { "entropy": 5.603418350219727, "epoch": 0.7868722815342032, "grad_norm": 0.91015625, "learning_rate": 0.000494660277059639, "loss": 5.4288, "mean_token_accuracy": 0.18460323065519332, "num_tokens": 18234005.0, "step": 7960 }, { "entropy": 5.592285585403443, "epoch": 0.7873665480427047, "grad_norm": 0.98828125, "learning_rate": 0.0004946526317345617, "loss": 5.307, "mean_token_accuracy": 0.19365054368972778, "num_tokens": 18246804.0, "step": 7965 }, { "entropy": 5.630798196792602, "epoch": 0.787860814551206, "grad_norm": 0.84375, "learning_rate": 0.0004946449810059957, "loss": 5.3275, "mean_token_accuracy": 0.19084322303533555, "num_tokens": 18259192.0, "step": 7970 }, { "entropy": 5.632711124420166, "epoch": 0.7883550810597074, "grad_norm": 0.8203125, "learning_rate": 0.0004946373248741289, "loss": 5.3537, "mean_token_accuracy": 0.18907561898231506, "num_tokens": 18271073.0, "step": 7975 }, { "entropy": 5.624254512786865, "epoch": 0.7888493475682088, "grad_norm": 1.0234375, "learning_rate": 0.00049462966333915, "loss": 5.3487, "mean_token_accuracy": 0.1897532895207405, "num_tokens": 18281650.0, "step": 7980 }, { "entropy": 5.653125953674317, "epoch": 0.7893436140767102, "grad_norm": 1.0, "learning_rate": 0.0004946219964012473, "loss": 5.3261, "mean_token_accuracy": 0.18969887495040894, "num_tokens": 18292217.0, "step": 7985 }, { "entropy": 5.590175294876099, "epoch": 0.7898378805852115, "grad_norm": 0.8203125, "learning_rate": 0.0004946143240606095, "loss": 5.3237, "mean_token_accuracy": 0.19149772822856903, "num_tokens": 18305210.0, "step": 7990 }, { "entropy": 5.594923591613769, "epoch": 0.7903321470937129, "grad_norm": 0.9453125, "learning_rate": 0.0004946066463174251, "loss": 5.2793, "mean_token_accuracy": 0.19526583105325698, "num_tokens": 18316418.0, "step": 7995 }, { "entropy": 5.493608999252319, "epoch": 0.7908264136022143, "grad_norm": 0.921875, "learning_rate": 0.0004945989631718831, "loss": 5.351, "mean_token_accuracy": 0.19271128624677658, "num_tokens": 18328637.0, "step": 8000 }, { "entropy": 5.612703895568847, "epoch": 0.7913206801107157, "grad_norm": 0.83203125, "learning_rate": 0.0004945912746241727, "loss": 5.2617, "mean_token_accuracy": 0.19455379992723465, "num_tokens": 18340292.0, "step": 8005 }, { "entropy": 5.635916376113892, "epoch": 0.791814946619217, "grad_norm": 0.94921875, "learning_rate": 0.0004945835806744828, "loss": 5.3138, "mean_token_accuracy": 0.19668588638305665, "num_tokens": 18350784.0, "step": 8010 }, { "entropy": 5.688429260253907, "epoch": 0.7923092131277185, "grad_norm": 0.8828125, "learning_rate": 0.0004945758813230028, "loss": 5.4009, "mean_token_accuracy": 0.18494396209716796, "num_tokens": 18363147.0, "step": 8015 }, { "entropy": 5.617534065246582, "epoch": 0.7928034796362199, "grad_norm": 0.91015625, "learning_rate": 0.000494568176569922, "loss": 5.3523, "mean_token_accuracy": 0.18822791874408723, "num_tokens": 18374152.0, "step": 8020 }, { "entropy": 5.610652446746826, "epoch": 0.7932977461447213, "grad_norm": 0.8828125, "learning_rate": 0.00049456046641543, "loss": 5.2671, "mean_token_accuracy": 0.19345310926437378, "num_tokens": 18385321.0, "step": 8025 }, { "entropy": 5.621513986587525, "epoch": 0.7937920126532226, "grad_norm": 0.98828125, "learning_rate": 0.0004945527508597165, "loss": 5.358, "mean_token_accuracy": 0.1831709623336792, "num_tokens": 18397072.0, "step": 8030 }, { "entropy": 5.596259641647339, "epoch": 0.794286279161724, "grad_norm": 0.91796875, "learning_rate": 0.0004945450299029713, "loss": 5.2939, "mean_token_accuracy": 0.18961886018514634, "num_tokens": 18408172.0, "step": 8035 }, { "entropy": 5.648156023025512, "epoch": 0.7947805456702254, "grad_norm": 0.85546875, "learning_rate": 0.0004945373035453842, "loss": 5.2987, "mean_token_accuracy": 0.19141530096530915, "num_tokens": 18419350.0, "step": 8040 }, { "entropy": 5.581797885894775, "epoch": 0.7952748121787268, "grad_norm": 0.9296875, "learning_rate": 0.0004945295717871454, "loss": 5.3434, "mean_token_accuracy": 0.1886121228337288, "num_tokens": 18430907.0, "step": 8045 }, { "entropy": 5.628627920150757, "epoch": 0.7957690786872281, "grad_norm": 1.0234375, "learning_rate": 0.0004945218346284451, "loss": 5.3331, "mean_token_accuracy": 0.19651662558317184, "num_tokens": 18441167.0, "step": 8050 }, { "entropy": 5.630374336242676, "epoch": 0.7962633451957295, "grad_norm": 1.0859375, "learning_rate": 0.0004945140920694736, "loss": 5.2474, "mean_token_accuracy": 0.200337715446949, "num_tokens": 18452025.0, "step": 8055 }, { "entropy": 5.622188377380371, "epoch": 0.7967576117042309, "grad_norm": 0.9375, "learning_rate": 0.0004945063441104214, "loss": 5.4825, "mean_token_accuracy": 0.17581942975521087, "num_tokens": 18464305.0, "step": 8060 }, { "entropy": 5.611766195297241, "epoch": 0.7972518782127324, "grad_norm": 0.9375, "learning_rate": 0.0004944985907514791, "loss": 5.3915, "mean_token_accuracy": 0.19027776420116424, "num_tokens": 18476217.0, "step": 8065 }, { "entropy": 5.652491331100464, "epoch": 0.7977461447212337, "grad_norm": 0.9609375, "learning_rate": 0.0004944908319928372, "loss": 5.3508, "mean_token_accuracy": 0.18386948108673096, "num_tokens": 18486967.0, "step": 8070 }, { "entropy": 5.636234140396118, "epoch": 0.7982404112297351, "grad_norm": 1.0, "learning_rate": 0.0004944830678346871, "loss": 5.3276, "mean_token_accuracy": 0.18290115594863893, "num_tokens": 18498918.0, "step": 8075 }, { "entropy": 5.625789737701416, "epoch": 0.7987346777382365, "grad_norm": 0.99609375, "learning_rate": 0.0004944752982772194, "loss": 5.3169, "mean_token_accuracy": 0.1963883027434349, "num_tokens": 18509424.0, "step": 8080 }, { "entropy": 5.539810562133789, "epoch": 0.7992289442467378, "grad_norm": 0.97265625, "learning_rate": 0.0004944675233206252, "loss": 5.259, "mean_token_accuracy": 0.19396135360002517, "num_tokens": 18520444.0, "step": 8085 }, { "entropy": 5.574186563491821, "epoch": 0.7997232107552392, "grad_norm": 0.921875, "learning_rate": 0.000494459742965096, "loss": 5.3206, "mean_token_accuracy": 0.1910506710410118, "num_tokens": 18531874.0, "step": 8090 }, { "entropy": 5.649960136413574, "epoch": 0.8002174772637406, "grad_norm": 0.9765625, "learning_rate": 0.000494451957210823, "loss": 5.4013, "mean_token_accuracy": 0.18565160483121873, "num_tokens": 18542492.0, "step": 8095 }, { "entropy": 5.712299823760986, "epoch": 0.800711743772242, "grad_norm": 1.2265625, "learning_rate": 0.0004944441660579979, "loss": 5.4498, "mean_token_accuracy": 0.17808727622032167, "num_tokens": 18554477.0, "step": 8100 }, { "entropy": 5.664086580276489, "epoch": 0.8012060102807433, "grad_norm": 0.93359375, "learning_rate": 0.0004944363695068121, "loss": 5.3157, "mean_token_accuracy": 0.19278150647878647, "num_tokens": 18565416.0, "step": 8105 }, { "entropy": 5.616779136657715, "epoch": 0.8017002767892447, "grad_norm": 0.9765625, "learning_rate": 0.0004944285675574576, "loss": 5.283, "mean_token_accuracy": 0.1878065809607506, "num_tokens": 18575949.0, "step": 8110 }, { "entropy": 5.574770545959472, "epoch": 0.8021945432977462, "grad_norm": 0.921875, "learning_rate": 0.0004944207602101265, "loss": 5.3966, "mean_token_accuracy": 0.18741019070148468, "num_tokens": 18588177.0, "step": 8115 }, { "entropy": 5.60226993560791, "epoch": 0.8026888098062476, "grad_norm": 0.94140625, "learning_rate": 0.0004944129474650104, "loss": 5.2522, "mean_token_accuracy": 0.18760309368371964, "num_tokens": 18599112.0, "step": 8120 }, { "entropy": 5.493180608749389, "epoch": 0.803183076314749, "grad_norm": 0.9140625, "learning_rate": 0.000494405129322302, "loss": 5.202, "mean_token_accuracy": 0.20194268822669983, "num_tokens": 18610432.0, "step": 8125 }, { "entropy": 5.633407306671143, "epoch": 0.8036773428232503, "grad_norm": 1.0078125, "learning_rate": 0.0004943973057821931, "loss": 5.3108, "mean_token_accuracy": 0.18266377747058868, "num_tokens": 18621739.0, "step": 8130 }, { "entropy": 5.685321569442749, "epoch": 0.8041716093317517, "grad_norm": 0.93359375, "learning_rate": 0.0004943894768448768, "loss": 5.3028, "mean_token_accuracy": 0.1919276937842369, "num_tokens": 18631983.0, "step": 8135 }, { "entropy": 5.631972599029541, "epoch": 0.8046658758402531, "grad_norm": 0.9375, "learning_rate": 0.000494381642510545, "loss": 5.4033, "mean_token_accuracy": 0.17982396781444548, "num_tokens": 18643507.0, "step": 8140 }, { "entropy": 5.679097414016724, "epoch": 0.8051601423487544, "grad_norm": 0.9921875, "learning_rate": 0.0004943738027793909, "loss": 5.4433, "mean_token_accuracy": 0.18832522183656691, "num_tokens": 18654516.0, "step": 8145 }, { "entropy": 5.678982162475586, "epoch": 0.8056544088572558, "grad_norm": 0.88671875, "learning_rate": 0.0004943659576516072, "loss": 5.4349, "mean_token_accuracy": 0.1815408930182457, "num_tokens": 18666855.0, "step": 8150 }, { "entropy": 5.639753818511963, "epoch": 0.8061486753657572, "grad_norm": 0.8671875, "learning_rate": 0.0004943581071273869, "loss": 5.3882, "mean_token_accuracy": 0.1815982162952423, "num_tokens": 18679105.0, "step": 8155 }, { "entropy": 5.673794412612915, "epoch": 0.8066429418742586, "grad_norm": 0.87109375, "learning_rate": 0.0004943502512069232, "loss": 5.467, "mean_token_accuracy": 0.1884306862950325, "num_tokens": 18691349.0, "step": 8160 }, { "entropy": 5.72624101638794, "epoch": 0.8071372083827599, "grad_norm": 0.96875, "learning_rate": 0.0004943423898904092, "loss": 5.4767, "mean_token_accuracy": 0.18212517201900483, "num_tokens": 18703773.0, "step": 8165 }, { "entropy": 5.666822385787964, "epoch": 0.8076314748912614, "grad_norm": 0.84375, "learning_rate": 0.0004943345231780385, "loss": 5.3315, "mean_token_accuracy": 0.1867762491106987, "num_tokens": 18715281.0, "step": 8170 }, { "entropy": 5.634292554855347, "epoch": 0.8081257413997628, "grad_norm": 0.98046875, "learning_rate": 0.0004943266510700043, "loss": 5.3309, "mean_token_accuracy": 0.1898277595639229, "num_tokens": 18726446.0, "step": 8175 }, { "entropy": 5.547077798843384, "epoch": 0.8086200079082642, "grad_norm": 0.9921875, "learning_rate": 0.0004943187735665007, "loss": 5.1949, "mean_token_accuracy": 0.20422890037298203, "num_tokens": 18737348.0, "step": 8180 }, { "entropy": 5.6050046443939205, "epoch": 0.8091142744167655, "grad_norm": 0.9375, "learning_rate": 0.0004943108906677211, "loss": 5.3068, "mean_token_accuracy": 0.19023669362068177, "num_tokens": 18748921.0, "step": 8185 }, { "entropy": 5.640390396118164, "epoch": 0.8096085409252669, "grad_norm": 0.96875, "learning_rate": 0.0004943030023738595, "loss": 5.3007, "mean_token_accuracy": 0.19515839517116546, "num_tokens": 18761252.0, "step": 8190 }, { "entropy": 5.6041707515716555, "epoch": 0.8101028074337683, "grad_norm": 0.8828125, "learning_rate": 0.0004942951086851102, "loss": 5.2837, "mean_token_accuracy": 0.19014440327882767, "num_tokens": 18772915.0, "step": 8195 }, { "entropy": 5.591022872924805, "epoch": 0.8105970739422697, "grad_norm": 1.0234375, "learning_rate": 0.0004942872096016671, "loss": 5.3158, "mean_token_accuracy": 0.19185126721858978, "num_tokens": 18783533.0, "step": 8200 }, { "entropy": 5.582116746902466, "epoch": 0.811091340450771, "grad_norm": 0.9140625, "learning_rate": 0.0004942793051237247, "loss": 5.3016, "mean_token_accuracy": 0.18552099466323851, "num_tokens": 18795068.0, "step": 8205 }, { "entropy": 5.697311162948608, "epoch": 0.8115856069592724, "grad_norm": 0.99609375, "learning_rate": 0.0004942713952514773, "loss": 5.4679, "mean_token_accuracy": 0.1744159296154976, "num_tokens": 18808105.0, "step": 8210 }, { "entropy": 5.6666069507598875, "epoch": 0.8120798734677738, "grad_norm": 0.96875, "learning_rate": 0.0004942634799851196, "loss": 5.3263, "mean_token_accuracy": 0.1870485857129097, "num_tokens": 18819275.0, "step": 8215 }, { "entropy": 5.6239588260650635, "epoch": 0.8125741399762753, "grad_norm": 1.015625, "learning_rate": 0.0004942555593248463, "loss": 5.2873, "mean_token_accuracy": 0.19853694438934327, "num_tokens": 18828535.0, "step": 8220 }, { "entropy": 5.587884426116943, "epoch": 0.8130684064847766, "grad_norm": 0.96875, "learning_rate": 0.0004942476332708522, "loss": 5.3063, "mean_token_accuracy": 0.18951144069433212, "num_tokens": 18839983.0, "step": 8225 }, { "entropy": 5.619858694076538, "epoch": 0.813562672993278, "grad_norm": 0.97265625, "learning_rate": 0.0004942397018233322, "loss": 5.347, "mean_token_accuracy": 0.1905583217740059, "num_tokens": 18851875.0, "step": 8230 }, { "entropy": 5.60425443649292, "epoch": 0.8140569395017794, "grad_norm": 0.83203125, "learning_rate": 0.0004942317649824816, "loss": 5.3634, "mean_token_accuracy": 0.18848080635070802, "num_tokens": 18863629.0, "step": 8235 }, { "entropy": 5.606148386001587, "epoch": 0.8145512060102807, "grad_norm": 0.94921875, "learning_rate": 0.0004942238227484956, "loss": 5.2646, "mean_token_accuracy": 0.19609968960285187, "num_tokens": 18875660.0, "step": 8240 }, { "entropy": 5.622015953063965, "epoch": 0.8150454725187821, "grad_norm": 0.93359375, "learning_rate": 0.0004942158751215696, "loss": 5.3926, "mean_token_accuracy": 0.18555951118469238, "num_tokens": 18887140.0, "step": 8245 }, { "entropy": 5.62107515335083, "epoch": 0.8155397390272835, "grad_norm": 0.8828125, "learning_rate": 0.0004942079221018989, "loss": 5.379, "mean_token_accuracy": 0.18471197932958602, "num_tokens": 18899386.0, "step": 8250 }, { "entropy": 5.691559505462647, "epoch": 0.8160340055357849, "grad_norm": 0.953125, "learning_rate": 0.0004941999636896795, "loss": 5.4352, "mean_token_accuracy": 0.17421678006649016, "num_tokens": 18911187.0, "step": 8255 }, { "entropy": 5.591946744918824, "epoch": 0.8165282720442862, "grad_norm": 0.98046875, "learning_rate": 0.0004941919998851068, "loss": 5.3057, "mean_token_accuracy": 0.1874287962913513, "num_tokens": 18922522.0, "step": 8260 }, { "entropy": 5.53172345161438, "epoch": 0.8170225385527876, "grad_norm": 1.015625, "learning_rate": 0.0004941840306883771, "loss": 5.2264, "mean_token_accuracy": 0.193104088306427, "num_tokens": 18932689.0, "step": 8265 }, { "entropy": 5.677608442306519, "epoch": 0.8175168050612891, "grad_norm": 0.99609375, "learning_rate": 0.0004941760560996861, "loss": 5.4626, "mean_token_accuracy": 0.18157462626695633, "num_tokens": 18944296.0, "step": 8270 }, { "entropy": 5.675486087799072, "epoch": 0.8180110715697905, "grad_norm": 0.9375, "learning_rate": 0.0004941680761192302, "loss": 5.4298, "mean_token_accuracy": 0.1839860796928406, "num_tokens": 18955449.0, "step": 8275 }, { "entropy": 5.703571796417236, "epoch": 0.8185053380782918, "grad_norm": 1.0390625, "learning_rate": 0.0004941600907472055, "loss": 5.4022, "mean_token_accuracy": 0.18319337368011473, "num_tokens": 18969065.0, "step": 8280 }, { "entropy": 5.633068943023682, "epoch": 0.8189996045867932, "grad_norm": 1.0, "learning_rate": 0.0004941520999838088, "loss": 5.3943, "mean_token_accuracy": 0.18983766287565232, "num_tokens": 18979801.0, "step": 8285 }, { "entropy": 5.665902996063233, "epoch": 0.8194938710952946, "grad_norm": 0.96484375, "learning_rate": 0.0004941441038292363, "loss": 5.4381, "mean_token_accuracy": 0.18075122237205504, "num_tokens": 18990795.0, "step": 8290 }, { "entropy": 5.6916916847229, "epoch": 0.819988137603796, "grad_norm": 0.92578125, "learning_rate": 0.0004941361022836847, "loss": 5.4033, "mean_token_accuracy": 0.18514705449342728, "num_tokens": 19002318.0, "step": 8295 }, { "entropy": 5.629551839828491, "epoch": 0.8204824041122973, "grad_norm": 0.875, "learning_rate": 0.0004941280953473513, "loss": 5.4021, "mean_token_accuracy": 0.19417527467012405, "num_tokens": 19014977.0, "step": 8300 }, { "entropy": 5.676556730270386, "epoch": 0.8209766706207987, "grad_norm": 0.93359375, "learning_rate": 0.0004941200830204325, "loss": 5.4164, "mean_token_accuracy": 0.18404287993907928, "num_tokens": 19026081.0, "step": 8305 }, { "entropy": 5.6924371242523195, "epoch": 0.8214709371293001, "grad_norm": 1.0, "learning_rate": 0.0004941120653031256, "loss": 5.3791, "mean_token_accuracy": 0.18315289914608002, "num_tokens": 19037694.0, "step": 8310 }, { "entropy": 5.587868881225586, "epoch": 0.8219652036378015, "grad_norm": 1.046875, "learning_rate": 0.0004941040421956282, "loss": 5.3043, "mean_token_accuracy": 0.19798943847417833, "num_tokens": 19048344.0, "step": 8315 }, { "entropy": 5.656932210922241, "epoch": 0.8224594701463029, "grad_norm": 0.921875, "learning_rate": 0.0004940960136981372, "loss": 5.3704, "mean_token_accuracy": 0.18792474269866943, "num_tokens": 19060213.0, "step": 8320 }, { "entropy": 5.575510835647583, "epoch": 0.8229537366548043, "grad_norm": 0.9609375, "learning_rate": 0.0004940879798108503, "loss": 5.2392, "mean_token_accuracy": 0.2062698096036911, "num_tokens": 19070881.0, "step": 8325 }, { "entropy": 5.570447587966919, "epoch": 0.8234480031633057, "grad_norm": 0.91796875, "learning_rate": 0.0004940799405339651, "loss": 5.3019, "mean_token_accuracy": 0.19131732881069183, "num_tokens": 19082206.0, "step": 8330 }, { "entropy": 5.5681945323944095, "epoch": 0.8239422696718071, "grad_norm": 0.84765625, "learning_rate": 0.0004940718958676794, "loss": 5.3177, "mean_token_accuracy": 0.19489962756633758, "num_tokens": 19094014.0, "step": 8335 }, { "entropy": 5.6420670509338375, "epoch": 0.8244365361803084, "grad_norm": 0.89453125, "learning_rate": 0.000494063845812191, "loss": 5.2904, "mean_token_accuracy": 0.1973865196108818, "num_tokens": 19106859.0, "step": 8340 }, { "entropy": 5.554845952987671, "epoch": 0.8249308026888098, "grad_norm": 0.953125, "learning_rate": 0.0004940557903676981, "loss": 5.3526, "mean_token_accuracy": 0.1915566459298134, "num_tokens": 19118296.0, "step": 8345 }, { "entropy": 5.620562744140625, "epoch": 0.8254250691973112, "grad_norm": 0.87109375, "learning_rate": 0.0004940477295343988, "loss": 5.2824, "mean_token_accuracy": 0.1935811921954155, "num_tokens": 19130212.0, "step": 8350 }, { "entropy": 5.566329717636108, "epoch": 0.8259193357058126, "grad_norm": 0.97265625, "learning_rate": 0.0004940396633124912, "loss": 5.2619, "mean_token_accuracy": 0.2050262287259102, "num_tokens": 19140798.0, "step": 8355 }, { "entropy": 5.689796686172485, "epoch": 0.8264136022143139, "grad_norm": 0.94140625, "learning_rate": 0.0004940315917021742, "loss": 5.4056, "mean_token_accuracy": 0.18843274414539338, "num_tokens": 19151875.0, "step": 8360 }, { "entropy": 5.730605220794677, "epoch": 0.8269078687228153, "grad_norm": 0.85546875, "learning_rate": 0.0004940235147036457, "loss": 5.4514, "mean_token_accuracy": 0.17686468064785005, "num_tokens": 19164532.0, "step": 8365 }, { "entropy": 5.594016742706299, "epoch": 0.8274021352313167, "grad_norm": 0.8515625, "learning_rate": 0.000494015432317105, "loss": 5.371, "mean_token_accuracy": 0.1883961483836174, "num_tokens": 19176828.0, "step": 8370 }, { "entropy": 5.545190715789795, "epoch": 0.8278964017398182, "grad_norm": 0.94921875, "learning_rate": 0.0004940073445427506, "loss": 5.222, "mean_token_accuracy": 0.20474162995815276, "num_tokens": 19188118.0, "step": 8375 }, { "entropy": 5.634063100814819, "epoch": 0.8283906682483195, "grad_norm": 0.9609375, "learning_rate": 0.0004939992513807816, "loss": 5.3999, "mean_token_accuracy": 0.1835853099822998, "num_tokens": 19201009.0, "step": 8380 }, { "entropy": 5.602933025360107, "epoch": 0.8288849347568209, "grad_norm": 0.8671875, "learning_rate": 0.0004939911528313971, "loss": 5.2991, "mean_token_accuracy": 0.1862445816397667, "num_tokens": 19212747.0, "step": 8385 }, { "entropy": 5.670134401321411, "epoch": 0.8293792012653223, "grad_norm": 0.94140625, "learning_rate": 0.000493983048894796, "loss": 5.3419, "mean_token_accuracy": 0.1856911763548851, "num_tokens": 19224043.0, "step": 8390 }, { "entropy": 5.625656461715698, "epoch": 0.8298734677738236, "grad_norm": 1.0, "learning_rate": 0.0004939749395711782, "loss": 5.2792, "mean_token_accuracy": 0.1895785227417946, "num_tokens": 19235475.0, "step": 8395 }, { "entropy": 5.682496643066406, "epoch": 0.830367734282325, "grad_norm": 0.9453125, "learning_rate": 0.0004939668248607428, "loss": 5.377, "mean_token_accuracy": 0.18660283088684082, "num_tokens": 19247208.0, "step": 8400 }, { "entropy": 5.571700525283814, "epoch": 0.8308620007908264, "grad_norm": 0.86328125, "learning_rate": 0.0004939587047636896, "loss": 5.3394, "mean_token_accuracy": 0.18749630004167556, "num_tokens": 19260172.0, "step": 8405 }, { "entropy": 5.598628568649292, "epoch": 0.8313562672993278, "grad_norm": 0.93359375, "learning_rate": 0.0004939505792802182, "loss": 5.3792, "mean_token_accuracy": 0.18930297791957856, "num_tokens": 19271173.0, "step": 8410 }, { "entropy": 5.66114912033081, "epoch": 0.8318505338078291, "grad_norm": 1.046875, "learning_rate": 0.0004939424484105287, "loss": 5.356, "mean_token_accuracy": 0.1934111848473549, "num_tokens": 19282693.0, "step": 8415 }, { "entropy": 5.643400382995606, "epoch": 0.8323448003163305, "grad_norm": 0.9296875, "learning_rate": 0.0004939343121548209, "loss": 5.3888, "mean_token_accuracy": 0.18141673058271407, "num_tokens": 19293883.0, "step": 8420 }, { "entropy": 5.508295154571533, "epoch": 0.832839066824832, "grad_norm": 1.0, "learning_rate": 0.0004939261705132951, "loss": 5.2339, "mean_token_accuracy": 0.19707490354776383, "num_tokens": 19304530.0, "step": 8425 }, { "entropy": 5.537072706222534, "epoch": 0.8333333333333334, "grad_norm": 0.9921875, "learning_rate": 0.0004939180234861516, "loss": 5.296, "mean_token_accuracy": 0.1957874447107315, "num_tokens": 19315765.0, "step": 8430 }, { "entropy": 5.6492729663848875, "epoch": 0.8338275998418347, "grad_norm": 0.9609375, "learning_rate": 0.0004939098710735906, "loss": 5.3379, "mean_token_accuracy": 0.19236592799425126, "num_tokens": 19328484.0, "step": 8435 }, { "entropy": 5.572430372238159, "epoch": 0.8343218663503361, "grad_norm": 0.95703125, "learning_rate": 0.0004939017132758129, "loss": 5.2842, "mean_token_accuracy": 0.18947661072015762, "num_tokens": 19340594.0, "step": 8440 }, { "entropy": 5.657331895828247, "epoch": 0.8348161328588375, "grad_norm": 1.0, "learning_rate": 0.0004938935500930192, "loss": 5.4024, "mean_token_accuracy": 0.18748917579650878, "num_tokens": 19351105.0, "step": 8445 }, { "entropy": 5.620879507064819, "epoch": 0.8353103993673389, "grad_norm": 0.9609375, "learning_rate": 0.0004938853815254101, "loss": 5.2752, "mean_token_accuracy": 0.19428649842739104, "num_tokens": 19361619.0, "step": 8450 }, { "entropy": 5.617256546020508, "epoch": 0.8358046658758402, "grad_norm": 0.83984375, "learning_rate": 0.0004938772075731867, "loss": 5.4579, "mean_token_accuracy": 0.18483119904994966, "num_tokens": 19374251.0, "step": 8455 }, { "entropy": 5.679248523712158, "epoch": 0.8362989323843416, "grad_norm": 1.2890625, "learning_rate": 0.0004938690282365499, "loss": 5.3939, "mean_token_accuracy": 0.17858734279870986, "num_tokens": 19386300.0, "step": 8460 }, { "entropy": 5.613411951065063, "epoch": 0.836793198892843, "grad_norm": 0.89453125, "learning_rate": 0.0004938608435157012, "loss": 5.3165, "mean_token_accuracy": 0.1922312334179878, "num_tokens": 19397082.0, "step": 8465 }, { "entropy": 5.580786180496216, "epoch": 0.8372874654013444, "grad_norm": 0.8515625, "learning_rate": 0.0004938526534108417, "loss": 5.4031, "mean_token_accuracy": 0.18431049585342407, "num_tokens": 19409123.0, "step": 8470 }, { "entropy": 5.514893436431885, "epoch": 0.8377817319098458, "grad_norm": 0.94921875, "learning_rate": 0.0004938444579221732, "loss": 5.1576, "mean_token_accuracy": 0.20392314046621324, "num_tokens": 19419854.0, "step": 8475 }, { "entropy": 5.6093950271606445, "epoch": 0.8382759984183472, "grad_norm": 0.953125, "learning_rate": 0.0004938362570498969, "loss": 5.3349, "mean_token_accuracy": 0.18766133785247802, "num_tokens": 19430825.0, "step": 8480 }, { "entropy": 5.60301833152771, "epoch": 0.8387702649268486, "grad_norm": 0.94921875, "learning_rate": 0.0004938280507942146, "loss": 5.3762, "mean_token_accuracy": 0.17991405427455903, "num_tokens": 19442617.0, "step": 8485 }, { "entropy": 5.681972932815552, "epoch": 0.83926453143535, "grad_norm": 1.0234375, "learning_rate": 0.0004938198391553285, "loss": 5.3875, "mean_token_accuracy": 0.18257388472557068, "num_tokens": 19453911.0, "step": 8490 }, { "entropy": 5.574787378311157, "epoch": 0.8397587979438513, "grad_norm": 1.0, "learning_rate": 0.0004938116221334404, "loss": 5.2915, "mean_token_accuracy": 0.19437296092510223, "num_tokens": 19464837.0, "step": 8495 }, { "entropy": 5.555682134628296, "epoch": 0.8402530644523527, "grad_norm": 1.0234375, "learning_rate": 0.0004938033997287524, "loss": 5.2447, "mean_token_accuracy": 0.19782529324293135, "num_tokens": 19477067.0, "step": 8500 }, { "entropy": 5.57052206993103, "epoch": 0.8407473309608541, "grad_norm": 0.92578125, "learning_rate": 0.0004937951719414668, "loss": 5.3015, "mean_token_accuracy": 0.19233842194080353, "num_tokens": 19489442.0, "step": 8505 }, { "entropy": 5.596868944168091, "epoch": 0.8412415974693555, "grad_norm": 0.94140625, "learning_rate": 0.0004937869387717861, "loss": 5.2683, "mean_token_accuracy": 0.1889539837837219, "num_tokens": 19501197.0, "step": 8510 }, { "entropy": 5.588694906234741, "epoch": 0.8417358639778568, "grad_norm": 0.8671875, "learning_rate": 0.0004937787002199127, "loss": 5.288, "mean_token_accuracy": 0.1915183424949646, "num_tokens": 19513311.0, "step": 8515 }, { "entropy": 5.681067752838135, "epoch": 0.8422301304863582, "grad_norm": 0.90234375, "learning_rate": 0.0004937704562860493, "loss": 5.4233, "mean_token_accuracy": 0.1847311168909073, "num_tokens": 19525643.0, "step": 8520 }, { "entropy": 5.524098205566406, "epoch": 0.8427243969948597, "grad_norm": 0.9609375, "learning_rate": 0.0004937622069703988, "loss": 5.2464, "mean_token_accuracy": 0.19578411132097245, "num_tokens": 19537478.0, "step": 8525 }, { "entropy": 5.621519708633423, "epoch": 0.843218663503361, "grad_norm": 0.85546875, "learning_rate": 0.0004937539522731641, "loss": 5.3089, "mean_token_accuracy": 0.1919087216258049, "num_tokens": 19549370.0, "step": 8530 }, { "entropy": 5.632019329071045, "epoch": 0.8437129300118624, "grad_norm": 0.9140625, "learning_rate": 0.0004937456921945482, "loss": 5.2438, "mean_token_accuracy": 0.20054298937320708, "num_tokens": 19561793.0, "step": 8535 }, { "entropy": 5.495332813262939, "epoch": 0.8442071965203638, "grad_norm": 0.87890625, "learning_rate": 0.0004937374267347543, "loss": 5.1776, "mean_token_accuracy": 0.20291545987129211, "num_tokens": 19573603.0, "step": 8540 }, { "entropy": 5.584205913543701, "epoch": 0.8447014630288652, "grad_norm": 0.921875, "learning_rate": 0.0004937291558939858, "loss": 5.3487, "mean_token_accuracy": 0.18634003251791, "num_tokens": 19584848.0, "step": 8545 }, { "entropy": 5.587422132492065, "epoch": 0.8451957295373665, "grad_norm": 0.9453125, "learning_rate": 0.0004937208796724461, "loss": 5.3219, "mean_token_accuracy": 0.189593081176281, "num_tokens": 19594965.0, "step": 8550 }, { "entropy": 5.588239908218384, "epoch": 0.8456899960458679, "grad_norm": 0.95703125, "learning_rate": 0.0004937125980703389, "loss": 5.2062, "mean_token_accuracy": 0.2018478125333786, "num_tokens": 19607347.0, "step": 8555 }, { "entropy": 5.603569078445434, "epoch": 0.8461842625543693, "grad_norm": 0.921875, "learning_rate": 0.0004937043110878678, "loss": 5.2906, "mean_token_accuracy": 0.19303068667650222, "num_tokens": 19618614.0, "step": 8560 }, { "entropy": 5.581605672836304, "epoch": 0.8466785290628707, "grad_norm": 0.99609375, "learning_rate": 0.0004936960187252367, "loss": 5.3086, "mean_token_accuracy": 0.1907982900738716, "num_tokens": 19630409.0, "step": 8565 }, { "entropy": 5.575473690032959, "epoch": 0.847172795571372, "grad_norm": 0.90625, "learning_rate": 0.0004936877209826497, "loss": 5.3417, "mean_token_accuracy": 0.1887072041630745, "num_tokens": 19642183.0, "step": 8570 }, { "entropy": 5.615716123580933, "epoch": 0.8476670620798734, "grad_norm": 0.984375, "learning_rate": 0.0004936794178603108, "loss": 5.3331, "mean_token_accuracy": 0.19512913525104522, "num_tokens": 19653846.0, "step": 8575 }, { "entropy": 5.606847476959229, "epoch": 0.8481613285883749, "grad_norm": 0.97265625, "learning_rate": 0.0004936711093584242, "loss": 5.3111, "mean_token_accuracy": 0.19328272789716722, "num_tokens": 19664183.0, "step": 8580 }, { "entropy": 5.587541627883911, "epoch": 0.8486555950968763, "grad_norm": 0.8984375, "learning_rate": 0.0004936627954771945, "loss": 5.3039, "mean_token_accuracy": 0.18937277793884277, "num_tokens": 19675863.0, "step": 8585 }, { "entropy": 5.565020036697388, "epoch": 0.8491498616053776, "grad_norm": 0.91796875, "learning_rate": 0.0004936544762168261, "loss": 5.3075, "mean_token_accuracy": 0.19574455320835113, "num_tokens": 19688410.0, "step": 8590 }, { "entropy": 5.606600713729859, "epoch": 0.849644128113879, "grad_norm": 1.0078125, "learning_rate": 0.0004936461515775237, "loss": 5.296, "mean_token_accuracy": 0.18527379482984543, "num_tokens": 19698849.0, "step": 8595 }, { "entropy": 5.701058864593506, "epoch": 0.8501383946223804, "grad_norm": 0.8515625, "learning_rate": 0.000493637821559492, "loss": 5.4612, "mean_token_accuracy": 0.17554941922426223, "num_tokens": 19710761.0, "step": 8600 }, { "entropy": 5.591354751586914, "epoch": 0.8506326611308818, "grad_norm": 1.0, "learning_rate": 0.0004936294861629358, "loss": 5.34, "mean_token_accuracy": 0.18895136713981628, "num_tokens": 19722530.0, "step": 8605 }, { "entropy": 5.56204833984375, "epoch": 0.8511269276393831, "grad_norm": 0.92578125, "learning_rate": 0.0004936211453880606, "loss": 5.3021, "mean_token_accuracy": 0.19413536190986633, "num_tokens": 19733352.0, "step": 8610 }, { "entropy": 5.6655668258667, "epoch": 0.8516211941478845, "grad_norm": 0.99609375, "learning_rate": 0.0004936127992350712, "loss": 5.3299, "mean_token_accuracy": 0.19247682243585587, "num_tokens": 19745071.0, "step": 8615 }, { "entropy": 5.616398572921753, "epoch": 0.8521154606563859, "grad_norm": 0.91796875, "learning_rate": 0.0004936044477041729, "loss": 5.2626, "mean_token_accuracy": 0.19520062655210496, "num_tokens": 19756039.0, "step": 8620 }, { "entropy": 5.645637369155883, "epoch": 0.8526097271648873, "grad_norm": 0.8828125, "learning_rate": 0.0004935960907955715, "loss": 5.3849, "mean_token_accuracy": 0.18131798952817918, "num_tokens": 19768728.0, "step": 8625 }, { "entropy": 5.61322431564331, "epoch": 0.8531039936733887, "grad_norm": 0.96875, "learning_rate": 0.0004935877285094722, "loss": 5.3539, "mean_token_accuracy": 0.18290757089853288, "num_tokens": 19780010.0, "step": 8630 }, { "entropy": 5.6073188304901125, "epoch": 0.8535982601818901, "grad_norm": 1.015625, "learning_rate": 0.000493579360846081, "loss": 5.2883, "mean_token_accuracy": 0.19940344393253326, "num_tokens": 19790082.0, "step": 8635 }, { "entropy": 5.621288824081421, "epoch": 0.8540925266903915, "grad_norm": 0.96875, "learning_rate": 0.0004935709878056034, "loss": 5.3697, "mean_token_accuracy": 0.19227386116981507, "num_tokens": 19801702.0, "step": 8640 }, { "entropy": 5.635842323303223, "epoch": 0.8545867931988929, "grad_norm": 0.984375, "learning_rate": 0.0004935626093882457, "loss": 5.4174, "mean_token_accuracy": 0.1858868971467018, "num_tokens": 19812173.0, "step": 8645 }, { "entropy": 5.595512390136719, "epoch": 0.8550810597073942, "grad_norm": 0.91796875, "learning_rate": 0.000493554225594214, "loss": 5.3039, "mean_token_accuracy": 0.19855883717536926, "num_tokens": 19823286.0, "step": 8650 }, { "entropy": 5.652039527893066, "epoch": 0.8555753262158956, "grad_norm": 1.0390625, "learning_rate": 0.0004935458364237143, "loss": 5.3112, "mean_token_accuracy": 0.1940981388092041, "num_tokens": 19834472.0, "step": 8655 }, { "entropy": 5.637959337234497, "epoch": 0.856069592724397, "grad_norm": 0.90625, "learning_rate": 0.0004935374418769532, "loss": 5.3395, "mean_token_accuracy": 0.1882571682333946, "num_tokens": 19845073.0, "step": 8660 }, { "entropy": 5.654879093170166, "epoch": 0.8565638592328984, "grad_norm": 0.9453125, "learning_rate": 0.0004935290419541371, "loss": 5.3727, "mean_token_accuracy": 0.18686570078134537, "num_tokens": 19856762.0, "step": 8665 }, { "entropy": 5.5987927436828615, "epoch": 0.8570581257413997, "grad_norm": 0.9609375, "learning_rate": 0.0004935206366554726, "loss": 5.3077, "mean_token_accuracy": 0.18820203691720963, "num_tokens": 19867358.0, "step": 8670 }, { "entropy": 5.573095798492432, "epoch": 0.8575523922499011, "grad_norm": 0.98046875, "learning_rate": 0.0004935122259811667, "loss": 5.3402, "mean_token_accuracy": 0.19240998178720475, "num_tokens": 19878527.0, "step": 8675 }, { "entropy": 5.669866228103638, "epoch": 0.8580466587584026, "grad_norm": 0.91015625, "learning_rate": 0.000493503809931426, "loss": 5.3819, "mean_token_accuracy": 0.18679010421037673, "num_tokens": 19889680.0, "step": 8680 }, { "entropy": 5.592174243927002, "epoch": 0.858540925266904, "grad_norm": 0.87890625, "learning_rate": 0.0004934953885064577, "loss": 5.275, "mean_token_accuracy": 0.19479130655527116, "num_tokens": 19900569.0, "step": 8685 }, { "entropy": 5.540210628509522, "epoch": 0.8590351917754053, "grad_norm": 0.84375, "learning_rate": 0.000493486961706469, "loss": 5.2535, "mean_token_accuracy": 0.19450439959764482, "num_tokens": 19912537.0, "step": 8690 }, { "entropy": 5.6402613639831545, "epoch": 0.8595294582839067, "grad_norm": 1.0078125, "learning_rate": 0.0004934785295316672, "loss": 5.304, "mean_token_accuracy": 0.18934845328330993, "num_tokens": 19923931.0, "step": 8695 }, { "entropy": 5.685604763031006, "epoch": 0.8600237247924081, "grad_norm": 1.0546875, "learning_rate": 0.0004934700919822596, "loss": 5.3847, "mean_token_accuracy": 0.1821209669113159, "num_tokens": 19933956.0, "step": 8700 }, { "entropy": 5.529983234405518, "epoch": 0.8605179913009094, "grad_norm": 0.9375, "learning_rate": 0.0004934616490584538, "loss": 5.2933, "mean_token_accuracy": 0.1939668297767639, "num_tokens": 19945603.0, "step": 8705 }, { "entropy": 5.651079607009888, "epoch": 0.8610122578094108, "grad_norm": 0.953125, "learning_rate": 0.0004934532007604577, "loss": 5.3362, "mean_token_accuracy": 0.19581063985824584, "num_tokens": 19956358.0, "step": 8710 }, { "entropy": 5.587679147720337, "epoch": 0.8615065243179122, "grad_norm": 0.9140625, "learning_rate": 0.0004934447470884788, "loss": 5.2693, "mean_token_accuracy": 0.19762010574340821, "num_tokens": 19967856.0, "step": 8715 }, { "entropy": 5.544615411758423, "epoch": 0.8620007908264136, "grad_norm": 1.2578125, "learning_rate": 0.0004934362880427253, "loss": 5.316, "mean_token_accuracy": 0.1885904610157013, "num_tokens": 19979323.0, "step": 8720 }, { "entropy": 5.686483764648438, "epoch": 0.8624950573349149, "grad_norm": 0.921875, "learning_rate": 0.0004934278236234052, "loss": 5.3666, "mean_token_accuracy": 0.18185524493455887, "num_tokens": 19991543.0, "step": 8725 }, { "entropy": 5.65110216140747, "epoch": 0.8629893238434164, "grad_norm": 0.91015625, "learning_rate": 0.0004934193538307268, "loss": 5.3325, "mean_token_accuracy": 0.1898670732975006, "num_tokens": 20003621.0, "step": 8730 }, { "entropy": 5.561264324188232, "epoch": 0.8634835903519178, "grad_norm": 0.92578125, "learning_rate": 0.0004934108786648983, "loss": 5.3484, "mean_token_accuracy": 0.1840649738907814, "num_tokens": 20015183.0, "step": 8735 }, { "entropy": 5.622852849960327, "epoch": 0.8639778568604192, "grad_norm": 0.83984375, "learning_rate": 0.0004934023981261285, "loss": 5.2718, "mean_token_accuracy": 0.19348782896995545, "num_tokens": 20026735.0, "step": 8740 }, { "entropy": 5.593182992935181, "epoch": 0.8644721233689205, "grad_norm": 0.8984375, "learning_rate": 0.0004933939122146256, "loss": 5.241, "mean_token_accuracy": 0.19366672784090042, "num_tokens": 20037410.0, "step": 8745 }, { "entropy": 5.489171934127808, "epoch": 0.8649663898774219, "grad_norm": 0.96484375, "learning_rate": 0.0004933854209305987, "loss": 5.2516, "mean_token_accuracy": 0.19483025819063188, "num_tokens": 20048972.0, "step": 8750 }, { "entropy": 5.661210012435913, "epoch": 0.8654606563859233, "grad_norm": 1.0703125, "learning_rate": 0.0004933769242742566, "loss": 5.277, "mean_token_accuracy": 0.19878142476081848, "num_tokens": 20059667.0, "step": 8755 }, { "entropy": 5.620577812194824, "epoch": 0.8659549228944247, "grad_norm": 0.84765625, "learning_rate": 0.0004933684222458082, "loss": 5.2275, "mean_token_accuracy": 0.19931579679250716, "num_tokens": 20070612.0, "step": 8760 }, { "entropy": 5.531230306625366, "epoch": 0.866449189402926, "grad_norm": 1.0546875, "learning_rate": 0.0004933599148454628, "loss": 5.2629, "mean_token_accuracy": 0.1962917000055313, "num_tokens": 20081445.0, "step": 8765 }, { "entropy": 5.649855089187622, "epoch": 0.8669434559114274, "grad_norm": 0.921875, "learning_rate": 0.0004933514020734296, "loss": 5.4083, "mean_token_accuracy": 0.18465888798236846, "num_tokens": 20094414.0, "step": 8770 }, { "entropy": 5.568540477752686, "epoch": 0.8674377224199288, "grad_norm": 0.890625, "learning_rate": 0.0004933428839299181, "loss": 5.211, "mean_token_accuracy": 0.20612840205430985, "num_tokens": 20106793.0, "step": 8775 }, { "entropy": 5.542680406570435, "epoch": 0.8679319889284303, "grad_norm": 0.90234375, "learning_rate": 0.0004933343604151376, "loss": 5.312, "mean_token_accuracy": 0.192640420794487, "num_tokens": 20118582.0, "step": 8780 }, { "entropy": 5.598910856246948, "epoch": 0.8684262554369316, "grad_norm": 1.1015625, "learning_rate": 0.0004933258315292982, "loss": 5.2597, "mean_token_accuracy": 0.19118647128343583, "num_tokens": 20130548.0, "step": 8785 }, { "entropy": 5.661962604522705, "epoch": 0.868920521945433, "grad_norm": 1.078125, "learning_rate": 0.0004933172972726094, "loss": 5.391, "mean_token_accuracy": 0.1849183514714241, "num_tokens": 20141821.0, "step": 8790 }, { "entropy": 5.6254345893859865, "epoch": 0.8694147884539344, "grad_norm": 1.046875, "learning_rate": 0.0004933087576452811, "loss": 5.3333, "mean_token_accuracy": 0.19377703964710236, "num_tokens": 20152071.0, "step": 8795 }, { "entropy": 5.61580171585083, "epoch": 0.8699090549624358, "grad_norm": 0.94921875, "learning_rate": 0.0004933002126475235, "loss": 5.3542, "mean_token_accuracy": 0.1902076631784439, "num_tokens": 20163780.0, "step": 8800 }, { "entropy": 5.585765027999878, "epoch": 0.8704033214709371, "grad_norm": 0.98828125, "learning_rate": 0.0004932916622795468, "loss": 5.3551, "mean_token_accuracy": 0.19266557842493057, "num_tokens": 20175477.0, "step": 8805 }, { "entropy": 5.5607236385345455, "epoch": 0.8708975879794385, "grad_norm": 0.79296875, "learning_rate": 0.0004932831065415614, "loss": 5.2589, "mean_token_accuracy": 0.1978373035788536, "num_tokens": 20189452.0, "step": 8810 }, { "entropy": 5.6668617725372314, "epoch": 0.8713918544879399, "grad_norm": 0.92578125, "learning_rate": 0.0004932745454337778, "loss": 5.3392, "mean_token_accuracy": 0.18952705413103105, "num_tokens": 20201250.0, "step": 8815 }, { "entropy": 5.535161828994751, "epoch": 0.8718861209964412, "grad_norm": 0.953125, "learning_rate": 0.0004932659789564065, "loss": 5.2675, "mean_token_accuracy": 0.19396359622478485, "num_tokens": 20212394.0, "step": 8820 }, { "entropy": 5.583550643920899, "epoch": 0.8723803875049426, "grad_norm": 0.92578125, "learning_rate": 0.0004932574071096581, "loss": 5.263, "mean_token_accuracy": 0.19573821127414703, "num_tokens": 20223262.0, "step": 8825 }, { "entropy": 5.576509046554565, "epoch": 0.872874654013444, "grad_norm": 0.96875, "learning_rate": 0.0004932488298937437, "loss": 5.3537, "mean_token_accuracy": 0.1901247814297676, "num_tokens": 20234088.0, "step": 8830 }, { "entropy": 5.539788246154785, "epoch": 0.8733689205219455, "grad_norm": 0.8984375, "learning_rate": 0.0004932402473088743, "loss": 5.2513, "mean_token_accuracy": 0.19825302809476852, "num_tokens": 20245373.0, "step": 8835 }, { "entropy": 5.638433837890625, "epoch": 0.8738631870304469, "grad_norm": 0.9609375, "learning_rate": 0.0004932316593552609, "loss": 5.3521, "mean_token_accuracy": 0.18906609266996383, "num_tokens": 20255824.0, "step": 8840 }, { "entropy": 5.56200942993164, "epoch": 0.8743574535389482, "grad_norm": 1.046875, "learning_rate": 0.0004932230660331148, "loss": 5.2045, "mean_token_accuracy": 0.20358600467443466, "num_tokens": 20266576.0, "step": 8845 }, { "entropy": 5.687299489974976, "epoch": 0.8748517200474496, "grad_norm": 1.015625, "learning_rate": 0.0004932144673426475, "loss": 5.3441, "mean_token_accuracy": 0.18444536328315736, "num_tokens": 20277874.0, "step": 8850 }, { "entropy": 5.577101564407348, "epoch": 0.875345986555951, "grad_norm": 0.98828125, "learning_rate": 0.0004932058632840705, "loss": 5.2679, "mean_token_accuracy": 0.19562996178865433, "num_tokens": 20288403.0, "step": 8855 }, { "entropy": 5.650596952438354, "epoch": 0.8758402530644523, "grad_norm": 0.95703125, "learning_rate": 0.0004931972538575952, "loss": 5.3205, "mean_token_accuracy": 0.1893024727702141, "num_tokens": 20299564.0, "step": 8860 }, { "entropy": 5.578593587875366, "epoch": 0.8763345195729537, "grad_norm": 0.8828125, "learning_rate": 0.0004931886390634338, "loss": 5.2432, "mean_token_accuracy": 0.1943518653512001, "num_tokens": 20312208.0, "step": 8865 }, { "entropy": 5.576356267929077, "epoch": 0.8768287860814551, "grad_norm": 0.8984375, "learning_rate": 0.000493180018901798, "loss": 5.3436, "mean_token_accuracy": 0.1892586201429367, "num_tokens": 20323486.0, "step": 8870 }, { "entropy": 5.6258461475372314, "epoch": 0.8773230525899565, "grad_norm": 0.96875, "learning_rate": 0.0004931713933728997, "loss": 5.3577, "mean_token_accuracy": 0.18634380251169205, "num_tokens": 20335806.0, "step": 8875 }, { "entropy": 5.604217529296875, "epoch": 0.8778173190984578, "grad_norm": 0.91796875, "learning_rate": 0.0004931627624769515, "loss": 5.2554, "mean_token_accuracy": 0.19714108854532242, "num_tokens": 20347216.0, "step": 8880 }, { "entropy": 5.638057899475098, "epoch": 0.8783115856069593, "grad_norm": 0.9140625, "learning_rate": 0.0004931541262141653, "loss": 5.3244, "mean_token_accuracy": 0.187897190451622, "num_tokens": 20358938.0, "step": 8885 }, { "entropy": 5.619483900070191, "epoch": 0.8788058521154607, "grad_norm": 0.91796875, "learning_rate": 0.0004931454845847539, "loss": 5.3624, "mean_token_accuracy": 0.18617626428604125, "num_tokens": 20370742.0, "step": 8890 }, { "entropy": 5.515508127212525, "epoch": 0.8793001186239621, "grad_norm": 1.046875, "learning_rate": 0.0004931368375889298, "loss": 5.2341, "mean_token_accuracy": 0.2006982982158661, "num_tokens": 20382100.0, "step": 8895 }, { "entropy": 5.642488861083985, "epoch": 0.8797943851324634, "grad_norm": 0.98828125, "learning_rate": 0.0004931281852269054, "loss": 5.3799, "mean_token_accuracy": 0.18890009373426436, "num_tokens": 20393348.0, "step": 8900 }, { "entropy": 5.620545816421509, "epoch": 0.8802886516409648, "grad_norm": 1.0, "learning_rate": 0.000493119527498894, "loss": 5.2362, "mean_token_accuracy": 0.1990106761455536, "num_tokens": 20403471.0, "step": 8905 }, { "entropy": 5.548617124557495, "epoch": 0.8807829181494662, "grad_norm": 0.8984375, "learning_rate": 0.0004931108644051084, "loss": 5.2954, "mean_token_accuracy": 0.20188704282045364, "num_tokens": 20415146.0, "step": 8910 }, { "entropy": 5.617062425613403, "epoch": 0.8812771846579676, "grad_norm": 0.94921875, "learning_rate": 0.0004931021959457617, "loss": 5.3006, "mean_token_accuracy": 0.19148198813199996, "num_tokens": 20425857.0, "step": 8915 }, { "entropy": 5.617871952056885, "epoch": 0.8817714511664689, "grad_norm": 1.015625, "learning_rate": 0.000493093522121067, "loss": 5.4015, "mean_token_accuracy": 0.1810201734304428, "num_tokens": 20437987.0, "step": 8920 }, { "entropy": 5.572575521469116, "epoch": 0.8822657176749703, "grad_norm": 0.953125, "learning_rate": 0.0004930848429312379, "loss": 5.2639, "mean_token_accuracy": 0.19230397790670395, "num_tokens": 20449079.0, "step": 8925 }, { "entropy": 5.637934684753418, "epoch": 0.8827599841834717, "grad_norm": 0.98828125, "learning_rate": 0.0004930761583764879, "loss": 5.3711, "mean_token_accuracy": 0.18775725960731507, "num_tokens": 20461032.0, "step": 8930 }, { "entropy": 5.669148921966553, "epoch": 0.8832542506919732, "grad_norm": 1.0078125, "learning_rate": 0.0004930674684570306, "loss": 5.3915, "mean_token_accuracy": 0.19035469144582748, "num_tokens": 20471825.0, "step": 8935 }, { "entropy": 5.630040168762207, "epoch": 0.8837485172004745, "grad_norm": 1.0078125, "learning_rate": 0.0004930587731730796, "loss": 5.3241, "mean_token_accuracy": 0.19135911017656326, "num_tokens": 20483329.0, "step": 8940 }, { "entropy": 5.595744848251343, "epoch": 0.8842427837089759, "grad_norm": 0.921875, "learning_rate": 0.000493050072524849, "loss": 5.2639, "mean_token_accuracy": 0.1895228460431099, "num_tokens": 20494537.0, "step": 8945 }, { "entropy": 5.52491569519043, "epoch": 0.8847370502174773, "grad_norm": 0.9765625, "learning_rate": 0.0004930413665125528, "loss": 5.2667, "mean_token_accuracy": 0.1969195783138275, "num_tokens": 20506205.0, "step": 8950 }, { "entropy": 5.625883483886719, "epoch": 0.8852313167259787, "grad_norm": 0.91796875, "learning_rate": 0.0004930326551364052, "loss": 5.3025, "mean_token_accuracy": 0.1905287116765976, "num_tokens": 20517447.0, "step": 8955 }, { "entropy": 5.6317743301391605, "epoch": 0.88572558323448, "grad_norm": 0.8828125, "learning_rate": 0.0004930239383966204, "loss": 5.3234, "mean_token_accuracy": 0.1901441067457199, "num_tokens": 20529435.0, "step": 8960 }, { "entropy": 5.588566684722901, "epoch": 0.8862198497429814, "grad_norm": 0.93359375, "learning_rate": 0.0004930152162934128, "loss": 5.2015, "mean_token_accuracy": 0.20207253396511077, "num_tokens": 20540151.0, "step": 8965 }, { "entropy": 5.582097673416138, "epoch": 0.8867141162514828, "grad_norm": 0.89453125, "learning_rate": 0.0004930064888269973, "loss": 5.3317, "mean_token_accuracy": 0.18770994246006012, "num_tokens": 20552355.0, "step": 8970 }, { "entropy": 5.660984182357788, "epoch": 0.8872083827599841, "grad_norm": 0.98046875, "learning_rate": 0.0004929977559975881, "loss": 5.3455, "mean_token_accuracy": 0.18621442019939421, "num_tokens": 20562129.0, "step": 8975 }, { "entropy": 5.596048736572266, "epoch": 0.8877026492684855, "grad_norm": 0.9375, "learning_rate": 0.0004929890178054004, "loss": 5.2794, "mean_token_accuracy": 0.19304637908935546, "num_tokens": 20573232.0, "step": 8980 }, { "entropy": 5.59243369102478, "epoch": 0.888196915776987, "grad_norm": 1.0390625, "learning_rate": 0.0004929802742506491, "loss": 5.2303, "mean_token_accuracy": 0.19674474000930786, "num_tokens": 20582986.0, "step": 8985 }, { "entropy": 5.634017038345337, "epoch": 0.8886911822854884, "grad_norm": 1.046875, "learning_rate": 0.0004929715253335492, "loss": 5.3193, "mean_token_accuracy": 0.1952466383576393, "num_tokens": 20593619.0, "step": 8990 }, { "entropy": 5.531735849380493, "epoch": 0.8891854487939898, "grad_norm": 0.91015625, "learning_rate": 0.0004929627710543159, "loss": 5.2437, "mean_token_accuracy": 0.19686733633279802, "num_tokens": 20604748.0, "step": 8995 }, { "entropy": 5.64347653388977, "epoch": 0.8896797153024911, "grad_norm": 0.98828125, "learning_rate": 0.0004929540114131647, "loss": 5.3749, "mean_token_accuracy": 0.1827043205499649, "num_tokens": 20615915.0, "step": 9000 }, { "epoch": 0.8896797153024911, "eval_entropy": 5.453859096611557, "eval_loss": 5.316276550292969, "eval_mean_token_accuracy": 0.19815392496767667, "eval_num_tokens": 20615915.0, "eval_runtime": 20.4543, "eval_samples_per_second": 1589.541, "eval_steps_per_second": 198.735, "step": 9000 }, { "entropy": 5.587483978271484, "epoch": 0.8901739818109925, "grad_norm": 0.9921875, "learning_rate": 0.0004929452464103109, "loss": 5.2213, "mean_token_accuracy": 0.19894326329231263, "num_tokens": 20627127.0, "step": 9005 }, { "entropy": 5.604601812362671, "epoch": 0.8906682483194939, "grad_norm": 0.94921875, "learning_rate": 0.0004929364760459704, "loss": 5.2999, "mean_token_accuracy": 0.19049624651670455, "num_tokens": 20638568.0, "step": 9010 }, { "entropy": 5.558288812637329, "epoch": 0.8911625148279952, "grad_norm": 1.1875, "learning_rate": 0.0004929277003203586, "loss": 5.2341, "mean_token_accuracy": 0.20183453261852263, "num_tokens": 20650803.0, "step": 9015 }, { "entropy": 5.627267551422119, "epoch": 0.8916567813364966, "grad_norm": 0.9296875, "learning_rate": 0.0004929189192336916, "loss": 5.4063, "mean_token_accuracy": 0.18134939074516296, "num_tokens": 20663021.0, "step": 9020 }, { "entropy": 5.577393341064453, "epoch": 0.892151047844998, "grad_norm": 0.9375, "learning_rate": 0.0004929101327861854, "loss": 5.2715, "mean_token_accuracy": 0.1950759693980217, "num_tokens": 20675144.0, "step": 9025 }, { "entropy": 5.58178677558899, "epoch": 0.8926453143534994, "grad_norm": 0.96875, "learning_rate": 0.0004929013409780562, "loss": 5.266, "mean_token_accuracy": 0.19267458617687225, "num_tokens": 20685941.0, "step": 9030 }, { "entropy": 5.546954107284546, "epoch": 0.8931395808620007, "grad_norm": 0.95703125, "learning_rate": 0.0004928925438095202, "loss": 5.3076, "mean_token_accuracy": 0.19046921730041505, "num_tokens": 20696996.0, "step": 9035 }, { "entropy": 5.597846555709839, "epoch": 0.8936338473705022, "grad_norm": 1.0703125, "learning_rate": 0.0004928837412807938, "loss": 5.278, "mean_token_accuracy": 0.19537227600812912, "num_tokens": 20708571.0, "step": 9040 }, { "entropy": 5.601914501190185, "epoch": 0.8941281138790036, "grad_norm": 0.91796875, "learning_rate": 0.0004928749333920935, "loss": 5.2902, "mean_token_accuracy": 0.19647103250026704, "num_tokens": 20719816.0, "step": 9045 }, { "entropy": 5.601902151107788, "epoch": 0.894622380387505, "grad_norm": 0.89453125, "learning_rate": 0.000492866120143636, "loss": 5.2763, "mean_token_accuracy": 0.1925179824233055, "num_tokens": 20731540.0, "step": 9050 }, { "entropy": 5.594970607757569, "epoch": 0.8951166468960063, "grad_norm": 0.96484375, "learning_rate": 0.0004928573015356382, "loss": 5.2988, "mean_token_accuracy": 0.19291871041059494, "num_tokens": 20742949.0, "step": 9055 }, { "entropy": 5.575451231002807, "epoch": 0.8956109134045077, "grad_norm": 0.94921875, "learning_rate": 0.0004928484775683171, "loss": 5.3285, "mean_token_accuracy": 0.19544809609651564, "num_tokens": 20752840.0, "step": 9060 }, { "entropy": 5.621188116073609, "epoch": 0.8961051799130091, "grad_norm": 0.86328125, "learning_rate": 0.0004928396482418895, "loss": 5.2997, "mean_token_accuracy": 0.19504310190677643, "num_tokens": 20763772.0, "step": 9065 }, { "entropy": 5.601122426986694, "epoch": 0.8965994464215105, "grad_norm": 0.94140625, "learning_rate": 0.0004928308135565728, "loss": 5.2886, "mean_token_accuracy": 0.19484919607639312, "num_tokens": 20775815.0, "step": 9070 }, { "entropy": 5.622862720489502, "epoch": 0.8970937129300118, "grad_norm": 0.9140625, "learning_rate": 0.0004928219735125843, "loss": 5.3252, "mean_token_accuracy": 0.191373074054718, "num_tokens": 20787307.0, "step": 9075 }, { "entropy": 5.6415482521057125, "epoch": 0.8975879794385132, "grad_norm": 0.9453125, "learning_rate": 0.0004928131281101415, "loss": 5.3943, "mean_token_accuracy": 0.1851114496588707, "num_tokens": 20798910.0, "step": 9080 }, { "entropy": 5.695727348327637, "epoch": 0.8980822459470146, "grad_norm": 1.078125, "learning_rate": 0.000492804277349462, "loss": 5.3091, "mean_token_accuracy": 0.18407160490751268, "num_tokens": 20808628.0, "step": 9085 }, { "entropy": 5.600136613845825, "epoch": 0.8985765124555161, "grad_norm": 0.99609375, "learning_rate": 0.0004927954212307634, "loss": 5.2342, "mean_token_accuracy": 0.1946546733379364, "num_tokens": 20820117.0, "step": 9090 }, { "entropy": 5.543583059310913, "epoch": 0.8990707789640174, "grad_norm": 0.8984375, "learning_rate": 0.0004927865597542637, "loss": 5.2183, "mean_token_accuracy": 0.2025999292731285, "num_tokens": 20830859.0, "step": 9095 }, { "entropy": 5.607215547561646, "epoch": 0.8995650454725188, "grad_norm": 0.96484375, "learning_rate": 0.0004927776929201807, "loss": 5.2248, "mean_token_accuracy": 0.19611435979604722, "num_tokens": 20843016.0, "step": 9100 }, { "entropy": 5.55854606628418, "epoch": 0.9000593119810202, "grad_norm": 0.96875, "learning_rate": 0.0004927688207287328, "loss": 5.2372, "mean_token_accuracy": 0.19648780673742294, "num_tokens": 20854873.0, "step": 9105 }, { "entropy": 5.6449456214904785, "epoch": 0.9005535784895216, "grad_norm": 0.95703125, "learning_rate": 0.0004927599431801381, "loss": 5.4503, "mean_token_accuracy": 0.18985198438167572, "num_tokens": 20866756.0, "step": 9110 }, { "entropy": 5.574172449111939, "epoch": 0.9010478449980229, "grad_norm": 0.953125, "learning_rate": 0.000492751060274615, "loss": 5.2123, "mean_token_accuracy": 0.20295542627573013, "num_tokens": 20878859.0, "step": 9115 }, { "entropy": 5.592064476013183, "epoch": 0.9015421115065243, "grad_norm": 1.0234375, "learning_rate": 0.0004927421720123821, "loss": 5.2683, "mean_token_accuracy": 0.19598311483860015, "num_tokens": 20889188.0, "step": 9120 }, { "entropy": 5.55375862121582, "epoch": 0.9020363780150257, "grad_norm": 0.98046875, "learning_rate": 0.0004927332783936579, "loss": 5.2502, "mean_token_accuracy": 0.19401780217885972, "num_tokens": 20900318.0, "step": 9125 }, { "entropy": 5.59337306022644, "epoch": 0.902530644523527, "grad_norm": 0.9765625, "learning_rate": 0.0004927243794186614, "loss": 5.3204, "mean_token_accuracy": 0.1892186477780342, "num_tokens": 20912384.0, "step": 9130 }, { "entropy": 5.5984546661376955, "epoch": 0.9030249110320284, "grad_norm": 0.96875, "learning_rate": 0.0004927154750876112, "loss": 5.26, "mean_token_accuracy": 0.19077356159687042, "num_tokens": 20923002.0, "step": 9135 }, { "entropy": 5.658222961425781, "epoch": 0.9035191775405299, "grad_norm": 0.92578125, "learning_rate": 0.0004927065654007268, "loss": 5.4024, "mean_token_accuracy": 0.1856117770075798, "num_tokens": 20934235.0, "step": 9140 }, { "entropy": 5.573357963562012, "epoch": 0.9040134440490313, "grad_norm": 0.9453125, "learning_rate": 0.0004926976503582269, "loss": 5.2543, "mean_token_accuracy": 0.19156253784894944, "num_tokens": 20946788.0, "step": 9145 }, { "entropy": 5.616217517852784, "epoch": 0.9045077105575327, "grad_norm": 0.89453125, "learning_rate": 0.000492688729960331, "loss": 5.2964, "mean_token_accuracy": 0.19346958696842192, "num_tokens": 20958963.0, "step": 9150 }, { "entropy": 5.6407979965209964, "epoch": 0.905001977066034, "grad_norm": 0.8828125, "learning_rate": 0.0004926798042072587, "loss": 5.2844, "mean_token_accuracy": 0.19110203981399537, "num_tokens": 20969630.0, "step": 9155 }, { "entropy": 5.562024211883545, "epoch": 0.9054962435745354, "grad_norm": 0.96484375, "learning_rate": 0.0004926708730992294, "loss": 5.2509, "mean_token_accuracy": 0.19519689828157424, "num_tokens": 20980489.0, "step": 9160 }, { "entropy": 5.630165004730225, "epoch": 0.9059905100830368, "grad_norm": 0.9453125, "learning_rate": 0.0004926619366364629, "loss": 5.2957, "mean_token_accuracy": 0.19124603420495986, "num_tokens": 20992199.0, "step": 9165 }, { "entropy": 5.631778287887573, "epoch": 0.9064847765915381, "grad_norm": 1.03125, "learning_rate": 0.000492652994819179, "loss": 5.3165, "mean_token_accuracy": 0.18919652253389357, "num_tokens": 21003680.0, "step": 9170 }, { "entropy": 5.591311931610107, "epoch": 0.9069790431000395, "grad_norm": 1.0625, "learning_rate": 0.0004926440476475975, "loss": 5.2161, "mean_token_accuracy": 0.20206432938575744, "num_tokens": 21014191.0, "step": 9175 }, { "entropy": 5.527163982391357, "epoch": 0.9074733096085409, "grad_norm": 1.046875, "learning_rate": 0.0004926350951219388, "loss": 5.2294, "mean_token_accuracy": 0.1952969640493393, "num_tokens": 21025692.0, "step": 9180 }, { "entropy": 5.561137676239014, "epoch": 0.9079675761170423, "grad_norm": 1.0, "learning_rate": 0.000492626137242423, "loss": 5.2481, "mean_token_accuracy": 0.20174835324287416, "num_tokens": 21036643.0, "step": 9185 }, { "entropy": 5.613081359863282, "epoch": 0.9084618426255437, "grad_norm": 0.94921875, "learning_rate": 0.0004926171740092704, "loss": 5.3164, "mean_token_accuracy": 0.1874464526772499, "num_tokens": 21047509.0, "step": 9190 }, { "entropy": 5.585333967208863, "epoch": 0.9089561091340451, "grad_norm": 1.0078125, "learning_rate": 0.0004926082054227016, "loss": 5.378, "mean_token_accuracy": 0.19022021144628526, "num_tokens": 21059854.0, "step": 9195 }, { "entropy": 5.603780460357666, "epoch": 0.9094503756425465, "grad_norm": 1.109375, "learning_rate": 0.0004925992314829372, "loss": 5.2187, "mean_token_accuracy": 0.2020441100001335, "num_tokens": 21069926.0, "step": 9200 }, { "entropy": 5.6267749786376955, "epoch": 0.9099446421510479, "grad_norm": 0.88671875, "learning_rate": 0.000492590252190198, "loss": 5.3133, "mean_token_accuracy": 0.1928973063826561, "num_tokens": 21081580.0, "step": 9205 }, { "entropy": 5.570774745941162, "epoch": 0.9104389086595492, "grad_norm": 1.0625, "learning_rate": 0.0004925812675447047, "loss": 5.199, "mean_token_accuracy": 0.1994393765926361, "num_tokens": 21092510.0, "step": 9210 }, { "entropy": 5.560053920745849, "epoch": 0.9109331751680506, "grad_norm": 0.9609375, "learning_rate": 0.0004925722775466785, "loss": 5.2325, "mean_token_accuracy": 0.1939576745033264, "num_tokens": 21103995.0, "step": 9215 }, { "entropy": 5.573094415664673, "epoch": 0.911427441676552, "grad_norm": 0.96484375, "learning_rate": 0.0004925632821963406, "loss": 5.3058, "mean_token_accuracy": 0.1983561098575592, "num_tokens": 21114949.0, "step": 9220 }, { "entropy": 5.551618051528931, "epoch": 0.9119217081850534, "grad_norm": 0.984375, "learning_rate": 0.0004925542814939121, "loss": 5.2097, "mean_token_accuracy": 0.20239128470420836, "num_tokens": 21125810.0, "step": 9225 }, { "entropy": 5.55057544708252, "epoch": 0.9124159746935547, "grad_norm": 0.88671875, "learning_rate": 0.0004925452754396146, "loss": 5.2931, "mean_token_accuracy": 0.18787168115377426, "num_tokens": 21137728.0, "step": 9230 }, { "entropy": 5.581655406951905, "epoch": 0.9129102412020561, "grad_norm": 0.93359375, "learning_rate": 0.0004925362640336696, "loss": 5.2653, "mean_token_accuracy": 0.19240166991949081, "num_tokens": 21149249.0, "step": 9235 }, { "entropy": 5.613656091690063, "epoch": 0.9134045077105575, "grad_norm": 0.87890625, "learning_rate": 0.0004925272472762987, "loss": 5.3543, "mean_token_accuracy": 0.1840820536017418, "num_tokens": 21162338.0, "step": 9240 }, { "entropy": 5.529747533798218, "epoch": 0.913898774219059, "grad_norm": 0.96875, "learning_rate": 0.0004925182251677238, "loss": 5.1196, "mean_token_accuracy": 0.2063831463456154, "num_tokens": 21172953.0, "step": 9245 }, { "entropy": 5.5246641635894775, "epoch": 0.9143930407275603, "grad_norm": 1.0078125, "learning_rate": 0.0004925091977081668, "loss": 5.2653, "mean_token_accuracy": 0.19415484368801117, "num_tokens": 21183835.0, "step": 9250 }, { "entropy": 5.529507827758789, "epoch": 0.9148873072360617, "grad_norm": 1.046875, "learning_rate": 0.0004925001648978498, "loss": 5.2521, "mean_token_accuracy": 0.20126226544380188, "num_tokens": 21195392.0, "step": 9255 }, { "entropy": 5.7258189678192135, "epoch": 0.9153815737445631, "grad_norm": 1.015625, "learning_rate": 0.000492491126736995, "loss": 5.3978, "mean_token_accuracy": 0.18098648488521576, "num_tokens": 21207213.0, "step": 9260 }, { "entropy": 5.6426825523376465, "epoch": 0.9158758402530645, "grad_norm": 0.9609375, "learning_rate": 0.0004924820832258248, "loss": 5.3577, "mean_token_accuracy": 0.19594235867261886, "num_tokens": 21218843.0, "step": 9265 }, { "entropy": 5.5363226413726805, "epoch": 0.9163701067615658, "grad_norm": 1.046875, "learning_rate": 0.0004924730343645614, "loss": 5.3295, "mean_token_accuracy": 0.19190503507852555, "num_tokens": 21229596.0, "step": 9270 }, { "entropy": 5.643647289276123, "epoch": 0.9168643732700672, "grad_norm": 0.9609375, "learning_rate": 0.0004924639801534278, "loss": 5.2404, "mean_token_accuracy": 0.19221349209547042, "num_tokens": 21240040.0, "step": 9275 }, { "entropy": 5.641191101074218, "epoch": 0.9173586397785686, "grad_norm": 0.8984375, "learning_rate": 0.0004924549205926465, "loss": 5.3828, "mean_token_accuracy": 0.1817492738366127, "num_tokens": 21252046.0, "step": 9280 }, { "entropy": 5.646723127365112, "epoch": 0.91785290628707, "grad_norm": 0.8828125, "learning_rate": 0.0004924458556824405, "loss": 5.3107, "mean_token_accuracy": 0.185044065117836, "num_tokens": 21263720.0, "step": 9285 }, { "entropy": 5.6652275085449215, "epoch": 0.9183471727955713, "grad_norm": 0.90625, "learning_rate": 0.0004924367854230326, "loss": 5.326, "mean_token_accuracy": 0.19200274497270584, "num_tokens": 21275751.0, "step": 9290 }, { "entropy": 5.57728123664856, "epoch": 0.9188414393040728, "grad_norm": 0.91015625, "learning_rate": 0.0004924277098146461, "loss": 5.2978, "mean_token_accuracy": 0.19622181504964828, "num_tokens": 21287081.0, "step": 9295 }, { "entropy": 5.544796800613403, "epoch": 0.9193357058125742, "grad_norm": 0.9921875, "learning_rate": 0.0004924186288575043, "loss": 5.25, "mean_token_accuracy": 0.19539826959371567, "num_tokens": 21298007.0, "step": 9300 }, { "entropy": 5.683059501647949, "epoch": 0.9198299723210756, "grad_norm": 0.8984375, "learning_rate": 0.0004924095425518304, "loss": 5.2947, "mean_token_accuracy": 0.18877930641174318, "num_tokens": 21309416.0, "step": 9305 }, { "entropy": 5.554641342163086, "epoch": 0.9203242388295769, "grad_norm": 0.921875, "learning_rate": 0.000492400450897848, "loss": 5.259, "mean_token_accuracy": 0.19206880480051042, "num_tokens": 21321129.0, "step": 9310 }, { "entropy": 5.56403374671936, "epoch": 0.9208185053380783, "grad_norm": 1.015625, "learning_rate": 0.0004923913538957809, "loss": 5.2335, "mean_token_accuracy": 0.19703521728515624, "num_tokens": 21331706.0, "step": 9315 }, { "entropy": 5.596106910705567, "epoch": 0.9213127718465797, "grad_norm": 0.875, "learning_rate": 0.0004923822515458526, "loss": 5.2955, "mean_token_accuracy": 0.19252702295780183, "num_tokens": 21343738.0, "step": 9320 }, { "entropy": 5.583720302581787, "epoch": 0.921807038355081, "grad_norm": 0.96875, "learning_rate": 0.0004923731438482873, "loss": 5.2623, "mean_token_accuracy": 0.19407890737056732, "num_tokens": 21354714.0, "step": 9325 }, { "entropy": 5.667014312744141, "epoch": 0.9223013048635824, "grad_norm": 0.953125, "learning_rate": 0.0004923640308033088, "loss": 5.3183, "mean_token_accuracy": 0.18703836649656297, "num_tokens": 21365947.0, "step": 9330 }, { "entropy": 5.676099157333374, "epoch": 0.9227955713720838, "grad_norm": 1.0390625, "learning_rate": 0.0004923549124111416, "loss": 5.4528, "mean_token_accuracy": 0.18146609663963317, "num_tokens": 21376729.0, "step": 9335 }, { "entropy": 5.571810865402222, "epoch": 0.9232898378805852, "grad_norm": 1.046875, "learning_rate": 0.0004923457886720098, "loss": 5.2513, "mean_token_accuracy": 0.20001922845840453, "num_tokens": 21388017.0, "step": 9340 }, { "entropy": 5.543676853179932, "epoch": 0.9237841043890866, "grad_norm": 0.9375, "learning_rate": 0.0004923366595861378, "loss": 5.2056, "mean_token_accuracy": 0.20334187000989914, "num_tokens": 21399566.0, "step": 9345 }, { "entropy": 5.615511846542359, "epoch": 0.924278370897588, "grad_norm": 1.015625, "learning_rate": 0.0004923275251537503, "loss": 5.3349, "mean_token_accuracy": 0.18682333081960678, "num_tokens": 21410276.0, "step": 9350 }, { "entropy": 5.564146327972412, "epoch": 0.9247726374060894, "grad_norm": 0.9453125, "learning_rate": 0.000492318385375072, "loss": 5.26, "mean_token_accuracy": 0.20146844089031218, "num_tokens": 21421090.0, "step": 9355 }, { "entropy": 5.587176513671875, "epoch": 0.9252669039145908, "grad_norm": 1.0078125, "learning_rate": 0.0004923092402503277, "loss": 5.2513, "mean_token_accuracy": 0.19699199497699738, "num_tokens": 21431057.0, "step": 9360 }, { "entropy": 5.596036577224732, "epoch": 0.9257611704230921, "grad_norm": 0.89453125, "learning_rate": 0.0004923000897797423, "loss": 5.3236, "mean_token_accuracy": 0.18349796831607817, "num_tokens": 21443849.0, "step": 9365 }, { "entropy": 5.655566215515137, "epoch": 0.9262554369315935, "grad_norm": 1.09375, "learning_rate": 0.0004922909339635411, "loss": 5.3647, "mean_token_accuracy": 0.18296800404787064, "num_tokens": 21454824.0, "step": 9370 }, { "entropy": 5.626794815063477, "epoch": 0.9267497034400949, "grad_norm": 0.953125, "learning_rate": 0.0004922817728019492, "loss": 5.2803, "mean_token_accuracy": 0.19204143881797792, "num_tokens": 21466082.0, "step": 9375 }, { "entropy": 5.5628503322601315, "epoch": 0.9272439699485963, "grad_norm": 1.046875, "learning_rate": 0.0004922726062951918, "loss": 5.272, "mean_token_accuracy": 0.1930104374885559, "num_tokens": 21477805.0, "step": 9380 }, { "entropy": 5.613981866836548, "epoch": 0.9277382364570976, "grad_norm": 0.9765625, "learning_rate": 0.0004922634344434948, "loss": 5.2667, "mean_token_accuracy": 0.18682682067155837, "num_tokens": 21490014.0, "step": 9385 }, { "entropy": 5.588494968414307, "epoch": 0.928232502965599, "grad_norm": 0.91015625, "learning_rate": 0.0004922542572470835, "loss": 5.3167, "mean_token_accuracy": 0.1919434279203415, "num_tokens": 21501713.0, "step": 9390 }, { "entropy": 5.49588041305542, "epoch": 0.9287267694741005, "grad_norm": 0.96484375, "learning_rate": 0.0004922450747061837, "loss": 5.1991, "mean_token_accuracy": 0.19648561030626296, "num_tokens": 21513258.0, "step": 9395 }, { "entropy": 5.5628822326660154, "epoch": 0.9292210359826019, "grad_norm": 0.94921875, "learning_rate": 0.0004922358868210214, "loss": 5.2704, "mean_token_accuracy": 0.19269068837165831, "num_tokens": 21526259.0, "step": 9400 }, { "entropy": 5.564657974243164, "epoch": 0.9297153024911032, "grad_norm": 0.9140625, "learning_rate": 0.0004922266935918227, "loss": 5.2435, "mean_token_accuracy": 0.19473872780799867, "num_tokens": 21539144.0, "step": 9405 }, { "entropy": 5.659498453140259, "epoch": 0.9302095689996046, "grad_norm": 0.9296875, "learning_rate": 0.0004922174950188136, "loss": 5.3269, "mean_token_accuracy": 0.1849493607878685, "num_tokens": 21550550.0, "step": 9410 }, { "entropy": 5.566400003433228, "epoch": 0.930703835508106, "grad_norm": 0.92578125, "learning_rate": 0.0004922082911022204, "loss": 5.2442, "mean_token_accuracy": 0.19395558834075927, "num_tokens": 21562491.0, "step": 9415 }, { "entropy": 5.540606069564819, "epoch": 0.9311981020166074, "grad_norm": 0.91796875, "learning_rate": 0.0004921990818422694, "loss": 5.2931, "mean_token_accuracy": 0.18951031863689421, "num_tokens": 21573679.0, "step": 9420 }, { "entropy": 5.592748212814331, "epoch": 0.9316923685251087, "grad_norm": 0.88671875, "learning_rate": 0.0004921898672391874, "loss": 5.2362, "mean_token_accuracy": 0.19630191773176192, "num_tokens": 21585491.0, "step": 9425 }, { "entropy": 5.623326253890991, "epoch": 0.9321866350336101, "grad_norm": 0.890625, "learning_rate": 0.0004921806472932011, "loss": 5.2948, "mean_token_accuracy": 0.1910802036523819, "num_tokens": 21598302.0, "step": 9430 }, { "entropy": 5.529564619064331, "epoch": 0.9326809015421115, "grad_norm": 0.94921875, "learning_rate": 0.0004921714220045371, "loss": 5.2905, "mean_token_accuracy": 0.19063889384269714, "num_tokens": 21608442.0, "step": 9435 }, { "entropy": 5.620128774642945, "epoch": 0.9331751680506128, "grad_norm": 0.9453125, "learning_rate": 0.0004921621913734223, "loss": 5.3089, "mean_token_accuracy": 0.19169669300317765, "num_tokens": 21619594.0, "step": 9440 }, { "entropy": 5.675646686553955, "epoch": 0.9336694345591142, "grad_norm": 1.0234375, "learning_rate": 0.0004921529554000841, "loss": 5.3204, "mean_token_accuracy": 0.19246283024549485, "num_tokens": 21631065.0, "step": 9445 }, { "entropy": 5.544268703460693, "epoch": 0.9341637010676157, "grad_norm": 0.98828125, "learning_rate": 0.0004921437140847493, "loss": 5.2347, "mean_token_accuracy": 0.1966544970870018, "num_tokens": 21640949.0, "step": 9450 }, { "entropy": 5.732216882705688, "epoch": 0.9346579675761171, "grad_norm": 0.953125, "learning_rate": 0.0004921344674276456, "loss": 5.3532, "mean_token_accuracy": 0.18929612636566162, "num_tokens": 21651189.0, "step": 9455 }, { "entropy": 5.657884502410889, "epoch": 0.9351522340846185, "grad_norm": 0.890625, "learning_rate": 0.0004921252154290003, "loss": 5.36, "mean_token_accuracy": 0.1827592596411705, "num_tokens": 21662790.0, "step": 9460 }, { "entropy": 5.607834529876709, "epoch": 0.9356465005931198, "grad_norm": 0.9453125, "learning_rate": 0.000492115958089041, "loss": 5.373, "mean_token_accuracy": 0.18952614665031434, "num_tokens": 21674980.0, "step": 9465 }, { "entropy": 5.583289432525635, "epoch": 0.9361407671016212, "grad_norm": 0.98046875, "learning_rate": 0.0004921066954079955, "loss": 5.2595, "mean_token_accuracy": 0.19525590538978577, "num_tokens": 21687721.0, "step": 9470 }, { "entropy": 5.630616855621338, "epoch": 0.9366350336101226, "grad_norm": 0.99609375, "learning_rate": 0.0004920974273860915, "loss": 5.407, "mean_token_accuracy": 0.18409871757030488, "num_tokens": 21699522.0, "step": 9475 }, { "entropy": 5.60090856552124, "epoch": 0.9371293001186239, "grad_norm": 0.9765625, "learning_rate": 0.0004920881540235572, "loss": 5.1762, "mean_token_accuracy": 0.19903065860271454, "num_tokens": 21709972.0, "step": 9480 }, { "entropy": 5.530702686309814, "epoch": 0.9376235666271253, "grad_norm": 0.93359375, "learning_rate": 0.0004920788753206205, "loss": 5.2769, "mean_token_accuracy": 0.19851672351360322, "num_tokens": 21722172.0, "step": 9485 }, { "entropy": 5.555144357681274, "epoch": 0.9381178331356267, "grad_norm": 1.03125, "learning_rate": 0.00049206959127751, "loss": 5.2781, "mean_token_accuracy": 0.1910274863243103, "num_tokens": 21734314.0, "step": 9490 }, { "entropy": 5.617087984085083, "epoch": 0.9386120996441281, "grad_norm": 1.015625, "learning_rate": 0.0004920603018944537, "loss": 5.2554, "mean_token_accuracy": 0.19869812577962875, "num_tokens": 21744031.0, "step": 9495 }, { "entropy": 5.596858978271484, "epoch": 0.9391063661526295, "grad_norm": 0.9921875, "learning_rate": 0.0004920510071716803, "loss": 5.2326, "mean_token_accuracy": 0.1996735394001007, "num_tokens": 21755653.0, "step": 9500 }, { "entropy": 5.648110675811767, "epoch": 0.9396006326611309, "grad_norm": 0.8671875, "learning_rate": 0.0004920417071094186, "loss": 5.3172, "mean_token_accuracy": 0.18745261579751968, "num_tokens": 21768513.0, "step": 9505 }, { "entropy": 5.621316909790039, "epoch": 0.9400948991696323, "grad_norm": 0.89453125, "learning_rate": 0.0004920324017078971, "loss": 5.2545, "mean_token_accuracy": 0.18876036554574965, "num_tokens": 21780857.0, "step": 9510 }, { "entropy": 5.519130516052246, "epoch": 0.9405891656781337, "grad_norm": 0.9140625, "learning_rate": 0.000492023090967345, "loss": 5.2565, "mean_token_accuracy": 0.20039683878421782, "num_tokens": 21792514.0, "step": 9515 }, { "entropy": 5.609611129760742, "epoch": 0.941083432186635, "grad_norm": 1.046875, "learning_rate": 0.000492013774887991, "loss": 5.3056, "mean_token_accuracy": 0.19367908388376237, "num_tokens": 21803154.0, "step": 9520 }, { "entropy": 5.5895103931427, "epoch": 0.9415776986951364, "grad_norm": 0.88671875, "learning_rate": 0.0004920044534700645, "loss": 5.2796, "mean_token_accuracy": 0.191404826939106, "num_tokens": 21814439.0, "step": 9525 }, { "entropy": 5.58048005104065, "epoch": 0.9420719652036378, "grad_norm": 0.89453125, "learning_rate": 0.0004919951267137949, "loss": 5.2315, "mean_token_accuracy": 0.2039950296282768, "num_tokens": 21826870.0, "step": 9530 }, { "entropy": 5.656774282455444, "epoch": 0.9425662317121392, "grad_norm": 0.97265625, "learning_rate": 0.0004919857946194114, "loss": 5.2091, "mean_token_accuracy": 0.19818320423364638, "num_tokens": 21837627.0, "step": 9535 }, { "entropy": 5.575752544403076, "epoch": 0.9430604982206405, "grad_norm": 1.0234375, "learning_rate": 0.0004919764571871438, "loss": 5.3576, "mean_token_accuracy": 0.18930294811725618, "num_tokens": 21848891.0, "step": 9540 }, { "entropy": 5.624856853485108, "epoch": 0.9435547647291419, "grad_norm": 0.92578125, "learning_rate": 0.0004919671144172216, "loss": 5.259, "mean_token_accuracy": 0.1936282053589821, "num_tokens": 21860094.0, "step": 9545 }, { "entropy": 5.547248363494873, "epoch": 0.9440490312376434, "grad_norm": 0.984375, "learning_rate": 0.0004919577663098748, "loss": 5.2213, "mean_token_accuracy": 0.1961129993200302, "num_tokens": 21870881.0, "step": 9550 }, { "entropy": 5.521943092346191, "epoch": 0.9445432977461448, "grad_norm": 0.87109375, "learning_rate": 0.0004919484128653333, "loss": 5.2634, "mean_token_accuracy": 0.19652665555477142, "num_tokens": 21882825.0, "step": 9555 }, { "entropy": 5.645021438598633, "epoch": 0.9450375642546461, "grad_norm": 0.859375, "learning_rate": 0.0004919390540838271, "loss": 5.3469, "mean_token_accuracy": 0.1920948028564453, "num_tokens": 21894952.0, "step": 9560 }, { "entropy": 5.616188097000122, "epoch": 0.9455318307631475, "grad_norm": 0.92578125, "learning_rate": 0.0004919296899655866, "loss": 5.2736, "mean_token_accuracy": 0.19004132002592086, "num_tokens": 21906893.0, "step": 9565 }, { "entropy": 5.605347204208374, "epoch": 0.9460260972716489, "grad_norm": 0.95703125, "learning_rate": 0.000491920320510842, "loss": 5.3489, "mean_token_accuracy": 0.1916381984949112, "num_tokens": 21918571.0, "step": 9570 }, { "entropy": 5.574189281463623, "epoch": 0.9465203637801503, "grad_norm": 0.97265625, "learning_rate": 0.0004919109457198239, "loss": 5.2354, "mean_token_accuracy": 0.19577887952327727, "num_tokens": 21929488.0, "step": 9575 }, { "entropy": 5.564260959625244, "epoch": 0.9470146302886516, "grad_norm": 0.93359375, "learning_rate": 0.0004919015655927629, "loss": 5.2221, "mean_token_accuracy": 0.19416780918836593, "num_tokens": 21940368.0, "step": 9580 }, { "entropy": 5.594017171859742, "epoch": 0.947508896797153, "grad_norm": 0.9765625, "learning_rate": 0.0004918921801298897, "loss": 5.3362, "mean_token_accuracy": 0.1906454458832741, "num_tokens": 21951171.0, "step": 9585 }, { "entropy": 5.631678295135498, "epoch": 0.9480031633056544, "grad_norm": 1.0625, "learning_rate": 0.0004918827893314353, "loss": 5.2936, "mean_token_accuracy": 0.2021256685256958, "num_tokens": 21962312.0, "step": 9590 }, { "entropy": 5.634715270996094, "epoch": 0.9484974298141557, "grad_norm": 0.9765625, "learning_rate": 0.0004918733931976305, "loss": 5.2371, "mean_token_accuracy": 0.19397043585777282, "num_tokens": 21971994.0, "step": 9595 }, { "entropy": 5.646886539459229, "epoch": 0.9489916963226572, "grad_norm": 1.015625, "learning_rate": 0.0004918639917287067, "loss": 5.3508, "mean_token_accuracy": 0.18840891122817993, "num_tokens": 21983084.0, "step": 9600 }, { "entropy": 5.632185935974121, "epoch": 0.9494859628311586, "grad_norm": 0.93359375, "learning_rate": 0.0004918545849248951, "loss": 5.3532, "mean_token_accuracy": 0.18419350534677506, "num_tokens": 21995005.0, "step": 9605 }, { "entropy": 5.526816177368164, "epoch": 0.94998022933966, "grad_norm": 0.9453125, "learning_rate": 0.000491845172786427, "loss": 5.2941, "mean_token_accuracy": 0.19690882861614228, "num_tokens": 22006377.0, "step": 9610 }, { "entropy": 5.579129266738891, "epoch": 0.9504744958481613, "grad_norm": 0.8828125, "learning_rate": 0.0004918357553135339, "loss": 5.3547, "mean_token_accuracy": 0.1897117719054222, "num_tokens": 22019663.0, "step": 9615 }, { "entropy": 5.709817123413086, "epoch": 0.9509687623566627, "grad_norm": 0.99609375, "learning_rate": 0.0004918263325064476, "loss": 5.3599, "mean_token_accuracy": 0.1875071108341217, "num_tokens": 22030646.0, "step": 9620 }, { "entropy": 5.602067852020264, "epoch": 0.9514630288651641, "grad_norm": 0.8671875, "learning_rate": 0.0004918169043654, "loss": 5.2596, "mean_token_accuracy": 0.19610577076673508, "num_tokens": 22043563.0, "step": 9625 }, { "entropy": 5.549284410476685, "epoch": 0.9519572953736655, "grad_norm": 0.91015625, "learning_rate": 0.0004918074708906229, "loss": 5.2575, "mean_token_accuracy": 0.194849456846714, "num_tokens": 22055224.0, "step": 9630 }, { "entropy": 5.566284894943237, "epoch": 0.9524515618821668, "grad_norm": 0.9375, "learning_rate": 0.0004917980320823483, "loss": 5.3347, "mean_token_accuracy": 0.1858800619840622, "num_tokens": 22067445.0, "step": 9635 }, { "entropy": 5.597623443603515, "epoch": 0.9529458283906682, "grad_norm": 0.9453125, "learning_rate": 0.0004917885879408085, "loss": 5.2548, "mean_token_accuracy": 0.19783033877611161, "num_tokens": 22078565.0, "step": 9640 }, { "entropy": 5.49347710609436, "epoch": 0.9534400948991696, "grad_norm": 0.96484375, "learning_rate": 0.0004917791384662359, "loss": 5.1541, "mean_token_accuracy": 0.2040240928530693, "num_tokens": 22088658.0, "step": 9645 }, { "entropy": 5.5499241828918455, "epoch": 0.953934361407671, "grad_norm": 0.953125, "learning_rate": 0.0004917696836588628, "loss": 5.2744, "mean_token_accuracy": 0.19117906391620637, "num_tokens": 22100747.0, "step": 9650 }, { "entropy": 5.549844694137573, "epoch": 0.9544286279161724, "grad_norm": 0.99609375, "learning_rate": 0.0004917602235189218, "loss": 5.2935, "mean_token_accuracy": 0.19279794692993163, "num_tokens": 22113559.0, "step": 9655 }, { "entropy": 5.657561922073365, "epoch": 0.9549228944246738, "grad_norm": 0.89453125, "learning_rate": 0.0004917507580466457, "loss": 5.2901, "mean_token_accuracy": 0.19023268073797225, "num_tokens": 22124678.0, "step": 9660 }, { "entropy": 5.587802314758301, "epoch": 0.9554171609331752, "grad_norm": 0.89453125, "learning_rate": 0.0004917412872422674, "loss": 5.2803, "mean_token_accuracy": 0.1970517799258232, "num_tokens": 22136462.0, "step": 9665 }, { "entropy": 5.577156257629395, "epoch": 0.9559114274416766, "grad_norm": 0.90625, "learning_rate": 0.0004917318111060198, "loss": 5.3101, "mean_token_accuracy": 0.19685729295015336, "num_tokens": 22149101.0, "step": 9670 }, { "entropy": 5.577842473983765, "epoch": 0.9564056939501779, "grad_norm": 1.0078125, "learning_rate": 0.000491722329638136, "loss": 5.2511, "mean_token_accuracy": 0.19420985877513885, "num_tokens": 22159574.0, "step": 9675 }, { "entropy": 5.596839761734008, "epoch": 0.9568999604586793, "grad_norm": 0.9140625, "learning_rate": 0.0004917128428388492, "loss": 5.3181, "mean_token_accuracy": 0.19554406851530076, "num_tokens": 22172308.0, "step": 9680 }, { "entropy": 5.60202841758728, "epoch": 0.9573942269671807, "grad_norm": 0.95703125, "learning_rate": 0.0004917033507083929, "loss": 5.2955, "mean_token_accuracy": 0.18659153282642366, "num_tokens": 22183714.0, "step": 9685 }, { "entropy": 5.515676259994507, "epoch": 0.9578884934756821, "grad_norm": 0.9609375, "learning_rate": 0.0004916938532470006, "loss": 5.1467, "mean_token_accuracy": 0.20056056082248688, "num_tokens": 22194785.0, "step": 9690 }, { "entropy": 5.603718328475952, "epoch": 0.9583827599841834, "grad_norm": 0.8828125, "learning_rate": 0.0004916843504549058, "loss": 5.3086, "mean_token_accuracy": 0.1961810365319252, "num_tokens": 22205998.0, "step": 9695 }, { "entropy": 5.606261539459228, "epoch": 0.9588770264926848, "grad_norm": 0.9453125, "learning_rate": 0.0004916748423323424, "loss": 5.2705, "mean_token_accuracy": 0.1953233301639557, "num_tokens": 22216114.0, "step": 9700 }, { "entropy": 5.556869029998779, "epoch": 0.9593712930011863, "grad_norm": 0.9609375, "learning_rate": 0.0004916653288795443, "loss": 5.2194, "mean_token_accuracy": 0.2003053143620491, "num_tokens": 22226793.0, "step": 9705 }, { "entropy": 5.632051563262939, "epoch": 0.9598655595096877, "grad_norm": 0.9453125, "learning_rate": 0.0004916558100967455, "loss": 5.323, "mean_token_accuracy": 0.19371782392263412, "num_tokens": 22237444.0, "step": 9710 }, { "entropy": 5.572880554199219, "epoch": 0.960359826018189, "grad_norm": 0.86328125, "learning_rate": 0.0004916462859841801, "loss": 5.2799, "mean_token_accuracy": 0.1963649123907089, "num_tokens": 22250704.0, "step": 9715 }, { "entropy": 5.596066951751709, "epoch": 0.9608540925266904, "grad_norm": 0.85546875, "learning_rate": 0.0004916367565420826, "loss": 5.317, "mean_token_accuracy": 0.19242674261331558, "num_tokens": 22264533.0, "step": 9720 }, { "entropy": 5.671209478378296, "epoch": 0.9613483590351918, "grad_norm": 0.890625, "learning_rate": 0.0004916272217706871, "loss": 5.3094, "mean_token_accuracy": 0.19443402588367462, "num_tokens": 22276510.0, "step": 9725 }, { "entropy": 5.6441021919250485, "epoch": 0.9618426255436932, "grad_norm": 0.93359375, "learning_rate": 0.0004916176816702284, "loss": 5.3476, "mean_token_accuracy": 0.19152981638908387, "num_tokens": 22288634.0, "step": 9730 }, { "entropy": 5.6352660179138185, "epoch": 0.9623368920521945, "grad_norm": 1.0234375, "learning_rate": 0.0004916081362409411, "loss": 5.3244, "mean_token_accuracy": 0.19086754620075225, "num_tokens": 22299781.0, "step": 9735 }, { "entropy": 5.5452476978302006, "epoch": 0.9628311585606959, "grad_norm": 1.1171875, "learning_rate": 0.00049159858548306, "loss": 5.159, "mean_token_accuracy": 0.20362296253442763, "num_tokens": 22310666.0, "step": 9740 }, { "entropy": 5.6343714714050295, "epoch": 0.9633254250691973, "grad_norm": 1.0, "learning_rate": 0.0004915890293968202, "loss": 5.348, "mean_token_accuracy": 0.18939732909202575, "num_tokens": 22322811.0, "step": 9745 }, { "entropy": 5.631976366043091, "epoch": 0.9638196915776986, "grad_norm": 0.984375, "learning_rate": 0.0004915794679824567, "loss": 5.2991, "mean_token_accuracy": 0.18904318809509277, "num_tokens": 22335017.0, "step": 9750 }, { "entropy": 5.544374179840088, "epoch": 0.9643139580862001, "grad_norm": 0.91796875, "learning_rate": 0.0004915699012402047, "loss": 5.2298, "mean_token_accuracy": 0.19919786155223845, "num_tokens": 22346250.0, "step": 9755 }, { "entropy": 5.613706016540528, "epoch": 0.9648082245947015, "grad_norm": 0.99609375, "learning_rate": 0.0004915603291702995, "loss": 5.264, "mean_token_accuracy": 0.19339928925037383, "num_tokens": 22357436.0, "step": 9760 }, { "entropy": 5.594664573669434, "epoch": 0.9653024911032029, "grad_norm": 1.0859375, "learning_rate": 0.0004915507517729765, "loss": 5.2334, "mean_token_accuracy": 0.1982589155435562, "num_tokens": 22368312.0, "step": 9765 }, { "entropy": 5.5927104473114015, "epoch": 0.9657967576117042, "grad_norm": 0.9453125, "learning_rate": 0.0004915411690484715, "loss": 5.2781, "mean_token_accuracy": 0.19157530665397643, "num_tokens": 22378659.0, "step": 9770 }, { "entropy": 5.593868017196655, "epoch": 0.9662910241202056, "grad_norm": 1.0078125, "learning_rate": 0.0004915315809970202, "loss": 5.2662, "mean_token_accuracy": 0.19319010972976686, "num_tokens": 22390642.0, "step": 9775 }, { "entropy": 5.630519723892212, "epoch": 0.966785290628707, "grad_norm": 0.9453125, "learning_rate": 0.0004915219876188583, "loss": 5.3582, "mean_token_accuracy": 0.1859220966696739, "num_tokens": 22402484.0, "step": 9780 }, { "entropy": 5.596364498138428, "epoch": 0.9672795571372084, "grad_norm": 0.9609375, "learning_rate": 0.0004915123889142221, "loss": 5.2394, "mean_token_accuracy": 0.1959250897169113, "num_tokens": 22413315.0, "step": 9785 }, { "entropy": 5.63036413192749, "epoch": 0.9677738236457097, "grad_norm": 0.921875, "learning_rate": 0.0004915027848833472, "loss": 5.3053, "mean_token_accuracy": 0.185574010014534, "num_tokens": 22425123.0, "step": 9790 }, { "entropy": 5.590751886367798, "epoch": 0.9682680901542111, "grad_norm": 1.0546875, "learning_rate": 0.0004914931755264705, "loss": 5.2172, "mean_token_accuracy": 0.1964314192533493, "num_tokens": 22436437.0, "step": 9795 }, { "entropy": 5.588899612426758, "epoch": 0.9687623566627125, "grad_norm": 1.0546875, "learning_rate": 0.000491483560843828, "loss": 5.1897, "mean_token_accuracy": 0.2030069649219513, "num_tokens": 22446677.0, "step": 9800 }, { "entropy": 5.532982540130615, "epoch": 0.969256623171214, "grad_norm": 0.96875, "learning_rate": 0.0004914739408356563, "loss": 5.2669, "mean_token_accuracy": 0.19747192412614822, "num_tokens": 22457597.0, "step": 9805 }, { "entropy": 5.652509164810181, "epoch": 0.9697508896797153, "grad_norm": 1.046875, "learning_rate": 0.0004914643155021921, "loss": 5.3566, "mean_token_accuracy": 0.19629071205854415, "num_tokens": 22469715.0, "step": 9810 }, { "entropy": 5.62703309059143, "epoch": 0.9702451561882167, "grad_norm": 0.9921875, "learning_rate": 0.0004914546848436722, "loss": 5.2973, "mean_token_accuracy": 0.19120223820209503, "num_tokens": 22479840.0, "step": 9815 }, { "entropy": 5.5469378471374515, "epoch": 0.9707394226967181, "grad_norm": 0.96484375, "learning_rate": 0.0004914450488603334, "loss": 5.215, "mean_token_accuracy": 0.19684406816959382, "num_tokens": 22491017.0, "step": 9820 }, { "entropy": 5.6205246925354, "epoch": 0.9712336892052195, "grad_norm": 0.9609375, "learning_rate": 0.0004914354075524129, "loss": 5.2066, "mean_token_accuracy": 0.20054888129234313, "num_tokens": 22502308.0, "step": 9825 }, { "entropy": 5.457305383682251, "epoch": 0.9717279557137208, "grad_norm": 1.0, "learning_rate": 0.0004914257609201477, "loss": 5.1466, "mean_token_accuracy": 0.20433254539966583, "num_tokens": 22513090.0, "step": 9830 }, { "entropy": 5.546218776702881, "epoch": 0.9722222222222222, "grad_norm": 1.0703125, "learning_rate": 0.0004914161089637752, "loss": 5.2284, "mean_token_accuracy": 0.1937375172972679, "num_tokens": 22523391.0, "step": 9835 }, { "entropy": 5.56900429725647, "epoch": 0.9727164887307236, "grad_norm": 0.8828125, "learning_rate": 0.0004914064516835329, "loss": 5.2174, "mean_token_accuracy": 0.20210507214069368, "num_tokens": 22536038.0, "step": 9840 }, { "entropy": 5.591285657882691, "epoch": 0.973210755239225, "grad_norm": 0.88671875, "learning_rate": 0.0004913967890796583, "loss": 5.2532, "mean_token_accuracy": 0.19766981303691863, "num_tokens": 22546897.0, "step": 9845 }, { "entropy": 5.57480411529541, "epoch": 0.9737050217477263, "grad_norm": 0.9296875, "learning_rate": 0.0004913871211523891, "loss": 5.3132, "mean_token_accuracy": 0.19203695207834243, "num_tokens": 22558240.0, "step": 9850 }, { "entropy": 5.578627586364746, "epoch": 0.9741992882562278, "grad_norm": 0.98046875, "learning_rate": 0.0004913774479019633, "loss": 5.2548, "mean_token_accuracy": 0.20199158042669296, "num_tokens": 22570540.0, "step": 9855 }, { "entropy": 5.651106119155884, "epoch": 0.9746935547647292, "grad_norm": 0.8984375, "learning_rate": 0.0004913677693286185, "loss": 5.349, "mean_token_accuracy": 0.18967558592557907, "num_tokens": 22582657.0, "step": 9860 }, { "entropy": 5.712968397140503, "epoch": 0.9751878212732306, "grad_norm": 1.0546875, "learning_rate": 0.0004913580854325932, "loss": 5.3758, "mean_token_accuracy": 0.1897176682949066, "num_tokens": 22593445.0, "step": 9865 }, { "entropy": 5.588431358337402, "epoch": 0.9756820877817319, "grad_norm": 0.9609375, "learning_rate": 0.0004913483962141253, "loss": 5.2308, "mean_token_accuracy": 0.19781755059957504, "num_tokens": 22604631.0, "step": 9870 }, { "entropy": 5.541736459732055, "epoch": 0.9761763542902333, "grad_norm": 1.046875, "learning_rate": 0.0004913387016734533, "loss": 5.2313, "mean_token_accuracy": 0.1967095360159874, "num_tokens": 22615130.0, "step": 9875 }, { "entropy": 5.574322128295899, "epoch": 0.9766706207987347, "grad_norm": 0.8984375, "learning_rate": 0.0004913290018108157, "loss": 5.2424, "mean_token_accuracy": 0.1940597414970398, "num_tokens": 22627372.0, "step": 9880 }, { "entropy": 5.659443187713623, "epoch": 0.977164887307236, "grad_norm": 1.0, "learning_rate": 0.0004913192966264511, "loss": 5.3256, "mean_token_accuracy": 0.19165087789297103, "num_tokens": 22640354.0, "step": 9885 }, { "entropy": 5.627220487594604, "epoch": 0.9776591538157374, "grad_norm": 1.0078125, "learning_rate": 0.0004913095861205982, "loss": 5.3192, "mean_token_accuracy": 0.1916943982243538, "num_tokens": 22651717.0, "step": 9890 }, { "entropy": 5.658727502822876, "epoch": 0.9781534203242388, "grad_norm": 0.91796875, "learning_rate": 0.0004912998702934961, "loss": 5.3791, "mean_token_accuracy": 0.18627908676862717, "num_tokens": 22663334.0, "step": 9895 }, { "entropy": 5.636075162887574, "epoch": 0.9786476868327402, "grad_norm": 0.890625, "learning_rate": 0.0004912901491453835, "loss": 5.2544, "mean_token_accuracy": 0.19907960295677185, "num_tokens": 22675894.0, "step": 9900 }, { "entropy": 5.481875324249268, "epoch": 0.9791419533412415, "grad_norm": 0.890625, "learning_rate": 0.0004912804226764997, "loss": 5.1914, "mean_token_accuracy": 0.20604961663484572, "num_tokens": 22687861.0, "step": 9905 }, { "entropy": 5.597089004516602, "epoch": 0.979636219849743, "grad_norm": 0.9296875, "learning_rate": 0.0004912706908870838, "loss": 5.2199, "mean_token_accuracy": 0.19496510028839112, "num_tokens": 22698346.0, "step": 9910 }, { "entropy": 5.599342155456543, "epoch": 0.9801304863582444, "grad_norm": 0.9609375, "learning_rate": 0.0004912609537773755, "loss": 5.3362, "mean_token_accuracy": 0.18920221477746962, "num_tokens": 22710665.0, "step": 9915 }, { "entropy": 5.602873754501343, "epoch": 0.9806247528667458, "grad_norm": 1.03125, "learning_rate": 0.0004912512113476142, "loss": 5.2283, "mean_token_accuracy": 0.20459803938865662, "num_tokens": 22720989.0, "step": 9920 }, { "entropy": 5.533445405960083, "epoch": 0.9811190193752471, "grad_norm": 0.97265625, "learning_rate": 0.0004912414635980395, "loss": 5.2429, "mean_token_accuracy": 0.20161013603210448, "num_tokens": 22732265.0, "step": 9925 }, { "entropy": 5.550347137451172, "epoch": 0.9816132858837485, "grad_norm": 0.91015625, "learning_rate": 0.0004912317105288912, "loss": 5.2333, "mean_token_accuracy": 0.19435042142868042, "num_tokens": 22742435.0, "step": 9930 }, { "entropy": 5.52305040359497, "epoch": 0.9821075523922499, "grad_norm": 0.90625, "learning_rate": 0.0004912219521404094, "loss": 5.2154, "mean_token_accuracy": 0.19586779028177262, "num_tokens": 22753750.0, "step": 9935 }, { "entropy": 5.606690979003906, "epoch": 0.9826018189007513, "grad_norm": 0.89453125, "learning_rate": 0.000491212188432834, "loss": 5.2698, "mean_token_accuracy": 0.19216922372579576, "num_tokens": 22765549.0, "step": 9940 }, { "entropy": 5.596594047546387, "epoch": 0.9830960854092526, "grad_norm": 0.9296875, "learning_rate": 0.0004912024194064052, "loss": 5.3165, "mean_token_accuracy": 0.19293341040611267, "num_tokens": 22777882.0, "step": 9945 }, { "entropy": 5.658262062072754, "epoch": 0.983590351917754, "grad_norm": 0.9375, "learning_rate": 0.0004911926450613633, "loss": 5.3577, "mean_token_accuracy": 0.18464237600564956, "num_tokens": 22789671.0, "step": 9950 }, { "entropy": 5.641764354705811, "epoch": 0.9840846184262554, "grad_norm": 1.03125, "learning_rate": 0.0004911828653979488, "loss": 5.3077, "mean_token_accuracy": 0.18895188122987747, "num_tokens": 22801330.0, "step": 9955 }, { "entropy": 5.602609252929687, "epoch": 0.9845788849347569, "grad_norm": 0.9375, "learning_rate": 0.0004911730804164024, "loss": 5.3423, "mean_token_accuracy": 0.18876313269138337, "num_tokens": 22813998.0, "step": 9960 }, { "entropy": 5.5710491180419925, "epoch": 0.9850731514432582, "grad_norm": 1.0390625, "learning_rate": 0.0004911632901169645, "loss": 5.2502, "mean_token_accuracy": 0.19529775828123092, "num_tokens": 22825048.0, "step": 9965 }, { "entropy": 5.50880880355835, "epoch": 0.9855674179517596, "grad_norm": 1.0859375, "learning_rate": 0.0004911534944998762, "loss": 5.1748, "mean_token_accuracy": 0.20166675448417665, "num_tokens": 22835450.0, "step": 9970 }, { "entropy": 5.566678714752197, "epoch": 0.986061684460261, "grad_norm": 0.80078125, "learning_rate": 0.0004911436935653785, "loss": 5.2273, "mean_token_accuracy": 0.1978338822722435, "num_tokens": 22847320.0, "step": 9975 }, { "entropy": 5.569015407562256, "epoch": 0.9865559509687624, "grad_norm": 0.96875, "learning_rate": 0.0004911338873137122, "loss": 5.1997, "mean_token_accuracy": 0.20487801283597945, "num_tokens": 22857676.0, "step": 9980 }, { "entropy": 5.496917724609375, "epoch": 0.9870502174772637, "grad_norm": 0.86328125, "learning_rate": 0.000491124075745119, "loss": 5.2121, "mean_token_accuracy": 0.19982381910085678, "num_tokens": 22869767.0, "step": 9985 }, { "entropy": 5.605363607406616, "epoch": 0.9875444839857651, "grad_norm": 0.96875, "learning_rate": 0.0004911142588598399, "loss": 5.3039, "mean_token_accuracy": 0.19786881804466247, "num_tokens": 22880096.0, "step": 9990 }, { "entropy": 5.6250762939453125, "epoch": 0.9880387504942665, "grad_norm": 0.921875, "learning_rate": 0.0004911044366581165, "loss": 5.2213, "mean_token_accuracy": 0.1927218943834305, "num_tokens": 22892436.0, "step": 9995 }, { "entropy": 5.598332834243775, "epoch": 0.9885330170027679, "grad_norm": 1.03125, "learning_rate": 0.0004910946091401903, "loss": 5.2544, "mean_token_accuracy": 0.19252291917800904, "num_tokens": 22904641.0, "step": 10000 }, { "entropy": 5.544689035415649, "epoch": 0.9890272835112692, "grad_norm": 0.94140625, "learning_rate": 0.0004910847763063033, "loss": 5.1299, "mean_token_accuracy": 0.20371597707271577, "num_tokens": 22915372.0, "step": 10005 }, { "entropy": 5.634660625457764, "epoch": 0.9895215500197707, "grad_norm": 0.96484375, "learning_rate": 0.0004910749381566973, "loss": 5.3505, "mean_token_accuracy": 0.1871284857392311, "num_tokens": 22926583.0, "step": 10010 }, { "entropy": 5.595619869232178, "epoch": 0.9900158165282721, "grad_norm": 0.92578125, "learning_rate": 0.0004910650946916143, "loss": 5.2026, "mean_token_accuracy": 0.1953663185238838, "num_tokens": 22938103.0, "step": 10015 }, { "entropy": 5.5323559761047365, "epoch": 0.9905100830367735, "grad_norm": 0.96484375, "learning_rate": 0.0004910552459112964, "loss": 5.2605, "mean_token_accuracy": 0.1967048615217209, "num_tokens": 22949475.0, "step": 10020 }, { "entropy": 5.612260818481445, "epoch": 0.9910043495452748, "grad_norm": 0.875, "learning_rate": 0.0004910453918159861, "loss": 5.2854, "mean_token_accuracy": 0.19485439956188202, "num_tokens": 22961404.0, "step": 10025 }, { "entropy": 5.5902708053588865, "epoch": 0.9914986160537762, "grad_norm": 0.94140625, "learning_rate": 0.0004910355324059255, "loss": 5.2689, "mean_token_accuracy": 0.1989734038710594, "num_tokens": 22973009.0, "step": 10030 }, { "entropy": 5.588032579421997, "epoch": 0.9919928825622776, "grad_norm": 1.0859375, "learning_rate": 0.0004910256676813572, "loss": 5.2984, "mean_token_accuracy": 0.19672427475452423, "num_tokens": 22985104.0, "step": 10035 }, { "entropy": 5.591600799560547, "epoch": 0.992487149070779, "grad_norm": 0.9140625, "learning_rate": 0.0004910157976425241, "loss": 5.2998, "mean_token_accuracy": 0.19046307504177093, "num_tokens": 22997133.0, "step": 10040 }, { "entropy": 5.553076124191284, "epoch": 0.9929814155792803, "grad_norm": 1.015625, "learning_rate": 0.0004910059222896689, "loss": 5.1364, "mean_token_accuracy": 0.20114083737134933, "num_tokens": 23007621.0, "step": 10045 }, { "entropy": 5.609169816970825, "epoch": 0.9934756820877817, "grad_norm": 0.99609375, "learning_rate": 0.0004909960416230344, "loss": 5.2991, "mean_token_accuracy": 0.19364230185747147, "num_tokens": 23018254.0, "step": 10050 }, { "entropy": 5.612542819976807, "epoch": 0.9939699485962831, "grad_norm": 1.015625, "learning_rate": 0.0004909861556428638, "loss": 5.2209, "mean_token_accuracy": 0.19697993993759155, "num_tokens": 23030733.0, "step": 10055 }, { "entropy": 5.546843433380127, "epoch": 0.9944642151047846, "grad_norm": 0.91796875, "learning_rate": 0.0004909762643494003, "loss": 5.2104, "mean_token_accuracy": 0.19433864802122117, "num_tokens": 23043086.0, "step": 10060 }, { "entropy": 5.667683506011963, "epoch": 0.9949584816132859, "grad_norm": 0.94140625, "learning_rate": 0.0004909663677428872, "loss": 5.4055, "mean_token_accuracy": 0.1863715410232544, "num_tokens": 23055281.0, "step": 10065 }, { "entropy": 5.556335878372193, "epoch": 0.9954527481217873, "grad_norm": 0.98828125, "learning_rate": 0.0004909564658235678, "loss": 5.2608, "mean_token_accuracy": 0.19995205253362655, "num_tokens": 23067332.0, "step": 10070 }, { "entropy": 5.565681457519531, "epoch": 0.9959470146302887, "grad_norm": 0.92578125, "learning_rate": 0.000490946558591686, "loss": 5.2416, "mean_token_accuracy": 0.19648875743150712, "num_tokens": 23079278.0, "step": 10075 }, { "entropy": 5.596590185165406, "epoch": 0.99644128113879, "grad_norm": 0.94921875, "learning_rate": 0.0004909366460474852, "loss": 5.2571, "mean_token_accuracy": 0.19538120329380035, "num_tokens": 23092177.0, "step": 10080 }, { "entropy": 5.49100284576416, "epoch": 0.9969355476472914, "grad_norm": 0.859375, "learning_rate": 0.0004909267281912095, "loss": 5.2338, "mean_token_accuracy": 0.19839042723178862, "num_tokens": 23103249.0, "step": 10085 }, { "entropy": 5.589391231536865, "epoch": 0.9974298141557928, "grad_norm": 0.9375, "learning_rate": 0.0004909168050231029, "loss": 5.2946, "mean_token_accuracy": 0.19781017154455185, "num_tokens": 23113821.0, "step": 10090 }, { "entropy": 5.631435203552246, "epoch": 0.9979240806642942, "grad_norm": 0.9453125, "learning_rate": 0.0004909068765434093, "loss": 5.297, "mean_token_accuracy": 0.18893093913793563, "num_tokens": 23124819.0, "step": 10095 }, { "entropy": 5.5806742191314695, "epoch": 0.9984183471727955, "grad_norm": 0.984375, "learning_rate": 0.000490896942752373, "loss": 5.2972, "mean_token_accuracy": 0.19282439202070237, "num_tokens": 23135590.0, "step": 10100 }, { "entropy": 5.624421644210815, "epoch": 0.9989126136812969, "grad_norm": 0.9140625, "learning_rate": 0.0004908870036502384, "loss": 5.2642, "mean_token_accuracy": 0.19772843420505523, "num_tokens": 23147290.0, "step": 10105 }, { "entropy": 5.6308904647827145, "epoch": 0.9994068801897983, "grad_norm": 1.078125, "learning_rate": 0.0004908770592372501, "loss": 5.2613, "mean_token_accuracy": 0.19748442023992538, "num_tokens": 23158276.0, "step": 10110 }, { "entropy": 5.5639791011810305, "epoch": 0.9999011466982998, "grad_norm": 0.98828125, "learning_rate": 0.0004908671095136526, "loss": 5.2238, "mean_token_accuracy": 0.19613727331161498, "num_tokens": 23169174.0, "step": 10115 }, { "entropy": 5.585605335235596, "epoch": 1.0003954132068011, "grad_norm": 0.90234375, "learning_rate": 0.0004908571544796908, "loss": 5.2497, "mean_token_accuracy": 0.19346072971820832, "num_tokens": 23180377.0, "step": 10120 }, { "entropy": 5.593979167938232, "epoch": 1.0008896797153024, "grad_norm": 0.98046875, "learning_rate": 0.0004908471941356094, "loss": 5.1885, "mean_token_accuracy": 0.20065478682518006, "num_tokens": 23191158.0, "step": 10125 }, { "entropy": 5.623124504089356, "epoch": 1.001383946223804, "grad_norm": 0.98828125, "learning_rate": 0.0004908372284816537, "loss": 5.2104, "mean_token_accuracy": 0.19927489012479782, "num_tokens": 23201956.0, "step": 10130 }, { "entropy": 5.556985473632812, "epoch": 1.0018782127323052, "grad_norm": 0.8984375, "learning_rate": 0.0004908272575180685, "loss": 5.1645, "mean_token_accuracy": 0.1972332179546356, "num_tokens": 23213449.0, "step": 10135 }, { "entropy": 5.633550548553467, "epoch": 1.0023724792408066, "grad_norm": 0.921875, "learning_rate": 0.0004908172812450993, "loss": 5.2507, "mean_token_accuracy": 0.19100189954042435, "num_tokens": 23226514.0, "step": 10140 }, { "entropy": 5.557511997222901, "epoch": 1.0028667457493081, "grad_norm": 0.984375, "learning_rate": 0.0004908072996629917, "loss": 5.1514, "mean_token_accuracy": 0.19451895207166672, "num_tokens": 23239322.0, "step": 10145 }, { "entropy": 5.597365808486939, "epoch": 1.0033610122578094, "grad_norm": 0.953125, "learning_rate": 0.0004907973127719909, "loss": 5.2014, "mean_token_accuracy": 0.19688851833343507, "num_tokens": 23250990.0, "step": 10150 }, { "entropy": 5.57306137084961, "epoch": 1.0038552787663109, "grad_norm": 1.0234375, "learning_rate": 0.0004907873205723427, "loss": 5.2405, "mean_token_accuracy": 0.18654904663562774, "num_tokens": 23261630.0, "step": 10155 }, { "entropy": 5.626395797729492, "epoch": 1.0043495452748121, "grad_norm": 0.890625, "learning_rate": 0.000490777323064293, "loss": 5.2002, "mean_token_accuracy": 0.19461013674736022, "num_tokens": 23272823.0, "step": 10160 }, { "entropy": 5.499048042297363, "epoch": 1.0048438117833136, "grad_norm": 0.97265625, "learning_rate": 0.0004907673202480876, "loss": 5.0182, "mean_token_accuracy": 0.22085244655609132, "num_tokens": 23282827.0, "step": 10165 }, { "entropy": 5.53596978187561, "epoch": 1.0053380782918149, "grad_norm": 0.95703125, "learning_rate": 0.0004907573121239727, "loss": 5.1913, "mean_token_accuracy": 0.19749634712934494, "num_tokens": 23295359.0, "step": 10170 }, { "entropy": 5.587849283218384, "epoch": 1.0058323448003164, "grad_norm": 0.984375, "learning_rate": 0.0004907472986921945, "loss": 5.1722, "mean_token_accuracy": 0.20383142232894896, "num_tokens": 23305932.0, "step": 10175 }, { "entropy": 5.562389373779297, "epoch": 1.0063266113088176, "grad_norm": 0.9140625, "learning_rate": 0.0004907372799529992, "loss": 5.1627, "mean_token_accuracy": 0.19517763704061508, "num_tokens": 23317856.0, "step": 10180 }, { "entropy": 5.553172779083252, "epoch": 1.006820877817319, "grad_norm": 1.0625, "learning_rate": 0.0004907272559066334, "loss": 5.0623, "mean_token_accuracy": 0.21483731865882874, "num_tokens": 23328071.0, "step": 10185 }, { "entropy": 5.5246669292449955, "epoch": 1.0073151443258206, "grad_norm": 0.9296875, "learning_rate": 0.0004907172265533436, "loss": 5.2258, "mean_token_accuracy": 0.19424324929714204, "num_tokens": 23339601.0, "step": 10190 }, { "entropy": 5.594854784011841, "epoch": 1.0078094108343219, "grad_norm": 0.9609375, "learning_rate": 0.0004907071918933766, "loss": 5.1841, "mean_token_accuracy": 0.19689080715179444, "num_tokens": 23351672.0, "step": 10195 }, { "entropy": 5.634538173675537, "epoch": 1.0083036773428233, "grad_norm": 1.0, "learning_rate": 0.0004906971519269793, "loss": 5.2324, "mean_token_accuracy": 0.19556740522384644, "num_tokens": 23361684.0, "step": 10200 }, { "entropy": 5.4859215259552006, "epoch": 1.0087979438513246, "grad_norm": 0.91796875, "learning_rate": 0.0004906871066543984, "loss": 5.2044, "mean_token_accuracy": 0.1972535192966461, "num_tokens": 23373969.0, "step": 10205 }, { "entropy": 5.64646315574646, "epoch": 1.009292210359826, "grad_norm": 0.890625, "learning_rate": 0.0004906770560758813, "loss": 5.2131, "mean_token_accuracy": 0.1878487154841423, "num_tokens": 23384747.0, "step": 10210 }, { "entropy": 5.645415449142456, "epoch": 1.0097864768683273, "grad_norm": 0.91796875, "learning_rate": 0.0004906670001916752, "loss": 5.191, "mean_token_accuracy": 0.1991061046719551, "num_tokens": 23395900.0, "step": 10215 }, { "entropy": 5.570387697219848, "epoch": 1.0102807433768288, "grad_norm": 0.859375, "learning_rate": 0.0004906569390020274, "loss": 5.1887, "mean_token_accuracy": 0.1975845292210579, "num_tokens": 23408912.0, "step": 10220 }, { "entropy": 5.56952977180481, "epoch": 1.01077500988533, "grad_norm": 0.97265625, "learning_rate": 0.0004906468725071855, "loss": 5.1338, "mean_token_accuracy": 0.2026058167219162, "num_tokens": 23419042.0, "step": 10225 }, { "entropy": 5.5745645523071286, "epoch": 1.0112692763938316, "grad_norm": 0.90625, "learning_rate": 0.000490636800707397, "loss": 5.1714, "mean_token_accuracy": 0.20130863040685654, "num_tokens": 23430861.0, "step": 10230 }, { "entropy": 5.681187677383423, "epoch": 1.0117635429023328, "grad_norm": 0.91015625, "learning_rate": 0.0004906267236029099, "loss": 5.2873, "mean_token_accuracy": 0.18768440634012223, "num_tokens": 23443489.0, "step": 10235 }, { "entropy": 5.591514539718628, "epoch": 1.0122578094108343, "grad_norm": 0.96484375, "learning_rate": 0.0004906166411939718, "loss": 5.2093, "mean_token_accuracy": 0.19726848006248474, "num_tokens": 23454327.0, "step": 10240 }, { "entropy": 5.5306089401245115, "epoch": 1.0127520759193358, "grad_norm": 0.88671875, "learning_rate": 0.0004906065534808309, "loss": 5.0844, "mean_token_accuracy": 0.20889917463064195, "num_tokens": 23466684.0, "step": 10245 }, { "entropy": 5.575207185745239, "epoch": 1.013246342427837, "grad_norm": 0.96484375, "learning_rate": 0.0004905964604637353, "loss": 5.2012, "mean_token_accuracy": 0.1996330663561821, "num_tokens": 23478347.0, "step": 10250 }, { "entropy": 5.521748065948486, "epoch": 1.0137406089363385, "grad_norm": 0.90625, "learning_rate": 0.0004905863621429334, "loss": 5.085, "mean_token_accuracy": 0.20203756392002106, "num_tokens": 23489588.0, "step": 10255 }, { "entropy": 5.508632469177246, "epoch": 1.0142348754448398, "grad_norm": 0.9453125, "learning_rate": 0.0004905762585186735, "loss": 5.1496, "mean_token_accuracy": 0.19950958490371704, "num_tokens": 23501347.0, "step": 10260 }, { "entropy": 5.649310636520386, "epoch": 1.0147291419533413, "grad_norm": 0.8984375, "learning_rate": 0.0004905661495912042, "loss": 5.2581, "mean_token_accuracy": 0.1926944375038147, "num_tokens": 23513036.0, "step": 10265 }, { "entropy": 5.528190422058105, "epoch": 1.0152234084618426, "grad_norm": 0.98828125, "learning_rate": 0.0004905560353607742, "loss": 5.1166, "mean_token_accuracy": 0.2033214971423149, "num_tokens": 23524166.0, "step": 10270 }, { "entropy": 5.552065658569336, "epoch": 1.015717674970344, "grad_norm": 0.94140625, "learning_rate": 0.0004905459158276323, "loss": 5.1879, "mean_token_accuracy": 0.19220776557922364, "num_tokens": 23536638.0, "step": 10275 }, { "entropy": 5.5671367168426515, "epoch": 1.0162119414788453, "grad_norm": 0.97265625, "learning_rate": 0.0004905357909920275, "loss": 5.2173, "mean_token_accuracy": 0.20055870711803436, "num_tokens": 23548567.0, "step": 10280 }, { "entropy": 5.57700777053833, "epoch": 1.0167062079873468, "grad_norm": 1.0078125, "learning_rate": 0.0004905256608542086, "loss": 5.14, "mean_token_accuracy": 0.2022263899445534, "num_tokens": 23560108.0, "step": 10285 }, { "entropy": 5.537317228317261, "epoch": 1.0172004744958483, "grad_norm": 0.96484375, "learning_rate": 0.0004905155254144251, "loss": 5.1423, "mean_token_accuracy": 0.20561775267124177, "num_tokens": 23571542.0, "step": 10290 }, { "entropy": 5.529106140136719, "epoch": 1.0176947410043495, "grad_norm": 0.96875, "learning_rate": 0.0004905053846729263, "loss": 5.1058, "mean_token_accuracy": 0.20332622528076172, "num_tokens": 23582200.0, "step": 10295 }, { "entropy": 5.6068085670471195, "epoch": 1.018189007512851, "grad_norm": 0.9296875, "learning_rate": 0.0004904952386299616, "loss": 5.2184, "mean_token_accuracy": 0.19524989575147628, "num_tokens": 23594530.0, "step": 10300 }, { "entropy": 5.515394258499145, "epoch": 1.0186832740213523, "grad_norm": 0.9453125, "learning_rate": 0.0004904850872857805, "loss": 5.0462, "mean_token_accuracy": 0.21549864560365678, "num_tokens": 23605697.0, "step": 10305 }, { "entropy": 5.558986806869507, "epoch": 1.0191775405298538, "grad_norm": 0.9609375, "learning_rate": 0.000490474930640633, "loss": 5.233, "mean_token_accuracy": 0.19493394941091538, "num_tokens": 23615730.0, "step": 10310 }, { "entropy": 5.541457939147949, "epoch": 1.019671807038355, "grad_norm": 0.90625, "learning_rate": 0.0004904647686947687, "loss": 5.1419, "mean_token_accuracy": 0.20664628744125366, "num_tokens": 23627242.0, "step": 10315 }, { "entropy": 5.492803478240967, "epoch": 1.0201660735468565, "grad_norm": 0.94140625, "learning_rate": 0.0004904546014484376, "loss": 5.0619, "mean_token_accuracy": 0.2093379646539688, "num_tokens": 23639450.0, "step": 10320 }, { "entropy": 5.55984091758728, "epoch": 1.0206603400553578, "grad_norm": 0.8671875, "learning_rate": 0.0004904444289018898, "loss": 5.1867, "mean_token_accuracy": 0.19723592698574066, "num_tokens": 23651154.0, "step": 10325 }, { "entropy": 5.589946031570435, "epoch": 1.0211546065638593, "grad_norm": 0.7890625, "learning_rate": 0.0004904342510553758, "loss": 5.2483, "mean_token_accuracy": 0.19353913217782975, "num_tokens": 23663996.0, "step": 10330 }, { "entropy": 5.587545919418335, "epoch": 1.0216488730723605, "grad_norm": 0.9453125, "learning_rate": 0.0004904240679091458, "loss": 5.1767, "mean_token_accuracy": 0.1984504997730255, "num_tokens": 23676270.0, "step": 10335 }, { "entropy": 5.6075948715209964, "epoch": 1.022143139580862, "grad_norm": 0.90625, "learning_rate": 0.0004904138794634502, "loss": 5.1622, "mean_token_accuracy": 0.19641509056091308, "num_tokens": 23687483.0, "step": 10340 }, { "entropy": 5.576608180999756, "epoch": 1.0226374060893635, "grad_norm": 1.078125, "learning_rate": 0.0004904036857185398, "loss": 5.2512, "mean_token_accuracy": 0.19206532835960388, "num_tokens": 23697956.0, "step": 10345 }, { "entropy": 5.567797994613647, "epoch": 1.0231316725978647, "grad_norm": 1.0234375, "learning_rate": 0.0004903934866746653, "loss": 5.1722, "mean_token_accuracy": 0.2047306090593338, "num_tokens": 23709029.0, "step": 10350 }, { "entropy": 5.580752325057984, "epoch": 1.0236259391063662, "grad_norm": 0.94921875, "learning_rate": 0.0004903832823320777, "loss": 5.1256, "mean_token_accuracy": 0.2092859461903572, "num_tokens": 23719792.0, "step": 10355 }, { "entropy": 5.556148529052734, "epoch": 1.0241202056148675, "grad_norm": 0.9609375, "learning_rate": 0.0004903730726910278, "loss": 5.1811, "mean_token_accuracy": 0.200365349650383, "num_tokens": 23730201.0, "step": 10360 }, { "entropy": 5.538752794265747, "epoch": 1.024614472123369, "grad_norm": 0.88671875, "learning_rate": 0.000490362857751767, "loss": 5.1248, "mean_token_accuracy": 0.20396237522363664, "num_tokens": 23741743.0, "step": 10365 }, { "entropy": 5.564542531967163, "epoch": 1.0251087386318702, "grad_norm": 0.8515625, "learning_rate": 0.0004903526375145465, "loss": 5.1008, "mean_token_accuracy": 0.20094452053308487, "num_tokens": 23753879.0, "step": 10370 }, { "entropy": 5.576785755157471, "epoch": 1.0256030051403717, "grad_norm": 1.0, "learning_rate": 0.0004903424119796176, "loss": 5.2404, "mean_token_accuracy": 0.19536191821098328, "num_tokens": 23765062.0, "step": 10375 }, { "entropy": 5.555910587310791, "epoch": 1.026097271648873, "grad_norm": 1.0, "learning_rate": 0.0004903321811472321, "loss": 5.2136, "mean_token_accuracy": 0.2016723111271858, "num_tokens": 23777261.0, "step": 10380 }, { "entropy": 5.603865909576416, "epoch": 1.0265915381573745, "grad_norm": 0.9375, "learning_rate": 0.0004903219450176413, "loss": 5.2109, "mean_token_accuracy": 0.1984434485435486, "num_tokens": 23789247.0, "step": 10385 }, { "entropy": 5.545823574066162, "epoch": 1.0270858046658757, "grad_norm": 1.03125, "learning_rate": 0.0004903117035910975, "loss": 5.1249, "mean_token_accuracy": 0.20036312639713288, "num_tokens": 23798981.0, "step": 10390 }, { "entropy": 5.584379816055298, "epoch": 1.0275800711743772, "grad_norm": 0.90625, "learning_rate": 0.0004903014568678523, "loss": 5.2209, "mean_token_accuracy": 0.19911035001277924, "num_tokens": 23810856.0, "step": 10395 }, { "entropy": 5.642748594284058, "epoch": 1.0280743376828787, "grad_norm": 0.9296875, "learning_rate": 0.0004902912048481579, "loss": 5.2152, "mean_token_accuracy": 0.19333504140377045, "num_tokens": 23821544.0, "step": 10400 }, { "entropy": 5.577395343780518, "epoch": 1.02856860419138, "grad_norm": 1.046875, "learning_rate": 0.0004902809475322664, "loss": 5.1267, "mean_token_accuracy": 0.2002933755517006, "num_tokens": 23831972.0, "step": 10405 }, { "entropy": 5.593789911270141, "epoch": 1.0290628706998814, "grad_norm": 0.91015625, "learning_rate": 0.0004902706849204302, "loss": 5.1544, "mean_token_accuracy": 0.2039760798215866, "num_tokens": 23843451.0, "step": 10410 }, { "entropy": 5.553869295120239, "epoch": 1.0295571372083827, "grad_norm": 1.046875, "learning_rate": 0.0004902604170129017, "loss": 5.1678, "mean_token_accuracy": 0.19788942188024522, "num_tokens": 23854060.0, "step": 10415 }, { "entropy": 5.617823362350464, "epoch": 1.0300514037168842, "grad_norm": 0.95703125, "learning_rate": 0.0004902501438099337, "loss": 5.2847, "mean_token_accuracy": 0.19125043004751205, "num_tokens": 23865722.0, "step": 10420 }, { "entropy": 5.5950113296508786, "epoch": 1.0305456702253855, "grad_norm": 1.0625, "learning_rate": 0.0004902398653117787, "loss": 5.207, "mean_token_accuracy": 0.19715650528669357, "num_tokens": 23875888.0, "step": 10425 }, { "entropy": 5.581772899627685, "epoch": 1.031039936733887, "grad_norm": 0.89453125, "learning_rate": 0.0004902295815186896, "loss": 5.2288, "mean_token_accuracy": 0.19258642196655273, "num_tokens": 23887816.0, "step": 10430 }, { "entropy": 5.605518245697022, "epoch": 1.0315342032423882, "grad_norm": 0.87890625, "learning_rate": 0.0004902192924309193, "loss": 5.1596, "mean_token_accuracy": 0.2032099485397339, "num_tokens": 23900468.0, "step": 10435 }, { "entropy": 5.60881609916687, "epoch": 1.0320284697508897, "grad_norm": 0.90625, "learning_rate": 0.0004902089980487211, "loss": 5.1563, "mean_token_accuracy": 0.20327936857938766, "num_tokens": 23912086.0, "step": 10440 }, { "entropy": 5.5391273021698, "epoch": 1.032522736259391, "grad_norm": 1.0859375, "learning_rate": 0.0004901986983723483, "loss": 5.1828, "mean_token_accuracy": 0.19803332090377807, "num_tokens": 23923262.0, "step": 10445 }, { "entropy": 5.543978691101074, "epoch": 1.0330170027678924, "grad_norm": 0.95703125, "learning_rate": 0.000490188393402054, "loss": 5.1204, "mean_token_accuracy": 0.20376888215541838, "num_tokens": 23934660.0, "step": 10450 }, { "entropy": 5.543337774276734, "epoch": 1.033511269276394, "grad_norm": 0.96484375, "learning_rate": 0.0004901780831380919, "loss": 5.1338, "mean_token_accuracy": 0.2077007234096527, "num_tokens": 23945822.0, "step": 10455 }, { "entropy": 5.535459089279175, "epoch": 1.0340055357848952, "grad_norm": 0.91015625, "learning_rate": 0.0004901677675807155, "loss": 5.2115, "mean_token_accuracy": 0.19840507507324218, "num_tokens": 23957312.0, "step": 10460 }, { "entropy": 5.600008726119995, "epoch": 1.0344998022933967, "grad_norm": 0.9375, "learning_rate": 0.0004901574467301786, "loss": 5.1961, "mean_token_accuracy": 0.19396428465843202, "num_tokens": 23968477.0, "step": 10465 }, { "entropy": 5.514800786972046, "epoch": 1.034994068801898, "grad_norm": 1.03125, "learning_rate": 0.0004901471205867353, "loss": 5.106, "mean_token_accuracy": 0.20012577921152114, "num_tokens": 23979041.0, "step": 10470 }, { "entropy": 5.601054334640503, "epoch": 1.0354883353103994, "grad_norm": 0.94140625, "learning_rate": 0.0004901367891506393, "loss": 5.2068, "mean_token_accuracy": 0.1969265818595886, "num_tokens": 23990947.0, "step": 10475 }, { "entropy": 5.587233066558838, "epoch": 1.0359826018189007, "grad_norm": 0.94140625, "learning_rate": 0.000490126452422145, "loss": 5.1332, "mean_token_accuracy": 0.20538911372423171, "num_tokens": 24001652.0, "step": 10480 }, { "entropy": 5.611830329895019, "epoch": 1.0364768683274022, "grad_norm": 0.9296875, "learning_rate": 0.0004901161104015066, "loss": 5.2202, "mean_token_accuracy": 0.18802994340658188, "num_tokens": 24012707.0, "step": 10485 }, { "entropy": 5.457373428344726, "epoch": 1.0369711348359034, "grad_norm": 1.1171875, "learning_rate": 0.0004901057630889784, "loss": 5.0447, "mean_token_accuracy": 0.20681007504463195, "num_tokens": 24024136.0, "step": 10490 }, { "entropy": 5.5800261974334715, "epoch": 1.037465401344405, "grad_norm": 0.953125, "learning_rate": 0.0004900954104848152, "loss": 5.184, "mean_token_accuracy": 0.202939672768116, "num_tokens": 24035586.0, "step": 10495 }, { "entropy": 5.615994691848755, "epoch": 1.0379596678529064, "grad_norm": 0.99609375, "learning_rate": 0.0004900850525892714, "loss": 5.1209, "mean_token_accuracy": 0.20566988587379456, "num_tokens": 24045338.0, "step": 10500 }, { "entropy": 5.592116069793701, "epoch": 1.0384539343614076, "grad_norm": 1.015625, "learning_rate": 0.000490074689402602, "loss": 5.2397, "mean_token_accuracy": 0.19365111142396926, "num_tokens": 24056898.0, "step": 10505 }, { "entropy": 5.482299375534057, "epoch": 1.0389482008699091, "grad_norm": 0.92578125, "learning_rate": 0.0004900643209250619, "loss": 5.0933, "mean_token_accuracy": 0.2095427021384239, "num_tokens": 24068998.0, "step": 10510 }, { "entropy": 5.531379365921021, "epoch": 1.0394424673784104, "grad_norm": 0.98046875, "learning_rate": 0.0004900539471569061, "loss": 5.157, "mean_token_accuracy": 0.197059765458107, "num_tokens": 24080301.0, "step": 10515 }, { "entropy": 5.6000512599945065, "epoch": 1.0399367338869119, "grad_norm": 0.91015625, "learning_rate": 0.00049004356809839, "loss": 5.1973, "mean_token_accuracy": 0.1955845683813095, "num_tokens": 24092601.0, "step": 10520 }, { "entropy": 5.660330820083618, "epoch": 1.0404310003954131, "grad_norm": 0.921875, "learning_rate": 0.0004900331837497686, "loss": 5.2901, "mean_token_accuracy": 0.18693166524171828, "num_tokens": 24105621.0, "step": 10525 }, { "entropy": 5.561062240600586, "epoch": 1.0409252669039146, "grad_norm": 0.88671875, "learning_rate": 0.0004900227941112976, "loss": 5.1514, "mean_token_accuracy": 0.21241918802261353, "num_tokens": 24117926.0, "step": 10530 }, { "entropy": 5.553754615783691, "epoch": 1.0414195334124159, "grad_norm": 0.96484375, "learning_rate": 0.0004900123991832323, "loss": 5.1161, "mean_token_accuracy": 0.1986616373062134, "num_tokens": 24129119.0, "step": 10535 }, { "entropy": 5.505317497253418, "epoch": 1.0419137999209174, "grad_norm": 1.0625, "learning_rate": 0.0004900019989658288, "loss": 5.1865, "mean_token_accuracy": 0.19536062628030776, "num_tokens": 24141726.0, "step": 10540 }, { "entropy": 5.675905227661133, "epoch": 1.0424080664294189, "grad_norm": 0.87890625, "learning_rate": 0.0004899915934593427, "loss": 5.1897, "mean_token_accuracy": 0.19878100007772445, "num_tokens": 24152912.0, "step": 10545 }, { "entropy": 5.644857263565063, "epoch": 1.0429023329379201, "grad_norm": 1.0078125, "learning_rate": 0.0004899811826640302, "loss": 5.2324, "mean_token_accuracy": 0.19198723137378693, "num_tokens": 24163602.0, "step": 10550 }, { "entropy": 5.568471479415893, "epoch": 1.0433965994464216, "grad_norm": 1.0390625, "learning_rate": 0.0004899707665801471, "loss": 5.2276, "mean_token_accuracy": 0.19840405732393265, "num_tokens": 24175904.0, "step": 10555 }, { "entropy": 5.527057790756226, "epoch": 1.0438908659549229, "grad_norm": 0.96875, "learning_rate": 0.0004899603452079499, "loss": 5.14, "mean_token_accuracy": 0.19772833436727524, "num_tokens": 24186438.0, "step": 10560 }, { "entropy": 5.559324312210083, "epoch": 1.0443851324634243, "grad_norm": 1.046875, "learning_rate": 0.0004899499185476948, "loss": 5.2537, "mean_token_accuracy": 0.1917422220110893, "num_tokens": 24198357.0, "step": 10565 }, { "entropy": 5.667194843292236, "epoch": 1.0448793989719256, "grad_norm": 0.9296875, "learning_rate": 0.0004899394865996383, "loss": 5.2923, "mean_token_accuracy": 0.19237663596868515, "num_tokens": 24211257.0, "step": 10570 }, { "entropy": 5.685110569000244, "epoch": 1.045373665480427, "grad_norm": 1.0, "learning_rate": 0.0004899290493640371, "loss": 5.2756, "mean_token_accuracy": 0.1862076923251152, "num_tokens": 24223189.0, "step": 10575 }, { "entropy": 5.539480781555175, "epoch": 1.0458679319889284, "grad_norm": 0.9921875, "learning_rate": 0.0004899186068411481, "loss": 5.1779, "mean_token_accuracy": 0.19652792811393738, "num_tokens": 24234701.0, "step": 10580 }, { "entropy": 5.601236867904663, "epoch": 1.0463621984974298, "grad_norm": 0.95703125, "learning_rate": 0.0004899081590312278, "loss": 5.1634, "mean_token_accuracy": 0.2021886482834816, "num_tokens": 24245562.0, "step": 10585 }, { "entropy": 5.575468301773071, "epoch": 1.046856465005931, "grad_norm": 0.97265625, "learning_rate": 0.0004898977059345336, "loss": 5.1624, "mean_token_accuracy": 0.19369119852781297, "num_tokens": 24256479.0, "step": 10590 }, { "entropy": 5.577045488357544, "epoch": 1.0473507315144326, "grad_norm": 0.98828125, "learning_rate": 0.0004898872475513225, "loss": 5.279, "mean_token_accuracy": 0.1854720890522003, "num_tokens": 24266900.0, "step": 10595 }, { "entropy": 5.653684091567993, "epoch": 1.047844998022934, "grad_norm": 0.90625, "learning_rate": 0.0004898767838818517, "loss": 5.2567, "mean_token_accuracy": 0.18758051544427873, "num_tokens": 24278915.0, "step": 10600 }, { "entropy": 5.560038328170776, "epoch": 1.0483392645314353, "grad_norm": 0.98828125, "learning_rate": 0.0004898663149263787, "loss": 5.1003, "mean_token_accuracy": 0.20755462795495988, "num_tokens": 24289584.0, "step": 10605 }, { "entropy": 5.551368379592896, "epoch": 1.0488335310399368, "grad_norm": 1.0, "learning_rate": 0.0004898558406851611, "loss": 5.1269, "mean_token_accuracy": 0.20389686822891234, "num_tokens": 24300922.0, "step": 10610 }, { "entropy": 5.526907157897949, "epoch": 1.049327797548438, "grad_norm": 0.92578125, "learning_rate": 0.0004898453611584564, "loss": 5.1418, "mean_token_accuracy": 0.19938257783651353, "num_tokens": 24311238.0, "step": 10615 }, { "entropy": 5.531491279602051, "epoch": 1.0498220640569396, "grad_norm": 0.98828125, "learning_rate": 0.0004898348763465226, "loss": 5.1329, "mean_token_accuracy": 0.20273597091436385, "num_tokens": 24322417.0, "step": 10620 }, { "entropy": 5.555086660385132, "epoch": 1.0503163305654408, "grad_norm": 1.140625, "learning_rate": 0.0004898243862496173, "loss": 5.1322, "mean_token_accuracy": 0.20332041382789612, "num_tokens": 24332751.0, "step": 10625 }, { "entropy": 5.637129068374634, "epoch": 1.0508105970739423, "grad_norm": 1.0078125, "learning_rate": 0.0004898138908679989, "loss": 5.2687, "mean_token_accuracy": 0.1866733342409134, "num_tokens": 24345082.0, "step": 10630 }, { "entropy": 5.587485980987549, "epoch": 1.0513048635824436, "grad_norm": 0.89453125, "learning_rate": 0.0004898033902019255, "loss": 5.2005, "mean_token_accuracy": 0.19992978274822235, "num_tokens": 24355863.0, "step": 10635 }, { "entropy": 5.690852117538452, "epoch": 1.051799130090945, "grad_norm": 0.94921875, "learning_rate": 0.0004897928842516553, "loss": 5.2489, "mean_token_accuracy": 0.18884448558092118, "num_tokens": 24367763.0, "step": 10640 }, { "entropy": 5.574813938140869, "epoch": 1.0522933965994463, "grad_norm": 0.98046875, "learning_rate": 0.0004897823730174468, "loss": 5.2144, "mean_token_accuracy": 0.19350397139787673, "num_tokens": 24378943.0, "step": 10645 }, { "entropy": 5.602366018295288, "epoch": 1.0527876631079478, "grad_norm": 0.98828125, "learning_rate": 0.0004897718564995587, "loss": 5.1579, "mean_token_accuracy": 0.20068552047014238, "num_tokens": 24389508.0, "step": 10650 }, { "entropy": 5.536917304992675, "epoch": 1.0532819296164493, "grad_norm": 0.98046875, "learning_rate": 0.0004897613346982495, "loss": 5.0943, "mean_token_accuracy": 0.2058506965637207, "num_tokens": 24400710.0, "step": 10655 }, { "entropy": 5.482138061523438, "epoch": 1.0537761961249505, "grad_norm": 0.9375, "learning_rate": 0.0004897508076137783, "loss": 5.1737, "mean_token_accuracy": 0.19732674658298494, "num_tokens": 24412854.0, "step": 10660 }, { "entropy": 5.590112638473511, "epoch": 1.054270462633452, "grad_norm": 0.9609375, "learning_rate": 0.0004897402752464037, "loss": 5.2116, "mean_token_accuracy": 0.1978938728570938, "num_tokens": 24423212.0, "step": 10665 }, { "entropy": 5.639067888259888, "epoch": 1.0547647291419533, "grad_norm": 1.0234375, "learning_rate": 0.0004897297375963852, "loss": 5.2066, "mean_token_accuracy": 0.19952762722969056, "num_tokens": 24436091.0, "step": 10670 }, { "entropy": 5.518482875823975, "epoch": 1.0552589956504548, "grad_norm": 1.0625, "learning_rate": 0.0004897191946639819, "loss": 5.11, "mean_token_accuracy": 0.20095923393964768, "num_tokens": 24448499.0, "step": 10675 }, { "entropy": 5.630298280715943, "epoch": 1.055753262158956, "grad_norm": 0.96875, "learning_rate": 0.0004897086464494529, "loss": 5.3105, "mean_token_accuracy": 0.190499946475029, "num_tokens": 24460732.0, "step": 10680 }, { "entropy": 5.578917837142944, "epoch": 1.0562475286674575, "grad_norm": 0.984375, "learning_rate": 0.0004896980929530579, "loss": 5.1847, "mean_token_accuracy": 0.20166405588388442, "num_tokens": 24472460.0, "step": 10685 }, { "entropy": 5.564520740509034, "epoch": 1.0567417951759588, "grad_norm": 0.9375, "learning_rate": 0.0004896875341750567, "loss": 5.1549, "mean_token_accuracy": 0.2042364224791527, "num_tokens": 24483820.0, "step": 10690 }, { "entropy": 5.5194141387939455, "epoch": 1.0572360616844603, "grad_norm": 0.9609375, "learning_rate": 0.0004896769701157087, "loss": 5.081, "mean_token_accuracy": 0.2075742870569229, "num_tokens": 24495775.0, "step": 10695 }, { "entropy": 5.5453602313995365, "epoch": 1.0577303281929615, "grad_norm": 0.96484375, "learning_rate": 0.000489666400775274, "loss": 5.1085, "mean_token_accuracy": 0.20910150408744813, "num_tokens": 24505589.0, "step": 10700 }, { "entropy": 5.499241542816162, "epoch": 1.058224594701463, "grad_norm": 0.97265625, "learning_rate": 0.0004896558261540125, "loss": 5.1588, "mean_token_accuracy": 0.20469000190496445, "num_tokens": 24515988.0, "step": 10705 }, { "entropy": 5.492513227462768, "epoch": 1.0587188612099645, "grad_norm": 0.96484375, "learning_rate": 0.0004896452462521844, "loss": 5.1184, "mean_token_accuracy": 0.20551001280546188, "num_tokens": 24528273.0, "step": 10710 }, { "entropy": 5.643070030212402, "epoch": 1.0592131277184658, "grad_norm": 1.09375, "learning_rate": 0.0004896346610700498, "loss": 5.194, "mean_token_accuracy": 0.20344004333019255, "num_tokens": 24539014.0, "step": 10715 }, { "entropy": 5.547551202774048, "epoch": 1.0597073942269672, "grad_norm": 0.8984375, "learning_rate": 0.0004896240706078694, "loss": 5.1333, "mean_token_accuracy": 0.2024830088019371, "num_tokens": 24550210.0, "step": 10720 }, { "entropy": 5.5272807598114015, "epoch": 1.0602016607354685, "grad_norm": 0.87890625, "learning_rate": 0.0004896134748659036, "loss": 5.122, "mean_token_accuracy": 0.2069556564092636, "num_tokens": 24560934.0, "step": 10725 }, { "entropy": 5.551986360549927, "epoch": 1.06069592724397, "grad_norm": 0.95703125, "learning_rate": 0.000489602873844413, "loss": 5.1912, "mean_token_accuracy": 0.19653814136981965, "num_tokens": 24572274.0, "step": 10730 }, { "entropy": 5.5967731952667235, "epoch": 1.0611901937524713, "grad_norm": 0.9296875, "learning_rate": 0.0004895922675436583, "loss": 5.1996, "mean_token_accuracy": 0.1996808260679245, "num_tokens": 24583950.0, "step": 10735 }, { "entropy": 5.5543114185333256, "epoch": 1.0616844602609727, "grad_norm": 0.80859375, "learning_rate": 0.0004895816559639006, "loss": 5.1319, "mean_token_accuracy": 0.20740285217761995, "num_tokens": 24597058.0, "step": 10740 }, { "entropy": 5.463448858261108, "epoch": 1.062178726769474, "grad_norm": 1.0, "learning_rate": 0.0004895710391054008, "loss": 5.0228, "mean_token_accuracy": 0.2110397219657898, "num_tokens": 24608604.0, "step": 10745 }, { "entropy": 5.586876153945923, "epoch": 1.0626729932779755, "grad_norm": 0.99609375, "learning_rate": 0.0004895604169684203, "loss": 5.2288, "mean_token_accuracy": 0.19643951058387757, "num_tokens": 24619707.0, "step": 10750 }, { "entropy": 5.624421882629394, "epoch": 1.063167259786477, "grad_norm": 1.0625, "learning_rate": 0.0004895497895532202, "loss": 5.1588, "mean_token_accuracy": 0.19690649807453156, "num_tokens": 24629579.0, "step": 10755 }, { "entropy": 5.527949666976928, "epoch": 1.0636615262949782, "grad_norm": 0.953125, "learning_rate": 0.0004895391568600619, "loss": 5.1693, "mean_token_accuracy": 0.19112413376569748, "num_tokens": 24641358.0, "step": 10760 }, { "entropy": 5.520353984832764, "epoch": 1.0641557928034797, "grad_norm": 1.0625, "learning_rate": 0.0004895285188892071, "loss": 5.1462, "mean_token_accuracy": 0.19451740831136705, "num_tokens": 24652293.0, "step": 10765 }, { "entropy": 5.594007396697998, "epoch": 1.064650059311981, "grad_norm": 0.9921875, "learning_rate": 0.0004895178756409175, "loss": 5.2738, "mean_token_accuracy": 0.19777637273073195, "num_tokens": 24663370.0, "step": 10770 }, { "entropy": 5.617769765853882, "epoch": 1.0651443258204825, "grad_norm": 0.95703125, "learning_rate": 0.0004895072271154548, "loss": 5.2311, "mean_token_accuracy": 0.19598817080259323, "num_tokens": 24675037.0, "step": 10775 }, { "entropy": 5.577160453796386, "epoch": 1.0656385923289837, "grad_norm": 0.96484375, "learning_rate": 0.0004894965733130812, "loss": 5.1596, "mean_token_accuracy": 0.19636635035276412, "num_tokens": 24685680.0, "step": 10780 }, { "entropy": 5.473557233810425, "epoch": 1.0661328588374852, "grad_norm": 0.93359375, "learning_rate": 0.0004894859142340585, "loss": 5.1302, "mean_token_accuracy": 0.2036169245839119, "num_tokens": 24697831.0, "step": 10785 }, { "entropy": 5.595727396011353, "epoch": 1.0666271253459865, "grad_norm": 0.9375, "learning_rate": 0.0004894752498786491, "loss": 5.1484, "mean_token_accuracy": 0.19863591194152833, "num_tokens": 24710226.0, "step": 10790 }, { "entropy": 5.6004595279693605, "epoch": 1.067121391854488, "grad_norm": 0.92578125, "learning_rate": 0.0004894645802471152, "loss": 5.1653, "mean_token_accuracy": 0.20208276510238649, "num_tokens": 24721743.0, "step": 10795 }, { "entropy": 5.560934972763062, "epoch": 1.0676156583629894, "grad_norm": 0.92578125, "learning_rate": 0.0004894539053397194, "loss": 5.1665, "mean_token_accuracy": 0.19371733963489532, "num_tokens": 24733804.0, "step": 10800 }, { "entropy": 5.551257038116455, "epoch": 1.0681099248714907, "grad_norm": 1.0390625, "learning_rate": 0.0004894432251567242, "loss": 5.1183, "mean_token_accuracy": 0.20756983309984206, "num_tokens": 24745285.0, "step": 10805 }, { "entropy": 5.569929361343384, "epoch": 1.0686041913799922, "grad_norm": 0.93359375, "learning_rate": 0.0004894325396983925, "loss": 5.1819, "mean_token_accuracy": 0.19394239485263826, "num_tokens": 24756069.0, "step": 10810 }, { "entropy": 5.518496465682984, "epoch": 1.0690984578884934, "grad_norm": 1.078125, "learning_rate": 0.0004894218489649869, "loss": 5.1228, "mean_token_accuracy": 0.20798676162958146, "num_tokens": 24766935.0, "step": 10815 }, { "entropy": 5.558261442184448, "epoch": 1.069592724396995, "grad_norm": 1.0234375, "learning_rate": 0.0004894111529567707, "loss": 5.1425, "mean_token_accuracy": 0.19975071847438813, "num_tokens": 24777642.0, "step": 10820 }, { "entropy": 5.5222861766815186, "epoch": 1.0700869909054962, "grad_norm": 0.95703125, "learning_rate": 0.0004894004516740069, "loss": 5.0896, "mean_token_accuracy": 0.20588015168905258, "num_tokens": 24788110.0, "step": 10825 }, { "entropy": 5.645274496078491, "epoch": 1.0705812574139977, "grad_norm": 1.015625, "learning_rate": 0.0004893897451169586, "loss": 5.2372, "mean_token_accuracy": 0.19152329564094545, "num_tokens": 24799976.0, "step": 10830 }, { "entropy": 5.636560916900635, "epoch": 1.071075523922499, "grad_norm": 1.0, "learning_rate": 0.0004893790332858893, "loss": 5.1886, "mean_token_accuracy": 0.19974806755781174, "num_tokens": 24811131.0, "step": 10835 }, { "entropy": 5.56330943107605, "epoch": 1.0715697904310004, "grad_norm": 0.92578125, "learning_rate": 0.0004893683161810626, "loss": 5.1492, "mean_token_accuracy": 0.19859754145145417, "num_tokens": 24822137.0, "step": 10840 }, { "entropy": 5.5115186214447025, "epoch": 1.0720640569395017, "grad_norm": 1.0, "learning_rate": 0.0004893575938027421, "loss": 5.1463, "mean_token_accuracy": 0.20651720017194747, "num_tokens": 24832369.0, "step": 10845 }, { "entropy": 5.579618501663208, "epoch": 1.0725583234480032, "grad_norm": 0.91796875, "learning_rate": 0.0004893468661511914, "loss": 5.1875, "mean_token_accuracy": 0.19901671409606933, "num_tokens": 24843351.0, "step": 10850 }, { "entropy": 5.677450132369995, "epoch": 1.0730525899565047, "grad_norm": 0.9609375, "learning_rate": 0.0004893361332266746, "loss": 5.2913, "mean_token_accuracy": 0.19184576869010925, "num_tokens": 24855019.0, "step": 10855 }, { "entropy": 5.535508298873902, "epoch": 1.073546856465006, "grad_norm": 0.9296875, "learning_rate": 0.0004893253950294557, "loss": 5.1709, "mean_token_accuracy": 0.19773777425289155, "num_tokens": 24866224.0, "step": 10860 }, { "entropy": 5.562621307373047, "epoch": 1.0740411229735074, "grad_norm": 1.0703125, "learning_rate": 0.0004893146515597989, "loss": 5.1169, "mean_token_accuracy": 0.2077363207936287, "num_tokens": 24876995.0, "step": 10865 }, { "entropy": 5.603760147094727, "epoch": 1.0745353894820087, "grad_norm": 0.9453125, "learning_rate": 0.0004893039028179683, "loss": 5.1868, "mean_token_accuracy": 0.19911775290966033, "num_tokens": 24887846.0, "step": 10870 }, { "entropy": 5.57794303894043, "epoch": 1.0750296559905101, "grad_norm": 0.91796875, "learning_rate": 0.0004892931488042285, "loss": 5.3136, "mean_token_accuracy": 0.18882703483104707, "num_tokens": 24899221.0, "step": 10875 }, { "entropy": 5.6387128829956055, "epoch": 1.0755239224990114, "grad_norm": 0.8671875, "learning_rate": 0.000489282389518844, "loss": 5.2464, "mean_token_accuracy": 0.19500546902418137, "num_tokens": 24912103.0, "step": 10880 }, { "entropy": 5.671927547454834, "epoch": 1.076018189007513, "grad_norm": 1.0, "learning_rate": 0.0004892716249620795, "loss": 5.2379, "mean_token_accuracy": 0.19743986576795577, "num_tokens": 24925465.0, "step": 10885 }, { "entropy": 5.575254726409912, "epoch": 1.0765124555160142, "grad_norm": 1.0390625, "learning_rate": 0.0004892608551341997, "loss": 5.0512, "mean_token_accuracy": 0.19931527525186538, "num_tokens": 24935136.0, "step": 10890 }, { "entropy": 5.518525171279907, "epoch": 1.0770067220245156, "grad_norm": 0.88671875, "learning_rate": 0.0004892500800354697, "loss": 5.1798, "mean_token_accuracy": 0.19453928321599961, "num_tokens": 24946845.0, "step": 10895 }, { "entropy": 5.551582860946655, "epoch": 1.077500988533017, "grad_norm": 1.03125, "learning_rate": 0.0004892392996661544, "loss": 5.1147, "mean_token_accuracy": 0.20050218403339387, "num_tokens": 24958337.0, "step": 10900 }, { "entropy": 5.616279935836792, "epoch": 1.0779952550415184, "grad_norm": 1.015625, "learning_rate": 0.0004892285140265192, "loss": 5.2395, "mean_token_accuracy": 0.19231962859630586, "num_tokens": 24969505.0, "step": 10905 }, { "entropy": 5.587889671325684, "epoch": 1.0784895215500199, "grad_norm": 0.921875, "learning_rate": 0.0004892177231168292, "loss": 5.186, "mean_token_accuracy": 0.19548296332359313, "num_tokens": 24981577.0, "step": 10910 }, { "entropy": 5.635748052597046, "epoch": 1.0789837880585211, "grad_norm": 0.9921875, "learning_rate": 0.0004892069269373502, "loss": 5.2156, "mean_token_accuracy": 0.19969984591007234, "num_tokens": 24992758.0, "step": 10915 }, { "entropy": 5.603749179840088, "epoch": 1.0794780545670226, "grad_norm": 1.109375, "learning_rate": 0.0004891961254883474, "loss": 5.1886, "mean_token_accuracy": 0.20499727874994278, "num_tokens": 25003057.0, "step": 10920 }, { "entropy": 5.532132482528686, "epoch": 1.0799723210755239, "grad_norm": 0.98046875, "learning_rate": 0.0004891853187700867, "loss": 5.1956, "mean_token_accuracy": 0.20162956416606903, "num_tokens": 25014900.0, "step": 10925 }, { "entropy": 5.544339799880982, "epoch": 1.0804665875840254, "grad_norm": 0.9296875, "learning_rate": 0.0004891745067828339, "loss": 5.0952, "mean_token_accuracy": 0.21201400011777877, "num_tokens": 25026313.0, "step": 10930 }, { "entropy": 5.631102275848389, "epoch": 1.0809608540925266, "grad_norm": 0.96484375, "learning_rate": 0.0004891636895268551, "loss": 5.1727, "mean_token_accuracy": 0.20085712224245073, "num_tokens": 25037014.0, "step": 10935 }, { "entropy": 5.653964996337891, "epoch": 1.081455120601028, "grad_norm": 0.953125, "learning_rate": 0.0004891528670024162, "loss": 5.2462, "mean_token_accuracy": 0.20296286195516586, "num_tokens": 25048051.0, "step": 10940 }, { "entropy": 5.49779052734375, "epoch": 1.0819493871095294, "grad_norm": 1.1015625, "learning_rate": 0.0004891420392097837, "loss": 5.0857, "mean_token_accuracy": 0.20798234194517135, "num_tokens": 25057825.0, "step": 10945 }, { "entropy": 5.5334696769714355, "epoch": 1.0824436536180309, "grad_norm": 0.9609375, "learning_rate": 0.0004891312061492236, "loss": 5.1641, "mean_token_accuracy": 0.19941528737545014, "num_tokens": 25067702.0, "step": 10950 }, { "entropy": 5.592205286026001, "epoch": 1.0829379201265321, "grad_norm": 1.078125, "learning_rate": 0.0004891203678210027, "loss": 5.1326, "mean_token_accuracy": 0.2001258075237274, "num_tokens": 25078246.0, "step": 10955 }, { "entropy": 5.526812505722046, "epoch": 1.0834321866350336, "grad_norm": 0.94921875, "learning_rate": 0.0004891095242253876, "loss": 5.1601, "mean_token_accuracy": 0.2001139298081398, "num_tokens": 25089267.0, "step": 10960 }, { "entropy": 5.609985780715943, "epoch": 1.083926453143535, "grad_norm": 0.96484375, "learning_rate": 0.0004890986753626449, "loss": 5.2401, "mean_token_accuracy": 0.19498961567878723, "num_tokens": 25101392.0, "step": 10965 }, { "entropy": 5.588744449615478, "epoch": 1.0844207196520363, "grad_norm": 0.890625, "learning_rate": 0.0004890878212330418, "loss": 5.2477, "mean_token_accuracy": 0.19930957853794098, "num_tokens": 25113309.0, "step": 10970 }, { "entropy": 5.502229833602906, "epoch": 1.0849149861605378, "grad_norm": 0.91015625, "learning_rate": 0.0004890769618368448, "loss": 5.0504, "mean_token_accuracy": 0.21513673812150955, "num_tokens": 25124803.0, "step": 10975 }, { "entropy": 5.571053791046142, "epoch": 1.085409252669039, "grad_norm": 1.015625, "learning_rate": 0.0004890660971743215, "loss": 5.1705, "mean_token_accuracy": 0.1980375573039055, "num_tokens": 25136443.0, "step": 10980 }, { "entropy": 5.633281278610229, "epoch": 1.0859035191775406, "grad_norm": 1.0703125, "learning_rate": 0.0004890552272457389, "loss": 5.1754, "mean_token_accuracy": 0.1961453527212143, "num_tokens": 25147128.0, "step": 10985 }, { "entropy": 5.536621379852295, "epoch": 1.0863977856860418, "grad_norm": 0.875, "learning_rate": 0.0004890443520513645, "loss": 5.2028, "mean_token_accuracy": 0.20052715986967087, "num_tokens": 25159420.0, "step": 10990 }, { "entropy": 5.554381847381592, "epoch": 1.0868920521945433, "grad_norm": 0.88671875, "learning_rate": 0.0004890334715914659, "loss": 5.1283, "mean_token_accuracy": 0.20306944102048874, "num_tokens": 25171624.0, "step": 10995 }, { "entropy": 5.5545636177062985, "epoch": 1.0873863187030446, "grad_norm": 1.0078125, "learning_rate": 0.0004890225858663106, "loss": 5.0767, "mean_token_accuracy": 0.20985513776540757, "num_tokens": 25181610.0, "step": 11000 }, { "entropy": 5.549045276641846, "epoch": 1.087880585211546, "grad_norm": 1.03125, "learning_rate": 0.0004890116948761666, "loss": 5.0641, "mean_token_accuracy": 0.20264645665884018, "num_tokens": 25191852.0, "step": 11005 }, { "entropy": 5.626057243347168, "epoch": 1.0883748517200476, "grad_norm": 0.9453125, "learning_rate": 0.0004890007986213018, "loss": 5.2704, "mean_token_accuracy": 0.18715669810771943, "num_tokens": 25204240.0, "step": 11010 }, { "entropy": 5.497927141189575, "epoch": 1.0888691182285488, "grad_norm": 1.1015625, "learning_rate": 0.0004889898971019838, "loss": 5.117, "mean_token_accuracy": 0.20612100809812545, "num_tokens": 25215512.0, "step": 11015 }, { "entropy": 5.5297935009002686, "epoch": 1.0893633847370503, "grad_norm": 0.9375, "learning_rate": 0.0004889789903184815, "loss": 5.2148, "mean_token_accuracy": 0.19777075648307801, "num_tokens": 25227903.0, "step": 11020 }, { "entropy": 5.601582717895508, "epoch": 1.0898576512455516, "grad_norm": 0.9453125, "learning_rate": 0.0004889680782710626, "loss": 5.1228, "mean_token_accuracy": 0.2064304918050766, "num_tokens": 25240204.0, "step": 11025 }, { "entropy": 5.5603265285491945, "epoch": 1.090351917754053, "grad_norm": 0.921875, "learning_rate": 0.0004889571609599958, "loss": 5.1301, "mean_token_accuracy": 0.2031820684671402, "num_tokens": 25251978.0, "step": 11030 }, { "entropy": 5.565732955932617, "epoch": 1.0908461842625543, "grad_norm": 0.9375, "learning_rate": 0.0004889462383855498, "loss": 5.1439, "mean_token_accuracy": 0.20658504366874694, "num_tokens": 25262496.0, "step": 11035 }, { "entropy": 5.587706089019775, "epoch": 1.0913404507710558, "grad_norm": 0.99609375, "learning_rate": 0.000488935310547993, "loss": 5.1885, "mean_token_accuracy": 0.20206077992916108, "num_tokens": 25272814.0, "step": 11040 }, { "entropy": 5.575008583068848, "epoch": 1.091834717279557, "grad_norm": 1.0, "learning_rate": 0.0004889243774475945, "loss": 5.116, "mean_token_accuracy": 0.20326627790927887, "num_tokens": 25283749.0, "step": 11045 }, { "entropy": 5.515556335449219, "epoch": 1.0923289837880585, "grad_norm": 0.9609375, "learning_rate": 0.000488913439084623, "loss": 5.1642, "mean_token_accuracy": 0.20492347031831742, "num_tokens": 25295993.0, "step": 11050 }, { "entropy": 5.545891809463501, "epoch": 1.09282325029656, "grad_norm": 0.95703125, "learning_rate": 0.0004889024954593477, "loss": 5.1793, "mean_token_accuracy": 0.20114313960075378, "num_tokens": 25309011.0, "step": 11055 }, { "entropy": 5.576767873764038, "epoch": 1.0933175168050613, "grad_norm": 0.890625, "learning_rate": 0.000488891546572038, "loss": 5.1326, "mean_token_accuracy": 0.201374089717865, "num_tokens": 25320901.0, "step": 11060 }, { "entropy": 5.565138816833496, "epoch": 1.0938117833135628, "grad_norm": 0.88671875, "learning_rate": 0.000488880592422963, "loss": 5.0975, "mean_token_accuracy": 0.210607673227787, "num_tokens": 25333042.0, "step": 11065 }, { "entropy": 5.5541685104370115, "epoch": 1.094306049822064, "grad_norm": 0.90234375, "learning_rate": 0.0004888696330123921, "loss": 5.1631, "mean_token_accuracy": 0.20184366405010223, "num_tokens": 25346413.0, "step": 11070 }, { "entropy": 5.568626356124878, "epoch": 1.0948003163305655, "grad_norm": 0.90234375, "learning_rate": 0.0004888586683405952, "loss": 5.1816, "mean_token_accuracy": 0.20026592165231705, "num_tokens": 25358104.0, "step": 11075 }, { "entropy": 5.555508756637574, "epoch": 1.0952945828390668, "grad_norm": 1.015625, "learning_rate": 0.0004888476984078419, "loss": 5.1551, "mean_token_accuracy": 0.2012148305773735, "num_tokens": 25369485.0, "step": 11080 }, { "entropy": 5.5926063537597654, "epoch": 1.0957888493475683, "grad_norm": 0.953125, "learning_rate": 0.000488836723214402, "loss": 5.2355, "mean_token_accuracy": 0.1966923624277115, "num_tokens": 25380349.0, "step": 11085 }, { "entropy": 5.570060348510742, "epoch": 1.0962831158560695, "grad_norm": 0.90234375, "learning_rate": 0.0004888257427605456, "loss": 5.2399, "mean_token_accuracy": 0.19394517093896865, "num_tokens": 25393042.0, "step": 11090 }, { "entropy": 5.686985874176026, "epoch": 1.096777382364571, "grad_norm": 1.0859375, "learning_rate": 0.0004888147570465426, "loss": 5.2701, "mean_token_accuracy": 0.19837679117918014, "num_tokens": 25404470.0, "step": 11095 }, { "entropy": 5.522860813140869, "epoch": 1.0972716488730723, "grad_norm": 0.89453125, "learning_rate": 0.0004888037660726635, "loss": 5.1015, "mean_token_accuracy": 0.2097419247031212, "num_tokens": 25415397.0, "step": 11100 }, { "entropy": 5.60865273475647, "epoch": 1.0977659153815738, "grad_norm": 0.921875, "learning_rate": 0.0004887927698391786, "loss": 5.2667, "mean_token_accuracy": 0.1902092292904854, "num_tokens": 25427409.0, "step": 11105 }, { "entropy": 5.6086814403533936, "epoch": 1.0982601818900752, "grad_norm": 1.015625, "learning_rate": 0.0004887817683463583, "loss": 5.1252, "mean_token_accuracy": 0.2016250431537628, "num_tokens": 25438063.0, "step": 11110 }, { "entropy": 5.541067981719971, "epoch": 1.0987544483985765, "grad_norm": 0.98046875, "learning_rate": 0.0004887707615944734, "loss": 5.0787, "mean_token_accuracy": 0.2092176854610443, "num_tokens": 25449242.0, "step": 11115 }, { "entropy": 5.602257251739502, "epoch": 1.099248714907078, "grad_norm": 0.94921875, "learning_rate": 0.0004887597495837946, "loss": 5.1999, "mean_token_accuracy": 0.20106181800365447, "num_tokens": 25461434.0, "step": 11120 }, { "entropy": 5.552419996261596, "epoch": 1.0997429814155792, "grad_norm": 1.0390625, "learning_rate": 0.0004887487323145929, "loss": 5.1516, "mean_token_accuracy": 0.20503550618886948, "num_tokens": 25472035.0, "step": 11125 }, { "entropy": 5.596607112884522, "epoch": 1.1002372479240807, "grad_norm": 0.94140625, "learning_rate": 0.000488737709787139, "loss": 5.201, "mean_token_accuracy": 0.1999283254146576, "num_tokens": 25483143.0, "step": 11130 }, { "entropy": 5.588045406341553, "epoch": 1.100731514432582, "grad_norm": 1.1015625, "learning_rate": 0.0004887266820017044, "loss": 5.3335, "mean_token_accuracy": 0.18946558833122254, "num_tokens": 25496873.0, "step": 11135 }, { "entropy": 5.576846408843994, "epoch": 1.1012257809410835, "grad_norm": 0.9453125, "learning_rate": 0.0004887156489585603, "loss": 5.1098, "mean_token_accuracy": 0.20409890115261078, "num_tokens": 25508661.0, "step": 11140 }, { "entropy": 5.659700012207031, "epoch": 1.1017200474495847, "grad_norm": 0.96484375, "learning_rate": 0.000488704610657978, "loss": 5.2749, "mean_token_accuracy": 0.19107664823532106, "num_tokens": 25520789.0, "step": 11145 }, { "entropy": 5.515792894363403, "epoch": 1.1022143139580862, "grad_norm": 0.99609375, "learning_rate": 0.0004886935671002293, "loss": 5.1146, "mean_token_accuracy": 0.21137055158615112, "num_tokens": 25531131.0, "step": 11150 }, { "entropy": 5.616808032989502, "epoch": 1.1027085804665875, "grad_norm": 0.83984375, "learning_rate": 0.0004886825182855855, "loss": 5.1981, "mean_token_accuracy": 0.1955420583486557, "num_tokens": 25543803.0, "step": 11155 }, { "entropy": 5.619532823562622, "epoch": 1.103202846975089, "grad_norm": 1.046875, "learning_rate": 0.0004886714642143188, "loss": 5.1211, "mean_token_accuracy": 0.21077332198619841, "num_tokens": 25553588.0, "step": 11160 }, { "entropy": 5.545204067230225, "epoch": 1.1036971134835905, "grad_norm": 0.94921875, "learning_rate": 0.0004886604048867007, "loss": 5.1791, "mean_token_accuracy": 0.20102021843194962, "num_tokens": 25566175.0, "step": 11165 }, { "entropy": 5.620724201202393, "epoch": 1.1041913799920917, "grad_norm": 1.09375, "learning_rate": 0.0004886493403030035, "loss": 5.2512, "mean_token_accuracy": 0.1937913030385971, "num_tokens": 25578033.0, "step": 11170 }, { "entropy": 5.536163330078125, "epoch": 1.1046856465005932, "grad_norm": 0.94921875, "learning_rate": 0.0004886382704634996, "loss": 5.1283, "mean_token_accuracy": 0.20268192440271376, "num_tokens": 25588759.0, "step": 11175 }, { "entropy": 5.496808338165283, "epoch": 1.1051799130090945, "grad_norm": 1.0546875, "learning_rate": 0.0004886271953684609, "loss": 5.0464, "mean_token_accuracy": 0.20832517892122268, "num_tokens": 25599200.0, "step": 11180 }, { "entropy": 5.555243110656738, "epoch": 1.105674179517596, "grad_norm": 1.015625, "learning_rate": 0.0004886161150181602, "loss": 5.1675, "mean_token_accuracy": 0.2013366162776947, "num_tokens": 25610279.0, "step": 11185 }, { "entropy": 5.523467397689819, "epoch": 1.1061684460260972, "grad_norm": 0.92578125, "learning_rate": 0.0004886050294128698, "loss": 5.1064, "mean_token_accuracy": 0.2036333367228508, "num_tokens": 25622062.0, "step": 11190 }, { "entropy": 5.558579778671264, "epoch": 1.1066627125345987, "grad_norm": 1.0859375, "learning_rate": 0.0004885939385528628, "loss": 5.1599, "mean_token_accuracy": 0.19904044270515442, "num_tokens": 25633451.0, "step": 11195 }, { "entropy": 5.514632511138916, "epoch": 1.1071569790431, "grad_norm": 0.95703125, "learning_rate": 0.0004885828424384114, "loss": 5.1047, "mean_token_accuracy": 0.20366704910993577, "num_tokens": 25644537.0, "step": 11200 }, { "entropy": 5.540765953063965, "epoch": 1.1076512455516014, "grad_norm": 1.015625, "learning_rate": 0.0004885717410697892, "loss": 5.1457, "mean_token_accuracy": 0.20146596282720566, "num_tokens": 25655570.0, "step": 11205 }, { "entropy": 5.661158227920533, "epoch": 1.1081455120601027, "grad_norm": 0.8828125, "learning_rate": 0.000488560634447269, "loss": 5.3003, "mean_token_accuracy": 0.1880436047911644, "num_tokens": 25669470.0, "step": 11210 }, { "entropy": 5.589978122711182, "epoch": 1.1086397785686042, "grad_norm": 0.93359375, "learning_rate": 0.000488549522571124, "loss": 5.2041, "mean_token_accuracy": 0.19872046858072281, "num_tokens": 25682347.0, "step": 11215 }, { "entropy": 5.64509654045105, "epoch": 1.1091340450771057, "grad_norm": 1.109375, "learning_rate": 0.0004885384054416276, "loss": 5.2701, "mean_token_accuracy": 0.19230715334415435, "num_tokens": 25694038.0, "step": 11220 }, { "entropy": 5.577707576751709, "epoch": 1.109628311585607, "grad_norm": 0.93359375, "learning_rate": 0.0004885272830590534, "loss": 5.0594, "mean_token_accuracy": 0.208463054895401, "num_tokens": 25705850.0, "step": 11225 }, { "entropy": 5.534164094924927, "epoch": 1.1101225780941084, "grad_norm": 1.03125, "learning_rate": 0.0004885161554236748, "loss": 5.1526, "mean_token_accuracy": 0.20452002584934234, "num_tokens": 25716294.0, "step": 11230 }, { "entropy": 5.5065959930419925, "epoch": 1.1106168446026097, "grad_norm": 0.91796875, "learning_rate": 0.0004885050225357657, "loss": 5.1405, "mean_token_accuracy": 0.20849686861038208, "num_tokens": 25727367.0, "step": 11235 }, { "entropy": 5.644446229934692, "epoch": 1.1111111111111112, "grad_norm": 1.0390625, "learning_rate": 0.0004884938843955999, "loss": 5.2605, "mean_token_accuracy": 0.190137055516243, "num_tokens": 25738352.0, "step": 11240 }, { "entropy": 5.522897577285766, "epoch": 1.1116053776196124, "grad_norm": 0.984375, "learning_rate": 0.0004884827410034515, "loss": 5.0767, "mean_token_accuracy": 0.20918794274330138, "num_tokens": 25749940.0, "step": 11245 }, { "entropy": 5.581638526916504, "epoch": 1.112099644128114, "grad_norm": 0.9921875, "learning_rate": 0.0004884715923595945, "loss": 5.1971, "mean_token_accuracy": 0.19225422590970992, "num_tokens": 25761251.0, "step": 11250 }, { "entropy": 5.590559387207032, "epoch": 1.1125939106366152, "grad_norm": 0.93359375, "learning_rate": 0.0004884604384643032, "loss": 5.2155, "mean_token_accuracy": 0.2005592793226242, "num_tokens": 25772382.0, "step": 11255 }, { "entropy": 5.512000513076782, "epoch": 1.1130881771451167, "grad_norm": 0.890625, "learning_rate": 0.000488449279317852, "loss": 5.1363, "mean_token_accuracy": 0.20783088803291322, "num_tokens": 25784960.0, "step": 11260 }, { "entropy": 5.576482343673706, "epoch": 1.113582443653618, "grad_norm": 1.0, "learning_rate": 0.0004884381149205154, "loss": 5.1502, "mean_token_accuracy": 0.1943017601966858, "num_tokens": 25796644.0, "step": 11265 }, { "entropy": 5.562193202972412, "epoch": 1.1140767101621194, "grad_norm": 0.94921875, "learning_rate": 0.0004884269452725681, "loss": 5.2189, "mean_token_accuracy": 0.20007513463497162, "num_tokens": 25807712.0, "step": 11270 }, { "entropy": 5.589531135559082, "epoch": 1.1145709766706209, "grad_norm": 0.99609375, "learning_rate": 0.0004884157703742848, "loss": 5.1098, "mean_token_accuracy": 0.208867447078228, "num_tokens": 25817944.0, "step": 11275 }, { "entropy": 5.505665397644043, "epoch": 1.1150652431791221, "grad_norm": 0.890625, "learning_rate": 0.0004884045902259405, "loss": 5.1377, "mean_token_accuracy": 0.20999344885349275, "num_tokens": 25830801.0, "step": 11280 }, { "entropy": 5.541778612136841, "epoch": 1.1155595096876236, "grad_norm": 0.98828125, "learning_rate": 0.0004883934048278102, "loss": 5.1537, "mean_token_accuracy": 0.19636219441890718, "num_tokens": 25843877.0, "step": 11285 }, { "entropy": 5.581416749954224, "epoch": 1.116053776196125, "grad_norm": 0.9453125, "learning_rate": 0.0004883822141801689, "loss": 5.1142, "mean_token_accuracy": 0.20428831428289412, "num_tokens": 25853763.0, "step": 11290 }, { "entropy": 5.588229703903198, "epoch": 1.1165480427046264, "grad_norm": 0.95703125, "learning_rate": 0.0004883710182832921, "loss": 5.2298, "mean_token_accuracy": 0.19397151619195938, "num_tokens": 25864759.0, "step": 11295 }, { "entropy": 5.63090705871582, "epoch": 1.1170423092131276, "grad_norm": 0.921875, "learning_rate": 0.0004883598171374552, "loss": 5.2739, "mean_token_accuracy": 0.1870568200945854, "num_tokens": 25877325.0, "step": 11300 }, { "entropy": 5.601251554489136, "epoch": 1.1175365757216291, "grad_norm": 1.046875, "learning_rate": 0.0004883486107429337, "loss": 5.1322, "mean_token_accuracy": 0.20365397930145263, "num_tokens": 25889308.0, "step": 11305 }, { "entropy": 5.544142770767212, "epoch": 1.1180308422301304, "grad_norm": 0.95703125, "learning_rate": 0.0004883373991000031, "loss": 5.2005, "mean_token_accuracy": 0.1963278353214264, "num_tokens": 25901721.0, "step": 11310 }, { "entropy": 5.623781824111939, "epoch": 1.1185251087386319, "grad_norm": 1.0390625, "learning_rate": 0.0004883261822089395, "loss": 5.1836, "mean_token_accuracy": 0.19505885988473892, "num_tokens": 25912399.0, "step": 11315 }, { "entropy": 5.52620792388916, "epoch": 1.1190193752471334, "grad_norm": 1.0078125, "learning_rate": 0.0004883149600700188, "loss": 5.0947, "mean_token_accuracy": 0.21273969262838363, "num_tokens": 25923560.0, "step": 11320 }, { "entropy": 5.576925802230835, "epoch": 1.1195136417556346, "grad_norm": 1.15625, "learning_rate": 0.0004883037326835169, "loss": 5.1495, "mean_token_accuracy": 0.2021413579583168, "num_tokens": 25933408.0, "step": 11325 }, { "entropy": 5.577878999710083, "epoch": 1.120007908264136, "grad_norm": 0.99609375, "learning_rate": 0.0004882925000497101, "loss": 5.1383, "mean_token_accuracy": 0.1969757556915283, "num_tokens": 25944492.0, "step": 11330 }, { "entropy": 5.563068199157715, "epoch": 1.1205021747726374, "grad_norm": 1.03125, "learning_rate": 0.0004882812621688747, "loss": 5.1477, "mean_token_accuracy": 0.20778826773166656, "num_tokens": 25956439.0, "step": 11335 }, { "entropy": 5.553294134140015, "epoch": 1.1209964412811388, "grad_norm": 0.9296875, "learning_rate": 0.0004882700190412873, "loss": 5.1983, "mean_token_accuracy": 0.19253796041011811, "num_tokens": 25968765.0, "step": 11340 }, { "entropy": 5.592649173736572, "epoch": 1.12149070778964, "grad_norm": 0.87109375, "learning_rate": 0.0004882587706672242, "loss": 5.2016, "mean_token_accuracy": 0.19993028938770294, "num_tokens": 25981300.0, "step": 11345 }, { "entropy": 5.57633695602417, "epoch": 1.1219849742981416, "grad_norm": 0.96875, "learning_rate": 0.0004882475170469622, "loss": 5.1393, "mean_token_accuracy": 0.20567684322595597, "num_tokens": 25991655.0, "step": 11350 }, { "entropy": 5.558594608306885, "epoch": 1.1224792408066429, "grad_norm": 0.95703125, "learning_rate": 0.0004882362581807783, "loss": 5.1245, "mean_token_accuracy": 0.21039678305387496, "num_tokens": 26002989.0, "step": 11355 }, { "entropy": 5.516820430755615, "epoch": 1.1229735073151443, "grad_norm": 1.0703125, "learning_rate": 0.0004882249940689494, "loss": 5.1381, "mean_token_accuracy": 0.2042115032672882, "num_tokens": 26013807.0, "step": 11360 }, { "entropy": 5.630669403076172, "epoch": 1.1234677738236458, "grad_norm": 0.86328125, "learning_rate": 0.00048821372471175245, "loss": 5.257, "mean_token_accuracy": 0.19562918543815613, "num_tokens": 26027099.0, "step": 11365 }, { "entropy": 5.634098863601684, "epoch": 1.123962040332147, "grad_norm": 0.91015625, "learning_rate": 0.00048820245010946486, "loss": 5.1422, "mean_token_accuracy": 0.196585014462471, "num_tokens": 26039046.0, "step": 11370 }, { "entropy": 5.497501087188721, "epoch": 1.1244563068406486, "grad_norm": 1.0, "learning_rate": 0.0004881911702623639, "loss": 5.027, "mean_token_accuracy": 0.2100775346159935, "num_tokens": 26049763.0, "step": 11375 }, { "entropy": 5.499991607666016, "epoch": 1.1249505733491498, "grad_norm": 1.2734375, "learning_rate": 0.0004881798851707271, "loss": 5.159, "mean_token_accuracy": 0.20486544519662858, "num_tokens": 26062227.0, "step": 11380 }, { "entropy": 5.486726331710815, "epoch": 1.1254448398576513, "grad_norm": 0.96875, "learning_rate": 0.00048816859483483214, "loss": 5.1314, "mean_token_accuracy": 0.20692529529333115, "num_tokens": 26074019.0, "step": 11385 }, { "entropy": 5.6499110698699955, "epoch": 1.1259391063661526, "grad_norm": 1.1171875, "learning_rate": 0.00048815729925495656, "loss": 5.247, "mean_token_accuracy": 0.19558872580528258, "num_tokens": 26086169.0, "step": 11390 }, { "entropy": 5.57415885925293, "epoch": 1.126433372874654, "grad_norm": 0.91015625, "learning_rate": 0.00048814599843137837, "loss": 5.1614, "mean_token_accuracy": 0.1953497812151909, "num_tokens": 26097677.0, "step": 11395 }, { "entropy": 5.480134201049805, "epoch": 1.1269276393831553, "grad_norm": 0.91015625, "learning_rate": 0.0004881346923643755, "loss": 5.0906, "mean_token_accuracy": 0.20814770758152007, "num_tokens": 26108825.0, "step": 11400 }, { "entropy": 5.6095856666564945, "epoch": 1.1274219058916568, "grad_norm": 0.91015625, "learning_rate": 0.0004881233810542263, "loss": 5.221, "mean_token_accuracy": 0.19476791471242905, "num_tokens": 26120274.0, "step": 11405 }, { "entropy": 5.542181062698364, "epoch": 1.127916172400158, "grad_norm": 0.90625, "learning_rate": 0.00048811206450120875, "loss": 5.1272, "mean_token_accuracy": 0.20568620413541794, "num_tokens": 26131964.0, "step": 11410 }, { "entropy": 5.556201934814453, "epoch": 1.1284104389086596, "grad_norm": 0.9765625, "learning_rate": 0.0004881007427056013, "loss": 5.199, "mean_token_accuracy": 0.1946858823299408, "num_tokens": 26143308.0, "step": 11415 }, { "entropy": 5.599824047088623, "epoch": 1.128904705417161, "grad_norm": 1.0234375, "learning_rate": 0.0004880894156676826, "loss": 5.2172, "mean_token_accuracy": 0.19359127134084703, "num_tokens": 26153951.0, "step": 11420 }, { "entropy": 5.560917520523072, "epoch": 1.1293989719256623, "grad_norm": 1.03125, "learning_rate": 0.0004880780833877312, "loss": 5.0894, "mean_token_accuracy": 0.2079484224319458, "num_tokens": 26165951.0, "step": 11425 }, { "entropy": 5.585844564437866, "epoch": 1.1298932384341638, "grad_norm": 0.97265625, "learning_rate": 0.0004880667458660259, "loss": 5.1338, "mean_token_accuracy": 0.19521732181310653, "num_tokens": 26176751.0, "step": 11430 }, { "entropy": 5.600941276550293, "epoch": 1.130387504942665, "grad_norm": 0.9609375, "learning_rate": 0.0004880554031028456, "loss": 5.2425, "mean_token_accuracy": 0.19723615050315857, "num_tokens": 26187682.0, "step": 11435 }, { "entropy": 5.655602931976318, "epoch": 1.1308817714511665, "grad_norm": 0.9609375, "learning_rate": 0.00048804405509846933, "loss": 5.2106, "mean_token_accuracy": 0.1987275779247284, "num_tokens": 26198960.0, "step": 11440 }, { "entropy": 5.5422632694244385, "epoch": 1.1313760379596678, "grad_norm": 1.015625, "learning_rate": 0.0004880327018531762, "loss": 5.1664, "mean_token_accuracy": 0.19947094917297364, "num_tokens": 26210198.0, "step": 11445 }, { "entropy": 5.515432405471802, "epoch": 1.1318703044681693, "grad_norm": 1.0625, "learning_rate": 0.00048802134336724566, "loss": 5.0897, "mean_token_accuracy": 0.2067318320274353, "num_tokens": 26220817.0, "step": 11450 }, { "entropy": 5.5369306087493895, "epoch": 1.1323645709766705, "grad_norm": 1.0, "learning_rate": 0.00048800997964095687, "loss": 5.0932, "mean_token_accuracy": 0.21017422080039977, "num_tokens": 26233657.0, "step": 11455 }, { "entropy": 5.569632339477539, "epoch": 1.132858837485172, "grad_norm": 0.96875, "learning_rate": 0.0004879986106745897, "loss": 5.1558, "mean_token_accuracy": 0.20125795155763626, "num_tokens": 26245566.0, "step": 11460 }, { "entropy": 5.52719669342041, "epoch": 1.1333531039936733, "grad_norm": 0.875, "learning_rate": 0.00048798723646842357, "loss": 5.0812, "mean_token_accuracy": 0.211815045773983, "num_tokens": 26256717.0, "step": 11465 }, { "entropy": 5.54382643699646, "epoch": 1.1338473705021748, "grad_norm": 0.94140625, "learning_rate": 0.0004879758570227384, "loss": 5.2073, "mean_token_accuracy": 0.19590527415275574, "num_tokens": 26267926.0, "step": 11470 }, { "entropy": 5.535868453979492, "epoch": 1.1343416370106763, "grad_norm": 0.9921875, "learning_rate": 0.00048796447233781406, "loss": 5.1581, "mean_token_accuracy": 0.19440439492464065, "num_tokens": 26278666.0, "step": 11475 }, { "entropy": 5.5688190937042235, "epoch": 1.1348359035191775, "grad_norm": 0.99609375, "learning_rate": 0.0004879530824139308, "loss": 5.1442, "mean_token_accuracy": 0.20360831618309022, "num_tokens": 26289961.0, "step": 11480 }, { "entropy": 5.570082902908325, "epoch": 1.135330170027679, "grad_norm": 0.9453125, "learning_rate": 0.00048794168725136854, "loss": 5.1838, "mean_token_accuracy": 0.1968776524066925, "num_tokens": 26301245.0, "step": 11485 }, { "entropy": 5.595168209075927, "epoch": 1.1358244365361803, "grad_norm": 1.0390625, "learning_rate": 0.0004879302868504078, "loss": 5.2002, "mean_token_accuracy": 0.19801755398511886, "num_tokens": 26312598.0, "step": 11490 }, { "entropy": 5.65485200881958, "epoch": 1.1363187030446817, "grad_norm": 0.84765625, "learning_rate": 0.0004879188812113289, "loss": 5.1898, "mean_token_accuracy": 0.1968305379152298, "num_tokens": 26324300.0, "step": 11495 }, { "entropy": 5.503046131134033, "epoch": 1.136812969553183, "grad_norm": 0.94921875, "learning_rate": 0.0004879074703344125, "loss": 5.1758, "mean_token_accuracy": 0.20016694515943528, "num_tokens": 26335789.0, "step": 11500 }, { "entropy": 5.5497589111328125, "epoch": 1.1373072360616845, "grad_norm": 0.953125, "learning_rate": 0.0004878960542199394, "loss": 5.1705, "mean_token_accuracy": 0.19867094457149506, "num_tokens": 26347336.0, "step": 11505 }, { "entropy": 5.643337869644165, "epoch": 1.1378015025701858, "grad_norm": 0.94140625, "learning_rate": 0.00048788463286819037, "loss": 5.1455, "mean_token_accuracy": 0.20171578526496886, "num_tokens": 26358176.0, "step": 11510 }, { "entropy": 5.504993343353272, "epoch": 1.1382957690786872, "grad_norm": 0.9921875, "learning_rate": 0.0004878732062794462, "loss": 5.1472, "mean_token_accuracy": 0.19595275521278382, "num_tokens": 26368915.0, "step": 11515 }, { "entropy": 5.53356704711914, "epoch": 1.1387900355871885, "grad_norm": 0.97265625, "learning_rate": 0.00048786177445398816, "loss": 5.1945, "mean_token_accuracy": 0.19492598623037338, "num_tokens": 26381687.0, "step": 11520 }, { "entropy": 5.597900438308716, "epoch": 1.13928430209569, "grad_norm": 0.86328125, "learning_rate": 0.0004878503373920975, "loss": 5.259, "mean_token_accuracy": 0.19725859463214873, "num_tokens": 26394289.0, "step": 11525 }, { "entropy": 5.58353066444397, "epoch": 1.1397785686041915, "grad_norm": 0.98828125, "learning_rate": 0.0004878388950940555, "loss": 5.1187, "mean_token_accuracy": 0.209721203148365, "num_tokens": 26405743.0, "step": 11530 }, { "entropy": 5.610544204711914, "epoch": 1.1402728351126927, "grad_norm": 1.0078125, "learning_rate": 0.00048782744756014365, "loss": 5.2729, "mean_token_accuracy": 0.18901991099119186, "num_tokens": 26417255.0, "step": 11535 }, { "entropy": 5.623516464233399, "epoch": 1.1407671016211942, "grad_norm": 0.921875, "learning_rate": 0.0004878159947906436, "loss": 5.2561, "mean_token_accuracy": 0.19475867599248886, "num_tokens": 26428992.0, "step": 11540 }, { "entropy": 5.533721876144409, "epoch": 1.1412613681296955, "grad_norm": 1.0234375, "learning_rate": 0.000487804536785837, "loss": 5.1561, "mean_token_accuracy": 0.20427749007940293, "num_tokens": 26440375.0, "step": 11545 }, { "entropy": 5.565828037261963, "epoch": 1.141755634638197, "grad_norm": 0.859375, "learning_rate": 0.00048779307354600586, "loss": 5.2218, "mean_token_accuracy": 0.1947557121515274, "num_tokens": 26452253.0, "step": 11550 }, { "entropy": 5.6452470302581785, "epoch": 1.1422499011466982, "grad_norm": 0.8671875, "learning_rate": 0.00048778160507143204, "loss": 5.2325, "mean_token_accuracy": 0.196069698035717, "num_tokens": 26463766.0, "step": 11555 }, { "entropy": 5.620745897293091, "epoch": 1.1427441676551997, "grad_norm": 0.9140625, "learning_rate": 0.0004877701313623978, "loss": 5.1899, "mean_token_accuracy": 0.1946606308221817, "num_tokens": 26475869.0, "step": 11560 }, { "entropy": 5.597680568695068, "epoch": 1.1432384341637012, "grad_norm": 0.9921875, "learning_rate": 0.0004877586524191852, "loss": 5.1826, "mean_token_accuracy": 0.1972901150584221, "num_tokens": 26487142.0, "step": 11565 }, { "entropy": 5.532548236846924, "epoch": 1.1437327006722025, "grad_norm": 0.90234375, "learning_rate": 0.0004877471682420768, "loss": 5.0215, "mean_token_accuracy": 0.20979078859090805, "num_tokens": 26499019.0, "step": 11570 }, { "entropy": 5.5022367477417, "epoch": 1.1442269671807037, "grad_norm": 1.1484375, "learning_rate": 0.0004877356788313551, "loss": 5.1247, "mean_token_accuracy": 0.2050749659538269, "num_tokens": 26510060.0, "step": 11575 }, { "entropy": 5.512467765808106, "epoch": 1.1447212336892052, "grad_norm": 0.8984375, "learning_rate": 0.0004877241841873027, "loss": 5.0687, "mean_token_accuracy": 0.20887821763753892, "num_tokens": 26520723.0, "step": 11580 }, { "entropy": 5.5431070804595945, "epoch": 1.1452155001977067, "grad_norm": 1.1953125, "learning_rate": 0.0004877126843102023, "loss": 5.1504, "mean_token_accuracy": 0.2072251930832863, "num_tokens": 26532545.0, "step": 11585 }, { "entropy": 5.5168702602386475, "epoch": 1.145709766706208, "grad_norm": 1.03125, "learning_rate": 0.00048770117920033697, "loss": 5.1424, "mean_token_accuracy": 0.21246752738952637, "num_tokens": 26542993.0, "step": 11590 }, { "entropy": 5.5236536979675295, "epoch": 1.1462040332147094, "grad_norm": 0.96484375, "learning_rate": 0.0004876896688579895, "loss": 5.1383, "mean_token_accuracy": 0.20722885578870773, "num_tokens": 26554658.0, "step": 11595 }, { "entropy": 5.577509593963623, "epoch": 1.1466982997232107, "grad_norm": 1.0234375, "learning_rate": 0.0004876781532834433, "loss": 5.1643, "mean_token_accuracy": 0.20704762041568756, "num_tokens": 26565925.0, "step": 11600 }, { "entropy": 5.556118154525757, "epoch": 1.1471925662317122, "grad_norm": 0.984375, "learning_rate": 0.0004876666324769815, "loss": 5.1328, "mean_token_accuracy": 0.20658752769231797, "num_tokens": 26577045.0, "step": 11605 }, { "entropy": 5.550484275817871, "epoch": 1.1476868327402134, "grad_norm": 1.015625, "learning_rate": 0.0004876551064388875, "loss": 5.2381, "mean_token_accuracy": 0.19311110228300093, "num_tokens": 26587773.0, "step": 11610 }, { "entropy": 5.602803802490234, "epoch": 1.148181099248715, "grad_norm": 0.9296875, "learning_rate": 0.00048764357516944485, "loss": 5.0991, "mean_token_accuracy": 0.20701897740364075, "num_tokens": 26597861.0, "step": 11615 }, { "entropy": 5.637305402755738, "epoch": 1.1486753657572164, "grad_norm": 1.0234375, "learning_rate": 0.00048763203866893735, "loss": 5.1638, "mean_token_accuracy": 0.20132549107074738, "num_tokens": 26607695.0, "step": 11620 }, { "entropy": 5.595219087600708, "epoch": 1.1491696322657177, "grad_norm": 0.96484375, "learning_rate": 0.00048762049693764866, "loss": 5.2266, "mean_token_accuracy": 0.1887555167078972, "num_tokens": 26619845.0, "step": 11625 }, { "entropy": 5.625263214111328, "epoch": 1.1496638987742192, "grad_norm": 1.0234375, "learning_rate": 0.00048760894997586284, "loss": 5.1333, "mean_token_accuracy": 0.20225919932126998, "num_tokens": 26630279.0, "step": 11630 }, { "entropy": 5.518025541305542, "epoch": 1.1501581652827204, "grad_norm": 0.984375, "learning_rate": 0.0004875973977838639, "loss": 5.1521, "mean_token_accuracy": 0.20252805948257446, "num_tokens": 26640996.0, "step": 11635 }, { "entropy": 5.458708572387695, "epoch": 1.150652431791222, "grad_norm": 1.0390625, "learning_rate": 0.00048758584036193587, "loss": 5.0842, "mean_token_accuracy": 0.20755780935287477, "num_tokens": 26652416.0, "step": 11640 }, { "entropy": 5.577388858795166, "epoch": 1.1511466982997232, "grad_norm": 0.9375, "learning_rate": 0.0004875742777103632, "loss": 5.1801, "mean_token_accuracy": 0.19637428671121598, "num_tokens": 26663649.0, "step": 11645 }, { "entropy": 5.6181248188018795, "epoch": 1.1516409648082246, "grad_norm": 0.93359375, "learning_rate": 0.00048756270982943035, "loss": 5.2472, "mean_token_accuracy": 0.19116724729537965, "num_tokens": 26676138.0, "step": 11650 }, { "entropy": 5.632998847961426, "epoch": 1.152135231316726, "grad_norm": 0.9609375, "learning_rate": 0.0004875511367194219, "loss": 5.2123, "mean_token_accuracy": 0.19030288308858873, "num_tokens": 26687364.0, "step": 11655 }, { "entropy": 5.577423524856568, "epoch": 1.1526294978252274, "grad_norm": 1.0, "learning_rate": 0.0004875395583806225, "loss": 5.1706, "mean_token_accuracy": 0.19729695320129395, "num_tokens": 26698135.0, "step": 11660 }, { "entropy": 5.569678115844726, "epoch": 1.1531237643337287, "grad_norm": 1.078125, "learning_rate": 0.0004875279748133169, "loss": 5.1055, "mean_token_accuracy": 0.20657850801944733, "num_tokens": 26710495.0, "step": 11665 }, { "entropy": 5.632407140731812, "epoch": 1.1536180308422301, "grad_norm": 1.0390625, "learning_rate": 0.0004875163860177902, "loss": 5.3014, "mean_token_accuracy": 0.18928948193788528, "num_tokens": 26722876.0, "step": 11670 }, { "entropy": 5.5743669986724855, "epoch": 1.1541122973507316, "grad_norm": 1.0, "learning_rate": 0.00048750479199432753, "loss": 5.1521, "mean_token_accuracy": 0.19912013411521912, "num_tokens": 26733548.0, "step": 11675 }, { "entropy": 5.533687591552734, "epoch": 1.1546065638592329, "grad_norm": 0.953125, "learning_rate": 0.0004874931927432139, "loss": 5.0887, "mean_token_accuracy": 0.2087789535522461, "num_tokens": 26744754.0, "step": 11680 }, { "entropy": 5.539801788330078, "epoch": 1.1551008303677344, "grad_norm": 0.90234375, "learning_rate": 0.0004874815882647348, "loss": 5.2242, "mean_token_accuracy": 0.1978342592716217, "num_tokens": 26757416.0, "step": 11685 }, { "entropy": 5.509987163543701, "epoch": 1.1555950968762356, "grad_norm": 0.9453125, "learning_rate": 0.0004874699785591756, "loss": 5.1107, "mean_token_accuracy": 0.20534605383872986, "num_tokens": 26768572.0, "step": 11690 }, { "entropy": 5.514437580108643, "epoch": 1.1560893633847371, "grad_norm": 0.96484375, "learning_rate": 0.00048745836362682203, "loss": 5.1049, "mean_token_accuracy": 0.20885729193687438, "num_tokens": 26779309.0, "step": 11695 }, { "entropy": 5.612732982635498, "epoch": 1.1565836298932384, "grad_norm": 1.0, "learning_rate": 0.0004874467434679598, "loss": 5.1935, "mean_token_accuracy": 0.20284541547298432, "num_tokens": 26791107.0, "step": 11700 }, { "entropy": 5.520433139801026, "epoch": 1.1570778964017399, "grad_norm": 1.0078125, "learning_rate": 0.0004874351180828746, "loss": 5.0893, "mean_token_accuracy": 0.20751285701990127, "num_tokens": 26801334.0, "step": 11705 }, { "entropy": 5.530741024017334, "epoch": 1.1575721629102411, "grad_norm": 0.90234375, "learning_rate": 0.0004874234874718526, "loss": 5.137, "mean_token_accuracy": 0.19951904714107513, "num_tokens": 26812972.0, "step": 11710 }, { "entropy": 5.5892174243927, "epoch": 1.1580664294187426, "grad_norm": 1.046875, "learning_rate": 0.00048741185163517984, "loss": 5.1846, "mean_token_accuracy": 0.19734706729650497, "num_tokens": 26823683.0, "step": 11715 }, { "entropy": 5.6301360607147215, "epoch": 1.1585606959272439, "grad_norm": 0.94140625, "learning_rate": 0.00048740021057314267, "loss": 5.1573, "mean_token_accuracy": 0.20925845205783844, "num_tokens": 26835898.0, "step": 11720 }, { "entropy": 5.558917093276977, "epoch": 1.1590549624357454, "grad_norm": 0.8984375, "learning_rate": 0.00048738856428602736, "loss": 5.1172, "mean_token_accuracy": 0.20644625872373581, "num_tokens": 26847363.0, "step": 11725 }, { "entropy": 5.514652347564697, "epoch": 1.1595492289442468, "grad_norm": 0.96875, "learning_rate": 0.0004873769127741203, "loss": 5.0764, "mean_token_accuracy": 0.20471990406513213, "num_tokens": 26859081.0, "step": 11730 }, { "entropy": 5.525179767608643, "epoch": 1.160043495452748, "grad_norm": 0.9296875, "learning_rate": 0.0004873652560377083, "loss": 5.1052, "mean_token_accuracy": 0.20595996975898742, "num_tokens": 26869966.0, "step": 11735 }, { "entropy": 5.527403259277344, "epoch": 1.1605377619612496, "grad_norm": 0.96875, "learning_rate": 0.000487353594077078, "loss": 5.1159, "mean_token_accuracy": 0.20118680894374846, "num_tokens": 26880673.0, "step": 11740 }, { "entropy": 5.56816258430481, "epoch": 1.1610320284697508, "grad_norm": 1.0703125, "learning_rate": 0.00048734192689251643, "loss": 5.1487, "mean_token_accuracy": 0.2037976235151291, "num_tokens": 26892306.0, "step": 11745 }, { "entropy": 5.61749415397644, "epoch": 1.1615262949782523, "grad_norm": 0.92578125, "learning_rate": 0.0004873302544843104, "loss": 5.1937, "mean_token_accuracy": 0.198708276450634, "num_tokens": 26904655.0, "step": 11750 }, { "entropy": 5.569536638259888, "epoch": 1.1620205614867536, "grad_norm": 0.96875, "learning_rate": 0.0004873185768527473, "loss": 5.2033, "mean_token_accuracy": 0.20075427144765853, "num_tokens": 26916580.0, "step": 11755 }, { "entropy": 5.580357599258423, "epoch": 1.162514827995255, "grad_norm": 1.0234375, "learning_rate": 0.00048730689399811427, "loss": 5.1551, "mean_token_accuracy": 0.1973597526550293, "num_tokens": 26927033.0, "step": 11760 }, { "entropy": 5.543411827087402, "epoch": 1.1630090945037563, "grad_norm": 1.1640625, "learning_rate": 0.0004872952059206986, "loss": 5.2235, "mean_token_accuracy": 0.19379889219999313, "num_tokens": 26938594.0, "step": 11765 }, { "entropy": 5.534972047805786, "epoch": 1.1635033610122578, "grad_norm": 1.078125, "learning_rate": 0.0004872835126207881, "loss": 5.1122, "mean_token_accuracy": 0.2076310247182846, "num_tokens": 26949595.0, "step": 11770 }, { "entropy": 5.632227993011474, "epoch": 1.163997627520759, "grad_norm": 0.921875, "learning_rate": 0.0004872718140986701, "loss": 5.2296, "mean_token_accuracy": 0.1975867211818695, "num_tokens": 26961692.0, "step": 11775 }, { "entropy": 5.565840387344361, "epoch": 1.1644918940292606, "grad_norm": 0.97265625, "learning_rate": 0.00048726011035463265, "loss": 5.0774, "mean_token_accuracy": 0.20398930907249452, "num_tokens": 26972062.0, "step": 11780 }, { "entropy": 5.597553539276123, "epoch": 1.164986160537762, "grad_norm": 1.0234375, "learning_rate": 0.0004872484013889635, "loss": 5.1306, "mean_token_accuracy": 0.20006432086229325, "num_tokens": 26983353.0, "step": 11785 }, { "entropy": 5.628548526763916, "epoch": 1.1654804270462633, "grad_norm": 1.0, "learning_rate": 0.00048723668720195067, "loss": 5.2548, "mean_token_accuracy": 0.19369657188653946, "num_tokens": 26994828.0, "step": 11790 }, { "entropy": 5.511232709884643, "epoch": 1.1659746935547648, "grad_norm": 0.890625, "learning_rate": 0.0004872249677938825, "loss": 5.1482, "mean_token_accuracy": 0.2071622669696808, "num_tokens": 27008311.0, "step": 11795 }, { "entropy": 5.520890188217163, "epoch": 1.166468960063266, "grad_norm": 0.94921875, "learning_rate": 0.0004872132431650472, "loss": 5.1171, "mean_token_accuracy": 0.20735262781381608, "num_tokens": 27018984.0, "step": 11800 }, { "entropy": 5.626417255401611, "epoch": 1.1669632265717675, "grad_norm": 1.0546875, "learning_rate": 0.00048720151331573317, "loss": 5.2343, "mean_token_accuracy": 0.19505226016044616, "num_tokens": 27029183.0, "step": 11805 }, { "entropy": 5.516587352752685, "epoch": 1.1674574930802688, "grad_norm": 1.015625, "learning_rate": 0.000487189778246229, "loss": 5.0751, "mean_token_accuracy": 0.20972050875425338, "num_tokens": 27039661.0, "step": 11810 }, { "entropy": 5.6001372814178465, "epoch": 1.1679517595887703, "grad_norm": 0.953125, "learning_rate": 0.00048717803795682334, "loss": 5.2408, "mean_token_accuracy": 0.19591276198625565, "num_tokens": 27051685.0, "step": 11815 }, { "entropy": 5.633527612686157, "epoch": 1.1684460260972718, "grad_norm": 1.0234375, "learning_rate": 0.0004871662924478051, "loss": 5.2024, "mean_token_accuracy": 0.2055162876844406, "num_tokens": 27062096.0, "step": 11820 }, { "entropy": 5.562768030166626, "epoch": 1.168940292605773, "grad_norm": 0.96875, "learning_rate": 0.0004871545417194631, "loss": 5.1007, "mean_token_accuracy": 0.20168951600790025, "num_tokens": 27073059.0, "step": 11825 }, { "entropy": 5.591780376434326, "epoch": 1.1694345591142743, "grad_norm": 0.9921875, "learning_rate": 0.00048714278577208643, "loss": 5.1988, "mean_token_accuracy": 0.20137875229120256, "num_tokens": 27085272.0, "step": 11830 }, { "entropy": 5.631634616851807, "epoch": 1.1699288256227758, "grad_norm": 0.890625, "learning_rate": 0.0004871310246059644, "loss": 5.1685, "mean_token_accuracy": 0.19758883565664292, "num_tokens": 27096651.0, "step": 11835 }, { "entropy": 5.574219226837158, "epoch": 1.1704230921312773, "grad_norm": 0.9765625, "learning_rate": 0.00048711925822138627, "loss": 5.123, "mean_token_accuracy": 0.19889912009239197, "num_tokens": 27108180.0, "step": 11840 }, { "entropy": 5.6250550746917725, "epoch": 1.1709173586397785, "grad_norm": 1.0078125, "learning_rate": 0.00048710748661864135, "loss": 5.2012, "mean_token_accuracy": 0.19879924654960632, "num_tokens": 27118902.0, "step": 11845 }, { "entropy": 5.5774431228637695, "epoch": 1.17141162514828, "grad_norm": 0.9609375, "learning_rate": 0.00048709570979801946, "loss": 5.1449, "mean_token_accuracy": 0.2042184665799141, "num_tokens": 27131279.0, "step": 11850 }, { "entropy": 5.508077335357666, "epoch": 1.1719058916567813, "grad_norm": 0.984375, "learning_rate": 0.00048708392775981014, "loss": 5.1264, "mean_token_accuracy": 0.2079082950949669, "num_tokens": 27142983.0, "step": 11855 }, { "entropy": 5.587015581130982, "epoch": 1.1724001581652828, "grad_norm": 1.0234375, "learning_rate": 0.0004870721405043033, "loss": 5.1018, "mean_token_accuracy": 0.20354023873806, "num_tokens": 27154516.0, "step": 11860 }, { "entropy": 5.59343581199646, "epoch": 1.172894424673784, "grad_norm": 0.9921875, "learning_rate": 0.0004870603480317889, "loss": 5.1914, "mean_token_accuracy": 0.1988074705004692, "num_tokens": 27164717.0, "step": 11865 }, { "entropy": 5.565467453002929, "epoch": 1.1733886911822855, "grad_norm": 1.03125, "learning_rate": 0.00048704855034255713, "loss": 5.1811, "mean_token_accuracy": 0.20271297693252563, "num_tokens": 27174830.0, "step": 11870 }, { "entropy": 5.527771472930908, "epoch": 1.173882957690787, "grad_norm": 0.98046875, "learning_rate": 0.00048703674743689806, "loss": 5.1633, "mean_token_accuracy": 0.20361095517873765, "num_tokens": 27186724.0, "step": 11875 }, { "entropy": 5.536152648925781, "epoch": 1.1743772241992882, "grad_norm": 0.89453125, "learning_rate": 0.0004870249393151021, "loss": 5.114, "mean_token_accuracy": 0.20198605805635453, "num_tokens": 27198416.0, "step": 11880 }, { "entropy": 5.5330852508544925, "epoch": 1.1748714907077897, "grad_norm": 1.0390625, "learning_rate": 0.00048701312597745986, "loss": 5.0413, "mean_token_accuracy": 0.20200354158878325, "num_tokens": 27209347.0, "step": 11885 }, { "entropy": 5.582232904434204, "epoch": 1.175365757216291, "grad_norm": 0.953125, "learning_rate": 0.00048700130742426165, "loss": 5.1294, "mean_token_accuracy": 0.1969321459531784, "num_tokens": 27221061.0, "step": 11890 }, { "entropy": 5.4926268577575685, "epoch": 1.1758600237247925, "grad_norm": 0.8671875, "learning_rate": 0.0004869894836557985, "loss": 5.1, "mean_token_accuracy": 0.21269620954990387, "num_tokens": 27233436.0, "step": 11895 }, { "entropy": 5.535915279388428, "epoch": 1.1763542902332937, "grad_norm": 0.90234375, "learning_rate": 0.00048697765467236117, "loss": 5.1029, "mean_token_accuracy": 0.2108367383480072, "num_tokens": 27246308.0, "step": 11900 }, { "entropy": 5.548798751831055, "epoch": 1.1768485567417952, "grad_norm": 0.91796875, "learning_rate": 0.00048696582047424053, "loss": 5.164, "mean_token_accuracy": 0.19986047595739365, "num_tokens": 27258187.0, "step": 11905 }, { "entropy": 5.5187177658081055, "epoch": 1.1773428232502965, "grad_norm": 0.9609375, "learning_rate": 0.00048695398106172793, "loss": 5.1253, "mean_token_accuracy": 0.2033068612217903, "num_tokens": 27269411.0, "step": 11910 }, { "entropy": 5.558929204940796, "epoch": 1.177837089758798, "grad_norm": 0.94921875, "learning_rate": 0.0004869421364351145, "loss": 5.1461, "mean_token_accuracy": 0.20296710580587388, "num_tokens": 27280592.0, "step": 11915 }, { "entropy": 5.654514598846435, "epoch": 1.1783313562672992, "grad_norm": 0.9453125, "learning_rate": 0.00048693028659469156, "loss": 5.2163, "mean_token_accuracy": 0.19018993824720382, "num_tokens": 27292151.0, "step": 11920 }, { "entropy": 5.579726028442383, "epoch": 1.1788256227758007, "grad_norm": 0.9375, "learning_rate": 0.00048691843154075075, "loss": 5.089, "mean_token_accuracy": 0.20336078554391862, "num_tokens": 27305371.0, "step": 11925 }, { "entropy": 5.51891074180603, "epoch": 1.1793198892843022, "grad_norm": 0.90625, "learning_rate": 0.00048690657127358367, "loss": 5.1897, "mean_token_accuracy": 0.19552197456359863, "num_tokens": 27316810.0, "step": 11930 }, { "entropy": 5.565583896636963, "epoch": 1.1798141557928035, "grad_norm": 0.8828125, "learning_rate": 0.00048689470579348207, "loss": 5.1477, "mean_token_accuracy": 0.1993245854973793, "num_tokens": 27328412.0, "step": 11935 }, { "entropy": 5.599685144424439, "epoch": 1.180308422301305, "grad_norm": 1.0625, "learning_rate": 0.00048688283510073775, "loss": 5.1944, "mean_token_accuracy": 0.19982632845640183, "num_tokens": 27340216.0, "step": 11940 }, { "entropy": 5.553625249862671, "epoch": 1.1808026888098062, "grad_norm": 0.97265625, "learning_rate": 0.0004868709591956429, "loss": 5.0573, "mean_token_accuracy": 0.20556551218032837, "num_tokens": 27350290.0, "step": 11945 }, { "entropy": 5.5789642333984375, "epoch": 1.1812969553183077, "grad_norm": 1.015625, "learning_rate": 0.00048685907807848955, "loss": 5.2186, "mean_token_accuracy": 0.19541641175746918, "num_tokens": 27360639.0, "step": 11950 }, { "entropy": 5.483990144729614, "epoch": 1.181791221826809, "grad_norm": 0.93359375, "learning_rate": 0.00048684719174957005, "loss": 5.0828, "mean_token_accuracy": 0.2095842957496643, "num_tokens": 27372059.0, "step": 11955 }, { "entropy": 5.587248468399048, "epoch": 1.1822854883353104, "grad_norm": 0.92578125, "learning_rate": 0.0004868353002091767, "loss": 5.1862, "mean_token_accuracy": 0.1906408205628395, "num_tokens": 27384308.0, "step": 11960 }, { "entropy": 5.516839981079102, "epoch": 1.1827797548438117, "grad_norm": 0.9375, "learning_rate": 0.0004868234034576021, "loss": 5.0271, "mean_token_accuracy": 0.2200890377163887, "num_tokens": 27395510.0, "step": 11965 }, { "entropy": 5.533232069015503, "epoch": 1.1832740213523132, "grad_norm": 0.98828125, "learning_rate": 0.000486811501495139, "loss": 5.111, "mean_token_accuracy": 0.19996487647294997, "num_tokens": 27406697.0, "step": 11970 }, { "entropy": 5.53826870918274, "epoch": 1.1837682878608144, "grad_norm": 1.015625, "learning_rate": 0.0004867995943220801, "loss": 5.1561, "mean_token_accuracy": 0.20447388142347336, "num_tokens": 27418047.0, "step": 11975 }, { "entropy": 5.627717399597168, "epoch": 1.184262554369316, "grad_norm": 1.0078125, "learning_rate": 0.00048678768193871825, "loss": 5.2611, "mean_token_accuracy": 0.1920420229434967, "num_tokens": 27430044.0, "step": 11980 }, { "entropy": 5.56064624786377, "epoch": 1.1847568208778174, "grad_norm": 0.97265625, "learning_rate": 0.0004867757643453466, "loss": 5.152, "mean_token_accuracy": 0.19673851281404495, "num_tokens": 27441392.0, "step": 11985 }, { "entropy": 5.594499015808106, "epoch": 1.1852510873863187, "grad_norm": 0.953125, "learning_rate": 0.00048676384154225827, "loss": 5.2752, "mean_token_accuracy": 0.19351455569267273, "num_tokens": 27451356.0, "step": 11990 }, { "entropy": 5.53398027420044, "epoch": 1.1857453538948202, "grad_norm": 1.0234375, "learning_rate": 0.0004867519135297466, "loss": 5.1046, "mean_token_accuracy": 0.2122244954109192, "num_tokens": 27462358.0, "step": 11995 }, { "entropy": 5.529299736022949, "epoch": 1.1862396204033214, "grad_norm": 0.9609375, "learning_rate": 0.00048673998030810507, "loss": 5.0808, "mean_token_accuracy": 0.2051681697368622, "num_tokens": 27474144.0, "step": 12000 }, { "epoch": 1.1862396204033214, "eval_entropy": 5.350943472933799, "eval_loss": 5.224883079528809, "eval_mean_token_accuracy": 0.20619367331926233, "eval_num_tokens": 27474144.0, "eval_runtime": 20.3492, "eval_samples_per_second": 1597.757, "eval_steps_per_second": 199.763, "step": 12000 }, { "entropy": 5.606253719329834, "epoch": 1.186733886911823, "grad_norm": 0.91796875, "learning_rate": 0.00048672804187762704, "loss": 5.2454, "mean_token_accuracy": 0.18993500322103501, "num_tokens": 27486337.0, "step": 12005 }, { "entropy": 5.588819885253907, "epoch": 1.1872281534203242, "grad_norm": 0.9140625, "learning_rate": 0.0004867160982386065, "loss": 5.1777, "mean_token_accuracy": 0.2063837617635727, "num_tokens": 27498686.0, "step": 12010 }, { "entropy": 5.606222915649414, "epoch": 1.1877224199288257, "grad_norm": 1.0234375, "learning_rate": 0.00048670414939133694, "loss": 5.184, "mean_token_accuracy": 0.19456379413604735, "num_tokens": 27509850.0, "step": 12015 }, { "entropy": 5.672155952453613, "epoch": 1.188216686437327, "grad_norm": 0.921875, "learning_rate": 0.0004866921953361125, "loss": 5.2879, "mean_token_accuracy": 0.19103008210659028, "num_tokens": 27521994.0, "step": 12020 }, { "entropy": 5.5940749168396, "epoch": 1.1887109529458284, "grad_norm": 0.92578125, "learning_rate": 0.0004866802360732273, "loss": 5.2096, "mean_token_accuracy": 0.1979520544409752, "num_tokens": 27534980.0, "step": 12025 }, { "entropy": 5.572839260101318, "epoch": 1.1892052194543297, "grad_norm": 1.0078125, "learning_rate": 0.0004866682716029754, "loss": 5.121, "mean_token_accuracy": 0.2025532379746437, "num_tokens": 27546461.0, "step": 12030 }, { "entropy": 5.535236263275147, "epoch": 1.1896994859628311, "grad_norm": 0.890625, "learning_rate": 0.00048665630192565117, "loss": 5.0804, "mean_token_accuracy": 0.2023960381746292, "num_tokens": 27557076.0, "step": 12035 }, { "entropy": 5.529903936386108, "epoch": 1.1901937524713326, "grad_norm": 0.88671875, "learning_rate": 0.0004866443270415491, "loss": 5.1573, "mean_token_accuracy": 0.2077688232064247, "num_tokens": 27569807.0, "step": 12040 }, { "entropy": 5.536041498184204, "epoch": 1.190688018979834, "grad_norm": 0.9296875, "learning_rate": 0.0004866323469509637, "loss": 5.0685, "mean_token_accuracy": 0.20607318580150605, "num_tokens": 27579858.0, "step": 12045 }, { "entropy": 5.5419731616973875, "epoch": 1.1911822854883354, "grad_norm": 1.0, "learning_rate": 0.0004866203616541898, "loss": 5.1733, "mean_token_accuracy": 0.19475528597831726, "num_tokens": 27590192.0, "step": 12050 }, { "entropy": 5.537713956832886, "epoch": 1.1916765519968366, "grad_norm": 0.97265625, "learning_rate": 0.00048660837115152214, "loss": 5.1947, "mean_token_accuracy": 0.20432979613542557, "num_tokens": 27601756.0, "step": 12055 }, { "entropy": 5.560750913619995, "epoch": 1.1921708185053381, "grad_norm": 0.828125, "learning_rate": 0.0004865963754432557, "loss": 5.0934, "mean_token_accuracy": 0.20397782176733018, "num_tokens": 27614019.0, "step": 12060 }, { "entropy": 5.5387622833251955, "epoch": 1.1926650850138394, "grad_norm": 0.9921875, "learning_rate": 0.0004865843745296856, "loss": 5.1246, "mean_token_accuracy": 0.2038758009672165, "num_tokens": 27626900.0, "step": 12065 }, { "entropy": 5.549509525299072, "epoch": 1.1931593515223409, "grad_norm": 1.0, "learning_rate": 0.00048657236841110707, "loss": 5.0703, "mean_token_accuracy": 0.20717169791460038, "num_tokens": 27637897.0, "step": 12070 }, { "entropy": 5.547579050064087, "epoch": 1.1936536180308421, "grad_norm": 0.91015625, "learning_rate": 0.0004865603570878155, "loss": 5.1839, "mean_token_accuracy": 0.198381145298481, "num_tokens": 27649523.0, "step": 12075 }, { "entropy": 5.597507190704346, "epoch": 1.1941478845393436, "grad_norm": 1.0546875, "learning_rate": 0.0004865483405601063, "loss": 5.1961, "mean_token_accuracy": 0.1990346357226372, "num_tokens": 27659406.0, "step": 12080 }, { "entropy": 5.522911071777344, "epoch": 1.1946421510478449, "grad_norm": 0.9296875, "learning_rate": 0.0004865363188282751, "loss": 5.1018, "mean_token_accuracy": 0.20534287840127946, "num_tokens": 27670912.0, "step": 12085 }, { "entropy": 5.564089727401734, "epoch": 1.1951364175563464, "grad_norm": 1.015625, "learning_rate": 0.00048652429189261767, "loss": 5.1319, "mean_token_accuracy": 0.20858239233493805, "num_tokens": 27681667.0, "step": 12090 }, { "entropy": 5.603047466278076, "epoch": 1.1956306840648478, "grad_norm": 0.98046875, "learning_rate": 0.0004865122597534298, "loss": 5.1534, "mean_token_accuracy": 0.2065138652920723, "num_tokens": 27692170.0, "step": 12095 }, { "entropy": 5.476941299438477, "epoch": 1.196124950573349, "grad_norm": 1.0078125, "learning_rate": 0.0004865002224110075, "loss": 5.0316, "mean_token_accuracy": 0.21594871431589127, "num_tokens": 27702533.0, "step": 12100 }, { "entropy": 5.501384830474853, "epoch": 1.1966192170818506, "grad_norm": 1.0078125, "learning_rate": 0.000486488179865647, "loss": 5.0522, "mean_token_accuracy": 0.21238352805376054, "num_tokens": 27713795.0, "step": 12105 }, { "entropy": 5.579130363464356, "epoch": 1.1971134835903519, "grad_norm": 1.0, "learning_rate": 0.0004864761321176444, "loss": 5.1982, "mean_token_accuracy": 0.20066786259412767, "num_tokens": 27725404.0, "step": 12110 }, { "entropy": 5.547001647949219, "epoch": 1.1976077500988533, "grad_norm": 1.0390625, "learning_rate": 0.0004864640791672962, "loss": 5.0682, "mean_token_accuracy": 0.2029715046286583, "num_tokens": 27737537.0, "step": 12115 }, { "entropy": 5.511212587356567, "epoch": 1.1981020166073546, "grad_norm": 0.91015625, "learning_rate": 0.0004864520210148988, "loss": 5.0913, "mean_token_accuracy": 0.20899055153131485, "num_tokens": 27749841.0, "step": 12120 }, { "entropy": 5.570568084716797, "epoch": 1.198596283115856, "grad_norm": 1.046875, "learning_rate": 0.0004864399576607489, "loss": 5.2029, "mean_token_accuracy": 0.1996957093477249, "num_tokens": 27760302.0, "step": 12125 }, { "entropy": 5.570320320129395, "epoch": 1.1990905496243576, "grad_norm": 1.140625, "learning_rate": 0.00048642788910514324, "loss": 5.1733, "mean_token_accuracy": 0.19922951757907867, "num_tokens": 27770989.0, "step": 12130 }, { "entropy": 5.581558561325073, "epoch": 1.1995848161328588, "grad_norm": 0.9140625, "learning_rate": 0.00048641581534837863, "loss": 5.1254, "mean_token_accuracy": 0.20401979237794876, "num_tokens": 27785196.0, "step": 12135 }, { "entropy": 5.5827244281768795, "epoch": 1.2000790826413603, "grad_norm": 1.015625, "learning_rate": 0.00048640373639075225, "loss": 5.1848, "mean_token_accuracy": 0.2016398772597313, "num_tokens": 27795588.0, "step": 12140 }, { "entropy": 5.48231053352356, "epoch": 1.2005733491498616, "grad_norm": 0.98828125, "learning_rate": 0.00048639165223256117, "loss": 5.0745, "mean_token_accuracy": 0.20510871410369874, "num_tokens": 27807204.0, "step": 12145 }, { "entropy": 5.538344955444336, "epoch": 1.201067615658363, "grad_norm": 1.03125, "learning_rate": 0.00048637956287410263, "loss": 5.057, "mean_token_accuracy": 0.21138203740119935, "num_tokens": 27817959.0, "step": 12150 }, { "entropy": 5.563371896743774, "epoch": 1.2015618821668643, "grad_norm": 1.0, "learning_rate": 0.00048636746831567403, "loss": 5.2278, "mean_token_accuracy": 0.19584421962499618, "num_tokens": 27830736.0, "step": 12155 }, { "entropy": 5.576968145370484, "epoch": 1.2020561486753658, "grad_norm": 1.1015625, "learning_rate": 0.0004863553685575729, "loss": 5.1748, "mean_token_accuracy": 0.19501989632844924, "num_tokens": 27840992.0, "step": 12160 }, { "entropy": 5.605135679244995, "epoch": 1.202550415183867, "grad_norm": 0.95703125, "learning_rate": 0.0004863432636000969, "loss": 5.1419, "mean_token_accuracy": 0.19932252466678618, "num_tokens": 27852747.0, "step": 12165 }, { "entropy": 5.565184259414673, "epoch": 1.2030446816923686, "grad_norm": 0.91796875, "learning_rate": 0.0004863311534435439, "loss": 5.2206, "mean_token_accuracy": 0.19357378780841827, "num_tokens": 27865136.0, "step": 12170 }, { "entropy": 5.60824761390686, "epoch": 1.2035389482008698, "grad_norm": 0.98046875, "learning_rate": 0.00048631903808821176, "loss": 5.0719, "mean_token_accuracy": 0.205821293592453, "num_tokens": 27876489.0, "step": 12175 }, { "entropy": 5.548784589767456, "epoch": 1.2040332147093713, "grad_norm": 1.015625, "learning_rate": 0.00048630691753439844, "loss": 5.0895, "mean_token_accuracy": 0.20974990576505662, "num_tokens": 27886478.0, "step": 12180 }, { "entropy": 5.494566535949707, "epoch": 1.2045274812178728, "grad_norm": 0.98828125, "learning_rate": 0.0004862947917824022, "loss": 5.1039, "mean_token_accuracy": 0.21159018725156784, "num_tokens": 27897473.0, "step": 12185 }, { "entropy": 5.518172931671143, "epoch": 1.205021747726374, "grad_norm": 0.96484375, "learning_rate": 0.00048628266083252124, "loss": 5.0673, "mean_token_accuracy": 0.20262546241283416, "num_tokens": 27908390.0, "step": 12190 }, { "entropy": 5.63221549987793, "epoch": 1.2055160142348755, "grad_norm": 1.0859375, "learning_rate": 0.0004862705246850541, "loss": 5.163, "mean_token_accuracy": 0.19483965635299683, "num_tokens": 27919372.0, "step": 12195 }, { "entropy": 5.537039852142334, "epoch": 1.2060102807433768, "grad_norm": 0.953125, "learning_rate": 0.0004862583833402993, "loss": 5.1123, "mean_token_accuracy": 0.2033754676580429, "num_tokens": 27931294.0, "step": 12200 }, { "entropy": 5.5740217685699465, "epoch": 1.2065045472518783, "grad_norm": 1.0703125, "learning_rate": 0.0004862462367985554, "loss": 5.1695, "mean_token_accuracy": 0.2008316174149513, "num_tokens": 27941782.0, "step": 12205 }, { "entropy": 5.559038972854614, "epoch": 1.2069988137603795, "grad_norm": 1.0546875, "learning_rate": 0.0004862340850601214, "loss": 5.0674, "mean_token_accuracy": 0.21748096644878387, "num_tokens": 27951703.0, "step": 12210 }, { "entropy": 5.59559178352356, "epoch": 1.207493080268881, "grad_norm": 1.1328125, "learning_rate": 0.0004862219281252961, "loss": 5.1008, "mean_token_accuracy": 0.20478769093751908, "num_tokens": 27962049.0, "step": 12215 }, { "entropy": 5.585819673538208, "epoch": 1.2079873467773823, "grad_norm": 0.97265625, "learning_rate": 0.0004862097659943786, "loss": 5.1336, "mean_token_accuracy": 0.1997738152742386, "num_tokens": 27973502.0, "step": 12220 }, { "entropy": 5.484788179397583, "epoch": 1.2084816132858838, "grad_norm": 0.9765625, "learning_rate": 0.00048619759866766807, "loss": 5.0233, "mean_token_accuracy": 0.21281846910715102, "num_tokens": 27984653.0, "step": 12225 }, { "entropy": 5.583715105056763, "epoch": 1.208975879794385, "grad_norm": 1.015625, "learning_rate": 0.00048618542614546384, "loss": 5.2195, "mean_token_accuracy": 0.19113730192184447, "num_tokens": 27995152.0, "step": 12230 }, { "entropy": 5.644762706756592, "epoch": 1.2094701463028865, "grad_norm": 1.078125, "learning_rate": 0.00048617324842806545, "loss": 5.2812, "mean_token_accuracy": 0.20170254707336427, "num_tokens": 28006928.0, "step": 12235 }, { "entropy": 5.601574945449829, "epoch": 1.209964412811388, "grad_norm": 0.984375, "learning_rate": 0.00048616106551577226, "loss": 5.1124, "mean_token_accuracy": 0.1999893993139267, "num_tokens": 28018004.0, "step": 12240 }, { "entropy": 5.607110929489136, "epoch": 1.2104586793198893, "grad_norm": 0.9375, "learning_rate": 0.00048614887740888426, "loss": 5.2284, "mean_token_accuracy": 0.1921067327260971, "num_tokens": 28030645.0, "step": 12245 }, { "entropy": 5.576347970962525, "epoch": 1.2109529458283907, "grad_norm": 0.98046875, "learning_rate": 0.000486136684107701, "loss": 5.1501, "mean_token_accuracy": 0.1970527097582817, "num_tokens": 28042591.0, "step": 12250 }, { "entropy": 5.555475902557373, "epoch": 1.211447212336892, "grad_norm": 0.9609375, "learning_rate": 0.0004861244856125226, "loss": 5.0847, "mean_token_accuracy": 0.20535727143287658, "num_tokens": 28053285.0, "step": 12255 }, { "entropy": 5.441348361968994, "epoch": 1.2119414788453935, "grad_norm": 0.91015625, "learning_rate": 0.0004861122819236491, "loss": 5.0742, "mean_token_accuracy": 0.21066842526197432, "num_tokens": 28065747.0, "step": 12260 }, { "entropy": 5.521334886550903, "epoch": 1.2124357453538948, "grad_norm": 0.96875, "learning_rate": 0.00048610007304138067, "loss": 5.1221, "mean_token_accuracy": 0.2053689956665039, "num_tokens": 28077112.0, "step": 12265 }, { "entropy": 5.562102890014648, "epoch": 1.2129300118623962, "grad_norm": 0.93359375, "learning_rate": 0.0004860878589660177, "loss": 5.1232, "mean_token_accuracy": 0.20958794057369232, "num_tokens": 28088835.0, "step": 12270 }, { "entropy": 5.659830856323242, "epoch": 1.2134242783708975, "grad_norm": 0.94921875, "learning_rate": 0.0004860756396978607, "loss": 5.1991, "mean_token_accuracy": 0.1969951495528221, "num_tokens": 28100921.0, "step": 12275 }, { "entropy": 5.549700546264648, "epoch": 1.213918544879399, "grad_norm": 0.93359375, "learning_rate": 0.0004860634152372102, "loss": 5.1419, "mean_token_accuracy": 0.20044081658124924, "num_tokens": 28112531.0, "step": 12280 }, { "entropy": 5.586253070831299, "epoch": 1.2144128113879002, "grad_norm": 0.9765625, "learning_rate": 0.0004860511855843669, "loss": 5.1679, "mean_token_accuracy": 0.19991495460271835, "num_tokens": 28123821.0, "step": 12285 }, { "entropy": 5.557551527023316, "epoch": 1.2149070778964017, "grad_norm": 0.8984375, "learning_rate": 0.00048603895073963177, "loss": 5.1225, "mean_token_accuracy": 0.2018553927540779, "num_tokens": 28135046.0, "step": 12290 }, { "entropy": 5.539025497436524, "epoch": 1.2154013444049032, "grad_norm": 1.046875, "learning_rate": 0.00048602671070330564, "loss": 5.1216, "mean_token_accuracy": 0.20502732694149017, "num_tokens": 28145870.0, "step": 12295 }, { "entropy": 5.614471387863159, "epoch": 1.2158956109134045, "grad_norm": 1.046875, "learning_rate": 0.00048601446547568973, "loss": 5.1582, "mean_token_accuracy": 0.2003155305981636, "num_tokens": 28156078.0, "step": 12300 }, { "entropy": 5.60464301109314, "epoch": 1.216389877421906, "grad_norm": 0.92578125, "learning_rate": 0.0004860022150570852, "loss": 5.1169, "mean_token_accuracy": 0.20152645260095597, "num_tokens": 28166658.0, "step": 12305 }, { "entropy": 5.5516032695770265, "epoch": 1.2168841439304072, "grad_norm": 0.88671875, "learning_rate": 0.00048598995944779344, "loss": 5.1341, "mean_token_accuracy": 0.20131059885025024, "num_tokens": 28178890.0, "step": 12310 }, { "entropy": 5.5417924404144285, "epoch": 1.2173784104389087, "grad_norm": 0.86328125, "learning_rate": 0.00048597769864811604, "loss": 5.1216, "mean_token_accuracy": 0.20877133011817933, "num_tokens": 28191101.0, "step": 12315 }, { "entropy": 5.552534389495849, "epoch": 1.21787267694741, "grad_norm": 0.93359375, "learning_rate": 0.0004859654326583544, "loss": 5.2106, "mean_token_accuracy": 0.1985444590449333, "num_tokens": 28202877.0, "step": 12320 }, { "entropy": 5.600597763061524, "epoch": 1.2183669434559115, "grad_norm": 0.94140625, "learning_rate": 0.0004859531614788105, "loss": 5.1766, "mean_token_accuracy": 0.20084937214851378, "num_tokens": 28214762.0, "step": 12325 }, { "entropy": 5.561122703552246, "epoch": 1.2188612099644127, "grad_norm": 1.0625, "learning_rate": 0.000485940885109786, "loss": 5.1227, "mean_token_accuracy": 0.1979749843478203, "num_tokens": 28225830.0, "step": 12330 }, { "entropy": 5.502673101425171, "epoch": 1.2193554764729142, "grad_norm": 0.90234375, "learning_rate": 0.00048592860355158306, "loss": 5.0891, "mean_token_accuracy": 0.2077110454440117, "num_tokens": 28237302.0, "step": 12335 }, { "entropy": 5.567276096343994, "epoch": 1.2198497429814155, "grad_norm": 1.0078125, "learning_rate": 0.0004859163168045038, "loss": 5.1084, "mean_token_accuracy": 0.21372148543596267, "num_tokens": 28247658.0, "step": 12340 }, { "entropy": 5.529503011703492, "epoch": 1.220344009489917, "grad_norm": 1.0234375, "learning_rate": 0.0004859040248688503, "loss": 5.1515, "mean_token_accuracy": 0.20457004457712175, "num_tokens": 28258473.0, "step": 12345 }, { "entropy": 5.662737607955933, "epoch": 1.2208382759984184, "grad_norm": 1.03125, "learning_rate": 0.00048589172774492515, "loss": 5.2661, "mean_token_accuracy": 0.19604720920324326, "num_tokens": 28270167.0, "step": 12350 }, { "entropy": 5.539353275299073, "epoch": 1.2213325425069197, "grad_norm": 0.984375, "learning_rate": 0.00048587942543303075, "loss": 5.1258, "mean_token_accuracy": 0.20520105957984924, "num_tokens": 28282047.0, "step": 12355 }, { "entropy": 5.5645397186279295, "epoch": 1.2218268090154212, "grad_norm": 0.98046875, "learning_rate": 0.0004858671179334698, "loss": 5.0978, "mean_token_accuracy": 0.20718374401330947, "num_tokens": 28292868.0, "step": 12360 }, { "entropy": 5.643032217025757, "epoch": 1.2223210755239224, "grad_norm": 0.921875, "learning_rate": 0.00048585480524654504, "loss": 5.2532, "mean_token_accuracy": 0.19163850992918013, "num_tokens": 28303816.0, "step": 12365 }, { "entropy": 5.658598852157593, "epoch": 1.222815342032424, "grad_norm": 0.9765625, "learning_rate": 0.0004858424873725593, "loss": 5.239, "mean_token_accuracy": 0.19514012336730957, "num_tokens": 28315191.0, "step": 12370 }, { "entropy": 5.581710577011108, "epoch": 1.2233096085409252, "grad_norm": 1.0390625, "learning_rate": 0.0004858301643118157, "loss": 5.0938, "mean_token_accuracy": 0.20735086351633072, "num_tokens": 28325312.0, "step": 12375 }, { "entropy": 5.5564251899719235, "epoch": 1.2238038750494267, "grad_norm": 1.109375, "learning_rate": 0.0004858178360646174, "loss": 5.1822, "mean_token_accuracy": 0.2015673264861107, "num_tokens": 28336171.0, "step": 12380 }, { "entropy": 5.56424994468689, "epoch": 1.2242981415579282, "grad_norm": 0.90234375, "learning_rate": 0.00048580550263126757, "loss": 5.1528, "mean_token_accuracy": 0.1944349393248558, "num_tokens": 28347488.0, "step": 12385 }, { "entropy": 5.587853002548218, "epoch": 1.2247924080664294, "grad_norm": 0.96484375, "learning_rate": 0.0004857931640120697, "loss": 5.0811, "mean_token_accuracy": 0.2097611755132675, "num_tokens": 28358653.0, "step": 12390 }, { "entropy": 5.530338716506958, "epoch": 1.2252866745749307, "grad_norm": 0.97265625, "learning_rate": 0.00048578082020732724, "loss": 5.1184, "mean_token_accuracy": 0.21497515141963958, "num_tokens": 28369588.0, "step": 12395 }, { "entropy": 5.5004315853118895, "epoch": 1.2257809410834322, "grad_norm": 0.9375, "learning_rate": 0.000485768471217344, "loss": 5.0419, "mean_token_accuracy": 0.20667341202497483, "num_tokens": 28382009.0, "step": 12400 }, { "entropy": 5.600673198699951, "epoch": 1.2262752075919336, "grad_norm": 0.98046875, "learning_rate": 0.0004857561170424235, "loss": 5.1879, "mean_token_accuracy": 0.19260446429252626, "num_tokens": 28394376.0, "step": 12405 }, { "entropy": 5.616631698608399, "epoch": 1.226769474100435, "grad_norm": 1.03125, "learning_rate": 0.00048574375768286996, "loss": 5.1996, "mean_token_accuracy": 0.1968756839632988, "num_tokens": 28406453.0, "step": 12410 }, { "entropy": 5.612762832641602, "epoch": 1.2272637406089364, "grad_norm": 0.98046875, "learning_rate": 0.00048573139313898723, "loss": 5.1415, "mean_token_accuracy": 0.20663228929042815, "num_tokens": 28417178.0, "step": 12415 }, { "entropy": 5.5937079906463625, "epoch": 1.2277580071174377, "grad_norm": 0.9921875, "learning_rate": 0.0004857190234110795, "loss": 5.1416, "mean_token_accuracy": 0.19749438166618347, "num_tokens": 28428396.0, "step": 12420 }, { "entropy": 5.469331932067871, "epoch": 1.2282522736259391, "grad_norm": 0.91796875, "learning_rate": 0.0004857066484994512, "loss": 5.083, "mean_token_accuracy": 0.20803297460079193, "num_tokens": 28441239.0, "step": 12425 }, { "entropy": 5.6153301239013675, "epoch": 1.2287465401344404, "grad_norm": 1.0546875, "learning_rate": 0.0004856942684044067, "loss": 5.2678, "mean_token_accuracy": 0.20296391397714614, "num_tokens": 28453671.0, "step": 12430 }, { "entropy": 5.566578769683838, "epoch": 1.2292408066429419, "grad_norm": 1.078125, "learning_rate": 0.00048568188312625037, "loss": 5.1393, "mean_token_accuracy": 0.20274109542369842, "num_tokens": 28465922.0, "step": 12435 }, { "entropy": 5.5779965877532955, "epoch": 1.2297350731514434, "grad_norm": 0.96875, "learning_rate": 0.0004856694926652871, "loss": 5.122, "mean_token_accuracy": 0.20147884041070938, "num_tokens": 28477559.0, "step": 12440 }, { "entropy": 5.517611122131347, "epoch": 1.2302293396599446, "grad_norm": 1.0078125, "learning_rate": 0.00048565709702182164, "loss": 5.1709, "mean_token_accuracy": 0.2013767331838608, "num_tokens": 28489276.0, "step": 12445 }, { "entropy": 5.584882593154907, "epoch": 1.2307236061684461, "grad_norm": 0.97265625, "learning_rate": 0.0004856446961961589, "loss": 5.2731, "mean_token_accuracy": 0.19741799533367158, "num_tokens": 28500821.0, "step": 12450 }, { "entropy": 5.606778478622436, "epoch": 1.2312178726769474, "grad_norm": 0.87109375, "learning_rate": 0.00048563229018860394, "loss": 5.1759, "mean_token_accuracy": 0.201718670129776, "num_tokens": 28513646.0, "step": 12455 }, { "entropy": 5.594239616394043, "epoch": 1.2317121391854489, "grad_norm": 0.9375, "learning_rate": 0.00048561987899946204, "loss": 5.1758, "mean_token_accuracy": 0.20248331278562545, "num_tokens": 28525508.0, "step": 12460 }, { "entropy": 5.642206192016602, "epoch": 1.2322064056939501, "grad_norm": 0.98828125, "learning_rate": 0.00048560746262903836, "loss": 5.1605, "mean_token_accuracy": 0.20255838185548783, "num_tokens": 28537863.0, "step": 12465 }, { "entropy": 5.58889946937561, "epoch": 1.2327006722024516, "grad_norm": 1.078125, "learning_rate": 0.0004855950410776385, "loss": 5.1624, "mean_token_accuracy": 0.19847507029771805, "num_tokens": 28550163.0, "step": 12470 }, { "entropy": 5.5216789722442625, "epoch": 1.2331949387109529, "grad_norm": 1.0625, "learning_rate": 0.0004855826143455678, "loss": 5.0701, "mean_token_accuracy": 0.20322557538747787, "num_tokens": 28560501.0, "step": 12475 }, { "entropy": 5.572009086608887, "epoch": 1.2336892052194544, "grad_norm": 1.046875, "learning_rate": 0.0004855701824331323, "loss": 5.2084, "mean_token_accuracy": 0.19184273034334182, "num_tokens": 28573057.0, "step": 12480 }, { "entropy": 5.610177087783813, "epoch": 1.2341834717279556, "grad_norm": 0.921875, "learning_rate": 0.00048555774534063753, "loss": 5.2035, "mean_token_accuracy": 0.19265684932470323, "num_tokens": 28585147.0, "step": 12485 }, { "entropy": 5.533315992355346, "epoch": 1.234677738236457, "grad_norm": 0.94140625, "learning_rate": 0.0004855453030683896, "loss": 5.1826, "mean_token_accuracy": 0.20019556432962418, "num_tokens": 28597774.0, "step": 12490 }, { "entropy": 5.552670335769653, "epoch": 1.2351720047449586, "grad_norm": 0.9765625, "learning_rate": 0.0004855328556166945, "loss": 5.0853, "mean_token_accuracy": 0.20767527520656587, "num_tokens": 28610031.0, "step": 12495 }, { "entropy": 5.61899356842041, "epoch": 1.2356662712534598, "grad_norm": 0.9296875, "learning_rate": 0.0004855204029858586, "loss": 5.1715, "mean_token_accuracy": 0.19956287294626235, "num_tokens": 28621485.0, "step": 12500 }, { "entropy": 5.528637361526489, "epoch": 1.2361605377619613, "grad_norm": 0.93359375, "learning_rate": 0.0004855079451761881, "loss": 5.0799, "mean_token_accuracy": 0.20973207503557206, "num_tokens": 28632213.0, "step": 12505 }, { "entropy": 5.615707015991211, "epoch": 1.2366548042704626, "grad_norm": 0.953125, "learning_rate": 0.0004854954821879894, "loss": 5.2299, "mean_token_accuracy": 0.195303313434124, "num_tokens": 28643994.0, "step": 12510 }, { "entropy": 5.668883419036865, "epoch": 1.237149070778964, "grad_norm": 0.9375, "learning_rate": 0.00048548301402156927, "loss": 5.184, "mean_token_accuracy": 0.20455095320940017, "num_tokens": 28656556.0, "step": 12515 }, { "entropy": 5.5333953380584715, "epoch": 1.2376433372874653, "grad_norm": 1.0546875, "learning_rate": 0.0004854705406772343, "loss": 5.1543, "mean_token_accuracy": 0.209703466296196, "num_tokens": 28668022.0, "step": 12520 }, { "entropy": 5.543085813522339, "epoch": 1.2381376037959668, "grad_norm": 1.0078125, "learning_rate": 0.00048545806215529136, "loss": 5.1619, "mean_token_accuracy": 0.19357722699642183, "num_tokens": 28679074.0, "step": 12525 }, { "entropy": 5.5393352031707765, "epoch": 1.238631870304468, "grad_norm": 0.859375, "learning_rate": 0.00048544557845604753, "loss": 5.0837, "mean_token_accuracy": 0.2072378233075142, "num_tokens": 28691872.0, "step": 12530 }, { "entropy": 5.636446189880371, "epoch": 1.2391261368129696, "grad_norm": 1.078125, "learning_rate": 0.00048543308957980973, "loss": 5.194, "mean_token_accuracy": 0.19903235286474227, "num_tokens": 28703367.0, "step": 12535 }, { "entropy": 5.503182601928711, "epoch": 1.2396204033214708, "grad_norm": 1.03125, "learning_rate": 0.0004854205955268853, "loss": 5.0435, "mean_token_accuracy": 0.2156751960515976, "num_tokens": 28713841.0, "step": 12540 }, { "entropy": 5.605351352691651, "epoch": 1.2401146698299723, "grad_norm": 0.9609375, "learning_rate": 0.00048540809629758167, "loss": 5.1917, "mean_token_accuracy": 0.19212467223405838, "num_tokens": 28724924.0, "step": 12545 }, { "entropy": 5.6089283466339115, "epoch": 1.2406089363384738, "grad_norm": 0.87890625, "learning_rate": 0.0004853955918922061, "loss": 5.1653, "mean_token_accuracy": 0.20193246901035308, "num_tokens": 28736236.0, "step": 12550 }, { "entropy": 5.570017766952515, "epoch": 1.241103202846975, "grad_norm": 0.93359375, "learning_rate": 0.0004853830823110663, "loss": 5.2087, "mean_token_accuracy": 0.20184025913476944, "num_tokens": 28748841.0, "step": 12555 }, { "entropy": 5.567014884948731, "epoch": 1.2415974693554765, "grad_norm": 0.94921875, "learning_rate": 0.0004853705675544702, "loss": 5.0585, "mean_token_accuracy": 0.2080792799592018, "num_tokens": 28759491.0, "step": 12560 }, { "entropy": 5.485192584991455, "epoch": 1.2420917358639778, "grad_norm": 0.8828125, "learning_rate": 0.0004853580476227254, "loss": 5.0181, "mean_token_accuracy": 0.21104526072740554, "num_tokens": 28771668.0, "step": 12565 }, { "entropy": 5.548715114593506, "epoch": 1.2425860023724793, "grad_norm": 0.99609375, "learning_rate": 0.00048534552251614, "loss": 5.1523, "mean_token_accuracy": 0.19993438124656676, "num_tokens": 28783102.0, "step": 12570 }, { "entropy": 5.550833749771118, "epoch": 1.2430802688809806, "grad_norm": 0.953125, "learning_rate": 0.00048533299223502217, "loss": 5.1697, "mean_token_accuracy": 0.20043113380670546, "num_tokens": 28794643.0, "step": 12575 }, { "entropy": 5.621817398071289, "epoch": 1.243574535389482, "grad_norm": 1.015625, "learning_rate": 0.0004853204567796801, "loss": 5.1671, "mean_token_accuracy": 0.1967419996857643, "num_tokens": 28806597.0, "step": 12580 }, { "entropy": 5.597347021102905, "epoch": 1.2440688018979833, "grad_norm": 1.03125, "learning_rate": 0.000485307916150422, "loss": 5.1334, "mean_token_accuracy": 0.2062913030385971, "num_tokens": 28817379.0, "step": 12585 }, { "entropy": 5.518059825897216, "epoch": 1.2445630684064848, "grad_norm": 1.125, "learning_rate": 0.0004852953703475567, "loss": 5.1526, "mean_token_accuracy": 0.1993664711713791, "num_tokens": 28828412.0, "step": 12590 }, { "entropy": 5.511235904693604, "epoch": 1.245057334914986, "grad_norm": 1.0390625, "learning_rate": 0.00048528281937139264, "loss": 5.0653, "mean_token_accuracy": 0.2075911730527878, "num_tokens": 28839888.0, "step": 12595 }, { "entropy": 5.626152753829956, "epoch": 1.2455516014234875, "grad_norm": 0.984375, "learning_rate": 0.00048527026322223854, "loss": 5.2561, "mean_token_accuracy": 0.19546025693416597, "num_tokens": 28852113.0, "step": 12600 }, { "entropy": 5.664360284805298, "epoch": 1.246045867931989, "grad_norm": 0.91796875, "learning_rate": 0.0004852577019004035, "loss": 5.1889, "mean_token_accuracy": 0.20023537278175355, "num_tokens": 28864715.0, "step": 12605 }, { "entropy": 5.502137041091919, "epoch": 1.2465401344404903, "grad_norm": 1.0390625, "learning_rate": 0.0004852451354061962, "loss": 5.0271, "mean_token_accuracy": 0.2124041885137558, "num_tokens": 28875166.0, "step": 12610 }, { "entropy": 5.5464598655700685, "epoch": 1.2470344009489918, "grad_norm": 0.984375, "learning_rate": 0.00048523256373992604, "loss": 5.1198, "mean_token_accuracy": 0.2029197558760643, "num_tokens": 28885946.0, "step": 12615 }, { "entropy": 5.569629716873169, "epoch": 1.247528667457493, "grad_norm": 0.9609375, "learning_rate": 0.0004852199869019021, "loss": 5.1088, "mean_token_accuracy": 0.21180127263069154, "num_tokens": 28896654.0, "step": 12620 }, { "entropy": 5.575248146057129, "epoch": 1.2480229339659945, "grad_norm": 0.9609375, "learning_rate": 0.00048520740489243396, "loss": 5.1421, "mean_token_accuracy": 0.20486144572496415, "num_tokens": 28908306.0, "step": 12625 }, { "entropy": 5.630066919326782, "epoch": 1.2485172004744958, "grad_norm": 0.88671875, "learning_rate": 0.00048519481771183107, "loss": 5.1732, "mean_token_accuracy": 0.19363946318626404, "num_tokens": 28921044.0, "step": 12630 }, { "entropy": 5.556470489501953, "epoch": 1.2490114669829973, "grad_norm": 0.859375, "learning_rate": 0.000485182225360403, "loss": 5.0992, "mean_token_accuracy": 0.20622342079877853, "num_tokens": 28932290.0, "step": 12635 }, { "entropy": 5.592446613311767, "epoch": 1.2495057334914987, "grad_norm": 0.97265625, "learning_rate": 0.0004851696278384596, "loss": 5.1259, "mean_token_accuracy": 0.20389163941144944, "num_tokens": 28943482.0, "step": 12640 }, { "entropy": 5.527834463119507, "epoch": 1.25, "grad_norm": 0.96484375, "learning_rate": 0.0004851570251463107, "loss": 5.1564, "mean_token_accuracy": 0.2056015446782112, "num_tokens": 28954749.0, "step": 12645 }, { "entropy": 5.643036222457885, "epoch": 1.2504942665085013, "grad_norm": 1.015625, "learning_rate": 0.00048514441728426646, "loss": 5.2153, "mean_token_accuracy": 0.19645627588033676, "num_tokens": 28965304.0, "step": 12650 }, { "entropy": 5.549638271331787, "epoch": 1.2509885330170027, "grad_norm": 1.0859375, "learning_rate": 0.0004851318042526369, "loss": 5.0985, "mean_token_accuracy": 0.20138593018054962, "num_tokens": 28976267.0, "step": 12655 }, { "entropy": 5.624220514297486, "epoch": 1.2514827995255042, "grad_norm": 1.0859375, "learning_rate": 0.0004851191860517324, "loss": 5.2508, "mean_token_accuracy": 0.19888855516910553, "num_tokens": 28986492.0, "step": 12660 }, { "entropy": 5.5842681407928465, "epoch": 1.2519770660340055, "grad_norm": 0.9609375, "learning_rate": 0.00048510656268186325, "loss": 5.1063, "mean_token_accuracy": 0.2059616521000862, "num_tokens": 28996693.0, "step": 12665 }, { "entropy": 5.5974987030029295, "epoch": 1.252471332542507, "grad_norm": 0.91015625, "learning_rate": 0.0004850939341433401, "loss": 5.1638, "mean_token_accuracy": 0.20920474976301193, "num_tokens": 29008498.0, "step": 12670 }, { "entropy": 5.646906137466431, "epoch": 1.2529655990510082, "grad_norm": 0.94921875, "learning_rate": 0.00048508130043647366, "loss": 5.2449, "mean_token_accuracy": 0.19596898108720778, "num_tokens": 29018563.0, "step": 12675 }, { "entropy": 5.551891088485718, "epoch": 1.2534598655595097, "grad_norm": 1.0625, "learning_rate": 0.0004850686615615745, "loss": 5.1078, "mean_token_accuracy": 0.20634361803531648, "num_tokens": 29029204.0, "step": 12680 }, { "entropy": 5.573403215408325, "epoch": 1.253954132068011, "grad_norm": 0.90625, "learning_rate": 0.00048505601751895383, "loss": 5.1529, "mean_token_accuracy": 0.19341640770435334, "num_tokens": 29041112.0, "step": 12685 }, { "entropy": 5.694770288467407, "epoch": 1.2544483985765125, "grad_norm": 1.015625, "learning_rate": 0.0004850433683089224, "loss": 5.1593, "mean_token_accuracy": 0.2059462547302246, "num_tokens": 29052791.0, "step": 12690 }, { "entropy": 5.604700708389283, "epoch": 1.254942665085014, "grad_norm": 0.95703125, "learning_rate": 0.0004850307139317916, "loss": 5.2089, "mean_token_accuracy": 0.19855011701583863, "num_tokens": 29064525.0, "step": 12695 }, { "entropy": 5.4554762840271, "epoch": 1.2554369315935152, "grad_norm": 0.9453125, "learning_rate": 0.0004850180543878726, "loss": 5.0584, "mean_token_accuracy": 0.21035029143095016, "num_tokens": 29077265.0, "step": 12700 }, { "entropy": 5.558976650238037, "epoch": 1.2559311981020165, "grad_norm": 0.87890625, "learning_rate": 0.0004850053896774769, "loss": 5.0756, "mean_token_accuracy": 0.20635127574205397, "num_tokens": 29088022.0, "step": 12705 }, { "entropy": 5.582965087890625, "epoch": 1.256425464610518, "grad_norm": 1.0390625, "learning_rate": 0.0004849927198009161, "loss": 5.1316, "mean_token_accuracy": 0.20435890108346938, "num_tokens": 29099901.0, "step": 12710 }, { "entropy": 5.592415285110474, "epoch": 1.2569197311190194, "grad_norm": 1.0546875, "learning_rate": 0.00048498004475850174, "loss": 5.1362, "mean_token_accuracy": 0.20079194903373718, "num_tokens": 29111249.0, "step": 12715 }, { "entropy": 5.526170969009399, "epoch": 1.2574139976275207, "grad_norm": 1.0390625, "learning_rate": 0.00048496736455054567, "loss": 5.1079, "mean_token_accuracy": 0.20681073218584062, "num_tokens": 29121261.0, "step": 12720 }, { "entropy": 5.607979393005371, "epoch": 1.2579082641360222, "grad_norm": 1.0234375, "learning_rate": 0.00048495467917736003, "loss": 5.2919, "mean_token_accuracy": 0.2000132367014885, "num_tokens": 29133987.0, "step": 12725 }, { "entropy": 5.642128801345825, "epoch": 1.2584025306445235, "grad_norm": 1.0859375, "learning_rate": 0.0004849419886392565, "loss": 5.1718, "mean_token_accuracy": 0.2033873528242111, "num_tokens": 29146499.0, "step": 12730 }, { "entropy": 5.577242755889893, "epoch": 1.258896797153025, "grad_norm": 0.94140625, "learning_rate": 0.0004849292929365476, "loss": 5.0431, "mean_token_accuracy": 0.2113046556711197, "num_tokens": 29157892.0, "step": 12735 }, { "entropy": 5.551754140853882, "epoch": 1.2593910636615262, "grad_norm": 0.95703125, "learning_rate": 0.0004849165920695455, "loss": 5.1804, "mean_token_accuracy": 0.19710207283496856, "num_tokens": 29169823.0, "step": 12740 }, { "entropy": 5.671357488632202, "epoch": 1.2598853301700277, "grad_norm": 0.99609375, "learning_rate": 0.0004849038860385627, "loss": 5.2287, "mean_token_accuracy": 0.19629838019609452, "num_tokens": 29181065.0, "step": 12745 }, { "entropy": 5.575687456130981, "epoch": 1.2603795966785292, "grad_norm": 0.9921875, "learning_rate": 0.0004848911748439117, "loss": 5.1232, "mean_token_accuracy": 0.20171080231666566, "num_tokens": 29192711.0, "step": 12750 }, { "entropy": 5.4919274806976315, "epoch": 1.2608738631870304, "grad_norm": 1.0078125, "learning_rate": 0.0004848784584859052, "loss": 5.0731, "mean_token_accuracy": 0.2061803862452507, "num_tokens": 29204688.0, "step": 12755 }, { "entropy": 5.507326126098633, "epoch": 1.2613681296955317, "grad_norm": 0.96484375, "learning_rate": 0.0004848657369648561, "loss": 5.0748, "mean_token_accuracy": 0.20837381035089492, "num_tokens": 29216326.0, "step": 12760 }, { "entropy": 5.531968498229981, "epoch": 1.2618623962040332, "grad_norm": 0.90234375, "learning_rate": 0.00048485301028107736, "loss": 5.1277, "mean_token_accuracy": 0.21219139248132707, "num_tokens": 29226805.0, "step": 12765 }, { "entropy": 5.4802696228027346, "epoch": 1.2623566627125347, "grad_norm": 0.87890625, "learning_rate": 0.000484840278434882, "loss": 5.1011, "mean_token_accuracy": 0.20450251549482346, "num_tokens": 29239334.0, "step": 12770 }, { "entropy": 5.633318090438843, "epoch": 1.262850929221036, "grad_norm": 1.0859375, "learning_rate": 0.0004848275414265832, "loss": 5.1224, "mean_token_accuracy": 0.20065472573041915, "num_tokens": 29250443.0, "step": 12775 }, { "entropy": 5.54659595489502, "epoch": 1.2633451957295374, "grad_norm": 1.0703125, "learning_rate": 0.00048481479925649435, "loss": 5.0857, "mean_token_accuracy": 0.2035423830151558, "num_tokens": 29261209.0, "step": 12780 }, { "entropy": 5.539792013168335, "epoch": 1.2638394622380387, "grad_norm": 1.0703125, "learning_rate": 0.00048480205192492887, "loss": 5.1996, "mean_token_accuracy": 0.19493308961391448, "num_tokens": 29273761.0, "step": 12785 }, { "entropy": 5.625712585449219, "epoch": 1.2643337287465402, "grad_norm": 0.984375, "learning_rate": 0.0004847892994322004, "loss": 5.1642, "mean_token_accuracy": 0.19911424517631532, "num_tokens": 29285157.0, "step": 12790 }, { "entropy": 5.60231237411499, "epoch": 1.2648279952550414, "grad_norm": 0.953125, "learning_rate": 0.0004847765417786226, "loss": 5.1517, "mean_token_accuracy": 0.19973706901073457, "num_tokens": 29295903.0, "step": 12795 }, { "entropy": 5.613919830322265, "epoch": 1.265322261763543, "grad_norm": 0.9609375, "learning_rate": 0.0004847637789645093, "loss": 5.1869, "mean_token_accuracy": 0.19678208827972413, "num_tokens": 29307865.0, "step": 12800 }, { "entropy": 5.690697956085205, "epoch": 1.2658165282720444, "grad_norm": 0.96484375, "learning_rate": 0.0004847510109901745, "loss": 5.2693, "mean_token_accuracy": 0.190783853828907, "num_tokens": 29319614.0, "step": 12805 }, { "entropy": 5.586088991165161, "epoch": 1.2663107947805456, "grad_norm": 1.125, "learning_rate": 0.0004847382378559323, "loss": 5.1531, "mean_token_accuracy": 0.20116908997297286, "num_tokens": 29330306.0, "step": 12810 }, { "entropy": 5.534205293655395, "epoch": 1.2668050612890471, "grad_norm": 1.015625, "learning_rate": 0.00048472545956209696, "loss": 5.1158, "mean_token_accuracy": 0.20247298181056977, "num_tokens": 29341611.0, "step": 12815 }, { "entropy": 5.506812906265258, "epoch": 1.2672993277975484, "grad_norm": 0.984375, "learning_rate": 0.0004847126761089827, "loss": 5.0541, "mean_token_accuracy": 0.21581392735242844, "num_tokens": 29353481.0, "step": 12820 }, { "entropy": 5.517165231704712, "epoch": 1.2677935943060499, "grad_norm": 0.98828125, "learning_rate": 0.0004846998874969041, "loss": 5.0315, "mean_token_accuracy": 0.2121157392859459, "num_tokens": 29365388.0, "step": 12825 }, { "entropy": 5.593751001358032, "epoch": 1.2682878608145511, "grad_norm": 1.0546875, "learning_rate": 0.0004846870937261758, "loss": 5.1994, "mean_token_accuracy": 0.1928087517619133, "num_tokens": 29377805.0, "step": 12830 }, { "entropy": 5.537947750091552, "epoch": 1.2687821273230526, "grad_norm": 0.91796875, "learning_rate": 0.00048467429479711233, "loss": 5.0701, "mean_token_accuracy": 0.2072820022702217, "num_tokens": 29389736.0, "step": 12835 }, { "entropy": 5.525837135314942, "epoch": 1.269276393831554, "grad_norm": 1.0390625, "learning_rate": 0.00048466149071002876, "loss": 5.0985, "mean_token_accuracy": 0.2104696214199066, "num_tokens": 29401256.0, "step": 12840 }, { "entropy": 5.581268787384033, "epoch": 1.2697706603400554, "grad_norm": 0.9453125, "learning_rate": 0.00048464868146524, "loss": 5.1101, "mean_token_accuracy": 0.2062648355960846, "num_tokens": 29413287.0, "step": 12845 }, { "entropy": 5.593953323364258, "epoch": 1.2702649268485566, "grad_norm": 1.125, "learning_rate": 0.00048463586706306113, "loss": 5.1552, "mean_token_accuracy": 0.20538982897996902, "num_tokens": 29424151.0, "step": 12850 }, { "entropy": 5.578843355178833, "epoch": 1.2707591933570581, "grad_norm": 1.0, "learning_rate": 0.0004846230475038074, "loss": 5.1373, "mean_token_accuracy": 0.19965371042490004, "num_tokens": 29435006.0, "step": 12855 }, { "entropy": 5.528163957595825, "epoch": 1.2712534598655596, "grad_norm": 0.9140625, "learning_rate": 0.0004846102227877942, "loss": 5.1249, "mean_token_accuracy": 0.2099713370203972, "num_tokens": 29446453.0, "step": 12860 }, { "entropy": 5.645973348617554, "epoch": 1.2717477263740609, "grad_norm": 1.0625, "learning_rate": 0.00048459739291533706, "loss": 5.193, "mean_token_accuracy": 0.195033960044384, "num_tokens": 29458468.0, "step": 12865 }, { "entropy": 5.651019620895386, "epoch": 1.2722419928825623, "grad_norm": 0.8671875, "learning_rate": 0.0004845845578867514, "loss": 5.2389, "mean_token_accuracy": 0.19410280734300614, "num_tokens": 29471167.0, "step": 12870 }, { "entropy": 5.609836912155151, "epoch": 1.2727362593910636, "grad_norm": 0.97265625, "learning_rate": 0.00048457171770235327, "loss": 5.1616, "mean_token_accuracy": 0.20380717366933823, "num_tokens": 29482668.0, "step": 12875 }, { "entropy": 5.617282390594482, "epoch": 1.273230525899565, "grad_norm": 1.0, "learning_rate": 0.0004845588723624582, "loss": 5.1838, "mean_token_accuracy": 0.20004723519086837, "num_tokens": 29495424.0, "step": 12880 }, { "entropy": 5.533297443389893, "epoch": 1.2737247924080664, "grad_norm": 0.90234375, "learning_rate": 0.0004845460218673825, "loss": 5.1869, "mean_token_accuracy": 0.20335550606250763, "num_tokens": 29508388.0, "step": 12885 }, { "entropy": 5.56331729888916, "epoch": 1.2742190589165678, "grad_norm": 1.03125, "learning_rate": 0.0004845331662174421, "loss": 5.0863, "mean_token_accuracy": 0.20890957564115525, "num_tokens": 29519884.0, "step": 12890 }, { "entropy": 5.6703962802886965, "epoch": 1.2747133254250693, "grad_norm": 1.0703125, "learning_rate": 0.0004845203054129533, "loss": 5.2906, "mean_token_accuracy": 0.19275391101837158, "num_tokens": 29532398.0, "step": 12895 }, { "entropy": 5.582969331741333, "epoch": 1.2752075919335706, "grad_norm": 1.0, "learning_rate": 0.00048450743945423246, "loss": 5.1578, "mean_token_accuracy": 0.21084296703338623, "num_tokens": 29544394.0, "step": 12900 }, { "entropy": 5.620017194747925, "epoch": 1.2757018584420718, "grad_norm": 1.0390625, "learning_rate": 0.0004844945683415961, "loss": 5.2083, "mean_token_accuracy": 0.1997788965702057, "num_tokens": 29555027.0, "step": 12905 }, { "entropy": 5.538217067718506, "epoch": 1.2761961249505733, "grad_norm": 0.9453125, "learning_rate": 0.000484481692075361, "loss": 5.1513, "mean_token_accuracy": 0.1997531533241272, "num_tokens": 29567386.0, "step": 12910 }, { "entropy": 5.6999180793762205, "epoch": 1.2766903914590748, "grad_norm": 0.94921875, "learning_rate": 0.00048446881065584367, "loss": 5.273, "mean_token_accuracy": 0.1919737622141838, "num_tokens": 29577832.0, "step": 12915 }, { "entropy": 5.542815828323365, "epoch": 1.277184657967576, "grad_norm": 0.9296875, "learning_rate": 0.00048445592408336106, "loss": 5.0774, "mean_token_accuracy": 0.208111572265625, "num_tokens": 29590163.0, "step": 12920 }, { "entropy": 5.581329107284546, "epoch": 1.2776789244760776, "grad_norm": 0.953125, "learning_rate": 0.00048444303235823023, "loss": 5.1044, "mean_token_accuracy": 0.20593189001083373, "num_tokens": 29601531.0, "step": 12925 }, { "entropy": 5.599567842483521, "epoch": 1.2781731909845788, "grad_norm": 1.078125, "learning_rate": 0.0004844301354807683, "loss": 5.1907, "mean_token_accuracy": 0.20404563397169112, "num_tokens": 29612417.0, "step": 12930 }, { "entropy": 5.578514528274536, "epoch": 1.2786674574930803, "grad_norm": 1.0078125, "learning_rate": 0.00048441723345129265, "loss": 5.1973, "mean_token_accuracy": 0.19703702628612518, "num_tokens": 29622087.0, "step": 12935 }, { "entropy": 5.700575494766236, "epoch": 1.2791617240015816, "grad_norm": 1.0703125, "learning_rate": 0.0004844043262701205, "loss": 5.2489, "mean_token_accuracy": 0.19511338621377944, "num_tokens": 29633564.0, "step": 12940 }, { "entropy": 5.5352160930633545, "epoch": 1.279655990510083, "grad_norm": 0.890625, "learning_rate": 0.0004843914139375695, "loss": 5.1024, "mean_token_accuracy": 0.2074584424495697, "num_tokens": 29644626.0, "step": 12945 }, { "entropy": 5.506257486343384, "epoch": 1.2801502570185845, "grad_norm": 1.0625, "learning_rate": 0.00048437849645395714, "loss": 5.0852, "mean_token_accuracy": 0.20964082479476928, "num_tokens": 29655587.0, "step": 12950 }, { "entropy": 5.584140300750732, "epoch": 1.2806445235270858, "grad_norm": 1.046875, "learning_rate": 0.0004843655738196013, "loss": 5.1528, "mean_token_accuracy": 0.20367241948843, "num_tokens": 29665067.0, "step": 12955 }, { "entropy": 5.613408041000366, "epoch": 1.281138790035587, "grad_norm": 1.125, "learning_rate": 0.0004843526460348199, "loss": 5.1189, "mean_token_accuracy": 0.2092861846089363, "num_tokens": 29676663.0, "step": 12960 }, { "entropy": 5.446095561981201, "epoch": 1.2816330565440885, "grad_norm": 0.93359375, "learning_rate": 0.0004843397130999309, "loss": 5.0699, "mean_token_accuracy": 0.20455270260572433, "num_tokens": 29688242.0, "step": 12965 }, { "entropy": 5.593413400650024, "epoch": 1.28212732305259, "grad_norm": 0.97265625, "learning_rate": 0.00048432677501525253, "loss": 5.1966, "mean_token_accuracy": 0.19344640225172044, "num_tokens": 29699184.0, "step": 12970 }, { "entropy": 5.567355394363403, "epoch": 1.2826215895610913, "grad_norm": 1.03125, "learning_rate": 0.000484313831781103, "loss": 5.1009, "mean_token_accuracy": 0.20269492715597154, "num_tokens": 29709610.0, "step": 12975 }, { "entropy": 5.553442525863647, "epoch": 1.2831158560695928, "grad_norm": 0.9453125, "learning_rate": 0.0004843008833978007, "loss": 5.0545, "mean_token_accuracy": 0.21513191014528274, "num_tokens": 29720359.0, "step": 12980 }, { "entropy": 5.611999750137329, "epoch": 1.283610122578094, "grad_norm": 0.97265625, "learning_rate": 0.00048428792986566425, "loss": 5.2318, "mean_token_accuracy": 0.19957399368286133, "num_tokens": 29732411.0, "step": 12985 }, { "entropy": 5.546327447891235, "epoch": 1.2841043890865955, "grad_norm": 0.96484375, "learning_rate": 0.0004842749711850122, "loss": 4.998, "mean_token_accuracy": 0.21754393726587296, "num_tokens": 29743394.0, "step": 12990 }, { "entropy": 5.601195049285889, "epoch": 1.2845986555950968, "grad_norm": 1.046875, "learning_rate": 0.00048426200735616343, "loss": 5.1637, "mean_token_accuracy": 0.2030368134379387, "num_tokens": 29754798.0, "step": 12995 }, { "entropy": 5.565696907043457, "epoch": 1.2850929221035983, "grad_norm": 0.91796875, "learning_rate": 0.0004842490383794368, "loss": 5.1329, "mean_token_accuracy": 0.20497622936964036, "num_tokens": 29767891.0, "step": 13000 }, { "entropy": 5.553113222122192, "epoch": 1.2855871886120998, "grad_norm": 1.0234375, "learning_rate": 0.00048423606425515136, "loss": 5.0198, "mean_token_accuracy": 0.21336970925331117, "num_tokens": 29780264.0, "step": 13005 }, { "entropy": 5.576889562606811, "epoch": 1.286081455120601, "grad_norm": 0.9765625, "learning_rate": 0.00048422308498362635, "loss": 5.1864, "mean_token_accuracy": 0.20178526639938354, "num_tokens": 29792184.0, "step": 13010 }, { "entropy": 5.563109922409057, "epoch": 1.2865757216291023, "grad_norm": 0.95703125, "learning_rate": 0.0004842101005651809, "loss": 5.1035, "mean_token_accuracy": 0.2044524759054184, "num_tokens": 29802651.0, "step": 13015 }, { "entropy": 5.587775135040284, "epoch": 1.2870699881376038, "grad_norm": 1.0625, "learning_rate": 0.0004841971110001346, "loss": 5.1257, "mean_token_accuracy": 0.2107615202665329, "num_tokens": 29814172.0, "step": 13020 }, { "entropy": 5.574641609191895, "epoch": 1.2875642546461052, "grad_norm": 0.859375, "learning_rate": 0.00048418411628880684, "loss": 5.2177, "mean_token_accuracy": 0.19662704467773437, "num_tokens": 29826636.0, "step": 13025 }, { "entropy": 5.522394371032715, "epoch": 1.2880585211546065, "grad_norm": 0.97265625, "learning_rate": 0.0004841711164315174, "loss": 5.1105, "mean_token_accuracy": 0.2005063995718956, "num_tokens": 29838532.0, "step": 13030 }, { "entropy": 5.584056234359741, "epoch": 1.288552787663108, "grad_norm": 0.90625, "learning_rate": 0.000484158111428586, "loss": 5.1085, "mean_token_accuracy": 0.20614879429340363, "num_tokens": 29849889.0, "step": 13035 }, { "entropy": 5.614079761505127, "epoch": 1.2890470541716093, "grad_norm": 0.90234375, "learning_rate": 0.00048414510128033265, "loss": 5.2191, "mean_token_accuracy": 0.19363229721784592, "num_tokens": 29860856.0, "step": 13040 }, { "entropy": 5.556839847564698, "epoch": 1.2895413206801107, "grad_norm": 0.9765625, "learning_rate": 0.0004841320859870774, "loss": 5.0757, "mean_token_accuracy": 0.21010504961013793, "num_tokens": 29871921.0, "step": 13045 }, { "entropy": 5.57680082321167, "epoch": 1.290035587188612, "grad_norm": 0.9140625, "learning_rate": 0.00048411906554914037, "loss": 5.1472, "mean_token_accuracy": 0.2015039727091789, "num_tokens": 29883410.0, "step": 13050 }, { "entropy": 5.669015789031983, "epoch": 1.2905298536971135, "grad_norm": 0.87109375, "learning_rate": 0.00048410603996684184, "loss": 5.2128, "mean_token_accuracy": 0.19672741442918779, "num_tokens": 29895640.0, "step": 13055 }, { "entropy": 5.565765142440796, "epoch": 1.291024120205615, "grad_norm": 1.0625, "learning_rate": 0.0004840930092405023, "loss": 5.0355, "mean_token_accuracy": 0.21407856196165084, "num_tokens": 29907797.0, "step": 13060 }, { "entropy": 5.490388536453247, "epoch": 1.2915183867141162, "grad_norm": 0.93359375, "learning_rate": 0.00048407997337044235, "loss": 5.1401, "mean_token_accuracy": 0.20244240313768386, "num_tokens": 29919085.0, "step": 13065 }, { "entropy": 5.548913049697876, "epoch": 1.2920126532226177, "grad_norm": 1.0859375, "learning_rate": 0.0004840669323569826, "loss": 5.178, "mean_token_accuracy": 0.19499380886554718, "num_tokens": 29930658.0, "step": 13070 }, { "entropy": 5.623510265350342, "epoch": 1.292506919731119, "grad_norm": 1.0, "learning_rate": 0.00048405388620044383, "loss": 5.1093, "mean_token_accuracy": 0.21030616909265518, "num_tokens": 29942550.0, "step": 13075 }, { "entropy": 5.563480234146118, "epoch": 1.2930011862396205, "grad_norm": 1.0078125, "learning_rate": 0.0004840408349011471, "loss": 5.0923, "mean_token_accuracy": 0.2066365212202072, "num_tokens": 29953600.0, "step": 13080 }, { "entropy": 5.568202638626099, "epoch": 1.2934954527481217, "grad_norm": 0.91796875, "learning_rate": 0.0004840277784594133, "loss": 5.1028, "mean_token_accuracy": 0.20880455225706102, "num_tokens": 29965694.0, "step": 13085 }, { "entropy": 5.5692346572875975, "epoch": 1.2939897192566232, "grad_norm": 0.890625, "learning_rate": 0.0004840147168755638, "loss": 5.1365, "mean_token_accuracy": 0.2025999903678894, "num_tokens": 29977216.0, "step": 13090 }, { "entropy": 5.493949842453003, "epoch": 1.2944839857651247, "grad_norm": 1.078125, "learning_rate": 0.0004840016501499198, "loss": 4.9996, "mean_token_accuracy": 0.21578514724969863, "num_tokens": 29988036.0, "step": 13095 }, { "entropy": 5.619052982330322, "epoch": 1.294978252273626, "grad_norm": 0.98046875, "learning_rate": 0.00048398857828280286, "loss": 5.1918, "mean_token_accuracy": 0.20698267668485643, "num_tokens": 30000711.0, "step": 13100 }, { "entropy": 5.6336158275604244, "epoch": 1.2954725187821272, "grad_norm": 0.91015625, "learning_rate": 0.00048397550127453445, "loss": 5.1943, "mean_token_accuracy": 0.1982634633779526, "num_tokens": 30013607.0, "step": 13105 }, { "entropy": 5.571711874008178, "epoch": 1.2959667852906287, "grad_norm": 1.0078125, "learning_rate": 0.0004839624191254362, "loss": 5.1048, "mean_token_accuracy": 0.20674486309289933, "num_tokens": 30024375.0, "step": 13110 }, { "entropy": 5.596471357345581, "epoch": 1.2964610517991302, "grad_norm": 1.078125, "learning_rate": 0.00048394933183583004, "loss": 5.1591, "mean_token_accuracy": 0.20311493277549744, "num_tokens": 30035476.0, "step": 13115 }, { "entropy": 5.610611629486084, "epoch": 1.2969553183076314, "grad_norm": 0.99609375, "learning_rate": 0.000483936239406038, "loss": 5.1668, "mean_token_accuracy": 0.19955393075942993, "num_tokens": 30047193.0, "step": 13120 }, { "entropy": 5.621019554138184, "epoch": 1.297449584816133, "grad_norm": 0.92578125, "learning_rate": 0.000483923141836382, "loss": 5.1675, "mean_token_accuracy": 0.200534850358963, "num_tokens": 30059873.0, "step": 13125 }, { "entropy": 5.545091581344605, "epoch": 1.2979438513246342, "grad_norm": 0.984375, "learning_rate": 0.0004839100391271843, "loss": 5.1563, "mean_token_accuracy": 0.2063492104411125, "num_tokens": 30071318.0, "step": 13130 }, { "entropy": 5.528760480880737, "epoch": 1.2984381178331357, "grad_norm": 1.1171875, "learning_rate": 0.0004838969312787672, "loss": 5.1388, "mean_token_accuracy": 0.20169186890125274, "num_tokens": 30082750.0, "step": 13135 }, { "entropy": 5.609570789337158, "epoch": 1.298932384341637, "grad_norm": 1.0234375, "learning_rate": 0.0004838838182914532, "loss": 5.1405, "mean_token_accuracy": 0.19932505637407302, "num_tokens": 30093730.0, "step": 13140 }, { "entropy": 5.6558918952941895, "epoch": 1.2994266508501384, "grad_norm": 1.03125, "learning_rate": 0.0004838707001655649, "loss": 5.1613, "mean_token_accuracy": 0.20620552748441695, "num_tokens": 30104776.0, "step": 13145 }, { "entropy": 5.510679244995117, "epoch": 1.29992091735864, "grad_norm": 1.015625, "learning_rate": 0.0004838575769014249, "loss": 5.0389, "mean_token_accuracy": 0.20765637308359147, "num_tokens": 30115110.0, "step": 13150 }, { "entropy": 5.514682817459106, "epoch": 1.3004151838671412, "grad_norm": 0.92578125, "learning_rate": 0.0004838444484993562, "loss": 5.104, "mean_token_accuracy": 0.20520822405815126, "num_tokens": 30126678.0, "step": 13155 }, { "entropy": 5.550967884063721, "epoch": 1.3009094503756424, "grad_norm": 1.015625, "learning_rate": 0.00048383131495968165, "loss": 5.0876, "mean_token_accuracy": 0.20401867479085922, "num_tokens": 30137703.0, "step": 13160 }, { "entropy": 5.567709970474243, "epoch": 1.301403716884144, "grad_norm": 1.0234375, "learning_rate": 0.00048381817628272427, "loss": 5.1691, "mean_token_accuracy": 0.20322782546281815, "num_tokens": 30147624.0, "step": 13165 }, { "entropy": 5.562980985641479, "epoch": 1.3018979833926454, "grad_norm": 1.0546875, "learning_rate": 0.0004838050324688074, "loss": 5.0886, "mean_token_accuracy": 0.20610730350017548, "num_tokens": 30158863.0, "step": 13170 }, { "entropy": 5.506331443786621, "epoch": 1.3023922499011467, "grad_norm": 1.0078125, "learning_rate": 0.0004837918835182544, "loss": 5.1411, "mean_token_accuracy": 0.19957690685987473, "num_tokens": 30170876.0, "step": 13175 }, { "entropy": 5.548203182220459, "epoch": 1.3028865164096481, "grad_norm": 0.96875, "learning_rate": 0.0004837787294313886, "loss": 5.0882, "mean_token_accuracy": 0.2097819298505783, "num_tokens": 30182267.0, "step": 13180 }, { "entropy": 5.589533424377441, "epoch": 1.3033807829181494, "grad_norm": 1.0234375, "learning_rate": 0.0004837655702085337, "loss": 5.1211, "mean_token_accuracy": 0.20648267567157746, "num_tokens": 30193572.0, "step": 13185 }, { "entropy": 5.491463947296142, "epoch": 1.303875049426651, "grad_norm": 0.89453125, "learning_rate": 0.0004837524058500134, "loss": 5.0449, "mean_token_accuracy": 0.21660517603158952, "num_tokens": 30206341.0, "step": 13190 }, { "entropy": 5.615534687042237, "epoch": 1.3043693159351522, "grad_norm": 1.1171875, "learning_rate": 0.00048373923635615146, "loss": 5.1428, "mean_token_accuracy": 0.20463847517967224, "num_tokens": 30216067.0, "step": 13195 }, { "entropy": 5.532439231872559, "epoch": 1.3048635824436536, "grad_norm": 1.0, "learning_rate": 0.00048372606172727197, "loss": 5.2046, "mean_token_accuracy": 0.20163963437080384, "num_tokens": 30227033.0, "step": 13200 }, { "entropy": 5.58521089553833, "epoch": 1.3053578489521551, "grad_norm": 1.0390625, "learning_rate": 0.000483712881963699, "loss": 5.1504, "mean_token_accuracy": 0.20623055398464202, "num_tokens": 30238766.0, "step": 13205 }, { "entropy": 5.6302533626556395, "epoch": 1.3058521154606564, "grad_norm": 1.0, "learning_rate": 0.00048369969706575666, "loss": 5.2151, "mean_token_accuracy": 0.19916196912527084, "num_tokens": 30250180.0, "step": 13210 }, { "entropy": 5.549505662918091, "epoch": 1.3063463819691576, "grad_norm": 0.94921875, "learning_rate": 0.00048368650703376956, "loss": 5.0123, "mean_token_accuracy": 0.21834553629159928, "num_tokens": 30260704.0, "step": 13215 }, { "entropy": 5.49736795425415, "epoch": 1.3068406484776591, "grad_norm": 0.9453125, "learning_rate": 0.0004836733118680619, "loss": 5.1025, "mean_token_accuracy": 0.21263509690761567, "num_tokens": 30273547.0, "step": 13220 }, { "entropy": 5.532813262939453, "epoch": 1.3073349149861606, "grad_norm": 0.97265625, "learning_rate": 0.0004836601115689584, "loss": 5.1114, "mean_token_accuracy": 0.1999944880604744, "num_tokens": 30284872.0, "step": 13225 }, { "entropy": 5.537988615036011, "epoch": 1.3078291814946619, "grad_norm": 0.9609375, "learning_rate": 0.0004836469061367838, "loss": 5.1542, "mean_token_accuracy": 0.2017763987183571, "num_tokens": 30296768.0, "step": 13230 }, { "entropy": 5.497501945495605, "epoch": 1.3083234480031634, "grad_norm": 0.97265625, "learning_rate": 0.00048363369557186293, "loss": 5.0283, "mean_token_accuracy": 0.2164567306637764, "num_tokens": 30308307.0, "step": 13235 }, { "entropy": 5.637799167633057, "epoch": 1.3088177145116646, "grad_norm": 0.98046875, "learning_rate": 0.00048362047987452085, "loss": 5.1318, "mean_token_accuracy": 0.20167392790317534, "num_tokens": 30318987.0, "step": 13240 }, { "entropy": 5.630300760269165, "epoch": 1.309311981020166, "grad_norm": 1.0078125, "learning_rate": 0.0004836072590450825, "loss": 5.1502, "mean_token_accuracy": 0.20470413863658904, "num_tokens": 30330401.0, "step": 13245 }, { "entropy": 5.576997470855713, "epoch": 1.3098062475286674, "grad_norm": 0.9765625, "learning_rate": 0.00048359403308387327, "loss": 5.1116, "mean_token_accuracy": 0.20236227214336394, "num_tokens": 30341485.0, "step": 13250 }, { "entropy": 5.6098753929138185, "epoch": 1.3103005140371689, "grad_norm": 1.0234375, "learning_rate": 0.00048358080199121845, "loss": 5.1732, "mean_token_accuracy": 0.19128949344158172, "num_tokens": 30352854.0, "step": 13255 }, { "entropy": 5.575608730316162, "epoch": 1.3107947805456703, "grad_norm": 1.0078125, "learning_rate": 0.00048356756576744354, "loss": 5.1623, "mean_token_accuracy": 0.20512322932481766, "num_tokens": 30363944.0, "step": 13260 }, { "entropy": 5.592336130142212, "epoch": 1.3112890470541716, "grad_norm": 0.97265625, "learning_rate": 0.0004835543244128742, "loss": 5.1777, "mean_token_accuracy": 0.19670488685369492, "num_tokens": 30375678.0, "step": 13265 }, { "entropy": 5.632266712188721, "epoch": 1.3117833135626729, "grad_norm": 0.984375, "learning_rate": 0.0004835410779278361, "loss": 5.1433, "mean_token_accuracy": 0.206669357419014, "num_tokens": 30387206.0, "step": 13270 }, { "entropy": 5.595316362380982, "epoch": 1.3122775800711743, "grad_norm": 0.98046875, "learning_rate": 0.0004835278263126551, "loss": 5.1626, "mean_token_accuracy": 0.20167567133903502, "num_tokens": 30398769.0, "step": 13275 }, { "entropy": 5.538611221313476, "epoch": 1.3127718465796758, "grad_norm": 1.1328125, "learning_rate": 0.0004835145695676572, "loss": 5.1041, "mean_token_accuracy": 0.21220427751541138, "num_tokens": 30409626.0, "step": 13280 }, { "entropy": 5.566901206970215, "epoch": 1.313266113088177, "grad_norm": 1.015625, "learning_rate": 0.0004835013076931686, "loss": 5.1339, "mean_token_accuracy": 0.20217393785715104, "num_tokens": 30421142.0, "step": 13285 }, { "entropy": 5.534543037414551, "epoch": 1.3137603795966786, "grad_norm": 1.1328125, "learning_rate": 0.00048348804068951547, "loss": 5.0051, "mean_token_accuracy": 0.22267270237207412, "num_tokens": 30430438.0, "step": 13290 }, { "entropy": 5.61610894203186, "epoch": 1.3142546461051798, "grad_norm": 0.86328125, "learning_rate": 0.00048347476855702413, "loss": 5.1706, "mean_token_accuracy": 0.1981277883052826, "num_tokens": 30442351.0, "step": 13295 }, { "entropy": 5.587489891052246, "epoch": 1.3147489126136813, "grad_norm": 0.92578125, "learning_rate": 0.00048346149129602125, "loss": 5.1815, "mean_token_accuracy": 0.19534419625997543, "num_tokens": 30454987.0, "step": 13300 }, { "entropy": 5.4983861446380615, "epoch": 1.3152431791221826, "grad_norm": 1.0078125, "learning_rate": 0.00048344820890683333, "loss": 5.0619, "mean_token_accuracy": 0.21126483231782914, "num_tokens": 30466186.0, "step": 13305 }, { "entropy": 5.593648290634155, "epoch": 1.315737445630684, "grad_norm": 1.03125, "learning_rate": 0.00048343492138978704, "loss": 5.187, "mean_token_accuracy": 0.20297560095787048, "num_tokens": 30477944.0, "step": 13310 }, { "entropy": 5.615107440948487, "epoch": 1.3162317121391856, "grad_norm": 0.953125, "learning_rate": 0.0004834216287452094, "loss": 5.1234, "mean_token_accuracy": 0.20509843081235885, "num_tokens": 30489922.0, "step": 13315 }, { "entropy": 5.5705774307250975, "epoch": 1.3167259786476868, "grad_norm": 0.9375, "learning_rate": 0.0004834083309734274, "loss": 5.1209, "mean_token_accuracy": 0.211226449906826, "num_tokens": 30501739.0, "step": 13320 }, { "entropy": 5.561836194992066, "epoch": 1.3172202451561883, "grad_norm": 0.96875, "learning_rate": 0.0004833950280747681, "loss": 5.2074, "mean_token_accuracy": 0.19602738618850707, "num_tokens": 30512213.0, "step": 13325 }, { "entropy": 5.596275997161865, "epoch": 1.3177145116646896, "grad_norm": 0.98046875, "learning_rate": 0.0004833817200495588, "loss": 5.1287, "mean_token_accuracy": 0.1995839774608612, "num_tokens": 30524300.0, "step": 13330 }, { "entropy": 5.590348815917968, "epoch": 1.318208778173191, "grad_norm": 0.9375, "learning_rate": 0.00048336840689812676, "loss": 5.1716, "mean_token_accuracy": 0.20043307691812515, "num_tokens": 30536137.0, "step": 13335 }, { "entropy": 5.537119436264038, "epoch": 1.3187030446816923, "grad_norm": 1.0390625, "learning_rate": 0.00048335508862079975, "loss": 5.1251, "mean_token_accuracy": 0.19965567886829377, "num_tokens": 30548657.0, "step": 13340 }, { "entropy": 5.625750732421875, "epoch": 1.3191973111901938, "grad_norm": 0.9609375, "learning_rate": 0.00048334176521790513, "loss": 5.1657, "mean_token_accuracy": 0.197721491754055, "num_tokens": 30560274.0, "step": 13345 }, { "entropy": 5.545386171340942, "epoch": 1.3196915776986953, "grad_norm": 0.9375, "learning_rate": 0.0004833284366897707, "loss": 5.0319, "mean_token_accuracy": 0.2136387497186661, "num_tokens": 30571026.0, "step": 13350 }, { "entropy": 5.497046327590942, "epoch": 1.3201858442071965, "grad_norm": 0.96875, "learning_rate": 0.00048331510303672456, "loss": 5.0402, "mean_token_accuracy": 0.2152375176548958, "num_tokens": 30582210.0, "step": 13355 }, { "entropy": 5.575345516204834, "epoch": 1.3206801107156978, "grad_norm": 1.015625, "learning_rate": 0.0004833017642590945, "loss": 5.1765, "mean_token_accuracy": 0.19622584581375122, "num_tokens": 30594049.0, "step": 13360 }, { "entropy": 5.584075164794922, "epoch": 1.3211743772241993, "grad_norm": 0.96875, "learning_rate": 0.00048328842035720863, "loss": 5.1459, "mean_token_accuracy": 0.1974661260843277, "num_tokens": 30604713.0, "step": 13365 }, { "entropy": 5.587335205078125, "epoch": 1.3216686437327008, "grad_norm": 1.0390625, "learning_rate": 0.0004832750713313954, "loss": 5.0703, "mean_token_accuracy": 0.20546313673257827, "num_tokens": 30615906.0, "step": 13370 }, { "entropy": 5.581573343276977, "epoch": 1.322162910241202, "grad_norm": 1.0234375, "learning_rate": 0.00048326171718198315, "loss": 5.1916, "mean_token_accuracy": 0.2005360260605812, "num_tokens": 30628191.0, "step": 13375 }, { "entropy": 5.641654825210571, "epoch": 1.3226571767497035, "grad_norm": 0.91796875, "learning_rate": 0.00048324835790930027, "loss": 5.2084, "mean_token_accuracy": 0.2009003594517708, "num_tokens": 30640667.0, "step": 13380 }, { "entropy": 5.596581220626831, "epoch": 1.3231514432582048, "grad_norm": 0.98046875, "learning_rate": 0.0004832349935136755, "loss": 5.165, "mean_token_accuracy": 0.19874256402254104, "num_tokens": 30651779.0, "step": 13385 }, { "entropy": 5.4966514110565186, "epoch": 1.3236457097667063, "grad_norm": 0.97265625, "learning_rate": 0.0004832216239954376, "loss": 5.007, "mean_token_accuracy": 0.2135276436805725, "num_tokens": 30662396.0, "step": 13390 }, { "entropy": 5.5749537467956545, "epoch": 1.3241399762752075, "grad_norm": 1.03125, "learning_rate": 0.0004832082493549154, "loss": 5.1527, "mean_token_accuracy": 0.20379097163677215, "num_tokens": 30674476.0, "step": 13395 }, { "entropy": 5.529784679412842, "epoch": 1.324634242783709, "grad_norm": 0.9140625, "learning_rate": 0.0004831948695924381, "loss": 5.1218, "mean_token_accuracy": 0.20832922160625458, "num_tokens": 30687417.0, "step": 13400 }, { "entropy": 5.574518728256225, "epoch": 1.3251285092922105, "grad_norm": 1.0625, "learning_rate": 0.0004831814847083346, "loss": 5.1754, "mean_token_accuracy": 0.2037739336490631, "num_tokens": 30698925.0, "step": 13405 }, { "entropy": 5.617417669296264, "epoch": 1.3256227758007118, "grad_norm": 0.91015625, "learning_rate": 0.00048316809470293426, "loss": 5.1605, "mean_token_accuracy": 0.20822017788887023, "num_tokens": 30711237.0, "step": 13410 }, { "entropy": 5.653109407424926, "epoch": 1.326117042309213, "grad_norm": 1.078125, "learning_rate": 0.00048315469957656656, "loss": 5.2074, "mean_token_accuracy": 0.1985791653394699, "num_tokens": 30721900.0, "step": 13415 }, { "entropy": 5.572653150558471, "epoch": 1.3266113088177145, "grad_norm": 0.9765625, "learning_rate": 0.0004831412993295609, "loss": 5.1351, "mean_token_accuracy": 0.19998104572296144, "num_tokens": 30734738.0, "step": 13420 }, { "entropy": 5.6029839515686035, "epoch": 1.327105575326216, "grad_norm": 1.03125, "learning_rate": 0.00048312789396224697, "loss": 5.1858, "mean_token_accuracy": 0.2072035253047943, "num_tokens": 30745849.0, "step": 13425 }, { "entropy": 5.603570413589478, "epoch": 1.3275998418347172, "grad_norm": 0.9375, "learning_rate": 0.00048311448347495466, "loss": 5.1227, "mean_token_accuracy": 0.2069063201546669, "num_tokens": 30757118.0, "step": 13430 }, { "entropy": 5.623440933227539, "epoch": 1.3280941083432187, "grad_norm": 0.98828125, "learning_rate": 0.0004831010678680137, "loss": 5.2381, "mean_token_accuracy": 0.2006916344165802, "num_tokens": 30768692.0, "step": 13435 }, { "entropy": 5.633304786682129, "epoch": 1.32858837485172, "grad_norm": 0.94921875, "learning_rate": 0.0004830876471417542, "loss": 5.1905, "mean_token_accuracy": 0.2040211632847786, "num_tokens": 30780241.0, "step": 13440 }, { "entropy": 5.53968653678894, "epoch": 1.3290826413602215, "grad_norm": 1.0234375, "learning_rate": 0.0004830742212965063, "loss": 5.1703, "mean_token_accuracy": 0.20048892945051194, "num_tokens": 30792733.0, "step": 13445 }, { "entropy": 5.552266216278076, "epoch": 1.3295769078687227, "grad_norm": 0.97265625, "learning_rate": 0.0004830607903326003, "loss": 5.1166, "mean_token_accuracy": 0.20337332040071487, "num_tokens": 30803997.0, "step": 13450 }, { "entropy": 5.554250621795655, "epoch": 1.3300711743772242, "grad_norm": 1.03125, "learning_rate": 0.0004830473542503665, "loss": 5.0777, "mean_token_accuracy": 0.20851262360811235, "num_tokens": 30815322.0, "step": 13455 }, { "entropy": 5.551299524307251, "epoch": 1.3305654408857257, "grad_norm": 0.96484375, "learning_rate": 0.00048303391305013556, "loss": 5.0948, "mean_token_accuracy": 0.2029724195599556, "num_tokens": 30825572.0, "step": 13460 }, { "entropy": 5.487126636505127, "epoch": 1.331059707394227, "grad_norm": 0.890625, "learning_rate": 0.00048302046673223816, "loss": 5.0359, "mean_token_accuracy": 0.21165415048599243, "num_tokens": 30837451.0, "step": 13465 }, { "entropy": 5.5425333976745605, "epoch": 1.3315539739027282, "grad_norm": 0.9375, "learning_rate": 0.0004830070152970049, "loss": 5.1293, "mean_token_accuracy": 0.20861604809761047, "num_tokens": 30849418.0, "step": 13470 }, { "entropy": 5.6905505657196045, "epoch": 1.3320482404112297, "grad_norm": 1.0, "learning_rate": 0.00048299355874476685, "loss": 5.2238, "mean_token_accuracy": 0.19164274632930756, "num_tokens": 30860387.0, "step": 13475 }, { "entropy": 5.535911750793457, "epoch": 1.3325425069197312, "grad_norm": 0.95703125, "learning_rate": 0.000482980097075855, "loss": 5.0812, "mean_token_accuracy": 0.20939546078443527, "num_tokens": 30871599.0, "step": 13480 }, { "entropy": 5.514025449752808, "epoch": 1.3330367734282325, "grad_norm": 0.89453125, "learning_rate": 0.00048296663029060046, "loss": 5.0672, "mean_token_accuracy": 0.2111184924840927, "num_tokens": 30882298.0, "step": 13485 }, { "entropy": 5.535732412338257, "epoch": 1.333531039936734, "grad_norm": 1.0625, "learning_rate": 0.0004829531583893345, "loss": 5.1331, "mean_token_accuracy": 0.20906356871128082, "num_tokens": 30893589.0, "step": 13490 }, { "entropy": 5.577214860916138, "epoch": 1.3340253064452352, "grad_norm": 0.90625, "learning_rate": 0.0004829396813723886, "loss": 5.0871, "mean_token_accuracy": 0.20451615005731583, "num_tokens": 30905041.0, "step": 13495 }, { "entropy": 5.603981447219849, "epoch": 1.3345195729537367, "grad_norm": 1.0546875, "learning_rate": 0.0004829261992400944, "loss": 5.1769, "mean_token_accuracy": 0.2021555185317993, "num_tokens": 30916244.0, "step": 13500 }, { "entropy": 5.602961730957031, "epoch": 1.335013839462238, "grad_norm": 1.0546875, "learning_rate": 0.0004829127119927833, "loss": 5.103, "mean_token_accuracy": 0.20931194424629213, "num_tokens": 30927444.0, "step": 13505 }, { "entropy": 5.55492787361145, "epoch": 1.3355081059707394, "grad_norm": 0.96875, "learning_rate": 0.0004828992196307873, "loss": 5.1227, "mean_token_accuracy": 0.2102734461426735, "num_tokens": 30939402.0, "step": 13510 }, { "entropy": 5.590943193435669, "epoch": 1.336002372479241, "grad_norm": 1.0078125, "learning_rate": 0.00048288572215443825, "loss": 5.1786, "mean_token_accuracy": 0.19665589928627014, "num_tokens": 30951598.0, "step": 13515 }, { "entropy": 5.599949645996094, "epoch": 1.3364966389877422, "grad_norm": 0.95703125, "learning_rate": 0.0004828722195640681, "loss": 5.1466, "mean_token_accuracy": 0.202519491314888, "num_tokens": 30963897.0, "step": 13520 }, { "entropy": 5.550779008865357, "epoch": 1.3369909054962434, "grad_norm": 1.0703125, "learning_rate": 0.00048285871186000916, "loss": 5.0848, "mean_token_accuracy": 0.20299825370311736, "num_tokens": 30975143.0, "step": 13525 }, { "entropy": 5.585113859176635, "epoch": 1.337485172004745, "grad_norm": 0.94921875, "learning_rate": 0.00048284519904259374, "loss": 5.1344, "mean_token_accuracy": 0.19542926251888276, "num_tokens": 30986656.0, "step": 13530 }, { "entropy": 5.673772573471069, "epoch": 1.3379794385132464, "grad_norm": 1.0625, "learning_rate": 0.0004828316811121541, "loss": 5.2274, "mean_token_accuracy": 0.20095635950565338, "num_tokens": 30999904.0, "step": 13535 }, { "entropy": 5.533515882492066, "epoch": 1.3384737050217477, "grad_norm": 1.0078125, "learning_rate": 0.00048281815806902286, "loss": 5.0126, "mean_token_accuracy": 0.21331348717212678, "num_tokens": 31012287.0, "step": 13540 }, { "entropy": 5.548990154266358, "epoch": 1.3389679715302492, "grad_norm": 0.93359375, "learning_rate": 0.00048280462991353267, "loss": 5.1092, "mean_token_accuracy": 0.20468691736459732, "num_tokens": 31023954.0, "step": 13545 }, { "entropy": 5.539100980758667, "epoch": 1.3394622380387504, "grad_norm": 0.9453125, "learning_rate": 0.0004827910966460164, "loss": 5.0548, "mean_token_accuracy": 0.20960886031389236, "num_tokens": 31035365.0, "step": 13550 }, { "entropy": 5.581730079650879, "epoch": 1.339956504547252, "grad_norm": 0.890625, "learning_rate": 0.0004827775582668069, "loss": 5.1124, "mean_token_accuracy": 0.20950435101985931, "num_tokens": 31046814.0, "step": 13555 }, { "entropy": 5.524360322952271, "epoch": 1.3404507710557532, "grad_norm": 0.96875, "learning_rate": 0.0004827640147762372, "loss": 5.0691, "mean_token_accuracy": 0.20621009171009064, "num_tokens": 31058112.0, "step": 13560 }, { "entropy": 5.503505373001099, "epoch": 1.3409450375642546, "grad_norm": 1.109375, "learning_rate": 0.00048275046617464055, "loss": 5.0718, "mean_token_accuracy": 0.2073362037539482, "num_tokens": 31068703.0, "step": 13565 }, { "entropy": 5.5613678932189945, "epoch": 1.3414393040727561, "grad_norm": 0.9921875, "learning_rate": 0.0004827369124623502, "loss": 5.1019, "mean_token_accuracy": 0.20726903676986694, "num_tokens": 31080018.0, "step": 13570 }, { "entropy": 5.6391771793365475, "epoch": 1.3419335705812574, "grad_norm": 1.0234375, "learning_rate": 0.00048272335363969956, "loss": 5.1634, "mean_token_accuracy": 0.20443627685308458, "num_tokens": 31091103.0, "step": 13575 }, { "entropy": 5.686288070678711, "epoch": 1.3424278370897589, "grad_norm": 0.98046875, "learning_rate": 0.0004827097897070222, "loss": 5.1765, "mean_token_accuracy": 0.19794023036956787, "num_tokens": 31102731.0, "step": 13580 }, { "entropy": 5.448893594741821, "epoch": 1.3429221035982601, "grad_norm": 0.98828125, "learning_rate": 0.0004826962206646518, "loss": 5.0328, "mean_token_accuracy": 0.21778308600187302, "num_tokens": 31114080.0, "step": 13585 }, { "entropy": 5.536490345001221, "epoch": 1.3434163701067616, "grad_norm": 0.9609375, "learning_rate": 0.00048268264651292215, "loss": 5.0997, "mean_token_accuracy": 0.20343845337629318, "num_tokens": 31125875.0, "step": 13590 }, { "entropy": 5.614523077011109, "epoch": 1.3439106366152629, "grad_norm": 0.97265625, "learning_rate": 0.00048266906725216713, "loss": 5.0864, "mean_token_accuracy": 0.20608544051647187, "num_tokens": 31139246.0, "step": 13595 }, { "entropy": 5.554616117477417, "epoch": 1.3444049031237644, "grad_norm": 0.99609375, "learning_rate": 0.00048265548288272086, "loss": 5.0225, "mean_token_accuracy": 0.20875378400087358, "num_tokens": 31150606.0, "step": 13600 }, { "entropy": 5.523560905456543, "epoch": 1.3448991696322659, "grad_norm": 1.0, "learning_rate": 0.00048264189340491755, "loss": 5.1364, "mean_token_accuracy": 0.20606419444084167, "num_tokens": 31162413.0, "step": 13605 }, { "entropy": 5.6174732685089115, "epoch": 1.3453934361407671, "grad_norm": 0.9765625, "learning_rate": 0.00048262829881909135, "loss": 5.1559, "mean_token_accuracy": 0.19696816205978393, "num_tokens": 31172832.0, "step": 13610 }, { "entropy": 5.5688446998596195, "epoch": 1.3458877026492684, "grad_norm": 0.89453125, "learning_rate": 0.00048261469912557685, "loss": 5.1702, "mean_token_accuracy": 0.20402154922485352, "num_tokens": 31186172.0, "step": 13615 }, { "entropy": 5.571122503280639, "epoch": 1.3463819691577699, "grad_norm": 1.015625, "learning_rate": 0.00048260109432470856, "loss": 5.0545, "mean_token_accuracy": 0.21002224683761597, "num_tokens": 31197580.0, "step": 13620 }, { "entropy": 5.605104780197143, "epoch": 1.3468762356662713, "grad_norm": 0.921875, "learning_rate": 0.00048258748441682114, "loss": 5.1118, "mean_token_accuracy": 0.20806742161512376, "num_tokens": 31209262.0, "step": 13625 }, { "entropy": 5.58793830871582, "epoch": 1.3473705021747726, "grad_norm": 0.96875, "learning_rate": 0.0004825738694022494, "loss": 5.1022, "mean_token_accuracy": 0.20548520982265472, "num_tokens": 31221722.0, "step": 13630 }, { "entropy": 5.485466861724854, "epoch": 1.347864768683274, "grad_norm": 1.078125, "learning_rate": 0.00048256024928132826, "loss": 5.0604, "mean_token_accuracy": 0.22038736194372177, "num_tokens": 31232871.0, "step": 13635 }, { "entropy": 5.5346503257751465, "epoch": 1.3483590351917754, "grad_norm": 1.0234375, "learning_rate": 0.0004825466240543928, "loss": 5.1378, "mean_token_accuracy": 0.20339940637350082, "num_tokens": 31244010.0, "step": 13640 }, { "entropy": 5.56313796043396, "epoch": 1.3488533017002768, "grad_norm": 0.984375, "learning_rate": 0.0004825329937217782, "loss": 5.0983, "mean_token_accuracy": 0.20538267940282823, "num_tokens": 31255643.0, "step": 13645 }, { "entropy": 5.652267503738403, "epoch": 1.349347568208778, "grad_norm": 1.0234375, "learning_rate": 0.0004825193582838196, "loss": 5.2239, "mean_token_accuracy": 0.19628677219152452, "num_tokens": 31266764.0, "step": 13650 }, { "entropy": 5.574744796752929, "epoch": 1.3498418347172796, "grad_norm": 0.953125, "learning_rate": 0.0004825057177408528, "loss": 5.0694, "mean_token_accuracy": 0.21507420241832734, "num_tokens": 31277533.0, "step": 13655 }, { "entropy": 5.552283668518067, "epoch": 1.350336101225781, "grad_norm": 0.96875, "learning_rate": 0.000482492072093213, "loss": 5.101, "mean_token_accuracy": 0.20723414570093154, "num_tokens": 31289509.0, "step": 13660 }, { "entropy": 5.574603700637818, "epoch": 1.3508303677342823, "grad_norm": 0.96875, "learning_rate": 0.00048247842134123615, "loss": 5.1381, "mean_token_accuracy": 0.20708564668893814, "num_tokens": 31300909.0, "step": 13665 }, { "entropy": 5.603860569000244, "epoch": 1.3513246342427836, "grad_norm": 0.96875, "learning_rate": 0.0004824647654852579, "loss": 5.1662, "mean_token_accuracy": 0.20065870732069016, "num_tokens": 31312148.0, "step": 13670 }, { "entropy": 5.529270601272583, "epoch": 1.351818900751285, "grad_norm": 0.9296875, "learning_rate": 0.0004824511045256142, "loss": 5.0258, "mean_token_accuracy": 0.2154597669839859, "num_tokens": 31323388.0, "step": 13675 }, { "entropy": 5.544249868392944, "epoch": 1.3523131672597866, "grad_norm": 1.0, "learning_rate": 0.00048243743846264125, "loss": 5.0184, "mean_token_accuracy": 0.210044527053833, "num_tokens": 31334103.0, "step": 13680 }, { "entropy": 5.564815473556519, "epoch": 1.3528074337682878, "grad_norm": 0.98828125, "learning_rate": 0.0004824237672966751, "loss": 5.1216, "mean_token_accuracy": 0.2004387229681015, "num_tokens": 31345456.0, "step": 13685 }, { "entropy": 5.459865951538086, "epoch": 1.3533017002767893, "grad_norm": 0.98828125, "learning_rate": 0.000482410091028052, "loss": 4.9733, "mean_token_accuracy": 0.22217990458011627, "num_tokens": 31356482.0, "step": 13690 }, { "entropy": 5.601660299301147, "epoch": 1.3537959667852906, "grad_norm": 1.0703125, "learning_rate": 0.00048239640965710854, "loss": 5.1781, "mean_token_accuracy": 0.20042692571878434, "num_tokens": 31367103.0, "step": 13695 }, { "entropy": 5.632080316543579, "epoch": 1.354290233293792, "grad_norm": 1.0625, "learning_rate": 0.00048238272318418127, "loss": 5.1674, "mean_token_accuracy": 0.19745872765779496, "num_tokens": 31378564.0, "step": 13700 }, { "entropy": 5.576942729949951, "epoch": 1.3547844998022933, "grad_norm": 0.89453125, "learning_rate": 0.00048236903160960677, "loss": 5.125, "mean_token_accuracy": 0.20643594413995742, "num_tokens": 31391435.0, "step": 13705 }, { "entropy": 5.578527021408081, "epoch": 1.3552787663107948, "grad_norm": 0.95703125, "learning_rate": 0.000482355334933722, "loss": 5.1499, "mean_token_accuracy": 0.2005109131336212, "num_tokens": 31403422.0, "step": 13710 }, { "entropy": 5.526031064987182, "epoch": 1.3557730328192963, "grad_norm": 0.96484375, "learning_rate": 0.00048234163315686375, "loss": 5.0038, "mean_token_accuracy": 0.22031928449869156, "num_tokens": 31414940.0, "step": 13715 }, { "entropy": 5.573614311218262, "epoch": 1.3562672993277975, "grad_norm": 0.8984375, "learning_rate": 0.0004823279262793692, "loss": 5.1933, "mean_token_accuracy": 0.20144014954566955, "num_tokens": 31426369.0, "step": 13720 }, { "entropy": 5.535800123214722, "epoch": 1.3567615658362988, "grad_norm": 0.96484375, "learning_rate": 0.00048231421430157547, "loss": 5.1319, "mean_token_accuracy": 0.20752509087324142, "num_tokens": 31438426.0, "step": 13725 }, { "entropy": 5.501848316192627, "epoch": 1.3572558323448003, "grad_norm": 0.96875, "learning_rate": 0.0004823004972238199, "loss": 5.0681, "mean_token_accuracy": 0.206590174138546, "num_tokens": 31450230.0, "step": 13730 }, { "entropy": 5.6070338726043705, "epoch": 1.3577500988533018, "grad_norm": 1.046875, "learning_rate": 0.00048228677504643996, "loss": 5.2261, "mean_token_accuracy": 0.1939161613583565, "num_tokens": 31462564.0, "step": 13735 }, { "entropy": 5.557730627059937, "epoch": 1.358244365361803, "grad_norm": 1.0390625, "learning_rate": 0.0004822730477697732, "loss": 5.0753, "mean_token_accuracy": 0.21364993155002593, "num_tokens": 31475053.0, "step": 13740 }, { "entropy": 5.573736524581909, "epoch": 1.3587386318703045, "grad_norm": 1.4453125, "learning_rate": 0.0004822593153941573, "loss": 5.1402, "mean_token_accuracy": 0.20660350769758223, "num_tokens": 31487187.0, "step": 13745 }, { "entropy": 5.604350662231445, "epoch": 1.3592328983788058, "grad_norm": 1.109375, "learning_rate": 0.00048224557791993013, "loss": 5.1475, "mean_token_accuracy": 0.20830897092819214, "num_tokens": 31499288.0, "step": 13750 }, { "entropy": 5.576268815994263, "epoch": 1.3597271648873073, "grad_norm": 0.94921875, "learning_rate": 0.00048223183534742953, "loss": 5.1065, "mean_token_accuracy": 0.20296761840581895, "num_tokens": 31510113.0, "step": 13755 }, { "entropy": 5.575766324996948, "epoch": 1.3602214313958085, "grad_norm": 1.046875, "learning_rate": 0.00048221808767699373, "loss": 5.0693, "mean_token_accuracy": 0.20747560113668442, "num_tokens": 31520900.0, "step": 13760 }, { "entropy": 5.563949871063232, "epoch": 1.36071569790431, "grad_norm": 1.0859375, "learning_rate": 0.0004822043349089607, "loss": 5.1059, "mean_token_accuracy": 0.21162760853767396, "num_tokens": 31533085.0, "step": 13765 }, { "entropy": 5.564993190765381, "epoch": 1.3612099644128115, "grad_norm": 0.9921875, "learning_rate": 0.0004821905770436689, "loss": 5.137, "mean_token_accuracy": 0.20071935653686523, "num_tokens": 31544287.0, "step": 13770 }, { "entropy": 5.520062685012817, "epoch": 1.3617042309213128, "grad_norm": 1.078125, "learning_rate": 0.0004821768140814568, "loss": 5.0985, "mean_token_accuracy": 0.21378722488880159, "num_tokens": 31555233.0, "step": 13775 }, { "entropy": 5.579205560684204, "epoch": 1.362198497429814, "grad_norm": 1.046875, "learning_rate": 0.0004821630460226629, "loss": 5.0346, "mean_token_accuracy": 0.2162458896636963, "num_tokens": 31565421.0, "step": 13780 }, { "entropy": 5.578094148635865, "epoch": 1.3626927639383155, "grad_norm": 1.0625, "learning_rate": 0.000482149272867626, "loss": 5.1473, "mean_token_accuracy": 0.20699767768383026, "num_tokens": 31576787.0, "step": 13785 }, { "entropy": 5.603877353668213, "epoch": 1.363187030446817, "grad_norm": 0.984375, "learning_rate": 0.00048213549461668476, "loss": 5.1941, "mean_token_accuracy": 0.19815989285707475, "num_tokens": 31587563.0, "step": 13790 }, { "entropy": 5.6196808338165285, "epoch": 1.3636812969553183, "grad_norm": 0.94140625, "learning_rate": 0.00048212171127017835, "loss": 5.0844, "mean_token_accuracy": 0.20661889910697936, "num_tokens": 31598186.0, "step": 13795 }, { "entropy": 5.596389865875244, "epoch": 1.3641755634638197, "grad_norm": 1.0390625, "learning_rate": 0.0004821079228284456, "loss": 5.1188, "mean_token_accuracy": 0.20242847353219987, "num_tokens": 31609458.0, "step": 13800 }, { "entropy": 5.522091484069824, "epoch": 1.364669829972321, "grad_norm": 1.125, "learning_rate": 0.00048209412929182586, "loss": 5.0461, "mean_token_accuracy": 0.21261921375989914, "num_tokens": 31619497.0, "step": 13805 }, { "entropy": 5.5600661277771, "epoch": 1.3651640964808225, "grad_norm": 0.93359375, "learning_rate": 0.0004820803306606584, "loss": 5.1422, "mean_token_accuracy": 0.19948734790086747, "num_tokens": 31630838.0, "step": 13810 }, { "entropy": 5.621643209457398, "epoch": 1.3656583629893237, "grad_norm": 0.9296875, "learning_rate": 0.0004820665269352827, "loss": 5.2059, "mean_token_accuracy": 0.20019068717956542, "num_tokens": 31642234.0, "step": 13815 }, { "entropy": 5.622629261016845, "epoch": 1.3661526294978252, "grad_norm": 0.96484375, "learning_rate": 0.00048205271811603827, "loss": 5.1592, "mean_token_accuracy": 0.19892484098672866, "num_tokens": 31653283.0, "step": 13820 }, { "entropy": 5.5786741256713865, "epoch": 1.3666468960063267, "grad_norm": 1.0703125, "learning_rate": 0.0004820389042032649, "loss": 5.0853, "mean_token_accuracy": 0.2106181874871254, "num_tokens": 31663284.0, "step": 13825 }, { "entropy": 5.514977979660034, "epoch": 1.367141162514828, "grad_norm": 0.94140625, "learning_rate": 0.0004820250851973023, "loss": 5.0522, "mean_token_accuracy": 0.20906058251857756, "num_tokens": 31674379.0, "step": 13830 }, { "entropy": 5.593608856201172, "epoch": 1.3676354290233292, "grad_norm": 0.9140625, "learning_rate": 0.0004820112610984906, "loss": 5.2062, "mean_token_accuracy": 0.19917240142822265, "num_tokens": 31686420.0, "step": 13835 }, { "entropy": 5.507311582565308, "epoch": 1.3681296955318307, "grad_norm": 1.03125, "learning_rate": 0.00048199743190716966, "loss": 5.0066, "mean_token_accuracy": 0.22053024768829346, "num_tokens": 31696919.0, "step": 13840 }, { "entropy": 5.548516416549683, "epoch": 1.3686239620403322, "grad_norm": 0.98828125, "learning_rate": 0.00048198359762367983, "loss": 5.1265, "mean_token_accuracy": 0.20189044177532195, "num_tokens": 31708878.0, "step": 13845 }, { "entropy": 5.588537216186523, "epoch": 1.3691182285488335, "grad_norm": 1.046875, "learning_rate": 0.00048196975824836135, "loss": 5.1605, "mean_token_accuracy": 0.2096859946846962, "num_tokens": 31719348.0, "step": 13850 }, { "entropy": 5.548238468170166, "epoch": 1.369612495057335, "grad_norm": 0.9765625, "learning_rate": 0.0004819559137815547, "loss": 5.1096, "mean_token_accuracy": 0.2089928686618805, "num_tokens": 31729349.0, "step": 13855 }, { "entropy": 5.602353143692016, "epoch": 1.3701067615658362, "grad_norm": 1.015625, "learning_rate": 0.0004819420642236005, "loss": 5.1173, "mean_token_accuracy": 0.2055353492498398, "num_tokens": 31740345.0, "step": 13860 }, { "entropy": 5.662989473342895, "epoch": 1.3706010280743377, "grad_norm": 0.9296875, "learning_rate": 0.0004819282095748395, "loss": 5.1334, "mean_token_accuracy": 0.20549549013376237, "num_tokens": 31752231.0, "step": 13865 }, { "entropy": 5.603303098678589, "epoch": 1.371095294582839, "grad_norm": 0.90234375, "learning_rate": 0.0004819143498356123, "loss": 5.1363, "mean_token_accuracy": 0.20778951793909073, "num_tokens": 31764248.0, "step": 13870 }, { "entropy": 5.496905851364136, "epoch": 1.3715895610913404, "grad_norm": 0.9453125, "learning_rate": 0.0004819004850062601, "loss": 4.9936, "mean_token_accuracy": 0.214388407766819, "num_tokens": 31774173.0, "step": 13875 }, { "entropy": 5.582096242904663, "epoch": 1.372083827599842, "grad_norm": 1.1015625, "learning_rate": 0.00048188661508712376, "loss": 5.1506, "mean_token_accuracy": 0.19871023297309875, "num_tokens": 31784860.0, "step": 13880 }, { "entropy": 5.57042818069458, "epoch": 1.3725780941083432, "grad_norm": 0.88671875, "learning_rate": 0.0004818727400785447, "loss": 5.1502, "mean_token_accuracy": 0.20428381115198135, "num_tokens": 31797012.0, "step": 13885 }, { "entropy": 5.532270050048828, "epoch": 1.3730723606168447, "grad_norm": 0.94921875, "learning_rate": 0.0004818588599808641, "loss": 5.0603, "mean_token_accuracy": 0.20941499024629592, "num_tokens": 31808216.0, "step": 13890 }, { "entropy": 5.556276893615722, "epoch": 1.373566627125346, "grad_norm": 1.0703125, "learning_rate": 0.00048184497479442345, "loss": 5.1485, "mean_token_accuracy": 0.2028528034687042, "num_tokens": 31820097.0, "step": 13895 }, { "entropy": 5.6298338890075685, "epoch": 1.3740608936338474, "grad_norm": 1.0078125, "learning_rate": 0.0004818310845195643, "loss": 5.2243, "mean_token_accuracy": 0.1943472221493721, "num_tokens": 31832252.0, "step": 13900 }, { "entropy": 5.637437152862549, "epoch": 1.3745551601423487, "grad_norm": 1.0, "learning_rate": 0.0004818171891566284, "loss": 5.2039, "mean_token_accuracy": 0.19813273698091508, "num_tokens": 31842928.0, "step": 13905 }, { "entropy": 5.565429544448852, "epoch": 1.3750494266508502, "grad_norm": 1.1015625, "learning_rate": 0.0004818032887059576, "loss": 5.042, "mean_token_accuracy": 0.21008803993463515, "num_tokens": 31854072.0, "step": 13910 }, { "entropy": 5.60542573928833, "epoch": 1.3755436931593517, "grad_norm": 0.9375, "learning_rate": 0.0004817893831678938, "loss": 5.1489, "mean_token_accuracy": 0.20480180233716966, "num_tokens": 31865163.0, "step": 13915 }, { "entropy": 5.515901851654053, "epoch": 1.376037959667853, "grad_norm": 0.921875, "learning_rate": 0.00048177547254277904, "loss": 5.0268, "mean_token_accuracy": 0.21805257052183152, "num_tokens": 31876583.0, "step": 13920 }, { "entropy": 5.53957052230835, "epoch": 1.3765322261763542, "grad_norm": 1.0859375, "learning_rate": 0.0004817615568309557, "loss": 5.1043, "mean_token_accuracy": 0.21166080087423325, "num_tokens": 31886794.0, "step": 13925 }, { "entropy": 5.652256870269776, "epoch": 1.3770264926848557, "grad_norm": 0.9375, "learning_rate": 0.0004817476360327658, "loss": 5.1803, "mean_token_accuracy": 0.20236516892910003, "num_tokens": 31899980.0, "step": 13930 }, { "entropy": 5.501806640625, "epoch": 1.3775207591933571, "grad_norm": 0.95703125, "learning_rate": 0.0004817337101485521, "loss": 5.0015, "mean_token_accuracy": 0.21366400867700577, "num_tokens": 31909906.0, "step": 13935 }, { "entropy": 5.477876281738281, "epoch": 1.3780150257018584, "grad_norm": 1.09375, "learning_rate": 0.00048171977917865706, "loss": 5.0803, "mean_token_accuracy": 0.21365077346563338, "num_tokens": 31920499.0, "step": 13940 }, { "entropy": 5.521246480941772, "epoch": 1.37850929221036, "grad_norm": 0.9765625, "learning_rate": 0.00048170584312342337, "loss": 5.0662, "mean_token_accuracy": 0.21290534883737564, "num_tokens": 31931031.0, "step": 13945 }, { "entropy": 5.596352624893188, "epoch": 1.3790035587188612, "grad_norm": 1.0703125, "learning_rate": 0.0004816919019831939, "loss": 5.0539, "mean_token_accuracy": 0.2130081370472908, "num_tokens": 31941887.0, "step": 13950 }, { "entropy": 5.595739793777466, "epoch": 1.3794978252273626, "grad_norm": 1.0, "learning_rate": 0.00048167795575831154, "loss": 5.1349, "mean_token_accuracy": 0.20080083906650542, "num_tokens": 31953727.0, "step": 13955 }, { "entropy": 5.570001459121704, "epoch": 1.379992091735864, "grad_norm": 1.140625, "learning_rate": 0.0004816640044491193, "loss": 5.1068, "mean_token_accuracy": 0.2048891931772232, "num_tokens": 31965418.0, "step": 13960 }, { "entropy": 5.593258237838745, "epoch": 1.3804863582443654, "grad_norm": 1.015625, "learning_rate": 0.0004816500480559607, "loss": 5.1596, "mean_token_accuracy": 0.20096204578876495, "num_tokens": 31976528.0, "step": 13965 }, { "entropy": 5.588778352737426, "epoch": 1.3809806247528669, "grad_norm": 0.9609375, "learning_rate": 0.00048163608657917874, "loss": 5.137, "mean_token_accuracy": 0.20209051668643951, "num_tokens": 31987921.0, "step": 13970 }, { "entropy": 5.540246438980103, "epoch": 1.3814748912613681, "grad_norm": 0.98828125, "learning_rate": 0.000481622120019117, "loss": 5.0121, "mean_token_accuracy": 0.2103307440876961, "num_tokens": 31998824.0, "step": 13975 }, { "entropy": 5.585183238983154, "epoch": 1.3819691577698694, "grad_norm": 0.9609375, "learning_rate": 0.0004816081483761191, "loss": 5.1764, "mean_token_accuracy": 0.19628219157457352, "num_tokens": 32011690.0, "step": 13980 }, { "entropy": 5.604935264587402, "epoch": 1.3824634242783709, "grad_norm": 0.98046875, "learning_rate": 0.0004815941716505286, "loss": 5.1527, "mean_token_accuracy": 0.2071884661912918, "num_tokens": 32022946.0, "step": 13985 }, { "entropy": 5.621512222290039, "epoch": 1.3829576907868724, "grad_norm": 0.94140625, "learning_rate": 0.00048158018984268954, "loss": 5.1324, "mean_token_accuracy": 0.20238869190216063, "num_tokens": 32033683.0, "step": 13990 }, { "entropy": 5.6394799709320065, "epoch": 1.3834519572953736, "grad_norm": 0.94140625, "learning_rate": 0.0004815662029529457, "loss": 5.1796, "mean_token_accuracy": 0.19835071861743928, "num_tokens": 32045334.0, "step": 13995 }, { "entropy": 5.558656883239746, "epoch": 1.383946223803875, "grad_norm": 0.9921875, "learning_rate": 0.00048155221098164123, "loss": 5.074, "mean_token_accuracy": 0.20933616757392884, "num_tokens": 32056425.0, "step": 14000 }, { "entropy": 5.61614294052124, "epoch": 1.3844404903123764, "grad_norm": 0.98046875, "learning_rate": 0.00048153821392912035, "loss": 5.1, "mean_token_accuracy": 0.2086609572172165, "num_tokens": 32068053.0, "step": 14005 }, { "entropy": 5.587152290344238, "epoch": 1.3849347568208779, "grad_norm": 1.203125, "learning_rate": 0.0004815242117957273, "loss": 5.1094, "mean_token_accuracy": 0.20470570176839828, "num_tokens": 32079462.0, "step": 14010 }, { "entropy": 5.4922092914581295, "epoch": 1.3854290233293791, "grad_norm": 1.0078125, "learning_rate": 0.00048151020458180667, "loss": 5.1115, "mean_token_accuracy": 0.20803782790899278, "num_tokens": 32090566.0, "step": 14015 }, { "entropy": 5.634176588058471, "epoch": 1.3859232898378806, "grad_norm": 0.95703125, "learning_rate": 0.000481496192287703, "loss": 5.1916, "mean_token_accuracy": 0.20657882690429688, "num_tokens": 32101535.0, "step": 14020 }, { "entropy": 5.556673955917359, "epoch": 1.386417556346382, "grad_norm": 0.96875, "learning_rate": 0.0004814821749137609, "loss": 5.0536, "mean_token_accuracy": 0.20657679438591003, "num_tokens": 32112450.0, "step": 14025 }, { "entropy": 5.5706545352935795, "epoch": 1.3869118228548833, "grad_norm": 0.99609375, "learning_rate": 0.0004814681524603252, "loss": 5.1492, "mean_token_accuracy": 0.20169909447431564, "num_tokens": 32123675.0, "step": 14030 }, { "entropy": 5.594191074371338, "epoch": 1.3874060893633846, "grad_norm": 0.97265625, "learning_rate": 0.000481454124927741, "loss": 5.1504, "mean_token_accuracy": 0.1986047700047493, "num_tokens": 32135283.0, "step": 14035 }, { "entropy": 5.543085289001465, "epoch": 1.387900355871886, "grad_norm": 1.0078125, "learning_rate": 0.00048144009231635326, "loss": 5.0755, "mean_token_accuracy": 0.21256354451179504, "num_tokens": 32146715.0, "step": 14040 }, { "entropy": 5.521589231491089, "epoch": 1.3883946223803876, "grad_norm": 1.0234375, "learning_rate": 0.0004814260546265073, "loss": 5.0967, "mean_token_accuracy": 0.20756663978099824, "num_tokens": 32158323.0, "step": 14045 }, { "entropy": 5.617977285385132, "epoch": 1.3888888888888888, "grad_norm": 0.984375, "learning_rate": 0.0004814120118585483, "loss": 5.1653, "mean_token_accuracy": 0.20169470757246016, "num_tokens": 32170453.0, "step": 14050 }, { "entropy": 5.664642381668091, "epoch": 1.3893831553973903, "grad_norm": 1.015625, "learning_rate": 0.0004813979640128218, "loss": 5.175, "mean_token_accuracy": 0.19825115650892258, "num_tokens": 32181596.0, "step": 14055 }, { "entropy": 5.60272970199585, "epoch": 1.3898774219058916, "grad_norm": 0.94921875, "learning_rate": 0.0004813839110896734, "loss": 5.1323, "mean_token_accuracy": 0.1999484568834305, "num_tokens": 32194603.0, "step": 14060 }, { "entropy": 5.531467580795288, "epoch": 1.390371688414393, "grad_norm": 0.921875, "learning_rate": 0.00048136985308944874, "loss": 5.0636, "mean_token_accuracy": 0.2084932267665863, "num_tokens": 32206064.0, "step": 14065 }, { "entropy": 5.602655744552612, "epoch": 1.3908659549228943, "grad_norm": 1.0625, "learning_rate": 0.00048135579001249367, "loss": 5.1209, "mean_token_accuracy": 0.19792898297309874, "num_tokens": 32217254.0, "step": 14070 }, { "entropy": 5.637914848327637, "epoch": 1.3913602214313958, "grad_norm": 1.046875, "learning_rate": 0.0004813417218591542, "loss": 5.2573, "mean_token_accuracy": 0.18737945705652237, "num_tokens": 32228821.0, "step": 14075 }, { "entropy": 5.621065092086792, "epoch": 1.3918544879398973, "grad_norm": 1.015625, "learning_rate": 0.0004813276486297763, "loss": 5.1103, "mean_token_accuracy": 0.2009533539414406, "num_tokens": 32239476.0, "step": 14080 }, { "entropy": 5.591162776947021, "epoch": 1.3923487544483986, "grad_norm": 0.96484375, "learning_rate": 0.0004813135703247062, "loss": 5.0768, "mean_token_accuracy": 0.2070294886827469, "num_tokens": 32250975.0, "step": 14085 }, { "entropy": 5.569203281402588, "epoch": 1.3928430209568998, "grad_norm": 1.078125, "learning_rate": 0.00048129948694429036, "loss": 5.0735, "mean_token_accuracy": 0.2143013909459114, "num_tokens": 32261675.0, "step": 14090 }, { "entropy": 5.5135582447052, "epoch": 1.3933372874654013, "grad_norm": 0.99609375, "learning_rate": 0.00048128539848887517, "loss": 4.9729, "mean_token_accuracy": 0.220565827190876, "num_tokens": 32272523.0, "step": 14095 }, { "entropy": 5.536860847473145, "epoch": 1.3938315539739028, "grad_norm": 1.0546875, "learning_rate": 0.00048127130495880703, "loss": 5.1326, "mean_token_accuracy": 0.20045574009418488, "num_tokens": 32284140.0, "step": 14100 }, { "entropy": 5.548109722137451, "epoch": 1.394325820482404, "grad_norm": 1.0078125, "learning_rate": 0.0004812572063544329, "loss": 5.0627, "mean_token_accuracy": 0.20566654056310654, "num_tokens": 32296286.0, "step": 14105 }, { "entropy": 5.600670003890992, "epoch": 1.3948200869909055, "grad_norm": 1.015625, "learning_rate": 0.00048124310267609946, "loss": 5.1242, "mean_token_accuracy": 0.20375613421201705, "num_tokens": 32307394.0, "step": 14110 }, { "entropy": 5.6348775863647464, "epoch": 1.3953143534994068, "grad_norm": 0.96484375, "learning_rate": 0.0004812289939241537, "loss": 5.2141, "mean_token_accuracy": 0.19800772219896318, "num_tokens": 32318788.0, "step": 14115 }, { "entropy": 5.619345712661743, "epoch": 1.3958086200079083, "grad_norm": 0.93359375, "learning_rate": 0.0004812148800989427, "loss": 5.1934, "mean_token_accuracy": 0.20114578306674957, "num_tokens": 32332395.0, "step": 14120 }, { "entropy": 5.643853330612183, "epoch": 1.3963028865164095, "grad_norm": 0.9453125, "learning_rate": 0.00048120076120081363, "loss": 5.1549, "mean_token_accuracy": 0.2001449018716812, "num_tokens": 32344226.0, "step": 14125 }, { "entropy": 5.633125591278076, "epoch": 1.396797153024911, "grad_norm": 1.0078125, "learning_rate": 0.00048118663723011393, "loss": 5.1445, "mean_token_accuracy": 0.19588407278060913, "num_tokens": 32354677.0, "step": 14130 }, { "entropy": 5.537072467803955, "epoch": 1.3972914195334125, "grad_norm": 0.984375, "learning_rate": 0.0004811725081871909, "loss": 5.0575, "mean_token_accuracy": 0.20122272819280623, "num_tokens": 32365054.0, "step": 14135 }, { "entropy": 5.497219133377075, "epoch": 1.3977856860419138, "grad_norm": 0.9765625, "learning_rate": 0.0004811583740723922, "loss": 5.0283, "mean_token_accuracy": 0.22518322467803956, "num_tokens": 32376215.0, "step": 14140 }, { "entropy": 5.615637397766113, "epoch": 1.3982799525504153, "grad_norm": 1.0078125, "learning_rate": 0.00048114423488606543, "loss": 5.1496, "mean_token_accuracy": 0.20132067054510117, "num_tokens": 32386880.0, "step": 14145 }, { "entropy": 5.577715730667114, "epoch": 1.3987742190589165, "grad_norm": 0.9609375, "learning_rate": 0.00048113009062855866, "loss": 5.1509, "mean_token_accuracy": 0.20639248937368393, "num_tokens": 32398227.0, "step": 14150 }, { "entropy": 5.671115350723267, "epoch": 1.399268485567418, "grad_norm": 0.9765625, "learning_rate": 0.0004811159413002196, "loss": 5.1743, "mean_token_accuracy": 0.20135313123464585, "num_tokens": 32410091.0, "step": 14155 }, { "entropy": 5.625784063339234, "epoch": 1.3997627520759193, "grad_norm": 0.890625, "learning_rate": 0.0004811017869013963, "loss": 5.1254, "mean_token_accuracy": 0.20393664985895157, "num_tokens": 32422710.0, "step": 14160 }, { "entropy": 5.592098760604858, "epoch": 1.4002570185844208, "grad_norm": 1.0703125, "learning_rate": 0.0004810876274324372, "loss": 5.1602, "mean_token_accuracy": 0.2063774511218071, "num_tokens": 32433691.0, "step": 14165 }, { "entropy": 5.529530954360962, "epoch": 1.4007512850929222, "grad_norm": 0.94921875, "learning_rate": 0.0004810734628936905, "loss": 5.0966, "mean_token_accuracy": 0.20668643712997437, "num_tokens": 32445370.0, "step": 14170 }, { "entropy": 5.536227893829346, "epoch": 1.4012455516014235, "grad_norm": 1.140625, "learning_rate": 0.00048105929328550465, "loss": 5.0575, "mean_token_accuracy": 0.211318039894104, "num_tokens": 32456737.0, "step": 14175 }, { "entropy": 5.550581407546997, "epoch": 1.4017398181099248, "grad_norm": 1.0546875, "learning_rate": 0.0004810451186082282, "loss": 5.1094, "mean_token_accuracy": 0.2032174438238144, "num_tokens": 32467957.0, "step": 14180 }, { "entropy": 5.611336278915405, "epoch": 1.4022340846184262, "grad_norm": 0.95703125, "learning_rate": 0.00048103093886220984, "loss": 5.1844, "mean_token_accuracy": 0.20157507359981536, "num_tokens": 32481697.0, "step": 14185 }, { "entropy": 5.566171646118164, "epoch": 1.4027283511269277, "grad_norm": 0.96484375, "learning_rate": 0.00048101675404779834, "loss": 5.0124, "mean_token_accuracy": 0.2114764094352722, "num_tokens": 32492828.0, "step": 14190 }, { "entropy": 5.6757549285888675, "epoch": 1.403222617635429, "grad_norm": 1.0234375, "learning_rate": 0.0004810025641653428, "loss": 5.2388, "mean_token_accuracy": 0.19806989580392836, "num_tokens": 32505120.0, "step": 14195 }, { "entropy": 5.539808464050293, "epoch": 1.4037168841439305, "grad_norm": 1.03125, "learning_rate": 0.0004809883692151923, "loss": 5.0715, "mean_token_accuracy": 0.21128014624118804, "num_tokens": 32516837.0, "step": 14200 }, { "entropy": 5.530702066421509, "epoch": 1.4042111506524317, "grad_norm": 1.0390625, "learning_rate": 0.00048097416919769595, "loss": 5.0357, "mean_token_accuracy": 0.21083852797746658, "num_tokens": 32526906.0, "step": 14205 }, { "entropy": 5.612507343292236, "epoch": 1.4047054171609332, "grad_norm": 1.078125, "learning_rate": 0.00048095996411320294, "loss": 5.1862, "mean_token_accuracy": 0.19941399097442628, "num_tokens": 32537929.0, "step": 14210 }, { "entropy": 5.582635021209716, "epoch": 1.4051996836694345, "grad_norm": 1.0078125, "learning_rate": 0.00048094575396206296, "loss": 5.18, "mean_token_accuracy": 0.2035173550248146, "num_tokens": 32549458.0, "step": 14215 }, { "entropy": 5.581595420837402, "epoch": 1.405693950177936, "grad_norm": 1.015625, "learning_rate": 0.0004809315387446255, "loss": 5.0721, "mean_token_accuracy": 0.20969368368387223, "num_tokens": 32560244.0, "step": 14220 }, { "entropy": 5.586174201965332, "epoch": 1.4061882166864375, "grad_norm": 1.0078125, "learning_rate": 0.0004809173184612402, "loss": 5.1871, "mean_token_accuracy": 0.20112673193216324, "num_tokens": 32571337.0, "step": 14225 }, { "entropy": 5.554188680648804, "epoch": 1.4066824831949387, "grad_norm": 0.9609375, "learning_rate": 0.0004809030931122569, "loss": 5.0767, "mean_token_accuracy": 0.2102083683013916, "num_tokens": 32582325.0, "step": 14230 }, { "entropy": 5.6330829620361325, "epoch": 1.40717674970344, "grad_norm": 1.09375, "learning_rate": 0.00048088886269802565, "loss": 5.1514, "mean_token_accuracy": 0.20807175487279891, "num_tokens": 32592953.0, "step": 14235 }, { "entropy": 5.546420669555664, "epoch": 1.4076710162119415, "grad_norm": 1.03125, "learning_rate": 0.0004808746272188964, "loss": 5.0875, "mean_token_accuracy": 0.2059058278799057, "num_tokens": 32604190.0, "step": 14240 }, { "entropy": 5.659741926193237, "epoch": 1.408165282720443, "grad_norm": 1.0859375, "learning_rate": 0.00048086038667521935, "loss": 5.0763, "mean_token_accuracy": 0.21153253614902495, "num_tokens": 32614467.0, "step": 14245 }, { "entropy": 5.5655481815338135, "epoch": 1.4086595492289442, "grad_norm": 1.0390625, "learning_rate": 0.0004808461410673449, "loss": 5.0789, "mean_token_accuracy": 0.2048017054796219, "num_tokens": 32624022.0, "step": 14250 }, { "entropy": 5.559842491149903, "epoch": 1.4091538157374457, "grad_norm": 0.99609375, "learning_rate": 0.0004808318903956234, "loss": 5.1025, "mean_token_accuracy": 0.21088871061801912, "num_tokens": 32634363.0, "step": 14255 }, { "entropy": 5.545155954360962, "epoch": 1.409648082245947, "grad_norm": 0.953125, "learning_rate": 0.0004808176346604055, "loss": 5.0426, "mean_token_accuracy": 0.21436950266361238, "num_tokens": 32646143.0, "step": 14260 }, { "entropy": 5.6161463260650635, "epoch": 1.4101423487544484, "grad_norm": 0.97265625, "learning_rate": 0.0004808033738620419, "loss": 5.1202, "mean_token_accuracy": 0.2072610706090927, "num_tokens": 32658735.0, "step": 14265 }, { "entropy": 5.640415143966675, "epoch": 1.4106366152629497, "grad_norm": 0.95703125, "learning_rate": 0.00048078910800088327, "loss": 5.2441, "mean_token_accuracy": 0.1978023886680603, "num_tokens": 32669337.0, "step": 14270 }, { "entropy": 5.508010816574097, "epoch": 1.4111308817714512, "grad_norm": 1.0234375, "learning_rate": 0.0004807748370772807, "loss": 5.0191, "mean_token_accuracy": 0.21674203872680664, "num_tokens": 32680072.0, "step": 14275 }, { "entropy": 5.555899381637573, "epoch": 1.4116251482799527, "grad_norm": 0.92578125, "learning_rate": 0.00048076056109158525, "loss": 5.0957, "mean_token_accuracy": 0.20808195918798447, "num_tokens": 32691142.0, "step": 14280 }, { "entropy": 5.6028892517089846, "epoch": 1.412119414788454, "grad_norm": 1.046875, "learning_rate": 0.0004807462800441481, "loss": 5.1775, "mean_token_accuracy": 0.1953692376613617, "num_tokens": 32702482.0, "step": 14285 }, { "entropy": 5.606126928329468, "epoch": 1.4126136812969552, "grad_norm": 1.0078125, "learning_rate": 0.0004807319939353204, "loss": 5.1636, "mean_token_accuracy": 0.20177900195121765, "num_tokens": 32714456.0, "step": 14290 }, { "entropy": 5.660591650009155, "epoch": 1.4131079478054567, "grad_norm": 0.953125, "learning_rate": 0.00048071770276545377, "loss": 5.1106, "mean_token_accuracy": 0.20197918266057968, "num_tokens": 32726305.0, "step": 14295 }, { "entropy": 5.5134447574615475, "epoch": 1.4136022143139582, "grad_norm": 1.1796875, "learning_rate": 0.00048070340653489984, "loss": 5.0603, "mean_token_accuracy": 0.21183177828788757, "num_tokens": 32736446.0, "step": 14300 }, { "entropy": 5.57809886932373, "epoch": 1.4140964808224594, "grad_norm": 1.09375, "learning_rate": 0.00048068910524401014, "loss": 5.1163, "mean_token_accuracy": 0.19969252943992616, "num_tokens": 32746798.0, "step": 14305 }, { "entropy": 5.536451005935669, "epoch": 1.414590747330961, "grad_norm": 0.953125, "learning_rate": 0.00048067479889313654, "loss": 5.0319, "mean_token_accuracy": 0.2168815776705742, "num_tokens": 32758647.0, "step": 14310 }, { "entropy": 5.565265083312989, "epoch": 1.4150850138394622, "grad_norm": 0.921875, "learning_rate": 0.00048066048748263097, "loss": 5.1167, "mean_token_accuracy": 0.1991676703095436, "num_tokens": 32770759.0, "step": 14315 }, { "entropy": 5.574407958984375, "epoch": 1.4155792803479637, "grad_norm": 0.83203125, "learning_rate": 0.00048064617101284553, "loss": 5.1142, "mean_token_accuracy": 0.20958426147699355, "num_tokens": 32783398.0, "step": 14320 }, { "entropy": 5.610066890716553, "epoch": 1.416073546856465, "grad_norm": 1.03125, "learning_rate": 0.00048063184948413237, "loss": 5.1315, "mean_token_accuracy": 0.19772445410490036, "num_tokens": 32795995.0, "step": 14325 }, { "entropy": 5.622658681869507, "epoch": 1.4165678133649664, "grad_norm": 0.90234375, "learning_rate": 0.00048061752289684385, "loss": 5.2069, "mean_token_accuracy": 0.20061795711517333, "num_tokens": 32808700.0, "step": 14330 }, { "entropy": 5.640567874908447, "epoch": 1.4170620798734679, "grad_norm": 0.96875, "learning_rate": 0.0004806031912513323, "loss": 5.2577, "mean_token_accuracy": 0.19035998582839966, "num_tokens": 32820815.0, "step": 14335 }, { "entropy": 5.637482595443726, "epoch": 1.4175563463819691, "grad_norm": 0.98828125, "learning_rate": 0.00048058885454795036, "loss": 5.1315, "mean_token_accuracy": 0.20643416792154312, "num_tokens": 32832216.0, "step": 14340 }, { "entropy": 5.644298791885376, "epoch": 1.4180506128904704, "grad_norm": 0.94140625, "learning_rate": 0.0004805745127870508, "loss": 5.2111, "mean_token_accuracy": 0.19610102623701095, "num_tokens": 32845118.0, "step": 14345 }, { "entropy": 5.595463609695434, "epoch": 1.418544879398972, "grad_norm": 0.9375, "learning_rate": 0.0004805601659689862, "loss": 5.0678, "mean_token_accuracy": 0.20649533569812775, "num_tokens": 32855662.0, "step": 14350 }, { "entropy": 5.644955778121949, "epoch": 1.4190391459074734, "grad_norm": 1.0078125, "learning_rate": 0.0004805458140941097, "loss": 5.172, "mean_token_accuracy": 0.2101058229804039, "num_tokens": 32865530.0, "step": 14355 }, { "entropy": 5.630716991424561, "epoch": 1.4195334124159746, "grad_norm": 1.0078125, "learning_rate": 0.00048053145716277424, "loss": 5.17, "mean_token_accuracy": 0.19806827008724212, "num_tokens": 32877542.0, "step": 14360 }, { "entropy": 5.5259030818939205, "epoch": 1.4200276789244761, "grad_norm": 1.046875, "learning_rate": 0.0004805170951753331, "loss": 5.125, "mean_token_accuracy": 0.20362270027399063, "num_tokens": 32888197.0, "step": 14365 }, { "entropy": 5.614957714080811, "epoch": 1.4205219454329774, "grad_norm": 0.98046875, "learning_rate": 0.0004805027281321395, "loss": 5.1451, "mean_token_accuracy": 0.20157837569713594, "num_tokens": 32899633.0, "step": 14370 }, { "entropy": 5.559344339370727, "epoch": 1.4210162119414789, "grad_norm": 1.0078125, "learning_rate": 0.0004804883560335469, "loss": 5.0591, "mean_token_accuracy": 0.2114964708685875, "num_tokens": 32910334.0, "step": 14375 }, { "entropy": 5.619707155227661, "epoch": 1.4215104784499801, "grad_norm": 1.078125, "learning_rate": 0.0004804739788799089, "loss": 5.1713, "mean_token_accuracy": 0.20387066304683685, "num_tokens": 32920071.0, "step": 14380 }, { "entropy": 5.5429261207580565, "epoch": 1.4220047449584816, "grad_norm": 0.93359375, "learning_rate": 0.00048045959667157914, "loss": 5.1373, "mean_token_accuracy": 0.20551764219999313, "num_tokens": 32931391.0, "step": 14385 }, { "entropy": 5.602373790740967, "epoch": 1.422499011466983, "grad_norm": 0.99609375, "learning_rate": 0.0004804452094089114, "loss": 5.1268, "mean_token_accuracy": 0.2073552653193474, "num_tokens": 32941831.0, "step": 14390 }, { "entropy": 5.589983749389648, "epoch": 1.4229932779754844, "grad_norm": 1.0078125, "learning_rate": 0.0004804308170922597, "loss": 5.0958, "mean_token_accuracy": 0.20801131874322892, "num_tokens": 32952949.0, "step": 14395 }, { "entropy": 5.635107088088989, "epoch": 1.4234875444839858, "grad_norm": 0.94921875, "learning_rate": 0.0004804164197219779, "loss": 5.2047, "mean_token_accuracy": 0.20269094705581664, "num_tokens": 32964411.0, "step": 14400 }, { "entropy": 5.65734076499939, "epoch": 1.423981810992487, "grad_norm": 0.98828125, "learning_rate": 0.0004804020172984204, "loss": 5.1564, "mean_token_accuracy": 0.20408105254173278, "num_tokens": 32975484.0, "step": 14405 }, { "entropy": 5.5482001304626465, "epoch": 1.4244760775009886, "grad_norm": 0.99609375, "learning_rate": 0.00048038760982194135, "loss": 5.0522, "mean_token_accuracy": 0.2068314492702484, "num_tokens": 32986691.0, "step": 14410 }, { "entropy": 5.57398943901062, "epoch": 1.4249703440094899, "grad_norm": 1.015625, "learning_rate": 0.0004803731972928954, "loss": 5.0756, "mean_token_accuracy": 0.2049403190612793, "num_tokens": 32998357.0, "step": 14415 }, { "entropy": 5.6058375358581545, "epoch": 1.4254646105179913, "grad_norm": 1.046875, "learning_rate": 0.00048035877971163674, "loss": 5.1493, "mean_token_accuracy": 0.20710208863019944, "num_tokens": 33009451.0, "step": 14420 }, { "entropy": 5.530548477172852, "epoch": 1.4259588770264928, "grad_norm": 0.9921875, "learning_rate": 0.0004803443570785203, "loss": 5.029, "mean_token_accuracy": 0.20898120999336242, "num_tokens": 33020143.0, "step": 14425 }, { "entropy": 5.535151529312134, "epoch": 1.426453143534994, "grad_norm": 1.046875, "learning_rate": 0.00048032992939390086, "loss": 5.0562, "mean_token_accuracy": 0.21383255571126938, "num_tokens": 33031448.0, "step": 14430 }, { "entropy": 5.636341571807861, "epoch": 1.4269474100434953, "grad_norm": 1.0234375, "learning_rate": 0.0004803154966581333, "loss": 5.1383, "mean_token_accuracy": 0.19828444570302964, "num_tokens": 33041545.0, "step": 14435 }, { "entropy": 5.577327823638916, "epoch": 1.4274416765519968, "grad_norm": 1.1328125, "learning_rate": 0.00048030105887157253, "loss": 5.1131, "mean_token_accuracy": 0.21114211529493332, "num_tokens": 33051681.0, "step": 14440 }, { "entropy": 5.631502389907837, "epoch": 1.4279359430604983, "grad_norm": 1.1171875, "learning_rate": 0.00048028661603457406, "loss": 5.1506, "mean_token_accuracy": 0.2001531094312668, "num_tokens": 33062735.0, "step": 14445 }, { "entropy": 5.557105493545532, "epoch": 1.4284302095689996, "grad_norm": 0.98046875, "learning_rate": 0.0004802721681474929, "loss": 5.0095, "mean_token_accuracy": 0.2185020312666893, "num_tokens": 33073975.0, "step": 14450 }, { "entropy": 5.5602278232574465, "epoch": 1.428924476077501, "grad_norm": 0.9140625, "learning_rate": 0.00048025771521068456, "loss": 5.1183, "mean_token_accuracy": 0.2084380194544792, "num_tokens": 33086928.0, "step": 14455 }, { "entropy": 5.640581798553467, "epoch": 1.4294187425860023, "grad_norm": 1.015625, "learning_rate": 0.00048024325722450454, "loss": 5.2393, "mean_token_accuracy": 0.20353354066610335, "num_tokens": 33099073.0, "step": 14460 }, { "entropy": 5.6720281600952145, "epoch": 1.4299130090945038, "grad_norm": 1.03125, "learning_rate": 0.0004802287941893087, "loss": 5.123, "mean_token_accuracy": 0.1990273430943489, "num_tokens": 33110245.0, "step": 14465 }, { "entropy": 5.592381143569947, "epoch": 1.430407275603005, "grad_norm": 0.9609375, "learning_rate": 0.0004802143261054525, "loss": 5.0895, "mean_token_accuracy": 0.20516822338104249, "num_tokens": 33121659.0, "step": 14470 }, { "entropy": 5.5609043598175045, "epoch": 1.4309015421115066, "grad_norm": 0.94140625, "learning_rate": 0.00048019985297329215, "loss": 5.1549, "mean_token_accuracy": 0.20569676607847215, "num_tokens": 33133296.0, "step": 14475 }, { "entropy": 5.560083627700806, "epoch": 1.431395808620008, "grad_norm": 0.93359375, "learning_rate": 0.0004801853747931836, "loss": 5.1815, "mean_token_accuracy": 0.20165218114852906, "num_tokens": 33145069.0, "step": 14480 }, { "entropy": 5.627783203125, "epoch": 1.4318900751285093, "grad_norm": 0.91015625, "learning_rate": 0.00048017089156548293, "loss": 5.1829, "mean_token_accuracy": 0.20199788063764573, "num_tokens": 33156089.0, "step": 14485 }, { "entropy": 5.647008657455444, "epoch": 1.4323843416370106, "grad_norm": 1.0, "learning_rate": 0.00048015640329054655, "loss": 5.1367, "mean_token_accuracy": 0.2043985679745674, "num_tokens": 33168300.0, "step": 14490 }, { "entropy": 5.565287256240845, "epoch": 1.432878608145512, "grad_norm": 1.0546875, "learning_rate": 0.00048014190996873075, "loss": 5.0295, "mean_token_accuracy": 0.21683679074048995, "num_tokens": 33179072.0, "step": 14495 }, { "entropy": 5.56313533782959, "epoch": 1.4333728746540135, "grad_norm": 0.99609375, "learning_rate": 0.00048012741160039223, "loss": 5.0824, "mean_token_accuracy": 0.20361751168966294, "num_tokens": 33190888.0, "step": 14500 }, { "entropy": 5.569019937515259, "epoch": 1.4338671411625148, "grad_norm": 0.98046875, "learning_rate": 0.0004801129081858875, "loss": 5.195, "mean_token_accuracy": 0.2022333025932312, "num_tokens": 33202747.0, "step": 14505 }, { "entropy": 5.639850234985351, "epoch": 1.4343614076710163, "grad_norm": 1.0078125, "learning_rate": 0.0004800983997255735, "loss": 5.1501, "mean_token_accuracy": 0.20476438254117965, "num_tokens": 33213917.0, "step": 14510 }, { "entropy": 5.586275720596314, "epoch": 1.4348556741795175, "grad_norm": 0.94140625, "learning_rate": 0.0004800838862198069, "loss": 5.1085, "mean_token_accuracy": 0.20423994809389115, "num_tokens": 33223924.0, "step": 14515 }, { "entropy": 5.551578092575073, "epoch": 1.435349940688019, "grad_norm": 1.0390625, "learning_rate": 0.000480069367668945, "loss": 5.0455, "mean_token_accuracy": 0.2119969457387924, "num_tokens": 33234487.0, "step": 14520 }, { "entropy": 5.602804374694824, "epoch": 1.4358442071965203, "grad_norm": 0.94140625, "learning_rate": 0.00048005484407334474, "loss": 5.1513, "mean_token_accuracy": 0.20628963857889177, "num_tokens": 33245585.0, "step": 14525 }, { "entropy": 5.553240013122559, "epoch": 1.4363384737050218, "grad_norm": 1.046875, "learning_rate": 0.0004800403154333636, "loss": 5.0571, "mean_token_accuracy": 0.21174272894859314, "num_tokens": 33256545.0, "step": 14530 }, { "entropy": 5.558158922195434, "epoch": 1.4368327402135233, "grad_norm": 1.1484375, "learning_rate": 0.0004800257817493589, "loss": 5.0582, "mean_token_accuracy": 0.20693610608577728, "num_tokens": 33267946.0, "step": 14535 }, { "entropy": 5.584046411514282, "epoch": 1.4373270067220245, "grad_norm": 0.9921875, "learning_rate": 0.00048001124302168814, "loss": 5.0823, "mean_token_accuracy": 0.210135817527771, "num_tokens": 33279099.0, "step": 14540 }, { "entropy": 5.613927030563355, "epoch": 1.4378212732305258, "grad_norm": 0.98046875, "learning_rate": 0.0004799966992507089, "loss": 5.1684, "mean_token_accuracy": 0.1972101718187332, "num_tokens": 33290544.0, "step": 14545 }, { "entropy": 5.571719360351563, "epoch": 1.4383155397390273, "grad_norm": 0.890625, "learning_rate": 0.00047998215043677914, "loss": 5.0237, "mean_token_accuracy": 0.21293942779302596, "num_tokens": 33302317.0, "step": 14550 }, { "entropy": 5.5433272361755375, "epoch": 1.4388098062475287, "grad_norm": 1.03125, "learning_rate": 0.0004799675965802567, "loss": 5.0799, "mean_token_accuracy": 0.2101183369755745, "num_tokens": 33313553.0, "step": 14555 }, { "entropy": 5.601527976989746, "epoch": 1.43930407275603, "grad_norm": 1.109375, "learning_rate": 0.00047995303768149955, "loss": 5.123, "mean_token_accuracy": 0.20429352074861526, "num_tokens": 33324610.0, "step": 14560 }, { "entropy": 5.5564107418060305, "epoch": 1.4397983392645315, "grad_norm": 1.0, "learning_rate": 0.0004799384737408659, "loss": 5.1162, "mean_token_accuracy": 0.20734917521476745, "num_tokens": 33335562.0, "step": 14565 }, { "entropy": 5.650315666198731, "epoch": 1.4402926057730328, "grad_norm": 0.9609375, "learning_rate": 0.00047992390475871396, "loss": 5.242, "mean_token_accuracy": 0.1945175439119339, "num_tokens": 33346778.0, "step": 14570 }, { "entropy": 5.600090551376343, "epoch": 1.4407868722815342, "grad_norm": 1.0390625, "learning_rate": 0.0004799093307354022, "loss": 5.1052, "mean_token_accuracy": 0.19611312448978424, "num_tokens": 33358712.0, "step": 14575 }, { "entropy": 5.592860889434815, "epoch": 1.4412811387900355, "grad_norm": 0.9921875, "learning_rate": 0.0004798947516712891, "loss": 5.1434, "mean_token_accuracy": 0.20113486498594285, "num_tokens": 33369293.0, "step": 14580 }, { "entropy": 5.643382930755616, "epoch": 1.441775405298537, "grad_norm": 0.91015625, "learning_rate": 0.00047988016756673335, "loss": 5.2111, "mean_token_accuracy": 0.19852956235408784, "num_tokens": 33383119.0, "step": 14585 }, { "entropy": 5.612777900695801, "epoch": 1.4422696718070385, "grad_norm": 1.0546875, "learning_rate": 0.0004798655784220937, "loss": 5.1108, "mean_token_accuracy": 0.20618600100278855, "num_tokens": 33395334.0, "step": 14590 }, { "entropy": 5.49222149848938, "epoch": 1.4427639383155397, "grad_norm": 0.96875, "learning_rate": 0.000479850984237729, "loss": 5.0322, "mean_token_accuracy": 0.2156323790550232, "num_tokens": 33406676.0, "step": 14595 }, { "entropy": 5.6671092987060545, "epoch": 1.443258204824041, "grad_norm": 0.9453125, "learning_rate": 0.0004798363850139983, "loss": 5.1578, "mean_token_accuracy": 0.19988797307014466, "num_tokens": 33419153.0, "step": 14600 }, { "entropy": 5.614649438858033, "epoch": 1.4437524713325425, "grad_norm": 1.0234375, "learning_rate": 0.0004798217807512608, "loss": 5.0556, "mean_token_accuracy": 0.20980203449726104, "num_tokens": 33430146.0, "step": 14605 }, { "entropy": 5.5850225448608395, "epoch": 1.444246737841044, "grad_norm": 1.0, "learning_rate": 0.00047980717144987574, "loss": 5.2097, "mean_token_accuracy": 0.1948772057890892, "num_tokens": 33441484.0, "step": 14610 }, { "entropy": 5.583469104766846, "epoch": 1.4447410043495452, "grad_norm": 1.0, "learning_rate": 0.00047979255711020236, "loss": 5.0414, "mean_token_accuracy": 0.2077420249581337, "num_tokens": 33451817.0, "step": 14615 }, { "entropy": 5.5805628299713135, "epoch": 1.4452352708580467, "grad_norm": 0.859375, "learning_rate": 0.0004797779377326004, "loss": 5.1427, "mean_token_accuracy": 0.20613541454076767, "num_tokens": 33463805.0, "step": 14620 }, { "entropy": 5.624154996871948, "epoch": 1.445729537366548, "grad_norm": 0.9609375, "learning_rate": 0.0004797633133174295, "loss": 5.1602, "mean_token_accuracy": 0.19528581947088242, "num_tokens": 33475931.0, "step": 14625 }, { "entropy": 5.601310157775879, "epoch": 1.4462238038750495, "grad_norm": 1.0546875, "learning_rate": 0.0004797486838650491, "loss": 5.0861, "mean_token_accuracy": 0.20230776220560073, "num_tokens": 33487306.0, "step": 14630 }, { "entropy": 5.5519733905792235, "epoch": 1.4467180703835507, "grad_norm": 0.96484375, "learning_rate": 0.0004797340493758195, "loss": 5.1237, "mean_token_accuracy": 0.2037101313471794, "num_tokens": 33499049.0, "step": 14635 }, { "entropy": 5.572856187820435, "epoch": 1.4472123368920522, "grad_norm": 0.9296875, "learning_rate": 0.0004797194098501004, "loss": 5.1167, "mean_token_accuracy": 0.20904998630285263, "num_tokens": 33509626.0, "step": 14640 }, { "entropy": 5.595196056365967, "epoch": 1.4477066034005537, "grad_norm": 0.94921875, "learning_rate": 0.0004797047652882521, "loss": 5.1643, "mean_token_accuracy": 0.19892482608556747, "num_tokens": 33521510.0, "step": 14645 }, { "entropy": 5.587060451507568, "epoch": 1.448200869909055, "grad_norm": 1.0078125, "learning_rate": 0.00047969011569063487, "loss": 5.1035, "mean_token_accuracy": 0.20494761914014817, "num_tokens": 33532622.0, "step": 14650 }, { "entropy": 5.533398103713989, "epoch": 1.4486951364175564, "grad_norm": 1.0078125, "learning_rate": 0.0004796754610576091, "loss": 5.0755, "mean_token_accuracy": 0.21466957330703734, "num_tokens": 33544196.0, "step": 14655 }, { "entropy": 5.668496751785279, "epoch": 1.4491894029260577, "grad_norm": 1.0234375, "learning_rate": 0.00047966080138953505, "loss": 5.1637, "mean_token_accuracy": 0.19850323349237442, "num_tokens": 33554927.0, "step": 14660 }, { "entropy": 5.631568479537964, "epoch": 1.4496836694345592, "grad_norm": 0.94140625, "learning_rate": 0.0004796461366867736, "loss": 5.1884, "mean_token_accuracy": 0.1946538656949997, "num_tokens": 33566412.0, "step": 14665 }, { "entropy": 5.523201990127563, "epoch": 1.4501779359430604, "grad_norm": 0.9609375, "learning_rate": 0.00047963146694968546, "loss": 5.091, "mean_token_accuracy": 0.2084333047270775, "num_tokens": 33578010.0, "step": 14670 }, { "entropy": 5.630752277374268, "epoch": 1.450672202451562, "grad_norm": 0.94140625, "learning_rate": 0.0004796167921786315, "loss": 5.1912, "mean_token_accuracy": 0.2006404146552086, "num_tokens": 33589647.0, "step": 14675 }, { "entropy": 5.682182264328003, "epoch": 1.4511664689600634, "grad_norm": 0.94921875, "learning_rate": 0.00047960211237397274, "loss": 5.2923, "mean_token_accuracy": 0.19204577058553696, "num_tokens": 33601292.0, "step": 14680 }, { "entropy": 5.652890014648437, "epoch": 1.4516607354685647, "grad_norm": 1.0703125, "learning_rate": 0.00047958742753607015, "loss": 5.127, "mean_token_accuracy": 0.20548514574766158, "num_tokens": 33612878.0, "step": 14685 }, { "entropy": 5.589878797531128, "epoch": 1.452155001977066, "grad_norm": 1.0234375, "learning_rate": 0.00047957273766528524, "loss": 5.125, "mean_token_accuracy": 0.20926111787557602, "num_tokens": 33625680.0, "step": 14690 }, { "entropy": 5.541853666305542, "epoch": 1.4526492684855674, "grad_norm": 1.0546875, "learning_rate": 0.0004795580427619791, "loss": 5.0706, "mean_token_accuracy": 0.20874421894550324, "num_tokens": 33637066.0, "step": 14695 }, { "entropy": 5.637106800079346, "epoch": 1.453143534994069, "grad_norm": 1.0, "learning_rate": 0.00047954334282651357, "loss": 5.2291, "mean_token_accuracy": 0.19504000693559648, "num_tokens": 33648213.0, "step": 14700 }, { "entropy": 5.651402759552002, "epoch": 1.4536378015025702, "grad_norm": 1.03125, "learning_rate": 0.0004795286378592499, "loss": 5.0764, "mean_token_accuracy": 0.20746127963066102, "num_tokens": 33661582.0, "step": 14705 }, { "entropy": 5.546464967727661, "epoch": 1.4541320680110716, "grad_norm": 0.95703125, "learning_rate": 0.0004795139278605501, "loss": 5.0664, "mean_token_accuracy": 0.20918658524751663, "num_tokens": 33673122.0, "step": 14710 }, { "entropy": 5.613947629928589, "epoch": 1.454626334519573, "grad_norm": 0.98046875, "learning_rate": 0.00047949921283077594, "loss": 5.0812, "mean_token_accuracy": 0.21068439781665801, "num_tokens": 33683926.0, "step": 14715 }, { "entropy": 5.602988243103027, "epoch": 1.4551206010280744, "grad_norm": 1.0234375, "learning_rate": 0.0004794844927702894, "loss": 5.1406, "mean_token_accuracy": 0.2063300848007202, "num_tokens": 33694529.0, "step": 14720 }, { "entropy": 5.62349500656128, "epoch": 1.4556148675365757, "grad_norm": 0.98828125, "learning_rate": 0.0004794697676794526, "loss": 5.1415, "mean_token_accuracy": 0.20532698184251785, "num_tokens": 33704618.0, "step": 14725 }, { "entropy": 5.557535028457641, "epoch": 1.4561091340450771, "grad_norm": 0.98828125, "learning_rate": 0.0004794550375586278, "loss": 5.0863, "mean_token_accuracy": 0.2060876101255417, "num_tokens": 33716354.0, "step": 14730 }, { "entropy": 5.543170642852783, "epoch": 1.4566034005535786, "grad_norm": 1.0625, "learning_rate": 0.0004794403024081774, "loss": 5.0543, "mean_token_accuracy": 0.21683259308338165, "num_tokens": 33728065.0, "step": 14735 }, { "entropy": 5.600379705429077, "epoch": 1.4570976670620799, "grad_norm": 0.89453125, "learning_rate": 0.0004794255622284638, "loss": 5.1463, "mean_token_accuracy": 0.202919340133667, "num_tokens": 33740207.0, "step": 14740 }, { "entropy": 5.63071231842041, "epoch": 1.4575919335705811, "grad_norm": 1.0, "learning_rate": 0.00047941081701984966, "loss": 5.1051, "mean_token_accuracy": 0.2023481771349907, "num_tokens": 33750768.0, "step": 14745 }, { "entropy": 5.58841233253479, "epoch": 1.4580862000790826, "grad_norm": 1.015625, "learning_rate": 0.00047939606678269774, "loss": 5.153, "mean_token_accuracy": 0.20421906411647797, "num_tokens": 33762029.0, "step": 14750 }, { "entropy": 5.546151733398437, "epoch": 1.4585804665875841, "grad_norm": 1.0234375, "learning_rate": 0.0004793813115173708, "loss": 5.0564, "mean_token_accuracy": 0.21054989993572235, "num_tokens": 33773483.0, "step": 14755 }, { "entropy": 5.594829463958741, "epoch": 1.4590747330960854, "grad_norm": 0.97265625, "learning_rate": 0.000479366551224232, "loss": 5.0998, "mean_token_accuracy": 0.20779649317264556, "num_tokens": 33784404.0, "step": 14760 }, { "entropy": 5.545187902450562, "epoch": 1.4595689996045869, "grad_norm": 1.046875, "learning_rate": 0.0004793517859036443, "loss": 5.0938, "mean_token_accuracy": 0.20755717307329177, "num_tokens": 33794625.0, "step": 14765 }, { "entropy": 5.60964183807373, "epoch": 1.4600632661130881, "grad_norm": 0.97265625, "learning_rate": 0.0004793370155559709, "loss": 5.1388, "mean_token_accuracy": 0.2010847106575966, "num_tokens": 33805872.0, "step": 14770 }, { "entropy": 5.532442378997803, "epoch": 1.4605575326215896, "grad_norm": 1.0078125, "learning_rate": 0.0004793222401815753, "loss": 4.992, "mean_token_accuracy": 0.22140320241451264, "num_tokens": 33815979.0, "step": 14775 }, { "entropy": 5.602110052108765, "epoch": 1.4610517991300909, "grad_norm": 0.9921875, "learning_rate": 0.0004793074597808208, "loss": 5.1599, "mean_token_accuracy": 0.20558698177337648, "num_tokens": 33827571.0, "step": 14780 }, { "entropy": 5.567653036117553, "epoch": 1.4615460656385924, "grad_norm": 0.98046875, "learning_rate": 0.00047929267435407115, "loss": 5.1318, "mean_token_accuracy": 0.20100756585597992, "num_tokens": 33838749.0, "step": 14785 }, { "entropy": 5.591733169555664, "epoch": 1.4620403321470938, "grad_norm": 0.97265625, "learning_rate": 0.00047927788390168997, "loss": 5.1396, "mean_token_accuracy": 0.20111843049526215, "num_tokens": 33849494.0, "step": 14790 }, { "entropy": 5.698034715652466, "epoch": 1.462534598655595, "grad_norm": 1.0078125, "learning_rate": 0.00047926308842404126, "loss": 5.1657, "mean_token_accuracy": 0.20221199244260787, "num_tokens": 33860586.0, "step": 14795 }, { "entropy": 5.530745649337769, "epoch": 1.4630288651640964, "grad_norm": 1.015625, "learning_rate": 0.0004792482879214888, "loss": 4.9504, "mean_token_accuracy": 0.2205275908112526, "num_tokens": 33871261.0, "step": 14800 }, { "entropy": 5.5544657707214355, "epoch": 1.4635231316725978, "grad_norm": 0.92578125, "learning_rate": 0.0004792334823943968, "loss": 5.0958, "mean_token_accuracy": 0.215969717502594, "num_tokens": 33883160.0, "step": 14805 }, { "entropy": 5.619077205657959, "epoch": 1.4640173981810993, "grad_norm": 0.98046875, "learning_rate": 0.0004792186718431294, "loss": 5.107, "mean_token_accuracy": 0.2062859833240509, "num_tokens": 33894250.0, "step": 14810 }, { "entropy": 5.55985836982727, "epoch": 1.4645116646896006, "grad_norm": 1.0, "learning_rate": 0.000479203856268051, "loss": 5.1083, "mean_token_accuracy": 0.2019595444202423, "num_tokens": 33905076.0, "step": 14815 }, { "entropy": 5.522359991073609, "epoch": 1.465005931198102, "grad_norm": 0.87109375, "learning_rate": 0.0004791890356695261, "loss": 5.1005, "mean_token_accuracy": 0.2061929225921631, "num_tokens": 33916982.0, "step": 14820 }, { "entropy": 5.630420827865601, "epoch": 1.4655001977066033, "grad_norm": 0.9375, "learning_rate": 0.0004791742100479193, "loss": 5.1676, "mean_token_accuracy": 0.20324736535549165, "num_tokens": 33928306.0, "step": 14825 }, { "entropy": 5.672866439819336, "epoch": 1.4659944642151048, "grad_norm": 0.86328125, "learning_rate": 0.0004791593794035952, "loss": 5.2034, "mean_token_accuracy": 0.20117881000041962, "num_tokens": 33940371.0, "step": 14830 }, { "entropy": 5.633200645446777, "epoch": 1.466488730723606, "grad_norm": 0.984375, "learning_rate": 0.0004791445437369187, "loss": 5.144, "mean_token_accuracy": 0.19709588438272477, "num_tokens": 33952250.0, "step": 14835 }, { "entropy": 5.6444504737854, "epoch": 1.4669829972321076, "grad_norm": 1.015625, "learning_rate": 0.0004791297030482547, "loss": 5.1113, "mean_token_accuracy": 0.20840838253498079, "num_tokens": 33963426.0, "step": 14840 }, { "entropy": 5.594843244552612, "epoch": 1.467477263740609, "grad_norm": 1.046875, "learning_rate": 0.0004791148573379684, "loss": 5.1111, "mean_token_accuracy": 0.19798390567302704, "num_tokens": 33974982.0, "step": 14845 }, { "entropy": 5.539167022705078, "epoch": 1.4679715302491103, "grad_norm": 0.95703125, "learning_rate": 0.00047910000660642487, "loss": 5.115, "mean_token_accuracy": 0.20622110664844512, "num_tokens": 33986413.0, "step": 14850 }, { "entropy": 5.606750774383545, "epoch": 1.4684657967576116, "grad_norm": 1.0390625, "learning_rate": 0.0004790851508539896, "loss": 5.0445, "mean_token_accuracy": 0.20845042616128923, "num_tokens": 33996821.0, "step": 14855 }, { "entropy": 5.6117254257202145, "epoch": 1.468960063266113, "grad_norm": 0.9921875, "learning_rate": 0.0004790702900810279, "loss": 5.108, "mean_token_accuracy": 0.20392974764108657, "num_tokens": 34008817.0, "step": 14860 }, { "entropy": 5.534069633483886, "epoch": 1.4694543297746145, "grad_norm": 0.98828125, "learning_rate": 0.00047905542428790536, "loss": 5.1274, "mean_token_accuracy": 0.2096110224723816, "num_tokens": 34020051.0, "step": 14865 }, { "entropy": 5.540973472595215, "epoch": 1.4699485962831158, "grad_norm": 1.0234375, "learning_rate": 0.0004790405534749878, "loss": 5.047, "mean_token_accuracy": 0.2154317244887352, "num_tokens": 34032764.0, "step": 14870 }, { "entropy": 5.612771224975586, "epoch": 1.4704428627916173, "grad_norm": 1.09375, "learning_rate": 0.000479025677642641, "loss": 5.1358, "mean_token_accuracy": 0.2030294194817543, "num_tokens": 34042868.0, "step": 14875 }, { "entropy": 5.617785453796387, "epoch": 1.4709371293001186, "grad_norm": 0.93359375, "learning_rate": 0.0004790107967912309, "loss": 5.1514, "mean_token_accuracy": 0.21039071828126907, "num_tokens": 34054807.0, "step": 14880 }, { "entropy": 5.632265233993531, "epoch": 1.47143139580862, "grad_norm": 0.9140625, "learning_rate": 0.00047899591092112343, "loss": 5.1739, "mean_token_accuracy": 0.20067447423934937, "num_tokens": 34066378.0, "step": 14885 }, { "entropy": 5.597336101531982, "epoch": 1.4719256623171213, "grad_norm": 1.0390625, "learning_rate": 0.000478981020032685, "loss": 5.1495, "mean_token_accuracy": 0.19735126197338104, "num_tokens": 34078267.0, "step": 14890 }, { "entropy": 5.57458758354187, "epoch": 1.4724199288256228, "grad_norm": 1.0078125, "learning_rate": 0.00047896612412628184, "loss": 5.1659, "mean_token_accuracy": 0.19533201605081557, "num_tokens": 34090356.0, "step": 14895 }, { "entropy": 5.62639856338501, "epoch": 1.4729141953341243, "grad_norm": 1.046875, "learning_rate": 0.00047895122320228026, "loss": 5.1007, "mean_token_accuracy": 0.20886988192796707, "num_tokens": 34101143.0, "step": 14900 }, { "entropy": 5.604722929000855, "epoch": 1.4734084618426255, "grad_norm": 1.0546875, "learning_rate": 0.00047893631726104703, "loss": 5.1074, "mean_token_accuracy": 0.2079416796565056, "num_tokens": 34112655.0, "step": 14905 }, { "entropy": 5.597968864440918, "epoch": 1.4739027283511268, "grad_norm": 0.9921875, "learning_rate": 0.0004789214063029488, "loss": 5.1318, "mean_token_accuracy": 0.20654098838567733, "num_tokens": 34123825.0, "step": 14910 }, { "entropy": 5.587929582595825, "epoch": 1.4743969948596283, "grad_norm": 1.09375, "learning_rate": 0.00047890649032835233, "loss": 5.1091, "mean_token_accuracy": 0.2053328961133957, "num_tokens": 34135416.0, "step": 14915 }, { "entropy": 5.641332578659058, "epoch": 1.4748912613681298, "grad_norm": 1.046875, "learning_rate": 0.0004788915693376245, "loss": 5.171, "mean_token_accuracy": 0.2032747134566307, "num_tokens": 34146797.0, "step": 14920 }, { "entropy": 5.617080020904541, "epoch": 1.475385527876631, "grad_norm": 1.0, "learning_rate": 0.00047887664333113244, "loss": 5.1885, "mean_token_accuracy": 0.19729799926280975, "num_tokens": 34158749.0, "step": 14925 }, { "entropy": 5.597067785263062, "epoch": 1.4758797943851325, "grad_norm": 1.0, "learning_rate": 0.0004788617123092434, "loss": 5.0628, "mean_token_accuracy": 0.20963310748338698, "num_tokens": 34169694.0, "step": 14930 }, { "entropy": 5.63031005859375, "epoch": 1.4763740608936338, "grad_norm": 0.96484375, "learning_rate": 0.0004788467762723245, "loss": 5.1627, "mean_token_accuracy": 0.202209410071373, "num_tokens": 34182166.0, "step": 14935 }, { "entropy": 5.611075210571289, "epoch": 1.4768683274021353, "grad_norm": 0.9765625, "learning_rate": 0.00047883183522074335, "loss": 5.0675, "mean_token_accuracy": 0.21033567637205125, "num_tokens": 34193651.0, "step": 14940 }, { "entropy": 5.643792629241943, "epoch": 1.4773625939106365, "grad_norm": 0.98046875, "learning_rate": 0.00047881688915486743, "loss": 5.2008, "mean_token_accuracy": 0.19561796635389328, "num_tokens": 34204173.0, "step": 14945 }, { "entropy": 5.552393054962158, "epoch": 1.477856860419138, "grad_norm": 0.96875, "learning_rate": 0.00047880193807506446, "loss": 5.1064, "mean_token_accuracy": 0.21321081817150117, "num_tokens": 34214872.0, "step": 14950 }, { "entropy": 5.6048074722290036, "epoch": 1.4783511269276395, "grad_norm": 1.03125, "learning_rate": 0.0004787869819817021, "loss": 5.0846, "mean_token_accuracy": 0.20981544703245164, "num_tokens": 34226433.0, "step": 14955 }, { "entropy": 5.585325860977173, "epoch": 1.4788453934361407, "grad_norm": 1.0703125, "learning_rate": 0.00047877202087514843, "loss": 5.1238, "mean_token_accuracy": 0.20873614251613617, "num_tokens": 34238047.0, "step": 14960 }, { "entropy": 5.577543449401856, "epoch": 1.4793396599446422, "grad_norm": 0.96875, "learning_rate": 0.0004787570547557715, "loss": 5.1519, "mean_token_accuracy": 0.20469194501638413, "num_tokens": 34250445.0, "step": 14965 }, { "entropy": 5.59612455368042, "epoch": 1.4798339264531435, "grad_norm": 1.0234375, "learning_rate": 0.00047874208362393925, "loss": 5.0246, "mean_token_accuracy": 0.21233244836330414, "num_tokens": 34261324.0, "step": 14970 }, { "entropy": 5.6003881931304935, "epoch": 1.480328192961645, "grad_norm": 1.0234375, "learning_rate": 0.00047872710748002024, "loss": 5.1285, "mean_token_accuracy": 0.20707152932882308, "num_tokens": 34272074.0, "step": 14975 }, { "entropy": 5.580270481109619, "epoch": 1.4808224594701462, "grad_norm": 0.9453125, "learning_rate": 0.0004787121263243827, "loss": 5.1168, "mean_token_accuracy": 0.199481064081192, "num_tokens": 34282958.0, "step": 14980 }, { "entropy": 5.593789196014404, "epoch": 1.4813167259786477, "grad_norm": 0.94921875, "learning_rate": 0.00047869714015739533, "loss": 5.0257, "mean_token_accuracy": 0.21420324593782425, "num_tokens": 34294999.0, "step": 14985 }, { "entropy": 5.604766321182251, "epoch": 1.4818109924871492, "grad_norm": 1.015625, "learning_rate": 0.00047868214897942675, "loss": 5.0992, "mean_token_accuracy": 0.20462840795516968, "num_tokens": 34305363.0, "step": 14990 }, { "entropy": 5.577491903305054, "epoch": 1.4823052589956505, "grad_norm": 0.99609375, "learning_rate": 0.0004786671527908456, "loss": 5.1727, "mean_token_accuracy": 0.20442317873239518, "num_tokens": 34317467.0, "step": 14995 }, { "entropy": 5.647814130783081, "epoch": 1.4827995255041517, "grad_norm": 0.97265625, "learning_rate": 0.000478652151592021, "loss": 5.1876, "mean_token_accuracy": 0.2012948751449585, "num_tokens": 34331058.0, "step": 15000 }, { "epoch": 1.4827995255041517, "eval_entropy": 5.374528445939443, "eval_loss": 5.156564235687256, "eval_mean_token_accuracy": 0.2119281252646798, "eval_num_tokens": 34331058.0, "eval_runtime": 20.4655, "eval_samples_per_second": 1588.672, "eval_steps_per_second": 198.627, "step": 15000 }, { "entropy": 5.608012866973877, "epoch": 1.4832937920126532, "grad_norm": 1.0546875, "learning_rate": 0.0004786371453833217, "loss": 5.1653, "mean_token_accuracy": 0.20194438695907593, "num_tokens": 34342593.0, "step": 15005 }, { "entropy": 5.608504581451416, "epoch": 1.4837880585211547, "grad_norm": 0.98046875, "learning_rate": 0.00047862213416511717, "loss": 5.1468, "mean_token_accuracy": 0.20769520998001098, "num_tokens": 34353507.0, "step": 15010 }, { "entropy": 5.499923801422119, "epoch": 1.484282325029656, "grad_norm": 0.92578125, "learning_rate": 0.0004786071179377766, "loss": 5.0322, "mean_token_accuracy": 0.2163454160094261, "num_tokens": 34365606.0, "step": 15015 }, { "entropy": 5.601342964172363, "epoch": 1.4847765915381574, "grad_norm": 0.97265625, "learning_rate": 0.0004785920967016692, "loss": 5.0837, "mean_token_accuracy": 0.20447224080562593, "num_tokens": 34375925.0, "step": 15020 }, { "entropy": 5.666055917739868, "epoch": 1.4852708580466587, "grad_norm": 0.98828125, "learning_rate": 0.00047857707045716473, "loss": 5.1739, "mean_token_accuracy": 0.2010725647211075, "num_tokens": 34387806.0, "step": 15025 }, { "entropy": 5.530684566497802, "epoch": 1.4857651245551602, "grad_norm": 0.97265625, "learning_rate": 0.00047856203920463273, "loss": 5.0008, "mean_token_accuracy": 0.2178072839975357, "num_tokens": 34400367.0, "step": 15030 }, { "entropy": 5.565196180343628, "epoch": 1.4862593910636615, "grad_norm": 0.9921875, "learning_rate": 0.000478547002944443, "loss": 5.113, "mean_token_accuracy": 0.20943034291267396, "num_tokens": 34412082.0, "step": 15035 }, { "entropy": 5.574523639678955, "epoch": 1.486753657572163, "grad_norm": 1.0, "learning_rate": 0.0004785319616769654, "loss": 5.0707, "mean_token_accuracy": 0.21591333001852037, "num_tokens": 34423315.0, "step": 15040 }, { "entropy": 5.579007911682129, "epoch": 1.4872479240806644, "grad_norm": 1.0, "learning_rate": 0.00047851691540256995, "loss": 5.0982, "mean_token_accuracy": 0.20285159200429917, "num_tokens": 34433748.0, "step": 15045 }, { "entropy": 5.563244724273682, "epoch": 1.4877421905891657, "grad_norm": 1.09375, "learning_rate": 0.00047850186412162684, "loss": 5.0605, "mean_token_accuracy": 0.20703905522823335, "num_tokens": 34444425.0, "step": 15050 }, { "entropy": 5.614755868911743, "epoch": 1.488236457097667, "grad_norm": 1.0234375, "learning_rate": 0.0004784868078345063, "loss": 5.1123, "mean_token_accuracy": 0.20629175007343292, "num_tokens": 34456350.0, "step": 15055 }, { "entropy": 5.6227093696594235, "epoch": 1.4887307236061684, "grad_norm": 1.0078125, "learning_rate": 0.0004784717465415787, "loss": 5.185, "mean_token_accuracy": 0.20383018553256987, "num_tokens": 34466606.0, "step": 15060 }, { "entropy": 5.627015542984009, "epoch": 1.48922499011467, "grad_norm": 0.93359375, "learning_rate": 0.00047845668024321455, "loss": 5.1003, "mean_token_accuracy": 0.1992869794368744, "num_tokens": 34478085.0, "step": 15065 }, { "entropy": 5.614677667617798, "epoch": 1.4897192566231712, "grad_norm": 1.4609375, "learning_rate": 0.0004784416089397846, "loss": 5.2026, "mean_token_accuracy": 0.20405098050832748, "num_tokens": 34488437.0, "step": 15070 }, { "entropy": 5.634267950057984, "epoch": 1.4902135231316727, "grad_norm": 1.0, "learning_rate": 0.0004784265326316594, "loss": 5.1064, "mean_token_accuracy": 0.20310512632131578, "num_tokens": 34499999.0, "step": 15075 }, { "entropy": 5.651707649230957, "epoch": 1.490707789640174, "grad_norm": 1.09375, "learning_rate": 0.00047841145131921, "loss": 5.1584, "mean_token_accuracy": 0.2089346706867218, "num_tokens": 34510509.0, "step": 15080 }, { "entropy": 5.618706178665161, "epoch": 1.4912020561486754, "grad_norm": 0.96875, "learning_rate": 0.00047839636500280724, "loss": 5.1373, "mean_token_accuracy": 0.20086116343736649, "num_tokens": 34521192.0, "step": 15085 }, { "entropy": 5.627463483810425, "epoch": 1.4916963226571767, "grad_norm": 1.0625, "learning_rate": 0.0004783812736828225, "loss": 5.1241, "mean_token_accuracy": 0.2050002783536911, "num_tokens": 34532401.0, "step": 15090 }, { "entropy": 5.6033789157867435, "epoch": 1.4921905891656781, "grad_norm": 1.0625, "learning_rate": 0.00047836617735962675, "loss": 5.1178, "mean_token_accuracy": 0.2007538229227066, "num_tokens": 34544306.0, "step": 15095 }, { "entropy": 5.529171371459961, "epoch": 1.4926848556741796, "grad_norm": 0.9921875, "learning_rate": 0.0004783510760335915, "loss": 5.0646, "mean_token_accuracy": 0.2022506922483444, "num_tokens": 34557122.0, "step": 15100 }, { "entropy": 5.574109745025635, "epoch": 1.493179122182681, "grad_norm": 1.0859375, "learning_rate": 0.0004783359697050883, "loss": 5.0743, "mean_token_accuracy": 0.21287332773208617, "num_tokens": 34568302.0, "step": 15105 }, { "entropy": 5.609303903579712, "epoch": 1.4936733886911822, "grad_norm": 0.98828125, "learning_rate": 0.00047832085837448864, "loss": 5.0258, "mean_token_accuracy": 0.21154176890850068, "num_tokens": 34578536.0, "step": 15110 }, { "entropy": 5.588144016265869, "epoch": 1.4941676551996836, "grad_norm": 1.0859375, "learning_rate": 0.00047830574204216436, "loss": 5.1008, "mean_token_accuracy": 0.20401494055986405, "num_tokens": 34590333.0, "step": 15115 }, { "entropy": 5.630799007415772, "epoch": 1.4946619217081851, "grad_norm": 1.078125, "learning_rate": 0.0004782906207084873, "loss": 5.1357, "mean_token_accuracy": 0.2006753131747246, "num_tokens": 34601447.0, "step": 15120 }, { "entropy": 5.592049646377563, "epoch": 1.4951561882166864, "grad_norm": 1.0703125, "learning_rate": 0.0004782754943738294, "loss": 5.1439, "mean_token_accuracy": 0.19646777361631393, "num_tokens": 34613559.0, "step": 15125 }, { "entropy": 5.597771883010864, "epoch": 1.4956504547251879, "grad_norm": 1.046875, "learning_rate": 0.0004782603630385628, "loss": 5.1268, "mean_token_accuracy": 0.20048989057540895, "num_tokens": 34624354.0, "step": 15130 }, { "entropy": 5.6135557174682615, "epoch": 1.4961447212336891, "grad_norm": 0.9609375, "learning_rate": 0.0004782452267030598, "loss": 5.2026, "mean_token_accuracy": 0.20350107550621033, "num_tokens": 34636093.0, "step": 15135 }, { "entropy": 5.63711519241333, "epoch": 1.4966389877421906, "grad_norm": 1.0078125, "learning_rate": 0.0004782300853676926, "loss": 5.0462, "mean_token_accuracy": 0.21071397364139557, "num_tokens": 34647503.0, "step": 15140 }, { "entropy": 5.613569116592407, "epoch": 1.4971332542506919, "grad_norm": 1.109375, "learning_rate": 0.00047821493903283383, "loss": 5.1904, "mean_token_accuracy": 0.19922369718551636, "num_tokens": 34660258.0, "step": 15145 }, { "entropy": 5.570112037658691, "epoch": 1.4976275207591934, "grad_norm": 0.9296875, "learning_rate": 0.000478199787698856, "loss": 5.0995, "mean_token_accuracy": 0.20309504568576814, "num_tokens": 34672199.0, "step": 15150 }, { "entropy": 5.560671758651734, "epoch": 1.4981217872676948, "grad_norm": 0.88671875, "learning_rate": 0.00047818463136613184, "loss": 5.0748, "mean_token_accuracy": 0.21119243949651717, "num_tokens": 34684419.0, "step": 15155 }, { "entropy": 5.467248201370239, "epoch": 1.498616053776196, "grad_norm": 1.015625, "learning_rate": 0.00047816947003503425, "loss": 4.9171, "mean_token_accuracy": 0.22326060384511948, "num_tokens": 34695649.0, "step": 15160 }, { "entropy": 5.641488647460937, "epoch": 1.4991103202846974, "grad_norm": 0.9921875, "learning_rate": 0.00047815430370593627, "loss": 5.1445, "mean_token_accuracy": 0.202543643116951, "num_tokens": 34707019.0, "step": 15165 }, { "entropy": 5.560432434082031, "epoch": 1.4996045867931989, "grad_norm": 1.015625, "learning_rate": 0.00047813913237921077, "loss": 5.058, "mean_token_accuracy": 0.21121390014886857, "num_tokens": 34717609.0, "step": 15170 }, { "entropy": 5.584616804122925, "epoch": 1.5000988533017003, "grad_norm": 0.984375, "learning_rate": 0.0004781239560552312, "loss": 5.1439, "mean_token_accuracy": 0.20205243974924086, "num_tokens": 34728607.0, "step": 15175 }, { "entropy": 5.52527813911438, "epoch": 1.5005931198102016, "grad_norm": 0.98046875, "learning_rate": 0.00047810877473437077, "loss": 5.0326, "mean_token_accuracy": 0.20855453759431838, "num_tokens": 34739537.0, "step": 15180 }, { "entropy": 5.5858128547668455, "epoch": 1.501087386318703, "grad_norm": 1.0, "learning_rate": 0.00047809358841700297, "loss": 5.1352, "mean_token_accuracy": 0.20694479644298552, "num_tokens": 34751814.0, "step": 15185 }, { "entropy": 5.62242112159729, "epoch": 1.5015816528272046, "grad_norm": 1.03125, "learning_rate": 0.0004780783971035014, "loss": 5.0725, "mean_token_accuracy": 0.20864391177892685, "num_tokens": 34762647.0, "step": 15190 }, { "entropy": 5.624110555648803, "epoch": 1.5020759193357058, "grad_norm": 1.0234375, "learning_rate": 0.0004780632007942397, "loss": 5.1563, "mean_token_accuracy": 0.20072754472494125, "num_tokens": 34774157.0, "step": 15195 }, { "entropy": 5.604524612426758, "epoch": 1.502570185844207, "grad_norm": 1.0, "learning_rate": 0.0004780479994895918, "loss": 5.0005, "mean_token_accuracy": 0.20834610909223555, "num_tokens": 34785244.0, "step": 15200 }, { "entropy": 5.560953950881958, "epoch": 1.5030644523527086, "grad_norm": 1.0234375, "learning_rate": 0.0004780327931899316, "loss": 5.0802, "mean_token_accuracy": 0.20723977088928222, "num_tokens": 34797090.0, "step": 15205 }, { "entropy": 5.548986196517944, "epoch": 1.50355871886121, "grad_norm": 1.0234375, "learning_rate": 0.00047801758189563315, "loss": 5.1039, "mean_token_accuracy": 0.20884364545345308, "num_tokens": 34808598.0, "step": 15210 }, { "entropy": 5.6062065124511715, "epoch": 1.5040529853697113, "grad_norm": 0.96484375, "learning_rate": 0.00047800236560707076, "loss": 5.1558, "mean_token_accuracy": 0.20923442542552947, "num_tokens": 34820619.0, "step": 15215 }, { "entropy": 5.611843633651733, "epoch": 1.5045472518782126, "grad_norm": 0.9375, "learning_rate": 0.00047798714432461864, "loss": 5.1303, "mean_token_accuracy": 0.20875605791807175, "num_tokens": 34832463.0, "step": 15220 }, { "entropy": 5.622715473175049, "epoch": 1.505041518386714, "grad_norm": 1.1015625, "learning_rate": 0.0004779719180486513, "loss": 5.1394, "mean_token_accuracy": 0.20220937132835387, "num_tokens": 34844255.0, "step": 15225 }, { "entropy": 5.552530765533447, "epoch": 1.5055357848952156, "grad_norm": 1.0390625, "learning_rate": 0.0004779566867795433, "loss": 5.1476, "mean_token_accuracy": 0.20076398700475692, "num_tokens": 34857215.0, "step": 15230 }, { "entropy": 5.570146465301514, "epoch": 1.5060300514037168, "grad_norm": 0.96484375, "learning_rate": 0.00047794145051766935, "loss": 5.0524, "mean_token_accuracy": 0.21133999824523925, "num_tokens": 34868831.0, "step": 15235 }, { "entropy": 5.610592651367187, "epoch": 1.5065243179122183, "grad_norm": 0.96484375, "learning_rate": 0.0004779262092634042, "loss": 4.9872, "mean_token_accuracy": 0.21782044023275376, "num_tokens": 34879258.0, "step": 15240 }, { "entropy": 5.604552268981934, "epoch": 1.5070185844207198, "grad_norm": 1.0078125, "learning_rate": 0.00047791096301712276, "loss": 5.137, "mean_token_accuracy": 0.20092440098524095, "num_tokens": 34891492.0, "step": 15245 }, { "entropy": 5.548613500595093, "epoch": 1.507512850929221, "grad_norm": 1.0, "learning_rate": 0.00047789571177920024, "loss": 5.0284, "mean_token_accuracy": 0.20604357421398162, "num_tokens": 34901836.0, "step": 15250 }, { "entropy": 5.56804518699646, "epoch": 1.5080071174377223, "grad_norm": 0.9609375, "learning_rate": 0.0004778804555500117, "loss": 5.1598, "mean_token_accuracy": 0.2070153459906578, "num_tokens": 34913892.0, "step": 15255 }, { "entropy": 5.639001989364624, "epoch": 1.5085013839462238, "grad_norm": 1.0390625, "learning_rate": 0.0004778651943299324, "loss": 5.1914, "mean_token_accuracy": 0.2009946033358574, "num_tokens": 34925657.0, "step": 15260 }, { "entropy": 5.624447250366211, "epoch": 1.5089956504547253, "grad_norm": 0.921875, "learning_rate": 0.000477849928119338, "loss": 5.1314, "mean_token_accuracy": 0.20471171736717225, "num_tokens": 34937921.0, "step": 15265 }, { "entropy": 5.569761800765991, "epoch": 1.5094899169632265, "grad_norm": 1.0078125, "learning_rate": 0.0004778346569186038, "loss": 5.1425, "mean_token_accuracy": 0.2058076485991478, "num_tokens": 34948742.0, "step": 15270 }, { "entropy": 5.562988758087158, "epoch": 1.5099841834717278, "grad_norm": 0.89453125, "learning_rate": 0.00047781938072810555, "loss": 5.113, "mean_token_accuracy": 0.20648351460695266, "num_tokens": 34960912.0, "step": 15275 }, { "entropy": 5.637849235534668, "epoch": 1.5104784499802293, "grad_norm": 1.1171875, "learning_rate": 0.00047780409954821914, "loss": 5.1716, "mean_token_accuracy": 0.20612891167402267, "num_tokens": 34971188.0, "step": 15280 }, { "entropy": 5.6148007869720455, "epoch": 1.5109727164887308, "grad_norm": 1.0625, "learning_rate": 0.00047778881337932037, "loss": 5.0865, "mean_token_accuracy": 0.20055453479290009, "num_tokens": 34983316.0, "step": 15285 }, { "entropy": 5.6922540187835695, "epoch": 1.511466982997232, "grad_norm": 1.015625, "learning_rate": 0.00047777352222178537, "loss": 5.1734, "mean_token_accuracy": 0.18953901678323745, "num_tokens": 34995698.0, "step": 15290 }, { "entropy": 5.570169925689697, "epoch": 1.5119612495057335, "grad_norm": 1.015625, "learning_rate": 0.00047775822607599023, "loss": 5.1041, "mean_token_accuracy": 0.21287715882062913, "num_tokens": 35007296.0, "step": 15295 }, { "entropy": 5.643136262893677, "epoch": 1.512455516014235, "grad_norm": 0.953125, "learning_rate": 0.0004777429249423113, "loss": 5.1652, "mean_token_accuracy": 0.19978206753730773, "num_tokens": 35019126.0, "step": 15300 }, { "entropy": 5.567792749404907, "epoch": 1.5129497825227363, "grad_norm": 1.03125, "learning_rate": 0.00047772761882112493, "loss": 5.065, "mean_token_accuracy": 0.20995612740516661, "num_tokens": 35030213.0, "step": 15305 }, { "entropy": 5.521895885467529, "epoch": 1.5134440490312375, "grad_norm": 0.94140625, "learning_rate": 0.0004777123077128077, "loss": 5.0365, "mean_token_accuracy": 0.20776783674955368, "num_tokens": 35043134.0, "step": 15310 }, { "entropy": 5.652577018737793, "epoch": 1.513938315539739, "grad_norm": 0.95703125, "learning_rate": 0.0004776969916177363, "loss": 5.1424, "mean_token_accuracy": 0.20080892294645308, "num_tokens": 35055484.0, "step": 15315 }, { "entropy": 5.59839825630188, "epoch": 1.5144325820482405, "grad_norm": 0.96875, "learning_rate": 0.0004776816705362874, "loss": 5.1581, "mean_token_accuracy": 0.2049498125910759, "num_tokens": 35067037.0, "step": 15320 }, { "entropy": 5.559148740768433, "epoch": 1.5149268485567418, "grad_norm": 1.046875, "learning_rate": 0.0004776663444688381, "loss": 5.069, "mean_token_accuracy": 0.21065797060728073, "num_tokens": 35078340.0, "step": 15325 }, { "entropy": 5.6285059452056885, "epoch": 1.515421115065243, "grad_norm": 1.015625, "learning_rate": 0.0004776510134157651, "loss": 5.1482, "mean_token_accuracy": 0.2034892663359642, "num_tokens": 35090526.0, "step": 15330 }, { "entropy": 5.6167138576507565, "epoch": 1.5159153815737447, "grad_norm": 1.0078125, "learning_rate": 0.00047763567737744576, "loss": 5.1751, "mean_token_accuracy": 0.19963110089302064, "num_tokens": 35103757.0, "step": 15335 }, { "entropy": 5.593349409103394, "epoch": 1.516409648082246, "grad_norm": 1.0, "learning_rate": 0.0004776203363542574, "loss": 5.0428, "mean_token_accuracy": 0.2091163694858551, "num_tokens": 35115694.0, "step": 15340 }, { "entropy": 5.568303346633911, "epoch": 1.5169039145907472, "grad_norm": 0.921875, "learning_rate": 0.0004776049903465773, "loss": 5.0577, "mean_token_accuracy": 0.21563917696475982, "num_tokens": 35126691.0, "step": 15345 }, { "entropy": 5.565527725219726, "epoch": 1.5173981810992487, "grad_norm": 0.953125, "learning_rate": 0.000477589639354783, "loss": 5.0798, "mean_token_accuracy": 0.20630001574754714, "num_tokens": 35137851.0, "step": 15350 }, { "entropy": 5.623522043228149, "epoch": 1.5178924476077502, "grad_norm": 1.09375, "learning_rate": 0.0004775742833792521, "loss": 5.1161, "mean_token_accuracy": 0.20100486725568772, "num_tokens": 35148583.0, "step": 15355 }, { "entropy": 5.610153770446777, "epoch": 1.5183867141162515, "grad_norm": 0.9453125, "learning_rate": 0.0004775589224203625, "loss": 5.119, "mean_token_accuracy": 0.20378896296024324, "num_tokens": 35161469.0, "step": 15360 }, { "entropy": 5.565720939636231, "epoch": 1.5188809806247527, "grad_norm": 0.91796875, "learning_rate": 0.00047754355647849185, "loss": 5.0014, "mean_token_accuracy": 0.21424447000026703, "num_tokens": 35172349.0, "step": 15365 }, { "entropy": 5.503789758682251, "epoch": 1.5193752471332542, "grad_norm": 0.97265625, "learning_rate": 0.00047752818555401845, "loss": 5.0394, "mean_token_accuracy": 0.20703009217977525, "num_tokens": 35183118.0, "step": 15370 }, { "entropy": 5.653103590011597, "epoch": 1.5198695136417557, "grad_norm": 0.953125, "learning_rate": 0.00047751280964732014, "loss": 5.0705, "mean_token_accuracy": 0.20798180997371674, "num_tokens": 35195702.0, "step": 15375 }, { "entropy": 5.728702783584595, "epoch": 1.520363780150257, "grad_norm": 0.984375, "learning_rate": 0.00047749742875877535, "loss": 5.2295, "mean_token_accuracy": 0.1946936920285225, "num_tokens": 35207356.0, "step": 15380 }, { "entropy": 5.606065845489502, "epoch": 1.5208580466587585, "grad_norm": 0.94921875, "learning_rate": 0.0004774820428887624, "loss": 5.1069, "mean_token_accuracy": 0.20884012877941133, "num_tokens": 35219207.0, "step": 15385 }, { "entropy": 5.521138525009155, "epoch": 1.52135231316726, "grad_norm": 1.046875, "learning_rate": 0.0004774666520376597, "loss": 5.0694, "mean_token_accuracy": 0.20350145995616914, "num_tokens": 35230396.0, "step": 15390 }, { "entropy": 5.603884649276734, "epoch": 1.5218465796757612, "grad_norm": 0.95703125, "learning_rate": 0.0004774512562058461, "loss": 5.1391, "mean_token_accuracy": 0.2026482030749321, "num_tokens": 35242320.0, "step": 15395 }, { "entropy": 5.635512495040894, "epoch": 1.5223408461842625, "grad_norm": 0.94921875, "learning_rate": 0.0004774358553937001, "loss": 5.1656, "mean_token_accuracy": 0.20292246639728545, "num_tokens": 35252926.0, "step": 15400 }, { "entropy": 5.687838172912597, "epoch": 1.522835112692764, "grad_norm": 0.9765625, "learning_rate": 0.0004774204496016006, "loss": 5.1788, "mean_token_accuracy": 0.19789968580007553, "num_tokens": 35263833.0, "step": 15405 }, { "entropy": 5.619166994094849, "epoch": 1.5233293792012654, "grad_norm": 0.92578125, "learning_rate": 0.00047740503882992677, "loss": 5.1461, "mean_token_accuracy": 0.19949700087308883, "num_tokens": 35274951.0, "step": 15410 }, { "entropy": 5.648856115341187, "epoch": 1.5238236457097667, "grad_norm": 0.9609375, "learning_rate": 0.0004773896230790575, "loss": 5.1734, "mean_token_accuracy": 0.20372291505336762, "num_tokens": 35287940.0, "step": 15415 }, { "entropy": 5.583803367614746, "epoch": 1.524317912218268, "grad_norm": 1.1875, "learning_rate": 0.00047737420234937215, "loss": 5.1003, "mean_token_accuracy": 0.21787805557250978, "num_tokens": 35299321.0, "step": 15420 }, { "entropy": 5.567562580108643, "epoch": 1.5248121787267694, "grad_norm": 1.03125, "learning_rate": 0.00047735877664125, "loss": 5.076, "mean_token_accuracy": 0.20533971786499022, "num_tokens": 35310181.0, "step": 15425 }, { "entropy": 5.622694969177246, "epoch": 1.525306445235271, "grad_norm": 1.09375, "learning_rate": 0.00047734334595507045, "loss": 5.1173, "mean_token_accuracy": 0.20542537569999694, "num_tokens": 35320435.0, "step": 15430 }, { "entropy": 5.593475437164306, "epoch": 1.5258007117437722, "grad_norm": 1.046875, "learning_rate": 0.0004773279102912134, "loss": 5.2004, "mean_token_accuracy": 0.19800256788730622, "num_tokens": 35332533.0, "step": 15435 }, { "entropy": 5.568828344345093, "epoch": 1.5262949782522737, "grad_norm": 1.0234375, "learning_rate": 0.0004773124696500582, "loss": 5.0728, "mean_token_accuracy": 0.22067630290985107, "num_tokens": 35344289.0, "step": 15440 }, { "entropy": 5.605533742904663, "epoch": 1.5267892447607752, "grad_norm": 1.0, "learning_rate": 0.0004772970240319849, "loss": 5.0538, "mean_token_accuracy": 0.21035726815462114, "num_tokens": 35355679.0, "step": 15445 }, { "entropy": 5.59890456199646, "epoch": 1.5272835112692764, "grad_norm": 0.95703125, "learning_rate": 0.00047728157343737346, "loss": 5.0664, "mean_token_accuracy": 0.21002404540777206, "num_tokens": 35367489.0, "step": 15450 }, { "entropy": 5.553568553924561, "epoch": 1.5277777777777777, "grad_norm": 1.0078125, "learning_rate": 0.00047726611786660396, "loss": 4.9963, "mean_token_accuracy": 0.21047165095806122, "num_tokens": 35378349.0, "step": 15455 }, { "entropy": 5.591574192047119, "epoch": 1.5282720442862792, "grad_norm": 1.0625, "learning_rate": 0.00047725065732005654, "loss": 5.1463, "mean_token_accuracy": 0.20712540298700333, "num_tokens": 35388927.0, "step": 15460 }, { "entropy": 5.542487573623657, "epoch": 1.5287663107947806, "grad_norm": 1.09375, "learning_rate": 0.0004772351917981115, "loss": 5.074, "mean_token_accuracy": 0.20949821472167968, "num_tokens": 35401859.0, "step": 15465 }, { "entropy": 5.672688150405884, "epoch": 1.529260577303282, "grad_norm": 1.015625, "learning_rate": 0.0004772197213011494, "loss": 5.1202, "mean_token_accuracy": 0.19934409558773042, "num_tokens": 35412735.0, "step": 15470 }, { "entropy": 5.555076313018799, "epoch": 1.5297548438117832, "grad_norm": 1.0625, "learning_rate": 0.0004772042458295509, "loss": 5.0536, "mean_token_accuracy": 0.20985513180494308, "num_tokens": 35422960.0, "step": 15475 }, { "entropy": 5.636799144744873, "epoch": 1.5302491103202847, "grad_norm": 1.0390625, "learning_rate": 0.00047718876538369655, "loss": 5.1923, "mean_token_accuracy": 0.20033311545848848, "num_tokens": 35435054.0, "step": 15480 }, { "entropy": 5.609391546249389, "epoch": 1.5307433768287861, "grad_norm": 1.015625, "learning_rate": 0.00047717327996396716, "loss": 5.1496, "mean_token_accuracy": 0.20434630662202835, "num_tokens": 35447388.0, "step": 15485 }, { "entropy": 5.645267534255981, "epoch": 1.5312376433372874, "grad_norm": 1.0625, "learning_rate": 0.0004771577895707437, "loss": 5.1359, "mean_token_accuracy": 0.20312395244836806, "num_tokens": 35459181.0, "step": 15490 }, { "entropy": 5.539734983444214, "epoch": 1.5317319098457889, "grad_norm": 0.9453125, "learning_rate": 0.0004771422942044073, "loss": 4.9679, "mean_token_accuracy": 0.20678249895572662, "num_tokens": 35469978.0, "step": 15495 }, { "entropy": 5.514973974227905, "epoch": 1.5322261763542904, "grad_norm": 0.9296875, "learning_rate": 0.0004771267938653391, "loss": 5.0813, "mean_token_accuracy": 0.21436522156000137, "num_tokens": 35482196.0, "step": 15500 }, { "entropy": 5.537350130081177, "epoch": 1.5327204428627916, "grad_norm": 0.93359375, "learning_rate": 0.0004771112885539204, "loss": 5.0104, "mean_token_accuracy": 0.21966301500797272, "num_tokens": 35493025.0, "step": 15505 }, { "entropy": 5.579631185531616, "epoch": 1.533214709371293, "grad_norm": 1.09375, "learning_rate": 0.00047709577827053257, "loss": 5.0944, "mean_token_accuracy": 0.21212977766990662, "num_tokens": 35504379.0, "step": 15510 }, { "entropy": 5.5411172866821286, "epoch": 1.5337089758797944, "grad_norm": 1.0546875, "learning_rate": 0.00047708026301555736, "loss": 5.0491, "mean_token_accuracy": 0.21304168850183486, "num_tokens": 35515401.0, "step": 15515 }, { "entropy": 5.630333662033081, "epoch": 1.5342032423882959, "grad_norm": 0.96875, "learning_rate": 0.00047706474278937626, "loss": 5.1364, "mean_token_accuracy": 0.20678273141384124, "num_tokens": 35527625.0, "step": 15520 }, { "entropy": 5.626978015899658, "epoch": 1.5346975088967971, "grad_norm": 1.0, "learning_rate": 0.00047704921759237116, "loss": 5.1097, "mean_token_accuracy": 0.20073188543319703, "num_tokens": 35539484.0, "step": 15525 }, { "entropy": 5.646079397201538, "epoch": 1.5351917754052984, "grad_norm": 1.109375, "learning_rate": 0.00047703368742492403, "loss": 5.1071, "mean_token_accuracy": 0.20365327149629592, "num_tokens": 35550362.0, "step": 15530 }, { "entropy": 5.609572458267212, "epoch": 1.5356860419137999, "grad_norm": 1.0, "learning_rate": 0.0004770181522874167, "loss": 5.0945, "mean_token_accuracy": 0.20684872418642045, "num_tokens": 35561564.0, "step": 15535 }, { "entropy": 5.582638359069824, "epoch": 1.5361803084223014, "grad_norm": 1.109375, "learning_rate": 0.0004770026121802316, "loss": 5.0291, "mean_token_accuracy": 0.20843826979398727, "num_tokens": 35572216.0, "step": 15540 }, { "entropy": 5.490638065338135, "epoch": 1.5366745749308026, "grad_norm": 0.93359375, "learning_rate": 0.0004769870671037509, "loss": 4.9802, "mean_token_accuracy": 0.22320197969675065, "num_tokens": 35584471.0, "step": 15545 }, { "entropy": 5.555990743637085, "epoch": 1.537168841439304, "grad_norm": 1.0078125, "learning_rate": 0.00047697151705835693, "loss": 5.0648, "mean_token_accuracy": 0.2112535357475281, "num_tokens": 35596551.0, "step": 15550 }, { "entropy": 5.616995525360108, "epoch": 1.5376631079478056, "grad_norm": 1.015625, "learning_rate": 0.0004769559620444324, "loss": 5.0884, "mean_token_accuracy": 0.20784934759140014, "num_tokens": 35607425.0, "step": 15555 }, { "entropy": 5.522336149215699, "epoch": 1.5381573744563068, "grad_norm": 1.046875, "learning_rate": 0.00047694040206235983, "loss": 5.0522, "mean_token_accuracy": 0.21096911281347275, "num_tokens": 35618900.0, "step": 15560 }, { "entropy": 5.597569179534912, "epoch": 1.538651640964808, "grad_norm": 0.99609375, "learning_rate": 0.000476924837112522, "loss": 5.0565, "mean_token_accuracy": 0.21403832733631134, "num_tokens": 35630126.0, "step": 15565 }, { "entropy": 5.606310081481934, "epoch": 1.5391459074733096, "grad_norm": 0.97265625, "learning_rate": 0.00047690926719530193, "loss": 5.1178, "mean_token_accuracy": 0.21079041808843613, "num_tokens": 35642406.0, "step": 15570 }, { "entropy": 5.541243362426758, "epoch": 1.539640173981811, "grad_norm": 0.984375, "learning_rate": 0.00047689369231108253, "loss": 5.1226, "mean_token_accuracy": 0.19969495087862016, "num_tokens": 35654701.0, "step": 15575 }, { "entropy": 5.689312982559204, "epoch": 1.5401344404903123, "grad_norm": 0.984375, "learning_rate": 0.000476878112460247, "loss": 5.2049, "mean_token_accuracy": 0.19935586601495742, "num_tokens": 35665668.0, "step": 15580 }, { "entropy": 5.560025882720947, "epoch": 1.5406287069988136, "grad_norm": 1.0234375, "learning_rate": 0.00047686252764317854, "loss": 5.078, "mean_token_accuracy": 0.20856538712978362, "num_tokens": 35676940.0, "step": 15585 }, { "entropy": 5.577630186080933, "epoch": 1.5411229735073153, "grad_norm": 0.99609375, "learning_rate": 0.00047684693786026054, "loss": 5.2059, "mean_token_accuracy": 0.19479766935110093, "num_tokens": 35687860.0, "step": 15590 }, { "entropy": 5.5941390037536625, "epoch": 1.5416172400158166, "grad_norm": 1.0703125, "learning_rate": 0.00047683134311187663, "loss": 5.0572, "mean_token_accuracy": 0.20723522007465361, "num_tokens": 35698349.0, "step": 15595 }, { "entropy": 5.5764110565185545, "epoch": 1.5421115065243178, "grad_norm": 0.91015625, "learning_rate": 0.00047681574339841044, "loss": 5.1027, "mean_token_accuracy": 0.20826167464256287, "num_tokens": 35709649.0, "step": 15600 }, { "entropy": 5.553362941741943, "epoch": 1.5426057730328193, "grad_norm": 1.0703125, "learning_rate": 0.00047680013872024546, "loss": 5.019, "mean_token_accuracy": 0.21016632318496703, "num_tokens": 35720806.0, "step": 15605 }, { "entropy": 5.6389915466308596, "epoch": 1.5431000395413208, "grad_norm": 0.9453125, "learning_rate": 0.0004767845290777659, "loss": 5.0738, "mean_token_accuracy": 0.20206350535154344, "num_tokens": 35732044.0, "step": 15610 }, { "entropy": 5.588653182983398, "epoch": 1.543594306049822, "grad_norm": 1.0703125, "learning_rate": 0.0004767689144713556, "loss": 5.12, "mean_token_accuracy": 0.20916222929954528, "num_tokens": 35743758.0, "step": 15615 }, { "entropy": 5.625391006469727, "epoch": 1.5440885725583233, "grad_norm": 0.89453125, "learning_rate": 0.00047675329490139866, "loss": 5.0657, "mean_token_accuracy": 0.20260853469371795, "num_tokens": 35756184.0, "step": 15620 }, { "entropy": 5.561628675460815, "epoch": 1.5445828390668248, "grad_norm": 1.0234375, "learning_rate": 0.00047673767036827947, "loss": 5.0818, "mean_token_accuracy": 0.20165523141622543, "num_tokens": 35768255.0, "step": 15625 }, { "entropy": 5.574328947067261, "epoch": 1.5450771055753263, "grad_norm": 1.078125, "learning_rate": 0.0004767220408723822, "loss": 5.1249, "mean_token_accuracy": 0.19853226095438004, "num_tokens": 35779111.0, "step": 15630 }, { "entropy": 5.618637609481811, "epoch": 1.5455713720838276, "grad_norm": 0.91796875, "learning_rate": 0.0004767064064140915, "loss": 5.1526, "mean_token_accuracy": 0.20699317157268524, "num_tokens": 35791676.0, "step": 15635 }, { "entropy": 5.581990766525268, "epoch": 1.546065638592329, "grad_norm": 0.91796875, "learning_rate": 0.0004766907669937919, "loss": 5.0323, "mean_token_accuracy": 0.2198507457971573, "num_tokens": 35801868.0, "step": 15640 }, { "entropy": 5.695472192764282, "epoch": 1.5465599051008305, "grad_norm": 1.0078125, "learning_rate": 0.000476675122611868, "loss": 5.2337, "mean_token_accuracy": 0.19707612097263336, "num_tokens": 35812428.0, "step": 15645 }, { "entropy": 5.611184692382812, "epoch": 1.5470541716093318, "grad_norm": 1.078125, "learning_rate": 0.000476659473268705, "loss": 5.0667, "mean_token_accuracy": 0.21282614171504974, "num_tokens": 35823600.0, "step": 15650 }, { "entropy": 5.605056238174439, "epoch": 1.547548438117833, "grad_norm": 0.96484375, "learning_rate": 0.0004766438189646876, "loss": 5.1152, "mean_token_accuracy": 0.20909148156642915, "num_tokens": 35834988.0, "step": 15655 }, { "entropy": 5.588900470733643, "epoch": 1.5480427046263345, "grad_norm": 0.94140625, "learning_rate": 0.00047662815970020086, "loss": 5.1391, "mean_token_accuracy": 0.20870608687400818, "num_tokens": 35846110.0, "step": 15660 }, { "entropy": 5.5267706394195555, "epoch": 1.548536971134836, "grad_norm": 0.90234375, "learning_rate": 0.0004766124954756302, "loss": 5.0909, "mean_token_accuracy": 0.21071358323097228, "num_tokens": 35858276.0, "step": 15665 }, { "entropy": 5.631910037994385, "epoch": 1.5490312376433373, "grad_norm": 1.03125, "learning_rate": 0.00047659682629136094, "loss": 5.1587, "mean_token_accuracy": 0.20168981850147247, "num_tokens": 35870705.0, "step": 15670 }, { "entropy": 5.584083366394043, "epoch": 1.5495255041518385, "grad_norm": 1.0234375, "learning_rate": 0.0004765811521477784, "loss": 5.1057, "mean_token_accuracy": 0.20638991445302962, "num_tokens": 35882298.0, "step": 15675 }, { "entropy": 5.536733961105346, "epoch": 1.55001977066034, "grad_norm": 0.91015625, "learning_rate": 0.0004765654730452682, "loss": 5.0255, "mean_token_accuracy": 0.211549574136734, "num_tokens": 35894665.0, "step": 15680 }, { "entropy": 5.603041410446167, "epoch": 1.5505140371688415, "grad_norm": 1.0859375, "learning_rate": 0.0004765497889842161, "loss": 5.1026, "mean_token_accuracy": 0.20983724445104598, "num_tokens": 35905893.0, "step": 15685 }, { "entropy": 5.605817270278931, "epoch": 1.5510083036773428, "grad_norm": 0.9609375, "learning_rate": 0.00047653409996500803, "loss": 5.043, "mean_token_accuracy": 0.21622056663036346, "num_tokens": 35917883.0, "step": 15690 }, { "entropy": 5.612425899505615, "epoch": 1.5515025701858443, "grad_norm": 1.03125, "learning_rate": 0.00047651840598802976, "loss": 5.1228, "mean_token_accuracy": 0.2105117678642273, "num_tokens": 35929863.0, "step": 15695 }, { "entropy": 5.64110631942749, "epoch": 1.5519968366943457, "grad_norm": 1.109375, "learning_rate": 0.0004765027070536674, "loss": 5.1503, "mean_token_accuracy": 0.20669665634632112, "num_tokens": 35940843.0, "step": 15700 }, { "entropy": 5.552305030822754, "epoch": 1.552491103202847, "grad_norm": 0.921875, "learning_rate": 0.0004764870031623073, "loss": 5.0269, "mean_token_accuracy": 0.21230757236480713, "num_tokens": 35953516.0, "step": 15705 }, { "entropy": 5.574197006225586, "epoch": 1.5529853697113483, "grad_norm": 0.953125, "learning_rate": 0.00047647129431433566, "loss": 5.0815, "mean_token_accuracy": 0.20829219371080399, "num_tokens": 35965481.0, "step": 15710 }, { "entropy": 5.605282926559449, "epoch": 1.5534796362198497, "grad_norm": 1.015625, "learning_rate": 0.0004764555805101388, "loss": 5.1671, "mean_token_accuracy": 0.2067513182759285, "num_tokens": 35976434.0, "step": 15715 }, { "entropy": 5.565255832672119, "epoch": 1.5539739027283512, "grad_norm": 1.0390625, "learning_rate": 0.0004764398617501035, "loss": 5.0433, "mean_token_accuracy": 0.21187710165977477, "num_tokens": 35987644.0, "step": 15720 }, { "entropy": 5.645238733291626, "epoch": 1.5544681692368525, "grad_norm": 0.984375, "learning_rate": 0.0004764241380346163, "loss": 5.1453, "mean_token_accuracy": 0.20578050911426543, "num_tokens": 35999630.0, "step": 15725 }, { "entropy": 5.659963607788086, "epoch": 1.5549624357453538, "grad_norm": 0.96484375, "learning_rate": 0.0004764084093640641, "loss": 5.1994, "mean_token_accuracy": 0.20511618703603746, "num_tokens": 36011889.0, "step": 15730 }, { "entropy": 5.676961088180542, "epoch": 1.5554567022538552, "grad_norm": 0.9609375, "learning_rate": 0.0004763926757388338, "loss": 5.1776, "mean_token_accuracy": 0.20161229968070984, "num_tokens": 36024131.0, "step": 15735 }, { "entropy": 5.598766469955445, "epoch": 1.5559509687623567, "grad_norm": 0.98046875, "learning_rate": 0.0004763769371593124, "loss": 5.1016, "mean_token_accuracy": 0.21266770958900452, "num_tokens": 36035759.0, "step": 15740 }, { "entropy": 5.619744205474854, "epoch": 1.556445235270858, "grad_norm": 1.09375, "learning_rate": 0.0004763611936258871, "loss": 5.148, "mean_token_accuracy": 0.20099306106567383, "num_tokens": 36047882.0, "step": 15745 }, { "entropy": 5.594178152084351, "epoch": 1.5569395017793595, "grad_norm": 1.0703125, "learning_rate": 0.0004763454451389452, "loss": 5.1072, "mean_token_accuracy": 0.20613367557525636, "num_tokens": 36058268.0, "step": 15750 }, { "entropy": 5.631468486785889, "epoch": 1.557433768287861, "grad_norm": 0.96484375, "learning_rate": 0.00047632969169887407, "loss": 5.1337, "mean_token_accuracy": 0.20946724861860275, "num_tokens": 36070797.0, "step": 15755 }, { "entropy": 5.599421882629395, "epoch": 1.5579280347963622, "grad_norm": 0.97265625, "learning_rate": 0.0004763139333060613, "loss": 5.1475, "mean_token_accuracy": 0.20652410984039307, "num_tokens": 36082858.0, "step": 15760 }, { "entropy": 5.627766561508179, "epoch": 1.5584223013048635, "grad_norm": 1.0234375, "learning_rate": 0.00047629816996089464, "loss": 5.1087, "mean_token_accuracy": 0.20676421374082565, "num_tokens": 36094825.0, "step": 15765 }, { "entropy": 5.635173797607422, "epoch": 1.558916567813365, "grad_norm": 1.015625, "learning_rate": 0.00047628240166376173, "loss": 5.1354, "mean_token_accuracy": 0.19842488467693328, "num_tokens": 36106379.0, "step": 15770 }, { "entropy": 5.587966537475586, "epoch": 1.5594108343218664, "grad_norm": 0.94921875, "learning_rate": 0.00047626662841505045, "loss": 5.0301, "mean_token_accuracy": 0.21156285107135772, "num_tokens": 36117137.0, "step": 15775 }, { "entropy": 5.624384164810181, "epoch": 1.5599051008303677, "grad_norm": 0.984375, "learning_rate": 0.000476250850215149, "loss": 5.1397, "mean_token_accuracy": 0.20219778418540954, "num_tokens": 36128420.0, "step": 15780 }, { "entropy": 5.600346422195434, "epoch": 1.560399367338869, "grad_norm": 1.09375, "learning_rate": 0.0004762350670644453, "loss": 5.0545, "mean_token_accuracy": 0.2149135187268257, "num_tokens": 36139017.0, "step": 15785 }, { "entropy": 5.609952831268311, "epoch": 1.5608936338473705, "grad_norm": 1.0546875, "learning_rate": 0.0004762192789633278, "loss": 5.1566, "mean_token_accuracy": 0.20792134702205659, "num_tokens": 36151748.0, "step": 15790 }, { "entropy": 5.668580007553101, "epoch": 1.561387900355872, "grad_norm": 0.98046875, "learning_rate": 0.00047620348591218475, "loss": 5.1255, "mean_token_accuracy": 0.2039097785949707, "num_tokens": 36163114.0, "step": 15795 }, { "entropy": 5.594047784805298, "epoch": 1.5618821668643732, "grad_norm": 0.9609375, "learning_rate": 0.0004761876879114048, "loss": 5.1449, "mean_token_accuracy": 0.20362650752067565, "num_tokens": 36174601.0, "step": 15800 }, { "entropy": 5.590933990478516, "epoch": 1.5623764333728747, "grad_norm": 1.0546875, "learning_rate": 0.0004761718849613765, "loss": 5.0732, "mean_token_accuracy": 0.2090313032269478, "num_tokens": 36185081.0, "step": 15805 }, { "entropy": 5.6614092826843265, "epoch": 1.5628706998813762, "grad_norm": 1.015625, "learning_rate": 0.0004761560770624886, "loss": 5.1331, "mean_token_accuracy": 0.20872577875852585, "num_tokens": 36196547.0, "step": 15810 }, { "entropy": 5.6012531280517575, "epoch": 1.5633649663898774, "grad_norm": 0.96875, "learning_rate": 0.0004761402642151301, "loss": 5.0558, "mean_token_accuracy": 0.21250957101583481, "num_tokens": 36208115.0, "step": 15815 }, { "entropy": 5.580404138565063, "epoch": 1.5638592328983787, "grad_norm": 1.0625, "learning_rate": 0.0004761244464196897, "loss": 5.0843, "mean_token_accuracy": 0.2106562688946724, "num_tokens": 36219571.0, "step": 15820 }, { "entropy": 5.6151642322540285, "epoch": 1.5643534994068802, "grad_norm": 0.8984375, "learning_rate": 0.0004761086236765569, "loss": 5.1124, "mean_token_accuracy": 0.20501108914613725, "num_tokens": 36232219.0, "step": 15825 }, { "entropy": 5.605246067047119, "epoch": 1.5648477659153817, "grad_norm": 0.98046875, "learning_rate": 0.0004760927959861206, "loss": 5.1275, "mean_token_accuracy": 0.20814582854509353, "num_tokens": 36243761.0, "step": 15830 }, { "entropy": 5.5628002166748045, "epoch": 1.565342032423883, "grad_norm": 0.93359375, "learning_rate": 0.0004760769633487704, "loss": 5.0678, "mean_token_accuracy": 0.2062663421034813, "num_tokens": 36255466.0, "step": 15835 }, { "entropy": 5.576330375671387, "epoch": 1.5658362989323842, "grad_norm": 1.0, "learning_rate": 0.00047606112576489574, "loss": 5.1248, "mean_token_accuracy": 0.20424727350473404, "num_tokens": 36267252.0, "step": 15840 }, { "entropy": 5.61838731765747, "epoch": 1.566330565440886, "grad_norm": 0.98046875, "learning_rate": 0.0004760452832348862, "loss": 5.1228, "mean_token_accuracy": 0.2095861554145813, "num_tokens": 36278149.0, "step": 15845 }, { "entropy": 5.712425470352173, "epoch": 1.5668248319493872, "grad_norm": 0.96875, "learning_rate": 0.00047602943575913146, "loss": 5.1355, "mean_token_accuracy": 0.21186519414186478, "num_tokens": 36290583.0, "step": 15850 }, { "entropy": 5.619927835464478, "epoch": 1.5673190984578884, "grad_norm": 1.0234375, "learning_rate": 0.0004760135833380214, "loss": 5.1221, "mean_token_accuracy": 0.20724484026432038, "num_tokens": 36301508.0, "step": 15855 }, { "entropy": 5.54689736366272, "epoch": 1.56781336496639, "grad_norm": 1.09375, "learning_rate": 0.000475997725971946, "loss": 5.0328, "mean_token_accuracy": 0.2094184935092926, "num_tokens": 36312488.0, "step": 15860 }, { "entropy": 5.570281600952148, "epoch": 1.5683076314748914, "grad_norm": 1.1015625, "learning_rate": 0.0004759818636612954, "loss": 5.0664, "mean_token_accuracy": 0.21277560591697692, "num_tokens": 36323263.0, "step": 15865 }, { "entropy": 5.606886339187622, "epoch": 1.5688018979833926, "grad_norm": 0.94140625, "learning_rate": 0.00047596599640645974, "loss": 5.0983, "mean_token_accuracy": 0.20313012450933457, "num_tokens": 36336095.0, "step": 15870 }, { "entropy": 5.601921272277832, "epoch": 1.569296164491894, "grad_norm": 1.0859375, "learning_rate": 0.00047595012420782946, "loss": 5.1342, "mean_token_accuracy": 0.20616301745176316, "num_tokens": 36346653.0, "step": 15875 }, { "entropy": 5.582756280899048, "epoch": 1.5697904310003954, "grad_norm": 0.98046875, "learning_rate": 0.0004759342470657949, "loss": 5.0846, "mean_token_accuracy": 0.21105553656816484, "num_tokens": 36358190.0, "step": 15880 }, { "entropy": 5.612012910842895, "epoch": 1.5702846975088969, "grad_norm": 1.015625, "learning_rate": 0.0004759183649807467, "loss": 5.1038, "mean_token_accuracy": 0.20510900467634202, "num_tokens": 36369037.0, "step": 15885 }, { "entropy": 5.650924301147461, "epoch": 1.5707789640173981, "grad_norm": 1.03125, "learning_rate": 0.0004759024779530755, "loss": 5.1039, "mean_token_accuracy": 0.20821370035409928, "num_tokens": 36379881.0, "step": 15890 }, { "entropy": 5.607387351989746, "epoch": 1.5712732305258994, "grad_norm": 1.015625, "learning_rate": 0.00047588658598317227, "loss": 5.0508, "mean_token_accuracy": 0.21415281742811204, "num_tokens": 36390927.0, "step": 15895 }, { "entropy": 5.6293925762176515, "epoch": 1.571767497034401, "grad_norm": 1.0078125, "learning_rate": 0.00047587068907142783, "loss": 5.1926, "mean_token_accuracy": 0.20652025192975998, "num_tokens": 36402398.0, "step": 15900 }, { "entropy": 5.571823263168335, "epoch": 1.5722617635429024, "grad_norm": 1.0625, "learning_rate": 0.0004758547872182332, "loss": 5.0314, "mean_token_accuracy": 0.2084917277097702, "num_tokens": 36413991.0, "step": 15905 }, { "entropy": 5.560000991821289, "epoch": 1.5727560300514036, "grad_norm": 1.0390625, "learning_rate": 0.0004758388804239797, "loss": 5.0997, "mean_token_accuracy": 0.20818343460559846, "num_tokens": 36425807.0, "step": 15910 }, { "entropy": 5.629786968231201, "epoch": 1.5732502965599051, "grad_norm": 1.0390625, "learning_rate": 0.0004758229686890586, "loss": 5.1389, "mean_token_accuracy": 0.20766399949789047, "num_tokens": 36437968.0, "step": 15915 }, { "entropy": 5.64189510345459, "epoch": 1.5737445630684066, "grad_norm": 1.046875, "learning_rate": 0.00047580705201386134, "loss": 5.1288, "mean_token_accuracy": 0.20171207040548325, "num_tokens": 36449803.0, "step": 15920 }, { "entropy": 5.641908359527588, "epoch": 1.5742388295769079, "grad_norm": 1.0078125, "learning_rate": 0.0004757911303987794, "loss": 5.1858, "mean_token_accuracy": 0.1981608286499977, "num_tokens": 36461849.0, "step": 15925 }, { "entropy": 5.558391427993774, "epoch": 1.5747330960854091, "grad_norm": 0.984375, "learning_rate": 0.0004757752038442045, "loss": 5.0619, "mean_token_accuracy": 0.21282735764980315, "num_tokens": 36473324.0, "step": 15930 }, { "entropy": 5.65172324180603, "epoch": 1.5752273625939106, "grad_norm": 1.1015625, "learning_rate": 0.0004757592723505284, "loss": 5.1184, "mean_token_accuracy": 0.2062368094921112, "num_tokens": 36483949.0, "step": 15935 }, { "entropy": 5.551617431640625, "epoch": 1.575721629102412, "grad_norm": 0.97265625, "learning_rate": 0.0004757433359181431, "loss": 5.0294, "mean_token_accuracy": 0.2184825822710991, "num_tokens": 36495308.0, "step": 15940 }, { "entropy": 5.53737244606018, "epoch": 1.5762158956109134, "grad_norm": 0.98046875, "learning_rate": 0.00047572739454744057, "loss": 5.0851, "mean_token_accuracy": 0.20751831233501433, "num_tokens": 36506052.0, "step": 15945 }, { "entropy": 5.4983213424682615, "epoch": 1.5767101621194148, "grad_norm": 0.96484375, "learning_rate": 0.000475711448238813, "loss": 4.9906, "mean_token_accuracy": 0.21721145361661912, "num_tokens": 36519175.0, "step": 15950 }, { "entropy": 5.630280828475952, "epoch": 1.5772044286279163, "grad_norm": 1.046875, "learning_rate": 0.00047569549699265275, "loss": 5.0848, "mean_token_accuracy": 0.2105712488293648, "num_tokens": 36529736.0, "step": 15955 }, { "entropy": 5.554080629348755, "epoch": 1.5776986951364176, "grad_norm": 1.046875, "learning_rate": 0.00047567954080935206, "loss": 5.0102, "mean_token_accuracy": 0.20750059485435485, "num_tokens": 36541715.0, "step": 15960 }, { "entropy": 5.589702224731445, "epoch": 1.5781929616449188, "grad_norm": 1.0, "learning_rate": 0.0004756635796893036, "loss": 5.1186, "mean_token_accuracy": 0.20888487249612808, "num_tokens": 36553807.0, "step": 15965 }, { "entropy": 5.655246353149414, "epoch": 1.5786872281534203, "grad_norm": 1.0078125, "learning_rate": 0.0004756476136328998, "loss": 5.1714, "mean_token_accuracy": 0.19896899908781052, "num_tokens": 36566053.0, "step": 15970 }, { "entropy": 5.627724695205688, "epoch": 1.5791814946619218, "grad_norm": 1.0234375, "learning_rate": 0.00047563164264053374, "loss": 5.1353, "mean_token_accuracy": 0.21143180131912231, "num_tokens": 36577637.0, "step": 15975 }, { "entropy": 5.615383577346802, "epoch": 1.579675761170423, "grad_norm": 1.0078125, "learning_rate": 0.00047561566671259803, "loss": 5.0773, "mean_token_accuracy": 0.20710201412439347, "num_tokens": 36587767.0, "step": 15980 }, { "entropy": 5.5172686100006105, "epoch": 1.5801700276789243, "grad_norm": 0.99609375, "learning_rate": 0.00047559968584948587, "loss": 5.0041, "mean_token_accuracy": 0.21537657529115678, "num_tokens": 36599163.0, "step": 15985 }, { "entropy": 5.597974872589111, "epoch": 1.5806642941874258, "grad_norm": 0.95703125, "learning_rate": 0.0004755837000515903, "loss": 5.1529, "mean_token_accuracy": 0.20173457115888596, "num_tokens": 36611170.0, "step": 15990 }, { "entropy": 5.667025995254517, "epoch": 1.5811585606959273, "grad_norm": 0.95703125, "learning_rate": 0.0004755677093193046, "loss": 5.2362, "mean_token_accuracy": 0.19940282702445983, "num_tokens": 36622907.0, "step": 15995 }, { "entropy": 5.6238728046417235, "epoch": 1.5816528272044286, "grad_norm": 0.94140625, "learning_rate": 0.0004755517136530221, "loss": 5.1364, "mean_token_accuracy": 0.20525768101215364, "num_tokens": 36635197.0, "step": 16000 }, { "entropy": 5.57008581161499, "epoch": 1.58214709371293, "grad_norm": 0.9765625, "learning_rate": 0.00047553571305313636, "loss": 5.0442, "mean_token_accuracy": 0.2135373279452324, "num_tokens": 36646965.0, "step": 16005 }, { "entropy": 5.532201766967773, "epoch": 1.5826413602214315, "grad_norm": 1.046875, "learning_rate": 0.00047551970752004097, "loss": 5.0514, "mean_token_accuracy": 0.21787638068199158, "num_tokens": 36657344.0, "step": 16010 }, { "entropy": 5.518529558181763, "epoch": 1.5831356267299328, "grad_norm": 1.0390625, "learning_rate": 0.00047550369705412964, "loss": 5.0352, "mean_token_accuracy": 0.21515831649303435, "num_tokens": 36668833.0, "step": 16015 }, { "entropy": 5.58407883644104, "epoch": 1.583629893238434, "grad_norm": 1.03125, "learning_rate": 0.0004754876816557963, "loss": 5.0162, "mean_token_accuracy": 0.2170218273997307, "num_tokens": 36680902.0, "step": 16020 }, { "entropy": 5.563946151733399, "epoch": 1.5841241597469355, "grad_norm": 1.0078125, "learning_rate": 0.00047547166132543483, "loss": 5.0442, "mean_token_accuracy": 0.21559051126241685, "num_tokens": 36691312.0, "step": 16025 }, { "entropy": 5.585513067245484, "epoch": 1.584618426255437, "grad_norm": 0.984375, "learning_rate": 0.00047545563606343945, "loss": 5.0784, "mean_token_accuracy": 0.2114490434527397, "num_tokens": 36701091.0, "step": 16030 }, { "entropy": 5.613026571273804, "epoch": 1.5851126927639383, "grad_norm": 1.046875, "learning_rate": 0.0004754396058702043, "loss": 5.1366, "mean_token_accuracy": 0.20682188123464584, "num_tokens": 36712524.0, "step": 16035 }, { "entropy": 5.6761736392974855, "epoch": 1.5856069592724396, "grad_norm": 1.015625, "learning_rate": 0.00047542357074612375, "loss": 5.1257, "mean_token_accuracy": 0.20406325906515121, "num_tokens": 36724181.0, "step": 16040 }, { "entropy": 5.577147579193115, "epoch": 1.586101225780941, "grad_norm": 1.0625, "learning_rate": 0.00047540753069159224, "loss": 5.0481, "mean_token_accuracy": 0.21630271822214125, "num_tokens": 36734777.0, "step": 16045 }, { "entropy": 5.5894763469696045, "epoch": 1.5865954922894425, "grad_norm": 1.03125, "learning_rate": 0.00047539148570700443, "loss": 5.1183, "mean_token_accuracy": 0.20856782644987107, "num_tokens": 36746437.0, "step": 16050 }, { "entropy": 5.681111240386963, "epoch": 1.5870897587979438, "grad_norm": 1.046875, "learning_rate": 0.00047537543579275496, "loss": 5.2328, "mean_token_accuracy": 0.19868498742580415, "num_tokens": 36759615.0, "step": 16055 }, { "entropy": 5.610970783233642, "epoch": 1.5875840253064453, "grad_norm": 1.1484375, "learning_rate": 0.0004753593809492387, "loss": 5.1101, "mean_token_accuracy": 0.2051735207438469, "num_tokens": 36770762.0, "step": 16060 }, { "entropy": 5.633020877838135, "epoch": 1.5880782918149468, "grad_norm": 1.125, "learning_rate": 0.0004753433211768506, "loss": 5.0935, "mean_token_accuracy": 0.20265328735113144, "num_tokens": 36781410.0, "step": 16065 }, { "entropy": 5.631603002548218, "epoch": 1.588572558323448, "grad_norm": 0.98046875, "learning_rate": 0.00047532725647598563, "loss": 5.0789, "mean_token_accuracy": 0.20963046252727507, "num_tokens": 36792737.0, "step": 16070 }, { "entropy": 5.539771652221679, "epoch": 1.5890668248319493, "grad_norm": 1.0078125, "learning_rate": 0.00047531118684703916, "loss": 4.9948, "mean_token_accuracy": 0.2151851937174797, "num_tokens": 36804626.0, "step": 16075 }, { "entropy": 5.592235803604126, "epoch": 1.5895610913404508, "grad_norm": 1.03125, "learning_rate": 0.0004752951122904064, "loss": 5.1004, "mean_token_accuracy": 0.20185748487710953, "num_tokens": 36815964.0, "step": 16080 }, { "entropy": 5.549988794326782, "epoch": 1.5900553578489522, "grad_norm": 1.046875, "learning_rate": 0.0004752790328064828, "loss": 5.0168, "mean_token_accuracy": 0.21882057785987855, "num_tokens": 36828180.0, "step": 16085 }, { "entropy": 5.578612995147705, "epoch": 1.5905496243574535, "grad_norm": 1.0078125, "learning_rate": 0.00047526294839566393, "loss": 5.0372, "mean_token_accuracy": 0.2138264924287796, "num_tokens": 36839589.0, "step": 16090 }, { "entropy": 5.630566787719727, "epoch": 1.5910438908659548, "grad_norm": 0.97265625, "learning_rate": 0.0004752468590583454, "loss": 5.0307, "mean_token_accuracy": 0.21182961016893387, "num_tokens": 36850392.0, "step": 16095 }, { "entropy": 5.581708145141602, "epoch": 1.5915381573744563, "grad_norm": 0.95703125, "learning_rate": 0.0004752307647949232, "loss": 5.0478, "mean_token_accuracy": 0.2148684084415436, "num_tokens": 36862334.0, "step": 16100 }, { "entropy": 5.523772954940796, "epoch": 1.5920324238829577, "grad_norm": 0.94140625, "learning_rate": 0.000475214665605793, "loss": 5.0423, "mean_token_accuracy": 0.21212013214826583, "num_tokens": 36874837.0, "step": 16105 }, { "entropy": 5.5602006912231445, "epoch": 1.592526690391459, "grad_norm": 1.046875, "learning_rate": 0.000475198561491351, "loss": 5.0888, "mean_token_accuracy": 0.21091907769441604, "num_tokens": 36886375.0, "step": 16110 }, { "entropy": 5.609549045562744, "epoch": 1.5930209568999605, "grad_norm": 0.89453125, "learning_rate": 0.0004751824524519934, "loss": 5.1145, "mean_token_accuracy": 0.203211273252964, "num_tokens": 36897731.0, "step": 16115 }, { "entropy": 5.639375638961792, "epoch": 1.593515223408462, "grad_norm": 1.03125, "learning_rate": 0.0004751663384881163, "loss": 5.1461, "mean_token_accuracy": 0.20179504305124282, "num_tokens": 36909647.0, "step": 16120 }, { "entropy": 5.605992078781128, "epoch": 1.5940094899169632, "grad_norm": 1.046875, "learning_rate": 0.0004751502196001163, "loss": 5.0994, "mean_token_accuracy": 0.20764477252960206, "num_tokens": 36919960.0, "step": 16125 }, { "entropy": 5.611138820648193, "epoch": 1.5945037564254645, "grad_norm": 1.046875, "learning_rate": 0.0004751340957883898, "loss": 5.1145, "mean_token_accuracy": 0.19949364364147187, "num_tokens": 36930520.0, "step": 16130 }, { "entropy": 5.647466135025025, "epoch": 1.594998022933966, "grad_norm": 0.9765625, "learning_rate": 0.0004751179670533335, "loss": 5.0912, "mean_token_accuracy": 0.20575627088546752, "num_tokens": 36942627.0, "step": 16135 }, { "entropy": 5.6051051139831545, "epoch": 1.5954922894424675, "grad_norm": 1.0, "learning_rate": 0.0004751018333953442, "loss": 5.1463, "mean_token_accuracy": 0.20832315534353257, "num_tokens": 36954276.0, "step": 16140 }, { "entropy": 5.563823413848877, "epoch": 1.5959865559509687, "grad_norm": 0.9375, "learning_rate": 0.0004750856948148187, "loss": 5.0715, "mean_token_accuracy": 0.2154904991388321, "num_tokens": 36965840.0, "step": 16145 }, { "entropy": 5.582765245437622, "epoch": 1.59648082245947, "grad_norm": 0.98828125, "learning_rate": 0.0004750695513121541, "loss": 5.0113, "mean_token_accuracy": 0.2137218162417412, "num_tokens": 36977133.0, "step": 16150 }, { "entropy": 5.641218042373657, "epoch": 1.5969750889679717, "grad_norm": 1.03125, "learning_rate": 0.0004750534028877475, "loss": 5.0846, "mean_token_accuracy": 0.20619741976261138, "num_tokens": 36989013.0, "step": 16155 }, { "entropy": 5.5743408203125, "epoch": 1.597469355476473, "grad_norm": 1.0078125, "learning_rate": 0.0004750372495419962, "loss": 5.0354, "mean_token_accuracy": 0.20327659845352172, "num_tokens": 37000324.0, "step": 16160 }, { "entropy": 5.623279476165772, "epoch": 1.5979636219849742, "grad_norm": 1.1015625, "learning_rate": 0.0004750210912752975, "loss": 5.1072, "mean_token_accuracy": 0.21170095801353456, "num_tokens": 37010551.0, "step": 16165 }, { "entropy": 5.693889570236206, "epoch": 1.5984578884934757, "grad_norm": 0.96875, "learning_rate": 0.0004750049280880489, "loss": 5.1548, "mean_token_accuracy": 0.19800064265727996, "num_tokens": 37022732.0, "step": 16170 }, { "entropy": 5.632914304733276, "epoch": 1.5989521550019772, "grad_norm": 0.99609375, "learning_rate": 0.00047498875998064805, "loss": 5.0837, "mean_token_accuracy": 0.2032868131995201, "num_tokens": 37033230.0, "step": 16175 }, { "entropy": 5.592324686050415, "epoch": 1.5994464215104784, "grad_norm": 1.0703125, "learning_rate": 0.0004749725869534926, "loss": 4.9971, "mean_token_accuracy": 0.22010678201913833, "num_tokens": 37043854.0, "step": 16180 }, { "entropy": 5.602157497406006, "epoch": 1.5999406880189797, "grad_norm": 1.0078125, "learning_rate": 0.00047495640900698064, "loss": 5.1214, "mean_token_accuracy": 0.2076443150639534, "num_tokens": 37055208.0, "step": 16185 }, { "entropy": 5.638591527938843, "epoch": 1.6004349545274812, "grad_norm": 1.046875, "learning_rate": 0.00047494022614150995, "loss": 5.1832, "mean_token_accuracy": 0.2012937396764755, "num_tokens": 37065938.0, "step": 16190 }, { "entropy": 5.6247796535491945, "epoch": 1.6009292210359827, "grad_norm": 1.0390625, "learning_rate": 0.0004749240383574786, "loss": 5.0103, "mean_token_accuracy": 0.21133680790662765, "num_tokens": 37077252.0, "step": 16195 }, { "entropy": 5.585537242889404, "epoch": 1.601423487544484, "grad_norm": 1.140625, "learning_rate": 0.000474907845655285, "loss": 5.0682, "mean_token_accuracy": 0.21093760132789613, "num_tokens": 37087443.0, "step": 16200 }, { "entropy": 5.484826993942261, "epoch": 1.6019177540529854, "grad_norm": 1.109375, "learning_rate": 0.0004748916480353273, "loss": 4.9409, "mean_token_accuracy": 0.22552498430013657, "num_tokens": 37097621.0, "step": 16205 }, { "entropy": 5.581682109832764, "epoch": 1.602412020561487, "grad_norm": 0.9609375, "learning_rate": 0.00047487544549800403, "loss": 5.1554, "mean_token_accuracy": 0.2034348204731941, "num_tokens": 37110026.0, "step": 16210 }, { "entropy": 5.579954004287719, "epoch": 1.6029062870699882, "grad_norm": 0.97265625, "learning_rate": 0.0004748592380437138, "loss": 5.0723, "mean_token_accuracy": 0.20482477992773057, "num_tokens": 37121447.0, "step": 16215 }, { "entropy": 5.583770608901977, "epoch": 1.6034005535784894, "grad_norm": 1.015625, "learning_rate": 0.0004748430256728554, "loss": 5.1011, "mean_token_accuracy": 0.20465439110994338, "num_tokens": 37132245.0, "step": 16220 }, { "entropy": 5.67191219329834, "epoch": 1.603894820086991, "grad_norm": 0.96484375, "learning_rate": 0.00047482680838582754, "loss": 5.1384, "mean_token_accuracy": 0.20424682646989822, "num_tokens": 37144135.0, "step": 16225 }, { "entropy": 5.651129722595215, "epoch": 1.6043890865954924, "grad_norm": 0.9765625, "learning_rate": 0.0004748105861830292, "loss": 5.1499, "mean_token_accuracy": 0.20160094350576402, "num_tokens": 37155716.0, "step": 16230 }, { "entropy": 5.646983242034912, "epoch": 1.6048833531039937, "grad_norm": 1.109375, "learning_rate": 0.0004747943590648594, "loss": 5.1885, "mean_token_accuracy": 0.19964427947998048, "num_tokens": 37166701.0, "step": 16235 }, { "entropy": 5.62757363319397, "epoch": 1.605377619612495, "grad_norm": 1.015625, "learning_rate": 0.00047477812703171737, "loss": 5.1428, "mean_token_accuracy": 0.19555430561304094, "num_tokens": 37177655.0, "step": 16240 }, { "entropy": 5.644311189651489, "epoch": 1.6058718861209964, "grad_norm": 1.0546875, "learning_rate": 0.00047476189008400246, "loss": 5.1035, "mean_token_accuracy": 0.2035239666700363, "num_tokens": 37189925.0, "step": 16245 }, { "entropy": 5.577450752258301, "epoch": 1.606366152629498, "grad_norm": 0.9453125, "learning_rate": 0.000474745648222114, "loss": 5.083, "mean_token_accuracy": 0.20667232125997542, "num_tokens": 37200756.0, "step": 16250 }, { "entropy": 5.617319869995117, "epoch": 1.6068604191379992, "grad_norm": 0.88671875, "learning_rate": 0.0004747294014464516, "loss": 5.0933, "mean_token_accuracy": 0.20791623294353484, "num_tokens": 37213252.0, "step": 16255 }, { "entropy": 5.659303760528564, "epoch": 1.6073546856465006, "grad_norm": 1.09375, "learning_rate": 0.000474713149757415, "loss": 5.0958, "mean_token_accuracy": 0.2083221048116684, "num_tokens": 37223754.0, "step": 16260 }, { "entropy": 5.612749671936035, "epoch": 1.6078489521550021, "grad_norm": 0.94921875, "learning_rate": 0.00047469689315540395, "loss": 5.1857, "mean_token_accuracy": 0.19870549142360688, "num_tokens": 37235930.0, "step": 16265 }, { "entropy": 5.575803279876709, "epoch": 1.6083432186635034, "grad_norm": 1.046875, "learning_rate": 0.00047468063164081826, "loss": 4.9583, "mean_token_accuracy": 0.22268344163894654, "num_tokens": 37246794.0, "step": 16270 }, { "entropy": 5.590708875656128, "epoch": 1.6088374851720046, "grad_norm": 0.97265625, "learning_rate": 0.0004746643652140581, "loss": 5.0601, "mean_token_accuracy": 0.20668543875217438, "num_tokens": 37257523.0, "step": 16275 }, { "entropy": 5.58200101852417, "epoch": 1.6093317516805061, "grad_norm": 1.046875, "learning_rate": 0.00047464809387552366, "loss": 5.1759, "mean_token_accuracy": 0.20732638239860535, "num_tokens": 37269505.0, "step": 16280 }, { "entropy": 5.613548278808594, "epoch": 1.6098260181890076, "grad_norm": 0.94140625, "learning_rate": 0.000474631817625615, "loss": 5.0749, "mean_token_accuracy": 0.2096614807844162, "num_tokens": 37281139.0, "step": 16285 }, { "entropy": 5.555200290679932, "epoch": 1.6103202846975089, "grad_norm": 1.03125, "learning_rate": 0.0004746155364647327, "loss": 5.0542, "mean_token_accuracy": 0.21262945383787155, "num_tokens": 37291784.0, "step": 16290 }, { "entropy": 5.566498947143555, "epoch": 1.6108145512060101, "grad_norm": 0.9609375, "learning_rate": 0.00047459925039327727, "loss": 5.1227, "mean_token_accuracy": 0.2055885076522827, "num_tokens": 37302754.0, "step": 16295 }, { "entropy": 5.56909408569336, "epoch": 1.6113088177145116, "grad_norm": 1.0546875, "learning_rate": 0.00047458295941164933, "loss": 5.0524, "mean_token_accuracy": 0.21205779910087585, "num_tokens": 37313478.0, "step": 16300 }, { "entropy": 5.63596134185791, "epoch": 1.611803084223013, "grad_norm": 0.97265625, "learning_rate": 0.0004745666635202496, "loss": 5.0639, "mean_token_accuracy": 0.2093847617506981, "num_tokens": 37325223.0, "step": 16305 }, { "entropy": 5.606675338745117, "epoch": 1.6122973507315144, "grad_norm": 1.03125, "learning_rate": 0.000474550362719479, "loss": 5.0708, "mean_token_accuracy": 0.20600384324789048, "num_tokens": 37336794.0, "step": 16310 }, { "entropy": 5.722767639160156, "epoch": 1.6127916172400159, "grad_norm": 1.0234375, "learning_rate": 0.00047453405700973844, "loss": 5.2552, "mean_token_accuracy": 0.19293907135725022, "num_tokens": 37349171.0, "step": 16315 }, { "entropy": 5.632841396331787, "epoch": 1.6132858837485173, "grad_norm": 0.96875, "learning_rate": 0.0004745177463914292, "loss": 5.1891, "mean_token_accuracy": 0.19806305468082427, "num_tokens": 37362201.0, "step": 16320 }, { "entropy": 5.634905290603638, "epoch": 1.6137801502570186, "grad_norm": 1.0234375, "learning_rate": 0.00047450143086495244, "loss": 5.1352, "mean_token_accuracy": 0.19872395396232606, "num_tokens": 37373858.0, "step": 16325 }, { "entropy": 5.648698854446411, "epoch": 1.6142744167655199, "grad_norm": 0.875, "learning_rate": 0.0004744851104307095, "loss": 5.1325, "mean_token_accuracy": 0.20530378371477126, "num_tokens": 37385973.0, "step": 16330 }, { "entropy": 5.6700139999389645, "epoch": 1.6147686832740213, "grad_norm": 1.015625, "learning_rate": 0.00047446878508910194, "loss": 5.1519, "mean_token_accuracy": 0.20350099205970765, "num_tokens": 37398054.0, "step": 16335 }, { "entropy": 5.646230602264405, "epoch": 1.6152629497825228, "grad_norm": 0.9921875, "learning_rate": 0.00047445245484053133, "loss": 5.1152, "mean_token_accuracy": 0.20578019917011262, "num_tokens": 37408656.0, "step": 16340 }, { "entropy": 5.550836896896362, "epoch": 1.615757216291024, "grad_norm": 1.015625, "learning_rate": 0.0004744361196853994, "loss": 4.9905, "mean_token_accuracy": 0.21831616163253784, "num_tokens": 37420454.0, "step": 16345 }, { "entropy": 5.620539665222168, "epoch": 1.6162514827995254, "grad_norm": 1.0234375, "learning_rate": 0.0004744197796241079, "loss": 5.1112, "mean_token_accuracy": 0.2124205783009529, "num_tokens": 37431879.0, "step": 16350 }, { "entropy": 5.676167345046997, "epoch": 1.6167457493080268, "grad_norm": 0.93359375, "learning_rate": 0.0004744034346570589, "loss": 5.1407, "mean_token_accuracy": 0.20651757270097731, "num_tokens": 37443487.0, "step": 16355 }, { "entropy": 5.522525453567505, "epoch": 1.6172400158165283, "grad_norm": 1.0, "learning_rate": 0.0004743870847846546, "loss": 5.027, "mean_token_accuracy": 0.2155781865119934, "num_tokens": 37455726.0, "step": 16360 }, { "entropy": 5.622258472442627, "epoch": 1.6177342823250296, "grad_norm": 1.171875, "learning_rate": 0.0004743707300072969, "loss": 5.1335, "mean_token_accuracy": 0.20428952425718308, "num_tokens": 37466735.0, "step": 16365 }, { "entropy": 5.686076736450195, "epoch": 1.618228548833531, "grad_norm": 0.93359375, "learning_rate": 0.00047435437032538843, "loss": 5.1878, "mean_token_accuracy": 0.20347058922052383, "num_tokens": 37479599.0, "step": 16370 }, { "entropy": 5.558248710632324, "epoch": 1.6187228153420326, "grad_norm": 1.03125, "learning_rate": 0.00047433800573933147, "loss": 5.1028, "mean_token_accuracy": 0.2050091251730919, "num_tokens": 37490896.0, "step": 16375 }, { "entropy": 5.570889663696289, "epoch": 1.6192170818505338, "grad_norm": 1.0859375, "learning_rate": 0.00047432163624952874, "loss": 5.1163, "mean_token_accuracy": 0.20233470052480698, "num_tokens": 37501474.0, "step": 16380 }, { "entropy": 5.564204216003418, "epoch": 1.619711348359035, "grad_norm": 0.953125, "learning_rate": 0.0004743052618563827, "loss": 5.1235, "mean_token_accuracy": 0.21101645529270172, "num_tokens": 37513410.0, "step": 16385 }, { "entropy": 5.603099536895752, "epoch": 1.6202056148675366, "grad_norm": 1.125, "learning_rate": 0.0004742888825602964, "loss": 5.0105, "mean_token_accuracy": 0.2194668546319008, "num_tokens": 37522612.0, "step": 16390 }, { "entropy": 5.661072444915772, "epoch": 1.620699881376038, "grad_norm": 1.09375, "learning_rate": 0.0004742724983616726, "loss": 5.1636, "mean_token_accuracy": 0.19809482991695404, "num_tokens": 37534320.0, "step": 16395 }, { "entropy": 5.613933134078979, "epoch": 1.6211941478845393, "grad_norm": 0.9921875, "learning_rate": 0.00047425610926091444, "loss": 5.1357, "mean_token_accuracy": 0.1991753935813904, "num_tokens": 37545599.0, "step": 16400 }, { "entropy": 5.634458112716675, "epoch": 1.6216884143930406, "grad_norm": 1.0703125, "learning_rate": 0.0004742397152584251, "loss": 5.1805, "mean_token_accuracy": 0.20842301696538926, "num_tokens": 37558002.0, "step": 16405 }, { "entropy": 5.595667695999145, "epoch": 1.6221826809015423, "grad_norm": 1.0078125, "learning_rate": 0.00047422331635460784, "loss": 5.0602, "mean_token_accuracy": 0.21066149771213533, "num_tokens": 37570808.0, "step": 16410 }, { "entropy": 5.616560316085815, "epoch": 1.6226769474100435, "grad_norm": 1.109375, "learning_rate": 0.00047420691254986615, "loss": 5.0964, "mean_token_accuracy": 0.21390743404626847, "num_tokens": 37581065.0, "step": 16415 }, { "entropy": 5.612736606597901, "epoch": 1.6231712139185448, "grad_norm": 1.125, "learning_rate": 0.00047419050384460345, "loss": 5.0794, "mean_token_accuracy": 0.21136367172002793, "num_tokens": 37592472.0, "step": 16420 }, { "entropy": 5.606675291061402, "epoch": 1.6236654804270463, "grad_norm": 0.99609375, "learning_rate": 0.0004741740902392235, "loss": 5.1026, "mean_token_accuracy": 0.20360047519207, "num_tokens": 37604601.0, "step": 16425 }, { "entropy": 5.624155426025391, "epoch": 1.6241597469355478, "grad_norm": 1.0390625, "learning_rate": 0.0004741576717341299, "loss": 5.0431, "mean_token_accuracy": 0.21151638478040696, "num_tokens": 37615978.0, "step": 16430 }, { "entropy": 5.564244937896729, "epoch": 1.624654013444049, "grad_norm": 0.9921875, "learning_rate": 0.0004741412483297268, "loss": 5.0388, "mean_token_accuracy": 0.2150374636054039, "num_tokens": 37627532.0, "step": 16435 }, { "entropy": 5.625432729721069, "epoch": 1.6251482799525503, "grad_norm": 1.0078125, "learning_rate": 0.0004741248200264181, "loss": 5.1555, "mean_token_accuracy": 0.20312726497650146, "num_tokens": 37640508.0, "step": 16440 }, { "entropy": 5.573958206176758, "epoch": 1.6256425464610518, "grad_norm": 1.1171875, "learning_rate": 0.0004741083868246079, "loss": 5.0249, "mean_token_accuracy": 0.2051164761185646, "num_tokens": 37652095.0, "step": 16445 }, { "entropy": 5.5128344058990475, "epoch": 1.6261368129695533, "grad_norm": 0.9375, "learning_rate": 0.0004740919487247005, "loss": 5.0585, "mean_token_accuracy": 0.21680962294340134, "num_tokens": 37663481.0, "step": 16450 }, { "entropy": 5.644660949707031, "epoch": 1.6266310794780545, "grad_norm": 0.97265625, "learning_rate": 0.0004740755057271003, "loss": 5.0847, "mean_token_accuracy": 0.2081639513373375, "num_tokens": 37675259.0, "step": 16455 }, { "entropy": 5.606770610809326, "epoch": 1.627125345986556, "grad_norm": 1.0234375, "learning_rate": 0.00047405905783221177, "loss": 5.06, "mean_token_accuracy": 0.208561310172081, "num_tokens": 37686006.0, "step": 16460 }, { "entropy": 5.569232368469239, "epoch": 1.6276196124950575, "grad_norm": 1.046875, "learning_rate": 0.00047404260504043945, "loss": 5.0946, "mean_token_accuracy": 0.21001459360122682, "num_tokens": 37697642.0, "step": 16465 }, { "entropy": 5.643761682510376, "epoch": 1.6281138790035588, "grad_norm": 1.0703125, "learning_rate": 0.00047402614735218824, "loss": 5.1183, "mean_token_accuracy": 0.20197266042232515, "num_tokens": 37707714.0, "step": 16470 }, { "entropy": 5.603501987457276, "epoch": 1.62860814551206, "grad_norm": 1.03125, "learning_rate": 0.0004740096847678629, "loss": 5.1002, "mean_token_accuracy": 0.21079923510551452, "num_tokens": 37719562.0, "step": 16475 }, { "entropy": 5.573470211029052, "epoch": 1.6291024120205615, "grad_norm": 1.0859375, "learning_rate": 0.0004739932172878685, "loss": 5.0726, "mean_token_accuracy": 0.21270739436149597, "num_tokens": 37731521.0, "step": 16480 }, { "entropy": 5.632239484786988, "epoch": 1.629596678529063, "grad_norm": 1.03125, "learning_rate": 0.00047397674491261003, "loss": 5.1428, "mean_token_accuracy": 0.20382774174213408, "num_tokens": 37743015.0, "step": 16485 }, { "entropy": 5.648154306411743, "epoch": 1.6300909450375642, "grad_norm": 1.03125, "learning_rate": 0.00047396026764249285, "loss": 5.1107, "mean_token_accuracy": 0.20094010829925538, "num_tokens": 37754219.0, "step": 16490 }, { "entropy": 5.575874519348145, "epoch": 1.6305852115460655, "grad_norm": 1.0859375, "learning_rate": 0.0004739437854779222, "loss": 5.1502, "mean_token_accuracy": 0.20089203715324402, "num_tokens": 37765738.0, "step": 16495 }, { "entropy": 5.427470874786377, "epoch": 1.631079478054567, "grad_norm": 0.98046875, "learning_rate": 0.00047392729841930345, "loss": 4.8811, "mean_token_accuracy": 0.2312359854578972, "num_tokens": 37778647.0, "step": 16500 }, { "entropy": 5.60193510055542, "epoch": 1.6315737445630685, "grad_norm": 1.03125, "learning_rate": 0.00047391080646704237, "loss": 5.1013, "mean_token_accuracy": 0.20892396569252014, "num_tokens": 37790380.0, "step": 16505 }, { "entropy": 5.601191091537475, "epoch": 1.6320680110715697, "grad_norm": 1.0, "learning_rate": 0.00047389430962154464, "loss": 5.0837, "mean_token_accuracy": 0.20496587455272675, "num_tokens": 37802474.0, "step": 16510 }, { "entropy": 5.6117455005645756, "epoch": 1.6325622775800712, "grad_norm": 1.0390625, "learning_rate": 0.00047387780788321594, "loss": 5.1377, "mean_token_accuracy": 0.20475959032773972, "num_tokens": 37814154.0, "step": 16515 }, { "entropy": 5.6922224998474125, "epoch": 1.6330565440885727, "grad_norm": 1.0234375, "learning_rate": 0.0004738613012524624, "loss": 5.084, "mean_token_accuracy": 0.21021141707897187, "num_tokens": 37825371.0, "step": 16520 }, { "entropy": 5.646232604980469, "epoch": 1.633550810597074, "grad_norm": 1.046875, "learning_rate": 0.00047384478972968997, "loss": 5.1087, "mean_token_accuracy": 0.2020147055387497, "num_tokens": 37836475.0, "step": 16525 }, { "entropy": 5.647755146026611, "epoch": 1.6340450771055752, "grad_norm": 0.96875, "learning_rate": 0.00047382827331530483, "loss": 5.1428, "mean_token_accuracy": 0.21048375815153123, "num_tokens": 37848413.0, "step": 16530 }, { "entropy": 5.539681339263916, "epoch": 1.6345393436140767, "grad_norm": 1.1171875, "learning_rate": 0.0004738117520097133, "loss": 5.0206, "mean_token_accuracy": 0.21728241592645645, "num_tokens": 37858174.0, "step": 16535 }, { "entropy": 5.6115415573120115, "epoch": 1.6350336101225782, "grad_norm": 1.0390625, "learning_rate": 0.000473795225813322, "loss": 5.1533, "mean_token_accuracy": 0.20300825983285903, "num_tokens": 37869987.0, "step": 16540 }, { "entropy": 5.591949415206909, "epoch": 1.6355278766310795, "grad_norm": 0.9609375, "learning_rate": 0.00047377869472653704, "loss": 5.0198, "mean_token_accuracy": 0.2177692770957947, "num_tokens": 37882050.0, "step": 16545 }, { "entropy": 5.578992033004761, "epoch": 1.6360221431395807, "grad_norm": 1.0390625, "learning_rate": 0.0004737621587497655, "loss": 5.0797, "mean_token_accuracy": 0.2046356350183487, "num_tokens": 37894537.0, "step": 16550 }, { "entropy": 5.607899951934814, "epoch": 1.6365164096480822, "grad_norm": 1.0078125, "learning_rate": 0.000473745617883414, "loss": 5.0246, "mean_token_accuracy": 0.21649314016103743, "num_tokens": 37905795.0, "step": 16555 }, { "entropy": 5.587925910949707, "epoch": 1.6370106761565837, "grad_norm": 0.953125, "learning_rate": 0.00047372907212788953, "loss": 5.0982, "mean_token_accuracy": 0.21070225536823273, "num_tokens": 37918778.0, "step": 16560 }, { "entropy": 5.599098587036133, "epoch": 1.637504942665085, "grad_norm": 1.0390625, "learning_rate": 0.00047371252148359897, "loss": 5.1723, "mean_token_accuracy": 0.19765920788049698, "num_tokens": 37930963.0, "step": 16565 }, { "entropy": 5.62286410331726, "epoch": 1.6379992091735864, "grad_norm": 1.03125, "learning_rate": 0.0004736959659509496, "loss": 5.1495, "mean_token_accuracy": 0.20569981187582015, "num_tokens": 37943067.0, "step": 16570 }, { "entropy": 5.637635946273804, "epoch": 1.638493475682088, "grad_norm": 1.09375, "learning_rate": 0.0004736794055303487, "loss": 5.1227, "mean_token_accuracy": 0.20555168986320496, "num_tokens": 37953425.0, "step": 16575 }, { "entropy": 5.543217563629151, "epoch": 1.6389877421905892, "grad_norm": 1.03125, "learning_rate": 0.00047366284022220346, "loss": 5.0297, "mean_token_accuracy": 0.21125663220882415, "num_tokens": 37965801.0, "step": 16580 }, { "entropy": 5.644961833953857, "epoch": 1.6394820086990904, "grad_norm": 0.99609375, "learning_rate": 0.0004736462700269216, "loss": 5.1396, "mean_token_accuracy": 0.2045402154326439, "num_tokens": 37978169.0, "step": 16585 }, { "entropy": 5.623996543884277, "epoch": 1.639976275207592, "grad_norm": 0.9765625, "learning_rate": 0.00047362969494491063, "loss": 5.0928, "mean_token_accuracy": 0.2111772418022156, "num_tokens": 37990154.0, "step": 16590 }, { "entropy": 5.624139022827149, "epoch": 1.6404705417160934, "grad_norm": 0.9609375, "learning_rate": 0.00047361311497657845, "loss": 5.0228, "mean_token_accuracy": 0.2117467388510704, "num_tokens": 38001249.0, "step": 16595 }, { "entropy": 5.564885950088501, "epoch": 1.6409648082245947, "grad_norm": 1.0078125, "learning_rate": 0.0004735965301223328, "loss": 5.036, "mean_token_accuracy": 0.21689542829990388, "num_tokens": 38013453.0, "step": 16600 }, { "entropy": 5.631832838058472, "epoch": 1.641459074733096, "grad_norm": 1.0703125, "learning_rate": 0.00047357994038258166, "loss": 5.1941, "mean_token_accuracy": 0.19759431779384612, "num_tokens": 38024463.0, "step": 16605 }, { "entropy": 5.627062225341797, "epoch": 1.6419533412415974, "grad_norm": 0.9453125, "learning_rate": 0.00047356334575773324, "loss": 5.1296, "mean_token_accuracy": 0.20521605461835862, "num_tokens": 38036131.0, "step": 16610 }, { "entropy": 5.588192081451416, "epoch": 1.642447607750099, "grad_norm": 1.0234375, "learning_rate": 0.0004735467462481956, "loss": 5.077, "mean_token_accuracy": 0.2158469095826149, "num_tokens": 38047428.0, "step": 16615 }, { "entropy": 5.581269884109497, "epoch": 1.6429418742586002, "grad_norm": 1.09375, "learning_rate": 0.0004735301418543773, "loss": 5.0896, "mean_token_accuracy": 0.2154875174164772, "num_tokens": 38059864.0, "step": 16620 }, { "entropy": 5.658363103866577, "epoch": 1.6434361407671016, "grad_norm": 1.109375, "learning_rate": 0.00047351353257668675, "loss": 5.1022, "mean_token_accuracy": 0.20411046147346495, "num_tokens": 38071356.0, "step": 16625 }, { "entropy": 5.671265745162964, "epoch": 1.6439304072756031, "grad_norm": 1.09375, "learning_rate": 0.0004734969184155324, "loss": 5.132, "mean_token_accuracy": 0.19943976104259492, "num_tokens": 38082124.0, "step": 16630 }, { "entropy": 5.6305906772613525, "epoch": 1.6444246737841044, "grad_norm": 0.98828125, "learning_rate": 0.00047348029937132306, "loss": 5.1147, "mean_token_accuracy": 0.20358150601387023, "num_tokens": 38093451.0, "step": 16635 }, { "entropy": 5.623329591751099, "epoch": 1.6449189402926057, "grad_norm": 0.9765625, "learning_rate": 0.00047346367544446753, "loss": 5.1107, "mean_token_accuracy": 0.20282532423734664, "num_tokens": 38105078.0, "step": 16640 }, { "entropy": 5.567230987548828, "epoch": 1.6454132068011071, "grad_norm": 1.0859375, "learning_rate": 0.0004734470466353749, "loss": 4.974, "mean_token_accuracy": 0.21667053699493408, "num_tokens": 38114953.0, "step": 16645 }, { "entropy": 5.6091491222381595, "epoch": 1.6459074733096086, "grad_norm": 1.03125, "learning_rate": 0.0004734304129444542, "loss": 5.0479, "mean_token_accuracy": 0.2071279615163803, "num_tokens": 38126465.0, "step": 16650 }, { "entropy": 5.678222179412842, "epoch": 1.6464017398181099, "grad_norm": 0.9765625, "learning_rate": 0.0004734137743721144, "loss": 5.1695, "mean_token_accuracy": 0.1996307447552681, "num_tokens": 38139223.0, "step": 16655 }, { "entropy": 5.533108949661255, "epoch": 1.6468960063266112, "grad_norm": 0.98828125, "learning_rate": 0.000473397130918765, "loss": 5.0554, "mean_token_accuracy": 0.21090508103370667, "num_tokens": 38151676.0, "step": 16660 }, { "entropy": 5.563622236251831, "epoch": 1.6473902728351129, "grad_norm": 0.9765625, "learning_rate": 0.00047338048258481545, "loss": 5.046, "mean_token_accuracy": 0.20862442553043364, "num_tokens": 38162759.0, "step": 16665 }, { "entropy": 5.574644470214844, "epoch": 1.6478845393436141, "grad_norm": 0.92578125, "learning_rate": 0.0004733638293706752, "loss": 5.0706, "mean_token_accuracy": 0.20723206847906112, "num_tokens": 38174820.0, "step": 16670 }, { "entropy": 5.561094522476196, "epoch": 1.6483788058521154, "grad_norm": 1.015625, "learning_rate": 0.000473347171276754, "loss": 4.97, "mean_token_accuracy": 0.21848901063203813, "num_tokens": 38185558.0, "step": 16675 }, { "entropy": 5.609171152114868, "epoch": 1.6488730723606169, "grad_norm": 0.97265625, "learning_rate": 0.0004733305083034617, "loss": 5.1274, "mean_token_accuracy": 0.20784054845571517, "num_tokens": 38198231.0, "step": 16680 }, { "entropy": 5.635039186477661, "epoch": 1.6493673388691183, "grad_norm": 1.0, "learning_rate": 0.00047331384045120803, "loss": 5.1244, "mean_token_accuracy": 0.2097431540489197, "num_tokens": 38209539.0, "step": 16685 }, { "entropy": 5.615074634552002, "epoch": 1.6498616053776196, "grad_norm": 1.0078125, "learning_rate": 0.0004732971677204031, "loss": 5.1466, "mean_token_accuracy": 0.2021052986383438, "num_tokens": 38220873.0, "step": 16690 }, { "entropy": 5.623443126678467, "epoch": 1.6503558718861209, "grad_norm": 1.0234375, "learning_rate": 0.00047328049011145714, "loss": 5.0514, "mean_token_accuracy": 0.215615850687027, "num_tokens": 38231186.0, "step": 16695 }, { "entropy": 5.658980512619019, "epoch": 1.6508501383946224, "grad_norm": 0.96484375, "learning_rate": 0.0004732638076247804, "loss": 5.1714, "mean_token_accuracy": 0.19961674958467485, "num_tokens": 38242152.0, "step": 16700 }, { "entropy": 5.631610918045044, "epoch": 1.6513444049031238, "grad_norm": 1.0, "learning_rate": 0.00047324712026078315, "loss": 5.0881, "mean_token_accuracy": 0.2045463353395462, "num_tokens": 38254281.0, "step": 16705 }, { "entropy": 5.569303131103515, "epoch": 1.651838671411625, "grad_norm": 1.0078125, "learning_rate": 0.000473230428019876, "loss": 4.9952, "mean_token_accuracy": 0.20831136852502824, "num_tokens": 38265120.0, "step": 16710 }, { "entropy": 5.617898416519165, "epoch": 1.6523329379201266, "grad_norm": 1.1015625, "learning_rate": 0.00047321373090246957, "loss": 5.0304, "mean_token_accuracy": 0.21197692602872847, "num_tokens": 38275509.0, "step": 16715 }, { "entropy": 5.54659423828125, "epoch": 1.652827204428628, "grad_norm": 1.03125, "learning_rate": 0.00047319702890897457, "loss": 5.0246, "mean_token_accuracy": 0.2173944503068924, "num_tokens": 38285586.0, "step": 16720 }, { "entropy": 5.625045394897461, "epoch": 1.6533214709371293, "grad_norm": 1.09375, "learning_rate": 0.000473180322039802, "loss": 5.0495, "mean_token_accuracy": 0.20681660771369934, "num_tokens": 38296091.0, "step": 16725 }, { "entropy": 5.582846355438233, "epoch": 1.6538157374456306, "grad_norm": 1.078125, "learning_rate": 0.0004731636102953627, "loss": 5.1308, "mean_token_accuracy": 0.2028467983007431, "num_tokens": 38308520.0, "step": 16730 }, { "entropy": 5.629749917984009, "epoch": 1.654310003954132, "grad_norm": 0.9609375, "learning_rate": 0.0004731468936760679, "loss": 5.1073, "mean_token_accuracy": 0.20724282413721085, "num_tokens": 38320584.0, "step": 16735 }, { "entropy": 5.5965948581695555, "epoch": 1.6548042704626336, "grad_norm": 0.90625, "learning_rate": 0.0004731301721823287, "loss": 5.0773, "mean_token_accuracy": 0.21146097779273987, "num_tokens": 38332646.0, "step": 16740 }, { "entropy": 5.662943601608276, "epoch": 1.6552985369711348, "grad_norm": 1.0625, "learning_rate": 0.0004731134458145566, "loss": 5.0988, "mean_token_accuracy": 0.20579134076833724, "num_tokens": 38343382.0, "step": 16745 }, { "entropy": 5.686185646057129, "epoch": 1.655792803479636, "grad_norm": 0.921875, "learning_rate": 0.00047309671457316295, "loss": 5.1406, "mean_token_accuracy": 0.19697401970624923, "num_tokens": 38354809.0, "step": 16750 }, { "entropy": 5.595534372329712, "epoch": 1.6562870699881376, "grad_norm": 1.015625, "learning_rate": 0.00047307997845855946, "loss": 5.0801, "mean_token_accuracy": 0.2067562997341156, "num_tokens": 38366524.0, "step": 16755 }, { "entropy": 5.548330974578858, "epoch": 1.656781336496639, "grad_norm": 1.0703125, "learning_rate": 0.0004730632374711578, "loss": 5.0188, "mean_token_accuracy": 0.2157275542616844, "num_tokens": 38377645.0, "step": 16760 }, { "entropy": 5.652022123336792, "epoch": 1.6572756030051403, "grad_norm": 1.0625, "learning_rate": 0.0004730464916113696, "loss": 5.1446, "mean_token_accuracy": 0.2108661189675331, "num_tokens": 38389633.0, "step": 16765 }, { "entropy": 5.627861833572387, "epoch": 1.6577698695136418, "grad_norm": 1.0703125, "learning_rate": 0.00047302974087960704, "loss": 5.1402, "mean_token_accuracy": 0.19971160292625428, "num_tokens": 38401255.0, "step": 16770 }, { "entropy": 5.633937931060791, "epoch": 1.6582641360221433, "grad_norm": 1.0546875, "learning_rate": 0.0004730129852762822, "loss": 5.087, "mean_token_accuracy": 0.20278262495994567, "num_tokens": 38413160.0, "step": 16775 }, { "entropy": 5.6047093868255615, "epoch": 1.6587584025306445, "grad_norm": 0.9921875, "learning_rate": 0.00047299622480180716, "loss": 5.1299, "mean_token_accuracy": 0.20023733079433442, "num_tokens": 38423789.0, "step": 16780 }, { "entropy": 5.576287841796875, "epoch": 1.6592526690391458, "grad_norm": 1.0078125, "learning_rate": 0.00047297945945659424, "loss": 5.1171, "mean_token_accuracy": 0.20301329642534255, "num_tokens": 38435031.0, "step": 16785 }, { "entropy": 5.634312295913697, "epoch": 1.6597469355476473, "grad_norm": 1.046875, "learning_rate": 0.00047296268924105594, "loss": 5.0829, "mean_token_accuracy": 0.21500262916088103, "num_tokens": 38445146.0, "step": 16790 }, { "entropy": 5.667566156387329, "epoch": 1.6602412020561488, "grad_norm": 0.95703125, "learning_rate": 0.00047294591415560484, "loss": 5.1199, "mean_token_accuracy": 0.20657151192426682, "num_tokens": 38457429.0, "step": 16795 }, { "entropy": 5.601976442337036, "epoch": 1.66073546856465, "grad_norm": 1.0703125, "learning_rate": 0.0004729291342006535, "loss": 5.0949, "mean_token_accuracy": 0.2104643166065216, "num_tokens": 38468218.0, "step": 16800 }, { "entropy": 5.667354536056519, "epoch": 1.6612297350731513, "grad_norm": 0.95703125, "learning_rate": 0.0004729123493766147, "loss": 5.1435, "mean_token_accuracy": 0.2049088656902313, "num_tokens": 38480841.0, "step": 16805 }, { "entropy": 5.5897706031799315, "epoch": 1.6617240015816528, "grad_norm": 0.94140625, "learning_rate": 0.0004728955596839014, "loss": 5.0378, "mean_token_accuracy": 0.20912363529205322, "num_tokens": 38493115.0, "step": 16810 }, { "entropy": 5.627354145050049, "epoch": 1.6622182680901543, "grad_norm": 0.8984375, "learning_rate": 0.0004728787651229267, "loss": 5.0824, "mean_token_accuracy": 0.20821521580219268, "num_tokens": 38505187.0, "step": 16815 }, { "entropy": 5.646703910827637, "epoch": 1.6627125345986555, "grad_norm": 0.94921875, "learning_rate": 0.00047286196569410366, "loss": 5.176, "mean_token_accuracy": 0.1990718811750412, "num_tokens": 38518736.0, "step": 16820 }, { "entropy": 5.563575410842896, "epoch": 1.663206801107157, "grad_norm": 0.9609375, "learning_rate": 0.00047284516139784556, "loss": 5.0384, "mean_token_accuracy": 0.21198480427265168, "num_tokens": 38529703.0, "step": 16825 }, { "entropy": 5.5785318374633786, "epoch": 1.6637010676156585, "grad_norm": 0.95703125, "learning_rate": 0.0004728283522345658, "loss": 5.0954, "mean_token_accuracy": 0.2032155305147171, "num_tokens": 38542200.0, "step": 16830 }, { "entropy": 5.645762538909912, "epoch": 1.6641953341241598, "grad_norm": 1.046875, "learning_rate": 0.0004728115382046779, "loss": 5.1352, "mean_token_accuracy": 0.20124557316303254, "num_tokens": 38552921.0, "step": 16835 }, { "entropy": 5.659325456619262, "epoch": 1.664689600632661, "grad_norm": 1.0625, "learning_rate": 0.0004727947193085954, "loss": 5.1393, "mean_token_accuracy": 0.2066242516040802, "num_tokens": 38564837.0, "step": 16840 }, { "entropy": 5.654189205169677, "epoch": 1.6651838671411625, "grad_norm": 1.109375, "learning_rate": 0.00047277789554673217, "loss": 5.0964, "mean_token_accuracy": 0.2075004532933235, "num_tokens": 38575786.0, "step": 16845 }, { "entropy": 5.645902347564697, "epoch": 1.665678133649664, "grad_norm": 0.94921875, "learning_rate": 0.00047276106691950204, "loss": 5.1346, "mean_token_accuracy": 0.20019922256469727, "num_tokens": 38588232.0, "step": 16850 }, { "entropy": 5.629886770248413, "epoch": 1.6661724001581653, "grad_norm": 0.90625, "learning_rate": 0.00047274423342731896, "loss": 5.0697, "mean_token_accuracy": 0.19962718486785888, "num_tokens": 38600276.0, "step": 16855 }, { "entropy": 5.627967739105225, "epoch": 1.6666666666666665, "grad_norm": 0.9921875, "learning_rate": 0.0004727273950705971, "loss": 5.0884, "mean_token_accuracy": 0.21263053715229036, "num_tokens": 38611879.0, "step": 16860 }, { "entropy": 5.638565254211426, "epoch": 1.667160933175168, "grad_norm": 0.9921875, "learning_rate": 0.00047271055184975057, "loss": 5.1576, "mean_token_accuracy": 0.20051352679729462, "num_tokens": 38623032.0, "step": 16865 }, { "entropy": 5.644910049438477, "epoch": 1.6676551996836695, "grad_norm": 1.0390625, "learning_rate": 0.0004726937037651939, "loss": 5.1424, "mean_token_accuracy": 0.2103547915816307, "num_tokens": 38633864.0, "step": 16870 }, { "entropy": 5.593103265762329, "epoch": 1.6681494661921707, "grad_norm": 1.0546875, "learning_rate": 0.00047267685081734133, "loss": 5.0787, "mean_token_accuracy": 0.20616680830717088, "num_tokens": 38645208.0, "step": 16875 }, { "entropy": 5.595769214630127, "epoch": 1.6686437327006722, "grad_norm": 1.0859375, "learning_rate": 0.0004726599930066076, "loss": 5.0565, "mean_token_accuracy": 0.21135809719562532, "num_tokens": 38655181.0, "step": 16880 }, { "entropy": 5.650787830352783, "epoch": 1.6691379992091737, "grad_norm": 1.0390625, "learning_rate": 0.0004726431303334074, "loss": 5.1424, "mean_token_accuracy": 0.20223476439714433, "num_tokens": 38667381.0, "step": 16885 }, { "entropy": 5.647785806655884, "epoch": 1.669632265717675, "grad_norm": 0.9296875, "learning_rate": 0.00047262626279815555, "loss": 5.1244, "mean_token_accuracy": 0.20468498915433883, "num_tokens": 38680479.0, "step": 16890 }, { "entropy": 5.613894271850586, "epoch": 1.6701265322261762, "grad_norm": 1.0859375, "learning_rate": 0.000472609390401267, "loss": 5.1063, "mean_token_accuracy": 0.20778726041316986, "num_tokens": 38691737.0, "step": 16895 }, { "entropy": 5.580828332901001, "epoch": 1.6706207987346777, "grad_norm": 1.0234375, "learning_rate": 0.0004725925131431567, "loss": 5.0494, "mean_token_accuracy": 0.2068464994430542, "num_tokens": 38703306.0, "step": 16900 }, { "entropy": 5.6251325607299805, "epoch": 1.6711150652431792, "grad_norm": 0.984375, "learning_rate": 0.00047257563102424, "loss": 5.0833, "mean_token_accuracy": 0.2089063346385956, "num_tokens": 38714683.0, "step": 16905 }, { "entropy": 5.63733057975769, "epoch": 1.6716093317516805, "grad_norm": 0.92578125, "learning_rate": 0.0004725587440449321, "loss": 5.1488, "mean_token_accuracy": 0.20324642658233644, "num_tokens": 38727705.0, "step": 16910 }, { "entropy": 5.6423510074615475, "epoch": 1.6721035982601817, "grad_norm": 1.109375, "learning_rate": 0.00047254185220564843, "loss": 5.1725, "mean_token_accuracy": 0.20280281752347945, "num_tokens": 38738687.0, "step": 16915 }, { "entropy": 5.6242790699005125, "epoch": 1.6725978647686834, "grad_norm": 1.0546875, "learning_rate": 0.00047252495550680453, "loss": 5.0832, "mean_token_accuracy": 0.20265248715877532, "num_tokens": 38749437.0, "step": 16920 }, { "entropy": 5.5302104473114015, "epoch": 1.6730921312771847, "grad_norm": 1.046875, "learning_rate": 0.0004725080539488162, "loss": 4.959, "mean_token_accuracy": 0.22986052483320235, "num_tokens": 38761342.0, "step": 16925 }, { "entropy": 5.644537687301636, "epoch": 1.673586397785686, "grad_norm": 1.0859375, "learning_rate": 0.00047249114753209896, "loss": 5.1498, "mean_token_accuracy": 0.20126670598983765, "num_tokens": 38773019.0, "step": 16930 }, { "entropy": 5.713083124160766, "epoch": 1.6740806642941874, "grad_norm": 1.078125, "learning_rate": 0.00047247423625706894, "loss": 5.1335, "mean_token_accuracy": 0.20493686497211455, "num_tokens": 38785291.0, "step": 16935 }, { "entropy": 5.571661949157715, "epoch": 1.674574930802689, "grad_norm": 0.96875, "learning_rate": 0.000472457320124142, "loss": 5.1073, "mean_token_accuracy": 0.20976669639348983, "num_tokens": 38796926.0, "step": 16940 }, { "entropy": 5.624986839294434, "epoch": 1.6750691973111902, "grad_norm": 0.9765625, "learning_rate": 0.00047244039913373444, "loss": 5.0817, "mean_token_accuracy": 0.2077751412987709, "num_tokens": 38809839.0, "step": 16945 }, { "entropy": 5.683303737640381, "epoch": 1.6755634638196915, "grad_norm": 1.0703125, "learning_rate": 0.0004724234732862624, "loss": 5.1728, "mean_token_accuracy": 0.19703376144170762, "num_tokens": 38823059.0, "step": 16950 }, { "entropy": 5.592754459381103, "epoch": 1.676057730328193, "grad_norm": 1.0625, "learning_rate": 0.0004724065425821422, "loss": 5.0135, "mean_token_accuracy": 0.21605484783649445, "num_tokens": 38834275.0, "step": 16955 }, { "entropy": 5.597435379028321, "epoch": 1.6765519968366944, "grad_norm": 1.03125, "learning_rate": 0.0004723896070217905, "loss": 5.0692, "mean_token_accuracy": 0.2103395164012909, "num_tokens": 38845992.0, "step": 16960 }, { "entropy": 5.600444269180298, "epoch": 1.6770462633451957, "grad_norm": 1.03125, "learning_rate": 0.0004723726666056239, "loss": 5.1651, "mean_token_accuracy": 0.207824444770813, "num_tokens": 38857269.0, "step": 16965 }, { "entropy": 5.60215129852295, "epoch": 1.677540529853697, "grad_norm": 0.96875, "learning_rate": 0.00047235572133405904, "loss": 5.1456, "mean_token_accuracy": 0.2088470846414566, "num_tokens": 38869393.0, "step": 16970 }, { "entropy": 5.716221189498901, "epoch": 1.6780347963621987, "grad_norm": 1.0078125, "learning_rate": 0.00047233877120751277, "loss": 5.1241, "mean_token_accuracy": 0.2056146577000618, "num_tokens": 38881625.0, "step": 16975 }, { "entropy": 5.663712120056152, "epoch": 1.6785290628707, "grad_norm": 0.9453125, "learning_rate": 0.00047232181622640216, "loss": 5.0974, "mean_token_accuracy": 0.20322421193122864, "num_tokens": 38892452.0, "step": 16980 }, { "entropy": 5.5888747215271, "epoch": 1.6790233293792012, "grad_norm": 1.1015625, "learning_rate": 0.0004723048563911443, "loss": 4.9841, "mean_token_accuracy": 0.221028895676136, "num_tokens": 38902415.0, "step": 16985 }, { "entropy": 5.597122621536255, "epoch": 1.6795175958877027, "grad_norm": 0.98828125, "learning_rate": 0.00047228789170215623, "loss": 5.0502, "mean_token_accuracy": 0.21787447035312651, "num_tokens": 38912655.0, "step": 16990 }, { "entropy": 5.6055848598480225, "epoch": 1.6800118623962041, "grad_norm": 0.98046875, "learning_rate": 0.00047227092215985553, "loss": 5.0888, "mean_token_accuracy": 0.20499154031276703, "num_tokens": 38923295.0, "step": 16995 }, { "entropy": 5.646879434585571, "epoch": 1.6805061289047054, "grad_norm": 0.875, "learning_rate": 0.0004722539477646595, "loss": 5.1412, "mean_token_accuracy": 0.2032402515411377, "num_tokens": 38934879.0, "step": 17000 }, { "entropy": 5.667455959320068, "epoch": 1.6810003954132067, "grad_norm": 0.953125, "learning_rate": 0.00047223696851698575, "loss": 5.2113, "mean_token_accuracy": 0.19655613601207733, "num_tokens": 38946574.0, "step": 17005 }, { "entropy": 5.623772192001343, "epoch": 1.6814946619217082, "grad_norm": 1.0625, "learning_rate": 0.000472219984417252, "loss": 5.1222, "mean_token_accuracy": 0.2051793858408928, "num_tokens": 38958136.0, "step": 17010 }, { "entropy": 5.663246583938599, "epoch": 1.6819889284302096, "grad_norm": 0.921875, "learning_rate": 0.0004722029954658761, "loss": 5.0612, "mean_token_accuracy": 0.2150219738483429, "num_tokens": 38969353.0, "step": 17015 }, { "entropy": 5.559848213195801, "epoch": 1.682483194938711, "grad_norm": 1.0625, "learning_rate": 0.0004721860016632758, "loss": 5.048, "mean_token_accuracy": 0.21512711346149443, "num_tokens": 38979878.0, "step": 17020 }, { "entropy": 5.63106894493103, "epoch": 1.6829774614472124, "grad_norm": 0.8984375, "learning_rate": 0.0004721690030098693, "loss": 5.183, "mean_token_accuracy": 0.2076355293393135, "num_tokens": 38992847.0, "step": 17025 }, { "entropy": 5.600835275650025, "epoch": 1.6834717279557139, "grad_norm": 0.9375, "learning_rate": 0.0004721519995060748, "loss": 5.0847, "mean_token_accuracy": 0.2081436887383461, "num_tokens": 39003874.0, "step": 17030 }, { "entropy": 5.624861145019532, "epoch": 1.6839659944642151, "grad_norm": 1.1484375, "learning_rate": 0.00047213499115231043, "loss": 5.0659, "mean_token_accuracy": 0.20849672257900237, "num_tokens": 39014327.0, "step": 17035 }, { "entropy": 5.604206180572509, "epoch": 1.6844602609727164, "grad_norm": 1.0703125, "learning_rate": 0.0004721179779489948, "loss": 5.0584, "mean_token_accuracy": 0.20310909301042557, "num_tokens": 39024507.0, "step": 17040 }, { "entropy": 5.609818077087402, "epoch": 1.6849545274812179, "grad_norm": 1.0625, "learning_rate": 0.00047210095989654624, "loss": 5.0714, "mean_token_accuracy": 0.20161157548427583, "num_tokens": 39036184.0, "step": 17045 }, { "entropy": 5.56157808303833, "epoch": 1.6854487939897194, "grad_norm": 1.03125, "learning_rate": 0.00047208393699538356, "loss": 5.0115, "mean_token_accuracy": 0.2155532106757164, "num_tokens": 39047649.0, "step": 17050 }, { "entropy": 5.570810985565186, "epoch": 1.6859430604982206, "grad_norm": 1.0078125, "learning_rate": 0.00047206690924592545, "loss": 5.0585, "mean_token_accuracy": 0.20958683341741563, "num_tokens": 39058167.0, "step": 17055 }, { "entropy": 5.60229983329773, "epoch": 1.6864373270067219, "grad_norm": 1.109375, "learning_rate": 0.0004720498766485907, "loss": 5.0918, "mean_token_accuracy": 0.2105751723051071, "num_tokens": 39070099.0, "step": 17060 }, { "entropy": 5.600150108337402, "epoch": 1.6869315935152234, "grad_norm": 1.015625, "learning_rate": 0.00047203283920379846, "loss": 5.0308, "mean_token_accuracy": 0.211593097448349, "num_tokens": 39080337.0, "step": 17065 }, { "entropy": 5.699786186218262, "epoch": 1.6874258600237249, "grad_norm": 0.875, "learning_rate": 0.00047201579691196784, "loss": 5.265, "mean_token_accuracy": 0.19461636543273925, "num_tokens": 39093455.0, "step": 17070 }, { "entropy": 5.680332183837891, "epoch": 1.6879201265322261, "grad_norm": 0.9765625, "learning_rate": 0.00047199874977351807, "loss": 5.0798, "mean_token_accuracy": 0.20551842004060744, "num_tokens": 39105424.0, "step": 17075 }, { "entropy": 5.574416208267212, "epoch": 1.6884143930407276, "grad_norm": 0.9609375, "learning_rate": 0.0004719816977888685, "loss": 5.0277, "mean_token_accuracy": 0.21643696278333663, "num_tokens": 39117441.0, "step": 17080 }, { "entropy": 5.600017404556274, "epoch": 1.688908659549229, "grad_norm": 0.95703125, "learning_rate": 0.00047196464095843857, "loss": 5.1359, "mean_token_accuracy": 0.1991147056221962, "num_tokens": 39129853.0, "step": 17085 }, { "entropy": 5.642088794708252, "epoch": 1.6894029260577303, "grad_norm": 1.0234375, "learning_rate": 0.0004719475792826479, "loss": 5.0486, "mean_token_accuracy": 0.211736299097538, "num_tokens": 39141132.0, "step": 17090 }, { "entropy": 5.529931497573853, "epoch": 1.6898971925662316, "grad_norm": 0.97265625, "learning_rate": 0.0004719305127619162, "loss": 5.0479, "mean_token_accuracy": 0.221005642414093, "num_tokens": 39153892.0, "step": 17095 }, { "entropy": 5.587333345413208, "epoch": 1.690391459074733, "grad_norm": 1.03125, "learning_rate": 0.0004719134413966635, "loss": 5.0128, "mean_token_accuracy": 0.21835585981607436, "num_tokens": 39164410.0, "step": 17100 }, { "entropy": 5.590937757492066, "epoch": 1.6908857255832346, "grad_norm": 1.046875, "learning_rate": 0.00047189636518730945, "loss": 5.0147, "mean_token_accuracy": 0.21712839603424072, "num_tokens": 39174612.0, "step": 17105 }, { "entropy": 5.652185106277466, "epoch": 1.6913799920917358, "grad_norm": 1.1015625, "learning_rate": 0.00047187928413427424, "loss": 5.0702, "mean_token_accuracy": 0.2104039967060089, "num_tokens": 39187355.0, "step": 17110 }, { "entropy": 5.62473692893982, "epoch": 1.691874258600237, "grad_norm": 1.1171875, "learning_rate": 0.00047186219823797815, "loss": 5.1171, "mean_token_accuracy": 0.2029208645224571, "num_tokens": 39199145.0, "step": 17115 }, { "entropy": 5.666260433197022, "epoch": 1.6923685251087386, "grad_norm": 0.97265625, "learning_rate": 0.00047184510749884146, "loss": 5.1541, "mean_token_accuracy": 0.2044594928622246, "num_tokens": 39210589.0, "step": 17120 }, { "entropy": 5.559412002563477, "epoch": 1.69286279161724, "grad_norm": 1.015625, "learning_rate": 0.0004718280119172846, "loss": 5.0323, "mean_token_accuracy": 0.21233490705490113, "num_tokens": 39222657.0, "step": 17125 }, { "entropy": 5.572614860534668, "epoch": 1.6933570581257413, "grad_norm": 1.0625, "learning_rate": 0.00047181091149372807, "loss": 5.0126, "mean_token_accuracy": 0.2207656666636467, "num_tokens": 39233439.0, "step": 17130 }, { "entropy": 5.564647197723389, "epoch": 1.6938513246342428, "grad_norm": 1.03125, "learning_rate": 0.0004717938062285926, "loss": 5.0228, "mean_token_accuracy": 0.21810393780469894, "num_tokens": 39243787.0, "step": 17135 }, { "entropy": 5.6436535835266115, "epoch": 1.6943455911427443, "grad_norm": 0.9921875, "learning_rate": 0.00047177669612229894, "loss": 5.108, "mean_token_accuracy": 0.2048338308930397, "num_tokens": 39255658.0, "step": 17140 }, { "entropy": 5.648793077468872, "epoch": 1.6948398576512456, "grad_norm": 0.98046875, "learning_rate": 0.00047175958117526805, "loss": 5.1209, "mean_token_accuracy": 0.2019812911748886, "num_tokens": 39269480.0, "step": 17145 }, { "entropy": 5.622503995895386, "epoch": 1.6953341241597468, "grad_norm": 1.0, "learning_rate": 0.00047174246138792096, "loss": 5.1462, "mean_token_accuracy": 0.20712246745824814, "num_tokens": 39281063.0, "step": 17150 }, { "entropy": 5.662272644042969, "epoch": 1.6958283906682483, "grad_norm": 1.0078125, "learning_rate": 0.00047172533676067874, "loss": 5.0928, "mean_token_accuracy": 0.2035623461008072, "num_tokens": 39292188.0, "step": 17155 }, { "entropy": 5.6210943222045895, "epoch": 1.6963226571767498, "grad_norm": 0.98828125, "learning_rate": 0.0004717082072939628, "loss": 5.1166, "mean_token_accuracy": 0.20159979313611984, "num_tokens": 39303661.0, "step": 17160 }, { "entropy": 5.599538326263428, "epoch": 1.696816923685251, "grad_norm": 0.98046875, "learning_rate": 0.0004716910729881944, "loss": 5.0924, "mean_token_accuracy": 0.2002613678574562, "num_tokens": 39315028.0, "step": 17165 }, { "entropy": 5.57334189414978, "epoch": 1.6973111901937523, "grad_norm": 1.0390625, "learning_rate": 0.00047167393384379513, "loss": 5.0037, "mean_token_accuracy": 0.2129130944609642, "num_tokens": 39326629.0, "step": 17170 }, { "entropy": 5.52201828956604, "epoch": 1.6978054567022538, "grad_norm": 0.9296875, "learning_rate": 0.00047165678986118653, "loss": 4.9967, "mean_token_accuracy": 0.21940028965473174, "num_tokens": 39338821.0, "step": 17175 }, { "entropy": 5.554665660858154, "epoch": 1.6982997232107553, "grad_norm": 1.0, "learning_rate": 0.0004716396410407904, "loss": 5.0103, "mean_token_accuracy": 0.20450480729341508, "num_tokens": 39350093.0, "step": 17180 }, { "entropy": 5.570998764038086, "epoch": 1.6987939897192565, "grad_norm": 1.03125, "learning_rate": 0.0004716224873830286, "loss": 4.9972, "mean_token_accuracy": 0.220351904630661, "num_tokens": 39361120.0, "step": 17185 }, { "entropy": 5.629751586914063, "epoch": 1.699288256227758, "grad_norm": 0.9921875, "learning_rate": 0.00047160532888832315, "loss": 5.0972, "mean_token_accuracy": 0.20546750575304032, "num_tokens": 39373040.0, "step": 17190 }, { "entropy": 5.616208887100219, "epoch": 1.6997825227362595, "grad_norm": 0.96484375, "learning_rate": 0.00047158816555709597, "loss": 5.0269, "mean_token_accuracy": 0.21504770666360856, "num_tokens": 39384576.0, "step": 17195 }, { "entropy": 5.5665661811828615, "epoch": 1.7002767892447608, "grad_norm": 0.8828125, "learning_rate": 0.0004715709973897696, "loss": 5.0167, "mean_token_accuracy": 0.21544964015483856, "num_tokens": 39397550.0, "step": 17200 }, { "entropy": 5.623475694656372, "epoch": 1.700771055753262, "grad_norm": 1.21875, "learning_rate": 0.00047155382438676604, "loss": 5.1077, "mean_token_accuracy": 0.21239760518074036, "num_tokens": 39407474.0, "step": 17205 }, { "entropy": 5.611954593658448, "epoch": 1.7012653222617635, "grad_norm": 0.953125, "learning_rate": 0.00047153664654850803, "loss": 5.0557, "mean_token_accuracy": 0.2116763859987259, "num_tokens": 39420104.0, "step": 17210 }, { "entropy": 5.69795413017273, "epoch": 1.701759588770265, "grad_norm": 0.97265625, "learning_rate": 0.00047151946387541795, "loss": 5.1931, "mean_token_accuracy": 0.19514567106962205, "num_tokens": 39431887.0, "step": 17215 }, { "entropy": 5.579754734039307, "epoch": 1.7022538552787663, "grad_norm": 1.015625, "learning_rate": 0.0004715022763679185, "loss": 5.046, "mean_token_accuracy": 0.21272858530282973, "num_tokens": 39442772.0, "step": 17220 }, { "entropy": 5.684418678283691, "epoch": 1.7027481217872675, "grad_norm": 0.921875, "learning_rate": 0.00047148508402643273, "loss": 5.1474, "mean_token_accuracy": 0.20664598643779755, "num_tokens": 39455067.0, "step": 17225 }, { "entropy": 5.643764543533325, "epoch": 1.7032423882957692, "grad_norm": 1.03125, "learning_rate": 0.0004714678868513834, "loss": 5.1407, "mean_token_accuracy": 0.20559087842702867, "num_tokens": 39466700.0, "step": 17230 }, { "entropy": 5.626100349426269, "epoch": 1.7037366548042705, "grad_norm": 1.09375, "learning_rate": 0.0004714506848431935, "loss": 5.1188, "mean_token_accuracy": 0.21142179071903228, "num_tokens": 39477591.0, "step": 17235 }, { "entropy": 5.624287843704224, "epoch": 1.7042309213127718, "grad_norm": 1.0625, "learning_rate": 0.00047143347800228624, "loss": 5.121, "mean_token_accuracy": 0.20180582702159883, "num_tokens": 39488615.0, "step": 17240 }, { "entropy": 5.6582193851470945, "epoch": 1.7047251878212732, "grad_norm": 1.0546875, "learning_rate": 0.000471416266329085, "loss": 5.1196, "mean_token_accuracy": 0.2043942391872406, "num_tokens": 39499610.0, "step": 17245 }, { "entropy": 5.6404633045196535, "epoch": 1.7052194543297747, "grad_norm": 1.09375, "learning_rate": 0.0004713990498240131, "loss": 5.0739, "mean_token_accuracy": 0.20743662118911743, "num_tokens": 39511180.0, "step": 17250 }, { "entropy": 5.561827230453491, "epoch": 1.705713720838276, "grad_norm": 1.0078125, "learning_rate": 0.00047138182848749415, "loss": 5.1105, "mean_token_accuracy": 0.2122265115380287, "num_tokens": 39523271.0, "step": 17255 }, { "entropy": 5.6465301513671875, "epoch": 1.7062079873467773, "grad_norm": 0.953125, "learning_rate": 0.0004713646023199518, "loss": 5.1145, "mean_token_accuracy": 0.2099142700433731, "num_tokens": 39534334.0, "step": 17260 }, { "entropy": 5.601046228408814, "epoch": 1.7067022538552787, "grad_norm": 0.94921875, "learning_rate": 0.0004713473713218097, "loss": 5.0199, "mean_token_accuracy": 0.2158074587583542, "num_tokens": 39545937.0, "step": 17265 }, { "entropy": 5.6703063488006595, "epoch": 1.7071965203637802, "grad_norm": 0.953125, "learning_rate": 0.0004713301354934918, "loss": 5.1345, "mean_token_accuracy": 0.2042662739753723, "num_tokens": 39558129.0, "step": 17270 }, { "entropy": 5.636465835571289, "epoch": 1.7076907868722815, "grad_norm": 1.03125, "learning_rate": 0.0004713128948354221, "loss": 5.1308, "mean_token_accuracy": 0.210024194419384, "num_tokens": 39569649.0, "step": 17275 }, { "entropy": 5.6543323516845705, "epoch": 1.708185053380783, "grad_norm": 1.078125, "learning_rate": 0.0004712956493480248, "loss": 5.1226, "mean_token_accuracy": 0.20256010591983795, "num_tokens": 39581051.0, "step": 17280 }, { "entropy": 5.6727863311767575, "epoch": 1.7086793198892845, "grad_norm": 1.1328125, "learning_rate": 0.000471278399031724, "loss": 5.1179, "mean_token_accuracy": 0.20681007355451583, "num_tokens": 39591225.0, "step": 17285 }, { "entropy": 5.579549980163574, "epoch": 1.7091735863977857, "grad_norm": 1.1171875, "learning_rate": 0.0004712611438869442, "loss": 4.9932, "mean_token_accuracy": 0.22073368728160858, "num_tokens": 39601270.0, "step": 17290 }, { "entropy": 5.5662736892700195, "epoch": 1.709667852906287, "grad_norm": 1.0234375, "learning_rate": 0.00047124388391410975, "loss": 4.9525, "mean_token_accuracy": 0.21443592458963395, "num_tokens": 39611574.0, "step": 17295 }, { "entropy": 5.547994327545166, "epoch": 1.7101621194147885, "grad_norm": 0.99609375, "learning_rate": 0.0004712266191136453, "loss": 5.0449, "mean_token_accuracy": 0.21948888897895813, "num_tokens": 39622889.0, "step": 17300 }, { "entropy": 5.608999633789063, "epoch": 1.71065638592329, "grad_norm": 1.0078125, "learning_rate": 0.0004712093494859757, "loss": 5.078, "mean_token_accuracy": 0.20621571093797683, "num_tokens": 39634286.0, "step": 17305 }, { "entropy": 5.642487192153931, "epoch": 1.7111506524317912, "grad_norm": 1.0390625, "learning_rate": 0.0004711920750315255, "loss": 5.154, "mean_token_accuracy": 0.20193358957767488, "num_tokens": 39646653.0, "step": 17310 }, { "entropy": 5.583581590652466, "epoch": 1.7116449189402925, "grad_norm": 1.5, "learning_rate": 0.0004711747957507199, "loss": 5.0756, "mean_token_accuracy": 0.2106478288769722, "num_tokens": 39658027.0, "step": 17315 }, { "entropy": 5.680062675476075, "epoch": 1.712139185448794, "grad_norm": 1.046875, "learning_rate": 0.00047115751164398395, "loss": 5.129, "mean_token_accuracy": 0.2052829831838608, "num_tokens": 39669912.0, "step": 17320 }, { "entropy": 5.591894054412842, "epoch": 1.7126334519572954, "grad_norm": 1.0703125, "learning_rate": 0.0004711402227117427, "loss": 5.0879, "mean_token_accuracy": 0.21313223093748093, "num_tokens": 39680857.0, "step": 17325 }, { "entropy": 5.631395673751831, "epoch": 1.7131277184657967, "grad_norm": 1.03125, "learning_rate": 0.00047112292895442156, "loss": 5.0526, "mean_token_accuracy": 0.21376217007637024, "num_tokens": 39692301.0, "step": 17330 }, { "entropy": 5.620531988143921, "epoch": 1.7136219849742982, "grad_norm": 1.1484375, "learning_rate": 0.000471105630372446, "loss": 5.0915, "mean_token_accuracy": 0.20618654489517213, "num_tokens": 39703641.0, "step": 17335 }, { "entropy": 5.603141117095947, "epoch": 1.7141162514827997, "grad_norm": 0.97265625, "learning_rate": 0.00047108832696624145, "loss": 5.0623, "mean_token_accuracy": 0.21962355971336364, "num_tokens": 39714919.0, "step": 17340 }, { "entropy": 5.545233201980591, "epoch": 1.714610517991301, "grad_norm": 0.9921875, "learning_rate": 0.0004710710187362336, "loss": 5.0697, "mean_token_accuracy": 0.21534564346075058, "num_tokens": 39725658.0, "step": 17345 }, { "entropy": 5.601299476623535, "epoch": 1.7151047844998022, "grad_norm": 1.015625, "learning_rate": 0.00047105370568284834, "loss": 5.0237, "mean_token_accuracy": 0.21798133105039597, "num_tokens": 39736899.0, "step": 17350 }, { "entropy": 5.670847606658936, "epoch": 1.7155990510083037, "grad_norm": 1.0234375, "learning_rate": 0.0004710363878065115, "loss": 5.1859, "mean_token_accuracy": 0.19644586145877838, "num_tokens": 39747875.0, "step": 17355 }, { "entropy": 5.687805700302124, "epoch": 1.7160933175168052, "grad_norm": 0.9921875, "learning_rate": 0.0004710190651076491, "loss": 5.1317, "mean_token_accuracy": 0.20567018836736678, "num_tokens": 39760253.0, "step": 17360 }, { "entropy": 5.6632341861724855, "epoch": 1.7165875840253064, "grad_norm": 1.0390625, "learning_rate": 0.0004710017375866872, "loss": 5.1108, "mean_token_accuracy": 0.20391863733530044, "num_tokens": 39771031.0, "step": 17365 }, { "entropy": 5.549928283691406, "epoch": 1.7170818505338077, "grad_norm": 1.171875, "learning_rate": 0.00047098440524405227, "loss": 5.0432, "mean_token_accuracy": 0.2109706446528435, "num_tokens": 39780850.0, "step": 17370 }, { "entropy": 5.589961099624634, "epoch": 1.7175761170423092, "grad_norm": 1.0, "learning_rate": 0.0004709670680801705, "loss": 5.1299, "mean_token_accuracy": 0.21724978387355803, "num_tokens": 39792975.0, "step": 17375 }, { "entropy": 5.657631826400757, "epoch": 1.7180703835508107, "grad_norm": 0.9921875, "learning_rate": 0.0004709497260954685, "loss": 5.1001, "mean_token_accuracy": 0.21650630384683608, "num_tokens": 39803574.0, "step": 17380 }, { "entropy": 5.586514568328857, "epoch": 1.718564650059312, "grad_norm": 0.9765625, "learning_rate": 0.00047093237929037284, "loss": 5.0687, "mean_token_accuracy": 0.20621376484632492, "num_tokens": 39814907.0, "step": 17385 }, { "entropy": 5.6329789638519285, "epoch": 1.7190589165678134, "grad_norm": 1.0, "learning_rate": 0.0004709150276653101, "loss": 5.0577, "mean_token_accuracy": 0.20564621537923813, "num_tokens": 39826344.0, "step": 17390 }, { "entropy": 5.648505640029907, "epoch": 1.7195531830763149, "grad_norm": 0.96875, "learning_rate": 0.00047089767122070756, "loss": 5.0647, "mean_token_accuracy": 0.20791766047477722, "num_tokens": 39838516.0, "step": 17395 }, { "entropy": 5.794493103027344, "epoch": 1.7200474495848161, "grad_norm": 1.0078125, "learning_rate": 0.00047088030995699173, "loss": 5.2859, "mean_token_accuracy": 0.19396543353796006, "num_tokens": 39850757.0, "step": 17400 }, { "entropy": 5.703511190414429, "epoch": 1.7205417160933174, "grad_norm": 1.125, "learning_rate": 0.0004708629438745899, "loss": 5.1652, "mean_token_accuracy": 0.20031564682722092, "num_tokens": 39861105.0, "step": 17405 }, { "entropy": 5.658168029785156, "epoch": 1.721035982601819, "grad_norm": 0.94921875, "learning_rate": 0.0004708455729739293, "loss": 5.1631, "mean_token_accuracy": 0.2006612464785576, "num_tokens": 39873999.0, "step": 17410 }, { "entropy": 5.572813987731934, "epoch": 1.7215302491103204, "grad_norm": 1.0, "learning_rate": 0.00047082819725543726, "loss": 5.1049, "mean_token_accuracy": 0.2041738897562027, "num_tokens": 39885768.0, "step": 17415 }, { "entropy": 5.702720499038696, "epoch": 1.7220245156188216, "grad_norm": 0.94921875, "learning_rate": 0.0004708108167195411, "loss": 5.1362, "mean_token_accuracy": 0.20366823822259902, "num_tokens": 39897548.0, "step": 17420 }, { "entropy": 5.631142663955688, "epoch": 1.722518782127323, "grad_norm": 0.9609375, "learning_rate": 0.0004707934313666685, "loss": 5.0598, "mean_token_accuracy": 0.21818998754024505, "num_tokens": 39909192.0, "step": 17425 }, { "entropy": 5.6069862842559814, "epoch": 1.7230130486358244, "grad_norm": 1.0859375, "learning_rate": 0.0004707760411972471, "loss": 5.0708, "mean_token_accuracy": 0.20918026566505432, "num_tokens": 39921279.0, "step": 17430 }, { "entropy": 5.681897211074829, "epoch": 1.7235073151443259, "grad_norm": 1.25, "learning_rate": 0.0004707586462117048, "loss": 5.0924, "mean_token_accuracy": 0.20393919497728347, "num_tokens": 39931638.0, "step": 17435 }, { "entropy": 5.612461090087891, "epoch": 1.7240015816528271, "grad_norm": 0.9609375, "learning_rate": 0.00047074124641046934, "loss": 5.0909, "mean_token_accuracy": 0.20777184814214705, "num_tokens": 39944239.0, "step": 17440 }, { "entropy": 5.6934521198272705, "epoch": 1.7244958481613286, "grad_norm": 1.0859375, "learning_rate": 0.0004707238417939689, "loss": 5.1617, "mean_token_accuracy": 0.19719092845916747, "num_tokens": 39956486.0, "step": 17445 }, { "entropy": 5.557765245437622, "epoch": 1.72499011466983, "grad_norm": 1.03125, "learning_rate": 0.0004707064323626316, "loss": 4.9479, "mean_token_accuracy": 0.22306529581546783, "num_tokens": 39966271.0, "step": 17450 }, { "entropy": 5.608198022842407, "epoch": 1.7254843811783314, "grad_norm": 0.97265625, "learning_rate": 0.00047068901811688564, "loss": 5.1152, "mean_token_accuracy": 0.2064355880022049, "num_tokens": 39978810.0, "step": 17455 }, { "entropy": 5.593552017211914, "epoch": 1.7259786476868326, "grad_norm": 0.98828125, "learning_rate": 0.0004706715990571595, "loss": 5.0536, "mean_token_accuracy": 0.21379542499780654, "num_tokens": 39989331.0, "step": 17460 }, { "entropy": 5.60614423751831, "epoch": 1.726472914195334, "grad_norm": 1.0703125, "learning_rate": 0.0004706541751838817, "loss": 5.0228, "mean_token_accuracy": 0.20855866819620134, "num_tokens": 39999931.0, "step": 17465 }, { "entropy": 5.626467990875244, "epoch": 1.7269671807038356, "grad_norm": 1.015625, "learning_rate": 0.0004706367464974808, "loss": 5.0157, "mean_token_accuracy": 0.2123204618692398, "num_tokens": 40010702.0, "step": 17470 }, { "entropy": 5.606916046142578, "epoch": 1.7274614472123369, "grad_norm": 0.94140625, "learning_rate": 0.00047061931299838554, "loss": 5.1164, "mean_token_accuracy": 0.20874683558940887, "num_tokens": 40022897.0, "step": 17475 }, { "entropy": 5.585560703277588, "epoch": 1.7279557137208381, "grad_norm": 1.0078125, "learning_rate": 0.000470601874687025, "loss": 5.0756, "mean_token_accuracy": 0.20956991910934447, "num_tokens": 40034057.0, "step": 17480 }, { "entropy": 5.6016875267028805, "epoch": 1.7284499802293398, "grad_norm": 1.0546875, "learning_rate": 0.0004705844315638279, "loss": 5.0943, "mean_token_accuracy": 0.2069302812218666, "num_tokens": 40044595.0, "step": 17485 }, { "entropy": 5.648400974273682, "epoch": 1.728944246737841, "grad_norm": 1.0078125, "learning_rate": 0.0004705669836292234, "loss": 5.07, "mean_token_accuracy": 0.20607781708240508, "num_tokens": 40055175.0, "step": 17490 }, { "entropy": 5.609479188919067, "epoch": 1.7294385132463423, "grad_norm": 0.98046875, "learning_rate": 0.0004705495308836408, "loss": 4.9861, "mean_token_accuracy": 0.21643590480089187, "num_tokens": 40065276.0, "step": 17495 }, { "entropy": 5.608193349838257, "epoch": 1.7299327797548438, "grad_norm": 0.97265625, "learning_rate": 0.0004705320733275094, "loss": 5.1163, "mean_token_accuracy": 0.20656183511018752, "num_tokens": 40077230.0, "step": 17500 }, { "entropy": 5.570828676223755, "epoch": 1.7304270462633453, "grad_norm": 1.1640625, "learning_rate": 0.0004705146109612587, "loss": 4.9671, "mean_token_accuracy": 0.2209431156516075, "num_tokens": 40088058.0, "step": 17505 }, { "entropy": 5.55942668914795, "epoch": 1.7309213127718466, "grad_norm": 1.078125, "learning_rate": 0.0004704971437853182, "loss": 5.0401, "mean_token_accuracy": 0.20841981917619706, "num_tokens": 40099618.0, "step": 17510 }, { "entropy": 5.619865798950196, "epoch": 1.7314155792803478, "grad_norm": 1.0234375, "learning_rate": 0.0004704796718001176, "loss": 5.1521, "mean_token_accuracy": 0.20959735661745071, "num_tokens": 40111088.0, "step": 17515 }, { "entropy": 5.670025300979614, "epoch": 1.7319098457888493, "grad_norm": 1.1640625, "learning_rate": 0.00047046219500608685, "loss": 5.1197, "mean_token_accuracy": 0.20570991039276124, "num_tokens": 40122191.0, "step": 17520 }, { "entropy": 5.656544923782349, "epoch": 1.7324041122973508, "grad_norm": 0.98046875, "learning_rate": 0.0004704447134036557, "loss": 5.141, "mean_token_accuracy": 0.19886110424995423, "num_tokens": 40133764.0, "step": 17525 }, { "entropy": 5.60163950920105, "epoch": 1.732898378805852, "grad_norm": 0.953125, "learning_rate": 0.00047042722699325426, "loss": 5.0369, "mean_token_accuracy": 0.21385132074356078, "num_tokens": 40144502.0, "step": 17530 }, { "entropy": 5.618469381332398, "epoch": 1.7333926453143536, "grad_norm": 0.99609375, "learning_rate": 0.0004704097357753128, "loss": 5.0646, "mean_token_accuracy": 0.2086172565817833, "num_tokens": 40155606.0, "step": 17535 }, { "entropy": 5.583535623550415, "epoch": 1.733886911822855, "grad_norm": 1.109375, "learning_rate": 0.0004703922397502614, "loss": 5.0427, "mean_token_accuracy": 0.21588583737611772, "num_tokens": 40166551.0, "step": 17540 }, { "entropy": 5.695721817016602, "epoch": 1.7343811783313563, "grad_norm": 0.98828125, "learning_rate": 0.00047037473891853066, "loss": 5.231, "mean_token_accuracy": 0.20325567573308945, "num_tokens": 40178804.0, "step": 17545 }, { "entropy": 5.686409425735474, "epoch": 1.7348754448398576, "grad_norm": 0.95703125, "learning_rate": 0.00047035723328055104, "loss": 5.1068, "mean_token_accuracy": 0.20559338182210923, "num_tokens": 40189861.0, "step": 17550 }, { "entropy": 5.576591873168946, "epoch": 1.735369711348359, "grad_norm": 0.93359375, "learning_rate": 0.0004703397228367532, "loss": 5.0191, "mean_token_accuracy": 0.21609163284301758, "num_tokens": 40202619.0, "step": 17555 }, { "entropy": 5.602781343460083, "epoch": 1.7358639778568605, "grad_norm": 1.0078125, "learning_rate": 0.00047032220758756786, "loss": 5.0304, "mean_token_accuracy": 0.20908728688955308, "num_tokens": 40213509.0, "step": 17560 }, { "entropy": 5.686196279525757, "epoch": 1.7363582443653618, "grad_norm": 1.0390625, "learning_rate": 0.0004703046875334259, "loss": 5.1207, "mean_token_accuracy": 0.2082460641860962, "num_tokens": 40224960.0, "step": 17565 }, { "entropy": 5.5903702735900875, "epoch": 1.736852510873863, "grad_norm": 1.0234375, "learning_rate": 0.00047028716267475827, "loss": 5.0836, "mean_token_accuracy": 0.2127421796321869, "num_tokens": 40238516.0, "step": 17570 }, { "entropy": 5.635223007202148, "epoch": 1.7373467773823645, "grad_norm": 1.109375, "learning_rate": 0.0004702696330119963, "loss": 5.1805, "mean_token_accuracy": 0.1994725450873375, "num_tokens": 40249123.0, "step": 17575 }, { "entropy": 5.669913864135742, "epoch": 1.737841043890866, "grad_norm": 1.0703125, "learning_rate": 0.0004702520985455709, "loss": 5.1122, "mean_token_accuracy": 0.2119538351893425, "num_tokens": 40260168.0, "step": 17580 }, { "entropy": 5.697174072265625, "epoch": 1.7383353103993673, "grad_norm": 1.03125, "learning_rate": 0.00047023455927591365, "loss": 5.1661, "mean_token_accuracy": 0.1991693452000618, "num_tokens": 40273183.0, "step": 17585 }, { "entropy": 5.692202520370484, "epoch": 1.7388295769078688, "grad_norm": 1.0546875, "learning_rate": 0.00047021701520345594, "loss": 5.1207, "mean_token_accuracy": 0.20273709744215013, "num_tokens": 40284452.0, "step": 17590 }, { "entropy": 5.589716911315918, "epoch": 1.7393238434163703, "grad_norm": 1.0390625, "learning_rate": 0.00047019946632862944, "loss": 5.0284, "mean_token_accuracy": 0.21259427964687347, "num_tokens": 40295267.0, "step": 17595 }, { "entropy": 5.5849583625793455, "epoch": 1.7398181099248715, "grad_norm": 0.98046875, "learning_rate": 0.00047018191265186566, "loss": 5.0165, "mean_token_accuracy": 0.21756792813539505, "num_tokens": 40306766.0, "step": 17600 }, { "entropy": 5.578857517242431, "epoch": 1.7403123764333728, "grad_norm": 1.015625, "learning_rate": 0.00047016435417359667, "loss": 5.0338, "mean_token_accuracy": 0.21207704693078994, "num_tokens": 40317382.0, "step": 17605 }, { "entropy": 5.648937511444092, "epoch": 1.7408066429418743, "grad_norm": 1.046875, "learning_rate": 0.00047014679089425423, "loss": 5.0969, "mean_token_accuracy": 0.2076997861266136, "num_tokens": 40328273.0, "step": 17610 }, { "entropy": 5.641238069534301, "epoch": 1.7413009094503757, "grad_norm": 1.09375, "learning_rate": 0.00047012922281427046, "loss": 5.1172, "mean_token_accuracy": 0.21610067635774613, "num_tokens": 40340550.0, "step": 17615 }, { "entropy": 5.714932870864868, "epoch": 1.741795175958877, "grad_norm": 0.984375, "learning_rate": 0.00047011164993407753, "loss": 5.1511, "mean_token_accuracy": 0.20430633574724197, "num_tokens": 40351752.0, "step": 17620 }, { "entropy": 5.6320713520050045, "epoch": 1.7422894424673783, "grad_norm": 0.9921875, "learning_rate": 0.00047009407225410776, "loss": 5.0205, "mean_token_accuracy": 0.21375680714845657, "num_tokens": 40363330.0, "step": 17625 }, { "entropy": 5.53848934173584, "epoch": 1.7427837089758798, "grad_norm": 0.9609375, "learning_rate": 0.0004700764897747936, "loss": 4.9804, "mean_token_accuracy": 0.21785327941179275, "num_tokens": 40375674.0, "step": 17630 }, { "entropy": 5.5552146434783936, "epoch": 1.7432779754843812, "grad_norm": 0.9765625, "learning_rate": 0.0004700589024965674, "loss": 5.0646, "mean_token_accuracy": 0.21175557523965835, "num_tokens": 40387120.0, "step": 17635 }, { "entropy": 5.590317964553833, "epoch": 1.7437722419928825, "grad_norm": 1.0, "learning_rate": 0.000470041310419862, "loss": 5.0663, "mean_token_accuracy": 0.21144843697547913, "num_tokens": 40399196.0, "step": 17640 }, { "entropy": 5.6205892086029055, "epoch": 1.744266508501384, "grad_norm": 0.98046875, "learning_rate": 0.0004700237135451101, "loss": 5.0884, "mean_token_accuracy": 0.2106338322162628, "num_tokens": 40411693.0, "step": 17645 }, { "entropy": 5.537706184387207, "epoch": 1.7447607750098855, "grad_norm": 1.03125, "learning_rate": 0.0004700061118727446, "loss": 4.9805, "mean_token_accuracy": 0.222697676718235, "num_tokens": 40422866.0, "step": 17650 }, { "entropy": 5.5675757884979244, "epoch": 1.7452550415183867, "grad_norm": 0.96875, "learning_rate": 0.0004699885054031985, "loss": 5.1285, "mean_token_accuracy": 0.21705474257469176, "num_tokens": 40435028.0, "step": 17655 }, { "entropy": 5.733217859268189, "epoch": 1.745749308026888, "grad_norm": 0.92578125, "learning_rate": 0.000469970894136905, "loss": 5.2036, "mean_token_accuracy": 0.20082123726606368, "num_tokens": 40446802.0, "step": 17660 }, { "entropy": 5.7069906234741214, "epoch": 1.7462435745353895, "grad_norm": 1.0390625, "learning_rate": 0.00046995327807429715, "loss": 5.1449, "mean_token_accuracy": 0.20663772970438005, "num_tokens": 40459025.0, "step": 17665 }, { "entropy": 5.658199119567871, "epoch": 1.746737841043891, "grad_norm": 0.9921875, "learning_rate": 0.00046993565721580846, "loss": 5.1601, "mean_token_accuracy": 0.199946628510952, "num_tokens": 40471486.0, "step": 17670 }, { "entropy": 5.5955729484558105, "epoch": 1.7472321075523922, "grad_norm": 0.99609375, "learning_rate": 0.0004699180315618723, "loss": 5.0257, "mean_token_accuracy": 0.21620751470327376, "num_tokens": 40483163.0, "step": 17675 }, { "entropy": 5.659731721878051, "epoch": 1.7477263740608935, "grad_norm": 1.0625, "learning_rate": 0.0004699004011129224, "loss": 5.0239, "mean_token_accuracy": 0.20473215430974961, "num_tokens": 40494475.0, "step": 17680 }, { "entropy": 5.575578832626343, "epoch": 1.748220640569395, "grad_norm": 1.1171875, "learning_rate": 0.00046988276586939234, "loss": 5.0898, "mean_token_accuracy": 0.20918691754341126, "num_tokens": 40504557.0, "step": 17685 }, { "entropy": 5.537972450256348, "epoch": 1.7487149070778965, "grad_norm": 1.1171875, "learning_rate": 0.0004698651258317161, "loss": 5.0392, "mean_token_accuracy": 0.2140949100255966, "num_tokens": 40516147.0, "step": 17690 }, { "entropy": 5.599554347991943, "epoch": 1.7492091735863977, "grad_norm": 0.9765625, "learning_rate": 0.0004698474810003274, "loss": 5.0343, "mean_token_accuracy": 0.21819851845502852, "num_tokens": 40527238.0, "step": 17695 }, { "entropy": 5.587231731414795, "epoch": 1.7497034400948992, "grad_norm": 1.046875, "learning_rate": 0.0004698298313756605, "loss": 4.9961, "mean_token_accuracy": 0.21516417264938353, "num_tokens": 40537470.0, "step": 17700 }, { "entropy": 5.567436027526855, "epoch": 1.7501977066034007, "grad_norm": 1.015625, "learning_rate": 0.00046981217695814953, "loss": 5.0384, "mean_token_accuracy": 0.2142973229289055, "num_tokens": 40549865.0, "step": 17705 }, { "entropy": 5.719965553283691, "epoch": 1.750691973111902, "grad_norm": 0.9375, "learning_rate": 0.0004697945177482287, "loss": 5.1406, "mean_token_accuracy": 0.20203239768743514, "num_tokens": 40561796.0, "step": 17710 }, { "entropy": 5.597134399414062, "epoch": 1.7511862396204032, "grad_norm": 1.21875, "learning_rate": 0.00046977685374633267, "loss": 4.9958, "mean_token_accuracy": 0.21192828118801116, "num_tokens": 40574597.0, "step": 17715 }, { "entropy": 5.5883544921875, "epoch": 1.7516805061289047, "grad_norm": 1.015625, "learning_rate": 0.00046975918495289576, "loss": 5.0863, "mean_token_accuracy": 0.20769154280424118, "num_tokens": 40586549.0, "step": 17720 }, { "entropy": 5.613870286941529, "epoch": 1.7521747726374062, "grad_norm": 1.0078125, "learning_rate": 0.0004697415113683527, "loss": 5.0532, "mean_token_accuracy": 0.21326100081205368, "num_tokens": 40597808.0, "step": 17725 }, { "entropy": 5.701170873641968, "epoch": 1.7526690391459074, "grad_norm": 1.140625, "learning_rate": 0.00046972383299313813, "loss": 5.2172, "mean_token_accuracy": 0.2023148149251938, "num_tokens": 40608636.0, "step": 17730 }, { "entropy": 5.637395906448364, "epoch": 1.7531633056544087, "grad_norm": 1.09375, "learning_rate": 0.0004697061498276872, "loss": 5.0766, "mean_token_accuracy": 0.21291877776384355, "num_tokens": 40619099.0, "step": 17735 }, { "entropy": 5.6175604343414305, "epoch": 1.7536575721629104, "grad_norm": 1.015625, "learning_rate": 0.00046968846187243473, "loss": 5.0257, "mean_token_accuracy": 0.21724378168582917, "num_tokens": 40630436.0, "step": 17740 }, { "entropy": 5.611420392990112, "epoch": 1.7541518386714117, "grad_norm": 1.0234375, "learning_rate": 0.00046967076912781585, "loss": 5.1013, "mean_token_accuracy": 0.215313121676445, "num_tokens": 40643078.0, "step": 17745 }, { "entropy": 5.592301750183106, "epoch": 1.754646105179913, "grad_norm": 1.078125, "learning_rate": 0.00046965307159426594, "loss": 5.041, "mean_token_accuracy": 0.21027908027172088, "num_tokens": 40653368.0, "step": 17750 }, { "entropy": 5.640551805496216, "epoch": 1.7551403716884144, "grad_norm": 1.0625, "learning_rate": 0.0004696353692722202, "loss": 5.0984, "mean_token_accuracy": 0.20734711438417436, "num_tokens": 40665377.0, "step": 17755 }, { "entropy": 5.663043260574341, "epoch": 1.755634638196916, "grad_norm": 1.140625, "learning_rate": 0.0004696176621621143, "loss": 5.1829, "mean_token_accuracy": 0.20557086914777756, "num_tokens": 40676599.0, "step": 17760 }, { "entropy": 5.623388290405273, "epoch": 1.7561289047054172, "grad_norm": 1.0625, "learning_rate": 0.0004695999502643836, "loss": 5.0365, "mean_token_accuracy": 0.21904126405715943, "num_tokens": 40687619.0, "step": 17765 }, { "entropy": 5.56389422416687, "epoch": 1.7566231712139184, "grad_norm": 0.97265625, "learning_rate": 0.00046958223357946395, "loss": 5.0442, "mean_token_accuracy": 0.21334367543458937, "num_tokens": 40699410.0, "step": 17770 }, { "entropy": 5.643612909317016, "epoch": 1.75711743772242, "grad_norm": 1.0546875, "learning_rate": 0.00046956451210779113, "loss": 5.1051, "mean_token_accuracy": 0.2014136552810669, "num_tokens": 40711149.0, "step": 17775 }, { "entropy": 5.577234125137329, "epoch": 1.7576117042309214, "grad_norm": 1.015625, "learning_rate": 0.00046954678584980113, "loss": 5.0726, "mean_token_accuracy": 0.21793222725391387, "num_tokens": 40722997.0, "step": 17780 }, { "entropy": 5.651458978652954, "epoch": 1.7581059707394227, "grad_norm": 1.1640625, "learning_rate": 0.00046952905480593014, "loss": 5.1287, "mean_token_accuracy": 0.21406314074993132, "num_tokens": 40733786.0, "step": 17785 }, { "entropy": 5.662873125076294, "epoch": 1.758600237247924, "grad_norm": 1.0234375, "learning_rate": 0.00046951131897661415, "loss": 5.1752, "mean_token_accuracy": 0.20344533622264863, "num_tokens": 40745925.0, "step": 17790 }, { "entropy": 5.663121700286865, "epoch": 1.7590945037564256, "grad_norm": 0.921875, "learning_rate": 0.00046949357836228946, "loss": 5.1514, "mean_token_accuracy": 0.20542600005865097, "num_tokens": 40760031.0, "step": 17795 }, { "entropy": 5.668500280380249, "epoch": 1.7595887702649269, "grad_norm": 1.203125, "learning_rate": 0.00046947583296339266, "loss": 5.161, "mean_token_accuracy": 0.20992569029331207, "num_tokens": 40771557.0, "step": 17800 }, { "entropy": 5.644318437576294, "epoch": 1.7600830367734281, "grad_norm": 1.046875, "learning_rate": 0.00046945808278036017, "loss": 5.1484, "mean_token_accuracy": 0.19976101368665694, "num_tokens": 40783557.0, "step": 17805 }, { "entropy": 5.584117650985718, "epoch": 1.7605773032819296, "grad_norm": 1.046875, "learning_rate": 0.0004694403278136287, "loss": 4.9832, "mean_token_accuracy": 0.21871382296085357, "num_tokens": 40794213.0, "step": 17810 }, { "entropy": 5.533468437194824, "epoch": 1.7610715697904311, "grad_norm": 0.953125, "learning_rate": 0.00046942256806363497, "loss": 4.9902, "mean_token_accuracy": 0.21686056703329087, "num_tokens": 40805753.0, "step": 17815 }, { "entropy": 5.626663303375244, "epoch": 1.7615658362989324, "grad_norm": 0.98828125, "learning_rate": 0.00046940480353081587, "loss": 5.1739, "mean_token_accuracy": 0.20669473856687545, "num_tokens": 40818315.0, "step": 17820 }, { "entropy": 5.599307632446289, "epoch": 1.7620601028074336, "grad_norm": 1.078125, "learning_rate": 0.0004693870342156085, "loss": 5.0337, "mean_token_accuracy": 0.21764670610427855, "num_tokens": 40828740.0, "step": 17825 }, { "entropy": 5.603894376754761, "epoch": 1.7625543693159351, "grad_norm": 1.0859375, "learning_rate": 0.0004693692601184499, "loss": 5.0937, "mean_token_accuracy": 0.2072587251663208, "num_tokens": 40841035.0, "step": 17830 }, { "entropy": 5.602542543411255, "epoch": 1.7630486358244366, "grad_norm": 1.0859375, "learning_rate": 0.0004693514812397774, "loss": 5.0902, "mean_token_accuracy": 0.2148335963487625, "num_tokens": 40851857.0, "step": 17835 }, { "entropy": 5.666842079162597, "epoch": 1.7635429023329379, "grad_norm": 0.9609375, "learning_rate": 0.0004693336975800283, "loss": 5.1265, "mean_token_accuracy": 0.20868967324495316, "num_tokens": 40863964.0, "step": 17840 }, { "entropy": 5.607761573791504, "epoch": 1.7640371688414394, "grad_norm": 1.0390625, "learning_rate": 0.00046931590913964013, "loss": 5.1028, "mean_token_accuracy": 0.20492272675037385, "num_tokens": 40876076.0, "step": 17845 }, { "entropy": 5.704649925231934, "epoch": 1.7645314353499408, "grad_norm": 1.1015625, "learning_rate": 0.00046929811591905034, "loss": 5.181, "mean_token_accuracy": 0.19913834929466248, "num_tokens": 40887839.0, "step": 17850 }, { "entropy": 5.6874391555786135, "epoch": 1.765025701858442, "grad_norm": 1.0625, "learning_rate": 0.0004692803179186968, "loss": 5.1459, "mean_token_accuracy": 0.20896546840667723, "num_tokens": 40898978.0, "step": 17855 }, { "entropy": 5.684002494812011, "epoch": 1.7655199683669434, "grad_norm": 1.0390625, "learning_rate": 0.0004692625151390173, "loss": 5.0736, "mean_token_accuracy": 0.20590097457170486, "num_tokens": 40910990.0, "step": 17860 }, { "entropy": 5.569335079193115, "epoch": 1.7660142348754448, "grad_norm": 0.98046875, "learning_rate": 0.0004692447075804498, "loss": 5.0435, "mean_token_accuracy": 0.21376760452985763, "num_tokens": 40922299.0, "step": 17865 }, { "entropy": 5.649651956558228, "epoch": 1.7665085013839463, "grad_norm": 1.03125, "learning_rate": 0.0004692268952434324, "loss": 5.107, "mean_token_accuracy": 0.20678063333034516, "num_tokens": 40933181.0, "step": 17870 }, { "entropy": 5.5636828422546385, "epoch": 1.7670027678924476, "grad_norm": 1.046875, "learning_rate": 0.0004692090781284032, "loss": 5.0869, "mean_token_accuracy": 0.2106851488351822, "num_tokens": 40944101.0, "step": 17875 }, { "entropy": 5.661847257614136, "epoch": 1.7674970344009489, "grad_norm": 1.0, "learning_rate": 0.0004691912562358006, "loss": 5.086, "mean_token_accuracy": 0.2123752936720848, "num_tokens": 40956492.0, "step": 17880 }, { "entropy": 5.676560688018799, "epoch": 1.7679913009094503, "grad_norm": 1.0078125, "learning_rate": 0.00046917342956606287, "loss": 5.1734, "mean_token_accuracy": 0.20163812786340712, "num_tokens": 40967477.0, "step": 17885 }, { "entropy": 5.685799789428711, "epoch": 1.7684855674179518, "grad_norm": 1.1015625, "learning_rate": 0.0004691555981196287, "loss": 5.153, "mean_token_accuracy": 0.20818835645914077, "num_tokens": 40978756.0, "step": 17890 }, { "entropy": 5.651121330261231, "epoch": 1.768979833926453, "grad_norm": 1.0625, "learning_rate": 0.0004691377618969367, "loss": 5.09, "mean_token_accuracy": 0.212821663916111, "num_tokens": 40990583.0, "step": 17895 }, { "entropy": 5.5949263095855715, "epoch": 1.7694741004349546, "grad_norm": 1.015625, "learning_rate": 0.00046911992089842565, "loss": 5.0243, "mean_token_accuracy": 0.2110041558742523, "num_tokens": 41002197.0, "step": 17900 }, { "entropy": 5.615978050231933, "epoch": 1.769968366943456, "grad_norm": 0.90234375, "learning_rate": 0.0004691020751245344, "loss": 5.0957, "mean_token_accuracy": 0.2101765513420105, "num_tokens": 41014038.0, "step": 17905 }, { "entropy": 5.584890937805175, "epoch": 1.7704626334519573, "grad_norm": 0.99609375, "learning_rate": 0.000469084224575702, "loss": 5.0284, "mean_token_accuracy": 0.2111211597919464, "num_tokens": 41025752.0, "step": 17910 }, { "entropy": 5.602554273605347, "epoch": 1.7709568999604586, "grad_norm": 1.078125, "learning_rate": 0.0004690663692523676, "loss": 5.0706, "mean_token_accuracy": 0.21555192321538924, "num_tokens": 41035974.0, "step": 17915 }, { "entropy": 5.572289657592774, "epoch": 1.77145116646896, "grad_norm": 1.0, "learning_rate": 0.00046904850915497037, "loss": 5.0364, "mean_token_accuracy": 0.2092446431517601, "num_tokens": 41047669.0, "step": 17920 }, { "entropy": 5.699800205230713, "epoch": 1.7719454329774615, "grad_norm": 1.0546875, "learning_rate": 0.0004690306442839497, "loss": 5.1354, "mean_token_accuracy": 0.20263245701789856, "num_tokens": 41059123.0, "step": 17925 }, { "entropy": 5.586166429519653, "epoch": 1.7724396994859628, "grad_norm": 1.0078125, "learning_rate": 0.0004690127746397451, "loss": 5.0202, "mean_token_accuracy": 0.21495632380247115, "num_tokens": 41070382.0, "step": 17930 }, { "entropy": 5.641909742355347, "epoch": 1.772933965994464, "grad_norm": 0.921875, "learning_rate": 0.00046899490022279613, "loss": 5.1071, "mean_token_accuracy": 0.21140794903039933, "num_tokens": 41081672.0, "step": 17935 }, { "entropy": 5.701880884170532, "epoch": 1.7734282325029656, "grad_norm": 1.046875, "learning_rate": 0.00046897702103354256, "loss": 5.1114, "mean_token_accuracy": 0.21204788833856583, "num_tokens": 41092448.0, "step": 17940 }, { "entropy": 5.643621349334717, "epoch": 1.773922499011467, "grad_norm": 1.0703125, "learning_rate": 0.00046895913707242423, "loss": 5.0421, "mean_token_accuracy": 0.21429447829723358, "num_tokens": 41103316.0, "step": 17945 }, { "entropy": 5.586219692230225, "epoch": 1.7744167655199683, "grad_norm": 1.0078125, "learning_rate": 0.0004689412483398809, "loss": 5.0586, "mean_token_accuracy": 0.20907151103019714, "num_tokens": 41114991.0, "step": 17950 }, { "entropy": 5.6106020450592045, "epoch": 1.7749110320284698, "grad_norm": 0.9296875, "learning_rate": 0.00046892335483635284, "loss": 5.043, "mean_token_accuracy": 0.20893514305353164, "num_tokens": 41126693.0, "step": 17955 }, { "entropy": 5.623128414154053, "epoch": 1.7754052985369713, "grad_norm": 0.9375, "learning_rate": 0.0004689054565622801, "loss": 5.0697, "mean_token_accuracy": 0.21594154238700866, "num_tokens": 41138344.0, "step": 17960 }, { "entropy": 5.619167709350586, "epoch": 1.7758995650454725, "grad_norm": 1.0390625, "learning_rate": 0.0004688875535181032, "loss": 5.0604, "mean_token_accuracy": 0.21544145941734313, "num_tokens": 41148962.0, "step": 17965 }, { "entropy": 5.61306414604187, "epoch": 1.7763938315539738, "grad_norm": 1.0859375, "learning_rate": 0.00046886964570426226, "loss": 4.9689, "mean_token_accuracy": 0.21499695628881454, "num_tokens": 41159317.0, "step": 17970 }, { "entropy": 5.63417329788208, "epoch": 1.7768880980624753, "grad_norm": 1.0078125, "learning_rate": 0.0004688517331211981, "loss": 5.0635, "mean_token_accuracy": 0.2097182586789131, "num_tokens": 41170646.0, "step": 17975 }, { "entropy": 5.622626304626465, "epoch": 1.7773823645709768, "grad_norm": 0.98046875, "learning_rate": 0.0004688338157693511, "loss": 5.0887, "mean_token_accuracy": 0.2024792104959488, "num_tokens": 41182868.0, "step": 17980 }, { "entropy": 5.585670423507691, "epoch": 1.777876631079478, "grad_norm": 1.0625, "learning_rate": 0.00046881589364916224, "loss": 5.005, "mean_token_accuracy": 0.21184975951910018, "num_tokens": 41194556.0, "step": 17985 }, { "entropy": 5.640451860427857, "epoch": 1.7783708975879793, "grad_norm": 0.9609375, "learning_rate": 0.0004687979667610722, "loss": 5.0567, "mean_token_accuracy": 0.21567105054855346, "num_tokens": 41207082.0, "step": 17990 }, { "entropy": 5.606506776809693, "epoch": 1.778865164096481, "grad_norm": 1.1640625, "learning_rate": 0.00046878003510552224, "loss": 5.066, "mean_token_accuracy": 0.2076279789209366, "num_tokens": 41217436.0, "step": 17995 }, { "entropy": 5.602188396453857, "epoch": 1.7793594306049823, "grad_norm": 0.9609375, "learning_rate": 0.0004687620986829533, "loss": 5.0444, "mean_token_accuracy": 0.2072078675031662, "num_tokens": 41228750.0, "step": 18000 }, { "epoch": 1.7793594306049823, "eval_entropy": 5.346589060463149, "eval_loss": 5.116301536560059, "eval_mean_token_accuracy": 0.2154179375494978, "eval_num_tokens": 41228750.0, "eval_runtime": 20.2376, "eval_samples_per_second": 1606.567, "eval_steps_per_second": 200.864, "step": 18000 }, { "entropy": 5.571775722503662, "epoch": 1.7798536971134835, "grad_norm": 1.125, "learning_rate": 0.00046874415749380673, "loss": 5.0622, "mean_token_accuracy": 0.2077022522687912, "num_tokens": 41239110.0, "step": 18005 }, { "entropy": 5.597383975982666, "epoch": 1.780347963621985, "grad_norm": 1.2109375, "learning_rate": 0.0004687262115385237, "loss": 5.0713, "mean_token_accuracy": 0.20876192152500153, "num_tokens": 41251239.0, "step": 18010 }, { "entropy": 5.645862483978272, "epoch": 1.7808422301304865, "grad_norm": 0.984375, "learning_rate": 0.000468708260817546, "loss": 5.1334, "mean_token_accuracy": 0.20513046979904176, "num_tokens": 41263996.0, "step": 18015 }, { "entropy": 5.729241418838501, "epoch": 1.7813364966389877, "grad_norm": 1.015625, "learning_rate": 0.00046869030533131493, "loss": 5.1794, "mean_token_accuracy": 0.20209298878908158, "num_tokens": 41277210.0, "step": 18020 }, { "entropy": 5.633277511596679, "epoch": 1.781830763147489, "grad_norm": 1.109375, "learning_rate": 0.0004686723450802723, "loss": 5.089, "mean_token_accuracy": 0.21079284846782684, "num_tokens": 41288383.0, "step": 18025 }, { "entropy": 5.643166255950928, "epoch": 1.7823250296559905, "grad_norm": 1.0234375, "learning_rate": 0.00046865438006486, "loss": 5.0619, "mean_token_accuracy": 0.2110056608915329, "num_tokens": 41300970.0, "step": 18030 }, { "entropy": 5.689360523223877, "epoch": 1.782819296164492, "grad_norm": 1.09375, "learning_rate": 0.00046863641028551984, "loss": 5.1068, "mean_token_accuracy": 0.2037048503756523, "num_tokens": 41312289.0, "step": 18035 }, { "entropy": 5.598718500137329, "epoch": 1.7833135626729932, "grad_norm": 0.98828125, "learning_rate": 0.00046861843574269395, "loss": 5.0043, "mean_token_accuracy": 0.20807235240936278, "num_tokens": 41323562.0, "step": 18040 }, { "entropy": 5.587372589111328, "epoch": 1.7838078291814945, "grad_norm": 0.98828125, "learning_rate": 0.0004686004564368245, "loss": 5.0543, "mean_token_accuracy": 0.2103486105799675, "num_tokens": 41335175.0, "step": 18045 }, { "entropy": 5.617983627319336, "epoch": 1.7843020956899962, "grad_norm": 1.046875, "learning_rate": 0.0004685824723683538, "loss": 5.0407, "mean_token_accuracy": 0.21997049003839492, "num_tokens": 41346160.0, "step": 18050 }, { "entropy": 5.620994901657104, "epoch": 1.7847963621984975, "grad_norm": 1.0234375, "learning_rate": 0.0004685644835377242, "loss": 5.1692, "mean_token_accuracy": 0.2029450163245201, "num_tokens": 41358619.0, "step": 18055 }, { "entropy": 5.713794183731079, "epoch": 1.7852906287069987, "grad_norm": 0.95703125, "learning_rate": 0.00046854648994537835, "loss": 5.0546, "mean_token_accuracy": 0.21474725008010864, "num_tokens": 41369034.0, "step": 18060 }, { "entropy": 5.685398435592651, "epoch": 1.7857848952155002, "grad_norm": 1.0703125, "learning_rate": 0.0004685284915917588, "loss": 5.1113, "mean_token_accuracy": 0.20298452526330948, "num_tokens": 41380700.0, "step": 18065 }, { "entropy": 5.668594264984131, "epoch": 1.7862791617240017, "grad_norm": 1.109375, "learning_rate": 0.00046851048847730835, "loss": 5.1223, "mean_token_accuracy": 0.20253825932741165, "num_tokens": 41391297.0, "step": 18070 }, { "entropy": 5.654129695892334, "epoch": 1.786773428232503, "grad_norm": 0.9765625, "learning_rate": 0.00046849248060246986, "loss": 5.1615, "mean_token_accuracy": 0.20067658573389052, "num_tokens": 41403418.0, "step": 18075 }, { "entropy": 5.669223022460938, "epoch": 1.7872676947410042, "grad_norm": 1.015625, "learning_rate": 0.00046847446796768633, "loss": 5.0975, "mean_token_accuracy": 0.20541063100099563, "num_tokens": 41414220.0, "step": 18080 }, { "entropy": 5.661696577072144, "epoch": 1.7877619612495057, "grad_norm": 1.078125, "learning_rate": 0.0004684564505734008, "loss": 5.123, "mean_token_accuracy": 0.210426926612854, "num_tokens": 41425933.0, "step": 18085 }, { "entropy": 5.579222393035889, "epoch": 1.7882562277580072, "grad_norm": 0.93359375, "learning_rate": 0.00046843842842005665, "loss": 5.0646, "mean_token_accuracy": 0.20990950912237166, "num_tokens": 41438413.0, "step": 18090 }, { "entropy": 5.534687042236328, "epoch": 1.7887504942665085, "grad_norm": 1.140625, "learning_rate": 0.0004684204015080971, "loss": 5.0009, "mean_token_accuracy": 0.22066094279289244, "num_tokens": 41449104.0, "step": 18095 }, { "entropy": 5.683242893218994, "epoch": 1.78924476077501, "grad_norm": 1.078125, "learning_rate": 0.0004684023698379657, "loss": 5.1985, "mean_token_accuracy": 0.19701089560985566, "num_tokens": 41460766.0, "step": 18100 }, { "entropy": 5.6720205783844, "epoch": 1.7897390272835114, "grad_norm": 1.0234375, "learning_rate": 0.0004683843334101061, "loss": 5.1653, "mean_token_accuracy": 0.1975286200642586, "num_tokens": 41471872.0, "step": 18105 }, { "entropy": 5.738069677352906, "epoch": 1.7902332937920127, "grad_norm": 1.0390625, "learning_rate": 0.00046836629222496174, "loss": 5.153, "mean_token_accuracy": 0.2075898364186287, "num_tokens": 41483313.0, "step": 18110 }, { "entropy": 5.625000476837158, "epoch": 1.790727560300514, "grad_norm": 1.0546875, "learning_rate": 0.0004683482462829766, "loss": 4.9976, "mean_token_accuracy": 0.22075052559375763, "num_tokens": 41492935.0, "step": 18115 }, { "entropy": 5.614463138580322, "epoch": 1.7912218268090154, "grad_norm": 1.0078125, "learning_rate": 0.0004683301955845947, "loss": 5.1826, "mean_token_accuracy": 0.20441991239786148, "num_tokens": 41504159.0, "step": 18120 }, { "entropy": 5.573270320892334, "epoch": 1.791716093317517, "grad_norm": 0.94140625, "learning_rate": 0.00046831214013025996, "loss": 4.9944, "mean_token_accuracy": 0.21832002252340316, "num_tokens": 41515812.0, "step": 18125 }, { "entropy": 5.556077384948731, "epoch": 1.7922103598260182, "grad_norm": 1.0, "learning_rate": 0.0004682940799204165, "loss": 4.9324, "mean_token_accuracy": 0.21955628097057342, "num_tokens": 41527109.0, "step": 18130 }, { "entropy": 5.582861471176147, "epoch": 1.7927046263345194, "grad_norm": 0.9765625, "learning_rate": 0.00046827601495550884, "loss": 5.0567, "mean_token_accuracy": 0.20825450420379638, "num_tokens": 41537183.0, "step": 18135 }, { "entropy": 5.558879566192627, "epoch": 1.793198892843021, "grad_norm": 1.078125, "learning_rate": 0.0004682579452359811, "loss": 5.0073, "mean_token_accuracy": 0.2158624529838562, "num_tokens": 41548170.0, "step": 18140 }, { "entropy": 5.605502796173096, "epoch": 1.7936931593515224, "grad_norm": 1.078125, "learning_rate": 0.000468239870762278, "loss": 5.088, "mean_token_accuracy": 0.20857780873775483, "num_tokens": 41558737.0, "step": 18145 }, { "entropy": 5.585472679138183, "epoch": 1.7941874258600237, "grad_norm": 1.0078125, "learning_rate": 0.000468221791534844, "loss": 4.9968, "mean_token_accuracy": 0.21801339238882064, "num_tokens": 41570096.0, "step": 18150 }, { "entropy": 5.567377710342408, "epoch": 1.7946816923685251, "grad_norm": 0.89453125, "learning_rate": 0.000468203707554124, "loss": 4.997, "mean_token_accuracy": 0.21452232897281648, "num_tokens": 41582670.0, "step": 18155 }, { "entropy": 5.582980108261109, "epoch": 1.7951759588770266, "grad_norm": 1.0390625, "learning_rate": 0.0004681856188205629, "loss": 4.9977, "mean_token_accuracy": 0.2157670333981514, "num_tokens": 41594300.0, "step": 18160 }, { "entropy": 5.612109994888305, "epoch": 1.795670225385528, "grad_norm": 1.0625, "learning_rate": 0.0004681675253346055, "loss": 5.0933, "mean_token_accuracy": 0.2040518879890442, "num_tokens": 41606021.0, "step": 18165 }, { "entropy": 5.606243085861206, "epoch": 1.7961644918940292, "grad_norm": 0.99609375, "learning_rate": 0.0004681494270966971, "loss": 5.0412, "mean_token_accuracy": 0.21353402733802795, "num_tokens": 41617338.0, "step": 18170 }, { "entropy": 5.6262736320495605, "epoch": 1.7966587584025306, "grad_norm": 1.078125, "learning_rate": 0.0004681313241072828, "loss": 5.0764, "mean_token_accuracy": 0.2042071834206581, "num_tokens": 41628407.0, "step": 18175 }, { "entropy": 5.589892053604126, "epoch": 1.7971530249110321, "grad_norm": 1.0234375, "learning_rate": 0.00046811321636680797, "loss": 5.0369, "mean_token_accuracy": 0.20715769231319428, "num_tokens": 41639715.0, "step": 18180 }, { "entropy": 5.622815227508545, "epoch": 1.7976472914195334, "grad_norm": 1.03125, "learning_rate": 0.00046809510387571806, "loss": 5.1195, "mean_token_accuracy": 0.20307933241128923, "num_tokens": 41651078.0, "step": 18185 }, { "entropy": 5.615792560577392, "epoch": 1.7981415579280347, "grad_norm": 1.0390625, "learning_rate": 0.0004680769866344586, "loss": 5.1404, "mean_token_accuracy": 0.20105107873678207, "num_tokens": 41661848.0, "step": 18190 }, { "entropy": 5.662042140960693, "epoch": 1.7986358244365361, "grad_norm": 1.0, "learning_rate": 0.0004680588646434753, "loss": 5.1238, "mean_token_accuracy": 0.20760765075683593, "num_tokens": 41673452.0, "step": 18195 }, { "entropy": 5.740449714660644, "epoch": 1.7991300909450376, "grad_norm": 1.0703125, "learning_rate": 0.00046804073790321403, "loss": 5.1698, "mean_token_accuracy": 0.19787259995937348, "num_tokens": 41685312.0, "step": 18200 }, { "entropy": 5.653957462310791, "epoch": 1.7996243574535389, "grad_norm": 0.9140625, "learning_rate": 0.00046802260641412065, "loss": 5.0452, "mean_token_accuracy": 0.21914575845003129, "num_tokens": 41696849.0, "step": 18205 }, { "entropy": 5.619838809967041, "epoch": 1.8001186239620404, "grad_norm": 1.0859375, "learning_rate": 0.0004680044701766413, "loss": 5.0523, "mean_token_accuracy": 0.21458888947963714, "num_tokens": 41707506.0, "step": 18210 }, { "entropy": 5.657530832290649, "epoch": 1.8006128904705418, "grad_norm": 1.0703125, "learning_rate": 0.0004679863291912219, "loss": 5.0464, "mean_token_accuracy": 0.20929965674877166, "num_tokens": 41718981.0, "step": 18215 }, { "entropy": 5.627421140670776, "epoch": 1.8011071569790431, "grad_norm": 1.0703125, "learning_rate": 0.0004679681834583089, "loss": 5.1527, "mean_token_accuracy": 0.2058393433690071, "num_tokens": 41731638.0, "step": 18220 }, { "entropy": 5.577653121948242, "epoch": 1.8016014234875444, "grad_norm": 1.0078125, "learning_rate": 0.00046795003297834864, "loss": 5.0153, "mean_token_accuracy": 0.22055792808532715, "num_tokens": 41742820.0, "step": 18225 }, { "entropy": 5.582306003570556, "epoch": 1.8020956899960459, "grad_norm": 0.9609375, "learning_rate": 0.00046793187775178764, "loss": 5.0681, "mean_token_accuracy": 0.2104687884449959, "num_tokens": 41754933.0, "step": 18230 }, { "entropy": 5.623110103607178, "epoch": 1.8025899565045473, "grad_norm": 1.1015625, "learning_rate": 0.0004679137177790725, "loss": 5.0857, "mean_token_accuracy": 0.21368390172719956, "num_tokens": 41767078.0, "step": 18235 }, { "entropy": 5.64307541847229, "epoch": 1.8030842230130486, "grad_norm": 1.1015625, "learning_rate": 0.0004678955530606501, "loss": 5.1278, "mean_token_accuracy": 0.20535721629858017, "num_tokens": 41778456.0, "step": 18240 }, { "entropy": 5.6462640285491945, "epoch": 1.8035784895215499, "grad_norm": 0.98046875, "learning_rate": 0.00046787738359696697, "loss": 5.1167, "mean_token_accuracy": 0.20513281524181365, "num_tokens": 41791226.0, "step": 18245 }, { "entropy": 5.582339525222778, "epoch": 1.8040727560300513, "grad_norm": 1.03125, "learning_rate": 0.0004678592093884704, "loss": 5.0672, "mean_token_accuracy": 0.21549567133188247, "num_tokens": 41803765.0, "step": 18250 }, { "entropy": 5.586045169830323, "epoch": 1.8045670225385528, "grad_norm": 0.97265625, "learning_rate": 0.00046784103043560736, "loss": 5.0926, "mean_token_accuracy": 0.20697415322065355, "num_tokens": 41815983.0, "step": 18255 }, { "entropy": 5.598139381408691, "epoch": 1.805061289047054, "grad_norm": 1.078125, "learning_rate": 0.00046782284673882506, "loss": 5.0359, "mean_token_accuracy": 0.22246965169906616, "num_tokens": 41826517.0, "step": 18260 }, { "entropy": 5.6675739765167235, "epoch": 1.8055555555555556, "grad_norm": 1.0625, "learning_rate": 0.0004678046582985708, "loss": 5.1243, "mean_token_accuracy": 0.2120986193418503, "num_tokens": 41837064.0, "step": 18265 }, { "entropy": 5.570134162902832, "epoch": 1.806049822064057, "grad_norm": 0.96875, "learning_rate": 0.000467786465115292, "loss": 5.0074, "mean_token_accuracy": 0.21737518459558486, "num_tokens": 41849109.0, "step": 18270 }, { "entropy": 5.554203367233276, "epoch": 1.8065440885725583, "grad_norm": 1.015625, "learning_rate": 0.0004677682671894364, "loss": 5.0353, "mean_token_accuracy": 0.21665082275867462, "num_tokens": 41859349.0, "step": 18275 }, { "entropy": 5.584117317199707, "epoch": 1.8070383550810596, "grad_norm": 1.0546875, "learning_rate": 0.00046775006452145135, "loss": 5.0438, "mean_token_accuracy": 0.21411108821630478, "num_tokens": 41870002.0, "step": 18280 }, { "entropy": 5.668031549453735, "epoch": 1.807532621589561, "grad_norm": 1.09375, "learning_rate": 0.0004677318571117849, "loss": 5.0758, "mean_token_accuracy": 0.20966586321592331, "num_tokens": 41881219.0, "step": 18285 }, { "entropy": 5.6352332592010494, "epoch": 1.8080268880980626, "grad_norm": 1.046875, "learning_rate": 0.00046771364496088475, "loss": 5.0804, "mean_token_accuracy": 0.206965634226799, "num_tokens": 41893318.0, "step": 18290 }, { "entropy": 5.552147483825683, "epoch": 1.8085211546065638, "grad_norm": 1.0625, "learning_rate": 0.00046769542806919913, "loss": 5.0653, "mean_token_accuracy": 0.21227698475122453, "num_tokens": 41904816.0, "step": 18295 }, { "entropy": 5.609357786178589, "epoch": 1.809015421115065, "grad_norm": 1.0078125, "learning_rate": 0.0004676772064371761, "loss": 5.1082, "mean_token_accuracy": 0.2048286348581314, "num_tokens": 41916293.0, "step": 18300 }, { "entropy": 5.62293963432312, "epoch": 1.8095096876235668, "grad_norm": 1.0703125, "learning_rate": 0.00046765898006526384, "loss": 5.0462, "mean_token_accuracy": 0.2178953021764755, "num_tokens": 41926654.0, "step": 18305 }, { "entropy": 5.567075204849243, "epoch": 1.810003954132068, "grad_norm": 1.046875, "learning_rate": 0.00046764074895391084, "loss": 5.011, "mean_token_accuracy": 0.21751009672880173, "num_tokens": 41937141.0, "step": 18310 }, { "entropy": 5.603100347518921, "epoch": 1.8104982206405693, "grad_norm": 1.046875, "learning_rate": 0.00046762251310356544, "loss": 5.1668, "mean_token_accuracy": 0.20739685148000717, "num_tokens": 41947793.0, "step": 18315 }, { "entropy": 5.6784978866577145, "epoch": 1.8109924871490708, "grad_norm": 1.125, "learning_rate": 0.0004676042725146764, "loss": 5.0403, "mean_token_accuracy": 0.2121469721198082, "num_tokens": 41958524.0, "step": 18320 }, { "entropy": 5.70434603691101, "epoch": 1.8114867536575723, "grad_norm": 1.0, "learning_rate": 0.00046758602718769245, "loss": 5.1029, "mean_token_accuracy": 0.20519926398992538, "num_tokens": 41969654.0, "step": 18325 }, { "entropy": 5.562315130233765, "epoch": 1.8119810201660735, "grad_norm": 0.9765625, "learning_rate": 0.00046756777712306225, "loss": 5.0405, "mean_token_accuracy": 0.21622565090656282, "num_tokens": 41980881.0, "step": 18330 }, { "entropy": 5.662221431732178, "epoch": 1.8124752866745748, "grad_norm": 0.98828125, "learning_rate": 0.0004675495223212349, "loss": 5.089, "mean_token_accuracy": 0.20789522528648377, "num_tokens": 41992490.0, "step": 18335 }, { "entropy": 5.565854454040528, "epoch": 1.8129695531830763, "grad_norm": 1.0625, "learning_rate": 0.0004675312627826594, "loss": 4.9797, "mean_token_accuracy": 0.22573965340852736, "num_tokens": 42001765.0, "step": 18340 }, { "entropy": 5.557320833206177, "epoch": 1.8134638196915778, "grad_norm": 1.0390625, "learning_rate": 0.000467512998507785, "loss": 5.0068, "mean_token_accuracy": 0.22120171785354614, "num_tokens": 42013122.0, "step": 18345 }, { "entropy": 5.6745768070220945, "epoch": 1.813958086200079, "grad_norm": 1.015625, "learning_rate": 0.00046749472949706095, "loss": 5.2, "mean_token_accuracy": 0.19890810996294023, "num_tokens": 42023369.0, "step": 18350 }, { "entropy": 5.674040985107422, "epoch": 1.8144523527085805, "grad_norm": 0.9453125, "learning_rate": 0.0004674764557509367, "loss": 5.2195, "mean_token_accuracy": 0.19458048641681672, "num_tokens": 42036054.0, "step": 18355 }, { "entropy": 5.636448764801026, "epoch": 1.814946619217082, "grad_norm": 0.9609375, "learning_rate": 0.0004674581772698618, "loss": 5.0545, "mean_token_accuracy": 0.2130661904811859, "num_tokens": 42048782.0, "step": 18360 }, { "entropy": 5.693838977813721, "epoch": 1.8154408857255833, "grad_norm": 1.046875, "learning_rate": 0.00046743989405428584, "loss": 5.1002, "mean_token_accuracy": 0.20548599362373351, "num_tokens": 42059438.0, "step": 18365 }, { "entropy": 5.681651926040649, "epoch": 1.8159351522340845, "grad_norm": 1.0078125, "learning_rate": 0.0004674216061046587, "loss": 5.1151, "mean_token_accuracy": 0.20730770081281663, "num_tokens": 42070767.0, "step": 18370 }, { "entropy": 5.623228263854981, "epoch": 1.816429418742586, "grad_norm": 1.1171875, "learning_rate": 0.0004674033134214301, "loss": 5.0827, "mean_token_accuracy": 0.2108712837100029, "num_tokens": 42081782.0, "step": 18375 }, { "entropy": 5.574859666824341, "epoch": 1.8169236852510875, "grad_norm": 0.93359375, "learning_rate": 0.00046738501600505016, "loss": 5.0556, "mean_token_accuracy": 0.21200058311223985, "num_tokens": 42094402.0, "step": 18380 }, { "entropy": 5.676452350616455, "epoch": 1.8174179517595888, "grad_norm": 1.015625, "learning_rate": 0.000467366713855969, "loss": 5.1227, "mean_token_accuracy": 0.20586069971323012, "num_tokens": 42106772.0, "step": 18385 }, { "entropy": 5.6214080333709715, "epoch": 1.81791221826809, "grad_norm": 1.1171875, "learning_rate": 0.00046734840697463685, "loss": 5.06, "mean_token_accuracy": 0.20938561856746674, "num_tokens": 42118093.0, "step": 18390 }, { "entropy": 5.63179612159729, "epoch": 1.8184064847765915, "grad_norm": 1.0078125, "learning_rate": 0.00046733009536150413, "loss": 5.068, "mean_token_accuracy": 0.206921723484993, "num_tokens": 42130319.0, "step": 18395 }, { "entropy": 5.684555196762085, "epoch": 1.818900751285093, "grad_norm": 1.0703125, "learning_rate": 0.0004673117790170211, "loss": 5.088, "mean_token_accuracy": 0.20807077288627623, "num_tokens": 42140867.0, "step": 18400 }, { "entropy": 5.630268144607544, "epoch": 1.8193950177935942, "grad_norm": 0.9453125, "learning_rate": 0.00046729345794163847, "loss": 5.0927, "mean_token_accuracy": 0.21221788227558136, "num_tokens": 42151425.0, "step": 18405 }, { "entropy": 5.693396186828613, "epoch": 1.8198892843020957, "grad_norm": 0.91796875, "learning_rate": 0.00046727513213580703, "loss": 5.1758, "mean_token_accuracy": 0.19837775081396103, "num_tokens": 42163553.0, "step": 18410 }, { "entropy": 5.64350700378418, "epoch": 1.8203835508105972, "grad_norm": 0.9765625, "learning_rate": 0.0004672568015999774, "loss": 5.131, "mean_token_accuracy": 0.20346449464559554, "num_tokens": 42174968.0, "step": 18415 }, { "entropy": 5.648220682144165, "epoch": 1.8208778173190985, "grad_norm": 0.97265625, "learning_rate": 0.00046723846633460074, "loss": 5.1075, "mean_token_accuracy": 0.2052953615784645, "num_tokens": 42186944.0, "step": 18420 }, { "entropy": 5.671308469772339, "epoch": 1.8213720838275997, "grad_norm": 1.1484375, "learning_rate": 0.00046722012634012794, "loss": 5.0718, "mean_token_accuracy": 0.2154764026403427, "num_tokens": 42198096.0, "step": 18425 }, { "entropy": 5.621400308609009, "epoch": 1.8218663503361012, "grad_norm": 1.0859375, "learning_rate": 0.00046720178161701014, "loss": 5.0933, "mean_token_accuracy": 0.21112703830003737, "num_tokens": 42208782.0, "step": 18430 }, { "entropy": 5.699342155456543, "epoch": 1.8223606168446027, "grad_norm": 1.0234375, "learning_rate": 0.0004671834321656988, "loss": 5.1372, "mean_token_accuracy": 0.20737984478473664, "num_tokens": 42219925.0, "step": 18435 }, { "entropy": 5.656798791885376, "epoch": 1.822854883353104, "grad_norm": 0.91015625, "learning_rate": 0.00046716507798664515, "loss": 5.0427, "mean_token_accuracy": 0.21399286836385728, "num_tokens": 42231140.0, "step": 18440 }, { "entropy": 5.627133369445801, "epoch": 1.8233491498616052, "grad_norm": 1.03125, "learning_rate": 0.0004671467190803008, "loss": 5.1434, "mean_token_accuracy": 0.20748264193534852, "num_tokens": 42245025.0, "step": 18445 }, { "entropy": 5.644261312484741, "epoch": 1.8238434163701067, "grad_norm": 1.125, "learning_rate": 0.0004671283554471174, "loss": 5.0729, "mean_token_accuracy": 0.2129092574119568, "num_tokens": 42255776.0, "step": 18450 }, { "entropy": 5.625153255462647, "epoch": 1.8243376828786082, "grad_norm": 1.09375, "learning_rate": 0.0004671099870875465, "loss": 5.1074, "mean_token_accuracy": 0.20320421010255812, "num_tokens": 42268016.0, "step": 18455 }, { "entropy": 5.587159490585327, "epoch": 1.8248319493871095, "grad_norm": 0.9921875, "learning_rate": 0.00046709161400204034, "loss": 5.0761, "mean_token_accuracy": 0.20983201414346694, "num_tokens": 42279521.0, "step": 18460 }, { "entropy": 5.634532690048218, "epoch": 1.825326215895611, "grad_norm": 0.9765625, "learning_rate": 0.00046707323619105053, "loss": 5.0518, "mean_token_accuracy": 0.21560497134923934, "num_tokens": 42290537.0, "step": 18465 }, { "entropy": 5.636009263992309, "epoch": 1.8258204824041124, "grad_norm": 1.0859375, "learning_rate": 0.00046705485365502926, "loss": 5.0479, "mean_token_accuracy": 0.20805914103984832, "num_tokens": 42303119.0, "step": 18470 }, { "entropy": 5.660705280303955, "epoch": 1.8263147489126137, "grad_norm": 1.03125, "learning_rate": 0.00046703646639442893, "loss": 5.0655, "mean_token_accuracy": 0.21009707003831862, "num_tokens": 42314408.0, "step": 18475 }, { "entropy": 5.586100959777832, "epoch": 1.826809015421115, "grad_norm": 1.0, "learning_rate": 0.0004670180744097017, "loss": 4.9892, "mean_token_accuracy": 0.2123853772878647, "num_tokens": 42325848.0, "step": 18480 }, { "entropy": 5.6210010051727295, "epoch": 1.8273032819296164, "grad_norm": 1.0078125, "learning_rate": 0.0004669996777013, "loss": 5.0724, "mean_token_accuracy": 0.20457233339548112, "num_tokens": 42337737.0, "step": 18485 }, { "entropy": 5.589487218856812, "epoch": 1.827797548438118, "grad_norm": 1.1953125, "learning_rate": 0.00046698127626967645, "loss": 4.9988, "mean_token_accuracy": 0.2150890201330185, "num_tokens": 42348418.0, "step": 18490 }, { "entropy": 5.63428692817688, "epoch": 1.8282918149466192, "grad_norm": 1.078125, "learning_rate": 0.0004669628701152837, "loss": 5.0986, "mean_token_accuracy": 0.20296107828617097, "num_tokens": 42358665.0, "step": 18495 }, { "entropy": 5.641710996627808, "epoch": 1.8287860814551204, "grad_norm": 1.03125, "learning_rate": 0.0004669444592385746, "loss": 5.0447, "mean_token_accuracy": 0.22363846749067307, "num_tokens": 42369030.0, "step": 18500 }, { "entropy": 5.6472063064575195, "epoch": 1.829280347963622, "grad_norm": 1.078125, "learning_rate": 0.00046692604364000203, "loss": 5.0664, "mean_token_accuracy": 0.2101534277200699, "num_tokens": 42380751.0, "step": 18505 }, { "entropy": 5.61702675819397, "epoch": 1.8297746144721234, "grad_norm": 1.0078125, "learning_rate": 0.000466907623320019, "loss": 5.0983, "mean_token_accuracy": 0.2110529750585556, "num_tokens": 42391945.0, "step": 18510 }, { "entropy": 5.635192060470581, "epoch": 1.8302688809806247, "grad_norm": 1.078125, "learning_rate": 0.00046688919827907866, "loss": 5.0669, "mean_token_accuracy": 0.208252976834774, "num_tokens": 42403346.0, "step": 18515 }, { "entropy": 5.6416065216064455, "epoch": 1.8307631474891262, "grad_norm": 1.078125, "learning_rate": 0.00046687076851763433, "loss": 5.1346, "mean_token_accuracy": 0.1972485825419426, "num_tokens": 42414895.0, "step": 18520 }, { "entropy": 5.550303030014038, "epoch": 1.8312574139976276, "grad_norm": 1.046875, "learning_rate": 0.00046685233403613927, "loss": 5.0176, "mean_token_accuracy": 0.21675971001386643, "num_tokens": 42426951.0, "step": 18525 }, { "entropy": 5.64603476524353, "epoch": 1.831751680506129, "grad_norm": 1.046875, "learning_rate": 0.00046683389483504704, "loss": 5.0689, "mean_token_accuracy": 0.20547551065683364, "num_tokens": 42438313.0, "step": 18530 }, { "entropy": 5.640618848800659, "epoch": 1.8322459470146302, "grad_norm": 1.09375, "learning_rate": 0.0004668154509148112, "loss": 5.077, "mean_token_accuracy": 0.20654894709587096, "num_tokens": 42448592.0, "step": 18535 }, { "entropy": 5.653771495819091, "epoch": 1.8327402135231317, "grad_norm": 0.94140625, "learning_rate": 0.00046679700227588556, "loss": 5.0971, "mean_token_accuracy": 0.21117539703845978, "num_tokens": 42460732.0, "step": 18540 }, { "entropy": 5.712293386459351, "epoch": 1.8332344800316331, "grad_norm": 1.0234375, "learning_rate": 0.00046677854891872384, "loss": 5.0745, "mean_token_accuracy": 0.21084051132202147, "num_tokens": 42472862.0, "step": 18545 }, { "entropy": 5.621286678314209, "epoch": 1.8337287465401344, "grad_norm": 1.0390625, "learning_rate": 0.0004667600908437802, "loss": 5.0314, "mean_token_accuracy": 0.21443700939416885, "num_tokens": 42483227.0, "step": 18550 }, { "entropy": 5.513270044326783, "epoch": 1.8342230130486357, "grad_norm": 0.97265625, "learning_rate": 0.00046674162805150843, "loss": 4.9177, "mean_token_accuracy": 0.2230600580573082, "num_tokens": 42495414.0, "step": 18555 }, { "entropy": 5.563138961791992, "epoch": 1.8347172795571374, "grad_norm": 1.0546875, "learning_rate": 0.00046672316054236293, "loss": 5.1079, "mean_token_accuracy": 0.2074661836028099, "num_tokens": 42507908.0, "step": 18560 }, { "entropy": 5.602343893051147, "epoch": 1.8352115460656386, "grad_norm": 1.03125, "learning_rate": 0.00046670468831679795, "loss": 4.9741, "mean_token_accuracy": 0.22215376049280167, "num_tokens": 42519228.0, "step": 18565 }, { "entropy": 5.578308486938477, "epoch": 1.83570581257414, "grad_norm": 1.0390625, "learning_rate": 0.0004666862113752679, "loss": 5.0047, "mean_token_accuracy": 0.22039030194282533, "num_tokens": 42530571.0, "step": 18570 }, { "entropy": 5.584758281707764, "epoch": 1.8362000790826414, "grad_norm": 1.0078125, "learning_rate": 0.0004666677297182273, "loss": 5.0844, "mean_token_accuracy": 0.20752530694007873, "num_tokens": 42541781.0, "step": 18575 }, { "entropy": 5.664156675338745, "epoch": 1.8366943455911429, "grad_norm": 0.9453125, "learning_rate": 0.0004666492433461308, "loss": 5.1182, "mean_token_accuracy": 0.20762841254472733, "num_tokens": 42553912.0, "step": 18580 }, { "entropy": 5.559686231613159, "epoch": 1.8371886120996441, "grad_norm": 1.0078125, "learning_rate": 0.0004666307522594332, "loss": 4.9685, "mean_token_accuracy": 0.22310858517885207, "num_tokens": 42565812.0, "step": 18585 }, { "entropy": 5.635580778121948, "epoch": 1.8376828786081454, "grad_norm": 1.046875, "learning_rate": 0.0004666122564585893, "loss": 5.0524, "mean_token_accuracy": 0.20300337076187133, "num_tokens": 42578177.0, "step": 18590 }, { "entropy": 5.649063158035278, "epoch": 1.8381771451166469, "grad_norm": 1.09375, "learning_rate": 0.00046659375594405427, "loss": 5.1362, "mean_token_accuracy": 0.21279135644435881, "num_tokens": 42590336.0, "step": 18595 }, { "entropy": 5.6791956424713135, "epoch": 1.8386714116251484, "grad_norm": 1.046875, "learning_rate": 0.00046657525071628307, "loss": 5.0551, "mean_token_accuracy": 0.2099889487028122, "num_tokens": 42601438.0, "step": 18600 }, { "entropy": 5.617106914520264, "epoch": 1.8391656781336496, "grad_norm": 1.015625, "learning_rate": 0.00046655674077573104, "loss": 5.0487, "mean_token_accuracy": 0.20921494513750077, "num_tokens": 42612572.0, "step": 18605 }, { "entropy": 5.629081296920776, "epoch": 1.839659944642151, "grad_norm": 1.09375, "learning_rate": 0.00046653822612285336, "loss": 5.1601, "mean_token_accuracy": 0.2004980817437172, "num_tokens": 42623138.0, "step": 18610 }, { "entropy": 5.551071310043335, "epoch": 1.8401542111506526, "grad_norm": 0.9921875, "learning_rate": 0.00046651970675810574, "loss": 5.0379, "mean_token_accuracy": 0.21764082908630372, "num_tokens": 42635694.0, "step": 18615 }, { "entropy": 5.729114723205567, "epoch": 1.8406484776591538, "grad_norm": 0.97265625, "learning_rate": 0.0004665011826819435, "loss": 5.1717, "mean_token_accuracy": 0.20647149085998534, "num_tokens": 42648371.0, "step": 18620 }, { "entropy": 5.691111040115357, "epoch": 1.841142744167655, "grad_norm": 1.015625, "learning_rate": 0.00046648265389482245, "loss": 5.0686, "mean_token_accuracy": 0.2040697678923607, "num_tokens": 42659229.0, "step": 18625 }, { "entropy": 5.6009797096252445, "epoch": 1.8416370106761566, "grad_norm": 1.03125, "learning_rate": 0.0004664641203971985, "loss": 5.049, "mean_token_accuracy": 0.2148164004087448, "num_tokens": 42669991.0, "step": 18630 }, { "entropy": 5.558878469467163, "epoch": 1.842131277184658, "grad_norm": 0.96484375, "learning_rate": 0.00046644558218952745, "loss": 4.9609, "mean_token_accuracy": 0.22014888226985932, "num_tokens": 42681091.0, "step": 18635 }, { "entropy": 5.66443977355957, "epoch": 1.8426255436931593, "grad_norm": 1.0, "learning_rate": 0.00046642703927226534, "loss": 5.0505, "mean_token_accuracy": 0.21094355434179307, "num_tokens": 42691928.0, "step": 18640 }, { "entropy": 5.5724739074707035, "epoch": 1.8431198102016606, "grad_norm": 0.96875, "learning_rate": 0.0004664084916458684, "loss": 5.054, "mean_token_accuracy": 0.2133571907877922, "num_tokens": 42704611.0, "step": 18645 }, { "entropy": 5.659736204147339, "epoch": 1.843614076710162, "grad_norm": 1.0625, "learning_rate": 0.0004663899393107929, "loss": 5.0733, "mean_token_accuracy": 0.21506861299276353, "num_tokens": 42715223.0, "step": 18650 }, { "entropy": 5.581835603713989, "epoch": 1.8441083432186636, "grad_norm": 0.98828125, "learning_rate": 0.0004663713822674952, "loss": 4.9984, "mean_token_accuracy": 0.21456711739301682, "num_tokens": 42728177.0, "step": 18655 }, { "entropy": 5.665618419647217, "epoch": 1.8446026097271648, "grad_norm": 0.9765625, "learning_rate": 0.00046635282051643166, "loss": 5.122, "mean_token_accuracy": 0.20710619688034057, "num_tokens": 42738469.0, "step": 18660 }, { "entropy": 5.606533336639404, "epoch": 1.8450968762356663, "grad_norm": 1.0234375, "learning_rate": 0.0004663342540580593, "loss": 5.0023, "mean_token_accuracy": 0.21385397613048554, "num_tokens": 42749915.0, "step": 18665 }, { "entropy": 5.670849227905274, "epoch": 1.8455911427441678, "grad_norm": 0.94140625, "learning_rate": 0.0004663156828928344, "loss": 5.175, "mean_token_accuracy": 0.20523013770580292, "num_tokens": 42762679.0, "step": 18670 }, { "entropy": 5.704402828216553, "epoch": 1.846085409252669, "grad_norm": 1.03125, "learning_rate": 0.0004662971070212141, "loss": 5.0899, "mean_token_accuracy": 0.2135408490896225, "num_tokens": 42775351.0, "step": 18675 }, { "entropy": 5.583113098144532, "epoch": 1.8465796757611703, "grad_norm": 1.015625, "learning_rate": 0.00046627852644365525, "loss": 5.077, "mean_token_accuracy": 0.20425946712493898, "num_tokens": 42785435.0, "step": 18680 }, { "entropy": 5.656018257141113, "epoch": 1.8470739422696718, "grad_norm": 1.0703125, "learning_rate": 0.00046625994116061505, "loss": 5.1151, "mean_token_accuracy": 0.2082199439406395, "num_tokens": 42795737.0, "step": 18685 }, { "entropy": 5.686426448822021, "epoch": 1.8475682087781733, "grad_norm": 1.046875, "learning_rate": 0.0004662413511725506, "loss": 5.1126, "mean_token_accuracy": 0.20597339868545533, "num_tokens": 42806965.0, "step": 18690 }, { "entropy": 5.703282403945923, "epoch": 1.8480624752866746, "grad_norm": 1.015625, "learning_rate": 0.0004662227564799192, "loss": 5.0802, "mean_token_accuracy": 0.20556501746177674, "num_tokens": 42818346.0, "step": 18695 }, { "entropy": 5.581487131118775, "epoch": 1.8485567417951758, "grad_norm": 1.0078125, "learning_rate": 0.00046620415708317834, "loss": 5.0573, "mean_token_accuracy": 0.21618811488151551, "num_tokens": 42829838.0, "step": 18700 }, { "entropy": 5.675687599182129, "epoch": 1.8490510083036773, "grad_norm": 1.09375, "learning_rate": 0.0004661855529827856, "loss": 5.1005, "mean_token_accuracy": 0.21205817312002181, "num_tokens": 42841212.0, "step": 18705 }, { "entropy": 5.576397562026978, "epoch": 1.8495452748121788, "grad_norm": 1.046875, "learning_rate": 0.00046616694417919854, "loss": 4.995, "mean_token_accuracy": 0.21777697205543517, "num_tokens": 42853237.0, "step": 18710 }, { "entropy": 5.624387931823731, "epoch": 1.85003954132068, "grad_norm": 1.09375, "learning_rate": 0.00046614833067287504, "loss": 5.0824, "mean_token_accuracy": 0.2091789036989212, "num_tokens": 42864000.0, "step": 18715 }, { "entropy": 5.611742734909058, "epoch": 1.8505338078291815, "grad_norm": 1.0703125, "learning_rate": 0.00046612971246427293, "loss": 5.0033, "mean_token_accuracy": 0.21334187239408492, "num_tokens": 42874491.0, "step": 18720 }, { "entropy": 5.69594087600708, "epoch": 1.851028074337683, "grad_norm": 1.046875, "learning_rate": 0.00046611108955385024, "loss": 5.1954, "mean_token_accuracy": 0.20151329636573792, "num_tokens": 42885947.0, "step": 18725 }, { "entropy": 5.650967741012574, "epoch": 1.8515223408461843, "grad_norm": 1.0390625, "learning_rate": 0.0004660924619420651, "loss": 5.1166, "mean_token_accuracy": 0.20813701450824737, "num_tokens": 42897907.0, "step": 18730 }, { "entropy": 5.6506095886230465, "epoch": 1.8520166073546855, "grad_norm": 1.0390625, "learning_rate": 0.0004660738296293758, "loss": 5.0208, "mean_token_accuracy": 0.21393196880817414, "num_tokens": 42909332.0, "step": 18735 }, { "entropy": 5.684459590911866, "epoch": 1.852510873863187, "grad_norm": 1.0078125, "learning_rate": 0.00046605519261624055, "loss": 5.1727, "mean_token_accuracy": 0.20069311261177064, "num_tokens": 42921877.0, "step": 18740 }, { "entropy": 5.665633296966552, "epoch": 1.8530051403716885, "grad_norm": 1.046875, "learning_rate": 0.00046603655090311796, "loss": 5.0642, "mean_token_accuracy": 0.2069414049386978, "num_tokens": 42933381.0, "step": 18745 }, { "entropy": 5.6590066909790036, "epoch": 1.8534994068801898, "grad_norm": 1.09375, "learning_rate": 0.0004660179044904666, "loss": 5.084, "mean_token_accuracy": 0.20914230197668077, "num_tokens": 42944756.0, "step": 18750 }, { "entropy": 5.686548471450806, "epoch": 1.853993673388691, "grad_norm": 1.0078125, "learning_rate": 0.00046599925337874516, "loss": 5.1329, "mean_token_accuracy": 0.20379782170057298, "num_tokens": 42955587.0, "step": 18755 }, { "entropy": 5.6876145362854, "epoch": 1.8544879398971925, "grad_norm": 1.078125, "learning_rate": 0.00046598059756841246, "loss": 5.1777, "mean_token_accuracy": 0.20237616151571275, "num_tokens": 42966150.0, "step": 18760 }, { "entropy": 5.721967506408691, "epoch": 1.854982206405694, "grad_norm": 0.953125, "learning_rate": 0.0004659619370599274, "loss": 5.1001, "mean_token_accuracy": 0.20659871846437455, "num_tokens": 42978626.0, "step": 18765 }, { "entropy": 5.632206916809082, "epoch": 1.8554764729141953, "grad_norm": 1.1328125, "learning_rate": 0.00046594327185374906, "loss": 4.9644, "mean_token_accuracy": 0.22102324664592743, "num_tokens": 42989194.0, "step": 18770 }, { "entropy": 5.555104494094849, "epoch": 1.8559707394226967, "grad_norm": 1.0234375, "learning_rate": 0.00046592460195033663, "loss": 5.0088, "mean_token_accuracy": 0.2135706663131714, "num_tokens": 43000589.0, "step": 18775 }, { "entropy": 5.548121213912964, "epoch": 1.8564650059311982, "grad_norm": 1.0078125, "learning_rate": 0.0004659059273501494, "loss": 5.0025, "mean_token_accuracy": 0.21604713499546052, "num_tokens": 43011417.0, "step": 18780 }, { "entropy": 5.683434867858887, "epoch": 1.8569592724396995, "grad_norm": 0.94140625, "learning_rate": 0.0004658872480536467, "loss": 5.0894, "mean_token_accuracy": 0.20349919945001602, "num_tokens": 43023178.0, "step": 18785 }, { "entropy": 5.622946929931641, "epoch": 1.8574535389482008, "grad_norm": 1.0703125, "learning_rate": 0.00046586856406128805, "loss": 5.1361, "mean_token_accuracy": 0.20357435643672944, "num_tokens": 43035526.0, "step": 18790 }, { "entropy": 5.616767644882202, "epoch": 1.8579478054567022, "grad_norm": 1.0546875, "learning_rate": 0.0004658498753735332, "loss": 5.0742, "mean_token_accuracy": 0.21253150552511216, "num_tokens": 43046681.0, "step": 18795 }, { "entropy": 5.621007061004638, "epoch": 1.8584420719652037, "grad_norm": 1.015625, "learning_rate": 0.00046583118199084177, "loss": 5.0534, "mean_token_accuracy": 0.21020459681749343, "num_tokens": 43058514.0, "step": 18800 }, { "entropy": 5.701592874526978, "epoch": 1.858936338473705, "grad_norm": 1.0625, "learning_rate": 0.0004658124839136737, "loss": 5.1156, "mean_token_accuracy": 0.20329195708036424, "num_tokens": 43069588.0, "step": 18805 }, { "entropy": 5.58687539100647, "epoch": 1.8594306049822062, "grad_norm": 1.0390625, "learning_rate": 0.0004657937811424889, "loss": 5.0655, "mean_token_accuracy": 0.21613341569900513, "num_tokens": 43080811.0, "step": 18810 }, { "entropy": 5.679731369018555, "epoch": 1.859924871490708, "grad_norm": 0.94140625, "learning_rate": 0.0004657750736777474, "loss": 5.1185, "mean_token_accuracy": 0.20846298933029175, "num_tokens": 43093506.0, "step": 18815 }, { "entropy": 5.58564338684082, "epoch": 1.8604191379992092, "grad_norm": 1.078125, "learning_rate": 0.00046575636151990955, "loss": 5.012, "mean_token_accuracy": 0.21496486961841582, "num_tokens": 43105272.0, "step": 18820 }, { "entropy": 5.634746265411377, "epoch": 1.8609134045077105, "grad_norm": 1.1796875, "learning_rate": 0.00046573764466943565, "loss": 5.0592, "mean_token_accuracy": 0.2072422057390213, "num_tokens": 43116070.0, "step": 18825 }, { "entropy": 5.645791292190552, "epoch": 1.861407671016212, "grad_norm": 1.1328125, "learning_rate": 0.00046571892312678606, "loss": 5.1012, "mean_token_accuracy": 0.20448542535305023, "num_tokens": 43126347.0, "step": 18830 }, { "entropy": 5.705598974227906, "epoch": 1.8619019375247134, "grad_norm": 0.97265625, "learning_rate": 0.00046570019689242136, "loss": 5.1598, "mean_token_accuracy": 0.2039424419403076, "num_tokens": 43138752.0, "step": 18835 }, { "entropy": 5.697179937362671, "epoch": 1.8623962040332147, "grad_norm": 1.0234375, "learning_rate": 0.0004656814659668023, "loss": 5.2148, "mean_token_accuracy": 0.2002865567803383, "num_tokens": 43151283.0, "step": 18840 }, { "entropy": 5.66009202003479, "epoch": 1.862890470541716, "grad_norm": 1.046875, "learning_rate": 0.00046566273035038953, "loss": 5.0685, "mean_token_accuracy": 0.20443406105041503, "num_tokens": 43161643.0, "step": 18845 }, { "entropy": 5.648190689086914, "epoch": 1.8633847370502175, "grad_norm": 1.125, "learning_rate": 0.00046564399004364403, "loss": 5.067, "mean_token_accuracy": 0.2069354847073555, "num_tokens": 43171966.0, "step": 18850 }, { "entropy": 5.6140340805053714, "epoch": 1.863879003558719, "grad_norm": 0.9765625, "learning_rate": 0.00046562524504702683, "loss": 5.0754, "mean_token_accuracy": 0.21122066527605057, "num_tokens": 43183022.0, "step": 18855 }, { "entropy": 5.64068489074707, "epoch": 1.8643732700672202, "grad_norm": 1.0625, "learning_rate": 0.00046560649536099905, "loss": 5.0955, "mean_token_accuracy": 0.21110787689685823, "num_tokens": 43194927.0, "step": 18860 }, { "entropy": 5.62657470703125, "epoch": 1.8648675365757215, "grad_norm": 1.1171875, "learning_rate": 0.0004655877409860218, "loss": 5.011, "mean_token_accuracy": 0.22447319477796554, "num_tokens": 43205519.0, "step": 18865 }, { "entropy": 5.600402164459228, "epoch": 1.8653618030842232, "grad_norm": 1.046875, "learning_rate": 0.00046556898192255664, "loss": 5.1429, "mean_token_accuracy": 0.19857464581727982, "num_tokens": 43217805.0, "step": 18870 }, { "entropy": 5.6111854076385494, "epoch": 1.8658560695927244, "grad_norm": 1.078125, "learning_rate": 0.00046555021817106494, "loss": 5.0993, "mean_token_accuracy": 0.20735810250043868, "num_tokens": 43228394.0, "step": 18875 }, { "entropy": 5.6211964130401615, "epoch": 1.8663503361012257, "grad_norm": 0.98828125, "learning_rate": 0.00046553144973200835, "loss": 5.05, "mean_token_accuracy": 0.20902428179979324, "num_tokens": 43240204.0, "step": 18880 }, { "entropy": 5.711541366577149, "epoch": 1.8668446026097272, "grad_norm": 1.03125, "learning_rate": 0.0004655126766058485, "loss": 5.1755, "mean_token_accuracy": 0.2023575335741043, "num_tokens": 43251103.0, "step": 18885 }, { "entropy": 5.587367916107178, "epoch": 1.8673388691182287, "grad_norm": 0.94140625, "learning_rate": 0.00046549389879304724, "loss": 5.0166, "mean_token_accuracy": 0.2134883686900139, "num_tokens": 43263653.0, "step": 18890 }, { "entropy": 5.606525707244873, "epoch": 1.86783313562673, "grad_norm": 1.0390625, "learning_rate": 0.0004654751162940665, "loss": 5.0498, "mean_token_accuracy": 0.2099285304546356, "num_tokens": 43274893.0, "step": 18895 }, { "entropy": 5.620145511627197, "epoch": 1.8683274021352312, "grad_norm": 0.99609375, "learning_rate": 0.0004654563291093684, "loss": 5.0396, "mean_token_accuracy": 0.21617888510227204, "num_tokens": 43287510.0, "step": 18900 }, { "entropy": 5.6573529720306395, "epoch": 1.8688216686437327, "grad_norm": 1.0234375, "learning_rate": 0.0004654375372394151, "loss": 5.1201, "mean_token_accuracy": 0.2086544379591942, "num_tokens": 43299735.0, "step": 18905 }, { "entropy": 5.623834800720215, "epoch": 1.8693159351522342, "grad_norm": 0.97265625, "learning_rate": 0.00046541874068466876, "loss": 5.0614, "mean_token_accuracy": 0.2172829195857048, "num_tokens": 43310401.0, "step": 18910 }, { "entropy": 5.609148693084717, "epoch": 1.8698102016607354, "grad_norm": 1.1171875, "learning_rate": 0.00046539993944559187, "loss": 5.0365, "mean_token_accuracy": 0.21044427007436753, "num_tokens": 43321300.0, "step": 18915 }, { "entropy": 5.596868562698364, "epoch": 1.870304468169237, "grad_norm": 1.0078125, "learning_rate": 0.000465381133522647, "loss": 5.037, "mean_token_accuracy": 0.20819175690412522, "num_tokens": 43332304.0, "step": 18920 }, { "entropy": 5.61895980834961, "epoch": 1.8707987346777384, "grad_norm": 1.046875, "learning_rate": 0.0004653623229162966, "loss": 5.0894, "mean_token_accuracy": 0.20482700169086457, "num_tokens": 43343524.0, "step": 18925 }, { "entropy": 5.6968413352966305, "epoch": 1.8712930011862396, "grad_norm": 1.03125, "learning_rate": 0.00046534350762700354, "loss": 5.0519, "mean_token_accuracy": 0.202326175570488, "num_tokens": 43353364.0, "step": 18930 }, { "entropy": 5.548586225509643, "epoch": 1.871787267694741, "grad_norm": 0.9375, "learning_rate": 0.00046532468765523075, "loss": 4.9589, "mean_token_accuracy": 0.2237056389451027, "num_tokens": 43365660.0, "step": 18935 }, { "entropy": 5.683240175247192, "epoch": 1.8722815342032424, "grad_norm": 1.03125, "learning_rate": 0.00046530586300144104, "loss": 5.1708, "mean_token_accuracy": 0.21004719734191896, "num_tokens": 43376882.0, "step": 18940 }, { "entropy": 5.7007904052734375, "epoch": 1.8727758007117439, "grad_norm": 1.109375, "learning_rate": 0.00046528703366609757, "loss": 5.0683, "mean_token_accuracy": 0.218053337931633, "num_tokens": 43387872.0, "step": 18945 }, { "entropy": 5.668022489547729, "epoch": 1.8732700672202451, "grad_norm": 1.0, "learning_rate": 0.00046526819964966363, "loss": 5.1453, "mean_token_accuracy": 0.20620756447315217, "num_tokens": 43399162.0, "step": 18950 }, { "entropy": 5.6261755466461185, "epoch": 1.8737643337287464, "grad_norm": 1.078125, "learning_rate": 0.0004652493609526024, "loss": 5.0582, "mean_token_accuracy": 0.20773775577545167, "num_tokens": 43410163.0, "step": 18955 }, { "entropy": 5.663573789596557, "epoch": 1.8742586002372479, "grad_norm": 1.0078125, "learning_rate": 0.0004652305175753774, "loss": 5.0645, "mean_token_accuracy": 0.21069157421588897, "num_tokens": 43421841.0, "step": 18960 }, { "entropy": 5.628210020065308, "epoch": 1.8747528667457494, "grad_norm": 1.3828125, "learning_rate": 0.0004652116695184521, "loss": 5.0117, "mean_token_accuracy": 0.21811187863349915, "num_tokens": 43432301.0, "step": 18965 }, { "entropy": 5.691852283477783, "epoch": 1.8752471332542506, "grad_norm": 1.0390625, "learning_rate": 0.0004651928167822903, "loss": 5.1247, "mean_token_accuracy": 0.20635047554969788, "num_tokens": 43443531.0, "step": 18970 }, { "entropy": 5.568627738952637, "epoch": 1.8757413997627521, "grad_norm": 1.078125, "learning_rate": 0.0004651739593673556, "loss": 4.9833, "mean_token_accuracy": 0.21363078504800798, "num_tokens": 43455230.0, "step": 18975 }, { "entropy": 5.633916854858398, "epoch": 1.8762356662712536, "grad_norm": 1.0390625, "learning_rate": 0.0004651550972741121, "loss": 5.1551, "mean_token_accuracy": 0.20274971425533295, "num_tokens": 43466342.0, "step": 18980 }, { "entropy": 5.691919422149658, "epoch": 1.8767299327797549, "grad_norm": 0.984375, "learning_rate": 0.0004651362305030237, "loss": 5.1677, "mean_token_accuracy": 0.20354398488998413, "num_tokens": 43477962.0, "step": 18985 }, { "entropy": 5.631208753585815, "epoch": 1.8772241992882561, "grad_norm": 1.0, "learning_rate": 0.0004651173590545545, "loss": 5.102, "mean_token_accuracy": 0.20939572155475616, "num_tokens": 43489252.0, "step": 18990 }, { "entropy": 5.700050210952758, "epoch": 1.8777184657967576, "grad_norm": 1.109375, "learning_rate": 0.00046509848292916877, "loss": 5.0594, "mean_token_accuracy": 0.21403837203979492, "num_tokens": 43499199.0, "step": 18995 }, { "entropy": 5.610651206970215, "epoch": 1.878212732305259, "grad_norm": 1.0625, "learning_rate": 0.00046507960212733093, "loss": 5.0587, "mean_token_accuracy": 0.21450406610965728, "num_tokens": 43509812.0, "step": 19000 }, { "entropy": 5.564178419113159, "epoch": 1.8787069988137604, "grad_norm": 0.984375, "learning_rate": 0.00046506071664950525, "loss": 5.0684, "mean_token_accuracy": 0.21679007709026338, "num_tokens": 43521197.0, "step": 19005 }, { "entropy": 5.612315559387207, "epoch": 1.8792012653222616, "grad_norm": 1.0546875, "learning_rate": 0.00046504182649615664, "loss": 5.0918, "mean_token_accuracy": 0.21189072877168655, "num_tokens": 43532826.0, "step": 19010 }, { "entropy": 5.664116477966308, "epoch": 1.879695531830763, "grad_norm": 1.0625, "learning_rate": 0.00046502293166774945, "loss": 5.0914, "mean_token_accuracy": 0.2052301898598671, "num_tokens": 43544617.0, "step": 19015 }, { "entropy": 5.56850962638855, "epoch": 1.8801897983392646, "grad_norm": 0.99609375, "learning_rate": 0.0004650040321647487, "loss": 4.9862, "mean_token_accuracy": 0.22246796190738677, "num_tokens": 43556006.0, "step": 19020 }, { "entropy": 5.614038705825806, "epoch": 1.8806840648477658, "grad_norm": 1.03125, "learning_rate": 0.0004649851279876193, "loss": 5.071, "mean_token_accuracy": 0.21333273202180864, "num_tokens": 43567112.0, "step": 19025 }, { "entropy": 5.641375255584717, "epoch": 1.8811783313562673, "grad_norm": 1.0703125, "learning_rate": 0.0004649662191368263, "loss": 5.1167, "mean_token_accuracy": 0.2111019864678383, "num_tokens": 43577974.0, "step": 19030 }, { "entropy": 5.62573471069336, "epoch": 1.8816725978647688, "grad_norm": 1.1015625, "learning_rate": 0.0004649473056128349, "loss": 4.9766, "mean_token_accuracy": 0.219074647128582, "num_tokens": 43588723.0, "step": 19035 }, { "entropy": 5.596174144744873, "epoch": 1.88216686437327, "grad_norm": 1.078125, "learning_rate": 0.0004649283874161102, "loss": 5.0077, "mean_token_accuracy": 0.21349561363458633, "num_tokens": 43599721.0, "step": 19040 }, { "entropy": 5.675543260574341, "epoch": 1.8826611308817713, "grad_norm": 0.94140625, "learning_rate": 0.0004649094645471177, "loss": 5.1178, "mean_token_accuracy": 0.20928578674793244, "num_tokens": 43610517.0, "step": 19045 }, { "entropy": 5.678053379058838, "epoch": 1.8831553973902728, "grad_norm": 0.96875, "learning_rate": 0.000464890537006323, "loss": 5.1505, "mean_token_accuracy": 0.2021818533539772, "num_tokens": 43622547.0, "step": 19050 }, { "entropy": 5.63472900390625, "epoch": 1.8836496638987743, "grad_norm": 1.046875, "learning_rate": 0.0004648716047941916, "loss": 5.0166, "mean_token_accuracy": 0.21149884015321732, "num_tokens": 43633982.0, "step": 19055 }, { "entropy": 5.628610849380493, "epoch": 1.8841439304072756, "grad_norm": 1.109375, "learning_rate": 0.0004648526679111892, "loss": 5.0566, "mean_token_accuracy": 0.21319651752710342, "num_tokens": 43644888.0, "step": 19060 }, { "entropy": 5.670370721817017, "epoch": 1.8846381969157768, "grad_norm": 0.94921875, "learning_rate": 0.0004648337263577818, "loss": 5.0738, "mean_token_accuracy": 0.21576802283525467, "num_tokens": 43658352.0, "step": 19065 }, { "entropy": 5.555505323410034, "epoch": 1.8851324634242785, "grad_norm": 1.0078125, "learning_rate": 0.00046481478013443527, "loss": 4.9391, "mean_token_accuracy": 0.2208205997943878, "num_tokens": 43669127.0, "step": 19070 }, { "entropy": 5.634367275238037, "epoch": 1.8856267299327798, "grad_norm": 0.97265625, "learning_rate": 0.0004647958292416157, "loss": 5.0757, "mean_token_accuracy": 0.20891330391168594, "num_tokens": 43681504.0, "step": 19075 }, { "entropy": 5.561264371871948, "epoch": 1.886120996441281, "grad_norm": 1.203125, "learning_rate": 0.0004647768736797893, "loss": 4.9888, "mean_token_accuracy": 0.21297334134578705, "num_tokens": 43691396.0, "step": 19080 }, { "entropy": 5.636831140518188, "epoch": 1.8866152629497825, "grad_norm": 1.0078125, "learning_rate": 0.00046475791344942227, "loss": 5.0629, "mean_token_accuracy": 0.21800864040851592, "num_tokens": 43703761.0, "step": 19085 }, { "entropy": 5.562981986999512, "epoch": 1.887109529458284, "grad_norm": 0.96875, "learning_rate": 0.0004647389485509812, "loss": 5.0369, "mean_token_accuracy": 0.216914002597332, "num_tokens": 43715041.0, "step": 19090 }, { "entropy": 5.667421340942383, "epoch": 1.8876037959667853, "grad_norm": 0.98046875, "learning_rate": 0.00046471997898493256, "loss": 5.1365, "mean_token_accuracy": 0.20903618186712264, "num_tokens": 43727060.0, "step": 19095 }, { "entropy": 5.696099805831909, "epoch": 1.8880980624752866, "grad_norm": 0.91796875, "learning_rate": 0.000464701004751743, "loss": 5.1452, "mean_token_accuracy": 0.19805069118738175, "num_tokens": 43738996.0, "step": 19100 }, { "entropy": 5.598925161361694, "epoch": 1.888592328983788, "grad_norm": 1.0546875, "learning_rate": 0.0004646820258518793, "loss": 4.9827, "mean_token_accuracy": 0.2098909556865692, "num_tokens": 43749415.0, "step": 19105 }, { "entropy": 5.579950761795044, "epoch": 1.8890865954922895, "grad_norm": 1.0625, "learning_rate": 0.0004646630422858083, "loss": 5.0902, "mean_token_accuracy": 0.2127127006649971, "num_tokens": 43760289.0, "step": 19110 }, { "entropy": 5.625993347167968, "epoch": 1.8895808620007908, "grad_norm": 1.0859375, "learning_rate": 0.00046464405405399707, "loss": 5.0854, "mean_token_accuracy": 0.2143365502357483, "num_tokens": 43771267.0, "step": 19115 }, { "entropy": 5.723125791549682, "epoch": 1.890075128509292, "grad_norm": 0.984375, "learning_rate": 0.00046462506115691274, "loss": 5.0836, "mean_token_accuracy": 0.21585662364959718, "num_tokens": 43782584.0, "step": 19120 }, { "entropy": 5.6809924125671385, "epoch": 1.8905693950177938, "grad_norm": 1.03125, "learning_rate": 0.00046460606359502237, "loss": 5.1308, "mean_token_accuracy": 0.20276195257902146, "num_tokens": 43792738.0, "step": 19125 }, { "entropy": 5.66569333076477, "epoch": 1.891063661526295, "grad_norm": 1.03125, "learning_rate": 0.00046458706136879354, "loss": 5.1219, "mean_token_accuracy": 0.21083028316497804, "num_tokens": 43804117.0, "step": 19130 }, { "entropy": 5.672361516952515, "epoch": 1.8915579280347963, "grad_norm": 0.9609375, "learning_rate": 0.0004645680544786935, "loss": 5.1144, "mean_token_accuracy": 0.20448788851499558, "num_tokens": 43817367.0, "step": 19135 }, { "entropy": 5.663379955291748, "epoch": 1.8920521945432978, "grad_norm": 1.0078125, "learning_rate": 0.00046454904292518996, "loss": 5.0899, "mean_token_accuracy": 0.21087296754121782, "num_tokens": 43829213.0, "step": 19140 }, { "entropy": 5.654307079315186, "epoch": 1.8925464610517992, "grad_norm": 1.09375, "learning_rate": 0.00046453002670875055, "loss": 5.083, "mean_token_accuracy": 0.2128744751214981, "num_tokens": 43839939.0, "step": 19145 }, { "entropy": 5.661191654205322, "epoch": 1.8930407275603005, "grad_norm": 1.015625, "learning_rate": 0.00046451100582984304, "loss": 5.027, "mean_token_accuracy": 0.21586479246616364, "num_tokens": 43850411.0, "step": 19150 }, { "entropy": 5.62843918800354, "epoch": 1.8935349940688018, "grad_norm": 1.1171875, "learning_rate": 0.0004644919802889354, "loss": 5.0453, "mean_token_accuracy": 0.20503214746713638, "num_tokens": 43861083.0, "step": 19155 }, { "entropy": 5.646159029006958, "epoch": 1.8940292605773033, "grad_norm": 1.046875, "learning_rate": 0.00046447295008649576, "loss": 5.0197, "mean_token_accuracy": 0.2111269325017929, "num_tokens": 43871712.0, "step": 19160 }, { "entropy": 5.7251006126403805, "epoch": 1.8945235270858047, "grad_norm": 0.94921875, "learning_rate": 0.00046445391522299204, "loss": 5.1134, "mean_token_accuracy": 0.20347818732261658, "num_tokens": 43884617.0, "step": 19165 }, { "entropy": 5.64468297958374, "epoch": 1.895017793594306, "grad_norm": 0.97265625, "learning_rate": 0.00046443487569889264, "loss": 5.1121, "mean_token_accuracy": 0.20712761729955673, "num_tokens": 43895533.0, "step": 19170 }, { "entropy": 5.646384906768799, "epoch": 1.8955120601028075, "grad_norm": 0.99609375, "learning_rate": 0.00046441583151466586, "loss": 5.1079, "mean_token_accuracy": 0.20890576094388963, "num_tokens": 43906616.0, "step": 19175 }, { "entropy": 5.674221229553223, "epoch": 1.896006326611309, "grad_norm": 1.046875, "learning_rate": 0.0004643967826707803, "loss": 5.0789, "mean_token_accuracy": 0.20838335752487183, "num_tokens": 43917389.0, "step": 19180 }, { "entropy": 5.675025892257691, "epoch": 1.8965005931198102, "grad_norm": 1.125, "learning_rate": 0.0004643777291677045, "loss": 5.1145, "mean_token_accuracy": 0.20656287670135498, "num_tokens": 43929239.0, "step": 19185 }, { "entropy": 5.706207704544068, "epoch": 1.8969948596283115, "grad_norm": 1.0078125, "learning_rate": 0.0004643586710059072, "loss": 5.1382, "mean_token_accuracy": 0.20939329415559768, "num_tokens": 43940267.0, "step": 19190 }, { "entropy": 5.671395540237427, "epoch": 1.897489126136813, "grad_norm": 1.125, "learning_rate": 0.00046433960818585717, "loss": 5.0503, "mean_token_accuracy": 0.21199682205915452, "num_tokens": 43951505.0, "step": 19195 }, { "entropy": 5.602506017684936, "epoch": 1.8979833926453145, "grad_norm": 1.046875, "learning_rate": 0.00046432054070802344, "loss": 5.0785, "mean_token_accuracy": 0.21312207579612732, "num_tokens": 43963669.0, "step": 19200 }, { "entropy": 5.587722587585449, "epoch": 1.8984776591538157, "grad_norm": 0.93359375, "learning_rate": 0.00046430146857287497, "loss": 5.0554, "mean_token_accuracy": 0.21037477254867554, "num_tokens": 43975814.0, "step": 19205 }, { "entropy": 5.619813394546509, "epoch": 1.898971925662317, "grad_norm": 0.9609375, "learning_rate": 0.00046428239178088106, "loss": 5.0705, "mean_token_accuracy": 0.20720606446266174, "num_tokens": 43987305.0, "step": 19210 }, { "entropy": 5.682951545715332, "epoch": 1.8994661921708185, "grad_norm": 1.046875, "learning_rate": 0.00046426331033251096, "loss": 5.0631, "mean_token_accuracy": 0.2163083702325821, "num_tokens": 43997441.0, "step": 19215 }, { "entropy": 5.670897674560547, "epoch": 1.89996045867932, "grad_norm": 0.99609375, "learning_rate": 0.000464244224228234, "loss": 5.0868, "mean_token_accuracy": 0.20913078337907792, "num_tokens": 44008718.0, "step": 19220 }, { "entropy": 5.677132701873779, "epoch": 1.9004547251878212, "grad_norm": 0.984375, "learning_rate": 0.0004642251334685199, "loss": 5.1262, "mean_token_accuracy": 0.2059702008962631, "num_tokens": 44020785.0, "step": 19225 }, { "entropy": 5.623924255371094, "epoch": 1.9009489916963227, "grad_norm": 1.046875, "learning_rate": 0.00046420603805383796, "loss": 5.0382, "mean_token_accuracy": 0.2141259044408798, "num_tokens": 44031360.0, "step": 19230 }, { "entropy": 5.616070222854614, "epoch": 1.9014432582048242, "grad_norm": 1.1015625, "learning_rate": 0.0004641869379846583, "loss": 5.0133, "mean_token_accuracy": 0.21576945334672928, "num_tokens": 44042510.0, "step": 19235 }, { "entropy": 5.64178466796875, "epoch": 1.9019375247133254, "grad_norm": 1.171875, "learning_rate": 0.00046416783326145065, "loss": 5.0526, "mean_token_accuracy": 0.2009693995118141, "num_tokens": 44053800.0, "step": 19240 }, { "entropy": 5.547603988647461, "epoch": 1.9024317912218267, "grad_norm": 1.0, "learning_rate": 0.0004641487238846848, "loss": 5.0549, "mean_token_accuracy": 0.21304074972867965, "num_tokens": 44066727.0, "step": 19245 }, { "entropy": 5.679951333999634, "epoch": 1.9029260577303282, "grad_norm": 1.0703125, "learning_rate": 0.00046412960985483105, "loss": 5.1017, "mean_token_accuracy": 0.20805110782384872, "num_tokens": 44077863.0, "step": 19250 }, { "entropy": 5.609346389770508, "epoch": 1.9034203242388297, "grad_norm": 1.0625, "learning_rate": 0.0004641104911723596, "loss": 4.999, "mean_token_accuracy": 0.22144273966550826, "num_tokens": 44088218.0, "step": 19255 }, { "entropy": 5.7215611934661865, "epoch": 1.903914590747331, "grad_norm": 1.0234375, "learning_rate": 0.0004640913678377407, "loss": 5.1796, "mean_token_accuracy": 0.20432823300361633, "num_tokens": 44101236.0, "step": 19260 }, { "entropy": 5.618597364425659, "epoch": 1.9044088572558322, "grad_norm": 0.94921875, "learning_rate": 0.0004640722398514448, "loss": 5.1242, "mean_token_accuracy": 0.2039702832698822, "num_tokens": 44114185.0, "step": 19265 }, { "entropy": 5.5997669219970705, "epoch": 1.9049031237643337, "grad_norm": 0.98828125, "learning_rate": 0.00046405310721394245, "loss": 5.0172, "mean_token_accuracy": 0.21126770675182344, "num_tokens": 44126060.0, "step": 19270 }, { "entropy": 5.624208974838257, "epoch": 1.9053973902728352, "grad_norm": 0.97265625, "learning_rate": 0.0004640339699257044, "loss": 5.1132, "mean_token_accuracy": 0.2070220246911049, "num_tokens": 44137709.0, "step": 19275 }, { "entropy": 5.638573789596558, "epoch": 1.9058916567813364, "grad_norm": 0.9609375, "learning_rate": 0.0004640148279872013, "loss": 5.0828, "mean_token_accuracy": 0.20739554464817048, "num_tokens": 44150042.0, "step": 19280 }, { "entropy": 5.675692892074585, "epoch": 1.906385923289838, "grad_norm": 1.0390625, "learning_rate": 0.00046399568139890413, "loss": 5.1175, "mean_token_accuracy": 0.2094061091542244, "num_tokens": 44162926.0, "step": 19285 }, { "entropy": 5.628718996047974, "epoch": 1.9068801897983394, "grad_norm": 0.9609375, "learning_rate": 0.00046397653016128396, "loss": 5.0056, "mean_token_accuracy": 0.21756524294614793, "num_tokens": 44174211.0, "step": 19290 }, { "entropy": 5.658139228820801, "epoch": 1.9073744563068407, "grad_norm": 0.98828125, "learning_rate": 0.0004639573742748117, "loss": 5.1523, "mean_token_accuracy": 0.19761571884155274, "num_tokens": 44187127.0, "step": 19295 }, { "entropy": 5.655079793930054, "epoch": 1.907868722815342, "grad_norm": 0.9375, "learning_rate": 0.00046393821373995884, "loss": 5.0787, "mean_token_accuracy": 0.20725574493408203, "num_tokens": 44199335.0, "step": 19300 }, { "entropy": 5.636370706558227, "epoch": 1.9083629893238434, "grad_norm": 0.98828125, "learning_rate": 0.00046391904855719654, "loss": 4.9726, "mean_token_accuracy": 0.2204921528697014, "num_tokens": 44209911.0, "step": 19305 }, { "entropy": 5.580710792541504, "epoch": 1.908857255832345, "grad_norm": 1.0078125, "learning_rate": 0.00046389987872699637, "loss": 4.9976, "mean_token_accuracy": 0.21754512637853624, "num_tokens": 44221391.0, "step": 19310 }, { "entropy": 5.628866720199585, "epoch": 1.9093515223408462, "grad_norm": 0.9453125, "learning_rate": 0.00046388070424982985, "loss": 5.0004, "mean_token_accuracy": 0.22271381169557572, "num_tokens": 44233138.0, "step": 19315 }, { "entropy": 5.613586950302124, "epoch": 1.9098457888493474, "grad_norm": 1.0234375, "learning_rate": 0.0004638615251261687, "loss": 5.0371, "mean_token_accuracy": 0.21705514639616014, "num_tokens": 44244353.0, "step": 19320 }, { "entropy": 5.64655442237854, "epoch": 1.910340055357849, "grad_norm": 0.99609375, "learning_rate": 0.00046384234135648475, "loss": 5.1083, "mean_token_accuracy": 0.20777883380651474, "num_tokens": 44256369.0, "step": 19325 }, { "entropy": 5.65443229675293, "epoch": 1.9108343218663504, "grad_norm": 1.0390625, "learning_rate": 0.00046382315294124987, "loss": 5.069, "mean_token_accuracy": 0.20716547816991807, "num_tokens": 44267958.0, "step": 19330 }, { "entropy": 5.600178241729736, "epoch": 1.9113285883748516, "grad_norm": 0.9921875, "learning_rate": 0.0004638039598809361, "loss": 5.0876, "mean_token_accuracy": 0.21102544367313386, "num_tokens": 44279379.0, "step": 19335 }, { "entropy": 5.643342685699463, "epoch": 1.9118228548833531, "grad_norm": 1.1484375, "learning_rate": 0.0004637847621760158, "loss": 5.0283, "mean_token_accuracy": 0.212414687871933, "num_tokens": 44289655.0, "step": 19340 }, { "entropy": 5.6762392044067385, "epoch": 1.9123171213918546, "grad_norm": 0.97265625, "learning_rate": 0.00046376555982696093, "loss": 5.1439, "mean_token_accuracy": 0.2042708531022072, "num_tokens": 44301642.0, "step": 19345 }, { "entropy": 5.6611488342285154, "epoch": 1.9128113879003559, "grad_norm": 1.0546875, "learning_rate": 0.000463746352834244, "loss": 5.0354, "mean_token_accuracy": 0.21279600858688355, "num_tokens": 44313260.0, "step": 19350 }, { "entropy": 5.670933055877685, "epoch": 1.9133056544088571, "grad_norm": 0.98046875, "learning_rate": 0.0004637271411983375, "loss": 5.0414, "mean_token_accuracy": 0.20739281177520752, "num_tokens": 44325095.0, "step": 19355 }, { "entropy": 5.667784690856934, "epoch": 1.9137999209173586, "grad_norm": 0.99609375, "learning_rate": 0.0004637079249197141, "loss": 5.092, "mean_token_accuracy": 0.2084566533565521, "num_tokens": 44337381.0, "step": 19360 }, { "entropy": 5.601995229721069, "epoch": 1.91429418742586, "grad_norm": 1.1328125, "learning_rate": 0.00046368870399884644, "loss": 5.0195, "mean_token_accuracy": 0.2199844554066658, "num_tokens": 44348487.0, "step": 19365 }, { "entropy": 5.589890718460083, "epoch": 1.9147884539343614, "grad_norm": 1.09375, "learning_rate": 0.00046366947843620737, "loss": 4.9965, "mean_token_accuracy": 0.21640492975711823, "num_tokens": 44358645.0, "step": 19370 }, { "entropy": 5.591676425933838, "epoch": 1.9152827204428626, "grad_norm": 1.0859375, "learning_rate": 0.00046365024823226994, "loss": 5.0261, "mean_token_accuracy": 0.2191988095641136, "num_tokens": 44369924.0, "step": 19375 }, { "entropy": 5.630442476272583, "epoch": 1.9157769869513643, "grad_norm": 1.0234375, "learning_rate": 0.0004636310133875071, "loss": 5.0435, "mean_token_accuracy": 0.20661877244710922, "num_tokens": 44381684.0, "step": 19380 }, { "entropy": 5.762734699249267, "epoch": 1.9162712534598656, "grad_norm": 1.0, "learning_rate": 0.00046361177390239204, "loss": 5.1739, "mean_token_accuracy": 0.20375576317310334, "num_tokens": 44392780.0, "step": 19385 }, { "entropy": 5.6657712936401365, "epoch": 1.9167655199683669, "grad_norm": 0.984375, "learning_rate": 0.0004635925297773981, "loss": 5.1132, "mean_token_accuracy": 0.2070128008723259, "num_tokens": 44405330.0, "step": 19390 }, { "entropy": 5.706775140762329, "epoch": 1.9172597864768683, "grad_norm": 1.109375, "learning_rate": 0.0004635732810129987, "loss": 5.1369, "mean_token_accuracy": 0.20602299124002457, "num_tokens": 44416307.0, "step": 19395 }, { "entropy": 5.6942767143249515, "epoch": 1.9177540529853698, "grad_norm": 1.0859375, "learning_rate": 0.0004635540276096673, "loss": 5.0895, "mean_token_accuracy": 0.2054031476378441, "num_tokens": 44427481.0, "step": 19400 }, { "entropy": 5.57626576423645, "epoch": 1.918248319493871, "grad_norm": 0.95703125, "learning_rate": 0.00046353476956787756, "loss": 5.0271, "mean_token_accuracy": 0.21087507903575897, "num_tokens": 44439462.0, "step": 19405 }, { "entropy": 5.657554197311401, "epoch": 1.9187425860023724, "grad_norm": 1.03125, "learning_rate": 0.00046351550688810317, "loss": 5.1062, "mean_token_accuracy": 0.20216142684221267, "num_tokens": 44452206.0, "step": 19410 }, { "entropy": 5.645693254470825, "epoch": 1.9192368525108738, "grad_norm": 1.0546875, "learning_rate": 0.0004634962395708182, "loss": 5.0514, "mean_token_accuracy": 0.21485889852046966, "num_tokens": 44463598.0, "step": 19415 }, { "entropy": 5.6406079769134525, "epoch": 1.9197311190193753, "grad_norm": 1.0234375, "learning_rate": 0.00046347696761649647, "loss": 5.0627, "mean_token_accuracy": 0.2152916505932808, "num_tokens": 44475606.0, "step": 19420 }, { "entropy": 5.645353603363037, "epoch": 1.9202253855278766, "grad_norm": 0.984375, "learning_rate": 0.000463457691025612, "loss": 5.0677, "mean_token_accuracy": 0.208383509516716, "num_tokens": 44486948.0, "step": 19425 }, { "entropy": 5.623245477676392, "epoch": 1.920719652036378, "grad_norm": 1.1015625, "learning_rate": 0.00046343840979863924, "loss": 5.0156, "mean_token_accuracy": 0.21358214765787126, "num_tokens": 44497408.0, "step": 19430 }, { "entropy": 5.652865171432495, "epoch": 1.9212139185448796, "grad_norm": 1.1015625, "learning_rate": 0.00046341912393605225, "loss": 5.0648, "mean_token_accuracy": 0.21157305240631102, "num_tokens": 44508246.0, "step": 19435 }, { "entropy": 5.5716166496276855, "epoch": 1.9217081850533808, "grad_norm": 0.9609375, "learning_rate": 0.0004633998334383256, "loss": 4.9939, "mean_token_accuracy": 0.2198000892996788, "num_tokens": 44520207.0, "step": 19440 }, { "entropy": 5.569386768341064, "epoch": 1.922202451561882, "grad_norm": 0.94921875, "learning_rate": 0.00046338053830593384, "loss": 4.9894, "mean_token_accuracy": 0.21163886040449142, "num_tokens": 44532290.0, "step": 19445 }, { "entropy": 5.657324123382568, "epoch": 1.9226967180703836, "grad_norm": 0.99609375, "learning_rate": 0.0004633612385393516, "loss": 5.1155, "mean_token_accuracy": 0.20451077073812485, "num_tokens": 44544305.0, "step": 19450 }, { "entropy": 5.679154014587402, "epoch": 1.923190984578885, "grad_norm": 0.9609375, "learning_rate": 0.0004633419341390537, "loss": 5.1135, "mean_token_accuracy": 0.20592916905879974, "num_tokens": 44556753.0, "step": 19455 }, { "entropy": 5.687878274917603, "epoch": 1.9236852510873863, "grad_norm": 1.0546875, "learning_rate": 0.000463322625105515, "loss": 5.0613, "mean_token_accuracy": 0.20601916462182998, "num_tokens": 44567891.0, "step": 19460 }, { "entropy": 5.599336576461792, "epoch": 1.9241795175958876, "grad_norm": 1.0390625, "learning_rate": 0.00046330331143921045, "loss": 4.9839, "mean_token_accuracy": 0.21828426718711852, "num_tokens": 44579060.0, "step": 19465 }, { "entropy": 5.636899042129516, "epoch": 1.924673784104389, "grad_norm": 0.93359375, "learning_rate": 0.00046328399314061525, "loss": 5.091, "mean_token_accuracy": 0.2109926775097847, "num_tokens": 44591748.0, "step": 19470 }, { "entropy": 5.601712083816528, "epoch": 1.9251680506128905, "grad_norm": 1.0546875, "learning_rate": 0.0004632646702102046, "loss": 5.0078, "mean_token_accuracy": 0.21655934154987336, "num_tokens": 44603119.0, "step": 19475 }, { "entropy": 5.684094476699829, "epoch": 1.9256623171213918, "grad_norm": 1.0234375, "learning_rate": 0.0004632453426484539, "loss": 5.1166, "mean_token_accuracy": 0.20843250304460526, "num_tokens": 44614391.0, "step": 19480 }, { "entropy": 5.630988550186157, "epoch": 1.9261565836298933, "grad_norm": 1.1171875, "learning_rate": 0.00046322601045583863, "loss": 4.9644, "mean_token_accuracy": 0.22375233769416808, "num_tokens": 44623950.0, "step": 19485 }, { "entropy": 5.561914396286011, "epoch": 1.9266508501383948, "grad_norm": 1.0390625, "learning_rate": 0.0004632066736328342, "loss": 5.0121, "mean_token_accuracy": 0.22212472707033157, "num_tokens": 44635177.0, "step": 19490 }, { "entropy": 5.636218023300171, "epoch": 1.927145116646896, "grad_norm": 1.0703125, "learning_rate": 0.0004631873321799164, "loss": 5.1477, "mean_token_accuracy": 0.20527319759130477, "num_tokens": 44646956.0, "step": 19495 }, { "entropy": 5.705089664459228, "epoch": 1.9276393831553973, "grad_norm": 0.99609375, "learning_rate": 0.000463167986097561, "loss": 5.0812, "mean_token_accuracy": 0.20600777268409728, "num_tokens": 44658161.0, "step": 19500 }, { "entropy": 5.605127143859863, "epoch": 1.9281336496638988, "grad_norm": 1.1171875, "learning_rate": 0.00046314863538624403, "loss": 5.041, "mean_token_accuracy": 0.2150225356221199, "num_tokens": 44668823.0, "step": 19505 }, { "entropy": 5.655456972122193, "epoch": 1.9286279161724003, "grad_norm": 1.0, "learning_rate": 0.0004631292800464414, "loss": 5.1401, "mean_token_accuracy": 0.2070609375834465, "num_tokens": 44682285.0, "step": 19510 }, { "entropy": 5.6841062068939205, "epoch": 1.9291221826809015, "grad_norm": 1.109375, "learning_rate": 0.00046310992007862935, "loss": 5.1218, "mean_token_accuracy": 0.21299461126327515, "num_tokens": 44694031.0, "step": 19515 }, { "entropy": 5.667581844329834, "epoch": 1.9296164491894028, "grad_norm": 1.125, "learning_rate": 0.000463090555483284, "loss": 5.0928, "mean_token_accuracy": 0.20440659821033477, "num_tokens": 44705636.0, "step": 19520 }, { "entropy": 5.6619658946990965, "epoch": 1.9301107156979043, "grad_norm": 1.078125, "learning_rate": 0.00046307118626088184, "loss": 5.1255, "mean_token_accuracy": 0.20776665806770325, "num_tokens": 44716505.0, "step": 19525 }, { "entropy": 5.646479988098145, "epoch": 1.9306049822064058, "grad_norm": 1.0078125, "learning_rate": 0.0004630518124118994, "loss": 5.1131, "mean_token_accuracy": 0.2020352900028229, "num_tokens": 44729298.0, "step": 19530 }, { "entropy": 5.648828172683716, "epoch": 1.931099248714907, "grad_norm": 0.9453125, "learning_rate": 0.00046303243393681307, "loss": 5.0625, "mean_token_accuracy": 0.20397354364395143, "num_tokens": 44740456.0, "step": 19535 }, { "entropy": 5.666863203048706, "epoch": 1.9315935152234085, "grad_norm": 0.96875, "learning_rate": 0.00046301305083609973, "loss": 5.0624, "mean_token_accuracy": 0.21573160737752914, "num_tokens": 44752311.0, "step": 19540 }, { "entropy": 5.700877475738525, "epoch": 1.93208778173191, "grad_norm": 1.03125, "learning_rate": 0.00046299366311023624, "loss": 5.1072, "mean_token_accuracy": 0.20626929998397828, "num_tokens": 44763704.0, "step": 19545 }, { "entropy": 5.571550703048706, "epoch": 1.9325820482404112, "grad_norm": 1.09375, "learning_rate": 0.0004629742707596994, "loss": 5.0883, "mean_token_accuracy": 0.2164826661348343, "num_tokens": 44775053.0, "step": 19550 }, { "entropy": 5.670269966125488, "epoch": 1.9330763147489125, "grad_norm": 1.078125, "learning_rate": 0.00046295487378496643, "loss": 5.1753, "mean_token_accuracy": 0.20627792328596115, "num_tokens": 44786734.0, "step": 19555 }, { "entropy": 5.758003902435303, "epoch": 1.933570581257414, "grad_norm": 1.0078125, "learning_rate": 0.00046293547218651427, "loss": 5.2129, "mean_token_accuracy": 0.2019398793578148, "num_tokens": 44798151.0, "step": 19560 }, { "entropy": 5.751073169708252, "epoch": 1.9340648477659155, "grad_norm": 1.1015625, "learning_rate": 0.0004629160659648204, "loss": 5.1662, "mean_token_accuracy": 0.2025855615735054, "num_tokens": 44809354.0, "step": 19565 }, { "entropy": 5.648626375198364, "epoch": 1.9345591142744167, "grad_norm": 1.0390625, "learning_rate": 0.0004628966551203622, "loss": 5.0777, "mean_token_accuracy": 0.20482106357812882, "num_tokens": 44820994.0, "step": 19570 }, { "entropy": 5.682492399215699, "epoch": 1.935053380782918, "grad_norm": 1.125, "learning_rate": 0.00046287723965361704, "loss": 5.1676, "mean_token_accuracy": 0.20429834127426147, "num_tokens": 44831486.0, "step": 19575 }, { "entropy": 5.662528562545776, "epoch": 1.9355476472914195, "grad_norm": 1.0546875, "learning_rate": 0.0004628578195650628, "loss": 5.1303, "mean_token_accuracy": 0.20603884011507034, "num_tokens": 44844078.0, "step": 19580 }, { "entropy": 5.661379384994507, "epoch": 1.936041913799921, "grad_norm": 1.03125, "learning_rate": 0.0004628383948551769, "loss": 5.0432, "mean_token_accuracy": 0.2123134180903435, "num_tokens": 44854722.0, "step": 19585 }, { "entropy": 5.646601676940918, "epoch": 1.9365361803084222, "grad_norm": 1.0859375, "learning_rate": 0.0004628189655244374, "loss": 5.0572, "mean_token_accuracy": 0.21286873519420624, "num_tokens": 44866337.0, "step": 19590 }, { "entropy": 5.64610857963562, "epoch": 1.9370304468169237, "grad_norm": 1.046875, "learning_rate": 0.0004627995315733222, "loss": 5.1384, "mean_token_accuracy": 0.20829109847545624, "num_tokens": 44878686.0, "step": 19595 }, { "entropy": 5.71244626045227, "epoch": 1.9375247133254252, "grad_norm": 0.9765625, "learning_rate": 0.00046278009300230945, "loss": 5.0512, "mean_token_accuracy": 0.20878118872642518, "num_tokens": 44890339.0, "step": 19600 }, { "entropy": 5.731397914886474, "epoch": 1.9380189798339265, "grad_norm": 1.140625, "learning_rate": 0.0004627606498118772, "loss": 5.1633, "mean_token_accuracy": 0.19915993213653566, "num_tokens": 44902850.0, "step": 19605 }, { "entropy": 5.6402421474456785, "epoch": 1.9385132463424277, "grad_norm": 1.0546875, "learning_rate": 0.0004627412020025039, "loss": 5.0523, "mean_token_accuracy": 0.21396560370922088, "num_tokens": 44914074.0, "step": 19610 }, { "entropy": 5.657770490646362, "epoch": 1.9390075128509292, "grad_norm": 0.99609375, "learning_rate": 0.00046272174957466783, "loss": 5.111, "mean_token_accuracy": 0.2034018635749817, "num_tokens": 44925665.0, "step": 19615 }, { "entropy": 5.690683078765869, "epoch": 1.9395017793594307, "grad_norm": 1.0625, "learning_rate": 0.0004627022925288476, "loss": 5.1402, "mean_token_accuracy": 0.2084256663918495, "num_tokens": 44936584.0, "step": 19620 }, { "entropy": 5.689779901504517, "epoch": 1.939996045867932, "grad_norm": 1.0859375, "learning_rate": 0.0004626828308655219, "loss": 5.0581, "mean_token_accuracy": 0.21032268702983856, "num_tokens": 44948028.0, "step": 19625 }, { "entropy": 5.620367813110351, "epoch": 1.9404903123764332, "grad_norm": 1.015625, "learning_rate": 0.00046266336458516944, "loss": 4.9903, "mean_token_accuracy": 0.21392030119895936, "num_tokens": 44959504.0, "step": 19630 }, { "entropy": 5.681977415084839, "epoch": 1.940984578884935, "grad_norm": 1.1328125, "learning_rate": 0.0004626438936882691, "loss": 5.1303, "mean_token_accuracy": 0.20370972007513047, "num_tokens": 44971518.0, "step": 19635 }, { "entropy": 5.592975616455078, "epoch": 1.9414788453934362, "grad_norm": 1.015625, "learning_rate": 0.00046262441817529986, "loss": 5.0005, "mean_token_accuracy": 0.2163567438721657, "num_tokens": 44982514.0, "step": 19640 }, { "entropy": 5.598299646377564, "epoch": 1.9419731119019374, "grad_norm": 0.94921875, "learning_rate": 0.0004626049380467408, "loss": 5.0269, "mean_token_accuracy": 0.2141561135649681, "num_tokens": 44995198.0, "step": 19645 }, { "entropy": 5.652569723129273, "epoch": 1.942467378410439, "grad_norm": 0.94921875, "learning_rate": 0.00046258545330307124, "loss": 5.0366, "mean_token_accuracy": 0.21497200280427933, "num_tokens": 45008014.0, "step": 19650 }, { "entropy": 5.633772516250611, "epoch": 1.9429616449189404, "grad_norm": 1.1015625, "learning_rate": 0.00046256596394477037, "loss": 5.1105, "mean_token_accuracy": 0.2109491854906082, "num_tokens": 45021169.0, "step": 19655 }, { "entropy": 5.590013456344605, "epoch": 1.9434559114274417, "grad_norm": 0.9609375, "learning_rate": 0.0004625464699723177, "loss": 4.9939, "mean_token_accuracy": 0.21578521579504012, "num_tokens": 45032703.0, "step": 19660 }, { "entropy": 5.590188074111938, "epoch": 1.943950177935943, "grad_norm": 1.078125, "learning_rate": 0.0004625269713861928, "loss": 5.0571, "mean_token_accuracy": 0.21333108693361283, "num_tokens": 45044350.0, "step": 19665 }, { "entropy": 5.600428915023803, "epoch": 1.9444444444444444, "grad_norm": 0.9609375, "learning_rate": 0.0004625074681868753, "loss": 5.053, "mean_token_accuracy": 0.2162907212972641, "num_tokens": 45055431.0, "step": 19670 }, { "entropy": 5.645396280288696, "epoch": 1.944938710952946, "grad_norm": 1.0703125, "learning_rate": 0.0004624879603748449, "loss": 5.0725, "mean_token_accuracy": 0.21348092555999756, "num_tokens": 45066801.0, "step": 19675 }, { "entropy": 5.636782455444336, "epoch": 1.9454329774614472, "grad_norm": 1.09375, "learning_rate": 0.0004624684479505817, "loss": 5.036, "mean_token_accuracy": 0.21464191675186156, "num_tokens": 45078393.0, "step": 19680 }, { "entropy": 5.66125864982605, "epoch": 1.9459272439699487, "grad_norm": 1.015625, "learning_rate": 0.0004624489309145655, "loss": 5.0881, "mean_token_accuracy": 0.21153341829776764, "num_tokens": 45090782.0, "step": 19685 }, { "entropy": 5.634819984436035, "epoch": 1.9464215104784501, "grad_norm": 1.0, "learning_rate": 0.0004624294092672766, "loss": 5.0527, "mean_token_accuracy": 0.21437938064336776, "num_tokens": 45102079.0, "step": 19690 }, { "entropy": 5.636746740341186, "epoch": 1.9469157769869514, "grad_norm": 1.0859375, "learning_rate": 0.0004624098830091951, "loss": 5.053, "mean_token_accuracy": 0.21874616146087647, "num_tokens": 45112947.0, "step": 19695 }, { "entropy": 5.630488157272339, "epoch": 1.9474100434954527, "grad_norm": 1.09375, "learning_rate": 0.00046239035214080146, "loss": 5.0631, "mean_token_accuracy": 0.21505101025104523, "num_tokens": 45124577.0, "step": 19700 }, { "entropy": 5.643087005615234, "epoch": 1.9479043100039541, "grad_norm": 1.1796875, "learning_rate": 0.0004623708166625761, "loss": 5.0863, "mean_token_accuracy": 0.20349374264478684, "num_tokens": 45135380.0, "step": 19705 }, { "entropy": 5.673106050491333, "epoch": 1.9483985765124556, "grad_norm": 1.0078125, "learning_rate": 0.00046235127657499945, "loss": 5.0665, "mean_token_accuracy": 0.21628130078315735, "num_tokens": 45146926.0, "step": 19710 }, { "entropy": 5.622417163848877, "epoch": 1.9488928430209569, "grad_norm": 1.015625, "learning_rate": 0.0004623317318785524, "loss": 5.0941, "mean_token_accuracy": 0.21177101731300355, "num_tokens": 45157662.0, "step": 19715 }, { "entropy": 5.560421514511108, "epoch": 1.9493871095294582, "grad_norm": 1.0859375, "learning_rate": 0.0004623121825737158, "loss": 4.9766, "mean_token_accuracy": 0.22680039703845978, "num_tokens": 45170239.0, "step": 19720 }, { "entropy": 5.642932748794555, "epoch": 1.9498813760379596, "grad_norm": 1.1640625, "learning_rate": 0.00046229262866097034, "loss": 5.0486, "mean_token_accuracy": 0.20475969314575196, "num_tokens": 45180979.0, "step": 19725 }, { "entropy": 5.616998291015625, "epoch": 1.9503756425464611, "grad_norm": 1.09375, "learning_rate": 0.0004622730701407971, "loss": 5.047, "mean_token_accuracy": 0.21303715705871581, "num_tokens": 45191160.0, "step": 19730 }, { "entropy": 5.659266614913941, "epoch": 1.9508699090549624, "grad_norm": 1.0, "learning_rate": 0.0004622535070136774, "loss": 5.0578, "mean_token_accuracy": 0.21700719445943834, "num_tokens": 45202865.0, "step": 19735 }, { "entropy": 5.681478881835938, "epoch": 1.9513641755634639, "grad_norm": 1.078125, "learning_rate": 0.00046223393928009233, "loss": 5.0621, "mean_token_accuracy": 0.20864974409341813, "num_tokens": 45214831.0, "step": 19740 }, { "entropy": 5.685804605484009, "epoch": 1.9518584420719653, "grad_norm": 1.1015625, "learning_rate": 0.00046221436694052334, "loss": 5.1596, "mean_token_accuracy": 0.2103135332465172, "num_tokens": 45226453.0, "step": 19745 }, { "entropy": 5.695609045028687, "epoch": 1.9523527085804666, "grad_norm": 1.0859375, "learning_rate": 0.00046219478999545184, "loss": 5.1275, "mean_token_accuracy": 0.21082912385463715, "num_tokens": 45237292.0, "step": 19750 }, { "entropy": 5.586497354507446, "epoch": 1.9528469750889679, "grad_norm": 1.015625, "learning_rate": 0.0004621752084453595, "loss": 4.9661, "mean_token_accuracy": 0.22651247531175614, "num_tokens": 45248117.0, "step": 19755 }, { "entropy": 5.609783554077149, "epoch": 1.9533412415974694, "grad_norm": 1.1484375, "learning_rate": 0.00046215562229072796, "loss": 5.0793, "mean_token_accuracy": 0.20511331111192704, "num_tokens": 45259120.0, "step": 19760 }, { "entropy": 5.637257862091064, "epoch": 1.9538355081059708, "grad_norm": 1.09375, "learning_rate": 0.00046213603153203906, "loss": 5.0063, "mean_token_accuracy": 0.2173925131559372, "num_tokens": 45269554.0, "step": 19765 }, { "entropy": 5.674184417724609, "epoch": 1.954329774614472, "grad_norm": 0.9296875, "learning_rate": 0.0004621164361697748, "loss": 5.0576, "mean_token_accuracy": 0.20595995038747789, "num_tokens": 45281055.0, "step": 19770 }, { "entropy": 5.617925024032592, "epoch": 1.9548240411229734, "grad_norm": 1.0546875, "learning_rate": 0.0004620968362044172, "loss": 5.0025, "mean_token_accuracy": 0.22530256807804108, "num_tokens": 45292430.0, "step": 19775 }, { "entropy": 5.599982643127442, "epoch": 1.9553183076314749, "grad_norm": 0.96484375, "learning_rate": 0.0004620772316364483, "loss": 4.9842, "mean_token_accuracy": 0.21350289434194564, "num_tokens": 45303417.0, "step": 19780 }, { "entropy": 5.662557792663574, "epoch": 1.9558125741399763, "grad_norm": 1.109375, "learning_rate": 0.0004620576224663506, "loss": 5.1293, "mean_token_accuracy": 0.20135805308818816, "num_tokens": 45315243.0, "step": 19785 }, { "entropy": 5.627854681015014, "epoch": 1.9563068406484776, "grad_norm": 1.0, "learning_rate": 0.0004620380086946063, "loss": 5.0537, "mean_token_accuracy": 0.21316584199666977, "num_tokens": 45326746.0, "step": 19790 }, { "entropy": 5.663054180145264, "epoch": 1.956801107156979, "grad_norm": 1.1015625, "learning_rate": 0.00046201839032169794, "loss": 5.0045, "mean_token_accuracy": 0.21379880905151366, "num_tokens": 45338199.0, "step": 19795 }, { "entropy": 5.6456685066223145, "epoch": 1.9572953736654806, "grad_norm": 0.97265625, "learning_rate": 0.0004619987673481082, "loss": 5.0354, "mean_token_accuracy": 0.2155898094177246, "num_tokens": 45349470.0, "step": 19800 }, { "entropy": 5.64262638092041, "epoch": 1.9577896401739818, "grad_norm": 1.1484375, "learning_rate": 0.00046197913977431983, "loss": 5.0859, "mean_token_accuracy": 0.2104426458477974, "num_tokens": 45359735.0, "step": 19805 }, { "entropy": 5.756972694396973, "epoch": 1.958283906682483, "grad_norm": 0.89453125, "learning_rate": 0.00046195950760081556, "loss": 5.2217, "mean_token_accuracy": 0.20072976350784302, "num_tokens": 45372960.0, "step": 19810 }, { "entropy": 5.693241834640503, "epoch": 1.9587781731909846, "grad_norm": 1.0, "learning_rate": 0.0004619398708280784, "loss": 5.1388, "mean_token_accuracy": 0.209391288459301, "num_tokens": 45385174.0, "step": 19815 }, { "entropy": 5.636270332336426, "epoch": 1.959272439699486, "grad_norm": 1.0703125, "learning_rate": 0.0004619202294565914, "loss": 5.0245, "mean_token_accuracy": 0.21848459243774415, "num_tokens": 45397013.0, "step": 19820 }, { "entropy": 5.745599222183228, "epoch": 1.9597667062079873, "grad_norm": 1.0546875, "learning_rate": 0.0004619005834868378, "loss": 5.2288, "mean_token_accuracy": 0.19671631157398223, "num_tokens": 45408863.0, "step": 19825 }, { "entropy": 5.6486900806427, "epoch": 1.9602609727164886, "grad_norm": 0.953125, "learning_rate": 0.0004618809329193008, "loss": 5.0693, "mean_token_accuracy": 0.21577177047729493, "num_tokens": 45420630.0, "step": 19830 }, { "entropy": 5.675883483886719, "epoch": 1.96075523922499, "grad_norm": 1.046875, "learning_rate": 0.0004618612777544639, "loss": 5.0515, "mean_token_accuracy": 0.21159921139478682, "num_tokens": 45431427.0, "step": 19835 }, { "entropy": 5.674523496627808, "epoch": 1.9612495057334915, "grad_norm": 0.9375, "learning_rate": 0.00046184161799281057, "loss": 4.9858, "mean_token_accuracy": 0.2158378392457962, "num_tokens": 45442649.0, "step": 19840 }, { "entropy": 5.5958747386932375, "epoch": 1.9617437722419928, "grad_norm": 1.0078125, "learning_rate": 0.00046182195363482444, "loss": 5.0497, "mean_token_accuracy": 0.2159850850701332, "num_tokens": 45454032.0, "step": 19845 }, { "entropy": 5.614143180847168, "epoch": 1.9622380387504943, "grad_norm": 0.96484375, "learning_rate": 0.00046180228468098927, "loss": 5.0909, "mean_token_accuracy": 0.20565929114818574, "num_tokens": 45464706.0, "step": 19850 }, { "entropy": 5.748627090454102, "epoch": 1.9627323052589958, "grad_norm": 1.1875, "learning_rate": 0.00046178261113178894, "loss": 5.1685, "mean_token_accuracy": 0.20039901584386827, "num_tokens": 45476292.0, "step": 19855 }, { "entropy": 5.61480131149292, "epoch": 1.963226571767497, "grad_norm": 0.9921875, "learning_rate": 0.0004617629329877074, "loss": 5.0138, "mean_token_accuracy": 0.21934296935796738, "num_tokens": 45488189.0, "step": 19860 }, { "entropy": 5.6691196918487545, "epoch": 1.9637208382759983, "grad_norm": 1.0625, "learning_rate": 0.0004617432502492287, "loss": 5.0495, "mean_token_accuracy": 0.21171228140592574, "num_tokens": 45499825.0, "step": 19865 }, { "entropy": 5.59667706489563, "epoch": 1.9642151047844998, "grad_norm": 0.984375, "learning_rate": 0.0004617235629168371, "loss": 5.0212, "mean_token_accuracy": 0.21345296651124954, "num_tokens": 45511164.0, "step": 19870 }, { "entropy": 5.659011507034302, "epoch": 1.9647093712930013, "grad_norm": 1.0625, "learning_rate": 0.0004617038709910168, "loss": 5.1615, "mean_token_accuracy": 0.2081812560558319, "num_tokens": 45521506.0, "step": 19875 }, { "entropy": 5.760163354873657, "epoch": 1.9652036378015025, "grad_norm": 1.1328125, "learning_rate": 0.0004616841744722524, "loss": 5.1556, "mean_token_accuracy": 0.20054230093955994, "num_tokens": 45531622.0, "step": 19880 }, { "entropy": 5.6677052021026615, "epoch": 1.9656979043100038, "grad_norm": 1.1484375, "learning_rate": 0.00046166447336102836, "loss": 5.0128, "mean_token_accuracy": 0.2161006897687912, "num_tokens": 45541565.0, "step": 19885 }, { "entropy": 5.638385963439942, "epoch": 1.9661921708185055, "grad_norm": 1.0, "learning_rate": 0.00046164476765782927, "loss": 5.0455, "mean_token_accuracy": 0.21054738610982895, "num_tokens": 45552943.0, "step": 19890 }, { "entropy": 5.655066108703613, "epoch": 1.9666864373270068, "grad_norm": 1.1484375, "learning_rate": 0.00046162505736313997, "loss": 5.0946, "mean_token_accuracy": 0.21339854896068572, "num_tokens": 45563914.0, "step": 19895 }, { "entropy": 5.593796920776367, "epoch": 1.967180703835508, "grad_norm": 1.078125, "learning_rate": 0.0004616053424774453, "loss": 4.9931, "mean_token_accuracy": 0.2180483341217041, "num_tokens": 45575730.0, "step": 19900 }, { "entropy": 5.702932643890381, "epoch": 1.9676749703440095, "grad_norm": 1.03125, "learning_rate": 0.00046158562300123023, "loss": 5.131, "mean_token_accuracy": 0.2032240465283394, "num_tokens": 45588369.0, "step": 19905 }, { "entropy": 5.621916580200195, "epoch": 1.968169236852511, "grad_norm": 1.0234375, "learning_rate": 0.00046156589893498, "loss": 4.9877, "mean_token_accuracy": 0.2164256528019905, "num_tokens": 45599235.0, "step": 19910 }, { "entropy": 5.634720993041992, "epoch": 1.9686635033610123, "grad_norm": 1.0625, "learning_rate": 0.00046154617027917955, "loss": 4.9884, "mean_token_accuracy": 0.22146720737218856, "num_tokens": 45610066.0, "step": 19915 }, { "entropy": 5.623582458496093, "epoch": 1.9691577698695135, "grad_norm": 1.0703125, "learning_rate": 0.00046152643703431447, "loss": 5.0365, "mean_token_accuracy": 0.20701096653938295, "num_tokens": 45621543.0, "step": 19920 }, { "entropy": 5.632377862930298, "epoch": 1.969652036378015, "grad_norm": 0.96484375, "learning_rate": 0.00046150669920087004, "loss": 5.1436, "mean_token_accuracy": 0.20344154983758928, "num_tokens": 45634984.0, "step": 19925 }, { "entropy": 5.685289430618286, "epoch": 1.9701463028865165, "grad_norm": 1.1484375, "learning_rate": 0.0004614869567793319, "loss": 5.0738, "mean_token_accuracy": 0.21167764365673064, "num_tokens": 45646778.0, "step": 19930 }, { "entropy": 5.6773916721344, "epoch": 1.9706405693950177, "grad_norm": 1.078125, "learning_rate": 0.00046146720977018567, "loss": 5.0441, "mean_token_accuracy": 0.2141490876674652, "num_tokens": 45658103.0, "step": 19935 }, { "entropy": 5.664430761337281, "epoch": 1.971134835903519, "grad_norm": 1.1484375, "learning_rate": 0.0004614474581739172, "loss": 5.0068, "mean_token_accuracy": 0.2116147294640541, "num_tokens": 45669166.0, "step": 19940 }, { "entropy": 5.608189487457276, "epoch": 1.9716291024120207, "grad_norm": 1.109375, "learning_rate": 0.0004614277019910123, "loss": 5.0714, "mean_token_accuracy": 0.20600481033325196, "num_tokens": 45680667.0, "step": 19945 }, { "entropy": 5.644654846191406, "epoch": 1.972123368920522, "grad_norm": 0.99609375, "learning_rate": 0.0004614079412219571, "loss": 5.1628, "mean_token_accuracy": 0.20308499932289123, "num_tokens": 45692347.0, "step": 19950 }, { "entropy": 5.737478590011596, "epoch": 1.9726176354290232, "grad_norm": 1.1328125, "learning_rate": 0.0004613881758672375, "loss": 5.118, "mean_token_accuracy": 0.2115105554461479, "num_tokens": 45703972.0, "step": 19955 }, { "entropy": 5.646668434143066, "epoch": 1.9731119019375247, "grad_norm": 1.0234375, "learning_rate": 0.00046136840592733995, "loss": 5.0322, "mean_token_accuracy": 0.21002266108989714, "num_tokens": 45715446.0, "step": 19960 }, { "entropy": 5.618658447265625, "epoch": 1.9736061684460262, "grad_norm": 1.0078125, "learning_rate": 0.00046134863140275066, "loss": 5.0289, "mean_token_accuracy": 0.22375083416700364, "num_tokens": 45727210.0, "step": 19965 }, { "entropy": 5.682565021514892, "epoch": 1.9741004349545275, "grad_norm": 1.0859375, "learning_rate": 0.00046132885229395606, "loss": 5.0732, "mean_token_accuracy": 0.20701718032360078, "num_tokens": 45738235.0, "step": 19970 }, { "entropy": 5.640673542022705, "epoch": 1.9745947014630287, "grad_norm": 0.9921875, "learning_rate": 0.0004613090686014429, "loss": 5.0579, "mean_token_accuracy": 0.21696689128875732, "num_tokens": 45750743.0, "step": 19975 }, { "entropy": 5.656289052963257, "epoch": 1.9750889679715302, "grad_norm": 0.98828125, "learning_rate": 0.00046128928032569775, "loss": 5.0949, "mean_token_accuracy": 0.20688619017601012, "num_tokens": 45761989.0, "step": 19980 }, { "entropy": 5.643511152267456, "epoch": 1.9755832344800317, "grad_norm": 1.0078125, "learning_rate": 0.0004612694874672073, "loss": 5.1266, "mean_token_accuracy": 0.2083459883928299, "num_tokens": 45775046.0, "step": 19985 }, { "entropy": 5.769370746612549, "epoch": 1.976077500988533, "grad_norm": 1.1015625, "learning_rate": 0.0004612496900264586, "loss": 5.165, "mean_token_accuracy": 0.20447853058576584, "num_tokens": 45786776.0, "step": 19990 }, { "entropy": 5.661684799194336, "epoch": 1.9765717674970344, "grad_norm": 1.0625, "learning_rate": 0.0004612298880039387, "loss": 5.0469, "mean_token_accuracy": 0.21397929340600969, "num_tokens": 45797675.0, "step": 19995 }, { "entropy": 5.64075493812561, "epoch": 1.977066034005536, "grad_norm": 1.0625, "learning_rate": 0.0004612100814001346, "loss": 5.0934, "mean_token_accuracy": 0.20576183795928954, "num_tokens": 45809897.0, "step": 20000 }, { "entropy": 5.69155445098877, "epoch": 1.9775603005140372, "grad_norm": 0.9765625, "learning_rate": 0.0004611902702155336, "loss": 5.1871, "mean_token_accuracy": 0.20376973748207092, "num_tokens": 45822330.0, "step": 20005 }, { "entropy": 5.659553003311157, "epoch": 1.9780545670225385, "grad_norm": 1.0078125, "learning_rate": 0.0004611704544506232, "loss": 5.0486, "mean_token_accuracy": 0.21087287068367006, "num_tokens": 45834705.0, "step": 20010 }, { "entropy": 5.696013879776001, "epoch": 1.97854883353104, "grad_norm": 0.93359375, "learning_rate": 0.0004611506341058906, "loss": 5.1085, "mean_token_accuracy": 0.2015373632311821, "num_tokens": 45846646.0, "step": 20015 }, { "entropy": 5.622548389434814, "epoch": 1.9790431000395414, "grad_norm": 1.1875, "learning_rate": 0.00046113080918182346, "loss": 5.0281, "mean_token_accuracy": 0.21788929402828217, "num_tokens": 45857252.0, "step": 20020 }, { "entropy": 5.601723146438599, "epoch": 1.9795373665480427, "grad_norm": 1.0625, "learning_rate": 0.00046111097967890975, "loss": 4.9932, "mean_token_accuracy": 0.21892698407173156, "num_tokens": 45867780.0, "step": 20025 }, { "entropy": 5.700494718551636, "epoch": 1.980031633056544, "grad_norm": 1.1171875, "learning_rate": 0.0004610911455976369, "loss": 5.1092, "mean_token_accuracy": 0.2014131486415863, "num_tokens": 45878998.0, "step": 20030 }, { "entropy": 5.64445652961731, "epoch": 1.9805258995650454, "grad_norm": 1.078125, "learning_rate": 0.00046107130693849303, "loss": 4.9559, "mean_token_accuracy": 0.21489724665880203, "num_tokens": 45889685.0, "step": 20035 }, { "entropy": 5.665057563781739, "epoch": 1.981020166073547, "grad_norm": 1.03125, "learning_rate": 0.0004610514637019662, "loss": 5.0838, "mean_token_accuracy": 0.21509398072957991, "num_tokens": 45900887.0, "step": 20040 }, { "entropy": 5.604751920700073, "epoch": 1.9815144325820482, "grad_norm": 1.0234375, "learning_rate": 0.0004610316158885444, "loss": 5.1239, "mean_token_accuracy": 0.2075942263007164, "num_tokens": 45913860.0, "step": 20045 }, { "entropy": 5.619090414047241, "epoch": 1.9820086990905497, "grad_norm": 1.0546875, "learning_rate": 0.0004610117634987161, "loss": 5.0535, "mean_token_accuracy": 0.20656904131174086, "num_tokens": 45924669.0, "step": 20050 }, { "entropy": 5.632274770736695, "epoch": 1.9825029655990511, "grad_norm": 0.984375, "learning_rate": 0.00046099190653296946, "loss": 5.0144, "mean_token_accuracy": 0.210272179543972, "num_tokens": 45937013.0, "step": 20055 }, { "entropy": 5.614424514770508, "epoch": 1.9829972321075524, "grad_norm": 0.9765625, "learning_rate": 0.0004609720449917932, "loss": 5.0158, "mean_token_accuracy": 0.21152610331773758, "num_tokens": 45950063.0, "step": 20060 }, { "entropy": 5.629835033416748, "epoch": 1.9834914986160537, "grad_norm": 1.0859375, "learning_rate": 0.00046095217887567565, "loss": 5.1004, "mean_token_accuracy": 0.21203971654176712, "num_tokens": 45962136.0, "step": 20065 }, { "entropy": 5.632299423217773, "epoch": 1.9839857651245552, "grad_norm": 1.015625, "learning_rate": 0.0004609323081851057, "loss": 4.9972, "mean_token_accuracy": 0.2113666668534279, "num_tokens": 45974712.0, "step": 20070 }, { "entropy": 5.646907615661621, "epoch": 1.9844800316330566, "grad_norm": 1.09375, "learning_rate": 0.0004609124329205721, "loss": 5.0828, "mean_token_accuracy": 0.2101914644241333, "num_tokens": 45985670.0, "step": 20075 }, { "entropy": 5.719666147232056, "epoch": 1.984974298141558, "grad_norm": 0.9921875, "learning_rate": 0.0004608925530825638, "loss": 5.1565, "mean_token_accuracy": 0.19922163039445878, "num_tokens": 45997215.0, "step": 20080 }, { "entropy": 5.62402925491333, "epoch": 1.9854685646500592, "grad_norm": 0.97265625, "learning_rate": 0.00046087266867156997, "loss": 5.0513, "mean_token_accuracy": 0.2119896560907364, "num_tokens": 46008479.0, "step": 20085 }, { "entropy": 5.672734308242798, "epoch": 1.9859628311585606, "grad_norm": 1.1015625, "learning_rate": 0.00046085277968807955, "loss": 5.0141, "mean_token_accuracy": 0.21189976930618287, "num_tokens": 46019504.0, "step": 20090 }, { "entropy": 5.6645325183868405, "epoch": 1.9864570976670621, "grad_norm": 1.046875, "learning_rate": 0.0004608328861325819, "loss": 5.0826, "mean_token_accuracy": 0.2082110673189163, "num_tokens": 46030218.0, "step": 20095 }, { "entropy": 5.643821954727173, "epoch": 1.9869513641755634, "grad_norm": 1.0625, "learning_rate": 0.0004608129880055665, "loss": 5.0941, "mean_token_accuracy": 0.2109190732240677, "num_tokens": 46041767.0, "step": 20100 }, { "entropy": 5.632380533218384, "epoch": 1.9874456306840649, "grad_norm": 1.0546875, "learning_rate": 0.00046079308530752274, "loss": 4.9575, "mean_token_accuracy": 0.221436807513237, "num_tokens": 46052792.0, "step": 20105 }, { "entropy": 5.727615213394165, "epoch": 1.9879398971925664, "grad_norm": 1.0390625, "learning_rate": 0.00046077317803894024, "loss": 5.1397, "mean_token_accuracy": 0.2075278341770172, "num_tokens": 46064609.0, "step": 20110 }, { "entropy": 5.618786478042603, "epoch": 1.9884341637010676, "grad_norm": 1.1171875, "learning_rate": 0.00046075326620030876, "loss": 5.0044, "mean_token_accuracy": 0.21593587398529052, "num_tokens": 46075624.0, "step": 20115 }, { "entropy": 5.668800640106201, "epoch": 1.9889284302095689, "grad_norm": 1.0703125, "learning_rate": 0.00046073334979211813, "loss": 5.0368, "mean_token_accuracy": 0.21365345269441605, "num_tokens": 46086455.0, "step": 20120 }, { "entropy": 5.726225996017456, "epoch": 1.9894226967180704, "grad_norm": 1.1484375, "learning_rate": 0.0004607134288148582, "loss": 5.1322, "mean_token_accuracy": 0.20751650780439376, "num_tokens": 46097362.0, "step": 20125 }, { "entropy": 5.5885638236999515, "epoch": 1.9899169632265719, "grad_norm": 0.9921875, "learning_rate": 0.00046069350326901915, "loss": 5.0081, "mean_token_accuracy": 0.22063725739717482, "num_tokens": 46107811.0, "step": 20130 }, { "entropy": 5.685397005081176, "epoch": 1.9904112297350731, "grad_norm": 1.0546875, "learning_rate": 0.0004606735731550912, "loss": 5.2272, "mean_token_accuracy": 0.19762394726276397, "num_tokens": 46120178.0, "step": 20135 }, { "entropy": 5.706793308258057, "epoch": 1.9909054962435744, "grad_norm": 1.0390625, "learning_rate": 0.00046065363847356443, "loss": 5.1353, "mean_token_accuracy": 0.2035257488489151, "num_tokens": 46131416.0, "step": 20140 }, { "entropy": 5.6986198902130125, "epoch": 1.991399762752076, "grad_norm": 1.1015625, "learning_rate": 0.00046063369922492943, "loss": 5.0651, "mean_token_accuracy": 0.21629051864147186, "num_tokens": 46142195.0, "step": 20145 }, { "entropy": 5.6435435771942135, "epoch": 1.9918940292605773, "grad_norm": 1.0078125, "learning_rate": 0.0004606137554096766, "loss": 5.1112, "mean_token_accuracy": 0.2057777538895607, "num_tokens": 46154537.0, "step": 20150 }, { "entropy": 5.678513622283935, "epoch": 1.9923882957690786, "grad_norm": 1.1015625, "learning_rate": 0.0004605938070282965, "loss": 5.0447, "mean_token_accuracy": 0.21020959913730622, "num_tokens": 46166711.0, "step": 20155 }, { "entropy": 5.612281322479248, "epoch": 1.99288256227758, "grad_norm": 1.0625, "learning_rate": 0.00046057385408128013, "loss": 5.02, "mean_token_accuracy": 0.2154894143342972, "num_tokens": 46178509.0, "step": 20160 }, { "entropy": 5.6511413097381595, "epoch": 1.9933768287860816, "grad_norm": 1.2109375, "learning_rate": 0.000460553896569118, "loss": 5.0576, "mean_token_accuracy": 0.21157811284065248, "num_tokens": 46188413.0, "step": 20165 }, { "entropy": 5.61622052192688, "epoch": 1.9938710952945828, "grad_norm": 1.078125, "learning_rate": 0.0004605339344923014, "loss": 5.0574, "mean_token_accuracy": 0.20834371596574783, "num_tokens": 46199708.0, "step": 20170 }, { "entropy": 5.601320886611939, "epoch": 1.994365361803084, "grad_norm": 1.015625, "learning_rate": 0.00046051396785132113, "loss": 5.0556, "mean_token_accuracy": 0.2138458713889122, "num_tokens": 46210670.0, "step": 20175 }, { "entropy": 5.634617328643799, "epoch": 1.9948596283115856, "grad_norm": 1.0859375, "learning_rate": 0.0004604939966466684, "loss": 5.0439, "mean_token_accuracy": 0.21017215102910997, "num_tokens": 46220935.0, "step": 20180 }, { "entropy": 5.6477782249450685, "epoch": 1.995353894820087, "grad_norm": 1.1171875, "learning_rate": 0.0004604740208788347, "loss": 5.0696, "mean_token_accuracy": 0.21563940942287446, "num_tokens": 46232651.0, "step": 20185 }, { "entropy": 5.700435066223145, "epoch": 1.9958481613285883, "grad_norm": 1.0078125, "learning_rate": 0.00046045404054831124, "loss": 5.0523, "mean_token_accuracy": 0.21273343712091447, "num_tokens": 46244308.0, "step": 20190 }, { "entropy": 5.747445106506348, "epoch": 1.9963424278370896, "grad_norm": 1.125, "learning_rate": 0.00046043405565558964, "loss": 5.1385, "mean_token_accuracy": 0.20388862639665603, "num_tokens": 46256941.0, "step": 20195 }, { "entropy": 5.627086973190307, "epoch": 1.9968366943455913, "grad_norm": 0.98046875, "learning_rate": 0.00046041406620116144, "loss": 5.1032, "mean_token_accuracy": 0.20514196753501893, "num_tokens": 46270557.0, "step": 20200 }, { "entropy": 5.703560829162598, "epoch": 1.9973309608540926, "grad_norm": 1.1953125, "learning_rate": 0.0004603940721855185, "loss": 5.0329, "mean_token_accuracy": 0.21716886162757873, "num_tokens": 46280940.0, "step": 20205 }, { "entropy": 5.663601207733154, "epoch": 1.9978252273625938, "grad_norm": 0.9765625, "learning_rate": 0.0004603740736091527, "loss": 5.1149, "mean_token_accuracy": 0.21009413599967958, "num_tokens": 46292358.0, "step": 20210 }, { "entropy": 5.689227771759033, "epoch": 1.9983194938710953, "grad_norm": 1.140625, "learning_rate": 0.0004603540704725558, "loss": 5.1454, "mean_token_accuracy": 0.21229636371135713, "num_tokens": 46303210.0, "step": 20215 }, { "entropy": 5.60545244216919, "epoch": 1.9988137603795968, "grad_norm": 1.0859375, "learning_rate": 0.0004603340627762201, "loss": 5.0333, "mean_token_accuracy": 0.21676837056875228, "num_tokens": 46315152.0, "step": 20220 }, { "entropy": 5.604914760589599, "epoch": 1.999308026888098, "grad_norm": 1.09375, "learning_rate": 0.00046031405052063756, "loss": 5.057, "mean_token_accuracy": 0.21999042332172394, "num_tokens": 46325776.0, "step": 20225 }, { "entropy": 5.634657287597657, "epoch": 1.9998022933965993, "grad_norm": 1.0625, "learning_rate": 0.00046029403370630086, "loss": 5.0231, "mean_token_accuracy": 0.22021838426589965, "num_tokens": 46336797.0, "step": 20230 }, { "entropy": 5.699384927749634, "epoch": 2.000296559905101, "grad_norm": 1.078125, "learning_rate": 0.00046027401233370203, "loss": 5.0505, "mean_token_accuracy": 0.21551384627819062, "num_tokens": 46346327.0, "step": 20235 }, { "entropy": 5.596620702743531, "epoch": 2.0007908264136023, "grad_norm": 0.99609375, "learning_rate": 0.00046025398640333373, "loss": 4.988, "mean_token_accuracy": 0.21683791279792786, "num_tokens": 46358056.0, "step": 20240 }, { "entropy": 5.568304967880249, "epoch": 2.0012850929221035, "grad_norm": 1.1171875, "learning_rate": 0.00046023395591568867, "loss": 4.9518, "mean_token_accuracy": 0.22018545418977736, "num_tokens": 46369792.0, "step": 20245 }, { "entropy": 5.645362663269043, "epoch": 2.001779359430605, "grad_norm": 0.99609375, "learning_rate": 0.00046021392087125957, "loss": 5.0461, "mean_token_accuracy": 0.21741883009672164, "num_tokens": 46381224.0, "step": 20250 }, { "entropy": 5.680661964416504, "epoch": 2.0022736259391065, "grad_norm": 0.9921875, "learning_rate": 0.0004601938812705393, "loss": 5.0379, "mean_token_accuracy": 0.2088194742798805, "num_tokens": 46393788.0, "step": 20255 }, { "entropy": 5.62198543548584, "epoch": 2.002767892447608, "grad_norm": 1.0390625, "learning_rate": 0.00046017383711402076, "loss": 4.9688, "mean_token_accuracy": 0.21495085060596467, "num_tokens": 46405742.0, "step": 20260 }, { "entropy": 5.665770864486694, "epoch": 2.003262158956109, "grad_norm": 1.2421875, "learning_rate": 0.0004601537884021972, "loss": 5.0382, "mean_token_accuracy": 0.2151986062526703, "num_tokens": 46417276.0, "step": 20265 }, { "entropy": 5.580656051635742, "epoch": 2.0037564254646103, "grad_norm": 1.1328125, "learning_rate": 0.0004601337351355617, "loss": 4.947, "mean_token_accuracy": 0.22402484118938445, "num_tokens": 46427950.0, "step": 20270 }, { "entropy": 5.593945693969727, "epoch": 2.004250691973112, "grad_norm": 1.09375, "learning_rate": 0.0004601136773146075, "loss": 5.0016, "mean_token_accuracy": 0.22060485631227494, "num_tokens": 46439200.0, "step": 20275 }, { "entropy": 5.703352069854736, "epoch": 2.0047449584816133, "grad_norm": 1.1796875, "learning_rate": 0.0004600936149398282, "loss": 5.0881, "mean_token_accuracy": 0.2098420187830925, "num_tokens": 46451176.0, "step": 20280 }, { "entropy": 5.656522274017334, "epoch": 2.0052392249901145, "grad_norm": 1.1015625, "learning_rate": 0.00046007354801171725, "loss": 5.0059, "mean_token_accuracy": 0.21866737604141234, "num_tokens": 46462798.0, "step": 20285 }, { "entropy": 5.660011053085327, "epoch": 2.0057334914986162, "grad_norm": 1.0625, "learning_rate": 0.0004600534765307682, "loss": 5.0205, "mean_token_accuracy": 0.21425664573907852, "num_tokens": 46473914.0, "step": 20290 }, { "entropy": 5.688671207427978, "epoch": 2.0062277580071175, "grad_norm": 1.03125, "learning_rate": 0.00046003340049747513, "loss": 5.0714, "mean_token_accuracy": 0.21550834476947783, "num_tokens": 46485089.0, "step": 20295 }, { "entropy": 5.629818105697632, "epoch": 2.0067220245156188, "grad_norm": 1.046875, "learning_rate": 0.0004600133199123316, "loss": 4.9906, "mean_token_accuracy": 0.2175535023212433, "num_tokens": 46497115.0, "step": 20300 }, { "entropy": 5.536961889266967, "epoch": 2.00721629102412, "grad_norm": 1.0390625, "learning_rate": 0.0004599932347758316, "loss": 4.891, "mean_token_accuracy": 0.22936010956764222, "num_tokens": 46508845.0, "step": 20305 }, { "entropy": 5.563985061645508, "epoch": 2.0077105575326217, "grad_norm": 1.0390625, "learning_rate": 0.0004599731450884694, "loss": 4.9214, "mean_token_accuracy": 0.22077784240245818, "num_tokens": 46520105.0, "step": 20310 }, { "entropy": 5.602231836318969, "epoch": 2.008204824041123, "grad_norm": 1.1796875, "learning_rate": 0.0004599530508507392, "loss": 4.9491, "mean_token_accuracy": 0.21800347715616225, "num_tokens": 46530701.0, "step": 20315 }, { "entropy": 5.62209997177124, "epoch": 2.0086990905496243, "grad_norm": 1.09375, "learning_rate": 0.0004599329520631351, "loss": 5.0134, "mean_token_accuracy": 0.21472022235393523, "num_tokens": 46542614.0, "step": 20320 }, { "entropy": 5.627220726013183, "epoch": 2.009193357058126, "grad_norm": 1.0703125, "learning_rate": 0.00045991284872615184, "loss": 4.9742, "mean_token_accuracy": 0.219235622882843, "num_tokens": 46553624.0, "step": 20325 }, { "entropy": 5.643541049957276, "epoch": 2.0096876235666272, "grad_norm": 1.0546875, "learning_rate": 0.00045989274084028375, "loss": 4.975, "mean_token_accuracy": 0.21747968792915345, "num_tokens": 46565599.0, "step": 20330 }, { "entropy": 5.62085108757019, "epoch": 2.0101818900751285, "grad_norm": 1.1328125, "learning_rate": 0.0004598726284060256, "loss": 4.9749, "mean_token_accuracy": 0.22432747930288316, "num_tokens": 46576730.0, "step": 20335 }, { "entropy": 5.637841987609863, "epoch": 2.0106761565836297, "grad_norm": 1.09375, "learning_rate": 0.000459852511423872, "loss": 5.0155, "mean_token_accuracy": 0.21111986488103868, "num_tokens": 46587435.0, "step": 20340 }, { "entropy": 5.570493555068969, "epoch": 2.0111704230921315, "grad_norm": 1.1640625, "learning_rate": 0.0004598323898943181, "loss": 4.8993, "mean_token_accuracy": 0.22364605963230133, "num_tokens": 46598431.0, "step": 20345 }, { "entropy": 5.654057312011719, "epoch": 2.0116646896006327, "grad_norm": 0.98828125, "learning_rate": 0.0004598122638178586, "loss": 5.0427, "mean_token_accuracy": 0.20871387273073197, "num_tokens": 46609343.0, "step": 20350 }, { "entropy": 5.709128141403198, "epoch": 2.012158956109134, "grad_norm": 1.171875, "learning_rate": 0.00045979213319498883, "loss": 5.0351, "mean_token_accuracy": 0.2146537646651268, "num_tokens": 46621844.0, "step": 20355 }, { "entropy": 5.621915864944458, "epoch": 2.0126532226176352, "grad_norm": 1.0703125, "learning_rate": 0.0004597719980262039, "loss": 4.9697, "mean_token_accuracy": 0.21887328177690507, "num_tokens": 46633278.0, "step": 20360 }, { "entropy": 5.605149030685425, "epoch": 2.013147489126137, "grad_norm": 1.109375, "learning_rate": 0.0004597518583119991, "loss": 5.0055, "mean_token_accuracy": 0.21184675097465516, "num_tokens": 46644375.0, "step": 20365 }, { "entropy": 5.693785285949707, "epoch": 2.013641755634638, "grad_norm": 0.97265625, "learning_rate": 0.0004597317140528699, "loss": 5.0539, "mean_token_accuracy": 0.21174909323453903, "num_tokens": 46655631.0, "step": 20370 }, { "entropy": 5.594194126129151, "epoch": 2.0141360221431395, "grad_norm": 1.0390625, "learning_rate": 0.00045971156524931195, "loss": 4.9319, "mean_token_accuracy": 0.228285776078701, "num_tokens": 46667095.0, "step": 20375 }, { "entropy": 5.6594164848327635, "epoch": 2.014630288651641, "grad_norm": 1.0625, "learning_rate": 0.0004596914119018209, "loss": 5.0134, "mean_token_accuracy": 0.21311117559671403, "num_tokens": 46678524.0, "step": 20380 }, { "entropy": 5.639763259887696, "epoch": 2.0151245551601424, "grad_norm": 1.1875, "learning_rate": 0.00045967125401089233, "loss": 4.9837, "mean_token_accuracy": 0.21402385830879211, "num_tokens": 46689785.0, "step": 20385 }, { "entropy": 5.638075733184815, "epoch": 2.0156188216686437, "grad_norm": 1.03125, "learning_rate": 0.0004596510915770223, "loss": 5.0017, "mean_token_accuracy": 0.21592282503843307, "num_tokens": 46701109.0, "step": 20390 }, { "entropy": 5.620486879348755, "epoch": 2.016113088177145, "grad_norm": 1.140625, "learning_rate": 0.0004596309246007068, "loss": 4.9633, "mean_token_accuracy": 0.22211750149726867, "num_tokens": 46711381.0, "step": 20395 }, { "entropy": 5.709034061431884, "epoch": 2.0166073546856467, "grad_norm": 1.078125, "learning_rate": 0.0004596107530824419, "loss": 5.0345, "mean_token_accuracy": 0.22004642933607102, "num_tokens": 46722237.0, "step": 20400 }, { "entropy": 5.601764917373657, "epoch": 2.017101621194148, "grad_norm": 0.97265625, "learning_rate": 0.00045959057702272383, "loss": 5.0063, "mean_token_accuracy": 0.21963334381580352, "num_tokens": 46733679.0, "step": 20405 }, { "entropy": 5.667360019683838, "epoch": 2.017595887702649, "grad_norm": 1.0390625, "learning_rate": 0.0004595703964220489, "loss": 5.087, "mean_token_accuracy": 0.20290523171424865, "num_tokens": 46746207.0, "step": 20410 }, { "entropy": 5.67379674911499, "epoch": 2.0180901542111505, "grad_norm": 1.1484375, "learning_rate": 0.0004595502112809137, "loss": 5.0076, "mean_token_accuracy": 0.21666087061166764, "num_tokens": 46756607.0, "step": 20415 }, { "entropy": 5.629199981689453, "epoch": 2.018584420719652, "grad_norm": 1.1328125, "learning_rate": 0.0004595300215998145, "loss": 5.0334, "mean_token_accuracy": 0.21264463663101196, "num_tokens": 46768383.0, "step": 20420 }, { "entropy": 5.712230777740478, "epoch": 2.0190786872281534, "grad_norm": 1.125, "learning_rate": 0.0004595098273792482, "loss": 5.0568, "mean_token_accuracy": 0.20964164584875106, "num_tokens": 46779511.0, "step": 20425 }, { "entropy": 5.663677549362182, "epoch": 2.0195729537366547, "grad_norm": 1.03125, "learning_rate": 0.0004594896286197116, "loss": 5.0044, "mean_token_accuracy": 0.21327026784420014, "num_tokens": 46791281.0, "step": 20430 }, { "entropy": 5.613603973388672, "epoch": 2.0200672202451564, "grad_norm": 1.125, "learning_rate": 0.00045946942532170147, "loss": 4.9982, "mean_token_accuracy": 0.2213928669691086, "num_tokens": 46802090.0, "step": 20435 }, { "entropy": 5.561343479156494, "epoch": 2.0205614867536577, "grad_norm": 1.0859375, "learning_rate": 0.0004594492174857149, "loss": 5.0047, "mean_token_accuracy": 0.2188415065407753, "num_tokens": 46814688.0, "step": 20440 }, { "entropy": 5.677382612228394, "epoch": 2.021055753262159, "grad_norm": 1.046875, "learning_rate": 0.00045942900511224886, "loss": 5.0181, "mean_token_accuracy": 0.21690109968185425, "num_tokens": 46826212.0, "step": 20445 }, { "entropy": 5.62393970489502, "epoch": 2.02155001977066, "grad_norm": 1.1484375, "learning_rate": 0.0004594087882018008, "loss": 4.9767, "mean_token_accuracy": 0.2204611137509346, "num_tokens": 46836583.0, "step": 20450 }, { "entropy": 5.632849931716919, "epoch": 2.022044286279162, "grad_norm": 1.0078125, "learning_rate": 0.0004593885667548679, "loss": 4.9969, "mean_token_accuracy": 0.21502190232276916, "num_tokens": 46847973.0, "step": 20455 }, { "entropy": 5.595225191116333, "epoch": 2.022538552787663, "grad_norm": 0.9375, "learning_rate": 0.00045936834077194754, "loss": 4.9879, "mean_token_accuracy": 0.21469274908304214, "num_tokens": 46860113.0, "step": 20460 }, { "entropy": 5.6931524753570555, "epoch": 2.0230328192961644, "grad_norm": 1.0625, "learning_rate": 0.0004593481102535375, "loss": 5.0817, "mean_token_accuracy": 0.21933774203062056, "num_tokens": 46871578.0, "step": 20465 }, { "entropy": 5.622058963775634, "epoch": 2.0235270858046657, "grad_norm": 1.1796875, "learning_rate": 0.00045932787520013533, "loss": 4.9894, "mean_token_accuracy": 0.21826379150152206, "num_tokens": 46883701.0, "step": 20470 }, { "entropy": 5.564680576324463, "epoch": 2.0240213523131674, "grad_norm": 1.0390625, "learning_rate": 0.0004593076356122389, "loss": 4.9575, "mean_token_accuracy": 0.21983609348535538, "num_tokens": 46895107.0, "step": 20475 }, { "entropy": 5.614832830429077, "epoch": 2.0245156188216686, "grad_norm": 1.0859375, "learning_rate": 0.000459287391490346, "loss": 4.8434, "mean_token_accuracy": 0.22814328223466873, "num_tokens": 46906984.0, "step": 20480 }, { "entropy": 5.694172191619873, "epoch": 2.02500988533017, "grad_norm": 1.0625, "learning_rate": 0.00045926714283495466, "loss": 5.0383, "mean_token_accuracy": 0.21790158599615098, "num_tokens": 46918582.0, "step": 20485 }, { "entropy": 5.663823556900025, "epoch": 2.0255041518386716, "grad_norm": 1.0390625, "learning_rate": 0.00045924688964656303, "loss": 5.0244, "mean_token_accuracy": 0.22124436795711516, "num_tokens": 46930799.0, "step": 20490 }, { "entropy": 5.595304107666015, "epoch": 2.025998418347173, "grad_norm": 1.1953125, "learning_rate": 0.00045922663192566926, "loss": 4.9714, "mean_token_accuracy": 0.22018831074237824, "num_tokens": 46941517.0, "step": 20495 }, { "entropy": 5.647267055511475, "epoch": 2.026492684855674, "grad_norm": 1.1640625, "learning_rate": 0.00045920636967277187, "loss": 5.0686, "mean_token_accuracy": 0.2116513505578041, "num_tokens": 46953160.0, "step": 20500 }, { "entropy": 5.636938524246216, "epoch": 2.0269869513641754, "grad_norm": 1.0078125, "learning_rate": 0.00045918610288836915, "loss": 4.8894, "mean_token_accuracy": 0.2218547210097313, "num_tokens": 46964284.0, "step": 20505 }, { "entropy": 5.651586627960205, "epoch": 2.027481217872677, "grad_norm": 1.03125, "learning_rate": 0.0004591658315729598, "loss": 5.0233, "mean_token_accuracy": 0.20604276061058044, "num_tokens": 46975402.0, "step": 20510 }, { "entropy": 5.676643323898316, "epoch": 2.0279754843811784, "grad_norm": 1.0859375, "learning_rate": 0.0004591455557270423, "loss": 5.0245, "mean_token_accuracy": 0.21678128987550735, "num_tokens": 46988629.0, "step": 20515 }, { "entropy": 5.65646595954895, "epoch": 2.0284697508896796, "grad_norm": 0.9375, "learning_rate": 0.00045912527535111567, "loss": 5.0295, "mean_token_accuracy": 0.21653229147195815, "num_tokens": 47000497.0, "step": 20520 }, { "entropy": 5.612023973464966, "epoch": 2.028964017398181, "grad_norm": 1.1484375, "learning_rate": 0.00045910499044567865, "loss": 5.0095, "mean_token_accuracy": 0.2108917087316513, "num_tokens": 47010841.0, "step": 20525 }, { "entropy": 5.591293048858643, "epoch": 2.0294582839066826, "grad_norm": 1.109375, "learning_rate": 0.0004590847010112303, "loss": 4.973, "mean_token_accuracy": 0.21762469708919524, "num_tokens": 47023131.0, "step": 20530 }, { "entropy": 5.689697360992431, "epoch": 2.029952550415184, "grad_norm": 0.984375, "learning_rate": 0.00045906440704826973, "loss": 5.0658, "mean_token_accuracy": 0.21944360584020614, "num_tokens": 47034363.0, "step": 20535 }, { "entropy": 5.626315784454346, "epoch": 2.030446816923685, "grad_norm": 1.09375, "learning_rate": 0.0004590441085572962, "loss": 5.0355, "mean_token_accuracy": 0.21112040132284166, "num_tokens": 47045584.0, "step": 20540 }, { "entropy": 5.655364513397217, "epoch": 2.030941083432187, "grad_norm": 1.109375, "learning_rate": 0.00045902380553880913, "loss": 4.9995, "mean_token_accuracy": 0.2140706866979599, "num_tokens": 47056245.0, "step": 20545 }, { "entropy": 5.636577987670899, "epoch": 2.031435349940688, "grad_norm": 1.03125, "learning_rate": 0.0004590034979933078, "loss": 4.9587, "mean_token_accuracy": 0.2167824164032936, "num_tokens": 47067856.0, "step": 20550 }, { "entropy": 5.601994132995605, "epoch": 2.0319296164491893, "grad_norm": 1.0625, "learning_rate": 0.00045898318592129197, "loss": 4.9543, "mean_token_accuracy": 0.22762623876333238, "num_tokens": 47079316.0, "step": 20555 }, { "entropy": 5.647870063781738, "epoch": 2.0324238829576906, "grad_norm": 1.1328125, "learning_rate": 0.00045896286932326115, "loss": 5.0398, "mean_token_accuracy": 0.20551608949899675, "num_tokens": 47090268.0, "step": 20560 }, { "entropy": 5.601574802398682, "epoch": 2.0329181494661923, "grad_norm": 1.09375, "learning_rate": 0.0004589425481997152, "loss": 4.9852, "mean_token_accuracy": 0.21836026459932328, "num_tokens": 47100980.0, "step": 20565 }, { "entropy": 5.685000038146972, "epoch": 2.0334124159746936, "grad_norm": 1.0390625, "learning_rate": 0.000458922222551154, "loss": 4.9591, "mean_token_accuracy": 0.21881216168403625, "num_tokens": 47112548.0, "step": 20570 }, { "entropy": 5.654142713546753, "epoch": 2.033906682483195, "grad_norm": 1.140625, "learning_rate": 0.0004589018923780777, "loss": 5.0516, "mean_token_accuracy": 0.21065052598714828, "num_tokens": 47123378.0, "step": 20575 }, { "entropy": 5.634250497817993, "epoch": 2.0344009489916965, "grad_norm": 0.98828125, "learning_rate": 0.0004588815576809862, "loss": 5.0623, "mean_token_accuracy": 0.2063598647713661, "num_tokens": 47135279.0, "step": 20580 }, { "entropy": 5.70617904663086, "epoch": 2.034895215500198, "grad_norm": 1.1015625, "learning_rate": 0.00045886121846037996, "loss": 5.0391, "mean_token_accuracy": 0.21745929419994353, "num_tokens": 47146510.0, "step": 20585 }, { "entropy": 5.675967741012573, "epoch": 2.035389482008699, "grad_norm": 0.953125, "learning_rate": 0.00045884087471675917, "loss": 4.9632, "mean_token_accuracy": 0.22255948632955552, "num_tokens": 47158275.0, "step": 20590 }, { "entropy": 5.635867691040039, "epoch": 2.0358837485172003, "grad_norm": 1.0234375, "learning_rate": 0.00045882052645062433, "loss": 5.0284, "mean_token_accuracy": 0.21328186392784118, "num_tokens": 47170530.0, "step": 20595 }, { "entropy": 5.639503717422485, "epoch": 2.036378015025702, "grad_norm": 1.234375, "learning_rate": 0.000458800173662476, "loss": 5.0005, "mean_token_accuracy": 0.21456129997968673, "num_tokens": 47182092.0, "step": 20600 }, { "entropy": 5.727000331878662, "epoch": 2.0368722815342033, "grad_norm": 1.140625, "learning_rate": 0.00045877981635281497, "loss": 5.0389, "mean_token_accuracy": 0.21668547838926316, "num_tokens": 47193184.0, "step": 20605 }, { "entropy": 5.674459934234619, "epoch": 2.0373665480427046, "grad_norm": 1.0234375, "learning_rate": 0.00045875945452214186, "loss": 5.0267, "mean_token_accuracy": 0.2067078784108162, "num_tokens": 47205032.0, "step": 20610 }, { "entropy": 5.676819324493408, "epoch": 2.037860814551206, "grad_norm": 1.1015625, "learning_rate": 0.00045873908817095773, "loss": 5.0372, "mean_token_accuracy": 0.21155654788017272, "num_tokens": 47217553.0, "step": 20615 }, { "entropy": 5.661591672897339, "epoch": 2.0383550810597075, "grad_norm": 1.0, "learning_rate": 0.0004587187172997635, "loss": 5.0682, "mean_token_accuracy": 0.21342489272356033, "num_tokens": 47230625.0, "step": 20620 }, { "entropy": 5.626975393295288, "epoch": 2.038849347568209, "grad_norm": 1.0859375, "learning_rate": 0.0004586983419090603, "loss": 4.9868, "mean_token_accuracy": 0.21127007603645326, "num_tokens": 47240703.0, "step": 20625 }, { "entropy": 5.586861085891724, "epoch": 2.03934361407671, "grad_norm": 1.1640625, "learning_rate": 0.00045867796199934943, "loss": 4.9699, "mean_token_accuracy": 0.22077276408672333, "num_tokens": 47253768.0, "step": 20630 }, { "entropy": 5.703717756271362, "epoch": 2.0398378805852118, "grad_norm": 1.2265625, "learning_rate": 0.0004586575775711322, "loss": 4.9577, "mean_token_accuracy": 0.21279335469007493, "num_tokens": 47264226.0, "step": 20635 }, { "entropy": 5.624111604690552, "epoch": 2.040332147093713, "grad_norm": 1.046875, "learning_rate": 0.00045863718862491, "loss": 5.0345, "mean_token_accuracy": 0.21963423043489455, "num_tokens": 47276675.0, "step": 20640 }, { "entropy": 5.629236555099487, "epoch": 2.0408264136022143, "grad_norm": 0.9921875, "learning_rate": 0.00045861679516118447, "loss": 5.0651, "mean_token_accuracy": 0.21377364099025725, "num_tokens": 47288876.0, "step": 20645 }, { "entropy": 5.631845998764038, "epoch": 2.0413206801107155, "grad_norm": 1.109375, "learning_rate": 0.0004585963971804574, "loss": 4.9538, "mean_token_accuracy": 0.21188754439353943, "num_tokens": 47300430.0, "step": 20650 }, { "entropy": 5.629928922653198, "epoch": 2.0418149466192173, "grad_norm": 1.1015625, "learning_rate": 0.0004585759946832304, "loss": 5.063, "mean_token_accuracy": 0.21600709557533265, "num_tokens": 47310822.0, "step": 20655 }, { "entropy": 5.640576028823853, "epoch": 2.0423092131277185, "grad_norm": 1.0234375, "learning_rate": 0.00045855558767000546, "loss": 5.0265, "mean_token_accuracy": 0.2137291893362999, "num_tokens": 47323042.0, "step": 20660 }, { "entropy": 5.622982835769653, "epoch": 2.0428034796362198, "grad_norm": 1.0859375, "learning_rate": 0.0004585351761412846, "loss": 5.0144, "mean_token_accuracy": 0.2158230200409889, "num_tokens": 47334003.0, "step": 20665 }, { "entropy": 5.588385438919067, "epoch": 2.043297746144721, "grad_norm": 1.0625, "learning_rate": 0.0004585147600975699, "loss": 4.9914, "mean_token_accuracy": 0.21692392677068711, "num_tokens": 47346279.0, "step": 20670 }, { "entropy": 5.649751281738281, "epoch": 2.0437920126532227, "grad_norm": 0.99609375, "learning_rate": 0.0004584943395393637, "loss": 4.9533, "mean_token_accuracy": 0.21330831199884415, "num_tokens": 47357655.0, "step": 20675 }, { "entropy": 5.622582626342774, "epoch": 2.044286279161724, "grad_norm": 1.0546875, "learning_rate": 0.00045847391446716826, "loss": 4.9783, "mean_token_accuracy": 0.21759354174137116, "num_tokens": 47369494.0, "step": 20680 }, { "entropy": 5.618836784362793, "epoch": 2.0447805456702253, "grad_norm": 1.078125, "learning_rate": 0.000458453484881486, "loss": 5.0198, "mean_token_accuracy": 0.21849720180034637, "num_tokens": 47380221.0, "step": 20685 }, { "entropy": 5.580331468582154, "epoch": 2.045274812178727, "grad_norm": 1.0234375, "learning_rate": 0.0004584330507828196, "loss": 4.9256, "mean_token_accuracy": 0.2214198276400566, "num_tokens": 47391119.0, "step": 20690 }, { "entropy": 5.700444126129151, "epoch": 2.0457690786872282, "grad_norm": 1.0703125, "learning_rate": 0.0004584126121716717, "loss": 4.9725, "mean_token_accuracy": 0.2235398381948471, "num_tokens": 47401828.0, "step": 20695 }, { "entropy": 5.594122886657715, "epoch": 2.0462633451957295, "grad_norm": 1.15625, "learning_rate": 0.0004583921690485451, "loss": 4.9614, "mean_token_accuracy": 0.22011225819587707, "num_tokens": 47412921.0, "step": 20700 }, { "entropy": 5.644391679763794, "epoch": 2.0467576117042308, "grad_norm": 1.03125, "learning_rate": 0.0004583717214139427, "loss": 5.0278, "mean_token_accuracy": 0.20867701768875122, "num_tokens": 47424117.0, "step": 20705 }, { "entropy": 5.625422239303589, "epoch": 2.0472518782127325, "grad_norm": 1.0625, "learning_rate": 0.00045835126926836744, "loss": 4.9991, "mean_token_accuracy": 0.21489228755235673, "num_tokens": 47434457.0, "step": 20710 }, { "entropy": 5.671094942092895, "epoch": 2.0477461447212337, "grad_norm": 1.1015625, "learning_rate": 0.0004583308126123225, "loss": 5.0656, "mean_token_accuracy": 0.2148061916232109, "num_tokens": 47446108.0, "step": 20715 }, { "entropy": 5.5869945049285885, "epoch": 2.048240411229735, "grad_norm": 0.96484375, "learning_rate": 0.00045831035144631115, "loss": 4.912, "mean_token_accuracy": 0.2219560459256172, "num_tokens": 47458735.0, "step": 20720 }, { "entropy": 5.681335401535034, "epoch": 2.0487346777382363, "grad_norm": 1.1171875, "learning_rate": 0.00045828988577083674, "loss": 5.0216, "mean_token_accuracy": 0.2196031928062439, "num_tokens": 47471726.0, "step": 20725 }, { "entropy": 5.726690340042114, "epoch": 2.049228944246738, "grad_norm": 1.046875, "learning_rate": 0.0004582694155864027, "loss": 5.0282, "mean_token_accuracy": 0.21059589087963104, "num_tokens": 47483940.0, "step": 20730 }, { "entropy": 5.582933235168457, "epoch": 2.0497232107552392, "grad_norm": 1.0625, "learning_rate": 0.00045824894089351265, "loss": 4.9587, "mean_token_accuracy": 0.2163565546274185, "num_tokens": 47494723.0, "step": 20735 }, { "entropy": 5.603602600097656, "epoch": 2.0502174772637405, "grad_norm": 1.0546875, "learning_rate": 0.0004582284616926702, "loss": 5.0148, "mean_token_accuracy": 0.21630021035671235, "num_tokens": 47506454.0, "step": 20740 }, { "entropy": 5.687269783020019, "epoch": 2.050711743772242, "grad_norm": 1.140625, "learning_rate": 0.0004582079779843791, "loss": 5.102, "mean_token_accuracy": 0.21112843006849288, "num_tokens": 47518366.0, "step": 20745 }, { "entropy": 5.626212120056152, "epoch": 2.0512060102807435, "grad_norm": 1.0078125, "learning_rate": 0.0004581874897691434, "loss": 5.0003, "mean_token_accuracy": 0.21571044325828553, "num_tokens": 47530635.0, "step": 20750 }, { "entropy": 5.70426197052002, "epoch": 2.0517002767892447, "grad_norm": 1.1875, "learning_rate": 0.000458166997047467, "loss": 5.0823, "mean_token_accuracy": 0.2122553199529648, "num_tokens": 47541158.0, "step": 20755 }, { "entropy": 5.718863296508789, "epoch": 2.052194543297746, "grad_norm": 1.109375, "learning_rate": 0.00045814649981985406, "loss": 5.0392, "mean_token_accuracy": 0.20852733999490738, "num_tokens": 47552392.0, "step": 20760 }, { "entropy": 5.657040548324585, "epoch": 2.0526888098062477, "grad_norm": 1.046875, "learning_rate": 0.0004581259980868088, "loss": 5.0297, "mean_token_accuracy": 0.21849019080400467, "num_tokens": 47565079.0, "step": 20765 }, { "entropy": 5.667049169540405, "epoch": 2.053183076314749, "grad_norm": 1.015625, "learning_rate": 0.0004581054918488356, "loss": 5.0364, "mean_token_accuracy": 0.21008581966161727, "num_tokens": 47575529.0, "step": 20770 }, { "entropy": 5.617583465576172, "epoch": 2.05367734282325, "grad_norm": 1.140625, "learning_rate": 0.00045808498110643886, "loss": 4.9508, "mean_token_accuracy": 0.21169558465480803, "num_tokens": 47587289.0, "step": 20775 }, { "entropy": 5.608504962921143, "epoch": 2.0541716093317515, "grad_norm": 0.9921875, "learning_rate": 0.00045806446586012326, "loss": 4.999, "mean_token_accuracy": 0.2174066573381424, "num_tokens": 47599184.0, "step": 20780 }, { "entropy": 5.589325857162476, "epoch": 2.054665875840253, "grad_norm": 1.0625, "learning_rate": 0.0004580439461103933, "loss": 4.8706, "mean_token_accuracy": 0.23097191452980043, "num_tokens": 47609651.0, "step": 20785 }, { "entropy": 5.6630189418792725, "epoch": 2.0551601423487544, "grad_norm": 1.1484375, "learning_rate": 0.0004580234218577539, "loss": 5.0088, "mean_token_accuracy": 0.21750993728637696, "num_tokens": 47621138.0, "step": 20790 }, { "entropy": 5.645431089401245, "epoch": 2.0556544088572557, "grad_norm": 1.09375, "learning_rate": 0.00045800289310270995, "loss": 5.0164, "mean_token_accuracy": 0.21875311583280563, "num_tokens": 47631492.0, "step": 20795 }, { "entropy": 5.614883995056152, "epoch": 2.0561486753657574, "grad_norm": 1.046875, "learning_rate": 0.0004579823598457664, "loss": 4.9749, "mean_token_accuracy": 0.22151675075292587, "num_tokens": 47643088.0, "step": 20800 }, { "entropy": 5.584973335266113, "epoch": 2.0566429418742587, "grad_norm": 1.1640625, "learning_rate": 0.00045796182208742846, "loss": 4.896, "mean_token_accuracy": 0.23082083612680435, "num_tokens": 47653393.0, "step": 20805 }, { "entropy": 5.610613632202148, "epoch": 2.05713720838276, "grad_norm": 1.15625, "learning_rate": 0.0004579412798282013, "loss": 4.9832, "mean_token_accuracy": 0.22302401065826416, "num_tokens": 47665879.0, "step": 20810 }, { "entropy": 5.54992356300354, "epoch": 2.057631474891261, "grad_norm": 0.98046875, "learning_rate": 0.0004579207330685902, "loss": 4.9538, "mean_token_accuracy": 0.22084347903728485, "num_tokens": 47678339.0, "step": 20815 }, { "entropy": 5.637741565704346, "epoch": 2.058125741399763, "grad_norm": 1.0703125, "learning_rate": 0.0004579001818091009, "loss": 4.9985, "mean_token_accuracy": 0.21972896456718444, "num_tokens": 47688867.0, "step": 20820 }, { "entropy": 5.657426214218139, "epoch": 2.058620007908264, "grad_norm": 1.0625, "learning_rate": 0.0004578796260502385, "loss": 5.0629, "mean_token_accuracy": 0.2141987442970276, "num_tokens": 47700265.0, "step": 20825 }, { "entropy": 5.692635917663575, "epoch": 2.0591142744167654, "grad_norm": 1.0390625, "learning_rate": 0.0004578590657925091, "loss": 5.0902, "mean_token_accuracy": 0.20471265465021132, "num_tokens": 47711539.0, "step": 20830 }, { "entropy": 5.706751012802124, "epoch": 2.059608540925267, "grad_norm": 0.97265625, "learning_rate": 0.0004578385010364182, "loss": 5.0271, "mean_token_accuracy": 0.21052338778972626, "num_tokens": 47722433.0, "step": 20835 }, { "entropy": 5.617966794967652, "epoch": 2.0601028074337684, "grad_norm": 1.125, "learning_rate": 0.00045781793178247194, "loss": 4.9759, "mean_token_accuracy": 0.21766455024480819, "num_tokens": 47734001.0, "step": 20840 }, { "entropy": 5.578632402420044, "epoch": 2.0605970739422697, "grad_norm": 1.0625, "learning_rate": 0.0004577973580311761, "loss": 4.9335, "mean_token_accuracy": 0.22645369917154312, "num_tokens": 47744903.0, "step": 20845 }, { "entropy": 5.685690116882324, "epoch": 2.061091340450771, "grad_norm": 1.1171875, "learning_rate": 0.0004577767797830369, "loss": 4.999, "mean_token_accuracy": 0.21660397946834564, "num_tokens": 47756571.0, "step": 20850 }, { "entropy": 5.623036289215088, "epoch": 2.0615856069592726, "grad_norm": 1.125, "learning_rate": 0.00045775619703856057, "loss": 4.9445, "mean_token_accuracy": 0.21764251291751863, "num_tokens": 47767555.0, "step": 20855 }, { "entropy": 5.667784547805786, "epoch": 2.062079873467774, "grad_norm": 0.9921875, "learning_rate": 0.00045773560979825347, "loss": 5.0257, "mean_token_accuracy": 0.22143202424049377, "num_tokens": 47779577.0, "step": 20860 }, { "entropy": 5.6690675735473635, "epoch": 2.062574139976275, "grad_norm": 1.1484375, "learning_rate": 0.00045771501806262196, "loss": 5.0335, "mean_token_accuracy": 0.2152952343225479, "num_tokens": 47790898.0, "step": 20865 }, { "entropy": 5.616121053695679, "epoch": 2.0630684064847764, "grad_norm": 1.109375, "learning_rate": 0.00045769442183217273, "loss": 5.0175, "mean_token_accuracy": 0.22019620537757872, "num_tokens": 47802008.0, "step": 20870 }, { "entropy": 5.603989219665527, "epoch": 2.063562672993278, "grad_norm": 1.2109375, "learning_rate": 0.0004576738211074123, "loss": 4.974, "mean_token_accuracy": 0.22003807127475739, "num_tokens": 47813544.0, "step": 20875 }, { "entropy": 5.7114586353302, "epoch": 2.0640569395017794, "grad_norm": 1.1875, "learning_rate": 0.0004576532158888476, "loss": 5.0234, "mean_token_accuracy": 0.2153146743774414, "num_tokens": 47824313.0, "step": 20880 }, { "entropy": 5.695303106307984, "epoch": 2.0645512060102806, "grad_norm": 1.015625, "learning_rate": 0.0004576326061769854, "loss": 4.9672, "mean_token_accuracy": 0.2200299397110939, "num_tokens": 47836653.0, "step": 20885 }, { "entropy": 5.623409843444824, "epoch": 2.065045472518782, "grad_norm": 1.1171875, "learning_rate": 0.00045761199197233285, "loss": 5.0463, "mean_token_accuracy": 0.21802671253681183, "num_tokens": 47848237.0, "step": 20890 }, { "entropy": 5.623781490325928, "epoch": 2.0655397390272836, "grad_norm": 1.0546875, "learning_rate": 0.00045759137327539684, "loss": 5.0301, "mean_token_accuracy": 0.2131922349333763, "num_tokens": 47859686.0, "step": 20895 }, { "entropy": 5.643564510345459, "epoch": 2.066034005535785, "grad_norm": 0.984375, "learning_rate": 0.0004575707500866848, "loss": 4.9468, "mean_token_accuracy": 0.21593184173107147, "num_tokens": 47871730.0, "step": 20900 }, { "entropy": 5.726583051681518, "epoch": 2.066528272044286, "grad_norm": 1.046875, "learning_rate": 0.00045755012240670395, "loss": 5.0499, "mean_token_accuracy": 0.20851520895957948, "num_tokens": 47883927.0, "step": 20905 }, { "entropy": 5.588821315765381, "epoch": 2.067022538552788, "grad_norm": 1.125, "learning_rate": 0.0004575294902359618, "loss": 4.8903, "mean_token_accuracy": 0.22889024764299393, "num_tokens": 47894885.0, "step": 20910 }, { "entropy": 5.6846973419189455, "epoch": 2.067516805061289, "grad_norm": 1.0546875, "learning_rate": 0.00045750885357496583, "loss": 5.0534, "mean_token_accuracy": 0.20783141404390335, "num_tokens": 47906183.0, "step": 20915 }, { "entropy": 5.619321966171265, "epoch": 2.0680110715697904, "grad_norm": 1.0078125, "learning_rate": 0.0004574882124242238, "loss": 5.022, "mean_token_accuracy": 0.2118142604827881, "num_tokens": 47918002.0, "step": 20920 }, { "entropy": 5.6108935356140135, "epoch": 2.0685053380782916, "grad_norm": 1.046875, "learning_rate": 0.00045746756678424343, "loss": 4.9329, "mean_token_accuracy": 0.22281570434570314, "num_tokens": 47928300.0, "step": 20925 }, { "entropy": 5.587422609329224, "epoch": 2.0689996045867933, "grad_norm": 1.0625, "learning_rate": 0.00045744691665553254, "loss": 4.9529, "mean_token_accuracy": 0.21884721964597703, "num_tokens": 47939591.0, "step": 20930 }, { "entropy": 5.688492774963379, "epoch": 2.0694938710952946, "grad_norm": 0.98046875, "learning_rate": 0.0004574262620385993, "loss": 5.0645, "mean_token_accuracy": 0.21155198216438292, "num_tokens": 47953075.0, "step": 20935 }, { "entropy": 5.726822471618652, "epoch": 2.069988137603796, "grad_norm": 1.078125, "learning_rate": 0.00045740560293395166, "loss": 5.0974, "mean_token_accuracy": 0.20883297473192214, "num_tokens": 47964795.0, "step": 20940 }, { "entropy": 5.5882494926452635, "epoch": 2.0704824041122976, "grad_norm": 1.0625, "learning_rate": 0.0004573849393420979, "loss": 4.9028, "mean_token_accuracy": 0.2308221861720085, "num_tokens": 47975175.0, "step": 20945 }, { "entropy": 5.640167903900147, "epoch": 2.070976670620799, "grad_norm": 1.140625, "learning_rate": 0.0004573642712635463, "loss": 5.0533, "mean_token_accuracy": 0.21567558050155639, "num_tokens": 47986548.0, "step": 20950 }, { "entropy": 5.669065332412719, "epoch": 2.0714709371293, "grad_norm": 1.078125, "learning_rate": 0.00045734359869880535, "loss": 5.0758, "mean_token_accuracy": 0.205637189745903, "num_tokens": 47998759.0, "step": 20955 }, { "entropy": 5.6118732452392575, "epoch": 2.0719652036378013, "grad_norm": 1.09375, "learning_rate": 0.0004573229216483836, "loss": 4.9711, "mean_token_accuracy": 0.2198145404458046, "num_tokens": 48010404.0, "step": 20960 }, { "entropy": 5.593988752365112, "epoch": 2.072459470146303, "grad_norm": 1.15625, "learning_rate": 0.0004573022401127897, "loss": 4.913, "mean_token_accuracy": 0.22079424411058426, "num_tokens": 48019729.0, "step": 20965 }, { "entropy": 5.655909490585327, "epoch": 2.0729537366548043, "grad_norm": 1.0625, "learning_rate": 0.00045728155409253236, "loss": 5.0142, "mean_token_accuracy": 0.21288294494152069, "num_tokens": 48031142.0, "step": 20970 }, { "entropy": 5.684966564178467, "epoch": 2.0734480031633056, "grad_norm": 1.0234375, "learning_rate": 0.0004572608635881206, "loss": 4.9948, "mean_token_accuracy": 0.22021991461515428, "num_tokens": 48043051.0, "step": 20975 }, { "entropy": 5.6209605693817135, "epoch": 2.073942269671807, "grad_norm": 1.0625, "learning_rate": 0.0004572401686000633, "loss": 4.9679, "mean_token_accuracy": 0.2234415039420128, "num_tokens": 48053721.0, "step": 20980 }, { "entropy": 5.548073196411133, "epoch": 2.0744365361803085, "grad_norm": 1.1015625, "learning_rate": 0.00045721946912886957, "loss": 4.9215, "mean_token_accuracy": 0.22545574903488158, "num_tokens": 48065208.0, "step": 20985 }, { "entropy": 5.663705348968506, "epoch": 2.07493080268881, "grad_norm": 1.1328125, "learning_rate": 0.0004571987651750486, "loss": 5.0755, "mean_token_accuracy": 0.2158670336008072, "num_tokens": 48076416.0, "step": 20990 }, { "entropy": 5.667838859558105, "epoch": 2.075425069197311, "grad_norm": 1.109375, "learning_rate": 0.0004571780567391098, "loss": 5.0128, "mean_token_accuracy": 0.2108416512608528, "num_tokens": 48087496.0, "step": 20995 }, { "entropy": 5.687728214263916, "epoch": 2.0759193357058128, "grad_norm": 1.078125, "learning_rate": 0.00045715734382156245, "loss": 5.0078, "mean_token_accuracy": 0.21656656712293626, "num_tokens": 48098920.0, "step": 21000 }, { "epoch": 2.0759193357058128, "eval_entropy": 5.410454393694175, "eval_loss": 5.086744785308838, "eval_mean_token_accuracy": 0.2191858798320443, "eval_num_tokens": 48098920.0, "eval_runtime": 20.5281, "eval_samples_per_second": 1583.826, "eval_steps_per_second": 198.021, "step": 21000 }, { "entropy": 5.655107164382935, "epoch": 2.076413602214314, "grad_norm": 1.0703125, "learning_rate": 0.0004571366264229162, "loss": 5.0675, "mean_token_accuracy": 0.2149159789085388, "num_tokens": 48109813.0, "step": 21005 }, { "entropy": 5.640252590179443, "epoch": 2.0769078687228153, "grad_norm": 1.09375, "learning_rate": 0.0004571159045436807, "loss": 5.0063, "mean_token_accuracy": 0.2218811556696892, "num_tokens": 48120736.0, "step": 21010 }, { "entropy": 5.630234146118164, "epoch": 2.0774021352313166, "grad_norm": 1.1171875, "learning_rate": 0.0004570951781843657, "loss": 4.9748, "mean_token_accuracy": 0.22196894884109497, "num_tokens": 48131631.0, "step": 21015 }, { "entropy": 5.573506116867065, "epoch": 2.0778964017398183, "grad_norm": 1.1171875, "learning_rate": 0.00045707444734548116, "loss": 4.9171, "mean_token_accuracy": 0.22053711712360383, "num_tokens": 48141662.0, "step": 21020 }, { "entropy": 5.551257705688476, "epoch": 2.0783906682483195, "grad_norm": 1.078125, "learning_rate": 0.0004570537120275369, "loss": 4.9712, "mean_token_accuracy": 0.22225781977176667, "num_tokens": 48152752.0, "step": 21025 }, { "entropy": 5.687500429153443, "epoch": 2.078884934756821, "grad_norm": 1.0703125, "learning_rate": 0.000457032972231043, "loss": 5.0249, "mean_token_accuracy": 0.21508511006832123, "num_tokens": 48163510.0, "step": 21030 }, { "entropy": 5.64520378112793, "epoch": 2.079379201265322, "grad_norm": 1.0390625, "learning_rate": 0.0004570122279565098, "loss": 5.0406, "mean_token_accuracy": 0.21083574146032333, "num_tokens": 48174241.0, "step": 21035 }, { "entropy": 5.641775465011596, "epoch": 2.0798734677738238, "grad_norm": 0.9921875, "learning_rate": 0.00045699147920444757, "loss": 5.0043, "mean_token_accuracy": 0.2137088805437088, "num_tokens": 48186062.0, "step": 21040 }, { "entropy": 5.650915813446045, "epoch": 2.080367734282325, "grad_norm": 1.1328125, "learning_rate": 0.0004569707259753667, "loss": 4.8833, "mean_token_accuracy": 0.22385343611240388, "num_tokens": 48197108.0, "step": 21045 }, { "entropy": 5.55268349647522, "epoch": 2.0808620007908263, "grad_norm": 1.1171875, "learning_rate": 0.0004569499682697778, "loss": 4.9311, "mean_token_accuracy": 0.23262353092432023, "num_tokens": 48208780.0, "step": 21050 }, { "entropy": 5.617620944976807, "epoch": 2.081356267299328, "grad_norm": 1.0, "learning_rate": 0.0004569292060881914, "loss": 4.9797, "mean_token_accuracy": 0.22262774258852006, "num_tokens": 48223164.0, "step": 21055 }, { "entropy": 5.609575939178467, "epoch": 2.0818505338078293, "grad_norm": 1.0625, "learning_rate": 0.00045690843943111824, "loss": 4.9233, "mean_token_accuracy": 0.22118592113256455, "num_tokens": 48234402.0, "step": 21060 }, { "entropy": 5.6509024143219, "epoch": 2.0823448003163305, "grad_norm": 1.140625, "learning_rate": 0.00045688766829906936, "loss": 4.9891, "mean_token_accuracy": 0.21137000918388366, "num_tokens": 48245147.0, "step": 21065 }, { "entropy": 5.655809688568115, "epoch": 2.0828390668248318, "grad_norm": 1.1015625, "learning_rate": 0.0004568668926925556, "loss": 5.0576, "mean_token_accuracy": 0.20728397071361543, "num_tokens": 48256787.0, "step": 21070 }, { "entropy": 5.632467603683471, "epoch": 2.0833333333333335, "grad_norm": 1.1484375, "learning_rate": 0.000456846112612088, "loss": 4.9902, "mean_token_accuracy": 0.20940980911254883, "num_tokens": 48267648.0, "step": 21075 }, { "entropy": 5.612430000305176, "epoch": 2.0838275998418347, "grad_norm": 1.1484375, "learning_rate": 0.00045682532805817796, "loss": 4.9991, "mean_token_accuracy": 0.21526008993387222, "num_tokens": 48279274.0, "step": 21080 }, { "entropy": 5.636698818206787, "epoch": 2.084321866350336, "grad_norm": 1.078125, "learning_rate": 0.0004568045390313365, "loss": 4.9994, "mean_token_accuracy": 0.218184894323349, "num_tokens": 48290849.0, "step": 21085 }, { "entropy": 5.645367527008057, "epoch": 2.0848161328588377, "grad_norm": 1.1171875, "learning_rate": 0.00045678374553207525, "loss": 5.0725, "mean_token_accuracy": 0.2104203835129738, "num_tokens": 48301271.0, "step": 21090 }, { "entropy": 5.6737768173217775, "epoch": 2.085310399367339, "grad_norm": 1.03125, "learning_rate": 0.00045676294756090565, "loss": 5.0029, "mean_token_accuracy": 0.20916156172752381, "num_tokens": 48311869.0, "step": 21095 }, { "entropy": 5.667511796951294, "epoch": 2.0858046658758402, "grad_norm": 0.98828125, "learning_rate": 0.0004567421451183393, "loss": 5.006, "mean_token_accuracy": 0.21990291327238082, "num_tokens": 48324907.0, "step": 21100 }, { "entropy": 5.621210098266602, "epoch": 2.0862989323843415, "grad_norm": 1.0, "learning_rate": 0.000456721338204888, "loss": 4.9521, "mean_token_accuracy": 0.22186561971902846, "num_tokens": 48335887.0, "step": 21105 }, { "entropy": 5.645153665542603, "epoch": 2.086793198892843, "grad_norm": 1.125, "learning_rate": 0.0004567005268210636, "loss": 4.9644, "mean_token_accuracy": 0.21500124037265778, "num_tokens": 48348190.0, "step": 21110 }, { "entropy": 5.699085903167725, "epoch": 2.0872874654013445, "grad_norm": 1.1015625, "learning_rate": 0.00045667971096737805, "loss": 5.126, "mean_token_accuracy": 0.20489919036626816, "num_tokens": 48360113.0, "step": 21115 }, { "entropy": 5.700635099411011, "epoch": 2.0877817319098457, "grad_norm": 1.0703125, "learning_rate": 0.0004566588906443434, "loss": 5.0363, "mean_token_accuracy": 0.21095264106988906, "num_tokens": 48371463.0, "step": 21120 }, { "entropy": 5.640934181213379, "epoch": 2.088275998418347, "grad_norm": 1.03125, "learning_rate": 0.0004566380658524719, "loss": 5.1143, "mean_token_accuracy": 0.20196683555841446, "num_tokens": 48383969.0, "step": 21125 }, { "entropy": 5.627220726013183, "epoch": 2.0887702649268487, "grad_norm": 1.140625, "learning_rate": 0.0004566172365922758, "loss": 4.9472, "mean_token_accuracy": 0.22313515990972518, "num_tokens": 48395551.0, "step": 21130 }, { "entropy": 5.674346256256103, "epoch": 2.08926453143535, "grad_norm": 1.09375, "learning_rate": 0.0004565964028642675, "loss": 4.9938, "mean_token_accuracy": 0.21910232901573182, "num_tokens": 48408154.0, "step": 21135 }, { "entropy": 5.563052320480347, "epoch": 2.089758797943851, "grad_norm": 1.0703125, "learning_rate": 0.0004565755646689595, "loss": 4.9448, "mean_token_accuracy": 0.22279797941446305, "num_tokens": 48420060.0, "step": 21140 }, { "entropy": 5.642939472198487, "epoch": 2.0902530644523525, "grad_norm": 0.9453125, "learning_rate": 0.0004565547220068644, "loss": 5.0458, "mean_token_accuracy": 0.21619906425476074, "num_tokens": 48432347.0, "step": 21145 }, { "entropy": 5.777932024002075, "epoch": 2.090747330960854, "grad_norm": 0.98828125, "learning_rate": 0.0004565338748784951, "loss": 5.075, "mean_token_accuracy": 0.20275344401597978, "num_tokens": 48443177.0, "step": 21150 }, { "entropy": 5.718689489364624, "epoch": 2.0912415974693555, "grad_norm": 1.1171875, "learning_rate": 0.0004565130232843642, "loss": 5.0102, "mean_token_accuracy": 0.2108388900756836, "num_tokens": 48453605.0, "step": 21155 }, { "entropy": 5.620134067535401, "epoch": 2.0917358639778567, "grad_norm": 1.1796875, "learning_rate": 0.0004564921672249848, "loss": 5.0401, "mean_token_accuracy": 0.21297027468681334, "num_tokens": 48465364.0, "step": 21160 }, { "entropy": 5.612469291687011, "epoch": 2.0922301304863584, "grad_norm": 0.9765625, "learning_rate": 0.00045647130670086996, "loss": 4.9706, "mean_token_accuracy": 0.21598804444074632, "num_tokens": 48477255.0, "step": 21165 }, { "entropy": 5.652618885040283, "epoch": 2.0927243969948597, "grad_norm": 1.2109375, "learning_rate": 0.0004564504417125328, "loss": 5.0123, "mean_token_accuracy": 0.2177692875266075, "num_tokens": 48487551.0, "step": 21170 }, { "entropy": 5.708688831329345, "epoch": 2.093218663503361, "grad_norm": 0.98828125, "learning_rate": 0.00045642957226048667, "loss": 4.9853, "mean_token_accuracy": 0.21612523198127748, "num_tokens": 48500422.0, "step": 21175 }, { "entropy": 5.5957526683807375, "epoch": 2.093712930011862, "grad_norm": 1.1640625, "learning_rate": 0.00045640869834524486, "loss": 4.9725, "mean_token_accuracy": 0.22203195840120316, "num_tokens": 48511588.0, "step": 21180 }, { "entropy": 5.648880910873413, "epoch": 2.094207196520364, "grad_norm": 1.09375, "learning_rate": 0.0004563878199673209, "loss": 5.0548, "mean_token_accuracy": 0.2171315848827362, "num_tokens": 48522700.0, "step": 21185 }, { "entropy": 5.743068981170654, "epoch": 2.094701463028865, "grad_norm": 1.0625, "learning_rate": 0.0004563669371272285, "loss": 5.0624, "mean_token_accuracy": 0.2143555298447609, "num_tokens": 48534253.0, "step": 21190 }, { "entropy": 5.600001096725464, "epoch": 2.0951957295373664, "grad_norm": 1.0078125, "learning_rate": 0.00045634604982548125, "loss": 4.9632, "mean_token_accuracy": 0.21917160153388976, "num_tokens": 48545543.0, "step": 21195 }, { "entropy": 5.674845027923584, "epoch": 2.095689996045868, "grad_norm": 1.0078125, "learning_rate": 0.00045632515806259306, "loss": 5.0638, "mean_token_accuracy": 0.2094424247741699, "num_tokens": 48557433.0, "step": 21200 }, { "entropy": 5.687759304046631, "epoch": 2.0961842625543694, "grad_norm": 1.0, "learning_rate": 0.00045630426183907786, "loss": 5.0386, "mean_token_accuracy": 0.21329042911529542, "num_tokens": 48570271.0, "step": 21205 }, { "entropy": 5.641349458694458, "epoch": 2.0966785290628707, "grad_norm": 1.125, "learning_rate": 0.0004562833611554497, "loss": 4.9875, "mean_token_accuracy": 0.21511641442775725, "num_tokens": 48582376.0, "step": 21210 }, { "entropy": 5.650782632827759, "epoch": 2.097172795571372, "grad_norm": 1.078125, "learning_rate": 0.0004562624560122227, "loss": 5.0296, "mean_token_accuracy": 0.21544295847415923, "num_tokens": 48595188.0, "step": 21215 }, { "entropy": 5.598039293289185, "epoch": 2.0976670620798736, "grad_norm": 1.1484375, "learning_rate": 0.0004562415464099112, "loss": 4.9283, "mean_token_accuracy": 0.2194436475634575, "num_tokens": 48606093.0, "step": 21220 }, { "entropy": 5.646231746673584, "epoch": 2.098161328588375, "grad_norm": 1.390625, "learning_rate": 0.0004562206323490295, "loss": 5.0503, "mean_token_accuracy": 0.21346221268177032, "num_tokens": 48618163.0, "step": 21225 }, { "entropy": 5.700385427474975, "epoch": 2.098655595096876, "grad_norm": 1.0390625, "learning_rate": 0.00045619971383009216, "loss": 5.0371, "mean_token_accuracy": 0.22046100199222565, "num_tokens": 48629771.0, "step": 21230 }, { "entropy": 5.66089391708374, "epoch": 2.0991498616053774, "grad_norm": 1.2890625, "learning_rate": 0.0004561787908536138, "loss": 4.9957, "mean_token_accuracy": 0.21111521124839783, "num_tokens": 48640409.0, "step": 21235 }, { "entropy": 5.598044681549072, "epoch": 2.099644128113879, "grad_norm": 1.078125, "learning_rate": 0.00045615786342010896, "loss": 4.9993, "mean_token_accuracy": 0.21732162386178971, "num_tokens": 48652223.0, "step": 21240 }, { "entropy": 5.6727148532867435, "epoch": 2.1001383946223804, "grad_norm": 1.1328125, "learning_rate": 0.00045613693153009264, "loss": 4.8977, "mean_token_accuracy": 0.22795259654521943, "num_tokens": 48663667.0, "step": 21245 }, { "entropy": 5.7089094638824465, "epoch": 2.1006326611308817, "grad_norm": 1.109375, "learning_rate": 0.0004561159951840797, "loss": 5.0557, "mean_token_accuracy": 0.21293465346097945, "num_tokens": 48674691.0, "step": 21250 }, { "entropy": 5.634056138992309, "epoch": 2.1011269276393834, "grad_norm": 1.0234375, "learning_rate": 0.0004560950543825852, "loss": 5.0149, "mean_token_accuracy": 0.21330103725194932, "num_tokens": 48686888.0, "step": 21255 }, { "entropy": 5.630914258956909, "epoch": 2.1016211941478846, "grad_norm": 1.078125, "learning_rate": 0.00045607410912612426, "loss": 5.0201, "mean_token_accuracy": 0.2149464949965477, "num_tokens": 48698666.0, "step": 21260 }, { "entropy": 5.647128582000732, "epoch": 2.102115460656386, "grad_norm": 1.1328125, "learning_rate": 0.0004560531594152121, "loss": 4.9529, "mean_token_accuracy": 0.22177106738090516, "num_tokens": 48709793.0, "step": 21265 }, { "entropy": 5.583790683746338, "epoch": 2.102609727164887, "grad_norm": 1.1015625, "learning_rate": 0.0004560322052503642, "loss": 4.8893, "mean_token_accuracy": 0.2306046724319458, "num_tokens": 48720835.0, "step": 21270 }, { "entropy": 5.71058087348938, "epoch": 2.103103993673389, "grad_norm": 1.078125, "learning_rate": 0.0004560112466320959, "loss": 5.1491, "mean_token_accuracy": 0.20738973319530488, "num_tokens": 48732990.0, "step": 21275 }, { "entropy": 5.6254298210144045, "epoch": 2.10359826018189, "grad_norm": 1.1640625, "learning_rate": 0.00045599028356092293, "loss": 4.9547, "mean_token_accuracy": 0.21950895786285402, "num_tokens": 48744985.0, "step": 21280 }, { "entropy": 5.580562400817871, "epoch": 2.1040925266903914, "grad_norm": 1.109375, "learning_rate": 0.0004559693160373608, "loss": 4.9273, "mean_token_accuracy": 0.22839030921459197, "num_tokens": 48755328.0, "step": 21285 }, { "entropy": 5.622778415679932, "epoch": 2.1045867931988926, "grad_norm": 1.0546875, "learning_rate": 0.0004559483440619255, "loss": 4.9624, "mean_token_accuracy": 0.21852560639381408, "num_tokens": 48766666.0, "step": 21290 }, { "entropy": 5.666731595993042, "epoch": 2.1050810597073943, "grad_norm": 1.0078125, "learning_rate": 0.00045592736763513285, "loss": 5.0115, "mean_token_accuracy": 0.21371037065982817, "num_tokens": 48779134.0, "step": 21295 }, { "entropy": 5.676667594909668, "epoch": 2.1055753262158956, "grad_norm": 0.9765625, "learning_rate": 0.0004559063867574989, "loss": 5.0321, "mean_token_accuracy": 0.2083706811070442, "num_tokens": 48791338.0, "step": 21300 }, { "entropy": 5.6195532321929935, "epoch": 2.106069592724397, "grad_norm": 1.3046875, "learning_rate": 0.00045588540142953973, "loss": 4.9497, "mean_token_accuracy": 0.22276730239391326, "num_tokens": 48802711.0, "step": 21305 }, { "entropy": 5.6214611530303955, "epoch": 2.1065638592328986, "grad_norm": 1.15625, "learning_rate": 0.0004558644116517717, "loss": 4.9737, "mean_token_accuracy": 0.2244958609342575, "num_tokens": 48815219.0, "step": 21310 }, { "entropy": 5.604186773300171, "epoch": 2.1070581257414, "grad_norm": 1.046875, "learning_rate": 0.00045584341742471095, "loss": 4.9991, "mean_token_accuracy": 0.21294087320566177, "num_tokens": 48826075.0, "step": 21315 }, { "entropy": 5.590073490142823, "epoch": 2.107552392249901, "grad_norm": 1.125, "learning_rate": 0.0004558224187488742, "loss": 4.9039, "mean_token_accuracy": 0.2194947436451912, "num_tokens": 48837375.0, "step": 21320 }, { "entropy": 5.66591854095459, "epoch": 2.1080466587584024, "grad_norm": 1.0390625, "learning_rate": 0.00045580141562477785, "loss": 5.0362, "mean_token_accuracy": 0.2112525761127472, "num_tokens": 48849205.0, "step": 21325 }, { "entropy": 5.6284441471099855, "epoch": 2.108540925266904, "grad_norm": 1.1484375, "learning_rate": 0.00045578040805293864, "loss": 4.9894, "mean_token_accuracy": 0.22381118386983873, "num_tokens": 48861700.0, "step": 21330 }, { "entropy": 5.708299684524536, "epoch": 2.1090351917754053, "grad_norm": 0.984375, "learning_rate": 0.00045575939603387336, "loss": 5.1444, "mean_token_accuracy": 0.20869310647249223, "num_tokens": 48873510.0, "step": 21335 }, { "entropy": 5.711788177490234, "epoch": 2.1095294582839066, "grad_norm": 1.0703125, "learning_rate": 0.0004557383795680988, "loss": 5.0152, "mean_token_accuracy": 0.21011894941329956, "num_tokens": 48885011.0, "step": 21340 }, { "entropy": 5.6726264476776125, "epoch": 2.1100237247924083, "grad_norm": 1.0703125, "learning_rate": 0.00045571735865613215, "loss": 4.9547, "mean_token_accuracy": 0.2200231209397316, "num_tokens": 48895767.0, "step": 21345 }, { "entropy": 5.649470043182373, "epoch": 2.1105179913009096, "grad_norm": 1.0234375, "learning_rate": 0.00045569633329849043, "loss": 5.0896, "mean_token_accuracy": 0.2028256833553314, "num_tokens": 48906616.0, "step": 21350 }, { "entropy": 5.673553133010865, "epoch": 2.111012257809411, "grad_norm": 1.0234375, "learning_rate": 0.0004556753034956909, "loss": 5.0197, "mean_token_accuracy": 0.21206318438053132, "num_tokens": 48916841.0, "step": 21355 }, { "entropy": 5.645083284378051, "epoch": 2.111506524317912, "grad_norm": 1.140625, "learning_rate": 0.0004556542692482508, "loss": 4.9765, "mean_token_accuracy": 0.2180880293250084, "num_tokens": 48928798.0, "step": 21360 }, { "entropy": 5.608558654785156, "epoch": 2.112000790826414, "grad_norm": 1.015625, "learning_rate": 0.0004556332305566877, "loss": 4.965, "mean_token_accuracy": 0.22064916044473648, "num_tokens": 48940235.0, "step": 21365 }, { "entropy": 5.645768165588379, "epoch": 2.112495057334915, "grad_norm": 1.0703125, "learning_rate": 0.0004556121874215191, "loss": 4.9745, "mean_token_accuracy": 0.21920240223407744, "num_tokens": 48951718.0, "step": 21370 }, { "entropy": 5.643590927124023, "epoch": 2.1129893238434163, "grad_norm": 1.1171875, "learning_rate": 0.0004555911398432627, "loss": 4.9577, "mean_token_accuracy": 0.2176239550113678, "num_tokens": 48963215.0, "step": 21375 }, { "entropy": 5.718164396286011, "epoch": 2.1134835903519176, "grad_norm": 1.015625, "learning_rate": 0.00045557008782243626, "loss": 5.0684, "mean_token_accuracy": 0.2136334538459778, "num_tokens": 48975761.0, "step": 21380 }, { "entropy": 5.641120100021363, "epoch": 2.1139778568604193, "grad_norm": 0.96875, "learning_rate": 0.0004555490313595575, "loss": 4.9746, "mean_token_accuracy": 0.22332814633846282, "num_tokens": 48987192.0, "step": 21385 }, { "entropy": 5.580223798751831, "epoch": 2.1144721233689205, "grad_norm": 1.0, "learning_rate": 0.0004555279704551447, "loss": 4.934, "mean_token_accuracy": 0.21804456561803817, "num_tokens": 48999503.0, "step": 21390 }, { "entropy": 5.631662130355835, "epoch": 2.114966389877422, "grad_norm": 1.109375, "learning_rate": 0.0004555069051097158, "loss": 5.0112, "mean_token_accuracy": 0.21067973375320434, "num_tokens": 49010046.0, "step": 21395 }, { "entropy": 5.651467227935791, "epoch": 2.115460656385923, "grad_norm": 1.046875, "learning_rate": 0.00045548583532378903, "loss": 5.0007, "mean_token_accuracy": 0.22020939290523528, "num_tokens": 49021028.0, "step": 21400 }, { "entropy": 5.703426933288574, "epoch": 2.1159549228944248, "grad_norm": 1.078125, "learning_rate": 0.0004554647610978827, "loss": 5.1131, "mean_token_accuracy": 0.21216829121112823, "num_tokens": 49034522.0, "step": 21405 }, { "entropy": 5.730159282684326, "epoch": 2.116449189402926, "grad_norm": 1.0703125, "learning_rate": 0.0004554436824325152, "loss": 5.0587, "mean_token_accuracy": 0.21673103272914887, "num_tokens": 49045034.0, "step": 21410 }, { "entropy": 5.621622896194458, "epoch": 2.1169434559114273, "grad_norm": 1.1328125, "learning_rate": 0.00045542259932820515, "loss": 5.0185, "mean_token_accuracy": 0.21675456464290618, "num_tokens": 49056350.0, "step": 21415 }, { "entropy": 5.647717761993408, "epoch": 2.117437722419929, "grad_norm": 1.1171875, "learning_rate": 0.0004554015117854712, "loss": 5.0369, "mean_token_accuracy": 0.21650834232568741, "num_tokens": 49067362.0, "step": 21420 }, { "entropy": 5.644987106323242, "epoch": 2.1179319889284303, "grad_norm": 1.03125, "learning_rate": 0.0004553804198048321, "loss": 5.0012, "mean_token_accuracy": 0.2159202739596367, "num_tokens": 49078067.0, "step": 21425 }, { "entropy": 5.595560121536255, "epoch": 2.1184262554369315, "grad_norm": 1.109375, "learning_rate": 0.00045535932338680655, "loss": 4.9989, "mean_token_accuracy": 0.2183430403470993, "num_tokens": 49090205.0, "step": 21430 }, { "entropy": 5.588483667373657, "epoch": 2.118920521945433, "grad_norm": 1.1328125, "learning_rate": 0.0004553382225319138, "loss": 4.978, "mean_token_accuracy": 0.21822975426912308, "num_tokens": 49101134.0, "step": 21435 }, { "entropy": 5.68566484451294, "epoch": 2.1194147884539345, "grad_norm": 1.203125, "learning_rate": 0.0004553171172406728, "loss": 5.0115, "mean_token_accuracy": 0.21091445833444594, "num_tokens": 49112282.0, "step": 21440 }, { "entropy": 5.637170743942261, "epoch": 2.1199090549624358, "grad_norm": 1.0546875, "learning_rate": 0.0004552960075136027, "loss": 4.9647, "mean_token_accuracy": 0.21583682149648667, "num_tokens": 49123228.0, "step": 21445 }, { "entropy": 5.6031959533691404, "epoch": 2.120403321470937, "grad_norm": 1.1015625, "learning_rate": 0.00045527489335122284, "loss": 4.9797, "mean_token_accuracy": 0.2167018696665764, "num_tokens": 49134769.0, "step": 21450 }, { "entropy": 5.559924745559693, "epoch": 2.1208975879794387, "grad_norm": 1.0390625, "learning_rate": 0.00045525377475405266, "loss": 4.9023, "mean_token_accuracy": 0.23155401200056075, "num_tokens": 49146096.0, "step": 21455 }, { "entropy": 5.6534138202667235, "epoch": 2.12139185448794, "grad_norm": 1.078125, "learning_rate": 0.00045523265172261155, "loss": 5.0058, "mean_token_accuracy": 0.21082258373498916, "num_tokens": 49156829.0, "step": 21460 }, { "entropy": 5.630233192443848, "epoch": 2.1218861209964412, "grad_norm": 1.1796875, "learning_rate": 0.00045521152425741934, "loss": 5.0498, "mean_token_accuracy": 0.2165581241250038, "num_tokens": 49167364.0, "step": 21465 }, { "entropy": 5.696925115585327, "epoch": 2.1223803875049425, "grad_norm": 1.1640625, "learning_rate": 0.00045519039235899573, "loss": 5.041, "mean_token_accuracy": 0.2169329822063446, "num_tokens": 49178283.0, "step": 21470 }, { "entropy": 5.768008708953857, "epoch": 2.122874654013444, "grad_norm": 0.95703125, "learning_rate": 0.00045516925602786043, "loss": 5.0906, "mean_token_accuracy": 0.21194446980953216, "num_tokens": 49190466.0, "step": 21475 }, { "entropy": 5.638028001785278, "epoch": 2.1233689205219455, "grad_norm": 0.96875, "learning_rate": 0.0004551481152645335, "loss": 4.9731, "mean_token_accuracy": 0.21756818592548371, "num_tokens": 49202601.0, "step": 21480 }, { "entropy": 5.531018924713135, "epoch": 2.1238631870304467, "grad_norm": 1.0390625, "learning_rate": 0.00045512697006953504, "loss": 4.8465, "mean_token_accuracy": 0.22627948820590973, "num_tokens": 49214228.0, "step": 21485 }, { "entropy": 5.55597448348999, "epoch": 2.124357453538948, "grad_norm": 1.046875, "learning_rate": 0.00045510582044338513, "loss": 4.9667, "mean_token_accuracy": 0.21313206255435943, "num_tokens": 49225495.0, "step": 21490 }, { "entropy": 5.644659328460693, "epoch": 2.1248517200474497, "grad_norm": 1.0625, "learning_rate": 0.000455084666386604, "loss": 5.0046, "mean_token_accuracy": 0.21568795293569565, "num_tokens": 49237348.0, "step": 21495 }, { "entropy": 5.683156824111938, "epoch": 2.125345986555951, "grad_norm": 1.0703125, "learning_rate": 0.00045506350789971227, "loss": 5.0465, "mean_token_accuracy": 0.20792530477046967, "num_tokens": 49247691.0, "step": 21500 }, { "entropy": 5.590653610229492, "epoch": 2.1258402530644522, "grad_norm": 1.140625, "learning_rate": 0.0004550423449832302, "loss": 4.9784, "mean_token_accuracy": 0.22258145064115525, "num_tokens": 49259191.0, "step": 21505 }, { "entropy": 5.666344118118286, "epoch": 2.126334519572954, "grad_norm": 1.0546875, "learning_rate": 0.0004550211776376787, "loss": 4.9652, "mean_token_accuracy": 0.2176661431789398, "num_tokens": 49271760.0, "step": 21510 }, { "entropy": 5.670879697799682, "epoch": 2.126828786081455, "grad_norm": 1.0625, "learning_rate": 0.00045500000586357807, "loss": 5.0843, "mean_token_accuracy": 0.21370499283075334, "num_tokens": 49283918.0, "step": 21515 }, { "entropy": 5.639508056640625, "epoch": 2.1273230525899565, "grad_norm": 1.046875, "learning_rate": 0.00045497882966144955, "loss": 4.926, "mean_token_accuracy": 0.22255134731531143, "num_tokens": 49294313.0, "step": 21520 }, { "entropy": 5.571183586120606, "epoch": 2.1278173190984577, "grad_norm": 1.0546875, "learning_rate": 0.0004549576490318138, "loss": 4.9522, "mean_token_accuracy": 0.21616321057081223, "num_tokens": 49305213.0, "step": 21525 }, { "entropy": 5.6119873046875, "epoch": 2.1283115856069594, "grad_norm": 1.078125, "learning_rate": 0.000454936463975192, "loss": 4.9436, "mean_token_accuracy": 0.22240554094314574, "num_tokens": 49317245.0, "step": 21530 }, { "entropy": 5.719055843353272, "epoch": 2.1288058521154607, "grad_norm": 1.0546875, "learning_rate": 0.0004549152744921053, "loss": 5.0733, "mean_token_accuracy": 0.20729273706674575, "num_tokens": 49328400.0, "step": 21535 }, { "entropy": 5.740843725204468, "epoch": 2.129300118623962, "grad_norm": 0.99609375, "learning_rate": 0.0004548940805830749, "loss": 5.0843, "mean_token_accuracy": 0.20744290500879287, "num_tokens": 49341094.0, "step": 21540 }, { "entropy": 5.635720109939575, "epoch": 2.129794385132463, "grad_norm": 1.03125, "learning_rate": 0.00045487288224862224, "loss": 4.9791, "mean_token_accuracy": 0.21727656275033952, "num_tokens": 49352472.0, "step": 21545 }, { "entropy": 5.573558235168457, "epoch": 2.130288651640965, "grad_norm": 1.09375, "learning_rate": 0.00045485167948926876, "loss": 4.9664, "mean_token_accuracy": 0.21765517443418503, "num_tokens": 49362432.0, "step": 21550 }, { "entropy": 5.596670818328858, "epoch": 2.130782918149466, "grad_norm": 1.1328125, "learning_rate": 0.000454830472305536, "loss": 4.98, "mean_token_accuracy": 0.22480798065662383, "num_tokens": 49373857.0, "step": 21555 }, { "entropy": 5.667988204956055, "epoch": 2.1312771846579674, "grad_norm": 1.046875, "learning_rate": 0.0004548092606979458, "loss": 5.043, "mean_token_accuracy": 0.2161017045378685, "num_tokens": 49387545.0, "step": 21560 }, { "entropy": 5.662838745117187, "epoch": 2.131771451166469, "grad_norm": 1.0625, "learning_rate": 0.00045478804466701984, "loss": 5.0131, "mean_token_accuracy": 0.21660160422325134, "num_tokens": 49398273.0, "step": 21565 }, { "entropy": 5.650055360794068, "epoch": 2.1322657176749704, "grad_norm": 1.09375, "learning_rate": 0.00045476682421328015, "loss": 4.99, "mean_token_accuracy": 0.21125394552946092, "num_tokens": 49408662.0, "step": 21570 }, { "entropy": 5.668147087097168, "epoch": 2.1327599841834717, "grad_norm": 1.15625, "learning_rate": 0.00045474559933724866, "loss": 5.0997, "mean_token_accuracy": 0.21337754875421525, "num_tokens": 49421189.0, "step": 21575 }, { "entropy": 5.687134552001953, "epoch": 2.133254250691973, "grad_norm": 1.140625, "learning_rate": 0.00045472437003944753, "loss": 5.0561, "mean_token_accuracy": 0.2158006325364113, "num_tokens": 49432878.0, "step": 21580 }, { "entropy": 5.68028712272644, "epoch": 2.1337485172004746, "grad_norm": 1.1484375, "learning_rate": 0.0004547031363203991, "loss": 5.0673, "mean_token_accuracy": 0.21448256969451904, "num_tokens": 49444058.0, "step": 21585 }, { "entropy": 5.646247100830078, "epoch": 2.134242783708976, "grad_norm": 1.09375, "learning_rate": 0.00045468189818062554, "loss": 5.0012, "mean_token_accuracy": 0.20970974415540694, "num_tokens": 49456602.0, "step": 21590 }, { "entropy": 5.670156526565552, "epoch": 2.134737050217477, "grad_norm": 1.1953125, "learning_rate": 0.0004546606556206494, "loss": 5.0061, "mean_token_accuracy": 0.21191326081752776, "num_tokens": 49467287.0, "step": 21595 }, { "entropy": 5.641109991073608, "epoch": 2.135231316725979, "grad_norm": 1.125, "learning_rate": 0.0004546394086409933, "loss": 4.956, "mean_token_accuracy": 0.21748731136322022, "num_tokens": 49478662.0, "step": 21600 }, { "entropy": 5.627913570404052, "epoch": 2.13572558323448, "grad_norm": 1.1484375, "learning_rate": 0.00045461815724217984, "loss": 5.0391, "mean_token_accuracy": 0.2139389246702194, "num_tokens": 49489365.0, "step": 21605 }, { "entropy": 5.689600324630737, "epoch": 2.1362198497429814, "grad_norm": 1.0625, "learning_rate": 0.00045459690142473193, "loss": 5.0673, "mean_token_accuracy": 0.20628269016742706, "num_tokens": 49501318.0, "step": 21610 }, { "entropy": 5.660380744934082, "epoch": 2.1367141162514827, "grad_norm": 1.09375, "learning_rate": 0.0004545756411891723, "loss": 5.0481, "mean_token_accuracy": 0.20921465903520584, "num_tokens": 49512138.0, "step": 21615 }, { "entropy": 5.689916038513184, "epoch": 2.1372083827599844, "grad_norm": 1.125, "learning_rate": 0.0004545543765360241, "loss": 4.9918, "mean_token_accuracy": 0.21490930914878845, "num_tokens": 49523325.0, "step": 21620 }, { "entropy": 5.611585664749145, "epoch": 2.1377026492684856, "grad_norm": 1.09375, "learning_rate": 0.00045453310746581036, "loss": 4.9349, "mean_token_accuracy": 0.2220182940363884, "num_tokens": 49535382.0, "step": 21625 }, { "entropy": 5.604008436203003, "epoch": 2.138196915776987, "grad_norm": 1.09375, "learning_rate": 0.0004545118339790543, "loss": 4.9168, "mean_token_accuracy": 0.22366950511932374, "num_tokens": 49546151.0, "step": 21630 }, { "entropy": 5.614528560638428, "epoch": 2.138691182285488, "grad_norm": 1.046875, "learning_rate": 0.0004544905560762793, "loss": 4.9959, "mean_token_accuracy": 0.220633564889431, "num_tokens": 49558617.0, "step": 21635 }, { "entropy": 5.63063497543335, "epoch": 2.13918544879399, "grad_norm": 1.234375, "learning_rate": 0.00045446927375800876, "loss": 4.9419, "mean_token_accuracy": 0.2289588764309883, "num_tokens": 49568494.0, "step": 21640 }, { "entropy": 5.635165452957153, "epoch": 2.139679715302491, "grad_norm": 1.1328125, "learning_rate": 0.00045444798702476625, "loss": 4.9937, "mean_token_accuracy": 0.22235831916332244, "num_tokens": 49579763.0, "step": 21645 }, { "entropy": 5.597065401077271, "epoch": 2.1401739818109924, "grad_norm": 1.046875, "learning_rate": 0.0004544266958770755, "loss": 4.9354, "mean_token_accuracy": 0.21802193820476531, "num_tokens": 49591631.0, "step": 21650 }, { "entropy": 5.650187253952026, "epoch": 2.1406682483194936, "grad_norm": 0.99609375, "learning_rate": 0.00045440540031546004, "loss": 5.0101, "mean_token_accuracy": 0.21588210612535477, "num_tokens": 49603458.0, "step": 21655 }, { "entropy": 5.628285360336304, "epoch": 2.1411625148279954, "grad_norm": 1.09375, "learning_rate": 0.00045438410034044397, "loss": 4.9664, "mean_token_accuracy": 0.22002998888492584, "num_tokens": 49614076.0, "step": 21660 }, { "entropy": 5.652142477035523, "epoch": 2.1416567813364966, "grad_norm": 1.1171875, "learning_rate": 0.00045436279595255125, "loss": 5.0768, "mean_token_accuracy": 0.21290842443704605, "num_tokens": 49624982.0, "step": 21665 }, { "entropy": 5.630671644210816, "epoch": 2.142151047844998, "grad_norm": 1.1015625, "learning_rate": 0.0004543414871523059, "loss": 4.9537, "mean_token_accuracy": 0.21931060701608657, "num_tokens": 49635897.0, "step": 21670 }, { "entropy": 5.628613138198853, "epoch": 2.1426453143534996, "grad_norm": 1.0703125, "learning_rate": 0.0004543201739402321, "loss": 4.9686, "mean_token_accuracy": 0.21775830537080765, "num_tokens": 49647023.0, "step": 21675 }, { "entropy": 5.638038444519043, "epoch": 2.143139580862001, "grad_norm": 1.0546875, "learning_rate": 0.00045429885631685424, "loss": 5.0576, "mean_token_accuracy": 0.20432451069355012, "num_tokens": 49658578.0, "step": 21680 }, { "entropy": 5.653888893127442, "epoch": 2.143633847370502, "grad_norm": 0.9375, "learning_rate": 0.0004542775342826967, "loss": 4.9749, "mean_token_accuracy": 0.21984683275222777, "num_tokens": 49670978.0, "step": 21685 }, { "entropy": 5.578224086761475, "epoch": 2.1441281138790034, "grad_norm": 1.015625, "learning_rate": 0.00045425620783828396, "loss": 4.9981, "mean_token_accuracy": 0.21594302207231522, "num_tokens": 49682553.0, "step": 21690 }, { "entropy": 5.64458818435669, "epoch": 2.144622380387505, "grad_norm": 0.984375, "learning_rate": 0.0004542348769841407, "loss": 4.9842, "mean_token_accuracy": 0.22028686702251435, "num_tokens": 49694589.0, "step": 21695 }, { "entropy": 5.650266981124878, "epoch": 2.1451166468960063, "grad_norm": 1.0546875, "learning_rate": 0.00045421354172079173, "loss": 5.0279, "mean_token_accuracy": 0.21618122905492781, "num_tokens": 49706530.0, "step": 21700 }, { "entropy": 5.607585000991821, "epoch": 2.1456109134045076, "grad_norm": 1.109375, "learning_rate": 0.00045419220204876175, "loss": 5.0033, "mean_token_accuracy": 0.21740746796131133, "num_tokens": 49718524.0, "step": 21705 }, { "entropy": 5.639693546295166, "epoch": 2.1461051799130093, "grad_norm": 1.125, "learning_rate": 0.00045417085796857596, "loss": 5.0068, "mean_token_accuracy": 0.2152506470680237, "num_tokens": 49729555.0, "step": 21710 }, { "entropy": 5.6691991806030275, "epoch": 2.1465994464215106, "grad_norm": 1.171875, "learning_rate": 0.00045414950948075906, "loss": 5.0494, "mean_token_accuracy": 0.21223363876342774, "num_tokens": 49739708.0, "step": 21715 }, { "entropy": 5.681228256225586, "epoch": 2.147093712930012, "grad_norm": 1.0703125, "learning_rate": 0.00045412815658583657, "loss": 5.0476, "mean_token_accuracy": 0.21409208327531815, "num_tokens": 49750997.0, "step": 21720 }, { "entropy": 5.602482318878174, "epoch": 2.147587979438513, "grad_norm": 1.1171875, "learning_rate": 0.0004541067992843336, "loss": 4.9879, "mean_token_accuracy": 0.22401541471481323, "num_tokens": 49761508.0, "step": 21725 }, { "entropy": 5.644294548034668, "epoch": 2.148082245947015, "grad_norm": 1.1953125, "learning_rate": 0.00045408543757677555, "loss": 4.9027, "mean_token_accuracy": 0.22139550894498825, "num_tokens": 49772821.0, "step": 21730 }, { "entropy": 5.556284666061401, "epoch": 2.148576512455516, "grad_norm": 1.1328125, "learning_rate": 0.000454064071463688, "loss": 4.9096, "mean_token_accuracy": 0.2241299644112587, "num_tokens": 49783932.0, "step": 21735 }, { "entropy": 5.6272820949554445, "epoch": 2.1490707789640173, "grad_norm": 1.046875, "learning_rate": 0.0004540427009455965, "loss": 4.9905, "mean_token_accuracy": 0.21326961368322372, "num_tokens": 49795126.0, "step": 21740 }, { "entropy": 5.627553033828735, "epoch": 2.1495650454725186, "grad_norm": 1.0078125, "learning_rate": 0.0004540213260230267, "loss": 4.9976, "mean_token_accuracy": 0.21134135872125626, "num_tokens": 49806110.0, "step": 21745 }, { "entropy": 5.71685562133789, "epoch": 2.1500593119810203, "grad_norm": 1.0546875, "learning_rate": 0.0004539999466965046, "loss": 5.1265, "mean_token_accuracy": 0.20695742219686508, "num_tokens": 49818879.0, "step": 21750 }, { "entropy": 5.661255693435669, "epoch": 2.1505535784895216, "grad_norm": 1.0625, "learning_rate": 0.00045397856296655603, "loss": 4.9667, "mean_token_accuracy": 0.21782406121492387, "num_tokens": 49828986.0, "step": 21755 }, { "entropy": 5.647045564651489, "epoch": 2.151047844998023, "grad_norm": 1.0078125, "learning_rate": 0.00045395717483370703, "loss": 5.032, "mean_token_accuracy": 0.21559846997261048, "num_tokens": 49841987.0, "step": 21760 }, { "entropy": 5.610520267486573, "epoch": 2.1515421115065245, "grad_norm": 1.0546875, "learning_rate": 0.00045393578229848373, "loss": 5.0292, "mean_token_accuracy": 0.21143033355474472, "num_tokens": 49854151.0, "step": 21765 }, { "entropy": 5.660473823547363, "epoch": 2.152036378015026, "grad_norm": 1.125, "learning_rate": 0.00045391438536141257, "loss": 5.0439, "mean_token_accuracy": 0.21628856807947158, "num_tokens": 49866531.0, "step": 21770 }, { "entropy": 5.6451061248779295, "epoch": 2.152530644523527, "grad_norm": 1.1328125, "learning_rate": 0.00045389298402301965, "loss": 4.9544, "mean_token_accuracy": 0.22130872011184693, "num_tokens": 49877737.0, "step": 21775 }, { "entropy": 5.731892061233521, "epoch": 2.1530249110320283, "grad_norm": 1.09375, "learning_rate": 0.0004538715782838316, "loss": 5.0497, "mean_token_accuracy": 0.20574968457221984, "num_tokens": 49889214.0, "step": 21780 }, { "entropy": 5.6572154521942135, "epoch": 2.15351917754053, "grad_norm": 1.0859375, "learning_rate": 0.00045385016814437494, "loss": 5.0213, "mean_token_accuracy": 0.2188189819455147, "num_tokens": 49900293.0, "step": 21785 }, { "entropy": 5.709380769729615, "epoch": 2.1540134440490313, "grad_norm": 1.0, "learning_rate": 0.00045382875360517645, "loss": 5.0974, "mean_token_accuracy": 0.2023204281926155, "num_tokens": 49912193.0, "step": 21790 }, { "entropy": 5.705944442749024, "epoch": 2.1545077105575325, "grad_norm": 1.078125, "learning_rate": 0.0004538073346667628, "loss": 4.9875, "mean_token_accuracy": 0.22009722292423248, "num_tokens": 49922780.0, "step": 21795 }, { "entropy": 5.597604417800904, "epoch": 2.155001977066034, "grad_norm": 1.1328125, "learning_rate": 0.00045378591132966105, "loss": 4.958, "mean_token_accuracy": 0.21570774167776108, "num_tokens": 49934551.0, "step": 21800 }, { "entropy": 5.6567998886108395, "epoch": 2.1554962435745355, "grad_norm": 1.0, "learning_rate": 0.0004537644835943982, "loss": 5.0059, "mean_token_accuracy": 0.21579796373844146, "num_tokens": 49945779.0, "step": 21805 }, { "entropy": 5.584072160720825, "epoch": 2.1559905100830368, "grad_norm": 1.109375, "learning_rate": 0.0004537430514615012, "loss": 4.8754, "mean_token_accuracy": 0.22672225683927535, "num_tokens": 49957127.0, "step": 21810 }, { "entropy": 5.611971473693847, "epoch": 2.156484776591538, "grad_norm": 1.109375, "learning_rate": 0.00045372161493149746, "loss": 4.969, "mean_token_accuracy": 0.21689440160989762, "num_tokens": 49968679.0, "step": 21815 }, { "entropy": 5.627978277206421, "epoch": 2.1569790431000397, "grad_norm": 1.0625, "learning_rate": 0.0004537001740049142, "loss": 4.9784, "mean_token_accuracy": 0.21968361586332322, "num_tokens": 49979924.0, "step": 21820 }, { "entropy": 5.6861762523651125, "epoch": 2.157473309608541, "grad_norm": 1.1015625, "learning_rate": 0.000453678728682279, "loss": 5.0066, "mean_token_accuracy": 0.21664040088653563, "num_tokens": 49991318.0, "step": 21825 }, { "entropy": 5.4896852493286135, "epoch": 2.1579675761170423, "grad_norm": 1.0390625, "learning_rate": 0.0004536572789641193, "loss": 4.9092, "mean_token_accuracy": 0.22200099974870682, "num_tokens": 50003096.0, "step": 21830 }, { "entropy": 5.569819021224975, "epoch": 2.1584618426255435, "grad_norm": 1.0859375, "learning_rate": 0.00045363582485096295, "loss": 4.9627, "mean_token_accuracy": 0.21801090687513353, "num_tokens": 50013953.0, "step": 21835 }, { "entropy": 5.646777963638305, "epoch": 2.1589561091340452, "grad_norm": 1.1015625, "learning_rate": 0.0004536143663433375, "loss": 4.973, "mean_token_accuracy": 0.22065008133649827, "num_tokens": 50025696.0, "step": 21840 }, { "entropy": 5.666622304916382, "epoch": 2.1594503756425465, "grad_norm": 1.125, "learning_rate": 0.00045359290344177094, "loss": 4.9782, "mean_token_accuracy": 0.21890347748994826, "num_tokens": 50036880.0, "step": 21845 }, { "entropy": 5.624815130233765, "epoch": 2.1599446421510478, "grad_norm": 1.125, "learning_rate": 0.0004535714361467913, "loss": 5.0353, "mean_token_accuracy": 0.21481664776802062, "num_tokens": 50048746.0, "step": 21850 }, { "entropy": 5.588080024719238, "epoch": 2.1604389086595495, "grad_norm": 1.125, "learning_rate": 0.0004535499644589266, "loss": 4.9632, "mean_token_accuracy": 0.22443701028823854, "num_tokens": 50060711.0, "step": 21855 }, { "entropy": 5.652092313766479, "epoch": 2.1609331751680507, "grad_norm": 1.2265625, "learning_rate": 0.00045352848837870496, "loss": 4.9539, "mean_token_accuracy": 0.21888331025838853, "num_tokens": 50071878.0, "step": 21860 }, { "entropy": 5.694894409179687, "epoch": 2.161427441676552, "grad_norm": 1.046875, "learning_rate": 0.000453507007906655, "loss": 5.022, "mean_token_accuracy": 0.21179139465093613, "num_tokens": 50084600.0, "step": 21865 }, { "entropy": 5.5414904117584225, "epoch": 2.1619217081850532, "grad_norm": 0.96875, "learning_rate": 0.0004534855230433048, "loss": 4.8916, "mean_token_accuracy": 0.22710329592227935, "num_tokens": 50095814.0, "step": 21870 }, { "entropy": 5.599045896530152, "epoch": 2.162415974693555, "grad_norm": 1.0546875, "learning_rate": 0.00045346403378918314, "loss": 5.0222, "mean_token_accuracy": 0.21904779374599456, "num_tokens": 50108390.0, "step": 21875 }, { "entropy": 5.631582307815552, "epoch": 2.162910241202056, "grad_norm": 1.0703125, "learning_rate": 0.0004534425401448185, "loss": 5.0602, "mean_token_accuracy": 0.21365441679954528, "num_tokens": 50118939.0, "step": 21880 }, { "entropy": 5.595835494995117, "epoch": 2.1634045077105575, "grad_norm": 1.1015625, "learning_rate": 0.0004534210421107397, "loss": 4.9555, "mean_token_accuracy": 0.22360922396183014, "num_tokens": 50129510.0, "step": 21885 }, { "entropy": 5.595914840698242, "epoch": 2.1638987742190587, "grad_norm": 1.1171875, "learning_rate": 0.0004533995396874756, "loss": 4.9831, "mean_token_accuracy": 0.22330474853515625, "num_tokens": 50140611.0, "step": 21890 }, { "entropy": 5.641322612762451, "epoch": 2.1643930407275604, "grad_norm": 1.0625, "learning_rate": 0.00045337803287555525, "loss": 5.0296, "mean_token_accuracy": 0.21516034752130508, "num_tokens": 50152214.0, "step": 21895 }, { "entropy": 5.74531397819519, "epoch": 2.1648873072360617, "grad_norm": 0.96875, "learning_rate": 0.0004533565216755075, "loss": 5.1367, "mean_token_accuracy": 0.20491723269224166, "num_tokens": 50164201.0, "step": 21900 }, { "entropy": 5.626381874084473, "epoch": 2.165381573744563, "grad_norm": 1.125, "learning_rate": 0.0004533350060878615, "loss": 4.9743, "mean_token_accuracy": 0.22156866043806075, "num_tokens": 50176515.0, "step": 21905 }, { "entropy": 5.664905643463134, "epoch": 2.1658758402530642, "grad_norm": 1.171875, "learning_rate": 0.0004533134861131469, "loss": 5.0193, "mean_token_accuracy": 0.21336598098278045, "num_tokens": 50187624.0, "step": 21910 }, { "entropy": 5.517172145843506, "epoch": 2.166370106761566, "grad_norm": 1.0234375, "learning_rate": 0.0004532919617518929, "loss": 4.8562, "mean_token_accuracy": 0.22781997472047805, "num_tokens": 50199549.0, "step": 21915 }, { "entropy": 5.676529216766357, "epoch": 2.166864373270067, "grad_norm": 1.046875, "learning_rate": 0.00045327043300462887, "loss": 5.044, "mean_token_accuracy": 0.21444866359233855, "num_tokens": 50210920.0, "step": 21920 }, { "entropy": 5.626539039611816, "epoch": 2.1673586397785685, "grad_norm": 1.0703125, "learning_rate": 0.0004532488998718846, "loss": 4.9536, "mean_token_accuracy": 0.2275352358818054, "num_tokens": 50221335.0, "step": 21925 }, { "entropy": 5.608596229553223, "epoch": 2.16785290628707, "grad_norm": 0.96484375, "learning_rate": 0.00045322736235418973, "loss": 5.0392, "mean_token_accuracy": 0.21377147734165192, "num_tokens": 50235138.0, "step": 21930 }, { "entropy": 5.648913717269897, "epoch": 2.1683471727955714, "grad_norm": 1.109375, "learning_rate": 0.00045320582045207405, "loss": 4.9659, "mean_token_accuracy": 0.22183896601200104, "num_tokens": 50246454.0, "step": 21935 }, { "entropy": 5.683821344375611, "epoch": 2.1688414393040727, "grad_norm": 1.125, "learning_rate": 0.0004531842741660675, "loss": 5.0109, "mean_token_accuracy": 0.2130260467529297, "num_tokens": 50257591.0, "step": 21940 }, { "entropy": 5.660471963882446, "epoch": 2.169335705812574, "grad_norm": 1.046875, "learning_rate": 0.0004531627234967003, "loss": 4.9927, "mean_token_accuracy": 0.21873451322317122, "num_tokens": 50268557.0, "step": 21945 }, { "entropy": 5.691157293319702, "epoch": 2.1698299723210757, "grad_norm": 0.97265625, "learning_rate": 0.0004531411684445024, "loss": 5.1197, "mean_token_accuracy": 0.20806851536035537, "num_tokens": 50280617.0, "step": 21950 }, { "entropy": 5.603302145004273, "epoch": 2.170324238829577, "grad_norm": 1.0703125, "learning_rate": 0.00045311960901000403, "loss": 4.9579, "mean_token_accuracy": 0.21671452820301057, "num_tokens": 50292071.0, "step": 21955 }, { "entropy": 5.634258031845093, "epoch": 2.170818505338078, "grad_norm": 1.0234375, "learning_rate": 0.0004530980451937358, "loss": 4.9869, "mean_token_accuracy": 0.21541567295789718, "num_tokens": 50303389.0, "step": 21960 }, { "entropy": 5.635688400268554, "epoch": 2.17131277184658, "grad_norm": 1.015625, "learning_rate": 0.0004530764769962279, "loss": 5.05, "mean_token_accuracy": 0.22100289762020112, "num_tokens": 50315088.0, "step": 21965 }, { "entropy": 5.651118183135987, "epoch": 2.171807038355081, "grad_norm": 0.9453125, "learning_rate": 0.0004530549044180111, "loss": 4.9636, "mean_token_accuracy": 0.220535808801651, "num_tokens": 50326177.0, "step": 21970 }, { "entropy": 5.600054979324341, "epoch": 2.1723013048635824, "grad_norm": 1.0625, "learning_rate": 0.00045303332745961605, "loss": 4.9686, "mean_token_accuracy": 0.22103646248579026, "num_tokens": 50337333.0, "step": 21975 }, { "entropy": 5.671171712875366, "epoch": 2.1727955713720837, "grad_norm": 1.125, "learning_rate": 0.00045301174612157345, "loss": 4.998, "mean_token_accuracy": 0.21949263662099838, "num_tokens": 50348406.0, "step": 21980 }, { "entropy": 5.616403341293335, "epoch": 2.1732898378805854, "grad_norm": 1.0625, "learning_rate": 0.0004529901604044143, "loss": 4.9361, "mean_token_accuracy": 0.22730042040348053, "num_tokens": 50360057.0, "step": 21985 }, { "entropy": 5.671643400192261, "epoch": 2.1737841043890866, "grad_norm": 1.1171875, "learning_rate": 0.0004529685703086697, "loss": 4.9916, "mean_token_accuracy": 0.21968017667531967, "num_tokens": 50370355.0, "step": 21990 }, { "entropy": 5.643956518173217, "epoch": 2.174278370897588, "grad_norm": 1.0, "learning_rate": 0.00045294697583487056, "loss": 5.0082, "mean_token_accuracy": 0.21507970839738846, "num_tokens": 50382193.0, "step": 21995 }, { "entropy": 5.644825220108032, "epoch": 2.174772637406089, "grad_norm": 1.0703125, "learning_rate": 0.00045292537698354824, "loss": 4.9657, "mean_token_accuracy": 0.215004625916481, "num_tokens": 50394383.0, "step": 22000 }, { "entropy": 5.612366771697998, "epoch": 2.175266903914591, "grad_norm": 1.09375, "learning_rate": 0.000452903773755234, "loss": 4.9316, "mean_token_accuracy": 0.22849385142326356, "num_tokens": 50405006.0, "step": 22005 }, { "entropy": 5.679098176956177, "epoch": 2.175761170423092, "grad_norm": 0.96875, "learning_rate": 0.0004528821661504594, "loss": 5.0745, "mean_token_accuracy": 0.21529259234666825, "num_tokens": 50416940.0, "step": 22010 }, { "entropy": 5.637016820907593, "epoch": 2.1762554369315934, "grad_norm": 1.1015625, "learning_rate": 0.0004528605541697558, "loss": 5.0043, "mean_token_accuracy": 0.2183789148926735, "num_tokens": 50428506.0, "step": 22015 }, { "entropy": 5.6875998973846436, "epoch": 2.176749703440095, "grad_norm": 1.09375, "learning_rate": 0.00045283893781365513, "loss": 5.0433, "mean_token_accuracy": 0.2110864281654358, "num_tokens": 50440421.0, "step": 22020 }, { "entropy": 5.668367862701416, "epoch": 2.1772439699485964, "grad_norm": 1.109375, "learning_rate": 0.0004528173170826889, "loss": 5.0475, "mean_token_accuracy": 0.21114738285541534, "num_tokens": 50451819.0, "step": 22025 }, { "entropy": 5.775361347198486, "epoch": 2.1777382364570976, "grad_norm": 1.1484375, "learning_rate": 0.0004527956919773891, "loss": 5.1532, "mean_token_accuracy": 0.20011237263679504, "num_tokens": 50464382.0, "step": 22030 }, { "entropy": 5.707822370529175, "epoch": 2.178232502965599, "grad_norm": 1.125, "learning_rate": 0.0004527740624982877, "loss": 5.0219, "mean_token_accuracy": 0.21936631798744202, "num_tokens": 50474773.0, "step": 22035 }, { "entropy": 5.619495916366577, "epoch": 2.1787267694741006, "grad_norm": 1.0390625, "learning_rate": 0.00045275242864591683, "loss": 4.9489, "mean_token_accuracy": 0.22284717559814454, "num_tokens": 50485626.0, "step": 22040 }, { "entropy": 5.630292558670044, "epoch": 2.179221035982602, "grad_norm": 1.0703125, "learning_rate": 0.00045273079042080854, "loss": 4.9471, "mean_token_accuracy": 0.21731263399124146, "num_tokens": 50496130.0, "step": 22045 }, { "entropy": 5.629637765884399, "epoch": 2.179715302491103, "grad_norm": 1.1640625, "learning_rate": 0.00045270914782349534, "loss": 5.0385, "mean_token_accuracy": 0.2181318446993828, "num_tokens": 50506578.0, "step": 22050 }, { "entropy": 5.667500448226929, "epoch": 2.1802095689996044, "grad_norm": 1.078125, "learning_rate": 0.00045268750085450946, "loss": 5.1049, "mean_token_accuracy": 0.20530329048633575, "num_tokens": 50517398.0, "step": 22055 }, { "entropy": 5.594801425933838, "epoch": 2.180703835508106, "grad_norm": 1.1328125, "learning_rate": 0.0004526658495143835, "loss": 4.9024, "mean_token_accuracy": 0.2297630116343498, "num_tokens": 50528577.0, "step": 22060 }, { "entropy": 5.636479663848877, "epoch": 2.1811981020166074, "grad_norm": 1.078125, "learning_rate": 0.0004526441938036501, "loss": 4.9684, "mean_token_accuracy": 0.22255425304174423, "num_tokens": 50539118.0, "step": 22065 }, { "entropy": 5.655508041381836, "epoch": 2.1816923685251086, "grad_norm": 1.1015625, "learning_rate": 0.00045262253372284193, "loss": 5.0353, "mean_token_accuracy": 0.21686965376138687, "num_tokens": 50549934.0, "step": 22070 }, { "entropy": 5.637511587142944, "epoch": 2.1821866350336103, "grad_norm": 1.0546875, "learning_rate": 0.00045260086927249193, "loss": 4.9842, "mean_token_accuracy": 0.21996564269065857, "num_tokens": 50560661.0, "step": 22075 }, { "entropy": 5.648717403411865, "epoch": 2.1826809015421116, "grad_norm": 1.046875, "learning_rate": 0.000452579200453133, "loss": 5.0454, "mean_token_accuracy": 0.2059583455324173, "num_tokens": 50573304.0, "step": 22080 }, { "entropy": 5.677945375442505, "epoch": 2.183175168050613, "grad_norm": 1.1171875, "learning_rate": 0.0004525575272652981, "loss": 5.0395, "mean_token_accuracy": 0.20937439054250717, "num_tokens": 50584166.0, "step": 22085 }, { "entropy": 5.724975967407227, "epoch": 2.183669434559114, "grad_norm": 1.046875, "learning_rate": 0.0004525358497095206, "loss": 5.0181, "mean_token_accuracy": 0.20789888352155686, "num_tokens": 50596425.0, "step": 22090 }, { "entropy": 5.649881219863891, "epoch": 2.184163701067616, "grad_norm": 1.1875, "learning_rate": 0.00045251416778633354, "loss": 4.9518, "mean_token_accuracy": 0.22508205324411393, "num_tokens": 50607483.0, "step": 22095 }, { "entropy": 5.628113698959351, "epoch": 2.184657967576117, "grad_norm": 1.015625, "learning_rate": 0.00045249248149627046, "loss": 4.9361, "mean_token_accuracy": 0.22333286255598067, "num_tokens": 50619655.0, "step": 22100 }, { "entropy": 5.662592887878418, "epoch": 2.1851522340846183, "grad_norm": 1.1171875, "learning_rate": 0.00045247079083986485, "loss": 5.0399, "mean_token_accuracy": 0.20970261842012405, "num_tokens": 50631323.0, "step": 22105 }, { "entropy": 5.607187652587891, "epoch": 2.18564650059312, "grad_norm": 1.125, "learning_rate": 0.0004524490958176502, "loss": 4.941, "mean_token_accuracy": 0.22389119267463684, "num_tokens": 50642931.0, "step": 22110 }, { "entropy": 5.558671379089356, "epoch": 2.1861407671016213, "grad_norm": 0.984375, "learning_rate": 0.0004524273964301603, "loss": 4.9033, "mean_token_accuracy": 0.22713505625724792, "num_tokens": 50655396.0, "step": 22115 }, { "entropy": 5.611291694641113, "epoch": 2.1866350336101226, "grad_norm": 1.0234375, "learning_rate": 0.00045240569267792887, "loss": 5.0253, "mean_token_accuracy": 0.2204742968082428, "num_tokens": 50667264.0, "step": 22120 }, { "entropy": 5.571619606018066, "epoch": 2.187129300118624, "grad_norm": 0.9921875, "learning_rate": 0.00045238398456148995, "loss": 4.926, "mean_token_accuracy": 0.22592018246650697, "num_tokens": 50679073.0, "step": 22125 }, { "entropy": 5.659052467346191, "epoch": 2.1876235666271255, "grad_norm": 1.1484375, "learning_rate": 0.00045236227208137744, "loss": 5.0146, "mean_token_accuracy": 0.21489075124263762, "num_tokens": 50689554.0, "step": 22130 }, { "entropy": 5.719157457351685, "epoch": 2.188117833135627, "grad_norm": 1.046875, "learning_rate": 0.0004523405552381256, "loss": 5.0364, "mean_token_accuracy": 0.2110719934105873, "num_tokens": 50702419.0, "step": 22135 }, { "entropy": 5.638813066482544, "epoch": 2.188612099644128, "grad_norm": 1.0625, "learning_rate": 0.0004523188340322685, "loss": 4.9633, "mean_token_accuracy": 0.21964765042066575, "num_tokens": 50713016.0, "step": 22140 }, { "entropy": 5.672059011459351, "epoch": 2.1891063661526293, "grad_norm": 1.078125, "learning_rate": 0.0004522971084643406, "loss": 5.0405, "mean_token_accuracy": 0.2096104294061661, "num_tokens": 50723936.0, "step": 22145 }, { "entropy": 5.672735214233398, "epoch": 2.189600632661131, "grad_norm": 1.0859375, "learning_rate": 0.00045227537853487627, "loss": 4.9725, "mean_token_accuracy": 0.2199035704135895, "num_tokens": 50734339.0, "step": 22150 }, { "entropy": 5.710371828079223, "epoch": 2.1900948991696323, "grad_norm": 1.0078125, "learning_rate": 0.00045225364424441016, "loss": 5.08, "mean_token_accuracy": 0.2040013149380684, "num_tokens": 50746262.0, "step": 22155 }, { "entropy": 5.675328302383423, "epoch": 2.1905891656781336, "grad_norm": 0.984375, "learning_rate": 0.000452231905593477, "loss": 4.9785, "mean_token_accuracy": 0.2201933890581131, "num_tokens": 50758218.0, "step": 22160 }, { "entropy": 5.737107276916504, "epoch": 2.191083432186635, "grad_norm": 1.234375, "learning_rate": 0.0004522101625826113, "loss": 5.0744, "mean_token_accuracy": 0.20993250906467437, "num_tokens": 50769263.0, "step": 22165 }, { "entropy": 5.564160299301148, "epoch": 2.1915776986951365, "grad_norm": 1.171875, "learning_rate": 0.0004521884152123482, "loss": 4.8647, "mean_token_accuracy": 0.23291980475187302, "num_tokens": 50780049.0, "step": 22170 }, { "entropy": 5.601339101791382, "epoch": 2.192071965203638, "grad_norm": 1.0859375, "learning_rate": 0.0004521666634832227, "loss": 5.003, "mean_token_accuracy": 0.21563053429126738, "num_tokens": 50791817.0, "step": 22175 }, { "entropy": 5.619451665878296, "epoch": 2.192566231712139, "grad_norm": 1.1015625, "learning_rate": 0.0004521449073957697, "loss": 4.993, "mean_token_accuracy": 0.21952337473630906, "num_tokens": 50802669.0, "step": 22180 }, { "entropy": 5.675236701965332, "epoch": 2.1930604982206408, "grad_norm": 1.0390625, "learning_rate": 0.00045212314695052447, "loss": 5.0103, "mean_token_accuracy": 0.2183389037847519, "num_tokens": 50813920.0, "step": 22185 }, { "entropy": 5.692987298965454, "epoch": 2.193554764729142, "grad_norm": 1.1484375, "learning_rate": 0.00045210138214802227, "loss": 5.058, "mean_token_accuracy": 0.21045937687158583, "num_tokens": 50825828.0, "step": 22190 }, { "entropy": 5.672288417816162, "epoch": 2.1940490312376433, "grad_norm": 1.0546875, "learning_rate": 0.00045207961298879875, "loss": 5.0624, "mean_token_accuracy": 0.20568755269050598, "num_tokens": 50837425.0, "step": 22195 }, { "entropy": 5.681703996658325, "epoch": 2.1945432977461445, "grad_norm": 1.140625, "learning_rate": 0.0004520578394733892, "loss": 5.0068, "mean_token_accuracy": 0.22216037660837173, "num_tokens": 50848720.0, "step": 22200 }, { "entropy": 5.595181703567505, "epoch": 2.1950375642546462, "grad_norm": 1.0703125, "learning_rate": 0.00045203606160232936, "loss": 4.9615, "mean_token_accuracy": 0.21896006017923356, "num_tokens": 50860304.0, "step": 22205 }, { "entropy": 5.657786798477173, "epoch": 2.1955318307631475, "grad_norm": 1.1015625, "learning_rate": 0.0004520142793761549, "loss": 5.0203, "mean_token_accuracy": 0.20914703905582427, "num_tokens": 50872099.0, "step": 22210 }, { "entropy": 5.765751028060913, "epoch": 2.1960260972716488, "grad_norm": 0.96875, "learning_rate": 0.0004519924927954017, "loss": 5.1041, "mean_token_accuracy": 0.2108405977487564, "num_tokens": 50884116.0, "step": 22215 }, { "entropy": 5.646667432785034, "epoch": 2.1965203637801505, "grad_norm": 1.109375, "learning_rate": 0.0004519707018606059, "loss": 4.9214, "mean_token_accuracy": 0.22320738732814788, "num_tokens": 50896293.0, "step": 22220 }, { "entropy": 5.611848640441894, "epoch": 2.1970146302886517, "grad_norm": 1.046875, "learning_rate": 0.00045194890657230315, "loss": 4.9138, "mean_token_accuracy": 0.22903822958469391, "num_tokens": 50908633.0, "step": 22225 }, { "entropy": 5.630171203613282, "epoch": 2.197508896797153, "grad_norm": 1.046875, "learning_rate": 0.00045192710693103, "loss": 4.9479, "mean_token_accuracy": 0.22072465270757674, "num_tokens": 50919524.0, "step": 22230 }, { "entropy": 5.640546226501465, "epoch": 2.1980031633056543, "grad_norm": 1.0546875, "learning_rate": 0.0004519053029373224, "loss": 5.0196, "mean_token_accuracy": 0.21351983845233918, "num_tokens": 50930157.0, "step": 22235 }, { "entropy": 5.726377964019775, "epoch": 2.198497429814156, "grad_norm": 1.1328125, "learning_rate": 0.000451883494591717, "loss": 5.0899, "mean_token_accuracy": 0.21191806495189666, "num_tokens": 50942474.0, "step": 22240 }, { "entropy": 5.709763622283935, "epoch": 2.1989916963226572, "grad_norm": 1.0078125, "learning_rate": 0.00045186168189475026, "loss": 5.0668, "mean_token_accuracy": 0.20783522427082063, "num_tokens": 50954847.0, "step": 22245 }, { "entropy": 5.638669538497925, "epoch": 2.1994859628311585, "grad_norm": 0.9921875, "learning_rate": 0.0004518398648469586, "loss": 5.0494, "mean_token_accuracy": 0.21514272540807725, "num_tokens": 50966446.0, "step": 22250 }, { "entropy": 5.584299850463867, "epoch": 2.1999802293396598, "grad_norm": 1.03125, "learning_rate": 0.00045181804344887887, "loss": 4.993, "mean_token_accuracy": 0.22143091708421708, "num_tokens": 50977949.0, "step": 22255 }, { "entropy": 5.681093311309814, "epoch": 2.2004744958481615, "grad_norm": 1.0078125, "learning_rate": 0.00045179621770104786, "loss": 5.0329, "mean_token_accuracy": 0.21312574595212935, "num_tokens": 50989297.0, "step": 22260 }, { "entropy": 5.6770096778869625, "epoch": 2.2009687623566627, "grad_norm": 1.0, "learning_rate": 0.00045177438760400244, "loss": 5.0522, "mean_token_accuracy": 0.21251516938209533, "num_tokens": 51001616.0, "step": 22265 }, { "entropy": 5.680920505523682, "epoch": 2.201463028865164, "grad_norm": 1.0625, "learning_rate": 0.0004517525531582797, "loss": 5.0431, "mean_token_accuracy": 0.2150268405675888, "num_tokens": 51012870.0, "step": 22270 }, { "entropy": 5.623628616333008, "epoch": 2.2019572953736652, "grad_norm": 1.0703125, "learning_rate": 0.00045173071436441665, "loss": 4.9845, "mean_token_accuracy": 0.22150683552026748, "num_tokens": 51025368.0, "step": 22275 }, { "entropy": 5.657191133499145, "epoch": 2.202451561882167, "grad_norm": 1.1484375, "learning_rate": 0.0004517088712229507, "loss": 4.9628, "mean_token_accuracy": 0.218977253139019, "num_tokens": 51035964.0, "step": 22280 }, { "entropy": 5.6696672439575195, "epoch": 2.202945828390668, "grad_norm": 1.15625, "learning_rate": 0.00045168702373441904, "loss": 4.9824, "mean_token_accuracy": 0.21080860495567322, "num_tokens": 51048313.0, "step": 22285 }, { "entropy": 5.625257873535157, "epoch": 2.2034400948991695, "grad_norm": 1.1953125, "learning_rate": 0.00045166517189935924, "loss": 4.9829, "mean_token_accuracy": 0.2228904828429222, "num_tokens": 51060503.0, "step": 22290 }, { "entropy": 5.637003993988037, "epoch": 2.203934361407671, "grad_norm": 1.078125, "learning_rate": 0.00045164331571830875, "loss": 4.9003, "mean_token_accuracy": 0.2190896451473236, "num_tokens": 51070865.0, "step": 22295 }, { "entropy": 5.664429616928101, "epoch": 2.2044286279161724, "grad_norm": 1.078125, "learning_rate": 0.00045162145519180534, "loss": 5.0023, "mean_token_accuracy": 0.21651459187269212, "num_tokens": 51081158.0, "step": 22300 }, { "entropy": 5.578027629852295, "epoch": 2.2049228944246737, "grad_norm": 1.296875, "learning_rate": 0.0004515995903203867, "loss": 4.8849, "mean_token_accuracy": 0.23054795563220978, "num_tokens": 51090661.0, "step": 22305 }, { "entropy": 5.57456865310669, "epoch": 2.205417160933175, "grad_norm": 1.1796875, "learning_rate": 0.0004515777211045908, "loss": 4.9788, "mean_token_accuracy": 0.21539676636457444, "num_tokens": 51101825.0, "step": 22310 }, { "entropy": 5.610644674301147, "epoch": 2.2059114274416767, "grad_norm": 1.125, "learning_rate": 0.00045155584754495546, "loss": 5.015, "mean_token_accuracy": 0.21632042080163955, "num_tokens": 51114546.0, "step": 22315 }, { "entropy": 5.686025190353393, "epoch": 2.206405693950178, "grad_norm": 1.09375, "learning_rate": 0.0004515339696420189, "loss": 4.971, "mean_token_accuracy": 0.21759041547775268, "num_tokens": 51124888.0, "step": 22320 }, { "entropy": 5.5615733623504635, "epoch": 2.206899960458679, "grad_norm": 1.0234375, "learning_rate": 0.0004515120873963194, "loss": 4.9021, "mean_token_accuracy": 0.22509758025407792, "num_tokens": 51135892.0, "step": 22325 }, { "entropy": 5.647225475311279, "epoch": 2.207394226967181, "grad_norm": 1.0546875, "learning_rate": 0.0004514902008083951, "loss": 5.014, "mean_token_accuracy": 0.21233924627304077, "num_tokens": 51147513.0, "step": 22330 }, { "entropy": 5.666854476928711, "epoch": 2.207888493475682, "grad_norm": 1.1875, "learning_rate": 0.0004514683098787845, "loss": 5.0193, "mean_token_accuracy": 0.21820505261421203, "num_tokens": 51159514.0, "step": 22335 }, { "entropy": 5.685096216201782, "epoch": 2.2083827599841834, "grad_norm": 1.015625, "learning_rate": 0.0004514464146080261, "loss": 5.0654, "mean_token_accuracy": 0.2144334778189659, "num_tokens": 51171245.0, "step": 22340 }, { "entropy": 5.624295997619629, "epoch": 2.2088770264926847, "grad_norm": 1.1015625, "learning_rate": 0.00045142451499665846, "loss": 4.9905, "mean_token_accuracy": 0.22204509228467942, "num_tokens": 51182763.0, "step": 22345 }, { "entropy": 5.677038860321045, "epoch": 2.2093712930011864, "grad_norm": 1.078125, "learning_rate": 0.00045140261104522044, "loss": 5.0217, "mean_token_accuracy": 0.21245643645524978, "num_tokens": 51193811.0, "step": 22350 }, { "entropy": 5.617627048492432, "epoch": 2.2098655595096877, "grad_norm": 1.1953125, "learning_rate": 0.0004513807027542508, "loss": 4.9256, "mean_token_accuracy": 0.22626098096370698, "num_tokens": 51203963.0, "step": 22355 }, { "entropy": 5.609482717514038, "epoch": 2.210359826018189, "grad_norm": 1.0625, "learning_rate": 0.0004513587901242886, "loss": 4.9067, "mean_token_accuracy": 0.2241803675889969, "num_tokens": 51215128.0, "step": 22360 }, { "entropy": 5.580700445175171, "epoch": 2.21085409252669, "grad_norm": 1.0859375, "learning_rate": 0.00045133687315587263, "loss": 4.9432, "mean_token_accuracy": 0.22594606280326843, "num_tokens": 51226773.0, "step": 22365 }, { "entropy": 5.594133567810059, "epoch": 2.211348359035192, "grad_norm": 1.1640625, "learning_rate": 0.0004513149518495424, "loss": 4.9854, "mean_token_accuracy": 0.2172035649418831, "num_tokens": 51238226.0, "step": 22370 }, { "entropy": 5.656217956542969, "epoch": 2.211842625543693, "grad_norm": 1.140625, "learning_rate": 0.00045129302620583683, "loss": 5.0008, "mean_token_accuracy": 0.22127577513456345, "num_tokens": 51249096.0, "step": 22375 }, { "entropy": 5.680662488937378, "epoch": 2.2123368920521944, "grad_norm": 1.203125, "learning_rate": 0.00045127109622529563, "loss": 4.9951, "mean_token_accuracy": 0.2232608452439308, "num_tokens": 51259709.0, "step": 22380 }, { "entropy": 5.5715508460998535, "epoch": 2.212831158560696, "grad_norm": 1.1171875, "learning_rate": 0.00045124916190845797, "loss": 4.976, "mean_token_accuracy": 0.22865558713674544, "num_tokens": 51271787.0, "step": 22385 }, { "entropy": 5.673215627670288, "epoch": 2.2133254250691974, "grad_norm": 1.046875, "learning_rate": 0.00045122722325586373, "loss": 5.0271, "mean_token_accuracy": 0.21401347666978837, "num_tokens": 51284093.0, "step": 22390 }, { "entropy": 5.706920099258423, "epoch": 2.2138196915776986, "grad_norm": 1.0859375, "learning_rate": 0.00045120528026805235, "loss": 5.0269, "mean_token_accuracy": 0.21827742755413054, "num_tokens": 51295659.0, "step": 22395 }, { "entropy": 5.6794092655181885, "epoch": 2.2143139580862, "grad_norm": 1.046875, "learning_rate": 0.00045118333294556377, "loss": 5.0468, "mean_token_accuracy": 0.21142876744270325, "num_tokens": 51307960.0, "step": 22400 }, { "entropy": 5.581096935272217, "epoch": 2.2148082245947016, "grad_norm": 1.1015625, "learning_rate": 0.0004511613812889379, "loss": 4.9061, "mean_token_accuracy": 0.22600414454936982, "num_tokens": 51319366.0, "step": 22405 }, { "entropy": 5.583076333999633, "epoch": 2.215302491103203, "grad_norm": 1.140625, "learning_rate": 0.00045113942529871473, "loss": 4.9469, "mean_token_accuracy": 0.22197468727827072, "num_tokens": 51332445.0, "step": 22410 }, { "entropy": 5.605283975601196, "epoch": 2.215796757611704, "grad_norm": 1.0625, "learning_rate": 0.0004511174649754343, "loss": 4.9155, "mean_token_accuracy": 0.2230609431862831, "num_tokens": 51342900.0, "step": 22415 }, { "entropy": 5.6048516750335695, "epoch": 2.2162910241202054, "grad_norm": 1.03125, "learning_rate": 0.000451095500319637, "loss": 4.9838, "mean_token_accuracy": 0.22243473082780837, "num_tokens": 51354437.0, "step": 22420 }, { "entropy": 5.594480228424072, "epoch": 2.216785290628707, "grad_norm": 1.0546875, "learning_rate": 0.000451073531331863, "loss": 4.9069, "mean_token_accuracy": 0.2228037804365158, "num_tokens": 51364630.0, "step": 22425 }, { "entropy": 5.649523544311523, "epoch": 2.2172795571372084, "grad_norm": 0.9921875, "learning_rate": 0.0004510515580126528, "loss": 5.0741, "mean_token_accuracy": 0.2083497703075409, "num_tokens": 51376547.0, "step": 22430 }, { "entropy": 5.700908088684082, "epoch": 2.2177738236457096, "grad_norm": 1.1015625, "learning_rate": 0.000451029580362547, "loss": 5.0363, "mean_token_accuracy": 0.2199498012661934, "num_tokens": 51388704.0, "step": 22435 }, { "entropy": 5.811529207229614, "epoch": 2.2182680901542113, "grad_norm": 1.1796875, "learning_rate": 0.0004510075983820862, "loss": 5.1978, "mean_token_accuracy": 0.19749512374401093, "num_tokens": 51400884.0, "step": 22440 }, { "entropy": 5.640939378738404, "epoch": 2.2187623566627126, "grad_norm": 0.96875, "learning_rate": 0.00045098561207181114, "loss": 4.9041, "mean_token_accuracy": 0.23067692071199417, "num_tokens": 51412946.0, "step": 22445 }, { "entropy": 5.662036371231079, "epoch": 2.219256623171214, "grad_norm": 1.015625, "learning_rate": 0.0004509636214322628, "loss": 5.0517, "mean_token_accuracy": 0.21512101888656615, "num_tokens": 51425860.0, "step": 22450 }, { "entropy": 5.649212741851807, "epoch": 2.219750889679715, "grad_norm": 1.21875, "learning_rate": 0.0004509416264639821, "loss": 4.9906, "mean_token_accuracy": 0.21654520481824874, "num_tokens": 51438812.0, "step": 22455 }, { "entropy": 5.695921993255615, "epoch": 2.220245156188217, "grad_norm": 1.2890625, "learning_rate": 0.0004509196271675101, "loss": 5.0964, "mean_token_accuracy": 0.2097064048051834, "num_tokens": 51449881.0, "step": 22460 }, { "entropy": 5.608725595474243, "epoch": 2.220739422696718, "grad_norm": 1.0390625, "learning_rate": 0.00045089762354338784, "loss": 4.9545, "mean_token_accuracy": 0.21869312226772308, "num_tokens": 51460403.0, "step": 22465 }, { "entropy": 5.690785884857178, "epoch": 2.2212336892052194, "grad_norm": 1.1875, "learning_rate": 0.00045087561559215683, "loss": 5.001, "mean_token_accuracy": 0.2102307140827179, "num_tokens": 51471414.0, "step": 22470 }, { "entropy": 5.602718734741211, "epoch": 2.221727955713721, "grad_norm": 1.1015625, "learning_rate": 0.00045085360331435835, "loss": 4.9478, "mean_token_accuracy": 0.22205538749694825, "num_tokens": 51482855.0, "step": 22475 }, { "entropy": 5.702400398254395, "epoch": 2.2222222222222223, "grad_norm": 1.046875, "learning_rate": 0.000450831586710534, "loss": 5.0625, "mean_token_accuracy": 0.21329119354486464, "num_tokens": 51495363.0, "step": 22480 }, { "entropy": 5.653773546218872, "epoch": 2.2227164887307236, "grad_norm": 1.015625, "learning_rate": 0.00045080956578122535, "loss": 4.972, "mean_token_accuracy": 0.21495070457458496, "num_tokens": 51506678.0, "step": 22485 }, { "entropy": 5.654488945007325, "epoch": 2.223210755239225, "grad_norm": 1.015625, "learning_rate": 0.00045078754052697406, "loss": 5.0138, "mean_token_accuracy": 0.21856178045272828, "num_tokens": 51518596.0, "step": 22490 }, { "entropy": 5.709525537490845, "epoch": 2.2237050217477266, "grad_norm": 1.0859375, "learning_rate": 0.00045076551094832206, "loss": 5.1159, "mean_token_accuracy": 0.20502690076828003, "num_tokens": 51531292.0, "step": 22495 }, { "entropy": 5.6593663692474365, "epoch": 2.224199288256228, "grad_norm": 1.109375, "learning_rate": 0.00045074347704581114, "loss": 4.9644, "mean_token_accuracy": 0.22537117600440978, "num_tokens": 51542507.0, "step": 22500 }, { "entropy": 5.657744312286377, "epoch": 2.224693554764729, "grad_norm": 1.171875, "learning_rate": 0.00045072143881998345, "loss": 4.9882, "mean_token_accuracy": 0.2155720293521881, "num_tokens": 51553895.0, "step": 22505 }, { "entropy": 5.705785608291626, "epoch": 2.2251878212732303, "grad_norm": 0.97265625, "learning_rate": 0.0004506993962713812, "loss": 5.0807, "mean_token_accuracy": 0.2111979305744171, "num_tokens": 51566533.0, "step": 22510 }, { "entropy": 5.688817834854126, "epoch": 2.225682087781732, "grad_norm": 1.1640625, "learning_rate": 0.00045067734940054644, "loss": 5.0, "mean_token_accuracy": 0.21248604208230973, "num_tokens": 51576308.0, "step": 22515 }, { "entropy": 5.6117274284362795, "epoch": 2.2261763542902333, "grad_norm": 0.98828125, "learning_rate": 0.00045065529820802165, "loss": 4.9447, "mean_token_accuracy": 0.2170528531074524, "num_tokens": 51589844.0, "step": 22520 }, { "entropy": 5.629724407196045, "epoch": 2.2266706207987346, "grad_norm": 1.109375, "learning_rate": 0.00045063324269434924, "loss": 4.9311, "mean_token_accuracy": 0.22700488716363906, "num_tokens": 51601685.0, "step": 22525 }, { "entropy": 5.672740507125854, "epoch": 2.227164887307236, "grad_norm": 1.0703125, "learning_rate": 0.0004506111828600719, "loss": 4.9934, "mean_token_accuracy": 0.22276042997837067, "num_tokens": 51613258.0, "step": 22530 }, { "entropy": 5.6977897644042965, "epoch": 2.2276591538157375, "grad_norm": 1.1328125, "learning_rate": 0.0004505891187057322, "loss": 5.0285, "mean_token_accuracy": 0.22136635035276414, "num_tokens": 51624088.0, "step": 22535 }, { "entropy": 5.651932334899902, "epoch": 2.228153420324239, "grad_norm": 0.984375, "learning_rate": 0.0004505670502318729, "loss": 4.9792, "mean_token_accuracy": 0.2240745395421982, "num_tokens": 51636617.0, "step": 22540 }, { "entropy": 5.689702939987183, "epoch": 2.22864768683274, "grad_norm": 1.078125, "learning_rate": 0.00045054497743903687, "loss": 5.0451, "mean_token_accuracy": 0.20711152553558348, "num_tokens": 51647777.0, "step": 22545 }, { "entropy": 5.652089786529541, "epoch": 2.2291419533412418, "grad_norm": 1.0546875, "learning_rate": 0.0004505229003277673, "loss": 5.0521, "mean_token_accuracy": 0.20854245573282243, "num_tokens": 51660505.0, "step": 22550 }, { "entropy": 5.702612781524659, "epoch": 2.229636219849743, "grad_norm": 1.1484375, "learning_rate": 0.00045050081889860713, "loss": 4.9966, "mean_token_accuracy": 0.22267340123653412, "num_tokens": 51672296.0, "step": 22555 }, { "entropy": 5.649834060668946, "epoch": 2.2301304863582443, "grad_norm": 1.0625, "learning_rate": 0.00045047873315209945, "loss": 5.0137, "mean_token_accuracy": 0.22388536632061004, "num_tokens": 51684437.0, "step": 22560 }, { "entropy": 5.583037185668945, "epoch": 2.2306247528667456, "grad_norm": 1.140625, "learning_rate": 0.0004504566430887878, "loss": 4.8438, "mean_token_accuracy": 0.2330440565943718, "num_tokens": 51694919.0, "step": 22565 }, { "entropy": 5.60652174949646, "epoch": 2.2311190193752473, "grad_norm": 1.0390625, "learning_rate": 0.00045043454870921553, "loss": 4.9681, "mean_token_accuracy": 0.22372659891843796, "num_tokens": 51705273.0, "step": 22570 }, { "entropy": 5.668671989440918, "epoch": 2.2316132858837485, "grad_norm": 1.0703125, "learning_rate": 0.0004504124500139261, "loss": 5.0047, "mean_token_accuracy": 0.21230462938547134, "num_tokens": 51717048.0, "step": 22575 }, { "entropy": 5.7057915210723875, "epoch": 2.23210755239225, "grad_norm": 1.109375, "learning_rate": 0.0004503903470034632, "loss": 5.0706, "mean_token_accuracy": 0.21053809225559234, "num_tokens": 51729208.0, "step": 22580 }, { "entropy": 5.588547468185425, "epoch": 2.2326018189007515, "grad_norm": 1.234375, "learning_rate": 0.00045036823967837066, "loss": 4.9378, "mean_token_accuracy": 0.22529369443655015, "num_tokens": 51740393.0, "step": 22585 }, { "entropy": 5.661834716796875, "epoch": 2.2330960854092528, "grad_norm": 1.0859375, "learning_rate": 0.0004503461280391921, "loss": 5.0047, "mean_token_accuracy": 0.2206682503223419, "num_tokens": 51751044.0, "step": 22590 }, { "entropy": 5.686704683303833, "epoch": 2.233590351917754, "grad_norm": 1.265625, "learning_rate": 0.0004503240120864716, "loss": 5.0039, "mean_token_accuracy": 0.21298899501562119, "num_tokens": 51761969.0, "step": 22595 }, { "entropy": 5.644410610198975, "epoch": 2.2340846184262553, "grad_norm": 1.046875, "learning_rate": 0.0004503018918207532, "loss": 5.0276, "mean_token_accuracy": 0.21174830794334412, "num_tokens": 51774185.0, "step": 22600 }, { "entropy": 5.692815256118775, "epoch": 2.234578884934757, "grad_norm": 1.1171875, "learning_rate": 0.0004502797672425811, "loss": 4.9822, "mean_token_accuracy": 0.21953933089971542, "num_tokens": 51786155.0, "step": 22605 }, { "entropy": 5.666292905807495, "epoch": 2.2350731514432582, "grad_norm": 1.0390625, "learning_rate": 0.00045025763835249957, "loss": 5.0219, "mean_token_accuracy": 0.2182562306523323, "num_tokens": 51797125.0, "step": 22610 }, { "entropy": 5.718952798843384, "epoch": 2.2355674179517595, "grad_norm": 0.99609375, "learning_rate": 0.0004502355051510528, "loss": 5.1062, "mean_token_accuracy": 0.21430083513259887, "num_tokens": 51809046.0, "step": 22615 }, { "entropy": 5.703240919113159, "epoch": 2.2360616844602608, "grad_norm": 0.99609375, "learning_rate": 0.00045021336763878555, "loss": 5.152, "mean_token_accuracy": 0.2022416114807129, "num_tokens": 51821857.0, "step": 22620 }, { "entropy": 5.711896800994873, "epoch": 2.2365559509687625, "grad_norm": 1.3125, "learning_rate": 0.00045019122581624224, "loss": 4.9533, "mean_token_accuracy": 0.22200523167848588, "num_tokens": 51833504.0, "step": 22625 }, { "entropy": 5.612013530731201, "epoch": 2.2370502174772637, "grad_norm": 1.140625, "learning_rate": 0.00045016907968396764, "loss": 5.0253, "mean_token_accuracy": 0.21867602914571763, "num_tokens": 51844166.0, "step": 22630 }, { "entropy": 5.665346956253051, "epoch": 2.237544483985765, "grad_norm": 1.0703125, "learning_rate": 0.0004501469292425064, "loss": 5.0142, "mean_token_accuracy": 0.21681543290615082, "num_tokens": 51855674.0, "step": 22635 }, { "entropy": 5.618327236175537, "epoch": 2.2380387504942667, "grad_norm": 1.1015625, "learning_rate": 0.00045012477449240363, "loss": 4.9752, "mean_token_accuracy": 0.2187501758337021, "num_tokens": 51866128.0, "step": 22640 }, { "entropy": 5.651944017410278, "epoch": 2.238533017002768, "grad_norm": 1.125, "learning_rate": 0.00045010261543420416, "loss": 5.0691, "mean_token_accuracy": 0.21898249834775924, "num_tokens": 51877036.0, "step": 22645 }, { "entropy": 5.659620761871338, "epoch": 2.2390272835112692, "grad_norm": 1.109375, "learning_rate": 0.0004500804520684532, "loss": 4.9838, "mean_token_accuracy": 0.2199044182896614, "num_tokens": 51888331.0, "step": 22650 }, { "entropy": 5.702177047729492, "epoch": 2.2395215500197705, "grad_norm": 0.96484375, "learning_rate": 0.00045005828439569594, "loss": 5.0271, "mean_token_accuracy": 0.21263622343540192, "num_tokens": 51899843.0, "step": 22655 }, { "entropy": 5.743517255783081, "epoch": 2.240015816528272, "grad_norm": 1.0859375, "learning_rate": 0.00045003611241647783, "loss": 5.0493, "mean_token_accuracy": 0.2091672897338867, "num_tokens": 51911429.0, "step": 22660 }, { "entropy": 5.648055839538574, "epoch": 2.2405100830367735, "grad_norm": 1.0859375, "learning_rate": 0.00045001393613134413, "loss": 5.0148, "mean_token_accuracy": 0.2187858358025551, "num_tokens": 51923154.0, "step": 22665 }, { "entropy": 5.691600704193116, "epoch": 2.2410043495452747, "grad_norm": 1.03125, "learning_rate": 0.0004499917555408405, "loss": 5.0305, "mean_token_accuracy": 0.21180993020534516, "num_tokens": 51935126.0, "step": 22670 }, { "entropy": 5.666724061965942, "epoch": 2.241498616053776, "grad_norm": 1.03125, "learning_rate": 0.00044996957064551244, "loss": 5.0398, "mean_token_accuracy": 0.21079792976379394, "num_tokens": 51947629.0, "step": 22675 }, { "entropy": 5.6925272941589355, "epoch": 2.2419928825622777, "grad_norm": 1.234375, "learning_rate": 0.0004499473814459059, "loss": 5.0296, "mean_token_accuracy": 0.21798262149095535, "num_tokens": 51957631.0, "step": 22680 }, { "entropy": 5.693587589263916, "epoch": 2.242487149070779, "grad_norm": 0.98828125, "learning_rate": 0.00044992518794256657, "loss": 5.0359, "mean_token_accuracy": 0.21122840642929078, "num_tokens": 51969854.0, "step": 22685 }, { "entropy": 5.718819236755371, "epoch": 2.24298141557928, "grad_norm": 1.0859375, "learning_rate": 0.00044990299013604045, "loss": 5.0334, "mean_token_accuracy": 0.2175116330385208, "num_tokens": 51980501.0, "step": 22690 }, { "entropy": 5.657420539855957, "epoch": 2.243475682087782, "grad_norm": 1.1171875, "learning_rate": 0.00044988078802687373, "loss": 5.0243, "mean_token_accuracy": 0.21538246124982835, "num_tokens": 51991336.0, "step": 22695 }, { "entropy": 5.675856304168701, "epoch": 2.243969948596283, "grad_norm": 1.109375, "learning_rate": 0.0004498585816156124, "loss": 5.0755, "mean_token_accuracy": 0.2148443877696991, "num_tokens": 52003215.0, "step": 22700 }, { "entropy": 5.712303209304809, "epoch": 2.2444642151047844, "grad_norm": 1.2265625, "learning_rate": 0.0004498363709028029, "loss": 5.0391, "mean_token_accuracy": 0.21391084790229797, "num_tokens": 52014772.0, "step": 22705 }, { "entropy": 5.674064254760742, "epoch": 2.2449584816132857, "grad_norm": 1.109375, "learning_rate": 0.00044981415588899153, "loss": 5.0393, "mean_token_accuracy": 0.21104245334863664, "num_tokens": 52025808.0, "step": 22710 }, { "entropy": 5.699333715438843, "epoch": 2.2454527481217874, "grad_norm": 1.0625, "learning_rate": 0.0004497919365747248, "loss": 5.0535, "mean_token_accuracy": 0.21469468325376512, "num_tokens": 52037397.0, "step": 22715 }, { "entropy": 5.596655178070068, "epoch": 2.2459470146302887, "grad_norm": 1.1171875, "learning_rate": 0.00044976971296054936, "loss": 4.9709, "mean_token_accuracy": 0.21980248540639877, "num_tokens": 52048874.0, "step": 22720 }, { "entropy": 5.684652280807495, "epoch": 2.24644128113879, "grad_norm": 1.03125, "learning_rate": 0.0004497474850470118, "loss": 5.0851, "mean_token_accuracy": 0.20508341044187545, "num_tokens": 52061180.0, "step": 22725 }, { "entropy": 5.694707584381104, "epoch": 2.2469355476472916, "grad_norm": 1.0703125, "learning_rate": 0.000449725252834659, "loss": 4.998, "mean_token_accuracy": 0.21377017050981523, "num_tokens": 52073400.0, "step": 22730 }, { "entropy": 5.674159908294678, "epoch": 2.247429814155793, "grad_norm": 1.1328125, "learning_rate": 0.00044970301632403796, "loss": 5.0473, "mean_token_accuracy": 0.221113421022892, "num_tokens": 52084737.0, "step": 22735 }, { "entropy": 5.618103933334351, "epoch": 2.247924080664294, "grad_norm": 1.078125, "learning_rate": 0.00044968077551569554, "loss": 4.9825, "mean_token_accuracy": 0.22225635796785354, "num_tokens": 52096044.0, "step": 22740 }, { "entropy": 5.681001615524292, "epoch": 2.2484183471727954, "grad_norm": 1.1484375, "learning_rate": 0.000449658530410179, "loss": 4.9761, "mean_token_accuracy": 0.22113857120275499, "num_tokens": 52108701.0, "step": 22745 }, { "entropy": 5.713064575195313, "epoch": 2.248912613681297, "grad_norm": 1.0625, "learning_rate": 0.0004496362810080354, "loss": 5.023, "mean_token_accuracy": 0.21937201619148256, "num_tokens": 52119797.0, "step": 22750 }, { "entropy": 5.645633506774902, "epoch": 2.2494068801897984, "grad_norm": 1.015625, "learning_rate": 0.0004496140273098123, "loss": 5.0743, "mean_token_accuracy": 0.21006072610616683, "num_tokens": 52132557.0, "step": 22755 }, { "entropy": 5.566066265106201, "epoch": 2.2499011466982997, "grad_norm": 0.9765625, "learning_rate": 0.00044959176931605704, "loss": 4.8886, "mean_token_accuracy": 0.22179346680641174, "num_tokens": 52144058.0, "step": 22760 }, { "entropy": 5.666570663452148, "epoch": 2.250395413206801, "grad_norm": 1.109375, "learning_rate": 0.00044956950702731714, "loss": 5.0118, "mean_token_accuracy": 0.21774857342243195, "num_tokens": 52155432.0, "step": 22765 }, { "entropy": 5.630380344390869, "epoch": 2.2508896797153026, "grad_norm": 1.1875, "learning_rate": 0.0004495472404441403, "loss": 4.9704, "mean_token_accuracy": 0.2209709405899048, "num_tokens": 52166925.0, "step": 22770 }, { "entropy": 5.5793393611907955, "epoch": 2.251383946223804, "grad_norm": 1.2421875, "learning_rate": 0.0004495249695670742, "loss": 4.9814, "mean_token_accuracy": 0.218789741396904, "num_tokens": 52177452.0, "step": 22775 }, { "entropy": 5.633113813400269, "epoch": 2.251878212732305, "grad_norm": 1.078125, "learning_rate": 0.0004495026943966669, "loss": 4.954, "mean_token_accuracy": 0.2157249018549919, "num_tokens": 52189288.0, "step": 22780 }, { "entropy": 5.624559020996093, "epoch": 2.2523724792408064, "grad_norm": 1.0546875, "learning_rate": 0.00044948041493346615, "loss": 4.9546, "mean_token_accuracy": 0.22229027152061462, "num_tokens": 52199963.0, "step": 22785 }, { "entropy": 5.620898818969726, "epoch": 2.252866745749308, "grad_norm": 1.1171875, "learning_rate": 0.0004494581311780202, "loss": 5.0203, "mean_token_accuracy": 0.2140634089708328, "num_tokens": 52210727.0, "step": 22790 }, { "entropy": 5.6376947402954105, "epoch": 2.2533610122578094, "grad_norm": 1.0703125, "learning_rate": 0.00044943584313087705, "loss": 5.0304, "mean_token_accuracy": 0.21278845220804216, "num_tokens": 52222211.0, "step": 22795 }, { "entropy": 5.672648859024048, "epoch": 2.2538552787663106, "grad_norm": 1.046875, "learning_rate": 0.00044941355079258517, "loss": 5.0482, "mean_token_accuracy": 0.21027215272188188, "num_tokens": 52234453.0, "step": 22800 }, { "entropy": 5.625530529022217, "epoch": 2.2543495452748123, "grad_norm": 1.0234375, "learning_rate": 0.0004493912541636928, "loss": 4.9959, "mean_token_accuracy": 0.2218208685517311, "num_tokens": 52246324.0, "step": 22805 }, { "entropy": 5.694216775894165, "epoch": 2.2548438117833136, "grad_norm": 1.21875, "learning_rate": 0.0004493689532447486, "loss": 5.0522, "mean_token_accuracy": 0.21249908804893494, "num_tokens": 52258223.0, "step": 22810 }, { "entropy": 5.65999698638916, "epoch": 2.255338078291815, "grad_norm": 1.140625, "learning_rate": 0.0004493466480363011, "loss": 5.0456, "mean_token_accuracy": 0.21982511579990388, "num_tokens": 52270066.0, "step": 22815 }, { "entropy": 5.765982580184937, "epoch": 2.255832344800316, "grad_norm": 1.125, "learning_rate": 0.00044932433853889903, "loss": 5.0688, "mean_token_accuracy": 0.20999107807874678, "num_tokens": 52281366.0, "step": 22820 }, { "entropy": 5.663675928115845, "epoch": 2.256326611308818, "grad_norm": 1.0703125, "learning_rate": 0.0004493020247530912, "loss": 5.0454, "mean_token_accuracy": 0.21232940405607223, "num_tokens": 52292109.0, "step": 22825 }, { "entropy": 5.586491489410401, "epoch": 2.256820877817319, "grad_norm": 1.09375, "learning_rate": 0.0004492797066794264, "loss": 4.8799, "mean_token_accuracy": 0.23107425421476363, "num_tokens": 52302707.0, "step": 22830 }, { "entropy": 5.647696781158447, "epoch": 2.2573151443258204, "grad_norm": 1.0625, "learning_rate": 0.00044925738431845385, "loss": 4.9872, "mean_token_accuracy": 0.21742101162672042, "num_tokens": 52313715.0, "step": 22835 }, { "entropy": 5.681366491317749, "epoch": 2.257809410834322, "grad_norm": 1.109375, "learning_rate": 0.00044923505767072267, "loss": 5.0068, "mean_token_accuracy": 0.20868510901927947, "num_tokens": 52325612.0, "step": 22840 }, { "entropy": 5.562087535858154, "epoch": 2.2583036773428233, "grad_norm": 1.15625, "learning_rate": 0.00044921272673678197, "loss": 4.8918, "mean_token_accuracy": 0.22701400518417358, "num_tokens": 52338233.0, "step": 22845 }, { "entropy": 5.617707061767578, "epoch": 2.2587979438513246, "grad_norm": 1.03125, "learning_rate": 0.0004491903915171812, "loss": 4.9528, "mean_token_accuracy": 0.2214539334177971, "num_tokens": 52348792.0, "step": 22850 }, { "entropy": 5.650212144851684, "epoch": 2.259292210359826, "grad_norm": 1.078125, "learning_rate": 0.00044916805201246975, "loss": 5.0561, "mean_token_accuracy": 0.21108245551586152, "num_tokens": 52359334.0, "step": 22855 }, { "entropy": 5.696758460998535, "epoch": 2.2597864768683276, "grad_norm": 1.265625, "learning_rate": 0.00044914570822319723, "loss": 5.0529, "mean_token_accuracy": 0.21030161529779434, "num_tokens": 52370600.0, "step": 22860 }, { "entropy": 5.6942384243011475, "epoch": 2.260280743376829, "grad_norm": 1.0546875, "learning_rate": 0.0004491233601499132, "loss": 5.039, "mean_token_accuracy": 0.21550527215003967, "num_tokens": 52382783.0, "step": 22865 }, { "entropy": 5.59625473022461, "epoch": 2.26077500988533, "grad_norm": 1.1328125, "learning_rate": 0.00044910100779316757, "loss": 4.9117, "mean_token_accuracy": 0.22785827666521072, "num_tokens": 52393372.0, "step": 22870 }, { "entropy": 5.635334825515747, "epoch": 2.261269276393832, "grad_norm": 1.046875, "learning_rate": 0.0004490786511535102, "loss": 4.9636, "mean_token_accuracy": 0.22134226262569429, "num_tokens": 52405181.0, "step": 22875 }, { "entropy": 5.645710754394531, "epoch": 2.261763542902333, "grad_norm": 1.0625, "learning_rate": 0.00044905629023149084, "loss": 4.9791, "mean_token_accuracy": 0.21486060172319413, "num_tokens": 52417371.0, "step": 22880 }, { "entropy": 5.6763176918029785, "epoch": 2.2622578094108343, "grad_norm": 1.078125, "learning_rate": 0.0004490339250276598, "loss": 5.0323, "mean_token_accuracy": 0.21425150632858275, "num_tokens": 52428712.0, "step": 22885 }, { "entropy": 5.629108667373657, "epoch": 2.2627520759193356, "grad_norm": 1.09375, "learning_rate": 0.0004490115555425672, "loss": 5.0536, "mean_token_accuracy": 0.2128271698951721, "num_tokens": 52439764.0, "step": 22890 }, { "entropy": 5.617012786865234, "epoch": 2.263246342427837, "grad_norm": 1.140625, "learning_rate": 0.0004489891817767634, "loss": 5.0416, "mean_token_accuracy": 0.21095010936260222, "num_tokens": 52451409.0, "step": 22895 }, { "entropy": 5.697663116455078, "epoch": 2.2637406089363385, "grad_norm": 1.109375, "learning_rate": 0.00044896680373079874, "loss": 5.0069, "mean_token_accuracy": 0.21348000317811966, "num_tokens": 52461471.0, "step": 22900 }, { "entropy": 5.69527907371521, "epoch": 2.26423487544484, "grad_norm": 1.078125, "learning_rate": 0.00044894442140522365, "loss": 5.0133, "mean_token_accuracy": 0.2141559302806854, "num_tokens": 52472693.0, "step": 22905 }, { "entropy": 5.639054965972901, "epoch": 2.264729141953341, "grad_norm": 1.1171875, "learning_rate": 0.0004489220348005889, "loss": 4.9204, "mean_token_accuracy": 0.2180305004119873, "num_tokens": 52483449.0, "step": 22910 }, { "entropy": 5.601035928726196, "epoch": 2.265223408461843, "grad_norm": 1.1875, "learning_rate": 0.000448899643917445, "loss": 5.0083, "mean_token_accuracy": 0.22308041155338287, "num_tokens": 52494048.0, "step": 22915 }, { "entropy": 5.6666422367095945, "epoch": 2.265717674970344, "grad_norm": 1.0390625, "learning_rate": 0.0004488772487563429, "loss": 5.032, "mean_token_accuracy": 0.21332575529813766, "num_tokens": 52506224.0, "step": 22920 }, { "entropy": 5.677220726013184, "epoch": 2.2662119414788453, "grad_norm": 0.98828125, "learning_rate": 0.0004488548493178336, "loss": 5.0059, "mean_token_accuracy": 0.209632109105587, "num_tokens": 52517157.0, "step": 22925 }, { "entropy": 5.6694670677185055, "epoch": 2.2667062079873466, "grad_norm": 1.1171875, "learning_rate": 0.00044883244560246793, "loss": 5.0707, "mean_token_accuracy": 0.21487941592931747, "num_tokens": 52528826.0, "step": 22930 }, { "entropy": 5.663610506057739, "epoch": 2.2672004744958483, "grad_norm": 1.078125, "learning_rate": 0.0004488100376107972, "loss": 4.8953, "mean_token_accuracy": 0.23146772831678392, "num_tokens": 52540068.0, "step": 22935 }, { "entropy": 5.607417631149292, "epoch": 2.2676947410043495, "grad_norm": 1.171875, "learning_rate": 0.0004487876253433726, "loss": 4.9508, "mean_token_accuracy": 0.21942494660615922, "num_tokens": 52552611.0, "step": 22940 }, { "entropy": 5.620614004135132, "epoch": 2.268189007512851, "grad_norm": 1.03125, "learning_rate": 0.0004487652088007454, "loss": 5.0042, "mean_token_accuracy": 0.21663637608289718, "num_tokens": 52564532.0, "step": 22945 }, { "entropy": 5.721346759796143, "epoch": 2.2686832740213525, "grad_norm": 1.078125, "learning_rate": 0.0004487427879834671, "loss": 5.0491, "mean_token_accuracy": 0.20971158444881438, "num_tokens": 52576110.0, "step": 22950 }, { "entropy": 5.690198564529419, "epoch": 2.2691775405298538, "grad_norm": 1.1015625, "learning_rate": 0.00044872036289208926, "loss": 4.9938, "mean_token_accuracy": 0.21658954322338103, "num_tokens": 52586890.0, "step": 22955 }, { "entropy": 5.603496980667114, "epoch": 2.269671807038355, "grad_norm": 1.125, "learning_rate": 0.0004486979335271635, "loss": 4.958, "mean_token_accuracy": 0.2178856536746025, "num_tokens": 52598597.0, "step": 22960 }, { "entropy": 5.5988301753997805, "epoch": 2.2701660735468563, "grad_norm": 1.078125, "learning_rate": 0.00044867549988924176, "loss": 4.9729, "mean_token_accuracy": 0.22163741886615754, "num_tokens": 52609361.0, "step": 22965 }, { "entropy": 5.725370979309082, "epoch": 2.270660340055358, "grad_norm": 1.0078125, "learning_rate": 0.00044865306197887573, "loss": 5.0648, "mean_token_accuracy": 0.21067475378513337, "num_tokens": 52620954.0, "step": 22970 }, { "entropy": 5.725204229354858, "epoch": 2.2711546065638593, "grad_norm": 1.1015625, "learning_rate": 0.00044863061979661745, "loss": 5.0845, "mean_token_accuracy": 0.21283821612596512, "num_tokens": 52631944.0, "step": 22975 }, { "entropy": 5.699615526199341, "epoch": 2.2716488730723605, "grad_norm": 1.0703125, "learning_rate": 0.0004486081733430189, "loss": 5.0351, "mean_token_accuracy": 0.2083725020289421, "num_tokens": 52642517.0, "step": 22980 }, { "entropy": 5.703259134292603, "epoch": 2.2721431395808622, "grad_norm": 1.09375, "learning_rate": 0.00044858572261863245, "loss": 5.0818, "mean_token_accuracy": 0.21242880821228027, "num_tokens": 52653654.0, "step": 22985 }, { "entropy": 5.679076337814331, "epoch": 2.2726374060893635, "grad_norm": 1.1875, "learning_rate": 0.0004485632676240102, "loss": 5.0493, "mean_token_accuracy": 0.21610891371965407, "num_tokens": 52666068.0, "step": 22990 }, { "entropy": 5.685547161102295, "epoch": 2.2731316725978647, "grad_norm": 1.09375, "learning_rate": 0.0004485408083597047, "loss": 4.9965, "mean_token_accuracy": 0.21779437810182573, "num_tokens": 52677797.0, "step": 22995 }, { "entropy": 5.64984712600708, "epoch": 2.273625939106366, "grad_norm": 1.0859375, "learning_rate": 0.0004485183448262684, "loss": 4.9811, "mean_token_accuracy": 0.21992648392915726, "num_tokens": 52688947.0, "step": 23000 }, { "entropy": 5.645264434814453, "epoch": 2.2741202056148677, "grad_norm": 1.1171875, "learning_rate": 0.0004484958770242538, "loss": 5.0236, "mean_token_accuracy": 0.20975972563028336, "num_tokens": 52700357.0, "step": 23005 }, { "entropy": 5.73111662864685, "epoch": 2.274614472123369, "grad_norm": 1.0625, "learning_rate": 0.00044847340495421384, "loss": 5.0983, "mean_token_accuracy": 0.20657340288162232, "num_tokens": 52712602.0, "step": 23010 }, { "entropy": 5.712519025802612, "epoch": 2.2751087386318702, "grad_norm": 1.0859375, "learning_rate": 0.00044845092861670114, "loss": 4.9916, "mean_token_accuracy": 0.21676507592201233, "num_tokens": 52723480.0, "step": 23015 }, { "entropy": 5.636447954177856, "epoch": 2.2756030051403715, "grad_norm": 1.0234375, "learning_rate": 0.0004484284480122688, "loss": 4.9926, "mean_token_accuracy": 0.21316518634557724, "num_tokens": 52735418.0, "step": 23020 }, { "entropy": 5.602292776107788, "epoch": 2.276097271648873, "grad_norm": 1.09375, "learning_rate": 0.00044840596314146955, "loss": 4.9408, "mean_token_accuracy": 0.22402605265378953, "num_tokens": 52746308.0, "step": 23025 }, { "entropy": 5.581596803665161, "epoch": 2.2765915381573745, "grad_norm": 1.1875, "learning_rate": 0.0004483834740048568, "loss": 4.8915, "mean_token_accuracy": 0.22750741392374038, "num_tokens": 52756834.0, "step": 23030 }, { "entropy": 5.624752378463745, "epoch": 2.2770858046658757, "grad_norm": 0.99609375, "learning_rate": 0.0004483609806029837, "loss": 4.9974, "mean_token_accuracy": 0.21336622536182404, "num_tokens": 52768398.0, "step": 23035 }, { "entropy": 5.702380847930908, "epoch": 2.277580071174377, "grad_norm": 1.0703125, "learning_rate": 0.00044833848293640354, "loss": 5.072, "mean_token_accuracy": 0.21296582221984864, "num_tokens": 52780062.0, "step": 23040 }, { "entropy": 5.664226913452149, "epoch": 2.2780743376828787, "grad_norm": 1.140625, "learning_rate": 0.00044831598100566984, "loss": 4.9702, "mean_token_accuracy": 0.2221826732158661, "num_tokens": 52791760.0, "step": 23045 }, { "entropy": 5.627329730987549, "epoch": 2.27856860419138, "grad_norm": 1.1484375, "learning_rate": 0.00044829347481133613, "loss": 4.9294, "mean_token_accuracy": 0.22126214653253556, "num_tokens": 52802638.0, "step": 23050 }, { "entropy": 5.611829090118408, "epoch": 2.2790628706998812, "grad_norm": 1.15625, "learning_rate": 0.000448270964353956, "loss": 5.01, "mean_token_accuracy": 0.2156575709581375, "num_tokens": 52813590.0, "step": 23055 }, { "entropy": 5.640258693695069, "epoch": 2.279557137208383, "grad_norm": 1.015625, "learning_rate": 0.0004482484496340833, "loss": 5.0378, "mean_token_accuracy": 0.22053225785493852, "num_tokens": 52824177.0, "step": 23060 }, { "entropy": 5.781703758239746, "epoch": 2.280051403716884, "grad_norm": 1.0546875, "learning_rate": 0.0004482259306522719, "loss": 5.1116, "mean_token_accuracy": 0.2061627835035324, "num_tokens": 52834637.0, "step": 23065 }, { "entropy": 5.720599126815796, "epoch": 2.2805456702253855, "grad_norm": 1.1015625, "learning_rate": 0.00044820340740907565, "loss": 5.0572, "mean_token_accuracy": 0.21326611042022706, "num_tokens": 52847893.0, "step": 23070 }, { "entropy": 5.682198810577392, "epoch": 2.2810399367338867, "grad_norm": 1.1484375, "learning_rate": 0.0004481808799050488, "loss": 4.9588, "mean_token_accuracy": 0.2172829195857048, "num_tokens": 52859339.0, "step": 23075 }, { "entropy": 5.679493618011475, "epoch": 2.2815342032423884, "grad_norm": 1.046875, "learning_rate": 0.00044815834814074544, "loss": 5.0303, "mean_token_accuracy": 0.2108192890882492, "num_tokens": 52872405.0, "step": 23080 }, { "entropy": 5.629469728469848, "epoch": 2.2820284697508897, "grad_norm": 1.0390625, "learning_rate": 0.0004481358121167198, "loss": 4.9003, "mean_token_accuracy": 0.23121637105941772, "num_tokens": 52882187.0, "step": 23085 }, { "entropy": 5.616191720962524, "epoch": 2.282522736259391, "grad_norm": 1.09375, "learning_rate": 0.00044811327183352627, "loss": 4.9466, "mean_token_accuracy": 0.22572716176509858, "num_tokens": 52894004.0, "step": 23090 }, { "entropy": 5.749456310272217, "epoch": 2.2830170027678927, "grad_norm": 1.2265625, "learning_rate": 0.0004480907272917195, "loss": 5.0437, "mean_token_accuracy": 0.20853720754384994, "num_tokens": 52904749.0, "step": 23095 }, { "entropy": 5.656525135040283, "epoch": 2.283511269276394, "grad_norm": 1.0703125, "learning_rate": 0.0004480681784918539, "loss": 5.0072, "mean_token_accuracy": 0.21528094857931138, "num_tokens": 52915794.0, "step": 23100 }, { "entropy": 5.652636623382568, "epoch": 2.284005535784895, "grad_norm": 1.0234375, "learning_rate": 0.00044804562543448436, "loss": 4.9765, "mean_token_accuracy": 0.2114195078611374, "num_tokens": 52926695.0, "step": 23105 }, { "entropy": 5.6036334991455075, "epoch": 2.2844998022933964, "grad_norm": 1.125, "learning_rate": 0.0004480230681201655, "loss": 4.9479, "mean_token_accuracy": 0.220542511343956, "num_tokens": 52937824.0, "step": 23110 }, { "entropy": 5.610993337631226, "epoch": 2.284994068801898, "grad_norm": 1.046875, "learning_rate": 0.00044800050654945233, "loss": 4.9992, "mean_token_accuracy": 0.21658325493335723, "num_tokens": 52949174.0, "step": 23115 }, { "entropy": 5.679161787033081, "epoch": 2.2854883353103994, "grad_norm": 1.1328125, "learning_rate": 0.00044797794072289987, "loss": 5.0644, "mean_token_accuracy": 0.21063904017210006, "num_tokens": 52960675.0, "step": 23120 }, { "entropy": 5.668533182144165, "epoch": 2.2859826018189007, "grad_norm": 1.1171875, "learning_rate": 0.00044795537064106335, "loss": 5.0083, "mean_token_accuracy": 0.2149379551410675, "num_tokens": 52971705.0, "step": 23125 }, { "entropy": 5.6634509563446045, "epoch": 2.2864768683274024, "grad_norm": 1.0078125, "learning_rate": 0.00044793279630449777, "loss": 5.0223, "mean_token_accuracy": 0.21304048597812653, "num_tokens": 52983025.0, "step": 23130 }, { "entropy": 5.68214225769043, "epoch": 2.2869711348359036, "grad_norm": 1.0546875, "learning_rate": 0.0004479102177137586, "loss": 5.012, "mean_token_accuracy": 0.2077503815293312, "num_tokens": 52993810.0, "step": 23135 }, { "entropy": 5.661705827713012, "epoch": 2.287465401344405, "grad_norm": 1.0, "learning_rate": 0.0004478876348694012, "loss": 5.0089, "mean_token_accuracy": 0.20985692441463472, "num_tokens": 53005902.0, "step": 23140 }, { "entropy": 5.675730276107788, "epoch": 2.287959667852906, "grad_norm": 1.0859375, "learning_rate": 0.0004478650477719812, "loss": 5.0274, "mean_token_accuracy": 0.2128356322646141, "num_tokens": 53017511.0, "step": 23145 }, { "entropy": 5.612431049346924, "epoch": 2.2884539343614074, "grad_norm": 1.0859375, "learning_rate": 0.0004478424564220542, "loss": 4.901, "mean_token_accuracy": 0.22601800560951232, "num_tokens": 53028514.0, "step": 23150 }, { "entropy": 5.669909334182739, "epoch": 2.288948200869909, "grad_norm": 1.1015625, "learning_rate": 0.00044781986082017595, "loss": 4.9637, "mean_token_accuracy": 0.2181425303220749, "num_tokens": 53039338.0, "step": 23155 }, { "entropy": 5.641277074813843, "epoch": 2.2894424673784104, "grad_norm": 1.0703125, "learning_rate": 0.00044779726096690227, "loss": 4.9509, "mean_token_accuracy": 0.22108167856931688, "num_tokens": 53050877.0, "step": 23160 }, { "entropy": 5.693188142776489, "epoch": 2.2899367338869117, "grad_norm": 1.0703125, "learning_rate": 0.0004477746568627892, "loss": 5.0062, "mean_token_accuracy": 0.21315236538648605, "num_tokens": 53062819.0, "step": 23165 }, { "entropy": 5.685944843292236, "epoch": 2.2904310003954134, "grad_norm": 1.1640625, "learning_rate": 0.00044775204850839277, "loss": 5.0654, "mean_token_accuracy": 0.21257565170526505, "num_tokens": 53073486.0, "step": 23170 }, { "entropy": 5.594070053100586, "epoch": 2.2909252669039146, "grad_norm": 1.0859375, "learning_rate": 0.0004477294359042692, "loss": 4.9725, "mean_token_accuracy": 0.22101456969976424, "num_tokens": 53084499.0, "step": 23175 }, { "entropy": 5.638562965393066, "epoch": 2.291419533412416, "grad_norm": 0.97265625, "learning_rate": 0.0004477068190509747, "loss": 5.0478, "mean_token_accuracy": 0.21086382120847702, "num_tokens": 53097181.0, "step": 23180 }, { "entropy": 5.72480092048645, "epoch": 2.291913799920917, "grad_norm": 0.96875, "learning_rate": 0.00044768419794906556, "loss": 5.0834, "mean_token_accuracy": 0.21605592221021652, "num_tokens": 53108586.0, "step": 23185 }, { "entropy": 5.7527566909790036, "epoch": 2.292408066429419, "grad_norm": 1.109375, "learning_rate": 0.00044766157259909853, "loss": 4.9605, "mean_token_accuracy": 0.21318284273147584, "num_tokens": 53119481.0, "step": 23190 }, { "entropy": 5.685546493530273, "epoch": 2.29290233293792, "grad_norm": 1.1953125, "learning_rate": 0.0004476389430016299, "loss": 4.9683, "mean_token_accuracy": 0.22081106305122375, "num_tokens": 53129482.0, "step": 23195 }, { "entropy": 5.576179647445679, "epoch": 2.2933965994464214, "grad_norm": 1.03125, "learning_rate": 0.00044761630915721645, "loss": 4.9851, "mean_token_accuracy": 0.21864856630563737, "num_tokens": 53142311.0, "step": 23200 }, { "entropy": 5.632884359359741, "epoch": 2.293890865954923, "grad_norm": 1.0625, "learning_rate": 0.0004475936710664151, "loss": 4.9642, "mean_token_accuracy": 0.2128441110253334, "num_tokens": 53153485.0, "step": 23205 }, { "entropy": 5.681209373474121, "epoch": 2.2943851324634243, "grad_norm": 1.1953125, "learning_rate": 0.0004475710287297826, "loss": 4.9987, "mean_token_accuracy": 0.20964257121086122, "num_tokens": 53164121.0, "step": 23210 }, { "entropy": 5.67168493270874, "epoch": 2.2948793989719256, "grad_norm": 1.1328125, "learning_rate": 0.0004475483821478761, "loss": 4.9976, "mean_token_accuracy": 0.21431410014629365, "num_tokens": 53174949.0, "step": 23215 }, { "entropy": 5.598780012130737, "epoch": 2.295373665480427, "grad_norm": 1.1171875, "learning_rate": 0.00044752573132125263, "loss": 4.9489, "mean_token_accuracy": 0.22340573817491532, "num_tokens": 53186762.0, "step": 23220 }, { "entropy": 5.700349569320679, "epoch": 2.2958679319889286, "grad_norm": 1.1328125, "learning_rate": 0.0004475030762504694, "loss": 4.9925, "mean_token_accuracy": 0.21599723398685455, "num_tokens": 53198261.0, "step": 23225 }, { "entropy": 5.575061702728272, "epoch": 2.29636219849743, "grad_norm": 1.078125, "learning_rate": 0.0004474804169360836, "loss": 4.8972, "mean_token_accuracy": 0.22586987018585206, "num_tokens": 53209143.0, "step": 23230 }, { "entropy": 5.71795163154602, "epoch": 2.296856465005931, "grad_norm": 0.91015625, "learning_rate": 0.00044745775337865293, "loss": 5.1495, "mean_token_accuracy": 0.208558090031147, "num_tokens": 53222619.0, "step": 23235 }, { "entropy": 5.637172365188599, "epoch": 2.297350731514433, "grad_norm": 1.0625, "learning_rate": 0.00044743508557873473, "loss": 4.9373, "mean_token_accuracy": 0.22620487660169603, "num_tokens": 53233829.0, "step": 23240 }, { "entropy": 5.666169357299805, "epoch": 2.297844998022934, "grad_norm": 1.2109375, "learning_rate": 0.00044741241353688665, "loss": 5.0242, "mean_token_accuracy": 0.21004287749528885, "num_tokens": 53244248.0, "step": 23245 }, { "entropy": 5.686219501495361, "epoch": 2.2983392645314353, "grad_norm": 1.1171875, "learning_rate": 0.0004473897372536665, "loss": 5.0422, "mean_token_accuracy": 0.21702573001384734, "num_tokens": 53255638.0, "step": 23250 }, { "entropy": 5.680190181732177, "epoch": 2.2988335310399366, "grad_norm": 1.0390625, "learning_rate": 0.000447367056729632, "loss": 5.0147, "mean_token_accuracy": 0.21081238836050034, "num_tokens": 53265798.0, "step": 23255 }, { "entropy": 5.664991044998169, "epoch": 2.2993277975484383, "grad_norm": 1.078125, "learning_rate": 0.0004473443719653412, "loss": 5.0007, "mean_token_accuracy": 0.21793916076421738, "num_tokens": 53278001.0, "step": 23260 }, { "entropy": 5.687960386276245, "epoch": 2.2998220640569396, "grad_norm": 1.125, "learning_rate": 0.00044732168296135217, "loss": 5.0361, "mean_token_accuracy": 0.2097020074725151, "num_tokens": 53289742.0, "step": 23265 }, { "entropy": 5.696910858154297, "epoch": 2.300316330565441, "grad_norm": 1.0859375, "learning_rate": 0.00044729898971822296, "loss": 4.9705, "mean_token_accuracy": 0.22231234163045882, "num_tokens": 53301285.0, "step": 23270 }, { "entropy": 5.583860111236572, "epoch": 2.300810597073942, "grad_norm": 1.15625, "learning_rate": 0.0004472762922365118, "loss": 4.9139, "mean_token_accuracy": 0.2226989209651947, "num_tokens": 53312883.0, "step": 23275 }, { "entropy": 5.658785343170166, "epoch": 2.301304863582444, "grad_norm": 1.1015625, "learning_rate": 0.0004472535905167773, "loss": 5.064, "mean_token_accuracy": 0.2056912139058113, "num_tokens": 53325215.0, "step": 23280 }, { "entropy": 5.664778375625611, "epoch": 2.301799130090945, "grad_norm": 1.1484375, "learning_rate": 0.0004472308845595776, "loss": 5.067, "mean_token_accuracy": 0.20703037679195405, "num_tokens": 53337104.0, "step": 23285 }, { "entropy": 5.673450040817261, "epoch": 2.3022933965994463, "grad_norm": 1.1328125, "learning_rate": 0.0004472081743654715, "loss": 5.0412, "mean_token_accuracy": 0.21587115675210952, "num_tokens": 53348097.0, "step": 23290 }, { "entropy": 5.654085445404053, "epoch": 2.3027876631079476, "grad_norm": 1.140625, "learning_rate": 0.00044718545993501754, "loss": 4.9345, "mean_token_accuracy": 0.22569898813962935, "num_tokens": 53358405.0, "step": 23295 }, { "entropy": 5.654303073883057, "epoch": 2.3032819296164493, "grad_norm": 1.109375, "learning_rate": 0.0004471627412687745, "loss": 5.0298, "mean_token_accuracy": 0.21355980932712554, "num_tokens": 53370012.0, "step": 23300 }, { "entropy": 5.747406721115112, "epoch": 2.3037761961249505, "grad_norm": 1.03125, "learning_rate": 0.00044714001836730145, "loss": 5.0996, "mean_token_accuracy": 0.20933543741703034, "num_tokens": 53383214.0, "step": 23305 }, { "entropy": 5.7046712875366214, "epoch": 2.304270462633452, "grad_norm": 1.1015625, "learning_rate": 0.00044711729123115716, "loss": 5.0465, "mean_token_accuracy": 0.2133384644985199, "num_tokens": 53395672.0, "step": 23310 }, { "entropy": 5.642041635513306, "epoch": 2.3047647291419535, "grad_norm": 0.98828125, "learning_rate": 0.00044709455986090084, "loss": 4.9777, "mean_token_accuracy": 0.21674280017614364, "num_tokens": 53407577.0, "step": 23315 }, { "entropy": 5.625307273864746, "epoch": 2.305258995650455, "grad_norm": 1.078125, "learning_rate": 0.0004470718242570916, "loss": 4.9526, "mean_token_accuracy": 0.21659355461597443, "num_tokens": 53417772.0, "step": 23320 }, { "entropy": 5.700246143341064, "epoch": 2.305753262158956, "grad_norm": 1.0, "learning_rate": 0.0004470490844202889, "loss": 5.0148, "mean_token_accuracy": 0.2123020887374878, "num_tokens": 53429675.0, "step": 23325 }, { "entropy": 5.650335359573364, "epoch": 2.3062475286674573, "grad_norm": 1.1015625, "learning_rate": 0.0004470263403510519, "loss": 5.0329, "mean_token_accuracy": 0.2086232915520668, "num_tokens": 53442352.0, "step": 23330 }, { "entropy": 5.7242063045501705, "epoch": 2.306741795175959, "grad_norm": 1.1171875, "learning_rate": 0.00044700359204994034, "loss": 5.1417, "mean_token_accuracy": 0.20519371181726456, "num_tokens": 53453710.0, "step": 23335 }, { "entropy": 5.709506177902222, "epoch": 2.3072360616844603, "grad_norm": 1.1875, "learning_rate": 0.00044698083951751365, "loss": 4.9712, "mean_token_accuracy": 0.22754202634096146, "num_tokens": 53464764.0, "step": 23340 }, { "entropy": 5.646165990829468, "epoch": 2.3077303281929615, "grad_norm": 1.0234375, "learning_rate": 0.0004469580827543318, "loss": 4.9402, "mean_token_accuracy": 0.22145799398422242, "num_tokens": 53476495.0, "step": 23345 }, { "entropy": 5.673996543884277, "epoch": 2.3082245947014632, "grad_norm": 1.203125, "learning_rate": 0.0004469353217609542, "loss": 5.0252, "mean_token_accuracy": 0.2099227175116539, "num_tokens": 53488613.0, "step": 23350 }, { "entropy": 5.682986927032471, "epoch": 2.3087188612099645, "grad_norm": 1.0625, "learning_rate": 0.0004469125565379411, "loss": 5.0955, "mean_token_accuracy": 0.20858614146709442, "num_tokens": 53501851.0, "step": 23355 }, { "entropy": 5.679410076141357, "epoch": 2.3092131277184658, "grad_norm": 1.046875, "learning_rate": 0.0004468897870858525, "loss": 5.028, "mean_token_accuracy": 0.2097813829779625, "num_tokens": 53514325.0, "step": 23360 }, { "entropy": 5.695396757125854, "epoch": 2.309707394226967, "grad_norm": 1.1171875, "learning_rate": 0.00044686701340524836, "loss": 4.9831, "mean_token_accuracy": 0.21775872856378556, "num_tokens": 53525717.0, "step": 23365 }, { "entropy": 5.64153642654419, "epoch": 2.3102016607354687, "grad_norm": 1.171875, "learning_rate": 0.0004468442354966891, "loss": 5.0172, "mean_token_accuracy": 0.21389828473329545, "num_tokens": 53536488.0, "step": 23370 }, { "entropy": 5.729271745681762, "epoch": 2.31069592724397, "grad_norm": 1.0859375, "learning_rate": 0.000446821453360735, "loss": 5.1216, "mean_token_accuracy": 0.20298956483602523, "num_tokens": 53547230.0, "step": 23375 }, { "entropy": 5.714764213562011, "epoch": 2.3111901937524713, "grad_norm": 1.1953125, "learning_rate": 0.00044679866699794644, "loss": 5.1282, "mean_token_accuracy": 0.20588886886835098, "num_tokens": 53558673.0, "step": 23380 }, { "entropy": 5.6543221950531, "epoch": 2.311684460260973, "grad_norm": 1.09375, "learning_rate": 0.0004467758764088841, "loss": 4.9744, "mean_token_accuracy": 0.22005589604377745, "num_tokens": 53570088.0, "step": 23385 }, { "entropy": 5.657515144348144, "epoch": 2.3121787267694742, "grad_norm": 1.09375, "learning_rate": 0.0004467530815941085, "loss": 5.0254, "mean_token_accuracy": 0.21949983686208724, "num_tokens": 53582115.0, "step": 23390 }, { "entropy": 5.6302672863006595, "epoch": 2.3126729932779755, "grad_norm": 1.046875, "learning_rate": 0.00044673028255418047, "loss": 5.0289, "mean_token_accuracy": 0.2136667862534523, "num_tokens": 53594719.0, "step": 23395 }, { "entropy": 5.5587951183319095, "epoch": 2.3131672597864767, "grad_norm": 1.078125, "learning_rate": 0.0004467074792896608, "loss": 4.8575, "mean_token_accuracy": 0.22768252491950988, "num_tokens": 53606453.0, "step": 23400 }, { "entropy": 5.6474823474884035, "epoch": 2.313661526294978, "grad_norm": 1.1171875, "learning_rate": 0.00044668467180111054, "loss": 4.9929, "mean_token_accuracy": 0.21750637143850327, "num_tokens": 53617038.0, "step": 23405 }, { "entropy": 5.74325008392334, "epoch": 2.3141557928034797, "grad_norm": 1.1328125, "learning_rate": 0.00044666186008909077, "loss": 5.0369, "mean_token_accuracy": 0.21823037713766097, "num_tokens": 53627230.0, "step": 23410 }, { "entropy": 5.715768671035766, "epoch": 2.314650059311981, "grad_norm": 1.140625, "learning_rate": 0.00044663904415416245, "loss": 5.0794, "mean_token_accuracy": 0.21024925857782364, "num_tokens": 53638247.0, "step": 23415 }, { "entropy": 5.681694650650025, "epoch": 2.3151443258204822, "grad_norm": 1.1328125, "learning_rate": 0.0004466162239968871, "loss": 4.9906, "mean_token_accuracy": 0.22165091037750245, "num_tokens": 53648643.0, "step": 23420 }, { "entropy": 5.626164436340332, "epoch": 2.315638592328984, "grad_norm": 1.125, "learning_rate": 0.0004465933996178261, "loss": 4.9363, "mean_token_accuracy": 0.22904857397079467, "num_tokens": 53659715.0, "step": 23425 }, { "entropy": 5.608146524429321, "epoch": 2.316132858837485, "grad_norm": 1.0078125, "learning_rate": 0.00044657057101754073, "loss": 4.9828, "mean_token_accuracy": 0.21807103157043456, "num_tokens": 53671119.0, "step": 23430 }, { "entropy": 5.651777696609497, "epoch": 2.3166271253459865, "grad_norm": 1.0859375, "learning_rate": 0.00044654773819659277, "loss": 4.981, "mean_token_accuracy": 0.2197079047560692, "num_tokens": 53682145.0, "step": 23435 }, { "entropy": 5.704486513137818, "epoch": 2.3171213918544877, "grad_norm": 1.046875, "learning_rate": 0.00044652490115554386, "loss": 4.9816, "mean_token_accuracy": 0.22056100964546205, "num_tokens": 53693882.0, "step": 23440 }, { "entropy": 5.649781131744385, "epoch": 2.3176156583629894, "grad_norm": 1.046875, "learning_rate": 0.0004465020598949557, "loss": 5.024, "mean_token_accuracy": 0.2093565508723259, "num_tokens": 53706010.0, "step": 23445 }, { "entropy": 5.646624660491943, "epoch": 2.3181099248714907, "grad_norm": 1.0390625, "learning_rate": 0.0004464792144153903, "loss": 5.0455, "mean_token_accuracy": 0.21391244232654572, "num_tokens": 53717657.0, "step": 23450 }, { "entropy": 5.66133680343628, "epoch": 2.318604191379992, "grad_norm": 1.1015625, "learning_rate": 0.0004464563647174096, "loss": 5.0017, "mean_token_accuracy": 0.21722687929868698, "num_tokens": 53729181.0, "step": 23455 }, { "entropy": 5.642555475234985, "epoch": 2.3190984578884937, "grad_norm": 1.125, "learning_rate": 0.0004464335108015757, "loss": 4.9774, "mean_token_accuracy": 0.2229529544711113, "num_tokens": 53740864.0, "step": 23460 }, { "entropy": 5.62421989440918, "epoch": 2.319592724396995, "grad_norm": 1.125, "learning_rate": 0.0004464106526684509, "loss": 4.9826, "mean_token_accuracy": 0.2158585622906685, "num_tokens": 53751726.0, "step": 23465 }, { "entropy": 5.7025621891021725, "epoch": 2.320086990905496, "grad_norm": 1.0234375, "learning_rate": 0.0004463877903185974, "loss": 5.0303, "mean_token_accuracy": 0.21454910188913345, "num_tokens": 53763629.0, "step": 23470 }, { "entropy": 5.665783929824829, "epoch": 2.3205812574139975, "grad_norm": 1.125, "learning_rate": 0.0004463649237525777, "loss": 4.9996, "mean_token_accuracy": 0.22046219259500505, "num_tokens": 53774814.0, "step": 23475 }, { "entropy": 5.697757053375244, "epoch": 2.321075523922499, "grad_norm": 1.1328125, "learning_rate": 0.0004463420529709543, "loss": 5.0092, "mean_token_accuracy": 0.21670455634593963, "num_tokens": 53786298.0, "step": 23480 }, { "entropy": 5.674049949645996, "epoch": 2.3215697904310004, "grad_norm": 1.0390625, "learning_rate": 0.00044631917797428985, "loss": 5.0142, "mean_token_accuracy": 0.2241431936621666, "num_tokens": 53798509.0, "step": 23485 }, { "entropy": 5.700702762603759, "epoch": 2.3220640569395017, "grad_norm": 1.0234375, "learning_rate": 0.000446296298763147, "loss": 5.0851, "mean_token_accuracy": 0.21019182801246644, "num_tokens": 53810689.0, "step": 23490 }, { "entropy": 5.699579668045044, "epoch": 2.3225583234480034, "grad_norm": 1.109375, "learning_rate": 0.0004462734153380886, "loss": 5.0496, "mean_token_accuracy": 0.21225131899118424, "num_tokens": 53822432.0, "step": 23495 }, { "entropy": 5.626414775848389, "epoch": 2.3230525899565047, "grad_norm": 1.125, "learning_rate": 0.00044625052769967766, "loss": 4.9796, "mean_token_accuracy": 0.2215825840830803, "num_tokens": 53833701.0, "step": 23500 }, { "entropy": 5.636937665939331, "epoch": 2.323546856465006, "grad_norm": 1.2265625, "learning_rate": 0.00044622763584847716, "loss": 4.9609, "mean_token_accuracy": 0.21911939531564711, "num_tokens": 53844413.0, "step": 23505 }, { "entropy": 5.608329153060913, "epoch": 2.324041122973507, "grad_norm": 1.0390625, "learning_rate": 0.00044620473978505023, "loss": 4.9216, "mean_token_accuracy": 0.22223889976739883, "num_tokens": 53856392.0, "step": 23510 }, { "entropy": 5.712033796310425, "epoch": 2.324535389482009, "grad_norm": 1.0078125, "learning_rate": 0.00044618183950996017, "loss": 5.0053, "mean_token_accuracy": 0.22014512866735458, "num_tokens": 53867938.0, "step": 23515 }, { "entropy": 5.586626720428467, "epoch": 2.32502965599051, "grad_norm": 1.0859375, "learning_rate": 0.0004461589350237702, "loss": 4.8715, "mean_token_accuracy": 0.22319066822528838, "num_tokens": 53878153.0, "step": 23520 }, { "entropy": 5.56695442199707, "epoch": 2.3255239224990114, "grad_norm": 1.21875, "learning_rate": 0.000446136026327044, "loss": 4.9501, "mean_token_accuracy": 0.21799801886081696, "num_tokens": 53889090.0, "step": 23525 }, { "entropy": 5.6354179859161375, "epoch": 2.3260181890075127, "grad_norm": 1.1484375, "learning_rate": 0.00044611311342034494, "loss": 4.9755, "mean_token_accuracy": 0.2236956238746643, "num_tokens": 53900459.0, "step": 23530 }, { "entropy": 5.659226036071777, "epoch": 2.3265124555160144, "grad_norm": 1.078125, "learning_rate": 0.0004460901963042368, "loss": 4.9699, "mean_token_accuracy": 0.2204741895198822, "num_tokens": 53912815.0, "step": 23535 }, { "entropy": 5.590457439422607, "epoch": 2.3270067220245156, "grad_norm": 1.171875, "learning_rate": 0.00044606727497928324, "loss": 4.9324, "mean_token_accuracy": 0.22062502503395082, "num_tokens": 53924387.0, "step": 23540 }, { "entropy": 5.714711856842041, "epoch": 2.327500988533017, "grad_norm": 1.046875, "learning_rate": 0.00044604434944604826, "loss": 5.0222, "mean_token_accuracy": 0.21449391394853592, "num_tokens": 53936147.0, "step": 23545 }, { "entropy": 5.671673679351807, "epoch": 2.327995255041518, "grad_norm": 1.1484375, "learning_rate": 0.0004460214197050956, "loss": 5.046, "mean_token_accuracy": 0.2137337163090706, "num_tokens": 53948102.0, "step": 23550 }, { "entropy": 5.673119926452637, "epoch": 2.32848952155002, "grad_norm": 0.98828125, "learning_rate": 0.0004459984857569896, "loss": 5.057, "mean_token_accuracy": 0.20863454788923264, "num_tokens": 53959721.0, "step": 23555 }, { "entropy": 5.623241710662842, "epoch": 2.328983788058521, "grad_norm": 1.1484375, "learning_rate": 0.00044597554760229433, "loss": 4.9887, "mean_token_accuracy": 0.21970128118991852, "num_tokens": 53970302.0, "step": 23560 }, { "entropy": 5.731866025924683, "epoch": 2.3294780545670224, "grad_norm": 1.0234375, "learning_rate": 0.000445952605241574, "loss": 5.0808, "mean_token_accuracy": 0.21380094438791275, "num_tokens": 53982198.0, "step": 23565 }, { "entropy": 5.738956451416016, "epoch": 2.329972321075524, "grad_norm": 1.015625, "learning_rate": 0.00044592965867539306, "loss": 5.1036, "mean_token_accuracy": 0.2059256210923195, "num_tokens": 53994443.0, "step": 23570 }, { "entropy": 5.647835969924927, "epoch": 2.3304665875840254, "grad_norm": 1.0390625, "learning_rate": 0.00044590670790431604, "loss": 4.9714, "mean_token_accuracy": 0.21688535660505295, "num_tokens": 54005666.0, "step": 23575 }, { "entropy": 5.64765567779541, "epoch": 2.3309608540925266, "grad_norm": 1.1796875, "learning_rate": 0.0004458837529289074, "loss": 4.9358, "mean_token_accuracy": 0.22210220396518707, "num_tokens": 54016173.0, "step": 23580 }, { "entropy": 5.601264095306396, "epoch": 2.331455120601028, "grad_norm": 1.1171875, "learning_rate": 0.0004458607937497321, "loss": 5.0732, "mean_token_accuracy": 0.20985782891511917, "num_tokens": 54027743.0, "step": 23585 }, { "entropy": 5.724059152603149, "epoch": 2.3319493871095296, "grad_norm": 1.203125, "learning_rate": 0.0004458378303673546, "loss": 5.0903, "mean_token_accuracy": 0.20857136994600295, "num_tokens": 54039804.0, "step": 23590 }, { "entropy": 5.691845417022705, "epoch": 2.332443653618031, "grad_norm": 1.2109375, "learning_rate": 0.0004458148627823401, "loss": 5.0481, "mean_token_accuracy": 0.21689510196447373, "num_tokens": 54050202.0, "step": 23595 }, { "entropy": 5.6657263278961185, "epoch": 2.332937920126532, "grad_norm": 1.0546875, "learning_rate": 0.00044579189099525334, "loss": 4.9699, "mean_token_accuracy": 0.22159582376480103, "num_tokens": 54061088.0, "step": 23600 }, { "entropy": 5.572190523147583, "epoch": 2.333432186635034, "grad_norm": 1.0859375, "learning_rate": 0.00044576891500665967, "loss": 4.9267, "mean_token_accuracy": 0.2253502279520035, "num_tokens": 54072524.0, "step": 23605 }, { "entropy": 5.638398504257202, "epoch": 2.333926453143535, "grad_norm": 1.265625, "learning_rate": 0.0004457459348171242, "loss": 5.0064, "mean_token_accuracy": 0.21764014661312103, "num_tokens": 54083265.0, "step": 23610 }, { "entropy": 5.6630456924438475, "epoch": 2.3344207196520363, "grad_norm": 1.0546875, "learning_rate": 0.00044572295042721215, "loss": 4.9368, "mean_token_accuracy": 0.22668247520923615, "num_tokens": 54093848.0, "step": 23615 }, { "entropy": 5.609566688537598, "epoch": 2.3349149861605376, "grad_norm": 1.2421875, "learning_rate": 0.00044569996183748913, "loss": 4.9565, "mean_token_accuracy": 0.23079534918069838, "num_tokens": 54104595.0, "step": 23620 }, { "entropy": 5.561442708969116, "epoch": 2.3354092526690393, "grad_norm": 1.046875, "learning_rate": 0.00044567696904852057, "loss": 4.888, "mean_token_accuracy": 0.23076927959918975, "num_tokens": 54115577.0, "step": 23625 }, { "entropy": 5.648702239990234, "epoch": 2.3359035191775406, "grad_norm": 1.1328125, "learning_rate": 0.000445653972060872, "loss": 4.9591, "mean_token_accuracy": 0.2203268140554428, "num_tokens": 54125579.0, "step": 23630 }, { "entropy": 5.656605386734009, "epoch": 2.336397785686042, "grad_norm": 1.0859375, "learning_rate": 0.00044563097087510934, "loss": 5.0627, "mean_token_accuracy": 0.2127949818968773, "num_tokens": 54137895.0, "step": 23635 }, { "entropy": 5.701214599609375, "epoch": 2.3368920521945435, "grad_norm": 1.1484375, "learning_rate": 0.00044560796549179826, "loss": 5.0682, "mean_token_accuracy": 0.21045654118061066, "num_tokens": 54149423.0, "step": 23640 }, { "entropy": 5.773826313018799, "epoch": 2.337386318703045, "grad_norm": 1.078125, "learning_rate": 0.0004455849559115048, "loss": 5.0396, "mean_token_accuracy": 0.21631911545991897, "num_tokens": 54160743.0, "step": 23645 }, { "entropy": 5.683167362213135, "epoch": 2.337880585211546, "grad_norm": 1.1953125, "learning_rate": 0.0004455619421347949, "loss": 5.0643, "mean_token_accuracy": 0.20993875861167907, "num_tokens": 54171517.0, "step": 23650 }, { "entropy": 5.645554542541504, "epoch": 2.3383748517200473, "grad_norm": 1.1640625, "learning_rate": 0.00044553892416223485, "loss": 4.9375, "mean_token_accuracy": 0.22406360507011414, "num_tokens": 54182959.0, "step": 23655 }, { "entropy": 5.669104433059692, "epoch": 2.3388691182285486, "grad_norm": 1.09375, "learning_rate": 0.00044551590199439075, "loss": 5.0388, "mean_token_accuracy": 0.2129897266626358, "num_tokens": 54194577.0, "step": 23660 }, { "entropy": 5.693298959732056, "epoch": 2.3393633847370503, "grad_norm": 1.046875, "learning_rate": 0.000445492875631829, "loss": 5.1436, "mean_token_accuracy": 0.20494206696748735, "num_tokens": 54207423.0, "step": 23665 }, { "entropy": 5.668057632446289, "epoch": 2.3398576512455516, "grad_norm": 1.0234375, "learning_rate": 0.0004454698450751161, "loss": 4.997, "mean_token_accuracy": 0.2173857346177101, "num_tokens": 54218776.0, "step": 23670 }, { "entropy": 5.700232219696045, "epoch": 2.340351917754053, "grad_norm": 0.9765625, "learning_rate": 0.0004454468103248186, "loss": 4.9257, "mean_token_accuracy": 0.2222027063369751, "num_tokens": 54229508.0, "step": 23675 }, { "entropy": 5.682994985580445, "epoch": 2.3408461842625545, "grad_norm": 1.0625, "learning_rate": 0.000445423771381503, "loss": 5.0962, "mean_token_accuracy": 0.20942182540893556, "num_tokens": 54240546.0, "step": 23680 }, { "entropy": 5.630633687973022, "epoch": 2.341340450771056, "grad_norm": 1.0859375, "learning_rate": 0.0004454007282457364, "loss": 5.0337, "mean_token_accuracy": 0.2196759507060051, "num_tokens": 54252486.0, "step": 23685 }, { "entropy": 5.723714447021484, "epoch": 2.341834717279557, "grad_norm": 1.109375, "learning_rate": 0.00044537768091808516, "loss": 5.0117, "mean_token_accuracy": 0.2188166096806526, "num_tokens": 54264240.0, "step": 23690 }, { "entropy": 5.703940200805664, "epoch": 2.3423289837880583, "grad_norm": 1.1171875, "learning_rate": 0.0004453546293991168, "loss": 4.9894, "mean_token_accuracy": 0.22072886675596237, "num_tokens": 54275894.0, "step": 23695 }, { "entropy": 5.685349178314209, "epoch": 2.34282325029656, "grad_norm": 1.0625, "learning_rate": 0.000445331573689398, "loss": 5.0326, "mean_token_accuracy": 0.21345318853855133, "num_tokens": 54287697.0, "step": 23700 }, { "entropy": 5.60703935623169, "epoch": 2.3433175168050613, "grad_norm": 1.15625, "learning_rate": 0.000445308513789496, "loss": 4.9336, "mean_token_accuracy": 0.22863015681505203, "num_tokens": 54300327.0, "step": 23705 }, { "entropy": 5.700958299636841, "epoch": 2.3438117833135625, "grad_norm": 1.1640625, "learning_rate": 0.00044528544969997823, "loss": 5.0808, "mean_token_accuracy": 0.21131146103143691, "num_tokens": 54311949.0, "step": 23710 }, { "entropy": 5.658927869796753, "epoch": 2.3443060498220643, "grad_norm": 1.0859375, "learning_rate": 0.00044526238142141196, "loss": 4.9735, "mean_token_accuracy": 0.2162339985370636, "num_tokens": 54322134.0, "step": 23715 }, { "entropy": 5.702368259429932, "epoch": 2.3448003163305655, "grad_norm": 1.0390625, "learning_rate": 0.00044523930895436475, "loss": 5.0888, "mean_token_accuracy": 0.20286719352006913, "num_tokens": 54334579.0, "step": 23720 }, { "entropy": 5.670440196990967, "epoch": 2.3452945828390668, "grad_norm": 1.1171875, "learning_rate": 0.00044521623229940407, "loss": 5.0098, "mean_token_accuracy": 0.21451695561408995, "num_tokens": 54346624.0, "step": 23725 }, { "entropy": 5.649648237228393, "epoch": 2.345788849347568, "grad_norm": 1.1796875, "learning_rate": 0.00044519315145709765, "loss": 4.976, "mean_token_accuracy": 0.21944692879915237, "num_tokens": 54356455.0, "step": 23730 }, { "entropy": 5.696085119247437, "epoch": 2.3462831158560697, "grad_norm": 1.1015625, "learning_rate": 0.0004451700664280133, "loss": 5.1123, "mean_token_accuracy": 0.20624695271253585, "num_tokens": 54368141.0, "step": 23735 }, { "entropy": 5.689579248428345, "epoch": 2.346777382364571, "grad_norm": 1.0859375, "learning_rate": 0.000445146977212719, "loss": 5.0373, "mean_token_accuracy": 0.213021881878376, "num_tokens": 54379304.0, "step": 23740 }, { "entropy": 5.657140445709229, "epoch": 2.3472716488730723, "grad_norm": 1.125, "learning_rate": 0.0004451238838117826, "loss": 4.9722, "mean_token_accuracy": 0.22089823484420776, "num_tokens": 54391462.0, "step": 23745 }, { "entropy": 5.629985094070435, "epoch": 2.347765915381574, "grad_norm": 1.0625, "learning_rate": 0.0004451007862257723, "loss": 4.9447, "mean_token_accuracy": 0.22952927350997926, "num_tokens": 54402325.0, "step": 23750 }, { "entropy": 5.604015254974366, "epoch": 2.3482601818900752, "grad_norm": 1.1484375, "learning_rate": 0.0004450776844552562, "loss": 4.9186, "mean_token_accuracy": 0.21776869148015976, "num_tokens": 54413874.0, "step": 23755 }, { "entropy": 5.632415914535523, "epoch": 2.3487544483985765, "grad_norm": 1.1171875, "learning_rate": 0.0004450545785008027, "loss": 5.0363, "mean_token_accuracy": 0.2186850130558014, "num_tokens": 54426266.0, "step": 23760 }, { "entropy": 5.6446596622467045, "epoch": 2.3492487149070778, "grad_norm": 1.21875, "learning_rate": 0.00044503146836298026, "loss": 5.0133, "mean_token_accuracy": 0.21799371540546417, "num_tokens": 54436682.0, "step": 23765 }, { "entropy": 5.658512258529663, "epoch": 2.3497429814155795, "grad_norm": 1.21875, "learning_rate": 0.00044500835404235727, "loss": 4.9994, "mean_token_accuracy": 0.2183884397149086, "num_tokens": 54447462.0, "step": 23770 }, { "entropy": 5.726205682754516, "epoch": 2.3502372479240807, "grad_norm": 0.9765625, "learning_rate": 0.0004449852355395024, "loss": 5.0401, "mean_token_accuracy": 0.22163018137216567, "num_tokens": 54460116.0, "step": 23775 }, { "entropy": 5.715434265136719, "epoch": 2.350731514432582, "grad_norm": 1.234375, "learning_rate": 0.00044496211285498434, "loss": 5.004, "mean_token_accuracy": 0.22352475076913833, "num_tokens": 54471016.0, "step": 23780 }, { "entropy": 5.62493371963501, "epoch": 2.3512257809410833, "grad_norm": 1.0859375, "learning_rate": 0.000444938985989372, "loss": 4.9289, "mean_token_accuracy": 0.22665604054927826, "num_tokens": 54482410.0, "step": 23785 }, { "entropy": 5.599335050582885, "epoch": 2.351720047449585, "grad_norm": 1.125, "learning_rate": 0.00044491585494323415, "loss": 4.9813, "mean_token_accuracy": 0.21639845222234727, "num_tokens": 54495555.0, "step": 23790 }, { "entropy": 5.721944856643677, "epoch": 2.3522143139580862, "grad_norm": 1.015625, "learning_rate": 0.00044489271971713995, "loss": 5.0256, "mean_token_accuracy": 0.2180335521697998, "num_tokens": 54505658.0, "step": 23795 }, { "entropy": 5.575951004028321, "epoch": 2.3527085804665875, "grad_norm": 1.1640625, "learning_rate": 0.00044486958031165856, "loss": 4.9517, "mean_token_accuracy": 0.22421502321958542, "num_tokens": 54518633.0, "step": 23800 }, { "entropy": 5.714538192749023, "epoch": 2.3532028469750887, "grad_norm": 0.9765625, "learning_rate": 0.00044484643672735907, "loss": 5.1438, "mean_token_accuracy": 0.2094655692577362, "num_tokens": 54531451.0, "step": 23805 }, { "entropy": 5.6757584571838375, "epoch": 2.3536971134835905, "grad_norm": 0.9921875, "learning_rate": 0.0004448232889648109, "loss": 4.9542, "mean_token_accuracy": 0.2257176533341408, "num_tokens": 54542798.0, "step": 23810 }, { "entropy": 5.639838695526123, "epoch": 2.3541913799920917, "grad_norm": 1.125, "learning_rate": 0.0004448001370245835, "loss": 5.057, "mean_token_accuracy": 0.2142079919576645, "num_tokens": 54554551.0, "step": 23815 }, { "entropy": 5.697571659088135, "epoch": 2.354685646500593, "grad_norm": 1.2421875, "learning_rate": 0.00044477698090724635, "loss": 5.0607, "mean_token_accuracy": 0.21112409085035325, "num_tokens": 54564711.0, "step": 23820 }, { "entropy": 5.709876680374146, "epoch": 2.3551799130090947, "grad_norm": 1.0234375, "learning_rate": 0.00044475382061336913, "loss": 5.0627, "mean_token_accuracy": 0.2137662723660469, "num_tokens": 54576096.0, "step": 23825 }, { "entropy": 5.665984678268432, "epoch": 2.355674179517596, "grad_norm": 1.0859375, "learning_rate": 0.0004447306561435215, "loss": 5.0475, "mean_token_accuracy": 0.21065954566001893, "num_tokens": 54587939.0, "step": 23830 }, { "entropy": 5.699896287918091, "epoch": 2.356168446026097, "grad_norm": 1.1171875, "learning_rate": 0.00044470748749827354, "loss": 4.9516, "mean_token_accuracy": 0.2186424434185028, "num_tokens": 54598470.0, "step": 23835 }, { "entropy": 5.708815240859986, "epoch": 2.3566627125345985, "grad_norm": 1.265625, "learning_rate": 0.00044468431467819505, "loss": 5.007, "mean_token_accuracy": 0.21999007910490037, "num_tokens": 54608840.0, "step": 23840 }, { "entropy": 5.669919538497925, "epoch": 2.3571569790431, "grad_norm": 1.140625, "learning_rate": 0.000444661137683856, "loss": 4.9963, "mean_token_accuracy": 0.21669238656759263, "num_tokens": 54619319.0, "step": 23845 }, { "entropy": 5.633040189743042, "epoch": 2.3576512455516014, "grad_norm": 1.1171875, "learning_rate": 0.0004446379565158268, "loss": 4.9947, "mean_token_accuracy": 0.2215055838227272, "num_tokens": 54630410.0, "step": 23850 }, { "entropy": 5.717750406265258, "epoch": 2.3581455120601027, "grad_norm": 1.0859375, "learning_rate": 0.0004446147711746774, "loss": 5.1063, "mean_token_accuracy": 0.20812556147575378, "num_tokens": 54642376.0, "step": 23855 }, { "entropy": 5.681838417053223, "epoch": 2.3586397785686044, "grad_norm": 1.1484375, "learning_rate": 0.0004445915816609784, "loss": 4.9934, "mean_token_accuracy": 0.21400044113397598, "num_tokens": 54654378.0, "step": 23860 }, { "entropy": 5.651501703262329, "epoch": 2.3591340450771057, "grad_norm": 1.2421875, "learning_rate": 0.00044456838797530006, "loss": 4.9813, "mean_token_accuracy": 0.21630917638540267, "num_tokens": 54664879.0, "step": 23865 }, { "entropy": 5.640066814422608, "epoch": 2.359628311585607, "grad_norm": 1.0859375, "learning_rate": 0.0004445451901182132, "loss": 5.0012, "mean_token_accuracy": 0.21393912732601167, "num_tokens": 54677251.0, "step": 23870 }, { "entropy": 5.6589438915252686, "epoch": 2.360122578094108, "grad_norm": 1.203125, "learning_rate": 0.0004445219880902884, "loss": 4.9709, "mean_token_accuracy": 0.21162965893745422, "num_tokens": 54688827.0, "step": 23875 }, { "entropy": 5.613009691238403, "epoch": 2.36061684460261, "grad_norm": 1.1640625, "learning_rate": 0.0004444987818920963, "loss": 5.0434, "mean_token_accuracy": 0.21211196333169938, "num_tokens": 54701046.0, "step": 23880 }, { "entropy": 5.723282146453857, "epoch": 2.361111111111111, "grad_norm": 1.046875, "learning_rate": 0.0004444755715242078, "loss": 5.0838, "mean_token_accuracy": 0.20903788954019548, "num_tokens": 54713254.0, "step": 23885 }, { "entropy": 5.6945147037506105, "epoch": 2.3616053776196124, "grad_norm": 1.1015625, "learning_rate": 0.00044445235698719406, "loss": 4.9467, "mean_token_accuracy": 0.22054114192724228, "num_tokens": 54723734.0, "step": 23890 }, { "entropy": 5.712226533889771, "epoch": 2.362099644128114, "grad_norm": 1.140625, "learning_rate": 0.000444429138281626, "loss": 5.0303, "mean_token_accuracy": 0.21615202277898787, "num_tokens": 54735080.0, "step": 23895 }, { "entropy": 5.598332309722901, "epoch": 2.3625939106366154, "grad_norm": 1.1640625, "learning_rate": 0.00044440591540807496, "loss": 4.9297, "mean_token_accuracy": 0.2242228150367737, "num_tokens": 54745164.0, "step": 23900 }, { "entropy": 5.6097643852233885, "epoch": 2.3630881771451167, "grad_norm": 1.1328125, "learning_rate": 0.000444382688367112, "loss": 5.0331, "mean_token_accuracy": 0.21686645448207856, "num_tokens": 54757350.0, "step": 23905 }, { "entropy": 5.641051244735718, "epoch": 2.363582443653618, "grad_norm": 1.15625, "learning_rate": 0.00044435945715930864, "loss": 4.9195, "mean_token_accuracy": 0.22130585908889772, "num_tokens": 54768290.0, "step": 23910 }, { "entropy": 5.699190378189087, "epoch": 2.364076710162119, "grad_norm": 1.09375, "learning_rate": 0.0004443362217852364, "loss": 5.0611, "mean_token_accuracy": 0.2084745392203331, "num_tokens": 54779053.0, "step": 23915 }, { "entropy": 5.779437780380249, "epoch": 2.364570976670621, "grad_norm": 1.03125, "learning_rate": 0.0004443129822454668, "loss": 5.1514, "mean_token_accuracy": 0.2049174815416336, "num_tokens": 54789787.0, "step": 23920 }, { "entropy": 5.718475675582885, "epoch": 2.365065243179122, "grad_norm": 1.0078125, "learning_rate": 0.00044428973854057164, "loss": 5.0492, "mean_token_accuracy": 0.2186028927564621, "num_tokens": 54802036.0, "step": 23925 }, { "entropy": 5.681513977050781, "epoch": 2.3655595096876234, "grad_norm": 1.171875, "learning_rate": 0.00044426649067112257, "loss": 5.0329, "mean_token_accuracy": 0.21332904398441316, "num_tokens": 54811765.0, "step": 23930 }, { "entropy": 5.630385494232177, "epoch": 2.366053776196125, "grad_norm": 1.2265625, "learning_rate": 0.0004442432386376916, "loss": 4.9873, "mean_token_accuracy": 0.22059177309274675, "num_tokens": 54823057.0, "step": 23935 }, { "entropy": 5.65553994178772, "epoch": 2.3665480427046264, "grad_norm": 1.1953125, "learning_rate": 0.00044421998244085066, "loss": 5.012, "mean_token_accuracy": 0.21475279778242112, "num_tokens": 54834070.0, "step": 23940 }, { "entropy": 5.628724002838135, "epoch": 2.3670423092131276, "grad_norm": 1.109375, "learning_rate": 0.00044419672208117204, "loss": 5.0118, "mean_token_accuracy": 0.21337459087371827, "num_tokens": 54845913.0, "step": 23945 }, { "entropy": 5.670712232589722, "epoch": 2.367536575721629, "grad_norm": 1.1328125, "learning_rate": 0.0004441734575592276, "loss": 5.0297, "mean_token_accuracy": 0.21595293581485747, "num_tokens": 54856721.0, "step": 23950 }, { "entropy": 5.7325849533081055, "epoch": 2.3680308422301306, "grad_norm": 1.09375, "learning_rate": 0.00044415018887559, "loss": 5.0404, "mean_token_accuracy": 0.2144642159342766, "num_tokens": 54868652.0, "step": 23955 }, { "entropy": 5.637701940536499, "epoch": 2.368525108738632, "grad_norm": 1.15625, "learning_rate": 0.0004441269160308315, "loss": 4.9334, "mean_token_accuracy": 0.22737201899290085, "num_tokens": 54880753.0, "step": 23960 }, { "entropy": 5.570465612411499, "epoch": 2.369019375247133, "grad_norm": 1.21875, "learning_rate": 0.00044410363902552466, "loss": 4.9095, "mean_token_accuracy": 0.23207402974367142, "num_tokens": 54891724.0, "step": 23965 }, { "entropy": 5.697908544540406, "epoch": 2.369513641755635, "grad_norm": 1.125, "learning_rate": 0.000444080357860242, "loss": 5.0384, "mean_token_accuracy": 0.21368204802274704, "num_tokens": 54902516.0, "step": 23970 }, { "entropy": 5.6927961826324465, "epoch": 2.370007908264136, "grad_norm": 1.1015625, "learning_rate": 0.00044405707253555626, "loss": 5.0506, "mean_token_accuracy": 0.2173882320523262, "num_tokens": 54914392.0, "step": 23975 }, { "entropy": 5.6504237174987795, "epoch": 2.3705021747726374, "grad_norm": 1.21875, "learning_rate": 0.0004440337830520404, "loss": 4.9179, "mean_token_accuracy": 0.22457821816205978, "num_tokens": 54925209.0, "step": 23980 }, { "entropy": 5.676028394699097, "epoch": 2.3709964412811386, "grad_norm": 1.1953125, "learning_rate": 0.00044401048941026725, "loss": 4.9438, "mean_token_accuracy": 0.21309418082237244, "num_tokens": 54935972.0, "step": 23985 }, { "entropy": 5.641994619369507, "epoch": 2.3714907077896403, "grad_norm": 1.1953125, "learning_rate": 0.0004439871916108098, "loss": 4.936, "mean_token_accuracy": 0.22319420129060746, "num_tokens": 54945631.0, "step": 23990 }, { "entropy": 5.651434469223022, "epoch": 2.3719849742981416, "grad_norm": 1.171875, "learning_rate": 0.00044396388965424124, "loss": 5.0168, "mean_token_accuracy": 0.21790778189897536, "num_tokens": 54955734.0, "step": 23995 }, { "entropy": 5.67791519165039, "epoch": 2.372479240806643, "grad_norm": 1.0859375, "learning_rate": 0.0004439405835411348, "loss": 5.0563, "mean_token_accuracy": 0.2126620590686798, "num_tokens": 54968506.0, "step": 24000 }, { "epoch": 2.372479240806643, "eval_entropy": 5.495205940795561, "eval_loss": 5.071153163909912, "eval_mean_token_accuracy": 0.22140243299222961, "eval_num_tokens": 54968506.0, "eval_runtime": 20.5129, "eval_samples_per_second": 1585.002, "eval_steps_per_second": 198.168, "step": 24000 }, { "entropy": 5.71533899307251, "epoch": 2.3729735073151446, "grad_norm": 1.0390625, "learning_rate": 0.0004439172732720637, "loss": 4.9582, "mean_token_accuracy": 0.22417230010032654, "num_tokens": 54979809.0, "step": 24005 }, { "entropy": 5.727009201049805, "epoch": 2.373467773823646, "grad_norm": 1.0625, "learning_rate": 0.0004438939588476016, "loss": 5.1081, "mean_token_accuracy": 0.21223565191030502, "num_tokens": 54991276.0, "step": 24010 }, { "entropy": 5.665151500701905, "epoch": 2.373962040332147, "grad_norm": 1.1875, "learning_rate": 0.00044387064026832183, "loss": 5.0002, "mean_token_accuracy": 0.2188743531703949, "num_tokens": 55002320.0, "step": 24015 }, { "entropy": 5.561293268203736, "epoch": 2.3744563068406483, "grad_norm": 1.125, "learning_rate": 0.00044384731753479813, "loss": 4.8679, "mean_token_accuracy": 0.23687697649002076, "num_tokens": 55012995.0, "step": 24020 }, { "entropy": 5.645366764068603, "epoch": 2.37495057334915, "grad_norm": 1.0234375, "learning_rate": 0.00044382399064760424, "loss": 5.0469, "mean_token_accuracy": 0.21571362167596816, "num_tokens": 55025342.0, "step": 24025 }, { "entropy": 5.602294635772705, "epoch": 2.3754448398576513, "grad_norm": 1.0703125, "learning_rate": 0.000443800659607314, "loss": 5.0054, "mean_token_accuracy": 0.22263902872800828, "num_tokens": 55036925.0, "step": 24030 }, { "entropy": 5.722566080093384, "epoch": 2.3759391063661526, "grad_norm": 1.0625, "learning_rate": 0.0004437773244145013, "loss": 5.0077, "mean_token_accuracy": 0.20871272683143616, "num_tokens": 55048913.0, "step": 24035 }, { "entropy": 5.665289068222046, "epoch": 2.376433372874654, "grad_norm": 1.0703125, "learning_rate": 0.0004437539850697403, "loss": 4.9962, "mean_token_accuracy": 0.21763528138399124, "num_tokens": 55059654.0, "step": 24040 }, { "entropy": 5.740592002868652, "epoch": 2.3769276393831555, "grad_norm": 1.09375, "learning_rate": 0.00044373064157360504, "loss": 5.0654, "mean_token_accuracy": 0.21257323473691941, "num_tokens": 55071077.0, "step": 24045 }, { "entropy": 5.709898567199707, "epoch": 2.377421905891657, "grad_norm": 1.0390625, "learning_rate": 0.0004437072939266698, "loss": 5.0051, "mean_token_accuracy": 0.2170957773923874, "num_tokens": 55082659.0, "step": 24050 }, { "entropy": 5.6168194770812985, "epoch": 2.377916172400158, "grad_norm": 1.1953125, "learning_rate": 0.00044368394212950896, "loss": 5.0642, "mean_token_accuracy": 0.21388001441955568, "num_tokens": 55093938.0, "step": 24055 }, { "entropy": 5.714694356918335, "epoch": 2.3784104389086593, "grad_norm": 0.9765625, "learning_rate": 0.00044366058618269707, "loss": 5.0343, "mean_token_accuracy": 0.21535336524248122, "num_tokens": 55105491.0, "step": 24060 }, { "entropy": 5.63551139831543, "epoch": 2.378904705417161, "grad_norm": 1.0078125, "learning_rate": 0.0004436372260868085, "loss": 4.8939, "mean_token_accuracy": 0.22774088829755784, "num_tokens": 55116941.0, "step": 24065 }, { "entropy": 5.7483419418334964, "epoch": 2.3793989719256623, "grad_norm": 1.1171875, "learning_rate": 0.00044361386184241805, "loss": 5.0487, "mean_token_accuracy": 0.21291780322790146, "num_tokens": 55128294.0, "step": 24070 }, { "entropy": 5.75245213508606, "epoch": 2.3798932384341636, "grad_norm": 1.1875, "learning_rate": 0.00044359049345010044, "loss": 5.0508, "mean_token_accuracy": 0.21437966227531433, "num_tokens": 55139781.0, "step": 24075 }, { "entropy": 5.680056238174439, "epoch": 2.3803875049426653, "grad_norm": 1.0859375, "learning_rate": 0.0004435671209104305, "loss": 4.9903, "mean_token_accuracy": 0.21878640949726105, "num_tokens": 55151517.0, "step": 24080 }, { "entropy": 5.594570970535278, "epoch": 2.3808817714511665, "grad_norm": 1.0703125, "learning_rate": 0.0004435437442239833, "loss": 4.9795, "mean_token_accuracy": 0.22098229974508285, "num_tokens": 55163029.0, "step": 24085 }, { "entropy": 5.5961638450622555, "epoch": 2.381376037959668, "grad_norm": 1.0859375, "learning_rate": 0.0004435203633913337, "loss": 4.9403, "mean_token_accuracy": 0.22853411138057708, "num_tokens": 55174262.0, "step": 24090 }, { "entropy": 5.643753385543823, "epoch": 2.381870304468169, "grad_norm": 1.1171875, "learning_rate": 0.00044349697841305715, "loss": 4.9852, "mean_token_accuracy": 0.22451517283916472, "num_tokens": 55185047.0, "step": 24095 }, { "entropy": 5.673589468002319, "epoch": 2.3823645709766708, "grad_norm": 1.109375, "learning_rate": 0.00044347358928972883, "loss": 4.9989, "mean_token_accuracy": 0.21840925216674806, "num_tokens": 55196396.0, "step": 24100 }, { "entropy": 5.670108318328857, "epoch": 2.382858837485172, "grad_norm": 1.0078125, "learning_rate": 0.0004434501960219239, "loss": 5.0419, "mean_token_accuracy": 0.21966529339551927, "num_tokens": 55208774.0, "step": 24105 }, { "entropy": 5.695929670333863, "epoch": 2.3833531039936733, "grad_norm": 1.109375, "learning_rate": 0.0004434267986102181, "loss": 5.0177, "mean_token_accuracy": 0.20808807462453843, "num_tokens": 55219946.0, "step": 24110 }, { "entropy": 5.673986101150513, "epoch": 2.383847370502175, "grad_norm": 1.171875, "learning_rate": 0.000443403397055187, "loss": 5.0752, "mean_token_accuracy": 0.21460306644439697, "num_tokens": 55231926.0, "step": 24115 }, { "entropy": 5.635173320770264, "epoch": 2.3843416370106763, "grad_norm": 1.015625, "learning_rate": 0.00044337999135740614, "loss": 4.9659, "mean_token_accuracy": 0.21592362374067306, "num_tokens": 55245240.0, "step": 24120 }, { "entropy": 5.733977317810059, "epoch": 2.3848359035191775, "grad_norm": 1.171875, "learning_rate": 0.0004433565815174514, "loss": 5.0389, "mean_token_accuracy": 0.21592750251293183, "num_tokens": 55256862.0, "step": 24125 }, { "entropy": 5.653119230270386, "epoch": 2.3853301700276788, "grad_norm": 1.046875, "learning_rate": 0.00044333316753589864, "loss": 5.0002, "mean_token_accuracy": 0.2151127353310585, "num_tokens": 55268157.0, "step": 24130 }, { "entropy": 5.680840682983399, "epoch": 2.3858244365361805, "grad_norm": 1.125, "learning_rate": 0.0004433097494133238, "loss": 5.0645, "mean_token_accuracy": 0.21176636070013047, "num_tokens": 55279580.0, "step": 24135 }, { "entropy": 5.763088130950928, "epoch": 2.3863187030446817, "grad_norm": 1.140625, "learning_rate": 0.00044328632715030303, "loss": 5.2072, "mean_token_accuracy": 0.19810367822647096, "num_tokens": 55292067.0, "step": 24140 }, { "entropy": 5.669901418685913, "epoch": 2.386812969553183, "grad_norm": 1.0546875, "learning_rate": 0.00044326290074741257, "loss": 4.9832, "mean_token_accuracy": 0.2228647217154503, "num_tokens": 55303338.0, "step": 24145 }, { "entropy": 5.675422048568725, "epoch": 2.3873072360616843, "grad_norm": 1.0546875, "learning_rate": 0.0004432394702052286, "loss": 5.0609, "mean_token_accuracy": 0.2061280280351639, "num_tokens": 55315165.0, "step": 24150 }, { "entropy": 5.703721380233764, "epoch": 2.387801502570186, "grad_norm": 1.03125, "learning_rate": 0.00044321603552432753, "loss": 5.0451, "mean_token_accuracy": 0.20892222225666046, "num_tokens": 55327928.0, "step": 24155 }, { "entropy": 5.652971887588501, "epoch": 2.3882957690786872, "grad_norm": 1.0390625, "learning_rate": 0.00044319259670528595, "loss": 4.9635, "mean_token_accuracy": 0.22193489521741866, "num_tokens": 55338438.0, "step": 24160 }, { "entropy": 5.613698482513428, "epoch": 2.3887900355871885, "grad_norm": 1.1640625, "learning_rate": 0.00044316915374868033, "loss": 4.9408, "mean_token_accuracy": 0.22139861881732942, "num_tokens": 55349513.0, "step": 24165 }, { "entropy": 5.621834754943848, "epoch": 2.3892843020956898, "grad_norm": 1.0390625, "learning_rate": 0.00044314570665508746, "loss": 5.0477, "mean_token_accuracy": 0.21473981589078903, "num_tokens": 55362498.0, "step": 24170 }, { "entropy": 5.698979997634888, "epoch": 2.3897785686041915, "grad_norm": 1.0625, "learning_rate": 0.0004431222554250841, "loss": 5.0195, "mean_token_accuracy": 0.21215529441833497, "num_tokens": 55374065.0, "step": 24175 }, { "entropy": 5.660956478118896, "epoch": 2.3902728351126927, "grad_norm": 1.1484375, "learning_rate": 0.00044309880005924726, "loss": 4.9878, "mean_token_accuracy": 0.22342018634080887, "num_tokens": 55385175.0, "step": 24180 }, { "entropy": 5.728198623657226, "epoch": 2.390767101621194, "grad_norm": 1.2421875, "learning_rate": 0.00044307534055815375, "loss": 5.0876, "mean_token_accuracy": 0.20970371067523957, "num_tokens": 55395457.0, "step": 24185 }, { "entropy": 5.683646154403687, "epoch": 2.3912613681296957, "grad_norm": 1.0625, "learning_rate": 0.00044305187692238087, "loss": 5.0155, "mean_token_accuracy": 0.2163003697991371, "num_tokens": 55406341.0, "step": 24190 }, { "entropy": 5.695096635818482, "epoch": 2.391755634638197, "grad_norm": 1.203125, "learning_rate": 0.00044302840915250575, "loss": 4.9782, "mean_token_accuracy": 0.2140378847718239, "num_tokens": 55417893.0, "step": 24195 }, { "entropy": 5.685885334014893, "epoch": 2.392249901146698, "grad_norm": 1.2734375, "learning_rate": 0.0004430049372491056, "loss": 5.0688, "mean_token_accuracy": 0.2129547417163849, "num_tokens": 55428286.0, "step": 24200 }, { "entropy": 5.575006437301636, "epoch": 2.3927441676551995, "grad_norm": 1.0859375, "learning_rate": 0.00044298146121275804, "loss": 4.9365, "mean_token_accuracy": 0.22150723934173583, "num_tokens": 55439861.0, "step": 24205 }, { "entropy": 5.7483823776245115, "epoch": 2.393238434163701, "grad_norm": 1.1015625, "learning_rate": 0.0004429579810440404, "loss": 5.021, "mean_token_accuracy": 0.20894015282392503, "num_tokens": 55450971.0, "step": 24210 }, { "entropy": 5.7034608840942385, "epoch": 2.3937327006722025, "grad_norm": 1.2265625, "learning_rate": 0.0004429344967435305, "loss": 4.9999, "mean_token_accuracy": 0.20725676268339158, "num_tokens": 55460584.0, "step": 24215 }, { "entropy": 5.758437728881836, "epoch": 2.3942269671807037, "grad_norm": 1.1796875, "learning_rate": 0.00044291100831180577, "loss": 5.1205, "mean_token_accuracy": 0.20620004683732987, "num_tokens": 55471576.0, "step": 24220 }, { "entropy": 5.714835214614868, "epoch": 2.3947212336892054, "grad_norm": 1.171875, "learning_rate": 0.0004428875157494442, "loss": 5.0255, "mean_token_accuracy": 0.22211101055145263, "num_tokens": 55483807.0, "step": 24225 }, { "entropy": 5.667826223373413, "epoch": 2.3952155001977067, "grad_norm": 1.1328125, "learning_rate": 0.00044286401905702376, "loss": 5.0163, "mean_token_accuracy": 0.21918080300092696, "num_tokens": 55495130.0, "step": 24230 }, { "entropy": 5.6276264667510985, "epoch": 2.395709766706208, "grad_norm": 1.0859375, "learning_rate": 0.0004428405182351224, "loss": 4.9821, "mean_token_accuracy": 0.22084650844335557, "num_tokens": 55506460.0, "step": 24235 }, { "entropy": 5.731813430786133, "epoch": 2.396204033214709, "grad_norm": 1.09375, "learning_rate": 0.0004428170132843182, "loss": 5.0826, "mean_token_accuracy": 0.2139906570315361, "num_tokens": 55518401.0, "step": 24240 }, { "entropy": 5.707881593704224, "epoch": 2.396698299723211, "grad_norm": 1.015625, "learning_rate": 0.00044279350420518956, "loss": 4.9812, "mean_token_accuracy": 0.22103473246097566, "num_tokens": 55530403.0, "step": 24245 }, { "entropy": 5.715621566772461, "epoch": 2.397192566231712, "grad_norm": 1.078125, "learning_rate": 0.00044276999099831463, "loss": 5.0247, "mean_token_accuracy": 0.21752341240644454, "num_tokens": 55541422.0, "step": 24250 }, { "entropy": 5.670212650299073, "epoch": 2.3976868327402134, "grad_norm": 1.0625, "learning_rate": 0.00044274647366427186, "loss": 4.9733, "mean_token_accuracy": 0.21887525618076326, "num_tokens": 55553798.0, "step": 24255 }, { "entropy": 5.688078594207764, "epoch": 2.398181099248715, "grad_norm": 1.1328125, "learning_rate": 0.00044272295220363977, "loss": 5.0155, "mean_token_accuracy": 0.21859420984983444, "num_tokens": 55565970.0, "step": 24260 }, { "entropy": 5.695979499816895, "epoch": 2.3986753657572164, "grad_norm": 1.046875, "learning_rate": 0.0004426994266169971, "loss": 5.0617, "mean_token_accuracy": 0.21257923990488053, "num_tokens": 55576385.0, "step": 24265 }, { "entropy": 5.587963104248047, "epoch": 2.3991696322657177, "grad_norm": 1.03125, "learning_rate": 0.0004426758969049225, "loss": 4.939, "mean_token_accuracy": 0.23063060343265535, "num_tokens": 55588752.0, "step": 24270 }, { "entropy": 5.612295913696289, "epoch": 2.399663898774219, "grad_norm": 1.171875, "learning_rate": 0.0004426523630679949, "loss": 5.0014, "mean_token_accuracy": 0.21514350175857544, "num_tokens": 55599348.0, "step": 24275 }, { "entropy": 5.654560184478759, "epoch": 2.4001581652827206, "grad_norm": 1.171875, "learning_rate": 0.0004426288251067931, "loss": 4.9699, "mean_token_accuracy": 0.21450434178113936, "num_tokens": 55610168.0, "step": 24280 }, { "entropy": 5.681350469589233, "epoch": 2.400652431791222, "grad_norm": 1.140625, "learning_rate": 0.00044260528302189617, "loss": 5.0326, "mean_token_accuracy": 0.21115672290325166, "num_tokens": 55622487.0, "step": 24285 }, { "entropy": 5.7031796932220455, "epoch": 2.401146698299723, "grad_norm": 1.078125, "learning_rate": 0.0004425817368138833, "loss": 5.0498, "mean_token_accuracy": 0.21588754653930664, "num_tokens": 55634486.0, "step": 24290 }, { "entropy": 5.694023323059082, "epoch": 2.4016409648082244, "grad_norm": 1.09375, "learning_rate": 0.0004425581864833337, "loss": 5.0459, "mean_token_accuracy": 0.2158758357167244, "num_tokens": 55646642.0, "step": 24295 }, { "entropy": 5.602871036529541, "epoch": 2.402135231316726, "grad_norm": 1.1015625, "learning_rate": 0.0004425346320308267, "loss": 4.8949, "mean_token_accuracy": 0.23538341969251633, "num_tokens": 55657921.0, "step": 24300 }, { "entropy": 5.639219951629639, "epoch": 2.4026294978252274, "grad_norm": 0.96484375, "learning_rate": 0.0004425110734569418, "loss": 5.0163, "mean_token_accuracy": 0.2221133142709732, "num_tokens": 55669414.0, "step": 24305 }, { "entropy": 5.635937023162842, "epoch": 2.4031237643337287, "grad_norm": 1.1015625, "learning_rate": 0.00044248751076225853, "loss": 4.9571, "mean_token_accuracy": 0.22063554972410201, "num_tokens": 55681854.0, "step": 24310 }, { "entropy": 5.68591160774231, "epoch": 2.40361803084223, "grad_norm": 1.1015625, "learning_rate": 0.00044246394394735646, "loss": 4.9307, "mean_token_accuracy": 0.2212206169962883, "num_tokens": 55692458.0, "step": 24315 }, { "entropy": 5.698038959503174, "epoch": 2.4041122973507316, "grad_norm": 1.0625, "learning_rate": 0.00044244037301281535, "loss": 5.0132, "mean_token_accuracy": 0.21802736669778824, "num_tokens": 55703676.0, "step": 24320 }, { "entropy": 5.684928321838379, "epoch": 2.404606563859233, "grad_norm": 1.1015625, "learning_rate": 0.0004424167979592152, "loss": 5.0129, "mean_token_accuracy": 0.21255262196063995, "num_tokens": 55714372.0, "step": 24325 }, { "entropy": 5.686886548995972, "epoch": 2.405100830367734, "grad_norm": 1.1484375, "learning_rate": 0.0004423932187871358, "loss": 4.9882, "mean_token_accuracy": 0.21610285341739655, "num_tokens": 55724342.0, "step": 24330 }, { "entropy": 5.694574356079102, "epoch": 2.405595096876236, "grad_norm": 1.0625, "learning_rate": 0.0004423696354971572, "loss": 5.0925, "mean_token_accuracy": 0.20919658243656158, "num_tokens": 55736272.0, "step": 24335 }, { "entropy": 5.6718299865722654, "epoch": 2.406089363384737, "grad_norm": 1.0546875, "learning_rate": 0.0004423460480898596, "loss": 4.9731, "mean_token_accuracy": 0.2244173288345337, "num_tokens": 55747174.0, "step": 24340 }, { "entropy": 5.62099986076355, "epoch": 2.4065836298932384, "grad_norm": 1.0625, "learning_rate": 0.0004423224565658233, "loss": 4.913, "mean_token_accuracy": 0.22494356483221054, "num_tokens": 55759676.0, "step": 24345 }, { "entropy": 5.635448694229126, "epoch": 2.4070778964017396, "grad_norm": 1.0390625, "learning_rate": 0.0004422988609256286, "loss": 5.0307, "mean_token_accuracy": 0.21425362378358842, "num_tokens": 55772140.0, "step": 24350 }, { "entropy": 5.645157527923584, "epoch": 2.4075721629102413, "grad_norm": 1.078125, "learning_rate": 0.000442275261169856, "loss": 4.9538, "mean_token_accuracy": 0.21871390640735627, "num_tokens": 55783639.0, "step": 24355 }, { "entropy": 5.768876409530639, "epoch": 2.4080664294187426, "grad_norm": 1.0703125, "learning_rate": 0.00044225165729908604, "loss": 5.0911, "mean_token_accuracy": 0.20983131527900695, "num_tokens": 55795867.0, "step": 24360 }, { "entropy": 5.632832050323486, "epoch": 2.408560695927244, "grad_norm": 1.0390625, "learning_rate": 0.00044222804931389934, "loss": 4.9332, "mean_token_accuracy": 0.2237125262618065, "num_tokens": 55807528.0, "step": 24365 }, { "entropy": 5.615286827087402, "epoch": 2.4090549624357456, "grad_norm": 1.0703125, "learning_rate": 0.0004422044372148766, "loss": 4.9563, "mean_token_accuracy": 0.22373713105916976, "num_tokens": 55817547.0, "step": 24370 }, { "entropy": 5.586380481719971, "epoch": 2.409549228944247, "grad_norm": 1.1484375, "learning_rate": 0.00044218082100259883, "loss": 4.9415, "mean_token_accuracy": 0.22736895680427552, "num_tokens": 55828474.0, "step": 24375 }, { "entropy": 5.672614288330078, "epoch": 2.410043495452748, "grad_norm": 1.2265625, "learning_rate": 0.00044215720067764696, "loss": 4.955, "mean_token_accuracy": 0.22223177850246428, "num_tokens": 55838485.0, "step": 24380 }, { "entropy": 5.65007438659668, "epoch": 2.4105377619612494, "grad_norm": 1.0703125, "learning_rate": 0.000442133576240602, "loss": 5.0316, "mean_token_accuracy": 0.21676303893327714, "num_tokens": 55850219.0, "step": 24385 }, { "entropy": 5.635620832443237, "epoch": 2.411032028469751, "grad_norm": 1.2109375, "learning_rate": 0.0004421099476920451, "loss": 4.9112, "mean_token_accuracy": 0.22755282521247863, "num_tokens": 55860241.0, "step": 24390 }, { "entropy": 5.717881584167481, "epoch": 2.4115262949782523, "grad_norm": 1.0546875, "learning_rate": 0.0004420863150325575, "loss": 5.1245, "mean_token_accuracy": 0.20093853622674943, "num_tokens": 55871201.0, "step": 24395 }, { "entropy": 5.658941268920898, "epoch": 2.4120205614867536, "grad_norm": 1.1328125, "learning_rate": 0.0004420626782627208, "loss": 4.9322, "mean_token_accuracy": 0.2284773901104927, "num_tokens": 55881758.0, "step": 24400 }, { "entropy": 5.6776713848114015, "epoch": 2.412514827995255, "grad_norm": 1.0703125, "learning_rate": 0.00044203903738311616, "loss": 5.0156, "mean_token_accuracy": 0.2147562250494957, "num_tokens": 55892931.0, "step": 24405 }, { "entropy": 5.688210725784302, "epoch": 2.4130090945037566, "grad_norm": 1.203125, "learning_rate": 0.00044201539239432534, "loss": 5.0018, "mean_token_accuracy": 0.21955032348632814, "num_tokens": 55903376.0, "step": 24410 }, { "entropy": 5.745237922668457, "epoch": 2.413503361012258, "grad_norm": 1.2109375, "learning_rate": 0.00044199174329693, "loss": 5.0514, "mean_token_accuracy": 0.21398818194866182, "num_tokens": 55913821.0, "step": 24415 }, { "entropy": 5.662148809432983, "epoch": 2.413997627520759, "grad_norm": 1.1875, "learning_rate": 0.00044196809009151183, "loss": 5.0211, "mean_token_accuracy": 0.2126387059688568, "num_tokens": 55925085.0, "step": 24420 }, { "entropy": 5.6319129943847654, "epoch": 2.4144918940292603, "grad_norm": 1.015625, "learning_rate": 0.0004419444327786527, "loss": 5.0225, "mean_token_accuracy": 0.21670317649841309, "num_tokens": 55937572.0, "step": 24425 }, { "entropy": 5.667691946029663, "epoch": 2.414986160537762, "grad_norm": 1.0078125, "learning_rate": 0.0004419207713589347, "loss": 5.0024, "mean_token_accuracy": 0.21289613842964172, "num_tokens": 55948890.0, "step": 24430 }, { "entropy": 5.720224857330322, "epoch": 2.4154804270462633, "grad_norm": 1.2421875, "learning_rate": 0.0004418971058329398, "loss": 5.0668, "mean_token_accuracy": 0.20685085654258728, "num_tokens": 55959319.0, "step": 24435 }, { "entropy": 5.696013164520264, "epoch": 2.4159746935547646, "grad_norm": 1.078125, "learning_rate": 0.00044187343620125016, "loss": 5.0437, "mean_token_accuracy": 0.2142469361424446, "num_tokens": 55970922.0, "step": 24440 }, { "entropy": 5.671346664428711, "epoch": 2.4164689600632663, "grad_norm": 1.09375, "learning_rate": 0.00044184976246444815, "loss": 5.024, "mean_token_accuracy": 0.21596957445144654, "num_tokens": 55982610.0, "step": 24445 }, { "entropy": 5.705566930770874, "epoch": 2.4169632265717675, "grad_norm": 1.078125, "learning_rate": 0.00044182608462311606, "loss": 4.9343, "mean_token_accuracy": 0.2240268647670746, "num_tokens": 55994393.0, "step": 24450 }, { "entropy": 5.624672889709473, "epoch": 2.417457493080269, "grad_norm": 1.109375, "learning_rate": 0.00044180240267783637, "loss": 4.9046, "mean_token_accuracy": 0.22389164716005325, "num_tokens": 56005705.0, "step": 24455 }, { "entropy": 5.700733327865601, "epoch": 2.41795175958877, "grad_norm": 1.1328125, "learning_rate": 0.00044177871662919184, "loss": 5.0153, "mean_token_accuracy": 0.21178597807884217, "num_tokens": 56016942.0, "step": 24460 }, { "entropy": 5.7080597400665285, "epoch": 2.4184460260972718, "grad_norm": 1.0625, "learning_rate": 0.00044175502647776486, "loss": 5.0256, "mean_token_accuracy": 0.2120076298713684, "num_tokens": 56028495.0, "step": 24465 }, { "entropy": 5.7025776386260985, "epoch": 2.418940292605773, "grad_norm": 1.1953125, "learning_rate": 0.00044173133222413845, "loss": 5.0848, "mean_token_accuracy": 0.21206338852643966, "num_tokens": 56039654.0, "step": 24470 }, { "entropy": 5.664964008331299, "epoch": 2.4194345591142743, "grad_norm": 1.1328125, "learning_rate": 0.0004417076338688954, "loss": 4.9924, "mean_token_accuracy": 0.22174919098615647, "num_tokens": 56051392.0, "step": 24475 }, { "entropy": 5.622236728668213, "epoch": 2.419928825622776, "grad_norm": 1.1796875, "learning_rate": 0.00044168393141261864, "loss": 4.9181, "mean_token_accuracy": 0.2277354270219803, "num_tokens": 56062574.0, "step": 24480 }, { "entropy": 5.652249479293824, "epoch": 2.4204230921312773, "grad_norm": 1.1484375, "learning_rate": 0.00044166022485589136, "loss": 4.926, "mean_token_accuracy": 0.2230381190776825, "num_tokens": 56072637.0, "step": 24485 }, { "entropy": 5.641043376922608, "epoch": 2.4209173586397785, "grad_norm": 1.1796875, "learning_rate": 0.00044163651419929667, "loss": 4.958, "mean_token_accuracy": 0.22054929435253143, "num_tokens": 56083573.0, "step": 24490 }, { "entropy": 5.664576673507691, "epoch": 2.42141162514828, "grad_norm": 1.09375, "learning_rate": 0.00044161279944341785, "loss": 5.0039, "mean_token_accuracy": 0.2141207218170166, "num_tokens": 56094833.0, "step": 24495 }, { "entropy": 5.6440824508667, "epoch": 2.4219058916567815, "grad_norm": 1.046875, "learning_rate": 0.0004415890805888383, "loss": 4.9622, "mean_token_accuracy": 0.2187026172876358, "num_tokens": 56107750.0, "step": 24500 }, { "entropy": 5.65316333770752, "epoch": 2.4224001581652828, "grad_norm": 1.203125, "learning_rate": 0.00044156535763614167, "loss": 4.9588, "mean_token_accuracy": 0.22000904381275177, "num_tokens": 56118815.0, "step": 24505 }, { "entropy": 5.654229021072387, "epoch": 2.422894424673784, "grad_norm": 1.1796875, "learning_rate": 0.0004415416305859113, "loss": 5.0134, "mean_token_accuracy": 0.212288998067379, "num_tokens": 56129120.0, "step": 24510 }, { "entropy": 5.619678735733032, "epoch": 2.4233886911822857, "grad_norm": 1.09375, "learning_rate": 0.00044151789943873095, "loss": 4.9459, "mean_token_accuracy": 0.22148673683404924, "num_tokens": 56140293.0, "step": 24515 }, { "entropy": 5.746534442901611, "epoch": 2.423882957690787, "grad_norm": 0.97265625, "learning_rate": 0.0004414941641951845, "loss": 5.0538, "mean_token_accuracy": 0.21042693853378297, "num_tokens": 56151942.0, "step": 24520 }, { "entropy": 5.659108591079712, "epoch": 2.4243772241992882, "grad_norm": 1.1640625, "learning_rate": 0.00044147042485585575, "loss": 4.9833, "mean_token_accuracy": 0.21781952828168868, "num_tokens": 56163088.0, "step": 24525 }, { "entropy": 5.6389707088470455, "epoch": 2.4248714907077895, "grad_norm": 1.109375, "learning_rate": 0.0004414466814213287, "loss": 5.018, "mean_token_accuracy": 0.21804199665784835, "num_tokens": 56174879.0, "step": 24530 }, { "entropy": 5.715752124786377, "epoch": 2.425365757216291, "grad_norm": 1.1015625, "learning_rate": 0.0004414229338921875, "loss": 5.0431, "mean_token_accuracy": 0.217880317568779, "num_tokens": 56187407.0, "step": 24535 }, { "entropy": 5.6570347309112545, "epoch": 2.4258600237247925, "grad_norm": 1.0859375, "learning_rate": 0.00044139918226901627, "loss": 4.9189, "mean_token_accuracy": 0.22698651999235153, "num_tokens": 56198830.0, "step": 24540 }, { "entropy": 5.746195363998413, "epoch": 2.4263542902332937, "grad_norm": 1.03125, "learning_rate": 0.00044137542655239945, "loss": 5.0939, "mean_token_accuracy": 0.20447674244642258, "num_tokens": 56210779.0, "step": 24545 }, { "entropy": 5.647099781036377, "epoch": 2.426848556741795, "grad_norm": 1.2109375, "learning_rate": 0.0004413516667429212, "loss": 4.9903, "mean_token_accuracy": 0.21783885806798936, "num_tokens": 56222258.0, "step": 24550 }, { "entropy": 5.606891298294068, "epoch": 2.4273428232502967, "grad_norm": 1.25, "learning_rate": 0.0004413279028411662, "loss": 4.9558, "mean_token_accuracy": 0.22344013154506684, "num_tokens": 56232834.0, "step": 24555 }, { "entropy": 5.616108560562134, "epoch": 2.427837089758798, "grad_norm": 1.203125, "learning_rate": 0.000441304134847719, "loss": 4.9295, "mean_token_accuracy": 0.2182505488395691, "num_tokens": 56244517.0, "step": 24560 }, { "entropy": 5.757014894485474, "epoch": 2.4283313562672992, "grad_norm": 1.125, "learning_rate": 0.00044128036276316424, "loss": 5.1029, "mean_token_accuracy": 0.21037830859422685, "num_tokens": 56256629.0, "step": 24565 }, { "entropy": 5.736163139343262, "epoch": 2.4288256227758005, "grad_norm": 1.0546875, "learning_rate": 0.00044125658658808676, "loss": 5.1353, "mean_token_accuracy": 0.20654115080833435, "num_tokens": 56268992.0, "step": 24570 }, { "entropy": 5.5915507793426515, "epoch": 2.429319889284302, "grad_norm": 1.046875, "learning_rate": 0.0004412328063230715, "loss": 4.9362, "mean_token_accuracy": 0.2265341490507126, "num_tokens": 56281588.0, "step": 24575 }, { "entropy": 5.74658522605896, "epoch": 2.4298141557928035, "grad_norm": 1.0703125, "learning_rate": 0.0004412090219687034, "loss": 5.1159, "mean_token_accuracy": 0.20606843531131744, "num_tokens": 56292587.0, "step": 24580 }, { "entropy": 5.6768317222595215, "epoch": 2.4303084223013047, "grad_norm": 1.0390625, "learning_rate": 0.00044118523352556756, "loss": 5.0018, "mean_token_accuracy": 0.21250355392694473, "num_tokens": 56304873.0, "step": 24585 }, { "entropy": 5.646546459197998, "epoch": 2.4308026888098064, "grad_norm": 1.203125, "learning_rate": 0.0004411614409942492, "loss": 4.9677, "mean_token_accuracy": 0.2191954031586647, "num_tokens": 56316048.0, "step": 24590 }, { "entropy": 5.637232160568237, "epoch": 2.4312969553183077, "grad_norm": 1.078125, "learning_rate": 0.00044113764437533356, "loss": 4.9827, "mean_token_accuracy": 0.2216390401124954, "num_tokens": 56328185.0, "step": 24595 }, { "entropy": 5.7336516857147215, "epoch": 2.431791221826809, "grad_norm": 0.9375, "learning_rate": 0.0004411138436694062, "loss": 5.1007, "mean_token_accuracy": 0.20844763070344924, "num_tokens": 56341533.0, "step": 24600 }, { "entropy": 5.8027015209198, "epoch": 2.43228548833531, "grad_norm": 1.25, "learning_rate": 0.00044109003887705245, "loss": 5.1631, "mean_token_accuracy": 0.20699408352375032, "num_tokens": 56351610.0, "step": 24605 }, { "entropy": 5.7029906749725345, "epoch": 2.432779754843812, "grad_norm": 1.125, "learning_rate": 0.000441066229998858, "loss": 5.0258, "mean_token_accuracy": 0.21874250769615172, "num_tokens": 56361822.0, "step": 24610 }, { "entropy": 5.6800535202026365, "epoch": 2.433274021352313, "grad_norm": 1.0625, "learning_rate": 0.00044104241703540854, "loss": 5.0228, "mean_token_accuracy": 0.21563208401203154, "num_tokens": 56373432.0, "step": 24615 }, { "entropy": 5.661668300628662, "epoch": 2.4337682878608144, "grad_norm": 1.1015625, "learning_rate": 0.0004410185999872898, "loss": 4.9928, "mean_token_accuracy": 0.2187672510743141, "num_tokens": 56385086.0, "step": 24620 }, { "entropy": 5.720230960845948, "epoch": 2.434262554369316, "grad_norm": 1.2109375, "learning_rate": 0.00044099477885508774, "loss": 4.9921, "mean_token_accuracy": 0.21573259085416793, "num_tokens": 56395963.0, "step": 24625 }, { "entropy": 5.725389528274536, "epoch": 2.4347568208778174, "grad_norm": 1.1328125, "learning_rate": 0.00044097095363938843, "loss": 5.063, "mean_token_accuracy": 0.20798081457614898, "num_tokens": 56407685.0, "step": 24630 }, { "entropy": 5.680238246917725, "epoch": 2.4352510873863187, "grad_norm": 1.109375, "learning_rate": 0.0004409471243407779, "loss": 4.9871, "mean_token_accuracy": 0.21958784610033036, "num_tokens": 56418570.0, "step": 24635 }, { "entropy": 5.720429992675781, "epoch": 2.43574535389482, "grad_norm": 1.078125, "learning_rate": 0.0004409232909598424, "loss": 5.0455, "mean_token_accuracy": 0.21304434835910796, "num_tokens": 56430312.0, "step": 24640 }, { "entropy": 5.7441215991973875, "epoch": 2.4362396204033216, "grad_norm": 1.03125, "learning_rate": 0.0004408994534971682, "loss": 5.0993, "mean_token_accuracy": 0.2052801087498665, "num_tokens": 56441847.0, "step": 24645 }, { "entropy": 5.688012886047363, "epoch": 2.436733886911823, "grad_norm": 1.078125, "learning_rate": 0.00044087561195334165, "loss": 5.0019, "mean_token_accuracy": 0.21972954124212266, "num_tokens": 56453567.0, "step": 24650 }, { "entropy": 5.689534759521484, "epoch": 2.437228153420324, "grad_norm": 1.1328125, "learning_rate": 0.0004408517663289493, "loss": 5.0168, "mean_token_accuracy": 0.21641867160797118, "num_tokens": 56464726.0, "step": 24655 }, { "entropy": 5.664986419677734, "epoch": 2.4377224199288254, "grad_norm": 1.125, "learning_rate": 0.0004408279166245778, "loss": 5.0102, "mean_token_accuracy": 0.21572286784648895, "num_tokens": 56475989.0, "step": 24660 }, { "entropy": 5.713948059082031, "epoch": 2.438216686437327, "grad_norm": 1.0703125, "learning_rate": 0.00044080406284081387, "loss": 5.0057, "mean_token_accuracy": 0.21967438310384751, "num_tokens": 56487782.0, "step": 24665 }, { "entropy": 5.675281667709351, "epoch": 2.4387109529458284, "grad_norm": 1.2109375, "learning_rate": 0.0004407802049782442, "loss": 5.0207, "mean_token_accuracy": 0.215204681456089, "num_tokens": 56500529.0, "step": 24670 }, { "entropy": 5.586161518096924, "epoch": 2.4392052194543297, "grad_norm": 1.0390625, "learning_rate": 0.0004407563430374558, "loss": 4.9606, "mean_token_accuracy": 0.21975905299186707, "num_tokens": 56512411.0, "step": 24675 }, { "entropy": 5.650100803375244, "epoch": 2.439699485962831, "grad_norm": 1.1015625, "learning_rate": 0.0004407324770190357, "loss": 4.8867, "mean_token_accuracy": 0.2270260453224182, "num_tokens": 56522983.0, "step": 24680 }, { "entropy": 5.6379321098327635, "epoch": 2.4401937524713326, "grad_norm": 1.0859375, "learning_rate": 0.00044070860692357086, "loss": 5.039, "mean_token_accuracy": 0.21439638137817382, "num_tokens": 56534380.0, "step": 24685 }, { "entropy": 5.634187793731689, "epoch": 2.440688018979834, "grad_norm": 1.0390625, "learning_rate": 0.00044068473275164863, "loss": 5.0215, "mean_token_accuracy": 0.21479888409376144, "num_tokens": 56546003.0, "step": 24690 }, { "entropy": 5.631953477859497, "epoch": 2.441182285488335, "grad_norm": 1.109375, "learning_rate": 0.0004406608545038563, "loss": 4.9154, "mean_token_accuracy": 0.22390684485435486, "num_tokens": 56556006.0, "step": 24695 }, { "entropy": 5.641700744628906, "epoch": 2.441676551996837, "grad_norm": 1.109375, "learning_rate": 0.0004406369721807812, "loss": 4.9543, "mean_token_accuracy": 0.22098313719034196, "num_tokens": 56567569.0, "step": 24700 }, { "entropy": 5.626941204071045, "epoch": 2.442170818505338, "grad_norm": 1.109375, "learning_rate": 0.0004406130857830109, "loss": 5.0479, "mean_token_accuracy": 0.21779407560825348, "num_tokens": 56580143.0, "step": 24705 }, { "entropy": 5.669708108901977, "epoch": 2.4426650850138394, "grad_norm": 1.03125, "learning_rate": 0.000440589195311133, "loss": 4.959, "mean_token_accuracy": 0.22387165278196336, "num_tokens": 56591169.0, "step": 24710 }, { "entropy": 5.672441005706787, "epoch": 2.4431593515223406, "grad_norm": 1.015625, "learning_rate": 0.00044056530076573515, "loss": 5.0078, "mean_token_accuracy": 0.21476769596338272, "num_tokens": 56602556.0, "step": 24715 }, { "entropy": 5.674004983901978, "epoch": 2.4436536180308424, "grad_norm": 1.0234375, "learning_rate": 0.0004405414021474053, "loss": 4.9768, "mean_token_accuracy": 0.2264782518148422, "num_tokens": 56614854.0, "step": 24720 }, { "entropy": 5.639186668395996, "epoch": 2.4441478845393436, "grad_norm": 1.0859375, "learning_rate": 0.0004405174994567313, "loss": 4.9198, "mean_token_accuracy": 0.2222625955939293, "num_tokens": 56626004.0, "step": 24725 }, { "entropy": 5.777587413787842, "epoch": 2.444642151047845, "grad_norm": 1.21875, "learning_rate": 0.00044049359269430105, "loss": 5.049, "mean_token_accuracy": 0.21429750472307205, "num_tokens": 56636373.0, "step": 24730 }, { "entropy": 5.635915517807007, "epoch": 2.4451364175563466, "grad_norm": 1.1875, "learning_rate": 0.0004404696818607028, "loss": 4.8996, "mean_token_accuracy": 0.2281292513012886, "num_tokens": 56648414.0, "step": 24735 }, { "entropy": 5.665419960021973, "epoch": 2.445630684064848, "grad_norm": 1.140625, "learning_rate": 0.00044044576695652463, "loss": 4.9957, "mean_token_accuracy": 0.21772778332233428, "num_tokens": 56660430.0, "step": 24740 }, { "entropy": 5.649163293838501, "epoch": 2.446124950573349, "grad_norm": 1.1640625, "learning_rate": 0.000440421847982355, "loss": 4.9943, "mean_token_accuracy": 0.2177042081952095, "num_tokens": 56671133.0, "step": 24745 }, { "entropy": 5.695397520065308, "epoch": 2.4466192170818504, "grad_norm": 1.09375, "learning_rate": 0.0004403979249387822, "loss": 5.0717, "mean_token_accuracy": 0.21322779953479767, "num_tokens": 56682788.0, "step": 24750 }, { "entropy": 5.659640216827393, "epoch": 2.447113483590352, "grad_norm": 1.046875, "learning_rate": 0.0004403739978263948, "loss": 5.0185, "mean_token_accuracy": 0.21997392773628235, "num_tokens": 56693832.0, "step": 24755 }, { "entropy": 5.705827283859253, "epoch": 2.4476077500988533, "grad_norm": 1.03125, "learning_rate": 0.00044035006664578145, "loss": 5.0638, "mean_token_accuracy": 0.2102128252387047, "num_tokens": 56705915.0, "step": 24760 }, { "entropy": 5.669723033905029, "epoch": 2.4481020166073546, "grad_norm": 1.0859375, "learning_rate": 0.00044032613139753077, "loss": 4.9867, "mean_token_accuracy": 0.22068042755126954, "num_tokens": 56717461.0, "step": 24765 }, { "entropy": 5.610535907745361, "epoch": 2.4485962831158563, "grad_norm": 1.0546875, "learning_rate": 0.0004403021920822316, "loss": 4.8569, "mean_token_accuracy": 0.23334282338619233, "num_tokens": 56728695.0, "step": 24770 }, { "entropy": 5.649751901626587, "epoch": 2.4490905496243576, "grad_norm": 1.1484375, "learning_rate": 0.0004402782487004728, "loss": 4.9543, "mean_token_accuracy": 0.21636142134666442, "num_tokens": 56740520.0, "step": 24775 }, { "entropy": 5.580807638168335, "epoch": 2.449584816132859, "grad_norm": 1.125, "learning_rate": 0.00044025430125284353, "loss": 4.9017, "mean_token_accuracy": 0.22548197507858275, "num_tokens": 56751071.0, "step": 24780 }, { "entropy": 5.698151874542236, "epoch": 2.45007908264136, "grad_norm": 1.0703125, "learning_rate": 0.0004402303497399329, "loss": 5.0729, "mean_token_accuracy": 0.2098132073879242, "num_tokens": 56764759.0, "step": 24785 }, { "entropy": 5.734591054916382, "epoch": 2.4505733491498614, "grad_norm": 1.21875, "learning_rate": 0.00044020639416232984, "loss": 5.0457, "mean_token_accuracy": 0.21618868857622148, "num_tokens": 56775592.0, "step": 24790 }, { "entropy": 5.698403835296631, "epoch": 2.451067615658363, "grad_norm": 1.203125, "learning_rate": 0.000440182434520624, "loss": 5.1041, "mean_token_accuracy": 0.20755320489406587, "num_tokens": 56786860.0, "step": 24795 }, { "entropy": 5.683164501190186, "epoch": 2.4515618821668643, "grad_norm": 1.0703125, "learning_rate": 0.0004401584708154045, "loss": 5.0408, "mean_token_accuracy": 0.21671999394893646, "num_tokens": 56798741.0, "step": 24800 }, { "entropy": 5.69742636680603, "epoch": 2.4520561486753656, "grad_norm": 1.109375, "learning_rate": 0.00044013450304726114, "loss": 4.9792, "mean_token_accuracy": 0.2199311926960945, "num_tokens": 56810612.0, "step": 24805 }, { "entropy": 5.62714638710022, "epoch": 2.4525504151838673, "grad_norm": 1.2421875, "learning_rate": 0.0004401105312167833, "loss": 5.014, "mean_token_accuracy": 0.218637552857399, "num_tokens": 56822169.0, "step": 24810 }, { "entropy": 5.639250183105469, "epoch": 2.4530446816923686, "grad_norm": 1.0625, "learning_rate": 0.0004400865553245608, "loss": 4.9609, "mean_token_accuracy": 0.22391692399978638, "num_tokens": 56833873.0, "step": 24815 }, { "entropy": 5.734986257553101, "epoch": 2.45353894820087, "grad_norm": 1.1875, "learning_rate": 0.00044006257537118344, "loss": 4.9183, "mean_token_accuracy": 0.22980219423770903, "num_tokens": 56844616.0, "step": 24820 }, { "entropy": 5.688593244552612, "epoch": 2.454033214709371, "grad_norm": 1.078125, "learning_rate": 0.0004400385913572412, "loss": 5.0114, "mean_token_accuracy": 0.2106737896800041, "num_tokens": 56855877.0, "step": 24825 }, { "entropy": 5.648899364471435, "epoch": 2.454527481217873, "grad_norm": 1.078125, "learning_rate": 0.00044001460328332387, "loss": 5.0072, "mean_token_accuracy": 0.21450023353099823, "num_tokens": 56868103.0, "step": 24830 }, { "entropy": 5.708245468139649, "epoch": 2.455021747726374, "grad_norm": 1.046875, "learning_rate": 0.0004399906111500218, "loss": 5.1085, "mean_token_accuracy": 0.2047686383128166, "num_tokens": 56878957.0, "step": 24835 }, { "entropy": 5.773703861236572, "epoch": 2.4555160142348753, "grad_norm": 1.078125, "learning_rate": 0.000439966614957925, "loss": 5.0306, "mean_token_accuracy": 0.20389980673789979, "num_tokens": 56891915.0, "step": 24840 }, { "entropy": 5.667133378982544, "epoch": 2.456010280743377, "grad_norm": 1.125, "learning_rate": 0.0004399426147076239, "loss": 4.9881, "mean_token_accuracy": 0.21946462541818618, "num_tokens": 56902322.0, "step": 24845 }, { "entropy": 5.682002878189087, "epoch": 2.4565045472518783, "grad_norm": 1.0546875, "learning_rate": 0.000439918610399709, "loss": 5.0609, "mean_token_accuracy": 0.20221312195062638, "num_tokens": 56913560.0, "step": 24850 }, { "entropy": 5.711883974075318, "epoch": 2.4569988137603795, "grad_norm": 1.0703125, "learning_rate": 0.00043989460203477053, "loss": 4.9977, "mean_token_accuracy": 0.2135155528783798, "num_tokens": 56924235.0, "step": 24855 }, { "entropy": 5.649257755279541, "epoch": 2.457493080268881, "grad_norm": 1.15625, "learning_rate": 0.00043987058961339937, "loss": 4.863, "mean_token_accuracy": 0.2276879444718361, "num_tokens": 56935257.0, "step": 24860 }, { "entropy": 5.664929914474487, "epoch": 2.4579873467773825, "grad_norm": 1.1484375, "learning_rate": 0.00043984657313618616, "loss": 5.0196, "mean_token_accuracy": 0.2208859518170357, "num_tokens": 56945896.0, "step": 24865 }, { "entropy": 5.737520027160644, "epoch": 2.4584816132858838, "grad_norm": 1.0625, "learning_rate": 0.0004398225526037216, "loss": 5.1315, "mean_token_accuracy": 0.20247652977705002, "num_tokens": 56957274.0, "step": 24870 }, { "entropy": 5.650135183334351, "epoch": 2.458975879794385, "grad_norm": 1.078125, "learning_rate": 0.00043979852801659673, "loss": 4.9619, "mean_token_accuracy": 0.21924443542957306, "num_tokens": 56969647.0, "step": 24875 }, { "entropy": 5.710012817382813, "epoch": 2.4594701463028867, "grad_norm": 1.0546875, "learning_rate": 0.0004397744993754025, "loss": 4.9641, "mean_token_accuracy": 0.21612230837345123, "num_tokens": 56981443.0, "step": 24880 }, { "entropy": 5.642097759246826, "epoch": 2.459964412811388, "grad_norm": 1.0703125, "learning_rate": 0.00043975046668072996, "loss": 4.95, "mean_token_accuracy": 0.22610472589731218, "num_tokens": 56992482.0, "step": 24885 }, { "entropy": 5.711119270324707, "epoch": 2.4604586793198893, "grad_norm": 1.2421875, "learning_rate": 0.00043972642993317043, "loss": 5.0128, "mean_token_accuracy": 0.2154277890920639, "num_tokens": 57003172.0, "step": 24890 }, { "entropy": 5.719520568847656, "epoch": 2.4609529458283905, "grad_norm": 1.140625, "learning_rate": 0.00043970238913331513, "loss": 5.1169, "mean_token_accuracy": 0.20815230458974837, "num_tokens": 57014763.0, "step": 24895 }, { "entropy": 5.6418785572052, "epoch": 2.4614472123368922, "grad_norm": 1.1875, "learning_rate": 0.00043967834428175565, "loss": 5.0154, "mean_token_accuracy": 0.22428970485925676, "num_tokens": 57025564.0, "step": 24900 }, { "entropy": 5.723076915740966, "epoch": 2.4619414788453935, "grad_norm": 1.1171875, "learning_rate": 0.00043965429537908316, "loss": 4.9932, "mean_token_accuracy": 0.21742018610239028, "num_tokens": 57036121.0, "step": 24905 }, { "entropy": 5.700960540771485, "epoch": 2.4624357453538948, "grad_norm": 1.1328125, "learning_rate": 0.0004396302424258896, "loss": 5.1308, "mean_token_accuracy": 0.20497939735651016, "num_tokens": 57048759.0, "step": 24910 }, { "entropy": 5.633072376251221, "epoch": 2.462930011862396, "grad_norm": 1.1015625, "learning_rate": 0.0004396061854227665, "loss": 4.9381, "mean_token_accuracy": 0.2216528758406639, "num_tokens": 57060791.0, "step": 24915 }, { "entropy": 5.644799470901489, "epoch": 2.4634242783708977, "grad_norm": 1.2421875, "learning_rate": 0.00043958212437030566, "loss": 4.9601, "mean_token_accuracy": 0.2201666057109833, "num_tokens": 57070788.0, "step": 24920 }, { "entropy": 5.6648184299469, "epoch": 2.463918544879399, "grad_norm": 1.2265625, "learning_rate": 0.000439558059269099, "loss": 5.0443, "mean_token_accuracy": 0.21208992153406142, "num_tokens": 57082008.0, "step": 24925 }, { "entropy": 5.676169109344483, "epoch": 2.4644128113879002, "grad_norm": 1.2109375, "learning_rate": 0.0004395339901197386, "loss": 4.9721, "mean_token_accuracy": 0.21825537979602813, "num_tokens": 57093081.0, "step": 24930 }, { "entropy": 5.622377252578735, "epoch": 2.4649070778964015, "grad_norm": 1.2265625, "learning_rate": 0.0004395099169228166, "loss": 4.9276, "mean_token_accuracy": 0.2246924877166748, "num_tokens": 57103294.0, "step": 24935 }, { "entropy": 5.616104984283448, "epoch": 2.465401344404903, "grad_norm": 1.09375, "learning_rate": 0.00043948583967892495, "loss": 4.9064, "mean_token_accuracy": 0.22889331430196763, "num_tokens": 57114509.0, "step": 24940 }, { "entropy": 5.7534528255462645, "epoch": 2.4658956109134045, "grad_norm": 1.1796875, "learning_rate": 0.0004394617583886563, "loss": 5.0622, "mean_token_accuracy": 0.2054104909300804, "num_tokens": 57126481.0, "step": 24945 }, { "entropy": 5.692492961883545, "epoch": 2.4663898774219057, "grad_norm": 1.1328125, "learning_rate": 0.0004394376730526028, "loss": 4.9816, "mean_token_accuracy": 0.2149360477924347, "num_tokens": 57138235.0, "step": 24950 }, { "entropy": 5.672536420822143, "epoch": 2.4668841439304074, "grad_norm": 0.97265625, "learning_rate": 0.00043941358367135706, "loss": 4.9983, "mean_token_accuracy": 0.21777955293655396, "num_tokens": 57150731.0, "step": 24955 }, { "entropy": 5.674402952194214, "epoch": 2.4673784104389087, "grad_norm": 1.078125, "learning_rate": 0.00043938949024551155, "loss": 5.0217, "mean_token_accuracy": 0.21622692346572875, "num_tokens": 57162729.0, "step": 24960 }, { "entropy": 5.706616067886353, "epoch": 2.46787267694741, "grad_norm": 1.1484375, "learning_rate": 0.00043936539277565916, "loss": 5.0164, "mean_token_accuracy": 0.2167980119585991, "num_tokens": 57173855.0, "step": 24965 }, { "entropy": 5.641604089736939, "epoch": 2.4683669434559112, "grad_norm": 1.2265625, "learning_rate": 0.00043934129126239256, "loss": 4.9634, "mean_token_accuracy": 0.2234649747610092, "num_tokens": 57184829.0, "step": 24970 }, { "entropy": 5.696771335601807, "epoch": 2.468861209964413, "grad_norm": 1.1796875, "learning_rate": 0.0004393171857063048, "loss": 5.0423, "mean_token_accuracy": 0.21251803934574126, "num_tokens": 57195679.0, "step": 24975 }, { "entropy": 5.730101108551025, "epoch": 2.469355476472914, "grad_norm": 1.0625, "learning_rate": 0.00043929307610798867, "loss": 4.9894, "mean_token_accuracy": 0.2182790756225586, "num_tokens": 57208022.0, "step": 24980 }, { "entropy": 5.630070972442627, "epoch": 2.4698497429814155, "grad_norm": 1.1171875, "learning_rate": 0.0004392689624680375, "loss": 4.8999, "mean_token_accuracy": 0.2281287968158722, "num_tokens": 57218699.0, "step": 24985 }, { "entropy": 5.64049654006958, "epoch": 2.470344009489917, "grad_norm": 0.98828125, "learning_rate": 0.0004392448447870443, "loss": 5.0569, "mean_token_accuracy": 0.21426043808460235, "num_tokens": 57231333.0, "step": 24990 }, { "entropy": 5.748660516738892, "epoch": 2.4708382759984184, "grad_norm": 1.078125, "learning_rate": 0.0004392207230656024, "loss": 5.0221, "mean_token_accuracy": 0.20917847156524658, "num_tokens": 57242748.0, "step": 24995 }, { "entropy": 5.719303369522095, "epoch": 2.4713325425069197, "grad_norm": 1.125, "learning_rate": 0.0004391965973043053, "loss": 4.9774, "mean_token_accuracy": 0.22064861357212068, "num_tokens": 57255438.0, "step": 25000 }, { "entropy": 5.751277685165405, "epoch": 2.471826809015421, "grad_norm": 0.92578125, "learning_rate": 0.0004391724675037464, "loss": 5.1046, "mean_token_accuracy": 0.21224838346242905, "num_tokens": 57267472.0, "step": 25005 }, { "entropy": 5.692398405075073, "epoch": 2.4723210755239227, "grad_norm": 1.1015625, "learning_rate": 0.00043914833366451934, "loss": 4.9938, "mean_token_accuracy": 0.2160089671611786, "num_tokens": 57277921.0, "step": 25010 }, { "entropy": 5.678887605667114, "epoch": 2.472815342032424, "grad_norm": 1.078125, "learning_rate": 0.0004391241957872178, "loss": 5.0084, "mean_token_accuracy": 0.21960539072752, "num_tokens": 57290207.0, "step": 25015 }, { "entropy": 5.675688886642456, "epoch": 2.473309608540925, "grad_norm": 1.1171875, "learning_rate": 0.00043910005387243564, "loss": 4.9531, "mean_token_accuracy": 0.22220274806022644, "num_tokens": 57300599.0, "step": 25020 }, { "entropy": 5.677533960342407, "epoch": 2.473803875049427, "grad_norm": 1.03125, "learning_rate": 0.00043907590792076665, "loss": 5.0513, "mean_token_accuracy": 0.2088640108704567, "num_tokens": 57313035.0, "step": 25025 }, { "entropy": 5.673757648468017, "epoch": 2.474298141557928, "grad_norm": 1.109375, "learning_rate": 0.0004390517579328048, "loss": 4.9993, "mean_token_accuracy": 0.219614477455616, "num_tokens": 57325141.0, "step": 25030 }, { "entropy": 5.720339393615722, "epoch": 2.4747924080664294, "grad_norm": 1.15625, "learning_rate": 0.0004390276039091443, "loss": 5.0427, "mean_token_accuracy": 0.21940211504697799, "num_tokens": 57336824.0, "step": 25035 }, { "entropy": 5.764863777160644, "epoch": 2.4752866745749307, "grad_norm": 1.296875, "learning_rate": 0.00043900344585037933, "loss": 5.1136, "mean_token_accuracy": 0.20562119036912918, "num_tokens": 57347078.0, "step": 25040 }, { "entropy": 5.656171035766602, "epoch": 2.475780941083432, "grad_norm": 1.0546875, "learning_rate": 0.00043897928375710417, "loss": 4.9607, "mean_token_accuracy": 0.21789245903491974, "num_tokens": 57359320.0, "step": 25045 }, { "entropy": 5.734521436691284, "epoch": 2.4762752075919336, "grad_norm": 1.1015625, "learning_rate": 0.0004389551176299132, "loss": 5.0274, "mean_token_accuracy": 0.2110027402639389, "num_tokens": 57370642.0, "step": 25050 }, { "entropy": 5.656056022644043, "epoch": 2.476769474100435, "grad_norm": 1.109375, "learning_rate": 0.0004389309474694008, "loss": 5.0008, "mean_token_accuracy": 0.22700024098157884, "num_tokens": 57382082.0, "step": 25055 }, { "entropy": 5.653369331359864, "epoch": 2.477263740608936, "grad_norm": 1.171875, "learning_rate": 0.0004389067732761617, "loss": 5.0867, "mean_token_accuracy": 0.20839382112026214, "num_tokens": 57393591.0, "step": 25060 }, { "entropy": 5.70035948753357, "epoch": 2.477758007117438, "grad_norm": 1.015625, "learning_rate": 0.00043888259505079063, "loss": 4.948, "mean_token_accuracy": 0.21773191690444946, "num_tokens": 57404999.0, "step": 25065 }, { "entropy": 5.688670587539673, "epoch": 2.478252273625939, "grad_norm": 1.125, "learning_rate": 0.0004388584127938822, "loss": 5.0351, "mean_token_accuracy": 0.21979344636201859, "num_tokens": 57416467.0, "step": 25070 }, { "entropy": 5.712506532669067, "epoch": 2.4787465401344404, "grad_norm": 1.0390625, "learning_rate": 0.0004388342265060314, "loss": 5.0771, "mean_token_accuracy": 0.21515004932880402, "num_tokens": 57427201.0, "step": 25075 }, { "entropy": 5.744004344940185, "epoch": 2.4792408066429417, "grad_norm": 1.21875, "learning_rate": 0.00043881003618783326, "loss": 5.0616, "mean_token_accuracy": 0.21530888378620147, "num_tokens": 57438345.0, "step": 25080 }, { "entropy": 5.6976001262664795, "epoch": 2.4797350731514434, "grad_norm": 1.140625, "learning_rate": 0.0004387858418398828, "loss": 5.0412, "mean_token_accuracy": 0.21416350901126863, "num_tokens": 57449818.0, "step": 25085 }, { "entropy": 5.720158958435059, "epoch": 2.4802293396599446, "grad_norm": 1.1953125, "learning_rate": 0.0004387616434627753, "loss": 5.0168, "mean_token_accuracy": 0.21614874005317689, "num_tokens": 57461961.0, "step": 25090 }, { "entropy": 5.631670188903809, "epoch": 2.480723606168446, "grad_norm": 1.2109375, "learning_rate": 0.00043873744105710585, "loss": 4.9702, "mean_token_accuracy": 0.22089387327432633, "num_tokens": 57473422.0, "step": 25095 }, { "entropy": 5.682746267318725, "epoch": 2.4812178726769476, "grad_norm": 1.0390625, "learning_rate": 0.00043871323462347, "loss": 4.955, "mean_token_accuracy": 0.22464104145765304, "num_tokens": 57484618.0, "step": 25100 }, { "entropy": 5.701671743392945, "epoch": 2.481712139185449, "grad_norm": 1.234375, "learning_rate": 0.0004386890241624631, "loss": 4.8593, "mean_token_accuracy": 0.22736164182424545, "num_tokens": 57493521.0, "step": 25105 }, { "entropy": 5.645185327529907, "epoch": 2.48220640569395, "grad_norm": 1.109375, "learning_rate": 0.0004386648096746809, "loss": 5.0164, "mean_token_accuracy": 0.2136268898844719, "num_tokens": 57505693.0, "step": 25110 }, { "entropy": 5.664259815216065, "epoch": 2.4827006722024514, "grad_norm": 1.0625, "learning_rate": 0.00043864059116071897, "loss": 4.9656, "mean_token_accuracy": 0.22260957956314087, "num_tokens": 57517734.0, "step": 25115 }, { "entropy": 5.73551664352417, "epoch": 2.483194938710953, "grad_norm": 1.09375, "learning_rate": 0.0004386163686211731, "loss": 5.0363, "mean_token_accuracy": 0.21635823398828508, "num_tokens": 57529393.0, "step": 25120 }, { "entropy": 5.625054407119751, "epoch": 2.4836892052194544, "grad_norm": 1.1328125, "learning_rate": 0.00043859214205663915, "loss": 4.9253, "mean_token_accuracy": 0.2234334886074066, "num_tokens": 57541109.0, "step": 25125 }, { "entropy": 5.727078247070312, "epoch": 2.4841834717279556, "grad_norm": 1.1484375, "learning_rate": 0.00043856791146771327, "loss": 5.0817, "mean_token_accuracy": 0.20471252351999283, "num_tokens": 57551869.0, "step": 25130 }, { "entropy": 5.683696126937866, "epoch": 2.4846777382364573, "grad_norm": 1.1640625, "learning_rate": 0.0004385436768549912, "loss": 4.9889, "mean_token_accuracy": 0.22505471408367156, "num_tokens": 57564174.0, "step": 25135 }, { "entropy": 5.74558391571045, "epoch": 2.4851720047449586, "grad_norm": 1.1328125, "learning_rate": 0.00043851943821906944, "loss": 5.0668, "mean_token_accuracy": 0.20998207479715347, "num_tokens": 57575110.0, "step": 25140 }, { "entropy": 5.682272624969483, "epoch": 2.48566627125346, "grad_norm": 1.078125, "learning_rate": 0.00043849519556054406, "loss": 4.9846, "mean_token_accuracy": 0.21560257077217101, "num_tokens": 57587143.0, "step": 25145 }, { "entropy": 5.637385606765747, "epoch": 2.486160537761961, "grad_norm": 1.09375, "learning_rate": 0.00043847094888001156, "loss": 4.9552, "mean_token_accuracy": 0.22274481505155563, "num_tokens": 57598828.0, "step": 25150 }, { "entropy": 5.690423154830933, "epoch": 2.486654804270463, "grad_norm": 1.0859375, "learning_rate": 0.0004384466981780683, "loss": 5.0314, "mean_token_accuracy": 0.2129915952682495, "num_tokens": 57609598.0, "step": 25155 }, { "entropy": 5.699505805969238, "epoch": 2.487149070778964, "grad_norm": 1.1171875, "learning_rate": 0.00043842244345531094, "loss": 4.9869, "mean_token_accuracy": 0.22090262770652772, "num_tokens": 57620702.0, "step": 25160 }, { "entropy": 5.712781238555908, "epoch": 2.4876433372874653, "grad_norm": 1.0546875, "learning_rate": 0.00043839818471233614, "loss": 5.0375, "mean_token_accuracy": 0.20699797868728637, "num_tokens": 57632996.0, "step": 25165 }, { "entropy": 5.696783638000488, "epoch": 2.4881376037959666, "grad_norm": 1.1171875, "learning_rate": 0.0004383739219497406, "loss": 5.0244, "mean_token_accuracy": 0.21355998665094375, "num_tokens": 57644222.0, "step": 25170 }, { "entropy": 5.6758842945098875, "epoch": 2.4886318703044683, "grad_norm": 1.109375, "learning_rate": 0.00043834965516812124, "loss": 5.0003, "mean_token_accuracy": 0.21898068189620973, "num_tokens": 57656399.0, "step": 25175 }, { "entropy": 5.722968053817749, "epoch": 2.4891261368129696, "grad_norm": 1.109375, "learning_rate": 0.00043832538436807506, "loss": 5.0546, "mean_token_accuracy": 0.20792030394077302, "num_tokens": 57668229.0, "step": 25180 }, { "entropy": 5.63116340637207, "epoch": 2.489620403321471, "grad_norm": 1.0859375, "learning_rate": 0.00043830110955019903, "loss": 4.9653, "mean_token_accuracy": 0.22337630093097688, "num_tokens": 57679828.0, "step": 25185 }, { "entropy": 5.693574285507202, "epoch": 2.490114669829972, "grad_norm": 1.125, "learning_rate": 0.00043827683071509044, "loss": 5.0277, "mean_token_accuracy": 0.215861676633358, "num_tokens": 57692248.0, "step": 25190 }, { "entropy": 5.707590341567993, "epoch": 2.490608936338474, "grad_norm": 1.0625, "learning_rate": 0.00043825254786334646, "loss": 5.0198, "mean_token_accuracy": 0.2157030999660492, "num_tokens": 57704123.0, "step": 25195 }, { "entropy": 5.60373821258545, "epoch": 2.491103202846975, "grad_norm": 1.0390625, "learning_rate": 0.00043822826099556444, "loss": 4.8995, "mean_token_accuracy": 0.22218241095542907, "num_tokens": 57715867.0, "step": 25200 }, { "entropy": 5.723360395431518, "epoch": 2.4915974693554763, "grad_norm": 1.140625, "learning_rate": 0.00043820397011234193, "loss": 5.092, "mean_token_accuracy": 0.20710570514202117, "num_tokens": 57727551.0, "step": 25205 }, { "entropy": 5.67418270111084, "epoch": 2.492091735863978, "grad_norm": 1.15625, "learning_rate": 0.0004381796752142764, "loss": 4.9519, "mean_token_accuracy": 0.22568920403718948, "num_tokens": 57738872.0, "step": 25210 }, { "entropy": 5.647845268249512, "epoch": 2.4925860023724793, "grad_norm": 1.234375, "learning_rate": 0.0004381553763019655, "loss": 4.9112, "mean_token_accuracy": 0.22385506629943847, "num_tokens": 57748323.0, "step": 25215 }, { "entropy": 5.669284343719482, "epoch": 2.4930802688809806, "grad_norm": 1.015625, "learning_rate": 0.00043813107337600717, "loss": 5.0508, "mean_token_accuracy": 0.21331439465284346, "num_tokens": 57759697.0, "step": 25220 }, { "entropy": 5.672144079208374, "epoch": 2.493574535389482, "grad_norm": 0.984375, "learning_rate": 0.000438106766436999, "loss": 4.9767, "mean_token_accuracy": 0.21207967400550842, "num_tokens": 57772532.0, "step": 25225 }, { "entropy": 5.664194393157959, "epoch": 2.4940688018979835, "grad_norm": 1.140625, "learning_rate": 0.00043808245548553916, "loss": 4.9353, "mean_token_accuracy": 0.22585006207227706, "num_tokens": 57783895.0, "step": 25230 }, { "entropy": 5.59704213142395, "epoch": 2.494563068406485, "grad_norm": 1.1640625, "learning_rate": 0.00043805814052222554, "loss": 4.9468, "mean_token_accuracy": 0.22482881993055343, "num_tokens": 57795566.0, "step": 25235 }, { "entropy": 5.658424997329712, "epoch": 2.495057334914986, "grad_norm": 1.078125, "learning_rate": 0.0004380338215476564, "loss": 5.0347, "mean_token_accuracy": 0.21452810615301132, "num_tokens": 57807792.0, "step": 25240 }, { "entropy": 5.706170511245728, "epoch": 2.4955516014234878, "grad_norm": 1.09375, "learning_rate": 0.00043800949856242995, "loss": 4.9884, "mean_token_accuracy": 0.22332818508148194, "num_tokens": 57817771.0, "step": 25245 }, { "entropy": 5.722303628921509, "epoch": 2.496045867931989, "grad_norm": 1.0234375, "learning_rate": 0.0004379851715671445, "loss": 5.0563, "mean_token_accuracy": 0.21444186419248581, "num_tokens": 57828442.0, "step": 25250 }, { "entropy": 5.750983953475952, "epoch": 2.4965401344404903, "grad_norm": 1.1171875, "learning_rate": 0.00043796084056239864, "loss": 5.1014, "mean_token_accuracy": 0.21133596450090408, "num_tokens": 57840537.0, "step": 25255 }, { "entropy": 5.724470090866089, "epoch": 2.4970344009489915, "grad_norm": 1.109375, "learning_rate": 0.00043793650554879075, "loss": 5.1406, "mean_token_accuracy": 0.20724169611930848, "num_tokens": 57851645.0, "step": 25260 }, { "entropy": 5.665840148925781, "epoch": 2.4975286674574932, "grad_norm": 1.203125, "learning_rate": 0.0004379121665269196, "loss": 4.9294, "mean_token_accuracy": 0.2209942474961281, "num_tokens": 57863812.0, "step": 25265 }, { "entropy": 5.7336629867553714, "epoch": 2.4980229339659945, "grad_norm": 1.0234375, "learning_rate": 0.00043788782349738387, "loss": 5.1079, "mean_token_accuracy": 0.20944133549928665, "num_tokens": 57876472.0, "step": 25270 }, { "entropy": 5.677082538604736, "epoch": 2.4985172004744958, "grad_norm": 1.1171875, "learning_rate": 0.0004378634764607824, "loss": 4.9399, "mean_token_accuracy": 0.2182406485080719, "num_tokens": 57887905.0, "step": 25275 }, { "entropy": 5.649707269668579, "epoch": 2.4990114669829975, "grad_norm": 1.1328125, "learning_rate": 0.0004378391254177141, "loss": 4.9401, "mean_token_accuracy": 0.2210611656308174, "num_tokens": 57899084.0, "step": 25280 }, { "entropy": 5.589944458007812, "epoch": 2.4995057334914987, "grad_norm": 1.078125, "learning_rate": 0.00043781477036877807, "loss": 4.9785, "mean_token_accuracy": 0.22290801107883454, "num_tokens": 57910134.0, "step": 25285 }, { "entropy": 5.663058519363403, "epoch": 2.5, "grad_norm": 1.0625, "learning_rate": 0.0004377904113145735, "loss": 4.9929, "mean_token_accuracy": 0.21774454414844513, "num_tokens": 57921957.0, "step": 25290 }, { "entropy": 5.618829393386841, "epoch": 2.5004942665085013, "grad_norm": 1.109375, "learning_rate": 0.0004377660482556995, "loss": 4.9295, "mean_token_accuracy": 0.22694969028234482, "num_tokens": 57932924.0, "step": 25295 }, { "entropy": 5.636366271972657, "epoch": 2.5009885330170025, "grad_norm": 1.1015625, "learning_rate": 0.00043774168119275553, "loss": 4.9893, "mean_token_accuracy": 0.22189912348985671, "num_tokens": 57945275.0, "step": 25300 }, { "entropy": 5.652057218551636, "epoch": 2.5014827995255042, "grad_norm": 1.0390625, "learning_rate": 0.00043771731012634085, "loss": 5.0053, "mean_token_accuracy": 0.2223360762000084, "num_tokens": 57957933.0, "step": 25305 }, { "entropy": 5.6775623798370365, "epoch": 2.5019770660340055, "grad_norm": 0.98046875, "learning_rate": 0.0004376929350570551, "loss": 4.9973, "mean_token_accuracy": 0.21329478174448013, "num_tokens": 57970401.0, "step": 25310 }, { "entropy": 5.692291402816773, "epoch": 2.5024713325425068, "grad_norm": 1.1171875, "learning_rate": 0.000437668555985498, "loss": 5.021, "mean_token_accuracy": 0.21095018088817596, "num_tokens": 57981433.0, "step": 25315 }, { "entropy": 5.686311054229736, "epoch": 2.5029655990510085, "grad_norm": 1.25, "learning_rate": 0.0004376441729122691, "loss": 4.9935, "mean_token_accuracy": 0.21841758340597153, "num_tokens": 57992288.0, "step": 25320 }, { "entropy": 5.720408010482788, "epoch": 2.5034598655595097, "grad_norm": 1.09375, "learning_rate": 0.0004376197858379684, "loss": 5.0795, "mean_token_accuracy": 0.21744418293237686, "num_tokens": 58004156.0, "step": 25325 }, { "entropy": 5.653982639312744, "epoch": 2.503954132068011, "grad_norm": 1.171875, "learning_rate": 0.0004375953947631957, "loss": 4.986, "mean_token_accuracy": 0.2212711200118065, "num_tokens": 58014949.0, "step": 25330 }, { "entropy": 5.653584718704224, "epoch": 2.5044483985765122, "grad_norm": 1.015625, "learning_rate": 0.00043757099968855104, "loss": 4.9569, "mean_token_accuracy": 0.2144590884447098, "num_tokens": 58025664.0, "step": 25335 }, { "entropy": 5.664389610290527, "epoch": 2.504942665085014, "grad_norm": 1.09375, "learning_rate": 0.0004375466006146346, "loss": 5.0251, "mean_token_accuracy": 0.2219024956226349, "num_tokens": 58037550.0, "step": 25340 }, { "entropy": 5.68461046218872, "epoch": 2.505436931593515, "grad_norm": 1.171875, "learning_rate": 0.0004375221975420465, "loss": 4.9586, "mean_token_accuracy": 0.21920741051435472, "num_tokens": 58048292.0, "step": 25345 }, { "entropy": 5.643983602523804, "epoch": 2.5059311981020165, "grad_norm": 1.09375, "learning_rate": 0.0004374977904713872, "loss": 4.962, "mean_token_accuracy": 0.2220889449119568, "num_tokens": 58060471.0, "step": 25350 }, { "entropy": 5.649974632263183, "epoch": 2.506425464610518, "grad_norm": 1.1796875, "learning_rate": 0.000437473379403257, "loss": 4.9751, "mean_token_accuracy": 0.22036201506853104, "num_tokens": 58072205.0, "step": 25355 }, { "entropy": 5.694737291336059, "epoch": 2.5069197311190194, "grad_norm": 1.078125, "learning_rate": 0.00043744896433825655, "loss": 4.9933, "mean_token_accuracy": 0.21448899209499359, "num_tokens": 58083789.0, "step": 25360 }, { "entropy": 5.659192180633545, "epoch": 2.5074139976275207, "grad_norm": 1.140625, "learning_rate": 0.0004374245452769863, "loss": 5.1092, "mean_token_accuracy": 0.21911460906267166, "num_tokens": 58096064.0, "step": 25365 }, { "entropy": 5.747098922729492, "epoch": 2.507908264136022, "grad_norm": 1.125, "learning_rate": 0.00043740012222004697, "loss": 5.0569, "mean_token_accuracy": 0.21643559485673905, "num_tokens": 58106935.0, "step": 25370 }, { "entropy": 5.681591892242432, "epoch": 2.5084025306445237, "grad_norm": 1.1015625, "learning_rate": 0.00043737569516803955, "loss": 4.9867, "mean_token_accuracy": 0.21928021162748337, "num_tokens": 58119204.0, "step": 25375 }, { "entropy": 5.649598169326782, "epoch": 2.508896797153025, "grad_norm": 1.109375, "learning_rate": 0.00043735126412156484, "loss": 4.9528, "mean_token_accuracy": 0.22029024511575698, "num_tokens": 58132006.0, "step": 25380 }, { "entropy": 5.7143261432647705, "epoch": 2.509391063661526, "grad_norm": 1.046875, "learning_rate": 0.0004373268290812238, "loss": 5.071, "mean_token_accuracy": 0.2092391163110733, "num_tokens": 58143845.0, "step": 25385 }, { "entropy": 5.582916975021362, "epoch": 2.509885330170028, "grad_norm": 1.03125, "learning_rate": 0.00043730239004761756, "loss": 4.8689, "mean_token_accuracy": 0.23230449259281158, "num_tokens": 58154838.0, "step": 25390 }, { "entropy": 5.742804098129272, "epoch": 2.510379596678529, "grad_norm": 1.109375, "learning_rate": 0.00043727794702134743, "loss": 5.0717, "mean_token_accuracy": 0.20775987654924394, "num_tokens": 58165446.0, "step": 25395 }, { "entropy": 5.589677000045777, "epoch": 2.5108738631870304, "grad_norm": 1.1328125, "learning_rate": 0.00043725350000301455, "loss": 4.905, "mean_token_accuracy": 0.23176924586296083, "num_tokens": 58177815.0, "step": 25400 }, { "entropy": 5.682651424407959, "epoch": 2.5113681296955317, "grad_norm": 1.1015625, "learning_rate": 0.0004372290489932204, "loss": 5.0204, "mean_token_accuracy": 0.21828600913286209, "num_tokens": 58190296.0, "step": 25405 }, { "entropy": 5.6945267677307125, "epoch": 2.511862396204033, "grad_norm": 1.265625, "learning_rate": 0.0004372045939925665, "loss": 4.9706, "mean_token_accuracy": 0.220380200445652, "num_tokens": 58200293.0, "step": 25410 }, { "entropy": 5.624544477462768, "epoch": 2.5123566627125347, "grad_norm": 1.171875, "learning_rate": 0.0004371801350016545, "loss": 5.0297, "mean_token_accuracy": 0.2108832135796547, "num_tokens": 58212263.0, "step": 25415 }, { "entropy": 5.714477109909057, "epoch": 2.512850929221036, "grad_norm": 1.1484375, "learning_rate": 0.00043715567202108597, "loss": 5.0573, "mean_token_accuracy": 0.21203925013542174, "num_tokens": 58222961.0, "step": 25420 }, { "entropy": 5.758030271530151, "epoch": 2.5133451957295376, "grad_norm": 1.046875, "learning_rate": 0.0004371312050514626, "loss": 5.0238, "mean_token_accuracy": 0.21647415310144424, "num_tokens": 58233514.0, "step": 25425 }, { "entropy": 5.7024109840393065, "epoch": 2.513839462238039, "grad_norm": 1.1640625, "learning_rate": 0.00043710673409338665, "loss": 4.9479, "mean_token_accuracy": 0.21910342425107956, "num_tokens": 58243637.0, "step": 25430 }, { "entropy": 5.626990509033203, "epoch": 2.51433372874654, "grad_norm": 1.0, "learning_rate": 0.0004370822591474598, "loss": 4.9569, "mean_token_accuracy": 0.2250988468527794, "num_tokens": 58256603.0, "step": 25435 }, { "entropy": 5.645711088180542, "epoch": 2.5148279952550414, "grad_norm": 1.09375, "learning_rate": 0.0004370577802142842, "loss": 4.9227, "mean_token_accuracy": 0.2226131945848465, "num_tokens": 58268112.0, "step": 25440 }, { "entropy": 5.761875915527344, "epoch": 2.5153222617635427, "grad_norm": 1.140625, "learning_rate": 0.00043703329729446213, "loss": 5.0695, "mean_token_accuracy": 0.21268550008535386, "num_tokens": 58281026.0, "step": 25445 }, { "entropy": 5.667680311203003, "epoch": 2.5158165282720444, "grad_norm": 1.078125, "learning_rate": 0.0004370088103885958, "loss": 5.0439, "mean_token_accuracy": 0.2166520208120346, "num_tokens": 58292749.0, "step": 25450 }, { "entropy": 5.714810562133789, "epoch": 2.5163107947805456, "grad_norm": 1.140625, "learning_rate": 0.0004369843194972876, "loss": 5.0583, "mean_token_accuracy": 0.20796494781970978, "num_tokens": 58304019.0, "step": 25455 }, { "entropy": 5.73217191696167, "epoch": 2.516805061289047, "grad_norm": 1.15625, "learning_rate": 0.00043695982462114, "loss": 5.0695, "mean_token_accuracy": 0.21553469747304915, "num_tokens": 58315998.0, "step": 25460 }, { "entropy": 5.692540884017944, "epoch": 2.5172993277975486, "grad_norm": 1.21875, "learning_rate": 0.00043693532576075556, "loss": 5.023, "mean_token_accuracy": 0.20998884737491608, "num_tokens": 58327839.0, "step": 25465 }, { "entropy": 5.674967956542969, "epoch": 2.51779359430605, "grad_norm": 0.98828125, "learning_rate": 0.000436910822916737, "loss": 4.954, "mean_token_accuracy": 0.2182467356324196, "num_tokens": 58339847.0, "step": 25470 }, { "entropy": 5.647035026550293, "epoch": 2.518287860814551, "grad_norm": 1.1328125, "learning_rate": 0.000436886316089687, "loss": 4.9248, "mean_token_accuracy": 0.2262007251381874, "num_tokens": 58351727.0, "step": 25475 }, { "entropy": 5.66247067451477, "epoch": 2.5187821273230524, "grad_norm": 1.265625, "learning_rate": 0.00043686180528020865, "loss": 4.9856, "mean_token_accuracy": 0.21872608214616776, "num_tokens": 58362519.0, "step": 25480 }, { "entropy": 5.730219888687134, "epoch": 2.519276393831554, "grad_norm": 1.2265625, "learning_rate": 0.0004368372904889047, "loss": 5.0622, "mean_token_accuracy": 0.21947843730449676, "num_tokens": 58373747.0, "step": 25485 }, { "entropy": 5.653955364227295, "epoch": 2.5197706603400554, "grad_norm": 1.2578125, "learning_rate": 0.0004368127717163783, "loss": 4.954, "mean_token_accuracy": 0.2212348386645317, "num_tokens": 58385196.0, "step": 25490 }, { "entropy": 5.706541204452515, "epoch": 2.5202649268485566, "grad_norm": 1.078125, "learning_rate": 0.0004367882489632327, "loss": 5.0396, "mean_token_accuracy": 0.21207271218299867, "num_tokens": 58397005.0, "step": 25495 }, { "entropy": 5.595873212814331, "epoch": 2.5207591933570583, "grad_norm": 1.09375, "learning_rate": 0.00043676372223007095, "loss": 4.9326, "mean_token_accuracy": 0.219038662314415, "num_tokens": 58407685.0, "step": 25500 }, { "entropy": 5.627429723739624, "epoch": 2.5212534598655596, "grad_norm": 1.125, "learning_rate": 0.0004367391915174966, "loss": 4.9829, "mean_token_accuracy": 0.21679268628358841, "num_tokens": 58419250.0, "step": 25505 }, { "entropy": 5.707195520401001, "epoch": 2.521747726374061, "grad_norm": 0.9453125, "learning_rate": 0.0004367146568261131, "loss": 5.0047, "mean_token_accuracy": 0.2134971722960472, "num_tokens": 58431135.0, "step": 25510 }, { "entropy": 5.723687648773193, "epoch": 2.522241992882562, "grad_norm": 1.0703125, "learning_rate": 0.0004366901181565239, "loss": 5.0656, "mean_token_accuracy": 0.20971050709486008, "num_tokens": 58443865.0, "step": 25515 }, { "entropy": 5.706615781784057, "epoch": 2.5227362593910634, "grad_norm": 1.0078125, "learning_rate": 0.00043666557550933266, "loss": 5.0543, "mean_token_accuracy": 0.22006092220544815, "num_tokens": 58456484.0, "step": 25520 }, { "entropy": 5.702159357070923, "epoch": 2.523230525899565, "grad_norm": 1.1015625, "learning_rate": 0.0004366410288851433, "loss": 5.0323, "mean_token_accuracy": 0.21417780816555024, "num_tokens": 58468384.0, "step": 25525 }, { "entropy": 5.639272880554199, "epoch": 2.5237247924080664, "grad_norm": 1.0859375, "learning_rate": 0.00043661647828455944, "loss": 4.993, "mean_token_accuracy": 0.2178630754351616, "num_tokens": 58479703.0, "step": 25530 }, { "entropy": 5.800481224060059, "epoch": 2.524219058916568, "grad_norm": 1.1875, "learning_rate": 0.0004365919237081852, "loss": 5.1211, "mean_token_accuracy": 0.21218721717596054, "num_tokens": 58491313.0, "step": 25535 }, { "entropy": 5.737855529785156, "epoch": 2.5247133254250693, "grad_norm": 1.09375, "learning_rate": 0.00043656736515662457, "loss": 5.0477, "mean_token_accuracy": 0.20464641749858856, "num_tokens": 58503323.0, "step": 25540 }, { "entropy": 5.705129671096802, "epoch": 2.5252075919335706, "grad_norm": 1.1015625, "learning_rate": 0.0004365428026304816, "loss": 4.9724, "mean_token_accuracy": 0.21658896058797836, "num_tokens": 58514935.0, "step": 25545 }, { "entropy": 5.850637292861938, "epoch": 2.525701858442072, "grad_norm": 1.0234375, "learning_rate": 0.0004365182361303607, "loss": 5.1643, "mean_token_accuracy": 0.20337425619363786, "num_tokens": 58525724.0, "step": 25550 }, { "entropy": 5.738964223861695, "epoch": 2.526196124950573, "grad_norm": 1.109375, "learning_rate": 0.00043649366565686615, "loss": 5.051, "mean_token_accuracy": 0.22097738534212114, "num_tokens": 58536868.0, "step": 25555 }, { "entropy": 5.65815281867981, "epoch": 2.526690391459075, "grad_norm": 1.140625, "learning_rate": 0.00043646909121060237, "loss": 5.0212, "mean_token_accuracy": 0.21731212139129638, "num_tokens": 58547285.0, "step": 25560 }, { "entropy": 5.699366235733033, "epoch": 2.527184657967576, "grad_norm": 1.0390625, "learning_rate": 0.0004364445127921738, "loss": 5.0371, "mean_token_accuracy": 0.21405023336410522, "num_tokens": 58559960.0, "step": 25565 }, { "entropy": 5.69747748374939, "epoch": 2.5276789244760773, "grad_norm": 1.0234375, "learning_rate": 0.0004364199304021853, "loss": 4.9999, "mean_token_accuracy": 0.213905668258667, "num_tokens": 58571229.0, "step": 25570 }, { "entropy": 5.7575304985046385, "epoch": 2.528173190984579, "grad_norm": 1.2890625, "learning_rate": 0.0004363953440412414, "loss": 5.0656, "mean_token_accuracy": 0.21360839009284974, "num_tokens": 58580988.0, "step": 25575 }, { "entropy": 5.655761671066284, "epoch": 2.5286674574930803, "grad_norm": 1.1953125, "learning_rate": 0.000436370753709947, "loss": 5.0321, "mean_token_accuracy": 0.2207318514585495, "num_tokens": 58592547.0, "step": 25580 }, { "entropy": 5.679642963409424, "epoch": 2.5291617240015816, "grad_norm": 0.99609375, "learning_rate": 0.0004363461594089071, "loss": 5.035, "mean_token_accuracy": 0.22493955194950105, "num_tokens": 58604820.0, "step": 25585 }, { "entropy": 5.676651287078857, "epoch": 2.529655990510083, "grad_norm": 1.1875, "learning_rate": 0.00043632156113872656, "loss": 4.9571, "mean_token_accuracy": 0.22722918689250945, "num_tokens": 58615635.0, "step": 25590 }, { "entropy": 5.70601487159729, "epoch": 2.5301502570185845, "grad_norm": 1.0234375, "learning_rate": 0.00043629695890001064, "loss": 4.9909, "mean_token_accuracy": 0.22076619863510133, "num_tokens": 58628799.0, "step": 25595 }, { "entropy": 5.6048609733581545, "epoch": 2.530644523527086, "grad_norm": 1.0, "learning_rate": 0.0004362723526933645, "loss": 4.993, "mean_token_accuracy": 0.22045634984970092, "num_tokens": 58641514.0, "step": 25600 }, { "entropy": 5.662329816818238, "epoch": 2.531138790035587, "grad_norm": 1.125, "learning_rate": 0.0004362477425193934, "loss": 4.9425, "mean_token_accuracy": 0.2210210844874382, "num_tokens": 58651719.0, "step": 25605 }, { "entropy": 5.737444591522217, "epoch": 2.5316330565440888, "grad_norm": 1.1953125, "learning_rate": 0.0004362231283787029, "loss": 4.969, "mean_token_accuracy": 0.22187156975269318, "num_tokens": 58663032.0, "step": 25610 }, { "entropy": 5.589449739456176, "epoch": 2.53212732305259, "grad_norm": 1.09375, "learning_rate": 0.0004361985102718984, "loss": 4.925, "mean_token_accuracy": 0.22426300197839738, "num_tokens": 58674188.0, "step": 25615 }, { "entropy": 5.618265151977539, "epoch": 2.5326215895610913, "grad_norm": 1.0703125, "learning_rate": 0.00043617388819958554, "loss": 4.899, "mean_token_accuracy": 0.22599843442440032, "num_tokens": 58684892.0, "step": 25620 }, { "entropy": 5.642139911651611, "epoch": 2.5331158560695926, "grad_norm": 1.1171875, "learning_rate": 0.00043614926216237, "loss": 4.9328, "mean_token_accuracy": 0.22733301818370819, "num_tokens": 58695520.0, "step": 25625 }, { "entropy": 5.675538015365601, "epoch": 2.5336101225780943, "grad_norm": 1.1015625, "learning_rate": 0.0004361246321608577, "loss": 4.9281, "mean_token_accuracy": 0.22020948827266693, "num_tokens": 58706579.0, "step": 25630 }, { "entropy": 5.7443122386932375, "epoch": 2.5341043890865955, "grad_norm": 1.28125, "learning_rate": 0.0004360999981956544, "loss": 5.0068, "mean_token_accuracy": 0.21650769412517548, "num_tokens": 58717292.0, "step": 25635 }, { "entropy": 5.677191209793091, "epoch": 2.534598655595097, "grad_norm": 1.1640625, "learning_rate": 0.00043607536026736603, "loss": 5.0438, "mean_token_accuracy": 0.2113322362303734, "num_tokens": 58728761.0, "step": 25640 }, { "entropy": 5.652059698104859, "epoch": 2.5350929221035985, "grad_norm": 1.265625, "learning_rate": 0.000436050718376599, "loss": 4.9072, "mean_token_accuracy": 0.22349171787500383, "num_tokens": 58739494.0, "step": 25645 }, { "entropy": 5.744930028915405, "epoch": 2.5355871886120998, "grad_norm": 1.109375, "learning_rate": 0.0004360260725239592, "loss": 5.1085, "mean_token_accuracy": 0.2070629432797432, "num_tokens": 58750119.0, "step": 25650 }, { "entropy": 5.684302043914795, "epoch": 2.536081455120601, "grad_norm": 1.03125, "learning_rate": 0.00043600142271005304, "loss": 4.9649, "mean_token_accuracy": 0.21406439393758775, "num_tokens": 58760438.0, "step": 25655 }, { "entropy": 5.736627435684204, "epoch": 2.5365757216291023, "grad_norm": 1.0703125, "learning_rate": 0.000435976768935487, "loss": 5.0679, "mean_token_accuracy": 0.21018319129943847, "num_tokens": 58771484.0, "step": 25660 }, { "entropy": 5.704580783843994, "epoch": 2.5370699881376035, "grad_norm": 1.1171875, "learning_rate": 0.0004359521112008674, "loss": 5.006, "mean_token_accuracy": 0.21156415790319444, "num_tokens": 58782716.0, "step": 25665 }, { "entropy": 5.7397631168365475, "epoch": 2.5375642546461052, "grad_norm": 1.1171875, "learning_rate": 0.0004359274495068009, "loss": 5.0599, "mean_token_accuracy": 0.21154440939426422, "num_tokens": 58793557.0, "step": 25670 }, { "entropy": 5.674383735656738, "epoch": 2.5380585211546065, "grad_norm": 1.0546875, "learning_rate": 0.0004359027838538941, "loss": 4.9864, "mean_token_accuracy": 0.21530407965183257, "num_tokens": 58804225.0, "step": 25675 }, { "entropy": 5.639667129516601, "epoch": 2.538552787663108, "grad_norm": 1.25, "learning_rate": 0.000435878114242754, "loss": 4.9411, "mean_token_accuracy": 0.2246530368924141, "num_tokens": 58814368.0, "step": 25680 }, { "entropy": 5.663958740234375, "epoch": 2.5390470541716095, "grad_norm": 1.1640625, "learning_rate": 0.00043585344067398725, "loss": 4.9559, "mean_token_accuracy": 0.21983493268489837, "num_tokens": 58825925.0, "step": 25685 }, { "entropy": 5.76571831703186, "epoch": 2.5395413206801107, "grad_norm": 1.140625, "learning_rate": 0.0004358287631482009, "loss": 5.0445, "mean_token_accuracy": 0.21155012249946595, "num_tokens": 58837334.0, "step": 25690 }, { "entropy": 5.692574501037598, "epoch": 2.540035587188612, "grad_norm": 1.21875, "learning_rate": 0.00043580408166600206, "loss": 4.9865, "mean_token_accuracy": 0.21738438904285431, "num_tokens": 58848045.0, "step": 25695 }, { "entropy": 5.693753385543824, "epoch": 2.5405298536971133, "grad_norm": 1.015625, "learning_rate": 0.00043577939622799786, "loss": 4.9784, "mean_token_accuracy": 0.22172187864780427, "num_tokens": 58858186.0, "step": 25700 }, { "entropy": 5.650910472869873, "epoch": 2.541024120205615, "grad_norm": 1.1328125, "learning_rate": 0.0004357547068347955, "loss": 4.9349, "mean_token_accuracy": 0.22337903082370758, "num_tokens": 58870102.0, "step": 25705 }, { "entropy": 5.7014459609985355, "epoch": 2.5415183867141162, "grad_norm": 1.109375, "learning_rate": 0.0004357300134870025, "loss": 5.0221, "mean_token_accuracy": 0.21377768516540527, "num_tokens": 58881246.0, "step": 25710 }, { "entropy": 5.747487783432007, "epoch": 2.5420126532226175, "grad_norm": 1.125, "learning_rate": 0.0004357053161852262, "loss": 5.1051, "mean_token_accuracy": 0.20898186415433884, "num_tokens": 58893722.0, "step": 25715 }, { "entropy": 5.662268590927124, "epoch": 2.542506919731119, "grad_norm": 1.09375, "learning_rate": 0.0004356806149300742, "loss": 4.8671, "mean_token_accuracy": 0.22970073372125627, "num_tokens": 58904703.0, "step": 25720 }, { "entropy": 5.591051292419434, "epoch": 2.5430011862396205, "grad_norm": 1.109375, "learning_rate": 0.0004356559097221541, "loss": 4.9201, "mean_token_accuracy": 0.2281045600771904, "num_tokens": 58916626.0, "step": 25725 }, { "entropy": 5.670955991744995, "epoch": 2.5434954527481217, "grad_norm": 1.0703125, "learning_rate": 0.00043563120056207375, "loss": 5.0447, "mean_token_accuracy": 0.2172209396958351, "num_tokens": 58927943.0, "step": 25730 }, { "entropy": 5.798449897766114, "epoch": 2.543989719256623, "grad_norm": 1.0703125, "learning_rate": 0.0004356064874504409, "loss": 5.108, "mean_token_accuracy": 0.2179997131228447, "num_tokens": 58940086.0, "step": 25735 }, { "entropy": 5.745757341384888, "epoch": 2.5444839857651247, "grad_norm": 1.1171875, "learning_rate": 0.0004355817703878637, "loss": 5.0036, "mean_token_accuracy": 0.21982791572809218, "num_tokens": 58952280.0, "step": 25740 }, { "entropy": 5.746413612365723, "epoch": 2.544978252273626, "grad_norm": 1.09375, "learning_rate": 0.0004355570493749498, "loss": 5.02, "mean_token_accuracy": 0.21654891967773438, "num_tokens": 58963726.0, "step": 25745 }, { "entropy": 5.703045654296875, "epoch": 2.545472518782127, "grad_norm": 1.0859375, "learning_rate": 0.0004355323244123077, "loss": 5.0227, "mean_token_accuracy": 0.21851530969142913, "num_tokens": 58974941.0, "step": 25750 }, { "entropy": 5.62224440574646, "epoch": 2.545966785290629, "grad_norm": 1.171875, "learning_rate": 0.00043550759550054554, "loss": 5.0017, "mean_token_accuracy": 0.21759624779224396, "num_tokens": 58985234.0, "step": 25755 }, { "entropy": 5.66828031539917, "epoch": 2.54646105179913, "grad_norm": 1.1328125, "learning_rate": 0.00043548286264027155, "loss": 4.9271, "mean_token_accuracy": 0.22616045773029328, "num_tokens": 58996781.0, "step": 25760 }, { "entropy": 5.6900678157806395, "epoch": 2.5469553183076314, "grad_norm": 1.046875, "learning_rate": 0.00043545812583209426, "loss": 4.9707, "mean_token_accuracy": 0.21759846359491347, "num_tokens": 59008044.0, "step": 25765 }, { "entropy": 5.674028921127319, "epoch": 2.5474495848161327, "grad_norm": 0.99609375, "learning_rate": 0.00043543338507662227, "loss": 5.0349, "mean_token_accuracy": 0.21647845655679704, "num_tokens": 59021579.0, "step": 25770 }, { "entropy": 5.739804267883301, "epoch": 2.547943851324634, "grad_norm": 1.1015625, "learning_rate": 0.0004354086403744641, "loss": 5.0306, "mean_token_accuracy": 0.2109982892870903, "num_tokens": 59033541.0, "step": 25775 }, { "entropy": 5.722770166397095, "epoch": 2.5484381178331357, "grad_norm": 1.1796875, "learning_rate": 0.0004353838917262284, "loss": 4.9837, "mean_token_accuracy": 0.2161448985338211, "num_tokens": 59044067.0, "step": 25780 }, { "entropy": 5.586360311508178, "epoch": 2.548932384341637, "grad_norm": 1.109375, "learning_rate": 0.0004353591391325241, "loss": 4.916, "mean_token_accuracy": 0.22428347617387773, "num_tokens": 59056758.0, "step": 25785 }, { "entropy": 5.60769214630127, "epoch": 2.5494266508501386, "grad_norm": 1.1953125, "learning_rate": 0.00043533438259396015, "loss": 4.9176, "mean_token_accuracy": 0.2264774352312088, "num_tokens": 59067681.0, "step": 25790 }, { "entropy": 5.714349031448364, "epoch": 2.54992091735864, "grad_norm": 1.1484375, "learning_rate": 0.00043530962211114547, "loss": 5.0235, "mean_token_accuracy": 0.21930799633264542, "num_tokens": 59079148.0, "step": 25795 }, { "entropy": 5.734426403045655, "epoch": 2.550415183867141, "grad_norm": 1.1328125, "learning_rate": 0.0004352848576846893, "loss": 5.0806, "mean_token_accuracy": 0.20495122522115708, "num_tokens": 59090597.0, "step": 25800 }, { "entropy": 5.674501705169678, "epoch": 2.5509094503756424, "grad_norm": 1.0390625, "learning_rate": 0.00043526008931520067, "loss": 4.9236, "mean_token_accuracy": 0.22471970170736313, "num_tokens": 59102445.0, "step": 25805 }, { "entropy": 5.755542469024658, "epoch": 2.5514037168841437, "grad_norm": 1.1875, "learning_rate": 0.000435235317003289, "loss": 5.0397, "mean_token_accuracy": 0.20923540145158767, "num_tokens": 59113470.0, "step": 25810 }, { "entropy": 5.606893825531006, "epoch": 2.5518979833926454, "grad_norm": 1.109375, "learning_rate": 0.00043521054074956367, "loss": 4.8829, "mean_token_accuracy": 0.23383215069770813, "num_tokens": 59124370.0, "step": 25815 }, { "entropy": 5.666479063034058, "epoch": 2.5523922499011467, "grad_norm": 1.125, "learning_rate": 0.00043518576055463423, "loss": 5.0753, "mean_token_accuracy": 0.2185169130563736, "num_tokens": 59135783.0, "step": 25820 }, { "entropy": 5.7129518508911135, "epoch": 2.552886516409648, "grad_norm": 1.15625, "learning_rate": 0.0004351609764191102, "loss": 5.0039, "mean_token_accuracy": 0.21676357537508012, "num_tokens": 59146729.0, "step": 25825 }, { "entropy": 5.769175434112549, "epoch": 2.5533807829181496, "grad_norm": 1.078125, "learning_rate": 0.0004351361883436014, "loss": 5.0573, "mean_token_accuracy": 0.21704217940568923, "num_tokens": 59159413.0, "step": 25830 }, { "entropy": 5.664879179000854, "epoch": 2.553875049426651, "grad_norm": 0.98828125, "learning_rate": 0.0004351113963287173, "loss": 4.9581, "mean_token_accuracy": 0.21388407051563263, "num_tokens": 59171013.0, "step": 25835 }, { "entropy": 5.697875928878784, "epoch": 2.554369315935152, "grad_norm": 1.046875, "learning_rate": 0.00043508660037506813, "loss": 5.0322, "mean_token_accuracy": 0.21326106935739517, "num_tokens": 59182571.0, "step": 25840 }, { "entropy": 5.593610382080078, "epoch": 2.5548635824436534, "grad_norm": 1.015625, "learning_rate": 0.0004350618004832638, "loss": 4.9256, "mean_token_accuracy": 0.22768286764621734, "num_tokens": 59194310.0, "step": 25845 }, { "entropy": 5.66645188331604, "epoch": 2.555357848952155, "grad_norm": 1.03125, "learning_rate": 0.0004350369966539143, "loss": 5.0036, "mean_token_accuracy": 0.21655056178569793, "num_tokens": 59206656.0, "step": 25850 }, { "entropy": 5.727938604354859, "epoch": 2.5558521154606564, "grad_norm": 1.0390625, "learning_rate": 0.00043501218888762985, "loss": 5.0911, "mean_token_accuracy": 0.2082471579313278, "num_tokens": 59219180.0, "step": 25855 }, { "entropy": 5.662927913665771, "epoch": 2.5563463819691576, "grad_norm": 1.265625, "learning_rate": 0.0004349873771850208, "loss": 4.9513, "mean_token_accuracy": 0.22282288372516632, "num_tokens": 59230879.0, "step": 25860 }, { "entropy": 5.764781665802002, "epoch": 2.5568406484776594, "grad_norm": 1.2265625, "learning_rate": 0.0004349625615466974, "loss": 5.0593, "mean_token_accuracy": 0.20757858604192733, "num_tokens": 59242283.0, "step": 25865 }, { "entropy": 5.644295024871826, "epoch": 2.5573349149861606, "grad_norm": 1.0625, "learning_rate": 0.00043493774197327014, "loss": 4.9293, "mean_token_accuracy": 0.22780680954456328, "num_tokens": 59253655.0, "step": 25870 }, { "entropy": 5.726610994338989, "epoch": 2.557829181494662, "grad_norm": 1.046875, "learning_rate": 0.00043491291846534965, "loss": 5.0008, "mean_token_accuracy": 0.20999871492385863, "num_tokens": 59266600.0, "step": 25875 }, { "entropy": 5.754388904571533, "epoch": 2.558323448003163, "grad_norm": 1.21875, "learning_rate": 0.00043488809102354653, "loss": 5.0967, "mean_token_accuracy": 0.21101153790950775, "num_tokens": 59277422.0, "step": 25880 }, { "entropy": 5.629184818267822, "epoch": 2.558817714511665, "grad_norm": 1.0703125, "learning_rate": 0.00043486325964847163, "loss": 4.9423, "mean_token_accuracy": 0.21830690950155257, "num_tokens": 59289179.0, "step": 25885 }, { "entropy": 5.612477397918701, "epoch": 2.559311981020166, "grad_norm": 1.078125, "learning_rate": 0.00043483842434073567, "loss": 4.8893, "mean_token_accuracy": 0.2338917076587677, "num_tokens": 59299692.0, "step": 25890 }, { "entropy": 5.692693471908569, "epoch": 2.5598062475286674, "grad_norm": 1.1171875, "learning_rate": 0.0004348135851009497, "loss": 4.9793, "mean_token_accuracy": 0.21635424643754958, "num_tokens": 59310797.0, "step": 25895 }, { "entropy": 5.617331600189209, "epoch": 2.560300514037169, "grad_norm": 0.984375, "learning_rate": 0.0004347887419297247, "loss": 4.9835, "mean_token_accuracy": 0.22083178162574768, "num_tokens": 59323167.0, "step": 25900 }, { "entropy": 5.633772134780884, "epoch": 2.5607947805456703, "grad_norm": 1.03125, "learning_rate": 0.00043476389482767193, "loss": 4.9929, "mean_token_accuracy": 0.21701076328754426, "num_tokens": 59335956.0, "step": 25905 }, { "entropy": 5.747253942489624, "epoch": 2.5612890470541716, "grad_norm": 1.1484375, "learning_rate": 0.0004347390437954026, "loss": 5.0466, "mean_token_accuracy": 0.2073051318526268, "num_tokens": 59348090.0, "step": 25910 }, { "entropy": 5.684022998809814, "epoch": 2.561783313562673, "grad_norm": 1.1015625, "learning_rate": 0.0004347141888335279, "loss": 5.0037, "mean_token_accuracy": 0.21830187141895294, "num_tokens": 59360276.0, "step": 25915 }, { "entropy": 5.703080129623413, "epoch": 2.562277580071174, "grad_norm": 1.1796875, "learning_rate": 0.0004346893299426595, "loss": 5.0497, "mean_token_accuracy": 0.20764821767807007, "num_tokens": 59372049.0, "step": 25920 }, { "entropy": 5.7351963996887205, "epoch": 2.562771846579676, "grad_norm": 1.109375, "learning_rate": 0.00043466446712340866, "loss": 5.0018, "mean_token_accuracy": 0.21832403242588044, "num_tokens": 59384017.0, "step": 25925 }, { "entropy": 5.791358566284179, "epoch": 2.563266113088177, "grad_norm": 1.1328125, "learning_rate": 0.0004346396003763873, "loss": 5.0794, "mean_token_accuracy": 0.21252351999282837, "num_tokens": 59395966.0, "step": 25930 }, { "entropy": 5.655357217788696, "epoch": 2.563760379596679, "grad_norm": 1.125, "learning_rate": 0.0004346147297022069, "loss": 4.9902, "mean_token_accuracy": 0.21827693283557892, "num_tokens": 59405815.0, "step": 25935 }, { "entropy": 5.684198904037475, "epoch": 2.56425464610518, "grad_norm": 1.0625, "learning_rate": 0.00043458985510147946, "loss": 4.982, "mean_token_accuracy": 0.2167527660727501, "num_tokens": 59416662.0, "step": 25940 }, { "entropy": 5.737367773056031, "epoch": 2.5647489126136813, "grad_norm": 1.1953125, "learning_rate": 0.0004345649765748168, "loss": 5.0327, "mean_token_accuracy": 0.2193744108080864, "num_tokens": 59427143.0, "step": 25945 }, { "entropy": 5.598809051513672, "epoch": 2.5652431791221826, "grad_norm": 1.140625, "learning_rate": 0.00043454009412283097, "loss": 4.999, "mean_token_accuracy": 0.21687404662370682, "num_tokens": 59439657.0, "step": 25950 }, { "entropy": 5.670913648605347, "epoch": 2.565737445630684, "grad_norm": 1.09375, "learning_rate": 0.00043451520774613405, "loss": 5.0094, "mean_token_accuracy": 0.21599899530410765, "num_tokens": 59452313.0, "step": 25955 }, { "entropy": 5.692306184768677, "epoch": 2.5662317121391856, "grad_norm": 1.15625, "learning_rate": 0.00043449031744533824, "loss": 4.9485, "mean_token_accuracy": 0.21973504722118378, "num_tokens": 59462412.0, "step": 25960 }, { "entropy": 5.709722423553467, "epoch": 2.566725978647687, "grad_norm": 1.0078125, "learning_rate": 0.00043446542322105595, "loss": 5.0095, "mean_token_accuracy": 0.21773470491170882, "num_tokens": 59474784.0, "step": 25965 }, { "entropy": 5.642324352264405, "epoch": 2.567220245156188, "grad_norm": 1.0625, "learning_rate": 0.0004344405250738994, "loss": 4.9024, "mean_token_accuracy": 0.22559424340724946, "num_tokens": 59487006.0, "step": 25970 }, { "entropy": 5.6816877841949465, "epoch": 2.56771451166469, "grad_norm": 1.0390625, "learning_rate": 0.00043441562300448134, "loss": 5.003, "mean_token_accuracy": 0.2187163144350052, "num_tokens": 59498625.0, "step": 25975 }, { "entropy": 5.655596542358398, "epoch": 2.568208778173191, "grad_norm": 1.078125, "learning_rate": 0.0004343907170134142, "loss": 4.8907, "mean_token_accuracy": 0.22329788655042648, "num_tokens": 59509257.0, "step": 25980 }, { "entropy": 5.720489645004273, "epoch": 2.5687030446816923, "grad_norm": 1.0625, "learning_rate": 0.0004343658071013106, "loss": 5.1033, "mean_token_accuracy": 0.20779407769441605, "num_tokens": 59520876.0, "step": 25985 }, { "entropy": 5.677516174316406, "epoch": 2.5691973111901936, "grad_norm": 1.171875, "learning_rate": 0.00043434089326878356, "loss": 4.956, "mean_token_accuracy": 0.2148314267396927, "num_tokens": 59532047.0, "step": 25990 }, { "entropy": 5.66168909072876, "epoch": 2.5696915776986953, "grad_norm": 1.09375, "learning_rate": 0.0004343159755164457, "loss": 5.0194, "mean_token_accuracy": 0.2183456763625145, "num_tokens": 59543831.0, "step": 25995 }, { "entropy": 5.62736439704895, "epoch": 2.5701858442071965, "grad_norm": 0.99609375, "learning_rate": 0.0004342910538449102, "loss": 4.9133, "mean_token_accuracy": 0.22225775420665742, "num_tokens": 59555298.0, "step": 26000 }, { "entropy": 5.773473501205444, "epoch": 2.570680110715698, "grad_norm": 1.1796875, "learning_rate": 0.00043426612825479003, "loss": 5.0033, "mean_token_accuracy": 0.21374738216400146, "num_tokens": 59566204.0, "step": 26005 }, { "entropy": 5.726179361343384, "epoch": 2.5711743772241995, "grad_norm": 1.2265625, "learning_rate": 0.0004342411987466984, "loss": 5.0858, "mean_token_accuracy": 0.20720468759536742, "num_tokens": 59577505.0, "step": 26010 }, { "entropy": 5.701810455322265, "epoch": 2.5716686437327008, "grad_norm": 1.046875, "learning_rate": 0.0004342162653212486, "loss": 5.0562, "mean_token_accuracy": 0.21396088004112243, "num_tokens": 59589430.0, "step": 26015 }, { "entropy": 5.679551410675049, "epoch": 2.572162910241202, "grad_norm": 1.140625, "learning_rate": 0.0004341913279790539, "loss": 4.9349, "mean_token_accuracy": 0.22740085870027543, "num_tokens": 59600328.0, "step": 26020 }, { "entropy": 5.701921367645264, "epoch": 2.5726571767497033, "grad_norm": 1.1640625, "learning_rate": 0.0004341663867207279, "loss": 4.9977, "mean_token_accuracy": 0.21352200508117675, "num_tokens": 59611643.0, "step": 26025 }, { "entropy": 5.705938386917114, "epoch": 2.5731514432582046, "grad_norm": 1.0546875, "learning_rate": 0.00043414144154688405, "loss": 5.0844, "mean_token_accuracy": 0.21820371747016906, "num_tokens": 59622586.0, "step": 26030 }, { "entropy": 5.752703094482422, "epoch": 2.5736457097667063, "grad_norm": 1.125, "learning_rate": 0.00043411649245813613, "loss": 5.0765, "mean_token_accuracy": 0.21112840622663498, "num_tokens": 59632719.0, "step": 26035 }, { "entropy": 5.672464799880982, "epoch": 2.5741399762752075, "grad_norm": 1.0546875, "learning_rate": 0.0004340915394550977, "loss": 4.9416, "mean_token_accuracy": 0.22603845745325088, "num_tokens": 59643788.0, "step": 26040 }, { "entropy": 5.6741680145263675, "epoch": 2.5746342427837092, "grad_norm": 1.1015625, "learning_rate": 0.0004340665825383828, "loss": 4.989, "mean_token_accuracy": 0.22299239039421082, "num_tokens": 59655355.0, "step": 26045 }, { "entropy": 5.73401141166687, "epoch": 2.5751285092922105, "grad_norm": 1.1171875, "learning_rate": 0.00043404162170860525, "loss": 5.1005, "mean_token_accuracy": 0.21177371144294738, "num_tokens": 59667099.0, "step": 26050 }, { "entropy": 5.692948341369629, "epoch": 2.5756227758007118, "grad_norm": 1.03125, "learning_rate": 0.0004340166569663792, "loss": 5.0571, "mean_token_accuracy": 0.20790252089500427, "num_tokens": 59679514.0, "step": 26055 }, { "entropy": 5.822658920288086, "epoch": 2.576117042309213, "grad_norm": 1.1484375, "learning_rate": 0.00043399168831231865, "loss": 5.1207, "mean_token_accuracy": 0.21273076832294463, "num_tokens": 59691569.0, "step": 26060 }, { "entropy": 5.759627771377564, "epoch": 2.5766113088177143, "grad_norm": 1.3125, "learning_rate": 0.0004339667157470379, "loss": 5.051, "mean_token_accuracy": 0.22027494609355927, "num_tokens": 59702841.0, "step": 26065 }, { "entropy": 5.669215250015259, "epoch": 2.577105575326216, "grad_norm": 1.1484375, "learning_rate": 0.0004339417392711513, "loss": 4.9789, "mean_token_accuracy": 0.22170305699110032, "num_tokens": 59714834.0, "step": 26070 }, { "entropy": 5.716326189041138, "epoch": 2.5775998418347172, "grad_norm": 1.1875, "learning_rate": 0.0004339167588852733, "loss": 5.0488, "mean_token_accuracy": 0.2122848302125931, "num_tokens": 59726863.0, "step": 26075 }, { "entropy": 5.706021928787232, "epoch": 2.5780941083432185, "grad_norm": 1.140625, "learning_rate": 0.0004338917745900183, "loss": 5.0646, "mean_token_accuracy": 0.21499428451061248, "num_tokens": 59738952.0, "step": 26080 }, { "entropy": 5.655021858215332, "epoch": 2.57858837485172, "grad_norm": 0.99609375, "learning_rate": 0.0004338667863860011, "loss": 4.9797, "mean_token_accuracy": 0.21834299713373184, "num_tokens": 59750445.0, "step": 26085 }, { "entropy": 5.689514589309693, "epoch": 2.5790826413602215, "grad_norm": 1.21875, "learning_rate": 0.0004338417942738362, "loss": 5.013, "mean_token_accuracy": 0.21743761748075485, "num_tokens": 59762447.0, "step": 26090 }, { "entropy": 5.61665940284729, "epoch": 2.5795769078687227, "grad_norm": 1.109375, "learning_rate": 0.0004338167982541386, "loss": 4.9199, "mean_token_accuracy": 0.22988397032022476, "num_tokens": 59773122.0, "step": 26095 }, { "entropy": 5.750516128540039, "epoch": 2.580071174377224, "grad_norm": 1.078125, "learning_rate": 0.00043379179832752306, "loss": 5.0509, "mean_token_accuracy": 0.21873348951339722, "num_tokens": 59784355.0, "step": 26100 }, { "entropy": 5.6588757038116455, "epoch": 2.5805654408857257, "grad_norm": 0.97265625, "learning_rate": 0.00043376679449460463, "loss": 4.92, "mean_token_accuracy": 0.23175878673791886, "num_tokens": 59796529.0, "step": 26105 }, { "entropy": 5.735718202590943, "epoch": 2.581059707394227, "grad_norm": 1.34375, "learning_rate": 0.00043374178675599853, "loss": 4.9888, "mean_token_accuracy": 0.2125225469470024, "num_tokens": 59807510.0, "step": 26110 }, { "entropy": 5.71296534538269, "epoch": 2.5815539739027282, "grad_norm": 1.1171875, "learning_rate": 0.00043371677511231977, "loss": 5.0102, "mean_token_accuracy": 0.21287502199411393, "num_tokens": 59819355.0, "step": 26115 }, { "entropy": 5.680662393569946, "epoch": 2.58204824041123, "grad_norm": 1.109375, "learning_rate": 0.0004336917595641838, "loss": 4.959, "mean_token_accuracy": 0.2135409876704216, "num_tokens": 59830780.0, "step": 26120 }, { "entropy": 5.658672571182251, "epoch": 2.582542506919731, "grad_norm": 1.1328125, "learning_rate": 0.0004336667401122058, "loss": 5.0338, "mean_token_accuracy": 0.21758261620998381, "num_tokens": 59842031.0, "step": 26125 }, { "entropy": 5.671532249450683, "epoch": 2.5830367734282325, "grad_norm": 1.203125, "learning_rate": 0.0004336417167570015, "loss": 5.015, "mean_token_accuracy": 0.2202451393008232, "num_tokens": 59852788.0, "step": 26130 }, { "entropy": 5.671050500869751, "epoch": 2.5835310399367337, "grad_norm": 1.046875, "learning_rate": 0.00043361668949918627, "loss": 4.9977, "mean_token_accuracy": 0.22320355772972106, "num_tokens": 59865618.0, "step": 26135 }, { "entropy": 5.721094131469727, "epoch": 2.5840253064452354, "grad_norm": 1.171875, "learning_rate": 0.0004335916583393759, "loss": 4.9959, "mean_token_accuracy": 0.21211876720190048, "num_tokens": 59877053.0, "step": 26140 }, { "entropy": 5.665718698501587, "epoch": 2.5845195729537367, "grad_norm": 1.125, "learning_rate": 0.0004335666232781861, "loss": 4.9263, "mean_token_accuracy": 0.22258886843919753, "num_tokens": 59888730.0, "step": 26145 }, { "entropy": 5.683137845993042, "epoch": 2.585013839462238, "grad_norm": 1.1484375, "learning_rate": 0.0004335415843162328, "loss": 5.021, "mean_token_accuracy": 0.21481456905603408, "num_tokens": 59900255.0, "step": 26150 }, { "entropy": 5.693092346191406, "epoch": 2.5855081059707397, "grad_norm": 1.1484375, "learning_rate": 0.00043351654145413197, "loss": 5.041, "mean_token_accuracy": 0.21829826682806014, "num_tokens": 59910705.0, "step": 26155 }, { "entropy": 5.620993041992188, "epoch": 2.586002372479241, "grad_norm": 1.0, "learning_rate": 0.0004334914946924996, "loss": 4.8975, "mean_token_accuracy": 0.22369939982891082, "num_tokens": 59923199.0, "step": 26160 }, { "entropy": 5.709030675888061, "epoch": 2.586496638987742, "grad_norm": 1.1171875, "learning_rate": 0.00043346644403195186, "loss": 4.9835, "mean_token_accuracy": 0.21240891814231871, "num_tokens": 59934098.0, "step": 26165 }, { "entropy": 5.707919883728027, "epoch": 2.5869909054962434, "grad_norm": 1.0, "learning_rate": 0.000433441389473105, "loss": 5.0178, "mean_token_accuracy": 0.2137576088309288, "num_tokens": 59945566.0, "step": 26170 }, { "entropy": 5.770123863220215, "epoch": 2.5874851720047447, "grad_norm": 1.0703125, "learning_rate": 0.0004334163310165754, "loss": 5.0685, "mean_token_accuracy": 0.21106477230787277, "num_tokens": 59956354.0, "step": 26175 }, { "entropy": 5.6716385841369625, "epoch": 2.5879794385132464, "grad_norm": 1.203125, "learning_rate": 0.00043339126866297943, "loss": 5.0263, "mean_token_accuracy": 0.21532163619995118, "num_tokens": 59967413.0, "step": 26180 }, { "entropy": 5.704101276397705, "epoch": 2.5884737050217477, "grad_norm": 1.09375, "learning_rate": 0.0004333662024129337, "loss": 5.0138, "mean_token_accuracy": 0.2163545846939087, "num_tokens": 59977936.0, "step": 26185 }, { "entropy": 5.7335728168487545, "epoch": 2.5889679715302494, "grad_norm": 1.234375, "learning_rate": 0.0004333411322670549, "loss": 5.0148, "mean_token_accuracy": 0.21911537498235703, "num_tokens": 59989566.0, "step": 26190 }, { "entropy": 5.7011682987213135, "epoch": 2.5894622380387506, "grad_norm": 1.0234375, "learning_rate": 0.00043331605822595964, "loss": 5.0091, "mean_token_accuracy": 0.2202601134777069, "num_tokens": 60000339.0, "step": 26195 }, { "entropy": 5.66443099975586, "epoch": 2.589956504547252, "grad_norm": 1.2109375, "learning_rate": 0.00043329098029026484, "loss": 4.9437, "mean_token_accuracy": 0.2179483577609062, "num_tokens": 60012903.0, "step": 26200 }, { "entropy": 5.735072898864746, "epoch": 2.590450771055753, "grad_norm": 1.078125, "learning_rate": 0.00043326589846058724, "loss": 5.0431, "mean_token_accuracy": 0.22036902308464051, "num_tokens": 60024135.0, "step": 26205 }, { "entropy": 5.6460906028747555, "epoch": 2.5909450375642544, "grad_norm": 1.1328125, "learning_rate": 0.00043324081273754403, "loss": 4.999, "mean_token_accuracy": 0.2155824527144432, "num_tokens": 60036314.0, "step": 26210 }, { "entropy": 5.7402331829071045, "epoch": 2.591439304072756, "grad_norm": 1.1328125, "learning_rate": 0.00043321572312175234, "loss": 4.9841, "mean_token_accuracy": 0.21894258856773377, "num_tokens": 60047337.0, "step": 26215 }, { "entropy": 5.764920091629028, "epoch": 2.5919335705812574, "grad_norm": 1.1953125, "learning_rate": 0.00043319062961382924, "loss": 5.0496, "mean_token_accuracy": 0.2134683459997177, "num_tokens": 60057875.0, "step": 26220 }, { "entropy": 5.639710235595703, "epoch": 2.5924278370897587, "grad_norm": 1.109375, "learning_rate": 0.00043316553221439214, "loss": 5.0187, "mean_token_accuracy": 0.21831004321575165, "num_tokens": 60069577.0, "step": 26225 }, { "entropy": 5.71601128578186, "epoch": 2.5929221035982604, "grad_norm": 1.046875, "learning_rate": 0.00043314043092405836, "loss": 5.0633, "mean_token_accuracy": 0.21288186460733413, "num_tokens": 60081744.0, "step": 26230 }, { "entropy": 5.772866678237915, "epoch": 2.5934163701067616, "grad_norm": 1.0859375, "learning_rate": 0.0004331153257434455, "loss": 5.0589, "mean_token_accuracy": 0.21265597343444825, "num_tokens": 60092837.0, "step": 26235 }, { "entropy": 5.681906890869141, "epoch": 2.593910636615263, "grad_norm": 1.09375, "learning_rate": 0.0004330902166731711, "loss": 5.0064, "mean_token_accuracy": 0.21188703924417496, "num_tokens": 60104512.0, "step": 26240 }, { "entropy": 5.638290977478027, "epoch": 2.594404903123764, "grad_norm": 1.125, "learning_rate": 0.0004330651037138529, "loss": 4.9741, "mean_token_accuracy": 0.22064238637685776, "num_tokens": 60115652.0, "step": 26245 }, { "entropy": 5.734539890289307, "epoch": 2.594899169632266, "grad_norm": 1.15625, "learning_rate": 0.0004330399868661085, "loss": 5.0116, "mean_token_accuracy": 0.22068501859903336, "num_tokens": 60127834.0, "step": 26250 }, { "entropy": 5.73403959274292, "epoch": 2.595393436140767, "grad_norm": 1.0234375, "learning_rate": 0.000433014866130556, "loss": 5.033, "mean_token_accuracy": 0.21219731271266937, "num_tokens": 60140200.0, "step": 26255 }, { "entropy": 5.703223133087159, "epoch": 2.5958877026492684, "grad_norm": 1.203125, "learning_rate": 0.00043298974150781326, "loss": 5.0727, "mean_token_accuracy": 0.21635280102491378, "num_tokens": 60150506.0, "step": 26260 }, { "entropy": 5.73765115737915, "epoch": 2.59638196915777, "grad_norm": 1.1484375, "learning_rate": 0.00043296461299849835, "loss": 5.1302, "mean_token_accuracy": 0.2085862398147583, "num_tokens": 60162107.0, "step": 26265 }, { "entropy": 5.775042867660522, "epoch": 2.5968762356662713, "grad_norm": 1.0390625, "learning_rate": 0.00043293948060322944, "loss": 5.0807, "mean_token_accuracy": 0.21121090799570083, "num_tokens": 60174435.0, "step": 26270 }, { "entropy": 5.776816701889038, "epoch": 2.5973705021747726, "grad_norm": 1.15625, "learning_rate": 0.0004329143443226249, "loss": 5.1135, "mean_token_accuracy": 0.2144237220287323, "num_tokens": 60186319.0, "step": 26275 }, { "entropy": 5.729561376571655, "epoch": 2.597864768683274, "grad_norm": 1.0859375, "learning_rate": 0.0004328892041573029, "loss": 5.0506, "mean_token_accuracy": 0.21685020625591278, "num_tokens": 60197981.0, "step": 26280 }, { "entropy": 5.644644737243652, "epoch": 2.598359035191775, "grad_norm": 1.1015625, "learning_rate": 0.000432864060107882, "loss": 4.9111, "mean_token_accuracy": 0.22440594732761382, "num_tokens": 60209086.0, "step": 26285 }, { "entropy": 5.672186231613159, "epoch": 2.598853301700277, "grad_norm": 1.1015625, "learning_rate": 0.00043283891217498074, "loss": 4.9808, "mean_token_accuracy": 0.22676471173763274, "num_tokens": 60221040.0, "step": 26290 }, { "entropy": 5.628039836883545, "epoch": 2.599347568208778, "grad_norm": 1.21875, "learning_rate": 0.0004328137603592177, "loss": 4.8972, "mean_token_accuracy": 0.22752701938152314, "num_tokens": 60232709.0, "step": 26295 }, { "entropy": 5.692705202102661, "epoch": 2.59984183471728, "grad_norm": 1.078125, "learning_rate": 0.0004327886046612117, "loss": 5.0103, "mean_token_accuracy": 0.21013389825820922, "num_tokens": 60244539.0, "step": 26300 }, { "entropy": 5.701635313034058, "epoch": 2.600336101225781, "grad_norm": 1.2109375, "learning_rate": 0.0004327634450815817, "loss": 4.9883, "mean_token_accuracy": 0.22222006767988206, "num_tokens": 60255124.0, "step": 26305 }, { "entropy": 5.792408800125122, "epoch": 2.6008303677342823, "grad_norm": 1.1015625, "learning_rate": 0.00043273828162094624, "loss": 5.1414, "mean_token_accuracy": 0.20262690931558608, "num_tokens": 60267819.0, "step": 26310 }, { "entropy": 5.710248613357544, "epoch": 2.6013246342427836, "grad_norm": 1.140625, "learning_rate": 0.0004327131142799247, "loss": 5.0455, "mean_token_accuracy": 0.21518499553203582, "num_tokens": 60279694.0, "step": 26315 }, { "entropy": 5.7176896095275875, "epoch": 2.601818900751285, "grad_norm": 1.1484375, "learning_rate": 0.0004326879430591361, "loss": 5.0485, "mean_token_accuracy": 0.21125290989875795, "num_tokens": 60291215.0, "step": 26320 }, { "entropy": 5.6756532192230225, "epoch": 2.6023131672597866, "grad_norm": 1.0234375, "learning_rate": 0.00043266276795919954, "loss": 4.962, "mean_token_accuracy": 0.21455197185277938, "num_tokens": 60303639.0, "step": 26325 }, { "entropy": 5.694013166427612, "epoch": 2.602807433768288, "grad_norm": 1.0234375, "learning_rate": 0.0004326375889807345, "loss": 4.9921, "mean_token_accuracy": 0.21615112721920013, "num_tokens": 60315290.0, "step": 26330 }, { "entropy": 5.696866655349732, "epoch": 2.603301700276789, "grad_norm": 1.2265625, "learning_rate": 0.0004326124061243603, "loss": 5.0093, "mean_token_accuracy": 0.21491447389125823, "num_tokens": 60325391.0, "step": 26335 }, { "entropy": 5.681035947799683, "epoch": 2.603795966785291, "grad_norm": 1.1875, "learning_rate": 0.0004325872193906965, "loss": 4.9303, "mean_token_accuracy": 0.2281200110912323, "num_tokens": 60335758.0, "step": 26340 }, { "entropy": 5.720879220962525, "epoch": 2.604290233293792, "grad_norm": 1.125, "learning_rate": 0.00043256202878036264, "loss": 4.9956, "mean_token_accuracy": 0.2181279554963112, "num_tokens": 60347365.0, "step": 26345 }, { "entropy": 5.629631662368775, "epoch": 2.6047844998022933, "grad_norm": 1.078125, "learning_rate": 0.00043253683429397843, "loss": 4.8947, "mean_token_accuracy": 0.2234208807349205, "num_tokens": 60359222.0, "step": 26350 }, { "entropy": 5.71719970703125, "epoch": 2.6052787663107946, "grad_norm": 1.1796875, "learning_rate": 0.00043251163593216365, "loss": 5.0933, "mean_token_accuracy": 0.205734683573246, "num_tokens": 60370730.0, "step": 26355 }, { "entropy": 5.638969278335571, "epoch": 2.6057730328192963, "grad_norm": 1.109375, "learning_rate": 0.00043248643369553813, "loss": 4.9467, "mean_token_accuracy": 0.22514139711856843, "num_tokens": 60381955.0, "step": 26360 }, { "entropy": 5.756603097915649, "epoch": 2.6062672993277975, "grad_norm": 1.0546875, "learning_rate": 0.000432461227584722, "loss": 5.063, "mean_token_accuracy": 0.20892783850431443, "num_tokens": 60395331.0, "step": 26365 }, { "entropy": 5.6695075035095215, "epoch": 2.606761565836299, "grad_norm": 1.125, "learning_rate": 0.0004324360176003352, "loss": 4.9334, "mean_token_accuracy": 0.22383388578891755, "num_tokens": 60407179.0, "step": 26370 }, { "entropy": 5.62222728729248, "epoch": 2.6072558323448005, "grad_norm": 1.2421875, "learning_rate": 0.0004324108037429979, "loss": 5.0021, "mean_token_accuracy": 0.21616304516792298, "num_tokens": 60418377.0, "step": 26375 }, { "entropy": 5.709018659591675, "epoch": 2.607750098853302, "grad_norm": 1.078125, "learning_rate": 0.0004323855860133305, "loss": 4.9863, "mean_token_accuracy": 0.21497878581285476, "num_tokens": 60428802.0, "step": 26380 }, { "entropy": 5.695616579055786, "epoch": 2.608244365361803, "grad_norm": 1.0390625, "learning_rate": 0.0004323603644119532, "loss": 5.0368, "mean_token_accuracy": 0.2188412845134735, "num_tokens": 60440445.0, "step": 26385 }, { "entropy": 5.69155650138855, "epoch": 2.6087386318703043, "grad_norm": 1.1640625, "learning_rate": 0.00043233513893948654, "loss": 4.9803, "mean_token_accuracy": 0.21946085542440413, "num_tokens": 60451040.0, "step": 26390 }, { "entropy": 5.706317377090454, "epoch": 2.609232898378806, "grad_norm": 1.078125, "learning_rate": 0.0004323099095965511, "loss": 5.0782, "mean_token_accuracy": 0.21186997890472412, "num_tokens": 60463820.0, "step": 26395 }, { "entropy": 5.713330984115601, "epoch": 2.6097271648873073, "grad_norm": 1.1875, "learning_rate": 0.0004322846763837674, "loss": 4.9887, "mean_token_accuracy": 0.2237784370779991, "num_tokens": 60474285.0, "step": 26400 }, { "entropy": 5.649153089523315, "epoch": 2.6102214313958085, "grad_norm": 1.2578125, "learning_rate": 0.00043225943930175626, "loss": 4.9235, "mean_token_accuracy": 0.23180877715349196, "num_tokens": 60484475.0, "step": 26405 }, { "entropy": 5.683869695663452, "epoch": 2.6107156979043102, "grad_norm": 1.2734375, "learning_rate": 0.0004322341983511386, "loss": 4.9295, "mean_token_accuracy": 0.22741284668445588, "num_tokens": 60494182.0, "step": 26410 }, { "entropy": 5.673253679275513, "epoch": 2.6112099644128115, "grad_norm": 1.09375, "learning_rate": 0.00043220895353253516, "loss": 4.9893, "mean_token_accuracy": 0.22148875445127486, "num_tokens": 60505455.0, "step": 26415 }, { "entropy": 5.6130575180053714, "epoch": 2.6117042309213128, "grad_norm": 1.0859375, "learning_rate": 0.00043218370484656717, "loss": 4.9325, "mean_token_accuracy": 0.22093128114938737, "num_tokens": 60518040.0, "step": 26420 }, { "entropy": 5.706735229492187, "epoch": 2.612198497429814, "grad_norm": 1.1328125, "learning_rate": 0.00043215845229385567, "loss": 5.029, "mean_token_accuracy": 0.2197766959667206, "num_tokens": 60528896.0, "step": 26425 }, { "entropy": 5.718177747726441, "epoch": 2.6126927639383153, "grad_norm": 1.125, "learning_rate": 0.00043213319587502173, "loss": 4.9286, "mean_token_accuracy": 0.22685479372739792, "num_tokens": 60539505.0, "step": 26430 }, { "entropy": 5.66402759552002, "epoch": 2.613187030446817, "grad_norm": 1.1328125, "learning_rate": 0.0004321079355906869, "loss": 4.9976, "mean_token_accuracy": 0.22045601308345794, "num_tokens": 60550544.0, "step": 26435 }, { "entropy": 5.752495527267456, "epoch": 2.6136812969553183, "grad_norm": 1.1640625, "learning_rate": 0.00043208267144147244, "loss": 5.0892, "mean_token_accuracy": 0.20932816863059997, "num_tokens": 60561697.0, "step": 26440 }, { "entropy": 5.650682497024536, "epoch": 2.61417556346382, "grad_norm": 1.0, "learning_rate": 0.00043205740342799995, "loss": 4.9071, "mean_token_accuracy": 0.2291514277458191, "num_tokens": 60572817.0, "step": 26445 }, { "entropy": 5.6928071022033695, "epoch": 2.6146698299723212, "grad_norm": 1.0546875, "learning_rate": 0.00043203213155089095, "loss": 4.9964, "mean_token_accuracy": 0.21810807138681412, "num_tokens": 60584679.0, "step": 26450 }, { "entropy": 5.6843626499176025, "epoch": 2.6151640964808225, "grad_norm": 1.171875, "learning_rate": 0.0004320068558107671, "loss": 5.0098, "mean_token_accuracy": 0.21317216604948044, "num_tokens": 60594871.0, "step": 26455 }, { "entropy": 5.634895849227905, "epoch": 2.6156583629893237, "grad_norm": 1.09375, "learning_rate": 0.00043198157620825023, "loss": 5.016, "mean_token_accuracy": 0.22486073076725005, "num_tokens": 60605626.0, "step": 26460 }, { "entropy": 5.645549631118774, "epoch": 2.616152629497825, "grad_norm": 1.015625, "learning_rate": 0.00043195629274396237, "loss": 5.0038, "mean_token_accuracy": 0.22918743789196014, "num_tokens": 60617802.0, "step": 26465 }, { "entropy": 5.738967418670654, "epoch": 2.6166468960063267, "grad_norm": 1.0234375, "learning_rate": 0.00043193100541852526, "loss": 5.0601, "mean_token_accuracy": 0.21122468411922454, "num_tokens": 60629044.0, "step": 26470 }, { "entropy": 5.6645190715789795, "epoch": 2.617141162514828, "grad_norm": 1.0859375, "learning_rate": 0.000431905714232561, "loss": 4.9691, "mean_token_accuracy": 0.22353244870901107, "num_tokens": 60639729.0, "step": 26475 }, { "entropy": 5.696509981155396, "epoch": 2.6176354290233292, "grad_norm": 1.140625, "learning_rate": 0.00043188041918669197, "loss": 5.0588, "mean_token_accuracy": 0.2144579604268074, "num_tokens": 60650499.0, "step": 26480 }, { "entropy": 5.784479379653931, "epoch": 2.618129695531831, "grad_norm": 1.15625, "learning_rate": 0.0004318551202815402, "loss": 5.1156, "mean_token_accuracy": 0.2068298026919365, "num_tokens": 60661453.0, "step": 26485 }, { "entropy": 5.724158763885498, "epoch": 2.618623962040332, "grad_norm": 1.234375, "learning_rate": 0.00043182981751772816, "loss": 4.9935, "mean_token_accuracy": 0.21910915672779083, "num_tokens": 60672748.0, "step": 26490 }, { "entropy": 5.653290700912476, "epoch": 2.6191182285488335, "grad_norm": 1.2265625, "learning_rate": 0.0004318045108958783, "loss": 4.9718, "mean_token_accuracy": 0.22034027725458144, "num_tokens": 60683679.0, "step": 26495 }, { "entropy": 5.649635457992554, "epoch": 2.6196124950573347, "grad_norm": 1.046875, "learning_rate": 0.00043177920041661313, "loss": 4.9374, "mean_token_accuracy": 0.2231195628643036, "num_tokens": 60696988.0, "step": 26500 }, { "entropy": 5.716681289672851, "epoch": 2.6201067615658364, "grad_norm": 1.046875, "learning_rate": 0.0004317538860805553, "loss": 5.1158, "mean_token_accuracy": 0.21333537697792054, "num_tokens": 60709817.0, "step": 26505 }, { "entropy": 5.753416681289673, "epoch": 2.6206010280743377, "grad_norm": 1.078125, "learning_rate": 0.00043172856788832755, "loss": 5.0394, "mean_token_accuracy": 0.21691515445709228, "num_tokens": 60720941.0, "step": 26510 }, { "entropy": 5.770007085800171, "epoch": 2.621095294582839, "grad_norm": 1.0703125, "learning_rate": 0.00043170324584055275, "loss": 5.1285, "mean_token_accuracy": 0.208763886988163, "num_tokens": 60731873.0, "step": 26515 }, { "entropy": 5.6864594459533695, "epoch": 2.6215895610913407, "grad_norm": 1.0859375, "learning_rate": 0.00043167791993785375, "loss": 5.0071, "mean_token_accuracy": 0.22098004668951035, "num_tokens": 60744361.0, "step": 26520 }, { "entropy": 5.733385515213013, "epoch": 2.622083827599842, "grad_norm": 1.1796875, "learning_rate": 0.0004316525901808536, "loss": 5.052, "mean_token_accuracy": 0.2154487207531929, "num_tokens": 60756111.0, "step": 26525 }, { "entropy": 5.733601903915405, "epoch": 2.622578094108343, "grad_norm": 1.140625, "learning_rate": 0.00043162725657017544, "loss": 4.9063, "mean_token_accuracy": 0.22673411220312117, "num_tokens": 60766602.0, "step": 26530 }, { "entropy": 5.731798601150513, "epoch": 2.6230723606168445, "grad_norm": 1.0546875, "learning_rate": 0.00043160191910644253, "loss": 5.031, "mean_token_accuracy": 0.2158122882246971, "num_tokens": 60778670.0, "step": 26535 }, { "entropy": 5.73510332107544, "epoch": 2.6235666271253457, "grad_norm": 1.140625, "learning_rate": 0.0004315765777902781, "loss": 5.0937, "mean_token_accuracy": 0.21073362827301026, "num_tokens": 60790026.0, "step": 26540 }, { "entropy": 5.724614810943604, "epoch": 2.6240608936338474, "grad_norm": 1.1484375, "learning_rate": 0.0004315512326223055, "loss": 5.0712, "mean_token_accuracy": 0.21171680986881256, "num_tokens": 60801325.0, "step": 26545 }, { "entropy": 5.733736658096314, "epoch": 2.6245551601423487, "grad_norm": 1.078125, "learning_rate": 0.0004315258836031483, "loss": 5.0531, "mean_token_accuracy": 0.2118220865726471, "num_tokens": 60813421.0, "step": 26550 }, { "entropy": 5.750084924697876, "epoch": 2.6250494266508504, "grad_norm": 1.0234375, "learning_rate": 0.0004315005307334301, "loss": 5.0483, "mean_token_accuracy": 0.20678311735391616, "num_tokens": 60826447.0, "step": 26555 }, { "entropy": 5.7129754543304445, "epoch": 2.6255436931593517, "grad_norm": 1.1953125, "learning_rate": 0.0004314751740137746, "loss": 5.0007, "mean_token_accuracy": 0.21546009182929993, "num_tokens": 60837663.0, "step": 26560 }, { "entropy": 5.733322811126709, "epoch": 2.626037959667853, "grad_norm": 1.1796875, "learning_rate": 0.00043144981344480553, "loss": 5.0084, "mean_token_accuracy": 0.21074688732624053, "num_tokens": 60849040.0, "step": 26565 }, { "entropy": 5.674941349029541, "epoch": 2.626532226176354, "grad_norm": 1.125, "learning_rate": 0.00043142444902714676, "loss": 5.0626, "mean_token_accuracy": 0.21186541318893432, "num_tokens": 60862112.0, "step": 26570 }, { "entropy": 5.660215759277344, "epoch": 2.6270264926848554, "grad_norm": 1.1484375, "learning_rate": 0.00043139908076142224, "loss": 4.9906, "mean_token_accuracy": 0.21630873531103134, "num_tokens": 60872822.0, "step": 26575 }, { "entropy": 5.724995803833008, "epoch": 2.627520759193357, "grad_norm": 1.1015625, "learning_rate": 0.0004313737086482562, "loss": 5.0735, "mean_token_accuracy": 0.20913240760564805, "num_tokens": 60884374.0, "step": 26580 }, { "entropy": 5.719517993927002, "epoch": 2.6280150257018584, "grad_norm": 1.0625, "learning_rate": 0.0004313483326882725, "loss": 5.0546, "mean_token_accuracy": 0.2164910092949867, "num_tokens": 60895490.0, "step": 26585 }, { "entropy": 5.62080864906311, "epoch": 2.6285092922103597, "grad_norm": 1.15625, "learning_rate": 0.0004313229528820957, "loss": 4.9081, "mean_token_accuracy": 0.22872539460659028, "num_tokens": 60906190.0, "step": 26590 }, { "entropy": 5.708775281906128, "epoch": 2.6290035587188614, "grad_norm": 1.1875, "learning_rate": 0.00043129756923034995, "loss": 5.0291, "mean_token_accuracy": 0.21680515855550767, "num_tokens": 60918466.0, "step": 26595 }, { "entropy": 5.650860691070557, "epoch": 2.6294978252273626, "grad_norm": 1.140625, "learning_rate": 0.0004312721817336597, "loss": 4.9135, "mean_token_accuracy": 0.22271667122840882, "num_tokens": 60930202.0, "step": 26600 }, { "entropy": 5.699853038787841, "epoch": 2.629992091735864, "grad_norm": 1.0390625, "learning_rate": 0.00043124679039264964, "loss": 5.0346, "mean_token_accuracy": 0.21889408230781554, "num_tokens": 60942089.0, "step": 26605 }, { "entropy": 5.710665321350097, "epoch": 2.630486358244365, "grad_norm": 1.15625, "learning_rate": 0.00043122139520794425, "loss": 4.961, "mean_token_accuracy": 0.21609577685594558, "num_tokens": 60954493.0, "step": 26610 }, { "entropy": 5.654888439178467, "epoch": 2.630980624752867, "grad_norm": 1.3125, "learning_rate": 0.00043119599618016824, "loss": 5.014, "mean_token_accuracy": 0.2144119545817375, "num_tokens": 60965888.0, "step": 26615 }, { "entropy": 5.667346096038818, "epoch": 2.631474891261368, "grad_norm": 1.171875, "learning_rate": 0.0004311705933099466, "loss": 4.954, "mean_token_accuracy": 0.21972678303718568, "num_tokens": 60976414.0, "step": 26620 }, { "entropy": 5.660156106948852, "epoch": 2.6319691577698694, "grad_norm": 1.234375, "learning_rate": 0.0004311451865979041, "loss": 4.9472, "mean_token_accuracy": 0.2212633639574051, "num_tokens": 60986353.0, "step": 26625 }, { "entropy": 5.686699295043946, "epoch": 2.632463424278371, "grad_norm": 1.2265625, "learning_rate": 0.00043111977604466575, "loss": 4.9894, "mean_token_accuracy": 0.2276598870754242, "num_tokens": 60996916.0, "step": 26630 }, { "entropy": 5.590903663635254, "epoch": 2.6329576907868724, "grad_norm": 1.0859375, "learning_rate": 0.0004310943616508567, "loss": 4.935, "mean_token_accuracy": 0.22646029591560363, "num_tokens": 61008741.0, "step": 26635 }, { "entropy": 5.754882335662842, "epoch": 2.6334519572953736, "grad_norm": 1.2109375, "learning_rate": 0.0004310689434171022, "loss": 5.1152, "mean_token_accuracy": 0.20967260897159576, "num_tokens": 61019988.0, "step": 26640 }, { "entropy": 5.749897718429565, "epoch": 2.633946223803875, "grad_norm": 1.1484375, "learning_rate": 0.00043104352134402734, "loss": 5.0295, "mean_token_accuracy": 0.21297657936811448, "num_tokens": 61031667.0, "step": 26645 }, { "entropy": 5.729730749130249, "epoch": 2.6344404903123766, "grad_norm": 1.203125, "learning_rate": 0.00043101809543225777, "loss": 4.9932, "mean_token_accuracy": 0.2207876205444336, "num_tokens": 61042203.0, "step": 26650 }, { "entropy": 5.665720987319946, "epoch": 2.634934756820878, "grad_norm": 1.203125, "learning_rate": 0.00043099266568241885, "loss": 4.9682, "mean_token_accuracy": 0.2185746029019356, "num_tokens": 61054243.0, "step": 26655 }, { "entropy": 5.6023646831512455, "epoch": 2.635429023329379, "grad_norm": 1.1015625, "learning_rate": 0.00043096723209513606, "loss": 4.837, "mean_token_accuracy": 0.23610788583755493, "num_tokens": 61064068.0, "step": 26660 }, { "entropy": 5.606233787536621, "epoch": 2.635923289837881, "grad_norm": 1.078125, "learning_rate": 0.0004309417946710352, "loss": 4.9263, "mean_token_accuracy": 0.2320251926779747, "num_tokens": 61075273.0, "step": 26665 }, { "entropy": 5.717097520828247, "epoch": 2.636417556346382, "grad_norm": 1.2578125, "learning_rate": 0.000430916353410742, "loss": 5.028, "mean_token_accuracy": 0.21700633466243743, "num_tokens": 61086536.0, "step": 26670 }, { "entropy": 5.671091985702515, "epoch": 2.6369118228548833, "grad_norm": 1.1015625, "learning_rate": 0.0004308909083148824, "loss": 4.9949, "mean_token_accuracy": 0.2183769166469574, "num_tokens": 61097567.0, "step": 26675 }, { "entropy": 5.679510927200317, "epoch": 2.6374060893633846, "grad_norm": 1.4140625, "learning_rate": 0.0004308654593840822, "loss": 4.9601, "mean_token_accuracy": 0.21929265111684798, "num_tokens": 61108379.0, "step": 26680 }, { "entropy": 5.618005895614624, "epoch": 2.637900355871886, "grad_norm": 1.0859375, "learning_rate": 0.00043084000661896757, "loss": 4.9705, "mean_token_accuracy": 0.22360235303640366, "num_tokens": 61119715.0, "step": 26685 }, { "entropy": 5.718747329711914, "epoch": 2.6383946223803876, "grad_norm": 1.140625, "learning_rate": 0.0004308145500201645, "loss": 5.0811, "mean_token_accuracy": 0.2129189118742943, "num_tokens": 61131810.0, "step": 26690 }, { "entropy": 5.6651510238647464, "epoch": 2.638888888888889, "grad_norm": 1.140625, "learning_rate": 0.00043078908958829945, "loss": 4.9469, "mean_token_accuracy": 0.22582807540893554, "num_tokens": 61142771.0, "step": 26695 }, { "entropy": 5.640940237045288, "epoch": 2.6393831553973905, "grad_norm": 1.140625, "learning_rate": 0.00043076362532399855, "loss": 4.9916, "mean_token_accuracy": 0.21778007298707963, "num_tokens": 61154105.0, "step": 26700 }, { "entropy": 5.707059526443482, "epoch": 2.639877421905892, "grad_norm": 1.171875, "learning_rate": 0.0004307381572278882, "loss": 4.9124, "mean_token_accuracy": 0.2288718491792679, "num_tokens": 61164574.0, "step": 26705 }, { "entropy": 5.730502605438232, "epoch": 2.640371688414393, "grad_norm": 1.0625, "learning_rate": 0.0004307126853005952, "loss": 5.0712, "mean_token_accuracy": 0.21152730286121368, "num_tokens": 61177085.0, "step": 26710 }, { "entropy": 5.698912286758423, "epoch": 2.6408659549228943, "grad_norm": 1.0859375, "learning_rate": 0.0004306872095427459, "loss": 4.961, "mean_token_accuracy": 0.22628767937421798, "num_tokens": 61188313.0, "step": 26715 }, { "entropy": 5.616076183319092, "epoch": 2.6413602214313956, "grad_norm": 1.1015625, "learning_rate": 0.0004306617299549672, "loss": 4.9214, "mean_token_accuracy": 0.22424285411834716, "num_tokens": 61199726.0, "step": 26720 }, { "entropy": 5.704315519332885, "epoch": 2.6418544879398973, "grad_norm": 1.171875, "learning_rate": 0.0004306362465378857, "loss": 4.9895, "mean_token_accuracy": 0.21507151424884796, "num_tokens": 61211861.0, "step": 26725 }, { "entropy": 5.699096059799194, "epoch": 2.6423487544483986, "grad_norm": 1.1015625, "learning_rate": 0.00043061075929212836, "loss": 4.9743, "mean_token_accuracy": 0.21925762742757798, "num_tokens": 61222464.0, "step": 26730 }, { "entropy": 5.724076890945435, "epoch": 2.6428430209569, "grad_norm": 1.15625, "learning_rate": 0.0004305852682183222, "loss": 4.9692, "mean_token_accuracy": 0.21709523350000381, "num_tokens": 61233678.0, "step": 26735 }, { "entropy": 5.662415981292725, "epoch": 2.6433372874654015, "grad_norm": 1.03125, "learning_rate": 0.0004305597733170944, "loss": 5.0318, "mean_token_accuracy": 0.21709883213043213, "num_tokens": 61244636.0, "step": 26740 }, { "entropy": 5.748428106307983, "epoch": 2.643831553973903, "grad_norm": 1.1875, "learning_rate": 0.00043053427458907196, "loss": 4.9959, "mean_token_accuracy": 0.21096169501543044, "num_tokens": 61256334.0, "step": 26745 }, { "entropy": 5.741091728210449, "epoch": 2.644325820482404, "grad_norm": 0.9765625, "learning_rate": 0.0004305087720348823, "loss": 5.0252, "mean_token_accuracy": 0.2193573459982872, "num_tokens": 61268614.0, "step": 26750 }, { "entropy": 5.7390929698944095, "epoch": 2.6448200869909053, "grad_norm": 1.1796875, "learning_rate": 0.00043048326565515267, "loss": 5.0753, "mean_token_accuracy": 0.21022985875606537, "num_tokens": 61280220.0, "step": 26755 }, { "entropy": 5.715899705886841, "epoch": 2.645314353499407, "grad_norm": 1.2265625, "learning_rate": 0.00043045775545051055, "loss": 4.9253, "mean_token_accuracy": 0.2259628102183342, "num_tokens": 61290796.0, "step": 26760 }, { "entropy": 5.690618515014648, "epoch": 2.6458086200079083, "grad_norm": 1.0703125, "learning_rate": 0.0004304322414215836, "loss": 5.0318, "mean_token_accuracy": 0.21538103222846985, "num_tokens": 61303645.0, "step": 26765 }, { "entropy": 5.662274408340454, "epoch": 2.6463028865164095, "grad_norm": 1.0234375, "learning_rate": 0.00043040672356899946, "loss": 5.0058, "mean_token_accuracy": 0.21806153655052185, "num_tokens": 61316641.0, "step": 26770 }, { "entropy": 5.721528482437134, "epoch": 2.6467971530249113, "grad_norm": 1.109375, "learning_rate": 0.00043038120189338566, "loss": 5.1016, "mean_token_accuracy": 0.20748539716005326, "num_tokens": 61329314.0, "step": 26775 }, { "entropy": 5.742600202560425, "epoch": 2.6472914195334125, "grad_norm": 1.0546875, "learning_rate": 0.00043035567639537026, "loss": 5.0899, "mean_token_accuracy": 0.21027597934007644, "num_tokens": 61340847.0, "step": 26780 }, { "entropy": 5.8133955001831055, "epoch": 2.6477856860419138, "grad_norm": 1.0859375, "learning_rate": 0.00043033014707558113, "loss": 5.0638, "mean_token_accuracy": 0.21224619895219804, "num_tokens": 61351875.0, "step": 26785 }, { "entropy": 5.71115140914917, "epoch": 2.648279952550415, "grad_norm": 1.015625, "learning_rate": 0.0004303046139346462, "loss": 5.0384, "mean_token_accuracy": 0.22300745993852616, "num_tokens": 61364441.0, "step": 26790 }, { "entropy": 5.691520071029663, "epoch": 2.6487742190589163, "grad_norm": 1.1015625, "learning_rate": 0.0004302790769731938, "loss": 4.9942, "mean_token_accuracy": 0.21748262643814087, "num_tokens": 61375084.0, "step": 26795 }, { "entropy": 5.743958139419556, "epoch": 2.649268485567418, "grad_norm": 1.1171875, "learning_rate": 0.00043025353619185195, "loss": 5.0712, "mean_token_accuracy": 0.20926353633403777, "num_tokens": 61386036.0, "step": 26800 }, { "entropy": 5.728154611587525, "epoch": 2.6497627520759193, "grad_norm": 1.0703125, "learning_rate": 0.00043022799159124904, "loss": 5.0144, "mean_token_accuracy": 0.22576939314603806, "num_tokens": 61396006.0, "step": 26805 }, { "entropy": 5.72993049621582, "epoch": 2.650257018584421, "grad_norm": 1.2734375, "learning_rate": 0.00043020244317201344, "loss": 5.0867, "mean_token_accuracy": 0.21387850046157836, "num_tokens": 61406453.0, "step": 26810 }, { "entropy": 5.715651893615723, "epoch": 2.6507512850929222, "grad_norm": 1.1015625, "learning_rate": 0.0004301768909347737, "loss": 5.0761, "mean_token_accuracy": 0.21549927890300752, "num_tokens": 61418271.0, "step": 26815 }, { "entropy": 5.79262957572937, "epoch": 2.6512455516014235, "grad_norm": 1.0234375, "learning_rate": 0.0004301513348801583, "loss": 5.0159, "mean_token_accuracy": 0.21253803372383118, "num_tokens": 61430575.0, "step": 26820 }, { "entropy": 5.630987977981567, "epoch": 2.6517398181099248, "grad_norm": 1.015625, "learning_rate": 0.000430125775008796, "loss": 4.9287, "mean_token_accuracy": 0.22457814514636992, "num_tokens": 61442336.0, "step": 26825 }, { "entropy": 5.71291675567627, "epoch": 2.652234084618426, "grad_norm": 1.0234375, "learning_rate": 0.00043010021132131564, "loss": 4.9984, "mean_token_accuracy": 0.21855925470590593, "num_tokens": 61453945.0, "step": 26830 }, { "entropy": 5.7469401359558105, "epoch": 2.6527283511269277, "grad_norm": 1.1171875, "learning_rate": 0.000430074643818346, "loss": 4.9856, "mean_token_accuracy": 0.2194122329354286, "num_tokens": 61463877.0, "step": 26835 }, { "entropy": 5.6636425971984865, "epoch": 2.653222617635429, "grad_norm": 1.3125, "learning_rate": 0.00043004907250051606, "loss": 4.9188, "mean_token_accuracy": 0.22524941563606263, "num_tokens": 61473278.0, "step": 26840 }, { "entropy": 5.71568193435669, "epoch": 2.6537168841439303, "grad_norm": 1.0625, "learning_rate": 0.0004300234973684548, "loss": 5.0838, "mean_token_accuracy": 0.2134735956788063, "num_tokens": 61486038.0, "step": 26845 }, { "entropy": 5.6928071022033695, "epoch": 2.654211150652432, "grad_norm": 1.1015625, "learning_rate": 0.0004299979184227916, "loss": 5.0253, "mean_token_accuracy": 0.2130693405866623, "num_tokens": 61497722.0, "step": 26850 }, { "entropy": 5.684412240982056, "epoch": 2.6547054171609332, "grad_norm": 1.1015625, "learning_rate": 0.00042997233566415547, "loss": 4.9746, "mean_token_accuracy": 0.2159498155117035, "num_tokens": 61508791.0, "step": 26855 }, { "entropy": 5.687562656402588, "epoch": 2.6551996836694345, "grad_norm": 1.0703125, "learning_rate": 0.00042994674909317584, "loss": 4.9765, "mean_token_accuracy": 0.22060172110795975, "num_tokens": 61520047.0, "step": 26860 }, { "entropy": 5.73206057548523, "epoch": 2.6556939501779357, "grad_norm": 1.15625, "learning_rate": 0.00042992115871048214, "loss": 4.9717, "mean_token_accuracy": 0.21753401458263397, "num_tokens": 61531005.0, "step": 26865 }, { "entropy": 5.678264045715332, "epoch": 2.6561882166864375, "grad_norm": 1.1640625, "learning_rate": 0.00042989556451670396, "loss": 5.0158, "mean_token_accuracy": 0.21903164237737655, "num_tokens": 61542087.0, "step": 26870 }, { "entropy": 5.673075771331787, "epoch": 2.6566824831949387, "grad_norm": 1.234375, "learning_rate": 0.0004298699665124708, "loss": 5.0813, "mean_token_accuracy": 0.21386438012123107, "num_tokens": 61553575.0, "step": 26875 }, { "entropy": 5.761148929595947, "epoch": 2.65717674970344, "grad_norm": 1.1640625, "learning_rate": 0.00042984436469841245, "loss": 5.0811, "mean_token_accuracy": 0.21132880002260207, "num_tokens": 61564833.0, "step": 26880 }, { "entropy": 5.661766624450683, "epoch": 2.6576710162119417, "grad_norm": 1.109375, "learning_rate": 0.00042981875907515874, "loss": 4.8688, "mean_token_accuracy": 0.23008145838975907, "num_tokens": 61575721.0, "step": 26885 }, { "entropy": 5.736316537857055, "epoch": 2.658165282720443, "grad_norm": 1.265625, "learning_rate": 0.00042979314964333953, "loss": 5.0207, "mean_token_accuracy": 0.21607204526662827, "num_tokens": 61587022.0, "step": 26890 }, { "entropy": 5.7123880863189695, "epoch": 2.658659549228944, "grad_norm": 1.203125, "learning_rate": 0.0004297675364035848, "loss": 4.9777, "mean_token_accuracy": 0.21809093058109283, "num_tokens": 61597610.0, "step": 26895 }, { "entropy": 5.8117307186126705, "epoch": 2.6591538157374455, "grad_norm": 1.28125, "learning_rate": 0.0004297419193565247, "loss": 5.0879, "mean_token_accuracy": 0.20330984741449357, "num_tokens": 61608254.0, "step": 26900 }, { "entropy": 5.7257812976837155, "epoch": 2.659648082245947, "grad_norm": 1.1484375, "learning_rate": 0.00042971629850278924, "loss": 4.9901, "mean_token_accuracy": 0.2176758050918579, "num_tokens": 61619937.0, "step": 26905 }, { "entropy": 5.6658965110778805, "epoch": 2.6601423487544484, "grad_norm": 1.109375, "learning_rate": 0.00042969067384300905, "loss": 5.0247, "mean_token_accuracy": 0.2169333964586258, "num_tokens": 61630460.0, "step": 26910 }, { "entropy": 5.6873921871185305, "epoch": 2.6606366152629497, "grad_norm": 1.109375, "learning_rate": 0.00042966504537781416, "loss": 4.9606, "mean_token_accuracy": 0.21972622275352477, "num_tokens": 61640855.0, "step": 26915 }, { "entropy": 5.779351615905762, "epoch": 2.6611308817714514, "grad_norm": 1.09375, "learning_rate": 0.0004296394131078351, "loss": 5.054, "mean_token_accuracy": 0.21082686334848405, "num_tokens": 61652405.0, "step": 26920 }, { "entropy": 5.722966814041138, "epoch": 2.6616251482799527, "grad_norm": 1.0234375, "learning_rate": 0.00042961377703370265, "loss": 4.957, "mean_token_accuracy": 0.22248823195695877, "num_tokens": 61664379.0, "step": 26925 }, { "entropy": 5.679649591445923, "epoch": 2.662119414788454, "grad_norm": 1.0078125, "learning_rate": 0.0004295881371560472, "loss": 4.9709, "mean_token_accuracy": 0.22487534284591676, "num_tokens": 61675259.0, "step": 26930 }, { "entropy": 5.644587135314941, "epoch": 2.662613681296955, "grad_norm": 1.0625, "learning_rate": 0.00042956249347549964, "loss": 4.991, "mean_token_accuracy": 0.21793091744184495, "num_tokens": 61687035.0, "step": 26935 }, { "entropy": 5.755333471298218, "epoch": 2.6631079478054565, "grad_norm": 1.1875, "learning_rate": 0.0004295368459926907, "loss": 5.0248, "mean_token_accuracy": 0.2154269203543663, "num_tokens": 61698082.0, "step": 26940 }, { "entropy": 5.762499904632568, "epoch": 2.663602214313958, "grad_norm": 1.1171875, "learning_rate": 0.00042951119470825146, "loss": 5.0072, "mean_token_accuracy": 0.2109287738800049, "num_tokens": 61708533.0, "step": 26945 }, { "entropy": 5.725760889053345, "epoch": 2.6640964808224594, "grad_norm": 1.171875, "learning_rate": 0.00042948553962281286, "loss": 5.0377, "mean_token_accuracy": 0.210419762134552, "num_tokens": 61719301.0, "step": 26950 }, { "entropy": 5.651941204071045, "epoch": 2.664590747330961, "grad_norm": 1.1796875, "learning_rate": 0.0004294598807370059, "loss": 4.9649, "mean_token_accuracy": 0.21873128563165664, "num_tokens": 61732225.0, "step": 26955 }, { "entropy": 5.625168895721435, "epoch": 2.6650850138394624, "grad_norm": 1.1171875, "learning_rate": 0.000429434218051462, "loss": 4.9576, "mean_token_accuracy": 0.2251772940158844, "num_tokens": 61743901.0, "step": 26960 }, { "entropy": 5.678807878494263, "epoch": 2.6655792803479637, "grad_norm": 1.125, "learning_rate": 0.0004294085515668123, "loss": 4.9848, "mean_token_accuracy": 0.2220032051205635, "num_tokens": 61756047.0, "step": 26965 }, { "entropy": 5.7197283744812015, "epoch": 2.666073546856465, "grad_norm": 1.1484375, "learning_rate": 0.00042938288128368835, "loss": 4.9756, "mean_token_accuracy": 0.22080026268959047, "num_tokens": 61767784.0, "step": 26970 }, { "entropy": 5.7354528427124025, "epoch": 2.666567813364966, "grad_norm": 1.1484375, "learning_rate": 0.00042935720720272156, "loss": 5.081, "mean_token_accuracy": 0.214602030813694, "num_tokens": 61778915.0, "step": 26975 }, { "entropy": 5.637601613998413, "epoch": 2.667062079873468, "grad_norm": 1.0703125, "learning_rate": 0.0004293315293245435, "loss": 4.9918, "mean_token_accuracy": 0.2192279428243637, "num_tokens": 61791046.0, "step": 26980 }, { "entropy": 5.717722654342651, "epoch": 2.667556346381969, "grad_norm": 1.1953125, "learning_rate": 0.00042930584764978597, "loss": 4.9755, "mean_token_accuracy": 0.2235797256231308, "num_tokens": 61802135.0, "step": 26985 }, { "entropy": 5.780620098114014, "epoch": 2.6680506128904704, "grad_norm": 1.0546875, "learning_rate": 0.00042928016217908053, "loss": 5.039, "mean_token_accuracy": 0.22073888927698135, "num_tokens": 61815077.0, "step": 26990 }, { "entropy": 5.665139770507812, "epoch": 2.668544879398972, "grad_norm": 1.1875, "learning_rate": 0.0004292544729130592, "loss": 4.9312, "mean_token_accuracy": 0.22228024899959564, "num_tokens": 61826031.0, "step": 26995 }, { "entropy": 5.661031484603882, "epoch": 2.6690391459074734, "grad_norm": 1.125, "learning_rate": 0.00042922877985235395, "loss": 4.9553, "mean_token_accuracy": 0.22762898355722427, "num_tokens": 61836372.0, "step": 27000 }, { "epoch": 2.6690391459074734, "eval_entropy": 5.4216988277318, "eval_loss": 5.053977012634277, "eval_mean_token_accuracy": 0.2238519115843163, "eval_num_tokens": 61836372.0, "eval_runtime": 20.548, "eval_samples_per_second": 1582.299, "eval_steps_per_second": 197.83, "step": 27000 }, { "entropy": 5.6321619033813475, "epoch": 2.6695334124159746, "grad_norm": 1.078125, "learning_rate": 0.00042920308299759677, "loss": 4.9372, "mean_token_accuracy": 0.21940778344869613, "num_tokens": 61847829.0, "step": 27005 }, { "entropy": 5.690559816360474, "epoch": 2.670027678924476, "grad_norm": 1.203125, "learning_rate": 0.0004291773823494198, "loss": 5.0168, "mean_token_accuracy": 0.22404668033123015, "num_tokens": 61859074.0, "step": 27010 }, { "entropy": 5.759458208084107, "epoch": 2.6705219454329776, "grad_norm": 1.1328125, "learning_rate": 0.00042915167790845535, "loss": 5.1186, "mean_token_accuracy": 0.20576048642396927, "num_tokens": 61868596.0, "step": 27015 }, { "entropy": 5.664997100830078, "epoch": 2.671016211941479, "grad_norm": 1.109375, "learning_rate": 0.0004291259696753356, "loss": 5.0191, "mean_token_accuracy": 0.2199859455227852, "num_tokens": 61879173.0, "step": 27020 }, { "entropy": 5.679371070861817, "epoch": 2.67151047844998, "grad_norm": 1.1796875, "learning_rate": 0.0004291002576506932, "loss": 4.9739, "mean_token_accuracy": 0.22460290789604187, "num_tokens": 61889784.0, "step": 27025 }, { "entropy": 5.7657787799835205, "epoch": 2.672004744958482, "grad_norm": 1.1796875, "learning_rate": 0.00042907454183516055, "loss": 5.0206, "mean_token_accuracy": 0.22319450974464417, "num_tokens": 61900295.0, "step": 27030 }, { "entropy": 5.688719415664673, "epoch": 2.672499011466983, "grad_norm": 1.1953125, "learning_rate": 0.0004290488222293702, "loss": 4.9609, "mean_token_accuracy": 0.2239790141582489, "num_tokens": 61911938.0, "step": 27035 }, { "entropy": 5.678220272064209, "epoch": 2.6729932779754844, "grad_norm": 1.25, "learning_rate": 0.00042902309883395497, "loss": 4.9982, "mean_token_accuracy": 0.221888168156147, "num_tokens": 61922609.0, "step": 27040 }, { "entropy": 5.640492963790893, "epoch": 2.6734875444839856, "grad_norm": 1.1796875, "learning_rate": 0.0004289973716495476, "loss": 4.9691, "mean_token_accuracy": 0.2174384132027626, "num_tokens": 61932744.0, "step": 27045 }, { "entropy": 5.66418776512146, "epoch": 2.673981810992487, "grad_norm": 1.1796875, "learning_rate": 0.00042897164067678094, "loss": 4.9754, "mean_token_accuracy": 0.2229044497013092, "num_tokens": 61944099.0, "step": 27050 }, { "entropy": 5.740688467025757, "epoch": 2.6744760775009886, "grad_norm": 1.1171875, "learning_rate": 0.00042894590591628813, "loss": 5.0711, "mean_token_accuracy": 0.21727485209703445, "num_tokens": 61955241.0, "step": 27055 }, { "entropy": 5.615402412414551, "epoch": 2.67497034400949, "grad_norm": 1.140625, "learning_rate": 0.00042892016736870213, "loss": 4.9487, "mean_token_accuracy": 0.22464238107204437, "num_tokens": 61966578.0, "step": 27060 }, { "entropy": 5.6774450778961185, "epoch": 2.6754646105179916, "grad_norm": 1.0703125, "learning_rate": 0.00042889442503465616, "loss": 4.9419, "mean_token_accuracy": 0.23150235265493393, "num_tokens": 61977628.0, "step": 27065 }, { "entropy": 5.7972900390625, "epoch": 2.675958877026493, "grad_norm": 1.140625, "learning_rate": 0.00042886867891478344, "loss": 5.1034, "mean_token_accuracy": 0.20824008584022521, "num_tokens": 61988904.0, "step": 27070 }, { "entropy": 5.674889039993286, "epoch": 2.676453143534994, "grad_norm": 1.1171875, "learning_rate": 0.0004288429290097173, "loss": 5.0568, "mean_token_accuracy": 0.21449539214372634, "num_tokens": 62000977.0, "step": 27075 }, { "entropy": 5.711830425262451, "epoch": 2.6769474100434953, "grad_norm": 1.1796875, "learning_rate": 0.00042881717532009125, "loss": 5.0263, "mean_token_accuracy": 0.2151870533823967, "num_tokens": 62011023.0, "step": 27080 }, { "entropy": 5.726917314529419, "epoch": 2.6774416765519966, "grad_norm": 1.171875, "learning_rate": 0.00042879141784653887, "loss": 5.0237, "mean_token_accuracy": 0.21477681398391724, "num_tokens": 62022679.0, "step": 27085 }, { "entropy": 5.7148909091949465, "epoch": 2.6779359430604983, "grad_norm": 1.1640625, "learning_rate": 0.00042876565658969375, "loss": 4.9404, "mean_token_accuracy": 0.21711788773536683, "num_tokens": 62033922.0, "step": 27090 }, { "entropy": 5.72533106803894, "epoch": 2.6784302095689996, "grad_norm": 1.1171875, "learning_rate": 0.00042873989155018955, "loss": 5.0837, "mean_token_accuracy": 0.2145394802093506, "num_tokens": 62045511.0, "step": 27095 }, { "entropy": 5.591947984695435, "epoch": 2.678924476077501, "grad_norm": 1.1640625, "learning_rate": 0.0004287141227286602, "loss": 4.8805, "mean_token_accuracy": 0.22692678719758988, "num_tokens": 62055113.0, "step": 27100 }, { "entropy": 5.784708738327026, "epoch": 2.6794187425860025, "grad_norm": 1.1484375, "learning_rate": 0.0004286883501257396, "loss": 5.1242, "mean_token_accuracy": 0.2087639257311821, "num_tokens": 62067808.0, "step": 27105 }, { "entropy": 5.727280378341675, "epoch": 2.679913009094504, "grad_norm": 1.125, "learning_rate": 0.00042866257374206174, "loss": 4.9489, "mean_token_accuracy": 0.21731794625520706, "num_tokens": 62078266.0, "step": 27110 }, { "entropy": 5.682216453552246, "epoch": 2.680407275603005, "grad_norm": 1.015625, "learning_rate": 0.00042863679357826076, "loss": 5.0477, "mean_token_accuracy": 0.21350272744894028, "num_tokens": 62091612.0, "step": 27115 }, { "entropy": 5.68894100189209, "epoch": 2.6809015421115063, "grad_norm": 1.109375, "learning_rate": 0.0004286110096349708, "loss": 5.0197, "mean_token_accuracy": 0.21286636888980864, "num_tokens": 62104198.0, "step": 27120 }, { "entropy": 5.6859534740447994, "epoch": 2.681395808620008, "grad_norm": 1.1328125, "learning_rate": 0.0004285852219128261, "loss": 4.9473, "mean_token_accuracy": 0.21675826758146285, "num_tokens": 62115155.0, "step": 27125 }, { "entropy": 5.736457204818725, "epoch": 2.6818900751285093, "grad_norm": 1.1015625, "learning_rate": 0.0004285594304124612, "loss": 5.0592, "mean_token_accuracy": 0.210584457218647, "num_tokens": 62126555.0, "step": 27130 }, { "entropy": 5.715244388580322, "epoch": 2.6823843416370106, "grad_norm": 1.1640625, "learning_rate": 0.00042853363513451056, "loss": 5.0208, "mean_token_accuracy": 0.21914572566747664, "num_tokens": 62138976.0, "step": 27135 }, { "entropy": 5.735333967208862, "epoch": 2.6828786081455123, "grad_norm": 1.0, "learning_rate": 0.00042850783607960855, "loss": 5.0834, "mean_token_accuracy": 0.21475236117839813, "num_tokens": 62150453.0, "step": 27140 }, { "entropy": 5.653365278244019, "epoch": 2.6833728746540135, "grad_norm": 1.140625, "learning_rate": 0.00042848203324839, "loss": 4.861, "mean_token_accuracy": 0.229047591984272, "num_tokens": 62162342.0, "step": 27145 }, { "entropy": 5.690463733673096, "epoch": 2.683867141162515, "grad_norm": 1.0703125, "learning_rate": 0.0004284562266414896, "loss": 5.0187, "mean_token_accuracy": 0.2196005180478096, "num_tokens": 62173850.0, "step": 27150 }, { "entropy": 5.621695899963379, "epoch": 2.684361407671016, "grad_norm": 1.1328125, "learning_rate": 0.00042843041625954223, "loss": 4.934, "mean_token_accuracy": 0.21622993797063828, "num_tokens": 62185410.0, "step": 27155 }, { "entropy": 5.68964376449585, "epoch": 2.6848556741795178, "grad_norm": 1.03125, "learning_rate": 0.0004284046021031828, "loss": 4.9582, "mean_token_accuracy": 0.22273259609937668, "num_tokens": 62197620.0, "step": 27160 }, { "entropy": 5.671229362487793, "epoch": 2.685349940688019, "grad_norm": 1.078125, "learning_rate": 0.0004283787841730464, "loss": 4.9842, "mean_token_accuracy": 0.2170150339603424, "num_tokens": 62209435.0, "step": 27165 }, { "entropy": 5.675285863876343, "epoch": 2.6858442071965203, "grad_norm": 1.09375, "learning_rate": 0.00042835296246976806, "loss": 5.0029, "mean_token_accuracy": 0.21671825647354126, "num_tokens": 62219948.0, "step": 27170 }, { "entropy": 5.682850408554077, "epoch": 2.686338473705022, "grad_norm": 1.125, "learning_rate": 0.0004283271369939831, "loss": 5.0134, "mean_token_accuracy": 0.21759459525346755, "num_tokens": 62230299.0, "step": 27175 }, { "entropy": 5.704958391189575, "epoch": 2.6868327402135233, "grad_norm": 1.0390625, "learning_rate": 0.00042830130774632687, "loss": 4.9981, "mean_token_accuracy": 0.22276640087366104, "num_tokens": 62241952.0, "step": 27180 }, { "entropy": 5.741428518295288, "epoch": 2.6873270067220245, "grad_norm": 1.171875, "learning_rate": 0.0004282754747274345, "loss": 5.0279, "mean_token_accuracy": 0.21613580882549285, "num_tokens": 62253200.0, "step": 27185 }, { "entropy": 5.729916143417358, "epoch": 2.6878212732305258, "grad_norm": 1.171875, "learning_rate": 0.00042824963793794174, "loss": 4.998, "mean_token_accuracy": 0.22157507091760636, "num_tokens": 62264203.0, "step": 27190 }, { "entropy": 5.746968364715576, "epoch": 2.688315539739027, "grad_norm": 1.1796875, "learning_rate": 0.00042822379737848424, "loss": 4.9953, "mean_token_accuracy": 0.22050076276063918, "num_tokens": 62276296.0, "step": 27195 }, { "entropy": 5.719486045837402, "epoch": 2.6888098062475287, "grad_norm": 1.0625, "learning_rate": 0.0004281979530496974, "loss": 5.0324, "mean_token_accuracy": 0.2144046738743782, "num_tokens": 62287827.0, "step": 27200 }, { "entropy": 5.803039026260376, "epoch": 2.68930407275603, "grad_norm": 1.109375, "learning_rate": 0.0004281721049522172, "loss": 5.0617, "mean_token_accuracy": 0.21033957302570344, "num_tokens": 62299451.0, "step": 27205 }, { "entropy": 5.682394123077392, "epoch": 2.6897983392645317, "grad_norm": 1.1015625, "learning_rate": 0.00042814625308667945, "loss": 5.0075, "mean_token_accuracy": 0.21834331303834914, "num_tokens": 62311508.0, "step": 27210 }, { "entropy": 5.698611497879028, "epoch": 2.690292605773033, "grad_norm": 1.078125, "learning_rate": 0.00042812039745372004, "loss": 4.972, "mean_token_accuracy": 0.2263050377368927, "num_tokens": 62323279.0, "step": 27215 }, { "entropy": 5.788854694366455, "epoch": 2.6907868722815342, "grad_norm": 1.234375, "learning_rate": 0.00042809453805397525, "loss": 5.0956, "mean_token_accuracy": 0.21407433450222016, "num_tokens": 62335897.0, "step": 27220 }, { "entropy": 5.7665125846862795, "epoch": 2.6912811387900355, "grad_norm": 1.125, "learning_rate": 0.000428068674888081, "loss": 5.0471, "mean_token_accuracy": 0.2097582072019577, "num_tokens": 62347090.0, "step": 27225 }, { "entropy": 5.747049331665039, "epoch": 2.6917754052985368, "grad_norm": 1.1875, "learning_rate": 0.00042804280795667363, "loss": 5.0117, "mean_token_accuracy": 0.21165463626384734, "num_tokens": 62358211.0, "step": 27230 }, { "entropy": 5.721274042129517, "epoch": 2.6922696718070385, "grad_norm": 1.1875, "learning_rate": 0.0004280169372603894, "loss": 4.9942, "mean_token_accuracy": 0.22276009619235992, "num_tokens": 62368628.0, "step": 27235 }, { "entropy": 5.6463953971862795, "epoch": 2.6927639383155397, "grad_norm": 1.09375, "learning_rate": 0.0004279910627998647, "loss": 4.9992, "mean_token_accuracy": 0.21832842826843263, "num_tokens": 62380633.0, "step": 27240 }, { "entropy": 5.764396619796753, "epoch": 2.693258204824041, "grad_norm": 1.203125, "learning_rate": 0.00042796518457573625, "loss": 5.0752, "mean_token_accuracy": 0.21331270188093185, "num_tokens": 62392615.0, "step": 27245 }, { "entropy": 5.73046178817749, "epoch": 2.6937524713325427, "grad_norm": 1.15625, "learning_rate": 0.0004279393025886405, "loss": 4.995, "mean_token_accuracy": 0.22365687787532806, "num_tokens": 62403087.0, "step": 27250 }, { "entropy": 5.765312576293946, "epoch": 2.694246737841044, "grad_norm": 1.1484375, "learning_rate": 0.00042791341683921417, "loss": 5.0216, "mean_token_accuracy": 0.21563545614480972, "num_tokens": 62415487.0, "step": 27255 }, { "entropy": 5.673682975769043, "epoch": 2.694741004349545, "grad_norm": 1.0859375, "learning_rate": 0.0004278875273280941, "loss": 4.9836, "mean_token_accuracy": 0.22069939225912094, "num_tokens": 62428123.0, "step": 27260 }, { "entropy": 5.695256948471069, "epoch": 2.6952352708580465, "grad_norm": 1.1328125, "learning_rate": 0.0004278616340559171, "loss": 5.0031, "mean_token_accuracy": 0.21745419055223464, "num_tokens": 62440250.0, "step": 27265 }, { "entropy": 5.6742844581604, "epoch": 2.695729537366548, "grad_norm": 1.2421875, "learning_rate": 0.00042783573702332014, "loss": 4.9823, "mean_token_accuracy": 0.2162162706255913, "num_tokens": 62451500.0, "step": 27270 }, { "entropy": 5.730587768554687, "epoch": 2.6962238038750495, "grad_norm": 1.28125, "learning_rate": 0.00042780983623094037, "loss": 5.0067, "mean_token_accuracy": 0.21840197890996932, "num_tokens": 62461839.0, "step": 27275 }, { "entropy": 5.715597820281983, "epoch": 2.6967180703835507, "grad_norm": 1.125, "learning_rate": 0.0004277839316794149, "loss": 4.9779, "mean_token_accuracy": 0.21947042793035507, "num_tokens": 62473650.0, "step": 27280 }, { "entropy": 5.718701601028442, "epoch": 2.6972123368920524, "grad_norm": 1.1484375, "learning_rate": 0.00042775802336938106, "loss": 5.028, "mean_token_accuracy": 0.2158135011792183, "num_tokens": 62484024.0, "step": 27285 }, { "entropy": 5.729912519454956, "epoch": 2.6977066034005537, "grad_norm": 1.1484375, "learning_rate": 0.0004277321113014762, "loss": 4.9996, "mean_token_accuracy": 0.21877060383558272, "num_tokens": 62495958.0, "step": 27290 }, { "entropy": 5.71972427368164, "epoch": 2.698200869909055, "grad_norm": 1.1171875, "learning_rate": 0.00042770619547633767, "loss": 5.1237, "mean_token_accuracy": 0.2141130343079567, "num_tokens": 62508474.0, "step": 27295 }, { "entropy": 5.6921507835388185, "epoch": 2.698695136417556, "grad_norm": 1.1640625, "learning_rate": 0.00042768027589460295, "loss": 5.0077, "mean_token_accuracy": 0.22028692364692687, "num_tokens": 62520281.0, "step": 27300 }, { "entropy": 5.766227388381958, "epoch": 2.6991894029260575, "grad_norm": 1.109375, "learning_rate": 0.0004276543525569098, "loss": 5.0208, "mean_token_accuracy": 0.21635464131832122, "num_tokens": 62532242.0, "step": 27305 }, { "entropy": 5.725044107437133, "epoch": 2.699683669434559, "grad_norm": 1.1875, "learning_rate": 0.00042762842546389593, "loss": 5.0193, "mean_token_accuracy": 0.22090674340724945, "num_tokens": 62544416.0, "step": 27310 }, { "entropy": 5.763671112060547, "epoch": 2.7001779359430604, "grad_norm": 1.203125, "learning_rate": 0.00042760249461619914, "loss": 5.0479, "mean_token_accuracy": 0.2149918332695961, "num_tokens": 62555932.0, "step": 27315 }, { "entropy": 5.619484186172485, "epoch": 2.700672202451562, "grad_norm": 1.1796875, "learning_rate": 0.00042757656001445727, "loss": 4.9282, "mean_token_accuracy": 0.22598726600408553, "num_tokens": 62567322.0, "step": 27320 }, { "entropy": 5.665970754623413, "epoch": 2.7011664689600634, "grad_norm": 1.2265625, "learning_rate": 0.0004275506216593083, "loss": 4.9663, "mean_token_accuracy": 0.21986768543720245, "num_tokens": 62577491.0, "step": 27325 }, { "entropy": 5.695775556564331, "epoch": 2.7016607354685647, "grad_norm": 1.0546875, "learning_rate": 0.0004275246795513904, "loss": 5.024, "mean_token_accuracy": 0.21667778640985488, "num_tokens": 62589912.0, "step": 27330 }, { "entropy": 5.661094427108765, "epoch": 2.702155001977066, "grad_norm": 1.0625, "learning_rate": 0.0004274987336913418, "loss": 5.0186, "mean_token_accuracy": 0.21415269523859023, "num_tokens": 62601571.0, "step": 27335 }, { "entropy": 5.726788759231567, "epoch": 2.702649268485567, "grad_norm": 1.125, "learning_rate": 0.0004274727840798007, "loss": 5.0127, "mean_token_accuracy": 0.2140343889594078, "num_tokens": 62615006.0, "step": 27340 }, { "entropy": 5.785875368118286, "epoch": 2.703143534994069, "grad_norm": 1.140625, "learning_rate": 0.00042744683071740524, "loss": 5.0779, "mean_token_accuracy": 0.21749793440103532, "num_tokens": 62626678.0, "step": 27345 }, { "entropy": 5.63812108039856, "epoch": 2.70363780150257, "grad_norm": 1.203125, "learning_rate": 0.0004274208736047944, "loss": 4.9538, "mean_token_accuracy": 0.21945013105869293, "num_tokens": 62637819.0, "step": 27350 }, { "entropy": 5.617285966873169, "epoch": 2.7041320680110714, "grad_norm": 1.0859375, "learning_rate": 0.00042739491274260615, "loss": 4.9047, "mean_token_accuracy": 0.23025340288877488, "num_tokens": 62649705.0, "step": 27355 }, { "entropy": 5.647848844528198, "epoch": 2.704626334519573, "grad_norm": 1.0234375, "learning_rate": 0.00042736894813147954, "loss": 4.9305, "mean_token_accuracy": 0.22029455453157426, "num_tokens": 62661695.0, "step": 27360 }, { "entropy": 5.832144117355346, "epoch": 2.7051206010280744, "grad_norm": 1.078125, "learning_rate": 0.00042734297977205325, "loss": 5.1102, "mean_token_accuracy": 0.2035825729370117, "num_tokens": 62674102.0, "step": 27365 }, { "entropy": 5.764290285110474, "epoch": 2.7056148675365757, "grad_norm": 1.1640625, "learning_rate": 0.00042731700766496586, "loss": 5.0598, "mean_token_accuracy": 0.21395417898893357, "num_tokens": 62685562.0, "step": 27370 }, { "entropy": 5.7593817710876465, "epoch": 2.706109134045077, "grad_norm": 1.2109375, "learning_rate": 0.0004272910318108565, "loss": 5.0122, "mean_token_accuracy": 0.21911872625350953, "num_tokens": 62696653.0, "step": 27375 }, { "entropy": 5.7076108932495115, "epoch": 2.7066034005535786, "grad_norm": 1.140625, "learning_rate": 0.00042726505221036415, "loss": 5.0007, "mean_token_accuracy": 0.21944233328104018, "num_tokens": 62708760.0, "step": 27380 }, { "entropy": 5.735338830947876, "epoch": 2.70709766706208, "grad_norm": 1.15625, "learning_rate": 0.0004272390688641279, "loss": 5.0109, "mean_token_accuracy": 0.21540824323892593, "num_tokens": 62718548.0, "step": 27385 }, { "entropy": 5.667323970794678, "epoch": 2.707591933570581, "grad_norm": 1.0625, "learning_rate": 0.00042721308177278696, "loss": 4.991, "mean_token_accuracy": 0.21974425315856932, "num_tokens": 62730792.0, "step": 27390 }, { "entropy": 5.796203708648681, "epoch": 2.708086200079083, "grad_norm": 1.2109375, "learning_rate": 0.00042718709093698054, "loss": 5.0484, "mean_token_accuracy": 0.21394769251346588, "num_tokens": 62741528.0, "step": 27395 }, { "entropy": 5.679714298248291, "epoch": 2.708580466587584, "grad_norm": 1.234375, "learning_rate": 0.00042716109635734806, "loss": 4.9552, "mean_token_accuracy": 0.22015808075666427, "num_tokens": 62751650.0, "step": 27400 }, { "entropy": 5.699984455108643, "epoch": 2.7090747330960854, "grad_norm": 1.1953125, "learning_rate": 0.00042713509803452904, "loss": 5.0076, "mean_token_accuracy": 0.22100409269332885, "num_tokens": 62763248.0, "step": 27405 }, { "entropy": 5.703722667694092, "epoch": 2.7095689996045866, "grad_norm": 1.09375, "learning_rate": 0.00042710909596916307, "loss": 5.0159, "mean_token_accuracy": 0.2154308408498764, "num_tokens": 62775696.0, "step": 27410 }, { "entropy": 5.673343896865845, "epoch": 2.7100632661130883, "grad_norm": 1.046875, "learning_rate": 0.00042708309016188965, "loss": 4.9252, "mean_token_accuracy": 0.22757147997617722, "num_tokens": 62786564.0, "step": 27415 }, { "entropy": 5.682564640045166, "epoch": 2.7105575326215896, "grad_norm": 1.0859375, "learning_rate": 0.0004270570806133486, "loss": 5.0075, "mean_token_accuracy": 0.21976580917835237, "num_tokens": 62799235.0, "step": 27420 }, { "entropy": 5.650778722763062, "epoch": 2.711051799130091, "grad_norm": 1.1015625, "learning_rate": 0.0004270310673241799, "loss": 4.9843, "mean_token_accuracy": 0.2160615235567093, "num_tokens": 62809605.0, "step": 27425 }, { "entropy": 5.74376654624939, "epoch": 2.7115460656385926, "grad_norm": 1.1875, "learning_rate": 0.0004270050502950233, "loss": 4.9801, "mean_token_accuracy": 0.2216406598687172, "num_tokens": 62820900.0, "step": 27430 }, { "entropy": 5.6701117038726805, "epoch": 2.712040332147094, "grad_norm": 1.0390625, "learning_rate": 0.0004269790295265189, "loss": 4.9245, "mean_token_accuracy": 0.22991884350776673, "num_tokens": 62831761.0, "step": 27435 }, { "entropy": 5.787686109542847, "epoch": 2.712534598655595, "grad_norm": 1.265625, "learning_rate": 0.00042695300501930674, "loss": 5.0762, "mean_token_accuracy": 0.21061451137065887, "num_tokens": 62842512.0, "step": 27440 }, { "entropy": 5.710083389282227, "epoch": 2.7130288651640964, "grad_norm": 1.109375, "learning_rate": 0.0004269269767740271, "loss": 5.027, "mean_token_accuracy": 0.2196846142411232, "num_tokens": 62853495.0, "step": 27445 }, { "entropy": 5.605766439437867, "epoch": 2.7135231316725976, "grad_norm": 1.1015625, "learning_rate": 0.00042690094479132023, "loss": 4.9321, "mean_token_accuracy": 0.23107286542654037, "num_tokens": 62864524.0, "step": 27450 }, { "entropy": 5.760519409179688, "epoch": 2.7140173981810993, "grad_norm": 1.25, "learning_rate": 0.00042687490907182665, "loss": 5.1222, "mean_token_accuracy": 0.2090625986456871, "num_tokens": 62874522.0, "step": 27455 }, { "entropy": 5.7070318222045895, "epoch": 2.7145116646896006, "grad_norm": 1.1484375, "learning_rate": 0.00042684886961618664, "loss": 4.9887, "mean_token_accuracy": 0.2167014554142952, "num_tokens": 62885477.0, "step": 27460 }, { "entropy": 5.703550863265991, "epoch": 2.715005931198102, "grad_norm": 1.1875, "learning_rate": 0.00042682282642504096, "loss": 5.026, "mean_token_accuracy": 0.2221037268638611, "num_tokens": 62896140.0, "step": 27465 }, { "entropy": 5.773190498352051, "epoch": 2.7155001977066036, "grad_norm": 1.1015625, "learning_rate": 0.00042679677949903017, "loss": 5.0945, "mean_token_accuracy": 0.20963554531335832, "num_tokens": 62907707.0, "step": 27470 }, { "entropy": 5.77922568321228, "epoch": 2.715994464215105, "grad_norm": 1.140625, "learning_rate": 0.00042677072883879496, "loss": 5.1012, "mean_token_accuracy": 0.21329701840877532, "num_tokens": 62919209.0, "step": 27475 }, { "entropy": 5.622571516036987, "epoch": 2.716488730723606, "grad_norm": 1.0703125, "learning_rate": 0.00042674467444497644, "loss": 4.8583, "mean_token_accuracy": 0.24185421615839003, "num_tokens": 62931971.0, "step": 27480 }, { "entropy": 5.704189586639404, "epoch": 2.7169829972321073, "grad_norm": 1.078125, "learning_rate": 0.0004267186163182153, "loss": 5.0457, "mean_token_accuracy": 0.21980664283037185, "num_tokens": 62944246.0, "step": 27485 }, { "entropy": 5.746811866760254, "epoch": 2.717477263740609, "grad_norm": 1.1640625, "learning_rate": 0.0004266925544591527, "loss": 5.0946, "mean_token_accuracy": 0.21023415327072142, "num_tokens": 62956973.0, "step": 27490 }, { "entropy": 5.788717269897461, "epoch": 2.7179715302491103, "grad_norm": 1.109375, "learning_rate": 0.0004266664888684297, "loss": 5.0947, "mean_token_accuracy": 0.20888681411743165, "num_tokens": 62968590.0, "step": 27495 }, { "entropy": 5.721470165252685, "epoch": 2.7184657967576116, "grad_norm": 1.109375, "learning_rate": 0.00042664041954668753, "loss": 5.0168, "mean_token_accuracy": 0.22157567143440246, "num_tokens": 62980382.0, "step": 27500 }, { "entropy": 5.706231212615966, "epoch": 2.7189600632661133, "grad_norm": 1.2109375, "learning_rate": 0.0004266143464945675, "loss": 4.9909, "mean_token_accuracy": 0.22012377232313157, "num_tokens": 62990432.0, "step": 27505 }, { "entropy": 5.711324644088745, "epoch": 2.7194543297746145, "grad_norm": 1.1015625, "learning_rate": 0.00042658826971271103, "loss": 5.0253, "mean_token_accuracy": 0.2160892218351364, "num_tokens": 63003341.0, "step": 27510 }, { "entropy": 5.75231556892395, "epoch": 2.719948596283116, "grad_norm": 1.1328125, "learning_rate": 0.00042656218920175963, "loss": 5.041, "mean_token_accuracy": 0.21142753213644028, "num_tokens": 63015527.0, "step": 27515 }, { "entropy": 5.764517736434937, "epoch": 2.720442862791617, "grad_norm": 1.1171875, "learning_rate": 0.000426536104962355, "loss": 5.0161, "mean_token_accuracy": 0.21887631416320802, "num_tokens": 63026995.0, "step": 27520 }, { "entropy": 5.708220815658569, "epoch": 2.7209371293001188, "grad_norm": 1.0859375, "learning_rate": 0.0004265100169951385, "loss": 4.9369, "mean_token_accuracy": 0.22315262705087663, "num_tokens": 63037156.0, "step": 27525 }, { "entropy": 5.742822456359863, "epoch": 2.72143139580862, "grad_norm": 1.0859375, "learning_rate": 0.0004264839253007521, "loss": 5.0324, "mean_token_accuracy": 0.22105981260538102, "num_tokens": 63047513.0, "step": 27530 }, { "entropy": 5.725811862945557, "epoch": 2.7219256623171213, "grad_norm": 0.984375, "learning_rate": 0.00042645782987983763, "loss": 4.9568, "mean_token_accuracy": 0.21601782292127608, "num_tokens": 63059968.0, "step": 27535 }, { "entropy": 5.701229429244995, "epoch": 2.722419928825623, "grad_norm": 1.2109375, "learning_rate": 0.00042643173073303713, "loss": 4.9914, "mean_token_accuracy": 0.21586666405200958, "num_tokens": 63071514.0, "step": 27540 }, { "entropy": 5.7435227394104, "epoch": 2.7229141953341243, "grad_norm": 1.046875, "learning_rate": 0.00042640562786099245, "loss": 5.0207, "mean_token_accuracy": 0.22378179281949998, "num_tokens": 63082810.0, "step": 27545 }, { "entropy": 5.732158660888672, "epoch": 2.7234084618426255, "grad_norm": 1.1875, "learning_rate": 0.00042637952126434593, "loss": 5.0142, "mean_token_accuracy": 0.21673722416162491, "num_tokens": 63093324.0, "step": 27550 }, { "entropy": 5.679854679107666, "epoch": 2.723902728351127, "grad_norm": 1.109375, "learning_rate": 0.0004263534109437397, "loss": 5.0279, "mean_token_accuracy": 0.21593224555253981, "num_tokens": 63104834.0, "step": 27555 }, { "entropy": 5.676044273376465, "epoch": 2.724396994859628, "grad_norm": 1.1328125, "learning_rate": 0.00042632729689981604, "loss": 5.0315, "mean_token_accuracy": 0.2163797065615654, "num_tokens": 63116625.0, "step": 27560 }, { "entropy": 5.755739688873291, "epoch": 2.7248912613681298, "grad_norm": 1.0859375, "learning_rate": 0.00042630117913321734, "loss": 5.0223, "mean_token_accuracy": 0.20924390703439713, "num_tokens": 63127616.0, "step": 27565 }, { "entropy": 5.667864418029785, "epoch": 2.725385527876631, "grad_norm": 1.0625, "learning_rate": 0.00042627505764458626, "loss": 4.9971, "mean_token_accuracy": 0.22559669315814973, "num_tokens": 63140546.0, "step": 27570 }, { "entropy": 5.627913331985473, "epoch": 2.7258797943851327, "grad_norm": 1.1953125, "learning_rate": 0.0004262489324345652, "loss": 4.9217, "mean_token_accuracy": 0.22269585877656936, "num_tokens": 63151693.0, "step": 27575 }, { "entropy": 5.691790771484375, "epoch": 2.726374060893634, "grad_norm": 1.1328125, "learning_rate": 0.0004262228035037971, "loss": 4.9542, "mean_token_accuracy": 0.2124678075313568, "num_tokens": 63162569.0, "step": 27580 }, { "entropy": 5.58673620223999, "epoch": 2.7268683274021353, "grad_norm": 1.171875, "learning_rate": 0.0004261966708529244, "loss": 4.8702, "mean_token_accuracy": 0.23437179028987884, "num_tokens": 63174073.0, "step": 27585 }, { "entropy": 5.732895803451538, "epoch": 2.7273625939106365, "grad_norm": 1.2265625, "learning_rate": 0.00042617053448259026, "loss": 4.9972, "mean_token_accuracy": 0.2205752432346344, "num_tokens": 63184752.0, "step": 27590 }, { "entropy": 5.714764642715454, "epoch": 2.7278568604191378, "grad_norm": 1.1171875, "learning_rate": 0.0004261443943934375, "loss": 4.9309, "mean_token_accuracy": 0.22033771723508835, "num_tokens": 63197682.0, "step": 27595 }, { "entropy": 5.775260734558105, "epoch": 2.7283511269276395, "grad_norm": 1.1484375, "learning_rate": 0.00042611825058610917, "loss": 5.0766, "mean_token_accuracy": 0.20358372628688812, "num_tokens": 63208868.0, "step": 27600 }, { "entropy": 5.752489328384399, "epoch": 2.7288453934361407, "grad_norm": 1.1484375, "learning_rate": 0.0004260921030612483, "loss": 5.1009, "mean_token_accuracy": 0.21696856319904329, "num_tokens": 63220418.0, "step": 27605 }, { "entropy": 5.716807413101196, "epoch": 2.729339659944642, "grad_norm": 1.09375, "learning_rate": 0.0004260659518194985, "loss": 4.9885, "mean_token_accuracy": 0.21934777945280076, "num_tokens": 63231431.0, "step": 27610 }, { "entropy": 5.6594061851501465, "epoch": 2.7298339264531437, "grad_norm": 1.1015625, "learning_rate": 0.0004260397968615027, "loss": 5.0042, "mean_token_accuracy": 0.20967702865600585, "num_tokens": 63243994.0, "step": 27615 }, { "entropy": 5.64479432106018, "epoch": 2.730328192961645, "grad_norm": 1.1171875, "learning_rate": 0.0004260136381879045, "loss": 4.9387, "mean_token_accuracy": 0.22758468836545945, "num_tokens": 63255414.0, "step": 27620 }, { "entropy": 5.725132131576538, "epoch": 2.7308224594701462, "grad_norm": 1.1171875, "learning_rate": 0.00042598747579934736, "loss": 5.0932, "mean_token_accuracy": 0.21382007002830505, "num_tokens": 63266289.0, "step": 27625 }, { "entropy": 5.726867628097534, "epoch": 2.7313167259786475, "grad_norm": 1.125, "learning_rate": 0.00042596130969647494, "loss": 4.9151, "mean_token_accuracy": 0.22526416033506394, "num_tokens": 63276497.0, "step": 27630 }, { "entropy": 5.711026906967163, "epoch": 2.731810992487149, "grad_norm": 1.1640625, "learning_rate": 0.0004259351398799308, "loss": 4.9706, "mean_token_accuracy": 0.22336022257804872, "num_tokens": 63286892.0, "step": 27635 }, { "entropy": 5.713762664794922, "epoch": 2.7323052589956505, "grad_norm": 1.015625, "learning_rate": 0.00042590896635035885, "loss": 5.0342, "mean_token_accuracy": 0.21670519560575485, "num_tokens": 63299978.0, "step": 27640 }, { "entropy": 5.7279047012329105, "epoch": 2.7327995255041517, "grad_norm": 1.21875, "learning_rate": 0.00042588278910840296, "loss": 5.0202, "mean_token_accuracy": 0.21966993063688278, "num_tokens": 63311916.0, "step": 27645 }, { "entropy": 5.705901765823365, "epoch": 2.7332937920126534, "grad_norm": 1.234375, "learning_rate": 0.000425856608154707, "loss": 4.9734, "mean_token_accuracy": 0.21916033774614335, "num_tokens": 63322994.0, "step": 27650 }, { "entropy": 5.760623168945313, "epoch": 2.7337880585211547, "grad_norm": 1.109375, "learning_rate": 0.0004258304234899151, "loss": 5.0448, "mean_token_accuracy": 0.21260327398777007, "num_tokens": 63334708.0, "step": 27655 }, { "entropy": 5.688549900054932, "epoch": 2.734282325029656, "grad_norm": 1.09375, "learning_rate": 0.0004258042351146713, "loss": 4.9476, "mean_token_accuracy": 0.2194727376103401, "num_tokens": 63346823.0, "step": 27660 }, { "entropy": 5.734207534790039, "epoch": 2.734776591538157, "grad_norm": 1.25, "learning_rate": 0.00042577804302961994, "loss": 5.0023, "mean_token_accuracy": 0.21713496893644332, "num_tokens": 63357677.0, "step": 27665 }, { "entropy": 5.625634479522705, "epoch": 2.7352708580466585, "grad_norm": 1.1015625, "learning_rate": 0.00042575184723540546, "loss": 4.8937, "mean_token_accuracy": 0.22304207533597947, "num_tokens": 63369685.0, "step": 27670 }, { "entropy": 5.75112099647522, "epoch": 2.73576512455516, "grad_norm": 1.171875, "learning_rate": 0.00042572564773267203, "loss": 5.0485, "mean_token_accuracy": 0.2096169710159302, "num_tokens": 63380340.0, "step": 27675 }, { "entropy": 5.676293516159058, "epoch": 2.7362593910636615, "grad_norm": 1.1328125, "learning_rate": 0.0004256994445220643, "loss": 5.019, "mean_token_accuracy": 0.22390236854553222, "num_tokens": 63390868.0, "step": 27680 }, { "entropy": 5.690142059326172, "epoch": 2.736753657572163, "grad_norm": 1.1171875, "learning_rate": 0.0004256732376042269, "loss": 4.9667, "mean_token_accuracy": 0.21894970983266832, "num_tokens": 63401669.0, "step": 27685 }, { "entropy": 5.712251663208008, "epoch": 2.7372479240806644, "grad_norm": 1.1171875, "learning_rate": 0.0004256470269798044, "loss": 4.9844, "mean_token_accuracy": 0.22077011168003083, "num_tokens": 63412593.0, "step": 27690 }, { "entropy": 5.732409811019897, "epoch": 2.7377421905891657, "grad_norm": 1.25, "learning_rate": 0.00042562081264944175, "loss": 5.0261, "mean_token_accuracy": 0.22626218795776368, "num_tokens": 63423952.0, "step": 27695 }, { "entropy": 5.708841228485108, "epoch": 2.738236457097667, "grad_norm": 1.1328125, "learning_rate": 0.00042559459461378367, "loss": 5.0361, "mean_token_accuracy": 0.21374601870775223, "num_tokens": 63435152.0, "step": 27700 }, { "entropy": 5.684716606140137, "epoch": 2.738730723606168, "grad_norm": 1.21875, "learning_rate": 0.00042556837287347524, "loss": 4.9, "mean_token_accuracy": 0.22808788418769838, "num_tokens": 63445977.0, "step": 27705 }, { "entropy": 5.747796487808228, "epoch": 2.73922499011467, "grad_norm": 1.09375, "learning_rate": 0.00042554214742916154, "loss": 5.0846, "mean_token_accuracy": 0.2097993165254593, "num_tokens": 63456790.0, "step": 27710 }, { "entropy": 5.659936618804932, "epoch": 2.739719256623171, "grad_norm": 1.234375, "learning_rate": 0.0004255159182814876, "loss": 4.9858, "mean_token_accuracy": 0.22480814158916473, "num_tokens": 63467775.0, "step": 27715 }, { "entropy": 5.789885997772217, "epoch": 2.7402135231316724, "grad_norm": 1.0234375, "learning_rate": 0.0004254896854310987, "loss": 5.0897, "mean_token_accuracy": 0.21030840873718262, "num_tokens": 63479445.0, "step": 27720 }, { "entropy": 5.7877874851226805, "epoch": 2.740707789640174, "grad_norm": 1.34375, "learning_rate": 0.0004254634488786402, "loss": 5.0954, "mean_token_accuracy": 0.2054578110575676, "num_tokens": 63489938.0, "step": 27725 }, { "entropy": 5.7030946731567385, "epoch": 2.7412020561486754, "grad_norm": 1.25, "learning_rate": 0.00042543720862475747, "loss": 4.9892, "mean_token_accuracy": 0.22576913088560105, "num_tokens": 63501509.0, "step": 27730 }, { "entropy": 5.674745893478393, "epoch": 2.7416963226571767, "grad_norm": 1.0546875, "learning_rate": 0.00042541096467009617, "loss": 4.9697, "mean_token_accuracy": 0.2223714455962181, "num_tokens": 63512222.0, "step": 27735 }, { "entropy": 5.769401264190674, "epoch": 2.742190589165678, "grad_norm": 1.0859375, "learning_rate": 0.00042538471701530174, "loss": 5.1019, "mean_token_accuracy": 0.21478029191493989, "num_tokens": 63524841.0, "step": 27740 }, { "entropy": 5.724522686004638, "epoch": 2.7426848556741796, "grad_norm": 1.2265625, "learning_rate": 0.00042535846566102, "loss": 4.9753, "mean_token_accuracy": 0.2166510969400406, "num_tokens": 63536167.0, "step": 27745 }, { "entropy": 5.718362951278687, "epoch": 2.743179122182681, "grad_norm": 1.09375, "learning_rate": 0.0004253322106078966, "loss": 4.9903, "mean_token_accuracy": 0.22181790620088576, "num_tokens": 63547774.0, "step": 27750 }, { "entropy": 5.748501920700074, "epoch": 2.743673388691182, "grad_norm": 1.1796875, "learning_rate": 0.00042530595185657756, "loss": 5.1123, "mean_token_accuracy": 0.21061017364263535, "num_tokens": 63560712.0, "step": 27755 }, { "entropy": 5.70149416923523, "epoch": 2.744167655199684, "grad_norm": 1.09375, "learning_rate": 0.00042527968940770874, "loss": 5.0517, "mean_token_accuracy": 0.21655175983905792, "num_tokens": 63572587.0, "step": 27760 }, { "entropy": 5.733349609375, "epoch": 2.744661921708185, "grad_norm": 1.09375, "learning_rate": 0.00042525342326193624, "loss": 5.0736, "mean_token_accuracy": 0.21250307261943818, "num_tokens": 63584694.0, "step": 27765 }, { "entropy": 5.7263007164001465, "epoch": 2.7451561882166864, "grad_norm": 0.9609375, "learning_rate": 0.00042522715341990625, "loss": 5.019, "mean_token_accuracy": 0.21938451379537582, "num_tokens": 63597894.0, "step": 27770 }, { "entropy": 5.748881387710571, "epoch": 2.7456504547251877, "grad_norm": 1.2109375, "learning_rate": 0.000425200879882265, "loss": 5.0575, "mean_token_accuracy": 0.21837457716464997, "num_tokens": 63608873.0, "step": 27775 }, { "entropy": 5.757216548919677, "epoch": 2.7461447212336894, "grad_norm": 1.1484375, "learning_rate": 0.0004251746026496588, "loss": 5.0588, "mean_token_accuracy": 0.2139126256108284, "num_tokens": 63621013.0, "step": 27780 }, { "entropy": 5.7875627994537355, "epoch": 2.7466389877421906, "grad_norm": 1.1640625, "learning_rate": 0.00042514832172273404, "loss": 5.1158, "mean_token_accuracy": 0.2072718247771263, "num_tokens": 63633438.0, "step": 27785 }, { "entropy": 5.7316060066223145, "epoch": 2.747133254250692, "grad_norm": 1.0546875, "learning_rate": 0.00042512203710213733, "loss": 4.9515, "mean_token_accuracy": 0.21874932050704957, "num_tokens": 63645032.0, "step": 27790 }, { "entropy": 5.6924913883209225, "epoch": 2.7476275207591936, "grad_norm": 1.078125, "learning_rate": 0.0004250957487885151, "loss": 4.9616, "mean_token_accuracy": 0.22638950645923614, "num_tokens": 63657747.0, "step": 27795 }, { "entropy": 5.674510860443116, "epoch": 2.748121787267695, "grad_norm": 1.1796875, "learning_rate": 0.0004250694567825143, "loss": 4.9478, "mean_token_accuracy": 0.22383185625076293, "num_tokens": 63669472.0, "step": 27800 }, { "entropy": 5.67832670211792, "epoch": 2.748616053776196, "grad_norm": 1.125, "learning_rate": 0.00042504316108478153, "loss": 4.994, "mean_token_accuracy": 0.22650742083787917, "num_tokens": 63681498.0, "step": 27805 }, { "entropy": 5.618740463256836, "epoch": 2.7491103202846974, "grad_norm": 1.171875, "learning_rate": 0.00042501686169596367, "loss": 4.9103, "mean_token_accuracy": 0.23110314160585405, "num_tokens": 63692628.0, "step": 27810 }, { "entropy": 5.712465238571167, "epoch": 2.7496045867931986, "grad_norm": 1.09375, "learning_rate": 0.00042499055861670783, "loss": 4.9829, "mean_token_accuracy": 0.21796264201402665, "num_tokens": 63704732.0, "step": 27815 }, { "entropy": 5.746215915679931, "epoch": 2.7500988533017003, "grad_norm": 1.1171875, "learning_rate": 0.0004249642518476609, "loss": 5.0526, "mean_token_accuracy": 0.2119926020503044, "num_tokens": 63716346.0, "step": 27820 }, { "entropy": 5.724862098693848, "epoch": 2.7505931198102016, "grad_norm": 1.1171875, "learning_rate": 0.00042493794138947013, "loss": 5.041, "mean_token_accuracy": 0.21886069029569627, "num_tokens": 63728320.0, "step": 27825 }, { "entropy": 5.678915309906006, "epoch": 2.7510873863187033, "grad_norm": 1.0234375, "learning_rate": 0.00042491162724278276, "loss": 5.0623, "mean_token_accuracy": 0.21261305660009383, "num_tokens": 63740211.0, "step": 27830 }, { "entropy": 5.663030052185059, "epoch": 2.7515816528272046, "grad_norm": 1.109375, "learning_rate": 0.00042488530940824616, "loss": 4.9094, "mean_token_accuracy": 0.23074459731578828, "num_tokens": 63751706.0, "step": 27835 }, { "entropy": 5.727924108505249, "epoch": 2.752075919335706, "grad_norm": 1.125, "learning_rate": 0.0004248589878865076, "loss": 5.0302, "mean_token_accuracy": 0.21577073335647584, "num_tokens": 63764045.0, "step": 27840 }, { "entropy": 5.685721063613892, "epoch": 2.752570185844207, "grad_norm": 1.1171875, "learning_rate": 0.0004248326626782147, "loss": 4.9309, "mean_token_accuracy": 0.22513374388217927, "num_tokens": 63774148.0, "step": 27845 }, { "entropy": 5.719576454162597, "epoch": 2.7530644523527084, "grad_norm": 1.140625, "learning_rate": 0.00042480633378401503, "loss": 4.9662, "mean_token_accuracy": 0.22026122212409974, "num_tokens": 63785202.0, "step": 27850 }, { "entropy": 5.718375110626221, "epoch": 2.75355871886121, "grad_norm": 1.09375, "learning_rate": 0.0004247800012045564, "loss": 4.9834, "mean_token_accuracy": 0.21291326135396957, "num_tokens": 63796990.0, "step": 27855 }, { "entropy": 5.6479393482208256, "epoch": 2.7540529853697113, "grad_norm": 1.25, "learning_rate": 0.00042475366494048645, "loss": 4.8845, "mean_token_accuracy": 0.23210216015577317, "num_tokens": 63807201.0, "step": 27860 }, { "entropy": 5.681387138366699, "epoch": 2.7545472518782126, "grad_norm": 1.1640625, "learning_rate": 0.00042472732499245316, "loss": 4.9824, "mean_token_accuracy": 0.2256856828927994, "num_tokens": 63818805.0, "step": 27865 }, { "entropy": 5.6817117691040036, "epoch": 2.7550415183867143, "grad_norm": 1.171875, "learning_rate": 0.00042470098136110444, "loss": 4.9553, "mean_token_accuracy": 0.2223185494542122, "num_tokens": 63829444.0, "step": 27870 }, { "entropy": 5.642939281463623, "epoch": 2.7555357848952156, "grad_norm": 1.15625, "learning_rate": 0.00042467463404708826, "loss": 4.9741, "mean_token_accuracy": 0.22321929037570953, "num_tokens": 63840868.0, "step": 27875 }, { "entropy": 5.683885383605957, "epoch": 2.756030051403717, "grad_norm": 1.09375, "learning_rate": 0.00042464828305105283, "loss": 5.014, "mean_token_accuracy": 0.21687053591012956, "num_tokens": 63851992.0, "step": 27880 }, { "entropy": 5.707004547119141, "epoch": 2.756524317912218, "grad_norm": 1.0625, "learning_rate": 0.00042462192837364654, "loss": 5.0033, "mean_token_accuracy": 0.2164152294397354, "num_tokens": 63863362.0, "step": 27885 }, { "entropy": 5.747110176086426, "epoch": 2.75701858442072, "grad_norm": 0.98828125, "learning_rate": 0.00042459557001551764, "loss": 5.0662, "mean_token_accuracy": 0.21289311349391937, "num_tokens": 63875712.0, "step": 27890 }, { "entropy": 5.786071157455444, "epoch": 2.757512850929221, "grad_norm": 1.109375, "learning_rate": 0.00042456920797731443, "loss": 4.9801, "mean_token_accuracy": 0.22067447006702423, "num_tokens": 63887253.0, "step": 27895 }, { "entropy": 5.757207155227661, "epoch": 2.7580071174377223, "grad_norm": 1.2265625, "learning_rate": 0.00042454284225968553, "loss": 5.0872, "mean_token_accuracy": 0.21548418402671815, "num_tokens": 63898328.0, "step": 27900 }, { "entropy": 5.642959880828857, "epoch": 2.758501383946224, "grad_norm": 1.1640625, "learning_rate": 0.0004245164728632795, "loss": 4.8913, "mean_token_accuracy": 0.2313155472278595, "num_tokens": 63908080.0, "step": 27905 }, { "entropy": 5.704622268676758, "epoch": 2.7589956504547253, "grad_norm": 1.1953125, "learning_rate": 0.000424490099788745, "loss": 5.0515, "mean_token_accuracy": 0.21184180229902266, "num_tokens": 63918860.0, "step": 27910 }, { "entropy": 5.756003046035767, "epoch": 2.7594899169632265, "grad_norm": 1.1640625, "learning_rate": 0.0004244637230367309, "loss": 4.9634, "mean_token_accuracy": 0.2202967509627342, "num_tokens": 63929601.0, "step": 27915 }, { "entropy": 5.691011381149292, "epoch": 2.759984183471728, "grad_norm": 1.2578125, "learning_rate": 0.000424437342607886, "loss": 5.0293, "mean_token_accuracy": 0.22072141468524933, "num_tokens": 63941170.0, "step": 27920 }, { "entropy": 5.666725301742554, "epoch": 2.760478449980229, "grad_norm": 1.140625, "learning_rate": 0.0004244109585028593, "loss": 4.9531, "mean_token_accuracy": 0.2271920010447502, "num_tokens": 63951907.0, "step": 27925 }, { "entropy": 5.740157270431519, "epoch": 2.7609727164887308, "grad_norm": 1.171875, "learning_rate": 0.00042438457072229986, "loss": 5.0047, "mean_token_accuracy": 0.21590171456336976, "num_tokens": 63963140.0, "step": 27930 }, { "entropy": 5.723110103607178, "epoch": 2.761466982997232, "grad_norm": 1.109375, "learning_rate": 0.00042435817926685684, "loss": 4.9989, "mean_token_accuracy": 0.21543813049793242, "num_tokens": 63974445.0, "step": 27935 }, { "entropy": 5.678072547912597, "epoch": 2.7619612495057337, "grad_norm": 1.046875, "learning_rate": 0.0004243317841371793, "loss": 4.9575, "mean_token_accuracy": 0.22454602420330047, "num_tokens": 63985463.0, "step": 27940 }, { "entropy": 5.7105320453643795, "epoch": 2.762455516014235, "grad_norm": 1.21875, "learning_rate": 0.00042430538533391683, "loss": 5.0283, "mean_token_accuracy": 0.2175595283508301, "num_tokens": 63997120.0, "step": 27945 }, { "entropy": 5.686862421035767, "epoch": 2.7629497825227363, "grad_norm": 1.109375, "learning_rate": 0.00042427898285771865, "loss": 5.0107, "mean_token_accuracy": 0.2157677009701729, "num_tokens": 64009195.0, "step": 27950 }, { "entropy": 5.735896158218384, "epoch": 2.7634440490312375, "grad_norm": 1.1171875, "learning_rate": 0.0004242525767092344, "loss": 5.0222, "mean_token_accuracy": 0.22532825022935868, "num_tokens": 64020915.0, "step": 27955 }, { "entropy": 5.68587851524353, "epoch": 2.763938315539739, "grad_norm": 1.203125, "learning_rate": 0.0004242261668891135, "loss": 4.9561, "mean_token_accuracy": 0.22005146294832229, "num_tokens": 64031187.0, "step": 27960 }, { "entropy": 5.731714105606079, "epoch": 2.7644325820482405, "grad_norm": 1.0859375, "learning_rate": 0.0004241997533980059, "loss": 5.0154, "mean_token_accuracy": 0.21325055062770842, "num_tokens": 64043045.0, "step": 27965 }, { "entropy": 5.842581462860108, "epoch": 2.7649268485567418, "grad_norm": 1.1953125, "learning_rate": 0.00042417333623656113, "loss": 5.1242, "mean_token_accuracy": 0.20680923759937286, "num_tokens": 64054030.0, "step": 27970 }, { "entropy": 5.732256889343262, "epoch": 2.765421115065243, "grad_norm": 1.2109375, "learning_rate": 0.00042414691540542917, "loss": 5.0079, "mean_token_accuracy": 0.2215494245290756, "num_tokens": 64064179.0, "step": 27975 }, { "entropy": 5.761953067779541, "epoch": 2.7659153815737447, "grad_norm": 1.1015625, "learning_rate": 0.00042412049090525996, "loss": 5.084, "mean_token_accuracy": 0.20787105560302735, "num_tokens": 64075812.0, "step": 27980 }, { "entropy": 5.6603254795074465, "epoch": 2.766409648082246, "grad_norm": 1.1328125, "learning_rate": 0.0004240940627367035, "loss": 4.9696, "mean_token_accuracy": 0.22319453358650207, "num_tokens": 64086848.0, "step": 27985 }, { "entropy": 5.7114259719848635, "epoch": 2.7669039145907472, "grad_norm": 1.1171875, "learning_rate": 0.00042406763090040996, "loss": 5.0122, "mean_token_accuracy": 0.21582835614681245, "num_tokens": 64098879.0, "step": 27990 }, { "entropy": 5.712428855895996, "epoch": 2.7673981810992485, "grad_norm": 1.1171875, "learning_rate": 0.00042404119539702956, "loss": 5.0428, "mean_token_accuracy": 0.21064504683017732, "num_tokens": 64109946.0, "step": 27995 }, { "entropy": 5.755137920379639, "epoch": 2.76789244760775, "grad_norm": 1.09375, "learning_rate": 0.00042401475622721264, "loss": 5.0895, "mean_token_accuracy": 0.2120663657784462, "num_tokens": 64122219.0, "step": 28000 }, { "entropy": 5.715014171600342, "epoch": 2.7683867141162515, "grad_norm": 1.171875, "learning_rate": 0.0004239883133916097, "loss": 4.9842, "mean_token_accuracy": 0.22325509488582612, "num_tokens": 64132950.0, "step": 28005 }, { "entropy": 5.708972215652466, "epoch": 2.7688809806247527, "grad_norm": 1.109375, "learning_rate": 0.0004239618668908711, "loss": 5.0632, "mean_token_accuracy": 0.21418076604604722, "num_tokens": 64145060.0, "step": 28010 }, { "entropy": 5.755795526504516, "epoch": 2.7693752471332544, "grad_norm": 1.296875, "learning_rate": 0.0004239354167256474, "loss": 5.0755, "mean_token_accuracy": 0.21114394813776016, "num_tokens": 64157294.0, "step": 28015 }, { "entropy": 5.756480884552002, "epoch": 2.7698695136417557, "grad_norm": 1.0390625, "learning_rate": 0.00042390896289658936, "loss": 5.0399, "mean_token_accuracy": 0.21127624064683914, "num_tokens": 64169001.0, "step": 28020 }, { "entropy": 5.67667555809021, "epoch": 2.770363780150257, "grad_norm": 1.046875, "learning_rate": 0.0004238825054043477, "loss": 4.9483, "mean_token_accuracy": 0.22188242077827453, "num_tokens": 64180525.0, "step": 28025 }, { "entropy": 5.665124416351318, "epoch": 2.7708580466587582, "grad_norm": 1.078125, "learning_rate": 0.00042385604424957337, "loss": 4.9586, "mean_token_accuracy": 0.21906013190746307, "num_tokens": 64192398.0, "step": 28030 }, { "entropy": 5.681071615219116, "epoch": 2.77135231316726, "grad_norm": 1.171875, "learning_rate": 0.0004238295794329172, "loss": 5.0252, "mean_token_accuracy": 0.21208575516939163, "num_tokens": 64203485.0, "step": 28035 }, { "entropy": 5.683232355117798, "epoch": 2.771846579675761, "grad_norm": 1.1953125, "learning_rate": 0.00042380311095503037, "loss": 4.9904, "mean_token_accuracy": 0.2218636080622673, "num_tokens": 64214226.0, "step": 28040 }, { "entropy": 5.682394742965698, "epoch": 2.7723408461842625, "grad_norm": 1.078125, "learning_rate": 0.00042377663881656394, "loss": 4.9494, "mean_token_accuracy": 0.2221979171037674, "num_tokens": 64225873.0, "step": 28045 }, { "entropy": 5.843520593643189, "epoch": 2.772835112692764, "grad_norm": 1.1953125, "learning_rate": 0.00042375016301816903, "loss": 5.1755, "mean_token_accuracy": 0.20077353864908218, "num_tokens": 64238023.0, "step": 28050 }, { "entropy": 5.76641960144043, "epoch": 2.7733293792012654, "grad_norm": 1.21875, "learning_rate": 0.0004237236835604971, "loss": 5.0489, "mean_token_accuracy": 0.20876119732856752, "num_tokens": 64248533.0, "step": 28055 }, { "entropy": 5.739803314208984, "epoch": 2.7738236457097667, "grad_norm": 1.1328125, "learning_rate": 0.0004236972004441994, "loss": 5.0834, "mean_token_accuracy": 0.21748532354831696, "num_tokens": 64260539.0, "step": 28060 }, { "entropy": 5.745120477676392, "epoch": 2.774317912218268, "grad_norm": 1.21875, "learning_rate": 0.00042367071366992753, "loss": 5.0059, "mean_token_accuracy": 0.21207655370235443, "num_tokens": 64271280.0, "step": 28065 }, { "entropy": 5.742461681365967, "epoch": 2.774812178726769, "grad_norm": 1.1875, "learning_rate": 0.00042364422323833313, "loss": 5.0601, "mean_token_accuracy": 0.2093740686774254, "num_tokens": 64282728.0, "step": 28070 }, { "entropy": 5.72702169418335, "epoch": 2.775306445235271, "grad_norm": 1.125, "learning_rate": 0.00042361772915006763, "loss": 5.0518, "mean_token_accuracy": 0.2110229402780533, "num_tokens": 64294728.0, "step": 28075 }, { "entropy": 5.721891117095947, "epoch": 2.775800711743772, "grad_norm": 1.1796875, "learning_rate": 0.0004235912314057831, "loss": 5.0908, "mean_token_accuracy": 0.21324075907468795, "num_tokens": 64305873.0, "step": 28080 }, { "entropy": 5.672266817092895, "epoch": 2.776294978252274, "grad_norm": 1.0859375, "learning_rate": 0.0004235647300061311, "loss": 4.9361, "mean_token_accuracy": 0.22254360765218734, "num_tokens": 64318892.0, "step": 28085 }, { "entropy": 5.633163261413574, "epoch": 2.776789244760775, "grad_norm": 1.1171875, "learning_rate": 0.0004235382249517637, "loss": 4.931, "mean_token_accuracy": 0.22110871076583863, "num_tokens": 64328918.0, "step": 28090 }, { "entropy": 5.677274465560913, "epoch": 2.7772835112692764, "grad_norm": 1.125, "learning_rate": 0.00042351171624333293, "loss": 4.9759, "mean_token_accuracy": 0.22169163674116135, "num_tokens": 64338670.0, "step": 28095 }, { "entropy": 5.732836580276489, "epoch": 2.7777777777777777, "grad_norm": 1.03125, "learning_rate": 0.00042348520388149093, "loss": 4.9802, "mean_token_accuracy": 0.21526568979024888, "num_tokens": 64350503.0, "step": 28100 }, { "entropy": 5.674016427993775, "epoch": 2.778272044286279, "grad_norm": 1.234375, "learning_rate": 0.0004234586878668899, "loss": 4.9269, "mean_token_accuracy": 0.22605169266462327, "num_tokens": 64361176.0, "step": 28105 }, { "entropy": 5.713886785507202, "epoch": 2.7787663107947806, "grad_norm": 1.1875, "learning_rate": 0.0004234321682001821, "loss": 5.0496, "mean_token_accuracy": 0.2157477542757988, "num_tokens": 64373397.0, "step": 28110 }, { "entropy": 5.672181940078735, "epoch": 2.779260577303282, "grad_norm": 1.2734375, "learning_rate": 0.00042340564488201987, "loss": 4.9796, "mean_token_accuracy": 0.21026417911052703, "num_tokens": 64384910.0, "step": 28115 }, { "entropy": 5.648859119415283, "epoch": 2.779754843811783, "grad_norm": 0.99609375, "learning_rate": 0.0004233791179130559, "loss": 4.9853, "mean_token_accuracy": 0.21526231616735458, "num_tokens": 64396787.0, "step": 28120 }, { "entropy": 5.695188283920288, "epoch": 2.780249110320285, "grad_norm": 1.1484375, "learning_rate": 0.0004233525872939424, "loss": 5.0516, "mean_token_accuracy": 0.2135879412293434, "num_tokens": 64407911.0, "step": 28125 }, { "entropy": 5.803978490829468, "epoch": 2.780743376828786, "grad_norm": 1.0390625, "learning_rate": 0.00042332605302533246, "loss": 5.0805, "mean_token_accuracy": 0.2148550420999527, "num_tokens": 64420697.0, "step": 28130 }, { "entropy": 5.709131813049316, "epoch": 2.7812376433372874, "grad_norm": 1.0078125, "learning_rate": 0.00042329951510787847, "loss": 4.9422, "mean_token_accuracy": 0.22601468563079835, "num_tokens": 64431675.0, "step": 28135 }, { "entropy": 5.701867866516113, "epoch": 2.7817319098457887, "grad_norm": 1.015625, "learning_rate": 0.00042327297354223346, "loss": 5.005, "mean_token_accuracy": 0.21770417243242263, "num_tokens": 64443398.0, "step": 28140 }, { "entropy": 5.672602653503418, "epoch": 2.7822261763542904, "grad_norm": 1.15625, "learning_rate": 0.0004232464283290502, "loss": 5.0216, "mean_token_accuracy": 0.21968140006065368, "num_tokens": 64455306.0, "step": 28145 }, { "entropy": 5.676162910461426, "epoch": 2.7827204428627916, "grad_norm": 1.203125, "learning_rate": 0.0004232198794689819, "loss": 4.9635, "mean_token_accuracy": 0.22292641699314117, "num_tokens": 64466475.0, "step": 28150 }, { "entropy": 5.667986869812012, "epoch": 2.783214709371293, "grad_norm": 1.1640625, "learning_rate": 0.0004231933269626815, "loss": 4.9788, "mean_token_accuracy": 0.2228396490216255, "num_tokens": 64476729.0, "step": 28155 }, { "entropy": 5.766189002990723, "epoch": 2.7837089758797946, "grad_norm": 1.0234375, "learning_rate": 0.0004231667708108024, "loss": 5.071, "mean_token_accuracy": 0.2161652848124504, "num_tokens": 64489403.0, "step": 28160 }, { "entropy": 5.681957054138183, "epoch": 2.784203242388296, "grad_norm": 1.0859375, "learning_rate": 0.00042314021101399763, "loss": 4.9879, "mean_token_accuracy": 0.2309042751789093, "num_tokens": 64501000.0, "step": 28165 }, { "entropy": 5.701148557662964, "epoch": 2.784697508896797, "grad_norm": 1.0859375, "learning_rate": 0.0004231136475729207, "loss": 4.9749, "mean_token_accuracy": 0.22036862820386888, "num_tokens": 64513504.0, "step": 28170 }, { "entropy": 5.643229722976685, "epoch": 2.7851917754052984, "grad_norm": 1.140625, "learning_rate": 0.00042308708048822513, "loss": 4.9419, "mean_token_accuracy": 0.22409293204545974, "num_tokens": 64525522.0, "step": 28175 }, { "entropy": 5.706642532348633, "epoch": 2.7856860419137996, "grad_norm": 1.0390625, "learning_rate": 0.0004230605097605644, "loss": 5.0417, "mean_token_accuracy": 0.22110858857631682, "num_tokens": 64537261.0, "step": 28180 }, { "entropy": 5.702304029464722, "epoch": 2.7861803084223014, "grad_norm": 1.03125, "learning_rate": 0.00042303393539059204, "loss": 4.9407, "mean_token_accuracy": 0.2263340100646019, "num_tokens": 64548527.0, "step": 28185 }, { "entropy": 5.625427198410034, "epoch": 2.7866745749308026, "grad_norm": 1.0859375, "learning_rate": 0.000423007357378962, "loss": 4.9274, "mean_token_accuracy": 0.22905777841806413, "num_tokens": 64560196.0, "step": 28190 }, { "entropy": 5.787480115890503, "epoch": 2.7871688414393043, "grad_norm": 1.203125, "learning_rate": 0.000422980775726328, "loss": 5.048, "mean_token_accuracy": 0.22112140953540801, "num_tokens": 64570828.0, "step": 28195 }, { "entropy": 5.7775331974029545, "epoch": 2.7876631079478056, "grad_norm": 1.2421875, "learning_rate": 0.0004229541904333439, "loss": 5.0968, "mean_token_accuracy": 0.2063877373933792, "num_tokens": 64581845.0, "step": 28200 }, { "entropy": 5.721597576141358, "epoch": 2.788157374456307, "grad_norm": 1.1484375, "learning_rate": 0.00042292760150066386, "loss": 5.0367, "mean_token_accuracy": 0.21710703074932097, "num_tokens": 64593105.0, "step": 28205 }, { "entropy": 5.682293891906738, "epoch": 2.788651640964808, "grad_norm": 1.1796875, "learning_rate": 0.00042290100892894184, "loss": 5.0053, "mean_token_accuracy": 0.21532258987426758, "num_tokens": 64605075.0, "step": 28210 }, { "entropy": 5.711063861846924, "epoch": 2.7891459074733094, "grad_norm": 1.09375, "learning_rate": 0.00042287441271883204, "loss": 5.0281, "mean_token_accuracy": 0.21748075783252716, "num_tokens": 64617091.0, "step": 28215 }, { "entropy": 5.751304006576538, "epoch": 2.789640173981811, "grad_norm": 1.140625, "learning_rate": 0.0004228478128709888, "loss": 4.9436, "mean_token_accuracy": 0.22211069017648696, "num_tokens": 64627870.0, "step": 28220 }, { "entropy": 5.695521068572998, "epoch": 2.7901344404903123, "grad_norm": 1.0703125, "learning_rate": 0.0004228212093860664, "loss": 5.012, "mean_token_accuracy": 0.21488795280456544, "num_tokens": 64639583.0, "step": 28225 }, { "entropy": 5.706600952148437, "epoch": 2.7906287069988136, "grad_norm": 1.109375, "learning_rate": 0.0004227946022647192, "loss": 4.9617, "mean_token_accuracy": 0.22071884125471114, "num_tokens": 64650477.0, "step": 28230 }, { "entropy": 5.741800260543823, "epoch": 2.7911229735073153, "grad_norm": 1.1953125, "learning_rate": 0.000422767991507602, "loss": 5.0007, "mean_token_accuracy": 0.21872826367616655, "num_tokens": 64660994.0, "step": 28235 }, { "entropy": 5.728321647644043, "epoch": 2.7916172400158166, "grad_norm": 1.171875, "learning_rate": 0.0004227413771153692, "loss": 5.0278, "mean_token_accuracy": 0.2242534875869751, "num_tokens": 64672348.0, "step": 28240 }, { "entropy": 5.714672565460205, "epoch": 2.792111506524318, "grad_norm": 1.1640625, "learning_rate": 0.00042271475908867563, "loss": 5.0026, "mean_token_accuracy": 0.21088871508836746, "num_tokens": 64683352.0, "step": 28245 }, { "entropy": 5.75800518989563, "epoch": 2.792605773032819, "grad_norm": 1.171875, "learning_rate": 0.0004226881374281761, "loss": 5.0601, "mean_token_accuracy": 0.2142708867788315, "num_tokens": 64695429.0, "step": 28250 }, { "entropy": 5.660664653778076, "epoch": 2.793100039541321, "grad_norm": 1.1953125, "learning_rate": 0.0004226615121345254, "loss": 4.9222, "mean_token_accuracy": 0.22085565626621245, "num_tokens": 64706438.0, "step": 28255 }, { "entropy": 5.701246881484986, "epoch": 2.793594306049822, "grad_norm": 1.1328125, "learning_rate": 0.0004226348832083787, "loss": 4.9852, "mean_token_accuracy": 0.21242036670446396, "num_tokens": 64717991.0, "step": 28260 }, { "entropy": 5.717717409133911, "epoch": 2.7940885725583233, "grad_norm": 1.1640625, "learning_rate": 0.00042260825065039095, "loss": 5.0494, "mean_token_accuracy": 0.21643056720495224, "num_tokens": 64730196.0, "step": 28265 }, { "entropy": 5.668759489059449, "epoch": 2.794582839066825, "grad_norm": 1.109375, "learning_rate": 0.0004225816144612173, "loss": 5.0206, "mean_token_accuracy": 0.2109068140387535, "num_tokens": 64742977.0, "step": 28270 }, { "entropy": 5.721907281875611, "epoch": 2.7950771055753263, "grad_norm": 1.203125, "learning_rate": 0.00042255497464151307, "loss": 5.0349, "mean_token_accuracy": 0.20828558057546614, "num_tokens": 64754101.0, "step": 28275 }, { "entropy": 5.693812847137451, "epoch": 2.7955713720838276, "grad_norm": 1.0390625, "learning_rate": 0.00042252833119193345, "loss": 5.0168, "mean_token_accuracy": 0.21898158490657807, "num_tokens": 64766611.0, "step": 28280 }, { "entropy": 5.685315895080566, "epoch": 2.796065638592329, "grad_norm": 1.1484375, "learning_rate": 0.00042250168411313413, "loss": 5.0099, "mean_token_accuracy": 0.22030934691429138, "num_tokens": 64778764.0, "step": 28285 }, { "entropy": 5.697000217437744, "epoch": 2.7965599051008305, "grad_norm": 1.15625, "learning_rate": 0.00042247503340577046, "loss": 4.9787, "mean_token_accuracy": 0.2200830966234207, "num_tokens": 64790208.0, "step": 28290 }, { "entropy": 5.7213341236114506, "epoch": 2.797054171609332, "grad_norm": 1.125, "learning_rate": 0.0004224483790704981, "loss": 5.0441, "mean_token_accuracy": 0.2125803902745247, "num_tokens": 64801692.0, "step": 28295 }, { "entropy": 5.743679189682007, "epoch": 2.797548438117833, "grad_norm": 1.3125, "learning_rate": 0.00042242172110797273, "loss": 4.9338, "mean_token_accuracy": 0.2200103297829628, "num_tokens": 64811919.0, "step": 28300 }, { "entropy": 5.687502098083496, "epoch": 2.7980427046263348, "grad_norm": 1.1328125, "learning_rate": 0.00042239505951885013, "loss": 4.9622, "mean_token_accuracy": 0.21980877816677094, "num_tokens": 64821679.0, "step": 28305 }, { "entropy": 5.63314118385315, "epoch": 2.798536971134836, "grad_norm": 1.1015625, "learning_rate": 0.00042236839430378624, "loss": 4.9946, "mean_token_accuracy": 0.2218866840004921, "num_tokens": 64833295.0, "step": 28310 }, { "entropy": 5.6306657791137695, "epoch": 2.7990312376433373, "grad_norm": 1.1328125, "learning_rate": 0.00042234172546343695, "loss": 4.9019, "mean_token_accuracy": 0.2301711618900299, "num_tokens": 64844970.0, "step": 28315 }, { "entropy": 5.683224439620972, "epoch": 2.7995255041518385, "grad_norm": 1.140625, "learning_rate": 0.00042231505299845836, "loss": 4.9013, "mean_token_accuracy": 0.22618651241064072, "num_tokens": 64855496.0, "step": 28320 }, { "entropy": 5.668324136734009, "epoch": 2.80001977066034, "grad_norm": 1.1171875, "learning_rate": 0.00042228837690950664, "loss": 4.9604, "mean_token_accuracy": 0.2243376851081848, "num_tokens": 64866836.0, "step": 28325 }, { "entropy": 5.659656143188476, "epoch": 2.8005140371688415, "grad_norm": 1.09375, "learning_rate": 0.00042226169719723793, "loss": 4.9949, "mean_token_accuracy": 0.22212968468666078, "num_tokens": 64879105.0, "step": 28330 }, { "entropy": 5.734632158279419, "epoch": 2.8010083036773428, "grad_norm": 1.0546875, "learning_rate": 0.0004222350138623087, "loss": 5.0069, "mean_token_accuracy": 0.22199305891990662, "num_tokens": 64891227.0, "step": 28335 }, { "entropy": 5.6966410160064695, "epoch": 2.8015025701858445, "grad_norm": 1.15625, "learning_rate": 0.00042220832690537525, "loss": 5.0107, "mean_token_accuracy": 0.21483013331890105, "num_tokens": 64904070.0, "step": 28340 }, { "entropy": 5.720845794677734, "epoch": 2.8019968366943457, "grad_norm": 1.25, "learning_rate": 0.0004221816363270941, "loss": 4.9349, "mean_token_accuracy": 0.22258009463548661, "num_tokens": 64915087.0, "step": 28345 }, { "entropy": 5.612367773056031, "epoch": 2.802491103202847, "grad_norm": 1.1875, "learning_rate": 0.00042215494212812193, "loss": 4.8931, "mean_token_accuracy": 0.23271571099758148, "num_tokens": 64926163.0, "step": 28350 }, { "entropy": 5.647972822189331, "epoch": 2.8029853697113483, "grad_norm": 1.25, "learning_rate": 0.00042212824430911533, "loss": 4.9321, "mean_token_accuracy": 0.22908053249120713, "num_tokens": 64936513.0, "step": 28355 }, { "entropy": 5.618739175796509, "epoch": 2.8034796362198495, "grad_norm": 1.2109375, "learning_rate": 0.0004221015428707311, "loss": 4.8712, "mean_token_accuracy": 0.23348571807146073, "num_tokens": 64947232.0, "step": 28360 }, { "entropy": 5.732770156860352, "epoch": 2.8039739027283512, "grad_norm": 1.1640625, "learning_rate": 0.000422074837813626, "loss": 5.0486, "mean_token_accuracy": 0.21315110474824905, "num_tokens": 64958622.0, "step": 28365 }, { "entropy": 5.757647466659546, "epoch": 2.8044681692368525, "grad_norm": 1.125, "learning_rate": 0.00042204812913845726, "loss": 5.0167, "mean_token_accuracy": 0.21504825204610825, "num_tokens": 64969975.0, "step": 28370 }, { "entropy": 5.727634763717651, "epoch": 2.8049624357453538, "grad_norm": 1.1640625, "learning_rate": 0.00042202141684588156, "loss": 4.9243, "mean_token_accuracy": 0.21933132112026216, "num_tokens": 64981195.0, "step": 28375 }, { "entropy": 5.734689950942993, "epoch": 2.8054567022538555, "grad_norm": 1.28125, "learning_rate": 0.0004219947009365563, "loss": 5.0746, "mean_token_accuracy": 0.2178567960858345, "num_tokens": 64992265.0, "step": 28380 }, { "entropy": 5.68792953491211, "epoch": 2.8059509687623567, "grad_norm": 1.1796875, "learning_rate": 0.0004219679814111386, "loss": 5.035, "mean_token_accuracy": 0.21525471061468124, "num_tokens": 65003613.0, "step": 28385 }, { "entropy": 5.666007852554321, "epoch": 2.806445235270858, "grad_norm": 1.1875, "learning_rate": 0.0004219412582702857, "loss": 4.9468, "mean_token_accuracy": 0.22464779317378997, "num_tokens": 65014768.0, "step": 28390 }, { "entropy": 5.724464797973633, "epoch": 2.8069395017793592, "grad_norm": 1.2578125, "learning_rate": 0.00042191453151465506, "loss": 4.9971, "mean_token_accuracy": 0.21822245121002198, "num_tokens": 65026425.0, "step": 28395 }, { "entropy": 5.721783542633057, "epoch": 2.807433768287861, "grad_norm": 1.2421875, "learning_rate": 0.00042188780114490413, "loss": 5.0094, "mean_token_accuracy": 0.22101344168186188, "num_tokens": 65037624.0, "step": 28400 }, { "entropy": 5.724779033660889, "epoch": 2.807928034796362, "grad_norm": 1.1953125, "learning_rate": 0.0004218610671616905, "loss": 5.0953, "mean_token_accuracy": 0.21858241707086562, "num_tokens": 65048659.0, "step": 28405 }, { "entropy": 5.674625015258789, "epoch": 2.8084223013048635, "grad_norm": 1.109375, "learning_rate": 0.00042183432956567184, "loss": 4.9247, "mean_token_accuracy": 0.2311659649014473, "num_tokens": 65059084.0, "step": 28410 }, { "entropy": 5.690136861801148, "epoch": 2.808916567813365, "grad_norm": 1.0859375, "learning_rate": 0.00042180758835750595, "loss": 4.9554, "mean_token_accuracy": 0.22586261928081514, "num_tokens": 65071525.0, "step": 28415 }, { "entropy": 5.699678087234497, "epoch": 2.8094108343218664, "grad_norm": 1.140625, "learning_rate": 0.0004217808435378506, "loss": 5.0428, "mean_token_accuracy": 0.2175804167985916, "num_tokens": 65082738.0, "step": 28420 }, { "entropy": 5.692951965332031, "epoch": 2.8099051008303677, "grad_norm": 1.109375, "learning_rate": 0.0004217540951073637, "loss": 5.0342, "mean_token_accuracy": 0.2167535498738289, "num_tokens": 65094988.0, "step": 28425 }, { "entropy": 5.7198585033416744, "epoch": 2.810399367338869, "grad_norm": 1.1640625, "learning_rate": 0.0004217273430667033, "loss": 5.0132, "mean_token_accuracy": 0.21366462111473083, "num_tokens": 65106412.0, "step": 28430 }, { "entropy": 5.718555450439453, "epoch": 2.8108936338473702, "grad_norm": 1.0703125, "learning_rate": 0.0004217005874165274, "loss": 5.0023, "mean_token_accuracy": 0.22496997117996215, "num_tokens": 65117756.0, "step": 28435 }, { "entropy": 5.713331604003907, "epoch": 2.811387900355872, "grad_norm": 1.1796875, "learning_rate": 0.0004216738281574944, "loss": 5.0557, "mean_token_accuracy": 0.2145448699593544, "num_tokens": 65129368.0, "step": 28440 }, { "entropy": 5.739205932617187, "epoch": 2.811882166864373, "grad_norm": 1.1640625, "learning_rate": 0.00042164706529026255, "loss": 5.0483, "mean_token_accuracy": 0.21423470824956894, "num_tokens": 65140553.0, "step": 28445 }, { "entropy": 5.653905963897705, "epoch": 2.812376433372875, "grad_norm": 1.21875, "learning_rate": 0.0004216202988154901, "loss": 4.945, "mean_token_accuracy": 0.22129978984594345, "num_tokens": 65152047.0, "step": 28450 }, { "entropy": 5.706011486053467, "epoch": 2.812870699881376, "grad_norm": 1.203125, "learning_rate": 0.0004215935287338354, "loss": 4.9786, "mean_token_accuracy": 0.21933094561100006, "num_tokens": 65164001.0, "step": 28455 }, { "entropy": 5.72477240562439, "epoch": 2.8133649663898774, "grad_norm": 1.1640625, "learning_rate": 0.0004215667550459573, "loss": 4.9901, "mean_token_accuracy": 0.2267170399427414, "num_tokens": 65175949.0, "step": 28460 }, { "entropy": 5.708213758468628, "epoch": 2.8138592328983787, "grad_norm": 1.296875, "learning_rate": 0.0004215399777525142, "loss": 4.9995, "mean_token_accuracy": 0.22296242713928222, "num_tokens": 65186725.0, "step": 28465 }, { "entropy": 5.733828592300415, "epoch": 2.81435349940688, "grad_norm": 1.1796875, "learning_rate": 0.000421513196854165, "loss": 4.9819, "mean_token_accuracy": 0.21910453736782073, "num_tokens": 65198489.0, "step": 28470 }, { "entropy": 5.636229848861694, "epoch": 2.8148477659153817, "grad_norm": 1.0625, "learning_rate": 0.0004214864123515684, "loss": 4.9111, "mean_token_accuracy": 0.222913259267807, "num_tokens": 65210572.0, "step": 28475 }, { "entropy": 5.693554401397705, "epoch": 2.815342032423883, "grad_norm": 1.140625, "learning_rate": 0.00042145962424538336, "loss": 5.0121, "mean_token_accuracy": 0.21850177198648452, "num_tokens": 65221785.0, "step": 28480 }, { "entropy": 5.749634599685669, "epoch": 2.815836298932384, "grad_norm": 1.09375, "learning_rate": 0.0004214328325362687, "loss": 5.0471, "mean_token_accuracy": 0.21214486807584762, "num_tokens": 65233998.0, "step": 28485 }, { "entropy": 5.744606971740723, "epoch": 2.816330565440886, "grad_norm": 1.125, "learning_rate": 0.0004214060372248838, "loss": 5.03, "mean_token_accuracy": 0.20983162075281142, "num_tokens": 65243907.0, "step": 28490 }, { "entropy": 5.729289293289185, "epoch": 2.816824831949387, "grad_norm": 1.078125, "learning_rate": 0.00042137923831188763, "loss": 4.9929, "mean_token_accuracy": 0.2183765560388565, "num_tokens": 65254555.0, "step": 28495 }, { "entropy": 5.740906715393066, "epoch": 2.8173190984578884, "grad_norm": 1.0625, "learning_rate": 0.00042135243579793946, "loss": 4.9995, "mean_token_accuracy": 0.21524958610534667, "num_tokens": 65265751.0, "step": 28500 }, { "entropy": 5.670943021774292, "epoch": 2.8178133649663897, "grad_norm": 1.09375, "learning_rate": 0.00042132562968369864, "loss": 4.9317, "mean_token_accuracy": 0.225890851020813, "num_tokens": 65275839.0, "step": 28505 }, { "entropy": 5.691793775558471, "epoch": 2.8183076314748914, "grad_norm": 1.1171875, "learning_rate": 0.0004212988199698247, "loss": 4.9525, "mean_token_accuracy": 0.2192242607474327, "num_tokens": 65287796.0, "step": 28510 }, { "entropy": 5.71829628944397, "epoch": 2.8188018979833926, "grad_norm": 1.046875, "learning_rate": 0.00042127200665697715, "loss": 5.0301, "mean_token_accuracy": 0.22356114238500596, "num_tokens": 65299014.0, "step": 28515 }, { "entropy": 5.706383609771729, "epoch": 2.819296164491894, "grad_norm": 1.09375, "learning_rate": 0.00042124518974581536, "loss": 4.9748, "mean_token_accuracy": 0.22318002879619597, "num_tokens": 65309830.0, "step": 28520 }, { "entropy": 5.754660701751709, "epoch": 2.8197904310003956, "grad_norm": 1.046875, "learning_rate": 0.0004212183692369994, "loss": 5.0589, "mean_token_accuracy": 0.21097784191370011, "num_tokens": 65321921.0, "step": 28525 }, { "entropy": 5.685256147384644, "epoch": 2.820284697508897, "grad_norm": 1.2265625, "learning_rate": 0.0004211915451311887, "loss": 4.9744, "mean_token_accuracy": 0.22360786199569702, "num_tokens": 65334175.0, "step": 28530 }, { "entropy": 5.720682430267334, "epoch": 2.820778964017398, "grad_norm": 1.0625, "learning_rate": 0.0004211647174290434, "loss": 5.065, "mean_token_accuracy": 0.21811071187257766, "num_tokens": 65345460.0, "step": 28535 }, { "entropy": 5.680964231491089, "epoch": 2.8212732305258994, "grad_norm": 1.1015625, "learning_rate": 0.00042113788613122333, "loss": 4.9472, "mean_token_accuracy": 0.2261755034327507, "num_tokens": 65357252.0, "step": 28540 }, { "entropy": 5.716677188873291, "epoch": 2.821767497034401, "grad_norm": 1.09375, "learning_rate": 0.0004211110512383887, "loss": 5.1166, "mean_token_accuracy": 0.21755707412958145, "num_tokens": 65370195.0, "step": 28545 }, { "entropy": 5.6663566589355465, "epoch": 2.8222617635429024, "grad_norm": 1.1640625, "learning_rate": 0.0004210842127511995, "loss": 4.9633, "mean_token_accuracy": 0.22314319014549255, "num_tokens": 65382531.0, "step": 28550 }, { "entropy": 5.77213487625122, "epoch": 2.8227560300514036, "grad_norm": 1.15625, "learning_rate": 0.0004210573706703159, "loss": 5.0771, "mean_token_accuracy": 0.2115390807390213, "num_tokens": 65393829.0, "step": 28555 }, { "entropy": 5.741116046905518, "epoch": 2.8232502965599053, "grad_norm": 1.1953125, "learning_rate": 0.0004210305249963984, "loss": 4.9816, "mean_token_accuracy": 0.21960900574922562, "num_tokens": 65404479.0, "step": 28560 }, { "entropy": 5.748715925216675, "epoch": 2.8237445630684066, "grad_norm": 1.25, "learning_rate": 0.0004210036757301073, "loss": 5.0473, "mean_token_accuracy": 0.21575185358524324, "num_tokens": 65415468.0, "step": 28565 }, { "entropy": 5.624507570266724, "epoch": 2.824238829576908, "grad_norm": 1.125, "learning_rate": 0.0004209768228721032, "loss": 4.9035, "mean_token_accuracy": 0.22806870490312575, "num_tokens": 65425994.0, "step": 28570 }, { "entropy": 5.636254167556762, "epoch": 2.824733096085409, "grad_norm": 1.0546875, "learning_rate": 0.00042094996642304657, "loss": 5.0252, "mean_token_accuracy": 0.2171539694070816, "num_tokens": 65438394.0, "step": 28575 }, { "entropy": 5.691539669036866, "epoch": 2.8252273625939104, "grad_norm": 1.2109375, "learning_rate": 0.0004209231063835981, "loss": 5.0509, "mean_token_accuracy": 0.2207360938191414, "num_tokens": 65450248.0, "step": 28580 }, { "entropy": 5.7311779975891115, "epoch": 2.825721629102412, "grad_norm": 1.109375, "learning_rate": 0.00042089624275441865, "loss": 5.0152, "mean_token_accuracy": 0.21828146427869796, "num_tokens": 65460803.0, "step": 28585 }, { "entropy": 5.70726752281189, "epoch": 2.8262158956109134, "grad_norm": 1.0390625, "learning_rate": 0.0004208693755361689, "loss": 5.0096, "mean_token_accuracy": 0.22166830003261567, "num_tokens": 65471899.0, "step": 28590 }, { "entropy": 5.705237531661988, "epoch": 2.826710162119415, "grad_norm": 1.125, "learning_rate": 0.0004208425047295099, "loss": 5.0283, "mean_token_accuracy": 0.21661674827337266, "num_tokens": 65483767.0, "step": 28595 }, { "entropy": 5.677091407775879, "epoch": 2.8272044286279163, "grad_norm": 1.15625, "learning_rate": 0.0004208156303351027, "loss": 4.8931, "mean_token_accuracy": 0.22830077707767488, "num_tokens": 65494859.0, "step": 28600 }, { "entropy": 5.784985876083374, "epoch": 2.8276986951364176, "grad_norm": 1.09375, "learning_rate": 0.00042078875235360835, "loss": 5.0958, "mean_token_accuracy": 0.2109665244817734, "num_tokens": 65506411.0, "step": 28605 }, { "entropy": 5.713237619400024, "epoch": 2.828192961644919, "grad_norm": 1.109375, "learning_rate": 0.00042076187078568804, "loss": 4.9581, "mean_token_accuracy": 0.2189013510942459, "num_tokens": 65516655.0, "step": 28610 }, { "entropy": 5.566547203063965, "epoch": 2.82868722815342, "grad_norm": 1.1328125, "learning_rate": 0.0004207349856320031, "loss": 4.9543, "mean_token_accuracy": 0.22132923305034638, "num_tokens": 65529305.0, "step": 28615 }, { "entropy": 5.696669054031372, "epoch": 2.829181494661922, "grad_norm": 1.15625, "learning_rate": 0.00042070809689321497, "loss": 5.0035, "mean_token_accuracy": 0.21742099970579148, "num_tokens": 65542129.0, "step": 28620 }, { "entropy": 5.705373668670655, "epoch": 2.829675761170423, "grad_norm": 1.0859375, "learning_rate": 0.000420681204569985, "loss": 4.9519, "mean_token_accuracy": 0.23366078436374665, "num_tokens": 65554240.0, "step": 28625 }, { "entropy": 5.675036144256592, "epoch": 2.8301700276789243, "grad_norm": 1.171875, "learning_rate": 0.00042065430866297486, "loss": 4.9295, "mean_token_accuracy": 0.22743548154830934, "num_tokens": 65564994.0, "step": 28630 }, { "entropy": 5.67653169631958, "epoch": 2.830664294187426, "grad_norm": 1.125, "learning_rate": 0.0004206274091728461, "loss": 4.9536, "mean_token_accuracy": 0.2186505004763603, "num_tokens": 65575986.0, "step": 28635 }, { "entropy": 5.753972864151001, "epoch": 2.8311585606959273, "grad_norm": 1.1171875, "learning_rate": 0.0004206005061002604, "loss": 5.0734, "mean_token_accuracy": 0.21588441282510756, "num_tokens": 65587792.0, "step": 28640 }, { "entropy": 5.798526096343994, "epoch": 2.8316528272044286, "grad_norm": 1.0546875, "learning_rate": 0.0004205735994458798, "loss": 5.1731, "mean_token_accuracy": 0.19955829977989198, "num_tokens": 65599845.0, "step": 28645 }, { "entropy": 5.745310211181641, "epoch": 2.83214709371293, "grad_norm": 1.25, "learning_rate": 0.0004205466892103659, "loss": 5.042, "mean_token_accuracy": 0.2107723817229271, "num_tokens": 65611796.0, "step": 28650 }, { "entropy": 5.816731405258179, "epoch": 2.8326413602214315, "grad_norm": 1.2734375, "learning_rate": 0.00042051977539438103, "loss": 5.0931, "mean_token_accuracy": 0.2105873018503189, "num_tokens": 65622319.0, "step": 28655 }, { "entropy": 5.6564515113830565, "epoch": 2.833135626729933, "grad_norm": 1.140625, "learning_rate": 0.00042049285799858707, "loss": 4.9615, "mean_token_accuracy": 0.22197322249412538, "num_tokens": 65634403.0, "step": 28660 }, { "entropy": 5.660837078094483, "epoch": 2.833629893238434, "grad_norm": 1.2890625, "learning_rate": 0.00042046593702364614, "loss": 5.0188, "mean_token_accuracy": 0.21811422556638718, "num_tokens": 65644719.0, "step": 28665 }, { "entropy": 5.851485824584961, "epoch": 2.8341241597469358, "grad_norm": 1.0859375, "learning_rate": 0.0004204390124702207, "loss": 5.1012, "mean_token_accuracy": 0.2078378066420555, "num_tokens": 65657083.0, "step": 28670 }, { "entropy": 5.6949550151824955, "epoch": 2.834618426255437, "grad_norm": 1.09375, "learning_rate": 0.0004204120843389729, "loss": 5.0136, "mean_token_accuracy": 0.2129308670759201, "num_tokens": 65667579.0, "step": 28675 }, { "entropy": 5.676826858520508, "epoch": 2.8351126927639383, "grad_norm": 1.203125, "learning_rate": 0.00042038515263056537, "loss": 4.9859, "mean_token_accuracy": 0.22246946394443512, "num_tokens": 65679066.0, "step": 28680 }, { "entropy": 5.7206175327301025, "epoch": 2.8356069592724396, "grad_norm": 1.2265625, "learning_rate": 0.0004203582173456604, "loss": 5.0724, "mean_token_accuracy": 0.21377201229333878, "num_tokens": 65690785.0, "step": 28685 }, { "entropy": 5.7132669448852536, "epoch": 2.836101225780941, "grad_norm": 1.1015625, "learning_rate": 0.00042033127848492086, "loss": 5.0242, "mean_token_accuracy": 0.2218717157840729, "num_tokens": 65701613.0, "step": 28690 }, { "entropy": 5.716776418685913, "epoch": 2.8365954922894425, "grad_norm": 1.1953125, "learning_rate": 0.0004203043360490093, "loss": 4.9931, "mean_token_accuracy": 0.2194090321660042, "num_tokens": 65713146.0, "step": 28695 }, { "entropy": 5.7508848190307615, "epoch": 2.837089758797944, "grad_norm": 1.2109375, "learning_rate": 0.00042027739003858855, "loss": 5.0349, "mean_token_accuracy": 0.20797315686941148, "num_tokens": 65724216.0, "step": 28700 }, { "entropy": 5.6577417850494385, "epoch": 2.8375840253064455, "grad_norm": 1.140625, "learning_rate": 0.0004202504404543214, "loss": 4.9389, "mean_token_accuracy": 0.22201081216335297, "num_tokens": 65735357.0, "step": 28705 }, { "entropy": 5.713968229293823, "epoch": 2.8380782918149468, "grad_norm": 1.140625, "learning_rate": 0.0004202234872968709, "loss": 4.9774, "mean_token_accuracy": 0.2148330807685852, "num_tokens": 65747679.0, "step": 28710 }, { "entropy": 5.7436014175415036, "epoch": 2.838572558323448, "grad_norm": 1.0078125, "learning_rate": 0.0004201965305669001, "loss": 4.9842, "mean_token_accuracy": 0.22125888019800186, "num_tokens": 65759126.0, "step": 28715 }, { "entropy": 5.700781011581421, "epoch": 2.8390668248319493, "grad_norm": 1.1953125, "learning_rate": 0.00042016957026507206, "loss": 5.0466, "mean_token_accuracy": 0.21566016525030135, "num_tokens": 65771240.0, "step": 28720 }, { "entropy": 5.6683799743652346, "epoch": 2.8395610913404505, "grad_norm": 1.109375, "learning_rate": 0.0004201426063920501, "loss": 4.9293, "mean_token_accuracy": 0.22560853362083436, "num_tokens": 65783323.0, "step": 28725 }, { "entropy": 5.68269910812378, "epoch": 2.8400553578489522, "grad_norm": 1.09375, "learning_rate": 0.00042011563894849756, "loss": 4.9356, "mean_token_accuracy": 0.22480877935886384, "num_tokens": 65794165.0, "step": 28730 }, { "entropy": 5.674124622344971, "epoch": 2.8405496243574535, "grad_norm": 1.09375, "learning_rate": 0.0004200886679350778, "loss": 4.9124, "mean_token_accuracy": 0.22809515595436097, "num_tokens": 65804541.0, "step": 28735 }, { "entropy": 5.659866905212402, "epoch": 2.8410438908659548, "grad_norm": 1.1484375, "learning_rate": 0.0004200616933524542, "loss": 5.0128, "mean_token_accuracy": 0.22012083679437638, "num_tokens": 65816986.0, "step": 28740 }, { "entropy": 5.696641969680786, "epoch": 2.8415381573744565, "grad_norm": 1.125, "learning_rate": 0.0004200347152012905, "loss": 4.9945, "mean_token_accuracy": 0.21558830440044402, "num_tokens": 65828711.0, "step": 28745 }, { "entropy": 5.758247423171997, "epoch": 2.8420324238829577, "grad_norm": 1.109375, "learning_rate": 0.0004200077334822503, "loss": 5.0161, "mean_token_accuracy": 0.21532185077667237, "num_tokens": 65840525.0, "step": 28750 }, { "entropy": 5.6997987747192385, "epoch": 2.842526690391459, "grad_norm": 1.234375, "learning_rate": 0.0004199807481959973, "loss": 4.9295, "mean_token_accuracy": 0.22420274168252946, "num_tokens": 65851663.0, "step": 28755 }, { "entropy": 5.679914236068726, "epoch": 2.8430209568999603, "grad_norm": 1.3125, "learning_rate": 0.0004199537593431955, "loss": 4.9793, "mean_token_accuracy": 0.22218133360147477, "num_tokens": 65863337.0, "step": 28760 }, { "entropy": 5.8040605068206785, "epoch": 2.843515223408462, "grad_norm": 1.0859375, "learning_rate": 0.0004199267669245087, "loss": 5.1321, "mean_token_accuracy": 0.20283611118793488, "num_tokens": 65875581.0, "step": 28765 }, { "entropy": 5.735746097564697, "epoch": 2.8440094899169632, "grad_norm": 1.2109375, "learning_rate": 0.00041989977094060096, "loss": 5.0031, "mean_token_accuracy": 0.22016289979219436, "num_tokens": 65886577.0, "step": 28770 }, { "entropy": 5.678605365753174, "epoch": 2.8445037564254645, "grad_norm": 1.0625, "learning_rate": 0.0004198727713921364, "loss": 5.0002, "mean_token_accuracy": 0.2172711044549942, "num_tokens": 65897914.0, "step": 28775 }, { "entropy": 5.683418846130371, "epoch": 2.844998022933966, "grad_norm": 1.0625, "learning_rate": 0.0004198457682797791, "loss": 4.9898, "mean_token_accuracy": 0.22387681752443314, "num_tokens": 65909781.0, "step": 28780 }, { "entropy": 5.702006578445435, "epoch": 2.8454922894424675, "grad_norm": 1.21875, "learning_rate": 0.00041981876160419353, "loss": 4.9734, "mean_token_accuracy": 0.2218906596302986, "num_tokens": 65921107.0, "step": 28785 }, { "entropy": 5.733965587615967, "epoch": 2.8459865559509687, "grad_norm": 1.1953125, "learning_rate": 0.00041979175136604385, "loss": 5.0112, "mean_token_accuracy": 0.22336645275354386, "num_tokens": 65931166.0, "step": 28790 }, { "entropy": 5.781806898117066, "epoch": 2.84648082245947, "grad_norm": 1.0859375, "learning_rate": 0.0004197647375659947, "loss": 5.1202, "mean_token_accuracy": 0.21038123667240144, "num_tokens": 65943835.0, "step": 28795 }, { "entropy": 5.671651411056518, "epoch": 2.8469750889679717, "grad_norm": 1.015625, "learning_rate": 0.00041973772020471054, "loss": 4.9619, "mean_token_accuracy": 0.22450049072504044, "num_tokens": 65956961.0, "step": 28800 }, { "entropy": 5.752721166610717, "epoch": 2.847469355476473, "grad_norm": 1.03125, "learning_rate": 0.00041971069928285596, "loss": 5.0441, "mean_token_accuracy": 0.2167324036359787, "num_tokens": 65967774.0, "step": 28805 }, { "entropy": 5.671965646743774, "epoch": 2.847963621984974, "grad_norm": 1.1328125, "learning_rate": 0.00041968367480109577, "loss": 4.9885, "mean_token_accuracy": 0.22039819210767747, "num_tokens": 65978318.0, "step": 28810 }, { "entropy": 5.722200489044189, "epoch": 2.848457888493476, "grad_norm": 1.15625, "learning_rate": 0.0004196566467600947, "loss": 4.9553, "mean_token_accuracy": 0.21982679665088653, "num_tokens": 65989763.0, "step": 28815 }, { "entropy": 5.65638108253479, "epoch": 2.848952155001977, "grad_norm": 1.1484375, "learning_rate": 0.00041962961516051777, "loss": 4.9264, "mean_token_accuracy": 0.23013641983270644, "num_tokens": 66001117.0, "step": 28820 }, { "entropy": 5.728678178787232, "epoch": 2.8494464215104784, "grad_norm": 1.1171875, "learning_rate": 0.0004196025800030298, "loss": 5.0121, "mean_token_accuracy": 0.21587574779987334, "num_tokens": 66012340.0, "step": 28825 }, { "entropy": 5.666395044326782, "epoch": 2.8499406880189797, "grad_norm": 1.1015625, "learning_rate": 0.0004195755412882959, "loss": 4.9953, "mean_token_accuracy": 0.22075920701026916, "num_tokens": 66023151.0, "step": 28830 }, { "entropy": 5.601254415512085, "epoch": 2.850434954527481, "grad_norm": 1.2578125, "learning_rate": 0.00041954849901698133, "loss": 4.8612, "mean_token_accuracy": 0.23114654123783113, "num_tokens": 66033399.0, "step": 28835 }, { "entropy": 5.649206924438476, "epoch": 2.8509292210359827, "grad_norm": 1.203125, "learning_rate": 0.00041952145318975114, "loss": 4.9776, "mean_token_accuracy": 0.22748736888170243, "num_tokens": 66045817.0, "step": 28840 }, { "entropy": 5.784841823577881, "epoch": 2.851423487544484, "grad_norm": 1.15625, "learning_rate": 0.0004194944038072709, "loss": 5.1172, "mean_token_accuracy": 0.2099556192755699, "num_tokens": 66058696.0, "step": 28845 }, { "entropy": 5.747118377685547, "epoch": 2.8519177540529856, "grad_norm": 1.109375, "learning_rate": 0.00041946735087020586, "loss": 4.9526, "mean_token_accuracy": 0.22156989723443984, "num_tokens": 66070197.0, "step": 28850 }, { "entropy": 5.6451598644256595, "epoch": 2.852412020561487, "grad_norm": 1.265625, "learning_rate": 0.0004194402943792216, "loss": 4.8259, "mean_token_accuracy": 0.23361034393310548, "num_tokens": 66080250.0, "step": 28855 }, { "entropy": 5.693163728713989, "epoch": 2.852906287069988, "grad_norm": 1.15625, "learning_rate": 0.0004194132343349837, "loss": 5.0386, "mean_token_accuracy": 0.21631951183080672, "num_tokens": 66090957.0, "step": 28860 }, { "entropy": 5.68308916091919, "epoch": 2.8534005535784894, "grad_norm": 1.0234375, "learning_rate": 0.0004193861707381578, "loss": 4.9467, "mean_token_accuracy": 0.22356856167316436, "num_tokens": 66103042.0, "step": 28865 }, { "entropy": 5.667127418518066, "epoch": 2.8538948200869907, "grad_norm": 1.1875, "learning_rate": 0.00041935910358940974, "loss": 4.9841, "mean_token_accuracy": 0.2217377617955208, "num_tokens": 66113832.0, "step": 28870 }, { "entropy": 5.635734128952026, "epoch": 2.8543890865954924, "grad_norm": 0.9921875, "learning_rate": 0.0004193320328894053, "loss": 4.9029, "mean_token_accuracy": 0.22974541932344436, "num_tokens": 66126268.0, "step": 28875 }, { "entropy": 5.700114774703979, "epoch": 2.8548833531039937, "grad_norm": 1.171875, "learning_rate": 0.0004193049586388105, "loss": 4.9179, "mean_token_accuracy": 0.21951544731855394, "num_tokens": 66137590.0, "step": 28880 }, { "entropy": 5.602246332168579, "epoch": 2.855377619612495, "grad_norm": 1.1640625, "learning_rate": 0.00041927788083829127, "loss": 4.9436, "mean_token_accuracy": 0.22722191512584686, "num_tokens": 66149110.0, "step": 28885 }, { "entropy": 5.6901427745819095, "epoch": 2.8558718861209966, "grad_norm": 1.0859375, "learning_rate": 0.0004192507994885137, "loss": 4.9249, "mean_token_accuracy": 0.22700337320566177, "num_tokens": 66160116.0, "step": 28890 }, { "entropy": 5.764993190765381, "epoch": 2.856366152629498, "grad_norm": 1.1953125, "learning_rate": 0.0004192237145901443, "loss": 5.064, "mean_token_accuracy": 0.20774249583482743, "num_tokens": 66170743.0, "step": 28895 }, { "entropy": 5.7725286960601805, "epoch": 2.856860419137999, "grad_norm": 1.0703125, "learning_rate": 0.000419196626143849, "loss": 5.0084, "mean_token_accuracy": 0.2114725425839424, "num_tokens": 66182280.0, "step": 28900 }, { "entropy": 5.745388793945312, "epoch": 2.8573546856465004, "grad_norm": 1.21875, "learning_rate": 0.00041916953415029447, "loss": 5.0446, "mean_token_accuracy": 0.21913896054029464, "num_tokens": 66193387.0, "step": 28905 }, { "entropy": 5.703210258483887, "epoch": 2.857848952155002, "grad_norm": 1.078125, "learning_rate": 0.0004191424386101469, "loss": 4.9916, "mean_token_accuracy": 0.2136000171303749, "num_tokens": 66206180.0, "step": 28910 }, { "entropy": 5.651580667495727, "epoch": 2.8583432186635034, "grad_norm": 1.203125, "learning_rate": 0.000419115339524073, "loss": 4.9346, "mean_token_accuracy": 0.22482164353132247, "num_tokens": 66217495.0, "step": 28915 }, { "entropy": 5.745947933197021, "epoch": 2.8588374851720046, "grad_norm": 1.1484375, "learning_rate": 0.0004190882368927394, "loss": 5.0219, "mean_token_accuracy": 0.21022023856639863, "num_tokens": 66229107.0, "step": 28920 }, { "entropy": 5.7303589344024655, "epoch": 2.8593317516805064, "grad_norm": 1.109375, "learning_rate": 0.0004190611307168128, "loss": 4.9677, "mean_token_accuracy": 0.2268611565232277, "num_tokens": 66240480.0, "step": 28925 }, { "entropy": 5.630237007141114, "epoch": 2.8598260181890076, "grad_norm": 1.15625, "learning_rate": 0.00041903402099696007, "loss": 4.9349, "mean_token_accuracy": 0.23011812418699265, "num_tokens": 66251785.0, "step": 28930 }, { "entropy": 5.676721525192261, "epoch": 2.860320284697509, "grad_norm": 1.2734375, "learning_rate": 0.0004190069077338481, "loss": 4.9099, "mean_token_accuracy": 0.22742154598236083, "num_tokens": 66262557.0, "step": 28935 }, { "entropy": 5.7323627948760985, "epoch": 2.86081455120601, "grad_norm": 1.1796875, "learning_rate": 0.0004189797909281438, "loss": 5.0518, "mean_token_accuracy": 0.21916950047016143, "num_tokens": 66272931.0, "step": 28940 }, { "entropy": 5.705012798309326, "epoch": 2.8613088177145114, "grad_norm": 1.1328125, "learning_rate": 0.00041895267058051434, "loss": 4.9839, "mean_token_accuracy": 0.22632209211587906, "num_tokens": 66283550.0, "step": 28945 }, { "entropy": 5.709415864944458, "epoch": 2.861803084223013, "grad_norm": 1.1484375, "learning_rate": 0.00041892554669162687, "loss": 5.0379, "mean_token_accuracy": 0.21380527019500734, "num_tokens": 66294740.0, "step": 28950 }, { "entropy": 5.6588582515716555, "epoch": 2.8622973507315144, "grad_norm": 1.15625, "learning_rate": 0.00041889841926214856, "loss": 4.9103, "mean_token_accuracy": 0.22401730120182037, "num_tokens": 66306241.0, "step": 28955 }, { "entropy": 5.765018367767334, "epoch": 2.862791617240016, "grad_norm": 1.0625, "learning_rate": 0.00041887128829274685, "loss": 5.0233, "mean_token_accuracy": 0.21215690672397614, "num_tokens": 66320006.0, "step": 28960 }, { "entropy": 5.746566438674927, "epoch": 2.8632858837485173, "grad_norm": 1.125, "learning_rate": 0.00041884415378408917, "loss": 4.9836, "mean_token_accuracy": 0.21629102081060408, "num_tokens": 66330810.0, "step": 28965 }, { "entropy": 5.721741676330566, "epoch": 2.8637801502570186, "grad_norm": 1.0390625, "learning_rate": 0.0004188170157368429, "loss": 5.0164, "mean_token_accuracy": 0.21850817948579787, "num_tokens": 66341858.0, "step": 28970 }, { "entropy": 5.681955099105835, "epoch": 2.86427441676552, "grad_norm": 1.15625, "learning_rate": 0.0004187898741516758, "loss": 4.9948, "mean_token_accuracy": 0.2210603728890419, "num_tokens": 66353175.0, "step": 28975 }, { "entropy": 5.747458124160767, "epoch": 2.864768683274021, "grad_norm": 1.046875, "learning_rate": 0.0004187627290292555, "loss": 5.0063, "mean_token_accuracy": 0.22123963087797166, "num_tokens": 66364245.0, "step": 28980 }, { "entropy": 5.653993940353393, "epoch": 2.865262949782523, "grad_norm": 1.140625, "learning_rate": 0.00041873558037024974, "loss": 5.0233, "mean_token_accuracy": 0.21779378801584243, "num_tokens": 66376793.0, "step": 28985 }, { "entropy": 5.740129041671753, "epoch": 2.865757216291024, "grad_norm": 1.1953125, "learning_rate": 0.0004187084281753264, "loss": 5.052, "mean_token_accuracy": 0.21087127029895783, "num_tokens": 66388130.0, "step": 28990 }, { "entropy": 5.799789762496948, "epoch": 2.8662514827995254, "grad_norm": 1.25, "learning_rate": 0.00041868127244515336, "loss": 5.0263, "mean_token_accuracy": 0.21852745562791825, "num_tokens": 66400784.0, "step": 28995 }, { "entropy": 5.717172908782959, "epoch": 2.866745749308027, "grad_norm": 1.1171875, "learning_rate": 0.00041865411318039883, "loss": 4.9999, "mean_token_accuracy": 0.21946692913770677, "num_tokens": 66412159.0, "step": 29000 }, { "entropy": 5.685863590240478, "epoch": 2.8672400158165283, "grad_norm": 1.15625, "learning_rate": 0.00041862695038173085, "loss": 4.9638, "mean_token_accuracy": 0.22451932430267335, "num_tokens": 66423471.0, "step": 29005 }, { "entropy": 5.758540678024292, "epoch": 2.8677342823250296, "grad_norm": 1.1484375, "learning_rate": 0.0004185997840498175, "loss": 5.1052, "mean_token_accuracy": 0.2064451366662979, "num_tokens": 66436889.0, "step": 29010 }, { "entropy": 5.760631465911866, "epoch": 2.868228548833531, "grad_norm": 1.1171875, "learning_rate": 0.0004185726141853272, "loss": 5.0448, "mean_token_accuracy": 0.2159798413515091, "num_tokens": 66448157.0, "step": 29015 }, { "entropy": 5.6205979347229, "epoch": 2.8687228153420326, "grad_norm": 1.203125, "learning_rate": 0.0004185454407889284, "loss": 4.8841, "mean_token_accuracy": 0.23127532452344896, "num_tokens": 66459877.0, "step": 29020 }, { "entropy": 5.739146757125854, "epoch": 2.869217081850534, "grad_norm": 1.3046875, "learning_rate": 0.0004185182638612895, "loss": 4.9615, "mean_token_accuracy": 0.22201238125562667, "num_tokens": 66469648.0, "step": 29025 }, { "entropy": 5.727696895599365, "epoch": 2.869711348359035, "grad_norm": 1.0546875, "learning_rate": 0.00041849108340307893, "loss": 5.0718, "mean_token_accuracy": 0.2139240935444832, "num_tokens": 66480878.0, "step": 29030 }, { "entropy": 5.796301221847534, "epoch": 2.870205614867537, "grad_norm": 1.15625, "learning_rate": 0.00041846389941496557, "loss": 5.105, "mean_token_accuracy": 0.21072110831737517, "num_tokens": 66492099.0, "step": 29035 }, { "entropy": 5.760681295394898, "epoch": 2.870699881376038, "grad_norm": 1.1796875, "learning_rate": 0.00041843671189761795, "loss": 5.017, "mean_token_accuracy": 0.2149985611438751, "num_tokens": 66503194.0, "step": 29040 }, { "entropy": 5.728110122680664, "epoch": 2.8711941478845393, "grad_norm": 1.3046875, "learning_rate": 0.000418409520851705, "loss": 5.0422, "mean_token_accuracy": 0.21155631691217422, "num_tokens": 66513393.0, "step": 29045 }, { "entropy": 5.698626947402954, "epoch": 2.8716884143930406, "grad_norm": 1.078125, "learning_rate": 0.0004183823262778955, "loss": 4.9814, "mean_token_accuracy": 0.2319273978471756, "num_tokens": 66524042.0, "step": 29050 }, { "entropy": 5.790049457550049, "epoch": 2.8721826809015423, "grad_norm": 1.234375, "learning_rate": 0.0004183551281768586, "loss": 5.0373, "mean_token_accuracy": 0.21906707286834717, "num_tokens": 66534111.0, "step": 29055 }, { "entropy": 5.753539371490478, "epoch": 2.8726769474100435, "grad_norm": 1.171875, "learning_rate": 0.00041832792654926333, "loss": 5.023, "mean_token_accuracy": 0.2183144897222519, "num_tokens": 66545605.0, "step": 29060 }, { "entropy": 5.665373802185059, "epoch": 2.873171213918545, "grad_norm": 1.2578125, "learning_rate": 0.00041830072139577886, "loss": 4.9891, "mean_token_accuracy": 0.22244725823402406, "num_tokens": 66556579.0, "step": 29065 }, { "entropy": 5.701911211013794, "epoch": 2.8736654804270465, "grad_norm": 1.046875, "learning_rate": 0.00041827351271707435, "loss": 4.9961, "mean_token_accuracy": 0.21557383239269257, "num_tokens": 66570262.0, "step": 29070 }, { "entropy": 5.7843729019165036, "epoch": 2.8741597469355478, "grad_norm": 1.2421875, "learning_rate": 0.00041824630051381917, "loss": 5.0551, "mean_token_accuracy": 0.20418720990419387, "num_tokens": 66581159.0, "step": 29075 }, { "entropy": 5.726523542404175, "epoch": 2.874654013444049, "grad_norm": 1.2890625, "learning_rate": 0.00041821908478668283, "loss": 4.9726, "mean_token_accuracy": 0.22645521759986878, "num_tokens": 66591641.0, "step": 29080 }, { "entropy": 5.6469262599945065, "epoch": 2.8751482799525503, "grad_norm": 1.25, "learning_rate": 0.00041819186553633476, "loss": 5.0307, "mean_token_accuracy": 0.21355478018522261, "num_tokens": 66603737.0, "step": 29085 }, { "entropy": 5.717840766906738, "epoch": 2.8756425464610516, "grad_norm": 1.1953125, "learning_rate": 0.00041816464276344463, "loss": 5.0134, "mean_token_accuracy": 0.21755453646183015, "num_tokens": 66615874.0, "step": 29090 }, { "entropy": 5.7800170421600345, "epoch": 2.8761368129695533, "grad_norm": 1.234375, "learning_rate": 0.00041813741646868204, "loss": 5.061, "mean_token_accuracy": 0.21498048901557923, "num_tokens": 66627297.0, "step": 29095 }, { "entropy": 5.773064422607422, "epoch": 2.8766310794780545, "grad_norm": 1.2578125, "learning_rate": 0.0004181101866527168, "loss": 5.0619, "mean_token_accuracy": 0.21054091304540634, "num_tokens": 66638342.0, "step": 29100 }, { "entropy": 5.734130620956421, "epoch": 2.8771253459865562, "grad_norm": 1.078125, "learning_rate": 0.0004180829533162188, "loss": 4.9469, "mean_token_accuracy": 0.22385955303907396, "num_tokens": 66648599.0, "step": 29105 }, { "entropy": 5.618639898300171, "epoch": 2.8776196124950575, "grad_norm": 1.15625, "learning_rate": 0.0004180557164598579, "loss": 4.9273, "mean_token_accuracy": 0.23167620301246644, "num_tokens": 66660850.0, "step": 29110 }, { "entropy": 5.641179752349854, "epoch": 2.8781138790035588, "grad_norm": 1.171875, "learning_rate": 0.0004180284760843042, "loss": 4.9814, "mean_token_accuracy": 0.2163483127951622, "num_tokens": 66672577.0, "step": 29115 }, { "entropy": 5.793479347229004, "epoch": 2.87860814551206, "grad_norm": 1.1953125, "learning_rate": 0.00041800123219022786, "loss": 5.0295, "mean_token_accuracy": 0.2161676749587059, "num_tokens": 66683720.0, "step": 29120 }, { "entropy": 5.791900873184204, "epoch": 2.8791024120205613, "grad_norm": 1.203125, "learning_rate": 0.0004179739847782989, "loss": 5.0808, "mean_token_accuracy": 0.21394957602024078, "num_tokens": 66696492.0, "step": 29125 }, { "entropy": 5.710444974899292, "epoch": 2.879596678529063, "grad_norm": 1.21875, "learning_rate": 0.0004179467338491878, "loss": 5.0106, "mean_token_accuracy": 0.21962936520576476, "num_tokens": 66707203.0, "step": 29130 }, { "entropy": 5.740445709228515, "epoch": 2.8800909450375642, "grad_norm": 1.296875, "learning_rate": 0.0004179194794035649, "loss": 5.0131, "mean_token_accuracy": 0.21750188171863555, "num_tokens": 66717433.0, "step": 29135 }, { "entropy": 5.655262231826782, "epoch": 2.8805852115460655, "grad_norm": 1.1328125, "learning_rate": 0.00041789222144210066, "loss": 4.8804, "mean_token_accuracy": 0.23399192243814468, "num_tokens": 66729452.0, "step": 29140 }, { "entropy": 5.670908784866333, "epoch": 2.881079478054567, "grad_norm": 1.203125, "learning_rate": 0.00041786495996546546, "loss": 5.0382, "mean_token_accuracy": 0.22025166898965837, "num_tokens": 66741360.0, "step": 29145 }, { "entropy": 5.706701469421387, "epoch": 2.8815737445630685, "grad_norm": 1.1484375, "learning_rate": 0.0004178376949743302, "loss": 4.9795, "mean_token_accuracy": 0.22138807773590088, "num_tokens": 66752585.0, "step": 29150 }, { "entropy": 5.707409954071045, "epoch": 2.8820680110715697, "grad_norm": 1.1953125, "learning_rate": 0.0004178104264693655, "loss": 4.9748, "mean_token_accuracy": 0.2266859456896782, "num_tokens": 66763898.0, "step": 29155 }, { "entropy": 5.692349195480347, "epoch": 2.882562277580071, "grad_norm": 1.0859375, "learning_rate": 0.000417783154451242, "loss": 4.8676, "mean_token_accuracy": 0.23227767795324325, "num_tokens": 66774272.0, "step": 29160 }, { "entropy": 5.695982503890991, "epoch": 2.8830565440885727, "grad_norm": 1.140625, "learning_rate": 0.00041775587892063095, "loss": 4.9596, "mean_token_accuracy": 0.21961992383003234, "num_tokens": 66784943.0, "step": 29165 }, { "entropy": 5.776537847518921, "epoch": 2.883550810597074, "grad_norm": 1.09375, "learning_rate": 0.000417728599878203, "loss": 5.0795, "mean_token_accuracy": 0.21163523495197295, "num_tokens": 66796449.0, "step": 29170 }, { "entropy": 5.665265464782715, "epoch": 2.8840450771055752, "grad_norm": 1.125, "learning_rate": 0.0004177013173246294, "loss": 5.0173, "mean_token_accuracy": 0.2173009067773819, "num_tokens": 66809936.0, "step": 29175 }, { "entropy": 5.778957271575928, "epoch": 2.884539343614077, "grad_norm": 1.1640625, "learning_rate": 0.0004176740312605813, "loss": 5.0411, "mean_token_accuracy": 0.21382412314414978, "num_tokens": 66820846.0, "step": 29180 }, { "entropy": 5.769250297546387, "epoch": 2.885033610122578, "grad_norm": 1.203125, "learning_rate": 0.0004176467416867298, "loss": 5.0269, "mean_token_accuracy": 0.21041557043790818, "num_tokens": 66832919.0, "step": 29185 }, { "entropy": 5.704727125167847, "epoch": 2.8855278766310795, "grad_norm": 1.15625, "learning_rate": 0.00041761944860374637, "loss": 4.9243, "mean_token_accuracy": 0.22857650965452195, "num_tokens": 66844944.0, "step": 29190 }, { "entropy": 5.695947074890137, "epoch": 2.8860221431395807, "grad_norm": 1.046875, "learning_rate": 0.0004175921520123023, "loss": 5.0035, "mean_token_accuracy": 0.21847164779901504, "num_tokens": 66857987.0, "step": 29195 }, { "entropy": 5.6469746112823485, "epoch": 2.886516409648082, "grad_norm": 1.1328125, "learning_rate": 0.0004175648519130693, "loss": 4.957, "mean_token_accuracy": 0.22026453018188477, "num_tokens": 66869100.0, "step": 29200 }, { "entropy": 5.670305919647217, "epoch": 2.8870106761565837, "grad_norm": 1.1328125, "learning_rate": 0.00041753754830671876, "loss": 4.9572, "mean_token_accuracy": 0.21612282395362853, "num_tokens": 66881168.0, "step": 29205 }, { "entropy": 5.7087959289550785, "epoch": 2.887504942665085, "grad_norm": 1.109375, "learning_rate": 0.0004175102411939224, "loss": 5.0211, "mean_token_accuracy": 0.21840193271636962, "num_tokens": 66894080.0, "step": 29210 }, { "entropy": 5.70404314994812, "epoch": 2.8879992091735867, "grad_norm": 1.1484375, "learning_rate": 0.00041748293057535207, "loss": 4.9977, "mean_token_accuracy": 0.22230230569839476, "num_tokens": 66906155.0, "step": 29215 }, { "entropy": 5.706106042861938, "epoch": 2.888493475682088, "grad_norm": 1.375, "learning_rate": 0.00041745561645167953, "loss": 4.9379, "mean_token_accuracy": 0.2300686612725258, "num_tokens": 66915745.0, "step": 29220 }, { "entropy": 5.764196538925171, "epoch": 2.888987742190589, "grad_norm": 1.0703125, "learning_rate": 0.0004174282988235767, "loss": 5.0162, "mean_token_accuracy": 0.21629587113857268, "num_tokens": 66927722.0, "step": 29225 }, { "entropy": 5.699118614196777, "epoch": 2.8894820086990904, "grad_norm": 1.1640625, "learning_rate": 0.0004174009776917156, "loss": 5.0217, "mean_token_accuracy": 0.21865702867507936, "num_tokens": 66939063.0, "step": 29230 }, { "entropy": 5.698572063446045, "epoch": 2.8899762752075917, "grad_norm": 1.109375, "learning_rate": 0.0004173736530567684, "loss": 4.9024, "mean_token_accuracy": 0.2304903194308281, "num_tokens": 66950596.0, "step": 29235 }, { "entropy": 5.704935121536255, "epoch": 2.8904705417160934, "grad_norm": 1.1875, "learning_rate": 0.0004173463249194072, "loss": 4.9592, "mean_token_accuracy": 0.21991574317216872, "num_tokens": 66961836.0, "step": 29240 }, { "entropy": 5.75808687210083, "epoch": 2.8909648082245947, "grad_norm": 1.0703125, "learning_rate": 0.00041731899328030443, "loss": 5.1039, "mean_token_accuracy": 0.20811564326286316, "num_tokens": 66976064.0, "step": 29245 }, { "entropy": 5.659255075454712, "epoch": 2.891459074733096, "grad_norm": 1.171875, "learning_rate": 0.0004172916581401322, "loss": 4.8925, "mean_token_accuracy": 0.23715227246284484, "num_tokens": 66987572.0, "step": 29250 }, { "entropy": 5.6431841373443605, "epoch": 2.8919533412415976, "grad_norm": 1.140625, "learning_rate": 0.0004172643194995632, "loss": 4.9195, "mean_token_accuracy": 0.23159011602401733, "num_tokens": 66998668.0, "step": 29255 }, { "entropy": 5.686891222000122, "epoch": 2.892447607750099, "grad_norm": 1.21875, "learning_rate": 0.0004172369773592699, "loss": 5.0316, "mean_token_accuracy": 0.2183586537837982, "num_tokens": 67010140.0, "step": 29260 }, { "entropy": 5.673285484313965, "epoch": 2.8929418742586, "grad_norm": 1.15625, "learning_rate": 0.0004172096317199248, "loss": 4.8691, "mean_token_accuracy": 0.23667492270469664, "num_tokens": 67021727.0, "step": 29265 }, { "entropy": 5.699222564697266, "epoch": 2.8934361407671014, "grad_norm": 1.1171875, "learning_rate": 0.0004171822825822007, "loss": 4.9889, "mean_token_accuracy": 0.22674315124750138, "num_tokens": 67033327.0, "step": 29270 }, { "entropy": 5.742250394821167, "epoch": 2.893930407275603, "grad_norm": 1.140625, "learning_rate": 0.0004171549299467704, "loss": 5.0526, "mean_token_accuracy": 0.21962883025407792, "num_tokens": 67044827.0, "step": 29275 }, { "entropy": 5.725108861923218, "epoch": 2.8944246737841044, "grad_norm": 1.140625, "learning_rate": 0.0004171275738143068, "loss": 4.9147, "mean_token_accuracy": 0.22060459703207017, "num_tokens": 67056042.0, "step": 29280 }, { "entropy": 5.722684574127197, "epoch": 2.8949189402926057, "grad_norm": 1.0859375, "learning_rate": 0.00041710021418548283, "loss": 4.9968, "mean_token_accuracy": 0.22067476361989974, "num_tokens": 67068346.0, "step": 29285 }, { "entropy": 5.712063932418824, "epoch": 2.8954132068011074, "grad_norm": 1.1796875, "learning_rate": 0.0004170728510609716, "loss": 4.9199, "mean_token_accuracy": 0.22658058255910873, "num_tokens": 67078282.0, "step": 29290 }, { "entropy": 5.693100690841675, "epoch": 2.8959074733096086, "grad_norm": 1.1328125, "learning_rate": 0.00041704548444144605, "loss": 4.9965, "mean_token_accuracy": 0.21355136185884477, "num_tokens": 67089958.0, "step": 29295 }, { "entropy": 5.738266849517823, "epoch": 2.89640173981811, "grad_norm": 1.0546875, "learning_rate": 0.00041701811432757964, "loss": 5.0119, "mean_token_accuracy": 0.2174461379647255, "num_tokens": 67101672.0, "step": 29300 }, { "entropy": 5.689097547531128, "epoch": 2.896896006326611, "grad_norm": 1.15625, "learning_rate": 0.0004169907407200456, "loss": 4.9399, "mean_token_accuracy": 0.2195773258805275, "num_tokens": 67113334.0, "step": 29305 }, { "entropy": 5.77873125076294, "epoch": 2.897390272835113, "grad_norm": 1.171875, "learning_rate": 0.00041696336361951727, "loss": 5.0262, "mean_token_accuracy": 0.2111230507493019, "num_tokens": 67123880.0, "step": 29310 }, { "entropy": 5.718956518173218, "epoch": 2.897884539343614, "grad_norm": 1.1171875, "learning_rate": 0.0004169359830266682, "loss": 5.0008, "mean_token_accuracy": 0.21950687915086747, "num_tokens": 67134966.0, "step": 29315 }, { "entropy": 5.675970983505249, "epoch": 2.8983788058521154, "grad_norm": 1.1875, "learning_rate": 0.0004169085989421719, "loss": 4.9608, "mean_token_accuracy": 0.22214278429746628, "num_tokens": 67145407.0, "step": 29320 }, { "entropy": 5.692808389663696, "epoch": 2.898873072360617, "grad_norm": 1.1640625, "learning_rate": 0.0004168812113667021, "loss": 4.9868, "mean_token_accuracy": 0.2174471840262413, "num_tokens": 67156201.0, "step": 29325 }, { "entropy": 5.65477180480957, "epoch": 2.8993673388691183, "grad_norm": 1.0546875, "learning_rate": 0.00041685382030093245, "loss": 4.9765, "mean_token_accuracy": 0.2209431856870651, "num_tokens": 67168851.0, "step": 29330 }, { "entropy": 5.586418724060058, "epoch": 2.8998616053776196, "grad_norm": 1.171875, "learning_rate": 0.00041682642574553683, "loss": 4.8427, "mean_token_accuracy": 0.23947807550430297, "num_tokens": 67180559.0, "step": 29335 }, { "entropy": 5.734999465942383, "epoch": 2.900355871886121, "grad_norm": 1.125, "learning_rate": 0.00041679902770118914, "loss": 5.0154, "mean_token_accuracy": 0.21532484292984008, "num_tokens": 67192494.0, "step": 29340 }, { "entropy": 5.705340003967285, "epoch": 2.900850138394622, "grad_norm": 1.1796875, "learning_rate": 0.00041677162616856337, "loss": 4.9741, "mean_token_accuracy": 0.22153246104717256, "num_tokens": 67203846.0, "step": 29345 }, { "entropy": 5.73865761756897, "epoch": 2.901344404903124, "grad_norm": 1.0703125, "learning_rate": 0.00041674422114833357, "loss": 4.9761, "mean_token_accuracy": 0.22285375297069548, "num_tokens": 67214528.0, "step": 29350 }, { "entropy": 5.745752811431885, "epoch": 2.901838671411625, "grad_norm": 1.078125, "learning_rate": 0.0004167168126411739, "loss": 5.035, "mean_token_accuracy": 0.21285356879234313, "num_tokens": 67225798.0, "step": 29355 }, { "entropy": 5.805123901367187, "epoch": 2.902332937920127, "grad_norm": 1.1953125, "learning_rate": 0.0004166894006477587, "loss": 5.1185, "mean_token_accuracy": 0.21292482018470765, "num_tokens": 67237245.0, "step": 29360 }, { "entropy": 5.754734039306641, "epoch": 2.902827204428628, "grad_norm": 1.140625, "learning_rate": 0.0004166619851687623, "loss": 5.0175, "mean_token_accuracy": 0.21246568262577056, "num_tokens": 67249741.0, "step": 29365 }, { "entropy": 5.767901468276977, "epoch": 2.9033214709371293, "grad_norm": 1.078125, "learning_rate": 0.00041663456620485913, "loss": 5.0714, "mean_token_accuracy": 0.21601364612579346, "num_tokens": 67261452.0, "step": 29370 }, { "entropy": 5.728582048416138, "epoch": 2.9038157374456306, "grad_norm": 1.0, "learning_rate": 0.0004166071437567236, "loss": 5.0075, "mean_token_accuracy": 0.216458822786808, "num_tokens": 67273420.0, "step": 29375 }, { "entropy": 5.752809047698975, "epoch": 2.904310003954132, "grad_norm": 1.1015625, "learning_rate": 0.0004165797178250303, "loss": 5.0556, "mean_token_accuracy": 0.21285313069820405, "num_tokens": 67284853.0, "step": 29380 }, { "entropy": 5.65129976272583, "epoch": 2.9048042704626336, "grad_norm": 1.21875, "learning_rate": 0.00041655228841045404, "loss": 4.872, "mean_token_accuracy": 0.23664825558662414, "num_tokens": 67295956.0, "step": 29385 }, { "entropy": 5.706582689285279, "epoch": 2.905298536971135, "grad_norm": 1.15625, "learning_rate": 0.00041652485551366955, "loss": 5.0078, "mean_token_accuracy": 0.2241780012845993, "num_tokens": 67307150.0, "step": 29390 }, { "entropy": 5.681396055221557, "epoch": 2.905792803479636, "grad_norm": 1.078125, "learning_rate": 0.0004164974191353516, "loss": 4.8797, "mean_token_accuracy": 0.22783144414424897, "num_tokens": 67318012.0, "step": 29395 }, { "entropy": 5.677178525924683, "epoch": 2.906287069988138, "grad_norm": 1.0859375, "learning_rate": 0.0004164699792761753, "loss": 4.9724, "mean_token_accuracy": 0.22274019867181777, "num_tokens": 67331335.0, "step": 29400 }, { "entropy": 5.762203931808472, "epoch": 2.906781336496639, "grad_norm": 1.2109375, "learning_rate": 0.00041644253593681543, "loss": 5.0354, "mean_token_accuracy": 0.2137201175093651, "num_tokens": 67342595.0, "step": 29405 }, { "entropy": 5.706224632263184, "epoch": 2.9072756030051403, "grad_norm": 1.046875, "learning_rate": 0.00041641508911794724, "loss": 4.9878, "mean_token_accuracy": 0.22095876187086105, "num_tokens": 67355620.0, "step": 29410 }, { "entropy": 5.722298336029053, "epoch": 2.9077698695136416, "grad_norm": 1.2578125, "learning_rate": 0.000416387638820246, "loss": 4.9858, "mean_token_accuracy": 0.21738834232091903, "num_tokens": 67366600.0, "step": 29415 }, { "entropy": 5.73576250076294, "epoch": 2.9082641360221433, "grad_norm": 1.2109375, "learning_rate": 0.00041636018504438683, "loss": 5.015, "mean_token_accuracy": 0.21352139115333557, "num_tokens": 67377122.0, "step": 29420 }, { "entropy": 5.698271083831787, "epoch": 2.9087584025306445, "grad_norm": 1.2890625, "learning_rate": 0.0004163327277910452, "loss": 5.0549, "mean_token_accuracy": 0.21910945177078248, "num_tokens": 67387572.0, "step": 29425 }, { "entropy": 5.680827045440674, "epoch": 2.909252669039146, "grad_norm": 1.0859375, "learning_rate": 0.00041630526706089657, "loss": 4.9124, "mean_token_accuracy": 0.2211971253156662, "num_tokens": 67399608.0, "step": 29430 }, { "entropy": 5.772811841964722, "epoch": 2.9097469355476475, "grad_norm": 1.1328125, "learning_rate": 0.00041627780285461645, "loss": 5.0569, "mean_token_accuracy": 0.20994145572185516, "num_tokens": 67410144.0, "step": 29435 }, { "entropy": 5.725733041763306, "epoch": 2.910241202056149, "grad_norm": 1.2421875, "learning_rate": 0.00041625033517288045, "loss": 4.9767, "mean_token_accuracy": 0.2218368634581566, "num_tokens": 67422777.0, "step": 29440 }, { "entropy": 5.739725732803345, "epoch": 2.91073546856465, "grad_norm": 1.09375, "learning_rate": 0.0004162228640163643, "loss": 5.0708, "mean_token_accuracy": 0.21369231045246123, "num_tokens": 67434226.0, "step": 29445 }, { "entropy": 5.803880596160889, "epoch": 2.9112297350731513, "grad_norm": 1.1171875, "learning_rate": 0.0004161953893857438, "loss": 5.0736, "mean_token_accuracy": 0.22120934575796128, "num_tokens": 67445316.0, "step": 29450 }, { "entropy": 5.765415287017822, "epoch": 2.9117240015816526, "grad_norm": 1.2109375, "learning_rate": 0.0004161679112816948, "loss": 5.0449, "mean_token_accuracy": 0.21660278737545013, "num_tokens": 67456973.0, "step": 29455 }, { "entropy": 5.66401891708374, "epoch": 2.9122182680901543, "grad_norm": 1.2109375, "learning_rate": 0.00041614042970489326, "loss": 4.8786, "mean_token_accuracy": 0.2321219265460968, "num_tokens": 67468134.0, "step": 29460 }, { "entropy": 5.735815334320068, "epoch": 2.9127125345986555, "grad_norm": 1.21875, "learning_rate": 0.00041611294465601525, "loss": 5.062, "mean_token_accuracy": 0.20952952057123184, "num_tokens": 67479973.0, "step": 29465 }, { "entropy": 5.732098054885864, "epoch": 2.9132068011071572, "grad_norm": 1.1953125, "learning_rate": 0.00041608545613573694, "loss": 5.0028, "mean_token_accuracy": 0.2230370044708252, "num_tokens": 67491469.0, "step": 29470 }, { "entropy": 5.724022054672242, "epoch": 2.9137010676156585, "grad_norm": 1.1796875, "learning_rate": 0.0004160579641447345, "loss": 5.0854, "mean_token_accuracy": 0.21310922652482986, "num_tokens": 67502911.0, "step": 29475 }, { "entropy": 5.820222473144531, "epoch": 2.9141953341241598, "grad_norm": 1.2734375, "learning_rate": 0.00041603046868368427, "loss": 5.1069, "mean_token_accuracy": 0.2115452527999878, "num_tokens": 67513958.0, "step": 29480 }, { "entropy": 5.76347713470459, "epoch": 2.914689600632661, "grad_norm": 1.1328125, "learning_rate": 0.00041600296975326267, "loss": 5.0072, "mean_token_accuracy": 0.22098410427570342, "num_tokens": 67524894.0, "step": 29485 }, { "entropy": 5.733859825134277, "epoch": 2.9151838671411623, "grad_norm": 1.140625, "learning_rate": 0.0004159754673541461, "loss": 4.9302, "mean_token_accuracy": 0.2239797070622444, "num_tokens": 67536256.0, "step": 29490 }, { "entropy": 5.690882682800293, "epoch": 2.915678133649664, "grad_norm": 1.0859375, "learning_rate": 0.00041594796148701116, "loss": 4.9735, "mean_token_accuracy": 0.22068268656730652, "num_tokens": 67548064.0, "step": 29495 }, { "entropy": 5.733793497085571, "epoch": 2.9161724001581653, "grad_norm": 1.0859375, "learning_rate": 0.0004159204521525345, "loss": 5.002, "mean_token_accuracy": 0.21627732664346694, "num_tokens": 67559530.0, "step": 29500 }, { "entropy": 5.787374687194824, "epoch": 2.9166666666666665, "grad_norm": 1.1328125, "learning_rate": 0.0004158929393513929, "loss": 5.0942, "mean_token_accuracy": 0.2177201732993126, "num_tokens": 67571633.0, "step": 29505 }, { "entropy": 5.727038717269897, "epoch": 2.9171609331751682, "grad_norm": 1.140625, "learning_rate": 0.00041586542308426306, "loss": 4.9668, "mean_token_accuracy": 0.21750555634498597, "num_tokens": 67583778.0, "step": 29510 }, { "entropy": 5.6886971950531, "epoch": 2.9176551996836695, "grad_norm": 1.0859375, "learning_rate": 0.00041583790335182196, "loss": 4.9204, "mean_token_accuracy": 0.2265894040465355, "num_tokens": 67595803.0, "step": 29515 }, { "entropy": 5.68999171257019, "epoch": 2.9181494661921707, "grad_norm": 1.2109375, "learning_rate": 0.00041581038015474673, "loss": 4.9927, "mean_token_accuracy": 0.21940671950578688, "num_tokens": 67606030.0, "step": 29520 }, { "entropy": 5.773620367050171, "epoch": 2.918643732700672, "grad_norm": 1.1328125, "learning_rate": 0.00041578285349371414, "loss": 5.0966, "mean_token_accuracy": 0.21141974925994872, "num_tokens": 67617632.0, "step": 29525 }, { "entropy": 5.768137788772583, "epoch": 2.9191379992091737, "grad_norm": 1.15625, "learning_rate": 0.0004157553233694016, "loss": 4.9726, "mean_token_accuracy": 0.22305114716291427, "num_tokens": 67627954.0, "step": 29530 }, { "entropy": 5.709478759765625, "epoch": 2.919632265717675, "grad_norm": 1.125, "learning_rate": 0.0004157277897824862, "loss": 4.9754, "mean_token_accuracy": 0.2175694853067398, "num_tokens": 67639180.0, "step": 29535 }, { "entropy": 5.679262018203735, "epoch": 2.9201265322261762, "grad_norm": 1.0390625, "learning_rate": 0.0004157002527336454, "loss": 5.0656, "mean_token_accuracy": 0.21360366940498351, "num_tokens": 67651834.0, "step": 29540 }, { "entropy": 5.703747892379761, "epoch": 2.920620798734678, "grad_norm": 1.046875, "learning_rate": 0.00041567271222355657, "loss": 4.9665, "mean_token_accuracy": 0.22111957669258117, "num_tokens": 67663263.0, "step": 29545 }, { "entropy": 5.750272464752197, "epoch": 2.921115065243179, "grad_norm": 1.2109375, "learning_rate": 0.0004156451682528971, "loss": 4.9912, "mean_token_accuracy": 0.21966143399477006, "num_tokens": 67673970.0, "step": 29550 }, { "entropy": 5.844485092163086, "epoch": 2.9216093317516805, "grad_norm": 1.25, "learning_rate": 0.00041561762082234467, "loss": 5.085, "mean_token_accuracy": 0.21227838546037675, "num_tokens": 67685668.0, "step": 29555 }, { "entropy": 5.7038818359375, "epoch": 2.9221035982601817, "grad_norm": 1.1796875, "learning_rate": 0.000415590069932577, "loss": 4.9207, "mean_token_accuracy": 0.23047964721918107, "num_tokens": 67696169.0, "step": 29560 }, { "entropy": 5.7554121017456055, "epoch": 2.9225978647686834, "grad_norm": 1.1875, "learning_rate": 0.0004155625155842719, "loss": 5.0363, "mean_token_accuracy": 0.20834168195724487, "num_tokens": 67709211.0, "step": 29565 }, { "entropy": 5.6942955493927006, "epoch": 2.9230921312771847, "grad_norm": 1.171875, "learning_rate": 0.000415534957778107, "loss": 5.073, "mean_token_accuracy": 0.21190536618232728, "num_tokens": 67720967.0, "step": 29570 }, { "entropy": 5.7143402099609375, "epoch": 2.923586397785686, "grad_norm": 1.1640625, "learning_rate": 0.0004155073965147604, "loss": 4.9244, "mean_token_accuracy": 0.22879833728075027, "num_tokens": 67733099.0, "step": 29575 }, { "entropy": 5.725629758834839, "epoch": 2.9240806642941877, "grad_norm": 1.1796875, "learning_rate": 0.00041547983179491, "loss": 4.9964, "mean_token_accuracy": 0.22062858641147615, "num_tokens": 67744739.0, "step": 29580 }, { "entropy": 5.71390118598938, "epoch": 2.924574930802689, "grad_norm": 1.1953125, "learning_rate": 0.00041545226361923394, "loss": 5.0524, "mean_token_accuracy": 0.21765577793121338, "num_tokens": 67756944.0, "step": 29585 }, { "entropy": 5.759599828720093, "epoch": 2.92506919731119, "grad_norm": 1.203125, "learning_rate": 0.00041542469198841043, "loss": 5.0872, "mean_token_accuracy": 0.2140345796942711, "num_tokens": 67769018.0, "step": 29590 }, { "entropy": 5.749445295333862, "epoch": 2.9255634638196915, "grad_norm": 1.09375, "learning_rate": 0.0004153971169031177, "loss": 4.9802, "mean_token_accuracy": 0.22066487073898317, "num_tokens": 67780164.0, "step": 29595 }, { "entropy": 5.750535154342652, "epoch": 2.9260577303281927, "grad_norm": 1.328125, "learning_rate": 0.0004153695383640341, "loss": 5.0121, "mean_token_accuracy": 0.21774566620588304, "num_tokens": 67790841.0, "step": 29600 }, { "entropy": 5.729867696762085, "epoch": 2.9265519968366944, "grad_norm": 1.1640625, "learning_rate": 0.00041534195637183807, "loss": 5.0055, "mean_token_accuracy": 0.2202119156718254, "num_tokens": 67802397.0, "step": 29605 }, { "entropy": 5.741932487487793, "epoch": 2.9270462633451957, "grad_norm": 1.3203125, "learning_rate": 0.0004153143709272082, "loss": 5.0324, "mean_token_accuracy": 0.22103935480117798, "num_tokens": 67814079.0, "step": 29610 }, { "entropy": 5.77334508895874, "epoch": 2.927540529853697, "grad_norm": 1.1328125, "learning_rate": 0.000415286782030823, "loss": 5.0724, "mean_token_accuracy": 0.2096322998404503, "num_tokens": 67825377.0, "step": 29615 }, { "entropy": 5.687475776672363, "epoch": 2.9280347963621987, "grad_norm": 1.0625, "learning_rate": 0.00041525918968336116, "loss": 4.9743, "mean_token_accuracy": 0.22541534453630446, "num_tokens": 67838277.0, "step": 29620 }, { "entropy": 5.764729309082031, "epoch": 2.9285290628707, "grad_norm": 1.109375, "learning_rate": 0.00041523159388550155, "loss": 5.0215, "mean_token_accuracy": 0.21633100956678392, "num_tokens": 67849720.0, "step": 29625 }, { "entropy": 5.731776762008667, "epoch": 2.929023329379201, "grad_norm": 1.125, "learning_rate": 0.00041520399463792297, "loss": 4.9545, "mean_token_accuracy": 0.22855816781520844, "num_tokens": 67860994.0, "step": 29630 }, { "entropy": 5.693594598770142, "epoch": 2.9295175958877024, "grad_norm": 1.015625, "learning_rate": 0.00041517639194130435, "loss": 5.0656, "mean_token_accuracy": 0.21111013740301132, "num_tokens": 67874445.0, "step": 29635 }, { "entropy": 5.7159360408782955, "epoch": 2.930011862396204, "grad_norm": 1.1171875, "learning_rate": 0.00041514878579632477, "loss": 4.9581, "mean_token_accuracy": 0.22365018129348754, "num_tokens": 67886789.0, "step": 29640 }, { "entropy": 5.79415192604065, "epoch": 2.9305061289047054, "grad_norm": 1.2109375, "learning_rate": 0.0004151211762036632, "loss": 5.0244, "mean_token_accuracy": 0.22314428687095642, "num_tokens": 67898839.0, "step": 29645 }, { "entropy": 5.712095546722412, "epoch": 2.9310003954132067, "grad_norm": 1.171875, "learning_rate": 0.00041509356316399916, "loss": 5.0443, "mean_token_accuracy": 0.21280768662691116, "num_tokens": 67909419.0, "step": 29650 }, { "entropy": 5.690729808807373, "epoch": 2.9314946619217084, "grad_norm": 1.0703125, "learning_rate": 0.00041506594667801164, "loss": 5.003, "mean_token_accuracy": 0.2170872151851654, "num_tokens": 67922011.0, "step": 29655 }, { "entropy": 5.807738971710205, "epoch": 2.9319889284302096, "grad_norm": 1.0546875, "learning_rate": 0.00041503832674638, "loss": 5.1503, "mean_token_accuracy": 0.20964345186948777, "num_tokens": 67934445.0, "step": 29660 }, { "entropy": 5.801150846481323, "epoch": 2.932483194938711, "grad_norm": 1.140625, "learning_rate": 0.0004150107033697839, "loss": 5.0834, "mean_token_accuracy": 0.21272073090076446, "num_tokens": 67944914.0, "step": 29665 }, { "entropy": 5.711522579193115, "epoch": 2.932977461447212, "grad_norm": 1.2109375, "learning_rate": 0.0004149830765489028, "loss": 5.0123, "mean_token_accuracy": 0.21578700840473175, "num_tokens": 67955375.0, "step": 29670 }, { "entropy": 5.7317736625671385, "epoch": 2.933471727955714, "grad_norm": 1.1484375, "learning_rate": 0.00041495544628441627, "loss": 4.9973, "mean_token_accuracy": 0.2219604343175888, "num_tokens": 67968453.0, "step": 29675 }, { "entropy": 5.775078678131104, "epoch": 2.933965994464215, "grad_norm": 1.1640625, "learning_rate": 0.00041492781257700405, "loss": 5.0291, "mean_token_accuracy": 0.2121727705001831, "num_tokens": 67979099.0, "step": 29680 }, { "entropy": 5.756981468200683, "epoch": 2.9344602609727164, "grad_norm": 1.0625, "learning_rate": 0.00041490017542734594, "loss": 4.9867, "mean_token_accuracy": 0.2151431143283844, "num_tokens": 67989399.0, "step": 29685 }, { "entropy": 5.686401987075806, "epoch": 2.934954527481218, "grad_norm": 1.1796875, "learning_rate": 0.00041487253483612173, "loss": 4.9161, "mean_token_accuracy": 0.2286037415266037, "num_tokens": 68001255.0, "step": 29690 }, { "entropy": 5.721219635009765, "epoch": 2.9354487939897194, "grad_norm": 1.125, "learning_rate": 0.0004148448908040116, "loss": 5.0214, "mean_token_accuracy": 0.21575491577386857, "num_tokens": 68012844.0, "step": 29695 }, { "entropy": 5.660803365707397, "epoch": 2.9359430604982206, "grad_norm": 1.2421875, "learning_rate": 0.0004148172433316954, "loss": 5.0028, "mean_token_accuracy": 0.21902500689029694, "num_tokens": 68024986.0, "step": 29700 }, { "entropy": 5.722166681289673, "epoch": 2.936437327006722, "grad_norm": 1.078125, "learning_rate": 0.0004147895924198533, "loss": 4.9772, "mean_token_accuracy": 0.2258203700184822, "num_tokens": 68036081.0, "step": 29705 }, { "entropy": 5.746487092971802, "epoch": 2.936931593515223, "grad_norm": 1.0625, "learning_rate": 0.00041476193806916557, "loss": 5.0139, "mean_token_accuracy": 0.21699535101652145, "num_tokens": 68049054.0, "step": 29710 }, { "entropy": 5.756295967102051, "epoch": 2.937425860023725, "grad_norm": 1.15625, "learning_rate": 0.0004147342802803124, "loss": 5.0417, "mean_token_accuracy": 0.21462388038635255, "num_tokens": 68060440.0, "step": 29715 }, { "entropy": 5.696961212158203, "epoch": 2.937920126532226, "grad_norm": 1.2421875, "learning_rate": 0.0004147066190539744, "loss": 5.0171, "mean_token_accuracy": 0.22197043150663376, "num_tokens": 68072260.0, "step": 29720 }, { "entropy": 5.7434087753295895, "epoch": 2.938414393040728, "grad_norm": 1.1015625, "learning_rate": 0.0004146789543908318, "loss": 4.9783, "mean_token_accuracy": 0.2180328756570816, "num_tokens": 68084737.0, "step": 29725 }, { "entropy": 5.723550844192505, "epoch": 2.938908659549229, "grad_norm": 1.0859375, "learning_rate": 0.0004146512862915653, "loss": 4.971, "mean_token_accuracy": 0.22655564397573472, "num_tokens": 68097146.0, "step": 29730 }, { "entropy": 5.797867250442505, "epoch": 2.9394029260577303, "grad_norm": 1.2421875, "learning_rate": 0.0004146236147568554, "loss": 5.0813, "mean_token_accuracy": 0.21524348855018616, "num_tokens": 68108158.0, "step": 29735 }, { "entropy": 5.650473928451538, "epoch": 2.9398971925662316, "grad_norm": 1.1171875, "learning_rate": 0.0004145959397873831, "loss": 4.9514, "mean_token_accuracy": 0.22025123238563538, "num_tokens": 68120242.0, "step": 29740 }, { "entropy": 5.725341749191284, "epoch": 2.940391459074733, "grad_norm": 1.1640625, "learning_rate": 0.00041456826138382884, "loss": 5.0677, "mean_token_accuracy": 0.20995645523071288, "num_tokens": 68131372.0, "step": 29745 }, { "entropy": 5.761231756210327, "epoch": 2.9408857255832346, "grad_norm": 1.15625, "learning_rate": 0.0004145405795468738, "loss": 5.0355, "mean_token_accuracy": 0.22340237945318223, "num_tokens": 68142828.0, "step": 29750 }, { "entropy": 5.7412913799285885, "epoch": 2.941379992091736, "grad_norm": 1.1484375, "learning_rate": 0.0004145128942771988, "loss": 5.0723, "mean_token_accuracy": 0.2066093862056732, "num_tokens": 68154398.0, "step": 29755 }, { "entropy": 5.727962589263916, "epoch": 2.941874258600237, "grad_norm": 1.1015625, "learning_rate": 0.000414485205575485, "loss": 5.0702, "mean_token_accuracy": 0.21236569583415985, "num_tokens": 68166645.0, "step": 29760 }, { "entropy": 5.767404222488404, "epoch": 2.942368525108739, "grad_norm": 1.140625, "learning_rate": 0.00041445751344241344, "loss": 4.9935, "mean_token_accuracy": 0.21915703415870666, "num_tokens": 68176800.0, "step": 29765 }, { "entropy": 5.7513994693756105, "epoch": 2.94286279161724, "grad_norm": 1.2265625, "learning_rate": 0.00041442981787866547, "loss": 5.0248, "mean_token_accuracy": 0.22235556244850158, "num_tokens": 68187933.0, "step": 29770 }, { "entropy": 5.772892999649048, "epoch": 2.9433570581257413, "grad_norm": 1.0546875, "learning_rate": 0.0004144021188849223, "loss": 5.1152, "mean_token_accuracy": 0.2070513352751732, "num_tokens": 68199925.0, "step": 29775 }, { "entropy": 5.669220209121704, "epoch": 2.9438513246342426, "grad_norm": 1.1171875, "learning_rate": 0.0004143744164618655, "loss": 4.9512, "mean_token_accuracy": 0.22645019143819808, "num_tokens": 68211313.0, "step": 29780 }, { "entropy": 5.726499795913696, "epoch": 2.9443455911427443, "grad_norm": 1.15625, "learning_rate": 0.00041434671061017634, "loss": 5.0455, "mean_token_accuracy": 0.2142818436026573, "num_tokens": 68223148.0, "step": 29785 }, { "entropy": 5.711609363555908, "epoch": 2.9448398576512456, "grad_norm": 1.0859375, "learning_rate": 0.0004143190013305364, "loss": 4.9969, "mean_token_accuracy": 0.22075555771589278, "num_tokens": 68234369.0, "step": 29790 }, { "entropy": 5.775344753265381, "epoch": 2.945334124159747, "grad_norm": 1.234375, "learning_rate": 0.00041429128862362756, "loss": 4.9984, "mean_token_accuracy": 0.21884723305702208, "num_tokens": 68243903.0, "step": 29795 }, { "entropy": 5.754987096786499, "epoch": 2.9458283906682485, "grad_norm": 1.0859375, "learning_rate": 0.0004142635724901313, "loss": 4.9937, "mean_token_accuracy": 0.21506194025278091, "num_tokens": 68254997.0, "step": 29800 }, { "entropy": 5.646459341049194, "epoch": 2.94632265717675, "grad_norm": 1.171875, "learning_rate": 0.0004142358529307296, "loss": 4.9432, "mean_token_accuracy": 0.22475767284631729, "num_tokens": 68266203.0, "step": 29805 }, { "entropy": 5.760909748077393, "epoch": 2.946816923685251, "grad_norm": 1.3046875, "learning_rate": 0.0004142081299461044, "loss": 4.9987, "mean_token_accuracy": 0.22593790292739868, "num_tokens": 68275930.0, "step": 29810 }, { "entropy": 5.760689353942871, "epoch": 2.9473111901937523, "grad_norm": 1.15625, "learning_rate": 0.0004141804035369375, "loss": 5.0057, "mean_token_accuracy": 0.22065238207578658, "num_tokens": 68287468.0, "step": 29815 }, { "entropy": 5.702890872955322, "epoch": 2.9478054567022536, "grad_norm": 1.203125, "learning_rate": 0.0004141526737039111, "loss": 4.9535, "mean_token_accuracy": 0.2214091032743454, "num_tokens": 68299151.0, "step": 29820 }, { "entropy": 5.7437779903411865, "epoch": 2.9482997232107553, "grad_norm": 1.1953125, "learning_rate": 0.0004141249404477074, "loss": 5.0733, "mean_token_accuracy": 0.20754510313272476, "num_tokens": 68310874.0, "step": 29825 }, { "entropy": 5.758662700653076, "epoch": 2.9487939897192565, "grad_norm": 1.0390625, "learning_rate": 0.0004140972037690085, "loss": 4.9881, "mean_token_accuracy": 0.2190428927540779, "num_tokens": 68323449.0, "step": 29830 }, { "entropy": 5.703635358810425, "epoch": 2.9492882562277583, "grad_norm": 1.1484375, "learning_rate": 0.00041406946366849686, "loss": 5.0106, "mean_token_accuracy": 0.22204073369503022, "num_tokens": 68334799.0, "step": 29835 }, { "entropy": 5.650119876861572, "epoch": 2.9497825227362595, "grad_norm": 1.1796875, "learning_rate": 0.00041404172014685483, "loss": 4.9752, "mean_token_accuracy": 0.22216772437095642, "num_tokens": 68348019.0, "step": 29840 }, { "entropy": 5.835838270187378, "epoch": 2.9502767892447608, "grad_norm": 1.171875, "learning_rate": 0.0004140139732047649, "loss": 5.0325, "mean_token_accuracy": 0.21513766646385193, "num_tokens": 68360969.0, "step": 29845 }, { "entropy": 5.781921434402466, "epoch": 2.950771055753262, "grad_norm": 1.15625, "learning_rate": 0.0004139862228429097, "loss": 5.0348, "mean_token_accuracy": 0.2189636528491974, "num_tokens": 68373245.0, "step": 29850 }, { "entropy": 5.694391107559204, "epoch": 2.9512653222617633, "grad_norm": 1.078125, "learning_rate": 0.00041395846906197174, "loss": 4.9618, "mean_token_accuracy": 0.22050405740737916, "num_tokens": 68385278.0, "step": 29855 }, { "entropy": 5.716791868209839, "epoch": 2.951759588770265, "grad_norm": 1.1484375, "learning_rate": 0.00041393071186263396, "loss": 4.976, "mean_token_accuracy": 0.22127410620450974, "num_tokens": 68396624.0, "step": 29860 }, { "entropy": 5.715279388427734, "epoch": 2.9522538552787663, "grad_norm": 1.15625, "learning_rate": 0.0004139029512455791, "loss": 4.9748, "mean_token_accuracy": 0.21673957705497743, "num_tokens": 68408656.0, "step": 29865 }, { "entropy": 5.710910654067993, "epoch": 2.9527481217872675, "grad_norm": 1.1484375, "learning_rate": 0.0004138751872114902, "loss": 4.9287, "mean_token_accuracy": 0.2239289700984955, "num_tokens": 68421150.0, "step": 29870 }, { "entropy": 5.795772886276245, "epoch": 2.9532423882957692, "grad_norm": 1.1640625, "learning_rate": 0.00041384741976105004, "loss": 5.0193, "mean_token_accuracy": 0.2085531085729599, "num_tokens": 68432446.0, "step": 29875 }, { "entropy": 5.724555015563965, "epoch": 2.9537366548042705, "grad_norm": 1.125, "learning_rate": 0.00041381964889494185, "loss": 5.0491, "mean_token_accuracy": 0.2138671189546585, "num_tokens": 68443508.0, "step": 29880 }, { "entropy": 5.7088744163513185, "epoch": 2.9542309213127718, "grad_norm": 1.171875, "learning_rate": 0.0004137918746138487, "loss": 5.0235, "mean_token_accuracy": 0.21643654257059097, "num_tokens": 68454425.0, "step": 29885 }, { "entropy": 5.717440795898438, "epoch": 2.954725187821273, "grad_norm": 1.1796875, "learning_rate": 0.00041376409691845395, "loss": 5.0, "mean_token_accuracy": 0.2169597178697586, "num_tokens": 68467759.0, "step": 29890 }, { "entropy": 5.738907146453857, "epoch": 2.9552194543297747, "grad_norm": 1.328125, "learning_rate": 0.00041373631580944093, "loss": 4.9924, "mean_token_accuracy": 0.22265892326831818, "num_tokens": 68478447.0, "step": 29895 }, { "entropy": 5.772379779815674, "epoch": 2.955713720838276, "grad_norm": 1.2265625, "learning_rate": 0.000413708531287493, "loss": 5.0894, "mean_token_accuracy": 0.21027482002973558, "num_tokens": 68489056.0, "step": 29900 }, { "entropy": 5.775525379180908, "epoch": 2.9562079873467773, "grad_norm": 1.1328125, "learning_rate": 0.0004136807433532936, "loss": 5.0801, "mean_token_accuracy": 0.21107235848903655, "num_tokens": 68500697.0, "step": 29905 }, { "entropy": 5.756763601303101, "epoch": 2.956702253855279, "grad_norm": 1.2734375, "learning_rate": 0.0004136529520075265, "loss": 4.9901, "mean_token_accuracy": 0.21894254833459853, "num_tokens": 68510594.0, "step": 29910 }, { "entropy": 5.708130311965943, "epoch": 2.9571965203637802, "grad_norm": 1.21875, "learning_rate": 0.00041362515725087523, "loss": 5.031, "mean_token_accuracy": 0.2129152312874794, "num_tokens": 68521293.0, "step": 29915 }, { "entropy": 5.676908922195435, "epoch": 2.9576907868722815, "grad_norm": 1.125, "learning_rate": 0.00041359735908402356, "loss": 4.9576, "mean_token_accuracy": 0.2282138541340828, "num_tokens": 68532380.0, "step": 29920 }, { "entropy": 5.721704626083374, "epoch": 2.9581850533807827, "grad_norm": 1.1796875, "learning_rate": 0.00041356955750765535, "loss": 4.9898, "mean_token_accuracy": 0.22226012051105498, "num_tokens": 68543510.0, "step": 29925 }, { "entropy": 5.752847003936767, "epoch": 2.9586793198892845, "grad_norm": 1.171875, "learning_rate": 0.0004135417525224546, "loss": 5.0811, "mean_token_accuracy": 0.2115839973092079, "num_tokens": 68556191.0, "step": 29930 }, { "entropy": 5.803689908981323, "epoch": 2.9591735863977857, "grad_norm": 1.1328125, "learning_rate": 0.0004135139441291052, "loss": 5.1284, "mean_token_accuracy": 0.21017372608184814, "num_tokens": 68568225.0, "step": 29935 }, { "entropy": 5.830569839477539, "epoch": 2.959667852906287, "grad_norm": 1.28125, "learning_rate": 0.0004134861323282913, "loss": 5.0542, "mean_token_accuracy": 0.2075226843357086, "num_tokens": 68580040.0, "step": 29940 }, { "entropy": 5.724698066711426, "epoch": 2.9601621194147887, "grad_norm": 1.171875, "learning_rate": 0.00041345831712069696, "loss": 4.9787, "mean_token_accuracy": 0.21417305916547774, "num_tokens": 68590338.0, "step": 29945 }, { "entropy": 5.716367387771607, "epoch": 2.96065638592329, "grad_norm": 1.2265625, "learning_rate": 0.00041343049850700673, "loss": 5.032, "mean_token_accuracy": 0.21398171931505203, "num_tokens": 68601153.0, "step": 29950 }, { "entropy": 5.741646385192871, "epoch": 2.961150652431791, "grad_norm": 1.21875, "learning_rate": 0.00041340267648790464, "loss": 5.0177, "mean_token_accuracy": 0.21677428632974624, "num_tokens": 68612665.0, "step": 29955 }, { "entropy": 5.732406806945801, "epoch": 2.9616449189402925, "grad_norm": 1.1328125, "learning_rate": 0.0004133748510640752, "loss": 4.9535, "mean_token_accuracy": 0.22279123812913895, "num_tokens": 68624229.0, "step": 29960 }, { "entropy": 5.762173461914062, "epoch": 2.9621391854487937, "grad_norm": 1.0390625, "learning_rate": 0.00041334702223620306, "loss": 5.0416, "mean_token_accuracy": 0.21539605855941774, "num_tokens": 68635811.0, "step": 29965 }, { "entropy": 5.697637367248535, "epoch": 2.9626334519572954, "grad_norm": 1.1328125, "learning_rate": 0.00041331919000497263, "loss": 4.9627, "mean_token_accuracy": 0.2201569750905037, "num_tokens": 68647518.0, "step": 29970 }, { "entropy": 5.791468477249145, "epoch": 2.9631277184657967, "grad_norm": 1.1484375, "learning_rate": 0.00041329135437106866, "loss": 5.1573, "mean_token_accuracy": 0.21058289855718612, "num_tokens": 68658739.0, "step": 29975 }, { "entropy": 5.696962356567383, "epoch": 2.9636219849742984, "grad_norm": 1.0859375, "learning_rate": 0.00041326351533517604, "loss": 4.9507, "mean_token_accuracy": 0.23010381013154985, "num_tokens": 68670317.0, "step": 29980 }, { "entropy": 5.692986488342285, "epoch": 2.9641162514827997, "grad_norm": 1.21875, "learning_rate": 0.0004132356728979794, "loss": 4.9767, "mean_token_accuracy": 0.22743176370859147, "num_tokens": 68681584.0, "step": 29985 }, { "entropy": 5.6973104000091555, "epoch": 2.964610517991301, "grad_norm": 1.0390625, "learning_rate": 0.00041320782706016375, "loss": 4.9477, "mean_token_accuracy": 0.2273889109492302, "num_tokens": 68694296.0, "step": 29990 }, { "entropy": 5.626551961898803, "epoch": 2.965104784499802, "grad_norm": 1.0390625, "learning_rate": 0.0004131799778224142, "loss": 4.8942, "mean_token_accuracy": 0.22775945514440538, "num_tokens": 68705281.0, "step": 29995 }, { "entropy": 5.673750972747802, "epoch": 2.9655990510083035, "grad_norm": 1.140625, "learning_rate": 0.00041315212518541565, "loss": 4.8712, "mean_token_accuracy": 0.2273642435669899, "num_tokens": 68716146.0, "step": 30000 }, { "epoch": 2.9655990510083035, "eval_entropy": 5.471667922232277, "eval_loss": 5.042595863342285, "eval_mean_token_accuracy": 0.2259625170283652, "eval_num_tokens": 68716146.0, "eval_runtime": 20.5162, "eval_samples_per_second": 1584.749, "eval_steps_per_second": 198.136, "step": 30000 }, { "entropy": 5.669720983505249, "epoch": 2.966093317516805, "grad_norm": 1.09375, "learning_rate": 0.0004131242691498534, "loss": 4.9859, "mean_token_accuracy": 0.2254968464374542, "num_tokens": 68728812.0, "step": 30005 }, { "entropy": 5.704223203659057, "epoch": 2.9665875840253064, "grad_norm": 1.109375, "learning_rate": 0.00041309640971641276, "loss": 5.0302, "mean_token_accuracy": 0.2114323526620865, "num_tokens": 68741283.0, "step": 30010 }, { "entropy": 5.733886480331421, "epoch": 2.9670818505338077, "grad_norm": 1.2265625, "learning_rate": 0.000413068546885779, "loss": 4.936, "mean_token_accuracy": 0.22926866114139557, "num_tokens": 68752701.0, "step": 30015 }, { "entropy": 5.7278026103973385, "epoch": 2.9675761170423094, "grad_norm": 1.1875, "learning_rate": 0.0004130406806586375, "loss": 4.9257, "mean_token_accuracy": 0.23022190034389495, "num_tokens": 68763133.0, "step": 30020 }, { "entropy": 5.692061138153076, "epoch": 2.9680703835508107, "grad_norm": 1.0703125, "learning_rate": 0.000413012811035674, "loss": 4.973, "mean_token_accuracy": 0.2238582506775856, "num_tokens": 68774692.0, "step": 30025 }, { "entropy": 5.715055847167969, "epoch": 2.968564650059312, "grad_norm": 1.140625, "learning_rate": 0.0004129849380175738, "loss": 5.0143, "mean_token_accuracy": 0.21372091323137282, "num_tokens": 68786233.0, "step": 30030 }, { "entropy": 5.6613853931427, "epoch": 2.969058916567813, "grad_norm": 1.15625, "learning_rate": 0.0004129570616050227, "loss": 4.9752, "mean_token_accuracy": 0.21903624832630159, "num_tokens": 68799674.0, "step": 30035 }, { "entropy": 5.74995789527893, "epoch": 2.969553183076315, "grad_norm": 1.0078125, "learning_rate": 0.00041292918179870665, "loss": 5.0269, "mean_token_accuracy": 0.21365875899791717, "num_tokens": 68811163.0, "step": 30040 }, { "entropy": 5.763164901733399, "epoch": 2.970047449584816, "grad_norm": 1.2578125, "learning_rate": 0.0004129012985993112, "loss": 4.9906, "mean_token_accuracy": 0.21980062872171402, "num_tokens": 68822781.0, "step": 30045 }, { "entropy": 5.722312927246094, "epoch": 2.9705417160933174, "grad_norm": 1.09375, "learning_rate": 0.00041287341200752235, "loss": 5.0219, "mean_token_accuracy": 0.22174839079380035, "num_tokens": 68834908.0, "step": 30050 }, { "entropy": 5.649223279953003, "epoch": 2.971035982601819, "grad_norm": 1.1328125, "learning_rate": 0.00041284552202402634, "loss": 4.8753, "mean_token_accuracy": 0.2298997536301613, "num_tokens": 68844253.0, "step": 30055 }, { "entropy": 5.666108131408691, "epoch": 2.9715302491103204, "grad_norm": 1.140625, "learning_rate": 0.000412817628649509, "loss": 4.9491, "mean_token_accuracy": 0.22055847495794295, "num_tokens": 68856132.0, "step": 30060 }, { "entropy": 5.740057849884034, "epoch": 2.9720245156188216, "grad_norm": 1.140625, "learning_rate": 0.00041278973188465655, "loss": 5.0096, "mean_token_accuracy": 0.2179216966032982, "num_tokens": 68867536.0, "step": 30065 }, { "entropy": 5.662638092041016, "epoch": 2.972518782127323, "grad_norm": 1.0859375, "learning_rate": 0.0004127618317301555, "loss": 4.9999, "mean_token_accuracy": 0.22032577097415923, "num_tokens": 68880544.0, "step": 30070 }, { "entropy": 5.70892014503479, "epoch": 2.973013048635824, "grad_norm": 1.078125, "learning_rate": 0.00041273392818669193, "loss": 5.0849, "mean_token_accuracy": 0.21786096394062043, "num_tokens": 68890755.0, "step": 30075 }, { "entropy": 5.789656496047973, "epoch": 2.973507315144326, "grad_norm": 1.1484375, "learning_rate": 0.00041270602125495227, "loss": 5.0741, "mean_token_accuracy": 0.20461636632680893, "num_tokens": 68902280.0, "step": 30080 }, { "entropy": 5.8169135570526125, "epoch": 2.974001581652827, "grad_norm": 1.140625, "learning_rate": 0.00041267811093562325, "loss": 5.0686, "mean_token_accuracy": 0.21582219302654265, "num_tokens": 68913674.0, "step": 30085 }, { "entropy": 5.787605285644531, "epoch": 2.974495848161329, "grad_norm": 1.1875, "learning_rate": 0.00041265019722939127, "loss": 5.0144, "mean_token_accuracy": 0.22127629220485687, "num_tokens": 68925129.0, "step": 30090 }, { "entropy": 5.703379726409912, "epoch": 2.97499011466983, "grad_norm": 1.2578125, "learning_rate": 0.00041262228013694307, "loss": 4.9295, "mean_token_accuracy": 0.22230359315872192, "num_tokens": 68935157.0, "step": 30095 }, { "entropy": 5.6842700958251955, "epoch": 2.9754843811783314, "grad_norm": 1.2578125, "learning_rate": 0.00041259435965896555, "loss": 4.9811, "mean_token_accuracy": 0.2140813171863556, "num_tokens": 68946752.0, "step": 30100 }, { "entropy": 5.741587734222412, "epoch": 2.9759786476868326, "grad_norm": 1.109375, "learning_rate": 0.0004125664357961453, "loss": 4.9725, "mean_token_accuracy": 0.2192420557141304, "num_tokens": 68958078.0, "step": 30105 }, { "entropy": 5.778346347808838, "epoch": 2.976472914195334, "grad_norm": 1.09375, "learning_rate": 0.00041253850854916946, "loss": 5.0358, "mean_token_accuracy": 0.21373041868209838, "num_tokens": 68970384.0, "step": 30110 }, { "entropy": 5.71354489326477, "epoch": 2.9769671807038356, "grad_norm": 1.0390625, "learning_rate": 0.00041251057791872497, "loss": 4.9784, "mean_token_accuracy": 0.22338918894529342, "num_tokens": 68983209.0, "step": 30115 }, { "entropy": 5.800860261917114, "epoch": 2.977461447212337, "grad_norm": 1.2421875, "learning_rate": 0.00041248264390549884, "loss": 5.1121, "mean_token_accuracy": 0.2100605845451355, "num_tokens": 68994710.0, "step": 30120 }, { "entropy": 5.755162239074707, "epoch": 2.977955713720838, "grad_norm": 1.1015625, "learning_rate": 0.00041245470651017846, "loss": 5.0564, "mean_token_accuracy": 0.21620704382658004, "num_tokens": 69005457.0, "step": 30125 }, { "entropy": 5.732906341552734, "epoch": 2.97844998022934, "grad_norm": 1.09375, "learning_rate": 0.00041242676573345096, "loss": 4.9446, "mean_token_accuracy": 0.22765863239765166, "num_tokens": 69018379.0, "step": 30130 }, { "entropy": 5.778547525405884, "epoch": 2.978944246737841, "grad_norm": 1.1015625, "learning_rate": 0.0004123988215760036, "loss": 5.0539, "mean_token_accuracy": 0.20956070423126222, "num_tokens": 69029608.0, "step": 30135 }, { "entropy": 5.732872104644775, "epoch": 2.9794385132463423, "grad_norm": 1.234375, "learning_rate": 0.000412370874038524, "loss": 5.0022, "mean_token_accuracy": 0.2188788741827011, "num_tokens": 69040341.0, "step": 30140 }, { "entropy": 5.725385618209839, "epoch": 2.9799327797548436, "grad_norm": 1.2109375, "learning_rate": 0.00041234292312169964, "loss": 5.0606, "mean_token_accuracy": 0.21333449631929396, "num_tokens": 69050814.0, "step": 30145 }, { "entropy": 5.79220061302185, "epoch": 2.9804270462633453, "grad_norm": 1.03125, "learning_rate": 0.0004123149688262179, "loss": 5.0961, "mean_token_accuracy": 0.2071923092007637, "num_tokens": 69063087.0, "step": 30150 }, { "entropy": 5.7737102031707765, "epoch": 2.9809213127718466, "grad_norm": 1.078125, "learning_rate": 0.0004122870111527668, "loss": 5.0789, "mean_token_accuracy": 0.21390679329633713, "num_tokens": 69075342.0, "step": 30155 }, { "entropy": 5.778729104995728, "epoch": 2.981415579280348, "grad_norm": 1.125, "learning_rate": 0.00041225905010203385, "loss": 5.0641, "mean_token_accuracy": 0.20892024040222168, "num_tokens": 69087616.0, "step": 30160 }, { "entropy": 5.820131778717041, "epoch": 2.9819098457888495, "grad_norm": 1.078125, "learning_rate": 0.00041223108567470696, "loss": 5.008, "mean_token_accuracy": 0.21184780299663544, "num_tokens": 69099816.0, "step": 30165 }, { "entropy": 5.6977824687957765, "epoch": 2.982404112297351, "grad_norm": 1.1484375, "learning_rate": 0.00041220311787147407, "loss": 4.87, "mean_token_accuracy": 0.2336866959929466, "num_tokens": 69111806.0, "step": 30170 }, { "entropy": 5.706397294998169, "epoch": 2.982898378805852, "grad_norm": 1.0234375, "learning_rate": 0.0004121751466930232, "loss": 5.0203, "mean_token_accuracy": 0.21648335307836533, "num_tokens": 69123479.0, "step": 30175 }, { "entropy": 5.810094738006592, "epoch": 2.9833926453143533, "grad_norm": 1.125, "learning_rate": 0.0004121471721400424, "loss": 5.0997, "mean_token_accuracy": 0.20706073343753814, "num_tokens": 69134541.0, "step": 30180 }, { "entropy": 5.766567373275757, "epoch": 2.983886911822855, "grad_norm": 1.1796875, "learning_rate": 0.00041211919421322, "loss": 4.9664, "mean_token_accuracy": 0.2215376913547516, "num_tokens": 69144765.0, "step": 30185 }, { "entropy": 5.788903522491455, "epoch": 2.9843811783313563, "grad_norm": 1.140625, "learning_rate": 0.0004120912129132441, "loss": 5.0182, "mean_token_accuracy": 0.21651130467653273, "num_tokens": 69156761.0, "step": 30190 }, { "entropy": 5.713674116134643, "epoch": 2.9848754448398576, "grad_norm": 1.1171875, "learning_rate": 0.0004120632282408031, "loss": 4.9835, "mean_token_accuracy": 0.21852971613407135, "num_tokens": 69167968.0, "step": 30195 }, { "entropy": 5.741098546981812, "epoch": 2.9853697113483593, "grad_norm": 1.1796875, "learning_rate": 0.0004120352401965854, "loss": 5.024, "mean_token_accuracy": 0.22322219759225845, "num_tokens": 69178356.0, "step": 30200 }, { "entropy": 5.773768615722656, "epoch": 2.9858639778568605, "grad_norm": 1.1484375, "learning_rate": 0.00041200724878127953, "loss": 4.944, "mean_token_accuracy": 0.2318148359656334, "num_tokens": 69188777.0, "step": 30205 }, { "entropy": 5.734551000595093, "epoch": 2.986358244365362, "grad_norm": 1.1796875, "learning_rate": 0.00041197925399557407, "loss": 4.9571, "mean_token_accuracy": 0.21552761197090148, "num_tokens": 69199166.0, "step": 30210 }, { "entropy": 5.665743064880371, "epoch": 2.986852510873863, "grad_norm": 1.234375, "learning_rate": 0.0004119512558401578, "loss": 4.9346, "mean_token_accuracy": 0.22371985614299775, "num_tokens": 69211062.0, "step": 30215 }, { "entropy": 5.769170808792114, "epoch": 2.9873467773823643, "grad_norm": 1.2109375, "learning_rate": 0.00041192325431571933, "loss": 5.0439, "mean_token_accuracy": 0.2166271388530731, "num_tokens": 69222263.0, "step": 30220 }, { "entropy": 5.779414510726928, "epoch": 2.987841043890866, "grad_norm": 1.0546875, "learning_rate": 0.00041189524942294753, "loss": 5.0417, "mean_token_accuracy": 0.22066823840141297, "num_tokens": 69234888.0, "step": 30225 }, { "entropy": 5.783027505874633, "epoch": 2.9883353103993673, "grad_norm": 1.1875, "learning_rate": 0.0004118672411625314, "loss": 5.0521, "mean_token_accuracy": 0.21986494064331055, "num_tokens": 69244618.0, "step": 30230 }, { "entropy": 5.742040395736694, "epoch": 2.988829576907869, "grad_norm": 1.15625, "learning_rate": 0.00041183922953515987, "loss": 4.9693, "mean_token_accuracy": 0.2201568901538849, "num_tokens": 69254687.0, "step": 30235 }, { "entropy": 5.76533055305481, "epoch": 2.9893238434163703, "grad_norm": 1.109375, "learning_rate": 0.000411811214541522, "loss": 5.0597, "mean_token_accuracy": 0.21636332869529723, "num_tokens": 69267029.0, "step": 30240 }, { "entropy": 5.783213186264038, "epoch": 2.9898181099248715, "grad_norm": 1.1953125, "learning_rate": 0.0004117831961823072, "loss": 5.0108, "mean_token_accuracy": 0.22210270315408706, "num_tokens": 69278001.0, "step": 30245 }, { "entropy": 5.720000600814819, "epoch": 2.9903123764333728, "grad_norm": 1.015625, "learning_rate": 0.0004117551744582045, "loss": 4.97, "mean_token_accuracy": 0.22349727749824524, "num_tokens": 69290591.0, "step": 30250 }, { "entropy": 5.757104778289795, "epoch": 2.990806642941874, "grad_norm": 1.09375, "learning_rate": 0.0004117271493699032, "loss": 5.0966, "mean_token_accuracy": 0.20326961874961852, "num_tokens": 69301977.0, "step": 30255 }, { "entropy": 5.711636400222778, "epoch": 2.9913009094503757, "grad_norm": 1.15625, "learning_rate": 0.00041169912091809294, "loss": 4.9987, "mean_token_accuracy": 0.2179024785757065, "num_tokens": 69313457.0, "step": 30260 }, { "entropy": 5.728415298461914, "epoch": 2.991795175958877, "grad_norm": 1.1328125, "learning_rate": 0.000411671089103463, "loss": 5.0011, "mean_token_accuracy": 0.22736626714468003, "num_tokens": 69324860.0, "step": 30265 }, { "entropy": 5.774936580657959, "epoch": 2.9922894424673783, "grad_norm": 1.2890625, "learning_rate": 0.0004116430539267031, "loss": 5.0295, "mean_token_accuracy": 0.21638217568397522, "num_tokens": 69335609.0, "step": 30270 }, { "entropy": 5.732158231735229, "epoch": 2.99278370897588, "grad_norm": 1.2578125, "learning_rate": 0.00041161501538850286, "loss": 5.0364, "mean_token_accuracy": 0.21488066464662553, "num_tokens": 69346952.0, "step": 30275 }, { "entropy": 5.619992256164551, "epoch": 2.9932779754843812, "grad_norm": 1.2578125, "learning_rate": 0.000411586973489552, "loss": 4.9046, "mean_token_accuracy": 0.22518128603696824, "num_tokens": 69357875.0, "step": 30280 }, { "entropy": 5.7201330184936525, "epoch": 2.9937722419928825, "grad_norm": 1.078125, "learning_rate": 0.00041155892823054046, "loss": 4.9935, "mean_token_accuracy": 0.21628873497247697, "num_tokens": 69370371.0, "step": 30285 }, { "entropy": 5.791064262390137, "epoch": 2.9942665085013838, "grad_norm": 1.28125, "learning_rate": 0.0004115308796121582, "loss": 5.0754, "mean_token_accuracy": 0.2135318323969841, "num_tokens": 69381567.0, "step": 30290 }, { "entropy": 5.746912574768066, "epoch": 2.9947607750098855, "grad_norm": 1.046875, "learning_rate": 0.000411502827635095, "loss": 4.9866, "mean_token_accuracy": 0.2135758727788925, "num_tokens": 69393559.0, "step": 30295 }, { "entropy": 5.788520574569702, "epoch": 2.9952550415183867, "grad_norm": 1.140625, "learning_rate": 0.00041147477230004103, "loss": 5.0068, "mean_token_accuracy": 0.21810808032751083, "num_tokens": 69404727.0, "step": 30300 }, { "entropy": 5.70776891708374, "epoch": 2.995749308026888, "grad_norm": 1.359375, "learning_rate": 0.00041144671360768655, "loss": 4.9672, "mean_token_accuracy": 0.22071568965911864, "num_tokens": 69414919.0, "step": 30305 }, { "entropy": 5.727727317810059, "epoch": 2.9962435745353897, "grad_norm": 1.140625, "learning_rate": 0.0004114186515587218, "loss": 4.9832, "mean_token_accuracy": 0.22871017307043076, "num_tokens": 69426362.0, "step": 30310 }, { "entropy": 5.742846918106079, "epoch": 2.996737841043891, "grad_norm": 1.2265625, "learning_rate": 0.00041139058615383703, "loss": 5.0182, "mean_token_accuracy": 0.2199365481734276, "num_tokens": 69438641.0, "step": 30315 }, { "entropy": 5.716010522842407, "epoch": 2.997232107552392, "grad_norm": 1.2109375, "learning_rate": 0.0004113625173937226, "loss": 5.0065, "mean_token_accuracy": 0.21939396113157272, "num_tokens": 69449237.0, "step": 30320 }, { "entropy": 5.73662052154541, "epoch": 2.9977263740608935, "grad_norm": 1.15625, "learning_rate": 0.0004113344452790691, "loss": 4.9886, "mean_token_accuracy": 0.21753095388412474, "num_tokens": 69460423.0, "step": 30325 }, { "entropy": 5.701431226730347, "epoch": 2.9982206405693947, "grad_norm": 1.1796875, "learning_rate": 0.00041130636981056716, "loss": 4.8831, "mean_token_accuracy": 0.23606034368276596, "num_tokens": 69470999.0, "step": 30330 }, { "entropy": 5.818048429489136, "epoch": 2.9987149070778965, "grad_norm": 1.265625, "learning_rate": 0.0004112782909889074, "loss": 5.0929, "mean_token_accuracy": 0.2087991252541542, "num_tokens": 69481517.0, "step": 30335 }, { "entropy": 5.724060297012329, "epoch": 2.9992091735863977, "grad_norm": 1.1171875, "learning_rate": 0.0004112502088147804, "loss": 5.0474, "mean_token_accuracy": 0.21982107311487198, "num_tokens": 69493387.0, "step": 30340 }, { "entropy": 5.7181077003479, "epoch": 2.9997034400948994, "grad_norm": 1.171875, "learning_rate": 0.00041122212328887725, "loss": 4.9586, "mean_token_accuracy": 0.2208357572555542, "num_tokens": 69504715.0, "step": 30345 }, { "entropy": 5.776590871810913, "epoch": 3.0001977066034007, "grad_norm": 1.2265625, "learning_rate": 0.00041119403441188874, "loss": 5.1058, "mean_token_accuracy": 0.21024317294359207, "num_tokens": 69515558.0, "step": 30350 }, { "entropy": 5.751272296905517, "epoch": 3.000691973111902, "grad_norm": 1.0390625, "learning_rate": 0.0004111659421845058, "loss": 5.0018, "mean_token_accuracy": 0.2176106244325638, "num_tokens": 69528195.0, "step": 30355 }, { "entropy": 5.825820446014404, "epoch": 3.001186239620403, "grad_norm": 1.078125, "learning_rate": 0.00041113784660741954, "loss": 4.9738, "mean_token_accuracy": 0.22079409509897233, "num_tokens": 69539565.0, "step": 30360 }, { "entropy": 5.67646017074585, "epoch": 3.001680506128905, "grad_norm": 1.1953125, "learning_rate": 0.0004111097476813212, "loss": 4.9149, "mean_token_accuracy": 0.22978126704692842, "num_tokens": 69550827.0, "step": 30365 }, { "entropy": 5.7710155010223385, "epoch": 3.002174772637406, "grad_norm": 1.140625, "learning_rate": 0.00041108164540690196, "loss": 5.0288, "mean_token_accuracy": 0.2232765629887581, "num_tokens": 69564205.0, "step": 30370 }, { "entropy": 5.7783668518066404, "epoch": 3.0026690391459074, "grad_norm": 1.15625, "learning_rate": 0.00041105353978485303, "loss": 4.9542, "mean_token_accuracy": 0.22511908560991287, "num_tokens": 69577353.0, "step": 30375 }, { "entropy": 5.690641641616821, "epoch": 3.0031633056544087, "grad_norm": 1.203125, "learning_rate": 0.00041102543081586603, "loss": 4.9159, "mean_token_accuracy": 0.23622947186231613, "num_tokens": 69588401.0, "step": 30380 }, { "entropy": 5.721901607513428, "epoch": 3.0036575721629104, "grad_norm": 1.109375, "learning_rate": 0.0004109973185006322, "loss": 4.9785, "mean_token_accuracy": 0.21664253175258635, "num_tokens": 69599966.0, "step": 30385 }, { "entropy": 5.7363073348999025, "epoch": 3.0041518386714117, "grad_norm": 1.1015625, "learning_rate": 0.00041096920283984335, "loss": 4.9843, "mean_token_accuracy": 0.2260678917169571, "num_tokens": 69611264.0, "step": 30390 }, { "entropy": 5.754953193664551, "epoch": 3.004646105179913, "grad_norm": 1.2265625, "learning_rate": 0.000410941083834191, "loss": 4.9665, "mean_token_accuracy": 0.22258009165525436, "num_tokens": 69621638.0, "step": 30395 }, { "entropy": 5.722536039352417, "epoch": 3.005140371688414, "grad_norm": 1.1171875, "learning_rate": 0.0004109129614843669, "loss": 4.9037, "mean_token_accuracy": 0.23678981512784958, "num_tokens": 69633236.0, "step": 30400 }, { "entropy": 5.750876998901367, "epoch": 3.005634638196916, "grad_norm": 1.1953125, "learning_rate": 0.0004108848357910628, "loss": 4.9396, "mean_token_accuracy": 0.22600589990615844, "num_tokens": 69644672.0, "step": 30405 }, { "entropy": 5.705188512802124, "epoch": 3.006128904705417, "grad_norm": 1.140625, "learning_rate": 0.00041085670675497065, "loss": 4.9554, "mean_token_accuracy": 0.21679213792085647, "num_tokens": 69655580.0, "step": 30410 }, { "entropy": 5.716627836227417, "epoch": 3.0066231712139184, "grad_norm": 1.0078125, "learning_rate": 0.0004108285743767825, "loss": 4.9892, "mean_token_accuracy": 0.2191089302301407, "num_tokens": 69668692.0, "step": 30415 }, { "entropy": 5.792183256149292, "epoch": 3.00711743772242, "grad_norm": 1.1953125, "learning_rate": 0.00041080043865719033, "loss": 5.0086, "mean_token_accuracy": 0.21841350048780442, "num_tokens": 69679885.0, "step": 30420 }, { "entropy": 5.737840270996093, "epoch": 3.0076117042309214, "grad_norm": 1.140625, "learning_rate": 0.0004107722995968863, "loss": 5.0035, "mean_token_accuracy": 0.22233931273221968, "num_tokens": 69691395.0, "step": 30425 }, { "entropy": 5.706387090682983, "epoch": 3.0081059707394227, "grad_norm": 1.1953125, "learning_rate": 0.0004107441571965627, "loss": 4.8508, "mean_token_accuracy": 0.2240563616156578, "num_tokens": 69701777.0, "step": 30430 }, { "entropy": 5.735692358016967, "epoch": 3.008600237247924, "grad_norm": 1.2421875, "learning_rate": 0.0004107160114569117, "loss": 4.9424, "mean_token_accuracy": 0.22495780140161514, "num_tokens": 69712922.0, "step": 30435 }, { "entropy": 5.71577262878418, "epoch": 3.0090945037564256, "grad_norm": 1.1953125, "learning_rate": 0.0004106878623786258, "loss": 4.9109, "mean_token_accuracy": 0.2244071438908577, "num_tokens": 69724342.0, "step": 30440 }, { "entropy": 5.675990772247315, "epoch": 3.009588770264927, "grad_norm": 1.09375, "learning_rate": 0.0004106597099623974, "loss": 4.9392, "mean_token_accuracy": 0.22462610751390458, "num_tokens": 69735650.0, "step": 30445 }, { "entropy": 5.708612108230591, "epoch": 3.010083036773428, "grad_norm": 1.1953125, "learning_rate": 0.0004106315542089191, "loss": 4.9087, "mean_token_accuracy": 0.22759891748428346, "num_tokens": 69746745.0, "step": 30450 }, { "entropy": 5.757959461212158, "epoch": 3.0105773032819294, "grad_norm": 1.1796875, "learning_rate": 0.0004106033951188835, "loss": 4.8961, "mean_token_accuracy": 0.21829326897859574, "num_tokens": 69759315.0, "step": 30455 }, { "entropy": 5.702524137496948, "epoch": 3.011071569790431, "grad_norm": 1.2421875, "learning_rate": 0.00041057523269298336, "loss": 4.9422, "mean_token_accuracy": 0.22083195745944978, "num_tokens": 69769883.0, "step": 30460 }, { "entropy": 5.6981323719024655, "epoch": 3.0115658362989324, "grad_norm": 1.2265625, "learning_rate": 0.0004105470669319115, "loss": 4.9464, "mean_token_accuracy": 0.21629173755645753, "num_tokens": 69781449.0, "step": 30465 }, { "entropy": 5.644127559661865, "epoch": 3.0120601028074336, "grad_norm": 1.171875, "learning_rate": 0.0004105188978363608, "loss": 4.888, "mean_token_accuracy": 0.23074255734682084, "num_tokens": 69793952.0, "step": 30470 }, { "entropy": 5.721765232086182, "epoch": 3.0125543693159353, "grad_norm": 1.109375, "learning_rate": 0.0004104907254070241, "loss": 4.9462, "mean_token_accuracy": 0.2289516508579254, "num_tokens": 69805705.0, "step": 30475 }, { "entropy": 5.790915441513062, "epoch": 3.0130486358244366, "grad_norm": 1.1171875, "learning_rate": 0.0004104625496445946, "loss": 5.0247, "mean_token_accuracy": 0.21664580553770066, "num_tokens": 69817298.0, "step": 30480 }, { "entropy": 5.778224658966065, "epoch": 3.013542902332938, "grad_norm": 1.1875, "learning_rate": 0.00041043437054976524, "loss": 5.0177, "mean_token_accuracy": 0.21752094477415085, "num_tokens": 69829280.0, "step": 30485 }, { "entropy": 5.687246465682984, "epoch": 3.014037168841439, "grad_norm": 1.1796875, "learning_rate": 0.0004104061881232295, "loss": 4.8783, "mean_token_accuracy": 0.23266586661338806, "num_tokens": 69841500.0, "step": 30490 }, { "entropy": 5.707006168365479, "epoch": 3.014531435349941, "grad_norm": 1.1953125, "learning_rate": 0.00041037800236568044, "loss": 4.9361, "mean_token_accuracy": 0.22687130868434907, "num_tokens": 69852651.0, "step": 30495 }, { "entropy": 5.693068170547486, "epoch": 3.015025701858442, "grad_norm": 1.109375, "learning_rate": 0.0004103498132778116, "loss": 4.9396, "mean_token_accuracy": 0.22818387299776077, "num_tokens": 69864746.0, "step": 30500 }, { "entropy": 5.630860376358032, "epoch": 3.0155199683669434, "grad_norm": 1.203125, "learning_rate": 0.0004103216208603163, "loss": 4.8812, "mean_token_accuracy": 0.22865380644798278, "num_tokens": 69875696.0, "step": 30505 }, { "entropy": 5.702639722824097, "epoch": 3.0160142348754446, "grad_norm": 1.203125, "learning_rate": 0.0004102934251138881, "loss": 4.8617, "mean_token_accuracy": 0.23673107028007506, "num_tokens": 69887363.0, "step": 30510 }, { "entropy": 5.779938697814941, "epoch": 3.0165085013839463, "grad_norm": 1.3046875, "learning_rate": 0.00041026522603922075, "loss": 4.9582, "mean_token_accuracy": 0.2271068811416626, "num_tokens": 69898561.0, "step": 30515 }, { "entropy": 5.723837566375733, "epoch": 3.0170027678924476, "grad_norm": 1.15625, "learning_rate": 0.0004102370236370077, "loss": 5.0142, "mean_token_accuracy": 0.2168318122625351, "num_tokens": 69910297.0, "step": 30520 }, { "entropy": 5.692807197570801, "epoch": 3.017497034400949, "grad_norm": 1.15625, "learning_rate": 0.00041020881790794305, "loss": 5.0053, "mean_token_accuracy": 0.21866068094968796, "num_tokens": 69922435.0, "step": 30525 }, { "entropy": 5.693126630783081, "epoch": 3.0179913009094506, "grad_norm": 1.03125, "learning_rate": 0.00041018060885272047, "loss": 4.9317, "mean_token_accuracy": 0.23414943516254424, "num_tokens": 69935151.0, "step": 30530 }, { "entropy": 5.764499044418335, "epoch": 3.018485567417952, "grad_norm": 1.171875, "learning_rate": 0.00041015239647203386, "loss": 4.9479, "mean_token_accuracy": 0.22107988744974136, "num_tokens": 69945915.0, "step": 30535 }, { "entropy": 5.692897939682007, "epoch": 3.018979833926453, "grad_norm": 1.171875, "learning_rate": 0.00041012418076657737, "loss": 4.9177, "mean_token_accuracy": 0.2252020761370659, "num_tokens": 69957016.0, "step": 30540 }, { "entropy": 5.604632949829101, "epoch": 3.0194741004349543, "grad_norm": 1.234375, "learning_rate": 0.00041009596173704506, "loss": 4.855, "mean_token_accuracy": 0.23118189871311187, "num_tokens": 69967863.0, "step": 30545 }, { "entropy": 5.737838077545166, "epoch": 3.019968366943456, "grad_norm": 1.1640625, "learning_rate": 0.00041006773938413114, "loss": 5.0247, "mean_token_accuracy": 0.21551278680562974, "num_tokens": 69978901.0, "step": 30550 }, { "entropy": 5.699930858612061, "epoch": 3.0204626334519573, "grad_norm": 1.0859375, "learning_rate": 0.0004100395137085299, "loss": 4.9193, "mean_token_accuracy": 0.22240727245807648, "num_tokens": 69990829.0, "step": 30555 }, { "entropy": 5.745898771286011, "epoch": 3.0209568999604586, "grad_norm": 1.171875, "learning_rate": 0.0004100112847109357, "loss": 4.9086, "mean_token_accuracy": 0.22435375303030014, "num_tokens": 70002130.0, "step": 30560 }, { "entropy": 5.730222940444946, "epoch": 3.0214511664689603, "grad_norm": 1.1953125, "learning_rate": 0.0004099830523920429, "loss": 4.9499, "mean_token_accuracy": 0.22606257796287538, "num_tokens": 70012913.0, "step": 30565 }, { "entropy": 5.706943464279175, "epoch": 3.0219454329774615, "grad_norm": 1.125, "learning_rate": 0.00040995481675254616, "loss": 4.9487, "mean_token_accuracy": 0.22607666850090027, "num_tokens": 70024689.0, "step": 30570 }, { "entropy": 5.719606685638428, "epoch": 3.022439699485963, "grad_norm": 1.15625, "learning_rate": 0.0004099265777931398, "loss": 4.9423, "mean_token_accuracy": 0.22446005046367645, "num_tokens": 70036153.0, "step": 30575 }, { "entropy": 5.69336953163147, "epoch": 3.022933965994464, "grad_norm": 1.1015625, "learning_rate": 0.00040989833551451885, "loss": 4.9637, "mean_token_accuracy": 0.220648455619812, "num_tokens": 70049190.0, "step": 30580 }, { "entropy": 5.685654592514038, "epoch": 3.0234282325029658, "grad_norm": 1.09375, "learning_rate": 0.00040987008991737786, "loss": 4.873, "mean_token_accuracy": 0.22690671533346177, "num_tokens": 70061391.0, "step": 30585 }, { "entropy": 5.623353338241577, "epoch": 3.023922499011467, "grad_norm": 1.25, "learning_rate": 0.0004098418410024118, "loss": 4.8562, "mean_token_accuracy": 0.23547518402338027, "num_tokens": 70072811.0, "step": 30590 }, { "entropy": 5.666262531280518, "epoch": 3.0244167655199683, "grad_norm": 1.1796875, "learning_rate": 0.00040981358877031546, "loss": 4.8785, "mean_token_accuracy": 0.22842076420783997, "num_tokens": 70083776.0, "step": 30595 }, { "entropy": 5.720788764953613, "epoch": 3.0249110320284696, "grad_norm": 1.1015625, "learning_rate": 0.0004097853332217839, "loss": 4.982, "mean_token_accuracy": 0.2208441063761711, "num_tokens": 70095720.0, "step": 30600 }, { "entropy": 5.743113279342651, "epoch": 3.0254052985369713, "grad_norm": 1.28125, "learning_rate": 0.0004097570743575123, "loss": 4.9791, "mean_token_accuracy": 0.21792996525764466, "num_tokens": 70106315.0, "step": 30605 }, { "entropy": 5.7307572841644285, "epoch": 3.0258995650454725, "grad_norm": 1.1796875, "learning_rate": 0.00040972881217819573, "loss": 5.0005, "mean_token_accuracy": 0.21487215161323547, "num_tokens": 70118018.0, "step": 30610 }, { "entropy": 5.721570348739624, "epoch": 3.026393831553974, "grad_norm": 1.1640625, "learning_rate": 0.0004097005466845295, "loss": 4.9355, "mean_token_accuracy": 0.22338203489780425, "num_tokens": 70130543.0, "step": 30615 }, { "entropy": 5.684346342086792, "epoch": 3.0268880980624755, "grad_norm": 1.1953125, "learning_rate": 0.0004096722778772089, "loss": 4.8827, "mean_token_accuracy": 0.2322327584028244, "num_tokens": 70142582.0, "step": 30620 }, { "entropy": 5.715225124359131, "epoch": 3.0273823645709768, "grad_norm": 1.046875, "learning_rate": 0.00040964400575692946, "loss": 4.9909, "mean_token_accuracy": 0.22311019599437715, "num_tokens": 70155002.0, "step": 30625 }, { "entropy": 5.730599641799927, "epoch": 3.027876631079478, "grad_norm": 1.1953125, "learning_rate": 0.00040961573032438647, "loss": 4.9741, "mean_token_accuracy": 0.22599612027406693, "num_tokens": 70167354.0, "step": 30630 }, { "entropy": 5.731669950485229, "epoch": 3.0283708975879793, "grad_norm": 1.328125, "learning_rate": 0.0004095874515802757, "loss": 5.004, "mean_token_accuracy": 0.2211572930216789, "num_tokens": 70178561.0, "step": 30635 }, { "entropy": 5.733244562149048, "epoch": 3.028865164096481, "grad_norm": 1.0546875, "learning_rate": 0.00040955916952529277, "loss": 4.9485, "mean_token_accuracy": 0.22722513228654861, "num_tokens": 70189954.0, "step": 30640 }, { "entropy": 5.779803133010864, "epoch": 3.0293594306049823, "grad_norm": 1.2265625, "learning_rate": 0.00040953088416013325, "loss": 5.0162, "mean_token_accuracy": 0.2126403883099556, "num_tokens": 70200595.0, "step": 30645 }, { "entropy": 5.71193265914917, "epoch": 3.0298536971134835, "grad_norm": 1.140625, "learning_rate": 0.0004095025954854933, "loss": 4.9687, "mean_token_accuracy": 0.22694027721881865, "num_tokens": 70211757.0, "step": 30650 }, { "entropy": 5.564568901062012, "epoch": 3.0303479636219848, "grad_norm": 1.1796875, "learning_rate": 0.0004094743035020685, "loss": 4.8302, "mean_token_accuracy": 0.23605324029922486, "num_tokens": 70223404.0, "step": 30655 }, { "entropy": 5.778880643844604, "epoch": 3.0308422301304865, "grad_norm": 1.2421875, "learning_rate": 0.00040944600821055506, "loss": 5.0585, "mean_token_accuracy": 0.2120603233575821, "num_tokens": 70234022.0, "step": 30660 }, { "entropy": 5.758217716217041, "epoch": 3.0313364966389877, "grad_norm": 1.3046875, "learning_rate": 0.0004094177096116489, "loss": 4.9662, "mean_token_accuracy": 0.22400532066822051, "num_tokens": 70245279.0, "step": 30665 }, { "entropy": 5.701322078704834, "epoch": 3.031830763147489, "grad_norm": 1.2421875, "learning_rate": 0.00040938940770604624, "loss": 4.9467, "mean_token_accuracy": 0.22491933703422545, "num_tokens": 70256561.0, "step": 30670 }, { "entropy": 5.6540955066680905, "epoch": 3.0323250296559907, "grad_norm": 1.1640625, "learning_rate": 0.00040936110249444323, "loss": 4.8885, "mean_token_accuracy": 0.23269078135490417, "num_tokens": 70268535.0, "step": 30675 }, { "entropy": 5.668256855010986, "epoch": 3.032819296164492, "grad_norm": 1.140625, "learning_rate": 0.0004093327939775364, "loss": 4.9167, "mean_token_accuracy": 0.23604007065296173, "num_tokens": 70279681.0, "step": 30680 }, { "entropy": 5.721025037765503, "epoch": 3.0333135626729932, "grad_norm": 1.1640625, "learning_rate": 0.0004093044821560219, "loss": 4.9056, "mean_token_accuracy": 0.228829962015152, "num_tokens": 70290796.0, "step": 30685 }, { "entropy": 5.6644690990447994, "epoch": 3.0338078291814945, "grad_norm": 1.25, "learning_rate": 0.00040927616703059636, "loss": 4.8918, "mean_token_accuracy": 0.22568174302577973, "num_tokens": 70302254.0, "step": 30690 }, { "entropy": 5.636654281616211, "epoch": 3.034302095689996, "grad_norm": 1.2109375, "learning_rate": 0.0004092478486019562, "loss": 4.8565, "mean_token_accuracy": 0.2362230360507965, "num_tokens": 70313022.0, "step": 30695 }, { "entropy": 5.73512864112854, "epoch": 3.0347963621984975, "grad_norm": 1.2109375, "learning_rate": 0.00040921952687079824, "loss": 4.9285, "mean_token_accuracy": 0.22421761453151703, "num_tokens": 70325356.0, "step": 30700 }, { "entropy": 5.7651876449584964, "epoch": 3.0352906287069987, "grad_norm": 1.046875, "learning_rate": 0.000409191201837819, "loss": 5.0296, "mean_token_accuracy": 0.21503649204969405, "num_tokens": 70336622.0, "step": 30705 }, { "entropy": 5.735172748565674, "epoch": 3.0357848952155, "grad_norm": 1.203125, "learning_rate": 0.00040916287350371546, "loss": 4.9538, "mean_token_accuracy": 0.22120559960603714, "num_tokens": 70347799.0, "step": 30710 }, { "entropy": 5.678066825866699, "epoch": 3.0362791617240017, "grad_norm": 1.1171875, "learning_rate": 0.00040913454186918436, "loss": 4.941, "mean_token_accuracy": 0.2258310079574585, "num_tokens": 70358918.0, "step": 30715 }, { "entropy": 5.759299659729004, "epoch": 3.036773428232503, "grad_norm": 1.109375, "learning_rate": 0.00040910620693492277, "loss": 5.0472, "mean_token_accuracy": 0.2138002946972847, "num_tokens": 70371853.0, "step": 30720 }, { "entropy": 5.749831008911133, "epoch": 3.037267694741004, "grad_norm": 1.2109375, "learning_rate": 0.0004090778687016276, "loss": 4.9944, "mean_token_accuracy": 0.21727119088172914, "num_tokens": 70383696.0, "step": 30725 }, { "entropy": 5.698311758041382, "epoch": 3.037761961249506, "grad_norm": 1.0859375, "learning_rate": 0.00040904952716999617, "loss": 4.89, "mean_token_accuracy": 0.22516567260026932, "num_tokens": 70395651.0, "step": 30730 }, { "entropy": 5.747574424743652, "epoch": 3.038256227758007, "grad_norm": 1.15625, "learning_rate": 0.0004090211823407255, "loss": 4.9688, "mean_token_accuracy": 0.21962679475545882, "num_tokens": 70408621.0, "step": 30735 }, { "entropy": 5.638271903991699, "epoch": 3.0387504942665085, "grad_norm": 1.1484375, "learning_rate": 0.000408992834214513, "loss": 4.8554, "mean_token_accuracy": 0.2269839808344841, "num_tokens": 70419627.0, "step": 30740 }, { "entropy": 5.629597234725952, "epoch": 3.0392447607750097, "grad_norm": 1.140625, "learning_rate": 0.0004089644827920559, "loss": 4.9226, "mean_token_accuracy": 0.22708497196435928, "num_tokens": 70431795.0, "step": 30745 }, { "entropy": 5.676336431503296, "epoch": 3.0397390272835114, "grad_norm": 1.1875, "learning_rate": 0.00040893612807405184, "loss": 4.8802, "mean_token_accuracy": 0.2393552169203758, "num_tokens": 70444086.0, "step": 30750 }, { "entropy": 5.764472818374633, "epoch": 3.0402332937920127, "grad_norm": 1.1640625, "learning_rate": 0.0004089077700611982, "loss": 4.9548, "mean_token_accuracy": 0.22660592049360276, "num_tokens": 70454844.0, "step": 30755 }, { "entropy": 5.756230783462525, "epoch": 3.040727560300514, "grad_norm": 1.234375, "learning_rate": 0.00040887940875419267, "loss": 5.0214, "mean_token_accuracy": 0.2166493207216263, "num_tokens": 70466003.0, "step": 30760 }, { "entropy": 5.7397068500518795, "epoch": 3.041221826809015, "grad_norm": 1.3046875, "learning_rate": 0.0004088510441537329, "loss": 4.9237, "mean_token_accuracy": 0.2283734545111656, "num_tokens": 70476586.0, "step": 30765 }, { "entropy": 5.763432550430298, "epoch": 3.041716093317517, "grad_norm": 1.265625, "learning_rate": 0.00040882267626051664, "loss": 5.0275, "mean_token_accuracy": 0.21383546739816667, "num_tokens": 70488561.0, "step": 30770 }, { "entropy": 5.766893148422241, "epoch": 3.042210359826018, "grad_norm": 1.2109375, "learning_rate": 0.0004087943050752419, "loss": 4.9621, "mean_token_accuracy": 0.2150772914290428, "num_tokens": 70499454.0, "step": 30775 }, { "entropy": 5.7595781803131105, "epoch": 3.0427046263345194, "grad_norm": 1.203125, "learning_rate": 0.0004087659305986064, "loss": 4.9924, "mean_token_accuracy": 0.21298387497663498, "num_tokens": 70510880.0, "step": 30780 }, { "entropy": 5.696375942230224, "epoch": 3.043198892843021, "grad_norm": 1.03125, "learning_rate": 0.00040873755283130824, "loss": 4.984, "mean_token_accuracy": 0.21819486916065217, "num_tokens": 70523199.0, "step": 30785 }, { "entropy": 5.691677093505859, "epoch": 3.0436931593515224, "grad_norm": 1.1484375, "learning_rate": 0.0004087091717740456, "loss": 4.905, "mean_token_accuracy": 0.22182126939296723, "num_tokens": 70535124.0, "step": 30790 }, { "entropy": 5.7096093654632565, "epoch": 3.0441874258600237, "grad_norm": 1.109375, "learning_rate": 0.00040868078742751655, "loss": 4.9031, "mean_token_accuracy": 0.2305453196167946, "num_tokens": 70547543.0, "step": 30795 }, { "entropy": 5.713780689239502, "epoch": 3.044681692368525, "grad_norm": 1.0625, "learning_rate": 0.00040865239979241946, "loss": 4.9243, "mean_token_accuracy": 0.23029208034276963, "num_tokens": 70559788.0, "step": 30800 }, { "entropy": 5.701771068572998, "epoch": 3.0451759588770266, "grad_norm": 1.328125, "learning_rate": 0.0004086240088694525, "loss": 4.9106, "mean_token_accuracy": 0.2341471329331398, "num_tokens": 70570303.0, "step": 30805 }, { "entropy": 5.648312044143677, "epoch": 3.045670225385528, "grad_norm": 1.234375, "learning_rate": 0.00040859561465931426, "loss": 4.8764, "mean_token_accuracy": 0.22893944382667542, "num_tokens": 70580924.0, "step": 30810 }, { "entropy": 5.708470487594605, "epoch": 3.046164491894029, "grad_norm": 1.1328125, "learning_rate": 0.00040856721716270316, "loss": 4.9363, "mean_token_accuracy": 0.22932678759098052, "num_tokens": 70592557.0, "step": 30815 }, { "entropy": 5.611740922927856, "epoch": 3.046658758402531, "grad_norm": 1.1171875, "learning_rate": 0.0004085388163803178, "loss": 4.8157, "mean_token_accuracy": 0.24518696665763856, "num_tokens": 70604374.0, "step": 30820 }, { "entropy": 5.727024888992309, "epoch": 3.047153024911032, "grad_norm": 1.3125, "learning_rate": 0.0004085104123128568, "loss": 4.9496, "mean_token_accuracy": 0.22042208164930344, "num_tokens": 70616380.0, "step": 30825 }, { "entropy": 5.714840364456177, "epoch": 3.0476472914195334, "grad_norm": 1.1640625, "learning_rate": 0.00040848200496101895, "loss": 4.9957, "mean_token_accuracy": 0.22494620382785796, "num_tokens": 70628297.0, "step": 30830 }, { "entropy": 5.783543109893799, "epoch": 3.0481415579280347, "grad_norm": 1.1640625, "learning_rate": 0.0004084535943255031, "loss": 4.9733, "mean_token_accuracy": 0.21780431419610977, "num_tokens": 70639815.0, "step": 30835 }, { "entropy": 5.756053066253662, "epoch": 3.0486358244365364, "grad_norm": 1.15625, "learning_rate": 0.00040842518040700815, "loss": 4.9816, "mean_token_accuracy": 0.22455343306064607, "num_tokens": 70651283.0, "step": 30840 }, { "entropy": 5.683791589736939, "epoch": 3.0491300909450376, "grad_norm": 1.3359375, "learning_rate": 0.000408396763206233, "loss": 4.9262, "mean_token_accuracy": 0.22923647463321686, "num_tokens": 70662465.0, "step": 30845 }, { "entropy": 5.7987658977508545, "epoch": 3.049624357453539, "grad_norm": 1.171875, "learning_rate": 0.0004083683427238768, "loss": 5.0357, "mean_token_accuracy": 0.21786613166332244, "num_tokens": 70674301.0, "step": 30850 }, { "entropy": 5.735969161987304, "epoch": 3.05011862396204, "grad_norm": 1.2421875, "learning_rate": 0.0004083399189606387, "loss": 4.9514, "mean_token_accuracy": 0.2262736976146698, "num_tokens": 70685423.0, "step": 30855 }, { "entropy": 5.72317476272583, "epoch": 3.050612890470542, "grad_norm": 1.28125, "learning_rate": 0.0004083114919172179, "loss": 4.8616, "mean_token_accuracy": 0.2286628469824791, "num_tokens": 70697043.0, "step": 30860 }, { "entropy": 5.759106111526489, "epoch": 3.051107156979043, "grad_norm": 1.1328125, "learning_rate": 0.0004082830615943137, "loss": 4.9866, "mean_token_accuracy": 0.22315319031476974, "num_tokens": 70708585.0, "step": 30865 }, { "entropy": 5.684482765197754, "epoch": 3.0516014234875444, "grad_norm": 1.0703125, "learning_rate": 0.0004082546279926256, "loss": 4.9163, "mean_token_accuracy": 0.22303294837474824, "num_tokens": 70720703.0, "step": 30870 }, { "entropy": 5.750705528259277, "epoch": 3.052095689996046, "grad_norm": 1.28125, "learning_rate": 0.00040822619111285284, "loss": 4.9663, "mean_token_accuracy": 0.21766726672649384, "num_tokens": 70731146.0, "step": 30875 }, { "entropy": 5.708006858825684, "epoch": 3.0525899565045473, "grad_norm": 1.1015625, "learning_rate": 0.00040819775095569515, "loss": 4.9143, "mean_token_accuracy": 0.22630273401737214, "num_tokens": 70742393.0, "step": 30880 }, { "entropy": 5.708527946472168, "epoch": 3.0530842230130486, "grad_norm": 1.140625, "learning_rate": 0.0004081693075218522, "loss": 4.8347, "mean_token_accuracy": 0.23410673439502716, "num_tokens": 70753419.0, "step": 30885 }, { "entropy": 5.650593614578247, "epoch": 3.05357848952155, "grad_norm": 1.1015625, "learning_rate": 0.00040814086081202364, "loss": 4.8916, "mean_token_accuracy": 0.2321733519434929, "num_tokens": 70765445.0, "step": 30890 }, { "entropy": 5.689175701141357, "epoch": 3.0540727560300516, "grad_norm": 1.1796875, "learning_rate": 0.00040811241082690914, "loss": 4.9457, "mean_token_accuracy": 0.2226109653711319, "num_tokens": 70776598.0, "step": 30895 }, { "entropy": 5.7555629253387455, "epoch": 3.054567022538553, "grad_norm": 1.203125, "learning_rate": 0.0004080839575672087, "loss": 4.9641, "mean_token_accuracy": 0.22415139079093932, "num_tokens": 70787982.0, "step": 30900 }, { "entropy": 5.709179830551148, "epoch": 3.055061289047054, "grad_norm": 1.0859375, "learning_rate": 0.00040805550103362225, "loss": 4.9129, "mean_token_accuracy": 0.2233087420463562, "num_tokens": 70799080.0, "step": 30905 }, { "entropy": 5.655936431884766, "epoch": 3.0555555555555554, "grad_norm": 1.1328125, "learning_rate": 0.00040802704122684994, "loss": 4.9157, "mean_token_accuracy": 0.22856585830450057, "num_tokens": 70809831.0, "step": 30910 }, { "entropy": 5.653885746002198, "epoch": 3.056049822064057, "grad_norm": 1.28125, "learning_rate": 0.00040799857814759167, "loss": 5.0101, "mean_token_accuracy": 0.22028934955596924, "num_tokens": 70821623.0, "step": 30915 }, { "entropy": 5.8056083679199215, "epoch": 3.0565440885725583, "grad_norm": 1.1875, "learning_rate": 0.0004079701117965477, "loss": 5.0566, "mean_token_accuracy": 0.2126554310321808, "num_tokens": 70833875.0, "step": 30920 }, { "entropy": 5.70546932220459, "epoch": 3.0570383550810596, "grad_norm": 1.1328125, "learning_rate": 0.0004079416421744185, "loss": 4.9442, "mean_token_accuracy": 0.22270976305007933, "num_tokens": 70845287.0, "step": 30925 }, { "entropy": 5.772080707550049, "epoch": 3.0575326215895613, "grad_norm": 1.2109375, "learning_rate": 0.00040791316928190423, "loss": 4.9529, "mean_token_accuracy": 0.2258085533976555, "num_tokens": 70856294.0, "step": 30930 }, { "entropy": 5.684677934646606, "epoch": 3.0580268880980626, "grad_norm": 1.2734375, "learning_rate": 0.00040788469311970525, "loss": 4.9689, "mean_token_accuracy": 0.22408422976732253, "num_tokens": 70867490.0, "step": 30935 }, { "entropy": 5.683466863632202, "epoch": 3.058521154606564, "grad_norm": 1.1640625, "learning_rate": 0.00040785621368852234, "loss": 4.9624, "mean_token_accuracy": 0.22475160360336305, "num_tokens": 70877991.0, "step": 30940 }, { "entropy": 5.731028413772583, "epoch": 3.059015421115065, "grad_norm": 1.25, "learning_rate": 0.00040782773098905594, "loss": 4.9831, "mean_token_accuracy": 0.22464986145496368, "num_tokens": 70888439.0, "step": 30945 }, { "entropy": 5.696441507339477, "epoch": 3.059509687623567, "grad_norm": 1.2578125, "learning_rate": 0.0004077992450220068, "loss": 4.8854, "mean_token_accuracy": 0.22986168116331102, "num_tokens": 70898331.0, "step": 30950 }, { "entropy": 5.711409044265747, "epoch": 3.060003954132068, "grad_norm": 1.3671875, "learning_rate": 0.0004077707557880755, "loss": 4.9086, "mean_token_accuracy": 0.22759510725736617, "num_tokens": 70908221.0, "step": 30955 }, { "entropy": 5.709689378738403, "epoch": 3.0604982206405693, "grad_norm": 1.2421875, "learning_rate": 0.00040774226328796315, "loss": 4.8946, "mean_token_accuracy": 0.2283681094646454, "num_tokens": 70919720.0, "step": 30960 }, { "entropy": 5.77891354560852, "epoch": 3.0609924871490706, "grad_norm": 1.234375, "learning_rate": 0.0004077137675223704, "loss": 4.9567, "mean_token_accuracy": 0.22452180385589598, "num_tokens": 70931322.0, "step": 30965 }, { "entropy": 5.675710010528564, "epoch": 3.0614867536575723, "grad_norm": 1.171875, "learning_rate": 0.0004076852684919985, "loss": 4.9593, "mean_token_accuracy": 0.22506803125143052, "num_tokens": 70943124.0, "step": 30970 }, { "entropy": 5.694900941848755, "epoch": 3.0619810201660735, "grad_norm": 1.1640625, "learning_rate": 0.0004076567661975484, "loss": 4.9241, "mean_token_accuracy": 0.22845420837402344, "num_tokens": 70954986.0, "step": 30975 }, { "entropy": 5.721801900863648, "epoch": 3.062475286674575, "grad_norm": 1.265625, "learning_rate": 0.0004076282606397211, "loss": 4.8757, "mean_token_accuracy": 0.226080784201622, "num_tokens": 70965500.0, "step": 30980 }, { "entropy": 5.701119232177734, "epoch": 3.0629695531830765, "grad_norm": 1.1328125, "learning_rate": 0.0004075997518192182, "loss": 4.9116, "mean_token_accuracy": 0.2215220585465431, "num_tokens": 70976717.0, "step": 30985 }, { "entropy": 5.635010719299316, "epoch": 3.0634638196915778, "grad_norm": 1.1953125, "learning_rate": 0.0004075712397367408, "loss": 4.9337, "mean_token_accuracy": 0.227948597073555, "num_tokens": 70987286.0, "step": 30990 }, { "entropy": 5.7938155174255375, "epoch": 3.063958086200079, "grad_norm": 1.3125, "learning_rate": 0.00040754272439299025, "loss": 5.0353, "mean_token_accuracy": 0.21077050715684892, "num_tokens": 70998710.0, "step": 30995 }, { "entropy": 5.73235764503479, "epoch": 3.0644523527085803, "grad_norm": 1.1640625, "learning_rate": 0.00040751420578866816, "loss": 4.9833, "mean_token_accuracy": 0.22203432619571686, "num_tokens": 71010725.0, "step": 31000 }, { "entropy": 5.754951620101929, "epoch": 3.064946619217082, "grad_norm": 1.1015625, "learning_rate": 0.0004074856839244761, "loss": 5.0228, "mean_token_accuracy": 0.22167063057422637, "num_tokens": 71021723.0, "step": 31005 }, { "entropy": 5.691845464706421, "epoch": 3.0654408857255833, "grad_norm": 1.28125, "learning_rate": 0.0004074571588011156, "loss": 4.9123, "mean_token_accuracy": 0.2324998214840889, "num_tokens": 71032744.0, "step": 31010 }, { "entropy": 5.673231983184815, "epoch": 3.0659351522340845, "grad_norm": 1.2734375, "learning_rate": 0.00040742863041928854, "loss": 4.8764, "mean_token_accuracy": 0.2278897985816002, "num_tokens": 71044296.0, "step": 31015 }, { "entropy": 5.719087553024292, "epoch": 3.066429418742586, "grad_norm": 1.21875, "learning_rate": 0.00040740009877969654, "loss": 5.0061, "mean_token_accuracy": 0.21975739896297455, "num_tokens": 71054636.0, "step": 31020 }, { "entropy": 5.7545655250549315, "epoch": 3.0669236852510875, "grad_norm": 1.1328125, "learning_rate": 0.0004073715638830415, "loss": 4.9887, "mean_token_accuracy": 0.22613947242498397, "num_tokens": 71067350.0, "step": 31025 }, { "entropy": 5.762490272521973, "epoch": 3.0674179517595888, "grad_norm": 1.1796875, "learning_rate": 0.00040734302573002565, "loss": 4.9801, "mean_token_accuracy": 0.2222036749124527, "num_tokens": 71078951.0, "step": 31030 }, { "entropy": 5.686424493789673, "epoch": 3.06791221826809, "grad_norm": 1.0859375, "learning_rate": 0.0004073144843213507, "loss": 4.9131, "mean_token_accuracy": 0.22868626415729523, "num_tokens": 71090039.0, "step": 31035 }, { "entropy": 5.66706395149231, "epoch": 3.0684064847765917, "grad_norm": 1.1875, "learning_rate": 0.00040728593965771895, "loss": 4.8971, "mean_token_accuracy": 0.2343684107065201, "num_tokens": 71101203.0, "step": 31040 }, { "entropy": 5.712617826461792, "epoch": 3.068900751285093, "grad_norm": 1.0859375, "learning_rate": 0.00040725739173983253, "loss": 4.8894, "mean_token_accuracy": 0.22742980122566223, "num_tokens": 71112720.0, "step": 31045 }, { "entropy": 5.766223001480102, "epoch": 3.0693950177935942, "grad_norm": 1.2265625, "learning_rate": 0.0004072288405683938, "loss": 5.0112, "mean_token_accuracy": 0.22089194357395173, "num_tokens": 71123126.0, "step": 31050 }, { "entropy": 5.707275629043579, "epoch": 3.0698892843020955, "grad_norm": 1.09375, "learning_rate": 0.00040720028614410497, "loss": 4.8771, "mean_token_accuracy": 0.22817520648241044, "num_tokens": 71135555.0, "step": 31055 }, { "entropy": 5.709377336502075, "epoch": 3.070383550810597, "grad_norm": 1.1796875, "learning_rate": 0.0004071717284676687, "loss": 4.8917, "mean_token_accuracy": 0.22726430594921113, "num_tokens": 71147304.0, "step": 31060 }, { "entropy": 5.749471807479859, "epoch": 3.0708778173190985, "grad_norm": 1.2109375, "learning_rate": 0.0004071431675397874, "loss": 4.9561, "mean_token_accuracy": 0.21819481998682022, "num_tokens": 71157564.0, "step": 31065 }, { "entropy": 5.6463275909423825, "epoch": 3.0713720838275997, "grad_norm": 1.125, "learning_rate": 0.00040711460336116364, "loss": 4.8295, "mean_token_accuracy": 0.23938505500555038, "num_tokens": 71168994.0, "step": 31070 }, { "entropy": 5.760703754425049, "epoch": 3.0718663503361014, "grad_norm": 1.0859375, "learning_rate": 0.00040708603593250016, "loss": 4.9544, "mean_token_accuracy": 0.2271053224802017, "num_tokens": 71180736.0, "step": 31075 }, { "entropy": 5.617252826690674, "epoch": 3.0723606168446027, "grad_norm": 1.078125, "learning_rate": 0.00040705746525449964, "loss": 4.8698, "mean_token_accuracy": 0.23434925824403763, "num_tokens": 71193187.0, "step": 31080 }, { "entropy": 5.682850313186646, "epoch": 3.072854883353104, "grad_norm": 1.125, "learning_rate": 0.00040702889132786507, "loss": 4.8653, "mean_token_accuracy": 0.23569113165140151, "num_tokens": 71204294.0, "step": 31085 }, { "entropy": 5.708966016769409, "epoch": 3.0733491498616052, "grad_norm": 1.296875, "learning_rate": 0.0004070003141532994, "loss": 4.9333, "mean_token_accuracy": 0.22191777229309081, "num_tokens": 71215259.0, "step": 31090 }, { "entropy": 5.6914191246032715, "epoch": 3.073843416370107, "grad_norm": 1.1328125, "learning_rate": 0.0004069717337315053, "loss": 4.936, "mean_token_accuracy": 0.2264552891254425, "num_tokens": 71227008.0, "step": 31095 }, { "entropy": 5.70731029510498, "epoch": 3.074337682878608, "grad_norm": 1.1328125, "learning_rate": 0.00040694315006318616, "loss": 4.9518, "mean_token_accuracy": 0.22575569599866868, "num_tokens": 71238190.0, "step": 31100 }, { "entropy": 5.781340312957764, "epoch": 3.0748319493871095, "grad_norm": 1.1796875, "learning_rate": 0.00040691456314904506, "loss": 4.9909, "mean_token_accuracy": 0.21723149269819259, "num_tokens": 71250534.0, "step": 31105 }, { "entropy": 5.689663505554199, "epoch": 3.0753262158956107, "grad_norm": 1.1640625, "learning_rate": 0.00040688597298978526, "loss": 4.9054, "mean_token_accuracy": 0.2318237841129303, "num_tokens": 71261432.0, "step": 31110 }, { "entropy": 5.7156758308410645, "epoch": 3.0758204824041124, "grad_norm": 1.2109375, "learning_rate": 0.0004068573795861101, "loss": 4.9962, "mean_token_accuracy": 0.21474476158618927, "num_tokens": 71272090.0, "step": 31115 }, { "entropy": 5.68539342880249, "epoch": 3.0763147489126137, "grad_norm": 1.078125, "learning_rate": 0.0004068287829387229, "loss": 4.9342, "mean_token_accuracy": 0.2241128757596016, "num_tokens": 71284696.0, "step": 31120 }, { "entropy": 5.683704566955567, "epoch": 3.076809015421115, "grad_norm": 1.15625, "learning_rate": 0.00040680018304832717, "loss": 4.9132, "mean_token_accuracy": 0.22966473549604416, "num_tokens": 71295701.0, "step": 31125 }, { "entropy": 5.723582983016968, "epoch": 3.0773032819296167, "grad_norm": 1.2265625, "learning_rate": 0.00040677157991562653, "loss": 4.9353, "mean_token_accuracy": 0.23452252000570298, "num_tokens": 71306798.0, "step": 31130 }, { "entropy": 5.703930521011353, "epoch": 3.077797548438118, "grad_norm": 1.1953125, "learning_rate": 0.0004067429735413245, "loss": 4.9366, "mean_token_accuracy": 0.22511770725250244, "num_tokens": 71319171.0, "step": 31135 }, { "entropy": 5.7279328346252445, "epoch": 3.078291814946619, "grad_norm": 1.15625, "learning_rate": 0.000406714363926125, "loss": 4.9478, "mean_token_accuracy": 0.22067981362342834, "num_tokens": 71331479.0, "step": 31140 }, { "entropy": 5.669634246826172, "epoch": 3.0787860814551204, "grad_norm": 1.1328125, "learning_rate": 0.00040668575107073165, "loss": 4.9178, "mean_token_accuracy": 0.23055005073547363, "num_tokens": 71343044.0, "step": 31145 }, { "entropy": 5.810487413406372, "epoch": 3.079280347963622, "grad_norm": 1.171875, "learning_rate": 0.00040665713497584836, "loss": 4.9931, "mean_token_accuracy": 0.2229029580950737, "num_tokens": 71354552.0, "step": 31150 }, { "entropy": 5.713155937194824, "epoch": 3.0797746144721234, "grad_norm": 1.171875, "learning_rate": 0.00040662851564217915, "loss": 4.9011, "mean_token_accuracy": 0.23371504247188568, "num_tokens": 71366201.0, "step": 31155 }, { "entropy": 5.70947380065918, "epoch": 3.0802688809806247, "grad_norm": 1.078125, "learning_rate": 0.00040659989307042816, "loss": 4.8986, "mean_token_accuracy": 0.2202175334095955, "num_tokens": 71377966.0, "step": 31160 }, { "entropy": 5.710884380340576, "epoch": 3.080763147489126, "grad_norm": 1.1953125, "learning_rate": 0.00040657126726129924, "loss": 4.9721, "mean_token_accuracy": 0.2262341558933258, "num_tokens": 71388927.0, "step": 31165 }, { "entropy": 5.702050399780274, "epoch": 3.0812574139976276, "grad_norm": 1.125, "learning_rate": 0.0004065426382154968, "loss": 4.9549, "mean_token_accuracy": 0.22521415650844573, "num_tokens": 71401728.0, "step": 31170 }, { "entropy": 5.810238265991211, "epoch": 3.081751680506129, "grad_norm": 1.140625, "learning_rate": 0.000406514005933725, "loss": 5.0944, "mean_token_accuracy": 0.2099160596728325, "num_tokens": 71413694.0, "step": 31175 }, { "entropy": 5.7336677551269535, "epoch": 3.08224594701463, "grad_norm": 1.2265625, "learning_rate": 0.0004064853704166883, "loss": 4.9104, "mean_token_accuracy": 0.2298359453678131, "num_tokens": 71425485.0, "step": 31180 }, { "entropy": 5.731386661529541, "epoch": 3.082740213523132, "grad_norm": 1.1015625, "learning_rate": 0.000406456731665091, "loss": 4.9518, "mean_token_accuracy": 0.21932245939970016, "num_tokens": 71437320.0, "step": 31185 }, { "entropy": 5.7461425304412845, "epoch": 3.083234480031633, "grad_norm": 1.1484375, "learning_rate": 0.00040642808967963787, "loss": 4.9479, "mean_token_accuracy": 0.2205512046813965, "num_tokens": 71448948.0, "step": 31190 }, { "entropy": 5.694533634185791, "epoch": 3.0837287465401344, "grad_norm": 1.125, "learning_rate": 0.00040639944446103324, "loss": 4.8874, "mean_token_accuracy": 0.2287810727953911, "num_tokens": 71460997.0, "step": 31195 }, { "entropy": 5.672366380691528, "epoch": 3.0842230130486357, "grad_norm": 1.1328125, "learning_rate": 0.00040637079600998186, "loss": 4.8923, "mean_token_accuracy": 0.22718246877193451, "num_tokens": 71472174.0, "step": 31200 }, { "entropy": 5.735339498519897, "epoch": 3.0847172795571374, "grad_norm": 1.15625, "learning_rate": 0.0004063421443271885, "loss": 4.9658, "mean_token_accuracy": 0.22571628391742707, "num_tokens": 71484306.0, "step": 31205 }, { "entropy": 5.721938848495483, "epoch": 3.0852115460656386, "grad_norm": 1.3203125, "learning_rate": 0.00040631348941335814, "loss": 4.906, "mean_token_accuracy": 0.22412378937005997, "num_tokens": 71494866.0, "step": 31210 }, { "entropy": 5.737693786621094, "epoch": 3.08570581257414, "grad_norm": 1.1640625, "learning_rate": 0.0004062848312691955, "loss": 4.9307, "mean_token_accuracy": 0.22584894597530364, "num_tokens": 71505591.0, "step": 31215 }, { "entropy": 5.718345594406128, "epoch": 3.086200079082641, "grad_norm": 1.1953125, "learning_rate": 0.00040625616989540565, "loss": 4.9472, "mean_token_accuracy": 0.22469822615385054, "num_tokens": 71517651.0, "step": 31220 }, { "entropy": 5.787763833999634, "epoch": 3.086694345591143, "grad_norm": 1.234375, "learning_rate": 0.0004062275052926936, "loss": 4.9671, "mean_token_accuracy": 0.21957968026399613, "num_tokens": 71529301.0, "step": 31225 }, { "entropy": 5.609581422805786, "epoch": 3.087188612099644, "grad_norm": 1.2109375, "learning_rate": 0.0004061988374617646, "loss": 4.8004, "mean_token_accuracy": 0.23956407755613326, "num_tokens": 71539971.0, "step": 31230 }, { "entropy": 5.697654819488525, "epoch": 3.0876828786081454, "grad_norm": 1.09375, "learning_rate": 0.0004061701664033239, "loss": 5.0008, "mean_token_accuracy": 0.2199922189116478, "num_tokens": 71551905.0, "step": 31235 }, { "entropy": 5.729603624343872, "epoch": 3.088177145116647, "grad_norm": 1.296875, "learning_rate": 0.0004061414921180767, "loss": 4.923, "mean_token_accuracy": 0.22901807427406312, "num_tokens": 71562945.0, "step": 31240 }, { "entropy": 5.716499996185303, "epoch": 3.0886714116251484, "grad_norm": 1.21875, "learning_rate": 0.00040611281460672846, "loss": 5.0207, "mean_token_accuracy": 0.2128499686717987, "num_tokens": 71574429.0, "step": 31245 }, { "entropy": 5.717672634124756, "epoch": 3.0891656781336496, "grad_norm": 1.34375, "learning_rate": 0.0004060841338699847, "loss": 4.9806, "mean_token_accuracy": 0.22163566052913666, "num_tokens": 71584827.0, "step": 31250 }, { "entropy": 5.75890007019043, "epoch": 3.089659944642151, "grad_norm": 1.1328125, "learning_rate": 0.00040605544990855074, "loss": 4.8915, "mean_token_accuracy": 0.22389666587114335, "num_tokens": 71595729.0, "step": 31255 }, { "entropy": 5.7560326099395756, "epoch": 3.0901542111506526, "grad_norm": 1.171875, "learning_rate": 0.00040602676272313257, "loss": 4.9406, "mean_token_accuracy": 0.2305128663778305, "num_tokens": 71606912.0, "step": 31260 }, { "entropy": 5.706454801559448, "epoch": 3.090648477659154, "grad_norm": 1.2109375, "learning_rate": 0.00040599807231443566, "loss": 4.9866, "mean_token_accuracy": 0.22579252421855928, "num_tokens": 71618706.0, "step": 31265 }, { "entropy": 5.703484725952149, "epoch": 3.091142744167655, "grad_norm": 1.1875, "learning_rate": 0.0004059693786831658, "loss": 4.9061, "mean_token_accuracy": 0.22688717991113663, "num_tokens": 71630826.0, "step": 31270 }, { "entropy": 5.767189979553223, "epoch": 3.0916370106761564, "grad_norm": 1.1484375, "learning_rate": 0.000405940681830029, "loss": 5.0019, "mean_token_accuracy": 0.22507247775793077, "num_tokens": 71643914.0, "step": 31275 }, { "entropy": 5.726987314224243, "epoch": 3.092131277184658, "grad_norm": 1.1171875, "learning_rate": 0.000405911981755731, "loss": 4.9029, "mean_token_accuracy": 0.2315288871526718, "num_tokens": 71655523.0, "step": 31280 }, { "entropy": 5.6731593132019045, "epoch": 3.0926255436931593, "grad_norm": 1.1328125, "learning_rate": 0.0004058832784609779, "loss": 4.9094, "mean_token_accuracy": 0.23002844154834748, "num_tokens": 71667423.0, "step": 31285 }, { "entropy": 5.659725856781006, "epoch": 3.0931198102016606, "grad_norm": 1.2265625, "learning_rate": 0.00040585457194647595, "loss": 4.9119, "mean_token_accuracy": 0.22417925596237182, "num_tokens": 71678116.0, "step": 31290 }, { "entropy": 5.745096063613891, "epoch": 3.0936140767101623, "grad_norm": 1.15625, "learning_rate": 0.00040582586221293127, "loss": 4.9962, "mean_token_accuracy": 0.2172016754746437, "num_tokens": 71690109.0, "step": 31295 }, { "entropy": 5.776556539535522, "epoch": 3.0941083432186636, "grad_norm": 1.125, "learning_rate": 0.00040579714926105, "loss": 5.0262, "mean_token_accuracy": 0.21753207445144654, "num_tokens": 71702640.0, "step": 31300 }, { "entropy": 5.717349672317505, "epoch": 3.094602609727165, "grad_norm": 1.109375, "learning_rate": 0.0004057684330915386, "loss": 4.9112, "mean_token_accuracy": 0.2259405493736267, "num_tokens": 71714537.0, "step": 31305 }, { "entropy": 5.685066080093383, "epoch": 3.095096876235666, "grad_norm": 1.28125, "learning_rate": 0.00040573971370510344, "loss": 5.0178, "mean_token_accuracy": 0.2217104747891426, "num_tokens": 71724901.0, "step": 31310 }, { "entropy": 5.759277057647705, "epoch": 3.095591142744168, "grad_norm": 1.0625, "learning_rate": 0.000405710991102451, "loss": 4.994, "mean_token_accuracy": 0.2186857581138611, "num_tokens": 71736640.0, "step": 31315 }, { "entropy": 5.780472993850708, "epoch": 3.096085409252669, "grad_norm": 1.3671875, "learning_rate": 0.00040568226528428795, "loss": 4.9923, "mean_token_accuracy": 0.21885482370853424, "num_tokens": 71747193.0, "step": 31320 }, { "entropy": 5.7577821731567385, "epoch": 3.0965796757611703, "grad_norm": 1.2421875, "learning_rate": 0.000405653536251321, "loss": 5.0427, "mean_token_accuracy": 0.21533706337213515, "num_tokens": 71759073.0, "step": 31325 }, { "entropy": 5.762305116653442, "epoch": 3.097073942269672, "grad_norm": 1.046875, "learning_rate": 0.0004056248040042566, "loss": 4.9603, "mean_token_accuracy": 0.21935534626245498, "num_tokens": 71770486.0, "step": 31330 }, { "entropy": 5.761210250854492, "epoch": 3.0975682087781733, "grad_norm": 1.203125, "learning_rate": 0.00040559606854380186, "loss": 5.0241, "mean_token_accuracy": 0.22060358971357347, "num_tokens": 71781536.0, "step": 31335 }, { "entropy": 5.743462181091308, "epoch": 3.0980624752866746, "grad_norm": 1.1953125, "learning_rate": 0.00040556732987066357, "loss": 5.009, "mean_token_accuracy": 0.22493914514780045, "num_tokens": 71792521.0, "step": 31340 }, { "entropy": 5.705568647384643, "epoch": 3.098556741795176, "grad_norm": 1.1640625, "learning_rate": 0.0004055385879855487, "loss": 4.9938, "mean_token_accuracy": 0.22277334332466125, "num_tokens": 71804150.0, "step": 31345 }, { "entropy": 5.647363138198853, "epoch": 3.0990510083036775, "grad_norm": 1.1640625, "learning_rate": 0.00040550984288916436, "loss": 4.9196, "mean_token_accuracy": 0.23266882002353667, "num_tokens": 71815842.0, "step": 31350 }, { "entropy": 5.8149501323699955, "epoch": 3.099545274812179, "grad_norm": 1.171875, "learning_rate": 0.00040548109458221756, "loss": 4.9558, "mean_token_accuracy": 0.2228508174419403, "num_tokens": 71827243.0, "step": 31355 }, { "entropy": 5.775880241394043, "epoch": 3.10003954132068, "grad_norm": 1.28125, "learning_rate": 0.0004054523430654156, "loss": 5.0069, "mean_token_accuracy": 0.2256786346435547, "num_tokens": 71839424.0, "step": 31360 }, { "entropy": 5.739609336853027, "epoch": 3.1005338078291813, "grad_norm": 1.1640625, "learning_rate": 0.00040542358833946577, "loss": 5.0157, "mean_token_accuracy": 0.21733000725507737, "num_tokens": 71851709.0, "step": 31365 }, { "entropy": 5.7281341552734375, "epoch": 3.101028074337683, "grad_norm": 1.109375, "learning_rate": 0.0004053948304050755, "loss": 4.9285, "mean_token_accuracy": 0.225421042740345, "num_tokens": 71862841.0, "step": 31370 }, { "entropy": 5.7415464401245115, "epoch": 3.1015223408461843, "grad_norm": 1.1796875, "learning_rate": 0.00040536606926295203, "loss": 4.935, "mean_token_accuracy": 0.23016288727521897, "num_tokens": 71873104.0, "step": 31375 }, { "entropy": 5.792458152770996, "epoch": 3.1020166073546855, "grad_norm": 1.171875, "learning_rate": 0.00040533730491380316, "loss": 5.0455, "mean_token_accuracy": 0.21659953147172928, "num_tokens": 71884809.0, "step": 31380 }, { "entropy": 5.693872165679932, "epoch": 3.102510873863187, "grad_norm": 1.1484375, "learning_rate": 0.0004053085373583363, "loss": 4.9467, "mean_token_accuracy": 0.2260803371667862, "num_tokens": 71896625.0, "step": 31385 }, { "entropy": 5.682625436782837, "epoch": 3.1030051403716885, "grad_norm": 1.2265625, "learning_rate": 0.0004052797665972593, "loss": 4.9256, "mean_token_accuracy": 0.22938040345907212, "num_tokens": 71908628.0, "step": 31390 }, { "entropy": 5.757524728775024, "epoch": 3.1034994068801898, "grad_norm": 1.2734375, "learning_rate": 0.00040525099263127976, "loss": 4.9654, "mean_token_accuracy": 0.22198040932416915, "num_tokens": 71919971.0, "step": 31395 }, { "entropy": 5.764160108566284, "epoch": 3.103993673388691, "grad_norm": 1.1796875, "learning_rate": 0.00040522221546110556, "loss": 5.0166, "mean_token_accuracy": 0.22115676254034042, "num_tokens": 71931240.0, "step": 31400 }, { "entropy": 5.701149129867554, "epoch": 3.1044879398971927, "grad_norm": 1.1328125, "learning_rate": 0.00040519343508744473, "loss": 4.9414, "mean_token_accuracy": 0.22984751611948012, "num_tokens": 71942735.0, "step": 31405 }, { "entropy": 5.688599395751953, "epoch": 3.104982206405694, "grad_norm": 1.25, "learning_rate": 0.00040516465151100515, "loss": 4.9084, "mean_token_accuracy": 0.24144310802221297, "num_tokens": 71953685.0, "step": 31410 }, { "entropy": 5.7322924613952635, "epoch": 3.1054764729141953, "grad_norm": 1.2578125, "learning_rate": 0.00040513586473249496, "loss": 4.9649, "mean_token_accuracy": 0.22066458761692048, "num_tokens": 71966061.0, "step": 31415 }, { "entropy": 5.7660572052001955, "epoch": 3.1059707394226965, "grad_norm": 1.1640625, "learning_rate": 0.0004051070747526223, "loss": 4.9936, "mean_token_accuracy": 0.2141634553670883, "num_tokens": 71978002.0, "step": 31420 }, { "entropy": 5.677839040756226, "epoch": 3.1064650059311982, "grad_norm": 1.2734375, "learning_rate": 0.00040507828157209546, "loss": 4.8687, "mean_token_accuracy": 0.23158190548419952, "num_tokens": 71988504.0, "step": 31425 }, { "entropy": 5.722964239120484, "epoch": 3.1069592724396995, "grad_norm": 1.125, "learning_rate": 0.00040504948519162276, "loss": 5.0031, "mean_token_accuracy": 0.2152043864130974, "num_tokens": 72000900.0, "step": 31430 }, { "entropy": 5.793111658096313, "epoch": 3.1074535389482008, "grad_norm": 1.21875, "learning_rate": 0.0004050206856119124, "loss": 5.0191, "mean_token_accuracy": 0.21697353422641755, "num_tokens": 72011134.0, "step": 31435 }, { "entropy": 5.7023913860321045, "epoch": 3.1079478054567025, "grad_norm": 1.171875, "learning_rate": 0.0004049918828336732, "loss": 4.9119, "mean_token_accuracy": 0.22637180387973785, "num_tokens": 72022784.0, "step": 31440 }, { "entropy": 5.673501110076904, "epoch": 3.1084420719652037, "grad_norm": 1.21875, "learning_rate": 0.0004049630768576133, "loss": 4.8836, "mean_token_accuracy": 0.22919871658086777, "num_tokens": 72033353.0, "step": 31445 }, { "entropy": 5.744571208953857, "epoch": 3.108936338473705, "grad_norm": 1.234375, "learning_rate": 0.00040493426768444164, "loss": 4.9521, "mean_token_accuracy": 0.2181500419974327, "num_tokens": 72044182.0, "step": 31450 }, { "entropy": 5.797312307357788, "epoch": 3.1094306049822062, "grad_norm": 1.0859375, "learning_rate": 0.0004049054553148668, "loss": 5.0151, "mean_token_accuracy": 0.21082063317298888, "num_tokens": 72056365.0, "step": 31455 }, { "entropy": 5.724458694458008, "epoch": 3.109924871490708, "grad_norm": 1.28125, "learning_rate": 0.0004048766397495977, "loss": 4.9187, "mean_token_accuracy": 0.22703131139278412, "num_tokens": 72066580.0, "step": 31460 }, { "entropy": 5.643708944320679, "epoch": 3.110419137999209, "grad_norm": 1.1796875, "learning_rate": 0.00040484782098934303, "loss": 4.9641, "mean_token_accuracy": 0.22813219726085662, "num_tokens": 72077731.0, "step": 31465 }, { "entropy": 5.7252216815948485, "epoch": 3.1109134045077105, "grad_norm": 1.4609375, "learning_rate": 0.0004048189990348119, "loss": 4.9782, "mean_token_accuracy": 0.21828000098466874, "num_tokens": 72088785.0, "step": 31470 }, { "entropy": 5.751339101791382, "epoch": 3.1114076710162117, "grad_norm": 1.171875, "learning_rate": 0.00040479017388671317, "loss": 4.927, "mean_token_accuracy": 0.23021653443574905, "num_tokens": 72100235.0, "step": 31475 }, { "entropy": 5.645326852798462, "epoch": 3.1119019375247134, "grad_norm": 1.1875, "learning_rate": 0.00040476134554575613, "loss": 4.8912, "mean_token_accuracy": 0.2246718406677246, "num_tokens": 72112124.0, "step": 31480 }, { "entropy": 5.717307138442993, "epoch": 3.1123962040332147, "grad_norm": 1.15625, "learning_rate": 0.0004047325140126497, "loss": 4.9369, "mean_token_accuracy": 0.22012407034635545, "num_tokens": 72124138.0, "step": 31485 }, { "entropy": 5.732042026519776, "epoch": 3.112890470541716, "grad_norm": 1.1640625, "learning_rate": 0.00040470367928810343, "loss": 4.9369, "mean_token_accuracy": 0.22572326064109802, "num_tokens": 72134330.0, "step": 31490 }, { "entropy": 5.824021339416504, "epoch": 3.1133847370502177, "grad_norm": 1.1328125, "learning_rate": 0.00040467484137282644, "loss": 5.068, "mean_token_accuracy": 0.2133909910917282, "num_tokens": 72146999.0, "step": 31495 }, { "entropy": 5.745410680770874, "epoch": 3.113879003558719, "grad_norm": 1.171875, "learning_rate": 0.00040464600026752834, "loss": 4.9349, "mean_token_accuracy": 0.2273472413420677, "num_tokens": 72158648.0, "step": 31500 }, { "entropy": 5.7780516147613525, "epoch": 3.11437327006722, "grad_norm": 1.140625, "learning_rate": 0.0004046171559729184, "loss": 4.9525, "mean_token_accuracy": 0.2263324126601219, "num_tokens": 72169621.0, "step": 31505 }, { "entropy": 5.679072475433349, "epoch": 3.1148675365757215, "grad_norm": 1.203125, "learning_rate": 0.0004045883084897064, "loss": 4.8808, "mean_token_accuracy": 0.22987501323223114, "num_tokens": 72179928.0, "step": 31510 }, { "entropy": 5.6903337955474855, "epoch": 3.115361803084223, "grad_norm": 1.1171875, "learning_rate": 0.00040455945781860185, "loss": 4.9067, "mean_token_accuracy": 0.22699038833379745, "num_tokens": 72190699.0, "step": 31515 }, { "entropy": 5.709006929397583, "epoch": 3.1158560695927244, "grad_norm": 1.1328125, "learning_rate": 0.0004045306039603146, "loss": 4.9792, "mean_token_accuracy": 0.22325705289840697, "num_tokens": 72202893.0, "step": 31520 }, { "entropy": 5.685155963897705, "epoch": 3.1163503361012257, "grad_norm": 1.1796875, "learning_rate": 0.00040450174691555434, "loss": 5.0271, "mean_token_accuracy": 0.21683308631181716, "num_tokens": 72214614.0, "step": 31525 }, { "entropy": 5.685437250137329, "epoch": 3.116844602609727, "grad_norm": 1.21875, "learning_rate": 0.0004044728866850311, "loss": 4.939, "mean_token_accuracy": 0.22852666079998016, "num_tokens": 72225882.0, "step": 31530 }, { "entropy": 5.782245111465454, "epoch": 3.1173388691182287, "grad_norm": 1.203125, "learning_rate": 0.0004044440232694547, "loss": 4.9572, "mean_token_accuracy": 0.22150728106498718, "num_tokens": 72236264.0, "step": 31535 }, { "entropy": 5.740688943862915, "epoch": 3.11783313562673, "grad_norm": 1.1484375, "learning_rate": 0.0004044151566695353, "loss": 5.0272, "mean_token_accuracy": 0.2189900115132332, "num_tokens": 72247380.0, "step": 31540 }, { "entropy": 5.73533992767334, "epoch": 3.118327402135231, "grad_norm": 1.1953125, "learning_rate": 0.00040438628688598287, "loss": 4.8638, "mean_token_accuracy": 0.230111263692379, "num_tokens": 72259141.0, "step": 31545 }, { "entropy": 5.6774030208587645, "epoch": 3.118821668643733, "grad_norm": 1.1953125, "learning_rate": 0.0004043574139195078, "loss": 4.8268, "mean_token_accuracy": 0.23159618824720382, "num_tokens": 72269549.0, "step": 31550 }, { "entropy": 5.673881196975708, "epoch": 3.119315935152234, "grad_norm": 1.15625, "learning_rate": 0.00040432853777082025, "loss": 4.9053, "mean_token_accuracy": 0.23007372319698333, "num_tokens": 72281589.0, "step": 31555 }, { "entropy": 5.7159655570983885, "epoch": 3.1198102016607354, "grad_norm": 1.21875, "learning_rate": 0.0004042996584406305, "loss": 5.0175, "mean_token_accuracy": 0.21938789784908294, "num_tokens": 72294239.0, "step": 31560 }, { "entropy": 5.690757465362549, "epoch": 3.1203044681692367, "grad_norm": 1.265625, "learning_rate": 0.00040427077592964923, "loss": 4.9886, "mean_token_accuracy": 0.22104758769273758, "num_tokens": 72306153.0, "step": 31565 }, { "entropy": 5.71517162322998, "epoch": 3.1207987346777384, "grad_norm": 1.1953125, "learning_rate": 0.0004042418902385868, "loss": 4.9349, "mean_token_accuracy": 0.2226513773202896, "num_tokens": 72317270.0, "step": 31570 }, { "entropy": 5.721489095687867, "epoch": 3.1212930011862396, "grad_norm": 1.125, "learning_rate": 0.00040421300136815375, "loss": 4.9838, "mean_token_accuracy": 0.22252339124679565, "num_tokens": 72329073.0, "step": 31575 }, { "entropy": 5.691077470779419, "epoch": 3.121787267694741, "grad_norm": 1.2109375, "learning_rate": 0.0004041841093190609, "loss": 4.9224, "mean_token_accuracy": 0.22589288651943207, "num_tokens": 72339677.0, "step": 31580 }, { "entropy": 5.776186132431031, "epoch": 3.1222815342032426, "grad_norm": 1.3125, "learning_rate": 0.0004041552140920189, "loss": 4.9716, "mean_token_accuracy": 0.22918739765882493, "num_tokens": 72350527.0, "step": 31585 }, { "entropy": 5.759203195571899, "epoch": 3.122775800711744, "grad_norm": 1.171875, "learning_rate": 0.0004041263156877386, "loss": 4.9799, "mean_token_accuracy": 0.219963239133358, "num_tokens": 72362740.0, "step": 31590 }, { "entropy": 5.710923910140991, "epoch": 3.123270067220245, "grad_norm": 1.2265625, "learning_rate": 0.00040409741410693084, "loss": 4.9462, "mean_token_accuracy": 0.21731142103672027, "num_tokens": 72372705.0, "step": 31595 }, { "entropy": 5.596602964401245, "epoch": 3.1237643337287464, "grad_norm": 1.234375, "learning_rate": 0.00040406850935030677, "loss": 4.8619, "mean_token_accuracy": 0.23526178449392318, "num_tokens": 72385085.0, "step": 31600 }, { "entropy": 5.6815074443817135, "epoch": 3.124258600237248, "grad_norm": 1.1796875, "learning_rate": 0.00040403960141857724, "loss": 4.9771, "mean_token_accuracy": 0.22717182487249374, "num_tokens": 72397017.0, "step": 31605 }, { "entropy": 5.746268367767334, "epoch": 3.1247528667457494, "grad_norm": 1.1953125, "learning_rate": 0.0004040106903124536, "loss": 4.9338, "mean_token_accuracy": 0.221175517141819, "num_tokens": 72409378.0, "step": 31610 }, { "entropy": 5.754933214187622, "epoch": 3.1252471332542506, "grad_norm": 1.2265625, "learning_rate": 0.0004039817760326469, "loss": 5.0087, "mean_token_accuracy": 0.21484584361314774, "num_tokens": 72420585.0, "step": 31615 }, { "entropy": 5.806163024902344, "epoch": 3.125741399762752, "grad_norm": 1.1484375, "learning_rate": 0.00040395285857986845, "loss": 5.0827, "mean_token_accuracy": 0.21263491958379746, "num_tokens": 72431779.0, "step": 31620 }, { "entropy": 5.745228576660156, "epoch": 3.1262356662712536, "grad_norm": 1.15625, "learning_rate": 0.0004039239379548298, "loss": 4.9075, "mean_token_accuracy": 0.22435821890830993, "num_tokens": 72441421.0, "step": 31625 }, { "entropy": 5.774961614608765, "epoch": 3.126729932779755, "grad_norm": 1.25, "learning_rate": 0.0004038950141582422, "loss": 4.968, "mean_token_accuracy": 0.22007061243057252, "num_tokens": 72452664.0, "step": 31630 }, { "entropy": 5.68954610824585, "epoch": 3.127224199288256, "grad_norm": 1.140625, "learning_rate": 0.0004038660871908173, "loss": 4.8621, "mean_token_accuracy": 0.23072129487991333, "num_tokens": 72464008.0, "step": 31635 }, { "entropy": 5.773107481002808, "epoch": 3.1277184657967574, "grad_norm": 1.2109375, "learning_rate": 0.00040383715705326665, "loss": 5.0476, "mean_token_accuracy": 0.21385151892900467, "num_tokens": 72475782.0, "step": 31640 }, { "entropy": 5.704550647735596, "epoch": 3.128212732305259, "grad_norm": 1.09375, "learning_rate": 0.0004038082237463019, "loss": 4.975, "mean_token_accuracy": 0.2204524338245392, "num_tokens": 72487770.0, "step": 31645 }, { "entropy": 5.653398656845093, "epoch": 3.1287069988137604, "grad_norm": 1.1328125, "learning_rate": 0.00040377928727063485, "loss": 4.8925, "mean_token_accuracy": 0.2310608670115471, "num_tokens": 72499336.0, "step": 31650 }, { "entropy": 5.708260726928711, "epoch": 3.1292012653222616, "grad_norm": 1.1328125, "learning_rate": 0.00040375034762697736, "loss": 4.937, "mean_token_accuracy": 0.223634672164917, "num_tokens": 72510658.0, "step": 31655 }, { "entropy": 5.721911668777466, "epoch": 3.1296955318307633, "grad_norm": 1.1796875, "learning_rate": 0.0004037214048160415, "loss": 4.9633, "mean_token_accuracy": 0.21866945475339888, "num_tokens": 72522617.0, "step": 31660 }, { "entropy": 5.684777450561524, "epoch": 3.1301897983392646, "grad_norm": 1.2265625, "learning_rate": 0.0004036924588385389, "loss": 4.8519, "mean_token_accuracy": 0.23900388777256013, "num_tokens": 72532829.0, "step": 31665 }, { "entropy": 5.720617961883545, "epoch": 3.130684064847766, "grad_norm": 1.203125, "learning_rate": 0.00040366350969518196, "loss": 4.9315, "mean_token_accuracy": 0.2335021197795868, "num_tokens": 72543556.0, "step": 31670 }, { "entropy": 5.79214825630188, "epoch": 3.131178331356267, "grad_norm": 1.1875, "learning_rate": 0.0004036345573866827, "loss": 4.9969, "mean_token_accuracy": 0.21669473201036454, "num_tokens": 72554545.0, "step": 31675 }, { "entropy": 5.803208446502685, "epoch": 3.131672597864769, "grad_norm": 1.1953125, "learning_rate": 0.00040360560191375335, "loss": 5.0471, "mean_token_accuracy": 0.21242739707231523, "num_tokens": 72566158.0, "step": 31680 }, { "entropy": 5.758175325393677, "epoch": 3.13216686437327, "grad_norm": 1.1953125, "learning_rate": 0.0004035766432771063, "loss": 5.0666, "mean_token_accuracy": 0.21780523657798767, "num_tokens": 72578229.0, "step": 31685 }, { "entropy": 5.6706194400787355, "epoch": 3.1326611308817713, "grad_norm": 1.234375, "learning_rate": 0.00040354768147745387, "loss": 4.8682, "mean_token_accuracy": 0.23317491561174392, "num_tokens": 72589237.0, "step": 31690 }, { "entropy": 5.750687026977539, "epoch": 3.133155397390273, "grad_norm": 1.140625, "learning_rate": 0.0004035187165155085, "loss": 4.9702, "mean_token_accuracy": 0.22496314197778702, "num_tokens": 72600531.0, "step": 31695 }, { "entropy": 5.710323143005371, "epoch": 3.1336496638987743, "grad_norm": 1.171875, "learning_rate": 0.0004034897483919827, "loss": 4.9053, "mean_token_accuracy": 0.22635679543018342, "num_tokens": 72611861.0, "step": 31700 }, { "entropy": 5.732558298110962, "epoch": 3.1341439304072756, "grad_norm": 1.1640625, "learning_rate": 0.0004034607771075893, "loss": 4.9887, "mean_token_accuracy": 0.22363526821136476, "num_tokens": 72624142.0, "step": 31705 }, { "entropy": 5.702888154983521, "epoch": 3.134638196915777, "grad_norm": 1.3125, "learning_rate": 0.00040343180266304074, "loss": 4.901, "mean_token_accuracy": 0.22720416337251664, "num_tokens": 72634995.0, "step": 31710 }, { "entropy": 5.768390750885009, "epoch": 3.1351324634242785, "grad_norm": 1.1171875, "learning_rate": 0.00040340282505904997, "loss": 5.0145, "mean_token_accuracy": 0.2214521810412407, "num_tokens": 72646798.0, "step": 31715 }, { "entropy": 5.74534592628479, "epoch": 3.13562672993278, "grad_norm": 1.2109375, "learning_rate": 0.00040337384429632974, "loss": 4.9645, "mean_token_accuracy": 0.22634658962488174, "num_tokens": 72657938.0, "step": 31720 }, { "entropy": 5.786575651168823, "epoch": 3.136120996441281, "grad_norm": 1.1484375, "learning_rate": 0.000403344860375593, "loss": 5.0207, "mean_token_accuracy": 0.21638917922973633, "num_tokens": 72671069.0, "step": 31725 }, { "entropy": 5.732324123382568, "epoch": 3.1366152629497823, "grad_norm": 1.203125, "learning_rate": 0.0004033158732975529, "loss": 4.9656, "mean_token_accuracy": 0.2240966945886612, "num_tokens": 72682695.0, "step": 31730 }, { "entropy": 5.732345533370972, "epoch": 3.137109529458284, "grad_norm": 1.078125, "learning_rate": 0.0004032868830629223, "loss": 5.0004, "mean_token_accuracy": 0.2207697555422783, "num_tokens": 72694514.0, "step": 31735 }, { "entropy": 5.686329936981201, "epoch": 3.1376037959667853, "grad_norm": 1.1875, "learning_rate": 0.00040325788967241453, "loss": 4.9014, "mean_token_accuracy": 0.22417863160371782, "num_tokens": 72705427.0, "step": 31740 }, { "entropy": 5.655508327484131, "epoch": 3.1380980624752866, "grad_norm": 1.28125, "learning_rate": 0.00040322889312674275, "loss": 4.8744, "mean_token_accuracy": 0.22913722395896913, "num_tokens": 72716877.0, "step": 31745 }, { "entropy": 5.685426902770996, "epoch": 3.1385923289837883, "grad_norm": 1.1640625, "learning_rate": 0.00040319989342662036, "loss": 4.9027, "mean_token_accuracy": 0.22637013345956802, "num_tokens": 72727927.0, "step": 31750 }, { "entropy": 5.776641845703125, "epoch": 3.1390865954922895, "grad_norm": 1.1875, "learning_rate": 0.00040317089057276067, "loss": 5.0313, "mean_token_accuracy": 0.22064234018325807, "num_tokens": 72739645.0, "step": 31755 }, { "entropy": 5.759417247772217, "epoch": 3.139580862000791, "grad_norm": 1.0625, "learning_rate": 0.0004031418845658772, "loss": 5.0366, "mean_token_accuracy": 0.20906257778406143, "num_tokens": 72750961.0, "step": 31760 }, { "entropy": 5.826264142990112, "epoch": 3.140075128509292, "grad_norm": 1.1171875, "learning_rate": 0.00040311287540668346, "loss": 5.015, "mean_token_accuracy": 0.21465834081172944, "num_tokens": 72763599.0, "step": 31765 }, { "entropy": 5.737165355682373, "epoch": 3.1405693950177938, "grad_norm": 1.0546875, "learning_rate": 0.00040308386309589314, "loss": 4.8999, "mean_token_accuracy": 0.22906113564968109, "num_tokens": 72775807.0, "step": 31770 }, { "entropy": 5.730438756942749, "epoch": 3.141063661526295, "grad_norm": 1.2890625, "learning_rate": 0.0004030548476342199, "loss": 4.9335, "mean_token_accuracy": 0.22640907615423203, "num_tokens": 72786161.0, "step": 31775 }, { "entropy": 5.735044145584107, "epoch": 3.1415579280347963, "grad_norm": 1.1328125, "learning_rate": 0.00040302582902237755, "loss": 4.9932, "mean_token_accuracy": 0.22479147762060164, "num_tokens": 72798211.0, "step": 31780 }, { "entropy": 5.780780792236328, "epoch": 3.1420521945432975, "grad_norm": 1.078125, "learning_rate": 0.00040299680726107995, "loss": 4.9966, "mean_token_accuracy": 0.21778926104307175, "num_tokens": 72809187.0, "step": 31785 }, { "entropy": 5.709589052200317, "epoch": 3.1425464610517992, "grad_norm": 1.1796875, "learning_rate": 0.00040296778235104105, "loss": 4.9373, "mean_token_accuracy": 0.23076942861080169, "num_tokens": 72820486.0, "step": 31790 }, { "entropy": 5.6492979526519775, "epoch": 3.1430407275603005, "grad_norm": 1.25, "learning_rate": 0.0004029387542929748, "loss": 4.8851, "mean_token_accuracy": 0.23109911531209945, "num_tokens": 72831442.0, "step": 31795 }, { "entropy": 5.68577618598938, "epoch": 3.1435349940688018, "grad_norm": 1.21875, "learning_rate": 0.00040290972308759535, "loss": 4.892, "mean_token_accuracy": 0.22983373403549195, "num_tokens": 72841902.0, "step": 31800 }, { "entropy": 5.641751766204834, "epoch": 3.1440292605773035, "grad_norm": 1.25, "learning_rate": 0.00040288068873561687, "loss": 4.8203, "mean_token_accuracy": 0.24102201759815217, "num_tokens": 72852327.0, "step": 31805 }, { "entropy": 5.751206731796264, "epoch": 3.1445235270858047, "grad_norm": 1.2734375, "learning_rate": 0.0004028516512377537, "loss": 4.9664, "mean_token_accuracy": 0.21753532737493514, "num_tokens": 72862643.0, "step": 31810 }, { "entropy": 5.682747793197632, "epoch": 3.145017793594306, "grad_norm": 1.140625, "learning_rate": 0.00040282261059471997, "loss": 4.9484, "mean_token_accuracy": 0.2258808732032776, "num_tokens": 72874081.0, "step": 31815 }, { "entropy": 5.713838005065918, "epoch": 3.1455120601028073, "grad_norm": 1.1328125, "learning_rate": 0.00040279356680723025, "loss": 4.9666, "mean_token_accuracy": 0.2238702654838562, "num_tokens": 72885472.0, "step": 31820 }, { "entropy": 5.770482158660888, "epoch": 3.146006326611309, "grad_norm": 1.125, "learning_rate": 0.0004027645198759988, "loss": 4.927, "mean_token_accuracy": 0.23033130764961243, "num_tokens": 72896626.0, "step": 31825 }, { "entropy": 5.743639373779297, "epoch": 3.1465005931198102, "grad_norm": 1.28125, "learning_rate": 0.0004027354698017405, "loss": 4.9388, "mean_token_accuracy": 0.23063793033361435, "num_tokens": 72907782.0, "step": 31830 }, { "entropy": 5.693716192245484, "epoch": 3.1469948596283115, "grad_norm": 1.1328125, "learning_rate": 0.00040270641658516986, "loss": 4.9009, "mean_token_accuracy": 0.22122326195240022, "num_tokens": 72919024.0, "step": 31835 }, { "entropy": 5.725043535232544, "epoch": 3.147489126136813, "grad_norm": 1.1640625, "learning_rate": 0.0004026773602270015, "loss": 4.9725, "mean_token_accuracy": 0.22053425014019012, "num_tokens": 72930576.0, "step": 31840 }, { "entropy": 5.730515813827514, "epoch": 3.1479833926453145, "grad_norm": 1.234375, "learning_rate": 0.00040264830072795027, "loss": 5.0028, "mean_token_accuracy": 0.21909455060958863, "num_tokens": 72942489.0, "step": 31845 }, { "entropy": 5.789901971817017, "epoch": 3.1484776591538157, "grad_norm": 1.234375, "learning_rate": 0.0004026192380887311, "loss": 5.0128, "mean_token_accuracy": 0.2121368795633316, "num_tokens": 72954209.0, "step": 31850 }, { "entropy": 5.840720796585083, "epoch": 3.148971925662317, "grad_norm": 1.2734375, "learning_rate": 0.0004025901723100588, "loss": 5.0419, "mean_token_accuracy": 0.22017311602830886, "num_tokens": 72965939.0, "step": 31855 }, { "entropy": 5.680883121490479, "epoch": 3.1494661921708187, "grad_norm": 1.15625, "learning_rate": 0.0004025611033926484, "loss": 4.8969, "mean_token_accuracy": 0.23203047066926957, "num_tokens": 72977114.0, "step": 31860 }, { "entropy": 5.716052389144897, "epoch": 3.14996045867932, "grad_norm": 1.140625, "learning_rate": 0.00040253203133721515, "loss": 5.0123, "mean_token_accuracy": 0.22163487523794173, "num_tokens": 72989726.0, "step": 31865 }, { "entropy": 5.697899341583252, "epoch": 3.150454725187821, "grad_norm": 1.1171875, "learning_rate": 0.0004025029561444742, "loss": 4.9529, "mean_token_accuracy": 0.22133278399705886, "num_tokens": 73000055.0, "step": 31870 }, { "entropy": 5.668669605255127, "epoch": 3.1509489916963225, "grad_norm": 1.171875, "learning_rate": 0.00040247387781514065, "loss": 4.9303, "mean_token_accuracy": 0.22347757518291472, "num_tokens": 73010769.0, "step": 31875 }, { "entropy": 5.786803245544434, "epoch": 3.151443258204824, "grad_norm": 1.0859375, "learning_rate": 0.00040244479634992997, "loss": 5.0038, "mean_token_accuracy": 0.22169877737760543, "num_tokens": 73022032.0, "step": 31880 }, { "entropy": 5.720450973510742, "epoch": 3.1519375247133254, "grad_norm": 1.2265625, "learning_rate": 0.00040241571174955755, "loss": 4.9419, "mean_token_accuracy": 0.21972451806068422, "num_tokens": 73033877.0, "step": 31885 }, { "entropy": 5.683818674087524, "epoch": 3.1524317912218267, "grad_norm": 1.1015625, "learning_rate": 0.0004023866240147389, "loss": 4.8947, "mean_token_accuracy": 0.22308821529150008, "num_tokens": 73045670.0, "step": 31890 }, { "entropy": 5.650382328033447, "epoch": 3.152926057730328, "grad_norm": 1.2578125, "learning_rate": 0.0004023575331461894, "loss": 4.9318, "mean_token_accuracy": 0.2268572822213173, "num_tokens": 73056879.0, "step": 31895 }, { "entropy": 5.713074779510498, "epoch": 3.1534203242388297, "grad_norm": 1.265625, "learning_rate": 0.00040232843914462493, "loss": 4.9806, "mean_token_accuracy": 0.21902749985456466, "num_tokens": 73068422.0, "step": 31900 }, { "entropy": 5.746976041793824, "epoch": 3.153914590747331, "grad_norm": 1.140625, "learning_rate": 0.0004022993420107611, "loss": 4.8892, "mean_token_accuracy": 0.22467874139547347, "num_tokens": 73079883.0, "step": 31905 }, { "entropy": 5.737526369094849, "epoch": 3.154408857255832, "grad_norm": 1.328125, "learning_rate": 0.00040227024174531364, "loss": 4.9535, "mean_token_accuracy": 0.22818573713302612, "num_tokens": 73090832.0, "step": 31910 }, { "entropy": 5.703965139389038, "epoch": 3.154903123764334, "grad_norm": 1.328125, "learning_rate": 0.0004022411383489985, "loss": 4.8958, "mean_token_accuracy": 0.23206118643283843, "num_tokens": 73102154.0, "step": 31915 }, { "entropy": 5.666731357574463, "epoch": 3.155397390272835, "grad_norm": 1.1484375, "learning_rate": 0.0004022120318225317, "loss": 4.9717, "mean_token_accuracy": 0.22813572138547897, "num_tokens": 73113530.0, "step": 31920 }, { "entropy": 5.77650556564331, "epoch": 3.1558916567813364, "grad_norm": 1.1875, "learning_rate": 0.00040218292216662903, "loss": 5.0284, "mean_token_accuracy": 0.220971742272377, "num_tokens": 73124379.0, "step": 31925 }, { "entropy": 5.727950954437256, "epoch": 3.1563859232898377, "grad_norm": 1.1484375, "learning_rate": 0.00040215380938200693, "loss": 4.98, "mean_token_accuracy": 0.22099777907133103, "num_tokens": 73136406.0, "step": 31930 }, { "entropy": 5.797395038604736, "epoch": 3.1568801897983394, "grad_norm": 1.09375, "learning_rate": 0.00040212469346938127, "loss": 5.0074, "mean_token_accuracy": 0.21926964521408082, "num_tokens": 73149302.0, "step": 31935 }, { "entropy": 5.7296020030975345, "epoch": 3.1573744563068407, "grad_norm": 1.25, "learning_rate": 0.0004020955744294685, "loss": 4.9673, "mean_token_accuracy": 0.21609448343515397, "num_tokens": 73160462.0, "step": 31940 }, { "entropy": 5.68043270111084, "epoch": 3.157868722815342, "grad_norm": 1.2265625, "learning_rate": 0.00040206645226298484, "loss": 4.8763, "mean_token_accuracy": 0.231180277466774, "num_tokens": 73171849.0, "step": 31945 }, { "entropy": 5.699740219116211, "epoch": 3.1583629893238436, "grad_norm": 1.2578125, "learning_rate": 0.0004020373269706468, "loss": 4.9097, "mean_token_accuracy": 0.22628739476203918, "num_tokens": 73182132.0, "step": 31950 }, { "entropy": 5.7765709400177006, "epoch": 3.158857255832345, "grad_norm": 1.203125, "learning_rate": 0.0004020081985531706, "loss": 5.0026, "mean_token_accuracy": 0.21831277012825012, "num_tokens": 73194527.0, "step": 31955 }, { "entropy": 5.700388860702515, "epoch": 3.159351522340846, "grad_norm": 1.09375, "learning_rate": 0.0004019790670112733, "loss": 4.9256, "mean_token_accuracy": 0.22562604248523713, "num_tokens": 73206104.0, "step": 31960 }, { "entropy": 5.685428857803345, "epoch": 3.1598457888493474, "grad_norm": 1.1796875, "learning_rate": 0.00040194993234567107, "loss": 4.9418, "mean_token_accuracy": 0.22462059706449508, "num_tokens": 73217665.0, "step": 31965 }, { "entropy": 5.718275880813598, "epoch": 3.160340055357849, "grad_norm": 1.1953125, "learning_rate": 0.00040192079455708083, "loss": 4.9629, "mean_token_accuracy": 0.2210962027311325, "num_tokens": 73229677.0, "step": 31970 }, { "entropy": 5.762109375, "epoch": 3.1608343218663504, "grad_norm": 1.2421875, "learning_rate": 0.00040189165364621943, "loss": 4.9928, "mean_token_accuracy": 0.21976627707481383, "num_tokens": 73240806.0, "step": 31975 }, { "entropy": 5.689442348480225, "epoch": 3.1613285883748516, "grad_norm": 1.1484375, "learning_rate": 0.0004018625096138036, "loss": 4.8893, "mean_token_accuracy": 0.2234673798084259, "num_tokens": 73252016.0, "step": 31980 }, { "entropy": 5.701041412353516, "epoch": 3.161822854883353, "grad_norm": 1.1484375, "learning_rate": 0.00040183336246055033, "loss": 4.9373, "mean_token_accuracy": 0.22504760771989823, "num_tokens": 73262790.0, "step": 31985 }, { "entropy": 5.800733804702759, "epoch": 3.1623171213918546, "grad_norm": 1.171875, "learning_rate": 0.0004018042121871767, "loss": 5.0346, "mean_token_accuracy": 0.21860115230083466, "num_tokens": 73275424.0, "step": 31990 }, { "entropy": 5.716345930099488, "epoch": 3.162811387900356, "grad_norm": 1.265625, "learning_rate": 0.00040177505879439984, "loss": 4.927, "mean_token_accuracy": 0.2281204491853714, "num_tokens": 73286790.0, "step": 31995 }, { "entropy": 5.7645610809326175, "epoch": 3.163305654408857, "grad_norm": 1.125, "learning_rate": 0.0004017459022829368, "loss": 5.0627, "mean_token_accuracy": 0.21259057223796846, "num_tokens": 73298876.0, "step": 32000 }, { "entropy": 5.733574295043946, "epoch": 3.163799920917359, "grad_norm": 1.1171875, "learning_rate": 0.00040171674265350487, "loss": 4.9594, "mean_token_accuracy": 0.22140556573867798, "num_tokens": 73310635.0, "step": 32005 }, { "entropy": 5.7724817276000975, "epoch": 3.16429418742586, "grad_norm": 1.203125, "learning_rate": 0.0004016875799068215, "loss": 5.0216, "mean_token_accuracy": 0.21486473232507705, "num_tokens": 73321998.0, "step": 32010 }, { "entropy": 5.697901487350464, "epoch": 3.1647884539343614, "grad_norm": 1.2265625, "learning_rate": 0.0004016584140436039, "loss": 4.9225, "mean_token_accuracy": 0.23045843243598937, "num_tokens": 73332979.0, "step": 32015 }, { "entropy": 5.7338958263397215, "epoch": 3.1652827204428626, "grad_norm": 1.09375, "learning_rate": 0.0004016292450645698, "loss": 4.9886, "mean_token_accuracy": 0.21328095942735673, "num_tokens": 73344405.0, "step": 32020 }, { "entropy": 5.731864786148071, "epoch": 3.1657769869513643, "grad_norm": 1.1875, "learning_rate": 0.00040160007297043655, "loss": 4.9695, "mean_token_accuracy": 0.22475258857011796, "num_tokens": 73356291.0, "step": 32025 }, { "entropy": 5.761966848373413, "epoch": 3.1662712534598656, "grad_norm": 1.15625, "learning_rate": 0.00040157089776192184, "loss": 4.9771, "mean_token_accuracy": 0.22883784621953965, "num_tokens": 73368299.0, "step": 32030 }, { "entropy": 5.76413140296936, "epoch": 3.166765519968367, "grad_norm": 1.1953125, "learning_rate": 0.00040154171943974345, "loss": 5.0274, "mean_token_accuracy": 0.22084034979343414, "num_tokens": 73380527.0, "step": 32035 }, { "entropy": 5.744593286514283, "epoch": 3.167259786476868, "grad_norm": 1.09375, "learning_rate": 0.00040151253800461913, "loss": 4.9732, "mean_token_accuracy": 0.22335683554410934, "num_tokens": 73392547.0, "step": 32040 }, { "entropy": 5.6888103008270265, "epoch": 3.16775405298537, "grad_norm": 1.2265625, "learning_rate": 0.0004014833534572667, "loss": 4.9066, "mean_token_accuracy": 0.23269703090190888, "num_tokens": 73404293.0, "step": 32045 }, { "entropy": 5.7477500438690186, "epoch": 3.168248319493871, "grad_norm": 1.3046875, "learning_rate": 0.0004014541657984043, "loss": 4.8751, "mean_token_accuracy": 0.22786087840795516, "num_tokens": 73414581.0, "step": 32050 }, { "entropy": 5.715932130813599, "epoch": 3.1687425860023724, "grad_norm": 1.28125, "learning_rate": 0.00040142497502874963, "loss": 5.0292, "mean_token_accuracy": 0.2114308312535286, "num_tokens": 73426485.0, "step": 32055 }, { "entropy": 5.7287070751190186, "epoch": 3.169236852510874, "grad_norm": 1.2109375, "learning_rate": 0.00040139578114902104, "loss": 5.0479, "mean_token_accuracy": 0.21972786039113998, "num_tokens": 73438481.0, "step": 32060 }, { "entropy": 5.782337951660156, "epoch": 3.1697311190193753, "grad_norm": 1.21875, "learning_rate": 0.00040136658415993663, "loss": 4.9421, "mean_token_accuracy": 0.21798247396945952, "num_tokens": 73448552.0, "step": 32065 }, { "entropy": 5.727556324005127, "epoch": 3.1702253855278766, "grad_norm": 1.3203125, "learning_rate": 0.0004013373840622146, "loss": 4.9239, "mean_token_accuracy": 0.2203081354498863, "num_tokens": 73459354.0, "step": 32070 }, { "entropy": 5.72588267326355, "epoch": 3.170719652036378, "grad_norm": 1.2578125, "learning_rate": 0.00040130818085657333, "loss": 4.9402, "mean_token_accuracy": 0.2236169919371605, "num_tokens": 73470718.0, "step": 32075 }, { "entropy": 5.768819093704224, "epoch": 3.1712139185448796, "grad_norm": 1.1796875, "learning_rate": 0.0004012789745437313, "loss": 5.0525, "mean_token_accuracy": 0.21579015851020814, "num_tokens": 73483133.0, "step": 32080 }, { "entropy": 5.77171745300293, "epoch": 3.171708185053381, "grad_norm": 1.390625, "learning_rate": 0.0004012497651244068, "loss": 4.9521, "mean_token_accuracy": 0.2193336695432663, "num_tokens": 73494675.0, "step": 32085 }, { "entropy": 5.714121675491333, "epoch": 3.172202451561882, "grad_norm": 1.2421875, "learning_rate": 0.00040122055259931856, "loss": 4.9367, "mean_token_accuracy": 0.23067618310451507, "num_tokens": 73505412.0, "step": 32090 }, { "entropy": 5.63411054611206, "epoch": 3.172696718070384, "grad_norm": 1.1796875, "learning_rate": 0.00040119133696918515, "loss": 4.8395, "mean_token_accuracy": 0.23873535841703414, "num_tokens": 73515835.0, "step": 32095 }, { "entropy": 5.72991418838501, "epoch": 3.173190984578885, "grad_norm": 1.2578125, "learning_rate": 0.0004011621182347252, "loss": 4.9432, "mean_token_accuracy": 0.22705233693122864, "num_tokens": 73526943.0, "step": 32100 }, { "entropy": 5.752754259109497, "epoch": 3.1736852510873863, "grad_norm": 1.1015625, "learning_rate": 0.00040113289639665765, "loss": 4.9572, "mean_token_accuracy": 0.22403370589017868, "num_tokens": 73540076.0, "step": 32105 }, { "entropy": 5.8096246242523195, "epoch": 3.1741795175958876, "grad_norm": 1.1015625, "learning_rate": 0.00040110367145570125, "loss": 5.0193, "mean_token_accuracy": 0.22183199524879454, "num_tokens": 73552265.0, "step": 32110 }, { "entropy": 5.724063158035278, "epoch": 3.1746737841043893, "grad_norm": 1.2265625, "learning_rate": 0.000401074443412575, "loss": 4.946, "mean_token_accuracy": 0.22147433012723922, "num_tokens": 73562581.0, "step": 32115 }, { "entropy": 5.695050048828125, "epoch": 3.1751680506128905, "grad_norm": 1.3046875, "learning_rate": 0.00040104521226799777, "loss": 4.9361, "mean_token_accuracy": 0.23346880376338958, "num_tokens": 73573478.0, "step": 32120 }, { "entropy": 5.7909619331359865, "epoch": 3.175662317121392, "grad_norm": 1.1484375, "learning_rate": 0.00040101597802268883, "loss": 4.9589, "mean_token_accuracy": 0.2238469123840332, "num_tokens": 73584639.0, "step": 32125 }, { "entropy": 5.760508489608765, "epoch": 3.176156583629893, "grad_norm": 1.2109375, "learning_rate": 0.0004009867406773673, "loss": 4.9987, "mean_token_accuracy": 0.22034768164157867, "num_tokens": 73596084.0, "step": 32130 }, { "entropy": 5.710902690887451, "epoch": 3.1766508501383948, "grad_norm": 1.1640625, "learning_rate": 0.00040095750023275243, "loss": 4.9774, "mean_token_accuracy": 0.22693269550800324, "num_tokens": 73606551.0, "step": 32135 }, { "entropy": 5.736982583999634, "epoch": 3.177145116646896, "grad_norm": 1.2578125, "learning_rate": 0.0004009282566895635, "loss": 4.8987, "mean_token_accuracy": 0.23246588110923766, "num_tokens": 73616134.0, "step": 32140 }, { "entropy": 5.6890191555023195, "epoch": 3.1776393831553973, "grad_norm": 1.125, "learning_rate": 0.0004008990100485199, "loss": 4.8554, "mean_token_accuracy": 0.22833207845687867, "num_tokens": 73626813.0, "step": 32145 }, { "entropy": 5.675510358810425, "epoch": 3.1781336496638986, "grad_norm": 1.1796875, "learning_rate": 0.00040086976031034104, "loss": 4.9646, "mean_token_accuracy": 0.2279843270778656, "num_tokens": 73638205.0, "step": 32150 }, { "entropy": 5.8437971591949465, "epoch": 3.1786279161724003, "grad_norm": 1.0390625, "learning_rate": 0.00040084050747574666, "loss": 5.0818, "mean_token_accuracy": 0.21092552691698074, "num_tokens": 73652276.0, "step": 32155 }, { "entropy": 5.785452890396118, "epoch": 3.1791221826809015, "grad_norm": 1.078125, "learning_rate": 0.0004008112515454562, "loss": 5.0645, "mean_token_accuracy": 0.21881006956100463, "num_tokens": 73665516.0, "step": 32160 }, { "entropy": 5.743360948562622, "epoch": 3.179616449189403, "grad_norm": 1.2265625, "learning_rate": 0.0004007819925201895, "loss": 4.9202, "mean_token_accuracy": 0.23202859461307526, "num_tokens": 73675783.0, "step": 32165 }, { "entropy": 5.76856837272644, "epoch": 3.1801107156979045, "grad_norm": 1.1953125, "learning_rate": 0.0004007527304006663, "loss": 5.0024, "mean_token_accuracy": 0.21402398943901063, "num_tokens": 73687853.0, "step": 32170 }, { "entropy": 5.697969388961792, "epoch": 3.1806049822064058, "grad_norm": 1.1953125, "learning_rate": 0.00040072346518760634, "loss": 4.908, "mean_token_accuracy": 0.23285412788391113, "num_tokens": 73699189.0, "step": 32175 }, { "entropy": 5.807528257369995, "epoch": 3.181099248714907, "grad_norm": 1.0234375, "learning_rate": 0.00040069419688172967, "loss": 5.0841, "mean_token_accuracy": 0.21684761196374894, "num_tokens": 73711003.0, "step": 32180 }, { "entropy": 5.785439777374267, "epoch": 3.1815935152234083, "grad_norm": 1.171875, "learning_rate": 0.00040066492548375627, "loss": 5.0305, "mean_token_accuracy": 0.21365318894386293, "num_tokens": 73723311.0, "step": 32185 }, { "entropy": 5.8026378631591795, "epoch": 3.18208778173191, "grad_norm": 1.25, "learning_rate": 0.00040063565099440616, "loss": 5.0145, "mean_token_accuracy": 0.2226735144853592, "num_tokens": 73734155.0, "step": 32190 }, { "entropy": 5.678349542617798, "epoch": 3.1825820482404112, "grad_norm": 1.140625, "learning_rate": 0.0004006063734143996, "loss": 4.9263, "mean_token_accuracy": 0.22843949794769286, "num_tokens": 73745289.0, "step": 32195 }, { "entropy": 5.6801502227783205, "epoch": 3.1830763147489125, "grad_norm": 1.21875, "learning_rate": 0.0004005770927444567, "loss": 4.9553, "mean_token_accuracy": 0.2269407406449318, "num_tokens": 73756955.0, "step": 32200 }, { "entropy": 5.735558128356933, "epoch": 3.183570581257414, "grad_norm": 1.1875, "learning_rate": 0.0004005478089852979, "loss": 4.9433, "mean_token_accuracy": 0.21973614245653153, "num_tokens": 73768676.0, "step": 32205 }, { "entropy": 5.694872236251831, "epoch": 3.1840648477659155, "grad_norm": 1.234375, "learning_rate": 0.0004005185221376435, "loss": 4.932, "mean_token_accuracy": 0.2317672148346901, "num_tokens": 73779505.0, "step": 32210 }, { "entropy": 5.710838317871094, "epoch": 3.1845591142744167, "grad_norm": 1.1484375, "learning_rate": 0.00040048923220221397, "loss": 4.9809, "mean_token_accuracy": 0.22104528546333313, "num_tokens": 73790785.0, "step": 32215 }, { "entropy": 5.747603845596314, "epoch": 3.185053380782918, "grad_norm": 1.265625, "learning_rate": 0.00040045993917972985, "loss": 4.9421, "mean_token_accuracy": 0.22288586050271988, "num_tokens": 73802689.0, "step": 32220 }, { "entropy": 5.745974349975586, "epoch": 3.1855476472914197, "grad_norm": 1.1015625, "learning_rate": 0.0004004306430709118, "loss": 4.9492, "mean_token_accuracy": 0.22333626300096512, "num_tokens": 73815029.0, "step": 32225 }, { "entropy": 5.769425582885742, "epoch": 3.186041913799921, "grad_norm": 1.28125, "learning_rate": 0.00040040134387648045, "loss": 4.9817, "mean_token_accuracy": 0.22192592471837996, "num_tokens": 73825509.0, "step": 32230 }, { "entropy": 5.77627534866333, "epoch": 3.1865361803084222, "grad_norm": 1.2578125, "learning_rate": 0.0004003720415971566, "loss": 4.97, "mean_token_accuracy": 0.22519028931856155, "num_tokens": 73836014.0, "step": 32235 }, { "entropy": 5.686406850814819, "epoch": 3.1870304468169235, "grad_norm": 1.203125, "learning_rate": 0.0004003427362336611, "loss": 4.9045, "mean_token_accuracy": 0.22717816829681398, "num_tokens": 73847044.0, "step": 32240 }, { "entropy": 5.700253057479858, "epoch": 3.187524713325425, "grad_norm": 1.1015625, "learning_rate": 0.00040031342778671476, "loss": 4.9533, "mean_token_accuracy": 0.22426968663930893, "num_tokens": 73859748.0, "step": 32245 }, { "entropy": 5.6867982864379885, "epoch": 3.1880189798339265, "grad_norm": 1.1640625, "learning_rate": 0.0004002841162570387, "loss": 4.9176, "mean_token_accuracy": 0.2298780471086502, "num_tokens": 73870450.0, "step": 32250 }, { "entropy": 5.783068704605102, "epoch": 3.1885132463424277, "grad_norm": 1.1640625, "learning_rate": 0.00040025480164535405, "loss": 5.0382, "mean_token_accuracy": 0.2143593117594719, "num_tokens": 73882533.0, "step": 32255 }, { "entropy": 5.756817245483399, "epoch": 3.1890075128509294, "grad_norm": 1.1875, "learning_rate": 0.00040022548395238173, "loss": 4.9896, "mean_token_accuracy": 0.2241203874349594, "num_tokens": 73894247.0, "step": 32260 }, { "entropy": 5.734116744995117, "epoch": 3.1895017793594307, "grad_norm": 1.1796875, "learning_rate": 0.0004001961631788431, "loss": 4.9377, "mean_token_accuracy": 0.23192739635705947, "num_tokens": 73905246.0, "step": 32265 }, { "entropy": 5.7124857902526855, "epoch": 3.189996045867932, "grad_norm": 1.21875, "learning_rate": 0.00040016683932545937, "loss": 4.9291, "mean_token_accuracy": 0.2254141613841057, "num_tokens": 73915906.0, "step": 32270 }, { "entropy": 5.689729261398315, "epoch": 3.190490312376433, "grad_norm": 1.3046875, "learning_rate": 0.000400137512392952, "loss": 4.958, "mean_token_accuracy": 0.21993598639965056, "num_tokens": 73928629.0, "step": 32275 }, { "entropy": 5.8052743434906, "epoch": 3.190984578884935, "grad_norm": 1.21875, "learning_rate": 0.00040010818238204256, "loss": 5.0152, "mean_token_accuracy": 0.2224835366010666, "num_tokens": 73940474.0, "step": 32280 }, { "entropy": 5.714233779907227, "epoch": 3.191478845393436, "grad_norm": 1.1640625, "learning_rate": 0.00040007884929345224, "loss": 4.9006, "mean_token_accuracy": 0.22905313670635224, "num_tokens": 73951636.0, "step": 32285 }, { "entropy": 5.6802863597869875, "epoch": 3.1919731119019374, "grad_norm": 1.1328125, "learning_rate": 0.0004000495131279029, "loss": 4.8975, "mean_token_accuracy": 0.2281394973397255, "num_tokens": 73963253.0, "step": 32290 }, { "entropy": 5.651004266738892, "epoch": 3.1924673784104387, "grad_norm": 1.4375, "learning_rate": 0.0004000201738861162, "loss": 4.8854, "mean_token_accuracy": 0.22926275432109833, "num_tokens": 73974215.0, "step": 32295 }, { "entropy": 5.716013336181641, "epoch": 3.1929616449189404, "grad_norm": 1.1328125, "learning_rate": 0.0003999908315688137, "loss": 4.9956, "mean_token_accuracy": 0.22173261046409606, "num_tokens": 73986127.0, "step": 32300 }, { "entropy": 5.7708740234375, "epoch": 3.1934559114274417, "grad_norm": 1.3203125, "learning_rate": 0.00039996148617671743, "loss": 4.9636, "mean_token_accuracy": 0.22691153585910798, "num_tokens": 73996998.0, "step": 32305 }, { "entropy": 5.757706356048584, "epoch": 3.193950177935943, "grad_norm": 1.296875, "learning_rate": 0.0003999321377105492, "loss": 4.9446, "mean_token_accuracy": 0.2277391731739044, "num_tokens": 74009432.0, "step": 32310 }, { "entropy": 5.67088041305542, "epoch": 3.1944444444444446, "grad_norm": 1.15625, "learning_rate": 0.000399902786171031, "loss": 4.9283, "mean_token_accuracy": 0.2227945163846016, "num_tokens": 74021242.0, "step": 32315 }, { "entropy": 5.738876914978027, "epoch": 3.194938710952946, "grad_norm": 1.1328125, "learning_rate": 0.00039987343155888484, "loss": 4.9714, "mean_token_accuracy": 0.2153807118535042, "num_tokens": 74032865.0, "step": 32320 }, { "entropy": 5.717230653762817, "epoch": 3.195432977461447, "grad_norm": 1.1171875, "learning_rate": 0.000399844073874833, "loss": 4.9181, "mean_token_accuracy": 0.23045008927583693, "num_tokens": 74044505.0, "step": 32325 }, { "entropy": 5.727366733551025, "epoch": 3.1959272439699484, "grad_norm": 1.234375, "learning_rate": 0.00039981471311959746, "loss": 4.9665, "mean_token_accuracy": 0.21949754357337953, "num_tokens": 74056551.0, "step": 32330 }, { "entropy": 5.744142961502075, "epoch": 3.19642151047845, "grad_norm": 1.171875, "learning_rate": 0.00039978534929390066, "loss": 4.9351, "mean_token_accuracy": 0.22213992327451706, "num_tokens": 74066746.0, "step": 32335 }, { "entropy": 5.733849954605103, "epoch": 3.1969157769869514, "grad_norm": 1.1484375, "learning_rate": 0.00039975598239846494, "loss": 4.9941, "mean_token_accuracy": 0.22086290419101715, "num_tokens": 74078493.0, "step": 32340 }, { "entropy": 5.746189832687378, "epoch": 3.1974100434954527, "grad_norm": 1.25, "learning_rate": 0.00039972661243401267, "loss": 4.9133, "mean_token_accuracy": 0.22525355815887452, "num_tokens": 74089484.0, "step": 32345 }, { "entropy": 5.7634727478027346, "epoch": 3.1979043100039544, "grad_norm": 1.21875, "learning_rate": 0.0003996972394012664, "loss": 4.9648, "mean_token_accuracy": 0.22273753434419633, "num_tokens": 74101038.0, "step": 32350 }, { "entropy": 5.806222295761108, "epoch": 3.1983985765124556, "grad_norm": 1.1328125, "learning_rate": 0.0003996678633009486, "loss": 5.0473, "mean_token_accuracy": 0.21717166155576706, "num_tokens": 74112708.0, "step": 32355 }, { "entropy": 5.7628068923950195, "epoch": 3.198892843020957, "grad_norm": 1.2421875, "learning_rate": 0.0003996384841337822, "loss": 4.9921, "mean_token_accuracy": 0.21744083166122435, "num_tokens": 74123899.0, "step": 32360 }, { "entropy": 5.680123519897461, "epoch": 3.199387109529458, "grad_norm": 1.078125, "learning_rate": 0.0003996091019004896, "loss": 4.9554, "mean_token_accuracy": 0.2233150541782379, "num_tokens": 74136025.0, "step": 32365 }, { "entropy": 5.7972798347473145, "epoch": 3.19988137603796, "grad_norm": 1.0625, "learning_rate": 0.0003995797166017938, "loss": 5.1058, "mean_token_accuracy": 0.21531136631965636, "num_tokens": 74149140.0, "step": 32370 }, { "entropy": 5.793102025985718, "epoch": 3.200375642546461, "grad_norm": 1.1875, "learning_rate": 0.00039955032823841766, "loss": 4.9598, "mean_token_accuracy": 0.22249247133731842, "num_tokens": 74160849.0, "step": 32375 }, { "entropy": 5.746348476409912, "epoch": 3.2008699090549624, "grad_norm": 1.1796875, "learning_rate": 0.00039952093681108416, "loss": 4.9997, "mean_token_accuracy": 0.22070683985948564, "num_tokens": 74171678.0, "step": 32380 }, { "entropy": 5.665137910842896, "epoch": 3.2013641755634636, "grad_norm": 1.2265625, "learning_rate": 0.0003994915423205162, "loss": 4.9248, "mean_token_accuracy": 0.22837164103984833, "num_tokens": 74183000.0, "step": 32385 }, { "entropy": 5.812749290466309, "epoch": 3.2018584420719653, "grad_norm": 1.1796875, "learning_rate": 0.0003994621447674371, "loss": 5.0308, "mean_token_accuracy": 0.21924428641796112, "num_tokens": 74195495.0, "step": 32390 }, { "entropy": 5.752200603485107, "epoch": 3.2023527085804666, "grad_norm": 1.3046875, "learning_rate": 0.0003994327441525699, "loss": 4.983, "mean_token_accuracy": 0.2202370971441269, "num_tokens": 74206023.0, "step": 32395 }, { "entropy": 5.729682350158692, "epoch": 3.202846975088968, "grad_norm": 1.1796875, "learning_rate": 0.0003994033404766378, "loss": 4.993, "mean_token_accuracy": 0.2224993422627449, "num_tokens": 74217943.0, "step": 32400 }, { "entropy": 5.7644007205963135, "epoch": 3.203341241597469, "grad_norm": 1.3046875, "learning_rate": 0.0003993739337403643, "loss": 5.0169, "mean_token_accuracy": 0.21626025140285493, "num_tokens": 74228142.0, "step": 32405 }, { "entropy": 5.76966233253479, "epoch": 3.203835508105971, "grad_norm": 1.359375, "learning_rate": 0.0003993445239444728, "loss": 5.0015, "mean_token_accuracy": 0.22228449136018752, "num_tokens": 74239692.0, "step": 32410 }, { "entropy": 5.78749713897705, "epoch": 3.204329774614472, "grad_norm": 1.1171875, "learning_rate": 0.0003993151110896866, "loss": 4.9779, "mean_token_accuracy": 0.21892784386873246, "num_tokens": 74251010.0, "step": 32415 }, { "entropy": 5.672426223754883, "epoch": 3.2048240411229734, "grad_norm": 1.15625, "learning_rate": 0.0003992856951767294, "loss": 4.8657, "mean_token_accuracy": 0.22561863511800767, "num_tokens": 74262579.0, "step": 32420 }, { "entropy": 5.710741901397705, "epoch": 3.205318307631475, "grad_norm": 1.3359375, "learning_rate": 0.00039925627620632486, "loss": 4.8851, "mean_token_accuracy": 0.23000517338514329, "num_tokens": 74272833.0, "step": 32425 }, { "entropy": 5.783285427093506, "epoch": 3.2058125741399763, "grad_norm": 1.125, "learning_rate": 0.0003992268541791967, "loss": 5.0206, "mean_token_accuracy": 0.2168182298541069, "num_tokens": 74284565.0, "step": 32430 }, { "entropy": 5.655234861373901, "epoch": 3.2063068406484776, "grad_norm": 1.2265625, "learning_rate": 0.0003991974290960685, "loss": 4.8547, "mean_token_accuracy": 0.2417011260986328, "num_tokens": 74295473.0, "step": 32435 }, { "entropy": 5.8008466243743895, "epoch": 3.206801107156979, "grad_norm": 1.2890625, "learning_rate": 0.00039916800095766443, "loss": 5.0512, "mean_token_accuracy": 0.20862850546836853, "num_tokens": 74305688.0, "step": 32440 }, { "entropy": 5.708681583404541, "epoch": 3.2072953736654806, "grad_norm": 1.015625, "learning_rate": 0.00039913856976470823, "loss": 4.9252, "mean_token_accuracy": 0.22708481699228286, "num_tokens": 74318268.0, "step": 32445 }, { "entropy": 5.771266269683838, "epoch": 3.207789640173982, "grad_norm": 1.1640625, "learning_rate": 0.0003991091355179239, "loss": 5.0295, "mean_token_accuracy": 0.2138544112443924, "num_tokens": 74330310.0, "step": 32450 }, { "entropy": 5.74018874168396, "epoch": 3.208283906682483, "grad_norm": 1.1875, "learning_rate": 0.0003990796982180356, "loss": 5.0061, "mean_token_accuracy": 0.22078711092472075, "num_tokens": 74342040.0, "step": 32455 }, { "entropy": 5.832875204086304, "epoch": 3.208778173190985, "grad_norm": 1.234375, "learning_rate": 0.00039905025786576755, "loss": 5.0533, "mean_token_accuracy": 0.2120827093720436, "num_tokens": 74354502.0, "step": 32460 }, { "entropy": 5.820251560211181, "epoch": 3.209272439699486, "grad_norm": 1.2578125, "learning_rate": 0.0003990208144618438, "loss": 4.9692, "mean_token_accuracy": 0.2199249669909477, "num_tokens": 74366100.0, "step": 32465 }, { "entropy": 5.846017742156983, "epoch": 3.2097667062079873, "grad_norm": 1.2578125, "learning_rate": 0.00039899136800698883, "loss": 5.0609, "mean_token_accuracy": 0.20613151043653488, "num_tokens": 74377627.0, "step": 32470 }, { "entropy": 5.682811641693116, "epoch": 3.2102609727164886, "grad_norm": 1.1328125, "learning_rate": 0.000398961918501927, "loss": 4.9458, "mean_token_accuracy": 0.22553450912237166, "num_tokens": 74389689.0, "step": 32475 }, { "entropy": 5.7804991722106935, "epoch": 3.2107552392249903, "grad_norm": 1.328125, "learning_rate": 0.0003989324659473827, "loss": 5.0777, "mean_token_accuracy": 0.20669523924589156, "num_tokens": 74399902.0, "step": 32480 }, { "entropy": 5.790475654602051, "epoch": 3.2112495057334915, "grad_norm": 1.09375, "learning_rate": 0.00039890301034408056, "loss": 5.0386, "mean_token_accuracy": 0.21036529839038848, "num_tokens": 74410935.0, "step": 32485 }, { "entropy": 5.755534696578979, "epoch": 3.211743772241993, "grad_norm": 1.1484375, "learning_rate": 0.0003988735516927451, "loss": 4.9262, "mean_token_accuracy": 0.2284962147474289, "num_tokens": 74421850.0, "step": 32490 }, { "entropy": 5.719126033782959, "epoch": 3.212238038750494, "grad_norm": 1.1015625, "learning_rate": 0.00039884408999410107, "loss": 4.9513, "mean_token_accuracy": 0.22695187628269195, "num_tokens": 74434104.0, "step": 32495 }, { "entropy": 5.772160816192627, "epoch": 3.212732305258996, "grad_norm": 1.015625, "learning_rate": 0.0003988146252488732, "loss": 5.033, "mean_token_accuracy": 0.21827645599842072, "num_tokens": 74446738.0, "step": 32500 }, { "entropy": 5.871346950531006, "epoch": 3.213226571767497, "grad_norm": 1.1171875, "learning_rate": 0.0003987851574577863, "loss": 5.0991, "mean_token_accuracy": 0.21547407060861587, "num_tokens": 74458202.0, "step": 32505 }, { "entropy": 5.795695209503174, "epoch": 3.2137208382759983, "grad_norm": 1.265625, "learning_rate": 0.0003987556866215654, "loss": 5.0258, "mean_token_accuracy": 0.22029586732387543, "num_tokens": 74470349.0, "step": 32510 }, { "entropy": 5.705416631698609, "epoch": 3.2142151047845, "grad_norm": 1.1328125, "learning_rate": 0.0003987262127409354, "loss": 4.9093, "mean_token_accuracy": 0.22899301946163178, "num_tokens": 74482569.0, "step": 32515 }, { "entropy": 5.73810305595398, "epoch": 3.2147093712930013, "grad_norm": 1.0859375, "learning_rate": 0.0003986967358166213, "loss": 4.9386, "mean_token_accuracy": 0.2188004046678543, "num_tokens": 74495425.0, "step": 32520 }, { "entropy": 5.775293922424316, "epoch": 3.2152036378015025, "grad_norm": 1.2109375, "learning_rate": 0.00039866725584934834, "loss": 5.0254, "mean_token_accuracy": 0.21586144268512725, "num_tokens": 74506429.0, "step": 32525 }, { "entropy": 5.808415269851684, "epoch": 3.215697904310004, "grad_norm": 1.265625, "learning_rate": 0.00039863777283984174, "loss": 5.0123, "mean_token_accuracy": 0.22003390938043593, "num_tokens": 74517426.0, "step": 32530 }, { "entropy": 5.784921789169312, "epoch": 3.2161921708185055, "grad_norm": 1.328125, "learning_rate": 0.00039860828678882674, "loss": 4.9941, "mean_token_accuracy": 0.2211372196674347, "num_tokens": 74528777.0, "step": 32535 }, { "entropy": 5.725776243209839, "epoch": 3.2166864373270068, "grad_norm": 1.171875, "learning_rate": 0.0003985787976970287, "loss": 4.9587, "mean_token_accuracy": 0.21525656878948213, "num_tokens": 74540384.0, "step": 32540 }, { "entropy": 5.7518346309661865, "epoch": 3.217180703835508, "grad_norm": 1.203125, "learning_rate": 0.000398549305565173, "loss": 4.8943, "mean_token_accuracy": 0.22654535323381425, "num_tokens": 74551698.0, "step": 32545 }, { "entropy": 5.750669860839844, "epoch": 3.2176749703440093, "grad_norm": 1.125, "learning_rate": 0.00039851981039398527, "loss": 4.9645, "mean_token_accuracy": 0.22653490155935288, "num_tokens": 74563467.0, "step": 32550 }, { "entropy": 5.656029796600341, "epoch": 3.218169236852511, "grad_norm": 1.0859375, "learning_rate": 0.00039849031218419114, "loss": 4.9057, "mean_token_accuracy": 0.23221013098955154, "num_tokens": 74575341.0, "step": 32555 }, { "entropy": 5.669033527374268, "epoch": 3.2186635033610123, "grad_norm": 1.2109375, "learning_rate": 0.000398460810936516, "loss": 4.8297, "mean_token_accuracy": 0.23788087517023088, "num_tokens": 74587706.0, "step": 32560 }, { "entropy": 5.746804523468017, "epoch": 3.2191577698695135, "grad_norm": 1.140625, "learning_rate": 0.00039843130665168585, "loss": 4.9628, "mean_token_accuracy": 0.22396714836359025, "num_tokens": 74599310.0, "step": 32565 }, { "entropy": 5.75776515007019, "epoch": 3.2196520363780152, "grad_norm": 1.1328125, "learning_rate": 0.00039840179933042644, "loss": 5.0728, "mean_token_accuracy": 0.2160360500216484, "num_tokens": 74610436.0, "step": 32570 }, { "entropy": 5.835077810287475, "epoch": 3.2201463028865165, "grad_norm": 1.1953125, "learning_rate": 0.00039837228897346357, "loss": 4.9722, "mean_token_accuracy": 0.21848828345537186, "num_tokens": 74621788.0, "step": 32575 }, { "entropy": 5.785645771026611, "epoch": 3.2206405693950177, "grad_norm": 1.1953125, "learning_rate": 0.00039834277558152326, "loss": 4.9865, "mean_token_accuracy": 0.22078637927770614, "num_tokens": 74633345.0, "step": 32580 }, { "entropy": 5.730307722091675, "epoch": 3.221134835903519, "grad_norm": 1.1484375, "learning_rate": 0.0003983132591553315, "loss": 5.0041, "mean_token_accuracy": 0.22205347716808319, "num_tokens": 74646217.0, "step": 32585 }, { "entropy": 5.751239347457886, "epoch": 3.2216291024120207, "grad_norm": 1.15625, "learning_rate": 0.0003982837396956145, "loss": 4.9803, "mean_token_accuracy": 0.22730713188648224, "num_tokens": 74657935.0, "step": 32590 }, { "entropy": 5.738717842102051, "epoch": 3.222123368920522, "grad_norm": 1.2421875, "learning_rate": 0.00039825421720309835, "loss": 5.0015, "mean_token_accuracy": 0.22322916090488434, "num_tokens": 74668547.0, "step": 32595 }, { "entropy": 5.809048748016357, "epoch": 3.2226176354290232, "grad_norm": 1.2734375, "learning_rate": 0.0003982246916785093, "loss": 5.0402, "mean_token_accuracy": 0.21314360499382018, "num_tokens": 74680013.0, "step": 32600 }, { "entropy": 5.766875171661377, "epoch": 3.223111901937525, "grad_norm": 1.296875, "learning_rate": 0.0003981951631225738, "loss": 4.9479, "mean_token_accuracy": 0.22897373735904694, "num_tokens": 74689927.0, "step": 32605 }, { "entropy": 5.7854045867919925, "epoch": 3.223606168446026, "grad_norm": 1.2578125, "learning_rate": 0.0003981656315360181, "loss": 4.9853, "mean_token_accuracy": 0.22221137583255768, "num_tokens": 74701854.0, "step": 32610 }, { "entropy": 5.713367986679077, "epoch": 3.2241004349545275, "grad_norm": 1.21875, "learning_rate": 0.00039813609691956883, "loss": 4.9554, "mean_token_accuracy": 0.22234144508838655, "num_tokens": 74713974.0, "step": 32615 }, { "entropy": 5.820211362838745, "epoch": 3.2245947014630287, "grad_norm": 1.1875, "learning_rate": 0.0003981065592739524, "loss": 5.0454, "mean_token_accuracy": 0.21344489455223084, "num_tokens": 74725367.0, "step": 32620 }, { "entropy": 5.812423181533814, "epoch": 3.2250889679715304, "grad_norm": 1.2109375, "learning_rate": 0.00039807701859989554, "loss": 4.9683, "mean_token_accuracy": 0.21789056658744813, "num_tokens": 74736801.0, "step": 32625 }, { "entropy": 5.703966760635376, "epoch": 3.2255832344800317, "grad_norm": 1.203125, "learning_rate": 0.00039804747489812495, "loss": 4.9757, "mean_token_accuracy": 0.22358919084072112, "num_tokens": 74747949.0, "step": 32630 }, { "entropy": 5.6846458435058596, "epoch": 3.226077500988533, "grad_norm": 1.3125, "learning_rate": 0.0003980179281693674, "loss": 4.9441, "mean_token_accuracy": 0.22936786115169525, "num_tokens": 74759985.0, "step": 32635 }, { "entropy": 5.728292417526245, "epoch": 3.2265717674970342, "grad_norm": 1.1328125, "learning_rate": 0.00039798837841434966, "loss": 4.9242, "mean_token_accuracy": 0.22488351613283158, "num_tokens": 74770981.0, "step": 32640 }, { "entropy": 5.729997301101685, "epoch": 3.227066034005536, "grad_norm": 1.1171875, "learning_rate": 0.00039795882563379876, "loss": 4.9031, "mean_token_accuracy": 0.23429159224033355, "num_tokens": 74783120.0, "step": 32645 }, { "entropy": 5.6912806034088135, "epoch": 3.227560300514037, "grad_norm": 1.25, "learning_rate": 0.0003979292698284417, "loss": 4.8996, "mean_token_accuracy": 0.2270379051566124, "num_tokens": 74793492.0, "step": 32650 }, { "entropy": 5.6635195255279545, "epoch": 3.2280545670225385, "grad_norm": 1.109375, "learning_rate": 0.00039789971099900545, "loss": 4.9517, "mean_token_accuracy": 0.22720779478549957, "num_tokens": 74805333.0, "step": 32655 }, { "entropy": 5.716989755630493, "epoch": 3.2285488335310397, "grad_norm": 1.2421875, "learning_rate": 0.0003978701491462174, "loss": 4.9151, "mean_token_accuracy": 0.22994406521320343, "num_tokens": 74816269.0, "step": 32660 }, { "entropy": 5.755623626708984, "epoch": 3.2290431000395414, "grad_norm": 1.1796875, "learning_rate": 0.0003978405842708045, "loss": 4.931, "mean_token_accuracy": 0.23005022704601288, "num_tokens": 74826901.0, "step": 32665 }, { "entropy": 5.735284757614136, "epoch": 3.2295373665480427, "grad_norm": 1.2109375, "learning_rate": 0.00039781101637349417, "loss": 4.9718, "mean_token_accuracy": 0.2257653221487999, "num_tokens": 74837373.0, "step": 32670 }, { "entropy": 5.748017406463623, "epoch": 3.230031633056544, "grad_norm": 1.1953125, "learning_rate": 0.00039778144545501374, "loss": 4.94, "mean_token_accuracy": 0.224665567278862, "num_tokens": 74848609.0, "step": 32675 }, { "entropy": 5.70569953918457, "epoch": 3.2305258995650457, "grad_norm": 1.2734375, "learning_rate": 0.0003977518715160908, "loss": 4.9623, "mean_token_accuracy": 0.22923813313245772, "num_tokens": 74859953.0, "step": 32680 }, { "entropy": 5.731884527206421, "epoch": 3.231020166073547, "grad_norm": 1.390625, "learning_rate": 0.00039772229455745285, "loss": 4.9716, "mean_token_accuracy": 0.22389605045318603, "num_tokens": 74872173.0, "step": 32685 }, { "entropy": 5.717567777633667, "epoch": 3.231514432582048, "grad_norm": 1.15625, "learning_rate": 0.00039769271457982733, "loss": 4.9196, "mean_token_accuracy": 0.22607224732637404, "num_tokens": 74884060.0, "step": 32690 }, { "entropy": 5.747975778579712, "epoch": 3.2320086990905494, "grad_norm": 1.25, "learning_rate": 0.0003976631315839419, "loss": 4.9599, "mean_token_accuracy": 0.2199810415506363, "num_tokens": 74895660.0, "step": 32695 }, { "entropy": 5.751423120498657, "epoch": 3.232502965599051, "grad_norm": 1.234375, "learning_rate": 0.0003976335455705245, "loss": 4.9819, "mean_token_accuracy": 0.22002631276845933, "num_tokens": 74907228.0, "step": 32700 }, { "entropy": 5.72869119644165, "epoch": 3.2329972321075524, "grad_norm": 1.2421875, "learning_rate": 0.0003976039565403029, "loss": 5.0019, "mean_token_accuracy": 0.21891435533761977, "num_tokens": 74919062.0, "step": 32705 }, { "entropy": 5.694114112854004, "epoch": 3.2334914986160537, "grad_norm": 1.3046875, "learning_rate": 0.00039757436449400484, "loss": 4.9281, "mean_token_accuracy": 0.2266903728246689, "num_tokens": 74930551.0, "step": 32710 }, { "entropy": 5.754921388626099, "epoch": 3.2339857651245554, "grad_norm": 1.203125, "learning_rate": 0.0003975447694323585, "loss": 4.9184, "mean_token_accuracy": 0.23049383908510207, "num_tokens": 74941219.0, "step": 32715 }, { "entropy": 5.777109813690186, "epoch": 3.2344800316330566, "grad_norm": 1.265625, "learning_rate": 0.0003975151713560918, "loss": 4.9921, "mean_token_accuracy": 0.22407320737838746, "num_tokens": 74951857.0, "step": 32720 }, { "entropy": 5.6656012535095215, "epoch": 3.234974298141558, "grad_norm": 1.0703125, "learning_rate": 0.0003974855702659328, "loss": 4.8247, "mean_token_accuracy": 0.22974827140569687, "num_tokens": 74963807.0, "step": 32725 }, { "entropy": 5.720166206359863, "epoch": 3.235468564650059, "grad_norm": 1.15625, "learning_rate": 0.00039745596616260983, "loss": 4.8998, "mean_token_accuracy": 0.23068222403526306, "num_tokens": 74975646.0, "step": 32730 }, { "entropy": 5.740240812301636, "epoch": 3.235962831158561, "grad_norm": 1.296875, "learning_rate": 0.0003974263590468511, "loss": 5.0263, "mean_token_accuracy": 0.22296654284000397, "num_tokens": 74987197.0, "step": 32735 }, { "entropy": 5.704717397689819, "epoch": 3.236457097667062, "grad_norm": 1.2265625, "learning_rate": 0.0003973967489193849, "loss": 4.9732, "mean_token_accuracy": 0.22435937225818633, "num_tokens": 74999020.0, "step": 32740 }, { "entropy": 5.751628398895264, "epoch": 3.2369513641755634, "grad_norm": 1.359375, "learning_rate": 0.00039736713578093975, "loss": 4.993, "mean_token_accuracy": 0.2288254350423813, "num_tokens": 75010889.0, "step": 32745 }, { "entropy": 5.766255283355713, "epoch": 3.2374456306840647, "grad_norm": 1.171875, "learning_rate": 0.000397337519632244, "loss": 5.0046, "mean_token_accuracy": 0.21778091341257094, "num_tokens": 75021934.0, "step": 32750 }, { "entropy": 5.673018169403076, "epoch": 3.2379398971925664, "grad_norm": 1.2109375, "learning_rate": 0.00039730790047402635, "loss": 4.8945, "mean_token_accuracy": 0.23094050586223602, "num_tokens": 75032337.0, "step": 32755 }, { "entropy": 5.721152639389038, "epoch": 3.2384341637010676, "grad_norm": 1.3515625, "learning_rate": 0.00039727827830701533, "loss": 4.8914, "mean_token_accuracy": 0.23109899014234542, "num_tokens": 75043094.0, "step": 32760 }, { "entropy": 5.724946355819702, "epoch": 3.238928430209569, "grad_norm": 1.28125, "learning_rate": 0.00039724865313193976, "loss": 4.8977, "mean_token_accuracy": 0.23170656710863113, "num_tokens": 75055108.0, "step": 32765 }, { "entropy": 5.734191274642944, "epoch": 3.23942269671807, "grad_norm": 1.2265625, "learning_rate": 0.0003972190249495283, "loss": 4.939, "mean_token_accuracy": 0.22555171996355056, "num_tokens": 75065388.0, "step": 32770 }, { "entropy": 5.726159143447876, "epoch": 3.239916963226572, "grad_norm": 1.1171875, "learning_rate": 0.0003971893937605099, "loss": 4.9634, "mean_token_accuracy": 0.22535429298877716, "num_tokens": 75077390.0, "step": 32775 }, { "entropy": 5.75620698928833, "epoch": 3.240411229735073, "grad_norm": 1.1484375, "learning_rate": 0.00039715975956561343, "loss": 4.9439, "mean_token_accuracy": 0.22031983733177185, "num_tokens": 75088795.0, "step": 32780 }, { "entropy": 5.75298228263855, "epoch": 3.2409054962435744, "grad_norm": 1.2421875, "learning_rate": 0.00039713012236556797, "loss": 4.9954, "mean_token_accuracy": 0.22003937661647796, "num_tokens": 75100336.0, "step": 32785 }, { "entropy": 5.775192070007324, "epoch": 3.241399762752076, "grad_norm": 1.2734375, "learning_rate": 0.0003971004821611025, "loss": 5.0218, "mean_token_accuracy": 0.21449678540229797, "num_tokens": 75111639.0, "step": 32790 }, { "entropy": 5.743088912963867, "epoch": 3.2418940292605773, "grad_norm": 1.3515625, "learning_rate": 0.00039707083895294625, "loss": 4.8871, "mean_token_accuracy": 0.2298685908317566, "num_tokens": 75122006.0, "step": 32795 }, { "entropy": 5.787891149520874, "epoch": 3.2423882957690786, "grad_norm": 1.3046875, "learning_rate": 0.00039704119274182835, "loss": 4.9963, "mean_token_accuracy": 0.2201235368847847, "num_tokens": 75132406.0, "step": 32800 }, { "entropy": 5.742186117172241, "epoch": 3.24288256227758, "grad_norm": 1.2265625, "learning_rate": 0.0003970115435284783, "loss": 4.958, "mean_token_accuracy": 0.22476572543382645, "num_tokens": 75145444.0, "step": 32805 }, { "entropy": 5.730851173400879, "epoch": 3.2433768287860816, "grad_norm": 1.15625, "learning_rate": 0.00039698189131362526, "loss": 4.8953, "mean_token_accuracy": 0.23222496658563613, "num_tokens": 75156069.0, "step": 32810 }, { "entropy": 5.740574073791504, "epoch": 3.243871095294583, "grad_norm": 1.2265625, "learning_rate": 0.00039695223609799885, "loss": 4.9888, "mean_token_accuracy": 0.219991435110569, "num_tokens": 75167075.0, "step": 32815 }, { "entropy": 5.711857509613037, "epoch": 3.244365361803084, "grad_norm": 1.0859375, "learning_rate": 0.0003969225778823285, "loss": 4.9103, "mean_token_accuracy": 0.2285653531551361, "num_tokens": 75178464.0, "step": 32820 }, { "entropy": 5.660870981216431, "epoch": 3.244859628311586, "grad_norm": 1.1328125, "learning_rate": 0.0003968929166673438, "loss": 4.8386, "mean_token_accuracy": 0.23088498264551163, "num_tokens": 75189803.0, "step": 32825 }, { "entropy": 5.7452253818511965, "epoch": 3.245353894820087, "grad_norm": 1.1953125, "learning_rate": 0.00039686325245377437, "loss": 5.025, "mean_token_accuracy": 0.21920556277036668, "num_tokens": 75201207.0, "step": 32830 }, { "entropy": 5.792042589187622, "epoch": 3.2458481613285883, "grad_norm": 1.0859375, "learning_rate": 0.0003968335852423501, "loss": 5.054, "mean_token_accuracy": 0.21513331085443496, "num_tokens": 75214092.0, "step": 32835 }, { "entropy": 5.743435192108154, "epoch": 3.2463424278370896, "grad_norm": 1.2109375, "learning_rate": 0.0003968039150338007, "loss": 4.9291, "mean_token_accuracy": 0.22192394882440566, "num_tokens": 75226139.0, "step": 32840 }, { "entropy": 5.741968822479248, "epoch": 3.2468366943455913, "grad_norm": 1.203125, "learning_rate": 0.00039677424182885606, "loss": 4.9042, "mean_token_accuracy": 0.22605155706405639, "num_tokens": 75238273.0, "step": 32845 }, { "entropy": 5.753855609893799, "epoch": 3.2473309608540926, "grad_norm": 1.1640625, "learning_rate": 0.0003967445656282462, "loss": 5.0336, "mean_token_accuracy": 0.22025871872901917, "num_tokens": 75250356.0, "step": 32850 }, { "entropy": 5.775371742248535, "epoch": 3.247825227362594, "grad_norm": 1.4140625, "learning_rate": 0.0003967148864327012, "loss": 4.9573, "mean_token_accuracy": 0.22411278486251832, "num_tokens": 75260329.0, "step": 32855 }, { "entropy": 5.776127099990845, "epoch": 3.248319493871095, "grad_norm": 1.2109375, "learning_rate": 0.0003966852042429511, "loss": 5.0166, "mean_token_accuracy": 0.21955184787511825, "num_tokens": 75271405.0, "step": 32860 }, { "entropy": 5.787915515899658, "epoch": 3.248813760379597, "grad_norm": 1.203125, "learning_rate": 0.00039665551905972607, "loss": 5.1031, "mean_token_accuracy": 0.2119460552930832, "num_tokens": 75283033.0, "step": 32865 }, { "entropy": 5.789566373825073, "epoch": 3.249308026888098, "grad_norm": 1.2890625, "learning_rate": 0.0003966258308837564, "loss": 4.9739, "mean_token_accuracy": 0.22148305624723436, "num_tokens": 75293582.0, "step": 32870 }, { "entropy": 5.737289905548096, "epoch": 3.2498022933965993, "grad_norm": 1.21875, "learning_rate": 0.0003965961397157724, "loss": 4.956, "mean_token_accuracy": 0.2272091254591942, "num_tokens": 75306500.0, "step": 32875 }, { "entropy": 5.722474002838135, "epoch": 3.250296559905101, "grad_norm": 1.1796875, "learning_rate": 0.00039656644555650456, "loss": 4.9392, "mean_token_accuracy": 0.2249496951699257, "num_tokens": 75318562.0, "step": 32880 }, { "entropy": 5.737403106689453, "epoch": 3.2507908264136023, "grad_norm": 1.2109375, "learning_rate": 0.00039653674840668326, "loss": 5.0121, "mean_token_accuracy": 0.22013545632362366, "num_tokens": 75330211.0, "step": 32885 }, { "entropy": 5.698039960861206, "epoch": 3.2512850929221035, "grad_norm": 1.1640625, "learning_rate": 0.0003965070482670391, "loss": 4.9095, "mean_token_accuracy": 0.23064723908901213, "num_tokens": 75341244.0, "step": 32890 }, { "entropy": 5.7085212707519535, "epoch": 3.251779359430605, "grad_norm": 1.140625, "learning_rate": 0.0003964773451383027, "loss": 4.9129, "mean_token_accuracy": 0.22117076218128204, "num_tokens": 75353381.0, "step": 32895 }, { "entropy": 5.709394454956055, "epoch": 3.2522736259391065, "grad_norm": 1.3125, "learning_rate": 0.00039644763902120473, "loss": 4.9209, "mean_token_accuracy": 0.22609392702579498, "num_tokens": 75364777.0, "step": 32900 }, { "entropy": 5.751534843444825, "epoch": 3.252767892447608, "grad_norm": 1.1640625, "learning_rate": 0.00039641792991647605, "loss": 4.9617, "mean_token_accuracy": 0.2263875976204872, "num_tokens": 75375677.0, "step": 32905 }, { "entropy": 5.775531387329101, "epoch": 3.253262158956109, "grad_norm": 1.1953125, "learning_rate": 0.0003963882178248475, "loss": 4.984, "mean_token_accuracy": 0.2281189888715744, "num_tokens": 75387925.0, "step": 32910 }, { "entropy": 5.639747571945191, "epoch": 3.2537564254646103, "grad_norm": 1.1875, "learning_rate": 0.0003963585027470498, "loss": 4.8202, "mean_token_accuracy": 0.23912526071071624, "num_tokens": 75399000.0, "step": 32915 }, { "entropy": 5.65747103691101, "epoch": 3.254250691973112, "grad_norm": 1.1640625, "learning_rate": 0.0003963287846838142, "loss": 4.8877, "mean_token_accuracy": 0.22225039303302765, "num_tokens": 75409930.0, "step": 32920 }, { "entropy": 5.742747735977173, "epoch": 3.2547449584816133, "grad_norm": 1.21875, "learning_rate": 0.00039629906363587177, "loss": 4.9957, "mean_token_accuracy": 0.21618987619876862, "num_tokens": 75421621.0, "step": 32925 }, { "entropy": 5.825606393814087, "epoch": 3.2552392249901145, "grad_norm": 1.2578125, "learning_rate": 0.00039626933960395345, "loss": 5.0765, "mean_token_accuracy": 0.21737864911556243, "num_tokens": 75434339.0, "step": 32930 }, { "entropy": 5.758001470565796, "epoch": 3.2557334914986162, "grad_norm": 1.1640625, "learning_rate": 0.00039623961258879057, "loss": 5.0345, "mean_token_accuracy": 0.223114912211895, "num_tokens": 75446720.0, "step": 32935 }, { "entropy": 5.674108171463013, "epoch": 3.2562277580071175, "grad_norm": 1.1484375, "learning_rate": 0.0003962098825911144, "loss": 4.9203, "mean_token_accuracy": 0.22712511867284774, "num_tokens": 75459354.0, "step": 32940 }, { "entropy": 5.775084209442139, "epoch": 3.2567220245156188, "grad_norm": 1.296875, "learning_rate": 0.00039618014961165633, "loss": 5.0434, "mean_token_accuracy": 0.21416785269975663, "num_tokens": 75471704.0, "step": 32945 }, { "entropy": 5.829787111282348, "epoch": 3.25721629102412, "grad_norm": 1.1953125, "learning_rate": 0.0003961504136511478, "loss": 5.0631, "mean_token_accuracy": 0.2210068702697754, "num_tokens": 75483145.0, "step": 32950 }, { "entropy": 5.778584766387939, "epoch": 3.2577105575326217, "grad_norm": 1.28125, "learning_rate": 0.00039612067471032024, "loss": 4.9467, "mean_token_accuracy": 0.223041108250618, "num_tokens": 75493678.0, "step": 32955 }, { "entropy": 5.717800235748291, "epoch": 3.258204824041123, "grad_norm": 1.1171875, "learning_rate": 0.0003960909327899053, "loss": 4.9549, "mean_token_accuracy": 0.2232361763715744, "num_tokens": 75504581.0, "step": 32960 }, { "entropy": 5.652930831909179, "epoch": 3.2586990905496243, "grad_norm": 1.296875, "learning_rate": 0.0003960611878906347, "loss": 4.863, "mean_token_accuracy": 0.23400799334049224, "num_tokens": 75515116.0, "step": 32965 }, { "entropy": 5.663910436630249, "epoch": 3.259193357058126, "grad_norm": 1.078125, "learning_rate": 0.0003960314400132401, "loss": 4.8933, "mean_token_accuracy": 0.2326750412583351, "num_tokens": 75527001.0, "step": 32970 }, { "entropy": 5.769656085968018, "epoch": 3.2596876235666272, "grad_norm": 1.3046875, "learning_rate": 0.0003960016891584532, "loss": 4.9491, "mean_token_accuracy": 0.22817399501800537, "num_tokens": 75537641.0, "step": 32975 }, { "entropy": 5.754283857345581, "epoch": 3.2601818900751285, "grad_norm": 1.15625, "learning_rate": 0.0003959719353270061, "loss": 4.9454, "mean_token_accuracy": 0.22727811932563782, "num_tokens": 75551225.0, "step": 32980 }, { "entropy": 5.660560035705567, "epoch": 3.2606761565836297, "grad_norm": 1.2265625, "learning_rate": 0.00039594217851963054, "loss": 4.9102, "mean_token_accuracy": 0.2328321620821953, "num_tokens": 75563112.0, "step": 32985 }, { "entropy": 5.7021783828735355, "epoch": 3.2611704230921315, "grad_norm": 1.21875, "learning_rate": 0.00039591241873705864, "loss": 4.8914, "mean_token_accuracy": 0.2300262987613678, "num_tokens": 75573709.0, "step": 32990 }, { "entropy": 5.7520205020904545, "epoch": 3.2616646896006327, "grad_norm": 1.234375, "learning_rate": 0.0003958826559800225, "loss": 4.9877, "mean_token_accuracy": 0.22024189531803132, "num_tokens": 75585269.0, "step": 32995 }, { "entropy": 5.747878551483154, "epoch": 3.262158956109134, "grad_norm": 1.125, "learning_rate": 0.0003958528902492543, "loss": 4.9928, "mean_token_accuracy": 0.21585804224014282, "num_tokens": 75597084.0, "step": 33000 }, { "epoch": 3.262158956109134, "eval_entropy": 5.481827690621877, "eval_loss": 5.033544063568115, "eval_mean_token_accuracy": 0.2278480052343154, "eval_num_tokens": 75597084.0, "eval_runtime": 20.2975, "eval_samples_per_second": 1601.823, "eval_steps_per_second": 200.271, "step": 33000 }, { "entropy": 5.675453424453735, "epoch": 3.2626532226176352, "grad_norm": 1.1875, "learning_rate": 0.00039582312154548614, "loss": 4.9086, "mean_token_accuracy": 0.23547551929950714, "num_tokens": 75608948.0, "step": 33005 }, { "entropy": 5.777303457260132, "epoch": 3.263147489126137, "grad_norm": 1.109375, "learning_rate": 0.00039579334986945055, "loss": 4.9603, "mean_token_accuracy": 0.22497835606336594, "num_tokens": 75619845.0, "step": 33010 }, { "entropy": 5.782904767990113, "epoch": 3.263641755634638, "grad_norm": 1.0625, "learning_rate": 0.0003957635752218797, "loss": 5.0213, "mean_token_accuracy": 0.21278902143239975, "num_tokens": 75632116.0, "step": 33015 }, { "entropy": 5.7099076271057125, "epoch": 3.2641360221431395, "grad_norm": 1.203125, "learning_rate": 0.0003957337976035063, "loss": 4.938, "mean_token_accuracy": 0.21921972036361695, "num_tokens": 75643675.0, "step": 33020 }, { "entropy": 5.776952028274536, "epoch": 3.2646302886516407, "grad_norm": 1.2734375, "learning_rate": 0.0003957040170150626, "loss": 4.9691, "mean_token_accuracy": 0.2205577239394188, "num_tokens": 75654451.0, "step": 33025 }, { "entropy": 5.692875719070434, "epoch": 3.2651245551601424, "grad_norm": 1.1796875, "learning_rate": 0.0003956742334572815, "loss": 4.874, "mean_token_accuracy": 0.2325876161456108, "num_tokens": 75666260.0, "step": 33030 }, { "entropy": 5.735413074493408, "epoch": 3.2656188216686437, "grad_norm": 1.2265625, "learning_rate": 0.0003956444469308955, "loss": 4.9913, "mean_token_accuracy": 0.21995376348495482, "num_tokens": 75678785.0, "step": 33035 }, { "entropy": 5.712336826324463, "epoch": 3.266113088177145, "grad_norm": 1.171875, "learning_rate": 0.0003956146574366374, "loss": 4.9176, "mean_token_accuracy": 0.2280648395419121, "num_tokens": 75690500.0, "step": 33040 }, { "entropy": 5.655271720886231, "epoch": 3.2666073546856467, "grad_norm": 1.0625, "learning_rate": 0.0003955848649752399, "loss": 4.9077, "mean_token_accuracy": 0.23271434605121613, "num_tokens": 75703616.0, "step": 33045 }, { "entropy": 5.693547916412354, "epoch": 3.267101621194148, "grad_norm": 1.28125, "learning_rate": 0.00039555506954743613, "loss": 4.9197, "mean_token_accuracy": 0.22507739067077637, "num_tokens": 75713996.0, "step": 33050 }, { "entropy": 5.78652925491333, "epoch": 3.267595887702649, "grad_norm": 1.140625, "learning_rate": 0.00039552527115395896, "loss": 5.0318, "mean_token_accuracy": 0.21904132068157195, "num_tokens": 75726746.0, "step": 33055 }, { "entropy": 5.806911563873291, "epoch": 3.2680901542111505, "grad_norm": 1.171875, "learning_rate": 0.00039549546979554133, "loss": 5.053, "mean_token_accuracy": 0.21448031067848206, "num_tokens": 75738441.0, "step": 33060 }, { "entropy": 5.715211391448975, "epoch": 3.268584420719652, "grad_norm": 1.15625, "learning_rate": 0.0003954656654729166, "loss": 5.0144, "mean_token_accuracy": 0.21815508604049683, "num_tokens": 75749592.0, "step": 33065 }, { "entropy": 5.822201442718506, "epoch": 3.2690786872281534, "grad_norm": 1.1796875, "learning_rate": 0.00039543585818681764, "loss": 5.1018, "mean_token_accuracy": 0.21020036637783052, "num_tokens": 75761668.0, "step": 33070 }, { "entropy": 5.782623291015625, "epoch": 3.2695729537366547, "grad_norm": 1.203125, "learning_rate": 0.0003954060479379779, "loss": 4.9893, "mean_token_accuracy": 0.2198414087295532, "num_tokens": 75773277.0, "step": 33075 }, { "entropy": 5.759593868255616, "epoch": 3.2700672202451564, "grad_norm": 1.265625, "learning_rate": 0.0003953762347271308, "loss": 4.9709, "mean_token_accuracy": 0.22093071788549423, "num_tokens": 75783888.0, "step": 33080 }, { "entropy": 5.687453079223633, "epoch": 3.2705614867536577, "grad_norm": 1.1484375, "learning_rate": 0.00039534641855500964, "loss": 4.9454, "mean_token_accuracy": 0.22809427678585054, "num_tokens": 75796157.0, "step": 33085 }, { "entropy": 5.6389994621276855, "epoch": 3.271055753262159, "grad_norm": 1.2421875, "learning_rate": 0.00039531659942234785, "loss": 4.8417, "mean_token_accuracy": 0.23880015909671784, "num_tokens": 75807523.0, "step": 33090 }, { "entropy": 5.7750657081604, "epoch": 3.27155001977066, "grad_norm": 1.1640625, "learning_rate": 0.00039528677732987913, "loss": 5.0272, "mean_token_accuracy": 0.21138565689325334, "num_tokens": 75819383.0, "step": 33095 }, { "entropy": 5.747149229049683, "epoch": 3.272044286279162, "grad_norm": 1.109375, "learning_rate": 0.000395256952278337, "loss": 5.0245, "mean_token_accuracy": 0.22631698101758957, "num_tokens": 75830957.0, "step": 33100 }, { "entropy": 5.757021808624268, "epoch": 3.272538552787663, "grad_norm": 1.171875, "learning_rate": 0.00039522712426845507, "loss": 4.9517, "mean_token_accuracy": 0.22000519633293153, "num_tokens": 75841260.0, "step": 33105 }, { "entropy": 5.725371980667115, "epoch": 3.2730328192961644, "grad_norm": 1.25, "learning_rate": 0.00039519729330096735, "loss": 4.9818, "mean_token_accuracy": 0.22631653696298598, "num_tokens": 75852803.0, "step": 33110 }, { "entropy": 5.768563175201416, "epoch": 3.273527085804666, "grad_norm": 1.234375, "learning_rate": 0.0003951674593766076, "loss": 4.98, "mean_token_accuracy": 0.2222690165042877, "num_tokens": 75863989.0, "step": 33115 }, { "entropy": 5.693273305892944, "epoch": 3.2740213523131674, "grad_norm": 1.1484375, "learning_rate": 0.0003951376224961096, "loss": 4.9023, "mean_token_accuracy": 0.23370018750429153, "num_tokens": 75875381.0, "step": 33120 }, { "entropy": 5.68121337890625, "epoch": 3.2745156188216686, "grad_norm": 1.109375, "learning_rate": 0.0003951077826602075, "loss": 4.8729, "mean_token_accuracy": 0.23197812288999559, "num_tokens": 75887204.0, "step": 33125 }, { "entropy": 5.7156453132629395, "epoch": 3.27500988533017, "grad_norm": 1.3203125, "learning_rate": 0.0003950779398696353, "loss": 4.9791, "mean_token_accuracy": 0.21795835793018342, "num_tokens": 75898666.0, "step": 33130 }, { "entropy": 5.716331720352173, "epoch": 3.275504151838671, "grad_norm": 1.2578125, "learning_rate": 0.00039504809412512724, "loss": 4.9281, "mean_token_accuracy": 0.22574625313282012, "num_tokens": 75910151.0, "step": 33135 }, { "entropy": 5.771676158905029, "epoch": 3.275998418347173, "grad_norm": 1.265625, "learning_rate": 0.0003950182454274173, "loss": 4.9861, "mean_token_accuracy": 0.228470116853714, "num_tokens": 75920533.0, "step": 33140 }, { "entropy": 5.76217942237854, "epoch": 3.276492684855674, "grad_norm": 1.109375, "learning_rate": 0.00039498839377723996, "loss": 4.9486, "mean_token_accuracy": 0.23305534273386003, "num_tokens": 75932335.0, "step": 33145 }, { "entropy": 5.782145261764526, "epoch": 3.2769869513641754, "grad_norm": 1.1953125, "learning_rate": 0.0003949585391753295, "loss": 4.9945, "mean_token_accuracy": 0.2259720340371132, "num_tokens": 75943741.0, "step": 33150 }, { "entropy": 5.676116895675659, "epoch": 3.277481217872677, "grad_norm": 1.234375, "learning_rate": 0.0003949286816224204, "loss": 4.9493, "mean_token_accuracy": 0.22634295821189881, "num_tokens": 75955755.0, "step": 33155 }, { "entropy": 5.744834852218628, "epoch": 3.2779754843811784, "grad_norm": 1.2265625, "learning_rate": 0.0003948988211192471, "loss": 4.9046, "mean_token_accuracy": 0.22474804371595383, "num_tokens": 75967057.0, "step": 33160 }, { "entropy": 5.710540342330932, "epoch": 3.2784697508896796, "grad_norm": 1.171875, "learning_rate": 0.0003948689576665443, "loss": 4.9605, "mean_token_accuracy": 0.22550025582313538, "num_tokens": 75978367.0, "step": 33165 }, { "entropy": 5.787054347991943, "epoch": 3.278964017398181, "grad_norm": 1.0625, "learning_rate": 0.00039483909126504643, "loss": 5.0541, "mean_token_accuracy": 0.21333929151296616, "num_tokens": 75990738.0, "step": 33170 }, { "entropy": 5.762073278427124, "epoch": 3.2794582839066826, "grad_norm": 1.2109375, "learning_rate": 0.0003948092219154883, "loss": 5.0134, "mean_token_accuracy": 0.2165161356329918, "num_tokens": 76003058.0, "step": 33175 }, { "entropy": 5.726857662200928, "epoch": 3.279952550415184, "grad_norm": 1.4375, "learning_rate": 0.0003947793496186048, "loss": 4.9224, "mean_token_accuracy": 0.23334858417510987, "num_tokens": 76013743.0, "step": 33180 }, { "entropy": 5.750691270828247, "epoch": 3.280446816923685, "grad_norm": 1.1875, "learning_rate": 0.0003947494743751307, "loss": 4.9865, "mean_token_accuracy": 0.22257972061634063, "num_tokens": 76024346.0, "step": 33185 }, { "entropy": 5.774991703033447, "epoch": 3.280941083432187, "grad_norm": 1.1953125, "learning_rate": 0.00039471959618580095, "loss": 4.9903, "mean_token_accuracy": 0.21920051127672197, "num_tokens": 76035444.0, "step": 33190 }, { "entropy": 5.692640542984009, "epoch": 3.281435349940688, "grad_norm": 1.1953125, "learning_rate": 0.0003946897150513506, "loss": 4.9292, "mean_token_accuracy": 0.23168145567178727, "num_tokens": 76047363.0, "step": 33195 }, { "entropy": 5.730627727508545, "epoch": 3.2819296164491893, "grad_norm": 1.2109375, "learning_rate": 0.0003946598309725146, "loss": 4.9916, "mean_token_accuracy": 0.216161872446537, "num_tokens": 76059581.0, "step": 33200 }, { "entropy": 5.69808406829834, "epoch": 3.2824238829576906, "grad_norm": 1.109375, "learning_rate": 0.0003946299439500283, "loss": 4.8981, "mean_token_accuracy": 0.23362579047679902, "num_tokens": 76071455.0, "step": 33205 }, { "entropy": 5.67490062713623, "epoch": 3.2829181494661923, "grad_norm": 1.125, "learning_rate": 0.0003946000539846267, "loss": 4.8946, "mean_token_accuracy": 0.23215041905641556, "num_tokens": 76083794.0, "step": 33210 }, { "entropy": 5.768623161315918, "epoch": 3.2834124159746936, "grad_norm": 1.09375, "learning_rate": 0.0003945701610770453, "loss": 4.9929, "mean_token_accuracy": 0.21989970356225969, "num_tokens": 76095690.0, "step": 33215 }, { "entropy": 5.67642560005188, "epoch": 3.283906682483195, "grad_norm": 1.21875, "learning_rate": 0.0003945402652280193, "loss": 4.9053, "mean_token_accuracy": 0.2241143152117729, "num_tokens": 76106730.0, "step": 33220 }, { "entropy": 5.688515472412109, "epoch": 3.2844009489916965, "grad_norm": 1.1875, "learning_rate": 0.0003945103664382844, "loss": 4.972, "mean_token_accuracy": 0.22458657175302504, "num_tokens": 76117333.0, "step": 33225 }, { "entropy": 5.680511713027954, "epoch": 3.284895215500198, "grad_norm": 1.2109375, "learning_rate": 0.0003944804647085759, "loss": 4.9014, "mean_token_accuracy": 0.23284486681222916, "num_tokens": 76129060.0, "step": 33230 }, { "entropy": 5.72352819442749, "epoch": 3.285389482008699, "grad_norm": 1.3359375, "learning_rate": 0.0003944505600396294, "loss": 4.9088, "mean_token_accuracy": 0.23243329674005508, "num_tokens": 76140724.0, "step": 33235 }, { "entropy": 5.66750955581665, "epoch": 3.2858837485172003, "grad_norm": 1.125, "learning_rate": 0.0003944206524321805, "loss": 4.9024, "mean_token_accuracy": 0.23183085918426513, "num_tokens": 76153021.0, "step": 33240 }, { "entropy": 5.717838907241822, "epoch": 3.286378015025702, "grad_norm": 1.140625, "learning_rate": 0.00039439074188696516, "loss": 4.9592, "mean_token_accuracy": 0.2249625727534294, "num_tokens": 76165759.0, "step": 33245 }, { "entropy": 5.78043007850647, "epoch": 3.2868722815342033, "grad_norm": 1.1171875, "learning_rate": 0.0003943608284047189, "loss": 4.958, "mean_token_accuracy": 0.22408254444599152, "num_tokens": 76178645.0, "step": 33250 }, { "entropy": 5.751153230667114, "epoch": 3.2873665480427046, "grad_norm": 1.2109375, "learning_rate": 0.0003943309119861779, "loss": 4.9169, "mean_token_accuracy": 0.22611104398965837, "num_tokens": 76189320.0, "step": 33255 }, { "entropy": 5.798932027816773, "epoch": 3.287860814551206, "grad_norm": 1.21875, "learning_rate": 0.0003943009926320778, "loss": 5.0551, "mean_token_accuracy": 0.21849936693906785, "num_tokens": 76200672.0, "step": 33260 }, { "entropy": 5.726233243942261, "epoch": 3.2883550810597075, "grad_norm": 1.2421875, "learning_rate": 0.0003942710703431548, "loss": 4.9406, "mean_token_accuracy": 0.22550822645425797, "num_tokens": 76211035.0, "step": 33265 }, { "entropy": 5.7367957592010494, "epoch": 3.288849347568209, "grad_norm": 1.1796875, "learning_rate": 0.0003942411451201451, "loss": 4.9764, "mean_token_accuracy": 0.22294462025165557, "num_tokens": 76222262.0, "step": 33270 }, { "entropy": 5.7552320003509525, "epoch": 3.28934361407671, "grad_norm": 1.203125, "learning_rate": 0.00039421121696378466, "loss": 4.9852, "mean_token_accuracy": 0.2240929961204529, "num_tokens": 76234346.0, "step": 33275 }, { "entropy": 5.731439447402954, "epoch": 3.2898378805852113, "grad_norm": 1.1640625, "learning_rate": 0.0003941812858748098, "loss": 4.9527, "mean_token_accuracy": 0.22616081386804582, "num_tokens": 76244536.0, "step": 33280 }, { "entropy": 5.686013698577881, "epoch": 3.290332147093713, "grad_norm": 1.2265625, "learning_rate": 0.0003941513518539568, "loss": 4.9642, "mean_token_accuracy": 0.22632805854082108, "num_tokens": 76256080.0, "step": 33285 }, { "entropy": 5.725487089157104, "epoch": 3.2908264136022143, "grad_norm": 1.1953125, "learning_rate": 0.00039412141490196206, "loss": 4.9289, "mean_token_accuracy": 0.2282807484269142, "num_tokens": 76266741.0, "step": 33290 }, { "entropy": 5.728825044631958, "epoch": 3.2913206801107155, "grad_norm": 1.3125, "learning_rate": 0.000394091475019562, "loss": 4.9459, "mean_token_accuracy": 0.21818799674510955, "num_tokens": 76279099.0, "step": 33295 }, { "entropy": 5.750980424880981, "epoch": 3.2918149466192173, "grad_norm": 1.3125, "learning_rate": 0.0003940615322074932, "loss": 5.0788, "mean_token_accuracy": 0.21638076901435851, "num_tokens": 76290692.0, "step": 33300 }, { "entropy": 5.761463069915772, "epoch": 3.2923092131277185, "grad_norm": 1.1640625, "learning_rate": 0.00039403158646649227, "loss": 4.9571, "mean_token_accuracy": 0.22315480262041093, "num_tokens": 76302003.0, "step": 33305 }, { "entropy": 5.698015832901001, "epoch": 3.2928034796362198, "grad_norm": 1.203125, "learning_rate": 0.0003940016377972958, "loss": 4.9532, "mean_token_accuracy": 0.22567558586597442, "num_tokens": 76313255.0, "step": 33310 }, { "entropy": 5.689161682128907, "epoch": 3.293297746144721, "grad_norm": 1.296875, "learning_rate": 0.00039397168620064065, "loss": 4.8999, "mean_token_accuracy": 0.23211898505687714, "num_tokens": 76323154.0, "step": 33315 }, { "entropy": 5.8088874340057375, "epoch": 3.2937920126532227, "grad_norm": 1.5, "learning_rate": 0.00039394173167726346, "loss": 5.0019, "mean_token_accuracy": 0.21445233672857283, "num_tokens": 76333168.0, "step": 33320 }, { "entropy": 5.75108494758606, "epoch": 3.294286279161724, "grad_norm": 1.1875, "learning_rate": 0.0003939117742279013, "loss": 5.015, "mean_token_accuracy": 0.2187953218817711, "num_tokens": 76344916.0, "step": 33325 }, { "entropy": 5.795640182495117, "epoch": 3.2947805456702253, "grad_norm": 1.1953125, "learning_rate": 0.000393881813853291, "loss": 4.9796, "mean_token_accuracy": 0.22268164455890654, "num_tokens": 76357124.0, "step": 33330 }, { "entropy": 5.836868190765381, "epoch": 3.295274812178727, "grad_norm": 1.1875, "learning_rate": 0.00039385185055416965, "loss": 5.0408, "mean_token_accuracy": 0.2126067817211151, "num_tokens": 76368784.0, "step": 33335 }, { "entropy": 5.808990240097046, "epoch": 3.2957690786872282, "grad_norm": 1.1875, "learning_rate": 0.00039382188433127437, "loss": 5.0089, "mean_token_accuracy": 0.21562146097421647, "num_tokens": 76379864.0, "step": 33340 }, { "entropy": 5.759326934814453, "epoch": 3.2962633451957295, "grad_norm": 1.25, "learning_rate": 0.0003937919151853422, "loss": 4.9744, "mean_token_accuracy": 0.22397873550653458, "num_tokens": 76392184.0, "step": 33345 }, { "entropy": 5.75353856086731, "epoch": 3.2967576117042308, "grad_norm": 1.1171875, "learning_rate": 0.0003937619431171107, "loss": 4.9318, "mean_token_accuracy": 0.22035236805677413, "num_tokens": 76404312.0, "step": 33350 }, { "entropy": 5.7463438510894775, "epoch": 3.2972518782127325, "grad_norm": 1.2734375, "learning_rate": 0.0003937319681273168, "loss": 5.0381, "mean_token_accuracy": 0.21764319092035295, "num_tokens": 76414351.0, "step": 33355 }, { "entropy": 5.762243366241455, "epoch": 3.2977461447212337, "grad_norm": 1.203125, "learning_rate": 0.0003937019902166981, "loss": 5.0076, "mean_token_accuracy": 0.2170119896531105, "num_tokens": 76425851.0, "step": 33360 }, { "entropy": 5.734449005126953, "epoch": 3.298240411229735, "grad_norm": 1.234375, "learning_rate": 0.000393672009385992, "loss": 4.9321, "mean_token_accuracy": 0.22990116178989412, "num_tokens": 76437669.0, "step": 33365 }, { "entropy": 5.71902027130127, "epoch": 3.2987346777382367, "grad_norm": 1.109375, "learning_rate": 0.0003936420256359361, "loss": 4.8922, "mean_token_accuracy": 0.22655837535858153, "num_tokens": 76449589.0, "step": 33370 }, { "entropy": 5.794484663009643, "epoch": 3.299228944246738, "grad_norm": 1.21875, "learning_rate": 0.000393612038967268, "loss": 5.0596, "mean_token_accuracy": 0.21757402271032333, "num_tokens": 76462143.0, "step": 33375 }, { "entropy": 5.764831686019898, "epoch": 3.2997232107552392, "grad_norm": 1.21875, "learning_rate": 0.00039358204938072527, "loss": 4.9633, "mean_token_accuracy": 0.22035585790872575, "num_tokens": 76473731.0, "step": 33380 }, { "entropy": 5.754424047470093, "epoch": 3.3002174772637405, "grad_norm": 1.1015625, "learning_rate": 0.00039355205687704575, "loss": 4.9619, "mean_token_accuracy": 0.2258112460374832, "num_tokens": 76484287.0, "step": 33385 }, { "entropy": 5.687608242034912, "epoch": 3.3007117437722417, "grad_norm": 1.15625, "learning_rate": 0.0003935220614569672, "loss": 4.937, "mean_token_accuracy": 0.22870177626609803, "num_tokens": 76495940.0, "step": 33390 }, { "entropy": 5.694515609741211, "epoch": 3.3012060102807435, "grad_norm": 1.21875, "learning_rate": 0.00039349206312122765, "loss": 4.8959, "mean_token_accuracy": 0.2354155421257019, "num_tokens": 76507890.0, "step": 33395 }, { "entropy": 5.764904499053955, "epoch": 3.3017002767892447, "grad_norm": 1.2421875, "learning_rate": 0.0003934620618705649, "loss": 4.9568, "mean_token_accuracy": 0.22027647495269775, "num_tokens": 76519654.0, "step": 33400 }, { "entropy": 5.742703199386597, "epoch": 3.302194543297746, "grad_norm": 1.15625, "learning_rate": 0.000393432057705717, "loss": 4.9372, "mean_token_accuracy": 0.22233319133520127, "num_tokens": 76532026.0, "step": 33405 }, { "entropy": 5.707004404067993, "epoch": 3.3026888098062477, "grad_norm": 1.1171875, "learning_rate": 0.0003934020506274222, "loss": 4.9021, "mean_token_accuracy": 0.23226378262043, "num_tokens": 76543629.0, "step": 33410 }, { "entropy": 5.750660800933838, "epoch": 3.303183076314749, "grad_norm": 1.171875, "learning_rate": 0.0003933720406364185, "loss": 4.98, "mean_token_accuracy": 0.22413599640130996, "num_tokens": 76554069.0, "step": 33415 }, { "entropy": 5.707640981674194, "epoch": 3.30367734282325, "grad_norm": 1.1328125, "learning_rate": 0.00039334202773344437, "loss": 4.925, "mean_token_accuracy": 0.22701105773448943, "num_tokens": 76566148.0, "step": 33420 }, { "entropy": 5.7383016586303714, "epoch": 3.3041716093317515, "grad_norm": 1.203125, "learning_rate": 0.00039331201191923794, "loss": 4.9396, "mean_token_accuracy": 0.22432364970445634, "num_tokens": 76577208.0, "step": 33425 }, { "entropy": 5.675359153747559, "epoch": 3.304665875840253, "grad_norm": 1.171875, "learning_rate": 0.0003932819931945375, "loss": 4.9212, "mean_token_accuracy": 0.23862544000148772, "num_tokens": 76588532.0, "step": 33430 }, { "entropy": 5.795589780807495, "epoch": 3.3051601423487544, "grad_norm": 1.21875, "learning_rate": 0.0003932519715600819, "loss": 5.0207, "mean_token_accuracy": 0.22104718685150146, "num_tokens": 76600054.0, "step": 33435 }, { "entropy": 5.768060398101807, "epoch": 3.3056544088572557, "grad_norm": 1.1171875, "learning_rate": 0.00039322194701660936, "loss": 4.9818, "mean_token_accuracy": 0.2276659607887268, "num_tokens": 76612571.0, "step": 33440 }, { "entropy": 5.761131000518799, "epoch": 3.3061486753657574, "grad_norm": 1.078125, "learning_rate": 0.00039319191956485854, "loss": 5.0091, "mean_token_accuracy": 0.21776643097400666, "num_tokens": 76625435.0, "step": 33445 }, { "entropy": 5.698491907119751, "epoch": 3.3066429418742587, "grad_norm": 1.359375, "learning_rate": 0.0003931618892055682, "loss": 4.9059, "mean_token_accuracy": 0.23080936074256897, "num_tokens": 76635529.0, "step": 33450 }, { "entropy": 5.658594942092895, "epoch": 3.30713720838276, "grad_norm": 1.1640625, "learning_rate": 0.00039313185593947713, "loss": 4.8371, "mean_token_accuracy": 0.2367470696568489, "num_tokens": 76645819.0, "step": 33455 }, { "entropy": 5.822653532028198, "epoch": 3.307631474891261, "grad_norm": 1.1171875, "learning_rate": 0.00039310181976732404, "loss": 5.1158, "mean_token_accuracy": 0.20834122002124786, "num_tokens": 76657803.0, "step": 33460 }, { "entropy": 5.838195419311523, "epoch": 3.308125741399763, "grad_norm": 1.2734375, "learning_rate": 0.00039307178068984783, "loss": 5.083, "mean_token_accuracy": 0.2120375454425812, "num_tokens": 76670260.0, "step": 33465 }, { "entropy": 5.709773540496826, "epoch": 3.308620007908264, "grad_norm": 1.171875, "learning_rate": 0.0003930417387077875, "loss": 4.9226, "mean_token_accuracy": 0.22853083312511444, "num_tokens": 76682591.0, "step": 33470 }, { "entropy": 5.724830913543701, "epoch": 3.3091142744167654, "grad_norm": 1.171875, "learning_rate": 0.0003930116938218821, "loss": 4.9237, "mean_token_accuracy": 0.22352764159440994, "num_tokens": 76694147.0, "step": 33475 }, { "entropy": 5.750931358337402, "epoch": 3.309608540925267, "grad_norm": 1.1328125, "learning_rate": 0.00039298164603287063, "loss": 5.0383, "mean_token_accuracy": 0.2250906527042389, "num_tokens": 76706325.0, "step": 33480 }, { "entropy": 5.78615140914917, "epoch": 3.3101028074337684, "grad_norm": 1.1640625, "learning_rate": 0.0003929515953414926, "loss": 4.9835, "mean_token_accuracy": 0.22102261781692506, "num_tokens": 76719574.0, "step": 33485 }, { "entropy": 5.724516344070435, "epoch": 3.3105970739422697, "grad_norm": 1.1640625, "learning_rate": 0.0003929215417484868, "loss": 4.8978, "mean_token_accuracy": 0.2268466144800186, "num_tokens": 76731820.0, "step": 33490 }, { "entropy": 5.656566381454468, "epoch": 3.311091340450771, "grad_norm": 1.25, "learning_rate": 0.00039289148525459283, "loss": 4.855, "mean_token_accuracy": 0.23334207832813264, "num_tokens": 76742849.0, "step": 33495 }, { "entropy": 5.791948509216309, "epoch": 3.3115856069592726, "grad_norm": 1.265625, "learning_rate": 0.00039286142586055005, "loss": 5.038, "mean_token_accuracy": 0.21924878358840943, "num_tokens": 76754747.0, "step": 33500 }, { "entropy": 5.717371129989624, "epoch": 3.312079873467774, "grad_norm": 1.0859375, "learning_rate": 0.000392831363567098, "loss": 4.892, "mean_token_accuracy": 0.2289115607738495, "num_tokens": 76766738.0, "step": 33505 }, { "entropy": 5.7241425037384035, "epoch": 3.312574139976275, "grad_norm": 1.2578125, "learning_rate": 0.00039280129837497595, "loss": 4.9818, "mean_token_accuracy": 0.21793031096458435, "num_tokens": 76777457.0, "step": 33510 }, { "entropy": 5.7857160568237305, "epoch": 3.3130684064847764, "grad_norm": 1.1484375, "learning_rate": 0.00039277123028492376, "loss": 5.0349, "mean_token_accuracy": 0.21183947026729583, "num_tokens": 76788335.0, "step": 33515 }, { "entropy": 5.801105308532715, "epoch": 3.313562672993278, "grad_norm": 1.234375, "learning_rate": 0.0003927411592976811, "loss": 4.9453, "mean_token_accuracy": 0.22345901578664779, "num_tokens": 76800471.0, "step": 33520 }, { "entropy": 5.724969816207886, "epoch": 3.3140569395017794, "grad_norm": 1.2734375, "learning_rate": 0.00039271108541398753, "loss": 4.955, "mean_token_accuracy": 0.2281900614500046, "num_tokens": 76811792.0, "step": 33525 }, { "entropy": 5.70270938873291, "epoch": 3.3145512060102806, "grad_norm": 1.28125, "learning_rate": 0.0003926810086345831, "loss": 4.89, "mean_token_accuracy": 0.23091378062963486, "num_tokens": 76824332.0, "step": 33530 }, { "entropy": 5.766416597366333, "epoch": 3.315045472518782, "grad_norm": 1.1953125, "learning_rate": 0.00039265092896020767, "loss": 4.9819, "mean_token_accuracy": 0.21932831704616546, "num_tokens": 76835712.0, "step": 33535 }, { "entropy": 5.689514923095703, "epoch": 3.3155397390272836, "grad_norm": 1.2265625, "learning_rate": 0.000392620846391601, "loss": 4.9061, "mean_token_accuracy": 0.2360375180840492, "num_tokens": 76847915.0, "step": 33540 }, { "entropy": 5.720696353912354, "epoch": 3.316034005535785, "grad_norm": 1.1171875, "learning_rate": 0.00039259076092950333, "loss": 4.9936, "mean_token_accuracy": 0.2188990220427513, "num_tokens": 76859982.0, "step": 33545 }, { "entropy": 5.695939064025879, "epoch": 3.316528272044286, "grad_norm": 1.171875, "learning_rate": 0.0003925606725746547, "loss": 4.8999, "mean_token_accuracy": 0.23364005088806153, "num_tokens": 76870743.0, "step": 33550 }, { "entropy": 5.629205989837646, "epoch": 3.317022538552788, "grad_norm": 1.1953125, "learning_rate": 0.0003925305813277952, "loss": 4.8683, "mean_token_accuracy": 0.23170077204704284, "num_tokens": 76882118.0, "step": 33555 }, { "entropy": 5.729952144622803, "epoch": 3.317516805061289, "grad_norm": 1.2265625, "learning_rate": 0.00039250048718966524, "loss": 4.9697, "mean_token_accuracy": 0.22129811197519303, "num_tokens": 76893658.0, "step": 33560 }, { "entropy": 5.769687747955322, "epoch": 3.3180110715697904, "grad_norm": 1.2265625, "learning_rate": 0.00039247039016100514, "loss": 4.9496, "mean_token_accuracy": 0.22413306832313537, "num_tokens": 76904974.0, "step": 33565 }, { "entropy": 5.730953741073608, "epoch": 3.3185053380782916, "grad_norm": 1.21875, "learning_rate": 0.00039244029024255506, "loss": 4.9608, "mean_token_accuracy": 0.22415735125541686, "num_tokens": 76915972.0, "step": 33570 }, { "entropy": 5.74026837348938, "epoch": 3.3189996045867933, "grad_norm": 1.140625, "learning_rate": 0.0003924101874350557, "loss": 4.9468, "mean_token_accuracy": 0.22654052823781967, "num_tokens": 76927397.0, "step": 33575 }, { "entropy": 5.783735275268555, "epoch": 3.3194938710952946, "grad_norm": 1.078125, "learning_rate": 0.0003923800817392475, "loss": 4.9561, "mean_token_accuracy": 0.21487514227628707, "num_tokens": 76939744.0, "step": 33580 }, { "entropy": 5.814383697509766, "epoch": 3.319988137603796, "grad_norm": 1.15625, "learning_rate": 0.00039234997315587105, "loss": 5.0672, "mean_token_accuracy": 0.21589359641075134, "num_tokens": 76951747.0, "step": 33585 }, { "entropy": 5.769013071060181, "epoch": 3.3204824041122976, "grad_norm": 1.296875, "learning_rate": 0.0003923198616856671, "loss": 4.9672, "mean_token_accuracy": 0.2254791423678398, "num_tokens": 76961734.0, "step": 33590 }, { "entropy": 5.746283340454101, "epoch": 3.320976670620799, "grad_norm": 1.2890625, "learning_rate": 0.00039228974732937637, "loss": 4.9895, "mean_token_accuracy": 0.21665629297494887, "num_tokens": 76972566.0, "step": 33595 }, { "entropy": 5.768842458724976, "epoch": 3.3214709371293, "grad_norm": 1.2109375, "learning_rate": 0.0003922596300877396, "loss": 4.9882, "mean_token_accuracy": 0.2165379822254181, "num_tokens": 76983446.0, "step": 33600 }, { "entropy": 5.765625953674316, "epoch": 3.3219652036378013, "grad_norm": 1.1328125, "learning_rate": 0.0003922295099614978, "loss": 4.9431, "mean_token_accuracy": 0.22241671085357667, "num_tokens": 76994292.0, "step": 33605 }, { "entropy": 5.7250487327575685, "epoch": 3.322459470146303, "grad_norm": 1.140625, "learning_rate": 0.00039219938695139186, "loss": 4.9628, "mean_token_accuracy": 0.22445331364870072, "num_tokens": 77007095.0, "step": 33610 }, { "entropy": 5.737336111068726, "epoch": 3.3229537366548043, "grad_norm": 1.171875, "learning_rate": 0.0003921692610581628, "loss": 4.9334, "mean_token_accuracy": 0.22273040413856507, "num_tokens": 77017358.0, "step": 33615 }, { "entropy": 5.6836442947387695, "epoch": 3.3234480031633056, "grad_norm": 1.140625, "learning_rate": 0.0003921391322825517, "loss": 4.8863, "mean_token_accuracy": 0.2275211066007614, "num_tokens": 77028794.0, "step": 33620 }, { "entropy": 5.66890287399292, "epoch": 3.3239422696718073, "grad_norm": 1.2265625, "learning_rate": 0.00039210900062529986, "loss": 4.9292, "mean_token_accuracy": 0.22593703269958496, "num_tokens": 77040795.0, "step": 33625 }, { "entropy": 5.76408281326294, "epoch": 3.3244365361803085, "grad_norm": 1.2578125, "learning_rate": 0.0003920788660871483, "loss": 4.9807, "mean_token_accuracy": 0.22772539108991624, "num_tokens": 77051810.0, "step": 33630 }, { "entropy": 5.759575891494751, "epoch": 3.32493080268881, "grad_norm": 1.140625, "learning_rate": 0.00039204872866883863, "loss": 5.0466, "mean_token_accuracy": 0.22512495666742324, "num_tokens": 77064504.0, "step": 33635 }, { "entropy": 5.779351663589478, "epoch": 3.325425069197311, "grad_norm": 1.15625, "learning_rate": 0.000392018588371112, "loss": 4.9768, "mean_token_accuracy": 0.2178046301007271, "num_tokens": 77075163.0, "step": 33640 }, { "entropy": 5.77309217453003, "epoch": 3.3259193357058123, "grad_norm": 1.3125, "learning_rate": 0.00039198844519470994, "loss": 4.9773, "mean_token_accuracy": 0.22501225173473358, "num_tokens": 77086871.0, "step": 33645 }, { "entropy": 5.691672945022583, "epoch": 3.326413602214314, "grad_norm": 1.3359375, "learning_rate": 0.000391958299140374, "loss": 4.8848, "mean_token_accuracy": 0.2329185351729393, "num_tokens": 77097285.0, "step": 33650 }, { "entropy": 5.650037813186645, "epoch": 3.3269078687228153, "grad_norm": 1.2109375, "learning_rate": 0.0003919281502088457, "loss": 4.8477, "mean_token_accuracy": 0.23862815350294114, "num_tokens": 77107035.0, "step": 33655 }, { "entropy": 5.774787855148316, "epoch": 3.3274021352313166, "grad_norm": 1.1171875, "learning_rate": 0.0003918979984008668, "loss": 4.9793, "mean_token_accuracy": 0.21611535251140596, "num_tokens": 77119449.0, "step": 33660 }, { "entropy": 5.744748592376709, "epoch": 3.3278964017398183, "grad_norm": 1.2421875, "learning_rate": 0.00039186784371717903, "loss": 4.9779, "mean_token_accuracy": 0.22698270678520202, "num_tokens": 77130508.0, "step": 33665 }, { "entropy": 5.758039951324463, "epoch": 3.3283906682483195, "grad_norm": 1.3125, "learning_rate": 0.0003918376861585242, "loss": 4.9699, "mean_token_accuracy": 0.21827473789453505, "num_tokens": 77142080.0, "step": 33670 }, { "entropy": 5.791952133178711, "epoch": 3.328884934756821, "grad_norm": 1.265625, "learning_rate": 0.00039180752572564405, "loss": 4.9971, "mean_token_accuracy": 0.22108243703842162, "num_tokens": 77152366.0, "step": 33675 }, { "entropy": 5.71120662689209, "epoch": 3.329379201265322, "grad_norm": 1.171875, "learning_rate": 0.0003917773624192808, "loss": 5.0435, "mean_token_accuracy": 0.21778865307569503, "num_tokens": 77164984.0, "step": 33680 }, { "entropy": 5.781825399398803, "epoch": 3.3298734677738238, "grad_norm": 1.2109375, "learning_rate": 0.0003917471962401762, "loss": 5.0512, "mean_token_accuracy": 0.2145717367529869, "num_tokens": 77176870.0, "step": 33685 }, { "entropy": 5.727587509155273, "epoch": 3.330367734282325, "grad_norm": 1.1328125, "learning_rate": 0.0003917170271890724, "loss": 4.8823, "mean_token_accuracy": 0.23652447909116744, "num_tokens": 77188376.0, "step": 33690 }, { "entropy": 5.741088819503784, "epoch": 3.3308620007908263, "grad_norm": 1.28125, "learning_rate": 0.0003916868552667118, "loss": 4.9261, "mean_token_accuracy": 0.22716683596372605, "num_tokens": 77198556.0, "step": 33695 }, { "entropy": 5.712704372406006, "epoch": 3.331356267299328, "grad_norm": 1.296875, "learning_rate": 0.00039165668047383634, "loss": 4.9995, "mean_token_accuracy": 0.22532976418733597, "num_tokens": 77209409.0, "step": 33700 }, { "entropy": 5.731375885009766, "epoch": 3.3318505338078293, "grad_norm": 1.1796875, "learning_rate": 0.0003916265028111886, "loss": 4.9882, "mean_token_accuracy": 0.22507862895727157, "num_tokens": 77219986.0, "step": 33705 }, { "entropy": 5.742857646942139, "epoch": 3.3323448003163305, "grad_norm": 1.1875, "learning_rate": 0.00039159632227951066, "loss": 4.9876, "mean_token_accuracy": 0.22230661511421204, "num_tokens": 77231380.0, "step": 33710 }, { "entropy": 5.69151201248169, "epoch": 3.3328390668248318, "grad_norm": 1.1484375, "learning_rate": 0.000391566138879545, "loss": 4.9834, "mean_token_accuracy": 0.2237701430916786, "num_tokens": 77241765.0, "step": 33715 }, { "entropy": 5.7134480476379395, "epoch": 3.3333333333333335, "grad_norm": 1.3125, "learning_rate": 0.0003915359526120344, "loss": 4.992, "mean_token_accuracy": 0.2184361070394516, "num_tokens": 77256091.0, "step": 33720 }, { "entropy": 5.804354429244995, "epoch": 3.3338275998418347, "grad_norm": 1.3359375, "learning_rate": 0.0003915057634777213, "loss": 5.0206, "mean_token_accuracy": 0.2190558835864067, "num_tokens": 77267084.0, "step": 33725 }, { "entropy": 5.811003684997559, "epoch": 3.334321866350336, "grad_norm": 1.265625, "learning_rate": 0.0003914755714773483, "loss": 5.0064, "mean_token_accuracy": 0.2206461176276207, "num_tokens": 77278435.0, "step": 33730 }, { "entropy": 5.734785461425782, "epoch": 3.3348161328588377, "grad_norm": 1.1796875, "learning_rate": 0.0003914453766116581, "loss": 4.9843, "mean_token_accuracy": 0.21770980805158616, "num_tokens": 77290971.0, "step": 33735 }, { "entropy": 5.719811487197876, "epoch": 3.335310399367339, "grad_norm": 1.140625, "learning_rate": 0.0003914151788813937, "loss": 4.9396, "mean_token_accuracy": 0.22535114288330077, "num_tokens": 77302704.0, "step": 33740 }, { "entropy": 5.736298704147339, "epoch": 3.3358046658758402, "grad_norm": 1.1015625, "learning_rate": 0.00039138497828729773, "loss": 4.8979, "mean_token_accuracy": 0.23244884014129638, "num_tokens": 77314107.0, "step": 33745 }, { "entropy": 5.790796136856079, "epoch": 3.3362989323843415, "grad_norm": 1.21875, "learning_rate": 0.0003913547748301133, "loss": 4.9569, "mean_token_accuracy": 0.22317126095294954, "num_tokens": 77324040.0, "step": 33750 }, { "entropy": 5.666530466079712, "epoch": 3.336793198892843, "grad_norm": 1.1484375, "learning_rate": 0.0003913245685105834, "loss": 4.9065, "mean_token_accuracy": 0.23847365975379944, "num_tokens": 77336471.0, "step": 33755 }, { "entropy": 5.766614103317261, "epoch": 3.3372874654013445, "grad_norm": 1.3125, "learning_rate": 0.00039129435932945094, "loss": 5.0058, "mean_token_accuracy": 0.21859643161296843, "num_tokens": 77346947.0, "step": 33760 }, { "entropy": 5.727384328842163, "epoch": 3.3377817319098457, "grad_norm": 1.25, "learning_rate": 0.0003912641472874593, "loss": 4.8949, "mean_token_accuracy": 0.2340430051088333, "num_tokens": 77357995.0, "step": 33765 }, { "entropy": 5.711845111846924, "epoch": 3.338275998418347, "grad_norm": 1.234375, "learning_rate": 0.0003912339323853516, "loss": 4.9217, "mean_token_accuracy": 0.22435169368982316, "num_tokens": 77368910.0, "step": 33770 }, { "entropy": 5.801765012741089, "epoch": 3.3387702649268487, "grad_norm": 1.109375, "learning_rate": 0.00039120371462387105, "loss": 5.0073, "mean_token_accuracy": 0.22015341371297836, "num_tokens": 77381010.0, "step": 33775 }, { "entropy": 5.802192831039429, "epoch": 3.33926453143535, "grad_norm": 1.140625, "learning_rate": 0.00039117349400376116, "loss": 5.0438, "mean_token_accuracy": 0.21507867872714997, "num_tokens": 77392182.0, "step": 33780 }, { "entropy": 5.819150400161743, "epoch": 3.339758797943851, "grad_norm": 1.171875, "learning_rate": 0.00039114327052576525, "loss": 5.0453, "mean_token_accuracy": 0.21451151072978974, "num_tokens": 77403574.0, "step": 33785 }, { "entropy": 5.636699295043945, "epoch": 3.3402530644523525, "grad_norm": 1.2734375, "learning_rate": 0.00039111304419062686, "loss": 4.846, "mean_token_accuracy": 0.23021390438079833, "num_tokens": 77414941.0, "step": 33790 }, { "entropy": 5.7312331199646, "epoch": 3.340747330960854, "grad_norm": 1.171875, "learning_rate": 0.0003910828149990897, "loss": 5.0167, "mean_token_accuracy": 0.21681069284677507, "num_tokens": 77426361.0, "step": 33795 }, { "entropy": 5.774086141586304, "epoch": 3.3412415974693555, "grad_norm": 1.1953125, "learning_rate": 0.00039105258295189717, "loss": 5.0181, "mean_token_accuracy": 0.22102180272340774, "num_tokens": 77438366.0, "step": 33800 }, { "entropy": 5.742863655090332, "epoch": 3.3417358639778567, "grad_norm": 1.3515625, "learning_rate": 0.00039102234804979307, "loss": 4.9391, "mean_token_accuracy": 0.23176540285348893, "num_tokens": 77448662.0, "step": 33805 }, { "entropy": 5.773565483093262, "epoch": 3.3422301304863584, "grad_norm": 1.234375, "learning_rate": 0.0003909921102935213, "loss": 4.9115, "mean_token_accuracy": 0.23041762858629228, "num_tokens": 77459806.0, "step": 33810 }, { "entropy": 5.732771110534668, "epoch": 3.3427243969948597, "grad_norm": 1.1875, "learning_rate": 0.00039096186968382555, "loss": 5.0315, "mean_token_accuracy": 0.21806803792715074, "num_tokens": 77470571.0, "step": 33815 }, { "entropy": 5.7407310009002686, "epoch": 3.343218663503361, "grad_norm": 1.1328125, "learning_rate": 0.0003909316262214498, "loss": 4.9568, "mean_token_accuracy": 0.23083746284246445, "num_tokens": 77483365.0, "step": 33820 }, { "entropy": 5.75578122138977, "epoch": 3.343712930011862, "grad_norm": 1.28125, "learning_rate": 0.00039090137990713817, "loss": 4.9077, "mean_token_accuracy": 0.22607372999191283, "num_tokens": 77493710.0, "step": 33825 }, { "entropy": 5.699822187423706, "epoch": 3.344207196520364, "grad_norm": 1.25, "learning_rate": 0.0003908711307416345, "loss": 4.9138, "mean_token_accuracy": 0.22897327244281768, "num_tokens": 77505153.0, "step": 33830 }, { "entropy": 5.792786169052124, "epoch": 3.344701463028865, "grad_norm": 1.1875, "learning_rate": 0.0003908408787256831, "loss": 5.0652, "mean_token_accuracy": 0.21909737586975098, "num_tokens": 77516370.0, "step": 33835 }, { "entropy": 5.8154134273529055, "epoch": 3.3451957295373664, "grad_norm": 1.2578125, "learning_rate": 0.0003908106238600281, "loss": 5.0285, "mean_token_accuracy": 0.2240742027759552, "num_tokens": 77526660.0, "step": 33840 }, { "entropy": 5.666768550872803, "epoch": 3.345689996045868, "grad_norm": 1.2109375, "learning_rate": 0.00039078036614541376, "loss": 4.8717, "mean_token_accuracy": 0.2325726181268692, "num_tokens": 77538112.0, "step": 33845 }, { "entropy": 5.698589134216308, "epoch": 3.3461842625543694, "grad_norm": 1.2734375, "learning_rate": 0.0003907501055825845, "loss": 4.934, "mean_token_accuracy": 0.22542956322431565, "num_tokens": 77548807.0, "step": 33850 }, { "entropy": 5.700926065444946, "epoch": 3.3466785290628707, "grad_norm": 1.171875, "learning_rate": 0.00039071984217228464, "loss": 4.9606, "mean_token_accuracy": 0.2278685450553894, "num_tokens": 77559803.0, "step": 33855 }, { "entropy": 5.77211627960205, "epoch": 3.347172795571372, "grad_norm": 1.2265625, "learning_rate": 0.00039068957591525873, "loss": 4.9621, "mean_token_accuracy": 0.21957990825176238, "num_tokens": 77570973.0, "step": 33860 }, { "entropy": 5.744198131561279, "epoch": 3.3476670620798736, "grad_norm": 1.2734375, "learning_rate": 0.0003906593068122513, "loss": 4.9946, "mean_token_accuracy": 0.22218303829431535, "num_tokens": 77583614.0, "step": 33865 }, { "entropy": 5.726515007019043, "epoch": 3.348161328588375, "grad_norm": 1.328125, "learning_rate": 0.000390629034864007, "loss": 4.9969, "mean_token_accuracy": 0.22657445669174195, "num_tokens": 77595086.0, "step": 33870 }, { "entropy": 5.793664932250977, "epoch": 3.348655595096876, "grad_norm": 1.3125, "learning_rate": 0.00039059876007127044, "loss": 4.9873, "mean_token_accuracy": 0.21717930734157562, "num_tokens": 77605492.0, "step": 33875 }, { "entropy": 5.730284833908081, "epoch": 3.349149861605378, "grad_norm": 1.1640625, "learning_rate": 0.0003905684824347865, "loss": 4.9515, "mean_token_accuracy": 0.2239883467555046, "num_tokens": 77618123.0, "step": 33880 }, { "entropy": 5.737873649597168, "epoch": 3.349644128113879, "grad_norm": 1.1640625, "learning_rate": 0.0003905382019553, "loss": 5.0057, "mean_token_accuracy": 0.21829362511634826, "num_tokens": 77630733.0, "step": 33885 }, { "entropy": 5.770794248580932, "epoch": 3.3501383946223804, "grad_norm": 1.25, "learning_rate": 0.00039050791863355573, "loss": 5.0041, "mean_token_accuracy": 0.22246245592832564, "num_tokens": 77641337.0, "step": 33890 }, { "entropy": 5.805846309661865, "epoch": 3.3506326611308817, "grad_norm": 1.1796875, "learning_rate": 0.00039047763247029876, "loss": 5.0197, "mean_token_accuracy": 0.22011965662240982, "num_tokens": 77652567.0, "step": 33895 }, { "entropy": 5.774141550064087, "epoch": 3.351126927639383, "grad_norm": 1.21875, "learning_rate": 0.0003904473434662741, "loss": 5.0468, "mean_token_accuracy": 0.21931514292955398, "num_tokens": 77664146.0, "step": 33900 }, { "entropy": 5.829627990722656, "epoch": 3.3516211941478846, "grad_norm": 1.234375, "learning_rate": 0.0003904170516222269, "loss": 4.9892, "mean_token_accuracy": 0.22041493356227876, "num_tokens": 77675406.0, "step": 33905 }, { "entropy": 5.744736528396606, "epoch": 3.352115460656386, "grad_norm": 1.25, "learning_rate": 0.0003903867569389024, "loss": 4.9894, "mean_token_accuracy": 0.22463519871234894, "num_tokens": 77686846.0, "step": 33910 }, { "entropy": 5.749107456207275, "epoch": 3.352609727164887, "grad_norm": 1.15625, "learning_rate": 0.0003903564594170457, "loss": 4.9517, "mean_token_accuracy": 0.22118581533432008, "num_tokens": 77697136.0, "step": 33915 }, { "entropy": 5.853708791732788, "epoch": 3.353103993673389, "grad_norm": 1.171875, "learning_rate": 0.00039032615905740226, "loss": 5.0276, "mean_token_accuracy": 0.21709294766187667, "num_tokens": 77708056.0, "step": 33920 }, { "entropy": 5.761302375793457, "epoch": 3.35359826018189, "grad_norm": 1.2109375, "learning_rate": 0.0003902958558607173, "loss": 4.9957, "mean_token_accuracy": 0.22170864343643187, "num_tokens": 77718582.0, "step": 33925 }, { "entropy": 5.728082466125488, "epoch": 3.3540925266903914, "grad_norm": 1.2890625, "learning_rate": 0.0003902655498277366, "loss": 4.9693, "mean_token_accuracy": 0.22448395192623138, "num_tokens": 77729388.0, "step": 33930 }, { "entropy": 5.7912506580352785, "epoch": 3.3545867931988926, "grad_norm": 1.2109375, "learning_rate": 0.00039023524095920534, "loss": 4.8706, "mean_token_accuracy": 0.2272852048277855, "num_tokens": 77739952.0, "step": 33935 }, { "entropy": 5.731177234649659, "epoch": 3.3550810597073943, "grad_norm": 1.1640625, "learning_rate": 0.0003902049292558693, "loss": 4.956, "mean_token_accuracy": 0.22535153180360795, "num_tokens": 77752415.0, "step": 33940 }, { "entropy": 5.673904705047607, "epoch": 3.3555753262158956, "grad_norm": 1.3046875, "learning_rate": 0.00039017461471847417, "loss": 4.8776, "mean_token_accuracy": 0.22828159034252166, "num_tokens": 77764102.0, "step": 33945 }, { "entropy": 5.7191397190094, "epoch": 3.356069592724397, "grad_norm": 1.2421875, "learning_rate": 0.0003901442973477656, "loss": 4.9582, "mean_token_accuracy": 0.22674656957387923, "num_tokens": 77774908.0, "step": 33950 }, { "entropy": 5.76264271736145, "epoch": 3.3565638592328986, "grad_norm": 1.25, "learning_rate": 0.0003901139771444894, "loss": 5.0158, "mean_token_accuracy": 0.21967628598213196, "num_tokens": 77785913.0, "step": 33955 }, { "entropy": 5.729533672332764, "epoch": 3.3570581257414, "grad_norm": 1.0859375, "learning_rate": 0.0003900836541093916, "loss": 4.9711, "mean_token_accuracy": 0.22423508763313293, "num_tokens": 77797539.0, "step": 33960 }, { "entropy": 5.759144401550293, "epoch": 3.357552392249901, "grad_norm": 1.1015625, "learning_rate": 0.000390053328243218, "loss": 4.9992, "mean_token_accuracy": 0.22237349003553392, "num_tokens": 77809777.0, "step": 33965 }, { "entropy": 5.749133014678955, "epoch": 3.3580466587584024, "grad_norm": 1.3125, "learning_rate": 0.0003900229995467147, "loss": 4.8975, "mean_token_accuracy": 0.23006992638111115, "num_tokens": 77820401.0, "step": 33970 }, { "entropy": 5.719423770904541, "epoch": 3.358540925266904, "grad_norm": 1.25, "learning_rate": 0.0003899926680206278, "loss": 4.9569, "mean_token_accuracy": 0.2166220024228096, "num_tokens": 77832235.0, "step": 33975 }, { "entropy": 5.7361043930053714, "epoch": 3.3590351917754053, "grad_norm": 1.1328125, "learning_rate": 0.00038996233366570335, "loss": 4.9909, "mean_token_accuracy": 0.22359827011823655, "num_tokens": 77843938.0, "step": 33980 }, { "entropy": 5.769420003890991, "epoch": 3.3595294582839066, "grad_norm": 1.265625, "learning_rate": 0.00038993199648268775, "loss": 4.9789, "mean_token_accuracy": 0.2152797371149063, "num_tokens": 77853921.0, "step": 33985 }, { "entropy": 5.719605922698975, "epoch": 3.3600237247924083, "grad_norm": 1.2734375, "learning_rate": 0.00038990165647232713, "loss": 4.8426, "mean_token_accuracy": 0.23854149281978607, "num_tokens": 77864661.0, "step": 33990 }, { "entropy": 5.845148324966431, "epoch": 3.3605179913009096, "grad_norm": 1.2734375, "learning_rate": 0.0003898713136353679, "loss": 5.1118, "mean_token_accuracy": 0.2067774310708046, "num_tokens": 77875743.0, "step": 33995 }, { "entropy": 5.712846136093139, "epoch": 3.361012257809411, "grad_norm": 1.171875, "learning_rate": 0.0003898409679725566, "loss": 4.9555, "mean_token_accuracy": 0.2252158537507057, "num_tokens": 77888575.0, "step": 34000 }, { "entropy": 5.883233499526978, "epoch": 3.361506524317912, "grad_norm": 1.21875, "learning_rate": 0.0003898106194846396, "loss": 5.1055, "mean_token_accuracy": 0.21185964792966844, "num_tokens": 77901212.0, "step": 34005 }, { "entropy": 5.728261423110962, "epoch": 3.362000790826414, "grad_norm": 1.3125, "learning_rate": 0.00038978026817236365, "loss": 4.9393, "mean_token_accuracy": 0.23533645868301392, "num_tokens": 77911905.0, "step": 34010 }, { "entropy": 5.7659642696380615, "epoch": 3.362495057334915, "grad_norm": 1.109375, "learning_rate": 0.00038974991403647536, "loss": 4.9994, "mean_token_accuracy": 0.21642355918884276, "num_tokens": 77923710.0, "step": 34015 }, { "entropy": 5.74726939201355, "epoch": 3.3629893238434163, "grad_norm": 1.3046875, "learning_rate": 0.00038971955707772126, "loss": 4.9566, "mean_token_accuracy": 0.2257274091243744, "num_tokens": 77934501.0, "step": 34020 }, { "entropy": 5.746541500091553, "epoch": 3.3634835903519176, "grad_norm": 1.3203125, "learning_rate": 0.0003896891972968482, "loss": 4.9232, "mean_token_accuracy": 0.22666034251451492, "num_tokens": 77944512.0, "step": 34025 }, { "entropy": 5.738111877441407, "epoch": 3.3639778568604193, "grad_norm": 1.2421875, "learning_rate": 0.0003896588346946033, "loss": 4.924, "mean_token_accuracy": 0.23085123896598816, "num_tokens": 77955253.0, "step": 34030 }, { "entropy": 5.6593996524810795, "epoch": 3.3644721233689205, "grad_norm": 1.2734375, "learning_rate": 0.00038962846927173306, "loss": 4.8685, "mean_token_accuracy": 0.22945576310157775, "num_tokens": 77967193.0, "step": 34035 }, { "entropy": 5.765934610366822, "epoch": 3.364966389877422, "grad_norm": 1.2734375, "learning_rate": 0.0003895981010289848, "loss": 5.048, "mean_token_accuracy": 0.21797843724489213, "num_tokens": 77977105.0, "step": 34040 }, { "entropy": 5.748804426193237, "epoch": 3.365460656385923, "grad_norm": 1.1953125, "learning_rate": 0.00038956772996710554, "loss": 4.9799, "mean_token_accuracy": 0.2239413544535637, "num_tokens": 77989517.0, "step": 34045 }, { "entropy": 5.785615539550781, "epoch": 3.3659549228944248, "grad_norm": 1.140625, "learning_rate": 0.00038953735608684216, "loss": 4.9963, "mean_token_accuracy": 0.21782848834991456, "num_tokens": 78000797.0, "step": 34050 }, { "entropy": 5.665162897109985, "epoch": 3.366449189402926, "grad_norm": 1.140625, "learning_rate": 0.0003895069793889422, "loss": 4.8355, "mean_token_accuracy": 0.23953462094068528, "num_tokens": 78012470.0, "step": 34055 }, { "entropy": 5.7289807319641115, "epoch": 3.3669434559114273, "grad_norm": 1.296875, "learning_rate": 0.0003894765998741528, "loss": 4.926, "mean_token_accuracy": 0.22437241077423095, "num_tokens": 78023774.0, "step": 34060 }, { "entropy": 5.734833192825318, "epoch": 3.367437722419929, "grad_norm": 1.1015625, "learning_rate": 0.0003894462175432212, "loss": 5.0059, "mean_token_accuracy": 0.21929133236408233, "num_tokens": 78035181.0, "step": 34065 }, { "entropy": 5.751251316070556, "epoch": 3.3679319889284303, "grad_norm": 1.2421875, "learning_rate": 0.00038941583239689495, "loss": 4.9713, "mean_token_accuracy": 0.22184754461050032, "num_tokens": 78045728.0, "step": 34070 }, { "entropy": 5.838360118865967, "epoch": 3.3684262554369315, "grad_norm": 1.25, "learning_rate": 0.00038938544443592146, "loss": 5.0033, "mean_token_accuracy": 0.2181825593113899, "num_tokens": 78056675.0, "step": 34075 }, { "entropy": 5.721235990524292, "epoch": 3.368920521945433, "grad_norm": 1.25, "learning_rate": 0.0003893550536610483, "loss": 4.8889, "mean_token_accuracy": 0.2346413776278496, "num_tokens": 78067686.0, "step": 34080 }, { "entropy": 5.666837215423584, "epoch": 3.3694147884539345, "grad_norm": 1.2578125, "learning_rate": 0.000389324660073023, "loss": 4.9535, "mean_token_accuracy": 0.23075952678918837, "num_tokens": 78078063.0, "step": 34085 }, { "entropy": 5.770784854888916, "epoch": 3.3699090549624358, "grad_norm": 1.2578125, "learning_rate": 0.0003892942636725934, "loss": 5.0622, "mean_token_accuracy": 0.21937436014413833, "num_tokens": 78088729.0, "step": 34090 }, { "entropy": 5.678276491165161, "epoch": 3.370403321470937, "grad_norm": 1.25, "learning_rate": 0.0003892638644605072, "loss": 4.8836, "mean_token_accuracy": 0.2351837381720543, "num_tokens": 78100468.0, "step": 34095 }, { "entropy": 5.749306583404541, "epoch": 3.3708975879794387, "grad_norm": 1.28125, "learning_rate": 0.00038923346243751217, "loss": 4.9831, "mean_token_accuracy": 0.2261546343564987, "num_tokens": 78111911.0, "step": 34100 }, { "entropy": 5.661248970031738, "epoch": 3.37139185448794, "grad_norm": 1.3671875, "learning_rate": 0.00038920305760435626, "loss": 4.8768, "mean_token_accuracy": 0.22817135453224183, "num_tokens": 78122411.0, "step": 34105 }, { "entropy": 5.771761846542359, "epoch": 3.3718861209964412, "grad_norm": 1.1796875, "learning_rate": 0.0003891726499617874, "loss": 5.0468, "mean_token_accuracy": 0.21325188279151916, "num_tokens": 78134313.0, "step": 34110 }, { "entropy": 5.663639879226684, "epoch": 3.3723803875049425, "grad_norm": 1.2265625, "learning_rate": 0.0003891422395105536, "loss": 4.7984, "mean_token_accuracy": 0.23698732256889343, "num_tokens": 78144753.0, "step": 34115 }, { "entropy": 5.6623725414276125, "epoch": 3.372874654013444, "grad_norm": 1.15625, "learning_rate": 0.00038911182625140305, "loss": 4.8766, "mean_token_accuracy": 0.22556447982788086, "num_tokens": 78154772.0, "step": 34120 }, { "entropy": 5.68983006477356, "epoch": 3.3733689205219455, "grad_norm": 1.21875, "learning_rate": 0.00038908141018508387, "loss": 4.9448, "mean_token_accuracy": 0.23074347972869874, "num_tokens": 78166876.0, "step": 34125 }, { "entropy": 5.7253423690795895, "epoch": 3.3738631870304467, "grad_norm": 1.3046875, "learning_rate": 0.00038905099131234433, "loss": 4.9218, "mean_token_accuracy": 0.2382257714867592, "num_tokens": 78177530.0, "step": 34130 }, { "entropy": 5.721208095550537, "epoch": 3.3743574535389484, "grad_norm": 1.1796875, "learning_rate": 0.00038902056963393265, "loss": 4.9201, "mean_token_accuracy": 0.2268524572253227, "num_tokens": 78187986.0, "step": 34135 }, { "entropy": 5.707645750045776, "epoch": 3.3748517200474497, "grad_norm": 1.1484375, "learning_rate": 0.00038899014515059735, "loss": 4.9532, "mean_token_accuracy": 0.22383246272802354, "num_tokens": 78199874.0, "step": 34140 }, { "entropy": 5.691944217681884, "epoch": 3.375345986555951, "grad_norm": 1.171875, "learning_rate": 0.0003889597178630867, "loss": 4.9312, "mean_token_accuracy": 0.2287371724843979, "num_tokens": 78210995.0, "step": 34145 }, { "entropy": 5.713322114944458, "epoch": 3.3758402530644522, "grad_norm": 1.1484375, "learning_rate": 0.0003889292877721493, "loss": 4.91, "mean_token_accuracy": 0.22524206042289735, "num_tokens": 78221792.0, "step": 34150 }, { "entropy": 5.653506183624268, "epoch": 3.3763345195729535, "grad_norm": 1.1640625, "learning_rate": 0.00038889885487853384, "loss": 4.914, "mean_token_accuracy": 0.23960447311401367, "num_tokens": 78232799.0, "step": 34155 }, { "entropy": 5.790098381042481, "epoch": 3.376828786081455, "grad_norm": 1.21875, "learning_rate": 0.0003888684191829889, "loss": 4.9957, "mean_token_accuracy": 0.2183838203549385, "num_tokens": 78243784.0, "step": 34160 }, { "entropy": 5.733755207061767, "epoch": 3.3773230525899565, "grad_norm": 1.25, "learning_rate": 0.00038883798068626305, "loss": 4.8787, "mean_token_accuracy": 0.23317979872226716, "num_tokens": 78255161.0, "step": 34165 }, { "entropy": 5.674816513061524, "epoch": 3.3778173190984577, "grad_norm": 1.15625, "learning_rate": 0.00038880753938910523, "loss": 4.9094, "mean_token_accuracy": 0.2264370948076248, "num_tokens": 78266462.0, "step": 34170 }, { "entropy": 5.724034690856934, "epoch": 3.3783115856069594, "grad_norm": 1.34375, "learning_rate": 0.00038877709529226446, "loss": 4.9781, "mean_token_accuracy": 0.21809536963701248, "num_tokens": 78278136.0, "step": 34175 }, { "entropy": 5.7751367568969725, "epoch": 3.3788058521154607, "grad_norm": 1.078125, "learning_rate": 0.0003887466483964893, "loss": 4.9866, "mean_token_accuracy": 0.21861551254987716, "num_tokens": 78290046.0, "step": 34180 }, { "entropy": 5.784373760223389, "epoch": 3.379300118623962, "grad_norm": 1.125, "learning_rate": 0.00038871619870252904, "loss": 4.9504, "mean_token_accuracy": 0.22399170994758605, "num_tokens": 78301636.0, "step": 34185 }, { "entropy": 5.7526853561401365, "epoch": 3.379794385132463, "grad_norm": 1.2265625, "learning_rate": 0.00038868574621113265, "loss": 4.9532, "mean_token_accuracy": 0.21787270456552504, "num_tokens": 78313326.0, "step": 34190 }, { "entropy": 5.752616882324219, "epoch": 3.380288651640965, "grad_norm": 1.0546875, "learning_rate": 0.0003886552909230492, "loss": 4.9943, "mean_token_accuracy": 0.21607912629842757, "num_tokens": 78325214.0, "step": 34195 }, { "entropy": 5.721040821075439, "epoch": 3.380782918149466, "grad_norm": 1.2890625, "learning_rate": 0.000388624832839028, "loss": 4.9227, "mean_token_accuracy": 0.22896347045898438, "num_tokens": 78336461.0, "step": 34200 }, { "entropy": 5.739862871170044, "epoch": 3.3812771846579674, "grad_norm": 1.3046875, "learning_rate": 0.00038859437195981833, "loss": 4.9979, "mean_token_accuracy": 0.22157906442880632, "num_tokens": 78347852.0, "step": 34205 }, { "entropy": 5.715168809890747, "epoch": 3.381771451166469, "grad_norm": 1.3046875, "learning_rate": 0.00038856390828616945, "loss": 4.9565, "mean_token_accuracy": 0.2184998258948326, "num_tokens": 78358736.0, "step": 34210 }, { "entropy": 5.847535943984985, "epoch": 3.3822657176749704, "grad_norm": 1.2578125, "learning_rate": 0.0003885334418188308, "loss": 5.1115, "mean_token_accuracy": 0.213736130297184, "num_tokens": 78370842.0, "step": 34215 }, { "entropy": 5.719734477996826, "epoch": 3.3827599841834717, "grad_norm": 1.1875, "learning_rate": 0.00038850297255855186, "loss": 4.8558, "mean_token_accuracy": 0.22974586635828018, "num_tokens": 78382159.0, "step": 34220 }, { "entropy": 5.758401536941529, "epoch": 3.383254250691973, "grad_norm": 1.359375, "learning_rate": 0.00038847250050608217, "loss": 5.067, "mean_token_accuracy": 0.21461165696382523, "num_tokens": 78392130.0, "step": 34225 }, { "entropy": 5.717522811889649, "epoch": 3.3837485172004746, "grad_norm": 1.25, "learning_rate": 0.00038844202566217146, "loss": 4.9555, "mean_token_accuracy": 0.2256264492869377, "num_tokens": 78403271.0, "step": 34230 }, { "entropy": 5.760998725891113, "epoch": 3.384242783708976, "grad_norm": 1.1640625, "learning_rate": 0.00038841154802756925, "loss": 4.9809, "mean_token_accuracy": 0.21933382898569107, "num_tokens": 78414621.0, "step": 34235 }, { "entropy": 5.854096603393555, "epoch": 3.384737050217477, "grad_norm": 1.0, "learning_rate": 0.00038838106760302537, "loss": 5.0974, "mean_token_accuracy": 0.2113494783639908, "num_tokens": 78427708.0, "step": 34240 }, { "entropy": 5.745160102844238, "epoch": 3.385231316725979, "grad_norm": 1.21875, "learning_rate": 0.00038835058438928965, "loss": 4.9329, "mean_token_accuracy": 0.2261657029390335, "num_tokens": 78438736.0, "step": 34245 }, { "entropy": 5.708537960052491, "epoch": 3.38572558323448, "grad_norm": 1.3125, "learning_rate": 0.000388320098387112, "loss": 4.9668, "mean_token_accuracy": 0.2280779853463173, "num_tokens": 78449118.0, "step": 34250 }, { "entropy": 5.756624555587768, "epoch": 3.3862198497429814, "grad_norm": 1.2578125, "learning_rate": 0.00038828960959724225, "loss": 5.0186, "mean_token_accuracy": 0.2169206976890564, "num_tokens": 78460027.0, "step": 34255 }, { "entropy": 5.727454996109008, "epoch": 3.3867141162514827, "grad_norm": 1.15625, "learning_rate": 0.00038825911802043057, "loss": 4.9018, "mean_token_accuracy": 0.22845005989074707, "num_tokens": 78471251.0, "step": 34260 }, { "entropy": 5.750979423522949, "epoch": 3.3872083827599844, "grad_norm": 1.2578125, "learning_rate": 0.00038822862365742704, "loss": 4.9936, "mean_token_accuracy": 0.22444596588611604, "num_tokens": 78482042.0, "step": 34265 }, { "entropy": 5.675802326202392, "epoch": 3.3877026492684856, "grad_norm": 1.1640625, "learning_rate": 0.0003881981265089818, "loss": 4.8917, "mean_token_accuracy": 0.22728991210460664, "num_tokens": 78492941.0, "step": 34270 }, { "entropy": 5.760136318206787, "epoch": 3.388196915776987, "grad_norm": 1.140625, "learning_rate": 0.0003881676265758451, "loss": 4.9747, "mean_token_accuracy": 0.21787781566381453, "num_tokens": 78506108.0, "step": 34275 }, { "entropy": 5.766173553466797, "epoch": 3.388691182285488, "grad_norm": 1.234375, "learning_rate": 0.00038813712385876714, "loss": 4.9463, "mean_token_accuracy": 0.22834778130054473, "num_tokens": 78517784.0, "step": 34280 }, { "entropy": 5.7463782787322994, "epoch": 3.38918544879399, "grad_norm": 1.328125, "learning_rate": 0.00038810661835849845, "loss": 4.9921, "mean_token_accuracy": 0.22301958352327347, "num_tokens": 78528795.0, "step": 34285 }, { "entropy": 5.692702054977417, "epoch": 3.389679715302491, "grad_norm": 1.0703125, "learning_rate": 0.00038807611007578947, "loss": 4.8962, "mean_token_accuracy": 0.2358813464641571, "num_tokens": 78540724.0, "step": 34290 }, { "entropy": 5.823853397369385, "epoch": 3.3901739818109924, "grad_norm": 1.296875, "learning_rate": 0.0003880455990113905, "loss": 5.0575, "mean_token_accuracy": 0.21508000642061234, "num_tokens": 78552569.0, "step": 34295 }, { "entropy": 5.752160930633545, "epoch": 3.3906682483194936, "grad_norm": 1.1640625, "learning_rate": 0.0003880150851660524, "loss": 4.9983, "mean_token_accuracy": 0.22020193338394164, "num_tokens": 78564785.0, "step": 34300 }, { "entropy": 5.737940406799316, "epoch": 3.3911625148279954, "grad_norm": 1.2109375, "learning_rate": 0.00038798456854052555, "loss": 4.9843, "mean_token_accuracy": 0.22239601612091064, "num_tokens": 78576323.0, "step": 34305 }, { "entropy": 5.802496290206909, "epoch": 3.3916567813364966, "grad_norm": 1.2890625, "learning_rate": 0.00038795404913556083, "loss": 5.0406, "mean_token_accuracy": 0.21609234064817429, "num_tokens": 78586978.0, "step": 34310 }, { "entropy": 5.751192998886109, "epoch": 3.392151047844998, "grad_norm": 1.234375, "learning_rate": 0.00038792352695190895, "loss": 5.0012, "mean_token_accuracy": 0.22484201490879058, "num_tokens": 78597591.0, "step": 34315 }, { "entropy": 5.71071228981018, "epoch": 3.3926453143534996, "grad_norm": 1.2578125, "learning_rate": 0.0003878930019903209, "loss": 4.9229, "mean_token_accuracy": 0.225471656024456, "num_tokens": 78608189.0, "step": 34320 }, { "entropy": 5.779983472824097, "epoch": 3.393139580862001, "grad_norm": 1.3359375, "learning_rate": 0.0003878624742515474, "loss": 5.0123, "mean_token_accuracy": 0.22660823315382003, "num_tokens": 78620170.0, "step": 34325 }, { "entropy": 5.783258056640625, "epoch": 3.393633847370502, "grad_norm": 1.25, "learning_rate": 0.00038783194373633956, "loss": 4.9791, "mean_token_accuracy": 0.22277851551771163, "num_tokens": 78632423.0, "step": 34330 }, { "entropy": 5.73965163230896, "epoch": 3.3941281138790034, "grad_norm": 1.1953125, "learning_rate": 0.00038780141044544836, "loss": 4.9949, "mean_token_accuracy": 0.22563783079385757, "num_tokens": 78644138.0, "step": 34335 }, { "entropy": 5.747307682037354, "epoch": 3.394622380387505, "grad_norm": 1.078125, "learning_rate": 0.000387770874379625, "loss": 4.9996, "mean_token_accuracy": 0.2226667121052742, "num_tokens": 78655659.0, "step": 34340 }, { "entropy": 5.647861051559448, "epoch": 3.3951166468960063, "grad_norm": 1.109375, "learning_rate": 0.0003877403355396206, "loss": 4.9355, "mean_token_accuracy": 0.22966020852327346, "num_tokens": 78665625.0, "step": 34345 }, { "entropy": 5.755460166931153, "epoch": 3.3956109134045076, "grad_norm": 1.1796875, "learning_rate": 0.0003877097939261865, "loss": 4.9871, "mean_token_accuracy": 0.22006723731756211, "num_tokens": 78677253.0, "step": 34350 }, { "entropy": 5.793676900863647, "epoch": 3.3961051799130093, "grad_norm": 1.109375, "learning_rate": 0.00038767924954007387, "loss": 4.9635, "mean_token_accuracy": 0.22454598397016526, "num_tokens": 78688574.0, "step": 34355 }, { "entropy": 5.745223140716552, "epoch": 3.3965994464215106, "grad_norm": 1.15625, "learning_rate": 0.0003876487023820343, "loss": 4.9089, "mean_token_accuracy": 0.23061376959085464, "num_tokens": 78700537.0, "step": 34360 }, { "entropy": 5.681247329711914, "epoch": 3.397093712930012, "grad_norm": 1.2890625, "learning_rate": 0.00038761815245281925, "loss": 4.8828, "mean_token_accuracy": 0.2323605790734291, "num_tokens": 78710257.0, "step": 34365 }, { "entropy": 5.729528570175171, "epoch": 3.397587979438513, "grad_norm": 1.1875, "learning_rate": 0.00038758759975318006, "loss": 4.9196, "mean_token_accuracy": 0.22853223234415054, "num_tokens": 78722503.0, "step": 34370 }, { "entropy": 5.733088397979737, "epoch": 3.398082245947015, "grad_norm": 1.2421875, "learning_rate": 0.0003875570442838686, "loss": 4.9795, "mean_token_accuracy": 0.22297899872064592, "num_tokens": 78734476.0, "step": 34375 }, { "entropy": 5.839818811416626, "epoch": 3.398576512455516, "grad_norm": 1.234375, "learning_rate": 0.0003875264860456362, "loss": 5.0198, "mean_token_accuracy": 0.22072531133890153, "num_tokens": 78745685.0, "step": 34380 }, { "entropy": 5.812339353561401, "epoch": 3.3990707789640173, "grad_norm": 1.1171875, "learning_rate": 0.00038749592503923484, "loss": 5.0204, "mean_token_accuracy": 0.22023228853940963, "num_tokens": 78758977.0, "step": 34385 }, { "entropy": 5.717302942276001, "epoch": 3.399565045472519, "grad_norm": 1.1328125, "learning_rate": 0.0003874653612654164, "loss": 4.9407, "mean_token_accuracy": 0.22151706963777543, "num_tokens": 78770702.0, "step": 34390 }, { "entropy": 5.739876079559326, "epoch": 3.4000593119810203, "grad_norm": 1.1796875, "learning_rate": 0.0003874347947249325, "loss": 4.9821, "mean_token_accuracy": 0.2196206584572792, "num_tokens": 78781763.0, "step": 34395 }, { "entropy": 5.770134162902832, "epoch": 3.4005535784895216, "grad_norm": 1.2578125, "learning_rate": 0.00038740422541853523, "loss": 4.9801, "mean_token_accuracy": 0.2222976878285408, "num_tokens": 78792341.0, "step": 34400 }, { "entropy": 5.737035751342773, "epoch": 3.401047844998023, "grad_norm": 1.1953125, "learning_rate": 0.00038737365334697656, "loss": 4.9322, "mean_token_accuracy": 0.22510787844657898, "num_tokens": 78803947.0, "step": 34405 }, { "entropy": 5.678115749359131, "epoch": 3.401542111506524, "grad_norm": 1.2578125, "learning_rate": 0.00038734307851100863, "loss": 4.8218, "mean_token_accuracy": 0.23743830472230912, "num_tokens": 78815503.0, "step": 34410 }, { "entropy": 5.744970846176147, "epoch": 3.402036378015026, "grad_norm": 1.3203125, "learning_rate": 0.0003873125009113835, "loss": 4.986, "mean_token_accuracy": 0.21829708367586137, "num_tokens": 78826206.0, "step": 34415 }, { "entropy": 5.757236957550049, "epoch": 3.402530644523527, "grad_norm": 1.1875, "learning_rate": 0.00038728192054885346, "loss": 4.9265, "mean_token_accuracy": 0.22752766460180282, "num_tokens": 78837472.0, "step": 34420 }, { "entropy": 5.805315256118774, "epoch": 3.4030249110320283, "grad_norm": 1.1796875, "learning_rate": 0.0003872513374241707, "loss": 5.0915, "mean_token_accuracy": 0.2133657917380333, "num_tokens": 78848005.0, "step": 34425 }, { "entropy": 5.755751466751098, "epoch": 3.40351917754053, "grad_norm": 1.25, "learning_rate": 0.00038722075153808764, "loss": 4.9407, "mean_token_accuracy": 0.223907034099102, "num_tokens": 78859577.0, "step": 34430 }, { "entropy": 5.769728469848633, "epoch": 3.4040134440490313, "grad_norm": 1.3125, "learning_rate": 0.0003871901628913568, "loss": 4.989, "mean_token_accuracy": 0.22358810752630234, "num_tokens": 78871527.0, "step": 34435 }, { "entropy": 5.739281797409058, "epoch": 3.4045077105575325, "grad_norm": 1.171875, "learning_rate": 0.0003871595714847304, "loss": 4.9777, "mean_token_accuracy": 0.22732713520526887, "num_tokens": 78882557.0, "step": 34440 }, { "entropy": 5.738371181488037, "epoch": 3.405001977066034, "grad_norm": 1.2734375, "learning_rate": 0.00038712897731896126, "loss": 4.9446, "mean_token_accuracy": 0.22249909490346909, "num_tokens": 78893191.0, "step": 34445 }, { "entropy": 5.758450698852539, "epoch": 3.4054962435745355, "grad_norm": 1.234375, "learning_rate": 0.0003870983803948017, "loss": 4.9865, "mean_token_accuracy": 0.22425025403499604, "num_tokens": 78904397.0, "step": 34450 }, { "entropy": 5.768943786621094, "epoch": 3.4059905100830368, "grad_norm": 1.125, "learning_rate": 0.0003870677807130047, "loss": 4.9867, "mean_token_accuracy": 0.22557110637426375, "num_tokens": 78916765.0, "step": 34455 }, { "entropy": 5.783790493011475, "epoch": 3.406484776591538, "grad_norm": 1.21875, "learning_rate": 0.000387037178274323, "loss": 4.9613, "mean_token_accuracy": 0.21932793408632278, "num_tokens": 78929745.0, "step": 34460 }, { "entropy": 5.786370515823364, "epoch": 3.4069790431000397, "grad_norm": 1.1328125, "learning_rate": 0.00038700657307950926, "loss": 4.9499, "mean_token_accuracy": 0.22982837110757828, "num_tokens": 78941158.0, "step": 34465 }, { "entropy": 5.691815614700317, "epoch": 3.407473309608541, "grad_norm": 1.15625, "learning_rate": 0.00038697596512931643, "loss": 4.9147, "mean_token_accuracy": 0.22486531883478164, "num_tokens": 78953465.0, "step": 34470 }, { "entropy": 5.7444963455200195, "epoch": 3.4079675761170423, "grad_norm": 1.265625, "learning_rate": 0.0003869453544244975, "loss": 4.9709, "mean_token_accuracy": 0.2220073387026787, "num_tokens": 78964841.0, "step": 34475 }, { "entropy": 5.760384178161621, "epoch": 3.4084618426255435, "grad_norm": 1.234375, "learning_rate": 0.00038691474096580545, "loss": 4.9807, "mean_token_accuracy": 0.22266217917203904, "num_tokens": 78975173.0, "step": 34480 }, { "entropy": 5.739780139923096, "epoch": 3.4089561091340452, "grad_norm": 1.1796875, "learning_rate": 0.0003868841247539934, "loss": 4.9677, "mean_token_accuracy": 0.2278680145740509, "num_tokens": 78986020.0, "step": 34485 }, { "entropy": 5.729197072982788, "epoch": 3.4094503756425465, "grad_norm": 1.265625, "learning_rate": 0.0003868535057898146, "loss": 4.9487, "mean_token_accuracy": 0.2223416492342949, "num_tokens": 78997906.0, "step": 34490 }, { "entropy": 5.822689771652222, "epoch": 3.4099446421510478, "grad_norm": 1.2890625, "learning_rate": 0.00038682288407402215, "loss": 5.0211, "mean_token_accuracy": 0.21067382842302323, "num_tokens": 79009322.0, "step": 34495 }, { "entropy": 5.68965163230896, "epoch": 3.4104389086595495, "grad_norm": 1.2578125, "learning_rate": 0.0003867922596073694, "loss": 4.8915, "mean_token_accuracy": 0.23269434571266173, "num_tokens": 79020940.0, "step": 34500 }, { "entropy": 5.772840309143066, "epoch": 3.4109331751680507, "grad_norm": 1.3203125, "learning_rate": 0.0003867616323906098, "loss": 5.0165, "mean_token_accuracy": 0.22040231227874757, "num_tokens": 79033002.0, "step": 34505 }, { "entropy": 5.682721948623657, "epoch": 3.411427441676552, "grad_norm": 1.1875, "learning_rate": 0.00038673100242449666, "loss": 4.8826, "mean_token_accuracy": 0.23146036714315416, "num_tokens": 79044129.0, "step": 34510 }, { "entropy": 5.685306692123413, "epoch": 3.4119217081850532, "grad_norm": 1.3203125, "learning_rate": 0.0003867003697097835, "loss": 4.9396, "mean_token_accuracy": 0.23317753970623017, "num_tokens": 79054961.0, "step": 34515 }, { "entropy": 5.775302600860596, "epoch": 3.412415974693555, "grad_norm": 1.34375, "learning_rate": 0.0003866697342472239, "loss": 4.9874, "mean_token_accuracy": 0.21745218336582184, "num_tokens": 79066136.0, "step": 34520 }, { "entropy": 5.715613746643067, "epoch": 3.412910241202056, "grad_norm": 1.203125, "learning_rate": 0.0003866390960375716, "loss": 4.9742, "mean_token_accuracy": 0.21906571388244628, "num_tokens": 79077821.0, "step": 34525 }, { "entropy": 5.722734498977661, "epoch": 3.4134045077105575, "grad_norm": 1.3125, "learning_rate": 0.0003866084550815801, "loss": 4.9336, "mean_token_accuracy": 0.2199051097035408, "num_tokens": 79087554.0, "step": 34530 }, { "entropy": 5.8052552223205565, "epoch": 3.4138987742190587, "grad_norm": 1.2578125, "learning_rate": 0.00038657781138000337, "loss": 5.0504, "mean_token_accuracy": 0.22023759484291078, "num_tokens": 79098434.0, "step": 34535 }, { "entropy": 5.769784832000733, "epoch": 3.4143930407275604, "grad_norm": 1.2421875, "learning_rate": 0.00038654716493359515, "loss": 4.9599, "mean_token_accuracy": 0.22111113965511323, "num_tokens": 79108962.0, "step": 34540 }, { "entropy": 5.662703180313111, "epoch": 3.4148873072360617, "grad_norm": 1.1640625, "learning_rate": 0.0003865165157431093, "loss": 4.9399, "mean_token_accuracy": 0.2254787415266037, "num_tokens": 79119592.0, "step": 34545 }, { "entropy": 5.722964334487915, "epoch": 3.415381573744563, "grad_norm": 1.1953125, "learning_rate": 0.0003864858638093, "loss": 4.9078, "mean_token_accuracy": 0.22666240334510804, "num_tokens": 79130170.0, "step": 34550 }, { "entropy": 5.752389621734619, "epoch": 3.4158758402530642, "grad_norm": 1.2421875, "learning_rate": 0.00038645520913292117, "loss": 4.9647, "mean_token_accuracy": 0.22595714628696442, "num_tokens": 79140949.0, "step": 34555 }, { "entropy": 5.750032234191894, "epoch": 3.416370106761566, "grad_norm": 1.34375, "learning_rate": 0.00038642455171472676, "loss": 4.9558, "mean_token_accuracy": 0.21651601791381836, "num_tokens": 79151508.0, "step": 34560 }, { "entropy": 5.740336894989014, "epoch": 3.416864373270067, "grad_norm": 1.1875, "learning_rate": 0.0003863938915554711, "loss": 4.9761, "mean_token_accuracy": 0.22562813460826875, "num_tokens": 79163062.0, "step": 34565 }, { "entropy": 5.781988668441772, "epoch": 3.4173586397785685, "grad_norm": 1.2890625, "learning_rate": 0.0003863632286559085, "loss": 4.9492, "mean_token_accuracy": 0.22952550053596496, "num_tokens": 79174025.0, "step": 34570 }, { "entropy": 5.718377637863159, "epoch": 3.41785290628707, "grad_norm": 1.1640625, "learning_rate": 0.0003863325630167932, "loss": 4.8672, "mean_token_accuracy": 0.23368196040391923, "num_tokens": 79185169.0, "step": 34575 }, { "entropy": 5.7356866836547855, "epoch": 3.4183471727955714, "grad_norm": 1.2890625, "learning_rate": 0.00038630189463887955, "loss": 4.9626, "mean_token_accuracy": 0.2266966313123703, "num_tokens": 79196503.0, "step": 34580 }, { "entropy": 5.738524389266968, "epoch": 3.4188414393040727, "grad_norm": 1.2265625, "learning_rate": 0.00038627122352292206, "loss": 4.9726, "mean_token_accuracy": 0.21931502372026443, "num_tokens": 79207887.0, "step": 34585 }, { "entropy": 5.715691423416137, "epoch": 3.419335705812574, "grad_norm": 1.265625, "learning_rate": 0.00038624054966967516, "loss": 4.9127, "mean_token_accuracy": 0.22652419060468673, "num_tokens": 79219339.0, "step": 34590 }, { "entropy": 5.744101619720459, "epoch": 3.4198299723210757, "grad_norm": 1.1015625, "learning_rate": 0.00038620987307989347, "loss": 4.9965, "mean_token_accuracy": 0.21834992617368698, "num_tokens": 79231454.0, "step": 34595 }, { "entropy": 5.808569431304932, "epoch": 3.420324238829577, "grad_norm": 1.1953125, "learning_rate": 0.00038617919375433176, "loss": 4.966, "mean_token_accuracy": 0.22571472376585006, "num_tokens": 79241761.0, "step": 34600 }, { "entropy": 5.787451457977295, "epoch": 3.420818505338078, "grad_norm": 1.1875, "learning_rate": 0.00038614851169374456, "loss": 4.9325, "mean_token_accuracy": 0.22021746039390563, "num_tokens": 79252272.0, "step": 34605 }, { "entropy": 5.733857202529907, "epoch": 3.42131277184658, "grad_norm": 1.328125, "learning_rate": 0.0003861178268988867, "loss": 4.9092, "mean_token_accuracy": 0.22506607919931412, "num_tokens": 79263612.0, "step": 34610 }, { "entropy": 5.6819069385528564, "epoch": 3.421807038355081, "grad_norm": 1.1796875, "learning_rate": 0.0003860871393705131, "loss": 4.9031, "mean_token_accuracy": 0.22698323726654052, "num_tokens": 79275361.0, "step": 34615 }, { "entropy": 5.786751937866211, "epoch": 3.4223013048635824, "grad_norm": 1.3125, "learning_rate": 0.00038605644910937856, "loss": 4.9472, "mean_token_accuracy": 0.22897537648677826, "num_tokens": 79285277.0, "step": 34620 }, { "entropy": 5.607639026641846, "epoch": 3.4227955713720837, "grad_norm": 1.25, "learning_rate": 0.00038602575611623827, "loss": 4.8124, "mean_token_accuracy": 0.23914988487958908, "num_tokens": 79296713.0, "step": 34625 }, { "entropy": 5.741404914855957, "epoch": 3.4232898378805854, "grad_norm": 1.1796875, "learning_rate": 0.000385995060391847, "loss": 4.9703, "mean_token_accuracy": 0.21990007609128953, "num_tokens": 79308363.0, "step": 34630 }, { "entropy": 5.7628120422363285, "epoch": 3.4237841043890866, "grad_norm": 1.234375, "learning_rate": 0.00038596436193696015, "loss": 5.0281, "mean_token_accuracy": 0.21933696717023848, "num_tokens": 79319626.0, "step": 34635 }, { "entropy": 5.733559322357178, "epoch": 3.424278370897588, "grad_norm": 1.2421875, "learning_rate": 0.0003859336607523327, "loss": 4.9364, "mean_token_accuracy": 0.2214723452925682, "num_tokens": 79330628.0, "step": 34640 }, { "entropy": 5.701859998703003, "epoch": 3.424772637406089, "grad_norm": 1.2421875, "learning_rate": 0.00038590295683872005, "loss": 4.9285, "mean_token_accuracy": 0.2218850940465927, "num_tokens": 79342323.0, "step": 34645 }, { "entropy": 5.684063196182251, "epoch": 3.425266903914591, "grad_norm": 1.171875, "learning_rate": 0.0003858722501968774, "loss": 4.8474, "mean_token_accuracy": 0.23856300562620164, "num_tokens": 79354108.0, "step": 34650 }, { "entropy": 5.72578239440918, "epoch": 3.425761170423092, "grad_norm": 1.140625, "learning_rate": 0.00038584154082756036, "loss": 4.9855, "mean_token_accuracy": 0.2311626449227333, "num_tokens": 79365494.0, "step": 34655 }, { "entropy": 5.635528802871704, "epoch": 3.4262554369315934, "grad_norm": 1.2578125, "learning_rate": 0.000385810828731524, "loss": 4.8032, "mean_token_accuracy": 0.23252518624067306, "num_tokens": 79376881.0, "step": 34660 }, { "entropy": 5.7045622825622555, "epoch": 3.4267497034400947, "grad_norm": 1.203125, "learning_rate": 0.0003857801139095242, "loss": 4.905, "mean_token_accuracy": 0.22882604449987412, "num_tokens": 79388154.0, "step": 34665 }, { "entropy": 5.810230112075805, "epoch": 3.4272439699485964, "grad_norm": 1.375, "learning_rate": 0.00038574939636231635, "loss": 4.9903, "mean_token_accuracy": 0.22079915851354598, "num_tokens": 79398995.0, "step": 34670 }, { "entropy": 5.750847053527832, "epoch": 3.4277382364570976, "grad_norm": 1.203125, "learning_rate": 0.0003857186760906562, "loss": 4.9885, "mean_token_accuracy": 0.22457312494516374, "num_tokens": 79410697.0, "step": 34675 }, { "entropy": 5.724606370925903, "epoch": 3.428232502965599, "grad_norm": 1.203125, "learning_rate": 0.00038568795309529947, "loss": 4.9884, "mean_token_accuracy": 0.22242140173912048, "num_tokens": 79421862.0, "step": 34680 }, { "entropy": 5.786133861541748, "epoch": 3.4287267694741006, "grad_norm": 1.2421875, "learning_rate": 0.00038565722737700185, "loss": 4.9758, "mean_token_accuracy": 0.22239427864551545, "num_tokens": 79432610.0, "step": 34685 }, { "entropy": 5.7748418807983395, "epoch": 3.429221035982602, "grad_norm": 1.3359375, "learning_rate": 0.00038562649893651924, "loss": 4.9847, "mean_token_accuracy": 0.22598233222961425, "num_tokens": 79443386.0, "step": 34690 }, { "entropy": 5.760905742645264, "epoch": 3.429715302491103, "grad_norm": 1.265625, "learning_rate": 0.0003855957677746077, "loss": 5.0068, "mean_token_accuracy": 0.22393664121627807, "num_tokens": 79454334.0, "step": 34695 }, { "entropy": 5.783784341812134, "epoch": 3.4302095689996044, "grad_norm": 1.1640625, "learning_rate": 0.0003855650338920231, "loss": 4.9631, "mean_token_accuracy": 0.2238968789577484, "num_tokens": 79465489.0, "step": 34700 }, { "entropy": 5.787978219985962, "epoch": 3.430703835508106, "grad_norm": 1.3046875, "learning_rate": 0.00038553429728952144, "loss": 5.0, "mean_token_accuracy": 0.21619585901498795, "num_tokens": 79477293.0, "step": 34705 }, { "entropy": 5.804285764694214, "epoch": 3.4311981020166074, "grad_norm": 1.1875, "learning_rate": 0.00038550355796785897, "loss": 5.0288, "mean_token_accuracy": 0.2129867345094681, "num_tokens": 79488995.0, "step": 34710 }, { "entropy": 5.7826683044433596, "epoch": 3.4316923685251086, "grad_norm": 1.09375, "learning_rate": 0.00038547281592779184, "loss": 5.0605, "mean_token_accuracy": 0.2194013148546219, "num_tokens": 79502757.0, "step": 34715 }, { "entropy": 5.791015577316284, "epoch": 3.4321866350336103, "grad_norm": 1.15625, "learning_rate": 0.0003854420711700763, "loss": 4.9899, "mean_token_accuracy": 0.2170246124267578, "num_tokens": 79515220.0, "step": 34720 }, { "entropy": 5.817648601531983, "epoch": 3.4326809015421116, "grad_norm": 1.2578125, "learning_rate": 0.00038541132369546865, "loss": 5.0579, "mean_token_accuracy": 0.2135082110762596, "num_tokens": 79527577.0, "step": 34725 }, { "entropy": 5.739390754699707, "epoch": 3.433175168050613, "grad_norm": 1.1328125, "learning_rate": 0.0003853805735047253, "loss": 4.9404, "mean_token_accuracy": 0.2223578944802284, "num_tokens": 79539136.0, "step": 34730 }, { "entropy": 5.674014663696289, "epoch": 3.433669434559114, "grad_norm": 1.1796875, "learning_rate": 0.00038534982059860274, "loss": 4.8612, "mean_token_accuracy": 0.23533019423484802, "num_tokens": 79550123.0, "step": 34735 }, { "entropy": 5.7918602466583256, "epoch": 3.434163701067616, "grad_norm": 1.203125, "learning_rate": 0.00038531906497785753, "loss": 5.0347, "mean_token_accuracy": 0.21710706800222396, "num_tokens": 79563072.0, "step": 34740 }, { "entropy": 5.759722948074341, "epoch": 3.434657967576117, "grad_norm": 1.234375, "learning_rate": 0.00038528830664324613, "loss": 4.9417, "mean_token_accuracy": 0.226544289290905, "num_tokens": 79573901.0, "step": 34745 }, { "entropy": 5.666585493087768, "epoch": 3.4351522340846183, "grad_norm": 1.125, "learning_rate": 0.00038525754559552526, "loss": 4.9366, "mean_token_accuracy": 0.2247488260269165, "num_tokens": 79585384.0, "step": 34750 }, { "entropy": 5.716826725006103, "epoch": 3.43564650059312, "grad_norm": 1.1875, "learning_rate": 0.0003852267818354517, "loss": 5.0202, "mean_token_accuracy": 0.22154323309659957, "num_tokens": 79597277.0, "step": 34755 }, { "entropy": 5.802966642379761, "epoch": 3.4361407671016213, "grad_norm": 1.21875, "learning_rate": 0.0003851960153637822, "loss": 5.0554, "mean_token_accuracy": 0.21783553212881088, "num_tokens": 79609797.0, "step": 34760 }, { "entropy": 5.781498289108276, "epoch": 3.4366350336101226, "grad_norm": 1.1328125, "learning_rate": 0.00038516524618127364, "loss": 4.9479, "mean_token_accuracy": 0.2301510751247406, "num_tokens": 79621247.0, "step": 34765 }, { "entropy": 5.801448583602905, "epoch": 3.437129300118624, "grad_norm": 1.1875, "learning_rate": 0.0003851344742886829, "loss": 5.0314, "mean_token_accuracy": 0.21347317695617676, "num_tokens": 79632892.0, "step": 34770 }, { "entropy": 5.744549942016602, "epoch": 3.4376235666271255, "grad_norm": 1.171875, "learning_rate": 0.00038510369968676705, "loss": 5.0135, "mean_token_accuracy": 0.21615123450756074, "num_tokens": 79644426.0, "step": 34775 }, { "entropy": 5.753431797027588, "epoch": 3.438117833135627, "grad_norm": 1.28125, "learning_rate": 0.0003850729223762831, "loss": 4.8864, "mean_token_accuracy": 0.2305927187204361, "num_tokens": 79656414.0, "step": 34780 }, { "entropy": 5.730092525482178, "epoch": 3.438612099644128, "grad_norm": 1.21875, "learning_rate": 0.0003850421423579882, "loss": 5.0015, "mean_token_accuracy": 0.2225076213479042, "num_tokens": 79667244.0, "step": 34785 }, { "entropy": 5.755971050262451, "epoch": 3.4391063661526293, "grad_norm": 1.171875, "learning_rate": 0.00038501135963263947, "loss": 4.9714, "mean_token_accuracy": 0.22137348353862762, "num_tokens": 79677837.0, "step": 34790 }, { "entropy": 5.802629280090332, "epoch": 3.439600632661131, "grad_norm": 1.21875, "learning_rate": 0.00038498057420099425, "loss": 5.0401, "mean_token_accuracy": 0.21932614594697952, "num_tokens": 79689500.0, "step": 34795 }, { "entropy": 5.707279443740845, "epoch": 3.4400948991696323, "grad_norm": 1.1328125, "learning_rate": 0.00038494978606380984, "loss": 4.912, "mean_token_accuracy": 0.22836938947439195, "num_tokens": 79701621.0, "step": 34800 }, { "entropy": 5.661640787124634, "epoch": 3.4405891656781336, "grad_norm": 1.2578125, "learning_rate": 0.0003849189952218436, "loss": 4.9678, "mean_token_accuracy": 0.23213227242231368, "num_tokens": 79712635.0, "step": 34805 }, { "entropy": 5.778584051132202, "epoch": 3.441083432186635, "grad_norm": 1.1875, "learning_rate": 0.0003848882016758531, "loss": 5.0474, "mean_token_accuracy": 0.2108338937163353, "num_tokens": 79723626.0, "step": 34810 }, { "entropy": 5.796139669418335, "epoch": 3.4415776986951365, "grad_norm": 1.234375, "learning_rate": 0.00038485740542659573, "loss": 5.0061, "mean_token_accuracy": 0.21480755805969237, "num_tokens": 79734983.0, "step": 34815 }, { "entropy": 5.7980384349823, "epoch": 3.442071965203638, "grad_norm": 1.1640625, "learning_rate": 0.0003848266064748292, "loss": 4.9841, "mean_token_accuracy": 0.21694866865873336, "num_tokens": 79746767.0, "step": 34820 }, { "entropy": 5.75792236328125, "epoch": 3.442566231712139, "grad_norm": 1.2109375, "learning_rate": 0.0003847958048213111, "loss": 4.979, "mean_token_accuracy": 0.2227740541100502, "num_tokens": 79759062.0, "step": 34825 }, { "entropy": 5.684417247772217, "epoch": 3.4430604982206408, "grad_norm": 1.2109375, "learning_rate": 0.00038476500046679915, "loss": 4.8955, "mean_token_accuracy": 0.23331020772457123, "num_tokens": 79769962.0, "step": 34830 }, { "entropy": 5.675603294372559, "epoch": 3.443554764729142, "grad_norm": 1.265625, "learning_rate": 0.00038473419341205115, "loss": 4.9387, "mean_token_accuracy": 0.2238091304898262, "num_tokens": 79781279.0, "step": 34835 }, { "entropy": 5.784378719329834, "epoch": 3.4440490312376433, "grad_norm": 1.3203125, "learning_rate": 0.000384703383657825, "loss": 4.9987, "mean_token_accuracy": 0.2203410357236862, "num_tokens": 79792406.0, "step": 34840 }, { "entropy": 5.810380649566651, "epoch": 3.4445432977461445, "grad_norm": 1.28125, "learning_rate": 0.0003846725712048786, "loss": 5.0264, "mean_token_accuracy": 0.2184491127729416, "num_tokens": 79804150.0, "step": 34845 }, { "entropy": 5.767418003082275, "epoch": 3.4450375642546462, "grad_norm": 1.328125, "learning_rate": 0.0003846417560539699, "loss": 4.8993, "mean_token_accuracy": 0.22999347150325775, "num_tokens": 79814267.0, "step": 34850 }, { "entropy": 5.720052433013916, "epoch": 3.4455318307631475, "grad_norm": 1.234375, "learning_rate": 0.000384610938205857, "loss": 4.9326, "mean_token_accuracy": 0.22880630940198898, "num_tokens": 79824887.0, "step": 34855 }, { "entropy": 5.748180389404297, "epoch": 3.4460260972716488, "grad_norm": 1.2265625, "learning_rate": 0.00038458011766129795, "loss": 5.0013, "mean_token_accuracy": 0.21667182445526123, "num_tokens": 79836840.0, "step": 34860 }, { "entropy": 5.735796070098877, "epoch": 3.4465203637801505, "grad_norm": 1.2734375, "learning_rate": 0.00038454929442105105, "loss": 4.9175, "mean_token_accuracy": 0.2268517166376114, "num_tokens": 79846876.0, "step": 34865 }, { "entropy": 5.756755256652832, "epoch": 3.4470146302886517, "grad_norm": 1.15625, "learning_rate": 0.0003845184684858746, "loss": 5.0007, "mean_token_accuracy": 0.22102858126163483, "num_tokens": 79859271.0, "step": 34870 }, { "entropy": 5.740095090866089, "epoch": 3.447508896797153, "grad_norm": 1.1328125, "learning_rate": 0.00038448763985652674, "loss": 5.0517, "mean_token_accuracy": 0.21844163089990615, "num_tokens": 79871938.0, "step": 34875 }, { "entropy": 5.780250406265258, "epoch": 3.4480031633056543, "grad_norm": 1.1953125, "learning_rate": 0.0003844568085337659, "loss": 5.0164, "mean_token_accuracy": 0.22304982095956802, "num_tokens": 79883202.0, "step": 34880 }, { "entropy": 5.712198066711426, "epoch": 3.448497429814156, "grad_norm": 1.1171875, "learning_rate": 0.00038442597451835076, "loss": 4.9434, "mean_token_accuracy": 0.22576947808265685, "num_tokens": 79895794.0, "step": 34885 }, { "entropy": 5.746598196029663, "epoch": 3.4489916963226572, "grad_norm": 1.3359375, "learning_rate": 0.0003843951378110396, "loss": 4.9377, "mean_token_accuracy": 0.229790398478508, "num_tokens": 79906548.0, "step": 34890 }, { "entropy": 5.75026650428772, "epoch": 3.4494859628311585, "grad_norm": 1.171875, "learning_rate": 0.000384364298412591, "loss": 4.9978, "mean_token_accuracy": 0.22277528196573257, "num_tokens": 79918116.0, "step": 34895 }, { "entropy": 5.7345386981964115, "epoch": 3.4499802293396598, "grad_norm": 1.1875, "learning_rate": 0.00038433345632376376, "loss": 4.9927, "mean_token_accuracy": 0.22818876802921295, "num_tokens": 79930791.0, "step": 34900 }, { "entropy": 5.723190498352051, "epoch": 3.4504744958481615, "grad_norm": 8.625, "learning_rate": 0.00038430261154531655, "loss": 4.9472, "mean_token_accuracy": 0.23318518102169036, "num_tokens": 79942359.0, "step": 34905 }, { "entropy": 5.709157657623291, "epoch": 3.4509687623566627, "grad_norm": 1.1328125, "learning_rate": 0.0003842717640780081, "loss": 4.9187, "mean_token_accuracy": 0.22305017709732056, "num_tokens": 79954424.0, "step": 34910 }, { "entropy": 5.7242498874664305, "epoch": 3.451463028865164, "grad_norm": 1.2109375, "learning_rate": 0.00038424091392259737, "loss": 4.925, "mean_token_accuracy": 0.2246979370713234, "num_tokens": 79965704.0, "step": 34915 }, { "entropy": 5.750075435638427, "epoch": 3.4519572953736652, "grad_norm": 1.1953125, "learning_rate": 0.0003842100610798431, "loss": 4.9391, "mean_token_accuracy": 0.2288699373602867, "num_tokens": 79977891.0, "step": 34920 }, { "entropy": 5.7055689811706545, "epoch": 3.452451561882167, "grad_norm": 1.1875, "learning_rate": 0.00038417920555050447, "loss": 4.9765, "mean_token_accuracy": 0.22124988734722137, "num_tokens": 79988709.0, "step": 34925 }, { "entropy": 5.718805599212646, "epoch": 3.452945828390668, "grad_norm": 1.2578125, "learning_rate": 0.00038414834733534046, "loss": 4.9537, "mean_token_accuracy": 0.2270994558930397, "num_tokens": 80000349.0, "step": 34930 }, { "entropy": 5.702279472351075, "epoch": 3.4534400948991695, "grad_norm": 1.3359375, "learning_rate": 0.0003841174864351101, "loss": 4.846, "mean_token_accuracy": 0.2380574494600296, "num_tokens": 80011317.0, "step": 34935 }, { "entropy": 5.75683069229126, "epoch": 3.453934361407671, "grad_norm": 1.1796875, "learning_rate": 0.00038408662285057267, "loss": 5.0259, "mean_token_accuracy": 0.22479131817817688, "num_tokens": 80023471.0, "step": 34940 }, { "entropy": 5.73680009841919, "epoch": 3.4544286279161724, "grad_norm": 1.1484375, "learning_rate": 0.00038405575658248737, "loss": 4.9617, "mean_token_accuracy": 0.22336150854825973, "num_tokens": 80035937.0, "step": 34945 }, { "entropy": 5.748815107345581, "epoch": 3.4549228944246737, "grad_norm": 1.1640625, "learning_rate": 0.0003840248876316135, "loss": 4.9493, "mean_token_accuracy": 0.22325362265110016, "num_tokens": 80048435.0, "step": 34950 }, { "entropy": 5.707042121887207, "epoch": 3.455417160933175, "grad_norm": 1.1796875, "learning_rate": 0.0003839940159987106, "loss": 4.9586, "mean_token_accuracy": 0.22586894780397415, "num_tokens": 80059675.0, "step": 34955 }, { "entropy": 5.821738910675049, "epoch": 3.4559114274416767, "grad_norm": 1.1640625, "learning_rate": 0.00038396314168453793, "loss": 5.0079, "mean_token_accuracy": 0.2158147782087326, "num_tokens": 80071232.0, "step": 34960 }, { "entropy": 5.731034660339356, "epoch": 3.456405693950178, "grad_norm": 1.3125, "learning_rate": 0.0003839322646898551, "loss": 4.9208, "mean_token_accuracy": 0.22737734764814377, "num_tokens": 80083331.0, "step": 34965 }, { "entropy": 5.752064895629883, "epoch": 3.456899960458679, "grad_norm": 1.2578125, "learning_rate": 0.00038390138501542164, "loss": 5.0157, "mean_token_accuracy": 0.22142302393913268, "num_tokens": 80095883.0, "step": 34970 }, { "entropy": 5.688836336135864, "epoch": 3.457394226967181, "grad_norm": 1.28125, "learning_rate": 0.0003838705026619972, "loss": 4.9597, "mean_token_accuracy": 0.22674014717340468, "num_tokens": 80108098.0, "step": 34975 }, { "entropy": 5.698457908630371, "epoch": 3.457888493475682, "grad_norm": 1.1796875, "learning_rate": 0.0003838396176303416, "loss": 4.9841, "mean_token_accuracy": 0.21836493611335756, "num_tokens": 80121184.0, "step": 34980 }, { "entropy": 5.750385761260986, "epoch": 3.4583827599841834, "grad_norm": 1.2421875, "learning_rate": 0.0003838087299212144, "loss": 4.9165, "mean_token_accuracy": 0.2225114330649376, "num_tokens": 80132862.0, "step": 34985 }, { "entropy": 5.762396144866943, "epoch": 3.4588770264926847, "grad_norm": 1.1953125, "learning_rate": 0.00038377783953537565, "loss": 4.9431, "mean_token_accuracy": 0.22454853951931, "num_tokens": 80143756.0, "step": 34990 }, { "entropy": 5.737108278274536, "epoch": 3.4593712930011864, "grad_norm": 1.1875, "learning_rate": 0.0003837469464735851, "loss": 4.9601, "mean_token_accuracy": 0.2255374625325203, "num_tokens": 80154570.0, "step": 34995 }, { "entropy": 5.6966629981994625, "epoch": 3.4598655595096877, "grad_norm": 1.2265625, "learning_rate": 0.00038371605073660284, "loss": 4.955, "mean_token_accuracy": 0.22564540058374405, "num_tokens": 80165968.0, "step": 35000 }, { "entropy": 5.695196151733398, "epoch": 3.460359826018189, "grad_norm": 1.3046875, "learning_rate": 0.00038368515232518885, "loss": 4.945, "mean_token_accuracy": 0.21703900247812272, "num_tokens": 80177584.0, "step": 35005 }, { "entropy": 5.727974557876587, "epoch": 3.4608540925266906, "grad_norm": 1.0703125, "learning_rate": 0.0003836542512401033, "loss": 4.9547, "mean_token_accuracy": 0.22055343985557557, "num_tokens": 80190113.0, "step": 35010 }, { "entropy": 5.802620506286621, "epoch": 3.461348359035192, "grad_norm": 1.3515625, "learning_rate": 0.0003836233474821063, "loss": 5.0157, "mean_token_accuracy": 0.21482030004262925, "num_tokens": 80201074.0, "step": 35015 }, { "entropy": 5.73555736541748, "epoch": 3.461842625543693, "grad_norm": 1.171875, "learning_rate": 0.00038359244105195807, "loss": 4.9886, "mean_token_accuracy": 0.23028539270162582, "num_tokens": 80212248.0, "step": 35020 }, { "entropy": 5.730514478683472, "epoch": 3.4623368920521944, "grad_norm": 1.1953125, "learning_rate": 0.00038356153195041886, "loss": 4.9006, "mean_token_accuracy": 0.2240366071462631, "num_tokens": 80223151.0, "step": 35025 }, { "entropy": 5.699669742584229, "epoch": 3.462831158560696, "grad_norm": 1.2734375, "learning_rate": 0.00038353062017824923, "loss": 4.8857, "mean_token_accuracy": 0.2262493446469307, "num_tokens": 80234978.0, "step": 35030 }, { "entropy": 5.727032613754273, "epoch": 3.4633254250691974, "grad_norm": 1.265625, "learning_rate": 0.0003834997057362096, "loss": 4.9275, "mean_token_accuracy": 0.22904649376869202, "num_tokens": 80246297.0, "step": 35035 }, { "entropy": 5.7936502456665036, "epoch": 3.4638196915776986, "grad_norm": 1.3046875, "learning_rate": 0.0003834687886250602, "loss": 5.0045, "mean_token_accuracy": 0.2158038854598999, "num_tokens": 80258628.0, "step": 35040 }, { "entropy": 5.728713321685791, "epoch": 3.4643139580862, "grad_norm": 1.203125, "learning_rate": 0.0003834378688455618, "loss": 4.9198, "mean_token_accuracy": 0.2268444687128067, "num_tokens": 80270694.0, "step": 35045 }, { "entropy": 5.694925785064697, "epoch": 3.4648082245947016, "grad_norm": 1.09375, "learning_rate": 0.0003834069463984751, "loss": 4.9636, "mean_token_accuracy": 0.2226157933473587, "num_tokens": 80282032.0, "step": 35050 }, { "entropy": 5.7082291603088375, "epoch": 3.465302491103203, "grad_norm": 1.1640625, "learning_rate": 0.0003833760212845605, "loss": 4.9478, "mean_token_accuracy": 0.2250010445713997, "num_tokens": 80294033.0, "step": 35055 }, { "entropy": 5.7644435405731205, "epoch": 3.465796757611704, "grad_norm": 1.375, "learning_rate": 0.00038334509350457913, "loss": 4.8608, "mean_token_accuracy": 0.2316405475139618, "num_tokens": 80304273.0, "step": 35060 }, { "entropy": 5.663561201095581, "epoch": 3.4662910241202054, "grad_norm": 1.234375, "learning_rate": 0.0003833141630592916, "loss": 4.8957, "mean_token_accuracy": 0.2306319624185562, "num_tokens": 80314049.0, "step": 35065 }, { "entropy": 5.797319793701172, "epoch": 3.466785290628707, "grad_norm": 1.28125, "learning_rate": 0.00038328322994945883, "loss": 5.0381, "mean_token_accuracy": 0.21499863266944885, "num_tokens": 80324632.0, "step": 35070 }, { "entropy": 5.724928522109986, "epoch": 3.4672795571372084, "grad_norm": 1.140625, "learning_rate": 0.00038325229417584194, "loss": 4.9054, "mean_token_accuracy": 0.23125911951065065, "num_tokens": 80335824.0, "step": 35075 }, { "entropy": 5.704902839660645, "epoch": 3.4677738236457096, "grad_norm": 1.15625, "learning_rate": 0.00038322135573920176, "loss": 4.9264, "mean_token_accuracy": 0.21805291026830673, "num_tokens": 80346537.0, "step": 35080 }, { "entropy": 5.746596193313598, "epoch": 3.4682680901542113, "grad_norm": 1.0625, "learning_rate": 0.0003831904146402994, "loss": 4.9137, "mean_token_accuracy": 0.2273559555411339, "num_tokens": 80358446.0, "step": 35085 }, { "entropy": 5.738199472427368, "epoch": 3.4687623566627126, "grad_norm": 1.1796875, "learning_rate": 0.000383159470879896, "loss": 4.9341, "mean_token_accuracy": 0.23073399513959886, "num_tokens": 80370219.0, "step": 35090 }, { "entropy": 5.739638805389404, "epoch": 3.469256623171214, "grad_norm": 1.3203125, "learning_rate": 0.0003831285244587529, "loss": 4.9711, "mean_token_accuracy": 0.22299767881631852, "num_tokens": 80380886.0, "step": 35095 }, { "entropy": 5.703467273712159, "epoch": 3.469750889679715, "grad_norm": 1.2421875, "learning_rate": 0.0003830975753776314, "loss": 4.8964, "mean_token_accuracy": 0.2301630988717079, "num_tokens": 80391171.0, "step": 35100 }, { "entropy": 5.728148698806763, "epoch": 3.470245156188217, "grad_norm": 1.1328125, "learning_rate": 0.0003830666236372927, "loss": 4.9317, "mean_token_accuracy": 0.22347177118062972, "num_tokens": 80403527.0, "step": 35105 }, { "entropy": 5.78545298576355, "epoch": 3.470739422696718, "grad_norm": 1.171875, "learning_rate": 0.00038303566923849827, "loss": 5.0382, "mean_token_accuracy": 0.218366439640522, "num_tokens": 80414992.0, "step": 35110 }, { "entropy": 5.7094153881073, "epoch": 3.4712336892052194, "grad_norm": 1.2578125, "learning_rate": 0.00038300471218200965, "loss": 4.9533, "mean_token_accuracy": 0.22169215381145477, "num_tokens": 80426167.0, "step": 35115 }, { "entropy": 5.74866418838501, "epoch": 3.471727955713721, "grad_norm": 1.125, "learning_rate": 0.00038297375246858835, "loss": 4.9499, "mean_token_accuracy": 0.22430207431316376, "num_tokens": 80438063.0, "step": 35120 }, { "entropy": 5.6901782035827635, "epoch": 3.4722222222222223, "grad_norm": 1.125, "learning_rate": 0.000382942790098996, "loss": 4.9381, "mean_token_accuracy": 0.21947703808546065, "num_tokens": 80449898.0, "step": 35125 }, { "entropy": 5.756030941009522, "epoch": 3.4727164887307236, "grad_norm": 1.1953125, "learning_rate": 0.00038291182507399425, "loss": 4.9534, "mean_token_accuracy": 0.2271957129240036, "num_tokens": 80461623.0, "step": 35130 }, { "entropy": 5.738477277755737, "epoch": 3.473210755239225, "grad_norm": 1.15625, "learning_rate": 0.00038288085739434486, "loss": 4.9054, "mean_token_accuracy": 0.23444311916828156, "num_tokens": 80472627.0, "step": 35135 }, { "entropy": 5.708876037597657, "epoch": 3.4737050217477266, "grad_norm": 1.1875, "learning_rate": 0.0003828498870608096, "loss": 4.9317, "mean_token_accuracy": 0.22621617913246156, "num_tokens": 80483494.0, "step": 35140 }, { "entropy": 5.682329225540161, "epoch": 3.474199288256228, "grad_norm": 1.234375, "learning_rate": 0.00038281891407415046, "loss": 4.8978, "mean_token_accuracy": 0.22756169736385345, "num_tokens": 80495122.0, "step": 35145 }, { "entropy": 5.656877088546753, "epoch": 3.474693554764729, "grad_norm": 1.1875, "learning_rate": 0.00038278793843512935, "loss": 4.9143, "mean_token_accuracy": 0.23086659908294677, "num_tokens": 80506639.0, "step": 35150 }, { "entropy": 5.769659233093262, "epoch": 3.4751878212732303, "grad_norm": 1.1953125, "learning_rate": 0.0003827569601445081, "loss": 4.9489, "mean_token_accuracy": 0.22331925928592683, "num_tokens": 80517897.0, "step": 35155 }, { "entropy": 5.784477424621582, "epoch": 3.475682087781732, "grad_norm": 1.109375, "learning_rate": 0.000382725979203049, "loss": 4.9704, "mean_token_accuracy": 0.21801871806383133, "num_tokens": 80530112.0, "step": 35160 }, { "entropy": 5.706895637512207, "epoch": 3.4761763542902333, "grad_norm": 1.1875, "learning_rate": 0.00038269499561151407, "loss": 4.912, "mean_token_accuracy": 0.2316989481449127, "num_tokens": 80541811.0, "step": 35165 }, { "entropy": 5.716243505477905, "epoch": 3.4766706207987346, "grad_norm": 1.203125, "learning_rate": 0.00038266400937066555, "loss": 4.9591, "mean_token_accuracy": 0.2291096955537796, "num_tokens": 80553107.0, "step": 35170 }, { "entropy": 5.798077535629273, "epoch": 3.477164887307236, "grad_norm": 1.25, "learning_rate": 0.00038263302048126567, "loss": 4.9985, "mean_token_accuracy": 0.2228512942790985, "num_tokens": 80562916.0, "step": 35175 }, { "entropy": 5.718015813827515, "epoch": 3.4776591538157375, "grad_norm": 1.2578125, "learning_rate": 0.0003826020289440768, "loss": 4.9283, "mean_token_accuracy": 0.22203734666109085, "num_tokens": 80573179.0, "step": 35180 }, { "entropy": 5.670910835266113, "epoch": 3.478153420324239, "grad_norm": 1.171875, "learning_rate": 0.00038257103475986134, "loss": 4.958, "mean_token_accuracy": 0.2293822631239891, "num_tokens": 80583494.0, "step": 35185 }, { "entropy": 5.661175966262817, "epoch": 3.47864768683274, "grad_norm": 1.171875, "learning_rate": 0.00038254003792938176, "loss": 4.973, "mean_token_accuracy": 0.22705525606870652, "num_tokens": 80595926.0, "step": 35190 }, { "entropy": 5.685512447357178, "epoch": 3.4791419533412418, "grad_norm": 1.1328125, "learning_rate": 0.00038250903845340057, "loss": 4.9416, "mean_token_accuracy": 0.23341089338064194, "num_tokens": 80607449.0, "step": 35195 }, { "entropy": 5.749845504760742, "epoch": 3.479636219849743, "grad_norm": 1.1875, "learning_rate": 0.0003824780363326803, "loss": 4.9502, "mean_token_accuracy": 0.2240004763007164, "num_tokens": 80619201.0, "step": 35200 }, { "entropy": 5.757830858230591, "epoch": 3.4801304863582443, "grad_norm": 1.1875, "learning_rate": 0.00038244703156798364, "loss": 5.042, "mean_token_accuracy": 0.22113657593727112, "num_tokens": 80632068.0, "step": 35205 }, { "entropy": 5.741551685333252, "epoch": 3.4806247528667456, "grad_norm": 1.125, "learning_rate": 0.0003824160241600734, "loss": 4.9329, "mean_token_accuracy": 0.22343134135007858, "num_tokens": 80643569.0, "step": 35210 }, { "entropy": 5.790683555603027, "epoch": 3.4811190193752473, "grad_norm": 1.2265625, "learning_rate": 0.00038238501410971226, "loss": 4.9462, "mean_token_accuracy": 0.2252105489373207, "num_tokens": 80656000.0, "step": 35215 }, { "entropy": 5.7622706413269045, "epoch": 3.4816132858837485, "grad_norm": 1.390625, "learning_rate": 0.00038235400141766314, "loss": 4.9308, "mean_token_accuracy": 0.22718267142772675, "num_tokens": 80667473.0, "step": 35220 }, { "entropy": 5.811671543121338, "epoch": 3.48210755239225, "grad_norm": 1.0703125, "learning_rate": 0.00038232298608468894, "loss": 5.0724, "mean_token_accuracy": 0.22198492735624314, "num_tokens": 80679322.0, "step": 35225 }, { "entropy": 5.84144139289856, "epoch": 3.4826018189007515, "grad_norm": 1.2265625, "learning_rate": 0.0003822919681115526, "loss": 5.0844, "mean_token_accuracy": 0.21785397976636886, "num_tokens": 80690907.0, "step": 35230 }, { "entropy": 5.696099138259887, "epoch": 3.4830960854092528, "grad_norm": 1.1640625, "learning_rate": 0.0003822609474990172, "loss": 4.8696, "mean_token_accuracy": 0.22997491657733918, "num_tokens": 80702012.0, "step": 35235 }, { "entropy": 5.826912450790405, "epoch": 3.483590351917754, "grad_norm": 1.15625, "learning_rate": 0.000382229924247846, "loss": 5.074, "mean_token_accuracy": 0.2123814344406128, "num_tokens": 80714283.0, "step": 35240 }, { "entropy": 5.714649724960327, "epoch": 3.4840846184262553, "grad_norm": 1.3046875, "learning_rate": 0.0003821988983588018, "loss": 4.9085, "mean_token_accuracy": 0.23351623117923737, "num_tokens": 80724964.0, "step": 35245 }, { "entropy": 5.786600160598755, "epoch": 3.484578884934757, "grad_norm": 1.21875, "learning_rate": 0.00038216786983264817, "loss": 4.9504, "mean_token_accuracy": 0.2237883150577545, "num_tokens": 80735934.0, "step": 35250 }, { "entropy": 5.800012063980103, "epoch": 3.4850731514432582, "grad_norm": 1.15625, "learning_rate": 0.00038213683867014824, "loss": 5.0574, "mean_token_accuracy": 0.21366148740053176, "num_tokens": 80746988.0, "step": 35255 }, { "entropy": 5.797828722000122, "epoch": 3.4855674179517595, "grad_norm": 1.171875, "learning_rate": 0.00038210580487206563, "loss": 5.0306, "mean_token_accuracy": 0.20996270328760147, "num_tokens": 80759300.0, "step": 35260 }, { "entropy": 5.699312305450439, "epoch": 3.486061684460261, "grad_norm": 1.1171875, "learning_rate": 0.0003820747684391636, "loss": 4.993, "mean_token_accuracy": 0.2224402606487274, "num_tokens": 80771055.0, "step": 35265 }, { "entropy": 5.6758167266845705, "epoch": 3.4865559509687625, "grad_norm": 1.2578125, "learning_rate": 0.0003820437293722054, "loss": 4.9029, "mean_token_accuracy": 0.22777575999498367, "num_tokens": 80782803.0, "step": 35270 }, { "entropy": 5.770343017578125, "epoch": 3.4870502174772637, "grad_norm": 1.28125, "learning_rate": 0.0003820126876719551, "loss": 4.9619, "mean_token_accuracy": 0.22241358309984208, "num_tokens": 80793833.0, "step": 35275 }, { "entropy": 5.753967905044556, "epoch": 3.487544483985765, "grad_norm": 1.203125, "learning_rate": 0.000381981643339176, "loss": 4.9435, "mean_token_accuracy": 0.22572194784879684, "num_tokens": 80804800.0, "step": 35280 }, { "entropy": 5.757425785064697, "epoch": 3.4880387504942663, "grad_norm": 1.2421875, "learning_rate": 0.0003819505963746318, "loss": 4.968, "mean_token_accuracy": 0.217978572845459, "num_tokens": 80815934.0, "step": 35285 }, { "entropy": 5.77924075126648, "epoch": 3.488533017002768, "grad_norm": 1.234375, "learning_rate": 0.0003819195467790864, "loss": 4.9724, "mean_token_accuracy": 0.22822180092334748, "num_tokens": 80826971.0, "step": 35290 }, { "entropy": 5.752380752563477, "epoch": 3.4890272835112692, "grad_norm": 1.203125, "learning_rate": 0.0003818884945533036, "loss": 5.0099, "mean_token_accuracy": 0.217777518928051, "num_tokens": 80839847.0, "step": 35295 }, { "entropy": 5.768237686157226, "epoch": 3.4895215500197705, "grad_norm": 1.296875, "learning_rate": 0.0003818574396980472, "loss": 4.9864, "mean_token_accuracy": 0.2221311792731285, "num_tokens": 80852937.0, "step": 35300 }, { "entropy": 5.741956281661987, "epoch": 3.490015816528272, "grad_norm": 1.3046875, "learning_rate": 0.0003818263822140812, "loss": 4.9034, "mean_token_accuracy": 0.23298288583755494, "num_tokens": 80862978.0, "step": 35305 }, { "entropy": 5.725862455368042, "epoch": 3.4905100830367735, "grad_norm": 1.203125, "learning_rate": 0.00038179532210216974, "loss": 4.9389, "mean_token_accuracy": 0.23028623610734938, "num_tokens": 80874446.0, "step": 35310 }, { "entropy": 5.6892200946807865, "epoch": 3.4910043495452747, "grad_norm": 1.21875, "learning_rate": 0.0003817642593630767, "loss": 4.9993, "mean_token_accuracy": 0.22696565091609955, "num_tokens": 80886289.0, "step": 35315 }, { "entropy": 5.735862731933594, "epoch": 3.491498616053776, "grad_norm": 1.1328125, "learning_rate": 0.00038173319399756626, "loss": 4.982, "mean_token_accuracy": 0.22164596617221832, "num_tokens": 80897363.0, "step": 35320 }, { "entropy": 5.780193519592285, "epoch": 3.4919928825622777, "grad_norm": 1.234375, "learning_rate": 0.0003817021260064028, "loss": 4.9572, "mean_token_accuracy": 0.2191171392798424, "num_tokens": 80907850.0, "step": 35325 }, { "entropy": 5.797368860244751, "epoch": 3.492487149070779, "grad_norm": 1.3203125, "learning_rate": 0.0003816710553903504, "loss": 4.983, "mean_token_accuracy": 0.2207235127687454, "num_tokens": 80918512.0, "step": 35330 }, { "entropy": 5.773538112640381, "epoch": 3.49298141557928, "grad_norm": 1.21875, "learning_rate": 0.0003816399821501736, "loss": 4.9529, "mean_token_accuracy": 0.2301558569073677, "num_tokens": 80929550.0, "step": 35335 }, { "entropy": 5.703844118118286, "epoch": 3.493475682087782, "grad_norm": 1.203125, "learning_rate": 0.00038160890628663663, "loss": 4.9444, "mean_token_accuracy": 0.22311123013496398, "num_tokens": 80941129.0, "step": 35340 }, { "entropy": 5.794006252288819, "epoch": 3.493969948596283, "grad_norm": 1.140625, "learning_rate": 0.000381577827800504, "loss": 4.927, "mean_token_accuracy": 0.22684859335422516, "num_tokens": 80951804.0, "step": 35345 }, { "entropy": 5.724021100997925, "epoch": 3.4944642151047844, "grad_norm": 1.1953125, "learning_rate": 0.0003815467466925402, "loss": 4.9124, "mean_token_accuracy": 0.23357467353343964, "num_tokens": 80962556.0, "step": 35350 }, { "entropy": 5.767390775680542, "epoch": 3.4949584816132857, "grad_norm": 1.25, "learning_rate": 0.00038151566296351, "loss": 5.0804, "mean_token_accuracy": 0.21496041715145112, "num_tokens": 80974550.0, "step": 35355 }, { "entropy": 5.7617134094238285, "epoch": 3.4954527481217874, "grad_norm": 1.28125, "learning_rate": 0.000381484576614178, "loss": 4.9379, "mean_token_accuracy": 0.22010361552238464, "num_tokens": 80987033.0, "step": 35360 }, { "entropy": 5.767470264434815, "epoch": 3.4959470146302887, "grad_norm": 1.1640625, "learning_rate": 0.00038145348764530887, "loss": 4.9004, "mean_token_accuracy": 0.22782645374536514, "num_tokens": 80998216.0, "step": 35365 }, { "entropy": 5.718341302871704, "epoch": 3.49644128113879, "grad_norm": 1.21875, "learning_rate": 0.00038142239605766737, "loss": 4.9394, "mean_token_accuracy": 0.2257169231772423, "num_tokens": 81010276.0, "step": 35370 }, { "entropy": 5.756587266921997, "epoch": 3.4969355476472916, "grad_norm": 1.2109375, "learning_rate": 0.00038139130185201845, "loss": 4.9468, "mean_token_accuracy": 0.22149068266153335, "num_tokens": 81020892.0, "step": 35375 }, { "entropy": 5.699207973480225, "epoch": 3.497429814155793, "grad_norm": 1.2265625, "learning_rate": 0.00038136020502912705, "loss": 4.8832, "mean_token_accuracy": 0.2350930616259575, "num_tokens": 81032390.0, "step": 35380 }, { "entropy": 5.699143886566162, "epoch": 3.497924080664294, "grad_norm": 1.234375, "learning_rate": 0.0003813291055897581, "loss": 4.9153, "mean_token_accuracy": 0.23069553673267365, "num_tokens": 81043433.0, "step": 35385 }, { "entropy": 5.7259584903717045, "epoch": 3.4984183471727954, "grad_norm": 1.3125, "learning_rate": 0.0003812980035346766, "loss": 4.9178, "mean_token_accuracy": 0.22666165083646775, "num_tokens": 81054798.0, "step": 35390 }, { "entropy": 5.7428895950317385, "epoch": 3.498912613681297, "grad_norm": 1.3203125, "learning_rate": 0.0003812668988646477, "loss": 5.0001, "mean_token_accuracy": 0.22207673043012618, "num_tokens": 81067746.0, "step": 35395 }, { "entropy": 5.7249915599823, "epoch": 3.4994068801897984, "grad_norm": 1.2734375, "learning_rate": 0.0003812357915804366, "loss": 4.987, "mean_token_accuracy": 0.22018432915210723, "num_tokens": 81079328.0, "step": 35400 }, { "entropy": 5.7407608985900875, "epoch": 3.4999011466982997, "grad_norm": 1.25, "learning_rate": 0.0003812046816828086, "loss": 4.9613, "mean_token_accuracy": 0.224355486035347, "num_tokens": 81091447.0, "step": 35405 }, { "entropy": 5.81247091293335, "epoch": 3.5003954132068014, "grad_norm": 1.1015625, "learning_rate": 0.000381173569172529, "loss": 5.026, "mean_token_accuracy": 0.21899720877408982, "num_tokens": 81103614.0, "step": 35410 }, { "entropy": 5.810672998428345, "epoch": 3.5008896797153026, "grad_norm": 1.1953125, "learning_rate": 0.000381142454050363, "loss": 5.0718, "mean_token_accuracy": 0.21583905071020126, "num_tokens": 81115387.0, "step": 35415 }, { "entropy": 5.75110502243042, "epoch": 3.501383946223804, "grad_norm": 1.1875, "learning_rate": 0.00038111133631707624, "loss": 4.9771, "mean_token_accuracy": 0.21944610029459, "num_tokens": 81128063.0, "step": 35420 }, { "entropy": 5.777230930328369, "epoch": 3.501878212732305, "grad_norm": 1.2265625, "learning_rate": 0.0003810802159734342, "loss": 4.97, "mean_token_accuracy": 0.2271800383925438, "num_tokens": 81139137.0, "step": 35425 }, { "entropy": 5.765392732620239, "epoch": 3.5023724792408064, "grad_norm": 1.140625, "learning_rate": 0.0003810490930202023, "loss": 5.0755, "mean_token_accuracy": 0.21693194806575775, "num_tokens": 81151896.0, "step": 35430 }, { "entropy": 5.850603723526001, "epoch": 3.502866745749308, "grad_norm": 1.234375, "learning_rate": 0.0003810179674581463, "loss": 4.9531, "mean_token_accuracy": 0.22099511772394181, "num_tokens": 81162843.0, "step": 35435 }, { "entropy": 5.834975957870483, "epoch": 3.5033610122578094, "grad_norm": 1.171875, "learning_rate": 0.00038098683928803186, "loss": 5.1118, "mean_token_accuracy": 0.2126134902238846, "num_tokens": 81176316.0, "step": 35440 }, { "entropy": 5.808986520767212, "epoch": 3.5038552787663106, "grad_norm": 1.1328125, "learning_rate": 0.00038095570851062467, "loss": 4.9647, "mean_token_accuracy": 0.22293055951595306, "num_tokens": 81187956.0, "step": 35445 }, { "entropy": 5.759843444824218, "epoch": 3.5043495452748123, "grad_norm": 1.0703125, "learning_rate": 0.00038092457512669067, "loss": 4.9466, "mean_token_accuracy": 0.22627142518758775, "num_tokens": 81199575.0, "step": 35450 }, { "entropy": 5.694977140426635, "epoch": 3.5048438117833136, "grad_norm": 1.359375, "learning_rate": 0.0003808934391369957, "loss": 4.9139, "mean_token_accuracy": 0.23169865757226943, "num_tokens": 81211959.0, "step": 35455 }, { "entropy": 5.698625659942627, "epoch": 3.505338078291815, "grad_norm": 1.2890625, "learning_rate": 0.0003808623005423057, "loss": 4.9064, "mean_token_accuracy": 0.23203559964895248, "num_tokens": 81222358.0, "step": 35460 }, { "entropy": 5.759253978729248, "epoch": 3.505832344800316, "grad_norm": 1.203125, "learning_rate": 0.00038083115934338667, "loss": 4.9458, "mean_token_accuracy": 0.22519572973251342, "num_tokens": 81233674.0, "step": 35465 }, { "entropy": 5.698000907897949, "epoch": 3.506326611308818, "grad_norm": 1.265625, "learning_rate": 0.00038080001554100467, "loss": 4.9226, "mean_token_accuracy": 0.22892085164785386, "num_tokens": 81243885.0, "step": 35470 }, { "entropy": 5.822749662399292, "epoch": 3.506820877817319, "grad_norm": 1.296875, "learning_rate": 0.0003807688691359259, "loss": 5.0762, "mean_token_accuracy": 0.2177318200469017, "num_tokens": 81255869.0, "step": 35475 }, { "entropy": 5.764692592620849, "epoch": 3.5073151443258204, "grad_norm": 1.25, "learning_rate": 0.0003807377201289165, "loss": 4.9497, "mean_token_accuracy": 0.21617780327796937, "num_tokens": 81266746.0, "step": 35480 }, { "entropy": 5.761414575576782, "epoch": 3.507809410834322, "grad_norm": 1.3125, "learning_rate": 0.0003807065685207429, "loss": 4.9545, "mean_token_accuracy": 0.22384707778692245, "num_tokens": 81277356.0, "step": 35485 }, { "entropy": 5.741801691055298, "epoch": 3.5083036773428233, "grad_norm": 1.140625, "learning_rate": 0.0003806754143121712, "loss": 5.0136, "mean_token_accuracy": 0.22078490257263184, "num_tokens": 81288926.0, "step": 35490 }, { "entropy": 5.805824565887451, "epoch": 3.5087979438513246, "grad_norm": 1.1953125, "learning_rate": 0.00038064425750396793, "loss": 4.9728, "mean_token_accuracy": 0.2262909695506096, "num_tokens": 81300990.0, "step": 35495 }, { "entropy": 5.712761068344117, "epoch": 3.509292210359826, "grad_norm": 1.2578125, "learning_rate": 0.00038061309809689955, "loss": 4.9184, "mean_token_accuracy": 0.22160707861185075, "num_tokens": 81312964.0, "step": 35500 }, { "entropy": 5.766635847091675, "epoch": 3.5097864768683276, "grad_norm": 1.140625, "learning_rate": 0.00038058193609173256, "loss": 4.9668, "mean_token_accuracy": 0.22672232538461684, "num_tokens": 81324196.0, "step": 35505 }, { "entropy": 5.7676207542419435, "epoch": 3.510280743376829, "grad_norm": 1.21875, "learning_rate": 0.0003805507714892336, "loss": 4.974, "mean_token_accuracy": 0.21922513097524643, "num_tokens": 81334723.0, "step": 35510 }, { "entropy": 5.786857080459595, "epoch": 3.51077500988533, "grad_norm": 1.2109375, "learning_rate": 0.00038051960429016923, "loss": 5.0075, "mean_token_accuracy": 0.21894041150808335, "num_tokens": 81346126.0, "step": 35515 }, { "entropy": 5.721186876296997, "epoch": 3.511269276393832, "grad_norm": 1.265625, "learning_rate": 0.0003804884344953063, "loss": 4.9474, "mean_token_accuracy": 0.23070349544286728, "num_tokens": 81358093.0, "step": 35520 }, { "entropy": 5.736390161514282, "epoch": 3.511763542902333, "grad_norm": 1.328125, "learning_rate": 0.00038045726210541144, "loss": 5.0046, "mean_token_accuracy": 0.22015675157308578, "num_tokens": 81369734.0, "step": 35525 }, { "entropy": 5.7293352603912355, "epoch": 3.5122578094108343, "grad_norm": 1.25, "learning_rate": 0.0003804260871212516, "loss": 4.978, "mean_token_accuracy": 0.2226536124944687, "num_tokens": 81381474.0, "step": 35530 }, { "entropy": 5.672225761413574, "epoch": 3.5127520759193356, "grad_norm": 1.078125, "learning_rate": 0.0003803949095435937, "loss": 4.9062, "mean_token_accuracy": 0.22413829416036607, "num_tokens": 81394661.0, "step": 35535 }, { "entropy": 5.843664169311523, "epoch": 3.513246342427837, "grad_norm": 1.3046875, "learning_rate": 0.0003803637293732046, "loss": 5.0532, "mean_token_accuracy": 0.21841167658567429, "num_tokens": 81405591.0, "step": 35540 }, { "entropy": 5.810409355163574, "epoch": 3.5137406089363385, "grad_norm": 1.2109375, "learning_rate": 0.00038033254661085146, "loss": 5.0665, "mean_token_accuracy": 0.2227519080042839, "num_tokens": 81417561.0, "step": 35545 }, { "entropy": 5.783941268920898, "epoch": 3.51423487544484, "grad_norm": 1.2890625, "learning_rate": 0.00038030136125730135, "loss": 5.0315, "mean_token_accuracy": 0.21669332385063172, "num_tokens": 81430502.0, "step": 35550 }, { "entropy": 5.728549194335938, "epoch": 3.5147291419533415, "grad_norm": 1.1796875, "learning_rate": 0.0003802701733133214, "loss": 4.9938, "mean_token_accuracy": 0.22475088387727737, "num_tokens": 81441717.0, "step": 35555 }, { "entropy": 5.705388307571411, "epoch": 3.515223408461843, "grad_norm": 1.265625, "learning_rate": 0.00038023898277967885, "loss": 4.9107, "mean_token_accuracy": 0.22867615520954132, "num_tokens": 81453282.0, "step": 35560 }, { "entropy": 5.782865810394287, "epoch": 3.515717674970344, "grad_norm": 1.234375, "learning_rate": 0.000380207789657141, "loss": 4.9541, "mean_token_accuracy": 0.22169853001832962, "num_tokens": 81463582.0, "step": 35565 }, { "entropy": 5.727762174606323, "epoch": 3.5162119414788453, "grad_norm": 1.171875, "learning_rate": 0.0003801765939464752, "loss": 4.9464, "mean_token_accuracy": 0.2283109560608864, "num_tokens": 81475490.0, "step": 35570 }, { "entropy": 5.705303192138672, "epoch": 3.5167062079873466, "grad_norm": 1.125, "learning_rate": 0.0003801453956484489, "loss": 4.9067, "mean_token_accuracy": 0.23532119989395142, "num_tokens": 81486939.0, "step": 35575 }, { "entropy": 5.718761920928955, "epoch": 3.5172004744958483, "grad_norm": 1.1953125, "learning_rate": 0.0003801141947638295, "loss": 4.9649, "mean_token_accuracy": 0.2252896249294281, "num_tokens": 81498260.0, "step": 35580 }, { "entropy": 5.773679971694946, "epoch": 3.5176947410043495, "grad_norm": 1.2109375, "learning_rate": 0.00038008299129338463, "loss": 4.907, "mean_token_accuracy": 0.23305947929620743, "num_tokens": 81508788.0, "step": 35585 }, { "entropy": 5.806025457382202, "epoch": 3.518189007512851, "grad_norm": 1.1796875, "learning_rate": 0.00038005178523788184, "loss": 5.0104, "mean_token_accuracy": 0.2194717526435852, "num_tokens": 81520500.0, "step": 35590 }, { "entropy": 5.682344055175781, "epoch": 3.5186832740213525, "grad_norm": 1.1796875, "learning_rate": 0.00038002057659808884, "loss": 4.9584, "mean_token_accuracy": 0.22543362230062486, "num_tokens": 81531617.0, "step": 35595 }, { "entropy": 5.773967218399048, "epoch": 3.5191775405298538, "grad_norm": 1.2421875, "learning_rate": 0.0003799893653747735, "loss": 4.9574, "mean_token_accuracy": 0.2260918140411377, "num_tokens": 81542814.0, "step": 35600 }, { "entropy": 5.734518814086914, "epoch": 3.519671807038355, "grad_norm": 1.3515625, "learning_rate": 0.00037995815156870334, "loss": 4.876, "mean_token_accuracy": 0.23281973004341125, "num_tokens": 81552551.0, "step": 35605 }, { "entropy": 5.777448606491089, "epoch": 3.5201660735468563, "grad_norm": 1.15625, "learning_rate": 0.00037992693518064635, "loss": 5.0863, "mean_token_accuracy": 0.2107955053448677, "num_tokens": 81564576.0, "step": 35610 }, { "entropy": 5.725781965255737, "epoch": 3.520660340055358, "grad_norm": 1.109375, "learning_rate": 0.00037989571621137053, "loss": 4.9532, "mean_token_accuracy": 0.22887909561395645, "num_tokens": 81575639.0, "step": 35615 }, { "entropy": 5.822841787338257, "epoch": 3.5211546065638593, "grad_norm": 1.3125, "learning_rate": 0.00037986449466164383, "loss": 5.0014, "mean_token_accuracy": 0.217158342897892, "num_tokens": 81587012.0, "step": 35620 }, { "entropy": 5.779533815383911, "epoch": 3.5216488730723605, "grad_norm": 1.2109375, "learning_rate": 0.0003798332705322343, "loss": 4.96, "mean_token_accuracy": 0.22823356986045837, "num_tokens": 81598194.0, "step": 35625 }, { "entropy": 5.758492136001587, "epoch": 3.5221431395808622, "grad_norm": 1.21875, "learning_rate": 0.0003798020438239101, "loss": 4.9816, "mean_token_accuracy": 0.22224068343639375, "num_tokens": 81608702.0, "step": 35630 }, { "entropy": 5.7276102066040036, "epoch": 3.5226374060893635, "grad_norm": 1.1171875, "learning_rate": 0.0003797708145374392, "loss": 4.9516, "mean_token_accuracy": 0.23077966868877411, "num_tokens": 81619598.0, "step": 35635 }, { "entropy": 5.762475299835205, "epoch": 3.5231316725978647, "grad_norm": 1.1328125, "learning_rate": 0.0003797395826735901, "loss": 4.9752, "mean_token_accuracy": 0.21124812215566635, "num_tokens": 81631928.0, "step": 35640 }, { "entropy": 5.852632761001587, "epoch": 3.523625939106366, "grad_norm": 1.1640625, "learning_rate": 0.00037970834823313106, "loss": 5.1006, "mean_token_accuracy": 0.21089707762002946, "num_tokens": 81644553.0, "step": 35645 }, { "entropy": 5.854278612136841, "epoch": 3.5241202056148673, "grad_norm": 1.2421875, "learning_rate": 0.00037967711121683037, "loss": 5.0691, "mean_token_accuracy": 0.21828970164060593, "num_tokens": 81656633.0, "step": 35650 }, { "entropy": 5.771139764785767, "epoch": 3.524614472123369, "grad_norm": 1.1328125, "learning_rate": 0.0003796458716254565, "loss": 4.9555, "mean_token_accuracy": 0.22815842628479005, "num_tokens": 81669287.0, "step": 35655 }, { "entropy": 5.686197233200073, "epoch": 3.5251087386318702, "grad_norm": 1.296875, "learning_rate": 0.00037961462945977794, "loss": 4.8741, "mean_token_accuracy": 0.23084161430597305, "num_tokens": 81680298.0, "step": 35660 }, { "entropy": 5.76054539680481, "epoch": 3.525603005140372, "grad_norm": 1.3203125, "learning_rate": 0.0003795833847205633, "loss": 5.0344, "mean_token_accuracy": 0.21372692734003068, "num_tokens": 81691088.0, "step": 35665 }, { "entropy": 5.752209186553955, "epoch": 3.526097271648873, "grad_norm": 1.171875, "learning_rate": 0.0003795521374085811, "loss": 4.9945, "mean_token_accuracy": 0.2204019919037819, "num_tokens": 81701791.0, "step": 35670 }, { "entropy": 5.827968597412109, "epoch": 3.5265915381573745, "grad_norm": 1.234375, "learning_rate": 0.00037952088752460025, "loss": 5.0776, "mean_token_accuracy": 0.21598095297813416, "num_tokens": 81713682.0, "step": 35675 }, { "entropy": 5.706695461273194, "epoch": 3.5270858046658757, "grad_norm": 1.21875, "learning_rate": 0.0003794896350693893, "loss": 4.8397, "mean_token_accuracy": 0.24375058561563492, "num_tokens": 81724857.0, "step": 35680 }, { "entropy": 5.773783016204834, "epoch": 3.527580071174377, "grad_norm": 1.2421875, "learning_rate": 0.000379458380043717, "loss": 4.9768, "mean_token_accuracy": 0.2226027324795723, "num_tokens": 81737074.0, "step": 35685 }, { "entropy": 5.813046407699585, "epoch": 3.5280743376828787, "grad_norm": 1.2109375, "learning_rate": 0.0003794271224483524, "loss": 5.0737, "mean_token_accuracy": 0.21293605268001556, "num_tokens": 81749679.0, "step": 35690 }, { "entropy": 5.760980939865112, "epoch": 3.52856860419138, "grad_norm": 1.2578125, "learning_rate": 0.00037939586228406445, "loss": 4.9703, "mean_token_accuracy": 0.22602469921112062, "num_tokens": 81761165.0, "step": 35695 }, { "entropy": 5.706920576095581, "epoch": 3.5290628706998812, "grad_norm": 1.1953125, "learning_rate": 0.00037936459955162204, "loss": 4.8574, "mean_token_accuracy": 0.23544945418834687, "num_tokens": 81773289.0, "step": 35700 }, { "entropy": 5.75397424697876, "epoch": 3.529557137208383, "grad_norm": 1.203125, "learning_rate": 0.0003793333342517943, "loss": 4.9215, "mean_token_accuracy": 0.22247510999441147, "num_tokens": 81785021.0, "step": 35705 }, { "entropy": 5.697779321670533, "epoch": 3.530051403716884, "grad_norm": 1.1875, "learning_rate": 0.0003793020663853503, "loss": 4.9263, "mean_token_accuracy": 0.22515626400709152, "num_tokens": 81796111.0, "step": 35710 }, { "entropy": 5.7483972072601315, "epoch": 3.5305456702253855, "grad_norm": 1.140625, "learning_rate": 0.0003792707959530594, "loss": 4.9355, "mean_token_accuracy": 0.228161758184433, "num_tokens": 81806927.0, "step": 35715 }, { "entropy": 5.801257753372193, "epoch": 3.5310399367338867, "grad_norm": 1.078125, "learning_rate": 0.0003792395229556907, "loss": 5.0787, "mean_token_accuracy": 0.21583347469568254, "num_tokens": 81819942.0, "step": 35720 }, { "entropy": 5.734513521194458, "epoch": 3.5315342032423884, "grad_norm": 1.265625, "learning_rate": 0.0003792082473940135, "loss": 4.9661, "mean_token_accuracy": 0.2264382690191269, "num_tokens": 81831192.0, "step": 35725 }, { "entropy": 5.761072444915771, "epoch": 3.5320284697508897, "grad_norm": 1.046875, "learning_rate": 0.0003791769692687973, "loss": 4.9924, "mean_token_accuracy": 0.22412968873977662, "num_tokens": 81844684.0, "step": 35730 }, { "entropy": 5.767040729522705, "epoch": 3.532522736259391, "grad_norm": 1.171875, "learning_rate": 0.00037914568858081146, "loss": 5.0117, "mean_token_accuracy": 0.22279942631721497, "num_tokens": 81855379.0, "step": 35735 }, { "entropy": 5.745207977294922, "epoch": 3.5330170027678927, "grad_norm": 1.1796875, "learning_rate": 0.0003791144053308256, "loss": 4.8374, "mean_token_accuracy": 0.22777983099222182, "num_tokens": 81867560.0, "step": 35740 }, { "entropy": 5.708595609664917, "epoch": 3.533511269276394, "grad_norm": 1.234375, "learning_rate": 0.00037908311951960916, "loss": 4.9713, "mean_token_accuracy": 0.22204873710870743, "num_tokens": 81879298.0, "step": 35745 }, { "entropy": 5.743827295303345, "epoch": 3.534005535784895, "grad_norm": 1.1953125, "learning_rate": 0.0003790518311479318, "loss": 4.9634, "mean_token_accuracy": 0.22549499273300172, "num_tokens": 81891323.0, "step": 35750 }, { "entropy": 5.7458302021026615, "epoch": 3.5344998022933964, "grad_norm": 1.2421875, "learning_rate": 0.0003790205402165633, "loss": 4.8837, "mean_token_accuracy": 0.23330256938934327, "num_tokens": 81901324.0, "step": 35755 }, { "entropy": 5.794938850402832, "epoch": 3.534994068801898, "grad_norm": 1.359375, "learning_rate": 0.00037898924672627346, "loss": 4.9932, "mean_token_accuracy": 0.2228091165423393, "num_tokens": 81911740.0, "step": 35760 }, { "entropy": 5.702045249938965, "epoch": 3.5354883353103994, "grad_norm": 1.1171875, "learning_rate": 0.00037895795067783184, "loss": 4.8832, "mean_token_accuracy": 0.22579411715269088, "num_tokens": 81922685.0, "step": 35765 }, { "entropy": 5.736795854568482, "epoch": 3.5359826018189007, "grad_norm": 1.2578125, "learning_rate": 0.0003789266520720086, "loss": 4.9696, "mean_token_accuracy": 0.2302746444940567, "num_tokens": 81935822.0, "step": 35770 }, { "entropy": 5.722377061843872, "epoch": 3.5364768683274024, "grad_norm": 1.3359375, "learning_rate": 0.0003788953509095736, "loss": 4.9319, "mean_token_accuracy": 0.22888694405555726, "num_tokens": 81948420.0, "step": 35775 }, { "entropy": 5.764716863632202, "epoch": 3.5369711348359036, "grad_norm": 1.2578125, "learning_rate": 0.0003788640471912968, "loss": 4.9771, "mean_token_accuracy": 0.2236185759305954, "num_tokens": 81959740.0, "step": 35780 }, { "entropy": 5.74137692451477, "epoch": 3.537465401344405, "grad_norm": 1.1328125, "learning_rate": 0.00037883274091794837, "loss": 4.9328, "mean_token_accuracy": 0.22990221232175828, "num_tokens": 81971334.0, "step": 35785 }, { "entropy": 5.77884726524353, "epoch": 3.537959667852906, "grad_norm": 1.359375, "learning_rate": 0.00037880143209029844, "loss": 4.9489, "mean_token_accuracy": 0.2228084087371826, "num_tokens": 81981740.0, "step": 35790 }, { "entropy": 5.734438467025757, "epoch": 3.5384539343614074, "grad_norm": 1.234375, "learning_rate": 0.0003787701207091171, "loss": 5.006, "mean_token_accuracy": 0.21568506211042404, "num_tokens": 81992987.0, "step": 35795 }, { "entropy": 5.715889883041382, "epoch": 3.538948200869909, "grad_norm": 1.28125, "learning_rate": 0.00037873880677517476, "loss": 4.9496, "mean_token_accuracy": 0.22788602411746978, "num_tokens": 82003590.0, "step": 35800 }, { "entropy": 5.8146388053894045, "epoch": 3.5394424673784104, "grad_norm": 1.171875, "learning_rate": 0.0003787074902892416, "loss": 5.0225, "mean_token_accuracy": 0.21453812718391418, "num_tokens": 82014894.0, "step": 35805 }, { "entropy": 5.7466412544250485, "epoch": 3.5399367338869117, "grad_norm": 1.3125, "learning_rate": 0.00037867617125208813, "loss": 4.9165, "mean_token_accuracy": 0.22870483249425888, "num_tokens": 82025214.0, "step": 35810 }, { "entropy": 5.702399587631225, "epoch": 3.5404310003954134, "grad_norm": 1.109375, "learning_rate": 0.0003786448496644848, "loss": 4.93, "mean_token_accuracy": 0.22937235981225967, "num_tokens": 82038866.0, "step": 35815 }, { "entropy": 5.792431306838989, "epoch": 3.5409252669039146, "grad_norm": 1.2890625, "learning_rate": 0.000378613525527202, "loss": 5.0414, "mean_token_accuracy": 0.22038553655147552, "num_tokens": 82051114.0, "step": 35820 }, { "entropy": 5.709439516067505, "epoch": 3.541419533412416, "grad_norm": 1.1484375, "learning_rate": 0.00037858219884101047, "loss": 4.9661, "mean_token_accuracy": 0.2258375257253647, "num_tokens": 82063091.0, "step": 35825 }, { "entropy": 5.749315595626831, "epoch": 3.541913799920917, "grad_norm": 1.2109375, "learning_rate": 0.0003785508696066808, "loss": 4.9332, "mean_token_accuracy": 0.22747773081064224, "num_tokens": 82073363.0, "step": 35830 }, { "entropy": 5.827824115753174, "epoch": 3.542408066429419, "grad_norm": 1.34375, "learning_rate": 0.00037851953782498367, "loss": 5.0215, "mean_token_accuracy": 0.2127931922674179, "num_tokens": 82083477.0, "step": 35835 }, { "entropy": 5.7536694526672365, "epoch": 3.54290233293792, "grad_norm": 1.140625, "learning_rate": 0.0003784882034966898, "loss": 4.8898, "mean_token_accuracy": 0.22668828219175338, "num_tokens": 82094738.0, "step": 35840 }, { "entropy": 5.756086730957032, "epoch": 3.5433965994464214, "grad_norm": 1.1875, "learning_rate": 0.00037845686662257, "loss": 4.9593, "mean_token_accuracy": 0.22838023751974107, "num_tokens": 82105769.0, "step": 35845 }, { "entropy": 5.776323509216309, "epoch": 3.543890865954923, "grad_norm": 1.1875, "learning_rate": 0.0003784255272033954, "loss": 5.0026, "mean_token_accuracy": 0.21800482869148255, "num_tokens": 82117644.0, "step": 35850 }, { "entropy": 5.696103239059449, "epoch": 3.5443851324634243, "grad_norm": 1.15625, "learning_rate": 0.00037839418523993667, "loss": 4.9072, "mean_token_accuracy": 0.2297068014740944, "num_tokens": 82129716.0, "step": 35855 }, { "entropy": 5.643079662322998, "epoch": 3.5448793989719256, "grad_norm": 1.3359375, "learning_rate": 0.000378362840732965, "loss": 4.8428, "mean_token_accuracy": 0.23724465072155, "num_tokens": 82142378.0, "step": 35860 }, { "entropy": 5.690996694564819, "epoch": 3.545373665480427, "grad_norm": 1.28125, "learning_rate": 0.00037833149368325143, "loss": 4.8713, "mean_token_accuracy": 0.2325006291270256, "num_tokens": 82152893.0, "step": 35865 }, { "entropy": 5.7738429546356205, "epoch": 3.5458679319889286, "grad_norm": 1.1796875, "learning_rate": 0.000378300144091567, "loss": 5.0153, "mean_token_accuracy": 0.22508428245782852, "num_tokens": 82165813.0, "step": 35870 }, { "entropy": 5.734207105636597, "epoch": 3.54636219849743, "grad_norm": 1.171875, "learning_rate": 0.000378268791958683, "loss": 4.9498, "mean_token_accuracy": 0.21678674221038818, "num_tokens": 82177641.0, "step": 35875 }, { "entropy": 5.791926050186158, "epoch": 3.546856465005931, "grad_norm": 1.3125, "learning_rate": 0.0003782374372853708, "loss": 4.9406, "mean_token_accuracy": 0.2200591668486595, "num_tokens": 82187594.0, "step": 35880 }, { "entropy": 5.6983870506286625, "epoch": 3.547350731514433, "grad_norm": 1.203125, "learning_rate": 0.0003782060800724016, "loss": 4.9594, "mean_token_accuracy": 0.21996378004550934, "num_tokens": 82199177.0, "step": 35885 }, { "entropy": 5.790413522720337, "epoch": 3.547844998022934, "grad_norm": 1.2890625, "learning_rate": 0.0003781747203205468, "loss": 4.9671, "mean_token_accuracy": 0.22168762236833572, "num_tokens": 82211176.0, "step": 35890 }, { "entropy": 5.7486106872558596, "epoch": 3.5483392645314353, "grad_norm": 1.1796875, "learning_rate": 0.00037814335803057773, "loss": 4.875, "mean_token_accuracy": 0.23064166754484178, "num_tokens": 82222767.0, "step": 35895 }, { "entropy": 5.727271366119385, "epoch": 3.5488335310399366, "grad_norm": 1.171875, "learning_rate": 0.0003781119932032662, "loss": 4.9858, "mean_token_accuracy": 0.22085098028182984, "num_tokens": 82234060.0, "step": 35900 }, { "entropy": 5.773919725418091, "epoch": 3.549327797548438, "grad_norm": 1.296875, "learning_rate": 0.00037808062583938367, "loss": 4.9548, "mean_token_accuracy": 0.22422117441892625, "num_tokens": 82244910.0, "step": 35905 }, { "entropy": 5.790648698806763, "epoch": 3.5498220640569396, "grad_norm": 1.125, "learning_rate": 0.0003780492559397017, "loss": 5.0498, "mean_token_accuracy": 0.21800085604190828, "num_tokens": 82257730.0, "step": 35910 }, { "entropy": 5.724204254150391, "epoch": 3.550316330565441, "grad_norm": 1.21875, "learning_rate": 0.0003780178835049921, "loss": 4.9007, "mean_token_accuracy": 0.2358308032155037, "num_tokens": 82268688.0, "step": 35915 }, { "entropy": 5.741845989227295, "epoch": 3.5508105970739425, "grad_norm": 1.2734375, "learning_rate": 0.0003779865085360265, "loss": 5.0002, "mean_token_accuracy": 0.2221138969063759, "num_tokens": 82279562.0, "step": 35920 }, { "entropy": 5.753812503814697, "epoch": 3.551304863582444, "grad_norm": 1.296875, "learning_rate": 0.0003779551310335768, "loss": 4.9078, "mean_token_accuracy": 0.23089702427387238, "num_tokens": 82289945.0, "step": 35925 }, { "entropy": 5.8040056228637695, "epoch": 3.551799130090945, "grad_norm": 1.1640625, "learning_rate": 0.00037792375099841505, "loss": 4.9844, "mean_token_accuracy": 0.22936297953128815, "num_tokens": 82301878.0, "step": 35930 }, { "entropy": 5.774952220916748, "epoch": 3.5522933965994463, "grad_norm": 1.234375, "learning_rate": 0.00037789236843131297, "loss": 5.0059, "mean_token_accuracy": 0.22326663881540298, "num_tokens": 82313565.0, "step": 35935 }, { "entropy": 5.746735429763794, "epoch": 3.5527876631079476, "grad_norm": 1.2421875, "learning_rate": 0.0003778609833330426, "loss": 4.994, "mean_token_accuracy": 0.21841957569122314, "num_tokens": 82324375.0, "step": 35940 }, { "entropy": 5.828620910644531, "epoch": 3.5532819296164493, "grad_norm": 1.1484375, "learning_rate": 0.0003778295957043761, "loss": 5.1064, "mean_token_accuracy": 0.20658788084983826, "num_tokens": 82335642.0, "step": 35945 }, { "entropy": 5.738768482208252, "epoch": 3.5537761961249505, "grad_norm": 1.25, "learning_rate": 0.0003777982055460857, "loss": 4.8742, "mean_token_accuracy": 0.23628106564283372, "num_tokens": 82345847.0, "step": 35950 }, { "entropy": 5.830169248580932, "epoch": 3.554270462633452, "grad_norm": 1.2734375, "learning_rate": 0.0003777668128589434, "loss": 5.0507, "mean_token_accuracy": 0.21960015296936036, "num_tokens": 82358249.0, "step": 35955 }, { "entropy": 5.746911525726318, "epoch": 3.5547647291419535, "grad_norm": 1.265625, "learning_rate": 0.0003777354176437216, "loss": 4.9596, "mean_token_accuracy": 0.22475355714559556, "num_tokens": 82369996.0, "step": 35960 }, { "entropy": 5.789019298553467, "epoch": 3.555258995650455, "grad_norm": 1.296875, "learning_rate": 0.0003777040199011926, "loss": 4.9181, "mean_token_accuracy": 0.22842899560928345, "num_tokens": 82381569.0, "step": 35965 }, { "entropy": 5.749431037902832, "epoch": 3.555753262158956, "grad_norm": 1.2265625, "learning_rate": 0.00037767261963212866, "loss": 4.9924, "mean_token_accuracy": 0.21827427744865419, "num_tokens": 82392343.0, "step": 35970 }, { "entropy": 5.692380571365357, "epoch": 3.5562475286674573, "grad_norm": 1.2578125, "learning_rate": 0.00037764121683730247, "loss": 4.9927, "mean_token_accuracy": 0.2241477847099304, "num_tokens": 82403681.0, "step": 35975 }, { "entropy": 5.789081001281739, "epoch": 3.556741795175959, "grad_norm": 1.1796875, "learning_rate": 0.00037760981151748645, "loss": 5.0202, "mean_token_accuracy": 0.21497927457094193, "num_tokens": 82415773.0, "step": 35980 }, { "entropy": 5.723096466064453, "epoch": 3.5572360616844603, "grad_norm": 1.296875, "learning_rate": 0.0003775784036734531, "loss": 4.8679, "mean_token_accuracy": 0.23354502469301225, "num_tokens": 82426636.0, "step": 35985 }, { "entropy": 5.836662340164184, "epoch": 3.5577303281929615, "grad_norm": 1.2578125, "learning_rate": 0.0003775469933059751, "loss": 5.0604, "mean_token_accuracy": 0.214945450425148, "num_tokens": 82438546.0, "step": 35990 }, { "entropy": 5.730599355697632, "epoch": 3.5582245947014632, "grad_norm": 1.203125, "learning_rate": 0.00037751558041582514, "loss": 4.9732, "mean_token_accuracy": 0.223971027135849, "num_tokens": 82451911.0, "step": 35995 }, { "entropy": 5.769511651992798, "epoch": 3.5587188612099645, "grad_norm": 1.2421875, "learning_rate": 0.000377484165003776, "loss": 4.895, "mean_token_accuracy": 0.22900905460119247, "num_tokens": 82464691.0, "step": 36000 }, { "epoch": 3.5587188612099645, "eval_entropy": 5.508558938306782, "eval_loss": 5.021881103515625, "eval_mean_token_accuracy": 0.22951890462952199, "eval_num_tokens": 82464691.0, "eval_runtime": 20.5404, "eval_samples_per_second": 1582.879, "eval_steps_per_second": 197.903, "step": 36000 }, { "entropy": 5.740245532989502, "epoch": 3.5592131277184658, "grad_norm": 1.1875, "learning_rate": 0.00037745274707060055, "loss": 4.9868, "mean_token_accuracy": 0.22039039433002472, "num_tokens": 82476498.0, "step": 36005 }, { "entropy": 5.679426479339599, "epoch": 3.559707394226967, "grad_norm": 1.09375, "learning_rate": 0.00037742132661707157, "loss": 4.9214, "mean_token_accuracy": 0.2336275190114975, "num_tokens": 82488434.0, "step": 36010 }, { "entropy": 5.725425863265992, "epoch": 3.5602016607354683, "grad_norm": 1.1640625, "learning_rate": 0.00037738990364396207, "loss": 4.8866, "mean_token_accuracy": 0.22621850967407225, "num_tokens": 82500277.0, "step": 36015 }, { "entropy": 5.796396636962891, "epoch": 3.56069592724397, "grad_norm": 1.1875, "learning_rate": 0.00037735847815204503, "loss": 5.014, "mean_token_accuracy": 0.2212940573692322, "num_tokens": 82513107.0, "step": 36020 }, { "entropy": 5.76483907699585, "epoch": 3.5611901937524713, "grad_norm": 1.2109375, "learning_rate": 0.00037732705014209366, "loss": 4.9792, "mean_token_accuracy": 0.2203971266746521, "num_tokens": 82524967.0, "step": 36025 }, { "entropy": 5.723723840713501, "epoch": 3.561684460260973, "grad_norm": 1.4609375, "learning_rate": 0.0003772956196148809, "loss": 4.9577, "mean_token_accuracy": 0.2198776811361313, "num_tokens": 82536721.0, "step": 36030 }, { "entropy": 5.781989431381225, "epoch": 3.5621787267694742, "grad_norm": 1.125, "learning_rate": 0.00037726418657118004, "loss": 4.9882, "mean_token_accuracy": 0.22244239151477813, "num_tokens": 82549386.0, "step": 36035 }, { "entropy": 5.763472843170166, "epoch": 3.5626729932779755, "grad_norm": 1.1796875, "learning_rate": 0.00037723275101176436, "loss": 4.8728, "mean_token_accuracy": 0.23617226481437684, "num_tokens": 82560207.0, "step": 36040 }, { "entropy": 5.762670230865479, "epoch": 3.5631672597864767, "grad_norm": 1.2578125, "learning_rate": 0.0003772013129374071, "loss": 5.0191, "mean_token_accuracy": 0.21680087298154832, "num_tokens": 82570484.0, "step": 36045 }, { "entropy": 5.721595001220703, "epoch": 3.563661526294978, "grad_norm": 1.1875, "learning_rate": 0.0003771698723488817, "loss": 4.9253, "mean_token_accuracy": 0.2233380541205406, "num_tokens": 82581833.0, "step": 36050 }, { "entropy": 5.661393451690674, "epoch": 3.5641557928034797, "grad_norm": 1.1875, "learning_rate": 0.00037713842924696155, "loss": 4.8701, "mean_token_accuracy": 0.23219945877790452, "num_tokens": 82593351.0, "step": 36055 }, { "entropy": 5.753630208969116, "epoch": 3.564650059311981, "grad_norm": 1.2578125, "learning_rate": 0.0003771069836324203, "loss": 5.0005, "mean_token_accuracy": 0.22054840326309205, "num_tokens": 82606644.0, "step": 36060 }, { "entropy": 5.716038179397583, "epoch": 3.5651443258204822, "grad_norm": 1.2890625, "learning_rate": 0.0003770755355060313, "loss": 5.0098, "mean_token_accuracy": 0.22876815646886825, "num_tokens": 82618779.0, "step": 36065 }, { "entropy": 5.773155450820923, "epoch": 3.565638592328984, "grad_norm": 1.2578125, "learning_rate": 0.0003770440848685683, "loss": 4.9249, "mean_token_accuracy": 0.22824518829584123, "num_tokens": 82629968.0, "step": 36070 }, { "entropy": 5.745453691482544, "epoch": 3.566132858837485, "grad_norm": 1.15625, "learning_rate": 0.00037701263172080514, "loss": 4.9566, "mean_token_accuracy": 0.23086657077074052, "num_tokens": 82641586.0, "step": 36075 }, { "entropy": 5.830714082717895, "epoch": 3.5666271253459865, "grad_norm": 1.1875, "learning_rate": 0.00037698117606351525, "loss": 5.0395, "mean_token_accuracy": 0.21885924637317658, "num_tokens": 82651901.0, "step": 36080 }, { "entropy": 5.70860276222229, "epoch": 3.5671213918544877, "grad_norm": 1.15625, "learning_rate": 0.0003769497178974726, "loss": 4.9103, "mean_token_accuracy": 0.22742430716753007, "num_tokens": 82663055.0, "step": 36085 }, { "entropy": 5.640104532241821, "epoch": 3.5676156583629894, "grad_norm": 1.2109375, "learning_rate": 0.0003769182572234512, "loss": 4.8747, "mean_token_accuracy": 0.23550799787044524, "num_tokens": 82674709.0, "step": 36090 }, { "entropy": 5.739613437652588, "epoch": 3.5681099248714907, "grad_norm": 1.2578125, "learning_rate": 0.0003768867940422248, "loss": 4.8719, "mean_token_accuracy": 0.23496613949537276, "num_tokens": 82685215.0, "step": 36095 }, { "entropy": 5.791907596588135, "epoch": 3.568604191379992, "grad_norm": 1.234375, "learning_rate": 0.0003768553283545674, "loss": 5.0157, "mean_token_accuracy": 0.22023407071828843, "num_tokens": 82697473.0, "step": 36100 }, { "entropy": 5.699418020248413, "epoch": 3.5690984578884937, "grad_norm": 1.28125, "learning_rate": 0.0003768238601612532, "loss": 4.9234, "mean_token_accuracy": 0.2325322523713112, "num_tokens": 82708033.0, "step": 36105 }, { "entropy": 5.752238988876343, "epoch": 3.569592724396995, "grad_norm": 1.28125, "learning_rate": 0.0003767923894630562, "loss": 4.9212, "mean_token_accuracy": 0.22852040380239486, "num_tokens": 82719410.0, "step": 36110 }, { "entropy": 5.804840469360352, "epoch": 3.570086990905496, "grad_norm": 1.2890625, "learning_rate": 0.00037676091626075056, "loss": 4.8861, "mean_token_accuracy": 0.22700747698545456, "num_tokens": 82730648.0, "step": 36115 }, { "entropy": 5.77003664970398, "epoch": 3.5705812574139975, "grad_norm": 1.2578125, "learning_rate": 0.0003767294405551107, "loss": 4.9699, "mean_token_accuracy": 0.2223377823829651, "num_tokens": 82742041.0, "step": 36120 }, { "entropy": 5.75500111579895, "epoch": 3.571075523922499, "grad_norm": 1.25, "learning_rate": 0.0003766979623469108, "loss": 4.987, "mean_token_accuracy": 0.21900109946727753, "num_tokens": 82754083.0, "step": 36125 }, { "entropy": 5.780793952941894, "epoch": 3.5715697904310004, "grad_norm": 1.1015625, "learning_rate": 0.0003766664816369252, "loss": 5.0392, "mean_token_accuracy": 0.21500103175640106, "num_tokens": 82766735.0, "step": 36130 }, { "entropy": 5.841730451583862, "epoch": 3.5720640569395017, "grad_norm": 1.2421875, "learning_rate": 0.00037663499842592845, "loss": 5.0888, "mean_token_accuracy": 0.21570731252431868, "num_tokens": 82778498.0, "step": 36135 }, { "entropy": 5.879758358001709, "epoch": 3.5725583234480034, "grad_norm": 1.34375, "learning_rate": 0.00037660351271469496, "loss": 5.0675, "mean_token_accuracy": 0.2123200163245201, "num_tokens": 82789927.0, "step": 36140 }, { "entropy": 5.826226234436035, "epoch": 3.5730525899565047, "grad_norm": 1.1796875, "learning_rate": 0.0003765720245039993, "loss": 4.9625, "mean_token_accuracy": 0.214798441529274, "num_tokens": 82800846.0, "step": 36145 }, { "entropy": 5.729911041259766, "epoch": 3.573546856465006, "grad_norm": 1.28125, "learning_rate": 0.00037654053379461606, "loss": 4.9664, "mean_token_accuracy": 0.22246886789798737, "num_tokens": 82812912.0, "step": 36150 }, { "entropy": 5.793826770782471, "epoch": 3.574041122973507, "grad_norm": 1.21875, "learning_rate": 0.0003765090405873199, "loss": 5.0186, "mean_token_accuracy": 0.22350654602050782, "num_tokens": 82824186.0, "step": 36155 }, { "entropy": 5.732223701477051, "epoch": 3.5745353894820084, "grad_norm": 1.2421875, "learning_rate": 0.0003764775448828856, "loss": 4.9872, "mean_token_accuracy": 0.22499649971723557, "num_tokens": 82835599.0, "step": 36160 }, { "entropy": 5.729511404037476, "epoch": 3.57502965599051, "grad_norm": 1.2421875, "learning_rate": 0.00037644604668208805, "loss": 4.8683, "mean_token_accuracy": 0.23070819079875945, "num_tokens": 82846272.0, "step": 36165 }, { "entropy": 5.7895670413970945, "epoch": 3.5755239224990114, "grad_norm": 1.3984375, "learning_rate": 0.0003764145459857019, "loss": 4.9833, "mean_token_accuracy": 0.22185556292533876, "num_tokens": 82858245.0, "step": 36170 }, { "entropy": 5.78285436630249, "epoch": 3.576018189007513, "grad_norm": 1.2890625, "learning_rate": 0.00037638304279450225, "loss": 4.9801, "mean_token_accuracy": 0.22269493639469146, "num_tokens": 82869951.0, "step": 36175 }, { "entropy": 5.738373279571533, "epoch": 3.5765124555160144, "grad_norm": 1.3125, "learning_rate": 0.00037635153710926394, "loss": 4.8996, "mean_token_accuracy": 0.23027793914079667, "num_tokens": 82880489.0, "step": 36180 }, { "entropy": 5.749619817733764, "epoch": 3.5770067220245156, "grad_norm": 1.1484375, "learning_rate": 0.00037632002893076217, "loss": 5.0165, "mean_token_accuracy": 0.2174355834722519, "num_tokens": 82892188.0, "step": 36185 }, { "entropy": 5.728027057647705, "epoch": 3.577500988533017, "grad_norm": 1.3828125, "learning_rate": 0.000376288518259772, "loss": 4.9204, "mean_token_accuracy": 0.23277533203363418, "num_tokens": 82903504.0, "step": 36190 }, { "entropy": 5.69014163017273, "epoch": 3.577995255041518, "grad_norm": 1.1953125, "learning_rate": 0.0003762570050970685, "loss": 4.8779, "mean_token_accuracy": 0.22655326277017593, "num_tokens": 82914396.0, "step": 36195 }, { "entropy": 5.695727014541626, "epoch": 3.57848952155002, "grad_norm": 1.1484375, "learning_rate": 0.000376225489443427, "loss": 4.8795, "mean_token_accuracy": 0.22872186601161956, "num_tokens": 82925759.0, "step": 36200 }, { "entropy": 5.727814674377441, "epoch": 3.578983788058521, "grad_norm": 1.2109375, "learning_rate": 0.0003761939712996227, "loss": 4.9219, "mean_token_accuracy": 0.2267654374241829, "num_tokens": 82937474.0, "step": 36205 }, { "entropy": 5.780701684951782, "epoch": 3.5794780545670224, "grad_norm": 1.3203125, "learning_rate": 0.0003761624506664311, "loss": 5.0169, "mean_token_accuracy": 0.21450553387403487, "num_tokens": 82948686.0, "step": 36210 }, { "entropy": 5.805887126922608, "epoch": 3.579972321075524, "grad_norm": 1.1953125, "learning_rate": 0.0003761309275446274, "loss": 4.9984, "mean_token_accuracy": 0.2257796049118042, "num_tokens": 82960099.0, "step": 36215 }, { "entropy": 5.742119455337525, "epoch": 3.5804665875840254, "grad_norm": 1.1953125, "learning_rate": 0.0003760994019349873, "loss": 4.9336, "mean_token_accuracy": 0.2234094113111496, "num_tokens": 82971415.0, "step": 36220 }, { "entropy": 5.76347918510437, "epoch": 3.5809608540925266, "grad_norm": 1.21875, "learning_rate": 0.0003760678738382862, "loss": 5.0082, "mean_token_accuracy": 0.21401462107896804, "num_tokens": 82983581.0, "step": 36225 }, { "entropy": 5.764483880996704, "epoch": 3.581455120601028, "grad_norm": 1.2109375, "learning_rate": 0.0003760363432552997, "loss": 4.968, "mean_token_accuracy": 0.2259003698825836, "num_tokens": 82994817.0, "step": 36230 }, { "entropy": 5.738733863830566, "epoch": 3.5819493871095296, "grad_norm": 1.3515625, "learning_rate": 0.0003760048101868035, "loss": 4.8705, "mean_token_accuracy": 0.2328740105032921, "num_tokens": 83004620.0, "step": 36235 }, { "entropy": 5.744269227981567, "epoch": 3.582443653618031, "grad_norm": 1.3359375, "learning_rate": 0.00037597327463357336, "loss": 4.9715, "mean_token_accuracy": 0.22100413888692855, "num_tokens": 83015257.0, "step": 36240 }, { "entropy": 5.654111433029175, "epoch": 3.582937920126532, "grad_norm": 1.234375, "learning_rate": 0.0003759417365963849, "loss": 4.8207, "mean_token_accuracy": 0.2398465797305107, "num_tokens": 83026765.0, "step": 36245 }, { "entropy": 5.75731258392334, "epoch": 3.583432186635034, "grad_norm": 1.078125, "learning_rate": 0.00037591019607601407, "loss": 4.9815, "mean_token_accuracy": 0.2226743295788765, "num_tokens": 83038893.0, "step": 36250 }, { "entropy": 5.677341747283935, "epoch": 3.583926453143535, "grad_norm": 1.140625, "learning_rate": 0.00037587865307323683, "loss": 4.9459, "mean_token_accuracy": 0.2274229571223259, "num_tokens": 83050615.0, "step": 36255 }, { "entropy": 5.781007528305054, "epoch": 3.5844207196520363, "grad_norm": 1.1640625, "learning_rate": 0.00037584710758882897, "loss": 5.0057, "mean_token_accuracy": 0.22131242007017135, "num_tokens": 83062459.0, "step": 36260 }, { "entropy": 5.831990385055542, "epoch": 3.5849149861605376, "grad_norm": 1.0859375, "learning_rate": 0.00037581555962356666, "loss": 5.056, "mean_token_accuracy": 0.21695964485406877, "num_tokens": 83073563.0, "step": 36265 }, { "entropy": 5.791493892669678, "epoch": 3.585409252669039, "grad_norm": 1.2890625, "learning_rate": 0.00037578400917822604, "loss": 5.0137, "mean_token_accuracy": 0.21658323109149932, "num_tokens": 83084831.0, "step": 36270 }, { "entropy": 5.727228403091431, "epoch": 3.5859035191775406, "grad_norm": 1.1171875, "learning_rate": 0.000375752456253583, "loss": 4.9179, "mean_token_accuracy": 0.2277284160256386, "num_tokens": 83096504.0, "step": 36275 }, { "entropy": 5.727636623382568, "epoch": 3.586397785686042, "grad_norm": 1.2734375, "learning_rate": 0.000375720900850414, "loss": 4.9922, "mean_token_accuracy": 0.22366588711738586, "num_tokens": 83108312.0, "step": 36280 }, { "entropy": 5.7168800830841064, "epoch": 3.5868920521945435, "grad_norm": 1.25, "learning_rate": 0.0003756893429694952, "loss": 4.8958, "mean_token_accuracy": 0.23572079986333846, "num_tokens": 83119040.0, "step": 36285 }, { "entropy": 5.742487573623658, "epoch": 3.587386318703045, "grad_norm": 1.1953125, "learning_rate": 0.00037565778261160296, "loss": 4.8485, "mean_token_accuracy": 0.2396532416343689, "num_tokens": 83129803.0, "step": 36290 }, { "entropy": 5.742160034179688, "epoch": 3.587880585211546, "grad_norm": 1.265625, "learning_rate": 0.0003756262197775137, "loss": 4.9295, "mean_token_accuracy": 0.22827044129371643, "num_tokens": 83142364.0, "step": 36295 }, { "entropy": 5.721851491928101, "epoch": 3.5883748517200473, "grad_norm": 1.375, "learning_rate": 0.00037559465446800364, "loss": 4.9721, "mean_token_accuracy": 0.2236535966396332, "num_tokens": 83152813.0, "step": 36300 }, { "entropy": 5.856607675552368, "epoch": 3.5888691182285486, "grad_norm": 1.3125, "learning_rate": 0.00037556308668384964, "loss": 5.1089, "mean_token_accuracy": 0.21373351961374282, "num_tokens": 83164052.0, "step": 36305 }, { "entropy": 5.756061792373657, "epoch": 3.5893633847370503, "grad_norm": 1.1328125, "learning_rate": 0.00037553151642582807, "loss": 4.9208, "mean_token_accuracy": 0.22529462575912476, "num_tokens": 83176236.0, "step": 36310 }, { "entropy": 5.727978754043579, "epoch": 3.5898576512455516, "grad_norm": 1.203125, "learning_rate": 0.0003754999436947156, "loss": 4.979, "mean_token_accuracy": 0.22029863744974137, "num_tokens": 83187173.0, "step": 36315 }, { "entropy": 5.708658361434937, "epoch": 3.590351917754053, "grad_norm": 1.2109375, "learning_rate": 0.0003754683684912889, "loss": 4.9648, "mean_token_accuracy": 0.2277854710817337, "num_tokens": 83199628.0, "step": 36320 }, { "entropy": 5.797570037841797, "epoch": 3.5908461842625545, "grad_norm": 1.359375, "learning_rate": 0.00037543679081632474, "loss": 4.9796, "mean_token_accuracy": 0.22740527093410492, "num_tokens": 83211748.0, "step": 36325 }, { "entropy": 5.696346712112427, "epoch": 3.591340450771056, "grad_norm": 1.359375, "learning_rate": 0.0003754052106706, "loss": 4.8934, "mean_token_accuracy": 0.2308681309223175, "num_tokens": 83223078.0, "step": 36330 }, { "entropy": 5.761122512817383, "epoch": 3.591834717279557, "grad_norm": 1.25, "learning_rate": 0.00037537362805489143, "loss": 4.9436, "mean_token_accuracy": 0.22822879254817963, "num_tokens": 83234046.0, "step": 36335 }, { "entropy": 5.763217115402222, "epoch": 3.5923289837880583, "grad_norm": 1.2890625, "learning_rate": 0.0003753420429699761, "loss": 4.987, "mean_token_accuracy": 0.2167970821261406, "num_tokens": 83244121.0, "step": 36340 }, { "entropy": 5.795695495605469, "epoch": 3.59282325029656, "grad_norm": 1.3046875, "learning_rate": 0.0003753104554166309, "loss": 4.9655, "mean_token_accuracy": 0.2181445837020874, "num_tokens": 83254182.0, "step": 36345 }, { "entropy": 5.716990041732788, "epoch": 3.5933175168050613, "grad_norm": 1.2421875, "learning_rate": 0.0003752788653956329, "loss": 4.9216, "mean_token_accuracy": 0.22640663981437684, "num_tokens": 83264527.0, "step": 36350 }, { "entropy": 5.810683536529541, "epoch": 3.5938117833135625, "grad_norm": 1.203125, "learning_rate": 0.0003752472729077593, "loss": 4.9842, "mean_token_accuracy": 0.21407381892204286, "num_tokens": 83275186.0, "step": 36355 }, { "entropy": 5.832469272613525, "epoch": 3.5943060498220643, "grad_norm": 1.2734375, "learning_rate": 0.0003752156779537873, "loss": 5.08, "mean_token_accuracy": 0.21350655406713487, "num_tokens": 83286919.0, "step": 36360 }, { "entropy": 5.744521188735962, "epoch": 3.5948003163305655, "grad_norm": 1.21875, "learning_rate": 0.00037518408053449404, "loss": 4.9434, "mean_token_accuracy": 0.21720613539218903, "num_tokens": 83298112.0, "step": 36365 }, { "entropy": 5.723997592926025, "epoch": 3.5952945828390668, "grad_norm": 1.1875, "learning_rate": 0.0003751524806506568, "loss": 5.0129, "mean_token_accuracy": 0.22148964405059815, "num_tokens": 83308978.0, "step": 36370 }, { "entropy": 5.774290704727173, "epoch": 3.595788849347568, "grad_norm": 1.2421875, "learning_rate": 0.00037512087830305306, "loss": 5.0604, "mean_token_accuracy": 0.21661423593759538, "num_tokens": 83320780.0, "step": 36375 }, { "entropy": 5.825651788711548, "epoch": 3.5962831158560697, "grad_norm": 1.34375, "learning_rate": 0.0003750892734924601, "loss": 5.0326, "mean_token_accuracy": 0.21498379707336426, "num_tokens": 83332070.0, "step": 36380 }, { "entropy": 5.786178779602051, "epoch": 3.596777382364571, "grad_norm": 1.203125, "learning_rate": 0.0003750576662196556, "loss": 4.9959, "mean_token_accuracy": 0.22339484691619874, "num_tokens": 83345506.0, "step": 36385 }, { "entropy": 5.840700149536133, "epoch": 3.5972716488730723, "grad_norm": 1.296875, "learning_rate": 0.0003750260564854169, "loss": 5.0732, "mean_token_accuracy": 0.21451534181833268, "num_tokens": 83357097.0, "step": 36390 }, { "entropy": 5.726877880096436, "epoch": 3.597765915381574, "grad_norm": 1.21875, "learning_rate": 0.0003749944442905217, "loss": 4.871, "mean_token_accuracy": 0.23418209701776505, "num_tokens": 83369088.0, "step": 36395 }, { "entropy": 5.780043506622315, "epoch": 3.5982601818900752, "grad_norm": 1.03125, "learning_rate": 0.0003749628296357477, "loss": 4.9943, "mean_token_accuracy": 0.22435135245323182, "num_tokens": 83381249.0, "step": 36400 }, { "entropy": 5.7276922225952145, "epoch": 3.5987544483985765, "grad_norm": 1.2265625, "learning_rate": 0.00037493121252187256, "loss": 4.9486, "mean_token_accuracy": 0.22232571691274644, "num_tokens": 83392000.0, "step": 36405 }, { "entropy": 5.70304913520813, "epoch": 3.5992487149070778, "grad_norm": 1.1015625, "learning_rate": 0.0003748995929496741, "loss": 4.8728, "mean_token_accuracy": 0.23157589584589006, "num_tokens": 83403841.0, "step": 36410 }, { "entropy": 5.761758661270141, "epoch": 3.599742981415579, "grad_norm": 1.203125, "learning_rate": 0.00037486797091993015, "loss": 4.9907, "mean_token_accuracy": 0.22523076832294464, "num_tokens": 83415114.0, "step": 36415 }, { "entropy": 5.7278139114379885, "epoch": 3.6002372479240807, "grad_norm": 1.15625, "learning_rate": 0.00037483634643341866, "loss": 5.0262, "mean_token_accuracy": 0.22027490586042403, "num_tokens": 83428158.0, "step": 36420 }, { "entropy": 5.83130841255188, "epoch": 3.600731514432582, "grad_norm": 1.1640625, "learning_rate": 0.0003748047194909175, "loss": 4.9998, "mean_token_accuracy": 0.22703043669462203, "num_tokens": 83439535.0, "step": 36425 }, { "entropy": 5.783418846130371, "epoch": 3.6012257809410837, "grad_norm": 1.234375, "learning_rate": 0.00037477309009320477, "loss": 4.9918, "mean_token_accuracy": 0.2218065306544304, "num_tokens": 83451215.0, "step": 36430 }, { "entropy": 5.808160209655762, "epoch": 3.601720047449585, "grad_norm": 1.25, "learning_rate": 0.00037474145824105854, "loss": 4.9839, "mean_token_accuracy": 0.21818913370370865, "num_tokens": 83461750.0, "step": 36435 }, { "entropy": 5.701957130432129, "epoch": 3.6022143139580862, "grad_norm": 1.1796875, "learning_rate": 0.00037470982393525697, "loss": 4.9387, "mean_token_accuracy": 0.2263297602534294, "num_tokens": 83473790.0, "step": 36440 }, { "entropy": 5.719630432128906, "epoch": 3.6027085804665875, "grad_norm": 1.1328125, "learning_rate": 0.00037467818717657825, "loss": 4.9481, "mean_token_accuracy": 0.2241119235754013, "num_tokens": 83485470.0, "step": 36445 }, { "entropy": 5.784329843521118, "epoch": 3.6032028469750887, "grad_norm": 1.28125, "learning_rate": 0.0003746465479658007, "loss": 4.952, "mean_token_accuracy": 0.2236907035112381, "num_tokens": 83496007.0, "step": 36450 }, { "entropy": 5.792724657058716, "epoch": 3.6036971134835905, "grad_norm": 1.1484375, "learning_rate": 0.0003746149063037026, "loss": 5.0507, "mean_token_accuracy": 0.218854358792305, "num_tokens": 83508620.0, "step": 36455 }, { "entropy": 5.737733459472656, "epoch": 3.6041913799920917, "grad_norm": 1.265625, "learning_rate": 0.0003745832621910623, "loss": 4.9369, "mean_token_accuracy": 0.23154576867818832, "num_tokens": 83520323.0, "step": 36460 }, { "entropy": 5.66882004737854, "epoch": 3.604685646500593, "grad_norm": 1.140625, "learning_rate": 0.00037455161562865833, "loss": 4.9012, "mean_token_accuracy": 0.2287164568901062, "num_tokens": 83532471.0, "step": 36465 }, { "entropy": 5.720019054412842, "epoch": 3.6051799130090947, "grad_norm": 1.21875, "learning_rate": 0.0003745199666172692, "loss": 4.9186, "mean_token_accuracy": 0.2306458532810211, "num_tokens": 83544156.0, "step": 36470 }, { "entropy": 5.7970428466796875, "epoch": 3.605674179517596, "grad_norm": 1.1015625, "learning_rate": 0.00037448831515767353, "loss": 4.9487, "mean_token_accuracy": 0.22554730772972106, "num_tokens": 83556321.0, "step": 36475 }, { "entropy": 5.759917783737182, "epoch": 3.606168446026097, "grad_norm": 1.234375, "learning_rate": 0.0003744566612506497, "loss": 4.9429, "mean_token_accuracy": 0.2262440949678421, "num_tokens": 83566604.0, "step": 36480 }, { "entropy": 5.739758920669556, "epoch": 3.6066627125345985, "grad_norm": 1.2421875, "learning_rate": 0.00037442500489697666, "loss": 4.9451, "mean_token_accuracy": 0.22738515585660934, "num_tokens": 83578349.0, "step": 36485 }, { "entropy": 5.754388999938965, "epoch": 3.6071569790431, "grad_norm": 1.359375, "learning_rate": 0.0003743933460974331, "loss": 4.9611, "mean_token_accuracy": 0.22614455968141556, "num_tokens": 83589198.0, "step": 36490 }, { "entropy": 5.838378810882569, "epoch": 3.6076512455516014, "grad_norm": 1.125, "learning_rate": 0.00037436168485279777, "loss": 5.04, "mean_token_accuracy": 0.21892516762018205, "num_tokens": 83602076.0, "step": 36495 }, { "entropy": 5.772137975692749, "epoch": 3.6081455120601027, "grad_norm": 1.296875, "learning_rate": 0.00037433002116384957, "loss": 4.9256, "mean_token_accuracy": 0.22084573954343795, "num_tokens": 83613340.0, "step": 36500 }, { "entropy": 5.730703067779541, "epoch": 3.6086397785686044, "grad_norm": 1.2578125, "learning_rate": 0.00037429835503136744, "loss": 4.9938, "mean_token_accuracy": 0.22658517807722092, "num_tokens": 83624715.0, "step": 36505 }, { "entropy": 5.704571723937988, "epoch": 3.6091340450771057, "grad_norm": 1.3125, "learning_rate": 0.0003742666864561304, "loss": 5.012, "mean_token_accuracy": 0.22628515362739562, "num_tokens": 83635833.0, "step": 36510 }, { "entropy": 5.7348085880279545, "epoch": 3.609628311585607, "grad_norm": 1.234375, "learning_rate": 0.0003742350154389174, "loss": 4.9124, "mean_token_accuracy": 0.22448546290397645, "num_tokens": 83647281.0, "step": 36515 }, { "entropy": 5.803982067108154, "epoch": 3.610122578094108, "grad_norm": 1.234375, "learning_rate": 0.00037420334198050775, "loss": 4.9975, "mean_token_accuracy": 0.220235675573349, "num_tokens": 83658745.0, "step": 36520 }, { "entropy": 5.795662927627563, "epoch": 3.6106168446026095, "grad_norm": 1.25, "learning_rate": 0.0003741716660816804, "loss": 4.961, "mean_token_accuracy": 0.21857482343912124, "num_tokens": 83671580.0, "step": 36525 }, { "entropy": 5.7819664478302, "epoch": 3.611111111111111, "grad_norm": 1.1796875, "learning_rate": 0.00037413998774321475, "loss": 4.9926, "mean_token_accuracy": 0.2225994125008583, "num_tokens": 83682667.0, "step": 36530 }, { "entropy": 5.736459112167358, "epoch": 3.6116053776196124, "grad_norm": 1.3125, "learning_rate": 0.00037410830696588994, "loss": 4.8967, "mean_token_accuracy": 0.23010231852531432, "num_tokens": 83693276.0, "step": 36535 }, { "entropy": 5.764947509765625, "epoch": 3.612099644128114, "grad_norm": 1.203125, "learning_rate": 0.00037407662375048544, "loss": 5.0086, "mean_token_accuracy": 0.22436152398586273, "num_tokens": 83705304.0, "step": 36540 }, { "entropy": 5.740032386779785, "epoch": 3.6125939106366154, "grad_norm": 1.1484375, "learning_rate": 0.00037404493809778063, "loss": 4.9766, "mean_token_accuracy": 0.22539893686771392, "num_tokens": 83717166.0, "step": 36545 }, { "entropy": 5.747815895080566, "epoch": 3.6130881771451167, "grad_norm": 1.2890625, "learning_rate": 0.00037401325000855495, "loss": 4.9098, "mean_token_accuracy": 0.23014338612556456, "num_tokens": 83727322.0, "step": 36550 }, { "entropy": 5.766996717453003, "epoch": 3.613582443653618, "grad_norm": 1.171875, "learning_rate": 0.00037398155948358805, "loss": 4.9244, "mean_token_accuracy": 0.2272268533706665, "num_tokens": 83738721.0, "step": 36555 }, { "entropy": 5.712638425827026, "epoch": 3.614076710162119, "grad_norm": 1.171875, "learning_rate": 0.0003739498665236593, "loss": 4.9392, "mean_token_accuracy": 0.2322855442762375, "num_tokens": 83750622.0, "step": 36560 }, { "entropy": 5.795522165298462, "epoch": 3.614570976670621, "grad_norm": 1.234375, "learning_rate": 0.0003739181711295485, "loss": 5.0189, "mean_token_accuracy": 0.21720549762248992, "num_tokens": 83761755.0, "step": 36565 }, { "entropy": 5.692834186553955, "epoch": 3.615065243179122, "grad_norm": 1.2578125, "learning_rate": 0.00037388647330203545, "loss": 4.8672, "mean_token_accuracy": 0.23607228547334672, "num_tokens": 83772335.0, "step": 36570 }, { "entropy": 5.710109901428223, "epoch": 3.6155595096876234, "grad_norm": 1.125, "learning_rate": 0.0003738547730418999, "loss": 4.9937, "mean_token_accuracy": 0.2242111384868622, "num_tokens": 83784949.0, "step": 36575 }, { "entropy": 5.740633916854859, "epoch": 3.616053776196125, "grad_norm": 1.2421875, "learning_rate": 0.0003738230703499213, "loss": 4.973, "mean_token_accuracy": 0.222284696996212, "num_tokens": 83795555.0, "step": 36580 }, { "entropy": 5.757212352752686, "epoch": 3.6165480427046264, "grad_norm": 1.2109375, "learning_rate": 0.00037379136522688, "loss": 4.9287, "mean_token_accuracy": 0.22794184237718582, "num_tokens": 83806682.0, "step": 36585 }, { "entropy": 5.769719362258911, "epoch": 3.6170423092131276, "grad_norm": 1.21875, "learning_rate": 0.00037375965767355584, "loss": 4.9435, "mean_token_accuracy": 0.22778161913156508, "num_tokens": 83818485.0, "step": 36590 }, { "entropy": 5.639184093475341, "epoch": 3.617536575721629, "grad_norm": 1.25, "learning_rate": 0.0003737279476907287, "loss": 4.873, "mean_token_accuracy": 0.23780063539743423, "num_tokens": 83829757.0, "step": 36595 }, { "entropy": 5.725658893585205, "epoch": 3.6180308422301306, "grad_norm": 1.1796875, "learning_rate": 0.00037369623527917876, "loss": 4.9775, "mean_token_accuracy": 0.22660067081451415, "num_tokens": 83841827.0, "step": 36600 }, { "entropy": 5.669194507598877, "epoch": 3.618525108738632, "grad_norm": 1.171875, "learning_rate": 0.0003736645204396861, "loss": 4.8136, "mean_token_accuracy": 0.23405515104532243, "num_tokens": 83852471.0, "step": 36605 }, { "entropy": 5.736182832717896, "epoch": 3.619019375247133, "grad_norm": 1.3125, "learning_rate": 0.0003736328031730309, "loss": 4.9097, "mean_token_accuracy": 0.23059954792261123, "num_tokens": 83864322.0, "step": 36610 }, { "entropy": 5.789630556106568, "epoch": 3.619513641755635, "grad_norm": 1.1875, "learning_rate": 0.0003736010834799936, "loss": 5.0008, "mean_token_accuracy": 0.22216322124004365, "num_tokens": 83875286.0, "step": 36615 }, { "entropy": 5.709139823913574, "epoch": 3.620007908264136, "grad_norm": 1.2109375, "learning_rate": 0.0003735693613613542, "loss": 4.8747, "mean_token_accuracy": 0.23301409780979157, "num_tokens": 83887794.0, "step": 36620 }, { "entropy": 5.766672945022583, "epoch": 3.6205021747726374, "grad_norm": 1.09375, "learning_rate": 0.0003735376368178932, "loss": 4.9641, "mean_token_accuracy": 0.2260563775897026, "num_tokens": 83898644.0, "step": 36625 }, { "entropy": 5.761818790435791, "epoch": 3.6209964412811386, "grad_norm": 1.2265625, "learning_rate": 0.0003735059098503911, "loss": 5.0192, "mean_token_accuracy": 0.2149218052625656, "num_tokens": 83909944.0, "step": 36630 }, { "entropy": 5.75932240486145, "epoch": 3.6214907077896403, "grad_norm": 1.25, "learning_rate": 0.0003734741804596284, "loss": 4.9809, "mean_token_accuracy": 0.22384252846240998, "num_tokens": 83920928.0, "step": 36635 }, { "entropy": 5.725000858306885, "epoch": 3.6219849742981416, "grad_norm": 1.2578125, "learning_rate": 0.0003734424486463855, "loss": 4.8849, "mean_token_accuracy": 0.23618270009756087, "num_tokens": 83933519.0, "step": 36640 }, { "entropy": 5.808859968185425, "epoch": 3.622479240806643, "grad_norm": 1.1484375, "learning_rate": 0.00037341071441144316, "loss": 5.0408, "mean_token_accuracy": 0.22432909905910492, "num_tokens": 83946933.0, "step": 36645 }, { "entropy": 5.735810136795044, "epoch": 3.6229735073151446, "grad_norm": 1.328125, "learning_rate": 0.0003733789777555819, "loss": 4.9351, "mean_token_accuracy": 0.2275382786989212, "num_tokens": 83957858.0, "step": 36650 }, { "entropy": 5.730549383163452, "epoch": 3.623467773823646, "grad_norm": 1.203125, "learning_rate": 0.00037334723867958256, "loss": 4.9213, "mean_token_accuracy": 0.23089100867509843, "num_tokens": 83968363.0, "step": 36655 }, { "entropy": 5.751165103912354, "epoch": 3.623962040332147, "grad_norm": 1.2265625, "learning_rate": 0.0003733154971842259, "loss": 4.9118, "mean_token_accuracy": 0.23166271150112153, "num_tokens": 83978719.0, "step": 36660 }, { "entropy": 5.709116411209107, "epoch": 3.6244563068406483, "grad_norm": 1.2421875, "learning_rate": 0.00037328375327029274, "loss": 4.9116, "mean_token_accuracy": 0.225031578540802, "num_tokens": 83990195.0, "step": 36665 }, { "entropy": 5.719848680496216, "epoch": 3.6249505733491496, "grad_norm": 1.15625, "learning_rate": 0.00037325200693856406, "loss": 5.0005, "mean_token_accuracy": 0.21995290517807006, "num_tokens": 84002068.0, "step": 36670 }, { "entropy": 5.713297176361084, "epoch": 3.6254448398576513, "grad_norm": 1.1328125, "learning_rate": 0.0003732202581898206, "loss": 4.9513, "mean_token_accuracy": 0.2229781463742256, "num_tokens": 84013405.0, "step": 36675 }, { "entropy": 5.812728071212769, "epoch": 3.6259391063661526, "grad_norm": 1.1953125, "learning_rate": 0.0003731885070248437, "loss": 5.0576, "mean_token_accuracy": 0.2140640303492546, "num_tokens": 84025650.0, "step": 36680 }, { "entropy": 5.712250995635986, "epoch": 3.6264333728746543, "grad_norm": 1.1796875, "learning_rate": 0.00037315675344441426, "loss": 4.8682, "mean_token_accuracy": 0.23593227863311766, "num_tokens": 84036753.0, "step": 36685 }, { "entropy": 5.833469343185425, "epoch": 3.6269276393831555, "grad_norm": 1.2578125, "learning_rate": 0.0003731249974493135, "loss": 5.0357, "mean_token_accuracy": 0.22362569719552994, "num_tokens": 84049082.0, "step": 36690 }, { "entropy": 5.787313032150268, "epoch": 3.627421905891657, "grad_norm": 1.2265625, "learning_rate": 0.00037309323904032254, "loss": 4.9753, "mean_token_accuracy": 0.21836165487766265, "num_tokens": 84059471.0, "step": 36695 }, { "entropy": 5.728457403182984, "epoch": 3.627916172400158, "grad_norm": 1.25, "learning_rate": 0.0003730614782182226, "loss": 4.9877, "mean_token_accuracy": 0.2323715940117836, "num_tokens": 84071475.0, "step": 36700 }, { "entropy": 5.754220294952392, "epoch": 3.6284104389086593, "grad_norm": 1.2109375, "learning_rate": 0.0003730297149837952, "loss": 4.9933, "mean_token_accuracy": 0.2199402153491974, "num_tokens": 84082465.0, "step": 36705 }, { "entropy": 5.746408700942993, "epoch": 3.628904705417161, "grad_norm": 1.4375, "learning_rate": 0.0003729979493378215, "loss": 4.9136, "mean_token_accuracy": 0.22645459920167924, "num_tokens": 84093845.0, "step": 36710 }, { "entropy": 5.798669099807739, "epoch": 3.6293989719256623, "grad_norm": 1.2734375, "learning_rate": 0.00037296618128108316, "loss": 4.9607, "mean_token_accuracy": 0.2252052053809166, "num_tokens": 84105865.0, "step": 36715 }, { "entropy": 5.748604822158813, "epoch": 3.6298932384341636, "grad_norm": 1.25, "learning_rate": 0.00037293441081436154, "loss": 4.9699, "mean_token_accuracy": 0.2211304634809494, "num_tokens": 84116376.0, "step": 36720 }, { "entropy": 5.6996846199035645, "epoch": 3.6303875049426653, "grad_norm": 1.25, "learning_rate": 0.0003729026379384381, "loss": 4.8853, "mean_token_accuracy": 0.23264809101819992, "num_tokens": 84126806.0, "step": 36725 }, { "entropy": 5.780883121490478, "epoch": 3.6308817714511665, "grad_norm": 1.234375, "learning_rate": 0.0003728708626540948, "loss": 4.9801, "mean_token_accuracy": 0.2275504469871521, "num_tokens": 84136750.0, "step": 36730 }, { "entropy": 5.7800546169281, "epoch": 3.631376037959668, "grad_norm": 1.234375, "learning_rate": 0.00037283908496211295, "loss": 5.0488, "mean_token_accuracy": 0.21009242236614228, "num_tokens": 84148614.0, "step": 36735 }, { "entropy": 5.821066570281983, "epoch": 3.631870304468169, "grad_norm": 1.296875, "learning_rate": 0.0003728073048632744, "loss": 5.0246, "mean_token_accuracy": 0.21641982793807985, "num_tokens": 84160347.0, "step": 36740 }, { "entropy": 5.784425497055054, "epoch": 3.6323645709766708, "grad_norm": 1.25, "learning_rate": 0.00037277552235836104, "loss": 5.0054, "mean_token_accuracy": 0.22381488382816314, "num_tokens": 84172240.0, "step": 36745 }, { "entropy": 5.791566562652588, "epoch": 3.632858837485172, "grad_norm": 1.1484375, "learning_rate": 0.00037274373744815466, "loss": 4.9852, "mean_token_accuracy": 0.22311032712459564, "num_tokens": 84184050.0, "step": 36750 }, { "entropy": 5.724491453170776, "epoch": 3.6333531039936733, "grad_norm": 1.2109375, "learning_rate": 0.0003727119501334371, "loss": 4.9491, "mean_token_accuracy": 0.2268210083246231, "num_tokens": 84194661.0, "step": 36755 }, { "entropy": 5.745427799224854, "epoch": 3.633847370502175, "grad_norm": 1.234375, "learning_rate": 0.00037268016041499055, "loss": 4.9577, "mean_token_accuracy": 0.22544464468955994, "num_tokens": 84205677.0, "step": 36760 }, { "entropy": 5.789601802825928, "epoch": 3.6343416370106763, "grad_norm": 1.1953125, "learning_rate": 0.0003726483682935968, "loss": 4.9446, "mean_token_accuracy": 0.22020726054906845, "num_tokens": 84217342.0, "step": 36765 }, { "entropy": 5.7664214134216305, "epoch": 3.6348359035191775, "grad_norm": 1.2265625, "learning_rate": 0.00037261657377003803, "loss": 4.978, "mean_token_accuracy": 0.2184204414486885, "num_tokens": 84229637.0, "step": 36770 }, { "entropy": 5.760247993469238, "epoch": 3.6353301700276788, "grad_norm": 1.1875, "learning_rate": 0.0003725847768450964, "loss": 5.0226, "mean_token_accuracy": 0.22189818173646927, "num_tokens": 84241156.0, "step": 36775 }, { "entropy": 5.831021165847778, "epoch": 3.63582443653618, "grad_norm": 1.2109375, "learning_rate": 0.0003725529775195542, "loss": 4.9953, "mean_token_accuracy": 0.22493703812360763, "num_tokens": 84253172.0, "step": 36780 }, { "entropy": 5.759899091720581, "epoch": 3.6363187030446817, "grad_norm": 1.25, "learning_rate": 0.00037252117579419355, "loss": 4.9107, "mean_token_accuracy": 0.22540205270051955, "num_tokens": 84265349.0, "step": 36785 }, { "entropy": 5.659424304962158, "epoch": 3.636812969553183, "grad_norm": 1.2578125, "learning_rate": 0.00037248937166979687, "loss": 4.8948, "mean_token_accuracy": 0.22992639392614364, "num_tokens": 84275931.0, "step": 36790 }, { "entropy": 5.740987730026245, "epoch": 3.6373072360616847, "grad_norm": 1.2265625, "learning_rate": 0.0003724575651471465, "loss": 4.9773, "mean_token_accuracy": 0.22295117676258086, "num_tokens": 84286502.0, "step": 36795 }, { "entropy": 5.836364650726319, "epoch": 3.637801502570186, "grad_norm": 1.203125, "learning_rate": 0.0003724257562270249, "loss": 5.0298, "mean_token_accuracy": 0.210837984085083, "num_tokens": 84297748.0, "step": 36800 }, { "entropy": 5.780948972702026, "epoch": 3.6382957690786872, "grad_norm": 1.3203125, "learning_rate": 0.00037239394491021463, "loss": 5.0167, "mean_token_accuracy": 0.22192592322826385, "num_tokens": 84309733.0, "step": 36805 }, { "entropy": 5.799102735519409, "epoch": 3.6387900355871885, "grad_norm": 1.265625, "learning_rate": 0.00037236213119749823, "loss": 5.0421, "mean_token_accuracy": 0.2177009865641594, "num_tokens": 84320606.0, "step": 36810 }, { "entropy": 5.776124715805054, "epoch": 3.6392843020956898, "grad_norm": 1.1640625, "learning_rate": 0.00037233031508965823, "loss": 4.9362, "mean_token_accuracy": 0.22778684943914412, "num_tokens": 84331149.0, "step": 36815 }, { "entropy": 5.794047880172729, "epoch": 3.6397785686041915, "grad_norm": 1.265625, "learning_rate": 0.0003722984965874774, "loss": 4.9779, "mean_token_accuracy": 0.22784479409456254, "num_tokens": 84343016.0, "step": 36820 }, { "entropy": 5.7488563537597654, "epoch": 3.6402728351126927, "grad_norm": 1.1796875, "learning_rate": 0.0003722666756917385, "loss": 5.0115, "mean_token_accuracy": 0.2191008672118187, "num_tokens": 84354846.0, "step": 36825 }, { "entropy": 5.762816095352173, "epoch": 3.640767101621194, "grad_norm": 1.1875, "learning_rate": 0.0003722348524032242, "loss": 4.9667, "mean_token_accuracy": 0.2260129541158676, "num_tokens": 84366698.0, "step": 36830 }, { "entropy": 5.772870302200317, "epoch": 3.6412613681296957, "grad_norm": 1.1640625, "learning_rate": 0.00037220302672271756, "loss": 4.9675, "mean_token_accuracy": 0.2290659725666046, "num_tokens": 84378186.0, "step": 36835 }, { "entropy": 5.796053743362426, "epoch": 3.641755634638197, "grad_norm": 1.2109375, "learning_rate": 0.00037217119865100127, "loss": 5.038, "mean_token_accuracy": 0.21514128297567367, "num_tokens": 84390301.0, "step": 36840 }, { "entropy": 5.723567056655884, "epoch": 3.642249901146698, "grad_norm": 1.265625, "learning_rate": 0.00037213936818885853, "loss": 4.9809, "mean_token_accuracy": 0.22278282195329666, "num_tokens": 84401134.0, "step": 36845 }, { "entropy": 5.750906276702881, "epoch": 3.6427441676551995, "grad_norm": 1.2421875, "learning_rate": 0.00037210753533707214, "loss": 4.9521, "mean_token_accuracy": 0.23028752356767654, "num_tokens": 84411734.0, "step": 36850 }, { "entropy": 5.8296699047088625, "epoch": 3.643238434163701, "grad_norm": 1.328125, "learning_rate": 0.00037207570009642536, "loss": 5.0533, "mean_token_accuracy": 0.2112957000732422, "num_tokens": 84422952.0, "step": 36855 }, { "entropy": 5.767107009887695, "epoch": 3.6437327006722025, "grad_norm": 1.25, "learning_rate": 0.0003720438624677014, "loss": 4.9075, "mean_token_accuracy": 0.23190695196390151, "num_tokens": 84433048.0, "step": 36860 }, { "entropy": 5.752732419967652, "epoch": 3.6442269671807037, "grad_norm": 1.1875, "learning_rate": 0.0003720120224516832, "loss": 4.9811, "mean_token_accuracy": 0.22363260090351106, "num_tokens": 84443318.0, "step": 36865 }, { "entropy": 5.704191446304321, "epoch": 3.6447212336892054, "grad_norm": 1.1953125, "learning_rate": 0.0003719801800491543, "loss": 4.947, "mean_token_accuracy": 0.22531927824020387, "num_tokens": 84453441.0, "step": 36870 }, { "entropy": 5.716620969772339, "epoch": 3.6452155001977067, "grad_norm": 1.234375, "learning_rate": 0.00037194833526089797, "loss": 4.9678, "mean_token_accuracy": 0.22396662533283235, "num_tokens": 84465290.0, "step": 36875 }, { "entropy": 5.80748610496521, "epoch": 3.645709766706208, "grad_norm": 1.203125, "learning_rate": 0.0003719164880876975, "loss": 5.0044, "mean_token_accuracy": 0.22186266928911208, "num_tokens": 84476482.0, "step": 36880 }, { "entropy": 5.757922983169555, "epoch": 3.646204033214709, "grad_norm": 1.2265625, "learning_rate": 0.0003718846385303363, "loss": 4.8988, "mean_token_accuracy": 0.2323881357908249, "num_tokens": 84488641.0, "step": 36885 }, { "entropy": 5.704709720611572, "epoch": 3.646698299723211, "grad_norm": 1.25, "learning_rate": 0.0003718527865895981, "loss": 5.0056, "mean_token_accuracy": 0.22506581842899323, "num_tokens": 84501967.0, "step": 36890 }, { "entropy": 5.7624289989471436, "epoch": 3.647192566231712, "grad_norm": 1.203125, "learning_rate": 0.0003718209322662662, "loss": 4.9682, "mean_token_accuracy": 0.21895689368247986, "num_tokens": 84513982.0, "step": 36895 }, { "entropy": 5.796509742736816, "epoch": 3.6476868327402134, "grad_norm": 1.265625, "learning_rate": 0.0003717890755611244, "loss": 4.9274, "mean_token_accuracy": 0.22604838907718658, "num_tokens": 84523395.0, "step": 36900 }, { "entropy": 5.71971492767334, "epoch": 3.648181099248715, "grad_norm": 1.2265625, "learning_rate": 0.00037175721647495635, "loss": 4.9223, "mean_token_accuracy": 0.23434487134218215, "num_tokens": 84536019.0, "step": 36905 }, { "entropy": 5.719699096679688, "epoch": 3.6486753657572164, "grad_norm": 1.15625, "learning_rate": 0.0003717253550085458, "loss": 4.9581, "mean_token_accuracy": 0.22978586405515672, "num_tokens": 84546882.0, "step": 36910 }, { "entropy": 5.787475728988648, "epoch": 3.6491696322657177, "grad_norm": 1.0546875, "learning_rate": 0.00037169349116267643, "loss": 4.9953, "mean_token_accuracy": 0.22336759120225907, "num_tokens": 84560195.0, "step": 36915 }, { "entropy": 5.794946718215942, "epoch": 3.649663898774219, "grad_norm": 1.2109375, "learning_rate": 0.00037166162493813224, "loss": 5.0513, "mean_token_accuracy": 0.2212998613715172, "num_tokens": 84573165.0, "step": 36920 }, { "entropy": 5.738963603973389, "epoch": 3.65015816528272, "grad_norm": 1.2890625, "learning_rate": 0.00037162975633569704, "loss": 4.8244, "mean_token_accuracy": 0.23829384297132492, "num_tokens": 84584871.0, "step": 36925 }, { "entropy": 5.790006494522094, "epoch": 3.650652431791222, "grad_norm": 1.2578125, "learning_rate": 0.00037159788535615486, "loss": 5.0284, "mean_token_accuracy": 0.21869076788425446, "num_tokens": 84596122.0, "step": 36930 }, { "entropy": 5.764120960235596, "epoch": 3.651146698299723, "grad_norm": 1.21875, "learning_rate": 0.00037156601200028975, "loss": 4.9929, "mean_token_accuracy": 0.22429582178592683, "num_tokens": 84607432.0, "step": 36935 }, { "entropy": 5.732975912094116, "epoch": 3.651640964808225, "grad_norm": 1.2578125, "learning_rate": 0.0003715341362688857, "loss": 4.8822, "mean_token_accuracy": 0.22737666964530945, "num_tokens": 84618440.0, "step": 36940 }, { "entropy": 5.699876165390014, "epoch": 3.652135231316726, "grad_norm": 1.2734375, "learning_rate": 0.0003715022581627269, "loss": 4.8787, "mean_token_accuracy": 0.234268656373024, "num_tokens": 84629173.0, "step": 36945 }, { "entropy": 5.707715606689453, "epoch": 3.6526294978252274, "grad_norm": 1.2265625, "learning_rate": 0.0003714703776825976, "loss": 4.8548, "mean_token_accuracy": 0.22917697429656983, "num_tokens": 84639770.0, "step": 36950 }, { "entropy": 5.744900131225586, "epoch": 3.6531237643337287, "grad_norm": 1.3046875, "learning_rate": 0.0003714384948292821, "loss": 4.9788, "mean_token_accuracy": 0.22067993879318237, "num_tokens": 84651405.0, "step": 36955 }, { "entropy": 5.719801235198974, "epoch": 3.65361803084223, "grad_norm": 1.2265625, "learning_rate": 0.0003714066096035646, "loss": 4.8434, "mean_token_accuracy": 0.23817473649978638, "num_tokens": 84663136.0, "step": 36960 }, { "entropy": 5.731724977493286, "epoch": 3.6541122973507316, "grad_norm": 1.296875, "learning_rate": 0.0003713747220062296, "loss": 4.8956, "mean_token_accuracy": 0.22873106449842454, "num_tokens": 84675432.0, "step": 36965 }, { "entropy": 5.712669610977173, "epoch": 3.654606563859233, "grad_norm": 1.171875, "learning_rate": 0.0003713428320380614, "loss": 4.9072, "mean_token_accuracy": 0.22904399633407593, "num_tokens": 84686961.0, "step": 36970 }, { "entropy": 5.722235250473022, "epoch": 3.655100830367734, "grad_norm": 1.265625, "learning_rate": 0.0003713109396998447, "loss": 4.8738, "mean_token_accuracy": 0.23667887449264527, "num_tokens": 84697316.0, "step": 36975 }, { "entropy": 5.758138847351074, "epoch": 3.655595096876236, "grad_norm": 1.140625, "learning_rate": 0.00037127904499236386, "loss": 5.0446, "mean_token_accuracy": 0.21933169215917586, "num_tokens": 84709228.0, "step": 36980 }, { "entropy": 5.781071138381958, "epoch": 3.656089363384737, "grad_norm": 1.234375, "learning_rate": 0.00037124714791640363, "loss": 4.9407, "mean_token_accuracy": 0.22102712988853454, "num_tokens": 84721300.0, "step": 36985 }, { "entropy": 5.780516338348389, "epoch": 3.6565836298932384, "grad_norm": 1.296875, "learning_rate": 0.00037121524847274855, "loss": 4.9554, "mean_token_accuracy": 0.2265076071023941, "num_tokens": 84732264.0, "step": 36990 }, { "entropy": 5.7190204620361325, "epoch": 3.6570778964017396, "grad_norm": 1.203125, "learning_rate": 0.0003711833466621835, "loss": 4.9215, "mean_token_accuracy": 0.22608231455087663, "num_tokens": 84743636.0, "step": 36995 }, { "entropy": 5.714638423919678, "epoch": 3.6575721629102413, "grad_norm": 1.2890625, "learning_rate": 0.00037115144248549324, "loss": 4.927, "mean_token_accuracy": 0.22801250070333481, "num_tokens": 84754696.0, "step": 37000 }, { "entropy": 5.840717077255249, "epoch": 3.6580664294187426, "grad_norm": 1.2578125, "learning_rate": 0.00037111953594346256, "loss": 4.991, "mean_token_accuracy": 0.22281605303287505, "num_tokens": 84766026.0, "step": 37005 }, { "entropy": 5.833309268951416, "epoch": 3.658560695927244, "grad_norm": 1.21875, "learning_rate": 0.00037108762703687634, "loss": 4.9702, "mean_token_accuracy": 0.2319195955991745, "num_tokens": 84777265.0, "step": 37010 }, { "entropy": 5.718849849700928, "epoch": 3.6590549624357456, "grad_norm": 1.234375, "learning_rate": 0.0003710557157665196, "loss": 4.9278, "mean_token_accuracy": 0.22437967658042907, "num_tokens": 84787715.0, "step": 37015 }, { "entropy": 5.788674068450928, "epoch": 3.659549228944247, "grad_norm": 1.2890625, "learning_rate": 0.0003710238021331773, "loss": 5.0279, "mean_token_accuracy": 0.2233757957816124, "num_tokens": 84798874.0, "step": 37020 }, { "entropy": 5.79263858795166, "epoch": 3.660043495452748, "grad_norm": 1.1875, "learning_rate": 0.0003709918861376346, "loss": 5.049, "mean_token_accuracy": 0.2145603269338608, "num_tokens": 84810072.0, "step": 37025 }, { "entropy": 5.81492805480957, "epoch": 3.6605377619612494, "grad_norm": 1.3125, "learning_rate": 0.00037095996778067664, "loss": 4.9497, "mean_token_accuracy": 0.22933973520994186, "num_tokens": 84820831.0, "step": 37030 }, { "entropy": 5.72659010887146, "epoch": 3.6610320284697506, "grad_norm": 1.1484375, "learning_rate": 0.0003709280470630886, "loss": 4.8383, "mean_token_accuracy": 0.23568262606859208, "num_tokens": 84832329.0, "step": 37035 }, { "entropy": 5.780866861343384, "epoch": 3.6615262949782523, "grad_norm": 1.1640625, "learning_rate": 0.0003708961239856557, "loss": 4.9859, "mean_token_accuracy": 0.2191890448331833, "num_tokens": 84844239.0, "step": 37040 }, { "entropy": 5.74135308265686, "epoch": 3.6620205614867536, "grad_norm": 1.1328125, "learning_rate": 0.00037086419854916327, "loss": 4.9537, "mean_token_accuracy": 0.22821117639541627, "num_tokens": 84855939.0, "step": 37045 }, { "entropy": 5.74976077079773, "epoch": 3.6625148279952553, "grad_norm": 1.203125, "learning_rate": 0.0003708322707543967, "loss": 4.9398, "mean_token_accuracy": 0.22210075408220292, "num_tokens": 84867170.0, "step": 37050 }, { "entropy": 5.757513380050659, "epoch": 3.6630090945037566, "grad_norm": 1.375, "learning_rate": 0.00037080034060214134, "loss": 4.9644, "mean_token_accuracy": 0.22816435843706132, "num_tokens": 84877986.0, "step": 37055 }, { "entropy": 5.708131408691406, "epoch": 3.663503361012258, "grad_norm": 1.1796875, "learning_rate": 0.0003707684080931827, "loss": 4.8703, "mean_token_accuracy": 0.23605380207300186, "num_tokens": 84888795.0, "step": 37060 }, { "entropy": 5.696499824523926, "epoch": 3.663997627520759, "grad_norm": 1.1953125, "learning_rate": 0.00037073647322830657, "loss": 4.9281, "mean_token_accuracy": 0.23496715873479843, "num_tokens": 84900569.0, "step": 37065 }, { "entropy": 5.76435604095459, "epoch": 3.6644918940292603, "grad_norm": 1.3515625, "learning_rate": 0.0003707045360082982, "loss": 5.0075, "mean_token_accuracy": 0.2246442422270775, "num_tokens": 84912018.0, "step": 37070 }, { "entropy": 5.836646318435669, "epoch": 3.664986160537762, "grad_norm": 1.328125, "learning_rate": 0.0003706725964339434, "loss": 4.9977, "mean_token_accuracy": 0.21550026386976243, "num_tokens": 84923088.0, "step": 37075 }, { "entropy": 5.756434488296509, "epoch": 3.6654804270462633, "grad_norm": 1.1796875, "learning_rate": 0.000370640654506028, "loss": 4.9261, "mean_token_accuracy": 0.23003214001655578, "num_tokens": 84933838.0, "step": 37080 }, { "entropy": 5.717120599746704, "epoch": 3.6659746935547646, "grad_norm": 1.2734375, "learning_rate": 0.0003706087102253375, "loss": 4.9039, "mean_token_accuracy": 0.22759612202644347, "num_tokens": 84945208.0, "step": 37085 }, { "entropy": 5.651730394363403, "epoch": 3.6664689600632663, "grad_norm": 1.109375, "learning_rate": 0.000370576763592658, "loss": 4.8715, "mean_token_accuracy": 0.2374713197350502, "num_tokens": 84956224.0, "step": 37090 }, { "entropy": 5.781054735183716, "epoch": 3.6669632265717675, "grad_norm": 1.203125, "learning_rate": 0.0003705448146087752, "loss": 5.0098, "mean_token_accuracy": 0.2258610710501671, "num_tokens": 84967507.0, "step": 37095 }, { "entropy": 5.738318157196045, "epoch": 3.667457493080269, "grad_norm": 1.1875, "learning_rate": 0.00037051286327447527, "loss": 4.9162, "mean_token_accuracy": 0.23021315634250641, "num_tokens": 84979578.0, "step": 37100 }, { "entropy": 5.843438291549683, "epoch": 3.66795175958877, "grad_norm": 1.140625, "learning_rate": 0.0003704809095905439, "loss": 5.0936, "mean_token_accuracy": 0.21126451194286347, "num_tokens": 84990875.0, "step": 37105 }, { "entropy": 5.731909227371216, "epoch": 3.6684460260972718, "grad_norm": 1.34375, "learning_rate": 0.00037044895355776747, "loss": 4.8881, "mean_token_accuracy": 0.2333762988448143, "num_tokens": 85001787.0, "step": 37110 }, { "entropy": 5.774100637435913, "epoch": 3.668940292605773, "grad_norm": 1.2109375, "learning_rate": 0.000370416995176932, "loss": 5.0295, "mean_token_accuracy": 0.2164655178785324, "num_tokens": 85015189.0, "step": 37115 }, { "entropy": 5.7636645317077635, "epoch": 3.6694345591142743, "grad_norm": 1.2734375, "learning_rate": 0.0003703850344488236, "loss": 4.9601, "mean_token_accuracy": 0.22757385969161986, "num_tokens": 85026267.0, "step": 37120 }, { "entropy": 5.72706937789917, "epoch": 3.669928825622776, "grad_norm": 1.1796875, "learning_rate": 0.00037035307137422855, "loss": 4.9252, "mean_token_accuracy": 0.23113259971141814, "num_tokens": 85038296.0, "step": 37125 }, { "entropy": 5.73038535118103, "epoch": 3.6704230921312773, "grad_norm": 1.21875, "learning_rate": 0.00037032110595393313, "loss": 4.9701, "mean_token_accuracy": 0.2260370820760727, "num_tokens": 85050518.0, "step": 37130 }, { "entropy": 5.829587984085083, "epoch": 3.6709173586397785, "grad_norm": 1.3203125, "learning_rate": 0.00037028913818872375, "loss": 4.9584, "mean_token_accuracy": 0.2186059445142746, "num_tokens": 85062002.0, "step": 37135 }, { "entropy": 5.807325029373169, "epoch": 3.67141162514828, "grad_norm": 1.265625, "learning_rate": 0.00037025716807938676, "loss": 4.9969, "mean_token_accuracy": 0.22650517225265504, "num_tokens": 85072818.0, "step": 37140 }, { "entropy": 5.677710151672363, "epoch": 3.6719058916567815, "grad_norm": 1.265625, "learning_rate": 0.0003702251956267087, "loss": 4.8968, "mean_token_accuracy": 0.23530446141958236, "num_tokens": 85083747.0, "step": 37145 }, { "entropy": 5.734698104858398, "epoch": 3.6724001581652828, "grad_norm": 1.1796875, "learning_rate": 0.000370193220831476, "loss": 4.9097, "mean_token_accuracy": 0.23229578137397766, "num_tokens": 85095546.0, "step": 37150 }, { "entropy": 5.779178285598755, "epoch": 3.672894424673784, "grad_norm": 1.3671875, "learning_rate": 0.00037016124369447533, "loss": 4.9641, "mean_token_accuracy": 0.21975258886814117, "num_tokens": 85105891.0, "step": 37155 }, { "entropy": 5.797160243988037, "epoch": 3.6733886911822857, "grad_norm": 1.1171875, "learning_rate": 0.0003701292642164933, "loss": 4.9734, "mean_token_accuracy": 0.21880849003791808, "num_tokens": 85118378.0, "step": 37160 }, { "entropy": 5.797689008712768, "epoch": 3.673882957690787, "grad_norm": 1.2109375, "learning_rate": 0.00037009728239831665, "loss": 5.023, "mean_token_accuracy": 0.21879465878009796, "num_tokens": 85130111.0, "step": 37165 }, { "entropy": 5.801438522338867, "epoch": 3.6743772241992882, "grad_norm": 1.375, "learning_rate": 0.0003700652982407321, "loss": 5.0113, "mean_token_accuracy": 0.21810525357723237, "num_tokens": 85140037.0, "step": 37170 }, { "entropy": 5.744135761260987, "epoch": 3.6748714907077895, "grad_norm": 1.2265625, "learning_rate": 0.0003700333117445264, "loss": 4.8982, "mean_token_accuracy": 0.23409973382949828, "num_tokens": 85152398.0, "step": 37175 }, { "entropy": 5.776797533035278, "epoch": 3.6753657572162908, "grad_norm": 1.1171875, "learning_rate": 0.00037000132291048655, "loss": 5.0128, "mean_token_accuracy": 0.21632560938596726, "num_tokens": 85164793.0, "step": 37180 }, { "entropy": 5.7823755741119385, "epoch": 3.6758600237247925, "grad_norm": 1.2890625, "learning_rate": 0.00036996933173939935, "loss": 5.021, "mean_token_accuracy": 0.21646941155195237, "num_tokens": 85176291.0, "step": 37185 }, { "entropy": 5.745422744750977, "epoch": 3.6763542902332937, "grad_norm": 1.2109375, "learning_rate": 0.0003699373382320519, "loss": 4.9706, "mean_token_accuracy": 0.2210451766848564, "num_tokens": 85188706.0, "step": 37190 }, { "entropy": 5.805277013778687, "epoch": 3.6768485567417954, "grad_norm": 1.25, "learning_rate": 0.00036990534238923124, "loss": 5.0256, "mean_token_accuracy": 0.22470012158155442, "num_tokens": 85200771.0, "step": 37195 }, { "entropy": 5.7734715938568115, "epoch": 3.6773428232502967, "grad_norm": 1.2421875, "learning_rate": 0.00036987334421172434, "loss": 5.0088, "mean_token_accuracy": 0.22506896406412125, "num_tokens": 85211209.0, "step": 37200 }, { "entropy": 5.74662709236145, "epoch": 3.677837089758798, "grad_norm": 1.2421875, "learning_rate": 0.00036984134370031846, "loss": 4.9055, "mean_token_accuracy": 0.2316187709569931, "num_tokens": 85222370.0, "step": 37205 }, { "entropy": 5.730053043365478, "epoch": 3.6783313562672992, "grad_norm": 1.140625, "learning_rate": 0.0003698093408558009, "loss": 4.8965, "mean_token_accuracy": 0.2215649291872978, "num_tokens": 85234210.0, "step": 37210 }, { "entropy": 5.779282426834106, "epoch": 3.6788256227758005, "grad_norm": 1.296875, "learning_rate": 0.0003697773356789588, "loss": 4.958, "mean_token_accuracy": 0.23065546303987502, "num_tokens": 85245506.0, "step": 37215 }, { "entropy": 5.768721628189087, "epoch": 3.679319889284302, "grad_norm": 1.3125, "learning_rate": 0.00036974532817057946, "loss": 4.9315, "mean_token_accuracy": 0.2294473320245743, "num_tokens": 85256904.0, "step": 37220 }, { "entropy": 5.733954048156738, "epoch": 3.6798141557928035, "grad_norm": 1.1796875, "learning_rate": 0.0003697133183314505, "loss": 4.9462, "mean_token_accuracy": 0.2240203708410263, "num_tokens": 85268660.0, "step": 37225 }, { "entropy": 5.738315296173096, "epoch": 3.6803084223013047, "grad_norm": 1.1875, "learning_rate": 0.0003696813061623591, "loss": 4.9875, "mean_token_accuracy": 0.22494334876537322, "num_tokens": 85280292.0, "step": 37230 }, { "entropy": 5.806431484222412, "epoch": 3.6808026888098064, "grad_norm": 1.265625, "learning_rate": 0.00036964929166409294, "loss": 4.9737, "mean_token_accuracy": 0.22737062424421312, "num_tokens": 85292029.0, "step": 37235 }, { "entropy": 5.704042959213257, "epoch": 3.6812969553183077, "grad_norm": 1.140625, "learning_rate": 0.00036961727483743957, "loss": 4.8614, "mean_token_accuracy": 0.22255279272794723, "num_tokens": 85304350.0, "step": 37240 }, { "entropy": 5.72512583732605, "epoch": 3.681791221826809, "grad_norm": 1.1953125, "learning_rate": 0.00036958525568318645, "loss": 4.9615, "mean_token_accuracy": 0.2307597354054451, "num_tokens": 85315646.0, "step": 37245 }, { "entropy": 5.847604465484619, "epoch": 3.68228548833531, "grad_norm": 1.1328125, "learning_rate": 0.0003695532342021214, "loss": 4.9726, "mean_token_accuracy": 0.2253118634223938, "num_tokens": 85328779.0, "step": 37250 }, { "entropy": 5.723974180221558, "epoch": 3.682779754843812, "grad_norm": 1.15625, "learning_rate": 0.0003695212103950321, "loss": 4.8827, "mean_token_accuracy": 0.2334430232644081, "num_tokens": 85339916.0, "step": 37255 }, { "entropy": 5.757748174667358, "epoch": 3.683274021352313, "grad_norm": 1.2578125, "learning_rate": 0.00036948918426270646, "loss": 5.0362, "mean_token_accuracy": 0.2162937968969345, "num_tokens": 85351381.0, "step": 37260 }, { "entropy": 5.749101781845093, "epoch": 3.6837682878608144, "grad_norm": 1.2265625, "learning_rate": 0.00036945715580593213, "loss": 4.984, "mean_token_accuracy": 0.21774595528841018, "num_tokens": 85362166.0, "step": 37265 }, { "entropy": 5.726912593841552, "epoch": 3.684262554369316, "grad_norm": 1.2109375, "learning_rate": 0.0003694251250254971, "loss": 4.8997, "mean_token_accuracy": 0.23004893958568573, "num_tokens": 85373626.0, "step": 37270 }, { "entropy": 5.781505012512207, "epoch": 3.6847568208778174, "grad_norm": 1.125, "learning_rate": 0.00036939309192218946, "loss": 4.9645, "mean_token_accuracy": 0.21542072147130967, "num_tokens": 85385217.0, "step": 37275 }, { "entropy": 5.7707232475280765, "epoch": 3.6852510873863187, "grad_norm": 1.375, "learning_rate": 0.000369361056496797, "loss": 4.9587, "mean_token_accuracy": 0.22747980803251266, "num_tokens": 85395944.0, "step": 37280 }, { "entropy": 5.7851881980896, "epoch": 3.68574535389482, "grad_norm": 1.296875, "learning_rate": 0.00036932901875010797, "loss": 4.9634, "mean_token_accuracy": 0.22452894002199172, "num_tokens": 85407614.0, "step": 37285 }, { "entropy": 5.737072992324829, "epoch": 3.686239620403321, "grad_norm": 1.2109375, "learning_rate": 0.00036929697868291045, "loss": 4.957, "mean_token_accuracy": 0.22738783657550812, "num_tokens": 85419006.0, "step": 37290 }, { "entropy": 5.7481636047363285, "epoch": 3.686733886911823, "grad_norm": 1.3046875, "learning_rate": 0.00036926493629599257, "loss": 4.9246, "mean_token_accuracy": 0.23410102277994155, "num_tokens": 85430267.0, "step": 37295 }, { "entropy": 5.7388018608093265, "epoch": 3.687228153420324, "grad_norm": 1.21875, "learning_rate": 0.0003692328915901427, "loss": 4.9552, "mean_token_accuracy": 0.22416764497756958, "num_tokens": 85441424.0, "step": 37300 }, { "entropy": 5.73291425704956, "epoch": 3.687722419928826, "grad_norm": 1.203125, "learning_rate": 0.0003692008445661491, "loss": 4.8973, "mean_token_accuracy": 0.22834030240774156, "num_tokens": 85452606.0, "step": 37305 }, { "entropy": 5.732199954986572, "epoch": 3.688216686437327, "grad_norm": 1.203125, "learning_rate": 0.00036916879522480003, "loss": 4.9422, "mean_token_accuracy": 0.22722528576850892, "num_tokens": 85463532.0, "step": 37310 }, { "entropy": 5.793481922149658, "epoch": 3.6887109529458284, "grad_norm": 1.265625, "learning_rate": 0.000369136743566884, "loss": 4.9968, "mean_token_accuracy": 0.22339461296796798, "num_tokens": 85476014.0, "step": 37315 }, { "entropy": 5.74561619758606, "epoch": 3.6892052194543297, "grad_norm": 1.28125, "learning_rate": 0.0003691046895931895, "loss": 4.9303, "mean_token_accuracy": 0.22855920493602752, "num_tokens": 85488296.0, "step": 37320 }, { "entropy": 5.806354331970215, "epoch": 3.689699485962831, "grad_norm": 1.1640625, "learning_rate": 0.00036907263330450505, "loss": 5.0219, "mean_token_accuracy": 0.2249247044324875, "num_tokens": 85498579.0, "step": 37325 }, { "entropy": 5.771112442016602, "epoch": 3.6901937524713326, "grad_norm": 1.234375, "learning_rate": 0.00036904057470161914, "loss": 4.9616, "mean_token_accuracy": 0.2243894636631012, "num_tokens": 85509978.0, "step": 37330 }, { "entropy": 5.785664653778076, "epoch": 3.690688018979834, "grad_norm": 1.28125, "learning_rate": 0.00036900851378532065, "loss": 4.9981, "mean_token_accuracy": 0.22123742550611497, "num_tokens": 85522277.0, "step": 37335 }, { "entropy": 5.715666723251343, "epoch": 3.691182285488335, "grad_norm": 1.203125, "learning_rate": 0.00036897645055639794, "loss": 4.9472, "mean_token_accuracy": 0.22633805721998215, "num_tokens": 85532880.0, "step": 37340 }, { "entropy": 5.6957906723022464, "epoch": 3.691676551996837, "grad_norm": 1.3671875, "learning_rate": 0.0003689443850156401, "loss": 4.8732, "mean_token_accuracy": 0.2336172491312027, "num_tokens": 85543714.0, "step": 37345 }, { "entropy": 5.703838682174682, "epoch": 3.692170818505338, "grad_norm": 1.2265625, "learning_rate": 0.0003689123171638358, "loss": 4.9103, "mean_token_accuracy": 0.23035956025123597, "num_tokens": 85555870.0, "step": 37350 }, { "entropy": 5.670854997634888, "epoch": 3.6926650850138394, "grad_norm": 1.171875, "learning_rate": 0.000368880247001774, "loss": 4.8497, "mean_token_accuracy": 0.23960686177015306, "num_tokens": 85567607.0, "step": 37355 }, { "entropy": 5.701727294921875, "epoch": 3.6931593515223406, "grad_norm": 1.359375, "learning_rate": 0.0003688481745302435, "loss": 4.954, "mean_token_accuracy": 0.22836966216564178, "num_tokens": 85578448.0, "step": 37360 }, { "entropy": 5.794955587387085, "epoch": 3.6936536180308424, "grad_norm": 1.2109375, "learning_rate": 0.0003688160997500332, "loss": 5.0207, "mean_token_accuracy": 0.21871814280748367, "num_tokens": 85589220.0, "step": 37365 }, { "entropy": 5.816171312332154, "epoch": 3.6941478845393436, "grad_norm": 1.3203125, "learning_rate": 0.00036878402266193243, "loss": 5.0986, "mean_token_accuracy": 0.21787215024232864, "num_tokens": 85600095.0, "step": 37370 }, { "entropy": 5.818463945388794, "epoch": 3.694642151047845, "grad_norm": 1.1640625, "learning_rate": 0.00036875194326673025, "loss": 4.9653, "mean_token_accuracy": 0.2266804203391075, "num_tokens": 85612188.0, "step": 37375 }, { "entropy": 5.719247579574585, "epoch": 3.6951364175563466, "grad_norm": 1.296875, "learning_rate": 0.00036871986156521554, "loss": 4.8576, "mean_token_accuracy": 0.23641509264707566, "num_tokens": 85623262.0, "step": 37380 }, { "entropy": 5.709928369522094, "epoch": 3.695630684064848, "grad_norm": 1.25, "learning_rate": 0.00036868777755817776, "loss": 4.9535, "mean_token_accuracy": 0.22405129224061965, "num_tokens": 85634811.0, "step": 37385 }, { "entropy": 5.8356575012207035, "epoch": 3.696124950573349, "grad_norm": 1.203125, "learning_rate": 0.0003686556912464062, "loss": 5.0617, "mean_token_accuracy": 0.21919228434562682, "num_tokens": 85645739.0, "step": 37390 }, { "entropy": 5.785538005828857, "epoch": 3.6966192170818504, "grad_norm": 1.2734375, "learning_rate": 0.00036862360263069, "loss": 4.9524, "mean_token_accuracy": 0.23166478425264359, "num_tokens": 85657124.0, "step": 37395 }, { "entropy": 5.829905939102173, "epoch": 3.697113483590352, "grad_norm": 1.296875, "learning_rate": 0.0003685915117118187, "loss": 4.976, "mean_token_accuracy": 0.22730881720781326, "num_tokens": 85667750.0, "step": 37400 }, { "entropy": 5.701602792739868, "epoch": 3.6976077500988533, "grad_norm": 1.2421875, "learning_rate": 0.0003685594184905817, "loss": 4.9577, "mean_token_accuracy": 0.2274487942457199, "num_tokens": 85679009.0, "step": 37405 }, { "entropy": 5.757835435867309, "epoch": 3.6981020166073546, "grad_norm": 1.25, "learning_rate": 0.0003685273229677684, "loss": 4.9928, "mean_token_accuracy": 0.2267878010869026, "num_tokens": 85690925.0, "step": 37410 }, { "entropy": 5.872438430786133, "epoch": 3.6985962831158563, "grad_norm": 1.2578125, "learning_rate": 0.00036849522514416854, "loss": 5.0809, "mean_token_accuracy": 0.21109531223773956, "num_tokens": 85702045.0, "step": 37415 }, { "entropy": 5.766263198852539, "epoch": 3.6990905496243576, "grad_norm": 1.1953125, "learning_rate": 0.0003684631250205716, "loss": 4.9627, "mean_token_accuracy": 0.2202484980225563, "num_tokens": 85713589.0, "step": 37420 }, { "entropy": 5.736242246627808, "epoch": 3.699584816132859, "grad_norm": 1.125, "learning_rate": 0.00036843102259776736, "loss": 4.9141, "mean_token_accuracy": 0.22963446080684663, "num_tokens": 85726060.0, "step": 37425 }, { "entropy": 5.89557147026062, "epoch": 3.70007908264136, "grad_norm": 1.2421875, "learning_rate": 0.0003683989178765454, "loss": 5.0684, "mean_token_accuracy": 0.21528128534555435, "num_tokens": 85737473.0, "step": 37430 }, { "entropy": 5.79092321395874, "epoch": 3.7005733491498614, "grad_norm": 1.1953125, "learning_rate": 0.0003683668108576955, "loss": 4.9794, "mean_token_accuracy": 0.22522441893815995, "num_tokens": 85749392.0, "step": 37435 }, { "entropy": 5.775051498413086, "epoch": 3.701067615658363, "grad_norm": 1.1328125, "learning_rate": 0.00036833470154200765, "loss": 4.9734, "mean_token_accuracy": 0.22117066085338594, "num_tokens": 85761180.0, "step": 37440 }, { "entropy": 5.689578104019165, "epoch": 3.7015618821668643, "grad_norm": 1.1953125, "learning_rate": 0.0003683025899302717, "loss": 4.9134, "mean_token_accuracy": 0.23618309944868088, "num_tokens": 85772230.0, "step": 37445 }, { "entropy": 5.766793251037598, "epoch": 3.702056148675366, "grad_norm": 1.296875, "learning_rate": 0.00036827047602327757, "loss": 5.0019, "mean_token_accuracy": 0.22699790745973586, "num_tokens": 85783413.0, "step": 37450 }, { "entropy": 5.808465003967285, "epoch": 3.7025504151838673, "grad_norm": 1.25, "learning_rate": 0.00036823835982181515, "loss": 4.9771, "mean_token_accuracy": 0.22568456083536148, "num_tokens": 85794057.0, "step": 37455 }, { "entropy": 5.775546598434448, "epoch": 3.7030446816923686, "grad_norm": 1.2109375, "learning_rate": 0.00036820624132667467, "loss": 4.8981, "mean_token_accuracy": 0.22219039499759674, "num_tokens": 85805379.0, "step": 37460 }, { "entropy": 5.796580457687378, "epoch": 3.70353894820087, "grad_norm": 1.25, "learning_rate": 0.00036817412053864626, "loss": 4.9577, "mean_token_accuracy": 0.22342815846204758, "num_tokens": 85817177.0, "step": 37465 }, { "entropy": 5.724299097061158, "epoch": 3.704033214709371, "grad_norm": 1.1171875, "learning_rate": 0.00036814199745851997, "loss": 4.939, "mean_token_accuracy": 0.23137965500354768, "num_tokens": 85830017.0, "step": 37470 }, { "entropy": 5.747087860107422, "epoch": 3.704527481217873, "grad_norm": 1.3046875, "learning_rate": 0.00036810987208708607, "loss": 5.0443, "mean_token_accuracy": 0.21935572624206542, "num_tokens": 85840835.0, "step": 37475 }, { "entropy": 5.736013269424438, "epoch": 3.705021747726374, "grad_norm": 1.1953125, "learning_rate": 0.00036807774442513495, "loss": 4.9504, "mean_token_accuracy": 0.2279438003897667, "num_tokens": 85852492.0, "step": 37480 }, { "entropy": 5.753422451019287, "epoch": 3.7055160142348753, "grad_norm": 1.140625, "learning_rate": 0.0003680456144734567, "loss": 4.9256, "mean_token_accuracy": 0.22800526171922683, "num_tokens": 85864570.0, "step": 37485 }, { "entropy": 5.745447826385498, "epoch": 3.706010280743377, "grad_norm": 1.2890625, "learning_rate": 0.0003680134822328421, "loss": 4.9378, "mean_token_accuracy": 0.22222978621721268, "num_tokens": 85875516.0, "step": 37490 }, { "entropy": 5.779710054397583, "epoch": 3.7065045472518783, "grad_norm": 1.125, "learning_rate": 0.0003679813477040814, "loss": 4.951, "mean_token_accuracy": 0.23086798340082168, "num_tokens": 85886051.0, "step": 37495 }, { "entropy": 5.797987794876098, "epoch": 3.7069988137603795, "grad_norm": 1.2265625, "learning_rate": 0.000367949210887965, "loss": 5.0234, "mean_token_accuracy": 0.2208812028169632, "num_tokens": 85897996.0, "step": 37500 }, { "entropy": 5.7410407066345215, "epoch": 3.707493080268881, "grad_norm": 1.296875, "learning_rate": 0.00036791707178528355, "loss": 4.855, "mean_token_accuracy": 0.23410629630088806, "num_tokens": 85908562.0, "step": 37505 }, { "entropy": 5.802285385131836, "epoch": 3.7079873467773825, "grad_norm": 1.2265625, "learning_rate": 0.0003678849303968278, "loss": 4.9972, "mean_token_accuracy": 0.21652754098176957, "num_tokens": 85920859.0, "step": 37510 }, { "entropy": 5.6696741580963135, "epoch": 3.7084816132858838, "grad_norm": 1.1796875, "learning_rate": 0.0003678527867233884, "loss": 4.9356, "mean_token_accuracy": 0.22560035437345505, "num_tokens": 85932919.0, "step": 37515 }, { "entropy": 5.681406879425049, "epoch": 3.708975879794385, "grad_norm": 1.171875, "learning_rate": 0.00036782064076575603, "loss": 4.8675, "mean_token_accuracy": 0.2346976190805435, "num_tokens": 85943399.0, "step": 37520 }, { "entropy": 5.776633596420288, "epoch": 3.7094701463028867, "grad_norm": 1.359375, "learning_rate": 0.00036778849252472144, "loss": 4.971, "mean_token_accuracy": 0.22241942584514618, "num_tokens": 85954110.0, "step": 37525 }, { "entropy": 5.804233169555664, "epoch": 3.709964412811388, "grad_norm": 1.2890625, "learning_rate": 0.0003677563420010755, "loss": 4.9651, "mean_token_accuracy": 0.22105648070573808, "num_tokens": 85965955.0, "step": 37530 }, { "entropy": 5.755979585647583, "epoch": 3.7104586793198893, "grad_norm": 1.1796875, "learning_rate": 0.00036772418919560937, "loss": 4.9104, "mean_token_accuracy": 0.2265198901295662, "num_tokens": 85977475.0, "step": 37535 }, { "entropy": 5.756081438064575, "epoch": 3.7109529458283905, "grad_norm": 1.2265625, "learning_rate": 0.0003676920341091136, "loss": 4.961, "mean_token_accuracy": 0.21792267709970475, "num_tokens": 85987995.0, "step": 37540 }, { "entropy": 5.789609479904175, "epoch": 3.711447212336892, "grad_norm": 1.234375, "learning_rate": 0.0003676598767423795, "loss": 5.0449, "mean_token_accuracy": 0.21563535630702974, "num_tokens": 86000379.0, "step": 37545 }, { "entropy": 5.784220790863037, "epoch": 3.7119414788453935, "grad_norm": 1.2890625, "learning_rate": 0.000367627717096198, "loss": 4.942, "mean_token_accuracy": 0.22381436675786973, "num_tokens": 86011959.0, "step": 37550 }, { "entropy": 5.792229747772216, "epoch": 3.7124357453538948, "grad_norm": 1.265625, "learning_rate": 0.0003675955551713603, "loss": 4.9654, "mean_token_accuracy": 0.21988274455070494, "num_tokens": 86023015.0, "step": 37555 }, { "entropy": 5.703189134597778, "epoch": 3.7129300118623965, "grad_norm": 1.2890625, "learning_rate": 0.0003675633909686576, "loss": 4.9149, "mean_token_accuracy": 0.2233332008123398, "num_tokens": 86032802.0, "step": 37560 }, { "entropy": 5.772376632690429, "epoch": 3.7134242783708977, "grad_norm": 1.1640625, "learning_rate": 0.00036753122448888114, "loss": 4.9525, "mean_token_accuracy": 0.22448374480009078, "num_tokens": 86043499.0, "step": 37565 }, { "entropy": 5.813872766494751, "epoch": 3.713918544879399, "grad_norm": 1.203125, "learning_rate": 0.00036749905573282214, "loss": 4.9681, "mean_token_accuracy": 0.2173368901014328, "num_tokens": 86054327.0, "step": 37570 }, { "entropy": 5.835749864578247, "epoch": 3.7144128113879002, "grad_norm": 1.1640625, "learning_rate": 0.00036746688470127214, "loss": 5.0738, "mean_token_accuracy": 0.2144184723496437, "num_tokens": 86067023.0, "step": 37575 }, { "entropy": 5.753268623352051, "epoch": 3.7149070778964015, "grad_norm": 1.2109375, "learning_rate": 0.00036743471139502235, "loss": 4.944, "mean_token_accuracy": 0.2225894033908844, "num_tokens": 86079906.0, "step": 37580 }, { "entropy": 5.7769428253173825, "epoch": 3.715401344404903, "grad_norm": 1.2890625, "learning_rate": 0.0003674025358148643, "loss": 4.9809, "mean_token_accuracy": 0.22423101514577864, "num_tokens": 86090467.0, "step": 37585 }, { "entropy": 5.7302769184112545, "epoch": 3.7158956109134045, "grad_norm": 1.125, "learning_rate": 0.0003673703579615895, "loss": 4.9285, "mean_token_accuracy": 0.22742253243923188, "num_tokens": 86102908.0, "step": 37590 }, { "entropy": 5.667901563644409, "epoch": 3.7163898774219057, "grad_norm": 1.2265625, "learning_rate": 0.00036733817783598973, "loss": 4.8432, "mean_token_accuracy": 0.23802122771739959, "num_tokens": 86114588.0, "step": 37595 }, { "entropy": 5.710298824310303, "epoch": 3.7168841439304074, "grad_norm": 1.0546875, "learning_rate": 0.0003673059954388563, "loss": 4.9711, "mean_token_accuracy": 0.22340784072875977, "num_tokens": 86126800.0, "step": 37600 }, { "entropy": 5.761493253707886, "epoch": 3.7173784104389087, "grad_norm": 1.203125, "learning_rate": 0.0003672738107709811, "loss": 4.9836, "mean_token_accuracy": 0.22413140535354614, "num_tokens": 86138703.0, "step": 37605 }, { "entropy": 5.745538568496704, "epoch": 3.71787267694741, "grad_norm": 1.359375, "learning_rate": 0.00036724162383315584, "loss": 4.8832, "mean_token_accuracy": 0.22908671349287033, "num_tokens": 86148856.0, "step": 37610 }, { "entropy": 5.8843542575836185, "epoch": 3.7183669434559112, "grad_norm": 1.3359375, "learning_rate": 0.00036720943462617236, "loss": 5.0125, "mean_token_accuracy": 0.22095763683319092, "num_tokens": 86160108.0, "step": 37615 }, { "entropy": 5.843805122375488, "epoch": 3.718861209964413, "grad_norm": 1.25, "learning_rate": 0.00036717724315082245, "loss": 4.9744, "mean_token_accuracy": 0.2241460680961609, "num_tokens": 86170065.0, "step": 37620 }, { "entropy": 5.768634939193726, "epoch": 3.719355476472914, "grad_norm": 1.234375, "learning_rate": 0.000367145049407898, "loss": 4.9579, "mean_token_accuracy": 0.22481756508350373, "num_tokens": 86180469.0, "step": 37625 }, { "entropy": 5.788803768157959, "epoch": 3.7198497429814155, "grad_norm": 1.2890625, "learning_rate": 0.00036711285339819115, "loss": 5.05, "mean_token_accuracy": 0.2188575014472008, "num_tokens": 86191801.0, "step": 37630 }, { "entropy": 5.731822204589844, "epoch": 3.720344009489917, "grad_norm": 1.296875, "learning_rate": 0.0003670806551224938, "loss": 4.9155, "mean_token_accuracy": 0.22321949005126954, "num_tokens": 86202967.0, "step": 37635 }, { "entropy": 5.811128568649292, "epoch": 3.7208382759984184, "grad_norm": 1.265625, "learning_rate": 0.00036704845458159803, "loss": 5.0458, "mean_token_accuracy": 0.21628097891807557, "num_tokens": 86215225.0, "step": 37640 }, { "entropy": 5.8112287521362305, "epoch": 3.7213325425069197, "grad_norm": 1.3203125, "learning_rate": 0.00036701625177629595, "loss": 5.0336, "mean_token_accuracy": 0.21719338595867158, "num_tokens": 86227417.0, "step": 37645 }, { "entropy": 5.753141736984253, "epoch": 3.721826809015421, "grad_norm": 1.328125, "learning_rate": 0.0003669840467073798, "loss": 4.9266, "mean_token_accuracy": 0.23020173460245133, "num_tokens": 86238749.0, "step": 37650 }, { "entropy": 5.728374290466308, "epoch": 3.7223210755239227, "grad_norm": 1.2578125, "learning_rate": 0.0003669518393756419, "loss": 5.0105, "mean_token_accuracy": 0.2173576608300209, "num_tokens": 86250146.0, "step": 37655 }, { "entropy": 5.766939640045166, "epoch": 3.722815342032424, "grad_norm": 1.1953125, "learning_rate": 0.0003669196297818745, "loss": 5.0126, "mean_token_accuracy": 0.2197690263390541, "num_tokens": 86262086.0, "step": 37660 }, { "entropy": 5.8283168315887455, "epoch": 3.723309608540925, "grad_norm": 1.375, "learning_rate": 0.00036688741792686985, "loss": 5.0147, "mean_token_accuracy": 0.22550718635320663, "num_tokens": 86273937.0, "step": 37665 }, { "entropy": 5.795480680465698, "epoch": 3.723803875049427, "grad_norm": 1.28125, "learning_rate": 0.0003668552038114205, "loss": 4.9872, "mean_token_accuracy": 0.22517864406108856, "num_tokens": 86284451.0, "step": 37670 }, { "entropy": 5.779292345046997, "epoch": 3.724298141557928, "grad_norm": 1.1640625, "learning_rate": 0.0003668229874363189, "loss": 4.9447, "mean_token_accuracy": 0.22701106071472169, "num_tokens": 86296406.0, "step": 37675 }, { "entropy": 5.732065296173095, "epoch": 3.7247924080664294, "grad_norm": 1.1953125, "learning_rate": 0.00036679076880235764, "loss": 4.9052, "mean_token_accuracy": 0.23302721381187438, "num_tokens": 86306922.0, "step": 37680 }, { "entropy": 5.763846015930175, "epoch": 3.7252866745749307, "grad_norm": 1.265625, "learning_rate": 0.00036675854791032916, "loss": 4.9086, "mean_token_accuracy": 0.23191508948802947, "num_tokens": 86317785.0, "step": 37685 }, { "entropy": 5.851247930526734, "epoch": 3.725780941083432, "grad_norm": 1.3046875, "learning_rate": 0.0003667263247610261, "loss": 5.0655, "mean_token_accuracy": 0.21622992157936097, "num_tokens": 86329271.0, "step": 37690 }, { "entropy": 5.810261297225952, "epoch": 3.7262752075919336, "grad_norm": 1.28125, "learning_rate": 0.00036669409935524136, "loss": 5.0119, "mean_token_accuracy": 0.22189213335514069, "num_tokens": 86339739.0, "step": 37695 }, { "entropy": 5.699525785446167, "epoch": 3.726769474100435, "grad_norm": 1.2578125, "learning_rate": 0.0003666618716937674, "loss": 4.8984, "mean_token_accuracy": 0.23122749477624893, "num_tokens": 86351111.0, "step": 37700 }, { "entropy": 5.7642998695373535, "epoch": 3.7272637406089366, "grad_norm": 1.28125, "learning_rate": 0.0003666296417773973, "loss": 5.0055, "mean_token_accuracy": 0.22127450853586197, "num_tokens": 86363320.0, "step": 37705 }, { "entropy": 5.798371458053589, "epoch": 3.727758007117438, "grad_norm": 1.234375, "learning_rate": 0.0003665974096069237, "loss": 5.0125, "mean_token_accuracy": 0.22296567112207413, "num_tokens": 86374372.0, "step": 37710 }, { "entropy": 5.887238025665283, "epoch": 3.728252273625939, "grad_norm": 1.203125, "learning_rate": 0.0003665651751831397, "loss": 5.0255, "mean_token_accuracy": 0.21387027949094772, "num_tokens": 86385545.0, "step": 37715 }, { "entropy": 5.750654602050782, "epoch": 3.7287465401344404, "grad_norm": 1.1328125, "learning_rate": 0.00036653293850683803, "loss": 4.9704, "mean_token_accuracy": 0.22632201313972472, "num_tokens": 86398240.0, "step": 37720 }, { "entropy": 5.733729219436645, "epoch": 3.7292408066429417, "grad_norm": 1.1640625, "learning_rate": 0.0003665006995788121, "loss": 4.9587, "mean_token_accuracy": 0.22277727723121643, "num_tokens": 86409024.0, "step": 37725 }, { "entropy": 5.835492563247681, "epoch": 3.7297350731514434, "grad_norm": 1.1953125, "learning_rate": 0.00036646845839985464, "loss": 4.9865, "mean_token_accuracy": 0.22047607600688934, "num_tokens": 86422114.0, "step": 37730 }, { "entropy": 5.817431545257568, "epoch": 3.7302293396599446, "grad_norm": 1.109375, "learning_rate": 0.00036643621497075895, "loss": 5.0221, "mean_token_accuracy": 0.21398374140262605, "num_tokens": 86435230.0, "step": 37735 }, { "entropy": 5.754470586776733, "epoch": 3.730723606168446, "grad_norm": 1.09375, "learning_rate": 0.00036640396929231813, "loss": 5.0548, "mean_token_accuracy": 0.219473434984684, "num_tokens": 86446449.0, "step": 37740 }, { "entropy": 5.789600801467896, "epoch": 3.7312178726769476, "grad_norm": 1.3515625, "learning_rate": 0.0003663717213653255, "loss": 4.975, "mean_token_accuracy": 0.22250833809375764, "num_tokens": 86456814.0, "step": 37745 }, { "entropy": 5.778157520294189, "epoch": 3.731712139185449, "grad_norm": 1.234375, "learning_rate": 0.0003663394711905744, "loss": 4.9234, "mean_token_accuracy": 0.22234784960746765, "num_tokens": 86468135.0, "step": 37750 }, { "entropy": 5.81230206489563, "epoch": 3.73220640569395, "grad_norm": 1.2578125, "learning_rate": 0.00036630721876885813, "loss": 5.0415, "mean_token_accuracy": 0.22250140458345413, "num_tokens": 86480268.0, "step": 37755 }, { "entropy": 5.73613224029541, "epoch": 3.7327006722024514, "grad_norm": 1.234375, "learning_rate": 0.00036627496410097005, "loss": 4.881, "mean_token_accuracy": 0.2334372490644455, "num_tokens": 86492660.0, "step": 37760 }, { "entropy": 5.755557250976563, "epoch": 3.733194938710953, "grad_norm": 1.2421875, "learning_rate": 0.00036624270718770376, "loss": 5.0016, "mean_token_accuracy": 0.2249850794672966, "num_tokens": 86504638.0, "step": 37765 }, { "entropy": 5.748024559020996, "epoch": 3.7336892052194544, "grad_norm": 1.234375, "learning_rate": 0.0003662104480298527, "loss": 4.8957, "mean_token_accuracy": 0.2314486101269722, "num_tokens": 86514225.0, "step": 37770 }, { "entropy": 5.7848869323730465, "epoch": 3.7341834717279556, "grad_norm": 1.1875, "learning_rate": 0.0003661781866282104, "loss": 4.981, "mean_token_accuracy": 0.22631637156009674, "num_tokens": 86525370.0, "step": 37775 }, { "entropy": 5.772403335571289, "epoch": 3.7346777382364573, "grad_norm": 1.328125, "learning_rate": 0.0003661459229835707, "loss": 4.898, "mean_token_accuracy": 0.22576549053192138, "num_tokens": 86535137.0, "step": 37780 }, { "entropy": 5.67782039642334, "epoch": 3.7351720047449586, "grad_norm": 1.359375, "learning_rate": 0.00036611365709672707, "loss": 4.851, "mean_token_accuracy": 0.23626085072755815, "num_tokens": 86546922.0, "step": 37785 }, { "entropy": 5.802244758605957, "epoch": 3.73566627125346, "grad_norm": 1.15625, "learning_rate": 0.0003660813889684733, "loss": 5.0252, "mean_token_accuracy": 0.21744414567947387, "num_tokens": 86559356.0, "step": 37790 }, { "entropy": 5.720613479614258, "epoch": 3.736160537761961, "grad_norm": 1.15625, "learning_rate": 0.0003660491185996033, "loss": 4.8409, "mean_token_accuracy": 0.2380582332611084, "num_tokens": 86571515.0, "step": 37795 }, { "entropy": 5.796172380447388, "epoch": 3.7366548042704624, "grad_norm": 1.390625, "learning_rate": 0.0003660168459909109, "loss": 4.9449, "mean_token_accuracy": 0.22473030984401704, "num_tokens": 86581641.0, "step": 37800 }, { "entropy": 5.73213529586792, "epoch": 3.737149070778964, "grad_norm": 1.1328125, "learning_rate": 0.00036598457114318984, "loss": 4.9443, "mean_token_accuracy": 0.22271333038806915, "num_tokens": 86594478.0, "step": 37805 }, { "entropy": 5.749959707260132, "epoch": 3.7376433372874653, "grad_norm": 1.2734375, "learning_rate": 0.0003659522940572343, "loss": 4.9176, "mean_token_accuracy": 0.22743833512067796, "num_tokens": 86605496.0, "step": 37810 }, { "entropy": 5.757935667037964, "epoch": 3.738137603795967, "grad_norm": 1.1953125, "learning_rate": 0.00036592001473383817, "loss": 4.9123, "mean_token_accuracy": 0.2287479966878891, "num_tokens": 86616745.0, "step": 37815 }, { "entropy": 5.793238306045533, "epoch": 3.7386318703044683, "grad_norm": 1.3125, "learning_rate": 0.0003658877331737956, "loss": 4.996, "mean_token_accuracy": 0.21782800704240798, "num_tokens": 86628094.0, "step": 37820 }, { "entropy": 5.780686664581299, "epoch": 3.7391261368129696, "grad_norm": 1.1796875, "learning_rate": 0.00036585544937790067, "loss": 4.9489, "mean_token_accuracy": 0.23064619600772857, "num_tokens": 86639421.0, "step": 37825 }, { "entropy": 5.705244827270508, "epoch": 3.739620403321471, "grad_norm": 1.2734375, "learning_rate": 0.00036582316334694766, "loss": 4.9208, "mean_token_accuracy": 0.22962794750928878, "num_tokens": 86650653.0, "step": 37830 }, { "entropy": 5.815390491485596, "epoch": 3.740114669829972, "grad_norm": 1.1875, "learning_rate": 0.0003657908750817307, "loss": 4.937, "mean_token_accuracy": 0.22738177329301834, "num_tokens": 86660954.0, "step": 37835 }, { "entropy": 5.821546316146851, "epoch": 3.740608936338474, "grad_norm": 1.1171875, "learning_rate": 0.00036575858458304407, "loss": 5.0412, "mean_token_accuracy": 0.2155962720513344, "num_tokens": 86671983.0, "step": 37840 }, { "entropy": 5.72502179145813, "epoch": 3.741103202846975, "grad_norm": 1.3203125, "learning_rate": 0.00036572629185168223, "loss": 4.872, "mean_token_accuracy": 0.23590594679117202, "num_tokens": 86682634.0, "step": 37845 }, { "entropy": 5.733956623077392, "epoch": 3.7415974693554763, "grad_norm": 1.2890625, "learning_rate": 0.0003656939968884396, "loss": 4.9969, "mean_token_accuracy": 0.22023146599531174, "num_tokens": 86693516.0, "step": 37850 }, { "entropy": 5.79281964302063, "epoch": 3.742091735863978, "grad_norm": 1.265625, "learning_rate": 0.00036566169969411047, "loss": 5.0152, "mean_token_accuracy": 0.21973765939474105, "num_tokens": 86705350.0, "step": 37855 }, { "entropy": 5.77914662361145, "epoch": 3.7425860023724793, "grad_norm": 1.2890625, "learning_rate": 0.0003656294002694895, "loss": 4.9348, "mean_token_accuracy": 0.22151776701211928, "num_tokens": 86715647.0, "step": 37860 }, { "entropy": 5.790775299072266, "epoch": 3.7430802688809806, "grad_norm": 1.265625, "learning_rate": 0.0003655970986153712, "loss": 5.0592, "mean_token_accuracy": 0.21426394134759902, "num_tokens": 86726453.0, "step": 37865 }, { "entropy": 5.756238412857056, "epoch": 3.743574535389482, "grad_norm": 1.171875, "learning_rate": 0.0003655647947325503, "loss": 4.9745, "mean_token_accuracy": 0.22652319073677063, "num_tokens": 86737400.0, "step": 37870 }, { "entropy": 5.865530109405517, "epoch": 3.7440688018979835, "grad_norm": 1.3359375, "learning_rate": 0.0003655324886218213, "loss": 5.0704, "mean_token_accuracy": 0.21921167224645616, "num_tokens": 86748667.0, "step": 37875 }, { "entropy": 5.748724794387817, "epoch": 3.744563068406485, "grad_norm": 1.3046875, "learning_rate": 0.00036550018028397915, "loss": 4.9524, "mean_token_accuracy": 0.2274917781352997, "num_tokens": 86761081.0, "step": 37880 }, { "entropy": 5.811793279647827, "epoch": 3.745057334914986, "grad_norm": 1.2421875, "learning_rate": 0.0003654678697198184, "loss": 5.0224, "mean_token_accuracy": 0.2225654751062393, "num_tokens": 86770823.0, "step": 37885 }, { "entropy": 5.747380065917969, "epoch": 3.7455516014234878, "grad_norm": 1.15625, "learning_rate": 0.00036543555693013406, "loss": 4.9805, "mean_token_accuracy": 0.22445109486579895, "num_tokens": 86784362.0, "step": 37890 }, { "entropy": 5.808714962005615, "epoch": 3.746045867931989, "grad_norm": 1.328125, "learning_rate": 0.0003654032419157211, "loss": 5.0162, "mean_token_accuracy": 0.22368196696043013, "num_tokens": 86796679.0, "step": 37895 }, { "entropy": 5.780781984329224, "epoch": 3.7465401344404903, "grad_norm": 1.328125, "learning_rate": 0.0003653709246773743, "loss": 5.0074, "mean_token_accuracy": 0.2254186525940895, "num_tokens": 86808272.0, "step": 37900 }, { "entropy": 5.795290946960449, "epoch": 3.7470344009489915, "grad_norm": 1.171875, "learning_rate": 0.0003653386052158886, "loss": 4.9893, "mean_token_accuracy": 0.22253507375717163, "num_tokens": 86819428.0, "step": 37905 }, { "entropy": 5.7553528308868405, "epoch": 3.7475286674574932, "grad_norm": 1.21875, "learning_rate": 0.0003653062835320593, "loss": 4.9781, "mean_token_accuracy": 0.21847597360610962, "num_tokens": 86831373.0, "step": 37910 }, { "entropy": 5.715044641494751, "epoch": 3.7480229339659945, "grad_norm": 1.2265625, "learning_rate": 0.00036527395962668145, "loss": 4.8738, "mean_token_accuracy": 0.22778510451316833, "num_tokens": 86843196.0, "step": 37915 }, { "entropy": 5.7884166717529295, "epoch": 3.7485172004744958, "grad_norm": 1.09375, "learning_rate": 0.0003652416335005502, "loss": 4.9839, "mean_token_accuracy": 0.2222740486264229, "num_tokens": 86855233.0, "step": 37920 }, { "entropy": 5.7970046043396, "epoch": 3.7490114669829975, "grad_norm": 1.3125, "learning_rate": 0.0003652093051544607, "loss": 4.9249, "mean_token_accuracy": 0.2237451121211052, "num_tokens": 86865994.0, "step": 37925 }, { "entropy": 5.758708906173706, "epoch": 3.7495057334914987, "grad_norm": 1.265625, "learning_rate": 0.00036517697458920837, "loss": 4.9117, "mean_token_accuracy": 0.22558679729700087, "num_tokens": 86877451.0, "step": 37930 }, { "entropy": 5.694994068145752, "epoch": 3.75, "grad_norm": 1.3203125, "learning_rate": 0.00036514464180558836, "loss": 4.9436, "mean_token_accuracy": 0.22306866496801375, "num_tokens": 86888390.0, "step": 37935 }, { "entropy": 5.7700052738189695, "epoch": 3.7504942665085013, "grad_norm": 1.1796875, "learning_rate": 0.0003651123068043963, "loss": 5.0286, "mean_token_accuracy": 0.22130186706781388, "num_tokens": 86899703.0, "step": 37940 }, { "entropy": 5.784519529342651, "epoch": 3.7509885330170025, "grad_norm": 1.125, "learning_rate": 0.00036507996958642746, "loss": 4.9668, "mean_token_accuracy": 0.22671309858560562, "num_tokens": 86911753.0, "step": 37945 }, { "entropy": 5.921967601776123, "epoch": 3.7514827995255042, "grad_norm": 1.0859375, "learning_rate": 0.0003650476301524773, "loss": 5.1182, "mean_token_accuracy": 0.21818505376577377, "num_tokens": 86924165.0, "step": 37950 }, { "entropy": 5.79480881690979, "epoch": 3.7519770660340055, "grad_norm": 1.15625, "learning_rate": 0.0003650152885033416, "loss": 5.0231, "mean_token_accuracy": 0.21883623749017717, "num_tokens": 86935848.0, "step": 37955 }, { "entropy": 5.7117616653442385, "epoch": 3.7524713325425068, "grad_norm": 1.15625, "learning_rate": 0.00036498294463981583, "loss": 4.9056, "mean_token_accuracy": 0.22507920414209365, "num_tokens": 86946816.0, "step": 37960 }, { "entropy": 5.78493103981018, "epoch": 3.7529655990510085, "grad_norm": 1.2109375, "learning_rate": 0.00036495059856269556, "loss": 4.999, "mean_token_accuracy": 0.22427811175584794, "num_tokens": 86958436.0, "step": 37965 }, { "entropy": 5.8226512432098385, "epoch": 3.7534598655595097, "grad_norm": 1.1875, "learning_rate": 0.0003649182502727768, "loss": 4.9472, "mean_token_accuracy": 0.21884147077798843, "num_tokens": 86970338.0, "step": 37970 }, { "entropy": 5.773404979705811, "epoch": 3.753954132068011, "grad_norm": 1.21875, "learning_rate": 0.00036488589977085495, "loss": 4.9471, "mean_token_accuracy": 0.2224264085292816, "num_tokens": 86981796.0, "step": 37975 }, { "entropy": 5.657529354095459, "epoch": 3.7544483985765122, "grad_norm": 1.2890625, "learning_rate": 0.00036485354705772605, "loss": 4.9022, "mean_token_accuracy": 0.23338191360235214, "num_tokens": 86993681.0, "step": 37980 }, { "entropy": 5.798483562469483, "epoch": 3.754942665085014, "grad_norm": 1.2578125, "learning_rate": 0.00036482119213418604, "loss": 5.098, "mean_token_accuracy": 0.21738347709178923, "num_tokens": 87005621.0, "step": 37985 }, { "entropy": 5.764780187606812, "epoch": 3.755436931593515, "grad_norm": 1.21875, "learning_rate": 0.00036478883500103067, "loss": 4.9732, "mean_token_accuracy": 0.23007028102874755, "num_tokens": 87016054.0, "step": 37990 }, { "entropy": 5.831835222244263, "epoch": 3.7559311981020165, "grad_norm": 1.1875, "learning_rate": 0.0003647564756590561, "loss": 4.964, "mean_token_accuracy": 0.22115644663572312, "num_tokens": 87026603.0, "step": 37995 }, { "entropy": 5.789140844345093, "epoch": 3.756425464610518, "grad_norm": 1.234375, "learning_rate": 0.0003647241141090583, "loss": 4.9842, "mean_token_accuracy": 0.22459333389997482, "num_tokens": 87037036.0, "step": 38000 }, { "entropy": 5.695921468734741, "epoch": 3.7569197311190194, "grad_norm": 1.34375, "learning_rate": 0.0003646917503518333, "loss": 4.9009, "mean_token_accuracy": 0.2345951572060585, "num_tokens": 87047360.0, "step": 38005 }, { "entropy": 5.675279569625855, "epoch": 3.7574139976275207, "grad_norm": 1.234375, "learning_rate": 0.00036465938438817735, "loss": 4.8977, "mean_token_accuracy": 0.23151865601539612, "num_tokens": 87058580.0, "step": 38010 }, { "entropy": 5.724679088592529, "epoch": 3.757908264136022, "grad_norm": 1.1875, "learning_rate": 0.0003646270162188867, "loss": 5.001, "mean_token_accuracy": 0.22494527846574783, "num_tokens": 87070176.0, "step": 38015 }, { "entropy": 5.768527460098267, "epoch": 3.7584025306445237, "grad_norm": 1.0625, "learning_rate": 0.0003645946458447575, "loss": 4.9804, "mean_token_accuracy": 0.22818768322467803, "num_tokens": 87082188.0, "step": 38020 }, { "entropy": 5.807416391372681, "epoch": 3.758896797153025, "grad_norm": 1.1953125, "learning_rate": 0.0003645622732665862, "loss": 4.9915, "mean_token_accuracy": 0.22055274695158006, "num_tokens": 87093784.0, "step": 38025 }, { "entropy": 5.748805332183838, "epoch": 3.759391063661526, "grad_norm": 1.328125, "learning_rate": 0.00036452989848516896, "loss": 4.9232, "mean_token_accuracy": 0.22302961945533753, "num_tokens": 87105102.0, "step": 38030 }, { "entropy": 5.703180599212646, "epoch": 3.759885330170028, "grad_norm": 1.1875, "learning_rate": 0.00036449752150130235, "loss": 4.901, "mean_token_accuracy": 0.23253726661205293, "num_tokens": 87115956.0, "step": 38035 }, { "entropy": 5.70514030456543, "epoch": 3.760379596678529, "grad_norm": 1.328125, "learning_rate": 0.00036446514231578287, "loss": 4.9139, "mean_token_accuracy": 0.22850992083549498, "num_tokens": 87126514.0, "step": 38040 }, { "entropy": 5.732977819442749, "epoch": 3.7608738631870304, "grad_norm": 1.203125, "learning_rate": 0.00036443276092940703, "loss": 4.9403, "mean_token_accuracy": 0.22415173649787903, "num_tokens": 87137249.0, "step": 38045 }, { "entropy": 5.780674314498901, "epoch": 3.7613681296955317, "grad_norm": 1.1796875, "learning_rate": 0.00036440037734297134, "loss": 5.0049, "mean_token_accuracy": 0.22554363161325455, "num_tokens": 87148593.0, "step": 38050 }, { "entropy": 5.813843727111816, "epoch": 3.761862396204033, "grad_norm": 1.234375, "learning_rate": 0.00036436799155727253, "loss": 4.993, "mean_token_accuracy": 0.2211841881275177, "num_tokens": 87160085.0, "step": 38055 }, { "entropy": 5.767389011383057, "epoch": 3.7623566627125347, "grad_norm": 1.15625, "learning_rate": 0.00036433560357310727, "loss": 4.9323, "mean_token_accuracy": 0.22540901750326156, "num_tokens": 87171427.0, "step": 38060 }, { "entropy": 5.727397346496582, "epoch": 3.762850929221036, "grad_norm": 1.1875, "learning_rate": 0.0003643032133912723, "loss": 4.9432, "mean_token_accuracy": 0.22716560661792756, "num_tokens": 87183073.0, "step": 38065 }, { "entropy": 5.77149019241333, "epoch": 3.7633451957295376, "grad_norm": 1.3671875, "learning_rate": 0.0003642708210125644, "loss": 4.9517, "mean_token_accuracy": 0.22665513008832933, "num_tokens": 87193199.0, "step": 38070 }, { "entropy": 5.829591274261475, "epoch": 3.763839462238039, "grad_norm": 1.3359375, "learning_rate": 0.00036423842643778045, "loss": 4.9984, "mean_token_accuracy": 0.22349378019571303, "num_tokens": 87205052.0, "step": 38075 }, { "entropy": 5.781742095947266, "epoch": 3.76433372874654, "grad_norm": 1.296875, "learning_rate": 0.00036420602966771734, "loss": 5.044, "mean_token_accuracy": 0.21928689777851104, "num_tokens": 87217485.0, "step": 38080 }, { "entropy": 5.745099020004273, "epoch": 3.7648279952550414, "grad_norm": 1.2734375, "learning_rate": 0.0003641736307031721, "loss": 4.9294, "mean_token_accuracy": 0.2298099234700203, "num_tokens": 87228184.0, "step": 38085 }, { "entropy": 5.757774114608765, "epoch": 3.7653222617635427, "grad_norm": 1.140625, "learning_rate": 0.00036414122954494177, "loss": 5.0109, "mean_token_accuracy": 0.2189857006072998, "num_tokens": 87240713.0, "step": 38090 }, { "entropy": 5.783568572998047, "epoch": 3.7658165282720444, "grad_norm": 1.1796875, "learning_rate": 0.0003641088261938233, "loss": 5.0223, "mean_token_accuracy": 0.21678822636604309, "num_tokens": 87252739.0, "step": 38095 }, { "entropy": 5.693881464004517, "epoch": 3.7663107947805456, "grad_norm": 1.3671875, "learning_rate": 0.0003640764206506138, "loss": 4.8399, "mean_token_accuracy": 0.24297914803028106, "num_tokens": 87263034.0, "step": 38100 }, { "entropy": 5.772025871276855, "epoch": 3.766805061289047, "grad_norm": 1.1875, "learning_rate": 0.0003640440129161107, "loss": 4.9753, "mean_token_accuracy": 0.22777872234582902, "num_tokens": 87275384.0, "step": 38105 }, { "entropy": 5.781468772888184, "epoch": 3.7672993277975486, "grad_norm": 1.3671875, "learning_rate": 0.00036401160299111095, "loss": 5.029, "mean_token_accuracy": 0.21649794578552245, "num_tokens": 87286568.0, "step": 38110 }, { "entropy": 5.744393968582154, "epoch": 3.76779359430605, "grad_norm": 1.1484375, "learning_rate": 0.000363979190876412, "loss": 4.939, "mean_token_accuracy": 0.22868804782629013, "num_tokens": 87297972.0, "step": 38115 }, { "entropy": 5.837701463699341, "epoch": 3.768287860814551, "grad_norm": 1.3125, "learning_rate": 0.00036394677657281113, "loss": 4.9196, "mean_token_accuracy": 0.2304409921169281, "num_tokens": 87309137.0, "step": 38120 }, { "entropy": 5.75016975402832, "epoch": 3.7687821273230524, "grad_norm": 1.1640625, "learning_rate": 0.00036391436008110573, "loss": 4.9815, "mean_token_accuracy": 0.22741299569606782, "num_tokens": 87320097.0, "step": 38125 }, { "entropy": 5.710018873214722, "epoch": 3.769276393831554, "grad_norm": 1.2421875, "learning_rate": 0.00036388194140209336, "loss": 4.9501, "mean_token_accuracy": 0.23217149525880815, "num_tokens": 87332662.0, "step": 38130 }, { "entropy": 5.781949424743653, "epoch": 3.7697706603400554, "grad_norm": 1.2265625, "learning_rate": 0.00036384952053657144, "loss": 4.9575, "mean_token_accuracy": 0.23605646342039108, "num_tokens": 87344118.0, "step": 38135 }, { "entropy": 5.705094909667968, "epoch": 3.7702649268485566, "grad_norm": 1.265625, "learning_rate": 0.00036381709748533746, "loss": 4.9084, "mean_token_accuracy": 0.2272249221801758, "num_tokens": 87355787.0, "step": 38140 }, { "entropy": 5.758694648742676, "epoch": 3.7707591933570583, "grad_norm": 1.21875, "learning_rate": 0.0003637846722491892, "loss": 4.9122, "mean_token_accuracy": 0.23372262418270112, "num_tokens": 87367332.0, "step": 38145 }, { "entropy": 5.729998254776001, "epoch": 3.7712534598655596, "grad_norm": 1.203125, "learning_rate": 0.0003637522448289241, "loss": 4.9295, "mean_token_accuracy": 0.2275598853826523, "num_tokens": 87378968.0, "step": 38150 }, { "entropy": 5.716853523254395, "epoch": 3.771747726374061, "grad_norm": 1.15625, "learning_rate": 0.0003637198152253401, "loss": 4.9604, "mean_token_accuracy": 0.22874368727207184, "num_tokens": 87391573.0, "step": 38155 }, { "entropy": 5.7780735969543455, "epoch": 3.772241992882562, "grad_norm": 1.3203125, "learning_rate": 0.0003636873834392349, "loss": 4.9824, "mean_token_accuracy": 0.22612094581127168, "num_tokens": 87402431.0, "step": 38160 }, { "entropy": 5.752438974380493, "epoch": 3.7727362593910634, "grad_norm": 1.109375, "learning_rate": 0.0003636549494714062, "loss": 4.9978, "mean_token_accuracy": 0.22652032226324081, "num_tokens": 87414156.0, "step": 38165 }, { "entropy": 5.728734302520752, "epoch": 3.773230525899565, "grad_norm": 1.15625, "learning_rate": 0.00036362251332265204, "loss": 4.9489, "mean_token_accuracy": 0.23094669133424758, "num_tokens": 87425878.0, "step": 38170 }, { "entropy": 5.770079612731934, "epoch": 3.7737247924080664, "grad_norm": 1.171875, "learning_rate": 0.0003635900749937703, "loss": 4.9723, "mean_token_accuracy": 0.22962706387043, "num_tokens": 87437171.0, "step": 38175 }, { "entropy": 5.750476408004761, "epoch": 3.774219058916568, "grad_norm": 1.2265625, "learning_rate": 0.000363557634485559, "loss": 4.9188, "mean_token_accuracy": 0.22449419796466827, "num_tokens": 87448465.0, "step": 38180 }, { "entropy": 5.678539705276489, "epoch": 3.7747133254250693, "grad_norm": 1.265625, "learning_rate": 0.0003635251917988162, "loss": 4.9099, "mean_token_accuracy": 0.2294145107269287, "num_tokens": 87458800.0, "step": 38185 }, { "entropy": 5.7286755561828615, "epoch": 3.7752075919335706, "grad_norm": 1.1796875, "learning_rate": 0.0003634927469343399, "loss": 4.8951, "mean_token_accuracy": 0.2320461317896843, "num_tokens": 87470427.0, "step": 38190 }, { "entropy": 5.757998752593994, "epoch": 3.775701858442072, "grad_norm": 1.25, "learning_rate": 0.0003634602998929282, "loss": 4.9212, "mean_token_accuracy": 0.22941216826438904, "num_tokens": 87481498.0, "step": 38195 }, { "entropy": 5.689374017715454, "epoch": 3.776196124950573, "grad_norm": 1.28125, "learning_rate": 0.0003634278506753795, "loss": 4.9064, "mean_token_accuracy": 0.23252497613430023, "num_tokens": 87493578.0, "step": 38200 }, { "entropy": 5.775686645507813, "epoch": 3.776690391459075, "grad_norm": 1.390625, "learning_rate": 0.000363395399282492, "loss": 5.0054, "mean_token_accuracy": 0.2134772151708603, "num_tokens": 87504387.0, "step": 38205 }, { "entropy": 5.794479084014893, "epoch": 3.777184657967576, "grad_norm": 1.2578125, "learning_rate": 0.00036336294571506387, "loss": 4.9309, "mean_token_accuracy": 0.22212982773780823, "num_tokens": 87514231.0, "step": 38210 }, { "entropy": 5.733604097366333, "epoch": 3.7776789244760773, "grad_norm": 1.1875, "learning_rate": 0.00036333048997389363, "loss": 4.9844, "mean_token_accuracy": 0.2264952078461647, "num_tokens": 87526483.0, "step": 38215 }, { "entropy": 5.763343286514282, "epoch": 3.778173190984579, "grad_norm": 1.1640625, "learning_rate": 0.0003632980320597797, "loss": 4.9629, "mean_token_accuracy": 0.2179630234837532, "num_tokens": 87537931.0, "step": 38220 }, { "entropy": 5.769645500183105, "epoch": 3.7786674574930803, "grad_norm": 1.234375, "learning_rate": 0.0003632655719735203, "loss": 4.9481, "mean_token_accuracy": 0.22772042602300643, "num_tokens": 87549486.0, "step": 38225 }, { "entropy": 5.766765451431274, "epoch": 3.7791617240015816, "grad_norm": 1.125, "learning_rate": 0.0003632331097159143, "loss": 5.0256, "mean_token_accuracy": 0.22252532243728637, "num_tokens": 87562232.0, "step": 38230 }, { "entropy": 5.784458971023559, "epoch": 3.779655990510083, "grad_norm": 1.1015625, "learning_rate": 0.00036320064528776, "loss": 4.9106, "mean_token_accuracy": 0.22461774051189423, "num_tokens": 87574246.0, "step": 38235 }, { "entropy": 5.793606376647949, "epoch": 3.7801502570185845, "grad_norm": 1.3671875, "learning_rate": 0.0003631681786898562, "loss": 4.9309, "mean_token_accuracy": 0.22601214945316314, "num_tokens": 87586033.0, "step": 38240 }, { "entropy": 5.753064060211182, "epoch": 3.780644523527086, "grad_norm": 1.3046875, "learning_rate": 0.0003631357099230015, "loss": 4.9567, "mean_token_accuracy": 0.2259281322360039, "num_tokens": 87596468.0, "step": 38245 }, { "entropy": 5.767170810699463, "epoch": 3.781138790035587, "grad_norm": 1.15625, "learning_rate": 0.0003631032389879947, "loss": 4.9951, "mean_token_accuracy": 0.2206801012158394, "num_tokens": 87608577.0, "step": 38250 }, { "entropy": 5.7897227764129635, "epoch": 3.7816330565440888, "grad_norm": 1.0625, "learning_rate": 0.0003630707658856345, "loss": 5.0124, "mean_token_accuracy": 0.2210958331823349, "num_tokens": 87620773.0, "step": 38255 }, { "entropy": 5.835418081283569, "epoch": 3.78212732305259, "grad_norm": 1.234375, "learning_rate": 0.00036303829061671986, "loss": 5.0092, "mean_token_accuracy": 0.21755923926830292, "num_tokens": 87633248.0, "step": 38260 }, { "entropy": 5.782951831817627, "epoch": 3.7826215895610913, "grad_norm": 1.2265625, "learning_rate": 0.0003630058131820495, "loss": 4.9815, "mean_token_accuracy": 0.22020128220319748, "num_tokens": 87644710.0, "step": 38265 }, { "entropy": 5.73781909942627, "epoch": 3.7831158560695926, "grad_norm": 1.1640625, "learning_rate": 0.0003629733335824226, "loss": 4.9211, "mean_token_accuracy": 0.22974741756916045, "num_tokens": 87655297.0, "step": 38270 }, { "entropy": 5.74844069480896, "epoch": 3.7836101225780943, "grad_norm": 1.2734375, "learning_rate": 0.000362940851818638, "loss": 4.9277, "mean_token_accuracy": 0.22986202389001847, "num_tokens": 87667595.0, "step": 38275 }, { "entropy": 5.748209142684937, "epoch": 3.7841043890865955, "grad_norm": 1.1328125, "learning_rate": 0.00036290836789149483, "loss": 4.9381, "mean_token_accuracy": 0.22753172218799592, "num_tokens": 87680041.0, "step": 38280 }, { "entropy": 5.7980231761932375, "epoch": 3.784598655595097, "grad_norm": 1.2265625, "learning_rate": 0.00036287588180179215, "loss": 5.0026, "mean_token_accuracy": 0.22103807032108308, "num_tokens": 87691287.0, "step": 38285 }, { "entropy": 5.740351676940918, "epoch": 3.7850929221035985, "grad_norm": 1.3046875, "learning_rate": 0.0003628433935503291, "loss": 4.9872, "mean_token_accuracy": 0.22585272043943405, "num_tokens": 87704224.0, "step": 38290 }, { "entropy": 5.748596239089966, "epoch": 3.7855871886120998, "grad_norm": 1.265625, "learning_rate": 0.000362810903137905, "loss": 4.9601, "mean_token_accuracy": 0.22943371087312697, "num_tokens": 87714449.0, "step": 38295 }, { "entropy": 5.772917366027832, "epoch": 3.786081455120601, "grad_norm": 1.234375, "learning_rate": 0.000362778410565319, "loss": 4.9636, "mean_token_accuracy": 0.22030484229326247, "num_tokens": 87725348.0, "step": 38300 }, { "entropy": 5.754444026947022, "epoch": 3.7865757216291023, "grad_norm": 1.296875, "learning_rate": 0.00036274591583337055, "loss": 4.9565, "mean_token_accuracy": 0.22712165415287017, "num_tokens": 87737244.0, "step": 38305 }, { "entropy": 5.721923208236694, "epoch": 3.7870699881376035, "grad_norm": 1.1640625, "learning_rate": 0.00036271341894285894, "loss": 4.9572, "mean_token_accuracy": 0.22210686802864074, "num_tokens": 87748710.0, "step": 38310 }, { "entropy": 5.763736867904663, "epoch": 3.7875642546461052, "grad_norm": 1.203125, "learning_rate": 0.00036268091989458357, "loss": 5.0401, "mean_token_accuracy": 0.22098899781703948, "num_tokens": 87759944.0, "step": 38315 }, { "entropy": 5.8263712406158445, "epoch": 3.7880585211546065, "grad_norm": 1.328125, "learning_rate": 0.0003626484186893441, "loss": 4.9724, "mean_token_accuracy": 0.22450798004865646, "num_tokens": 87771201.0, "step": 38320 }, { "entropy": 5.77383246421814, "epoch": 3.788552787663108, "grad_norm": 1.1640625, "learning_rate": 0.0003626159153279398, "loss": 4.9258, "mean_token_accuracy": 0.23120176643133164, "num_tokens": 87782129.0, "step": 38325 }, { "entropy": 5.724788331985474, "epoch": 3.7890470541716095, "grad_norm": 1.21875, "learning_rate": 0.00036258340981117044, "loss": 4.9173, "mean_token_accuracy": 0.23080307841300965, "num_tokens": 87792915.0, "step": 38330 }, { "entropy": 5.767858219146729, "epoch": 3.7895413206801107, "grad_norm": 1.2578125, "learning_rate": 0.00036255090213983555, "loss": 4.9226, "mean_token_accuracy": 0.22401067167520522, "num_tokens": 87803301.0, "step": 38335 }, { "entropy": 5.778872966766357, "epoch": 3.790035587188612, "grad_norm": 1.2109375, "learning_rate": 0.00036251839231473494, "loss": 5.0187, "mean_token_accuracy": 0.2227788582444191, "num_tokens": 87815167.0, "step": 38340 }, { "entropy": 5.753599786758423, "epoch": 3.7905298536971133, "grad_norm": 1.234375, "learning_rate": 0.0003624858803366684, "loss": 4.9782, "mean_token_accuracy": 0.22499951273202895, "num_tokens": 87827348.0, "step": 38345 }, { "entropy": 5.729551124572754, "epoch": 3.791024120205615, "grad_norm": 1.2265625, "learning_rate": 0.0003624533662064355, "loss": 4.9247, "mean_token_accuracy": 0.23431379050016404, "num_tokens": 87837986.0, "step": 38350 }, { "entropy": 5.749391555786133, "epoch": 3.7915183867141162, "grad_norm": 1.3125, "learning_rate": 0.0003624208499248362, "loss": 4.87, "mean_token_accuracy": 0.2357859343290329, "num_tokens": 87847992.0, "step": 38355 }, { "entropy": 5.801260662078858, "epoch": 3.7920126532226175, "grad_norm": 1.203125, "learning_rate": 0.0003623883314926705, "loss": 5.0907, "mean_token_accuracy": 0.21952947825193406, "num_tokens": 87859768.0, "step": 38360 }, { "entropy": 5.760098600387574, "epoch": 3.792506919731119, "grad_norm": 1.21875, "learning_rate": 0.0003623558109107383, "loss": 4.9696, "mean_token_accuracy": 0.21976616531610488, "num_tokens": 87871366.0, "step": 38365 }, { "entropy": 5.747028779983521, "epoch": 3.7930011862396205, "grad_norm": 1.3203125, "learning_rate": 0.0003623232881798395, "loss": 4.9494, "mean_token_accuracy": 0.2308356985449791, "num_tokens": 87883074.0, "step": 38370 }, { "entropy": 5.720154762268066, "epoch": 3.7934954527481217, "grad_norm": 1.1875, "learning_rate": 0.00036229076330077445, "loss": 4.9406, "mean_token_accuracy": 0.22300800830125808, "num_tokens": 87894906.0, "step": 38375 }, { "entropy": 5.738593196868896, "epoch": 3.793989719256623, "grad_norm": 1.171875, "learning_rate": 0.0003622582362743429, "loss": 4.8787, "mean_token_accuracy": 0.2324230194091797, "num_tokens": 87906027.0, "step": 38380 }, { "entropy": 5.753184843063354, "epoch": 3.7944839857651247, "grad_norm": 1.2734375, "learning_rate": 0.0003622257071013453, "loss": 4.9649, "mean_token_accuracy": 0.21730988025665282, "num_tokens": 87916348.0, "step": 38385 }, { "entropy": 5.750005197525025, "epoch": 3.794978252273626, "grad_norm": 1.2734375, "learning_rate": 0.0003621931757825817, "loss": 4.9657, "mean_token_accuracy": 0.22124162316322327, "num_tokens": 87928397.0, "step": 38390 }, { "entropy": 5.79720983505249, "epoch": 3.795472518782127, "grad_norm": 1.203125, "learning_rate": 0.00036216064231885255, "loss": 4.9773, "mean_token_accuracy": 0.21621413081884383, "num_tokens": 87939925.0, "step": 38395 }, { "entropy": 5.734981346130371, "epoch": 3.795966785290629, "grad_norm": 1.265625, "learning_rate": 0.00036212810671095797, "loss": 4.9737, "mean_token_accuracy": 0.22742882668972014, "num_tokens": 87951166.0, "step": 38400 }, { "entropy": 5.7364801406860355, "epoch": 3.79646105179913, "grad_norm": 1.1796875, "learning_rate": 0.00036209556895969847, "loss": 4.9053, "mean_token_accuracy": 0.23710869252681732, "num_tokens": 87962861.0, "step": 38405 }, { "entropy": 5.68361611366272, "epoch": 3.7969553183076314, "grad_norm": 1.2109375, "learning_rate": 0.0003620630290658745, "loss": 4.8251, "mean_token_accuracy": 0.23367105126380922, "num_tokens": 87974362.0, "step": 38410 }, { "entropy": 5.745436143875122, "epoch": 3.7974495848161327, "grad_norm": 1.203125, "learning_rate": 0.0003620304870302865, "loss": 4.9645, "mean_token_accuracy": 0.229224357008934, "num_tokens": 87984982.0, "step": 38415 }, { "entropy": 5.763537883758545, "epoch": 3.797943851324634, "grad_norm": 1.1875, "learning_rate": 0.00036199794285373505, "loss": 4.9161, "mean_token_accuracy": 0.23079071044921876, "num_tokens": 87996980.0, "step": 38420 }, { "entropy": 5.776569604873657, "epoch": 3.7984381178331357, "grad_norm": 1.2734375, "learning_rate": 0.00036196539653702073, "loss": 4.9324, "mean_token_accuracy": 0.22842410057783127, "num_tokens": 88008585.0, "step": 38425 }, { "entropy": 5.730450010299682, "epoch": 3.798932384341637, "grad_norm": 1.1640625, "learning_rate": 0.000361932848080944, "loss": 4.9199, "mean_token_accuracy": 0.2352994441986084, "num_tokens": 88020779.0, "step": 38430 }, { "entropy": 5.795297908782959, "epoch": 3.7994266508501386, "grad_norm": 1.234375, "learning_rate": 0.0003619002974863059, "loss": 5.0268, "mean_token_accuracy": 0.21689335256814957, "num_tokens": 88033003.0, "step": 38435 }, { "entropy": 5.740248918533325, "epoch": 3.79992091735864, "grad_norm": 1.1171875, "learning_rate": 0.00036186774475390686, "loss": 4.9308, "mean_token_accuracy": 0.22629230618476867, "num_tokens": 88044095.0, "step": 38440 }, { "entropy": 5.802647495269776, "epoch": 3.800415183867141, "grad_norm": 1.2265625, "learning_rate": 0.00036183518988454794, "loss": 5.0129, "mean_token_accuracy": 0.22315700501203536, "num_tokens": 88056487.0, "step": 38445 }, { "entropy": 5.753944826126099, "epoch": 3.8009094503756424, "grad_norm": 1.171875, "learning_rate": 0.0003618026328790299, "loss": 4.976, "mean_token_accuracy": 0.2270748272538185, "num_tokens": 88067803.0, "step": 38450 }, { "entropy": 5.832457113265991, "epoch": 3.8014037168841437, "grad_norm": 1.2265625, "learning_rate": 0.0003617700737381535, "loss": 4.988, "mean_token_accuracy": 0.2283177763223648, "num_tokens": 88078914.0, "step": 38455 }, { "entropy": 5.796089220046997, "epoch": 3.8018979833926454, "grad_norm": 1.359375, "learning_rate": 0.0003617375124627199, "loss": 4.9574, "mean_token_accuracy": 0.2189305081963539, "num_tokens": 88090567.0, "step": 38460 }, { "entropy": 5.752261209487915, "epoch": 3.8023922499011467, "grad_norm": 1.2890625, "learning_rate": 0.00036170494905352996, "loss": 4.9626, "mean_token_accuracy": 0.21865417659282685, "num_tokens": 88101171.0, "step": 38465 }, { "entropy": 5.767463302612304, "epoch": 3.802886516409648, "grad_norm": 1.21875, "learning_rate": 0.00036167238351138487, "loss": 4.9874, "mean_token_accuracy": 0.22491028010845185, "num_tokens": 88111629.0, "step": 38470 }, { "entropy": 5.83456597328186, "epoch": 3.8033807829181496, "grad_norm": 1.328125, "learning_rate": 0.00036163981583708574, "loss": 4.9812, "mean_token_accuracy": 0.21840023547410964, "num_tokens": 88122354.0, "step": 38475 }, { "entropy": 5.745080280303955, "epoch": 3.803875049426651, "grad_norm": 1.2421875, "learning_rate": 0.0003616072460314336, "loss": 4.9317, "mean_token_accuracy": 0.22894297242164613, "num_tokens": 88134830.0, "step": 38480 }, { "entropy": 5.703588581085205, "epoch": 3.804369315935152, "grad_norm": 1.3359375, "learning_rate": 0.00036157467409522986, "loss": 4.8779, "mean_token_accuracy": 0.22895611822605133, "num_tokens": 88145995.0, "step": 38485 }, { "entropy": 5.796066761016846, "epoch": 3.8048635824436534, "grad_norm": 1.34375, "learning_rate": 0.0003615421000292757, "loss": 5.0057, "mean_token_accuracy": 0.2224449634552002, "num_tokens": 88157777.0, "step": 38490 }, { "entropy": 5.819619464874267, "epoch": 3.805357848952155, "grad_norm": 1.265625, "learning_rate": 0.00036150952383437246, "loss": 4.9997, "mean_token_accuracy": 0.2208433046936989, "num_tokens": 88169971.0, "step": 38495 }, { "entropy": 5.732924938201904, "epoch": 3.8058521154606564, "grad_norm": 1.265625, "learning_rate": 0.0003614769455113215, "loss": 4.8882, "mean_token_accuracy": 0.2283529594540596, "num_tokens": 88181317.0, "step": 38500 }, { "entropy": 5.817422389984131, "epoch": 3.8063463819691576, "grad_norm": 1.125, "learning_rate": 0.0003614443650609242, "loss": 5.0768, "mean_token_accuracy": 0.212154258787632, "num_tokens": 88194603.0, "step": 38505 }, { "entropy": 5.792971849441528, "epoch": 3.8068406484776594, "grad_norm": 1.171875, "learning_rate": 0.0003614117824839822, "loss": 5.0323, "mean_token_accuracy": 0.22379914820194244, "num_tokens": 88205775.0, "step": 38510 }, { "entropy": 5.754872179031372, "epoch": 3.8073349149861606, "grad_norm": 1.2421875, "learning_rate": 0.0003613791977812969, "loss": 4.974, "mean_token_accuracy": 0.2208371192216873, "num_tokens": 88216784.0, "step": 38515 }, { "entropy": 5.796415519714356, "epoch": 3.807829181494662, "grad_norm": 1.2578125, "learning_rate": 0.00036134661095367, "loss": 4.9373, "mean_token_accuracy": 0.22468699514865875, "num_tokens": 88228861.0, "step": 38520 }, { "entropy": 5.7819616317749025, "epoch": 3.808323448003163, "grad_norm": 1.1796875, "learning_rate": 0.00036131402200190296, "loss": 4.9524, "mean_token_accuracy": 0.22730890810489654, "num_tokens": 88241134.0, "step": 38525 }, { "entropy": 5.715646600723266, "epoch": 3.808817714511665, "grad_norm": 1.3125, "learning_rate": 0.00036128143092679764, "loss": 4.9452, "mean_token_accuracy": 0.2244659036397934, "num_tokens": 88253295.0, "step": 38530 }, { "entropy": 5.795124435424805, "epoch": 3.809311981020166, "grad_norm": 1.1640625, "learning_rate": 0.00036124883772915573, "loss": 4.9785, "mean_token_accuracy": 0.22221399694681168, "num_tokens": 88265906.0, "step": 38535 }, { "entropy": 5.742788076400757, "epoch": 3.8098062475286674, "grad_norm": 1.2421875, "learning_rate": 0.0003612162424097791, "loss": 4.8699, "mean_token_accuracy": 0.23514126539230346, "num_tokens": 88276928.0, "step": 38540 }, { "entropy": 5.716719150543213, "epoch": 3.810300514037169, "grad_norm": 1.2578125, "learning_rate": 0.00036118364496946943, "loss": 4.9135, "mean_token_accuracy": 0.22747474014759064, "num_tokens": 88288125.0, "step": 38545 }, { "entropy": 5.765071630477905, "epoch": 3.8107947805456703, "grad_norm": 1.34375, "learning_rate": 0.0003611510454090288, "loss": 4.9568, "mean_token_accuracy": 0.2240847334265709, "num_tokens": 88298778.0, "step": 38550 }, { "entropy": 5.796245813369751, "epoch": 3.8112890470541716, "grad_norm": 1.3203125, "learning_rate": 0.000361118443729259, "loss": 4.9566, "mean_token_accuracy": 0.2243811532855034, "num_tokens": 88309086.0, "step": 38555 }, { "entropy": 5.761635398864746, "epoch": 3.811783313562673, "grad_norm": 1.125, "learning_rate": 0.0003610858399309622, "loss": 4.9834, "mean_token_accuracy": 0.22224853187799454, "num_tokens": 88320358.0, "step": 38560 }, { "entropy": 5.723652696609497, "epoch": 3.812277580071174, "grad_norm": 1.2265625, "learning_rate": 0.0003610532340149404, "loss": 4.8747, "mean_token_accuracy": 0.2352326676249504, "num_tokens": 88331767.0, "step": 38565 }, { "entropy": 5.722182750701904, "epoch": 3.812771846579676, "grad_norm": 1.1953125, "learning_rate": 0.00036102062598199566, "loss": 4.8738, "mean_token_accuracy": 0.22826676666736603, "num_tokens": 88342197.0, "step": 38570 }, { "entropy": 5.780563688278198, "epoch": 3.813266113088177, "grad_norm": 1.2578125, "learning_rate": 0.0003609880158329301, "loss": 4.9426, "mean_token_accuracy": 0.2273011952638626, "num_tokens": 88353378.0, "step": 38575 }, { "entropy": 5.6785595417022705, "epoch": 3.813760379596679, "grad_norm": 1.21875, "learning_rate": 0.0003609554035685462, "loss": 4.8759, "mean_token_accuracy": 0.23317303210496904, "num_tokens": 88366006.0, "step": 38580 }, { "entropy": 5.821148347854614, "epoch": 3.81425464610518, "grad_norm": 1.2578125, "learning_rate": 0.0003609227891896459, "loss": 5.0539, "mean_token_accuracy": 0.22001373022794724, "num_tokens": 88378132.0, "step": 38585 }, { "entropy": 5.737678146362304, "epoch": 3.8147489126136813, "grad_norm": 1.28125, "learning_rate": 0.00036089017269703164, "loss": 4.9127, "mean_token_accuracy": 0.2250444307923317, "num_tokens": 88389760.0, "step": 38590 }, { "entropy": 5.703362846374512, "epoch": 3.8152431791221826, "grad_norm": 1.328125, "learning_rate": 0.00036085755409150577, "loss": 4.9425, "mean_token_accuracy": 0.2284134656190872, "num_tokens": 88402518.0, "step": 38595 }, { "entropy": 5.771936559677124, "epoch": 3.815737445630684, "grad_norm": 1.2734375, "learning_rate": 0.0003608249333738709, "loss": 5.0015, "mean_token_accuracy": 0.21708550304174423, "num_tokens": 88413359.0, "step": 38600 }, { "entropy": 5.813227319717408, "epoch": 3.8162317121391856, "grad_norm": 1.2890625, "learning_rate": 0.0003607923105449292, "loss": 4.9773, "mean_token_accuracy": 0.21970864832401277, "num_tokens": 88424966.0, "step": 38605 }, { "entropy": 5.718343353271484, "epoch": 3.816725978647687, "grad_norm": 1.1484375, "learning_rate": 0.00036075968560548346, "loss": 4.8407, "mean_token_accuracy": 0.23425922989845277, "num_tokens": 88435826.0, "step": 38610 }, { "entropy": 5.68151593208313, "epoch": 3.817220245156188, "grad_norm": 1.234375, "learning_rate": 0.00036072705855633613, "loss": 4.8962, "mean_token_accuracy": 0.23387911915779114, "num_tokens": 88447136.0, "step": 38615 }, { "entropy": 5.650468349456787, "epoch": 3.81771451166469, "grad_norm": 1.34375, "learning_rate": 0.0003606944293982898, "loss": 4.8508, "mean_token_accuracy": 0.23945784121751784, "num_tokens": 88458394.0, "step": 38620 }, { "entropy": 5.805815696716309, "epoch": 3.818208778173191, "grad_norm": 1.0703125, "learning_rate": 0.0003606617981321473, "loss": 4.9495, "mean_token_accuracy": 0.2281596392393112, "num_tokens": 88469573.0, "step": 38625 }, { "entropy": 5.778375196456909, "epoch": 3.8187030446816923, "grad_norm": 1.4453125, "learning_rate": 0.00036062916475871124, "loss": 4.8847, "mean_token_accuracy": 0.234144826233387, "num_tokens": 88479561.0, "step": 38630 }, { "entropy": 5.7266237258911135, "epoch": 3.8191973111901936, "grad_norm": 1.171875, "learning_rate": 0.00036059652927878446, "loss": 4.9825, "mean_token_accuracy": 0.22871050089597703, "num_tokens": 88492296.0, "step": 38635 }, { "entropy": 5.782790946960449, "epoch": 3.8196915776986953, "grad_norm": 1.28125, "learning_rate": 0.00036056389169316977, "loss": 5.0642, "mean_token_accuracy": 0.22096779495477675, "num_tokens": 88504993.0, "step": 38640 }, { "entropy": 5.752505970001221, "epoch": 3.8201858442071965, "grad_norm": 1.2109375, "learning_rate": 0.00036053125200267, "loss": 4.9282, "mean_token_accuracy": 0.23099552989006042, "num_tokens": 88516126.0, "step": 38645 }, { "entropy": 5.7910315990448, "epoch": 3.820680110715698, "grad_norm": 1.390625, "learning_rate": 0.0003604986102080882, "loss": 4.9952, "mean_token_accuracy": 0.21310860961675643, "num_tokens": 88527327.0, "step": 38650 }, { "entropy": 5.701392269134521, "epoch": 3.8211743772241995, "grad_norm": 1.1875, "learning_rate": 0.0003604659663102274, "loss": 4.8475, "mean_token_accuracy": 0.23302048444747925, "num_tokens": 88539088.0, "step": 38655 }, { "entropy": 5.708590078353882, "epoch": 3.8216686437327008, "grad_norm": 1.2578125, "learning_rate": 0.0003604333203098905, "loss": 4.9111, "mean_token_accuracy": 0.22605914622545242, "num_tokens": 88551539.0, "step": 38660 }, { "entropy": 5.757379817962646, "epoch": 3.822162910241202, "grad_norm": 1.21875, "learning_rate": 0.00036040067220788075, "loss": 4.9308, "mean_token_accuracy": 0.2261853575706482, "num_tokens": 88563111.0, "step": 38665 }, { "entropy": 5.754641342163086, "epoch": 3.8226571767497033, "grad_norm": 1.3828125, "learning_rate": 0.0003603680220050011, "loss": 4.9566, "mean_token_accuracy": 0.23046756088733672, "num_tokens": 88574181.0, "step": 38670 }, { "entropy": 5.782589101791382, "epoch": 3.8231514432582046, "grad_norm": 1.234375, "learning_rate": 0.00036033536970205487, "loss": 4.9981, "mean_token_accuracy": 0.2266621023416519, "num_tokens": 88584965.0, "step": 38675 }, { "entropy": 5.848534631729126, "epoch": 3.8236457097667063, "grad_norm": 1.40625, "learning_rate": 0.00036030271529984535, "loss": 5.0441, "mean_token_accuracy": 0.21533331423997878, "num_tokens": 88597390.0, "step": 38680 }, { "entropy": 5.809558963775634, "epoch": 3.8241399762752075, "grad_norm": 1.2265625, "learning_rate": 0.0003602700587991759, "loss": 4.9575, "mean_token_accuracy": 0.2284396171569824, "num_tokens": 88609470.0, "step": 38685 }, { "entropy": 5.7601337909698485, "epoch": 3.8246342427837092, "grad_norm": 1.3359375, "learning_rate": 0.00036023740020084963, "loss": 4.9431, "mean_token_accuracy": 0.22481801360845566, "num_tokens": 88620858.0, "step": 38690 }, { "entropy": 5.779210090637207, "epoch": 3.8251285092922105, "grad_norm": 1.3515625, "learning_rate": 0.0003602047395056701, "loss": 4.9897, "mean_token_accuracy": 0.2229233890771866, "num_tokens": 88632191.0, "step": 38695 }, { "entropy": 5.78726601600647, "epoch": 3.8256227758007118, "grad_norm": 1.28125, "learning_rate": 0.00036017207671444086, "loss": 4.9828, "mean_token_accuracy": 0.22114255726337434, "num_tokens": 88643405.0, "step": 38700 }, { "entropy": 5.719884872436523, "epoch": 3.826117042309213, "grad_norm": 1.265625, "learning_rate": 0.00036013941182796516, "loss": 4.8149, "mean_token_accuracy": 0.23648451119661332, "num_tokens": 88653765.0, "step": 38705 }, { "entropy": 5.7795919418334964, "epoch": 3.8266113088177143, "grad_norm": 1.1953125, "learning_rate": 0.00036010674484704684, "loss": 4.9827, "mean_token_accuracy": 0.2190888747572899, "num_tokens": 88665038.0, "step": 38710 }, { "entropy": 5.726240968704223, "epoch": 3.827105575326216, "grad_norm": 1.296875, "learning_rate": 0.0003600740757724894, "loss": 4.9119, "mean_token_accuracy": 0.23566055446863174, "num_tokens": 88675172.0, "step": 38715 }, { "entropy": 5.750473260879517, "epoch": 3.8275998418347172, "grad_norm": 1.1953125, "learning_rate": 0.00036004140460509646, "loss": 4.972, "mean_token_accuracy": 0.22573740780353546, "num_tokens": 88687393.0, "step": 38720 }, { "entropy": 5.853509521484375, "epoch": 3.8280941083432185, "grad_norm": 1.3515625, "learning_rate": 0.0003600087313456718, "loss": 5.0348, "mean_token_accuracy": 0.21617888510227204, "num_tokens": 88700117.0, "step": 38725 }, { "entropy": 5.762597131729126, "epoch": 3.82858837485172, "grad_norm": 1.4375, "learning_rate": 0.00035997605599501914, "loss": 4.9548, "mean_token_accuracy": 0.22774316370487213, "num_tokens": 88711329.0, "step": 38730 }, { "entropy": 5.81672945022583, "epoch": 3.8290826413602215, "grad_norm": 1.25, "learning_rate": 0.0003599433785539423, "loss": 5.0012, "mean_token_accuracy": 0.22332691103219987, "num_tokens": 88722017.0, "step": 38735 }, { "entropy": 5.722673416137695, "epoch": 3.8295769078687227, "grad_norm": 1.2265625, "learning_rate": 0.00035991069902324517, "loss": 4.922, "mean_token_accuracy": 0.22938984334468843, "num_tokens": 88733749.0, "step": 38740 }, { "entropy": 5.773297119140625, "epoch": 3.830071174377224, "grad_norm": 1.2734375, "learning_rate": 0.0003598780174037318, "loss": 4.9374, "mean_token_accuracy": 0.2268606022000313, "num_tokens": 88745885.0, "step": 38745 }, { "entropy": 5.841207790374756, "epoch": 3.8305654408857257, "grad_norm": 1.296875, "learning_rate": 0.0003598453336962059, "loss": 5.0833, "mean_token_accuracy": 0.21651489585638045, "num_tokens": 88759216.0, "step": 38750 }, { "entropy": 5.74736180305481, "epoch": 3.831059707394227, "grad_norm": 1.2578125, "learning_rate": 0.00035981264790147167, "loss": 4.9892, "mean_token_accuracy": 0.2230536237359047, "num_tokens": 88770272.0, "step": 38755 }, { "entropy": 5.698786354064941, "epoch": 3.8315539739027282, "grad_norm": 1.2109375, "learning_rate": 0.0003597799600203331, "loss": 4.8689, "mean_token_accuracy": 0.2378442943096161, "num_tokens": 88781509.0, "step": 38760 }, { "entropy": 5.770243167877197, "epoch": 3.83204824041123, "grad_norm": 1.296875, "learning_rate": 0.00035974727005359434, "loss": 4.9788, "mean_token_accuracy": 0.22589323073625564, "num_tokens": 88791770.0, "step": 38765 }, { "entropy": 5.764696550369263, "epoch": 3.832542506919731, "grad_norm": 1.3671875, "learning_rate": 0.0003597145780020597, "loss": 4.9725, "mean_token_accuracy": 0.22748714089393615, "num_tokens": 88804344.0, "step": 38770 }, { "entropy": 5.753374528884888, "epoch": 3.8330367734282325, "grad_norm": 1.296875, "learning_rate": 0.0003596818838665333, "loss": 4.8872, "mean_token_accuracy": 0.23273838460445403, "num_tokens": 88816251.0, "step": 38775 }, { "entropy": 5.693378686904907, "epoch": 3.8335310399367337, "grad_norm": 1.234375, "learning_rate": 0.0003596491876478193, "loss": 4.9326, "mean_token_accuracy": 0.22621732652187349, "num_tokens": 88827805.0, "step": 38780 }, { "entropy": 5.763323593139648, "epoch": 3.8340253064452354, "grad_norm": 1.1953125, "learning_rate": 0.0003596164893467222, "loss": 4.9282, "mean_token_accuracy": 0.22901551723480223, "num_tokens": 88839237.0, "step": 38785 }, { "entropy": 5.882288789749145, "epoch": 3.8345195729537367, "grad_norm": 1.4296875, "learning_rate": 0.00035958378896404635, "loss": 5.0416, "mean_token_accuracy": 0.21981064081192017, "num_tokens": 88850950.0, "step": 38790 }, { "entropy": 5.735190343856812, "epoch": 3.835013839462238, "grad_norm": 1.203125, "learning_rate": 0.00035955108650059613, "loss": 4.9189, "mean_token_accuracy": 0.23332116305828093, "num_tokens": 88863743.0, "step": 38795 }, { "entropy": 5.683094453811646, "epoch": 3.8355081059707397, "grad_norm": 1.109375, "learning_rate": 0.00035951838195717614, "loss": 4.8706, "mean_token_accuracy": 0.23135916441679, "num_tokens": 88875375.0, "step": 38800 }, { "entropy": 5.792744493484497, "epoch": 3.836002372479241, "grad_norm": 1.2109375, "learning_rate": 0.00035948567533459076, "loss": 4.999, "mean_token_accuracy": 0.22894601672887802, "num_tokens": 88885890.0, "step": 38805 }, { "entropy": 5.807839727401733, "epoch": 3.836496638987742, "grad_norm": 1.2109375, "learning_rate": 0.00035945296663364467, "loss": 4.9532, "mean_token_accuracy": 0.22057102620601654, "num_tokens": 88897783.0, "step": 38810 }, { "entropy": 5.7756999969482425, "epoch": 3.8369909054962434, "grad_norm": 1.1171875, "learning_rate": 0.00035942025585514257, "loss": 4.9903, "mean_token_accuracy": 0.226309172809124, "num_tokens": 88908982.0, "step": 38815 }, { "entropy": 5.686149930953979, "epoch": 3.8374851720047447, "grad_norm": 1.2265625, "learning_rate": 0.000359387542999889, "loss": 4.8565, "mean_token_accuracy": 0.24286628067493438, "num_tokens": 88921059.0, "step": 38820 }, { "entropy": 5.798223781585693, "epoch": 3.8379794385132464, "grad_norm": 1.2421875, "learning_rate": 0.0003593548280686889, "loss": 5.0786, "mean_token_accuracy": 0.20993549525737762, "num_tokens": 88932988.0, "step": 38825 }, { "entropy": 5.790928745269776, "epoch": 3.8384737050217477, "grad_norm": 1.21875, "learning_rate": 0.0003593221110623468, "loss": 4.9542, "mean_token_accuracy": 0.22731160074472428, "num_tokens": 88944890.0, "step": 38830 }, { "entropy": 5.763184595108032, "epoch": 3.8389679715302494, "grad_norm": 1.1875, "learning_rate": 0.00035928939198166777, "loss": 4.9534, "mean_token_accuracy": 0.2276351422071457, "num_tokens": 88956936.0, "step": 38835 }, { "entropy": 5.776267957687378, "epoch": 3.8394622380387506, "grad_norm": 1.234375, "learning_rate": 0.0003592566708274566, "loss": 4.9883, "mean_token_accuracy": 0.22827732414007187, "num_tokens": 88968705.0, "step": 38840 }, { "entropy": 5.74217209815979, "epoch": 3.839956504547252, "grad_norm": 1.171875, "learning_rate": 0.0003592239476005183, "loss": 4.8825, "mean_token_accuracy": 0.23492239266633988, "num_tokens": 88979977.0, "step": 38845 }, { "entropy": 5.7370171546936035, "epoch": 3.840450771055753, "grad_norm": 1.2265625, "learning_rate": 0.0003591912223016578, "loss": 4.9955, "mean_token_accuracy": 0.21851376593112945, "num_tokens": 88991974.0, "step": 38850 }, { "entropy": 5.713030767440796, "epoch": 3.8409450375642544, "grad_norm": 1.2421875, "learning_rate": 0.0003591584949316801, "loss": 4.903, "mean_token_accuracy": 0.2345935359597206, "num_tokens": 89003733.0, "step": 38855 }, { "entropy": 5.847453927993774, "epoch": 3.841439304072756, "grad_norm": 1.140625, "learning_rate": 0.0003591257654913904, "loss": 5.0432, "mean_token_accuracy": 0.20937418341636657, "num_tokens": 89015701.0, "step": 38860 }, { "entropy": 5.841371679306031, "epoch": 3.8419335705812574, "grad_norm": 1.1796875, "learning_rate": 0.0003590930339815938, "loss": 5.0209, "mean_token_accuracy": 0.22092653661966324, "num_tokens": 89027216.0, "step": 38865 }, { "entropy": 5.8067199230194095, "epoch": 3.8424278370897587, "grad_norm": 1.234375, "learning_rate": 0.0003590603004030956, "loss": 4.9559, "mean_token_accuracy": 0.22416433542966843, "num_tokens": 89039305.0, "step": 38870 }, { "entropy": 5.7390532970428465, "epoch": 3.8429221035982604, "grad_norm": 1.21875, "learning_rate": 0.000359027564756701, "loss": 4.8797, "mean_token_accuracy": 0.23254089653491974, "num_tokens": 89049982.0, "step": 38875 }, { "entropy": 5.748529624938965, "epoch": 3.8434163701067616, "grad_norm": 1.15625, "learning_rate": 0.0003589948270432151, "loss": 4.948, "mean_token_accuracy": 0.23012804090976716, "num_tokens": 89062039.0, "step": 38880 }, { "entropy": 5.755610513687134, "epoch": 3.843910636615263, "grad_norm": 1.2109375, "learning_rate": 0.0003589620872634436, "loss": 4.9483, "mean_token_accuracy": 0.22757059037685395, "num_tokens": 89072621.0, "step": 38885 }, { "entropy": 5.796428632736206, "epoch": 3.844404903123764, "grad_norm": 1.453125, "learning_rate": 0.0003589293454181916, "loss": 4.9187, "mean_token_accuracy": 0.22796160131692886, "num_tokens": 89084019.0, "step": 38890 }, { "entropy": 5.777689504623413, "epoch": 3.844899169632266, "grad_norm": 1.2734375, "learning_rate": 0.00035889660150826473, "loss": 4.9561, "mean_token_accuracy": 0.2256498709321022, "num_tokens": 89094305.0, "step": 38895 }, { "entropy": 5.707172632217407, "epoch": 3.845393436140767, "grad_norm": 1.2578125, "learning_rate": 0.00035886385553446853, "loss": 4.9623, "mean_token_accuracy": 0.2203045204281807, "num_tokens": 89106261.0, "step": 38900 }, { "entropy": 5.69955096244812, "epoch": 3.8458877026492684, "grad_norm": 1.3046875, "learning_rate": 0.00035883110749760836, "loss": 4.9013, "mean_token_accuracy": 0.22885473668575287, "num_tokens": 89118171.0, "step": 38905 }, { "entropy": 5.809811973571778, "epoch": 3.84638196915777, "grad_norm": 1.3125, "learning_rate": 0.00035879835739848994, "loss": 5.0386, "mean_token_accuracy": 0.22211336493492126, "num_tokens": 89129953.0, "step": 38910 }, { "entropy": 5.695519304275512, "epoch": 3.8468762356662713, "grad_norm": 1.2109375, "learning_rate": 0.000358765605237919, "loss": 4.8589, "mean_token_accuracy": 0.23657006323337554, "num_tokens": 89143284.0, "step": 38915 }, { "entropy": 5.790096426010132, "epoch": 3.8473705021747726, "grad_norm": 1.328125, "learning_rate": 0.0003587328510167012, "loss": 4.9947, "mean_token_accuracy": 0.22115783393383026, "num_tokens": 89154675.0, "step": 38920 }, { "entropy": 5.823217535018921, "epoch": 3.847864768683274, "grad_norm": 1.3359375, "learning_rate": 0.0003587000947356421, "loss": 5.0133, "mean_token_accuracy": 0.21787019371986388, "num_tokens": 89164576.0, "step": 38925 }, { "entropy": 5.771351003646851, "epoch": 3.848359035191775, "grad_norm": 1.1875, "learning_rate": 0.00035866733639554777, "loss": 5.0358, "mean_token_accuracy": 0.21166231334209443, "num_tokens": 89176106.0, "step": 38930 }, { "entropy": 5.773771953582764, "epoch": 3.848853301700277, "grad_norm": 1.171875, "learning_rate": 0.000358634575997224, "loss": 4.9562, "mean_token_accuracy": 0.223372446000576, "num_tokens": 89187214.0, "step": 38935 }, { "entropy": 5.695539712905884, "epoch": 3.849347568208778, "grad_norm": 1.3671875, "learning_rate": 0.0003586018135414767, "loss": 4.8395, "mean_token_accuracy": 0.2304440751671791, "num_tokens": 89198366.0, "step": 38940 }, { "entropy": 5.735632991790771, "epoch": 3.84984183471728, "grad_norm": 1.328125, "learning_rate": 0.0003585690490291119, "loss": 5.0195, "mean_token_accuracy": 0.22199472039937973, "num_tokens": 89209122.0, "step": 38945 }, { "entropy": 5.809645557403565, "epoch": 3.850336101225781, "grad_norm": 1.203125, "learning_rate": 0.0003585362824609354, "loss": 5.0177, "mean_token_accuracy": 0.21956222206354142, "num_tokens": 89221104.0, "step": 38950 }, { "entropy": 5.806887817382813, "epoch": 3.8508303677342823, "grad_norm": 1.3046875, "learning_rate": 0.0003585035138377534, "loss": 4.9837, "mean_token_accuracy": 0.22624120116233826, "num_tokens": 89231087.0, "step": 38955 }, { "entropy": 5.782963848114013, "epoch": 3.8513246342427836, "grad_norm": 1.2578125, "learning_rate": 0.00035847074316037206, "loss": 5.0412, "mean_token_accuracy": 0.2204209163784981, "num_tokens": 89243198.0, "step": 38960 }, { "entropy": 5.713662385940552, "epoch": 3.851818900751285, "grad_norm": 1.28125, "learning_rate": 0.0003584379704295975, "loss": 4.9431, "mean_token_accuracy": 0.22764402031898498, "num_tokens": 89254408.0, "step": 38965 }, { "entropy": 5.822534513473511, "epoch": 3.8523131672597866, "grad_norm": 1.234375, "learning_rate": 0.0003584051956462359, "loss": 5.0057, "mean_token_accuracy": 0.2243173524737358, "num_tokens": 89266087.0, "step": 38970 }, { "entropy": 5.747350215911865, "epoch": 3.852807433768288, "grad_norm": 1.109375, "learning_rate": 0.0003583724188110936, "loss": 4.8974, "mean_token_accuracy": 0.2257521629333496, "num_tokens": 89277039.0, "step": 38975 }, { "entropy": 5.809957265853882, "epoch": 3.853301700276789, "grad_norm": 1.3125, "learning_rate": 0.00035833963992497667, "loss": 5.0189, "mean_token_accuracy": 0.22204402834177017, "num_tokens": 89288940.0, "step": 38980 }, { "entropy": 5.805511426925659, "epoch": 3.853795966785291, "grad_norm": 1.140625, "learning_rate": 0.0003583068589886919, "loss": 4.9196, "mean_token_accuracy": 0.22370391637086867, "num_tokens": 89301460.0, "step": 38985 }, { "entropy": 5.791597318649292, "epoch": 3.854290233293792, "grad_norm": 1.1953125, "learning_rate": 0.00035827407600304533, "loss": 4.9899, "mean_token_accuracy": 0.22211606055498123, "num_tokens": 89312421.0, "step": 38990 }, { "entropy": 5.743489456176758, "epoch": 3.8547844998022933, "grad_norm": 1.203125, "learning_rate": 0.0003582412909688436, "loss": 4.9546, "mean_token_accuracy": 0.2253192186355591, "num_tokens": 89323552.0, "step": 38995 }, { "entropy": 5.79524827003479, "epoch": 3.8552787663107946, "grad_norm": 1.1640625, "learning_rate": 0.0003582085038868932, "loss": 4.9981, "mean_token_accuracy": 0.21214788407087326, "num_tokens": 89333911.0, "step": 39000 }, { "epoch": 3.8552787663107946, "eval_entropy": 5.5270417131327765, "eval_loss": 5.015138149261475, "eval_mean_token_accuracy": 0.23101152317623663, "eval_num_tokens": 89333911.0, "eval_runtime": 20.4603, "eval_samples_per_second": 1589.076, "eval_steps_per_second": 198.677, "step": 39000 }, { "entropy": 5.843964576721191, "epoch": 3.8557730328192963, "grad_norm": 1.1796875, "learning_rate": 0.0003581757147580007, "loss": 5.0649, "mean_token_accuracy": 0.2166712090373039, "num_tokens": 89344632.0, "step": 39005 }, { "entropy": 5.776649713516235, "epoch": 3.8562672993277975, "grad_norm": 1.265625, "learning_rate": 0.00035814292358297273, "loss": 4.9481, "mean_token_accuracy": 0.23139783442020417, "num_tokens": 89354443.0, "step": 39010 }, { "entropy": 5.784475088119507, "epoch": 3.856761565836299, "grad_norm": 1.25, "learning_rate": 0.000358110130362616, "loss": 5.0145, "mean_token_accuracy": 0.22555150836706161, "num_tokens": 89365292.0, "step": 39015 }, { "entropy": 5.811525583267212, "epoch": 3.8572558323448005, "grad_norm": 1.1796875, "learning_rate": 0.00035807733509773704, "loss": 5.0614, "mean_token_accuracy": 0.22084376066923142, "num_tokens": 89378280.0, "step": 39020 }, { "entropy": 5.8122330665588375, "epoch": 3.857750098853302, "grad_norm": 1.3515625, "learning_rate": 0.0003580445377891428, "loss": 4.9598, "mean_token_accuracy": 0.2288960337638855, "num_tokens": 89390360.0, "step": 39025 }, { "entropy": 5.784896373748779, "epoch": 3.858244365361803, "grad_norm": 1.265625, "learning_rate": 0.0003580117384376401, "loss": 4.9859, "mean_token_accuracy": 0.22218020260334015, "num_tokens": 89402057.0, "step": 39030 }, { "entropy": 5.73190279006958, "epoch": 3.8587386318703043, "grad_norm": 1.2265625, "learning_rate": 0.0003579789370440358, "loss": 4.9314, "mean_token_accuracy": 0.22414183914661406, "num_tokens": 89413057.0, "step": 39035 }, { "entropy": 5.7765881538391115, "epoch": 3.859232898378806, "grad_norm": 1.1796875, "learning_rate": 0.00035794613360913666, "loss": 5.027, "mean_token_accuracy": 0.2201632261276245, "num_tokens": 89425565.0, "step": 39040 }, { "entropy": 5.784101676940918, "epoch": 3.8597271648873073, "grad_norm": 1.296875, "learning_rate": 0.00035791332813374973, "loss": 4.9637, "mean_token_accuracy": 0.22456785887479783, "num_tokens": 89436806.0, "step": 39045 }, { "entropy": 5.799672174453735, "epoch": 3.8602214313958085, "grad_norm": 1.2421875, "learning_rate": 0.00035788052061868215, "loss": 5.0198, "mean_token_accuracy": 0.2219857320189476, "num_tokens": 89448745.0, "step": 39050 }, { "entropy": 5.802977275848389, "epoch": 3.8607156979043102, "grad_norm": 1.3046875, "learning_rate": 0.0003578477110647409, "loss": 4.9753, "mean_token_accuracy": 0.22809406518936157, "num_tokens": 89460236.0, "step": 39055 }, { "entropy": 5.7846136569976805, "epoch": 3.8612099644128115, "grad_norm": 1.28125, "learning_rate": 0.0003578148994727331, "loss": 4.9804, "mean_token_accuracy": 0.2210586816072464, "num_tokens": 89471534.0, "step": 39060 }, { "entropy": 5.822690391540528, "epoch": 3.8617042309213128, "grad_norm": 1.15625, "learning_rate": 0.0003577820858434659, "loss": 5.0133, "mean_token_accuracy": 0.22286662012338637, "num_tokens": 89483803.0, "step": 39065 }, { "entropy": 5.763155078887939, "epoch": 3.862198497429814, "grad_norm": 1.3515625, "learning_rate": 0.00035774927017774653, "loss": 4.9613, "mean_token_accuracy": 0.22060411423444748, "num_tokens": 89494236.0, "step": 39070 }, { "entropy": 5.808399677276611, "epoch": 3.8626927639383153, "grad_norm": 1.1875, "learning_rate": 0.00035771645247638243, "loss": 4.9682, "mean_token_accuracy": 0.22675992995500566, "num_tokens": 89506101.0, "step": 39075 }, { "entropy": 5.789398097991944, "epoch": 3.863187030446817, "grad_norm": 1.171875, "learning_rate": 0.00035768363274018064, "loss": 4.9351, "mean_token_accuracy": 0.23177928030490874, "num_tokens": 89518820.0, "step": 39080 }, { "entropy": 5.710754823684693, "epoch": 3.8636812969553183, "grad_norm": 1.265625, "learning_rate": 0.00035765081096994863, "loss": 4.8569, "mean_token_accuracy": 0.229751555621624, "num_tokens": 89530337.0, "step": 39085 }, { "entropy": 5.735813951492309, "epoch": 3.86417556346382, "grad_norm": 1.2109375, "learning_rate": 0.00035761798716649385, "loss": 4.9064, "mean_token_accuracy": 0.22648853063583374, "num_tokens": 89541516.0, "step": 39090 }, { "entropy": 5.823968076705933, "epoch": 3.8646698299723212, "grad_norm": 1.2421875, "learning_rate": 0.0003575851613306238, "loss": 5.0128, "mean_token_accuracy": 0.2252624198794365, "num_tokens": 89553544.0, "step": 39095 }, { "entropy": 5.766701745986938, "epoch": 3.8651640964808225, "grad_norm": 1.2265625, "learning_rate": 0.00035755233346314595, "loss": 4.9571, "mean_token_accuracy": 0.2299944654107094, "num_tokens": 89564472.0, "step": 39100 }, { "entropy": 5.777039337158203, "epoch": 3.8656583629893237, "grad_norm": 1.4453125, "learning_rate": 0.00035751950356486796, "loss": 5.008, "mean_token_accuracy": 0.22157350480556487, "num_tokens": 89575708.0, "step": 39105 }, { "entropy": 5.809261274337769, "epoch": 3.866152629497825, "grad_norm": 1.2734375, "learning_rate": 0.00035748667163659737, "loss": 4.9093, "mean_token_accuracy": 0.23332905173301696, "num_tokens": 89585643.0, "step": 39110 }, { "entropy": 5.696730041503907, "epoch": 3.8666468960063267, "grad_norm": 1.28125, "learning_rate": 0.0003574538376791418, "loss": 4.8996, "mean_token_accuracy": 0.2408711552619934, "num_tokens": 89597069.0, "step": 39115 }, { "entropy": 5.864247179031372, "epoch": 3.867141162514828, "grad_norm": 1.2890625, "learning_rate": 0.00035742100169330903, "loss": 5.1147, "mean_token_accuracy": 0.209864641726017, "num_tokens": 89608469.0, "step": 39120 }, { "entropy": 5.805208969116211, "epoch": 3.8676354290233292, "grad_norm": 1.3203125, "learning_rate": 0.0003573881636799068, "loss": 5.0326, "mean_token_accuracy": 0.2186299070715904, "num_tokens": 89620132.0, "step": 39125 }, { "entropy": 5.747498226165772, "epoch": 3.868129695531831, "grad_norm": 1.25, "learning_rate": 0.00035735532363974305, "loss": 4.9344, "mean_token_accuracy": 0.2288547471165657, "num_tokens": 89631565.0, "step": 39130 }, { "entropy": 5.754403495788575, "epoch": 3.868623962040332, "grad_norm": 1.328125, "learning_rate": 0.0003573224815736256, "loss": 4.896, "mean_token_accuracy": 0.23093175739049912, "num_tokens": 89641530.0, "step": 39135 }, { "entropy": 5.772377061843872, "epoch": 3.8691182285488335, "grad_norm": 1.3125, "learning_rate": 0.0003572896374823622, "loss": 5.0204, "mean_token_accuracy": 0.2199908599257469, "num_tokens": 89653588.0, "step": 39140 }, { "entropy": 5.8562065124511715, "epoch": 3.8696124950573347, "grad_norm": 1.234375, "learning_rate": 0.00035725679136676104, "loss": 5.062, "mean_token_accuracy": 0.22180762588977815, "num_tokens": 89665506.0, "step": 39145 }, { "entropy": 5.738216161727905, "epoch": 3.8701067615658364, "grad_norm": 1.234375, "learning_rate": 0.00035722394322763, "loss": 4.9335, "mean_token_accuracy": 0.22933071255683898, "num_tokens": 89678133.0, "step": 39150 }, { "entropy": 5.7754473209381105, "epoch": 3.8706010280743377, "grad_norm": 1.234375, "learning_rate": 0.0003571910930657773, "loss": 4.8885, "mean_token_accuracy": 0.23716054111719131, "num_tokens": 89690102.0, "step": 39155 }, { "entropy": 5.709008598327637, "epoch": 3.871095294582839, "grad_norm": 1.1796875, "learning_rate": 0.0003571582408820109, "loss": 4.8603, "mean_token_accuracy": 0.23795785307884215, "num_tokens": 89701434.0, "step": 39160 }, { "entropy": 5.7675879955291744, "epoch": 3.8715895610913407, "grad_norm": 1.3984375, "learning_rate": 0.00035712538667713895, "loss": 5.0563, "mean_token_accuracy": 0.2192534625530243, "num_tokens": 89711812.0, "step": 39165 }, { "entropy": 5.815571212768555, "epoch": 3.872083827599842, "grad_norm": 1.4140625, "learning_rate": 0.00035709253045196977, "loss": 4.9905, "mean_token_accuracy": 0.22557516545057296, "num_tokens": 89723077.0, "step": 39170 }, { "entropy": 5.770314407348633, "epoch": 3.872578094108343, "grad_norm": 1.3359375, "learning_rate": 0.0003570596722073117, "loss": 4.9451, "mean_token_accuracy": 0.22723625004291534, "num_tokens": 89733964.0, "step": 39175 }, { "entropy": 5.776780796051026, "epoch": 3.8730723606168445, "grad_norm": 1.1953125, "learning_rate": 0.000357026811943973, "loss": 4.9718, "mean_token_accuracy": 0.22622642070055007, "num_tokens": 89745086.0, "step": 39180 }, { "entropy": 5.771366834640503, "epoch": 3.8735666271253457, "grad_norm": 1.2109375, "learning_rate": 0.00035699394966276184, "loss": 4.9699, "mean_token_accuracy": 0.21960407346487046, "num_tokens": 89756075.0, "step": 39185 }, { "entropy": 5.754063749313355, "epoch": 3.8740608936338474, "grad_norm": 1.25, "learning_rate": 0.00035696108536448684, "loss": 4.8912, "mean_token_accuracy": 0.232508347928524, "num_tokens": 89766271.0, "step": 39190 }, { "entropy": 5.7904266834259035, "epoch": 3.8745551601423487, "grad_norm": 1.1796875, "learning_rate": 0.00035692821904995646, "loss": 5.0254, "mean_token_accuracy": 0.22071074694395065, "num_tokens": 89778408.0, "step": 39195 }, { "entropy": 5.778732776641846, "epoch": 3.8750494266508504, "grad_norm": 1.3828125, "learning_rate": 0.00035689535071997913, "loss": 4.9626, "mean_token_accuracy": 0.22704945206642152, "num_tokens": 89789670.0, "step": 39200 }, { "entropy": 5.758708763122558, "epoch": 3.8755436931593517, "grad_norm": 1.171875, "learning_rate": 0.00035686248037536356, "loss": 4.9618, "mean_token_accuracy": 0.22741394639015197, "num_tokens": 89802269.0, "step": 39205 }, { "entropy": 5.744171953201294, "epoch": 3.876037959667853, "grad_norm": 1.1796875, "learning_rate": 0.0003568296080169182, "loss": 4.9393, "mean_token_accuracy": 0.22382222414016723, "num_tokens": 89814168.0, "step": 39210 }, { "entropy": 5.783205127716064, "epoch": 3.876532226176354, "grad_norm": 1.3125, "learning_rate": 0.0003567967336454518, "loss": 4.973, "mean_token_accuracy": 0.22233276814222336, "num_tokens": 89826494.0, "step": 39215 }, { "entropy": 5.752947998046875, "epoch": 3.8770264926848554, "grad_norm": 1.2265625, "learning_rate": 0.0003567638572617731, "loss": 4.9105, "mean_token_accuracy": 0.22909229397773742, "num_tokens": 89838266.0, "step": 39220 }, { "entropy": 5.707412242889404, "epoch": 3.877520759193357, "grad_norm": 1.40625, "learning_rate": 0.00035673097886669086, "loss": 4.9074, "mean_token_accuracy": 0.2270902544260025, "num_tokens": 89848941.0, "step": 39225 }, { "entropy": 5.765740394592285, "epoch": 3.8780150257018584, "grad_norm": 1.2734375, "learning_rate": 0.00035669809846101383, "loss": 4.9396, "mean_token_accuracy": 0.22830454856157303, "num_tokens": 89859878.0, "step": 39230 }, { "entropy": 5.765536165237426, "epoch": 3.8785092922103597, "grad_norm": 1.2578125, "learning_rate": 0.0003566652160455508, "loss": 4.9663, "mean_token_accuracy": 0.2269761949777603, "num_tokens": 89872044.0, "step": 39235 }, { "entropy": 5.786499977111816, "epoch": 3.8790035587188614, "grad_norm": 1.2265625, "learning_rate": 0.0003566323316211109, "loss": 4.9699, "mean_token_accuracy": 0.22595528066158294, "num_tokens": 89883950.0, "step": 39240 }, { "entropy": 5.794172143936157, "epoch": 3.8794978252273626, "grad_norm": 1.21875, "learning_rate": 0.0003565994451885029, "loss": 5.0092, "mean_token_accuracy": 0.22047265768051147, "num_tokens": 89895944.0, "step": 39245 }, { "entropy": 5.78608341217041, "epoch": 3.879992091735864, "grad_norm": 1.1640625, "learning_rate": 0.00035656655674853595, "loss": 5.0006, "mean_token_accuracy": 0.2194966718554497, "num_tokens": 89907413.0, "step": 39250 }, { "entropy": 5.749328851699829, "epoch": 3.880486358244365, "grad_norm": 1.265625, "learning_rate": 0.00035653366630201906, "loss": 4.8878, "mean_token_accuracy": 0.2271288201212883, "num_tokens": 89918910.0, "step": 39255 }, { "entropy": 5.808552408218384, "epoch": 3.880980624752867, "grad_norm": 1.171875, "learning_rate": 0.0003565007738497612, "loss": 5.1022, "mean_token_accuracy": 0.2123834580183029, "num_tokens": 89931928.0, "step": 39260 }, { "entropy": 5.761010408401489, "epoch": 3.881474891261368, "grad_norm": 1.4765625, "learning_rate": 0.0003564678793925718, "loss": 4.954, "mean_token_accuracy": 0.2312987580895424, "num_tokens": 89942963.0, "step": 39265 }, { "entropy": 5.705652904510498, "epoch": 3.8819691577698694, "grad_norm": 1.265625, "learning_rate": 0.00035643498293125997, "loss": 4.898, "mean_token_accuracy": 0.22958698719739914, "num_tokens": 89953706.0, "step": 39270 }, { "entropy": 5.714903545379639, "epoch": 3.882463424278371, "grad_norm": 1.1875, "learning_rate": 0.0003564020844666348, "loss": 4.9611, "mean_token_accuracy": 0.22449294626712799, "num_tokens": 89964243.0, "step": 39275 }, { "entropy": 5.846740865707398, "epoch": 3.8829576907868724, "grad_norm": 1.375, "learning_rate": 0.0003563691839995058, "loss": 5.0003, "mean_token_accuracy": 0.21891957372426987, "num_tokens": 89974708.0, "step": 39280 }, { "entropy": 5.742700481414795, "epoch": 3.8834519572953736, "grad_norm": 1.328125, "learning_rate": 0.00035633628153068213, "loss": 4.9023, "mean_token_accuracy": 0.24532349407672882, "num_tokens": 89984950.0, "step": 39285 }, { "entropy": 5.752230596542359, "epoch": 3.883946223803875, "grad_norm": 1.3125, "learning_rate": 0.0003563033770609734, "loss": 4.8705, "mean_token_accuracy": 0.22767487317323684, "num_tokens": 89995605.0, "step": 39290 }, { "entropy": 5.691107702255249, "epoch": 3.8844404903123766, "grad_norm": 1.171875, "learning_rate": 0.00035627047059118907, "loss": 4.9116, "mean_token_accuracy": 0.23006444424390793, "num_tokens": 90007209.0, "step": 39295 }, { "entropy": 5.719086694717407, "epoch": 3.884934756820878, "grad_norm": 1.171875, "learning_rate": 0.00035623756212213847, "loss": 4.929, "mean_token_accuracy": 0.22537785917520523, "num_tokens": 90019042.0, "step": 39300 }, { "entropy": 5.776600408554077, "epoch": 3.885429023329379, "grad_norm": 1.25, "learning_rate": 0.00035620465165463124, "loss": 4.9565, "mean_token_accuracy": 0.23085272163152695, "num_tokens": 90030466.0, "step": 39305 }, { "entropy": 5.742365407943725, "epoch": 3.885923289837881, "grad_norm": 1.2109375, "learning_rate": 0.00035617173918947695, "loss": 4.8892, "mean_token_accuracy": 0.22705599516630173, "num_tokens": 90041308.0, "step": 39310 }, { "entropy": 5.7418293952941895, "epoch": 3.886417556346382, "grad_norm": 1.2421875, "learning_rate": 0.0003561388247274853, "loss": 5.0175, "mean_token_accuracy": 0.22416626811027526, "num_tokens": 90052655.0, "step": 39315 }, { "entropy": 5.797838878631592, "epoch": 3.8869118228548833, "grad_norm": 1.25, "learning_rate": 0.000356105908269466, "loss": 5.0074, "mean_token_accuracy": 0.21475773304700851, "num_tokens": 90063643.0, "step": 39320 }, { "entropy": 5.723918342590332, "epoch": 3.8874060893633846, "grad_norm": 1.328125, "learning_rate": 0.00035607298981622885, "loss": 4.8963, "mean_token_accuracy": 0.23104674220085145, "num_tokens": 90076293.0, "step": 39325 }, { "entropy": 5.825060749053955, "epoch": 3.887900355871886, "grad_norm": 1.328125, "learning_rate": 0.00035604006936858343, "loss": 5.0224, "mean_token_accuracy": 0.2145558550953865, "num_tokens": 90086423.0, "step": 39330 }, { "entropy": 5.774041318893433, "epoch": 3.8883946223803876, "grad_norm": 1.2265625, "learning_rate": 0.00035600714692733974, "loss": 4.8829, "mean_token_accuracy": 0.23435807526111602, "num_tokens": 90097330.0, "step": 39335 }, { "entropy": 5.796225118637085, "epoch": 3.888888888888889, "grad_norm": 1.1484375, "learning_rate": 0.0003559742224933078, "loss": 5.0374, "mean_token_accuracy": 0.22253907471895218, "num_tokens": 90109532.0, "step": 39340 }, { "entropy": 5.857407522201538, "epoch": 3.8893831553973905, "grad_norm": 1.140625, "learning_rate": 0.0003559412960672972, "loss": 5.0724, "mean_token_accuracy": 0.21018495708703994, "num_tokens": 90121655.0, "step": 39345 }, { "entropy": 5.734466981887818, "epoch": 3.889877421905892, "grad_norm": 1.2578125, "learning_rate": 0.0003559083676501184, "loss": 4.9445, "mean_token_accuracy": 0.23160445988178252, "num_tokens": 90133515.0, "step": 39350 }, { "entropy": 5.822032690048218, "epoch": 3.890371688414393, "grad_norm": 1.171875, "learning_rate": 0.0003558754372425811, "loss": 4.9829, "mean_token_accuracy": 0.2198260620236397, "num_tokens": 90146364.0, "step": 39355 }, { "entropy": 5.807757711410522, "epoch": 3.8908659549228943, "grad_norm": 1.3515625, "learning_rate": 0.00035584250484549547, "loss": 4.9658, "mean_token_accuracy": 0.22484630197286606, "num_tokens": 90158568.0, "step": 39360 }, { "entropy": 5.743658971786499, "epoch": 3.8913602214313956, "grad_norm": 1.2109375, "learning_rate": 0.0003558095704596717, "loss": 4.9395, "mean_token_accuracy": 0.22645913064479828, "num_tokens": 90169252.0, "step": 39365 }, { "entropy": 5.8253251075744625, "epoch": 3.8918544879398973, "grad_norm": 1.21875, "learning_rate": 0.00035577663408592003, "loss": 5.0521, "mean_token_accuracy": 0.2255424365401268, "num_tokens": 90180398.0, "step": 39370 }, { "entropy": 5.7431800365448, "epoch": 3.8923487544483986, "grad_norm": 1.1953125, "learning_rate": 0.00035574369572505054, "loss": 4.899, "mean_token_accuracy": 0.23363993167877198, "num_tokens": 90191991.0, "step": 39375 }, { "entropy": 5.804829072952271, "epoch": 3.8928430209569, "grad_norm": 1.2421875, "learning_rate": 0.0003557107553778736, "loss": 4.9676, "mean_token_accuracy": 0.22032666504383086, "num_tokens": 90203812.0, "step": 39380 }, { "entropy": 5.762810182571411, "epoch": 3.8933372874654015, "grad_norm": 1.2734375, "learning_rate": 0.0003556778130451997, "loss": 4.9704, "mean_token_accuracy": 0.22746917754411697, "num_tokens": 90214793.0, "step": 39385 }, { "entropy": 5.740804862976074, "epoch": 3.893831553973903, "grad_norm": 1.2734375, "learning_rate": 0.0003556448687278389, "loss": 4.909, "mean_token_accuracy": 0.22290343195199966, "num_tokens": 90225145.0, "step": 39390 }, { "entropy": 5.708287858963013, "epoch": 3.894325820482404, "grad_norm": 1.25, "learning_rate": 0.00035561192242660193, "loss": 4.9453, "mean_token_accuracy": 0.225430528819561, "num_tokens": 90236394.0, "step": 39395 }, { "entropy": 5.793304920196533, "epoch": 3.8948200869909053, "grad_norm": 1.34375, "learning_rate": 0.0003555789741422991, "loss": 4.963, "mean_token_accuracy": 0.22755814641714095, "num_tokens": 90246649.0, "step": 39400 }, { "entropy": 5.825546407699585, "epoch": 3.895314353499407, "grad_norm": 1.2265625, "learning_rate": 0.00035554602387574105, "loss": 4.9811, "mean_token_accuracy": 0.22282395362854004, "num_tokens": 90258047.0, "step": 39405 }, { "entropy": 5.849278593063355, "epoch": 3.8958086200079083, "grad_norm": 1.2109375, "learning_rate": 0.0003555130716277383, "loss": 5.0662, "mean_token_accuracy": 0.21635986119508743, "num_tokens": 90269848.0, "step": 39410 }, { "entropy": 5.81041955947876, "epoch": 3.8963028865164095, "grad_norm": 1.1875, "learning_rate": 0.0003554801173991016, "loss": 4.9991, "mean_token_accuracy": 0.22111031264066697, "num_tokens": 90281614.0, "step": 39415 }, { "entropy": 5.778650236129761, "epoch": 3.8967971530249113, "grad_norm": 1.296875, "learning_rate": 0.0003554471611906414, "loss": 4.9607, "mean_token_accuracy": 0.22790725529193878, "num_tokens": 90292857.0, "step": 39420 }, { "entropy": 5.748271131515503, "epoch": 3.8972914195334125, "grad_norm": 1.2734375, "learning_rate": 0.0003554142030031685, "loss": 4.999, "mean_token_accuracy": 0.21897072046995164, "num_tokens": 90304558.0, "step": 39425 }, { "entropy": 5.764628934860229, "epoch": 3.8977856860419138, "grad_norm": 1.21875, "learning_rate": 0.00035538124283749387, "loss": 4.9448, "mean_token_accuracy": 0.2267860621213913, "num_tokens": 90315914.0, "step": 39430 }, { "entropy": 5.768094396591186, "epoch": 3.898279952550415, "grad_norm": 1.234375, "learning_rate": 0.0003553482806944281, "loss": 4.8883, "mean_token_accuracy": 0.22569429874420166, "num_tokens": 90327165.0, "step": 39435 }, { "entropy": 5.7028614521026615, "epoch": 3.8987742190589163, "grad_norm": 1.140625, "learning_rate": 0.0003553153165747822, "loss": 4.8732, "mean_token_accuracy": 0.23501939624547957, "num_tokens": 90338755.0, "step": 39440 }, { "entropy": 5.707259798049927, "epoch": 3.899268485567418, "grad_norm": 1.3046875, "learning_rate": 0.000355282350479367, "loss": 4.9579, "mean_token_accuracy": 0.2260788857936859, "num_tokens": 90349694.0, "step": 39445 }, { "entropy": 5.800248384475708, "epoch": 3.8997627520759193, "grad_norm": 1.3046875, "learning_rate": 0.0003552493824089936, "loss": 4.9184, "mean_token_accuracy": 0.22780183106660842, "num_tokens": 90359604.0, "step": 39450 }, { "entropy": 5.6854407787323, "epoch": 3.900257018584421, "grad_norm": 1.2890625, "learning_rate": 0.00035521641236447297, "loss": 4.8117, "mean_token_accuracy": 0.23606300801038743, "num_tokens": 90370607.0, "step": 39455 }, { "entropy": 5.712741947174072, "epoch": 3.9007512850929222, "grad_norm": 1.359375, "learning_rate": 0.00035518344034661607, "loss": 4.8712, "mean_token_accuracy": 0.2347013309597969, "num_tokens": 90381429.0, "step": 39460 }, { "entropy": 5.734273147583008, "epoch": 3.9012455516014235, "grad_norm": 1.2578125, "learning_rate": 0.00035515046635623416, "loss": 4.9244, "mean_token_accuracy": 0.23089791983366012, "num_tokens": 90393550.0, "step": 39465 }, { "entropy": 5.738218116760254, "epoch": 3.9017398181099248, "grad_norm": 1.34375, "learning_rate": 0.0003551174903941383, "loss": 4.9969, "mean_token_accuracy": 0.2252648264169693, "num_tokens": 90404380.0, "step": 39470 }, { "entropy": 5.807044887542725, "epoch": 3.902234084618426, "grad_norm": 1.28125, "learning_rate": 0.0003550845124611397, "loss": 4.9492, "mean_token_accuracy": 0.2220213681459427, "num_tokens": 90414374.0, "step": 39475 }, { "entropy": 5.754154539108276, "epoch": 3.9027283511269277, "grad_norm": 1.1796875, "learning_rate": 0.0003550515325580498, "loss": 4.9113, "mean_token_accuracy": 0.23424049615859985, "num_tokens": 90426682.0, "step": 39480 }, { "entropy": 5.729799270629883, "epoch": 3.903222617635429, "grad_norm": 1.3359375, "learning_rate": 0.0003550185506856797, "loss": 4.8869, "mean_token_accuracy": 0.23171612322330476, "num_tokens": 90437992.0, "step": 39485 }, { "entropy": 5.781531620025635, "epoch": 3.9037168841439303, "grad_norm": 1.2265625, "learning_rate": 0.00035498556684484086, "loss": 5.0343, "mean_token_accuracy": 0.22096819579601287, "num_tokens": 90450589.0, "step": 39490 }, { "entropy": 5.703736352920532, "epoch": 3.904211150652432, "grad_norm": 1.203125, "learning_rate": 0.0003549525810363446, "loss": 4.8921, "mean_token_accuracy": 0.2307443305850029, "num_tokens": 90461723.0, "step": 39495 }, { "entropy": 5.791468906402588, "epoch": 3.9047054171609332, "grad_norm": 1.359375, "learning_rate": 0.00035491959326100253, "loss": 4.9495, "mean_token_accuracy": 0.22864301651716232, "num_tokens": 90472972.0, "step": 39500 }, { "entropy": 5.807104063034058, "epoch": 3.9051996836694345, "grad_norm": 1.25, "learning_rate": 0.000354886603519626, "loss": 5.029, "mean_token_accuracy": 0.21685766875743867, "num_tokens": 90483995.0, "step": 39505 }, { "entropy": 5.739621686935425, "epoch": 3.9056939501779357, "grad_norm": 1.25, "learning_rate": 0.0003548536118130267, "loss": 4.8817, "mean_token_accuracy": 0.2336791381239891, "num_tokens": 90495999.0, "step": 39510 }, { "entropy": 5.8262029647827145, "epoch": 3.9061882166864375, "grad_norm": 1.265625, "learning_rate": 0.00035482061814201614, "loss": 5.0161, "mean_token_accuracy": 0.22147536426782607, "num_tokens": 90507906.0, "step": 39515 }, { "entropy": 5.756185483932495, "epoch": 3.9066824831949387, "grad_norm": 1.3359375, "learning_rate": 0.00035478762250740594, "loss": 4.9249, "mean_token_accuracy": 0.23043465316295625, "num_tokens": 90517938.0, "step": 39520 }, { "entropy": 5.768194627761841, "epoch": 3.90717674970344, "grad_norm": 1.328125, "learning_rate": 0.0003547546249100079, "loss": 4.9686, "mean_token_accuracy": 0.22231417000293732, "num_tokens": 90528163.0, "step": 39525 }, { "entropy": 5.752123641967773, "epoch": 3.9076710162119417, "grad_norm": 1.1796875, "learning_rate": 0.00035472162535063375, "loss": 4.9539, "mean_token_accuracy": 0.22275971621274948, "num_tokens": 90539846.0, "step": 39530 }, { "entropy": 5.7405637264251705, "epoch": 3.908165282720443, "grad_norm": 1.3203125, "learning_rate": 0.00035468862383009514, "loss": 4.8615, "mean_token_accuracy": 0.23689231276512146, "num_tokens": 90550290.0, "step": 39535 }, { "entropy": 5.771781539916992, "epoch": 3.908659549228944, "grad_norm": 1.28125, "learning_rate": 0.00035465562034920413, "loss": 4.9277, "mean_token_accuracy": 0.23283457309007644, "num_tokens": 90561052.0, "step": 39540 }, { "entropy": 5.771683216094971, "epoch": 3.9091538157374455, "grad_norm": 1.3203125, "learning_rate": 0.0003546226149087724, "loss": 5.01, "mean_token_accuracy": 0.22289457321166992, "num_tokens": 90572007.0, "step": 39545 }, { "entropy": 5.772237825393677, "epoch": 3.909648082245947, "grad_norm": 1.2578125, "learning_rate": 0.00035458960750961205, "loss": 4.9938, "mean_token_accuracy": 0.22165055125951766, "num_tokens": 90583538.0, "step": 39550 }, { "entropy": 5.77426700592041, "epoch": 3.9101423487544484, "grad_norm": 1.1640625, "learning_rate": 0.000354556598152535, "loss": 4.9536, "mean_token_accuracy": 0.23117521405220032, "num_tokens": 90595464.0, "step": 39555 }, { "entropy": 5.8065886974334715, "epoch": 3.9106366152629497, "grad_norm": 1.28125, "learning_rate": 0.0003545235868383533, "loss": 5.0243, "mean_token_accuracy": 0.22450612634420394, "num_tokens": 90607593.0, "step": 39560 }, { "entropy": 5.872856283187867, "epoch": 3.9111308817714514, "grad_norm": 1.3203125, "learning_rate": 0.000354490573567879, "loss": 5.0475, "mean_token_accuracy": 0.21648077219724654, "num_tokens": 90618779.0, "step": 39565 }, { "entropy": 5.801626396179199, "epoch": 3.9116251482799527, "grad_norm": 1.1015625, "learning_rate": 0.00035445755834192426, "loss": 4.9726, "mean_token_accuracy": 0.22345806509256363, "num_tokens": 90630355.0, "step": 39570 }, { "entropy": 5.8214026927948, "epoch": 3.912119414788454, "grad_norm": 1.2421875, "learning_rate": 0.0003544245411613013, "loss": 4.9972, "mean_token_accuracy": 0.2175506293773651, "num_tokens": 90642042.0, "step": 39575 }, { "entropy": 5.78690767288208, "epoch": 3.912613681296955, "grad_norm": 1.2890625, "learning_rate": 0.0003543915220268223, "loss": 4.9395, "mean_token_accuracy": 0.2172304391860962, "num_tokens": 90653659.0, "step": 39580 }, { "entropy": 5.752219343185425, "epoch": 3.9131079478054565, "grad_norm": 1.1796875, "learning_rate": 0.0003543585009392996, "loss": 4.9002, "mean_token_accuracy": 0.23587049990892411, "num_tokens": 90664525.0, "step": 39585 }, { "entropy": 5.731579065322876, "epoch": 3.913602214313958, "grad_norm": 1.25, "learning_rate": 0.0003543254778995453, "loss": 4.9841, "mean_token_accuracy": 0.21812761723995208, "num_tokens": 90676231.0, "step": 39590 }, { "entropy": 5.821331787109375, "epoch": 3.9140964808224594, "grad_norm": 1.296875, "learning_rate": 0.00035429245290837197, "loss": 5.0274, "mean_token_accuracy": 0.20846595317125322, "num_tokens": 90686996.0, "step": 39595 }, { "entropy": 5.827587556838989, "epoch": 3.914590747330961, "grad_norm": 1.0859375, "learning_rate": 0.00035425942596659213, "loss": 4.9961, "mean_token_accuracy": 0.22124552428722383, "num_tokens": 90699329.0, "step": 39600 }, { "entropy": 5.738008737564087, "epoch": 3.9150850138394624, "grad_norm": 1.234375, "learning_rate": 0.000354226397075018, "loss": 4.9556, "mean_token_accuracy": 0.23012987673282623, "num_tokens": 90710835.0, "step": 39605 }, { "entropy": 5.702221870422363, "epoch": 3.9155792803479637, "grad_norm": 1.2421875, "learning_rate": 0.0003541933662344623, "loss": 4.8781, "mean_token_accuracy": 0.23469143509864807, "num_tokens": 90722793.0, "step": 39610 }, { "entropy": 5.776153087615967, "epoch": 3.916073546856465, "grad_norm": 1.203125, "learning_rate": 0.00035416033344573745, "loss": 4.9882, "mean_token_accuracy": 0.22272575944662093, "num_tokens": 90733380.0, "step": 39615 }, { "entropy": 5.789487314224243, "epoch": 3.916567813364966, "grad_norm": 1.3203125, "learning_rate": 0.00035412729870965606, "loss": 5.032, "mean_token_accuracy": 0.2201627939939499, "num_tokens": 90744801.0, "step": 39620 }, { "entropy": 5.783236503601074, "epoch": 3.917062079873468, "grad_norm": 1.2890625, "learning_rate": 0.00035409426202703093, "loss": 4.9583, "mean_token_accuracy": 0.2277090683579445, "num_tokens": 90755826.0, "step": 39625 }, { "entropy": 5.7975671768188475, "epoch": 3.917556346381969, "grad_norm": 1.15625, "learning_rate": 0.0003540612233986747, "loss": 4.9482, "mean_token_accuracy": 0.22587441354990007, "num_tokens": 90766943.0, "step": 39630 }, { "entropy": 5.848583984375, "epoch": 3.9180506128904704, "grad_norm": 1.1328125, "learning_rate": 0.00035402818282540005, "loss": 5.1684, "mean_token_accuracy": 0.21577582359313965, "num_tokens": 90780413.0, "step": 39635 }, { "entropy": 5.80862455368042, "epoch": 3.918544879398972, "grad_norm": 1.1640625, "learning_rate": 0.00035399514030801983, "loss": 4.9706, "mean_token_accuracy": 0.22604450285434724, "num_tokens": 90792923.0, "step": 39640 }, { "entropy": 5.727105951309204, "epoch": 3.9190391459074734, "grad_norm": 1.2109375, "learning_rate": 0.00035396209584734697, "loss": 4.885, "mean_token_accuracy": 0.22646315395832062, "num_tokens": 90803457.0, "step": 39645 }, { "entropy": 5.75400218963623, "epoch": 3.9195334124159746, "grad_norm": 1.2578125, "learning_rate": 0.00035392904944419424, "loss": 4.9205, "mean_token_accuracy": 0.22814578860998153, "num_tokens": 90815499.0, "step": 39650 }, { "entropy": 5.773372840881348, "epoch": 3.920027678924476, "grad_norm": 1.15625, "learning_rate": 0.0003538960010993747, "loss": 4.9395, "mean_token_accuracy": 0.22199928760528564, "num_tokens": 90827263.0, "step": 39655 }, { "entropy": 5.810328340530395, "epoch": 3.9205219454329776, "grad_norm": 1.328125, "learning_rate": 0.00035386295081370125, "loss": 4.9386, "mean_token_accuracy": 0.23436135202646255, "num_tokens": 90837804.0, "step": 39660 }, { "entropy": 5.7375880718231205, "epoch": 3.921016211941479, "grad_norm": 1.2890625, "learning_rate": 0.00035382989858798695, "loss": 4.9852, "mean_token_accuracy": 0.23022964149713515, "num_tokens": 90849331.0, "step": 39665 }, { "entropy": 5.7507225513458256, "epoch": 3.92151047844998, "grad_norm": 1.25, "learning_rate": 0.00035379684442304497, "loss": 4.9931, "mean_token_accuracy": 0.22130931913852692, "num_tokens": 90861164.0, "step": 39670 }, { "entropy": 5.817691373825073, "epoch": 3.922004744958482, "grad_norm": 1.25, "learning_rate": 0.00035376378831968844, "loss": 5.0939, "mean_token_accuracy": 0.20615292638540267, "num_tokens": 90872453.0, "step": 39675 }, { "entropy": 5.691192960739135, "epoch": 3.922499011466983, "grad_norm": 1.296875, "learning_rate": 0.0003537307302787304, "loss": 4.8879, "mean_token_accuracy": 0.2311477079987526, "num_tokens": 90882111.0, "step": 39680 }, { "entropy": 5.737515544891357, "epoch": 3.9229932779754844, "grad_norm": 1.3046875, "learning_rate": 0.00035369767030098424, "loss": 4.9697, "mean_token_accuracy": 0.22839185744524002, "num_tokens": 90894501.0, "step": 39685 }, { "entropy": 5.7266960620880125, "epoch": 3.9234875444839856, "grad_norm": 1.234375, "learning_rate": 0.00035366460838726316, "loss": 4.8439, "mean_token_accuracy": 0.2304357260465622, "num_tokens": 90905629.0, "step": 39690 }, { "entropy": 5.732442998886109, "epoch": 3.923981810992487, "grad_norm": 1.1953125, "learning_rate": 0.0003536315445383805, "loss": 4.957, "mean_token_accuracy": 0.2217630684375763, "num_tokens": 90916710.0, "step": 39695 }, { "entropy": 5.744244527816773, "epoch": 3.9244760775009886, "grad_norm": 1.3125, "learning_rate": 0.0003535984787551497, "loss": 4.9475, "mean_token_accuracy": 0.2251925840973854, "num_tokens": 90927463.0, "step": 39700 }, { "entropy": 5.795710611343384, "epoch": 3.92497034400949, "grad_norm": 1.234375, "learning_rate": 0.0003535654110383841, "loss": 4.9312, "mean_token_accuracy": 0.2223491832613945, "num_tokens": 90938387.0, "step": 39705 }, { "entropy": 5.753119325637817, "epoch": 3.9254646105179916, "grad_norm": 1.2265625, "learning_rate": 0.0003535323413888972, "loss": 4.9525, "mean_token_accuracy": 0.23341279625892639, "num_tokens": 90950326.0, "step": 39710 }, { "entropy": 5.796470975875854, "epoch": 3.925958877026493, "grad_norm": 1.2265625, "learning_rate": 0.0003534992698075025, "loss": 4.9816, "mean_token_accuracy": 0.22603694647550582, "num_tokens": 90962598.0, "step": 39715 }, { "entropy": 5.780059289932251, "epoch": 3.926453143534994, "grad_norm": 1.203125, "learning_rate": 0.0003534661962950136, "loss": 4.9949, "mean_token_accuracy": 0.220823971927166, "num_tokens": 90975048.0, "step": 39720 }, { "entropy": 5.788070964813232, "epoch": 3.9269474100434953, "grad_norm": 1.3203125, "learning_rate": 0.00035343312085224407, "loss": 4.9686, "mean_token_accuracy": 0.23019943684339522, "num_tokens": 90985768.0, "step": 39725 }, { "entropy": 5.807478666305542, "epoch": 3.9274416765519966, "grad_norm": 1.21875, "learning_rate": 0.00035340004348000765, "loss": 5.0031, "mean_token_accuracy": 0.21751173287630082, "num_tokens": 90998448.0, "step": 39730 }, { "entropy": 5.779744625091553, "epoch": 3.9279359430604983, "grad_norm": 1.3125, "learning_rate": 0.000353366964179118, "loss": 4.9919, "mean_token_accuracy": 0.2238590657711029, "num_tokens": 91010463.0, "step": 39735 }, { "entropy": 5.812977361679077, "epoch": 3.9284302095689996, "grad_norm": 1.25, "learning_rate": 0.0003533338829503888, "loss": 4.8949, "mean_token_accuracy": 0.2244887501001358, "num_tokens": 91022188.0, "step": 39740 }, { "entropy": 5.7933777332305905, "epoch": 3.928924476077501, "grad_norm": 1.28125, "learning_rate": 0.00035330079979463397, "loss": 4.9805, "mean_token_accuracy": 0.2278628706932068, "num_tokens": 91033272.0, "step": 39745 }, { "entropy": 5.713204097747803, "epoch": 3.9294187425860025, "grad_norm": 1.3515625, "learning_rate": 0.00035326771471266735, "loss": 4.9702, "mean_token_accuracy": 0.22614417523145675, "num_tokens": 91044014.0, "step": 39750 }, { "entropy": 5.744575166702271, "epoch": 3.929913009094504, "grad_norm": 1.390625, "learning_rate": 0.0003532346277053028, "loss": 4.9412, "mean_token_accuracy": 0.22631218582391738, "num_tokens": 91055601.0, "step": 39755 }, { "entropy": 5.702720594406128, "epoch": 3.930407275603005, "grad_norm": 1.1640625, "learning_rate": 0.00035320153877335415, "loss": 4.9077, "mean_token_accuracy": 0.23022176027297975, "num_tokens": 91066384.0, "step": 39760 }, { "entropy": 5.732511520385742, "epoch": 3.9309015421115063, "grad_norm": 1.4453125, "learning_rate": 0.0003531684479176356, "loss": 4.8963, "mean_token_accuracy": 0.23080967962741852, "num_tokens": 91076675.0, "step": 39765 }, { "entropy": 5.755775308609008, "epoch": 3.931395808620008, "grad_norm": 1.203125, "learning_rate": 0.0003531353551389611, "loss": 4.9685, "mean_token_accuracy": 0.2287505641579628, "num_tokens": 91088900.0, "step": 39770 }, { "entropy": 5.806204414367675, "epoch": 3.9318900751285093, "grad_norm": 1.2265625, "learning_rate": 0.0003531022604381448, "loss": 4.8769, "mean_token_accuracy": 0.23561695367097854, "num_tokens": 91100483.0, "step": 39775 }, { "entropy": 5.814331436157227, "epoch": 3.9323843416370106, "grad_norm": 1.21875, "learning_rate": 0.0003530691638160007, "loss": 5.0635, "mean_token_accuracy": 0.2156870886683464, "num_tokens": 91112310.0, "step": 39780 }, { "entropy": 5.782642793655396, "epoch": 3.9328786081455123, "grad_norm": 1.2734375, "learning_rate": 0.00035303606527334314, "loss": 4.9817, "mean_token_accuracy": 0.22016711980104448, "num_tokens": 91124086.0, "step": 39785 }, { "entropy": 5.69743013381958, "epoch": 3.9333728746540135, "grad_norm": 1.1875, "learning_rate": 0.0003530029648109862, "loss": 4.9136, "mean_token_accuracy": 0.2258111596107483, "num_tokens": 91135044.0, "step": 39790 }, { "entropy": 5.782300710678101, "epoch": 3.933867141162515, "grad_norm": 1.3046875, "learning_rate": 0.0003529698624297442, "loss": 4.9747, "mean_token_accuracy": 0.22447331249713898, "num_tokens": 91145606.0, "step": 39795 }, { "entropy": 5.756932401657105, "epoch": 3.934361407671016, "grad_norm": 1.3046875, "learning_rate": 0.0003529367581304316, "loss": 4.9326, "mean_token_accuracy": 0.23109450191259384, "num_tokens": 91155709.0, "step": 39800 }, { "entropy": 5.734607934951782, "epoch": 3.9348556741795178, "grad_norm": 1.2578125, "learning_rate": 0.0003529036519138626, "loss": 4.9159, "mean_token_accuracy": 0.23251646608114243, "num_tokens": 91166511.0, "step": 39805 }, { "entropy": 5.75219693183899, "epoch": 3.935349940688019, "grad_norm": 1.1953125, "learning_rate": 0.0003528705437808516, "loss": 4.9118, "mean_token_accuracy": 0.22588907927274704, "num_tokens": 91178441.0, "step": 39810 }, { "entropy": 5.818978977203369, "epoch": 3.9358442071965203, "grad_norm": 1.2109375, "learning_rate": 0.00035283743373221323, "loss": 5.042, "mean_token_accuracy": 0.2196223497390747, "num_tokens": 91189958.0, "step": 39815 }, { "entropy": 5.786458206176758, "epoch": 3.936338473705022, "grad_norm": 1.2421875, "learning_rate": 0.000352804321768762, "loss": 4.9464, "mean_token_accuracy": 0.22719651013612746, "num_tokens": 91201461.0, "step": 39820 }, { "entropy": 5.736437273025513, "epoch": 3.9368327402135233, "grad_norm": 1.2578125, "learning_rate": 0.00035277120789131217, "loss": 4.9009, "mean_token_accuracy": 0.22953283786773682, "num_tokens": 91212626.0, "step": 39825 }, { "entropy": 5.7448506355285645, "epoch": 3.9373270067220245, "grad_norm": 1.2890625, "learning_rate": 0.0003527380921006787, "loss": 4.938, "mean_token_accuracy": 0.22615545392036437, "num_tokens": 91224425.0, "step": 39830 }, { "entropy": 5.720529460906983, "epoch": 3.9378212732305258, "grad_norm": 1.21875, "learning_rate": 0.00035270497439767606, "loss": 4.8623, "mean_token_accuracy": 0.2317921668291092, "num_tokens": 91234989.0, "step": 39835 }, { "entropy": 5.736161422729492, "epoch": 3.938315539739027, "grad_norm": 1.2265625, "learning_rate": 0.00035267185478311895, "loss": 4.8755, "mean_token_accuracy": 0.23517173230648042, "num_tokens": 91245713.0, "step": 39840 }, { "entropy": 5.742568635940552, "epoch": 3.9388098062475287, "grad_norm": 1.1796875, "learning_rate": 0.0003526387332578223, "loss": 4.918, "mean_token_accuracy": 0.2307419240474701, "num_tokens": 91256719.0, "step": 39845 }, { "entropy": 5.768957948684692, "epoch": 3.93930407275603, "grad_norm": 1.2109375, "learning_rate": 0.0003526056098226007, "loss": 5.0455, "mean_token_accuracy": 0.2200557678937912, "num_tokens": 91268167.0, "step": 39850 }, { "entropy": 5.793686962127685, "epoch": 3.9397983392645317, "grad_norm": 1.34375, "learning_rate": 0.000352572484478269, "loss": 5.0148, "mean_token_accuracy": 0.21721922755241393, "num_tokens": 91280182.0, "step": 39855 }, { "entropy": 5.791457605361939, "epoch": 3.940292605773033, "grad_norm": 1.234375, "learning_rate": 0.00035253935722564215, "loss": 5.0127, "mean_token_accuracy": 0.2197528213262558, "num_tokens": 91291755.0, "step": 39860 }, { "entropy": 5.769615745544433, "epoch": 3.9407868722815342, "grad_norm": 1.25, "learning_rate": 0.00035250622806553525, "loss": 4.886, "mean_token_accuracy": 0.23325519412755966, "num_tokens": 91302389.0, "step": 39865 }, { "entropy": 5.789990949630737, "epoch": 3.9412811387900355, "grad_norm": 1.3359375, "learning_rate": 0.00035247309699876293, "loss": 4.9493, "mean_token_accuracy": 0.23177388608455657, "num_tokens": 91313354.0, "step": 39870 }, { "entropy": 5.7733869552612305, "epoch": 3.9417754052985368, "grad_norm": 1.15625, "learning_rate": 0.0003524399640261404, "loss": 5.0637, "mean_token_accuracy": 0.21744525730609893, "num_tokens": 91325939.0, "step": 39875 }, { "entropy": 5.763187503814697, "epoch": 3.9422696718070385, "grad_norm": 1.328125, "learning_rate": 0.0003524068291484829, "loss": 4.9646, "mean_token_accuracy": 0.22696375697851182, "num_tokens": 91336637.0, "step": 39880 }, { "entropy": 5.759377908706665, "epoch": 3.9427639383155397, "grad_norm": 1.2578125, "learning_rate": 0.00035237369236660525, "loss": 4.9759, "mean_token_accuracy": 0.22297230511903762, "num_tokens": 91348058.0, "step": 39885 }, { "entropy": 5.751921463012695, "epoch": 3.943258204824041, "grad_norm": 1.2109375, "learning_rate": 0.0003523405536813229, "loss": 4.893, "mean_token_accuracy": 0.23175987154245375, "num_tokens": 91358630.0, "step": 39890 }, { "entropy": 5.792415904998779, "epoch": 3.9437524713325427, "grad_norm": 1.234375, "learning_rate": 0.0003523074130934509, "loss": 4.9523, "mean_token_accuracy": 0.2214099258184433, "num_tokens": 91369989.0, "step": 39895 }, { "entropy": 5.773793363571167, "epoch": 3.944246737841044, "grad_norm": 1.0859375, "learning_rate": 0.00035227427060380436, "loss": 5.0023, "mean_token_accuracy": 0.21726160049438475, "num_tokens": 91382145.0, "step": 39900 }, { "entropy": 5.790749359130859, "epoch": 3.944741004349545, "grad_norm": 1.3125, "learning_rate": 0.000352241126213199, "loss": 4.8955, "mean_token_accuracy": 0.23027364760637284, "num_tokens": 91392952.0, "step": 39905 }, { "entropy": 5.751145124435425, "epoch": 3.9452352708580465, "grad_norm": 1.2265625, "learning_rate": 0.0003522079799224499, "loss": 4.9776, "mean_token_accuracy": 0.22604178339242936, "num_tokens": 91404050.0, "step": 39910 }, { "entropy": 5.684496736526489, "epoch": 3.945729537366548, "grad_norm": 1.359375, "learning_rate": 0.0003521748317323724, "loss": 4.8918, "mean_token_accuracy": 0.22975898236036302, "num_tokens": 91414326.0, "step": 39915 }, { "entropy": 5.834219026565552, "epoch": 3.9462238038750495, "grad_norm": 1.296875, "learning_rate": 0.0003521416816437822, "loss": 5.0066, "mean_token_accuracy": 0.22006482183933257, "num_tokens": 91426774.0, "step": 39920 }, { "entropy": 5.790394401550293, "epoch": 3.9467180703835507, "grad_norm": 1.1328125, "learning_rate": 0.0003521085296574945, "loss": 4.9433, "mean_token_accuracy": 0.22705452889204025, "num_tokens": 91438303.0, "step": 39925 }, { "entropy": 5.804960918426514, "epoch": 3.9472123368920524, "grad_norm": 1.2734375, "learning_rate": 0.00035207537577432516, "loss": 4.9646, "mean_token_accuracy": 0.2261754646897316, "num_tokens": 91449310.0, "step": 39930 }, { "entropy": 5.765598583221435, "epoch": 3.9477066034005537, "grad_norm": 1.234375, "learning_rate": 0.0003520422199950896, "loss": 4.9401, "mean_token_accuracy": 0.22558145523071288, "num_tokens": 91460665.0, "step": 39935 }, { "entropy": 5.827822875976563, "epoch": 3.948200869909055, "grad_norm": 1.3984375, "learning_rate": 0.0003520090623206034, "loss": 4.9829, "mean_token_accuracy": 0.22303509563207627, "num_tokens": 91471111.0, "step": 39940 }, { "entropy": 5.680939960479736, "epoch": 3.948695136417556, "grad_norm": 1.2578125, "learning_rate": 0.00035197590275168247, "loss": 4.8912, "mean_token_accuracy": 0.23884239345788955, "num_tokens": 91483525.0, "step": 39945 }, { "entropy": 5.72439923286438, "epoch": 3.9491894029260575, "grad_norm": 1.3046875, "learning_rate": 0.0003519427412891422, "loss": 4.92, "mean_token_accuracy": 0.22762472778558732, "num_tokens": 91494718.0, "step": 39950 }, { "entropy": 5.763533878326416, "epoch": 3.949683669434559, "grad_norm": 1.1171875, "learning_rate": 0.0003519095779337987, "loss": 4.913, "mean_token_accuracy": 0.23371028304100036, "num_tokens": 91507286.0, "step": 39955 }, { "entropy": 5.678683614730835, "epoch": 3.9501779359430604, "grad_norm": 1.484375, "learning_rate": 0.00035187641268646756, "loss": 4.812, "mean_token_accuracy": 0.24543562531471252, "num_tokens": 91517590.0, "step": 39960 }, { "entropy": 5.7644916534423825, "epoch": 3.950672202451562, "grad_norm": 1.3046875, "learning_rate": 0.00035184324554796484, "loss": 4.8567, "mean_token_accuracy": 0.2372788518667221, "num_tokens": 91527995.0, "step": 39965 }, { "entropy": 5.855312156677246, "epoch": 3.9511664689600634, "grad_norm": 1.3359375, "learning_rate": 0.00035181007651910624, "loss": 4.9909, "mean_token_accuracy": 0.21801034957170487, "num_tokens": 91539457.0, "step": 39970 }, { "entropy": 5.72074179649353, "epoch": 3.9516607354685647, "grad_norm": 1.3515625, "learning_rate": 0.0003517769056007079, "loss": 4.9221, "mean_token_accuracy": 0.23197518140077591, "num_tokens": 91551104.0, "step": 39975 }, { "entropy": 5.787520122528076, "epoch": 3.952155001977066, "grad_norm": 1.3125, "learning_rate": 0.00035174373279358586, "loss": 4.9351, "mean_token_accuracy": 0.22299662083387375, "num_tokens": 91561558.0, "step": 39980 }, { "entropy": 5.83480396270752, "epoch": 3.952649268485567, "grad_norm": 1.3828125, "learning_rate": 0.0003517105580985559, "loss": 5.0883, "mean_token_accuracy": 0.2192860037088394, "num_tokens": 91573179.0, "step": 39985 }, { "entropy": 5.784835147857666, "epoch": 3.953143534994069, "grad_norm": 1.4140625, "learning_rate": 0.0003516773815164345, "loss": 4.9925, "mean_token_accuracy": 0.22235371619462968, "num_tokens": 91584973.0, "step": 39990 }, { "entropy": 5.787422323226929, "epoch": 3.95363780150257, "grad_norm": 1.1328125, "learning_rate": 0.0003516442030480375, "loss": 4.9153, "mean_token_accuracy": 0.23015111982822417, "num_tokens": 91596681.0, "step": 39995 }, { "entropy": 5.720462465286255, "epoch": 3.9541320680110714, "grad_norm": 1.2421875, "learning_rate": 0.0003516110226941812, "loss": 4.894, "mean_token_accuracy": 0.2240665152668953, "num_tokens": 91608382.0, "step": 40000 }, { "entropy": 5.822912693023682, "epoch": 3.954626334519573, "grad_norm": 1.203125, "learning_rate": 0.00035157784045568194, "loss": 4.9771, "mean_token_accuracy": 0.22176067531108856, "num_tokens": 91619619.0, "step": 40005 }, { "entropy": 5.810512113571167, "epoch": 3.9551206010280744, "grad_norm": 1.1328125, "learning_rate": 0.0003515446563333559, "loss": 5.0111, "mean_token_accuracy": 0.21462950855493546, "num_tokens": 91631889.0, "step": 40010 }, { "entropy": 5.8214610576629635, "epoch": 3.9556148675365757, "grad_norm": 1.2421875, "learning_rate": 0.00035151147032801947, "loss": 5.028, "mean_token_accuracy": 0.22076182216405868, "num_tokens": 91643982.0, "step": 40015 }, { "entropy": 5.774022340774536, "epoch": 3.956109134045077, "grad_norm": 1.1875, "learning_rate": 0.00035147828244048887, "loss": 5.0165, "mean_token_accuracy": 0.22320191860198973, "num_tokens": 91656322.0, "step": 40020 }, { "entropy": 5.764347219467163, "epoch": 3.9566034005535786, "grad_norm": 1.1015625, "learning_rate": 0.0003514450926715808, "loss": 4.9919, "mean_token_accuracy": 0.21665906012058259, "num_tokens": 91669419.0, "step": 40025 }, { "entropy": 5.772978973388672, "epoch": 3.95709766706208, "grad_norm": 1.21875, "learning_rate": 0.0003514119010221115, "loss": 4.8776, "mean_token_accuracy": 0.23673643469810485, "num_tokens": 91679919.0, "step": 40030 }, { "entropy": 5.709691429138184, "epoch": 3.957591933570581, "grad_norm": 1.3671875, "learning_rate": 0.0003513787074928976, "loss": 4.8893, "mean_token_accuracy": 0.23461782336235046, "num_tokens": 91690985.0, "step": 40035 }, { "entropy": 5.7271809577941895, "epoch": 3.958086200079083, "grad_norm": 1.1015625, "learning_rate": 0.0003513455120847557, "loss": 4.9325, "mean_token_accuracy": 0.22589402496814728, "num_tokens": 91702944.0, "step": 40040 }, { "entropy": 5.771044397354126, "epoch": 3.958580466587584, "grad_norm": 1.28125, "learning_rate": 0.00035131231479850226, "loss": 4.9172, "mean_token_accuracy": 0.23129124641418458, "num_tokens": 91713608.0, "step": 40045 }, { "entropy": 5.8294273853302006, "epoch": 3.9590747330960854, "grad_norm": 1.15625, "learning_rate": 0.0003512791156349541, "loss": 4.9581, "mean_token_accuracy": 0.22651818841695787, "num_tokens": 91725970.0, "step": 40050 }, { "entropy": 5.714255523681641, "epoch": 3.9595689996045866, "grad_norm": 1.2265625, "learning_rate": 0.0003512459145949279, "loss": 4.8957, "mean_token_accuracy": 0.22749619334936141, "num_tokens": 91738001.0, "step": 40055 }, { "entropy": 5.729784631729126, "epoch": 3.9600632661130883, "grad_norm": 1.4921875, "learning_rate": 0.00035121271167924033, "loss": 4.9115, "mean_token_accuracy": 0.23294657766819, "num_tokens": 91747050.0, "step": 40060 }, { "entropy": 5.73633975982666, "epoch": 3.9605575326215896, "grad_norm": 1.4296875, "learning_rate": 0.0003511795068887082, "loss": 4.9224, "mean_token_accuracy": 0.2277794286608696, "num_tokens": 91757298.0, "step": 40065 }, { "entropy": 5.848687410354614, "epoch": 3.961051799130091, "grad_norm": 1.15625, "learning_rate": 0.0003511463002241485, "loss": 5.0289, "mean_token_accuracy": 0.21902576982975006, "num_tokens": 91768276.0, "step": 40070 }, { "entropy": 5.777990531921387, "epoch": 3.9615460656385926, "grad_norm": 1.2734375, "learning_rate": 0.0003511130916863779, "loss": 4.923, "mean_token_accuracy": 0.23095069378614425, "num_tokens": 91779186.0, "step": 40075 }, { "entropy": 5.742792463302612, "epoch": 3.962040332147094, "grad_norm": 1.2109375, "learning_rate": 0.0003510798812762134, "loss": 4.9856, "mean_token_accuracy": 0.22668840289115905, "num_tokens": 91790503.0, "step": 40080 }, { "entropy": 5.762075471878052, "epoch": 3.962534598655595, "grad_norm": 1.2578125, "learning_rate": 0.0003510466689944721, "loss": 4.9492, "mean_token_accuracy": 0.22801593989133834, "num_tokens": 91802526.0, "step": 40085 }, { "entropy": 5.777751016616821, "epoch": 3.9630288651640964, "grad_norm": 1.2890625, "learning_rate": 0.0003510134548419709, "loss": 4.9477, "mean_token_accuracy": 0.2307625502347946, "num_tokens": 91814116.0, "step": 40090 }, { "entropy": 5.771556234359741, "epoch": 3.9635231316725976, "grad_norm": 1.203125, "learning_rate": 0.0003509802388195269, "loss": 4.9749, "mean_token_accuracy": 0.2300652891397476, "num_tokens": 91825459.0, "step": 40095 }, { "entropy": 5.789162063598633, "epoch": 3.9640173981810993, "grad_norm": 1.1328125, "learning_rate": 0.00035094702092795734, "loss": 5.0309, "mean_token_accuracy": 0.2215588092803955, "num_tokens": 91837656.0, "step": 40100 }, { "entropy": 5.751531887054443, "epoch": 3.9645116646896006, "grad_norm": 1.2265625, "learning_rate": 0.0003509138011680792, "loss": 4.9454, "mean_token_accuracy": 0.2293277069926262, "num_tokens": 91849384.0, "step": 40105 }, { "entropy": 5.717943572998047, "epoch": 3.965005931198102, "grad_norm": 1.1796875, "learning_rate": 0.0003508805795407097, "loss": 4.9062, "mean_token_accuracy": 0.23012191206216812, "num_tokens": 91861508.0, "step": 40110 }, { "entropy": 5.802012395858765, "epoch": 3.9655001977066036, "grad_norm": 1.203125, "learning_rate": 0.00035084735604666627, "loss": 5.0512, "mean_token_accuracy": 0.21989835500717164, "num_tokens": 91874439.0, "step": 40115 }, { "entropy": 5.821330547332764, "epoch": 3.965994464215105, "grad_norm": 1.265625, "learning_rate": 0.0003508141306867662, "loss": 4.9527, "mean_token_accuracy": 0.22307491153478623, "num_tokens": 91884949.0, "step": 40120 }, { "entropy": 5.766239309310913, "epoch": 3.966488730723606, "grad_norm": 1.25, "learning_rate": 0.0003507809034618267, "loss": 4.9407, "mean_token_accuracy": 0.22629584074020387, "num_tokens": 91895636.0, "step": 40125 }, { "entropy": 5.794170808792114, "epoch": 3.9669829972321073, "grad_norm": 1.1953125, "learning_rate": 0.00035074767437266507, "loss": 4.9556, "mean_token_accuracy": 0.2285407453775406, "num_tokens": 91908392.0, "step": 40130 }, { "entropy": 5.81916995048523, "epoch": 3.967477263740609, "grad_norm": 1.296875, "learning_rate": 0.000350714443420099, "loss": 4.9985, "mean_token_accuracy": 0.22149754762649537, "num_tokens": 91919976.0, "step": 40135 }, { "entropy": 5.7858967781066895, "epoch": 3.9679715302491103, "grad_norm": 1.296875, "learning_rate": 0.00035068121060494596, "loss": 4.9416, "mean_token_accuracy": 0.22283742129802703, "num_tokens": 91930770.0, "step": 40140 }, { "entropy": 5.863386011123657, "epoch": 3.9684657967576116, "grad_norm": 1.1953125, "learning_rate": 0.0003506479759280233, "loss": 5.0554, "mean_token_accuracy": 0.21945670545101165, "num_tokens": 91943317.0, "step": 40145 }, { "entropy": 5.766076850891113, "epoch": 3.9689600632661133, "grad_norm": 1.203125, "learning_rate": 0.0003506147393901487, "loss": 4.9403, "mean_token_accuracy": 0.22656757086515428, "num_tokens": 91954949.0, "step": 40150 }, { "entropy": 5.763749885559082, "epoch": 3.9694543297746145, "grad_norm": 1.34375, "learning_rate": 0.0003505815009921398, "loss": 4.9483, "mean_token_accuracy": 0.22425553500652312, "num_tokens": 91967392.0, "step": 40155 }, { "entropy": 5.7620312690734865, "epoch": 3.969948596283116, "grad_norm": 1.21875, "learning_rate": 0.0003505482607348142, "loss": 4.8925, "mean_token_accuracy": 0.22799201756715776, "num_tokens": 91979116.0, "step": 40160 }, { "entropy": 5.822312211990356, "epoch": 3.970442862791617, "grad_norm": 1.3046875, "learning_rate": 0.0003505150186189898, "loss": 4.9634, "mean_token_accuracy": 0.2221357047557831, "num_tokens": 91989811.0, "step": 40165 }, { "entropy": 5.771495723724366, "epoch": 3.9709371293001188, "grad_norm": 1.4375, "learning_rate": 0.0003504817746454841, "loss": 4.9497, "mean_token_accuracy": 0.2263193815946579, "num_tokens": 92000043.0, "step": 40170 }, { "entropy": 5.780642509460449, "epoch": 3.97143139580862, "grad_norm": 1.2109375, "learning_rate": 0.00035044852881511507, "loss": 5.0498, "mean_token_accuracy": 0.21753509789705278, "num_tokens": 92013475.0, "step": 40175 }, { "entropy": 5.803360843658448, "epoch": 3.9719256623171213, "grad_norm": 1.3515625, "learning_rate": 0.00035041528112870053, "loss": 4.9984, "mean_token_accuracy": 0.22429601550102235, "num_tokens": 92025369.0, "step": 40180 }, { "entropy": 5.808307266235351, "epoch": 3.972419928825623, "grad_norm": 1.328125, "learning_rate": 0.0003503820315870583, "loss": 4.9739, "mean_token_accuracy": 0.22106163799762726, "num_tokens": 92035682.0, "step": 40185 }, { "entropy": 5.82649507522583, "epoch": 3.9729141953341243, "grad_norm": 1.265625, "learning_rate": 0.0003503487801910065, "loss": 4.9731, "mean_token_accuracy": 0.22267328202724457, "num_tokens": 92046735.0, "step": 40190 }, { "entropy": 5.753697872161865, "epoch": 3.9734084618426255, "grad_norm": 1.2890625, "learning_rate": 0.000350315526941363, "loss": 4.9508, "mean_token_accuracy": 0.22687720954418183, "num_tokens": 92057802.0, "step": 40195 }, { "entropy": 5.785489845275879, "epoch": 3.973902728351127, "grad_norm": 1.265625, "learning_rate": 0.0003502822718389459, "loss": 5.0018, "mean_token_accuracy": 0.22397810220718384, "num_tokens": 92068656.0, "step": 40200 }, { "entropy": 5.721517753601074, "epoch": 3.974396994859628, "grad_norm": 1.21875, "learning_rate": 0.0003502490148845732, "loss": 4.9125, "mean_token_accuracy": 0.23132238239049913, "num_tokens": 92079403.0, "step": 40205 }, { "entropy": 5.783994483947754, "epoch": 3.9748912613681298, "grad_norm": 1.2734375, "learning_rate": 0.00035021575607906304, "loss": 4.9965, "mean_token_accuracy": 0.21775999516248704, "num_tokens": 92091482.0, "step": 40210 }, { "entropy": 5.8313556671142575, "epoch": 3.975385527876631, "grad_norm": 1.390625, "learning_rate": 0.00035018249542323357, "loss": 5.0096, "mean_token_accuracy": 0.2175132766366005, "num_tokens": 92101906.0, "step": 40215 }, { "entropy": 5.820845127105713, "epoch": 3.9758797943851327, "grad_norm": 1.2109375, "learning_rate": 0.0003501492329179031, "loss": 5.038, "mean_token_accuracy": 0.2138381227850914, "num_tokens": 92114683.0, "step": 40220 }, { "entropy": 5.873892879486084, "epoch": 3.976374060893634, "grad_norm": 1.296875, "learning_rate": 0.0003501159685638898, "loss": 5.0269, "mean_token_accuracy": 0.2177908957004547, "num_tokens": 92126108.0, "step": 40225 }, { "entropy": 5.763959884643555, "epoch": 3.9768683274021353, "grad_norm": 1.1875, "learning_rate": 0.000350082702362012, "loss": 4.963, "mean_token_accuracy": 0.22574483156204223, "num_tokens": 92136970.0, "step": 40230 }, { "entropy": 5.758642911911011, "epoch": 3.9773625939106365, "grad_norm": 1.25, "learning_rate": 0.00035004943431308816, "loss": 5.0494, "mean_token_accuracy": 0.21973459869623185, "num_tokens": 92148919.0, "step": 40235 }, { "entropy": 5.785069131851197, "epoch": 3.9778568604191378, "grad_norm": 1.28125, "learning_rate": 0.0003500161644179366, "loss": 4.8443, "mean_token_accuracy": 0.2346043646335602, "num_tokens": 92159492.0, "step": 40240 }, { "entropy": 5.833597803115845, "epoch": 3.9783511269276395, "grad_norm": 1.40625, "learning_rate": 0.0003499828926773757, "loss": 4.9774, "mean_token_accuracy": 0.2258749157190323, "num_tokens": 92171324.0, "step": 40245 }, { "entropy": 5.705038022994995, "epoch": 3.9788453934361407, "grad_norm": 1.3046875, "learning_rate": 0.00034994961909222405, "loss": 4.879, "mean_token_accuracy": 0.22789081186056137, "num_tokens": 92182336.0, "step": 40250 }, { "entropy": 5.757192611694336, "epoch": 3.979339659944642, "grad_norm": 1.2734375, "learning_rate": 0.00034991634366330005, "loss": 4.8848, "mean_token_accuracy": 0.23378842324018478, "num_tokens": 92193965.0, "step": 40255 }, { "entropy": 5.753625679016113, "epoch": 3.9798339264531437, "grad_norm": 1.234375, "learning_rate": 0.0003498830663914224, "loss": 4.8995, "mean_token_accuracy": 0.2297613501548767, "num_tokens": 92204921.0, "step": 40260 }, { "entropy": 5.734578418731689, "epoch": 3.980328192961645, "grad_norm": 1.265625, "learning_rate": 0.00034984978727740977, "loss": 4.9468, "mean_token_accuracy": 0.22469718158245086, "num_tokens": 92216557.0, "step": 40265 }, { "entropy": 5.762670040130615, "epoch": 3.9808224594701462, "grad_norm": 1.3359375, "learning_rate": 0.0003498165063220808, "loss": 4.9166, "mean_token_accuracy": 0.23029980808496475, "num_tokens": 92227346.0, "step": 40270 }, { "entropy": 5.733290815353394, "epoch": 3.9813167259786475, "grad_norm": 1.3203125, "learning_rate": 0.0003497832235262541, "loss": 4.8943, "mean_token_accuracy": 0.23587428033351898, "num_tokens": 92240099.0, "step": 40275 }, { "entropy": 5.771744298934936, "epoch": 3.981810992487149, "grad_norm": 1.2265625, "learning_rate": 0.00034974993889074846, "loss": 4.9863, "mean_token_accuracy": 0.22145727127790452, "num_tokens": 92251194.0, "step": 40280 }, { "entropy": 5.821692180633545, "epoch": 3.9823052589956505, "grad_norm": 1.2578125, "learning_rate": 0.0003497166524163827, "loss": 4.9912, "mean_token_accuracy": 0.22347330152988434, "num_tokens": 92261926.0, "step": 40285 }, { "entropy": 5.792262983322144, "epoch": 3.9827995255041517, "grad_norm": 1.25, "learning_rate": 0.00034968336410397586, "loss": 4.9282, "mean_token_accuracy": 0.23435707539319992, "num_tokens": 92274292.0, "step": 40290 }, { "entropy": 5.734842824935913, "epoch": 3.9832937920126534, "grad_norm": 1.1640625, "learning_rate": 0.00034965007395434657, "loss": 4.9587, "mean_token_accuracy": 0.22517624199390412, "num_tokens": 92285803.0, "step": 40295 }, { "entropy": 5.737663316726684, "epoch": 3.9837880585211547, "grad_norm": 1.2109375, "learning_rate": 0.0003496167819683138, "loss": 4.9404, "mean_token_accuracy": 0.2281440481543541, "num_tokens": 92297729.0, "step": 40300 }, { "entropy": 5.772334098815918, "epoch": 3.984282325029656, "grad_norm": 1.3828125, "learning_rate": 0.0003495834881466967, "loss": 4.9433, "mean_token_accuracy": 0.23039780408143998, "num_tokens": 92309215.0, "step": 40305 }, { "entropy": 5.7725506782531735, "epoch": 3.984776591538157, "grad_norm": 1.1953125, "learning_rate": 0.0003495501924903143, "loss": 4.9627, "mean_token_accuracy": 0.2204370990395546, "num_tokens": 92320320.0, "step": 40310 }, { "entropy": 5.781480836868286, "epoch": 3.9852708580466585, "grad_norm": 1.234375, "learning_rate": 0.0003495168949999855, "loss": 4.9835, "mean_token_accuracy": 0.2208327829837799, "num_tokens": 92333054.0, "step": 40315 }, { "entropy": 5.699251174926758, "epoch": 3.98576512455516, "grad_norm": 1.21875, "learning_rate": 0.0003494835956765295, "loss": 4.9092, "mean_token_accuracy": 0.22790580242872238, "num_tokens": 92345558.0, "step": 40320 }, { "entropy": 5.751389694213867, "epoch": 3.9862593910636615, "grad_norm": 1.3828125, "learning_rate": 0.0003494502945207656, "loss": 4.9092, "mean_token_accuracy": 0.22479078471660613, "num_tokens": 92356782.0, "step": 40325 }, { "entropy": 5.84130449295044, "epoch": 3.986753657572163, "grad_norm": 1.3203125, "learning_rate": 0.00034941699153351286, "loss": 5.0467, "mean_token_accuracy": 0.22326316237449645, "num_tokens": 92368600.0, "step": 40330 }, { "entropy": 5.786207675933838, "epoch": 3.9872479240806644, "grad_norm": 1.2265625, "learning_rate": 0.0003493836867155905, "loss": 4.9192, "mean_token_accuracy": 0.22779793590307235, "num_tokens": 92380694.0, "step": 40335 }, { "entropy": 5.742025232315063, "epoch": 3.9877421905891657, "grad_norm": 1.125, "learning_rate": 0.00034935038006781805, "loss": 4.9451, "mean_token_accuracy": 0.22942596822977065, "num_tokens": 92392518.0, "step": 40340 }, { "entropy": 5.745583248138428, "epoch": 3.988236457097667, "grad_norm": 1.2734375, "learning_rate": 0.00034931707159101467, "loss": 4.9769, "mean_token_accuracy": 0.22393186390399933, "num_tokens": 92403631.0, "step": 40345 }, { "entropy": 5.88181209564209, "epoch": 3.988730723606168, "grad_norm": 1.2265625, "learning_rate": 0.0003492837612859997, "loss": 5.1564, "mean_token_accuracy": 0.20926500707864762, "num_tokens": 92414606.0, "step": 40350 }, { "entropy": 5.7603480339050295, "epoch": 3.98922499011467, "grad_norm": 1.421875, "learning_rate": 0.0003492504491535928, "loss": 4.905, "mean_token_accuracy": 0.2368936851620674, "num_tokens": 92425384.0, "step": 40355 }, { "entropy": 5.746561288833618, "epoch": 3.989719256623171, "grad_norm": 1.25, "learning_rate": 0.0003492171351946133, "loss": 4.8662, "mean_token_accuracy": 0.23603501319885253, "num_tokens": 92436179.0, "step": 40360 }, { "entropy": 5.672228717803955, "epoch": 3.9902135231316724, "grad_norm": 1.2265625, "learning_rate": 0.00034918381940988075, "loss": 4.9061, "mean_token_accuracy": 0.2369284674525261, "num_tokens": 92447615.0, "step": 40365 }, { "entropy": 5.743786144256592, "epoch": 3.990707789640174, "grad_norm": 1.390625, "learning_rate": 0.0003491505018002147, "loss": 4.9611, "mean_token_accuracy": 0.22974384874105452, "num_tokens": 92458900.0, "step": 40370 }, { "entropy": 5.747843027114868, "epoch": 3.9912020561486754, "grad_norm": 1.203125, "learning_rate": 0.0003491171823664348, "loss": 4.8705, "mean_token_accuracy": 0.23919363170862198, "num_tokens": 92470065.0, "step": 40375 }, { "entropy": 5.866286516189575, "epoch": 3.9916963226571767, "grad_norm": 1.3203125, "learning_rate": 0.00034908386110936077, "loss": 5.0603, "mean_token_accuracy": 0.2202727258205414, "num_tokens": 92482157.0, "step": 40380 }, { "entropy": 5.754137992858887, "epoch": 3.992190589165678, "grad_norm": 1.15625, "learning_rate": 0.0003490505380298122, "loss": 5.0023, "mean_token_accuracy": 0.21203076839447021, "num_tokens": 92496438.0, "step": 40385 }, { "entropy": 5.72451605796814, "epoch": 3.9926848556741796, "grad_norm": 1.2578125, "learning_rate": 0.000349017213128609, "loss": 4.8854, "mean_token_accuracy": 0.23598654121160506, "num_tokens": 92507832.0, "step": 40390 }, { "entropy": 5.75435094833374, "epoch": 3.993179122182681, "grad_norm": 1.265625, "learning_rate": 0.0003489838864065708, "loss": 4.9257, "mean_token_accuracy": 0.2287950873374939, "num_tokens": 92519465.0, "step": 40395 }, { "entropy": 5.743924808502197, "epoch": 3.993673388691182, "grad_norm": 1.234375, "learning_rate": 0.0003489505578645175, "loss": 4.9734, "mean_token_accuracy": 0.21963551193475722, "num_tokens": 92531051.0, "step": 40400 }, { "entropy": 5.740170431137085, "epoch": 3.994167655199684, "grad_norm": 1.203125, "learning_rate": 0.00034891722750326907, "loss": 4.9826, "mean_token_accuracy": 0.22334738373756408, "num_tokens": 92543654.0, "step": 40405 }, { "entropy": 5.8207605361938475, "epoch": 3.994661921708185, "grad_norm": 1.3359375, "learning_rate": 0.00034888389532364533, "loss": 4.9824, "mean_token_accuracy": 0.225418059527874, "num_tokens": 92554126.0, "step": 40410 }, { "entropy": 5.807209396362305, "epoch": 3.9951561882166864, "grad_norm": 1.1484375, "learning_rate": 0.00034885056132646637, "loss": 5.0786, "mean_token_accuracy": 0.21850505322217942, "num_tokens": 92567205.0, "step": 40415 }, { "entropy": 5.778727054595947, "epoch": 3.9956504547251877, "grad_norm": 1.3359375, "learning_rate": 0.00034881722551255206, "loss": 4.9405, "mean_token_accuracy": 0.22961635142564774, "num_tokens": 92579402.0, "step": 40420 }, { "entropy": 5.82212266921997, "epoch": 3.9961447212336894, "grad_norm": 1.1015625, "learning_rate": 0.0003487838878827225, "loss": 4.9814, "mean_token_accuracy": 0.2220032572746277, "num_tokens": 92592514.0, "step": 40425 }, { "entropy": 5.777477264404297, "epoch": 3.9966389877421906, "grad_norm": 1.265625, "learning_rate": 0.00034875054843779804, "loss": 4.9444, "mean_token_accuracy": 0.22618235051631927, "num_tokens": 92604571.0, "step": 40430 }, { "entropy": 5.724583482742309, "epoch": 3.997133254250692, "grad_norm": 1.28125, "learning_rate": 0.0003487172071785985, "loss": 4.9916, "mean_token_accuracy": 0.2290568083524704, "num_tokens": 92616867.0, "step": 40435 }, { "entropy": 5.758102321624756, "epoch": 3.9976275207591936, "grad_norm": 1.2109375, "learning_rate": 0.0003486838641059443, "loss": 4.9523, "mean_token_accuracy": 0.2272259071469307, "num_tokens": 92628958.0, "step": 40440 }, { "entropy": 5.806486463546753, "epoch": 3.998121787267695, "grad_norm": 1.25, "learning_rate": 0.00034865051922065556, "loss": 4.9863, "mean_token_accuracy": 0.22635818719863893, "num_tokens": 92639076.0, "step": 40445 }, { "entropy": 5.850391244888305, "epoch": 3.998616053776196, "grad_norm": 1.1484375, "learning_rate": 0.00034861717252355264, "loss": 5.0205, "mean_token_accuracy": 0.22004858255386353, "num_tokens": 92650824.0, "step": 40450 }, { "entropy": 5.801622819900513, "epoch": 3.9991103202846974, "grad_norm": 1.28125, "learning_rate": 0.0003485838240154559, "loss": 5.0758, "mean_token_accuracy": 0.2143637418746948, "num_tokens": 92662371.0, "step": 40455 }, { "entropy": 5.839067077636718, "epoch": 3.9996045867931986, "grad_norm": 1.2109375, "learning_rate": 0.00034855047369718563, "loss": 5.0721, "mean_token_accuracy": 0.21548788249492645, "num_tokens": 92673604.0, "step": 40460 }, { "entropy": 5.785769891738892, "epoch": 4.0000988533017, "grad_norm": 1.125, "learning_rate": 0.00034851712156956226, "loss": 4.9656, "mean_token_accuracy": 0.218556709587574, "num_tokens": 92684130.0, "step": 40465 }, { "entropy": 5.762605953216553, "epoch": 4.000593119810202, "grad_norm": 1.25, "learning_rate": 0.00034848376763340635, "loss": 4.881, "mean_token_accuracy": 0.22869669944047927, "num_tokens": 92694625.0, "step": 40470 }, { "entropy": 5.761461544036865, "epoch": 4.001087386318703, "grad_norm": 1.296875, "learning_rate": 0.00034845041188953836, "loss": 4.9901, "mean_token_accuracy": 0.2163677215576172, "num_tokens": 92705243.0, "step": 40475 }, { "entropy": 5.712785053253174, "epoch": 4.001581652827205, "grad_norm": 1.2578125, "learning_rate": 0.0003484170543387788, "loss": 4.8023, "mean_token_accuracy": 0.24021390229463577, "num_tokens": 92716064.0, "step": 40480 }, { "entropy": 5.824042749404907, "epoch": 4.002075919335706, "grad_norm": 1.4140625, "learning_rate": 0.0003483836949819483, "loss": 4.9341, "mean_token_accuracy": 0.22667334824800492, "num_tokens": 92726910.0, "step": 40485 }, { "entropy": 5.803349924087525, "epoch": 4.002570185844207, "grad_norm": 1.3515625, "learning_rate": 0.00034835033381986757, "loss": 4.9713, "mean_token_accuracy": 0.224851331114769, "num_tokens": 92738847.0, "step": 40490 }, { "entropy": 5.7535951137542725, "epoch": 4.003064452352708, "grad_norm": 1.2578125, "learning_rate": 0.0003483169708533572, "loss": 4.9799, "mean_token_accuracy": 0.22277723848819733, "num_tokens": 92750471.0, "step": 40495 }, { "entropy": 5.709720087051392, "epoch": 4.00355871886121, "grad_norm": 1.1796875, "learning_rate": 0.0003482836060832381, "loss": 4.8768, "mean_token_accuracy": 0.23464414477348328, "num_tokens": 92762619.0, "step": 40500 }, { "entropy": 5.702446556091308, "epoch": 4.004052985369712, "grad_norm": 1.265625, "learning_rate": 0.0003482502395103309, "loss": 4.8284, "mean_token_accuracy": 0.23986173719167708, "num_tokens": 92774308.0, "step": 40505 }, { "entropy": 5.783125019073486, "epoch": 4.004547251878213, "grad_norm": 1.234375, "learning_rate": 0.00034821687113545624, "loss": 5.0138, "mean_token_accuracy": 0.21683288663625716, "num_tokens": 92784408.0, "step": 40510 }, { "entropy": 5.805502843856812, "epoch": 4.005041518386714, "grad_norm": 1.296875, "learning_rate": 0.00034818350095943535, "loss": 4.9917, "mean_token_accuracy": 0.2325211927294731, "num_tokens": 92795615.0, "step": 40515 }, { "entropy": 5.814350032806397, "epoch": 4.005535784895216, "grad_norm": 1.2890625, "learning_rate": 0.00034815012898308894, "loss": 4.9934, "mean_token_accuracy": 0.2276730492711067, "num_tokens": 92807850.0, "step": 40520 }, { "entropy": 5.881468486785889, "epoch": 4.006030051403717, "grad_norm": 1.2578125, "learning_rate": 0.000348116755207238, "loss": 5.0107, "mean_token_accuracy": 0.2245783507823944, "num_tokens": 92818462.0, "step": 40525 }, { "entropy": 5.776654672622681, "epoch": 4.006524317912218, "grad_norm": 1.15625, "learning_rate": 0.00034808337963270364, "loss": 4.8652, "mean_token_accuracy": 0.23501743525266647, "num_tokens": 92830716.0, "step": 40530 }, { "entropy": 5.815789651870728, "epoch": 4.007018584420719, "grad_norm": 1.1953125, "learning_rate": 0.00034805000226030677, "loss": 4.9927, "mean_token_accuracy": 0.2213546723127365, "num_tokens": 92842576.0, "step": 40535 }, { "entropy": 5.794633245468139, "epoch": 4.007512850929221, "grad_norm": 1.15625, "learning_rate": 0.0003480166230908683, "loss": 4.9798, "mean_token_accuracy": 0.222476963698864, "num_tokens": 92853981.0, "step": 40540 }, { "entropy": 5.797709703445435, "epoch": 4.008007117437723, "grad_norm": 1.2265625, "learning_rate": 0.0003479832421252098, "loss": 4.971, "mean_token_accuracy": 0.21914765536785125, "num_tokens": 92866059.0, "step": 40545 }, { "entropy": 5.7646660804748535, "epoch": 4.008501383946224, "grad_norm": 1.328125, "learning_rate": 0.0003479498593641522, "loss": 4.9291, "mean_token_accuracy": 0.22424253821372986, "num_tokens": 92877362.0, "step": 40550 }, { "entropy": 5.807667016983032, "epoch": 4.008995650454725, "grad_norm": 1.2578125, "learning_rate": 0.0003479164748085167, "loss": 4.9909, "mean_token_accuracy": 0.2231794148683548, "num_tokens": 92890910.0, "step": 40555 }, { "entropy": 5.786786651611328, "epoch": 4.0094899169632265, "grad_norm": 1.390625, "learning_rate": 0.00034788308845912463, "loss": 4.8903, "mean_token_accuracy": 0.23297762274742126, "num_tokens": 92901463.0, "step": 40560 }, { "entropy": 5.7811933040618895, "epoch": 4.009984183471728, "grad_norm": 1.2890625, "learning_rate": 0.0003478497003167972, "loss": 4.9014, "mean_token_accuracy": 0.23313555717468262, "num_tokens": 92912964.0, "step": 40565 }, { "entropy": 5.732276153564453, "epoch": 4.010478449980229, "grad_norm": 1.421875, "learning_rate": 0.00034781631038235597, "loss": 4.882, "mean_token_accuracy": 0.2361373260617256, "num_tokens": 92923725.0, "step": 40570 }, { "entropy": 5.696112251281738, "epoch": 4.01097271648873, "grad_norm": 1.2734375, "learning_rate": 0.0003477829186566221, "loss": 4.9464, "mean_token_accuracy": 0.23318856358528137, "num_tokens": 92934982.0, "step": 40575 }, { "entropy": 5.828345251083374, "epoch": 4.0114669829972325, "grad_norm": 1.4296875, "learning_rate": 0.0003477495251404172, "loss": 4.9474, "mean_token_accuracy": 0.22557390630245208, "num_tokens": 92945525.0, "step": 40580 }, { "entropy": 5.735734272003174, "epoch": 4.011961249505734, "grad_norm": 1.203125, "learning_rate": 0.0003477161298345627, "loss": 4.8962, "mean_token_accuracy": 0.23384736478328705, "num_tokens": 92957802.0, "step": 40585 }, { "entropy": 5.83856692314148, "epoch": 4.012455516014235, "grad_norm": 1.34375, "learning_rate": 0.00034768273273988004, "loss": 4.9609, "mean_token_accuracy": 0.22502784430980682, "num_tokens": 92969010.0, "step": 40590 }, { "entropy": 5.811841201782227, "epoch": 4.012949782522736, "grad_norm": 1.28125, "learning_rate": 0.0003476493338571909, "loss": 5.0109, "mean_token_accuracy": 0.22335454672574998, "num_tokens": 92979342.0, "step": 40595 }, { "entropy": 5.81382737159729, "epoch": 4.0134440490312375, "grad_norm": 1.328125, "learning_rate": 0.00034761593318731704, "loss": 4.9488, "mean_token_accuracy": 0.22952488213777542, "num_tokens": 92990092.0, "step": 40600 }, { "entropy": 5.7955405712127686, "epoch": 4.013938315539739, "grad_norm": 1.3046875, "learning_rate": 0.00034758253073107983, "loss": 4.8631, "mean_token_accuracy": 0.23247399628162385, "num_tokens": 92999658.0, "step": 40605 }, { "entropy": 5.737318325042724, "epoch": 4.01443258204824, "grad_norm": 1.28125, "learning_rate": 0.0003475491264893011, "loss": 4.9727, "mean_token_accuracy": 0.22823771685361863, "num_tokens": 93010771.0, "step": 40610 }, { "entropy": 5.788852262496948, "epoch": 4.014926848556742, "grad_norm": 1.265625, "learning_rate": 0.00034751572046280254, "loss": 4.9029, "mean_token_accuracy": 0.22613521069288253, "num_tokens": 93020993.0, "step": 40615 }, { "entropy": 5.820985412597656, "epoch": 4.0154211150652435, "grad_norm": 1.3203125, "learning_rate": 0.00034748231265240617, "loss": 4.9961, "mean_token_accuracy": 0.22618257254362106, "num_tokens": 93032072.0, "step": 40620 }, { "entropy": 5.798431825637818, "epoch": 4.015915381573745, "grad_norm": 1.3125, "learning_rate": 0.00034744890305893355, "loss": 5.0358, "mean_token_accuracy": 0.22091520428657532, "num_tokens": 93042768.0, "step": 40625 }, { "entropy": 5.822737407684326, "epoch": 4.016409648082246, "grad_norm": 1.2265625, "learning_rate": 0.0003474154916832067, "loss": 4.9771, "mean_token_accuracy": 0.23114742189645768, "num_tokens": 93054162.0, "step": 40630 }, { "entropy": 5.739299964904785, "epoch": 4.016903914590747, "grad_norm": 1.2734375, "learning_rate": 0.00034738207852604746, "loss": 4.7729, "mean_token_accuracy": 0.24725307673215866, "num_tokens": 93065124.0, "step": 40635 }, { "entropy": 5.769763088226318, "epoch": 4.0173981810992485, "grad_norm": 1.1796875, "learning_rate": 0.00034734866358827795, "loss": 4.9424, "mean_token_accuracy": 0.23085163086652755, "num_tokens": 93076439.0, "step": 40640 }, { "entropy": 5.744402122497559, "epoch": 4.01789244760775, "grad_norm": 1.2578125, "learning_rate": 0.00034731524687072005, "loss": 4.9154, "mean_token_accuracy": 0.22195419520139695, "num_tokens": 93087441.0, "step": 40645 }, { "entropy": 5.873094511032105, "epoch": 4.018386714116252, "grad_norm": 1.375, "learning_rate": 0.0003472818283741959, "loss": 5.0439, "mean_token_accuracy": 0.20976882576942443, "num_tokens": 93099098.0, "step": 40650 }, { "entropy": 5.762462902069092, "epoch": 4.018880980624753, "grad_norm": 1.3203125, "learning_rate": 0.0003472484080995275, "loss": 4.8994, "mean_token_accuracy": 0.2354673907160759, "num_tokens": 93109927.0, "step": 40655 }, { "entropy": 5.741521215438842, "epoch": 4.0193752471332544, "grad_norm": 1.3984375, "learning_rate": 0.00034721498604753706, "loss": 4.8254, "mean_token_accuracy": 0.2353705108165741, "num_tokens": 93121910.0, "step": 40660 }, { "entropy": 5.711540842056275, "epoch": 4.019869513641756, "grad_norm": 1.3203125, "learning_rate": 0.00034718156221904677, "loss": 4.9215, "mean_token_accuracy": 0.23290601670742034, "num_tokens": 93133598.0, "step": 40665 }, { "entropy": 5.7512321949005125, "epoch": 4.020363780150257, "grad_norm": 1.2890625, "learning_rate": 0.0003471481366148789, "loss": 4.9255, "mean_token_accuracy": 0.2258656218647957, "num_tokens": 93145189.0, "step": 40670 }, { "entropy": 5.786343765258789, "epoch": 4.020858046658758, "grad_norm": 1.2890625, "learning_rate": 0.00034711470923585563, "loss": 4.9327, "mean_token_accuracy": 0.2321312204003334, "num_tokens": 93157630.0, "step": 40675 }, { "entropy": 5.731643772125244, "epoch": 4.0213523131672595, "grad_norm": 1.296875, "learning_rate": 0.0003470812800827993, "loss": 4.8698, "mean_token_accuracy": 0.23693819493055343, "num_tokens": 93167640.0, "step": 40680 }, { "entropy": 5.722732257843018, "epoch": 4.021846579675761, "grad_norm": 1.2890625, "learning_rate": 0.0003470478491565323, "loss": 4.8762, "mean_token_accuracy": 0.23768391609191894, "num_tokens": 93179088.0, "step": 40685 }, { "entropy": 5.785084962844849, "epoch": 4.022340846184263, "grad_norm": 1.3046875, "learning_rate": 0.00034701441645787706, "loss": 4.9433, "mean_token_accuracy": 0.23518577665090562, "num_tokens": 93190345.0, "step": 40690 }, { "entropy": 5.815078830718994, "epoch": 4.022835112692764, "grad_norm": 1.359375, "learning_rate": 0.0003469809819876561, "loss": 4.9557, "mean_token_accuracy": 0.22196510881185533, "num_tokens": 93201206.0, "step": 40695 }, { "entropy": 5.763471603393555, "epoch": 4.023329379201265, "grad_norm": 1.1953125, "learning_rate": 0.00034694754574669166, "loss": 4.8781, "mean_token_accuracy": 0.2307511568069458, "num_tokens": 93212204.0, "step": 40700 }, { "entropy": 5.7550232887268065, "epoch": 4.023823645709767, "grad_norm": 1.203125, "learning_rate": 0.00034691410773580653, "loss": 4.8637, "mean_token_accuracy": 0.24097003936767578, "num_tokens": 93224530.0, "step": 40705 }, { "entropy": 5.756622266769409, "epoch": 4.024317912218268, "grad_norm": 1.359375, "learning_rate": 0.0003468806679558231, "loss": 4.9272, "mean_token_accuracy": 0.2391957238316536, "num_tokens": 93237403.0, "step": 40710 }, { "entropy": 5.745161056518555, "epoch": 4.024812178726769, "grad_norm": 1.234375, "learning_rate": 0.00034684722640756415, "loss": 4.9322, "mean_token_accuracy": 0.23341405987739564, "num_tokens": 93249168.0, "step": 40715 }, { "entropy": 5.78914065361023, "epoch": 4.0253064452352705, "grad_norm": 1.3515625, "learning_rate": 0.0003468137830918523, "loss": 4.933, "mean_token_accuracy": 0.22577230483293534, "num_tokens": 93260050.0, "step": 40720 }, { "entropy": 5.767939805984497, "epoch": 4.025800711743773, "grad_norm": 1.1328125, "learning_rate": 0.0003467803380095102, "loss": 4.9352, "mean_token_accuracy": 0.22619079798460007, "num_tokens": 93272514.0, "step": 40725 }, { "entropy": 5.71905746459961, "epoch": 4.026294978252274, "grad_norm": 1.140625, "learning_rate": 0.00034674689116136073, "loss": 4.9405, "mean_token_accuracy": 0.23253145962953567, "num_tokens": 93283824.0, "step": 40730 }, { "entropy": 5.732578086853027, "epoch": 4.026789244760775, "grad_norm": 1.234375, "learning_rate": 0.00034671344254822654, "loss": 4.8791, "mean_token_accuracy": 0.23702708780765533, "num_tokens": 93294864.0, "step": 40735 }, { "entropy": 5.765891647338867, "epoch": 4.027283511269276, "grad_norm": 1.265625, "learning_rate": 0.00034667999217093056, "loss": 4.9978, "mean_token_accuracy": 0.22929890751838683, "num_tokens": 93306166.0, "step": 40740 }, { "entropy": 5.804338550567627, "epoch": 4.027777777777778, "grad_norm": 1.1875, "learning_rate": 0.0003466465400302956, "loss": 4.998, "mean_token_accuracy": 0.22286831736564636, "num_tokens": 93318622.0, "step": 40745 }, { "entropy": 5.741446828842163, "epoch": 4.028272044286279, "grad_norm": 1.3359375, "learning_rate": 0.0003466130861271447, "loss": 4.8809, "mean_token_accuracy": 0.2385230302810669, "num_tokens": 93330487.0, "step": 40750 }, { "entropy": 5.797368812561035, "epoch": 4.02876631079478, "grad_norm": 1.3203125, "learning_rate": 0.0003465796304623007, "loss": 4.9931, "mean_token_accuracy": 0.22030794322490693, "num_tokens": 93342639.0, "step": 40755 }, { "entropy": 5.733156490325928, "epoch": 4.029260577303282, "grad_norm": 1.1484375, "learning_rate": 0.0003465461730365868, "loss": 4.8791, "mean_token_accuracy": 0.23482966125011445, "num_tokens": 93355696.0, "step": 40760 }, { "entropy": 5.786558294296265, "epoch": 4.029754843811784, "grad_norm": 1.2421875, "learning_rate": 0.0003465127138508259, "loss": 4.9096, "mean_token_accuracy": 0.22907466441392899, "num_tokens": 93367913.0, "step": 40765 }, { "entropy": 5.756281185150146, "epoch": 4.030249110320285, "grad_norm": 1.328125, "learning_rate": 0.00034647925290584114, "loss": 4.9418, "mean_token_accuracy": 0.22875956445932388, "num_tokens": 93378872.0, "step": 40770 }, { "entropy": 5.75783052444458, "epoch": 4.030743376828786, "grad_norm": 1.2734375, "learning_rate": 0.0003464457902024556, "loss": 4.9522, "mean_token_accuracy": 0.22891180515289306, "num_tokens": 93390029.0, "step": 40775 }, { "entropy": 5.817436361312867, "epoch": 4.031237643337287, "grad_norm": 1.25, "learning_rate": 0.00034641232574149263, "loss": 4.9621, "mean_token_accuracy": 0.22530021965503694, "num_tokens": 93401518.0, "step": 40780 }, { "entropy": 5.7952308177948, "epoch": 4.031731909845789, "grad_norm": 1.3359375, "learning_rate": 0.0003463788595237753, "loss": 4.8551, "mean_token_accuracy": 0.2315203756093979, "num_tokens": 93412399.0, "step": 40785 }, { "entropy": 5.796579647064209, "epoch": 4.03222617635429, "grad_norm": 1.28125, "learning_rate": 0.00034634539155012703, "loss": 4.9637, "mean_token_accuracy": 0.22577570527791976, "num_tokens": 93423815.0, "step": 40790 }, { "entropy": 5.79377179145813, "epoch": 4.032720442862791, "grad_norm": 1.1953125, "learning_rate": 0.000346311921821371, "loss": 4.9242, "mean_token_accuracy": 0.23173152804374694, "num_tokens": 93434635.0, "step": 40795 }, { "entropy": 5.7649143695831295, "epoch": 4.033214709371293, "grad_norm": 1.3046875, "learning_rate": 0.00034627845033833053, "loss": 4.9407, "mean_token_accuracy": 0.23091771006584166, "num_tokens": 93445138.0, "step": 40800 }, { "entropy": 5.762605762481689, "epoch": 4.033708975879795, "grad_norm": 1.2265625, "learning_rate": 0.0003462449771018293, "loss": 4.9324, "mean_token_accuracy": 0.23476919680833816, "num_tokens": 93456249.0, "step": 40805 }, { "entropy": 5.8352518558502195, "epoch": 4.034203242388296, "grad_norm": 1.15625, "learning_rate": 0.0003462115021126906, "loss": 4.9729, "mean_token_accuracy": 0.22602119892835618, "num_tokens": 93468576.0, "step": 40810 }, { "entropy": 5.813147830963135, "epoch": 4.034697508896797, "grad_norm": 1.3203125, "learning_rate": 0.0003461780253717378, "loss": 4.9036, "mean_token_accuracy": 0.22892917990684508, "num_tokens": 93479643.0, "step": 40815 }, { "entropy": 5.786829233169556, "epoch": 4.035191775405298, "grad_norm": 1.2109375, "learning_rate": 0.0003461445468797946, "loss": 4.8802, "mean_token_accuracy": 0.2335035979747772, "num_tokens": 93490619.0, "step": 40820 }, { "entropy": 5.688183116912842, "epoch": 4.0356860419138, "grad_norm": 1.2421875, "learning_rate": 0.00034611106663768443, "loss": 4.8481, "mean_token_accuracy": 0.22841022461652755, "num_tokens": 93501763.0, "step": 40825 }, { "entropy": 5.73259015083313, "epoch": 4.036180308422301, "grad_norm": 1.3125, "learning_rate": 0.000346077584646231, "loss": 4.8408, "mean_token_accuracy": 0.23093935698270798, "num_tokens": 93513851.0, "step": 40830 }, { "entropy": 5.71949577331543, "epoch": 4.036674574930803, "grad_norm": 1.328125, "learning_rate": 0.00034604410090625795, "loss": 4.9332, "mean_token_accuracy": 0.22738130986690522, "num_tokens": 93525049.0, "step": 40835 }, { "entropy": 5.723616600036621, "epoch": 4.037168841439304, "grad_norm": 1.2421875, "learning_rate": 0.0003460106154185891, "loss": 4.926, "mean_token_accuracy": 0.23043525218963623, "num_tokens": 93537068.0, "step": 40840 }, { "entropy": 5.797301578521728, "epoch": 4.037663107947806, "grad_norm": 1.2421875, "learning_rate": 0.00034597712818404793, "loss": 4.9098, "mean_token_accuracy": 0.2364737495779991, "num_tokens": 93548787.0, "step": 40845 }, { "entropy": 5.7573511600494385, "epoch": 4.038157374456307, "grad_norm": 1.3125, "learning_rate": 0.0003459436392034585, "loss": 4.9187, "mean_token_accuracy": 0.23165173381567, "num_tokens": 93559781.0, "step": 40850 }, { "entropy": 5.769538259506225, "epoch": 4.038651640964808, "grad_norm": 1.2890625, "learning_rate": 0.00034591014847764457, "loss": 4.897, "mean_token_accuracy": 0.22607481479644775, "num_tokens": 93570775.0, "step": 40855 }, { "entropy": 5.738147020339966, "epoch": 4.039145907473309, "grad_norm": 1.4765625, "learning_rate": 0.0003458766560074299, "loss": 4.8908, "mean_token_accuracy": 0.23456590324640275, "num_tokens": 93581222.0, "step": 40860 }, { "entropy": 5.775625705718994, "epoch": 4.039640173981811, "grad_norm": 1.25, "learning_rate": 0.0003458431617936386, "loss": 4.9712, "mean_token_accuracy": 0.22165210992097856, "num_tokens": 93592071.0, "step": 40865 }, { "entropy": 5.796543884277344, "epoch": 4.040134440490313, "grad_norm": 1.3828125, "learning_rate": 0.0003458096658370944, "loss": 4.9556, "mean_token_accuracy": 0.22880680561065675, "num_tokens": 93603570.0, "step": 40870 }, { "entropy": 5.840706920623779, "epoch": 4.040628706998814, "grad_norm": 1.296875, "learning_rate": 0.0003457761681386215, "loss": 4.9349, "mean_token_accuracy": 0.2240452766418457, "num_tokens": 93614552.0, "step": 40875 }, { "entropy": 5.765056705474853, "epoch": 4.041122973507315, "grad_norm": 1.359375, "learning_rate": 0.0003457426686990439, "loss": 4.9383, "mean_token_accuracy": 0.23604277819395064, "num_tokens": 93625593.0, "step": 40880 }, { "entropy": 5.757392263412475, "epoch": 4.041617240015817, "grad_norm": 1.3125, "learning_rate": 0.0003457091675191857, "loss": 4.936, "mean_token_accuracy": 0.23400370180606841, "num_tokens": 93635420.0, "step": 40885 }, { "entropy": 5.742556428909301, "epoch": 4.042111506524318, "grad_norm": 1.328125, "learning_rate": 0.000345675664599871, "loss": 4.869, "mean_token_accuracy": 0.23507955372333528, "num_tokens": 93647458.0, "step": 40890 }, { "entropy": 5.796082639694214, "epoch": 4.042605773032819, "grad_norm": 1.2734375, "learning_rate": 0.0003456421599419239, "loss": 4.9119, "mean_token_accuracy": 0.2297603502869606, "num_tokens": 93658867.0, "step": 40895 }, { "entropy": 5.834683990478515, "epoch": 4.04310003954132, "grad_norm": 1.3515625, "learning_rate": 0.00034560865354616875, "loss": 4.97, "mean_token_accuracy": 0.22013348788022996, "num_tokens": 93670391.0, "step": 40900 }, { "entropy": 5.739375066757202, "epoch": 4.0435943060498225, "grad_norm": 1.1953125, "learning_rate": 0.0003455751454134298, "loss": 4.9012, "mean_token_accuracy": 0.23456461131572723, "num_tokens": 93681670.0, "step": 40905 }, { "entropy": 5.757953786849976, "epoch": 4.044088572558324, "grad_norm": 1.3203125, "learning_rate": 0.0003455416355445313, "loss": 4.8941, "mean_token_accuracy": 0.22779715657234192, "num_tokens": 93692529.0, "step": 40910 }, { "entropy": 5.815210199356079, "epoch": 4.044582839066825, "grad_norm": 1.1640625, "learning_rate": 0.00034550812394029765, "loss": 4.9258, "mean_token_accuracy": 0.22130864560604097, "num_tokens": 93704259.0, "step": 40915 }, { "entropy": 5.716447591781616, "epoch": 4.045077105575326, "grad_norm": 1.2265625, "learning_rate": 0.00034547461060155317, "loss": 4.9079, "mean_token_accuracy": 0.22683641761541368, "num_tokens": 93715832.0, "step": 40920 }, { "entropy": 5.776839113235473, "epoch": 4.0455713720838276, "grad_norm": 1.2421875, "learning_rate": 0.0003454410955291224, "loss": 4.9515, "mean_token_accuracy": 0.22794792652130128, "num_tokens": 93728022.0, "step": 40925 }, { "entropy": 5.769331359863282, "epoch": 4.046065638592329, "grad_norm": 1.2890625, "learning_rate": 0.00034540757872382965, "loss": 4.9093, "mean_token_accuracy": 0.23582160025835036, "num_tokens": 93739445.0, "step": 40930 }, { "entropy": 5.663434267044067, "epoch": 4.04655990510083, "grad_norm": 1.1875, "learning_rate": 0.0003453740601864997, "loss": 4.8767, "mean_token_accuracy": 0.24382007867097855, "num_tokens": 93752132.0, "step": 40935 }, { "entropy": 5.783597755432129, "epoch": 4.047054171609331, "grad_norm": 1.109375, "learning_rate": 0.00034534053991795683, "loss": 4.9491, "mean_token_accuracy": 0.22663235664367676, "num_tokens": 93763346.0, "step": 40940 }, { "entropy": 5.8040412902832035, "epoch": 4.0475484381178335, "grad_norm": 1.328125, "learning_rate": 0.00034530701791902574, "loss": 4.9652, "mean_token_accuracy": 0.22557296901941298, "num_tokens": 93775877.0, "step": 40945 }, { "entropy": 5.766940450668335, "epoch": 4.048042704626335, "grad_norm": 1.1484375, "learning_rate": 0.00034527349419053116, "loss": 4.9599, "mean_token_accuracy": 0.2233266532421112, "num_tokens": 93788741.0, "step": 40950 }, { "entropy": 5.732238006591797, "epoch": 4.048536971134836, "grad_norm": 1.2734375, "learning_rate": 0.0003452399687332978, "loss": 4.9262, "mean_token_accuracy": 0.23133978396654128, "num_tokens": 93798865.0, "step": 40955 }, { "entropy": 5.794459104537964, "epoch": 4.049031237643337, "grad_norm": 1.359375, "learning_rate": 0.0003452064415481502, "loss": 4.9413, "mean_token_accuracy": 0.23377889692783355, "num_tokens": 93810131.0, "step": 40960 }, { "entropy": 5.776198530197144, "epoch": 4.0495255041518385, "grad_norm": 1.15625, "learning_rate": 0.0003451729126359132, "loss": 4.9106, "mean_token_accuracy": 0.23329171538352966, "num_tokens": 93821696.0, "step": 40965 }, { "entropy": 5.81839919090271, "epoch": 4.05001977066034, "grad_norm": 1.2578125, "learning_rate": 0.0003451393819974118, "loss": 4.9593, "mean_token_accuracy": 0.22210249155759812, "num_tokens": 93833297.0, "step": 40970 }, { "entropy": 5.757199001312256, "epoch": 4.050514037168841, "grad_norm": 1.234375, "learning_rate": 0.00034510584963347063, "loss": 4.9656, "mean_token_accuracy": 0.22226360738277434, "num_tokens": 93844573.0, "step": 40975 }, { "entropy": 5.81689419746399, "epoch": 4.051008303677343, "grad_norm": 1.2890625, "learning_rate": 0.0003450723155449148, "loss": 4.9323, "mean_token_accuracy": 0.22625923305749893, "num_tokens": 93856542.0, "step": 40980 }, { "entropy": 5.7723846435546875, "epoch": 4.0515025701858445, "grad_norm": 1.2265625, "learning_rate": 0.000345038779732569, "loss": 4.8945, "mean_token_accuracy": 0.22036599069833757, "num_tokens": 93868750.0, "step": 40985 }, { "entropy": 5.77267107963562, "epoch": 4.051996836694346, "grad_norm": 1.296875, "learning_rate": 0.0003450052421972583, "loss": 4.8809, "mean_token_accuracy": 0.23302657455205916, "num_tokens": 93879506.0, "step": 40990 }, { "entropy": 5.734283685684204, "epoch": 4.052491103202847, "grad_norm": 1.265625, "learning_rate": 0.00034497170293980794, "loss": 4.8758, "mean_token_accuracy": 0.23572975695133208, "num_tokens": 93890068.0, "step": 40995 }, { "entropy": 5.766786241531372, "epoch": 4.052985369711348, "grad_norm": 1.1953125, "learning_rate": 0.0003449381619610428, "loss": 5.0101, "mean_token_accuracy": 0.22521729469299318, "num_tokens": 93902869.0, "step": 41000 }, { "entropy": 5.7843513011932375, "epoch": 4.0534796362198495, "grad_norm": 1.125, "learning_rate": 0.00034490461926178794, "loss": 4.9603, "mean_token_accuracy": 0.2256326735019684, "num_tokens": 93915403.0, "step": 41005 }, { "entropy": 5.778074169158936, "epoch": 4.053973902728351, "grad_norm": 1.34375, "learning_rate": 0.00034487107484286873, "loss": 4.8964, "mean_token_accuracy": 0.2346753165125847, "num_tokens": 93926616.0, "step": 41010 }, { "entropy": 5.783435869216919, "epoch": 4.054468169236853, "grad_norm": 1.2421875, "learning_rate": 0.00034483752870511015, "loss": 4.8924, "mean_token_accuracy": 0.2339733734726906, "num_tokens": 93938840.0, "step": 41015 }, { "entropy": 5.7416908740997314, "epoch": 4.054962435745354, "grad_norm": 1.3515625, "learning_rate": 0.0003448039808493375, "loss": 4.9461, "mean_token_accuracy": 0.2251197636127472, "num_tokens": 93951294.0, "step": 41020 }, { "entropy": 5.756411695480347, "epoch": 4.0554567022538555, "grad_norm": 1.265625, "learning_rate": 0.0003447704312763762, "loss": 4.9183, "mean_token_accuracy": 0.23253450244665147, "num_tokens": 93962596.0, "step": 41025 }, { "entropy": 5.850187873840332, "epoch": 4.055950968762357, "grad_norm": 1.2265625, "learning_rate": 0.00034473687998705144, "loss": 4.9916, "mean_token_accuracy": 0.22448416352272033, "num_tokens": 93973699.0, "step": 41030 }, { "entropy": 5.757361125946045, "epoch": 4.056445235270858, "grad_norm": 1.234375, "learning_rate": 0.00034470332698218853, "loss": 4.8888, "mean_token_accuracy": 0.22993982285261155, "num_tokens": 93984711.0, "step": 41035 }, { "entropy": 5.798279857635498, "epoch": 4.056939501779359, "grad_norm": 1.1875, "learning_rate": 0.00034466977226261305, "loss": 5.0305, "mean_token_accuracy": 0.22364769577980043, "num_tokens": 93996217.0, "step": 41040 }, { "entropy": 5.732394647598267, "epoch": 4.0574337682878605, "grad_norm": 1.2578125, "learning_rate": 0.0003446362158291503, "loss": 4.9302, "mean_token_accuracy": 0.22893664091825486, "num_tokens": 94007738.0, "step": 41045 }, { "entropy": 5.780115079879761, "epoch": 4.057928034796362, "grad_norm": 1.3203125, "learning_rate": 0.0003446026576826258, "loss": 4.9278, "mean_token_accuracy": 0.23068011552095413, "num_tokens": 94018473.0, "step": 41050 }, { "entropy": 5.818477725982666, "epoch": 4.058422301304864, "grad_norm": 1.296875, "learning_rate": 0.0003445690978238653, "loss": 4.9817, "mean_token_accuracy": 0.22401828318834305, "num_tokens": 94029461.0, "step": 41055 }, { "entropy": 5.734799480438232, "epoch": 4.058916567813365, "grad_norm": 1.28125, "learning_rate": 0.00034453553625369405, "loss": 4.9754, "mean_token_accuracy": 0.22892947793006896, "num_tokens": 94042399.0, "step": 41060 }, { "entropy": 5.80694727897644, "epoch": 4.0594108343218664, "grad_norm": 1.1875, "learning_rate": 0.00034450197297293783, "loss": 4.8984, "mean_token_accuracy": 0.23060431331396103, "num_tokens": 94054694.0, "step": 41065 }, { "entropy": 5.811329936981201, "epoch": 4.059905100830368, "grad_norm": 1.3046875, "learning_rate": 0.0003444684079824223, "loss": 4.9664, "mean_token_accuracy": 0.2272731676697731, "num_tokens": 94065426.0, "step": 41070 }, { "entropy": 5.736282777786255, "epoch": 4.060399367338869, "grad_norm": 1.28125, "learning_rate": 0.00034443484128297326, "loss": 4.8465, "mean_token_accuracy": 0.2341087654232979, "num_tokens": 94078119.0, "step": 41075 }, { "entropy": 5.719613838195801, "epoch": 4.06089363384737, "grad_norm": 1.4921875, "learning_rate": 0.0003444012728754162, "loss": 4.9002, "mean_token_accuracy": 0.23489640206098555, "num_tokens": 94089157.0, "step": 41080 }, { "entropy": 5.748463153839111, "epoch": 4.0613879003558715, "grad_norm": 1.1953125, "learning_rate": 0.00034436770276057715, "loss": 4.9151, "mean_token_accuracy": 0.22995193153619767, "num_tokens": 94101534.0, "step": 41085 }, { "entropy": 5.768482398986817, "epoch": 4.061882166864374, "grad_norm": 1.234375, "learning_rate": 0.0003443341309392818, "loss": 4.9585, "mean_token_accuracy": 0.22236736714839936, "num_tokens": 94113310.0, "step": 41090 }, { "entropy": 5.780543422698974, "epoch": 4.062376433372875, "grad_norm": 1.234375, "learning_rate": 0.00034430055741235615, "loss": 4.9008, "mean_token_accuracy": 0.2296526089310646, "num_tokens": 94124189.0, "step": 41095 }, { "entropy": 5.745877408981324, "epoch": 4.062870699881376, "grad_norm": 1.28125, "learning_rate": 0.00034426698218062603, "loss": 4.8898, "mean_token_accuracy": 0.23208441138267516, "num_tokens": 94135458.0, "step": 41100 }, { "entropy": 5.69871335029602, "epoch": 4.063364966389877, "grad_norm": 1.34375, "learning_rate": 0.00034423340524491737, "loss": 4.903, "mean_token_accuracy": 0.2315752238035202, "num_tokens": 94146270.0, "step": 41105 }, { "entropy": 5.778707981109619, "epoch": 4.063859232898379, "grad_norm": 1.1796875, "learning_rate": 0.0003441998266060561, "loss": 4.9022, "mean_token_accuracy": 0.23032476156949996, "num_tokens": 94157814.0, "step": 41110 }, { "entropy": 5.83778223991394, "epoch": 4.06435349940688, "grad_norm": 1.2734375, "learning_rate": 0.00034416624626486855, "loss": 4.9689, "mean_token_accuracy": 0.23451650887727737, "num_tokens": 94170424.0, "step": 41115 }, { "entropy": 5.783183288574219, "epoch": 4.064847765915381, "grad_norm": 1.171875, "learning_rate": 0.0003441326642221805, "loss": 4.9329, "mean_token_accuracy": 0.2251179501414299, "num_tokens": 94181913.0, "step": 41120 }, { "entropy": 5.688137483596802, "epoch": 4.065342032423883, "grad_norm": 1.2578125, "learning_rate": 0.0003440990804788182, "loss": 4.9108, "mean_token_accuracy": 0.22789467573165895, "num_tokens": 94193370.0, "step": 41125 }, { "entropy": 5.734695625305176, "epoch": 4.065836298932385, "grad_norm": 1.2265625, "learning_rate": 0.0003440654950356078, "loss": 4.8451, "mean_token_accuracy": 0.2342666804790497, "num_tokens": 94204176.0, "step": 41130 }, { "entropy": 5.829955577850342, "epoch": 4.066330565440886, "grad_norm": 1.296875, "learning_rate": 0.00034403190789337546, "loss": 4.949, "mean_token_accuracy": 0.22796981483697892, "num_tokens": 94214355.0, "step": 41135 }, { "entropy": 5.800871992111206, "epoch": 4.066824831949387, "grad_norm": 1.3046875, "learning_rate": 0.0003439983190529476, "loss": 4.9679, "mean_token_accuracy": 0.22392816990613937, "num_tokens": 94226248.0, "step": 41140 }, { "entropy": 5.758503389358521, "epoch": 4.067319098457888, "grad_norm": 1.3125, "learning_rate": 0.0003439647285151503, "loss": 4.873, "mean_token_accuracy": 0.23600295782089234, "num_tokens": 94236847.0, "step": 41145 }, { "entropy": 5.783296966552735, "epoch": 4.06781336496639, "grad_norm": 1.1796875, "learning_rate": 0.00034393113628080994, "loss": 4.9682, "mean_token_accuracy": 0.22489985525608064, "num_tokens": 94248387.0, "step": 41150 }, { "entropy": 5.766246223449707, "epoch": 4.068307631474891, "grad_norm": 1.2734375, "learning_rate": 0.00034389754235075303, "loss": 4.8917, "mean_token_accuracy": 0.2326929062604904, "num_tokens": 94259069.0, "step": 41155 }, { "entropy": 5.713758754730224, "epoch": 4.068801897983393, "grad_norm": 1.265625, "learning_rate": 0.00034386394672580585, "loss": 4.8865, "mean_token_accuracy": 0.23263249546289444, "num_tokens": 94270390.0, "step": 41160 }, { "entropy": 5.77420597076416, "epoch": 4.069296164491894, "grad_norm": 1.421875, "learning_rate": 0.0003438303494067949, "loss": 4.9757, "mean_token_accuracy": 0.2271587073802948, "num_tokens": 94281712.0, "step": 41165 }, { "entropy": 5.7641973972320555, "epoch": 4.069790431000396, "grad_norm": 1.2109375, "learning_rate": 0.0003437967503945467, "loss": 4.892, "mean_token_accuracy": 0.2344158485531807, "num_tokens": 94292277.0, "step": 41170 }, { "entropy": 5.7991039752960205, "epoch": 4.070284697508897, "grad_norm": 1.3046875, "learning_rate": 0.00034376314968988773, "loss": 5.0016, "mean_token_accuracy": 0.22252244949340821, "num_tokens": 94303276.0, "step": 41175 }, { "entropy": 5.751678419113159, "epoch": 4.070778964017398, "grad_norm": 1.40625, "learning_rate": 0.00034372954729364457, "loss": 4.8597, "mean_token_accuracy": 0.24168787002563477, "num_tokens": 94313692.0, "step": 41180 }, { "entropy": 5.802755832672119, "epoch": 4.071273230525899, "grad_norm": 1.21875, "learning_rate": 0.000343695943206644, "loss": 4.9339, "mean_token_accuracy": 0.2270935520529747, "num_tokens": 94326859.0, "step": 41185 }, { "entropy": 5.79927020072937, "epoch": 4.071767497034401, "grad_norm": 1.2421875, "learning_rate": 0.0003436623374297125, "loss": 4.9852, "mean_token_accuracy": 0.2233715310692787, "num_tokens": 94339417.0, "step": 41190 }, { "entropy": 5.820031929016113, "epoch": 4.072261763542902, "grad_norm": 1.3203125, "learning_rate": 0.0003436287299636768, "loss": 5.0127, "mean_token_accuracy": 0.22170572131872177, "num_tokens": 94351462.0, "step": 41195 }, { "entropy": 5.775681352615356, "epoch": 4.072756030051404, "grad_norm": 1.296875, "learning_rate": 0.0003435951208093638, "loss": 4.8849, "mean_token_accuracy": 0.2265557661652565, "num_tokens": 94362455.0, "step": 41200 }, { "entropy": 5.760687303543091, "epoch": 4.073250296559905, "grad_norm": 1.359375, "learning_rate": 0.0003435615099676001, "loss": 4.9154, "mean_token_accuracy": 0.22505036890506744, "num_tokens": 94373005.0, "step": 41205 }, { "entropy": 5.7610198020935055, "epoch": 4.073744563068407, "grad_norm": 1.203125, "learning_rate": 0.0003435278974392126, "loss": 4.9173, "mean_token_accuracy": 0.2382674530148506, "num_tokens": 94385619.0, "step": 41210 }, { "entropy": 5.808843326568604, "epoch": 4.074238829576908, "grad_norm": 1.2890625, "learning_rate": 0.0003434942832250283, "loss": 4.928, "mean_token_accuracy": 0.22959907054901124, "num_tokens": 94397281.0, "step": 41215 }, { "entropy": 5.798768138885498, "epoch": 4.074733096085409, "grad_norm": 1.4453125, "learning_rate": 0.00034346066732587394, "loss": 4.9541, "mean_token_accuracy": 0.22725386023521424, "num_tokens": 94408222.0, "step": 41220 }, { "entropy": 5.812325429916382, "epoch": 4.07522736259391, "grad_norm": 1.3515625, "learning_rate": 0.00034342704974257653, "loss": 4.9574, "mean_token_accuracy": 0.228243188560009, "num_tokens": 94419540.0, "step": 41225 }, { "entropy": 5.731334590911866, "epoch": 4.075721629102412, "grad_norm": 1.4140625, "learning_rate": 0.0003433934304759631, "loss": 4.9271, "mean_token_accuracy": 0.22931711822748185, "num_tokens": 94431372.0, "step": 41230 }, { "entropy": 5.769289112091064, "epoch": 4.076215895610914, "grad_norm": 1.3515625, "learning_rate": 0.00034335980952686064, "loss": 4.8539, "mean_token_accuracy": 0.2335490494966507, "num_tokens": 94441922.0, "step": 41235 }, { "entropy": 5.734683847427368, "epoch": 4.076710162119415, "grad_norm": 1.28125, "learning_rate": 0.0003433261868960964, "loss": 4.82, "mean_token_accuracy": 0.23569392114877702, "num_tokens": 94453031.0, "step": 41240 }, { "entropy": 5.8063396453857425, "epoch": 4.077204428627916, "grad_norm": 1.3828125, "learning_rate": 0.00034329256258449725, "loss": 4.9513, "mean_token_accuracy": 0.22520948052406312, "num_tokens": 94463952.0, "step": 41245 }, { "entropy": 5.80389256477356, "epoch": 4.077698695136418, "grad_norm": 1.3671875, "learning_rate": 0.0003432589365928904, "loss": 4.9184, "mean_token_accuracy": 0.23384554088115692, "num_tokens": 94474811.0, "step": 41250 }, { "entropy": 5.71890115737915, "epoch": 4.078192961644919, "grad_norm": 1.234375, "learning_rate": 0.00034322530892210324, "loss": 4.9015, "mean_token_accuracy": 0.22836243659257888, "num_tokens": 94485901.0, "step": 41255 }, { "entropy": 5.735397243499756, "epoch": 4.07868722815342, "grad_norm": 1.1640625, "learning_rate": 0.0003431916795729628, "loss": 4.9323, "mean_token_accuracy": 0.22868915647268295, "num_tokens": 94498147.0, "step": 41260 }, { "entropy": 5.740125417709351, "epoch": 4.079181494661921, "grad_norm": 1.296875, "learning_rate": 0.0003431580485462966, "loss": 4.8752, "mean_token_accuracy": 0.2339969828724861, "num_tokens": 94510787.0, "step": 41265 }, { "entropy": 5.775384092330933, "epoch": 4.0796757611704235, "grad_norm": 1.25, "learning_rate": 0.0003431244158429317, "loss": 5.0165, "mean_token_accuracy": 0.22178604155778886, "num_tokens": 94523459.0, "step": 41270 }, { "entropy": 5.766784620285034, "epoch": 4.080170027678925, "grad_norm": 1.3828125, "learning_rate": 0.00034309078146369567, "loss": 4.9288, "mean_token_accuracy": 0.22403345853090287, "num_tokens": 94534579.0, "step": 41275 }, { "entropy": 5.8723752975463865, "epoch": 4.080664294187426, "grad_norm": 1.421875, "learning_rate": 0.0003430571454094158, "loss": 5.0086, "mean_token_accuracy": 0.22319798320531845, "num_tokens": 94545233.0, "step": 41280 }, { "entropy": 5.8177896499633786, "epoch": 4.081158560695927, "grad_norm": 1.390625, "learning_rate": 0.00034302350768091963, "loss": 4.9582, "mean_token_accuracy": 0.2297793671488762, "num_tokens": 94555189.0, "step": 41285 }, { "entropy": 5.854527282714844, "epoch": 4.081652827204429, "grad_norm": 1.34375, "learning_rate": 0.00034298986827903464, "loss": 4.985, "mean_token_accuracy": 0.2198912352323532, "num_tokens": 94566001.0, "step": 41290 }, { "entropy": 5.710570478439331, "epoch": 4.08214709371293, "grad_norm": 1.1796875, "learning_rate": 0.0003429562272045883, "loss": 4.8493, "mean_token_accuracy": 0.23932705223560333, "num_tokens": 94577578.0, "step": 41295 }, { "entropy": 5.767728328704834, "epoch": 4.082641360221431, "grad_norm": 1.296875, "learning_rate": 0.00034292258445840816, "loss": 4.854, "mean_token_accuracy": 0.23665076196193696, "num_tokens": 94589162.0, "step": 41300 }, { "entropy": 5.776793336868286, "epoch": 4.083135626729932, "grad_norm": 1.296875, "learning_rate": 0.00034288894004132203, "loss": 5.0262, "mean_token_accuracy": 0.21865688711404802, "num_tokens": 94601883.0, "step": 41305 }, { "entropy": 5.767431211471558, "epoch": 4.0836298932384345, "grad_norm": 1.3125, "learning_rate": 0.00034285529395415744, "loss": 4.9682, "mean_token_accuracy": 0.22047097980976105, "num_tokens": 94612944.0, "step": 41310 }, { "entropy": 5.77349739074707, "epoch": 4.084124159746936, "grad_norm": 1.421875, "learning_rate": 0.000342821646197742, "loss": 4.9159, "mean_token_accuracy": 0.22595989853143691, "num_tokens": 94624042.0, "step": 41315 }, { "entropy": 5.72882719039917, "epoch": 4.084618426255437, "grad_norm": 1.2421875, "learning_rate": 0.00034278799677290363, "loss": 4.8783, "mean_token_accuracy": 0.23347859382629393, "num_tokens": 94635149.0, "step": 41320 }, { "entropy": 5.7230040550231935, "epoch": 4.085112692763938, "grad_norm": 1.328125, "learning_rate": 0.00034275434568047, "loss": 4.9281, "mean_token_accuracy": 0.2301914244890213, "num_tokens": 94646586.0, "step": 41325 }, { "entropy": 5.725247192382812, "epoch": 4.0856069592724396, "grad_norm": 1.234375, "learning_rate": 0.0003427206929212689, "loss": 4.9851, "mean_token_accuracy": 0.22446895092725755, "num_tokens": 94658602.0, "step": 41330 }, { "entropy": 5.785997343063355, "epoch": 4.086101225780941, "grad_norm": 1.3125, "learning_rate": 0.0003426870384961283, "loss": 4.9171, "mean_token_accuracy": 0.2248311385512352, "num_tokens": 94668472.0, "step": 41335 }, { "entropy": 5.806724882125854, "epoch": 4.086595492289442, "grad_norm": 1.203125, "learning_rate": 0.000342653382405876, "loss": 4.9173, "mean_token_accuracy": 0.22882626205682755, "num_tokens": 94679397.0, "step": 41340 }, { "entropy": 5.851347637176514, "epoch": 4.087089758797944, "grad_norm": 1.1875, "learning_rate": 0.0003426197246513401, "loss": 4.9839, "mean_token_accuracy": 0.22656087577342987, "num_tokens": 94690770.0, "step": 41345 }, { "entropy": 5.758445405960083, "epoch": 4.0875840253064455, "grad_norm": 1.21875, "learning_rate": 0.00034258606523334843, "loss": 4.9234, "mean_token_accuracy": 0.22523144632577896, "num_tokens": 94702426.0, "step": 41350 }, { "entropy": 5.672008848190307, "epoch": 4.088078291814947, "grad_norm": 1.3984375, "learning_rate": 0.00034255240415272906, "loss": 4.8211, "mean_token_accuracy": 0.23724103569984437, "num_tokens": 94713403.0, "step": 41355 }, { "entropy": 5.797766160964966, "epoch": 4.088572558323448, "grad_norm": 1.4453125, "learning_rate": 0.0003425187414103101, "loss": 4.9518, "mean_token_accuracy": 0.23036193251609802, "num_tokens": 94724441.0, "step": 41360 }, { "entropy": 5.754850578308106, "epoch": 4.089066824831949, "grad_norm": 1.6015625, "learning_rate": 0.00034248507700691957, "loss": 4.9526, "mean_token_accuracy": 0.23229407668113708, "num_tokens": 94735048.0, "step": 41365 }, { "entropy": 5.827209520339966, "epoch": 4.0895610913404505, "grad_norm": 1.4140625, "learning_rate": 0.0003424514109433857, "loss": 4.9731, "mean_token_accuracy": 0.22553397417068483, "num_tokens": 94745435.0, "step": 41370 }, { "entropy": 5.766744136810303, "epoch": 4.090055357848952, "grad_norm": 1.3359375, "learning_rate": 0.0003424177432205366, "loss": 4.8938, "mean_token_accuracy": 0.231175796687603, "num_tokens": 94756495.0, "step": 41375 }, { "entropy": 5.7455644607543945, "epoch": 4.090549624357454, "grad_norm": 1.2421875, "learning_rate": 0.0003423840738392007, "loss": 4.9044, "mean_token_accuracy": 0.2333471104502678, "num_tokens": 94767876.0, "step": 41380 }, { "entropy": 5.782841157913208, "epoch": 4.091043890865955, "grad_norm": 1.40625, "learning_rate": 0.000342350402800206, "loss": 4.9388, "mean_token_accuracy": 0.22504641264677047, "num_tokens": 94778855.0, "step": 41385 }, { "entropy": 5.827413558959961, "epoch": 4.0915381573744565, "grad_norm": 1.3671875, "learning_rate": 0.00034231673010438104, "loss": 4.9025, "mean_token_accuracy": 0.2313551649451256, "num_tokens": 94788433.0, "step": 41390 }, { "entropy": 5.672556018829345, "epoch": 4.092032423882958, "grad_norm": 1.2109375, "learning_rate": 0.00034228305575255397, "loss": 4.8024, "mean_token_accuracy": 0.24233658909797667, "num_tokens": 94799630.0, "step": 41395 }, { "entropy": 5.709322261810303, "epoch": 4.092526690391459, "grad_norm": 1.1640625, "learning_rate": 0.00034224937974555334, "loss": 4.8542, "mean_token_accuracy": 0.23055158108472823, "num_tokens": 94811696.0, "step": 41400 }, { "entropy": 5.823106288909912, "epoch": 4.09302095689996, "grad_norm": 1.28125, "learning_rate": 0.00034221570208420755, "loss": 4.9787, "mean_token_accuracy": 0.2263631045818329, "num_tokens": 94822648.0, "step": 41405 }, { "entropy": 5.760322618484497, "epoch": 4.0935152234084615, "grad_norm": 1.265625, "learning_rate": 0.00034218202276934507, "loss": 4.8895, "mean_token_accuracy": 0.2305459722876549, "num_tokens": 94833690.0, "step": 41410 }, { "entropy": 5.728191661834717, "epoch": 4.094009489916964, "grad_norm": 1.21875, "learning_rate": 0.0003421483418017944, "loss": 4.8494, "mean_token_accuracy": 0.23938871771097184, "num_tokens": 94843859.0, "step": 41415 }, { "entropy": 5.767635250091553, "epoch": 4.094503756425465, "grad_norm": 1.3125, "learning_rate": 0.0003421146591823841, "loss": 4.9008, "mean_token_accuracy": 0.23263185620307922, "num_tokens": 94855156.0, "step": 41420 }, { "entropy": 5.8042725086212155, "epoch": 4.094998022933966, "grad_norm": 1.4140625, "learning_rate": 0.0003420809749119427, "loss": 5.0027, "mean_token_accuracy": 0.2186235785484314, "num_tokens": 94867082.0, "step": 41425 }, { "entropy": 5.733512687683105, "epoch": 4.0954922894424675, "grad_norm": 1.3671875, "learning_rate": 0.0003420472889912991, "loss": 4.8498, "mean_token_accuracy": 0.23714292496442796, "num_tokens": 94877606.0, "step": 41430 }, { "entropy": 5.778481340408325, "epoch": 4.095986555950969, "grad_norm": 1.4453125, "learning_rate": 0.00034201360142128165, "loss": 4.8537, "mean_token_accuracy": 0.2366952121257782, "num_tokens": 94888114.0, "step": 41435 }, { "entropy": 5.7050361156463625, "epoch": 4.09648082245947, "grad_norm": 1.21875, "learning_rate": 0.0003419799122027192, "loss": 4.8414, "mean_token_accuracy": 0.2384738028049469, "num_tokens": 94900135.0, "step": 41440 }, { "entropy": 5.768857192993164, "epoch": 4.096975088967971, "grad_norm": 1.2109375, "learning_rate": 0.0003419462213364405, "loss": 4.8938, "mean_token_accuracy": 0.2314760833978653, "num_tokens": 94911444.0, "step": 41445 }, { "entropy": 5.688500595092774, "epoch": 4.0974693554764725, "grad_norm": 1.3125, "learning_rate": 0.0003419125288232745, "loss": 4.8984, "mean_token_accuracy": 0.23025558441877364, "num_tokens": 94923378.0, "step": 41450 }, { "entropy": 5.709119510650635, "epoch": 4.097963621984975, "grad_norm": 1.25, "learning_rate": 0.0003418788346640498, "loss": 4.8494, "mean_token_accuracy": 0.23043256849050522, "num_tokens": 94933784.0, "step": 41455 }, { "entropy": 5.7248087406158445, "epoch": 4.098457888493476, "grad_norm": 1.1875, "learning_rate": 0.00034184513885959544, "loss": 4.8828, "mean_token_accuracy": 0.23019013553857803, "num_tokens": 94945814.0, "step": 41460 }, { "entropy": 5.715527486801148, "epoch": 4.098952155001977, "grad_norm": 1.140625, "learning_rate": 0.00034181144141074023, "loss": 4.9327, "mean_token_accuracy": 0.22753919363021852, "num_tokens": 94957792.0, "step": 41465 }, { "entropy": 5.732485961914063, "epoch": 4.0994464215104784, "grad_norm": 1.3046875, "learning_rate": 0.00034177774231831324, "loss": 4.9009, "mean_token_accuracy": 0.23239139318466187, "num_tokens": 94968524.0, "step": 41470 }, { "entropy": 5.777075529098511, "epoch": 4.09994068801898, "grad_norm": 1.3046875, "learning_rate": 0.00034174404158314345, "loss": 4.9398, "mean_token_accuracy": 0.22249210774898528, "num_tokens": 94979213.0, "step": 41475 }, { "entropy": 5.693767738342285, "epoch": 4.100434954527481, "grad_norm": 1.2421875, "learning_rate": 0.0003417103392060599, "loss": 4.8408, "mean_token_accuracy": 0.2336836040019989, "num_tokens": 94991068.0, "step": 41480 }, { "entropy": 5.752703857421875, "epoch": 4.100929221035982, "grad_norm": 1.4140625, "learning_rate": 0.00034167663518789156, "loss": 4.939, "mean_token_accuracy": 0.22881190478801727, "num_tokens": 95001780.0, "step": 41485 }, { "entropy": 5.822382068634033, "epoch": 4.101423487544484, "grad_norm": 1.453125, "learning_rate": 0.0003416429295294677, "loss": 4.9949, "mean_token_accuracy": 0.22056188732385634, "num_tokens": 95013244.0, "step": 41490 }, { "entropy": 5.749713277816772, "epoch": 4.101917754052986, "grad_norm": 1.1953125, "learning_rate": 0.00034160922223161743, "loss": 4.8634, "mean_token_accuracy": 0.23021193593740463, "num_tokens": 95024103.0, "step": 41495 }, { "entropy": 5.725566577911377, "epoch": 4.102412020561487, "grad_norm": 1.328125, "learning_rate": 0.0003415755132951699, "loss": 4.8711, "mean_token_accuracy": 0.23483748286962508, "num_tokens": 95034132.0, "step": 41500 }, { "entropy": 5.73406457901001, "epoch": 4.102906287069988, "grad_norm": 1.25, "learning_rate": 0.0003415418027209546, "loss": 4.8841, "mean_token_accuracy": 0.22875937521457673, "num_tokens": 95046735.0, "step": 41505 }, { "entropy": 5.75829586982727, "epoch": 4.103400553578489, "grad_norm": 1.359375, "learning_rate": 0.0003415080905098005, "loss": 4.8693, "mean_token_accuracy": 0.23368439227342605, "num_tokens": 95058538.0, "step": 41510 }, { "entropy": 5.758951187133789, "epoch": 4.103894820086991, "grad_norm": 1.2421875, "learning_rate": 0.0003414743766625371, "loss": 4.869, "mean_token_accuracy": 0.23296344578266143, "num_tokens": 95070049.0, "step": 41515 }, { "entropy": 5.741114854812622, "epoch": 4.104389086595492, "grad_norm": 1.2734375, "learning_rate": 0.00034144066117999366, "loss": 4.9227, "mean_token_accuracy": 0.23145071417093277, "num_tokens": 95081702.0, "step": 41520 }, { "entropy": 5.7907140254974365, "epoch": 4.104883353103994, "grad_norm": 1.3125, "learning_rate": 0.0003414069440629997, "loss": 4.9953, "mean_token_accuracy": 0.21967278122901918, "num_tokens": 95093831.0, "step": 41525 }, { "entropy": 5.7364953517913815, "epoch": 4.105377619612495, "grad_norm": 1.25, "learning_rate": 0.0003413732253123846, "loss": 4.8617, "mean_token_accuracy": 0.23206555396318435, "num_tokens": 95104960.0, "step": 41530 }, { "entropy": 5.791954851150512, "epoch": 4.105871886120997, "grad_norm": 1.203125, "learning_rate": 0.0003413395049289778, "loss": 5.0021, "mean_token_accuracy": 0.2272172152996063, "num_tokens": 95115578.0, "step": 41535 }, { "entropy": 5.776717042922973, "epoch": 4.106366152629498, "grad_norm": 1.3046875, "learning_rate": 0.0003413057829136089, "loss": 4.9354, "mean_token_accuracy": 0.2249817132949829, "num_tokens": 95129237.0, "step": 41540 }, { "entropy": 5.808293724060059, "epoch": 4.106860419137999, "grad_norm": 1.421875, "learning_rate": 0.00034127205926710755, "loss": 5.0049, "mean_token_accuracy": 0.21929070651531218, "num_tokens": 95141500.0, "step": 41545 }, { "entropy": 5.737236499786377, "epoch": 4.1073546856465, "grad_norm": 1.328125, "learning_rate": 0.00034123833399030324, "loss": 4.8628, "mean_token_accuracy": 0.237789523601532, "num_tokens": 95152669.0, "step": 41550 }, { "entropy": 5.822025108337402, "epoch": 4.107848952155002, "grad_norm": 1.3515625, "learning_rate": 0.0003412046070840256, "loss": 4.9046, "mean_token_accuracy": 0.2299567922949791, "num_tokens": 95163181.0, "step": 41555 }, { "entropy": 5.8268636703491214, "epoch": 4.108343218663503, "grad_norm": 1.2265625, "learning_rate": 0.00034117087854910436, "loss": 4.9984, "mean_token_accuracy": 0.21720368564128875, "num_tokens": 95176321.0, "step": 41560 }, { "entropy": 5.7686468124389645, "epoch": 4.108837485172005, "grad_norm": 1.171875, "learning_rate": 0.0003411371483863692, "loss": 4.929, "mean_token_accuracy": 0.22899484187364577, "num_tokens": 95188097.0, "step": 41565 }, { "entropy": 5.679139041900635, "epoch": 4.109331751680506, "grad_norm": 1.171875, "learning_rate": 0.00034110341659665, "loss": 4.8546, "mean_token_accuracy": 0.24654210060834886, "num_tokens": 95199629.0, "step": 41570 }, { "entropy": 5.8065441131591795, "epoch": 4.109826018189008, "grad_norm": 1.125, "learning_rate": 0.0003410696831807765, "loss": 4.9852, "mean_token_accuracy": 0.21947593092918397, "num_tokens": 95212035.0, "step": 41575 }, { "entropy": 5.858055353164673, "epoch": 4.110320284697509, "grad_norm": 1.3984375, "learning_rate": 0.00034103594813957846, "loss": 4.9899, "mean_token_accuracy": 0.22308092415332795, "num_tokens": 95222705.0, "step": 41580 }, { "entropy": 5.740157175064087, "epoch": 4.11081455120601, "grad_norm": 1.234375, "learning_rate": 0.0003410022114738859, "loss": 4.9599, "mean_token_accuracy": 0.2264355167746544, "num_tokens": 95234806.0, "step": 41585 }, { "entropy": 5.743243074417114, "epoch": 4.111308817714511, "grad_norm": 1.234375, "learning_rate": 0.0003409684731845287, "loss": 4.872, "mean_token_accuracy": 0.23121480643749237, "num_tokens": 95245789.0, "step": 41590 }, { "entropy": 5.806638145446778, "epoch": 4.111803084223013, "grad_norm": 1.1328125, "learning_rate": 0.0003409347332723369, "loss": 4.9604, "mean_token_accuracy": 0.22663187831640244, "num_tokens": 95258295.0, "step": 41595 }, { "entropy": 5.827193927764893, "epoch": 4.112297350731515, "grad_norm": 1.328125, "learning_rate": 0.0003409009917381403, "loss": 4.938, "mean_token_accuracy": 0.2247425600886345, "num_tokens": 95270704.0, "step": 41600 }, { "entropy": 5.762149477005005, "epoch": 4.112791617240016, "grad_norm": 1.140625, "learning_rate": 0.00034086724858276913, "loss": 4.9273, "mean_token_accuracy": 0.2296552389860153, "num_tokens": 95283321.0, "step": 41605 }, { "entropy": 5.767711448669433, "epoch": 4.113285883748517, "grad_norm": 1.3203125, "learning_rate": 0.00034083350380705344, "loss": 4.946, "mean_token_accuracy": 0.22966258674860002, "num_tokens": 95294592.0, "step": 41610 }, { "entropy": 5.726210451126098, "epoch": 4.113780150257019, "grad_norm": 1.2578125, "learning_rate": 0.00034079975741182334, "loss": 4.9003, "mean_token_accuracy": 0.2387520655989647, "num_tokens": 95306619.0, "step": 41615 }, { "entropy": 5.712404870986939, "epoch": 4.11427441676552, "grad_norm": 1.203125, "learning_rate": 0.00034076600939790904, "loss": 4.8921, "mean_token_accuracy": 0.2362593322992325, "num_tokens": 95318660.0, "step": 41620 }, { "entropy": 5.755060625076294, "epoch": 4.114768683274021, "grad_norm": 1.359375, "learning_rate": 0.0003407322597661407, "loss": 4.9723, "mean_token_accuracy": 0.2230877161026001, "num_tokens": 95330355.0, "step": 41625 }, { "entropy": 5.768701362609863, "epoch": 4.115262949782522, "grad_norm": 1.34375, "learning_rate": 0.0003406985085173484, "loss": 4.924, "mean_token_accuracy": 0.23125091195106506, "num_tokens": 95343390.0, "step": 41630 }, { "entropy": 5.73344578742981, "epoch": 4.1157572162910245, "grad_norm": 1.3203125, "learning_rate": 0.0003406647556523628, "loss": 4.9221, "mean_token_accuracy": 0.22505954504013062, "num_tokens": 95355379.0, "step": 41635 }, { "entropy": 5.714823532104492, "epoch": 4.116251482799526, "grad_norm": 1.2421875, "learning_rate": 0.000340631001172014, "loss": 4.9917, "mean_token_accuracy": 0.22489867061376573, "num_tokens": 95367166.0, "step": 41640 }, { "entropy": 5.802769517898559, "epoch": 4.116745749308027, "grad_norm": 1.328125, "learning_rate": 0.0003405972450771323, "loss": 4.8362, "mean_token_accuracy": 0.23994607627391815, "num_tokens": 95377692.0, "step": 41645 }, { "entropy": 5.833525085449219, "epoch": 4.117240015816528, "grad_norm": 1.34375, "learning_rate": 0.0003405634873685483, "loss": 4.9531, "mean_token_accuracy": 0.22516766041517258, "num_tokens": 95390057.0, "step": 41650 }, { "entropy": 5.7912674903869625, "epoch": 4.11773428232503, "grad_norm": 1.2421875, "learning_rate": 0.00034052972804709224, "loss": 4.9227, "mean_token_accuracy": 0.22753215730190277, "num_tokens": 95401525.0, "step": 41655 }, { "entropy": 5.7854469299316404, "epoch": 4.118228548833531, "grad_norm": 1.296875, "learning_rate": 0.00034049596711359473, "loss": 4.9483, "mean_token_accuracy": 0.21727627664804458, "num_tokens": 95413659.0, "step": 41660 }, { "entropy": 5.800493669509888, "epoch": 4.118722815342032, "grad_norm": 1.390625, "learning_rate": 0.00034046220456888633, "loss": 4.9865, "mean_token_accuracy": 0.22885150015354155, "num_tokens": 95424269.0, "step": 41665 }, { "entropy": 5.771414947509766, "epoch": 4.119217081850534, "grad_norm": 1.34375, "learning_rate": 0.0003404284404137975, "loss": 4.8838, "mean_token_accuracy": 0.2324856013059616, "num_tokens": 95434683.0, "step": 41670 }, { "entropy": 5.731257820129395, "epoch": 4.1197113483590355, "grad_norm": 1.1640625, "learning_rate": 0.00034039467464915885, "loss": 5.0134, "mean_token_accuracy": 0.22297765463590621, "num_tokens": 95446561.0, "step": 41675 }, { "entropy": 5.777362203598022, "epoch": 4.120205614867537, "grad_norm": 1.3671875, "learning_rate": 0.00034036090727580104, "loss": 4.9459, "mean_token_accuracy": 0.2209606260061264, "num_tokens": 95458716.0, "step": 41680 }, { "entropy": 5.831929492950439, "epoch": 4.120699881376038, "grad_norm": 1.1953125, "learning_rate": 0.00034032713829455487, "loss": 4.9821, "mean_token_accuracy": 0.22794946283102036, "num_tokens": 95470628.0, "step": 41685 }, { "entropy": 5.786280822753906, "epoch": 4.121194147884539, "grad_norm": 1.2734375, "learning_rate": 0.00034029336770625095, "loss": 4.8781, "mean_token_accuracy": 0.23393614590168, "num_tokens": 95481995.0, "step": 41690 }, { "entropy": 5.714264726638794, "epoch": 4.121688414393041, "grad_norm": 1.28125, "learning_rate": 0.00034025959551172005, "loss": 4.8229, "mean_token_accuracy": 0.23844441324472426, "num_tokens": 95493518.0, "step": 41695 }, { "entropy": 5.764245510101318, "epoch": 4.122182680901542, "grad_norm": 1.5625, "learning_rate": 0.00034022582171179284, "loss": 4.9767, "mean_token_accuracy": 0.22553161680698394, "num_tokens": 95504089.0, "step": 41700 }, { "entropy": 5.842084693908691, "epoch": 4.122676947410043, "grad_norm": 1.3828125, "learning_rate": 0.00034019204630730045, "loss": 4.9682, "mean_token_accuracy": 0.21809196770191192, "num_tokens": 95513658.0, "step": 41705 }, { "entropy": 5.801896381378174, "epoch": 4.123171213918545, "grad_norm": 1.296875, "learning_rate": 0.00034015826929907357, "loss": 4.9524, "mean_token_accuracy": 0.22594311982393264, "num_tokens": 95524969.0, "step": 41710 }, { "entropy": 5.840292024612427, "epoch": 4.1236654804270465, "grad_norm": 1.2890625, "learning_rate": 0.0003401244906879431, "loss": 5.0183, "mean_token_accuracy": 0.2240653708577156, "num_tokens": 95535432.0, "step": 41715 }, { "entropy": 5.809587717056274, "epoch": 4.124159746935548, "grad_norm": 1.171875, "learning_rate": 0.00034009071047474016, "loss": 4.9514, "mean_token_accuracy": 0.23011977672576905, "num_tokens": 95546389.0, "step": 41720 }, { "entropy": 5.737720489501953, "epoch": 4.124654013444049, "grad_norm": 1.3359375, "learning_rate": 0.0003400569286602955, "loss": 4.9031, "mean_token_accuracy": 0.23201536983251572, "num_tokens": 95558398.0, "step": 41725 }, { "entropy": 5.767891359329224, "epoch": 4.12514827995255, "grad_norm": 1.265625, "learning_rate": 0.0003400231452454404, "loss": 4.9855, "mean_token_accuracy": 0.22396766841411592, "num_tokens": 95570707.0, "step": 41730 }, { "entropy": 5.75676155090332, "epoch": 4.1256425464610516, "grad_norm": 1.3515625, "learning_rate": 0.00033998936023100585, "loss": 4.9429, "mean_token_accuracy": 0.22870891839265822, "num_tokens": 95583187.0, "step": 41735 }, { "entropy": 5.848313474655152, "epoch": 4.126136812969553, "grad_norm": 1.1953125, "learning_rate": 0.000339955573617823, "loss": 4.9706, "mean_token_accuracy": 0.2235844373703003, "num_tokens": 95595121.0, "step": 41740 }, { "entropy": 5.845588636398316, "epoch": 4.126631079478055, "grad_norm": 1.15625, "learning_rate": 0.00033992178540672287, "loss": 5.006, "mean_token_accuracy": 0.22153065651655196, "num_tokens": 95606992.0, "step": 41745 }, { "entropy": 5.7620946884155275, "epoch": 4.127125345986556, "grad_norm": 1.390625, "learning_rate": 0.00033988799559853675, "loss": 4.916, "mean_token_accuracy": 0.23088352382183075, "num_tokens": 95618460.0, "step": 41750 }, { "entropy": 5.824718856811524, "epoch": 4.1276196124950575, "grad_norm": 1.1953125, "learning_rate": 0.000339854204194096, "loss": 4.9726, "mean_token_accuracy": 0.227671879529953, "num_tokens": 95629690.0, "step": 41755 }, { "entropy": 5.678577136993408, "epoch": 4.128113879003559, "grad_norm": 1.5390625, "learning_rate": 0.00033982041119423156, "loss": 4.7584, "mean_token_accuracy": 0.24933973103761672, "num_tokens": 95640732.0, "step": 41760 }, { "entropy": 5.712448167800903, "epoch": 4.12860814551206, "grad_norm": 1.203125, "learning_rate": 0.0003397866165997751, "loss": 4.9168, "mean_token_accuracy": 0.23318539410829545, "num_tokens": 95651292.0, "step": 41765 }, { "entropy": 5.735893821716308, "epoch": 4.129102412020561, "grad_norm": 1.3125, "learning_rate": 0.0003397528204115578, "loss": 4.9115, "mean_token_accuracy": 0.23449735045433046, "num_tokens": 95662499.0, "step": 41770 }, { "entropy": 5.776894998550415, "epoch": 4.1295966785290625, "grad_norm": 1.203125, "learning_rate": 0.000339719022630411, "loss": 4.949, "mean_token_accuracy": 0.2284708723425865, "num_tokens": 95674097.0, "step": 41775 }, { "entropy": 5.823663854598999, "epoch": 4.130090945037564, "grad_norm": 1.40625, "learning_rate": 0.0003396852232571663, "loss": 4.9111, "mean_token_accuracy": 0.22634780108928682, "num_tokens": 95684917.0, "step": 41780 }, { "entropy": 5.834529685974121, "epoch": 4.130585211546066, "grad_norm": 1.2265625, "learning_rate": 0.000339651422292655, "loss": 5.0003, "mean_token_accuracy": 0.2175817906856537, "num_tokens": 95696588.0, "step": 41785 }, { "entropy": 5.775815725326538, "epoch": 4.131079478054567, "grad_norm": 1.2578125, "learning_rate": 0.00033961761973770865, "loss": 4.922, "mean_token_accuracy": 0.23107039630413057, "num_tokens": 95707246.0, "step": 41790 }, { "entropy": 5.7839210510253904, "epoch": 4.1315737445630685, "grad_norm": 1.359375, "learning_rate": 0.0003395838155931589, "loss": 4.935, "mean_token_accuracy": 0.22675368338823318, "num_tokens": 95717432.0, "step": 41795 }, { "entropy": 5.765988731384278, "epoch": 4.13206801107157, "grad_norm": 1.3046875, "learning_rate": 0.00033955000985983727, "loss": 4.9127, "mean_token_accuracy": 0.22939050197601318, "num_tokens": 95728102.0, "step": 41800 }, { "entropy": 5.783460807800293, "epoch": 4.132562277580071, "grad_norm": 1.3671875, "learning_rate": 0.0003395162025385753, "loss": 4.9032, "mean_token_accuracy": 0.22884804010391235, "num_tokens": 95738691.0, "step": 41805 }, { "entropy": 5.728170585632324, "epoch": 4.133056544088572, "grad_norm": 1.234375, "learning_rate": 0.0003394823936302048, "loss": 4.9318, "mean_token_accuracy": 0.22652331590652466, "num_tokens": 95750716.0, "step": 41810 }, { "entropy": 5.772882747650146, "epoch": 4.1335508105970735, "grad_norm": 1.3359375, "learning_rate": 0.0003394485831355574, "loss": 4.9012, "mean_token_accuracy": 0.22775209844112396, "num_tokens": 95764130.0, "step": 41815 }, { "entropy": 5.7816931247711185, "epoch": 4.134045077105576, "grad_norm": 1.25, "learning_rate": 0.00033941477105546493, "loss": 4.9648, "mean_token_accuracy": 0.22361060231924057, "num_tokens": 95776222.0, "step": 41820 }, { "entropy": 5.805946731567383, "epoch": 4.134539343614077, "grad_norm": 1.3671875, "learning_rate": 0.00033938095739075903, "loss": 4.914, "mean_token_accuracy": 0.22808899134397506, "num_tokens": 95786986.0, "step": 41825 }, { "entropy": 5.7656896114349365, "epoch": 4.135033610122578, "grad_norm": 1.3203125, "learning_rate": 0.00033934714214227163, "loss": 4.8685, "mean_token_accuracy": 0.23751085698604585, "num_tokens": 95797206.0, "step": 41830 }, { "entropy": 5.797953987121582, "epoch": 4.1355278766310795, "grad_norm": 1.25, "learning_rate": 0.00033931332531083447, "loss": 4.9914, "mean_token_accuracy": 0.23031650930643083, "num_tokens": 95809277.0, "step": 41835 }, { "entropy": 5.83391695022583, "epoch": 4.136022143139581, "grad_norm": 1.1171875, "learning_rate": 0.0003392795068972796, "loss": 4.9849, "mean_token_accuracy": 0.218040369451046, "num_tokens": 95820981.0, "step": 41840 }, { "entropy": 5.803598546981812, "epoch": 4.136516409648082, "grad_norm": 1.2578125, "learning_rate": 0.00033924568690243885, "loss": 4.9312, "mean_token_accuracy": 0.22516164779663086, "num_tokens": 95832287.0, "step": 41845 }, { "entropy": 5.7404989242553714, "epoch": 4.137010676156583, "grad_norm": 1.25, "learning_rate": 0.00033921186532714426, "loss": 4.902, "mean_token_accuracy": 0.23195397704839707, "num_tokens": 95842650.0, "step": 41850 }, { "entropy": 5.789996004104614, "epoch": 4.137504942665085, "grad_norm": 1.5, "learning_rate": 0.0003391780421722279, "loss": 4.9765, "mean_token_accuracy": 0.2248440146446228, "num_tokens": 95852946.0, "step": 41855 }, { "entropy": 5.764745569229126, "epoch": 4.137999209173587, "grad_norm": 1.4375, "learning_rate": 0.0003391442174385216, "loss": 4.9749, "mean_token_accuracy": 0.22567938417196273, "num_tokens": 95864373.0, "step": 41860 }, { "entropy": 5.78674578666687, "epoch": 4.138493475682088, "grad_norm": 1.3515625, "learning_rate": 0.00033911039112685773, "loss": 4.9359, "mean_token_accuracy": 0.2320415958762169, "num_tokens": 95875932.0, "step": 41865 }, { "entropy": 5.78922963142395, "epoch": 4.138987742190589, "grad_norm": 1.2265625, "learning_rate": 0.0003390765632380681, "loss": 4.916, "mean_token_accuracy": 0.23035893142223357, "num_tokens": 95887677.0, "step": 41870 }, { "entropy": 5.7822576522827145, "epoch": 4.13948200869909, "grad_norm": 1.3359375, "learning_rate": 0.0003390427337729852, "loss": 4.9467, "mean_token_accuracy": 0.22918060272932053, "num_tokens": 95898966.0, "step": 41875 }, { "entropy": 5.766458892822266, "epoch": 4.139976275207592, "grad_norm": 1.25, "learning_rate": 0.00033900890273244117, "loss": 4.9692, "mean_token_accuracy": 0.2234041139483452, "num_tokens": 95909645.0, "step": 41880 }, { "entropy": 5.781626844406128, "epoch": 4.140470541716093, "grad_norm": 1.2578125, "learning_rate": 0.00033897507011726815, "loss": 4.9202, "mean_token_accuracy": 0.2280095174908638, "num_tokens": 95920365.0, "step": 41885 }, { "entropy": 5.784172391891479, "epoch": 4.140964808224595, "grad_norm": 1.21875, "learning_rate": 0.00033894123592829843, "loss": 4.967, "mean_token_accuracy": 0.2250792443752289, "num_tokens": 95932770.0, "step": 41890 }, { "entropy": 5.793095493316651, "epoch": 4.141459074733096, "grad_norm": 1.3125, "learning_rate": 0.00033890740016636445, "loss": 4.9064, "mean_token_accuracy": 0.22764774262905121, "num_tokens": 95942792.0, "step": 41895 }, { "entropy": 5.752836132049561, "epoch": 4.141953341241598, "grad_norm": 1.3046875, "learning_rate": 0.0003388735628322985, "loss": 4.8426, "mean_token_accuracy": 0.23235284835100173, "num_tokens": 95953286.0, "step": 41900 }, { "entropy": 5.781254291534424, "epoch": 4.142447607750099, "grad_norm": 1.234375, "learning_rate": 0.00033883972392693295, "loss": 4.9655, "mean_token_accuracy": 0.22055097818374633, "num_tokens": 95964419.0, "step": 41905 }, { "entropy": 5.847490739822388, "epoch": 4.1429418742586, "grad_norm": 1.1484375, "learning_rate": 0.00033880588345110044, "loss": 4.9896, "mean_token_accuracy": 0.22141663134098052, "num_tokens": 95975558.0, "step": 41910 }, { "entropy": 5.875650024414062, "epoch": 4.143436140767101, "grad_norm": 1.4140625, "learning_rate": 0.0003387720414056331, "loss": 5.0509, "mean_token_accuracy": 0.22070700079202651, "num_tokens": 95987421.0, "step": 41915 }, { "entropy": 5.847297859191895, "epoch": 4.143930407275603, "grad_norm": 1.25, "learning_rate": 0.00033873819779136374, "loss": 4.9499, "mean_token_accuracy": 0.22520407289266586, "num_tokens": 95999765.0, "step": 41920 }, { "entropy": 5.74351487159729, "epoch": 4.144424673784105, "grad_norm": 1.3125, "learning_rate": 0.0003387043526091248, "loss": 4.9498, "mean_token_accuracy": 0.2274530276656151, "num_tokens": 96010795.0, "step": 41925 }, { "entropy": 5.79376974105835, "epoch": 4.144918940292606, "grad_norm": 1.3984375, "learning_rate": 0.000338670505859749, "loss": 4.9707, "mean_token_accuracy": 0.22821931838989257, "num_tokens": 96022885.0, "step": 41930 }, { "entropy": 5.786641263961792, "epoch": 4.145413206801107, "grad_norm": 1.2421875, "learning_rate": 0.00033863665754406874, "loss": 4.9339, "mean_token_accuracy": 0.2335208147764206, "num_tokens": 96034636.0, "step": 41935 }, { "entropy": 5.806053113937378, "epoch": 4.145907473309609, "grad_norm": 1.4375, "learning_rate": 0.0003386028076629169, "loss": 4.9398, "mean_token_accuracy": 0.2244931563735008, "num_tokens": 96044880.0, "step": 41940 }, { "entropy": 5.7830219745635985, "epoch": 4.14640173981811, "grad_norm": 1.34375, "learning_rate": 0.0003385689562171261, "loss": 4.9953, "mean_token_accuracy": 0.22309200018644332, "num_tokens": 96056856.0, "step": 41945 }, { "entropy": 5.7712890148162845, "epoch": 4.146896006326611, "grad_norm": 1.4140625, "learning_rate": 0.0003385351032075291, "loss": 4.8746, "mean_token_accuracy": 0.2320969060063362, "num_tokens": 96068843.0, "step": 41950 }, { "entropy": 5.754102611541748, "epoch": 4.147390272835112, "grad_norm": 1.3046875, "learning_rate": 0.0003385012486349588, "loss": 4.9188, "mean_token_accuracy": 0.23111398816108703, "num_tokens": 96079780.0, "step": 41955 }, { "entropy": 5.722984266281128, "epoch": 4.147884539343614, "grad_norm": 1.3359375, "learning_rate": 0.0003384673925002478, "loss": 4.8778, "mean_token_accuracy": 0.23693632185459138, "num_tokens": 96090747.0, "step": 41960 }, { "entropy": 5.753922939300537, "epoch": 4.148378805852116, "grad_norm": 1.1953125, "learning_rate": 0.00033843353480422924, "loss": 4.8568, "mean_token_accuracy": 0.2386754870414734, "num_tokens": 96102895.0, "step": 41965 }, { "entropy": 5.7776401996612545, "epoch": 4.148873072360617, "grad_norm": 1.25, "learning_rate": 0.0003383996755477358, "loss": 4.906, "mean_token_accuracy": 0.22976725548505783, "num_tokens": 96113860.0, "step": 41970 }, { "entropy": 5.733097934722901, "epoch": 4.149367338869118, "grad_norm": 1.3203125, "learning_rate": 0.0003383658147316006, "loss": 4.8939, "mean_token_accuracy": 0.23128117024898528, "num_tokens": 96124154.0, "step": 41975 }, { "entropy": 5.770008373260498, "epoch": 4.14986160537762, "grad_norm": 1.1640625, "learning_rate": 0.00033833195235665636, "loss": 4.9653, "mean_token_accuracy": 0.22047383338212967, "num_tokens": 96137137.0, "step": 41980 }, { "entropy": 5.752041149139404, "epoch": 4.150355871886121, "grad_norm": 1.1875, "learning_rate": 0.00033829808842373633, "loss": 4.9188, "mean_token_accuracy": 0.23087651133537293, "num_tokens": 96148683.0, "step": 41985 }, { "entropy": 5.690748167037964, "epoch": 4.150850138394622, "grad_norm": 1.3203125, "learning_rate": 0.00033826422293367354, "loss": 4.8403, "mean_token_accuracy": 0.23442936837673187, "num_tokens": 96159240.0, "step": 41990 }, { "entropy": 5.797614336013794, "epoch": 4.151344404903123, "grad_norm": 1.2578125, "learning_rate": 0.000338230355887301, "loss": 4.9834, "mean_token_accuracy": 0.2292370840907097, "num_tokens": 96170479.0, "step": 41995 }, { "entropy": 5.831102752685547, "epoch": 4.1518386714116255, "grad_norm": 1.3046875, "learning_rate": 0.000338196487285452, "loss": 4.9615, "mean_token_accuracy": 0.22549984455108643, "num_tokens": 96181242.0, "step": 42000 }, { "epoch": 4.1518386714116255, "eval_entropy": 5.533678781502362, "eval_loss": 5.009167194366455, "eval_mean_token_accuracy": 0.23254616406790884, "eval_num_tokens": 96181242.0, "eval_runtime": 20.5425, "eval_samples_per_second": 1582.72, "eval_steps_per_second": 197.883, "step": 42000 }, { "entropy": 5.85185227394104, "epoch": 4.152332937920127, "grad_norm": 1.3671875, "learning_rate": 0.0003381626171289595, "loss": 5.0112, "mean_token_accuracy": 0.22486206591129304, "num_tokens": 96192049.0, "step": 42005 }, { "entropy": 5.745854711532592, "epoch": 4.152827204428628, "grad_norm": 1.3828125, "learning_rate": 0.00033812874541865685, "loss": 4.8998, "mean_token_accuracy": 0.23356309086084365, "num_tokens": 96203334.0, "step": 42010 }, { "entropy": 5.745328617095947, "epoch": 4.153321470937129, "grad_norm": 1.328125, "learning_rate": 0.0003380948721553773, "loss": 4.9403, "mean_token_accuracy": 0.22854797244071962, "num_tokens": 96214790.0, "step": 42015 }, { "entropy": 5.809774446487427, "epoch": 4.153815737445631, "grad_norm": 1.28125, "learning_rate": 0.0003380609973399541, "loss": 5.0114, "mean_token_accuracy": 0.22639363259077072, "num_tokens": 96227832.0, "step": 42020 }, { "entropy": 5.922045946121216, "epoch": 4.154310003954132, "grad_norm": 1.3046875, "learning_rate": 0.0003380271209732205, "loss": 5.0891, "mean_token_accuracy": 0.21870527863502504, "num_tokens": 96238501.0, "step": 42025 }, { "entropy": 5.7928547859191895, "epoch": 4.154804270462633, "grad_norm": 1.375, "learning_rate": 0.00033799324305601, "loss": 4.9373, "mean_token_accuracy": 0.2300085484981537, "num_tokens": 96249605.0, "step": 42030 }, { "entropy": 5.790035820007324, "epoch": 4.155298536971134, "grad_norm": 1.2890625, "learning_rate": 0.00033795936358915594, "loss": 4.9913, "mean_token_accuracy": 0.22123833745718002, "num_tokens": 96259754.0, "step": 42035 }, { "entropy": 5.748666477203369, "epoch": 4.1557928034796365, "grad_norm": 1.25, "learning_rate": 0.00033792548257349184, "loss": 4.9344, "mean_token_accuracy": 0.23001475036144256, "num_tokens": 96272566.0, "step": 42040 }, { "entropy": 5.810056924819946, "epoch": 4.156287069988138, "grad_norm": 1.21875, "learning_rate": 0.0003378916000098511, "loss": 4.955, "mean_token_accuracy": 0.2234086126089096, "num_tokens": 96283560.0, "step": 42045 }, { "entropy": 5.833791494369507, "epoch": 4.156781336496639, "grad_norm": 1.28125, "learning_rate": 0.00033785771589906724, "loss": 4.926, "mean_token_accuracy": 0.22924749851226806, "num_tokens": 96295892.0, "step": 42050 }, { "entropy": 5.806897783279419, "epoch": 4.15727560300514, "grad_norm": 1.28125, "learning_rate": 0.00033782383024197365, "loss": 4.9655, "mean_token_accuracy": 0.2264800950884819, "num_tokens": 96307561.0, "step": 42055 }, { "entropy": 5.666009616851807, "epoch": 4.157769869513642, "grad_norm": 1.2421875, "learning_rate": 0.0003377899430394043, "loss": 4.8547, "mean_token_accuracy": 0.24008260369300843, "num_tokens": 96318782.0, "step": 42060 }, { "entropy": 5.777905750274658, "epoch": 4.158264136022143, "grad_norm": 1.4140625, "learning_rate": 0.0003377560542921925, "loss": 4.9237, "mean_token_accuracy": 0.23734949976205827, "num_tokens": 96329090.0, "step": 42065 }, { "entropy": 5.878195810317993, "epoch": 4.158758402530644, "grad_norm": 1.3828125, "learning_rate": 0.00033772216400117206, "loss": 5.0285, "mean_token_accuracy": 0.2202135592699051, "num_tokens": 96338681.0, "step": 42070 }, { "entropy": 5.738410711288452, "epoch": 4.159252669039146, "grad_norm": 1.265625, "learning_rate": 0.00033768827216717676, "loss": 4.883, "mean_token_accuracy": 0.23235542923212052, "num_tokens": 96348772.0, "step": 42075 }, { "entropy": 5.797555637359619, "epoch": 4.1597469355476475, "grad_norm": 1.3203125, "learning_rate": 0.00033765437879104004, "loss": 4.9756, "mean_token_accuracy": 0.22796508818864822, "num_tokens": 96360772.0, "step": 42080 }, { "entropy": 5.834882020950317, "epoch": 4.160241202056149, "grad_norm": 1.296875, "learning_rate": 0.00033762048387359593, "loss": 4.9892, "mean_token_accuracy": 0.22521932870149614, "num_tokens": 96371729.0, "step": 42085 }, { "entropy": 5.808661460876465, "epoch": 4.16073546856465, "grad_norm": 1.3359375, "learning_rate": 0.0003375865874156783, "loss": 4.9443, "mean_token_accuracy": 0.22904234677553176, "num_tokens": 96382422.0, "step": 42090 }, { "entropy": 5.809221076965332, "epoch": 4.161229735073151, "grad_norm": 1.25, "learning_rate": 0.0003375526894181208, "loss": 4.9748, "mean_token_accuracy": 0.22535169422626494, "num_tokens": 96393411.0, "step": 42095 }, { "entropy": 5.713190650939941, "epoch": 4.161724001581653, "grad_norm": 1.2578125, "learning_rate": 0.0003375187898817575, "loss": 4.8651, "mean_token_accuracy": 0.23432136625051497, "num_tokens": 96404133.0, "step": 42100 }, { "entropy": 5.831609487533569, "epoch": 4.162218268090154, "grad_norm": 1.203125, "learning_rate": 0.0003374848888074223, "loss": 4.9837, "mean_token_accuracy": 0.22206680476665497, "num_tokens": 96416651.0, "step": 42105 }, { "entropy": 5.8268908023834225, "epoch": 4.162712534598656, "grad_norm": 1.265625, "learning_rate": 0.00033745098619594906, "loss": 4.9889, "mean_token_accuracy": 0.22366662472486495, "num_tokens": 96429831.0, "step": 42110 }, { "entropy": 5.72743673324585, "epoch": 4.163206801107157, "grad_norm": 1.2734375, "learning_rate": 0.000337417082048172, "loss": 4.8792, "mean_token_accuracy": 0.2341558203101158, "num_tokens": 96440227.0, "step": 42115 }, { "entropy": 5.789227867126465, "epoch": 4.1637010676156585, "grad_norm": 1.2578125, "learning_rate": 0.00033738317636492496, "loss": 4.965, "mean_token_accuracy": 0.22414795011281968, "num_tokens": 96451975.0, "step": 42120 }, { "entropy": 5.724147891998291, "epoch": 4.16419533412416, "grad_norm": 1.328125, "learning_rate": 0.0003373492691470421, "loss": 4.8604, "mean_token_accuracy": 0.23121273815631865, "num_tokens": 96462416.0, "step": 42125 }, { "entropy": 5.783310747146606, "epoch": 4.164689600632661, "grad_norm": 1.390625, "learning_rate": 0.00033731536039535747, "loss": 4.9266, "mean_token_accuracy": 0.228180493414402, "num_tokens": 96475450.0, "step": 42130 }, { "entropy": 5.852667999267578, "epoch": 4.165183867141162, "grad_norm": 1.25, "learning_rate": 0.00033728145011070537, "loss": 5.0241, "mean_token_accuracy": 0.21669515818357468, "num_tokens": 96486885.0, "step": 42135 }, { "entropy": 5.752664232254029, "epoch": 4.1656781336496636, "grad_norm": 1.4765625, "learning_rate": 0.00033724753829391996, "loss": 4.9065, "mean_token_accuracy": 0.22948591858148576, "num_tokens": 96498401.0, "step": 42140 }, { "entropy": 5.728801679611206, "epoch": 4.166172400158166, "grad_norm": 1.2421875, "learning_rate": 0.0003372136249458355, "loss": 4.9219, "mean_token_accuracy": 0.23119271397590638, "num_tokens": 96509824.0, "step": 42145 }, { "entropy": 5.755523443222046, "epoch": 4.166666666666667, "grad_norm": 1.2578125, "learning_rate": 0.0003371797100672861, "loss": 4.9261, "mean_token_accuracy": 0.2321494162082672, "num_tokens": 96521261.0, "step": 42150 }, { "entropy": 5.830453634262085, "epoch": 4.167160933175168, "grad_norm": 1.2578125, "learning_rate": 0.00033714579365910617, "loss": 4.9643, "mean_token_accuracy": 0.22389705926179887, "num_tokens": 96533015.0, "step": 42155 }, { "entropy": 5.8386155128479, "epoch": 4.1676551996836695, "grad_norm": 1.4765625, "learning_rate": 0.0003371118757221302, "loss": 4.9272, "mean_token_accuracy": 0.2348856583237648, "num_tokens": 96543076.0, "step": 42160 }, { "entropy": 5.746624708175659, "epoch": 4.168149466192171, "grad_norm": 1.2265625, "learning_rate": 0.00033707795625719243, "loss": 4.874, "mean_token_accuracy": 0.2364471897482872, "num_tokens": 96554003.0, "step": 42165 }, { "entropy": 5.710572195053101, "epoch": 4.168643732700672, "grad_norm": 1.140625, "learning_rate": 0.0003370440352651273, "loss": 4.8629, "mean_token_accuracy": 0.23399485349655152, "num_tokens": 96567005.0, "step": 42170 }, { "entropy": 5.7476881980896, "epoch": 4.169137999209173, "grad_norm": 1.2890625, "learning_rate": 0.00033701011274676917, "loss": 4.9295, "mean_token_accuracy": 0.22620429545640947, "num_tokens": 96577403.0, "step": 42175 }, { "entropy": 5.811063432693482, "epoch": 4.169632265717675, "grad_norm": 1.3046875, "learning_rate": 0.00033697618870295274, "loss": 4.9218, "mean_token_accuracy": 0.23040825873613358, "num_tokens": 96588511.0, "step": 42180 }, { "entropy": 5.84308876991272, "epoch": 4.170126532226177, "grad_norm": 1.328125, "learning_rate": 0.0003369422631345124, "loss": 4.9864, "mean_token_accuracy": 0.22484734058380126, "num_tokens": 96599422.0, "step": 42185 }, { "entropy": 5.795851421356201, "epoch": 4.170620798734678, "grad_norm": 1.1953125, "learning_rate": 0.00033690833604228283, "loss": 4.9697, "mean_token_accuracy": 0.22498807162046433, "num_tokens": 96611230.0, "step": 42190 }, { "entropy": 5.702176713943482, "epoch": 4.171115065243179, "grad_norm": 1.21875, "learning_rate": 0.0003368744074270986, "loss": 4.8636, "mean_token_accuracy": 0.24526637494564058, "num_tokens": 96622341.0, "step": 42195 }, { "entropy": 5.7744073390960695, "epoch": 4.1716093317516805, "grad_norm": 1.3828125, "learning_rate": 0.00033684047728979426, "loss": 4.892, "mean_token_accuracy": 0.22548425048589707, "num_tokens": 96632987.0, "step": 42200 }, { "entropy": 5.740166521072387, "epoch": 4.172103598260182, "grad_norm": 1.3203125, "learning_rate": 0.0003368065456312047, "loss": 4.9358, "mean_token_accuracy": 0.23454935550689698, "num_tokens": 96645262.0, "step": 42205 }, { "entropy": 5.737353181838989, "epoch": 4.172597864768683, "grad_norm": 1.2890625, "learning_rate": 0.00033677261245216444, "loss": 4.9058, "mean_token_accuracy": 0.23785075545310974, "num_tokens": 96657873.0, "step": 42210 }, { "entropy": 5.773782730102539, "epoch": 4.173092131277184, "grad_norm": 1.34375, "learning_rate": 0.0003367386777535084, "loss": 4.9743, "mean_token_accuracy": 0.2265040621161461, "num_tokens": 96668845.0, "step": 42215 }, { "entropy": 5.7452627658844, "epoch": 4.173586397785686, "grad_norm": 1.2734375, "learning_rate": 0.00033670474153607127, "loss": 4.8884, "mean_token_accuracy": 0.23731583803892137, "num_tokens": 96680787.0, "step": 42220 }, { "entropy": 5.805747175216675, "epoch": 4.174080664294188, "grad_norm": 1.328125, "learning_rate": 0.00033667080380068786, "loss": 4.9334, "mean_token_accuracy": 0.23413556069135666, "num_tokens": 96692783.0, "step": 42225 }, { "entropy": 5.899657773971557, "epoch": 4.174574930802689, "grad_norm": 1.2734375, "learning_rate": 0.00033663686454819326, "loss": 5.086, "mean_token_accuracy": 0.21467451006174088, "num_tokens": 96704000.0, "step": 42230 }, { "entropy": 5.792047119140625, "epoch": 4.17506919731119, "grad_norm": 1.2109375, "learning_rate": 0.0003366029237794221, "loss": 4.9794, "mean_token_accuracy": 0.22851030379533768, "num_tokens": 96715791.0, "step": 42235 }, { "entropy": 5.772071790695191, "epoch": 4.1755634638196915, "grad_norm": 1.2890625, "learning_rate": 0.0003365689814952095, "loss": 4.8715, "mean_token_accuracy": 0.23212676495313644, "num_tokens": 96726510.0, "step": 42240 }, { "entropy": 5.771815061569214, "epoch": 4.176057730328193, "grad_norm": 1.265625, "learning_rate": 0.00033653503769639045, "loss": 4.9258, "mean_token_accuracy": 0.22770150750875473, "num_tokens": 96738147.0, "step": 42245 }, { "entropy": 5.749001169204712, "epoch": 4.176551996836694, "grad_norm": 1.546875, "learning_rate": 0.0003365010923837999, "loss": 4.9401, "mean_token_accuracy": 0.23551376461982726, "num_tokens": 96749553.0, "step": 42250 }, { "entropy": 5.819431114196777, "epoch": 4.177046263345196, "grad_norm": 1.25, "learning_rate": 0.0003364671455582729, "loss": 4.9453, "mean_token_accuracy": 0.22581138014793395, "num_tokens": 96761728.0, "step": 42255 }, { "entropy": 5.770155763626098, "epoch": 4.177540529853697, "grad_norm": 1.3515625, "learning_rate": 0.00033643319722064457, "loss": 4.8949, "mean_token_accuracy": 0.23484534919261932, "num_tokens": 96772382.0, "step": 42260 }, { "entropy": 5.636398077011108, "epoch": 4.178034796362199, "grad_norm": 1.2890625, "learning_rate": 0.0003363992473717502, "loss": 4.7689, "mean_token_accuracy": 0.2548342704772949, "num_tokens": 96783844.0, "step": 42265 }, { "entropy": 5.755936145782471, "epoch": 4.1785290628707, "grad_norm": 1.1875, "learning_rate": 0.0003363652960124246, "loss": 4.9963, "mean_token_accuracy": 0.22712917178869246, "num_tokens": 96795256.0, "step": 42270 }, { "entropy": 5.79455075263977, "epoch": 4.179023329379201, "grad_norm": 1.34375, "learning_rate": 0.00033633134314350335, "loss": 4.9887, "mean_token_accuracy": 0.22693213522434236, "num_tokens": 96807085.0, "step": 42275 }, { "entropy": 5.790366363525391, "epoch": 4.179517595887702, "grad_norm": 1.3125, "learning_rate": 0.00033629738876582156, "loss": 4.8891, "mean_token_accuracy": 0.2325239360332489, "num_tokens": 96818351.0, "step": 42280 }, { "entropy": 5.762495660781861, "epoch": 4.180011862396204, "grad_norm": 1.3359375, "learning_rate": 0.00033626343288021437, "loss": 4.8851, "mean_token_accuracy": 0.23101907968521118, "num_tokens": 96830093.0, "step": 42285 }, { "entropy": 5.785472869873047, "epoch": 4.180506128904705, "grad_norm": 1.2578125, "learning_rate": 0.00033622947548751737, "loss": 4.9323, "mean_token_accuracy": 0.22993303686380387, "num_tokens": 96842124.0, "step": 42290 }, { "entropy": 5.757175493240356, "epoch": 4.181000395413207, "grad_norm": 1.3828125, "learning_rate": 0.00033619551658856567, "loss": 4.9744, "mean_token_accuracy": 0.21841660737991334, "num_tokens": 96853764.0, "step": 42295 }, { "entropy": 5.764651155471801, "epoch": 4.181494661921708, "grad_norm": 1.359375, "learning_rate": 0.0003361615561841948, "loss": 4.925, "mean_token_accuracy": 0.2266773283481598, "num_tokens": 96865356.0, "step": 42300 }, { "entropy": 5.773111391067505, "epoch": 4.18198892843021, "grad_norm": 1.3515625, "learning_rate": 0.00033612759427524016, "loss": 4.9253, "mean_token_accuracy": 0.23118874728679656, "num_tokens": 96876747.0, "step": 42305 }, { "entropy": 5.756291246414184, "epoch": 4.182483194938711, "grad_norm": 1.28125, "learning_rate": 0.00033609363086253727, "loss": 4.8756, "mean_token_accuracy": 0.23611579239368438, "num_tokens": 96888723.0, "step": 42310 }, { "entropy": 5.798770999908447, "epoch": 4.182977461447212, "grad_norm": 1.2890625, "learning_rate": 0.0003360596659469215, "loss": 4.9507, "mean_token_accuracy": 0.2297533854842186, "num_tokens": 96900772.0, "step": 42315 }, { "entropy": 5.828733348846436, "epoch": 4.183471727955713, "grad_norm": 1.25, "learning_rate": 0.0003360256995292285, "loss": 4.9663, "mean_token_accuracy": 0.22560759484767914, "num_tokens": 96911739.0, "step": 42320 }, { "entropy": 5.76828236579895, "epoch": 4.183965994464215, "grad_norm": 1.25, "learning_rate": 0.00033599173161029383, "loss": 4.8803, "mean_token_accuracy": 0.2311836913228035, "num_tokens": 96923135.0, "step": 42325 }, { "entropy": 5.741417407989502, "epoch": 4.184460260972717, "grad_norm": 1.2890625, "learning_rate": 0.0003359577621909531, "loss": 4.8929, "mean_token_accuracy": 0.23270026445388795, "num_tokens": 96934835.0, "step": 42330 }, { "entropy": 5.801205253601074, "epoch": 4.184954527481218, "grad_norm": 1.5703125, "learning_rate": 0.000335923791272042, "loss": 5.0142, "mean_token_accuracy": 0.2273244485259056, "num_tokens": 96944870.0, "step": 42335 }, { "entropy": 5.881455326080323, "epoch": 4.185448793989719, "grad_norm": 1.40625, "learning_rate": 0.0003358898188543961, "loss": 5.028, "mean_token_accuracy": 0.22067079544067383, "num_tokens": 96955562.0, "step": 42340 }, { "entropy": 5.77050371170044, "epoch": 4.185943060498221, "grad_norm": 1.2421875, "learning_rate": 0.00033585584493885123, "loss": 4.9238, "mean_token_accuracy": 0.23313048779964446, "num_tokens": 96966445.0, "step": 42345 }, { "entropy": 5.837284517288208, "epoch": 4.186437327006722, "grad_norm": 1.2734375, "learning_rate": 0.00033582186952624314, "loss": 5.0434, "mean_token_accuracy": 0.2157254621386528, "num_tokens": 96978162.0, "step": 42350 }, { "entropy": 5.7980328559875485, "epoch": 4.186931593515223, "grad_norm": 1.171875, "learning_rate": 0.00033578789261740766, "loss": 4.9486, "mean_token_accuracy": 0.22475740313529968, "num_tokens": 96989348.0, "step": 42355 }, { "entropy": 5.850470447540284, "epoch": 4.187425860023724, "grad_norm": 1.3515625, "learning_rate": 0.00033575391421318063, "loss": 4.9671, "mean_token_accuracy": 0.2292979434132576, "num_tokens": 97001291.0, "step": 42360 }, { "entropy": 5.764464282989502, "epoch": 4.187920126532227, "grad_norm": 1.1875, "learning_rate": 0.00033571993431439777, "loss": 5.0261, "mean_token_accuracy": 0.2221033275127411, "num_tokens": 97013568.0, "step": 42365 }, { "entropy": 5.783184385299682, "epoch": 4.188414393040728, "grad_norm": 1.375, "learning_rate": 0.0003356859529218952, "loss": 4.8943, "mean_token_accuracy": 0.22824627310037612, "num_tokens": 97024009.0, "step": 42370 }, { "entropy": 5.785395574569702, "epoch": 4.188908659549229, "grad_norm": 1.328125, "learning_rate": 0.00033565197003650876, "loss": 4.9495, "mean_token_accuracy": 0.2278834268450737, "num_tokens": 97035582.0, "step": 42375 }, { "entropy": 5.758455896377564, "epoch": 4.18940292605773, "grad_norm": 1.359375, "learning_rate": 0.0003356179856590744, "loss": 4.9837, "mean_token_accuracy": 0.22433990985155106, "num_tokens": 97048193.0, "step": 42380 }, { "entropy": 5.777410268783569, "epoch": 4.189897192566232, "grad_norm": 1.5234375, "learning_rate": 0.00033558399979042826, "loss": 4.9649, "mean_token_accuracy": 0.23234901279211045, "num_tokens": 97058977.0, "step": 42385 }, { "entropy": 5.823492240905762, "epoch": 4.190391459074733, "grad_norm": 1.296875, "learning_rate": 0.00033555001243140627, "loss": 4.9663, "mean_token_accuracy": 0.2248974099755287, "num_tokens": 97070757.0, "step": 42390 }, { "entropy": 5.857982444763183, "epoch": 4.190885725583234, "grad_norm": 1.28125, "learning_rate": 0.0003355160235828446, "loss": 4.98, "mean_token_accuracy": 0.22358244210481643, "num_tokens": 97081062.0, "step": 42395 }, { "entropy": 5.793693017959595, "epoch": 4.191379992091736, "grad_norm": 1.3125, "learning_rate": 0.00033548203324557937, "loss": 4.9494, "mean_token_accuracy": 0.22338467985391616, "num_tokens": 97093090.0, "step": 42400 }, { "entropy": 5.773223066329956, "epoch": 4.1918742586002375, "grad_norm": 1.2421875, "learning_rate": 0.00033544804142044673, "loss": 4.9568, "mean_token_accuracy": 0.22342406809329987, "num_tokens": 97103936.0, "step": 42405 }, { "entropy": 5.7943885803222654, "epoch": 4.192368525108739, "grad_norm": 1.34375, "learning_rate": 0.00033541404810828284, "loss": 4.9703, "mean_token_accuracy": 0.21995019912719727, "num_tokens": 97115797.0, "step": 42410 }, { "entropy": 5.840319585800171, "epoch": 4.19286279161724, "grad_norm": 1.375, "learning_rate": 0.00033538005330992405, "loss": 4.9905, "mean_token_accuracy": 0.23146339058876036, "num_tokens": 97126920.0, "step": 42415 }, { "entropy": 5.759835577011108, "epoch": 4.193357058125741, "grad_norm": 1.234375, "learning_rate": 0.0003353460570262066, "loss": 4.8082, "mean_token_accuracy": 0.23873633295297622, "num_tokens": 97138236.0, "step": 42420 }, { "entropy": 5.810373210906983, "epoch": 4.193851324634243, "grad_norm": 1.21875, "learning_rate": 0.00033531205925796674, "loss": 4.9728, "mean_token_accuracy": 0.2259466528892517, "num_tokens": 97150666.0, "step": 42425 }, { "entropy": 5.790635585784912, "epoch": 4.194345591142744, "grad_norm": 1.1953125, "learning_rate": 0.0003352780600060409, "loss": 4.913, "mean_token_accuracy": 0.2279958412051201, "num_tokens": 97161747.0, "step": 42430 }, { "entropy": 5.770146656036377, "epoch": 4.194839857651246, "grad_norm": 1.2890625, "learning_rate": 0.00033524405927126536, "loss": 4.9333, "mean_token_accuracy": 0.22841710597276688, "num_tokens": 97173582.0, "step": 42435 }, { "entropy": 5.787171936035156, "epoch": 4.195334124159747, "grad_norm": 1.265625, "learning_rate": 0.0003352100570544767, "loss": 4.8791, "mean_token_accuracy": 0.23148779273033143, "num_tokens": 97184707.0, "step": 42440 }, { "entropy": 5.743264198303223, "epoch": 4.1958283906682485, "grad_norm": 1.390625, "learning_rate": 0.0003351760533565113, "loss": 4.9201, "mean_token_accuracy": 0.2276039019227028, "num_tokens": 97196496.0, "step": 42445 }, { "entropy": 5.739260911941528, "epoch": 4.19632265717675, "grad_norm": 1.375, "learning_rate": 0.00033514204817820564, "loss": 4.9156, "mean_token_accuracy": 0.2269454151391983, "num_tokens": 97207291.0, "step": 42450 }, { "entropy": 5.811512184143067, "epoch": 4.196816923685251, "grad_norm": 1.2734375, "learning_rate": 0.0003351080415203962, "loss": 5.0051, "mean_token_accuracy": 0.22769604474306107, "num_tokens": 97219001.0, "step": 42455 }, { "entropy": 5.821756744384766, "epoch": 4.197311190193752, "grad_norm": 1.3046875, "learning_rate": 0.0003350740333839197, "loss": 4.9325, "mean_token_accuracy": 0.23457292467355728, "num_tokens": 97230451.0, "step": 42460 }, { "entropy": 5.8236688613891605, "epoch": 4.197805456702254, "grad_norm": 1.28125, "learning_rate": 0.0003350400237696126, "loss": 4.9494, "mean_token_accuracy": 0.22913777083158493, "num_tokens": 97241752.0, "step": 42465 }, { "entropy": 5.724374580383301, "epoch": 4.198299723210755, "grad_norm": 1.25, "learning_rate": 0.00033500601267831163, "loss": 4.9359, "mean_token_accuracy": 0.22753970474004745, "num_tokens": 97253453.0, "step": 42470 }, { "entropy": 5.7651282787323, "epoch": 4.198793989719257, "grad_norm": 1.171875, "learning_rate": 0.00033497200011085344, "loss": 4.8894, "mean_token_accuracy": 0.23417162597179414, "num_tokens": 97265963.0, "step": 42475 }, { "entropy": 5.699686050415039, "epoch": 4.199288256227758, "grad_norm": 1.21875, "learning_rate": 0.0003349379860680747, "loss": 4.8875, "mean_token_accuracy": 0.23095064014196395, "num_tokens": 97278311.0, "step": 42480 }, { "entropy": 5.817659854888916, "epoch": 4.1997825227362595, "grad_norm": 1.3046875, "learning_rate": 0.0003349039705508123, "loss": 4.9071, "mean_token_accuracy": 0.22736934721469879, "num_tokens": 97289437.0, "step": 42485 }, { "entropy": 5.745040798187256, "epoch": 4.200276789244761, "grad_norm": 1.34375, "learning_rate": 0.0003348699535599028, "loss": 4.8753, "mean_token_accuracy": 0.23689419031143188, "num_tokens": 97300623.0, "step": 42490 }, { "entropy": 5.777965068817139, "epoch": 4.200771055753262, "grad_norm": 1.265625, "learning_rate": 0.0003348359350961833, "loss": 4.953, "mean_token_accuracy": 0.23104121685028076, "num_tokens": 97311584.0, "step": 42495 }, { "entropy": 5.777185773849487, "epoch": 4.201265322261763, "grad_norm": 1.296875, "learning_rate": 0.0003348019151604904, "loss": 4.9249, "mean_token_accuracy": 0.22905660420656204, "num_tokens": 97323536.0, "step": 42500 }, { "entropy": 5.750197219848633, "epoch": 4.201759588770265, "grad_norm": 1.296875, "learning_rate": 0.00033476789375366106, "loss": 4.9347, "mean_token_accuracy": 0.23070674389600754, "num_tokens": 97333203.0, "step": 42505 }, { "entropy": 5.749302673339844, "epoch": 4.202253855278767, "grad_norm": 1.296875, "learning_rate": 0.00033473387087653244, "loss": 4.9233, "mean_token_accuracy": 0.2303317129611969, "num_tokens": 97343970.0, "step": 42510 }, { "entropy": 5.791309595108032, "epoch": 4.202748121787268, "grad_norm": 1.4296875, "learning_rate": 0.0003346998465299412, "loss": 4.9467, "mean_token_accuracy": 0.22809857428073882, "num_tokens": 97355636.0, "step": 42515 }, { "entropy": 5.837331485748291, "epoch": 4.203242388295769, "grad_norm": 1.4296875, "learning_rate": 0.00033466582071472453, "loss": 4.965, "mean_token_accuracy": 0.2257887005805969, "num_tokens": 97366756.0, "step": 42520 }, { "entropy": 5.798159790039063, "epoch": 4.2037366548042705, "grad_norm": 1.2109375, "learning_rate": 0.0003346317934317194, "loss": 5.008, "mean_token_accuracy": 0.22483496963977814, "num_tokens": 97379304.0, "step": 42525 }, { "entropy": 5.768119955062867, "epoch": 4.204230921312772, "grad_norm": 1.2421875, "learning_rate": 0.0003345977646817629, "loss": 4.8859, "mean_token_accuracy": 0.23493802100419997, "num_tokens": 97390162.0, "step": 42530 }, { "entropy": 5.78220386505127, "epoch": 4.204725187821273, "grad_norm": 1.296875, "learning_rate": 0.0003345637344656921, "loss": 4.9649, "mean_token_accuracy": 0.22246380895376205, "num_tokens": 97401380.0, "step": 42535 }, { "entropy": 5.766062450408936, "epoch": 4.205219454329774, "grad_norm": 1.2890625, "learning_rate": 0.00033452970278434425, "loss": 4.9988, "mean_token_accuracy": 0.22351522892713546, "num_tokens": 97413056.0, "step": 42540 }, { "entropy": 5.745073556900024, "epoch": 4.2057137208382755, "grad_norm": 1.140625, "learning_rate": 0.00033449566963855644, "loss": 4.9071, "mean_token_accuracy": 0.23116191923618318, "num_tokens": 97424143.0, "step": 42545 }, { "entropy": 5.769159412384033, "epoch": 4.206207987346778, "grad_norm": 1.4296875, "learning_rate": 0.000334461635029166, "loss": 4.9198, "mean_token_accuracy": 0.2286946713924408, "num_tokens": 97435417.0, "step": 42550 }, { "entropy": 5.822003126144409, "epoch": 4.206702253855279, "grad_norm": 1.25, "learning_rate": 0.00033442759895701, "loss": 5.052, "mean_token_accuracy": 0.21964351534843446, "num_tokens": 97446769.0, "step": 42555 }, { "entropy": 5.822015619277954, "epoch": 4.20719652036378, "grad_norm": 1.328125, "learning_rate": 0.00033439356142292594, "loss": 5.0, "mean_token_accuracy": 0.22792186588048935, "num_tokens": 97456878.0, "step": 42560 }, { "entropy": 5.769874429702758, "epoch": 4.2076907868722815, "grad_norm": 1.34375, "learning_rate": 0.00033435952242775096, "loss": 4.9282, "mean_token_accuracy": 0.23150235712528228, "num_tokens": 97467593.0, "step": 42565 }, { "entropy": 5.773221158981324, "epoch": 4.208185053380783, "grad_norm": 1.265625, "learning_rate": 0.0003343254819723226, "loss": 4.9098, "mean_token_accuracy": 0.23176957666873932, "num_tokens": 97478024.0, "step": 42570 }, { "entropy": 5.696961307525635, "epoch": 4.208679319889284, "grad_norm": 1.25, "learning_rate": 0.0003342914400574782, "loss": 4.8314, "mean_token_accuracy": 0.23367846012115479, "num_tokens": 97489028.0, "step": 42575 }, { "entropy": 5.719100666046143, "epoch": 4.209173586397785, "grad_norm": 1.390625, "learning_rate": 0.00033425739668405515, "loss": 4.8887, "mean_token_accuracy": 0.2301653653383255, "num_tokens": 97500521.0, "step": 42580 }, { "entropy": 5.879099607467651, "epoch": 4.209667852906287, "grad_norm": 1.3828125, "learning_rate": 0.00033422335185289093, "loss": 5.0855, "mean_token_accuracy": 0.21434663534164428, "num_tokens": 97511781.0, "step": 42585 }, { "entropy": 5.788574647903443, "epoch": 4.210162119414789, "grad_norm": 1.328125, "learning_rate": 0.00033418930556482305, "loss": 4.9209, "mean_token_accuracy": 0.22930293083190917, "num_tokens": 97523232.0, "step": 42590 }, { "entropy": 5.729521656036377, "epoch": 4.21065638592329, "grad_norm": 1.2578125, "learning_rate": 0.0003341552578206891, "loss": 4.8879, "mean_token_accuracy": 0.23320727348327636, "num_tokens": 97534072.0, "step": 42595 }, { "entropy": 5.765132236480713, "epoch": 4.211150652431791, "grad_norm": 1.3046875, "learning_rate": 0.0003341212086213266, "loss": 4.9128, "mean_token_accuracy": 0.2346050411462784, "num_tokens": 97546480.0, "step": 42600 }, { "entropy": 5.790809583663941, "epoch": 4.2116449189402925, "grad_norm": 1.3515625, "learning_rate": 0.00033408715796757316, "loss": 4.9126, "mean_token_accuracy": 0.2208746165037155, "num_tokens": 97557840.0, "step": 42605 }, { "entropy": 5.835300016403198, "epoch": 4.212139185448794, "grad_norm": 1.2421875, "learning_rate": 0.0003340531058602666, "loss": 4.9745, "mean_token_accuracy": 0.22754185050725936, "num_tokens": 97570244.0, "step": 42610 }, { "entropy": 5.68229112625122, "epoch": 4.212633451957295, "grad_norm": 1.21875, "learning_rate": 0.0003340190523002444, "loss": 4.7454, "mean_token_accuracy": 0.2451862722635269, "num_tokens": 97580093.0, "step": 42615 }, { "entropy": 5.764474248886108, "epoch": 4.213127718465797, "grad_norm": 1.2734375, "learning_rate": 0.00033398499728834436, "loss": 4.9688, "mean_token_accuracy": 0.22876218259334563, "num_tokens": 97592134.0, "step": 42620 }, { "entropy": 5.775645542144775, "epoch": 4.213621984974298, "grad_norm": 1.2578125, "learning_rate": 0.0003339509408254042, "loss": 4.9668, "mean_token_accuracy": 0.22776615470647812, "num_tokens": 97604881.0, "step": 42625 }, { "entropy": 5.756598949432373, "epoch": 4.2141162514828, "grad_norm": 1.484375, "learning_rate": 0.0003339168829122618, "loss": 4.9378, "mean_token_accuracy": 0.22826602756977082, "num_tokens": 97615916.0, "step": 42630 }, { "entropy": 5.8059889793396, "epoch": 4.214610517991301, "grad_norm": 1.2890625, "learning_rate": 0.0003338828235497549, "loss": 4.9581, "mean_token_accuracy": 0.23205505758523942, "num_tokens": 97627184.0, "step": 42635 }, { "entropy": 5.827702569961548, "epoch": 4.215104784499802, "grad_norm": 1.4140625, "learning_rate": 0.00033384876273872145, "loss": 4.9709, "mean_token_accuracy": 0.2198186472058296, "num_tokens": 97637981.0, "step": 42640 }, { "entropy": 5.81188850402832, "epoch": 4.2155990510083035, "grad_norm": 1.328125, "learning_rate": 0.0003338147004799993, "loss": 4.9967, "mean_token_accuracy": 0.22466234862804413, "num_tokens": 97649103.0, "step": 42645 }, { "entropy": 5.745229721069336, "epoch": 4.216093317516805, "grad_norm": 1.2734375, "learning_rate": 0.0003337806367744263, "loss": 4.8695, "mean_token_accuracy": 0.23384003192186356, "num_tokens": 97661380.0, "step": 42650 }, { "entropy": 5.779924011230468, "epoch": 4.216587584025307, "grad_norm": 1.15625, "learning_rate": 0.0003337465716228406, "loss": 4.9465, "mean_token_accuracy": 0.22884174585342407, "num_tokens": 97672283.0, "step": 42655 }, { "entropy": 5.760346412658691, "epoch": 4.217081850533808, "grad_norm": 1.390625, "learning_rate": 0.00033371250502608015, "loss": 4.957, "mean_token_accuracy": 0.22185326218605042, "num_tokens": 97683918.0, "step": 42660 }, { "entropy": 5.82781572341919, "epoch": 4.217576117042309, "grad_norm": 1.5390625, "learning_rate": 0.0003336784369849829, "loss": 4.9104, "mean_token_accuracy": 0.23541373908519744, "num_tokens": 97695391.0, "step": 42665 }, { "entropy": 5.79263916015625, "epoch": 4.218070383550811, "grad_norm": 1.2734375, "learning_rate": 0.0003336443675003871, "loss": 4.9378, "mean_token_accuracy": 0.23558879196643828, "num_tokens": 97705932.0, "step": 42670 }, { "entropy": 5.772899007797241, "epoch": 4.218564650059312, "grad_norm": 1.359375, "learning_rate": 0.0003336102965731306, "loss": 4.9245, "mean_token_accuracy": 0.23542657345533372, "num_tokens": 97717298.0, "step": 42675 }, { "entropy": 5.742224597930909, "epoch": 4.219058916567813, "grad_norm": 1.4453125, "learning_rate": 0.0003335762242040519, "loss": 4.9096, "mean_token_accuracy": 0.22689489424228668, "num_tokens": 97727631.0, "step": 42680 }, { "entropy": 5.718751859664917, "epoch": 4.219553183076314, "grad_norm": 1.4375, "learning_rate": 0.00033354215039398886, "loss": 4.8922, "mean_token_accuracy": 0.23641736060380936, "num_tokens": 97738363.0, "step": 42685 }, { "entropy": 5.793566942214966, "epoch": 4.220047449584817, "grad_norm": 1.40625, "learning_rate": 0.0003335080751437799, "loss": 4.9351, "mean_token_accuracy": 0.23322536796331406, "num_tokens": 97750413.0, "step": 42690 }, { "entropy": 5.853152894973755, "epoch": 4.220541716093318, "grad_norm": 1.328125, "learning_rate": 0.0003334739984542632, "loss": 5.0274, "mean_token_accuracy": 0.21706680655479432, "num_tokens": 97762284.0, "step": 42695 }, { "entropy": 5.702807760238647, "epoch": 4.221035982601819, "grad_norm": 1.28125, "learning_rate": 0.0003334399203262771, "loss": 4.903, "mean_token_accuracy": 0.22967411577701569, "num_tokens": 97774006.0, "step": 42700 }, { "entropy": 5.825601863861084, "epoch": 4.22153024911032, "grad_norm": 1.4140625, "learning_rate": 0.0003334058407606598, "loss": 5.0081, "mean_token_accuracy": 0.222252556681633, "num_tokens": 97785373.0, "step": 42705 }, { "entropy": 5.8319169044494625, "epoch": 4.222024515618822, "grad_norm": 1.3515625, "learning_rate": 0.00033337175975824986, "loss": 4.9621, "mean_token_accuracy": 0.22701905518770218, "num_tokens": 97796455.0, "step": 42710 }, { "entropy": 5.7989696025848385, "epoch": 4.222518782127323, "grad_norm": 1.1796875, "learning_rate": 0.00033333767731988557, "loss": 4.9224, "mean_token_accuracy": 0.22690904289484023, "num_tokens": 97808248.0, "step": 42715 }, { "entropy": 5.797176647186279, "epoch": 4.223013048635824, "grad_norm": 1.2421875, "learning_rate": 0.0003333035934464052, "loss": 4.9684, "mean_token_accuracy": 0.22452993988990783, "num_tokens": 97821318.0, "step": 42720 }, { "entropy": 5.673232555389404, "epoch": 4.223507315144325, "grad_norm": 1.328125, "learning_rate": 0.0003332695081386476, "loss": 4.9054, "mean_token_accuracy": 0.2260928452014923, "num_tokens": 97832213.0, "step": 42725 }, { "entropy": 5.866296482086182, "epoch": 4.224001581652828, "grad_norm": 1.234375, "learning_rate": 0.00033323542139745093, "loss": 5.1157, "mean_token_accuracy": 0.2082962140440941, "num_tokens": 97844577.0, "step": 42730 }, { "entropy": 5.844697523117065, "epoch": 4.224495848161329, "grad_norm": 1.25, "learning_rate": 0.00033320133322365395, "loss": 4.963, "mean_token_accuracy": 0.2305160492658615, "num_tokens": 97857366.0, "step": 42735 }, { "entropy": 5.790691280364991, "epoch": 4.22499011466983, "grad_norm": 1.3125, "learning_rate": 0.0003331672436180951, "loss": 4.9793, "mean_token_accuracy": 0.22226182073354722, "num_tokens": 97869107.0, "step": 42740 }, { "entropy": 5.742409896850586, "epoch": 4.225484381178331, "grad_norm": 1.359375, "learning_rate": 0.000333133152581613, "loss": 4.8984, "mean_token_accuracy": 0.2426530107855797, "num_tokens": 97879741.0, "step": 42745 }, { "entropy": 5.798948192596436, "epoch": 4.225978647686833, "grad_norm": 1.5078125, "learning_rate": 0.00033309906011504635, "loss": 4.9951, "mean_token_accuracy": 0.22139669358730316, "num_tokens": 97890025.0, "step": 42750 }, { "entropy": 5.7380938053131105, "epoch": 4.226472914195334, "grad_norm": 1.2265625, "learning_rate": 0.00033306496621923385, "loss": 4.8855, "mean_token_accuracy": 0.23137569129467012, "num_tokens": 97901584.0, "step": 42755 }, { "entropy": 5.783602094650268, "epoch": 4.226967180703835, "grad_norm": 1.3515625, "learning_rate": 0.0003330308708950141, "loss": 4.8868, "mean_token_accuracy": 0.2366688385605812, "num_tokens": 97912264.0, "step": 42760 }, { "entropy": 5.81136736869812, "epoch": 4.227461447212337, "grad_norm": 1.2890625, "learning_rate": 0.000332996774143226, "loss": 4.9289, "mean_token_accuracy": 0.22855636477470398, "num_tokens": 97922971.0, "step": 42765 }, { "entropy": 5.775972032546997, "epoch": 4.227955713720839, "grad_norm": 1.2890625, "learning_rate": 0.0003329626759647082, "loss": 4.9137, "mean_token_accuracy": 0.23125038146972657, "num_tokens": 97934528.0, "step": 42770 }, { "entropy": 5.74899525642395, "epoch": 4.22844998022934, "grad_norm": 1.328125, "learning_rate": 0.0003329285763602996, "loss": 4.9645, "mean_token_accuracy": 0.23216992020606994, "num_tokens": 97947426.0, "step": 42775 }, { "entropy": 5.789149761199951, "epoch": 4.228944246737841, "grad_norm": 1.234375, "learning_rate": 0.000332894475330839, "loss": 4.9157, "mean_token_accuracy": 0.22987958043813705, "num_tokens": 97958675.0, "step": 42780 }, { "entropy": 5.756489324569702, "epoch": 4.229438513246342, "grad_norm": 1.3359375, "learning_rate": 0.00033286037287716543, "loss": 4.815, "mean_token_accuracy": 0.24156129360198975, "num_tokens": 97970100.0, "step": 42785 }, { "entropy": 5.812063837051392, "epoch": 4.229932779754844, "grad_norm": 1.328125, "learning_rate": 0.00033282626900011763, "loss": 4.9986, "mean_token_accuracy": 0.21871910840272904, "num_tokens": 97982265.0, "step": 42790 }, { "entropy": 5.743394136428833, "epoch": 4.230427046263345, "grad_norm": 1.3828125, "learning_rate": 0.0003327921637005346, "loss": 4.8615, "mean_token_accuracy": 0.23582167625427247, "num_tokens": 97993804.0, "step": 42795 }, { "entropy": 5.771084022521973, "epoch": 4.230921312771846, "grad_norm": 1.296875, "learning_rate": 0.0003327580569792554, "loss": 4.9483, "mean_token_accuracy": 0.2285108119249344, "num_tokens": 98005377.0, "step": 42800 }, { "entropy": 5.77469391822815, "epoch": 4.231415579280348, "grad_norm": 1.3671875, "learning_rate": 0.00033272394883711916, "loss": 4.9059, "mean_token_accuracy": 0.23201585114002227, "num_tokens": 98016492.0, "step": 42805 }, { "entropy": 5.746594762802124, "epoch": 4.2319098457888495, "grad_norm": 1.296875, "learning_rate": 0.0003326898392749647, "loss": 4.8984, "mean_token_accuracy": 0.2318544402718544, "num_tokens": 98027924.0, "step": 42810 }, { "entropy": 5.776256942749024, "epoch": 4.232404112297351, "grad_norm": 1.421875, "learning_rate": 0.00033265572829363125, "loss": 4.8876, "mean_token_accuracy": 0.23608448058366777, "num_tokens": 98039993.0, "step": 42815 }, { "entropy": 5.745669221878051, "epoch": 4.232898378805852, "grad_norm": 1.3203125, "learning_rate": 0.00033262161589395797, "loss": 4.8844, "mean_token_accuracy": 0.23217971324920655, "num_tokens": 98051292.0, "step": 42820 }, { "entropy": 5.783245038986206, "epoch": 4.233392645314353, "grad_norm": 1.2734375, "learning_rate": 0.00033258750207678403, "loss": 4.9699, "mean_token_accuracy": 0.22795554101467133, "num_tokens": 98063462.0, "step": 42825 }, { "entropy": 5.7545631408691404, "epoch": 4.233886911822855, "grad_norm": 1.1953125, "learning_rate": 0.00033255338684294854, "loss": 4.9163, "mean_token_accuracy": 0.23314686566591264, "num_tokens": 98074960.0, "step": 42830 }, { "entropy": 5.813656663894653, "epoch": 4.234381178331356, "grad_norm": 1.2578125, "learning_rate": 0.0003325192701932908, "loss": 4.9111, "mean_token_accuracy": 0.23063104450702668, "num_tokens": 98086266.0, "step": 42835 }, { "entropy": 5.841728353500367, "epoch": 4.234875444839858, "grad_norm": 1.359375, "learning_rate": 0.0003324851521286501, "loss": 4.9848, "mean_token_accuracy": 0.22389378100633622, "num_tokens": 98097276.0, "step": 42840 }, { "entropy": 5.839176750183105, "epoch": 4.235369711348359, "grad_norm": 1.28125, "learning_rate": 0.0003324510326498658, "loss": 4.9983, "mean_token_accuracy": 0.22117218971252442, "num_tokens": 98108462.0, "step": 42845 }, { "entropy": 5.751401424407959, "epoch": 4.2358639778568605, "grad_norm": 1.3515625, "learning_rate": 0.0003324169117577771, "loss": 4.9058, "mean_token_accuracy": 0.23278176188468933, "num_tokens": 98120384.0, "step": 42850 }, { "entropy": 5.788185119628906, "epoch": 4.236358244365362, "grad_norm": 1.3828125, "learning_rate": 0.0003323827894532236, "loss": 4.9395, "mean_token_accuracy": 0.23105270862579347, "num_tokens": 98132281.0, "step": 42855 }, { "entropy": 5.803438138961792, "epoch": 4.236852510873863, "grad_norm": 1.34375, "learning_rate": 0.00033234866573704443, "loss": 4.9636, "mean_token_accuracy": 0.2211210161447525, "num_tokens": 98142027.0, "step": 42860 }, { "entropy": 5.78488335609436, "epoch": 4.237346777382364, "grad_norm": 1.4296875, "learning_rate": 0.0003323145406100792, "loss": 4.9248, "mean_token_accuracy": 0.22945363372564315, "num_tokens": 98152452.0, "step": 42865 }, { "entropy": 5.777389812469482, "epoch": 4.237841043890866, "grad_norm": 1.296875, "learning_rate": 0.00033228041407316753, "loss": 4.9808, "mean_token_accuracy": 0.2221358373761177, "num_tokens": 98162968.0, "step": 42870 }, { "entropy": 5.761802005767822, "epoch": 4.238335310399368, "grad_norm": 1.296875, "learning_rate": 0.00033224628612714863, "loss": 4.8894, "mean_token_accuracy": 0.2369239702820778, "num_tokens": 98174768.0, "step": 42875 }, { "entropy": 5.850575256347656, "epoch": 4.238829576907869, "grad_norm": 1.328125, "learning_rate": 0.0003322121567728623, "loss": 5.0211, "mean_token_accuracy": 0.22095994800329208, "num_tokens": 98185602.0, "step": 42880 }, { "entropy": 5.750828886032105, "epoch": 4.23932384341637, "grad_norm": 1.4609375, "learning_rate": 0.000332178026011148, "loss": 4.8437, "mean_token_accuracy": 0.24256231188774108, "num_tokens": 98197142.0, "step": 42885 }, { "entropy": 5.785069274902344, "epoch": 4.2398181099248715, "grad_norm": 1.328125, "learning_rate": 0.00033214389384284536, "loss": 5.0271, "mean_token_accuracy": 0.2202734872698784, "num_tokens": 98209396.0, "step": 42890 }, { "entropy": 5.820632886886597, "epoch": 4.240312376433373, "grad_norm": 1.390625, "learning_rate": 0.0003321097602687941, "loss": 4.9619, "mean_token_accuracy": 0.2264051541686058, "num_tokens": 98221099.0, "step": 42895 }, { "entropy": 5.7308117866516115, "epoch": 4.240806642941874, "grad_norm": 1.25, "learning_rate": 0.0003320756252898339, "loss": 4.8704, "mean_token_accuracy": 0.2408662647008896, "num_tokens": 98232475.0, "step": 42900 }, { "entropy": 5.7716302394866945, "epoch": 4.241300909450375, "grad_norm": 1.171875, "learning_rate": 0.0003320414889068044, "loss": 4.9587, "mean_token_accuracy": 0.22904403507709503, "num_tokens": 98243819.0, "step": 42905 }, { "entropy": 5.845891618728638, "epoch": 4.2417951759588775, "grad_norm": 1.28125, "learning_rate": 0.0003320073511205454, "loss": 4.9841, "mean_token_accuracy": 0.22430334240198135, "num_tokens": 98254695.0, "step": 42910 }, { "entropy": 5.735282754898071, "epoch": 4.242289442467379, "grad_norm": 1.2578125, "learning_rate": 0.00033197321193189684, "loss": 4.8939, "mean_token_accuracy": 0.2293570414185524, "num_tokens": 98265882.0, "step": 42915 }, { "entropy": 5.726566505432129, "epoch": 4.24278370897588, "grad_norm": 1.2734375, "learning_rate": 0.0003319390713416984, "loss": 4.8842, "mean_token_accuracy": 0.23846326768398285, "num_tokens": 98277273.0, "step": 42920 }, { "entropy": 5.6971132278442385, "epoch": 4.243277975484381, "grad_norm": 1.453125, "learning_rate": 0.0003319049293507899, "loss": 4.8091, "mean_token_accuracy": 0.23734006583690642, "num_tokens": 98287197.0, "step": 42925 }, { "entropy": 5.799550628662109, "epoch": 4.2437722419928825, "grad_norm": 1.3515625, "learning_rate": 0.00033187078596001143, "loss": 4.9896, "mean_token_accuracy": 0.2240047961473465, "num_tokens": 98299264.0, "step": 42930 }, { "entropy": 5.767678451538086, "epoch": 4.244266508501384, "grad_norm": 1.2578125, "learning_rate": 0.00033183664117020266, "loss": 4.9042, "mean_token_accuracy": 0.22502769231796266, "num_tokens": 98310521.0, "step": 42935 }, { "entropy": 5.772043895721436, "epoch": 4.244760775009885, "grad_norm": 1.296875, "learning_rate": 0.0003318024949822038, "loss": 4.9917, "mean_token_accuracy": 0.227236770093441, "num_tokens": 98322806.0, "step": 42940 }, { "entropy": 5.810443687438965, "epoch": 4.245255041518386, "grad_norm": 1.2265625, "learning_rate": 0.0003317683473968547, "loss": 4.9357, "mean_token_accuracy": 0.22973594069480896, "num_tokens": 98334825.0, "step": 42945 }, { "entropy": 5.726431179046631, "epoch": 4.245749308026888, "grad_norm": 1.28125, "learning_rate": 0.00033173419841499546, "loss": 4.9873, "mean_token_accuracy": 0.22865829467773438, "num_tokens": 98346331.0, "step": 42950 }, { "entropy": 5.761148405075073, "epoch": 4.24624357453539, "grad_norm": 1.171875, "learning_rate": 0.00033170004803746613, "loss": 4.9299, "mean_token_accuracy": 0.23412587195634843, "num_tokens": 98357523.0, "step": 42955 }, { "entropy": 5.793221187591553, "epoch": 4.246737841043891, "grad_norm": 1.1875, "learning_rate": 0.00033166589626510676, "loss": 4.9303, "mean_token_accuracy": 0.2237307012081146, "num_tokens": 98368552.0, "step": 42960 }, { "entropy": 5.761098051071167, "epoch": 4.247232107552392, "grad_norm": 1.25, "learning_rate": 0.00033163174309875764, "loss": 4.9256, "mean_token_accuracy": 0.23658025711774827, "num_tokens": 98380473.0, "step": 42965 }, { "entropy": 5.735262060165406, "epoch": 4.2477263740608935, "grad_norm": 1.359375, "learning_rate": 0.0003315975885392589, "loss": 4.864, "mean_token_accuracy": 0.2377377927303314, "num_tokens": 98391018.0, "step": 42970 }, { "entropy": 5.798591232299804, "epoch": 4.248220640569395, "grad_norm": 1.390625, "learning_rate": 0.00033156343258745067, "loss": 5.0, "mean_token_accuracy": 0.22954386472702026, "num_tokens": 98403177.0, "step": 42975 }, { "entropy": 5.826274394989014, "epoch": 4.248714907077896, "grad_norm": 1.21875, "learning_rate": 0.0003315292752441731, "loss": 5.0078, "mean_token_accuracy": 0.23046029657125472, "num_tokens": 98415118.0, "step": 42980 }, { "entropy": 5.708406066894531, "epoch": 4.249209173586398, "grad_norm": 1.2734375, "learning_rate": 0.00033149511651026667, "loss": 4.8437, "mean_token_accuracy": 0.23663249462842942, "num_tokens": 98427951.0, "step": 42985 }, { "entropy": 5.794697618484497, "epoch": 4.249703440094899, "grad_norm": 1.3125, "learning_rate": 0.00033146095638657166, "loss": 4.9484, "mean_token_accuracy": 0.22799890041351317, "num_tokens": 98440935.0, "step": 42990 }, { "entropy": 5.732081270217895, "epoch": 4.250197706603401, "grad_norm": 1.3515625, "learning_rate": 0.0003314267948739283, "loss": 4.8723, "mean_token_accuracy": 0.23388630151748657, "num_tokens": 98452950.0, "step": 42995 }, { "entropy": 5.818053197860718, "epoch": 4.250691973111902, "grad_norm": 1.390625, "learning_rate": 0.00033139263197317704, "loss": 4.9618, "mean_token_accuracy": 0.22811376452445983, "num_tokens": 98463725.0, "step": 43000 }, { "entropy": 5.806340837478638, "epoch": 4.251186239620403, "grad_norm": 1.2890625, "learning_rate": 0.0003313584676851583, "loss": 4.9512, "mean_token_accuracy": 0.22498218715190887, "num_tokens": 98475244.0, "step": 43005 }, { "entropy": 5.765746593475342, "epoch": 4.2516805061289045, "grad_norm": 1.3671875, "learning_rate": 0.0003313243020107125, "loss": 4.917, "mean_token_accuracy": 0.22897647470235824, "num_tokens": 98485625.0, "step": 43010 }, { "entropy": 5.850155639648437, "epoch": 4.252174772637406, "grad_norm": 1.375, "learning_rate": 0.00033129013495068017, "loss": 5.0224, "mean_token_accuracy": 0.2202941969037056, "num_tokens": 98496572.0, "step": 43015 }, { "entropy": 5.816200828552246, "epoch": 4.252669039145908, "grad_norm": 1.234375, "learning_rate": 0.0003312559665059017, "loss": 5.0636, "mean_token_accuracy": 0.21866766065359117, "num_tokens": 98509460.0, "step": 43020 }, { "entropy": 5.778518295288086, "epoch": 4.253163305654409, "grad_norm": 1.234375, "learning_rate": 0.0003312217966772178, "loss": 4.9937, "mean_token_accuracy": 0.2309087783098221, "num_tokens": 98521415.0, "step": 43025 }, { "entropy": 5.783109045028686, "epoch": 4.25365757216291, "grad_norm": 1.4921875, "learning_rate": 0.00033118762546546895, "loss": 4.8591, "mean_token_accuracy": 0.2348336935043335, "num_tokens": 98532188.0, "step": 43030 }, { "entropy": 5.744780206680298, "epoch": 4.254151838671412, "grad_norm": 1.3515625, "learning_rate": 0.0003311534528714959, "loss": 4.9282, "mean_token_accuracy": 0.2324213445186615, "num_tokens": 98544112.0, "step": 43035 }, { "entropy": 5.783785820007324, "epoch": 4.254646105179913, "grad_norm": 1.328125, "learning_rate": 0.00033111927889613904, "loss": 4.8796, "mean_token_accuracy": 0.22901627719402312, "num_tokens": 98555054.0, "step": 43040 }, { "entropy": 5.7991087436676025, "epoch": 4.255140371688414, "grad_norm": 1.3984375, "learning_rate": 0.0003310851035402393, "loss": 4.9364, "mean_token_accuracy": 0.2239627331495285, "num_tokens": 98565956.0, "step": 43045 }, { "entropy": 5.799546718597412, "epoch": 4.2556346381969155, "grad_norm": 1.1796875, "learning_rate": 0.00033105092680463726, "loss": 4.9949, "mean_token_accuracy": 0.2288043513894081, "num_tokens": 98577976.0, "step": 43050 }, { "entropy": 5.787723207473755, "epoch": 4.256128904705417, "grad_norm": 1.2421875, "learning_rate": 0.00033101674869017377, "loss": 4.9573, "mean_token_accuracy": 0.22977009564638137, "num_tokens": 98589143.0, "step": 43055 }, { "entropy": 5.758676958084107, "epoch": 4.256623171213919, "grad_norm": 1.4765625, "learning_rate": 0.0003309825691976896, "loss": 4.9056, "mean_token_accuracy": 0.2288531944155693, "num_tokens": 98599323.0, "step": 43060 }, { "entropy": 5.771621370315552, "epoch": 4.25711743772242, "grad_norm": 1.265625, "learning_rate": 0.00033094838832802546, "loss": 5.0568, "mean_token_accuracy": 0.22085707485675812, "num_tokens": 98610869.0, "step": 43065 }, { "entropy": 5.811565256118774, "epoch": 4.257611704230921, "grad_norm": 1.3515625, "learning_rate": 0.00033091420608202235, "loss": 4.8738, "mean_token_accuracy": 0.23123203665018083, "num_tokens": 98622022.0, "step": 43070 }, { "entropy": 5.812743330001831, "epoch": 4.258105970739423, "grad_norm": 1.2109375, "learning_rate": 0.00033088002246052105, "loss": 4.9355, "mean_token_accuracy": 0.23160478323698044, "num_tokens": 98634110.0, "step": 43075 }, { "entropy": 5.7493304252624515, "epoch": 4.258600237247924, "grad_norm": 1.234375, "learning_rate": 0.0003308458374643626, "loss": 4.9542, "mean_token_accuracy": 0.23056052774190902, "num_tokens": 98645182.0, "step": 43080 }, { "entropy": 5.809789371490479, "epoch": 4.259094503756425, "grad_norm": 1.390625, "learning_rate": 0.0003308116510943878, "loss": 4.9846, "mean_token_accuracy": 0.22502518743276595, "num_tokens": 98655651.0, "step": 43085 }, { "entropy": 5.804376268386841, "epoch": 4.259588770264926, "grad_norm": 1.4296875, "learning_rate": 0.0003307774633514378, "loss": 4.9025, "mean_token_accuracy": 0.2311157241463661, "num_tokens": 98668191.0, "step": 43090 }, { "entropy": 5.741907215118408, "epoch": 4.260083036773429, "grad_norm": 1.3984375, "learning_rate": 0.00033074327423635356, "loss": 4.905, "mean_token_accuracy": 0.2314024716615677, "num_tokens": 98678479.0, "step": 43095 }, { "entropy": 5.728987789154052, "epoch": 4.26057730328193, "grad_norm": 1.3671875, "learning_rate": 0.00033070908374997597, "loss": 4.793, "mean_token_accuracy": 0.24201630204916, "num_tokens": 98688702.0, "step": 43100 }, { "entropy": 5.774787378311157, "epoch": 4.261071569790431, "grad_norm": 1.2578125, "learning_rate": 0.00033067489189314645, "loss": 4.9243, "mean_token_accuracy": 0.22774240970611573, "num_tokens": 98700131.0, "step": 43105 }, { "entropy": 5.763353157043457, "epoch": 4.261565836298932, "grad_norm": 1.3828125, "learning_rate": 0.0003306406986667059, "loss": 4.8973, "mean_token_accuracy": 0.22950106710195542, "num_tokens": 98711134.0, "step": 43110 }, { "entropy": 5.810732698440551, "epoch": 4.262060102807434, "grad_norm": 1.3203125, "learning_rate": 0.0003306065040714955, "loss": 4.9547, "mean_token_accuracy": 0.24042146205902098, "num_tokens": 98721892.0, "step": 43115 }, { "entropy": 5.698682832717895, "epoch": 4.262554369315935, "grad_norm": 1.1640625, "learning_rate": 0.0003305723081083565, "loss": 4.9539, "mean_token_accuracy": 0.2260197088122368, "num_tokens": 98734663.0, "step": 43120 }, { "entropy": 5.829581022262573, "epoch": 4.263048635824436, "grad_norm": 1.140625, "learning_rate": 0.0003305381107781301, "loss": 4.9285, "mean_token_accuracy": 0.22908418476581574, "num_tokens": 98746216.0, "step": 43125 }, { "entropy": 5.769526481628418, "epoch": 4.263542902332938, "grad_norm": 1.453125, "learning_rate": 0.00033050391208165755, "loss": 4.8267, "mean_token_accuracy": 0.22889414429664612, "num_tokens": 98756322.0, "step": 43130 }, { "entropy": 5.789292097091675, "epoch": 4.26403716884144, "grad_norm": 1.2890625, "learning_rate": 0.00033046971201978017, "loss": 5.0151, "mean_token_accuracy": 0.22542168945074081, "num_tokens": 98768256.0, "step": 43135 }, { "entropy": 5.804489612579346, "epoch": 4.264531435349941, "grad_norm": 1.2265625, "learning_rate": 0.0003304355105933393, "loss": 4.9662, "mean_token_accuracy": 0.2250652477145195, "num_tokens": 98780787.0, "step": 43140 }, { "entropy": 5.827536869049072, "epoch": 4.265025701858442, "grad_norm": 1.2890625, "learning_rate": 0.00033040130780317615, "loss": 4.9671, "mean_token_accuracy": 0.22966360598802565, "num_tokens": 98791965.0, "step": 43145 }, { "entropy": 5.790524244308472, "epoch": 4.265519968366943, "grad_norm": 1.34375, "learning_rate": 0.00033036710365013234, "loss": 4.9165, "mean_token_accuracy": 0.22805018872022628, "num_tokens": 98803087.0, "step": 43150 }, { "entropy": 5.822976922988891, "epoch": 4.266014234875445, "grad_norm": 1.2109375, "learning_rate": 0.00033033289813504916, "loss": 5.0361, "mean_token_accuracy": 0.22536057233810425, "num_tokens": 98814829.0, "step": 43155 }, { "entropy": 5.751730585098267, "epoch": 4.266508501383946, "grad_norm": 1.265625, "learning_rate": 0.0003302986912587681, "loss": 4.9275, "mean_token_accuracy": 0.22343873083591462, "num_tokens": 98826144.0, "step": 43160 }, { "entropy": 5.790082836151123, "epoch": 4.267002767892448, "grad_norm": 1.28125, "learning_rate": 0.0003302644830221307, "loss": 4.9702, "mean_token_accuracy": 0.22530618757009507, "num_tokens": 98836233.0, "step": 43165 }, { "entropy": 5.767870569229126, "epoch": 4.267497034400949, "grad_norm": 1.2734375, "learning_rate": 0.0003302302734259784, "loss": 4.9602, "mean_token_accuracy": 0.22929328829050064, "num_tokens": 98849011.0, "step": 43170 }, { "entropy": 5.781072092056275, "epoch": 4.267991300909451, "grad_norm": 1.3984375, "learning_rate": 0.00033019606247115276, "loss": 4.8902, "mean_token_accuracy": 0.23799516260623932, "num_tokens": 98859843.0, "step": 43175 }, { "entropy": 5.777816390991211, "epoch": 4.268485567417952, "grad_norm": 1.2265625, "learning_rate": 0.00033016185015849545, "loss": 4.9463, "mean_token_accuracy": 0.22494549602270125, "num_tokens": 98871261.0, "step": 43180 }, { "entropy": 5.746015787124634, "epoch": 4.268979833926453, "grad_norm": 1.3984375, "learning_rate": 0.00033012763648884806, "loss": 4.9529, "mean_token_accuracy": 0.232180655002594, "num_tokens": 98882046.0, "step": 43185 }, { "entropy": 5.761539268493652, "epoch": 4.269474100434954, "grad_norm": 1.2578125, "learning_rate": 0.00033009342146305234, "loss": 4.9591, "mean_token_accuracy": 0.2292468100786209, "num_tokens": 98894337.0, "step": 43190 }, { "entropy": 5.79749059677124, "epoch": 4.269968366943456, "grad_norm": 1.3515625, "learning_rate": 0.0003300592050819498, "loss": 4.9364, "mean_token_accuracy": 0.23068920522928238, "num_tokens": 98904766.0, "step": 43195 }, { "entropy": 5.74762806892395, "epoch": 4.270462633451958, "grad_norm": 1.1328125, "learning_rate": 0.00033002498734638233, "loss": 5.0142, "mean_token_accuracy": 0.22265869081020356, "num_tokens": 98917278.0, "step": 43200 }, { "entropy": 5.861811780929566, "epoch": 4.270956899960459, "grad_norm": 1.140625, "learning_rate": 0.00032999076825719165, "loss": 5.0422, "mean_token_accuracy": 0.2192737877368927, "num_tokens": 98930417.0, "step": 43205 }, { "entropy": 5.8522233963012695, "epoch": 4.27145116646896, "grad_norm": 1.265625, "learning_rate": 0.0003299565478152196, "loss": 4.9628, "mean_token_accuracy": 0.21862891018390657, "num_tokens": 98941105.0, "step": 43210 }, { "entropy": 5.7517982006073, "epoch": 4.2719454329774615, "grad_norm": 1.15625, "learning_rate": 0.0003299223260213078, "loss": 4.905, "mean_token_accuracy": 0.23683905452489853, "num_tokens": 98953178.0, "step": 43215 }, { "entropy": 5.774961376190186, "epoch": 4.272439699485963, "grad_norm": 1.34375, "learning_rate": 0.00032988810287629827, "loss": 4.9052, "mean_token_accuracy": 0.22653292268514633, "num_tokens": 98964394.0, "step": 43220 }, { "entropy": 5.854064702987671, "epoch": 4.272933965994464, "grad_norm": 1.2109375, "learning_rate": 0.00032985387838103296, "loss": 5.0056, "mean_token_accuracy": 0.22290830314159393, "num_tokens": 98975522.0, "step": 43225 }, { "entropy": 5.7996526718139645, "epoch": 4.273428232502965, "grad_norm": 1.3125, "learning_rate": 0.0003298196525363537, "loss": 4.8958, "mean_token_accuracy": 0.2281111881136894, "num_tokens": 98987965.0, "step": 43230 }, { "entropy": 5.7047285556793215, "epoch": 4.273922499011467, "grad_norm": 1.140625, "learning_rate": 0.0003297854253431025, "loss": 4.8676, "mean_token_accuracy": 0.2389364719390869, "num_tokens": 98999773.0, "step": 43235 }, { "entropy": 5.778940677642822, "epoch": 4.274416765519969, "grad_norm": 1.34375, "learning_rate": 0.0003297511968021214, "loss": 4.9155, "mean_token_accuracy": 0.22905998677015305, "num_tokens": 99010487.0, "step": 43240 }, { "entropy": 5.730114459991455, "epoch": 4.27491103202847, "grad_norm": 1.28125, "learning_rate": 0.00032971696691425225, "loss": 4.9464, "mean_token_accuracy": 0.2264096647500992, "num_tokens": 99021876.0, "step": 43245 }, { "entropy": 5.76324691772461, "epoch": 4.275405298536971, "grad_norm": 1.2578125, "learning_rate": 0.0003296827356803373, "loss": 4.903, "mean_token_accuracy": 0.2262290194630623, "num_tokens": 99032507.0, "step": 43250 }, { "entropy": 5.846307229995728, "epoch": 4.2758995650454725, "grad_norm": 1.3359375, "learning_rate": 0.0003296485031012186, "loss": 4.9781, "mean_token_accuracy": 0.22036830931901932, "num_tokens": 99043139.0, "step": 43255 }, { "entropy": 5.895349550247192, "epoch": 4.276393831553974, "grad_norm": 1.4296875, "learning_rate": 0.0003296142691777382, "loss": 5.0101, "mean_token_accuracy": 0.2225436344742775, "num_tokens": 99053966.0, "step": 43260 }, { "entropy": 5.8293062210083, "epoch": 4.276888098062475, "grad_norm": 1.265625, "learning_rate": 0.00032958003391073826, "loss": 5.0248, "mean_token_accuracy": 0.22121129631996156, "num_tokens": 99066118.0, "step": 43265 }, { "entropy": 5.710164356231689, "epoch": 4.277382364570976, "grad_norm": 1.21875, "learning_rate": 0.0003295457973010611, "loss": 4.8534, "mean_token_accuracy": 0.23426484018564225, "num_tokens": 99078898.0, "step": 43270 }, { "entropy": 5.792031192779541, "epoch": 4.2778766310794785, "grad_norm": 1.40625, "learning_rate": 0.00032951155934954877, "loss": 4.944, "mean_token_accuracy": 0.22990844398736954, "num_tokens": 99089816.0, "step": 43275 }, { "entropy": 5.811977434158325, "epoch": 4.27837089758798, "grad_norm": 1.3046875, "learning_rate": 0.0003294773200570437, "loss": 4.9355, "mean_token_accuracy": 0.23657287508249283, "num_tokens": 99101033.0, "step": 43280 }, { "entropy": 5.692740345001221, "epoch": 4.278865164096481, "grad_norm": 1.3515625, "learning_rate": 0.0003294430794243881, "loss": 4.8411, "mean_token_accuracy": 0.2332753837108612, "num_tokens": 99111706.0, "step": 43285 }, { "entropy": 5.717005014419556, "epoch": 4.279359430604982, "grad_norm": 1.15625, "learning_rate": 0.00032940883745242425, "loss": 4.8442, "mean_token_accuracy": 0.23728483468294143, "num_tokens": 99123461.0, "step": 43290 }, { "entropy": 5.765208148956299, "epoch": 4.2798536971134835, "grad_norm": 1.390625, "learning_rate": 0.0003293745941419946, "loss": 4.871, "mean_token_accuracy": 0.23692589700222016, "num_tokens": 99134309.0, "step": 43295 }, { "entropy": 5.7740672588348385, "epoch": 4.280347963621985, "grad_norm": 1.453125, "learning_rate": 0.0003293403494939415, "loss": 4.9485, "mean_token_accuracy": 0.2295371860265732, "num_tokens": 99145416.0, "step": 43300 }, { "entropy": 5.748534917831421, "epoch": 4.280842230130486, "grad_norm": 1.3046875, "learning_rate": 0.00032930610350910734, "loss": 4.9294, "mean_token_accuracy": 0.23051405549049378, "num_tokens": 99157004.0, "step": 43305 }, { "entropy": 5.820102214813232, "epoch": 4.281336496638987, "grad_norm": 1.3203125, "learning_rate": 0.0003292718561883346, "loss": 4.9008, "mean_token_accuracy": 0.23587457686662675, "num_tokens": 99168563.0, "step": 43310 }, { "entropy": 5.821598196029663, "epoch": 4.2818307631474894, "grad_norm": 1.234375, "learning_rate": 0.0003292376075324658, "loss": 4.914, "mean_token_accuracy": 0.2315291255712509, "num_tokens": 99180522.0, "step": 43315 }, { "entropy": 5.738863325119018, "epoch": 4.282325029655991, "grad_norm": 1.3515625, "learning_rate": 0.00032920335754234347, "loss": 4.9269, "mean_token_accuracy": 0.22914780378341676, "num_tokens": 99192487.0, "step": 43320 }, { "entropy": 5.71196665763855, "epoch": 4.282819296164492, "grad_norm": 1.3359375, "learning_rate": 0.00032916910621881015, "loss": 4.8969, "mean_token_accuracy": 0.23040175139904023, "num_tokens": 99203808.0, "step": 43325 }, { "entropy": 5.773679208755493, "epoch": 4.283313562672993, "grad_norm": 1.2265625, "learning_rate": 0.00032913485356270833, "loss": 4.9558, "mean_token_accuracy": 0.22506097406148912, "num_tokens": 99216459.0, "step": 43330 }, { "entropy": 5.750085973739624, "epoch": 4.2838078291814945, "grad_norm": 1.28125, "learning_rate": 0.00032910059957488077, "loss": 4.8843, "mean_token_accuracy": 0.23416091352701188, "num_tokens": 99227244.0, "step": 43335 }, { "entropy": 5.813915681838989, "epoch": 4.284302095689996, "grad_norm": 1.296875, "learning_rate": 0.0003290663442561701, "loss": 4.9569, "mean_token_accuracy": 0.22644461691379547, "num_tokens": 99239034.0, "step": 43340 }, { "entropy": 5.737202739715576, "epoch": 4.284796362198497, "grad_norm": 1.3359375, "learning_rate": 0.00032903208760741887, "loss": 4.904, "mean_token_accuracy": 0.23592038899660112, "num_tokens": 99250466.0, "step": 43345 }, { "entropy": 5.775089406967163, "epoch": 4.285290628706999, "grad_norm": 1.265625, "learning_rate": 0.00032899782962947, "loss": 4.9546, "mean_token_accuracy": 0.22616446167230606, "num_tokens": 99261720.0, "step": 43350 }, { "entropy": 5.838986730575561, "epoch": 4.2857848952155, "grad_norm": 1.2578125, "learning_rate": 0.0003289635703231662, "loss": 4.9506, "mean_token_accuracy": 0.2297082930803299, "num_tokens": 99272597.0, "step": 43355 }, { "entropy": 5.7523571968078615, "epoch": 4.286279161724002, "grad_norm": 1.3125, "learning_rate": 0.00032892930968934995, "loss": 4.9109, "mean_token_accuracy": 0.2346217229962349, "num_tokens": 99284941.0, "step": 43360 }, { "entropy": 5.80360050201416, "epoch": 4.286773428232503, "grad_norm": 1.34375, "learning_rate": 0.00032889504772886454, "loss": 4.964, "mean_token_accuracy": 0.22827168405056, "num_tokens": 99296096.0, "step": 43365 }, { "entropy": 5.736228561401367, "epoch": 4.287267694741004, "grad_norm": 1.4609375, "learning_rate": 0.0003288607844425526, "loss": 4.8913, "mean_token_accuracy": 0.23487668484449387, "num_tokens": 99307779.0, "step": 43370 }, { "entropy": 5.818888425827026, "epoch": 4.2877619612495055, "grad_norm": 1.2578125, "learning_rate": 0.0003288265198312568, "loss": 5.0094, "mean_token_accuracy": 0.22803349643945695, "num_tokens": 99319179.0, "step": 43375 }, { "entropy": 5.8140768051147464, "epoch": 4.288256227758007, "grad_norm": 1.203125, "learning_rate": 0.0003287922538958205, "loss": 5.0082, "mean_token_accuracy": 0.21821558922529222, "num_tokens": 99331706.0, "step": 43380 }, { "entropy": 5.822761917114258, "epoch": 4.288750494266509, "grad_norm": 1.3671875, "learning_rate": 0.00032875798663708626, "loss": 5.0124, "mean_token_accuracy": 0.22471252530813218, "num_tokens": 99343527.0, "step": 43385 }, { "entropy": 5.760383033752442, "epoch": 4.28924476077501, "grad_norm": 1.3359375, "learning_rate": 0.00032872371805589724, "loss": 4.9695, "mean_token_accuracy": 0.2258553609251976, "num_tokens": 99354593.0, "step": 43390 }, { "entropy": 5.788660764694214, "epoch": 4.289739027283511, "grad_norm": 1.1484375, "learning_rate": 0.0003286894481530964, "loss": 4.9963, "mean_token_accuracy": 0.22517401576042176, "num_tokens": 99367204.0, "step": 43395 }, { "entropy": 5.79248080253601, "epoch": 4.290233293792013, "grad_norm": 1.2421875, "learning_rate": 0.0003286551769295269, "loss": 4.9139, "mean_token_accuracy": 0.23274416476488113, "num_tokens": 99377846.0, "step": 43400 }, { "entropy": 5.795986175537109, "epoch": 4.290727560300514, "grad_norm": 1.3828125, "learning_rate": 0.0003286209043860317, "loss": 5.0161, "mean_token_accuracy": 0.21947432905435563, "num_tokens": 99388894.0, "step": 43405 }, { "entropy": 5.756523704528808, "epoch": 4.291221826809015, "grad_norm": 1.4140625, "learning_rate": 0.0003285866305234539, "loss": 4.9194, "mean_token_accuracy": 0.23076125234365463, "num_tokens": 99399666.0, "step": 43410 }, { "entropy": 5.799577617645264, "epoch": 4.2917160933175165, "grad_norm": 1.1484375, "learning_rate": 0.0003285523553426367, "loss": 4.8756, "mean_token_accuracy": 0.22879491299390792, "num_tokens": 99412390.0, "step": 43415 }, { "entropy": 5.785652446746826, "epoch": 4.292210359826019, "grad_norm": 1.421875, "learning_rate": 0.0003285180788444232, "loss": 4.9478, "mean_token_accuracy": 0.2291867330670357, "num_tokens": 99424572.0, "step": 43420 }, { "entropy": 5.804775905609131, "epoch": 4.29270462633452, "grad_norm": 1.2109375, "learning_rate": 0.0003284838010296567, "loss": 5.0151, "mean_token_accuracy": 0.22339471131563188, "num_tokens": 99436911.0, "step": 43425 }, { "entropy": 5.8251588344573975, "epoch": 4.293198892843021, "grad_norm": 1.1484375, "learning_rate": 0.0003284495218991803, "loss": 4.9582, "mean_token_accuracy": 0.22570926696062088, "num_tokens": 99448259.0, "step": 43430 }, { "entropy": 5.819349527359009, "epoch": 4.293693159351522, "grad_norm": 1.34375, "learning_rate": 0.0003284152414538374, "loss": 4.9485, "mean_token_accuracy": 0.232858307659626, "num_tokens": 99459807.0, "step": 43435 }, { "entropy": 5.841078901290894, "epoch": 4.294187425860024, "grad_norm": 1.3671875, "learning_rate": 0.00032838095969447143, "loss": 5.0083, "mean_token_accuracy": 0.2254486247897148, "num_tokens": 99471204.0, "step": 43440 }, { "entropy": 5.790413665771484, "epoch": 4.294681692368525, "grad_norm": 1.25, "learning_rate": 0.00032834667662192546, "loss": 4.9805, "mean_token_accuracy": 0.23049046844244003, "num_tokens": 99483906.0, "step": 43445 }, { "entropy": 5.750399208068847, "epoch": 4.295175958877026, "grad_norm": 1.21875, "learning_rate": 0.000328312392237043, "loss": 4.8427, "mean_token_accuracy": 0.23797794431447983, "num_tokens": 99494088.0, "step": 43450 }, { "entropy": 5.751242780685425, "epoch": 4.295670225385528, "grad_norm": 1.3203125, "learning_rate": 0.0003282781065406674, "loss": 4.9267, "mean_token_accuracy": 0.2288760870695114, "num_tokens": 99504398.0, "step": 43455 }, { "entropy": 5.7648131370544435, "epoch": 4.29616449189403, "grad_norm": 1.2265625, "learning_rate": 0.00032824381953364205, "loss": 4.9458, "mean_token_accuracy": 0.22770990580320358, "num_tokens": 99515574.0, "step": 43460 }, { "entropy": 5.742452716827392, "epoch": 4.296658758402531, "grad_norm": 1.15625, "learning_rate": 0.0003282095312168106, "loss": 4.8772, "mean_token_accuracy": 0.23198122382164002, "num_tokens": 99528322.0, "step": 43465 }, { "entropy": 5.754184436798096, "epoch": 4.297153024911032, "grad_norm": 1.3046875, "learning_rate": 0.00032817524159101634, "loss": 4.8988, "mean_token_accuracy": 0.23320045620203017, "num_tokens": 99539202.0, "step": 43470 }, { "entropy": 5.770015811920166, "epoch": 4.297647291419533, "grad_norm": 1.28125, "learning_rate": 0.0003281409506571029, "loss": 4.9794, "mean_token_accuracy": 0.22583311051130295, "num_tokens": 99552190.0, "step": 43475 }, { "entropy": 5.797441911697388, "epoch": 4.298141557928035, "grad_norm": 1.2734375, "learning_rate": 0.0003281066584159138, "loss": 4.9969, "mean_token_accuracy": 0.22186241596937178, "num_tokens": 99564125.0, "step": 43480 }, { "entropy": 5.815305423736572, "epoch": 4.298635824436536, "grad_norm": 1.3515625, "learning_rate": 0.00032807236486829275, "loss": 4.9229, "mean_token_accuracy": 0.2317344442009926, "num_tokens": 99575607.0, "step": 43485 }, { "entropy": 5.8023299217224125, "epoch": 4.299130090945037, "grad_norm": 1.34375, "learning_rate": 0.00032803807001508326, "loss": 4.9974, "mean_token_accuracy": 0.22914122343063353, "num_tokens": 99587054.0, "step": 43490 }, { "entropy": 5.81861138343811, "epoch": 4.299624357453539, "grad_norm": 1.2578125, "learning_rate": 0.000328003773857129, "loss": 4.9609, "mean_token_accuracy": 0.22524659782648088, "num_tokens": 99598839.0, "step": 43495 }, { "entropy": 5.73095383644104, "epoch": 4.300118623962041, "grad_norm": 1.515625, "learning_rate": 0.00032796947639527366, "loss": 4.875, "mean_token_accuracy": 0.24024249464273453, "num_tokens": 99609953.0, "step": 43500 }, { "entropy": 5.679924631118775, "epoch": 4.300612890470542, "grad_norm": 1.3984375, "learning_rate": 0.000327935177630361, "loss": 4.8477, "mean_token_accuracy": 0.23327869325876235, "num_tokens": 99620916.0, "step": 43505 }, { "entropy": 5.761402654647827, "epoch": 4.301107156979043, "grad_norm": 1.34375, "learning_rate": 0.00032790087756323476, "loss": 4.9493, "mean_token_accuracy": 0.22225290089845656, "num_tokens": 99632615.0, "step": 43510 }, { "entropy": 5.858375167846679, "epoch": 4.301601423487544, "grad_norm": 1.40625, "learning_rate": 0.00032786657619473874, "loss": 4.9329, "mean_token_accuracy": 0.23221989274024962, "num_tokens": 99643140.0, "step": 43515 }, { "entropy": 5.761956405639649, "epoch": 4.302095689996046, "grad_norm": 1.2265625, "learning_rate": 0.0003278322735257167, "loss": 4.9369, "mean_token_accuracy": 0.22405422180891038, "num_tokens": 99654514.0, "step": 43520 }, { "entropy": 5.807722663879394, "epoch": 4.302589956504547, "grad_norm": 1.3359375, "learning_rate": 0.0003277979695570126, "loss": 4.9919, "mean_token_accuracy": 0.22425485998392106, "num_tokens": 99666168.0, "step": 43525 }, { "entropy": 5.789457225799561, "epoch": 4.303084223013049, "grad_norm": 1.390625, "learning_rate": 0.00032776366428947023, "loss": 4.9288, "mean_token_accuracy": 0.22506711930036544, "num_tokens": 99677911.0, "step": 43530 }, { "entropy": 5.778418684005738, "epoch": 4.30357848952155, "grad_norm": 1.3125, "learning_rate": 0.00032772935772393356, "loss": 4.906, "mean_token_accuracy": 0.2303909331560135, "num_tokens": 99688805.0, "step": 43535 }, { "entropy": 5.787128353118897, "epoch": 4.304072756030052, "grad_norm": 1.296875, "learning_rate": 0.0003276950498612465, "loss": 4.9629, "mean_token_accuracy": 0.22370685487985612, "num_tokens": 99699613.0, "step": 43540 }, { "entropy": 5.7627091884613035, "epoch": 4.304567022538553, "grad_norm": 1.3515625, "learning_rate": 0.00032766074070225297, "loss": 4.9225, "mean_token_accuracy": 0.2237701639533043, "num_tokens": 99709687.0, "step": 43545 }, { "entropy": 5.75416898727417, "epoch": 4.305061289047054, "grad_norm": 1.3125, "learning_rate": 0.0003276264302477971, "loss": 4.9235, "mean_token_accuracy": 0.23285234570503235, "num_tokens": 99721105.0, "step": 43550 }, { "entropy": 5.74481315612793, "epoch": 4.305555555555555, "grad_norm": 1.265625, "learning_rate": 0.0003275921184987229, "loss": 4.9252, "mean_token_accuracy": 0.2334502950310707, "num_tokens": 99732979.0, "step": 43555 }, { "entropy": 5.7675505638122555, "epoch": 4.306049822064057, "grad_norm": 1.234375, "learning_rate": 0.00032755780545587444, "loss": 4.8915, "mean_token_accuracy": 0.22913219034671783, "num_tokens": 99743964.0, "step": 43560 }, { "entropy": 5.77692437171936, "epoch": 4.306544088572558, "grad_norm": 1.234375, "learning_rate": 0.0003275234911200958, "loss": 4.9183, "mean_token_accuracy": 0.23403078615665435, "num_tokens": 99755313.0, "step": 43565 }, { "entropy": 5.817244052886963, "epoch": 4.30703835508106, "grad_norm": 1.40625, "learning_rate": 0.00032748917549223113, "loss": 4.8889, "mean_token_accuracy": 0.23346937596797943, "num_tokens": 99765807.0, "step": 43570 }, { "entropy": 5.876787328720093, "epoch": 4.307532621589561, "grad_norm": 1.2109375, "learning_rate": 0.0003274548585731245, "loss": 5.0171, "mean_token_accuracy": 0.21789332032203673, "num_tokens": 99777167.0, "step": 43575 }, { "entropy": 5.763022136688233, "epoch": 4.308026888098063, "grad_norm": 1.3203125, "learning_rate": 0.0003274205403636203, "loss": 4.9218, "mean_token_accuracy": 0.2234768182039261, "num_tokens": 99787022.0, "step": 43580 }, { "entropy": 5.838502597808838, "epoch": 4.308521154606564, "grad_norm": 1.5546875, "learning_rate": 0.0003273862208645627, "loss": 5.0444, "mean_token_accuracy": 0.21600334644317626, "num_tokens": 99798498.0, "step": 43585 }, { "entropy": 5.760817813873291, "epoch": 4.309015421115065, "grad_norm": 1.453125, "learning_rate": 0.0003273519000767959, "loss": 4.9615, "mean_token_accuracy": 0.23053132891654968, "num_tokens": 99808462.0, "step": 43590 }, { "entropy": 5.831525278091431, "epoch": 4.309509687623566, "grad_norm": 1.3046875, "learning_rate": 0.00032731757800116417, "loss": 5.0252, "mean_token_accuracy": 0.21893076598644257, "num_tokens": 99820403.0, "step": 43595 }, { "entropy": 5.656565856933594, "epoch": 4.310003954132068, "grad_norm": 1.203125, "learning_rate": 0.000327283254638512, "loss": 4.8039, "mean_token_accuracy": 0.24927282631397246, "num_tokens": 99831802.0, "step": 43600 }, { "entropy": 5.759474897384644, "epoch": 4.31049822064057, "grad_norm": 1.265625, "learning_rate": 0.0003272489299896837, "loss": 4.8698, "mean_token_accuracy": 0.23000855296850203, "num_tokens": 99844433.0, "step": 43605 }, { "entropy": 5.809208154678345, "epoch": 4.310992487149071, "grad_norm": 1.1875, "learning_rate": 0.0003272146040555235, "loss": 4.9667, "mean_token_accuracy": 0.2286195531487465, "num_tokens": 99856425.0, "step": 43610 }, { "entropy": 5.792343950271606, "epoch": 4.311486753657572, "grad_norm": 1.3671875, "learning_rate": 0.000327180276836876, "loss": 5.0061, "mean_token_accuracy": 0.22227270603179933, "num_tokens": 99868091.0, "step": 43615 }, { "entropy": 5.686750316619873, "epoch": 4.3119810201660735, "grad_norm": 1.3515625, "learning_rate": 0.00032714594833458554, "loss": 4.8799, "mean_token_accuracy": 0.23801347017288207, "num_tokens": 99880118.0, "step": 43620 }, { "entropy": 5.817808675765991, "epoch": 4.312475286674575, "grad_norm": 1.3046875, "learning_rate": 0.00032711161854949666, "loss": 4.9964, "mean_token_accuracy": 0.21977361142635346, "num_tokens": 99891397.0, "step": 43625 }, { "entropy": 5.803943538665772, "epoch": 4.312969553183076, "grad_norm": 1.1875, "learning_rate": 0.00032707728748245397, "loss": 4.9097, "mean_token_accuracy": 0.23356318473815918, "num_tokens": 99903184.0, "step": 43630 }, { "entropy": 5.813151693344116, "epoch": 4.313463819691577, "grad_norm": 1.328125, "learning_rate": 0.0003270429551343019, "loss": 4.9793, "mean_token_accuracy": 0.22186863273382187, "num_tokens": 99913946.0, "step": 43635 }, { "entropy": 5.736412000656128, "epoch": 4.3139580862000795, "grad_norm": 1.390625, "learning_rate": 0.00032700862150588506, "loss": 4.8827, "mean_token_accuracy": 0.23413027226924896, "num_tokens": 99925367.0, "step": 43640 }, { "entropy": 5.740288305282593, "epoch": 4.314452352708581, "grad_norm": 1.421875, "learning_rate": 0.00032697428659804803, "loss": 4.9177, "mean_token_accuracy": 0.22883841395378113, "num_tokens": 99937605.0, "step": 43645 }, { "entropy": 5.802655982971191, "epoch": 4.314946619217082, "grad_norm": 1.3515625, "learning_rate": 0.0003269399504116355, "loss": 4.9881, "mean_token_accuracy": 0.22271736562252045, "num_tokens": 99948508.0, "step": 43650 }, { "entropy": 5.82040581703186, "epoch": 4.315440885725583, "grad_norm": 1.3515625, "learning_rate": 0.0003269056129474921, "loss": 4.9625, "mean_token_accuracy": 0.22900949716567992, "num_tokens": 99959436.0, "step": 43655 }, { "entropy": 5.795877313613891, "epoch": 4.3159351522340845, "grad_norm": 1.34375, "learning_rate": 0.0003268712742064626, "loss": 4.9415, "mean_token_accuracy": 0.22824318706989288, "num_tokens": 99970164.0, "step": 43660 }, { "entropy": 5.783881330490113, "epoch": 4.316429418742586, "grad_norm": 1.296875, "learning_rate": 0.00032683693418939175, "loss": 4.9454, "mean_token_accuracy": 0.2307812362909317, "num_tokens": 99982571.0, "step": 43665 }, { "entropy": 5.6900654315948485, "epoch": 4.316923685251087, "grad_norm": 1.3359375, "learning_rate": 0.00032680259289712414, "loss": 4.8306, "mean_token_accuracy": 0.2340555027127266, "num_tokens": 99994482.0, "step": 43670 }, { "entropy": 5.8299415588378904, "epoch": 4.317417951759589, "grad_norm": 1.2109375, "learning_rate": 0.0003267682503305049, "loss": 4.9755, "mean_token_accuracy": 0.22461063265800477, "num_tokens": 100006962.0, "step": 43675 }, { "entropy": 5.842651653289795, "epoch": 4.3179122182680905, "grad_norm": 1.3046875, "learning_rate": 0.00032673390649037853, "loss": 5.0373, "mean_token_accuracy": 0.22794072926044465, "num_tokens": 100018804.0, "step": 43680 }, { "entropy": 5.7152337551116945, "epoch": 4.318406484776592, "grad_norm": 1.3515625, "learning_rate": 0.0003266995613775901, "loss": 4.8864, "mean_token_accuracy": 0.23669615387916565, "num_tokens": 100029876.0, "step": 43685 }, { "entropy": 5.820630073547363, "epoch": 4.318900751285093, "grad_norm": 1.1640625, "learning_rate": 0.0003266652149929844, "loss": 4.9643, "mean_token_accuracy": 0.22326465398073198, "num_tokens": 100042368.0, "step": 43690 }, { "entropy": 5.846385860443116, "epoch": 4.319395017793594, "grad_norm": 1.3203125, "learning_rate": 0.00032663086733740644, "loss": 5.0422, "mean_token_accuracy": 0.22350607812404633, "num_tokens": 100054800.0, "step": 43695 }, { "entropy": 5.720472288131714, "epoch": 4.3198892843020955, "grad_norm": 1.25, "learning_rate": 0.0003265965184117011, "loss": 4.9138, "mean_token_accuracy": 0.2326551765203476, "num_tokens": 100067480.0, "step": 43700 }, { "entropy": 5.7658435821533205, "epoch": 4.320383550810597, "grad_norm": 1.2109375, "learning_rate": 0.0003265621682167135, "loss": 4.9783, "mean_token_accuracy": 0.23047412633895875, "num_tokens": 100080414.0, "step": 43705 }, { "entropy": 5.892251300811767, "epoch": 4.320877817319099, "grad_norm": 1.2734375, "learning_rate": 0.0003265278167532884, "loss": 4.9955, "mean_token_accuracy": 0.22642307579517365, "num_tokens": 100090909.0, "step": 43710 }, { "entropy": 5.76643648147583, "epoch": 4.3213720838276, "grad_norm": 1.296875, "learning_rate": 0.0003264934640222711, "loss": 4.9051, "mean_token_accuracy": 0.22523427605628968, "num_tokens": 100101892.0, "step": 43715 }, { "entropy": 5.801924562454223, "epoch": 4.3218663503361014, "grad_norm": 1.1875, "learning_rate": 0.0003264591100245066, "loss": 4.9646, "mean_token_accuracy": 0.22455812394618987, "num_tokens": 100115158.0, "step": 43720 }, { "entropy": 5.7676451206207275, "epoch": 4.322360616844603, "grad_norm": 1.328125, "learning_rate": 0.00032642475476084, "loss": 4.8877, "mean_token_accuracy": 0.23035601824522017, "num_tokens": 100125732.0, "step": 43725 }, { "entropy": 5.742232990264893, "epoch": 4.322854883353104, "grad_norm": 1.203125, "learning_rate": 0.0003263903982321164, "loss": 4.8897, "mean_token_accuracy": 0.23454792499542237, "num_tokens": 100138500.0, "step": 43730 }, { "entropy": 5.774654197692871, "epoch": 4.323349149861605, "grad_norm": 1.1328125, "learning_rate": 0.0003263560404391811, "loss": 4.9508, "mean_token_accuracy": 0.23044732809066773, "num_tokens": 100151320.0, "step": 43735 }, { "entropy": 5.753339147567749, "epoch": 4.3238434163701065, "grad_norm": 1.2421875, "learning_rate": 0.00032632168138287923, "loss": 4.914, "mean_token_accuracy": 0.2280087113380432, "num_tokens": 100161839.0, "step": 43740 }, { "entropy": 5.792183065414429, "epoch": 4.324337682878608, "grad_norm": 1.2265625, "learning_rate": 0.000326287321064056, "loss": 4.9712, "mean_token_accuracy": 0.22993913441896438, "num_tokens": 100174077.0, "step": 43745 }, { "entropy": 5.78464412689209, "epoch": 4.32483194938711, "grad_norm": 1.34375, "learning_rate": 0.00032625295948355675, "loss": 4.9604, "mean_token_accuracy": 0.23379905223846437, "num_tokens": 100186971.0, "step": 43750 }, { "entropy": 5.803415250778198, "epoch": 4.325326215895611, "grad_norm": 1.2421875, "learning_rate": 0.00032621859664222675, "loss": 4.8946, "mean_token_accuracy": 0.2362338125705719, "num_tokens": 100198976.0, "step": 43755 }, { "entropy": 5.79419355392456, "epoch": 4.325820482404112, "grad_norm": 1.28125, "learning_rate": 0.00032618423254091136, "loss": 4.9206, "mean_token_accuracy": 0.2339049234986305, "num_tokens": 100210052.0, "step": 43760 }, { "entropy": 5.803069257736206, "epoch": 4.326314748912614, "grad_norm": 1.359375, "learning_rate": 0.00032614986718045583, "loss": 4.992, "mean_token_accuracy": 0.22524020075798035, "num_tokens": 100221360.0, "step": 43765 }, { "entropy": 5.709546613693237, "epoch": 4.326809015421115, "grad_norm": 1.3046875, "learning_rate": 0.0003261155005617056, "loss": 4.8772, "mean_token_accuracy": 0.23937513530254365, "num_tokens": 100232746.0, "step": 43770 }, { "entropy": 5.77418007850647, "epoch": 4.327303281929616, "grad_norm": 1.34375, "learning_rate": 0.0003260811326855063, "loss": 4.8729, "mean_token_accuracy": 0.22601770758628845, "num_tokens": 100243604.0, "step": 43775 }, { "entropy": 5.732131624221802, "epoch": 4.3277975484381175, "grad_norm": 1.2734375, "learning_rate": 0.0003260467635527031, "loss": 4.8521, "mean_token_accuracy": 0.24189838171005248, "num_tokens": 100255139.0, "step": 43780 }, { "entropy": 5.829389476776123, "epoch": 4.32829181494662, "grad_norm": 1.140625, "learning_rate": 0.00032601239316414147, "loss": 4.998, "mean_token_accuracy": 0.2263636514544487, "num_tokens": 100266925.0, "step": 43785 }, { "entropy": 5.852699184417725, "epoch": 4.328786081455121, "grad_norm": 1.3671875, "learning_rate": 0.00032597802152066724, "loss": 4.9719, "mean_token_accuracy": 0.22343516796827317, "num_tokens": 100277237.0, "step": 43790 }, { "entropy": 5.730988311767578, "epoch": 4.329280347963622, "grad_norm": 1.3203125, "learning_rate": 0.0003259436486231257, "loss": 4.9022, "mean_token_accuracy": 0.24145944118499757, "num_tokens": 100289212.0, "step": 43795 }, { "entropy": 5.769581937789917, "epoch": 4.329774614472123, "grad_norm": 1.359375, "learning_rate": 0.0003259092744723625, "loss": 4.9579, "mean_token_accuracy": 0.22664784640073776, "num_tokens": 100300749.0, "step": 43800 }, { "entropy": 5.813533639907837, "epoch": 4.330268880980625, "grad_norm": 1.359375, "learning_rate": 0.00032587489906922334, "loss": 4.8888, "mean_token_accuracy": 0.23205453306436538, "num_tokens": 100309895.0, "step": 43805 }, { "entropy": 5.784304761886597, "epoch": 4.330763147489126, "grad_norm": 1.328125, "learning_rate": 0.00032584052241455366, "loss": 4.9018, "mean_token_accuracy": 0.22921976447105408, "num_tokens": 100321639.0, "step": 43810 }, { "entropy": 5.75391321182251, "epoch": 4.331257413997627, "grad_norm": 1.2734375, "learning_rate": 0.00032580614450919925, "loss": 4.9558, "mean_token_accuracy": 0.2304617941379547, "num_tokens": 100334461.0, "step": 43815 }, { "entropy": 5.787412214279175, "epoch": 4.3317516805061285, "grad_norm": 1.2890625, "learning_rate": 0.0003257717653540059, "loss": 4.9698, "mean_token_accuracy": 0.22787330597639083, "num_tokens": 100345404.0, "step": 43820 }, { "entropy": 5.7872556209564205, "epoch": 4.332245947014631, "grad_norm": 1.359375, "learning_rate": 0.00032573738494981913, "loss": 4.9293, "mean_token_accuracy": 0.22544123679399491, "num_tokens": 100356229.0, "step": 43825 }, { "entropy": 5.803913974761963, "epoch": 4.332740213523132, "grad_norm": 1.203125, "learning_rate": 0.00032570300329748495, "loss": 4.9618, "mean_token_accuracy": 0.231622114777565, "num_tokens": 100367965.0, "step": 43830 }, { "entropy": 5.815386772155762, "epoch": 4.333234480031633, "grad_norm": 1.3359375, "learning_rate": 0.00032566862039784886, "loss": 4.9644, "mean_token_accuracy": 0.2266029089689255, "num_tokens": 100380435.0, "step": 43835 }, { "entropy": 5.71528058052063, "epoch": 4.333728746540134, "grad_norm": 1.359375, "learning_rate": 0.0003256342362517569, "loss": 4.8555, "mean_token_accuracy": 0.23829855024814606, "num_tokens": 100391811.0, "step": 43840 }, { "entropy": 5.743194532394409, "epoch": 4.334223013048636, "grad_norm": 1.3046875, "learning_rate": 0.0003255998508600549, "loss": 4.9916, "mean_token_accuracy": 0.2225760981440544, "num_tokens": 100403124.0, "step": 43845 }, { "entropy": 5.8112959384918215, "epoch": 4.334717279557137, "grad_norm": 1.2109375, "learning_rate": 0.0003255654642235888, "loss": 4.9625, "mean_token_accuracy": 0.22332628071308136, "num_tokens": 100416047.0, "step": 43850 }, { "entropy": 5.815351390838623, "epoch": 4.335211546065638, "grad_norm": 1.1953125, "learning_rate": 0.0003255310763432043, "loss": 4.9264, "mean_token_accuracy": 0.22594129741191865, "num_tokens": 100427730.0, "step": 43855 }, { "entropy": 5.805792903900146, "epoch": 4.33570581257414, "grad_norm": 1.390625, "learning_rate": 0.0003254966872197475, "loss": 4.9689, "mean_token_accuracy": 0.2294496178627014, "num_tokens": 100439108.0, "step": 43860 }, { "entropy": 5.819001340866089, "epoch": 4.336200079082642, "grad_norm": 1.3203125, "learning_rate": 0.0003254622968540645, "loss": 4.9485, "mean_token_accuracy": 0.23153590112924577, "num_tokens": 100451240.0, "step": 43865 }, { "entropy": 5.820013570785522, "epoch": 4.336694345591143, "grad_norm": 1.328125, "learning_rate": 0.000325427905247001, "loss": 4.9538, "mean_token_accuracy": 0.23107928931713104, "num_tokens": 100462875.0, "step": 43870 }, { "entropy": 5.77145562171936, "epoch": 4.337188612099644, "grad_norm": 1.34375, "learning_rate": 0.0003253935123994033, "loss": 4.872, "mean_token_accuracy": 0.24394679814577103, "num_tokens": 100473206.0, "step": 43875 }, { "entropy": 5.7274768352508545, "epoch": 4.337682878608145, "grad_norm": 1.3671875, "learning_rate": 0.0003253591183121173, "loss": 4.8703, "mean_token_accuracy": 0.23346533328294755, "num_tokens": 100483905.0, "step": 43880 }, { "entropy": 5.768246269226074, "epoch": 4.338177145116647, "grad_norm": 1.5234375, "learning_rate": 0.00032532472298598926, "loss": 4.839, "mean_token_accuracy": 0.23923424929380416, "num_tokens": 100495432.0, "step": 43885 }, { "entropy": 5.77139139175415, "epoch": 4.338671411625148, "grad_norm": 1.2109375, "learning_rate": 0.00032529032642186523, "loss": 4.9425, "mean_token_accuracy": 0.2307194098830223, "num_tokens": 100507300.0, "step": 43890 }, { "entropy": 5.761772155761719, "epoch": 4.33916567813365, "grad_norm": 1.265625, "learning_rate": 0.00032525592862059133, "loss": 4.9388, "mean_token_accuracy": 0.2232879489660263, "num_tokens": 100518797.0, "step": 43895 }, { "entropy": 5.799756717681885, "epoch": 4.339659944642151, "grad_norm": 1.2109375, "learning_rate": 0.0003252215295830138, "loss": 4.9904, "mean_token_accuracy": 0.22461570501327516, "num_tokens": 100530250.0, "step": 43900 }, { "entropy": 5.739356184005738, "epoch": 4.340154211150653, "grad_norm": 1.2578125, "learning_rate": 0.0003251871293099788, "loss": 4.9059, "mean_token_accuracy": 0.23649802803993225, "num_tokens": 100541711.0, "step": 43905 }, { "entropy": 5.76520528793335, "epoch": 4.340648477659154, "grad_norm": 1.296875, "learning_rate": 0.0003251527278023327, "loss": 4.9113, "mean_token_accuracy": 0.23077207803726196, "num_tokens": 100553322.0, "step": 43910 }, { "entropy": 5.808765268325805, "epoch": 4.341142744167655, "grad_norm": 1.234375, "learning_rate": 0.0003251183250609217, "loss": 4.9401, "mean_token_accuracy": 0.22486316710710524, "num_tokens": 100564891.0, "step": 43915 }, { "entropy": 5.8058404445648195, "epoch": 4.341637010676156, "grad_norm": 1.4453125, "learning_rate": 0.00032508392108659213, "loss": 4.9399, "mean_token_accuracy": 0.22869712859392166, "num_tokens": 100575211.0, "step": 43920 }, { "entropy": 5.744402122497559, "epoch": 4.342131277184658, "grad_norm": 1.3125, "learning_rate": 0.00032504951588019034, "loss": 4.9048, "mean_token_accuracy": 0.22673576474189758, "num_tokens": 100586785.0, "step": 43925 }, { "entropy": 5.826343631744384, "epoch": 4.34262554369316, "grad_norm": 1.3671875, "learning_rate": 0.00032501510944256266, "loss": 4.9685, "mean_token_accuracy": 0.2246192827820778, "num_tokens": 100596834.0, "step": 43930 }, { "entropy": 5.750299119949341, "epoch": 4.343119810201661, "grad_norm": 1.2421875, "learning_rate": 0.0003249807017745555, "loss": 4.9351, "mean_token_accuracy": 0.22991953343153, "num_tokens": 100608059.0, "step": 43935 }, { "entropy": 5.788659381866455, "epoch": 4.343614076710162, "grad_norm": 1.2578125, "learning_rate": 0.00032494629287701545, "loss": 4.9795, "mean_token_accuracy": 0.22982373386621474, "num_tokens": 100619134.0, "step": 43940 }, { "entropy": 5.780305242538452, "epoch": 4.344108343218664, "grad_norm": 1.4921875, "learning_rate": 0.0003249118827507887, "loss": 4.8952, "mean_token_accuracy": 0.23748289197683334, "num_tokens": 100629963.0, "step": 43945 }, { "entropy": 5.894381999969482, "epoch": 4.344602609727165, "grad_norm": 1.375, "learning_rate": 0.0003248774713967219, "loss": 5.0818, "mean_token_accuracy": 0.21382415741682054, "num_tokens": 100641267.0, "step": 43950 }, { "entropy": 5.806288146972657, "epoch": 4.345096876235666, "grad_norm": 1.2734375, "learning_rate": 0.0003248430588156616, "loss": 4.95, "mean_token_accuracy": 0.22947254478931428, "num_tokens": 100652664.0, "step": 43955 }, { "entropy": 5.799053716659546, "epoch": 4.345591142744167, "grad_norm": 1.234375, "learning_rate": 0.0003248086450084544, "loss": 4.9062, "mean_token_accuracy": 0.23578690588474274, "num_tokens": 100664792.0, "step": 43960 }, { "entropy": 5.856228256225586, "epoch": 4.3460854092526695, "grad_norm": 1.0703125, "learning_rate": 0.0003247742299759468, "loss": 5.017, "mean_token_accuracy": 0.22255590111017226, "num_tokens": 100679028.0, "step": 43965 }, { "entropy": 5.69987006187439, "epoch": 4.346579675761171, "grad_norm": 1.21875, "learning_rate": 0.00032473981371898536, "loss": 4.8813, "mean_token_accuracy": 0.2368882805109024, "num_tokens": 100691119.0, "step": 43970 }, { "entropy": 5.708284997940064, "epoch": 4.347073942269672, "grad_norm": 1.3125, "learning_rate": 0.00032470539623841675, "loss": 4.9007, "mean_token_accuracy": 0.2335027977824211, "num_tokens": 100702046.0, "step": 43975 }, { "entropy": 5.766903829574585, "epoch": 4.347568208778173, "grad_norm": 1.25, "learning_rate": 0.00032467097753508775, "loss": 4.942, "mean_token_accuracy": 0.23029682785272598, "num_tokens": 100714345.0, "step": 43980 }, { "entropy": 5.75723557472229, "epoch": 4.3480624752866746, "grad_norm": 1.3828125, "learning_rate": 0.00032463655760984496, "loss": 4.9131, "mean_token_accuracy": 0.2349873885512352, "num_tokens": 100724526.0, "step": 43985 }, { "entropy": 5.814954090118408, "epoch": 4.348556741795176, "grad_norm": 1.2109375, "learning_rate": 0.0003246021364635352, "loss": 4.9496, "mean_token_accuracy": 0.22874481678009034, "num_tokens": 100736413.0, "step": 43990 }, { "entropy": 5.821660900115967, "epoch": 4.349051008303677, "grad_norm": 1.296875, "learning_rate": 0.00032456771409700516, "loss": 5.0345, "mean_token_accuracy": 0.22705846279859543, "num_tokens": 100747431.0, "step": 43995 }, { "entropy": 5.763138055801392, "epoch": 4.349545274812178, "grad_norm": 1.3828125, "learning_rate": 0.00032453329051110156, "loss": 4.9464, "mean_token_accuracy": 0.2330540046095848, "num_tokens": 100758475.0, "step": 44000 }, { "entropy": 5.7330591678619385, "epoch": 4.3500395413206805, "grad_norm": 1.34375, "learning_rate": 0.0003244988657066715, "loss": 4.8511, "mean_token_accuracy": 0.23591730892658233, "num_tokens": 100769145.0, "step": 44005 }, { "entropy": 5.731269216537475, "epoch": 4.350533807829182, "grad_norm": 1.125, "learning_rate": 0.00032446443968456166, "loss": 4.8973, "mean_token_accuracy": 0.24055728912353516, "num_tokens": 100780074.0, "step": 44010 }, { "entropy": 5.769398260116577, "epoch": 4.351028074337683, "grad_norm": 1.28125, "learning_rate": 0.00032443001244561876, "loss": 4.8985, "mean_token_accuracy": 0.2310859367251396, "num_tokens": 100790752.0, "step": 44015 }, { "entropy": 5.7649352073669435, "epoch": 4.351522340846184, "grad_norm": 1.125, "learning_rate": 0.00032439558399069006, "loss": 5.0108, "mean_token_accuracy": 0.22790098935365677, "num_tokens": 100801803.0, "step": 44020 }, { "entropy": 5.773670816421509, "epoch": 4.3520166073546855, "grad_norm": 1.3046875, "learning_rate": 0.00032436115432062226, "loss": 4.8883, "mean_token_accuracy": 0.2344165936112404, "num_tokens": 100813221.0, "step": 44025 }, { "entropy": 5.837436389923096, "epoch": 4.352510873863187, "grad_norm": 1.3671875, "learning_rate": 0.00032432672343626234, "loss": 4.8986, "mean_token_accuracy": 0.23521172106266022, "num_tokens": 100825159.0, "step": 44030 }, { "entropy": 5.813451051712036, "epoch": 4.353005140371688, "grad_norm": 1.3671875, "learning_rate": 0.00032429229133845743, "loss": 4.9553, "mean_token_accuracy": 0.22492115050554276, "num_tokens": 100836282.0, "step": 44035 }, { "entropy": 5.783771610260009, "epoch": 4.35349940688019, "grad_norm": 1.296875, "learning_rate": 0.0003242578580280546, "loss": 4.8935, "mean_token_accuracy": 0.22847584635019302, "num_tokens": 100847543.0, "step": 44040 }, { "entropy": 5.702975702285767, "epoch": 4.3539936733886915, "grad_norm": 1.421875, "learning_rate": 0.00032422342350590065, "loss": 4.8674, "mean_token_accuracy": 0.2368446409702301, "num_tokens": 100859038.0, "step": 44045 }, { "entropy": 5.7889069557189945, "epoch": 4.354487939897193, "grad_norm": 1.3203125, "learning_rate": 0.00032418898777284295, "loss": 4.9464, "mean_token_accuracy": 0.22795826941728592, "num_tokens": 100869678.0, "step": 44050 }, { "entropy": 5.780865097045899, "epoch": 4.354982206405694, "grad_norm": 1.2890625, "learning_rate": 0.0003241545508297285, "loss": 4.9324, "mean_token_accuracy": 0.22249923646450043, "num_tokens": 100881305.0, "step": 44055 }, { "entropy": 5.784142684936524, "epoch": 4.355476472914195, "grad_norm": 1.4375, "learning_rate": 0.00032412011267740447, "loss": 4.9837, "mean_token_accuracy": 0.22497359961271285, "num_tokens": 100892085.0, "step": 44060 }, { "entropy": 5.875810861587524, "epoch": 4.3559707394226965, "grad_norm": 1.4375, "learning_rate": 0.0003240856733167181, "loss": 5.0956, "mean_token_accuracy": 0.21268861293792723, "num_tokens": 100903558.0, "step": 44065 }, { "entropy": 5.800432252883911, "epoch": 4.356465005931198, "grad_norm": 1.421875, "learning_rate": 0.00032405123274851643, "loss": 4.9038, "mean_token_accuracy": 0.23196739107370376, "num_tokens": 100914219.0, "step": 44070 }, { "entropy": 5.830919981002808, "epoch": 4.356959272439699, "grad_norm": 1.1875, "learning_rate": 0.0003240167909736469, "loss": 4.9902, "mean_token_accuracy": 0.22438732534646988, "num_tokens": 100926846.0, "step": 44075 }, { "entropy": 5.785229063034057, "epoch": 4.357453538948201, "grad_norm": 1.34375, "learning_rate": 0.0003239823479929567, "loss": 4.9523, "mean_token_accuracy": 0.22845074832439421, "num_tokens": 100937502.0, "step": 44080 }, { "entropy": 5.76610312461853, "epoch": 4.3579478054567025, "grad_norm": 1.265625, "learning_rate": 0.00032394790380729316, "loss": 4.9504, "mean_token_accuracy": 0.2245262771844864, "num_tokens": 100949797.0, "step": 44085 }, { "entropy": 5.745938491821289, "epoch": 4.358442071965204, "grad_norm": 1.2265625, "learning_rate": 0.00032391345841750356, "loss": 4.8859, "mean_token_accuracy": 0.23861430287361146, "num_tokens": 100960952.0, "step": 44090 }, { "entropy": 5.782887268066406, "epoch": 4.358936338473705, "grad_norm": 1.34375, "learning_rate": 0.0003238790118244353, "loss": 4.9602, "mean_token_accuracy": 0.23222958892583848, "num_tokens": 100971691.0, "step": 44095 }, { "entropy": 5.744265985488892, "epoch": 4.359430604982206, "grad_norm": 1.5234375, "learning_rate": 0.0003238445640289358, "loss": 4.8584, "mean_token_accuracy": 0.23746822476387025, "num_tokens": 100982872.0, "step": 44100 }, { "entropy": 5.743630266189575, "epoch": 4.3599248714907075, "grad_norm": 1.265625, "learning_rate": 0.00032381011503185243, "loss": 4.8877, "mean_token_accuracy": 0.23484389632940292, "num_tokens": 100994435.0, "step": 44105 }, { "entropy": 5.817675256729126, "epoch": 4.360419137999209, "grad_norm": 1.296875, "learning_rate": 0.00032377566483403266, "loss": 4.9654, "mean_token_accuracy": 0.22597405314445496, "num_tokens": 101006647.0, "step": 44110 }, { "entropy": 5.733247232437134, "epoch": 4.360913404507711, "grad_norm": 1.3203125, "learning_rate": 0.00032374121343632396, "loss": 4.8817, "mean_token_accuracy": 0.23568636775016785, "num_tokens": 101018156.0, "step": 44115 }, { "entropy": 5.7707600593566895, "epoch": 4.361407671016212, "grad_norm": 1.3984375, "learning_rate": 0.0003237067608395738, "loss": 4.9617, "mean_token_accuracy": 0.22437798380851745, "num_tokens": 101028691.0, "step": 44120 }, { "entropy": 5.801129150390625, "epoch": 4.3619019375247134, "grad_norm": 1.2890625, "learning_rate": 0.00032367230704462985, "loss": 4.9567, "mean_token_accuracy": 0.22752400636672973, "num_tokens": 101040658.0, "step": 44125 }, { "entropy": 5.848366546630859, "epoch": 4.362396204033215, "grad_norm": 1.25, "learning_rate": 0.00032363785205233954, "loss": 4.9654, "mean_token_accuracy": 0.2246871203184128, "num_tokens": 101052879.0, "step": 44130 }, { "entropy": 5.78539776802063, "epoch": 4.362890470541716, "grad_norm": 1.28125, "learning_rate": 0.00032360339586355054, "loss": 4.9289, "mean_token_accuracy": 0.2264582708477974, "num_tokens": 101064349.0, "step": 44135 }, { "entropy": 5.730290317535401, "epoch": 4.363384737050217, "grad_norm": 1.234375, "learning_rate": 0.00032356893847911044, "loss": 4.8542, "mean_token_accuracy": 0.23592747747898102, "num_tokens": 101078624.0, "step": 44140 }, { "entropy": 5.745179224014282, "epoch": 4.3638790035587185, "grad_norm": 1.2109375, "learning_rate": 0.00032353447989986697, "loss": 4.8376, "mean_token_accuracy": 0.23632629662752153, "num_tokens": 101089822.0, "step": 44145 }, { "entropy": 5.7355554580688475, "epoch": 4.364373270067221, "grad_norm": 1.3125, "learning_rate": 0.0003235000201266678, "loss": 4.8418, "mean_token_accuracy": 0.23961308598518372, "num_tokens": 101100499.0, "step": 44150 }, { "entropy": 5.619287061691284, "epoch": 4.364867536575722, "grad_norm": 1.3515625, "learning_rate": 0.00032346555916036053, "loss": 4.7916, "mean_token_accuracy": 0.2498767614364624, "num_tokens": 101112331.0, "step": 44155 }, { "entropy": 5.852122974395752, "epoch": 4.365361803084223, "grad_norm": 1.3671875, "learning_rate": 0.00032343109700179294, "loss": 5.0324, "mean_token_accuracy": 0.22152429670095444, "num_tokens": 101123491.0, "step": 44160 }, { "entropy": 5.775107288360596, "epoch": 4.365856069592724, "grad_norm": 1.375, "learning_rate": 0.0003233966336518129, "loss": 4.9086, "mean_token_accuracy": 0.23637375086545945, "num_tokens": 101134039.0, "step": 44165 }, { "entropy": 5.8704845905303955, "epoch": 4.366350336101226, "grad_norm": 1.265625, "learning_rate": 0.0003233621691112683, "loss": 4.9936, "mean_token_accuracy": 0.22862096428871154, "num_tokens": 101145910.0, "step": 44170 }, { "entropy": 5.81949553489685, "epoch": 4.366844602609727, "grad_norm": 1.375, "learning_rate": 0.00032332770338100664, "loss": 4.9977, "mean_token_accuracy": 0.22273940294981004, "num_tokens": 101155924.0, "step": 44175 }, { "entropy": 5.731286525726318, "epoch": 4.367338869118228, "grad_norm": 1.3046875, "learning_rate": 0.0003232932364618761, "loss": 4.9118, "mean_token_accuracy": 0.22744144648313522, "num_tokens": 101166656.0, "step": 44180 }, { "entropy": 5.819930124282837, "epoch": 4.36783313562673, "grad_norm": 1.1953125, "learning_rate": 0.00032325876835472445, "loss": 5.0248, "mean_token_accuracy": 0.22852956652641296, "num_tokens": 101177868.0, "step": 44185 }, { "entropy": 5.799646282196045, "epoch": 4.368327402135232, "grad_norm": 1.3203125, "learning_rate": 0.0003232242990603995, "loss": 4.9401, "mean_token_accuracy": 0.23055540919303893, "num_tokens": 101190114.0, "step": 44190 }, { "entropy": 5.787968873977661, "epoch": 4.368821668643733, "grad_norm": 1.25, "learning_rate": 0.0003231898285797494, "loss": 4.9692, "mean_token_accuracy": 0.22656389325857162, "num_tokens": 101202417.0, "step": 44195 }, { "entropy": 5.819163131713867, "epoch": 4.369315935152234, "grad_norm": 1.3515625, "learning_rate": 0.000323155356913622, "loss": 4.96, "mean_token_accuracy": 0.22407441288232804, "num_tokens": 101214416.0, "step": 44200 }, { "entropy": 5.769860553741455, "epoch": 4.369810201660735, "grad_norm": 1.265625, "learning_rate": 0.00032312088406286543, "loss": 4.8766, "mean_token_accuracy": 0.22877698689699172, "num_tokens": 101225304.0, "step": 44205 }, { "entropy": 5.7694511890411375, "epoch": 4.370304468169237, "grad_norm": 1.21875, "learning_rate": 0.0003230864100283276, "loss": 4.9847, "mean_token_accuracy": 0.2290133625268936, "num_tokens": 101236988.0, "step": 44210 }, { "entropy": 5.6366394519805905, "epoch": 4.370798734677738, "grad_norm": 1.2578125, "learning_rate": 0.0003230519348108566, "loss": 4.7387, "mean_token_accuracy": 0.25698686838150026, "num_tokens": 101248105.0, "step": 44215 }, { "entropy": 5.789619493484497, "epoch": 4.37129300118624, "grad_norm": 1.25, "learning_rate": 0.0003230174584113005, "loss": 4.996, "mean_token_accuracy": 0.21850239783525466, "num_tokens": 101260180.0, "step": 44220 }, { "entropy": 5.775313091278076, "epoch": 4.371787267694741, "grad_norm": 1.1640625, "learning_rate": 0.00032298298083050756, "loss": 4.9368, "mean_token_accuracy": 0.22804800420999527, "num_tokens": 101271799.0, "step": 44225 }, { "entropy": 5.696804618835449, "epoch": 4.372281534203243, "grad_norm": 1.328125, "learning_rate": 0.0003229485020693259, "loss": 4.8212, "mean_token_accuracy": 0.24237262457609177, "num_tokens": 101283111.0, "step": 44230 }, { "entropy": 5.7484715461730955, "epoch": 4.372775800711744, "grad_norm": 1.2265625, "learning_rate": 0.00032291402212860347, "loss": 4.9471, "mean_token_accuracy": 0.22551867067813874, "num_tokens": 101295419.0, "step": 44235 }, { "entropy": 5.84717173576355, "epoch": 4.373270067220245, "grad_norm": 1.234375, "learning_rate": 0.00032287954100918877, "loss": 5.039, "mean_token_accuracy": 0.21360981911420823, "num_tokens": 101307431.0, "step": 44240 }, { "entropy": 5.817013263702393, "epoch": 4.373764333728746, "grad_norm": 1.359375, "learning_rate": 0.00032284505871193, "loss": 4.9054, "mean_token_accuracy": 0.22775947004556657, "num_tokens": 101318080.0, "step": 44245 }, { "entropy": 5.785833406448364, "epoch": 4.374258600237248, "grad_norm": 1.234375, "learning_rate": 0.00032281057523767524, "loss": 4.9248, "mean_token_accuracy": 0.2356586217880249, "num_tokens": 101330628.0, "step": 44250 }, { "entropy": 5.763400840759277, "epoch": 4.374752866745749, "grad_norm": 1.296875, "learning_rate": 0.00032277609058727297, "loss": 4.9275, "mean_token_accuracy": 0.23164038956165314, "num_tokens": 101340823.0, "step": 44255 }, { "entropy": 5.754184007644653, "epoch": 4.375247133254251, "grad_norm": 1.3046875, "learning_rate": 0.0003227416047615714, "loss": 4.8925, "mean_token_accuracy": 0.22541674524545668, "num_tokens": 101352329.0, "step": 44260 }, { "entropy": 5.821122455596924, "epoch": 4.375741399762752, "grad_norm": 1.3515625, "learning_rate": 0.00032270711776141904, "loss": 5.0091, "mean_token_accuracy": 0.21585677862167357, "num_tokens": 101364223.0, "step": 44265 }, { "entropy": 5.790074586868286, "epoch": 4.376235666271254, "grad_norm": 1.296875, "learning_rate": 0.0003226726295876642, "loss": 4.9387, "mean_token_accuracy": 0.2250300258398056, "num_tokens": 101375935.0, "step": 44270 }, { "entropy": 5.7145483016967775, "epoch": 4.376729932779755, "grad_norm": 1.203125, "learning_rate": 0.00032263814024115515, "loss": 4.8539, "mean_token_accuracy": 0.23135704398155213, "num_tokens": 101386751.0, "step": 44275 }, { "entropy": 5.797204542160034, "epoch": 4.377224199288256, "grad_norm": 1.328125, "learning_rate": 0.0003226036497227406, "loss": 4.9771, "mean_token_accuracy": 0.2224976345896721, "num_tokens": 101397863.0, "step": 44280 }, { "entropy": 5.741680669784546, "epoch": 4.377718465796757, "grad_norm": 1.3359375, "learning_rate": 0.00032256915803326874, "loss": 4.9209, "mean_token_accuracy": 0.23197393119335175, "num_tokens": 101408912.0, "step": 44285 }, { "entropy": 5.735201120376587, "epoch": 4.378212732305259, "grad_norm": 1.2578125, "learning_rate": 0.0003225346651735883, "loss": 4.8474, "mean_token_accuracy": 0.24280088543891906, "num_tokens": 101419784.0, "step": 44290 }, { "entropy": 5.76398458480835, "epoch": 4.37870699881376, "grad_norm": 1.3515625, "learning_rate": 0.00032250017114454773, "loss": 4.8758, "mean_token_accuracy": 0.23235227912664413, "num_tokens": 101431148.0, "step": 44295 }, { "entropy": 5.7205362796783445, "epoch": 4.379201265322262, "grad_norm": 1.1875, "learning_rate": 0.0003224656759469956, "loss": 4.9408, "mean_token_accuracy": 0.2321418270468712, "num_tokens": 101443034.0, "step": 44300 }, { "entropy": 5.775005912780761, "epoch": 4.379695531830763, "grad_norm": 1.1953125, "learning_rate": 0.00032243117958178036, "loss": 4.9422, "mean_token_accuracy": 0.2310222268104553, "num_tokens": 101455242.0, "step": 44305 }, { "entropy": 5.787845468521118, "epoch": 4.380189798339265, "grad_norm": 1.390625, "learning_rate": 0.0003223966820497508, "loss": 5.0084, "mean_token_accuracy": 0.2278506875038147, "num_tokens": 101466838.0, "step": 44310 }, { "entropy": 5.860180997848511, "epoch": 4.380684064847766, "grad_norm": 1.2890625, "learning_rate": 0.0003223621833517555, "loss": 4.9993, "mean_token_accuracy": 0.23098972737789153, "num_tokens": 101479333.0, "step": 44315 }, { "entropy": 5.7658881664276125, "epoch": 4.381178331356267, "grad_norm": 1.234375, "learning_rate": 0.00032232768348864314, "loss": 4.9276, "mean_token_accuracy": 0.2284233182668686, "num_tokens": 101490891.0, "step": 44320 }, { "entropy": 5.858300256729126, "epoch": 4.381672597864768, "grad_norm": 1.2734375, "learning_rate": 0.0003222931824612626, "loss": 5.0803, "mean_token_accuracy": 0.21535296142101287, "num_tokens": 101502146.0, "step": 44325 }, { "entropy": 5.7702418804168705, "epoch": 4.38216686437327, "grad_norm": 1.1640625, "learning_rate": 0.0003222586802704622, "loss": 4.936, "mean_token_accuracy": 0.22951242476701736, "num_tokens": 101514619.0, "step": 44330 }, { "entropy": 5.836402511596679, "epoch": 4.382661130881772, "grad_norm": 1.4375, "learning_rate": 0.00032222417691709097, "loss": 4.9897, "mean_token_accuracy": 0.22398712784051894, "num_tokens": 101526103.0, "step": 44335 }, { "entropy": 5.749256610870361, "epoch": 4.383155397390273, "grad_norm": 1.2265625, "learning_rate": 0.00032218967240199776, "loss": 4.872, "mean_token_accuracy": 0.2353816568851471, "num_tokens": 101538503.0, "step": 44340 }, { "entropy": 5.750564002990723, "epoch": 4.383649663898774, "grad_norm": 1.3046875, "learning_rate": 0.0003221551667260313, "loss": 5.0058, "mean_token_accuracy": 0.22326190173625945, "num_tokens": 101549854.0, "step": 44345 }, { "entropy": 5.813726854324341, "epoch": 4.384143930407276, "grad_norm": 1.4140625, "learning_rate": 0.00032212065989004036, "loss": 5.0005, "mean_token_accuracy": 0.2255925416946411, "num_tokens": 101561272.0, "step": 44350 }, { "entropy": 5.800186681747436, "epoch": 4.384638196915777, "grad_norm": 1.3515625, "learning_rate": 0.0003220861518948738, "loss": 4.8628, "mean_token_accuracy": 0.23794747442007064, "num_tokens": 101570941.0, "step": 44355 }, { "entropy": 5.673511171340943, "epoch": 4.385132463424278, "grad_norm": 1.25, "learning_rate": 0.00032205164274138075, "loss": 4.8616, "mean_token_accuracy": 0.23980370312929153, "num_tokens": 101582530.0, "step": 44360 }, { "entropy": 5.7948277473449705, "epoch": 4.385626729932779, "grad_norm": 1.40625, "learning_rate": 0.0003220171324304099, "loss": 5.0374, "mean_token_accuracy": 0.2218106359243393, "num_tokens": 101594402.0, "step": 44365 }, { "entropy": 5.760267448425293, "epoch": 4.3861209964412815, "grad_norm": 1.3359375, "learning_rate": 0.0003219826209628103, "loss": 4.8925, "mean_token_accuracy": 0.2339683637022972, "num_tokens": 101606399.0, "step": 44370 }, { "entropy": 5.774322986602783, "epoch": 4.386615262949783, "grad_norm": 1.2109375, "learning_rate": 0.0003219481083394309, "loss": 4.9276, "mean_token_accuracy": 0.22042375504970552, "num_tokens": 101618403.0, "step": 44375 }, { "entropy": 5.8222596645355225, "epoch": 4.387109529458284, "grad_norm": 1.46875, "learning_rate": 0.00032191359456112083, "loss": 4.9801, "mean_token_accuracy": 0.22815112471580506, "num_tokens": 101630553.0, "step": 44380 }, { "entropy": 5.803790521621704, "epoch": 4.387603795966785, "grad_norm": 1.3671875, "learning_rate": 0.0003218790796287291, "loss": 4.939, "mean_token_accuracy": 0.22676888406276702, "num_tokens": 101642188.0, "step": 44385 }, { "entropy": 5.7963869094848635, "epoch": 4.3880980624752866, "grad_norm": 1.3515625, "learning_rate": 0.00032184456354310465, "loss": 4.9138, "mean_token_accuracy": 0.23316336721181868, "num_tokens": 101654202.0, "step": 44390 }, { "entropy": 5.803341484069824, "epoch": 4.388592328983788, "grad_norm": 1.4296875, "learning_rate": 0.0003218100463050967, "loss": 4.9247, "mean_token_accuracy": 0.226852910220623, "num_tokens": 101665017.0, "step": 44395 }, { "entropy": 5.784501838684082, "epoch": 4.389086595492289, "grad_norm": 1.25, "learning_rate": 0.0003217755279155543, "loss": 4.9223, "mean_token_accuracy": 0.22675565034151077, "num_tokens": 101675662.0, "step": 44400 }, { "entropy": 5.766637325286865, "epoch": 4.389580862000791, "grad_norm": 1.296875, "learning_rate": 0.0003217410083753267, "loss": 4.9191, "mean_token_accuracy": 0.22631852626800536, "num_tokens": 101687707.0, "step": 44405 }, { "entropy": 5.702825450897217, "epoch": 4.3900751285092925, "grad_norm": 1.1484375, "learning_rate": 0.000321706487685263, "loss": 4.8991, "mean_token_accuracy": 0.22825476974248887, "num_tokens": 101701557.0, "step": 44410 }, { "entropy": 5.7099542140960695, "epoch": 4.390569395017794, "grad_norm": 1.2578125, "learning_rate": 0.00032167196584621257, "loss": 4.8175, "mean_token_accuracy": 0.2400932714343071, "num_tokens": 101713305.0, "step": 44415 }, { "entropy": 5.7351367473602295, "epoch": 4.391063661526295, "grad_norm": 1.2578125, "learning_rate": 0.00032163744285902446, "loss": 4.8962, "mean_token_accuracy": 0.2351185992360115, "num_tokens": 101725390.0, "step": 44420 }, { "entropy": 5.800309324264527, "epoch": 4.391557928034796, "grad_norm": 1.3359375, "learning_rate": 0.000321602918724548, "loss": 4.9999, "mean_token_accuracy": 0.22799553871154785, "num_tokens": 101737191.0, "step": 44425 }, { "entropy": 5.800535535812378, "epoch": 4.3920521945432975, "grad_norm": 1.28125, "learning_rate": 0.0003215683934436325, "loss": 4.9401, "mean_token_accuracy": 0.22713883817195893, "num_tokens": 101747326.0, "step": 44430 }, { "entropy": 5.7912821769714355, "epoch": 4.392546461051799, "grad_norm": 1.46875, "learning_rate": 0.00032153386701712735, "loss": 4.955, "mean_token_accuracy": 0.23055837005376817, "num_tokens": 101758214.0, "step": 44435 }, { "entropy": 5.724551105499268, "epoch": 4.393040727560301, "grad_norm": 1.2421875, "learning_rate": 0.0003214993394458818, "loss": 4.892, "mean_token_accuracy": 0.23377511352300645, "num_tokens": 101769045.0, "step": 44440 }, { "entropy": 5.79332218170166, "epoch": 4.393534994068802, "grad_norm": 1.2421875, "learning_rate": 0.0003214648107307454, "loss": 4.954, "mean_token_accuracy": 0.22634820491075516, "num_tokens": 101780358.0, "step": 44445 }, { "entropy": 5.764217138290405, "epoch": 4.3940292605773035, "grad_norm": 1.3125, "learning_rate": 0.0003214302808725673, "loss": 4.9749, "mean_token_accuracy": 0.225906802713871, "num_tokens": 101792370.0, "step": 44450 }, { "entropy": 5.781581735610962, "epoch": 4.394523527085805, "grad_norm": 1.40625, "learning_rate": 0.0003213957498721971, "loss": 4.904, "mean_token_accuracy": 0.23213106244802476, "num_tokens": 101803105.0, "step": 44455 }, { "entropy": 5.728999328613281, "epoch": 4.395017793594306, "grad_norm": 1.3515625, "learning_rate": 0.00032136121773048445, "loss": 4.8944, "mean_token_accuracy": 0.24072905927896499, "num_tokens": 101814237.0, "step": 44460 }, { "entropy": 5.817507219314575, "epoch": 4.395512060102807, "grad_norm": 1.203125, "learning_rate": 0.00032132668444827847, "loss": 4.959, "mean_token_accuracy": 0.22507347613573075, "num_tokens": 101825190.0, "step": 44465 }, { "entropy": 5.783156299591065, "epoch": 4.3960063266113085, "grad_norm": 1.4140625, "learning_rate": 0.00032129215002642893, "loss": 4.9132, "mean_token_accuracy": 0.22980836033821106, "num_tokens": 101835512.0, "step": 44470 }, { "entropy": 5.812867593765259, "epoch": 4.39650059311981, "grad_norm": 1.3984375, "learning_rate": 0.0003212576144657852, "loss": 5.0065, "mean_token_accuracy": 0.22016580849885942, "num_tokens": 101847329.0, "step": 44475 }, { "entropy": 5.861368846893311, "epoch": 4.396994859628312, "grad_norm": 1.359375, "learning_rate": 0.0003212230777671971, "loss": 5.0394, "mean_token_accuracy": 0.22342875003814697, "num_tokens": 101858371.0, "step": 44480 }, { "entropy": 5.831535053253174, "epoch": 4.397489126136813, "grad_norm": 1.265625, "learning_rate": 0.0003211885399315141, "loss": 4.9874, "mean_token_accuracy": 0.2299030140042305, "num_tokens": 101869011.0, "step": 44485 }, { "entropy": 5.774883556365967, "epoch": 4.3979833926453145, "grad_norm": 1.3125, "learning_rate": 0.00032115400095958585, "loss": 4.9289, "mean_token_accuracy": 0.2337183192372322, "num_tokens": 101880147.0, "step": 44490 }, { "entropy": 5.774054479598999, "epoch": 4.398477659153816, "grad_norm": 1.4453125, "learning_rate": 0.000321119460852262, "loss": 4.8976, "mean_token_accuracy": 0.2280077025294304, "num_tokens": 101891519.0, "step": 44495 }, { "entropy": 5.712663888931274, "epoch": 4.398971925662317, "grad_norm": 1.28125, "learning_rate": 0.0003210849196103922, "loss": 4.8371, "mean_token_accuracy": 0.23728777170181276, "num_tokens": 101902575.0, "step": 44500 }, { "entropy": 5.758746194839477, "epoch": 4.399466192170818, "grad_norm": 1.28125, "learning_rate": 0.00032105037723482635, "loss": 4.9415, "mean_token_accuracy": 0.22427077293395997, "num_tokens": 101913717.0, "step": 44505 }, { "entropy": 5.783820962905883, "epoch": 4.3999604586793195, "grad_norm": 1.2734375, "learning_rate": 0.00032101583372641404, "loss": 4.8967, "mean_token_accuracy": 0.23310937732458115, "num_tokens": 101925196.0, "step": 44510 }, { "entropy": 5.814217901229858, "epoch": 4.400454725187822, "grad_norm": 1.3046875, "learning_rate": 0.00032098128908600505, "loss": 4.897, "mean_token_accuracy": 0.2318163186311722, "num_tokens": 101936430.0, "step": 44515 }, { "entropy": 5.785718393325806, "epoch": 4.400948991696323, "grad_norm": 1.3359375, "learning_rate": 0.0003209467433144492, "loss": 4.9347, "mean_token_accuracy": 0.22434916347265244, "num_tokens": 101947368.0, "step": 44520 }, { "entropy": 5.7272134780883786, "epoch": 4.401443258204824, "grad_norm": 1.359375, "learning_rate": 0.00032091219641259633, "loss": 4.8713, "mean_token_accuracy": 0.23744321316480638, "num_tokens": 101957474.0, "step": 44525 }, { "entropy": 5.846186113357544, "epoch": 4.4019375247133254, "grad_norm": 1.1875, "learning_rate": 0.00032087764838129636, "loss": 5.0503, "mean_token_accuracy": 0.22099510878324508, "num_tokens": 101970141.0, "step": 44530 }, { "entropy": 5.825059986114502, "epoch": 4.402431791221827, "grad_norm": 1.34375, "learning_rate": 0.00032084309922139907, "loss": 5.0037, "mean_token_accuracy": 0.21945223063230515, "num_tokens": 101980851.0, "step": 44535 }, { "entropy": 5.779472732543946, "epoch": 4.402926057730328, "grad_norm": 1.3359375, "learning_rate": 0.00032080854893375447, "loss": 4.9409, "mean_token_accuracy": 0.22958521246910096, "num_tokens": 101992716.0, "step": 44540 }, { "entropy": 5.752793169021606, "epoch": 4.403420324238829, "grad_norm": 1.390625, "learning_rate": 0.0003207739975192124, "loss": 4.9206, "mean_token_accuracy": 0.22481743693351747, "num_tokens": 102003419.0, "step": 44545 }, { "entropy": 5.796084451675415, "epoch": 4.4039145907473305, "grad_norm": 1.4140625, "learning_rate": 0.0003207394449786231, "loss": 4.938, "mean_token_accuracy": 0.23021966218948364, "num_tokens": 102014188.0, "step": 44550 }, { "entropy": 5.804183769226074, "epoch": 4.404408857255833, "grad_norm": 1.3125, "learning_rate": 0.0003207048913128361, "loss": 4.9279, "mean_token_accuracy": 0.22860852330923082, "num_tokens": 102024925.0, "step": 44555 }, { "entropy": 5.709659481048584, "epoch": 4.404903123764334, "grad_norm": 1.2734375, "learning_rate": 0.0003206703365227018, "loss": 4.8879, "mean_token_accuracy": 0.2354836270213127, "num_tokens": 102036846.0, "step": 44560 }, { "entropy": 5.6926289081573485, "epoch": 4.405397390272835, "grad_norm": 1.1953125, "learning_rate": 0.0003206357806090701, "loss": 4.9004, "mean_token_accuracy": 0.23062173128128052, "num_tokens": 102050187.0, "step": 44565 }, { "entropy": 5.774506998062134, "epoch": 4.405891656781336, "grad_norm": 1.28125, "learning_rate": 0.0003206012235727911, "loss": 4.97, "mean_token_accuracy": 0.22743042409420014, "num_tokens": 102062071.0, "step": 44570 }, { "entropy": 5.805512809753418, "epoch": 4.406385923289838, "grad_norm": 1.34375, "learning_rate": 0.00032056666541471497, "loss": 4.9176, "mean_token_accuracy": 0.23443736732006074, "num_tokens": 102073641.0, "step": 44575 }, { "entropy": 5.815981101989746, "epoch": 4.406880189798339, "grad_norm": 1.296875, "learning_rate": 0.0003205321061356918, "loss": 4.9042, "mean_token_accuracy": 0.2320135623216629, "num_tokens": 102085328.0, "step": 44580 }, { "entropy": 5.764554023742676, "epoch": 4.40737445630684, "grad_norm": 1.421875, "learning_rate": 0.00032049754573657176, "loss": 4.9506, "mean_token_accuracy": 0.2369006544351578, "num_tokens": 102096866.0, "step": 44585 }, { "entropy": 5.724488067626953, "epoch": 4.407868722815342, "grad_norm": 1.421875, "learning_rate": 0.000320462984218205, "loss": 4.9233, "mean_token_accuracy": 0.22877844125032426, "num_tokens": 102107823.0, "step": 44590 }, { "entropy": 5.759817838668823, "epoch": 4.408362989323844, "grad_norm": 1.3046875, "learning_rate": 0.00032042842158144173, "loss": 4.863, "mean_token_accuracy": 0.236982823908329, "num_tokens": 102118443.0, "step": 44595 }, { "entropy": 5.796397686004639, "epoch": 4.408857255832345, "grad_norm": 1.265625, "learning_rate": 0.0003203938578271324, "loss": 4.9228, "mean_token_accuracy": 0.23113987296819688, "num_tokens": 102131745.0, "step": 44600 }, { "entropy": 5.762889051437378, "epoch": 4.409351522340846, "grad_norm": 1.4453125, "learning_rate": 0.00032035929295612695, "loss": 4.9622, "mean_token_accuracy": 0.22129473984241485, "num_tokens": 102143275.0, "step": 44605 }, { "entropy": 5.762961959838867, "epoch": 4.409845788849347, "grad_norm": 1.2734375, "learning_rate": 0.000320324726969276, "loss": 4.9041, "mean_token_accuracy": 0.2342536687850952, "num_tokens": 102156125.0, "step": 44610 }, { "entropy": 5.762206745147705, "epoch": 4.410340055357849, "grad_norm": 1.3515625, "learning_rate": 0.00032029015986742966, "loss": 4.8654, "mean_token_accuracy": 0.23709594011306762, "num_tokens": 102166599.0, "step": 44615 }, { "entropy": 5.649644422531128, "epoch": 4.41083432186635, "grad_norm": 1.2890625, "learning_rate": 0.0003202555916514384, "loss": 4.8285, "mean_token_accuracy": 0.24055459797382356, "num_tokens": 102179320.0, "step": 44620 }, { "entropy": 5.785014581680298, "epoch": 4.411328588374852, "grad_norm": 1.390625, "learning_rate": 0.0003202210223221525, "loss": 5.0023, "mean_token_accuracy": 0.2238845556974411, "num_tokens": 102191786.0, "step": 44625 }, { "entropy": 5.799521446228027, "epoch": 4.411822854883353, "grad_norm": 1.3203125, "learning_rate": 0.0003201864518804225, "loss": 4.8851, "mean_token_accuracy": 0.23715116530656816, "num_tokens": 102202955.0, "step": 44630 }, { "entropy": 5.789065170288086, "epoch": 4.412317121391855, "grad_norm": 1.2734375, "learning_rate": 0.0003201518803270987, "loss": 4.8469, "mean_token_accuracy": 0.24145787954330444, "num_tokens": 102214930.0, "step": 44635 }, { "entropy": 5.793876457214355, "epoch": 4.412811387900356, "grad_norm": 1.46875, "learning_rate": 0.00032011730766303163, "loss": 4.9112, "mean_token_accuracy": 0.22901122719049455, "num_tokens": 102226009.0, "step": 44640 }, { "entropy": 5.7417479991912845, "epoch": 4.413305654408857, "grad_norm": 1.25, "learning_rate": 0.0003200827338890719, "loss": 4.8675, "mean_token_accuracy": 0.23515848368406295, "num_tokens": 102237486.0, "step": 44645 }, { "entropy": 5.718871831893921, "epoch": 4.413799920917358, "grad_norm": 1.390625, "learning_rate": 0.00032004815900606994, "loss": 4.9275, "mean_token_accuracy": 0.22771875113248824, "num_tokens": 102249094.0, "step": 44650 }, { "entropy": 5.753797340393066, "epoch": 4.41429418742586, "grad_norm": 1.234375, "learning_rate": 0.0003200135830148762, "loss": 4.9953, "mean_token_accuracy": 0.22277871668338775, "num_tokens": 102260388.0, "step": 44655 }, { "entropy": 5.794828462600708, "epoch": 4.414788453934362, "grad_norm": 1.25, "learning_rate": 0.0003199790059163414, "loss": 4.9439, "mean_token_accuracy": 0.22106139063835145, "num_tokens": 102272745.0, "step": 44660 }, { "entropy": 5.754795837402344, "epoch": 4.415282720442863, "grad_norm": 1.2890625, "learning_rate": 0.0003199444277113159, "loss": 4.8701, "mean_token_accuracy": 0.23313587605953218, "num_tokens": 102283566.0, "step": 44665 }, { "entropy": 5.810240173339844, "epoch": 4.415776986951364, "grad_norm": 1.328125, "learning_rate": 0.0003199098484006507, "loss": 4.9849, "mean_token_accuracy": 0.22759221643209457, "num_tokens": 102296125.0, "step": 44670 }, { "entropy": 5.8383808612823485, "epoch": 4.416271253459866, "grad_norm": 1.3515625, "learning_rate": 0.00031987526798519616, "loss": 4.9189, "mean_token_accuracy": 0.2265412464737892, "num_tokens": 102307925.0, "step": 44675 }, { "entropy": 5.850876426696777, "epoch": 4.416765519968367, "grad_norm": 1.3828125, "learning_rate": 0.00031984068646580315, "loss": 4.9779, "mean_token_accuracy": 0.22305086106061936, "num_tokens": 102318913.0, "step": 44680 }, { "entropy": 5.705397129058838, "epoch": 4.417259786476868, "grad_norm": 1.3203125, "learning_rate": 0.0003198061038433222, "loss": 4.887, "mean_token_accuracy": 0.23596783429384233, "num_tokens": 102330659.0, "step": 44685 }, { "entropy": 5.785893678665161, "epoch": 4.417754052985369, "grad_norm": 1.21875, "learning_rate": 0.00031977152011860416, "loss": 4.9318, "mean_token_accuracy": 0.22578260600566863, "num_tokens": 102342389.0, "step": 44690 }, { "entropy": 5.871178913116455, "epoch": 4.4182483194938715, "grad_norm": 1.3203125, "learning_rate": 0.00031973693529249985, "loss": 4.9935, "mean_token_accuracy": 0.22863285094499589, "num_tokens": 102354810.0, "step": 44695 }, { "entropy": 5.7864807605743405, "epoch": 4.418742586002373, "grad_norm": 1.390625, "learning_rate": 0.00031970234936585997, "loss": 4.936, "mean_token_accuracy": 0.22711482793092727, "num_tokens": 102366078.0, "step": 44700 }, { "entropy": 5.758639717102051, "epoch": 4.419236852510874, "grad_norm": 1.2265625, "learning_rate": 0.00031966776233953534, "loss": 4.95, "mean_token_accuracy": 0.2346431568264961, "num_tokens": 102378480.0, "step": 44705 }, { "entropy": 5.747470331192017, "epoch": 4.419731119019375, "grad_norm": 1.28125, "learning_rate": 0.00031963317421437675, "loss": 4.8619, "mean_token_accuracy": 0.2429773062467575, "num_tokens": 102389493.0, "step": 44710 }, { "entropy": 5.887057447433472, "epoch": 4.420225385527877, "grad_norm": 1.140625, "learning_rate": 0.0003195985849912353, "loss": 5.035, "mean_token_accuracy": 0.21522504985332488, "num_tokens": 102401543.0, "step": 44715 }, { "entropy": 5.7858387470245365, "epoch": 4.420719652036378, "grad_norm": 1.3046875, "learning_rate": 0.0003195639946709616, "loss": 5.0028, "mean_token_accuracy": 0.22263889759778976, "num_tokens": 102412758.0, "step": 44720 }, { "entropy": 5.794162178039551, "epoch": 4.421213918544879, "grad_norm": 1.34375, "learning_rate": 0.00031952940325440685, "loss": 4.9044, "mean_token_accuracy": 0.229052072763443, "num_tokens": 102422297.0, "step": 44725 }, { "entropy": 5.730296945571899, "epoch": 4.42170818505338, "grad_norm": 1.25, "learning_rate": 0.00031949481074242174, "loss": 4.8925, "mean_token_accuracy": 0.2313983842730522, "num_tokens": 102433838.0, "step": 44730 }, { "entropy": 5.816375350952148, "epoch": 4.4222024515618825, "grad_norm": 1.2578125, "learning_rate": 0.00031946021713585745, "loss": 4.9512, "mean_token_accuracy": 0.22502039819955827, "num_tokens": 102445138.0, "step": 44735 }, { "entropy": 5.749163389205933, "epoch": 4.422696718070384, "grad_norm": 1.2890625, "learning_rate": 0.0003194256224355649, "loss": 4.8828, "mean_token_accuracy": 0.23647888898849487, "num_tokens": 102457346.0, "step": 44740 }, { "entropy": 5.732340860366821, "epoch": 4.423190984578885, "grad_norm": 1.265625, "learning_rate": 0.0003193910266423952, "loss": 4.9289, "mean_token_accuracy": 0.23004593849182128, "num_tokens": 102469463.0, "step": 44745 }, { "entropy": 5.727120399475098, "epoch": 4.423685251087386, "grad_norm": 1.3125, "learning_rate": 0.00031935642975719936, "loss": 4.9015, "mean_token_accuracy": 0.23419105410575866, "num_tokens": 102480623.0, "step": 44750 }, { "entropy": 5.756617021560669, "epoch": 4.424179517595888, "grad_norm": 1.234375, "learning_rate": 0.0003193218317808284, "loss": 4.9276, "mean_token_accuracy": 0.23384655714035035, "num_tokens": 102492768.0, "step": 44755 }, { "entropy": 5.801549863815308, "epoch": 4.424673784104389, "grad_norm": 1.4140625, "learning_rate": 0.0003192872327141335, "loss": 4.8924, "mean_token_accuracy": 0.23001836240291595, "num_tokens": 102503592.0, "step": 44760 }, { "entropy": 5.766797828674316, "epoch": 4.42516805061289, "grad_norm": 1.2734375, "learning_rate": 0.00031925263255796587, "loss": 4.9237, "mean_token_accuracy": 0.2280314087867737, "num_tokens": 102515056.0, "step": 44765 }, { "entropy": 5.78840708732605, "epoch": 4.425662317121392, "grad_norm": 1.2890625, "learning_rate": 0.00031921803131317657, "loss": 4.9155, "mean_token_accuracy": 0.22566602677106856, "num_tokens": 102525749.0, "step": 44770 }, { "entropy": 5.7522176742553714, "epoch": 4.4261565836298935, "grad_norm": 1.3046875, "learning_rate": 0.0003191834289806169, "loss": 4.9238, "mean_token_accuracy": 0.23341690003871918, "num_tokens": 102537760.0, "step": 44775 }, { "entropy": 5.816337060928345, "epoch": 4.426650850138395, "grad_norm": 1.359375, "learning_rate": 0.0003191488255611379, "loss": 5.0436, "mean_token_accuracy": 0.2216949224472046, "num_tokens": 102548997.0, "step": 44780 }, { "entropy": 5.750407409667969, "epoch": 4.427145116646896, "grad_norm": 1.171875, "learning_rate": 0.000319114221055591, "loss": 4.9493, "mean_token_accuracy": 0.2295815259218216, "num_tokens": 102562056.0, "step": 44785 }, { "entropy": 5.703689670562744, "epoch": 4.427639383155397, "grad_norm": 1.2890625, "learning_rate": 0.0003190796154648275, "loss": 4.7663, "mean_token_accuracy": 0.24367156326770784, "num_tokens": 102573336.0, "step": 44790 }, { "entropy": 5.773833847045898, "epoch": 4.4281336496638986, "grad_norm": 1.234375, "learning_rate": 0.0003190450087896986, "loss": 4.9161, "mean_token_accuracy": 0.2274806395173073, "num_tokens": 102583929.0, "step": 44795 }, { "entropy": 5.750168943405152, "epoch": 4.4286279161724, "grad_norm": 1.40625, "learning_rate": 0.00031901040103105553, "loss": 4.8336, "mean_token_accuracy": 0.2391642227768898, "num_tokens": 102594444.0, "step": 44800 }, { "entropy": 5.757972240447998, "epoch": 4.429122182680901, "grad_norm": 1.1953125, "learning_rate": 0.0003189757921897498, "loss": 4.9625, "mean_token_accuracy": 0.22552814185619355, "num_tokens": 102606357.0, "step": 44805 }, { "entropy": 5.780731248855591, "epoch": 4.429616449189403, "grad_norm": 1.328125, "learning_rate": 0.0003189411822666329, "loss": 4.9497, "mean_token_accuracy": 0.23164233416318894, "num_tokens": 102617798.0, "step": 44810 }, { "entropy": 5.769657850265503, "epoch": 4.4301107156979045, "grad_norm": 1.265625, "learning_rate": 0.00031890657126255596, "loss": 4.8855, "mean_token_accuracy": 0.237362901866436, "num_tokens": 102630104.0, "step": 44815 }, { "entropy": 5.76247501373291, "epoch": 4.430604982206406, "grad_norm": 1.34375, "learning_rate": 0.00031887195917837066, "loss": 4.8496, "mean_token_accuracy": 0.23561314195394517, "num_tokens": 102641469.0, "step": 44820 }, { "entropy": 5.733041667938233, "epoch": 4.431099248714907, "grad_norm": 1.4140625, "learning_rate": 0.00031883734601492823, "loss": 4.9591, "mean_token_accuracy": 0.2274942323565483, "num_tokens": 102653023.0, "step": 44825 }, { "entropy": 5.804011535644531, "epoch": 4.431593515223408, "grad_norm": 1.140625, "learning_rate": 0.0003188027317730803, "loss": 4.9387, "mean_token_accuracy": 0.22652135491371156, "num_tokens": 102665074.0, "step": 44830 }, { "entropy": 5.7715263843536375, "epoch": 4.4320877817319095, "grad_norm": 1.203125, "learning_rate": 0.0003187681164536785, "loss": 4.897, "mean_token_accuracy": 0.23389161229133607, "num_tokens": 102677277.0, "step": 44835 }, { "entropy": 5.786307430267334, "epoch": 4.432582048240411, "grad_norm": 1.4140625, "learning_rate": 0.00031873350005757415, "loss": 4.9277, "mean_token_accuracy": 0.23112163543701172, "num_tokens": 102687375.0, "step": 44840 }, { "entropy": 5.778110694885254, "epoch": 4.433076314748913, "grad_norm": 1.3359375, "learning_rate": 0.00031869888258561897, "loss": 4.899, "mean_token_accuracy": 0.23145822137594224, "num_tokens": 102698305.0, "step": 44845 }, { "entropy": 5.753381633758545, "epoch": 4.433570581257414, "grad_norm": 1.3828125, "learning_rate": 0.00031866426403866444, "loss": 4.9309, "mean_token_accuracy": 0.23085810244083405, "num_tokens": 102711887.0, "step": 44850 }, { "entropy": 5.829583692550659, "epoch": 4.4340648477659155, "grad_norm": 1.3203125, "learning_rate": 0.00031862964441756224, "loss": 4.8807, "mean_token_accuracy": 0.22851230055093766, "num_tokens": 102723187.0, "step": 44855 }, { "entropy": 5.697841024398803, "epoch": 4.434559114274417, "grad_norm": 1.4453125, "learning_rate": 0.0003185950237231641, "loss": 4.8611, "mean_token_accuracy": 0.24009753465652467, "num_tokens": 102733380.0, "step": 44860 }, { "entropy": 5.705118036270141, "epoch": 4.435053380782918, "grad_norm": 1.296875, "learning_rate": 0.00031856040195632154, "loss": 4.9342, "mean_token_accuracy": 0.22359001338481904, "num_tokens": 102746371.0, "step": 44865 }, { "entropy": 5.772717046737671, "epoch": 4.435547647291419, "grad_norm": 1.3984375, "learning_rate": 0.00031852577911788637, "loss": 4.8881, "mean_token_accuracy": 0.24111796915531158, "num_tokens": 102757069.0, "step": 44870 }, { "entropy": 5.756084537506103, "epoch": 4.4360419137999205, "grad_norm": 1.296875, "learning_rate": 0.00031849115520871026, "loss": 4.9206, "mean_token_accuracy": 0.23426035046577454, "num_tokens": 102768323.0, "step": 44875 }, { "entropy": 5.829871797561646, "epoch": 4.436536180308423, "grad_norm": 1.328125, "learning_rate": 0.0003184565302296449, "loss": 4.9544, "mean_token_accuracy": 0.22645423263311387, "num_tokens": 102779330.0, "step": 44880 }, { "entropy": 5.762402009963989, "epoch": 4.437030446816924, "grad_norm": 1.40625, "learning_rate": 0.00031842190418154235, "loss": 4.8828, "mean_token_accuracy": 0.23722873777151107, "num_tokens": 102790288.0, "step": 44885 }, { "entropy": 5.724287700653076, "epoch": 4.437524713325425, "grad_norm": 1.375, "learning_rate": 0.00031838727706525404, "loss": 4.8157, "mean_token_accuracy": 0.24305551946163179, "num_tokens": 102800799.0, "step": 44890 }, { "entropy": 5.772220468521118, "epoch": 4.4380189798339265, "grad_norm": 1.265625, "learning_rate": 0.0003183526488816321, "loss": 4.9205, "mean_token_accuracy": 0.2321889728307724, "num_tokens": 102811811.0, "step": 44895 }, { "entropy": 5.786501741409301, "epoch": 4.438513246342428, "grad_norm": 1.265625, "learning_rate": 0.0003183180196315282, "loss": 4.9479, "mean_token_accuracy": 0.22081732153892517, "num_tokens": 102822851.0, "step": 44900 }, { "entropy": 5.7800191879272464, "epoch": 4.439007512850929, "grad_norm": 1.3046875, "learning_rate": 0.0003182833893157943, "loss": 4.8946, "mean_token_accuracy": 0.225760518014431, "num_tokens": 102833333.0, "step": 44905 }, { "entropy": 5.782329273223877, "epoch": 4.43950177935943, "grad_norm": 1.4296875, "learning_rate": 0.0003182487579352824, "loss": 4.8911, "mean_token_accuracy": 0.2317438989877701, "num_tokens": 102844667.0, "step": 44910 }, { "entropy": 5.8237776279449465, "epoch": 4.439996045867932, "grad_norm": 1.2578125, "learning_rate": 0.00031821412549084426, "loss": 4.9808, "mean_token_accuracy": 0.22645284980535507, "num_tokens": 102856701.0, "step": 44915 }, { "entropy": 5.8112269878387455, "epoch": 4.440490312376434, "grad_norm": 1.265625, "learning_rate": 0.0003181794919833319, "loss": 4.9259, "mean_token_accuracy": 0.22987623810768126, "num_tokens": 102869518.0, "step": 44920 }, { "entropy": 5.759421634674072, "epoch": 4.440984578884935, "grad_norm": 1.2421875, "learning_rate": 0.0003181448574135974, "loss": 4.9414, "mean_token_accuracy": 0.2303444415330887, "num_tokens": 102879839.0, "step": 44925 }, { "entropy": 5.781966018676758, "epoch": 4.441478845393436, "grad_norm": 1.2421875, "learning_rate": 0.0003181102217824927, "loss": 4.8911, "mean_token_accuracy": 0.2298296019434929, "num_tokens": 102892034.0, "step": 44930 }, { "entropy": 5.803639316558838, "epoch": 4.441973111901937, "grad_norm": 1.359375, "learning_rate": 0.00031807558509086987, "loss": 4.9738, "mean_token_accuracy": 0.22538159787654877, "num_tokens": 102903683.0, "step": 44935 }, { "entropy": 5.827106857299805, "epoch": 4.442467378410439, "grad_norm": 1.3203125, "learning_rate": 0.000318040947339581, "loss": 4.9507, "mean_token_accuracy": 0.2275276467204094, "num_tokens": 102915115.0, "step": 44940 }, { "entropy": 5.796533107757568, "epoch": 4.44296164491894, "grad_norm": 1.40625, "learning_rate": 0.000318006308529478, "loss": 4.9146, "mean_token_accuracy": 0.22475071251392365, "num_tokens": 102925765.0, "step": 44945 }, { "entropy": 5.7181822776794435, "epoch": 4.443455911427442, "grad_norm": 1.2109375, "learning_rate": 0.0003179716686614133, "loss": 4.9081, "mean_token_accuracy": 0.227689728140831, "num_tokens": 102937611.0, "step": 44950 }, { "entropy": 5.732023859024048, "epoch": 4.443950177935943, "grad_norm": 1.4296875, "learning_rate": 0.00031793702773623883, "loss": 4.8888, "mean_token_accuracy": 0.2343665897846222, "num_tokens": 102947975.0, "step": 44955 }, { "entropy": 5.730938196182251, "epoch": 4.444444444444445, "grad_norm": 1.2890625, "learning_rate": 0.0003179023857548068, "loss": 4.9394, "mean_token_accuracy": 0.23144738078117372, "num_tokens": 102960040.0, "step": 44960 }, { "entropy": 5.852973175048828, "epoch": 4.444938710952946, "grad_norm": 1.421875, "learning_rate": 0.0003178677427179694, "loss": 5.055, "mean_token_accuracy": 0.22154628336429597, "num_tokens": 102971723.0, "step": 44965 }, { "entropy": 5.781847095489502, "epoch": 4.445432977461447, "grad_norm": 1.234375, "learning_rate": 0.00031783309862657897, "loss": 4.9187, "mean_token_accuracy": 0.2291146770119667, "num_tokens": 102982776.0, "step": 44970 }, { "entropy": 5.849120140075684, "epoch": 4.445927243969948, "grad_norm": 1.4296875, "learning_rate": 0.0003177984534814875, "loss": 5.0446, "mean_token_accuracy": 0.2212783470749855, "num_tokens": 102994043.0, "step": 44975 }, { "entropy": 5.808528757095337, "epoch": 4.44642151047845, "grad_norm": 1.2578125, "learning_rate": 0.0003177638072835476, "loss": 4.9233, "mean_token_accuracy": 0.23067558109760283, "num_tokens": 103005863.0, "step": 44980 }, { "entropy": 5.80425329208374, "epoch": 4.446915776986951, "grad_norm": 1.28125, "learning_rate": 0.00031772916003361136, "loss": 4.9637, "mean_token_accuracy": 0.2263253942131996, "num_tokens": 103017584.0, "step": 44985 }, { "entropy": 5.7601556301116945, "epoch": 4.447410043495453, "grad_norm": 1.2890625, "learning_rate": 0.00031769451173253117, "loss": 4.9273, "mean_token_accuracy": 0.228986257314682, "num_tokens": 103029505.0, "step": 44990 }, { "entropy": 5.824105501174927, "epoch": 4.447904310003954, "grad_norm": 1.3125, "learning_rate": 0.0003176598623811593, "loss": 4.8684, "mean_token_accuracy": 0.23501897156238555, "num_tokens": 103039897.0, "step": 44995 }, { "entropy": 5.819701910018921, "epoch": 4.448398576512456, "grad_norm": 1.203125, "learning_rate": 0.0003176252119803483, "loss": 4.9786, "mean_token_accuracy": 0.22547285556793212, "num_tokens": 103052674.0, "step": 45000 }, { "epoch": 4.448398576512456, "eval_entropy": 5.51085833189379, "eval_loss": 5.003839015960693, "eval_mean_token_accuracy": 0.23369953760838302, "eval_num_tokens": 103052674.0, "eval_runtime": 20.5812, "eval_samples_per_second": 1579.742, "eval_steps_per_second": 197.51, "step": 45000 }, { "entropy": 5.7594677925109865, "epoch": 4.448892843020957, "grad_norm": 1.3046875, "learning_rate": 0.00031759056053095035, "loss": 4.9525, "mean_token_accuracy": 0.2280846953392029, "num_tokens": 103063772.0, "step": 45005 }, { "entropy": 5.784536504745484, "epoch": 4.449387109529458, "grad_norm": 1.3984375, "learning_rate": 0.00031755590803381813, "loss": 4.9093, "mean_token_accuracy": 0.23169808983802795, "num_tokens": 103074784.0, "step": 45010 }, { "entropy": 5.770496559143067, "epoch": 4.449881376037959, "grad_norm": 1.4296875, "learning_rate": 0.0003175212544898038, "loss": 4.8371, "mean_token_accuracy": 0.23846487253904342, "num_tokens": 103085552.0, "step": 45015 }, { "entropy": 5.764013624191284, "epoch": 4.450375642546461, "grad_norm": 1.4296875, "learning_rate": 0.0003174865998997602, "loss": 4.9187, "mean_token_accuracy": 0.23576008081436156, "num_tokens": 103096499.0, "step": 45020 }, { "entropy": 5.693491744995117, "epoch": 4.450869909054963, "grad_norm": 1.2890625, "learning_rate": 0.00031745194426453956, "loss": 4.9192, "mean_token_accuracy": 0.23411534130573272, "num_tokens": 103107669.0, "step": 45025 }, { "entropy": 5.816270923614502, "epoch": 4.451364175563464, "grad_norm": 1.375, "learning_rate": 0.00031741728758499457, "loss": 4.9011, "mean_token_accuracy": 0.23865312933921815, "num_tokens": 103118661.0, "step": 45030 }, { "entropy": 5.892057085037232, "epoch": 4.451858442071965, "grad_norm": 1.46875, "learning_rate": 0.0003173826298619776, "loss": 5.0419, "mean_token_accuracy": 0.22481542378664016, "num_tokens": 103130131.0, "step": 45035 }, { "entropy": 5.81878695487976, "epoch": 4.452352708580467, "grad_norm": 1.234375, "learning_rate": 0.00031734797109634147, "loss": 4.9833, "mean_token_accuracy": 0.22596470713615419, "num_tokens": 103141985.0, "step": 45040 }, { "entropy": 5.844881391525268, "epoch": 4.452846975088968, "grad_norm": 1.3671875, "learning_rate": 0.00031731331128893864, "loss": 5.0043, "mean_token_accuracy": 0.22548459470272064, "num_tokens": 103152442.0, "step": 45045 }, { "entropy": 5.781526565551758, "epoch": 4.453341241597469, "grad_norm": 1.359375, "learning_rate": 0.00031727865044062177, "loss": 4.8951, "mean_token_accuracy": 0.23354577124118805, "num_tokens": 103163196.0, "step": 45050 }, { "entropy": 5.819967317581177, "epoch": 4.45383550810597, "grad_norm": 1.3515625, "learning_rate": 0.0003172439885522436, "loss": 4.9286, "mean_token_accuracy": 0.23250508606433867, "num_tokens": 103173933.0, "step": 45055 }, { "entropy": 5.783967447280884, "epoch": 4.454329774614472, "grad_norm": 1.265625, "learning_rate": 0.00031720932562465673, "loss": 4.9552, "mean_token_accuracy": 0.22930959910154342, "num_tokens": 103186445.0, "step": 45060 }, { "entropy": 5.771194314956665, "epoch": 4.454824041122974, "grad_norm": 1.390625, "learning_rate": 0.00031717466165871386, "loss": 4.9158, "mean_token_accuracy": 0.23100268244743347, "num_tokens": 103198381.0, "step": 45065 }, { "entropy": 5.730855512619018, "epoch": 4.455318307631475, "grad_norm": 1.265625, "learning_rate": 0.00031713999665526784, "loss": 4.8717, "mean_token_accuracy": 0.23673943877220155, "num_tokens": 103209668.0, "step": 45070 }, { "entropy": 5.804381036758423, "epoch": 4.455812574139976, "grad_norm": 1.265625, "learning_rate": 0.0003171053306151713, "loss": 4.9639, "mean_token_accuracy": 0.21901979744434358, "num_tokens": 103222601.0, "step": 45075 }, { "entropy": 5.759120845794678, "epoch": 4.456306840648478, "grad_norm": 1.3203125, "learning_rate": 0.0003170706635392771, "loss": 4.8942, "mean_token_accuracy": 0.22490824908018112, "num_tokens": 103233224.0, "step": 45080 }, { "entropy": 5.741366910934448, "epoch": 4.456801107156979, "grad_norm": 1.359375, "learning_rate": 0.0003170359954284381, "loss": 4.8667, "mean_token_accuracy": 0.2370065540075302, "num_tokens": 103244276.0, "step": 45085 }, { "entropy": 5.809133291244507, "epoch": 4.45729537366548, "grad_norm": 1.578125, "learning_rate": 0.00031700132628350696, "loss": 4.9522, "mean_token_accuracy": 0.23240016996860505, "num_tokens": 103254063.0, "step": 45090 }, { "entropy": 5.810419225692749, "epoch": 4.457789640173981, "grad_norm": 1.2734375, "learning_rate": 0.0003169666561053368, "loss": 4.9716, "mean_token_accuracy": 0.22476155310869217, "num_tokens": 103266634.0, "step": 45095 }, { "entropy": 5.79051513671875, "epoch": 4.4582839066824835, "grad_norm": 1.4140625, "learning_rate": 0.0003169319848947805, "loss": 4.8627, "mean_token_accuracy": 0.23638947755098344, "num_tokens": 103276858.0, "step": 45100 }, { "entropy": 5.796458435058594, "epoch": 4.458778173190985, "grad_norm": 1.1875, "learning_rate": 0.00031689731265269064, "loss": 4.9791, "mean_token_accuracy": 0.2236119583249092, "num_tokens": 103287582.0, "step": 45105 }, { "entropy": 5.78113956451416, "epoch": 4.459272439699486, "grad_norm": 1.5, "learning_rate": 0.00031686263937992054, "loss": 4.9012, "mean_token_accuracy": 0.23414964824914933, "num_tokens": 103298628.0, "step": 45110 }, { "entropy": 5.813367080688477, "epoch": 4.459766706207987, "grad_norm": 1.3671875, "learning_rate": 0.0003168279650773229, "loss": 4.9236, "mean_token_accuracy": 0.23301488757133484, "num_tokens": 103310055.0, "step": 45115 }, { "entropy": 5.768561267852784, "epoch": 4.460260972716489, "grad_norm": 1.296875, "learning_rate": 0.0003167932897457509, "loss": 4.9862, "mean_token_accuracy": 0.2228391408920288, "num_tokens": 103321337.0, "step": 45120 }, { "entropy": 5.804376888275146, "epoch": 4.46075523922499, "grad_norm": 1.3671875, "learning_rate": 0.0003167586133860575, "loss": 4.9828, "mean_token_accuracy": 0.2259013384580612, "num_tokens": 103333753.0, "step": 45125 }, { "entropy": 5.762835931777954, "epoch": 4.461249505733491, "grad_norm": 1.2265625, "learning_rate": 0.0003167239359990957, "loss": 4.8127, "mean_token_accuracy": 0.23836423307657242, "num_tokens": 103345106.0, "step": 45130 }, { "entropy": 5.828259754180908, "epoch": 4.461743772241993, "grad_norm": 1.4296875, "learning_rate": 0.00031668925758571864, "loss": 4.9527, "mean_token_accuracy": 0.22639204412698746, "num_tokens": 103355470.0, "step": 45135 }, { "entropy": 5.799319076538086, "epoch": 4.4622380387504945, "grad_norm": 1.296875, "learning_rate": 0.0003166545781467793, "loss": 4.9397, "mean_token_accuracy": 0.22289031445980073, "num_tokens": 103366422.0, "step": 45140 }, { "entropy": 5.715981197357178, "epoch": 4.462732305258996, "grad_norm": 1.2421875, "learning_rate": 0.0003166198976831309, "loss": 4.7817, "mean_token_accuracy": 0.24110711812973024, "num_tokens": 103377721.0, "step": 45145 }, { "entropy": 5.8008959770202635, "epoch": 4.463226571767497, "grad_norm": 1.2578125, "learning_rate": 0.00031658521619562665, "loss": 4.982, "mean_token_accuracy": 0.22364811599254608, "num_tokens": 103389399.0, "step": 45150 }, { "entropy": 5.702796506881714, "epoch": 4.463720838275998, "grad_norm": 1.3984375, "learning_rate": 0.00031655053368511956, "loss": 4.93, "mean_token_accuracy": 0.23522112518548965, "num_tokens": 103400664.0, "step": 45155 }, { "entropy": 5.7671815872192385, "epoch": 4.4642151047845, "grad_norm": 1.3984375, "learning_rate": 0.0003165158501524629, "loss": 4.9009, "mean_token_accuracy": 0.2301260784268379, "num_tokens": 103411220.0, "step": 45160 }, { "entropy": 5.746367454528809, "epoch": 4.464709371293001, "grad_norm": 1.3515625, "learning_rate": 0.00031648116559850986, "loss": 4.805, "mean_token_accuracy": 0.24461638331413268, "num_tokens": 103421987.0, "step": 45165 }, { "entropy": 5.690417146682739, "epoch": 4.465203637801503, "grad_norm": 1.34375, "learning_rate": 0.00031644648002411373, "loss": 4.835, "mean_token_accuracy": 0.23668057322502137, "num_tokens": 103433397.0, "step": 45170 }, { "entropy": 5.851757335662842, "epoch": 4.465697904310004, "grad_norm": 1.2890625, "learning_rate": 0.0003164117934301278, "loss": 5.0187, "mean_token_accuracy": 0.22407246530056, "num_tokens": 103445332.0, "step": 45175 }, { "entropy": 5.810300636291504, "epoch": 4.4661921708185055, "grad_norm": 1.265625, "learning_rate": 0.0003163771058174053, "loss": 4.9308, "mean_token_accuracy": 0.22863934487104415, "num_tokens": 103456052.0, "step": 45180 }, { "entropy": 5.812199831008911, "epoch": 4.466686437327007, "grad_norm": 1.359375, "learning_rate": 0.0003163424171867996, "loss": 4.9676, "mean_token_accuracy": 0.22579726874828338, "num_tokens": 103467341.0, "step": 45185 }, { "entropy": 5.716512012481689, "epoch": 4.467180703835508, "grad_norm": 1.296875, "learning_rate": 0.000316307727539164, "loss": 4.8285, "mean_token_accuracy": 0.2429486021399498, "num_tokens": 103479383.0, "step": 45190 }, { "entropy": 5.779064750671386, "epoch": 4.467674970344009, "grad_norm": 1.2109375, "learning_rate": 0.0003162730368753518, "loss": 4.9392, "mean_token_accuracy": 0.22418877482414246, "num_tokens": 103491650.0, "step": 45195 }, { "entropy": 5.847826766967773, "epoch": 4.4681692368525106, "grad_norm": 1.3046875, "learning_rate": 0.00031623834519621665, "loss": 5.0074, "mean_token_accuracy": 0.22580087780952454, "num_tokens": 103503276.0, "step": 45200 }, { "entropy": 5.8123682022094725, "epoch": 4.468663503361013, "grad_norm": 1.2109375, "learning_rate": 0.00031620365250261176, "loss": 4.9401, "mean_token_accuracy": 0.23036534190177918, "num_tokens": 103515425.0, "step": 45205 }, { "entropy": 5.706355810165405, "epoch": 4.469157769869514, "grad_norm": 1.4140625, "learning_rate": 0.00031616895879539055, "loss": 4.9065, "mean_token_accuracy": 0.23564016222953796, "num_tokens": 103526166.0, "step": 45210 }, { "entropy": 5.8396265506744385, "epoch": 4.469652036378015, "grad_norm": 1.2734375, "learning_rate": 0.00031613426407540665, "loss": 5.0278, "mean_token_accuracy": 0.22693254947662353, "num_tokens": 103537679.0, "step": 45215 }, { "entropy": 5.795495080947876, "epoch": 4.4701463028865165, "grad_norm": 1.2109375, "learning_rate": 0.00031609956834351344, "loss": 4.8677, "mean_token_accuracy": 0.23599029034376146, "num_tokens": 103548792.0, "step": 45220 }, { "entropy": 5.816911363601685, "epoch": 4.470640569395018, "grad_norm": 1.2734375, "learning_rate": 0.0003160648716005645, "loss": 4.9626, "mean_token_accuracy": 0.22733725607395172, "num_tokens": 103559900.0, "step": 45225 }, { "entropy": 5.788603830337524, "epoch": 4.471134835903519, "grad_norm": 1.3125, "learning_rate": 0.0003160301738474133, "loss": 4.9519, "mean_token_accuracy": 0.23107523918151857, "num_tokens": 103571820.0, "step": 45230 }, { "entropy": 5.7808185577392575, "epoch": 4.47162910241202, "grad_norm": 1.375, "learning_rate": 0.0003159954750849135, "loss": 4.9083, "mean_token_accuracy": 0.23181209862232208, "num_tokens": 103583246.0, "step": 45235 }, { "entropy": 5.850015926361084, "epoch": 4.4721233689205215, "grad_norm": 1.109375, "learning_rate": 0.00031596077531391865, "loss": 4.975, "mean_token_accuracy": 0.22433124631643295, "num_tokens": 103594951.0, "step": 45240 }, { "entropy": 5.827924823760986, "epoch": 4.472617635429024, "grad_norm": 1.375, "learning_rate": 0.00031592607453528236, "loss": 4.982, "mean_token_accuracy": 0.2310337319970131, "num_tokens": 103608304.0, "step": 45245 }, { "entropy": 5.854845142364502, "epoch": 4.473111901937525, "grad_norm": 1.3984375, "learning_rate": 0.00031589137274985827, "loss": 4.9621, "mean_token_accuracy": 0.22753060460090638, "num_tokens": 103619051.0, "step": 45250 }, { "entropy": 5.8117451667785645, "epoch": 4.473606168446026, "grad_norm": 1.3203125, "learning_rate": 0.0003158566699585001, "loss": 4.9618, "mean_token_accuracy": 0.23229935616254807, "num_tokens": 103630330.0, "step": 45255 }, { "entropy": 5.848821592330933, "epoch": 4.4741004349545275, "grad_norm": 1.21875, "learning_rate": 0.00031582196616206147, "loss": 5.0284, "mean_token_accuracy": 0.22590140849351883, "num_tokens": 103642450.0, "step": 45260 }, { "entropy": 5.817962217330932, "epoch": 4.474594701463029, "grad_norm": 1.3515625, "learning_rate": 0.00031578726136139617, "loss": 4.966, "mean_token_accuracy": 0.2260540872812271, "num_tokens": 103653389.0, "step": 45265 }, { "entropy": 5.775904130935669, "epoch": 4.47508896797153, "grad_norm": 1.3359375, "learning_rate": 0.0003157525555573579, "loss": 4.9264, "mean_token_accuracy": 0.2303704097867012, "num_tokens": 103664586.0, "step": 45270 }, { "entropy": 5.7523026943206785, "epoch": 4.475583234480031, "grad_norm": 1.3203125, "learning_rate": 0.0003157178487508005, "loss": 4.9426, "mean_token_accuracy": 0.23125007450580598, "num_tokens": 103675987.0, "step": 45275 }, { "entropy": 5.761595344543457, "epoch": 4.476077500988533, "grad_norm": 1.375, "learning_rate": 0.00031568314094257763, "loss": 4.9427, "mean_token_accuracy": 0.22179912477731706, "num_tokens": 103688649.0, "step": 45280 }, { "entropy": 5.799959373474121, "epoch": 4.476571767497035, "grad_norm": 1.1875, "learning_rate": 0.0003156484321335432, "loss": 4.9848, "mean_token_accuracy": 0.23477091640233994, "num_tokens": 103700582.0, "step": 45285 }, { "entropy": 5.882960033416748, "epoch": 4.477066034005536, "grad_norm": 1.3828125, "learning_rate": 0.00031561372232455105, "loss": 5.0937, "mean_token_accuracy": 0.218164823949337, "num_tokens": 103712705.0, "step": 45290 }, { "entropy": 5.76187915802002, "epoch": 4.477560300514037, "grad_norm": 1.296875, "learning_rate": 0.0003155790115164551, "loss": 4.9139, "mean_token_accuracy": 0.23022040575742722, "num_tokens": 103723128.0, "step": 45295 }, { "entropy": 5.819494581222534, "epoch": 4.4780545670225385, "grad_norm": 1.5390625, "learning_rate": 0.00031554429971010907, "loss": 4.9181, "mean_token_accuracy": 0.22745622992515563, "num_tokens": 103734443.0, "step": 45300 }, { "entropy": 5.732424211502075, "epoch": 4.47854883353104, "grad_norm": 1.3203125, "learning_rate": 0.00031550958690636693, "loss": 4.8758, "mean_token_accuracy": 0.2363263949751854, "num_tokens": 103746838.0, "step": 45305 }, { "entropy": 5.768497657775879, "epoch": 4.479043100039541, "grad_norm": 1.2734375, "learning_rate": 0.00031547487310608276, "loss": 4.942, "mean_token_accuracy": 0.23609296828508378, "num_tokens": 103756924.0, "step": 45310 }, { "entropy": 5.803349876403809, "epoch": 4.479537366548042, "grad_norm": 1.296875, "learning_rate": 0.0003154401583101104, "loss": 4.9651, "mean_token_accuracy": 0.2180570513010025, "num_tokens": 103769332.0, "step": 45315 }, { "entropy": 5.789024734497071, "epoch": 4.480031633056544, "grad_norm": 1.265625, "learning_rate": 0.0003154054425193039, "loss": 4.9036, "mean_token_accuracy": 0.2341454282402992, "num_tokens": 103781149.0, "step": 45320 }, { "entropy": 5.85286545753479, "epoch": 4.480525899565046, "grad_norm": 1.3203125, "learning_rate": 0.00031537072573451717, "loss": 5.0133, "mean_token_accuracy": 0.22293965071439742, "num_tokens": 103792217.0, "step": 45325 }, { "entropy": 5.742894458770752, "epoch": 4.481020166073547, "grad_norm": 1.1953125, "learning_rate": 0.0003153360079566044, "loss": 4.8979, "mean_token_accuracy": 0.23371906727552413, "num_tokens": 103803628.0, "step": 45330 }, { "entropy": 5.748565149307251, "epoch": 4.481514432582048, "grad_norm": 1.296875, "learning_rate": 0.0003153012891864196, "loss": 4.9089, "mean_token_accuracy": 0.22793481796979903, "num_tokens": 103814735.0, "step": 45335 }, { "entropy": 5.792451572418213, "epoch": 4.482008699090549, "grad_norm": 1.2890625, "learning_rate": 0.00031526656942481673, "loss": 4.9336, "mean_token_accuracy": 0.23010524362325668, "num_tokens": 103825952.0, "step": 45340 }, { "entropy": 5.71683259010315, "epoch": 4.482502965599051, "grad_norm": 1.28125, "learning_rate": 0.00031523184867265013, "loss": 4.9292, "mean_token_accuracy": 0.2290325328707695, "num_tokens": 103836558.0, "step": 45345 }, { "entropy": 5.789231777191162, "epoch": 4.482997232107552, "grad_norm": 1.296875, "learning_rate": 0.00031519712693077375, "loss": 4.9554, "mean_token_accuracy": 0.22570794969797134, "num_tokens": 103848453.0, "step": 45350 }, { "entropy": 5.769028854370117, "epoch": 4.483491498616054, "grad_norm": 1.3125, "learning_rate": 0.0003151624042000418, "loss": 4.8409, "mean_token_accuracy": 0.23806987851858138, "num_tokens": 103860603.0, "step": 45355 }, { "entropy": 5.764129686355591, "epoch": 4.483985765124555, "grad_norm": 1.34375, "learning_rate": 0.00031512768048130846, "loss": 4.9581, "mean_token_accuracy": 0.23115486800670623, "num_tokens": 103870678.0, "step": 45360 }, { "entropy": 5.759457969665528, "epoch": 4.484480031633057, "grad_norm": 1.3515625, "learning_rate": 0.00031509295577542804, "loss": 4.9178, "mean_token_accuracy": 0.22873513251543046, "num_tokens": 103881139.0, "step": 45365 }, { "entropy": 5.766952800750732, "epoch": 4.484974298141558, "grad_norm": 1.359375, "learning_rate": 0.0003150582300832546, "loss": 4.8924, "mean_token_accuracy": 0.2364226222038269, "num_tokens": 103892623.0, "step": 45370 }, { "entropy": 5.85888442993164, "epoch": 4.485468564650059, "grad_norm": 1.25, "learning_rate": 0.0003150235034056425, "loss": 4.9464, "mean_token_accuracy": 0.22653366774320602, "num_tokens": 103905278.0, "step": 45375 }, { "entropy": 5.813764762878418, "epoch": 4.48596283115856, "grad_norm": 1.265625, "learning_rate": 0.00031498877574344603, "loss": 4.9142, "mean_token_accuracy": 0.22859687060117723, "num_tokens": 103916363.0, "step": 45380 }, { "entropy": 5.725140190124511, "epoch": 4.486457097667062, "grad_norm": 1.140625, "learning_rate": 0.00031495404709751945, "loss": 4.9219, "mean_token_accuracy": 0.2254478380084038, "num_tokens": 103927764.0, "step": 45385 }, { "entropy": 5.737674713134766, "epoch": 4.486951364175564, "grad_norm": 1.453125, "learning_rate": 0.00031491931746871715, "loss": 4.9028, "mean_token_accuracy": 0.2328400582075119, "num_tokens": 103938415.0, "step": 45390 }, { "entropy": 5.7559370517730715, "epoch": 4.487445630684065, "grad_norm": 1.3515625, "learning_rate": 0.0003148845868578934, "loss": 4.8451, "mean_token_accuracy": 0.23926866203546523, "num_tokens": 103949282.0, "step": 45395 }, { "entropy": 5.72900800704956, "epoch": 4.487939897192566, "grad_norm": 1.2890625, "learning_rate": 0.0003148498552659026, "loss": 4.9005, "mean_token_accuracy": 0.23042674511671066, "num_tokens": 103960896.0, "step": 45400 }, { "entropy": 5.753850936889648, "epoch": 4.488434163701068, "grad_norm": 1.4453125, "learning_rate": 0.0003148151226935993, "loss": 4.8691, "mean_token_accuracy": 0.24018344581127166, "num_tokens": 103970696.0, "step": 45405 }, { "entropy": 5.900739955902099, "epoch": 4.488928430209569, "grad_norm": 1.265625, "learning_rate": 0.00031478038914183764, "loss": 5.1279, "mean_token_accuracy": 0.210573410987854, "num_tokens": 103984218.0, "step": 45410 }, { "entropy": 5.766367197036743, "epoch": 4.48942269671807, "grad_norm": 1.390625, "learning_rate": 0.00031474565461147235, "loss": 4.9062, "mean_token_accuracy": 0.23101238161325455, "num_tokens": 103994871.0, "step": 45415 }, { "entropy": 5.656657123565674, "epoch": 4.489916963226571, "grad_norm": 1.3046875, "learning_rate": 0.0003147109191033578, "loss": 4.7248, "mean_token_accuracy": 0.24869392067193985, "num_tokens": 104005629.0, "step": 45420 }, { "entropy": 5.748292541503906, "epoch": 4.490411229735074, "grad_norm": 1.484375, "learning_rate": 0.0003146761826183484, "loss": 4.8395, "mean_token_accuracy": 0.2364925593137741, "num_tokens": 104016257.0, "step": 45425 }, { "entropy": 5.741846513748169, "epoch": 4.490905496243575, "grad_norm": 1.2578125, "learning_rate": 0.0003146414451572988, "loss": 4.8516, "mean_token_accuracy": 0.23508195877075194, "num_tokens": 104028322.0, "step": 45430 }, { "entropy": 5.849905490875244, "epoch": 4.491399762752076, "grad_norm": 1.3046875, "learning_rate": 0.00031460670672106355, "loss": 4.8885, "mean_token_accuracy": 0.23126174956560136, "num_tokens": 104039349.0, "step": 45435 }, { "entropy": 5.797709989547729, "epoch": 4.491894029260577, "grad_norm": 1.2578125, "learning_rate": 0.0003145719673104971, "loss": 4.9685, "mean_token_accuracy": 0.21894969940185546, "num_tokens": 104050585.0, "step": 45440 }, { "entropy": 5.7235959529876705, "epoch": 4.492388295769079, "grad_norm": 1.359375, "learning_rate": 0.00031453722692645407, "loss": 4.831, "mean_token_accuracy": 0.23474867045879363, "num_tokens": 104060623.0, "step": 45445 }, { "entropy": 5.712519216537475, "epoch": 4.49288256227758, "grad_norm": 1.3828125, "learning_rate": 0.00031450248556978927, "loss": 4.8772, "mean_token_accuracy": 0.23690192252397538, "num_tokens": 104070880.0, "step": 45450 }, { "entropy": 5.808254051208496, "epoch": 4.493376828786081, "grad_norm": 1.234375, "learning_rate": 0.0003144677432413571, "loss": 4.9881, "mean_token_accuracy": 0.22447519600391388, "num_tokens": 104082686.0, "step": 45455 }, { "entropy": 5.764213514328003, "epoch": 4.493871095294583, "grad_norm": 1.421875, "learning_rate": 0.00031443299994201234, "loss": 4.9617, "mean_token_accuracy": 0.2254466861486435, "num_tokens": 104093746.0, "step": 45460 }, { "entropy": 5.806276178359985, "epoch": 4.4943653618030845, "grad_norm": 1.3515625, "learning_rate": 0.0003143982556726097, "loss": 4.9247, "mean_token_accuracy": 0.2323767676949501, "num_tokens": 104104843.0, "step": 45465 }, { "entropy": 5.718568229675293, "epoch": 4.494859628311586, "grad_norm": 1.3984375, "learning_rate": 0.0003143635104340037, "loss": 4.8062, "mean_token_accuracy": 0.24710734635591508, "num_tokens": 104115317.0, "step": 45470 }, { "entropy": 5.7181707382202145, "epoch": 4.495353894820087, "grad_norm": 1.15625, "learning_rate": 0.00031432876422704943, "loss": 4.8836, "mean_token_accuracy": 0.22716282606124877, "num_tokens": 104126775.0, "step": 45475 }, { "entropy": 5.7147480010986325, "epoch": 4.495848161328588, "grad_norm": 1.1875, "learning_rate": 0.0003142940170526014, "loss": 4.873, "mean_token_accuracy": 0.23321637362241746, "num_tokens": 104138343.0, "step": 45480 }, { "entropy": 5.861667728424072, "epoch": 4.49634242783709, "grad_norm": 1.4375, "learning_rate": 0.0003142592689115145, "loss": 4.9535, "mean_token_accuracy": 0.22753961831331254, "num_tokens": 104149406.0, "step": 45485 }, { "entropy": 5.820281553268432, "epoch": 4.496836694345591, "grad_norm": 1.265625, "learning_rate": 0.0003142245198046434, "loss": 4.9479, "mean_token_accuracy": 0.22834640890359878, "num_tokens": 104159665.0, "step": 45490 }, { "entropy": 5.78868670463562, "epoch": 4.497330960854092, "grad_norm": 1.359375, "learning_rate": 0.0003141897697328431, "loss": 4.9912, "mean_token_accuracy": 0.2187335729598999, "num_tokens": 104171195.0, "step": 45495 }, { "entropy": 5.774057769775391, "epoch": 4.497825227362594, "grad_norm": 1.5, "learning_rate": 0.0003141550186969683, "loss": 4.9262, "mean_token_accuracy": 0.23265533596277238, "num_tokens": 104182035.0, "step": 45500 }, { "entropy": 5.798000621795654, "epoch": 4.4983194938710955, "grad_norm": 1.3515625, "learning_rate": 0.000314120266697874, "loss": 4.9079, "mean_token_accuracy": 0.22686358839273452, "num_tokens": 104192643.0, "step": 45505 }, { "entropy": 5.732927227020264, "epoch": 4.498813760379597, "grad_norm": 1.2109375, "learning_rate": 0.00031408551373641514, "loss": 4.8567, "mean_token_accuracy": 0.23118343949317932, "num_tokens": 104205079.0, "step": 45510 }, { "entropy": 5.758198213577271, "epoch": 4.499308026888098, "grad_norm": 1.328125, "learning_rate": 0.0003140507598134465, "loss": 4.9619, "mean_token_accuracy": 0.22676891833543777, "num_tokens": 104216495.0, "step": 45515 }, { "entropy": 5.81792140007019, "epoch": 4.499802293396599, "grad_norm": 1.3828125, "learning_rate": 0.0003140160049298231, "loss": 5.0228, "mean_token_accuracy": 0.22965183854103088, "num_tokens": 104228115.0, "step": 45520 }, { "entropy": 5.784226560592652, "epoch": 4.500296559905101, "grad_norm": 1.1171875, "learning_rate": 0.00031398124908639996, "loss": 4.9113, "mean_token_accuracy": 0.231858529150486, "num_tokens": 104241184.0, "step": 45525 }, { "entropy": 5.786034202575683, "epoch": 4.500790826413602, "grad_norm": 1.1796875, "learning_rate": 0.00031394649228403207, "loss": 4.9453, "mean_token_accuracy": 0.22771105915308, "num_tokens": 104253039.0, "step": 45530 }, { "entropy": 5.731417846679688, "epoch": 4.501285092922103, "grad_norm": 1.5078125, "learning_rate": 0.0003139117345235744, "loss": 4.86, "mean_token_accuracy": 0.23112557083368301, "num_tokens": 104263536.0, "step": 45535 }, { "entropy": 5.697473049163818, "epoch": 4.501779359430605, "grad_norm": 1.375, "learning_rate": 0.000313876975805882, "loss": 4.8434, "mean_token_accuracy": 0.24049308001995087, "num_tokens": 104275744.0, "step": 45540 }, { "entropy": 5.7183098793029785, "epoch": 4.5022736259391065, "grad_norm": 1.25, "learning_rate": 0.00031384221613181, "loss": 4.8633, "mean_token_accuracy": 0.23792820274829865, "num_tokens": 104286338.0, "step": 45545 }, { "entropy": 5.7764688491821286, "epoch": 4.502767892447608, "grad_norm": 1.1015625, "learning_rate": 0.00031380745550221346, "loss": 4.899, "mean_token_accuracy": 0.2315663665533066, "num_tokens": 104298641.0, "step": 45550 }, { "entropy": 5.7993558883667, "epoch": 4.503262158956109, "grad_norm": 1.34375, "learning_rate": 0.00031377269391794744, "loss": 4.9367, "mean_token_accuracy": 0.22540636956691742, "num_tokens": 104308973.0, "step": 45555 }, { "entropy": 5.724284648895264, "epoch": 4.50375642546461, "grad_norm": 1.3671875, "learning_rate": 0.00031373793137986724, "loss": 4.8633, "mean_token_accuracy": 0.24258564561605453, "num_tokens": 104320949.0, "step": 45560 }, { "entropy": 5.799285650253296, "epoch": 4.504250691973112, "grad_norm": 1.3671875, "learning_rate": 0.0003137031678888278, "loss": 4.9345, "mean_token_accuracy": 0.23465042263269426, "num_tokens": 104332190.0, "step": 45565 }, { "entropy": 5.818480157852173, "epoch": 4.504744958481613, "grad_norm": 1.265625, "learning_rate": 0.00031366840344568443, "loss": 4.9429, "mean_token_accuracy": 0.22992178946733474, "num_tokens": 104342936.0, "step": 45570 }, { "entropy": 5.789445304870606, "epoch": 4.505239224990115, "grad_norm": 1.390625, "learning_rate": 0.0003136336380512925, "loss": 4.9511, "mean_token_accuracy": 0.22872791588306426, "num_tokens": 104353556.0, "step": 45575 }, { "entropy": 5.818964195251465, "epoch": 4.505733491498616, "grad_norm": 1.3203125, "learning_rate": 0.00031359887170650695, "loss": 4.9685, "mean_token_accuracy": 0.22081490308046342, "num_tokens": 104364960.0, "step": 45580 }, { "entropy": 5.8182331085205075, "epoch": 4.5062277580071175, "grad_norm": 1.359375, "learning_rate": 0.0003135641044121831, "loss": 4.9641, "mean_token_accuracy": 0.2231404036283493, "num_tokens": 104376101.0, "step": 45585 }, { "entropy": 5.7885191440582275, "epoch": 4.506722024515619, "grad_norm": 1.359375, "learning_rate": 0.00031352933616917637, "loss": 4.9624, "mean_token_accuracy": 0.22957054078578948, "num_tokens": 104386981.0, "step": 45590 }, { "entropy": 5.755187892913819, "epoch": 4.50721629102412, "grad_norm": 1.328125, "learning_rate": 0.00031349456697834203, "loss": 4.9001, "mean_token_accuracy": 0.22705262899398804, "num_tokens": 104398275.0, "step": 45595 }, { "entropy": 5.805354499816895, "epoch": 4.507710557532621, "grad_norm": 1.21875, "learning_rate": 0.0003134597968405354, "loss": 4.9888, "mean_token_accuracy": 0.22353918552398683, "num_tokens": 104409337.0, "step": 45600 }, { "entropy": 5.807986831665039, "epoch": 4.5082048240411225, "grad_norm": 1.34375, "learning_rate": 0.00031342502575661173, "loss": 4.9553, "mean_token_accuracy": 0.23028065413236617, "num_tokens": 104420880.0, "step": 45605 }, { "entropy": 5.744704484939575, "epoch": 4.508699090549625, "grad_norm": 1.3515625, "learning_rate": 0.00031339025372742647, "loss": 4.8511, "mean_token_accuracy": 0.23837293088436126, "num_tokens": 104432398.0, "step": 45610 }, { "entropy": 5.760972690582276, "epoch": 4.509193357058126, "grad_norm": 1.296875, "learning_rate": 0.00031335548075383504, "loss": 4.939, "mean_token_accuracy": 0.22678867727518082, "num_tokens": 104444008.0, "step": 45615 }, { "entropy": 5.8074994564056395, "epoch": 4.509687623566627, "grad_norm": 1.359375, "learning_rate": 0.0003133207068366928, "loss": 4.9785, "mean_token_accuracy": 0.22550204545259475, "num_tokens": 104456059.0, "step": 45620 }, { "entropy": 5.758225345611573, "epoch": 4.5101818900751285, "grad_norm": 1.3203125, "learning_rate": 0.0003132859319768553, "loss": 4.9449, "mean_token_accuracy": 0.23146769553422927, "num_tokens": 104467757.0, "step": 45625 }, { "entropy": 5.782956886291504, "epoch": 4.51067615658363, "grad_norm": 1.3046875, "learning_rate": 0.00031325115617517784, "loss": 4.9561, "mean_token_accuracy": 0.22635255008935928, "num_tokens": 104479102.0, "step": 45630 }, { "entropy": 5.733843851089477, "epoch": 4.511170423092131, "grad_norm": 1.3515625, "learning_rate": 0.000313216379432516, "loss": 4.8669, "mean_token_accuracy": 0.23859147876501083, "num_tokens": 104490515.0, "step": 45635 }, { "entropy": 5.817013931274414, "epoch": 4.511664689600632, "grad_norm": 1.3671875, "learning_rate": 0.0003131816017497254, "loss": 4.9485, "mean_token_accuracy": 0.22880192399024962, "num_tokens": 104502539.0, "step": 45640 }, { "entropy": 5.784474802017212, "epoch": 4.512158956109134, "grad_norm": 1.2734375, "learning_rate": 0.0003131468231276614, "loss": 4.9145, "mean_token_accuracy": 0.22501565963029863, "num_tokens": 104514763.0, "step": 45645 }, { "entropy": 5.838056564331055, "epoch": 4.512653222617636, "grad_norm": 1.171875, "learning_rate": 0.00031311204356717964, "loss": 4.9709, "mean_token_accuracy": 0.22233615964651107, "num_tokens": 104527192.0, "step": 45650 }, { "entropy": 5.766119289398193, "epoch": 4.513147489126137, "grad_norm": 1.4609375, "learning_rate": 0.0003130772630691357, "loss": 4.9044, "mean_token_accuracy": 0.240135994553566, "num_tokens": 104539482.0, "step": 45655 }, { "entropy": 5.793220186233521, "epoch": 4.513641755634638, "grad_norm": 1.3984375, "learning_rate": 0.00031304248163438513, "loss": 4.9257, "mean_token_accuracy": 0.2305889382958412, "num_tokens": 104551168.0, "step": 45660 }, { "entropy": 5.826167106628418, "epoch": 4.5141360221431395, "grad_norm": 1.3359375, "learning_rate": 0.00031300769926378367, "loss": 4.9876, "mean_token_accuracy": 0.22297198474407195, "num_tokens": 104562516.0, "step": 45665 }, { "entropy": 5.810970640182495, "epoch": 4.514630288651641, "grad_norm": 1.2578125, "learning_rate": 0.00031297291595818697, "loss": 4.9268, "mean_token_accuracy": 0.23705515265464783, "num_tokens": 104573665.0, "step": 45670 }, { "entropy": 5.7266350269317625, "epoch": 4.515124555160142, "grad_norm": 1.296875, "learning_rate": 0.0003129381317184506, "loss": 4.8754, "mean_token_accuracy": 0.23252833336591722, "num_tokens": 104584596.0, "step": 45675 }, { "entropy": 5.692915964126587, "epoch": 4.515618821668644, "grad_norm": 1.3125, "learning_rate": 0.0003129033465454303, "loss": 4.8809, "mean_token_accuracy": 0.23240439593791962, "num_tokens": 104596961.0, "step": 45680 }, { "entropy": 5.813670492172241, "epoch": 4.516113088177145, "grad_norm": 1.234375, "learning_rate": 0.00031286856043998175, "loss": 4.9821, "mean_token_accuracy": 0.23345856368541718, "num_tokens": 104609479.0, "step": 45685 }, { "entropy": 5.839987182617188, "epoch": 4.516607354685647, "grad_norm": 1.1640625, "learning_rate": 0.0003128337734029607, "loss": 4.9974, "mean_token_accuracy": 0.22323267608880998, "num_tokens": 104622690.0, "step": 45690 }, { "entropy": 5.807674551010132, "epoch": 4.517101621194148, "grad_norm": 1.375, "learning_rate": 0.0003127989854352231, "loss": 4.8806, "mean_token_accuracy": 0.23564257323741913, "num_tokens": 104633005.0, "step": 45695 }, { "entropy": 5.799054098129273, "epoch": 4.517595887702649, "grad_norm": 1.25, "learning_rate": 0.0003127641965376245, "loss": 4.9637, "mean_token_accuracy": 0.22782188057899475, "num_tokens": 104646209.0, "step": 45700 }, { "entropy": 5.773272943496704, "epoch": 4.5180901542111505, "grad_norm": 1.296875, "learning_rate": 0.0003127294067110208, "loss": 4.9308, "mean_token_accuracy": 0.2275946170091629, "num_tokens": 104657833.0, "step": 45705 }, { "entropy": 5.786072015762329, "epoch": 4.518584420719652, "grad_norm": 1.2578125, "learning_rate": 0.00031269461595626784, "loss": 4.9649, "mean_token_accuracy": 0.2236754685640335, "num_tokens": 104668858.0, "step": 45710 }, { "entropy": 5.78107590675354, "epoch": 4.519078687228154, "grad_norm": 1.3125, "learning_rate": 0.00031265982427422154, "loss": 4.908, "mean_token_accuracy": 0.22265292406082154, "num_tokens": 104681231.0, "step": 45715 }, { "entropy": 5.852201128005982, "epoch": 4.519572953736655, "grad_norm": 1.234375, "learning_rate": 0.00031262503166573776, "loss": 5.0271, "mean_token_accuracy": 0.22966112047433854, "num_tokens": 104693543.0, "step": 45720 }, { "entropy": 5.773343944549561, "epoch": 4.520067220245156, "grad_norm": 1.3671875, "learning_rate": 0.00031259023813167227, "loss": 4.8934, "mean_token_accuracy": 0.2293206572532654, "num_tokens": 104704642.0, "step": 45725 }, { "entropy": 5.7721751689910885, "epoch": 4.520561486753658, "grad_norm": 1.2578125, "learning_rate": 0.0003125554436728811, "loss": 4.9291, "mean_token_accuracy": 0.2256588250398636, "num_tokens": 104715931.0, "step": 45730 }, { "entropy": 5.772691535949707, "epoch": 4.521055753262159, "grad_norm": 1.3125, "learning_rate": 0.00031252064829022017, "loss": 4.9025, "mean_token_accuracy": 0.2356062114238739, "num_tokens": 104727561.0, "step": 45735 }, { "entropy": 5.802690696716309, "epoch": 4.52155001977066, "grad_norm": 1.265625, "learning_rate": 0.00031248585198454556, "loss": 4.9542, "mean_token_accuracy": 0.22885042130947114, "num_tokens": 104740127.0, "step": 45740 }, { "entropy": 5.8079160213470455, "epoch": 4.522044286279161, "grad_norm": 1.296875, "learning_rate": 0.00031245105475671305, "loss": 4.9222, "mean_token_accuracy": 0.23039889186620713, "num_tokens": 104752255.0, "step": 45745 }, { "entropy": 5.810000658035278, "epoch": 4.522538552787664, "grad_norm": 1.390625, "learning_rate": 0.00031241625660757887, "loss": 4.9906, "mean_token_accuracy": 0.21968691498041154, "num_tokens": 104763956.0, "step": 45750 }, { "entropy": 5.761193752288818, "epoch": 4.523032819296165, "grad_norm": 1.1953125, "learning_rate": 0.00031238145753799895, "loss": 4.9083, "mean_token_accuracy": 0.22877920120954515, "num_tokens": 104775608.0, "step": 45755 }, { "entropy": 5.797948503494263, "epoch": 4.523527085804666, "grad_norm": 1.15625, "learning_rate": 0.00031234665754882937, "loss": 4.8653, "mean_token_accuracy": 0.2278096243739128, "num_tokens": 104786958.0, "step": 45760 }, { "entropy": 5.829562187194824, "epoch": 4.524021352313167, "grad_norm": 1.2734375, "learning_rate": 0.00031231185664092623, "loss": 4.9983, "mean_token_accuracy": 0.21904897093772888, "num_tokens": 104798155.0, "step": 45765 }, { "entropy": 5.781052780151367, "epoch": 4.524515618821669, "grad_norm": 1.2734375, "learning_rate": 0.00031227705481514566, "loss": 4.9041, "mean_token_accuracy": 0.22937185317277908, "num_tokens": 104809378.0, "step": 45770 }, { "entropy": 5.740417003631592, "epoch": 4.52500988533017, "grad_norm": 1.265625, "learning_rate": 0.00031224225207234375, "loss": 4.8765, "mean_token_accuracy": 0.2324560448527336, "num_tokens": 104820223.0, "step": 45775 }, { "entropy": 5.826227712631225, "epoch": 4.525504151838671, "grad_norm": 1.1640625, "learning_rate": 0.0003122074484133766, "loss": 4.9391, "mean_token_accuracy": 0.23290713280439376, "num_tokens": 104833665.0, "step": 45780 }, { "entropy": 5.781940126419068, "epoch": 4.525998418347172, "grad_norm": 1.2890625, "learning_rate": 0.0003121726438391005, "loss": 4.9134, "mean_token_accuracy": 0.23552767634391786, "num_tokens": 104845405.0, "step": 45785 }, { "entropy": 5.8112023830413815, "epoch": 4.526492684855674, "grad_norm": 1.3125, "learning_rate": 0.0003121378383503716, "loss": 5.017, "mean_token_accuracy": 0.2193110242486, "num_tokens": 104856388.0, "step": 45790 }, { "entropy": 5.776507425308227, "epoch": 4.526986951364176, "grad_norm": 1.2421875, "learning_rate": 0.0003121030319480461, "loss": 4.9327, "mean_token_accuracy": 0.2277138724923134, "num_tokens": 104868214.0, "step": 45795 }, { "entropy": 5.772354698181152, "epoch": 4.527481217872677, "grad_norm": 1.3203125, "learning_rate": 0.00031206822463298017, "loss": 4.8776, "mean_token_accuracy": 0.2362642616033554, "num_tokens": 104880894.0, "step": 45800 }, { "entropy": 5.808596515655518, "epoch": 4.527975484381178, "grad_norm": 1.6796875, "learning_rate": 0.0003120334164060303, "loss": 4.9552, "mean_token_accuracy": 0.22429129034280776, "num_tokens": 104894244.0, "step": 45805 }, { "entropy": 5.79736180305481, "epoch": 4.52846975088968, "grad_norm": 1.2890625, "learning_rate": 0.0003119986072680526, "loss": 4.8902, "mean_token_accuracy": 0.2254765287041664, "num_tokens": 104904960.0, "step": 45810 }, { "entropy": 5.778193140029908, "epoch": 4.528964017398181, "grad_norm": 1.2421875, "learning_rate": 0.0003119637972199034, "loss": 4.9993, "mean_token_accuracy": 0.22231073528528214, "num_tokens": 104917574.0, "step": 45815 }, { "entropy": 5.716688108444214, "epoch": 4.529458283906682, "grad_norm": 1.3046875, "learning_rate": 0.00031192898626243907, "loss": 4.8244, "mean_token_accuracy": 0.23645983934402465, "num_tokens": 104928131.0, "step": 45820 }, { "entropy": 5.824159383773804, "epoch": 4.529952550415183, "grad_norm": 1.4140625, "learning_rate": 0.00031189417439651584, "loss": 4.9424, "mean_token_accuracy": 0.22612955868244172, "num_tokens": 104939166.0, "step": 45825 }, { "entropy": 5.758881902694702, "epoch": 4.530446816923686, "grad_norm": 1.3984375, "learning_rate": 0.0003118593616229904, "loss": 4.9334, "mean_token_accuracy": 0.23210021555423738, "num_tokens": 104949595.0, "step": 45830 }, { "entropy": 5.810052919387817, "epoch": 4.530941083432187, "grad_norm": 1.3359375, "learning_rate": 0.0003118245479427188, "loss": 4.9275, "mean_token_accuracy": 0.22450329959392548, "num_tokens": 104961089.0, "step": 45835 }, { "entropy": 5.780639266967773, "epoch": 4.531435349940688, "grad_norm": 1.2734375, "learning_rate": 0.0003117897333565577, "loss": 4.9542, "mean_token_accuracy": 0.22893834710121155, "num_tokens": 104972199.0, "step": 45840 }, { "entropy": 5.761220932006836, "epoch": 4.531929616449189, "grad_norm": 1.2890625, "learning_rate": 0.0003117549178653634, "loss": 4.8822, "mean_token_accuracy": 0.24257535338401795, "num_tokens": 104984286.0, "step": 45845 }, { "entropy": 5.80683708190918, "epoch": 4.532423882957691, "grad_norm": 1.4296875, "learning_rate": 0.0003117201014699924, "loss": 4.8793, "mean_token_accuracy": 0.23434792459011078, "num_tokens": 104995339.0, "step": 45850 }, { "entropy": 5.837441444396973, "epoch": 4.532918149466192, "grad_norm": 1.28125, "learning_rate": 0.0003116852841713012, "loss": 5.0316, "mean_token_accuracy": 0.216287998855114, "num_tokens": 105006199.0, "step": 45855 }, { "entropy": 5.794378137588501, "epoch": 4.533412415974693, "grad_norm": 1.234375, "learning_rate": 0.0003116504659701463, "loss": 4.9235, "mean_token_accuracy": 0.2343118518590927, "num_tokens": 105017222.0, "step": 45860 }, { "entropy": 5.753310632705689, "epoch": 4.533906682483195, "grad_norm": 1.2734375, "learning_rate": 0.00031161564686738437, "loss": 4.8946, "mean_token_accuracy": 0.22981908917427063, "num_tokens": 105028260.0, "step": 45865 }, { "entropy": 5.770794534683228, "epoch": 4.5344009489916965, "grad_norm": 1.390625, "learning_rate": 0.00031158082686387175, "loss": 4.9073, "mean_token_accuracy": 0.23393017202615737, "num_tokens": 105040397.0, "step": 45870 }, { "entropy": 5.7791064262390135, "epoch": 4.534895215500198, "grad_norm": 1.3671875, "learning_rate": 0.0003115460059604652, "loss": 4.9727, "mean_token_accuracy": 0.23050335496664048, "num_tokens": 105051291.0, "step": 45875 }, { "entropy": 5.86417965888977, "epoch": 4.535389482008699, "grad_norm": 1.375, "learning_rate": 0.0003115111841580211, "loss": 5.022, "mean_token_accuracy": 0.22395497411489487, "num_tokens": 105063224.0, "step": 45880 }, { "entropy": 5.839791774749756, "epoch": 4.5358837485172, "grad_norm": 1.3203125, "learning_rate": 0.00031147636145739633, "loss": 4.9596, "mean_token_accuracy": 0.22914834022521974, "num_tokens": 105074750.0, "step": 45885 }, { "entropy": 5.760359907150269, "epoch": 4.536378015025702, "grad_norm": 1.1953125, "learning_rate": 0.0003114415378594473, "loss": 4.8946, "mean_token_accuracy": 0.23531904369592666, "num_tokens": 105086782.0, "step": 45890 }, { "entropy": 5.8248707294464115, "epoch": 4.536872281534203, "grad_norm": 1.203125, "learning_rate": 0.00031140671336503086, "loss": 5.0713, "mean_token_accuracy": 0.22133518904447555, "num_tokens": 105099540.0, "step": 45895 }, { "entropy": 5.826449537277222, "epoch": 4.537366548042705, "grad_norm": 1.296875, "learning_rate": 0.00031137188797500365, "loss": 5.0316, "mean_token_accuracy": 0.22160473167896272, "num_tokens": 105112212.0, "step": 45900 }, { "entropy": 5.823426818847656, "epoch": 4.537860814551206, "grad_norm": 1.3359375, "learning_rate": 0.0003113370616902223, "loss": 4.9833, "mean_token_accuracy": 0.22607220560312272, "num_tokens": 105124397.0, "step": 45905 }, { "entropy": 5.879618072509766, "epoch": 4.5383550810597075, "grad_norm": 1.25, "learning_rate": 0.0003113022345115436, "loss": 5.0173, "mean_token_accuracy": 0.2288053959608078, "num_tokens": 105138114.0, "step": 45910 }, { "entropy": 5.85983247756958, "epoch": 4.538849347568209, "grad_norm": 1.296875, "learning_rate": 0.00031126740643982434, "loss": 4.9456, "mean_token_accuracy": 0.23041774481534957, "num_tokens": 105148967.0, "step": 45915 }, { "entropy": 5.724219799041748, "epoch": 4.53934361407671, "grad_norm": 1.28125, "learning_rate": 0.00031123257747592113, "loss": 4.8607, "mean_token_accuracy": 0.23958863615989684, "num_tokens": 105161472.0, "step": 45920 }, { "entropy": 5.7243719577789305, "epoch": 4.539837880585211, "grad_norm": 1.25, "learning_rate": 0.00031119774762069103, "loss": 4.9277, "mean_token_accuracy": 0.2267378032207489, "num_tokens": 105174213.0, "step": 45925 }, { "entropy": 5.865203762054444, "epoch": 4.540332147093713, "grad_norm": 1.375, "learning_rate": 0.00031116291687499067, "loss": 5.0321, "mean_token_accuracy": 0.22186678797006607, "num_tokens": 105186011.0, "step": 45930 }, { "entropy": 5.791933488845825, "epoch": 4.540826413602215, "grad_norm": 1.3046875, "learning_rate": 0.00031112808523967695, "loss": 4.9214, "mean_token_accuracy": 0.23054639250040054, "num_tokens": 105197605.0, "step": 45935 }, { "entropy": 5.833133840560913, "epoch": 4.541320680110716, "grad_norm": 1.3203125, "learning_rate": 0.0003110932527156067, "loss": 5.0409, "mean_token_accuracy": 0.22330638766288757, "num_tokens": 105209030.0, "step": 45940 }, { "entropy": 5.771899557113647, "epoch": 4.541814946619217, "grad_norm": 1.296875, "learning_rate": 0.00031105841930363686, "loss": 4.8418, "mean_token_accuracy": 0.24034301191568375, "num_tokens": 105220167.0, "step": 45945 }, { "entropy": 5.745329999923706, "epoch": 4.5423092131277185, "grad_norm": 1.359375, "learning_rate": 0.00031102358500462434, "loss": 4.8841, "mean_token_accuracy": 0.23243952691555023, "num_tokens": 105231646.0, "step": 45950 }, { "entropy": 5.788830900192261, "epoch": 4.54280347963622, "grad_norm": 1.40625, "learning_rate": 0.000310988749819426, "loss": 4.9592, "mean_token_accuracy": 0.22363257259130478, "num_tokens": 105243822.0, "step": 45955 }, { "entropy": 5.832404041290284, "epoch": 4.543297746144721, "grad_norm": 1.2578125, "learning_rate": 0.00031095391374889885, "loss": 4.974, "mean_token_accuracy": 0.22787881642580032, "num_tokens": 105256267.0, "step": 45960 }, { "entropy": 5.805338191986084, "epoch": 4.543792012653222, "grad_norm": 1.3125, "learning_rate": 0.00031091907679389985, "loss": 4.9642, "mean_token_accuracy": 0.23044847697019577, "num_tokens": 105267748.0, "step": 45965 }, { "entropy": 5.815966796875, "epoch": 4.5442862791617245, "grad_norm": 1.3515625, "learning_rate": 0.000310884238955286, "loss": 4.9786, "mean_token_accuracy": 0.22754546105861664, "num_tokens": 105278696.0, "step": 45970 }, { "entropy": 5.755666780471802, "epoch": 4.544780545670226, "grad_norm": 1.3828125, "learning_rate": 0.0003108494002339143, "loss": 4.8618, "mean_token_accuracy": 0.2380600929260254, "num_tokens": 105290053.0, "step": 45975 }, { "entropy": 5.828767013549805, "epoch": 4.545274812178727, "grad_norm": 1.3515625, "learning_rate": 0.0003108145606306417, "loss": 4.9531, "mean_token_accuracy": 0.23300205767154694, "num_tokens": 105301196.0, "step": 45980 }, { "entropy": 5.7889210224151615, "epoch": 4.545769078687228, "grad_norm": 1.3203125, "learning_rate": 0.00031077972014632545, "loss": 4.9834, "mean_token_accuracy": 0.22678053826093675, "num_tokens": 105312799.0, "step": 45985 }, { "entropy": 5.866717147827148, "epoch": 4.5462633451957295, "grad_norm": 1.265625, "learning_rate": 0.0003107448787818225, "loss": 5.0084, "mean_token_accuracy": 0.21666594892740249, "num_tokens": 105324818.0, "step": 45990 }, { "entropy": 5.7314784049987795, "epoch": 4.546757611704231, "grad_norm": 1.2734375, "learning_rate": 0.00031071003653799, "loss": 4.8994, "mean_token_accuracy": 0.23617913872003554, "num_tokens": 105335916.0, "step": 45995 }, { "entropy": 5.774842357635498, "epoch": 4.547251878212732, "grad_norm": 1.2734375, "learning_rate": 0.00031067519341568506, "loss": 4.8853, "mean_token_accuracy": 0.23889122307300567, "num_tokens": 105347257.0, "step": 46000 }, { "entropy": 5.843125534057617, "epoch": 4.547746144721234, "grad_norm": 1.2578125, "learning_rate": 0.0003106403494157649, "loss": 5.034, "mean_token_accuracy": 0.21733746230602263, "num_tokens": 105359285.0, "step": 46005 }, { "entropy": 5.830749273300171, "epoch": 4.548240411229735, "grad_norm": 1.4296875, "learning_rate": 0.0003106055045390865, "loss": 5.0512, "mean_token_accuracy": 0.22584494203329086, "num_tokens": 105372809.0, "step": 46010 }, { "entropy": 5.758221387863159, "epoch": 4.548734677738237, "grad_norm": 1.3515625, "learning_rate": 0.00031057065878650715, "loss": 4.8403, "mean_token_accuracy": 0.23986903876066207, "num_tokens": 105384341.0, "step": 46015 }, { "entropy": 5.792311716079712, "epoch": 4.549228944246738, "grad_norm": 1.2578125, "learning_rate": 0.00031053581215888417, "loss": 4.9135, "mean_token_accuracy": 0.23019323945045472, "num_tokens": 105397222.0, "step": 46020 }, { "entropy": 5.771563529968262, "epoch": 4.549723210755239, "grad_norm": 1.421875, "learning_rate": 0.00031050096465707466, "loss": 4.8649, "mean_token_accuracy": 0.2273395150899887, "num_tokens": 105407924.0, "step": 46025 }, { "entropy": 5.741381216049194, "epoch": 4.5502174772637405, "grad_norm": 1.21875, "learning_rate": 0.0003104661162819359, "loss": 4.9629, "mean_token_accuracy": 0.23127864599227904, "num_tokens": 105419390.0, "step": 46030 }, { "entropy": 5.802460527420044, "epoch": 4.550711743772242, "grad_norm": 1.4375, "learning_rate": 0.0003104312670343252, "loss": 4.9171, "mean_token_accuracy": 0.23314529061317443, "num_tokens": 105430963.0, "step": 46035 }, { "entropy": 5.742901039123535, "epoch": 4.551206010280743, "grad_norm": 1.3359375, "learning_rate": 0.00031039641691509983, "loss": 4.8804, "mean_token_accuracy": 0.23332030475139617, "num_tokens": 105443176.0, "step": 46040 }, { "entropy": 5.81176643371582, "epoch": 4.551700276789244, "grad_norm": 1.2578125, "learning_rate": 0.0003103615659251171, "loss": 4.9025, "mean_token_accuracy": 0.23529370427131652, "num_tokens": 105454523.0, "step": 46045 }, { "entropy": 5.772581434249878, "epoch": 4.552194543297746, "grad_norm": 1.3125, "learning_rate": 0.0003103267140652344, "loss": 4.9296, "mean_token_accuracy": 0.23143180757761, "num_tokens": 105466523.0, "step": 46050 }, { "entropy": 5.722124624252319, "epoch": 4.552688809806248, "grad_norm": 1.390625, "learning_rate": 0.000310291861336309, "loss": 4.8932, "mean_token_accuracy": 0.23618594706058502, "num_tokens": 105478799.0, "step": 46055 }, { "entropy": 5.798241043090821, "epoch": 4.553183076314749, "grad_norm": 1.3046875, "learning_rate": 0.00031025700773919837, "loss": 4.9618, "mean_token_accuracy": 0.22804735749959945, "num_tokens": 105491088.0, "step": 46060 }, { "entropy": 5.833500146865845, "epoch": 4.55367734282325, "grad_norm": 1.2734375, "learning_rate": 0.0003102221532747598, "loss": 4.9212, "mean_token_accuracy": 0.2349862903356552, "num_tokens": 105502258.0, "step": 46065 }, { "entropy": 5.782088708877564, "epoch": 4.5541716093317515, "grad_norm": 1.1640625, "learning_rate": 0.0003101872979438509, "loss": 4.9453, "mean_token_accuracy": 0.22302112430334092, "num_tokens": 105514414.0, "step": 46070 }, { "entropy": 5.768762111663818, "epoch": 4.554665875840253, "grad_norm": 1.2890625, "learning_rate": 0.000310152441747329, "loss": 4.8752, "mean_token_accuracy": 0.23776285648345946, "num_tokens": 105526023.0, "step": 46075 }, { "entropy": 5.761282539367675, "epoch": 4.555160142348754, "grad_norm": 1.2109375, "learning_rate": 0.0003101175846860515, "loss": 4.9404, "mean_token_accuracy": 0.22767429649829865, "num_tokens": 105538593.0, "step": 46080 }, { "entropy": 5.781795835494995, "epoch": 4.555654408857256, "grad_norm": 1.34375, "learning_rate": 0.0003100827267608761, "loss": 4.8882, "mean_token_accuracy": 0.23408602625131608, "num_tokens": 105549854.0, "step": 46085 }, { "entropy": 5.773876428604126, "epoch": 4.556148675365757, "grad_norm": 1.3046875, "learning_rate": 0.00031004786797266004, "loss": 4.9651, "mean_token_accuracy": 0.22132352739572525, "num_tokens": 105561778.0, "step": 46090 }, { "entropy": 5.793002891540527, "epoch": 4.556642941874259, "grad_norm": 1.2109375, "learning_rate": 0.00031001300832226105, "loss": 4.9957, "mean_token_accuracy": 0.2241692900657654, "num_tokens": 105573829.0, "step": 46095 }, { "entropy": 5.742995309829712, "epoch": 4.55713720838276, "grad_norm": 1.2734375, "learning_rate": 0.00030997814781053663, "loss": 4.8984, "mean_token_accuracy": 0.23615624755620956, "num_tokens": 105585456.0, "step": 46100 }, { "entropy": 5.834888553619384, "epoch": 4.557631474891261, "grad_norm": 1.3828125, "learning_rate": 0.00030994328643834437, "loss": 4.9534, "mean_token_accuracy": 0.2263108894228935, "num_tokens": 105596926.0, "step": 46105 }, { "entropy": 5.874442672729492, "epoch": 4.5581257413997625, "grad_norm": 1.4375, "learning_rate": 0.00030990842420654176, "loss": 5.0391, "mean_token_accuracy": 0.21975065171718597, "num_tokens": 105608316.0, "step": 46110 }, { "entropy": 5.758781671524048, "epoch": 4.558620007908264, "grad_norm": 1.234375, "learning_rate": 0.0003098735611159866, "loss": 4.9183, "mean_token_accuracy": 0.23203592300415038, "num_tokens": 105618921.0, "step": 46115 }, { "entropy": 5.783056592941284, "epoch": 4.559114274416766, "grad_norm": 1.2265625, "learning_rate": 0.0003098386971675364, "loss": 5.0214, "mean_token_accuracy": 0.21841016858816148, "num_tokens": 105629981.0, "step": 46120 }, { "entropy": 5.8702027797698975, "epoch": 4.559608540925267, "grad_norm": 1.359375, "learning_rate": 0.00030980383236204885, "loss": 4.9979, "mean_token_accuracy": 0.22250534296035768, "num_tokens": 105640975.0, "step": 46125 }, { "entropy": 5.7482696056365965, "epoch": 4.560102807433768, "grad_norm": 1.2734375, "learning_rate": 0.00030976896670038156, "loss": 4.8916, "mean_token_accuracy": 0.23418245762586593, "num_tokens": 105652075.0, "step": 46130 }, { "entropy": 5.846658182144165, "epoch": 4.56059707394227, "grad_norm": 1.3046875, "learning_rate": 0.00030973410018339233, "loss": 5.0241, "mean_token_accuracy": 0.21871226131916047, "num_tokens": 105663016.0, "step": 46135 }, { "entropy": 5.738672733306885, "epoch": 4.561091340450771, "grad_norm": 1.328125, "learning_rate": 0.00030969923281193887, "loss": 4.8968, "mean_token_accuracy": 0.22797385156154631, "num_tokens": 105674032.0, "step": 46140 }, { "entropy": 5.8253308773040775, "epoch": 4.561585606959272, "grad_norm": 1.3515625, "learning_rate": 0.00030966436458687883, "loss": 4.9525, "mean_token_accuracy": 0.2279127135872841, "num_tokens": 105685411.0, "step": 46145 }, { "entropy": 5.764629936218261, "epoch": 4.562079873467773, "grad_norm": 1.3828125, "learning_rate": 0.00030962949550907015, "loss": 4.8691, "mean_token_accuracy": 0.23304575383663179, "num_tokens": 105695898.0, "step": 46150 }, { "entropy": 5.774698877334595, "epoch": 4.562574139976276, "grad_norm": 1.3046875, "learning_rate": 0.0003095946255793705, "loss": 4.9636, "mean_token_accuracy": 0.22783783227205276, "num_tokens": 105706889.0, "step": 46155 }, { "entropy": 5.777381038665771, "epoch": 4.563068406484777, "grad_norm": 1.25, "learning_rate": 0.0003095597547986376, "loss": 4.9408, "mean_token_accuracy": 0.22896846383810043, "num_tokens": 105718700.0, "step": 46160 }, { "entropy": 5.7424046993255615, "epoch": 4.563562672993278, "grad_norm": 1.3984375, "learning_rate": 0.0003095248831677294, "loss": 4.82, "mean_token_accuracy": 0.2347561925649643, "num_tokens": 105729790.0, "step": 46165 }, { "entropy": 5.7797459125518795, "epoch": 4.564056939501779, "grad_norm": 1.3359375, "learning_rate": 0.0003094900106875037, "loss": 4.9192, "mean_token_accuracy": 0.2315300539135933, "num_tokens": 105740370.0, "step": 46170 }, { "entropy": 5.8432698249816895, "epoch": 4.564551206010281, "grad_norm": 1.4765625, "learning_rate": 0.0003094551373588185, "loss": 4.8982, "mean_token_accuracy": 0.22627813667058944, "num_tokens": 105749992.0, "step": 46175 }, { "entropy": 5.760067987442016, "epoch": 4.565045472518782, "grad_norm": 1.359375, "learning_rate": 0.00030942026318253146, "loss": 4.8802, "mean_token_accuracy": 0.23362171947956084, "num_tokens": 105760491.0, "step": 46180 }, { "entropy": 5.667845344543457, "epoch": 4.565539739027283, "grad_norm": 1.2734375, "learning_rate": 0.0003093853881595006, "loss": 4.8756, "mean_token_accuracy": 0.24643746465444566, "num_tokens": 105772307.0, "step": 46185 }, { "entropy": 5.778562831878662, "epoch": 4.566034005535785, "grad_norm": 1.2734375, "learning_rate": 0.000309350512290584, "loss": 4.9558, "mean_token_accuracy": 0.22749521285295488, "num_tokens": 105784108.0, "step": 46190 }, { "entropy": 5.7500465393066404, "epoch": 4.566528272044287, "grad_norm": 1.2734375, "learning_rate": 0.00030931563557663934, "loss": 4.9404, "mean_token_accuracy": 0.2314898043870926, "num_tokens": 105795833.0, "step": 46195 }, { "entropy": 5.848878335952759, "epoch": 4.567022538552788, "grad_norm": 1.25, "learning_rate": 0.00030928075801852473, "loss": 4.963, "mean_token_accuracy": 0.23106114715337753, "num_tokens": 105807170.0, "step": 46200 }, { "entropy": 5.86488184928894, "epoch": 4.567516805061289, "grad_norm": 1.265625, "learning_rate": 0.0003092458796170982, "loss": 4.9657, "mean_token_accuracy": 0.22627424448728561, "num_tokens": 105818620.0, "step": 46205 }, { "entropy": 5.7761985778808596, "epoch": 4.56801107156979, "grad_norm": 1.3515625, "learning_rate": 0.00030921100037321767, "loss": 4.8719, "mean_token_accuracy": 0.23799406588077546, "num_tokens": 105830872.0, "step": 46210 }, { "entropy": 5.694473457336426, "epoch": 4.568505338078292, "grad_norm": 1.390625, "learning_rate": 0.00030917612028774123, "loss": 4.7964, "mean_token_accuracy": 0.24616227596998214, "num_tokens": 105840132.0, "step": 46215 }, { "entropy": 5.751914358139038, "epoch": 4.568999604586793, "grad_norm": 1.3671875, "learning_rate": 0.000309141239361527, "loss": 4.9238, "mean_token_accuracy": 0.23768649101257325, "num_tokens": 105851949.0, "step": 46220 }, { "entropy": 5.7951353073120115, "epoch": 4.569493871095295, "grad_norm": 1.390625, "learning_rate": 0.0003091063575954329, "loss": 4.903, "mean_token_accuracy": 0.23163083344697952, "num_tokens": 105863340.0, "step": 46225 }, { "entropy": 5.82391324043274, "epoch": 4.569988137603796, "grad_norm": 1.1953125, "learning_rate": 0.0003090714749903171, "loss": 5.0361, "mean_token_accuracy": 0.2240614339709282, "num_tokens": 105875158.0, "step": 46230 }, { "entropy": 5.74729905128479, "epoch": 4.570482404112298, "grad_norm": 1.4296875, "learning_rate": 0.00030903659154703786, "loss": 4.9588, "mean_token_accuracy": 0.23066673129796983, "num_tokens": 105886369.0, "step": 46235 }, { "entropy": 5.799321079254151, "epoch": 4.570976670620799, "grad_norm": 1.4296875, "learning_rate": 0.000309001707266453, "loss": 4.9152, "mean_token_accuracy": 0.23584138751029968, "num_tokens": 105897341.0, "step": 46240 }, { "entropy": 5.762801313400269, "epoch": 4.5714709371293, "grad_norm": 1.5, "learning_rate": 0.00030896682214942106, "loss": 4.9257, "mean_token_accuracy": 0.22668698728084563, "num_tokens": 105909132.0, "step": 46245 }, { "entropy": 5.853288555145264, "epoch": 4.571965203637801, "grad_norm": 1.2421875, "learning_rate": 0.00030893193619679985, "loss": 4.9597, "mean_token_accuracy": 0.22201996445655822, "num_tokens": 105919916.0, "step": 46250 }, { "entropy": 5.810869121551514, "epoch": 4.572459470146303, "grad_norm": 1.390625, "learning_rate": 0.0003088970494094479, "loss": 4.9534, "mean_token_accuracy": 0.22364890575408936, "num_tokens": 105930104.0, "step": 46255 }, { "entropy": 5.785264110565185, "epoch": 4.572953736654805, "grad_norm": 1.328125, "learning_rate": 0.0003088621617882232, "loss": 4.8927, "mean_token_accuracy": 0.22587590366601945, "num_tokens": 105942382.0, "step": 46260 }, { "entropy": 5.763106775283814, "epoch": 4.573448003163306, "grad_norm": 1.1953125, "learning_rate": 0.0003088272733339841, "loss": 4.9324, "mean_token_accuracy": 0.22870266437530518, "num_tokens": 105954878.0, "step": 46265 }, { "entropy": 5.728130435943603, "epoch": 4.573942269671807, "grad_norm": 1.3359375, "learning_rate": 0.0003087923840475888, "loss": 4.8523, "mean_token_accuracy": 0.23797095268964769, "num_tokens": 105965277.0, "step": 46270 }, { "entropy": 5.822075843811035, "epoch": 4.5744365361803085, "grad_norm": 1.2421875, "learning_rate": 0.00030875749392989557, "loss": 4.985, "mean_token_accuracy": 0.22939426004886626, "num_tokens": 105977660.0, "step": 46275 }, { "entropy": 5.730556631088257, "epoch": 4.57493080268881, "grad_norm": 1.2890625, "learning_rate": 0.0003087226029817628, "loss": 4.9276, "mean_token_accuracy": 0.2355106756091118, "num_tokens": 105989401.0, "step": 46280 }, { "entropy": 5.810043239593506, "epoch": 4.575425069197311, "grad_norm": 1.25, "learning_rate": 0.0003086877112040487, "loss": 4.9331, "mean_token_accuracy": 0.22445629686117172, "num_tokens": 105999801.0, "step": 46285 }, { "entropy": 5.763574075698853, "epoch": 4.575919335705812, "grad_norm": 1.125, "learning_rate": 0.0003086528185976118, "loss": 4.9301, "mean_token_accuracy": 0.22380468398332595, "num_tokens": 106011263.0, "step": 46290 }, { "entropy": 5.779327058792115, "epoch": 4.576413602214314, "grad_norm": 1.328125, "learning_rate": 0.0003086179251633103, "loss": 4.953, "mean_token_accuracy": 0.2292763113975525, "num_tokens": 106023166.0, "step": 46295 }, { "entropy": 5.785010528564453, "epoch": 4.576907868722815, "grad_norm": 1.2890625, "learning_rate": 0.00030858303090200255, "loss": 4.9852, "mean_token_accuracy": 0.22796581089496612, "num_tokens": 106036143.0, "step": 46300 }, { "entropy": 5.743170499801636, "epoch": 4.577402135231317, "grad_norm": 1.4375, "learning_rate": 0.00030854813581454707, "loss": 4.8557, "mean_token_accuracy": 0.2360699236392975, "num_tokens": 106047160.0, "step": 46305 }, { "entropy": 5.8159160137176515, "epoch": 4.577896401739818, "grad_norm": 1.125, "learning_rate": 0.0003085132399018023, "loss": 4.9303, "mean_token_accuracy": 0.23296049237251282, "num_tokens": 106059384.0, "step": 46310 }, { "entropy": 5.794270706176758, "epoch": 4.5783906682483195, "grad_norm": 1.3828125, "learning_rate": 0.0003084783431646266, "loss": 4.9491, "mean_token_accuracy": 0.22866792380809783, "num_tokens": 106069859.0, "step": 46315 }, { "entropy": 5.749280166625977, "epoch": 4.578884934756821, "grad_norm": 1.3984375, "learning_rate": 0.00030844344560387844, "loss": 4.9157, "mean_token_accuracy": 0.22616037279367446, "num_tokens": 106081292.0, "step": 46320 }, { "entropy": 5.782117176055908, "epoch": 4.579379201265322, "grad_norm": 1.3125, "learning_rate": 0.0003084085472204163, "loss": 4.9008, "mean_token_accuracy": 0.230620676279068, "num_tokens": 106093236.0, "step": 46325 }, { "entropy": 5.788677453994751, "epoch": 4.579873467773823, "grad_norm": 1.2265625, "learning_rate": 0.00030837364801509874, "loss": 4.9301, "mean_token_accuracy": 0.23032985031604766, "num_tokens": 106104386.0, "step": 46330 }, { "entropy": 5.789829254150391, "epoch": 4.580367734282325, "grad_norm": 1.421875, "learning_rate": 0.00030833874798878437, "loss": 4.8943, "mean_token_accuracy": 0.23631369471549987, "num_tokens": 106114812.0, "step": 46335 }, { "entropy": 5.770914554595947, "epoch": 4.580862000790827, "grad_norm": 1.3515625, "learning_rate": 0.00030830384714233155, "loss": 4.8823, "mean_token_accuracy": 0.23000660240650178, "num_tokens": 106125434.0, "step": 46340 }, { "entropy": 5.782076740264893, "epoch": 4.581356267299328, "grad_norm": 1.3203125, "learning_rate": 0.00030826894547659876, "loss": 4.9645, "mean_token_accuracy": 0.22369841635227203, "num_tokens": 106138218.0, "step": 46345 }, { "entropy": 5.764967632293701, "epoch": 4.581850533807829, "grad_norm": 1.359375, "learning_rate": 0.00030823404299244495, "loss": 4.8582, "mean_token_accuracy": 0.23870978951454164, "num_tokens": 106149408.0, "step": 46350 }, { "entropy": 5.861570167541504, "epoch": 4.5823448003163305, "grad_norm": 1.4453125, "learning_rate": 0.0003081991396907285, "loss": 5.0841, "mean_token_accuracy": 0.21974919885396957, "num_tokens": 106162589.0, "step": 46355 }, { "entropy": 5.789119863510132, "epoch": 4.582839066824832, "grad_norm": 1.2734375, "learning_rate": 0.00030816423557230807, "loss": 4.9921, "mean_token_accuracy": 0.23710990697145462, "num_tokens": 106175539.0, "step": 46360 }, { "entropy": 5.829701662063599, "epoch": 4.583333333333333, "grad_norm": 1.4296875, "learning_rate": 0.00030812933063804226, "loss": 4.9771, "mean_token_accuracy": 0.2270043596625328, "num_tokens": 106187545.0, "step": 46365 }, { "entropy": 5.8006213188171385, "epoch": 4.583827599841834, "grad_norm": 1.3203125, "learning_rate": 0.00030809442488878976, "loss": 4.9125, "mean_token_accuracy": 0.22982307225465776, "num_tokens": 106199512.0, "step": 46370 }, { "entropy": 5.78091721534729, "epoch": 4.5843218663503364, "grad_norm": 1.3984375, "learning_rate": 0.0003080595183254093, "loss": 4.9568, "mean_token_accuracy": 0.22119287997484208, "num_tokens": 106211185.0, "step": 46375 }, { "entropy": 5.8040971755981445, "epoch": 4.584816132858838, "grad_norm": 1.3359375, "learning_rate": 0.0003080246109487596, "loss": 4.9548, "mean_token_accuracy": 0.22680919021368026, "num_tokens": 106222604.0, "step": 46380 }, { "entropy": 5.8519572734832765, "epoch": 4.585310399367339, "grad_norm": 1.2421875, "learning_rate": 0.0003079897027596992, "loss": 4.9919, "mean_token_accuracy": 0.224563167989254, "num_tokens": 106236134.0, "step": 46385 }, { "entropy": 5.795613384246826, "epoch": 4.58580466587584, "grad_norm": 1.2421875, "learning_rate": 0.0003079547937590872, "loss": 4.9356, "mean_token_accuracy": 0.2309411346912384, "num_tokens": 106247553.0, "step": 46390 }, { "entropy": 5.745602607727051, "epoch": 4.5862989323843415, "grad_norm": 1.3203125, "learning_rate": 0.000307919883947782, "loss": 4.8643, "mean_token_accuracy": 0.24145733416080475, "num_tokens": 106258356.0, "step": 46395 }, { "entropy": 5.831272745132447, "epoch": 4.586793198892843, "grad_norm": 1.3203125, "learning_rate": 0.0003078849733266426, "loss": 4.9914, "mean_token_accuracy": 0.22067010253667832, "num_tokens": 106269428.0, "step": 46400 }, { "entropy": 5.742138338088989, "epoch": 4.587287465401344, "grad_norm": 1.265625, "learning_rate": 0.0003078500618965278, "loss": 4.8299, "mean_token_accuracy": 0.2401998907327652, "num_tokens": 106280600.0, "step": 46405 }, { "entropy": 5.820037937164306, "epoch": 4.587781731909846, "grad_norm": 1.3203125, "learning_rate": 0.00030781514965829636, "loss": 4.9104, "mean_token_accuracy": 0.22838593125343323, "num_tokens": 106291720.0, "step": 46410 }, { "entropy": 5.746521997451782, "epoch": 4.588275998418347, "grad_norm": 1.2734375, "learning_rate": 0.0003077802366128071, "loss": 4.9372, "mean_token_accuracy": 0.2251282438635826, "num_tokens": 106303156.0, "step": 46415 }, { "entropy": 5.755290126800537, "epoch": 4.588770264926849, "grad_norm": 1.3046875, "learning_rate": 0.000307745322760919, "loss": 4.9195, "mean_token_accuracy": 0.23144638389348984, "num_tokens": 106314671.0, "step": 46420 }, { "entropy": 5.774840068817139, "epoch": 4.58926453143535, "grad_norm": 1.1015625, "learning_rate": 0.0003077104081034909, "loss": 4.9047, "mean_token_accuracy": 0.23309523165225982, "num_tokens": 106327246.0, "step": 46425 }, { "entropy": 5.8008284091949465, "epoch": 4.589758797943851, "grad_norm": 1.4921875, "learning_rate": 0.00030767549264138156, "loss": 4.8775, "mean_token_accuracy": 0.24055134057998656, "num_tokens": 106337632.0, "step": 46430 }, { "entropy": 5.806554985046387, "epoch": 4.5902530644523525, "grad_norm": 1.28125, "learning_rate": 0.0003076405763754501, "loss": 4.9799, "mean_token_accuracy": 0.22656079083681108, "num_tokens": 106348885.0, "step": 46435 }, { "entropy": 5.802888584136963, "epoch": 4.590747330960854, "grad_norm": 1.375, "learning_rate": 0.00030760565930655544, "loss": 4.9178, "mean_token_accuracy": 0.23548796772956848, "num_tokens": 106359369.0, "step": 46440 }, { "entropy": 5.723750925064087, "epoch": 4.591241597469356, "grad_norm": 1.4375, "learning_rate": 0.0003075707414355564, "loss": 4.8823, "mean_token_accuracy": 0.23327623903751374, "num_tokens": 106371198.0, "step": 46445 }, { "entropy": 5.836214065551758, "epoch": 4.591735863977857, "grad_norm": 1.3125, "learning_rate": 0.0003075358227633122, "loss": 4.9871, "mean_token_accuracy": 0.22521165758371353, "num_tokens": 106382874.0, "step": 46450 }, { "entropy": 5.871688270568848, "epoch": 4.592230130486358, "grad_norm": 1.234375, "learning_rate": 0.00030750090329068167, "loss": 5.0364, "mean_token_accuracy": 0.2219303399324417, "num_tokens": 106394329.0, "step": 46455 }, { "entropy": 5.748979473114014, "epoch": 4.59272439699486, "grad_norm": 1.125, "learning_rate": 0.0003074659830185238, "loss": 4.919, "mean_token_accuracy": 0.2393765166401863, "num_tokens": 106407223.0, "step": 46460 }, { "entropy": 5.781836223602295, "epoch": 4.593218663503361, "grad_norm": 1.3046875, "learning_rate": 0.0003074310619476978, "loss": 4.9704, "mean_token_accuracy": 0.23156144618988037, "num_tokens": 106418622.0, "step": 46465 }, { "entropy": 5.821830177307129, "epoch": 4.593712930011862, "grad_norm": 1.3046875, "learning_rate": 0.0003073961400790626, "loss": 4.955, "mean_token_accuracy": 0.2286625936627388, "num_tokens": 106430575.0, "step": 46470 }, { "entropy": 5.762187337875366, "epoch": 4.5942071965203635, "grad_norm": 1.3125, "learning_rate": 0.0003073612174134773, "loss": 4.894, "mean_token_accuracy": 0.22554826289415358, "num_tokens": 106441707.0, "step": 46475 }, { "entropy": 5.8026206493377686, "epoch": 4.594701463028866, "grad_norm": 1.25, "learning_rate": 0.0003073262939518011, "loss": 4.9582, "mean_token_accuracy": 0.22558055818080902, "num_tokens": 106453470.0, "step": 46480 }, { "entropy": 5.744352245330811, "epoch": 4.595195729537367, "grad_norm": 1.3046875, "learning_rate": 0.000307291369694893, "loss": 4.9067, "mean_token_accuracy": 0.23441220372915267, "num_tokens": 106464140.0, "step": 46485 }, { "entropy": 5.783983373641968, "epoch": 4.595689996045868, "grad_norm": 1.3203125, "learning_rate": 0.0003072564446436122, "loss": 4.8943, "mean_token_accuracy": 0.2320398911833763, "num_tokens": 106476052.0, "step": 46490 }, { "entropy": 5.713870573043823, "epoch": 4.596184262554369, "grad_norm": 1.359375, "learning_rate": 0.00030722151879881786, "loss": 4.8435, "mean_token_accuracy": 0.2404267519712448, "num_tokens": 106486568.0, "step": 46495 }, { "entropy": 5.702104806900024, "epoch": 4.596678529062871, "grad_norm": 1.2109375, "learning_rate": 0.00030718659216136924, "loss": 4.9011, "mean_token_accuracy": 0.23873864710330964, "num_tokens": 106498770.0, "step": 46500 }, { "entropy": 5.797584676742554, "epoch": 4.597172795571372, "grad_norm": 1.390625, "learning_rate": 0.0003071516647321254, "loss": 4.9424, "mean_token_accuracy": 0.22179621011018752, "num_tokens": 106510384.0, "step": 46505 }, { "entropy": 5.729933166503907, "epoch": 4.597667062079873, "grad_norm": 1.2890625, "learning_rate": 0.0003071167365119455, "loss": 4.8791, "mean_token_accuracy": 0.23266719430685043, "num_tokens": 106522197.0, "step": 46510 }, { "entropy": 5.785855388641357, "epoch": 4.598161328588375, "grad_norm": 1.3203125, "learning_rate": 0.0003070818075016891, "loss": 4.9219, "mean_token_accuracy": 0.22925770431756973, "num_tokens": 106533218.0, "step": 46515 }, { "entropy": 5.780378246307373, "epoch": 4.598655595096877, "grad_norm": 1.3046875, "learning_rate": 0.0003070468777022151, "loss": 4.8978, "mean_token_accuracy": 0.23363303989171982, "num_tokens": 106545391.0, "step": 46520 }, { "entropy": 5.826485300064087, "epoch": 4.599149861605378, "grad_norm": 1.296875, "learning_rate": 0.00030701194711438306, "loss": 4.9556, "mean_token_accuracy": 0.22816691994667054, "num_tokens": 106556122.0, "step": 46525 }, { "entropy": 5.7969639778137205, "epoch": 4.599644128113879, "grad_norm": 1.1640625, "learning_rate": 0.00030697701573905204, "loss": 4.9147, "mean_token_accuracy": 0.2263759881258011, "num_tokens": 106567876.0, "step": 46530 }, { "entropy": 5.704545974731445, "epoch": 4.60013839462238, "grad_norm": 1.3046875, "learning_rate": 0.0003069420835770816, "loss": 4.8612, "mean_token_accuracy": 0.2347429007291794, "num_tokens": 106578083.0, "step": 46535 }, { "entropy": 5.764178466796875, "epoch": 4.600632661130882, "grad_norm": 1.21875, "learning_rate": 0.0003069071506293308, "loss": 4.9773, "mean_token_accuracy": 0.2270976036787033, "num_tokens": 106589986.0, "step": 46540 }, { "entropy": 5.843314170837402, "epoch": 4.601126927639383, "grad_norm": 1.15625, "learning_rate": 0.0003068722168966593, "loss": 4.9726, "mean_token_accuracy": 0.22991180568933486, "num_tokens": 106602055.0, "step": 46545 }, { "entropy": 5.869006538391114, "epoch": 4.601621194147884, "grad_norm": 1.3359375, "learning_rate": 0.00030683728237992626, "loss": 4.8934, "mean_token_accuracy": 0.2325399711728096, "num_tokens": 106613394.0, "step": 46550 }, { "entropy": 5.806365966796875, "epoch": 4.602115460656385, "grad_norm": 1.2890625, "learning_rate": 0.00030680234707999117, "loss": 4.8175, "mean_token_accuracy": 0.24214028269052507, "num_tokens": 106624190.0, "step": 46555 }, { "entropy": 5.742762613296509, "epoch": 4.602609727164888, "grad_norm": 1.328125, "learning_rate": 0.0003067674109977133, "loss": 4.9174, "mean_token_accuracy": 0.22881741672754288, "num_tokens": 106636030.0, "step": 46560 }, { "entropy": 5.828702926635742, "epoch": 4.603103993673389, "grad_norm": 1.2421875, "learning_rate": 0.0003067324741339523, "loss": 4.9943, "mean_token_accuracy": 0.22057678401470185, "num_tokens": 106648648.0, "step": 46565 }, { "entropy": 5.726020860671997, "epoch": 4.60359826018189, "grad_norm": 1.3828125, "learning_rate": 0.00030669753648956743, "loss": 4.8756, "mean_token_accuracy": 0.23147964477539062, "num_tokens": 106659902.0, "step": 46570 }, { "entropy": 5.821587562561035, "epoch": 4.604092526690391, "grad_norm": 1.2421875, "learning_rate": 0.00030666259806541823, "loss": 4.9719, "mean_token_accuracy": 0.22490687817335128, "num_tokens": 106670768.0, "step": 46575 }, { "entropy": 5.763034534454346, "epoch": 4.604586793198893, "grad_norm": 1.3359375, "learning_rate": 0.0003066276588623643, "loss": 4.9066, "mean_token_accuracy": 0.22534407526254654, "num_tokens": 106682331.0, "step": 46580 }, { "entropy": 5.814328193664551, "epoch": 4.605081059707394, "grad_norm": 1.3828125, "learning_rate": 0.000306592718881265, "loss": 5.0036, "mean_token_accuracy": 0.22627761960029602, "num_tokens": 106692562.0, "step": 46585 }, { "entropy": 5.741906356811524, "epoch": 4.605575326215895, "grad_norm": 1.28125, "learning_rate": 0.0003065577781229799, "loss": 4.881, "mean_token_accuracy": 0.23673069179058076, "num_tokens": 106705208.0, "step": 46590 }, { "entropy": 5.890418243408203, "epoch": 4.606069592724397, "grad_norm": 1.3515625, "learning_rate": 0.0003065228365883686, "loss": 5.0577, "mean_token_accuracy": 0.22078993171453476, "num_tokens": 106717875.0, "step": 46595 }, { "entropy": 5.835211658477784, "epoch": 4.606563859232899, "grad_norm": 1.2109375, "learning_rate": 0.00030648789427829067, "loss": 4.9417, "mean_token_accuracy": 0.22563556730747222, "num_tokens": 106729237.0, "step": 46600 }, { "entropy": 5.794555425643921, "epoch": 4.6070581257414, "grad_norm": 1.390625, "learning_rate": 0.00030645295119360557, "loss": 5.0049, "mean_token_accuracy": 0.2262166440486908, "num_tokens": 106740805.0, "step": 46605 }, { "entropy": 5.729637384414673, "epoch": 4.607552392249901, "grad_norm": 1.3671875, "learning_rate": 0.000306418007335173, "loss": 4.907, "mean_token_accuracy": 0.23758375346660615, "num_tokens": 106752069.0, "step": 46610 }, { "entropy": 5.923226022720337, "epoch": 4.608046658758402, "grad_norm": 1.25, "learning_rate": 0.00030638306270385266, "loss": 5.0759, "mean_token_accuracy": 0.21541512459516526, "num_tokens": 106764885.0, "step": 46615 }, { "entropy": 5.797978734970092, "epoch": 4.608540925266904, "grad_norm": 1.390625, "learning_rate": 0.000306348117300504, "loss": 4.9559, "mean_token_accuracy": 0.22912544012069702, "num_tokens": 106775712.0, "step": 46620 }, { "entropy": 5.796900510787964, "epoch": 4.609035191775405, "grad_norm": 1.21875, "learning_rate": 0.0003063131711259868, "loss": 4.9206, "mean_token_accuracy": 0.23948630094528198, "num_tokens": 106788068.0, "step": 46625 }, { "entropy": 5.759616470336914, "epoch": 4.609529458283907, "grad_norm": 1.2578125, "learning_rate": 0.00030627822418116083, "loss": 4.9147, "mean_token_accuracy": 0.2280917078256607, "num_tokens": 106798984.0, "step": 46630 }, { "entropy": 5.835804414749146, "epoch": 4.610023724792408, "grad_norm": 1.3671875, "learning_rate": 0.0003062432764668856, "loss": 4.954, "mean_token_accuracy": 0.22887501269578933, "num_tokens": 106811447.0, "step": 46635 }, { "entropy": 5.748229551315307, "epoch": 4.61051799130091, "grad_norm": 1.296875, "learning_rate": 0.000306208327984021, "loss": 4.9854, "mean_token_accuracy": 0.22281210571527482, "num_tokens": 106823622.0, "step": 46640 }, { "entropy": 5.79205322265625, "epoch": 4.611012257809411, "grad_norm": 1.1796875, "learning_rate": 0.00030617337873342664, "loss": 5.0006, "mean_token_accuracy": 0.22198145240545272, "num_tokens": 106836767.0, "step": 46645 }, { "entropy": 5.862561655044556, "epoch": 4.611506524317912, "grad_norm": 1.3125, "learning_rate": 0.0003061384287159623, "loss": 5.0463, "mean_token_accuracy": 0.22319204062223436, "num_tokens": 106849027.0, "step": 46650 }, { "entropy": 5.76710090637207, "epoch": 4.612000790826413, "grad_norm": 1.3046875, "learning_rate": 0.0003061034779324878, "loss": 4.8934, "mean_token_accuracy": 0.23429109901189804, "num_tokens": 106859543.0, "step": 46655 }, { "entropy": 5.783667707443238, "epoch": 4.612495057334915, "grad_norm": 1.421875, "learning_rate": 0.00030606852638386304, "loss": 4.8737, "mean_token_accuracy": 0.23549743592739106, "num_tokens": 106870300.0, "step": 46660 }, { "entropy": 5.7949793338775635, "epoch": 4.612989323843417, "grad_norm": 1.4921875, "learning_rate": 0.0003060335740709475, "loss": 4.9021, "mean_token_accuracy": 0.23392112404108048, "num_tokens": 106880706.0, "step": 46665 }, { "entropy": 5.781295442581177, "epoch": 4.613483590351918, "grad_norm": 1.3671875, "learning_rate": 0.0003059986209946014, "loss": 5.0002, "mean_token_accuracy": 0.22184660136699677, "num_tokens": 106890906.0, "step": 46670 }, { "entropy": 5.79620213508606, "epoch": 4.613977856860419, "grad_norm": 1.2421875, "learning_rate": 0.0003059636671556843, "loss": 4.9573, "mean_token_accuracy": 0.22817874997854232, "num_tokens": 106902175.0, "step": 46675 }, { "entropy": 5.815825796127319, "epoch": 4.6144721233689205, "grad_norm": 1.359375, "learning_rate": 0.00030592871255505615, "loss": 5.0141, "mean_token_accuracy": 0.21588873863220215, "num_tokens": 106913267.0, "step": 46680 }, { "entropy": 5.76472840309143, "epoch": 4.614966389877422, "grad_norm": 1.140625, "learning_rate": 0.00030589375719357705, "loss": 4.942, "mean_token_accuracy": 0.2238152578473091, "num_tokens": 106925603.0, "step": 46685 }, { "entropy": 5.798580503463745, "epoch": 4.615460656385923, "grad_norm": 1.484375, "learning_rate": 0.00030585880107210654, "loss": 4.9537, "mean_token_accuracy": 0.2326124280691147, "num_tokens": 106937038.0, "step": 46690 }, { "entropy": 5.757341527938843, "epoch": 4.615954922894424, "grad_norm": 1.2890625, "learning_rate": 0.0003058238441915049, "loss": 4.8391, "mean_token_accuracy": 0.231806880235672, "num_tokens": 106948302.0, "step": 46695 }, { "entropy": 5.753542566299439, "epoch": 4.6164491894029265, "grad_norm": 1.4140625, "learning_rate": 0.0003057888865526318, "loss": 4.8282, "mean_token_accuracy": 0.2423550859093666, "num_tokens": 106958347.0, "step": 46700 }, { "entropy": 5.805516386032105, "epoch": 4.616943455911428, "grad_norm": 1.265625, "learning_rate": 0.0003057539281563473, "loss": 4.9869, "mean_token_accuracy": 0.22660465240478517, "num_tokens": 106969816.0, "step": 46705 }, { "entropy": 5.791575384140015, "epoch": 4.617437722419929, "grad_norm": 1.375, "learning_rate": 0.00030571896900351156, "loss": 4.9669, "mean_token_accuracy": 0.22817349880933763, "num_tokens": 106981100.0, "step": 46710 }, { "entropy": 5.705214929580689, "epoch": 4.61793198892843, "grad_norm": 1.3359375, "learning_rate": 0.0003056840090949843, "loss": 4.9013, "mean_token_accuracy": 0.23403552174568176, "num_tokens": 106993135.0, "step": 46715 }, { "entropy": 5.827020359039307, "epoch": 4.6184262554369315, "grad_norm": 1.359375, "learning_rate": 0.0003056490484316256, "loss": 4.967, "mean_token_accuracy": 0.22484555691480637, "num_tokens": 107005375.0, "step": 46720 }, { "entropy": 5.856458234786987, "epoch": 4.618920521945433, "grad_norm": 1.3515625, "learning_rate": 0.0003056140870142957, "loss": 4.9575, "mean_token_accuracy": 0.2268575206398964, "num_tokens": 107017932.0, "step": 46725 }, { "entropy": 5.796388006210327, "epoch": 4.619414788453934, "grad_norm": 1.2734375, "learning_rate": 0.0003055791248438544, "loss": 4.8776, "mean_token_accuracy": 0.23005934059619904, "num_tokens": 107029122.0, "step": 46730 }, { "entropy": 5.718320274353028, "epoch": 4.619909054962436, "grad_norm": 1.3828125, "learning_rate": 0.00030554416192116185, "loss": 4.9566, "mean_token_accuracy": 0.23064990043640138, "num_tokens": 107041501.0, "step": 46735 }, { "entropy": 5.77813868522644, "epoch": 4.6204033214709375, "grad_norm": 1.328125, "learning_rate": 0.0003055091982470783, "loss": 4.9406, "mean_token_accuracy": 0.23280662000179292, "num_tokens": 107051948.0, "step": 46740 }, { "entropy": 5.810642433166504, "epoch": 4.620897587979439, "grad_norm": 1.375, "learning_rate": 0.00030547423382246364, "loss": 4.9292, "mean_token_accuracy": 0.23355851769447328, "num_tokens": 107063186.0, "step": 46745 }, { "entropy": 5.722560119628906, "epoch": 4.62139185448794, "grad_norm": 1.3828125, "learning_rate": 0.0003054392686481781, "loss": 4.8857, "mean_token_accuracy": 0.2381330594420433, "num_tokens": 107075617.0, "step": 46750 }, { "entropy": 5.782483863830566, "epoch": 4.621886120996441, "grad_norm": 1.40625, "learning_rate": 0.00030540430272508193, "loss": 4.9748, "mean_token_accuracy": 0.22900398969650268, "num_tokens": 107087505.0, "step": 46755 }, { "entropy": 5.825350570678711, "epoch": 4.6223803875049425, "grad_norm": 1.3125, "learning_rate": 0.00030536933605403513, "loss": 4.9214, "mean_token_accuracy": 0.23312136828899382, "num_tokens": 107099062.0, "step": 46760 }, { "entropy": 5.740026521682739, "epoch": 4.622874654013444, "grad_norm": 1.234375, "learning_rate": 0.00030533436863589794, "loss": 4.8709, "mean_token_accuracy": 0.23595583885908128, "num_tokens": 107112014.0, "step": 46765 }, { "entropy": 5.729031610488891, "epoch": 4.623368920521946, "grad_norm": 1.3203125, "learning_rate": 0.0003052994004715306, "loss": 4.8819, "mean_token_accuracy": 0.23987618535757066, "num_tokens": 107124458.0, "step": 46770 }, { "entropy": 5.833514547348022, "epoch": 4.623863187030447, "grad_norm": 1.390625, "learning_rate": 0.00030526443156179327, "loss": 5.0123, "mean_token_accuracy": 0.22328999489545823, "num_tokens": 107135701.0, "step": 46775 }, { "entropy": 5.793702745437622, "epoch": 4.6243574535389484, "grad_norm": 1.203125, "learning_rate": 0.00030522946190754624, "loss": 4.9065, "mean_token_accuracy": 0.2326708570122719, "num_tokens": 107147347.0, "step": 46780 }, { "entropy": 5.81126561164856, "epoch": 4.62485172004745, "grad_norm": 1.3359375, "learning_rate": 0.0003051944915096498, "loss": 4.9735, "mean_token_accuracy": 0.2295999437570572, "num_tokens": 107159287.0, "step": 46785 }, { "entropy": 5.770407867431641, "epoch": 4.625345986555951, "grad_norm": 1.3125, "learning_rate": 0.0003051595203689642, "loss": 4.9808, "mean_token_accuracy": 0.22392118126153945, "num_tokens": 107170445.0, "step": 46790 }, { "entropy": 5.837595891952515, "epoch": 4.625840253064452, "grad_norm": 1.1640625, "learning_rate": 0.00030512454848634964, "loss": 4.9958, "mean_token_accuracy": 0.22195052355527878, "num_tokens": 107182676.0, "step": 46795 }, { "entropy": 5.804289770126343, "epoch": 4.6263345195729535, "grad_norm": 1.328125, "learning_rate": 0.00030508957586266656, "loss": 4.9829, "mean_token_accuracy": 0.2260310471057892, "num_tokens": 107192929.0, "step": 46800 }, { "entropy": 5.747317361831665, "epoch": 4.626828786081455, "grad_norm": 1.296875, "learning_rate": 0.00030505460249877523, "loss": 4.8671, "mean_token_accuracy": 0.237581966817379, "num_tokens": 107204649.0, "step": 46805 }, { "entropy": 5.771765613555909, "epoch": 4.627323052589956, "grad_norm": 1.3203125, "learning_rate": 0.00030501962839553603, "loss": 4.9419, "mean_token_accuracy": 0.23457082360982895, "num_tokens": 107216784.0, "step": 46810 }, { "entropy": 5.743585157394409, "epoch": 4.627817319098458, "grad_norm": 1.296875, "learning_rate": 0.0003049846535538094, "loss": 4.8987, "mean_token_accuracy": 0.23351547867059708, "num_tokens": 107228265.0, "step": 46815 }, { "entropy": 5.847634267807007, "epoch": 4.628311585606959, "grad_norm": 1.265625, "learning_rate": 0.0003049496779744555, "loss": 4.9971, "mean_token_accuracy": 0.22111781537532807, "num_tokens": 107239433.0, "step": 46820 }, { "entropy": 5.803410005569458, "epoch": 4.628805852115461, "grad_norm": 1.3515625, "learning_rate": 0.00030491470165833483, "loss": 4.8886, "mean_token_accuracy": 0.23405026495456696, "num_tokens": 107250780.0, "step": 46825 }, { "entropy": 5.722461748123169, "epoch": 4.629300118623962, "grad_norm": 1.421875, "learning_rate": 0.00030487972460630804, "loss": 4.8818, "mean_token_accuracy": 0.2355014681816101, "num_tokens": 107261914.0, "step": 46830 }, { "entropy": 5.761139249801635, "epoch": 4.629794385132463, "grad_norm": 1.3828125, "learning_rate": 0.00030484474681923533, "loss": 4.9282, "mean_token_accuracy": 0.23302968442440034, "num_tokens": 107272697.0, "step": 46835 }, { "entropy": 5.845745086669922, "epoch": 4.6302886516409645, "grad_norm": 1.4765625, "learning_rate": 0.0003048097682979772, "loss": 5.0165, "mean_token_accuracy": 0.23046574145555496, "num_tokens": 107283722.0, "step": 46840 }, { "entropy": 5.823620843887329, "epoch": 4.630782918149466, "grad_norm": 1.3203125, "learning_rate": 0.00030477478904339405, "loss": 4.9982, "mean_token_accuracy": 0.22307006418704986, "num_tokens": 107296605.0, "step": 46845 }, { "entropy": 5.8146570205688475, "epoch": 4.631277184657968, "grad_norm": 1.171875, "learning_rate": 0.00030473980905634655, "loss": 4.9811, "mean_token_accuracy": 0.22446367591619493, "num_tokens": 107309564.0, "step": 46850 }, { "entropy": 5.792740392684936, "epoch": 4.631771451166469, "grad_norm": 1.203125, "learning_rate": 0.0003047048283376952, "loss": 4.8964, "mean_token_accuracy": 0.23018056601285936, "num_tokens": 107321400.0, "step": 46855 }, { "entropy": 5.818086576461792, "epoch": 4.63226571767497, "grad_norm": 1.21875, "learning_rate": 0.0003046698468883004, "loss": 5.0012, "mean_token_accuracy": 0.22375721782445906, "num_tokens": 107333242.0, "step": 46860 }, { "entropy": 5.657722091674804, "epoch": 4.632759984183472, "grad_norm": 1.1953125, "learning_rate": 0.0003046348647090227, "loss": 4.8171, "mean_token_accuracy": 0.24118132442235946, "num_tokens": 107346641.0, "step": 46865 }, { "entropy": 5.7459029197692875, "epoch": 4.633254250691973, "grad_norm": 1.234375, "learning_rate": 0.0003045998818007228, "loss": 4.8513, "mean_token_accuracy": 0.23637654185295104, "num_tokens": 107358274.0, "step": 46870 }, { "entropy": 5.838780164718628, "epoch": 4.633748517200474, "grad_norm": 1.34375, "learning_rate": 0.00030456489816426123, "loss": 4.9924, "mean_token_accuracy": 0.22585046887397767, "num_tokens": 107370984.0, "step": 46875 }, { "entropy": 5.805145740509033, "epoch": 4.6342427837089755, "grad_norm": 1.25, "learning_rate": 0.0003045299138004986, "loss": 4.9704, "mean_token_accuracy": 0.23411972522735597, "num_tokens": 107383416.0, "step": 46880 }, { "entropy": 5.749883604049683, "epoch": 4.634737050217478, "grad_norm": 1.1484375, "learning_rate": 0.0003044949287102955, "loss": 4.8764, "mean_token_accuracy": 0.2316595658659935, "num_tokens": 107394949.0, "step": 46885 }, { "entropy": 5.7576038360595705, "epoch": 4.635231316725979, "grad_norm": 1.3515625, "learning_rate": 0.0003044599428945125, "loss": 4.9278, "mean_token_accuracy": 0.23068660646677017, "num_tokens": 107406310.0, "step": 46890 }, { "entropy": 5.809793853759766, "epoch": 4.63572558323448, "grad_norm": 1.2734375, "learning_rate": 0.0003044249563540104, "loss": 4.9693, "mean_token_accuracy": 0.2268818974494934, "num_tokens": 107417988.0, "step": 46895 }, { "entropy": 5.752955722808838, "epoch": 4.636219849742981, "grad_norm": 1.25, "learning_rate": 0.00030438996908964985, "loss": 4.8777, "mean_token_accuracy": 0.23615337163209915, "num_tokens": 107430254.0, "step": 46900 }, { "entropy": 5.7924481391906735, "epoch": 4.636714116251483, "grad_norm": 1.328125, "learning_rate": 0.00030435498110229143, "loss": 4.9305, "mean_token_accuracy": 0.23742320984601975, "num_tokens": 107441674.0, "step": 46905 }, { "entropy": 5.842913198471069, "epoch": 4.637208382759984, "grad_norm": 1.359375, "learning_rate": 0.0003043199923927959, "loss": 4.9677, "mean_token_accuracy": 0.228306382894516, "num_tokens": 107452019.0, "step": 46910 }, { "entropy": 5.854248142242431, "epoch": 4.637702649268485, "grad_norm": 1.453125, "learning_rate": 0.000304285002962024, "loss": 5.0642, "mean_token_accuracy": 0.21787166297435762, "num_tokens": 107463254.0, "step": 46915 }, { "entropy": 5.764175462722778, "epoch": 4.638196915776987, "grad_norm": 1.3046875, "learning_rate": 0.0003042500128108366, "loss": 4.9216, "mean_token_accuracy": 0.23076693713665009, "num_tokens": 107474674.0, "step": 46920 }, { "entropy": 5.801751518249512, "epoch": 4.638691182285489, "grad_norm": 1.234375, "learning_rate": 0.00030421502194009426, "loss": 4.9709, "mean_token_accuracy": 0.22785632759332658, "num_tokens": 107486374.0, "step": 46925 }, { "entropy": 5.795235633850098, "epoch": 4.63918544879399, "grad_norm": 1.3203125, "learning_rate": 0.00030418003035065784, "loss": 4.937, "mean_token_accuracy": 0.22354020923376083, "num_tokens": 107497759.0, "step": 46930 }, { "entropy": 5.777407789230347, "epoch": 4.639679715302491, "grad_norm": 1.3203125, "learning_rate": 0.0003041450380433882, "loss": 4.9102, "mean_token_accuracy": 0.23000673204660416, "num_tokens": 107509693.0, "step": 46935 }, { "entropy": 5.696861124038696, "epoch": 4.640173981810992, "grad_norm": 1.3203125, "learning_rate": 0.00030411004501914603, "loss": 4.8585, "mean_token_accuracy": 0.23283033967018127, "num_tokens": 107521453.0, "step": 46940 }, { "entropy": 5.7536849021911625, "epoch": 4.640668248319494, "grad_norm": 1.5234375, "learning_rate": 0.0003040750512787923, "loss": 4.8734, "mean_token_accuracy": 0.24750007539987565, "num_tokens": 107533401.0, "step": 46945 }, { "entropy": 5.815132761001587, "epoch": 4.641162514827995, "grad_norm": 1.265625, "learning_rate": 0.0003040400568231878, "loss": 4.89, "mean_token_accuracy": 0.2341687023639679, "num_tokens": 107545126.0, "step": 46950 }, { "entropy": 5.893264818191528, "epoch": 4.641656781336497, "grad_norm": 1.265625, "learning_rate": 0.00030400506165319333, "loss": 5.0632, "mean_token_accuracy": 0.21849648803472518, "num_tokens": 107555774.0, "step": 46955 }, { "entropy": 5.847916126251221, "epoch": 4.642151047844998, "grad_norm": 1.2734375, "learning_rate": 0.0003039700657696699, "loss": 5.0371, "mean_token_accuracy": 0.21739352196455003, "num_tokens": 107567522.0, "step": 46960 }, { "entropy": 5.724497699737549, "epoch": 4.6426453143535, "grad_norm": 1.3203125, "learning_rate": 0.00030393506917347833, "loss": 4.8422, "mean_token_accuracy": 0.24883191883563996, "num_tokens": 107578637.0, "step": 46965 }, { "entropy": 5.713301801681519, "epoch": 4.643139580862001, "grad_norm": 1.328125, "learning_rate": 0.00030390007186547956, "loss": 4.9028, "mean_token_accuracy": 0.22882129698991777, "num_tokens": 107590750.0, "step": 46970 }, { "entropy": 5.775608205795288, "epoch": 4.643633847370502, "grad_norm": 1.375, "learning_rate": 0.0003038650738465347, "loss": 4.8998, "mean_token_accuracy": 0.23181559294462203, "num_tokens": 107600660.0, "step": 46975 }, { "entropy": 5.803049373626709, "epoch": 4.644128113879003, "grad_norm": 1.3046875, "learning_rate": 0.0003038300751175044, "loss": 4.9801, "mean_token_accuracy": 0.22562056928873062, "num_tokens": 107612880.0, "step": 46980 }, { "entropy": 5.728144025802612, "epoch": 4.644622380387505, "grad_norm": 1.28125, "learning_rate": 0.0003037950756792497, "loss": 4.9074, "mean_token_accuracy": 0.2424024224281311, "num_tokens": 107625651.0, "step": 46985 }, { "entropy": 5.806266117095947, "epoch": 4.645116646896007, "grad_norm": 1.3984375, "learning_rate": 0.0003037600755326317, "loss": 4.9098, "mean_token_accuracy": 0.23096064627170562, "num_tokens": 107636418.0, "step": 46990 }, { "entropy": 5.811736583709717, "epoch": 4.645610913404508, "grad_norm": 1.265625, "learning_rate": 0.00030372507467851155, "loss": 4.9868, "mean_token_accuracy": 0.22928935885429383, "num_tokens": 107648643.0, "step": 46995 }, { "entropy": 5.779860019683838, "epoch": 4.646105179913009, "grad_norm": 1.2421875, "learning_rate": 0.00030369007311775, "loss": 4.9521, "mean_token_accuracy": 0.2262760728597641, "num_tokens": 107660183.0, "step": 47000 }, { "entropy": 5.77252049446106, "epoch": 4.646599446421511, "grad_norm": 1.28125, "learning_rate": 0.0003036550708512082, "loss": 4.9462, "mean_token_accuracy": 0.23115115314722062, "num_tokens": 107670868.0, "step": 47005 }, { "entropy": 5.7599915027618405, "epoch": 4.647093712930012, "grad_norm": 1.2421875, "learning_rate": 0.0003036200678797471, "loss": 4.9047, "mean_token_accuracy": 0.23555329591035842, "num_tokens": 107682502.0, "step": 47010 }, { "entropy": 5.819391965866089, "epoch": 4.647587979438513, "grad_norm": 1.3359375, "learning_rate": 0.000303585064204228, "loss": 4.9538, "mean_token_accuracy": 0.22348420917987824, "num_tokens": 107694490.0, "step": 47015 }, { "entropy": 5.848630809783936, "epoch": 4.648082245947014, "grad_norm": 1.25, "learning_rate": 0.000303550059825512, "loss": 4.9652, "mean_token_accuracy": 0.2221877709031105, "num_tokens": 107707172.0, "step": 47020 }, { "entropy": 5.8045569896698, "epoch": 4.6485765124555165, "grad_norm": 1.484375, "learning_rate": 0.00030351505474445997, "loss": 4.8944, "mean_token_accuracy": 0.23476910442113877, "num_tokens": 107718919.0, "step": 47025 }, { "entropy": 5.798918342590332, "epoch": 4.649070778964018, "grad_norm": 1.3046875, "learning_rate": 0.0003034800489619332, "loss": 4.9583, "mean_token_accuracy": 0.22852526903152465, "num_tokens": 107729839.0, "step": 47030 }, { "entropy": 5.736470365524292, "epoch": 4.649565045472519, "grad_norm": 1.265625, "learning_rate": 0.00030344504247879273, "loss": 4.8666, "mean_token_accuracy": 0.23711312115192412, "num_tokens": 107740551.0, "step": 47035 }, { "entropy": 5.834483671188354, "epoch": 4.65005931198102, "grad_norm": 1.1953125, "learning_rate": 0.0003034100352958999, "loss": 5.0346, "mean_token_accuracy": 0.21883748918771745, "num_tokens": 107754594.0, "step": 47040 }, { "entropy": 5.788775205612183, "epoch": 4.6505535784895216, "grad_norm": 1.28125, "learning_rate": 0.0003033750274141157, "loss": 4.9434, "mean_token_accuracy": 0.22954196631908416, "num_tokens": 107765957.0, "step": 47045 }, { "entropy": 5.81618914604187, "epoch": 4.651047844998023, "grad_norm": 1.4140625, "learning_rate": 0.0003033400188343015, "loss": 4.9178, "mean_token_accuracy": 0.23099416494369507, "num_tokens": 107776336.0, "step": 47050 }, { "entropy": 5.705657148361206, "epoch": 4.651542111506524, "grad_norm": 1.203125, "learning_rate": 0.0003033050095573185, "loss": 4.8482, "mean_token_accuracy": 0.24015369564294814, "num_tokens": 107788394.0, "step": 47055 }, { "entropy": 5.830919408798218, "epoch": 4.652036378015025, "grad_norm": 1.1328125, "learning_rate": 0.0003032699995840277, "loss": 4.9709, "mean_token_accuracy": 0.2256106972694397, "num_tokens": 107800398.0, "step": 47060 }, { "entropy": 5.815746927261353, "epoch": 4.652530644523527, "grad_norm": 1.2421875, "learning_rate": 0.0003032349889152907, "loss": 4.9686, "mean_token_accuracy": 0.22416827976703643, "num_tokens": 107810906.0, "step": 47065 }, { "entropy": 5.747481489181519, "epoch": 4.653024911032029, "grad_norm": 1.265625, "learning_rate": 0.0003031999775519685, "loss": 4.8307, "mean_token_accuracy": 0.2402476578950882, "num_tokens": 107821864.0, "step": 47070 }, { "entropy": 5.768503618240357, "epoch": 4.65351917754053, "grad_norm": 1.28125, "learning_rate": 0.00030316496549492243, "loss": 4.8854, "mean_token_accuracy": 0.23162124156951905, "num_tokens": 107832898.0, "step": 47075 }, { "entropy": 5.7859814167022705, "epoch": 4.654013444049031, "grad_norm": 1.484375, "learning_rate": 0.0003031299527450139, "loss": 4.9559, "mean_token_accuracy": 0.2311214253306389, "num_tokens": 107845075.0, "step": 47080 }, { "entropy": 5.895735883712769, "epoch": 4.6545077105575325, "grad_norm": 1.2734375, "learning_rate": 0.00030309493930310416, "loss": 5.0282, "mean_token_accuracy": 0.21744897216558456, "num_tokens": 107856735.0, "step": 47085 }, { "entropy": 5.771990633010864, "epoch": 4.655001977066034, "grad_norm": 1.421875, "learning_rate": 0.0003030599251700546, "loss": 4.8759, "mean_token_accuracy": 0.24318237900733947, "num_tokens": 107868224.0, "step": 47090 }, { "entropy": 5.7607152462005615, "epoch": 4.655496243574535, "grad_norm": 1.3984375, "learning_rate": 0.0003030249103467265, "loss": 4.9575, "mean_token_accuracy": 0.22793270349502565, "num_tokens": 107879332.0, "step": 47095 }, { "entropy": 5.778506803512573, "epoch": 4.655990510083036, "grad_norm": 1.21875, "learning_rate": 0.0003029898948339812, "loss": 4.9154, "mean_token_accuracy": 0.2332310274243355, "num_tokens": 107891537.0, "step": 47100 }, { "entropy": 5.736543750762939, "epoch": 4.6564847765915385, "grad_norm": 1.3203125, "learning_rate": 0.00030295487863268015, "loss": 4.8442, "mean_token_accuracy": 0.2425287976861, "num_tokens": 107904127.0, "step": 47105 }, { "entropy": 5.822204828262329, "epoch": 4.65697904310004, "grad_norm": 1.28125, "learning_rate": 0.00030291986174368484, "loss": 4.9488, "mean_token_accuracy": 0.22527184933423997, "num_tokens": 107915436.0, "step": 47110 }, { "entropy": 5.673159790039063, "epoch": 4.657473309608541, "grad_norm": 1.515625, "learning_rate": 0.00030288484416785656, "loss": 4.7931, "mean_token_accuracy": 0.23887789994478226, "num_tokens": 107927335.0, "step": 47115 }, { "entropy": 5.771707677841187, "epoch": 4.657967576117042, "grad_norm": 1.234375, "learning_rate": 0.00030284982590605687, "loss": 4.9419, "mean_token_accuracy": 0.22586944550275803, "num_tokens": 107938941.0, "step": 47120 }, { "entropy": 5.810255908966065, "epoch": 4.6584618426255435, "grad_norm": 1.3515625, "learning_rate": 0.00030281480695914696, "loss": 4.9732, "mean_token_accuracy": 0.22516824901103974, "num_tokens": 107950333.0, "step": 47125 }, { "entropy": 5.821358728408813, "epoch": 4.658956109134045, "grad_norm": 1.34375, "learning_rate": 0.00030277978732798854, "loss": 4.9632, "mean_token_accuracy": 0.23040594905614853, "num_tokens": 107960951.0, "step": 47130 }, { "entropy": 5.80390419960022, "epoch": 4.659450375642546, "grad_norm": 1.3046875, "learning_rate": 0.00030274476701344313, "loss": 4.9638, "mean_token_accuracy": 0.23027291446924208, "num_tokens": 107972383.0, "step": 47135 }, { "entropy": 5.751413106918335, "epoch": 4.659944642151048, "grad_norm": 1.4296875, "learning_rate": 0.00030270974601637207, "loss": 4.8784, "mean_token_accuracy": 0.23280862271785735, "num_tokens": 107984562.0, "step": 47140 }, { "entropy": 5.732869243621826, "epoch": 4.6604389086595495, "grad_norm": 1.3984375, "learning_rate": 0.000302674724337637, "loss": 4.8765, "mean_token_accuracy": 0.23776807636022568, "num_tokens": 107995445.0, "step": 47145 }, { "entropy": 5.824235534667968, "epoch": 4.660933175168051, "grad_norm": 1.3125, "learning_rate": 0.00030263970197809935, "loss": 5.0088, "mean_token_accuracy": 0.22183357328176498, "num_tokens": 108007444.0, "step": 47150 }, { "entropy": 5.808983230590821, "epoch": 4.661427441676552, "grad_norm": 1.3359375, "learning_rate": 0.00030260467893862086, "loss": 4.9533, "mean_token_accuracy": 0.23162726014852525, "num_tokens": 108019813.0, "step": 47155 }, { "entropy": 5.756083583831787, "epoch": 4.661921708185053, "grad_norm": 1.390625, "learning_rate": 0.0003025696552200629, "loss": 4.8481, "mean_token_accuracy": 0.24116761684417726, "num_tokens": 108031309.0, "step": 47160 }, { "entropy": 5.720457220077515, "epoch": 4.6624159746935545, "grad_norm": 1.5, "learning_rate": 0.0003025346308232872, "loss": 4.8871, "mean_token_accuracy": 0.2379217267036438, "num_tokens": 108042480.0, "step": 47165 }, { "entropy": 5.807332468032837, "epoch": 4.662910241202056, "grad_norm": 1.3203125, "learning_rate": 0.00030249960574915523, "loss": 4.9219, "mean_token_accuracy": 0.22399173974990844, "num_tokens": 108054297.0, "step": 47170 }, { "entropy": 5.816686916351318, "epoch": 4.663404507710558, "grad_norm": 1.2734375, "learning_rate": 0.0003024645799985287, "loss": 4.9969, "mean_token_accuracy": 0.2252377226948738, "num_tokens": 108066065.0, "step": 47175 }, { "entropy": 5.868224334716797, "epoch": 4.663898774219059, "grad_norm": 1.2421875, "learning_rate": 0.0003024295535722693, "loss": 5.0065, "mean_token_accuracy": 0.2236034169793129, "num_tokens": 108078421.0, "step": 47180 }, { "entropy": 5.76887698173523, "epoch": 4.6643930407275604, "grad_norm": 1.3828125, "learning_rate": 0.0003023945264712386, "loss": 4.9721, "mean_token_accuracy": 0.2306017830967903, "num_tokens": 108090022.0, "step": 47185 }, { "entropy": 5.7657371997833256, "epoch": 4.664887307236062, "grad_norm": 1.234375, "learning_rate": 0.0003023594986962984, "loss": 4.9484, "mean_token_accuracy": 0.22866140455007553, "num_tokens": 108102425.0, "step": 47190 }, { "entropy": 5.796149492263794, "epoch": 4.665381573744563, "grad_norm": 1.3125, "learning_rate": 0.00030232447024831015, "loss": 4.9653, "mean_token_accuracy": 0.22979059666395188, "num_tokens": 108114801.0, "step": 47195 }, { "entropy": 5.7963744640350345, "epoch": 4.665875840253064, "grad_norm": 1.359375, "learning_rate": 0.00030228944112813567, "loss": 4.9023, "mean_token_accuracy": 0.2323967769742012, "num_tokens": 108126089.0, "step": 47200 }, { "entropy": 5.747124576568604, "epoch": 4.6663701067615655, "grad_norm": 1.375, "learning_rate": 0.0003022544113366368, "loss": 4.8385, "mean_token_accuracy": 0.2410220116376877, "num_tokens": 108137500.0, "step": 47205 }, { "entropy": 5.780154418945313, "epoch": 4.666864373270068, "grad_norm": 1.3125, "learning_rate": 0.00030221938087467517, "loss": 5.0089, "mean_token_accuracy": 0.216172057390213, "num_tokens": 108148645.0, "step": 47210 }, { "entropy": 5.800406265258789, "epoch": 4.667358639778569, "grad_norm": 1.21875, "learning_rate": 0.0003021843497431125, "loss": 4.9626, "mean_token_accuracy": 0.2223236531019211, "num_tokens": 108159227.0, "step": 47215 }, { "entropy": 5.767984294891358, "epoch": 4.66785290628707, "grad_norm": 1.2890625, "learning_rate": 0.0003021493179428107, "loss": 4.9131, "mean_token_accuracy": 0.23571093380451202, "num_tokens": 108170686.0, "step": 47220 }, { "entropy": 5.845607566833496, "epoch": 4.668347172795571, "grad_norm": 1.3828125, "learning_rate": 0.0003021142854746314, "loss": 4.9711, "mean_token_accuracy": 0.2292397752404213, "num_tokens": 108182170.0, "step": 47225 }, { "entropy": 5.730560541152954, "epoch": 4.668841439304073, "grad_norm": 1.3203125, "learning_rate": 0.0003020792523394364, "loss": 4.8647, "mean_token_accuracy": 0.23827758580446243, "num_tokens": 108193638.0, "step": 47230 }, { "entropy": 5.744837665557862, "epoch": 4.669335705812574, "grad_norm": 1.390625, "learning_rate": 0.00030204421853808765, "loss": 4.9482, "mean_token_accuracy": 0.22724126428365707, "num_tokens": 108205455.0, "step": 47235 }, { "entropy": 5.80811915397644, "epoch": 4.669829972321075, "grad_norm": 1.265625, "learning_rate": 0.000302009184071447, "loss": 4.937, "mean_token_accuracy": 0.22525297701358796, "num_tokens": 108216949.0, "step": 47240 }, { "entropy": 5.847018527984619, "epoch": 4.670324238829577, "grad_norm": 1.296875, "learning_rate": 0.0003019741489403762, "loss": 4.9467, "mean_token_accuracy": 0.2233959749341011, "num_tokens": 108227792.0, "step": 47245 }, { "entropy": 5.788420820236206, "epoch": 4.670818505338079, "grad_norm": 1.234375, "learning_rate": 0.0003019391131457371, "loss": 4.9056, "mean_token_accuracy": 0.2358655020594597, "num_tokens": 108239167.0, "step": 47250 }, { "entropy": 5.8632443904876705, "epoch": 4.67131277184658, "grad_norm": 1.2734375, "learning_rate": 0.0003019040766883917, "loss": 5.0346, "mean_token_accuracy": 0.22102455347776412, "num_tokens": 108251241.0, "step": 47255 }, { "entropy": 5.755634927749634, "epoch": 4.671807038355081, "grad_norm": 1.2421875, "learning_rate": 0.00030186903956920183, "loss": 4.8762, "mean_token_accuracy": 0.23423669934272767, "num_tokens": 108262287.0, "step": 47260 }, { "entropy": 5.7509729862213135, "epoch": 4.672301304863582, "grad_norm": 1.21875, "learning_rate": 0.0003018340017890294, "loss": 4.847, "mean_token_accuracy": 0.23831482529640197, "num_tokens": 108275126.0, "step": 47265 }, { "entropy": 5.726219034194946, "epoch": 4.672795571372084, "grad_norm": 1.4375, "learning_rate": 0.0003017989633487363, "loss": 4.8827, "mean_token_accuracy": 0.2269839733839035, "num_tokens": 108287021.0, "step": 47270 }, { "entropy": 5.774707841873169, "epoch": 4.673289837880585, "grad_norm": 1.328125, "learning_rate": 0.0003017639242491846, "loss": 4.8505, "mean_token_accuracy": 0.23849994391202928, "num_tokens": 108298512.0, "step": 47275 }, { "entropy": 5.727691411972046, "epoch": 4.673784104389087, "grad_norm": 1.2578125, "learning_rate": 0.0003017288844912362, "loss": 4.8511, "mean_token_accuracy": 0.24037442356348038, "num_tokens": 108309505.0, "step": 47280 }, { "entropy": 5.793265295028687, "epoch": 4.674278370897588, "grad_norm": 1.2734375, "learning_rate": 0.00030169384407575315, "loss": 4.9246, "mean_token_accuracy": 0.22959048599004744, "num_tokens": 108320404.0, "step": 47285 }, { "entropy": 5.778944587707519, "epoch": 4.67477263740609, "grad_norm": 1.3515625, "learning_rate": 0.0003016588030035973, "loss": 4.9897, "mean_token_accuracy": 0.22556092590093613, "num_tokens": 108332221.0, "step": 47290 }, { "entropy": 5.7904242992401125, "epoch": 4.675266903914591, "grad_norm": 1.2578125, "learning_rate": 0.00030162376127563085, "loss": 4.9523, "mean_token_accuracy": 0.22357306629419327, "num_tokens": 108344962.0, "step": 47295 }, { "entropy": 5.727663230895996, "epoch": 4.675761170423092, "grad_norm": 1.3515625, "learning_rate": 0.00030158871889271574, "loss": 4.8374, "mean_token_accuracy": 0.2410629078745842, "num_tokens": 108356515.0, "step": 47300 }, { "entropy": 5.773973178863526, "epoch": 4.676255436931593, "grad_norm": 1.328125, "learning_rate": 0.00030155367585571393, "loss": 4.9319, "mean_token_accuracy": 0.2320661038160324, "num_tokens": 108367807.0, "step": 47305 }, { "entropy": 5.828750944137573, "epoch": 4.676749703440095, "grad_norm": 1.2890625, "learning_rate": 0.0003015186321654877, "loss": 5.0066, "mean_token_accuracy": 0.22485716491937638, "num_tokens": 108381296.0, "step": 47310 }, { "entropy": 5.814452123641968, "epoch": 4.677243969948596, "grad_norm": 1.3828125, "learning_rate": 0.00030148358782289893, "loss": 5.0048, "mean_token_accuracy": 0.2319187968969345, "num_tokens": 108392331.0, "step": 47315 }, { "entropy": 5.802259826660157, "epoch": 4.677738236457097, "grad_norm": 1.3359375, "learning_rate": 0.00030144854282880974, "loss": 4.8828, "mean_token_accuracy": 0.24043433964252472, "num_tokens": 108402523.0, "step": 47320 }, { "entropy": 5.8346014499664305, "epoch": 4.678232502965599, "grad_norm": 1.2890625, "learning_rate": 0.00030141349718408237, "loss": 4.9929, "mean_token_accuracy": 0.22858950942754747, "num_tokens": 108413828.0, "step": 47325 }, { "entropy": 5.754173517227173, "epoch": 4.678726769474101, "grad_norm": 1.3125, "learning_rate": 0.0003013784508895788, "loss": 4.861, "mean_token_accuracy": 0.23203733265399934, "num_tokens": 108424273.0, "step": 47330 }, { "entropy": 5.789046001434326, "epoch": 4.679221035982602, "grad_norm": 1.1171875, "learning_rate": 0.00030134340394616133, "loss": 4.9718, "mean_token_accuracy": 0.2277196690440178, "num_tokens": 108435620.0, "step": 47335 }, { "entropy": 5.679608774185181, "epoch": 4.679715302491103, "grad_norm": 1.484375, "learning_rate": 0.000301308356354692, "loss": 4.7852, "mean_token_accuracy": 0.23625802099704743, "num_tokens": 108445947.0, "step": 47340 }, { "entropy": 5.779399061203003, "epoch": 4.680209568999604, "grad_norm": 1.2421875, "learning_rate": 0.00030127330811603297, "loss": 4.9038, "mean_token_accuracy": 0.23002164661884308, "num_tokens": 108457343.0, "step": 47345 }, { "entropy": 5.684987592697143, "epoch": 4.680703835508106, "grad_norm": 1.265625, "learning_rate": 0.0003012382592310466, "loss": 4.803, "mean_token_accuracy": 0.24076834917068482, "num_tokens": 108468393.0, "step": 47350 }, { "entropy": 5.833012247085572, "epoch": 4.681198102016607, "grad_norm": 1.390625, "learning_rate": 0.00030120320970059494, "loss": 5.0168, "mean_token_accuracy": 0.22196914106607438, "num_tokens": 108479170.0, "step": 47355 }, { "entropy": 5.835642623901367, "epoch": 4.681692368525109, "grad_norm": 1.2890625, "learning_rate": 0.0003011681595255402, "loss": 4.9376, "mean_token_accuracy": 0.23087151497602462, "num_tokens": 108490807.0, "step": 47360 }, { "entropy": 5.911527395248413, "epoch": 4.68218663503361, "grad_norm": 1.3125, "learning_rate": 0.0003011331087067447, "loss": 5.0513, "mean_token_accuracy": 0.21888690441846848, "num_tokens": 108501582.0, "step": 47365 }, { "entropy": 5.795808029174805, "epoch": 4.682680901542112, "grad_norm": 1.2265625, "learning_rate": 0.00030109805724507074, "loss": 4.9256, "mean_token_accuracy": 0.23486603796482086, "num_tokens": 108513805.0, "step": 47370 }, { "entropy": 5.870370197296142, "epoch": 4.683175168050613, "grad_norm": 1.234375, "learning_rate": 0.0003010630051413804, "loss": 4.9745, "mean_token_accuracy": 0.21895952075719832, "num_tokens": 108525486.0, "step": 47375 }, { "entropy": 5.815187931060791, "epoch": 4.683669434559114, "grad_norm": 1.2421875, "learning_rate": 0.0003010279523965362, "loss": 4.9698, "mean_token_accuracy": 0.23192799985408782, "num_tokens": 108537194.0, "step": 47380 }, { "entropy": 5.8313206195831295, "epoch": 4.684163701067615, "grad_norm": 1.359375, "learning_rate": 0.0003009928990114003, "loss": 4.9922, "mean_token_accuracy": 0.22354118824005126, "num_tokens": 108548422.0, "step": 47385 }, { "entropy": 5.844069862365723, "epoch": 4.684657967576117, "grad_norm": 1.359375, "learning_rate": 0.000300957844986835, "loss": 4.9823, "mean_token_accuracy": 0.22397423535585403, "num_tokens": 108559604.0, "step": 47390 }, { "entropy": 5.818086242675781, "epoch": 4.685152234084619, "grad_norm": 1.359375, "learning_rate": 0.0003009227903237027, "loss": 5.0051, "mean_token_accuracy": 0.22341058552265167, "num_tokens": 108570878.0, "step": 47395 }, { "entropy": 5.768146419525147, "epoch": 4.68564650059312, "grad_norm": 1.296875, "learning_rate": 0.0003008877350228659, "loss": 4.8693, "mean_token_accuracy": 0.23457152843475343, "num_tokens": 108582687.0, "step": 47400 }, { "entropy": 5.762358236312866, "epoch": 4.686140767101621, "grad_norm": 1.3515625, "learning_rate": 0.0003008526790851866, "loss": 4.9127, "mean_token_accuracy": 0.23555808812379836, "num_tokens": 108593505.0, "step": 47405 }, { "entropy": 5.740628242492676, "epoch": 4.686635033610123, "grad_norm": 1.234375, "learning_rate": 0.00030081762251152745, "loss": 4.8659, "mean_token_accuracy": 0.2364867866039276, "num_tokens": 108604809.0, "step": 47410 }, { "entropy": 5.732062959671021, "epoch": 4.687129300118624, "grad_norm": 1.265625, "learning_rate": 0.00030078256530275077, "loss": 4.9121, "mean_token_accuracy": 0.23210962861776352, "num_tokens": 108616601.0, "step": 47415 }, { "entropy": 5.80835280418396, "epoch": 4.687623566627125, "grad_norm": 1.3671875, "learning_rate": 0.000300747507459719, "loss": 4.893, "mean_token_accuracy": 0.23503482192754746, "num_tokens": 108627521.0, "step": 47420 }, { "entropy": 5.818966627120972, "epoch": 4.688117833135626, "grad_norm": 1.203125, "learning_rate": 0.00030071244898329457, "loss": 4.9856, "mean_token_accuracy": 0.2256098970770836, "num_tokens": 108639602.0, "step": 47425 }, { "entropy": 5.891282367706299, "epoch": 4.6886120996441285, "grad_norm": 1.140625, "learning_rate": 0.0003006773898743399, "loss": 5.03, "mean_token_accuracy": 0.21880697160959245, "num_tokens": 108652546.0, "step": 47430 }, { "entropy": 5.750076484680176, "epoch": 4.68910636615263, "grad_norm": 1.3203125, "learning_rate": 0.0003006423301337174, "loss": 4.8464, "mean_token_accuracy": 0.23219281286001206, "num_tokens": 108663772.0, "step": 47435 }, { "entropy": 5.814196157455444, "epoch": 4.689600632661131, "grad_norm": 1.3359375, "learning_rate": 0.00030060726976228964, "loss": 4.9296, "mean_token_accuracy": 0.22501252889633178, "num_tokens": 108674865.0, "step": 47440 }, { "entropy": 5.835595655441284, "epoch": 4.690094899169632, "grad_norm": 1.3046875, "learning_rate": 0.0003005722087609191, "loss": 5.0479, "mean_token_accuracy": 0.22176049053668975, "num_tokens": 108687127.0, "step": 47445 }, { "entropy": 5.825901174545288, "epoch": 4.6905891656781336, "grad_norm": 1.421875, "learning_rate": 0.00030053714713046826, "loss": 4.9602, "mean_token_accuracy": 0.22832885831594468, "num_tokens": 108698119.0, "step": 47450 }, { "entropy": 5.757703685760498, "epoch": 4.691083432186635, "grad_norm": 1.234375, "learning_rate": 0.0003005020848717996, "loss": 4.9173, "mean_token_accuracy": 0.23430751711130143, "num_tokens": 108709104.0, "step": 47455 }, { "entropy": 5.710097885131836, "epoch": 4.691577698695136, "grad_norm": 1.3046875, "learning_rate": 0.0003004670219857757, "loss": 4.8887, "mean_token_accuracy": 0.24015873968601226, "num_tokens": 108720111.0, "step": 47460 }, { "entropy": 5.796454668045044, "epoch": 4.692071965203638, "grad_norm": 1.296875, "learning_rate": 0.0003004319584732591, "loss": 4.9776, "mean_token_accuracy": 0.22292574048042296, "num_tokens": 108731496.0, "step": 47465 }, { "entropy": 5.746397352218628, "epoch": 4.6925662317121395, "grad_norm": 1.328125, "learning_rate": 0.00030039689433511234, "loss": 4.9263, "mean_token_accuracy": 0.2338717073202133, "num_tokens": 108742760.0, "step": 47470 }, { "entropy": 5.722792768478394, "epoch": 4.693060498220641, "grad_norm": 1.3125, "learning_rate": 0.0003003618295721982, "loss": 4.8493, "mean_token_accuracy": 0.24326559007167817, "num_tokens": 108754554.0, "step": 47475 }, { "entropy": 5.82582802772522, "epoch": 4.693554764729142, "grad_norm": 1.2890625, "learning_rate": 0.0003003267641853789, "loss": 4.9277, "mean_token_accuracy": 0.232988241314888, "num_tokens": 108765832.0, "step": 47480 }, { "entropy": 5.793525505065918, "epoch": 4.694049031237643, "grad_norm": 1.2421875, "learning_rate": 0.00030029169817551746, "loss": 4.9176, "mean_token_accuracy": 0.22953367084264756, "num_tokens": 108776898.0, "step": 47485 }, { "entropy": 5.723574876785278, "epoch": 4.6945432977461445, "grad_norm": 1.390625, "learning_rate": 0.00030025663154347615, "loss": 4.802, "mean_token_accuracy": 0.24124278277158737, "num_tokens": 108786724.0, "step": 47490 }, { "entropy": 5.774144887924194, "epoch": 4.695037564254646, "grad_norm": 1.390625, "learning_rate": 0.00030022156429011787, "loss": 4.9493, "mean_token_accuracy": 0.22150613218545914, "num_tokens": 108797950.0, "step": 47495 }, { "entropy": 5.728539037704468, "epoch": 4.695531830763148, "grad_norm": 1.328125, "learning_rate": 0.0003001864964163053, "loss": 4.8585, "mean_token_accuracy": 0.236504989862442, "num_tokens": 108809931.0, "step": 47500 }, { "entropy": 5.792474794387817, "epoch": 4.696026097271649, "grad_norm": 1.359375, "learning_rate": 0.00030015142792290086, "loss": 4.9638, "mean_token_accuracy": 0.2231461688876152, "num_tokens": 108820893.0, "step": 47505 }, { "entropy": 5.821643543243408, "epoch": 4.6965203637801505, "grad_norm": 1.2578125, "learning_rate": 0.0003001163588107674, "loss": 4.9628, "mean_token_accuracy": 0.22859786003828048, "num_tokens": 108832208.0, "step": 47510 }, { "entropy": 5.840558242797852, "epoch": 4.697014630288652, "grad_norm": 1.359375, "learning_rate": 0.0003000812890807677, "loss": 5.0164, "mean_token_accuracy": 0.21479549258947372, "num_tokens": 108843297.0, "step": 47515 }, { "entropy": 5.82894082069397, "epoch": 4.697508896797153, "grad_norm": 1.3671875, "learning_rate": 0.0003000462187337644, "loss": 4.91, "mean_token_accuracy": 0.23035038709640504, "num_tokens": 108853503.0, "step": 47520 }, { "entropy": 5.8051676750183105, "epoch": 4.698003163305654, "grad_norm": 1.3203125, "learning_rate": 0.00030001114777062016, "loss": 4.9426, "mean_token_accuracy": 0.23255185335874556, "num_tokens": 108864305.0, "step": 47525 }, { "entropy": 5.670496797561645, "epoch": 4.6984974298141555, "grad_norm": 1.375, "learning_rate": 0.0002999760761921978, "loss": 4.837, "mean_token_accuracy": 0.24469426572322844, "num_tokens": 108875096.0, "step": 47530 }, { "entropy": 5.73917965888977, "epoch": 4.698991696322658, "grad_norm": 1.2734375, "learning_rate": 0.00029994100399936016, "loss": 4.8892, "mean_token_accuracy": 0.2391519844532013, "num_tokens": 108886708.0, "step": 47535 }, { "entropy": 5.826587677001953, "epoch": 4.699485962831159, "grad_norm": 1.3515625, "learning_rate": 0.00029990593119296995, "loss": 4.9843, "mean_token_accuracy": 0.21747240126132966, "num_tokens": 108897706.0, "step": 47540 }, { "entropy": 5.777768087387085, "epoch": 4.69998022933966, "grad_norm": 1.3125, "learning_rate": 0.00029987085777388994, "loss": 4.9189, "mean_token_accuracy": 0.2314580038189888, "num_tokens": 108908356.0, "step": 47545 }, { "entropy": 5.830490159988403, "epoch": 4.7004744958481615, "grad_norm": 1.34375, "learning_rate": 0.000299835783742983, "loss": 4.9415, "mean_token_accuracy": 0.2284214034676552, "num_tokens": 108920090.0, "step": 47550 }, { "entropy": 5.741714334487915, "epoch": 4.700968762356663, "grad_norm": 1.375, "learning_rate": 0.00029980070910111184, "loss": 4.8407, "mean_token_accuracy": 0.24353937804698944, "num_tokens": 108931171.0, "step": 47555 }, { "entropy": 5.782672357559204, "epoch": 4.701463028865164, "grad_norm": 1.21875, "learning_rate": 0.0002997656338491395, "loss": 4.941, "mean_token_accuracy": 0.23217135965824126, "num_tokens": 108941915.0, "step": 47560 }, { "entropy": 5.78099684715271, "epoch": 4.701957295373665, "grad_norm": 1.296875, "learning_rate": 0.00029973055798792865, "loss": 4.9203, "mean_token_accuracy": 0.2261556178331375, "num_tokens": 108953983.0, "step": 47565 }, { "entropy": 5.709943675994873, "epoch": 4.7024515618821665, "grad_norm": 1.2578125, "learning_rate": 0.00029969548151834223, "loss": 4.8448, "mean_token_accuracy": 0.24059588015079497, "num_tokens": 108965372.0, "step": 47570 }, { "entropy": 5.783597373962403, "epoch": 4.702945828390668, "grad_norm": 1.328125, "learning_rate": 0.0002996604044412431, "loss": 4.9309, "mean_token_accuracy": 0.22744090110063553, "num_tokens": 108975739.0, "step": 47575 }, { "entropy": 5.849443531036377, "epoch": 4.70344009489917, "grad_norm": 1.3046875, "learning_rate": 0.00029962532675749425, "loss": 5.0114, "mean_token_accuracy": 0.22142528891563415, "num_tokens": 108987005.0, "step": 47580 }, { "entropy": 5.789889287948609, "epoch": 4.703934361407671, "grad_norm": 1.3671875, "learning_rate": 0.0002995902484679586, "loss": 4.9208, "mean_token_accuracy": 0.22667604982852935, "num_tokens": 108998353.0, "step": 47585 }, { "entropy": 5.878598880767822, "epoch": 4.7044286279161724, "grad_norm": 1.328125, "learning_rate": 0.000299555169573499, "loss": 5.1309, "mean_token_accuracy": 0.22114192694425583, "num_tokens": 109010991.0, "step": 47590 }, { "entropy": 5.776914167404175, "epoch": 4.704922894424674, "grad_norm": 1.328125, "learning_rate": 0.0002995200900749784, "loss": 4.8383, "mean_token_accuracy": 0.2362937346100807, "num_tokens": 109021850.0, "step": 47595 }, { "entropy": 5.8423261642456055, "epoch": 4.705417160933175, "grad_norm": 1.3359375, "learning_rate": 0.00029948500997325974, "loss": 4.9823, "mean_token_accuracy": 0.2264585167169571, "num_tokens": 109032900.0, "step": 47600 }, { "entropy": 5.815677547454834, "epoch": 4.705911427441676, "grad_norm": 1.40625, "learning_rate": 0.00029944992926920604, "loss": 5.0111, "mean_token_accuracy": 0.22767894715070724, "num_tokens": 109043861.0, "step": 47605 }, { "entropy": 5.7531952381134035, "epoch": 4.7064056939501775, "grad_norm": 1.2890625, "learning_rate": 0.0002994148479636803, "loss": 4.8749, "mean_token_accuracy": 0.22969327569007875, "num_tokens": 109054662.0, "step": 47610 }, { "entropy": 5.745825719833374, "epoch": 4.70689996045868, "grad_norm": 1.4375, "learning_rate": 0.0002993797660575456, "loss": 4.8384, "mean_token_accuracy": 0.24698904007673264, "num_tokens": 109065767.0, "step": 47615 }, { "entropy": 5.760192346572876, "epoch": 4.707394226967181, "grad_norm": 1.25, "learning_rate": 0.00029934468355166476, "loss": 4.9693, "mean_token_accuracy": 0.2245113432407379, "num_tokens": 109076984.0, "step": 47620 }, { "entropy": 5.807067060470581, "epoch": 4.707888493475682, "grad_norm": 1.2890625, "learning_rate": 0.0002993096004469009, "loss": 4.9363, "mean_token_accuracy": 0.2207971140742302, "num_tokens": 109089105.0, "step": 47625 }, { "entropy": 5.834498739242553, "epoch": 4.708382759984183, "grad_norm": 1.2734375, "learning_rate": 0.0002992745167441172, "loss": 4.9532, "mean_token_accuracy": 0.22714738845825194, "num_tokens": 109100918.0, "step": 47630 }, { "entropy": 5.806296682357788, "epoch": 4.708877026492685, "grad_norm": 1.3046875, "learning_rate": 0.00029923943244417663, "loss": 4.9078, "mean_token_accuracy": 0.23116590231657028, "num_tokens": 109112304.0, "step": 47635 }, { "entropy": 5.782422256469727, "epoch": 4.709371293001186, "grad_norm": 1.3828125, "learning_rate": 0.00029920434754794216, "loss": 4.9864, "mean_token_accuracy": 0.23077698200941085, "num_tokens": 109122651.0, "step": 47640 }, { "entropy": 5.730442476272583, "epoch": 4.709865559509687, "grad_norm": 1.4140625, "learning_rate": 0.0002991692620562771, "loss": 4.8151, "mean_token_accuracy": 0.23456472307443618, "num_tokens": 109135064.0, "step": 47645 }, { "entropy": 5.789420890808105, "epoch": 4.710359826018189, "grad_norm": 1.421875, "learning_rate": 0.0002991341759700443, "loss": 4.9548, "mean_token_accuracy": 0.23002425134181975, "num_tokens": 109148202.0, "step": 47650 }, { "entropy": 5.791964721679688, "epoch": 4.710854092526691, "grad_norm": 1.21875, "learning_rate": 0.00029909908929010715, "loss": 4.9165, "mean_token_accuracy": 0.23380051404237748, "num_tokens": 109160867.0, "step": 47655 }, { "entropy": 5.7236556053161625, "epoch": 4.711348359035192, "grad_norm": 1.25, "learning_rate": 0.0002990640020173286, "loss": 4.9109, "mean_token_accuracy": 0.22859922498464585, "num_tokens": 109173107.0, "step": 47660 }, { "entropy": 5.750639581680298, "epoch": 4.711842625543693, "grad_norm": 1.3671875, "learning_rate": 0.00029902891415257196, "loss": 4.9391, "mean_token_accuracy": 0.22540190815925598, "num_tokens": 109184148.0, "step": 47665 }, { "entropy": 5.779976320266724, "epoch": 4.712336892052194, "grad_norm": 1.3046875, "learning_rate": 0.00029899382569670025, "loss": 4.8291, "mean_token_accuracy": 0.2380516678094864, "num_tokens": 109194647.0, "step": 47670 }, { "entropy": 5.8154045104980465, "epoch": 4.712831158560696, "grad_norm": 1.3984375, "learning_rate": 0.00029895873665057663, "loss": 4.953, "mean_token_accuracy": 0.2364491879940033, "num_tokens": 109206495.0, "step": 47675 }, { "entropy": 5.778707790374756, "epoch": 4.713325425069197, "grad_norm": 1.4765625, "learning_rate": 0.0002989236470150644, "loss": 4.9636, "mean_token_accuracy": 0.2275765359401703, "num_tokens": 109217131.0, "step": 47680 }, { "entropy": 5.718992137908936, "epoch": 4.713819691577699, "grad_norm": 1.28125, "learning_rate": 0.0002988885567910269, "loss": 4.9023, "mean_token_accuracy": 0.23317519724369049, "num_tokens": 109228785.0, "step": 47685 }, { "entropy": 5.816817855834961, "epoch": 4.7143139580862, "grad_norm": 1.3359375, "learning_rate": 0.00029885346597932703, "loss": 4.9616, "mean_token_accuracy": 0.22616491764783858, "num_tokens": 109240821.0, "step": 47690 }, { "entropy": 5.802253532409668, "epoch": 4.714808224594702, "grad_norm": 1.296875, "learning_rate": 0.0002988183745808282, "loss": 4.9147, "mean_token_accuracy": 0.23629493564367293, "num_tokens": 109251982.0, "step": 47695 }, { "entropy": 5.75986762046814, "epoch": 4.715302491103203, "grad_norm": 1.40625, "learning_rate": 0.00029878328259639377, "loss": 4.9598, "mean_token_accuracy": 0.22361217439174652, "num_tokens": 109263176.0, "step": 47700 }, { "entropy": 5.74373950958252, "epoch": 4.715796757611704, "grad_norm": 1.2578125, "learning_rate": 0.0002987481900268868, "loss": 4.9484, "mean_token_accuracy": 0.2228730872273445, "num_tokens": 109275076.0, "step": 47705 }, { "entropy": 5.829935598373413, "epoch": 4.716291024120205, "grad_norm": 1.4140625, "learning_rate": 0.00029871309687317066, "loss": 4.9589, "mean_token_accuracy": 0.2250740945339203, "num_tokens": 109285872.0, "step": 47710 }, { "entropy": 5.818625593185425, "epoch": 4.716785290628707, "grad_norm": 1.3671875, "learning_rate": 0.0002986780031361087, "loss": 4.9686, "mean_token_accuracy": 0.22753921151161194, "num_tokens": 109298268.0, "step": 47715 }, { "entropy": 5.8017435550689695, "epoch": 4.717279557137209, "grad_norm": 1.296875, "learning_rate": 0.00029864290881656427, "loss": 4.9348, "mean_token_accuracy": 0.22436753064393997, "num_tokens": 109309739.0, "step": 47720 }, { "entropy": 5.726105833053589, "epoch": 4.71777382364571, "grad_norm": 1.3125, "learning_rate": 0.00029860781391540046, "loss": 4.8924, "mean_token_accuracy": 0.23759746849536895, "num_tokens": 109321876.0, "step": 47725 }, { "entropy": 5.84837121963501, "epoch": 4.718268090154211, "grad_norm": 1.2109375, "learning_rate": 0.0002985727184334809, "loss": 4.9115, "mean_token_accuracy": 0.2332331657409668, "num_tokens": 109333112.0, "step": 47730 }, { "entropy": 5.761255359649658, "epoch": 4.718762356662713, "grad_norm": 1.2890625, "learning_rate": 0.0002985376223716688, "loss": 4.9378, "mean_token_accuracy": 0.2280514121055603, "num_tokens": 109344590.0, "step": 47735 }, { "entropy": 5.732264661788941, "epoch": 4.719256623171214, "grad_norm": 1.328125, "learning_rate": 0.00029850252573082744, "loss": 4.9082, "mean_token_accuracy": 0.2339516818523407, "num_tokens": 109355824.0, "step": 47740 }, { "entropy": 5.753519487380982, "epoch": 4.719750889679715, "grad_norm": 1.2890625, "learning_rate": 0.0002984674285118203, "loss": 4.8412, "mean_token_accuracy": 0.23846886157989503, "num_tokens": 109366753.0, "step": 47745 }, { "entropy": 5.760152673721313, "epoch": 4.720245156188216, "grad_norm": 1.265625, "learning_rate": 0.00029843233071551086, "loss": 4.9244, "mean_token_accuracy": 0.22944518625736238, "num_tokens": 109378279.0, "step": 47750 }, { "entropy": 5.7465921401977536, "epoch": 4.7207394226967185, "grad_norm": 1.0859375, "learning_rate": 0.0002983972323427624, "loss": 4.957, "mean_token_accuracy": 0.22748399078845977, "num_tokens": 109390485.0, "step": 47755 }, { "entropy": 5.837819576263428, "epoch": 4.72123368920522, "grad_norm": 1.296875, "learning_rate": 0.0002983621333944384, "loss": 4.9837, "mean_token_accuracy": 0.2216181293129921, "num_tokens": 109402245.0, "step": 47760 }, { "entropy": 5.8557665824890135, "epoch": 4.721727955713721, "grad_norm": 1.265625, "learning_rate": 0.0002983270338714023, "loss": 5.0042, "mean_token_accuracy": 0.22224336117506027, "num_tokens": 109413531.0, "step": 47765 }, { "entropy": 5.797545003890991, "epoch": 4.722222222222222, "grad_norm": 1.2109375, "learning_rate": 0.0002982919337745175, "loss": 4.9778, "mean_token_accuracy": 0.23266494572162627, "num_tokens": 109424959.0, "step": 47770 }, { "entropy": 5.833150959014892, "epoch": 4.722716488730724, "grad_norm": 1.3125, "learning_rate": 0.0002982568331046476, "loss": 4.9601, "mean_token_accuracy": 0.2265777826309204, "num_tokens": 109436981.0, "step": 47775 }, { "entropy": 5.7705484390258786, "epoch": 4.723210755239225, "grad_norm": 1.328125, "learning_rate": 0.00029822173186265597, "loss": 4.8825, "mean_token_accuracy": 0.23940133303403854, "num_tokens": 109448948.0, "step": 47780 }, { "entropy": 5.7298290729522705, "epoch": 4.723705021747726, "grad_norm": 1.3359375, "learning_rate": 0.00029818663004940613, "loss": 4.8985, "mean_token_accuracy": 0.23255247473716736, "num_tokens": 109459729.0, "step": 47785 }, { "entropy": 5.780205297470093, "epoch": 4.724199288256228, "grad_norm": 1.2578125, "learning_rate": 0.0002981515276657616, "loss": 4.8932, "mean_token_accuracy": 0.23434288650751114, "num_tokens": 109471283.0, "step": 47790 }, { "entropy": 5.726873111724854, "epoch": 4.7246935547647295, "grad_norm": 1.5, "learning_rate": 0.0002981164247125859, "loss": 4.7543, "mean_token_accuracy": 0.24842661768198013, "num_tokens": 109482626.0, "step": 47795 }, { "entropy": 5.814235591888428, "epoch": 4.725187821273231, "grad_norm": 1.1796875, "learning_rate": 0.0002980813211907426, "loss": 4.931, "mean_token_accuracy": 0.230115170776844, "num_tokens": 109495072.0, "step": 47800 }, { "entropy": 5.769908094406128, "epoch": 4.725682087781732, "grad_norm": 1.3359375, "learning_rate": 0.00029804621710109513, "loss": 4.9744, "mean_token_accuracy": 0.233517324924469, "num_tokens": 109506104.0, "step": 47805 }, { "entropy": 5.739403009414673, "epoch": 4.726176354290233, "grad_norm": 1.4296875, "learning_rate": 0.0002980111124445072, "loss": 4.8629, "mean_token_accuracy": 0.24353299736976625, "num_tokens": 109517001.0, "step": 47810 }, { "entropy": 5.764806127548217, "epoch": 4.726670620798735, "grad_norm": 1.34375, "learning_rate": 0.00029797600722184225, "loss": 4.8738, "mean_token_accuracy": 0.24242452532052994, "num_tokens": 109528432.0, "step": 47815 }, { "entropy": 5.779729795455933, "epoch": 4.727164887307236, "grad_norm": 1.25, "learning_rate": 0.00029794090143396405, "loss": 4.9572, "mean_token_accuracy": 0.23355347365140916, "num_tokens": 109539584.0, "step": 47820 }, { "entropy": 5.720501470565796, "epoch": 4.727659153815737, "grad_norm": 1.21875, "learning_rate": 0.0002979057950817361, "loss": 4.7928, "mean_token_accuracy": 0.2456271231174469, "num_tokens": 109550795.0, "step": 47825 }, { "entropy": 5.737788343429566, "epoch": 4.728153420324238, "grad_norm": 1.2265625, "learning_rate": 0.0002978706881660221, "loss": 4.9155, "mean_token_accuracy": 0.23036651015281678, "num_tokens": 109561741.0, "step": 47830 }, { "entropy": 5.758519458770752, "epoch": 4.7286476868327405, "grad_norm": 1.2265625, "learning_rate": 0.0002978355806876856, "loss": 4.9322, "mean_token_accuracy": 0.22955139130353927, "num_tokens": 109574246.0, "step": 47835 }, { "entropy": 5.852679634094239, "epoch": 4.729141953341242, "grad_norm": 1.375, "learning_rate": 0.00029780047264759015, "loss": 4.9474, "mean_token_accuracy": 0.2323753535747528, "num_tokens": 109584133.0, "step": 47840 }, { "entropy": 5.7726890563964846, "epoch": 4.729636219849743, "grad_norm": 1.34375, "learning_rate": 0.0002977653640465996, "loss": 4.8921, "mean_token_accuracy": 0.23043569922447205, "num_tokens": 109596128.0, "step": 47845 }, { "entropy": 5.714256286621094, "epoch": 4.730130486358244, "grad_norm": 1.3203125, "learning_rate": 0.0002977302548855776, "loss": 4.8963, "mean_token_accuracy": 0.23256790935993193, "num_tokens": 109608309.0, "step": 47850 }, { "entropy": 5.761639738082886, "epoch": 4.7306247528667456, "grad_norm": 1.46875, "learning_rate": 0.00029769514516538774, "loss": 4.929, "mean_token_accuracy": 0.23441541343927383, "num_tokens": 109620153.0, "step": 47855 }, { "entropy": 5.7831024646759035, "epoch": 4.731119019375247, "grad_norm": 1.421875, "learning_rate": 0.0002976600348868939, "loss": 4.8653, "mean_token_accuracy": 0.2412390500307083, "num_tokens": 109630775.0, "step": 47860 }, { "entropy": 5.8199068069458, "epoch": 4.731613285883748, "grad_norm": 1.3671875, "learning_rate": 0.0002976249240509595, "loss": 4.8938, "mean_token_accuracy": 0.23597402721643448, "num_tokens": 109641623.0, "step": 47865 }, { "entropy": 5.731820821762085, "epoch": 4.73210755239225, "grad_norm": 1.4375, "learning_rate": 0.0002975898126584486, "loss": 4.9027, "mean_token_accuracy": 0.2401573270559311, "num_tokens": 109652071.0, "step": 47870 }, { "entropy": 5.800443887710571, "epoch": 4.7326018189007515, "grad_norm": 1.3671875, "learning_rate": 0.0002975547007102248, "loss": 4.9075, "mean_token_accuracy": 0.22722297310829162, "num_tokens": 109662734.0, "step": 47875 }, { "entropy": 5.79953293800354, "epoch": 4.733096085409253, "grad_norm": 1.2578125, "learning_rate": 0.0002975195882071519, "loss": 5.0085, "mean_token_accuracy": 0.22036950886249543, "num_tokens": 109674419.0, "step": 47880 }, { "entropy": 5.800833082199096, "epoch": 4.733590351917754, "grad_norm": 1.296875, "learning_rate": 0.0002974844751500935, "loss": 4.8919, "mean_token_accuracy": 0.23005912750959395, "num_tokens": 109686442.0, "step": 47885 }, { "entropy": 5.843943071365357, "epoch": 4.734084618426255, "grad_norm": 1.296875, "learning_rate": 0.0002974493615399136, "loss": 4.9378, "mean_token_accuracy": 0.23649304807186128, "num_tokens": 109698191.0, "step": 47890 }, { "entropy": 5.781586599349976, "epoch": 4.7345788849347565, "grad_norm": 1.3203125, "learning_rate": 0.00029741424737747595, "loss": 4.9634, "mean_token_accuracy": 0.22625308632850646, "num_tokens": 109709822.0, "step": 47895 }, { "entropy": 5.837997913360596, "epoch": 4.735073151443258, "grad_norm": 1.3671875, "learning_rate": 0.0002973791326636443, "loss": 4.9948, "mean_token_accuracy": 0.22127400189638138, "num_tokens": 109720638.0, "step": 47900 }, { "entropy": 5.812130355834961, "epoch": 4.73556741795176, "grad_norm": 1.2109375, "learning_rate": 0.0002973440173992826, "loss": 4.9357, "mean_token_accuracy": 0.2291085436940193, "num_tokens": 109731678.0, "step": 47905 }, { "entropy": 5.845504188537598, "epoch": 4.736061684460261, "grad_norm": 1.3828125, "learning_rate": 0.00029730890158525446, "loss": 4.9668, "mean_token_accuracy": 0.22876352369785308, "num_tokens": 109742089.0, "step": 47910 }, { "entropy": 5.837890720367431, "epoch": 4.7365559509687625, "grad_norm": 1.3671875, "learning_rate": 0.00029727378522242395, "loss": 4.9429, "mean_token_accuracy": 0.2281051680445671, "num_tokens": 109754392.0, "step": 47915 }, { "entropy": 5.7649506568908695, "epoch": 4.737050217477264, "grad_norm": 1.2734375, "learning_rate": 0.00029723866831165484, "loss": 4.9906, "mean_token_accuracy": 0.22172244191169738, "num_tokens": 109766019.0, "step": 47920 }, { "entropy": 5.736168003082275, "epoch": 4.737544483985765, "grad_norm": 1.359375, "learning_rate": 0.0002972035508538112, "loss": 4.8867, "mean_token_accuracy": 0.2382505491375923, "num_tokens": 109776545.0, "step": 47925 }, { "entropy": 5.86067533493042, "epoch": 4.738038750494266, "grad_norm": 1.3203125, "learning_rate": 0.0002971684328497565, "loss": 5.0261, "mean_token_accuracy": 0.22011249810457229, "num_tokens": 109789356.0, "step": 47930 }, { "entropy": 5.741080379486084, "epoch": 4.7385330170027675, "grad_norm": 1.296875, "learning_rate": 0.00029713331430035505, "loss": 4.882, "mean_token_accuracy": 0.23431582152843475, "num_tokens": 109800823.0, "step": 47935 }, { "entropy": 5.775539255142212, "epoch": 4.73902728351127, "grad_norm": 1.3359375, "learning_rate": 0.0002970981952064707, "loss": 4.9352, "mean_token_accuracy": 0.2327557235956192, "num_tokens": 109812512.0, "step": 47940 }, { "entropy": 5.764524030685425, "epoch": 4.739521550019771, "grad_norm": 1.3515625, "learning_rate": 0.00029706307556896723, "loss": 4.8705, "mean_token_accuracy": 0.23699752539396285, "num_tokens": 109824026.0, "step": 47945 }, { "entropy": 5.812251424789428, "epoch": 4.740015816528272, "grad_norm": 1.359375, "learning_rate": 0.00029702795538870874, "loss": 4.9772, "mean_token_accuracy": 0.22571152597665786, "num_tokens": 109834792.0, "step": 47950 }, { "entropy": 5.778350305557251, "epoch": 4.7405100830367735, "grad_norm": 1.2265625, "learning_rate": 0.000296992834666559, "loss": 4.8854, "mean_token_accuracy": 0.23837599009275437, "num_tokens": 109846435.0, "step": 47955 }, { "entropy": 5.735034847259522, "epoch": 4.741004349545275, "grad_norm": 1.359375, "learning_rate": 0.00029695771340338225, "loss": 4.834, "mean_token_accuracy": 0.23706765621900558, "num_tokens": 109857399.0, "step": 47960 }, { "entropy": 5.794822549819946, "epoch": 4.741498616053776, "grad_norm": 1.296875, "learning_rate": 0.0002969225916000423, "loss": 4.9143, "mean_token_accuracy": 0.23088134080171585, "num_tokens": 109868872.0, "step": 47965 }, { "entropy": 5.756534051895142, "epoch": 4.741992882562277, "grad_norm": 1.2265625, "learning_rate": 0.0002968874692574032, "loss": 4.9757, "mean_token_accuracy": 0.22160680443048478, "num_tokens": 109880724.0, "step": 47970 }, { "entropy": 5.868090486526489, "epoch": 4.742487149070779, "grad_norm": 1.4296875, "learning_rate": 0.00029685234637632894, "loss": 4.9689, "mean_token_accuracy": 0.22669397443532943, "num_tokens": 109891513.0, "step": 47975 }, { "entropy": 5.763829898834229, "epoch": 4.742981415579281, "grad_norm": 1.2421875, "learning_rate": 0.0002968172229576836, "loss": 4.9078, "mean_token_accuracy": 0.23452693670988084, "num_tokens": 109904148.0, "step": 47980 }, { "entropy": 5.848297786712647, "epoch": 4.743475682087782, "grad_norm": 1.3125, "learning_rate": 0.0002967820990023311, "loss": 4.9206, "mean_token_accuracy": 0.23044856488704682, "num_tokens": 109915835.0, "step": 47985 }, { "entropy": 5.781224918365479, "epoch": 4.743969948596283, "grad_norm": 1.2890625, "learning_rate": 0.00029674697451113576, "loss": 4.9838, "mean_token_accuracy": 0.22415730655193328, "num_tokens": 109927538.0, "step": 47990 }, { "entropy": 5.831448411941528, "epoch": 4.744464215104784, "grad_norm": 1.390625, "learning_rate": 0.00029671184948496134, "loss": 4.9777, "mean_token_accuracy": 0.222627255320549, "num_tokens": 109938379.0, "step": 47995 }, { "entropy": 5.74734206199646, "epoch": 4.744958481613286, "grad_norm": 1.515625, "learning_rate": 0.0002966767239246721, "loss": 4.8522, "mean_token_accuracy": 0.23739527612924577, "num_tokens": 109949155.0, "step": 48000 }, { "epoch": 4.744958481613286, "eval_entropy": 5.495092670152109, "eval_loss": 4.997913360595703, "eval_mean_token_accuracy": 0.2346619784337128, "eval_num_tokens": 109949155.0, "eval_runtime": 20.3323, "eval_samples_per_second": 1599.078, "eval_steps_per_second": 199.928, "step": 48000 }, { "entropy": 5.815223264694214, "epoch": 4.745452748121787, "grad_norm": 1.390625, "learning_rate": 0.00029664159783113203, "loss": 4.9439, "mean_token_accuracy": 0.22734562158584595, "num_tokens": 109959968.0, "step": 48005 }, { "entropy": 5.860291862487793, "epoch": 4.745947014630289, "grad_norm": 1.3515625, "learning_rate": 0.0002966064712052054, "loss": 5.0425, "mean_token_accuracy": 0.2229422450065613, "num_tokens": 109972247.0, "step": 48010 }, { "entropy": 5.822835874557495, "epoch": 4.74644128113879, "grad_norm": 1.421875, "learning_rate": 0.00029657134404775614, "loss": 4.894, "mean_token_accuracy": 0.22919864505529403, "num_tokens": 109982905.0, "step": 48015 }, { "entropy": 5.839215660095215, "epoch": 4.746935547647292, "grad_norm": 1.3828125, "learning_rate": 0.0002965362163596485, "loss": 5.0102, "mean_token_accuracy": 0.22506968230009078, "num_tokens": 109994155.0, "step": 48020 }, { "entropy": 5.788618850708008, "epoch": 4.747429814155793, "grad_norm": 1.359375, "learning_rate": 0.00029650108814174657, "loss": 4.8963, "mean_token_accuracy": 0.23855823576450347, "num_tokens": 110005642.0, "step": 48025 }, { "entropy": 5.75698184967041, "epoch": 4.747924080664294, "grad_norm": 1.3125, "learning_rate": 0.0002964659593949146, "loss": 4.8804, "mean_token_accuracy": 0.23293833881616594, "num_tokens": 110016627.0, "step": 48030 }, { "entropy": 5.767724800109863, "epoch": 4.748418347172795, "grad_norm": 1.3046875, "learning_rate": 0.00029643083012001665, "loss": 4.8652, "mean_token_accuracy": 0.23284413516521454, "num_tokens": 110026758.0, "step": 48035 }, { "entropy": 5.847751474380493, "epoch": 4.748912613681297, "grad_norm": 1.2421875, "learning_rate": 0.00029639570031791696, "loss": 5.0288, "mean_token_accuracy": 0.22261364609003068, "num_tokens": 110038652.0, "step": 48040 }, { "entropy": 5.805406808853149, "epoch": 4.749406880189798, "grad_norm": 1.28125, "learning_rate": 0.00029636056998947973, "loss": 4.938, "mean_token_accuracy": 0.23308006525039673, "num_tokens": 110049483.0, "step": 48045 }, { "entropy": 5.7864031314849855, "epoch": 4.7499011466983, "grad_norm": 1.375, "learning_rate": 0.0002963254391355691, "loss": 4.95, "mean_token_accuracy": 0.2258678987622261, "num_tokens": 110059925.0, "step": 48050 }, { "entropy": 5.8283538818359375, "epoch": 4.750395413206801, "grad_norm": 1.3515625, "learning_rate": 0.00029629030775704944, "loss": 5.0001, "mean_token_accuracy": 0.21990932077169417, "num_tokens": 110071953.0, "step": 48055 }, { "entropy": 5.758293485641479, "epoch": 4.750889679715303, "grad_norm": 1.234375, "learning_rate": 0.0002962551758547849, "loss": 4.8956, "mean_token_accuracy": 0.23699200451374053, "num_tokens": 110083742.0, "step": 48060 }, { "entropy": 5.8650599956512455, "epoch": 4.751383946223804, "grad_norm": 1.3203125, "learning_rate": 0.0002962200434296397, "loss": 4.9866, "mean_token_accuracy": 0.22963346689939498, "num_tokens": 110094920.0, "step": 48065 }, { "entropy": 5.849640274047852, "epoch": 4.751878212732305, "grad_norm": 1.3125, "learning_rate": 0.0002961849104824782, "loss": 5.0062, "mean_token_accuracy": 0.22333280444145204, "num_tokens": 110107109.0, "step": 48070 }, { "entropy": 5.88192138671875, "epoch": 4.752372479240806, "grad_norm": 1.4375, "learning_rate": 0.0002961497770141645, "loss": 4.9998, "mean_token_accuracy": 0.22173140347003936, "num_tokens": 110117529.0, "step": 48075 }, { "entropy": 5.755938720703125, "epoch": 4.752866745749308, "grad_norm": 1.375, "learning_rate": 0.0002961146430255631, "loss": 4.8945, "mean_token_accuracy": 0.23653606027364732, "num_tokens": 110130356.0, "step": 48080 }, { "entropy": 5.74698314666748, "epoch": 4.753361012257809, "grad_norm": 1.265625, "learning_rate": 0.0002960795085175382, "loss": 4.8572, "mean_token_accuracy": 0.2323732390999794, "num_tokens": 110142176.0, "step": 48085 }, { "entropy": 5.842442178726197, "epoch": 4.753855278766311, "grad_norm": 1.359375, "learning_rate": 0.0002960443734909541, "loss": 5.021, "mean_token_accuracy": 0.22443126291036605, "num_tokens": 110153777.0, "step": 48090 }, { "entropy": 5.8104053974151615, "epoch": 4.754349545274812, "grad_norm": 1.21875, "learning_rate": 0.00029600923794667524, "loss": 4.9568, "mean_token_accuracy": 0.2292995572090149, "num_tokens": 110165346.0, "step": 48095 }, { "entropy": 5.832502841949463, "epoch": 4.754843811783314, "grad_norm": 1.3671875, "learning_rate": 0.0002959741018855658, "loss": 4.9026, "mean_token_accuracy": 0.23744392842054368, "num_tokens": 110175714.0, "step": 48100 }, { "entropy": 5.7123020648956295, "epoch": 4.755338078291815, "grad_norm": 1.40625, "learning_rate": 0.00029593896530849014, "loss": 4.9019, "mean_token_accuracy": 0.23093169182538986, "num_tokens": 110187451.0, "step": 48105 }, { "entropy": 5.762855768203735, "epoch": 4.755832344800316, "grad_norm": 1.296875, "learning_rate": 0.0002959038282163127, "loss": 4.9158, "mean_token_accuracy": 0.2250763162970543, "num_tokens": 110199199.0, "step": 48110 }, { "entropy": 5.8097158908844, "epoch": 4.756326611308817, "grad_norm": 1.4453125, "learning_rate": 0.0002958686906098979, "loss": 4.9576, "mean_token_accuracy": 0.22751531451940538, "num_tokens": 110209936.0, "step": 48115 }, { "entropy": 5.745332860946656, "epoch": 4.756820877817319, "grad_norm": 1.375, "learning_rate": 0.00029583355249011004, "loss": 4.905, "mean_token_accuracy": 0.23148689419031143, "num_tokens": 110220646.0, "step": 48120 }, { "entropy": 5.741123151779175, "epoch": 4.757315144325821, "grad_norm": 1.28125, "learning_rate": 0.00029579841385781353, "loss": 4.8301, "mean_token_accuracy": 0.24511925578117372, "num_tokens": 110232314.0, "step": 48125 }, { "entropy": 5.807451152801514, "epoch": 4.757809410834322, "grad_norm": 1.125, "learning_rate": 0.00029576327471387285, "loss": 4.9192, "mean_token_accuracy": 0.22710827738046646, "num_tokens": 110245566.0, "step": 48130 }, { "entropy": 5.7495331287384035, "epoch": 4.758303677342823, "grad_norm": 1.359375, "learning_rate": 0.0002957281350591524, "loss": 4.8615, "mean_token_accuracy": 0.24180029928684235, "num_tokens": 110256133.0, "step": 48135 }, { "entropy": 5.812336111068726, "epoch": 4.758797943851325, "grad_norm": 1.3984375, "learning_rate": 0.0002956929948945166, "loss": 4.9506, "mean_token_accuracy": 0.23354557752609253, "num_tokens": 110268080.0, "step": 48140 }, { "entropy": 5.766601610183716, "epoch": 4.759292210359826, "grad_norm": 1.2421875, "learning_rate": 0.00029565785422082993, "loss": 4.9396, "mean_token_accuracy": 0.22591589987277985, "num_tokens": 110278940.0, "step": 48145 }, { "entropy": 5.7701996803283695, "epoch": 4.759786476868327, "grad_norm": 1.296875, "learning_rate": 0.0002956227130389568, "loss": 4.9317, "mean_token_accuracy": 0.22912800759077073, "num_tokens": 110289610.0, "step": 48150 }, { "entropy": 5.780746793746948, "epoch": 4.760280743376828, "grad_norm": 1.46875, "learning_rate": 0.0002955875713497617, "loss": 4.904, "mean_token_accuracy": 0.23255961239337922, "num_tokens": 110300563.0, "step": 48155 }, { "entropy": 5.829084491729736, "epoch": 4.7607750098853305, "grad_norm": 1.1953125, "learning_rate": 0.00029555242915410925, "loss": 4.9784, "mean_token_accuracy": 0.23344335407018663, "num_tokens": 110312352.0, "step": 48160 }, { "entropy": 5.784983921051025, "epoch": 4.761269276393832, "grad_norm": 1.3046875, "learning_rate": 0.0002955172864528638, "loss": 4.9463, "mean_token_accuracy": 0.23354115337133408, "num_tokens": 110323964.0, "step": 48165 }, { "entropy": 5.766483402252197, "epoch": 4.761763542902333, "grad_norm": 1.2578125, "learning_rate": 0.00029548214324688995, "loss": 4.9613, "mean_token_accuracy": 0.2292727544903755, "num_tokens": 110337369.0, "step": 48170 }, { "entropy": 5.7960272312164305, "epoch": 4.762257809410834, "grad_norm": 1.359375, "learning_rate": 0.00029544699953705213, "loss": 4.9452, "mean_token_accuracy": 0.2351111114025116, "num_tokens": 110349554.0, "step": 48175 }, { "entropy": 5.778850507736206, "epoch": 4.762752075919336, "grad_norm": 1.421875, "learning_rate": 0.000295411855324215, "loss": 4.9069, "mean_token_accuracy": 0.22932820916175842, "num_tokens": 110360254.0, "step": 48180 }, { "entropy": 5.793631744384766, "epoch": 4.763246342427837, "grad_norm": 1.3125, "learning_rate": 0.0002953767106092431, "loss": 4.8869, "mean_token_accuracy": 0.22682023793458939, "num_tokens": 110371765.0, "step": 48185 }, { "entropy": 5.754798555374146, "epoch": 4.763740608936338, "grad_norm": 1.296875, "learning_rate": 0.0002953415653930009, "loss": 4.8855, "mean_token_accuracy": 0.23610733449459076, "num_tokens": 110383061.0, "step": 48190 }, { "entropy": 5.835553455352783, "epoch": 4.76423487544484, "grad_norm": 1.171875, "learning_rate": 0.00029530641967635303, "loss": 4.9996, "mean_token_accuracy": 0.22661035507917404, "num_tokens": 110395851.0, "step": 48195 }, { "entropy": 5.851271915435791, "epoch": 4.7647291419533415, "grad_norm": 1.2890625, "learning_rate": 0.0002952712734601641, "loss": 5.0046, "mean_token_accuracy": 0.22413257360458375, "num_tokens": 110408221.0, "step": 48200 }, { "entropy": 5.754383754730225, "epoch": 4.765223408461843, "grad_norm": 1.21875, "learning_rate": 0.00029523612674529876, "loss": 4.9157, "mean_token_accuracy": 0.23201589584350585, "num_tokens": 110420390.0, "step": 48205 }, { "entropy": 5.790556573867798, "epoch": 4.765717674970344, "grad_norm": 1.4140625, "learning_rate": 0.00029520097953262154, "loss": 4.9483, "mean_token_accuracy": 0.22475413531064986, "num_tokens": 110431365.0, "step": 48210 }, { "entropy": 5.7308553695678714, "epoch": 4.766211941478845, "grad_norm": 1.3203125, "learning_rate": 0.000295165831822997, "loss": 4.8642, "mean_token_accuracy": 0.23766261488199233, "num_tokens": 110442116.0, "step": 48215 }, { "entropy": 5.691875219345093, "epoch": 4.766706207987347, "grad_norm": 1.25, "learning_rate": 0.0002951306836172899, "loss": 4.7975, "mean_token_accuracy": 0.24256475567817687, "num_tokens": 110453015.0, "step": 48220 }, { "entropy": 5.75885591506958, "epoch": 4.767200474495848, "grad_norm": 1.2265625, "learning_rate": 0.00029509553491636494, "loss": 4.9363, "mean_token_accuracy": 0.23123945593833922, "num_tokens": 110464957.0, "step": 48225 }, { "entropy": 5.8461285591125485, "epoch": 4.76769474100435, "grad_norm": 1.3046875, "learning_rate": 0.0002950603857210867, "loss": 5.0141, "mean_token_accuracy": 0.22275579422712327, "num_tokens": 110477179.0, "step": 48230 }, { "entropy": 5.819657802581787, "epoch": 4.768189007512851, "grad_norm": 1.296875, "learning_rate": 0.00029502523603231975, "loss": 4.8995, "mean_token_accuracy": 0.2339450240135193, "num_tokens": 110488235.0, "step": 48235 }, { "entropy": 5.739092826843262, "epoch": 4.7686832740213525, "grad_norm": 1.3203125, "learning_rate": 0.000294990085850929, "loss": 4.8591, "mean_token_accuracy": 0.2429361879825592, "num_tokens": 110501083.0, "step": 48240 }, { "entropy": 5.8375, "epoch": 4.769177540529854, "grad_norm": 1.4375, "learning_rate": 0.0002949549351777789, "loss": 4.9498, "mean_token_accuracy": 0.22401072531938554, "num_tokens": 110511819.0, "step": 48245 }, { "entropy": 5.828218126296997, "epoch": 4.769671807038355, "grad_norm": 1.4296875, "learning_rate": 0.00029491978401373435, "loss": 4.9394, "mean_token_accuracy": 0.2392090827226639, "num_tokens": 110522243.0, "step": 48250 }, { "entropy": 5.786455678939819, "epoch": 4.770166073546856, "grad_norm": 1.3671875, "learning_rate": 0.0002948846323596601, "loss": 4.9621, "mean_token_accuracy": 0.22299021035432814, "num_tokens": 110533069.0, "step": 48255 }, { "entropy": 5.769337606430054, "epoch": 4.7706603400553576, "grad_norm": 1.3203125, "learning_rate": 0.00029484948021642085, "loss": 4.9494, "mean_token_accuracy": 0.2294630229473114, "num_tokens": 110543740.0, "step": 48260 }, { "entropy": 5.844870615005493, "epoch": 4.77115460656386, "grad_norm": 1.3828125, "learning_rate": 0.00029481432758488106, "loss": 4.9747, "mean_token_accuracy": 0.21788849383592607, "num_tokens": 110555335.0, "step": 48265 }, { "entropy": 5.807349348068238, "epoch": 4.771648873072361, "grad_norm": 1.4453125, "learning_rate": 0.000294779174465906, "loss": 4.9251, "mean_token_accuracy": 0.2316594660282135, "num_tokens": 110566645.0, "step": 48270 }, { "entropy": 5.795274877548218, "epoch": 4.772143139580862, "grad_norm": 1.4140625, "learning_rate": 0.0002947440208603601, "loss": 4.9156, "mean_token_accuracy": 0.23267343938350676, "num_tokens": 110578001.0, "step": 48275 }, { "entropy": 5.804475259780884, "epoch": 4.7726374060893635, "grad_norm": 1.28125, "learning_rate": 0.00029470886676910817, "loss": 4.9601, "mean_token_accuracy": 0.23293033838272095, "num_tokens": 110589432.0, "step": 48280 }, { "entropy": 5.767077875137329, "epoch": 4.773131672597865, "grad_norm": 1.296875, "learning_rate": 0.0002946737121930151, "loss": 4.865, "mean_token_accuracy": 0.23637205362319946, "num_tokens": 110601213.0, "step": 48285 }, { "entropy": 5.744436502456665, "epoch": 4.773625939106366, "grad_norm": 1.328125, "learning_rate": 0.00029463855713294563, "loss": 4.912, "mean_token_accuracy": 0.2326609954237938, "num_tokens": 110612898.0, "step": 48290 }, { "entropy": 5.724813032150268, "epoch": 4.774120205614867, "grad_norm": 1.2734375, "learning_rate": 0.00029460340158976464, "loss": 4.9013, "mean_token_accuracy": 0.23118477314710617, "num_tokens": 110624345.0, "step": 48295 }, { "entropy": 5.804712295532227, "epoch": 4.7746144721233685, "grad_norm": 1.3671875, "learning_rate": 0.0002945682455643369, "loss": 4.9098, "mean_token_accuracy": 0.23064847737550737, "num_tokens": 110635758.0, "step": 48300 }, { "entropy": 5.800288963317871, "epoch": 4.775108738631871, "grad_norm": 1.5, "learning_rate": 0.0002945330890575273, "loss": 4.947, "mean_token_accuracy": 0.23002690821886063, "num_tokens": 110647641.0, "step": 48305 }, { "entropy": 5.787571716308594, "epoch": 4.775603005140372, "grad_norm": 1.265625, "learning_rate": 0.0002944979320702007, "loss": 4.9468, "mean_token_accuracy": 0.23017821758985518, "num_tokens": 110659498.0, "step": 48310 }, { "entropy": 5.784953927993774, "epoch": 4.776097271648873, "grad_norm": 1.25, "learning_rate": 0.0002944627746032219, "loss": 4.9201, "mean_token_accuracy": 0.22933128476142883, "num_tokens": 110671303.0, "step": 48315 }, { "entropy": 5.836751556396484, "epoch": 4.7765915381573745, "grad_norm": 1.1875, "learning_rate": 0.00029442761665745583, "loss": 5.0158, "mean_token_accuracy": 0.22049447447061538, "num_tokens": 110684377.0, "step": 48320 }, { "entropy": 5.754684972763061, "epoch": 4.777085804665876, "grad_norm": 2.140625, "learning_rate": 0.00029439245823376743, "loss": 4.8962, "mean_token_accuracy": 0.2303997904062271, "num_tokens": 110697433.0, "step": 48325 }, { "entropy": 5.864385414123535, "epoch": 4.777580071174377, "grad_norm": 1.28125, "learning_rate": 0.0002943572993330215, "loss": 5.0253, "mean_token_accuracy": 0.22800776809453965, "num_tokens": 110709178.0, "step": 48330 }, { "entropy": 5.814106798171997, "epoch": 4.778074337682878, "grad_norm": 1.5078125, "learning_rate": 0.0002943221399560831, "loss": 4.9305, "mean_token_accuracy": 0.22009014785289766, "num_tokens": 110719512.0, "step": 48335 }, { "entropy": 5.780506896972656, "epoch": 4.7785686041913795, "grad_norm": 1.25, "learning_rate": 0.00029428698010381695, "loss": 4.8522, "mean_token_accuracy": 0.23838422149419786, "num_tokens": 110730726.0, "step": 48340 }, { "entropy": 5.7862035751342775, "epoch": 4.779062870699882, "grad_norm": 1.3203125, "learning_rate": 0.00029425181977708816, "loss": 5.0049, "mean_token_accuracy": 0.22065076380968093, "num_tokens": 110743767.0, "step": 48345 }, { "entropy": 5.716965866088867, "epoch": 4.779557137208383, "grad_norm": 1.4453125, "learning_rate": 0.00029421665897676154, "loss": 4.813, "mean_token_accuracy": 0.24135451763868332, "num_tokens": 110753744.0, "step": 48350 }, { "entropy": 5.821961402893066, "epoch": 4.780051403716884, "grad_norm": 1.28125, "learning_rate": 0.00029418149770370217, "loss": 5.0581, "mean_token_accuracy": 0.22011152803897857, "num_tokens": 110766036.0, "step": 48355 }, { "entropy": 5.771739435195923, "epoch": 4.7805456702253855, "grad_norm": 1.3125, "learning_rate": 0.00029414633595877497, "loss": 4.8801, "mean_token_accuracy": 0.23368316888809204, "num_tokens": 110778739.0, "step": 48360 }, { "entropy": 5.768290042877197, "epoch": 4.781039936733887, "grad_norm": 1.2890625, "learning_rate": 0.00029411117374284493, "loss": 4.8913, "mean_token_accuracy": 0.24399167597293853, "num_tokens": 110790675.0, "step": 48365 }, { "entropy": 5.719346570968628, "epoch": 4.781534203242388, "grad_norm": 1.21875, "learning_rate": 0.00029407601105677707, "loss": 4.9572, "mean_token_accuracy": 0.22749950736761093, "num_tokens": 110803807.0, "step": 48370 }, { "entropy": 5.697475862503052, "epoch": 4.782028469750889, "grad_norm": 1.34375, "learning_rate": 0.0002940408479014364, "loss": 4.7803, "mean_token_accuracy": 0.25386126935482023, "num_tokens": 110815543.0, "step": 48375 }, { "entropy": 5.841625738143921, "epoch": 4.782522736259391, "grad_norm": 1.421875, "learning_rate": 0.00029400568427768786, "loss": 4.9112, "mean_token_accuracy": 0.229024076461792, "num_tokens": 110826919.0, "step": 48380 }, { "entropy": 5.772989749908447, "epoch": 4.783017002767893, "grad_norm": 1.3515625, "learning_rate": 0.00029397052018639657, "loss": 4.9061, "mean_token_accuracy": 0.22511757910251617, "num_tokens": 110839314.0, "step": 48385 }, { "entropy": 5.819831418991089, "epoch": 4.783511269276394, "grad_norm": 1.359375, "learning_rate": 0.0002939353556284276, "loss": 4.9702, "mean_token_accuracy": 0.22306977063417435, "num_tokens": 110850762.0, "step": 48390 }, { "entropy": 5.709316778182983, "epoch": 4.784005535784895, "grad_norm": 1.3203125, "learning_rate": 0.0002939001906046458, "loss": 4.84, "mean_token_accuracy": 0.23457081168889998, "num_tokens": 110862177.0, "step": 48395 }, { "entropy": 5.845559692382812, "epoch": 4.784499802293396, "grad_norm": 1.484375, "learning_rate": 0.00029386502511591654, "loss": 5.006, "mean_token_accuracy": 0.22857406437397004, "num_tokens": 110873647.0, "step": 48400 }, { "entropy": 5.820308065414428, "epoch": 4.784994068801898, "grad_norm": 1.5390625, "learning_rate": 0.00029382985916310466, "loss": 4.9888, "mean_token_accuracy": 0.21962386816740037, "num_tokens": 110885996.0, "step": 48405 }, { "entropy": 5.703316593170166, "epoch": 4.785488335310399, "grad_norm": 1.4140625, "learning_rate": 0.00029379469274707525, "loss": 4.8289, "mean_token_accuracy": 0.23729819804430008, "num_tokens": 110897600.0, "step": 48410 }, { "entropy": 5.811141633987427, "epoch": 4.785982601818901, "grad_norm": 1.3125, "learning_rate": 0.00029375952586869363, "loss": 4.9427, "mean_token_accuracy": 0.2299438863992691, "num_tokens": 110909853.0, "step": 48415 }, { "entropy": 5.78523998260498, "epoch": 4.786476868327402, "grad_norm": 1.28125, "learning_rate": 0.0002937243585288247, "loss": 4.9566, "mean_token_accuracy": 0.22216263115406037, "num_tokens": 110921938.0, "step": 48420 }, { "entropy": 5.8564962387084964, "epoch": 4.786971134835904, "grad_norm": 1.4296875, "learning_rate": 0.0002936891907283336, "loss": 5.0192, "mean_token_accuracy": 0.22907274812459946, "num_tokens": 110932856.0, "step": 48425 }, { "entropy": 5.780996227264405, "epoch": 4.787465401344405, "grad_norm": 1.390625, "learning_rate": 0.0002936540224680855, "loss": 4.873, "mean_token_accuracy": 0.24152058213949204, "num_tokens": 110944601.0, "step": 48430 }, { "entropy": 5.758243799209595, "epoch": 4.787959667852906, "grad_norm": 1.3125, "learning_rate": 0.00029361885374894566, "loss": 4.8789, "mean_token_accuracy": 0.24083559066057206, "num_tokens": 110955916.0, "step": 48435 }, { "entropy": 5.790015983581543, "epoch": 4.788453934361407, "grad_norm": 1.21875, "learning_rate": 0.0002935836845717791, "loss": 4.9446, "mean_token_accuracy": 0.22843215316534043, "num_tokens": 110968068.0, "step": 48440 }, { "entropy": 5.725407218933105, "epoch": 4.788948200869909, "grad_norm": 1.2578125, "learning_rate": 0.000293548514937451, "loss": 4.8935, "mean_token_accuracy": 0.23900855034589769, "num_tokens": 110979251.0, "step": 48445 }, { "entropy": 5.799242067337036, "epoch": 4.789442467378411, "grad_norm": 1.34375, "learning_rate": 0.0002935133448468265, "loss": 4.9468, "mean_token_accuracy": 0.23031775206327437, "num_tokens": 110991029.0, "step": 48450 }, { "entropy": 5.848375511169434, "epoch": 4.789936733886912, "grad_norm": 1.6328125, "learning_rate": 0.0002934781743007709, "loss": 4.9987, "mean_token_accuracy": 0.2227770984172821, "num_tokens": 111001500.0, "step": 48455 }, { "entropy": 5.833744668960572, "epoch": 4.790431000395413, "grad_norm": 1.34375, "learning_rate": 0.00029344300330014933, "loss": 4.9052, "mean_token_accuracy": 0.23683041781187059, "num_tokens": 111012838.0, "step": 48460 }, { "entropy": 5.7820264339447025, "epoch": 4.790925266903915, "grad_norm": 1.2890625, "learning_rate": 0.000293407831845827, "loss": 4.9918, "mean_token_accuracy": 0.2264212980866432, "num_tokens": 111024937.0, "step": 48465 }, { "entropy": 5.820897626876831, "epoch": 4.791419533412416, "grad_norm": 1.328125, "learning_rate": 0.00029337265993866916, "loss": 5.0035, "mean_token_accuracy": 0.22224596440792083, "num_tokens": 111035700.0, "step": 48470 }, { "entropy": 5.751635026931763, "epoch": 4.791913799920917, "grad_norm": 1.2265625, "learning_rate": 0.0002933374875795411, "loss": 4.818, "mean_token_accuracy": 0.24409843534231185, "num_tokens": 111047605.0, "step": 48475 }, { "entropy": 5.818263816833496, "epoch": 4.792408066429418, "grad_norm": 1.34375, "learning_rate": 0.00029330231476930785, "loss": 4.94, "mean_token_accuracy": 0.23142216205596924, "num_tokens": 111059209.0, "step": 48480 }, { "entropy": 5.81302695274353, "epoch": 4.792902332937921, "grad_norm": 1.4453125, "learning_rate": 0.000293267141508835, "loss": 4.9639, "mean_token_accuracy": 0.2209448531270027, "num_tokens": 111069862.0, "step": 48485 }, { "entropy": 5.784808206558227, "epoch": 4.793396599446422, "grad_norm": 1.2265625, "learning_rate": 0.0002932319677989875, "loss": 4.9339, "mean_token_accuracy": 0.22385257333517075, "num_tokens": 111081646.0, "step": 48490 }, { "entropy": 5.77811017036438, "epoch": 4.793890865954923, "grad_norm": 1.390625, "learning_rate": 0.0002931967936406308, "loss": 4.8895, "mean_token_accuracy": 0.23336291313171387, "num_tokens": 111091763.0, "step": 48495 }, { "entropy": 5.749838495254517, "epoch": 4.794385132463424, "grad_norm": 1.3359375, "learning_rate": 0.00029316161903463026, "loss": 4.895, "mean_token_accuracy": 0.23352765589952468, "num_tokens": 111103777.0, "step": 48500 }, { "entropy": 5.7744375705719, "epoch": 4.794879398971926, "grad_norm": 1.3203125, "learning_rate": 0.00029312644398185096, "loss": 4.9442, "mean_token_accuracy": 0.23032571375370026, "num_tokens": 111115100.0, "step": 48505 }, { "entropy": 5.750958824157715, "epoch": 4.795373665480427, "grad_norm": 1.3515625, "learning_rate": 0.0002930912684831583, "loss": 4.8923, "mean_token_accuracy": 0.22976758033037187, "num_tokens": 111125563.0, "step": 48510 }, { "entropy": 5.761693334579467, "epoch": 4.795867931988928, "grad_norm": 1.3125, "learning_rate": 0.0002930560925394177, "loss": 4.9321, "mean_token_accuracy": 0.2354413613677025, "num_tokens": 111136306.0, "step": 48515 }, { "entropy": 5.820460224151612, "epoch": 4.79636219849743, "grad_norm": 1.28125, "learning_rate": 0.00029302091615149447, "loss": 4.9638, "mean_token_accuracy": 0.21639739871025085, "num_tokens": 111148533.0, "step": 48520 }, { "entropy": 5.734290838241577, "epoch": 4.7968564650059315, "grad_norm": 1.3359375, "learning_rate": 0.00029298573932025373, "loss": 4.9142, "mean_token_accuracy": 0.23580976873636245, "num_tokens": 111160285.0, "step": 48525 }, { "entropy": 5.729951190948486, "epoch": 4.797350731514433, "grad_norm": 1.328125, "learning_rate": 0.00029295056204656114, "loss": 4.8722, "mean_token_accuracy": 0.23296225517988206, "num_tokens": 111171803.0, "step": 48530 }, { "entropy": 5.816208171844482, "epoch": 4.797844998022934, "grad_norm": 1.2578125, "learning_rate": 0.0002929153843312819, "loss": 4.932, "mean_token_accuracy": 0.22507246136665343, "num_tokens": 111184819.0, "step": 48535 }, { "entropy": 5.751821899414063, "epoch": 4.798339264531435, "grad_norm": 1.3125, "learning_rate": 0.0002928802061752814, "loss": 4.8715, "mean_token_accuracy": 0.23102896958589553, "num_tokens": 111195592.0, "step": 48540 }, { "entropy": 5.757092618942261, "epoch": 4.798833531039937, "grad_norm": 1.265625, "learning_rate": 0.00029284502757942515, "loss": 4.9312, "mean_token_accuracy": 0.2373213067650795, "num_tokens": 111207300.0, "step": 48545 }, { "entropy": 5.762848138809204, "epoch": 4.799327797548438, "grad_norm": 1.421875, "learning_rate": 0.00029280984854457835, "loss": 4.9164, "mean_token_accuracy": 0.22977296113967896, "num_tokens": 111217542.0, "step": 48550 }, { "entropy": 5.740937566757202, "epoch": 4.799822064056939, "grad_norm": 1.2734375, "learning_rate": 0.00029277466907160653, "loss": 4.8462, "mean_token_accuracy": 0.23858896493911744, "num_tokens": 111229422.0, "step": 48555 }, { "entropy": 5.8081145763397215, "epoch": 4.800316330565441, "grad_norm": 1.1796875, "learning_rate": 0.0002927394891613752, "loss": 4.9984, "mean_token_accuracy": 0.22640254497528076, "num_tokens": 111241547.0, "step": 48560 }, { "entropy": 5.772748947143555, "epoch": 4.8008105970739425, "grad_norm": 1.4453125, "learning_rate": 0.0002927043088147496, "loss": 4.9083, "mean_token_accuracy": 0.2349537044763565, "num_tokens": 111252123.0, "step": 48565 }, { "entropy": 5.765936660766601, "epoch": 4.801304863582444, "grad_norm": 1.28125, "learning_rate": 0.0002926691280325953, "loss": 4.9163, "mean_token_accuracy": 0.2331869900226593, "num_tokens": 111263862.0, "step": 48570 }, { "entropy": 5.778378105163574, "epoch": 4.801799130090945, "grad_norm": 1.4453125, "learning_rate": 0.00029263394681577757, "loss": 4.9468, "mean_token_accuracy": 0.23231848627328872, "num_tokens": 111274525.0, "step": 48575 }, { "entropy": 5.84856104850769, "epoch": 4.802293396599446, "grad_norm": 1.3984375, "learning_rate": 0.00029259876516516217, "loss": 4.9655, "mean_token_accuracy": 0.2263644114136696, "num_tokens": 111284972.0, "step": 48580 }, { "entropy": 5.807890844345093, "epoch": 4.802787663107948, "grad_norm": 1.3359375, "learning_rate": 0.0002925635830816144, "loss": 4.9957, "mean_token_accuracy": 0.23001225888729096, "num_tokens": 111297214.0, "step": 48585 }, { "entropy": 5.767961692810059, "epoch": 4.803281929616449, "grad_norm": 1.4296875, "learning_rate": 0.0002925284005659997, "loss": 4.8524, "mean_token_accuracy": 0.23326777815818786, "num_tokens": 111307731.0, "step": 48590 }, { "entropy": 5.860457563400269, "epoch": 4.80377619612495, "grad_norm": 1.3046875, "learning_rate": 0.00029249321761918364, "loss": 4.9794, "mean_token_accuracy": 0.2264727845788002, "num_tokens": 111319474.0, "step": 48595 }, { "entropy": 5.797132778167724, "epoch": 4.804270462633452, "grad_norm": 1.359375, "learning_rate": 0.00029245803424203173, "loss": 4.8552, "mean_token_accuracy": 0.240923647582531, "num_tokens": 111329821.0, "step": 48600 }, { "entropy": 5.781694984436035, "epoch": 4.8047647291419535, "grad_norm": 1.3125, "learning_rate": 0.0002924228504354095, "loss": 4.9481, "mean_token_accuracy": 0.22714199274778366, "num_tokens": 111340761.0, "step": 48605 }, { "entropy": 5.7036017894744875, "epoch": 4.805258995650455, "grad_norm": 1.34375, "learning_rate": 0.00029238766620018244, "loss": 4.8156, "mean_token_accuracy": 0.2418240413069725, "num_tokens": 111352208.0, "step": 48610 }, { "entropy": 5.849536037445068, "epoch": 4.805753262158956, "grad_norm": 1.421875, "learning_rate": 0.000292352481537216, "loss": 5.0061, "mean_token_accuracy": 0.22162528336048126, "num_tokens": 111363489.0, "step": 48615 }, { "entropy": 5.824751949310302, "epoch": 4.806247528667457, "grad_norm": 1.3515625, "learning_rate": 0.00029231729644737587, "loss": 4.9938, "mean_token_accuracy": 0.22761696726083755, "num_tokens": 111375791.0, "step": 48620 }, { "entropy": 5.818091154098511, "epoch": 4.806741795175959, "grad_norm": 1.3359375, "learning_rate": 0.0002922821109315275, "loss": 4.9133, "mean_token_accuracy": 0.23071672916412353, "num_tokens": 111387349.0, "step": 48625 }, { "entropy": 5.750053024291992, "epoch": 4.80723606168446, "grad_norm": 1.2890625, "learning_rate": 0.00029224692499053666, "loss": 4.9078, "mean_token_accuracy": 0.23563915938138963, "num_tokens": 111398342.0, "step": 48630 }, { "entropy": 5.777785301208496, "epoch": 4.807730328192962, "grad_norm": 1.3984375, "learning_rate": 0.0002922117386252687, "loss": 4.9048, "mean_token_accuracy": 0.23507018387317657, "num_tokens": 111410208.0, "step": 48635 }, { "entropy": 5.806124925613403, "epoch": 4.808224594701463, "grad_norm": 1.3125, "learning_rate": 0.00029217655183658945, "loss": 4.8935, "mean_token_accuracy": 0.23420380502939225, "num_tokens": 111421273.0, "step": 48640 }, { "entropy": 5.798521232604981, "epoch": 4.8087188612099645, "grad_norm": 1.234375, "learning_rate": 0.0002921413646253642, "loss": 4.9389, "mean_token_accuracy": 0.23665851056575776, "num_tokens": 111432496.0, "step": 48645 }, { "entropy": 5.857860708236695, "epoch": 4.809213127718466, "grad_norm": 1.296875, "learning_rate": 0.0002921061769924587, "loss": 5.0156, "mean_token_accuracy": 0.22493495047092438, "num_tokens": 111443830.0, "step": 48650 }, { "entropy": 5.787855625152588, "epoch": 4.809707394226967, "grad_norm": 1.2890625, "learning_rate": 0.00029207098893873864, "loss": 4.9359, "mean_token_accuracy": 0.2311509519815445, "num_tokens": 111455056.0, "step": 48655 }, { "entropy": 5.819750452041626, "epoch": 4.810201660735468, "grad_norm": 1.3046875, "learning_rate": 0.00029203580046506967, "loss": 4.9837, "mean_token_accuracy": 0.22390341013669968, "num_tokens": 111466829.0, "step": 48660 }, { "entropy": 5.7724113941192625, "epoch": 4.8106959272439695, "grad_norm": 1.3359375, "learning_rate": 0.00029200061157231725, "loss": 4.8824, "mean_token_accuracy": 0.23262255340814592, "num_tokens": 111477967.0, "step": 48665 }, { "entropy": 5.804455041885376, "epoch": 4.811190193752472, "grad_norm": 1.453125, "learning_rate": 0.00029196542226134724, "loss": 4.9368, "mean_token_accuracy": 0.23116700649261473, "num_tokens": 111488376.0, "step": 48670 }, { "entropy": 5.78844985961914, "epoch": 4.811684460260973, "grad_norm": 1.28125, "learning_rate": 0.00029193023253302515, "loss": 4.9489, "mean_token_accuracy": 0.23101856261491777, "num_tokens": 111500460.0, "step": 48675 }, { "entropy": 5.830862617492675, "epoch": 4.812178726769474, "grad_norm": 1.4296875, "learning_rate": 0.00029189504238821677, "loss": 4.9645, "mean_token_accuracy": 0.2189592733979225, "num_tokens": 111511229.0, "step": 48680 }, { "entropy": 5.811045932769775, "epoch": 4.8126729932779755, "grad_norm": 1.2734375, "learning_rate": 0.00029185985182778767, "loss": 4.895, "mean_token_accuracy": 0.2434671476483345, "num_tokens": 111521829.0, "step": 48685 }, { "entropy": 5.812684726715088, "epoch": 4.813167259786477, "grad_norm": 1.3359375, "learning_rate": 0.00029182466085260364, "loss": 4.9121, "mean_token_accuracy": 0.2291320487856865, "num_tokens": 111533674.0, "step": 48690 }, { "entropy": 5.836369752883911, "epoch": 4.813661526294978, "grad_norm": 1.328125, "learning_rate": 0.00029178946946353037, "loss": 4.9889, "mean_token_accuracy": 0.230241996049881, "num_tokens": 111545588.0, "step": 48695 }, { "entropy": 5.8090471744537355, "epoch": 4.814155792803479, "grad_norm": 1.3203125, "learning_rate": 0.0002917542776614335, "loss": 4.8779, "mean_token_accuracy": 0.24001488089561462, "num_tokens": 111557316.0, "step": 48700 }, { "entropy": 5.759321784973144, "epoch": 4.814650059311981, "grad_norm": 1.328125, "learning_rate": 0.0002917190854471788, "loss": 4.9495, "mean_token_accuracy": 0.23272371888160706, "num_tokens": 111569402.0, "step": 48705 }, { "entropy": 5.749652338027954, "epoch": 4.815144325820483, "grad_norm": 1.3125, "learning_rate": 0.00029168389282163205, "loss": 4.9348, "mean_token_accuracy": 0.23140799403190612, "num_tokens": 111581155.0, "step": 48710 }, { "entropy": 5.729934358596802, "epoch": 4.815638592328984, "grad_norm": 1.3046875, "learning_rate": 0.0002916486997856588, "loss": 4.8529, "mean_token_accuracy": 0.2374156266450882, "num_tokens": 111592566.0, "step": 48715 }, { "entropy": 5.810738039016724, "epoch": 4.816132858837485, "grad_norm": 1.3203125, "learning_rate": 0.00029161350634012513, "loss": 4.955, "mean_token_accuracy": 0.23040008693933486, "num_tokens": 111604039.0, "step": 48720 }, { "entropy": 5.871062326431274, "epoch": 4.8166271253459865, "grad_norm": 1.328125, "learning_rate": 0.00029157831248589655, "loss": 5.0336, "mean_token_accuracy": 0.21991561055183412, "num_tokens": 111614943.0, "step": 48725 }, { "entropy": 5.741412019729614, "epoch": 4.817121391854488, "grad_norm": 1.390625, "learning_rate": 0.0002915431182238389, "loss": 4.875, "mean_token_accuracy": 0.23893264383077623, "num_tokens": 111626011.0, "step": 48730 }, { "entropy": 5.764105319976807, "epoch": 4.817615658362989, "grad_norm": 1.3515625, "learning_rate": 0.00029150792355481806, "loss": 4.8899, "mean_token_accuracy": 0.23161435425281524, "num_tokens": 111636980.0, "step": 48735 }, { "entropy": 5.790144252777099, "epoch": 4.818109924871491, "grad_norm": 1.8125, "learning_rate": 0.0002914727284796996, "loss": 4.9802, "mean_token_accuracy": 0.22901953905820846, "num_tokens": 111649603.0, "step": 48740 }, { "entropy": 5.806594276428223, "epoch": 4.818604191379992, "grad_norm": 1.2265625, "learning_rate": 0.00029143753299934954, "loss": 4.9974, "mean_token_accuracy": 0.2225810781121254, "num_tokens": 111661554.0, "step": 48745 }, { "entropy": 5.848444700241089, "epoch": 4.819098457888494, "grad_norm": 1.3671875, "learning_rate": 0.00029140233711463364, "loss": 4.9605, "mean_token_accuracy": 0.22503461241722106, "num_tokens": 111673938.0, "step": 48750 }, { "entropy": 5.807308530807495, "epoch": 4.819592724396995, "grad_norm": 1.3515625, "learning_rate": 0.0002913671408264177, "loss": 4.9169, "mean_token_accuracy": 0.22926753014326096, "num_tokens": 111685526.0, "step": 48755 }, { "entropy": 5.809872817993164, "epoch": 4.820086990905496, "grad_norm": 1.3359375, "learning_rate": 0.0002913319441355675, "loss": 5.0441, "mean_token_accuracy": 0.22487984150648116, "num_tokens": 111698195.0, "step": 48760 }, { "entropy": 5.817394065856933, "epoch": 4.8205812574139975, "grad_norm": 1.2890625, "learning_rate": 0.00029129674704294896, "loss": 4.9714, "mean_token_accuracy": 0.2356329083442688, "num_tokens": 111708793.0, "step": 48765 }, { "entropy": 5.797488451004028, "epoch": 4.821075523922499, "grad_norm": 1.2734375, "learning_rate": 0.000291261549549428, "loss": 4.9079, "mean_token_accuracy": 0.23432808220386506, "num_tokens": 111720388.0, "step": 48770 }, { "entropy": 5.7515308380126955, "epoch": 4.821569790431001, "grad_norm": 1.375, "learning_rate": 0.00029122635165587023, "loss": 4.9001, "mean_token_accuracy": 0.2344530001282692, "num_tokens": 111733178.0, "step": 48775 }, { "entropy": 5.762867164611817, "epoch": 4.822064056939502, "grad_norm": 1.2890625, "learning_rate": 0.00029119115336314185, "loss": 4.8647, "mean_token_accuracy": 0.23720869421958923, "num_tokens": 111744131.0, "step": 48780 }, { "entropy": 5.804542350769043, "epoch": 4.822558323448003, "grad_norm": 1.3203125, "learning_rate": 0.0002911559546721085, "loss": 4.9472, "mean_token_accuracy": 0.2304277941584587, "num_tokens": 111755926.0, "step": 48785 }, { "entropy": 5.772536659240723, "epoch": 4.823052589956505, "grad_norm": 1.3671875, "learning_rate": 0.00029112075558363615, "loss": 4.8663, "mean_token_accuracy": 0.23646577596664428, "num_tokens": 111766252.0, "step": 48790 }, { "entropy": 5.762499189376831, "epoch": 4.823546856465006, "grad_norm": 1.2890625, "learning_rate": 0.0002910855560985908, "loss": 4.8314, "mean_token_accuracy": 0.2392893150448799, "num_tokens": 111776703.0, "step": 48795 }, { "entropy": 5.712212085723877, "epoch": 4.824041122973507, "grad_norm": 1.2578125, "learning_rate": 0.0002910503562178382, "loss": 4.837, "mean_token_accuracy": 0.24385461658239366, "num_tokens": 111788026.0, "step": 48800 }, { "entropy": 5.7266027450561525, "epoch": 4.824535389482008, "grad_norm": 1.4453125, "learning_rate": 0.00029101515594224435, "loss": 4.8196, "mean_token_accuracy": 0.24569595158100127, "num_tokens": 111798673.0, "step": 48805 }, { "entropy": 5.7184511661529545, "epoch": 4.82502965599051, "grad_norm": 1.328125, "learning_rate": 0.0002909799552726752, "loss": 4.9206, "mean_token_accuracy": 0.23068345040082933, "num_tokens": 111810502.0, "step": 48810 }, { "entropy": 5.829906940460205, "epoch": 4.825523922499012, "grad_norm": 1.1953125, "learning_rate": 0.00029094475420999666, "loss": 4.9866, "mean_token_accuracy": 0.2190413221716881, "num_tokens": 111822597.0, "step": 48815 }, { "entropy": 5.817552995681763, "epoch": 4.826018189007513, "grad_norm": 1.4140625, "learning_rate": 0.00029090955275507473, "loss": 4.9587, "mean_token_accuracy": 0.2273958370089531, "num_tokens": 111833372.0, "step": 48820 }, { "entropy": 5.821482801437378, "epoch": 4.826512455516014, "grad_norm": 1.2578125, "learning_rate": 0.00029087435090877534, "loss": 4.9747, "mean_token_accuracy": 0.2231215789914131, "num_tokens": 111845323.0, "step": 48825 }, { "entropy": 5.792683887481689, "epoch": 4.827006722024516, "grad_norm": 1.4765625, "learning_rate": 0.0002908391486719644, "loss": 4.8908, "mean_token_accuracy": 0.2401478484272957, "num_tokens": 111855953.0, "step": 48830 }, { "entropy": 5.793558120727539, "epoch": 4.827500988533017, "grad_norm": 1.421875, "learning_rate": 0.00029080394604550795, "loss": 4.9729, "mean_token_accuracy": 0.22883465886116028, "num_tokens": 111866433.0, "step": 48835 }, { "entropy": 5.811889266967773, "epoch": 4.827995255041518, "grad_norm": 1.28125, "learning_rate": 0.000290768743030272, "loss": 5.0015, "mean_token_accuracy": 0.2313559353351593, "num_tokens": 111877774.0, "step": 48840 }, { "entropy": 5.810166263580323, "epoch": 4.828489521550019, "grad_norm": 1.3359375, "learning_rate": 0.0002907335396271225, "loss": 4.9672, "mean_token_accuracy": 0.22693869322538376, "num_tokens": 111888966.0, "step": 48845 }, { "entropy": 5.81334958076477, "epoch": 4.828983788058521, "grad_norm": 1.53125, "learning_rate": 0.00029069833583692553, "loss": 4.9628, "mean_token_accuracy": 0.22860878854990005, "num_tokens": 111899571.0, "step": 48850 }, { "entropy": 5.758677053451538, "epoch": 4.829478054567023, "grad_norm": 1.3515625, "learning_rate": 0.000290663131660547, "loss": 4.9622, "mean_token_accuracy": 0.2224608764052391, "num_tokens": 111911280.0, "step": 48855 }, { "entropy": 5.880365800857544, "epoch": 4.829972321075524, "grad_norm": 1.3203125, "learning_rate": 0.000290627927098853, "loss": 5.0463, "mean_token_accuracy": 0.21710314154624938, "num_tokens": 111922692.0, "step": 48860 }, { "entropy": 5.772500896453858, "epoch": 4.830466587584025, "grad_norm": 1.3671875, "learning_rate": 0.00029059272215270965, "loss": 4.906, "mean_token_accuracy": 0.23387258648872375, "num_tokens": 111934910.0, "step": 48865 }, { "entropy": 5.787146329879761, "epoch": 4.830960854092527, "grad_norm": 1.3046875, "learning_rate": 0.00029055751682298295, "loss": 4.8561, "mean_token_accuracy": 0.23517969846725464, "num_tokens": 111945539.0, "step": 48870 }, { "entropy": 5.74071159362793, "epoch": 4.831455120601028, "grad_norm": 1.4296875, "learning_rate": 0.0002905223111105388, "loss": 4.8961, "mean_token_accuracy": 0.23512951135635377, "num_tokens": 111956456.0, "step": 48875 }, { "entropy": 5.714801073074341, "epoch": 4.831949387109529, "grad_norm": 1.359375, "learning_rate": 0.0002904871050162434, "loss": 4.849, "mean_token_accuracy": 0.23729708641767502, "num_tokens": 111967054.0, "step": 48880 }, { "entropy": 5.719619083404541, "epoch": 4.83244365361803, "grad_norm": 1.3828125, "learning_rate": 0.0002904518985409629, "loss": 4.8962, "mean_token_accuracy": 0.2348434656858444, "num_tokens": 111978774.0, "step": 48885 }, { "entropy": 5.798677158355713, "epoch": 4.832937920126533, "grad_norm": 1.2890625, "learning_rate": 0.00029041669168556315, "loss": 4.8781, "mean_token_accuracy": 0.2366304099559784, "num_tokens": 111989459.0, "step": 48890 }, { "entropy": 5.850676774978638, "epoch": 4.833432186635034, "grad_norm": 1.1796875, "learning_rate": 0.0002903814844509106, "loss": 4.9716, "mean_token_accuracy": 0.22540567368268966, "num_tokens": 112002016.0, "step": 48895 }, { "entropy": 5.840531730651856, "epoch": 4.833926453143535, "grad_norm": 1.3203125, "learning_rate": 0.000290346276837871, "loss": 4.9496, "mean_token_accuracy": 0.2277243033051491, "num_tokens": 112014697.0, "step": 48900 }, { "entropy": 5.821752691268921, "epoch": 4.834420719652036, "grad_norm": 1.3203125, "learning_rate": 0.0002903110688473106, "loss": 4.9555, "mean_token_accuracy": 0.23304442018270494, "num_tokens": 112026425.0, "step": 48905 }, { "entropy": 5.773401546478271, "epoch": 4.834914986160538, "grad_norm": 1.265625, "learning_rate": 0.00029027586048009554, "loss": 4.8961, "mean_token_accuracy": 0.2319907397031784, "num_tokens": 112036980.0, "step": 48910 }, { "entropy": 5.7356030464172365, "epoch": 4.835409252669039, "grad_norm": 1.3046875, "learning_rate": 0.000290240651737092, "loss": 4.9678, "mean_token_accuracy": 0.22903912216424943, "num_tokens": 112048746.0, "step": 48915 }, { "entropy": 5.836233901977539, "epoch": 4.83590351917754, "grad_norm": 1.265625, "learning_rate": 0.000290205442619166, "loss": 4.9349, "mean_token_accuracy": 0.2324625074863434, "num_tokens": 112059635.0, "step": 48920 }, { "entropy": 5.895700216293335, "epoch": 4.836397785686042, "grad_norm": 1.3125, "learning_rate": 0.00029017023312718387, "loss": 5.0301, "mean_token_accuracy": 0.22018679976463318, "num_tokens": 112070994.0, "step": 48925 }, { "entropy": 5.769571733474732, "epoch": 4.8368920521945435, "grad_norm": 1.265625, "learning_rate": 0.0002901350232620116, "loss": 4.9048, "mean_token_accuracy": 0.2372240036725998, "num_tokens": 112080897.0, "step": 48930 }, { "entropy": 5.842018890380859, "epoch": 4.837386318703045, "grad_norm": 1.4765625, "learning_rate": 0.0002900998130245153, "loss": 4.9622, "mean_token_accuracy": 0.23688526600599288, "num_tokens": 112091658.0, "step": 48935 }, { "entropy": 5.847526884078979, "epoch": 4.837880585211546, "grad_norm": 1.28125, "learning_rate": 0.00029006460241556137, "loss": 4.9904, "mean_token_accuracy": 0.22483591586351395, "num_tokens": 112103490.0, "step": 48940 }, { "entropy": 5.817656230926514, "epoch": 4.838374851720047, "grad_norm": 1.390625, "learning_rate": 0.00029002939143601584, "loss": 4.9286, "mean_token_accuracy": 0.23140643388032914, "num_tokens": 112115255.0, "step": 48945 }, { "entropy": 5.7761311531066895, "epoch": 4.838869118228549, "grad_norm": 1.3203125, "learning_rate": 0.000289994180086745, "loss": 4.9144, "mean_token_accuracy": 0.22883250415325165, "num_tokens": 112126188.0, "step": 48950 }, { "entropy": 5.793883037567139, "epoch": 4.83936338473705, "grad_norm": 1.453125, "learning_rate": 0.0002899589683686149, "loss": 4.9628, "mean_token_accuracy": 0.22414219230413437, "num_tokens": 112138006.0, "step": 48955 }, { "entropy": 5.801441192626953, "epoch": 4.839857651245552, "grad_norm": 1.1953125, "learning_rate": 0.00028992375628249196, "loss": 4.9681, "mean_token_accuracy": 0.22325728833675385, "num_tokens": 112149828.0, "step": 48960 }, { "entropy": 5.755842018127441, "epoch": 4.840351917754053, "grad_norm": 1.28125, "learning_rate": 0.0002898885438292423, "loss": 4.9574, "mean_token_accuracy": 0.2333178073167801, "num_tokens": 112161615.0, "step": 48965 }, { "entropy": 5.739009046554566, "epoch": 4.8408461842625545, "grad_norm": 1.3828125, "learning_rate": 0.00028985333100973207, "loss": 4.8255, "mean_token_accuracy": 0.24662744402885436, "num_tokens": 112172116.0, "step": 48970 }, { "entropy": 5.790988779067993, "epoch": 4.841340450771056, "grad_norm": 1.34375, "learning_rate": 0.00028981811782482765, "loss": 4.872, "mean_token_accuracy": 0.23302360028028488, "num_tokens": 112184469.0, "step": 48975 }, { "entropy": 5.793516302108765, "epoch": 4.841834717279557, "grad_norm": 1.34375, "learning_rate": 0.0002897829042753952, "loss": 4.9208, "mean_token_accuracy": 0.2327763095498085, "num_tokens": 112195473.0, "step": 48980 }, { "entropy": 5.851512813568116, "epoch": 4.842328983788058, "grad_norm": 1.3515625, "learning_rate": 0.00028974769036230105, "loss": 5.0018, "mean_token_accuracy": 0.22331580519676208, "num_tokens": 112207339.0, "step": 48985 }, { "entropy": 5.774642562866211, "epoch": 4.84282325029656, "grad_norm": 1.3671875, "learning_rate": 0.00028971247608641136, "loss": 4.8942, "mean_token_accuracy": 0.23702143430709838, "num_tokens": 112218444.0, "step": 48990 }, { "entropy": 5.868919038772583, "epoch": 4.843317516805062, "grad_norm": 1.375, "learning_rate": 0.00028967726144859255, "loss": 5.0071, "mean_token_accuracy": 0.22231556326150895, "num_tokens": 112230108.0, "step": 48995 }, { "entropy": 5.7322290420532225, "epoch": 4.843811783313563, "grad_norm": 1.265625, "learning_rate": 0.00028964204644971083, "loss": 4.8853, "mean_token_accuracy": 0.24014401584863662, "num_tokens": 112241731.0, "step": 49000 }, { "entropy": 5.753686714172363, "epoch": 4.844306049822064, "grad_norm": 1.3125, "learning_rate": 0.00028960683109063244, "loss": 4.8892, "mean_token_accuracy": 0.23182919025421142, "num_tokens": 112253501.0, "step": 49005 }, { "entropy": 5.750853586196899, "epoch": 4.8448003163305655, "grad_norm": 1.453125, "learning_rate": 0.00028957161537222374, "loss": 4.8545, "mean_token_accuracy": 0.24411375373601912, "num_tokens": 112264128.0, "step": 49010 }, { "entropy": 5.826304817199707, "epoch": 4.845294582839067, "grad_norm": 1.3828125, "learning_rate": 0.00028953639929535114, "loss": 5.0, "mean_token_accuracy": 0.21745189279317856, "num_tokens": 112275602.0, "step": 49015 }, { "entropy": 5.815337753295898, "epoch": 4.845788849347568, "grad_norm": 1.3203125, "learning_rate": 0.0002895011828608808, "loss": 4.967, "mean_token_accuracy": 0.2273756667971611, "num_tokens": 112287158.0, "step": 49020 }, { "entropy": 5.702516984939575, "epoch": 4.846283115856069, "grad_norm": 1.296875, "learning_rate": 0.0002894659660696791, "loss": 4.7557, "mean_token_accuracy": 0.2473243370652199, "num_tokens": 112298764.0, "step": 49025 }, { "entropy": 5.7469700336456295, "epoch": 4.8467773823645715, "grad_norm": 1.421875, "learning_rate": 0.0002894307489226124, "loss": 4.8252, "mean_token_accuracy": 0.24225077778100967, "num_tokens": 112309976.0, "step": 49030 }, { "entropy": 5.828213787078857, "epoch": 4.847271648873073, "grad_norm": 1.2265625, "learning_rate": 0.000289395531420547, "loss": 4.9363, "mean_token_accuracy": 0.22556197196245192, "num_tokens": 112321950.0, "step": 49035 }, { "entropy": 5.714060211181641, "epoch": 4.847765915381574, "grad_norm": 1.25, "learning_rate": 0.0002893603135643494, "loss": 4.8093, "mean_token_accuracy": 0.23687225431203843, "num_tokens": 112332823.0, "step": 49040 }, { "entropy": 5.734771680831909, "epoch": 4.848260181890075, "grad_norm": 1.2265625, "learning_rate": 0.0002893250953548857, "loss": 4.9261, "mean_token_accuracy": 0.2350659266114235, "num_tokens": 112345374.0, "step": 49045 }, { "entropy": 5.83812313079834, "epoch": 4.8487544483985765, "grad_norm": 1.2734375, "learning_rate": 0.00028928987679302255, "loss": 5.0093, "mean_token_accuracy": 0.22093958854675294, "num_tokens": 112357963.0, "step": 49050 }, { "entropy": 5.782468175888061, "epoch": 4.849248714907078, "grad_norm": 1.3515625, "learning_rate": 0.0002892546578796262, "loss": 4.9514, "mean_token_accuracy": 0.22908113300800323, "num_tokens": 112368410.0, "step": 49055 }, { "entropy": 5.8211737155914305, "epoch": 4.849742981415579, "grad_norm": 1.4765625, "learning_rate": 0.00028921943861556304, "loss": 4.9288, "mean_token_accuracy": 0.23487457633018494, "num_tokens": 112379202.0, "step": 49060 }, { "entropy": 5.695417404174805, "epoch": 4.85023724792408, "grad_norm": 1.328125, "learning_rate": 0.0002891842190016995, "loss": 4.8308, "mean_token_accuracy": 0.23586246073246003, "num_tokens": 112389908.0, "step": 49065 }, { "entropy": 5.752830171585083, "epoch": 4.850731514432582, "grad_norm": 1.3984375, "learning_rate": 0.00028914899903890193, "loss": 4.989, "mean_token_accuracy": 0.22820772230625153, "num_tokens": 112400917.0, "step": 49070 }, { "entropy": 5.718752145767212, "epoch": 4.851225780941084, "grad_norm": 1.390625, "learning_rate": 0.00028911377872803683, "loss": 4.859, "mean_token_accuracy": 0.23485609591007234, "num_tokens": 112413540.0, "step": 49075 }, { "entropy": 5.784301662445069, "epoch": 4.851720047449585, "grad_norm": 1.4765625, "learning_rate": 0.00028907855806997057, "loss": 4.8963, "mean_token_accuracy": 0.2355680987238884, "num_tokens": 112423779.0, "step": 49080 }, { "entropy": 5.826023101806641, "epoch": 4.852214313958086, "grad_norm": 1.2578125, "learning_rate": 0.0002890433370655696, "loss": 4.9603, "mean_token_accuracy": 0.2272229865193367, "num_tokens": 112435705.0, "step": 49085 }, { "entropy": 5.780259704589843, "epoch": 4.8527085804665875, "grad_norm": 1.296875, "learning_rate": 0.00028900811571570036, "loss": 4.8864, "mean_token_accuracy": 0.24538090080022812, "num_tokens": 112446138.0, "step": 49090 }, { "entropy": 5.751820850372314, "epoch": 4.853202846975089, "grad_norm": 1.203125, "learning_rate": 0.0002889728940212293, "loss": 4.9237, "mean_token_accuracy": 0.23289150297641753, "num_tokens": 112457616.0, "step": 49095 }, { "entropy": 5.7912389755249025, "epoch": 4.85369711348359, "grad_norm": 1.28125, "learning_rate": 0.00028893767198302284, "loss": 4.9601, "mean_token_accuracy": 0.23024620711803437, "num_tokens": 112470367.0, "step": 49100 }, { "entropy": 5.786993408203125, "epoch": 4.854191379992091, "grad_norm": 1.3671875, "learning_rate": 0.0002889024496019476, "loss": 4.9246, "mean_token_accuracy": 0.23474255651235582, "num_tokens": 112481075.0, "step": 49105 }, { "entropy": 5.781751441955566, "epoch": 4.854685646500593, "grad_norm": 1.203125, "learning_rate": 0.00028886722687886986, "loss": 4.9271, "mean_token_accuracy": 0.23021235466003417, "num_tokens": 112493846.0, "step": 49110 }, { "entropy": 5.727640628814697, "epoch": 4.855179913009095, "grad_norm": 1.1640625, "learning_rate": 0.0002888320038146562, "loss": 4.9143, "mean_token_accuracy": 0.2323154479265213, "num_tokens": 112506464.0, "step": 49115 }, { "entropy": 5.779295825958252, "epoch": 4.855674179517596, "grad_norm": 1.265625, "learning_rate": 0.00028879678041017297, "loss": 4.8463, "mean_token_accuracy": 0.23435731679201127, "num_tokens": 112517603.0, "step": 49120 }, { "entropy": 5.792895126342773, "epoch": 4.856168446026097, "grad_norm": 1.296875, "learning_rate": 0.000288761556666287, "loss": 4.8955, "mean_token_accuracy": 0.23019715994596482, "num_tokens": 112528736.0, "step": 49125 }, { "entropy": 5.830591297149658, "epoch": 4.8566627125345985, "grad_norm": 1.3671875, "learning_rate": 0.00028872633258386453, "loss": 4.9937, "mean_token_accuracy": 0.22849510759115219, "num_tokens": 112540864.0, "step": 49130 }, { "entropy": 5.803523826599121, "epoch": 4.8571569790431, "grad_norm": 1.4375, "learning_rate": 0.00028869110816377215, "loss": 4.8823, "mean_token_accuracy": 0.23310040682554245, "num_tokens": 112551563.0, "step": 49135 }, { "entropy": 5.799018430709839, "epoch": 4.857651245551601, "grad_norm": 1.2578125, "learning_rate": 0.00028865588340687637, "loss": 5.0196, "mean_token_accuracy": 0.22205927073955536, "num_tokens": 112563445.0, "step": 49140 }, { "entropy": 5.824177980422974, "epoch": 4.858145512060103, "grad_norm": 1.5234375, "learning_rate": 0.0002886206583140437, "loss": 4.9826, "mean_token_accuracy": 0.22782248705625535, "num_tokens": 112573601.0, "step": 49145 }, { "entropy": 5.804582309722901, "epoch": 4.858639778568604, "grad_norm": 1.359375, "learning_rate": 0.0002885854328861407, "loss": 4.9275, "mean_token_accuracy": 0.23240430057048797, "num_tokens": 112584251.0, "step": 49150 }, { "entropy": 5.720830869674683, "epoch": 4.859134045077106, "grad_norm": 1.2890625, "learning_rate": 0.0002885502071240341, "loss": 4.8328, "mean_token_accuracy": 0.24566471725702285, "num_tokens": 112595580.0, "step": 49155 }, { "entropy": 5.774464702606201, "epoch": 4.859628311585607, "grad_norm": 1.3046875, "learning_rate": 0.0002885149810285903, "loss": 4.8949, "mean_token_accuracy": 0.23415710031986237, "num_tokens": 112606806.0, "step": 49160 }, { "entropy": 5.776809644699097, "epoch": 4.860122578094108, "grad_norm": 1.2734375, "learning_rate": 0.0002884797546006757, "loss": 4.912, "mean_token_accuracy": 0.23020249754190444, "num_tokens": 112618508.0, "step": 49165 }, { "entropy": 5.767145109176636, "epoch": 4.8606168446026095, "grad_norm": 1.296875, "learning_rate": 0.0002884445278411572, "loss": 4.873, "mean_token_accuracy": 0.23561283200979233, "num_tokens": 112630830.0, "step": 49170 }, { "entropy": 5.783767461776733, "epoch": 4.861111111111111, "grad_norm": 1.265625, "learning_rate": 0.0002884093007509012, "loss": 4.9272, "mean_token_accuracy": 0.23199794292449952, "num_tokens": 112642432.0, "step": 49175 }, { "entropy": 5.816671514511109, "epoch": 4.861605377619613, "grad_norm": 1.3671875, "learning_rate": 0.0002883740733307742, "loss": 4.9322, "mean_token_accuracy": 0.23084331601858138, "num_tokens": 112653756.0, "step": 49180 }, { "entropy": 5.809394073486328, "epoch": 4.862099644128114, "grad_norm": 1.3359375, "learning_rate": 0.000288338845581643, "loss": 4.8939, "mean_token_accuracy": 0.23427701592445374, "num_tokens": 112664495.0, "step": 49185 }, { "entropy": 5.847043037414551, "epoch": 4.862593910636615, "grad_norm": 1.28125, "learning_rate": 0.0002883036175043742, "loss": 4.9377, "mean_token_accuracy": 0.22541873455047606, "num_tokens": 112676232.0, "step": 49190 }, { "entropy": 5.819697570800781, "epoch": 4.863088177145117, "grad_norm": 1.265625, "learning_rate": 0.0002882683890998342, "loss": 4.9255, "mean_token_accuracy": 0.21987585127353668, "num_tokens": 112687145.0, "step": 49195 }, { "entropy": 5.784909963607788, "epoch": 4.863582443653618, "grad_norm": 1.296875, "learning_rate": 0.0002882331603688899, "loss": 4.941, "mean_token_accuracy": 0.22892287820577623, "num_tokens": 112697231.0, "step": 49200 }, { "entropy": 5.726517963409424, "epoch": 4.864076710162119, "grad_norm": 1.2578125, "learning_rate": 0.0002881979313124078, "loss": 4.8345, "mean_token_accuracy": 0.23340236991643906, "num_tokens": 112708478.0, "step": 49205 }, { "entropy": 5.768404769897461, "epoch": 4.86457097667062, "grad_norm": 1.3203125, "learning_rate": 0.00028816270193125445, "loss": 4.8578, "mean_token_accuracy": 0.23843661993741988, "num_tokens": 112718564.0, "step": 49210 }, { "entropy": 5.78004412651062, "epoch": 4.865065243179123, "grad_norm": 1.2421875, "learning_rate": 0.0002881274722262966, "loss": 4.9074, "mean_token_accuracy": 0.23452680855989455, "num_tokens": 112728913.0, "step": 49215 }, { "entropy": 5.7678955078125, "epoch": 4.865559509687624, "grad_norm": 1.5234375, "learning_rate": 0.0002880922421984009, "loss": 4.8433, "mean_token_accuracy": 0.23443082720041275, "num_tokens": 112739136.0, "step": 49220 }, { "entropy": 5.755817556381226, "epoch": 4.866053776196125, "grad_norm": 1.46875, "learning_rate": 0.00028805701184843406, "loss": 4.89, "mean_token_accuracy": 0.227299202978611, "num_tokens": 112750279.0, "step": 49225 }, { "entropy": 5.751411294937133, "epoch": 4.866548042704626, "grad_norm": 1.34375, "learning_rate": 0.0002880217811772627, "loss": 4.9179, "mean_token_accuracy": 0.233957003057003, "num_tokens": 112761814.0, "step": 49230 }, { "entropy": 5.743126487731933, "epoch": 4.867042309213128, "grad_norm": 1.4453125, "learning_rate": 0.0002879865501857535, "loss": 4.8618, "mean_token_accuracy": 0.22636641263961793, "num_tokens": 112771806.0, "step": 49235 }, { "entropy": 5.715855646133423, "epoch": 4.867536575721629, "grad_norm": 1.4140625, "learning_rate": 0.0002879513188747731, "loss": 4.8543, "mean_token_accuracy": 0.23425724655389785, "num_tokens": 112782071.0, "step": 49240 }, { "entropy": 5.696483135223389, "epoch": 4.86803084223013, "grad_norm": 1.421875, "learning_rate": 0.00028791608724518833, "loss": 4.9395, "mean_token_accuracy": 0.2379143238067627, "num_tokens": 112793312.0, "step": 49245 }, { "entropy": 5.742300796508789, "epoch": 4.868525108738632, "grad_norm": 1.2734375, "learning_rate": 0.0002878808552978658, "loss": 4.932, "mean_token_accuracy": 0.2354622781276703, "num_tokens": 112804925.0, "step": 49250 }, { "entropy": 5.812800073623658, "epoch": 4.869019375247134, "grad_norm": 1.28125, "learning_rate": 0.00028784562303367213, "loss": 4.9597, "mean_token_accuracy": 0.22812983244657517, "num_tokens": 112817947.0, "step": 49255 }, { "entropy": 5.854327297210693, "epoch": 4.869513641755635, "grad_norm": 1.359375, "learning_rate": 0.0002878103904534742, "loss": 4.9815, "mean_token_accuracy": 0.22626199573278427, "num_tokens": 112829182.0, "step": 49260 }, { "entropy": 5.843795442581177, "epoch": 4.870007908264136, "grad_norm": 1.2109375, "learning_rate": 0.00028777515755813867, "loss": 4.9784, "mean_token_accuracy": 0.22238934338092803, "num_tokens": 112841024.0, "step": 49265 }, { "entropy": 5.8153845310211185, "epoch": 4.870502174772637, "grad_norm": 1.2421875, "learning_rate": 0.00028773992434853236, "loss": 4.8998, "mean_token_accuracy": 0.23224059790372847, "num_tokens": 112852175.0, "step": 49270 }, { "entropy": 5.699468564987183, "epoch": 4.870996441281139, "grad_norm": 1.2421875, "learning_rate": 0.0002877046908255219, "loss": 4.8467, "mean_token_accuracy": 0.2413761019706726, "num_tokens": 112863392.0, "step": 49275 }, { "entropy": 5.812985563278199, "epoch": 4.87149070778964, "grad_norm": 1.2265625, "learning_rate": 0.00028766945698997397, "loss": 5.0034, "mean_token_accuracy": 0.21540404111146927, "num_tokens": 112876393.0, "step": 49280 }, { "entropy": 5.806315755844116, "epoch": 4.871984974298142, "grad_norm": 1.3203125, "learning_rate": 0.00028763422284275547, "loss": 4.9588, "mean_token_accuracy": 0.23059856593608857, "num_tokens": 112886540.0, "step": 49285 }, { "entropy": 5.785651969909668, "epoch": 4.872479240806643, "grad_norm": 1.4375, "learning_rate": 0.0002875989883847332, "loss": 4.8964, "mean_token_accuracy": 0.2378912091255188, "num_tokens": 112898057.0, "step": 49290 }, { "entropy": 5.74857006072998, "epoch": 4.872973507315145, "grad_norm": 1.265625, "learning_rate": 0.0002875637536167738, "loss": 4.8772, "mean_token_accuracy": 0.23588797003030776, "num_tokens": 112910135.0, "step": 49295 }, { "entropy": 5.844922399520874, "epoch": 4.873467773823646, "grad_norm": 1.3515625, "learning_rate": 0.0002875285185397442, "loss": 5.0153, "mean_token_accuracy": 0.22356097549200057, "num_tokens": 112923374.0, "step": 49300 }, { "entropy": 5.725541353225708, "epoch": 4.873962040332147, "grad_norm": 1.3671875, "learning_rate": 0.000287493283154511, "loss": 4.8864, "mean_token_accuracy": 0.23751910775899887, "num_tokens": 112934332.0, "step": 49305 }, { "entropy": 5.663888549804687, "epoch": 4.874456306840648, "grad_norm": 1.4375, "learning_rate": 0.0002874580474619411, "loss": 4.7899, "mean_token_accuracy": 0.24756349474191666, "num_tokens": 112944630.0, "step": 49310 }, { "entropy": 5.810069847106933, "epoch": 4.87495057334915, "grad_norm": 1.1640625, "learning_rate": 0.0002874228114629014, "loss": 4.9777, "mean_token_accuracy": 0.22409878373146058, "num_tokens": 112957589.0, "step": 49315 }, { "entropy": 5.759831523895263, "epoch": 4.875444839857651, "grad_norm": 1.3046875, "learning_rate": 0.0002873875751582586, "loss": 4.8533, "mean_token_accuracy": 0.23885130137205124, "num_tokens": 112969052.0, "step": 49320 }, { "entropy": 5.812015390396118, "epoch": 4.875939106366152, "grad_norm": 1.4296875, "learning_rate": 0.0002873523385488794, "loss": 4.8968, "mean_token_accuracy": 0.2364566758275032, "num_tokens": 112979578.0, "step": 49325 }, { "entropy": 5.74316372871399, "epoch": 4.876433372874654, "grad_norm": 1.1953125, "learning_rate": 0.00028731710163563083, "loss": 4.8596, "mean_token_accuracy": 0.23841979950666428, "num_tokens": 112991353.0, "step": 49330 }, { "entropy": 5.829902076721192, "epoch": 4.8769276393831555, "grad_norm": 1.265625, "learning_rate": 0.0002872818644193797, "loss": 5.0518, "mean_token_accuracy": 0.21806159168481826, "num_tokens": 113003918.0, "step": 49335 }, { "entropy": 5.770462703704834, "epoch": 4.877421905891657, "grad_norm": 1.3203125, "learning_rate": 0.0002872466269009927, "loss": 4.9765, "mean_token_accuracy": 0.23322107195854186, "num_tokens": 113015251.0, "step": 49340 }, { "entropy": 5.772735643386841, "epoch": 4.877916172400158, "grad_norm": 1.5078125, "learning_rate": 0.00028721138908133686, "loss": 4.8542, "mean_token_accuracy": 0.23681345731019973, "num_tokens": 113027076.0, "step": 49345 }, { "entropy": 5.856437063217163, "epoch": 4.878410438908659, "grad_norm": 1.4296875, "learning_rate": 0.00028717615096127895, "loss": 5.0068, "mean_token_accuracy": 0.22299409359693528, "num_tokens": 113037622.0, "step": 49350 }, { "entropy": 5.812705945968628, "epoch": 4.878904705417161, "grad_norm": 1.2578125, "learning_rate": 0.00028714091254168574, "loss": 4.9186, "mean_token_accuracy": 0.23489080965518952, "num_tokens": 113048687.0, "step": 49355 }, { "entropy": 5.847864055633545, "epoch": 4.879398971925662, "grad_norm": 1.453125, "learning_rate": 0.00028710567382342426, "loss": 5.0568, "mean_token_accuracy": 0.2227376565337181, "num_tokens": 113060185.0, "step": 49360 }, { "entropy": 5.871094036102295, "epoch": 4.879893238434164, "grad_norm": 1.2109375, "learning_rate": 0.0002870704348073614, "loss": 5.0525, "mean_token_accuracy": 0.21605550348758698, "num_tokens": 113072743.0, "step": 49365 }, { "entropy": 5.8603894233703615, "epoch": 4.880387504942665, "grad_norm": 1.453125, "learning_rate": 0.00028703519549436385, "loss": 5.0096, "mean_token_accuracy": 0.2306547373533249, "num_tokens": 113082990.0, "step": 49370 }, { "entropy": 5.863398027420044, "epoch": 4.8808817714511665, "grad_norm": 1.296875, "learning_rate": 0.0002869999558852988, "loss": 4.963, "mean_token_accuracy": 0.21795407235622405, "num_tokens": 113094316.0, "step": 49375 }, { "entropy": 5.802748298645019, "epoch": 4.881376037959668, "grad_norm": 1.328125, "learning_rate": 0.0002869647159810327, "loss": 4.9457, "mean_token_accuracy": 0.22640439867973328, "num_tokens": 113105297.0, "step": 49380 }, { "entropy": 5.762135076522827, "epoch": 4.881870304468169, "grad_norm": 1.4296875, "learning_rate": 0.00028692947578243293, "loss": 4.8535, "mean_token_accuracy": 0.24241251349449158, "num_tokens": 113116851.0, "step": 49385 }, { "entropy": 5.750718212127685, "epoch": 4.88236457097667, "grad_norm": 1.375, "learning_rate": 0.0002868942352903662, "loss": 4.8731, "mean_token_accuracy": 0.23560429066419603, "num_tokens": 113127429.0, "step": 49390 }, { "entropy": 5.783828973770142, "epoch": 4.882858837485172, "grad_norm": 1.2734375, "learning_rate": 0.0002868589945056994, "loss": 4.9684, "mean_token_accuracy": 0.22898115813732148, "num_tokens": 113140173.0, "step": 49395 }, { "entropy": 5.8312843322753904, "epoch": 4.883353103993674, "grad_norm": 1.390625, "learning_rate": 0.0002868237534292995, "loss": 4.9201, "mean_token_accuracy": 0.23126276284456254, "num_tokens": 113151147.0, "step": 49400 }, { "entropy": 5.801044845581055, "epoch": 4.883847370502175, "grad_norm": 1.265625, "learning_rate": 0.0002867885120620334, "loss": 4.9338, "mean_token_accuracy": 0.2244262397289276, "num_tokens": 113163308.0, "step": 49405 }, { "entropy": 5.839687776565552, "epoch": 4.884341637010676, "grad_norm": 1.4296875, "learning_rate": 0.0002867532704047681, "loss": 4.9784, "mean_token_accuracy": 0.22870284020900727, "num_tokens": 113174405.0, "step": 49410 }, { "entropy": 5.792166423797608, "epoch": 4.8848359035191775, "grad_norm": 1.3671875, "learning_rate": 0.0002867180284583705, "loss": 4.9526, "mean_token_accuracy": 0.23022861033678055, "num_tokens": 113186662.0, "step": 49415 }, { "entropy": 5.756495189666748, "epoch": 4.885330170027679, "grad_norm": 1.265625, "learning_rate": 0.00028668278622370763, "loss": 4.8723, "mean_token_accuracy": 0.2418500378727913, "num_tokens": 113198489.0, "step": 49420 }, { "entropy": 5.788332462310791, "epoch": 4.88582443653618, "grad_norm": 1.2734375, "learning_rate": 0.0002866475437016464, "loss": 4.9504, "mean_token_accuracy": 0.2251896381378174, "num_tokens": 113210238.0, "step": 49425 }, { "entropy": 5.70060362815857, "epoch": 4.886318703044681, "grad_norm": 1.34375, "learning_rate": 0.00028661230089305375, "loss": 4.886, "mean_token_accuracy": 0.2377672776579857, "num_tokens": 113222008.0, "step": 49430 }, { "entropy": 5.752803707122803, "epoch": 4.8868129695531834, "grad_norm": 1.4140625, "learning_rate": 0.0002865770577987967, "loss": 4.9072, "mean_token_accuracy": 0.2328586310148239, "num_tokens": 113234187.0, "step": 49435 }, { "entropy": 5.761597537994385, "epoch": 4.887307236061685, "grad_norm": 1.296875, "learning_rate": 0.0002865418144197423, "loss": 4.8911, "mean_token_accuracy": 0.23951933085918425, "num_tokens": 113246418.0, "step": 49440 }, { "entropy": 5.742188405990601, "epoch": 4.887801502570186, "grad_norm": 1.3671875, "learning_rate": 0.00028650657075675735, "loss": 4.894, "mean_token_accuracy": 0.2345789149403572, "num_tokens": 113256561.0, "step": 49445 }, { "entropy": 5.7131763935089115, "epoch": 4.888295769078687, "grad_norm": 1.3125, "learning_rate": 0.0002864713268107091, "loss": 4.9019, "mean_token_accuracy": 0.23587365448474884, "num_tokens": 113269145.0, "step": 49450 }, { "entropy": 5.758551073074341, "epoch": 4.8887900355871885, "grad_norm": 1.296875, "learning_rate": 0.0002864360825824643, "loss": 4.8734, "mean_token_accuracy": 0.23137819468975068, "num_tokens": 113280545.0, "step": 49455 }, { "entropy": 5.845311450958252, "epoch": 4.88928430209569, "grad_norm": 1.3359375, "learning_rate": 0.0002864008380728902, "loss": 4.9316, "mean_token_accuracy": 0.23153275102376938, "num_tokens": 113292276.0, "step": 49460 }, { "entropy": 5.820145845413208, "epoch": 4.889778568604191, "grad_norm": 1.25, "learning_rate": 0.00028636559328285374, "loss": 4.9682, "mean_token_accuracy": 0.23152431845664978, "num_tokens": 113304486.0, "step": 49465 }, { "entropy": 5.757752323150635, "epoch": 4.890272835112693, "grad_norm": 1.2890625, "learning_rate": 0.00028633034821322177, "loss": 4.9553, "mean_token_accuracy": 0.22723328173160554, "num_tokens": 113316374.0, "step": 49470 }, { "entropy": 5.816243886947632, "epoch": 4.890767101621194, "grad_norm": 1.3671875, "learning_rate": 0.0002862951028648616, "loss": 4.8702, "mean_token_accuracy": 0.23911852687597274, "num_tokens": 113327151.0, "step": 49475 }, { "entropy": 5.7520115852355955, "epoch": 4.891261368129696, "grad_norm": 1.6015625, "learning_rate": 0.0002862598572386402, "loss": 4.8899, "mean_token_accuracy": 0.23756948858499527, "num_tokens": 113336314.0, "step": 49480 }, { "entropy": 5.7892567157745365, "epoch": 4.891755634638197, "grad_norm": 1.390625, "learning_rate": 0.00028622461133542436, "loss": 4.9411, "mean_token_accuracy": 0.2231715813279152, "num_tokens": 113346671.0, "step": 49485 }, { "entropy": 5.83081374168396, "epoch": 4.892249901146698, "grad_norm": 1.3359375, "learning_rate": 0.0002861893651560816, "loss": 4.9655, "mean_token_accuracy": 0.22435983121395112, "num_tokens": 113357781.0, "step": 49490 }, { "entropy": 5.809107971191406, "epoch": 4.8927441676551995, "grad_norm": 1.296875, "learning_rate": 0.0002861541187014785, "loss": 4.9487, "mean_token_accuracy": 0.2285016655921936, "num_tokens": 113369691.0, "step": 49495 }, { "entropy": 5.782532119750977, "epoch": 4.893238434163701, "grad_norm": 1.3671875, "learning_rate": 0.0002861188719724824, "loss": 4.9617, "mean_token_accuracy": 0.22591428309679032, "num_tokens": 113381586.0, "step": 49500 }, { "entropy": 5.7742259979248045, "epoch": 4.893732700672203, "grad_norm": 1.3125, "learning_rate": 0.00028608362496996046, "loss": 4.9505, "mean_token_accuracy": 0.23338802456855773, "num_tokens": 113393551.0, "step": 49505 }, { "entropy": 5.841367483139038, "epoch": 4.894226967180704, "grad_norm": 1.28125, "learning_rate": 0.0002860483776947795, "loss": 4.891, "mean_token_accuracy": 0.23188011050224305, "num_tokens": 113404615.0, "step": 49510 }, { "entropy": 5.752622985839844, "epoch": 4.894721233689205, "grad_norm": 1.3671875, "learning_rate": 0.00028601313014780676, "loss": 4.9234, "mean_token_accuracy": 0.23329124748706817, "num_tokens": 113416186.0, "step": 49515 }, { "entropy": 5.795762062072754, "epoch": 4.895215500197707, "grad_norm": 1.2734375, "learning_rate": 0.0002859778823299093, "loss": 4.9408, "mean_token_accuracy": 0.2286386325955391, "num_tokens": 113428037.0, "step": 49520 }, { "entropy": 5.783979511260986, "epoch": 4.895709766706208, "grad_norm": 1.5546875, "learning_rate": 0.0002859426342419543, "loss": 4.8809, "mean_token_accuracy": 0.23774271011352538, "num_tokens": 113439020.0, "step": 49525 }, { "entropy": 5.845564603805542, "epoch": 4.896204033214709, "grad_norm": 1.40625, "learning_rate": 0.0002859073858848087, "loss": 4.9994, "mean_token_accuracy": 0.22532339990139008, "num_tokens": 113451060.0, "step": 49530 }, { "entropy": 5.834315061569214, "epoch": 4.8966982997232105, "grad_norm": 1.2421875, "learning_rate": 0.00028587213725933975, "loss": 4.9626, "mean_token_accuracy": 0.22629932463169097, "num_tokens": 113463485.0, "step": 49535 }, { "entropy": 5.751065444946289, "epoch": 4.897192566231713, "grad_norm": 1.3671875, "learning_rate": 0.0002858368883664146, "loss": 4.9011, "mean_token_accuracy": 0.23899421691894532, "num_tokens": 113476259.0, "step": 49540 }, { "entropy": 5.837675619125366, "epoch": 4.897686832740214, "grad_norm": 1.3671875, "learning_rate": 0.00028580163920690016, "loss": 5.0094, "mean_token_accuracy": 0.2246207684278488, "num_tokens": 113487957.0, "step": 49545 }, { "entropy": 5.84792914390564, "epoch": 4.898181099248715, "grad_norm": 1.2890625, "learning_rate": 0.0002857663897816639, "loss": 5.0165, "mean_token_accuracy": 0.21944080293178558, "num_tokens": 113500066.0, "step": 49550 }, { "entropy": 5.749091625213623, "epoch": 4.898675365757216, "grad_norm": 1.2265625, "learning_rate": 0.0002857311400915726, "loss": 4.806, "mean_token_accuracy": 0.2427174910902977, "num_tokens": 113511032.0, "step": 49555 }, { "entropy": 5.729857110977173, "epoch": 4.899169632265718, "grad_norm": 1.3125, "learning_rate": 0.00028569589013749375, "loss": 4.8534, "mean_token_accuracy": 0.2420921131968498, "num_tokens": 113522472.0, "step": 49560 }, { "entropy": 5.750196695327759, "epoch": 4.899663898774219, "grad_norm": 1.3203125, "learning_rate": 0.0002856606399202943, "loss": 4.9583, "mean_token_accuracy": 0.2297402262687683, "num_tokens": 113534841.0, "step": 49565 }, { "entropy": 5.855951929092408, "epoch": 4.90015816528272, "grad_norm": 1.28125, "learning_rate": 0.00028562538944084135, "loss": 4.9642, "mean_token_accuracy": 0.2299104690551758, "num_tokens": 113545659.0, "step": 49570 }, { "entropy": 5.788914060592651, "epoch": 4.9006524317912215, "grad_norm": 1.421875, "learning_rate": 0.0002855901387000023, "loss": 4.9505, "mean_token_accuracy": 0.23686325848102568, "num_tokens": 113557293.0, "step": 49575 }, { "entropy": 5.813724088668823, "epoch": 4.901146698299723, "grad_norm": 1.2734375, "learning_rate": 0.0002855548876986442, "loss": 4.9616, "mean_token_accuracy": 0.22703695595264434, "num_tokens": 113568270.0, "step": 49580 }, { "entropy": 5.779737901687622, "epoch": 4.901640964808225, "grad_norm": 1.2578125, "learning_rate": 0.0002855196364376341, "loss": 4.9126, "mean_token_accuracy": 0.22952039688825607, "num_tokens": 113579838.0, "step": 49585 }, { "entropy": 5.815392303466797, "epoch": 4.902135231316726, "grad_norm": 1.3203125, "learning_rate": 0.0002854843849178395, "loss": 4.9733, "mean_token_accuracy": 0.23557699471712112, "num_tokens": 113590817.0, "step": 49590 }, { "entropy": 5.768790197372437, "epoch": 4.902629497825227, "grad_norm": 1.53125, "learning_rate": 0.0002854491331401273, "loss": 4.9101, "mean_token_accuracy": 0.234692944586277, "num_tokens": 113602912.0, "step": 49595 }, { "entropy": 5.773423910140991, "epoch": 4.903123764333729, "grad_norm": 1.3046875, "learning_rate": 0.0002854138811053647, "loss": 4.9112, "mean_token_accuracy": 0.23110030293464662, "num_tokens": 113613508.0, "step": 49600 }, { "entropy": 5.809531879425049, "epoch": 4.90361803084223, "grad_norm": 1.3671875, "learning_rate": 0.00028537862881441913, "loss": 4.9847, "mean_token_accuracy": 0.22846920192241668, "num_tokens": 113625221.0, "step": 49605 }, { "entropy": 5.763628339767456, "epoch": 4.904112297350731, "grad_norm": 1.375, "learning_rate": 0.0002853433762681577, "loss": 4.8548, "mean_token_accuracy": 0.23607393205165864, "num_tokens": 113636367.0, "step": 49610 }, { "entropy": 5.774369621276856, "epoch": 4.904606563859232, "grad_norm": 1.25, "learning_rate": 0.00028530812346744754, "loss": 4.9599, "mean_token_accuracy": 0.22789814472198486, "num_tokens": 113648667.0, "step": 49615 }, { "entropy": 5.786903238296508, "epoch": 4.905100830367735, "grad_norm": 1.375, "learning_rate": 0.000285272870413156, "loss": 4.951, "mean_token_accuracy": 0.23696109056472778, "num_tokens": 113659331.0, "step": 49620 }, { "entropy": 5.74313006401062, "epoch": 4.905595096876236, "grad_norm": 1.328125, "learning_rate": 0.00028523761710615023, "loss": 4.8871, "mean_token_accuracy": 0.2343490019440651, "num_tokens": 113669874.0, "step": 49625 }, { "entropy": 5.849160671234131, "epoch": 4.906089363384737, "grad_norm": 1.671875, "learning_rate": 0.0002852023635472974, "loss": 4.9733, "mean_token_accuracy": 0.22268903702497483, "num_tokens": 113681626.0, "step": 49630 }, { "entropy": 5.826789712905883, "epoch": 4.906583629893238, "grad_norm": 1.3203125, "learning_rate": 0.000285167109737465, "loss": 4.9867, "mean_token_accuracy": 0.228760027885437, "num_tokens": 113692778.0, "step": 49635 }, { "entropy": 5.7404790878295895, "epoch": 4.90707789640174, "grad_norm": 1.2890625, "learning_rate": 0.00028513185567752004, "loss": 4.9258, "mean_token_accuracy": 0.23725828975439073, "num_tokens": 113704061.0, "step": 49640 }, { "entropy": 5.720127725601197, "epoch": 4.907572162910241, "grad_norm": 1.4375, "learning_rate": 0.00028509660136832984, "loss": 4.85, "mean_token_accuracy": 0.242891925573349, "num_tokens": 113715184.0, "step": 49645 }, { "entropy": 5.773281002044678, "epoch": 4.908066429418742, "grad_norm": 1.25, "learning_rate": 0.0002850613468107617, "loss": 4.963, "mean_token_accuracy": 0.22806744873523713, "num_tokens": 113726987.0, "step": 49650 }, { "entropy": 5.809217071533203, "epoch": 4.908560695927244, "grad_norm": 1.3671875, "learning_rate": 0.000285026092005683, "loss": 4.9935, "mean_token_accuracy": 0.22644792199134828, "num_tokens": 113738516.0, "step": 49655 }, { "entropy": 5.909839200973511, "epoch": 4.909054962435746, "grad_norm": 1.390625, "learning_rate": 0.0002849908369539607, "loss": 5.1007, "mean_token_accuracy": 0.21748928874731063, "num_tokens": 113750087.0, "step": 49660 }, { "entropy": 5.717170667648316, "epoch": 4.909549228944247, "grad_norm": 1.40625, "learning_rate": 0.0002849555816564623, "loss": 4.7555, "mean_token_accuracy": 0.25533356964588166, "num_tokens": 113760837.0, "step": 49665 }, { "entropy": 5.825530576705932, "epoch": 4.910043495452748, "grad_norm": 1.53125, "learning_rate": 0.00028492032611405506, "loss": 4.9159, "mean_token_accuracy": 0.23628135323524474, "num_tokens": 113770496.0, "step": 49670 }, { "entropy": 5.821273994445801, "epoch": 4.910537761961249, "grad_norm": 1.4609375, "learning_rate": 0.0002848850703276062, "loss": 5.0018, "mean_token_accuracy": 0.2215157702565193, "num_tokens": 113781720.0, "step": 49675 }, { "entropy": 5.744265460968018, "epoch": 4.911032028469751, "grad_norm": 1.296875, "learning_rate": 0.00028484981429798326, "loss": 4.8594, "mean_token_accuracy": 0.23632450699806212, "num_tokens": 113793140.0, "step": 49680 }, { "entropy": 5.827163887023926, "epoch": 4.911526294978252, "grad_norm": 1.40625, "learning_rate": 0.0002848145580260532, "loss": 4.9677, "mean_token_accuracy": 0.219768488407135, "num_tokens": 113804584.0, "step": 49685 }, { "entropy": 5.71978611946106, "epoch": 4.912020561486754, "grad_norm": 1.2578125, "learning_rate": 0.0002847793015126835, "loss": 4.8745, "mean_token_accuracy": 0.2271732896566391, "num_tokens": 113815701.0, "step": 49690 }, { "entropy": 5.752813482284546, "epoch": 4.912514827995255, "grad_norm": 1.2734375, "learning_rate": 0.00028474404475874155, "loss": 4.853, "mean_token_accuracy": 0.23758791238069535, "num_tokens": 113826878.0, "step": 49695 }, { "entropy": 5.7857531070709225, "epoch": 4.913009094503757, "grad_norm": 1.3671875, "learning_rate": 0.0002847087877650946, "loss": 4.901, "mean_token_accuracy": 0.23775359094142914, "num_tokens": 113837320.0, "step": 49700 }, { "entropy": 5.874799537658691, "epoch": 4.913503361012258, "grad_norm": 1.265625, "learning_rate": 0.0002846735305326098, "loss": 5.1032, "mean_token_accuracy": 0.21485828310251237, "num_tokens": 113849460.0, "step": 49705 }, { "entropy": 5.745315313339233, "epoch": 4.913997627520759, "grad_norm": 1.46875, "learning_rate": 0.0002846382730621548, "loss": 4.8557, "mean_token_accuracy": 0.24056546986103058, "num_tokens": 113860998.0, "step": 49710 }, { "entropy": 5.794930124282837, "epoch": 4.91449189402926, "grad_norm": 1.390625, "learning_rate": 0.0002846030153545967, "loss": 4.9141, "mean_token_accuracy": 0.2289827585220337, "num_tokens": 113873100.0, "step": 49715 }, { "entropy": 5.799171400070191, "epoch": 4.914986160537762, "grad_norm": 1.2890625, "learning_rate": 0.00028456775741080297, "loss": 4.9979, "mean_token_accuracy": 0.22023083865642548, "num_tokens": 113885444.0, "step": 49720 }, { "entropy": 5.807810354232788, "epoch": 4.915480427046264, "grad_norm": 1.3359375, "learning_rate": 0.00028453249923164094, "loss": 4.9349, "mean_token_accuracy": 0.23151204884052276, "num_tokens": 113897198.0, "step": 49725 }, { "entropy": 5.822122287750244, "epoch": 4.915974693554765, "grad_norm": 1.3515625, "learning_rate": 0.00028449724081797796, "loss": 4.9538, "mean_token_accuracy": 0.22858942449092864, "num_tokens": 113908436.0, "step": 49730 }, { "entropy": 5.800542879104614, "epoch": 4.916468960063266, "grad_norm": 1.328125, "learning_rate": 0.00028446198217068133, "loss": 4.9914, "mean_token_accuracy": 0.23040324449539185, "num_tokens": 113918955.0, "step": 49735 }, { "entropy": 5.744678020477295, "epoch": 4.9169632265717675, "grad_norm": 1.40625, "learning_rate": 0.00028442672329061854, "loss": 4.9525, "mean_token_accuracy": 0.2347753643989563, "num_tokens": 113931299.0, "step": 49740 }, { "entropy": 5.855995416641235, "epoch": 4.917457493080269, "grad_norm": 1.25, "learning_rate": 0.0002843914641786568, "loss": 4.961, "mean_token_accuracy": 0.22710224986076355, "num_tokens": 113942396.0, "step": 49745 }, { "entropy": 5.842866897583008, "epoch": 4.91795175958877, "grad_norm": 1.390625, "learning_rate": 0.00028435620483566366, "loss": 4.9478, "mean_token_accuracy": 0.2239452451467514, "num_tokens": 113953815.0, "step": 49750 }, { "entropy": 5.851448488235474, "epoch": 4.918446026097271, "grad_norm": 1.265625, "learning_rate": 0.0002843209452625064, "loss": 4.99, "mean_token_accuracy": 0.23054806143045425, "num_tokens": 113965567.0, "step": 49755 }, { "entropy": 5.763729429244995, "epoch": 4.9189402926057735, "grad_norm": 1.2890625, "learning_rate": 0.0002842856854600524, "loss": 4.9664, "mean_token_accuracy": 0.2292360171675682, "num_tokens": 113977350.0, "step": 49760 }, { "entropy": 5.862820100784302, "epoch": 4.919434559114275, "grad_norm": 1.3515625, "learning_rate": 0.00028425042542916916, "loss": 5.0441, "mean_token_accuracy": 0.2248494103550911, "num_tokens": 113987997.0, "step": 49765 }, { "entropy": 5.774439096450806, "epoch": 4.919928825622776, "grad_norm": 1.375, "learning_rate": 0.00028421516517072404, "loss": 4.8376, "mean_token_accuracy": 0.23773832470178605, "num_tokens": 113998754.0, "step": 49770 }, { "entropy": 5.782770776748658, "epoch": 4.920423092131277, "grad_norm": 1.3125, "learning_rate": 0.00028417990468558433, "loss": 4.9206, "mean_token_accuracy": 0.2305078998208046, "num_tokens": 114009619.0, "step": 49775 }, { "entropy": 5.742311000823975, "epoch": 4.9209173586397785, "grad_norm": 1.421875, "learning_rate": 0.0002841446439746176, "loss": 4.8635, "mean_token_accuracy": 0.23687660247087478, "num_tokens": 114020581.0, "step": 49780 }, { "entropy": 5.795451498031616, "epoch": 4.92141162514828, "grad_norm": 1.3125, "learning_rate": 0.00028410938303869126, "loss": 4.9184, "mean_token_accuracy": 0.2348613977432251, "num_tokens": 114031796.0, "step": 49785 }, { "entropy": 5.806154537200928, "epoch": 4.921905891656781, "grad_norm": 1.375, "learning_rate": 0.0002840741218786726, "loss": 4.9424, "mean_token_accuracy": 0.2264641135931015, "num_tokens": 114042125.0, "step": 49790 }, { "entropy": 5.790507650375366, "epoch": 4.922400158165283, "grad_norm": 1.296875, "learning_rate": 0.0002840388604954292, "loss": 4.9393, "mean_token_accuracy": 0.22884512394666673, "num_tokens": 114054546.0, "step": 49795 }, { "entropy": 5.826856231689453, "epoch": 4.9228944246737845, "grad_norm": 1.578125, "learning_rate": 0.0002840035988898284, "loss": 4.9468, "mean_token_accuracy": 0.23112366646528243, "num_tokens": 114065290.0, "step": 49800 }, { "entropy": 5.863804817199707, "epoch": 4.923388691182286, "grad_norm": 1.34375, "learning_rate": 0.0002839683370627377, "loss": 4.9316, "mean_token_accuracy": 0.2260959655046463, "num_tokens": 114075560.0, "step": 49805 }, { "entropy": 5.730663824081421, "epoch": 4.923882957690787, "grad_norm": 1.265625, "learning_rate": 0.0002839330750150244, "loss": 4.7917, "mean_token_accuracy": 0.2465095192193985, "num_tokens": 114086806.0, "step": 49810 }, { "entropy": 5.742004776000977, "epoch": 4.924377224199288, "grad_norm": 1.3046875, "learning_rate": 0.00028389781274755624, "loss": 4.9371, "mean_token_accuracy": 0.23309370130300522, "num_tokens": 114098204.0, "step": 49815 }, { "entropy": 5.76456503868103, "epoch": 4.9248714907077895, "grad_norm": 1.1640625, "learning_rate": 0.0002838625502612004, "loss": 4.9408, "mean_token_accuracy": 0.23431558907032013, "num_tokens": 114111331.0, "step": 49820 }, { "entropy": 5.813323926925659, "epoch": 4.925365757216291, "grad_norm": 1.3203125, "learning_rate": 0.00028382728755682444, "loss": 4.973, "mean_token_accuracy": 0.23562365770339966, "num_tokens": 114122878.0, "step": 49825 }, { "entropy": 5.866981029510498, "epoch": 4.925860023724792, "grad_norm": 1.3984375, "learning_rate": 0.00028379202463529586, "loss": 4.8962, "mean_token_accuracy": 0.2335548982024193, "num_tokens": 114133320.0, "step": 49830 }, { "entropy": 5.760624980926513, "epoch": 4.926354290233293, "grad_norm": 1.3125, "learning_rate": 0.00028375676149748207, "loss": 4.8903, "mean_token_accuracy": 0.23015797585248948, "num_tokens": 114145975.0, "step": 49835 }, { "entropy": 5.76899824142456, "epoch": 4.9268485567417954, "grad_norm": 1.3671875, "learning_rate": 0.0002837214981442507, "loss": 4.9441, "mean_token_accuracy": 0.22269562780857086, "num_tokens": 114156812.0, "step": 49840 }, { "entropy": 5.806515836715699, "epoch": 4.927342823250297, "grad_norm": 1.4140625, "learning_rate": 0.0002836862345764691, "loss": 4.998, "mean_token_accuracy": 0.2285042390227318, "num_tokens": 114169009.0, "step": 49845 }, { "entropy": 5.811793565750122, "epoch": 4.927837089758798, "grad_norm": 1.2578125, "learning_rate": 0.00028365097079500475, "loss": 4.879, "mean_token_accuracy": 0.2363865539431572, "num_tokens": 114181427.0, "step": 49850 }, { "entropy": 5.795496034622192, "epoch": 4.928331356267299, "grad_norm": 1.3203125, "learning_rate": 0.00028361570680072507, "loss": 4.9727, "mean_token_accuracy": 0.22633173167705536, "num_tokens": 114192427.0, "step": 49855 }, { "entropy": 5.7613029956817625, "epoch": 4.9288256227758005, "grad_norm": 1.390625, "learning_rate": 0.00028358044259449785, "loss": 4.8681, "mean_token_accuracy": 0.24114388972520828, "num_tokens": 114202914.0, "step": 49860 }, { "entropy": 5.731849336624146, "epoch": 4.929319889284302, "grad_norm": 1.3359375, "learning_rate": 0.00028354517817719024, "loss": 4.899, "mean_token_accuracy": 0.23744490295648574, "num_tokens": 114214359.0, "step": 49865 }, { "entropy": 5.834128952026367, "epoch": 4.929814155792803, "grad_norm": 1.4609375, "learning_rate": 0.00028350991354967003, "loss": 5.0506, "mean_token_accuracy": 0.23135192096233367, "num_tokens": 114225766.0, "step": 49870 }, { "entropy": 5.826089715957641, "epoch": 4.930308422301305, "grad_norm": 1.3046875, "learning_rate": 0.0002834746487128046, "loss": 4.9655, "mean_token_accuracy": 0.232780584692955, "num_tokens": 114236488.0, "step": 49875 }, { "entropy": 5.85629620552063, "epoch": 4.930802688809806, "grad_norm": 1.1796875, "learning_rate": 0.0002834393836674615, "loss": 4.9476, "mean_token_accuracy": 0.23046936392784118, "num_tokens": 114248524.0, "step": 49880 }, { "entropy": 5.767047452926636, "epoch": 4.931296955318308, "grad_norm": 1.3359375, "learning_rate": 0.0002834041184145082, "loss": 4.8612, "mean_token_accuracy": 0.2411500871181488, "num_tokens": 114260523.0, "step": 49885 }, { "entropy": 5.76344256401062, "epoch": 4.931791221826809, "grad_norm": 1.25, "learning_rate": 0.0002833688529548124, "loss": 4.8648, "mean_token_accuracy": 0.2361275389790535, "num_tokens": 114272150.0, "step": 49890 }, { "entropy": 5.789968538284302, "epoch": 4.93228548833531, "grad_norm": 1.3515625, "learning_rate": 0.0002833335872892414, "loss": 5.001, "mean_token_accuracy": 0.22087265253067018, "num_tokens": 114284127.0, "step": 49895 }, { "entropy": 5.841102409362793, "epoch": 4.9327797548438115, "grad_norm": 1.4375, "learning_rate": 0.0002832983214186629, "loss": 5.0396, "mean_token_accuracy": 0.22227319329977036, "num_tokens": 114295995.0, "step": 49900 }, { "entropy": 5.817886257171631, "epoch": 4.933274021352313, "grad_norm": 1.3046875, "learning_rate": 0.0002832630553439444, "loss": 4.9849, "mean_token_accuracy": 0.22462240159511565, "num_tokens": 114307148.0, "step": 49905 }, { "entropy": 5.774989795684815, "epoch": 4.933768287860815, "grad_norm": 1.2421875, "learning_rate": 0.0002832277890659535, "loss": 4.952, "mean_token_accuracy": 0.2342192381620407, "num_tokens": 114319062.0, "step": 49910 }, { "entropy": 5.810780096054077, "epoch": 4.934262554369316, "grad_norm": 1.40625, "learning_rate": 0.0002831925225855577, "loss": 4.9351, "mean_token_accuracy": 0.23211680203676224, "num_tokens": 114330958.0, "step": 49915 }, { "entropy": 5.867742538452148, "epoch": 4.934756820877817, "grad_norm": 1.3046875, "learning_rate": 0.0002831572559036245, "loss": 4.9718, "mean_token_accuracy": 0.22906851023435593, "num_tokens": 114342249.0, "step": 49920 }, { "entropy": 5.84346833229065, "epoch": 4.935251087386319, "grad_norm": 1.3203125, "learning_rate": 0.00028312198902102166, "loss": 4.9386, "mean_token_accuracy": 0.2293518677353859, "num_tokens": 114352834.0, "step": 49925 }, { "entropy": 5.880119180679321, "epoch": 4.93574535389482, "grad_norm": 1.34375, "learning_rate": 0.0002830867219386166, "loss": 4.9961, "mean_token_accuracy": 0.22626329362392425, "num_tokens": 114364397.0, "step": 49930 }, { "entropy": 5.715747547149658, "epoch": 4.936239620403321, "grad_norm": 1.421875, "learning_rate": 0.0002830514546572768, "loss": 4.8404, "mean_token_accuracy": 0.24229886084795, "num_tokens": 114375588.0, "step": 49935 }, { "entropy": 5.850084352493286, "epoch": 4.9367338869118225, "grad_norm": 1.1640625, "learning_rate": 0.00028301618717787013, "loss": 5.0128, "mean_token_accuracy": 0.2190149173140526, "num_tokens": 114387467.0, "step": 49940 }, { "entropy": 5.834776735305786, "epoch": 4.937228153420325, "grad_norm": 1.2890625, "learning_rate": 0.0002829809195012639, "loss": 4.9504, "mean_token_accuracy": 0.23169461041688919, "num_tokens": 114399024.0, "step": 49945 }, { "entropy": 5.777243947982788, "epoch": 4.937722419928826, "grad_norm": 1.4296875, "learning_rate": 0.00028294565162832584, "loss": 4.9013, "mean_token_accuracy": 0.23407716006040574, "num_tokens": 114409441.0, "step": 49950 }, { "entropy": 5.782475519180298, "epoch": 4.938216686437327, "grad_norm": 1.3046875, "learning_rate": 0.00028291038355992356, "loss": 4.8911, "mean_token_accuracy": 0.23453335464000702, "num_tokens": 114422033.0, "step": 49955 }, { "entropy": 5.813448095321656, "epoch": 4.938710952945828, "grad_norm": 1.265625, "learning_rate": 0.00028287511529692465, "loss": 4.8757, "mean_token_accuracy": 0.23964359760284423, "num_tokens": 114432850.0, "step": 49960 }, { "entropy": 5.833718013763428, "epoch": 4.93920521945433, "grad_norm": 1.3046875, "learning_rate": 0.0002828398468401966, "loss": 4.9923, "mean_token_accuracy": 0.22636514157056808, "num_tokens": 114444381.0, "step": 49965 }, { "entropy": 5.823450422286987, "epoch": 4.939699485962831, "grad_norm": 1.3515625, "learning_rate": 0.00028280457819060704, "loss": 4.978, "mean_token_accuracy": 0.2295143187046051, "num_tokens": 114456052.0, "step": 49970 }, { "entropy": 5.762185716629029, "epoch": 4.940193752471332, "grad_norm": 1.4609375, "learning_rate": 0.00028276930934902376, "loss": 4.865, "mean_token_accuracy": 0.24041374325752257, "num_tokens": 114466933.0, "step": 49975 }, { "entropy": 5.772572183609009, "epoch": 4.940688018979834, "grad_norm": 1.28125, "learning_rate": 0.0002827340403163143, "loss": 4.9292, "mean_token_accuracy": 0.2306359201669693, "num_tokens": 114478688.0, "step": 49980 }, { "entropy": 5.821403312683105, "epoch": 4.941182285488336, "grad_norm": 1.328125, "learning_rate": 0.0002826987710933462, "loss": 4.976, "mean_token_accuracy": 0.22346433997154236, "num_tokens": 114489655.0, "step": 49985 }, { "entropy": 5.792050361633301, "epoch": 4.941676551996837, "grad_norm": 1.21875, "learning_rate": 0.00028266350168098706, "loss": 4.8529, "mean_token_accuracy": 0.2348995640873909, "num_tokens": 114500791.0, "step": 49990 }, { "entropy": 5.859633302688598, "epoch": 4.942170818505338, "grad_norm": 1.265625, "learning_rate": 0.00028262823208010464, "loss": 5.0045, "mean_token_accuracy": 0.2238997608423233, "num_tokens": 114513562.0, "step": 49995 }, { "entropy": 5.817596673965454, "epoch": 4.942665085013839, "grad_norm": 1.2421875, "learning_rate": 0.0002825929622915665, "loss": 4.9875, "mean_token_accuracy": 0.2229781374335289, "num_tokens": 114524973.0, "step": 50000 }, { "entropy": 5.861956024169922, "epoch": 4.943159351522341, "grad_norm": 1.3203125, "learning_rate": 0.0002825576923162404, "loss": 4.9679, "mean_token_accuracy": 0.22606209218502044, "num_tokens": 114536511.0, "step": 50005 }, { "entropy": 5.873575115203858, "epoch": 4.943653618030842, "grad_norm": 1.1953125, "learning_rate": 0.00028252242215499385, "loss": 5.016, "mean_token_accuracy": 0.22243181616067886, "num_tokens": 114548544.0, "step": 50010 }, { "entropy": 5.819559574127197, "epoch": 4.944147884539344, "grad_norm": 1.4140625, "learning_rate": 0.00028248715180869457, "loss": 4.9019, "mean_token_accuracy": 0.23738448619842528, "num_tokens": 114559759.0, "step": 50015 }, { "entropy": 5.7790083408355715, "epoch": 4.944642151047845, "grad_norm": 1.3671875, "learning_rate": 0.00028245188127821015, "loss": 4.9006, "mean_token_accuracy": 0.2331358566880226, "num_tokens": 114570746.0, "step": 50020 }, { "entropy": 5.801171922683716, "epoch": 4.945136417556347, "grad_norm": 1.375, "learning_rate": 0.00028241661056440824, "loss": 4.9646, "mean_token_accuracy": 0.23100357353687287, "num_tokens": 114582411.0, "step": 50025 }, { "entropy": 5.735310363769531, "epoch": 4.945630684064848, "grad_norm": 1.3515625, "learning_rate": 0.00028238133966815667, "loss": 4.9028, "mean_token_accuracy": 0.24055004715919495, "num_tokens": 114594692.0, "step": 50030 }, { "entropy": 5.773415374755859, "epoch": 4.946124950573349, "grad_norm": 1.3203125, "learning_rate": 0.00028234606859032303, "loss": 4.8689, "mean_token_accuracy": 0.23279104232788086, "num_tokens": 114606346.0, "step": 50035 }, { "entropy": 5.8222709655761715, "epoch": 4.94661921708185, "grad_norm": 1.296875, "learning_rate": 0.0002823107973317748, "loss": 4.9734, "mean_token_accuracy": 0.23279672116041183, "num_tokens": 114617657.0, "step": 50040 }, { "entropy": 5.798703145980835, "epoch": 4.947113483590352, "grad_norm": 1.2890625, "learning_rate": 0.0002822755258933799, "loss": 4.9108, "mean_token_accuracy": 0.23610049337148667, "num_tokens": 114629203.0, "step": 50045 }, { "entropy": 5.787212467193603, "epoch": 4.947607750098854, "grad_norm": 1.4140625, "learning_rate": 0.00028224025427600597, "loss": 5.0014, "mean_token_accuracy": 0.22070663124322892, "num_tokens": 114640441.0, "step": 50050 }, { "entropy": 5.800938844680786, "epoch": 4.948102016607355, "grad_norm": 1.359375, "learning_rate": 0.00028220498248052064, "loss": 4.9329, "mean_token_accuracy": 0.22891813665628433, "num_tokens": 114651095.0, "step": 50055 }, { "entropy": 5.778642702102661, "epoch": 4.948596283115856, "grad_norm": 1.4140625, "learning_rate": 0.00028216971050779163, "loss": 4.9129, "mean_token_accuracy": 0.22912734597921372, "num_tokens": 114662691.0, "step": 50060 }, { "entropy": 5.797781658172608, "epoch": 4.949090549624358, "grad_norm": 1.2421875, "learning_rate": 0.00028213443835868655, "loss": 4.9096, "mean_token_accuracy": 0.23262368589639665, "num_tokens": 114674618.0, "step": 50065 }, { "entropy": 5.816585731506348, "epoch": 4.949584816132859, "grad_norm": 1.5625, "learning_rate": 0.00028209916603407333, "loss": 4.9616, "mean_token_accuracy": 0.2245672821998596, "num_tokens": 114685832.0, "step": 50070 }, { "entropy": 5.777929639816284, "epoch": 4.95007908264136, "grad_norm": 1.375, "learning_rate": 0.0002820638935348194, "loss": 4.8835, "mean_token_accuracy": 0.23668137937784195, "num_tokens": 114696723.0, "step": 50075 }, { "entropy": 5.817441034317016, "epoch": 4.950573349149861, "grad_norm": 1.4609375, "learning_rate": 0.0002820286208617926, "loss": 4.9448, "mean_token_accuracy": 0.2272737056016922, "num_tokens": 114707064.0, "step": 50080 }, { "entropy": 5.783890104293823, "epoch": 4.951067615658363, "grad_norm": 1.4296875, "learning_rate": 0.0002819933480158607, "loss": 4.9033, "mean_token_accuracy": 0.23640350252389908, "num_tokens": 114717121.0, "step": 50085 }, { "entropy": 5.778128242492675, "epoch": 4.951561882166864, "grad_norm": 1.21875, "learning_rate": 0.0002819580749978913, "loss": 4.8801, "mean_token_accuracy": 0.23893888145685196, "num_tokens": 114728539.0, "step": 50090 }, { "entropy": 5.749608325958252, "epoch": 4.952056148675366, "grad_norm": 1.34375, "learning_rate": 0.0002819228018087522, "loss": 4.8648, "mean_token_accuracy": 0.23393135964870454, "num_tokens": 114739318.0, "step": 50095 }, { "entropy": 5.864294385910034, "epoch": 4.952550415183867, "grad_norm": 1.296875, "learning_rate": 0.00028188752844931115, "loss": 4.9744, "mean_token_accuracy": 0.22932562083005906, "num_tokens": 114751118.0, "step": 50100 }, { "entropy": 5.810138130187989, "epoch": 4.953044681692369, "grad_norm": 1.3203125, "learning_rate": 0.0002818522549204358, "loss": 4.9082, "mean_token_accuracy": 0.22569647282361985, "num_tokens": 114762309.0, "step": 50105 }, { "entropy": 5.847204303741455, "epoch": 4.95353894820087, "grad_norm": 1.1953125, "learning_rate": 0.0002818169812229939, "loss": 4.9518, "mean_token_accuracy": 0.22461484372615814, "num_tokens": 114774279.0, "step": 50110 }, { "entropy": 5.812509822845459, "epoch": 4.954033214709371, "grad_norm": 1.4140625, "learning_rate": 0.00028178170735785316, "loss": 5.0113, "mean_token_accuracy": 0.22614845037460327, "num_tokens": 114786188.0, "step": 50115 }, { "entropy": 5.743883228302002, "epoch": 4.954527481217872, "grad_norm": 1.359375, "learning_rate": 0.00028174643332588145, "loss": 4.8474, "mean_token_accuracy": 0.23588586002588272, "num_tokens": 114797720.0, "step": 50120 }, { "entropy": 5.777899312973022, "epoch": 4.955021747726374, "grad_norm": 1.3125, "learning_rate": 0.00028171115912794636, "loss": 4.9468, "mean_token_accuracy": 0.23775314390659333, "num_tokens": 114809717.0, "step": 50125 }, { "entropy": 5.81242995262146, "epoch": 4.955516014234876, "grad_norm": 1.3359375, "learning_rate": 0.0002816758847649158, "loss": 4.918, "mean_token_accuracy": 0.2350105121731758, "num_tokens": 114819900.0, "step": 50130 }, { "entropy": 5.83761887550354, "epoch": 4.956010280743377, "grad_norm": 1.2109375, "learning_rate": 0.0002816406102376574, "loss": 4.9627, "mean_token_accuracy": 0.2272122621536255, "num_tokens": 114832089.0, "step": 50135 }, { "entropy": 5.833520841598511, "epoch": 4.956504547251878, "grad_norm": 1.1171875, "learning_rate": 0.00028160533554703887, "loss": 5.0526, "mean_token_accuracy": 0.22129807770252227, "num_tokens": 114844261.0, "step": 50140 }, { "entropy": 5.774409484863281, "epoch": 4.9569988137603795, "grad_norm": 1.4453125, "learning_rate": 0.00028157006069392816, "loss": 4.8963, "mean_token_accuracy": 0.23243194669485093, "num_tokens": 114854903.0, "step": 50145 }, { "entropy": 5.814947509765625, "epoch": 4.957493080268881, "grad_norm": 1.265625, "learning_rate": 0.00028153478567919293, "loss": 4.8819, "mean_token_accuracy": 0.23764284402132035, "num_tokens": 114865997.0, "step": 50150 }, { "entropy": 5.829001760482788, "epoch": 4.957987346777382, "grad_norm": 1.3046875, "learning_rate": 0.00028149951050370094, "loss": 5.0398, "mean_token_accuracy": 0.21498369425535202, "num_tokens": 114878522.0, "step": 50155 }, { "entropy": 5.83411054611206, "epoch": 4.958481613285883, "grad_norm": 1.4375, "learning_rate": 0.00028146423516831997, "loss": 4.953, "mean_token_accuracy": 0.23039473593235016, "num_tokens": 114890277.0, "step": 50160 }, { "entropy": 5.736070346832276, "epoch": 4.9589758797943855, "grad_norm": 1.2421875, "learning_rate": 0.00028142895967391793, "loss": 4.8513, "mean_token_accuracy": 0.23783244490623473, "num_tokens": 114902019.0, "step": 50165 }, { "entropy": 5.775155544281006, "epoch": 4.959470146302887, "grad_norm": 1.2734375, "learning_rate": 0.0002813936840213623, "loss": 4.9182, "mean_token_accuracy": 0.23343444615602493, "num_tokens": 114913375.0, "step": 50170 }, { "entropy": 5.8057445049285885, "epoch": 4.959964412811388, "grad_norm": 1.3828125, "learning_rate": 0.0002813584082115212, "loss": 4.932, "mean_token_accuracy": 0.23340822160243987, "num_tokens": 114924793.0, "step": 50175 }, { "entropy": 5.80465874671936, "epoch": 4.960458679319889, "grad_norm": 1.2890625, "learning_rate": 0.00028132313224526226, "loss": 4.9206, "mean_token_accuracy": 0.23438309282064437, "num_tokens": 114936255.0, "step": 50180 }, { "entropy": 5.810911035537719, "epoch": 4.9609529458283905, "grad_norm": 1.328125, "learning_rate": 0.0002812878561234531, "loss": 4.9359, "mean_token_accuracy": 0.22913830429315568, "num_tokens": 114947832.0, "step": 50185 }, { "entropy": 5.747545385360718, "epoch": 4.961447212336892, "grad_norm": 1.3828125, "learning_rate": 0.00028125257984696185, "loss": 4.9271, "mean_token_accuracy": 0.23852724730968475, "num_tokens": 114960245.0, "step": 50190 }, { "entropy": 5.784721755981446, "epoch": 4.961941478845393, "grad_norm": 1.28125, "learning_rate": 0.00028121730341665617, "loss": 4.9296, "mean_token_accuracy": 0.22984112203121185, "num_tokens": 114970931.0, "step": 50195 }, { "entropy": 5.795871829986572, "epoch": 4.962435745353895, "grad_norm": 1.28125, "learning_rate": 0.0002811820268334038, "loss": 4.9267, "mean_token_accuracy": 0.23059766739606857, "num_tokens": 114982106.0, "step": 50200 }, { "entropy": 5.859975576400757, "epoch": 4.9629300118623965, "grad_norm": 1.3359375, "learning_rate": 0.0002811467500980727, "loss": 4.9456, "mean_token_accuracy": 0.23010871559381485, "num_tokens": 114994194.0, "step": 50205 }, { "entropy": 5.7653028011322025, "epoch": 4.963424278370898, "grad_norm": 1.2265625, "learning_rate": 0.0002811114732115305, "loss": 4.936, "mean_token_accuracy": 0.23017161041498185, "num_tokens": 115006526.0, "step": 50210 }, { "entropy": 5.770809602737427, "epoch": 4.963918544879399, "grad_norm": 1.2421875, "learning_rate": 0.0002810761961746452, "loss": 4.9183, "mean_token_accuracy": 0.23486812561750411, "num_tokens": 115017863.0, "step": 50215 }, { "entropy": 5.801350116729736, "epoch": 4.9644128113879, "grad_norm": 1.2890625, "learning_rate": 0.00028104091898828454, "loss": 4.9338, "mean_token_accuracy": 0.2330716520547867, "num_tokens": 115029597.0, "step": 50220 }, { "entropy": 5.7715836524963375, "epoch": 4.9649070778964015, "grad_norm": 1.3828125, "learning_rate": 0.0002810056416533162, "loss": 4.9222, "mean_token_accuracy": 0.23138584047555924, "num_tokens": 115041027.0, "step": 50225 }, { "entropy": 5.793311882019043, "epoch": 4.965401344404903, "grad_norm": 1.3359375, "learning_rate": 0.0002809703641706083, "loss": 4.9315, "mean_token_accuracy": 0.2287633612751961, "num_tokens": 115051508.0, "step": 50230 }, { "entropy": 5.706295824050903, "epoch": 4.965895610913405, "grad_norm": 1.1875, "learning_rate": 0.0002809350865410284, "loss": 4.8438, "mean_token_accuracy": 0.23879338651895524, "num_tokens": 115061766.0, "step": 50235 }, { "entropy": 5.808468914031982, "epoch": 4.966389877421906, "grad_norm": 1.359375, "learning_rate": 0.0002808998087654445, "loss": 4.9523, "mean_token_accuracy": 0.22999130189418793, "num_tokens": 115072858.0, "step": 50240 }, { "entropy": 5.874891996383667, "epoch": 4.9668841439304074, "grad_norm": 1.34375, "learning_rate": 0.00028086453084472443, "loss": 5.0388, "mean_token_accuracy": 0.21961769610643386, "num_tokens": 115084714.0, "step": 50245 }, { "entropy": 5.749356937408447, "epoch": 4.967378410438909, "grad_norm": 1.34375, "learning_rate": 0.00028082925277973596, "loss": 4.8929, "mean_token_accuracy": 0.23632720857858658, "num_tokens": 115095647.0, "step": 50250 }, { "entropy": 5.790010404586792, "epoch": 4.96787267694741, "grad_norm": 1.296875, "learning_rate": 0.0002807939745713469, "loss": 4.924, "mean_token_accuracy": 0.22470076829195024, "num_tokens": 115106030.0, "step": 50255 }, { "entropy": 5.89292426109314, "epoch": 4.968366943455911, "grad_norm": 1.2890625, "learning_rate": 0.0002807586962204252, "loss": 5.0839, "mean_token_accuracy": 0.2159691721200943, "num_tokens": 115117941.0, "step": 50260 }, { "entropy": 5.792506361007691, "epoch": 4.9688612099644125, "grad_norm": 1.3359375, "learning_rate": 0.0002807234177278388, "loss": 4.8367, "mean_token_accuracy": 0.2352254331111908, "num_tokens": 115130230.0, "step": 50265 }, { "entropy": 5.779163408279419, "epoch": 4.969355476472915, "grad_norm": 1.5078125, "learning_rate": 0.00028068813909445527, "loss": 4.9265, "mean_token_accuracy": 0.23493935614824296, "num_tokens": 115141925.0, "step": 50270 }, { "entropy": 5.744682455062867, "epoch": 4.969849742981416, "grad_norm": 1.359375, "learning_rate": 0.00028065286032114266, "loss": 4.9493, "mean_token_accuracy": 0.23053625524044036, "num_tokens": 115154295.0, "step": 50275 }, { "entropy": 5.730276679992675, "epoch": 4.970344009489917, "grad_norm": 1.4375, "learning_rate": 0.0002806175814087689, "loss": 4.827, "mean_token_accuracy": 0.24380260407924653, "num_tokens": 115165133.0, "step": 50280 }, { "entropy": 5.806663894653321, "epoch": 4.970838275998418, "grad_norm": 1.1796875, "learning_rate": 0.0002805823023582017, "loss": 4.903, "mean_token_accuracy": 0.23219995349645614, "num_tokens": 115176570.0, "step": 50285 }, { "entropy": 5.793891382217407, "epoch": 4.97133254250692, "grad_norm": 1.40625, "learning_rate": 0.000280547023170309, "loss": 4.9861, "mean_token_accuracy": 0.2218492478132248, "num_tokens": 115188464.0, "step": 50290 }, { "entropy": 5.8527429580688475, "epoch": 4.971826809015421, "grad_norm": 1.3125, "learning_rate": 0.00028051174384595873, "loss": 5.0055, "mean_token_accuracy": 0.22439261823892592, "num_tokens": 115199422.0, "step": 50295 }, { "entropy": 5.793202495574951, "epoch": 4.972321075523922, "grad_norm": 1.4453125, "learning_rate": 0.00028047646438601867, "loss": 4.9546, "mean_token_accuracy": 0.23006391227245332, "num_tokens": 115211281.0, "step": 50300 }, { "entropy": 5.883242273330689, "epoch": 4.972815342032424, "grad_norm": 1.2890625, "learning_rate": 0.0002804411847913567, "loss": 5.026, "mean_token_accuracy": 0.22225152850151061, "num_tokens": 115223194.0, "step": 50305 }, { "entropy": 5.80102949142456, "epoch": 4.973309608540926, "grad_norm": 1.2890625, "learning_rate": 0.00028040590506284076, "loss": 4.9049, "mean_token_accuracy": 0.22802323549985887, "num_tokens": 115233919.0, "step": 50310 }, { "entropy": 5.882370281219482, "epoch": 4.973803875049427, "grad_norm": 1.28125, "learning_rate": 0.0002803706252013387, "loss": 5.0482, "mean_token_accuracy": 0.223785500228405, "num_tokens": 115246245.0, "step": 50315 }, { "entropy": 5.753377103805542, "epoch": 4.974298141557928, "grad_norm": 1.4296875, "learning_rate": 0.0002803353452077185, "loss": 4.8445, "mean_token_accuracy": 0.24095330238342286, "num_tokens": 115257247.0, "step": 50320 }, { "entropy": 5.8253552436828615, "epoch": 4.974792408066429, "grad_norm": 1.2890625, "learning_rate": 0.0002803000650828479, "loss": 4.9763, "mean_token_accuracy": 0.23062942624092103, "num_tokens": 115268962.0, "step": 50325 }, { "entropy": 5.7928262710571286, "epoch": 4.975286674574931, "grad_norm": 1.3125, "learning_rate": 0.00028026478482759485, "loss": 4.8955, "mean_token_accuracy": 0.23038111478090287, "num_tokens": 115281034.0, "step": 50330 }, { "entropy": 5.811640977859497, "epoch": 4.975780941083432, "grad_norm": 1.34375, "learning_rate": 0.0002802295044428274, "loss": 4.989, "mean_token_accuracy": 0.2286304324865341, "num_tokens": 115292904.0, "step": 50335 }, { "entropy": 5.863275480270386, "epoch": 4.976275207591933, "grad_norm": 1.328125, "learning_rate": 0.0002801942239294133, "loss": 4.9547, "mean_token_accuracy": 0.22226293236017228, "num_tokens": 115304723.0, "step": 50340 }, { "entropy": 5.795854282379151, "epoch": 4.9767694741004345, "grad_norm": 1.34375, "learning_rate": 0.0002801589432882204, "loss": 4.9765, "mean_token_accuracy": 0.22963757514953614, "num_tokens": 115316106.0, "step": 50345 }, { "entropy": 5.79200553894043, "epoch": 4.977263740608937, "grad_norm": 1.265625, "learning_rate": 0.00028012366252011674, "loss": 4.9415, "mean_token_accuracy": 0.2274552971124649, "num_tokens": 115328981.0, "step": 50350 }, { "entropy": 5.87086033821106, "epoch": 4.977758007117438, "grad_norm": 1.328125, "learning_rate": 0.0002800883816259702, "loss": 4.9905, "mean_token_accuracy": 0.22318440824747085, "num_tokens": 115340655.0, "step": 50355 }, { "entropy": 5.707351016998291, "epoch": 4.978252273625939, "grad_norm": 1.3359375, "learning_rate": 0.00028005310060664866, "loss": 4.8143, "mean_token_accuracy": 0.24641534239053725, "num_tokens": 115352130.0, "step": 50360 }, { "entropy": 5.759663867950439, "epoch": 4.97874654013444, "grad_norm": 1.34375, "learning_rate": 0.0002800178194630201, "loss": 4.9147, "mean_token_accuracy": 0.22972965091466904, "num_tokens": 115363419.0, "step": 50365 }, { "entropy": 5.797353982925415, "epoch": 4.979240806642942, "grad_norm": 1.3828125, "learning_rate": 0.00027998253819595234, "loss": 4.8559, "mean_token_accuracy": 0.23890891522169114, "num_tokens": 115374008.0, "step": 50370 }, { "entropy": 5.840556192398071, "epoch": 4.979735073151443, "grad_norm": 1.328125, "learning_rate": 0.00027994725680631336, "loss": 4.969, "mean_token_accuracy": 0.2232537493109703, "num_tokens": 115385829.0, "step": 50375 }, { "entropy": 5.776134586334228, "epoch": 4.980229339659944, "grad_norm": 1.5546875, "learning_rate": 0.0002799119752949712, "loss": 4.9171, "mean_token_accuracy": 0.22979263812303544, "num_tokens": 115396747.0, "step": 50380 }, { "entropy": 5.770176029205322, "epoch": 4.980723606168446, "grad_norm": 1.3046875, "learning_rate": 0.00027987669366279363, "loss": 4.8846, "mean_token_accuracy": 0.23460711985826493, "num_tokens": 115407436.0, "step": 50385 }, { "entropy": 5.820124626159668, "epoch": 4.981217872676948, "grad_norm": 1.296875, "learning_rate": 0.0002798414119106487, "loss": 4.9435, "mean_token_accuracy": 0.23083589524030684, "num_tokens": 115418395.0, "step": 50390 }, { "entropy": 5.8134846687316895, "epoch": 4.981712139185449, "grad_norm": 1.40625, "learning_rate": 0.0002798061300394041, "loss": 4.899, "mean_token_accuracy": 0.23319198191165924, "num_tokens": 115428501.0, "step": 50395 }, { "entropy": 5.745656681060791, "epoch": 4.98220640569395, "grad_norm": 1.3671875, "learning_rate": 0.00027977084804992807, "loss": 4.8882, "mean_token_accuracy": 0.23176613003015517, "num_tokens": 115440557.0, "step": 50400 }, { "entropy": 5.834184360504151, "epoch": 4.982700672202451, "grad_norm": 1.390625, "learning_rate": 0.0002797355659430885, "loss": 4.9913, "mean_token_accuracy": 0.22125499099493026, "num_tokens": 115451349.0, "step": 50405 }, { "entropy": 5.841407775878906, "epoch": 4.983194938710953, "grad_norm": 1.3828125, "learning_rate": 0.0002797002837197532, "loss": 4.932, "mean_token_accuracy": 0.22379605025053023, "num_tokens": 115461816.0, "step": 50410 }, { "entropy": 5.709989547729492, "epoch": 4.983689205219454, "grad_norm": 1.3046875, "learning_rate": 0.0002796650013807902, "loss": 4.8132, "mean_token_accuracy": 0.24233080297708512, "num_tokens": 115473670.0, "step": 50415 }, { "entropy": 5.769084835052491, "epoch": 4.984183471727956, "grad_norm": 1.2265625, "learning_rate": 0.0002796297189270675, "loss": 4.9353, "mean_token_accuracy": 0.23125441670417785, "num_tokens": 115485533.0, "step": 50420 }, { "entropy": 5.753753662109375, "epoch": 4.984677738236457, "grad_norm": 1.3359375, "learning_rate": 0.00027959443635945295, "loss": 4.8606, "mean_token_accuracy": 0.23900100141763686, "num_tokens": 115497226.0, "step": 50425 }, { "entropy": 5.811904191970825, "epoch": 4.985172004744959, "grad_norm": 1.3125, "learning_rate": 0.00027955915367881444, "loss": 4.9319, "mean_token_accuracy": 0.23003616333007812, "num_tokens": 115509202.0, "step": 50430 }, { "entropy": 5.8007896900177, "epoch": 4.98566627125346, "grad_norm": 1.4921875, "learning_rate": 0.0002795238708860202, "loss": 4.9408, "mean_token_accuracy": 0.23013546466827392, "num_tokens": 115520548.0, "step": 50435 }, { "entropy": 5.73655686378479, "epoch": 4.986160537761961, "grad_norm": 1.3203125, "learning_rate": 0.00027948858798193803, "loss": 4.8741, "mean_token_accuracy": 0.23425007313489915, "num_tokens": 115532016.0, "step": 50440 }, { "entropy": 5.814308404922485, "epoch": 4.986654804270462, "grad_norm": 1.3828125, "learning_rate": 0.00027945330496743584, "loss": 4.9567, "mean_token_accuracy": 0.234225831925869, "num_tokens": 115542420.0, "step": 50445 }, { "entropy": 5.7929274559021, "epoch": 4.987149070778964, "grad_norm": 1.2578125, "learning_rate": 0.0002794180218433816, "loss": 4.8819, "mean_token_accuracy": 0.22814449220895766, "num_tokens": 115552947.0, "step": 50450 }, { "entropy": 5.776124095916748, "epoch": 4.987643337287466, "grad_norm": 1.28125, "learning_rate": 0.0002793827386106435, "loss": 4.9331, "mean_token_accuracy": 0.23522318452596663, "num_tokens": 115564564.0, "step": 50455 }, { "entropy": 5.80662088394165, "epoch": 4.988137603795967, "grad_norm": 1.3671875, "learning_rate": 0.0002793474552700892, "loss": 4.9229, "mean_token_accuracy": 0.2334411084651947, "num_tokens": 115575235.0, "step": 50460 }, { "entropy": 5.843799114227295, "epoch": 4.988631870304468, "grad_norm": 1.3671875, "learning_rate": 0.00027931217182258696, "loss": 4.989, "mean_token_accuracy": 0.22882246226072311, "num_tokens": 115587142.0, "step": 50465 }, { "entropy": 5.758025169372559, "epoch": 4.98912613681297, "grad_norm": 1.3125, "learning_rate": 0.0002792768882690045, "loss": 4.9044, "mean_token_accuracy": 0.22891243696212768, "num_tokens": 115597895.0, "step": 50470 }, { "entropy": 5.857814979553223, "epoch": 4.989620403321471, "grad_norm": 1.4140625, "learning_rate": 0.00027924160461020994, "loss": 4.9571, "mean_token_accuracy": 0.2320897176861763, "num_tokens": 115609606.0, "step": 50475 }, { "entropy": 5.747151708602905, "epoch": 4.990114669829972, "grad_norm": 1.296875, "learning_rate": 0.0002792063208470713, "loss": 4.8583, "mean_token_accuracy": 0.24255991876125335, "num_tokens": 115620280.0, "step": 50480 }, { "entropy": 5.823554754257202, "epoch": 4.990608936338473, "grad_norm": 1.359375, "learning_rate": 0.0002791710369804565, "loss": 4.94, "mean_token_accuracy": 0.23338314294815063, "num_tokens": 115631970.0, "step": 50485 }, { "entropy": 5.791849899291992, "epoch": 4.9911032028469755, "grad_norm": 1.3125, "learning_rate": 0.00027913575301123357, "loss": 4.8523, "mean_token_accuracy": 0.22632969170808792, "num_tokens": 115642186.0, "step": 50490 }, { "entropy": 5.754032802581787, "epoch": 4.991597469355477, "grad_norm": 1.4453125, "learning_rate": 0.0002791004689402704, "loss": 4.8641, "mean_token_accuracy": 0.2316341444849968, "num_tokens": 115653658.0, "step": 50495 }, { "entropy": 5.777803993225097, "epoch": 4.992091735863978, "grad_norm": 1.375, "learning_rate": 0.00027906518476843514, "loss": 4.8821, "mean_token_accuracy": 0.23468457013368607, "num_tokens": 115665517.0, "step": 50500 }, { "entropy": 5.784101486206055, "epoch": 4.992586002372479, "grad_norm": 1.28125, "learning_rate": 0.0002790299004965956, "loss": 4.9131, "mean_token_accuracy": 0.233921679854393, "num_tokens": 115677317.0, "step": 50505 }, { "entropy": 5.848688459396362, "epoch": 4.9930802688809806, "grad_norm": 1.2890625, "learning_rate": 0.00027899461612562005, "loss": 5.0241, "mean_token_accuracy": 0.2204493299126625, "num_tokens": 115689732.0, "step": 50510 }, { "entropy": 5.775991296768188, "epoch": 4.993574535389482, "grad_norm": 1.2890625, "learning_rate": 0.00027895933165637615, "loss": 4.8777, "mean_token_accuracy": 0.23720050603151321, "num_tokens": 115701660.0, "step": 50515 }, { "entropy": 5.862777900695801, "epoch": 4.994068801897983, "grad_norm": 1.46875, "learning_rate": 0.0002789240470897322, "loss": 4.9335, "mean_token_accuracy": 0.22486172318458558, "num_tokens": 115713113.0, "step": 50520 }, { "entropy": 5.7619537830352785, "epoch": 4.994563068406485, "grad_norm": 1.3359375, "learning_rate": 0.000278888762426556, "loss": 4.9028, "mean_token_accuracy": 0.23057316541671752, "num_tokens": 115725613.0, "step": 50525 }, { "entropy": 5.7636620044708256, "epoch": 4.9950573349149865, "grad_norm": 1.2890625, "learning_rate": 0.0002788534776677157, "loss": 4.9216, "mean_token_accuracy": 0.2327973112463951, "num_tokens": 115737680.0, "step": 50530 }, { "entropy": 5.77488899230957, "epoch": 4.995551601423488, "grad_norm": 1.359375, "learning_rate": 0.0002788181928140792, "loss": 4.9283, "mean_token_accuracy": 0.23227963000535964, "num_tokens": 115747847.0, "step": 50535 }, { "entropy": 5.801711511611939, "epoch": 4.996045867931989, "grad_norm": 1.359375, "learning_rate": 0.00027878290786651454, "loss": 4.9864, "mean_token_accuracy": 0.2283879041671753, "num_tokens": 115758679.0, "step": 50540 }, { "entropy": 5.896848678588867, "epoch": 4.99654013444049, "grad_norm": 1.140625, "learning_rate": 0.0002787476228258898, "loss": 5.004, "mean_token_accuracy": 0.2216818302869797, "num_tokens": 115769496.0, "step": 50545 }, { "entropy": 5.799694347381592, "epoch": 4.9970344009489915, "grad_norm": 1.4375, "learning_rate": 0.000278712337693073, "loss": 4.8992, "mean_token_accuracy": 0.23330094665288925, "num_tokens": 115781422.0, "step": 50550 }, { "entropy": 5.833764219284058, "epoch": 4.997528667457493, "grad_norm": 1.3203125, "learning_rate": 0.0002786770524689321, "loss": 5.0305, "mean_token_accuracy": 0.22634673863649368, "num_tokens": 115792612.0, "step": 50555 }, { "entropy": 5.779271984100342, "epoch": 4.998022933965995, "grad_norm": 1.265625, "learning_rate": 0.00027864176715433517, "loss": 4.9542, "mean_token_accuracy": 0.2259409934282303, "num_tokens": 115805479.0, "step": 50560 }, { "entropy": 5.7756028175354, "epoch": 4.998517200474496, "grad_norm": 1.2890625, "learning_rate": 0.00027860648175015006, "loss": 4.8415, "mean_token_accuracy": 0.24140482693910598, "num_tokens": 115817582.0, "step": 50565 }, { "entropy": 5.804584980010986, "epoch": 4.9990114669829975, "grad_norm": 1.21875, "learning_rate": 0.0002785711962572451, "loss": 4.9351, "mean_token_accuracy": 0.23388731181621553, "num_tokens": 115829413.0, "step": 50570 }, { "entropy": 5.735230922698975, "epoch": 4.999505733491499, "grad_norm": 1.3359375, "learning_rate": 0.00027853591067648805, "loss": 4.8583, "mean_token_accuracy": 0.23544179797172546, "num_tokens": 115840247.0, "step": 50575 }, { "entropy": 5.680647850036621, "epoch": 5.0, "grad_norm": 1.625, "learning_rate": 0.0002785006250087471, "loss": 4.7671, "mean_token_accuracy": 0.24508559405803682, "num_tokens": 115851460.0, "step": 50580 }, { "entropy": 5.790252256393432, "epoch": 5.000494266508501, "grad_norm": 1.328125, "learning_rate": 0.0002784653392548902, "loss": 4.8662, "mean_token_accuracy": 0.24249252080917358, "num_tokens": 115863069.0, "step": 50585 }, { "entropy": 5.764139223098755, "epoch": 5.0009885330170025, "grad_norm": 1.34375, "learning_rate": 0.00027843005341578544, "loss": 4.8154, "mean_token_accuracy": 0.242041651904583, "num_tokens": 115875628.0, "step": 50590 }, { "entropy": 5.809588527679443, "epoch": 5.001482799525504, "grad_norm": 1.421875, "learning_rate": 0.00027839476749230084, "loss": 4.9477, "mean_token_accuracy": 0.22751238495111464, "num_tokens": 115886404.0, "step": 50595 }, { "entropy": 5.752597618103027, "epoch": 5.001977066034006, "grad_norm": 1.328125, "learning_rate": 0.0002783594814853045, "loss": 4.8199, "mean_token_accuracy": 0.2419012278318405, "num_tokens": 115897927.0, "step": 50600 }, { "entropy": 5.781824684143066, "epoch": 5.002471332542507, "grad_norm": 1.3515625, "learning_rate": 0.00027832419539566426, "loss": 4.9222, "mean_token_accuracy": 0.23271087408065796, "num_tokens": 115908908.0, "step": 50605 }, { "entropy": 5.7605384349822994, "epoch": 5.0029655990510085, "grad_norm": 1.4453125, "learning_rate": 0.00027828890922424837, "loss": 4.8484, "mean_token_accuracy": 0.23954013139009475, "num_tokens": 115919783.0, "step": 50610 }, { "entropy": 5.846383857727051, "epoch": 5.00345986555951, "grad_norm": 1.3984375, "learning_rate": 0.0002782536229719248, "loss": 4.9161, "mean_token_accuracy": 0.22566650062799454, "num_tokens": 115931939.0, "step": 50615 }, { "entropy": 5.812274026870727, "epoch": 5.003954132068011, "grad_norm": 1.4375, "learning_rate": 0.0002782183366395616, "loss": 4.9171, "mean_token_accuracy": 0.23325273692607879, "num_tokens": 115943606.0, "step": 50620 }, { "entropy": 5.636936521530151, "epoch": 5.004448398576512, "grad_norm": 1.3828125, "learning_rate": 0.0002781830502280268, "loss": 4.7947, "mean_token_accuracy": 0.24648771584033966, "num_tokens": 115955121.0, "step": 50625 }, { "entropy": 5.773365068435669, "epoch": 5.0049426650850135, "grad_norm": 1.5390625, "learning_rate": 0.00027814776373818854, "loss": 4.8971, "mean_token_accuracy": 0.2371148183941841, "num_tokens": 115965720.0, "step": 50630 }, { "entropy": 5.81085057258606, "epoch": 5.005436931593516, "grad_norm": 1.28125, "learning_rate": 0.00027811247717091466, "loss": 4.9044, "mean_token_accuracy": 0.23276356011629104, "num_tokens": 115977318.0, "step": 50635 }, { "entropy": 5.706590890884399, "epoch": 5.005931198102017, "grad_norm": 1.2734375, "learning_rate": 0.0002780771905270735, "loss": 4.816, "mean_token_accuracy": 0.24623806774616241, "num_tokens": 115989541.0, "step": 50640 }, { "entropy": 5.705309677124023, "epoch": 5.006425464610518, "grad_norm": 1.3515625, "learning_rate": 0.0002780419038075329, "loss": 4.7189, "mean_token_accuracy": 0.25526981949806216, "num_tokens": 116000227.0, "step": 50645 }, { "entropy": 5.821117162704468, "epoch": 5.0069197311190194, "grad_norm": 1.34375, "learning_rate": 0.00027800661701316096, "loss": 4.9536, "mean_token_accuracy": 0.2256518065929413, "num_tokens": 116012822.0, "step": 50650 }, { "entropy": 5.886148977279663, "epoch": 5.007413997627521, "grad_norm": 1.3984375, "learning_rate": 0.0002779713301448259, "loss": 4.9913, "mean_token_accuracy": 0.2290161594748497, "num_tokens": 116024113.0, "step": 50655 }, { "entropy": 5.764233112335205, "epoch": 5.007908264136022, "grad_norm": 1.3203125, "learning_rate": 0.00027793604320339556, "loss": 4.8759, "mean_token_accuracy": 0.24002205282449723, "num_tokens": 116035381.0, "step": 50660 }, { "entropy": 5.756098222732544, "epoch": 5.008402530644523, "grad_norm": 1.3046875, "learning_rate": 0.0002779007561897381, "loss": 4.8114, "mean_token_accuracy": 0.2432310089468956, "num_tokens": 116045673.0, "step": 50665 }, { "entropy": 5.8016825199127195, "epoch": 5.0088967971530245, "grad_norm": 1.328125, "learning_rate": 0.00027786546910472167, "loss": 4.9509, "mean_token_accuracy": 0.23153091967105865, "num_tokens": 116057010.0, "step": 50670 }, { "entropy": 5.804245376586914, "epoch": 5.009391063661527, "grad_norm": 1.328125, "learning_rate": 0.00027783018194921423, "loss": 4.9009, "mean_token_accuracy": 0.22945568859577178, "num_tokens": 116067197.0, "step": 50675 }, { "entropy": 5.785934638977051, "epoch": 5.009885330170028, "grad_norm": 1.3125, "learning_rate": 0.0002777948947240838, "loss": 4.9018, "mean_token_accuracy": 0.23685529381036757, "num_tokens": 116080409.0, "step": 50680 }, { "entropy": 5.813837146759033, "epoch": 5.010379596678529, "grad_norm": 1.3828125, "learning_rate": 0.00027775960743019857, "loss": 4.9412, "mean_token_accuracy": 0.22483682483434678, "num_tokens": 116091935.0, "step": 50685 }, { "entropy": 5.828999471664429, "epoch": 5.01087386318703, "grad_norm": 1.3203125, "learning_rate": 0.0002777243200684266, "loss": 4.9161, "mean_token_accuracy": 0.2295263960957527, "num_tokens": 116103326.0, "step": 50690 }, { "entropy": 5.735544109344483, "epoch": 5.011368129695532, "grad_norm": 1.265625, "learning_rate": 0.0002776890326396359, "loss": 4.7934, "mean_token_accuracy": 0.24206490367650985, "num_tokens": 116114711.0, "step": 50695 }, { "entropy": 5.717087125778198, "epoch": 5.011862396204033, "grad_norm": 1.296875, "learning_rate": 0.00027765374514469453, "loss": 4.8552, "mean_token_accuracy": 0.24208480417728423, "num_tokens": 116126023.0, "step": 50700 }, { "entropy": 5.760784864425659, "epoch": 5.012356662712534, "grad_norm": 1.34375, "learning_rate": 0.0002776184575844707, "loss": 4.8811, "mean_token_accuracy": 0.23942002654075623, "num_tokens": 116137847.0, "step": 50705 }, { "entropy": 5.7322986125946045, "epoch": 5.012850929221036, "grad_norm": 1.3671875, "learning_rate": 0.00027758316995983237, "loss": 4.8455, "mean_token_accuracy": 0.2383717492222786, "num_tokens": 116148635.0, "step": 50710 }, { "entropy": 5.7208997249603275, "epoch": 5.013345195729538, "grad_norm": 1.359375, "learning_rate": 0.00027754788227164767, "loss": 4.8511, "mean_token_accuracy": 0.24311988055706024, "num_tokens": 116159312.0, "step": 50715 }, { "entropy": 5.858943319320678, "epoch": 5.013839462238039, "grad_norm": 1.3984375, "learning_rate": 0.00027751259452078465, "loss": 4.9907, "mean_token_accuracy": 0.22615025341510772, "num_tokens": 116171754.0, "step": 50720 }, { "entropy": 5.857482004165649, "epoch": 5.01433372874654, "grad_norm": 1.359375, "learning_rate": 0.0002774773067081114, "loss": 4.9496, "mean_token_accuracy": 0.22050189226865768, "num_tokens": 116182691.0, "step": 50725 }, { "entropy": 5.823702573776245, "epoch": 5.014827995255041, "grad_norm": 1.2734375, "learning_rate": 0.0002774420188344961, "loss": 4.9983, "mean_token_accuracy": 0.2181121051311493, "num_tokens": 116194580.0, "step": 50730 }, { "entropy": 5.809158611297607, "epoch": 5.015322261763543, "grad_norm": 1.359375, "learning_rate": 0.0002774067309008067, "loss": 4.9455, "mean_token_accuracy": 0.22156823724508284, "num_tokens": 116205634.0, "step": 50735 }, { "entropy": 5.783737230300903, "epoch": 5.015816528272044, "grad_norm": 1.3046875, "learning_rate": 0.00027737144290791135, "loss": 4.8842, "mean_token_accuracy": 0.23593875169754028, "num_tokens": 116217246.0, "step": 50740 }, { "entropy": 5.842929887771606, "epoch": 5.016310794780546, "grad_norm": 1.2578125, "learning_rate": 0.00027733615485667825, "loss": 4.9873, "mean_token_accuracy": 0.2224092662334442, "num_tokens": 116229725.0, "step": 50745 }, { "entropy": 5.747458219528198, "epoch": 5.016805061289047, "grad_norm": 1.3828125, "learning_rate": 0.00027730086674797517, "loss": 4.8616, "mean_token_accuracy": 0.24245306700468064, "num_tokens": 116240706.0, "step": 50750 }, { "entropy": 5.791763114929199, "epoch": 5.017299327797549, "grad_norm": 1.28125, "learning_rate": 0.00027726557858267055, "loss": 4.8758, "mean_token_accuracy": 0.23667625337839127, "num_tokens": 116251750.0, "step": 50755 }, { "entropy": 5.853065919876099, "epoch": 5.01779359430605, "grad_norm": 1.3203125, "learning_rate": 0.0002772302903616323, "loss": 4.9191, "mean_token_accuracy": 0.22910383939743043, "num_tokens": 116263116.0, "step": 50760 }, { "entropy": 5.87770676612854, "epoch": 5.018287860814551, "grad_norm": 1.2421875, "learning_rate": 0.00027719500208572855, "loss": 4.9871, "mean_token_accuracy": 0.22318989038467407, "num_tokens": 116274425.0, "step": 50765 }, { "entropy": 5.781600522994995, "epoch": 5.018782127323052, "grad_norm": 1.203125, "learning_rate": 0.0002771597137558274, "loss": 4.8569, "mean_token_accuracy": 0.24118724912405015, "num_tokens": 116287535.0, "step": 50770 }, { "entropy": 5.768781423568726, "epoch": 5.019276393831554, "grad_norm": 1.3046875, "learning_rate": 0.000277124425372797, "loss": 4.9089, "mean_token_accuracy": 0.2295445665717125, "num_tokens": 116299530.0, "step": 50775 }, { "entropy": 5.761230325698852, "epoch": 5.019770660340055, "grad_norm": 1.5703125, "learning_rate": 0.0002770891369375054, "loss": 4.9352, "mean_token_accuracy": 0.2340790331363678, "num_tokens": 116311114.0, "step": 50780 }, { "entropy": 5.790247249603271, "epoch": 5.020264926848557, "grad_norm": 1.4140625, "learning_rate": 0.0002770538484508207, "loss": 4.9176, "mean_token_accuracy": 0.23376774787902832, "num_tokens": 116322149.0, "step": 50785 }, { "entropy": 5.69867730140686, "epoch": 5.020759193357058, "grad_norm": 1.34375, "learning_rate": 0.0002770185599136111, "loss": 4.8104, "mean_token_accuracy": 0.23930883705615996, "num_tokens": 116333905.0, "step": 50790 }, { "entropy": 5.842459201812744, "epoch": 5.02125345986556, "grad_norm": 1.296875, "learning_rate": 0.0002769832713267445, "loss": 4.9055, "mean_token_accuracy": 0.23321451842784882, "num_tokens": 116344415.0, "step": 50795 }, { "entropy": 5.847038221359253, "epoch": 5.021747726374061, "grad_norm": 1.3515625, "learning_rate": 0.0002769479826910891, "loss": 5.0301, "mean_token_accuracy": 0.22335854768753052, "num_tokens": 116358272.0, "step": 50800 }, { "entropy": 5.836552143096924, "epoch": 5.022241992882562, "grad_norm": 1.1796875, "learning_rate": 0.00027691269400751306, "loss": 4.9463, "mean_token_accuracy": 0.22245769649744035, "num_tokens": 116370880.0, "step": 50805 }, { "entropy": 5.799551248550415, "epoch": 5.022736259391063, "grad_norm": 1.2421875, "learning_rate": 0.00027687740527688445, "loss": 4.9103, "mean_token_accuracy": 0.23957173824310302, "num_tokens": 116382525.0, "step": 50810 }, { "entropy": 5.763939380645752, "epoch": 5.023230525899565, "grad_norm": 1.2734375, "learning_rate": 0.0002768421165000714, "loss": 4.8467, "mean_token_accuracy": 0.23824166208505632, "num_tokens": 116393810.0, "step": 50815 }, { "entropy": 5.7464484691619875, "epoch": 5.023724792408067, "grad_norm": 1.375, "learning_rate": 0.000276806827677942, "loss": 4.8797, "mean_token_accuracy": 0.2380839541554451, "num_tokens": 116405935.0, "step": 50820 }, { "entropy": 5.814163541793823, "epoch": 5.024219058916568, "grad_norm": 1.453125, "learning_rate": 0.0002767715388113643, "loss": 4.9537, "mean_token_accuracy": 0.23389680832624435, "num_tokens": 116416026.0, "step": 50825 }, { "entropy": 5.820384693145752, "epoch": 5.024713325425069, "grad_norm": 1.4453125, "learning_rate": 0.00027673624990120653, "loss": 4.9567, "mean_token_accuracy": 0.22330318242311478, "num_tokens": 116426387.0, "step": 50830 }, { "entropy": 5.851880598068237, "epoch": 5.025207591933571, "grad_norm": 1.3359375, "learning_rate": 0.00027670096094833675, "loss": 4.9937, "mean_token_accuracy": 0.22774713933467866, "num_tokens": 116438793.0, "step": 50835 }, { "entropy": 5.834858417510986, "epoch": 5.025701858442072, "grad_norm": 1.4140625, "learning_rate": 0.000276665671953623, "loss": 4.8818, "mean_token_accuracy": 0.23656534552574157, "num_tokens": 116451524.0, "step": 50840 }, { "entropy": 5.768569231033325, "epoch": 5.026196124950573, "grad_norm": 1.3125, "learning_rate": 0.00027663038291793357, "loss": 4.895, "mean_token_accuracy": 0.2359624296426773, "num_tokens": 116462856.0, "step": 50845 }, { "entropy": 5.782940530776978, "epoch": 5.026690391459074, "grad_norm": 1.5078125, "learning_rate": 0.00027659509384213635, "loss": 4.9199, "mean_token_accuracy": 0.2310938686132431, "num_tokens": 116473355.0, "step": 50850 }, { "entropy": 5.8317756175994875, "epoch": 5.0271846579675765, "grad_norm": 1.21875, "learning_rate": 0.0002765598047270996, "loss": 4.9158, "mean_token_accuracy": 0.23415391147136688, "num_tokens": 116485286.0, "step": 50855 }, { "entropy": 5.82098879814148, "epoch": 5.027678924476078, "grad_norm": 1.2734375, "learning_rate": 0.0002765245155736915, "loss": 4.9454, "mean_token_accuracy": 0.23094826936721802, "num_tokens": 116497962.0, "step": 50860 }, { "entropy": 5.7679750442504885, "epoch": 5.028173190984579, "grad_norm": 1.4765625, "learning_rate": 0.00027648922638278, "loss": 4.8679, "mean_token_accuracy": 0.2334793269634247, "num_tokens": 116510085.0, "step": 50865 }, { "entropy": 5.685627031326294, "epoch": 5.02866745749308, "grad_norm": 1.4296875, "learning_rate": 0.0002764539371552333, "loss": 4.7505, "mean_token_accuracy": 0.25049273371696473, "num_tokens": 116520547.0, "step": 50870 }, { "entropy": 5.750125360488892, "epoch": 5.029161724001582, "grad_norm": 1.2265625, "learning_rate": 0.0002764186478919195, "loss": 4.8902, "mean_token_accuracy": 0.23526969701051711, "num_tokens": 116531181.0, "step": 50875 }, { "entropy": 5.7176519393920895, "epoch": 5.029655990510083, "grad_norm": 1.328125, "learning_rate": 0.00027638335859370676, "loss": 4.8572, "mean_token_accuracy": 0.24460895955562592, "num_tokens": 116543262.0, "step": 50880 }, { "entropy": 5.780966091156006, "epoch": 5.030150257018584, "grad_norm": 1.203125, "learning_rate": 0.0002763480692614632, "loss": 4.9134, "mean_token_accuracy": 0.23494441211223602, "num_tokens": 116555942.0, "step": 50885 }, { "entropy": 5.7937249660491945, "epoch": 5.030644523527086, "grad_norm": 1.34375, "learning_rate": 0.00027631277989605704, "loss": 4.9094, "mean_token_accuracy": 0.2349216341972351, "num_tokens": 116566964.0, "step": 50890 }, { "entropy": 5.763413000106811, "epoch": 5.0311387900355875, "grad_norm": 1.4375, "learning_rate": 0.0002762774904983561, "loss": 4.8207, "mean_token_accuracy": 0.23895571380853653, "num_tokens": 116578731.0, "step": 50895 }, { "entropy": 5.775255441665649, "epoch": 5.031633056544089, "grad_norm": 1.3046875, "learning_rate": 0.00027624220106922876, "loss": 4.8862, "mean_token_accuracy": 0.2385069340467453, "num_tokens": 116590010.0, "step": 50900 }, { "entropy": 5.800702953338623, "epoch": 5.03212732305259, "grad_norm": 1.3671875, "learning_rate": 0.00027620691160954315, "loss": 4.8779, "mean_token_accuracy": 0.23042651414871215, "num_tokens": 116601477.0, "step": 50905 }, { "entropy": 5.838814210891724, "epoch": 5.032621589561091, "grad_norm": 1.296875, "learning_rate": 0.0002761716221201672, "loss": 4.9078, "mean_token_accuracy": 0.2336578533053398, "num_tokens": 116612543.0, "step": 50910 }, { "entropy": 5.763749599456787, "epoch": 5.0331158560695926, "grad_norm": 1.3046875, "learning_rate": 0.0002761363326019693, "loss": 5.0075, "mean_token_accuracy": 0.23233336061239243, "num_tokens": 116626754.0, "step": 50915 }, { "entropy": 5.7157008171081545, "epoch": 5.033610122578094, "grad_norm": 1.3671875, "learning_rate": 0.0002761010430558173, "loss": 4.8178, "mean_token_accuracy": 0.24412799179553984, "num_tokens": 116636486.0, "step": 50920 }, { "entropy": 5.796712589263916, "epoch": 5.034104389086595, "grad_norm": 1.515625, "learning_rate": 0.0002760657534825796, "loss": 4.9187, "mean_token_accuracy": 0.23088960349559784, "num_tokens": 116647455.0, "step": 50925 }, { "entropy": 5.8264930725097654, "epoch": 5.034598655595097, "grad_norm": 1.3984375, "learning_rate": 0.00027603046388312416, "loss": 4.9446, "mean_token_accuracy": 0.22876252979040146, "num_tokens": 116659505.0, "step": 50930 }, { "entropy": 5.787563133239746, "epoch": 5.0350929221035985, "grad_norm": 1.3125, "learning_rate": 0.00027599517425831916, "loss": 4.8807, "mean_token_accuracy": 0.23339801281690598, "num_tokens": 116672275.0, "step": 50935 }, { "entropy": 5.749746179580688, "epoch": 5.0355871886121, "grad_norm": 1.390625, "learning_rate": 0.00027595988460903266, "loss": 4.8473, "mean_token_accuracy": 0.234682796895504, "num_tokens": 116684834.0, "step": 50940 }, { "entropy": 5.845160961151123, "epoch": 5.036081455120601, "grad_norm": 1.4375, "learning_rate": 0.0002759245949361329, "loss": 4.9744, "mean_token_accuracy": 0.23578402847051622, "num_tokens": 116696651.0, "step": 50945 }, { "entropy": 5.764265871047973, "epoch": 5.036575721629102, "grad_norm": 1.4140625, "learning_rate": 0.0002758893052404879, "loss": 4.8225, "mean_token_accuracy": 0.2406596377491951, "num_tokens": 116707726.0, "step": 50950 }, { "entropy": 5.843689775466919, "epoch": 5.0370699881376035, "grad_norm": 1.2890625, "learning_rate": 0.0002758540155229659, "loss": 4.9886, "mean_token_accuracy": 0.22216079384088516, "num_tokens": 116720014.0, "step": 50955 }, { "entropy": 5.750387573242188, "epoch": 5.037564254646105, "grad_norm": 1.359375, "learning_rate": 0.000275818725784435, "loss": 4.8278, "mean_token_accuracy": 0.2400175452232361, "num_tokens": 116731361.0, "step": 50960 }, { "entropy": 5.775577068328857, "epoch": 5.038058521154607, "grad_norm": 1.2890625, "learning_rate": 0.0002757834360257633, "loss": 4.9043, "mean_token_accuracy": 0.2347245082259178, "num_tokens": 116742962.0, "step": 50965 }, { "entropy": 5.757082319259643, "epoch": 5.038552787663108, "grad_norm": 1.28125, "learning_rate": 0.0002757481462478189, "loss": 4.8924, "mean_token_accuracy": 0.23865432292222977, "num_tokens": 116756177.0, "step": 50970 }, { "entropy": 5.783158016204834, "epoch": 5.0390470541716095, "grad_norm": 1.4453125, "learning_rate": 0.00027571285645147013, "loss": 4.8865, "mean_token_accuracy": 0.2359623685479164, "num_tokens": 116766671.0, "step": 50975 }, { "entropy": 5.774899101257324, "epoch": 5.039541320680111, "grad_norm": 1.53125, "learning_rate": 0.00027567756663758494, "loss": 4.8961, "mean_token_accuracy": 0.22883131057024003, "num_tokens": 116777815.0, "step": 50980 }, { "entropy": 5.762152051925659, "epoch": 5.040035587188612, "grad_norm": 1.40625, "learning_rate": 0.0002756422768070314, "loss": 4.8475, "mean_token_accuracy": 0.23789254873991011, "num_tokens": 116788125.0, "step": 50985 }, { "entropy": 5.815701723098755, "epoch": 5.040529853697113, "grad_norm": 1.3046875, "learning_rate": 0.00027560698696067775, "loss": 4.9605, "mean_token_accuracy": 0.22900315672159194, "num_tokens": 116800548.0, "step": 50990 }, { "entropy": 5.791468000411987, "epoch": 5.0410241202056145, "grad_norm": 1.265625, "learning_rate": 0.00027557169709939227, "loss": 4.8125, "mean_token_accuracy": 0.24385957270860673, "num_tokens": 116812807.0, "step": 50995 }, { "entropy": 5.829205083847046, "epoch": 5.041518386714117, "grad_norm": 1.4296875, "learning_rate": 0.00027553640722404284, "loss": 4.9503, "mean_token_accuracy": 0.22996021211147308, "num_tokens": 116823751.0, "step": 51000 }, { "epoch": 5.041518386714117, "eval_entropy": 5.506667784776488, "eval_loss": 4.990108489990234, "eval_mean_token_accuracy": 0.2360359296037702, "eval_num_tokens": 116823751.0, "eval_runtime": 20.5791, "eval_samples_per_second": 1579.901, "eval_steps_per_second": 197.53, "step": 51000 }, { "entropy": 5.755015087127686, "epoch": 5.042012653222618, "grad_norm": 1.328125, "learning_rate": 0.00027550111733549775, "loss": 4.8912, "mean_token_accuracy": 0.2353619173169136, "num_tokens": 116834903.0, "step": 51005 }, { "entropy": 5.756914901733398, "epoch": 5.042506919731119, "grad_norm": 1.3046875, "learning_rate": 0.00027546582743462507, "loss": 4.8477, "mean_token_accuracy": 0.23741211891174316, "num_tokens": 116846399.0, "step": 51010 }, { "entropy": 5.820778894424438, "epoch": 5.0430011862396205, "grad_norm": 1.3671875, "learning_rate": 0.00027543053752229296, "loss": 4.8768, "mean_token_accuracy": 0.23498898446559907, "num_tokens": 116858114.0, "step": 51015 }, { "entropy": 5.784293079376221, "epoch": 5.043495452748122, "grad_norm": 1.25, "learning_rate": 0.0002753952475993696, "loss": 4.9113, "mean_token_accuracy": 0.2370942622423172, "num_tokens": 116869447.0, "step": 51020 }, { "entropy": 5.754377174377441, "epoch": 5.043989719256623, "grad_norm": 1.359375, "learning_rate": 0.00027535995766672313, "loss": 4.8334, "mean_token_accuracy": 0.23920430094003678, "num_tokens": 116880527.0, "step": 51025 }, { "entropy": 5.71414852142334, "epoch": 5.044483985765124, "grad_norm": 1.4375, "learning_rate": 0.00027532466772522155, "loss": 4.8431, "mean_token_accuracy": 0.23739852756261826, "num_tokens": 116892521.0, "step": 51030 }, { "entropy": 5.785099267959595, "epoch": 5.0449782522736255, "grad_norm": 1.28125, "learning_rate": 0.000275289377775733, "loss": 4.9662, "mean_token_accuracy": 0.23111690431833268, "num_tokens": 116905032.0, "step": 51035 }, { "entropy": 5.769398593902588, "epoch": 5.045472518782128, "grad_norm": 1.2734375, "learning_rate": 0.0002752540878191259, "loss": 4.9089, "mean_token_accuracy": 0.23312829285860062, "num_tokens": 116916388.0, "step": 51040 }, { "entropy": 5.801865148544311, "epoch": 5.045966785290629, "grad_norm": 1.5, "learning_rate": 0.0002752187978562681, "loss": 4.8578, "mean_token_accuracy": 0.23967996686697007, "num_tokens": 116928825.0, "step": 51045 }, { "entropy": 5.883091020584106, "epoch": 5.04646105179913, "grad_norm": 1.3359375, "learning_rate": 0.00027518350788802794, "loss": 4.9819, "mean_token_accuracy": 0.22765196561813356, "num_tokens": 116940230.0, "step": 51050 }, { "entropy": 5.810816860198974, "epoch": 5.046955318307631, "grad_norm": 1.578125, "learning_rate": 0.00027514821791527335, "loss": 4.8819, "mean_token_accuracy": 0.2356828659772873, "num_tokens": 116951967.0, "step": 51055 }, { "entropy": 5.884723377227783, "epoch": 5.047449584816133, "grad_norm": 1.3046875, "learning_rate": 0.0002751129279388726, "loss": 5.009, "mean_token_accuracy": 0.2252824619412422, "num_tokens": 116962727.0, "step": 51060 }, { "entropy": 5.790974569320679, "epoch": 5.047943851324634, "grad_norm": 1.3515625, "learning_rate": 0.0002750776379596938, "loss": 4.8414, "mean_token_accuracy": 0.24004556834697724, "num_tokens": 116974429.0, "step": 51065 }, { "entropy": 5.7647583961486815, "epoch": 5.048438117833135, "grad_norm": 1.3984375, "learning_rate": 0.00027504234797860516, "loss": 4.9206, "mean_token_accuracy": 0.23701458275318146, "num_tokens": 116986095.0, "step": 51070 }, { "entropy": 5.764050531387329, "epoch": 5.048932384341637, "grad_norm": 1.3828125, "learning_rate": 0.0002750070579964747, "loss": 4.8604, "mean_token_accuracy": 0.24363618493080139, "num_tokens": 116997725.0, "step": 51075 }, { "entropy": 5.747545289993286, "epoch": 5.049426650850139, "grad_norm": 1.3984375, "learning_rate": 0.0002749717680141707, "loss": 4.8313, "mean_token_accuracy": 0.2449190154671669, "num_tokens": 117007764.0, "step": 51080 }, { "entropy": 5.750375843048095, "epoch": 5.04992091735864, "grad_norm": 1.2734375, "learning_rate": 0.0002749364780325611, "loss": 4.8838, "mean_token_accuracy": 0.24095782339572908, "num_tokens": 117019289.0, "step": 51085 }, { "entropy": 5.766412782669067, "epoch": 5.050415183867141, "grad_norm": 1.390625, "learning_rate": 0.0002749011880525142, "loss": 4.8932, "mean_token_accuracy": 0.23451274037361144, "num_tokens": 117030397.0, "step": 51090 }, { "entropy": 5.763336563110352, "epoch": 5.050909450375642, "grad_norm": 1.1875, "learning_rate": 0.000274865898074898, "loss": 4.8867, "mean_token_accuracy": 0.23976435214281083, "num_tokens": 117042224.0, "step": 51095 }, { "entropy": 5.825167512893676, "epoch": 5.051403716884144, "grad_norm": 1.4296875, "learning_rate": 0.00027483060810058085, "loss": 4.9442, "mean_token_accuracy": 0.23388280868530273, "num_tokens": 117053172.0, "step": 51100 }, { "entropy": 5.808302688598633, "epoch": 5.051897983392645, "grad_norm": 1.3828125, "learning_rate": 0.00027479531813043073, "loss": 4.9268, "mean_token_accuracy": 0.23059697598218917, "num_tokens": 117065171.0, "step": 51105 }, { "entropy": 5.763390588760376, "epoch": 5.052392249901147, "grad_norm": 1.3203125, "learning_rate": 0.0002747600281653158, "loss": 4.9038, "mean_token_accuracy": 0.24061799347400664, "num_tokens": 117076718.0, "step": 51110 }, { "entropy": 5.788515520095825, "epoch": 5.052886516409648, "grad_norm": 1.3046875, "learning_rate": 0.0002747247382061042, "loss": 4.9157, "mean_token_accuracy": 0.2341613695025444, "num_tokens": 117089439.0, "step": 51115 }, { "entropy": 5.8271935939788815, "epoch": 5.05338078291815, "grad_norm": 1.4453125, "learning_rate": 0.00027468944825366406, "loss": 4.9079, "mean_token_accuracy": 0.22733000665903091, "num_tokens": 117102022.0, "step": 51120 }, { "entropy": 5.786767768859863, "epoch": 5.053875049426651, "grad_norm": 1.3515625, "learning_rate": 0.00027465415830886357, "loss": 4.9048, "mean_token_accuracy": 0.23422137200832366, "num_tokens": 117113379.0, "step": 51125 }, { "entropy": 5.7811966896057125, "epoch": 5.054369315935152, "grad_norm": 1.5859375, "learning_rate": 0.0002746188683725709, "loss": 4.851, "mean_token_accuracy": 0.2377065345644951, "num_tokens": 117123859.0, "step": 51130 }, { "entropy": 5.867577028274536, "epoch": 5.054863582443653, "grad_norm": 1.4140625, "learning_rate": 0.00027458357844565407, "loss": 4.9621, "mean_token_accuracy": 0.22797959446907043, "num_tokens": 117134556.0, "step": 51135 }, { "entropy": 5.768825483322144, "epoch": 5.055357848952155, "grad_norm": 1.375, "learning_rate": 0.00027454828852898136, "loss": 4.839, "mean_token_accuracy": 0.2465412899851799, "num_tokens": 117146210.0, "step": 51140 }, { "entropy": 5.748956871032715, "epoch": 5.055852115460657, "grad_norm": 1.2109375, "learning_rate": 0.0002745129986234207, "loss": 4.8994, "mean_token_accuracy": 0.2402205228805542, "num_tokens": 117158932.0, "step": 51145 }, { "entropy": 5.7720640182495115, "epoch": 5.056346381969158, "grad_norm": 1.546875, "learning_rate": 0.00027447770872984035, "loss": 4.9323, "mean_token_accuracy": 0.22607089728116989, "num_tokens": 117170591.0, "step": 51150 }, { "entropy": 5.770310401916504, "epoch": 5.056840648477659, "grad_norm": 1.421875, "learning_rate": 0.0002744424188491085, "loss": 4.9409, "mean_token_accuracy": 0.22987632006406783, "num_tokens": 117182513.0, "step": 51155 }, { "entropy": 5.788483905792236, "epoch": 5.057334914986161, "grad_norm": 1.390625, "learning_rate": 0.00027440712898209324, "loss": 4.8643, "mean_token_accuracy": 0.23142679929733276, "num_tokens": 117193924.0, "step": 51160 }, { "entropy": 5.752580213546753, "epoch": 5.057829181494662, "grad_norm": 1.3828125, "learning_rate": 0.0002743718391296627, "loss": 4.8662, "mean_token_accuracy": 0.23860539942979814, "num_tokens": 117204309.0, "step": 51165 }, { "entropy": 5.837085962295532, "epoch": 5.058323448003163, "grad_norm": 1.3671875, "learning_rate": 0.00027433654929268504, "loss": 4.9532, "mean_token_accuracy": 0.233220411837101, "num_tokens": 117215936.0, "step": 51170 }, { "entropy": 5.735549640655518, "epoch": 5.058817714511664, "grad_norm": 1.3125, "learning_rate": 0.0002743012594720283, "loss": 4.7975, "mean_token_accuracy": 0.24481100142002105, "num_tokens": 117226392.0, "step": 51175 }, { "entropy": 5.703374242782592, "epoch": 5.059311981020166, "grad_norm": 1.375, "learning_rate": 0.0002742659696685607, "loss": 4.8227, "mean_token_accuracy": 0.24700641483068467, "num_tokens": 117238149.0, "step": 51180 }, { "entropy": 5.750212240219116, "epoch": 5.059806247528668, "grad_norm": 1.3046875, "learning_rate": 0.00027423067988315036, "loss": 4.8946, "mean_token_accuracy": 0.23320370465517043, "num_tokens": 117248686.0, "step": 51185 }, { "entropy": 5.827206230163574, "epoch": 5.060300514037169, "grad_norm": 1.2421875, "learning_rate": 0.00027419539011666545, "loss": 4.9388, "mean_token_accuracy": 0.22561368644237517, "num_tokens": 117260894.0, "step": 51190 }, { "entropy": 5.773357725143432, "epoch": 5.06079478054567, "grad_norm": 1.34375, "learning_rate": 0.00027416010036997407, "loss": 4.8991, "mean_token_accuracy": 0.24014170616865158, "num_tokens": 117272860.0, "step": 51195 }, { "entropy": 5.7768370628356935, "epoch": 5.061289047054172, "grad_norm": 1.2890625, "learning_rate": 0.00027412481064394427, "loss": 4.9092, "mean_token_accuracy": 0.2359883576631546, "num_tokens": 117285068.0, "step": 51200 }, { "entropy": 5.826574420928955, "epoch": 5.061783313562673, "grad_norm": 1.4609375, "learning_rate": 0.0002740895209394444, "loss": 4.974, "mean_token_accuracy": 0.21939457803964615, "num_tokens": 117297451.0, "step": 51205 }, { "entropy": 5.783771896362305, "epoch": 5.062277580071174, "grad_norm": 1.3984375, "learning_rate": 0.0002740542312573423, "loss": 4.8556, "mean_token_accuracy": 0.23927167057991028, "num_tokens": 117307257.0, "step": 51210 }, { "entropy": 5.775034666061401, "epoch": 5.062771846579675, "grad_norm": 1.2734375, "learning_rate": 0.0002740189415985063, "loss": 4.8754, "mean_token_accuracy": 0.23333913683891297, "num_tokens": 117317920.0, "step": 51215 }, { "entropy": 5.783985137939453, "epoch": 5.0632661130881775, "grad_norm": 1.4609375, "learning_rate": 0.0002739836519638046, "loss": 4.927, "mean_token_accuracy": 0.23144375085830687, "num_tokens": 117328858.0, "step": 51220 }, { "entropy": 5.7549608707427975, "epoch": 5.063760379596679, "grad_norm": 1.2890625, "learning_rate": 0.0002739483623541051, "loss": 4.8941, "mean_token_accuracy": 0.23410273641347884, "num_tokens": 117340155.0, "step": 51225 }, { "entropy": 5.842346143722534, "epoch": 5.06425464610518, "grad_norm": 1.21875, "learning_rate": 0.00027391307277027616, "loss": 4.9146, "mean_token_accuracy": 0.23020991086959838, "num_tokens": 117351905.0, "step": 51230 }, { "entropy": 5.863545560836792, "epoch": 5.064748912613681, "grad_norm": 1.265625, "learning_rate": 0.0002738777832131857, "loss": 4.9519, "mean_token_accuracy": 0.22844569981098176, "num_tokens": 117363415.0, "step": 51235 }, { "entropy": 5.737932777404785, "epoch": 5.065243179122183, "grad_norm": 1.3828125, "learning_rate": 0.00027384249368370194, "loss": 4.8948, "mean_token_accuracy": 0.23542826473712922, "num_tokens": 117374073.0, "step": 51240 }, { "entropy": 5.813953018188476, "epoch": 5.065737445630684, "grad_norm": 1.3828125, "learning_rate": 0.00027380720418269304, "loss": 4.9298, "mean_token_accuracy": 0.22165605723857879, "num_tokens": 117385208.0, "step": 51245 }, { "entropy": 5.817016553878784, "epoch": 5.066231712139185, "grad_norm": 1.390625, "learning_rate": 0.00027377191471102716, "loss": 4.9219, "mean_token_accuracy": 0.22853710800409316, "num_tokens": 117396218.0, "step": 51250 }, { "entropy": 5.802625465393066, "epoch": 5.066725978647687, "grad_norm": 1.3515625, "learning_rate": 0.00027373662526957235, "loss": 4.8359, "mean_token_accuracy": 0.24194348007440566, "num_tokens": 117407453.0, "step": 51255 }, { "entropy": 5.756240367889404, "epoch": 5.0672202451561885, "grad_norm": 1.2265625, "learning_rate": 0.0002737013358591967, "loss": 4.8848, "mean_token_accuracy": 0.23029125481843948, "num_tokens": 117419223.0, "step": 51260 }, { "entropy": 5.722092151641846, "epoch": 5.06771451166469, "grad_norm": 1.4765625, "learning_rate": 0.0002736660464807685, "loss": 4.8164, "mean_token_accuracy": 0.2363016724586487, "num_tokens": 117430182.0, "step": 51265 }, { "entropy": 5.81238431930542, "epoch": 5.068208778173191, "grad_norm": 1.328125, "learning_rate": 0.00027363075713515554, "loss": 4.9231, "mean_token_accuracy": 0.2234948009252548, "num_tokens": 117441006.0, "step": 51270 }, { "entropy": 5.797903823852539, "epoch": 5.068703044681692, "grad_norm": 1.3828125, "learning_rate": 0.0002735954678232263, "loss": 4.9196, "mean_token_accuracy": 0.2344592899084091, "num_tokens": 117452320.0, "step": 51275 }, { "entropy": 5.756849956512451, "epoch": 5.069197311190194, "grad_norm": 1.3203125, "learning_rate": 0.0002735601785458488, "loss": 4.8655, "mean_token_accuracy": 0.23825550973415374, "num_tokens": 117462783.0, "step": 51280 }, { "entropy": 5.897156858444214, "epoch": 5.069691577698695, "grad_norm": 1.453125, "learning_rate": 0.0002735248893038912, "loss": 4.9538, "mean_token_accuracy": 0.22331099659204484, "num_tokens": 117473078.0, "step": 51285 }, { "entropy": 5.719188117980957, "epoch": 5.070185844207196, "grad_norm": 1.296875, "learning_rate": 0.0002734896000982215, "loss": 4.7797, "mean_token_accuracy": 0.24512575417757035, "num_tokens": 117484592.0, "step": 51290 }, { "entropy": 5.726627016067505, "epoch": 5.070680110715698, "grad_norm": 1.265625, "learning_rate": 0.0002734543109297077, "loss": 4.9229, "mean_token_accuracy": 0.23180221021175385, "num_tokens": 117496039.0, "step": 51295 }, { "entropy": 5.788932132720947, "epoch": 5.0711743772241995, "grad_norm": 1.4453125, "learning_rate": 0.00027341902179921825, "loss": 4.9265, "mean_token_accuracy": 0.23673444837331772, "num_tokens": 117507284.0, "step": 51300 }, { "entropy": 5.849740219116211, "epoch": 5.071668643732701, "grad_norm": 1.359375, "learning_rate": 0.00027338373270762107, "loss": 4.9192, "mean_token_accuracy": 0.22814241498708726, "num_tokens": 117519389.0, "step": 51305 }, { "entropy": 5.803204584121704, "epoch": 5.072162910241202, "grad_norm": 1.40625, "learning_rate": 0.0002733484436557844, "loss": 4.8891, "mean_token_accuracy": 0.2370512753725052, "num_tokens": 117530727.0, "step": 51310 }, { "entropy": 5.84442458152771, "epoch": 5.072657176749703, "grad_norm": 1.46875, "learning_rate": 0.0002733131546445762, "loss": 4.9468, "mean_token_accuracy": 0.22916903346776962, "num_tokens": 117543079.0, "step": 51315 }, { "entropy": 5.835252857208252, "epoch": 5.0731514432582046, "grad_norm": 1.34375, "learning_rate": 0.00027327786567486463, "loss": 4.9305, "mean_token_accuracy": 0.2286427929997444, "num_tokens": 117555128.0, "step": 51320 }, { "entropy": 5.768091106414795, "epoch": 5.073645709766706, "grad_norm": 1.359375, "learning_rate": 0.0002732425767475178, "loss": 4.8696, "mean_token_accuracy": 0.24293849170207976, "num_tokens": 117566394.0, "step": 51325 }, { "entropy": 5.808863592147827, "epoch": 5.074139976275208, "grad_norm": 1.375, "learning_rate": 0.00027320728786340393, "loss": 4.9059, "mean_token_accuracy": 0.23259452730417252, "num_tokens": 117577247.0, "step": 51330 }, { "entropy": 5.770870971679687, "epoch": 5.074634242783709, "grad_norm": 1.3125, "learning_rate": 0.0002731719990233911, "loss": 4.9608, "mean_token_accuracy": 0.23561477959156035, "num_tokens": 117589976.0, "step": 51335 }, { "entropy": 5.791405820846558, "epoch": 5.0751285092922105, "grad_norm": 1.3984375, "learning_rate": 0.0002731367102283474, "loss": 4.9252, "mean_token_accuracy": 0.23132380694150925, "num_tokens": 117599963.0, "step": 51340 }, { "entropy": 5.723532676696777, "epoch": 5.075622775800712, "grad_norm": 1.4140625, "learning_rate": 0.00027310142147914075, "loss": 4.8256, "mean_token_accuracy": 0.239030359685421, "num_tokens": 117612396.0, "step": 51345 }, { "entropy": 5.740130376815796, "epoch": 5.076117042309213, "grad_norm": 1.421875, "learning_rate": 0.0002730661327766395, "loss": 4.8778, "mean_token_accuracy": 0.23406336903572084, "num_tokens": 117624815.0, "step": 51350 }, { "entropy": 5.821886348724365, "epoch": 5.076611308817714, "grad_norm": 1.375, "learning_rate": 0.00027303084412171166, "loss": 4.9271, "mean_token_accuracy": 0.23350560367107392, "num_tokens": 117636962.0, "step": 51355 }, { "entropy": 5.8264405727386475, "epoch": 5.0771055753262155, "grad_norm": 1.4296875, "learning_rate": 0.0002729955555152254, "loss": 4.9324, "mean_token_accuracy": 0.23494893163442612, "num_tokens": 117648484.0, "step": 51360 }, { "entropy": 5.814236068725586, "epoch": 5.077599841834718, "grad_norm": 1.3671875, "learning_rate": 0.0002729602669580488, "loss": 4.9294, "mean_token_accuracy": 0.22854012101888657, "num_tokens": 117661590.0, "step": 51365 }, { "entropy": 5.78513126373291, "epoch": 5.078094108343219, "grad_norm": 1.3359375, "learning_rate": 0.0002729249784510499, "loss": 4.8793, "mean_token_accuracy": 0.2338658258318901, "num_tokens": 117673860.0, "step": 51370 }, { "entropy": 5.790787696838379, "epoch": 5.07858837485172, "grad_norm": 1.3359375, "learning_rate": 0.00027288968999509693, "loss": 4.9694, "mean_token_accuracy": 0.22769856899976731, "num_tokens": 117686602.0, "step": 51375 }, { "entropy": 5.749928617477417, "epoch": 5.0790826413602215, "grad_norm": 1.265625, "learning_rate": 0.0002728544015910579, "loss": 4.9093, "mean_token_accuracy": 0.23692586719989778, "num_tokens": 117698267.0, "step": 51380 }, { "entropy": 5.755554580688477, "epoch": 5.079576907868723, "grad_norm": 1.3671875, "learning_rate": 0.0002728191132398008, "loss": 4.8461, "mean_token_accuracy": 0.23987818956375123, "num_tokens": 117709542.0, "step": 51385 }, { "entropy": 5.756363582611084, "epoch": 5.080071174377224, "grad_norm": 1.515625, "learning_rate": 0.000272783824942194, "loss": 4.8142, "mean_token_accuracy": 0.2448135420680046, "num_tokens": 117720413.0, "step": 51390 }, { "entropy": 5.819203948974609, "epoch": 5.080565440885725, "grad_norm": 1.5, "learning_rate": 0.00027274853669910536, "loss": 4.9663, "mean_token_accuracy": 0.23029715865850447, "num_tokens": 117732115.0, "step": 51395 }, { "entropy": 5.7345868110656735, "epoch": 5.0810597073942265, "grad_norm": 1.2734375, "learning_rate": 0.00027271324851140314, "loss": 4.8789, "mean_token_accuracy": 0.2378255009651184, "num_tokens": 117742571.0, "step": 51400 }, { "entropy": 5.825289011001587, "epoch": 5.081553973902729, "grad_norm": 1.4140625, "learning_rate": 0.00027267796037995534, "loss": 4.9736, "mean_token_accuracy": 0.2241715356707573, "num_tokens": 117755159.0, "step": 51405 }, { "entropy": 5.819095659255981, "epoch": 5.08204824041123, "grad_norm": 1.4609375, "learning_rate": 0.00027264267230563014, "loss": 4.9511, "mean_token_accuracy": 0.22886353433132173, "num_tokens": 117765482.0, "step": 51410 }, { "entropy": 5.8019555568695065, "epoch": 5.082542506919731, "grad_norm": 1.265625, "learning_rate": 0.0002726073842892954, "loss": 4.928, "mean_token_accuracy": 0.23271461129188536, "num_tokens": 117776878.0, "step": 51415 }, { "entropy": 5.742416143417358, "epoch": 5.0830367734282325, "grad_norm": 1.3359375, "learning_rate": 0.00027257209633181937, "loss": 4.8418, "mean_token_accuracy": 0.23938788920640947, "num_tokens": 117788873.0, "step": 51420 }, { "entropy": 5.7196937084198, "epoch": 5.083531039936734, "grad_norm": 1.234375, "learning_rate": 0.0002725368084340703, "loss": 4.7872, "mean_token_accuracy": 0.24716376960277558, "num_tokens": 117799497.0, "step": 51425 }, { "entropy": 5.789262390136718, "epoch": 5.084025306445235, "grad_norm": 1.375, "learning_rate": 0.0002725015205969161, "loss": 4.9387, "mean_token_accuracy": 0.22567253857851027, "num_tokens": 117810203.0, "step": 51430 }, { "entropy": 5.74295711517334, "epoch": 5.084519572953736, "grad_norm": 1.359375, "learning_rate": 0.0002724662328212248, "loss": 4.8672, "mean_token_accuracy": 0.24587636888027192, "num_tokens": 117821057.0, "step": 51435 }, { "entropy": 5.747556257247925, "epoch": 5.085013839462238, "grad_norm": 1.2578125, "learning_rate": 0.0002724309451078646, "loss": 4.8521, "mean_token_accuracy": 0.23266409039497377, "num_tokens": 117832294.0, "step": 51440 }, { "entropy": 5.81097731590271, "epoch": 5.08550810597074, "grad_norm": 1.2578125, "learning_rate": 0.0002723956574577035, "loss": 4.8777, "mean_token_accuracy": 0.23060377836227416, "num_tokens": 117842909.0, "step": 51445 }, { "entropy": 5.859164428710938, "epoch": 5.086002372479241, "grad_norm": 1.2421875, "learning_rate": 0.0002723603698716097, "loss": 5.0007, "mean_token_accuracy": 0.22439118176698686, "num_tokens": 117855881.0, "step": 51450 }, { "entropy": 5.7852214813232425, "epoch": 5.086496638987742, "grad_norm": 1.46875, "learning_rate": 0.0002723250823504513, "loss": 4.9614, "mean_token_accuracy": 0.23355901688337327, "num_tokens": 117867716.0, "step": 51455 }, { "entropy": 5.755856990814209, "epoch": 5.086990905496243, "grad_norm": 1.4140625, "learning_rate": 0.0002722897948950962, "loss": 4.8849, "mean_token_accuracy": 0.24029562175273894, "num_tokens": 117878049.0, "step": 51460 }, { "entropy": 5.883109283447266, "epoch": 5.087485172004745, "grad_norm": 1.265625, "learning_rate": 0.00027225450750641253, "loss": 5.0212, "mean_token_accuracy": 0.21799014806747435, "num_tokens": 117889593.0, "step": 51465 }, { "entropy": 5.745349454879761, "epoch": 5.087979438513246, "grad_norm": 1.625, "learning_rate": 0.0002722192201852683, "loss": 4.8763, "mean_token_accuracy": 0.23730818033218384, "num_tokens": 117900012.0, "step": 51470 }, { "entropy": 5.772338914871216, "epoch": 5.088473705021748, "grad_norm": 1.28125, "learning_rate": 0.00027218393293253185, "loss": 4.9318, "mean_token_accuracy": 0.2317038208246231, "num_tokens": 117911483.0, "step": 51475 }, { "entropy": 5.769381523132324, "epoch": 5.088967971530249, "grad_norm": 1.3828125, "learning_rate": 0.00027214864574907113, "loss": 4.9621, "mean_token_accuracy": 0.2316024348139763, "num_tokens": 117923718.0, "step": 51480 }, { "entropy": 5.778090524673462, "epoch": 5.089462238038751, "grad_norm": 1.2890625, "learning_rate": 0.0002721133586357541, "loss": 4.8687, "mean_token_accuracy": 0.23859770596027374, "num_tokens": 117936014.0, "step": 51485 }, { "entropy": 5.776889514923096, "epoch": 5.089956504547252, "grad_norm": 1.34375, "learning_rate": 0.0002720780715934488, "loss": 4.8484, "mean_token_accuracy": 0.2326500818133354, "num_tokens": 117947593.0, "step": 51490 }, { "entropy": 5.854087591171265, "epoch": 5.090450771055753, "grad_norm": 1.375, "learning_rate": 0.0002720427846230235, "loss": 4.94, "mean_token_accuracy": 0.22942851781845092, "num_tokens": 117959155.0, "step": 51495 }, { "entropy": 5.834285306930542, "epoch": 5.090945037564254, "grad_norm": 1.3671875, "learning_rate": 0.00027200749772534607, "loss": 4.9229, "mean_token_accuracy": 0.2299712911248207, "num_tokens": 117970580.0, "step": 51500 }, { "entropy": 5.777625989913941, "epoch": 5.091439304072756, "grad_norm": 1.40625, "learning_rate": 0.00027197221090128476, "loss": 4.8765, "mean_token_accuracy": 0.23451332598924637, "num_tokens": 117983026.0, "step": 51505 }, { "entropy": 5.791086483001709, "epoch": 5.091933570581258, "grad_norm": 1.4140625, "learning_rate": 0.0002719369241517075, "loss": 4.9301, "mean_token_accuracy": 0.2303038716316223, "num_tokens": 117994317.0, "step": 51510 }, { "entropy": 5.7648838520050045, "epoch": 5.092427837089759, "grad_norm": 1.296875, "learning_rate": 0.0002719016374774824, "loss": 4.8985, "mean_token_accuracy": 0.23311750143766402, "num_tokens": 118005825.0, "step": 51515 }, { "entropy": 5.831339883804321, "epoch": 5.09292210359826, "grad_norm": 1.3984375, "learning_rate": 0.0002718663508794775, "loss": 4.9314, "mean_token_accuracy": 0.23071902990341187, "num_tokens": 118017437.0, "step": 51520 }, { "entropy": 5.711911869049072, "epoch": 5.093416370106762, "grad_norm": 1.3671875, "learning_rate": 0.0002718310643585608, "loss": 4.8511, "mean_token_accuracy": 0.24188246279954911, "num_tokens": 118029714.0, "step": 51525 }, { "entropy": 5.8974226951599125, "epoch": 5.093910636615263, "grad_norm": 1.25, "learning_rate": 0.0002717957779156004, "loss": 5.0794, "mean_token_accuracy": 0.21733969151973725, "num_tokens": 118042102.0, "step": 51530 }, { "entropy": 5.870179605484009, "epoch": 5.094404903123764, "grad_norm": 1.296875, "learning_rate": 0.0002717604915514644, "loss": 4.8881, "mean_token_accuracy": 0.23331099152565002, "num_tokens": 118052985.0, "step": 51535 }, { "entropy": 5.812343692779541, "epoch": 5.094899169632265, "grad_norm": 1.3046875, "learning_rate": 0.0002717252052670208, "loss": 4.9761, "mean_token_accuracy": 0.2258494660258293, "num_tokens": 118064969.0, "step": 51540 }, { "entropy": 5.683795928955078, "epoch": 5.095393436140767, "grad_norm": 1.328125, "learning_rate": 0.0002716899190631377, "loss": 4.7496, "mean_token_accuracy": 0.24493298381567002, "num_tokens": 118076489.0, "step": 51545 }, { "entropy": 5.752049779891967, "epoch": 5.095887702649269, "grad_norm": 1.390625, "learning_rate": 0.000271654632940683, "loss": 4.8971, "mean_token_accuracy": 0.2394574910402298, "num_tokens": 118087512.0, "step": 51550 }, { "entropy": 5.848593044281006, "epoch": 5.09638196915777, "grad_norm": 1.3125, "learning_rate": 0.000271619346900525, "loss": 4.9627, "mean_token_accuracy": 0.23201024681329727, "num_tokens": 118099797.0, "step": 51555 }, { "entropy": 5.736326408386231, "epoch": 5.096876235666271, "grad_norm": 1.2890625, "learning_rate": 0.0002715840609435314, "loss": 4.8083, "mean_token_accuracy": 0.24461707323789597, "num_tokens": 118111854.0, "step": 51560 }, { "entropy": 5.802618217468262, "epoch": 5.097370502174773, "grad_norm": 1.3671875, "learning_rate": 0.0002715487750705706, "loss": 4.9575, "mean_token_accuracy": 0.22569347620010377, "num_tokens": 118123901.0, "step": 51565 }, { "entropy": 5.756728410720825, "epoch": 5.097864768683274, "grad_norm": 1.390625, "learning_rate": 0.0002715134892825104, "loss": 4.797, "mean_token_accuracy": 0.2479052349925041, "num_tokens": 118133844.0, "step": 51570 }, { "entropy": 5.769483137130737, "epoch": 5.098359035191775, "grad_norm": 1.4296875, "learning_rate": 0.0002714782035802189, "loss": 4.8848, "mean_token_accuracy": 0.23666471391916274, "num_tokens": 118145978.0, "step": 51575 }, { "entropy": 5.799629831314087, "epoch": 5.098853301700276, "grad_norm": 1.3984375, "learning_rate": 0.00027144291796456417, "loss": 4.9581, "mean_token_accuracy": 0.22932883352041245, "num_tokens": 118157532.0, "step": 51580 }, { "entropy": 5.803337717056275, "epoch": 5.0993475682087785, "grad_norm": 1.375, "learning_rate": 0.0002714076324364142, "loss": 4.931, "mean_token_accuracy": 0.22640581876039506, "num_tokens": 118168700.0, "step": 51585 }, { "entropy": 5.789723443984985, "epoch": 5.09984183471728, "grad_norm": 1.453125, "learning_rate": 0.0002713723469966369, "loss": 4.8873, "mean_token_accuracy": 0.23550939410924912, "num_tokens": 118178961.0, "step": 51590 }, { "entropy": 5.783200359344482, "epoch": 5.100336101225781, "grad_norm": 1.59375, "learning_rate": 0.0002713370616461006, "loss": 4.8798, "mean_token_accuracy": 0.23656709790229796, "num_tokens": 118189074.0, "step": 51595 }, { "entropy": 5.817804288864136, "epoch": 5.100830367734282, "grad_norm": 1.375, "learning_rate": 0.00027130177638567314, "loss": 4.9036, "mean_token_accuracy": 0.23428381830453873, "num_tokens": 118201606.0, "step": 51600 }, { "entropy": 5.795020484924317, "epoch": 5.101324634242784, "grad_norm": 1.390625, "learning_rate": 0.00027126649121622247, "loss": 4.9384, "mean_token_accuracy": 0.2288828283548355, "num_tokens": 118212645.0, "step": 51605 }, { "entropy": 5.762093782424927, "epoch": 5.101818900751285, "grad_norm": 1.3671875, "learning_rate": 0.0002712312061386168, "loss": 4.8606, "mean_token_accuracy": 0.23501413464546203, "num_tokens": 118223870.0, "step": 51610 }, { "entropy": 5.836634683609009, "epoch": 5.102313167259786, "grad_norm": 1.375, "learning_rate": 0.0002711959211537239, "loss": 4.9459, "mean_token_accuracy": 0.2303989514708519, "num_tokens": 118235144.0, "step": 51615 }, { "entropy": 5.752189826965332, "epoch": 5.102807433768288, "grad_norm": 1.359375, "learning_rate": 0.000271160636262412, "loss": 4.8579, "mean_token_accuracy": 0.23388785719871522, "num_tokens": 118246006.0, "step": 51620 }, { "entropy": 5.796044731140137, "epoch": 5.1033017002767895, "grad_norm": 1.3203125, "learning_rate": 0.00027112535146554915, "loss": 4.9118, "mean_token_accuracy": 0.23701255023479462, "num_tokens": 118258486.0, "step": 51625 }, { "entropy": 5.826635837554932, "epoch": 5.103795966785291, "grad_norm": 1.4609375, "learning_rate": 0.00027109006676400305, "loss": 4.9252, "mean_token_accuracy": 0.22975379079580308, "num_tokens": 118269266.0, "step": 51630 }, { "entropy": 5.796469068527221, "epoch": 5.104290233293792, "grad_norm": 1.390625, "learning_rate": 0.0002710547821586421, "loss": 4.9448, "mean_token_accuracy": 0.23124364167451858, "num_tokens": 118280586.0, "step": 51635 }, { "entropy": 5.737385559082031, "epoch": 5.104784499802293, "grad_norm": 1.34375, "learning_rate": 0.0002710194976503341, "loss": 4.8198, "mean_token_accuracy": 0.2418235421180725, "num_tokens": 118292463.0, "step": 51640 }, { "entropy": 5.71797661781311, "epoch": 5.105278766310795, "grad_norm": 1.4609375, "learning_rate": 0.0002709842132399469, "loss": 4.8412, "mean_token_accuracy": 0.24015462547540664, "num_tokens": 118304777.0, "step": 51645 }, { "entropy": 5.79847092628479, "epoch": 5.105773032819296, "grad_norm": 1.5234375, "learning_rate": 0.0002709489289283488, "loss": 4.9012, "mean_token_accuracy": 0.2336844816803932, "num_tokens": 118315402.0, "step": 51650 }, { "entropy": 5.786246109008789, "epoch": 5.106267299327797, "grad_norm": 1.2578125, "learning_rate": 0.00027091364471640766, "loss": 4.9075, "mean_token_accuracy": 0.23111010044813157, "num_tokens": 118328933.0, "step": 51655 }, { "entropy": 5.74150595664978, "epoch": 5.106761565836299, "grad_norm": 1.3359375, "learning_rate": 0.00027087836060499156, "loss": 4.8258, "mean_token_accuracy": 0.2404320701956749, "num_tokens": 118340724.0, "step": 51660 }, { "entropy": 5.78893404006958, "epoch": 5.1072558323448005, "grad_norm": 1.2421875, "learning_rate": 0.0002708430765949684, "loss": 4.9983, "mean_token_accuracy": 0.22240907549858094, "num_tokens": 118353524.0, "step": 51665 }, { "entropy": 5.793966484069824, "epoch": 5.107750098853302, "grad_norm": 1.3984375, "learning_rate": 0.00027080779268720616, "loss": 4.8628, "mean_token_accuracy": 0.23624544590711594, "num_tokens": 118365038.0, "step": 51670 }, { "entropy": 5.766090393066406, "epoch": 5.108244365361803, "grad_norm": 1.3203125, "learning_rate": 0.0002707725088825728, "loss": 4.8929, "mean_token_accuracy": 0.23490609377622604, "num_tokens": 118377230.0, "step": 51675 }, { "entropy": 5.811159896850586, "epoch": 5.108738631870304, "grad_norm": 1.4453125, "learning_rate": 0.00027073722518193647, "loss": 4.867, "mean_token_accuracy": 0.23770486265420915, "num_tokens": 118387407.0, "step": 51680 }, { "entropy": 5.775157165527344, "epoch": 5.109232898378806, "grad_norm": 1.34375, "learning_rate": 0.00027070194158616514, "loss": 4.8966, "mean_token_accuracy": 0.23446733951568605, "num_tokens": 118398116.0, "step": 51685 }, { "entropy": 5.737257814407348, "epoch": 5.109727164887307, "grad_norm": 1.421875, "learning_rate": 0.0002706666580961266, "loss": 4.8518, "mean_token_accuracy": 0.2353003814816475, "num_tokens": 118409486.0, "step": 51690 }, { "entropy": 5.69752779006958, "epoch": 5.110221431395809, "grad_norm": 1.4609375, "learning_rate": 0.000270631374712689, "loss": 4.8149, "mean_token_accuracy": 0.24391796737909316, "num_tokens": 118420469.0, "step": 51695 }, { "entropy": 5.77099289894104, "epoch": 5.11071569790431, "grad_norm": 1.3125, "learning_rate": 0.00027059609143672024, "loss": 4.9176, "mean_token_accuracy": 0.2394423559308052, "num_tokens": 118431506.0, "step": 51700 }, { "entropy": 5.73484845161438, "epoch": 5.1112099644128115, "grad_norm": 1.4140625, "learning_rate": 0.0002705608082690882, "loss": 4.904, "mean_token_accuracy": 0.24268007427453994, "num_tokens": 118443311.0, "step": 51705 }, { "entropy": 5.773115873336792, "epoch": 5.111704230921313, "grad_norm": 1.2578125, "learning_rate": 0.00027052552521066107, "loss": 4.8789, "mean_token_accuracy": 0.23386637717485428, "num_tokens": 118454997.0, "step": 51710 }, { "entropy": 5.759063100814819, "epoch": 5.112198497429814, "grad_norm": 1.3046875, "learning_rate": 0.0002704902422623068, "loss": 4.835, "mean_token_accuracy": 0.24104640483856202, "num_tokens": 118468145.0, "step": 51715 }, { "entropy": 5.798162841796875, "epoch": 5.112692763938315, "grad_norm": 1.2109375, "learning_rate": 0.0002704549594248932, "loss": 4.9001, "mean_token_accuracy": 0.2305876299738884, "num_tokens": 118479904.0, "step": 51720 }, { "entropy": 5.670382070541382, "epoch": 5.1131870304468166, "grad_norm": 1.3125, "learning_rate": 0.0002704196766992883, "loss": 4.7857, "mean_token_accuracy": 0.2452153041958809, "num_tokens": 118491227.0, "step": 51725 }, { "entropy": 5.761623573303223, "epoch": 5.113681296955319, "grad_norm": 1.453125, "learning_rate": 0.00027038439408636004, "loss": 4.8667, "mean_token_accuracy": 0.24027989208698272, "num_tokens": 118501910.0, "step": 51730 }, { "entropy": 5.858758640289307, "epoch": 5.11417556346382, "grad_norm": 1.3046875, "learning_rate": 0.00027034911158697634, "loss": 4.9791, "mean_token_accuracy": 0.2316924065351486, "num_tokens": 118512972.0, "step": 51735 }, { "entropy": 5.702692890167237, "epoch": 5.114669829972321, "grad_norm": 1.4375, "learning_rate": 0.0002703138292020053, "loss": 4.8811, "mean_token_accuracy": 0.23641757071018218, "num_tokens": 118523105.0, "step": 51740 }, { "entropy": 5.816646766662598, "epoch": 5.1151640964808225, "grad_norm": 1.4140625, "learning_rate": 0.00027027854693231486, "loss": 4.9871, "mean_token_accuracy": 0.22500278502702714, "num_tokens": 118532938.0, "step": 51745 }, { "entropy": 5.816492080688477, "epoch": 5.115658362989324, "grad_norm": 1.3671875, "learning_rate": 0.0002702432647787728, "loss": 4.9096, "mean_token_accuracy": 0.22594673335552215, "num_tokens": 118543863.0, "step": 51750 }, { "entropy": 5.788086795806885, "epoch": 5.116152629497825, "grad_norm": 1.40625, "learning_rate": 0.0002702079827422472, "loss": 4.9469, "mean_token_accuracy": 0.2373531311750412, "num_tokens": 118554406.0, "step": 51755 }, { "entropy": 5.782899284362793, "epoch": 5.116646896006326, "grad_norm": 1.1875, "learning_rate": 0.00027017270082360585, "loss": 4.8917, "mean_token_accuracy": 0.23370036631822586, "num_tokens": 118566881.0, "step": 51760 }, { "entropy": 5.861611318588257, "epoch": 5.117141162514828, "grad_norm": 1.2890625, "learning_rate": 0.0002701374190237169, "loss": 4.9982, "mean_token_accuracy": 0.22707634866237641, "num_tokens": 118578591.0, "step": 51765 }, { "entropy": 5.839370203018189, "epoch": 5.11763542902333, "grad_norm": 1.3046875, "learning_rate": 0.00027010213734344823, "loss": 4.9389, "mean_token_accuracy": 0.23113846480846406, "num_tokens": 118590618.0, "step": 51770 }, { "entropy": 5.884372425079346, "epoch": 5.118129695531831, "grad_norm": 1.3671875, "learning_rate": 0.00027006685578366774, "loss": 4.9946, "mean_token_accuracy": 0.2217216521501541, "num_tokens": 118603064.0, "step": 51775 }, { "entropy": 5.740394353866577, "epoch": 5.118623962040332, "grad_norm": 1.3984375, "learning_rate": 0.00027003157434524335, "loss": 4.8216, "mean_token_accuracy": 0.2463473603129387, "num_tokens": 118613604.0, "step": 51780 }, { "entropy": 5.795015525817871, "epoch": 5.1191182285488335, "grad_norm": 1.375, "learning_rate": 0.00026999629302904303, "loss": 4.8838, "mean_token_accuracy": 0.2323044091463089, "num_tokens": 118625430.0, "step": 51785 }, { "entropy": 5.704747295379638, "epoch": 5.119612495057335, "grad_norm": 1.2890625, "learning_rate": 0.00026996101183593456, "loss": 4.8746, "mean_token_accuracy": 0.2386867344379425, "num_tokens": 118636844.0, "step": 51790 }, { "entropy": 5.74528226852417, "epoch": 5.120106761565836, "grad_norm": 1.40625, "learning_rate": 0.0002699257307667861, "loss": 4.8794, "mean_token_accuracy": 0.23548623621463777, "num_tokens": 118648143.0, "step": 51795 }, { "entropy": 5.82378363609314, "epoch": 5.120601028074337, "grad_norm": 1.40625, "learning_rate": 0.00026989044982246536, "loss": 4.9603, "mean_token_accuracy": 0.22603877931833266, "num_tokens": 118659110.0, "step": 51800 }, { "entropy": 5.819825649261475, "epoch": 5.121095294582839, "grad_norm": 1.3984375, "learning_rate": 0.00026985516900384043, "loss": 4.8788, "mean_token_accuracy": 0.23614778965711594, "num_tokens": 118670641.0, "step": 51805 }, { "entropy": 5.816943502426147, "epoch": 5.121589561091341, "grad_norm": 1.3984375, "learning_rate": 0.00026981988831177914, "loss": 4.9942, "mean_token_accuracy": 0.2260827124118805, "num_tokens": 118682308.0, "step": 51810 }, { "entropy": 5.840769577026367, "epoch": 5.122083827599842, "grad_norm": 1.3203125, "learning_rate": 0.00026978460774714934, "loss": 4.9802, "mean_token_accuracy": 0.22392056584358216, "num_tokens": 118695631.0, "step": 51815 }, { "entropy": 5.757374334335327, "epoch": 5.122578094108343, "grad_norm": 1.2578125, "learning_rate": 0.00026974932731081903, "loss": 4.8796, "mean_token_accuracy": 0.23899724334478378, "num_tokens": 118706961.0, "step": 51820 }, { "entropy": 5.805899238586425, "epoch": 5.1230723606168445, "grad_norm": 1.375, "learning_rate": 0.000269714047003656, "loss": 4.8831, "mean_token_accuracy": 0.23812064230442048, "num_tokens": 118718809.0, "step": 51825 }, { "entropy": 5.7707830429077145, "epoch": 5.123566627125346, "grad_norm": 1.375, "learning_rate": 0.00026967876682652836, "loss": 4.8765, "mean_token_accuracy": 0.23799988925457, "num_tokens": 118732278.0, "step": 51830 }, { "entropy": 5.786280965805053, "epoch": 5.124060893633847, "grad_norm": 1.3984375, "learning_rate": 0.00026964348678030386, "loss": 4.9199, "mean_token_accuracy": 0.22972101271152495, "num_tokens": 118743446.0, "step": 51835 }, { "entropy": 5.8399045944213865, "epoch": 5.124555160142349, "grad_norm": 1.5, "learning_rate": 0.00026960820686585036, "loss": 4.9332, "mean_token_accuracy": 0.22787681967020035, "num_tokens": 118754220.0, "step": 51840 }, { "entropy": 5.84801139831543, "epoch": 5.12504942665085, "grad_norm": 1.4765625, "learning_rate": 0.00026957292708403594, "loss": 4.9699, "mean_token_accuracy": 0.2322448745369911, "num_tokens": 118765422.0, "step": 51845 }, { "entropy": 5.731307888031006, "epoch": 5.125543693159352, "grad_norm": 1.375, "learning_rate": 0.0002695376474357281, "loss": 4.8227, "mean_token_accuracy": 0.23956434279680253, "num_tokens": 118777244.0, "step": 51850 }, { "entropy": 5.797716236114502, "epoch": 5.126037959667853, "grad_norm": 1.328125, "learning_rate": 0.0002695023679217952, "loss": 4.8993, "mean_token_accuracy": 0.2291640043258667, "num_tokens": 118789142.0, "step": 51855 }, { "entropy": 5.843733787536621, "epoch": 5.126532226176354, "grad_norm": 1.390625, "learning_rate": 0.0002694670885431049, "loss": 4.9094, "mean_token_accuracy": 0.23270364999771118, "num_tokens": 118800697.0, "step": 51860 }, { "entropy": 5.809617948532105, "epoch": 5.127026492684855, "grad_norm": 1.375, "learning_rate": 0.00026943180930052497, "loss": 4.944, "mean_token_accuracy": 0.23590609878301622, "num_tokens": 118813200.0, "step": 51865 }, { "entropy": 5.865290737152099, "epoch": 5.127520759193357, "grad_norm": 1.1953125, "learning_rate": 0.0002693965301949234, "loss": 5.0053, "mean_token_accuracy": 0.22642103284597398, "num_tokens": 118827037.0, "step": 51870 }, { "entropy": 5.753869533538818, "epoch": 5.128015025701859, "grad_norm": 1.4296875, "learning_rate": 0.00026936125122716816, "loss": 4.8657, "mean_token_accuracy": 0.2366800546646118, "num_tokens": 118837579.0, "step": 51875 }, { "entropy": 5.812687826156616, "epoch": 5.12850929221036, "grad_norm": 1.2265625, "learning_rate": 0.0002693259723981269, "loss": 4.9071, "mean_token_accuracy": 0.23242078721523285, "num_tokens": 118849270.0, "step": 51880 }, { "entropy": 5.697208881378174, "epoch": 5.129003558718861, "grad_norm": 1.3359375, "learning_rate": 0.00026929069370866765, "loss": 4.8501, "mean_token_accuracy": 0.23358366638422012, "num_tokens": 118861521.0, "step": 51885 }, { "entropy": 5.808628511428833, "epoch": 5.129497825227363, "grad_norm": 1.4375, "learning_rate": 0.00026925541515965826, "loss": 4.8755, "mean_token_accuracy": 0.2357863187789917, "num_tokens": 118872617.0, "step": 51890 }, { "entropy": 5.833275508880615, "epoch": 5.129992091735864, "grad_norm": 1.2734375, "learning_rate": 0.0002692201367519665, "loss": 4.9145, "mean_token_accuracy": 0.23210688382387162, "num_tokens": 118884831.0, "step": 51895 }, { "entropy": 5.759375381469726, "epoch": 5.130486358244365, "grad_norm": 1.34375, "learning_rate": 0.0002691848584864603, "loss": 4.857, "mean_token_accuracy": 0.2415716230869293, "num_tokens": 118896468.0, "step": 51900 }, { "entropy": 5.719766759872437, "epoch": 5.130980624752866, "grad_norm": 1.4609375, "learning_rate": 0.0002691495803640075, "loss": 4.8038, "mean_token_accuracy": 0.2399125576019287, "num_tokens": 118907605.0, "step": 51905 }, { "entropy": 5.701514387130738, "epoch": 5.131474891261368, "grad_norm": 1.4140625, "learning_rate": 0.00026911430238547586, "loss": 4.8651, "mean_token_accuracy": 0.24075173884630202, "num_tokens": 118919767.0, "step": 51910 }, { "entropy": 5.83512396812439, "epoch": 5.13196915776987, "grad_norm": 1.296875, "learning_rate": 0.0002690790245517333, "loss": 4.9528, "mean_token_accuracy": 0.22484129369258882, "num_tokens": 118931964.0, "step": 51915 }, { "entropy": 5.769226455688477, "epoch": 5.132463424278371, "grad_norm": 1.3671875, "learning_rate": 0.0002690437468636477, "loss": 4.8429, "mean_token_accuracy": 0.23760697543621062, "num_tokens": 118943738.0, "step": 51920 }, { "entropy": 5.800049543380737, "epoch": 5.132957690786872, "grad_norm": 1.4140625, "learning_rate": 0.00026900846932208683, "loss": 4.9542, "mean_token_accuracy": 0.22608914971351624, "num_tokens": 118954700.0, "step": 51925 }, { "entropy": 5.774595594406128, "epoch": 5.133451957295374, "grad_norm": 1.515625, "learning_rate": 0.0002689731919279186, "loss": 4.9142, "mean_token_accuracy": 0.23789456188678743, "num_tokens": 118966422.0, "step": 51930 }, { "entropy": 5.794870805740357, "epoch": 5.133946223803875, "grad_norm": 1.4375, "learning_rate": 0.0002689379146820106, "loss": 4.8912, "mean_token_accuracy": 0.23002667725086212, "num_tokens": 118977166.0, "step": 51935 }, { "entropy": 5.731141233444214, "epoch": 5.134440490312376, "grad_norm": 1.4609375, "learning_rate": 0.00026890263758523104, "loss": 4.7967, "mean_token_accuracy": 0.23931180834770202, "num_tokens": 118987611.0, "step": 51940 }, { "entropy": 5.776971769332886, "epoch": 5.134934756820877, "grad_norm": 1.3359375, "learning_rate": 0.0002688673606384475, "loss": 4.9227, "mean_token_accuracy": 0.23252964913845062, "num_tokens": 118998565.0, "step": 51945 }, { "entropy": 5.839393854141235, "epoch": 5.13542902332938, "grad_norm": 1.40625, "learning_rate": 0.00026883208384252785, "loss": 4.961, "mean_token_accuracy": 0.2233155131340027, "num_tokens": 119009528.0, "step": 51950 }, { "entropy": 5.853628492355346, "epoch": 5.135923289837881, "grad_norm": 1.2421875, "learning_rate": 0.0002687968071983399, "loss": 4.9676, "mean_token_accuracy": 0.22640328705310822, "num_tokens": 119021663.0, "step": 51955 }, { "entropy": 5.858878421783447, "epoch": 5.136417556346382, "grad_norm": 1.265625, "learning_rate": 0.00026876153070675134, "loss": 4.9881, "mean_token_accuracy": 0.22769499570131302, "num_tokens": 119034357.0, "step": 51960 }, { "entropy": 5.820227527618409, "epoch": 5.136911822854883, "grad_norm": 1.4296875, "learning_rate": 0.00026872625436863006, "loss": 4.8937, "mean_token_accuracy": 0.23418477028608323, "num_tokens": 119044049.0, "step": 51965 }, { "entropy": 5.77783236503601, "epoch": 5.137406089363385, "grad_norm": 1.3359375, "learning_rate": 0.0002686909781848441, "loss": 4.8793, "mean_token_accuracy": 0.2370429053902626, "num_tokens": 119055359.0, "step": 51970 }, { "entropy": 5.755026054382324, "epoch": 5.137900355871886, "grad_norm": 1.4140625, "learning_rate": 0.00026865570215626095, "loss": 4.7959, "mean_token_accuracy": 0.2403356522321701, "num_tokens": 119065984.0, "step": 51975 }, { "entropy": 5.7757243633270265, "epoch": 5.138394622380387, "grad_norm": 1.3203125, "learning_rate": 0.00026862042628374855, "loss": 4.8661, "mean_token_accuracy": 0.23437810689210892, "num_tokens": 119077260.0, "step": 51980 }, { "entropy": 5.733433675765991, "epoch": 5.138888888888889, "grad_norm": 1.53125, "learning_rate": 0.00026858515056817463, "loss": 4.914, "mean_token_accuracy": 0.23037851452827454, "num_tokens": 119088370.0, "step": 51985 }, { "entropy": 5.78386082649231, "epoch": 5.1393831553973905, "grad_norm": 1.328125, "learning_rate": 0.000268549875010407, "loss": 4.8959, "mean_token_accuracy": 0.23075580447912217, "num_tokens": 119099566.0, "step": 51990 }, { "entropy": 5.834256792068482, "epoch": 5.139877421905892, "grad_norm": 1.421875, "learning_rate": 0.00026851459961131337, "loss": 4.9096, "mean_token_accuracy": 0.23344081044197082, "num_tokens": 119111144.0, "step": 51995 }, { "entropy": 5.778498125076294, "epoch": 5.140371688414393, "grad_norm": 1.5, "learning_rate": 0.0002684793243717617, "loss": 4.8875, "mean_token_accuracy": 0.22877756804227828, "num_tokens": 119122936.0, "step": 52000 }, { "entropy": 5.776762819290161, "epoch": 5.140865954922894, "grad_norm": 1.3671875, "learning_rate": 0.00026844404929261963, "loss": 4.9339, "mean_token_accuracy": 0.23260470032691954, "num_tokens": 119134794.0, "step": 52005 }, { "entropy": 5.75736174583435, "epoch": 5.141360221431396, "grad_norm": 1.3515625, "learning_rate": 0.0002684087743747549, "loss": 4.8785, "mean_token_accuracy": 0.23193226456642152, "num_tokens": 119146114.0, "step": 52010 }, { "entropy": 5.824868154525757, "epoch": 5.141854487939897, "grad_norm": 1.171875, "learning_rate": 0.00026837349961903546, "loss": 4.9654, "mean_token_accuracy": 0.22668658047914506, "num_tokens": 119158137.0, "step": 52015 }, { "entropy": 5.84308385848999, "epoch": 5.142348754448399, "grad_norm": 1.2734375, "learning_rate": 0.0002683382250263289, "loss": 4.9441, "mean_token_accuracy": 0.2307843506336212, "num_tokens": 119170422.0, "step": 52020 }, { "entropy": 5.69630880355835, "epoch": 5.1428430209569, "grad_norm": 1.359375, "learning_rate": 0.00026830295059750305, "loss": 4.7966, "mean_token_accuracy": 0.2432638570666313, "num_tokens": 119182250.0, "step": 52025 }, { "entropy": 5.830500793457031, "epoch": 5.1433372874654015, "grad_norm": 1.53125, "learning_rate": 0.0002682676763334256, "loss": 4.9619, "mean_token_accuracy": 0.23052581697702407, "num_tokens": 119192810.0, "step": 52030 }, { "entropy": 5.7857825756073, "epoch": 5.143831553973903, "grad_norm": 1.2578125, "learning_rate": 0.00026823240223496444, "loss": 4.8529, "mean_token_accuracy": 0.2390858858823776, "num_tokens": 119203754.0, "step": 52035 }, { "entropy": 5.76120548248291, "epoch": 5.144325820482404, "grad_norm": 1.515625, "learning_rate": 0.0002681971283029872, "loss": 4.902, "mean_token_accuracy": 0.2340383991599083, "num_tokens": 119214956.0, "step": 52040 }, { "entropy": 5.812171792984008, "epoch": 5.144820086990905, "grad_norm": 1.2890625, "learning_rate": 0.00026816185453836167, "loss": 4.8952, "mean_token_accuracy": 0.23928548991680146, "num_tokens": 119227608.0, "step": 52045 }, { "entropy": 5.837193250656128, "epoch": 5.145314353499407, "grad_norm": 1.34375, "learning_rate": 0.0002681265809419555, "loss": 4.9939, "mean_token_accuracy": 0.2248193770647049, "num_tokens": 119239700.0, "step": 52050 }, { "entropy": 5.822922706604004, "epoch": 5.145808620007908, "grad_norm": 1.2578125, "learning_rate": 0.0002680913075146366, "loss": 4.9259, "mean_token_accuracy": 0.23404424637556076, "num_tokens": 119250803.0, "step": 52055 }, { "entropy": 5.775328969955444, "epoch": 5.14630288651641, "grad_norm": 1.328125, "learning_rate": 0.00026805603425727255, "loss": 4.8786, "mean_token_accuracy": 0.23798750191926957, "num_tokens": 119261574.0, "step": 52060 }, { "entropy": 5.7581535339355465, "epoch": 5.146797153024911, "grad_norm": 1.359375, "learning_rate": 0.0002680207611707312, "loss": 4.8844, "mean_token_accuracy": 0.23909699469804763, "num_tokens": 119274558.0, "step": 52065 }, { "entropy": 5.8164139747619625, "epoch": 5.1472914195334125, "grad_norm": 1.359375, "learning_rate": 0.00026798548825588016, "loss": 4.9086, "mean_token_accuracy": 0.23062155693769454, "num_tokens": 119286262.0, "step": 52070 }, { "entropy": 5.825852108001709, "epoch": 5.147785686041914, "grad_norm": 1.5, "learning_rate": 0.0002679502155135872, "loss": 4.9988, "mean_token_accuracy": 0.23776006549596787, "num_tokens": 119297345.0, "step": 52075 }, { "entropy": 5.773509836196899, "epoch": 5.148279952550415, "grad_norm": 1.5078125, "learning_rate": 0.00026791494294472004, "loss": 4.896, "mean_token_accuracy": 0.23074910193681716, "num_tokens": 119309356.0, "step": 52080 }, { "entropy": 5.781809854507446, "epoch": 5.148774219058916, "grad_norm": 1.234375, "learning_rate": 0.00026787967055014633, "loss": 4.9063, "mean_token_accuracy": 0.23062957376241683, "num_tokens": 119321614.0, "step": 52085 }, { "entropy": 5.727697134017944, "epoch": 5.149268485567418, "grad_norm": 1.4609375, "learning_rate": 0.00026784439833073395, "loss": 4.8001, "mean_token_accuracy": 0.24458896964788437, "num_tokens": 119332568.0, "step": 52090 }, { "entropy": 5.670125150680542, "epoch": 5.14976275207592, "grad_norm": 1.34375, "learning_rate": 0.0002678091262873504, "loss": 4.7541, "mean_token_accuracy": 0.2525578305125237, "num_tokens": 119343424.0, "step": 52095 }, { "entropy": 5.754666519165039, "epoch": 5.150257018584421, "grad_norm": 1.5, "learning_rate": 0.0002677738544208635, "loss": 4.8999, "mean_token_accuracy": 0.2323012113571167, "num_tokens": 119354630.0, "step": 52100 }, { "entropy": 5.7501060485839846, "epoch": 5.150751285092922, "grad_norm": 1.3984375, "learning_rate": 0.00026773858273214087, "loss": 4.9166, "mean_token_accuracy": 0.23349232524633406, "num_tokens": 119365222.0, "step": 52105 }, { "entropy": 5.752210330963135, "epoch": 5.1512455516014235, "grad_norm": 1.3828125, "learning_rate": 0.0002677033112220501, "loss": 4.8277, "mean_token_accuracy": 0.24399359822273253, "num_tokens": 119377510.0, "step": 52110 }, { "entropy": 5.846501159667969, "epoch": 5.151739818109925, "grad_norm": 1.3984375, "learning_rate": 0.0002676680398914592, "loss": 4.9423, "mean_token_accuracy": 0.23093689233064651, "num_tokens": 119389168.0, "step": 52115 }, { "entropy": 5.791972064971924, "epoch": 5.152234084618426, "grad_norm": 1.4921875, "learning_rate": 0.0002676327687412356, "loss": 4.8536, "mean_token_accuracy": 0.23433460891246796, "num_tokens": 119399739.0, "step": 52120 }, { "entropy": 5.851007604598999, "epoch": 5.152728351126927, "grad_norm": 1.3046875, "learning_rate": 0.0002675974977722471, "loss": 4.97, "mean_token_accuracy": 0.22799548953771592, "num_tokens": 119411654.0, "step": 52125 }, { "entropy": 5.8112188339233395, "epoch": 5.153222617635429, "grad_norm": 1.28125, "learning_rate": 0.0002675622269853612, "loss": 4.979, "mean_token_accuracy": 0.2324247255921364, "num_tokens": 119423003.0, "step": 52130 }, { "entropy": 5.806789922714233, "epoch": 5.153716884143931, "grad_norm": 1.40625, "learning_rate": 0.0002675269563814457, "loss": 4.8934, "mean_token_accuracy": 0.2416821911931038, "num_tokens": 119435359.0, "step": 52135 }, { "entropy": 5.7659525871276855, "epoch": 5.154211150652432, "grad_norm": 1.4921875, "learning_rate": 0.00026749168596136813, "loss": 4.9244, "mean_token_accuracy": 0.2316432073712349, "num_tokens": 119445740.0, "step": 52140 }, { "entropy": 5.778765916824341, "epoch": 5.154705417160933, "grad_norm": 1.3984375, "learning_rate": 0.00026745641572599644, "loss": 4.9409, "mean_token_accuracy": 0.23024870008230208, "num_tokens": 119456862.0, "step": 52145 }, { "entropy": 5.820015239715576, "epoch": 5.1551996836694345, "grad_norm": 1.3828125, "learning_rate": 0.000267421145676198, "loss": 4.953, "mean_token_accuracy": 0.22794984579086303, "num_tokens": 119469405.0, "step": 52150 }, { "entropy": 5.719579076766967, "epoch": 5.155693950177936, "grad_norm": 1.453125, "learning_rate": 0.0002673858758128405, "loss": 4.8077, "mean_token_accuracy": 0.24238479435443877, "num_tokens": 119481739.0, "step": 52155 }, { "entropy": 5.7426918029785154, "epoch": 5.156188216686437, "grad_norm": 1.296875, "learning_rate": 0.00026735060613679177, "loss": 4.8735, "mean_token_accuracy": 0.23772998601198198, "num_tokens": 119494542.0, "step": 52160 }, { "entropy": 5.814143943786621, "epoch": 5.156682483194938, "grad_norm": 1.25, "learning_rate": 0.00026731533664891926, "loss": 4.9214, "mean_token_accuracy": 0.23200863152742385, "num_tokens": 119506360.0, "step": 52165 }, { "entropy": 5.885232830047608, "epoch": 5.15717674970344, "grad_norm": 1.359375, "learning_rate": 0.00026728006735009057, "loss": 5.0034, "mean_token_accuracy": 0.2238052934408188, "num_tokens": 119517401.0, "step": 52170 }, { "entropy": 5.761955118179321, "epoch": 5.157671016211942, "grad_norm": 1.4296875, "learning_rate": 0.00026724479824117355, "loss": 4.8385, "mean_token_accuracy": 0.23778898566961287, "num_tokens": 119528486.0, "step": 52175 }, { "entropy": 5.823266553878784, "epoch": 5.158165282720443, "grad_norm": 1.3203125, "learning_rate": 0.0002672095293230356, "loss": 4.9784, "mean_token_accuracy": 0.2273479089140892, "num_tokens": 119539549.0, "step": 52180 }, { "entropy": 5.778042364120483, "epoch": 5.158659549228944, "grad_norm": 1.3984375, "learning_rate": 0.00026717426059654447, "loss": 4.9017, "mean_token_accuracy": 0.23521946370601654, "num_tokens": 119550895.0, "step": 52185 }, { "entropy": 5.808334302902222, "epoch": 5.1591538157374455, "grad_norm": 1.2265625, "learning_rate": 0.0002671389920625678, "loss": 4.8802, "mean_token_accuracy": 0.2393190011382103, "num_tokens": 119561950.0, "step": 52190 }, { "entropy": 5.766501426696777, "epoch": 5.159648082245947, "grad_norm": 1.4375, "learning_rate": 0.00026710372372197306, "loss": 4.938, "mean_token_accuracy": 0.2287602096796036, "num_tokens": 119573002.0, "step": 52195 }, { "entropy": 5.791385746002197, "epoch": 5.160142348754448, "grad_norm": 1.3359375, "learning_rate": 0.000267068455575628, "loss": 4.8289, "mean_token_accuracy": 0.23940352499485015, "num_tokens": 119585056.0, "step": 52200 }, { "entropy": 5.759680509567261, "epoch": 5.16063661526295, "grad_norm": 1.4453125, "learning_rate": 0.00026703318762440003, "loss": 4.8864, "mean_token_accuracy": 0.23162442594766616, "num_tokens": 119597048.0, "step": 52205 }, { "entropy": 5.8073410987854, "epoch": 5.161130881771451, "grad_norm": 1.3515625, "learning_rate": 0.0002669979198691571, "loss": 4.935, "mean_token_accuracy": 0.23327739387750626, "num_tokens": 119609094.0, "step": 52210 }, { "entropy": 5.752017068862915, "epoch": 5.161625148279953, "grad_norm": 1.4296875, "learning_rate": 0.0002669626523107664, "loss": 4.8932, "mean_token_accuracy": 0.23307142406702042, "num_tokens": 119619598.0, "step": 52215 }, { "entropy": 5.820453548431397, "epoch": 5.162119414788454, "grad_norm": 1.3046875, "learning_rate": 0.0002669273849500958, "loss": 4.8642, "mean_token_accuracy": 0.24119096696376802, "num_tokens": 119632024.0, "step": 52220 }, { "entropy": 5.832971668243408, "epoch": 5.162613681296955, "grad_norm": 1.2265625, "learning_rate": 0.0002668921177880128, "loss": 4.9537, "mean_token_accuracy": 0.2316473349928856, "num_tokens": 119644609.0, "step": 52225 }, { "entropy": 5.8075333595275875, "epoch": 5.1631079478054565, "grad_norm": 1.234375, "learning_rate": 0.00026685685082538486, "loss": 4.9169, "mean_token_accuracy": 0.23027351945638658, "num_tokens": 119657029.0, "step": 52230 }, { "entropy": 5.778679752349854, "epoch": 5.163602214313958, "grad_norm": 1.484375, "learning_rate": 0.00026682158406307973, "loss": 4.9172, "mean_token_accuracy": 0.23953217417001724, "num_tokens": 119669104.0, "step": 52235 }, { "entropy": 5.752894687652588, "epoch": 5.16409648082246, "grad_norm": 1.375, "learning_rate": 0.00026678631750196485, "loss": 4.9114, "mean_token_accuracy": 0.23704142421483992, "num_tokens": 119679772.0, "step": 52240 }, { "entropy": 5.80510106086731, "epoch": 5.164590747330961, "grad_norm": 1.4609375, "learning_rate": 0.00026675105114290786, "loss": 4.8676, "mean_token_accuracy": 0.23960766941308975, "num_tokens": 119691481.0, "step": 52245 }, { "entropy": 5.741370820999146, "epoch": 5.165085013839462, "grad_norm": 1.4921875, "learning_rate": 0.00026671578498677637, "loss": 4.8577, "mean_token_accuracy": 0.2386803776025772, "num_tokens": 119703593.0, "step": 52250 }, { "entropy": 5.777454471588134, "epoch": 5.165579280347964, "grad_norm": 1.328125, "learning_rate": 0.0002666805190344377, "loss": 4.8753, "mean_token_accuracy": 0.2390339970588684, "num_tokens": 119715362.0, "step": 52255 }, { "entropy": 5.783180093765258, "epoch": 5.166073546856465, "grad_norm": 1.3515625, "learning_rate": 0.00026664525328675965, "loss": 4.9289, "mean_token_accuracy": 0.2284673497080803, "num_tokens": 119726975.0, "step": 52260 }, { "entropy": 5.726257848739624, "epoch": 5.166567813364966, "grad_norm": 1.3359375, "learning_rate": 0.00026660998774460964, "loss": 4.8011, "mean_token_accuracy": 0.2488056406378746, "num_tokens": 119738093.0, "step": 52265 }, { "entropy": 5.810727262496949, "epoch": 5.167062079873467, "grad_norm": 1.328125, "learning_rate": 0.00026657472240885523, "loss": 4.947, "mean_token_accuracy": 0.23611362725496293, "num_tokens": 119750136.0, "step": 52270 }, { "entropy": 5.748880910873413, "epoch": 5.16755634638197, "grad_norm": 1.28125, "learning_rate": 0.000266539457280364, "loss": 4.8313, "mean_token_accuracy": 0.2422332912683487, "num_tokens": 119760954.0, "step": 52275 }, { "entropy": 5.7187803268432615, "epoch": 5.168050612890471, "grad_norm": 1.4140625, "learning_rate": 0.0002665041923600034, "loss": 4.8228, "mean_token_accuracy": 0.23759566992521286, "num_tokens": 119771330.0, "step": 52280 }, { "entropy": 5.695650196075439, "epoch": 5.168544879398972, "grad_norm": 1.34375, "learning_rate": 0.00026646892764864096, "loss": 4.8654, "mean_token_accuracy": 0.24107057154178618, "num_tokens": 119782269.0, "step": 52285 }, { "entropy": 5.755441379547119, "epoch": 5.169039145907473, "grad_norm": 1.296875, "learning_rate": 0.00026643366314714424, "loss": 4.9433, "mean_token_accuracy": 0.22619068175554274, "num_tokens": 119793671.0, "step": 52290 }, { "entropy": 5.770061874389649, "epoch": 5.169533412415975, "grad_norm": 1.3125, "learning_rate": 0.00026639839885638075, "loss": 4.8589, "mean_token_accuracy": 0.23388723731040956, "num_tokens": 119804416.0, "step": 52295 }, { "entropy": 5.749242353439331, "epoch": 5.170027678924476, "grad_norm": 1.3984375, "learning_rate": 0.00026636313477721796, "loss": 4.8245, "mean_token_accuracy": 0.2407286658883095, "num_tokens": 119816269.0, "step": 52300 }, { "entropy": 5.766209459304809, "epoch": 5.170521945432977, "grad_norm": 1.546875, "learning_rate": 0.00026632787091052345, "loss": 4.8892, "mean_token_accuracy": 0.23497200161218643, "num_tokens": 119827899.0, "step": 52305 }, { "entropy": 5.841371822357178, "epoch": 5.171016211941478, "grad_norm": 1.4296875, "learning_rate": 0.00026629260725716464, "loss": 4.8971, "mean_token_accuracy": 0.23108644038438797, "num_tokens": 119840300.0, "step": 52310 }, { "entropy": 5.8218026638031, "epoch": 5.171510478449981, "grad_norm": 1.34375, "learning_rate": 0.000266257343818009, "loss": 4.9399, "mean_token_accuracy": 0.23020581752061844, "num_tokens": 119852260.0, "step": 52315 }, { "entropy": 5.760693311691284, "epoch": 5.172004744958482, "grad_norm": 1.34375, "learning_rate": 0.000266222080593924, "loss": 4.8804, "mean_token_accuracy": 0.23899160027503968, "num_tokens": 119864348.0, "step": 52320 }, { "entropy": 5.754494476318359, "epoch": 5.172499011466983, "grad_norm": 1.390625, "learning_rate": 0.0002661868175857773, "loss": 4.8424, "mean_token_accuracy": 0.2402345985174179, "num_tokens": 119875667.0, "step": 52325 }, { "entropy": 5.759509515762329, "epoch": 5.172993277975484, "grad_norm": 1.2421875, "learning_rate": 0.00026615155479443626, "loss": 4.8565, "mean_token_accuracy": 0.24012009501457215, "num_tokens": 119886944.0, "step": 52330 }, { "entropy": 5.772789144515992, "epoch": 5.173487544483986, "grad_norm": 1.25, "learning_rate": 0.00026611629222076825, "loss": 4.9107, "mean_token_accuracy": 0.23416221439838408, "num_tokens": 119898477.0, "step": 52335 }, { "entropy": 5.807863855361939, "epoch": 5.173981810992487, "grad_norm": 1.3046875, "learning_rate": 0.00026608102986564093, "loss": 4.9488, "mean_token_accuracy": 0.23154127448797227, "num_tokens": 119910500.0, "step": 52340 }, { "entropy": 5.736991739273071, "epoch": 5.174476077500988, "grad_norm": 1.265625, "learning_rate": 0.0002660457677299215, "loss": 4.8589, "mean_token_accuracy": 0.24088558405637742, "num_tokens": 119922493.0, "step": 52345 }, { "entropy": 5.8319010734558105, "epoch": 5.17497034400949, "grad_norm": 1.4375, "learning_rate": 0.0002660105058144777, "loss": 4.8905, "mean_token_accuracy": 0.23249326050281524, "num_tokens": 119933215.0, "step": 52350 }, { "entropy": 5.811773061752319, "epoch": 5.175464610517992, "grad_norm": 1.3046875, "learning_rate": 0.0002659752441201769, "loss": 4.9945, "mean_token_accuracy": 0.227525731921196, "num_tokens": 119945337.0, "step": 52355 }, { "entropy": 5.780213356018066, "epoch": 5.175958877026493, "grad_norm": 1.375, "learning_rate": 0.00026593998264788643, "loss": 4.8358, "mean_token_accuracy": 0.24163734316825866, "num_tokens": 119955027.0, "step": 52360 }, { "entropy": 5.826695442199707, "epoch": 5.176453143534994, "grad_norm": 1.375, "learning_rate": 0.00026590472139847375, "loss": 5.0171, "mean_token_accuracy": 0.22727564722299576, "num_tokens": 119966994.0, "step": 52365 }, { "entropy": 5.768813991546631, "epoch": 5.176947410043495, "grad_norm": 1.4453125, "learning_rate": 0.0002658694603728064, "loss": 4.85, "mean_token_accuracy": 0.2390779286623001, "num_tokens": 119977412.0, "step": 52370 }, { "entropy": 5.813506269454956, "epoch": 5.177441676551997, "grad_norm": 1.2265625, "learning_rate": 0.00026583419957175165, "loss": 4.9556, "mean_token_accuracy": 0.22832420468330383, "num_tokens": 119990088.0, "step": 52375 }, { "entropy": 5.814873838424683, "epoch": 5.177935943060498, "grad_norm": 1.3671875, "learning_rate": 0.0002657989389961771, "loss": 4.9127, "mean_token_accuracy": 0.2346550017595291, "num_tokens": 120000284.0, "step": 52380 }, { "entropy": 5.744707345962524, "epoch": 5.178430209569, "grad_norm": 1.2421875, "learning_rate": 0.00026576367864695013, "loss": 4.8556, "mean_token_accuracy": 0.2412243440747261, "num_tokens": 120011805.0, "step": 52385 }, { "entropy": 5.81412992477417, "epoch": 5.178924476077501, "grad_norm": 1.2578125, "learning_rate": 0.000265728418524938, "loss": 4.9265, "mean_token_accuracy": 0.2295692890882492, "num_tokens": 120023391.0, "step": 52390 }, { "entropy": 5.785387802124023, "epoch": 5.1794187425860025, "grad_norm": 1.3984375, "learning_rate": 0.00026569315863100824, "loss": 4.8602, "mean_token_accuracy": 0.23535608649253845, "num_tokens": 120034613.0, "step": 52395 }, { "entropy": 5.81029782295227, "epoch": 5.179913009094504, "grad_norm": 1.3515625, "learning_rate": 0.00026565789896602817, "loss": 4.9922, "mean_token_accuracy": 0.22745047509670258, "num_tokens": 120046843.0, "step": 52400 }, { "entropy": 5.829337215423584, "epoch": 5.180407275603005, "grad_norm": 1.3203125, "learning_rate": 0.0002656226395308653, "loss": 4.9619, "mean_token_accuracy": 0.22829216420650483, "num_tokens": 120058823.0, "step": 52405 }, { "entropy": 5.810755825042724, "epoch": 5.180901542111506, "grad_norm": 1.3046875, "learning_rate": 0.00026558738032638694, "loss": 4.9291, "mean_token_accuracy": 0.2341179832816124, "num_tokens": 120071082.0, "step": 52410 }, { "entropy": 5.854770994186401, "epoch": 5.181395808620008, "grad_norm": 1.2421875, "learning_rate": 0.00026555212135346044, "loss": 5.031, "mean_token_accuracy": 0.22222233265638353, "num_tokens": 120084009.0, "step": 52415 }, { "entropy": 5.769263982772827, "epoch": 5.181890075128509, "grad_norm": 1.4609375, "learning_rate": 0.00026551686261295333, "loss": 4.8919, "mean_token_accuracy": 0.23295036256313323, "num_tokens": 120094927.0, "step": 52420 }, { "entropy": 5.797933673858642, "epoch": 5.182384341637011, "grad_norm": 1.4140625, "learning_rate": 0.0002654816041057328, "loss": 4.9269, "mean_token_accuracy": 0.23214564025402068, "num_tokens": 120108343.0, "step": 52425 }, { "entropy": 5.803945589065552, "epoch": 5.182878608145512, "grad_norm": 1.421875, "learning_rate": 0.00026544634583266623, "loss": 4.9127, "mean_token_accuracy": 0.23175592720508575, "num_tokens": 120119660.0, "step": 52430 }, { "entropy": 5.795047473907471, "epoch": 5.1833728746540135, "grad_norm": 1.2890625, "learning_rate": 0.00026541108779462114, "loss": 4.8973, "mean_token_accuracy": 0.2254657492041588, "num_tokens": 120130827.0, "step": 52435 }, { "entropy": 5.8015471458435055, "epoch": 5.183867141162515, "grad_norm": 1.2890625, "learning_rate": 0.00026537582999246466, "loss": 4.8663, "mean_token_accuracy": 0.23336290717124938, "num_tokens": 120142243.0, "step": 52440 }, { "entropy": 5.697288084030151, "epoch": 5.184361407671016, "grad_norm": 1.2890625, "learning_rate": 0.0002653405724270644, "loss": 4.8074, "mean_token_accuracy": 0.2458158776164055, "num_tokens": 120153419.0, "step": 52445 }, { "entropy": 5.769218444824219, "epoch": 5.184855674179517, "grad_norm": 1.3203125, "learning_rate": 0.00026530531509928745, "loss": 4.8782, "mean_token_accuracy": 0.23883734047412872, "num_tokens": 120165622.0, "step": 52450 }, { "entropy": 5.807198715209961, "epoch": 5.185349940688019, "grad_norm": 1.2578125, "learning_rate": 0.00026527005801000133, "loss": 4.9155, "mean_token_accuracy": 0.2306995674967766, "num_tokens": 120176333.0, "step": 52455 }, { "entropy": 5.816861534118653, "epoch": 5.185844207196521, "grad_norm": 1.25, "learning_rate": 0.0002652348011600732, "loss": 4.8985, "mean_token_accuracy": 0.2344875916838646, "num_tokens": 120187910.0, "step": 52460 }, { "entropy": 5.770047664642334, "epoch": 5.186338473705022, "grad_norm": 1.34375, "learning_rate": 0.0002651995445503705, "loss": 4.8852, "mean_token_accuracy": 0.23669556230306626, "num_tokens": 120199169.0, "step": 52465 }, { "entropy": 5.790364694595337, "epoch": 5.186832740213523, "grad_norm": 1.4140625, "learning_rate": 0.00026516428818176054, "loss": 4.8445, "mean_token_accuracy": 0.23834069818258286, "num_tokens": 120209230.0, "step": 52470 }, { "entropy": 5.791821432113648, "epoch": 5.1873270067220245, "grad_norm": 1.28125, "learning_rate": 0.0002651290320551107, "loss": 4.9556, "mean_token_accuracy": 0.22904090881347655, "num_tokens": 120220681.0, "step": 52475 }, { "entropy": 5.779607820510864, "epoch": 5.187821273230526, "grad_norm": 1.265625, "learning_rate": 0.00026509377617128804, "loss": 4.9211, "mean_token_accuracy": 0.2310744047164917, "num_tokens": 120232823.0, "step": 52480 }, { "entropy": 5.810683679580689, "epoch": 5.188315539739027, "grad_norm": 1.1875, "learning_rate": 0.0002650585205311602, "loss": 4.9093, "mean_token_accuracy": 0.2327719360589981, "num_tokens": 120244319.0, "step": 52485 }, { "entropy": 5.7898133277893065, "epoch": 5.188809806247528, "grad_norm": 1.25, "learning_rate": 0.0002650232651355941, "loss": 4.8733, "mean_token_accuracy": 0.24025457948446274, "num_tokens": 120255415.0, "step": 52490 }, { "entropy": 5.772481250762939, "epoch": 5.1893040727560305, "grad_norm": 1.328125, "learning_rate": 0.00026498800998545736, "loss": 4.9021, "mean_token_accuracy": 0.23460862338542937, "num_tokens": 120266074.0, "step": 52495 }, { "entropy": 5.728386783599854, "epoch": 5.189798339264532, "grad_norm": 1.328125, "learning_rate": 0.0002649527550816171, "loss": 4.89, "mean_token_accuracy": 0.23353151232004166, "num_tokens": 120277491.0, "step": 52500 }, { "entropy": 5.760611057281494, "epoch": 5.190292605773033, "grad_norm": 1.46875, "learning_rate": 0.0002649175004249406, "loss": 4.8192, "mean_token_accuracy": 0.2410721018910408, "num_tokens": 120288190.0, "step": 52505 }, { "entropy": 5.7306712627410885, "epoch": 5.190786872281534, "grad_norm": 1.5390625, "learning_rate": 0.00026488224601629526, "loss": 4.833, "mean_token_accuracy": 0.23720658272504808, "num_tokens": 120299001.0, "step": 52510 }, { "entropy": 5.767369985580444, "epoch": 5.1912811387900355, "grad_norm": 1.34375, "learning_rate": 0.0002648469918565481, "loss": 4.8187, "mean_token_accuracy": 0.24812449067831038, "num_tokens": 120310965.0, "step": 52515 }, { "entropy": 5.753214597702026, "epoch": 5.191775405298537, "grad_norm": 1.3515625, "learning_rate": 0.00026481173794656653, "loss": 4.8619, "mean_token_accuracy": 0.23485870212316512, "num_tokens": 120322954.0, "step": 52520 }, { "entropy": 5.654851675033569, "epoch": 5.192269671807038, "grad_norm": 1.2734375, "learning_rate": 0.0002647764842872179, "loss": 4.7815, "mean_token_accuracy": 0.2452276885509491, "num_tokens": 120335131.0, "step": 52525 }, { "entropy": 5.708177280426026, "epoch": 5.19276393831554, "grad_norm": 1.203125, "learning_rate": 0.00026474123087936926, "loss": 4.8008, "mean_token_accuracy": 0.24617787599563598, "num_tokens": 120346068.0, "step": 52530 }, { "entropy": 5.7385354995727536, "epoch": 5.193258204824041, "grad_norm": 1.515625, "learning_rate": 0.0002647059777238879, "loss": 4.842, "mean_token_accuracy": 0.2427709922194481, "num_tokens": 120357781.0, "step": 52535 }, { "entropy": 5.70217456817627, "epoch": 5.193752471332543, "grad_norm": 1.5078125, "learning_rate": 0.0002646707248216412, "loss": 4.7563, "mean_token_accuracy": 0.2522758573293686, "num_tokens": 120367910.0, "step": 52540 }, { "entropy": 5.754609107971191, "epoch": 5.194246737841044, "grad_norm": 1.2421875, "learning_rate": 0.0002646354721734962, "loss": 4.8785, "mean_token_accuracy": 0.23436597287654876, "num_tokens": 120381215.0, "step": 52545 }, { "entropy": 5.826053333282471, "epoch": 5.194741004349545, "grad_norm": 1.3515625, "learning_rate": 0.0002646002197803201, "loss": 4.9672, "mean_token_accuracy": 0.23190339356660844, "num_tokens": 120392733.0, "step": 52550 }, { "entropy": 5.752792263031006, "epoch": 5.1952352708580465, "grad_norm": 1.4375, "learning_rate": 0.00026456496764298035, "loss": 4.9242, "mean_token_accuracy": 0.22858668863773346, "num_tokens": 120403668.0, "step": 52555 }, { "entropy": 5.8375904083251955, "epoch": 5.195729537366548, "grad_norm": 1.421875, "learning_rate": 0.000264529715762344, "loss": 5.0054, "mean_token_accuracy": 0.2244014024734497, "num_tokens": 120416104.0, "step": 52560 }, { "entropy": 5.7775591850280765, "epoch": 5.196223803875049, "grad_norm": 1.4140625, "learning_rate": 0.00026449446413927816, "loss": 4.8315, "mean_token_accuracy": 0.23757384568452836, "num_tokens": 120426460.0, "step": 52565 }, { "entropy": 5.795022916793823, "epoch": 5.196718070383551, "grad_norm": 1.453125, "learning_rate": 0.0002644592127746503, "loss": 4.9293, "mean_token_accuracy": 0.22576959133148194, "num_tokens": 120437236.0, "step": 52570 }, { "entropy": 5.785792493820191, "epoch": 5.197212336892052, "grad_norm": 1.390625, "learning_rate": 0.00026442396166932725, "loss": 4.8824, "mean_token_accuracy": 0.23254936784505845, "num_tokens": 120448054.0, "step": 52575 }, { "entropy": 5.775089359283447, "epoch": 5.197706603400554, "grad_norm": 1.203125, "learning_rate": 0.0002643887108241765, "loss": 4.9329, "mean_token_accuracy": 0.22964668422937393, "num_tokens": 120460284.0, "step": 52580 }, { "entropy": 5.795315408706665, "epoch": 5.198200869909055, "grad_norm": 1.2734375, "learning_rate": 0.0002643534602400651, "loss": 4.9252, "mean_token_accuracy": 0.22973159104585647, "num_tokens": 120472268.0, "step": 52585 }, { "entropy": 5.830442142486572, "epoch": 5.198695136417556, "grad_norm": 1.296875, "learning_rate": 0.0002643182099178602, "loss": 4.9559, "mean_token_accuracy": 0.23254806250333787, "num_tokens": 120483117.0, "step": 52590 }, { "entropy": 5.809105443954468, "epoch": 5.1991894029260575, "grad_norm": 1.265625, "learning_rate": 0.00026428295985842903, "loss": 4.8763, "mean_token_accuracy": 0.23150597512722015, "num_tokens": 120494493.0, "step": 52595 }, { "entropy": 5.799513101577759, "epoch": 5.199683669434559, "grad_norm": 1.3828125, "learning_rate": 0.00026424771006263863, "loss": 4.8718, "mean_token_accuracy": 0.2364787846803665, "num_tokens": 120504737.0, "step": 52600 }, { "entropy": 5.686538124084473, "epoch": 5.200177935943061, "grad_norm": 1.3828125, "learning_rate": 0.00026421246053135627, "loss": 4.8208, "mean_token_accuracy": 0.24905122816562653, "num_tokens": 120516516.0, "step": 52605 }, { "entropy": 5.712759733200073, "epoch": 5.200672202451562, "grad_norm": 1.421875, "learning_rate": 0.0002641772112654491, "loss": 4.8169, "mean_token_accuracy": 0.2359617218375206, "num_tokens": 120527327.0, "step": 52610 }, { "entropy": 5.799140977859497, "epoch": 5.201166468960063, "grad_norm": 1.4296875, "learning_rate": 0.00026414196226578416, "loss": 4.8824, "mean_token_accuracy": 0.23932477533817292, "num_tokens": 120538578.0, "step": 52615 }, { "entropy": 5.7796721935272215, "epoch": 5.201660735468565, "grad_norm": 1.34375, "learning_rate": 0.0002641067135332287, "loss": 4.8994, "mean_token_accuracy": 0.24005429148674012, "num_tokens": 120550682.0, "step": 52620 }, { "entropy": 5.68453950881958, "epoch": 5.202155001977066, "grad_norm": 1.390625, "learning_rate": 0.00026407146506864977, "loss": 4.7472, "mean_token_accuracy": 0.2489650994539261, "num_tokens": 120561110.0, "step": 52625 }, { "entropy": 5.745421361923218, "epoch": 5.202649268485567, "grad_norm": 1.40625, "learning_rate": 0.0002640362168729145, "loss": 4.8587, "mean_token_accuracy": 0.24351892173290252, "num_tokens": 120572104.0, "step": 52630 }, { "entropy": 5.75730299949646, "epoch": 5.2031435349940685, "grad_norm": 1.4453125, "learning_rate": 0.00026400096894688987, "loss": 4.8862, "mean_token_accuracy": 0.22695060670375825, "num_tokens": 120582639.0, "step": 52635 }, { "entropy": 5.773979330062867, "epoch": 5.203637801502571, "grad_norm": 1.4375, "learning_rate": 0.0002639657212914432, "loss": 4.8756, "mean_token_accuracy": 0.23909149467945098, "num_tokens": 120594615.0, "step": 52640 }, { "entropy": 5.785218715667725, "epoch": 5.204132068011072, "grad_norm": 1.3984375, "learning_rate": 0.0002639304739074415, "loss": 4.9096, "mean_token_accuracy": 0.23432474732398986, "num_tokens": 120604970.0, "step": 52645 }, { "entropy": 5.750272464752197, "epoch": 5.204626334519573, "grad_norm": 1.515625, "learning_rate": 0.0002638952267957518, "loss": 4.8702, "mean_token_accuracy": 0.23436136543750763, "num_tokens": 120616280.0, "step": 52650 }, { "entropy": 5.7475183486938475, "epoch": 5.205120601028074, "grad_norm": 1.375, "learning_rate": 0.00026385997995724135, "loss": 4.9071, "mean_token_accuracy": 0.2341076448559761, "num_tokens": 120628790.0, "step": 52655 }, { "entropy": 5.797174739837646, "epoch": 5.205614867536576, "grad_norm": 1.328125, "learning_rate": 0.00026382473339277713, "loss": 4.9405, "mean_token_accuracy": 0.22537988126277925, "num_tokens": 120639906.0, "step": 52660 }, { "entropy": 5.740252876281739, "epoch": 5.206109134045077, "grad_norm": 1.421875, "learning_rate": 0.0002637894871032261, "loss": 4.8585, "mean_token_accuracy": 0.23370161205530166, "num_tokens": 120651429.0, "step": 52665 }, { "entropy": 5.696439218521118, "epoch": 5.206603400553578, "grad_norm": 1.421875, "learning_rate": 0.00026375424108945547, "loss": 4.6946, "mean_token_accuracy": 0.24924720525741578, "num_tokens": 120662119.0, "step": 52670 }, { "entropy": 5.7125077724456785, "epoch": 5.207097667062079, "grad_norm": 1.375, "learning_rate": 0.00026371899535233216, "loss": 4.8322, "mean_token_accuracy": 0.24521962851285933, "num_tokens": 120672719.0, "step": 52675 }, { "entropy": 5.720586585998535, "epoch": 5.207591933570582, "grad_norm": 1.4296875, "learning_rate": 0.00026368374989272345, "loss": 4.9323, "mean_token_accuracy": 0.23373921364545822, "num_tokens": 120683287.0, "step": 52680 }, { "entropy": 5.755691766738892, "epoch": 5.208086200079083, "grad_norm": 1.390625, "learning_rate": 0.00026364850471149624, "loss": 4.9555, "mean_token_accuracy": 0.2326302111148834, "num_tokens": 120693867.0, "step": 52685 }, { "entropy": 5.803948974609375, "epoch": 5.208580466587584, "grad_norm": 1.203125, "learning_rate": 0.0002636132598095175, "loss": 4.9, "mean_token_accuracy": 0.23293645828962325, "num_tokens": 120706068.0, "step": 52690 }, { "entropy": 5.7815336227417, "epoch": 5.209074733096085, "grad_norm": 1.359375, "learning_rate": 0.0002635780151876544, "loss": 4.8891, "mean_token_accuracy": 0.24202115833759308, "num_tokens": 120717111.0, "step": 52695 }, { "entropy": 5.8339159965515135, "epoch": 5.209568999604587, "grad_norm": 1.34375, "learning_rate": 0.00026354277084677386, "loss": 4.9059, "mean_token_accuracy": 0.24094317406415938, "num_tokens": 120729468.0, "step": 52700 }, { "entropy": 5.829070329666138, "epoch": 5.210063266113088, "grad_norm": 1.375, "learning_rate": 0.000263507526787743, "loss": 4.9657, "mean_token_accuracy": 0.22731245160102845, "num_tokens": 120740101.0, "step": 52705 }, { "entropy": 5.803519058227539, "epoch": 5.210557532621589, "grad_norm": 1.34375, "learning_rate": 0.0002634722830114287, "loss": 4.9429, "mean_token_accuracy": 0.23000066727399826, "num_tokens": 120750250.0, "step": 52710 }, { "entropy": 5.72346076965332, "epoch": 5.211051799130091, "grad_norm": 1.40625, "learning_rate": 0.00026343703951869804, "loss": 4.8339, "mean_token_accuracy": 0.24094051420688628, "num_tokens": 120761955.0, "step": 52715 }, { "entropy": 5.711988306045532, "epoch": 5.211546065638593, "grad_norm": 1.40625, "learning_rate": 0.00026340179631041796, "loss": 4.8072, "mean_token_accuracy": 0.24470532387495042, "num_tokens": 120773660.0, "step": 52720 }, { "entropy": 5.805677032470703, "epoch": 5.212040332147094, "grad_norm": 1.3671875, "learning_rate": 0.0002633665533874555, "loss": 4.9201, "mean_token_accuracy": 0.2288750573992729, "num_tokens": 120785571.0, "step": 52725 }, { "entropy": 5.803398323059082, "epoch": 5.212534598655595, "grad_norm": 1.40625, "learning_rate": 0.0002633313107506777, "loss": 4.9718, "mean_token_accuracy": 0.23289743661880494, "num_tokens": 120799292.0, "step": 52730 }, { "entropy": 5.785973358154297, "epoch": 5.213028865164096, "grad_norm": 1.3203125, "learning_rate": 0.00026329606840095146, "loss": 4.9188, "mean_token_accuracy": 0.23506598323583602, "num_tokens": 120811839.0, "step": 52735 }, { "entropy": 5.819769191741943, "epoch": 5.213523131672598, "grad_norm": 1.4296875, "learning_rate": 0.00026326082633914373, "loss": 4.8808, "mean_token_accuracy": 0.24286891371011735, "num_tokens": 120822859.0, "step": 52740 }, { "entropy": 5.818783712387085, "epoch": 5.214017398181099, "grad_norm": 1.2578125, "learning_rate": 0.00026322558456612144, "loss": 4.9483, "mean_token_accuracy": 0.21918484419584275, "num_tokens": 120833146.0, "step": 52745 }, { "entropy": 5.8454365730285645, "epoch": 5.214511664689601, "grad_norm": 1.515625, "learning_rate": 0.00026319034308275156, "loss": 4.9414, "mean_token_accuracy": 0.23100204914808273, "num_tokens": 120843229.0, "step": 52750 }, { "entropy": 5.733302402496338, "epoch": 5.215005931198102, "grad_norm": 1.3828125, "learning_rate": 0.0002631551018899012, "loss": 4.8743, "mean_token_accuracy": 0.2432454526424408, "num_tokens": 120855374.0, "step": 52755 }, { "entropy": 5.763633298873901, "epoch": 5.215500197706604, "grad_norm": 1.2578125, "learning_rate": 0.00026311986098843715, "loss": 4.897, "mean_token_accuracy": 0.2358341783285141, "num_tokens": 120867762.0, "step": 52760 }, { "entropy": 5.798912525177002, "epoch": 5.215994464215105, "grad_norm": 1.4375, "learning_rate": 0.00026308462037922636, "loss": 4.8722, "mean_token_accuracy": 0.23197089582681657, "num_tokens": 120879235.0, "step": 52765 }, { "entropy": 5.811575031280517, "epoch": 5.216488730723606, "grad_norm": 1.359375, "learning_rate": 0.00026304938006313565, "loss": 4.908, "mean_token_accuracy": 0.23741862326860427, "num_tokens": 120890500.0, "step": 52770 }, { "entropy": 5.752939081192016, "epoch": 5.216982997232107, "grad_norm": 1.4453125, "learning_rate": 0.0002630141400410322, "loss": 5.0079, "mean_token_accuracy": 0.22500530034303665, "num_tokens": 120901812.0, "step": 52775 }, { "entropy": 5.7808174133300785, "epoch": 5.217477263740609, "grad_norm": 1.3515625, "learning_rate": 0.00026297890031378265, "loss": 4.905, "mean_token_accuracy": 0.2354174107313156, "num_tokens": 120913934.0, "step": 52780 }, { "entropy": 5.79930624961853, "epoch": 5.217971530249111, "grad_norm": 1.4375, "learning_rate": 0.00026294366088225405, "loss": 4.9072, "mean_token_accuracy": 0.22858721911907195, "num_tokens": 120924851.0, "step": 52785 }, { "entropy": 5.749112939834594, "epoch": 5.218465796757612, "grad_norm": 1.3984375, "learning_rate": 0.00026290842174731335, "loss": 4.8067, "mean_token_accuracy": 0.24057770520448685, "num_tokens": 120935986.0, "step": 52790 }, { "entropy": 5.868067789077759, "epoch": 5.218960063266113, "grad_norm": 1.4296875, "learning_rate": 0.0002628731829098272, "loss": 4.9976, "mean_token_accuracy": 0.22129117101430892, "num_tokens": 120948153.0, "step": 52795 }, { "entropy": 5.847903108596801, "epoch": 5.2194543297746145, "grad_norm": 1.3203125, "learning_rate": 0.0002628379443706627, "loss": 4.9229, "mean_token_accuracy": 0.2340480923652649, "num_tokens": 120958524.0, "step": 52800 }, { "entropy": 5.783440017700196, "epoch": 5.219948596283116, "grad_norm": 1.40625, "learning_rate": 0.00026280270613068666, "loss": 4.8904, "mean_token_accuracy": 0.23051270097494125, "num_tokens": 120970332.0, "step": 52805 }, { "entropy": 5.796902799606324, "epoch": 5.220442862791617, "grad_norm": 1.2578125, "learning_rate": 0.0002627674681907659, "loss": 4.9586, "mean_token_accuracy": 0.22956990897655488, "num_tokens": 120982315.0, "step": 52810 }, { "entropy": 5.670535612106323, "epoch": 5.220937129300118, "grad_norm": 1.421875, "learning_rate": 0.0002627322305517674, "loss": 4.7897, "mean_token_accuracy": 0.24570701867341996, "num_tokens": 120993631.0, "step": 52815 }, { "entropy": 5.743099641799927, "epoch": 5.22143139580862, "grad_norm": 1.3125, "learning_rate": 0.0002626969932145579, "loss": 4.8457, "mean_token_accuracy": 0.24059172421693803, "num_tokens": 121005392.0, "step": 52820 }, { "entropy": 5.703053188323975, "epoch": 5.221925662317122, "grad_norm": 1.46875, "learning_rate": 0.00026266175618000427, "loss": 4.7339, "mean_token_accuracy": 0.24860429465770723, "num_tokens": 121015775.0, "step": 52825 }, { "entropy": 5.811665964126587, "epoch": 5.222419928825623, "grad_norm": 1.359375, "learning_rate": 0.0002626265194489734, "loss": 4.9037, "mean_token_accuracy": 0.23336833566427231, "num_tokens": 121026635.0, "step": 52830 }, { "entropy": 5.756366729736328, "epoch": 5.222914195334124, "grad_norm": 1.4921875, "learning_rate": 0.000262591283022332, "loss": 4.8625, "mean_token_accuracy": 0.24737353920936583, "num_tokens": 121037643.0, "step": 52835 }, { "entropy": 5.853870534896851, "epoch": 5.2234084618426255, "grad_norm": 1.328125, "learning_rate": 0.00026255604690094694, "loss": 5.0181, "mean_token_accuracy": 0.22399319261312484, "num_tokens": 121049936.0, "step": 52840 }, { "entropy": 5.717159366607666, "epoch": 5.223902728351127, "grad_norm": 1.3515625, "learning_rate": 0.0002625208110856851, "loss": 4.771, "mean_token_accuracy": 0.25098422914743423, "num_tokens": 121062594.0, "step": 52845 }, { "entropy": 5.7594257354736325, "epoch": 5.224396994859628, "grad_norm": 1.4453125, "learning_rate": 0.0002624855755774133, "loss": 4.8816, "mean_token_accuracy": 0.23950533270835878, "num_tokens": 121074129.0, "step": 52850 }, { "entropy": 5.885507011413575, "epoch": 5.224891261368129, "grad_norm": 1.359375, "learning_rate": 0.0002624503403769982, "loss": 4.9987, "mean_token_accuracy": 0.22132306694984435, "num_tokens": 121085829.0, "step": 52855 }, { "entropy": 5.8054876804351805, "epoch": 5.2253855278766315, "grad_norm": 1.3203125, "learning_rate": 0.0002624151054853067, "loss": 4.9541, "mean_token_accuracy": 0.2266192153096199, "num_tokens": 121096645.0, "step": 52860 }, { "entropy": 5.770385885238648, "epoch": 5.225879794385133, "grad_norm": 1.453125, "learning_rate": 0.0002623798709032056, "loss": 4.8762, "mean_token_accuracy": 0.2361864998936653, "num_tokens": 121109236.0, "step": 52865 }, { "entropy": 5.722325420379638, "epoch": 5.226374060893634, "grad_norm": 1.375, "learning_rate": 0.0002623446366315615, "loss": 4.8687, "mean_token_accuracy": 0.2388315826654434, "num_tokens": 121121139.0, "step": 52870 }, { "entropy": 5.794505929946899, "epoch": 5.226868327402135, "grad_norm": 1.734375, "learning_rate": 0.00026230940267124136, "loss": 4.892, "mean_token_accuracy": 0.23590610921382904, "num_tokens": 121133112.0, "step": 52875 }, { "entropy": 5.788093185424804, "epoch": 5.2273625939106365, "grad_norm": 1.3671875, "learning_rate": 0.00026227416902311197, "loss": 4.8811, "mean_token_accuracy": 0.23319605737924576, "num_tokens": 121144414.0, "step": 52880 }, { "entropy": 5.742389488220215, "epoch": 5.227856860419138, "grad_norm": 1.3203125, "learning_rate": 0.00026223893568803994, "loss": 4.8539, "mean_token_accuracy": 0.236684150993824, "num_tokens": 121156742.0, "step": 52885 }, { "entropy": 5.729253911972046, "epoch": 5.228351126927639, "grad_norm": 1.328125, "learning_rate": 0.0002622037026668921, "loss": 4.8961, "mean_token_accuracy": 0.24452172219753265, "num_tokens": 121169494.0, "step": 52890 }, { "entropy": 5.838353538513184, "epoch": 5.228845393436141, "grad_norm": 1.34375, "learning_rate": 0.0002621684699605351, "loss": 5.0321, "mean_token_accuracy": 0.22803181111812593, "num_tokens": 121181700.0, "step": 52895 }, { "entropy": 5.78857011795044, "epoch": 5.2293396599446424, "grad_norm": 1.34375, "learning_rate": 0.0002621332375698357, "loss": 4.8444, "mean_token_accuracy": 0.2422074556350708, "num_tokens": 121193428.0, "step": 52900 }, { "entropy": 5.773274087905884, "epoch": 5.229833926453144, "grad_norm": 1.3671875, "learning_rate": 0.0002620980054956608, "loss": 4.8954, "mean_token_accuracy": 0.2380651742219925, "num_tokens": 121205103.0, "step": 52905 }, { "entropy": 5.79285831451416, "epoch": 5.230328192961645, "grad_norm": 1.375, "learning_rate": 0.0002620627737388768, "loss": 4.9043, "mean_token_accuracy": 0.23574793338775635, "num_tokens": 121217149.0, "step": 52910 }, { "entropy": 5.8601312160491945, "epoch": 5.230822459470146, "grad_norm": 1.375, "learning_rate": 0.0002620275423003507, "loss": 4.9804, "mean_token_accuracy": 0.23017164915800095, "num_tokens": 121228604.0, "step": 52915 }, { "entropy": 5.790221929550171, "epoch": 5.2313167259786475, "grad_norm": 1.40625, "learning_rate": 0.00026199231118094907, "loss": 4.8897, "mean_token_accuracy": 0.2373717397451401, "num_tokens": 121240290.0, "step": 52920 }, { "entropy": 5.779712915420532, "epoch": 5.231810992487149, "grad_norm": 1.265625, "learning_rate": 0.0002619570803815385, "loss": 4.8973, "mean_token_accuracy": 0.23402367830276488, "num_tokens": 121252294.0, "step": 52925 }, { "entropy": 5.822255849838257, "epoch": 5.23230525899565, "grad_norm": 1.3984375, "learning_rate": 0.00026192184990298585, "loss": 4.9429, "mean_token_accuracy": 0.23206371515989305, "num_tokens": 121263709.0, "step": 52930 }, { "entropy": 5.735537004470825, "epoch": 5.232799525504152, "grad_norm": 1.28125, "learning_rate": 0.0002618866197461577, "loss": 4.7626, "mean_token_accuracy": 0.24475300759077073, "num_tokens": 121275218.0, "step": 52935 }, { "entropy": 5.769990348815918, "epoch": 5.233293792012653, "grad_norm": 1.234375, "learning_rate": 0.00026185138991192074, "loss": 4.8284, "mean_token_accuracy": 0.2373397782444954, "num_tokens": 121287236.0, "step": 52940 }, { "entropy": 5.790617370605469, "epoch": 5.233788058521155, "grad_norm": 1.375, "learning_rate": 0.00026181616040114164, "loss": 4.8862, "mean_token_accuracy": 0.23425393104553222, "num_tokens": 121299510.0, "step": 52945 }, { "entropy": 5.762645578384399, "epoch": 5.234282325029656, "grad_norm": 1.3125, "learning_rate": 0.0002617809312146871, "loss": 4.8813, "mean_token_accuracy": 0.235842165350914, "num_tokens": 121311222.0, "step": 52950 }, { "entropy": 5.777142524719238, "epoch": 5.234776591538157, "grad_norm": 1.25, "learning_rate": 0.00026174570235342354, "loss": 4.876, "mean_token_accuracy": 0.24115837812423707, "num_tokens": 121322217.0, "step": 52955 }, { "entropy": 5.795700931549073, "epoch": 5.2352708580466585, "grad_norm": 1.421875, "learning_rate": 0.00026171047381821786, "loss": 4.9108, "mean_token_accuracy": 0.23465074002742767, "num_tokens": 121333386.0, "step": 52960 }, { "entropy": 5.744344186782837, "epoch": 5.23576512455516, "grad_norm": 1.3203125, "learning_rate": 0.0002616752456099366, "loss": 4.8731, "mean_token_accuracy": 0.235241162776947, "num_tokens": 121345492.0, "step": 52965 }, { "entropy": 5.773640489578247, "epoch": 5.236259391063662, "grad_norm": 1.3125, "learning_rate": 0.0002616400177294463, "loss": 4.8829, "mean_token_accuracy": 0.23715141415596008, "num_tokens": 121356953.0, "step": 52970 }, { "entropy": 5.796369123458862, "epoch": 5.236753657572163, "grad_norm": 1.4296875, "learning_rate": 0.0002616047901776138, "loss": 4.9193, "mean_token_accuracy": 0.23460109084844588, "num_tokens": 121368366.0, "step": 52975 }, { "entropy": 5.869020557403564, "epoch": 5.237247924080664, "grad_norm": 1.3359375, "learning_rate": 0.0002615695629553054, "loss": 4.9925, "mean_token_accuracy": 0.22700978815555573, "num_tokens": 121379541.0, "step": 52980 }, { "entropy": 5.828376388549804, "epoch": 5.237742190589166, "grad_norm": 1.4140625, "learning_rate": 0.00026153433606338774, "loss": 4.9733, "mean_token_accuracy": 0.22856339812278748, "num_tokens": 121391745.0, "step": 52985 }, { "entropy": 5.776850461959839, "epoch": 5.238236457097667, "grad_norm": 1.3046875, "learning_rate": 0.00026149910950272763, "loss": 4.8976, "mean_token_accuracy": 0.23703269213438033, "num_tokens": 121402880.0, "step": 52990 }, { "entropy": 5.834416198730469, "epoch": 5.238730723606168, "grad_norm": 1.4921875, "learning_rate": 0.00026146388327419155, "loss": 5.0187, "mean_token_accuracy": 0.22637251317501067, "num_tokens": 121414061.0, "step": 52995 }, { "entropy": 5.790109777450562, "epoch": 5.2392249901146695, "grad_norm": 1.34375, "learning_rate": 0.000261428657378646, "loss": 4.9185, "mean_token_accuracy": 0.22891247272491455, "num_tokens": 121425016.0, "step": 53000 }, { "entropy": 5.843472146987915, "epoch": 5.239719256623172, "grad_norm": 1.203125, "learning_rate": 0.0002613934318169576, "loss": 4.9375, "mean_token_accuracy": 0.23408869802951812, "num_tokens": 121436955.0, "step": 53005 }, { "entropy": 5.789486026763916, "epoch": 5.240213523131673, "grad_norm": 1.2578125, "learning_rate": 0.0002613582065899929, "loss": 4.8945, "mean_token_accuracy": 0.23274163603782655, "num_tokens": 121449690.0, "step": 53010 }, { "entropy": 5.826712942123413, "epoch": 5.240707789640174, "grad_norm": 1.3203125, "learning_rate": 0.00026132298169861837, "loss": 4.9575, "mean_token_accuracy": 0.22878662943840028, "num_tokens": 121462009.0, "step": 53015 }, { "entropy": 5.760797786712646, "epoch": 5.241202056148675, "grad_norm": 1.3828125, "learning_rate": 0.0002612877571437006, "loss": 4.9027, "mean_token_accuracy": 0.23074429035186766, "num_tokens": 121474416.0, "step": 53020 }, { "entropy": 5.819698143005371, "epoch": 5.241696322657177, "grad_norm": 1.328125, "learning_rate": 0.00026125253292610625, "loss": 4.9637, "mean_token_accuracy": 0.2304188132286072, "num_tokens": 121485990.0, "step": 53025 }, { "entropy": 5.853346252441407, "epoch": 5.242190589165678, "grad_norm": 1.359375, "learning_rate": 0.0002612173090467016, "loss": 4.8806, "mean_token_accuracy": 0.2361729383468628, "num_tokens": 121496924.0, "step": 53030 }, { "entropy": 5.813127851486206, "epoch": 5.242684855674179, "grad_norm": 1.34375, "learning_rate": 0.00026118208550635335, "loss": 4.9147, "mean_token_accuracy": 0.2351555734872818, "num_tokens": 121508601.0, "step": 53035 }, { "entropy": 5.831164073944092, "epoch": 5.243179122182681, "grad_norm": 1.296875, "learning_rate": 0.00026114686230592797, "loss": 4.9857, "mean_token_accuracy": 0.2275465816259384, "num_tokens": 121521004.0, "step": 53040 }, { "entropy": 5.786175918579102, "epoch": 5.243673388691183, "grad_norm": 1.3125, "learning_rate": 0.0002611116394462918, "loss": 4.8971, "mean_token_accuracy": 0.23269540816545486, "num_tokens": 121531660.0, "step": 53045 }, { "entropy": 5.757289838790894, "epoch": 5.244167655199684, "grad_norm": 1.3515625, "learning_rate": 0.0002610764169283116, "loss": 4.8634, "mean_token_accuracy": 0.23809027522802353, "num_tokens": 121542614.0, "step": 53050 }, { "entropy": 5.827285194396973, "epoch": 5.244661921708185, "grad_norm": 1.4765625, "learning_rate": 0.0002610411947528536, "loss": 4.9741, "mean_token_accuracy": 0.2335599899291992, "num_tokens": 121553428.0, "step": 53055 }, { "entropy": 5.8337095260620115, "epoch": 5.245156188216686, "grad_norm": 1.2890625, "learning_rate": 0.00026100597292078444, "loss": 4.982, "mean_token_accuracy": 0.2228473022580147, "num_tokens": 121565957.0, "step": 53060 }, { "entropy": 5.755543851852417, "epoch": 5.245650454725188, "grad_norm": 1.421875, "learning_rate": 0.0002609707514329705, "loss": 4.8157, "mean_token_accuracy": 0.238124817609787, "num_tokens": 121576229.0, "step": 53065 }, { "entropy": 5.732319593429565, "epoch": 5.246144721233689, "grad_norm": 1.375, "learning_rate": 0.00026093553029027817, "loss": 4.9057, "mean_token_accuracy": 0.22830894589424133, "num_tokens": 121587938.0, "step": 53070 }, { "entropy": 5.719219493865967, "epoch": 5.24663898774219, "grad_norm": 1.421875, "learning_rate": 0.0002609003094935741, "loss": 4.8698, "mean_token_accuracy": 0.23851091861724855, "num_tokens": 121598605.0, "step": 53075 }, { "entropy": 5.762585639953613, "epoch": 5.247133254250692, "grad_norm": 1.328125, "learning_rate": 0.00026086508904372453, "loss": 4.8946, "mean_token_accuracy": 0.2397138223052025, "num_tokens": 121611963.0, "step": 53080 }, { "entropy": 5.8020587921142575, "epoch": 5.247627520759194, "grad_norm": 1.359375, "learning_rate": 0.00026082986894159605, "loss": 4.9213, "mean_token_accuracy": 0.22964800149202347, "num_tokens": 121623510.0, "step": 53085 }, { "entropy": 5.831209802627564, "epoch": 5.248121787267695, "grad_norm": 1.2890625, "learning_rate": 0.00026079464918805494, "loss": 4.9406, "mean_token_accuracy": 0.22570960372686386, "num_tokens": 121635337.0, "step": 53090 }, { "entropy": 5.782417869567871, "epoch": 5.248616053776196, "grad_norm": 1.4140625, "learning_rate": 0.0002607594297839676, "loss": 4.8709, "mean_token_accuracy": 0.23625948131084443, "num_tokens": 121645682.0, "step": 53095 }, { "entropy": 5.863605117797851, "epoch": 5.249110320284697, "grad_norm": 1.2734375, "learning_rate": 0.00026072421073020053, "loss": 5.0281, "mean_token_accuracy": 0.2218097984790802, "num_tokens": 121658531.0, "step": 53100 }, { "entropy": 5.761544418334961, "epoch": 5.249604586793199, "grad_norm": 1.328125, "learning_rate": 0.00026068899202762007, "loss": 4.9153, "mean_token_accuracy": 0.23979781121015548, "num_tokens": 121669721.0, "step": 53105 }, { "entropy": 5.830628681182861, "epoch": 5.2500988533017, "grad_norm": 1.265625, "learning_rate": 0.00026065377367709273, "loss": 4.9563, "mean_token_accuracy": 0.22691141664981843, "num_tokens": 121680438.0, "step": 53110 }, { "entropy": 5.867693996429443, "epoch": 5.250593119810202, "grad_norm": 1.359375, "learning_rate": 0.00026061855567948474, "loss": 4.9664, "mean_token_accuracy": 0.2308885633945465, "num_tokens": 121691342.0, "step": 53115 }, { "entropy": 5.760453796386718, "epoch": 5.251087386318703, "grad_norm": 1.2265625, "learning_rate": 0.0002605833380356625, "loss": 4.8727, "mean_token_accuracy": 0.2322571337223053, "num_tokens": 121703022.0, "step": 53120 }, { "entropy": 5.781603193283081, "epoch": 5.251581652827205, "grad_norm": 1.5703125, "learning_rate": 0.0002605481207464924, "loss": 4.911, "mean_token_accuracy": 0.23846331387758254, "num_tokens": 121713738.0, "step": 53125 }, { "entropy": 5.758379554748535, "epoch": 5.252075919335706, "grad_norm": 1.4921875, "learning_rate": 0.00026051290381284067, "loss": 4.8633, "mean_token_accuracy": 0.23346432149410248, "num_tokens": 121724640.0, "step": 53130 }, { "entropy": 5.829484653472901, "epoch": 5.252570185844207, "grad_norm": 1.25, "learning_rate": 0.00026047768723557385, "loss": 4.9838, "mean_token_accuracy": 0.2274206295609474, "num_tokens": 121737469.0, "step": 53135 }, { "entropy": 5.839113521575928, "epoch": 5.253064452352708, "grad_norm": 1.3671875, "learning_rate": 0.0002604424710155582, "loss": 4.9588, "mean_token_accuracy": 0.23049239814281464, "num_tokens": 121749483.0, "step": 53140 }, { "entropy": 5.859843730926514, "epoch": 5.25355871886121, "grad_norm": 1.3515625, "learning_rate": 0.0002604072551536599, "loss": 4.9951, "mean_token_accuracy": 0.22963541895151138, "num_tokens": 121761065.0, "step": 53145 }, { "entropy": 5.82386040687561, "epoch": 5.254052985369711, "grad_norm": 1.4296875, "learning_rate": 0.0002603720396507455, "loss": 4.9464, "mean_token_accuracy": 0.22915802747011185, "num_tokens": 121772382.0, "step": 53150 }, { "entropy": 5.841601037979126, "epoch": 5.254547251878213, "grad_norm": 1.3828125, "learning_rate": 0.0002603368245076812, "loss": 4.9567, "mean_token_accuracy": 0.23309761434793472, "num_tokens": 121783565.0, "step": 53155 }, { "entropy": 5.80554165840149, "epoch": 5.255041518386714, "grad_norm": 1.3125, "learning_rate": 0.00026030160972533316, "loss": 4.949, "mean_token_accuracy": 0.22750390321016312, "num_tokens": 121795560.0, "step": 53160 }, { "entropy": 5.797992181777954, "epoch": 5.255535784895216, "grad_norm": 1.3203125, "learning_rate": 0.00026026639530456793, "loss": 4.9693, "mean_token_accuracy": 0.2280057191848755, "num_tokens": 121807199.0, "step": 53165 }, { "entropy": 5.785141658782959, "epoch": 5.256030051403717, "grad_norm": 1.3515625, "learning_rate": 0.0002602311812462516, "loss": 4.9023, "mean_token_accuracy": 0.23679499477148055, "num_tokens": 121818923.0, "step": 53170 }, { "entropy": 5.797716951370239, "epoch": 5.256524317912218, "grad_norm": 1.4453125, "learning_rate": 0.0002601959675512505, "loss": 4.9167, "mean_token_accuracy": 0.2287073776125908, "num_tokens": 121830544.0, "step": 53175 }, { "entropy": 5.821096134185791, "epoch": 5.257018584420719, "grad_norm": 1.34375, "learning_rate": 0.000260160754220431, "loss": 4.9215, "mean_token_accuracy": 0.22517766505479814, "num_tokens": 121842557.0, "step": 53180 }, { "entropy": 5.781222295761109, "epoch": 5.257512850929221, "grad_norm": 1.359375, "learning_rate": 0.0002601255412546592, "loss": 4.8883, "mean_token_accuracy": 0.23780398964881896, "num_tokens": 121855207.0, "step": 53185 }, { "entropy": 5.798046636581421, "epoch": 5.258007117437723, "grad_norm": 1.40625, "learning_rate": 0.0002600903286548013, "loss": 4.998, "mean_token_accuracy": 0.2235134482383728, "num_tokens": 121867516.0, "step": 53190 }, { "entropy": 5.799411725997925, "epoch": 5.258501383946224, "grad_norm": 1.375, "learning_rate": 0.00026005511642172364, "loss": 4.887, "mean_token_accuracy": 0.2334684267640114, "num_tokens": 121879036.0, "step": 53195 }, { "entropy": 5.827278423309326, "epoch": 5.258995650454725, "grad_norm": 1.3828125, "learning_rate": 0.0002600199045562925, "loss": 4.9692, "mean_token_accuracy": 0.22800715267658234, "num_tokens": 121891575.0, "step": 53200 }, { "entropy": 5.860282135009766, "epoch": 5.2594899169632265, "grad_norm": 1.3125, "learning_rate": 0.00025998469305937405, "loss": 4.9424, "mean_token_accuracy": 0.22373806834220886, "num_tokens": 121902665.0, "step": 53205 }, { "entropy": 5.757001352310181, "epoch": 5.259984183471728, "grad_norm": 1.3828125, "learning_rate": 0.0002599494819318345, "loss": 4.8451, "mean_token_accuracy": 0.24240019917488098, "num_tokens": 121914045.0, "step": 53210 }, { "entropy": 5.690659809112549, "epoch": 5.260478449980229, "grad_norm": 1.328125, "learning_rate": 0.0002599142711745399, "loss": 4.7675, "mean_token_accuracy": 0.24499010145664216, "num_tokens": 121925183.0, "step": 53215 }, { "entropy": 5.790027523040772, "epoch": 5.26097271648873, "grad_norm": 1.3125, "learning_rate": 0.0002598790607883566, "loss": 4.9531, "mean_token_accuracy": 0.2322533279657364, "num_tokens": 121936742.0, "step": 53220 }, { "entropy": 5.768565988540649, "epoch": 5.2614669829972325, "grad_norm": 1.3359375, "learning_rate": 0.0002598438507741508, "loss": 4.8616, "mean_token_accuracy": 0.2418904572725296, "num_tokens": 121948832.0, "step": 53225 }, { "entropy": 5.8038280487060545, "epoch": 5.261961249505734, "grad_norm": 1.2734375, "learning_rate": 0.00025980864113278867, "loss": 4.9412, "mean_token_accuracy": 0.23113111555576324, "num_tokens": 121959603.0, "step": 53230 }, { "entropy": 5.766725635528564, "epoch": 5.262455516014235, "grad_norm": 1.390625, "learning_rate": 0.0002597734318651363, "loss": 4.9051, "mean_token_accuracy": 0.2330106481909752, "num_tokens": 121970646.0, "step": 53235 }, { "entropy": 5.746005964279175, "epoch": 5.262949782522736, "grad_norm": 1.2890625, "learning_rate": 0.0002597382229720598, "loss": 4.8098, "mean_token_accuracy": 0.24316336959600449, "num_tokens": 121981704.0, "step": 53240 }, { "entropy": 5.790102195739746, "epoch": 5.2634440490312375, "grad_norm": 1.328125, "learning_rate": 0.00025970301445442536, "loss": 4.9281, "mean_token_accuracy": 0.23448754996061325, "num_tokens": 121993328.0, "step": 53245 }, { "entropy": 5.8121058464050295, "epoch": 5.263938315539739, "grad_norm": 1.3203125, "learning_rate": 0.00025966780631309923, "loss": 4.9099, "mean_token_accuracy": 0.23548202961683273, "num_tokens": 122003672.0, "step": 53250 }, { "entropy": 5.808974027633667, "epoch": 5.26443258204824, "grad_norm": 1.4609375, "learning_rate": 0.0002596325985489474, "loss": 4.9318, "mean_token_accuracy": 0.23892140686511992, "num_tokens": 122013690.0, "step": 53255 }, { "entropy": 5.785220623016357, "epoch": 5.264926848556742, "grad_norm": 1.3515625, "learning_rate": 0.0002595973911628361, "loss": 4.8634, "mean_token_accuracy": 0.24277035444974898, "num_tokens": 122026636.0, "step": 53260 }, { "entropy": 5.826932096481324, "epoch": 5.2654211150652435, "grad_norm": 1.390625, "learning_rate": 0.00025956218415563125, "loss": 4.9433, "mean_token_accuracy": 0.22814250439405442, "num_tokens": 122037543.0, "step": 53265 }, { "entropy": 5.845264530181884, "epoch": 5.265915381573745, "grad_norm": 1.4609375, "learning_rate": 0.0002595269775281992, "loss": 4.9378, "mean_token_accuracy": 0.22860383838415146, "num_tokens": 122048833.0, "step": 53270 }, { "entropy": 5.8074116706848145, "epoch": 5.266409648082246, "grad_norm": 1.4609375, "learning_rate": 0.0002594917712814057, "loss": 4.9373, "mean_token_accuracy": 0.23358654975891113, "num_tokens": 122060294.0, "step": 53275 }, { "entropy": 5.715169143676758, "epoch": 5.266903914590747, "grad_norm": 1.265625, "learning_rate": 0.0002594565654161172, "loss": 4.8348, "mean_token_accuracy": 0.23334084451198578, "num_tokens": 122071551.0, "step": 53280 }, { "entropy": 5.75650429725647, "epoch": 5.2673981810992485, "grad_norm": 1.3125, "learning_rate": 0.0002594213599331996, "loss": 4.8564, "mean_token_accuracy": 0.2303932264447212, "num_tokens": 122082331.0, "step": 53285 }, { "entropy": 5.801055288314819, "epoch": 5.26789244760775, "grad_norm": 1.4453125, "learning_rate": 0.0002593861548335189, "loss": 4.9263, "mean_token_accuracy": 0.23169513344764708, "num_tokens": 122094303.0, "step": 53290 }, { "entropy": 5.772427415847778, "epoch": 5.268386714116252, "grad_norm": 1.359375, "learning_rate": 0.0002593509501179413, "loss": 4.8573, "mean_token_accuracy": 0.2410147726535797, "num_tokens": 122104435.0, "step": 53295 }, { "entropy": 5.853130292892456, "epoch": 5.268880980624753, "grad_norm": 1.3125, "learning_rate": 0.0002593157457873327, "loss": 4.9439, "mean_token_accuracy": 0.22760724425315856, "num_tokens": 122115623.0, "step": 53300 }, { "entropy": 5.847374820709229, "epoch": 5.2693752471332544, "grad_norm": 1.234375, "learning_rate": 0.0002592805418425591, "loss": 4.9652, "mean_token_accuracy": 0.22753052562475204, "num_tokens": 122127128.0, "step": 53305 }, { "entropy": 5.831954145431519, "epoch": 5.269869513641756, "grad_norm": 1.3359375, "learning_rate": 0.0002592453382844867, "loss": 4.9669, "mean_token_accuracy": 0.2299848198890686, "num_tokens": 122138305.0, "step": 53310 }, { "entropy": 5.775985240936279, "epoch": 5.270363780150257, "grad_norm": 1.421875, "learning_rate": 0.00025921013511398137, "loss": 4.8831, "mean_token_accuracy": 0.23105882853269577, "num_tokens": 122149092.0, "step": 53315 }, { "entropy": 5.763343620300293, "epoch": 5.270858046658758, "grad_norm": 1.4453125, "learning_rate": 0.00025917493233190925, "loss": 4.865, "mean_token_accuracy": 0.2370038241147995, "num_tokens": 122160152.0, "step": 53320 }, { "entropy": 5.794892883300781, "epoch": 5.2713523131672595, "grad_norm": 1.4140625, "learning_rate": 0.00025913972993913623, "loss": 4.8944, "mean_token_accuracy": 0.23668826669454573, "num_tokens": 122170889.0, "step": 53325 }, { "entropy": 5.861569118499756, "epoch": 5.271846579675761, "grad_norm": 1.578125, "learning_rate": 0.0002591045279365283, "loss": 5.0081, "mean_token_accuracy": 0.22176806330680848, "num_tokens": 122182881.0, "step": 53330 }, { "entropy": 5.7466450214385985, "epoch": 5.272340846184263, "grad_norm": 1.40625, "learning_rate": 0.00025906932632495145, "loss": 4.8254, "mean_token_accuracy": 0.24544476419687272, "num_tokens": 122194258.0, "step": 53335 }, { "entropy": 5.748769855499267, "epoch": 5.272835112692764, "grad_norm": 1.2578125, "learning_rate": 0.0002590341251052716, "loss": 4.8769, "mean_token_accuracy": 0.2347778007388115, "num_tokens": 122205678.0, "step": 53340 }, { "entropy": 5.753863763809204, "epoch": 5.273329379201265, "grad_norm": 1.2734375, "learning_rate": 0.00025899892427835473, "loss": 4.9126, "mean_token_accuracy": 0.2355031579732895, "num_tokens": 122217446.0, "step": 53345 }, { "entropy": 5.7574296474456785, "epoch": 5.273823645709767, "grad_norm": 1.3046875, "learning_rate": 0.00025896372384506697, "loss": 4.9009, "mean_token_accuracy": 0.23715901076793672, "num_tokens": 122228466.0, "step": 53350 }, { "entropy": 5.775121212005615, "epoch": 5.274317912218268, "grad_norm": 1.3515625, "learning_rate": 0.0002589285238062739, "loss": 4.9433, "mean_token_accuracy": 0.23403626978397368, "num_tokens": 122240528.0, "step": 53355 }, { "entropy": 5.884656620025635, "epoch": 5.274812178726769, "grad_norm": 1.3046875, "learning_rate": 0.00025889332416284175, "loss": 4.9678, "mean_token_accuracy": 0.23180302530527114, "num_tokens": 122251267.0, "step": 53360 }, { "entropy": 5.90588526725769, "epoch": 5.2753064452352705, "grad_norm": 1.28125, "learning_rate": 0.00025885812491563626, "loss": 4.986, "mean_token_accuracy": 0.22455986589193344, "num_tokens": 122262999.0, "step": 53365 }, { "entropy": 5.867618465423584, "epoch": 5.275800711743773, "grad_norm": 1.3359375, "learning_rate": 0.00025882292606552344, "loss": 4.9825, "mean_token_accuracy": 0.22695672810077666, "num_tokens": 122275216.0, "step": 53370 }, { "entropy": 5.721565675735474, "epoch": 5.276294978252274, "grad_norm": 1.4453125, "learning_rate": 0.00025878772761336915, "loss": 4.7812, "mean_token_accuracy": 0.24817583411931993, "num_tokens": 122285385.0, "step": 53375 }, { "entropy": 5.7855224609375, "epoch": 5.276789244760775, "grad_norm": 1.421875, "learning_rate": 0.00025875252956003927, "loss": 4.8958, "mean_token_accuracy": 0.23777510076761246, "num_tokens": 122296386.0, "step": 53380 }, { "entropy": 5.767304944992065, "epoch": 5.277283511269276, "grad_norm": 1.4296875, "learning_rate": 0.00025871733190639966, "loss": 4.8624, "mean_token_accuracy": 0.23948730677366256, "num_tokens": 122307339.0, "step": 53385 }, { "entropy": 5.7609882831573485, "epoch": 5.277777777777778, "grad_norm": 1.5703125, "learning_rate": 0.0002586821346533162, "loss": 4.8475, "mean_token_accuracy": 0.24567288160324097, "num_tokens": 122318712.0, "step": 53390 }, { "entropy": 5.754209756851196, "epoch": 5.278272044286279, "grad_norm": 1.3203125, "learning_rate": 0.00025864693780165476, "loss": 4.8606, "mean_token_accuracy": 0.23581949323415757, "num_tokens": 122329890.0, "step": 53395 }, { "entropy": 5.760194206237793, "epoch": 5.27876631079478, "grad_norm": 1.390625, "learning_rate": 0.0002586117413522813, "loss": 4.8721, "mean_token_accuracy": 0.2352184236049652, "num_tokens": 122340582.0, "step": 53400 }, { "entropy": 5.82879490852356, "epoch": 5.2792605773032815, "grad_norm": 1.359375, "learning_rate": 0.0002585765453060615, "loss": 4.9769, "mean_token_accuracy": 0.2244429975748062, "num_tokens": 122353661.0, "step": 53405 }, { "entropy": 5.869246006011963, "epoch": 5.279754843811784, "grad_norm": 1.390625, "learning_rate": 0.0002585413496638611, "loss": 5.0376, "mean_token_accuracy": 0.2292223945260048, "num_tokens": 122365223.0, "step": 53410 }, { "entropy": 5.822266530990601, "epoch": 5.280249110320285, "grad_norm": 1.328125, "learning_rate": 0.00025850615442654624, "loss": 4.8944, "mean_token_accuracy": 0.24017884880304335, "num_tokens": 122376148.0, "step": 53415 }, { "entropy": 5.757019710540772, "epoch": 5.280743376828786, "grad_norm": 1.3515625, "learning_rate": 0.00025847095959498237, "loss": 4.9525, "mean_token_accuracy": 0.2271917462348938, "num_tokens": 122388108.0, "step": 53420 }, { "entropy": 5.781629943847657, "epoch": 5.281237643337287, "grad_norm": 1.3671875, "learning_rate": 0.0002584357651700355, "loss": 4.8961, "mean_token_accuracy": 0.23520078510046005, "num_tokens": 122400999.0, "step": 53425 }, { "entropy": 5.706395101547241, "epoch": 5.281731909845789, "grad_norm": 1.25, "learning_rate": 0.00025840057115257147, "loss": 4.8346, "mean_token_accuracy": 0.24182889461517335, "num_tokens": 122412398.0, "step": 53430 }, { "entropy": 5.844756841659546, "epoch": 5.28222617635429, "grad_norm": 1.5078125, "learning_rate": 0.0002583653775434559, "loss": 4.9489, "mean_token_accuracy": 0.23105632960796357, "num_tokens": 122423877.0, "step": 53435 }, { "entropy": 5.770450496673584, "epoch": 5.282720442862791, "grad_norm": 1.34375, "learning_rate": 0.00025833018434355466, "loss": 4.8644, "mean_token_accuracy": 0.2328769788146019, "num_tokens": 122435030.0, "step": 53440 }, { "entropy": 5.825913047790527, "epoch": 5.283214709371293, "grad_norm": 1.3203125, "learning_rate": 0.00025829499155373344, "loss": 4.9869, "mean_token_accuracy": 0.22283226549625396, "num_tokens": 122446550.0, "step": 53445 }, { "entropy": 5.825781917572021, "epoch": 5.283708975879795, "grad_norm": 1.328125, "learning_rate": 0.00025825979917485796, "loss": 4.9395, "mean_token_accuracy": 0.22569505572319032, "num_tokens": 122457662.0, "step": 53450 }, { "entropy": 5.760116815567017, "epoch": 5.284203242388296, "grad_norm": 1.359375, "learning_rate": 0.0002582246072077941, "loss": 4.9363, "mean_token_accuracy": 0.23199324309825897, "num_tokens": 122469514.0, "step": 53455 }, { "entropy": 5.796312379837036, "epoch": 5.284697508896797, "grad_norm": 1.3828125, "learning_rate": 0.0002581894156534075, "loss": 4.948, "mean_token_accuracy": 0.22823249846696853, "num_tokens": 122480795.0, "step": 53460 }, { "entropy": 5.761532735824585, "epoch": 5.285191775405298, "grad_norm": 1.2890625, "learning_rate": 0.0002581542245125639, "loss": 4.8367, "mean_token_accuracy": 0.24709578305482865, "num_tokens": 122492018.0, "step": 53465 }, { "entropy": 5.714620685577392, "epoch": 5.2856860419138, "grad_norm": 1.4375, "learning_rate": 0.00025811903378612896, "loss": 4.8335, "mean_token_accuracy": 0.23537764996290206, "num_tokens": 122503551.0, "step": 53470 }, { "entropy": 5.782076072692871, "epoch": 5.286180308422301, "grad_norm": 1.4609375, "learning_rate": 0.0002580838434749684, "loss": 4.8626, "mean_token_accuracy": 0.23754838854074478, "num_tokens": 122515145.0, "step": 53475 }, { "entropy": 5.814262056350708, "epoch": 5.286674574930803, "grad_norm": 1.2421875, "learning_rate": 0.00025804865357994785, "loss": 4.9514, "mean_token_accuracy": 0.23070691972970964, "num_tokens": 122527399.0, "step": 53480 }, { "entropy": 5.7863842964172365, "epoch": 5.287168841439304, "grad_norm": 1.3359375, "learning_rate": 0.0002580134641019331, "loss": 4.8143, "mean_token_accuracy": 0.2445555180311203, "num_tokens": 122537608.0, "step": 53485 }, { "entropy": 5.796369457244873, "epoch": 5.287663107947806, "grad_norm": 1.375, "learning_rate": 0.0002579782750417898, "loss": 4.9158, "mean_token_accuracy": 0.23440824449062347, "num_tokens": 122548289.0, "step": 53490 }, { "entropy": 5.8116865158081055, "epoch": 5.288157374456307, "grad_norm": 1.421875, "learning_rate": 0.0002579430864003836, "loss": 4.9958, "mean_token_accuracy": 0.23201971352100373, "num_tokens": 122560787.0, "step": 53495 }, { "entropy": 5.82585654258728, "epoch": 5.288651640964808, "grad_norm": 1.2890625, "learning_rate": 0.00025790789817858005, "loss": 4.9306, "mean_token_accuracy": 0.2301764592528343, "num_tokens": 122572794.0, "step": 53500 }, { "entropy": 5.798297595977783, "epoch": 5.289145907473309, "grad_norm": 1.2421875, "learning_rate": 0.00025787271037724496, "loss": 4.9091, "mean_token_accuracy": 0.24008553773164748, "num_tokens": 122586200.0, "step": 53505 }, { "entropy": 5.862014532089233, "epoch": 5.289640173981811, "grad_norm": 1.3515625, "learning_rate": 0.00025783752299724373, "loss": 5.0593, "mean_token_accuracy": 0.22071299105882644, "num_tokens": 122597392.0, "step": 53510 }, { "entropy": 5.764507865905761, "epoch": 5.290134440490313, "grad_norm": 1.46875, "learning_rate": 0.00025780233603944216, "loss": 4.8932, "mean_token_accuracy": 0.2311556190252304, "num_tokens": 122608907.0, "step": 53515 }, { "entropy": 5.778825139999389, "epoch": 5.290628706998814, "grad_norm": 1.4921875, "learning_rate": 0.0002577671495047058, "loss": 4.8015, "mean_token_accuracy": 0.25134068429470063, "num_tokens": 122619792.0, "step": 53520 }, { "entropy": 5.800314950942993, "epoch": 5.291122973507315, "grad_norm": 1.3984375, "learning_rate": 0.00025773196339390017, "loss": 4.8668, "mean_token_accuracy": 0.23419223129749298, "num_tokens": 122630113.0, "step": 53525 }, { "entropy": 5.775997591018677, "epoch": 5.291617240015817, "grad_norm": 1.3359375, "learning_rate": 0.000257696777707891, "loss": 4.9743, "mean_token_accuracy": 0.22858325093984605, "num_tokens": 122642045.0, "step": 53530 }, { "entropy": 5.696418190002442, "epoch": 5.292111506524318, "grad_norm": 1.4140625, "learning_rate": 0.00025766159244754367, "loss": 4.8024, "mean_token_accuracy": 0.2495665580034256, "num_tokens": 122654148.0, "step": 53535 }, { "entropy": 5.8170921325683596, "epoch": 5.292605773032819, "grad_norm": 1.2734375, "learning_rate": 0.00025762640761372397, "loss": 4.9169, "mean_token_accuracy": 0.23545741885900498, "num_tokens": 122665012.0, "step": 53540 }, { "entropy": 5.778345823287964, "epoch": 5.29310003954132, "grad_norm": 1.2109375, "learning_rate": 0.0002575912232072973, "loss": 4.8748, "mean_token_accuracy": 0.23926792442798614, "num_tokens": 122677009.0, "step": 53545 }, { "entropy": 5.793969631195068, "epoch": 5.2935943060498225, "grad_norm": 1.4921875, "learning_rate": 0.00025755603922912926, "loss": 4.8931, "mean_token_accuracy": 0.23192045390605925, "num_tokens": 122688828.0, "step": 53550 }, { "entropy": 5.754349279403686, "epoch": 5.294088572558324, "grad_norm": 1.5, "learning_rate": 0.00025752085568008534, "loss": 4.9133, "mean_token_accuracy": 0.23478081524372102, "num_tokens": 122699408.0, "step": 53555 }, { "entropy": 5.834153890609741, "epoch": 5.294582839066825, "grad_norm": 1.25, "learning_rate": 0.0002574856725610311, "loss": 4.9163, "mean_token_accuracy": 0.23136269450187683, "num_tokens": 122711885.0, "step": 53560 }, { "entropy": 5.761081171035767, "epoch": 5.295077105575326, "grad_norm": 1.296875, "learning_rate": 0.00025745048987283197, "loss": 4.7701, "mean_token_accuracy": 0.24466915875673295, "num_tokens": 122722805.0, "step": 53565 }, { "entropy": 5.7405171394348145, "epoch": 5.2955713720838276, "grad_norm": 1.40625, "learning_rate": 0.00025741530761635355, "loss": 4.8005, "mean_token_accuracy": 0.24088837057352067, "num_tokens": 122734595.0, "step": 53570 }, { "entropy": 5.726275396347046, "epoch": 5.296065638592329, "grad_norm": 1.3125, "learning_rate": 0.0002573801257924613, "loss": 4.8843, "mean_token_accuracy": 0.23586251586675644, "num_tokens": 122747299.0, "step": 53575 }, { "entropy": 5.787537717819214, "epoch": 5.29655990510083, "grad_norm": 1.3671875, "learning_rate": 0.00025734494440202073, "loss": 4.9464, "mean_token_accuracy": 0.22741032987833024, "num_tokens": 122759504.0, "step": 53580 }, { "entropy": 5.798646688461304, "epoch": 5.297054171609331, "grad_norm": 1.2890625, "learning_rate": 0.0002573097634458972, "loss": 4.9107, "mean_token_accuracy": 0.23337824791669845, "num_tokens": 122772220.0, "step": 53585 }, { "entropy": 5.744379281997681, "epoch": 5.2975484381178335, "grad_norm": 1.40625, "learning_rate": 0.0002572745829249563, "loss": 4.8376, "mean_token_accuracy": 0.24275604635477066, "num_tokens": 122784585.0, "step": 53590 }, { "entropy": 5.854198837280274, "epoch": 5.298042704626335, "grad_norm": 1.4453125, "learning_rate": 0.0002572394028400633, "loss": 4.9364, "mean_token_accuracy": 0.2304521232843399, "num_tokens": 122795465.0, "step": 53595 }, { "entropy": 5.6753538131713865, "epoch": 5.298536971134836, "grad_norm": 1.296875, "learning_rate": 0.0002572042231920838, "loss": 4.8524, "mean_token_accuracy": 0.2389932841062546, "num_tokens": 122807129.0, "step": 53600 }, { "entropy": 5.768017053604126, "epoch": 5.299031237643337, "grad_norm": 1.3203125, "learning_rate": 0.00025716904398188326, "loss": 4.8854, "mean_token_accuracy": 0.22844571471214295, "num_tokens": 122818201.0, "step": 53605 }, { "entropy": 5.831211948394776, "epoch": 5.2995255041518385, "grad_norm": 1.4765625, "learning_rate": 0.00025713386521032693, "loss": 4.912, "mean_token_accuracy": 0.23061102777719497, "num_tokens": 122828540.0, "step": 53610 }, { "entropy": 5.805179119110107, "epoch": 5.30001977066034, "grad_norm": 1.3984375, "learning_rate": 0.0002570986868782803, "loss": 4.9248, "mean_token_accuracy": 0.235867702960968, "num_tokens": 122840829.0, "step": 53615 }, { "entropy": 5.758443784713745, "epoch": 5.300514037168841, "grad_norm": 1.296875, "learning_rate": 0.00025706350898660875, "loss": 4.909, "mean_token_accuracy": 0.23470396250486375, "num_tokens": 122853131.0, "step": 53620 }, { "entropy": 5.809024667739868, "epoch": 5.301008303677343, "grad_norm": 1.3046875, "learning_rate": 0.00025702833153617755, "loss": 4.9268, "mean_token_accuracy": 0.22747260481119155, "num_tokens": 122865062.0, "step": 53625 }, { "entropy": 5.77620038986206, "epoch": 5.3015025701858445, "grad_norm": 1.5390625, "learning_rate": 0.0002569931545278523, "loss": 4.9044, "mean_token_accuracy": 0.2313554272055626, "num_tokens": 122875696.0, "step": 53630 }, { "entropy": 5.800540018081665, "epoch": 5.301996836694346, "grad_norm": 1.234375, "learning_rate": 0.00025695797796249824, "loss": 4.933, "mean_token_accuracy": 0.22957686483860015, "num_tokens": 122888383.0, "step": 53635 }, { "entropy": 5.803252220153809, "epoch": 5.302491103202847, "grad_norm": 1.6796875, "learning_rate": 0.0002569228018409807, "loss": 4.9011, "mean_token_accuracy": 0.2318322092294693, "num_tokens": 122899345.0, "step": 53640 }, { "entropy": 5.856547021865845, "epoch": 5.302985369711348, "grad_norm": 1.328125, "learning_rate": 0.00025688762616416503, "loss": 5.0513, "mean_token_accuracy": 0.22793136537075043, "num_tokens": 122911104.0, "step": 53645 }, { "entropy": 5.808743715286255, "epoch": 5.3034796362198495, "grad_norm": 1.2890625, "learning_rate": 0.00025685245093291667, "loss": 4.878, "mean_token_accuracy": 0.23417021483182907, "num_tokens": 122921844.0, "step": 53650 }, { "entropy": 5.779083108901977, "epoch": 5.303973902728351, "grad_norm": 1.4609375, "learning_rate": 0.00025681727614810065, "loss": 4.8968, "mean_token_accuracy": 0.23549798727035523, "num_tokens": 122932774.0, "step": 53655 }, { "entropy": 5.762442970275879, "epoch": 5.304468169236852, "grad_norm": 1.421875, "learning_rate": 0.00025678210181058253, "loss": 4.9152, "mean_token_accuracy": 0.2330689698457718, "num_tokens": 122944565.0, "step": 53660 }, { "entropy": 5.723546838760376, "epoch": 5.304962435745354, "grad_norm": 1.34375, "learning_rate": 0.0002567469279212276, "loss": 4.7803, "mean_token_accuracy": 0.24965546727180482, "num_tokens": 122955989.0, "step": 53665 }, { "entropy": 5.807387447357177, "epoch": 5.3054567022538555, "grad_norm": 1.3203125, "learning_rate": 0.000256711754480901, "loss": 4.8836, "mean_token_accuracy": 0.23474696427583694, "num_tokens": 122967862.0, "step": 53670 }, { "entropy": 5.815908718109131, "epoch": 5.305950968762357, "grad_norm": 1.2734375, "learning_rate": 0.00025667658149046814, "loss": 4.9174, "mean_token_accuracy": 0.22924703657627105, "num_tokens": 122978832.0, "step": 53675 }, { "entropy": 5.7551641941070555, "epoch": 5.306445235270858, "grad_norm": 1.3671875, "learning_rate": 0.0002566414089507942, "loss": 4.8151, "mean_token_accuracy": 0.24581925868988036, "num_tokens": 122991342.0, "step": 53680 }, { "entropy": 5.717195081710815, "epoch": 5.306939501779359, "grad_norm": 1.2890625, "learning_rate": 0.0002566062368627443, "loss": 4.8566, "mean_token_accuracy": 0.23960224837064742, "num_tokens": 123003377.0, "step": 53685 }, { "entropy": 5.743018436431885, "epoch": 5.3074337682878605, "grad_norm": 1.3515625, "learning_rate": 0.000256571065227184, "loss": 4.7898, "mean_token_accuracy": 0.24273349791765214, "num_tokens": 123013797.0, "step": 53690 }, { "entropy": 5.791771793365479, "epoch": 5.307928034796362, "grad_norm": 1.46875, "learning_rate": 0.0002565358940449783, "loss": 4.8808, "mean_token_accuracy": 0.23681527972221375, "num_tokens": 123023858.0, "step": 53695 }, { "entropy": 5.780860710144043, "epoch": 5.308422301304864, "grad_norm": 1.4609375, "learning_rate": 0.0002565007233169925, "loss": 4.9415, "mean_token_accuracy": 0.23055520206689833, "num_tokens": 123034410.0, "step": 53700 }, { "entropy": 5.7003649234771725, "epoch": 5.308916567813365, "grad_norm": 1.390625, "learning_rate": 0.0002564655530440918, "loss": 4.8356, "mean_token_accuracy": 0.2374408334493637, "num_tokens": 123045422.0, "step": 53705 }, { "entropy": 5.832486820220947, "epoch": 5.3094108343218664, "grad_norm": 1.453125, "learning_rate": 0.00025643038322714125, "loss": 4.9442, "mean_token_accuracy": 0.23420112431049347, "num_tokens": 123056549.0, "step": 53710 }, { "entropy": 5.838386726379395, "epoch": 5.309905100830368, "grad_norm": 1.34375, "learning_rate": 0.00025639521386700627, "loss": 4.9536, "mean_token_accuracy": 0.23329526782035828, "num_tokens": 123067983.0, "step": 53715 }, { "entropy": 5.812074899673462, "epoch": 5.310399367338869, "grad_norm": 1.25, "learning_rate": 0.00025636004496455185, "loss": 4.9561, "mean_token_accuracy": 0.23123320192098618, "num_tokens": 123080332.0, "step": 53720 }, { "entropy": 5.860667943954468, "epoch": 5.31089363384737, "grad_norm": 1.3984375, "learning_rate": 0.0002563248765206432, "loss": 4.984, "mean_token_accuracy": 0.23098001927137374, "num_tokens": 123092905.0, "step": 53725 }, { "entropy": 5.841025161743164, "epoch": 5.3113879003558715, "grad_norm": 1.3984375, "learning_rate": 0.00025628970853614565, "loss": 4.9124, "mean_token_accuracy": 0.22909849435091018, "num_tokens": 123105042.0, "step": 53730 }, { "entropy": 5.777275705337525, "epoch": 5.311882166864374, "grad_norm": 1.375, "learning_rate": 0.000256254541011924, "loss": 4.8971, "mean_token_accuracy": 0.2328811302781105, "num_tokens": 123115986.0, "step": 53735 }, { "entropy": 5.878675889968872, "epoch": 5.312376433372875, "grad_norm": 1.34375, "learning_rate": 0.0002562193739488436, "loss": 5.0443, "mean_token_accuracy": 0.22539665848016738, "num_tokens": 123127453.0, "step": 53740 }, { "entropy": 5.849966335296631, "epoch": 5.312870699881376, "grad_norm": 1.453125, "learning_rate": 0.00025618420734776945, "loss": 5.0009, "mean_token_accuracy": 0.23008051216602327, "num_tokens": 123138806.0, "step": 53745 }, { "entropy": 5.828011798858642, "epoch": 5.313364966389877, "grad_norm": 1.328125, "learning_rate": 0.0002561490412095668, "loss": 4.9009, "mean_token_accuracy": 0.24043914079666137, "num_tokens": 123149498.0, "step": 53750 }, { "entropy": 5.780609226226806, "epoch": 5.313859232898379, "grad_norm": 1.421875, "learning_rate": 0.00025611387553510067, "loss": 4.8998, "mean_token_accuracy": 0.2309871271252632, "num_tokens": 123160669.0, "step": 53755 }, { "entropy": 5.754515504837036, "epoch": 5.31435349940688, "grad_norm": 1.3828125, "learning_rate": 0.0002560787103252361, "loss": 4.8475, "mean_token_accuracy": 0.23811665624380113, "num_tokens": 123171330.0, "step": 53760 }, { "entropy": 5.784481143951416, "epoch": 5.314847765915381, "grad_norm": 1.421875, "learning_rate": 0.0002560435455808382, "loss": 4.9315, "mean_token_accuracy": 0.2334736093878746, "num_tokens": 123183449.0, "step": 53765 }, { "entropy": 5.767261171340943, "epoch": 5.315342032423883, "grad_norm": 1.328125, "learning_rate": 0.0002560083813027719, "loss": 4.9035, "mean_token_accuracy": 0.24158943593502044, "num_tokens": 123194904.0, "step": 53770 }, { "entropy": 5.806327486038208, "epoch": 5.315836298932385, "grad_norm": 1.4765625, "learning_rate": 0.0002559732174919026, "loss": 4.8445, "mean_token_accuracy": 0.23293237388134003, "num_tokens": 123206240.0, "step": 53775 }, { "entropy": 5.868523406982422, "epoch": 5.316330565440886, "grad_norm": 1.484375, "learning_rate": 0.0002559380541490949, "loss": 4.8723, "mean_token_accuracy": 0.23655816316604614, "num_tokens": 123217277.0, "step": 53780 }, { "entropy": 5.712953376770019, "epoch": 5.316824831949387, "grad_norm": 1.4765625, "learning_rate": 0.00025590289127521413, "loss": 4.8075, "mean_token_accuracy": 0.24541327208280564, "num_tokens": 123228074.0, "step": 53785 }, { "entropy": 5.720205068588257, "epoch": 5.317319098457888, "grad_norm": 1.3515625, "learning_rate": 0.0002558677288711252, "loss": 4.8537, "mean_token_accuracy": 0.23487648218870164, "num_tokens": 123238030.0, "step": 53790 }, { "entropy": 5.757998657226563, "epoch": 5.31781336496639, "grad_norm": 1.5234375, "learning_rate": 0.0002558325669376931, "loss": 4.915, "mean_token_accuracy": 0.234829343855381, "num_tokens": 123248716.0, "step": 53795 }, { "entropy": 5.739530372619629, "epoch": 5.318307631474891, "grad_norm": 1.2109375, "learning_rate": 0.0002557974054757827, "loss": 4.8314, "mean_token_accuracy": 0.24374352991580964, "num_tokens": 123260235.0, "step": 53800 }, { "entropy": 5.797208547592163, "epoch": 5.318801897983393, "grad_norm": 1.5, "learning_rate": 0.0002557622444862593, "loss": 4.8867, "mean_token_accuracy": 0.2449814960360527, "num_tokens": 123272214.0, "step": 53805 }, { "entropy": 5.790957403182984, "epoch": 5.319296164491894, "grad_norm": 1.3828125, "learning_rate": 0.00025572708396998757, "loss": 4.9089, "mean_token_accuracy": 0.2318798616528511, "num_tokens": 123283644.0, "step": 53810 }, { "entropy": 5.726669406890869, "epoch": 5.319790431000396, "grad_norm": 1.3203125, "learning_rate": 0.00025569192392783257, "loss": 4.8332, "mean_token_accuracy": 0.23835319727659227, "num_tokens": 123295487.0, "step": 53815 }, { "entropy": 5.783889675140381, "epoch": 5.320284697508897, "grad_norm": 1.421875, "learning_rate": 0.0002556567643606593, "loss": 4.8998, "mean_token_accuracy": 0.23681072890758514, "num_tokens": 123306912.0, "step": 53820 }, { "entropy": 5.824093341827393, "epoch": 5.320778964017398, "grad_norm": 1.3984375, "learning_rate": 0.0002556216052693325, "loss": 4.8826, "mean_token_accuracy": 0.2317727565765381, "num_tokens": 123318875.0, "step": 53825 }, { "entropy": 5.796582412719727, "epoch": 5.321273230525899, "grad_norm": 1.2890625, "learning_rate": 0.0002555864466547173, "loss": 4.9275, "mean_token_accuracy": 0.23717094212770462, "num_tokens": 123330877.0, "step": 53830 }, { "entropy": 5.703095388412476, "epoch": 5.321767497034401, "grad_norm": 1.3671875, "learning_rate": 0.00025555128851767846, "loss": 4.7724, "mean_token_accuracy": 0.2533256858587265, "num_tokens": 123341720.0, "step": 53835 }, { "entropy": 5.771019411087036, "epoch": 5.322261763542902, "grad_norm": 1.265625, "learning_rate": 0.000255516130859081, "loss": 4.8932, "mean_token_accuracy": 0.2376276135444641, "num_tokens": 123353160.0, "step": 53840 }, { "entropy": 5.759971714019775, "epoch": 5.322756030051404, "grad_norm": 1.4375, "learning_rate": 0.0002554809736797898, "loss": 4.8859, "mean_token_accuracy": 0.2334063395857811, "num_tokens": 123363726.0, "step": 53845 }, { "entropy": 5.832391595840454, "epoch": 5.323250296559905, "grad_norm": 1.375, "learning_rate": 0.00025544581698066967, "loss": 4.9205, "mean_token_accuracy": 0.23166232258081437, "num_tokens": 123375152.0, "step": 53850 }, { "entropy": 5.780570983886719, "epoch": 5.323744563068407, "grad_norm": 1.3984375, "learning_rate": 0.00025541066076258535, "loss": 4.8816, "mean_token_accuracy": 0.23595014810562134, "num_tokens": 123386266.0, "step": 53855 }, { "entropy": 5.778565835952759, "epoch": 5.324238829576908, "grad_norm": 1.4609375, "learning_rate": 0.00025537550502640184, "loss": 4.8379, "mean_token_accuracy": 0.2453214555978775, "num_tokens": 123396423.0, "step": 53860 }, { "entropy": 5.813871002197265, "epoch": 5.324733096085409, "grad_norm": 1.3671875, "learning_rate": 0.00025534034977298396, "loss": 4.9422, "mean_token_accuracy": 0.23119716495275497, "num_tokens": 123407907.0, "step": 53865 }, { "entropy": 5.8000068187713625, "epoch": 5.32522736259391, "grad_norm": 1.3203125, "learning_rate": 0.0002553051950031966, "loss": 4.948, "mean_token_accuracy": 0.22675623297691344, "num_tokens": 123419968.0, "step": 53870 }, { "entropy": 5.827806091308593, "epoch": 5.325721629102412, "grad_norm": 1.3984375, "learning_rate": 0.0002552700407179045, "loss": 4.9759, "mean_token_accuracy": 0.22901190519332887, "num_tokens": 123432089.0, "step": 53875 }, { "entropy": 5.759852886199951, "epoch": 5.326215895610914, "grad_norm": 1.3125, "learning_rate": 0.00025523488691797235, "loss": 4.8898, "mean_token_accuracy": 0.23924679607152938, "num_tokens": 123443623.0, "step": 53880 }, { "entropy": 5.825639629364014, "epoch": 5.326710162119415, "grad_norm": 1.4453125, "learning_rate": 0.00025519973360426507, "loss": 4.9283, "mean_token_accuracy": 0.23681171387434005, "num_tokens": 123454200.0, "step": 53885 }, { "entropy": 5.885631847381592, "epoch": 5.327204428627916, "grad_norm": 1.46875, "learning_rate": 0.0002551645807776475, "loss": 4.992, "mean_token_accuracy": 0.23027701377868653, "num_tokens": 123466361.0, "step": 53890 }, { "entropy": 5.787861299514771, "epoch": 5.327698695136418, "grad_norm": 1.4296875, "learning_rate": 0.0002551294284389843, "loss": 4.9379, "mean_token_accuracy": 0.2290056824684143, "num_tokens": 123478355.0, "step": 53895 }, { "entropy": 5.736255025863647, "epoch": 5.328192961644919, "grad_norm": 1.28125, "learning_rate": 0.00025509427658914024, "loss": 4.8883, "mean_token_accuracy": 0.23788779973983765, "num_tokens": 123489463.0, "step": 53900 }, { "entropy": 5.791329050064087, "epoch": 5.32868722815342, "grad_norm": 1.3984375, "learning_rate": 0.00025505912522898, "loss": 4.8826, "mean_token_accuracy": 0.23348919302225113, "num_tokens": 123500924.0, "step": 53905 }, { "entropy": 5.759895467758179, "epoch": 5.329181494661921, "grad_norm": 1.390625, "learning_rate": 0.00025502397435936847, "loss": 4.7633, "mean_token_accuracy": 0.24542152136564255, "num_tokens": 123511414.0, "step": 53910 }, { "entropy": 5.738644933700561, "epoch": 5.329675761170423, "grad_norm": 1.3671875, "learning_rate": 0.0002549888239811701, "loss": 4.8044, "mean_token_accuracy": 0.24394217729568482, "num_tokens": 123521741.0, "step": 53915 }, { "entropy": 5.690075063705445, "epoch": 5.330170027678925, "grad_norm": 1.40625, "learning_rate": 0.0002549536740952499, "loss": 4.8444, "mean_token_accuracy": 0.2390352576971054, "num_tokens": 123532469.0, "step": 53920 }, { "entropy": 5.714728689193725, "epoch": 5.330664294187426, "grad_norm": 1.359375, "learning_rate": 0.0002549185247024725, "loss": 4.8293, "mean_token_accuracy": 0.24825237840414047, "num_tokens": 123544931.0, "step": 53925 }, { "entropy": 5.82331953048706, "epoch": 5.331158560695927, "grad_norm": 1.3828125, "learning_rate": 0.00025488337580370236, "loss": 4.9349, "mean_token_accuracy": 0.22830101549625398, "num_tokens": 123557042.0, "step": 53930 }, { "entropy": 5.795929765701294, "epoch": 5.331652827204429, "grad_norm": 1.46875, "learning_rate": 0.0002548482273998044, "loss": 4.8645, "mean_token_accuracy": 0.23205238282680513, "num_tokens": 123567740.0, "step": 53935 }, { "entropy": 5.808051061630249, "epoch": 5.33214709371293, "grad_norm": 1.5546875, "learning_rate": 0.0002548130794916432, "loss": 4.9107, "mean_token_accuracy": 0.22945208102464676, "num_tokens": 123577756.0, "step": 53940 }, { "entropy": 5.780467844009399, "epoch": 5.332641360221431, "grad_norm": 1.3203125, "learning_rate": 0.00025477793208008323, "loss": 4.9381, "mean_token_accuracy": 0.23680469542741775, "num_tokens": 123590160.0, "step": 53945 }, { "entropy": 5.708120965957642, "epoch": 5.333135626729932, "grad_norm": 1.1953125, "learning_rate": 0.0002547427851659893, "loss": 4.8526, "mean_token_accuracy": 0.23673400580883025, "num_tokens": 123602240.0, "step": 53950 }, { "entropy": 5.836886930465698, "epoch": 5.3336298932384345, "grad_norm": 1.2578125, "learning_rate": 0.000254707638750226, "loss": 4.9871, "mean_token_accuracy": 0.22607833743095399, "num_tokens": 123613634.0, "step": 53955 }, { "entropy": 5.818803501129151, "epoch": 5.334124159746936, "grad_norm": 1.359375, "learning_rate": 0.000254672492833658, "loss": 4.91, "mean_token_accuracy": 0.24193129688501358, "num_tokens": 123625094.0, "step": 53960 }, { "entropy": 5.803480434417724, "epoch": 5.334618426255437, "grad_norm": 1.46875, "learning_rate": 0.00025463734741714984, "loss": 4.9333, "mean_token_accuracy": 0.23162195086479187, "num_tokens": 123636481.0, "step": 53965 }, { "entropy": 5.709811210632324, "epoch": 5.335112692763938, "grad_norm": 1.3828125, "learning_rate": 0.000254602202501566, "loss": 4.7513, "mean_token_accuracy": 0.252083446085453, "num_tokens": 123645674.0, "step": 53970 }, { "entropy": 5.757914018630982, "epoch": 5.3356069592724396, "grad_norm": 1.21875, "learning_rate": 0.0002545670580877712, "loss": 4.7922, "mean_token_accuracy": 0.244442018866539, "num_tokens": 123656592.0, "step": 53975 }, { "entropy": 5.768587207794189, "epoch": 5.336101225780941, "grad_norm": 1.4296875, "learning_rate": 0.0002545319141766299, "loss": 4.8711, "mean_token_accuracy": 0.23446458876132964, "num_tokens": 123668084.0, "step": 53980 }, { "entropy": 5.811733341217041, "epoch": 5.336595492289442, "grad_norm": 1.2890625, "learning_rate": 0.0002544967707690068, "loss": 5.0349, "mean_token_accuracy": 0.22667082995176316, "num_tokens": 123679416.0, "step": 53985 }, { "entropy": 5.794829654693603, "epoch": 5.337089758797944, "grad_norm": 1.3828125, "learning_rate": 0.00025446162786576626, "loss": 4.8732, "mean_token_accuracy": 0.2356559678912163, "num_tokens": 123690165.0, "step": 53990 }, { "entropy": 5.854612588882446, "epoch": 5.3375840253064455, "grad_norm": 1.234375, "learning_rate": 0.0002544264854677728, "loss": 4.9644, "mean_token_accuracy": 0.22763216942548753, "num_tokens": 123702294.0, "step": 53995 }, { "entropy": 5.854082918167114, "epoch": 5.338078291814947, "grad_norm": 1.3828125, "learning_rate": 0.00025439134357589107, "loss": 4.9205, "mean_token_accuracy": 0.23585116118192673, "num_tokens": 123712872.0, "step": 54000 }, { "epoch": 5.338078291814947, "eval_entropy": 5.5482322355038125, "eval_loss": 4.986919403076172, "eval_mean_token_accuracy": 0.2368713241313363, "eval_num_tokens": 123712872.0, "eval_runtime": 20.2791, "eval_samples_per_second": 1603.279, "eval_steps_per_second": 200.453, "step": 54000 } ], "logging_steps": 5, "max_steps": 101150, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.872000832246784e+16, "train_batch_size": 16, "trial_name": null, "trial_params": null }