{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 7.710557532621589, "eval_steps": 3000, "global_step": 78000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 7.151007413864136, "epoch": 0.0004942665085013839, "grad_norm": 1.078125, "learning_rate": 2e-06, "loss": 7.279, "mean_token_accuracy": 0.08845784291625022, "num_tokens": 11289.0, "step": 5 }, { "entropy": 7.142992544174194, "epoch": 0.0009885330170027679, "grad_norm": 1.1015625, "learning_rate": 4.5e-06, "loss": 7.2577, "mean_token_accuracy": 0.08933138325810433, "num_tokens": 21541.0, "step": 10 }, { "entropy": 7.182202959060669, "epoch": 0.0014827995255041518, "grad_norm": 1.0703125, "learning_rate": 7e-06, "loss": 7.2317, "mean_token_accuracy": 0.0934896469116211, "num_tokens": 32257.0, "step": 15 }, { "entropy": 7.244844675064087, "epoch": 0.0019770660340055358, "grad_norm": 0.9140625, "learning_rate": 9.5e-06, "loss": 7.2492, "mean_token_accuracy": 0.09298909306526185, "num_tokens": 44176.0, "step": 20 }, { "entropy": 7.262534332275391, "epoch": 0.0024713325425069197, "grad_norm": 0.98828125, "learning_rate": 1.2e-05, "loss": 7.1678, "mean_token_accuracy": 0.09061622098088265, "num_tokens": 56115.0, "step": 25 }, { "entropy": 7.378157377243042, "epoch": 0.0029655990510083037, "grad_norm": 0.94921875, "learning_rate": 1.4500000000000002e-05, "loss": 7.2162, "mean_token_accuracy": 0.09287815466523171, "num_tokens": 68828.0, "step": 30 }, { "entropy": 7.399503707885742, "epoch": 0.0034598655595096876, "grad_norm": 0.98828125, "learning_rate": 1.7000000000000003e-05, "loss": 7.2093, "mean_token_accuracy": 0.09124612733721733, "num_tokens": 80097.0, "step": 35 }, { "entropy": 7.373995113372803, "epoch": 0.0039541320680110716, "grad_norm": 0.83203125, "learning_rate": 1.95e-05, "loss": 7.1903, "mean_token_accuracy": 0.09260638207197189, "num_tokens": 91510.0, "step": 40 }, { "entropy": 7.330695772171021, "epoch": 0.004448398576512456, "grad_norm": 0.8046875, "learning_rate": 2.2e-05, "loss": 7.234, "mean_token_accuracy": 0.09660193100571632, "num_tokens": 103443.0, "step": 45 }, { "entropy": 7.33756799697876, "epoch": 0.0049426650850138395, "grad_norm": 0.83984375, "learning_rate": 2.4500000000000003e-05, "loss": 7.2565, "mean_token_accuracy": 0.09188243448734283, "num_tokens": 114629.0, "step": 50 }, { "entropy": 7.324716234207154, "epoch": 0.005436931593515224, "grad_norm": 0.875, "learning_rate": 2.7e-05, "loss": 7.2396, "mean_token_accuracy": 0.09266308695077896, "num_tokens": 125012.0, "step": 55 }, { "entropy": 7.393645143508911, "epoch": 0.005931198102016607, "grad_norm": 0.87890625, "learning_rate": 2.95e-05, "loss": 7.1731, "mean_token_accuracy": 0.09935653060674668, "num_tokens": 135834.0, "step": 60 }, { "entropy": 7.348312473297119, "epoch": 0.006425464610517992, "grad_norm": 0.89453125, "learning_rate": 3.2e-05, "loss": 7.0755, "mean_token_accuracy": 0.10009140819311142, "num_tokens": 147413.0, "step": 65 }, { "entropy": 7.368169450759888, "epoch": 0.006919731119019375, "grad_norm": 0.9375, "learning_rate": 3.4500000000000005e-05, "loss": 7.2672, "mean_token_accuracy": 0.09652369320392609, "num_tokens": 158046.0, "step": 70 }, { "entropy": 7.3670432567596436, "epoch": 0.00741399762752076, "grad_norm": 0.99609375, "learning_rate": 3.7e-05, "loss": 7.1792, "mean_token_accuracy": 0.09774387776851653, "num_tokens": 168564.0, "step": 75 }, { "entropy": 7.313370609283448, "epoch": 0.007908264136022143, "grad_norm": 0.8515625, "learning_rate": 3.95e-05, "loss": 7.1885, "mean_token_accuracy": 0.09465310201048852, "num_tokens": 181168.0, "step": 80 }, { "entropy": 7.35333480834961, "epoch": 0.008402530644523527, "grad_norm": 0.9296875, "learning_rate": 4.2000000000000004e-05, "loss": 7.1552, "mean_token_accuracy": 0.09859942272305489, "num_tokens": 192666.0, "step": 85 }, { "entropy": 7.388514804840088, "epoch": 0.008896797153024912, "grad_norm": 0.81640625, "learning_rate": 4.45e-05, "loss": 7.2204, "mean_token_accuracy": 0.09482975378632545, "num_tokens": 203688.0, "step": 90 }, { "entropy": 7.303425407409668, "epoch": 0.009391063661526295, "grad_norm": 0.9140625, "learning_rate": 4.7000000000000004e-05, "loss": 7.0729, "mean_token_accuracy": 0.10156495124101639, "num_tokens": 214399.0, "step": 95 }, { "entropy": 7.27442512512207, "epoch": 0.009885330170027679, "grad_norm": 0.765625, "learning_rate": 4.9500000000000004e-05, "loss": 7.1681, "mean_token_accuracy": 0.09274221584200859, "num_tokens": 227549.0, "step": 100 }, { "entropy": 7.317437267303466, "epoch": 0.010379596678529062, "grad_norm": 0.765625, "learning_rate": 5.2e-05, "loss": 7.0679, "mean_token_accuracy": 0.11123422309756278, "num_tokens": 239612.0, "step": 105 }, { "entropy": 7.363053894042968, "epoch": 0.010873863187030448, "grad_norm": 0.96484375, "learning_rate": 5.45e-05, "loss": 7.1978, "mean_token_accuracy": 0.09392422363162041, "num_tokens": 251163.0, "step": 110 }, { "entropy": 7.261190605163574, "epoch": 0.011368129695531831, "grad_norm": 0.87890625, "learning_rate": 5.7e-05, "loss": 7.0645, "mean_token_accuracy": 0.10441159456968307, "num_tokens": 263995.0, "step": 115 }, { "entropy": 7.40733699798584, "epoch": 0.011862396204033215, "grad_norm": 1.0390625, "learning_rate": 5.9499999999999996e-05, "loss": 7.2354, "mean_token_accuracy": 0.08496984019875527, "num_tokens": 275103.0, "step": 120 }, { "entropy": 7.273692512512207, "epoch": 0.012356662712534598, "grad_norm": 0.8515625, "learning_rate": 6.2e-05, "loss": 7.1369, "mean_token_accuracy": 0.0968512661755085, "num_tokens": 286838.0, "step": 125 }, { "entropy": 7.423242712020874, "epoch": 0.012850929221035983, "grad_norm": 1.046875, "learning_rate": 6.450000000000001e-05, "loss": 7.1665, "mean_token_accuracy": 0.09364857673645019, "num_tokens": 298750.0, "step": 130 }, { "entropy": 7.250139808654785, "epoch": 0.013345195729537367, "grad_norm": 0.953125, "learning_rate": 6.7e-05, "loss": 7.0329, "mean_token_accuracy": 0.10625170543789864, "num_tokens": 310451.0, "step": 135 }, { "entropy": 7.348578405380249, "epoch": 0.01383946223803875, "grad_norm": 0.95703125, "learning_rate": 6.950000000000001e-05, "loss": 7.1935, "mean_token_accuracy": 0.09695170894265175, "num_tokens": 321232.0, "step": 140 }, { "entropy": 7.488092279434204, "epoch": 0.014333728746540134, "grad_norm": 0.83984375, "learning_rate": 7.2e-05, "loss": 7.106, "mean_token_accuracy": 0.09741687774658203, "num_tokens": 332531.0, "step": 145 }, { "entropy": 7.19592809677124, "epoch": 0.01482799525504152, "grad_norm": 0.94140625, "learning_rate": 7.45e-05, "loss": 7.1008, "mean_token_accuracy": 0.09623056724667549, "num_tokens": 346002.0, "step": 150 }, { "entropy": 7.401388263702392, "epoch": 0.015322261763542903, "grad_norm": 1.03125, "learning_rate": 7.7e-05, "loss": 7.0874, "mean_token_accuracy": 0.09739502891898155, "num_tokens": 356691.0, "step": 155 }, { "entropy": 7.243306970596313, "epoch": 0.015816528272044286, "grad_norm": 0.94140625, "learning_rate": 7.950000000000001e-05, "loss": 7.0938, "mean_token_accuracy": 0.1009882666170597, "num_tokens": 368749.0, "step": 160 }, { "entropy": 7.3369566917419435, "epoch": 0.01631079478054567, "grad_norm": 1.03125, "learning_rate": 8.2e-05, "loss": 7.0241, "mean_token_accuracy": 0.10501249730587006, "num_tokens": 379484.0, "step": 165 }, { "entropy": 7.281102800369263, "epoch": 0.016805061289047053, "grad_norm": 0.953125, "learning_rate": 8.450000000000001e-05, "loss": 7.0703, "mean_token_accuracy": 0.09354055374860763, "num_tokens": 389751.0, "step": 170 }, { "entropy": 7.325433778762817, "epoch": 0.017299327797548437, "grad_norm": 0.99609375, "learning_rate": 8.7e-05, "loss": 7.0892, "mean_token_accuracy": 0.09684126302599907, "num_tokens": 400771.0, "step": 175 }, { "entropy": 7.323175096511841, "epoch": 0.017793594306049824, "grad_norm": 0.90234375, "learning_rate": 8.95e-05, "loss": 7.1061, "mean_token_accuracy": 0.09781083017587662, "num_tokens": 413575.0, "step": 180 }, { "entropy": 7.328048992156982, "epoch": 0.018287860814551207, "grad_norm": 0.890625, "learning_rate": 9.2e-05, "loss": 7.0467, "mean_token_accuracy": 0.09532680064439773, "num_tokens": 424825.0, "step": 185 }, { "entropy": 7.333641099929809, "epoch": 0.01878212732305259, "grad_norm": 0.93359375, "learning_rate": 9.45e-05, "loss": 7.1064, "mean_token_accuracy": 0.10553916320204734, "num_tokens": 435610.0, "step": 190 }, { "entropy": 7.328917694091797, "epoch": 0.019276393831553974, "grad_norm": 1.0625, "learning_rate": 9.7e-05, "loss": 7.1187, "mean_token_accuracy": 0.0999750517308712, "num_tokens": 445855.0, "step": 195 }, { "entropy": 7.2166337966918945, "epoch": 0.019770660340055358, "grad_norm": 0.98046875, "learning_rate": 9.95e-05, "loss": 7.0063, "mean_token_accuracy": 0.10225539430975913, "num_tokens": 456895.0, "step": 200 }, { "entropy": 7.476543855667114, "epoch": 0.02026492684855674, "grad_norm": 1.234375, "learning_rate": 0.000102, "loss": 7.1414, "mean_token_accuracy": 0.09506701603531838, "num_tokens": 467446.0, "step": 205 }, { "entropy": 7.272785186767578, "epoch": 0.020759193357058125, "grad_norm": 0.921875, "learning_rate": 0.00010449999999999999, "loss": 7.0607, "mean_token_accuracy": 0.09756421521306038, "num_tokens": 478988.0, "step": 210 }, { "entropy": 7.290947103500367, "epoch": 0.02125345986555951, "grad_norm": 1.0078125, "learning_rate": 0.000107, "loss": 7.0557, "mean_token_accuracy": 0.10137153342366219, "num_tokens": 491053.0, "step": 215 }, { "entropy": 7.357240819931031, "epoch": 0.021747726374060895, "grad_norm": 1.1171875, "learning_rate": 0.0001095, "loss": 7.1334, "mean_token_accuracy": 0.09304505437612534, "num_tokens": 502279.0, "step": 220 }, { "entropy": 7.198823118209839, "epoch": 0.02224199288256228, "grad_norm": 0.92578125, "learning_rate": 0.000112, "loss": 7.0177, "mean_token_accuracy": 0.10008044987916946, "num_tokens": 513470.0, "step": 225 }, { "entropy": 7.373158121109009, "epoch": 0.022736259391063662, "grad_norm": 1.0234375, "learning_rate": 0.0001145, "loss": 7.0871, "mean_token_accuracy": 0.096877521276474, "num_tokens": 524380.0, "step": 230 }, { "entropy": 7.324968671798706, "epoch": 0.023230525899565046, "grad_norm": 1.1640625, "learning_rate": 0.00011700000000000001, "loss": 7.0885, "mean_token_accuracy": 0.10163207277655602, "num_tokens": 535798.0, "step": 235 }, { "entropy": 7.273069143295288, "epoch": 0.02372479240806643, "grad_norm": 1.0078125, "learning_rate": 0.00011949999999999999, "loss": 7.0313, "mean_token_accuracy": 0.10062324851751328, "num_tokens": 545720.0, "step": 240 }, { "entropy": 7.329104614257813, "epoch": 0.024219058916567813, "grad_norm": 1.2265625, "learning_rate": 0.000122, "loss": 7.0595, "mean_token_accuracy": 0.09972514137625695, "num_tokens": 557110.0, "step": 245 }, { "entropy": 7.1850278854370115, "epoch": 0.024713325425069196, "grad_norm": 1.109375, "learning_rate": 0.0001245, "loss": 7.016, "mean_token_accuracy": 0.10394479855895042, "num_tokens": 568966.0, "step": 250 }, { "entropy": 7.360903692245484, "epoch": 0.02520759193357058, "grad_norm": 0.97265625, "learning_rate": 0.000127, "loss": 7.0469, "mean_token_accuracy": 0.10300094187259674, "num_tokens": 580441.0, "step": 255 }, { "entropy": 7.301402139663696, "epoch": 0.025701858442071967, "grad_norm": 1.0859375, "learning_rate": 0.0001295, "loss": 7.0452, "mean_token_accuracy": 0.09699605703353882, "num_tokens": 592698.0, "step": 260 }, { "entropy": 7.190503692626953, "epoch": 0.02619612495057335, "grad_norm": 0.98828125, "learning_rate": 0.000132, "loss": 7.0198, "mean_token_accuracy": 0.10279446840286255, "num_tokens": 604787.0, "step": 265 }, { "entropy": 7.302949237823486, "epoch": 0.026690391459074734, "grad_norm": 1.0546875, "learning_rate": 0.00013450000000000002, "loss": 7.013, "mean_token_accuracy": 0.09963318407535553, "num_tokens": 616445.0, "step": 270 }, { "entropy": 7.2669110774993895, "epoch": 0.027184657967576117, "grad_norm": 1.0546875, "learning_rate": 0.00013700000000000002, "loss": 7.0808, "mean_token_accuracy": 0.1002419799566269, "num_tokens": 627723.0, "step": 275 }, { "entropy": 7.345779991149902, "epoch": 0.0276789244760775, "grad_norm": 1.0234375, "learning_rate": 0.0001395, "loss": 7.1067, "mean_token_accuracy": 0.10031414031982422, "num_tokens": 638987.0, "step": 280 }, { "entropy": 7.279949617385864, "epoch": 0.028173190984578884, "grad_norm": 1.296875, "learning_rate": 0.00014199999999999998, "loss": 6.9384, "mean_token_accuracy": 0.10166889876127243, "num_tokens": 650626.0, "step": 285 }, { "entropy": 7.149828386306763, "epoch": 0.028667457493080268, "grad_norm": 1.109375, "learning_rate": 0.0001445, "loss": 6.9604, "mean_token_accuracy": 0.10975496619939804, "num_tokens": 661911.0, "step": 290 }, { "entropy": 7.256064605712891, "epoch": 0.02916172400158165, "grad_norm": 1.0234375, "learning_rate": 0.000147, "loss": 7.0137, "mean_token_accuracy": 0.10477377250790595, "num_tokens": 674298.0, "step": 295 }, { "entropy": 7.236632680892944, "epoch": 0.02965599051008304, "grad_norm": 0.96875, "learning_rate": 0.0001495, "loss": 6.9431, "mean_token_accuracy": 0.10994272455573081, "num_tokens": 686000.0, "step": 300 }, { "entropy": 7.216502523422241, "epoch": 0.030150257018584422, "grad_norm": 0.9921875, "learning_rate": 0.000152, "loss": 6.9926, "mean_token_accuracy": 0.10297218561172486, "num_tokens": 698464.0, "step": 305 }, { "entropy": 7.215946102142334, "epoch": 0.030644523527085805, "grad_norm": 1.0234375, "learning_rate": 0.00015450000000000001, "loss": 6.9883, "mean_token_accuracy": 0.09871925041079521, "num_tokens": 709702.0, "step": 310 }, { "entropy": 7.40031623840332, "epoch": 0.03113879003558719, "grad_norm": 1.1171875, "learning_rate": 0.000157, "loss": 7.1009, "mean_token_accuracy": 0.09918646588921547, "num_tokens": 722234.0, "step": 315 }, { "entropy": 7.222815370559692, "epoch": 0.03163305654408857, "grad_norm": 1.09375, "learning_rate": 0.0001595, "loss": 7.0443, "mean_token_accuracy": 0.10143259838223458, "num_tokens": 733001.0, "step": 320 }, { "entropy": 7.251048564910889, "epoch": 0.03212732305258996, "grad_norm": 1.0625, "learning_rate": 0.000162, "loss": 7.0047, "mean_token_accuracy": 0.09862519353628159, "num_tokens": 743315.0, "step": 325 }, { "entropy": 7.253071928024292, "epoch": 0.03262158956109134, "grad_norm": 1.0546875, "learning_rate": 0.00016450000000000001, "loss": 6.9549, "mean_token_accuracy": 0.09725747108459473, "num_tokens": 754386.0, "step": 330 }, { "entropy": 7.24435601234436, "epoch": 0.033115856069592726, "grad_norm": 1.2734375, "learning_rate": 0.00016700000000000002, "loss": 7.0694, "mean_token_accuracy": 0.10413578823208809, "num_tokens": 766504.0, "step": 335 }, { "entropy": 7.090495014190674, "epoch": 0.033610122578094107, "grad_norm": 1.2734375, "learning_rate": 0.00016950000000000003, "loss": 6.9017, "mean_token_accuracy": 0.10729243233799934, "num_tokens": 777039.0, "step": 340 }, { "entropy": 7.284985685348511, "epoch": 0.034104389086595494, "grad_norm": 1.1484375, "learning_rate": 0.00017199999999999998, "loss": 7.0025, "mean_token_accuracy": 0.10153071135282517, "num_tokens": 787890.0, "step": 345 }, { "entropy": 7.234701490402221, "epoch": 0.034598655595096874, "grad_norm": 1.1796875, "learning_rate": 0.00017449999999999999, "loss": 6.9532, "mean_token_accuracy": 0.10262288972735405, "num_tokens": 800129.0, "step": 350 }, { "entropy": 7.139390373229981, "epoch": 0.03509292210359826, "grad_norm": 0.94140625, "learning_rate": 0.000177, "loss": 7.0596, "mean_token_accuracy": 0.0944197230041027, "num_tokens": 812517.0, "step": 355 }, { "entropy": 7.259590196609497, "epoch": 0.03558718861209965, "grad_norm": 1.0, "learning_rate": 0.0001795, "loss": 6.9787, "mean_token_accuracy": 0.10446251705288886, "num_tokens": 824570.0, "step": 360 }, { "entropy": 7.1810768127441404, "epoch": 0.03608145512060103, "grad_norm": 0.94140625, "learning_rate": 0.000182, "loss": 6.9823, "mean_token_accuracy": 0.1032750204205513, "num_tokens": 836506.0, "step": 365 }, { "entropy": 7.251035213470459, "epoch": 0.036575721629102415, "grad_norm": 0.98046875, "learning_rate": 0.0001845, "loss": 6.9702, "mean_token_accuracy": 0.10457680597901345, "num_tokens": 846841.0, "step": 370 }, { "entropy": 7.27037239074707, "epoch": 0.037069988137603795, "grad_norm": 1.1484375, "learning_rate": 0.000187, "loss": 7.0054, "mean_token_accuracy": 0.106174336373806, "num_tokens": 858770.0, "step": 375 }, { "entropy": 7.1212574481964115, "epoch": 0.03756425464610518, "grad_norm": 1.125, "learning_rate": 0.0001895, "loss": 6.8786, "mean_token_accuracy": 0.10385922640562058, "num_tokens": 870184.0, "step": 380 }, { "entropy": 7.172485733032227, "epoch": 0.03805852115460656, "grad_norm": 1.0234375, "learning_rate": 0.000192, "loss": 6.9197, "mean_token_accuracy": 0.10581747069954872, "num_tokens": 881843.0, "step": 385 }, { "entropy": 7.2427778244018555, "epoch": 0.03855278766310795, "grad_norm": 1.0546875, "learning_rate": 0.0001945, "loss": 6.9489, "mean_token_accuracy": 0.10129198804497719, "num_tokens": 893453.0, "step": 390 }, { "entropy": 7.205210494995117, "epoch": 0.03904705417160933, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 7.0049, "mean_token_accuracy": 0.09680559858679771, "num_tokens": 904417.0, "step": 395 }, { "entropy": 7.202549695968628, "epoch": 0.039541320680110716, "grad_norm": 1.1484375, "learning_rate": 0.00019950000000000002, "loss": 6.9462, "mean_token_accuracy": 0.0999035358428955, "num_tokens": 915134.0, "step": 400 }, { "entropy": 7.133806133270264, "epoch": 0.0400355871886121, "grad_norm": 1.0390625, "learning_rate": 0.000202, "loss": 6.9589, "mean_token_accuracy": 0.1034577377140522, "num_tokens": 926361.0, "step": 405 }, { "entropy": 7.144542980194092, "epoch": 0.04052985369711348, "grad_norm": 1.1015625, "learning_rate": 0.00020449999999999998, "loss": 6.8841, "mean_token_accuracy": 0.10176018252968788, "num_tokens": 937474.0, "step": 410 }, { "entropy": 7.3199704647064205, "epoch": 0.04102412020561487, "grad_norm": 1.0703125, "learning_rate": 0.000207, "loss": 6.947, "mean_token_accuracy": 0.10589171275496483, "num_tokens": 948897.0, "step": 415 }, { "entropy": 7.157266998291016, "epoch": 0.04151838671411625, "grad_norm": 1.15625, "learning_rate": 0.0002095, "loss": 6.9643, "mean_token_accuracy": 0.1008329525589943, "num_tokens": 960669.0, "step": 420 }, { "entropy": 7.024852180480957, "epoch": 0.04201265322261764, "grad_norm": 1.0, "learning_rate": 0.000212, "loss": 6.8152, "mean_token_accuracy": 0.10260056778788566, "num_tokens": 973001.0, "step": 425 }, { "entropy": 7.119008874893188, "epoch": 0.04250691973111902, "grad_norm": 1.0546875, "learning_rate": 0.0002145, "loss": 6.8859, "mean_token_accuracy": 0.10822405442595481, "num_tokens": 986214.0, "step": 430 }, { "entropy": 7.105495595932007, "epoch": 0.043001186239620404, "grad_norm": 1.0703125, "learning_rate": 0.00021700000000000002, "loss": 6.8937, "mean_token_accuracy": 0.10061700344085693, "num_tokens": 997363.0, "step": 435 }, { "entropy": 7.120448970794678, "epoch": 0.04349545274812179, "grad_norm": 1.0390625, "learning_rate": 0.0002195, "loss": 6.8093, "mean_token_accuracy": 0.11288737356662751, "num_tokens": 1009543.0, "step": 440 }, { "entropy": 7.0541246891021725, "epoch": 0.04398971925662317, "grad_norm": 1.0234375, "learning_rate": 0.000222, "loss": 6.9215, "mean_token_accuracy": 0.10269275158643723, "num_tokens": 1020561.0, "step": 445 }, { "entropy": 7.185726308822632, "epoch": 0.04448398576512456, "grad_norm": 0.984375, "learning_rate": 0.0002245, "loss": 6.8725, "mean_token_accuracy": 0.10224331989884376, "num_tokens": 1032587.0, "step": 450 }, { "entropy": 7.159319496154785, "epoch": 0.04497825227362594, "grad_norm": 1.140625, "learning_rate": 0.00022700000000000002, "loss": 6.8784, "mean_token_accuracy": 0.1019284375011921, "num_tokens": 1044249.0, "step": 455 }, { "entropy": 7.076584959030152, "epoch": 0.045472518782127325, "grad_norm": 1.328125, "learning_rate": 0.00022950000000000002, "loss": 6.9215, "mean_token_accuracy": 0.10558762773871422, "num_tokens": 1055415.0, "step": 460 }, { "entropy": 7.1408079147338865, "epoch": 0.045966785290628705, "grad_norm": 1.03125, "learning_rate": 0.00023200000000000003, "loss": 6.8942, "mean_token_accuracy": 0.10558660700917244, "num_tokens": 1066593.0, "step": 465 }, { "entropy": 7.15621657371521, "epoch": 0.04646105179913009, "grad_norm": 1.109375, "learning_rate": 0.00023449999999999998, "loss": 6.8924, "mean_token_accuracy": 0.10691260844469071, "num_tokens": 1076966.0, "step": 470 }, { "entropy": 7.067881631851196, "epoch": 0.04695531830763147, "grad_norm": 1.03125, "learning_rate": 0.000237, "loss": 6.9491, "mean_token_accuracy": 0.09959092512726783, "num_tokens": 1089927.0, "step": 475 }, { "entropy": 7.091880464553833, "epoch": 0.04744958481613286, "grad_norm": 1.09375, "learning_rate": 0.0002395, "loss": 6.8869, "mean_token_accuracy": 0.10327862426638604, "num_tokens": 1101920.0, "step": 480 }, { "entropy": 7.182226657867432, "epoch": 0.047943851324634246, "grad_norm": 1.0078125, "learning_rate": 0.000242, "loss": 6.9376, "mean_token_accuracy": 0.10818986669182777, "num_tokens": 1115078.0, "step": 485 }, { "entropy": 7.180230808258057, "epoch": 0.048438117833135626, "grad_norm": 1.109375, "learning_rate": 0.0002445, "loss": 7.0315, "mean_token_accuracy": 0.0969414807856083, "num_tokens": 1127138.0, "step": 490 }, { "entropy": 7.088583707809448, "epoch": 0.04893238434163701, "grad_norm": 1.1875, "learning_rate": 0.000247, "loss": 6.815, "mean_token_accuracy": 0.10144753381609917, "num_tokens": 1138390.0, "step": 495 }, { "entropy": 7.003582715988159, "epoch": 0.04942665085013839, "grad_norm": 1.09375, "learning_rate": 0.0002495, "loss": 6.78, "mean_token_accuracy": 0.11048796996474267, "num_tokens": 1149124.0, "step": 500 }, { "entropy": 7.101625585556031, "epoch": 0.04992091735863978, "grad_norm": 1.109375, "learning_rate": 0.000252, "loss": 6.8585, "mean_token_accuracy": 0.10951191484928131, "num_tokens": 1161091.0, "step": 505 }, { "entropy": 7.118922424316406, "epoch": 0.05041518386714116, "grad_norm": 0.99609375, "learning_rate": 0.0002545, "loss": 6.8355, "mean_token_accuracy": 0.10461836084723472, "num_tokens": 1171919.0, "step": 510 }, { "entropy": 7.051087188720703, "epoch": 0.05090945037564255, "grad_norm": 1.0859375, "learning_rate": 0.000257, "loss": 6.8633, "mean_token_accuracy": 0.10401171222329139, "num_tokens": 1183688.0, "step": 515 }, { "entropy": 7.0168451309204105, "epoch": 0.051403716884143934, "grad_norm": 1.09375, "learning_rate": 0.0002595, "loss": 6.7819, "mean_token_accuracy": 0.10449134409427643, "num_tokens": 1195323.0, "step": 520 }, { "entropy": 7.09809103012085, "epoch": 0.051897983392645314, "grad_norm": 1.1015625, "learning_rate": 0.000262, "loss": 6.8999, "mean_token_accuracy": 0.10218222662806511, "num_tokens": 1206782.0, "step": 525 }, { "entropy": 6.965949535369873, "epoch": 0.0523922499011467, "grad_norm": 1.0625, "learning_rate": 0.00026450000000000003, "loss": 6.8013, "mean_token_accuracy": 0.10973932594060898, "num_tokens": 1218102.0, "step": 530 }, { "entropy": 7.017365598678589, "epoch": 0.05288651640964808, "grad_norm": 1.1328125, "learning_rate": 0.00026700000000000004, "loss": 6.7659, "mean_token_accuracy": 0.10771052315831184, "num_tokens": 1230199.0, "step": 535 }, { "entropy": 7.0721368312835695, "epoch": 0.05338078291814947, "grad_norm": 1.03125, "learning_rate": 0.00026950000000000005, "loss": 6.8896, "mean_token_accuracy": 0.10399755015969277, "num_tokens": 1242127.0, "step": 540 }, { "entropy": 7.027034282684326, "epoch": 0.05387504942665085, "grad_norm": 1.1796875, "learning_rate": 0.00027200000000000005, "loss": 6.7655, "mean_token_accuracy": 0.10667505711317063, "num_tokens": 1252329.0, "step": 545 }, { "entropy": 6.865018033981324, "epoch": 0.054369315935152235, "grad_norm": 1.0390625, "learning_rate": 0.0002745, "loss": 6.7666, "mean_token_accuracy": 0.11077538877725601, "num_tokens": 1264832.0, "step": 550 }, { "entropy": 7.053894948959351, "epoch": 0.054863582443653615, "grad_norm": 1.0625, "learning_rate": 0.000277, "loss": 6.8414, "mean_token_accuracy": 0.10259129181504249, "num_tokens": 1276708.0, "step": 555 }, { "entropy": 7.017140913009643, "epoch": 0.055357848952155, "grad_norm": 1.1484375, "learning_rate": 0.0002795, "loss": 6.7446, "mean_token_accuracy": 0.11817902401089668, "num_tokens": 1288089.0, "step": 560 }, { "entropy": 7.102619647979736, "epoch": 0.05585211546065639, "grad_norm": 1.2890625, "learning_rate": 0.00028199999999999997, "loss": 6.9011, "mean_token_accuracy": 0.10063079670071602, "num_tokens": 1299411.0, "step": 565 }, { "entropy": 7.038193321228027, "epoch": 0.05634638196915777, "grad_norm": 1.015625, "learning_rate": 0.0002845, "loss": 6.8678, "mean_token_accuracy": 0.10497712716460228, "num_tokens": 1311368.0, "step": 570 }, { "entropy": 6.996581506729126, "epoch": 0.056840648477659156, "grad_norm": 1.140625, "learning_rate": 0.000287, "loss": 6.7798, "mean_token_accuracy": 0.1104745551943779, "num_tokens": 1321962.0, "step": 575 }, { "entropy": 6.984814691543579, "epoch": 0.057334914986160536, "grad_norm": 1.046875, "learning_rate": 0.0002895, "loss": 6.7845, "mean_token_accuracy": 0.10723584592342376, "num_tokens": 1335150.0, "step": 580 }, { "entropy": 7.0060882568359375, "epoch": 0.05782918149466192, "grad_norm": 1.015625, "learning_rate": 0.000292, "loss": 6.8106, "mean_token_accuracy": 0.10954170823097228, "num_tokens": 1346986.0, "step": 585 }, { "entropy": 7.04237003326416, "epoch": 0.0583234480031633, "grad_norm": 1.1875, "learning_rate": 0.0002945, "loss": 6.7456, "mean_token_accuracy": 0.11029022559523582, "num_tokens": 1357820.0, "step": 590 }, { "entropy": 6.898483562469482, "epoch": 0.05881771451166469, "grad_norm": 1.203125, "learning_rate": 0.000297, "loss": 6.7381, "mean_token_accuracy": 0.1155846431851387, "num_tokens": 1368269.0, "step": 595 }, { "entropy": 6.914667129516602, "epoch": 0.05931198102016608, "grad_norm": 1.1796875, "learning_rate": 0.0002995, "loss": 6.7699, "mean_token_accuracy": 0.10781971290707588, "num_tokens": 1380364.0, "step": 600 }, { "entropy": 6.9423737049102785, "epoch": 0.05980624752866746, "grad_norm": 1.2265625, "learning_rate": 0.000302, "loss": 6.7359, "mean_token_accuracy": 0.11458505317568779, "num_tokens": 1390667.0, "step": 605 }, { "entropy": 6.890728282928467, "epoch": 0.060300514037168844, "grad_norm": 1.0703125, "learning_rate": 0.0003045, "loss": 6.6885, "mean_token_accuracy": 0.10985699743032455, "num_tokens": 1401452.0, "step": 610 }, { "entropy": 6.968847942352295, "epoch": 0.060794780545670224, "grad_norm": 1.1328125, "learning_rate": 0.000307, "loss": 6.6936, "mean_token_accuracy": 0.11100370958447456, "num_tokens": 1412947.0, "step": 615 }, { "entropy": 6.867507553100586, "epoch": 0.06128904705417161, "grad_norm": 0.953125, "learning_rate": 0.0003095, "loss": 6.7476, "mean_token_accuracy": 0.10398394390940666, "num_tokens": 1425123.0, "step": 620 }, { "entropy": 6.928701877593994, "epoch": 0.06178331356267299, "grad_norm": 1.0703125, "learning_rate": 0.000312, "loss": 6.7218, "mean_token_accuracy": 0.10982921719551086, "num_tokens": 1436538.0, "step": 625 }, { "entropy": 6.933251285552979, "epoch": 0.06227758007117438, "grad_norm": 1.046875, "learning_rate": 0.0003145, "loss": 6.77, "mean_token_accuracy": 0.10577303692698478, "num_tokens": 1448269.0, "step": 630 }, { "entropy": 6.900527620315552, "epoch": 0.06277184657967576, "grad_norm": 1.1875, "learning_rate": 0.000317, "loss": 6.7432, "mean_token_accuracy": 0.11349172964692116, "num_tokens": 1459729.0, "step": 635 }, { "entropy": 6.960564184188843, "epoch": 0.06326611308817714, "grad_norm": 1.125, "learning_rate": 0.0003195, "loss": 6.7581, "mean_token_accuracy": 0.10724205747246743, "num_tokens": 1470684.0, "step": 640 }, { "entropy": 6.889400863647461, "epoch": 0.06376037959667853, "grad_norm": 0.9375, "learning_rate": 0.000322, "loss": 6.7232, "mean_token_accuracy": 0.10671663433313369, "num_tokens": 1483571.0, "step": 645 }, { "entropy": 6.8848834991455075, "epoch": 0.06425464610517992, "grad_norm": 1.0546875, "learning_rate": 0.00032450000000000003, "loss": 6.6891, "mean_token_accuracy": 0.11692152470350266, "num_tokens": 1494671.0, "step": 650 }, { "entropy": 6.905150508880615, "epoch": 0.06474891261368129, "grad_norm": 1.296875, "learning_rate": 0.00032700000000000003, "loss": 6.7095, "mean_token_accuracy": 0.1126905307173729, "num_tokens": 1505435.0, "step": 655 }, { "entropy": 6.948776197433472, "epoch": 0.06524317912218268, "grad_norm": 1.0859375, "learning_rate": 0.00032950000000000004, "loss": 6.803, "mean_token_accuracy": 0.10531418174505233, "num_tokens": 1518510.0, "step": 660 }, { "entropy": 6.9253791809082035, "epoch": 0.06573744563068407, "grad_norm": 1.0859375, "learning_rate": 0.00033200000000000005, "loss": 6.7145, "mean_token_accuracy": 0.11463218927383423, "num_tokens": 1530218.0, "step": 665 }, { "entropy": 6.91641206741333, "epoch": 0.06623171213918545, "grad_norm": 1.078125, "learning_rate": 0.00033450000000000005, "loss": 6.7582, "mean_token_accuracy": 0.11466718763113022, "num_tokens": 1542486.0, "step": 670 }, { "entropy": 6.8444969177246096, "epoch": 0.06672597864768683, "grad_norm": 1.0390625, "learning_rate": 0.000337, "loss": 6.7533, "mean_token_accuracy": 0.10930409133434296, "num_tokens": 1553873.0, "step": 675 }, { "entropy": 6.942787122726441, "epoch": 0.06722024515618821, "grad_norm": 1.0625, "learning_rate": 0.0003395, "loss": 6.7047, "mean_token_accuracy": 0.1153480589389801, "num_tokens": 1565343.0, "step": 680 }, { "entropy": 6.903558826446533, "epoch": 0.0677145116646896, "grad_norm": 1.078125, "learning_rate": 0.000342, "loss": 6.7608, "mean_token_accuracy": 0.10652155056595802, "num_tokens": 1577061.0, "step": 685 }, { "entropy": 6.872377204895019, "epoch": 0.06820877817319099, "grad_norm": 1.0625, "learning_rate": 0.00034449999999999997, "loss": 6.7529, "mean_token_accuracy": 0.11244799494743347, "num_tokens": 1588083.0, "step": 690 }, { "entropy": 6.879619789123535, "epoch": 0.06870304468169237, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 6.7159, "mean_token_accuracy": 0.10822473615407943, "num_tokens": 1599796.0, "step": 695 }, { "entropy": 6.90326623916626, "epoch": 0.06919731119019375, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 6.7681, "mean_token_accuracy": 0.10771963074803352, "num_tokens": 1611994.0, "step": 700 }, { "entropy": 6.872850322723389, "epoch": 0.06969157769869513, "grad_norm": 1.0625, "learning_rate": 0.000352, "loss": 6.7022, "mean_token_accuracy": 0.10573551878333091, "num_tokens": 1623280.0, "step": 705 }, { "entropy": 6.8690471172332765, "epoch": 0.07018584420719652, "grad_norm": 1.21875, "learning_rate": 0.0003545, "loss": 6.7681, "mean_token_accuracy": 0.10785022675991059, "num_tokens": 1634989.0, "step": 710 }, { "entropy": 6.947969198226929, "epoch": 0.07068011071569791, "grad_norm": 1.0546875, "learning_rate": 0.000357, "loss": 6.7925, "mean_token_accuracy": 0.10478616431355477, "num_tokens": 1647042.0, "step": 715 }, { "entropy": 6.809376001358032, "epoch": 0.0711743772241993, "grad_norm": 1.09375, "learning_rate": 0.0003595, "loss": 6.6855, "mean_token_accuracy": 0.1154635414481163, "num_tokens": 1659245.0, "step": 720 }, { "entropy": 6.81630311012268, "epoch": 0.07166864373270067, "grad_norm": 1.140625, "learning_rate": 0.000362, "loss": 6.6819, "mean_token_accuracy": 0.10983811244368553, "num_tokens": 1670271.0, "step": 725 }, { "entropy": 6.873712110519409, "epoch": 0.07216291024120206, "grad_norm": 0.96875, "learning_rate": 0.0003645, "loss": 6.735, "mean_token_accuracy": 0.11080555841326714, "num_tokens": 1682648.0, "step": 730 }, { "entropy": 6.822260570526123, "epoch": 0.07265717674970344, "grad_norm": 1.0859375, "learning_rate": 0.000367, "loss": 6.7573, "mean_token_accuracy": 0.1052017480134964, "num_tokens": 1694542.0, "step": 735 }, { "entropy": 6.849833726882935, "epoch": 0.07315144325820483, "grad_norm": 1.015625, "learning_rate": 0.0003695, "loss": 6.6493, "mean_token_accuracy": 0.10704348310828209, "num_tokens": 1705737.0, "step": 740 }, { "entropy": 6.862112379074096, "epoch": 0.0736457097667062, "grad_norm": 0.95703125, "learning_rate": 0.000372, "loss": 6.71, "mean_token_accuracy": 0.10965840369462967, "num_tokens": 1718474.0, "step": 745 }, { "entropy": 6.826199579238891, "epoch": 0.07413997627520759, "grad_norm": 1.1015625, "learning_rate": 0.0003745, "loss": 6.6873, "mean_token_accuracy": 0.1082968644797802, "num_tokens": 1729360.0, "step": 750 }, { "entropy": 6.8160795211792, "epoch": 0.07463424278370898, "grad_norm": 1.0703125, "learning_rate": 0.000377, "loss": 6.6964, "mean_token_accuracy": 0.1107470378279686, "num_tokens": 1739654.0, "step": 755 }, { "entropy": 6.836647272109985, "epoch": 0.07512850929221036, "grad_norm": 1.09375, "learning_rate": 0.0003795, "loss": 6.6939, "mean_token_accuracy": 0.11239867880940438, "num_tokens": 1752158.0, "step": 760 }, { "entropy": 6.834174489974975, "epoch": 0.07562277580071175, "grad_norm": 1.171875, "learning_rate": 0.000382, "loss": 6.6923, "mean_token_accuracy": 0.11612112373113632, "num_tokens": 1764545.0, "step": 765 }, { "entropy": 6.821158313751221, "epoch": 0.07611704230921312, "grad_norm": 1.3828125, "learning_rate": 0.0003845, "loss": 6.6814, "mean_token_accuracy": 0.1128039114177227, "num_tokens": 1775422.0, "step": 770 }, { "entropy": 6.840568494796753, "epoch": 0.07661130881771451, "grad_norm": 0.9140625, "learning_rate": 0.00038700000000000003, "loss": 6.7088, "mean_token_accuracy": 0.10114984959363937, "num_tokens": 1787833.0, "step": 775 }, { "entropy": 6.74714674949646, "epoch": 0.0771055753262159, "grad_norm": 1.1640625, "learning_rate": 0.00038950000000000003, "loss": 6.5723, "mean_token_accuracy": 0.1219009131193161, "num_tokens": 1798508.0, "step": 780 }, { "entropy": 6.753849983215332, "epoch": 0.07759984183471728, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.6209, "mean_token_accuracy": 0.11469837054610252, "num_tokens": 1809873.0, "step": 785 }, { "entropy": 6.821059226989746, "epoch": 0.07809410834321866, "grad_norm": 1.3515625, "learning_rate": 0.00039450000000000005, "loss": 6.7014, "mean_token_accuracy": 0.11237634271383286, "num_tokens": 1820876.0, "step": 790 }, { "entropy": 6.7968470573425295, "epoch": 0.07858837485172004, "grad_norm": 1.0390625, "learning_rate": 0.00039700000000000005, "loss": 6.663, "mean_token_accuracy": 0.10904834121465683, "num_tokens": 1833233.0, "step": 795 }, { "entropy": 6.812273120880127, "epoch": 0.07908264136022143, "grad_norm": 1.140625, "learning_rate": 0.0003995, "loss": 6.7481, "mean_token_accuracy": 0.10785818174481392, "num_tokens": 1844520.0, "step": 800 }, { "entropy": 6.765308666229248, "epoch": 0.07957690786872282, "grad_norm": 1.0546875, "learning_rate": 0.000402, "loss": 6.6292, "mean_token_accuracy": 0.1142186164855957, "num_tokens": 1856814.0, "step": 805 }, { "entropy": 6.732009649276733, "epoch": 0.0800711743772242, "grad_norm": 0.96875, "learning_rate": 0.0004045, "loss": 6.6196, "mean_token_accuracy": 0.11811698004603385, "num_tokens": 1867581.0, "step": 810 }, { "entropy": 6.84562578201294, "epoch": 0.08056544088572558, "grad_norm": 1.2578125, "learning_rate": 0.00040699999999999997, "loss": 6.6907, "mean_token_accuracy": 0.10590304806828499, "num_tokens": 1879302.0, "step": 815 }, { "entropy": 6.756962633132934, "epoch": 0.08105970739422697, "grad_norm": 1.015625, "learning_rate": 0.0004095, "loss": 6.6571, "mean_token_accuracy": 0.10640354081988335, "num_tokens": 1891697.0, "step": 820 }, { "entropy": 6.759096002578735, "epoch": 0.08155397390272835, "grad_norm": 1.078125, "learning_rate": 0.000412, "loss": 6.5979, "mean_token_accuracy": 0.11474953293800354, "num_tokens": 1903544.0, "step": 825 }, { "entropy": 6.774603033065796, "epoch": 0.08204824041122974, "grad_norm": 1.2265625, "learning_rate": 0.0004145, "loss": 6.6545, "mean_token_accuracy": 0.11101827323436737, "num_tokens": 1915286.0, "step": 830 }, { "entropy": 6.688508129119873, "epoch": 0.08254250691973111, "grad_norm": 1.1640625, "learning_rate": 0.000417, "loss": 6.5346, "mean_token_accuracy": 0.11861704438924789, "num_tokens": 1926361.0, "step": 835 }, { "entropy": 6.751745128631592, "epoch": 0.0830367734282325, "grad_norm": 0.96875, "learning_rate": 0.0004195, "loss": 6.6299, "mean_token_accuracy": 0.11083293855190277, "num_tokens": 1938540.0, "step": 840 }, { "entropy": 6.763704109191894, "epoch": 0.08353103993673389, "grad_norm": 0.9140625, "learning_rate": 0.000422, "loss": 6.6603, "mean_token_accuracy": 0.10724062249064445, "num_tokens": 1950532.0, "step": 845 }, { "entropy": 6.8038843154907225, "epoch": 0.08402530644523527, "grad_norm": 1.078125, "learning_rate": 0.0004245, "loss": 6.6778, "mean_token_accuracy": 0.10919453650712967, "num_tokens": 1960899.0, "step": 850 }, { "entropy": 6.68118052482605, "epoch": 0.08451957295373666, "grad_norm": 1.1796875, "learning_rate": 0.000427, "loss": 6.6496, "mean_token_accuracy": 0.11730073392391205, "num_tokens": 1972278.0, "step": 855 }, { "entropy": 6.725075197219849, "epoch": 0.08501383946223803, "grad_norm": 0.9921875, "learning_rate": 0.0004295, "loss": 6.6692, "mean_token_accuracy": 0.1092053584754467, "num_tokens": 1985079.0, "step": 860 }, { "entropy": 6.635829877853394, "epoch": 0.08550810597073942, "grad_norm": 1.15625, "learning_rate": 0.000432, "loss": 6.7065, "mean_token_accuracy": 0.10706321522593498, "num_tokens": 1996467.0, "step": 865 }, { "entropy": 6.8284436702728275, "epoch": 0.08600237247924081, "grad_norm": 1.0546875, "learning_rate": 0.0004345, "loss": 6.5832, "mean_token_accuracy": 0.11370615139603615, "num_tokens": 2007339.0, "step": 870 }, { "entropy": 6.677596378326416, "epoch": 0.0864966389877422, "grad_norm": 1.015625, "learning_rate": 0.000437, "loss": 6.5879, "mean_token_accuracy": 0.1196245089173317, "num_tokens": 2019962.0, "step": 875 }, { "entropy": 6.747453260421753, "epoch": 0.08699090549624358, "grad_norm": 1.1484375, "learning_rate": 0.0004395, "loss": 6.5866, "mean_token_accuracy": 0.11758355721831322, "num_tokens": 2031251.0, "step": 880 }, { "entropy": 6.661469602584839, "epoch": 0.08748517200474495, "grad_norm": 0.99609375, "learning_rate": 0.000442, "loss": 6.6013, "mean_token_accuracy": 0.11161932870745658, "num_tokens": 2042412.0, "step": 885 }, { "entropy": 6.6397772312164305, "epoch": 0.08797943851324634, "grad_norm": 1.0625, "learning_rate": 0.0004445, "loss": 6.6221, "mean_token_accuracy": 0.11210491955280304, "num_tokens": 2054423.0, "step": 890 }, { "entropy": 6.686139965057373, "epoch": 0.08847370502174773, "grad_norm": 1.046875, "learning_rate": 0.000447, "loss": 6.595, "mean_token_accuracy": 0.10692231729626656, "num_tokens": 2065657.0, "step": 895 }, { "entropy": 6.717379331588745, "epoch": 0.08896797153024912, "grad_norm": 1.046875, "learning_rate": 0.00044950000000000003, "loss": 6.5827, "mean_token_accuracy": 0.11325386464595795, "num_tokens": 2076305.0, "step": 900 }, { "entropy": 6.697859430313111, "epoch": 0.08946223803875049, "grad_norm": 1.046875, "learning_rate": 0.00045200000000000004, "loss": 6.5783, "mean_token_accuracy": 0.11316154897212982, "num_tokens": 2087734.0, "step": 905 }, { "entropy": 6.595232200622559, "epoch": 0.08995650454725188, "grad_norm": 1.0703125, "learning_rate": 0.00045450000000000004, "loss": 6.4953, "mean_token_accuracy": 0.12035880610346794, "num_tokens": 2098016.0, "step": 910 }, { "entropy": 6.665337467193604, "epoch": 0.09045077105575326, "grad_norm": 0.9609375, "learning_rate": 0.00045700000000000005, "loss": 6.6678, "mean_token_accuracy": 0.10886707603931427, "num_tokens": 2110293.0, "step": 915 }, { "entropy": 6.673768377304077, "epoch": 0.09094503756425465, "grad_norm": 1.0390625, "learning_rate": 0.00045950000000000006, "loss": 6.4485, "mean_token_accuracy": 0.11682527139782906, "num_tokens": 2120441.0, "step": 920 }, { "entropy": 6.539246511459351, "epoch": 0.09143930407275604, "grad_norm": 1.0390625, "learning_rate": 0.000462, "loss": 6.5683, "mean_token_accuracy": 0.11887063086032867, "num_tokens": 2131520.0, "step": 925 }, { "entropy": 6.664091300964356, "epoch": 0.09193357058125741, "grad_norm": 0.8828125, "learning_rate": 0.0004645, "loss": 6.5796, "mean_token_accuracy": 0.11637971252202987, "num_tokens": 2145005.0, "step": 930 }, { "entropy": 6.605041790008545, "epoch": 0.0924278370897588, "grad_norm": 1.0625, "learning_rate": 0.000467, "loss": 6.5338, "mean_token_accuracy": 0.1211809828877449, "num_tokens": 2156608.0, "step": 935 }, { "entropy": 6.601588439941406, "epoch": 0.09292210359826018, "grad_norm": 1.03125, "learning_rate": 0.0004695, "loss": 6.5318, "mean_token_accuracy": 0.11969754993915557, "num_tokens": 2168341.0, "step": 940 }, { "entropy": 6.625442409515381, "epoch": 0.09341637010676157, "grad_norm": 1.0546875, "learning_rate": 0.000472, "loss": 6.5258, "mean_token_accuracy": 0.11236160099506379, "num_tokens": 2178704.0, "step": 945 }, { "entropy": 6.704224395751953, "epoch": 0.09391063661526294, "grad_norm": 1.0390625, "learning_rate": 0.0004745, "loss": 6.6906, "mean_token_accuracy": 0.10928287953138352, "num_tokens": 2190884.0, "step": 950 }, { "entropy": 6.682482194900513, "epoch": 0.09440490312376433, "grad_norm": 1.0390625, "learning_rate": 0.000477, "loss": 6.598, "mean_token_accuracy": 0.1167626291513443, "num_tokens": 2201822.0, "step": 955 }, { "entropy": 6.629432439804077, "epoch": 0.09489916963226572, "grad_norm": 1.0703125, "learning_rate": 0.0004795, "loss": 6.5926, "mean_token_accuracy": 0.11254436299204826, "num_tokens": 2213362.0, "step": 960 }, { "entropy": 6.692664337158203, "epoch": 0.0953934361407671, "grad_norm": 1.0234375, "learning_rate": 0.000482, "loss": 6.602, "mean_token_accuracy": 0.11311232969164849, "num_tokens": 2224366.0, "step": 965 }, { "entropy": 6.46690821647644, "epoch": 0.09588770264926849, "grad_norm": 1.1171875, "learning_rate": 0.0004845, "loss": 6.4535, "mean_token_accuracy": 0.1190331868827343, "num_tokens": 2234645.0, "step": 970 }, { "entropy": 6.678108978271484, "epoch": 0.09638196915776986, "grad_norm": 1.0703125, "learning_rate": 0.000487, "loss": 6.5498, "mean_token_accuracy": 0.12018159404397011, "num_tokens": 2245904.0, "step": 975 }, { "entropy": 6.4710277080535885, "epoch": 0.09687623566627125, "grad_norm": 1.03125, "learning_rate": 0.0004895, "loss": 6.49, "mean_token_accuracy": 0.11942838132381439, "num_tokens": 2257753.0, "step": 980 }, { "entropy": 6.551316976547241, "epoch": 0.09737050217477264, "grad_norm": 1.03125, "learning_rate": 0.000492, "loss": 6.4953, "mean_token_accuracy": 0.1244705080986023, "num_tokens": 2269009.0, "step": 985 }, { "entropy": 6.693281459808349, "epoch": 0.09786476868327403, "grad_norm": 1.0, "learning_rate": 0.0004945, "loss": 6.5493, "mean_token_accuracy": 0.11529032737016678, "num_tokens": 2279840.0, "step": 990 }, { "entropy": 6.533772134780884, "epoch": 0.0983590351917754, "grad_norm": 1.1328125, "learning_rate": 0.000497, "loss": 6.5154, "mean_token_accuracy": 0.11877169013023377, "num_tokens": 2290577.0, "step": 995 }, { "entropy": 6.553924179077148, "epoch": 0.09885330170027679, "grad_norm": 1.0625, "learning_rate": 0.0004995, "loss": 6.5274, "mean_token_accuracy": 0.12048136815428734, "num_tokens": 2301341.0, "step": 1000 }, { "entropy": 6.566124486923218, "epoch": 0.09934756820877817, "grad_norm": 1.0234375, "learning_rate": 0.0004999999982287888, "loss": 6.5896, "mean_token_accuracy": 0.11639286801218987, "num_tokens": 2312505.0, "step": 1005 }, { "entropy": 6.718512153625488, "epoch": 0.09984183471727956, "grad_norm": 1.015625, "learning_rate": 0.0004999999910332434, "loss": 6.5236, "mean_token_accuracy": 0.11419004276394844, "num_tokens": 2323443.0, "step": 1010 }, { "entropy": 6.4791271686553955, "epoch": 0.10033610122578095, "grad_norm": 1.03125, "learning_rate": 0.0004999999783026635, "loss": 6.5439, "mean_token_accuracy": 0.11673406213521957, "num_tokens": 2335686.0, "step": 1015 }, { "entropy": 6.514018297195435, "epoch": 0.10083036773428232, "grad_norm": 1.0234375, "learning_rate": 0.0004999999600370491, "loss": 6.5178, "mean_token_accuracy": 0.11814445331692695, "num_tokens": 2347273.0, "step": 1020 }, { "entropy": 6.552177906036377, "epoch": 0.1013246342427837, "grad_norm": 1.1328125, "learning_rate": 0.0004999999362364008, "loss": 6.4427, "mean_token_accuracy": 0.12624893859028816, "num_tokens": 2358011.0, "step": 1025 }, { "entropy": 6.5004723072052, "epoch": 0.1018189007512851, "grad_norm": 1.015625, "learning_rate": 0.0004999999069007191, "loss": 6.5815, "mean_token_accuracy": 0.11536967605352402, "num_tokens": 2371390.0, "step": 1030 }, { "entropy": 6.596110677719116, "epoch": 0.10231316725978648, "grad_norm": 1.0546875, "learning_rate": 0.0004999998720300048, "loss": 6.5271, "mean_token_accuracy": 0.12005563005805016, "num_tokens": 2381887.0, "step": 1035 }, { "entropy": 6.551437664031982, "epoch": 0.10280743376828787, "grad_norm": 0.921875, "learning_rate": 0.0004999998316242589, "loss": 6.4663, "mean_token_accuracy": 0.11999196782708169, "num_tokens": 2393632.0, "step": 1040 }, { "entropy": 6.530908870697021, "epoch": 0.10330170027678924, "grad_norm": 1.0703125, "learning_rate": 0.0004999997856834821, "loss": 6.4778, "mean_token_accuracy": 0.12028345614671707, "num_tokens": 2405686.0, "step": 1045 }, { "entropy": 6.457987642288208, "epoch": 0.10379596678529063, "grad_norm": 0.984375, "learning_rate": 0.0004999997342076757, "loss": 6.455, "mean_token_accuracy": 0.11674800738692284, "num_tokens": 2417459.0, "step": 1050 }, { "entropy": 6.636799621582031, "epoch": 0.10429023329379201, "grad_norm": 0.91015625, "learning_rate": 0.0004999996771968408, "loss": 6.4995, "mean_token_accuracy": 0.11853041127324104, "num_tokens": 2428689.0, "step": 1055 }, { "entropy": 6.509030675888061, "epoch": 0.1047844998022934, "grad_norm": 1.078125, "learning_rate": 0.0004999996146509791, "loss": 6.5295, "mean_token_accuracy": 0.11135807186365128, "num_tokens": 2439437.0, "step": 1060 }, { "entropy": 6.580507850646972, "epoch": 0.10527876631079477, "grad_norm": 1.0390625, "learning_rate": 0.0004999995465700919, "loss": 6.5104, "mean_token_accuracy": 0.11756298467516899, "num_tokens": 2450576.0, "step": 1065 }, { "entropy": 6.587932443618774, "epoch": 0.10577303281929616, "grad_norm": 1.0078125, "learning_rate": 0.0004999994729541809, "loss": 6.6509, "mean_token_accuracy": 0.11502083018422127, "num_tokens": 2462684.0, "step": 1070 }, { "entropy": 6.633237361907959, "epoch": 0.10626729932779755, "grad_norm": 1.2265625, "learning_rate": 0.0004999993938032481, "loss": 6.5244, "mean_token_accuracy": 0.12519583106040955, "num_tokens": 2474193.0, "step": 1075 }, { "entropy": 6.394119358062744, "epoch": 0.10676156583629894, "grad_norm": 0.9921875, "learning_rate": 0.0004999993091172952, "loss": 6.4655, "mean_token_accuracy": 0.11539505198597907, "num_tokens": 2486264.0, "step": 1080 }, { "entropy": 6.555998420715332, "epoch": 0.10725583234480032, "grad_norm": 0.96484375, "learning_rate": 0.0004999992188963245, "loss": 6.4541, "mean_token_accuracy": 0.12652762085199357, "num_tokens": 2497668.0, "step": 1085 }, { "entropy": 6.488944244384766, "epoch": 0.1077500988533017, "grad_norm": 0.96875, "learning_rate": 0.000499999123140338, "loss": 6.5113, "mean_token_accuracy": 0.11666428670287132, "num_tokens": 2509635.0, "step": 1090 }, { "entropy": 6.545294523239136, "epoch": 0.10824436536180308, "grad_norm": 1.046875, "learning_rate": 0.0004999990218493382, "loss": 6.5051, "mean_token_accuracy": 0.12337316423654557, "num_tokens": 2521980.0, "step": 1095 }, { "entropy": 6.497365427017212, "epoch": 0.10873863187030447, "grad_norm": 0.97265625, "learning_rate": 0.0004999989150233276, "loss": 6.4639, "mean_token_accuracy": 0.11867155879735947, "num_tokens": 2533750.0, "step": 1100 }, { "entropy": 6.565949201583862, "epoch": 0.10923289837880586, "grad_norm": 0.96875, "learning_rate": 0.0004999988026623088, "loss": 6.5618, "mean_token_accuracy": 0.11584960371255874, "num_tokens": 2545620.0, "step": 1105 }, { "entropy": 6.454707479476928, "epoch": 0.10972716488730723, "grad_norm": 1.046875, "learning_rate": 0.0004999986847662843, "loss": 6.3302, "mean_token_accuracy": 0.13472548872232437, "num_tokens": 2556463.0, "step": 1110 }, { "entropy": 6.503189325332642, "epoch": 0.11022143139580862, "grad_norm": 1.09375, "learning_rate": 0.0004999985613352576, "loss": 6.5358, "mean_token_accuracy": 0.12201443389058113, "num_tokens": 2567396.0, "step": 1115 }, { "entropy": 6.544538831710815, "epoch": 0.11071569790431, "grad_norm": 0.91796875, "learning_rate": 0.0004999984323692311, "loss": 6.48, "mean_token_accuracy": 0.123195381462574, "num_tokens": 2579208.0, "step": 1120 }, { "entropy": 6.412357044219971, "epoch": 0.11120996441281139, "grad_norm": 0.96875, "learning_rate": 0.0004999982978682085, "loss": 6.4248, "mean_token_accuracy": 0.12385009601712227, "num_tokens": 2590940.0, "step": 1125 }, { "entropy": 6.558205413818359, "epoch": 0.11170423092131278, "grad_norm": 0.90625, "learning_rate": 0.0004999981578321927, "loss": 6.51, "mean_token_accuracy": 0.1274452067911625, "num_tokens": 2602491.0, "step": 1130 }, { "entropy": 6.439068698883057, "epoch": 0.11219849742981415, "grad_norm": 1.2109375, "learning_rate": 0.0004999980122611874, "loss": 6.3438, "mean_token_accuracy": 0.12809207662940025, "num_tokens": 2612139.0, "step": 1135 }, { "entropy": 6.445886325836182, "epoch": 0.11269276393831554, "grad_norm": 0.99609375, "learning_rate": 0.000499997861155196, "loss": 6.5104, "mean_token_accuracy": 0.12374393939971924, "num_tokens": 2624906.0, "step": 1140 }, { "entropy": 6.474299335479737, "epoch": 0.11318703044681692, "grad_norm": 0.9765625, "learning_rate": 0.0004999977045142223, "loss": 6.4204, "mean_token_accuracy": 0.12185963913798332, "num_tokens": 2636046.0, "step": 1145 }, { "entropy": 6.521690130233765, "epoch": 0.11368129695531831, "grad_norm": 1.1015625, "learning_rate": 0.0004999975423382703, "loss": 6.4288, "mean_token_accuracy": 0.13111222088336943, "num_tokens": 2645617.0, "step": 1150 }, { "entropy": 6.534403610229492, "epoch": 0.11417556346381968, "grad_norm": 0.984375, "learning_rate": 0.0004999973746273438, "loss": 6.4529, "mean_token_accuracy": 0.12487476840615272, "num_tokens": 2656780.0, "step": 1155 }, { "entropy": 6.454224348068237, "epoch": 0.11466982997232107, "grad_norm": 1.03125, "learning_rate": 0.000499997201381447, "loss": 6.438, "mean_token_accuracy": 0.1251967266201973, "num_tokens": 2668078.0, "step": 1160 }, { "entropy": 6.491998386383057, "epoch": 0.11516409648082246, "grad_norm": 1.015625, "learning_rate": 0.0004999970226005841, "loss": 6.5242, "mean_token_accuracy": 0.11767346188426017, "num_tokens": 2679049.0, "step": 1165 }, { "entropy": 6.53035717010498, "epoch": 0.11565836298932385, "grad_norm": 0.91015625, "learning_rate": 0.0004999968382847595, "loss": 6.4624, "mean_token_accuracy": 0.12308069095015525, "num_tokens": 2690165.0, "step": 1170 }, { "entropy": 6.536982250213623, "epoch": 0.11615262949782523, "grad_norm": 1.0078125, "learning_rate": 0.0004999966484339778, "loss": 6.5002, "mean_token_accuracy": 0.116629458963871, "num_tokens": 2701965.0, "step": 1175 }, { "entropy": 6.402723407745361, "epoch": 0.1166468960063266, "grad_norm": 1.046875, "learning_rate": 0.0004999964530482437, "loss": 6.421, "mean_token_accuracy": 0.12439692988991738, "num_tokens": 2713479.0, "step": 1180 }, { "entropy": 6.465710687637329, "epoch": 0.11714116251482799, "grad_norm": 1.0234375, "learning_rate": 0.0004999962521275619, "loss": 6.436, "mean_token_accuracy": 0.12075797766447068, "num_tokens": 2725629.0, "step": 1185 }, { "entropy": 6.268183088302612, "epoch": 0.11763542902332938, "grad_norm": 1.015625, "learning_rate": 0.0004999960456719374, "loss": 6.3492, "mean_token_accuracy": 0.12263342142105102, "num_tokens": 2736620.0, "step": 1190 }, { "entropy": 6.464852428436279, "epoch": 0.11812969553183077, "grad_norm": 1.09375, "learning_rate": 0.0004999958336813753, "loss": 6.3325, "mean_token_accuracy": 0.1303306147456169, "num_tokens": 2747118.0, "step": 1195 }, { "entropy": 6.372828674316406, "epoch": 0.11862396204033215, "grad_norm": 1.03125, "learning_rate": 0.0004999956161558807, "loss": 6.3799, "mean_token_accuracy": 0.1274876520037651, "num_tokens": 2758371.0, "step": 1200 }, { "entropy": 6.391465854644776, "epoch": 0.11911822854883353, "grad_norm": 0.98046875, "learning_rate": 0.0004999953930954591, "loss": 6.3852, "mean_token_accuracy": 0.12252886295318603, "num_tokens": 2770575.0, "step": 1205 }, { "entropy": 6.448058319091797, "epoch": 0.11961249505733491, "grad_norm": 0.9375, "learning_rate": 0.0004999951645001159, "loss": 6.3455, "mean_token_accuracy": 0.1301012769341469, "num_tokens": 2783103.0, "step": 1210 }, { "entropy": 6.436516189575196, "epoch": 0.1201067615658363, "grad_norm": 0.80078125, "learning_rate": 0.0004999949303698568, "loss": 6.4665, "mean_token_accuracy": 0.12414569854736328, "num_tokens": 2796636.0, "step": 1215 }, { "entropy": 6.406609773635864, "epoch": 0.12060102807433769, "grad_norm": 0.984375, "learning_rate": 0.0004999946907046875, "loss": 6.322, "mean_token_accuracy": 0.13122917115688323, "num_tokens": 2807798.0, "step": 1220 }, { "entropy": 6.362497234344483, "epoch": 0.12109529458283906, "grad_norm": 0.89453125, "learning_rate": 0.0004999944455046139, "loss": 6.439, "mean_token_accuracy": 0.12562692314386367, "num_tokens": 2819255.0, "step": 1225 }, { "entropy": 6.454278612136841, "epoch": 0.12158956109134045, "grad_norm": 1.03125, "learning_rate": 0.000499994194769642, "loss": 6.4012, "mean_token_accuracy": 0.1260200709104538, "num_tokens": 2829952.0, "step": 1230 }, { "entropy": 6.518359088897705, "epoch": 0.12208382759984183, "grad_norm": 1.046875, "learning_rate": 0.000499993938499778, "loss": 6.4773, "mean_token_accuracy": 0.1282096892595291, "num_tokens": 2841056.0, "step": 1235 }, { "entropy": 6.377371597290039, "epoch": 0.12257809410834322, "grad_norm": 1.140625, "learning_rate": 0.0004999936766950283, "loss": 6.3282, "mean_token_accuracy": 0.13203255608677864, "num_tokens": 2852045.0, "step": 1240 }, { "entropy": 6.4568657875061035, "epoch": 0.12307236061684461, "grad_norm": 1.03125, "learning_rate": 0.0004999934093553992, "loss": 6.434, "mean_token_accuracy": 0.12442487627267837, "num_tokens": 2863440.0, "step": 1245 }, { "entropy": 6.430741882324218, "epoch": 0.12356662712534598, "grad_norm": 1.0390625, "learning_rate": 0.0004999931364808972, "loss": 6.4369, "mean_token_accuracy": 0.1217712052166462, "num_tokens": 2874017.0, "step": 1250 }, { "entropy": 6.364642333984375, "epoch": 0.12406089363384737, "grad_norm": 1.0546875, "learning_rate": 0.0004999928580715293, "loss": 6.3657, "mean_token_accuracy": 0.1264870472252369, "num_tokens": 2885677.0, "step": 1255 }, { "entropy": 6.433004665374756, "epoch": 0.12455516014234876, "grad_norm": 0.9453125, "learning_rate": 0.000499992574127302, "loss": 6.4812, "mean_token_accuracy": 0.1225816085934639, "num_tokens": 2897825.0, "step": 1260 }, { "entropy": 6.524859094619751, "epoch": 0.12504942665085014, "grad_norm": 0.95703125, "learning_rate": 0.0004999922846482226, "loss": 6.5257, "mean_token_accuracy": 0.1220851257443428, "num_tokens": 2909304.0, "step": 1265 }, { "entropy": 6.429646253585815, "epoch": 0.12554369315935152, "grad_norm": 0.98828125, "learning_rate": 0.0004999919896342981, "loss": 6.4588, "mean_token_accuracy": 0.12074072510004044, "num_tokens": 2920918.0, "step": 1270 }, { "entropy": 6.501003408432007, "epoch": 0.12603795966785292, "grad_norm": 0.953125, "learning_rate": 0.0004999916890855358, "loss": 6.4073, "mean_token_accuracy": 0.12426696866750717, "num_tokens": 2932294.0, "step": 1275 }, { "entropy": 6.363391876220703, "epoch": 0.1265322261763543, "grad_norm": 0.9921875, "learning_rate": 0.0004999913830019431, "loss": 6.3237, "mean_token_accuracy": 0.13384533002972604, "num_tokens": 2943372.0, "step": 1280 }, { "entropy": 6.311191463470459, "epoch": 0.12702649268485566, "grad_norm": 1.046875, "learning_rate": 0.0004999910713835272, "loss": 6.3047, "mean_token_accuracy": 0.13015900626778604, "num_tokens": 2953807.0, "step": 1285 }, { "entropy": 6.342788410186768, "epoch": 0.12752075919335706, "grad_norm": 1.0390625, "learning_rate": 0.0004999907542302962, "loss": 6.2438, "mean_token_accuracy": 0.13418981581926345, "num_tokens": 2964372.0, "step": 1290 }, { "entropy": 6.376524639129639, "epoch": 0.12801502570185844, "grad_norm": 1.046875, "learning_rate": 0.0004999904315422577, "loss": 6.3365, "mean_token_accuracy": 0.1274750992655754, "num_tokens": 2975537.0, "step": 1295 }, { "entropy": 6.296396970748901, "epoch": 0.12850929221035984, "grad_norm": 1.046875, "learning_rate": 0.0004999901033194198, "loss": 6.3172, "mean_token_accuracy": 0.12614937424659728, "num_tokens": 2986094.0, "step": 1300 }, { "entropy": 6.412167549133301, "epoch": 0.1290035587188612, "grad_norm": 1.1015625, "learning_rate": 0.0004999897695617904, "loss": 6.4284, "mean_token_accuracy": 0.12951384037733077, "num_tokens": 2996023.0, "step": 1305 }, { "entropy": 6.477496385574341, "epoch": 0.12949782522736258, "grad_norm": 0.96484375, "learning_rate": 0.0004999894302693778, "loss": 6.4201, "mean_token_accuracy": 0.12168471738696099, "num_tokens": 3007584.0, "step": 1310 }, { "entropy": 6.470839118957519, "epoch": 0.12999209173586398, "grad_norm": 1.1484375, "learning_rate": 0.0004999890854421902, "loss": 6.4722, "mean_token_accuracy": 0.11812516897916794, "num_tokens": 3018995.0, "step": 1315 }, { "entropy": 6.263270092010498, "epoch": 0.13048635824436536, "grad_norm": 0.95703125, "learning_rate": 0.0004999887350802362, "loss": 6.2577, "mean_token_accuracy": 0.13282620459794997, "num_tokens": 3030576.0, "step": 1320 }, { "entropy": 6.371448612213134, "epoch": 0.13098062475286676, "grad_norm": 1.0546875, "learning_rate": 0.0004999883791835246, "loss": 6.3224, "mean_token_accuracy": 0.12991052865982056, "num_tokens": 3040765.0, "step": 1325 }, { "entropy": 6.39703049659729, "epoch": 0.13147489126136813, "grad_norm": 0.953125, "learning_rate": 0.0004999880177520637, "loss": 6.3713, "mean_token_accuracy": 0.12290074527263642, "num_tokens": 3053912.0, "step": 1330 }, { "entropy": 6.269509172439575, "epoch": 0.1319691577698695, "grad_norm": 0.9765625, "learning_rate": 0.0004999876507858628, "loss": 6.358, "mean_token_accuracy": 0.12943168208003045, "num_tokens": 3065921.0, "step": 1335 }, { "entropy": 6.491255092620849, "epoch": 0.1324634242783709, "grad_norm": 0.953125, "learning_rate": 0.0004999872782849308, "loss": 6.4118, "mean_token_accuracy": 0.1217479057610035, "num_tokens": 3078643.0, "step": 1340 }, { "entropy": 6.297278165817261, "epoch": 0.13295769078687228, "grad_norm": 0.96875, "learning_rate": 0.0004999869002492768, "loss": 6.3262, "mean_token_accuracy": 0.12477339208126068, "num_tokens": 3090300.0, "step": 1345 }, { "entropy": 6.313536787033081, "epoch": 0.13345195729537365, "grad_norm": 0.91015625, "learning_rate": 0.0004999865166789102, "loss": 6.2574, "mean_token_accuracy": 0.13334870636463164, "num_tokens": 3102307.0, "step": 1350 }, { "entropy": 6.430685234069824, "epoch": 0.13394622380387505, "grad_norm": 0.99609375, "learning_rate": 0.0004999861275738404, "loss": 6.4038, "mean_token_accuracy": 0.12200917750597, "num_tokens": 3113817.0, "step": 1355 }, { "entropy": 6.360499048233033, "epoch": 0.13444049031237643, "grad_norm": 1.0390625, "learning_rate": 0.0004999857329340769, "loss": 6.2516, "mean_token_accuracy": 0.12839845269918443, "num_tokens": 3124719.0, "step": 1360 }, { "entropy": 6.246741867065429, "epoch": 0.13493475682087783, "grad_norm": 0.94140625, "learning_rate": 0.0004999853327596295, "loss": 6.2873, "mean_token_accuracy": 0.1282256707549095, "num_tokens": 3136136.0, "step": 1365 }, { "entropy": 6.370300054550171, "epoch": 0.1354290233293792, "grad_norm": 0.90234375, "learning_rate": 0.000499984927050508, "loss": 6.3012, "mean_token_accuracy": 0.1290183626115322, "num_tokens": 3148977.0, "step": 1370 }, { "entropy": 6.377018070220947, "epoch": 0.13592328983788057, "grad_norm": 1.0234375, "learning_rate": 0.0004999845158067223, "loss": 6.3579, "mean_token_accuracy": 0.1252500332891941, "num_tokens": 3160520.0, "step": 1375 }, { "entropy": 6.366725778579712, "epoch": 0.13641755634638197, "grad_norm": 0.91015625, "learning_rate": 0.0004999840990282828, "loss": 6.3426, "mean_token_accuracy": 0.12962477132678032, "num_tokens": 3172895.0, "step": 1380 }, { "entropy": 6.324902153015136, "epoch": 0.13691182285488335, "grad_norm": 1.0078125, "learning_rate": 0.0004999836767151994, "loss": 6.3544, "mean_token_accuracy": 0.13052070513367653, "num_tokens": 3183960.0, "step": 1385 }, { "entropy": 6.330108976364135, "epoch": 0.13740608936338475, "grad_norm": 1.0234375, "learning_rate": 0.0004999832488674827, "loss": 6.3886, "mean_token_accuracy": 0.1273997098207474, "num_tokens": 3194276.0, "step": 1390 }, { "entropy": 6.366259002685547, "epoch": 0.13790035587188612, "grad_norm": 1.0078125, "learning_rate": 0.0004999828154851432, "loss": 6.2558, "mean_token_accuracy": 0.13061744794249536, "num_tokens": 3206084.0, "step": 1395 }, { "entropy": 6.301025104522705, "epoch": 0.1383946223803875, "grad_norm": 1.015625, "learning_rate": 0.0004999823765681915, "loss": 6.2972, "mean_token_accuracy": 0.13314774185419082, "num_tokens": 3217941.0, "step": 1400 }, { "entropy": 6.338549423217773, "epoch": 0.1388888888888889, "grad_norm": 0.9296875, "learning_rate": 0.0004999819321166385, "loss": 6.2742, "mean_token_accuracy": 0.13190385103225707, "num_tokens": 3229088.0, "step": 1405 }, { "entropy": 6.25566258430481, "epoch": 0.13938315539739027, "grad_norm": 1.0, "learning_rate": 0.000499981482130495, "loss": 6.2205, "mean_token_accuracy": 0.13236010000109671, "num_tokens": 3240708.0, "step": 1410 }, { "entropy": 6.294620752334595, "epoch": 0.13987742190589167, "grad_norm": 0.94921875, "learning_rate": 0.0004999810266097721, "loss": 6.3444, "mean_token_accuracy": 0.1264272078871727, "num_tokens": 3251040.0, "step": 1415 }, { "entropy": 6.291800880432129, "epoch": 0.14037168841439304, "grad_norm": 1.09375, "learning_rate": 0.0004999805655544811, "loss": 6.2912, "mean_token_accuracy": 0.13168664127588273, "num_tokens": 3262655.0, "step": 1420 }, { "entropy": 6.291258907318115, "epoch": 0.14086595492289442, "grad_norm": 1.0078125, "learning_rate": 0.0004999800989646333, "loss": 6.2228, "mean_token_accuracy": 0.13803994432091712, "num_tokens": 3273160.0, "step": 1425 }, { "entropy": 6.300457239151001, "epoch": 0.14136022143139582, "grad_norm": 0.98828125, "learning_rate": 0.0004999796268402401, "loss": 6.2783, "mean_token_accuracy": 0.1296892285346985, "num_tokens": 3285932.0, "step": 1430 }, { "entropy": 6.249773216247559, "epoch": 0.1418544879398972, "grad_norm": 0.90625, "learning_rate": 0.0004999791491813132, "loss": 6.2971, "mean_token_accuracy": 0.12768914625048639, "num_tokens": 3298834.0, "step": 1435 }, { "entropy": 6.409033393859863, "epoch": 0.1423487544483986, "grad_norm": 1.0625, "learning_rate": 0.0004999786659878643, "loss": 6.2799, "mean_token_accuracy": 0.12664505764842032, "num_tokens": 3310473.0, "step": 1440 }, { "entropy": 6.182092523574829, "epoch": 0.14284302095689996, "grad_norm": 0.97265625, "learning_rate": 0.0004999781772599055, "loss": 6.2497, "mean_token_accuracy": 0.13217792585492133, "num_tokens": 3322662.0, "step": 1445 }, { "entropy": 6.391679096221924, "epoch": 0.14333728746540134, "grad_norm": 0.96484375, "learning_rate": 0.0004999776829974484, "loss": 6.3475, "mean_token_accuracy": 0.132525734603405, "num_tokens": 3334321.0, "step": 1450 }, { "entropy": 6.246479558944702, "epoch": 0.14383155397390274, "grad_norm": 0.98828125, "learning_rate": 0.0004999771832005055, "loss": 6.2512, "mean_token_accuracy": 0.13095758333802224, "num_tokens": 3345130.0, "step": 1455 }, { "entropy": 6.2692060470581055, "epoch": 0.1443258204824041, "grad_norm": 0.984375, "learning_rate": 0.000499976677869089, "loss": 6.2271, "mean_token_accuracy": 0.13088599741458892, "num_tokens": 3355601.0, "step": 1460 }, { "entropy": 6.194102716445923, "epoch": 0.14482008699090548, "grad_norm": 0.9296875, "learning_rate": 0.0004999761670032115, "loss": 6.2295, "mean_token_accuracy": 0.13360995799303055, "num_tokens": 3367075.0, "step": 1465 }, { "entropy": 6.32319974899292, "epoch": 0.14531435349940688, "grad_norm": 0.8984375, "learning_rate": 0.0004999756506028851, "loss": 6.1937, "mean_token_accuracy": 0.13329043239355087, "num_tokens": 3378888.0, "step": 1470 }, { "entropy": 6.248707866668701, "epoch": 0.14580862000790826, "grad_norm": 0.9765625, "learning_rate": 0.0004999751286681229, "loss": 6.2325, "mean_token_accuracy": 0.1328907147049904, "num_tokens": 3390705.0, "step": 1475 }, { "entropy": 6.288841915130615, "epoch": 0.14630288651640966, "grad_norm": 0.92578125, "learning_rate": 0.0004999746011989376, "loss": 6.249, "mean_token_accuracy": 0.1373384565114975, "num_tokens": 3401710.0, "step": 1480 }, { "entropy": 6.346017694473266, "epoch": 0.14679715302491103, "grad_norm": 1.0390625, "learning_rate": 0.0004999740681953422, "loss": 6.3789, "mean_token_accuracy": 0.1264251612126827, "num_tokens": 3413467.0, "step": 1485 }, { "entropy": 6.331368350982666, "epoch": 0.1472914195334124, "grad_norm": 1.015625, "learning_rate": 0.0004999735296573499, "loss": 6.3007, "mean_token_accuracy": 0.13292821869254112, "num_tokens": 3425885.0, "step": 1490 }, { "entropy": 6.329574871063232, "epoch": 0.1477856860419138, "grad_norm": 0.84375, "learning_rate": 0.0004999729855849738, "loss": 6.3151, "mean_token_accuracy": 0.12490678578615189, "num_tokens": 3437952.0, "step": 1495 }, { "entropy": 6.267677640914917, "epoch": 0.14827995255041518, "grad_norm": 0.921875, "learning_rate": 0.0004999724359782274, "loss": 6.1911, "mean_token_accuracy": 0.1455492317676544, "num_tokens": 3449680.0, "step": 1500 }, { "entropy": 6.317681789398193, "epoch": 0.14877421905891658, "grad_norm": 1.03125, "learning_rate": 0.0004999718808371241, "loss": 6.3432, "mean_token_accuracy": 0.12537492960691451, "num_tokens": 3460699.0, "step": 1505 }, { "entropy": 6.338581228256226, "epoch": 0.14926848556741795, "grad_norm": 0.98046875, "learning_rate": 0.0004999713201616776, "loss": 6.2238, "mean_token_accuracy": 0.13232341259717942, "num_tokens": 3471919.0, "step": 1510 }, { "entropy": 6.166346454620362, "epoch": 0.14976275207591933, "grad_norm": 0.99609375, "learning_rate": 0.000499970753951902, "loss": 6.3229, "mean_token_accuracy": 0.12744686827063562, "num_tokens": 3484110.0, "step": 1515 }, { "entropy": 6.412110614776611, "epoch": 0.15025701858442073, "grad_norm": 1.0859375, "learning_rate": 0.0004999701822078107, "loss": 6.2352, "mean_token_accuracy": 0.12983164712786674, "num_tokens": 3496103.0, "step": 1520 }, { "entropy": 6.272561883926391, "epoch": 0.1507512850929221, "grad_norm": 1.0859375, "learning_rate": 0.000499969604929418, "loss": 6.3098, "mean_token_accuracy": 0.13165246173739434, "num_tokens": 3507291.0, "step": 1525 }, { "entropy": 6.302027225494385, "epoch": 0.1512455516014235, "grad_norm": 0.92578125, "learning_rate": 0.0004999690221167382, "loss": 6.3173, "mean_token_accuracy": 0.12720877900719643, "num_tokens": 3519564.0, "step": 1530 }, { "entropy": 6.204291439056396, "epoch": 0.15173981810992487, "grad_norm": 0.98828125, "learning_rate": 0.0004999684337697855, "loss": 6.1724, "mean_token_accuracy": 0.13716719225049018, "num_tokens": 3530679.0, "step": 1535 }, { "entropy": 6.2982782363891605, "epoch": 0.15223408461842625, "grad_norm": 0.86328125, "learning_rate": 0.0004999678398885746, "loss": 6.2473, "mean_token_accuracy": 0.1318476304411888, "num_tokens": 3542662.0, "step": 1540 }, { "entropy": 6.265805768966675, "epoch": 0.15272835112692765, "grad_norm": 0.84765625, "learning_rate": 0.0004999672404731197, "loss": 6.3499, "mean_token_accuracy": 0.12811536714434624, "num_tokens": 3554760.0, "step": 1545 }, { "entropy": 6.249004793167114, "epoch": 0.15322261763542902, "grad_norm": 1.0390625, "learning_rate": 0.000499966635523436, "loss": 6.1602, "mean_token_accuracy": 0.13934924975037574, "num_tokens": 3565604.0, "step": 1550 }, { "entropy": 6.277536392211914, "epoch": 0.1537168841439304, "grad_norm": 1.1015625, "learning_rate": 0.0004999660250395381, "loss": 6.3141, "mean_token_accuracy": 0.12867220491170883, "num_tokens": 3577535.0, "step": 1555 }, { "entropy": 6.295968151092529, "epoch": 0.1542111506524318, "grad_norm": 0.9453125, "learning_rate": 0.000499965409021441, "loss": 6.3235, "mean_token_accuracy": 0.12822821363806725, "num_tokens": 3590458.0, "step": 1560 }, { "entropy": 6.375429725646972, "epoch": 0.15470541716093317, "grad_norm": 0.92578125, "learning_rate": 0.00049996478746916, "loss": 6.2851, "mean_token_accuracy": 0.13392977118492128, "num_tokens": 3600916.0, "step": 1565 }, { "entropy": 6.222699928283691, "epoch": 0.15519968366943457, "grad_norm": 0.9296875, "learning_rate": 0.0004999641603827104, "loss": 6.3037, "mean_token_accuracy": 0.12990911155939103, "num_tokens": 3612794.0, "step": 1570 }, { "entropy": 6.27130880355835, "epoch": 0.15569395017793594, "grad_norm": 1.0078125, "learning_rate": 0.0004999635277621073, "loss": 6.2037, "mean_token_accuracy": 0.1420078307390213, "num_tokens": 3624186.0, "step": 1575 }, { "entropy": 6.199323654174805, "epoch": 0.15618821668643731, "grad_norm": 0.97265625, "learning_rate": 0.0004999628896073668, "loss": 6.2448, "mean_token_accuracy": 0.12877988070249557, "num_tokens": 3636041.0, "step": 1580 }, { "entropy": 6.304298067092896, "epoch": 0.15668248319493872, "grad_norm": 1.109375, "learning_rate": 0.0004999622459185042, "loss": 6.3071, "mean_token_accuracy": 0.12442853599786759, "num_tokens": 3646859.0, "step": 1585 }, { "entropy": 6.2107603549957275, "epoch": 0.1571767497034401, "grad_norm": 0.9609375, "learning_rate": 0.0004999615966955354, "loss": 6.119, "mean_token_accuracy": 0.14032085835933686, "num_tokens": 3657853.0, "step": 1590 }, { "entropy": 6.324536895751953, "epoch": 0.1576710162119415, "grad_norm": 1.078125, "learning_rate": 0.0004999609419384764, "loss": 6.2253, "mean_token_accuracy": 0.134918150305748, "num_tokens": 3668341.0, "step": 1595 }, { "entropy": 6.249271965026855, "epoch": 0.15816528272044286, "grad_norm": 1.1484375, "learning_rate": 0.0004999602816473434, "loss": 6.2563, "mean_token_accuracy": 0.13581479713320732, "num_tokens": 3679020.0, "step": 1600 }, { "entropy": 6.1892296314239506, "epoch": 0.15865954922894424, "grad_norm": 0.875, "learning_rate": 0.0004999596158221526, "loss": 6.1613, "mean_token_accuracy": 0.13848758935928346, "num_tokens": 3691121.0, "step": 1605 }, { "entropy": 6.234239339828491, "epoch": 0.15915381573744564, "grad_norm": 0.94921875, "learning_rate": 0.0004999589444629203, "loss": 6.2286, "mean_token_accuracy": 0.13591036275029184, "num_tokens": 3702584.0, "step": 1610 }, { "entropy": 6.20807032585144, "epoch": 0.159648082245947, "grad_norm": 1.0546875, "learning_rate": 0.0004999582675696631, "loss": 6.177, "mean_token_accuracy": 0.1353621505200863, "num_tokens": 3713085.0, "step": 1615 }, { "entropy": 6.320692300796509, "epoch": 0.1601423487544484, "grad_norm": 1.015625, "learning_rate": 0.0004999575851423976, "loss": 6.2929, "mean_token_accuracy": 0.12485695034265518, "num_tokens": 3724318.0, "step": 1620 }, { "entropy": 6.2754554271698, "epoch": 0.16063661526294978, "grad_norm": 0.98828125, "learning_rate": 0.0004999568971811407, "loss": 6.1999, "mean_token_accuracy": 0.14148797765374183, "num_tokens": 3734288.0, "step": 1625 }, { "entropy": 6.201929521560669, "epoch": 0.16113088177145116, "grad_norm": 0.953125, "learning_rate": 0.000499956203685909, "loss": 6.1941, "mean_token_accuracy": 0.13511522933840753, "num_tokens": 3744645.0, "step": 1630 }, { "entropy": 6.282017421722412, "epoch": 0.16162514827995256, "grad_norm": 1.0703125, "learning_rate": 0.00049995550465672, "loss": 6.1854, "mean_token_accuracy": 0.13890446051955224, "num_tokens": 3755660.0, "step": 1635 }, { "entropy": 6.125180339813232, "epoch": 0.16211941478845393, "grad_norm": 1.03125, "learning_rate": 0.0004999548000935906, "loss": 6.1599, "mean_token_accuracy": 0.14167107045650482, "num_tokens": 3767614.0, "step": 1640 }, { "entropy": 6.254905891418457, "epoch": 0.16261368129695533, "grad_norm": 1.0078125, "learning_rate": 0.0004999540899965383, "loss": 6.308, "mean_token_accuracy": 0.1335205040872097, "num_tokens": 3780750.0, "step": 1645 }, { "entropy": 6.242093515396118, "epoch": 0.1631079478054567, "grad_norm": 0.97265625, "learning_rate": 0.0004999533743655803, "loss": 6.2965, "mean_token_accuracy": 0.1281206913292408, "num_tokens": 3793195.0, "step": 1650 }, { "entropy": 6.24614839553833, "epoch": 0.16360221431395808, "grad_norm": 1.125, "learning_rate": 0.0004999526532007346, "loss": 6.2606, "mean_token_accuracy": 0.13350182473659516, "num_tokens": 3804256.0, "step": 1655 }, { "entropy": 6.289435911178589, "epoch": 0.16409648082245948, "grad_norm": 0.96875, "learning_rate": 0.0004999519265020187, "loss": 6.2237, "mean_token_accuracy": 0.12859297171235085, "num_tokens": 3815403.0, "step": 1660 }, { "entropy": 6.08995943069458, "epoch": 0.16459074733096085, "grad_norm": 0.9921875, "learning_rate": 0.0004999511942694504, "loss": 6.128, "mean_token_accuracy": 0.14284673556685448, "num_tokens": 3826682.0, "step": 1665 }, { "entropy": 6.215432214736938, "epoch": 0.16508501383946222, "grad_norm": 0.99609375, "learning_rate": 0.0004999504565030479, "loss": 6.139, "mean_token_accuracy": 0.13716638311743737, "num_tokens": 3837780.0, "step": 1670 }, { "entropy": 6.164974164962769, "epoch": 0.16557928034796363, "grad_norm": 0.93359375, "learning_rate": 0.0004999497132028293, "loss": 6.2072, "mean_token_accuracy": 0.1344188041985035, "num_tokens": 3848782.0, "step": 1675 }, { "entropy": 6.244879055023193, "epoch": 0.166073546856465, "grad_norm": 1.0234375, "learning_rate": 0.0004999489643688127, "loss": 6.1649, "mean_token_accuracy": 0.13939150497317315, "num_tokens": 3859220.0, "step": 1680 }, { "entropy": 6.102788019180298, "epoch": 0.1665678133649664, "grad_norm": 1.03125, "learning_rate": 0.0004999482100010169, "loss": 6.0808, "mean_token_accuracy": 0.1425606593489647, "num_tokens": 3869794.0, "step": 1685 }, { "entropy": 6.161266660690307, "epoch": 0.16706207987346777, "grad_norm": 0.953125, "learning_rate": 0.0004999474500994601, "loss": 6.2184, "mean_token_accuracy": 0.1334006331861019, "num_tokens": 3881133.0, "step": 1690 }, { "entropy": 6.2152763366699215, "epoch": 0.16755634638196915, "grad_norm": 0.99609375, "learning_rate": 0.0004999466846641611, "loss": 6.1567, "mean_token_accuracy": 0.1364052601158619, "num_tokens": 3891600.0, "step": 1695 }, { "entropy": 6.224546241760254, "epoch": 0.16805061289047055, "grad_norm": 0.8828125, "learning_rate": 0.0004999459136951389, "loss": 6.2529, "mean_token_accuracy": 0.13441457897424697, "num_tokens": 3903287.0, "step": 1700 }, { "entropy": 6.245505905151367, "epoch": 0.16854487939897192, "grad_norm": 1.0234375, "learning_rate": 0.0004999451371924123, "loss": 6.1635, "mean_token_accuracy": 0.14323566406965255, "num_tokens": 3914497.0, "step": 1705 }, { "entropy": 6.2008990287780765, "epoch": 0.16903914590747332, "grad_norm": 0.9375, "learning_rate": 0.0004999443551560003, "loss": 6.1996, "mean_token_accuracy": 0.13277414664626122, "num_tokens": 3925536.0, "step": 1710 }, { "entropy": 6.179309701919555, "epoch": 0.1695334124159747, "grad_norm": 0.9375, "learning_rate": 0.0004999435675859224, "loss": 6.1432, "mean_token_accuracy": 0.1426541492342949, "num_tokens": 3936705.0, "step": 1715 }, { "entropy": 6.117032384872436, "epoch": 0.17002767892447607, "grad_norm": 1.078125, "learning_rate": 0.0004999427744821977, "loss": 6.0382, "mean_token_accuracy": 0.1389991022646427, "num_tokens": 3948422.0, "step": 1720 }, { "entropy": 6.144522857666016, "epoch": 0.17052194543297747, "grad_norm": 1.0078125, "learning_rate": 0.000499941975844846, "loss": 6.1085, "mean_token_accuracy": 0.14725376516580582, "num_tokens": 3958697.0, "step": 1725 }, { "entropy": 6.112959909439087, "epoch": 0.17101621194147884, "grad_norm": 0.9140625, "learning_rate": 0.0004999411716738866, "loss": 6.1208, "mean_token_accuracy": 0.13783455789089202, "num_tokens": 3970255.0, "step": 1730 }, { "entropy": 6.206806802749634, "epoch": 0.17151047844998024, "grad_norm": 1.1328125, "learning_rate": 0.0004999403619693397, "loss": 6.2172, "mean_token_accuracy": 0.13266652897000314, "num_tokens": 3980892.0, "step": 1735 }, { "entropy": 6.101211071014404, "epoch": 0.17200474495848161, "grad_norm": 1.0, "learning_rate": 0.0004999395467312249, "loss": 6.1532, "mean_token_accuracy": 0.13273056447505951, "num_tokens": 3991375.0, "step": 1740 }, { "entropy": 6.304367208480835, "epoch": 0.172499011466983, "grad_norm": 0.9921875, "learning_rate": 0.0004999387259595623, "loss": 6.3042, "mean_token_accuracy": 0.12940156012773513, "num_tokens": 4003352.0, "step": 1745 }, { "entropy": 6.152772092819214, "epoch": 0.1729932779754844, "grad_norm": 0.97265625, "learning_rate": 0.0004999378996543723, "loss": 6.1745, "mean_token_accuracy": 0.13783681988716126, "num_tokens": 4014429.0, "step": 1750 }, { "entropy": 6.22617883682251, "epoch": 0.17348754448398576, "grad_norm": 1.0078125, "learning_rate": 0.0004999370678156749, "loss": 6.1056, "mean_token_accuracy": 0.14252740070223807, "num_tokens": 4025213.0, "step": 1755 }, { "entropy": 6.1182598114013675, "epoch": 0.17398181099248716, "grad_norm": 1.0703125, "learning_rate": 0.0004999362304434909, "loss": 6.0983, "mean_token_accuracy": 0.1411632165312767, "num_tokens": 4036244.0, "step": 1760 }, { "entropy": 6.218455600738525, "epoch": 0.17447607750098854, "grad_norm": 1.0546875, "learning_rate": 0.0004999353875378406, "loss": 6.1392, "mean_token_accuracy": 0.13833620101213456, "num_tokens": 4047944.0, "step": 1765 }, { "entropy": 6.125010585784912, "epoch": 0.1749703440094899, "grad_norm": 0.921875, "learning_rate": 0.000499934539098745, "loss": 6.1127, "mean_token_accuracy": 0.13938926681876182, "num_tokens": 4058865.0, "step": 1770 }, { "entropy": 6.112168598175049, "epoch": 0.1754646105179913, "grad_norm": 0.9765625, "learning_rate": 0.0004999336851262247, "loss": 6.1605, "mean_token_accuracy": 0.13652415424585343, "num_tokens": 4070627.0, "step": 1775 }, { "entropy": 6.221715450286865, "epoch": 0.17595887702649268, "grad_norm": 0.921875, "learning_rate": 0.0004999328256203009, "loss": 6.2029, "mean_token_accuracy": 0.13283938243985177, "num_tokens": 4081406.0, "step": 1780 }, { "entropy": 6.202430009841919, "epoch": 0.17645314353499406, "grad_norm": 0.92578125, "learning_rate": 0.0004999319605809947, "loss": 6.1763, "mean_token_accuracy": 0.1280331313610077, "num_tokens": 4092957.0, "step": 1785 }, { "entropy": 6.209701681137085, "epoch": 0.17694741004349546, "grad_norm": 1.0078125, "learning_rate": 0.0004999310900083274, "loss": 6.232, "mean_token_accuracy": 0.13681847751140594, "num_tokens": 4104381.0, "step": 1790 }, { "entropy": 6.180554962158203, "epoch": 0.17744167655199683, "grad_norm": 1.0, "learning_rate": 0.0004999302139023204, "loss": 6.1452, "mean_token_accuracy": 0.13721615672111512, "num_tokens": 4117190.0, "step": 1795 }, { "entropy": 6.11452693939209, "epoch": 0.17793594306049823, "grad_norm": 1.046875, "learning_rate": 0.0004999293322629951, "loss": 6.0752, "mean_token_accuracy": 0.14162272289395333, "num_tokens": 4127870.0, "step": 1800 }, { "entropy": 6.098488092422485, "epoch": 0.1784302095689996, "grad_norm": 1.0546875, "learning_rate": 0.0004999284450903736, "loss": 6.1272, "mean_token_accuracy": 0.14127160534262656, "num_tokens": 4139240.0, "step": 1805 }, { "entropy": 6.223893737792968, "epoch": 0.17892447607750098, "grad_norm": 1.015625, "learning_rate": 0.0004999275523844772, "loss": 6.0978, "mean_token_accuracy": 0.14117365032434465, "num_tokens": 4149885.0, "step": 1810 }, { "entropy": 6.183619403839112, "epoch": 0.17941874258600238, "grad_norm": 1.046875, "learning_rate": 0.0004999266541453283, "loss": 6.2727, "mean_token_accuracy": 0.1341182231903076, "num_tokens": 4161824.0, "step": 1815 }, { "entropy": 6.192480278015137, "epoch": 0.17991300909450375, "grad_norm": 0.91796875, "learning_rate": 0.0004999257503729487, "loss": 6.2305, "mean_token_accuracy": 0.13566601723432542, "num_tokens": 4173581.0, "step": 1820 }, { "entropy": 6.188820171356201, "epoch": 0.18040727560300515, "grad_norm": 1.0703125, "learning_rate": 0.0004999248410673607, "loss": 6.1086, "mean_token_accuracy": 0.14354413226246834, "num_tokens": 4184843.0, "step": 1825 }, { "entropy": 6.199634456634522, "epoch": 0.18090154211150652, "grad_norm": 1.03125, "learning_rate": 0.0004999239262285869, "loss": 6.196, "mean_token_accuracy": 0.12894793301820756, "num_tokens": 4195016.0, "step": 1830 }, { "entropy": 6.183595895767212, "epoch": 0.1813958086200079, "grad_norm": 0.9609375, "learning_rate": 0.0004999230058566495, "loss": 6.149, "mean_token_accuracy": 0.13868849724531174, "num_tokens": 4206798.0, "step": 1835 }, { "entropy": 6.20193657875061, "epoch": 0.1818900751285093, "grad_norm": 0.94140625, "learning_rate": 0.0004999220799515713, "loss": 6.1197, "mean_token_accuracy": 0.13616999015212058, "num_tokens": 4218784.0, "step": 1840 }, { "entropy": 6.098097658157348, "epoch": 0.18238434163701067, "grad_norm": 0.96875, "learning_rate": 0.000499921148513375, "loss": 6.1495, "mean_token_accuracy": 0.13528309762477875, "num_tokens": 4229875.0, "step": 1845 }, { "entropy": 6.120871686935425, "epoch": 0.18287860814551207, "grad_norm": 0.98828125, "learning_rate": 0.0004999202115420836, "loss": 6.1274, "mean_token_accuracy": 0.13959604278206825, "num_tokens": 4241801.0, "step": 1850 }, { "entropy": 6.136850357055664, "epoch": 0.18337287465401345, "grad_norm": 1.0546875, "learning_rate": 0.0004999192690377201, "loss": 6.112, "mean_token_accuracy": 0.13544971346855164, "num_tokens": 4253168.0, "step": 1855 }, { "entropy": 6.151134204864502, "epoch": 0.18386714116251482, "grad_norm": 0.9375, "learning_rate": 0.0004999183210003076, "loss": 6.1371, "mean_token_accuracy": 0.13654277250170707, "num_tokens": 4264791.0, "step": 1860 }, { "entropy": 6.127550983428955, "epoch": 0.18436140767101622, "grad_norm": 1.125, "learning_rate": 0.0004999173674298696, "loss": 6.0802, "mean_token_accuracy": 0.1429269403219223, "num_tokens": 4275816.0, "step": 1865 }, { "entropy": 6.2200188636779785, "epoch": 0.1848556741795176, "grad_norm": 1.0, "learning_rate": 0.0004999164083264294, "loss": 6.1638, "mean_token_accuracy": 0.13557607755064965, "num_tokens": 4287806.0, "step": 1870 }, { "entropy": 6.1365429878234865, "epoch": 0.185349940688019, "grad_norm": 0.97265625, "learning_rate": 0.0004999154436900108, "loss": 6.2061, "mean_token_accuracy": 0.13776358291506768, "num_tokens": 4300319.0, "step": 1875 }, { "entropy": 6.261188077926636, "epoch": 0.18584420719652037, "grad_norm": 0.9609375, "learning_rate": 0.0004999144735206373, "loss": 6.2191, "mean_token_accuracy": 0.13050539270043374, "num_tokens": 4310987.0, "step": 1880 }, { "entropy": 6.134886789321899, "epoch": 0.18633847370502174, "grad_norm": 0.90234375, "learning_rate": 0.0004999134978183328, "loss": 6.1589, "mean_token_accuracy": 0.14048967361450196, "num_tokens": 4322438.0, "step": 1885 }, { "entropy": 6.216308641433716, "epoch": 0.18683274021352314, "grad_norm": 1.09375, "learning_rate": 0.0004999125165831215, "loss": 6.194, "mean_token_accuracy": 0.13951309472322465, "num_tokens": 4333242.0, "step": 1890 }, { "entropy": 6.1126538753509525, "epoch": 0.1873270067220245, "grad_norm": 1.0546875, "learning_rate": 0.0004999115298150273, "loss": 6.0433, "mean_token_accuracy": 0.14102249965071678, "num_tokens": 4343660.0, "step": 1895 }, { "entropy": 6.163443613052368, "epoch": 0.1878212732305259, "grad_norm": 1.015625, "learning_rate": 0.0004999105375140746, "loss": 6.1246, "mean_token_accuracy": 0.1411570593714714, "num_tokens": 4353382.0, "step": 1900 }, { "entropy": 6.103315830230713, "epoch": 0.1883155397390273, "grad_norm": 1.0546875, "learning_rate": 0.0004999095396802878, "loss": 6.1044, "mean_token_accuracy": 0.13109617531299592, "num_tokens": 4364614.0, "step": 1905 }, { "entropy": 6.2517712116241455, "epoch": 0.18880980624752866, "grad_norm": 0.96875, "learning_rate": 0.0004999085363136913, "loss": 6.1812, "mean_token_accuracy": 0.1353604979813099, "num_tokens": 4376001.0, "step": 1910 }, { "entropy": 6.128733491897583, "epoch": 0.18930407275603006, "grad_norm": 1.0078125, "learning_rate": 0.00049990752741431, "loss": 6.1848, "mean_token_accuracy": 0.13217584118247033, "num_tokens": 4387083.0, "step": 1915 }, { "entropy": 6.139519214630127, "epoch": 0.18979833926453143, "grad_norm": 0.8984375, "learning_rate": 0.0004999065129821687, "loss": 6.1356, "mean_token_accuracy": 0.13750590831041337, "num_tokens": 4399977.0, "step": 1920 }, { "entropy": 6.0825254917144775, "epoch": 0.1902926057730328, "grad_norm": 0.8828125, "learning_rate": 0.0004999054930172923, "loss": 6.0592, "mean_token_accuracy": 0.14218987300992011, "num_tokens": 4411609.0, "step": 1925 }, { "entropy": 6.175016450881958, "epoch": 0.1907868722815342, "grad_norm": 1.1171875, "learning_rate": 0.0004999044675197058, "loss": 6.1817, "mean_token_accuracy": 0.13701564595103263, "num_tokens": 4423567.0, "step": 1930 }, { "entropy": 6.147806310653687, "epoch": 0.19128113879003558, "grad_norm": 1.09375, "learning_rate": 0.0004999034364894345, "loss": 6.1472, "mean_token_accuracy": 0.13876281678676605, "num_tokens": 4435410.0, "step": 1935 }, { "entropy": 6.18219690322876, "epoch": 0.19177540529853698, "grad_norm": 1.0703125, "learning_rate": 0.0004999023999265039, "loss": 6.1697, "mean_token_accuracy": 0.1378607526421547, "num_tokens": 4445279.0, "step": 1940 }, { "entropy": 6.077285814285278, "epoch": 0.19226967180703836, "grad_norm": 1.078125, "learning_rate": 0.0004999013578309392, "loss": 6.0385, "mean_token_accuracy": 0.14334971085190773, "num_tokens": 4456017.0, "step": 1945 }, { "entropy": 6.126475811004639, "epoch": 0.19276393831553973, "grad_norm": 1.046875, "learning_rate": 0.0004999003102027663, "loss": 6.0311, "mean_token_accuracy": 0.14338691681623458, "num_tokens": 4466759.0, "step": 1950 }, { "entropy": 6.117775201797485, "epoch": 0.19325820482404113, "grad_norm": 1.0390625, "learning_rate": 0.000499899257042011, "loss": 6.1139, "mean_token_accuracy": 0.1352181151509285, "num_tokens": 4478316.0, "step": 1955 }, { "entropy": 6.208990001678467, "epoch": 0.1937524713325425, "grad_norm": 1.0234375, "learning_rate": 0.0004998981983486988, "loss": 6.1751, "mean_token_accuracy": 0.1322692520916462, "num_tokens": 4490775.0, "step": 1960 }, { "entropy": 6.064915752410888, "epoch": 0.1942467378410439, "grad_norm": 1.0078125, "learning_rate": 0.0004998971341228563, "loss": 6.039, "mean_token_accuracy": 0.1443925455212593, "num_tokens": 4501622.0, "step": 1965 }, { "entropy": 6.149889087677002, "epoch": 0.19474100434954528, "grad_norm": 0.921875, "learning_rate": 0.0004998960643645093, "loss": 6.1338, "mean_token_accuracy": 0.13769015669822693, "num_tokens": 4512279.0, "step": 1970 }, { "entropy": 6.167524814605713, "epoch": 0.19523527085804665, "grad_norm": 0.9296875, "learning_rate": 0.0004998949890736841, "loss": 6.1239, "mean_token_accuracy": 0.14070178642868997, "num_tokens": 4524087.0, "step": 1975 }, { "entropy": 6.139242649078369, "epoch": 0.19572953736654805, "grad_norm": 1.015625, "learning_rate": 0.0004998939082504075, "loss": 6.1075, "mean_token_accuracy": 0.13732974529266356, "num_tokens": 4534816.0, "step": 1980 }, { "entropy": 6.103002882003784, "epoch": 0.19622380387504942, "grad_norm": 0.98046875, "learning_rate": 0.0004998928218947057, "loss": 6.0825, "mean_token_accuracy": 0.13870148733258247, "num_tokens": 4545725.0, "step": 1985 }, { "entropy": 6.218700933456421, "epoch": 0.1967180703835508, "grad_norm": 1.1484375, "learning_rate": 0.0004998917300066056, "loss": 6.1897, "mean_token_accuracy": 0.13517609983682632, "num_tokens": 4557003.0, "step": 1990 }, { "entropy": 6.099284267425537, "epoch": 0.1972123368920522, "grad_norm": 1.015625, "learning_rate": 0.0004998906325861342, "loss": 6.1023, "mean_token_accuracy": 0.13518477007746696, "num_tokens": 4568768.0, "step": 1995 }, { "entropy": 6.103130531311035, "epoch": 0.19770660340055357, "grad_norm": 1.0703125, "learning_rate": 0.0004998895296333183, "loss": 6.0715, "mean_token_accuracy": 0.14329598397016524, "num_tokens": 4581116.0, "step": 2000 }, { "entropy": 6.170775890350342, "epoch": 0.19820086990905497, "grad_norm": 1.1171875, "learning_rate": 0.000499888421148185, "loss": 6.1516, "mean_token_accuracy": 0.13928177580237389, "num_tokens": 4592660.0, "step": 2005 }, { "entropy": 6.074905729293823, "epoch": 0.19869513641755635, "grad_norm": 0.9296875, "learning_rate": 0.0004998873071307617, "loss": 6.1321, "mean_token_accuracy": 0.13926766365766524, "num_tokens": 4603057.0, "step": 2010 }, { "entropy": 6.111081838607788, "epoch": 0.19918940292605772, "grad_norm": 1.1796875, "learning_rate": 0.0004998861875810758, "loss": 6.0145, "mean_token_accuracy": 0.14594943076372147, "num_tokens": 4613546.0, "step": 2015 }, { "entropy": 6.130213642120362, "epoch": 0.19968366943455912, "grad_norm": 1.0234375, "learning_rate": 0.0004998850624991548, "loss": 6.0932, "mean_token_accuracy": 0.13966753333806992, "num_tokens": 4624613.0, "step": 2020 }, { "entropy": 6.070725202560425, "epoch": 0.2001779359430605, "grad_norm": 1.0078125, "learning_rate": 0.0004998839318850263, "loss": 6.0581, "mean_token_accuracy": 0.14254929646849632, "num_tokens": 4636004.0, "step": 2025 }, { "entropy": 6.094811868667603, "epoch": 0.2006722024515619, "grad_norm": 1.078125, "learning_rate": 0.0004998827957387182, "loss": 6.1194, "mean_token_accuracy": 0.1468837432563305, "num_tokens": 4646450.0, "step": 2030 }, { "entropy": 6.105382490158081, "epoch": 0.20116646896006327, "grad_norm": 0.94140625, "learning_rate": 0.0004998816540602584, "loss": 6.0993, "mean_token_accuracy": 0.14319370239973067, "num_tokens": 4658928.0, "step": 2035 }, { "entropy": 6.133113861083984, "epoch": 0.20166073546856464, "grad_norm": 0.94921875, "learning_rate": 0.0004998805068496752, "loss": 6.1279, "mean_token_accuracy": 0.13475392609834672, "num_tokens": 4670392.0, "step": 2040 }, { "entropy": 6.141398954391479, "epoch": 0.20215500197706604, "grad_norm": 1.1015625, "learning_rate": 0.0004998793541069964, "loss": 6.108, "mean_token_accuracy": 0.13688452690839767, "num_tokens": 4680605.0, "step": 2045 }, { "entropy": 6.069099378585816, "epoch": 0.2026492684855674, "grad_norm": 1.0234375, "learning_rate": 0.0004998781958322507, "loss": 6.0134, "mean_token_accuracy": 0.14460673555731773, "num_tokens": 4694250.0, "step": 2050 }, { "entropy": 6.110835599899292, "epoch": 0.20314353499406881, "grad_norm": 1.015625, "learning_rate": 0.0004998770320254666, "loss": 6.1661, "mean_token_accuracy": 0.13903781324625014, "num_tokens": 4705754.0, "step": 2055 }, { "entropy": 6.213265514373779, "epoch": 0.2036378015025702, "grad_norm": 1.0078125, "learning_rate": 0.0004998758626866725, "loss": 6.0439, "mean_token_accuracy": 0.14397211521863937, "num_tokens": 4716393.0, "step": 2060 }, { "entropy": 5.992143011093139, "epoch": 0.20413206801107156, "grad_norm": 0.95703125, "learning_rate": 0.0004998746878158973, "loss": 6.055, "mean_token_accuracy": 0.14380352646112443, "num_tokens": 4726894.0, "step": 2065 }, { "entropy": 6.137889289855957, "epoch": 0.20462633451957296, "grad_norm": 1.078125, "learning_rate": 0.0004998735074131699, "loss": 6.082, "mean_token_accuracy": 0.13775463551282882, "num_tokens": 4737488.0, "step": 2070 }, { "entropy": 6.157661390304566, "epoch": 0.20512060102807433, "grad_norm": 0.93359375, "learning_rate": 0.0004998723214785194, "loss": 6.1528, "mean_token_accuracy": 0.1327391304075718, "num_tokens": 4749131.0, "step": 2075 }, { "entropy": 6.090861511230469, "epoch": 0.20561486753657574, "grad_norm": 0.99609375, "learning_rate": 0.0004998711300119749, "loss": 6.0322, "mean_token_accuracy": 0.1410945810377598, "num_tokens": 4760503.0, "step": 2080 }, { "entropy": 6.128068828582764, "epoch": 0.2061091340450771, "grad_norm": 0.96484375, "learning_rate": 0.0004998699330135656, "loss": 6.1567, "mean_token_accuracy": 0.1358460932970047, "num_tokens": 4771965.0, "step": 2085 }, { "entropy": 6.096466827392578, "epoch": 0.20660340055357848, "grad_norm": 1.0234375, "learning_rate": 0.0004998687304833212, "loss": 6.1254, "mean_token_accuracy": 0.13651231974363326, "num_tokens": 4784215.0, "step": 2090 }, { "entropy": 6.102608966827392, "epoch": 0.20709766706207988, "grad_norm": 1.078125, "learning_rate": 0.000499867522421271, "loss": 6.0457, "mean_token_accuracy": 0.1427777349948883, "num_tokens": 4796410.0, "step": 2095 }, { "entropy": 6.065385389328003, "epoch": 0.20759193357058126, "grad_norm": 1.109375, "learning_rate": 0.000499866308827445, "loss": 6.0463, "mean_token_accuracy": 0.1456620767712593, "num_tokens": 4806990.0, "step": 2100 }, { "entropy": 6.113207626342773, "epoch": 0.20808620007908263, "grad_norm": 0.9453125, "learning_rate": 0.0004998650897018729, "loss": 6.0949, "mean_token_accuracy": 0.14114938974380492, "num_tokens": 4818903.0, "step": 2105 }, { "entropy": 6.091670751571655, "epoch": 0.20858046658758403, "grad_norm": 1.046875, "learning_rate": 0.0004998638650445847, "loss": 6.0222, "mean_token_accuracy": 0.14184736907482148, "num_tokens": 4829130.0, "step": 2110 }, { "entropy": 6.0775425910949705, "epoch": 0.2090747330960854, "grad_norm": 0.99609375, "learning_rate": 0.0004998626348556105, "loss": 6.0507, "mean_token_accuracy": 0.1536749005317688, "num_tokens": 4840424.0, "step": 2115 }, { "entropy": 6.098685884475708, "epoch": 0.2095689996045868, "grad_norm": 0.9453125, "learning_rate": 0.0004998613991349807, "loss": 6.0283, "mean_token_accuracy": 0.143294495344162, "num_tokens": 4851674.0, "step": 2120 }, { "entropy": 5.9475749969482425, "epoch": 0.21006326611308818, "grad_norm": 0.98828125, "learning_rate": 0.0004998601578827255, "loss": 5.9793, "mean_token_accuracy": 0.1536559596657753, "num_tokens": 4863884.0, "step": 2125 }, { "entropy": 6.033754873275757, "epoch": 0.21055753262158955, "grad_norm": 0.94921875, "learning_rate": 0.0004998589110988755, "loss": 6.0494, "mean_token_accuracy": 0.14718157574534416, "num_tokens": 4875582.0, "step": 2130 }, { "entropy": 6.114961338043213, "epoch": 0.21105179913009095, "grad_norm": 0.95703125, "learning_rate": 0.0004998576587834614, "loss": 6.0803, "mean_token_accuracy": 0.14199472591280937, "num_tokens": 4888325.0, "step": 2135 }, { "entropy": 6.098699426651001, "epoch": 0.21154606563859232, "grad_norm": 1.046875, "learning_rate": 0.000499856400936514, "loss": 6.072, "mean_token_accuracy": 0.14264639914035798, "num_tokens": 4899631.0, "step": 2140 }, { "entropy": 6.029827070236206, "epoch": 0.21204033214709372, "grad_norm": 0.99609375, "learning_rate": 0.0004998551375580643, "loss": 6.0712, "mean_token_accuracy": 0.13763367459177972, "num_tokens": 4910954.0, "step": 2145 }, { "entropy": 6.051994514465332, "epoch": 0.2125345986555951, "grad_norm": 1.0234375, "learning_rate": 0.0004998538686481435, "loss": 6.0714, "mean_token_accuracy": 0.14147689938545227, "num_tokens": 4921952.0, "step": 2150 }, { "entropy": 6.0656555652618405, "epoch": 0.21302886516409647, "grad_norm": 1.0, "learning_rate": 0.0004998525942067824, "loss": 6.0253, "mean_token_accuracy": 0.14360493123531343, "num_tokens": 4933984.0, "step": 2155 }, { "entropy": 6.164171361923218, "epoch": 0.21352313167259787, "grad_norm": 0.91015625, "learning_rate": 0.0004998513142340128, "loss": 6.1657, "mean_token_accuracy": 0.14157587438821792, "num_tokens": 4945926.0, "step": 2160 }, { "entropy": 6.026093053817749, "epoch": 0.21401739818109924, "grad_norm": 1.125, "learning_rate": 0.0004998500287298657, "loss": 6.0878, "mean_token_accuracy": 0.14866259396076204, "num_tokens": 4958123.0, "step": 2165 }, { "entropy": 6.158975839614868, "epoch": 0.21451166468960065, "grad_norm": 0.9921875, "learning_rate": 0.0004998487376943733, "loss": 6.1491, "mean_token_accuracy": 0.13338658437132836, "num_tokens": 4970409.0, "step": 2170 }, { "entropy": 6.122834396362305, "epoch": 0.21500593119810202, "grad_norm": 1.09375, "learning_rate": 0.000499847441127567, "loss": 6.0485, "mean_token_accuracy": 0.13795322477817534, "num_tokens": 4980429.0, "step": 2175 }, { "entropy": 6.053185510635376, "epoch": 0.2155001977066034, "grad_norm": 1.078125, "learning_rate": 0.0004998461390294787, "loss": 6.0711, "mean_token_accuracy": 0.14336730688810348, "num_tokens": 4991790.0, "step": 2180 }, { "entropy": 6.095970296859742, "epoch": 0.2159944642151048, "grad_norm": 0.98828125, "learning_rate": 0.0004998448314001405, "loss": 6.0869, "mean_token_accuracy": 0.14493904113769532, "num_tokens": 5003611.0, "step": 2185 }, { "entropy": 6.176206493377686, "epoch": 0.21648873072360617, "grad_norm": 1.1171875, "learning_rate": 0.0004998435182395845, "loss": 6.1385, "mean_token_accuracy": 0.1309673383831978, "num_tokens": 5014824.0, "step": 2190 }, { "entropy": 6.142057228088379, "epoch": 0.21698299723210757, "grad_norm": 0.96484375, "learning_rate": 0.0004998421995478432, "loss": 6.0831, "mean_token_accuracy": 0.143635593354702, "num_tokens": 5026937.0, "step": 2195 }, { "entropy": 6.116099071502686, "epoch": 0.21747726374060894, "grad_norm": 0.99609375, "learning_rate": 0.0004998408753249489, "loss": 6.1134, "mean_token_accuracy": 0.1369356207549572, "num_tokens": 5037996.0, "step": 2200 }, { "entropy": 6.096542501449585, "epoch": 0.2179715302491103, "grad_norm": 0.9921875, "learning_rate": 0.0004998395455709342, "loss": 6.0605, "mean_token_accuracy": 0.14553544148802758, "num_tokens": 5050944.0, "step": 2205 }, { "entropy": 6.150865888595581, "epoch": 0.2184657967576117, "grad_norm": 1.046875, "learning_rate": 0.0004998382102858317, "loss": 6.1, "mean_token_accuracy": 0.1378478489816189, "num_tokens": 5062129.0, "step": 2210 }, { "entropy": 6.0926353454589846, "epoch": 0.2189600632661131, "grad_norm": 1.0078125, "learning_rate": 0.0004998368694696743, "loss": 6.0959, "mean_token_accuracy": 0.14366044774651526, "num_tokens": 5073318.0, "step": 2215 }, { "entropy": 6.064820623397827, "epoch": 0.21945432977461446, "grad_norm": 0.9921875, "learning_rate": 0.0004998355231224952, "loss": 6.1278, "mean_token_accuracy": 0.13671059682965278, "num_tokens": 5084607.0, "step": 2220 }, { "entropy": 6.1097174167633055, "epoch": 0.21994859628311586, "grad_norm": 0.96484375, "learning_rate": 0.0004998341712443273, "loss": 6.0165, "mean_token_accuracy": 0.14424162060022355, "num_tokens": 5096004.0, "step": 2225 }, { "entropy": 6.0761024951934814, "epoch": 0.22044286279161723, "grad_norm": 1.0234375, "learning_rate": 0.000499832813835204, "loss": 6.0296, "mean_token_accuracy": 0.14155133366584777, "num_tokens": 5107171.0, "step": 2230 }, { "entropy": 5.977806282043457, "epoch": 0.22093712930011863, "grad_norm": 0.93359375, "learning_rate": 0.0004998314508951584, "loss": 5.9782, "mean_token_accuracy": 0.15077303797006608, "num_tokens": 5119249.0, "step": 2235 }, { "entropy": 6.04344334602356, "epoch": 0.22143139580862, "grad_norm": 1.0703125, "learning_rate": 0.0004998300824242244, "loss": 5.9945, "mean_token_accuracy": 0.13899804279208183, "num_tokens": 5130798.0, "step": 2240 }, { "entropy": 6.146693372726441, "epoch": 0.22192566231712138, "grad_norm": 1.171875, "learning_rate": 0.0004998287084224353, "loss": 6.1624, "mean_token_accuracy": 0.12782063856720924, "num_tokens": 5141376.0, "step": 2245 }, { "entropy": 5.979104852676391, "epoch": 0.22241992882562278, "grad_norm": 1.1015625, "learning_rate": 0.0004998273288898252, "loss": 5.9599, "mean_token_accuracy": 0.1464287005364895, "num_tokens": 5152888.0, "step": 2250 }, { "entropy": 6.031632804870606, "epoch": 0.22291419533412415, "grad_norm": 0.9375, "learning_rate": 0.000499825943826428, "loss": 6.0647, "mean_token_accuracy": 0.14004838690161706, "num_tokens": 5165720.0, "step": 2255 }, { "entropy": 6.069583225250244, "epoch": 0.22340846184262556, "grad_norm": 1.0390625, "learning_rate": 0.0004998245532322776, "loss": 5.9363, "mean_token_accuracy": 0.14667778834700584, "num_tokens": 5177345.0, "step": 2260 }, { "entropy": 6.060588693618774, "epoch": 0.22390272835112693, "grad_norm": 1.171875, "learning_rate": 0.0004998231571074083, "loss": 5.9634, "mean_token_accuracy": 0.14570290222764015, "num_tokens": 5187385.0, "step": 2265 }, { "entropy": 6.04728593826294, "epoch": 0.2243969948596283, "grad_norm": 1.015625, "learning_rate": 0.0004998217554518545, "loss": 6.0683, "mean_token_accuracy": 0.13824618086218834, "num_tokens": 5199552.0, "step": 2270 }, { "entropy": 6.039723873138428, "epoch": 0.2248912613681297, "grad_norm": 0.99609375, "learning_rate": 0.0004998203482656507, "loss": 6.027, "mean_token_accuracy": 0.14244999885559081, "num_tokens": 5210316.0, "step": 2275 }, { "entropy": 6.0842948913574215, "epoch": 0.22538552787663108, "grad_norm": 1.0703125, "learning_rate": 0.0004998189355488314, "loss": 6.1053, "mean_token_accuracy": 0.1472305215895176, "num_tokens": 5221595.0, "step": 2280 }, { "entropy": 6.140758895874024, "epoch": 0.22587979438513248, "grad_norm": 1.078125, "learning_rate": 0.0004998175173014313, "loss": 6.0722, "mean_token_accuracy": 0.13632547855377197, "num_tokens": 5232882.0, "step": 2285 }, { "entropy": 6.0675756454467775, "epoch": 0.22637406089363385, "grad_norm": 1.0625, "learning_rate": 0.0004998160935234857, "loss": 6.1709, "mean_token_accuracy": 0.13839787468314171, "num_tokens": 5244841.0, "step": 2290 }, { "entropy": 6.096714353561401, "epoch": 0.22686832740213522, "grad_norm": 1.0859375, "learning_rate": 0.000499814664215029, "loss": 5.9748, "mean_token_accuracy": 0.1458760157227516, "num_tokens": 5256162.0, "step": 2295 }, { "entropy": 6.00123872756958, "epoch": 0.22736259391063662, "grad_norm": 1.15625, "learning_rate": 0.0004998132293760968, "loss": 5.9029, "mean_token_accuracy": 0.15427679419517518, "num_tokens": 5267130.0, "step": 2300 }, { "entropy": 5.969837474822998, "epoch": 0.227856860419138, "grad_norm": 0.98828125, "learning_rate": 0.0004998117890067243, "loss": 6.0244, "mean_token_accuracy": 0.14411933422088624, "num_tokens": 5279394.0, "step": 2305 }, { "entropy": 5.981906747817993, "epoch": 0.22835112692763937, "grad_norm": 1.046875, "learning_rate": 0.0004998103431069469, "loss": 5.9975, "mean_token_accuracy": 0.1491586372256279, "num_tokens": 5291068.0, "step": 2310 }, { "entropy": 6.060888195037842, "epoch": 0.22884539343614077, "grad_norm": 1.0859375, "learning_rate": 0.0004998088916768002, "loss": 5.9579, "mean_token_accuracy": 0.14889078661799432, "num_tokens": 5300924.0, "step": 2315 }, { "entropy": 6.016797971725464, "epoch": 0.22933965994464214, "grad_norm": 1.0078125, "learning_rate": 0.0004998074347163199, "loss": 5.9542, "mean_token_accuracy": 0.1480551391839981, "num_tokens": 5311998.0, "step": 2320 }, { "entropy": 6.06162691116333, "epoch": 0.22983392645314354, "grad_norm": 0.984375, "learning_rate": 0.0004998059722255418, "loss": 5.9899, "mean_token_accuracy": 0.14691204354166984, "num_tokens": 5322163.0, "step": 2325 }, { "entropy": 6.0275694847106935, "epoch": 0.23032819296164492, "grad_norm": 1.1171875, "learning_rate": 0.0004998045042045019, "loss": 5.996, "mean_token_accuracy": 0.1497631698846817, "num_tokens": 5331638.0, "step": 2330 }, { "entropy": 6.048976612091065, "epoch": 0.2308224594701463, "grad_norm": 1.078125, "learning_rate": 0.0004998030306532363, "loss": 5.9939, "mean_token_accuracy": 0.14958565384149553, "num_tokens": 5342399.0, "step": 2335 }, { "entropy": 6.055438804626465, "epoch": 0.2313167259786477, "grad_norm": 1.1015625, "learning_rate": 0.0004998015515717813, "loss": 6.0695, "mean_token_accuracy": 0.14016990289092063, "num_tokens": 5353481.0, "step": 2340 }, { "entropy": 6.052402687072754, "epoch": 0.23181099248714906, "grad_norm": 1.0546875, "learning_rate": 0.0004998000669601733, "loss": 5.9689, "mean_token_accuracy": 0.1473512254655361, "num_tokens": 5365167.0, "step": 2345 }, { "entropy": 6.002137184143066, "epoch": 0.23230525899565047, "grad_norm": 0.98828125, "learning_rate": 0.0004997985768184488, "loss": 5.9967, "mean_token_accuracy": 0.1431095339357853, "num_tokens": 5375809.0, "step": 2350 }, { "entropy": 5.962526512145996, "epoch": 0.23279952550415184, "grad_norm": 1.046875, "learning_rate": 0.0004997970811466443, "loss": 5.9133, "mean_token_accuracy": 0.1538688361644745, "num_tokens": 5387372.0, "step": 2355 }, { "entropy": 6.187628889083863, "epoch": 0.2332937920126532, "grad_norm": 1.09375, "learning_rate": 0.0004997955799447969, "loss": 6.0898, "mean_token_accuracy": 0.13684846088290215, "num_tokens": 5399210.0, "step": 2360 }, { "entropy": 5.985762119293213, "epoch": 0.2337880585211546, "grad_norm": 1.0390625, "learning_rate": 0.0004997940732129432, "loss": 6.017, "mean_token_accuracy": 0.14093376472592353, "num_tokens": 5410969.0, "step": 2365 }, { "entropy": 5.984814739227295, "epoch": 0.23428232502965599, "grad_norm": 1.0859375, "learning_rate": 0.0004997925609511205, "loss": 5.9824, "mean_token_accuracy": 0.14780228435993195, "num_tokens": 5422569.0, "step": 2370 }, { "entropy": 6.031500720977784, "epoch": 0.2347765915381574, "grad_norm": 1.1796875, "learning_rate": 0.0004997910431593659, "loss": 5.9606, "mean_token_accuracy": 0.15011014714837073, "num_tokens": 5434592.0, "step": 2375 }, { "entropy": 6.0243175506591795, "epoch": 0.23527085804665876, "grad_norm": 1.0703125, "learning_rate": 0.0004997895198377168, "loss": 6.0545, "mean_token_accuracy": 0.14284207075834274, "num_tokens": 5446525.0, "step": 2380 }, { "entropy": 6.08224196434021, "epoch": 0.23576512455516013, "grad_norm": 1.0078125, "learning_rate": 0.0004997879909862105, "loss": 6.025, "mean_token_accuracy": 0.14782738387584687, "num_tokens": 5457327.0, "step": 2385 }, { "entropy": 6.105248498916626, "epoch": 0.23625939106366153, "grad_norm": 1.078125, "learning_rate": 0.000499786456604885, "loss": 6.0642, "mean_token_accuracy": 0.1362588956952095, "num_tokens": 5468533.0, "step": 2390 }, { "entropy": 5.998384857177735, "epoch": 0.2367536575721629, "grad_norm": 0.97265625, "learning_rate": 0.0004997849166937776, "loss": 5.9451, "mean_token_accuracy": 0.14417133554816247, "num_tokens": 5480652.0, "step": 2395 }, { "entropy": 6.012068605422973, "epoch": 0.2372479240806643, "grad_norm": 1.0390625, "learning_rate": 0.0004997833712529265, "loss": 5.9707, "mean_token_accuracy": 0.14451036602258682, "num_tokens": 5491446.0, "step": 2400 }, { "entropy": 6.021755743026733, "epoch": 0.23774219058916568, "grad_norm": 0.96484375, "learning_rate": 0.0004997818202823695, "loss": 5.9945, "mean_token_accuracy": 0.14959129244089125, "num_tokens": 5502886.0, "step": 2405 }, { "entropy": 6.0749561309814455, "epoch": 0.23823645709766705, "grad_norm": 1.125, "learning_rate": 0.0004997802637821449, "loss": 6.023, "mean_token_accuracy": 0.14053252562880517, "num_tokens": 5514305.0, "step": 2410 }, { "entropy": 5.98513970375061, "epoch": 0.23873072360616845, "grad_norm": 0.99609375, "learning_rate": 0.0004997787017522909, "loss": 5.9437, "mean_token_accuracy": 0.15076548904180526, "num_tokens": 5525913.0, "step": 2415 }, { "entropy": 5.90565128326416, "epoch": 0.23922499011466983, "grad_norm": 1.015625, "learning_rate": 0.0004997771341928459, "loss": 5.9446, "mean_token_accuracy": 0.1544351950287819, "num_tokens": 5537069.0, "step": 2420 }, { "entropy": 6.022730112075806, "epoch": 0.2397192566231712, "grad_norm": 1.1953125, "learning_rate": 0.0004997755611038487, "loss": 6.0441, "mean_token_accuracy": 0.1400386117398739, "num_tokens": 5547988.0, "step": 2425 }, { "entropy": 6.105308675765992, "epoch": 0.2402135231316726, "grad_norm": 0.94140625, "learning_rate": 0.0004997739824853378, "loss": 6.1088, "mean_token_accuracy": 0.1395256355404854, "num_tokens": 5560400.0, "step": 2430 }, { "entropy": 5.987665414810181, "epoch": 0.24070778964017397, "grad_norm": 1.0, "learning_rate": 0.0004997723983373519, "loss": 5.9696, "mean_token_accuracy": 0.15029642432928086, "num_tokens": 5572291.0, "step": 2435 }, { "entropy": 6.100761747360229, "epoch": 0.24120205614867538, "grad_norm": 1.015625, "learning_rate": 0.0004997708086599303, "loss": 5.9938, "mean_token_accuracy": 0.14239495247602463, "num_tokens": 5583583.0, "step": 2440 }, { "entropy": 6.093548583984375, "epoch": 0.24169632265717675, "grad_norm": 0.92578125, "learning_rate": 0.0004997692134531119, "loss": 6.0205, "mean_token_accuracy": 0.14349138885736465, "num_tokens": 5595499.0, "step": 2445 }, { "entropy": 5.937535381317138, "epoch": 0.24219058916567812, "grad_norm": 1.0703125, "learning_rate": 0.000499767612716936, "loss": 5.9486, "mean_token_accuracy": 0.1555730566382408, "num_tokens": 5606745.0, "step": 2450 }, { "entropy": 5.977556610107422, "epoch": 0.24268485567417952, "grad_norm": 1.1328125, "learning_rate": 0.0004997660064514419, "loss": 6.0333, "mean_token_accuracy": 0.1459631770849228, "num_tokens": 5618226.0, "step": 2455 }, { "entropy": 6.103812122344971, "epoch": 0.2431791221826809, "grad_norm": 0.95703125, "learning_rate": 0.0004997643946566691, "loss": 6.0358, "mean_token_accuracy": 0.14382674545049667, "num_tokens": 5628941.0, "step": 2460 }, { "entropy": 5.948967981338501, "epoch": 0.2436733886911823, "grad_norm": 1.0390625, "learning_rate": 0.0004997627773326574, "loss": 5.8499, "mean_token_accuracy": 0.15501064658164979, "num_tokens": 5641077.0, "step": 2465 }, { "entropy": 6.018094301223755, "epoch": 0.24416765519968367, "grad_norm": 1.1328125, "learning_rate": 0.0004997611544794465, "loss": 6.1555, "mean_token_accuracy": 0.1338454492390156, "num_tokens": 5652156.0, "step": 2470 }, { "entropy": 6.151158618927002, "epoch": 0.24466192170818504, "grad_norm": 1.0390625, "learning_rate": 0.0004997595260970764, "loss": 6.0822, "mean_token_accuracy": 0.14347486943006516, "num_tokens": 5663988.0, "step": 2475 }, { "entropy": 5.977680206298828, "epoch": 0.24515618821668644, "grad_norm": 0.9609375, "learning_rate": 0.000499757892185587, "loss": 6.0018, "mean_token_accuracy": 0.14267092123627662, "num_tokens": 5676302.0, "step": 2480 }, { "entropy": 6.070641231536865, "epoch": 0.24565045472518782, "grad_norm": 1.0625, "learning_rate": 0.0004997562527450187, "loss": 6.046, "mean_token_accuracy": 0.14550234749913216, "num_tokens": 5686686.0, "step": 2485 }, { "entropy": 6.021747350692749, "epoch": 0.24614472123368922, "grad_norm": 1.0703125, "learning_rate": 0.0004997546077754116, "loss": 5.9525, "mean_token_accuracy": 0.15929894894361496, "num_tokens": 5698379.0, "step": 2490 }, { "entropy": 5.958306932449341, "epoch": 0.2466389877421906, "grad_norm": 1.0546875, "learning_rate": 0.0004997529572768063, "loss": 5.9432, "mean_token_accuracy": 0.1498410865664482, "num_tokens": 5708891.0, "step": 2495 }, { "entropy": 5.981058549880982, "epoch": 0.24713325425069196, "grad_norm": 1.0859375, "learning_rate": 0.0004997513012492434, "loss": 5.9923, "mean_token_accuracy": 0.14332532063126563, "num_tokens": 5720326.0, "step": 2500 }, { "entropy": 6.052645683288574, "epoch": 0.24762752075919336, "grad_norm": 1.0, "learning_rate": 0.0004997496396927636, "loss": 5.9112, "mean_token_accuracy": 0.15235294178128242, "num_tokens": 5731121.0, "step": 2505 }, { "entropy": 6.023140573501587, "epoch": 0.24812178726769474, "grad_norm": 1.125, "learning_rate": 0.0004997479726074077, "loss": 5.9597, "mean_token_accuracy": 0.15026197880506514, "num_tokens": 5741637.0, "step": 2510 }, { "entropy": 6.048560428619385, "epoch": 0.24861605377619614, "grad_norm": 1.0078125, "learning_rate": 0.000499746299993217, "loss": 6.0102, "mean_token_accuracy": 0.14581428989768028, "num_tokens": 5752659.0, "step": 2515 }, { "entropy": 5.998668670654297, "epoch": 0.2491103202846975, "grad_norm": 1.015625, "learning_rate": 0.0004997446218502324, "loss": 5.9728, "mean_token_accuracy": 0.14580842703580857, "num_tokens": 5763829.0, "step": 2520 }, { "entropy": 6.0419858455657955, "epoch": 0.24960458679319888, "grad_norm": 1.03125, "learning_rate": 0.0004997429381784952, "loss": 6.053, "mean_token_accuracy": 0.1448736622929573, "num_tokens": 5775848.0, "step": 2525 }, { "entropy": 5.984309673309326, "epoch": 0.2500988533017003, "grad_norm": 1.1328125, "learning_rate": 0.0004997412489780469, "loss": 6.0037, "mean_token_accuracy": 0.1499286875128746, "num_tokens": 5786595.0, "step": 2530 }, { "entropy": 5.964243793487549, "epoch": 0.25059311981020166, "grad_norm": 1.0625, "learning_rate": 0.000499739554248929, "loss": 5.8929, "mean_token_accuracy": 0.15398191586136817, "num_tokens": 5797841.0, "step": 2535 }, { "entropy": 5.912666082382202, "epoch": 0.25108738631870303, "grad_norm": 1.0546875, "learning_rate": 0.0004997378539911832, "loss": 5.9089, "mean_token_accuracy": 0.15088940635323525, "num_tokens": 5809106.0, "step": 2540 }, { "entropy": 5.973687314987183, "epoch": 0.2515816528272044, "grad_norm": 1.0234375, "learning_rate": 0.0004997361482048513, "loss": 5.9215, "mean_token_accuracy": 0.1497866354882717, "num_tokens": 5820316.0, "step": 2545 }, { "entropy": 6.026650857925415, "epoch": 0.25207591933570583, "grad_norm": 1.0078125, "learning_rate": 0.0004997344368899753, "loss": 6.0408, "mean_token_accuracy": 0.139362945407629, "num_tokens": 5833137.0, "step": 2550 }, { "entropy": 6.037950611114502, "epoch": 0.2525701858442072, "grad_norm": 1.109375, "learning_rate": 0.0004997327200465972, "loss": 5.9694, "mean_token_accuracy": 0.14529137313365936, "num_tokens": 5844088.0, "step": 2555 }, { "entropy": 6.077861881256103, "epoch": 0.2530644523527086, "grad_norm": 0.93359375, "learning_rate": 0.0004997309976747594, "loss": 5.9736, "mean_token_accuracy": 0.14326793625950812, "num_tokens": 5854546.0, "step": 2560 }, { "entropy": 6.011197853088379, "epoch": 0.25355871886120995, "grad_norm": 1.09375, "learning_rate": 0.0004997292697745042, "loss": 5.9723, "mean_token_accuracy": 0.1466481104493141, "num_tokens": 5865326.0, "step": 2565 }, { "entropy": 5.999698734283447, "epoch": 0.2540529853697113, "grad_norm": 1.0234375, "learning_rate": 0.0004997275363458741, "loss": 5.8594, "mean_token_accuracy": 0.1503140576183796, "num_tokens": 5876487.0, "step": 2570 }, { "entropy": 5.875597381591797, "epoch": 0.25454725187821275, "grad_norm": 1.0390625, "learning_rate": 0.0004997257973889118, "loss": 5.9726, "mean_token_accuracy": 0.14843393564224244, "num_tokens": 5887846.0, "step": 2575 }, { "entropy": 6.101366996765137, "epoch": 0.25504151838671413, "grad_norm": 1.078125, "learning_rate": 0.0004997240529036599, "loss": 5.9412, "mean_token_accuracy": 0.15172709226608277, "num_tokens": 5898572.0, "step": 2580 }, { "entropy": 5.881202983856201, "epoch": 0.2555357848952155, "grad_norm": 1.0859375, "learning_rate": 0.0004997223028901615, "loss": 6.0037, "mean_token_accuracy": 0.1475423127412796, "num_tokens": 5908927.0, "step": 2585 }, { "entropy": 6.037431478500366, "epoch": 0.2560300514037169, "grad_norm": 1.0859375, "learning_rate": 0.0004997205473484596, "loss": 5.9495, "mean_token_accuracy": 0.1498175874352455, "num_tokens": 5919807.0, "step": 2590 }, { "entropy": 5.920142316818238, "epoch": 0.25652431791221825, "grad_norm": 1.0078125, "learning_rate": 0.0004997187862785974, "loss": 5.9779, "mean_token_accuracy": 0.14424620494246482, "num_tokens": 5931160.0, "step": 2595 }, { "entropy": 6.088014888763428, "epoch": 0.2570185844207197, "grad_norm": 0.94921875, "learning_rate": 0.0004997170196806181, "loss": 6.0412, "mean_token_accuracy": 0.1426064506173134, "num_tokens": 5943694.0, "step": 2600 }, { "entropy": 5.981357526779175, "epoch": 0.25751285092922105, "grad_norm": 1.0078125, "learning_rate": 0.0004997152475545652, "loss": 5.9319, "mean_token_accuracy": 0.14945385083556176, "num_tokens": 5954543.0, "step": 2605 }, { "entropy": 5.9636317729949955, "epoch": 0.2580071174377224, "grad_norm": 1.015625, "learning_rate": 0.0004997134699004825, "loss": 5.973, "mean_token_accuracy": 0.1513287492096424, "num_tokens": 5965080.0, "step": 2610 }, { "entropy": 6.036751079559326, "epoch": 0.2585013839462238, "grad_norm": 1.1484375, "learning_rate": 0.0004997116867184136, "loss": 5.9566, "mean_token_accuracy": 0.14630378186702728, "num_tokens": 5975314.0, "step": 2615 }, { "entropy": 6.02877459526062, "epoch": 0.25899565045472517, "grad_norm": 1.109375, "learning_rate": 0.0004997098980084022, "loss": 5.9735, "mean_token_accuracy": 0.14686284810304642, "num_tokens": 5985927.0, "step": 2620 }, { "entropy": 5.9730428695678714, "epoch": 0.2594899169632266, "grad_norm": 1.1015625, "learning_rate": 0.0004997081037704926, "loss": 5.9986, "mean_token_accuracy": 0.145076747238636, "num_tokens": 5997311.0, "step": 2625 }, { "entropy": 5.986532354354859, "epoch": 0.25998418347172797, "grad_norm": 1.0, "learning_rate": 0.0004997063040047288, "loss": 6.0236, "mean_token_accuracy": 0.13863110765814782, "num_tokens": 6008595.0, "step": 2630 }, { "entropy": 6.084332275390625, "epoch": 0.26047844998022934, "grad_norm": 1.21875, "learning_rate": 0.0004997044987111548, "loss": 5.9346, "mean_token_accuracy": 0.1485560044646263, "num_tokens": 6019055.0, "step": 2635 }, { "entropy": 5.984119462966919, "epoch": 0.2609727164887307, "grad_norm": 1.046875, "learning_rate": 0.0004997026878898155, "loss": 6.0785, "mean_token_accuracy": 0.13726168423891066, "num_tokens": 6030029.0, "step": 2640 }, { "entropy": 6.064934492111206, "epoch": 0.2614669829972321, "grad_norm": 1.03125, "learning_rate": 0.0004997008715407552, "loss": 6.0149, "mean_token_accuracy": 0.14624494388699533, "num_tokens": 6041495.0, "step": 2645 }, { "entropy": 6.0098552227020265, "epoch": 0.2619612495057335, "grad_norm": 0.98828125, "learning_rate": 0.0004996990496640185, "loss": 5.9223, "mean_token_accuracy": 0.14212577491998674, "num_tokens": 6052307.0, "step": 2650 }, { "entropy": 5.9654816627502445, "epoch": 0.2624555160142349, "grad_norm": 1.0078125, "learning_rate": 0.0004996972222596505, "loss": 5.8811, "mean_token_accuracy": 0.14910161644220352, "num_tokens": 6062550.0, "step": 2655 }, { "entropy": 5.945908880233764, "epoch": 0.26294978252273626, "grad_norm": 1.078125, "learning_rate": 0.0004996953893276958, "loss": 5.9301, "mean_token_accuracy": 0.14317954927682877, "num_tokens": 6074450.0, "step": 2660 }, { "entropy": 5.945242881774902, "epoch": 0.26344404903123764, "grad_norm": 0.97265625, "learning_rate": 0.0004996935508681997, "loss": 5.9609, "mean_token_accuracy": 0.1495286300778389, "num_tokens": 6085749.0, "step": 2665 }, { "entropy": 6.005150699615479, "epoch": 0.263938315539739, "grad_norm": 1.125, "learning_rate": 0.0004996917068812075, "loss": 5.8905, "mean_token_accuracy": 0.1543781578540802, "num_tokens": 6096438.0, "step": 2670 }, { "entropy": 5.924571704864502, "epoch": 0.26443258204824044, "grad_norm": 1.0078125, "learning_rate": 0.0004996898573667643, "loss": 5.9266, "mean_token_accuracy": 0.1454748436808586, "num_tokens": 6108386.0, "step": 2675 }, { "entropy": 6.008694839477539, "epoch": 0.2649268485567418, "grad_norm": 1.09375, "learning_rate": 0.0004996880023249158, "loss": 5.8626, "mean_token_accuracy": 0.15368301123380662, "num_tokens": 6118771.0, "step": 2680 }, { "entropy": 5.974543571472168, "epoch": 0.2654211150652432, "grad_norm": 1.03125, "learning_rate": 0.0004996861417557076, "loss": 5.9496, "mean_token_accuracy": 0.14521803110837936, "num_tokens": 6130718.0, "step": 2685 }, { "entropy": 5.922163200378418, "epoch": 0.26591538157374456, "grad_norm": 1.109375, "learning_rate": 0.0004996842756591855, "loss": 5.9631, "mean_token_accuracy": 0.14341218546032905, "num_tokens": 6142086.0, "step": 2690 }, { "entropy": 5.976787948608399, "epoch": 0.26640964808224593, "grad_norm": 0.9765625, "learning_rate": 0.0004996824040353953, "loss": 5.9613, "mean_token_accuracy": 0.1457512103021145, "num_tokens": 6153857.0, "step": 2695 }, { "entropy": 6.125744962692261, "epoch": 0.2669039145907473, "grad_norm": 1.046875, "learning_rate": 0.0004996805268843832, "loss": 6.0951, "mean_token_accuracy": 0.1432183265686035, "num_tokens": 6166796.0, "step": 2700 }, { "entropy": 5.963466644287109, "epoch": 0.26739818109924873, "grad_norm": 1.015625, "learning_rate": 0.0004996786442061952, "loss": 5.9169, "mean_token_accuracy": 0.15192901045084, "num_tokens": 6178046.0, "step": 2705 }, { "entropy": 5.9657057762146, "epoch": 0.2678924476077501, "grad_norm": 0.97265625, "learning_rate": 0.0004996767560008777, "loss": 5.9593, "mean_token_accuracy": 0.14713699072599412, "num_tokens": 6190455.0, "step": 2710 }, { "entropy": 5.899187612533569, "epoch": 0.2683867141162515, "grad_norm": 0.99609375, "learning_rate": 0.0004996748622684771, "loss": 5.8462, "mean_token_accuracy": 0.15217214077711105, "num_tokens": 6201659.0, "step": 2715 }, { "entropy": 5.924319171905518, "epoch": 0.26888098062475285, "grad_norm": 1.03125, "learning_rate": 0.0004996729630090401, "loss": 5.9552, "mean_token_accuracy": 0.1431477539241314, "num_tokens": 6213870.0, "step": 2720 }, { "entropy": 6.0065733909606935, "epoch": 0.2693752471332542, "grad_norm": 1.015625, "learning_rate": 0.0004996710582226133, "loss": 5.9012, "mean_token_accuracy": 0.1548033893108368, "num_tokens": 6224237.0, "step": 2725 }, { "entropy": 5.960059928894043, "epoch": 0.26986951364175565, "grad_norm": 1.140625, "learning_rate": 0.0004996691479092437, "loss": 5.9433, "mean_token_accuracy": 0.14833316206932068, "num_tokens": 6235868.0, "step": 2730 }, { "entropy": 6.0247667789459225, "epoch": 0.270363780150257, "grad_norm": 1.0703125, "learning_rate": 0.0004996672320689782, "loss": 5.9961, "mean_token_accuracy": 0.14516259282827376, "num_tokens": 6247994.0, "step": 2735 }, { "entropy": 5.855693197250366, "epoch": 0.2708580466587584, "grad_norm": 1.0234375, "learning_rate": 0.0004996653107018638, "loss": 5.8469, "mean_token_accuracy": 0.15463558286428453, "num_tokens": 6259654.0, "step": 2740 }, { "entropy": 5.977344179153443, "epoch": 0.2713523131672598, "grad_norm": 1.0, "learning_rate": 0.000499663383807948, "loss": 5.9049, "mean_token_accuracy": 0.1500097319483757, "num_tokens": 6270582.0, "step": 2745 }, { "entropy": 5.968403148651123, "epoch": 0.27184657967576115, "grad_norm": 1.0703125, "learning_rate": 0.0004996614513872781, "loss": 5.9016, "mean_token_accuracy": 0.15006383657455444, "num_tokens": 6281088.0, "step": 2750 }, { "entropy": 5.981626415252686, "epoch": 0.2723408461842626, "grad_norm": 1.140625, "learning_rate": 0.0004996595134399017, "loss": 6.0555, "mean_token_accuracy": 0.140472724288702, "num_tokens": 6292920.0, "step": 2755 }, { "entropy": 6.020872259140015, "epoch": 0.27283511269276395, "grad_norm": 0.953125, "learning_rate": 0.0004996575699658664, "loss": 5.9111, "mean_token_accuracy": 0.15108120441436768, "num_tokens": 6304980.0, "step": 2760 }, { "entropy": 5.918898677825927, "epoch": 0.2733293792012653, "grad_norm": 1.0234375, "learning_rate": 0.0004996556209652199, "loss": 5.8999, "mean_token_accuracy": 0.15111031085252763, "num_tokens": 6316175.0, "step": 2765 }, { "entropy": 5.976380968093872, "epoch": 0.2738236457097667, "grad_norm": 1.0546875, "learning_rate": 0.0004996536664380104, "loss": 5.9517, "mean_token_accuracy": 0.15452203899621964, "num_tokens": 6327590.0, "step": 2770 }, { "entropy": 5.924459648132324, "epoch": 0.27431791221826807, "grad_norm": 1.0078125, "learning_rate": 0.0004996517063842859, "loss": 5.9716, "mean_token_accuracy": 0.1498926803469658, "num_tokens": 6339066.0, "step": 2775 }, { "entropy": 6.0026692867279055, "epoch": 0.2748121787267695, "grad_norm": 0.98828125, "learning_rate": 0.0004996497408040944, "loss": 5.9024, "mean_token_accuracy": 0.15032327100634574, "num_tokens": 6349485.0, "step": 2780 }, { "entropy": 5.844460916519165, "epoch": 0.27530644523527087, "grad_norm": 1.078125, "learning_rate": 0.0004996477696974845, "loss": 5.8657, "mean_token_accuracy": 0.15661628544330597, "num_tokens": 6360775.0, "step": 2785 }, { "entropy": 5.9499735832214355, "epoch": 0.27580071174377224, "grad_norm": 1.09375, "learning_rate": 0.0004996457930645046, "loss": 5.883, "mean_token_accuracy": 0.148551806807518, "num_tokens": 6371645.0, "step": 2790 }, { "entropy": 5.961523580551147, "epoch": 0.2762949782522736, "grad_norm": 1.0234375, "learning_rate": 0.0004996438109052034, "loss": 5.9074, "mean_token_accuracy": 0.15085601136088372, "num_tokens": 6383877.0, "step": 2795 }, { "entropy": 5.9515691757202145, "epoch": 0.276789244760775, "grad_norm": 1.046875, "learning_rate": 0.0004996418232196296, "loss": 5.9828, "mean_token_accuracy": 0.14350538998842238, "num_tokens": 6394488.0, "step": 2800 }, { "entropy": 5.979497003555298, "epoch": 0.2772835112692764, "grad_norm": 1.015625, "learning_rate": 0.0004996398300078321, "loss": 5.9065, "mean_token_accuracy": 0.15064874663949013, "num_tokens": 6404948.0, "step": 2805 }, { "entropy": 5.974899482727051, "epoch": 0.2777777777777778, "grad_norm": 1.0, "learning_rate": 0.0004996378312698598, "loss": 5.9471, "mean_token_accuracy": 0.1533238559961319, "num_tokens": 6416273.0, "step": 2810 }, { "entropy": 6.013521671295166, "epoch": 0.27827204428627916, "grad_norm": 1.1484375, "learning_rate": 0.0004996358270057622, "loss": 5.9557, "mean_token_accuracy": 0.1466079130768776, "num_tokens": 6427091.0, "step": 2815 }, { "entropy": 5.9516332149505615, "epoch": 0.27876631079478054, "grad_norm": 1.078125, "learning_rate": 0.0004996338172155883, "loss": 5.9126, "mean_token_accuracy": 0.14914426058530808, "num_tokens": 6438254.0, "step": 2820 }, { "entropy": 5.89876914024353, "epoch": 0.2792605773032819, "grad_norm": 1.015625, "learning_rate": 0.0004996318018993876, "loss": 5.8239, "mean_token_accuracy": 0.1530715063214302, "num_tokens": 6450618.0, "step": 2825 }, { "entropy": 5.980556011199951, "epoch": 0.27975484381178334, "grad_norm": 0.9296875, "learning_rate": 0.0004996297810572098, "loss": 5.8956, "mean_token_accuracy": 0.1491038627922535, "num_tokens": 6462467.0, "step": 2830 }, { "entropy": 5.9045891761779785, "epoch": 0.2802491103202847, "grad_norm": 1.0078125, "learning_rate": 0.0004996277546891045, "loss": 5.864, "mean_token_accuracy": 0.15746333003044127, "num_tokens": 6474206.0, "step": 2835 }, { "entropy": 5.942203712463379, "epoch": 0.2807433768287861, "grad_norm": 1.0390625, "learning_rate": 0.0004996257227951216, "loss": 5.9691, "mean_token_accuracy": 0.1443627193570137, "num_tokens": 6486405.0, "step": 2840 }, { "entropy": 5.967880725860596, "epoch": 0.28123764333728746, "grad_norm": 1.09375, "learning_rate": 0.000499623685375311, "loss": 5.9336, "mean_token_accuracy": 0.14780732095241547, "num_tokens": 6496949.0, "step": 2845 }, { "entropy": 5.923089170455933, "epoch": 0.28173190984578883, "grad_norm": 1.0, "learning_rate": 0.000499621642429723, "loss": 5.874, "mean_token_accuracy": 0.1550042062997818, "num_tokens": 6508913.0, "step": 2850 }, { "entropy": 5.956121826171875, "epoch": 0.28222617635429026, "grad_norm": 0.94921875, "learning_rate": 0.0004996195939584078, "loss": 5.9019, "mean_token_accuracy": 0.14797470420598985, "num_tokens": 6519837.0, "step": 2855 }, { "entropy": 5.941003894805908, "epoch": 0.28272044286279163, "grad_norm": 0.98046875, "learning_rate": 0.0004996175399614156, "loss": 5.872, "mean_token_accuracy": 0.14837601631879807, "num_tokens": 6531409.0, "step": 2860 }, { "entropy": 5.937231063842773, "epoch": 0.283214709371293, "grad_norm": 0.953125, "learning_rate": 0.0004996154804387972, "loss": 5.9121, "mean_token_accuracy": 0.15122439116239547, "num_tokens": 6543433.0, "step": 2865 }, { "entropy": 5.91095666885376, "epoch": 0.2837089758797944, "grad_norm": 1.140625, "learning_rate": 0.000499613415390603, "loss": 5.9883, "mean_token_accuracy": 0.14575250148773194, "num_tokens": 6554511.0, "step": 2870 }, { "entropy": 6.029332876205444, "epoch": 0.28420324238829575, "grad_norm": 1.1015625, "learning_rate": 0.000499611344816884, "loss": 5.9113, "mean_token_accuracy": 0.1500216841697693, "num_tokens": 6564591.0, "step": 2875 }, { "entropy": 5.943623399734497, "epoch": 0.2846975088967972, "grad_norm": 0.99609375, "learning_rate": 0.000499609268717691, "loss": 5.8826, "mean_token_accuracy": 0.15444658771157266, "num_tokens": 6575684.0, "step": 2880 }, { "entropy": 6.002884864807129, "epoch": 0.28519177540529855, "grad_norm": 1.0390625, "learning_rate": 0.0004996071870930753, "loss": 6.0142, "mean_token_accuracy": 0.1460142984986305, "num_tokens": 6588504.0, "step": 2885 }, { "entropy": 5.843828010559082, "epoch": 0.2856860419137999, "grad_norm": 1.015625, "learning_rate": 0.0004996050999430878, "loss": 5.8341, "mean_token_accuracy": 0.1514135092496872, "num_tokens": 6599969.0, "step": 2890 }, { "entropy": 5.977163600921631, "epoch": 0.2861803084223013, "grad_norm": 1.109375, "learning_rate": 0.0004996030072677802, "loss": 5.9088, "mean_token_accuracy": 0.15263523682951927, "num_tokens": 6611430.0, "step": 2895 }, { "entropy": 5.925257349014283, "epoch": 0.2866745749308027, "grad_norm": 1.203125, "learning_rate": 0.0004996009090672037, "loss": 5.8906, "mean_token_accuracy": 0.14462630748748778, "num_tokens": 6623247.0, "step": 2900 }, { "entropy": 5.96600112915039, "epoch": 0.28716884143930405, "grad_norm": 1.0546875, "learning_rate": 0.0004995988053414098, "loss": 6.0225, "mean_token_accuracy": 0.14478808343410493, "num_tokens": 6635508.0, "step": 2905 }, { "entropy": 5.954598236083984, "epoch": 0.2876631079478055, "grad_norm": 1.046875, "learning_rate": 0.0004995966960904506, "loss": 5.9278, "mean_token_accuracy": 0.14939955547451972, "num_tokens": 6646020.0, "step": 2910 }, { "entropy": 5.978266286849975, "epoch": 0.28815737445630685, "grad_norm": 1.0625, "learning_rate": 0.0004995945813143778, "loss": 5.9568, "mean_token_accuracy": 0.14021606743335724, "num_tokens": 6658194.0, "step": 2915 }, { "entropy": 5.96915636062622, "epoch": 0.2886516409648082, "grad_norm": 1.0078125, "learning_rate": 0.0004995924610132435, "loss": 5.9182, "mean_token_accuracy": 0.1475129932165146, "num_tokens": 6670582.0, "step": 2920 }, { "entropy": 5.928704261779785, "epoch": 0.2891459074733096, "grad_norm": 1.140625, "learning_rate": 0.0004995903351870998, "loss": 5.8759, "mean_token_accuracy": 0.14914150834083556, "num_tokens": 6680836.0, "step": 2925 }, { "entropy": 6.073338317871094, "epoch": 0.28964017398181097, "grad_norm": 1.1484375, "learning_rate": 0.000499588203835999, "loss": 5.9717, "mean_token_accuracy": 0.14328644201159477, "num_tokens": 6693045.0, "step": 2930 }, { "entropy": 5.933247041702271, "epoch": 0.2901344404903124, "grad_norm": 1.1875, "learning_rate": 0.0004995860669599935, "loss": 5.9092, "mean_token_accuracy": 0.14393445253372192, "num_tokens": 6704006.0, "step": 2935 }, { "entropy": 5.837153053283691, "epoch": 0.29062870699881377, "grad_norm": 0.96875, "learning_rate": 0.000499583924559136, "loss": 5.8793, "mean_token_accuracy": 0.14840964674949647, "num_tokens": 6717027.0, "step": 2940 }, { "entropy": 5.981049108505249, "epoch": 0.29112297350731514, "grad_norm": 1.0390625, "learning_rate": 0.000499581776633479, "loss": 5.8749, "mean_token_accuracy": 0.15013007670640946, "num_tokens": 6728107.0, "step": 2945 }, { "entropy": 5.88144817352295, "epoch": 0.2916172400158165, "grad_norm": 1.1796875, "learning_rate": 0.0004995796231830756, "loss": 5.8902, "mean_token_accuracy": 0.15416626930236815, "num_tokens": 6738628.0, "step": 2950 }, { "entropy": 5.934478712081909, "epoch": 0.2921115065243179, "grad_norm": 1.1015625, "learning_rate": 0.0004995774642079786, "loss": 5.8421, "mean_token_accuracy": 0.1537696972489357, "num_tokens": 6749416.0, "step": 2955 }, { "entropy": 5.905332374572754, "epoch": 0.2926057730328193, "grad_norm": 1.0625, "learning_rate": 0.000499575299708241, "loss": 5.947, "mean_token_accuracy": 0.14088274016976357, "num_tokens": 6761663.0, "step": 2960 }, { "entropy": 6.020952272415161, "epoch": 0.2931000395413207, "grad_norm": 0.99609375, "learning_rate": 0.0004995731296839163, "loss": 5.8909, "mean_token_accuracy": 0.1538805305957794, "num_tokens": 6773557.0, "step": 2965 }, { "entropy": 5.81088809967041, "epoch": 0.29359430604982206, "grad_norm": 1.15625, "learning_rate": 0.0004995709541350578, "loss": 5.8199, "mean_token_accuracy": 0.1593501538038254, "num_tokens": 6782832.0, "step": 2970 }, { "entropy": 5.9672423839569095, "epoch": 0.29408857255832344, "grad_norm": 1.109375, "learning_rate": 0.000499568773061719, "loss": 5.9335, "mean_token_accuracy": 0.14496245384216308, "num_tokens": 6795165.0, "step": 2975 }, { "entropy": 6.023906803131103, "epoch": 0.2945828390668248, "grad_norm": 1.0546875, "learning_rate": 0.0004995665864639534, "loss": 5.9486, "mean_token_accuracy": 0.1483907014131546, "num_tokens": 6807054.0, "step": 2980 }, { "entropy": 5.876065492630005, "epoch": 0.29507710557532624, "grad_norm": 1.1171875, "learning_rate": 0.0004995643943418149, "loss": 5.7332, "mean_token_accuracy": 0.15653893128037452, "num_tokens": 6817681.0, "step": 2985 }, { "entropy": 5.863463449478149, "epoch": 0.2955713720838276, "grad_norm": 1.03125, "learning_rate": 0.0004995621966953576, "loss": 5.9026, "mean_token_accuracy": 0.1518360435962677, "num_tokens": 6829387.0, "step": 2990 }, { "entropy": 5.936010360717773, "epoch": 0.296065638592329, "grad_norm": 0.93359375, "learning_rate": 0.0004995599935246355, "loss": 5.9071, "mean_token_accuracy": 0.1520347461104393, "num_tokens": 6842023.0, "step": 2995 }, { "entropy": 5.92348346710205, "epoch": 0.29655990510083036, "grad_norm": 1.0234375, "learning_rate": 0.0004995577848297026, "loss": 5.8992, "mean_token_accuracy": 0.1477331593632698, "num_tokens": 6853189.0, "step": 3000 }, { "epoch": 0.29655990510083036, "eval_entropy": 5.794283665472878, "eval_loss": 5.955329895019531, "eval_mean_token_accuracy": 0.15471349589865732, "eval_num_tokens": 6853189.0, "eval_runtime": 26.573, "eval_samples_per_second": 1223.537, "eval_steps_per_second": 152.975, "step": 3000 }, { "entropy": 5.963679313659668, "epoch": 0.29705417160933173, "grad_norm": 1.1640625, "learning_rate": 0.0004995555706106134, "loss": 5.9504, "mean_token_accuracy": 0.1432880811393261, "num_tokens": 6864338.0, "step": 3005 }, { "entropy": 5.9105650901794435, "epoch": 0.29754843811783316, "grad_norm": 1.15625, "learning_rate": 0.0004995533508674223, "loss": 5.8262, "mean_token_accuracy": 0.15388680547475814, "num_tokens": 6875409.0, "step": 3010 }, { "entropy": 5.927374696731567, "epoch": 0.29804270462633453, "grad_norm": 1.109375, "learning_rate": 0.0004995511256001839, "loss": 5.8561, "mean_token_accuracy": 0.14918482303619385, "num_tokens": 6885757.0, "step": 3015 }, { "entropy": 5.894947910308838, "epoch": 0.2985369711348359, "grad_norm": 1.125, "learning_rate": 0.000499548894808953, "loss": 5.9246, "mean_token_accuracy": 0.149386990070343, "num_tokens": 6896440.0, "step": 3020 }, { "entropy": 5.982046318054199, "epoch": 0.2990312376433373, "grad_norm": 1.0703125, "learning_rate": 0.0004995466584937846, "loss": 5.934, "mean_token_accuracy": 0.14567233771085739, "num_tokens": 6907319.0, "step": 3025 }, { "entropy": 5.953330326080322, "epoch": 0.29952550415183865, "grad_norm": 1.1171875, "learning_rate": 0.0004995444166547333, "loss": 5.8928, "mean_token_accuracy": 0.14992106705904007, "num_tokens": 6918683.0, "step": 3030 }, { "entropy": 5.879758739471436, "epoch": 0.3000197706603401, "grad_norm": 1.140625, "learning_rate": 0.0004995421692918547, "loss": 5.8745, "mean_token_accuracy": 0.15101571381092072, "num_tokens": 6929974.0, "step": 3035 }, { "entropy": 5.998798656463623, "epoch": 0.30051403716884145, "grad_norm": 1.078125, "learning_rate": 0.0004995399164052038, "loss": 5.8816, "mean_token_accuracy": 0.14776666909456254, "num_tokens": 6941213.0, "step": 3040 }, { "entropy": 6.010467910766602, "epoch": 0.3010083036773428, "grad_norm": 1.1015625, "learning_rate": 0.0004995376579948362, "loss": 5.9299, "mean_token_accuracy": 0.149107863008976, "num_tokens": 6952880.0, "step": 3045 }, { "entropy": 5.940840101242065, "epoch": 0.3015025701858442, "grad_norm": 1.0703125, "learning_rate": 0.0004995353940608074, "loss": 5.916, "mean_token_accuracy": 0.14906010404229164, "num_tokens": 6964344.0, "step": 3050 }, { "entropy": 5.867275619506836, "epoch": 0.30199683669434557, "grad_norm": 1.046875, "learning_rate": 0.000499533124603173, "loss": 5.8496, "mean_token_accuracy": 0.15172645151615144, "num_tokens": 6976042.0, "step": 3055 }, { "entropy": 5.927947092056274, "epoch": 0.302491103202847, "grad_norm": 1.046875, "learning_rate": 0.000499530849621989, "loss": 5.8254, "mean_token_accuracy": 0.1564239665865898, "num_tokens": 6988137.0, "step": 3060 }, { "entropy": 5.871209049224854, "epoch": 0.3029853697113484, "grad_norm": 1.09375, "learning_rate": 0.0004995285691173111, "loss": 5.8455, "mean_token_accuracy": 0.15776384100317956, "num_tokens": 6999858.0, "step": 3065 }, { "entropy": 5.956633234024048, "epoch": 0.30347963621984975, "grad_norm": 1.125, "learning_rate": 0.0004995262830891957, "loss": 5.9192, "mean_token_accuracy": 0.1524971157312393, "num_tokens": 7012756.0, "step": 3070 }, { "entropy": 5.922817134857178, "epoch": 0.3039739027283511, "grad_norm": 1.15625, "learning_rate": 0.0004995239915376988, "loss": 5.928, "mean_token_accuracy": 0.1458661213517189, "num_tokens": 7024769.0, "step": 3075 }, { "entropy": 5.925840139389038, "epoch": 0.3044681692368525, "grad_norm": 1.1796875, "learning_rate": 0.0004995216944628769, "loss": 5.9021, "mean_token_accuracy": 0.1427825465798378, "num_tokens": 7035422.0, "step": 3080 }, { "entropy": 5.907672977447509, "epoch": 0.3049624357453539, "grad_norm": 1.0859375, "learning_rate": 0.0004995193918647865, "loss": 5.8496, "mean_token_accuracy": 0.1537895068526268, "num_tokens": 7046923.0, "step": 3085 }, { "entropy": 6.0074094295501705, "epoch": 0.3054567022538553, "grad_norm": 0.99609375, "learning_rate": 0.0004995170837434844, "loss": 5.8896, "mean_token_accuracy": 0.1455712527036667, "num_tokens": 7058241.0, "step": 3090 }, { "entropy": 5.843660068511963, "epoch": 0.30595096876235667, "grad_norm": 1.1015625, "learning_rate": 0.0004995147700990269, "loss": 5.9194, "mean_token_accuracy": 0.15101224333047866, "num_tokens": 7070028.0, "step": 3095 }, { "entropy": 5.969692516326904, "epoch": 0.30644523527085804, "grad_norm": 1.1640625, "learning_rate": 0.0004995124509314714, "loss": 5.898, "mean_token_accuracy": 0.14975875839591027, "num_tokens": 7082641.0, "step": 3100 }, { "entropy": 5.934259939193725, "epoch": 0.3069395017793594, "grad_norm": 1.140625, "learning_rate": 0.0004995101262408748, "loss": 5.8971, "mean_token_accuracy": 0.14581625610589982, "num_tokens": 7094462.0, "step": 3105 }, { "entropy": 5.879360914230347, "epoch": 0.3074337682878608, "grad_norm": 1.1171875, "learning_rate": 0.0004995077960272943, "loss": 5.8656, "mean_token_accuracy": 0.15483699291944503, "num_tokens": 7106598.0, "step": 3110 }, { "entropy": 5.908220291137695, "epoch": 0.3079280347963622, "grad_norm": 1.1875, "learning_rate": 0.0004995054602907871, "loss": 5.7884, "mean_token_accuracy": 0.15013569295406343, "num_tokens": 7117006.0, "step": 3115 }, { "entropy": 5.8303180694580075, "epoch": 0.3084223013048636, "grad_norm": 1.2421875, "learning_rate": 0.0004995031190314107, "loss": 5.8671, "mean_token_accuracy": 0.15000214129686357, "num_tokens": 7128071.0, "step": 3120 }, { "entropy": 5.932742738723755, "epoch": 0.30891656781336496, "grad_norm": 1.140625, "learning_rate": 0.0004995007722492228, "loss": 5.89, "mean_token_accuracy": 0.1478637784719467, "num_tokens": 7139896.0, "step": 3125 }, { "entropy": 5.860946559906006, "epoch": 0.30941083432186633, "grad_norm": 1.0234375, "learning_rate": 0.0004994984199442811, "loss": 5.8406, "mean_token_accuracy": 0.1579609915614128, "num_tokens": 7151479.0, "step": 3130 }, { "entropy": 5.981082534790039, "epoch": 0.3099051008303677, "grad_norm": 1.1171875, "learning_rate": 0.0004994960621166434, "loss": 5.8752, "mean_token_accuracy": 0.1548340156674385, "num_tokens": 7162942.0, "step": 3135 }, { "entropy": 5.838286972045898, "epoch": 0.31039936733886914, "grad_norm": 1.140625, "learning_rate": 0.0004994936987663678, "loss": 5.8426, "mean_token_accuracy": 0.16279832720756532, "num_tokens": 7174572.0, "step": 3140 }, { "entropy": 5.894599485397339, "epoch": 0.3108936338473705, "grad_norm": 1.09375, "learning_rate": 0.0004994913298935124, "loss": 5.8984, "mean_token_accuracy": 0.14952836856245993, "num_tokens": 7186352.0, "step": 3145 }, { "entropy": 5.913238382339477, "epoch": 0.3113879003558719, "grad_norm": 1.0546875, "learning_rate": 0.0004994889554981353, "loss": 5.8677, "mean_token_accuracy": 0.1546166017651558, "num_tokens": 7197849.0, "step": 3150 }, { "entropy": 5.900243902206421, "epoch": 0.31188216686437326, "grad_norm": 1.1328125, "learning_rate": 0.0004994865755802953, "loss": 5.8454, "mean_token_accuracy": 0.14976087883114814, "num_tokens": 7207897.0, "step": 3155 }, { "entropy": 5.965626001358032, "epoch": 0.31237643337287463, "grad_norm": 1.078125, "learning_rate": 0.0004994841901400505, "loss": 5.9604, "mean_token_accuracy": 0.14765686094760894, "num_tokens": 7219148.0, "step": 3160 }, { "entropy": 6.065278720855713, "epoch": 0.31287069988137606, "grad_norm": 1.0546875, "learning_rate": 0.0004994817991774599, "loss": 6.0262, "mean_token_accuracy": 0.13792147636413574, "num_tokens": 7230690.0, "step": 3165 }, { "entropy": 6.003130722045898, "epoch": 0.31336496638987743, "grad_norm": 1.2421875, "learning_rate": 0.0004994794026925822, "loss": 5.8691, "mean_token_accuracy": 0.15180785357952117, "num_tokens": 7240935.0, "step": 3170 }, { "entropy": 5.883154249191284, "epoch": 0.3138592328983788, "grad_norm": 1.046875, "learning_rate": 0.0004994770006854763, "loss": 5.9264, "mean_token_accuracy": 0.15141893699765205, "num_tokens": 7253345.0, "step": 3175 }, { "entropy": 6.033541965484619, "epoch": 0.3143534994068802, "grad_norm": 1.140625, "learning_rate": 0.0004994745931562015, "loss": 5.9278, "mean_token_accuracy": 0.1564277797937393, "num_tokens": 7265355.0, "step": 3180 }, { "entropy": 5.799361228942871, "epoch": 0.31484776591538155, "grad_norm": 1.15625, "learning_rate": 0.0004994721801048168, "loss": 5.8203, "mean_token_accuracy": 0.15881146639585494, "num_tokens": 7277355.0, "step": 3185 }, { "entropy": 5.938270950317383, "epoch": 0.315342032423883, "grad_norm": 1.1484375, "learning_rate": 0.0004994697615313817, "loss": 5.884, "mean_token_accuracy": 0.15086214244365692, "num_tokens": 7288754.0, "step": 3190 }, { "entropy": 5.974021053314209, "epoch": 0.31583629893238435, "grad_norm": 1.1328125, "learning_rate": 0.0004994673374359556, "loss": 5.9535, "mean_token_accuracy": 0.14664196968078613, "num_tokens": 7301158.0, "step": 3195 }, { "entropy": 5.9225036144256595, "epoch": 0.3163305654408857, "grad_norm": 1.0625, "learning_rate": 0.0004994649078185982, "loss": 5.9181, "mean_token_accuracy": 0.14927734285593033, "num_tokens": 7314420.0, "step": 3200 }, { "entropy": 5.934207391738892, "epoch": 0.3168248319493871, "grad_norm": 1.6953125, "learning_rate": 0.0004994624726793693, "loss": 5.8647, "mean_token_accuracy": 0.15222589820623397, "num_tokens": 7325459.0, "step": 3205 }, { "entropy": 5.925555992126465, "epoch": 0.31731909845788847, "grad_norm": 1.171875, "learning_rate": 0.0004994600320183286, "loss": 5.8421, "mean_token_accuracy": 0.15424371659755706, "num_tokens": 7336016.0, "step": 3210 }, { "entropy": 5.891087865829467, "epoch": 0.3178133649663899, "grad_norm": 1.1640625, "learning_rate": 0.0004994575858355364, "loss": 5.8343, "mean_token_accuracy": 0.15168708860874175, "num_tokens": 7346716.0, "step": 3215 }, { "entropy": 5.9876645565032955, "epoch": 0.3183076314748913, "grad_norm": 1.328125, "learning_rate": 0.0004994551341310526, "loss": 5.9459, "mean_token_accuracy": 0.1490081638097763, "num_tokens": 7357246.0, "step": 3220 }, { "entropy": 5.9510910987854, "epoch": 0.31880189798339265, "grad_norm": 1.25, "learning_rate": 0.0004994526769049379, "loss": 5.9666, "mean_token_accuracy": 0.1405780427157879, "num_tokens": 7369173.0, "step": 3225 }, { "entropy": 5.986663293838501, "epoch": 0.319296164491894, "grad_norm": 1.265625, "learning_rate": 0.0004994502141572524, "loss": 5.9451, "mean_token_accuracy": 0.13844343274831772, "num_tokens": 7381118.0, "step": 3230 }, { "entropy": 5.9236208438873295, "epoch": 0.3197904310003954, "grad_norm": 1.0703125, "learning_rate": 0.0004994477458880568, "loss": 5.7938, "mean_token_accuracy": 0.15767068266868592, "num_tokens": 7391874.0, "step": 3235 }, { "entropy": 5.865980625152588, "epoch": 0.3202846975088968, "grad_norm": 1.265625, "learning_rate": 0.0004994452720974119, "loss": 5.8872, "mean_token_accuracy": 0.15512483119964598, "num_tokens": 7403474.0, "step": 3240 }, { "entropy": 5.942899942398071, "epoch": 0.3207789640173982, "grad_norm": 1.03125, "learning_rate": 0.0004994427927853785, "loss": 5.7869, "mean_token_accuracy": 0.15654317587614058, "num_tokens": 7415173.0, "step": 3245 }, { "entropy": 5.843418598175049, "epoch": 0.32127323052589957, "grad_norm": 1.125, "learning_rate": 0.0004994403079520175, "loss": 5.8195, "mean_token_accuracy": 0.15521105378866196, "num_tokens": 7426965.0, "step": 3250 }, { "entropy": 5.930048942565918, "epoch": 0.32176749703440094, "grad_norm": 1.1328125, "learning_rate": 0.0004994378175973902, "loss": 5.7899, "mean_token_accuracy": 0.15678596049547194, "num_tokens": 7438162.0, "step": 3255 }, { "entropy": 5.909450387954712, "epoch": 0.3222617635429023, "grad_norm": 1.1875, "learning_rate": 0.0004994353217215577, "loss": 5.8716, "mean_token_accuracy": 0.1480770692229271, "num_tokens": 7450241.0, "step": 3260 }, { "entropy": 5.9811969757080075, "epoch": 0.32275603005140374, "grad_norm": 1.171875, "learning_rate": 0.0004994328203245814, "loss": 5.9739, "mean_token_accuracy": 0.1421304538846016, "num_tokens": 7462236.0, "step": 3265 }, { "entropy": 5.981936073303222, "epoch": 0.3232502965599051, "grad_norm": 1.1484375, "learning_rate": 0.0004994303134065231, "loss": 5.8787, "mean_token_accuracy": 0.14774280935525894, "num_tokens": 7472811.0, "step": 3270 }, { "entropy": 5.823878812789917, "epoch": 0.3237445630684065, "grad_norm": 1.2109375, "learning_rate": 0.0004994278009674442, "loss": 5.7781, "mean_token_accuracy": 0.16131176203489303, "num_tokens": 7484837.0, "step": 3275 }, { "entropy": 5.996675300598144, "epoch": 0.32423882957690786, "grad_norm": 1.1328125, "learning_rate": 0.0004994252830074064, "loss": 5.8776, "mean_token_accuracy": 0.14760498106479644, "num_tokens": 7496712.0, "step": 3280 }, { "entropy": 5.824530220031738, "epoch": 0.32473309608540923, "grad_norm": 1.078125, "learning_rate": 0.000499422759526472, "loss": 5.8799, "mean_token_accuracy": 0.1516605421900749, "num_tokens": 7508014.0, "step": 3285 }, { "entropy": 5.916428327560425, "epoch": 0.32522736259391066, "grad_norm": 1.1953125, "learning_rate": 0.0004994202305247029, "loss": 5.9297, "mean_token_accuracy": 0.14520037919282913, "num_tokens": 7519466.0, "step": 3290 }, { "entropy": 6.085912036895752, "epoch": 0.32572162910241204, "grad_norm": 1.0703125, "learning_rate": 0.0004994176960021613, "loss": 5.9715, "mean_token_accuracy": 0.1455385245382786, "num_tokens": 7531661.0, "step": 3295 }, { "entropy": 5.927366018295288, "epoch": 0.3262158956109134, "grad_norm": 1.09375, "learning_rate": 0.0004994151559589095, "loss": 5.8879, "mean_token_accuracy": 0.14917458668351175, "num_tokens": 7544096.0, "step": 3300 }, { "entropy": 5.924072742462158, "epoch": 0.3267101621194148, "grad_norm": 1.328125, "learning_rate": 0.0004994126103950101, "loss": 5.863, "mean_token_accuracy": 0.14948750287294388, "num_tokens": 7556022.0, "step": 3305 }, { "entropy": 5.904584789276123, "epoch": 0.32720442862791616, "grad_norm": 1.2109375, "learning_rate": 0.0004994100593105257, "loss": 5.835, "mean_token_accuracy": 0.15778674483299254, "num_tokens": 7567399.0, "step": 3310 }, { "entropy": 5.845813608169555, "epoch": 0.3276986951364176, "grad_norm": 1.046875, "learning_rate": 0.0004994075027055189, "loss": 5.9029, "mean_token_accuracy": 0.150156831741333, "num_tokens": 7580673.0, "step": 3315 }, { "entropy": 5.995374393463135, "epoch": 0.32819296164491896, "grad_norm": 1.171875, "learning_rate": 0.0004994049405800529, "loss": 5.849, "mean_token_accuracy": 0.14884991571307182, "num_tokens": 7591799.0, "step": 3320 }, { "entropy": 5.906673097610474, "epoch": 0.32868722815342033, "grad_norm": 1.1484375, "learning_rate": 0.0004994023729341904, "loss": 5.8885, "mean_token_accuracy": 0.1490943245589733, "num_tokens": 7603663.0, "step": 3325 }, { "entropy": 5.905765390396118, "epoch": 0.3291814946619217, "grad_norm": 1.1015625, "learning_rate": 0.0004993997997679949, "loss": 5.8288, "mean_token_accuracy": 0.15654058754444122, "num_tokens": 7615651.0, "step": 3330 }, { "entropy": 5.823675203323364, "epoch": 0.3296757611704231, "grad_norm": 1.28125, "learning_rate": 0.0004993972210815292, "loss": 5.8597, "mean_token_accuracy": 0.15760498493909836, "num_tokens": 7628033.0, "step": 3335 }, { "entropy": 5.996159982681275, "epoch": 0.33017002767892445, "grad_norm": 1.09375, "learning_rate": 0.0004993946368748573, "loss": 5.9642, "mean_token_accuracy": 0.14904893189668655, "num_tokens": 7640227.0, "step": 3340 }, { "entropy": 5.973145627975464, "epoch": 0.3306642941874259, "grad_norm": 1.125, "learning_rate": 0.0004993920471480424, "loss": 5.8588, "mean_token_accuracy": 0.155265648663044, "num_tokens": 7651684.0, "step": 3345 }, { "entropy": 5.897155094146728, "epoch": 0.33115856069592725, "grad_norm": 1.546875, "learning_rate": 0.0004993894519011484, "loss": 5.8992, "mean_token_accuracy": 0.15093035399913787, "num_tokens": 7662721.0, "step": 3350 }, { "entropy": 5.908133935928345, "epoch": 0.3316528272044286, "grad_norm": 0.984375, "learning_rate": 0.0004993868511342391, "loss": 5.8487, "mean_token_accuracy": 0.15349284261465074, "num_tokens": 7674060.0, "step": 3355 }, { "entropy": 5.858733654022217, "epoch": 0.33214709371293, "grad_norm": 1.3046875, "learning_rate": 0.0004993842448473783, "loss": 5.8045, "mean_token_accuracy": 0.15487059578299522, "num_tokens": 7685054.0, "step": 3360 }, { "entropy": 5.886049079895019, "epoch": 0.33264136022143137, "grad_norm": 1.25, "learning_rate": 0.0004993816330406304, "loss": 5.9195, "mean_token_accuracy": 0.14408770725131034, "num_tokens": 7696554.0, "step": 3365 }, { "entropy": 6.02078652381897, "epoch": 0.3331356267299328, "grad_norm": 1.296875, "learning_rate": 0.0004993790157140595, "loss": 5.7918, "mean_token_accuracy": 0.15052541792392732, "num_tokens": 7707000.0, "step": 3370 }, { "entropy": 5.9085273265838625, "epoch": 0.33362989323843417, "grad_norm": 1.171875, "learning_rate": 0.0004993763928677299, "loss": 5.8716, "mean_token_accuracy": 0.15730493217706681, "num_tokens": 7718898.0, "step": 3375 }, { "entropy": 5.933470582962036, "epoch": 0.33412415974693555, "grad_norm": 1.171875, "learning_rate": 0.0004993737645017064, "loss": 5.9046, "mean_token_accuracy": 0.15121666342020035, "num_tokens": 7730493.0, "step": 3380 }, { "entropy": 5.896996593475341, "epoch": 0.3346184262554369, "grad_norm": 1.1875, "learning_rate": 0.0004993711306160534, "loss": 5.8152, "mean_token_accuracy": 0.15182201862335204, "num_tokens": 7742177.0, "step": 3385 }, { "entropy": 5.885739374160766, "epoch": 0.3351126927639383, "grad_norm": 1.203125, "learning_rate": 0.0004993684912108358, "loss": 5.8901, "mean_token_accuracy": 0.1533852696418762, "num_tokens": 7753386.0, "step": 3390 }, { "entropy": 5.854862308502197, "epoch": 0.3356069592724397, "grad_norm": 1.2421875, "learning_rate": 0.0004993658462861184, "loss": 5.7926, "mean_token_accuracy": 0.15316681638360025, "num_tokens": 7764259.0, "step": 3395 }, { "entropy": 5.915011262893676, "epoch": 0.3361012257809411, "grad_norm": 1.203125, "learning_rate": 0.0004993631958419666, "loss": 5.7892, "mean_token_accuracy": 0.15640075802803038, "num_tokens": 7775853.0, "step": 3400 }, { "entropy": 5.902416372299195, "epoch": 0.33659549228944247, "grad_norm": 1.1328125, "learning_rate": 0.0004993605398784451, "loss": 5.9146, "mean_token_accuracy": 0.139879260212183, "num_tokens": 7787116.0, "step": 3405 }, { "entropy": 5.956493091583252, "epoch": 0.33708975879794384, "grad_norm": 1.2421875, "learning_rate": 0.0004993578783956198, "loss": 5.9393, "mean_token_accuracy": 0.1419096127152443, "num_tokens": 7799666.0, "step": 3410 }, { "entropy": 5.90988245010376, "epoch": 0.3375840253064452, "grad_norm": 1.1640625, "learning_rate": 0.0004993552113935557, "loss": 5.8263, "mean_token_accuracy": 0.1583866521716118, "num_tokens": 7812454.0, "step": 3415 }, { "entropy": 5.916579532623291, "epoch": 0.33807829181494664, "grad_norm": 1.3515625, "learning_rate": 0.0004993525388723186, "loss": 5.8834, "mean_token_accuracy": 0.1530376985669136, "num_tokens": 7824427.0, "step": 3420 }, { "entropy": 5.901572895050049, "epoch": 0.338572558323448, "grad_norm": 1.2109375, "learning_rate": 0.0004993498608319742, "loss": 5.8844, "mean_token_accuracy": 0.15276393666863441, "num_tokens": 7835382.0, "step": 3425 }, { "entropy": 5.859151458740234, "epoch": 0.3390668248319494, "grad_norm": 1.328125, "learning_rate": 0.0004993471772725886, "loss": 5.7989, "mean_token_accuracy": 0.15550214797258377, "num_tokens": 7846618.0, "step": 3430 }, { "entropy": 5.901988458633423, "epoch": 0.33956109134045076, "grad_norm": 1.1640625, "learning_rate": 0.0004993444881942274, "loss": 5.8146, "mean_token_accuracy": 0.15682211965322496, "num_tokens": 7859160.0, "step": 3435 }, { "entropy": 5.8803332328796385, "epoch": 0.34005535784895213, "grad_norm": 1.0390625, "learning_rate": 0.0004993417935969572, "loss": 5.8434, "mean_token_accuracy": 0.15452905595302582, "num_tokens": 7870628.0, "step": 3440 }, { "entropy": 5.94140362739563, "epoch": 0.34054962435745356, "grad_norm": 1.109375, "learning_rate": 0.000499339093480844, "loss": 5.8743, "mean_token_accuracy": 0.1545655608177185, "num_tokens": 7883016.0, "step": 3445 }, { "entropy": 5.867698383331299, "epoch": 0.34104389086595494, "grad_norm": 1.2421875, "learning_rate": 0.0004993363878459542, "loss": 5.8751, "mean_token_accuracy": 0.14724137187004088, "num_tokens": 7895940.0, "step": 3450 }, { "entropy": 5.9430724620819095, "epoch": 0.3415381573744563, "grad_norm": 1.2265625, "learning_rate": 0.0004993336766923546, "loss": 5.9059, "mean_token_accuracy": 0.14910922944545746, "num_tokens": 7907920.0, "step": 3455 }, { "entropy": 5.952860927581787, "epoch": 0.3420324238829577, "grad_norm": 1.375, "learning_rate": 0.0004993309600201117, "loss": 5.889, "mean_token_accuracy": 0.15425898805260657, "num_tokens": 7920181.0, "step": 3460 }, { "entropy": 5.888333415985107, "epoch": 0.34252669039145905, "grad_norm": 1.3515625, "learning_rate": 0.0004993282378292923, "loss": 5.8396, "mean_token_accuracy": 0.1592525601387024, "num_tokens": 7931135.0, "step": 3465 }, { "entropy": 5.885323476791382, "epoch": 0.3430209568999605, "grad_norm": 1.2578125, "learning_rate": 0.0004993255101199635, "loss": 5.8211, "mean_token_accuracy": 0.15970962271094322, "num_tokens": 7941002.0, "step": 3470 }, { "entropy": 5.942181777954102, "epoch": 0.34351522340846186, "grad_norm": 1.4609375, "learning_rate": 0.0004993227768921924, "loss": 5.792, "mean_token_accuracy": 0.1554045557975769, "num_tokens": 7950393.0, "step": 3475 }, { "entropy": 5.9116617202758786, "epoch": 0.34400948991696323, "grad_norm": 1.1171875, "learning_rate": 0.0004993200381460461, "loss": 5.8258, "mean_token_accuracy": 0.15245998203754424, "num_tokens": 7961468.0, "step": 3480 }, { "entropy": 5.817622375488281, "epoch": 0.3445037564254646, "grad_norm": 1.09375, "learning_rate": 0.0004993172938815922, "loss": 5.6706, "mean_token_accuracy": 0.1642368882894516, "num_tokens": 7973783.0, "step": 3485 }, { "entropy": 5.789644384384156, "epoch": 0.344998022933966, "grad_norm": 1.421875, "learning_rate": 0.0004993145440988979, "loss": 5.7316, "mean_token_accuracy": 0.16548056602478028, "num_tokens": 7984099.0, "step": 3490 }, { "entropy": 5.954108858108521, "epoch": 0.3454922894424674, "grad_norm": 1.0859375, "learning_rate": 0.0004993117887980311, "loss": 5.8921, "mean_token_accuracy": 0.15117180049419404, "num_tokens": 7995115.0, "step": 3495 }, { "entropy": 5.920248556137085, "epoch": 0.3459865559509688, "grad_norm": 1.2109375, "learning_rate": 0.0004993090279790596, "loss": 5.8406, "mean_token_accuracy": 0.15169650912284852, "num_tokens": 8006103.0, "step": 3500 }, { "entropy": 5.7916463851928714, "epoch": 0.34648082245947015, "grad_norm": 1.2265625, "learning_rate": 0.000499306261642051, "loss": 5.8067, "mean_token_accuracy": 0.14806041717529297, "num_tokens": 8018228.0, "step": 3505 }, { "entropy": 5.884153890609741, "epoch": 0.3469750889679715, "grad_norm": 1.2109375, "learning_rate": 0.0004993034897870737, "loss": 5.7563, "mean_token_accuracy": 0.15497301369905472, "num_tokens": 8029808.0, "step": 3510 }, { "entropy": 5.843921661376953, "epoch": 0.3474693554764729, "grad_norm": 1.140625, "learning_rate": 0.0004993007124141958, "loss": 5.8536, "mean_token_accuracy": 0.14964404553174973, "num_tokens": 8041136.0, "step": 3515 }, { "entropy": 5.920845794677734, "epoch": 0.3479636219849743, "grad_norm": 1.25, "learning_rate": 0.0004992979295234854, "loss": 5.9013, "mean_token_accuracy": 0.14759098887443542, "num_tokens": 8053013.0, "step": 3520 }, { "entropy": 5.940861701965332, "epoch": 0.3484578884934757, "grad_norm": 1.046875, "learning_rate": 0.0004992951411150112, "loss": 5.8713, "mean_token_accuracy": 0.14649871438741685, "num_tokens": 8065139.0, "step": 3525 }, { "entropy": 5.860837078094482, "epoch": 0.34895215500197707, "grad_norm": 1.2890625, "learning_rate": 0.0004992923471888418, "loss": 5.7316, "mean_token_accuracy": 0.16246522814035416, "num_tokens": 8075719.0, "step": 3530 }, { "entropy": 5.876574087142944, "epoch": 0.34944642151047844, "grad_norm": 1.1953125, "learning_rate": 0.0004992895477450459, "loss": 5.8621, "mean_token_accuracy": 0.15280634313821792, "num_tokens": 8087821.0, "step": 3535 }, { "entropy": 5.838806915283203, "epoch": 0.3499406880189798, "grad_norm": 1.2265625, "learning_rate": 0.0004992867427836923, "loss": 5.755, "mean_token_accuracy": 0.15870047360658646, "num_tokens": 8099861.0, "step": 3540 }, { "entropy": 6.010531711578369, "epoch": 0.3504349545274812, "grad_norm": 1.1875, "learning_rate": 0.0004992839323048501, "loss": 5.9882, "mean_token_accuracy": 0.14447013214230536, "num_tokens": 8111671.0, "step": 3545 }, { "entropy": 6.0363317966461185, "epoch": 0.3509292210359826, "grad_norm": 1.1875, "learning_rate": 0.0004992811163085882, "loss": 5.9404, "mean_token_accuracy": 0.150308321416378, "num_tokens": 8123569.0, "step": 3550 }, { "entropy": 5.9858965396881105, "epoch": 0.351423487544484, "grad_norm": 1.1796875, "learning_rate": 0.0004992782947949761, "loss": 5.9541, "mean_token_accuracy": 0.15137761533260347, "num_tokens": 8135621.0, "step": 3555 }, { "entropy": 5.8561443328857425, "epoch": 0.35191775405298537, "grad_norm": 1.25, "learning_rate": 0.0004992754677640831, "loss": 5.7978, "mean_token_accuracy": 0.15685692727565764, "num_tokens": 8147012.0, "step": 3560 }, { "entropy": 5.908249092102051, "epoch": 0.35241202056148674, "grad_norm": 1.1953125, "learning_rate": 0.0004992726352159789, "loss": 5.7851, "mean_token_accuracy": 0.15655775964260102, "num_tokens": 8158686.0, "step": 3565 }, { "entropy": 5.85140061378479, "epoch": 0.3529062870699881, "grad_norm": 1.203125, "learning_rate": 0.0004992697971507331, "loss": 5.7901, "mean_token_accuracy": 0.15729555934667588, "num_tokens": 8170188.0, "step": 3570 }, { "entropy": 5.890997982025146, "epoch": 0.35340055357848954, "grad_norm": 1.0546875, "learning_rate": 0.0004992669535684155, "loss": 5.8717, "mean_token_accuracy": 0.15248715728521348, "num_tokens": 8182467.0, "step": 3575 }, { "entropy": 5.957807207107544, "epoch": 0.3538948200869909, "grad_norm": 1.1015625, "learning_rate": 0.0004992641044690959, "loss": 5.9638, "mean_token_accuracy": 0.15112252160906792, "num_tokens": 8193433.0, "step": 3580 }, { "entropy": 5.893219804763794, "epoch": 0.3543890865954923, "grad_norm": 1.109375, "learning_rate": 0.0004992612498528447, "loss": 5.7478, "mean_token_accuracy": 0.1555414766073227, "num_tokens": 8204220.0, "step": 3585 }, { "entropy": 5.810119009017944, "epoch": 0.35488335310399366, "grad_norm": 1.3046875, "learning_rate": 0.0004992583897197319, "loss": 5.7642, "mean_token_accuracy": 0.16225289255380632, "num_tokens": 8214203.0, "step": 3590 }, { "entropy": 5.9189142227172855, "epoch": 0.35537761961249503, "grad_norm": 1.3046875, "learning_rate": 0.0004992555240698279, "loss": 5.9038, "mean_token_accuracy": 0.14603765159845353, "num_tokens": 8225143.0, "step": 3595 }, { "entropy": 5.91175103187561, "epoch": 0.35587188612099646, "grad_norm": 1.40625, "learning_rate": 0.0004992526529032032, "loss": 5.7585, "mean_token_accuracy": 0.15905050486326217, "num_tokens": 8237715.0, "step": 3600 }, { "entropy": 5.805362415313721, "epoch": 0.35636615262949783, "grad_norm": 1.0078125, "learning_rate": 0.0004992497762199285, "loss": 5.8196, "mean_token_accuracy": 0.15873343497514725, "num_tokens": 8249645.0, "step": 3605 }, { "entropy": 5.945392084121704, "epoch": 0.3568604191379992, "grad_norm": 1.1875, "learning_rate": 0.0004992468940200745, "loss": 5.7897, "mean_token_accuracy": 0.1611865848302841, "num_tokens": 8260624.0, "step": 3610 }, { "entropy": 5.910581159591675, "epoch": 0.3573546856465006, "grad_norm": 1.140625, "learning_rate": 0.0004992440063037121, "loss": 5.8894, "mean_token_accuracy": 0.1492436170578003, "num_tokens": 8272526.0, "step": 3615 }, { "entropy": 5.777053737640381, "epoch": 0.35784895215500195, "grad_norm": 1.1953125, "learning_rate": 0.0004992411130709124, "loss": 5.7908, "mean_token_accuracy": 0.15661219209432603, "num_tokens": 8284270.0, "step": 3620 }, { "entropy": 5.969174575805664, "epoch": 0.3583432186635034, "grad_norm": 1.0546875, "learning_rate": 0.0004992382143217466, "loss": 5.9021, "mean_token_accuracy": 0.15277914106845855, "num_tokens": 8296407.0, "step": 3625 }, { "entropy": 5.841032934188843, "epoch": 0.35883748517200476, "grad_norm": 1.0859375, "learning_rate": 0.0004992353100562858, "loss": 5.805, "mean_token_accuracy": 0.16218566447496413, "num_tokens": 8307695.0, "step": 3630 }, { "entropy": 5.794250535964966, "epoch": 0.35933175168050613, "grad_norm": 1.1171875, "learning_rate": 0.0004992324002746016, "loss": 5.7942, "mean_token_accuracy": 0.15522915124893188, "num_tokens": 8319458.0, "step": 3635 }, { "entropy": 5.872878932952881, "epoch": 0.3598260181890075, "grad_norm": 1.0859375, "learning_rate": 0.0004992294849767656, "loss": 5.7111, "mean_token_accuracy": 0.16143833845853806, "num_tokens": 8330284.0, "step": 3640 }, { "entropy": 5.853314065933228, "epoch": 0.3603202846975089, "grad_norm": 1.171875, "learning_rate": 0.0004992265641628495, "loss": 5.827, "mean_token_accuracy": 0.15445810109376906, "num_tokens": 8343622.0, "step": 3645 }, { "entropy": 5.894721937179566, "epoch": 0.3608145512060103, "grad_norm": 1.1171875, "learning_rate": 0.0004992236378329252, "loss": 5.7864, "mean_token_accuracy": 0.1555868223309517, "num_tokens": 8354079.0, "step": 3650 }, { "entropy": 5.8952436447143555, "epoch": 0.3613088177145117, "grad_norm": 1.2109375, "learning_rate": 0.0004992207059870645, "loss": 5.83, "mean_token_accuracy": 0.15822544246912001, "num_tokens": 8364876.0, "step": 3655 }, { "entropy": 5.934147882461548, "epoch": 0.36180308422301305, "grad_norm": 1.2421875, "learning_rate": 0.0004992177686253396, "loss": 5.7813, "mean_token_accuracy": 0.15549880415201187, "num_tokens": 8375095.0, "step": 3660 }, { "entropy": 5.7936859130859375, "epoch": 0.3622973507315144, "grad_norm": 1.15625, "learning_rate": 0.000499214825747823, "loss": 5.7544, "mean_token_accuracy": 0.15899945050477982, "num_tokens": 8385934.0, "step": 3665 }, { "entropy": 5.8251642227172855, "epoch": 0.3627916172400158, "grad_norm": 1.171875, "learning_rate": 0.0004992118773545868, "loss": 5.7247, "mean_token_accuracy": 0.1615453451871872, "num_tokens": 8397018.0, "step": 3670 }, { "entropy": 5.841867876052857, "epoch": 0.3632858837485172, "grad_norm": 1.2578125, "learning_rate": 0.0004992089234457036, "loss": 5.7961, "mean_token_accuracy": 0.1640404224395752, "num_tokens": 8406668.0, "step": 3675 }, { "entropy": 5.953409671783447, "epoch": 0.3637801502570186, "grad_norm": 1.1796875, "learning_rate": 0.0004992059640212461, "loss": 5.8298, "mean_token_accuracy": 0.15458669289946556, "num_tokens": 8417471.0, "step": 3680 }, { "entropy": 5.856666088104248, "epoch": 0.36427441676551997, "grad_norm": 1.1953125, "learning_rate": 0.0004992029990812872, "loss": 5.9011, "mean_token_accuracy": 0.14456111043691636, "num_tokens": 8430073.0, "step": 3685 }, { "entropy": 5.893247652053833, "epoch": 0.36476868327402134, "grad_norm": 1.09375, "learning_rate": 0.0004992000286258997, "loss": 5.8086, "mean_token_accuracy": 0.15492908284068108, "num_tokens": 8442573.0, "step": 3690 }, { "entropy": 5.940594816207886, "epoch": 0.3652629497825227, "grad_norm": 1.1484375, "learning_rate": 0.0004991970526551567, "loss": 5.8576, "mean_token_accuracy": 0.15471384078264236, "num_tokens": 8453920.0, "step": 3695 }, { "entropy": 5.851522207260132, "epoch": 0.36575721629102415, "grad_norm": 1.125, "learning_rate": 0.0004991940711691314, "loss": 5.8945, "mean_token_accuracy": 0.15315308719873427, "num_tokens": 8466652.0, "step": 3700 }, { "entropy": 5.93485655784607, "epoch": 0.3662514827995255, "grad_norm": 1.1484375, "learning_rate": 0.0004991910841678972, "loss": 5.9105, "mean_token_accuracy": 0.14977106899023057, "num_tokens": 8480203.0, "step": 3705 }, { "entropy": 5.864224863052368, "epoch": 0.3667457493080269, "grad_norm": 1.15625, "learning_rate": 0.0004991880916515275, "loss": 5.8174, "mean_token_accuracy": 0.15368005335330964, "num_tokens": 8491396.0, "step": 3710 }, { "entropy": 5.918771553039551, "epoch": 0.36724001581652826, "grad_norm": 1.15625, "learning_rate": 0.000499185093620096, "loss": 5.7838, "mean_token_accuracy": 0.15006800889968872, "num_tokens": 8501838.0, "step": 3715 }, { "entropy": 5.798188638687134, "epoch": 0.36773428232502964, "grad_norm": 1.3828125, "learning_rate": 0.0004991820900736765, "loss": 5.6723, "mean_token_accuracy": 0.1582162246108055, "num_tokens": 8512113.0, "step": 3720 }, { "entropy": 5.831536865234375, "epoch": 0.36822854883353107, "grad_norm": 1.171875, "learning_rate": 0.0004991790810123427, "loss": 5.7507, "mean_token_accuracy": 0.15408645272254945, "num_tokens": 8523888.0, "step": 3725 }, { "entropy": 5.79871392250061, "epoch": 0.36872281534203244, "grad_norm": 1.3203125, "learning_rate": 0.0004991760664361688, "loss": 5.6859, "mean_token_accuracy": 0.1632385030388832, "num_tokens": 8536078.0, "step": 3730 }, { "entropy": 5.837257719039917, "epoch": 0.3692170818505338, "grad_norm": 1.1796875, "learning_rate": 0.0004991730463452288, "loss": 5.8265, "mean_token_accuracy": 0.15056723803281785, "num_tokens": 8547131.0, "step": 3735 }, { "entropy": 5.847607707977295, "epoch": 0.3697113483590352, "grad_norm": 1.1484375, "learning_rate": 0.0004991700207395971, "loss": 5.6923, "mean_token_accuracy": 0.16566429436206817, "num_tokens": 8557269.0, "step": 3740 }, { "entropy": 5.921040964126587, "epoch": 0.37020561486753656, "grad_norm": 1.2109375, "learning_rate": 0.0004991669896193482, "loss": 5.8815, "mean_token_accuracy": 0.146759133040905, "num_tokens": 8569193.0, "step": 3745 }, { "entropy": 5.870231437683105, "epoch": 0.370699881376038, "grad_norm": 1.09375, "learning_rate": 0.0004991639529845565, "loss": 5.7533, "mean_token_accuracy": 0.15931029468774796, "num_tokens": 8580888.0, "step": 3750 }, { "entropy": 5.840953636169433, "epoch": 0.37119414788453936, "grad_norm": 1.1953125, "learning_rate": 0.0004991609108352968, "loss": 5.836, "mean_token_accuracy": 0.1561110332608223, "num_tokens": 8591868.0, "step": 3755 }, { "entropy": 5.83723406791687, "epoch": 0.37168841439304073, "grad_norm": 1.21875, "learning_rate": 0.0004991578631716438, "loss": 5.7962, "mean_token_accuracy": 0.15383539870381355, "num_tokens": 8602338.0, "step": 3760 }, { "entropy": 5.8507262706756595, "epoch": 0.3721826809015421, "grad_norm": 1.1953125, "learning_rate": 0.0004991548099936727, "loss": 5.7276, "mean_token_accuracy": 0.15699041187763213, "num_tokens": 8611698.0, "step": 3765 }, { "entropy": 5.836185693740845, "epoch": 0.3726769474100435, "grad_norm": 1.203125, "learning_rate": 0.0004991517513014585, "loss": 5.7327, "mean_token_accuracy": 0.1610111728310585, "num_tokens": 8623537.0, "step": 3770 }, { "entropy": 5.787095975875855, "epoch": 0.37317121391854485, "grad_norm": 1.3203125, "learning_rate": 0.0004991486870950765, "loss": 5.7996, "mean_token_accuracy": 0.1559009499847889, "num_tokens": 8634678.0, "step": 3775 }, { "entropy": 5.864709520339966, "epoch": 0.3736654804270463, "grad_norm": 1.2734375, "learning_rate": 0.0004991456173746021, "loss": 5.7777, "mean_token_accuracy": 0.16089840829372407, "num_tokens": 8646207.0, "step": 3780 }, { "entropy": 5.955631351470947, "epoch": 0.37415974693554765, "grad_norm": 1.15625, "learning_rate": 0.0004991425421401105, "loss": 5.839, "mean_token_accuracy": 0.15324022620916367, "num_tokens": 8657069.0, "step": 3785 }, { "entropy": 5.766555738449097, "epoch": 0.374654013444049, "grad_norm": 1.171875, "learning_rate": 0.0004991394613916777, "loss": 5.6965, "mean_token_accuracy": 0.16205490231513978, "num_tokens": 8668296.0, "step": 3790 }, { "entropy": 5.816662788391113, "epoch": 0.3751482799525504, "grad_norm": 1.2265625, "learning_rate": 0.0004991363751293795, "loss": 5.8514, "mean_token_accuracy": 0.15196674913167954, "num_tokens": 8680626.0, "step": 3795 }, { "entropy": 5.868446969985962, "epoch": 0.3756425464610518, "grad_norm": 1.140625, "learning_rate": 0.0004991332833532915, "loss": 5.7609, "mean_token_accuracy": 0.16015817373991012, "num_tokens": 8691571.0, "step": 3800 }, { "entropy": 5.863410568237304, "epoch": 0.3761368129695532, "grad_norm": 1.140625, "learning_rate": 0.00049913018606349, "loss": 5.814, "mean_token_accuracy": 0.16047453731298447, "num_tokens": 8703262.0, "step": 3805 }, { "entropy": 5.922005653381348, "epoch": 0.3766310794780546, "grad_norm": 1.1484375, "learning_rate": 0.0004991270832600512, "loss": 5.9128, "mean_token_accuracy": 0.1440843015909195, "num_tokens": 8714799.0, "step": 3810 }, { "entropy": 5.948727369308472, "epoch": 0.37712534598655595, "grad_norm": 1.2578125, "learning_rate": 0.0004991239749430514, "loss": 5.8848, "mean_token_accuracy": 0.14975858181715013, "num_tokens": 8726417.0, "step": 3815 }, { "entropy": 5.77113709449768, "epoch": 0.3776196124950573, "grad_norm": 1.2109375, "learning_rate": 0.000499120861112567, "loss": 5.7504, "mean_token_accuracy": 0.16276681572198867, "num_tokens": 8738572.0, "step": 3820 }, { "entropy": 5.987140226364136, "epoch": 0.3781138790035587, "grad_norm": 1.1640625, "learning_rate": 0.0004991177417686747, "loss": 5.9179, "mean_token_accuracy": 0.1479107543826103, "num_tokens": 8750557.0, "step": 3825 }, { "entropy": 5.889439392089844, "epoch": 0.3786081455120601, "grad_norm": 1.296875, "learning_rate": 0.0004991146169114511, "loss": 5.7055, "mean_token_accuracy": 0.1570228233933449, "num_tokens": 8761921.0, "step": 3830 }, { "entropy": 5.750439548492432, "epoch": 0.3791024120205615, "grad_norm": 1.2421875, "learning_rate": 0.0004991114865409732, "loss": 5.7991, "mean_token_accuracy": 0.15767900198698043, "num_tokens": 8772705.0, "step": 3835 }, { "entropy": 5.842856407165527, "epoch": 0.37959667852906287, "grad_norm": 1.1953125, "learning_rate": 0.000499108350657318, "loss": 5.8153, "mean_token_accuracy": 0.1552213490009308, "num_tokens": 8783563.0, "step": 3840 }, { "entropy": 5.858430480957031, "epoch": 0.38009094503756424, "grad_norm": 1.25, "learning_rate": 0.0004991052092605627, "loss": 5.7152, "mean_token_accuracy": 0.16301678866147995, "num_tokens": 8794171.0, "step": 3845 }, { "entropy": 5.80806884765625, "epoch": 0.3805852115460656, "grad_norm": 1.4296875, "learning_rate": 0.0004991020623507842, "loss": 5.8158, "mean_token_accuracy": 0.1521042175590992, "num_tokens": 8806487.0, "step": 3850 }, { "entropy": 5.895160150527954, "epoch": 0.38107947805456704, "grad_norm": 1.1171875, "learning_rate": 0.0004990989099280604, "loss": 5.8211, "mean_token_accuracy": 0.1585649460554123, "num_tokens": 8817819.0, "step": 3855 }, { "entropy": 5.874980354309082, "epoch": 0.3815737445630684, "grad_norm": 1.2109375, "learning_rate": 0.0004990957519924686, "loss": 5.764, "mean_token_accuracy": 0.15150784254074096, "num_tokens": 8828485.0, "step": 3860 }, { "entropy": 5.821585559844971, "epoch": 0.3820680110715698, "grad_norm": 1.1875, "learning_rate": 0.0004990925885440865, "loss": 5.8205, "mean_token_accuracy": 0.15444822385907173, "num_tokens": 8840179.0, "step": 3865 }, { "entropy": 5.953197860717774, "epoch": 0.38256227758007116, "grad_norm": 1.234375, "learning_rate": 0.0004990894195829921, "loss": 5.8494, "mean_token_accuracy": 0.1579738438129425, "num_tokens": 8851813.0, "step": 3870 }, { "entropy": 5.844118452072143, "epoch": 0.38305654408857254, "grad_norm": 1.203125, "learning_rate": 0.0004990862451092631, "loss": 5.7774, "mean_token_accuracy": 0.15051404684782027, "num_tokens": 8863072.0, "step": 3875 }, { "entropy": 5.880052471160889, "epoch": 0.38355081059707397, "grad_norm": 1.2265625, "learning_rate": 0.0004990830651229776, "loss": 5.7813, "mean_token_accuracy": 0.15792119652032852, "num_tokens": 8873510.0, "step": 3880 }, { "entropy": 5.8031305313110355, "epoch": 0.38404507710557534, "grad_norm": 1.2265625, "learning_rate": 0.0004990798796242142, "loss": 5.7356, "mean_token_accuracy": 0.15857678204774855, "num_tokens": 8884296.0, "step": 3885 }, { "entropy": 5.851049709320068, "epoch": 0.3845393436140767, "grad_norm": 1.3671875, "learning_rate": 0.0004990766886130508, "loss": 5.7761, "mean_token_accuracy": 0.16058651506900787, "num_tokens": 8894208.0, "step": 3890 }, { "entropy": 5.988053703308106, "epoch": 0.3850336101225781, "grad_norm": 1.5703125, "learning_rate": 0.0004990734920895662, "loss": 5.9627, "mean_token_accuracy": 0.14808114171028136, "num_tokens": 8905703.0, "step": 3895 }, { "entropy": 5.8592668056488035, "epoch": 0.38552787663107946, "grad_norm": 1.2421875, "learning_rate": 0.0004990702900538388, "loss": 5.7484, "mean_token_accuracy": 0.15851551443338394, "num_tokens": 8918077.0, "step": 3900 }, { "entropy": 5.788652181625366, "epoch": 0.3860221431395809, "grad_norm": 1.125, "learning_rate": 0.0004990670825059477, "loss": 5.7267, "mean_token_accuracy": 0.15688996613025666, "num_tokens": 8930240.0, "step": 3905 }, { "entropy": 5.900861597061157, "epoch": 0.38651640964808226, "grad_norm": 1.3046875, "learning_rate": 0.0004990638694459715, "loss": 5.7986, "mean_token_accuracy": 0.15847810059785844, "num_tokens": 8941421.0, "step": 3910 }, { "entropy": 5.872343826293945, "epoch": 0.38701067615658363, "grad_norm": 1.203125, "learning_rate": 0.0004990606508739893, "loss": 5.8115, "mean_token_accuracy": 0.15537682622671128, "num_tokens": 8952296.0, "step": 3915 }, { "entropy": 5.869143915176392, "epoch": 0.387504942665085, "grad_norm": 1.15625, "learning_rate": 0.0004990574267900804, "loss": 5.8186, "mean_token_accuracy": 0.15669666230678558, "num_tokens": 8963167.0, "step": 3920 }, { "entropy": 5.86326756477356, "epoch": 0.3879992091735864, "grad_norm": 1.1953125, "learning_rate": 0.0004990541971943241, "loss": 5.787, "mean_token_accuracy": 0.15738223493099213, "num_tokens": 8974405.0, "step": 3925 }, { "entropy": 5.871088266372681, "epoch": 0.3884934756820878, "grad_norm": 1.15625, "learning_rate": 0.0004990509620867997, "loss": 5.7112, "mean_token_accuracy": 0.16412873268127443, "num_tokens": 8986012.0, "step": 3930 }, { "entropy": 5.720556116104126, "epoch": 0.3889877421905892, "grad_norm": 1.171875, "learning_rate": 0.0004990477214675868, "loss": 5.694, "mean_token_accuracy": 0.16026492416858673, "num_tokens": 8996759.0, "step": 3935 }, { "entropy": 5.849727296829224, "epoch": 0.38948200869909055, "grad_norm": 1.1484375, "learning_rate": 0.0004990444753367653, "loss": 5.829, "mean_token_accuracy": 0.15216880887746811, "num_tokens": 9007215.0, "step": 3940 }, { "entropy": 5.791629219055176, "epoch": 0.3899762752075919, "grad_norm": 1.1015625, "learning_rate": 0.0004990412236944149, "loss": 5.7292, "mean_token_accuracy": 0.17175416946411132, "num_tokens": 9018281.0, "step": 3945 }, { "entropy": 5.912288618087769, "epoch": 0.3904705417160933, "grad_norm": 1.0625, "learning_rate": 0.0004990379665406157, "loss": 5.8764, "mean_token_accuracy": 0.15223623141646386, "num_tokens": 9029312.0, "step": 3950 }, { "entropy": 5.94501895904541, "epoch": 0.39096480822459473, "grad_norm": 1.15625, "learning_rate": 0.0004990347038754477, "loss": 5.8566, "mean_token_accuracy": 0.14973756968975066, "num_tokens": 9040273.0, "step": 3955 }, { "entropy": 5.866108179092407, "epoch": 0.3914590747330961, "grad_norm": 0.9765625, "learning_rate": 0.0004990314356989912, "loss": 5.7922, "mean_token_accuracy": 0.15092711076140403, "num_tokens": 9052571.0, "step": 3960 }, { "entropy": 5.806940126419067, "epoch": 0.3919533412415975, "grad_norm": 1.5, "learning_rate": 0.0004990281620113268, "loss": 5.7422, "mean_token_accuracy": 0.15850640684366227, "num_tokens": 9063531.0, "step": 3965 }, { "entropy": 5.925866508483887, "epoch": 0.39244760775009885, "grad_norm": 1.265625, "learning_rate": 0.0004990248828125347, "loss": 5.7836, "mean_token_accuracy": 0.15395828783512117, "num_tokens": 9075404.0, "step": 3970 }, { "entropy": 5.757915782928467, "epoch": 0.3929418742586002, "grad_norm": 1.171875, "learning_rate": 0.0004990215981026958, "loss": 5.8031, "mean_token_accuracy": 0.15948758646845818, "num_tokens": 9086570.0, "step": 3975 }, { "entropy": 5.876324081420899, "epoch": 0.3934361407671016, "grad_norm": 1.078125, "learning_rate": 0.0004990183078818908, "loss": 5.6828, "mean_token_accuracy": 0.1598816230893135, "num_tokens": 9097993.0, "step": 3980 }, { "entropy": 5.838431692123413, "epoch": 0.393930407275603, "grad_norm": 1.2109375, "learning_rate": 0.0004990150121502007, "loss": 5.7628, "mean_token_accuracy": 0.16408235877752303, "num_tokens": 9108783.0, "step": 3985 }, { "entropy": 5.788733673095703, "epoch": 0.3944246737841044, "grad_norm": 1.328125, "learning_rate": 0.0004990117109077066, "loss": 5.8128, "mean_token_accuracy": 0.15555327832698823, "num_tokens": 9120039.0, "step": 3990 }, { "entropy": 5.8930316925048825, "epoch": 0.39491894029260577, "grad_norm": 1.2578125, "learning_rate": 0.0004990084041544895, "loss": 5.7652, "mean_token_accuracy": 0.15779706388711928, "num_tokens": 9131543.0, "step": 3995 }, { "entropy": 5.815483951568604, "epoch": 0.39541320680110714, "grad_norm": 1.078125, "learning_rate": 0.000499005091890631, "loss": 5.7806, "mean_token_accuracy": 0.15455961227416992, "num_tokens": 9142968.0, "step": 4000 }, { "entropy": 5.782220888137817, "epoch": 0.3959074733096085, "grad_norm": 1.3515625, "learning_rate": 0.0004990017741162125, "loss": 5.8476, "mean_token_accuracy": 0.15507417023181916, "num_tokens": 9155705.0, "step": 4005 }, { "entropy": 5.916092014312744, "epoch": 0.39640173981810994, "grad_norm": 1.1171875, "learning_rate": 0.0004989984508313156, "loss": 5.8555, "mean_token_accuracy": 0.14767262265086173, "num_tokens": 9167575.0, "step": 4010 }, { "entropy": 5.864837169647217, "epoch": 0.3968960063266113, "grad_norm": 1.203125, "learning_rate": 0.000498995122036022, "loss": 5.8303, "mean_token_accuracy": 0.15483421534299852, "num_tokens": 9178493.0, "step": 4015 }, { "entropy": 5.9377106666564945, "epoch": 0.3973902728351127, "grad_norm": 1.171875, "learning_rate": 0.0004989917877304138, "loss": 5.8824, "mean_token_accuracy": 0.1505347326397896, "num_tokens": 9189677.0, "step": 4020 }, { "entropy": 5.827444219589234, "epoch": 0.39788453934361406, "grad_norm": 1.25, "learning_rate": 0.0004989884479145727, "loss": 5.7078, "mean_token_accuracy": 0.15970520824193954, "num_tokens": 9199179.0, "step": 4025 }, { "entropy": 5.905575847625732, "epoch": 0.39837880585211544, "grad_norm": 1.125, "learning_rate": 0.0004989851025885812, "loss": 5.778, "mean_token_accuracy": 0.15371362268924713, "num_tokens": 9210689.0, "step": 4030 }, { "entropy": 5.812503290176392, "epoch": 0.39887307236061686, "grad_norm": 1.234375, "learning_rate": 0.0004989817517525212, "loss": 5.7441, "mean_token_accuracy": 0.15978539288043975, "num_tokens": 9221710.0, "step": 4035 }, { "entropy": 5.845702409744263, "epoch": 0.39936733886911824, "grad_norm": 1.1875, "learning_rate": 0.0004989783954064755, "loss": 5.84, "mean_token_accuracy": 0.15523956567049027, "num_tokens": 9234079.0, "step": 4040 }, { "entropy": 5.842787218093872, "epoch": 0.3998616053776196, "grad_norm": 1.125, "learning_rate": 0.0004989750335505265, "loss": 5.7661, "mean_token_accuracy": 0.15682925432920455, "num_tokens": 9245050.0, "step": 4045 }, { "entropy": 5.9115033626556395, "epoch": 0.400355871886121, "grad_norm": 1.2421875, "learning_rate": 0.0004989716661847571, "loss": 5.8554, "mean_token_accuracy": 0.15244610458612443, "num_tokens": 9256455.0, "step": 4050 }, { "entropy": 5.779877328872681, "epoch": 0.40085013839462236, "grad_norm": 1.453125, "learning_rate": 0.0004989682933092497, "loss": 5.7513, "mean_token_accuracy": 0.16125411689281463, "num_tokens": 9267722.0, "step": 4055 }, { "entropy": 5.817647457122803, "epoch": 0.4013444049031238, "grad_norm": 1.2421875, "learning_rate": 0.0004989649149240877, "loss": 5.7853, "mean_token_accuracy": 0.15072275847196578, "num_tokens": 9277533.0, "step": 4060 }, { "entropy": 5.887001609802246, "epoch": 0.40183867141162516, "grad_norm": 1.1015625, "learning_rate": 0.000498961531029354, "loss": 5.8136, "mean_token_accuracy": 0.16053701788187028, "num_tokens": 9290052.0, "step": 4065 }, { "entropy": 5.850340270996094, "epoch": 0.40233293792012653, "grad_norm": 1.1484375, "learning_rate": 0.000498958141625132, "loss": 5.8021, "mean_token_accuracy": 0.15744038969278334, "num_tokens": 9302201.0, "step": 4070 }, { "entropy": 5.914964580535889, "epoch": 0.4028272044286279, "grad_norm": 1.390625, "learning_rate": 0.0004989547467115047, "loss": 5.8788, "mean_token_accuracy": 0.1513068199157715, "num_tokens": 9313215.0, "step": 4075 }, { "entropy": 5.910677099227906, "epoch": 0.4033214709371293, "grad_norm": 1.1796875, "learning_rate": 0.0004989513462885561, "loss": 5.917, "mean_token_accuracy": 0.145223967730999, "num_tokens": 9324098.0, "step": 4080 }, { "entropy": 5.964850568771363, "epoch": 0.4038157374456307, "grad_norm": 1.0234375, "learning_rate": 0.0004989479403563696, "loss": 5.7984, "mean_token_accuracy": 0.15427584648132325, "num_tokens": 9336048.0, "step": 4085 }, { "entropy": 5.874447202682495, "epoch": 0.4043100039541321, "grad_norm": 1.09375, "learning_rate": 0.0004989445289150289, "loss": 5.7562, "mean_token_accuracy": 0.15428639203310013, "num_tokens": 9347723.0, "step": 4090 }, { "entropy": 5.81725811958313, "epoch": 0.40480427046263345, "grad_norm": 1.0, "learning_rate": 0.0004989411119646183, "loss": 5.802, "mean_token_accuracy": 0.15105294287204743, "num_tokens": 9360588.0, "step": 4095 }, { "entropy": 5.881053924560547, "epoch": 0.4052985369711348, "grad_norm": 1.2734375, "learning_rate": 0.0004989376895052214, "loss": 5.7714, "mean_token_accuracy": 0.1561678320169449, "num_tokens": 9371798.0, "step": 4100 }, { "entropy": 5.816941499710083, "epoch": 0.4057928034796362, "grad_norm": 1.421875, "learning_rate": 0.0004989342615369226, "loss": 5.7775, "mean_token_accuracy": 0.16338589042425156, "num_tokens": 9382421.0, "step": 4105 }, { "entropy": 5.828975009918213, "epoch": 0.40628706998813763, "grad_norm": 1.1484375, "learning_rate": 0.0004989308280598063, "loss": 5.7102, "mean_token_accuracy": 0.16223904639482498, "num_tokens": 9392832.0, "step": 4110 }, { "entropy": 5.789451217651367, "epoch": 0.406781336496639, "grad_norm": 1.0703125, "learning_rate": 0.0004989273890739569, "loss": 5.7038, "mean_token_accuracy": 0.16221638768911362, "num_tokens": 9405309.0, "step": 4115 }, { "entropy": 5.795983219146729, "epoch": 0.4072756030051404, "grad_norm": 1.125, "learning_rate": 0.000498923944579459, "loss": 5.7135, "mean_token_accuracy": 0.16932716518640517, "num_tokens": 9416707.0, "step": 4120 }, { "entropy": 5.821607875823974, "epoch": 0.40776986951364175, "grad_norm": 1.3046875, "learning_rate": 0.0004989204945763972, "loss": 5.8453, "mean_token_accuracy": 0.1561842828989029, "num_tokens": 9427684.0, "step": 4125 }, { "entropy": 5.83395471572876, "epoch": 0.4082641360221431, "grad_norm": 1.1796875, "learning_rate": 0.0004989170390648567, "loss": 5.8027, "mean_token_accuracy": 0.15728633105754852, "num_tokens": 9439073.0, "step": 4130 }, { "entropy": 5.800190210342407, "epoch": 0.40875840253064455, "grad_norm": 1.0703125, "learning_rate": 0.0004989135780449222, "loss": 5.7427, "mean_token_accuracy": 0.15998244285583496, "num_tokens": 9450266.0, "step": 4135 }, { "entropy": 5.776017856597901, "epoch": 0.4092526690391459, "grad_norm": 1.203125, "learning_rate": 0.0004989101115166789, "loss": 5.706, "mean_token_accuracy": 0.16565122753381728, "num_tokens": 9462662.0, "step": 4140 }, { "entropy": 5.86929087638855, "epoch": 0.4097469355476473, "grad_norm": 1.15625, "learning_rate": 0.0004989066394802122, "loss": 5.8024, "mean_token_accuracy": 0.15239896178245543, "num_tokens": 9474338.0, "step": 4145 }, { "entropy": 5.845749139785767, "epoch": 0.41024120205614867, "grad_norm": 1.265625, "learning_rate": 0.0004989031619356074, "loss": 5.7838, "mean_token_accuracy": 0.16020090132951736, "num_tokens": 9486353.0, "step": 4150 }, { "entropy": 5.8469836711883545, "epoch": 0.41073546856465004, "grad_norm": 1.5078125, "learning_rate": 0.00049889967888295, "loss": 5.7535, "mean_token_accuracy": 0.1544842854142189, "num_tokens": 9497464.0, "step": 4155 }, { "entropy": 5.81313943862915, "epoch": 0.41122973507315147, "grad_norm": 1.125, "learning_rate": 0.0004988961903223258, "loss": 5.7288, "mean_token_accuracy": 0.1628125235438347, "num_tokens": 9508037.0, "step": 4160 }, { "entropy": 5.773452091217041, "epoch": 0.41172400158165284, "grad_norm": 1.3671875, "learning_rate": 0.0004988926962538207, "loss": 5.7676, "mean_token_accuracy": 0.15996645092964173, "num_tokens": 9518653.0, "step": 4165 }, { "entropy": 5.854199171066284, "epoch": 0.4122182680901542, "grad_norm": 1.25, "learning_rate": 0.0004988891966775204, "loss": 5.7609, "mean_token_accuracy": 0.16049931049346924, "num_tokens": 9529225.0, "step": 4170 }, { "entropy": 5.8694295406341555, "epoch": 0.4127125345986556, "grad_norm": 1.3203125, "learning_rate": 0.0004988856915935112, "loss": 5.7343, "mean_token_accuracy": 0.15607544779777527, "num_tokens": 9541010.0, "step": 4175 }, { "entropy": 5.747597646713257, "epoch": 0.41320680110715696, "grad_norm": 1.2109375, "learning_rate": 0.0004988821810018791, "loss": 5.8116, "mean_token_accuracy": 0.15240168645977975, "num_tokens": 9552061.0, "step": 4180 }, { "entropy": 5.953191566467285, "epoch": 0.41370106761565834, "grad_norm": 1.171875, "learning_rate": 0.0004988786649027108, "loss": 5.9074, "mean_token_accuracy": 0.14590952843427657, "num_tokens": 9563970.0, "step": 4185 }, { "entropy": 5.872267389297486, "epoch": 0.41419533412415976, "grad_norm": 1.1328125, "learning_rate": 0.0004988751432960926, "loss": 5.6962, "mean_token_accuracy": 0.16297404766082763, "num_tokens": 9575381.0, "step": 4190 }, { "entropy": 5.843984842300415, "epoch": 0.41468960063266114, "grad_norm": 1.4609375, "learning_rate": 0.0004988716161821111, "loss": 5.7267, "mean_token_accuracy": 0.16292373985052108, "num_tokens": 9586821.0, "step": 4195 }, { "entropy": 5.843246555328369, "epoch": 0.4151838671411625, "grad_norm": 1.1640625, "learning_rate": 0.0004988680835608531, "loss": 5.8082, "mean_token_accuracy": 0.15058472603559495, "num_tokens": 9599580.0, "step": 4200 }, { "entropy": 5.7772629737854, "epoch": 0.4156781336496639, "grad_norm": 1.09375, "learning_rate": 0.0004988645454324055, "loss": 5.8068, "mean_token_accuracy": 0.15320300832390785, "num_tokens": 9611495.0, "step": 4205 }, { "entropy": 5.92116961479187, "epoch": 0.41617240015816526, "grad_norm": 1.1484375, "learning_rate": 0.0004988610017968554, "loss": 5.7728, "mean_token_accuracy": 0.15595485121011735, "num_tokens": 9623713.0, "step": 4210 }, { "entropy": 5.768342113494873, "epoch": 0.4166666666666667, "grad_norm": 1.28125, "learning_rate": 0.0004988574526542899, "loss": 5.7569, "mean_token_accuracy": 0.1648036479949951, "num_tokens": 9633922.0, "step": 4215 }, { "entropy": 5.831979560852051, "epoch": 0.41716093317516806, "grad_norm": 1.2890625, "learning_rate": 0.0004988538980047963, "loss": 5.8424, "mean_token_accuracy": 0.15677017271518706, "num_tokens": 9645641.0, "step": 4220 }, { "entropy": 5.851514863967895, "epoch": 0.41765519968366943, "grad_norm": 1.21875, "learning_rate": 0.0004988503378484622, "loss": 5.7467, "mean_token_accuracy": 0.16601389199495314, "num_tokens": 9656927.0, "step": 4225 }, { "entropy": 5.79203519821167, "epoch": 0.4181494661921708, "grad_norm": 1.25, "learning_rate": 0.000498846772185375, "loss": 5.7172, "mean_token_accuracy": 0.1635448768734932, "num_tokens": 9669148.0, "step": 4230 }, { "entropy": 5.891840267181396, "epoch": 0.4186437327006722, "grad_norm": 1.125, "learning_rate": 0.0004988432010156224, "loss": 5.838, "mean_token_accuracy": 0.1492895156145096, "num_tokens": 9680620.0, "step": 4235 }, { "entropy": 5.9005063533782955, "epoch": 0.4191379992091736, "grad_norm": 1.3359375, "learning_rate": 0.0004988396243392924, "loss": 5.7901, "mean_token_accuracy": 0.15724762678146362, "num_tokens": 9690984.0, "step": 4240 }, { "entropy": 5.832825088500977, "epoch": 0.419632265717675, "grad_norm": 1.1953125, "learning_rate": 0.000498836042156473, "loss": 5.768, "mean_token_accuracy": 0.16585759073495865, "num_tokens": 9701561.0, "step": 4245 }, { "entropy": 5.790317058563232, "epoch": 0.42012653222617635, "grad_norm": 1.2890625, "learning_rate": 0.0004988324544672521, "loss": 5.7601, "mean_token_accuracy": 0.1544044718146324, "num_tokens": 9712780.0, "step": 4250 }, { "entropy": 5.848903608322144, "epoch": 0.4206207987346777, "grad_norm": 1.265625, "learning_rate": 0.0004988288612717182, "loss": 5.7547, "mean_token_accuracy": 0.1562611922621727, "num_tokens": 9724547.0, "step": 4255 }, { "entropy": 5.8364794731140135, "epoch": 0.4211150652431791, "grad_norm": 1.140625, "learning_rate": 0.0004988252625699594, "loss": 5.8111, "mean_token_accuracy": 0.15629005581140518, "num_tokens": 9736897.0, "step": 4260 }, { "entropy": 5.8446488857269285, "epoch": 0.4216093317516805, "grad_norm": 1.1796875, "learning_rate": 0.0004988216583620647, "loss": 5.7584, "mean_token_accuracy": 0.16204439848661423, "num_tokens": 9748214.0, "step": 4265 }, { "entropy": 5.886655187606811, "epoch": 0.4221035982601819, "grad_norm": 1.2578125, "learning_rate": 0.0004988180486481223, "loss": 5.7894, "mean_token_accuracy": 0.15823814868927003, "num_tokens": 9759602.0, "step": 4270 }, { "entropy": 5.827601718902588, "epoch": 0.4225978647686833, "grad_norm": 1.265625, "learning_rate": 0.0004988144334282211, "loss": 5.7425, "mean_token_accuracy": 0.1589537337422371, "num_tokens": 9771645.0, "step": 4275 }, { "entropy": 5.853240966796875, "epoch": 0.42309213127718465, "grad_norm": 1.3046875, "learning_rate": 0.0004988108127024503, "loss": 5.7505, "mean_token_accuracy": 0.1587558016180992, "num_tokens": 9783504.0, "step": 4280 }, { "entropy": 5.891699171066284, "epoch": 0.423586397785686, "grad_norm": 1.2265625, "learning_rate": 0.0004988071864708987, "loss": 5.8804, "mean_token_accuracy": 0.15425789207220078, "num_tokens": 9795572.0, "step": 4285 }, { "entropy": 5.83182110786438, "epoch": 0.42408066429418745, "grad_norm": 1.265625, "learning_rate": 0.0004988035547336555, "loss": 5.7336, "mean_token_accuracy": 0.15293268710374833, "num_tokens": 9806398.0, "step": 4290 }, { "entropy": 5.82321310043335, "epoch": 0.4245749308026888, "grad_norm": 1.1875, "learning_rate": 0.0004987999174908104, "loss": 5.7342, "mean_token_accuracy": 0.1546010985970497, "num_tokens": 9817171.0, "step": 4295 }, { "entropy": 5.818284416198731, "epoch": 0.4250691973111902, "grad_norm": 1.3515625, "learning_rate": 0.0004987962747424524, "loss": 5.7763, "mean_token_accuracy": 0.15528347045183183, "num_tokens": 9827535.0, "step": 4300 }, { "entropy": 5.79456467628479, "epoch": 0.42556346381969157, "grad_norm": 1.296875, "learning_rate": 0.0004987926264886713, "loss": 5.7551, "mean_token_accuracy": 0.1570479989051819, "num_tokens": 9839619.0, "step": 4305 }, { "entropy": 5.840618705749511, "epoch": 0.42605773032819294, "grad_norm": 1.28125, "learning_rate": 0.000498788972729557, "loss": 5.7544, "mean_token_accuracy": 0.15230125635862352, "num_tokens": 9850100.0, "step": 4310 }, { "entropy": 5.917747354507446, "epoch": 0.42655199683669437, "grad_norm": 1.2421875, "learning_rate": 0.0004987853134651992, "loss": 5.8327, "mean_token_accuracy": 0.14419816955924034, "num_tokens": 9862228.0, "step": 4315 }, { "entropy": 5.803866004943847, "epoch": 0.42704626334519574, "grad_norm": 1.2734375, "learning_rate": 0.000498781648695688, "loss": 5.7229, "mean_token_accuracy": 0.1623837560415268, "num_tokens": 9873080.0, "step": 4320 }, { "entropy": 5.791725206375122, "epoch": 0.4275405298536971, "grad_norm": 1.2734375, "learning_rate": 0.0004987779784211135, "loss": 5.7442, "mean_token_accuracy": 0.15227282643318177, "num_tokens": 9884735.0, "step": 4325 }, { "entropy": 5.879214715957642, "epoch": 0.4280347963621985, "grad_norm": 1.234375, "learning_rate": 0.000498774302641566, "loss": 5.7641, "mean_token_accuracy": 0.15441785752773285, "num_tokens": 9895018.0, "step": 4330 }, { "entropy": 5.850545740127563, "epoch": 0.42852906287069986, "grad_norm": 1.1953125, "learning_rate": 0.0004987706213571359, "loss": 5.7371, "mean_token_accuracy": 0.1566600888967514, "num_tokens": 9906838.0, "step": 4335 }, { "entropy": 5.844648790359497, "epoch": 0.4290233293792013, "grad_norm": 1.265625, "learning_rate": 0.0004987669345679139, "loss": 5.7701, "mean_token_accuracy": 0.1565292850136757, "num_tokens": 9919556.0, "step": 4340 }, { "entropy": 5.781128025054931, "epoch": 0.42951759588770266, "grad_norm": 1.25, "learning_rate": 0.0004987632422739904, "loss": 5.6781, "mean_token_accuracy": 0.15627526938915254, "num_tokens": 9929783.0, "step": 4345 }, { "entropy": 5.772721195220948, "epoch": 0.43001186239620404, "grad_norm": 1.421875, "learning_rate": 0.0004987595444754567, "loss": 5.7391, "mean_token_accuracy": 0.15912755578756332, "num_tokens": 9940894.0, "step": 4350 }, { "entropy": 5.80626540184021, "epoch": 0.4305061289047054, "grad_norm": 1.3203125, "learning_rate": 0.0004987558411724032, "loss": 5.718, "mean_token_accuracy": 0.16627187728881837, "num_tokens": 9951973.0, "step": 4355 }, { "entropy": 5.9029295444488525, "epoch": 0.4310003954132068, "grad_norm": 1.2109375, "learning_rate": 0.0004987521323649215, "loss": 5.7694, "mean_token_accuracy": 0.15462518632411956, "num_tokens": 9963304.0, "step": 4360 }, { "entropy": 5.838963317871094, "epoch": 0.4314946619217082, "grad_norm": 1.2109375, "learning_rate": 0.0004987484180531026, "loss": 5.7812, "mean_token_accuracy": 0.16214534044265747, "num_tokens": 9973981.0, "step": 4365 }, { "entropy": 5.8302850246429445, "epoch": 0.4319889284302096, "grad_norm": 1.234375, "learning_rate": 0.0004987446982370379, "loss": 5.8036, "mean_token_accuracy": 0.1544625535607338, "num_tokens": 9986461.0, "step": 4370 }, { "entropy": 5.8808770179748535, "epoch": 0.43248319493871096, "grad_norm": 1.2265625, "learning_rate": 0.000498740972916819, "loss": 5.7715, "mean_token_accuracy": 0.15348488688468934, "num_tokens": 9997973.0, "step": 4375 }, { "entropy": 5.828121280670166, "epoch": 0.43297746144721233, "grad_norm": 1.2421875, "learning_rate": 0.0004987372420925373, "loss": 5.78, "mean_token_accuracy": 0.15659529715776443, "num_tokens": 10009572.0, "step": 4380 }, { "entropy": 5.816518115997314, "epoch": 0.4334717279557137, "grad_norm": 1.203125, "learning_rate": 0.0004987335057642847, "loss": 5.6502, "mean_token_accuracy": 0.1678347870707512, "num_tokens": 10020437.0, "step": 4385 }, { "entropy": 5.809616422653198, "epoch": 0.43396599446421513, "grad_norm": 1.1484375, "learning_rate": 0.0004987297639321533, "loss": 5.7808, "mean_token_accuracy": 0.15647988617420197, "num_tokens": 10031827.0, "step": 4390 }, { "entropy": 5.821065092086792, "epoch": 0.4344602609727165, "grad_norm": 1.1796875, "learning_rate": 0.0004987260165962349, "loss": 5.7813, "mean_token_accuracy": 0.15543572455644608, "num_tokens": 10043833.0, "step": 4395 }, { "entropy": 5.8089728355407715, "epoch": 0.4349545274812179, "grad_norm": 1.3515625, "learning_rate": 0.0004987222637566218, "loss": 5.7225, "mean_token_accuracy": 0.1572750225663185, "num_tokens": 10054645.0, "step": 4400 }, { "entropy": 5.7818284034729, "epoch": 0.43544879398971925, "grad_norm": 1.171875, "learning_rate": 0.0004987185054134064, "loss": 5.6724, "mean_token_accuracy": 0.1580430954694748, "num_tokens": 10065178.0, "step": 4405 }, { "entropy": 5.825777530670166, "epoch": 0.4359430604982206, "grad_norm": 1.2265625, "learning_rate": 0.000498714741566681, "loss": 5.706, "mean_token_accuracy": 0.16232621520757676, "num_tokens": 10076701.0, "step": 4410 }, { "entropy": 5.735870885848999, "epoch": 0.436437327006722, "grad_norm": 1.21875, "learning_rate": 0.0004987109722165383, "loss": 5.7263, "mean_token_accuracy": 0.15729656368494033, "num_tokens": 10087959.0, "step": 4415 }, { "entropy": 5.88615665435791, "epoch": 0.4369315935152234, "grad_norm": 1.2890625, "learning_rate": 0.0004987071973630708, "loss": 5.7156, "mean_token_accuracy": 0.15740345194935798, "num_tokens": 10099463.0, "step": 4420 }, { "entropy": 5.822025537490845, "epoch": 0.4374258600237248, "grad_norm": 1.2109375, "learning_rate": 0.0004987034170063717, "loss": 5.8005, "mean_token_accuracy": 0.15701815336942673, "num_tokens": 10111384.0, "step": 4425 }, { "entropy": 5.821445465087891, "epoch": 0.4379201265322262, "grad_norm": 1.234375, "learning_rate": 0.0004986996311465338, "loss": 5.7321, "mean_token_accuracy": 0.15710116550326347, "num_tokens": 10121838.0, "step": 4430 }, { "entropy": 5.8637402057647705, "epoch": 0.43841439304072755, "grad_norm": 1.140625, "learning_rate": 0.0004986958397836503, "loss": 5.6928, "mean_token_accuracy": 0.1640600949525833, "num_tokens": 10132225.0, "step": 4435 }, { "entropy": 5.729298543930054, "epoch": 0.4389086595492289, "grad_norm": 1.1796875, "learning_rate": 0.0004986920429178144, "loss": 5.6631, "mean_token_accuracy": 0.15749302357435227, "num_tokens": 10143114.0, "step": 4440 }, { "entropy": 5.893101644515991, "epoch": 0.43940292605773035, "grad_norm": 1.2109375, "learning_rate": 0.0004986882405491195, "loss": 5.8626, "mean_token_accuracy": 0.15157403349876403, "num_tokens": 10155057.0, "step": 4445 }, { "entropy": 5.75573582649231, "epoch": 0.4398971925662317, "grad_norm": 1.234375, "learning_rate": 0.0004986844326776593, "loss": 5.6229, "mean_token_accuracy": 0.1684441089630127, "num_tokens": 10166816.0, "step": 4450 }, { "entropy": 5.734735536575317, "epoch": 0.4403914590747331, "grad_norm": 1.1953125, "learning_rate": 0.0004986806193035272, "loss": 5.695, "mean_token_accuracy": 0.1676469177007675, "num_tokens": 10179433.0, "step": 4455 }, { "entropy": 5.8267802715301515, "epoch": 0.44088572558323447, "grad_norm": 1.171875, "learning_rate": 0.0004986768004268173, "loss": 5.693, "mean_token_accuracy": 0.16008566021919252, "num_tokens": 10190784.0, "step": 4460 }, { "entropy": 5.836114597320557, "epoch": 0.44137999209173584, "grad_norm": 1.3203125, "learning_rate": 0.0004986729760476234, "loss": 5.7523, "mean_token_accuracy": 0.15255020558834076, "num_tokens": 10201941.0, "step": 4465 }, { "entropy": 5.808204221725464, "epoch": 0.44187425860023727, "grad_norm": 1.265625, "learning_rate": 0.0004986691461660394, "loss": 5.7176, "mean_token_accuracy": 0.16116027235984803, "num_tokens": 10214029.0, "step": 4470 }, { "entropy": 5.776810598373413, "epoch": 0.44236852510873864, "grad_norm": 1.1875, "learning_rate": 0.0004986653107821599, "loss": 5.7602, "mean_token_accuracy": 0.16111526936292647, "num_tokens": 10225585.0, "step": 4475 }, { "entropy": 5.78863844871521, "epoch": 0.44286279161724, "grad_norm": 1.2265625, "learning_rate": 0.0004986614698960789, "loss": 5.7031, "mean_token_accuracy": 0.16227239221334458, "num_tokens": 10237753.0, "step": 4480 }, { "entropy": 5.912133312225341, "epoch": 0.4433570581257414, "grad_norm": 1.234375, "learning_rate": 0.0004986576235078913, "loss": 5.9483, "mean_token_accuracy": 0.1438101887702942, "num_tokens": 10251522.0, "step": 4485 }, { "entropy": 5.831998538970947, "epoch": 0.44385132463424276, "grad_norm": 1.2265625, "learning_rate": 0.0004986537716176912, "loss": 5.6578, "mean_token_accuracy": 0.16271060109138488, "num_tokens": 10263319.0, "step": 4490 }, { "entropy": 5.715137338638305, "epoch": 0.4443455911427442, "grad_norm": 1.3046875, "learning_rate": 0.0004986499142255738, "loss": 5.7045, "mean_token_accuracy": 0.15843060836195946, "num_tokens": 10274899.0, "step": 4495 }, { "entropy": 5.836452913284302, "epoch": 0.44483985765124556, "grad_norm": 1.3671875, "learning_rate": 0.0004986460513316338, "loss": 5.676, "mean_token_accuracy": 0.16559335291385652, "num_tokens": 10286110.0, "step": 4500 }, { "entropy": 5.78662633895874, "epoch": 0.44533412415974694, "grad_norm": 1.1796875, "learning_rate": 0.0004986421829359662, "loss": 5.8238, "mean_token_accuracy": 0.15288708209991456, "num_tokens": 10298870.0, "step": 4505 }, { "entropy": 5.843674945831299, "epoch": 0.4458283906682483, "grad_norm": 1.234375, "learning_rate": 0.0004986383090386661, "loss": 5.744, "mean_token_accuracy": 0.15693433284759523, "num_tokens": 10310326.0, "step": 4510 }, { "entropy": 5.83041410446167, "epoch": 0.4463226571767497, "grad_norm": 1.265625, "learning_rate": 0.000498634429639829, "loss": 5.6721, "mean_token_accuracy": 0.15878720134496688, "num_tokens": 10320899.0, "step": 4515 }, { "entropy": 5.792200517654419, "epoch": 0.4468169236852511, "grad_norm": 1.3828125, "learning_rate": 0.0004986305447395502, "loss": 5.7275, "mean_token_accuracy": 0.1623765215277672, "num_tokens": 10331669.0, "step": 4520 }, { "entropy": 5.829644346237183, "epoch": 0.4473111901937525, "grad_norm": 1.265625, "learning_rate": 0.0004986266543379254, "loss": 5.7114, "mean_token_accuracy": 0.1589057058095932, "num_tokens": 10343120.0, "step": 4525 }, { "entropy": 5.772820949554443, "epoch": 0.44780545670225386, "grad_norm": 1.1953125, "learning_rate": 0.0004986227584350501, "loss": 5.7149, "mean_token_accuracy": 0.1589616447687149, "num_tokens": 10354806.0, "step": 4530 }, { "entropy": 5.848662900924682, "epoch": 0.44829972321075523, "grad_norm": 1.140625, "learning_rate": 0.0004986188570310203, "loss": 5.7359, "mean_token_accuracy": 0.1575729265809059, "num_tokens": 10366453.0, "step": 4535 }, { "entropy": 5.86790361404419, "epoch": 0.4487939897192566, "grad_norm": 1.203125, "learning_rate": 0.0004986149501259319, "loss": 5.8281, "mean_token_accuracy": 0.15670044720172882, "num_tokens": 10378095.0, "step": 4540 }, { "entropy": 5.732289028167725, "epoch": 0.44928825622775803, "grad_norm": 1.1875, "learning_rate": 0.0004986110377198812, "loss": 5.6931, "mean_token_accuracy": 0.16421767175197602, "num_tokens": 10389620.0, "step": 4545 }, { "entropy": 5.868263101577758, "epoch": 0.4497825227362594, "grad_norm": 1.2421875, "learning_rate": 0.000498607119812964, "loss": 5.8237, "mean_token_accuracy": 0.15202950835227966, "num_tokens": 10400166.0, "step": 4550 }, { "entropy": 5.809820365905762, "epoch": 0.4502767892447608, "grad_norm": 1.25, "learning_rate": 0.0004986031964052772, "loss": 5.7247, "mean_token_accuracy": 0.15717918127775193, "num_tokens": 10411116.0, "step": 4555 }, { "entropy": 5.741772174835205, "epoch": 0.45077105575326215, "grad_norm": 1.3359375, "learning_rate": 0.0004985992674969169, "loss": 5.7477, "mean_token_accuracy": 0.15264249593019485, "num_tokens": 10423484.0, "step": 4560 }, { "entropy": 5.902524757385254, "epoch": 0.4512653222617635, "grad_norm": 1.3515625, "learning_rate": 0.0004985953330879801, "loss": 5.813, "mean_token_accuracy": 0.14781858772039413, "num_tokens": 10435636.0, "step": 4565 }, { "entropy": 5.847655820846557, "epoch": 0.45175958877026495, "grad_norm": 1.2421875, "learning_rate": 0.0004985913931785633, "loss": 5.7489, "mean_token_accuracy": 0.1599886104464531, "num_tokens": 10447586.0, "step": 4570 }, { "entropy": 5.782388496398926, "epoch": 0.4522538552787663, "grad_norm": 1.28125, "learning_rate": 0.0004985874477687636, "loss": 5.8058, "mean_token_accuracy": 0.1555984526872635, "num_tokens": 10460678.0, "step": 4575 }, { "entropy": 5.818998098373413, "epoch": 0.4527481217872677, "grad_norm": 1.2109375, "learning_rate": 0.0004985834968586779, "loss": 5.7685, "mean_token_accuracy": 0.1549448549747467, "num_tokens": 10472738.0, "step": 4580 }, { "entropy": 5.85989031791687, "epoch": 0.45324238829576907, "grad_norm": 1.21875, "learning_rate": 0.0004985795404484037, "loss": 5.6418, "mean_token_accuracy": 0.16428616791963577, "num_tokens": 10483716.0, "step": 4585 }, { "entropy": 5.747600412368774, "epoch": 0.45373665480427045, "grad_norm": 1.3828125, "learning_rate": 0.0004985755785380379, "loss": 5.7724, "mean_token_accuracy": 0.15435491055250167, "num_tokens": 10495287.0, "step": 4590 }, { "entropy": 5.795434284210205, "epoch": 0.4542309213127719, "grad_norm": 1.390625, "learning_rate": 0.0004985716111276781, "loss": 5.7235, "mean_token_accuracy": 0.16080528646707534, "num_tokens": 10506332.0, "step": 4595 }, { "entropy": 5.858145904541016, "epoch": 0.45472518782127325, "grad_norm": 1.2421875, "learning_rate": 0.0004985676382174223, "loss": 5.7538, "mean_token_accuracy": 0.15550379902124406, "num_tokens": 10517574.0, "step": 4600 }, { "entropy": 5.77792444229126, "epoch": 0.4552194543297746, "grad_norm": 1.2109375, "learning_rate": 0.0004985636598073677, "loss": 5.6777, "mean_token_accuracy": 0.1682252198457718, "num_tokens": 10528998.0, "step": 4605 }, { "entropy": 5.829964351654053, "epoch": 0.455713720838276, "grad_norm": 1.234375, "learning_rate": 0.0004985596758976125, "loss": 5.7456, "mean_token_accuracy": 0.15128750652074813, "num_tokens": 10539669.0, "step": 4610 }, { "entropy": 5.807875728607177, "epoch": 0.45620798734677737, "grad_norm": 1.1875, "learning_rate": 0.0004985556864882545, "loss": 5.7253, "mean_token_accuracy": 0.16209764927625656, "num_tokens": 10550005.0, "step": 4615 }, { "entropy": 5.745830821990967, "epoch": 0.45670225385527874, "grad_norm": 1.171875, "learning_rate": 0.000498551691579392, "loss": 5.6994, "mean_token_accuracy": 0.16218698173761367, "num_tokens": 10561122.0, "step": 4620 }, { "entropy": 5.817157936096192, "epoch": 0.45719652036378017, "grad_norm": 1.203125, "learning_rate": 0.0004985476911711232, "loss": 5.6775, "mean_token_accuracy": 0.15966929942369462, "num_tokens": 10572081.0, "step": 4625 }, { "entropy": 5.656571245193481, "epoch": 0.45769078687228154, "grad_norm": 1.4609375, "learning_rate": 0.0004985436852635465, "loss": 5.6708, "mean_token_accuracy": 0.1661362901329994, "num_tokens": 10582297.0, "step": 4630 }, { "entropy": 5.8948314666748045, "epoch": 0.4581850533807829, "grad_norm": 1.1875, "learning_rate": 0.0004985396738567604, "loss": 5.7712, "mean_token_accuracy": 0.15315597653388976, "num_tokens": 10593161.0, "step": 4635 }, { "entropy": 5.829736757278442, "epoch": 0.4586793198892843, "grad_norm": 1.15625, "learning_rate": 0.0004985356569508638, "loss": 5.7647, "mean_token_accuracy": 0.1625633120536804, "num_tokens": 10603900.0, "step": 4640 }, { "entropy": 5.788417482376099, "epoch": 0.45917358639778566, "grad_norm": 1.2265625, "learning_rate": 0.0004985316345459551, "loss": 5.7583, "mean_token_accuracy": 0.16019802242517472, "num_tokens": 10614946.0, "step": 4645 }, { "entropy": 5.819199132919311, "epoch": 0.4596678529062871, "grad_norm": 1.234375, "learning_rate": 0.0004985276066421338, "loss": 5.7609, "mean_token_accuracy": 0.1518936887383461, "num_tokens": 10625073.0, "step": 4650 }, { "entropy": 5.856818628311157, "epoch": 0.46016211941478846, "grad_norm": 1.3125, "learning_rate": 0.0004985235732394986, "loss": 5.8623, "mean_token_accuracy": 0.15111786425113677, "num_tokens": 10636942.0, "step": 4655 }, { "entropy": 5.893058109283447, "epoch": 0.46065638592328984, "grad_norm": 1.328125, "learning_rate": 0.0004985195343381487, "loss": 5.7983, "mean_token_accuracy": 0.1530800074338913, "num_tokens": 10647608.0, "step": 4660 }, { "entropy": 5.854513692855835, "epoch": 0.4611506524317912, "grad_norm": 1.1875, "learning_rate": 0.0004985154899381837, "loss": 5.8287, "mean_token_accuracy": 0.15122355073690413, "num_tokens": 10659532.0, "step": 4665 }, { "entropy": 5.853507041931152, "epoch": 0.4616449189402926, "grad_norm": 1.296875, "learning_rate": 0.0004985114400397029, "loss": 5.7571, "mean_token_accuracy": 0.16026072353124618, "num_tokens": 10670342.0, "step": 4670 }, { "entropy": 5.8415283203125, "epoch": 0.462139185448794, "grad_norm": 1.3203125, "learning_rate": 0.0004985073846428061, "loss": 5.7877, "mean_token_accuracy": 0.15555054545402527, "num_tokens": 10682984.0, "step": 4675 }, { "entropy": 5.841789770126343, "epoch": 0.4626334519572954, "grad_norm": 1.125, "learning_rate": 0.0004985033237475929, "loss": 5.773, "mean_token_accuracy": 0.15423207432031633, "num_tokens": 10694235.0, "step": 4680 }, { "entropy": 5.926882314682007, "epoch": 0.46312771846579676, "grad_norm": 1.2265625, "learning_rate": 0.0004984992573541633, "loss": 5.7837, "mean_token_accuracy": 0.15645679384469985, "num_tokens": 10704508.0, "step": 4685 }, { "entropy": 5.676226234436035, "epoch": 0.46362198497429813, "grad_norm": 1.2109375, "learning_rate": 0.0004984951854626173, "loss": 5.6549, "mean_token_accuracy": 0.1645615130662918, "num_tokens": 10716927.0, "step": 4690 }, { "entropy": 5.752277278900147, "epoch": 0.4641162514827995, "grad_norm": 1.171875, "learning_rate": 0.0004984911080730551, "loss": 5.6912, "mean_token_accuracy": 0.16231297999620437, "num_tokens": 10728396.0, "step": 4695 }, { "entropy": 5.783680486679077, "epoch": 0.46461051799130093, "grad_norm": 1.1875, "learning_rate": 0.0004984870251855769, "loss": 5.7673, "mean_token_accuracy": 0.16363271474838256, "num_tokens": 10739001.0, "step": 4700 }, { "entropy": 5.851905822753906, "epoch": 0.4651047844998023, "grad_norm": 1.265625, "learning_rate": 0.0004984829368002831, "loss": 5.7344, "mean_token_accuracy": 0.15897003412246705, "num_tokens": 10748768.0, "step": 4705 }, { "entropy": 5.860234689712525, "epoch": 0.4655990510083037, "grad_norm": 1.2890625, "learning_rate": 0.0004984788429172745, "loss": 5.7698, "mean_token_accuracy": 0.1561150312423706, "num_tokens": 10760582.0, "step": 4710 }, { "entropy": 5.760329294204712, "epoch": 0.46609331751680505, "grad_norm": 1.296875, "learning_rate": 0.0004984747435366517, "loss": 5.6788, "mean_token_accuracy": 0.16664675623178482, "num_tokens": 10772537.0, "step": 4715 }, { "entropy": 5.772965812683106, "epoch": 0.4665875840253064, "grad_norm": 1.40625, "learning_rate": 0.0004984706386585156, "loss": 5.6206, "mean_token_accuracy": 0.168980173766613, "num_tokens": 10783740.0, "step": 4720 }, { "entropy": 5.840044403076172, "epoch": 0.46708185053380785, "grad_norm": 1.1953125, "learning_rate": 0.000498466528282967, "loss": 5.77, "mean_token_accuracy": 0.15619183331727982, "num_tokens": 10794793.0, "step": 4725 }, { "entropy": 5.840643644332886, "epoch": 0.4675761170423092, "grad_norm": 1.2421875, "learning_rate": 0.0004984624124101072, "loss": 5.7317, "mean_token_accuracy": 0.1579558730125427, "num_tokens": 10805944.0, "step": 4730 }, { "entropy": 5.8369344711303714, "epoch": 0.4680703835508106, "grad_norm": 1.265625, "learning_rate": 0.0004984582910400374, "loss": 5.7556, "mean_token_accuracy": 0.15298434495925903, "num_tokens": 10818362.0, "step": 4735 }, { "entropy": 5.780828523635864, "epoch": 0.46856465005931197, "grad_norm": 1.109375, "learning_rate": 0.000498454164172859, "loss": 5.7502, "mean_token_accuracy": 0.16281691044569016, "num_tokens": 10831306.0, "step": 4740 }, { "entropy": 5.807979011535645, "epoch": 0.46905891656781334, "grad_norm": 1.296875, "learning_rate": 0.0004984500318086733, "loss": 5.7066, "mean_token_accuracy": 0.16005800068378448, "num_tokens": 10841671.0, "step": 4745 }, { "entropy": 5.77095742225647, "epoch": 0.4695531830763148, "grad_norm": 1.203125, "learning_rate": 0.0004984458939475824, "loss": 5.6916, "mean_token_accuracy": 0.1572381556034088, "num_tokens": 10852754.0, "step": 4750 }, { "entropy": 5.815678262710572, "epoch": 0.47004744958481615, "grad_norm": 1.3671875, "learning_rate": 0.0004984417505896877, "loss": 5.7662, "mean_token_accuracy": 0.156097312271595, "num_tokens": 10864812.0, "step": 4755 }, { "entropy": 5.857409429550171, "epoch": 0.4705417160933175, "grad_norm": 1.359375, "learning_rate": 0.0004984376017350913, "loss": 5.7473, "mean_token_accuracy": 0.1609667122364044, "num_tokens": 10875967.0, "step": 4760 }, { "entropy": 5.79653754234314, "epoch": 0.4710359826018189, "grad_norm": 1.171875, "learning_rate": 0.0004984334473838953, "loss": 5.7227, "mean_token_accuracy": 0.16150201112031937, "num_tokens": 10889575.0, "step": 4765 }, { "entropy": 5.82901701927185, "epoch": 0.47153024911032027, "grad_norm": 1.2578125, "learning_rate": 0.0004984292875362018, "loss": 5.804, "mean_token_accuracy": 0.1580755218863487, "num_tokens": 10900751.0, "step": 4770 }, { "entropy": 5.878472757339478, "epoch": 0.4720245156188217, "grad_norm": 1.1640625, "learning_rate": 0.0004984251221921131, "loss": 5.7473, "mean_token_accuracy": 0.15800192058086396, "num_tokens": 10912618.0, "step": 4775 }, { "entropy": 5.765990495681763, "epoch": 0.47251878212732307, "grad_norm": 1.2890625, "learning_rate": 0.0004984209513517317, "loss": 5.7156, "mean_token_accuracy": 0.15646711066365243, "num_tokens": 10925286.0, "step": 4780 }, { "entropy": 5.829292821884155, "epoch": 0.47301304863582444, "grad_norm": 1.3203125, "learning_rate": 0.0004984167750151603, "loss": 5.7242, "mean_token_accuracy": 0.16060231178998946, "num_tokens": 10936033.0, "step": 4785 }, { "entropy": 5.779935884475708, "epoch": 0.4735073151443258, "grad_norm": 1.2265625, "learning_rate": 0.0004984125931825018, "loss": 5.6637, "mean_token_accuracy": 0.16456516981124877, "num_tokens": 10947055.0, "step": 4790 }, { "entropy": 5.793975830078125, "epoch": 0.4740015816528272, "grad_norm": 1.4375, "learning_rate": 0.0004984084058538585, "loss": 5.7137, "mean_token_accuracy": 0.1572008863091469, "num_tokens": 10957468.0, "step": 4795 }, { "entropy": 5.861984443664551, "epoch": 0.4744958481613286, "grad_norm": 1.5390625, "learning_rate": 0.0004984042130293339, "loss": 5.8362, "mean_token_accuracy": 0.1582918718457222, "num_tokens": 10970273.0, "step": 4800 }, { "entropy": 5.86493616104126, "epoch": 0.47499011466983, "grad_norm": 1.375, "learning_rate": 0.0004984000147090311, "loss": 5.8211, "mean_token_accuracy": 0.1545470640063286, "num_tokens": 10981842.0, "step": 4805 }, { "entropy": 5.888898468017578, "epoch": 0.47548438117833136, "grad_norm": 1.3125, "learning_rate": 0.0004983958108930531, "loss": 5.7169, "mean_token_accuracy": 0.15943304374814032, "num_tokens": 10993615.0, "step": 4810 }, { "entropy": 5.83760347366333, "epoch": 0.47597864768683273, "grad_norm": 1.46875, "learning_rate": 0.0004983916015815036, "loss": 5.8064, "mean_token_accuracy": 0.15529759526252745, "num_tokens": 11004451.0, "step": 4815 }, { "entropy": 5.901088237762451, "epoch": 0.4764729141953341, "grad_norm": 1.53125, "learning_rate": 0.000498387386774486, "loss": 5.745, "mean_token_accuracy": 0.15757741779088974, "num_tokens": 11014834.0, "step": 4820 }, { "entropy": 5.731997919082642, "epoch": 0.4769671807038355, "grad_norm": 1.375, "learning_rate": 0.000498383166472104, "loss": 5.6858, "mean_token_accuracy": 0.15810937881469728, "num_tokens": 11026116.0, "step": 4825 }, { "entropy": 5.807245063781738, "epoch": 0.4774614472123369, "grad_norm": 1.28125, "learning_rate": 0.0004983789406744615, "loss": 5.7472, "mean_token_accuracy": 0.15772093832492828, "num_tokens": 11038780.0, "step": 4830 }, { "entropy": 5.878645515441894, "epoch": 0.4779557137208383, "grad_norm": 1.375, "learning_rate": 0.0004983747093816625, "loss": 5.7909, "mean_token_accuracy": 0.1571904167532921, "num_tokens": 11049824.0, "step": 4835 }, { "entropy": 5.7510171890258786, "epoch": 0.47844998022933966, "grad_norm": 1.1640625, "learning_rate": 0.0004983704725938108, "loss": 5.6787, "mean_token_accuracy": 0.1669359490275383, "num_tokens": 11060863.0, "step": 4840 }, { "entropy": 5.7988502979278564, "epoch": 0.47894424673784103, "grad_norm": 1.28125, "learning_rate": 0.000498366230311011, "loss": 5.6829, "mean_token_accuracy": 0.1632984146475792, "num_tokens": 11072533.0, "step": 4845 }, { "entropy": 5.72292914390564, "epoch": 0.4794385132463424, "grad_norm": 1.1953125, "learning_rate": 0.0004983619825333671, "loss": 5.6217, "mean_token_accuracy": 0.1602368801832199, "num_tokens": 11083627.0, "step": 4850 }, { "entropy": 5.8456309795379635, "epoch": 0.47993277975484383, "grad_norm": 1.2421875, "learning_rate": 0.0004983577292609839, "loss": 5.8346, "mean_token_accuracy": 0.14952256679534912, "num_tokens": 11096421.0, "step": 4855 }, { "entropy": 5.796829748153686, "epoch": 0.4804270462633452, "grad_norm": 1.21875, "learning_rate": 0.0004983534704939659, "loss": 5.6678, "mean_token_accuracy": 0.15885301381349565, "num_tokens": 11109053.0, "step": 4860 }, { "entropy": 5.730153894424438, "epoch": 0.4809213127718466, "grad_norm": 1.1875, "learning_rate": 0.0004983492062324179, "loss": 5.6214, "mean_token_accuracy": 0.16144478619098662, "num_tokens": 11120431.0, "step": 4865 }, { "entropy": 5.791682338714599, "epoch": 0.48141557928034795, "grad_norm": 1.375, "learning_rate": 0.0004983449364764447, "loss": 5.7241, "mean_token_accuracy": 0.1602831542491913, "num_tokens": 11132767.0, "step": 4870 }, { "entropy": 5.746629905700684, "epoch": 0.4819098457888493, "grad_norm": 1.375, "learning_rate": 0.0004983406612261514, "loss": 5.7184, "mean_token_accuracy": 0.15982515960931779, "num_tokens": 11144508.0, "step": 4875 }, { "entropy": 5.765431594848633, "epoch": 0.48240411229735075, "grad_norm": 1.25, "learning_rate": 0.0004983363804816433, "loss": 5.7026, "mean_token_accuracy": 0.16171906739473343, "num_tokens": 11156905.0, "step": 4880 }, { "entropy": 5.812859296798706, "epoch": 0.4828983788058521, "grad_norm": 1.25, "learning_rate": 0.0004983320942430256, "loss": 5.6916, "mean_token_accuracy": 0.16429043263196946, "num_tokens": 11169383.0, "step": 4885 }, { "entropy": 5.784932374954224, "epoch": 0.4833926453143535, "grad_norm": 1.1875, "learning_rate": 0.0004983278025104036, "loss": 5.6305, "mean_token_accuracy": 0.17158691734075546, "num_tokens": 11179795.0, "step": 4890 }, { "entropy": 5.760914993286133, "epoch": 0.48388691182285487, "grad_norm": 1.1796875, "learning_rate": 0.000498323505283883, "loss": 5.7569, "mean_token_accuracy": 0.15697767585515976, "num_tokens": 11190783.0, "step": 4895 }, { "entropy": 5.82587571144104, "epoch": 0.48438117833135624, "grad_norm": 1.671875, "learning_rate": 0.0004983192025635698, "loss": 5.6969, "mean_token_accuracy": 0.15884145647287368, "num_tokens": 11203000.0, "step": 4900 }, { "entropy": 5.802449417114258, "epoch": 0.48487544483985767, "grad_norm": 1.3515625, "learning_rate": 0.0004983148943495693, "loss": 5.7132, "mean_token_accuracy": 0.1578467845916748, "num_tokens": 11213721.0, "step": 4905 }, { "entropy": 5.8142822742462155, "epoch": 0.48536971134835905, "grad_norm": 1.3671875, "learning_rate": 0.0004983105806419878, "loss": 5.7944, "mean_token_accuracy": 0.1531928800046444, "num_tokens": 11224490.0, "step": 4910 }, { "entropy": 5.801441812515259, "epoch": 0.4858639778568604, "grad_norm": 1.234375, "learning_rate": 0.0004983062614409314, "loss": 5.6924, "mean_token_accuracy": 0.16117836385965348, "num_tokens": 11235022.0, "step": 4915 }, { "entropy": 5.850840520858765, "epoch": 0.4863582443653618, "grad_norm": 1.28125, "learning_rate": 0.0004983019367465064, "loss": 5.7245, "mean_token_accuracy": 0.15540830790996552, "num_tokens": 11247485.0, "step": 4920 }, { "entropy": 5.75506625175476, "epoch": 0.48685251087386316, "grad_norm": 1.2734375, "learning_rate": 0.000498297606558819, "loss": 5.6655, "mean_token_accuracy": 0.1630787342786789, "num_tokens": 11258488.0, "step": 4925 }, { "entropy": 5.736137628555298, "epoch": 0.4873467773823646, "grad_norm": 1.265625, "learning_rate": 0.0004982932708779759, "loss": 5.7167, "mean_token_accuracy": 0.16207361966371536, "num_tokens": 11270786.0, "step": 4930 }, { "entropy": 5.90667872428894, "epoch": 0.48784104389086597, "grad_norm": 1.3359375, "learning_rate": 0.0004982889297040836, "loss": 5.7079, "mean_token_accuracy": 0.15878405645489693, "num_tokens": 11282434.0, "step": 4935 }, { "entropy": 5.791211462020874, "epoch": 0.48833531039936734, "grad_norm": 1.2265625, "learning_rate": 0.0004982845830372491, "loss": 5.694, "mean_token_accuracy": 0.1584634080529213, "num_tokens": 11292406.0, "step": 4940 }, { "entropy": 5.844303798675537, "epoch": 0.4888295769078687, "grad_norm": 1.1953125, "learning_rate": 0.0004982802308775791, "loss": 5.83, "mean_token_accuracy": 0.1521375820040703, "num_tokens": 11304491.0, "step": 4945 }, { "entropy": 5.850516319274902, "epoch": 0.4893238434163701, "grad_norm": 1.3203125, "learning_rate": 0.000498275873225181, "loss": 5.7576, "mean_token_accuracy": 0.159835883975029, "num_tokens": 11317038.0, "step": 4950 }, { "entropy": 5.819036674499512, "epoch": 0.4898181099248715, "grad_norm": 1.4609375, "learning_rate": 0.0004982715100801616, "loss": 5.7688, "mean_token_accuracy": 0.1559791311621666, "num_tokens": 11329354.0, "step": 4955 }, { "entropy": 5.789994812011718, "epoch": 0.4903123764333729, "grad_norm": 1.21875, "learning_rate": 0.0004982671414426285, "loss": 5.735, "mean_token_accuracy": 0.15645507723093033, "num_tokens": 11340508.0, "step": 4960 }, { "entropy": 5.792756795883179, "epoch": 0.49080664294187426, "grad_norm": 1.296875, "learning_rate": 0.0004982627673126889, "loss": 5.7224, "mean_token_accuracy": 0.16280135810375213, "num_tokens": 11352608.0, "step": 4965 }, { "entropy": 5.749039602279663, "epoch": 0.49130090945037563, "grad_norm": 1.34375, "learning_rate": 0.0004982583876904508, "loss": 5.6953, "mean_token_accuracy": 0.16312929540872573, "num_tokens": 11364089.0, "step": 4970 }, { "entropy": 5.7701911449432375, "epoch": 0.491795175958877, "grad_norm": 1.359375, "learning_rate": 0.0004982540025760217, "loss": 5.6459, "mean_token_accuracy": 0.16562199592590332, "num_tokens": 11375521.0, "step": 4975 }, { "entropy": 5.782875490188599, "epoch": 0.49228944246737844, "grad_norm": 1.4453125, "learning_rate": 0.0004982496119695094, "loss": 5.7708, "mean_token_accuracy": 0.1639150306582451, "num_tokens": 11387721.0, "step": 4980 }, { "entropy": 5.809487771987915, "epoch": 0.4927837089758798, "grad_norm": 1.453125, "learning_rate": 0.000498245215871022, "loss": 5.7793, "mean_token_accuracy": 0.15731133073568343, "num_tokens": 11398688.0, "step": 4985 }, { "entropy": 5.778379106521607, "epoch": 0.4932779754843812, "grad_norm": 1.21875, "learning_rate": 0.0004982408142806678, "loss": 5.6689, "mean_token_accuracy": 0.1573247194290161, "num_tokens": 11410420.0, "step": 4990 }, { "entropy": 5.766946649551391, "epoch": 0.49377224199288255, "grad_norm": 1.2265625, "learning_rate": 0.0004982364071985549, "loss": 5.6466, "mean_token_accuracy": 0.16381097137928008, "num_tokens": 11420521.0, "step": 4995 }, { "entropy": 5.80004506111145, "epoch": 0.4942665085013839, "grad_norm": 1.1875, "learning_rate": 0.0004982319946247917, "loss": 5.7457, "mean_token_accuracy": 0.15540773868560792, "num_tokens": 11432550.0, "step": 5000 }, { "entropy": 5.876774835586548, "epoch": 0.49476077500988536, "grad_norm": 1.2265625, "learning_rate": 0.0004982275765594869, "loss": 5.7119, "mean_token_accuracy": 0.15528473407030105, "num_tokens": 11444602.0, "step": 5005 }, { "entropy": 5.723411178588867, "epoch": 0.49525504151838673, "grad_norm": 1.4140625, "learning_rate": 0.0004982231530027489, "loss": 5.5624, "mean_token_accuracy": 0.16830452531576157, "num_tokens": 11456187.0, "step": 5010 }, { "entropy": 5.714942979812622, "epoch": 0.4957493080268881, "grad_norm": 1.28125, "learning_rate": 0.0004982187239546868, "loss": 5.7802, "mean_token_accuracy": 0.15819563418626786, "num_tokens": 11468615.0, "step": 5015 }, { "entropy": 5.8007875919342045, "epoch": 0.4962435745353895, "grad_norm": 1.1875, "learning_rate": 0.0004982142894154095, "loss": 5.6822, "mean_token_accuracy": 0.1621628761291504, "num_tokens": 11480865.0, "step": 5020 }, { "entropy": 5.8547523021698, "epoch": 0.49673784104389085, "grad_norm": 1.3203125, "learning_rate": 0.000498209849385026, "loss": 5.7576, "mean_token_accuracy": 0.1487893909215927, "num_tokens": 11492590.0, "step": 5025 }, { "entropy": 5.832790374755859, "epoch": 0.4972321075523923, "grad_norm": 1.359375, "learning_rate": 0.0004982054038636456, "loss": 5.7379, "mean_token_accuracy": 0.16455563455820083, "num_tokens": 11503481.0, "step": 5030 }, { "entropy": 5.797842264175415, "epoch": 0.49772637406089365, "grad_norm": 1.3359375, "learning_rate": 0.0004982009528513776, "loss": 5.677, "mean_token_accuracy": 0.15781579166650772, "num_tokens": 11515083.0, "step": 5035 }, { "entropy": 5.786930131912231, "epoch": 0.498220640569395, "grad_norm": 1.1796875, "learning_rate": 0.0004981964963483316, "loss": 5.7479, "mean_token_accuracy": 0.15487340539693834, "num_tokens": 11527923.0, "step": 5040 }, { "entropy": 5.790785455703736, "epoch": 0.4987149070778964, "grad_norm": 1.3046875, "learning_rate": 0.0004981920343546171, "loss": 5.767, "mean_token_accuracy": 0.15837057381868364, "num_tokens": 11539456.0, "step": 5045 }, { "entropy": 5.834515476226807, "epoch": 0.49920917358639777, "grad_norm": 1.3359375, "learning_rate": 0.000498187566870344, "loss": 5.6746, "mean_token_accuracy": 0.16797788292169571, "num_tokens": 11550809.0, "step": 5050 }, { "entropy": 5.907103157043457, "epoch": 0.49970344009489914, "grad_norm": 1.4296875, "learning_rate": 0.0004981830938956221, "loss": 5.8069, "mean_token_accuracy": 0.15619237422943116, "num_tokens": 11562545.0, "step": 5055 }, { "entropy": 5.729175996780396, "epoch": 0.5001977066034006, "grad_norm": 1.234375, "learning_rate": 0.0004981786154305615, "loss": 5.6898, "mean_token_accuracy": 0.16165309697389602, "num_tokens": 11574479.0, "step": 5060 }, { "entropy": 5.8273388862609865, "epoch": 0.500691973111902, "grad_norm": 1.5859375, "learning_rate": 0.0004981741314752722, "loss": 5.6308, "mean_token_accuracy": 0.16577657908201218, "num_tokens": 11583942.0, "step": 5065 }, { "entropy": 5.768800449371338, "epoch": 0.5011862396204033, "grad_norm": 1.4140625, "learning_rate": 0.0004981696420298647, "loss": 5.7375, "mean_token_accuracy": 0.15999182015657426, "num_tokens": 11596745.0, "step": 5070 }, { "entropy": 5.69454779624939, "epoch": 0.5016805061289047, "grad_norm": 1.2578125, "learning_rate": 0.0004981651470944495, "loss": 5.6275, "mean_token_accuracy": 0.16875656843185424, "num_tokens": 11608950.0, "step": 5075 }, { "entropy": 5.708047723770141, "epoch": 0.5021747726374061, "grad_norm": 1.265625, "learning_rate": 0.000498160646669137, "loss": 5.7504, "mean_token_accuracy": 0.16267986744642257, "num_tokens": 11619996.0, "step": 5080 }, { "entropy": 5.8013287544250485, "epoch": 0.5026690391459074, "grad_norm": 1.2890625, "learning_rate": 0.0004981561407540379, "loss": 5.6509, "mean_token_accuracy": 0.16587038934230805, "num_tokens": 11632167.0, "step": 5085 }, { "entropy": 5.7611579418182375, "epoch": 0.5031633056544088, "grad_norm": 1.40625, "learning_rate": 0.0004981516293492632, "loss": 5.6612, "mean_token_accuracy": 0.16275765299797057, "num_tokens": 11643722.0, "step": 5090 }, { "entropy": 5.723428201675415, "epoch": 0.5036575721629103, "grad_norm": 1.6171875, "learning_rate": 0.0004981471124549237, "loss": 5.6624, "mean_token_accuracy": 0.1652078226208687, "num_tokens": 11654890.0, "step": 5095 }, { "entropy": 5.806342506408692, "epoch": 0.5041518386714117, "grad_norm": 1.59375, "learning_rate": 0.0004981425900711308, "loss": 5.7349, "mean_token_accuracy": 0.15667447149753572, "num_tokens": 11665485.0, "step": 5100 }, { "entropy": 5.781207275390625, "epoch": 0.504646105179913, "grad_norm": 1.2578125, "learning_rate": 0.0004981380621979954, "loss": 5.6345, "mean_token_accuracy": 0.1660120278596878, "num_tokens": 11676145.0, "step": 5105 }, { "entropy": 5.761055755615234, "epoch": 0.5051403716884144, "grad_norm": 1.390625, "learning_rate": 0.0004981335288356291, "loss": 5.6519, "mean_token_accuracy": 0.15547278001904488, "num_tokens": 11687777.0, "step": 5110 }, { "entropy": 5.841087675094604, "epoch": 0.5056346381969158, "grad_norm": 1.46875, "learning_rate": 0.0004981289899841434, "loss": 5.6841, "mean_token_accuracy": 0.1652728870511055, "num_tokens": 11699703.0, "step": 5115 }, { "entropy": 5.83178071975708, "epoch": 0.5061289047054172, "grad_norm": 1.3046875, "learning_rate": 0.0004981244456436499, "loss": 5.7897, "mean_token_accuracy": 0.14936670213937758, "num_tokens": 11711632.0, "step": 5120 }, { "entropy": 5.860979509353638, "epoch": 0.5066231712139185, "grad_norm": 1.2890625, "learning_rate": 0.0004981198958142604, "loss": 5.7706, "mean_token_accuracy": 0.15854335874319075, "num_tokens": 11723763.0, "step": 5125 }, { "entropy": 5.8356544971466064, "epoch": 0.5071174377224199, "grad_norm": 1.21875, "learning_rate": 0.0004981153404960869, "loss": 5.7765, "mean_token_accuracy": 0.15582619458436966, "num_tokens": 11736061.0, "step": 5130 }, { "entropy": 5.736947250366211, "epoch": 0.5076117042309213, "grad_norm": 1.53125, "learning_rate": 0.0004981107796892414, "loss": 5.7768, "mean_token_accuracy": 0.16211810559034348, "num_tokens": 11749342.0, "step": 5135 }, { "entropy": 5.870418214797974, "epoch": 0.5081059707394227, "grad_norm": 1.4453125, "learning_rate": 0.0004981062133938361, "loss": 5.7008, "mean_token_accuracy": 0.16118012517690658, "num_tokens": 11760441.0, "step": 5140 }, { "entropy": 5.736885452270508, "epoch": 0.508600237247924, "grad_norm": 1.2578125, "learning_rate": 0.0004981016416099834, "loss": 5.617, "mean_token_accuracy": 0.16642038524150848, "num_tokens": 11772191.0, "step": 5145 }, { "entropy": 5.8572736263275145, "epoch": 0.5090945037564255, "grad_norm": 1.25, "learning_rate": 0.0004980970643377956, "loss": 5.8781, "mean_token_accuracy": 0.14796603471040726, "num_tokens": 11786347.0, "step": 5150 }, { "entropy": 5.814970922470093, "epoch": 0.5095887702649269, "grad_norm": 1.3515625, "learning_rate": 0.0004980924815773855, "loss": 5.6264, "mean_token_accuracy": 0.16511821299791335, "num_tokens": 11797741.0, "step": 5155 }, { "entropy": 5.809056663513184, "epoch": 0.5100830367734283, "grad_norm": 1.296875, "learning_rate": 0.0004980878933288657, "loss": 5.7587, "mean_token_accuracy": 0.15323774218559266, "num_tokens": 11809728.0, "step": 5160 }, { "entropy": 5.859042739868164, "epoch": 0.5105773032819296, "grad_norm": 1.2109375, "learning_rate": 0.000498083299592349, "loss": 5.7098, "mean_token_accuracy": 0.1520225413143635, "num_tokens": 11822000.0, "step": 5165 }, { "entropy": 5.8006284713745115, "epoch": 0.511071569790431, "grad_norm": 1.7109375, "learning_rate": 0.0004980787003679486, "loss": 5.7056, "mean_token_accuracy": 0.15795185714960097, "num_tokens": 11834059.0, "step": 5170 }, { "entropy": 5.692893600463867, "epoch": 0.5115658362989324, "grad_norm": 1.4921875, "learning_rate": 0.0004980740956557776, "loss": 5.5905, "mean_token_accuracy": 0.1717328056693077, "num_tokens": 11844001.0, "step": 5175 }, { "entropy": 5.73483099937439, "epoch": 0.5120601028074337, "grad_norm": 1.3125, "learning_rate": 0.0004980694854559493, "loss": 5.7625, "mean_token_accuracy": 0.16032130271196365, "num_tokens": 11855991.0, "step": 5180 }, { "entropy": 5.868142175674438, "epoch": 0.5125543693159351, "grad_norm": 1.25, "learning_rate": 0.000498064869768577, "loss": 5.7355, "mean_token_accuracy": 0.1608465313911438, "num_tokens": 11867975.0, "step": 5185 }, { "entropy": 5.761822128295899, "epoch": 0.5130486358244365, "grad_norm": 1.25, "learning_rate": 0.0004980602485937743, "loss": 5.6842, "mean_token_accuracy": 0.1614299662411213, "num_tokens": 11880034.0, "step": 5190 }, { "entropy": 5.815242528915405, "epoch": 0.5135429023329379, "grad_norm": 2.03125, "learning_rate": 0.0004980556219316549, "loss": 5.7557, "mean_token_accuracy": 0.1584977239370346, "num_tokens": 11891490.0, "step": 5195 }, { "entropy": 5.83032603263855, "epoch": 0.5140371688414394, "grad_norm": 1.2578125, "learning_rate": 0.0004980509897823326, "loss": 5.6579, "mean_token_accuracy": 0.16577705144882202, "num_tokens": 11902988.0, "step": 5200 }, { "entropy": 5.741867351531982, "epoch": 0.5145314353499407, "grad_norm": 1.546875, "learning_rate": 0.0004980463521459212, "loss": 5.7216, "mean_token_accuracy": 0.16082934737205506, "num_tokens": 11915088.0, "step": 5205 }, { "entropy": 5.786735105514526, "epoch": 0.5150257018584421, "grad_norm": 1.6875, "learning_rate": 0.0004980417090225351, "loss": 5.7334, "mean_token_accuracy": 0.16337004601955413, "num_tokens": 11926789.0, "step": 5210 }, { "entropy": 5.9148640632629395, "epoch": 0.5155199683669435, "grad_norm": 1.4296875, "learning_rate": 0.0004980370604122883, "loss": 5.7611, "mean_token_accuracy": 0.15934159755706787, "num_tokens": 11938876.0, "step": 5215 }, { "entropy": 5.8335541725158695, "epoch": 0.5160142348754448, "grad_norm": 1.7578125, "learning_rate": 0.0004980324063152952, "loss": 5.7172, "mean_token_accuracy": 0.16266890615224838, "num_tokens": 11950099.0, "step": 5220 }, { "entropy": 5.842185688018799, "epoch": 0.5165085013839462, "grad_norm": 1.2890625, "learning_rate": 0.0004980277467316704, "loss": 5.7757, "mean_token_accuracy": 0.15510211884975433, "num_tokens": 11962585.0, "step": 5225 }, { "entropy": 5.820865440368652, "epoch": 0.5170027678924476, "grad_norm": 1.703125, "learning_rate": 0.0004980230816615282, "loss": 5.7006, "mean_token_accuracy": 0.16341910213232042, "num_tokens": 11972579.0, "step": 5230 }, { "entropy": 5.80379729270935, "epoch": 0.517497034400949, "grad_norm": 1.3828125, "learning_rate": 0.0004980184111049837, "loss": 5.6335, "mean_token_accuracy": 0.16957199275493623, "num_tokens": 11983337.0, "step": 5235 }, { "entropy": 5.778374338150025, "epoch": 0.5179913009094503, "grad_norm": 1.2890625, "learning_rate": 0.0004980137350621518, "loss": 5.7555, "mean_token_accuracy": 0.1562938116490841, "num_tokens": 11995086.0, "step": 5240 }, { "entropy": 5.847301006317139, "epoch": 0.5184855674179517, "grad_norm": 1.234375, "learning_rate": 0.0004980090535331473, "loss": 5.7757, "mean_token_accuracy": 0.1603434130549431, "num_tokens": 12007814.0, "step": 5245 }, { "entropy": 5.7690938949584964, "epoch": 0.5189798339264532, "grad_norm": 1.1953125, "learning_rate": 0.0004980043665180857, "loss": 5.6201, "mean_token_accuracy": 0.16814614981412887, "num_tokens": 12020714.0, "step": 5250 }, { "entropy": 5.707731676101685, "epoch": 0.5194741004349546, "grad_norm": 1.5, "learning_rate": 0.0004979996740170819, "loss": 5.6433, "mean_token_accuracy": 0.1608419969677925, "num_tokens": 12031994.0, "step": 5255 }, { "entropy": 5.841365575790405, "epoch": 0.5199683669434559, "grad_norm": 1.2578125, "learning_rate": 0.0004979949760302515, "loss": 5.682, "mean_token_accuracy": 0.15966767072677612, "num_tokens": 12042887.0, "step": 5260 }, { "entropy": 5.849974203109741, "epoch": 0.5204626334519573, "grad_norm": 1.3515625, "learning_rate": 0.0004979902725577101, "loss": 5.735, "mean_token_accuracy": 0.15892827957868577, "num_tokens": 12054426.0, "step": 5265 }, { "entropy": 5.810884571075439, "epoch": 0.5209568999604587, "grad_norm": 1.234375, "learning_rate": 0.0004979855635995735, "loss": 5.7355, "mean_token_accuracy": 0.15427639484405517, "num_tokens": 12066360.0, "step": 5270 }, { "entropy": 5.898036861419678, "epoch": 0.5214511664689601, "grad_norm": 1.5625, "learning_rate": 0.0004979808491559573, "loss": 5.7527, "mean_token_accuracy": 0.15606434941291808, "num_tokens": 12076651.0, "step": 5275 }, { "entropy": 5.781798648834228, "epoch": 0.5219454329774614, "grad_norm": 1.9140625, "learning_rate": 0.0004979761292269778, "loss": 5.6263, "mean_token_accuracy": 0.16331419348716736, "num_tokens": 12087522.0, "step": 5280 }, { "entropy": 5.740968227386475, "epoch": 0.5224396994859628, "grad_norm": 1.375, "learning_rate": 0.0004979714038127508, "loss": 5.7151, "mean_token_accuracy": 0.15970026403665544, "num_tokens": 12097999.0, "step": 5285 }, { "entropy": 5.736458444595337, "epoch": 0.5229339659944642, "grad_norm": 1.7421875, "learning_rate": 0.0004979666729133927, "loss": 5.6423, "mean_token_accuracy": 0.15874699205160142, "num_tokens": 12108080.0, "step": 5290 }, { "entropy": 5.913213014602661, "epoch": 0.5234282325029656, "grad_norm": 1.28125, "learning_rate": 0.0004979619365290199, "loss": 5.8909, "mean_token_accuracy": 0.1450125604867935, "num_tokens": 12122705.0, "step": 5295 }, { "entropy": 5.923708438873291, "epoch": 0.523922499011467, "grad_norm": 1.4140625, "learning_rate": 0.0004979571946597488, "loss": 5.7064, "mean_token_accuracy": 0.1583932265639305, "num_tokens": 12134000.0, "step": 5300 }, { "entropy": 5.741547060012818, "epoch": 0.5244167655199684, "grad_norm": 1.4765625, "learning_rate": 0.0004979524473056961, "loss": 5.7182, "mean_token_accuracy": 0.1550974190235138, "num_tokens": 12144825.0, "step": 5305 }, { "entropy": 5.817003345489502, "epoch": 0.5249110320284698, "grad_norm": 1.53125, "learning_rate": 0.0004979476944669787, "loss": 5.8085, "mean_token_accuracy": 0.15489696711301804, "num_tokens": 12156590.0, "step": 5310 }, { "entropy": 5.874768495559692, "epoch": 0.5254052985369712, "grad_norm": 1.4609375, "learning_rate": 0.0004979429361437134, "loss": 5.6488, "mean_token_accuracy": 0.16562367230653763, "num_tokens": 12167478.0, "step": 5315 }, { "entropy": 5.818252611160278, "epoch": 0.5258995650454725, "grad_norm": 1.4765625, "learning_rate": 0.0004979381723360173, "loss": 5.6482, "mean_token_accuracy": 0.16822979003190994, "num_tokens": 12178728.0, "step": 5320 }, { "entropy": 5.6653368949890135, "epoch": 0.5263938315539739, "grad_norm": 1.21875, "learning_rate": 0.0004979334030440076, "loss": 5.6163, "mean_token_accuracy": 0.15801714062690736, "num_tokens": 12190061.0, "step": 5325 }, { "entropy": 5.708331680297851, "epoch": 0.5268880980624753, "grad_norm": 1.578125, "learning_rate": 0.0004979286282678015, "loss": 5.7284, "mean_token_accuracy": 0.1623130276799202, "num_tokens": 12200867.0, "step": 5330 }, { "entropy": 5.832484483718872, "epoch": 0.5273823645709766, "grad_norm": 1.3359375, "learning_rate": 0.0004979238480075166, "loss": 5.6842, "mean_token_accuracy": 0.16192447394132614, "num_tokens": 12212681.0, "step": 5335 }, { "entropy": 5.8057342052459715, "epoch": 0.527876631079478, "grad_norm": 1.5078125, "learning_rate": 0.0004979190622632705, "loss": 5.727, "mean_token_accuracy": 0.16040914058685302, "num_tokens": 12224279.0, "step": 5340 }, { "entropy": 5.689106702804565, "epoch": 0.5283708975879794, "grad_norm": 1.21875, "learning_rate": 0.0004979142710351809, "loss": 5.5774, "mean_token_accuracy": 0.17663966119289398, "num_tokens": 12235754.0, "step": 5345 }, { "entropy": 5.832288217544556, "epoch": 0.5288651640964809, "grad_norm": 1.359375, "learning_rate": 0.0004979094743233656, "loss": 5.706, "mean_token_accuracy": 0.16103370785713195, "num_tokens": 12246014.0, "step": 5350 }, { "entropy": 5.761579513549805, "epoch": 0.5293594306049823, "grad_norm": 1.3828125, "learning_rate": 0.0004979046721279426, "loss": 5.6665, "mean_token_accuracy": 0.16219642460346223, "num_tokens": 12257519.0, "step": 5355 }, { "entropy": 5.7685311794281, "epoch": 0.5298536971134836, "grad_norm": 1.7890625, "learning_rate": 0.0004978998644490302, "loss": 5.7177, "mean_token_accuracy": 0.15667742639780044, "num_tokens": 12269806.0, "step": 5360 }, { "entropy": 5.7736852169036865, "epoch": 0.530347963621985, "grad_norm": 1.421875, "learning_rate": 0.0004978950512867465, "loss": 5.7213, "mean_token_accuracy": 0.15609590262174605, "num_tokens": 12281612.0, "step": 5365 }, { "entropy": 5.835879468917847, "epoch": 0.5308422301304864, "grad_norm": 1.3359375, "learning_rate": 0.0004978902326412099, "loss": 5.6872, "mean_token_accuracy": 0.159187912940979, "num_tokens": 12293022.0, "step": 5370 }, { "entropy": 5.790759038925171, "epoch": 0.5313364966389877, "grad_norm": 1.2578125, "learning_rate": 0.000497885408512539, "loss": 5.6714, "mean_token_accuracy": 0.16126388013362886, "num_tokens": 12304414.0, "step": 5375 }, { "entropy": 5.893075704574585, "epoch": 0.5318307631474891, "grad_norm": 1.703125, "learning_rate": 0.0004978805789008526, "loss": 5.8077, "mean_token_accuracy": 0.15097813457250595, "num_tokens": 12315618.0, "step": 5380 }, { "entropy": 5.829635524749756, "epoch": 0.5323250296559905, "grad_norm": 1.4140625, "learning_rate": 0.0004978757438062692, "loss": 5.6497, "mean_token_accuracy": 0.16604820936918258, "num_tokens": 12328026.0, "step": 5385 }, { "entropy": 5.793191528320312, "epoch": 0.5328192961644919, "grad_norm": 1.2734375, "learning_rate": 0.0004978709032289081, "loss": 5.7214, "mean_token_accuracy": 0.1559169754385948, "num_tokens": 12339441.0, "step": 5390 }, { "entropy": 5.85589632987976, "epoch": 0.5333135626729932, "grad_norm": 1.4453125, "learning_rate": 0.0004978660571688881, "loss": 5.7425, "mean_token_accuracy": 0.15749634355306624, "num_tokens": 12351005.0, "step": 5395 }, { "entropy": 5.811450242996216, "epoch": 0.5338078291814946, "grad_norm": 1.4765625, "learning_rate": 0.0004978612056263286, "loss": 5.7471, "mean_token_accuracy": 0.16507457196712494, "num_tokens": 12363147.0, "step": 5400 }, { "entropy": 5.825579690933227, "epoch": 0.5343020956899961, "grad_norm": 1.5546875, "learning_rate": 0.0004978563486013488, "loss": 5.6776, "mean_token_accuracy": 0.16178106069564818, "num_tokens": 12373446.0, "step": 5405 }, { "entropy": 5.7309596061706545, "epoch": 0.5347963621984975, "grad_norm": 1.3671875, "learning_rate": 0.0004978514860940683, "loss": 5.6618, "mean_token_accuracy": 0.16514517068862916, "num_tokens": 12384591.0, "step": 5410 }, { "entropy": 5.761965560913086, "epoch": 0.5352906287069988, "grad_norm": 1.5, "learning_rate": 0.0004978466181046067, "loss": 5.6196, "mean_token_accuracy": 0.16532472819089888, "num_tokens": 12396117.0, "step": 5415 }, { "entropy": 5.76508355140686, "epoch": 0.5357848952155002, "grad_norm": 1.3515625, "learning_rate": 0.0004978417446330837, "loss": 5.6999, "mean_token_accuracy": 0.16554254442453384, "num_tokens": 12407400.0, "step": 5420 }, { "entropy": 5.7422675609588625, "epoch": 0.5362791617240016, "grad_norm": 1.890625, "learning_rate": 0.0004978368656796191, "loss": 5.6184, "mean_token_accuracy": 0.16983277797698976, "num_tokens": 12417629.0, "step": 5425 }, { "entropy": 5.7121666431427, "epoch": 0.536773428232503, "grad_norm": 2.171875, "learning_rate": 0.0004978319812443331, "loss": 5.6461, "mean_token_accuracy": 0.1678358569741249, "num_tokens": 12428522.0, "step": 5430 }, { "entropy": 5.803666687011718, "epoch": 0.5372676947410043, "grad_norm": 1.703125, "learning_rate": 0.0004978270913273458, "loss": 5.7394, "mean_token_accuracy": 0.15472337305545808, "num_tokens": 12440390.0, "step": 5435 }, { "entropy": 5.783153104782104, "epoch": 0.5377619612495057, "grad_norm": 1.4375, "learning_rate": 0.0004978221959287775, "loss": 5.6473, "mean_token_accuracy": 0.16296303272247314, "num_tokens": 12451846.0, "step": 5440 }, { "entropy": 5.743931531906128, "epoch": 0.5382562277580071, "grad_norm": 1.5625, "learning_rate": 0.0004978172950487486, "loss": 5.6829, "mean_token_accuracy": 0.16433457732200624, "num_tokens": 12462051.0, "step": 5445 }, { "entropy": 5.716442108154297, "epoch": 0.5387504942665085, "grad_norm": 1.484375, "learning_rate": 0.0004978123886873797, "loss": 5.6008, "mean_token_accuracy": 0.17102793008089065, "num_tokens": 12472730.0, "step": 5450 }, { "entropy": 5.751273155212402, "epoch": 0.5392447607750099, "grad_norm": 1.5859375, "learning_rate": 0.0004978074768447915, "loss": 5.6123, "mean_token_accuracy": 0.17399577647447587, "num_tokens": 12482719.0, "step": 5455 }, { "entropy": 5.761351537704468, "epoch": 0.5397390272835113, "grad_norm": 1.578125, "learning_rate": 0.0004978025595211048, "loss": 5.6517, "mean_token_accuracy": 0.16074512004852295, "num_tokens": 12492659.0, "step": 5460 }, { "entropy": 5.882458209991455, "epoch": 0.5402332937920127, "grad_norm": 1.375, "learning_rate": 0.0004977976367164404, "loss": 5.7174, "mean_token_accuracy": 0.16112817525863649, "num_tokens": 12504381.0, "step": 5465 }, { "entropy": 5.807905769348144, "epoch": 0.540727560300514, "grad_norm": 1.421875, "learning_rate": 0.0004977927084309198, "loss": 5.5634, "mean_token_accuracy": 0.17260986417531968, "num_tokens": 12515041.0, "step": 5470 }, { "entropy": 5.804184818267823, "epoch": 0.5412218268090154, "grad_norm": 1.890625, "learning_rate": 0.0004977877746646639, "loss": 5.7184, "mean_token_accuracy": 0.15993063598871232, "num_tokens": 12526313.0, "step": 5475 }, { "entropy": 5.80208010673523, "epoch": 0.5417160933175168, "grad_norm": 1.4453125, "learning_rate": 0.0004977828354177941, "loss": 5.807, "mean_token_accuracy": 0.14883915781974794, "num_tokens": 12538268.0, "step": 5480 }, { "entropy": 5.808342599868775, "epoch": 0.5422103598260182, "grad_norm": 1.3515625, "learning_rate": 0.0004977778906904321, "loss": 5.7029, "mean_token_accuracy": 0.1601228341460228, "num_tokens": 12548365.0, "step": 5485 }, { "entropy": 5.879845809936524, "epoch": 0.5427046263345195, "grad_norm": 1.3203125, "learning_rate": 0.0004977729404826995, "loss": 5.8156, "mean_token_accuracy": 0.14491160213947296, "num_tokens": 12560652.0, "step": 5490 }, { "entropy": 5.794532537460327, "epoch": 0.5431988928430209, "grad_norm": 1.65625, "learning_rate": 0.0004977679847947179, "loss": 5.6637, "mean_token_accuracy": 0.16358893662691115, "num_tokens": 12572079.0, "step": 5495 }, { "entropy": 5.745615434646607, "epoch": 0.5436931593515223, "grad_norm": 1.359375, "learning_rate": 0.0004977630236266093, "loss": 5.5743, "mean_token_accuracy": 0.16720821112394332, "num_tokens": 12582601.0, "step": 5500 }, { "entropy": 5.836099672317505, "epoch": 0.5441874258600238, "grad_norm": 1.5625, "learning_rate": 0.0004977580569784958, "loss": 5.7246, "mean_token_accuracy": 0.15426233559846877, "num_tokens": 12595176.0, "step": 5505 }, { "entropy": 5.81144642829895, "epoch": 0.5446816923685251, "grad_norm": 1.484375, "learning_rate": 0.0004977530848504994, "loss": 5.7258, "mean_token_accuracy": 0.15800877958536147, "num_tokens": 12608161.0, "step": 5510 }, { "entropy": 5.777765703201294, "epoch": 0.5451759588770265, "grad_norm": 1.46875, "learning_rate": 0.0004977481072427427, "loss": 5.7436, "mean_token_accuracy": 0.15919482260942458, "num_tokens": 12620109.0, "step": 5515 }, { "entropy": 5.854056882858276, "epoch": 0.5456702253855279, "grad_norm": 1.640625, "learning_rate": 0.000497743124155348, "loss": 5.7314, "mean_token_accuracy": 0.15875154584646226, "num_tokens": 12630339.0, "step": 5520 }, { "entropy": 5.824705743789673, "epoch": 0.5461644918940293, "grad_norm": 1.6328125, "learning_rate": 0.0004977381355884379, "loss": 5.7727, "mean_token_accuracy": 0.16132542490959167, "num_tokens": 12642101.0, "step": 5525 }, { "entropy": 5.889630699157715, "epoch": 0.5466587584025306, "grad_norm": 1.28125, "learning_rate": 0.0004977331415421351, "loss": 5.8264, "mean_token_accuracy": 0.14514302015304564, "num_tokens": 12655436.0, "step": 5530 }, { "entropy": 5.740127992630005, "epoch": 0.547153024911032, "grad_norm": 1.3515625, "learning_rate": 0.0004977281420165624, "loss": 5.5126, "mean_token_accuracy": 0.1704614356160164, "num_tokens": 12667100.0, "step": 5535 }, { "entropy": 5.814797306060791, "epoch": 0.5476472914195334, "grad_norm": 1.2734375, "learning_rate": 0.000497723137011843, "loss": 5.7994, "mean_token_accuracy": 0.15522741228342057, "num_tokens": 12678788.0, "step": 5540 }, { "entropy": 5.793706703186035, "epoch": 0.5481415579280348, "grad_norm": 1.3203125, "learning_rate": 0.0004977181265280997, "loss": 5.6823, "mean_token_accuracy": 0.16902316808700563, "num_tokens": 12690980.0, "step": 5545 }, { "entropy": 5.889812088012695, "epoch": 0.5486358244365361, "grad_norm": 1.453125, "learning_rate": 0.000497713110565456, "loss": 5.7941, "mean_token_accuracy": 0.15406299531459808, "num_tokens": 12702642.0, "step": 5550 }, { "entropy": 5.710815286636352, "epoch": 0.5491300909450376, "grad_norm": 1.3515625, "learning_rate": 0.0004977080891240352, "loss": 5.5668, "mean_token_accuracy": 0.17032462358474731, "num_tokens": 12712750.0, "step": 5555 }, { "entropy": 5.71341609954834, "epoch": 0.549624357453539, "grad_norm": 1.4296875, "learning_rate": 0.000497703062203961, "loss": 5.5853, "mean_token_accuracy": 0.16658094078302382, "num_tokens": 12724464.0, "step": 5560 }, { "entropy": 5.749512577056885, "epoch": 0.5501186239620404, "grad_norm": 1.328125, "learning_rate": 0.0004976980298053567, "loss": 5.6705, "mean_token_accuracy": 0.1623353898525238, "num_tokens": 12735419.0, "step": 5565 }, { "entropy": 5.863523006439209, "epoch": 0.5506128904705417, "grad_norm": 1.1953125, "learning_rate": 0.0004976929919283465, "loss": 5.6631, "mean_token_accuracy": 0.16216106861829757, "num_tokens": 12746279.0, "step": 5570 }, { "entropy": 5.748651504516602, "epoch": 0.5511071569790431, "grad_norm": 1.5859375, "learning_rate": 0.0004976879485730541, "loss": 5.7698, "mean_token_accuracy": 0.15983541011810304, "num_tokens": 12758107.0, "step": 5575 }, { "entropy": 5.745821332931518, "epoch": 0.5516014234875445, "grad_norm": 1.4296875, "learning_rate": 0.0004976828997396036, "loss": 5.6676, "mean_token_accuracy": 0.17020906507968903, "num_tokens": 12769354.0, "step": 5580 }, { "entropy": 5.821145534515381, "epoch": 0.5520956899960459, "grad_norm": 1.515625, "learning_rate": 0.0004976778454281193, "loss": 5.6384, "mean_token_accuracy": 0.1623901054263115, "num_tokens": 12780926.0, "step": 5585 }, { "entropy": 5.810956811904907, "epoch": 0.5525899565045472, "grad_norm": 1.5, "learning_rate": 0.0004976727856387253, "loss": 5.6478, "mean_token_accuracy": 0.15976598411798476, "num_tokens": 12792423.0, "step": 5590 }, { "entropy": 5.711795043945313, "epoch": 0.5530842230130486, "grad_norm": 1.515625, "learning_rate": 0.0004976677203715464, "loss": 5.5853, "mean_token_accuracy": 0.17233408838510514, "num_tokens": 12803688.0, "step": 5595 }, { "entropy": 5.709937620162964, "epoch": 0.55357848952155, "grad_norm": 1.5546875, "learning_rate": 0.000497662649626707, "loss": 5.5821, "mean_token_accuracy": 0.16821181625127793, "num_tokens": 12814617.0, "step": 5600 }, { "entropy": 5.731007671356201, "epoch": 0.5540727560300513, "grad_norm": 1.5546875, "learning_rate": 0.0004976575734043318, "loss": 5.6118, "mean_token_accuracy": 0.16292986273765564, "num_tokens": 12826027.0, "step": 5605 }, { "entropy": 5.753634214401245, "epoch": 0.5545670225385528, "grad_norm": 1.359375, "learning_rate": 0.0004976524917045457, "loss": 5.7005, "mean_token_accuracy": 0.15490526854991912, "num_tokens": 12837454.0, "step": 5610 }, { "entropy": 5.759040403366089, "epoch": 0.5550612890470542, "grad_norm": 1.640625, "learning_rate": 0.000497647404527474, "loss": 5.597, "mean_token_accuracy": 0.16277759820222854, "num_tokens": 12848550.0, "step": 5615 }, { "entropy": 5.775821399688721, "epoch": 0.5555555555555556, "grad_norm": 1.2890625, "learning_rate": 0.0004976423118732413, "loss": 5.6663, "mean_token_accuracy": 0.16614630222320556, "num_tokens": 12858270.0, "step": 5620 }, { "entropy": 5.715994215011596, "epoch": 0.556049822064057, "grad_norm": 1.4765625, "learning_rate": 0.0004976372137419733, "loss": 5.6312, "mean_token_accuracy": 0.16284454464912415, "num_tokens": 12869507.0, "step": 5625 }, { "entropy": 5.775624847412109, "epoch": 0.5565440885725583, "grad_norm": 1.6640625, "learning_rate": 0.0004976321101337954, "loss": 5.5959, "mean_token_accuracy": 0.16878042072057725, "num_tokens": 12880097.0, "step": 5630 }, { "entropy": 5.714468574523925, "epoch": 0.5570383550810597, "grad_norm": 1.390625, "learning_rate": 0.000497627001048833, "loss": 5.5886, "mean_token_accuracy": 0.1684863582253456, "num_tokens": 12891302.0, "step": 5635 }, { "entropy": 5.662768936157226, "epoch": 0.5575326215895611, "grad_norm": 1.796875, "learning_rate": 0.0004976218864872118, "loss": 5.6089, "mean_token_accuracy": 0.17541296780109406, "num_tokens": 12903950.0, "step": 5640 }, { "entropy": 5.763148927688599, "epoch": 0.5580268880980624, "grad_norm": 1.4140625, "learning_rate": 0.0004976167664490576, "loss": 5.6523, "mean_token_accuracy": 0.16255742013454438, "num_tokens": 12915713.0, "step": 5645 }, { "entropy": 5.76856484413147, "epoch": 0.5585211546065638, "grad_norm": 1.34375, "learning_rate": 0.0004976116409344966, "loss": 5.6154, "mean_token_accuracy": 0.16408945620059967, "num_tokens": 12926655.0, "step": 5650 }, { "entropy": 5.692210292816162, "epoch": 0.5590154211150652, "grad_norm": 1.28125, "learning_rate": 0.0004976065099436546, "loss": 5.6092, "mean_token_accuracy": 0.16390977948904037, "num_tokens": 12938144.0, "step": 5655 }, { "entropy": 5.833284473419189, "epoch": 0.5595096876235667, "grad_norm": 1.484375, "learning_rate": 0.0004976013734766579, "loss": 5.7924, "mean_token_accuracy": 0.15775922387838365, "num_tokens": 12950486.0, "step": 5660 }, { "entropy": 5.755685710906983, "epoch": 0.560003954132068, "grad_norm": 1.71875, "learning_rate": 0.000497596231533633, "loss": 5.5279, "mean_token_accuracy": 0.1694363996386528, "num_tokens": 12960966.0, "step": 5665 }, { "entropy": 5.704496192932129, "epoch": 0.5604982206405694, "grad_norm": 1.65625, "learning_rate": 0.000497591084114706, "loss": 5.6336, "mean_token_accuracy": 0.16190723776817323, "num_tokens": 12971960.0, "step": 5670 }, { "entropy": 5.789654350280761, "epoch": 0.5609924871490708, "grad_norm": 1.6875, "learning_rate": 0.000497585931220004, "loss": 5.7266, "mean_token_accuracy": 0.16142417639493942, "num_tokens": 12984186.0, "step": 5675 }, { "entropy": 5.7306139945983885, "epoch": 0.5614867536575722, "grad_norm": 1.84375, "learning_rate": 0.0004975807728496535, "loss": 5.562, "mean_token_accuracy": 0.17325062155723572, "num_tokens": 12994205.0, "step": 5680 }, { "entropy": 5.799353694915771, "epoch": 0.5619810201660735, "grad_norm": 1.6640625, "learning_rate": 0.0004975756090037815, "loss": 5.6845, "mean_token_accuracy": 0.16368188560009003, "num_tokens": 13006143.0, "step": 5685 }, { "entropy": 5.88020429611206, "epoch": 0.5624752866745749, "grad_norm": 1.4140625, "learning_rate": 0.000497570439682515, "loss": 5.7204, "mean_token_accuracy": 0.16078546196222304, "num_tokens": 13017849.0, "step": 5690 }, { "entropy": 5.665234613418579, "epoch": 0.5629695531830763, "grad_norm": 1.3515625, "learning_rate": 0.000497565264885981, "loss": 5.5975, "mean_token_accuracy": 0.1682819738984108, "num_tokens": 13030301.0, "step": 5695 }, { "entropy": 5.71648907661438, "epoch": 0.5634638196915777, "grad_norm": 1.6015625, "learning_rate": 0.0004975600846143072, "loss": 5.6572, "mean_token_accuracy": 0.16545034497976302, "num_tokens": 13040229.0, "step": 5700 }, { "entropy": 5.736776065826416, "epoch": 0.563958086200079, "grad_norm": 1.40625, "learning_rate": 0.0004975548988676206, "loss": 5.592, "mean_token_accuracy": 0.16608160734176636, "num_tokens": 13050752.0, "step": 5705 }, { "entropy": 5.809312772750855, "epoch": 0.5644523527085805, "grad_norm": 1.5078125, "learning_rate": 0.0004975497076460491, "loss": 5.7965, "mean_token_accuracy": 0.15191729068756105, "num_tokens": 13062003.0, "step": 5710 }, { "entropy": 5.793465518951416, "epoch": 0.5649466192170819, "grad_norm": 1.46875, "learning_rate": 0.0004975445109497202, "loss": 5.708, "mean_token_accuracy": 0.1548692211508751, "num_tokens": 13073746.0, "step": 5715 }, { "entropy": 5.859099817276001, "epoch": 0.5654408857255833, "grad_norm": 1.3984375, "learning_rate": 0.0004975393087787617, "loss": 5.7765, "mean_token_accuracy": 0.15511635392904283, "num_tokens": 13086068.0, "step": 5720 }, { "entropy": 5.81207914352417, "epoch": 0.5659351522340846, "grad_norm": 1.453125, "learning_rate": 0.0004975341011333019, "loss": 5.6729, "mean_token_accuracy": 0.16146194487810134, "num_tokens": 13097078.0, "step": 5725 }, { "entropy": 5.746955919265747, "epoch": 0.566429418742586, "grad_norm": 1.40625, "learning_rate": 0.0004975288880134685, "loss": 5.6566, "mean_token_accuracy": 0.16354386880993843, "num_tokens": 13108450.0, "step": 5730 }, { "entropy": 5.790970754623413, "epoch": 0.5669236852510874, "grad_norm": 1.4375, "learning_rate": 0.0004975236694193901, "loss": 5.7057, "mean_token_accuracy": 0.15594887360930443, "num_tokens": 13120216.0, "step": 5735 }, { "entropy": 5.838050889968872, "epoch": 0.5674179517595888, "grad_norm": 1.390625, "learning_rate": 0.0004975184453511948, "loss": 5.6929, "mean_token_accuracy": 0.15619661808013915, "num_tokens": 13131214.0, "step": 5740 }, { "entropy": 5.817377376556396, "epoch": 0.5679122182680901, "grad_norm": 1.3828125, "learning_rate": 0.0004975132158090112, "loss": 5.7391, "mean_token_accuracy": 0.15629347264766694, "num_tokens": 13143792.0, "step": 5745 }, { "entropy": 5.72936897277832, "epoch": 0.5684064847765915, "grad_norm": 2.78125, "learning_rate": 0.000497507980792968, "loss": 5.7115, "mean_token_accuracy": 0.15781604796648024, "num_tokens": 13156022.0, "step": 5750 }, { "entropy": 5.779087352752685, "epoch": 0.5689007512850929, "grad_norm": 1.5703125, "learning_rate": 0.000497502740303194, "loss": 5.657, "mean_token_accuracy": 0.16479096114635466, "num_tokens": 13167374.0, "step": 5755 }, { "entropy": 5.718874120712281, "epoch": 0.5693950177935944, "grad_norm": 1.6640625, "learning_rate": 0.000497497494339818, "loss": 5.5917, "mean_token_accuracy": 0.17131200879812242, "num_tokens": 13177662.0, "step": 5760 }, { "entropy": 5.713671731948852, "epoch": 0.5698892843020957, "grad_norm": 1.4453125, "learning_rate": 0.0004974922429029692, "loss": 5.6569, "mean_token_accuracy": 0.16335739940404892, "num_tokens": 13188375.0, "step": 5765 }, { "entropy": 5.797548484802246, "epoch": 0.5703835508105971, "grad_norm": 1.5546875, "learning_rate": 0.0004974869859927767, "loss": 5.5823, "mean_token_accuracy": 0.16842106431722642, "num_tokens": 13198988.0, "step": 5770 }, { "entropy": 5.837228012084961, "epoch": 0.5708778173190985, "grad_norm": 1.3671875, "learning_rate": 0.0004974817236093697, "loss": 5.6669, "mean_token_accuracy": 0.15082263350486755, "num_tokens": 13210699.0, "step": 5775 }, { "entropy": 5.689919376373291, "epoch": 0.5713720838275999, "grad_norm": 1.34375, "learning_rate": 0.0004974764557528779, "loss": 5.5902, "mean_token_accuracy": 0.16678860187530517, "num_tokens": 13221925.0, "step": 5780 }, { "entropy": 5.740795373916626, "epoch": 0.5718663503361012, "grad_norm": 1.484375, "learning_rate": 0.0004974711824234308, "loss": 5.7047, "mean_token_accuracy": 0.15749675184488296, "num_tokens": 13233278.0, "step": 5785 }, { "entropy": 5.813934755325318, "epoch": 0.5723606168446026, "grad_norm": 1.421875, "learning_rate": 0.000497465903621158, "loss": 5.6713, "mean_token_accuracy": 0.16290869414806367, "num_tokens": 13245423.0, "step": 5790 }, { "entropy": 5.772157192230225, "epoch": 0.572854883353104, "grad_norm": 1.6328125, "learning_rate": 0.0004974606193461895, "loss": 5.7195, "mean_token_accuracy": 0.16523960530757903, "num_tokens": 13256312.0, "step": 5795 }, { "entropy": 5.7896302223205565, "epoch": 0.5733491498616053, "grad_norm": 1.625, "learning_rate": 0.0004974553295986553, "loss": 5.671, "mean_token_accuracy": 0.16062716990709305, "num_tokens": 13268158.0, "step": 5800 }, { "entropy": 5.740266132354736, "epoch": 0.5738434163701067, "grad_norm": 4.375, "learning_rate": 0.0004974500343786854, "loss": 5.6451, "mean_token_accuracy": 0.16627271771430968, "num_tokens": 13279625.0, "step": 5805 }, { "entropy": 5.76525650024414, "epoch": 0.5743376828786081, "grad_norm": 1.6484375, "learning_rate": 0.0004974447336864102, "loss": 5.666, "mean_token_accuracy": 0.15998833552002906, "num_tokens": 13291967.0, "step": 5810 }, { "entropy": 5.686205053329468, "epoch": 0.5748319493871096, "grad_norm": 1.609375, "learning_rate": 0.00049743942752196, "loss": 5.553, "mean_token_accuracy": 0.1758944123983383, "num_tokens": 13303641.0, "step": 5815 }, { "entropy": 5.69308819770813, "epoch": 0.575326215895611, "grad_norm": 1.453125, "learning_rate": 0.0004974341158854654, "loss": 5.6128, "mean_token_accuracy": 0.1627964958548546, "num_tokens": 13314754.0, "step": 5820 }, { "entropy": 5.784170627593994, "epoch": 0.5758204824041123, "grad_norm": 1.4609375, "learning_rate": 0.0004974287987770571, "loss": 5.7281, "mean_token_accuracy": 0.1593188002705574, "num_tokens": 13325574.0, "step": 5825 }, { "entropy": 5.7553788185119625, "epoch": 0.5763147489126137, "grad_norm": 1.5390625, "learning_rate": 0.0004974234761968658, "loss": 5.6266, "mean_token_accuracy": 0.17157164961099625, "num_tokens": 13335946.0, "step": 5830 }, { "entropy": 5.772668933868408, "epoch": 0.5768090154211151, "grad_norm": 1.4296875, "learning_rate": 0.0004974181481450224, "loss": 5.6394, "mean_token_accuracy": 0.16848790645599365, "num_tokens": 13347812.0, "step": 5835 }, { "entropy": 5.708554220199585, "epoch": 0.5773032819296164, "grad_norm": 1.4375, "learning_rate": 0.0004974128146216581, "loss": 5.5988, "mean_token_accuracy": 0.16473570913076402, "num_tokens": 13358492.0, "step": 5840 }, { "entropy": 5.8079423904418945, "epoch": 0.5777975484381178, "grad_norm": 1.390625, "learning_rate": 0.0004974074756269042, "loss": 5.7656, "mean_token_accuracy": 0.15715205073356628, "num_tokens": 13370465.0, "step": 5845 }, { "entropy": 5.811331558227539, "epoch": 0.5782918149466192, "grad_norm": 1.21875, "learning_rate": 0.0004974021311608917, "loss": 5.6226, "mean_token_accuracy": 0.16963550597429275, "num_tokens": 13382328.0, "step": 5850 }, { "entropy": 5.728660964965821, "epoch": 0.5787860814551206, "grad_norm": 1.421875, "learning_rate": 0.0004973967812237523, "loss": 5.7362, "mean_token_accuracy": 0.1589743450284004, "num_tokens": 13393439.0, "step": 5855 }, { "entropy": 5.764760494232178, "epoch": 0.5792803479636219, "grad_norm": 1.5546875, "learning_rate": 0.0004973914258156177, "loss": 5.66, "mean_token_accuracy": 0.16472170054912566, "num_tokens": 13404778.0, "step": 5860 }, { "entropy": 5.827328157424927, "epoch": 0.5797746144721234, "grad_norm": 1.5390625, "learning_rate": 0.0004973860649366195, "loss": 5.6623, "mean_token_accuracy": 0.16409119665622712, "num_tokens": 13417031.0, "step": 5865 }, { "entropy": 5.772861671447754, "epoch": 0.5802688809806248, "grad_norm": 1.46875, "learning_rate": 0.0004973806985868895, "loss": 5.6507, "mean_token_accuracy": 0.16444518119096757, "num_tokens": 13428030.0, "step": 5870 }, { "entropy": 5.775449323654175, "epoch": 0.5807631474891262, "grad_norm": 1.359375, "learning_rate": 0.0004973753267665599, "loss": 5.651, "mean_token_accuracy": 0.1662319228053093, "num_tokens": 13438934.0, "step": 5875 }, { "entropy": 5.7868541240692135, "epoch": 0.5812574139976275, "grad_norm": 1.4140625, "learning_rate": 0.0004973699494757627, "loss": 5.6287, "mean_token_accuracy": 0.1601264923810959, "num_tokens": 13450542.0, "step": 5880 }, { "entropy": 5.67889986038208, "epoch": 0.5817516805061289, "grad_norm": 1.4140625, "learning_rate": 0.0004973645667146302, "loss": 5.6767, "mean_token_accuracy": 0.1716054067015648, "num_tokens": 13462382.0, "step": 5885 }, { "entropy": 5.7738378047943115, "epoch": 0.5822459470146303, "grad_norm": 1.359375, "learning_rate": 0.0004973591784832949, "loss": 5.6777, "mean_token_accuracy": 0.15822771340608596, "num_tokens": 13473852.0, "step": 5890 }, { "entropy": 5.811481475830078, "epoch": 0.5827402135231317, "grad_norm": 1.359375, "learning_rate": 0.0004973537847818894, "loss": 5.7087, "mean_token_accuracy": 0.15851057916879654, "num_tokens": 13485763.0, "step": 5895 }, { "entropy": 5.740776443481446, "epoch": 0.583234480031633, "grad_norm": 1.25, "learning_rate": 0.0004973483856105462, "loss": 5.6722, "mean_token_accuracy": 0.16087493374943734, "num_tokens": 13498154.0, "step": 5900 }, { "entropy": 5.851483392715454, "epoch": 0.5837287465401344, "grad_norm": 1.2578125, "learning_rate": 0.0004973429809693983, "loss": 5.7124, "mean_token_accuracy": 0.15585886985063552, "num_tokens": 13510563.0, "step": 5905 }, { "entropy": 5.849711275100708, "epoch": 0.5842230130486358, "grad_norm": 1.453125, "learning_rate": 0.0004973375708585785, "loss": 5.7279, "mean_token_accuracy": 0.16208239942789077, "num_tokens": 13521987.0, "step": 5910 }, { "entropy": 5.787547874450683, "epoch": 0.5847172795571373, "grad_norm": 2.015625, "learning_rate": 0.0004973321552782201, "loss": 5.6743, "mean_token_accuracy": 0.16171410232782363, "num_tokens": 13534075.0, "step": 5915 }, { "entropy": 5.83193187713623, "epoch": 0.5852115460656386, "grad_norm": 1.46875, "learning_rate": 0.000497326734228456, "loss": 5.8267, "mean_token_accuracy": 0.15176279693841935, "num_tokens": 13546201.0, "step": 5920 }, { "entropy": 5.834552907943726, "epoch": 0.58570581257414, "grad_norm": 1.4921875, "learning_rate": 0.0004973213077094199, "loss": 5.6472, "mean_token_accuracy": 0.16397160589694976, "num_tokens": 13556985.0, "step": 5925 }, { "entropy": 5.82445592880249, "epoch": 0.5862000790826414, "grad_norm": 1.5703125, "learning_rate": 0.0004973158757212451, "loss": 5.6773, "mean_token_accuracy": 0.1634679839015007, "num_tokens": 13568617.0, "step": 5930 }, { "entropy": 5.668050289154053, "epoch": 0.5866943455911428, "grad_norm": 1.46875, "learning_rate": 0.0004973104382640652, "loss": 5.6194, "mean_token_accuracy": 0.16359573006629943, "num_tokens": 13581326.0, "step": 5935 }, { "entropy": 5.706488561630249, "epoch": 0.5871886120996441, "grad_norm": 1.4765625, "learning_rate": 0.0004973049953380141, "loss": 5.6349, "mean_token_accuracy": 0.1637824833393097, "num_tokens": 13591776.0, "step": 5940 }, { "entropy": 5.85504903793335, "epoch": 0.5876828786081455, "grad_norm": 1.4921875, "learning_rate": 0.0004972995469432256, "loss": 5.7793, "mean_token_accuracy": 0.15763178318738938, "num_tokens": 13603475.0, "step": 5945 }, { "entropy": 5.793098735809326, "epoch": 0.5881771451166469, "grad_norm": 1.3046875, "learning_rate": 0.0004972940930798338, "loss": 5.6696, "mean_token_accuracy": 0.1648968607187271, "num_tokens": 13615348.0, "step": 5950 }, { "entropy": 5.720390892028808, "epoch": 0.5886714116251482, "grad_norm": 1.546875, "learning_rate": 0.0004972886337479727, "loss": 5.5652, "mean_token_accuracy": 0.16782755702733992, "num_tokens": 13625982.0, "step": 5955 }, { "entropy": 5.809796619415283, "epoch": 0.5891656781336496, "grad_norm": 1.4296875, "learning_rate": 0.0004972831689477768, "loss": 5.6988, "mean_token_accuracy": 0.15440213531255723, "num_tokens": 13637203.0, "step": 5960 }, { "entropy": 5.763940525054932, "epoch": 0.5896599446421511, "grad_norm": 1.40625, "learning_rate": 0.0004972776986793806, "loss": 5.6135, "mean_token_accuracy": 0.1651282861828804, "num_tokens": 13648880.0, "step": 5965 }, { "entropy": 5.771618938446045, "epoch": 0.5901542111506525, "grad_norm": 1.8046875, "learning_rate": 0.0004972722229429184, "loss": 5.697, "mean_token_accuracy": 0.16329590529203414, "num_tokens": 13660266.0, "step": 5970 }, { "entropy": 5.889302015304565, "epoch": 0.5906484776591538, "grad_norm": 1.53125, "learning_rate": 0.000497266741738525, "loss": 5.7748, "mean_token_accuracy": 0.14944686591625214, "num_tokens": 13672063.0, "step": 5975 }, { "entropy": 5.85100908279419, "epoch": 0.5911427441676552, "grad_norm": 1.421875, "learning_rate": 0.0004972612550663353, "loss": 5.6693, "mean_token_accuracy": 0.16710522919893264, "num_tokens": 13683379.0, "step": 5980 }, { "entropy": 5.740947961807251, "epoch": 0.5916370106761566, "grad_norm": 1.46875, "learning_rate": 0.0004972557629264842, "loss": 5.6176, "mean_token_accuracy": 0.16787842363119126, "num_tokens": 13694512.0, "step": 5985 }, { "entropy": 5.738776826858521, "epoch": 0.592131277184658, "grad_norm": 1.5234375, "learning_rate": 0.0004972502653191069, "loss": 5.6258, "mean_token_accuracy": 0.15922403559088708, "num_tokens": 13705642.0, "step": 5990 }, { "entropy": 5.705231809616089, "epoch": 0.5926255436931593, "grad_norm": 1.6015625, "learning_rate": 0.0004972447622443387, "loss": 5.5422, "mean_token_accuracy": 0.1716584861278534, "num_tokens": 13717367.0, "step": 5995 }, { "entropy": 5.697733211517334, "epoch": 0.5931198102016607, "grad_norm": 1.5390625, "learning_rate": 0.0004972392537023147, "loss": 5.6232, "mean_token_accuracy": 0.16564393490552903, "num_tokens": 13728577.0, "step": 6000 }, { "epoch": 0.5931198102016607, "eval_entropy": 5.626806823852464, "eval_loss": 5.705826759338379, "eval_mean_token_accuracy": 0.16681483873288716, "eval_num_tokens": 13728577.0, "eval_runtime": 26.5814, "eval_samples_per_second": 1223.15, "eval_steps_per_second": 152.927, "step": 6000 }, { "entropy": 5.774589395523071, "epoch": 0.5936140767101621, "grad_norm": 1.7421875, "learning_rate": 0.0004972337396931707, "loss": 5.6272, "mean_token_accuracy": 0.16147202998399734, "num_tokens": 13739016.0, "step": 6005 }, { "entropy": 5.8219915390014645, "epoch": 0.5941083432186635, "grad_norm": 1.7578125, "learning_rate": 0.0004972282202170421, "loss": 5.6713, "mean_token_accuracy": 0.15762737691402434, "num_tokens": 13749971.0, "step": 6010 }, { "entropy": 5.744158411026001, "epoch": 0.5946026097271648, "grad_norm": 1.484375, "learning_rate": 0.000497222695274065, "loss": 5.7037, "mean_token_accuracy": 0.1618531882762909, "num_tokens": 13760927.0, "step": 6015 }, { "entropy": 5.762528657913208, "epoch": 0.5950968762356663, "grad_norm": 1.3828125, "learning_rate": 0.0004972171648643749, "loss": 5.6606, "mean_token_accuracy": 0.16211145669221877, "num_tokens": 13772725.0, "step": 6020 }, { "entropy": 5.793417167663574, "epoch": 0.5955911427441677, "grad_norm": 1.6328125, "learning_rate": 0.0004972116289881082, "loss": 5.6606, "mean_token_accuracy": 0.16376404762268065, "num_tokens": 13783427.0, "step": 6025 }, { "entropy": 5.758443784713745, "epoch": 0.5960854092526691, "grad_norm": 1.375, "learning_rate": 0.000497206087645401, "loss": 5.5688, "mean_token_accuracy": 0.1702422946691513, "num_tokens": 13794045.0, "step": 6030 }, { "entropy": 5.793889379501342, "epoch": 0.5965796757611704, "grad_norm": 1.390625, "learning_rate": 0.0004972005408363894, "loss": 5.6123, "mean_token_accuracy": 0.16738815009593963, "num_tokens": 13805629.0, "step": 6035 }, { "entropy": 5.729014110565186, "epoch": 0.5970739422696718, "grad_norm": 1.375, "learning_rate": 0.0004971949885612102, "loss": 5.725, "mean_token_accuracy": 0.15540962368249894, "num_tokens": 13817526.0, "step": 6040 }, { "entropy": 5.79081506729126, "epoch": 0.5975682087781732, "grad_norm": 1.3359375, "learning_rate": 0.0004971894308199997, "loss": 5.6337, "mean_token_accuracy": 0.16940680146217346, "num_tokens": 13828553.0, "step": 6045 }, { "entropy": 5.802762985229492, "epoch": 0.5980624752866746, "grad_norm": 1.359375, "learning_rate": 0.0004971838676128947, "loss": 5.6454, "mean_token_accuracy": 0.16584882736206055, "num_tokens": 13840323.0, "step": 6050 }, { "entropy": 5.723171710968018, "epoch": 0.5985567417951759, "grad_norm": 1.3984375, "learning_rate": 0.0004971782989400323, "loss": 5.6337, "mean_token_accuracy": 0.16908691674470902, "num_tokens": 13853524.0, "step": 6055 }, { "entropy": 5.715406084060669, "epoch": 0.5990510083036773, "grad_norm": 1.3125, "learning_rate": 0.0004971727248015491, "loss": 5.604, "mean_token_accuracy": 0.1647974133491516, "num_tokens": 13864462.0, "step": 6060 }, { "entropy": 5.7595452785491945, "epoch": 0.5995452748121787, "grad_norm": 1.359375, "learning_rate": 0.0004971671451975823, "loss": 5.6324, "mean_token_accuracy": 0.16867476999759673, "num_tokens": 13876615.0, "step": 6065 }, { "entropy": 5.753623008728027, "epoch": 0.6000395413206802, "grad_norm": 1.515625, "learning_rate": 0.0004971615601282695, "loss": 5.7443, "mean_token_accuracy": 0.15899960994720458, "num_tokens": 13887652.0, "step": 6070 }, { "entropy": 5.7975993156433105, "epoch": 0.6005338078291815, "grad_norm": 1.59375, "learning_rate": 0.0004971559695937477, "loss": 5.6126, "mean_token_accuracy": 0.16469364762306213, "num_tokens": 13898961.0, "step": 6075 }, { "entropy": 5.841239309310913, "epoch": 0.6010280743376829, "grad_norm": 1.46875, "learning_rate": 0.0004971503735941547, "loss": 5.687, "mean_token_accuracy": 0.165712633728981, "num_tokens": 13909904.0, "step": 6080 }, { "entropy": 5.8075621128082275, "epoch": 0.6015223408461843, "grad_norm": 1.390625, "learning_rate": 0.000497144772129628, "loss": 5.7012, "mean_token_accuracy": 0.15533842593431474, "num_tokens": 13921376.0, "step": 6085 }, { "entropy": 5.714434671401977, "epoch": 0.6020166073546857, "grad_norm": 1.4453125, "learning_rate": 0.0004971391652003054, "loss": 5.6479, "mean_token_accuracy": 0.1701917678117752, "num_tokens": 13932925.0, "step": 6090 }, { "entropy": 5.8097669124603275, "epoch": 0.602510873863187, "grad_norm": 1.5703125, "learning_rate": 0.000497133552806325, "loss": 5.6328, "mean_token_accuracy": 0.16505085527896882, "num_tokens": 13945010.0, "step": 6095 }, { "entropy": 5.7640375137329105, "epoch": 0.6030051403716884, "grad_norm": 1.359375, "learning_rate": 0.0004971279349478245, "loss": 5.6537, "mean_token_accuracy": 0.1582181602716446, "num_tokens": 13957710.0, "step": 6100 }, { "entropy": 5.662689304351806, "epoch": 0.6034994068801898, "grad_norm": 1.421875, "learning_rate": 0.0004971223116249424, "loss": 5.5516, "mean_token_accuracy": 0.17787012457847595, "num_tokens": 13967819.0, "step": 6105 }, { "entropy": 5.861082077026367, "epoch": 0.6039936733886911, "grad_norm": 1.3359375, "learning_rate": 0.0004971166828378172, "loss": 5.8144, "mean_token_accuracy": 0.15251778960227966, "num_tokens": 13980342.0, "step": 6110 }, { "entropy": 5.833240985870361, "epoch": 0.6044879398971925, "grad_norm": 1.359375, "learning_rate": 0.000497111048586587, "loss": 5.6901, "mean_token_accuracy": 0.16436685621738434, "num_tokens": 13990370.0, "step": 6115 }, { "entropy": 5.7875110626220705, "epoch": 0.604982206405694, "grad_norm": 1.53125, "learning_rate": 0.0004971054088713905, "loss": 5.6878, "mean_token_accuracy": 0.16689518690109253, "num_tokens": 14001761.0, "step": 6120 }, { "entropy": 5.755599641799927, "epoch": 0.6054764729141954, "grad_norm": 1.53125, "learning_rate": 0.0004970997636923665, "loss": 5.6926, "mean_token_accuracy": 0.16299993991851808, "num_tokens": 14012980.0, "step": 6125 }, { "entropy": 5.748826742172241, "epoch": 0.6059707394226967, "grad_norm": 1.484375, "learning_rate": 0.000497094113049654, "loss": 5.5902, "mean_token_accuracy": 0.16267894804477692, "num_tokens": 14023609.0, "step": 6130 }, { "entropy": 5.838775253295898, "epoch": 0.6064650059311981, "grad_norm": 1.4375, "learning_rate": 0.0004970884569433917, "loss": 5.7649, "mean_token_accuracy": 0.15493567585945128, "num_tokens": 14036052.0, "step": 6135 }, { "entropy": 5.775563335418701, "epoch": 0.6069592724396995, "grad_norm": 1.3203125, "learning_rate": 0.000497082795373719, "loss": 5.5995, "mean_token_accuracy": 0.1711900442838669, "num_tokens": 14047932.0, "step": 6140 }, { "entropy": 5.798108720779419, "epoch": 0.6074535389482009, "grad_norm": 1.4140625, "learning_rate": 0.0004970771283407749, "loss": 5.6819, "mean_token_accuracy": 0.1644543319940567, "num_tokens": 14059674.0, "step": 6145 }, { "entropy": 5.764031267166137, "epoch": 0.6079478054567022, "grad_norm": 1.34375, "learning_rate": 0.0004970714558446992, "loss": 5.6969, "mean_token_accuracy": 0.16591319292783738, "num_tokens": 14070753.0, "step": 6150 }, { "entropy": 5.776700687408447, "epoch": 0.6084420719652036, "grad_norm": 3.609375, "learning_rate": 0.0004970657778856312, "loss": 5.6721, "mean_token_accuracy": 0.16524501740932465, "num_tokens": 14083565.0, "step": 6155 }, { "entropy": 5.9135137557983395, "epoch": 0.608936338473705, "grad_norm": 1.6875, "learning_rate": 0.0004970600944637106, "loss": 5.7546, "mean_token_accuracy": 0.15822430551052094, "num_tokens": 14095008.0, "step": 6160 }, { "entropy": 5.671637296676636, "epoch": 0.6094306049822064, "grad_norm": 1.5390625, "learning_rate": 0.0004970544055790772, "loss": 5.5445, "mean_token_accuracy": 0.16504374593496324, "num_tokens": 14106586.0, "step": 6165 }, { "entropy": 5.657175731658936, "epoch": 0.6099248714907078, "grad_norm": 1.46875, "learning_rate": 0.000497048711231871, "loss": 5.5317, "mean_token_accuracy": 0.17381640821695327, "num_tokens": 14117778.0, "step": 6170 }, { "entropy": 5.707796049118042, "epoch": 0.6104191379992092, "grad_norm": 1.328125, "learning_rate": 0.0004970430114222319, "loss": 5.6119, "mean_token_accuracy": 0.16493278443813325, "num_tokens": 14129644.0, "step": 6175 }, { "entropy": 5.6628653049469, "epoch": 0.6109134045077106, "grad_norm": 1.4296875, "learning_rate": 0.0004970373061503005, "loss": 5.5874, "mean_token_accuracy": 0.1685387223958969, "num_tokens": 14141230.0, "step": 6180 }, { "entropy": 5.737487840652466, "epoch": 0.611407671016212, "grad_norm": 1.5078125, "learning_rate": 0.0004970315954162169, "loss": 5.7221, "mean_token_accuracy": 0.16381432712078095, "num_tokens": 14151622.0, "step": 6185 }, { "entropy": 5.814573860168457, "epoch": 0.6119019375247133, "grad_norm": 1.671875, "learning_rate": 0.0004970258792201214, "loss": 5.6591, "mean_token_accuracy": 0.16623520851135254, "num_tokens": 14163641.0, "step": 6190 }, { "entropy": 5.805066299438477, "epoch": 0.6123962040332147, "grad_norm": 1.328125, "learning_rate": 0.000497020157562155, "loss": 5.6116, "mean_token_accuracy": 0.1692408263683319, "num_tokens": 14175154.0, "step": 6195 }, { "entropy": 5.788309717178345, "epoch": 0.6128904705417161, "grad_norm": 1.4140625, "learning_rate": 0.0004970144304424582, "loss": 5.6444, "mean_token_accuracy": 0.1643928676843643, "num_tokens": 14185472.0, "step": 6200 }, { "entropy": 5.754764270782471, "epoch": 0.6133847370502175, "grad_norm": 2.046875, "learning_rate": 0.000497008697861172, "loss": 5.6203, "mean_token_accuracy": 0.16751834899187087, "num_tokens": 14196992.0, "step": 6205 }, { "entropy": 5.700463199615479, "epoch": 0.6138790035587188, "grad_norm": 1.53125, "learning_rate": 0.0004970029598184375, "loss": 5.6121, "mean_token_accuracy": 0.1657865524291992, "num_tokens": 14207732.0, "step": 6210 }, { "entropy": 5.877051067352295, "epoch": 0.6143732700672202, "grad_norm": 1.7109375, "learning_rate": 0.0004969972163143956, "loss": 5.7594, "mean_token_accuracy": 0.15141110718250275, "num_tokens": 14219164.0, "step": 6215 }, { "entropy": 5.8117677688598635, "epoch": 0.6148675365757216, "grad_norm": 1.96875, "learning_rate": 0.0004969914673491878, "loss": 5.7159, "mean_token_accuracy": 0.1557608500123024, "num_tokens": 14231687.0, "step": 6220 }, { "entropy": 5.775439739227295, "epoch": 0.6153618030842231, "grad_norm": 1.3828125, "learning_rate": 0.0004969857129229555, "loss": 5.5532, "mean_token_accuracy": 0.16914770603179932, "num_tokens": 14243099.0, "step": 6225 }, { "entropy": 5.804778575897217, "epoch": 0.6158560695927244, "grad_norm": 1.5, "learning_rate": 0.0004969799530358402, "loss": 5.7586, "mean_token_accuracy": 0.15600511133670808, "num_tokens": 14255835.0, "step": 6230 }, { "entropy": 5.7494730949401855, "epoch": 0.6163503361012258, "grad_norm": 1.28125, "learning_rate": 0.0004969741876879835, "loss": 5.5926, "mean_token_accuracy": 0.16058395355939864, "num_tokens": 14266661.0, "step": 6235 }, { "entropy": 5.7279599666595455, "epoch": 0.6168446026097272, "grad_norm": 1.3203125, "learning_rate": 0.0004969684168795275, "loss": 5.6731, "mean_token_accuracy": 0.1628929853439331, "num_tokens": 14278474.0, "step": 6240 }, { "entropy": 5.822378301620484, "epoch": 0.6173388691182286, "grad_norm": 1.375, "learning_rate": 0.0004969626406106139, "loss": 5.6425, "mean_token_accuracy": 0.16124500781297685, "num_tokens": 14289516.0, "step": 6245 }, { "entropy": 5.696770429611206, "epoch": 0.6178331356267299, "grad_norm": 1.8828125, "learning_rate": 0.0004969568588813851, "loss": 5.6503, "mean_token_accuracy": 0.16988480165600778, "num_tokens": 14301312.0, "step": 6250 }, { "entropy": 5.776571321487427, "epoch": 0.6183274021352313, "grad_norm": 1.234375, "learning_rate": 0.0004969510716919829, "loss": 5.6151, "mean_token_accuracy": 0.17066278606653212, "num_tokens": 14312009.0, "step": 6255 }, { "entropy": 5.770249891281128, "epoch": 0.6188216686437327, "grad_norm": 1.4140625, "learning_rate": 0.00049694527904255, "loss": 5.6573, "mean_token_accuracy": 0.17074283510446547, "num_tokens": 14322754.0, "step": 6260 }, { "entropy": 5.6543920040130615, "epoch": 0.619315935152234, "grad_norm": 1.3046875, "learning_rate": 0.0004969394809332287, "loss": 5.5159, "mean_token_accuracy": 0.1669551819562912, "num_tokens": 14333939.0, "step": 6265 }, { "entropy": 5.746486043930053, "epoch": 0.6198102016607354, "grad_norm": 1.40625, "learning_rate": 0.0004969336773641619, "loss": 5.6323, "mean_token_accuracy": 0.16919056326150894, "num_tokens": 14345987.0, "step": 6270 }, { "entropy": 5.81604266166687, "epoch": 0.6203044681692369, "grad_norm": 1.2578125, "learning_rate": 0.0004969278683354921, "loss": 5.6322, "mean_token_accuracy": 0.1565315842628479, "num_tokens": 14356974.0, "step": 6275 }, { "entropy": 5.780891370773316, "epoch": 0.6207987346777383, "grad_norm": 1.40625, "learning_rate": 0.0004969220538473625, "loss": 5.6569, "mean_token_accuracy": 0.15674652606248857, "num_tokens": 14368175.0, "step": 6280 }, { "entropy": 5.7501989841461185, "epoch": 0.6212930011862396, "grad_norm": 1.6484375, "learning_rate": 0.0004969162338999157, "loss": 5.7288, "mean_token_accuracy": 0.16223904192447663, "num_tokens": 14379067.0, "step": 6285 }, { "entropy": 5.777649879455566, "epoch": 0.621787267694741, "grad_norm": 1.59375, "learning_rate": 0.0004969104084932953, "loss": 5.676, "mean_token_accuracy": 0.1620064541697502, "num_tokens": 14390483.0, "step": 6290 }, { "entropy": 5.730044412612915, "epoch": 0.6222815342032424, "grad_norm": 1.5546875, "learning_rate": 0.0004969045776276443, "loss": 5.6918, "mean_token_accuracy": 0.16353509873151778, "num_tokens": 14402757.0, "step": 6295 }, { "entropy": 5.731755065917969, "epoch": 0.6227758007117438, "grad_norm": 1.75, "learning_rate": 0.0004968987413031063, "loss": 5.6327, "mean_token_accuracy": 0.16243165880441665, "num_tokens": 14413829.0, "step": 6300 }, { "entropy": 5.767355728149414, "epoch": 0.6232700672202451, "grad_norm": 1.4296875, "learning_rate": 0.0004968928995198249, "loss": 5.7327, "mean_token_accuracy": 0.1529085859656334, "num_tokens": 14425165.0, "step": 6305 }, { "entropy": 5.852034854888916, "epoch": 0.6237643337287465, "grad_norm": 1.5625, "learning_rate": 0.0004968870522779437, "loss": 5.6647, "mean_token_accuracy": 0.1615695297718048, "num_tokens": 14436264.0, "step": 6310 }, { "entropy": 5.729472541809082, "epoch": 0.6242586002372479, "grad_norm": 1.5234375, "learning_rate": 0.0004968811995776066, "loss": 5.6122, "mean_token_accuracy": 0.1666173070669174, "num_tokens": 14447384.0, "step": 6315 }, { "entropy": 5.7991142749786375, "epoch": 0.6247528667457493, "grad_norm": 1.390625, "learning_rate": 0.0004968753414189576, "loss": 5.7192, "mean_token_accuracy": 0.15756288915872574, "num_tokens": 14460013.0, "step": 6320 }, { "entropy": 5.823254251480103, "epoch": 0.6252471332542507, "grad_norm": 1.515625, "learning_rate": 0.0004968694778021408, "loss": 5.608, "mean_token_accuracy": 0.16636418253183366, "num_tokens": 14472452.0, "step": 6325 }, { "entropy": 5.7357104301452635, "epoch": 0.6257413997627521, "grad_norm": 1.4140625, "learning_rate": 0.0004968636087273003, "loss": 5.651, "mean_token_accuracy": 0.16405002474784852, "num_tokens": 14484487.0, "step": 6330 }, { "entropy": 5.737237119674683, "epoch": 0.6262356662712535, "grad_norm": 1.5, "learning_rate": 0.0004968577341945806, "loss": 5.5763, "mean_token_accuracy": 0.1684148997068405, "num_tokens": 14496043.0, "step": 6335 }, { "entropy": 5.790759181976318, "epoch": 0.6267299327797549, "grad_norm": 1.6640625, "learning_rate": 0.0004968518542041264, "loss": 5.6792, "mean_token_accuracy": 0.16304038614034652, "num_tokens": 14508089.0, "step": 6340 }, { "entropy": 5.8391822338104244, "epoch": 0.6272241992882562, "grad_norm": 1.7109375, "learning_rate": 0.000496845968756082, "loss": 5.7369, "mean_token_accuracy": 0.15663580745458602, "num_tokens": 14519480.0, "step": 6345 }, { "entropy": 5.820170545578003, "epoch": 0.6277184657967576, "grad_norm": 1.6328125, "learning_rate": 0.0004968400778505925, "loss": 5.6587, "mean_token_accuracy": 0.17018893361091614, "num_tokens": 14531214.0, "step": 6350 }, { "entropy": 5.8212890625, "epoch": 0.628212732305259, "grad_norm": 1.28125, "learning_rate": 0.0004968341814878025, "loss": 5.7239, "mean_token_accuracy": 0.16491053253412247, "num_tokens": 14544118.0, "step": 6355 }, { "entropy": 5.784654712677002, "epoch": 0.6287069988137604, "grad_norm": 1.3359375, "learning_rate": 0.0004968282796678573, "loss": 5.6231, "mean_token_accuracy": 0.163566854596138, "num_tokens": 14555545.0, "step": 6360 }, { "entropy": 5.740172290802002, "epoch": 0.6292012653222617, "grad_norm": 1.40625, "learning_rate": 0.000496822372390902, "loss": 5.6403, "mean_token_accuracy": 0.16461472660303117, "num_tokens": 14567157.0, "step": 6365 }, { "entropy": 5.730631160736084, "epoch": 0.6296955318307631, "grad_norm": 1.5234375, "learning_rate": 0.000496816459657082, "loss": 5.6034, "mean_token_accuracy": 0.16728046983480455, "num_tokens": 14577074.0, "step": 6370 }, { "entropy": 5.794475650787353, "epoch": 0.6301897983392646, "grad_norm": 1.5546875, "learning_rate": 0.0004968105414665426, "loss": 5.6688, "mean_token_accuracy": 0.16565605998039246, "num_tokens": 14589133.0, "step": 6375 }, { "entropy": 5.771366834640503, "epoch": 0.630684064847766, "grad_norm": 1.4765625, "learning_rate": 0.0004968046178194295, "loss": 5.6355, "mean_token_accuracy": 0.1643053725361824, "num_tokens": 14600985.0, "step": 6380 }, { "entropy": 5.77326807975769, "epoch": 0.6311783313562673, "grad_norm": 1.6953125, "learning_rate": 0.0004967986887158884, "loss": 5.6097, "mean_token_accuracy": 0.16638877093791962, "num_tokens": 14612163.0, "step": 6385 }, { "entropy": 5.71264967918396, "epoch": 0.6316725978647687, "grad_norm": 1.4921875, "learning_rate": 0.0004967927541560651, "loss": 5.7184, "mean_token_accuracy": 0.16650869697332382, "num_tokens": 14623045.0, "step": 6390 }, { "entropy": 5.791554927825928, "epoch": 0.6321668643732701, "grad_norm": 1.5390625, "learning_rate": 0.0004967868141401056, "loss": 5.6893, "mean_token_accuracy": 0.16229858845472336, "num_tokens": 14634696.0, "step": 6395 }, { "entropy": 5.850910758972168, "epoch": 0.6326611308817714, "grad_norm": 1.4609375, "learning_rate": 0.0004967808686681562, "loss": 5.6875, "mean_token_accuracy": 0.16024835854768754, "num_tokens": 14645589.0, "step": 6400 }, { "entropy": 5.799806213378906, "epoch": 0.6331553973902728, "grad_norm": 1.578125, "learning_rate": 0.0004967749177403629, "loss": 5.6237, "mean_token_accuracy": 0.16475450098514557, "num_tokens": 14657199.0, "step": 6405 }, { "entropy": 5.772099733352661, "epoch": 0.6336496638987742, "grad_norm": 2.0625, "learning_rate": 0.0004967689613568723, "loss": 5.6801, "mean_token_accuracy": 0.159478160738945, "num_tokens": 14668767.0, "step": 6410 }, { "entropy": 5.73914680480957, "epoch": 0.6341439304072756, "grad_norm": 1.453125, "learning_rate": 0.0004967629995178309, "loss": 5.5801, "mean_token_accuracy": 0.16919685602188111, "num_tokens": 14680860.0, "step": 6415 }, { "entropy": 5.6863480567932125, "epoch": 0.6346381969157769, "grad_norm": 1.515625, "learning_rate": 0.0004967570322233852, "loss": 5.541, "mean_token_accuracy": 0.16810448914766313, "num_tokens": 14692134.0, "step": 6420 }, { "entropy": 5.723415756225586, "epoch": 0.6351324634242784, "grad_norm": 1.625, "learning_rate": 0.0004967510594736822, "loss": 5.6543, "mean_token_accuracy": 0.16126812547445296, "num_tokens": 14703323.0, "step": 6425 }, { "entropy": 5.722515678405761, "epoch": 0.6356267299327798, "grad_norm": 1.546875, "learning_rate": 0.0004967450812688686, "loss": 5.5869, "mean_token_accuracy": 0.1672411799430847, "num_tokens": 14714453.0, "step": 6430 }, { "entropy": 5.736376619338989, "epoch": 0.6361209964412812, "grad_norm": 1.6171875, "learning_rate": 0.0004967390976090917, "loss": 5.6807, "mean_token_accuracy": 0.1590673267841339, "num_tokens": 14726562.0, "step": 6435 }, { "entropy": 5.687188625335693, "epoch": 0.6366152629497825, "grad_norm": 1.5234375, "learning_rate": 0.0004967331084944986, "loss": 5.5045, "mean_token_accuracy": 0.17426086068153382, "num_tokens": 14738054.0, "step": 6440 }, { "entropy": 5.642411756515503, "epoch": 0.6371095294582839, "grad_norm": 1.6640625, "learning_rate": 0.0004967271139252365, "loss": 5.6294, "mean_token_accuracy": 0.1622166484594345, "num_tokens": 14749037.0, "step": 6445 }, { "entropy": 5.775140428543091, "epoch": 0.6376037959667853, "grad_norm": 1.5234375, "learning_rate": 0.0004967211139014531, "loss": 5.5897, "mean_token_accuracy": 0.16244631856679917, "num_tokens": 14759667.0, "step": 6450 }, { "entropy": 5.7774248123168945, "epoch": 0.6380980624752867, "grad_norm": 1.9765625, "learning_rate": 0.000496715108423296, "loss": 5.6162, "mean_token_accuracy": 0.1629392221570015, "num_tokens": 14770866.0, "step": 6455 }, { "entropy": 5.754608488082885, "epoch": 0.638592328983788, "grad_norm": 1.875, "learning_rate": 0.0004967090974909127, "loss": 5.6312, "mean_token_accuracy": 0.16380554884672166, "num_tokens": 14783095.0, "step": 6460 }, { "entropy": 5.772108030319214, "epoch": 0.6390865954922894, "grad_norm": 1.296875, "learning_rate": 0.0004967030811044512, "loss": 5.6992, "mean_token_accuracy": 0.15968350768089296, "num_tokens": 14794046.0, "step": 6465 }, { "entropy": 5.756714677810669, "epoch": 0.6395808620007908, "grad_norm": 1.5078125, "learning_rate": 0.0004966970592640596, "loss": 5.6757, "mean_token_accuracy": 0.16397481709718703, "num_tokens": 14807295.0, "step": 6470 }, { "entropy": 5.783436918258667, "epoch": 0.6400751285092922, "grad_norm": 1.5078125, "learning_rate": 0.0004966910319698859, "loss": 5.6379, "mean_token_accuracy": 0.1722213000059128, "num_tokens": 14819109.0, "step": 6475 }, { "entropy": 5.755461025238037, "epoch": 0.6405693950177936, "grad_norm": 1.484375, "learning_rate": 0.0004966849992220784, "loss": 5.6022, "mean_token_accuracy": 0.16542187631130217, "num_tokens": 14830719.0, "step": 6480 }, { "entropy": 5.751820373535156, "epoch": 0.641063661526295, "grad_norm": 1.703125, "learning_rate": 0.0004966789610207856, "loss": 5.6848, "mean_token_accuracy": 0.1639040231704712, "num_tokens": 14843392.0, "step": 6485 }, { "entropy": 5.740760231018067, "epoch": 0.6415579280347964, "grad_norm": 1.4296875, "learning_rate": 0.0004966729173661559, "loss": 5.5618, "mean_token_accuracy": 0.17255358248949051, "num_tokens": 14855745.0, "step": 6490 }, { "entropy": 5.813320350646973, "epoch": 0.6420521945432978, "grad_norm": 1.625, "learning_rate": 0.000496666868258338, "loss": 5.7094, "mean_token_accuracy": 0.15964556038379668, "num_tokens": 14868053.0, "step": 6495 }, { "entropy": 5.76065993309021, "epoch": 0.6425464610517991, "grad_norm": 1.6953125, "learning_rate": 0.0004966608136974809, "loss": 5.6266, "mean_token_accuracy": 0.16805339008569717, "num_tokens": 14880095.0, "step": 6500 }, { "entropy": 5.819428634643555, "epoch": 0.6430407275603005, "grad_norm": 1.453125, "learning_rate": 0.0004966547536837333, "loss": 5.6923, "mean_token_accuracy": 0.15894569158554078, "num_tokens": 14891013.0, "step": 6505 }, { "entropy": 5.784639310836792, "epoch": 0.6435349940688019, "grad_norm": 1.53125, "learning_rate": 0.0004966486882172444, "loss": 5.6024, "mean_token_accuracy": 0.16922138929367064, "num_tokens": 14901875.0, "step": 6510 }, { "entropy": 5.730242681503296, "epoch": 0.6440292605773033, "grad_norm": 1.4453125, "learning_rate": 0.0004966426172981634, "loss": 5.6333, "mean_token_accuracy": 0.16815225183963775, "num_tokens": 14912620.0, "step": 6515 }, { "entropy": 5.685377740859986, "epoch": 0.6445235270858046, "grad_norm": 1.84375, "learning_rate": 0.0004966365409266396, "loss": 5.6164, "mean_token_accuracy": 0.1710914969444275, "num_tokens": 14923128.0, "step": 6520 }, { "entropy": 5.724513721466065, "epoch": 0.645017793594306, "grad_norm": 1.4375, "learning_rate": 0.0004966304591028225, "loss": 5.6079, "mean_token_accuracy": 0.16572261601686478, "num_tokens": 14933621.0, "step": 6525 }, { "entropy": 5.730213737487793, "epoch": 0.6455120601028075, "grad_norm": 1.8046875, "learning_rate": 0.0004966243718268617, "loss": 5.569, "mean_token_accuracy": 0.16851237118244172, "num_tokens": 14943292.0, "step": 6530 }, { "entropy": 5.706056022644043, "epoch": 0.6460063266113089, "grad_norm": 1.421875, "learning_rate": 0.000496618279098907, "loss": 5.6307, "mean_token_accuracy": 0.16001626700162888, "num_tokens": 14953998.0, "step": 6535 }, { "entropy": 5.784326171875, "epoch": 0.6465005931198102, "grad_norm": 1.6640625, "learning_rate": 0.0004966121809191083, "loss": 5.6679, "mean_token_accuracy": 0.16561168134212495, "num_tokens": 14965430.0, "step": 6540 }, { "entropy": 5.74091362953186, "epoch": 0.6469948596283116, "grad_norm": 1.875, "learning_rate": 0.0004966060772876156, "loss": 5.5362, "mean_token_accuracy": 0.17125169187784195, "num_tokens": 14977124.0, "step": 6545 }, { "entropy": 5.742420101165772, "epoch": 0.647489126136813, "grad_norm": 1.6328125, "learning_rate": 0.0004965999682045788, "loss": 5.5547, "mean_token_accuracy": 0.1699445702135563, "num_tokens": 14987069.0, "step": 6550 }, { "entropy": 5.677365732192993, "epoch": 0.6479833926453143, "grad_norm": 1.5390625, "learning_rate": 0.0004965938536701486, "loss": 5.6403, "mean_token_accuracy": 0.17897330820560456, "num_tokens": 14997919.0, "step": 6555 }, { "entropy": 5.7578435897827145, "epoch": 0.6484776591538157, "grad_norm": 1.5390625, "learning_rate": 0.0004965877336844752, "loss": 5.6947, "mean_token_accuracy": 0.16872752606868743, "num_tokens": 15010042.0, "step": 6560 }, { "entropy": 5.809809398651123, "epoch": 0.6489719256623171, "grad_norm": 1.5625, "learning_rate": 0.0004965816082477091, "loss": 5.561, "mean_token_accuracy": 0.16624810099601744, "num_tokens": 15021166.0, "step": 6565 }, { "entropy": 5.805764436721802, "epoch": 0.6494661921708185, "grad_norm": 1.5078125, "learning_rate": 0.0004965754773600011, "loss": 5.6452, "mean_token_accuracy": 0.16420420557260512, "num_tokens": 15032182.0, "step": 6570 }, { "entropy": 5.6941694736480715, "epoch": 0.6499604586793198, "grad_norm": 1.8125, "learning_rate": 0.000496569341021502, "loss": 5.5943, "mean_token_accuracy": 0.16626092344522475, "num_tokens": 15043054.0, "step": 6575 }, { "entropy": 5.68024435043335, "epoch": 0.6504547251878213, "grad_norm": 1.6484375, "learning_rate": 0.0004965631992323628, "loss": 5.531, "mean_token_accuracy": 0.1773110330104828, "num_tokens": 15055462.0, "step": 6580 }, { "entropy": 5.748437976837158, "epoch": 0.6509489916963227, "grad_norm": 1.3515625, "learning_rate": 0.0004965570519927345, "loss": 5.6462, "mean_token_accuracy": 0.16381797343492507, "num_tokens": 15066849.0, "step": 6585 }, { "entropy": 5.7041933059692385, "epoch": 0.6514432582048241, "grad_norm": 1.3671875, "learning_rate": 0.0004965508993027682, "loss": 5.6044, "mean_token_accuracy": 0.16580681204795839, "num_tokens": 15078388.0, "step": 6590 }, { "entropy": 5.816247892379761, "epoch": 0.6519375247133254, "grad_norm": 1.4375, "learning_rate": 0.0004965447411626156, "loss": 5.6364, "mean_token_accuracy": 0.16688652336597443, "num_tokens": 15090474.0, "step": 6595 }, { "entropy": 5.815159559249878, "epoch": 0.6524317912218268, "grad_norm": 1.3125, "learning_rate": 0.0004965385775724279, "loss": 5.6316, "mean_token_accuracy": 0.16053054630756378, "num_tokens": 15101104.0, "step": 6600 }, { "entropy": 5.749491405487061, "epoch": 0.6529260577303282, "grad_norm": 1.78125, "learning_rate": 0.0004965324085323569, "loss": 5.6476, "mean_token_accuracy": 0.15748330056667328, "num_tokens": 15112036.0, "step": 6605 }, { "entropy": 5.803199338912964, "epoch": 0.6534203242388296, "grad_norm": 1.6875, "learning_rate": 0.0004965262340425541, "loss": 5.7597, "mean_token_accuracy": 0.1529676854610443, "num_tokens": 15124913.0, "step": 6610 }, { "entropy": 5.871570348739624, "epoch": 0.6539145907473309, "grad_norm": 1.8671875, "learning_rate": 0.0004965200541031717, "loss": 5.6563, "mean_token_accuracy": 0.1651740312576294, "num_tokens": 15135555.0, "step": 6615 }, { "entropy": 5.859944820404053, "epoch": 0.6544088572558323, "grad_norm": 1.5, "learning_rate": 0.0004965138687143616, "loss": 5.7435, "mean_token_accuracy": 0.15558698326349257, "num_tokens": 15146646.0, "step": 6620 }, { "entropy": 5.7530012130737305, "epoch": 0.6549031237643337, "grad_norm": 1.5859375, "learning_rate": 0.0004965076778762759, "loss": 5.6074, "mean_token_accuracy": 0.16277364492416382, "num_tokens": 15157101.0, "step": 6625 }, { "entropy": 5.797142171859742, "epoch": 0.6553973902728352, "grad_norm": 1.2421875, "learning_rate": 0.0004965014815890671, "loss": 5.6227, "mean_token_accuracy": 0.16162085384130478, "num_tokens": 15169645.0, "step": 6630 }, { "entropy": 5.7598498344421385, "epoch": 0.6558916567813365, "grad_norm": 1.421875, "learning_rate": 0.0004964952798528874, "loss": 5.5373, "mean_token_accuracy": 0.1664197862148285, "num_tokens": 15181018.0, "step": 6635 }, { "entropy": 5.747228479385376, "epoch": 0.6563859232898379, "grad_norm": 1.5078125, "learning_rate": 0.0004964890726678894, "loss": 5.6154, "mean_token_accuracy": 0.1631882131099701, "num_tokens": 15191880.0, "step": 6640 }, { "entropy": 5.683012437820435, "epoch": 0.6568801897983393, "grad_norm": 1.4453125, "learning_rate": 0.0004964828600342259, "loss": 5.5831, "mean_token_accuracy": 0.16633551120758056, "num_tokens": 15203886.0, "step": 6645 }, { "entropy": 5.758241844177246, "epoch": 0.6573744563068407, "grad_norm": 1.3359375, "learning_rate": 0.0004964766419520497, "loss": 5.571, "mean_token_accuracy": 0.1714767888188362, "num_tokens": 15215837.0, "step": 6650 }, { "entropy": 5.789406251907349, "epoch": 0.657868722815342, "grad_norm": 1.3671875, "learning_rate": 0.0004964704184215138, "loss": 5.6685, "mean_token_accuracy": 0.1581181839108467, "num_tokens": 15226833.0, "step": 6655 }, { "entropy": 5.738519811630249, "epoch": 0.6583629893238434, "grad_norm": 1.4609375, "learning_rate": 0.0004964641894427712, "loss": 5.7133, "mean_token_accuracy": 0.15806318670511246, "num_tokens": 15239312.0, "step": 6660 }, { "entropy": 5.788010501861573, "epoch": 0.6588572558323448, "grad_norm": 1.5, "learning_rate": 0.0004964579550159752, "loss": 5.5938, "mean_token_accuracy": 0.1595676064491272, "num_tokens": 15250348.0, "step": 6665 }, { "entropy": 5.707490110397339, "epoch": 0.6593515223408462, "grad_norm": 1.4921875, "learning_rate": 0.0004964517151412791, "loss": 5.654, "mean_token_accuracy": 0.16972415298223495, "num_tokens": 15261445.0, "step": 6670 }, { "entropy": 5.780685329437256, "epoch": 0.6598457888493475, "grad_norm": 1.7109375, "learning_rate": 0.0004964454698188364, "loss": 5.5768, "mean_token_accuracy": 0.16413053274154663, "num_tokens": 15271606.0, "step": 6675 }, { "entropy": 5.711971473693848, "epoch": 0.6603400553578489, "grad_norm": 1.5, "learning_rate": 0.000496439219048801, "loss": 5.6486, "mean_token_accuracy": 0.16437918245792388, "num_tokens": 15283690.0, "step": 6680 }, { "entropy": 5.715126705169678, "epoch": 0.6608343218663504, "grad_norm": 1.296875, "learning_rate": 0.0004964329628313263, "loss": 5.6089, "mean_token_accuracy": 0.17137991935014724, "num_tokens": 15294792.0, "step": 6685 }, { "entropy": 5.808073616027832, "epoch": 0.6613285883748518, "grad_norm": 1.53125, "learning_rate": 0.0004964267011665664, "loss": 5.6457, "mean_token_accuracy": 0.1627802923321724, "num_tokens": 15305636.0, "step": 6690 }, { "entropy": 5.7131470203399655, "epoch": 0.6618228548833531, "grad_norm": 1.9921875, "learning_rate": 0.0004964204340546753, "loss": 5.6345, "mean_token_accuracy": 0.1627189040184021, "num_tokens": 15316495.0, "step": 6695 }, { "entropy": 5.721789312362671, "epoch": 0.6623171213918545, "grad_norm": 1.703125, "learning_rate": 0.0004964141614958071, "loss": 5.6201, "mean_token_accuracy": 0.16983213126659394, "num_tokens": 15328246.0, "step": 6700 }, { "entropy": 5.816872072219849, "epoch": 0.6628113879003559, "grad_norm": 1.40625, "learning_rate": 0.0004964078834901163, "loss": 5.5891, "mean_token_accuracy": 0.16585003212094307, "num_tokens": 15339229.0, "step": 6705 }, { "entropy": 5.7035352230072025, "epoch": 0.6633056544088572, "grad_norm": 1.640625, "learning_rate": 0.000496401600037757, "loss": 5.6099, "mean_token_accuracy": 0.164272303879261, "num_tokens": 15350591.0, "step": 6710 }, { "entropy": 5.812136697769165, "epoch": 0.6637999209173586, "grad_norm": 1.625, "learning_rate": 0.0004963953111388842, "loss": 5.7277, "mean_token_accuracy": 0.1567153736948967, "num_tokens": 15363726.0, "step": 6715 }, { "entropy": 5.7724522113800045, "epoch": 0.66429418742586, "grad_norm": 1.2734375, "learning_rate": 0.0004963890167936524, "loss": 5.6112, "mean_token_accuracy": 0.16536572575569153, "num_tokens": 15375569.0, "step": 6720 }, { "entropy": 5.748994970321656, "epoch": 0.6647884539343614, "grad_norm": 1.3203125, "learning_rate": 0.0004963827170022164, "loss": 5.6863, "mean_token_accuracy": 0.1543663889169693, "num_tokens": 15387323.0, "step": 6725 }, { "entropy": 5.7563999652862545, "epoch": 0.6652827204428627, "grad_norm": 1.5390625, "learning_rate": 0.0004963764117647311, "loss": 5.5605, "mean_token_accuracy": 0.15932124704122544, "num_tokens": 15397912.0, "step": 6730 }, { "entropy": 5.691759538650513, "epoch": 0.6657769869513642, "grad_norm": 1.4609375, "learning_rate": 0.0004963701010813519, "loss": 5.4786, "mean_token_accuracy": 0.1785081997513771, "num_tokens": 15409469.0, "step": 6735 }, { "entropy": 5.6755051612854, "epoch": 0.6662712534598656, "grad_norm": 1.5078125, "learning_rate": 0.0004963637849522338, "loss": 5.5229, "mean_token_accuracy": 0.16746993511915206, "num_tokens": 15419681.0, "step": 6740 }, { "entropy": 5.778180408477783, "epoch": 0.666765519968367, "grad_norm": 1.2578125, "learning_rate": 0.0004963574633775323, "loss": 5.7094, "mean_token_accuracy": 0.1608496442437172, "num_tokens": 15431237.0, "step": 6745 }, { "entropy": 5.766178703308105, "epoch": 0.6672597864768683, "grad_norm": 1.515625, "learning_rate": 0.0004963511363574027, "loss": 5.6216, "mean_token_accuracy": 0.16089110523462297, "num_tokens": 15442366.0, "step": 6750 }, { "entropy": 5.740045976638794, "epoch": 0.6677540529853697, "grad_norm": 1.3125, "learning_rate": 0.0004963448038920009, "loss": 5.6081, "mean_token_accuracy": 0.15921292304992676, "num_tokens": 15453121.0, "step": 6755 }, { "entropy": 5.734017372131348, "epoch": 0.6682483194938711, "grad_norm": 1.3203125, "learning_rate": 0.0004963384659814827, "loss": 5.5849, "mean_token_accuracy": 0.17104532420635224, "num_tokens": 15463489.0, "step": 6760 }, { "entropy": 5.7487220287323, "epoch": 0.6687425860023725, "grad_norm": 1.203125, "learning_rate": 0.0004963321226260038, "loss": 5.6448, "mean_token_accuracy": 0.16038959920406343, "num_tokens": 15475217.0, "step": 6765 }, { "entropy": 5.736399412155151, "epoch": 0.6692368525108738, "grad_norm": 1.5234375, "learning_rate": 0.0004963257738257203, "loss": 5.6264, "mean_token_accuracy": 0.16269309297204018, "num_tokens": 15485844.0, "step": 6770 }, { "entropy": 5.7635212421417235, "epoch": 0.6697311190193752, "grad_norm": 1.2734375, "learning_rate": 0.0004963194195807886, "loss": 5.6147, "mean_token_accuracy": 0.16412168890237808, "num_tokens": 15496835.0, "step": 6775 }, { "entropy": 5.7644247055053714, "epoch": 0.6702253855278766, "grad_norm": 1.3515625, "learning_rate": 0.0004963130598913646, "loss": 5.6523, "mean_token_accuracy": 0.1657743513584137, "num_tokens": 15508087.0, "step": 6780 }, { "entropy": 5.7958824157714846, "epoch": 0.6707196520363781, "grad_norm": 1.3359375, "learning_rate": 0.0004963066947576051, "loss": 5.6557, "mean_token_accuracy": 0.15826882794499397, "num_tokens": 15519596.0, "step": 6785 }, { "entropy": 5.780778408050537, "epoch": 0.6712139185448794, "grad_norm": 1.28125, "learning_rate": 0.0004963003241796666, "loss": 5.6412, "mean_token_accuracy": 0.1555856592953205, "num_tokens": 15530830.0, "step": 6790 }, { "entropy": 5.706460666656494, "epoch": 0.6717081850533808, "grad_norm": 1.2734375, "learning_rate": 0.0004962939481577059, "loss": 5.5405, "mean_token_accuracy": 0.17752100974321366, "num_tokens": 15543195.0, "step": 6795 }, { "entropy": 5.749172973632812, "epoch": 0.6722024515618822, "grad_norm": 1.515625, "learning_rate": 0.0004962875666918796, "loss": 5.6553, "mean_token_accuracy": 0.1612786501646042, "num_tokens": 15554465.0, "step": 6800 }, { "entropy": 5.6718591213226315, "epoch": 0.6726967180703836, "grad_norm": 1.5390625, "learning_rate": 0.0004962811797823448, "loss": 5.6188, "mean_token_accuracy": 0.1627206638455391, "num_tokens": 15566016.0, "step": 6805 }, { "entropy": 5.799967336654663, "epoch": 0.6731909845788849, "grad_norm": 1.5234375, "learning_rate": 0.0004962747874292588, "loss": 5.7041, "mean_token_accuracy": 0.15960169285535813, "num_tokens": 15576843.0, "step": 6810 }, { "entropy": 5.840959692001343, "epoch": 0.6736852510873863, "grad_norm": 1.3359375, "learning_rate": 0.0004962683896327786, "loss": 5.631, "mean_token_accuracy": 0.1652127519249916, "num_tokens": 15588390.0, "step": 6815 }, { "entropy": 5.829801368713379, "epoch": 0.6741795175958877, "grad_norm": 1.3984375, "learning_rate": 0.0004962619863930616, "loss": 5.7312, "mean_token_accuracy": 0.1608808308839798, "num_tokens": 15600270.0, "step": 6820 }, { "entropy": 5.735422515869141, "epoch": 0.674673784104389, "grad_norm": 1.28125, "learning_rate": 0.0004962555777102656, "loss": 5.5721, "mean_token_accuracy": 0.16506532430648804, "num_tokens": 15611617.0, "step": 6825 }, { "entropy": 5.707896947860718, "epoch": 0.6751680506128904, "grad_norm": 1.3203125, "learning_rate": 0.000496249163584548, "loss": 5.6483, "mean_token_accuracy": 0.16650721281766892, "num_tokens": 15622128.0, "step": 6830 }, { "entropy": 5.843118000030517, "epoch": 0.6756623171213919, "grad_norm": 1.390625, "learning_rate": 0.0004962427440160665, "loss": 5.658, "mean_token_accuracy": 0.15920696258544922, "num_tokens": 15635250.0, "step": 6835 }, { "entropy": 5.830879068374633, "epoch": 0.6761565836298933, "grad_norm": 1.53125, "learning_rate": 0.0004962363190049794, "loss": 5.7233, "mean_token_accuracy": 0.15867377519607545, "num_tokens": 15646535.0, "step": 6840 }, { "entropy": 5.755466175079346, "epoch": 0.6766508501383947, "grad_norm": 1.5625, "learning_rate": 0.0004962298885514444, "loss": 5.6739, "mean_token_accuracy": 0.16584515273571016, "num_tokens": 15658399.0, "step": 6845 }, { "entropy": 5.796150159835816, "epoch": 0.677145116646896, "grad_norm": 1.5390625, "learning_rate": 0.0004962234526556199, "loss": 5.6215, "mean_token_accuracy": 0.1704525589942932, "num_tokens": 15669321.0, "step": 6850 }, { "entropy": 5.691433572769165, "epoch": 0.6776393831553974, "grad_norm": 1.7421875, "learning_rate": 0.000496217011317664, "loss": 5.5963, "mean_token_accuracy": 0.16430669128894806, "num_tokens": 15681666.0, "step": 6855 }, { "entropy": 5.666491460800171, "epoch": 0.6781336496638988, "grad_norm": 1.3671875, "learning_rate": 0.0004962105645377354, "loss": 5.6065, "mean_token_accuracy": 0.16990689039230347, "num_tokens": 15693432.0, "step": 6860 }, { "entropy": 5.745400285720825, "epoch": 0.6786279161724001, "grad_norm": 1.4609375, "learning_rate": 0.0004962041123159926, "loss": 5.5414, "mean_token_accuracy": 0.16931298077106477, "num_tokens": 15705151.0, "step": 6865 }, { "entropy": 5.697288370132446, "epoch": 0.6791221826809015, "grad_norm": 1.4765625, "learning_rate": 0.0004961976546525943, "loss": 5.55, "mean_token_accuracy": 0.16901147365570068, "num_tokens": 15716549.0, "step": 6870 }, { "entropy": 5.756910037994385, "epoch": 0.6796164491894029, "grad_norm": 1.5078125, "learning_rate": 0.0004961911915476994, "loss": 5.6921, "mean_token_accuracy": 0.16362438648939132, "num_tokens": 15727499.0, "step": 6875 }, { "entropy": 5.732259511947632, "epoch": 0.6801107156979043, "grad_norm": 1.359375, "learning_rate": 0.0004961847230014668, "loss": 5.5914, "mean_token_accuracy": 0.16787823289632797, "num_tokens": 15739196.0, "step": 6880 }, { "entropy": 5.740002965927124, "epoch": 0.6806049822064056, "grad_norm": 1.3515625, "learning_rate": 0.0004961782490140558, "loss": 5.5897, "mean_token_accuracy": 0.17234150767326356, "num_tokens": 15750890.0, "step": 6885 }, { "entropy": 5.747622394561768, "epoch": 0.6810992487149071, "grad_norm": 1.2578125, "learning_rate": 0.0004961717695856256, "loss": 5.6336, "mean_token_accuracy": 0.17156925797462463, "num_tokens": 15762366.0, "step": 6890 }, { "entropy": 5.716518783569336, "epoch": 0.6815935152234085, "grad_norm": 1.4140625, "learning_rate": 0.0004961652847163354, "loss": 5.6004, "mean_token_accuracy": 0.1655272826552391, "num_tokens": 15773962.0, "step": 6895 }, { "entropy": 5.626062822341919, "epoch": 0.6820877817319099, "grad_norm": 1.3828125, "learning_rate": 0.000496158794406345, "loss": 5.4643, "mean_token_accuracy": 0.1829729974269867, "num_tokens": 15784563.0, "step": 6900 }, { "entropy": 5.7201660633087155, "epoch": 0.6825820482404112, "grad_norm": 1.359375, "learning_rate": 0.0004961522986558139, "loss": 5.603, "mean_token_accuracy": 0.1636321648955345, "num_tokens": 15796461.0, "step": 6905 }, { "entropy": 5.754406833648682, "epoch": 0.6830763147489126, "grad_norm": 1.46875, "learning_rate": 0.000496145797464902, "loss": 5.6178, "mean_token_accuracy": 0.16484073251485826, "num_tokens": 15807303.0, "step": 6910 }, { "entropy": 5.676671648025513, "epoch": 0.683570581257414, "grad_norm": 1.390625, "learning_rate": 0.0004961392908337691, "loss": 5.5537, "mean_token_accuracy": 0.1768821358680725, "num_tokens": 15818964.0, "step": 6915 }, { "entropy": 5.7280134677886965, "epoch": 0.6840648477659154, "grad_norm": 1.359375, "learning_rate": 0.0004961327787625754, "loss": 5.7026, "mean_token_accuracy": 0.15737905353307724, "num_tokens": 15831181.0, "step": 6920 }, { "entropy": 5.7252861022949215, "epoch": 0.6845591142744167, "grad_norm": 1.40625, "learning_rate": 0.000496126261251481, "loss": 5.5628, "mean_token_accuracy": 0.16701388210058213, "num_tokens": 15842442.0, "step": 6925 }, { "entropy": 5.780656528472901, "epoch": 0.6850533807829181, "grad_norm": 1.2890625, "learning_rate": 0.0004961197383006463, "loss": 5.659, "mean_token_accuracy": 0.16329487413167953, "num_tokens": 15854755.0, "step": 6930 }, { "entropy": 5.642618083953858, "epoch": 0.6855476472914195, "grad_norm": 1.390625, "learning_rate": 0.0004961132099102316, "loss": 5.539, "mean_token_accuracy": 0.16859302073717117, "num_tokens": 15866300.0, "step": 6935 }, { "entropy": 5.686197423934937, "epoch": 0.686041913799921, "grad_norm": 1.4609375, "learning_rate": 0.0004961066760803978, "loss": 5.5276, "mean_token_accuracy": 0.17215495705604553, "num_tokens": 15877165.0, "step": 6940 }, { "entropy": 5.787747859954834, "epoch": 0.6865361803084223, "grad_norm": 1.5546875, "learning_rate": 0.0004961001368113054, "loss": 5.6158, "mean_token_accuracy": 0.16086900383234023, "num_tokens": 15888893.0, "step": 6945 }, { "entropy": 5.739814615249633, "epoch": 0.6870304468169237, "grad_norm": 1.265625, "learning_rate": 0.0004960935921031153, "loss": 5.6375, "mean_token_accuracy": 0.1608149915933609, "num_tokens": 15899994.0, "step": 6950 }, { "entropy": 5.686029529571533, "epoch": 0.6875247133254251, "grad_norm": 1.3203125, "learning_rate": 0.0004960870419559887, "loss": 5.538, "mean_token_accuracy": 0.1723516635596752, "num_tokens": 15911330.0, "step": 6955 }, { "entropy": 5.722923231124878, "epoch": 0.6880189798339265, "grad_norm": 1.53125, "learning_rate": 0.0004960804863700864, "loss": 5.6281, "mean_token_accuracy": 0.16891862601041793, "num_tokens": 15922397.0, "step": 6960 }, { "entropy": 5.720265007019043, "epoch": 0.6885132463424278, "grad_norm": 1.21875, "learning_rate": 0.0004960739253455699, "loss": 5.6056, "mean_token_accuracy": 0.1666198566555977, "num_tokens": 15934628.0, "step": 6965 }, { "entropy": 5.689791822433472, "epoch": 0.6890075128509292, "grad_norm": 1.375, "learning_rate": 0.0004960673588826005, "loss": 5.5806, "mean_token_accuracy": 0.16941634565591812, "num_tokens": 15946599.0, "step": 6970 }, { "entropy": 5.775901412963867, "epoch": 0.6895017793594306, "grad_norm": 1.2265625, "learning_rate": 0.0004960607869813398, "loss": 5.5979, "mean_token_accuracy": 0.1695634126663208, "num_tokens": 15957402.0, "step": 6975 }, { "entropy": 5.756583118438721, "epoch": 0.689996045867932, "grad_norm": 1.28125, "learning_rate": 0.0004960542096419494, "loss": 5.6477, "mean_token_accuracy": 0.16816511303186416, "num_tokens": 15968091.0, "step": 6980 }, { "entropy": 5.680802536010742, "epoch": 0.6904903123764333, "grad_norm": 1.234375, "learning_rate": 0.0004960476268645912, "loss": 5.6518, "mean_token_accuracy": 0.15996556580066681, "num_tokens": 15980809.0, "step": 6985 }, { "entropy": 5.726210641860962, "epoch": 0.6909845788849348, "grad_norm": 1.46875, "learning_rate": 0.0004960410386494271, "loss": 5.6232, "mean_token_accuracy": 0.1655051276087761, "num_tokens": 15992701.0, "step": 6990 }, { "entropy": 5.869408893585205, "epoch": 0.6914788453934362, "grad_norm": 1.296875, "learning_rate": 0.0004960344449966191, "loss": 5.706, "mean_token_accuracy": 0.1593773052096367, "num_tokens": 16005871.0, "step": 6995 }, { "entropy": 5.792735528945923, "epoch": 0.6919731119019376, "grad_norm": 1.3359375, "learning_rate": 0.0004960278459063296, "loss": 5.7126, "mean_token_accuracy": 0.1535090833902359, "num_tokens": 16018126.0, "step": 7000 }, { "entropy": 5.701186609268189, "epoch": 0.6924673784104389, "grad_norm": 1.265625, "learning_rate": 0.0004960212413787206, "loss": 5.5467, "mean_token_accuracy": 0.16927996426820754, "num_tokens": 16028694.0, "step": 7005 }, { "entropy": 5.729494571685791, "epoch": 0.6929616449189403, "grad_norm": 1.5234375, "learning_rate": 0.000496014631413955, "loss": 5.654, "mean_token_accuracy": 0.16199876368045807, "num_tokens": 16040354.0, "step": 7010 }, { "entropy": 5.756959724426269, "epoch": 0.6934559114274417, "grad_norm": 1.40625, "learning_rate": 0.0004960080160121951, "loss": 5.6055, "mean_token_accuracy": 0.1653362527489662, "num_tokens": 16051713.0, "step": 7015 }, { "entropy": 5.799495077133178, "epoch": 0.693950177935943, "grad_norm": 1.4140625, "learning_rate": 0.0004960013951736036, "loss": 5.6939, "mean_token_accuracy": 0.1569141462445259, "num_tokens": 16064737.0, "step": 7020 }, { "entropy": 5.724238586425781, "epoch": 0.6944444444444444, "grad_norm": 1.4375, "learning_rate": 0.0004959947688983436, "loss": 5.5548, "mean_token_accuracy": 0.17220764309167863, "num_tokens": 16075515.0, "step": 7025 }, { "entropy": 5.769337606430054, "epoch": 0.6949387109529458, "grad_norm": 1.2421875, "learning_rate": 0.0004959881371865779, "loss": 5.6266, "mean_token_accuracy": 0.1644908979535103, "num_tokens": 16088702.0, "step": 7030 }, { "entropy": 5.683289098739624, "epoch": 0.6954329774614472, "grad_norm": 1.578125, "learning_rate": 0.0004959815000384699, "loss": 5.5556, "mean_token_accuracy": 0.16567983478307724, "num_tokens": 16101122.0, "step": 7035 }, { "entropy": 5.749926900863647, "epoch": 0.6959272439699487, "grad_norm": 1.4609375, "learning_rate": 0.0004959748574541826, "loss": 5.6294, "mean_token_accuracy": 0.16365983486175537, "num_tokens": 16112817.0, "step": 7040 }, { "entropy": 5.845486259460449, "epoch": 0.69642151047845, "grad_norm": 1.390625, "learning_rate": 0.0004959682094338795, "loss": 5.7138, "mean_token_accuracy": 0.1570294588804245, "num_tokens": 16124827.0, "step": 7045 }, { "entropy": 5.6996053695678714, "epoch": 0.6969157769869514, "grad_norm": 1.46875, "learning_rate": 0.0004959615559777243, "loss": 5.5905, "mean_token_accuracy": 0.1688149690628052, "num_tokens": 16136940.0, "step": 7050 }, { "entropy": 5.72951307296753, "epoch": 0.6974100434954528, "grad_norm": 1.703125, "learning_rate": 0.0004959548970858805, "loss": 5.5936, "mean_token_accuracy": 0.17095874845981598, "num_tokens": 16147541.0, "step": 7055 }, { "entropy": 5.721037769317627, "epoch": 0.6979043100039541, "grad_norm": 1.46875, "learning_rate": 0.0004959482327585119, "loss": 5.6199, "mean_token_accuracy": 0.16173220723867415, "num_tokens": 16157626.0, "step": 7060 }, { "entropy": 5.744309997558593, "epoch": 0.6983985765124555, "grad_norm": 1.515625, "learning_rate": 0.0004959415629957824, "loss": 5.5777, "mean_token_accuracy": 0.16985894292593, "num_tokens": 16168494.0, "step": 7065 }, { "entropy": 5.782959604263306, "epoch": 0.6988928430209569, "grad_norm": 1.4921875, "learning_rate": 0.0004959348877978563, "loss": 5.6841, "mean_token_accuracy": 0.165982449054718, "num_tokens": 16180749.0, "step": 7070 }, { "entropy": 5.719228601455688, "epoch": 0.6993871095294583, "grad_norm": 1.8046875, "learning_rate": 0.0004959282071648977, "loss": 5.6362, "mean_token_accuracy": 0.1687002196907997, "num_tokens": 16193204.0, "step": 7075 }, { "entropy": 5.739464950561524, "epoch": 0.6998813760379596, "grad_norm": 1.40625, "learning_rate": 0.000495921521097071, "loss": 5.5934, "mean_token_accuracy": 0.1826246902346611, "num_tokens": 16204303.0, "step": 7080 }, { "entropy": 5.705110502243042, "epoch": 0.700375642546461, "grad_norm": 1.3515625, "learning_rate": 0.0004959148295945405, "loss": 5.5489, "mean_token_accuracy": 0.1684345468878746, "num_tokens": 16215261.0, "step": 7085 }, { "entropy": 5.693350887298584, "epoch": 0.7008699090549624, "grad_norm": 1.4375, "learning_rate": 0.0004959081326574708, "loss": 5.5561, "mean_token_accuracy": 0.1730835407972336, "num_tokens": 16226973.0, "step": 7090 }, { "entropy": 5.602511167526245, "epoch": 0.7013641755634639, "grad_norm": 1.3515625, "learning_rate": 0.0004959014302860271, "loss": 5.4411, "mean_token_accuracy": 0.1794707089662552, "num_tokens": 16239152.0, "step": 7095 }, { "entropy": 5.743041944503784, "epoch": 0.7018584420719652, "grad_norm": 1.3828125, "learning_rate": 0.0004958947224803737, "loss": 5.5775, "mean_token_accuracy": 0.17361103594303132, "num_tokens": 16251884.0, "step": 7100 }, { "entropy": 5.721180820465088, "epoch": 0.7023527085804666, "grad_norm": 1.625, "learning_rate": 0.0004958880092406759, "loss": 5.6523, "mean_token_accuracy": 0.15597390979528428, "num_tokens": 16262497.0, "step": 7105 }, { "entropy": 5.696573257446289, "epoch": 0.702846975088968, "grad_norm": 1.515625, "learning_rate": 0.0004958812905670988, "loss": 5.6, "mean_token_accuracy": 0.16918797194957733, "num_tokens": 16274624.0, "step": 7110 }, { "entropy": 5.794445562362671, "epoch": 0.7033412415974694, "grad_norm": 1.671875, "learning_rate": 0.0004958745664598077, "loss": 5.6083, "mean_token_accuracy": 0.1654810830950737, "num_tokens": 16286096.0, "step": 7115 }, { "entropy": 5.691314268112182, "epoch": 0.7038355081059707, "grad_norm": 1.4296875, "learning_rate": 0.0004958678369189679, "loss": 5.5325, "mean_token_accuracy": 0.17520693093538284, "num_tokens": 16297853.0, "step": 7120 }, { "entropy": 5.690968465805054, "epoch": 0.7043297746144721, "grad_norm": 1.5234375, "learning_rate": 0.0004958611019447452, "loss": 5.6683, "mean_token_accuracy": 0.16415596902370452, "num_tokens": 16310708.0, "step": 7125 }, { "entropy": 5.79909029006958, "epoch": 0.7048240411229735, "grad_norm": 1.578125, "learning_rate": 0.0004958543615373051, "loss": 5.6072, "mean_token_accuracy": 0.1694961205124855, "num_tokens": 16321216.0, "step": 7130 }, { "entropy": 5.719899320602417, "epoch": 0.7053183076314749, "grad_norm": 3.0625, "learning_rate": 0.0004958476156968134, "loss": 5.5688, "mean_token_accuracy": 0.17243465632200242, "num_tokens": 16331982.0, "step": 7135 }, { "entropy": 5.701531553268433, "epoch": 0.7058125741399762, "grad_norm": 1.2734375, "learning_rate": 0.000495840864423436, "loss": 5.6554, "mean_token_accuracy": 0.16359290480613708, "num_tokens": 16343001.0, "step": 7140 }, { "entropy": 5.845033454895019, "epoch": 0.7063068406484777, "grad_norm": 1.515625, "learning_rate": 0.0004958341077173392, "loss": 5.6023, "mean_token_accuracy": 0.16307328194379805, "num_tokens": 16355519.0, "step": 7145 }, { "entropy": 5.748544406890869, "epoch": 0.7068011071569791, "grad_norm": 1.703125, "learning_rate": 0.0004958273455786892, "loss": 5.5802, "mean_token_accuracy": 0.16546572297811507, "num_tokens": 16366342.0, "step": 7150 }, { "entropy": 5.7766571044921875, "epoch": 0.7072953736654805, "grad_norm": 1.453125, "learning_rate": 0.0004958205780076521, "loss": 5.6721, "mean_token_accuracy": 0.15858823508024217, "num_tokens": 16378395.0, "step": 7155 }, { "entropy": 5.728197002410889, "epoch": 0.7077896401739818, "grad_norm": 1.6328125, "learning_rate": 0.0004958138050043945, "loss": 5.5582, "mean_token_accuracy": 0.16583077907562255, "num_tokens": 16388946.0, "step": 7160 }, { "entropy": 5.657739543914795, "epoch": 0.7082839066824832, "grad_norm": 1.8203125, "learning_rate": 0.0004958070265690831, "loss": 5.6317, "mean_token_accuracy": 0.16495919078588486, "num_tokens": 16399824.0, "step": 7165 }, { "entropy": 5.7876451969146725, "epoch": 0.7087781731909846, "grad_norm": 1.3828125, "learning_rate": 0.0004958002427018845, "loss": 5.6197, "mean_token_accuracy": 0.1602352723479271, "num_tokens": 16411932.0, "step": 7170 }, { "entropy": 5.815198183059692, "epoch": 0.709272439699486, "grad_norm": 1.4609375, "learning_rate": 0.0004957934534029658, "loss": 5.6052, "mean_token_accuracy": 0.163335819542408, "num_tokens": 16423634.0, "step": 7175 }, { "entropy": 5.7700950622558596, "epoch": 0.7097667062079873, "grad_norm": 2.046875, "learning_rate": 0.0004957866586724938, "loss": 5.6627, "mean_token_accuracy": 0.1671762764453888, "num_tokens": 16434700.0, "step": 7180 }, { "entropy": 5.7832824230194095, "epoch": 0.7102609727164887, "grad_norm": 1.4609375, "learning_rate": 0.0004957798585106359, "loss": 5.6468, "mean_token_accuracy": 0.16163350492715836, "num_tokens": 16445829.0, "step": 7185 }, { "entropy": 5.68034815788269, "epoch": 0.7107552392249901, "grad_norm": 1.4765625, "learning_rate": 0.000495773052917559, "loss": 5.5141, "mean_token_accuracy": 0.17704764306545256, "num_tokens": 16456352.0, "step": 7190 }, { "entropy": 5.6992011070251465, "epoch": 0.7112495057334915, "grad_norm": 1.5, "learning_rate": 0.0004957662418934309, "loss": 5.5365, "mean_token_accuracy": 0.1718830108642578, "num_tokens": 16467542.0, "step": 7195 }, { "entropy": 5.620245409011841, "epoch": 0.7117437722419929, "grad_norm": 1.3359375, "learning_rate": 0.0004957594254384189, "loss": 5.4978, "mean_token_accuracy": 0.17775754928588866, "num_tokens": 16478614.0, "step": 7200 }, { "entropy": 5.7373486995697025, "epoch": 0.7122380387504943, "grad_norm": 1.59375, "learning_rate": 0.0004957526035526908, "loss": 5.5665, "mean_token_accuracy": 0.16869405061006545, "num_tokens": 16489929.0, "step": 7205 }, { "entropy": 5.8183043003082275, "epoch": 0.7127323052589957, "grad_norm": 2.40625, "learning_rate": 0.0004957457762364146, "loss": 5.6891, "mean_token_accuracy": 0.15675144046545028, "num_tokens": 16502532.0, "step": 7210 }, { "entropy": 5.806992864608764, "epoch": 0.713226571767497, "grad_norm": 1.6640625, "learning_rate": 0.0004957389434897578, "loss": 5.6969, "mean_token_accuracy": 0.16106098294258117, "num_tokens": 16513805.0, "step": 7215 }, { "entropy": 5.771140623092651, "epoch": 0.7137208382759984, "grad_norm": 1.7578125, "learning_rate": 0.0004957321053128889, "loss": 5.6764, "mean_token_accuracy": 0.16268240809440612, "num_tokens": 16525189.0, "step": 7220 }, { "entropy": 5.7535521507263185, "epoch": 0.7142151047844998, "grad_norm": 1.7578125, "learning_rate": 0.0004957252617059759, "loss": 5.6751, "mean_token_accuracy": 0.16041869074106216, "num_tokens": 16538246.0, "step": 7225 }, { "entropy": 5.8260119438171385, "epoch": 0.7147093712930012, "grad_norm": 1.9765625, "learning_rate": 0.0004957184126691873, "loss": 5.6609, "mean_token_accuracy": 0.16416329145431519, "num_tokens": 16550036.0, "step": 7230 }, { "entropy": 5.74976224899292, "epoch": 0.7152036378015025, "grad_norm": 1.5703125, "learning_rate": 0.0004957115582026915, "loss": 5.6072, "mean_token_accuracy": 0.16773174107074737, "num_tokens": 16562262.0, "step": 7235 }, { "entropy": 5.707104778289795, "epoch": 0.7156979043100039, "grad_norm": 1.5078125, "learning_rate": 0.000495704698306657, "loss": 5.5791, "mean_token_accuracy": 0.1737347051501274, "num_tokens": 16574213.0, "step": 7240 }, { "entropy": 5.802697229385376, "epoch": 0.7161921708185054, "grad_norm": 1.7890625, "learning_rate": 0.0004956978329812528, "loss": 5.6479, "mean_token_accuracy": 0.16947502195835112, "num_tokens": 16586063.0, "step": 7245 }, { "entropy": 5.790889883041382, "epoch": 0.7166864373270068, "grad_norm": 1.4296875, "learning_rate": 0.0004956909622266476, "loss": 5.6501, "mean_token_accuracy": 0.16264750808477402, "num_tokens": 16598014.0, "step": 7250 }, { "entropy": 5.731391477584839, "epoch": 0.7171807038355081, "grad_norm": 1.5859375, "learning_rate": 0.0004956840860430104, "loss": 5.6127, "mean_token_accuracy": 0.16996590346097945, "num_tokens": 16609128.0, "step": 7255 }, { "entropy": 5.741106462478638, "epoch": 0.7176749703440095, "grad_norm": 1.53125, "learning_rate": 0.0004956772044305106, "loss": 5.5423, "mean_token_accuracy": 0.1706029072403908, "num_tokens": 16620095.0, "step": 7260 }, { "entropy": 5.748459672927856, "epoch": 0.7181692368525109, "grad_norm": 1.921875, "learning_rate": 0.0004956703173893173, "loss": 5.5585, "mean_token_accuracy": 0.16713149696588517, "num_tokens": 16630919.0, "step": 7265 }, { "entropy": 5.7497953414917, "epoch": 0.7186635033610123, "grad_norm": 1.7890625, "learning_rate": 0.0004956634249196001, "loss": 5.6744, "mean_token_accuracy": 0.1614256903529167, "num_tokens": 16642111.0, "step": 7270 }, { "entropy": 5.7414665699005125, "epoch": 0.7191577698695136, "grad_norm": 1.65625, "learning_rate": 0.0004956565270215282, "loss": 5.652, "mean_token_accuracy": 0.16246819943189622, "num_tokens": 16654805.0, "step": 7275 }, { "entropy": 5.853487873077393, "epoch": 0.719652036378015, "grad_norm": 1.6171875, "learning_rate": 0.0004956496236952716, "loss": 5.6905, "mean_token_accuracy": 0.16142804622650148, "num_tokens": 16664735.0, "step": 7280 }, { "entropy": 5.802929544448853, "epoch": 0.7201463028865164, "grad_norm": 1.5, "learning_rate": 0.000495642714941, "loss": 5.5447, "mean_token_accuracy": 0.16482402384281158, "num_tokens": 16676163.0, "step": 7285 }, { "entropy": 5.81269097328186, "epoch": 0.7206405693950177, "grad_norm": 1.5546875, "learning_rate": 0.0004956358007588834, "loss": 5.7549, "mean_token_accuracy": 0.15713878720998764, "num_tokens": 16689683.0, "step": 7290 }, { "entropy": 5.856641530990601, "epoch": 0.7211348359035191, "grad_norm": 1.5859375, "learning_rate": 0.0004956288811490919, "loss": 5.682, "mean_token_accuracy": 0.1596776008605957, "num_tokens": 16702193.0, "step": 7295 }, { "entropy": 5.684182596206665, "epoch": 0.7216291024120206, "grad_norm": 2.078125, "learning_rate": 0.0004956219561117955, "loss": 5.501, "mean_token_accuracy": 0.17966277301311492, "num_tokens": 16713489.0, "step": 7300 }, { "entropy": 5.68188705444336, "epoch": 0.722123368920522, "grad_norm": 1.625, "learning_rate": 0.000495615025647165, "loss": 5.6197, "mean_token_accuracy": 0.16612053662538528, "num_tokens": 16725103.0, "step": 7305 }, { "entropy": 5.735351848602295, "epoch": 0.7226176354290234, "grad_norm": 1.59375, "learning_rate": 0.0004956080897553705, "loss": 5.5905, "mean_token_accuracy": 0.16317443400621415, "num_tokens": 16737056.0, "step": 7310 }, { "entropy": 5.698517084121704, "epoch": 0.7231119019375247, "grad_norm": 1.53125, "learning_rate": 0.0004956011484365829, "loss": 5.5534, "mean_token_accuracy": 0.1738612711429596, "num_tokens": 16747347.0, "step": 7315 }, { "entropy": 5.692885541915894, "epoch": 0.7236061684460261, "grad_norm": 1.5390625, "learning_rate": 0.0004955942016909728, "loss": 5.571, "mean_token_accuracy": 0.1722766116261482, "num_tokens": 16758738.0, "step": 7320 }, { "entropy": 5.711320209503174, "epoch": 0.7241004349545275, "grad_norm": 1.4375, "learning_rate": 0.000495587249518711, "loss": 5.6174, "mean_token_accuracy": 0.163837032020092, "num_tokens": 16770867.0, "step": 7325 }, { "entropy": 5.768688583374024, "epoch": 0.7245947014630288, "grad_norm": 1.5078125, "learning_rate": 0.0004955802919199687, "loss": 5.5512, "mean_token_accuracy": 0.17396171689033507, "num_tokens": 16781537.0, "step": 7330 }, { "entropy": 5.738880825042725, "epoch": 0.7250889679715302, "grad_norm": 1.484375, "learning_rate": 0.000495573328894917, "loss": 5.588, "mean_token_accuracy": 0.16630553752183913, "num_tokens": 16792250.0, "step": 7335 }, { "entropy": 5.720074129104614, "epoch": 0.7255832344800316, "grad_norm": 1.46875, "learning_rate": 0.0004955663604437272, "loss": 5.5543, "mean_token_accuracy": 0.16450802534818648, "num_tokens": 16803673.0, "step": 7340 }, { "entropy": 5.7297827243804935, "epoch": 0.726077500988533, "grad_norm": 1.5859375, "learning_rate": 0.0004955593865665707, "loss": 5.6732, "mean_token_accuracy": 0.16134673357009888, "num_tokens": 16815484.0, "step": 7345 }, { "entropy": 5.758619976043701, "epoch": 0.7265717674970344, "grad_norm": 1.6875, "learning_rate": 0.000495552407263619, "loss": 5.6215, "mean_token_accuracy": 0.16498324126005173, "num_tokens": 16827097.0, "step": 7350 }, { "entropy": 5.828380537033081, "epoch": 0.7270660340055358, "grad_norm": 1.75, "learning_rate": 0.0004955454225350441, "loss": 5.581, "mean_token_accuracy": 0.16659811586141587, "num_tokens": 16838235.0, "step": 7355 }, { "entropy": 5.756051635742187, "epoch": 0.7275603005140372, "grad_norm": 1.3984375, "learning_rate": 0.0004955384323810174, "loss": 5.5903, "mean_token_accuracy": 0.16529640108346938, "num_tokens": 16847831.0, "step": 7360 }, { "entropy": 5.743377733230591, "epoch": 0.7280545670225386, "grad_norm": 2.6875, "learning_rate": 0.000495531436801711, "loss": 5.6226, "mean_token_accuracy": 0.16450040489435197, "num_tokens": 16859607.0, "step": 7365 }, { "entropy": 5.863069009780884, "epoch": 0.7285488335310399, "grad_norm": 1.5546875, "learning_rate": 0.0004955244357972972, "loss": 5.6743, "mean_token_accuracy": 0.16126021295785903, "num_tokens": 16869787.0, "step": 7370 }, { "entropy": 5.708996438980103, "epoch": 0.7290431000395413, "grad_norm": 1.3359375, "learning_rate": 0.000495517429367948, "loss": 5.5496, "mean_token_accuracy": 0.16942000091075898, "num_tokens": 16880819.0, "step": 7375 }, { "entropy": 5.769755458831787, "epoch": 0.7295373665480427, "grad_norm": 1.6171875, "learning_rate": 0.0004955104175138358, "loss": 5.6697, "mean_token_accuracy": 0.16085806638002395, "num_tokens": 16893247.0, "step": 7380 }, { "entropy": 5.781706809997559, "epoch": 0.7300316330565441, "grad_norm": 1.3984375, "learning_rate": 0.0004955034002351332, "loss": 5.5792, "mean_token_accuracy": 0.16594864279031754, "num_tokens": 16904469.0, "step": 7385 }, { "entropy": 5.7706982612609865, "epoch": 0.7305258995650454, "grad_norm": 1.3671875, "learning_rate": 0.0004954963775320127, "loss": 5.7237, "mean_token_accuracy": 0.16324723958969117, "num_tokens": 16918433.0, "step": 7390 }, { "entropy": 5.801693916320801, "epoch": 0.7310201660735468, "grad_norm": 1.4765625, "learning_rate": 0.000495489349404647, "loss": 5.6518, "mean_token_accuracy": 0.1594475969672203, "num_tokens": 16930905.0, "step": 7395 }, { "entropy": 5.820454740524292, "epoch": 0.7315144325820483, "grad_norm": 1.484375, "learning_rate": 0.0004954823158532093, "loss": 5.6792, "mean_token_accuracy": 0.15785257816314696, "num_tokens": 16943461.0, "step": 7400 }, { "entropy": 5.702722454071045, "epoch": 0.7320086990905497, "grad_norm": 1.40625, "learning_rate": 0.0004954752768778723, "loss": 5.6351, "mean_token_accuracy": 0.16629653424024582, "num_tokens": 16955539.0, "step": 7405 }, { "entropy": 5.735093688964843, "epoch": 0.732502965599051, "grad_norm": 1.546875, "learning_rate": 0.0004954682324788093, "loss": 5.5956, "mean_token_accuracy": 0.16030968278646468, "num_tokens": 16967508.0, "step": 7410 }, { "entropy": 5.771734523773193, "epoch": 0.7329972321075524, "grad_norm": 1.5078125, "learning_rate": 0.0004954611826561935, "loss": 5.5661, "mean_token_accuracy": 0.1696939140558243, "num_tokens": 16979033.0, "step": 7415 }, { "entropy": 5.715194416046143, "epoch": 0.7334914986160538, "grad_norm": 1.34375, "learning_rate": 0.0004954541274101985, "loss": 5.5482, "mean_token_accuracy": 0.17350004613399506, "num_tokens": 16991874.0, "step": 7420 }, { "entropy": 5.8296373844146725, "epoch": 0.7339857651245552, "grad_norm": 1.9140625, "learning_rate": 0.0004954470667409978, "loss": 5.7261, "mean_token_accuracy": 0.15965375751256944, "num_tokens": 17003160.0, "step": 7425 }, { "entropy": 5.749544095993042, "epoch": 0.7344800316330565, "grad_norm": 1.6015625, "learning_rate": 0.000495440000648765, "loss": 5.5817, "mean_token_accuracy": 0.16631619036197662, "num_tokens": 17014043.0, "step": 7430 }, { "entropy": 5.759813642501831, "epoch": 0.7349742981415579, "grad_norm": 1.5078125, "learning_rate": 0.0004954329291336739, "loss": 5.5436, "mean_token_accuracy": 0.16683925092220306, "num_tokens": 17025117.0, "step": 7435 }, { "entropy": 5.66251392364502, "epoch": 0.7354685646500593, "grad_norm": 2.25, "learning_rate": 0.0004954258521958988, "loss": 5.611, "mean_token_accuracy": 0.1650553524494171, "num_tokens": 17037366.0, "step": 7440 }, { "entropy": 5.764198064804077, "epoch": 0.7359628311585606, "grad_norm": 1.609375, "learning_rate": 0.0004954187698356133, "loss": 5.6507, "mean_token_accuracy": 0.16029622852802278, "num_tokens": 17050683.0, "step": 7445 }, { "entropy": 5.708848094940185, "epoch": 0.7364570976670621, "grad_norm": 1.8203125, "learning_rate": 0.0004954116820529921, "loss": 5.5338, "mean_token_accuracy": 0.1740710735321045, "num_tokens": 17062403.0, "step": 7450 }, { "entropy": 5.714789724349975, "epoch": 0.7369513641755635, "grad_norm": 2.171875, "learning_rate": 0.0004954045888482091, "loss": 5.5412, "mean_token_accuracy": 0.1723011016845703, "num_tokens": 17072688.0, "step": 7455 }, { "entropy": 5.749787712097168, "epoch": 0.7374456306840649, "grad_norm": 1.5078125, "learning_rate": 0.0004953974902214391, "loss": 5.6045, "mean_token_accuracy": 0.16877943873405457, "num_tokens": 17084118.0, "step": 7460 }, { "entropy": 5.808379793167115, "epoch": 0.7379398971925663, "grad_norm": 1.578125, "learning_rate": 0.0004953903861728567, "loss": 5.6354, "mean_token_accuracy": 0.16455026119947433, "num_tokens": 17095600.0, "step": 7465 }, { "entropy": 5.8653984546661375, "epoch": 0.7384341637010676, "grad_norm": 1.578125, "learning_rate": 0.0004953832767026365, "loss": 5.7431, "mean_token_accuracy": 0.15749269872903823, "num_tokens": 17107934.0, "step": 7470 }, { "entropy": 5.745365571975708, "epoch": 0.738928430209569, "grad_norm": 1.515625, "learning_rate": 0.0004953761618109535, "loss": 5.6656, "mean_token_accuracy": 0.15862454771995543, "num_tokens": 17119578.0, "step": 7475 }, { "entropy": 5.762130832672119, "epoch": 0.7394226967180704, "grad_norm": 1.8828125, "learning_rate": 0.0004953690414979828, "loss": 5.6451, "mean_token_accuracy": 0.16063157021999358, "num_tokens": 17129928.0, "step": 7480 }, { "entropy": 5.7570428371429445, "epoch": 0.7399169632265717, "grad_norm": 1.78125, "learning_rate": 0.0004953619157638995, "loss": 5.6536, "mean_token_accuracy": 0.16045423299074174, "num_tokens": 17141149.0, "step": 7485 }, { "entropy": 5.7265997409820555, "epoch": 0.7404112297350731, "grad_norm": 1.484375, "learning_rate": 0.0004953547846088789, "loss": 5.5467, "mean_token_accuracy": 0.16523138135671617, "num_tokens": 17152577.0, "step": 7490 }, { "entropy": 5.703083562850952, "epoch": 0.7409054962435745, "grad_norm": 1.5390625, "learning_rate": 0.0004953476480330964, "loss": 5.5679, "mean_token_accuracy": 0.16664033830165864, "num_tokens": 17163997.0, "step": 7495 }, { "entropy": 5.722478723526001, "epoch": 0.741399762752076, "grad_norm": 1.375, "learning_rate": 0.0004953405060367276, "loss": 5.5299, "mean_token_accuracy": 0.16978507190942765, "num_tokens": 17175317.0, "step": 7500 }, { "entropy": 5.63282732963562, "epoch": 0.7418940292605773, "grad_norm": 1.9453125, "learning_rate": 0.0004953333586199481, "loss": 5.5892, "mean_token_accuracy": 0.17345013469457626, "num_tokens": 17185615.0, "step": 7505 }, { "entropy": 5.815655708312988, "epoch": 0.7423882957690787, "grad_norm": 1.765625, "learning_rate": 0.0004953262057829338, "loss": 5.6085, "mean_token_accuracy": 0.16249293237924575, "num_tokens": 17198160.0, "step": 7510 }, { "entropy": 5.761313104629517, "epoch": 0.7428825622775801, "grad_norm": 1.6796875, "learning_rate": 0.0004953190475258607, "loss": 5.5911, "mean_token_accuracy": 0.1688827559351921, "num_tokens": 17209652.0, "step": 7515 }, { "entropy": 5.756549215316772, "epoch": 0.7433768287860815, "grad_norm": 1.6875, "learning_rate": 0.0004953118838489049, "loss": 5.5966, "mean_token_accuracy": 0.1644274726510048, "num_tokens": 17220832.0, "step": 7520 }, { "entropy": 5.7113487243652346, "epoch": 0.7438710952945828, "grad_norm": 2.125, "learning_rate": 0.0004953047147522424, "loss": 5.5467, "mean_token_accuracy": 0.16912853568792344, "num_tokens": 17231952.0, "step": 7525 }, { "entropy": 5.634316873550415, "epoch": 0.7443653618030842, "grad_norm": 1.7109375, "learning_rate": 0.0004952975402360499, "loss": 5.5471, "mean_token_accuracy": 0.17110426276922225, "num_tokens": 17242705.0, "step": 7530 }, { "entropy": 5.7730433464050295, "epoch": 0.7448596283115856, "grad_norm": 1.7890625, "learning_rate": 0.0004952903603005037, "loss": 5.6208, "mean_token_accuracy": 0.1608292430639267, "num_tokens": 17253946.0, "step": 7535 }, { "entropy": 5.856173133850097, "epoch": 0.745353894820087, "grad_norm": 1.7890625, "learning_rate": 0.0004952831749457804, "loss": 5.6546, "mean_token_accuracy": 0.17365415692329406, "num_tokens": 17265732.0, "step": 7540 }, { "entropy": 5.735471105575561, "epoch": 0.7458481613285883, "grad_norm": 1.6328125, "learning_rate": 0.0004952759841720569, "loss": 5.5842, "mean_token_accuracy": 0.1696339651942253, "num_tokens": 17277154.0, "step": 7545 }, { "entropy": 5.73749475479126, "epoch": 0.7463424278370897, "grad_norm": 1.5546875, "learning_rate": 0.0004952687879795101, "loss": 5.6365, "mean_token_accuracy": 0.16797012239694595, "num_tokens": 17288179.0, "step": 7550 }, { "entropy": 5.746026420593262, "epoch": 0.7468366943455912, "grad_norm": 3.375, "learning_rate": 0.0004952615863683167, "loss": 5.577, "mean_token_accuracy": 0.17081994265317918, "num_tokens": 17299435.0, "step": 7555 }, { "entropy": 5.6489966869354244, "epoch": 0.7473309608540926, "grad_norm": 2.875, "learning_rate": 0.0004952543793386543, "loss": 5.4363, "mean_token_accuracy": 0.18596286624670028, "num_tokens": 17309442.0, "step": 7560 }, { "entropy": 5.76450023651123, "epoch": 0.7478252273625939, "grad_norm": 1.6640625, "learning_rate": 0.0004952471668906999, "loss": 5.6504, "mean_token_accuracy": 0.15946330577135087, "num_tokens": 17322072.0, "step": 7565 }, { "entropy": 5.770624351501465, "epoch": 0.7483194938710953, "grad_norm": 1.6015625, "learning_rate": 0.0004952399490246311, "loss": 5.5672, "mean_token_accuracy": 0.1691721722483635, "num_tokens": 17333458.0, "step": 7570 }, { "entropy": 5.647971057891846, "epoch": 0.7488137603795967, "grad_norm": 2.265625, "learning_rate": 0.0004952327257406253, "loss": 5.5297, "mean_token_accuracy": 0.1690526247024536, "num_tokens": 17344319.0, "step": 7575 }, { "entropy": 5.714942932128906, "epoch": 0.749308026888098, "grad_norm": 1.96875, "learning_rate": 0.0004952254970388603, "loss": 5.6395, "mean_token_accuracy": 0.16880596280097962, "num_tokens": 17357016.0, "step": 7580 }, { "entropy": 5.754970455169678, "epoch": 0.7498022933965994, "grad_norm": 1.453125, "learning_rate": 0.000495218262919514, "loss": 5.5313, "mean_token_accuracy": 0.1711251214146614, "num_tokens": 17368574.0, "step": 7585 }, { "entropy": 5.609649229049682, "epoch": 0.7502965599051008, "grad_norm": 1.578125, "learning_rate": 0.0004952110233827642, "loss": 5.4966, "mean_token_accuracy": 0.1723710983991623, "num_tokens": 17379858.0, "step": 7590 }, { "entropy": 5.747307205200196, "epoch": 0.7507908264136022, "grad_norm": 1.6953125, "learning_rate": 0.0004952037784287891, "loss": 5.6442, "mean_token_accuracy": 0.1659706175327301, "num_tokens": 17391543.0, "step": 7595 }, { "entropy": 5.772963285446167, "epoch": 0.7512850929221035, "grad_norm": 1.796875, "learning_rate": 0.0004951965280577668, "loss": 5.5947, "mean_token_accuracy": 0.17050851732492447, "num_tokens": 17403193.0, "step": 7600 }, { "entropy": 5.756211566925049, "epoch": 0.751779359430605, "grad_norm": 1.8203125, "learning_rate": 0.0004951892722698759, "loss": 5.6992, "mean_token_accuracy": 0.16200622618198396, "num_tokens": 17415866.0, "step": 7605 }, { "entropy": 5.665574550628662, "epoch": 0.7522736259391064, "grad_norm": 1.734375, "learning_rate": 0.0004951820110652946, "loss": 5.5441, "mean_token_accuracy": 0.16659905314445494, "num_tokens": 17427880.0, "step": 7610 }, { "entropy": 5.76431713104248, "epoch": 0.7527678924476078, "grad_norm": 1.8203125, "learning_rate": 0.0004951747444442017, "loss": 5.5778, "mean_token_accuracy": 0.16731993854045868, "num_tokens": 17440295.0, "step": 7615 }, { "entropy": 5.792757797241211, "epoch": 0.7532621589561092, "grad_norm": 1.984375, "learning_rate": 0.0004951674724067759, "loss": 5.6111, "mean_token_accuracy": 0.17040710896253586, "num_tokens": 17451636.0, "step": 7620 }, { "entropy": 5.778954076766968, "epoch": 0.7537564254646105, "grad_norm": 2.0, "learning_rate": 0.0004951601949531962, "loss": 5.6619, "mean_token_accuracy": 0.16695151776075362, "num_tokens": 17464376.0, "step": 7625 }, { "entropy": 5.734000110626221, "epoch": 0.7542506919731119, "grad_norm": 1.515625, "learning_rate": 0.0004951529120836416, "loss": 5.5152, "mean_token_accuracy": 0.1681979015469551, "num_tokens": 17475098.0, "step": 7630 }, { "entropy": 5.651544904708862, "epoch": 0.7547449584816133, "grad_norm": 1.5703125, "learning_rate": 0.0004951456237982911, "loss": 5.5267, "mean_token_accuracy": 0.16398171633481978, "num_tokens": 17486176.0, "step": 7635 }, { "entropy": 5.710281324386597, "epoch": 0.7552392249901146, "grad_norm": 1.71875, "learning_rate": 0.0004951383300973242, "loss": 5.5864, "mean_token_accuracy": 0.16826897412538527, "num_tokens": 17498386.0, "step": 7640 }, { "entropy": 5.766921281814575, "epoch": 0.755733491498616, "grad_norm": 1.4453125, "learning_rate": 0.0004951310309809201, "loss": 5.6293, "mean_token_accuracy": 0.16339175999164582, "num_tokens": 17510409.0, "step": 7645 }, { "entropy": 5.711449527740479, "epoch": 0.7562277580071174, "grad_norm": 1.6796875, "learning_rate": 0.0004951237264492585, "loss": 5.566, "mean_token_accuracy": 0.1698060467839241, "num_tokens": 17521803.0, "step": 7650 }, { "entropy": 5.692463731765747, "epoch": 0.7567220245156189, "grad_norm": 1.484375, "learning_rate": 0.0004951164165025192, "loss": 5.6248, "mean_token_accuracy": 0.16975642889738082, "num_tokens": 17532974.0, "step": 7655 }, { "entropy": 5.783552932739258, "epoch": 0.7572162910241202, "grad_norm": 2.125, "learning_rate": 0.0004951091011408818, "loss": 5.5994, "mean_token_accuracy": 0.1688157469034195, "num_tokens": 17544309.0, "step": 7660 }, { "entropy": 5.709373950958252, "epoch": 0.7577105575326216, "grad_norm": 1.53125, "learning_rate": 0.0004951017803645264, "loss": 5.5425, "mean_token_accuracy": 0.16980530321598053, "num_tokens": 17555395.0, "step": 7665 }, { "entropy": 5.680856132507325, "epoch": 0.758204824041123, "grad_norm": 1.7109375, "learning_rate": 0.000495094454173633, "loss": 5.5023, "mean_token_accuracy": 0.17162813395261764, "num_tokens": 17567434.0, "step": 7670 }, { "entropy": 5.778611326217652, "epoch": 0.7586990905496244, "grad_norm": 1.5078125, "learning_rate": 0.0004950871225683819, "loss": 5.6471, "mean_token_accuracy": 0.16490187793970107, "num_tokens": 17578381.0, "step": 7675 }, { "entropy": 5.737913703918457, "epoch": 0.7591933570581257, "grad_norm": 1.4609375, "learning_rate": 0.0004950797855489535, "loss": 5.5999, "mean_token_accuracy": 0.16983857303857802, "num_tokens": 17589732.0, "step": 7680 }, { "entropy": 5.79100489616394, "epoch": 0.7596876235666271, "grad_norm": 1.65625, "learning_rate": 0.0004950724431155283, "loss": 5.5374, "mean_token_accuracy": 0.16733123809099198, "num_tokens": 17601092.0, "step": 7685 }, { "entropy": 5.717710208892822, "epoch": 0.7601818900751285, "grad_norm": 1.515625, "learning_rate": 0.0004950650952682867, "loss": 5.6421, "mean_token_accuracy": 0.16308820098638535, "num_tokens": 17613268.0, "step": 7690 }, { "entropy": 5.780374574661255, "epoch": 0.7606761565836299, "grad_norm": 1.46875, "learning_rate": 0.0004950577420074098, "loss": 5.536, "mean_token_accuracy": 0.16852555721998214, "num_tokens": 17623500.0, "step": 7695 }, { "entropy": 5.770693397521972, "epoch": 0.7611704230921312, "grad_norm": 1.5, "learning_rate": 0.0004950503833330781, "loss": 5.7473, "mean_token_accuracy": 0.1554810255765915, "num_tokens": 17636151.0, "step": 7700 }, { "entropy": 5.761449670791626, "epoch": 0.7616646896006327, "grad_norm": 1.7734375, "learning_rate": 0.0004950430192454729, "loss": 5.6112, "mean_token_accuracy": 0.16518060564994813, "num_tokens": 17648392.0, "step": 7705 }, { "entropy": 5.72187991142273, "epoch": 0.7621589561091341, "grad_norm": 1.71875, "learning_rate": 0.0004950356497447754, "loss": 5.5495, "mean_token_accuracy": 0.16627350598573684, "num_tokens": 17659777.0, "step": 7710 }, { "entropy": 5.785965776443481, "epoch": 0.7626532226176355, "grad_norm": 1.3203125, "learning_rate": 0.0004950282748311666, "loss": 5.6516, "mean_token_accuracy": 0.16374578326940536, "num_tokens": 17671986.0, "step": 7715 }, { "entropy": 5.734409761428833, "epoch": 0.7631474891261368, "grad_norm": 1.46875, "learning_rate": 0.0004950208945048283, "loss": 5.576, "mean_token_accuracy": 0.16800594031810762, "num_tokens": 17683740.0, "step": 7720 }, { "entropy": 5.712638425827026, "epoch": 0.7636417556346382, "grad_norm": 1.453125, "learning_rate": 0.0004950135087659417, "loss": 5.6567, "mean_token_accuracy": 0.16560078561306, "num_tokens": 17696034.0, "step": 7725 }, { "entropy": 5.751904010772705, "epoch": 0.7641360221431396, "grad_norm": 2.5625, "learning_rate": 0.0004950061176146887, "loss": 5.5864, "mean_token_accuracy": 0.16943542659282684, "num_tokens": 17707783.0, "step": 7730 }, { "entropy": 5.737476634979248, "epoch": 0.764630288651641, "grad_norm": 1.4609375, "learning_rate": 0.0004949987210512511, "loss": 5.5474, "mean_token_accuracy": 0.17262809574604035, "num_tokens": 17718127.0, "step": 7735 }, { "entropy": 5.739609050750732, "epoch": 0.7651245551601423, "grad_norm": 1.8046875, "learning_rate": 0.0004949913190758109, "loss": 5.6278, "mean_token_accuracy": 0.1614113688468933, "num_tokens": 17729798.0, "step": 7740 }, { "entropy": 5.787795925140381, "epoch": 0.7656188216686437, "grad_norm": 1.5625, "learning_rate": 0.0004949839116885499, "loss": 5.5846, "mean_token_accuracy": 0.16649723351001738, "num_tokens": 17741989.0, "step": 7745 }, { "entropy": 5.696823358535767, "epoch": 0.7661130881771451, "grad_norm": 1.9375, "learning_rate": 0.0004949764988896508, "loss": 5.6303, "mean_token_accuracy": 0.16772397458553315, "num_tokens": 17753737.0, "step": 7750 }, { "entropy": 5.672492122650146, "epoch": 0.7666073546856464, "grad_norm": 1.4921875, "learning_rate": 0.0004949690806792955, "loss": 5.4977, "mean_token_accuracy": 0.1778843492269516, "num_tokens": 17764158.0, "step": 7755 }, { "entropy": 5.745405960083008, "epoch": 0.7671016211941479, "grad_norm": 1.484375, "learning_rate": 0.0004949616570576668, "loss": 5.6329, "mean_token_accuracy": 0.16734983325004577, "num_tokens": 17775878.0, "step": 7760 }, { "entropy": 5.7288330078125, "epoch": 0.7675958877026493, "grad_norm": 1.4375, "learning_rate": 0.0004949542280249473, "loss": 5.5491, "mean_token_accuracy": 0.17019440233707428, "num_tokens": 17786107.0, "step": 7765 }, { "entropy": 5.716768264770508, "epoch": 0.7680901542111507, "grad_norm": 1.5078125, "learning_rate": 0.0004949467935813196, "loss": 5.6092, "mean_token_accuracy": 0.16628210842609406, "num_tokens": 17798470.0, "step": 7770 }, { "entropy": 5.762594699859619, "epoch": 0.768584420719652, "grad_norm": 1.6796875, "learning_rate": 0.0004949393537269666, "loss": 5.6083, "mean_token_accuracy": 0.16674718111753464, "num_tokens": 17811125.0, "step": 7775 }, { "entropy": 5.714617395401001, "epoch": 0.7690786872281534, "grad_norm": 1.6875, "learning_rate": 0.0004949319084620714, "loss": 5.4803, "mean_token_accuracy": 0.17195260524749756, "num_tokens": 17821535.0, "step": 7780 }, { "entropy": 5.794731998443604, "epoch": 0.7695729537366548, "grad_norm": 1.390625, "learning_rate": 0.000494924457786817, "loss": 5.7081, "mean_token_accuracy": 0.15793583393096924, "num_tokens": 17833493.0, "step": 7785 }, { "entropy": 5.854009294509888, "epoch": 0.7700672202451562, "grad_norm": 1.4375, "learning_rate": 0.0004949170017013871, "loss": 5.6708, "mean_token_accuracy": 0.16421451568603515, "num_tokens": 17844705.0, "step": 7790 }, { "entropy": 5.773963212966919, "epoch": 0.7705614867536575, "grad_norm": 1.6796875, "learning_rate": 0.0004949095402059646, "loss": 5.6724, "mean_token_accuracy": 0.15974969714879989, "num_tokens": 17856088.0, "step": 7795 }, { "entropy": 5.8078529834747314, "epoch": 0.7710557532621589, "grad_norm": 1.46875, "learning_rate": 0.0004949020733007334, "loss": 5.6566, "mean_token_accuracy": 0.16017177999019622, "num_tokens": 17867602.0, "step": 7800 }, { "entropy": 5.803476333618164, "epoch": 0.7715500197706603, "grad_norm": 1.4921875, "learning_rate": 0.000494894600985877, "loss": 5.6991, "mean_token_accuracy": 0.1625214010477066, "num_tokens": 17880487.0, "step": 7805 }, { "entropy": 5.83843674659729, "epoch": 0.7720442862791618, "grad_norm": 2.0, "learning_rate": 0.0004948871232615794, "loss": 5.6192, "mean_token_accuracy": 0.16537441909313202, "num_tokens": 17891690.0, "step": 7810 }, { "entropy": 5.819495391845703, "epoch": 0.7725385527876631, "grad_norm": 1.7421875, "learning_rate": 0.0004948796401280244, "loss": 5.667, "mean_token_accuracy": 0.16117413341999054, "num_tokens": 17903165.0, "step": 7815 }, { "entropy": 5.731281900405884, "epoch": 0.7730328192961645, "grad_norm": 1.65625, "learning_rate": 0.0004948721515853962, "loss": 5.5061, "mean_token_accuracy": 0.17569276541471482, "num_tokens": 17914492.0, "step": 7820 }, { "entropy": 5.739938879013062, "epoch": 0.7735270858046659, "grad_norm": 1.4296875, "learning_rate": 0.0004948646576338789, "loss": 5.5912, "mean_token_accuracy": 0.1642355740070343, "num_tokens": 17926231.0, "step": 7825 }, { "entropy": 5.72123498916626, "epoch": 0.7740213523131673, "grad_norm": 1.7421875, "learning_rate": 0.000494857158273657, "loss": 5.5679, "mean_token_accuracy": 0.1720128521323204, "num_tokens": 17937167.0, "step": 7830 }, { "entropy": 5.773499441146851, "epoch": 0.7745156188216686, "grad_norm": 1.59375, "learning_rate": 0.0004948496535049148, "loss": 5.6419, "mean_token_accuracy": 0.16745395958423615, "num_tokens": 17948939.0, "step": 7835 }, { "entropy": 5.710143995285034, "epoch": 0.77500988533017, "grad_norm": 1.78125, "learning_rate": 0.000494842143327837, "loss": 5.431, "mean_token_accuracy": 0.18013058453798295, "num_tokens": 17959250.0, "step": 7840 }, { "entropy": 5.673285865783692, "epoch": 0.7755041518386714, "grad_norm": 1.796875, "learning_rate": 0.0004948346277426084, "loss": 5.6599, "mean_token_accuracy": 0.16390762478113174, "num_tokens": 17970191.0, "step": 7845 }, { "entropy": 5.7622730255126955, "epoch": 0.7759984183471728, "grad_norm": 2.0, "learning_rate": 0.000494827106749414, "loss": 5.5742, "mean_token_accuracy": 0.17012883871793746, "num_tokens": 17982114.0, "step": 7850 }, { "entropy": 5.843960189819336, "epoch": 0.7764926848556741, "grad_norm": 1.4453125, "learning_rate": 0.0004948195803484385, "loss": 5.6825, "mean_token_accuracy": 0.1603810116648674, "num_tokens": 17994066.0, "step": 7855 }, { "entropy": 5.718367099761963, "epoch": 0.7769869513641756, "grad_norm": 3.203125, "learning_rate": 0.0004948120485398673, "loss": 5.5979, "mean_token_accuracy": 0.16301825344562532, "num_tokens": 18005406.0, "step": 7860 }, { "entropy": 5.71928973197937, "epoch": 0.777481217872677, "grad_norm": 1.6953125, "learning_rate": 0.0004948045113238856, "loss": 5.614, "mean_token_accuracy": 0.16130679994821548, "num_tokens": 18016773.0, "step": 7865 }, { "entropy": 5.8236809253692625, "epoch": 0.7779754843811784, "grad_norm": 1.46875, "learning_rate": 0.0004947969687006787, "loss": 5.6569, "mean_token_accuracy": 0.16104890108108522, "num_tokens": 18028682.0, "step": 7870 }, { "entropy": 5.822891807556152, "epoch": 0.7784697508896797, "grad_norm": 2.21875, "learning_rate": 0.0004947894206704324, "loss": 5.6201, "mean_token_accuracy": 0.16524371057748793, "num_tokens": 18039525.0, "step": 7875 }, { "entropy": 5.726070070266724, "epoch": 0.7789640173981811, "grad_norm": 1.578125, "learning_rate": 0.0004947818672333323, "loss": 5.5996, "mean_token_accuracy": 0.163727305829525, "num_tokens": 18049918.0, "step": 7880 }, { "entropy": 5.791027450561524, "epoch": 0.7794582839066825, "grad_norm": 2.046875, "learning_rate": 0.000494774308389564, "loss": 5.643, "mean_token_accuracy": 0.16190916895866395, "num_tokens": 18061019.0, "step": 7885 }, { "entropy": 5.775240516662597, "epoch": 0.7799525504151839, "grad_norm": 1.9453125, "learning_rate": 0.0004947667441393138, "loss": 5.5796, "mean_token_accuracy": 0.16727473735809326, "num_tokens": 18072123.0, "step": 7890 }, { "entropy": 5.710614395141602, "epoch": 0.7804468169236852, "grad_norm": 1.6875, "learning_rate": 0.0004947591744827674, "loss": 5.6008, "mean_token_accuracy": 0.16120128184556962, "num_tokens": 18083354.0, "step": 7895 }, { "entropy": 5.802106952667236, "epoch": 0.7809410834321866, "grad_norm": 2.1875, "learning_rate": 0.0004947515994201113, "loss": 5.6914, "mean_token_accuracy": 0.15860090479254724, "num_tokens": 18094188.0, "step": 7900 }, { "entropy": 5.792725992202759, "epoch": 0.781435349940688, "grad_norm": 2.359375, "learning_rate": 0.0004947440189515318, "loss": 5.6032, "mean_token_accuracy": 0.16835448443889617, "num_tokens": 18106198.0, "step": 7905 }, { "entropy": 5.766251420974731, "epoch": 0.7819296164491895, "grad_norm": 1.5390625, "learning_rate": 0.0004947364330772154, "loss": 5.5687, "mean_token_accuracy": 0.1729208290576935, "num_tokens": 18117137.0, "step": 7910 }, { "entropy": 5.698108386993408, "epoch": 0.7824238829576908, "grad_norm": 1.4453125, "learning_rate": 0.0004947288417973486, "loss": 5.6236, "mean_token_accuracy": 0.15833986103534697, "num_tokens": 18127341.0, "step": 7915 }, { "entropy": 5.735625219345093, "epoch": 0.7829181494661922, "grad_norm": 1.8046875, "learning_rate": 0.0004947212451121182, "loss": 5.5679, "mean_token_accuracy": 0.16582157760858535, "num_tokens": 18138333.0, "step": 7920 }, { "entropy": 5.854029607772827, "epoch": 0.7834124159746936, "grad_norm": 1.8125, "learning_rate": 0.000494713643021711, "loss": 5.8224, "mean_token_accuracy": 0.15139006227254867, "num_tokens": 18150961.0, "step": 7925 }, { "entropy": 5.845320081710815, "epoch": 0.783906682483195, "grad_norm": 1.828125, "learning_rate": 0.0004947060355263142, "loss": 5.6045, "mean_token_accuracy": 0.1659821465611458, "num_tokens": 18162604.0, "step": 7930 }, { "entropy": 5.793997812271118, "epoch": 0.7844009489916963, "grad_norm": 1.8359375, "learning_rate": 0.0004946984226261149, "loss": 5.6423, "mean_token_accuracy": 0.16274237185716628, "num_tokens": 18174202.0, "step": 7935 }, { "entropy": 5.815287303924561, "epoch": 0.7848952155001977, "grad_norm": 2.765625, "learning_rate": 0.0004946908043213001, "loss": 5.649, "mean_token_accuracy": 0.16121193915605544, "num_tokens": 18185942.0, "step": 7940 }, { "entropy": 5.766228580474854, "epoch": 0.7853894820086991, "grad_norm": 1.96875, "learning_rate": 0.0004946831806120576, "loss": 5.5758, "mean_token_accuracy": 0.16358782947063447, "num_tokens": 18198897.0, "step": 7945 }, { "entropy": 5.713035774230957, "epoch": 0.7858837485172004, "grad_norm": 2.03125, "learning_rate": 0.0004946755514985748, "loss": 5.494, "mean_token_accuracy": 0.17339199781417847, "num_tokens": 18211439.0, "step": 7950 }, { "entropy": 5.67184591293335, "epoch": 0.7863780150257018, "grad_norm": 2.109375, "learning_rate": 0.0004946679169810392, "loss": 5.5178, "mean_token_accuracy": 0.1753073200583458, "num_tokens": 18221864.0, "step": 7955 }, { "entropy": 5.699005889892578, "epoch": 0.7868722815342032, "grad_norm": 2.453125, "learning_rate": 0.000494660277059639, "loss": 5.6852, "mean_token_accuracy": 0.1599324032664299, "num_tokens": 18234005.0, "step": 7960 }, { "entropy": 5.764883041381836, "epoch": 0.7873665480427047, "grad_norm": 2.125, "learning_rate": 0.0004946526317345617, "loss": 5.5763, "mean_token_accuracy": 0.17003808170557022, "num_tokens": 18246804.0, "step": 7965 }, { "entropy": 5.78763518333435, "epoch": 0.787860814551206, "grad_norm": 1.84375, "learning_rate": 0.0004946449810059957, "loss": 5.5721, "mean_token_accuracy": 0.16835487633943558, "num_tokens": 18259192.0, "step": 7970 }, { "entropy": 5.7099353790283205, "epoch": 0.7883550810597074, "grad_norm": 1.4296875, "learning_rate": 0.0004946373248741289, "loss": 5.6096, "mean_token_accuracy": 0.16795953810214997, "num_tokens": 18271073.0, "step": 7975 }, { "entropy": 5.746679973602295, "epoch": 0.7888493475682088, "grad_norm": 1.8046875, "learning_rate": 0.00049462966333915, "loss": 5.607, "mean_token_accuracy": 0.16693271249532698, "num_tokens": 18281650.0, "step": 7980 }, { "entropy": 5.821167373657227, "epoch": 0.7893436140767102, "grad_norm": 2.078125, "learning_rate": 0.0004946219964012473, "loss": 5.5497, "mean_token_accuracy": 0.16873108595609665, "num_tokens": 18292217.0, "step": 7985 }, { "entropy": 5.650928974151611, "epoch": 0.7898378805852115, "grad_norm": 1.828125, "learning_rate": 0.0004946143240606095, "loss": 5.5557, "mean_token_accuracy": 0.16773455291986467, "num_tokens": 18305210.0, "step": 7990 }, { "entropy": 5.711899185180664, "epoch": 0.7903321470937129, "grad_norm": 2.0, "learning_rate": 0.0004946066463174251, "loss": 5.5226, "mean_token_accuracy": 0.172981558740139, "num_tokens": 18316418.0, "step": 7995 }, { "entropy": 5.6965254783630375, "epoch": 0.7908264136022143, "grad_norm": 2.171875, "learning_rate": 0.0004945989631718831, "loss": 5.6019, "mean_token_accuracy": 0.16918894946575164, "num_tokens": 18328637.0, "step": 8000 }, { "entropy": 5.708858489990234, "epoch": 0.7913206801107157, "grad_norm": 1.765625, "learning_rate": 0.0004945912746241727, "loss": 5.4984, "mean_token_accuracy": 0.17455985844135286, "num_tokens": 18340292.0, "step": 8005 }, { "entropy": 5.734827184677124, "epoch": 0.791814946619217, "grad_norm": 1.6171875, "learning_rate": 0.0004945835806744828, "loss": 5.5826, "mean_token_accuracy": 0.16928263306617736, "num_tokens": 18350784.0, "step": 8010 }, { "entropy": 5.804034471511841, "epoch": 0.7923092131277185, "grad_norm": 2.078125, "learning_rate": 0.0004945758813230028, "loss": 5.6269, "mean_token_accuracy": 0.16163259893655776, "num_tokens": 18363147.0, "step": 8015 }, { "entropy": 5.79567584991455, "epoch": 0.7928034796362199, "grad_norm": 2.25, "learning_rate": 0.000494568176569922, "loss": 5.5995, "mean_token_accuracy": 0.1675742194056511, "num_tokens": 18374152.0, "step": 8020 }, { "entropy": 5.745318222045898, "epoch": 0.7932977461447213, "grad_norm": 1.78125, "learning_rate": 0.00049456046641543, "loss": 5.4946, "mean_token_accuracy": 0.16881230026483535, "num_tokens": 18385321.0, "step": 8025 }, { "entropy": 5.675108766555786, "epoch": 0.7937920126532226, "grad_norm": 1.9296875, "learning_rate": 0.0004945527508597165, "loss": 5.5988, "mean_token_accuracy": 0.1631831556558609, "num_tokens": 18397072.0, "step": 8030 }, { "entropy": 5.730170154571534, "epoch": 0.794286279161724, "grad_norm": 1.625, "learning_rate": 0.0004945450299029713, "loss": 5.5449, "mean_token_accuracy": 0.16746590435504913, "num_tokens": 18408172.0, "step": 8035 }, { "entropy": 5.788347434997559, "epoch": 0.7947805456702254, "grad_norm": 1.7421875, "learning_rate": 0.0004945373035453842, "loss": 5.5505, "mean_token_accuracy": 0.1692645326256752, "num_tokens": 18419350.0, "step": 8040 }, { "entropy": 5.686052751541138, "epoch": 0.7952748121787268, "grad_norm": 1.6640625, "learning_rate": 0.0004945295717871454, "loss": 5.5926, "mean_token_accuracy": 0.16614610105752944, "num_tokens": 18430907.0, "step": 8045 }, { "entropy": 5.753582334518432, "epoch": 0.7957690786872281, "grad_norm": 1.7578125, "learning_rate": 0.0004945218346284451, "loss": 5.5776, "mean_token_accuracy": 0.16936265379190446, "num_tokens": 18441167.0, "step": 8050 }, { "entropy": 5.731485366821289, "epoch": 0.7962633451957295, "grad_norm": 1.9453125, "learning_rate": 0.0004945140920694736, "loss": 5.4865, "mean_token_accuracy": 0.17925694435834885, "num_tokens": 18452025.0, "step": 8055 }, { "entropy": 5.770360326766967, "epoch": 0.7967576117042309, "grad_norm": 2.484375, "learning_rate": 0.0004945063441104214, "loss": 5.7099, "mean_token_accuracy": 0.15428086891770362, "num_tokens": 18464305.0, "step": 8060 }, { "entropy": 5.755635833740234, "epoch": 0.7972518782127324, "grad_norm": 2.359375, "learning_rate": 0.0004944985907514791, "loss": 5.6277, "mean_token_accuracy": 0.16804383099079132, "num_tokens": 18476217.0, "step": 8065 }, { "entropy": 5.840139961242675, "epoch": 0.7977461447212337, "grad_norm": 1.921875, "learning_rate": 0.0004944908319928372, "loss": 5.6014, "mean_token_accuracy": 0.16283569633960723, "num_tokens": 18486967.0, "step": 8070 }, { "entropy": 5.804177236557007, "epoch": 0.7982404112297351, "grad_norm": 1.9921875, "learning_rate": 0.0004944830678346871, "loss": 5.5772, "mean_token_accuracy": 0.16123078316450118, "num_tokens": 18498918.0, "step": 8075 }, { "entropy": 5.735114192962646, "epoch": 0.7987346777382365, "grad_norm": 1.828125, "learning_rate": 0.0004944752982772194, "loss": 5.5767, "mean_token_accuracy": 0.1721997916698456, "num_tokens": 18509424.0, "step": 8080 }, { "entropy": 5.687436103820801, "epoch": 0.7992289442467378, "grad_norm": 2.1875, "learning_rate": 0.0004944675233206252, "loss": 5.485, "mean_token_accuracy": 0.17480947375297545, "num_tokens": 18520444.0, "step": 8085 }, { "entropy": 5.692551803588867, "epoch": 0.7997232107552392, "grad_norm": 3.265625, "learning_rate": 0.000494459742965096, "loss": 5.5625, "mean_token_accuracy": 0.17156413346529006, "num_tokens": 18531874.0, "step": 8090 }, { "entropy": 5.79705581665039, "epoch": 0.8002174772637406, "grad_norm": 2.140625, "learning_rate": 0.000494451957210823, "loss": 5.6377, "mean_token_accuracy": 0.16214412003755568, "num_tokens": 18542492.0, "step": 8095 }, { "entropy": 5.810577726364135, "epoch": 0.800711743772242, "grad_norm": 2.0625, "learning_rate": 0.0004944441660579979, "loss": 5.6892, "mean_token_accuracy": 0.15392046570777893, "num_tokens": 18554477.0, "step": 8100 }, { "entropy": 5.748530530929566, "epoch": 0.8012060102807433, "grad_norm": 1.6171875, "learning_rate": 0.0004944363695068121, "loss": 5.5564, "mean_token_accuracy": 0.17218154817819595, "num_tokens": 18565416.0, "step": 8105 }, { "entropy": 5.733624601364136, "epoch": 0.8017002767892447, "grad_norm": 1.7890625, "learning_rate": 0.0004944285675574576, "loss": 5.5239, "mean_token_accuracy": 0.17163797467947006, "num_tokens": 18575949.0, "step": 8110 }, { "entropy": 5.705946159362793, "epoch": 0.8021945432977462, "grad_norm": 1.9609375, "learning_rate": 0.0004944207602101265, "loss": 5.6401, "mean_token_accuracy": 0.16614215821027756, "num_tokens": 18588177.0, "step": 8115 }, { "entropy": 5.770335531234741, "epoch": 0.8026888098062476, "grad_norm": 1.4140625, "learning_rate": 0.0004944129474650104, "loss": 5.4932, "mean_token_accuracy": 0.16864445805549622, "num_tokens": 18599112.0, "step": 8120 }, { "entropy": 5.58718318939209, "epoch": 0.803183076314749, "grad_norm": 1.5078125, "learning_rate": 0.000494405129322302, "loss": 5.4515, "mean_token_accuracy": 0.17800434678792953, "num_tokens": 18610432.0, "step": 8125 }, { "entropy": 5.708334064483642, "epoch": 0.8036773428232503, "grad_norm": 1.5625, "learning_rate": 0.0004943973057821931, "loss": 5.5363, "mean_token_accuracy": 0.16058900356292724, "num_tokens": 18621739.0, "step": 8130 }, { "entropy": 5.75359206199646, "epoch": 0.8041716093317517, "grad_norm": 1.5234375, "learning_rate": 0.0004943894768448768, "loss": 5.5513, "mean_token_accuracy": 0.16682366132736207, "num_tokens": 18631983.0, "step": 8135 }, { "entropy": 5.758172178268433, "epoch": 0.8046658758402531, "grad_norm": 1.78125, "learning_rate": 0.000494381642510545, "loss": 5.6501, "mean_token_accuracy": 0.1592622384428978, "num_tokens": 18643507.0, "step": 8140 }, { "entropy": 5.856941986083984, "epoch": 0.8051601423487544, "grad_norm": 1.5078125, "learning_rate": 0.0004943738027793909, "loss": 5.6847, "mean_token_accuracy": 0.16642322838306428, "num_tokens": 18654516.0, "step": 8145 }, { "entropy": 5.860350036621094, "epoch": 0.8056544088572558, "grad_norm": 1.421875, "learning_rate": 0.0004943659576516072, "loss": 5.6642, "mean_token_accuracy": 0.16003682017326354, "num_tokens": 18666855.0, "step": 8150 }, { "entropy": 5.720005226135254, "epoch": 0.8061486753657572, "grad_norm": 1.8984375, "learning_rate": 0.0004943581071273869, "loss": 5.6396, "mean_token_accuracy": 0.16216532737016678, "num_tokens": 18679105.0, "step": 8155 }, { "entropy": 5.747036457061768, "epoch": 0.8066429418742586, "grad_norm": 1.53125, "learning_rate": 0.0004943502512069232, "loss": 5.7048, "mean_token_accuracy": 0.16681862473487855, "num_tokens": 18691349.0, "step": 8160 }, { "entropy": 5.866746234893799, "epoch": 0.8071372083827599, "grad_norm": 1.9609375, "learning_rate": 0.0004943423898904092, "loss": 5.7216, "mean_token_accuracy": 0.16013684570789338, "num_tokens": 18703773.0, "step": 8165 }, { "entropy": 5.770022296905518, "epoch": 0.8076314748912614, "grad_norm": 1.8515625, "learning_rate": 0.0004943345231780385, "loss": 5.5964, "mean_token_accuracy": 0.16229512095451354, "num_tokens": 18715281.0, "step": 8170 }, { "entropy": 5.730436706542969, "epoch": 0.8081257413997628, "grad_norm": 1.7109375, "learning_rate": 0.0004943266510700043, "loss": 5.5626, "mean_token_accuracy": 0.16943300813436507, "num_tokens": 18726446.0, "step": 8175 }, { "entropy": 5.711192083358765, "epoch": 0.8086200079082642, "grad_norm": 1.7890625, "learning_rate": 0.0004943187735665007, "loss": 5.4443, "mean_token_accuracy": 0.17946724593639374, "num_tokens": 18737348.0, "step": 8180 }, { "entropy": 5.722460412979126, "epoch": 0.8091142744167655, "grad_norm": 1.671875, "learning_rate": 0.0004943108906677211, "loss": 5.5377, "mean_token_accuracy": 0.16783976107835769, "num_tokens": 18748921.0, "step": 8185 }, { "entropy": 5.6996664047241214, "epoch": 0.8096085409252669, "grad_norm": 2.46875, "learning_rate": 0.0004943030023738595, "loss": 5.5646, "mean_token_accuracy": 0.17357683777809144, "num_tokens": 18761252.0, "step": 8190 }, { "entropy": 5.712693071365356, "epoch": 0.8101028074337683, "grad_norm": 1.859375, "learning_rate": 0.0004942951086851102, "loss": 5.5342, "mean_token_accuracy": 0.1661703333258629, "num_tokens": 18772915.0, "step": 8195 }, { "entropy": 5.715088748931885, "epoch": 0.8105970739422697, "grad_norm": 2.046875, "learning_rate": 0.0004942872096016671, "loss": 5.5609, "mean_token_accuracy": 0.17356885224580765, "num_tokens": 18783533.0, "step": 8200 }, { "entropy": 5.696490907669068, "epoch": 0.811091340450771, "grad_norm": 1.3984375, "learning_rate": 0.0004942793051237247, "loss": 5.5334, "mean_token_accuracy": 0.16562338173389435, "num_tokens": 18795068.0, "step": 8205 }, { "entropy": 5.799958515167236, "epoch": 0.8115856069592724, "grad_norm": 1.8046875, "learning_rate": 0.0004942713952514773, "loss": 5.718, "mean_token_accuracy": 0.15598101913928986, "num_tokens": 18808105.0, "step": 8210 }, { "entropy": 5.74779863357544, "epoch": 0.8120798734677738, "grad_norm": 1.9609375, "learning_rate": 0.0004942634799851196, "loss": 5.5751, "mean_token_accuracy": 0.16392529457807542, "num_tokens": 18819275.0, "step": 8215 }, { "entropy": 5.709667634963989, "epoch": 0.8125741399762753, "grad_norm": 1.890625, "learning_rate": 0.0004942555593248463, "loss": 5.5199, "mean_token_accuracy": 0.17542681843042374, "num_tokens": 18828535.0, "step": 8220 }, { "entropy": 5.7056725978851315, "epoch": 0.8130684064847766, "grad_norm": 1.9296875, "learning_rate": 0.0004942476332708522, "loss": 5.5377, "mean_token_accuracy": 0.17447522431612014, "num_tokens": 18839983.0, "step": 8225 }, { "entropy": 5.779212856292725, "epoch": 0.813562672993278, "grad_norm": 1.6875, "learning_rate": 0.0004942397018233322, "loss": 5.6074, "mean_token_accuracy": 0.16651627272367478, "num_tokens": 18851875.0, "step": 8230 }, { "entropy": 5.742778253555298, "epoch": 0.8140569395017794, "grad_norm": 1.546875, "learning_rate": 0.0004942317649824816, "loss": 5.6173, "mean_token_accuracy": 0.1662682831287384, "num_tokens": 18863629.0, "step": 8235 }, { "entropy": 5.688341474533081, "epoch": 0.8145512060102807, "grad_norm": 1.625, "learning_rate": 0.0004942238227484956, "loss": 5.5326, "mean_token_accuracy": 0.17284415364265443, "num_tokens": 18875660.0, "step": 8240 }, { "entropy": 5.7825586795806885, "epoch": 0.8150454725187821, "grad_norm": 1.8359375, "learning_rate": 0.0004942158751215696, "loss": 5.629, "mean_token_accuracy": 0.16246573776006698, "num_tokens": 18887140.0, "step": 8245 }, { "entropy": 5.751757287979126, "epoch": 0.8155397390272835, "grad_norm": 1.4296875, "learning_rate": 0.0004942079221018989, "loss": 5.6324, "mean_token_accuracy": 0.1648348778486252, "num_tokens": 18899386.0, "step": 8250 }, { "entropy": 5.828459548950195, "epoch": 0.8160340055357849, "grad_norm": 1.53125, "learning_rate": 0.0004941999636896795, "loss": 5.6788, "mean_token_accuracy": 0.15502452254295349, "num_tokens": 18911187.0, "step": 8255 }, { "entropy": 5.741218852996826, "epoch": 0.8165282720442862, "grad_norm": 1.5546875, "learning_rate": 0.0004941919998851068, "loss": 5.543, "mean_token_accuracy": 0.1658144935965538, "num_tokens": 18922522.0, "step": 8260 }, { "entropy": 5.624863624572754, "epoch": 0.8170225385527876, "grad_norm": 2.265625, "learning_rate": 0.0004941840306883771, "loss": 5.4739, "mean_token_accuracy": 0.17052083611488342, "num_tokens": 18932689.0, "step": 8265 }, { "entropy": 5.811828184127807, "epoch": 0.8175168050612891, "grad_norm": 1.515625, "learning_rate": 0.0004941760560996861, "loss": 5.7242, "mean_token_accuracy": 0.16082705110311507, "num_tokens": 18944296.0, "step": 8270 }, { "entropy": 5.806406307220459, "epoch": 0.8180110715697905, "grad_norm": 1.671875, "learning_rate": 0.0004941680761192302, "loss": 5.6438, "mean_token_accuracy": 0.1650134488940239, "num_tokens": 18955449.0, "step": 8275 }, { "entropy": 5.840929269790649, "epoch": 0.8185053380782918, "grad_norm": 1.625, "learning_rate": 0.0004941600907472055, "loss": 5.6476, "mean_token_accuracy": 0.16064279079437255, "num_tokens": 18969065.0, "step": 8280 }, { "entropy": 5.764996004104614, "epoch": 0.8189996045867932, "grad_norm": 1.5625, "learning_rate": 0.0004941520999838088, "loss": 5.6348, "mean_token_accuracy": 0.17293646186590195, "num_tokens": 18979801.0, "step": 8285 }, { "entropy": 5.722033262252808, "epoch": 0.8194938710952946, "grad_norm": 1.71875, "learning_rate": 0.0004941441038292363, "loss": 5.6818, "mean_token_accuracy": 0.16279126033186914, "num_tokens": 18990795.0, "step": 8290 }, { "entropy": 5.803367376327515, "epoch": 0.819988137603796, "grad_norm": 1.7890625, "learning_rate": 0.0004941361022836847, "loss": 5.6322, "mean_token_accuracy": 0.16177277714014054, "num_tokens": 19002318.0, "step": 8295 }, { "entropy": 5.774603319168091, "epoch": 0.8204824041122973, "grad_norm": 1.4296875, "learning_rate": 0.0004941280953473513, "loss": 5.6415, "mean_token_accuracy": 0.1721104621887207, "num_tokens": 19014977.0, "step": 8300 }, { "entropy": 5.795838165283203, "epoch": 0.8209766706207987, "grad_norm": 1.6875, "learning_rate": 0.0004941200830204325, "loss": 5.6524, "mean_token_accuracy": 0.16473191753029823, "num_tokens": 19026081.0, "step": 8305 }, { "entropy": 5.792309236526489, "epoch": 0.8214709371293001, "grad_norm": 1.5546875, "learning_rate": 0.0004941120653031256, "loss": 5.6311, "mean_token_accuracy": 0.1613746091723442, "num_tokens": 19037694.0, "step": 8310 }, { "entropy": 5.711976194381714, "epoch": 0.8219652036378015, "grad_norm": 1.5703125, "learning_rate": 0.0004941040421956282, "loss": 5.5316, "mean_token_accuracy": 0.17463389784097672, "num_tokens": 19048344.0, "step": 8315 }, { "entropy": 5.784969282150269, "epoch": 0.8224594701463029, "grad_norm": 1.4140625, "learning_rate": 0.0004940960136981372, "loss": 5.6022, "mean_token_accuracy": 0.16066683381795882, "num_tokens": 19060213.0, "step": 8320 }, { "entropy": 5.7101997375488285, "epoch": 0.8229537366548043, "grad_norm": 1.9921875, "learning_rate": 0.0004940879798108503, "loss": 5.4935, "mean_token_accuracy": 0.17741834223270417, "num_tokens": 19070881.0, "step": 8325 }, { "entropy": 5.726340198516846, "epoch": 0.8234480031633057, "grad_norm": 1.484375, "learning_rate": 0.0004940799405339651, "loss": 5.5341, "mean_token_accuracy": 0.16876033395528794, "num_tokens": 19082206.0, "step": 8330 }, { "entropy": 5.667361116409301, "epoch": 0.8239422696718071, "grad_norm": 1.453125, "learning_rate": 0.0004940718958676794, "loss": 5.5631, "mean_token_accuracy": 0.1733643665909767, "num_tokens": 19094014.0, "step": 8335 }, { "entropy": 5.789534711837769, "epoch": 0.8244365361803084, "grad_norm": 2.28125, "learning_rate": 0.000494063845812191, "loss": 5.5522, "mean_token_accuracy": 0.17264978140592574, "num_tokens": 19106859.0, "step": 8340 }, { "entropy": 5.654939222335815, "epoch": 0.8249308026888098, "grad_norm": 1.640625, "learning_rate": 0.0004940557903676981, "loss": 5.5968, "mean_token_accuracy": 0.1693487599492073, "num_tokens": 19118296.0, "step": 8345 }, { "entropy": 5.741930246353149, "epoch": 0.8254250691973112, "grad_norm": 1.5703125, "learning_rate": 0.0004940477295343988, "loss": 5.544, "mean_token_accuracy": 0.1718739315867424, "num_tokens": 19130212.0, "step": 8350 }, { "entropy": 5.71384630203247, "epoch": 0.8259193357058126, "grad_norm": 1.9453125, "learning_rate": 0.0004940396633124912, "loss": 5.5218, "mean_token_accuracy": 0.1781422570347786, "num_tokens": 19140798.0, "step": 8355 }, { "entropy": 5.773586368560791, "epoch": 0.8264136022143139, "grad_norm": 1.484375, "learning_rate": 0.0004940315917021742, "loss": 5.6263, "mean_token_accuracy": 0.16828884929418564, "num_tokens": 19151875.0, "step": 8360 }, { "entropy": 5.8171134948730465, "epoch": 0.8269078687228153, "grad_norm": 1.328125, "learning_rate": 0.0004940235147036457, "loss": 5.6904, "mean_token_accuracy": 0.15664152204990386, "num_tokens": 19164532.0, "step": 8365 }, { "entropy": 5.73322434425354, "epoch": 0.8274021352313167, "grad_norm": 1.5234375, "learning_rate": 0.000494015432317105, "loss": 5.6274, "mean_token_accuracy": 0.165276001393795, "num_tokens": 19176828.0, "step": 8370 }, { "entropy": 5.6323466300964355, "epoch": 0.8278964017398182, "grad_norm": 1.4375, "learning_rate": 0.0004940073445427506, "loss": 5.4644, "mean_token_accuracy": 0.1765448972582817, "num_tokens": 19188118.0, "step": 8375 }, { "entropy": 5.726210451126098, "epoch": 0.8283906682483195, "grad_norm": 2.15625, "learning_rate": 0.0004939992513807816, "loss": 5.6424, "mean_token_accuracy": 0.1584145173430443, "num_tokens": 19201009.0, "step": 8380 }, { "entropy": 5.74536657333374, "epoch": 0.8288849347568209, "grad_norm": 1.625, "learning_rate": 0.0004939911528313971, "loss": 5.543, "mean_token_accuracy": 0.16552556604146956, "num_tokens": 19212747.0, "step": 8385 }, { "entropy": 5.7278941631317135, "epoch": 0.8293792012653223, "grad_norm": 1.5390625, "learning_rate": 0.000493983048894796, "loss": 5.6061, "mean_token_accuracy": 0.16094849705696107, "num_tokens": 19224043.0, "step": 8390 }, { "entropy": 5.742194604873657, "epoch": 0.8298734677738236, "grad_norm": 1.5859375, "learning_rate": 0.0004939749395711782, "loss": 5.5166, "mean_token_accuracy": 0.16918471604585647, "num_tokens": 19235475.0, "step": 8395 }, { "entropy": 5.848622798919678, "epoch": 0.830367734282325, "grad_norm": 1.2734375, "learning_rate": 0.0004939668248607428, "loss": 5.6148, "mean_token_accuracy": 0.16481879055500032, "num_tokens": 19247208.0, "step": 8400 }, { "entropy": 5.7011463165283205, "epoch": 0.8308620007908264, "grad_norm": 1.2890625, "learning_rate": 0.0004939587047636896, "loss": 5.5725, "mean_token_accuracy": 0.16622405797243117, "num_tokens": 19260172.0, "step": 8405 }, { "entropy": 5.751612997055053, "epoch": 0.8313562672993278, "grad_norm": 1.625, "learning_rate": 0.0004939505792802182, "loss": 5.6284, "mean_token_accuracy": 0.1683248460292816, "num_tokens": 19271173.0, "step": 8410 }, { "entropy": 5.7848186016082765, "epoch": 0.8318505338078291, "grad_norm": 1.3359375, "learning_rate": 0.0004939424484105287, "loss": 5.5965, "mean_token_accuracy": 0.17174357622861863, "num_tokens": 19282693.0, "step": 8415 }, { "entropy": 5.73541841506958, "epoch": 0.8323448003163305, "grad_norm": 1.6953125, "learning_rate": 0.0004939343121548209, "loss": 5.6297, "mean_token_accuracy": 0.15996363162994384, "num_tokens": 19293883.0, "step": 8420 }, { "entropy": 5.6662674903869625, "epoch": 0.832839066824832, "grad_norm": 1.46875, "learning_rate": 0.0004939261705132951, "loss": 5.474, "mean_token_accuracy": 0.1741936683654785, "num_tokens": 19304530.0, "step": 8425 }, { "entropy": 5.645070791244507, "epoch": 0.8333333333333334, "grad_norm": 1.390625, "learning_rate": 0.0004939180234861516, "loss": 5.5249, "mean_token_accuracy": 0.17261814922094346, "num_tokens": 19315765.0, "step": 8430 }, { "entropy": 5.750543737411499, "epoch": 0.8338275998418347, "grad_norm": 1.8203125, "learning_rate": 0.0004939098710735906, "loss": 5.5881, "mean_token_accuracy": 0.16688463538885118, "num_tokens": 19328484.0, "step": 8435 }, { "entropy": 5.6985454082489015, "epoch": 0.8343218663503361, "grad_norm": 1.5390625, "learning_rate": 0.0004939017132758129, "loss": 5.5335, "mean_token_accuracy": 0.17178886979818345, "num_tokens": 19340594.0, "step": 8440 }, { "entropy": 5.813464736938476, "epoch": 0.8348161328588375, "grad_norm": 1.546875, "learning_rate": 0.0004938935500930192, "loss": 5.6238, "mean_token_accuracy": 0.16470698714256288, "num_tokens": 19351105.0, "step": 8445 }, { "entropy": 5.729646682739258, "epoch": 0.8353103993673389, "grad_norm": 1.65625, "learning_rate": 0.0004938853815254101, "loss": 5.5312, "mean_token_accuracy": 0.17212710082530974, "num_tokens": 19361619.0, "step": 8450 }, { "entropy": 5.739841556549072, "epoch": 0.8358046658758402, "grad_norm": 1.484375, "learning_rate": 0.0004938772075731867, "loss": 5.6958, "mean_token_accuracy": 0.16396330744028093, "num_tokens": 19374251.0, "step": 8455 }, { "entropy": 5.80084490776062, "epoch": 0.8362989323843416, "grad_norm": 2.625, "learning_rate": 0.0004938690282365499, "loss": 5.6386, "mean_token_accuracy": 0.1563650041818619, "num_tokens": 19386300.0, "step": 8460 }, { "entropy": 5.709263563156128, "epoch": 0.836793198892843, "grad_norm": 1.3046875, "learning_rate": 0.0004938608435157012, "loss": 5.5593, "mean_token_accuracy": 0.1674885407090187, "num_tokens": 19397082.0, "step": 8465 }, { "entropy": 5.699165153503418, "epoch": 0.8372874654013444, "grad_norm": 1.7890625, "learning_rate": 0.0004938526534108417, "loss": 5.6282, "mean_token_accuracy": 0.16458649039268494, "num_tokens": 19409123.0, "step": 8470 }, { "entropy": 5.634624910354614, "epoch": 0.8377817319098458, "grad_norm": 2.0625, "learning_rate": 0.0004938444579221732, "loss": 5.3999, "mean_token_accuracy": 0.1866477444767952, "num_tokens": 19419854.0, "step": 8475 }, { "entropy": 5.757629108428955, "epoch": 0.8382759984183472, "grad_norm": 1.5, "learning_rate": 0.0004938362570498969, "loss": 5.6005, "mean_token_accuracy": 0.16824939399957656, "num_tokens": 19430825.0, "step": 8480 }, { "entropy": 5.708920335769653, "epoch": 0.8387702649268486, "grad_norm": 1.53125, "learning_rate": 0.0004938280507942146, "loss": 5.6112, "mean_token_accuracy": 0.16124509274959564, "num_tokens": 19442617.0, "step": 8485 }, { "entropy": 5.83821210861206, "epoch": 0.83926453143535, "grad_norm": 1.578125, "learning_rate": 0.0004938198391553285, "loss": 5.6299, "mean_token_accuracy": 0.1635190352797508, "num_tokens": 19453911.0, "step": 8490 }, { "entropy": 5.6762285232543945, "epoch": 0.8397587979438513, "grad_norm": 1.7734375, "learning_rate": 0.0004938116221334404, "loss": 5.5267, "mean_token_accuracy": 0.17146094739437104, "num_tokens": 19464837.0, "step": 8495 }, { "entropy": 5.660635662078858, "epoch": 0.8402530644523527, "grad_norm": 1.5703125, "learning_rate": 0.0004938033997287524, "loss": 5.5105, "mean_token_accuracy": 0.17637209445238114, "num_tokens": 19477067.0, "step": 8500 }, { "entropy": 5.66599178314209, "epoch": 0.8407473309608541, "grad_norm": 1.7890625, "learning_rate": 0.0004937951719414668, "loss": 5.5559, "mean_token_accuracy": 0.1712522029876709, "num_tokens": 19489442.0, "step": 8505 }, { "entropy": 5.6885395526885985, "epoch": 0.8412415974693555, "grad_norm": 1.453125, "learning_rate": 0.0004937869387717861, "loss": 5.525, "mean_token_accuracy": 0.16600052267313004, "num_tokens": 19501197.0, "step": 8510 }, { "entropy": 5.7533753395080565, "epoch": 0.8417358639778568, "grad_norm": 1.453125, "learning_rate": 0.0004937787002199127, "loss": 5.551, "mean_token_accuracy": 0.1710121750831604, "num_tokens": 19513311.0, "step": 8515 }, { "entropy": 5.8224297046661375, "epoch": 0.8422301304863582, "grad_norm": 1.578125, "learning_rate": 0.0004937704562860493, "loss": 5.6781, "mean_token_accuracy": 0.16092755049467086, "num_tokens": 19525643.0, "step": 8520 }, { "entropy": 5.6762122631073, "epoch": 0.8427243969948597, "grad_norm": 1.640625, "learning_rate": 0.0004937622069703988, "loss": 5.485, "mean_token_accuracy": 0.1767942041158676, "num_tokens": 19537478.0, "step": 8525 }, { "entropy": 5.732364177703857, "epoch": 0.843218663503361, "grad_norm": 1.6328125, "learning_rate": 0.0004937539522731641, "loss": 5.5552, "mean_token_accuracy": 0.17082753777503967, "num_tokens": 19549370.0, "step": 8530 }, { "entropy": 5.772033739089966, "epoch": 0.8437129300118624, "grad_norm": 1.890625, "learning_rate": 0.0004937456921945482, "loss": 5.5, "mean_token_accuracy": 0.17610560804605485, "num_tokens": 19561793.0, "step": 8535 }, { "entropy": 5.596465587615967, "epoch": 0.8442071965203638, "grad_norm": 1.7734375, "learning_rate": 0.0004937374267347543, "loss": 5.4331, "mean_token_accuracy": 0.18058519512414933, "num_tokens": 19573603.0, "step": 8540 }, { "entropy": 5.679430818557739, "epoch": 0.8447014630288652, "grad_norm": 1.5234375, "learning_rate": 0.0004937291558939858, "loss": 5.6086, "mean_token_accuracy": 0.1616741880774498, "num_tokens": 19584848.0, "step": 8545 }, { "entropy": 5.734065532684326, "epoch": 0.8451957295373665, "grad_norm": 1.5, "learning_rate": 0.0004937208796724461, "loss": 5.5647, "mean_token_accuracy": 0.16682935655117034, "num_tokens": 19594965.0, "step": 8550 }, { "entropy": 5.741935729980469, "epoch": 0.8456899960458679, "grad_norm": 1.671875, "learning_rate": 0.0004937125980703389, "loss": 5.4621, "mean_token_accuracy": 0.17768049091100693, "num_tokens": 19607347.0, "step": 8555 }, { "entropy": 5.737591218948364, "epoch": 0.8461842625543693, "grad_norm": 1.5859375, "learning_rate": 0.0004937043110878678, "loss": 5.5231, "mean_token_accuracy": 0.17151321321725846, "num_tokens": 19618614.0, "step": 8560 }, { "entropy": 5.729369211196899, "epoch": 0.8466785290628707, "grad_norm": 1.5703125, "learning_rate": 0.0004936960187252367, "loss": 5.5566, "mean_token_accuracy": 0.16908628940582277, "num_tokens": 19630409.0, "step": 8565 }, { "entropy": 5.691347980499268, "epoch": 0.847172795571372, "grad_norm": 2.125, "learning_rate": 0.0004936877209826497, "loss": 5.5892, "mean_token_accuracy": 0.16252141147851945, "num_tokens": 19642183.0, "step": 8570 }, { "entropy": 5.7433980941772464, "epoch": 0.8476670620798734, "grad_norm": 1.5078125, "learning_rate": 0.0004936794178603108, "loss": 5.585, "mean_token_accuracy": 0.17702843695878984, "num_tokens": 19653846.0, "step": 8575 }, { "entropy": 5.765725612640381, "epoch": 0.8481613285883749, "grad_norm": 2.234375, "learning_rate": 0.0004936711093584242, "loss": 5.5551, "mean_token_accuracy": 0.1723070040345192, "num_tokens": 19664183.0, "step": 8580 }, { "entropy": 5.719138860702515, "epoch": 0.8486555950968763, "grad_norm": 1.640625, "learning_rate": 0.0004936627954771945, "loss": 5.552, "mean_token_accuracy": 0.1693572610616684, "num_tokens": 19675863.0, "step": 8585 }, { "entropy": 5.646349763870239, "epoch": 0.8491498616053776, "grad_norm": 1.5234375, "learning_rate": 0.0004936544762168261, "loss": 5.571, "mean_token_accuracy": 0.17368430644273758, "num_tokens": 19688410.0, "step": 8590 }, { "entropy": 5.736141061782837, "epoch": 0.849644128113879, "grad_norm": 1.65625, "learning_rate": 0.0004936461515775237, "loss": 5.5386, "mean_token_accuracy": 0.16690851300954818, "num_tokens": 19698849.0, "step": 8595 }, { "entropy": 5.842454051971435, "epoch": 0.8501383946223804, "grad_norm": 1.75, "learning_rate": 0.000493637821559492, "loss": 5.7097, "mean_token_accuracy": 0.15919574201107026, "num_tokens": 19710761.0, "step": 8600 }, { "entropy": 5.764397382736206, "epoch": 0.8506326611308818, "grad_norm": 1.5859375, "learning_rate": 0.0004936294861629358, "loss": 5.5974, "mean_token_accuracy": 0.1675185576081276, "num_tokens": 19722530.0, "step": 8605 }, { "entropy": 5.670903205871582, "epoch": 0.8511269276393831, "grad_norm": 1.3828125, "learning_rate": 0.0004936211453880606, "loss": 5.512, "mean_token_accuracy": 0.17287883907556534, "num_tokens": 19733352.0, "step": 8610 }, { "entropy": 5.7012639999389645, "epoch": 0.8516211941478845, "grad_norm": 1.4140625, "learning_rate": 0.0004936127992350712, "loss": 5.5806, "mean_token_accuracy": 0.17090388685464858, "num_tokens": 19745071.0, "step": 8615 }, { "entropy": 5.742192649841309, "epoch": 0.8521154606563859, "grad_norm": 2.109375, "learning_rate": 0.0004936044477041729, "loss": 5.5244, "mean_token_accuracy": 0.17320816963911057, "num_tokens": 19756039.0, "step": 8620 }, { "entropy": 5.722411012649536, "epoch": 0.8526097271648873, "grad_norm": 1.7265625, "learning_rate": 0.0004935960907955715, "loss": 5.619, "mean_token_accuracy": 0.16041606664657593, "num_tokens": 19768728.0, "step": 8625 }, { "entropy": 5.718424987792969, "epoch": 0.8531039936733887, "grad_norm": 1.7421875, "learning_rate": 0.0004935877285094722, "loss": 5.5978, "mean_token_accuracy": 0.1654672145843506, "num_tokens": 19780010.0, "step": 8630 }, { "entropy": 5.7518528461456295, "epoch": 0.8535982601818901, "grad_norm": 2.53125, "learning_rate": 0.000493579360846081, "loss": 5.5281, "mean_token_accuracy": 0.17875559329986573, "num_tokens": 19790082.0, "step": 8635 }, { "entropy": 5.7833168506622314, "epoch": 0.8540925266903915, "grad_norm": 2.40625, "learning_rate": 0.0004935709878056034, "loss": 5.6247, "mean_token_accuracy": 0.16765579134225844, "num_tokens": 19801702.0, "step": 8640 }, { "entropy": 5.710736656188965, "epoch": 0.8545867931988929, "grad_norm": 2.3125, "learning_rate": 0.0004935626093882457, "loss": 5.6742, "mean_token_accuracy": 0.16747738271951676, "num_tokens": 19812173.0, "step": 8645 }, { "entropy": 5.680256938934326, "epoch": 0.8550810597073942, "grad_norm": 2.265625, "learning_rate": 0.000493554225594214, "loss": 5.5398, "mean_token_accuracy": 0.17358147948980332, "num_tokens": 19823286.0, "step": 8650 }, { "entropy": 5.7853436946868895, "epoch": 0.8555753262158956, "grad_norm": 1.7265625, "learning_rate": 0.0004935458364237143, "loss": 5.5524, "mean_token_accuracy": 0.17029246538877488, "num_tokens": 19834472.0, "step": 8655 }, { "entropy": 5.784717130661011, "epoch": 0.856069592724397, "grad_norm": 2.28125, "learning_rate": 0.0004935374418769532, "loss": 5.5765, "mean_token_accuracy": 0.16844407021999358, "num_tokens": 19845073.0, "step": 8660 }, { "entropy": 5.765900182723999, "epoch": 0.8565638592328984, "grad_norm": 1.6015625, "learning_rate": 0.0004935290419541371, "loss": 5.6283, "mean_token_accuracy": 0.1618078276515007, "num_tokens": 19856762.0, "step": 8665 }, { "entropy": 5.711626052856445, "epoch": 0.8570581257413997, "grad_norm": 1.59375, "learning_rate": 0.0004935206366554726, "loss": 5.5423, "mean_token_accuracy": 0.17094463855028152, "num_tokens": 19867358.0, "step": 8670 }, { "entropy": 5.702182626724243, "epoch": 0.8575523922499011, "grad_norm": 1.453125, "learning_rate": 0.0004935122259811667, "loss": 5.5829, "mean_token_accuracy": 0.1757657617330551, "num_tokens": 19878527.0, "step": 8675 }, { "entropy": 5.77548394203186, "epoch": 0.8580466587584026, "grad_norm": 2.109375, "learning_rate": 0.000493503809931426, "loss": 5.6172, "mean_token_accuracy": 0.1653773806989193, "num_tokens": 19889680.0, "step": 8680 }, { "entropy": 5.751953983306885, "epoch": 0.858540925266904, "grad_norm": 1.8515625, "learning_rate": 0.0004934953885064577, "loss": 5.5199, "mean_token_accuracy": 0.17434027343988417, "num_tokens": 19900569.0, "step": 8685 }, { "entropy": 5.661594724655151, "epoch": 0.8590351917754053, "grad_norm": 1.640625, "learning_rate": 0.000493486961706469, "loss": 5.4962, "mean_token_accuracy": 0.17351965010166168, "num_tokens": 19912537.0, "step": 8690 }, { "entropy": 5.705906391143799, "epoch": 0.8595294582839067, "grad_norm": 1.84375, "learning_rate": 0.0004934785295316672, "loss": 5.5611, "mean_token_accuracy": 0.16770893782377244, "num_tokens": 19923931.0, "step": 8695 }, { "entropy": 5.814125823974609, "epoch": 0.8600237247924081, "grad_norm": 1.9296875, "learning_rate": 0.0004934700919822596, "loss": 5.6378, "mean_token_accuracy": 0.16237291246652602, "num_tokens": 19933956.0, "step": 8700 }, { "entropy": 5.696491146087647, "epoch": 0.8605179913009094, "grad_norm": 1.796875, "learning_rate": 0.0004934616490584538, "loss": 5.5152, "mean_token_accuracy": 0.1765739381313324, "num_tokens": 19945603.0, "step": 8705 }, { "entropy": 5.76496958732605, "epoch": 0.8610122578094108, "grad_norm": 1.7421875, "learning_rate": 0.0004934532007604577, "loss": 5.5922, "mean_token_accuracy": 0.167815600335598, "num_tokens": 19956358.0, "step": 8710 }, { "entropy": 5.721701908111572, "epoch": 0.8615065243179122, "grad_norm": 1.8515625, "learning_rate": 0.0004934447470884788, "loss": 5.5212, "mean_token_accuracy": 0.17156184166669847, "num_tokens": 19967856.0, "step": 8715 }, { "entropy": 5.672111463546753, "epoch": 0.8620007908264136, "grad_norm": 2.328125, "learning_rate": 0.0004934362880427253, "loss": 5.5499, "mean_token_accuracy": 0.1714496999979019, "num_tokens": 19979323.0, "step": 8720 }, { "entropy": 5.793496084213257, "epoch": 0.8624950573349149, "grad_norm": 2.3125, "learning_rate": 0.0004934278236234052, "loss": 5.6038, "mean_token_accuracy": 0.1626463383436203, "num_tokens": 19991543.0, "step": 8725 }, { "entropy": 5.796078205108643, "epoch": 0.8629893238434164, "grad_norm": 1.796875, "learning_rate": 0.0004934193538307268, "loss": 5.5933, "mean_token_accuracy": 0.16286921501159668, "num_tokens": 20003621.0, "step": 8730 }, { "entropy": 5.684550333023071, "epoch": 0.8634835903519178, "grad_norm": 2.515625, "learning_rate": 0.0004934108786648983, "loss": 5.5786, "mean_token_accuracy": 0.16030988246202468, "num_tokens": 20015183.0, "step": 8735 }, { "entropy": 5.740259408950806, "epoch": 0.8639778568604192, "grad_norm": 1.5, "learning_rate": 0.0004934023981261285, "loss": 5.5143, "mean_token_accuracy": 0.17002393901348115, "num_tokens": 20026735.0, "step": 8740 }, { "entropy": 5.755583667755127, "epoch": 0.8644721233689205, "grad_norm": 1.90625, "learning_rate": 0.0004933939122146256, "loss": 5.493, "mean_token_accuracy": 0.16880759298801423, "num_tokens": 20037410.0, "step": 8745 }, { "entropy": 5.5991795539855955, "epoch": 0.8649663898774219, "grad_norm": 1.7265625, "learning_rate": 0.0004933854209305987, "loss": 5.4981, "mean_token_accuracy": 0.17080789059400558, "num_tokens": 20048972.0, "step": 8750 }, { "entropy": 5.707715702056885, "epoch": 0.8654606563859233, "grad_norm": 1.9765625, "learning_rate": 0.0004933769242742566, "loss": 5.5287, "mean_token_accuracy": 0.17359218299388884, "num_tokens": 20059667.0, "step": 8755 }, { "entropy": 5.707452774047852, "epoch": 0.8659549228944247, "grad_norm": 1.578125, "learning_rate": 0.0004933684222458082, "loss": 5.4851, "mean_token_accuracy": 0.17378606051206588, "num_tokens": 20070612.0, "step": 8760 }, { "entropy": 5.647929525375366, "epoch": 0.866449189402926, "grad_norm": 3.265625, "learning_rate": 0.0004933599148454628, "loss": 5.5018, "mean_token_accuracy": 0.17339118272066117, "num_tokens": 20081445.0, "step": 8765 }, { "entropy": 5.774861288070679, "epoch": 0.8669434559114274, "grad_norm": 1.5859375, "learning_rate": 0.0004933514020734296, "loss": 5.6464, "mean_token_accuracy": 0.16188667863607406, "num_tokens": 20094414.0, "step": 8770 }, { "entropy": 5.723762559890747, "epoch": 0.8674377224199288, "grad_norm": 1.671875, "learning_rate": 0.0004933428839299181, "loss": 5.4601, "mean_token_accuracy": 0.1835716888308525, "num_tokens": 20106793.0, "step": 8775 }, { "entropy": 5.698265886306762, "epoch": 0.8679319889284303, "grad_norm": 1.984375, "learning_rate": 0.0004933343604151376, "loss": 5.5529, "mean_token_accuracy": 0.17220603823661804, "num_tokens": 20118582.0, "step": 8780 }, { "entropy": 5.741739892959595, "epoch": 0.8684262554369316, "grad_norm": 1.8359375, "learning_rate": 0.0004933258315292982, "loss": 5.5108, "mean_token_accuracy": 0.1700451508164406, "num_tokens": 20130548.0, "step": 8785 }, { "entropy": 5.772466707229614, "epoch": 0.868920521945433, "grad_norm": 1.7890625, "learning_rate": 0.0004933172972726094, "loss": 5.6551, "mean_token_accuracy": 0.16548369973897933, "num_tokens": 20141821.0, "step": 8790 }, { "entropy": 5.714755010604859, "epoch": 0.8694147884539344, "grad_norm": 2.078125, "learning_rate": 0.0004933087576452811, "loss": 5.5783, "mean_token_accuracy": 0.17281537801027297, "num_tokens": 20152071.0, "step": 8795 }, { "entropy": 5.786811208724975, "epoch": 0.8699090549624358, "grad_norm": 1.6953125, "learning_rate": 0.0004933002126475235, "loss": 5.5795, "mean_token_accuracy": 0.16612692028284073, "num_tokens": 20163780.0, "step": 8800 }, { "entropy": 5.738742542266846, "epoch": 0.8704033214709371, "grad_norm": 2.328125, "learning_rate": 0.0004932916622795468, "loss": 5.6145, "mean_token_accuracy": 0.16578862071037292, "num_tokens": 20175477.0, "step": 8805 }, { "entropy": 5.624256181716919, "epoch": 0.8708975879794385, "grad_norm": 2.015625, "learning_rate": 0.0004932831065415614, "loss": 5.5104, "mean_token_accuracy": 0.17047771364450454, "num_tokens": 20189452.0, "step": 8810 }, { "entropy": 5.768142175674439, "epoch": 0.8713918544879399, "grad_norm": 1.7265625, "learning_rate": 0.0004932745454337778, "loss": 5.6011, "mean_token_accuracy": 0.16280566155910492, "num_tokens": 20201250.0, "step": 8815 }, { "entropy": 5.7166344165802006, "epoch": 0.8718861209964412, "grad_norm": 1.5859375, "learning_rate": 0.0004932659789564065, "loss": 5.5081, "mean_token_accuracy": 0.17887499630451204, "num_tokens": 20212394.0, "step": 8820 }, { "entropy": 5.729531717300415, "epoch": 0.8723803875049426, "grad_norm": 1.7421875, "learning_rate": 0.0004932574071096581, "loss": 5.5072, "mean_token_accuracy": 0.17219230085611342, "num_tokens": 20223262.0, "step": 8825 }, { "entropy": 5.698611259460449, "epoch": 0.872874654013444, "grad_norm": 1.8359375, "learning_rate": 0.0004932488298937437, "loss": 5.6138, "mean_token_accuracy": 0.1673371374607086, "num_tokens": 20234088.0, "step": 8830 }, { "entropy": 5.660132932662964, "epoch": 0.8733689205219455, "grad_norm": 1.5703125, "learning_rate": 0.0004932402473088743, "loss": 5.4931, "mean_token_accuracy": 0.17071036249399185, "num_tokens": 20245373.0, "step": 8835 }, { "entropy": 5.775502157211304, "epoch": 0.8738631870304469, "grad_norm": 2.984375, "learning_rate": 0.0004932316593552609, "loss": 5.6064, "mean_token_accuracy": 0.17334347367286682, "num_tokens": 20255824.0, "step": 8840 }, { "entropy": 5.661215305328369, "epoch": 0.8743574535389482, "grad_norm": 1.59375, "learning_rate": 0.0004932230660331148, "loss": 5.4655, "mean_token_accuracy": 0.17837783545255662, "num_tokens": 20266576.0, "step": 8845 }, { "entropy": 5.790356683731079, "epoch": 0.8748517200474496, "grad_norm": 2.3125, "learning_rate": 0.0004932144673426475, "loss": 5.5982, "mean_token_accuracy": 0.16162995994091034, "num_tokens": 20277874.0, "step": 8850 }, { "entropy": 5.695214176177979, "epoch": 0.875345986555951, "grad_norm": 1.7578125, "learning_rate": 0.0004932058632840705, "loss": 5.5188, "mean_token_accuracy": 0.172012996673584, "num_tokens": 20288403.0, "step": 8855 }, { "entropy": 5.764313507080078, "epoch": 0.8758402530644523, "grad_norm": 1.828125, "learning_rate": 0.0004931972538575952, "loss": 5.5804, "mean_token_accuracy": 0.16243908554315567, "num_tokens": 20299564.0, "step": 8860 }, { "entropy": 5.680908489227295, "epoch": 0.8763345195729537, "grad_norm": 1.5703125, "learning_rate": 0.0004931886390634338, "loss": 5.4998, "mean_token_accuracy": 0.17179912477731704, "num_tokens": 20312208.0, "step": 8865 }, { "entropy": 5.705981826782226, "epoch": 0.8768287860814551, "grad_norm": 1.828125, "learning_rate": 0.000493180018901798, "loss": 5.6039, "mean_token_accuracy": 0.16613852381706237, "num_tokens": 20323486.0, "step": 8870 }, { "entropy": 5.804632759094238, "epoch": 0.8773230525899565, "grad_norm": 1.53125, "learning_rate": 0.0004931713933728997, "loss": 5.6091, "mean_token_accuracy": 0.16351276636123657, "num_tokens": 20335806.0, "step": 8875 }, { "entropy": 5.742422723770142, "epoch": 0.8778173190984578, "grad_norm": 1.5859375, "learning_rate": 0.0004931627624769515, "loss": 5.4946, "mean_token_accuracy": 0.1730387896299362, "num_tokens": 20347216.0, "step": 8880 }, { "entropy": 5.6844422817230225, "epoch": 0.8783115856069593, "grad_norm": 1.859375, "learning_rate": 0.0004931541262141653, "loss": 5.5852, "mean_token_accuracy": 0.1655227795243263, "num_tokens": 20358938.0, "step": 8885 }, { "entropy": 5.708975553512573, "epoch": 0.8788058521154607, "grad_norm": 1.65625, "learning_rate": 0.0004931454845847539, "loss": 5.5966, "mean_token_accuracy": 0.16430084109306337, "num_tokens": 20370742.0, "step": 8890 }, { "entropy": 5.653120803833008, "epoch": 0.8793001186239621, "grad_norm": 2.578125, "learning_rate": 0.0004931368375889298, "loss": 5.4753, "mean_token_accuracy": 0.17863573729991913, "num_tokens": 20382100.0, "step": 8895 }, { "entropy": 5.774899673461914, "epoch": 0.8797943851324634, "grad_norm": 2.015625, "learning_rate": 0.0004931281852269054, "loss": 5.6282, "mean_token_accuracy": 0.16720043271780013, "num_tokens": 20393348.0, "step": 8900 }, { "entropy": 5.726962852478027, "epoch": 0.8802886516409648, "grad_norm": 1.8359375, "learning_rate": 0.000493119527498894, "loss": 5.4671, "mean_token_accuracy": 0.17663811445236205, "num_tokens": 20403471.0, "step": 8905 }, { "entropy": 5.726318407058716, "epoch": 0.8807829181494662, "grad_norm": 2.09375, "learning_rate": 0.0004931108644051084, "loss": 5.5251, "mean_token_accuracy": 0.1799784854054451, "num_tokens": 20415146.0, "step": 8910 }, { "entropy": 5.739230489730835, "epoch": 0.8812771846579676, "grad_norm": 1.6875, "learning_rate": 0.0004931021959457617, "loss": 5.5466, "mean_token_accuracy": 0.1642392247915268, "num_tokens": 20425857.0, "step": 8915 }, { "entropy": 5.7194342613220215, "epoch": 0.8817714511664689, "grad_norm": 1.8046875, "learning_rate": 0.000493093522121067, "loss": 5.659, "mean_token_accuracy": 0.16173420399427413, "num_tokens": 20437987.0, "step": 8920 }, { "entropy": 5.692117977142334, "epoch": 0.8822657176749703, "grad_norm": 2.21875, "learning_rate": 0.0004930848429312379, "loss": 5.4962, "mean_token_accuracy": 0.17015793770551682, "num_tokens": 20449079.0, "step": 8925 }, { "entropy": 5.791934490203857, "epoch": 0.8827599841834717, "grad_norm": 2.203125, "learning_rate": 0.0004930761583764879, "loss": 5.6569, "mean_token_accuracy": 0.16063505560159683, "num_tokens": 20461032.0, "step": 8930 }, { "entropy": 5.79985876083374, "epoch": 0.8832542506919732, "grad_norm": 1.5390625, "learning_rate": 0.0004930674684570306, "loss": 5.6377, "mean_token_accuracy": 0.16756799966096877, "num_tokens": 20471825.0, "step": 8935 }, { "entropy": 5.73646650314331, "epoch": 0.8837485172004745, "grad_norm": 2.015625, "learning_rate": 0.0004930587731730796, "loss": 5.5765, "mean_token_accuracy": 0.1716840773820877, "num_tokens": 20483329.0, "step": 8940 }, { "entropy": 5.716999340057373, "epoch": 0.8842427837089759, "grad_norm": 1.609375, "learning_rate": 0.000493050072524849, "loss": 5.5456, "mean_token_accuracy": 0.16333414018154144, "num_tokens": 20494537.0, "step": 8945 }, { "entropy": 5.679772901535034, "epoch": 0.8847370502174773, "grad_norm": 1.8203125, "learning_rate": 0.0004930413665125528, "loss": 5.5126, "mean_token_accuracy": 0.1739257425069809, "num_tokens": 20506205.0, "step": 8950 }, { "entropy": 5.771314525604248, "epoch": 0.8852313167259787, "grad_norm": 1.8203125, "learning_rate": 0.0004930326551364052, "loss": 5.5617, "mean_token_accuracy": 0.16719167828559875, "num_tokens": 20517447.0, "step": 8955 }, { "entropy": 5.727482795715332, "epoch": 0.88572558323448, "grad_norm": 1.6953125, "learning_rate": 0.0004930239383966204, "loss": 5.6009, "mean_token_accuracy": 0.169428226351738, "num_tokens": 20529435.0, "step": 8960 }, { "entropy": 5.687300539016723, "epoch": 0.8862198497429814, "grad_norm": 2.265625, "learning_rate": 0.0004930152162934128, "loss": 5.4441, "mean_token_accuracy": 0.1800736054778099, "num_tokens": 20540151.0, "step": 8965 }, { "entropy": 5.684276580810547, "epoch": 0.8867141162514828, "grad_norm": 1.8828125, "learning_rate": 0.0004930064888269973, "loss": 5.5866, "mean_token_accuracy": 0.1656283736228943, "num_tokens": 20552355.0, "step": 8970 }, { "entropy": 5.818031358718872, "epoch": 0.8872083827599841, "grad_norm": 2.421875, "learning_rate": 0.0004929977559975881, "loss": 5.5924, "mean_token_accuracy": 0.16680291742086412, "num_tokens": 20562129.0, "step": 8975 }, { "entropy": 5.74086275100708, "epoch": 0.8877026492684855, "grad_norm": 1.90625, "learning_rate": 0.0004929890178054004, "loss": 5.5582, "mean_token_accuracy": 0.16622466892004012, "num_tokens": 20573232.0, "step": 8980 }, { "entropy": 5.725743961334229, "epoch": 0.888196915776987, "grad_norm": 2.046875, "learning_rate": 0.0004929802742506491, "loss": 5.476, "mean_token_accuracy": 0.17476498931646348, "num_tokens": 20582986.0, "step": 8985 }, { "entropy": 5.77103328704834, "epoch": 0.8886911822854884, "grad_norm": 2.75, "learning_rate": 0.0004929715253335492, "loss": 5.5539, "mean_token_accuracy": 0.17096674740314483, "num_tokens": 20593619.0, "step": 8990 }, { "entropy": 5.672032690048217, "epoch": 0.8891854487939898, "grad_norm": 1.9921875, "learning_rate": 0.0004929627710543159, "loss": 5.5082, "mean_token_accuracy": 0.17296775728464125, "num_tokens": 20604748.0, "step": 8995 }, { "entropy": 5.771025037765503, "epoch": 0.8896797153024911, "grad_norm": 1.4765625, "learning_rate": 0.0004929540114131647, "loss": 5.6207, "mean_token_accuracy": 0.16361732929944992, "num_tokens": 20615915.0, "step": 9000 }, { "epoch": 0.8896797153024911, "eval_entropy": 5.632198041655481, "eval_loss": 5.590260028839111, "eval_mean_token_accuracy": 0.17387622830081104, "eval_num_tokens": 20615915.0, "eval_runtime": 26.5769, "eval_samples_per_second": 1223.354, "eval_steps_per_second": 152.952, "step": 9000 }, { "entropy": 5.720098304748535, "epoch": 0.8901739818109925, "grad_norm": 1.84375, "learning_rate": 0.0004929452464103109, "loss": 5.4836, "mean_token_accuracy": 0.176371668279171, "num_tokens": 20627127.0, "step": 9005 }, { "entropy": 5.78907413482666, "epoch": 0.8906682483194939, "grad_norm": 1.8125, "learning_rate": 0.0004929364760459704, "loss": 5.5641, "mean_token_accuracy": 0.16439370661973954, "num_tokens": 20638568.0, "step": 9010 }, { "entropy": 5.714658117294311, "epoch": 0.8911625148279952, "grad_norm": 2.4375, "learning_rate": 0.0004929277003203586, "loss": 5.4954, "mean_token_accuracy": 0.17102617770433426, "num_tokens": 20650803.0, "step": 9015 }, { "entropy": 5.7387138366699215, "epoch": 0.8916567813364966, "grad_norm": 1.4453125, "learning_rate": 0.0004929189192336916, "loss": 5.6561, "mean_token_accuracy": 0.15735799074172974, "num_tokens": 20663021.0, "step": 9020 }, { "entropy": 5.742475605010986, "epoch": 0.892151047844998, "grad_norm": 1.6484375, "learning_rate": 0.0004929101327861854, "loss": 5.5317, "mean_token_accuracy": 0.1722045734524727, "num_tokens": 20675144.0, "step": 9025 }, { "entropy": 5.692175197601318, "epoch": 0.8926453143534994, "grad_norm": 1.5234375, "learning_rate": 0.0004929013409780562, "loss": 5.526, "mean_token_accuracy": 0.1707400217652321, "num_tokens": 20685941.0, "step": 9030 }, { "entropy": 5.626820421218872, "epoch": 0.8931395808620007, "grad_norm": 1.6953125, "learning_rate": 0.0004928925438095202, "loss": 5.5671, "mean_token_accuracy": 0.16542149782180787, "num_tokens": 20696996.0, "step": 9035 }, { "entropy": 5.73852801322937, "epoch": 0.8936338473705022, "grad_norm": 1.6328125, "learning_rate": 0.0004928837412807938, "loss": 5.5197, "mean_token_accuracy": 0.16998820304870604, "num_tokens": 20708571.0, "step": 9040 }, { "entropy": 5.754188203811646, "epoch": 0.8941281138790036, "grad_norm": 1.7421875, "learning_rate": 0.0004928749333920935, "loss": 5.5551, "mean_token_accuracy": 0.17240752577781676, "num_tokens": 20719816.0, "step": 9045 }, { "entropy": 5.687234401702881, "epoch": 0.894622380387505, "grad_norm": 1.5078125, "learning_rate": 0.000492866120143636, "loss": 5.5359, "mean_token_accuracy": 0.16947951912879944, "num_tokens": 20731540.0, "step": 9050 }, { "entropy": 5.726993370056152, "epoch": 0.8951166468960063, "grad_norm": 2.265625, "learning_rate": 0.0004928573015356382, "loss": 5.5456, "mean_token_accuracy": 0.17137984484434127, "num_tokens": 20742949.0, "step": 9055 }, { "entropy": 5.729455184936524, "epoch": 0.8956109134045077, "grad_norm": 1.671875, "learning_rate": 0.0004928484775683171, "loss": 5.5549, "mean_token_accuracy": 0.17138264775276185, "num_tokens": 20752840.0, "step": 9060 }, { "entropy": 5.687931203842163, "epoch": 0.8961051799130091, "grad_norm": 1.6484375, "learning_rate": 0.0004928396482418895, "loss": 5.5632, "mean_token_accuracy": 0.16409212499856948, "num_tokens": 20763772.0, "step": 9065 }, { "entropy": 5.720460271835327, "epoch": 0.8965994464215105, "grad_norm": 1.6796875, "learning_rate": 0.0004928308135565728, "loss": 5.5444, "mean_token_accuracy": 0.17190071940422058, "num_tokens": 20775815.0, "step": 9070 }, { "entropy": 5.716368055343628, "epoch": 0.8970937129300118, "grad_norm": 1.6875, "learning_rate": 0.0004928219735125843, "loss": 5.5737, "mean_token_accuracy": 0.167434960603714, "num_tokens": 20787307.0, "step": 9075 }, { "entropy": 5.737261772155762, "epoch": 0.8975879794385132, "grad_norm": 1.7890625, "learning_rate": 0.0004928131281101415, "loss": 5.6537, "mean_token_accuracy": 0.16068975925445556, "num_tokens": 20798910.0, "step": 9080 }, { "entropy": 5.870688104629517, "epoch": 0.8980822459470146, "grad_norm": 2.5, "learning_rate": 0.000492804277349462, "loss": 5.5793, "mean_token_accuracy": 0.1611576959490776, "num_tokens": 20808628.0, "step": 9085 }, { "entropy": 5.729201316833496, "epoch": 0.8985765124555161, "grad_norm": 2.234375, "learning_rate": 0.0004927954212307634, "loss": 5.494, "mean_token_accuracy": 0.1680928349494934, "num_tokens": 20820117.0, "step": 9090 }, { "entropy": 5.589667654037475, "epoch": 0.8990707789640174, "grad_norm": 1.5859375, "learning_rate": 0.0004927865597542637, "loss": 5.4608, "mean_token_accuracy": 0.17886472791433333, "num_tokens": 20830859.0, "step": 9095 }, { "entropy": 5.716715574264526, "epoch": 0.8995650454725188, "grad_norm": 2.59375, "learning_rate": 0.0004927776929201807, "loss": 5.4836, "mean_token_accuracy": 0.17389875203371047, "num_tokens": 20843016.0, "step": 9100 }, { "entropy": 5.700129270553589, "epoch": 0.9000593119810202, "grad_norm": 2.203125, "learning_rate": 0.0004927688207287328, "loss": 5.4976, "mean_token_accuracy": 0.16986022442579268, "num_tokens": 20854873.0, "step": 9105 }, { "entropy": 5.771597194671631, "epoch": 0.9005535784895216, "grad_norm": 2.0, "learning_rate": 0.0004927599431801381, "loss": 5.6897, "mean_token_accuracy": 0.1707574725151062, "num_tokens": 20866756.0, "step": 9110 }, { "entropy": 5.737335109710694, "epoch": 0.9010478449980229, "grad_norm": 2.703125, "learning_rate": 0.000492751060274615, "loss": 5.4831, "mean_token_accuracy": 0.17735593020915985, "num_tokens": 20878859.0, "step": 9115 }, { "entropy": 5.673659038543701, "epoch": 0.9015421115065243, "grad_norm": 1.5703125, "learning_rate": 0.0004927421720123821, "loss": 5.5392, "mean_token_accuracy": 0.1698540985584259, "num_tokens": 20889188.0, "step": 9120 }, { "entropy": 5.691730403900147, "epoch": 0.9020363780150257, "grad_norm": 1.9765625, "learning_rate": 0.0004927332783936579, "loss": 5.4922, "mean_token_accuracy": 0.17076885402202607, "num_tokens": 20900318.0, "step": 9125 }, { "entropy": 5.729398012161255, "epoch": 0.902530644523527, "grad_norm": 2.40625, "learning_rate": 0.0004927243794186614, "loss": 5.5728, "mean_token_accuracy": 0.16684664338827132, "num_tokens": 20912384.0, "step": 9130 }, { "entropy": 5.691777324676513, "epoch": 0.9030249110320284, "grad_norm": 1.8828125, "learning_rate": 0.0004927154750876112, "loss": 5.5263, "mean_token_accuracy": 0.16683476269245148, "num_tokens": 20923002.0, "step": 9135 }, { "entropy": 5.720336961746216, "epoch": 0.9035191775405299, "grad_norm": 2.09375, "learning_rate": 0.0004927065654007268, "loss": 5.6612, "mean_token_accuracy": 0.16474491804838182, "num_tokens": 20934235.0, "step": 9140 }, { "entropy": 5.681716823577881, "epoch": 0.9040134440490313, "grad_norm": 1.765625, "learning_rate": 0.0004926976503582269, "loss": 5.5106, "mean_token_accuracy": 0.16745854318141937, "num_tokens": 20946788.0, "step": 9145 }, { "entropy": 5.7602071285247805, "epoch": 0.9045077105575327, "grad_norm": 1.734375, "learning_rate": 0.000492688729960331, "loss": 5.548, "mean_token_accuracy": 0.17626707553863524, "num_tokens": 20958963.0, "step": 9150 }, { "entropy": 5.7697436809539795, "epoch": 0.905001977066034, "grad_norm": 1.6640625, "learning_rate": 0.0004926798042072587, "loss": 5.5258, "mean_token_accuracy": 0.17248127460479737, "num_tokens": 20969630.0, "step": 9155 }, { "entropy": 5.671909046173096, "epoch": 0.9054962435745354, "grad_norm": 1.625, "learning_rate": 0.0004926708730992294, "loss": 5.503, "mean_token_accuracy": 0.17446861267089844, "num_tokens": 20980489.0, "step": 9160 }, { "entropy": 5.77673864364624, "epoch": 0.9059905100830368, "grad_norm": 1.5, "learning_rate": 0.0004926619366364629, "loss": 5.5565, "mean_token_accuracy": 0.1746782347559929, "num_tokens": 20992199.0, "step": 9165 }, { "entropy": 5.753552103042603, "epoch": 0.9064847765915381, "grad_norm": 1.9765625, "learning_rate": 0.000492652994819179, "loss": 5.5754, "mean_token_accuracy": 0.166583052277565, "num_tokens": 21003680.0, "step": 9170 }, { "entropy": 5.733190870285034, "epoch": 0.9069790431000395, "grad_norm": 1.359375, "learning_rate": 0.0004926440476475975, "loss": 5.484, "mean_token_accuracy": 0.1758432000875473, "num_tokens": 21014191.0, "step": 9175 }, { "entropy": 5.724966335296631, "epoch": 0.9074733096085409, "grad_norm": 1.5859375, "learning_rate": 0.0004926350951219388, "loss": 5.4859, "mean_token_accuracy": 0.17352897375822068, "num_tokens": 21025692.0, "step": 9180 }, { "entropy": 5.6547223091125485, "epoch": 0.9079675761170423, "grad_norm": 2.390625, "learning_rate": 0.000492626137242423, "loss": 5.5037, "mean_token_accuracy": 0.1735650509595871, "num_tokens": 21036643.0, "step": 9185 }, { "entropy": 5.712827491760254, "epoch": 0.9084618426255437, "grad_norm": 1.6015625, "learning_rate": 0.0004926171740092704, "loss": 5.5935, "mean_token_accuracy": 0.16322490721940994, "num_tokens": 21047509.0, "step": 9190 }, { "entropy": 5.721576261520386, "epoch": 0.9089561091340451, "grad_norm": 1.7265625, "learning_rate": 0.0004926082054227016, "loss": 5.6401, "mean_token_accuracy": 0.17004420459270478, "num_tokens": 21059854.0, "step": 9195 }, { "entropy": 5.7053791046142575, "epoch": 0.9094503756425465, "grad_norm": 2.1875, "learning_rate": 0.0004925992314829372, "loss": 5.4607, "mean_token_accuracy": 0.17410786002874373, "num_tokens": 21069926.0, "step": 9200 }, { "entropy": 5.750688266754151, "epoch": 0.9099446421510479, "grad_norm": 1.6171875, "learning_rate": 0.000492590252190198, "loss": 5.5647, "mean_token_accuracy": 0.1693345457315445, "num_tokens": 21081580.0, "step": 9205 }, { "entropy": 5.710610485076904, "epoch": 0.9104389086595492, "grad_norm": 1.78125, "learning_rate": 0.0004925812675447047, "loss": 5.4592, "mean_token_accuracy": 0.17503467500209807, "num_tokens": 21092510.0, "step": 9210 }, { "entropy": 5.640002012252808, "epoch": 0.9109331751680506, "grad_norm": 2.140625, "learning_rate": 0.0004925722775466785, "loss": 5.4806, "mean_token_accuracy": 0.17165618687868117, "num_tokens": 21103995.0, "step": 9215 }, { "entropy": 5.743108701705933, "epoch": 0.911427441676552, "grad_norm": 1.734375, "learning_rate": 0.0004925632821963406, "loss": 5.5564, "mean_token_accuracy": 0.1709841176867485, "num_tokens": 21114949.0, "step": 9220 }, { "entropy": 5.728981018066406, "epoch": 0.9119217081850534, "grad_norm": 1.8515625, "learning_rate": 0.0004925542814939121, "loss": 5.4762, "mean_token_accuracy": 0.1855828732252121, "num_tokens": 21125810.0, "step": 9225 }, { "entropy": 5.658492136001587, "epoch": 0.9124159746935547, "grad_norm": 2.140625, "learning_rate": 0.0004925452754396146, "loss": 5.5463, "mean_token_accuracy": 0.16577664613723755, "num_tokens": 21137728.0, "step": 9230 }, { "entropy": 5.7361180782318115, "epoch": 0.9129102412020561, "grad_norm": 1.625, "learning_rate": 0.0004925362640336696, "loss": 5.5207, "mean_token_accuracy": 0.17037809193134307, "num_tokens": 21149249.0, "step": 9235 }, { "entropy": 5.74154806137085, "epoch": 0.9134045077105575, "grad_norm": 1.6875, "learning_rate": 0.0004925272472762987, "loss": 5.6152, "mean_token_accuracy": 0.16150472760200502, "num_tokens": 21162338.0, "step": 9240 }, { "entropy": 5.618438482284546, "epoch": 0.913898774219059, "grad_norm": 1.59375, "learning_rate": 0.0004925182251677238, "loss": 5.3848, "mean_token_accuracy": 0.1800136461853981, "num_tokens": 21172953.0, "step": 9245 }, { "entropy": 5.699621725082397, "epoch": 0.9143930407275603, "grad_norm": 1.890625, "learning_rate": 0.0004925091977081668, "loss": 5.5477, "mean_token_accuracy": 0.17176782488822936, "num_tokens": 21183835.0, "step": 9250 }, { "entropy": 5.699409437179566, "epoch": 0.9148873072360617, "grad_norm": 1.65625, "learning_rate": 0.0004925001648978498, "loss": 5.5087, "mean_token_accuracy": 0.17691364139318466, "num_tokens": 21195392.0, "step": 9255 }, { "entropy": 5.810751867294312, "epoch": 0.9153815737445631, "grad_norm": 2.09375, "learning_rate": 0.000492491126736995, "loss": 5.6633, "mean_token_accuracy": 0.15760257691144944, "num_tokens": 21207213.0, "step": 9260 }, { "entropy": 5.801012849807739, "epoch": 0.9158758402530645, "grad_norm": 1.5390625, "learning_rate": 0.0004924820832258248, "loss": 5.6224, "mean_token_accuracy": 0.1684015840291977, "num_tokens": 21218843.0, "step": 9265 }, { "entropy": 5.700365972518921, "epoch": 0.9163701067615658, "grad_norm": 1.7421875, "learning_rate": 0.0004924730343645614, "loss": 5.5762, "mean_token_accuracy": 0.1689996376633644, "num_tokens": 21229596.0, "step": 9270 }, { "entropy": 5.770077037811279, "epoch": 0.9168643732700672, "grad_norm": 1.4609375, "learning_rate": 0.0004924639801534278, "loss": 5.5118, "mean_token_accuracy": 0.17067157924175264, "num_tokens": 21240040.0, "step": 9275 }, { "entropy": 5.7615241527557375, "epoch": 0.9173586397785686, "grad_norm": 1.4140625, "learning_rate": 0.0004924549205926465, "loss": 5.6402, "mean_token_accuracy": 0.1597430318593979, "num_tokens": 21252046.0, "step": 9280 }, { "entropy": 5.75082573890686, "epoch": 0.91785290628707, "grad_norm": 1.671875, "learning_rate": 0.0004924458556824405, "loss": 5.5675, "mean_token_accuracy": 0.16260437667369843, "num_tokens": 21263720.0, "step": 9285 }, { "entropy": 5.767461442947388, "epoch": 0.9183471727955713, "grad_norm": 1.7734375, "learning_rate": 0.0004924367854230326, "loss": 5.5755, "mean_token_accuracy": 0.16299645304679872, "num_tokens": 21275751.0, "step": 9290 }, { "entropy": 5.7449291229248045, "epoch": 0.9188414393040728, "grad_norm": 1.5078125, "learning_rate": 0.0004924277098146461, "loss": 5.5632, "mean_token_accuracy": 0.17114244848489762, "num_tokens": 21287081.0, "step": 9295 }, { "entropy": 5.649151706695557, "epoch": 0.9193357058125742, "grad_norm": 2.015625, "learning_rate": 0.0004924186288575043, "loss": 5.5221, "mean_token_accuracy": 0.17164077907800673, "num_tokens": 21298007.0, "step": 9300 }, { "entropy": 5.747290325164795, "epoch": 0.9198299723210756, "grad_norm": 1.7890625, "learning_rate": 0.0004924095425518304, "loss": 5.5545, "mean_token_accuracy": 0.167376746237278, "num_tokens": 21309416.0, "step": 9305 }, { "entropy": 5.664888668060303, "epoch": 0.9203242388295769, "grad_norm": 1.671875, "learning_rate": 0.000492400450897848, "loss": 5.5199, "mean_token_accuracy": 0.17147454023361205, "num_tokens": 21321129.0, "step": 9310 }, { "entropy": 5.7010034084320065, "epoch": 0.9208185053380783, "grad_norm": 1.75, "learning_rate": 0.0004923913538957809, "loss": 5.5081, "mean_token_accuracy": 0.17650321274995803, "num_tokens": 21331706.0, "step": 9315 }, { "entropy": 5.72475118637085, "epoch": 0.9213127718465797, "grad_norm": 1.765625, "learning_rate": 0.0004923822515458526, "loss": 5.5453, "mean_token_accuracy": 0.1709713250398636, "num_tokens": 21343738.0, "step": 9320 }, { "entropy": 5.730406284332275, "epoch": 0.921807038355081, "grad_norm": 1.6953125, "learning_rate": 0.0004923731438482873, "loss": 5.5361, "mean_token_accuracy": 0.17120832204818726, "num_tokens": 21354714.0, "step": 9325 }, { "entropy": 5.795811319351197, "epoch": 0.9223013048635824, "grad_norm": 1.671875, "learning_rate": 0.0004923640308033088, "loss": 5.5813, "mean_token_accuracy": 0.1637384533882141, "num_tokens": 21365947.0, "step": 9330 }, { "entropy": 5.835444068908691, "epoch": 0.9227955713720838, "grad_norm": 1.703125, "learning_rate": 0.0004923549124111416, "loss": 5.708, "mean_token_accuracy": 0.15868209153413773, "num_tokens": 21376729.0, "step": 9335 }, { "entropy": 5.694757604598999, "epoch": 0.9232898378805852, "grad_norm": 1.703125, "learning_rate": 0.0004923457886720098, "loss": 5.5016, "mean_token_accuracy": 0.1803483709692955, "num_tokens": 21388017.0, "step": 9340 }, { "entropy": 5.630907011032105, "epoch": 0.9237841043890866, "grad_norm": 1.796875, "learning_rate": 0.0004923366595861378, "loss": 5.4776, "mean_token_accuracy": 0.18337951153516768, "num_tokens": 21399566.0, "step": 9345 }, { "entropy": 5.760402250289917, "epoch": 0.924278370897588, "grad_norm": 1.6640625, "learning_rate": 0.0004923275251537503, "loss": 5.5908, "mean_token_accuracy": 0.16621706634759903, "num_tokens": 21410276.0, "step": 9350 }, { "entropy": 5.716007423400879, "epoch": 0.9247726374060894, "grad_norm": 1.890625, "learning_rate": 0.000492318385375072, "loss": 5.5176, "mean_token_accuracy": 0.17807159721851348, "num_tokens": 21421090.0, "step": 9355 }, { "entropy": 5.69927749633789, "epoch": 0.9252669039145908, "grad_norm": 1.6875, "learning_rate": 0.0004923092402503277, "loss": 5.4996, "mean_token_accuracy": 0.17431414425373076, "num_tokens": 21431057.0, "step": 9360 }, { "entropy": 5.734055471420288, "epoch": 0.9257611704230921, "grad_norm": 1.75, "learning_rate": 0.0004923000897797423, "loss": 5.5753, "mean_token_accuracy": 0.16445844024419784, "num_tokens": 21443849.0, "step": 9365 }, { "entropy": 5.802360677719117, "epoch": 0.9262554369315935, "grad_norm": 1.6953125, "learning_rate": 0.0004922909339635411, "loss": 5.6275, "mean_token_accuracy": 0.1604536235332489, "num_tokens": 21454824.0, "step": 9370 }, { "entropy": 5.740575313568115, "epoch": 0.9267497034400949, "grad_norm": 1.5859375, "learning_rate": 0.0004922817728019492, "loss": 5.5393, "mean_token_accuracy": 0.16994927674531937, "num_tokens": 21466082.0, "step": 9375 }, { "entropy": 5.7078859329223635, "epoch": 0.9272439699485963, "grad_norm": 2.375, "learning_rate": 0.0004922726062951918, "loss": 5.5113, "mean_token_accuracy": 0.17064426243305206, "num_tokens": 21477805.0, "step": 9380 }, { "entropy": 5.744085168838501, "epoch": 0.9277382364570976, "grad_norm": 1.5, "learning_rate": 0.0004922634344434948, "loss": 5.5207, "mean_token_accuracy": 0.16478744000196457, "num_tokens": 21490014.0, "step": 9385 }, { "entropy": 5.759122610092163, "epoch": 0.928232502965599, "grad_norm": 2.109375, "learning_rate": 0.0004922542572470835, "loss": 5.5924, "mean_token_accuracy": 0.16787174344062805, "num_tokens": 21501713.0, "step": 9390 }, { "entropy": 5.623011350631714, "epoch": 0.9287267694741005, "grad_norm": 1.6953125, "learning_rate": 0.0004922450747061837, "loss": 5.4546, "mean_token_accuracy": 0.1778919905424118, "num_tokens": 21513258.0, "step": 9395 }, { "entropy": 5.682714223861694, "epoch": 0.9292210359826019, "grad_norm": 1.703125, "learning_rate": 0.0004922358868210214, "loss": 5.5475, "mean_token_accuracy": 0.17112779170274733, "num_tokens": 21526259.0, "step": 9400 }, { "entropy": 5.695071601867676, "epoch": 0.9297153024911032, "grad_norm": 2.46875, "learning_rate": 0.0004922266935918227, "loss": 5.5149, "mean_token_accuracy": 0.16989525109529496, "num_tokens": 21539144.0, "step": 9405 }, { "entropy": 5.778148746490478, "epoch": 0.9302095689996046, "grad_norm": 1.8203125, "learning_rate": 0.0004922174950188136, "loss": 5.5996, "mean_token_accuracy": 0.16327397972345353, "num_tokens": 21550550.0, "step": 9410 }, { "entropy": 5.7194273471832275, "epoch": 0.930703835508106, "grad_norm": 2.5, "learning_rate": 0.0004922082911022204, "loss": 5.5015, "mean_token_accuracy": 0.16759830862283706, "num_tokens": 21562491.0, "step": 9415 }, { "entropy": 5.68703031539917, "epoch": 0.9311981020166074, "grad_norm": 2.21875, "learning_rate": 0.0004921990818422694, "loss": 5.5711, "mean_token_accuracy": 0.16791069358587266, "num_tokens": 21573679.0, "step": 9420 }, { "entropy": 5.736935138702393, "epoch": 0.9316923685251087, "grad_norm": 2.25, "learning_rate": 0.0004921898672391874, "loss": 5.487, "mean_token_accuracy": 0.17206409722566604, "num_tokens": 21585491.0, "step": 9425 }, { "entropy": 5.795855474472046, "epoch": 0.9321866350336101, "grad_norm": 2.421875, "learning_rate": 0.0004921806472932011, "loss": 5.5667, "mean_token_accuracy": 0.17183364033699036, "num_tokens": 21598302.0, "step": 9430 }, { "entropy": 5.709362936019898, "epoch": 0.9326809015421115, "grad_norm": 1.6953125, "learning_rate": 0.0004921714220045371, "loss": 5.5457, "mean_token_accuracy": 0.17069749385118485, "num_tokens": 21608442.0, "step": 9435 }, { "entropy": 5.72504825592041, "epoch": 0.9331751680506128, "grad_norm": 1.578125, "learning_rate": 0.0004921621913734223, "loss": 5.5527, "mean_token_accuracy": 0.1707771122455597, "num_tokens": 21619594.0, "step": 9440 }, { "entropy": 5.791470766067505, "epoch": 0.9336694345591142, "grad_norm": 1.7421875, "learning_rate": 0.0004921529554000841, "loss": 5.5785, "mean_token_accuracy": 0.16914348304271698, "num_tokens": 21631065.0, "step": 9445 }, { "entropy": 5.712844276428223, "epoch": 0.9341637010676157, "grad_norm": 5.28125, "learning_rate": 0.0004921437140847493, "loss": 5.4894, "mean_token_accuracy": 0.17622862309217452, "num_tokens": 21640949.0, "step": 9450 }, { "entropy": 5.776348352432251, "epoch": 0.9346579675761171, "grad_norm": 1.6171875, "learning_rate": 0.0004921344674276456, "loss": 5.6225, "mean_token_accuracy": 0.1652636095881462, "num_tokens": 21651189.0, "step": 9455 }, { "entropy": 5.8496729850769045, "epoch": 0.9351522340846185, "grad_norm": 1.7890625, "learning_rate": 0.0004921252154290003, "loss": 5.6029, "mean_token_accuracy": 0.1607473149895668, "num_tokens": 21662790.0, "step": 9460 }, { "entropy": 5.7654030323028564, "epoch": 0.9356465005931198, "grad_norm": 1.5703125, "learning_rate": 0.000492115958089041, "loss": 5.6467, "mean_token_accuracy": 0.16289750188589097, "num_tokens": 21674980.0, "step": 9465 }, { "entropy": 5.699536752700806, "epoch": 0.9361407671016212, "grad_norm": 1.671875, "learning_rate": 0.0004921066954079955, "loss": 5.5328, "mean_token_accuracy": 0.1692644625902176, "num_tokens": 21687721.0, "step": 9470 }, { "entropy": 5.763693237304688, "epoch": 0.9366350336101226, "grad_norm": 2.328125, "learning_rate": 0.0004920974273860915, "loss": 5.6703, "mean_token_accuracy": 0.15921183824539184, "num_tokens": 21699522.0, "step": 9475 }, { "entropy": 5.782375383377075, "epoch": 0.9371293001186239, "grad_norm": 1.53125, "learning_rate": 0.0004920881540235572, "loss": 5.4274, "mean_token_accuracy": 0.17436766028404235, "num_tokens": 21709972.0, "step": 9480 }, { "entropy": 5.62567663192749, "epoch": 0.9376235666271253, "grad_norm": 1.90625, "learning_rate": 0.0004920788753206205, "loss": 5.5437, "mean_token_accuracy": 0.17245012819766997, "num_tokens": 21722172.0, "step": 9485 }, { "entropy": 5.6970696449279785, "epoch": 0.9381178331356267, "grad_norm": 1.9296875, "learning_rate": 0.00049206959127751, "loss": 5.5502, "mean_token_accuracy": 0.16532090157270432, "num_tokens": 21734314.0, "step": 9490 }, { "entropy": 5.741184091567993, "epoch": 0.9386120996441281, "grad_norm": 2.765625, "learning_rate": 0.0004920603018944537, "loss": 5.5199, "mean_token_accuracy": 0.17438743263483047, "num_tokens": 21744031.0, "step": 9495 }, { "entropy": 5.715707159042358, "epoch": 0.9391063661526295, "grad_norm": 2.390625, "learning_rate": 0.0004920510071716803, "loss": 5.4969, "mean_token_accuracy": 0.1746805191040039, "num_tokens": 21755653.0, "step": 9500 }, { "entropy": 5.816602802276611, "epoch": 0.9396006326611309, "grad_norm": 1.7734375, "learning_rate": 0.0004920417071094186, "loss": 5.594, "mean_token_accuracy": 0.1655436113476753, "num_tokens": 21768513.0, "step": 9505 }, { "entropy": 5.744887208938598, "epoch": 0.9400948991696323, "grad_norm": 1.3828125, "learning_rate": 0.0004920324017078971, "loss": 5.5205, "mean_token_accuracy": 0.16552363485097885, "num_tokens": 21780857.0, "step": 9510 }, { "entropy": 5.665854024887085, "epoch": 0.9405891656781337, "grad_norm": 1.90625, "learning_rate": 0.000492023090967345, "loss": 5.5126, "mean_token_accuracy": 0.17808787375688553, "num_tokens": 21792514.0, "step": 9515 }, { "entropy": 5.8031830310821535, "epoch": 0.941083432186635, "grad_norm": 1.6953125, "learning_rate": 0.000492013774887991, "loss": 5.5716, "mean_token_accuracy": 0.1701519325375557, "num_tokens": 21803154.0, "step": 9520 }, { "entropy": 5.694848203659058, "epoch": 0.9415776986951364, "grad_norm": 1.6875, "learning_rate": 0.0004920044534700645, "loss": 5.5582, "mean_token_accuracy": 0.16919979006052016, "num_tokens": 21814439.0, "step": 9525 }, { "entropy": 5.6712646484375, "epoch": 0.9420719652036378, "grad_norm": 1.8125, "learning_rate": 0.0004919951267137949, "loss": 5.5032, "mean_token_accuracy": 0.17841036319732667, "num_tokens": 21826870.0, "step": 9530 }, { "entropy": 5.803434705734253, "epoch": 0.9425662317121392, "grad_norm": 1.71875, "learning_rate": 0.0004919857946194114, "loss": 5.4939, "mean_token_accuracy": 0.17100831866264343, "num_tokens": 21837627.0, "step": 9535 }, { "entropy": 5.663749742507934, "epoch": 0.9430604982206405, "grad_norm": 1.578125, "learning_rate": 0.0004919764571871438, "loss": 5.6254, "mean_token_accuracy": 0.16555337458848954, "num_tokens": 21848891.0, "step": 9540 }, { "entropy": 5.804639577865601, "epoch": 0.9435547647291419, "grad_norm": 1.6953125, "learning_rate": 0.0004919671144172216, "loss": 5.5292, "mean_token_accuracy": 0.16971494555473327, "num_tokens": 21860094.0, "step": 9545 }, { "entropy": 5.770897102355957, "epoch": 0.9440490312376434, "grad_norm": 1.5, "learning_rate": 0.0004919577663098748, "loss": 5.5062, "mean_token_accuracy": 0.17213414311408998, "num_tokens": 21870881.0, "step": 9550 }, { "entropy": 5.708716773986817, "epoch": 0.9445432977461448, "grad_norm": 1.5703125, "learning_rate": 0.0004919484128653333, "loss": 5.5525, "mean_token_accuracy": 0.16999221891164779, "num_tokens": 21882825.0, "step": 9555 }, { "entropy": 5.736716032028198, "epoch": 0.9450375642546461, "grad_norm": 1.515625, "learning_rate": 0.0004919390540838271, "loss": 5.6146, "mean_token_accuracy": 0.16759835928678513, "num_tokens": 21894952.0, "step": 9560 }, { "entropy": 5.760945129394531, "epoch": 0.9455318307631475, "grad_norm": 1.5, "learning_rate": 0.0004919296899655866, "loss": 5.5588, "mean_token_accuracy": 0.16439727395772935, "num_tokens": 21906893.0, "step": 9565 }, { "entropy": 5.770154666900635, "epoch": 0.9460260972716489, "grad_norm": 1.8203125, "learning_rate": 0.000491920320510842, "loss": 5.619, "mean_token_accuracy": 0.16570377796888353, "num_tokens": 21918571.0, "step": 9570 }, { "entropy": 5.63245735168457, "epoch": 0.9465203637801503, "grad_norm": 1.59375, "learning_rate": 0.0004919109457198239, "loss": 5.4869, "mean_token_accuracy": 0.17033022046089172, "num_tokens": 21929488.0, "step": 9575 }, { "entropy": 5.692418336868286, "epoch": 0.9470146302886516, "grad_norm": 2.625, "learning_rate": 0.0004919015655927629, "loss": 5.4875, "mean_token_accuracy": 0.16792791038751603, "num_tokens": 21940368.0, "step": 9580 }, { "entropy": 5.777459001541137, "epoch": 0.947508896797153, "grad_norm": 1.5625, "learning_rate": 0.0004918921801298897, "loss": 5.6152, "mean_token_accuracy": 0.16874023675918579, "num_tokens": 21951171.0, "step": 9585 }, { "entropy": 5.767289924621582, "epoch": 0.9480031633056544, "grad_norm": 1.5078125, "learning_rate": 0.0004918827893314353, "loss": 5.5649, "mean_token_accuracy": 0.1750333920121193, "num_tokens": 21962312.0, "step": 9590 }, { "entropy": 5.7734699726104735, "epoch": 0.9484974298141557, "grad_norm": 1.828125, "learning_rate": 0.0004918733931976305, "loss": 5.4953, "mean_token_accuracy": 0.17125972658395766, "num_tokens": 21971994.0, "step": 9595 }, { "entropy": 5.778622150421143, "epoch": 0.9489916963226572, "grad_norm": 1.640625, "learning_rate": 0.0004918639917287067, "loss": 5.593, "mean_token_accuracy": 0.16450224071741104, "num_tokens": 21983084.0, "step": 9600 }, { "entropy": 5.701753854751587, "epoch": 0.9494859628311586, "grad_norm": 1.9765625, "learning_rate": 0.0004918545849248951, "loss": 5.6045, "mean_token_accuracy": 0.16481069773435592, "num_tokens": 21995005.0, "step": 9605 }, { "entropy": 5.677874517440796, "epoch": 0.94998022933966, "grad_norm": 1.75, "learning_rate": 0.000491845172786427, "loss": 5.5477, "mean_token_accuracy": 0.17119743973016738, "num_tokens": 22006377.0, "step": 9610 }, { "entropy": 5.747830867767334, "epoch": 0.9504744958481613, "grad_norm": 1.453125, "learning_rate": 0.0004918357553135339, "loss": 5.6163, "mean_token_accuracy": 0.167357137799263, "num_tokens": 22019663.0, "step": 9615 }, { "entropy": 5.847278070449829, "epoch": 0.9509687623566627, "grad_norm": 1.9375, "learning_rate": 0.0004918263325064476, "loss": 5.6026, "mean_token_accuracy": 0.16540860384702682, "num_tokens": 22030646.0, "step": 9620 }, { "entropy": 5.759588670730591, "epoch": 0.9514630288651641, "grad_norm": 1.703125, "learning_rate": 0.0004918169043654, "loss": 5.5325, "mean_token_accuracy": 0.17217915654182434, "num_tokens": 22043563.0, "step": 9625 }, { "entropy": 5.673029232025146, "epoch": 0.9519572953736655, "grad_norm": 1.609375, "learning_rate": 0.0004918074708906229, "loss": 5.506, "mean_token_accuracy": 0.17214220017194748, "num_tokens": 22055224.0, "step": 9630 }, { "entropy": 5.713845300674438, "epoch": 0.9524515618821668, "grad_norm": 1.921875, "learning_rate": 0.0004917980320823483, "loss": 5.5903, "mean_token_accuracy": 0.16551012098789214, "num_tokens": 22067445.0, "step": 9635 }, { "entropy": 5.742143154144287, "epoch": 0.9529458283906682, "grad_norm": 1.4765625, "learning_rate": 0.0004917885879408085, "loss": 5.502, "mean_token_accuracy": 0.17228208035230635, "num_tokens": 22078565.0, "step": 9640 }, { "entropy": 5.605641555786133, "epoch": 0.9534400948991696, "grad_norm": 1.875, "learning_rate": 0.0004917791384662359, "loss": 5.4062, "mean_token_accuracy": 0.1809736594557762, "num_tokens": 22088658.0, "step": 9645 }, { "entropy": 5.66534013748169, "epoch": 0.953934361407671, "grad_norm": 1.5546875, "learning_rate": 0.0004917696836588628, "loss": 5.5396, "mean_token_accuracy": 0.16359647661447524, "num_tokens": 22100747.0, "step": 9650 }, { "entropy": 5.658927488327026, "epoch": 0.9544286279161724, "grad_norm": 1.984375, "learning_rate": 0.0004917602235189218, "loss": 5.5572, "mean_token_accuracy": 0.16690735518932343, "num_tokens": 22113559.0, "step": 9655 }, { "entropy": 5.807874345779419, "epoch": 0.9549228944246738, "grad_norm": 1.515625, "learning_rate": 0.0004917507580466457, "loss": 5.558, "mean_token_accuracy": 0.16766222715377807, "num_tokens": 22124678.0, "step": 9660 }, { "entropy": 5.729693412780762, "epoch": 0.9554171609331752, "grad_norm": 1.859375, "learning_rate": 0.0004917412872422674, "loss": 5.5451, "mean_token_accuracy": 0.17450609058141708, "num_tokens": 22136462.0, "step": 9665 }, { "entropy": 5.695987272262573, "epoch": 0.9559114274416766, "grad_norm": 1.703125, "learning_rate": 0.0004917318111060198, "loss": 5.5553, "mean_token_accuracy": 0.17311072945594788, "num_tokens": 22149101.0, "step": 9670 }, { "entropy": 5.716809606552124, "epoch": 0.9564056939501779, "grad_norm": 2.0625, "learning_rate": 0.000491722329638136, "loss": 5.5018, "mean_token_accuracy": 0.17296547144651414, "num_tokens": 22159574.0, "step": 9675 }, { "entropy": 5.746746778488159, "epoch": 0.9568999604586793, "grad_norm": 1.8203125, "learning_rate": 0.0004917128428388492, "loss": 5.5792, "mean_token_accuracy": 0.17071614861488343, "num_tokens": 22172308.0, "step": 9680 }, { "entropy": 5.729102516174317, "epoch": 0.9573942269671807, "grad_norm": 1.53125, "learning_rate": 0.0004917033507083929, "loss": 5.5644, "mean_token_accuracy": 0.16269811391830444, "num_tokens": 22183714.0, "step": 9685 }, { "entropy": 5.662445402145385, "epoch": 0.9578884934756821, "grad_norm": 3.765625, "learning_rate": 0.0004916938532470006, "loss": 5.4123, "mean_token_accuracy": 0.17422082275152206, "num_tokens": 22194785.0, "step": 9690 }, { "entropy": 5.710245752334595, "epoch": 0.9583827599841834, "grad_norm": 1.7265625, "learning_rate": 0.0004916843504549058, "loss": 5.5693, "mean_token_accuracy": 0.17288799285888673, "num_tokens": 22205998.0, "step": 9695 }, { "entropy": 5.723492574691773, "epoch": 0.9588770264926848, "grad_norm": 1.6953125, "learning_rate": 0.0004916748423323424, "loss": 5.5291, "mean_token_accuracy": 0.16438755691051482, "num_tokens": 22216114.0, "step": 9700 }, { "entropy": 5.6744773387908936, "epoch": 0.9593712930011863, "grad_norm": 2.046875, "learning_rate": 0.0004916653288795443, "loss": 5.4928, "mean_token_accuracy": 0.17621395885944366, "num_tokens": 22226793.0, "step": 9705 }, { "entropy": 5.718301105499267, "epoch": 0.9598655595096877, "grad_norm": 1.484375, "learning_rate": 0.0004916558100967455, "loss": 5.6036, "mean_token_accuracy": 0.17109611630439758, "num_tokens": 22237444.0, "step": 9710 }, { "entropy": 5.724616670608521, "epoch": 0.960359826018189, "grad_norm": 1.859375, "learning_rate": 0.0004916462859841801, "loss": 5.5622, "mean_token_accuracy": 0.16795298755168914, "num_tokens": 22250704.0, "step": 9715 }, { "entropy": 5.742507457733154, "epoch": 0.9608540925266904, "grad_norm": 1.5625, "learning_rate": 0.0004916367565420826, "loss": 5.5823, "mean_token_accuracy": 0.17305338829755784, "num_tokens": 22264533.0, "step": 9720 }, { "entropy": 5.818283224105835, "epoch": 0.9613483590351918, "grad_norm": 1.75, "learning_rate": 0.0004916272217706871, "loss": 5.5864, "mean_token_accuracy": 0.16755596548318863, "num_tokens": 22276510.0, "step": 9725 }, { "entropy": 5.765133094787598, "epoch": 0.9618426255436932, "grad_norm": 1.9296875, "learning_rate": 0.0004916176816702284, "loss": 5.6159, "mean_token_accuracy": 0.16529442965984345, "num_tokens": 22288634.0, "step": 9730 }, { "entropy": 5.789472341537476, "epoch": 0.9623368920521945, "grad_norm": 1.8515625, "learning_rate": 0.0004916081362409411, "loss": 5.5959, "mean_token_accuracy": 0.16372036784887314, "num_tokens": 22299781.0, "step": 9735 }, { "entropy": 5.670352220535278, "epoch": 0.9628311585606959, "grad_norm": 1.5703125, "learning_rate": 0.00049159858548306, "loss": 5.4344, "mean_token_accuracy": 0.1774035409092903, "num_tokens": 22310666.0, "step": 9740 }, { "entropy": 5.744387197494507, "epoch": 0.9633254250691973, "grad_norm": 1.5859375, "learning_rate": 0.0004915890293968202, "loss": 5.6118, "mean_token_accuracy": 0.16391652673482895, "num_tokens": 22322811.0, "step": 9745 }, { "entropy": 5.748639297485352, "epoch": 0.9638196915776986, "grad_norm": 2.28125, "learning_rate": 0.0004915794679824567, "loss": 5.5789, "mean_token_accuracy": 0.16041059792041779, "num_tokens": 22335017.0, "step": 9750 }, { "entropy": 5.667694616317749, "epoch": 0.9643139580862001, "grad_norm": 2.453125, "learning_rate": 0.0004915699012402047, "loss": 5.4992, "mean_token_accuracy": 0.1760917529463768, "num_tokens": 22346250.0, "step": 9755 }, { "entropy": 5.755313062667847, "epoch": 0.9648082245947015, "grad_norm": 2.109375, "learning_rate": 0.0004915603291702995, "loss": 5.5462, "mean_token_accuracy": 0.17052748203277587, "num_tokens": 22357436.0, "step": 9760 }, { "entropy": 5.755286169052124, "epoch": 0.9653024911032029, "grad_norm": 2.546875, "learning_rate": 0.0004915507517729765, "loss": 5.4888, "mean_token_accuracy": 0.174141626060009, "num_tokens": 22368312.0, "step": 9765 }, { "entropy": 5.719630479812622, "epoch": 0.9657967576117042, "grad_norm": 1.671875, "learning_rate": 0.0004915411690484715, "loss": 5.5166, "mean_token_accuracy": 0.1709474354982376, "num_tokens": 22378659.0, "step": 9770 }, { "entropy": 5.720451307296753, "epoch": 0.9662910241202056, "grad_norm": 2.140625, "learning_rate": 0.0004915315809970202, "loss": 5.5186, "mean_token_accuracy": 0.17279943972826003, "num_tokens": 22390642.0, "step": 9775 }, { "entropy": 5.779125785827636, "epoch": 0.966785290628707, "grad_norm": 2.328125, "learning_rate": 0.0004915219876188583, "loss": 5.6254, "mean_token_accuracy": 0.16319596916437148, "num_tokens": 22402484.0, "step": 9780 }, { "entropy": 5.709197664260865, "epoch": 0.9672795571372084, "grad_norm": 2.34375, "learning_rate": 0.0004915123889142221, "loss": 5.5234, "mean_token_accuracy": 0.17170323580503463, "num_tokens": 22413315.0, "step": 9785 }, { "entropy": 5.778808069229126, "epoch": 0.9677738236457097, "grad_norm": 1.8984375, "learning_rate": 0.0004915027848833472, "loss": 5.5834, "mean_token_accuracy": 0.16111094057559966, "num_tokens": 22425123.0, "step": 9790 }, { "entropy": 5.730625629425049, "epoch": 0.9682680901542111, "grad_norm": 2.359375, "learning_rate": 0.0004914931755264705, "loss": 5.4801, "mean_token_accuracy": 0.17246174812316895, "num_tokens": 22436437.0, "step": 9795 }, { "entropy": 5.721488285064697, "epoch": 0.9687623566627125, "grad_norm": 1.671875, "learning_rate": 0.000491483560843828, "loss": 5.4722, "mean_token_accuracy": 0.17317120879888534, "num_tokens": 22446677.0, "step": 9800 }, { "entropy": 5.724382066726685, "epoch": 0.969256623171214, "grad_norm": 1.828125, "learning_rate": 0.0004914739408356563, "loss": 5.5369, "mean_token_accuracy": 0.17374182641506195, "num_tokens": 22457597.0, "step": 9805 }, { "entropy": 5.784380340576172, "epoch": 0.9697508896797153, "grad_norm": 1.6640625, "learning_rate": 0.0004914643155021921, "loss": 5.6127, "mean_token_accuracy": 0.17223210036754608, "num_tokens": 22469715.0, "step": 9810 }, { "entropy": 5.738711214065551, "epoch": 0.9702451561882167, "grad_norm": 1.9140625, "learning_rate": 0.0004914546848436722, "loss": 5.5637, "mean_token_accuracy": 0.16941601932048797, "num_tokens": 22479840.0, "step": 9815 }, { "entropy": 5.689458894729614, "epoch": 0.9707394226967181, "grad_norm": 7.0625, "learning_rate": 0.0004914450488603334, "loss": 5.4809, "mean_token_accuracy": 0.17289411127567292, "num_tokens": 22491017.0, "step": 9820 }, { "entropy": 5.727369022369385, "epoch": 0.9712336892052195, "grad_norm": 1.671875, "learning_rate": 0.0004914354075524129, "loss": 5.4819, "mean_token_accuracy": 0.17074205428361894, "num_tokens": 22502308.0, "step": 9825 }, { "entropy": 5.597308731079101, "epoch": 0.9717279557137208, "grad_norm": 1.65625, "learning_rate": 0.0004914257609201477, "loss": 5.4226, "mean_token_accuracy": 0.18115499317646028, "num_tokens": 22513090.0, "step": 9830 }, { "entropy": 5.680245494842529, "epoch": 0.9722222222222222, "grad_norm": 1.984375, "learning_rate": 0.0004914161089637752, "loss": 5.4995, "mean_token_accuracy": 0.17669508904218673, "num_tokens": 22523391.0, "step": 9835 }, { "entropy": 5.68854022026062, "epoch": 0.9727164887307236, "grad_norm": 1.71875, "learning_rate": 0.0004914064516835329, "loss": 5.4841, "mean_token_accuracy": 0.1739958181977272, "num_tokens": 22536038.0, "step": 9840 }, { "entropy": 5.7563879013061525, "epoch": 0.973210755239225, "grad_norm": 1.8046875, "learning_rate": 0.0004913967890796583, "loss": 5.5307, "mean_token_accuracy": 0.16982893347740174, "num_tokens": 22546897.0, "step": 9845 }, { "entropy": 5.715967416763306, "epoch": 0.9737050217477263, "grad_norm": 1.8828125, "learning_rate": 0.0004913871211523891, "loss": 5.5775, "mean_token_accuracy": 0.16490885317325593, "num_tokens": 22558240.0, "step": 9850 }, { "entropy": 5.6967414855957035, "epoch": 0.9741992882562278, "grad_norm": 2.4375, "learning_rate": 0.0004913774479019633, "loss": 5.5312, "mean_token_accuracy": 0.17213609218597412, "num_tokens": 22570540.0, "step": 9855 }, { "entropy": 5.81184492111206, "epoch": 0.9746935547647292, "grad_norm": 1.984375, "learning_rate": 0.0004913677693286185, "loss": 5.6159, "mean_token_accuracy": 0.16770697087049485, "num_tokens": 22582657.0, "step": 9860 }, { "entropy": 5.81785569190979, "epoch": 0.9751878212732306, "grad_norm": 2.09375, "learning_rate": 0.0004913580854325932, "loss": 5.6541, "mean_token_accuracy": 0.16404767334461212, "num_tokens": 22593445.0, "step": 9865 }, { "entropy": 5.690832710266113, "epoch": 0.9756820877817319, "grad_norm": 2.078125, "learning_rate": 0.0004913483962141253, "loss": 5.501, "mean_token_accuracy": 0.16884115636348723, "num_tokens": 22604631.0, "step": 9870 }, { "entropy": 5.682158422470093, "epoch": 0.9761763542902333, "grad_norm": 1.5078125, "learning_rate": 0.0004913387016734533, "loss": 5.5136, "mean_token_accuracy": 0.17531213015317917, "num_tokens": 22615130.0, "step": 9875 }, { "entropy": 5.705617094039917, "epoch": 0.9766706207987347, "grad_norm": 1.4921875, "learning_rate": 0.0004913290018108157, "loss": 5.5195, "mean_token_accuracy": 0.1676092565059662, "num_tokens": 22627372.0, "step": 9880 }, { "entropy": 5.794613313674927, "epoch": 0.977164887307236, "grad_norm": 1.578125, "learning_rate": 0.0004913192966264511, "loss": 5.6028, "mean_token_accuracy": 0.16676058620214462, "num_tokens": 22640354.0, "step": 9885 }, { "entropy": 5.773149681091309, "epoch": 0.9776591538157374, "grad_norm": 1.4765625, "learning_rate": 0.0004913095861205982, "loss": 5.603, "mean_token_accuracy": 0.1643069788813591, "num_tokens": 22651717.0, "step": 9890 }, { "entropy": 5.84906964302063, "epoch": 0.9781534203242388, "grad_norm": 1.734375, "learning_rate": 0.0004912998702934961, "loss": 5.6459, "mean_token_accuracy": 0.16125912070274354, "num_tokens": 22663334.0, "step": 9895 }, { "entropy": 5.792688226699829, "epoch": 0.9786476868327402, "grad_norm": 1.703125, "learning_rate": 0.0004912901491453835, "loss": 5.545, "mean_token_accuracy": 0.17154308557510375, "num_tokens": 22675894.0, "step": 9900 }, { "entropy": 5.651049518585205, "epoch": 0.9791419533412415, "grad_norm": 2.03125, "learning_rate": 0.0004912804226764997, "loss": 5.4765, "mean_token_accuracy": 0.18328205943107606, "num_tokens": 22687861.0, "step": 9905 }, { "entropy": 5.710421419143676, "epoch": 0.979636219849743, "grad_norm": 1.890625, "learning_rate": 0.0004912706908870838, "loss": 5.4763, "mean_token_accuracy": 0.1715717598795891, "num_tokens": 22698346.0, "step": 9910 }, { "entropy": 5.703184700012207, "epoch": 0.9801304863582444, "grad_norm": 1.734375, "learning_rate": 0.0004912609537773755, "loss": 5.5988, "mean_token_accuracy": 0.16239245235919952, "num_tokens": 22710665.0, "step": 9915 }, { "entropy": 5.711629629135132, "epoch": 0.9806247528667458, "grad_norm": 1.828125, "learning_rate": 0.0004912512113476142, "loss": 5.5132, "mean_token_accuracy": 0.17588357776403427, "num_tokens": 22720989.0, "step": 9920 }, { "entropy": 5.689323139190674, "epoch": 0.9811190193752471, "grad_norm": 2.59375, "learning_rate": 0.0004912414635980395, "loss": 5.5147, "mean_token_accuracy": 0.17529048919677734, "num_tokens": 22732265.0, "step": 9925 }, { "entropy": 5.712391090393067, "epoch": 0.9816132858837485, "grad_norm": 1.59375, "learning_rate": 0.0004912317105288912, "loss": 5.5162, "mean_token_accuracy": 0.16600595265626908, "num_tokens": 22742435.0, "step": 9930 }, { "entropy": 5.696404027938843, "epoch": 0.9821075523922499, "grad_norm": 1.765625, "learning_rate": 0.0004912219521404094, "loss": 5.4883, "mean_token_accuracy": 0.17258599251508713, "num_tokens": 22753750.0, "step": 9935 }, { "entropy": 5.778047513961792, "epoch": 0.9826018189007513, "grad_norm": 4.46875, "learning_rate": 0.000491212188432834, "loss": 5.5516, "mean_token_accuracy": 0.16767684519290924, "num_tokens": 22765549.0, "step": 9940 }, { "entropy": 5.719587564468384, "epoch": 0.9830960854092526, "grad_norm": 2.453125, "learning_rate": 0.0004912024194064052, "loss": 5.611, "mean_token_accuracy": 0.16390867978334428, "num_tokens": 22777882.0, "step": 9945 }, { "entropy": 5.779613828659057, "epoch": 0.983590351917754, "grad_norm": 1.453125, "learning_rate": 0.0004911926450613633, "loss": 5.6056, "mean_token_accuracy": 0.16340621560811996, "num_tokens": 22789671.0, "step": 9950 }, { "entropy": 5.783669090270996, "epoch": 0.9840846184262554, "grad_norm": 1.6328125, "learning_rate": 0.0004911828653979488, "loss": 5.5757, "mean_token_accuracy": 0.16210843324661256, "num_tokens": 22801330.0, "step": 9955 }, { "entropy": 5.725742197036743, "epoch": 0.9845788849347569, "grad_norm": 1.390625, "learning_rate": 0.0004911730804164024, "loss": 5.5996, "mean_token_accuracy": 0.16601726561784744, "num_tokens": 22813998.0, "step": 9960 }, { "entropy": 5.732435894012451, "epoch": 0.9850731514432582, "grad_norm": 1.828125, "learning_rate": 0.0004911632901169645, "loss": 5.5312, "mean_token_accuracy": 0.17036539912223816, "num_tokens": 22825048.0, "step": 9965 }, { "entropy": 5.63055191040039, "epoch": 0.9855674179517596, "grad_norm": 1.5859375, "learning_rate": 0.0004911534944998762, "loss": 5.4513, "mean_token_accuracy": 0.17461760640144347, "num_tokens": 22835450.0, "step": 9970 }, { "entropy": 5.666855812072754, "epoch": 0.986061684460261, "grad_norm": 1.7734375, "learning_rate": 0.0004911436935653785, "loss": 5.4842, "mean_token_accuracy": 0.1743703842163086, "num_tokens": 22847320.0, "step": 9975 }, { "entropy": 5.726233386993409, "epoch": 0.9865559509687624, "grad_norm": 2.1875, "learning_rate": 0.0004911338873137122, "loss": 5.4607, "mean_token_accuracy": 0.17830847352743148, "num_tokens": 22857676.0, "step": 9980 }, { "entropy": 5.659705543518067, "epoch": 0.9870502174772637, "grad_norm": 1.4765625, "learning_rate": 0.000491124075745119, "loss": 5.4851, "mean_token_accuracy": 0.17840947955846786, "num_tokens": 22869767.0, "step": 9985 }, { "entropy": 5.7767034530639645, "epoch": 0.9875444839857651, "grad_norm": 2.109375, "learning_rate": 0.0004911142588598399, "loss": 5.5869, "mean_token_accuracy": 0.17025674283504486, "num_tokens": 22880096.0, "step": 9990 }, { "entropy": 5.801022672653199, "epoch": 0.9880387504942665, "grad_norm": 1.6875, "learning_rate": 0.0004911044366581165, "loss": 5.4958, "mean_token_accuracy": 0.17515075951814651, "num_tokens": 22892436.0, "step": 9995 }, { "entropy": 5.759911441802979, "epoch": 0.9885330170027679, "grad_norm": 1.5546875, "learning_rate": 0.0004910946091401903, "loss": 5.5384, "mean_token_accuracy": 0.16783835142850875, "num_tokens": 22904641.0, "step": 10000 }, { "entropy": 5.6862218379974365, "epoch": 0.9890272835112692, "grad_norm": 1.4921875, "learning_rate": 0.0004910847763063033, "loss": 5.3948, "mean_token_accuracy": 0.17469682544469833, "num_tokens": 22915372.0, "step": 10005 }, { "entropy": 5.756756591796875, "epoch": 0.9895215500197707, "grad_norm": 1.796875, "learning_rate": 0.0004910749381566973, "loss": 5.6249, "mean_token_accuracy": 0.15831247717142105, "num_tokens": 22926583.0, "step": 10010 }, { "entropy": 5.726555013656617, "epoch": 0.9900158165282721, "grad_norm": 1.7890625, "learning_rate": 0.0004910650946916143, "loss": 5.4904, "mean_token_accuracy": 0.17097898572683334, "num_tokens": 22938103.0, "step": 10015 }, { "entropy": 5.692210149765015, "epoch": 0.9905100830367735, "grad_norm": 1.5390625, "learning_rate": 0.0004910552459112964, "loss": 5.5445, "mean_token_accuracy": 0.17311066538095474, "num_tokens": 22949475.0, "step": 10020 }, { "entropy": 5.73862590789795, "epoch": 0.9910043495452748, "grad_norm": 1.53125, "learning_rate": 0.0004910453918159861, "loss": 5.5659, "mean_token_accuracy": 0.16979775428771973, "num_tokens": 22961404.0, "step": 10025 }, { "entropy": 5.722372436523438, "epoch": 0.9914986160537762, "grad_norm": 1.6875, "learning_rate": 0.0004910355324059255, "loss": 5.5298, "mean_token_accuracy": 0.17193541228771209, "num_tokens": 22973009.0, "step": 10030 }, { "entropy": 5.701122713088989, "epoch": 0.9919928825622776, "grad_norm": 1.5078125, "learning_rate": 0.0004910256676813572, "loss": 5.576, "mean_token_accuracy": 0.17126102447509767, "num_tokens": 22985104.0, "step": 10035 }, { "entropy": 5.713639116287231, "epoch": 0.992487149070779, "grad_norm": 2.421875, "learning_rate": 0.0004910157976425241, "loss": 5.5728, "mean_token_accuracy": 0.1672808587551117, "num_tokens": 22997133.0, "step": 10040 }, { "entropy": 5.697215032577515, "epoch": 0.9929814155792803, "grad_norm": 1.3984375, "learning_rate": 0.0004910059222896689, "loss": 5.4149, "mean_token_accuracy": 0.17880269140005112, "num_tokens": 23007621.0, "step": 10045 }, { "entropy": 5.758591985702514, "epoch": 0.9934756820877817, "grad_norm": 1.4140625, "learning_rate": 0.0004909960416230344, "loss": 5.5798, "mean_token_accuracy": 0.1678140103816986, "num_tokens": 23018254.0, "step": 10050 }, { "entropy": 5.6953295230865475, "epoch": 0.9939699485962831, "grad_norm": 1.515625, "learning_rate": 0.0004909861556428638, "loss": 5.4975, "mean_token_accuracy": 0.17135821878910065, "num_tokens": 23030733.0, "step": 10055 }, { "entropy": 5.6859265804290775, "epoch": 0.9944642151047846, "grad_norm": 1.609375, "learning_rate": 0.0004909762643494003, "loss": 5.4804, "mean_token_accuracy": 0.16995348781347275, "num_tokens": 23043086.0, "step": 10060 }, { "entropy": 5.784011268615723, "epoch": 0.9949584816132859, "grad_norm": 2.046875, "learning_rate": 0.0004909663677428872, "loss": 5.6515, "mean_token_accuracy": 0.16197943538427353, "num_tokens": 23055281.0, "step": 10065 }, { "entropy": 5.6577071189880375, "epoch": 0.9954527481217873, "grad_norm": 1.4609375, "learning_rate": 0.0004909564658235678, "loss": 5.531, "mean_token_accuracy": 0.17189735770225525, "num_tokens": 23067332.0, "step": 10070 }, { "entropy": 5.707271242141724, "epoch": 0.9959470146302887, "grad_norm": 1.75, "learning_rate": 0.000490946558591686, "loss": 5.5062, "mean_token_accuracy": 0.17119333148002625, "num_tokens": 23079278.0, "step": 10075 }, { "entropy": 5.704014110565185, "epoch": 0.99644128113879, "grad_norm": 1.75, "learning_rate": 0.0004909366460474852, "loss": 5.5154, "mean_token_accuracy": 0.1689569190144539, "num_tokens": 23092177.0, "step": 10080 }, { "entropy": 5.638453149795533, "epoch": 0.9969355476472914, "grad_norm": 1.625, "learning_rate": 0.0004909267281912095, "loss": 5.5239, "mean_token_accuracy": 0.17321101874113082, "num_tokens": 23103249.0, "step": 10085 }, { "entropy": 5.669422817230225, "epoch": 0.9974298141557928, "grad_norm": 1.7265625, "learning_rate": 0.0004909168050231029, "loss": 5.5578, "mean_token_accuracy": 0.1760734960436821, "num_tokens": 23113821.0, "step": 10090 }, { "entropy": 5.777122926712036, "epoch": 0.9979240806642942, "grad_norm": 1.859375, "learning_rate": 0.0004909068765434093, "loss": 5.5645, "mean_token_accuracy": 0.16094685047864915, "num_tokens": 23124819.0, "step": 10095 }, { "entropy": 5.758470964431763, "epoch": 0.9984183471727955, "grad_norm": 1.7421875, "learning_rate": 0.000490896942752373, "loss": 5.5615, "mean_token_accuracy": 0.16750091016292573, "num_tokens": 23135590.0, "step": 10100 }, { "entropy": 5.721115493774414, "epoch": 0.9989126136812969, "grad_norm": 1.7734375, "learning_rate": 0.0004908870036502384, "loss": 5.5313, "mean_token_accuracy": 0.1731726974248886, "num_tokens": 23147290.0, "step": 10105 }, { "entropy": 5.744794416427612, "epoch": 0.9994068801897983, "grad_norm": 1.53125, "learning_rate": 0.0004908770592372501, "loss": 5.5257, "mean_token_accuracy": 0.17112929821014405, "num_tokens": 23158276.0, "step": 10110 }, { "entropy": 5.714811325073242, "epoch": 0.9999011466982998, "grad_norm": 1.6328125, "learning_rate": 0.0004908671095136526, "loss": 5.5044, "mean_token_accuracy": 0.1722613126039505, "num_tokens": 23169174.0, "step": 10115 }, { "entropy": 5.721333026885986, "epoch": 1.0003954132068011, "grad_norm": 1.953125, "learning_rate": 0.0004908571544796908, "loss": 5.5284, "mean_token_accuracy": 0.16843016892671586, "num_tokens": 23180377.0, "step": 10120 }, { "entropy": 5.708949089050293, "epoch": 1.0008896797153024, "grad_norm": 2.375, "learning_rate": 0.0004908471941356094, "loss": 5.4766, "mean_token_accuracy": 0.17432643324136735, "num_tokens": 23191158.0, "step": 10125 }, { "entropy": 5.743306827545166, "epoch": 1.001383946223804, "grad_norm": 1.609375, "learning_rate": 0.0004908372284816537, "loss": 5.4925, "mean_token_accuracy": 0.1740867018699646, "num_tokens": 23201956.0, "step": 10130 }, { "entropy": 5.684691715240478, "epoch": 1.0018782127323052, "grad_norm": 1.8828125, "learning_rate": 0.0004908272575180685, "loss": 5.4276, "mean_token_accuracy": 0.1736741080880165, "num_tokens": 23213449.0, "step": 10135 }, { "entropy": 5.775772142410278, "epoch": 1.0023724792408066, "grad_norm": 1.453125, "learning_rate": 0.0004908172812450993, "loss": 5.5231, "mean_token_accuracy": 0.15992673933506013, "num_tokens": 23226514.0, "step": 10140 }, { "entropy": 5.662961006164551, "epoch": 1.0028667457493081, "grad_norm": 1.5, "learning_rate": 0.0004908072996629917, "loss": 5.445, "mean_token_accuracy": 0.16994922310113908, "num_tokens": 23239322.0, "step": 10145 }, { "entropy": 5.707709884643554, "epoch": 1.0033610122578094, "grad_norm": 1.65625, "learning_rate": 0.0004907973127719909, "loss": 5.4795, "mean_token_accuracy": 0.17108853608369828, "num_tokens": 23250990.0, "step": 10150 }, { "entropy": 5.72198257446289, "epoch": 1.0038552787663109, "grad_norm": 1.6796875, "learning_rate": 0.0004907873205723427, "loss": 5.5102, "mean_token_accuracy": 0.16593290269374847, "num_tokens": 23261630.0, "step": 10155 }, { "entropy": 5.7621190547943115, "epoch": 1.0043495452748121, "grad_norm": 1.78125, "learning_rate": 0.000490777323064293, "loss": 5.4764, "mean_token_accuracy": 0.16607781499624252, "num_tokens": 23272823.0, "step": 10160 }, { "entropy": 5.625604629516602, "epoch": 1.0048438117833136, "grad_norm": 1.421875, "learning_rate": 0.0004907673202480876, "loss": 5.2859, "mean_token_accuracy": 0.19299798607826232, "num_tokens": 23282827.0, "step": 10165 }, { "entropy": 5.698440217971802, "epoch": 1.0053380782918149, "grad_norm": 1.4453125, "learning_rate": 0.0004907573121239727, "loss": 5.4919, "mean_token_accuracy": 0.17170169204473495, "num_tokens": 23295359.0, "step": 10170 }, { "entropy": 5.697689151763916, "epoch": 1.0058323448003164, "grad_norm": 2.328125, "learning_rate": 0.0004907472986921945, "loss": 5.4573, "mean_token_accuracy": 0.17231786549091338, "num_tokens": 23305932.0, "step": 10175 }, { "entropy": 5.676281976699829, "epoch": 1.0063266113088176, "grad_norm": 1.5625, "learning_rate": 0.0004907372799529992, "loss": 5.4342, "mean_token_accuracy": 0.1741688385605812, "num_tokens": 23317856.0, "step": 10180 }, { "entropy": 5.693381118774414, "epoch": 1.006820877817319, "grad_norm": 1.78125, "learning_rate": 0.0004907272559066334, "loss": 5.3396, "mean_token_accuracy": 0.18660397678613663, "num_tokens": 23328071.0, "step": 10185 }, { "entropy": 5.651421022415161, "epoch": 1.0073151443258206, "grad_norm": 2.109375, "learning_rate": 0.0004907172265533436, "loss": 5.5209, "mean_token_accuracy": 0.1700335383415222, "num_tokens": 23339601.0, "step": 10190 }, { "entropy": 5.740713691711425, "epoch": 1.0078094108343219, "grad_norm": 1.75, "learning_rate": 0.0004907071918933766, "loss": 5.4867, "mean_token_accuracy": 0.17361918538808824, "num_tokens": 23351672.0, "step": 10195 }, { "entropy": 5.7681866645812985, "epoch": 1.0083036773428233, "grad_norm": 1.5703125, "learning_rate": 0.0004906971519269793, "loss": 5.5063, "mean_token_accuracy": 0.17053833603858948, "num_tokens": 23361684.0, "step": 10200 }, { "entropy": 5.615524816513061, "epoch": 1.0087979438513246, "grad_norm": 1.625, "learning_rate": 0.0004906871066543984, "loss": 5.4756, "mean_token_accuracy": 0.17541383057832718, "num_tokens": 23373969.0, "step": 10205 }, { "entropy": 5.7493010520935055, "epoch": 1.009292210359826, "grad_norm": 1.515625, "learning_rate": 0.0004906770560758813, "loss": 5.5105, "mean_token_accuracy": 0.16009564846754074, "num_tokens": 23384747.0, "step": 10210 }, { "entropy": 5.768032264709473, "epoch": 1.0097864768683273, "grad_norm": 1.734375, "learning_rate": 0.0004906670001916752, "loss": 5.4713, "mean_token_accuracy": 0.1735076993703842, "num_tokens": 23395900.0, "step": 10215 }, { "entropy": 5.717750883102417, "epoch": 1.0102807433768288, "grad_norm": 3.453125, "learning_rate": 0.0004906569390020274, "loss": 5.4877, "mean_token_accuracy": 0.17244392186403273, "num_tokens": 23408912.0, "step": 10220 }, { "entropy": 5.712572050094605, "epoch": 1.01077500988533, "grad_norm": 1.65625, "learning_rate": 0.0004906468725071855, "loss": 5.4131, "mean_token_accuracy": 0.17759112566709517, "num_tokens": 23419042.0, "step": 10225 }, { "entropy": 5.693017435073853, "epoch": 1.0112692763938316, "grad_norm": 1.609375, "learning_rate": 0.000490636800707397, "loss": 5.4527, "mean_token_accuracy": 0.17689252644777298, "num_tokens": 23430861.0, "step": 10230 }, { "entropy": 5.77862868309021, "epoch": 1.0117635429023328, "grad_norm": 1.546875, "learning_rate": 0.0004906267236029099, "loss": 5.5539, "mean_token_accuracy": 0.1663425713777542, "num_tokens": 23443489.0, "step": 10235 }, { "entropy": 5.709869241714477, "epoch": 1.0122578094108343, "grad_norm": 1.6875, "learning_rate": 0.0004906166411939718, "loss": 5.476, "mean_token_accuracy": 0.17230155020952226, "num_tokens": 23454327.0, "step": 10240 }, { "entropy": 5.6665137767791744, "epoch": 1.0127520759193358, "grad_norm": 1.8359375, "learning_rate": 0.0004906065534808309, "loss": 5.38, "mean_token_accuracy": 0.17807909101247787, "num_tokens": 23466684.0, "step": 10245 }, { "entropy": 5.678644275665283, "epoch": 1.013246342427837, "grad_norm": 1.4609375, "learning_rate": 0.0004905964604637353, "loss": 5.477, "mean_token_accuracy": 0.17528004497289656, "num_tokens": 23478347.0, "step": 10250 }, { "entropy": 5.622536945343017, "epoch": 1.0137406089363385, "grad_norm": 1.9140625, "learning_rate": 0.0004905863621429334, "loss": 5.3539, "mean_token_accuracy": 0.17825525999069214, "num_tokens": 23489588.0, "step": 10255 }, { "entropy": 5.642977619171143, "epoch": 1.0142348754448398, "grad_norm": 1.6015625, "learning_rate": 0.0004905762585186735, "loss": 5.4355, "mean_token_accuracy": 0.17546121925115585, "num_tokens": 23501347.0, "step": 10260 }, { "entropy": 5.768431997299194, "epoch": 1.0147291419533413, "grad_norm": 1.59375, "learning_rate": 0.0004905661495912042, "loss": 5.5025, "mean_token_accuracy": 0.16941647082567216, "num_tokens": 23513036.0, "step": 10265 }, { "entropy": 5.641936492919922, "epoch": 1.0152234084618426, "grad_norm": 3.3125, "learning_rate": 0.0004905560353607742, "loss": 5.385, "mean_token_accuracy": 0.17548509687185287, "num_tokens": 23524166.0, "step": 10270 }, { "entropy": 5.633813858032227, "epoch": 1.015717674970344, "grad_norm": 1.6484375, "learning_rate": 0.0004905459158276323, "loss": 5.4743, "mean_token_accuracy": 0.17159906774759293, "num_tokens": 23536638.0, "step": 10275 }, { "entropy": 5.7214484214782715, "epoch": 1.0162119414788453, "grad_norm": 1.90625, "learning_rate": 0.0004905357909920275, "loss": 5.4902, "mean_token_accuracy": 0.17271796464920045, "num_tokens": 23548567.0, "step": 10280 }, { "entropy": 5.696207189559937, "epoch": 1.0167062079873468, "grad_norm": 1.984375, "learning_rate": 0.0004905256608542086, "loss": 5.4225, "mean_token_accuracy": 0.1777705207467079, "num_tokens": 23560108.0, "step": 10285 }, { "entropy": 5.632985210418701, "epoch": 1.0172004744958483, "grad_norm": 3.0625, "learning_rate": 0.0004905155254144251, "loss": 5.4225, "mean_token_accuracy": 0.17967845052480697, "num_tokens": 23571542.0, "step": 10290 }, { "entropy": 5.601810550689697, "epoch": 1.0176947410043495, "grad_norm": 1.7421875, "learning_rate": 0.0004905053846729263, "loss": 5.4001, "mean_token_accuracy": 0.17619881480932237, "num_tokens": 23582200.0, "step": 10295 }, { "entropy": 5.703922843933105, "epoch": 1.018189007512851, "grad_norm": 1.53125, "learning_rate": 0.0004904952386299616, "loss": 5.4895, "mean_token_accuracy": 0.16764492392539979, "num_tokens": 23594530.0, "step": 10300 }, { "entropy": 5.69450831413269, "epoch": 1.0186832740213523, "grad_norm": 1.6875, "learning_rate": 0.0004904850872857805, "loss": 5.3444, "mean_token_accuracy": 0.19017274230718612, "num_tokens": 23605697.0, "step": 10305 }, { "entropy": 5.652023887634277, "epoch": 1.0191775405298538, "grad_norm": 1.4765625, "learning_rate": 0.000490474930640633, "loss": 5.5008, "mean_token_accuracy": 0.17088642716407776, "num_tokens": 23615730.0, "step": 10310 }, { "entropy": 5.571003818511963, "epoch": 1.019671807038355, "grad_norm": 1.453125, "learning_rate": 0.0004904647686947687, "loss": 5.4094, "mean_token_accuracy": 0.182180692255497, "num_tokens": 23627242.0, "step": 10315 }, { "entropy": 5.624724102020264, "epoch": 1.0201660735468565, "grad_norm": 1.6171875, "learning_rate": 0.0004904546014484376, "loss": 5.3522, "mean_token_accuracy": 0.18565500676631927, "num_tokens": 23639450.0, "step": 10320 }, { "entropy": 5.730679082870483, "epoch": 1.0206603400553578, "grad_norm": 1.6953125, "learning_rate": 0.0004904444289018898, "loss": 5.4622, "mean_token_accuracy": 0.17341006845235823, "num_tokens": 23651154.0, "step": 10325 }, { "entropy": 5.69901762008667, "epoch": 1.0211546065638593, "grad_norm": 1.984375, "learning_rate": 0.0004904342510553758, "loss": 5.5191, "mean_token_accuracy": 0.16899913549423218, "num_tokens": 23663996.0, "step": 10330 }, { "entropy": 5.6800093173980715, "epoch": 1.0216488730723605, "grad_norm": 1.7578125, "learning_rate": 0.0004904240679091458, "loss": 5.4458, "mean_token_accuracy": 0.172891241312027, "num_tokens": 23676270.0, "step": 10335 }, { "entropy": 5.746737003326416, "epoch": 1.022143139580862, "grad_norm": 1.9140625, "learning_rate": 0.0004904138794634502, "loss": 5.4254, "mean_token_accuracy": 0.17328813523054123, "num_tokens": 23687483.0, "step": 10340 }, { "entropy": 5.73184905052185, "epoch": 1.0226374060893635, "grad_norm": 5.375, "learning_rate": 0.0004904036857185398, "loss": 5.5057, "mean_token_accuracy": 0.17040742337703704, "num_tokens": 23697956.0, "step": 10345 }, { "entropy": 5.670113945007325, "epoch": 1.0231316725978647, "grad_norm": 1.921875, "learning_rate": 0.0004903934866746653, "loss": 5.4599, "mean_token_accuracy": 0.17762310802936554, "num_tokens": 23709029.0, "step": 10350 }, { "entropy": 5.65038914680481, "epoch": 1.0236259391063662, "grad_norm": 1.796875, "learning_rate": 0.0004903832823320777, "loss": 5.3957, "mean_token_accuracy": 0.1827886775135994, "num_tokens": 23719792.0, "step": 10355 }, { "entropy": 5.703197288513183, "epoch": 1.0241202056148675, "grad_norm": 2.625, "learning_rate": 0.0004903730726910278, "loss": 5.4657, "mean_token_accuracy": 0.1736227661371231, "num_tokens": 23730201.0, "step": 10360 }, { "entropy": 5.679931545257569, "epoch": 1.024614472123369, "grad_norm": 1.671875, "learning_rate": 0.000490362857751767, "loss": 5.414, "mean_token_accuracy": 0.17664798051118852, "num_tokens": 23741743.0, "step": 10365 }, { "entropy": 5.661805295944214, "epoch": 1.0251087386318702, "grad_norm": 1.953125, "learning_rate": 0.0004903526375145465, "loss": 5.3697, "mean_token_accuracy": 0.17597247511148453, "num_tokens": 23753879.0, "step": 10370 }, { "entropy": 5.698982429504395, "epoch": 1.0256030051403717, "grad_norm": 2.171875, "learning_rate": 0.0004903424119796176, "loss": 5.5251, "mean_token_accuracy": 0.16546280086040496, "num_tokens": 23765062.0, "step": 10375 }, { "entropy": 5.687112331390381, "epoch": 1.026097271648873, "grad_norm": 1.6875, "learning_rate": 0.0004903321811472321, "loss": 5.4873, "mean_token_accuracy": 0.17693398892879486, "num_tokens": 23777261.0, "step": 10380 }, { "entropy": 5.698892879486084, "epoch": 1.0265915381573745, "grad_norm": 1.6484375, "learning_rate": 0.0004903219450176413, "loss": 5.48, "mean_token_accuracy": 0.17271430939435958, "num_tokens": 23789247.0, "step": 10385 }, { "entropy": 5.683625364303589, "epoch": 1.0270858046658757, "grad_norm": 1.7890625, "learning_rate": 0.0004903117035910975, "loss": 5.3765, "mean_token_accuracy": 0.17468706369400025, "num_tokens": 23798981.0, "step": 10390 }, { "entropy": 5.710557699203491, "epoch": 1.0275800711743772, "grad_norm": 1.6328125, "learning_rate": 0.0004903014568678523, "loss": 5.4939, "mean_token_accuracy": 0.17281184941530228, "num_tokens": 23810856.0, "step": 10395 }, { "entropy": 5.70170259475708, "epoch": 1.0280743376828787, "grad_norm": 1.609375, "learning_rate": 0.0004902912048481579, "loss": 5.4876, "mean_token_accuracy": 0.17184120863676072, "num_tokens": 23821544.0, "step": 10400 }, { "entropy": 5.665974378585815, "epoch": 1.02856860419138, "grad_norm": 1.6796875, "learning_rate": 0.0004902809475322664, "loss": 5.423, "mean_token_accuracy": 0.1731875240802765, "num_tokens": 23831972.0, "step": 10405 }, { "entropy": 5.758858346939087, "epoch": 1.0290628706998814, "grad_norm": 1.7734375, "learning_rate": 0.0004902706849204302, "loss": 5.4198, "mean_token_accuracy": 0.17724981009960175, "num_tokens": 23843451.0, "step": 10410 }, { "entropy": 5.674815464019775, "epoch": 1.0295571372083827, "grad_norm": 1.71875, "learning_rate": 0.0004902604170129017, "loss": 5.4488, "mean_token_accuracy": 0.17553705275058745, "num_tokens": 23854060.0, "step": 10415 }, { "entropy": 5.753055143356323, "epoch": 1.0300514037168842, "grad_norm": 2.109375, "learning_rate": 0.0004902501438099337, "loss": 5.5603, "mean_token_accuracy": 0.1612450122833252, "num_tokens": 23865722.0, "step": 10420 }, { "entropy": 5.7256828308105465, "epoch": 1.0305456702253855, "grad_norm": 1.734375, "learning_rate": 0.0004902398653117787, "loss": 5.4783, "mean_token_accuracy": 0.1738601580262184, "num_tokens": 23875888.0, "step": 10425 }, { "entropy": 5.726684522628784, "epoch": 1.031039936733887, "grad_norm": 1.6640625, "learning_rate": 0.0004902295815186896, "loss": 5.4912, "mean_token_accuracy": 0.16859359592199324, "num_tokens": 23887816.0, "step": 10430 }, { "entropy": 5.703883075714112, "epoch": 1.0315342032423882, "grad_norm": 1.5859375, "learning_rate": 0.0004902192924309193, "loss": 5.4453, "mean_token_accuracy": 0.1753258228302002, "num_tokens": 23900468.0, "step": 10435 }, { "entropy": 5.7410656929016115, "epoch": 1.0320284697508897, "grad_norm": 1.984375, "learning_rate": 0.0004902089980487211, "loss": 5.4022, "mean_token_accuracy": 0.17207707464694977, "num_tokens": 23912086.0, "step": 10440 }, { "entropy": 5.670900201797485, "epoch": 1.032522736259391, "grad_norm": 1.6171875, "learning_rate": 0.0004901986983723483, "loss": 5.448, "mean_token_accuracy": 0.17552540749311446, "num_tokens": 23923262.0, "step": 10445 }, { "entropy": 5.600853347778321, "epoch": 1.0330170027678924, "grad_norm": 3.34375, "learning_rate": 0.000490188393402054, "loss": 5.4123, "mean_token_accuracy": 0.172198124229908, "num_tokens": 23934660.0, "step": 10450 }, { "entropy": 5.687058019638061, "epoch": 1.033511269276394, "grad_norm": 2.40625, "learning_rate": 0.0004901780831380919, "loss": 5.4066, "mean_token_accuracy": 0.18070681244134904, "num_tokens": 23945822.0, "step": 10455 }, { "entropy": 5.681888008117676, "epoch": 1.0340055357848952, "grad_norm": 1.890625, "learning_rate": 0.0004901677675807155, "loss": 5.4855, "mean_token_accuracy": 0.17444808334112166, "num_tokens": 23957312.0, "step": 10460 }, { "entropy": 5.696739625930786, "epoch": 1.0344998022933967, "grad_norm": 1.8984375, "learning_rate": 0.0004901574467301786, "loss": 5.4576, "mean_token_accuracy": 0.1726560115814209, "num_tokens": 23968477.0, "step": 10465 }, { "entropy": 5.620746803283692, "epoch": 1.034994068801898, "grad_norm": 1.9765625, "learning_rate": 0.0004901471205867353, "loss": 5.382, "mean_token_accuracy": 0.17293237149715424, "num_tokens": 23979041.0, "step": 10470 }, { "entropy": 5.739405393600464, "epoch": 1.0354883353103994, "grad_norm": 1.5703125, "learning_rate": 0.0004901367891506393, "loss": 5.4879, "mean_token_accuracy": 0.1751044735312462, "num_tokens": 23990947.0, "step": 10475 }, { "entropy": 5.715644311904907, "epoch": 1.0359826018189007, "grad_norm": 1.640625, "learning_rate": 0.000490126452422145, "loss": 5.3961, "mean_token_accuracy": 0.18013232350349426, "num_tokens": 24001652.0, "step": 10480 }, { "entropy": 5.732950448989868, "epoch": 1.0364768683274022, "grad_norm": 2.4375, "learning_rate": 0.0004901161104015066, "loss": 5.4818, "mean_token_accuracy": 0.1697138473391533, "num_tokens": 24012707.0, "step": 10485 }, { "entropy": 5.5767247676849365, "epoch": 1.0369711348359034, "grad_norm": 1.9375, "learning_rate": 0.0004901057630889784, "loss": 5.3276, "mean_token_accuracy": 0.1830436870455742, "num_tokens": 24024136.0, "step": 10490 }, { "entropy": 5.692571210861206, "epoch": 1.037465401344405, "grad_norm": 2.296875, "learning_rate": 0.0004900954104848152, "loss": 5.4736, "mean_token_accuracy": 0.17764198333024978, "num_tokens": 24035586.0, "step": 10495 }, { "entropy": 5.698720121383667, "epoch": 1.0379596678529064, "grad_norm": 2.109375, "learning_rate": 0.0004900850525892714, "loss": 5.4103, "mean_token_accuracy": 0.17735551595687865, "num_tokens": 24045338.0, "step": 10500 }, { "entropy": 5.730284309387207, "epoch": 1.0384539343614076, "grad_norm": 1.984375, "learning_rate": 0.000490074689402602, "loss": 5.5, "mean_token_accuracy": 0.16347283273935317, "num_tokens": 24056898.0, "step": 10505 }, { "entropy": 5.6666100978851315, "epoch": 1.0389482008699091, "grad_norm": 1.5, "learning_rate": 0.0004900643209250619, "loss": 5.3773, "mean_token_accuracy": 0.18072302937507628, "num_tokens": 24068998.0, "step": 10510 }, { "entropy": 5.636692190170288, "epoch": 1.0394424673784104, "grad_norm": 1.9296875, "learning_rate": 0.0004900539471569061, "loss": 5.4409, "mean_token_accuracy": 0.1745138868689537, "num_tokens": 24080301.0, "step": 10515 }, { "entropy": 5.657697582244873, "epoch": 1.0399367338869119, "grad_norm": 1.9140625, "learning_rate": 0.00049004356809839, "loss": 5.4701, "mean_token_accuracy": 0.17101382613182067, "num_tokens": 24092601.0, "step": 10520 }, { "entropy": 5.801998853683472, "epoch": 1.0404310003954131, "grad_norm": 1.84375, "learning_rate": 0.0004900331837497686, "loss": 5.5748, "mean_token_accuracy": 0.16291743665933608, "num_tokens": 24105621.0, "step": 10525 }, { "entropy": 5.733995389938355, "epoch": 1.0409252669039146, "grad_norm": 2.46875, "learning_rate": 0.0004900227941112976, "loss": 5.446, "mean_token_accuracy": 0.1833525836467743, "num_tokens": 24117926.0, "step": 10530 }, { "entropy": 5.664119672775269, "epoch": 1.0414195334124159, "grad_norm": 1.5703125, "learning_rate": 0.0004900123991832323, "loss": 5.4049, "mean_token_accuracy": 0.17392261922359467, "num_tokens": 24129119.0, "step": 10535 }, { "entropy": 5.604949569702148, "epoch": 1.0419137999209174, "grad_norm": 2.015625, "learning_rate": 0.0004900019989658288, "loss": 5.4643, "mean_token_accuracy": 0.16780135184526443, "num_tokens": 24141726.0, "step": 10540 }, { "entropy": 5.795202016830444, "epoch": 1.0424080664294189, "grad_norm": 2.234375, "learning_rate": 0.0004899915934593427, "loss": 5.4902, "mean_token_accuracy": 0.17176624685525893, "num_tokens": 24152912.0, "step": 10545 }, { "entropy": 5.802124071121216, "epoch": 1.0429023329379201, "grad_norm": 2.59375, "learning_rate": 0.0004899811826640302, "loss": 5.5042, "mean_token_accuracy": 0.16834273487329482, "num_tokens": 24163602.0, "step": 10550 }, { "entropy": 5.677811765670777, "epoch": 1.0433965994464216, "grad_norm": 1.9453125, "learning_rate": 0.0004899707665801471, "loss": 5.499, "mean_token_accuracy": 0.17468012869358063, "num_tokens": 24175904.0, "step": 10555 }, { "entropy": 5.661863040924072, "epoch": 1.0438908659549229, "grad_norm": 1.5859375, "learning_rate": 0.0004899603452079499, "loss": 5.4212, "mean_token_accuracy": 0.1718466505408287, "num_tokens": 24186438.0, "step": 10560 }, { "entropy": 5.694998502731323, "epoch": 1.0443851324634243, "grad_norm": 1.609375, "learning_rate": 0.0004899499185476948, "loss": 5.545, "mean_token_accuracy": 0.1677091032266617, "num_tokens": 24198357.0, "step": 10565 }, { "entropy": 5.8026610851287845, "epoch": 1.0448793989719256, "grad_norm": 1.7109375, "learning_rate": 0.0004899394865996383, "loss": 5.5847, "mean_token_accuracy": 0.1644972965121269, "num_tokens": 24211257.0, "step": 10570 }, { "entropy": 5.787684726715088, "epoch": 1.045373665480427, "grad_norm": 1.5390625, "learning_rate": 0.0004899290493640371, "loss": 5.5521, "mean_token_accuracy": 0.16253542751073838, "num_tokens": 24223189.0, "step": 10575 }, { "entropy": 5.669928932189942, "epoch": 1.0458679319889284, "grad_norm": 2.09375, "learning_rate": 0.0004899186068411481, "loss": 5.4573, "mean_token_accuracy": 0.17435319125652313, "num_tokens": 24234701.0, "step": 10580 }, { "entropy": 5.6718775749206545, "epoch": 1.0463621984974298, "grad_norm": 1.5390625, "learning_rate": 0.0004899081590312278, "loss": 5.4448, "mean_token_accuracy": 0.17705156952142714, "num_tokens": 24245562.0, "step": 10585 }, { "entropy": 5.695548248291016, "epoch": 1.046856465005931, "grad_norm": 2.09375, "learning_rate": 0.0004898977059345336, "loss": 5.4456, "mean_token_accuracy": 0.16797035187482834, "num_tokens": 24256479.0, "step": 10590 }, { "entropy": 5.726232385635376, "epoch": 1.0473507315144326, "grad_norm": 1.921875, "learning_rate": 0.0004898872475513225, "loss": 5.5574, "mean_token_accuracy": 0.16119212806224822, "num_tokens": 24266900.0, "step": 10595 }, { "entropy": 5.801811981201172, "epoch": 1.047844998022934, "grad_norm": 1.703125, "learning_rate": 0.0004898767838818517, "loss": 5.5412, "mean_token_accuracy": 0.1650843694806099, "num_tokens": 24278915.0, "step": 10600 }, { "entropy": 5.725538301467895, "epoch": 1.0483392645314353, "grad_norm": 1.4296875, "learning_rate": 0.0004898663149263787, "loss": 5.3705, "mean_token_accuracy": 0.18136925846338273, "num_tokens": 24289584.0, "step": 10605 }, { "entropy": 5.665912246704101, "epoch": 1.0488335310399368, "grad_norm": 1.6328125, "learning_rate": 0.0004898558406851611, "loss": 5.4032, "mean_token_accuracy": 0.17417797446250916, "num_tokens": 24300922.0, "step": 10610 }, { "entropy": 5.6453601837158205, "epoch": 1.049327797548438, "grad_norm": 1.5546875, "learning_rate": 0.0004898453611584564, "loss": 5.4113, "mean_token_accuracy": 0.17546495646238328, "num_tokens": 24311238.0, "step": 10615 }, { "entropy": 5.6730499267578125, "epoch": 1.0498220640569396, "grad_norm": 1.640625, "learning_rate": 0.0004898348763465226, "loss": 5.3961, "mean_token_accuracy": 0.17771839201450348, "num_tokens": 24322417.0, "step": 10620 }, { "entropy": 5.665038681030273, "epoch": 1.0503163305654408, "grad_norm": 1.6875, "learning_rate": 0.0004898243862496173, "loss": 5.3801, "mean_token_accuracy": 0.182219797372818, "num_tokens": 24332751.0, "step": 10625 }, { "entropy": 5.717585182189941, "epoch": 1.0508105970739423, "grad_norm": 1.84375, "learning_rate": 0.0004898138908679989, "loss": 5.5427, "mean_token_accuracy": 0.1624419942498207, "num_tokens": 24345082.0, "step": 10630 }, { "entropy": 5.710233116149903, "epoch": 1.0513048635824436, "grad_norm": 1.453125, "learning_rate": 0.0004898033902019255, "loss": 5.4797, "mean_token_accuracy": 0.1731332704424858, "num_tokens": 24355863.0, "step": 10635 }, { "entropy": 5.840935707092285, "epoch": 1.051799130090945, "grad_norm": 1.828125, "learning_rate": 0.0004897928842516553, "loss": 5.5313, "mean_token_accuracy": 0.16327820122241973, "num_tokens": 24367763.0, "step": 10640 }, { "entropy": 5.68679575920105, "epoch": 1.0522933965994463, "grad_norm": 1.8671875, "learning_rate": 0.0004897823730174468, "loss": 5.4751, "mean_token_accuracy": 0.16723699867725372, "num_tokens": 24378943.0, "step": 10645 }, { "entropy": 5.6792675971984865, "epoch": 1.0527876631079478, "grad_norm": 2.296875, "learning_rate": 0.0004897718564995587, "loss": 5.4444, "mean_token_accuracy": 0.1703573137521744, "num_tokens": 24389508.0, "step": 10650 }, { "entropy": 5.681413888931274, "epoch": 1.0532819296164493, "grad_norm": 2.09375, "learning_rate": 0.0004897613346982495, "loss": 5.358, "mean_token_accuracy": 0.17905720472335815, "num_tokens": 24400710.0, "step": 10655 }, { "entropy": 5.6566481590271, "epoch": 1.0537761961249505, "grad_norm": 1.46875, "learning_rate": 0.0004897508076137783, "loss": 5.4602, "mean_token_accuracy": 0.17372193336486816, "num_tokens": 24412854.0, "step": 10660 }, { "entropy": 5.7195087432861325, "epoch": 1.054270462633452, "grad_norm": 1.8671875, "learning_rate": 0.0004897402752464037, "loss": 5.4846, "mean_token_accuracy": 0.17400692403316498, "num_tokens": 24423212.0, "step": 10665 }, { "entropy": 5.694505739212036, "epoch": 1.0547647291419533, "grad_norm": 2.171875, "learning_rate": 0.0004897297375963852, "loss": 5.4786, "mean_token_accuracy": 0.17213946282863618, "num_tokens": 24436091.0, "step": 10670 }, { "entropy": 5.61199369430542, "epoch": 1.0552589956504548, "grad_norm": 1.6875, "learning_rate": 0.0004897191946639819, "loss": 5.3749, "mean_token_accuracy": 0.17962474077939988, "num_tokens": 24448499.0, "step": 10675 }, { "entropy": 5.767547607421875, "epoch": 1.055753262158956, "grad_norm": 2.296875, "learning_rate": 0.0004897086464494529, "loss": 5.5765, "mean_token_accuracy": 0.16218212693929673, "num_tokens": 24460732.0, "step": 10680 }, { "entropy": 5.746901226043701, "epoch": 1.0562475286674575, "grad_norm": 1.5078125, "learning_rate": 0.0004896980929530579, "loss": 5.4556, "mean_token_accuracy": 0.1791859969496727, "num_tokens": 24472460.0, "step": 10685 }, { "entropy": 5.6408806324005125, "epoch": 1.0567417951759588, "grad_norm": 1.546875, "learning_rate": 0.0004896875341750567, "loss": 5.4363, "mean_token_accuracy": 0.17761030346155166, "num_tokens": 24483820.0, "step": 10690 }, { "entropy": 5.626603603363037, "epoch": 1.0572360616844603, "grad_norm": 1.578125, "learning_rate": 0.0004896769701157087, "loss": 5.3462, "mean_token_accuracy": 0.18297673314809798, "num_tokens": 24495775.0, "step": 10695 }, { "entropy": 5.670195913314819, "epoch": 1.0577303281929615, "grad_norm": 1.671875, "learning_rate": 0.000489666400775274, "loss": 5.3809, "mean_token_accuracy": 0.18010785877704621, "num_tokens": 24505589.0, "step": 10700 }, { "entropy": 5.646228551864624, "epoch": 1.058224594701463, "grad_norm": 1.59375, "learning_rate": 0.0004896558261540125, "loss": 5.4354, "mean_token_accuracy": 0.17763150334358216, "num_tokens": 24515988.0, "step": 10705 }, { "entropy": 5.576885223388672, "epoch": 1.0587188612099645, "grad_norm": 1.78125, "learning_rate": 0.0004896452462521844, "loss": 5.4076, "mean_token_accuracy": 0.1800934761762619, "num_tokens": 24528273.0, "step": 10710 }, { "entropy": 5.745494604110718, "epoch": 1.0592131277184658, "grad_norm": 1.8515625, "learning_rate": 0.0004896346610700498, "loss": 5.4449, "mean_token_accuracy": 0.1785084530711174, "num_tokens": 24539014.0, "step": 10715 }, { "entropy": 5.642323732376099, "epoch": 1.0597073942269672, "grad_norm": 1.6015625, "learning_rate": 0.0004896240706078694, "loss": 5.4184, "mean_token_accuracy": 0.17620733231306077, "num_tokens": 24550210.0, "step": 10720 }, { "entropy": 5.64607834815979, "epoch": 1.0602016607354685, "grad_norm": 2.640625, "learning_rate": 0.0004896134748659036, "loss": 5.376, "mean_token_accuracy": 0.17596860975027084, "num_tokens": 24560934.0, "step": 10725 }, { "entropy": 5.6721272468566895, "epoch": 1.06069592724397, "grad_norm": 2.03125, "learning_rate": 0.000489602873844413, "loss": 5.4692, "mean_token_accuracy": 0.16910083293914796, "num_tokens": 24572274.0, "step": 10730 }, { "entropy": 5.738881397247314, "epoch": 1.0611901937524713, "grad_norm": 2.140625, "learning_rate": 0.0004895922675436583, "loss": 5.4737, "mean_token_accuracy": 0.17420842200517656, "num_tokens": 24583950.0, "step": 10735 }, { "entropy": 5.706207895278931, "epoch": 1.0616844602609727, "grad_norm": 1.5703125, "learning_rate": 0.0004895816559639006, "loss": 5.4099, "mean_token_accuracy": 0.1797514706850052, "num_tokens": 24597058.0, "step": 10740 }, { "entropy": 5.60955810546875, "epoch": 1.062178726769474, "grad_norm": 1.6328125, "learning_rate": 0.0004895710391054008, "loss": 5.2857, "mean_token_accuracy": 0.18629123270511627, "num_tokens": 24608604.0, "step": 10745 }, { "entropy": 5.703134679794312, "epoch": 1.0626729932779755, "grad_norm": 2.40625, "learning_rate": 0.0004895604169684203, "loss": 5.5008, "mean_token_accuracy": 0.17173027396202087, "num_tokens": 24619707.0, "step": 10750 }, { "entropy": 5.729007291793823, "epoch": 1.063167259786477, "grad_norm": 1.6953125, "learning_rate": 0.0004895497895532202, "loss": 5.4317, "mean_token_accuracy": 0.1732850044965744, "num_tokens": 24629579.0, "step": 10755 }, { "entropy": 5.62091293334961, "epoch": 1.0636615262949782, "grad_norm": 1.8359375, "learning_rate": 0.0004895391568600619, "loss": 5.4496, "mean_token_accuracy": 0.1655258521437645, "num_tokens": 24641358.0, "step": 10760 }, { "entropy": 5.623490047454834, "epoch": 1.0641557928034797, "grad_norm": 2.21875, "learning_rate": 0.0004895285188892071, "loss": 5.4152, "mean_token_accuracy": 0.17440328747034073, "num_tokens": 24652293.0, "step": 10765 }, { "entropy": 5.7239823818206785, "epoch": 1.064650059311981, "grad_norm": 1.765625, "learning_rate": 0.0004895178756409175, "loss": 5.5595, "mean_token_accuracy": 0.17060342133045198, "num_tokens": 24663370.0, "step": 10770 }, { "entropy": 5.7556455612182615, "epoch": 1.0651443258204825, "grad_norm": 1.890625, "learning_rate": 0.0004895072271154548, "loss": 5.5119, "mean_token_accuracy": 0.17038141191005707, "num_tokens": 24675037.0, "step": 10775 }, { "entropy": 5.7060566425323485, "epoch": 1.0656385923289837, "grad_norm": 1.5234375, "learning_rate": 0.0004894965733130812, "loss": 5.4312, "mean_token_accuracy": 0.17229524701833726, "num_tokens": 24685680.0, "step": 10780 }, { "entropy": 5.623900699615478, "epoch": 1.0661328588374852, "grad_norm": 1.5078125, "learning_rate": 0.0004894859142340585, "loss": 5.3981, "mean_token_accuracy": 0.1753751665353775, "num_tokens": 24697831.0, "step": 10785 }, { "entropy": 5.686001968383789, "epoch": 1.0666271253459865, "grad_norm": 1.4609375, "learning_rate": 0.0004894752498786491, "loss": 5.4301, "mean_token_accuracy": 0.17435342669487, "num_tokens": 24710226.0, "step": 10790 }, { "entropy": 5.684980154037476, "epoch": 1.067121391854488, "grad_norm": 1.859375, "learning_rate": 0.0004894645802471152, "loss": 5.4577, "mean_token_accuracy": 0.1775508314371109, "num_tokens": 24721743.0, "step": 10795 }, { "entropy": 5.685684299468994, "epoch": 1.0676156583629894, "grad_norm": 1.6171875, "learning_rate": 0.0004894539053397194, "loss": 5.4477, "mean_token_accuracy": 0.16322674304246904, "num_tokens": 24733804.0, "step": 10800 }, { "entropy": 5.712589454650879, "epoch": 1.0681099248714907, "grad_norm": 1.4375, "learning_rate": 0.0004894432251567242, "loss": 5.3965, "mean_token_accuracy": 0.1844434380531311, "num_tokens": 24745285.0, "step": 10805 }, { "entropy": 5.678305912017822, "epoch": 1.0686041913799922, "grad_norm": 1.8125, "learning_rate": 0.0004894325396983925, "loss": 5.4555, "mean_token_accuracy": 0.1691162258386612, "num_tokens": 24756069.0, "step": 10810 }, { "entropy": 5.610199117660523, "epoch": 1.0690984578884934, "grad_norm": 1.53125, "learning_rate": 0.0004894218489649869, "loss": 5.3803, "mean_token_accuracy": 0.17897149920463562, "num_tokens": 24766935.0, "step": 10815 }, { "entropy": 5.7185900688171385, "epoch": 1.069592724396995, "grad_norm": 1.5625, "learning_rate": 0.0004894111529567707, "loss": 5.4289, "mean_token_accuracy": 0.17824586480855942, "num_tokens": 24777642.0, "step": 10820 }, { "entropy": 5.651887607574463, "epoch": 1.0700869909054962, "grad_norm": 1.6015625, "learning_rate": 0.0004894004516740069, "loss": 5.377, "mean_token_accuracy": 0.1777845025062561, "num_tokens": 24788110.0, "step": 10825 }, { "entropy": 5.710649204254151, "epoch": 1.0705812574139977, "grad_norm": 1.5625, "learning_rate": 0.0004893897451169586, "loss": 5.5152, "mean_token_accuracy": 0.16544357389211656, "num_tokens": 24799976.0, "step": 10830 }, { "entropy": 5.757799196243286, "epoch": 1.071075523922499, "grad_norm": 1.4375, "learning_rate": 0.0004893790332858893, "loss": 5.4607, "mean_token_accuracy": 0.17245256751775742, "num_tokens": 24811131.0, "step": 10835 }, { "entropy": 5.70740327835083, "epoch": 1.0715697904310004, "grad_norm": 1.4921875, "learning_rate": 0.0004893683161810626, "loss": 5.4196, "mean_token_accuracy": 0.17343536615371705, "num_tokens": 24822137.0, "step": 10840 }, { "entropy": 5.5790143489837645, "epoch": 1.0720640569395017, "grad_norm": 1.609375, "learning_rate": 0.0004893575938027421, "loss": 5.4147, "mean_token_accuracy": 0.17936326563358307, "num_tokens": 24832369.0, "step": 10845 }, { "entropy": 5.697907638549805, "epoch": 1.0725583234480032, "grad_norm": 1.6875, "learning_rate": 0.0004893468661511914, "loss": 5.474, "mean_token_accuracy": 0.1761583521962166, "num_tokens": 24843351.0, "step": 10850 }, { "entropy": 5.8073609352111815, "epoch": 1.0730525899565047, "grad_norm": 1.5546875, "learning_rate": 0.0004893361332266746, "loss": 5.5499, "mean_token_accuracy": 0.16175124049186707, "num_tokens": 24855019.0, "step": 10855 }, { "entropy": 5.697947549819946, "epoch": 1.073546856465006, "grad_norm": 1.5703125, "learning_rate": 0.0004893253950294557, "loss": 5.4525, "mean_token_accuracy": 0.174090975522995, "num_tokens": 24866224.0, "step": 10860 }, { "entropy": 5.64131121635437, "epoch": 1.0740411229735074, "grad_norm": 1.6484375, "learning_rate": 0.0004893146515597989, "loss": 5.3759, "mean_token_accuracy": 0.1829046055674553, "num_tokens": 24876995.0, "step": 10865 }, { "entropy": 5.67849440574646, "epoch": 1.0745353894820087, "grad_norm": 1.5546875, "learning_rate": 0.0004893039028179683, "loss": 5.4737, "mean_token_accuracy": 0.17300374507904054, "num_tokens": 24887846.0, "step": 10870 }, { "entropy": 5.741180038452148, "epoch": 1.0750296559905101, "grad_norm": 1.4921875, "learning_rate": 0.0004892931488042285, "loss": 5.5989, "mean_token_accuracy": 0.16268961429595946, "num_tokens": 24899221.0, "step": 10875 }, { "entropy": 5.758380556106568, "epoch": 1.0755239224990114, "grad_norm": 1.6484375, "learning_rate": 0.000489282389518844, "loss": 5.5469, "mean_token_accuracy": 0.1690807208418846, "num_tokens": 24912103.0, "step": 10880 }, { "entropy": 5.792465305328369, "epoch": 1.076018189007513, "grad_norm": 1.578125, "learning_rate": 0.0004892716249620795, "loss": 5.5274, "mean_token_accuracy": 0.16700552254915238, "num_tokens": 24925465.0, "step": 10885 }, { "entropy": 5.712474822998047, "epoch": 1.0765124555160142, "grad_norm": 1.7734375, "learning_rate": 0.0004892608551341997, "loss": 5.3236, "mean_token_accuracy": 0.17507287859916687, "num_tokens": 24935136.0, "step": 10890 }, { "entropy": 5.653912019729614, "epoch": 1.0770067220245156, "grad_norm": 1.578125, "learning_rate": 0.0004892500800354697, "loss": 5.4631, "mean_token_accuracy": 0.16899198442697524, "num_tokens": 24946845.0, "step": 10895 }, { "entropy": 5.616721534729004, "epoch": 1.077500988533017, "grad_norm": 1.484375, "learning_rate": 0.0004892392996661544, "loss": 5.3935, "mean_token_accuracy": 0.17076674848794937, "num_tokens": 24958337.0, "step": 10900 }, { "entropy": 5.721500301361084, "epoch": 1.0779952550415184, "grad_norm": 1.7421875, "learning_rate": 0.0004892285140265192, "loss": 5.5059, "mean_token_accuracy": 0.16908132582902907, "num_tokens": 24969505.0, "step": 10905 }, { "entropy": 5.653558921813965, "epoch": 1.0784895215500199, "grad_norm": 1.6171875, "learning_rate": 0.0004892177231168292, "loss": 5.4578, "mean_token_accuracy": 0.17113558501005172, "num_tokens": 24981577.0, "step": 10910 }, { "entropy": 5.753542566299439, "epoch": 1.0789837880585211, "grad_norm": 1.296875, "learning_rate": 0.0004892069269373502, "loss": 5.509, "mean_token_accuracy": 0.17284602224826812, "num_tokens": 24992758.0, "step": 10915 }, { "entropy": 5.739348220825195, "epoch": 1.0794780545670226, "grad_norm": 1.515625, "learning_rate": 0.0004891961254883474, "loss": 5.4784, "mean_token_accuracy": 0.17648012042045594, "num_tokens": 25003057.0, "step": 10920 }, { "entropy": 5.653453207015991, "epoch": 1.0799723210755239, "grad_norm": 1.3984375, "learning_rate": 0.0004891853187700867, "loss": 5.4636, "mean_token_accuracy": 0.17451973110437394, "num_tokens": 25014900.0, "step": 10925 }, { "entropy": 5.64291934967041, "epoch": 1.0804665875840254, "grad_norm": 1.703125, "learning_rate": 0.0004891745067828339, "loss": 5.3834, "mean_token_accuracy": 0.18131772428750992, "num_tokens": 25026313.0, "step": 10930 }, { "entropy": 5.708517026901245, "epoch": 1.0809608540925266, "grad_norm": 1.5078125, "learning_rate": 0.0004891636895268551, "loss": 5.4679, "mean_token_accuracy": 0.17502452582120895, "num_tokens": 25037014.0, "step": 10935 }, { "entropy": 5.752079343795776, "epoch": 1.081455120601028, "grad_norm": 1.421875, "learning_rate": 0.0004891528670024162, "loss": 5.5584, "mean_token_accuracy": 0.17423778027296066, "num_tokens": 25048051.0, "step": 10940 }, { "entropy": 5.632770633697509, "epoch": 1.0819493871095294, "grad_norm": 1.484375, "learning_rate": 0.0004891420392097837, "loss": 5.3781, "mean_token_accuracy": 0.18239771574735641, "num_tokens": 25057825.0, "step": 10945 }, { "entropy": 5.616934061050415, "epoch": 1.0824436536180309, "grad_norm": 1.7578125, "learning_rate": 0.0004891312061492236, "loss": 5.4173, "mean_token_accuracy": 0.17249033600091934, "num_tokens": 25067702.0, "step": 10950 }, { "entropy": 5.694773626327515, "epoch": 1.0829379201265321, "grad_norm": 1.6328125, "learning_rate": 0.0004891203678210027, "loss": 5.403, "mean_token_accuracy": 0.1786690905690193, "num_tokens": 25078246.0, "step": 10955 }, { "entropy": 5.680955410003662, "epoch": 1.0834321866350336, "grad_norm": 1.609375, "learning_rate": 0.0004891095242253876, "loss": 5.4173, "mean_token_accuracy": 0.17662651240825653, "num_tokens": 25089267.0, "step": 10960 }, { "entropy": 5.7063781261444095, "epoch": 1.083926453143535, "grad_norm": 1.6328125, "learning_rate": 0.0004890986753626449, "loss": 5.509, "mean_token_accuracy": 0.16996352672576903, "num_tokens": 25101392.0, "step": 10965 }, { "entropy": 5.698831224441529, "epoch": 1.0844207196520363, "grad_norm": 2.03125, "learning_rate": 0.0004890878212330418, "loss": 5.5032, "mean_token_accuracy": 0.17343595176935195, "num_tokens": 25113309.0, "step": 10970 }, { "entropy": 5.668400239944458, "epoch": 1.0849149861605378, "grad_norm": 1.5, "learning_rate": 0.0004890769618368448, "loss": 5.3325, "mean_token_accuracy": 0.1874750480055809, "num_tokens": 25124803.0, "step": 10975 }, { "entropy": 5.680614185333252, "epoch": 1.085409252669039, "grad_norm": 5.25, "learning_rate": 0.0004890660971743215, "loss": 5.4266, "mean_token_accuracy": 0.1783684939146042, "num_tokens": 25136443.0, "step": 10980 }, { "entropy": 5.707544231414795, "epoch": 1.0859035191775406, "grad_norm": 1.3984375, "learning_rate": 0.0004890552272457389, "loss": 5.4362, "mean_token_accuracy": 0.1714188352227211, "num_tokens": 25147128.0, "step": 10985 }, { "entropy": 5.620350742340088, "epoch": 1.0863977856860418, "grad_norm": 1.453125, "learning_rate": 0.0004890443520513645, "loss": 5.4871, "mean_token_accuracy": 0.17620726972818374, "num_tokens": 25159420.0, "step": 10990 }, { "entropy": 5.637927675247193, "epoch": 1.0868920521945433, "grad_norm": 1.546875, "learning_rate": 0.0004890334715914659, "loss": 5.4119, "mean_token_accuracy": 0.17815214842557908, "num_tokens": 25171624.0, "step": 10995 }, { "entropy": 5.660104274749756, "epoch": 1.0873863187030446, "grad_norm": 1.734375, "learning_rate": 0.0004890225858663106, "loss": 5.3573, "mean_token_accuracy": 0.18545863330364226, "num_tokens": 25181610.0, "step": 11000 }, { "entropy": 5.703441953659057, "epoch": 1.087880585211546, "grad_norm": 1.4765625, "learning_rate": 0.0004890116948761666, "loss": 5.3451, "mean_token_accuracy": 0.17712744921445847, "num_tokens": 25191852.0, "step": 11005 }, { "entropy": 5.696305465698242, "epoch": 1.0883748517200476, "grad_norm": 1.421875, "learning_rate": 0.0004890007986213018, "loss": 5.5346, "mean_token_accuracy": 0.166000697016716, "num_tokens": 25204240.0, "step": 11010 }, { "entropy": 5.556787633895874, "epoch": 1.0888691182285488, "grad_norm": 1.6953125, "learning_rate": 0.0004889898971019838, "loss": 5.3813, "mean_token_accuracy": 0.1833414316177368, "num_tokens": 25215512.0, "step": 11015 }, { "entropy": 5.690842151641846, "epoch": 1.0893633847370503, "grad_norm": 1.390625, "learning_rate": 0.0004889789903184815, "loss": 5.4802, "mean_token_accuracy": 0.16919929832220076, "num_tokens": 25227903.0, "step": 11020 }, { "entropy": 5.730541086196899, "epoch": 1.0898576512455516, "grad_norm": 1.4765625, "learning_rate": 0.0004889680782710626, "loss": 5.4147, "mean_token_accuracy": 0.17766868472099304, "num_tokens": 25240204.0, "step": 11025 }, { "entropy": 5.620070505142212, "epoch": 1.090351917754053, "grad_norm": 1.40625, "learning_rate": 0.0004889571609599958, "loss": 5.3853, "mean_token_accuracy": 0.17708191126585007, "num_tokens": 25251978.0, "step": 11030 }, { "entropy": 5.670386457443238, "epoch": 1.0908461842625543, "grad_norm": 1.5703125, "learning_rate": 0.0004889462383855498, "loss": 5.4195, "mean_token_accuracy": 0.1792678251862526, "num_tokens": 25262496.0, "step": 11035 }, { "entropy": 5.691803979873657, "epoch": 1.0913404507710558, "grad_norm": 1.5859375, "learning_rate": 0.000488935310547993, "loss": 5.4608, "mean_token_accuracy": 0.17530543655157088, "num_tokens": 25272814.0, "step": 11040 }, { "entropy": 5.724419021606446, "epoch": 1.091834717279557, "grad_norm": 1.8359375, "learning_rate": 0.0004889243774475945, "loss": 5.3906, "mean_token_accuracy": 0.17630032896995546, "num_tokens": 25283749.0, "step": 11045 }, { "entropy": 5.640465211868286, "epoch": 1.0923289837880585, "grad_norm": 1.8125, "learning_rate": 0.000488913439084623, "loss": 5.4399, "mean_token_accuracy": 0.17799849957227706, "num_tokens": 25295993.0, "step": 11050 }, { "entropy": 5.632370233535767, "epoch": 1.09282325029656, "grad_norm": 1.6015625, "learning_rate": 0.0004889024954593477, "loss": 5.474, "mean_token_accuracy": 0.17380830645561218, "num_tokens": 25309011.0, "step": 11055 }, { "entropy": 5.681922769546508, "epoch": 1.0933175168050613, "grad_norm": 1.25, "learning_rate": 0.000488891546572038, "loss": 5.4085, "mean_token_accuracy": 0.17508513629436492, "num_tokens": 25320901.0, "step": 11060 }, { "entropy": 5.699883890151978, "epoch": 1.0938117833135628, "grad_norm": 1.9765625, "learning_rate": 0.000488880592422963, "loss": 5.389, "mean_token_accuracy": 0.1825525000691414, "num_tokens": 25333042.0, "step": 11065 }, { "entropy": 5.62830171585083, "epoch": 1.094306049822064, "grad_norm": 1.4140625, "learning_rate": 0.0004888696330123921, "loss": 5.4603, "mean_token_accuracy": 0.17420888245105742, "num_tokens": 25346413.0, "step": 11070 }, { "entropy": 5.667964601516724, "epoch": 1.0948003163305655, "grad_norm": 1.5625, "learning_rate": 0.0004888586683405952, "loss": 5.4759, "mean_token_accuracy": 0.1709025666117668, "num_tokens": 25358104.0, "step": 11075 }, { "entropy": 5.679701471328736, "epoch": 1.0952945828390668, "grad_norm": 1.6796875, "learning_rate": 0.0004888476984078419, "loss": 5.4473, "mean_token_accuracy": 0.17665988206863403, "num_tokens": 25369485.0, "step": 11080 }, { "entropy": 5.7206920146942135, "epoch": 1.0957888493475683, "grad_norm": 1.3828125, "learning_rate": 0.000488836723214402, "loss": 5.5008, "mean_token_accuracy": 0.17268404215574265, "num_tokens": 25380349.0, "step": 11085 }, { "entropy": 5.721868324279785, "epoch": 1.0962831158560695, "grad_norm": 1.734375, "learning_rate": 0.0004888257427605456, "loss": 5.5257, "mean_token_accuracy": 0.1666341729462147, "num_tokens": 25393042.0, "step": 11090 }, { "entropy": 5.761946821212769, "epoch": 1.096777382364571, "grad_norm": 1.6953125, "learning_rate": 0.0004888147570465426, "loss": 5.524, "mean_token_accuracy": 0.17503573894500732, "num_tokens": 25404470.0, "step": 11095 }, { "entropy": 5.627283143997192, "epoch": 1.0972716488730723, "grad_norm": 1.5625, "learning_rate": 0.0004888037660726635, "loss": 5.3685, "mean_token_accuracy": 0.18558280915021896, "num_tokens": 25415397.0, "step": 11100 }, { "entropy": 5.679556846618652, "epoch": 1.0977659153815738, "grad_norm": 1.3828125, "learning_rate": 0.0004887927698391786, "loss": 5.5463, "mean_token_accuracy": 0.1637173056602478, "num_tokens": 25427409.0, "step": 11105 }, { "entropy": 5.718594217300415, "epoch": 1.0982601818900752, "grad_norm": 1.671875, "learning_rate": 0.0004887817683463583, "loss": 5.399, "mean_token_accuracy": 0.17618545591831208, "num_tokens": 25438063.0, "step": 11110 }, { "entropy": 5.614250230789184, "epoch": 1.0987544483985765, "grad_norm": 1.4453125, "learning_rate": 0.0004887707615944734, "loss": 5.3631, "mean_token_accuracy": 0.1788792833685875, "num_tokens": 25449242.0, "step": 11115 }, { "entropy": 5.693329954147339, "epoch": 1.099248714907078, "grad_norm": 1.4921875, "learning_rate": 0.0004887597495837946, "loss": 5.486, "mean_token_accuracy": 0.17618035823106765, "num_tokens": 25461434.0, "step": 11120 }, { "entropy": 5.659618759155274, "epoch": 1.0997429814155792, "grad_norm": 1.59375, "learning_rate": 0.0004887487323145929, "loss": 5.4355, "mean_token_accuracy": 0.17905406504869462, "num_tokens": 25472035.0, "step": 11125 }, { "entropy": 5.656661128997802, "epoch": 1.1002372479240807, "grad_norm": 1.4453125, "learning_rate": 0.000488737709787139, "loss": 5.4626, "mean_token_accuracy": 0.17480503022670746, "num_tokens": 25483143.0, "step": 11130 }, { "entropy": 5.6812938213348385, "epoch": 1.100731514432582, "grad_norm": 1.609375, "learning_rate": 0.0004887266820017044, "loss": 5.6167, "mean_token_accuracy": 0.16335411220788956, "num_tokens": 25496873.0, "step": 11135 }, { "entropy": 5.689480924606324, "epoch": 1.1012257809410835, "grad_norm": 1.3671875, "learning_rate": 0.0004887156489585603, "loss": 5.4049, "mean_token_accuracy": 0.17622639536857604, "num_tokens": 25508661.0, "step": 11140 }, { "entropy": 5.794542360305786, "epoch": 1.1017200474495847, "grad_norm": 1.296875, "learning_rate": 0.000488704610657978, "loss": 5.5578, "mean_token_accuracy": 0.16312139481306076, "num_tokens": 25520789.0, "step": 11145 }, { "entropy": 5.568453454971314, "epoch": 1.1022143139580862, "grad_norm": 1.53125, "learning_rate": 0.0004886935671002293, "loss": 5.4133, "mean_token_accuracy": 0.17906275987625123, "num_tokens": 25531131.0, "step": 11150 }, { "entropy": 5.756692600250244, "epoch": 1.1027085804665875, "grad_norm": 1.28125, "learning_rate": 0.0004886825182855855, "loss": 5.4954, "mean_token_accuracy": 0.16403940469026565, "num_tokens": 25543803.0, "step": 11155 }, { "entropy": 5.766486978530883, "epoch": 1.103202846975089, "grad_norm": 1.3515625, "learning_rate": 0.0004886714642143188, "loss": 5.4045, "mean_token_accuracy": 0.18338447213172912, "num_tokens": 25553588.0, "step": 11160 }, { "entropy": 5.64628849029541, "epoch": 1.1036971134835905, "grad_norm": 1.4609375, "learning_rate": 0.0004886604048867007, "loss": 5.4601, "mean_token_accuracy": 0.17688646167516708, "num_tokens": 25566175.0, "step": 11165 }, { "entropy": 5.737870454788208, "epoch": 1.1041913799920917, "grad_norm": 1.921875, "learning_rate": 0.0004886493403030035, "loss": 5.5392, "mean_token_accuracy": 0.1695457637310028, "num_tokens": 25578033.0, "step": 11170 }, { "entropy": 5.698987054824829, "epoch": 1.1046856465005932, "grad_norm": 1.578125, "learning_rate": 0.0004886382704634996, "loss": 5.4029, "mean_token_accuracy": 0.1759108915925026, "num_tokens": 25588759.0, "step": 11175 }, { "entropy": 5.61225323677063, "epoch": 1.1051799130090945, "grad_norm": 1.5703125, "learning_rate": 0.0004886271953684609, "loss": 5.315, "mean_token_accuracy": 0.1810745894908905, "num_tokens": 25599200.0, "step": 11180 }, { "entropy": 5.617602348327637, "epoch": 1.105674179517596, "grad_norm": 2.03125, "learning_rate": 0.0004886161150181602, "loss": 5.4146, "mean_token_accuracy": 0.17927956581115723, "num_tokens": 25610279.0, "step": 11185 }, { "entropy": 5.6308276653289795, "epoch": 1.1061684460260972, "grad_norm": 1.6484375, "learning_rate": 0.0004886050294128698, "loss": 5.3885, "mean_token_accuracy": 0.1758725807070732, "num_tokens": 25622062.0, "step": 11190 }, { "entropy": 5.702178955078125, "epoch": 1.1066627125345987, "grad_norm": 1.8984375, "learning_rate": 0.0004885939385528628, "loss": 5.4409, "mean_token_accuracy": 0.17086283713579178, "num_tokens": 25633451.0, "step": 11195 }, { "entropy": 5.633413314819336, "epoch": 1.1071569790431, "grad_norm": 2.078125, "learning_rate": 0.0004885828424384114, "loss": 5.3822, "mean_token_accuracy": 0.1800318941473961, "num_tokens": 25644537.0, "step": 11200 }, { "entropy": 5.624868011474609, "epoch": 1.1076512455516014, "grad_norm": 1.625, "learning_rate": 0.0004885717410697892, "loss": 5.418, "mean_token_accuracy": 0.1765780344605446, "num_tokens": 25655570.0, "step": 11205 }, { "entropy": 5.767362356185913, "epoch": 1.1081455120601027, "grad_norm": 1.546875, "learning_rate": 0.000488560634447269, "loss": 5.5663, "mean_token_accuracy": 0.16615985780954362, "num_tokens": 25669470.0, "step": 11210 }, { "entropy": 5.728941822052002, "epoch": 1.1086397785686042, "grad_norm": 1.3515625, "learning_rate": 0.000488549522571124, "loss": 5.4746, "mean_token_accuracy": 0.17191808223724364, "num_tokens": 25682347.0, "step": 11215 }, { "entropy": 5.7414826393127445, "epoch": 1.1091340450771057, "grad_norm": 1.5859375, "learning_rate": 0.0004885384054416276, "loss": 5.541, "mean_token_accuracy": 0.16353462636470795, "num_tokens": 25694038.0, "step": 11220 }, { "entropy": 5.668048620223999, "epoch": 1.109628311585607, "grad_norm": 1.5390625, "learning_rate": 0.0004885272830590534, "loss": 5.3421, "mean_token_accuracy": 0.17849619090557098, "num_tokens": 25705850.0, "step": 11225 }, { "entropy": 5.656874418258667, "epoch": 1.1101225780941084, "grad_norm": 1.4140625, "learning_rate": 0.0004885161554236748, "loss": 5.4117, "mean_token_accuracy": 0.17788560837507247, "num_tokens": 25716294.0, "step": 11230 }, { "entropy": 5.583490800857544, "epoch": 1.1106168446026097, "grad_norm": 1.46875, "learning_rate": 0.0004885050225357657, "loss": 5.4142, "mean_token_accuracy": 0.18146836310625075, "num_tokens": 25727367.0, "step": 11235 }, { "entropy": 5.737776374816894, "epoch": 1.1111111111111112, "grad_norm": 1.65625, "learning_rate": 0.0004884938843955999, "loss": 5.5347, "mean_token_accuracy": 0.16589053124189376, "num_tokens": 25738352.0, "step": 11240 }, { "entropy": 5.663060474395752, "epoch": 1.1116053776196124, "grad_norm": 1.4375, "learning_rate": 0.0004884827410034515, "loss": 5.3529, "mean_token_accuracy": 0.18134012520313264, "num_tokens": 25749940.0, "step": 11245 }, { "entropy": 5.630949878692627, "epoch": 1.112099644128114, "grad_norm": 1.5546875, "learning_rate": 0.0004884715923595945, "loss": 5.4435, "mean_token_accuracy": 0.16812354773283006, "num_tokens": 25761251.0, "step": 11250 }, { "entropy": 5.664326858520508, "epoch": 1.1125939106366152, "grad_norm": 1.59375, "learning_rate": 0.0004884604384643032, "loss": 5.4801, "mean_token_accuracy": 0.17426120340824128, "num_tokens": 25772382.0, "step": 11255 }, { "entropy": 5.637487506866455, "epoch": 1.1130881771451167, "grad_norm": 1.4765625, "learning_rate": 0.000488449279317852, "loss": 5.4089, "mean_token_accuracy": 0.17870349436998367, "num_tokens": 25784960.0, "step": 11260 }, { "entropy": 5.694792127609253, "epoch": 1.113582443653618, "grad_norm": 1.6875, "learning_rate": 0.0004884381149205154, "loss": 5.3988, "mean_token_accuracy": 0.17258140295743943, "num_tokens": 25796644.0, "step": 11265 }, { "entropy": 5.656617069244385, "epoch": 1.1140767101621194, "grad_norm": 1.375, "learning_rate": 0.0004884269452725681, "loss": 5.4953, "mean_token_accuracy": 0.17754077017307282, "num_tokens": 25807712.0, "step": 11270 }, { "entropy": 5.650223445892334, "epoch": 1.1145709766706209, "grad_norm": 1.78125, "learning_rate": 0.0004884157703742848, "loss": 5.3863, "mean_token_accuracy": 0.17846150696277618, "num_tokens": 25817944.0, "step": 11275 }, { "entropy": 5.60605902671814, "epoch": 1.1150652431791221, "grad_norm": 1.546875, "learning_rate": 0.0004884045902259405, "loss": 5.4157, "mean_token_accuracy": 0.17873818725347518, "num_tokens": 25830801.0, "step": 11280 }, { "entropy": 5.6828076362609865, "epoch": 1.1155595096876236, "grad_norm": 1.7578125, "learning_rate": 0.0004883934048278102, "loss": 5.4188, "mean_token_accuracy": 0.17201802283525466, "num_tokens": 25843877.0, "step": 11285 }, { "entropy": 5.667689371109009, "epoch": 1.116053776196125, "grad_norm": 1.6171875, "learning_rate": 0.0004883822141801689, "loss": 5.3798, "mean_token_accuracy": 0.1794407308101654, "num_tokens": 25853763.0, "step": 11290 }, { "entropy": 5.689780902862549, "epoch": 1.1165480427046264, "grad_norm": 1.671875, "learning_rate": 0.0004883710182832921, "loss": 5.5016, "mean_token_accuracy": 0.16742501109838487, "num_tokens": 25864759.0, "step": 11295 }, { "entropy": 5.770525407791138, "epoch": 1.1170423092131276, "grad_norm": 1.75, "learning_rate": 0.0004883598171374552, "loss": 5.5681, "mean_token_accuracy": 0.16486529558897017, "num_tokens": 25877325.0, "step": 11300 }, { "entropy": 5.675923871994018, "epoch": 1.1175365757216291, "grad_norm": 1.578125, "learning_rate": 0.0004883486107429337, "loss": 5.4036, "mean_token_accuracy": 0.17564295828342438, "num_tokens": 25889308.0, "step": 11305 }, { "entropy": 5.591322946548462, "epoch": 1.1180308422301304, "grad_norm": 1.7265625, "learning_rate": 0.0004883373991000031, "loss": 5.4685, "mean_token_accuracy": 0.17322899848222734, "num_tokens": 25901721.0, "step": 11310 }, { "entropy": 5.6956439971923825, "epoch": 1.1185251087386319, "grad_norm": 1.6953125, "learning_rate": 0.0004883261822089395, "loss": 5.4546, "mean_token_accuracy": 0.17071697115898132, "num_tokens": 25912399.0, "step": 11315 }, { "entropy": 5.630310440063477, "epoch": 1.1190193752471334, "grad_norm": 1.4765625, "learning_rate": 0.0004883149600700188, "loss": 5.3662, "mean_token_accuracy": 0.1815431609749794, "num_tokens": 25923560.0, "step": 11320 }, { "entropy": 5.673865890502929, "epoch": 1.1195136417556346, "grad_norm": 1.5703125, "learning_rate": 0.0004883037326835169, "loss": 5.4309, "mean_token_accuracy": 0.17131112664937972, "num_tokens": 25933408.0, "step": 11325 }, { "entropy": 5.633373880386353, "epoch": 1.120007908264136, "grad_norm": 1.4609375, "learning_rate": 0.0004882925000497101, "loss": 5.4269, "mean_token_accuracy": 0.17251218110322952, "num_tokens": 25944492.0, "step": 11330 }, { "entropy": 5.693177509307861, "epoch": 1.1205021747726374, "grad_norm": 1.84375, "learning_rate": 0.0004882812621688747, "loss": 5.4292, "mean_token_accuracy": 0.18335856199264527, "num_tokens": 25956439.0, "step": 11335 }, { "entropy": 5.681436491012573, "epoch": 1.1209964412811388, "grad_norm": 1.59375, "learning_rate": 0.0004882700190412873, "loss": 5.4592, "mean_token_accuracy": 0.16837025731801986, "num_tokens": 25968765.0, "step": 11340 }, { "entropy": 5.636088705062866, "epoch": 1.12149070778964, "grad_norm": 1.859375, "learning_rate": 0.0004882587706672242, "loss": 5.4631, "mean_token_accuracy": 0.1741855710744858, "num_tokens": 25981300.0, "step": 11345 }, { "entropy": 5.665346479415893, "epoch": 1.1219849742981416, "grad_norm": 1.515625, "learning_rate": 0.0004882475170469622, "loss": 5.4121, "mean_token_accuracy": 0.17627294659614562, "num_tokens": 25991655.0, "step": 11350 }, { "entropy": 5.678512907028198, "epoch": 1.1224792408066429, "grad_norm": 1.6640625, "learning_rate": 0.0004882362581807783, "loss": 5.4, "mean_token_accuracy": 0.17776245772838592, "num_tokens": 26002989.0, "step": 11355 }, { "entropy": 5.621101999282837, "epoch": 1.1229735073151443, "grad_norm": 1.8046875, "learning_rate": 0.0004882249940689494, "loss": 5.3993, "mean_token_accuracy": 0.1808344915509224, "num_tokens": 26013807.0, "step": 11360 }, { "entropy": 5.691890525817871, "epoch": 1.1234677738236458, "grad_norm": 1.5, "learning_rate": 0.00048821372471175245, "loss": 5.53, "mean_token_accuracy": 0.16830582469701766, "num_tokens": 26027099.0, "step": 11365 }, { "entropy": 5.722969627380371, "epoch": 1.123962040332147, "grad_norm": 1.34375, "learning_rate": 0.00048820245010946486, "loss": 5.4276, "mean_token_accuracy": 0.17034331411123277, "num_tokens": 26039046.0, "step": 11370 }, { "entropy": 5.588412952423096, "epoch": 1.1244563068406486, "grad_norm": 1.3671875, "learning_rate": 0.0004881911702623639, "loss": 5.2913, "mean_token_accuracy": 0.18566345870494844, "num_tokens": 26049763.0, "step": 11375 }, { "entropy": 5.5760393142700195, "epoch": 1.1249505733491498, "grad_norm": 1.7421875, "learning_rate": 0.0004881798851707271, "loss": 5.4488, "mean_token_accuracy": 0.17723255157470702, "num_tokens": 26062227.0, "step": 11380 }, { "entropy": 5.650962877273559, "epoch": 1.1254448398576513, "grad_norm": 1.46875, "learning_rate": 0.00048816859483483214, "loss": 5.4271, "mean_token_accuracy": 0.1804071545600891, "num_tokens": 26074019.0, "step": 11385 }, { "entropy": 5.723393440246582, "epoch": 1.1259391063661526, "grad_norm": 1.8125, "learning_rate": 0.00048815729925495656, "loss": 5.5132, "mean_token_accuracy": 0.17423951178789138, "num_tokens": 26086169.0, "step": 11390 }, { "entropy": 5.620085525512695, "epoch": 1.126433372874654, "grad_norm": 1.3203125, "learning_rate": 0.00048814599843137837, "loss": 5.428, "mean_token_accuracy": 0.16667740494012834, "num_tokens": 26097677.0, "step": 11395 }, { "entropy": 5.610358047485351, "epoch": 1.1269276393831553, "grad_norm": 1.4453125, "learning_rate": 0.0004881346923643755, "loss": 5.339, "mean_token_accuracy": 0.18491210490465165, "num_tokens": 26108825.0, "step": 11400 }, { "entropy": 5.752606773376465, "epoch": 1.1274219058916568, "grad_norm": 1.4765625, "learning_rate": 0.0004881233810542263, "loss": 5.4979, "mean_token_accuracy": 0.16972808837890624, "num_tokens": 26120274.0, "step": 11405 }, { "entropy": 5.609503364562988, "epoch": 1.127916172400158, "grad_norm": 1.5546875, "learning_rate": 0.00048811206450120875, "loss": 5.3985, "mean_token_accuracy": 0.17722068279981612, "num_tokens": 26131964.0, "step": 11410 }, { "entropy": 5.661878633499145, "epoch": 1.1284104389086596, "grad_norm": 1.390625, "learning_rate": 0.0004881007427056013, "loss": 5.4566, "mean_token_accuracy": 0.1762293979525566, "num_tokens": 26143308.0, "step": 11415 }, { "entropy": 5.70899338722229, "epoch": 1.128904705417161, "grad_norm": 1.890625, "learning_rate": 0.0004880894156676826, "loss": 5.4904, "mean_token_accuracy": 0.16551888436079026, "num_tokens": 26153951.0, "step": 11420 }, { "entropy": 5.663500785827637, "epoch": 1.1293989719256623, "grad_norm": 1.53125, "learning_rate": 0.0004880780833877312, "loss": 5.3573, "mean_token_accuracy": 0.17926861345767975, "num_tokens": 26165951.0, "step": 11425 }, { "entropy": 5.631722688674927, "epoch": 1.1298932384341638, "grad_norm": 1.4921875, "learning_rate": 0.0004880667458660259, "loss": 5.4365, "mean_token_accuracy": 0.16626278012990953, "num_tokens": 26176751.0, "step": 11430 }, { "entropy": 5.715836238861084, "epoch": 1.130387504942665, "grad_norm": 1.875, "learning_rate": 0.0004880554031028456, "loss": 5.5231, "mean_token_accuracy": 0.17225386649370195, "num_tokens": 26187682.0, "step": 11435 }, { "entropy": 5.781738328933716, "epoch": 1.1308817714511665, "grad_norm": 1.7109375, "learning_rate": 0.00048804405509846933, "loss": 5.4891, "mean_token_accuracy": 0.1706399753689766, "num_tokens": 26198960.0, "step": 11440 }, { "entropy": 5.636456251144409, "epoch": 1.1313760379596678, "grad_norm": 1.5703125, "learning_rate": 0.0004880327018531762, "loss": 5.4698, "mean_token_accuracy": 0.17297246754169465, "num_tokens": 26210198.0, "step": 11445 }, { "entropy": 5.605314636230469, "epoch": 1.1318703044681693, "grad_norm": 1.5, "learning_rate": 0.00048802134336724566, "loss": 5.36, "mean_token_accuracy": 0.17575148046016692, "num_tokens": 26220817.0, "step": 11450 }, { "entropy": 5.647216749191284, "epoch": 1.1323645709766705, "grad_norm": 1.5625, "learning_rate": 0.00048800997964095687, "loss": 5.3927, "mean_token_accuracy": 0.18376834839582443, "num_tokens": 26233657.0, "step": 11455 }, { "entropy": 5.636550951004028, "epoch": 1.132858837485172, "grad_norm": 1.71875, "learning_rate": 0.0004879986106745897, "loss": 5.434, "mean_token_accuracy": 0.17422324866056443, "num_tokens": 26245566.0, "step": 11460 }, { "entropy": 5.666111087799072, "epoch": 1.1333531039936733, "grad_norm": 1.5625, "learning_rate": 0.00048798723646842357, "loss": 5.3695, "mean_token_accuracy": 0.18181964755058289, "num_tokens": 26256717.0, "step": 11465 }, { "entropy": 5.6364631175994875, "epoch": 1.1338473705021748, "grad_norm": 2.328125, "learning_rate": 0.0004879758570227384, "loss": 5.4569, "mean_token_accuracy": 0.17115849405527114, "num_tokens": 26267926.0, "step": 11470 }, { "entropy": 5.620614242553711, "epoch": 1.1343416370106763, "grad_norm": 1.4375, "learning_rate": 0.00048796447233781406, "loss": 5.4271, "mean_token_accuracy": 0.17267002314329147, "num_tokens": 26278666.0, "step": 11475 }, { "entropy": 5.667811727523803, "epoch": 1.1348359035191775, "grad_norm": 1.3515625, "learning_rate": 0.0004879530824139308, "loss": 5.3947, "mean_token_accuracy": 0.1804790809750557, "num_tokens": 26289961.0, "step": 11480 }, { "entropy": 5.627564764022827, "epoch": 1.135330170027679, "grad_norm": 1.3828125, "learning_rate": 0.00048794168725136854, "loss": 5.4312, "mean_token_accuracy": 0.17107535451650618, "num_tokens": 26301245.0, "step": 11485 }, { "entropy": 5.687054109573364, "epoch": 1.1358244365361803, "grad_norm": 1.8203125, "learning_rate": 0.0004879302868504078, "loss": 5.4727, "mean_token_accuracy": 0.17107676416635514, "num_tokens": 26312598.0, "step": 11490 }, { "entropy": 5.755224800109863, "epoch": 1.1363187030446817, "grad_norm": 1.671875, "learning_rate": 0.0004879188812113289, "loss": 5.4642, "mean_token_accuracy": 0.17363066375255584, "num_tokens": 26324300.0, "step": 11495 }, { "entropy": 5.564968395233154, "epoch": 1.136812969553183, "grad_norm": 1.7421875, "learning_rate": 0.0004879074703344125, "loss": 5.438, "mean_token_accuracy": 0.17608712017536163, "num_tokens": 26335789.0, "step": 11500 }, { "entropy": 5.714873218536377, "epoch": 1.1373072360616845, "grad_norm": 1.6875, "learning_rate": 0.0004878960542199394, "loss": 5.4235, "mean_token_accuracy": 0.1759517163038254, "num_tokens": 26347336.0, "step": 11505 }, { "entropy": 5.72796597480774, "epoch": 1.1378015025701858, "grad_norm": 1.46875, "learning_rate": 0.00048788463286819037, "loss": 5.4128, "mean_token_accuracy": 0.17386628687381744, "num_tokens": 26358176.0, "step": 11510 }, { "entropy": 5.591306924819946, "epoch": 1.1382957690786872, "grad_norm": 1.4140625, "learning_rate": 0.0004878732062794462, "loss": 5.3957, "mean_token_accuracy": 0.17131773829460145, "num_tokens": 26368915.0, "step": 11515 }, { "entropy": 5.653985548019409, "epoch": 1.1387900355871885, "grad_norm": 1.53125, "learning_rate": 0.00048786177445398816, "loss": 5.4692, "mean_token_accuracy": 0.17206621021032334, "num_tokens": 26381687.0, "step": 11520 }, { "entropy": 5.693347501754761, "epoch": 1.13928430209569, "grad_norm": 1.484375, "learning_rate": 0.0004878503373920975, "loss": 5.5225, "mean_token_accuracy": 0.1717299461364746, "num_tokens": 26394289.0, "step": 11525 }, { "entropy": 5.627802801132202, "epoch": 1.1397785686041915, "grad_norm": 1.4140625, "learning_rate": 0.0004878388950940555, "loss": 5.3886, "mean_token_accuracy": 0.18488000631332396, "num_tokens": 26405743.0, "step": 11530 }, { "entropy": 5.742920541763306, "epoch": 1.1402728351126927, "grad_norm": 1.34375, "learning_rate": 0.00048782744756014365, "loss": 5.5207, "mean_token_accuracy": 0.16564180701971054, "num_tokens": 26417255.0, "step": 11535 }, { "entropy": 5.746685361862182, "epoch": 1.1407671016211942, "grad_norm": 1.4296875, "learning_rate": 0.0004878159947906436, "loss": 5.5333, "mean_token_accuracy": 0.17083633840084075, "num_tokens": 26428992.0, "step": 11540 }, { "entropy": 5.619696760177613, "epoch": 1.1412613681296955, "grad_norm": 1.40625, "learning_rate": 0.000487804536785837, "loss": 5.4275, "mean_token_accuracy": 0.18058303594589234, "num_tokens": 26440375.0, "step": 11545 }, { "entropy": 5.680644845962524, "epoch": 1.141755634638197, "grad_norm": 1.25, "learning_rate": 0.00048779307354600586, "loss": 5.4876, "mean_token_accuracy": 0.16940272301435472, "num_tokens": 26452253.0, "step": 11550 }, { "entropy": 5.740002298355103, "epoch": 1.1422499011466982, "grad_norm": 1.7421875, "learning_rate": 0.00048778160507143204, "loss": 5.5166, "mean_token_accuracy": 0.16702307760715485, "num_tokens": 26463766.0, "step": 11555 }, { "entropy": 5.634490919113159, "epoch": 1.1427441676551997, "grad_norm": 1.3828125, "learning_rate": 0.0004877701313623978, "loss": 5.4744, "mean_token_accuracy": 0.1724281281232834, "num_tokens": 26475869.0, "step": 11560 }, { "entropy": 5.70414628982544, "epoch": 1.1432384341637012, "grad_norm": 1.3359375, "learning_rate": 0.0004877586524191852, "loss": 5.4498, "mean_token_accuracy": 0.17543199509382248, "num_tokens": 26487142.0, "step": 11565 }, { "entropy": 5.661681413650513, "epoch": 1.1437327006722025, "grad_norm": 1.375, "learning_rate": 0.0004877471682420768, "loss": 5.2898, "mean_token_accuracy": 0.18153191357851028, "num_tokens": 26499019.0, "step": 11570 }, { "entropy": 5.596389675140381, "epoch": 1.1442269671807037, "grad_norm": 1.6015625, "learning_rate": 0.0004877356788313551, "loss": 5.3995, "mean_token_accuracy": 0.18449472784996032, "num_tokens": 26510060.0, "step": 11575 }, { "entropy": 5.596276760101318, "epoch": 1.1447212336892052, "grad_norm": 1.6640625, "learning_rate": 0.0004877241841873027, "loss": 5.3307, "mean_token_accuracy": 0.18034512549638748, "num_tokens": 26520723.0, "step": 11580 }, { "entropy": 5.603102827072144, "epoch": 1.1452155001977067, "grad_norm": 1.7265625, "learning_rate": 0.0004877126843102023, "loss": 5.4184, "mean_token_accuracy": 0.17794054597616196, "num_tokens": 26532545.0, "step": 11585 }, { "entropy": 5.695872735977173, "epoch": 1.145709766706208, "grad_norm": 1.7890625, "learning_rate": 0.00048770117920033697, "loss": 5.4048, "mean_token_accuracy": 0.18506992906332015, "num_tokens": 26542993.0, "step": 11590 }, { "entropy": 5.682855701446533, "epoch": 1.1462040332147094, "grad_norm": 1.4375, "learning_rate": 0.0004876896688579895, "loss": 5.4174, "mean_token_accuracy": 0.1772419184446335, "num_tokens": 26554658.0, "step": 11595 }, { "entropy": 5.653793478012085, "epoch": 1.1466982997232107, "grad_norm": 1.6640625, "learning_rate": 0.0004876781532834433, "loss": 5.4349, "mean_token_accuracy": 0.18008334040641785, "num_tokens": 26565925.0, "step": 11600 }, { "entropy": 5.606824779510498, "epoch": 1.1471925662317122, "grad_norm": 1.5859375, "learning_rate": 0.0004876666324769815, "loss": 5.4022, "mean_token_accuracy": 0.1800542414188385, "num_tokens": 26577045.0, "step": 11605 }, { "entropy": 5.635615015029908, "epoch": 1.1476868327402134, "grad_norm": 1.6796875, "learning_rate": 0.0004876551064388875, "loss": 5.4863, "mean_token_accuracy": 0.1699806660413742, "num_tokens": 26587773.0, "step": 11610 }, { "entropy": 5.675181722640991, "epoch": 1.148181099248715, "grad_norm": 1.65625, "learning_rate": 0.00048764357516944485, "loss": 5.3888, "mean_token_accuracy": 0.17851745188236237, "num_tokens": 26597861.0, "step": 11615 }, { "entropy": 5.737946939468384, "epoch": 1.1486753657572164, "grad_norm": 1.5390625, "learning_rate": 0.00048763203866893735, "loss": 5.4359, "mean_token_accuracy": 0.17790672332048416, "num_tokens": 26607695.0, "step": 11620 }, { "entropy": 5.650989007949829, "epoch": 1.1491696322657177, "grad_norm": 1.6640625, "learning_rate": 0.00048762049693764866, "loss": 5.4952, "mean_token_accuracy": 0.1648597463965416, "num_tokens": 26619845.0, "step": 11625 }, { "entropy": 5.743856191635132, "epoch": 1.1496638987742192, "grad_norm": 2.390625, "learning_rate": 0.00048760894997586284, "loss": 5.3941, "mean_token_accuracy": 0.17170243710279465, "num_tokens": 26630279.0, "step": 11630 }, { "entropy": 5.61414909362793, "epoch": 1.1501581652827204, "grad_norm": 1.75, "learning_rate": 0.0004875973977838639, "loss": 5.4093, "mean_token_accuracy": 0.1825347810983658, "num_tokens": 26640996.0, "step": 11635 }, { "entropy": 5.552602672576905, "epoch": 1.150652431791222, "grad_norm": 1.59375, "learning_rate": 0.00048758584036193587, "loss": 5.3398, "mean_token_accuracy": 0.17941114753484727, "num_tokens": 26652416.0, "step": 11640 }, { "entropy": 5.676434087753296, "epoch": 1.1511466982997232, "grad_norm": 1.5625, "learning_rate": 0.0004875742777103632, "loss": 5.4468, "mean_token_accuracy": 0.17161732017993928, "num_tokens": 26663649.0, "step": 11645 }, { "entropy": 5.709451341629029, "epoch": 1.1516409648082246, "grad_norm": 1.46875, "learning_rate": 0.00048756270982943035, "loss": 5.5184, "mean_token_accuracy": 0.16836084872484208, "num_tokens": 26676138.0, "step": 11650 }, { "entropy": 5.7523651123046875, "epoch": 1.152135231316726, "grad_norm": 1.65625, "learning_rate": 0.0004875511367194219, "loss": 5.4705, "mean_token_accuracy": 0.1685570076107979, "num_tokens": 26687364.0, "step": 11655 }, { "entropy": 5.661980247497558, "epoch": 1.1526294978252274, "grad_norm": 1.359375, "learning_rate": 0.0004875395583806225, "loss": 5.4327, "mean_token_accuracy": 0.1747313290834427, "num_tokens": 26698135.0, "step": 11660 }, { "entropy": 5.6518364429473875, "epoch": 1.1531237643337287, "grad_norm": 1.6875, "learning_rate": 0.0004875279748133169, "loss": 5.3871, "mean_token_accuracy": 0.17886864840984346, "num_tokens": 26710495.0, "step": 11665 }, { "entropy": 5.7325492858886715, "epoch": 1.1536180308422301, "grad_norm": 1.6328125, "learning_rate": 0.0004875163860177902, "loss": 5.5527, "mean_token_accuracy": 0.1664167106151581, "num_tokens": 26722876.0, "step": 11670 }, { "entropy": 5.665588855743408, "epoch": 1.1541122973507316, "grad_norm": 1.6640625, "learning_rate": 0.00048750479199432753, "loss": 5.4165, "mean_token_accuracy": 0.17477668076753616, "num_tokens": 26733548.0, "step": 11675 }, { "entropy": 5.550989198684692, "epoch": 1.1546065638592329, "grad_norm": 1.578125, "learning_rate": 0.0004874931927432139, "loss": 5.3427, "mean_token_accuracy": 0.18304872363805771, "num_tokens": 26744754.0, "step": 11680 }, { "entropy": 5.619116973876953, "epoch": 1.1551008303677344, "grad_norm": 1.8125, "learning_rate": 0.0004874815882647348, "loss": 5.4721, "mean_token_accuracy": 0.17246431410312651, "num_tokens": 26757416.0, "step": 11685 }, { "entropy": 5.643358421325684, "epoch": 1.1555950968762356, "grad_norm": 1.6796875, "learning_rate": 0.0004874699785591756, "loss": 5.3776, "mean_token_accuracy": 0.17925926446914672, "num_tokens": 26768572.0, "step": 11690 }, { "entropy": 5.593602085113526, "epoch": 1.1560893633847371, "grad_norm": 1.5546875, "learning_rate": 0.00048745836362682203, "loss": 5.3712, "mean_token_accuracy": 0.18403592556715012, "num_tokens": 26779309.0, "step": 11695 }, { "entropy": 5.7210639953613285, "epoch": 1.1565836298932384, "grad_norm": 1.6328125, "learning_rate": 0.0004874467434679598, "loss": 5.4628, "mean_token_accuracy": 0.17899265587329866, "num_tokens": 26791107.0, "step": 11700 }, { "entropy": 5.63674488067627, "epoch": 1.1570778964017399, "grad_norm": 1.484375, "learning_rate": 0.0004874351180828746, "loss": 5.3522, "mean_token_accuracy": 0.18383544087409973, "num_tokens": 26801334.0, "step": 11705 }, { "entropy": 5.582541036605835, "epoch": 1.1575721629102411, "grad_norm": 1.2578125, "learning_rate": 0.0004874234874718526, "loss": 5.3867, "mean_token_accuracy": 0.17482873648405076, "num_tokens": 26812972.0, "step": 11710 }, { "entropy": 5.675421714782715, "epoch": 1.1580664294187426, "grad_norm": 2.453125, "learning_rate": 0.00048741185163517984, "loss": 5.4429, "mean_token_accuracy": 0.17699123919010162, "num_tokens": 26823683.0, "step": 11715 }, { "entropy": 5.6697557926177975, "epoch": 1.1585606959272439, "grad_norm": 1.5625, "learning_rate": 0.00048740021057314267, "loss": 5.4169, "mean_token_accuracy": 0.18200384974479675, "num_tokens": 26835898.0, "step": 11720 }, { "entropy": 5.661006021499634, "epoch": 1.1590549624357454, "grad_norm": 1.2265625, "learning_rate": 0.00048738856428602736, "loss": 5.3759, "mean_token_accuracy": 0.18145013302564622, "num_tokens": 26847363.0, "step": 11725 }, { "entropy": 5.6185790538787845, "epoch": 1.1595492289442468, "grad_norm": 1.3359375, "learning_rate": 0.0004873769127741203, "loss": 5.3423, "mean_token_accuracy": 0.17896101325750352, "num_tokens": 26859081.0, "step": 11730 }, { "entropy": 5.640149259567261, "epoch": 1.160043495452748, "grad_norm": 1.3984375, "learning_rate": 0.0004873652560377083, "loss": 5.3649, "mean_token_accuracy": 0.1796891063451767, "num_tokens": 26869966.0, "step": 11735 }, { "entropy": 5.630725002288818, "epoch": 1.1605377619612496, "grad_norm": 1.6171875, "learning_rate": 0.000487353594077078, "loss": 5.3721, "mean_token_accuracy": 0.1796877056360245, "num_tokens": 26880673.0, "step": 11740 }, { "entropy": 5.648007583618164, "epoch": 1.1610320284697508, "grad_norm": 1.4453125, "learning_rate": 0.00048734192689251643, "loss": 5.4095, "mean_token_accuracy": 0.1808043971657753, "num_tokens": 26892306.0, "step": 11745 }, { "entropy": 5.743666696548462, "epoch": 1.1615262949782523, "grad_norm": 1.296875, "learning_rate": 0.0004873302544843104, "loss": 5.4672, "mean_token_accuracy": 0.17247305661439896, "num_tokens": 26904655.0, "step": 11750 }, { "entropy": 5.609138011932373, "epoch": 1.1620205614867536, "grad_norm": 1.53125, "learning_rate": 0.0004873185768527473, "loss": 5.4781, "mean_token_accuracy": 0.17411849796772003, "num_tokens": 26916580.0, "step": 11755 }, { "entropy": 5.674717092514038, "epoch": 1.162514827995255, "grad_norm": 1.421875, "learning_rate": 0.00048730689399811427, "loss": 5.4097, "mean_token_accuracy": 0.17701719105243682, "num_tokens": 26927033.0, "step": 11760 }, { "entropy": 5.680281448364258, "epoch": 1.1630090945037563, "grad_norm": 1.8359375, "learning_rate": 0.0004872952059206986, "loss": 5.4916, "mean_token_accuracy": 0.17104896754026414, "num_tokens": 26938594.0, "step": 11765 }, { "entropy": 5.623374891281128, "epoch": 1.1635033610122578, "grad_norm": 1.359375, "learning_rate": 0.0004872835126207881, "loss": 5.3698, "mean_token_accuracy": 0.18213477730751038, "num_tokens": 26949595.0, "step": 11770 }, { "entropy": 5.711515045166015, "epoch": 1.163997627520759, "grad_norm": 1.390625, "learning_rate": 0.0004872718140986701, "loss": 5.5018, "mean_token_accuracy": 0.17131920754909516, "num_tokens": 26961692.0, "step": 11775 }, { "entropy": 5.654244089126587, "epoch": 1.1644918940292606, "grad_norm": 1.5546875, "learning_rate": 0.00048726011035463265, "loss": 5.343, "mean_token_accuracy": 0.17828375101089478, "num_tokens": 26972062.0, "step": 11780 }, { "entropy": 5.701637077331543, "epoch": 1.164986160537762, "grad_norm": 1.8671875, "learning_rate": 0.0004872484013889635, "loss": 5.3837, "mean_token_accuracy": 0.17885130345821382, "num_tokens": 26983353.0, "step": 11785 }, { "entropy": 5.711111164093017, "epoch": 1.1654804270462633, "grad_norm": 1.5625, "learning_rate": 0.00048723668720195067, "loss": 5.5137, "mean_token_accuracy": 0.16809093058109284, "num_tokens": 26994828.0, "step": 11790 }, { "entropy": 5.595471048355103, "epoch": 1.1659746935547648, "grad_norm": 1.515625, "learning_rate": 0.0004872249677938825, "loss": 5.4147, "mean_token_accuracy": 0.17792768776416779, "num_tokens": 27008311.0, "step": 11795 }, { "entropy": 5.592234420776367, "epoch": 1.166468960063266, "grad_norm": 2.125, "learning_rate": 0.0004872132431650472, "loss": 5.3809, "mean_token_accuracy": 0.18287635445594788, "num_tokens": 27018984.0, "step": 11800 }, { "entropy": 5.6987982273101805, "epoch": 1.1669632265717675, "grad_norm": 1.6484375, "learning_rate": 0.00048720151331573317, "loss": 5.4973, "mean_token_accuracy": 0.1673872858285904, "num_tokens": 27029183.0, "step": 11805 }, { "entropy": 5.595653820037842, "epoch": 1.1674574930802688, "grad_norm": 1.6328125, "learning_rate": 0.000487189778246229, "loss": 5.344, "mean_token_accuracy": 0.18547672182321548, "num_tokens": 27039661.0, "step": 11810 }, { "entropy": 5.69262924194336, "epoch": 1.1679517595887703, "grad_norm": 1.6953125, "learning_rate": 0.00048717803795682334, "loss": 5.5111, "mean_token_accuracy": 0.16858460158109664, "num_tokens": 27051685.0, "step": 11815 }, { "entropy": 5.751629972457886, "epoch": 1.1684460260972718, "grad_norm": 1.6015625, "learning_rate": 0.0004871662924478051, "loss": 5.4691, "mean_token_accuracy": 0.1781709909439087, "num_tokens": 27062096.0, "step": 11820 }, { "entropy": 5.636955308914184, "epoch": 1.168940292605773, "grad_norm": 1.390625, "learning_rate": 0.0004871545417194631, "loss": 5.367, "mean_token_accuracy": 0.17909791320562363, "num_tokens": 27073059.0, "step": 11825 }, { "entropy": 5.708993577957154, "epoch": 1.1694345591142743, "grad_norm": 1.6484375, "learning_rate": 0.00048714278577208643, "loss": 5.4533, "mean_token_accuracy": 0.1752929374575615, "num_tokens": 27085272.0, "step": 11830 }, { "entropy": 5.700922155380249, "epoch": 1.1699288256227758, "grad_norm": 1.578125, "learning_rate": 0.0004871310246059644, "loss": 5.4374, "mean_token_accuracy": 0.16876550614833832, "num_tokens": 27096651.0, "step": 11835 }, { "entropy": 5.694065380096435, "epoch": 1.1704230921312773, "grad_norm": 1.515625, "learning_rate": 0.00048711925822138627, "loss": 5.3697, "mean_token_accuracy": 0.17503898441791535, "num_tokens": 27108180.0, "step": 11840 }, { "entropy": 5.717705345153808, "epoch": 1.1709173586397785, "grad_norm": 1.4609375, "learning_rate": 0.00048710748661864135, "loss": 5.4577, "mean_token_accuracy": 0.1774182364344597, "num_tokens": 27118902.0, "step": 11845 }, { "entropy": 5.639253377914429, "epoch": 1.17141162514828, "grad_norm": 1.375, "learning_rate": 0.00048709570979801946, "loss": 5.4198, "mean_token_accuracy": 0.17686117738485335, "num_tokens": 27131279.0, "step": 11850 }, { "entropy": 5.621879291534424, "epoch": 1.1719058916567813, "grad_norm": 1.4609375, "learning_rate": 0.00048708392775981014, "loss": 5.393, "mean_token_accuracy": 0.18451005816459656, "num_tokens": 27142983.0, "step": 11855 }, { "entropy": 5.660607719421387, "epoch": 1.1724001581652828, "grad_norm": 1.828125, "learning_rate": 0.0004870721405043033, "loss": 5.3776, "mean_token_accuracy": 0.1748368352651596, "num_tokens": 27154516.0, "step": 11860 }, { "entropy": 5.676554727554321, "epoch": 1.172894424673784, "grad_norm": 1.59375, "learning_rate": 0.0004870603480317889, "loss": 5.4369, "mean_token_accuracy": 0.17714077830314637, "num_tokens": 27164717.0, "step": 11865 }, { "entropy": 5.712461853027344, "epoch": 1.1733886911822855, "grad_norm": 1.46875, "learning_rate": 0.00048704855034255713, "loss": 5.4437, "mean_token_accuracy": 0.18074197918176652, "num_tokens": 27174830.0, "step": 11870 }, { "entropy": 5.637642765045166, "epoch": 1.173882957690787, "grad_norm": 1.5625, "learning_rate": 0.00048703674743689806, "loss": 5.4109, "mean_token_accuracy": 0.1771542340517044, "num_tokens": 27186724.0, "step": 11875 }, { "entropy": 5.574132919311523, "epoch": 1.1743772241992882, "grad_norm": 1.5, "learning_rate": 0.0004870249393151021, "loss": 5.3843, "mean_token_accuracy": 0.17653077244758605, "num_tokens": 27198416.0, "step": 11880 }, { "entropy": 5.641961002349854, "epoch": 1.1748714907077897, "grad_norm": 1.5703125, "learning_rate": 0.00048701312597745986, "loss": 5.307, "mean_token_accuracy": 0.18012466728687287, "num_tokens": 27209347.0, "step": 11885 }, { "entropy": 5.6432661533355715, "epoch": 1.175365757216291, "grad_norm": 1.4453125, "learning_rate": 0.00048700130742426165, "loss": 5.3988, "mean_token_accuracy": 0.1704787015914917, "num_tokens": 27221061.0, "step": 11890 }, { "entropy": 5.629746580123902, "epoch": 1.1758600237247925, "grad_norm": 1.4296875, "learning_rate": 0.0004869894836557985, "loss": 5.3737, "mean_token_accuracy": 0.18714386522769927, "num_tokens": 27233436.0, "step": 11895 }, { "entropy": 5.657157850265503, "epoch": 1.1763542902332937, "grad_norm": 1.546875, "learning_rate": 0.00048697765467236117, "loss": 5.3814, "mean_token_accuracy": 0.18612172752618789, "num_tokens": 27246308.0, "step": 11900 }, { "entropy": 5.651254463195801, "epoch": 1.1768485567417952, "grad_norm": 1.4375, "learning_rate": 0.00048696582047424053, "loss": 5.4382, "mean_token_accuracy": 0.17277199029922485, "num_tokens": 27258187.0, "step": 11905 }, { "entropy": 5.628514671325684, "epoch": 1.1773428232502965, "grad_norm": 1.4609375, "learning_rate": 0.00048695398106172793, "loss": 5.4002, "mean_token_accuracy": 0.18142856806516647, "num_tokens": 27269411.0, "step": 11910 }, { "entropy": 5.630224800109863, "epoch": 1.177837089758798, "grad_norm": 1.3828125, "learning_rate": 0.0004869421364351145, "loss": 5.4196, "mean_token_accuracy": 0.1757066622376442, "num_tokens": 27280592.0, "step": 11915 }, { "entropy": 5.749567890167237, "epoch": 1.1783313562672992, "grad_norm": 1.53125, "learning_rate": 0.00048693028659469156, "loss": 5.5001, "mean_token_accuracy": 0.16359154284000396, "num_tokens": 27292151.0, "step": 11920 }, { "entropy": 5.660740852355957, "epoch": 1.1788256227758007, "grad_norm": 1.4609375, "learning_rate": 0.00048691843154075075, "loss": 5.3616, "mean_token_accuracy": 0.17889530807733536, "num_tokens": 27305371.0, "step": 11925 }, { "entropy": 5.623413515090943, "epoch": 1.1793198892843022, "grad_norm": 1.390625, "learning_rate": 0.00048690657127358367, "loss": 5.4557, "mean_token_accuracy": 0.1730481877923012, "num_tokens": 27316810.0, "step": 11930 }, { "entropy": 5.645069646835327, "epoch": 1.1798141557928035, "grad_norm": 1.53125, "learning_rate": 0.00048689470579348207, "loss": 5.4366, "mean_token_accuracy": 0.17546434402465821, "num_tokens": 27328412.0, "step": 11935 }, { "entropy": 5.707151222229004, "epoch": 1.180308422301305, "grad_norm": 1.5546875, "learning_rate": 0.00048688283510073775, "loss": 5.4833, "mean_token_accuracy": 0.17414152175188063, "num_tokens": 27340216.0, "step": 11940 }, { "entropy": 5.622820711135864, "epoch": 1.1808026888098062, "grad_norm": 1.5859375, "learning_rate": 0.0004868709591956429, "loss": 5.3127, "mean_token_accuracy": 0.17851535528898238, "num_tokens": 27350290.0, "step": 11945 }, { "entropy": 5.634811019897461, "epoch": 1.1812969553183077, "grad_norm": 1.5859375, "learning_rate": 0.00048685907807848955, "loss": 5.486, "mean_token_accuracy": 0.1703660801053047, "num_tokens": 27360639.0, "step": 11950 }, { "entropy": 5.62358283996582, "epoch": 1.181791221826809, "grad_norm": 1.359375, "learning_rate": 0.00048684719174957005, "loss": 5.3517, "mean_token_accuracy": 0.1807660326361656, "num_tokens": 27372059.0, "step": 11955 }, { "entropy": 5.663116455078125, "epoch": 1.1822854883353104, "grad_norm": 1.8671875, "learning_rate": 0.0004868353002091767, "loss": 5.4695, "mean_token_accuracy": 0.16530514657497405, "num_tokens": 27384308.0, "step": 11960 }, { "entropy": 5.575397205352783, "epoch": 1.1827797548438117, "grad_norm": 1.421875, "learning_rate": 0.0004868234034576021, "loss": 5.2754, "mean_token_accuracy": 0.1968613848090172, "num_tokens": 27395510.0, "step": 11965 }, { "entropy": 5.610069465637207, "epoch": 1.1832740213523132, "grad_norm": 1.34375, "learning_rate": 0.000486811501495139, "loss": 5.404, "mean_token_accuracy": 0.17248845845460892, "num_tokens": 27406697.0, "step": 11970 }, { "entropy": 5.638059663772583, "epoch": 1.1837682878608144, "grad_norm": 1.828125, "learning_rate": 0.0004867995943220801, "loss": 5.4212, "mean_token_accuracy": 0.18095448911190032, "num_tokens": 27418047.0, "step": 11975 }, { "entropy": 5.706262063980103, "epoch": 1.184262554369316, "grad_norm": 1.5078125, "learning_rate": 0.00048678768193871825, "loss": 5.5287, "mean_token_accuracy": 0.16767776757478714, "num_tokens": 27430044.0, "step": 11980 }, { "entropy": 5.656655359268188, "epoch": 1.1847568208778174, "grad_norm": 1.65625, "learning_rate": 0.0004867757643453466, "loss": 5.4489, "mean_token_accuracy": 0.17198732495307922, "num_tokens": 27441392.0, "step": 11985 }, { "entropy": 5.703206872940063, "epoch": 1.1852510873863187, "grad_norm": 1.390625, "learning_rate": 0.00048676384154225827, "loss": 5.5398, "mean_token_accuracy": 0.16984956264495848, "num_tokens": 27451356.0, "step": 11990 }, { "entropy": 5.602766323089599, "epoch": 1.1857453538948202, "grad_norm": 1.578125, "learning_rate": 0.0004867519135297466, "loss": 5.3635, "mean_token_accuracy": 0.1859638586640358, "num_tokens": 27462358.0, "step": 11995 }, { "entropy": 5.5955119132995605, "epoch": 1.1862396204033214, "grad_norm": 1.296875, "learning_rate": 0.00048673998030810507, "loss": 5.3555, "mean_token_accuracy": 0.17727247327566148, "num_tokens": 27474144.0, "step": 12000 }, { "epoch": 1.1862396204033214, "eval_entropy": 5.5140220208068325, "eval_loss": 5.510257244110107, "eval_mean_token_accuracy": 0.18012088329369733, "eval_num_tokens": 27474144.0, "eval_runtime": 26.4017, "eval_samples_per_second": 1231.475, "eval_steps_per_second": 153.967, "step": 12000 }, { "entropy": 5.739811515808105, "epoch": 1.186733886911823, "grad_norm": 1.359375, "learning_rate": 0.00048672804187762704, "loss": 5.5097, "mean_token_accuracy": 0.16732267439365386, "num_tokens": 27486337.0, "step": 12005 }, { "entropy": 5.657247114181518, "epoch": 1.1872281534203242, "grad_norm": 1.4296875, "learning_rate": 0.0004867160982386065, "loss": 5.4336, "mean_token_accuracy": 0.18076617270708084, "num_tokens": 27498686.0, "step": 12010 }, { "entropy": 5.7094970703125, "epoch": 1.1877224199288257, "grad_norm": 1.4609375, "learning_rate": 0.00048670414939133694, "loss": 5.4611, "mean_token_accuracy": 0.17435312420129775, "num_tokens": 27509850.0, "step": 12015 }, { "entropy": 5.778923892974854, "epoch": 1.188216686437327, "grad_norm": 1.578125, "learning_rate": 0.0004866921953361125, "loss": 5.558, "mean_token_accuracy": 0.16622319221496581, "num_tokens": 27521994.0, "step": 12020 }, { "entropy": 5.635497379302978, "epoch": 1.1887109529458284, "grad_norm": 1.6953125, "learning_rate": 0.0004866802360732273, "loss": 5.4934, "mean_token_accuracy": 0.17442448139190675, "num_tokens": 27534980.0, "step": 12025 }, { "entropy": 5.672856235504151, "epoch": 1.1892052194543297, "grad_norm": 1.40625, "learning_rate": 0.0004866682716029754, "loss": 5.3913, "mean_token_accuracy": 0.17617794126272202, "num_tokens": 27546461.0, "step": 12030 }, { "entropy": 5.665174865722657, "epoch": 1.1896994859628311, "grad_norm": 1.390625, "learning_rate": 0.00048665630192565117, "loss": 5.3281, "mean_token_accuracy": 0.18198878914117814, "num_tokens": 27557076.0, "step": 12035 }, { "entropy": 5.563039493560791, "epoch": 1.1901937524713326, "grad_norm": 1.4453125, "learning_rate": 0.0004866443270415491, "loss": 5.4388, "mean_token_accuracy": 0.18048588037490845, "num_tokens": 27569807.0, "step": 12040 }, { "entropy": 5.675030899047852, "epoch": 1.190688018979834, "grad_norm": 1.4375, "learning_rate": 0.0004866323469509637, "loss": 5.3448, "mean_token_accuracy": 0.18154726922512054, "num_tokens": 27579858.0, "step": 12045 }, { "entropy": 5.646805286407471, "epoch": 1.1911822854883354, "grad_norm": 1.421875, "learning_rate": 0.0004866203616541898, "loss": 5.4392, "mean_token_accuracy": 0.17135237157344818, "num_tokens": 27590192.0, "step": 12050 }, { "entropy": 5.616262292861938, "epoch": 1.1916765519968366, "grad_norm": 1.28125, "learning_rate": 0.00048660837115152214, "loss": 5.4372, "mean_token_accuracy": 0.18135599046945572, "num_tokens": 27601756.0, "step": 12055 }, { "entropy": 5.627850341796875, "epoch": 1.1921708185053381, "grad_norm": 1.3984375, "learning_rate": 0.0004865963754432557, "loss": 5.3573, "mean_token_accuracy": 0.18076136261224746, "num_tokens": 27614019.0, "step": 12060 }, { "entropy": 5.588666105270386, "epoch": 1.1926650850138394, "grad_norm": 1.7890625, "learning_rate": 0.0004865843745296856, "loss": 5.4031, "mean_token_accuracy": 0.17696809470653535, "num_tokens": 27626900.0, "step": 12065 }, { "entropy": 5.618898963928222, "epoch": 1.1931593515223409, "grad_norm": 1.3515625, "learning_rate": 0.00048657236841110707, "loss": 5.3423, "mean_token_accuracy": 0.18124785125255585, "num_tokens": 27637897.0, "step": 12070 }, { "entropy": 5.67648663520813, "epoch": 1.1936536180308421, "grad_norm": 1.4453125, "learning_rate": 0.0004865603570878155, "loss": 5.4485, "mean_token_accuracy": 0.1725422888994217, "num_tokens": 27649523.0, "step": 12075 }, { "entropy": 5.703610610961914, "epoch": 1.1941478845393436, "grad_norm": 1.453125, "learning_rate": 0.0004865483405601063, "loss": 5.4665, "mean_token_accuracy": 0.17718684077262878, "num_tokens": 27659406.0, "step": 12080 }, { "entropy": 5.589076232910156, "epoch": 1.1946421510478449, "grad_norm": 1.265625, "learning_rate": 0.0004865363188282751, "loss": 5.3647, "mean_token_accuracy": 0.1768591359257698, "num_tokens": 27670912.0, "step": 12085 }, { "entropy": 5.655852746963501, "epoch": 1.1951364175563464, "grad_norm": 1.3359375, "learning_rate": 0.00048652429189261767, "loss": 5.4101, "mean_token_accuracy": 0.18040030747652053, "num_tokens": 27681667.0, "step": 12090 }, { "entropy": 5.652654838562012, "epoch": 1.1956306840648478, "grad_norm": 1.890625, "learning_rate": 0.0004865122597534298, "loss": 5.4287, "mean_token_accuracy": 0.17895926535129547, "num_tokens": 27692170.0, "step": 12095 }, { "entropy": 5.5692291259765625, "epoch": 1.196124950573349, "grad_norm": 1.4921875, "learning_rate": 0.0004865002224110075, "loss": 5.2976, "mean_token_accuracy": 0.18794215023517608, "num_tokens": 27702533.0, "step": 12100 }, { "entropy": 5.615765953063965, "epoch": 1.1966192170818506, "grad_norm": 1.5, "learning_rate": 0.000486488179865647, "loss": 5.3229, "mean_token_accuracy": 0.18321851789951324, "num_tokens": 27713795.0, "step": 12105 }, { "entropy": 5.655087471008301, "epoch": 1.1971134835903519, "grad_norm": 1.3984375, "learning_rate": 0.0004864761321176444, "loss": 5.4615, "mean_token_accuracy": 0.1752711534500122, "num_tokens": 27725404.0, "step": 12110 }, { "entropy": 5.595058250427246, "epoch": 1.1976077500988533, "grad_norm": 1.5390625, "learning_rate": 0.0004864640791672962, "loss": 5.3531, "mean_token_accuracy": 0.17602431178092956, "num_tokens": 27737537.0, "step": 12115 }, { "entropy": 5.596295928955078, "epoch": 1.1981020166073546, "grad_norm": 1.828125, "learning_rate": 0.0004864520210148988, "loss": 5.3576, "mean_token_accuracy": 0.18118408620357512, "num_tokens": 27749841.0, "step": 12120 }, { "entropy": 5.6556768894195555, "epoch": 1.198596283115856, "grad_norm": 1.375, "learning_rate": 0.0004864399576607489, "loss": 5.471, "mean_token_accuracy": 0.17475775331258775, "num_tokens": 27760302.0, "step": 12125 }, { "entropy": 5.6397792339324955, "epoch": 1.1990905496243576, "grad_norm": 2.125, "learning_rate": 0.00048642788910514324, "loss": 5.4584, "mean_token_accuracy": 0.17943050116300582, "num_tokens": 27770989.0, "step": 12130 }, { "entropy": 5.714544105529785, "epoch": 1.1995848161328588, "grad_norm": 1.4296875, "learning_rate": 0.00048641581534837863, "loss": 5.4042, "mean_token_accuracy": 0.17871297597885133, "num_tokens": 27785196.0, "step": 12135 }, { "entropy": 5.620921564102173, "epoch": 1.2000790826413603, "grad_norm": 1.5078125, "learning_rate": 0.00048640373639075225, "loss": 5.4314, "mean_token_accuracy": 0.17638997584581376, "num_tokens": 27795588.0, "step": 12140 }, { "entropy": 5.565603399276734, "epoch": 1.2005733491498616, "grad_norm": 1.4296875, "learning_rate": 0.00048639165223256117, "loss": 5.3449, "mean_token_accuracy": 0.17768989205360414, "num_tokens": 27807204.0, "step": 12145 }, { "entropy": 5.617923736572266, "epoch": 1.201067615658363, "grad_norm": 1.390625, "learning_rate": 0.00048637956287410263, "loss": 5.3388, "mean_token_accuracy": 0.18450913578271866, "num_tokens": 27817959.0, "step": 12150 }, { "entropy": 5.667637157440185, "epoch": 1.2015618821668643, "grad_norm": 1.4140625, "learning_rate": 0.00048636746831567403, "loss": 5.5082, "mean_token_accuracy": 0.170717990398407, "num_tokens": 27830736.0, "step": 12155 }, { "entropy": 5.660735654830932, "epoch": 1.2020561486753658, "grad_norm": 1.8828125, "learning_rate": 0.0004863553685575729, "loss": 5.4385, "mean_token_accuracy": 0.1692439377307892, "num_tokens": 27840992.0, "step": 12160 }, { "entropy": 5.676145792007446, "epoch": 1.202550415183867, "grad_norm": 1.3984375, "learning_rate": 0.0004863432636000969, "loss": 5.4075, "mean_token_accuracy": 0.17512346804141998, "num_tokens": 27852747.0, "step": 12165 }, { "entropy": 5.640401172637939, "epoch": 1.2030446816923686, "grad_norm": 1.3203125, "learning_rate": 0.0004863311534435439, "loss": 5.4989, "mean_token_accuracy": 0.17363506257534028, "num_tokens": 27865136.0, "step": 12170 }, { "entropy": 5.712698268890381, "epoch": 1.2035389482008698, "grad_norm": 1.7578125, "learning_rate": 0.00048631903808821176, "loss": 5.3447, "mean_token_accuracy": 0.18180596083402634, "num_tokens": 27876489.0, "step": 12175 }, { "entropy": 5.613698101043701, "epoch": 1.2040332147093713, "grad_norm": 1.4765625, "learning_rate": 0.00048630691753439844, "loss": 5.3516, "mean_token_accuracy": 0.1796725422143936, "num_tokens": 27886478.0, "step": 12180 }, { "entropy": 5.571279525756836, "epoch": 1.2045274812178728, "grad_norm": 1.546875, "learning_rate": 0.0004862947917824022, "loss": 5.374, "mean_token_accuracy": 0.1868493989109993, "num_tokens": 27897473.0, "step": 12185 }, { "entropy": 5.614389181137085, "epoch": 1.205021747726374, "grad_norm": 1.359375, "learning_rate": 0.00048628266083252124, "loss": 5.3351, "mean_token_accuracy": 0.17487846314907074, "num_tokens": 27908390.0, "step": 12190 }, { "entropy": 5.696160984039307, "epoch": 1.2055160142348755, "grad_norm": 1.5234375, "learning_rate": 0.0004862705246850541, "loss": 5.4058, "mean_token_accuracy": 0.17434001415967942, "num_tokens": 27919372.0, "step": 12195 }, { "entropy": 5.5829774856567385, "epoch": 1.2060102807433768, "grad_norm": 1.3203125, "learning_rate": 0.0004862583833402993, "loss": 5.3797, "mean_token_accuracy": 0.17981068789958954, "num_tokens": 27931294.0, "step": 12200 }, { "entropy": 5.660366868972778, "epoch": 1.2065045472518783, "grad_norm": 1.421875, "learning_rate": 0.0004862462367985554, "loss": 5.4295, "mean_token_accuracy": 0.1760703966021538, "num_tokens": 27941782.0, "step": 12205 }, { "entropy": 5.620453786849976, "epoch": 1.2069988137603795, "grad_norm": 1.421875, "learning_rate": 0.0004862340850601214, "loss": 5.3257, "mean_token_accuracy": 0.19191028475761412, "num_tokens": 27951703.0, "step": 12210 }, { "entropy": 5.655619049072266, "epoch": 1.207493080268881, "grad_norm": 1.3359375, "learning_rate": 0.0004862219281252961, "loss": 5.3656, "mean_token_accuracy": 0.18273694962263107, "num_tokens": 27962049.0, "step": 12215 }, { "entropy": 5.675875425338745, "epoch": 1.2079873467773823, "grad_norm": 1.40625, "learning_rate": 0.0004862097659943786, "loss": 5.4074, "mean_token_accuracy": 0.17820671647787095, "num_tokens": 27973502.0, "step": 12220 }, { "entropy": 5.550475168228149, "epoch": 1.2084816132858838, "grad_norm": 1.2734375, "learning_rate": 0.00048619759866766807, "loss": 5.2836, "mean_token_accuracy": 0.18255395740270614, "num_tokens": 27984653.0, "step": 12225 }, { "entropy": 5.638367605209351, "epoch": 1.208975879794385, "grad_norm": 1.4296875, "learning_rate": 0.00048618542614546384, "loss": 5.4858, "mean_token_accuracy": 0.16729370206594468, "num_tokens": 27995152.0, "step": 12230 }, { "entropy": 5.725869369506836, "epoch": 1.2094701463028865, "grad_norm": 1.4375, "learning_rate": 0.00048617324842806545, "loss": 5.5598, "mean_token_accuracy": 0.16973497122526168, "num_tokens": 28006928.0, "step": 12235 }, { "entropy": 5.67096529006958, "epoch": 1.209964412811388, "grad_norm": 1.453125, "learning_rate": 0.00048616106551577226, "loss": 5.3859, "mean_token_accuracy": 0.17552573084831238, "num_tokens": 28018004.0, "step": 12240 }, { "entropy": 5.682720947265625, "epoch": 1.2104586793198893, "grad_norm": 1.2578125, "learning_rate": 0.00048614887740888426, "loss": 5.4847, "mean_token_accuracy": 0.16631695330142976, "num_tokens": 28030645.0, "step": 12245 }, { "entropy": 5.6960653305053714, "epoch": 1.2109529458283907, "grad_norm": 1.5703125, "learning_rate": 0.000486136684107701, "loss": 5.3983, "mean_token_accuracy": 0.18029665350914, "num_tokens": 28042591.0, "step": 12250 }, { "entropy": 5.589819478988647, "epoch": 1.211447212336892, "grad_norm": 1.3515625, "learning_rate": 0.0004861244856125226, "loss": 5.351, "mean_token_accuracy": 0.18234280049800872, "num_tokens": 28053285.0, "step": 12255 }, { "entropy": 5.518368053436279, "epoch": 1.2119414788453935, "grad_norm": 1.546875, "learning_rate": 0.0004861122819236491, "loss": 5.335, "mean_token_accuracy": 0.1806777760386467, "num_tokens": 28065747.0, "step": 12260 }, { "entropy": 5.627572441101075, "epoch": 1.2124357453538948, "grad_norm": 1.375, "learning_rate": 0.00048610007304138067, "loss": 5.3808, "mean_token_accuracy": 0.17638372629880905, "num_tokens": 28077112.0, "step": 12265 }, { "entropy": 5.630892562866211, "epoch": 1.2129300118623962, "grad_norm": 1.65625, "learning_rate": 0.0004860878589660177, "loss": 5.3865, "mean_token_accuracy": 0.18621813058853148, "num_tokens": 28088835.0, "step": 12270 }, { "entropy": 5.733489227294922, "epoch": 1.2134242783708975, "grad_norm": 1.515625, "learning_rate": 0.0004860756396978607, "loss": 5.4748, "mean_token_accuracy": 0.16959445178508759, "num_tokens": 28100921.0, "step": 12275 }, { "entropy": 5.681570243835449, "epoch": 1.213918544879399, "grad_norm": 1.5390625, "learning_rate": 0.0004860634152372102, "loss": 5.3867, "mean_token_accuracy": 0.17884536385536193, "num_tokens": 28112531.0, "step": 12280 }, { "entropy": 5.6841654777526855, "epoch": 1.2144128113879002, "grad_norm": 1.6640625, "learning_rate": 0.0004860511855843669, "loss": 5.4332, "mean_token_accuracy": 0.17698246389627456, "num_tokens": 28123821.0, "step": 12285 }, { "entropy": 5.626000261306762, "epoch": 1.2149070778964017, "grad_norm": 1.7265625, "learning_rate": 0.00048603895073963177, "loss": 5.3761, "mean_token_accuracy": 0.1729662999510765, "num_tokens": 28135046.0, "step": 12290 }, { "entropy": 5.6053605556488035, "epoch": 1.2154013444049032, "grad_norm": 1.3203125, "learning_rate": 0.00048602671070330564, "loss": 5.3832, "mean_token_accuracy": 0.18139130920171737, "num_tokens": 28145870.0, "step": 12295 }, { "entropy": 5.6928201675415036, "epoch": 1.2158956109134045, "grad_norm": 1.5078125, "learning_rate": 0.00048601446547568973, "loss": 5.3982, "mean_token_accuracy": 0.17751380056142807, "num_tokens": 28156078.0, "step": 12300 }, { "entropy": 5.659221839904785, "epoch": 1.216389877421906, "grad_norm": 1.3359375, "learning_rate": 0.0004860022150570852, "loss": 5.3714, "mean_token_accuracy": 0.1776227831840515, "num_tokens": 28166658.0, "step": 12305 }, { "entropy": 5.5944211959838865, "epoch": 1.2168841439304072, "grad_norm": 1.3203125, "learning_rate": 0.00048598995944779344, "loss": 5.4104, "mean_token_accuracy": 0.17678799480199814, "num_tokens": 28178890.0, "step": 12310 }, { "entropy": 5.612985229492187, "epoch": 1.2173784104389087, "grad_norm": 1.2734375, "learning_rate": 0.00048597769864811604, "loss": 5.3727, "mean_token_accuracy": 0.18694625943899154, "num_tokens": 28191101.0, "step": 12315 }, { "entropy": 5.64115424156189, "epoch": 1.21787267694741, "grad_norm": 1.703125, "learning_rate": 0.0004859654326583544, "loss": 5.4669, "mean_token_accuracy": 0.17831785529851912, "num_tokens": 28202877.0, "step": 12320 }, { "entropy": 5.680452442169189, "epoch": 1.2183669434559115, "grad_norm": 1.4453125, "learning_rate": 0.0004859531614788105, "loss": 5.4376, "mean_token_accuracy": 0.1753949835896492, "num_tokens": 28214762.0, "step": 12325 }, { "entropy": 5.682998323440552, "epoch": 1.2188612099644127, "grad_norm": 1.5703125, "learning_rate": 0.000485940885109786, "loss": 5.3839, "mean_token_accuracy": 0.17759552896022796, "num_tokens": 28225830.0, "step": 12330 }, { "entropy": 5.557255125045776, "epoch": 1.2193554764729142, "grad_norm": 1.7421875, "learning_rate": 0.00048592860355158306, "loss": 5.3635, "mean_token_accuracy": 0.18647830337285995, "num_tokens": 28237302.0, "step": 12335 }, { "entropy": 5.612345838546753, "epoch": 1.2198497429814155, "grad_norm": 1.5, "learning_rate": 0.0004859163168045038, "loss": 5.3754, "mean_token_accuracy": 0.1846173033118248, "num_tokens": 28247658.0, "step": 12340 }, { "entropy": 5.613757658004761, "epoch": 1.220344009489917, "grad_norm": 2.078125, "learning_rate": 0.0004859040248688503, "loss": 5.4395, "mean_token_accuracy": 0.1818190962076187, "num_tokens": 28258473.0, "step": 12345 }, { "entropy": 5.741697692871094, "epoch": 1.2208382759984184, "grad_norm": 1.4921875, "learning_rate": 0.00048589172774492515, "loss": 5.5443, "mean_token_accuracy": 0.17012276500463486, "num_tokens": 28270167.0, "step": 12350 }, { "entropy": 5.60206937789917, "epoch": 1.2213325425069197, "grad_norm": 1.375, "learning_rate": 0.00048587942543303075, "loss": 5.3912, "mean_token_accuracy": 0.18306322246789933, "num_tokens": 28282047.0, "step": 12355 }, { "entropy": 5.640376424789428, "epoch": 1.2218268090154212, "grad_norm": 1.8359375, "learning_rate": 0.0004858671179334698, "loss": 5.3562, "mean_token_accuracy": 0.18394216746091843, "num_tokens": 28292868.0, "step": 12360 }, { "entropy": 5.705264711380005, "epoch": 1.2223210755239224, "grad_norm": 1.8359375, "learning_rate": 0.00048585480524654504, "loss": 5.5139, "mean_token_accuracy": 0.1703129768371582, "num_tokens": 28303816.0, "step": 12365 }, { "entropy": 5.7533531665802, "epoch": 1.222815342032424, "grad_norm": 1.59375, "learning_rate": 0.0004858424873725593, "loss": 5.4959, "mean_token_accuracy": 0.17069889158010482, "num_tokens": 28315191.0, "step": 12370 }, { "entropy": 5.669316530227661, "epoch": 1.2233096085409252, "grad_norm": 1.375, "learning_rate": 0.0004858301643118157, "loss": 5.3583, "mean_token_accuracy": 0.18108568489551544, "num_tokens": 28325312.0, "step": 12375 }, { "entropy": 5.642570304870605, "epoch": 1.2238038750494267, "grad_norm": 1.4453125, "learning_rate": 0.0004858178360646174, "loss": 5.4362, "mean_token_accuracy": 0.1718377485871315, "num_tokens": 28336171.0, "step": 12380 }, { "entropy": 5.635008192062378, "epoch": 1.2242981415579282, "grad_norm": 1.4609375, "learning_rate": 0.00048580550263126757, "loss": 5.412, "mean_token_accuracy": 0.16938796043395996, "num_tokens": 28347488.0, "step": 12385 }, { "entropy": 5.6321797370910645, "epoch": 1.2247924080664294, "grad_norm": 1.4921875, "learning_rate": 0.0004857931640120697, "loss": 5.3261, "mean_token_accuracy": 0.18346469849348068, "num_tokens": 28358653.0, "step": 12390 }, { "entropy": 5.619165849685669, "epoch": 1.2252866745749307, "grad_norm": 1.4921875, "learning_rate": 0.00048578082020732724, "loss": 5.3817, "mean_token_accuracy": 0.19016854465007782, "num_tokens": 28369588.0, "step": 12395 }, { "entropy": 5.605570983886719, "epoch": 1.2257809410834322, "grad_norm": 1.453125, "learning_rate": 0.000485768471217344, "loss": 5.3182, "mean_token_accuracy": 0.18049757480621337, "num_tokens": 28382009.0, "step": 12400 }, { "entropy": 5.700220441818237, "epoch": 1.2262752075919336, "grad_norm": 1.546875, "learning_rate": 0.0004857561170424235, "loss": 5.4522, "mean_token_accuracy": 0.17025645822286606, "num_tokens": 28394376.0, "step": 12405 }, { "entropy": 5.66279354095459, "epoch": 1.226769474100435, "grad_norm": 1.8671875, "learning_rate": 0.00048574375768286996, "loss": 5.4606, "mean_token_accuracy": 0.1747723937034607, "num_tokens": 28406453.0, "step": 12410 }, { "entropy": 5.681567859649658, "epoch": 1.2272637406089364, "grad_norm": 1.703125, "learning_rate": 0.00048573139313898723, "loss": 5.4079, "mean_token_accuracy": 0.1819054201245308, "num_tokens": 28417178.0, "step": 12415 }, { "entropy": 5.6706850051879885, "epoch": 1.2277580071174377, "grad_norm": 1.390625, "learning_rate": 0.0004857190234110795, "loss": 5.3876, "mean_token_accuracy": 0.1764465883374214, "num_tokens": 28428396.0, "step": 12420 }, { "entropy": 5.49635157585144, "epoch": 1.2282522736259391, "grad_norm": 1.5234375, "learning_rate": 0.0004857066484994512, "loss": 5.3447, "mean_token_accuracy": 0.18193579614162445, "num_tokens": 28441239.0, "step": 12425 }, { "entropy": 5.7104579448699955, "epoch": 1.2287465401344404, "grad_norm": 1.71875, "learning_rate": 0.0004856942684044067, "loss": 5.5477, "mean_token_accuracy": 0.18025958240032197, "num_tokens": 28453671.0, "step": 12430 }, { "entropy": 5.6799072265625, "epoch": 1.2292408066429419, "grad_norm": 1.4453125, "learning_rate": 0.00048568188312625037, "loss": 5.3981, "mean_token_accuracy": 0.17662502974271774, "num_tokens": 28465922.0, "step": 12435 }, { "entropy": 5.650804281234741, "epoch": 1.2297350731514434, "grad_norm": 1.9140625, "learning_rate": 0.0004856694926652871, "loss": 5.3942, "mean_token_accuracy": 0.17636173516511916, "num_tokens": 28477559.0, "step": 12440 }, { "entropy": 5.637345218658448, "epoch": 1.2302293396599446, "grad_norm": 1.515625, "learning_rate": 0.00048565709702182164, "loss": 5.4299, "mean_token_accuracy": 0.17880400121212006, "num_tokens": 28489276.0, "step": 12445 }, { "entropy": 5.6748137950897215, "epoch": 1.2307236061684461, "grad_norm": 1.6640625, "learning_rate": 0.0004856446961961589, "loss": 5.528, "mean_token_accuracy": 0.17531248331069946, "num_tokens": 28500821.0, "step": 12450 }, { "entropy": 5.658227396011353, "epoch": 1.2312178726769474, "grad_norm": 1.5234375, "learning_rate": 0.00048563229018860394, "loss": 5.4392, "mean_token_accuracy": 0.1774931490421295, "num_tokens": 28513646.0, "step": 12455 }, { "entropy": 5.683524656295776, "epoch": 1.2317121391854489, "grad_norm": 1.5625, "learning_rate": 0.00048561987899946204, "loss": 5.4276, "mean_token_accuracy": 0.1752988278865814, "num_tokens": 28525508.0, "step": 12460 }, { "entropy": 5.7381178855896, "epoch": 1.2322064056939501, "grad_norm": 2.03125, "learning_rate": 0.00048560746262903836, "loss": 5.4302, "mean_token_accuracy": 0.176610304415226, "num_tokens": 28537863.0, "step": 12465 }, { "entropy": 5.599919939041138, "epoch": 1.2327006722024516, "grad_norm": 1.5234375, "learning_rate": 0.0004855950410776385, "loss": 5.4294, "mean_token_accuracy": 0.17595396041870118, "num_tokens": 28550163.0, "step": 12470 }, { "entropy": 5.62755274772644, "epoch": 1.2331949387109529, "grad_norm": 1.2890625, "learning_rate": 0.0004855826143455678, "loss": 5.3184, "mean_token_accuracy": 0.1826096773147583, "num_tokens": 28560501.0, "step": 12475 }, { "entropy": 5.739967250823975, "epoch": 1.2336892052194544, "grad_norm": 2.15625, "learning_rate": 0.0004855701824331323, "loss": 5.4661, "mean_token_accuracy": 0.16783886551856994, "num_tokens": 28573057.0, "step": 12480 }, { "entropy": 5.6555641174316404, "epoch": 1.2341834717279556, "grad_norm": 1.4375, "learning_rate": 0.00048555774534063753, "loss": 5.4591, "mean_token_accuracy": 0.1719682291150093, "num_tokens": 28585147.0, "step": 12485 }, { "entropy": 5.5736206531524655, "epoch": 1.234677738236457, "grad_norm": 1.40625, "learning_rate": 0.0004855453030683896, "loss": 5.4346, "mean_token_accuracy": 0.17766974866390228, "num_tokens": 28597774.0, "step": 12490 }, { "entropy": 5.685682868957519, "epoch": 1.2351720047449586, "grad_norm": 1.390625, "learning_rate": 0.0004855328556166945, "loss": 5.3544, "mean_token_accuracy": 0.18068389743566513, "num_tokens": 28610031.0, "step": 12495 }, { "entropy": 5.687689638137817, "epoch": 1.2356662712534598, "grad_norm": 1.546875, "learning_rate": 0.0004855204029858586, "loss": 5.4209, "mean_token_accuracy": 0.17408981323242187, "num_tokens": 28621485.0, "step": 12500 }, { "entropy": 5.578461313247681, "epoch": 1.2361605377619613, "grad_norm": 1.5, "learning_rate": 0.0004855079451761881, "loss": 5.3359, "mean_token_accuracy": 0.1862749397754669, "num_tokens": 28632213.0, "step": 12505 }, { "entropy": 5.695471096038818, "epoch": 1.2366548042704626, "grad_norm": 1.640625, "learning_rate": 0.0004854954821879894, "loss": 5.5189, "mean_token_accuracy": 0.1741614282131195, "num_tokens": 28643994.0, "step": 12510 }, { "entropy": 5.770418787002564, "epoch": 1.237149070778964, "grad_norm": 1.53125, "learning_rate": 0.00048548301402156927, "loss": 5.4386, "mean_token_accuracy": 0.17961105108261108, "num_tokens": 28656556.0, "step": 12515 }, { "entropy": 5.640476369857788, "epoch": 1.2376433372874653, "grad_norm": 1.484375, "learning_rate": 0.0004854705406772343, "loss": 5.426, "mean_token_accuracy": 0.18069577664136888, "num_tokens": 28668022.0, "step": 12520 }, { "entropy": 5.609474754333496, "epoch": 1.2381376037959668, "grad_norm": 1.4375, "learning_rate": 0.00048545806215529136, "loss": 5.4312, "mean_token_accuracy": 0.1721807077527046, "num_tokens": 28679074.0, "step": 12525 }, { "entropy": 5.630985260009766, "epoch": 1.238631870304468, "grad_norm": 1.1484375, "learning_rate": 0.00048544557845604753, "loss": 5.3557, "mean_token_accuracy": 0.18284886479377746, "num_tokens": 28691872.0, "step": 12530 }, { "entropy": 5.736825895309448, "epoch": 1.2391261368129696, "grad_norm": 1.625, "learning_rate": 0.00048543308957980973, "loss": 5.4639, "mean_token_accuracy": 0.17925804555416108, "num_tokens": 28703367.0, "step": 12535 }, { "entropy": 5.581083488464356, "epoch": 1.2396204033214708, "grad_norm": 1.6171875, "learning_rate": 0.0004854205955268853, "loss": 5.2938, "mean_token_accuracy": 0.18966979831457137, "num_tokens": 28713841.0, "step": 12540 }, { "entropy": 5.617019414901733, "epoch": 1.2401146698299723, "grad_norm": 1.6171875, "learning_rate": 0.00048540809629758167, "loss": 5.4704, "mean_token_accuracy": 0.1692992240190506, "num_tokens": 28724924.0, "step": 12545 }, { "entropy": 5.6759274959564205, "epoch": 1.2406089363384738, "grad_norm": 1.25, "learning_rate": 0.0004853955918922061, "loss": 5.4277, "mean_token_accuracy": 0.17921543270349502, "num_tokens": 28736236.0, "step": 12550 }, { "entropy": 5.70656533241272, "epoch": 1.241103202846975, "grad_norm": 1.4609375, "learning_rate": 0.0004853830823110663, "loss": 5.466, "mean_token_accuracy": 0.1763219028711319, "num_tokens": 28748841.0, "step": 12555 }, { "entropy": 5.610775709152222, "epoch": 1.2415974693554765, "grad_norm": 1.3671875, "learning_rate": 0.0004853705675544702, "loss": 5.3275, "mean_token_accuracy": 0.18271404206752778, "num_tokens": 28759491.0, "step": 12560 }, { "entropy": 5.524050188064575, "epoch": 1.2420917358639778, "grad_norm": 1.3828125, "learning_rate": 0.0004853580476227254, "loss": 5.2976, "mean_token_accuracy": 0.18501685708761215, "num_tokens": 28771668.0, "step": 12565 }, { "entropy": 5.5875575065612795, "epoch": 1.2425860023724793, "grad_norm": 1.5703125, "learning_rate": 0.00048534552251614, "loss": 5.4221, "mean_token_accuracy": 0.17837006449699402, "num_tokens": 28783102.0, "step": 12570 }, { "entropy": 5.6870335102081295, "epoch": 1.2430802688809806, "grad_norm": 1.359375, "learning_rate": 0.00048533299223502217, "loss": 5.4271, "mean_token_accuracy": 0.17940369248390198, "num_tokens": 28794643.0, "step": 12575 }, { "entropy": 5.661948823928833, "epoch": 1.243574535389482, "grad_norm": 1.5703125, "learning_rate": 0.0004853204567796801, "loss": 5.4331, "mean_token_accuracy": 0.17136591374874116, "num_tokens": 28806597.0, "step": 12580 }, { "entropy": 5.632091426849366, "epoch": 1.2440688018979833, "grad_norm": 1.609375, "learning_rate": 0.000485307916150422, "loss": 5.3856, "mean_token_accuracy": 0.17984899282455444, "num_tokens": 28817379.0, "step": 12585 }, { "entropy": 5.621669912338257, "epoch": 1.2445630684064848, "grad_norm": 1.5703125, "learning_rate": 0.0004852953703475567, "loss": 5.3909, "mean_token_accuracy": 0.17360709905624389, "num_tokens": 28828412.0, "step": 12590 }, { "entropy": 5.587964200973511, "epoch": 1.245057334914986, "grad_norm": 1.5234375, "learning_rate": 0.00048528281937139264, "loss": 5.316, "mean_token_accuracy": 0.1840084671974182, "num_tokens": 28839888.0, "step": 12595 }, { "entropy": 5.704300451278686, "epoch": 1.2455516014234875, "grad_norm": 1.5, "learning_rate": 0.00048527026322223854, "loss": 5.4969, "mean_token_accuracy": 0.1701827421784401, "num_tokens": 28852113.0, "step": 12600 }, { "entropy": 5.692036962509155, "epoch": 1.246045867931989, "grad_norm": 1.4765625, "learning_rate": 0.0004852577019004035, "loss": 5.4663, "mean_token_accuracy": 0.17194680720567704, "num_tokens": 28864715.0, "step": 12605 }, { "entropy": 5.597376585006714, "epoch": 1.2465401344404903, "grad_norm": 1.421875, "learning_rate": 0.0004852451354061962, "loss": 5.2876, "mean_token_accuracy": 0.18463059812784194, "num_tokens": 28875166.0, "step": 12610 }, { "entropy": 5.582881498336792, "epoch": 1.2470344009489918, "grad_norm": 1.6875, "learning_rate": 0.00048523256373992604, "loss": 5.3724, "mean_token_accuracy": 0.18343687802553177, "num_tokens": 28885946.0, "step": 12615 }, { "entropy": 5.611480045318603, "epoch": 1.247528667457493, "grad_norm": 1.4140625, "learning_rate": 0.0004852199869019021, "loss": 5.3716, "mean_token_accuracy": 0.17991825491189956, "num_tokens": 28896654.0, "step": 12620 }, { "entropy": 5.6644855499267575, "epoch": 1.2480229339659945, "grad_norm": 1.5390625, "learning_rate": 0.00048520740489243396, "loss": 5.4131, "mean_token_accuracy": 0.17587956190109252, "num_tokens": 28908306.0, "step": 12625 }, { "entropy": 5.675091171264649, "epoch": 1.2485172004744958, "grad_norm": 1.3046875, "learning_rate": 0.00048519481771183107, "loss": 5.4399, "mean_token_accuracy": 0.16886961460113525, "num_tokens": 28921044.0, "step": 12630 }, { "entropy": 5.631007289886474, "epoch": 1.2490114669829973, "grad_norm": 1.8203125, "learning_rate": 0.000485182225360403, "loss": 5.3418, "mean_token_accuracy": 0.18043060451745987, "num_tokens": 28932290.0, "step": 12635 }, { "entropy": 5.658507061004639, "epoch": 1.2495057334914987, "grad_norm": 1.5, "learning_rate": 0.0004851696278384596, "loss": 5.3923, "mean_token_accuracy": 0.18084783405065535, "num_tokens": 28943482.0, "step": 12640 }, { "entropy": 5.562141704559326, "epoch": 1.25, "grad_norm": 1.6015625, "learning_rate": 0.0004851570251463107, "loss": 5.4219, "mean_token_accuracy": 0.1782122403383255, "num_tokens": 28954749.0, "step": 12645 }, { "entropy": 5.720483493804932, "epoch": 1.2504942665085013, "grad_norm": 1.4921875, "learning_rate": 0.00048514441728426646, "loss": 5.4769, "mean_token_accuracy": 0.16636212468147277, "num_tokens": 28965304.0, "step": 12650 }, { "entropy": 5.611703300476075, "epoch": 1.2509885330170027, "grad_norm": 1.3359375, "learning_rate": 0.0004851318042526369, "loss": 5.3448, "mean_token_accuracy": 0.1800813630223274, "num_tokens": 28976267.0, "step": 12655 }, { "entropy": 5.700345659255982, "epoch": 1.2514827995255042, "grad_norm": 1.8203125, "learning_rate": 0.0004851191860517324, "loss": 5.5044, "mean_token_accuracy": 0.17805597186088562, "num_tokens": 28986492.0, "step": 12660 }, { "entropy": 5.684275484085083, "epoch": 1.2519770660340055, "grad_norm": 1.6171875, "learning_rate": 0.00048510656268186325, "loss": 5.3714, "mean_token_accuracy": 0.18066300004720687, "num_tokens": 28996693.0, "step": 12665 }, { "entropy": 5.671869564056396, "epoch": 1.252471332542507, "grad_norm": 1.3671875, "learning_rate": 0.0004850939341433401, "loss": 5.4352, "mean_token_accuracy": 0.1819142982363701, "num_tokens": 29008498.0, "step": 12670 }, { "entropy": 5.69298095703125, "epoch": 1.2529655990510082, "grad_norm": 1.6640625, "learning_rate": 0.00048508130043647366, "loss": 5.511, "mean_token_accuracy": 0.17398120164871217, "num_tokens": 29018563.0, "step": 12675 }, { "entropy": 5.645291996002197, "epoch": 1.2534598655595097, "grad_norm": 1.453125, "learning_rate": 0.0004850686615615745, "loss": 5.3661, "mean_token_accuracy": 0.17985970824956893, "num_tokens": 29029204.0, "step": 12680 }, { "entropy": 5.583032321929932, "epoch": 1.253954132068011, "grad_norm": 1.953125, "learning_rate": 0.00048505601751895383, "loss": 5.3941, "mean_token_accuracy": 0.17486785352230072, "num_tokens": 29041112.0, "step": 12685 }, { "entropy": 5.741714668273926, "epoch": 1.2544483985765125, "grad_norm": 1.59375, "learning_rate": 0.0004850433683089224, "loss": 5.4221, "mean_token_accuracy": 0.17500852644443513, "num_tokens": 29052791.0, "step": 12690 }, { "entropy": 5.679446697235107, "epoch": 1.254942665085014, "grad_norm": 1.5234375, "learning_rate": 0.0004850307139317916, "loss": 5.4684, "mean_token_accuracy": 0.17206247001886368, "num_tokens": 29064525.0, "step": 12695 }, { "entropy": 5.48385853767395, "epoch": 1.2554369315935152, "grad_norm": 1.921875, "learning_rate": 0.0004850180543878726, "loss": 5.3237, "mean_token_accuracy": 0.18715211004018784, "num_tokens": 29077265.0, "step": 12700 }, { "entropy": 5.634773635864258, "epoch": 1.2559311981020165, "grad_norm": 1.703125, "learning_rate": 0.0004850053896774769, "loss": 5.3379, "mean_token_accuracy": 0.18502485603094102, "num_tokens": 29088022.0, "step": 12705 }, { "entropy": 5.730953121185303, "epoch": 1.256425464610518, "grad_norm": 2.328125, "learning_rate": 0.0004849927198009161, "loss": 5.3939, "mean_token_accuracy": 0.17817443013191223, "num_tokens": 29099901.0, "step": 12710 }, { "entropy": 5.64830379486084, "epoch": 1.2569197311190194, "grad_norm": 2.140625, "learning_rate": 0.00048498004475850174, "loss": 5.3882, "mean_token_accuracy": 0.17698948979377746, "num_tokens": 29111249.0, "step": 12715 }, { "entropy": 5.507478952407837, "epoch": 1.2574139976275207, "grad_norm": 1.4453125, "learning_rate": 0.00048496736455054567, "loss": 5.3591, "mean_token_accuracy": 0.18044111728668213, "num_tokens": 29121261.0, "step": 12720 }, { "entropy": 5.656966972351074, "epoch": 1.2579082641360222, "grad_norm": 1.5390625, "learning_rate": 0.00048495467917736003, "loss": 5.5315, "mean_token_accuracy": 0.17606231123208999, "num_tokens": 29133987.0, "step": 12725 }, { "entropy": 5.772422790527344, "epoch": 1.2584025306445235, "grad_norm": 1.9296875, "learning_rate": 0.0004849419886392565, "loss": 5.4321, "mean_token_accuracy": 0.18040544241666795, "num_tokens": 29146499.0, "step": 12730 }, { "entropy": 5.609433269500732, "epoch": 1.258896797153025, "grad_norm": 1.3359375, "learning_rate": 0.0004849292929365476, "loss": 5.3103, "mean_token_accuracy": 0.18331663608551024, "num_tokens": 29157892.0, "step": 12735 }, { "entropy": 5.621004962921143, "epoch": 1.2593910636615262, "grad_norm": 3.875, "learning_rate": 0.0004849165920695455, "loss": 5.4279, "mean_token_accuracy": 0.17835961282253265, "num_tokens": 29169823.0, "step": 12740 }, { "entropy": 5.75237922668457, "epoch": 1.2598853301700277, "grad_norm": 1.5078125, "learning_rate": 0.0004849038860385627, "loss": 5.462, "mean_token_accuracy": 0.1735948607325554, "num_tokens": 29181065.0, "step": 12745 }, { "entropy": 5.64034070968628, "epoch": 1.2603795966785292, "grad_norm": 1.6484375, "learning_rate": 0.0004848911748439117, "loss": 5.3708, "mean_token_accuracy": 0.17959531843662263, "num_tokens": 29192711.0, "step": 12750 }, { "entropy": 5.552733993530273, "epoch": 1.2608738631870304, "grad_norm": 1.546875, "learning_rate": 0.0004848784584859052, "loss": 5.3191, "mean_token_accuracy": 0.18066852986812593, "num_tokens": 29204688.0, "step": 12755 }, { "entropy": 5.566748905181885, "epoch": 1.2613681296955317, "grad_norm": 1.4296875, "learning_rate": 0.0004848657369648561, "loss": 5.366, "mean_token_accuracy": 0.18262538462877273, "num_tokens": 29216326.0, "step": 12760 }, { "entropy": 5.606880521774292, "epoch": 1.2618623962040332, "grad_norm": 1.7734375, "learning_rate": 0.00048485301028107736, "loss": 5.3765, "mean_token_accuracy": 0.184257772564888, "num_tokens": 29226805.0, "step": 12765 }, { "entropy": 5.584829711914063, "epoch": 1.2623566627125347, "grad_norm": 1.5078125, "learning_rate": 0.000484840278434882, "loss": 5.365, "mean_token_accuracy": 0.1775599479675293, "num_tokens": 29239334.0, "step": 12770 }, { "entropy": 5.6800188541412355, "epoch": 1.262850929221036, "grad_norm": 1.71875, "learning_rate": 0.0004848275414265832, "loss": 5.3789, "mean_token_accuracy": 0.1781705290079117, "num_tokens": 29250443.0, "step": 12775 }, { "entropy": 5.594029474258423, "epoch": 1.2633451957295374, "grad_norm": 1.46875, "learning_rate": 0.00048481479925649435, "loss": 5.3356, "mean_token_accuracy": 0.17795343548059464, "num_tokens": 29261209.0, "step": 12780 }, { "entropy": 5.6312315464019775, "epoch": 1.2638394622380387, "grad_norm": 1.6171875, "learning_rate": 0.00048480205192492887, "loss": 5.4764, "mean_token_accuracy": 0.16658923476934434, "num_tokens": 29273761.0, "step": 12785 }, { "entropy": 5.719128370285034, "epoch": 1.2643337287465402, "grad_norm": 1.53125, "learning_rate": 0.0004847892994322004, "loss": 5.4512, "mean_token_accuracy": 0.17355400174856186, "num_tokens": 29285157.0, "step": 12790 }, { "entropy": 5.709945917129517, "epoch": 1.2648279952550414, "grad_norm": 1.671875, "learning_rate": 0.0004847765417786226, "loss": 5.4174, "mean_token_accuracy": 0.177736359834671, "num_tokens": 29295903.0, "step": 12795 }, { "entropy": 5.705383539199829, "epoch": 1.265322261763543, "grad_norm": 1.4765625, "learning_rate": 0.0004847637789645093, "loss": 5.45, "mean_token_accuracy": 0.17303601056337356, "num_tokens": 29307865.0, "step": 12800 }, { "entropy": 5.752659273147583, "epoch": 1.2658165282720444, "grad_norm": 1.515625, "learning_rate": 0.0004847510109901745, "loss": 5.5215, "mean_token_accuracy": 0.16498949825763704, "num_tokens": 29319614.0, "step": 12805 }, { "entropy": 5.637752914428711, "epoch": 1.2663107947805456, "grad_norm": 1.671875, "learning_rate": 0.0004847382378559323, "loss": 5.4065, "mean_token_accuracy": 0.1753526359796524, "num_tokens": 29330306.0, "step": 12810 }, { "entropy": 5.641529321670532, "epoch": 1.2668050612890471, "grad_norm": 1.8515625, "learning_rate": 0.00048472545956209696, "loss": 5.3708, "mean_token_accuracy": 0.18000748455524446, "num_tokens": 29341611.0, "step": 12815 }, { "entropy": 5.605336093902588, "epoch": 1.2672993277975484, "grad_norm": 1.46875, "learning_rate": 0.0004847126761089827, "loss": 5.3085, "mean_token_accuracy": 0.18791087716817856, "num_tokens": 29353481.0, "step": 12820 }, { "entropy": 5.60109224319458, "epoch": 1.2677935943060499, "grad_norm": 1.265625, "learning_rate": 0.0004846998874969041, "loss": 5.2939, "mean_token_accuracy": 0.18456100970506667, "num_tokens": 29365388.0, "step": 12825 }, { "entropy": 5.681017684936523, "epoch": 1.2682878608145511, "grad_norm": 1.4453125, "learning_rate": 0.0004846870937261758, "loss": 5.4539, "mean_token_accuracy": 0.16939304769039154, "num_tokens": 29377805.0, "step": 12830 }, { "entropy": 5.595469951629639, "epoch": 1.2687821273230526, "grad_norm": 1.546875, "learning_rate": 0.00048467429479711233, "loss": 5.3411, "mean_token_accuracy": 0.18266978710889817, "num_tokens": 29389736.0, "step": 12835 }, { "entropy": 5.592105388641357, "epoch": 1.269276393831554, "grad_norm": 1.6328125, "learning_rate": 0.00048466149071002876, "loss": 5.3381, "mean_token_accuracy": 0.1925693854689598, "num_tokens": 29401256.0, "step": 12840 }, { "entropy": 5.6697304248809814, "epoch": 1.2697706603400554, "grad_norm": 1.2890625, "learning_rate": 0.00048464868146524, "loss": 5.3749, "mean_token_accuracy": 0.17923028022050858, "num_tokens": 29413287.0, "step": 12845 }, { "entropy": 5.653916311264038, "epoch": 1.2702649268485566, "grad_norm": 1.7890625, "learning_rate": 0.00048463586706306113, "loss": 5.4282, "mean_token_accuracy": 0.17880818396806716, "num_tokens": 29424151.0, "step": 12850 }, { "entropy": 5.658403825759888, "epoch": 1.2707591933570581, "grad_norm": 1.640625, "learning_rate": 0.0004846230475038074, "loss": 5.3897, "mean_token_accuracy": 0.17668010145425797, "num_tokens": 29435006.0, "step": 12855 }, { "entropy": 5.588736152648925, "epoch": 1.2712534598655596, "grad_norm": 1.5703125, "learning_rate": 0.0004846102227877942, "loss": 5.39, "mean_token_accuracy": 0.18401414453983306, "num_tokens": 29446453.0, "step": 12860 }, { "entropy": 5.690087890625, "epoch": 1.2717477263740609, "grad_norm": 1.734375, "learning_rate": 0.00048459739291533706, "loss": 5.4515, "mean_token_accuracy": 0.17386644184589387, "num_tokens": 29458468.0, "step": 12865 }, { "entropy": 5.7500592231750485, "epoch": 1.2722419928825623, "grad_norm": 1.6796875, "learning_rate": 0.0004845845578867514, "loss": 5.4968, "mean_token_accuracy": 0.1727755606174469, "num_tokens": 29471167.0, "step": 12870 }, { "entropy": 5.658725786209106, "epoch": 1.2727362593910636, "grad_norm": 1.640625, "learning_rate": 0.00048457171770235327, "loss": 5.4108, "mean_token_accuracy": 0.1813260719180107, "num_tokens": 29482668.0, "step": 12875 }, { "entropy": 5.689535808563233, "epoch": 1.273230525899565, "grad_norm": 1.6953125, "learning_rate": 0.0004845588723624582, "loss": 5.4646, "mean_token_accuracy": 0.17666347622871398, "num_tokens": 29495424.0, "step": 12880 }, { "entropy": 5.6919396877288815, "epoch": 1.2737247924080664, "grad_norm": 2.546875, "learning_rate": 0.0004845460218673825, "loss": 5.461, "mean_token_accuracy": 0.17963027060031891, "num_tokens": 29508388.0, "step": 12885 }, { "entropy": 5.630347633361817, "epoch": 1.2742190589165678, "grad_norm": 1.6875, "learning_rate": 0.0004845331662174421, "loss": 5.3609, "mean_token_accuracy": 0.18002698421478272, "num_tokens": 29519884.0, "step": 12890 }, { "entropy": 5.687825918197632, "epoch": 1.2747133254250693, "grad_norm": 1.6640625, "learning_rate": 0.0004845203054129533, "loss": 5.5531, "mean_token_accuracy": 0.16874832510948182, "num_tokens": 29532398.0, "step": 12895 }, { "entropy": 5.671998405456543, "epoch": 1.2752075919335706, "grad_norm": 1.7890625, "learning_rate": 0.00048450743945423246, "loss": 5.4333, "mean_token_accuracy": 0.18099327236413956, "num_tokens": 29544394.0, "step": 12900 }, { "entropy": 5.70644359588623, "epoch": 1.2757018584420718, "grad_norm": 1.6328125, "learning_rate": 0.0004844945683415961, "loss": 5.4868, "mean_token_accuracy": 0.17671926468610763, "num_tokens": 29555027.0, "step": 12905 }, { "entropy": 5.665847635269165, "epoch": 1.2761961249505733, "grad_norm": 1.3828125, "learning_rate": 0.000484481692075361, "loss": 5.4197, "mean_token_accuracy": 0.17745458632707595, "num_tokens": 29567386.0, "step": 12910 }, { "entropy": 5.733074712753296, "epoch": 1.2766903914590748, "grad_norm": 1.515625, "learning_rate": 0.00048446881065584367, "loss": 5.5363, "mean_token_accuracy": 0.1666639506816864, "num_tokens": 29577832.0, "step": 12915 }, { "entropy": 5.601913690567017, "epoch": 1.277184657967576, "grad_norm": 1.4296875, "learning_rate": 0.00048445592408336106, "loss": 5.3305, "mean_token_accuracy": 0.1860379919409752, "num_tokens": 29590163.0, "step": 12920 }, { "entropy": 5.672854566574097, "epoch": 1.2776789244760776, "grad_norm": 1.46875, "learning_rate": 0.00048444303235823023, "loss": 5.3663, "mean_token_accuracy": 0.1835150256752968, "num_tokens": 29601531.0, "step": 12925 }, { "entropy": 5.674741649627686, "epoch": 1.2781731909845788, "grad_norm": 1.4921875, "learning_rate": 0.0004844301354807683, "loss": 5.4555, "mean_token_accuracy": 0.17768363654613495, "num_tokens": 29612417.0, "step": 12930 }, { "entropy": 5.703456687927246, "epoch": 1.2786674574930803, "grad_norm": 1.359375, "learning_rate": 0.00048441723345129265, "loss": 5.4721, "mean_token_accuracy": 0.17694191187620162, "num_tokens": 29622087.0, "step": 12935 }, { "entropy": 5.780738687515258, "epoch": 1.2791617240015816, "grad_norm": 1.515625, "learning_rate": 0.0004844043262701205, "loss": 5.5177, "mean_token_accuracy": 0.17039716243743896, "num_tokens": 29633564.0, "step": 12940 }, { "entropy": 5.580569744110107, "epoch": 1.279655990510083, "grad_norm": 1.7265625, "learning_rate": 0.0004843914139375695, "loss": 5.3708, "mean_token_accuracy": 0.18296968638896943, "num_tokens": 29644626.0, "step": 12945 }, { "entropy": 5.5537426471710205, "epoch": 1.2801502570185845, "grad_norm": 1.484375, "learning_rate": 0.00048437849645395714, "loss": 5.3422, "mean_token_accuracy": 0.18308935314416885, "num_tokens": 29655587.0, "step": 12950 }, { "entropy": 5.691879844665527, "epoch": 1.2806445235270858, "grad_norm": 2.109375, "learning_rate": 0.0004843655738196013, "loss": 5.3843, "mean_token_accuracy": 0.1844848096370697, "num_tokens": 29665067.0, "step": 12955 }, { "entropy": 5.70751805305481, "epoch": 1.281138790035587, "grad_norm": 1.8984375, "learning_rate": 0.0004843526460348199, "loss": 5.373, "mean_token_accuracy": 0.1804453819990158, "num_tokens": 29676663.0, "step": 12960 }, { "entropy": 5.522183752059936, "epoch": 1.2816330565440885, "grad_norm": 1.296875, "learning_rate": 0.0004843397130999309, "loss": 5.3273, "mean_token_accuracy": 0.18253915756940842, "num_tokens": 29688242.0, "step": 12965 }, { "entropy": 5.678976202011109, "epoch": 1.28212732305259, "grad_norm": 1.3671875, "learning_rate": 0.00048432677501525253, "loss": 5.4461, "mean_token_accuracy": 0.16873905509710313, "num_tokens": 29699184.0, "step": 12970 }, { "entropy": 5.613884782791137, "epoch": 1.2826215895610913, "grad_norm": 1.703125, "learning_rate": 0.000484313831781103, "loss": 5.3743, "mean_token_accuracy": 0.17882349491119384, "num_tokens": 29709610.0, "step": 12975 }, { "entropy": 5.573097181320191, "epoch": 1.2831158560695928, "grad_norm": 1.5, "learning_rate": 0.0004843008833978007, "loss": 5.3236, "mean_token_accuracy": 0.1840164691209793, "num_tokens": 29720359.0, "step": 12980 }, { "entropy": 5.6951256275177, "epoch": 1.283610122578094, "grad_norm": 1.359375, "learning_rate": 0.00048428792986566425, "loss": 5.5031, "mean_token_accuracy": 0.1707326963543892, "num_tokens": 29732411.0, "step": 12985 }, { "entropy": 5.68478479385376, "epoch": 1.2841043890865955, "grad_norm": 2.171875, "learning_rate": 0.0004842749711850122, "loss": 5.2516, "mean_token_accuracy": 0.19107532799243926, "num_tokens": 29743394.0, "step": 12990 }, { "entropy": 5.639246797561645, "epoch": 1.2845986555950968, "grad_norm": 1.7109375, "learning_rate": 0.00048426200735616343, "loss": 5.4283, "mean_token_accuracy": 0.17719055712223053, "num_tokens": 29754798.0, "step": 12995 }, { "entropy": 5.648987913131714, "epoch": 1.2850929221035983, "grad_norm": 1.546875, "learning_rate": 0.0004842490383794368, "loss": 5.4049, "mean_token_accuracy": 0.18132104277610778, "num_tokens": 29767891.0, "step": 13000 }, { "entropy": 5.588558721542358, "epoch": 1.2855871886120998, "grad_norm": 1.46875, "learning_rate": 0.00048423606425515136, "loss": 5.2791, "mean_token_accuracy": 0.18616220355033875, "num_tokens": 29780264.0, "step": 13005 }, { "entropy": 5.65120644569397, "epoch": 1.286081455120601, "grad_norm": 1.3515625, "learning_rate": 0.00048422308498362635, "loss": 5.4696, "mean_token_accuracy": 0.17653971463441848, "num_tokens": 29792184.0, "step": 13010 }, { "entropy": 5.647147989273071, "epoch": 1.2865757216291023, "grad_norm": 1.3671875, "learning_rate": 0.0004842101005651809, "loss": 5.3701, "mean_token_accuracy": 0.17719782441854476, "num_tokens": 29802651.0, "step": 13015 }, { "entropy": 5.607454633712768, "epoch": 1.2870699881376038, "grad_norm": 1.40625, "learning_rate": 0.0004841971110001346, "loss": 5.3772, "mean_token_accuracy": 0.1856875702738762, "num_tokens": 29814172.0, "step": 13020 }, { "entropy": 5.711566686630249, "epoch": 1.2875642546461052, "grad_norm": 1.4375, "learning_rate": 0.00048418411628880684, "loss": 5.4764, "mean_token_accuracy": 0.171826508641243, "num_tokens": 29826636.0, "step": 13025 }, { "entropy": 5.603142166137696, "epoch": 1.2880585211546065, "grad_norm": 1.4609375, "learning_rate": 0.0004841711164315174, "loss": 5.3736, "mean_token_accuracy": 0.17839546054601668, "num_tokens": 29838532.0, "step": 13030 }, { "entropy": 5.600117206573486, "epoch": 1.288552787663108, "grad_norm": 1.1796875, "learning_rate": 0.000484158111428586, "loss": 5.3632, "mean_token_accuracy": 0.18144417703151702, "num_tokens": 29849889.0, "step": 13035 }, { "entropy": 5.745006275177002, "epoch": 1.2890470541716093, "grad_norm": 1.2109375, "learning_rate": 0.00048414510128033265, "loss": 5.4663, "mean_token_accuracy": 0.1679910659790039, "num_tokens": 29860856.0, "step": 13040 }, { "entropy": 5.638733720779419, "epoch": 1.2895413206801107, "grad_norm": 1.4375, "learning_rate": 0.0004841320859870774, "loss": 5.3746, "mean_token_accuracy": 0.18261008709669113, "num_tokens": 29871921.0, "step": 13045 }, { "entropy": 5.5799013614654545, "epoch": 1.290035587188612, "grad_norm": 1.28125, "learning_rate": 0.00048411906554914037, "loss": 5.3832, "mean_token_accuracy": 0.1773080348968506, "num_tokens": 29883410.0, "step": 13050 }, { "entropy": 5.750530576705932, "epoch": 1.2905298536971135, "grad_norm": 1.4921875, "learning_rate": 0.00048410603996684184, "loss": 5.5035, "mean_token_accuracy": 0.17208611369132995, "num_tokens": 29895640.0, "step": 13055 }, { "entropy": 5.629776525497436, "epoch": 1.291024120205615, "grad_norm": 1.59375, "learning_rate": 0.0004840930092405023, "loss": 5.3102, "mean_token_accuracy": 0.18957563042640685, "num_tokens": 29907797.0, "step": 13060 }, { "entropy": 5.530115270614624, "epoch": 1.2915183867141162, "grad_norm": 1.4921875, "learning_rate": 0.00048407997337044235, "loss": 5.3943, "mean_token_accuracy": 0.18360997438430787, "num_tokens": 29919085.0, "step": 13065 }, { "entropy": 5.658555698394776, "epoch": 1.2920126532226177, "grad_norm": 1.46875, "learning_rate": 0.0004840669323569826, "loss": 5.4169, "mean_token_accuracy": 0.17061354964971542, "num_tokens": 29930658.0, "step": 13070 }, { "entropy": 5.692487525939941, "epoch": 1.292506919731119, "grad_norm": 1.5625, "learning_rate": 0.00048405388620044383, "loss": 5.3639, "mean_token_accuracy": 0.1829603925347328, "num_tokens": 29942550.0, "step": 13075 }, { "entropy": 5.569294452667236, "epoch": 1.2930011862396205, "grad_norm": 1.6015625, "learning_rate": 0.0004840408349011471, "loss": 5.3512, "mean_token_accuracy": 0.1800552323460579, "num_tokens": 29953600.0, "step": 13080 }, { "entropy": 5.6464011669158936, "epoch": 1.2934954527481217, "grad_norm": 1.4921875, "learning_rate": 0.0004840277784594133, "loss": 5.368, "mean_token_accuracy": 0.18142091184854509, "num_tokens": 29965694.0, "step": 13085 }, { "entropy": 5.645879220962525, "epoch": 1.2939897192566232, "grad_norm": 1.3671875, "learning_rate": 0.0004840147168755638, "loss": 5.3797, "mean_token_accuracy": 0.18047715574502946, "num_tokens": 29977216.0, "step": 13090 }, { "entropy": 5.55439863204956, "epoch": 1.2944839857651247, "grad_norm": 1.5078125, "learning_rate": 0.0004840016501499198, "loss": 5.2762, "mean_token_accuracy": 0.18975744545459747, "num_tokens": 29988036.0, "step": 13095 }, { "entropy": 5.681125593185425, "epoch": 1.294978252273626, "grad_norm": 1.46875, "learning_rate": 0.00048398857828280286, "loss": 5.4432, "mean_token_accuracy": 0.1805913582444191, "num_tokens": 30000711.0, "step": 13100 }, { "entropy": 5.695340204238891, "epoch": 1.2954725187821272, "grad_norm": 1.328125, "learning_rate": 0.00048397550127453445, "loss": 5.4626, "mean_token_accuracy": 0.17566647827625276, "num_tokens": 30013607.0, "step": 13105 }, { "entropy": 5.6256498336792, "epoch": 1.2959667852906287, "grad_norm": 1.5390625, "learning_rate": 0.0004839624191254362, "loss": 5.3773, "mean_token_accuracy": 0.178213170170784, "num_tokens": 30024375.0, "step": 13110 }, { "entropy": 5.620825958251953, "epoch": 1.2964610517991302, "grad_norm": 1.3515625, "learning_rate": 0.00048394933183583004, "loss": 5.424, "mean_token_accuracy": 0.1755230352282524, "num_tokens": 30035476.0, "step": 13115 }, { "entropy": 5.6692657470703125, "epoch": 1.2969553183076314, "grad_norm": 1.5703125, "learning_rate": 0.000483936239406038, "loss": 5.4222, "mean_token_accuracy": 0.17723745703697205, "num_tokens": 30047193.0, "step": 13120 }, { "entropy": 5.735631275177002, "epoch": 1.297449584816133, "grad_norm": 2.921875, "learning_rate": 0.000483923141836382, "loss": 5.4347, "mean_token_accuracy": 0.17823024243116378, "num_tokens": 30059873.0, "step": 13125 }, { "entropy": 5.679801034927368, "epoch": 1.2979438513246342, "grad_norm": 1.46875, "learning_rate": 0.0004839100391271843, "loss": 5.4182, "mean_token_accuracy": 0.17939580380916595, "num_tokens": 30071318.0, "step": 13130 }, { "entropy": 5.5987104892730715, "epoch": 1.2984381178331357, "grad_norm": 1.4296875, "learning_rate": 0.0004838969312787672, "loss": 5.3939, "mean_token_accuracy": 0.18115571439266204, "num_tokens": 30082750.0, "step": 13135 }, { "entropy": 5.632969570159912, "epoch": 1.298932384341637, "grad_norm": 1.5, "learning_rate": 0.0004838838182914532, "loss": 5.4, "mean_token_accuracy": 0.17292409688234328, "num_tokens": 30093730.0, "step": 13140 }, { "entropy": 5.715986251831055, "epoch": 1.2994266508501384, "grad_norm": 1.6171875, "learning_rate": 0.0004838707001655649, "loss": 5.4078, "mean_token_accuracy": 0.18056964725255967, "num_tokens": 30104776.0, "step": 13145 }, { "entropy": 5.558435106277466, "epoch": 1.29992091735864, "grad_norm": 1.3203125, "learning_rate": 0.0004838575769014249, "loss": 5.2964, "mean_token_accuracy": 0.18821469694375992, "num_tokens": 30115110.0, "step": 13150 }, { "entropy": 5.619421100616455, "epoch": 1.3004151838671412, "grad_norm": 1.421875, "learning_rate": 0.0004838444484993562, "loss": 5.3691, "mean_token_accuracy": 0.18099021315574645, "num_tokens": 30126678.0, "step": 13155 }, { "entropy": 5.6659797668457035, "epoch": 1.3009094503756424, "grad_norm": 1.5, "learning_rate": 0.00048383131495968165, "loss": 5.3447, "mean_token_accuracy": 0.17956814169883728, "num_tokens": 30137703.0, "step": 13160 }, { "entropy": 5.579706239700317, "epoch": 1.301403716884144, "grad_norm": 1.7421875, "learning_rate": 0.00048381817628272427, "loss": 5.4064, "mean_token_accuracy": 0.17738770693540573, "num_tokens": 30147624.0, "step": 13165 }, { "entropy": 5.613440656661988, "epoch": 1.3018979833926454, "grad_norm": 1.5, "learning_rate": 0.0004838050324688074, "loss": 5.3454, "mean_token_accuracy": 0.18368444889783858, "num_tokens": 30158863.0, "step": 13170 }, { "entropy": 5.64213981628418, "epoch": 1.3023922499011467, "grad_norm": 1.4765625, "learning_rate": 0.0004837918835182544, "loss": 5.3858, "mean_token_accuracy": 0.1810169920325279, "num_tokens": 30170876.0, "step": 13175 }, { "entropy": 5.606496524810791, "epoch": 1.3028865164096481, "grad_norm": 1.8046875, "learning_rate": 0.0004837787294313886, "loss": 5.3255, "mean_token_accuracy": 0.1836916372179985, "num_tokens": 30182267.0, "step": 13180 }, { "entropy": 5.632263326644898, "epoch": 1.3033807829181494, "grad_norm": 1.390625, "learning_rate": 0.0004837655702085337, "loss": 5.4063, "mean_token_accuracy": 0.1785965159535408, "num_tokens": 30193572.0, "step": 13185 }, { "entropy": 5.615349769592285, "epoch": 1.303875049426651, "grad_norm": 1.5390625, "learning_rate": 0.0004837524058500134, "loss": 5.3248, "mean_token_accuracy": 0.18587929308414458, "num_tokens": 30206341.0, "step": 13190 }, { "entropy": 5.663844728469849, "epoch": 1.3043693159351522, "grad_norm": 1.4140625, "learning_rate": 0.00048373923635615146, "loss": 5.4009, "mean_token_accuracy": 0.17908063381910325, "num_tokens": 30216067.0, "step": 13195 }, { "entropy": 5.630838346481323, "epoch": 1.3048635824436536, "grad_norm": 1.3203125, "learning_rate": 0.00048372606172727197, "loss": 5.4723, "mean_token_accuracy": 0.17101092785596847, "num_tokens": 30227033.0, "step": 13200 }, { "entropy": 5.700982999801636, "epoch": 1.3053578489521551, "grad_norm": 1.4609375, "learning_rate": 0.000483712881963699, "loss": 5.4258, "mean_token_accuracy": 0.1803620934486389, "num_tokens": 30238766.0, "step": 13205 }, { "entropy": 5.660584402084351, "epoch": 1.3058521154606564, "grad_norm": 1.4140625, "learning_rate": 0.00048369969706575666, "loss": 5.4746, "mean_token_accuracy": 0.17368588596582413, "num_tokens": 30250180.0, "step": 13210 }, { "entropy": 5.590638971328735, "epoch": 1.3063463819691576, "grad_norm": 1.25, "learning_rate": 0.00048368650703376956, "loss": 5.274, "mean_token_accuracy": 0.19140132665634155, "num_tokens": 30260704.0, "step": 13215 }, { "entropy": 5.59091215133667, "epoch": 1.3068406484776591, "grad_norm": 1.2890625, "learning_rate": 0.0004836733118680619, "loss": 5.3594, "mean_token_accuracy": 0.18530572801828385, "num_tokens": 30273547.0, "step": 13220 }, { "entropy": 5.605325078964233, "epoch": 1.3073349149861606, "grad_norm": 1.2421875, "learning_rate": 0.0004836601115689584, "loss": 5.3659, "mean_token_accuracy": 0.17476717978715897, "num_tokens": 30284872.0, "step": 13225 }, { "entropy": 5.570671653747558, "epoch": 1.3078291814946619, "grad_norm": 1.390625, "learning_rate": 0.0004836469061367838, "loss": 5.399, "mean_token_accuracy": 0.17890868335962296, "num_tokens": 30296768.0, "step": 13230 }, { "entropy": 5.591505002975464, "epoch": 1.3083234480031634, "grad_norm": 1.3359375, "learning_rate": 0.00048363369557186293, "loss": 5.3012, "mean_token_accuracy": 0.18937211483716965, "num_tokens": 30308307.0, "step": 13235 }, { "entropy": 5.722180032730103, "epoch": 1.3088177145116646, "grad_norm": 1.2734375, "learning_rate": 0.00048362047987452085, "loss": 5.3935, "mean_token_accuracy": 0.17431413680315017, "num_tokens": 30318987.0, "step": 13240 }, { "entropy": 5.643228530883789, "epoch": 1.309311981020166, "grad_norm": 1.3828125, "learning_rate": 0.0004836072590450825, "loss": 5.4181, "mean_token_accuracy": 0.1802129030227661, "num_tokens": 30330401.0, "step": 13245 }, { "entropy": 5.645843267440796, "epoch": 1.3098062475286674, "grad_norm": 1.40625, "learning_rate": 0.00048359403308387327, "loss": 5.3463, "mean_token_accuracy": 0.1787939503788948, "num_tokens": 30341485.0, "step": 13250 }, { "entropy": 5.693995666503906, "epoch": 1.3103005140371689, "grad_norm": 1.6328125, "learning_rate": 0.00048358080199121845, "loss": 5.4316, "mean_token_accuracy": 0.1705599918961525, "num_tokens": 30352854.0, "step": 13255 }, { "entropy": 5.679081201553345, "epoch": 1.3107947805456703, "grad_norm": 1.4921875, "learning_rate": 0.00048356756576744354, "loss": 5.4305, "mean_token_accuracy": 0.178836627304554, "num_tokens": 30363944.0, "step": 13260 }, { "entropy": 5.6488221168518065, "epoch": 1.3112890470541716, "grad_norm": 1.59375, "learning_rate": 0.0004835543244128742, "loss": 5.4293, "mean_token_accuracy": 0.1715848907828331, "num_tokens": 30375678.0, "step": 13265 }, { "entropy": 5.635829257965088, "epoch": 1.3117833135626729, "grad_norm": 1.3046875, "learning_rate": 0.0004835410779278361, "loss": 5.407, "mean_token_accuracy": 0.18080176115036012, "num_tokens": 30387206.0, "step": 13270 }, { "entropy": 5.642653369903565, "epoch": 1.3122775800711743, "grad_norm": 1.7421875, "learning_rate": 0.0004835278263126551, "loss": 5.4147, "mean_token_accuracy": 0.1762957602739334, "num_tokens": 30398769.0, "step": 13275 }, { "entropy": 5.664876508712768, "epoch": 1.3127718465796758, "grad_norm": 1.5703125, "learning_rate": 0.0004835145695676572, "loss": 5.3668, "mean_token_accuracy": 0.18843472748994827, "num_tokens": 30409626.0, "step": 13280 }, { "entropy": 5.629417657852173, "epoch": 1.313266113088177, "grad_norm": 1.453125, "learning_rate": 0.0004835013076931686, "loss": 5.3782, "mean_token_accuracy": 0.17804671674966813, "num_tokens": 30421142.0, "step": 13285 }, { "entropy": 5.59480242729187, "epoch": 1.3137603795966786, "grad_norm": 1.3203125, "learning_rate": 0.00048348804068951547, "loss": 5.2425, "mean_token_accuracy": 0.1974676877260208, "num_tokens": 30430438.0, "step": 13290 }, { "entropy": 5.644433116912841, "epoch": 1.3142546461051798, "grad_norm": 1.1953125, "learning_rate": 0.00048347476855702413, "loss": 5.4122, "mean_token_accuracy": 0.17402077913284303, "num_tokens": 30442351.0, "step": 13295 }, { "entropy": 5.6162878513336185, "epoch": 1.3147489126136813, "grad_norm": 1.3671875, "learning_rate": 0.00048346149129602125, "loss": 5.444, "mean_token_accuracy": 0.1723179340362549, "num_tokens": 30454987.0, "step": 13300 }, { "entropy": 5.59311089515686, "epoch": 1.3152431791221826, "grad_norm": 1.5390625, "learning_rate": 0.00048344820890683333, "loss": 5.3345, "mean_token_accuracy": 0.18361980020999907, "num_tokens": 30466186.0, "step": 13305 }, { "entropy": 5.6795103549957275, "epoch": 1.315737445630684, "grad_norm": 1.359375, "learning_rate": 0.00048343492138978704, "loss": 5.4492, "mean_token_accuracy": 0.17615232169628142, "num_tokens": 30477944.0, "step": 13310 }, { "entropy": 5.65897126197815, "epoch": 1.3162317121391856, "grad_norm": 1.3828125, "learning_rate": 0.0004834216287452094, "loss": 5.3699, "mean_token_accuracy": 0.18468839526176453, "num_tokens": 30489922.0, "step": 13315 }, { "entropy": 5.608570003509522, "epoch": 1.3167259786476868, "grad_norm": 1.2109375, "learning_rate": 0.0004834083309734274, "loss": 5.3909, "mean_token_accuracy": 0.18573866486549379, "num_tokens": 30501739.0, "step": 13320 }, { "entropy": 5.702604866027832, "epoch": 1.3172202451561883, "grad_norm": 1.4140625, "learning_rate": 0.0004833950280747681, "loss": 5.4557, "mean_token_accuracy": 0.1728788986802101, "num_tokens": 30512213.0, "step": 13325 }, { "entropy": 5.69100136756897, "epoch": 1.3177145116646896, "grad_norm": 1.3828125, "learning_rate": 0.0004833817200495588, "loss": 5.3906, "mean_token_accuracy": 0.17468763142824173, "num_tokens": 30524300.0, "step": 13330 }, { "entropy": 5.623618125915527, "epoch": 1.318208778173191, "grad_norm": 1.4765625, "learning_rate": 0.00048336840689812676, "loss": 5.4309, "mean_token_accuracy": 0.17311019748449324, "num_tokens": 30536137.0, "step": 13335 }, { "entropy": 5.611327219009399, "epoch": 1.3187030446816923, "grad_norm": 1.4375, "learning_rate": 0.00048335508862079975, "loss": 5.3965, "mean_token_accuracy": 0.1716880276799202, "num_tokens": 30548657.0, "step": 13340 }, { "entropy": 5.6862232208251955, "epoch": 1.3191973111901938, "grad_norm": 1.421875, "learning_rate": 0.00048334176521790513, "loss": 5.4205, "mean_token_accuracy": 0.17718607038259507, "num_tokens": 30560274.0, "step": 13345 }, { "entropy": 5.574866247177124, "epoch": 1.3196915776986953, "grad_norm": 1.2421875, "learning_rate": 0.0004833284366897707, "loss": 5.2735, "mean_token_accuracy": 0.18969914615154265, "num_tokens": 30571026.0, "step": 13350 }, { "entropy": 5.578272104263306, "epoch": 1.3201858442071965, "grad_norm": 1.578125, "learning_rate": 0.00048331510303672456, "loss": 5.2936, "mean_token_accuracy": 0.18864040672779084, "num_tokens": 30582210.0, "step": 13355 }, { "entropy": 5.644514846801758, "epoch": 1.3206801107156978, "grad_norm": 1.28125, "learning_rate": 0.0004833017642590945, "loss": 5.4444, "mean_token_accuracy": 0.17006874233484268, "num_tokens": 30594049.0, "step": 13360 }, { "entropy": 5.675704860687256, "epoch": 1.3211743772241993, "grad_norm": 1.6171875, "learning_rate": 0.00048328842035720863, "loss": 5.398, "mean_token_accuracy": 0.17326983362436293, "num_tokens": 30604713.0, "step": 13365 }, { "entropy": 5.597809505462647, "epoch": 1.3216686437327008, "grad_norm": 1.3828125, "learning_rate": 0.0004832750713313954, "loss": 5.3361, "mean_token_accuracy": 0.17634675949811934, "num_tokens": 30615906.0, "step": 13370 }, { "entropy": 5.643567705154419, "epoch": 1.322162910241202, "grad_norm": 1.359375, "learning_rate": 0.00048326171718198315, "loss": 5.4583, "mean_token_accuracy": 0.17781806215643883, "num_tokens": 30628191.0, "step": 13375 }, { "entropy": 5.679811906814575, "epoch": 1.3226571767497035, "grad_norm": 1.2734375, "learning_rate": 0.00048324835790930027, "loss": 5.4629, "mean_token_accuracy": 0.17555269449949265, "num_tokens": 30640667.0, "step": 13380 }, { "entropy": 5.63090705871582, "epoch": 1.3231514432582048, "grad_norm": 2.84375, "learning_rate": 0.0004832349935136755, "loss": 5.4278, "mean_token_accuracy": 0.17625583261251448, "num_tokens": 30651779.0, "step": 13385 }, { "entropy": 5.5488059520721436, "epoch": 1.3236457097667063, "grad_norm": 1.3671875, "learning_rate": 0.0004832216239954376, "loss": 5.2572, "mean_token_accuracy": 0.19061069041490555, "num_tokens": 30662396.0, "step": 13390 }, { "entropy": 5.62912073135376, "epoch": 1.3241399762752075, "grad_norm": 1.421875, "learning_rate": 0.0004832082493549154, "loss": 5.3982, "mean_token_accuracy": 0.1802899122238159, "num_tokens": 30674476.0, "step": 13395 }, { "entropy": 5.6277824401855465, "epoch": 1.324634242783709, "grad_norm": 1.515625, "learning_rate": 0.0004831948695924381, "loss": 5.3869, "mean_token_accuracy": 0.18105309307575226, "num_tokens": 30687417.0, "step": 13400 }, { "entropy": 5.647561931610108, "epoch": 1.3251285092922105, "grad_norm": 1.3671875, "learning_rate": 0.0004831814847083346, "loss": 5.4238, "mean_token_accuracy": 0.17972079813480377, "num_tokens": 30698925.0, "step": 13405 }, { "entropy": 5.659072542190552, "epoch": 1.3256227758007118, "grad_norm": 1.5390625, "learning_rate": 0.00048316809470293426, "loss": 5.4237, "mean_token_accuracy": 0.17830995619297027, "num_tokens": 30711237.0, "step": 13410 }, { "entropy": 5.6586585521698, "epoch": 1.326117042309213, "grad_norm": 1.625, "learning_rate": 0.00048315469957656656, "loss": 5.4432, "mean_token_accuracy": 0.17360139042139053, "num_tokens": 30721900.0, "step": 13415 }, { "entropy": 5.680593538284302, "epoch": 1.3266113088177145, "grad_norm": 1.4296875, "learning_rate": 0.0004831412993295609, "loss": 5.3856, "mean_token_accuracy": 0.17664714008569718, "num_tokens": 30734738.0, "step": 13420 }, { "entropy": 5.645633602142334, "epoch": 1.327105575326216, "grad_norm": 1.296875, "learning_rate": 0.00048312789396224697, "loss": 5.4344, "mean_token_accuracy": 0.17951468527317047, "num_tokens": 30745849.0, "step": 13425 }, { "entropy": 5.661584997177124, "epoch": 1.3275998418347172, "grad_norm": 1.3203125, "learning_rate": 0.00048311448347495466, "loss": 5.3987, "mean_token_accuracy": 0.1778587281703949, "num_tokens": 30757118.0, "step": 13430 }, { "entropy": 5.692550134658814, "epoch": 1.3280941083432187, "grad_norm": 1.46875, "learning_rate": 0.0004831010678680137, "loss": 5.4904, "mean_token_accuracy": 0.17638929784297944, "num_tokens": 30768692.0, "step": 13435 }, { "entropy": 5.683389329910279, "epoch": 1.32858837485172, "grad_norm": 2.875, "learning_rate": 0.0004830876471417542, "loss": 5.4344, "mean_token_accuracy": 0.17975543588399887, "num_tokens": 30780241.0, "step": 13440 }, { "entropy": 5.606634998321534, "epoch": 1.3290826413602215, "grad_norm": 1.2421875, "learning_rate": 0.0004830742212965063, "loss": 5.4172, "mean_token_accuracy": 0.17563898265361785, "num_tokens": 30792733.0, "step": 13445 }, { "entropy": 5.620973730087281, "epoch": 1.3295769078687227, "grad_norm": 1.984375, "learning_rate": 0.0004830607903326003, "loss": 5.3679, "mean_token_accuracy": 0.1809845268726349, "num_tokens": 30803997.0, "step": 13450 }, { "entropy": 5.593581581115723, "epoch": 1.3300711743772242, "grad_norm": 1.421875, "learning_rate": 0.0004830473542503665, "loss": 5.3356, "mean_token_accuracy": 0.18298769295215606, "num_tokens": 30815322.0, "step": 13455 }, { "entropy": 5.6125345706939695, "epoch": 1.3305654408857257, "grad_norm": 1.265625, "learning_rate": 0.00048303391305013556, "loss": 5.3639, "mean_token_accuracy": 0.17978909313678743, "num_tokens": 30825572.0, "step": 13460 }, { "entropy": 5.599508953094483, "epoch": 1.331059707394227, "grad_norm": 1.2265625, "learning_rate": 0.00048302046673223816, "loss": 5.2795, "mean_token_accuracy": 0.18489835411310196, "num_tokens": 30837451.0, "step": 13465 }, { "entropy": 5.587284898757934, "epoch": 1.3315539739027282, "grad_norm": 1.40625, "learning_rate": 0.0004830070152970049, "loss": 5.3613, "mean_token_accuracy": 0.1831515297293663, "num_tokens": 30849418.0, "step": 13470 }, { "entropy": 5.75219316482544, "epoch": 1.3320482404112297, "grad_norm": 1.3125, "learning_rate": 0.00048299355874476685, "loss": 5.4682, "mean_token_accuracy": 0.1709510028362274, "num_tokens": 30860387.0, "step": 13475 }, { "entropy": 5.5926683902740475, "epoch": 1.3325425069197312, "grad_norm": 1.328125, "learning_rate": 0.000482980097075855, "loss": 5.3502, "mean_token_accuracy": 0.18210737854242326, "num_tokens": 30871599.0, "step": 13480 }, { "entropy": 5.561595392227173, "epoch": 1.3330367734282325, "grad_norm": 1.1640625, "learning_rate": 0.00048296663029060046, "loss": 5.2984, "mean_token_accuracy": 0.18697010576725007, "num_tokens": 30882298.0, "step": 13485 }, { "entropy": 5.571579360961914, "epoch": 1.333531039936734, "grad_norm": 1.4765625, "learning_rate": 0.0004829531583893345, "loss": 5.3999, "mean_token_accuracy": 0.18073733001947404, "num_tokens": 30893589.0, "step": 13490 }, { "entropy": 5.619697856903076, "epoch": 1.3340253064452352, "grad_norm": 1.265625, "learning_rate": 0.0004829396813723886, "loss": 5.3424, "mean_token_accuracy": 0.17959402352571488, "num_tokens": 30905041.0, "step": 13495 }, { "entropy": 5.674782562255859, "epoch": 1.3345195729537367, "grad_norm": 1.6328125, "learning_rate": 0.0004829261992400944, "loss": 5.4271, "mean_token_accuracy": 0.17518270611763, "num_tokens": 30916244.0, "step": 13500 }, { "entropy": 5.638361072540283, "epoch": 1.335013839462238, "grad_norm": 1.828125, "learning_rate": 0.0004829127119927833, "loss": 5.3625, "mean_token_accuracy": 0.18202189803123475, "num_tokens": 30927444.0, "step": 13505 }, { "entropy": 5.583319044113159, "epoch": 1.3355081059707394, "grad_norm": 1.5234375, "learning_rate": 0.0004828992196307873, "loss": 5.3668, "mean_token_accuracy": 0.18954140990972518, "num_tokens": 30939402.0, "step": 13510 }, { "entropy": 5.689163446426392, "epoch": 1.336002372479241, "grad_norm": 1.59375, "learning_rate": 0.00048288572215443825, "loss": 5.4479, "mean_token_accuracy": 0.17430518418550492, "num_tokens": 30951598.0, "step": 13515 }, { "entropy": 5.66749677658081, "epoch": 1.3364966389877422, "grad_norm": 1.328125, "learning_rate": 0.0004828722195640681, "loss": 5.4196, "mean_token_accuracy": 0.17818957567214966, "num_tokens": 30963897.0, "step": 13520 }, { "entropy": 5.6022481441497805, "epoch": 1.3369909054962434, "grad_norm": 1.6328125, "learning_rate": 0.00048285871186000916, "loss": 5.3421, "mean_token_accuracy": 0.17971886992454528, "num_tokens": 30975143.0, "step": 13525 }, { "entropy": 5.644520902633667, "epoch": 1.337485172004745, "grad_norm": 1.390625, "learning_rate": 0.00048284519904259374, "loss": 5.3607, "mean_token_accuracy": 0.17373865097761154, "num_tokens": 30986656.0, "step": 13530 }, { "entropy": 5.713407182693482, "epoch": 1.3379794385132464, "grad_norm": 1.328125, "learning_rate": 0.0004828316811121541, "loss": 5.4979, "mean_token_accuracy": 0.1779793843626976, "num_tokens": 30999904.0, "step": 13535 }, { "entropy": 5.618749570846558, "epoch": 1.3384737050217477, "grad_norm": 1.3359375, "learning_rate": 0.00048281815806902286, "loss": 5.2598, "mean_token_accuracy": 0.18969714790582656, "num_tokens": 31012287.0, "step": 13540 }, { "entropy": 5.639257431030273, "epoch": 1.3389679715302492, "grad_norm": 1.375, "learning_rate": 0.00048280462991353267, "loss": 5.3672, "mean_token_accuracy": 0.1851990595459938, "num_tokens": 31023954.0, "step": 13545 }, { "entropy": 5.573872852325439, "epoch": 1.3394622380387504, "grad_norm": 1.484375, "learning_rate": 0.0004827910966460164, "loss": 5.3272, "mean_token_accuracy": 0.18471778333187103, "num_tokens": 31035365.0, "step": 13550 }, { "entropy": 5.612487077713013, "epoch": 1.339956504547252, "grad_norm": 1.46875, "learning_rate": 0.0004827775582668069, "loss": 5.3592, "mean_token_accuracy": 0.1845427244901657, "num_tokens": 31046814.0, "step": 13555 }, { "entropy": 5.572548675537109, "epoch": 1.3404507710557532, "grad_norm": 1.8046875, "learning_rate": 0.0004827640147762372, "loss": 5.3232, "mean_token_accuracy": 0.18366092592477798, "num_tokens": 31058112.0, "step": 13560 }, { "entropy": 5.55669584274292, "epoch": 1.3409450375642546, "grad_norm": 1.4609375, "learning_rate": 0.00048275046617464055, "loss": 5.3288, "mean_token_accuracy": 0.18401081562042237, "num_tokens": 31068703.0, "step": 13565 }, { "entropy": 5.645600700378418, "epoch": 1.3414393040727561, "grad_norm": 1.484375, "learning_rate": 0.0004827369124623502, "loss": 5.364, "mean_token_accuracy": 0.18467544466257096, "num_tokens": 31080018.0, "step": 13570 }, { "entropy": 5.678955984115601, "epoch": 1.3419335705812574, "grad_norm": 2.0, "learning_rate": 0.00048272335363969956, "loss": 5.4271, "mean_token_accuracy": 0.17893292903900146, "num_tokens": 31091103.0, "step": 13575 }, { "entropy": 5.706071186065674, "epoch": 1.3424278370897589, "grad_norm": 1.3671875, "learning_rate": 0.0004827097897070222, "loss": 5.4285, "mean_token_accuracy": 0.17564288526773453, "num_tokens": 31102731.0, "step": 13580 }, { "entropy": 5.541435718536377, "epoch": 1.3429221035982601, "grad_norm": 1.3671875, "learning_rate": 0.0004826962206646518, "loss": 5.2902, "mean_token_accuracy": 0.1952822133898735, "num_tokens": 31114080.0, "step": 13585 }, { "entropy": 5.575323390960693, "epoch": 1.3434163701067616, "grad_norm": 1.46875, "learning_rate": 0.00048268264651292215, "loss": 5.3583, "mean_token_accuracy": 0.17633841186761856, "num_tokens": 31125875.0, "step": 13590 }, { "entropy": 5.661813354492187, "epoch": 1.3439106366152629, "grad_norm": 2.234375, "learning_rate": 0.00048266906725216713, "loss": 5.356, "mean_token_accuracy": 0.18115421682596206, "num_tokens": 31139246.0, "step": 13595 }, { "entropy": 5.604208612442017, "epoch": 1.3444049031237644, "grad_norm": 1.4609375, "learning_rate": 0.00048265548288272086, "loss": 5.2787, "mean_token_accuracy": 0.1843094438314438, "num_tokens": 31150606.0, "step": 13600 }, { "entropy": 5.570496940612793, "epoch": 1.3448991696322659, "grad_norm": 1.3671875, "learning_rate": 0.00048264189340491755, "loss": 5.4089, "mean_token_accuracy": 0.180218605697155, "num_tokens": 31162413.0, "step": 13605 }, { "entropy": 5.655467796325683, "epoch": 1.3453934361407671, "grad_norm": 1.4140625, "learning_rate": 0.00048262829881909135, "loss": 5.4031, "mean_token_accuracy": 0.1763067677617073, "num_tokens": 31172832.0, "step": 13610 }, { "entropy": 5.650714921951294, "epoch": 1.3458877026492684, "grad_norm": 1.3359375, "learning_rate": 0.00048261469912557685, "loss": 5.4257, "mean_token_accuracy": 0.17724828869104386, "num_tokens": 31186172.0, "step": 13615 }, { "entropy": 5.635502576828003, "epoch": 1.3463819691577699, "grad_norm": 1.640625, "learning_rate": 0.00048260109432470856, "loss": 5.2927, "mean_token_accuracy": 0.1912631407380104, "num_tokens": 31197580.0, "step": 13620 }, { "entropy": 5.613646411895752, "epoch": 1.3468762356662713, "grad_norm": 1.3203125, "learning_rate": 0.00048258748441682114, "loss": 5.3589, "mean_token_accuracy": 0.18065993934869767, "num_tokens": 31209262.0, "step": 13625 }, { "entropy": 5.5887237071990965, "epoch": 1.3473705021747726, "grad_norm": 1.390625, "learning_rate": 0.0004825738694022494, "loss": 5.3555, "mean_token_accuracy": 0.18029915988445283, "num_tokens": 31221722.0, "step": 13630 }, { "entropy": 5.602186250686645, "epoch": 1.347864768683274, "grad_norm": 1.34375, "learning_rate": 0.00048256024928132826, "loss": 5.3071, "mean_token_accuracy": 0.1955119326710701, "num_tokens": 31232871.0, "step": 13635 }, { "entropy": 5.613846206665039, "epoch": 1.3483590351917754, "grad_norm": 1.453125, "learning_rate": 0.0004825466240543928, "loss": 5.3822, "mean_token_accuracy": 0.1794242352247238, "num_tokens": 31244010.0, "step": 13640 }, { "entropy": 5.56691312789917, "epoch": 1.3488533017002768, "grad_norm": 1.421875, "learning_rate": 0.0004825329937217782, "loss": 5.3769, "mean_token_accuracy": 0.17975466847419738, "num_tokens": 31255643.0, "step": 13645 }, { "entropy": 5.712325811386108, "epoch": 1.349347568208778, "grad_norm": 1.6640625, "learning_rate": 0.0004825193582838196, "loss": 5.476, "mean_token_accuracy": 0.17626722902059555, "num_tokens": 31266764.0, "step": 13650 }, { "entropy": 5.691398477554321, "epoch": 1.3498418347172796, "grad_norm": 1.40625, "learning_rate": 0.0004825057177408528, "loss": 5.3355, "mean_token_accuracy": 0.1884911060333252, "num_tokens": 31277533.0, "step": 13655 }, { "entropy": 5.59542818069458, "epoch": 1.350336101225781, "grad_norm": 1.34375, "learning_rate": 0.000482492072093213, "loss": 5.358, "mean_token_accuracy": 0.17958372235298156, "num_tokens": 31289509.0, "step": 13660 }, { "entropy": 5.599795770645142, "epoch": 1.3508303677342823, "grad_norm": 1.4921875, "learning_rate": 0.00048247842134123615, "loss": 5.4155, "mean_token_accuracy": 0.1811332657933235, "num_tokens": 31300909.0, "step": 13665 }, { "entropy": 5.663826608657837, "epoch": 1.3513246342427836, "grad_norm": 1.359375, "learning_rate": 0.0004824647654852579, "loss": 5.4295, "mean_token_accuracy": 0.1764205664396286, "num_tokens": 31312148.0, "step": 13670 }, { "entropy": 5.603689527511596, "epoch": 1.351818900751285, "grad_norm": 1.4140625, "learning_rate": 0.0004824511045256142, "loss": 5.2806, "mean_token_accuracy": 0.1938604086637497, "num_tokens": 31323388.0, "step": 13675 }, { "entropy": 5.589712715148925, "epoch": 1.3523131672597866, "grad_norm": 1.796875, "learning_rate": 0.00048243743846264125, "loss": 5.2603, "mean_token_accuracy": 0.18790659308433533, "num_tokens": 31334103.0, "step": 13680 }, { "entropy": 5.608765602111816, "epoch": 1.3528074337682878, "grad_norm": 1.5703125, "learning_rate": 0.0004824237672966751, "loss": 5.3598, "mean_token_accuracy": 0.1805233985185623, "num_tokens": 31345456.0, "step": 13685 }, { "entropy": 5.521354341506958, "epoch": 1.3533017002767893, "grad_norm": 1.5625, "learning_rate": 0.000482410091028052, "loss": 5.2303, "mean_token_accuracy": 0.19384558498859406, "num_tokens": 31356482.0, "step": 13690 }, { "entropy": 5.634257793426514, "epoch": 1.3537959667852906, "grad_norm": 1.6953125, "learning_rate": 0.00048239640965710854, "loss": 5.4417, "mean_token_accuracy": 0.1719844087958336, "num_tokens": 31367103.0, "step": 13695 }, { "entropy": 5.691772508621216, "epoch": 1.354290233293792, "grad_norm": 1.828125, "learning_rate": 0.00048238272318418127, "loss": 5.4011, "mean_token_accuracy": 0.17740811556577682, "num_tokens": 31378564.0, "step": 13700 }, { "entropy": 5.645037221908569, "epoch": 1.3547844998022933, "grad_norm": 1.2265625, "learning_rate": 0.00048236903160960677, "loss": 5.3894, "mean_token_accuracy": 0.18022141307592393, "num_tokens": 31391435.0, "step": 13705 }, { "entropy": 5.6197977542877195, "epoch": 1.3552787663107948, "grad_norm": 1.3671875, "learning_rate": 0.000482355334933722, "loss": 5.4029, "mean_token_accuracy": 0.1759616881608963, "num_tokens": 31403422.0, "step": 13710 }, { "entropy": 5.604930877685547, "epoch": 1.3557730328192963, "grad_norm": 1.4765625, "learning_rate": 0.00048234163315686375, "loss": 5.2503, "mean_token_accuracy": 0.19544390738010406, "num_tokens": 31414940.0, "step": 13715 }, { "entropy": 5.6139758110046385, "epoch": 1.3562672993277975, "grad_norm": 1.4921875, "learning_rate": 0.0004823279262793692, "loss": 5.4644, "mean_token_accuracy": 0.17626293748617172, "num_tokens": 31426369.0, "step": 13720 }, { "entropy": 5.577859354019165, "epoch": 1.3567615658362988, "grad_norm": 1.2734375, "learning_rate": 0.00048231421430157547, "loss": 5.3865, "mean_token_accuracy": 0.18294183164834976, "num_tokens": 31438426.0, "step": 13725 }, { "entropy": 5.561729478836059, "epoch": 1.3572558323448003, "grad_norm": 1.3203125, "learning_rate": 0.0004823004972238199, "loss": 5.3096, "mean_token_accuracy": 0.1826370596885681, "num_tokens": 31450230.0, "step": 13730 }, { "entropy": 5.656190872192383, "epoch": 1.3577500988533018, "grad_norm": 1.390625, "learning_rate": 0.00048228677504643996, "loss": 5.4813, "mean_token_accuracy": 0.17086569517850875, "num_tokens": 31462564.0, "step": 13735 }, { "entropy": 5.6548137187957765, "epoch": 1.358244365361803, "grad_norm": 1.3515625, "learning_rate": 0.0004822730477697732, "loss": 5.328, "mean_token_accuracy": 0.18942943811416627, "num_tokens": 31475053.0, "step": 13740 }, { "entropy": 5.570001649856567, "epoch": 1.3587386318703045, "grad_norm": 1.84375, "learning_rate": 0.0004822593153941573, "loss": 5.3696, "mean_token_accuracy": 0.18805706948041917, "num_tokens": 31487187.0, "step": 13745 }, { "entropy": 5.668126106262207, "epoch": 1.3592328983788058, "grad_norm": 1.4375, "learning_rate": 0.00048224557791993013, "loss": 5.4042, "mean_token_accuracy": 0.18166119307279588, "num_tokens": 31499288.0, "step": 13750 }, { "entropy": 5.618986558914185, "epoch": 1.3597271648873073, "grad_norm": 1.46875, "learning_rate": 0.00048223183534742953, "loss": 5.3463, "mean_token_accuracy": 0.18207521587610245, "num_tokens": 31510113.0, "step": 13755 }, { "entropy": 5.575040054321289, "epoch": 1.3602214313958085, "grad_norm": 1.421875, "learning_rate": 0.00048221808767699373, "loss": 5.3085, "mean_token_accuracy": 0.1831543982028961, "num_tokens": 31520900.0, "step": 13760 }, { "entropy": 5.651335525512695, "epoch": 1.36071569790431, "grad_norm": 1.7421875, "learning_rate": 0.0004822043349089607, "loss": 5.3724, "mean_token_accuracy": 0.1856143057346344, "num_tokens": 31533085.0, "step": 13765 }, { "entropy": 5.6594603061676025, "epoch": 1.3612099644128115, "grad_norm": 1.4765625, "learning_rate": 0.0004821905770436689, "loss": 5.3707, "mean_token_accuracy": 0.17452322691679, "num_tokens": 31544287.0, "step": 13770 }, { "entropy": 5.567810916900635, "epoch": 1.3617042309213128, "grad_norm": 1.65625, "learning_rate": 0.0004821768140814568, "loss": 5.3368, "mean_token_accuracy": 0.18782113939523698, "num_tokens": 31555233.0, "step": 13775 }, { "entropy": 5.607983779907227, "epoch": 1.362198497429814, "grad_norm": 1.4375, "learning_rate": 0.0004821630460226629, "loss": 5.2746, "mean_token_accuracy": 0.18981120437383653, "num_tokens": 31565421.0, "step": 13780 }, { "entropy": 5.626432085037232, "epoch": 1.3626927639383155, "grad_norm": 1.375, "learning_rate": 0.000482149272867626, "loss": 5.3883, "mean_token_accuracy": 0.1856262981891632, "num_tokens": 31576787.0, "step": 13785 }, { "entropy": 5.64390196800232, "epoch": 1.363187030446817, "grad_norm": 1.4375, "learning_rate": 0.00048213549461668476, "loss": 5.4412, "mean_token_accuracy": 0.17790410965681075, "num_tokens": 31587563.0, "step": 13790 }, { "entropy": 5.643861103057861, "epoch": 1.3636812969553183, "grad_norm": 1.765625, "learning_rate": 0.00048212171127017835, "loss": 5.3339, "mean_token_accuracy": 0.18473720997571946, "num_tokens": 31598186.0, "step": 13795 }, { "entropy": 5.666094207763672, "epoch": 1.3641755634638197, "grad_norm": 1.5390625, "learning_rate": 0.0004821079228284456, "loss": 5.3588, "mean_token_accuracy": 0.1768627107143402, "num_tokens": 31609458.0, "step": 13800 }, { "entropy": 5.628021001815796, "epoch": 1.364669829972321, "grad_norm": 1.53125, "learning_rate": 0.00048209412929182586, "loss": 5.2808, "mean_token_accuracy": 0.18881404101848603, "num_tokens": 31619497.0, "step": 13805 }, { "entropy": 5.6065410614013675, "epoch": 1.3651640964808225, "grad_norm": 1.5, "learning_rate": 0.0004820803306606584, "loss": 5.3858, "mean_token_accuracy": 0.17492412477731706, "num_tokens": 31630838.0, "step": 13810 }, { "entropy": 5.652844095230103, "epoch": 1.3656583629893237, "grad_norm": 2.359375, "learning_rate": 0.0004820665269352827, "loss": 5.4446, "mean_token_accuracy": 0.1760430321097374, "num_tokens": 31642234.0, "step": 13815 }, { "entropy": 5.6957813739776615, "epoch": 1.3661526294978252, "grad_norm": 1.703125, "learning_rate": 0.00048205271811603827, "loss": 5.4052, "mean_token_accuracy": 0.17412530183792113, "num_tokens": 31653283.0, "step": 13820 }, { "entropy": 5.693255805969239, "epoch": 1.3666468960063267, "grad_norm": 2.1875, "learning_rate": 0.0004820389042032649, "loss": 5.3407, "mean_token_accuracy": 0.18445192277431488, "num_tokens": 31663284.0, "step": 13825 }, { "entropy": 5.555064392089844, "epoch": 1.367141162514828, "grad_norm": 1.3984375, "learning_rate": 0.0004820250851973023, "loss": 5.3024, "mean_token_accuracy": 0.18553722500801087, "num_tokens": 31674379.0, "step": 13830 }, { "entropy": 5.6579591751098635, "epoch": 1.3676354290233292, "grad_norm": 1.5, "learning_rate": 0.0004820112610984906, "loss": 5.4597, "mean_token_accuracy": 0.17677143663167955, "num_tokens": 31686420.0, "step": 13835 }, { "entropy": 5.556261730194092, "epoch": 1.3681296955318307, "grad_norm": 2.171875, "learning_rate": 0.00048199743190716966, "loss": 5.2543, "mean_token_accuracy": 0.19362638145685196, "num_tokens": 31696919.0, "step": 13840 }, { "entropy": 5.591260147094727, "epoch": 1.3686239620403322, "grad_norm": 1.8359375, "learning_rate": 0.00048198359762367983, "loss": 5.3678, "mean_token_accuracy": 0.17782708555459975, "num_tokens": 31708878.0, "step": 13845 }, { "entropy": 5.6437853336334225, "epoch": 1.3691182285488335, "grad_norm": 1.7265625, "learning_rate": 0.00048196975824836135, "loss": 5.388, "mean_token_accuracy": 0.1815121129155159, "num_tokens": 31719348.0, "step": 13850 }, { "entropy": 5.621160697937012, "epoch": 1.369612495057335, "grad_norm": 1.6171875, "learning_rate": 0.0004819559137815547, "loss": 5.3446, "mean_token_accuracy": 0.1858145609498024, "num_tokens": 31729349.0, "step": 13855 }, { "entropy": 5.674253654479981, "epoch": 1.3701067615658362, "grad_norm": 1.8828125, "learning_rate": 0.0004819420642236005, "loss": 5.3615, "mean_token_accuracy": 0.18043985068798066, "num_tokens": 31740345.0, "step": 13860 }, { "entropy": 5.676819467544556, "epoch": 1.3706010280743377, "grad_norm": 1.5546875, "learning_rate": 0.0004819282095748395, "loss": 5.3866, "mean_token_accuracy": 0.17638078480958938, "num_tokens": 31752231.0, "step": 13865 }, { "entropy": 5.654842710494995, "epoch": 1.371095294582839, "grad_norm": 1.796875, "learning_rate": 0.0004819143498356123, "loss": 5.3926, "mean_token_accuracy": 0.1823098376393318, "num_tokens": 31764248.0, "step": 13870 }, { "entropy": 5.551671409606934, "epoch": 1.3715895610913404, "grad_norm": 1.484375, "learning_rate": 0.0004819004850062601, "loss": 5.2235, "mean_token_accuracy": 0.18993889391422272, "num_tokens": 31774173.0, "step": 13875 }, { "entropy": 5.609506845474243, "epoch": 1.372083827599842, "grad_norm": 1.34375, "learning_rate": 0.00048188661508712376, "loss": 5.3902, "mean_token_accuracy": 0.17847636342048645, "num_tokens": 31784860.0, "step": 13880 }, { "entropy": 5.618414068222046, "epoch": 1.3725780941083432, "grad_norm": 1.6953125, "learning_rate": 0.0004818727400785447, "loss": 5.4058, "mean_token_accuracy": 0.1797900229692459, "num_tokens": 31797012.0, "step": 13885 }, { "entropy": 5.597910213470459, "epoch": 1.3730723606168447, "grad_norm": 1.484375, "learning_rate": 0.0004818588599808641, "loss": 5.3025, "mean_token_accuracy": 0.1837613582611084, "num_tokens": 31808216.0, "step": 13890 }, { "entropy": 5.606488990783691, "epoch": 1.373566627125346, "grad_norm": 1.390625, "learning_rate": 0.00048184497479442345, "loss": 5.4182, "mean_token_accuracy": 0.17232680320739746, "num_tokens": 31820097.0, "step": 13895 }, { "entropy": 5.6867293357849125, "epoch": 1.3740608936338474, "grad_norm": 1.46875, "learning_rate": 0.0004818310845195643, "loss": 5.4774, "mean_token_accuracy": 0.17236514538526534, "num_tokens": 31832252.0, "step": 13900 }, { "entropy": 5.651212930679321, "epoch": 1.3745551601423487, "grad_norm": 1.28125, "learning_rate": 0.0004818171891566284, "loss": 5.4432, "mean_token_accuracy": 0.17456165552139283, "num_tokens": 31842928.0, "step": 13905 }, { "entropy": 5.629182624816894, "epoch": 1.3750494266508502, "grad_norm": 1.53125, "learning_rate": 0.0004818032887059576, "loss": 5.2923, "mean_token_accuracy": 0.19028321355581285, "num_tokens": 31854072.0, "step": 13910 }, { "entropy": 5.6791047096252445, "epoch": 1.3755436931593517, "grad_norm": 1.34375, "learning_rate": 0.0004817893831678938, "loss": 5.4136, "mean_token_accuracy": 0.1805824011564255, "num_tokens": 31865163.0, "step": 13915 }, { "entropy": 5.526577377319336, "epoch": 1.376037959667853, "grad_norm": 1.5390625, "learning_rate": 0.00048177547254277904, "loss": 5.287, "mean_token_accuracy": 0.18845449686050414, "num_tokens": 31876583.0, "step": 13920 }, { "entropy": 5.634654188156128, "epoch": 1.3765322261763542, "grad_norm": 1.4296875, "learning_rate": 0.0004817615568309557, "loss": 5.3403, "mean_token_accuracy": 0.18297360688447953, "num_tokens": 31886794.0, "step": 13925 }, { "entropy": 5.69839129447937, "epoch": 1.3770264926848557, "grad_norm": 1.8359375, "learning_rate": 0.0004817476360327658, "loss": 5.4266, "mean_token_accuracy": 0.17962846904993057, "num_tokens": 31899980.0, "step": 13930 }, { "entropy": 5.559878158569336, "epoch": 1.3775207591933571, "grad_norm": 1.5390625, "learning_rate": 0.0004817337101485521, "loss": 5.2333, "mean_token_accuracy": 0.19485677629709244, "num_tokens": 31909906.0, "step": 13935 }, { "entropy": 5.531175947189331, "epoch": 1.3780150257018584, "grad_norm": 1.4609375, "learning_rate": 0.00048171977917865706, "loss": 5.3175, "mean_token_accuracy": 0.18942902237176895, "num_tokens": 31920499.0, "step": 13940 }, { "entropy": 5.533161878585815, "epoch": 1.37850929221036, "grad_norm": 1.5234375, "learning_rate": 0.00048170584312342337, "loss": 5.3218, "mean_token_accuracy": 0.19081737995147705, "num_tokens": 31931031.0, "step": 13945 }, { "entropy": 5.654254961013794, "epoch": 1.3790035587188612, "grad_norm": 1.40625, "learning_rate": 0.0004816919019831939, "loss": 5.3158, "mean_token_accuracy": 0.18491162210702897, "num_tokens": 31941887.0, "step": 13950 }, { "entropy": 5.6600535869598385, "epoch": 1.3794978252273626, "grad_norm": 1.8828125, "learning_rate": 0.00048167795575831154, "loss": 5.4021, "mean_token_accuracy": 0.17590015530586242, "num_tokens": 31953727.0, "step": 13955 }, { "entropy": 5.611099529266357, "epoch": 1.379992091735864, "grad_norm": 1.359375, "learning_rate": 0.0004816640044491193, "loss": 5.3638, "mean_token_accuracy": 0.18339920341968535, "num_tokens": 31965418.0, "step": 13960 }, { "entropy": 5.619025993347168, "epoch": 1.3804863582443654, "grad_norm": 1.4453125, "learning_rate": 0.0004816500480559607, "loss": 5.3919, "mean_token_accuracy": 0.18112977892160415, "num_tokens": 31976528.0, "step": 13965 }, { "entropy": 5.642622089385986, "epoch": 1.3809806247528669, "grad_norm": 1.4765625, "learning_rate": 0.00048163608657917874, "loss": 5.38, "mean_token_accuracy": 0.17919955253601075, "num_tokens": 31987921.0, "step": 13970 }, { "entropy": 5.587106704711914, "epoch": 1.3814748912613681, "grad_norm": 1.4453125, "learning_rate": 0.000481622120019117, "loss": 5.2548, "mean_token_accuracy": 0.18843722045421601, "num_tokens": 31998824.0, "step": 13975 }, { "entropy": 5.617704248428344, "epoch": 1.3819691577698694, "grad_norm": 1.453125, "learning_rate": 0.0004816081483761191, "loss": 5.4425, "mean_token_accuracy": 0.17394677996635438, "num_tokens": 32011690.0, "step": 13980 }, { "entropy": 5.658710956573486, "epoch": 1.3824634242783709, "grad_norm": 1.4921875, "learning_rate": 0.0004815941716505286, "loss": 5.4222, "mean_token_accuracy": 0.18356541395187378, "num_tokens": 32022946.0, "step": 13985 }, { "entropy": 5.655589818954468, "epoch": 1.3829576907868724, "grad_norm": 1.390625, "learning_rate": 0.00048158018984268954, "loss": 5.3743, "mean_token_accuracy": 0.17571795731782913, "num_tokens": 32033683.0, "step": 13990 }, { "entropy": 5.6693085670471195, "epoch": 1.3834519572953736, "grad_norm": 1.515625, "learning_rate": 0.0004815662029529457, "loss": 5.4298, "mean_token_accuracy": 0.1724245861172676, "num_tokens": 32045334.0, "step": 13995 }, { "entropy": 5.589751243591309, "epoch": 1.383946223803875, "grad_norm": 1.3828125, "learning_rate": 0.00048155221098164123, "loss": 5.316, "mean_token_accuracy": 0.18133876323699952, "num_tokens": 32056425.0, "step": 14000 }, { "entropy": 5.628468751907349, "epoch": 1.3844404903123764, "grad_norm": 1.4375, "learning_rate": 0.00048153821392912035, "loss": 5.3674, "mean_token_accuracy": 0.18083936721086502, "num_tokens": 32068053.0, "step": 14005 }, { "entropy": 5.663592529296875, "epoch": 1.3849347568208779, "grad_norm": 1.5390625, "learning_rate": 0.0004815242117957273, "loss": 5.3751, "mean_token_accuracy": 0.18200017362833024, "num_tokens": 32079462.0, "step": 14010 }, { "entropy": 5.54339189529419, "epoch": 1.3854290233293791, "grad_norm": 1.46875, "learning_rate": 0.00048151020458180667, "loss": 5.3512, "mean_token_accuracy": 0.18686241209506987, "num_tokens": 32090566.0, "step": 14015 }, { "entropy": 5.722955894470215, "epoch": 1.3859232898378806, "grad_norm": 1.2109375, "learning_rate": 0.000481496192287703, "loss": 5.43, "mean_token_accuracy": 0.17913904488086702, "num_tokens": 32101535.0, "step": 14020 }, { "entropy": 5.600596332550049, "epoch": 1.386417556346382, "grad_norm": 1.6328125, "learning_rate": 0.0004814821749137609, "loss": 5.2919, "mean_token_accuracy": 0.18575020730495453, "num_tokens": 32112450.0, "step": 14025 }, { "entropy": 5.551318883895874, "epoch": 1.3869118228548833, "grad_norm": 1.4609375, "learning_rate": 0.0004814681524603252, "loss": 5.4073, "mean_token_accuracy": 0.17307053953409196, "num_tokens": 32123675.0, "step": 14030 }, { "entropy": 5.6738694190979, "epoch": 1.3874060893633846, "grad_norm": 1.390625, "learning_rate": 0.000481454124927741, "loss": 5.4015, "mean_token_accuracy": 0.17737227082252502, "num_tokens": 32135283.0, "step": 14035 }, { "entropy": 5.607222080230713, "epoch": 1.387900355871886, "grad_norm": 1.546875, "learning_rate": 0.00048144009231635326, "loss": 5.3128, "mean_token_accuracy": 0.19094865769147873, "num_tokens": 32146715.0, "step": 14040 }, { "entropy": 5.5505311489105225, "epoch": 1.3883946223803876, "grad_norm": 1.828125, "learning_rate": 0.0004814260546265073, "loss": 5.3444, "mean_token_accuracy": 0.1852043941617012, "num_tokens": 32158323.0, "step": 14045 }, { "entropy": 5.629556179046631, "epoch": 1.3888888888888888, "grad_norm": 1.4296875, "learning_rate": 0.0004814120118585483, "loss": 5.4083, "mean_token_accuracy": 0.1811718225479126, "num_tokens": 32170453.0, "step": 14050 }, { "entropy": 5.740184307098389, "epoch": 1.3893831553973903, "grad_norm": 1.390625, "learning_rate": 0.0004813979640128218, "loss": 5.4245, "mean_token_accuracy": 0.17536792308092117, "num_tokens": 32181596.0, "step": 14055 }, { "entropy": 5.71956353187561, "epoch": 1.3898774219058916, "grad_norm": 1.65625, "learning_rate": 0.0004813839110896734, "loss": 5.3981, "mean_token_accuracy": 0.18018420189619064, "num_tokens": 32194603.0, "step": 14060 }, { "entropy": 5.5669067859649655, "epoch": 1.390371688414393, "grad_norm": 1.5859375, "learning_rate": 0.00048136985308944874, "loss": 5.3001, "mean_token_accuracy": 0.18715957105159758, "num_tokens": 32206064.0, "step": 14065 }, { "entropy": 5.618303680419922, "epoch": 1.3908659549228943, "grad_norm": 1.4921875, "learning_rate": 0.00048135579001249367, "loss": 5.3729, "mean_token_accuracy": 0.1751048281788826, "num_tokens": 32217254.0, "step": 14070 }, { "entropy": 5.764079332351685, "epoch": 1.3913602214313958, "grad_norm": 2.859375, "learning_rate": 0.0004813417218591542, "loss": 5.5131, "mean_token_accuracy": 0.16822995394468307, "num_tokens": 32228821.0, "step": 14075 }, { "entropy": 5.6994609355926515, "epoch": 1.3918544879398973, "grad_norm": 2.5625, "learning_rate": 0.0004813276486297763, "loss": 5.3707, "mean_token_accuracy": 0.17629912197589875, "num_tokens": 32239476.0, "step": 14080 }, { "entropy": 5.600485897064209, "epoch": 1.3923487544483986, "grad_norm": 1.4921875, "learning_rate": 0.0004813135703247062, "loss": 5.3305, "mean_token_accuracy": 0.184663724899292, "num_tokens": 32250975.0, "step": 14085 }, { "entropy": 5.651822423934936, "epoch": 1.3928430209568998, "grad_norm": 1.8125, "learning_rate": 0.00048129948694429036, "loss": 5.3117, "mean_token_accuracy": 0.19396121203899383, "num_tokens": 32261675.0, "step": 14090 }, { "entropy": 5.5526707649230955, "epoch": 1.3933372874654013, "grad_norm": 1.4765625, "learning_rate": 0.00048128539848887517, "loss": 5.2218, "mean_token_accuracy": 0.1985325649380684, "num_tokens": 32272523.0, "step": 14095 }, { "entropy": 5.589223480224609, "epoch": 1.3938315539739028, "grad_norm": 1.7578125, "learning_rate": 0.00048127130495880703, "loss": 5.3903, "mean_token_accuracy": 0.17744339108467103, "num_tokens": 32284140.0, "step": 14100 }, { "entropy": 5.598843765258789, "epoch": 1.394325820482404, "grad_norm": 1.7109375, "learning_rate": 0.0004812572063544329, "loss": 5.3217, "mean_token_accuracy": 0.17905248701572418, "num_tokens": 32296286.0, "step": 14105 }, { "entropy": 5.6526764869689945, "epoch": 1.3948200869909055, "grad_norm": 1.6796875, "learning_rate": 0.00048124310267609946, "loss": 5.3731, "mean_token_accuracy": 0.18060370683670043, "num_tokens": 32307394.0, "step": 14110 }, { "entropy": 5.681780576705933, "epoch": 1.3953143534994068, "grad_norm": 1.515625, "learning_rate": 0.0004812289939241537, "loss": 5.4591, "mean_token_accuracy": 0.17379377037286758, "num_tokens": 32318788.0, "step": 14115 }, { "entropy": 5.663927268981934, "epoch": 1.3958086200079083, "grad_norm": 1.4140625, "learning_rate": 0.0004812148800989427, "loss": 5.4546, "mean_token_accuracy": 0.17521916776895524, "num_tokens": 32332395.0, "step": 14120 }, { "entropy": 5.688994550704956, "epoch": 1.3963028865164095, "grad_norm": 1.609375, "learning_rate": 0.00048120076120081363, "loss": 5.4187, "mean_token_accuracy": 0.17732064425945282, "num_tokens": 32344226.0, "step": 14125 }, { "entropy": 5.667909383773804, "epoch": 1.396797153024911, "grad_norm": 1.46875, "learning_rate": 0.00048118663723011393, "loss": 5.3973, "mean_token_accuracy": 0.17809137254953383, "num_tokens": 32354677.0, "step": 14130 }, { "entropy": 5.627816009521484, "epoch": 1.3972914195334125, "grad_norm": 1.3046875, "learning_rate": 0.0004811725081871909, "loss": 5.3023, "mean_token_accuracy": 0.18046956956386567, "num_tokens": 32365054.0, "step": 14135 }, { "entropy": 5.55205659866333, "epoch": 1.3977856860419138, "grad_norm": 1.40625, "learning_rate": 0.0004811583740723922, "loss": 5.293, "mean_token_accuracy": 0.19918642193078995, "num_tokens": 32376215.0, "step": 14140 }, { "entropy": 5.717932224273682, "epoch": 1.3982799525504153, "grad_norm": 1.3515625, "learning_rate": 0.00048114423488606543, "loss": 5.3989, "mean_token_accuracy": 0.17818801999092101, "num_tokens": 32386880.0, "step": 14145 }, { "entropy": 5.639126348495483, "epoch": 1.3987742190589165, "grad_norm": 1.484375, "learning_rate": 0.00048113009062855866, "loss": 5.4097, "mean_token_accuracy": 0.18310538828372955, "num_tokens": 32398227.0, "step": 14150 }, { "entropy": 5.680119609832763, "epoch": 1.399268485567418, "grad_norm": 1.421875, "learning_rate": 0.0004811159413002196, "loss": 5.4268, "mean_token_accuracy": 0.177865169942379, "num_tokens": 32410091.0, "step": 14155 }, { "entropy": 5.661602926254273, "epoch": 1.3997627520759193, "grad_norm": 1.5390625, "learning_rate": 0.0004811017869013963, "loss": 5.3683, "mean_token_accuracy": 0.17924144864082336, "num_tokens": 32422710.0, "step": 14160 }, { "entropy": 5.65218677520752, "epoch": 1.4002570185844208, "grad_norm": 1.46875, "learning_rate": 0.0004810876274324372, "loss": 5.405, "mean_token_accuracy": 0.1841844215989113, "num_tokens": 32433691.0, "step": 14165 }, { "entropy": 5.608447647094726, "epoch": 1.4007512850929222, "grad_norm": 1.4375, "learning_rate": 0.0004810734628936905, "loss": 5.3363, "mean_token_accuracy": 0.18748170435428618, "num_tokens": 32445370.0, "step": 14170 }, { "entropy": 5.606389427185059, "epoch": 1.4012455516014235, "grad_norm": 1.453125, "learning_rate": 0.00048105929328550465, "loss": 5.307, "mean_token_accuracy": 0.18583703488111497, "num_tokens": 32456737.0, "step": 14175 }, { "entropy": 5.5614348411560055, "epoch": 1.4017398181099248, "grad_norm": 1.53125, "learning_rate": 0.0004810451186082282, "loss": 5.3748, "mean_token_accuracy": 0.17483311295509338, "num_tokens": 32467957.0, "step": 14180 }, { "entropy": 5.632024574279785, "epoch": 1.4022340846184262, "grad_norm": 1.421875, "learning_rate": 0.00048103093886220984, "loss": 5.4392, "mean_token_accuracy": 0.1730569750070572, "num_tokens": 32481697.0, "step": 14185 }, { "entropy": 5.6059290885925295, "epoch": 1.4027283511269277, "grad_norm": 1.3515625, "learning_rate": 0.00048101675404779834, "loss": 5.2545, "mean_token_accuracy": 0.1884591683745384, "num_tokens": 32492828.0, "step": 14190 }, { "entropy": 5.736994743347168, "epoch": 1.403222617635429, "grad_norm": 1.4609375, "learning_rate": 0.0004810025641653428, "loss": 5.506, "mean_token_accuracy": 0.17533777952194213, "num_tokens": 32505120.0, "step": 14195 }, { "entropy": 5.582390546798706, "epoch": 1.4037168841439305, "grad_norm": 1.5859375, "learning_rate": 0.0004809883692151923, "loss": 5.3188, "mean_token_accuracy": 0.18648334741592407, "num_tokens": 32516837.0, "step": 14200 }, { "entropy": 5.57723822593689, "epoch": 1.4042111506524317, "grad_norm": 1.6875, "learning_rate": 0.00048097416919769595, "loss": 5.2735, "mean_token_accuracy": 0.19068894982337953, "num_tokens": 32526906.0, "step": 14205 }, { "entropy": 5.657097005844117, "epoch": 1.4047054171609332, "grad_norm": 1.53125, "learning_rate": 0.00048095996411320294, "loss": 5.425, "mean_token_accuracy": 0.17666495591402054, "num_tokens": 32537929.0, "step": 14210 }, { "entropy": 5.59872350692749, "epoch": 1.4051996836694345, "grad_norm": 1.6953125, "learning_rate": 0.00048094575396206296, "loss": 5.4146, "mean_token_accuracy": 0.18222443759441376, "num_tokens": 32549458.0, "step": 14215 }, { "entropy": 5.615854358673095, "epoch": 1.405693950177936, "grad_norm": 1.5078125, "learning_rate": 0.0004809315387446255, "loss": 5.3442, "mean_token_accuracy": 0.18087542057037354, "num_tokens": 32560244.0, "step": 14220 }, { "entropy": 5.6728517532348635, "epoch": 1.4061882166864375, "grad_norm": 1.375, "learning_rate": 0.0004809173184612402, "loss": 5.4353, "mean_token_accuracy": 0.17692623138427735, "num_tokens": 32571337.0, "step": 14225 }, { "entropy": 5.589094638824463, "epoch": 1.4066824831949387, "grad_norm": 1.5234375, "learning_rate": 0.0004809030931122569, "loss": 5.3429, "mean_token_accuracy": 0.1807697132229805, "num_tokens": 32582325.0, "step": 14230 }, { "entropy": 5.706233787536621, "epoch": 1.40717674970344, "grad_norm": 1.3828125, "learning_rate": 0.00048088886269802565, "loss": 5.4044, "mean_token_accuracy": 0.1818245232105255, "num_tokens": 32592953.0, "step": 14235 }, { "entropy": 5.615331029891967, "epoch": 1.4076710162119415, "grad_norm": 1.3984375, "learning_rate": 0.0004808746272188964, "loss": 5.3158, "mean_token_accuracy": 0.18511224091053008, "num_tokens": 32604190.0, "step": 14240 }, { "entropy": 5.6900841236114506, "epoch": 1.408165282720443, "grad_norm": 1.671875, "learning_rate": 0.00048086038667521935, "loss": 5.3138, "mean_token_accuracy": 0.18650416880846024, "num_tokens": 32614467.0, "step": 14245 }, { "entropy": 5.555642032623291, "epoch": 1.4086595492289442, "grad_norm": 1.53125, "learning_rate": 0.0004808461410673449, "loss": 5.3312, "mean_token_accuracy": 0.1829972445964813, "num_tokens": 32624022.0, "step": 14250 }, { "entropy": 5.52761435508728, "epoch": 1.4091538157374457, "grad_norm": 1.4921875, "learning_rate": 0.0004808318903956234, "loss": 5.3392, "mean_token_accuracy": 0.18747462332248688, "num_tokens": 32634363.0, "step": 14255 }, { "entropy": 5.600794696807862, "epoch": 1.409648082245947, "grad_norm": 1.828125, "learning_rate": 0.0004808176346604055, "loss": 5.274, "mean_token_accuracy": 0.1910204216837883, "num_tokens": 32646143.0, "step": 14260 }, { "entropy": 5.624323749542237, "epoch": 1.4101423487544484, "grad_norm": 1.234375, "learning_rate": 0.0004808033738620419, "loss": 5.3624, "mean_token_accuracy": 0.17982067912817, "num_tokens": 32658735.0, "step": 14265 }, { "entropy": 5.684943056106567, "epoch": 1.4106366152629497, "grad_norm": 1.4453125, "learning_rate": 0.00048078910800088327, "loss": 5.4734, "mean_token_accuracy": 0.17568115144968033, "num_tokens": 32669337.0, "step": 14270 }, { "entropy": 5.5618006706237795, "epoch": 1.4111308817714512, "grad_norm": 1.609375, "learning_rate": 0.0004807748370772807, "loss": 5.2686, "mean_token_accuracy": 0.1903432548046112, "num_tokens": 32680072.0, "step": 14275 }, { "entropy": 5.59342131614685, "epoch": 1.4116251482799527, "grad_norm": 1.3828125, "learning_rate": 0.00048076056109158525, "loss": 5.3226, "mean_token_accuracy": 0.18741660118103026, "num_tokens": 32691142.0, "step": 14280 }, { "entropy": 5.68325514793396, "epoch": 1.412119414788454, "grad_norm": 1.3046875, "learning_rate": 0.0004807462800441481, "loss": 5.4168, "mean_token_accuracy": 0.17906888872385024, "num_tokens": 32702482.0, "step": 14285 }, { "entropy": 5.658294582366944, "epoch": 1.4126136812969552, "grad_norm": 1.4375, "learning_rate": 0.0004807319939353204, "loss": 5.4193, "mean_token_accuracy": 0.17739390581846237, "num_tokens": 32714456.0, "step": 14290 }, { "entropy": 5.650444650650025, "epoch": 1.4131079478054567, "grad_norm": 1.3984375, "learning_rate": 0.00048071770276545377, "loss": 5.3477, "mean_token_accuracy": 0.177822445333004, "num_tokens": 32726305.0, "step": 14295 }, { "entropy": 5.518589162826538, "epoch": 1.4136022143139582, "grad_norm": 1.453125, "learning_rate": 0.00048070340653489984, "loss": 5.2948, "mean_token_accuracy": 0.19069047570228576, "num_tokens": 32736446.0, "step": 14300 }, { "entropy": 5.62140154838562, "epoch": 1.4140964808224594, "grad_norm": 1.4140625, "learning_rate": 0.00048068910524401014, "loss": 5.3666, "mean_token_accuracy": 0.17754603624343873, "num_tokens": 32746798.0, "step": 14305 }, { "entropy": 5.5328234195709225, "epoch": 1.414590747330961, "grad_norm": 1.5078125, "learning_rate": 0.00048067479889313654, "loss": 5.2784, "mean_token_accuracy": 0.1890805631875992, "num_tokens": 32758647.0, "step": 14310 }, { "entropy": 5.580541706085205, "epoch": 1.4150850138394622, "grad_norm": 1.328125, "learning_rate": 0.00048066048748263097, "loss": 5.357, "mean_token_accuracy": 0.1755592092871666, "num_tokens": 32770759.0, "step": 14315 }, { "entropy": 5.640110445022583, "epoch": 1.4155792803479637, "grad_norm": 1.8203125, "learning_rate": 0.00048064617101284553, "loss": 5.3578, "mean_token_accuracy": 0.18834201991558075, "num_tokens": 32783398.0, "step": 14320 }, { "entropy": 5.665228271484375, "epoch": 1.416073546856465, "grad_norm": 1.3515625, "learning_rate": 0.00048063184948413237, "loss": 5.3701, "mean_token_accuracy": 0.17614586055278778, "num_tokens": 32795995.0, "step": 14325 }, { "entropy": 5.674857711791992, "epoch": 1.4165678133649664, "grad_norm": 1.65625, "learning_rate": 0.00048061752289684385, "loss": 5.4351, "mean_token_accuracy": 0.17878583669662476, "num_tokens": 32808700.0, "step": 14330 }, { "entropy": 5.661518812179565, "epoch": 1.4170620798734679, "grad_norm": 1.4375, "learning_rate": 0.0004806031912513323, "loss": 5.5123, "mean_token_accuracy": 0.1630460724234581, "num_tokens": 32820815.0, "step": 14335 }, { "entropy": 5.639752626419067, "epoch": 1.4175563463819691, "grad_norm": 1.5625, "learning_rate": 0.00048058885454795036, "loss": 5.3892, "mean_token_accuracy": 0.18315636217594147, "num_tokens": 32832216.0, "step": 14340 }, { "entropy": 5.700220727920533, "epoch": 1.4180506128904704, "grad_norm": 1.3984375, "learning_rate": 0.0004805745127870508, "loss": 5.4666, "mean_token_accuracy": 0.17161145955324172, "num_tokens": 32845118.0, "step": 14345 }, { "entropy": 5.6551275730133055, "epoch": 1.418544879398972, "grad_norm": 1.484375, "learning_rate": 0.0004805601659689862, "loss": 5.3048, "mean_token_accuracy": 0.1845885768532753, "num_tokens": 32855662.0, "step": 14350 }, { "entropy": 5.639504289627075, "epoch": 1.4190391459074734, "grad_norm": 1.515625, "learning_rate": 0.0004805458140941097, "loss": 5.4253, "mean_token_accuracy": 0.18153348565101624, "num_tokens": 32865530.0, "step": 14355 }, { "entropy": 5.6355565071105955, "epoch": 1.4195334124159746, "grad_norm": 2.03125, "learning_rate": 0.00048053145716277424, "loss": 5.4103, "mean_token_accuracy": 0.17455045580863954, "num_tokens": 32877542.0, "step": 14360 }, { "entropy": 5.604001712799072, "epoch": 1.4200276789244761, "grad_norm": 1.4453125, "learning_rate": 0.0004805170951753331, "loss": 5.353, "mean_token_accuracy": 0.18324343115091324, "num_tokens": 32888197.0, "step": 14365 }, { "entropy": 5.632210922241211, "epoch": 1.4205219454329774, "grad_norm": 1.4296875, "learning_rate": 0.0004805027281321395, "loss": 5.3738, "mean_token_accuracy": 0.17722806483507156, "num_tokens": 32899633.0, "step": 14370 }, { "entropy": 5.548191928863526, "epoch": 1.4210162119414789, "grad_norm": 1.3203125, "learning_rate": 0.0004804883560335469, "loss": 5.3305, "mean_token_accuracy": 0.18591197431087494, "num_tokens": 32910334.0, "step": 14375 }, { "entropy": 5.695159244537353, "epoch": 1.4215104784499801, "grad_norm": 1.6796875, "learning_rate": 0.0004804739788799089, "loss": 5.4091, "mean_token_accuracy": 0.18576927334070206, "num_tokens": 32920071.0, "step": 14380 }, { "entropy": 5.610476636886597, "epoch": 1.4220047449584816, "grad_norm": 1.375, "learning_rate": 0.00048045959667157914, "loss": 5.38, "mean_token_accuracy": 0.18382232934236525, "num_tokens": 32931391.0, "step": 14385 }, { "entropy": 5.6042783737182615, "epoch": 1.422499011466983, "grad_norm": 1.375, "learning_rate": 0.0004804452094089114, "loss": 5.3625, "mean_token_accuracy": 0.1807640716433525, "num_tokens": 32941831.0, "step": 14390 }, { "entropy": 5.620062637329101, "epoch": 1.4229932779754844, "grad_norm": 1.640625, "learning_rate": 0.0004804308170922597, "loss": 5.3404, "mean_token_accuracy": 0.18507003784179688, "num_tokens": 32952949.0, "step": 14395 }, { "entropy": 5.6729881286621096, "epoch": 1.4234875444839858, "grad_norm": 1.5546875, "learning_rate": 0.0004804164197219779, "loss": 5.4439, "mean_token_accuracy": 0.17989460229873658, "num_tokens": 32964411.0, "step": 14400 }, { "entropy": 5.682026958465576, "epoch": 1.423981810992487, "grad_norm": 1.28125, "learning_rate": 0.0004804020172984204, "loss": 5.3853, "mean_token_accuracy": 0.17940158098936082, "num_tokens": 32975484.0, "step": 14405 }, { "entropy": 5.593816804885864, "epoch": 1.4244760775009886, "grad_norm": 1.296875, "learning_rate": 0.00048038760982194135, "loss": 5.2949, "mean_token_accuracy": 0.18834904432296753, "num_tokens": 32986691.0, "step": 14410 }, { "entropy": 5.609579086303711, "epoch": 1.4249703440094899, "grad_norm": 1.3046875, "learning_rate": 0.0004803731972928954, "loss": 5.3163, "mean_token_accuracy": 0.18441108167171477, "num_tokens": 32998357.0, "step": 14415 }, { "entropy": 5.66904764175415, "epoch": 1.4254646105179913, "grad_norm": 1.3671875, "learning_rate": 0.00048035877971163674, "loss": 5.3929, "mean_token_accuracy": 0.18656598627567292, "num_tokens": 33009451.0, "step": 14420 }, { "entropy": 5.507620096206665, "epoch": 1.4259588770264928, "grad_norm": 1.2578125, "learning_rate": 0.0004803443570785203, "loss": 5.2737, "mean_token_accuracy": 0.18558445572853088, "num_tokens": 33020143.0, "step": 14425 }, { "entropy": 5.563524532318115, "epoch": 1.426453143534994, "grad_norm": 1.5625, "learning_rate": 0.00048032992939390086, "loss": 5.2718, "mean_token_accuracy": 0.19021858423948287, "num_tokens": 33031448.0, "step": 14430 }, { "entropy": 5.684447813034057, "epoch": 1.4269474100434953, "grad_norm": 1.375, "learning_rate": 0.0004803154966581333, "loss": 5.3877, "mean_token_accuracy": 0.17983870953321457, "num_tokens": 33041545.0, "step": 14435 }, { "entropy": 5.606578302383423, "epoch": 1.4274416765519968, "grad_norm": 1.328125, "learning_rate": 0.00048030105887157253, "loss": 5.3479, "mean_token_accuracy": 0.18550915122032166, "num_tokens": 33051681.0, "step": 14440 }, { "entropy": 5.697551631927491, "epoch": 1.4279359430604983, "grad_norm": 1.4140625, "learning_rate": 0.00048028661603457406, "loss": 5.3928, "mean_token_accuracy": 0.1820794641971588, "num_tokens": 33062735.0, "step": 14445 }, { "entropy": 5.568870639801025, "epoch": 1.4284302095689996, "grad_norm": 1.3359375, "learning_rate": 0.0004802721681474929, "loss": 5.2552, "mean_token_accuracy": 0.19466136991977692, "num_tokens": 33073975.0, "step": 14450 }, { "entropy": 5.599568557739258, "epoch": 1.428924476077501, "grad_norm": 1.4140625, "learning_rate": 0.00048025771521068456, "loss": 5.3619, "mean_token_accuracy": 0.18302928954362868, "num_tokens": 33086928.0, "step": 14455 }, { "entropy": 5.6740195751190186, "epoch": 1.4294187425860023, "grad_norm": 1.2734375, "learning_rate": 0.00048024325722450454, "loss": 5.5036, "mean_token_accuracy": 0.17859254628419877, "num_tokens": 33099073.0, "step": 14460 }, { "entropy": 5.719235181808472, "epoch": 1.4299130090945038, "grad_norm": 1.2734375, "learning_rate": 0.0004802287941893087, "loss": 5.3685, "mean_token_accuracy": 0.17799197733402253, "num_tokens": 33110245.0, "step": 14465 }, { "entropy": 5.6248149394989015, "epoch": 1.430407275603005, "grad_norm": 1.2265625, "learning_rate": 0.0004802143261054525, "loss": 5.3428, "mean_token_accuracy": 0.18073080480098724, "num_tokens": 33121659.0, "step": 14470 }, { "entropy": 5.596703433990479, "epoch": 1.4309015421115066, "grad_norm": 1.21875, "learning_rate": 0.00048019985297329215, "loss": 5.415, "mean_token_accuracy": 0.1760291948914528, "num_tokens": 33133296.0, "step": 14475 }, { "entropy": 5.616138505935669, "epoch": 1.431395808620008, "grad_norm": 1.25, "learning_rate": 0.0004801853747931836, "loss": 5.4193, "mean_token_accuracy": 0.1771381080150604, "num_tokens": 33145069.0, "step": 14480 }, { "entropy": 5.683020067214966, "epoch": 1.4318900751285093, "grad_norm": 1.296875, "learning_rate": 0.00048017089156548293, "loss": 5.4134, "mean_token_accuracy": 0.1787265807390213, "num_tokens": 33156089.0, "step": 14485 }, { "entropy": 5.733552122116089, "epoch": 1.4323843416370106, "grad_norm": 1.46875, "learning_rate": 0.00048015640329054655, "loss": 5.3829, "mean_token_accuracy": 0.1780915677547455, "num_tokens": 33168300.0, "step": 14490 }, { "entropy": 5.55993766784668, "epoch": 1.432878608145512, "grad_norm": 1.3515625, "learning_rate": 0.00048014190996873075, "loss": 5.272, "mean_token_accuracy": 0.19346413612365723, "num_tokens": 33179072.0, "step": 14495 }, { "entropy": 5.580727434158325, "epoch": 1.4333728746540135, "grad_norm": 1.3203125, "learning_rate": 0.00048012741160039223, "loss": 5.3292, "mean_token_accuracy": 0.18078672736883164, "num_tokens": 33190888.0, "step": 14500 }, { "entropy": 5.663186931610108, "epoch": 1.4338671411625148, "grad_norm": 1.2109375, "learning_rate": 0.0004801129081858875, "loss": 5.4342, "mean_token_accuracy": 0.17907172739505767, "num_tokens": 33202747.0, "step": 14505 }, { "entropy": 5.684048700332641, "epoch": 1.4343614076710163, "grad_norm": 1.3671875, "learning_rate": 0.0004800983997255735, "loss": 5.3817, "mean_token_accuracy": 0.18273817002773285, "num_tokens": 33213917.0, "step": 14510 }, { "entropy": 5.59083662033081, "epoch": 1.4348556741795175, "grad_norm": 1.359375, "learning_rate": 0.0004800838862198069, "loss": 5.3334, "mean_token_accuracy": 0.17874141037464142, "num_tokens": 33223924.0, "step": 14515 }, { "entropy": 5.618529605865478, "epoch": 1.435349940688019, "grad_norm": 1.3984375, "learning_rate": 0.000480069367668945, "loss": 5.2909, "mean_token_accuracy": 0.18572077304124832, "num_tokens": 33234487.0, "step": 14520 }, { "entropy": 5.598186922073364, "epoch": 1.4358442071965203, "grad_norm": 1.734375, "learning_rate": 0.00048005484407334474, "loss": 5.386, "mean_token_accuracy": 0.18556090593338012, "num_tokens": 33245585.0, "step": 14525 }, { "entropy": 5.606752204895019, "epoch": 1.4363384737050218, "grad_norm": 1.5390625, "learning_rate": 0.0004800403154333636, "loss": 5.2933, "mean_token_accuracy": 0.18794708997011184, "num_tokens": 33256545.0, "step": 14530 }, { "entropy": 5.580558729171753, "epoch": 1.4368327402135233, "grad_norm": 1.4609375, "learning_rate": 0.0004800257817493589, "loss": 5.2852, "mean_token_accuracy": 0.1874091848731041, "num_tokens": 33267946.0, "step": 14535 }, { "entropy": 5.604639720916748, "epoch": 1.4373270067220245, "grad_norm": 1.7109375, "learning_rate": 0.00048001124302168814, "loss": 5.3185, "mean_token_accuracy": 0.1865818217396736, "num_tokens": 33279099.0, "step": 14540 }, { "entropy": 5.683906126022339, "epoch": 1.4378212732305258, "grad_norm": 1.3359375, "learning_rate": 0.0004799966992507089, "loss": 5.4147, "mean_token_accuracy": 0.1787988394498825, "num_tokens": 33290544.0, "step": 14545 }, { "entropy": 5.591766595840454, "epoch": 1.4383155397390273, "grad_norm": 1.3046875, "learning_rate": 0.00047998215043677914, "loss": 5.268, "mean_token_accuracy": 0.18995272368192673, "num_tokens": 33302317.0, "step": 14550 }, { "entropy": 5.580928659439087, "epoch": 1.4388098062475287, "grad_norm": 1.359375, "learning_rate": 0.0004799675965802567, "loss": 5.3077, "mean_token_accuracy": 0.1868557170033455, "num_tokens": 33313553.0, "step": 14555 }, { "entropy": 5.645744895935058, "epoch": 1.43930407275603, "grad_norm": 1.2734375, "learning_rate": 0.00047995303768149955, "loss": 5.3678, "mean_token_accuracy": 0.1820383131504059, "num_tokens": 33324610.0, "step": 14560 }, { "entropy": 5.574640274047852, "epoch": 1.4397983392645315, "grad_norm": 1.4453125, "learning_rate": 0.0004799384737408659, "loss": 5.3641, "mean_token_accuracy": 0.18238909542560577, "num_tokens": 33335562.0, "step": 14565 }, { "entropy": 5.696072626113891, "epoch": 1.4402926057730328, "grad_norm": 1.3125, "learning_rate": 0.00047992390475871396, "loss": 5.4947, "mean_token_accuracy": 0.17222489416599274, "num_tokens": 33346778.0, "step": 14570 }, { "entropy": 5.667906379699707, "epoch": 1.4407868722815342, "grad_norm": 1.421875, "learning_rate": 0.0004799093307354022, "loss": 5.3618, "mean_token_accuracy": 0.1750493198633194, "num_tokens": 33358712.0, "step": 14575 }, { "entropy": 5.6158068656921385, "epoch": 1.4412811387900355, "grad_norm": 2.171875, "learning_rate": 0.0004798947516712891, "loss": 5.3751, "mean_token_accuracy": 0.18001998364925384, "num_tokens": 33369293.0, "step": 14580 }, { "entropy": 5.661997842788696, "epoch": 1.441775405298537, "grad_norm": 1.3125, "learning_rate": 0.00047988016756673335, "loss": 5.4379, "mean_token_accuracy": 0.17685143798589706, "num_tokens": 33383119.0, "step": 14585 }, { "entropy": 5.667682361602783, "epoch": 1.4422696718070385, "grad_norm": 1.25, "learning_rate": 0.0004798655784220937, "loss": 5.3517, "mean_token_accuracy": 0.18535353243350983, "num_tokens": 33395334.0, "step": 14590 }, { "entropy": 5.51068754196167, "epoch": 1.4427639383155397, "grad_norm": 1.46875, "learning_rate": 0.000479850984237729, "loss": 5.2635, "mean_token_accuracy": 0.19356120079755784, "num_tokens": 33406676.0, "step": 14595 }, { "entropy": 5.705871438980102, "epoch": 1.443258204824041, "grad_norm": 2.046875, "learning_rate": 0.0004798363850139983, "loss": 5.4089, "mean_token_accuracy": 0.17501930743455887, "num_tokens": 33419153.0, "step": 14600 }, { "entropy": 5.617748403549195, "epoch": 1.4437524713325425, "grad_norm": 1.25, "learning_rate": 0.0004798217807512608, "loss": 5.296, "mean_token_accuracy": 0.18446858376264572, "num_tokens": 33430146.0, "step": 14605 }, { "entropy": 5.632235765457153, "epoch": 1.444246737841044, "grad_norm": 1.5, "learning_rate": 0.00047980717144987574, "loss": 5.4431, "mean_token_accuracy": 0.17428609281778334, "num_tokens": 33441484.0, "step": 14610 }, { "entropy": 5.666584444046021, "epoch": 1.4447410043495452, "grad_norm": 1.390625, "learning_rate": 0.00047979255711020236, "loss": 5.2821, "mean_token_accuracy": 0.18434666842222214, "num_tokens": 33451817.0, "step": 14615 }, { "entropy": 5.581913089752197, "epoch": 1.4452352708580467, "grad_norm": 1.328125, "learning_rate": 0.0004797779377326004, "loss": 5.3709, "mean_token_accuracy": 0.1810087189078331, "num_tokens": 33463805.0, "step": 14620 }, { "entropy": 5.60614013671875, "epoch": 1.445729537366548, "grad_norm": 1.421875, "learning_rate": 0.0004797633133174295, "loss": 5.4005, "mean_token_accuracy": 0.17057690471410752, "num_tokens": 33475931.0, "step": 14625 }, { "entropy": 5.6683330059051515, "epoch": 1.4462238038750495, "grad_norm": 1.3046875, "learning_rate": 0.0004797486838650491, "loss": 5.3275, "mean_token_accuracy": 0.18055067509412764, "num_tokens": 33487306.0, "step": 14630 }, { "entropy": 5.612042379379273, "epoch": 1.4467180703835507, "grad_norm": 1.828125, "learning_rate": 0.0004797340493758195, "loss": 5.3693, "mean_token_accuracy": 0.17981306463479996, "num_tokens": 33499049.0, "step": 14635 }, { "entropy": 5.627777528762818, "epoch": 1.4472123368920522, "grad_norm": 1.5859375, "learning_rate": 0.0004797194098501004, "loss": 5.3484, "mean_token_accuracy": 0.18871730715036392, "num_tokens": 33509626.0, "step": 14640 }, { "entropy": 5.622543001174927, "epoch": 1.4477066034005537, "grad_norm": 1.8203125, "learning_rate": 0.0004797047652882521, "loss": 5.4133, "mean_token_accuracy": 0.17613703310489653, "num_tokens": 33521510.0, "step": 14645 }, { "entropy": 5.574356555938721, "epoch": 1.448200869909055, "grad_norm": 1.2890625, "learning_rate": 0.00047969011569063487, "loss": 5.3423, "mean_token_accuracy": 0.18178556263446807, "num_tokens": 33532622.0, "step": 14650 }, { "entropy": 5.5780839920043945, "epoch": 1.4486951364175564, "grad_norm": 1.4296875, "learning_rate": 0.0004796754610576091, "loss": 5.3044, "mean_token_accuracy": 0.1923196479678154, "num_tokens": 33544196.0, "step": 14655 }, { "entropy": 5.6785729885101315, "epoch": 1.4491894029260577, "grad_norm": 1.7265625, "learning_rate": 0.00047966080138953505, "loss": 5.4051, "mean_token_accuracy": 0.1795321062207222, "num_tokens": 33554927.0, "step": 14660 }, { "entropy": 5.669644927978515, "epoch": 1.4496836694345592, "grad_norm": 1.34375, "learning_rate": 0.0004796461366867736, "loss": 5.4302, "mean_token_accuracy": 0.1686223939061165, "num_tokens": 33566412.0, "step": 14665 }, { "entropy": 5.5711634159088135, "epoch": 1.4501779359430604, "grad_norm": 1.5625, "learning_rate": 0.00047963146694968546, "loss": 5.3479, "mean_token_accuracy": 0.18360590636730195, "num_tokens": 33578010.0, "step": 14670 }, { "entropy": 5.643803644180298, "epoch": 1.450672202451562, "grad_norm": 1.375, "learning_rate": 0.0004796167921786315, "loss": 5.4302, "mean_token_accuracy": 0.17864201962947845, "num_tokens": 33589647.0, "step": 14675 }, { "entropy": 5.730944204330444, "epoch": 1.4511664689600634, "grad_norm": 2.09375, "learning_rate": 0.00047960211237397274, "loss": 5.5316, "mean_token_accuracy": 0.17348184138536454, "num_tokens": 33601292.0, "step": 14680 }, { "entropy": 5.689969062805176, "epoch": 1.4516607354685647, "grad_norm": 1.3359375, "learning_rate": 0.00047958742753607015, "loss": 5.3746, "mean_token_accuracy": 0.18604425042867662, "num_tokens": 33612878.0, "step": 14685 }, { "entropy": 5.6125401020050045, "epoch": 1.452155001977066, "grad_norm": 1.4453125, "learning_rate": 0.00047957273766528524, "loss": 5.3719, "mean_token_accuracy": 0.18531243354082108, "num_tokens": 33625680.0, "step": 14690 }, { "entropy": 5.587348461151123, "epoch": 1.4526492684855674, "grad_norm": 1.7109375, "learning_rate": 0.0004795580427619791, "loss": 5.312, "mean_token_accuracy": 0.18208350688219072, "num_tokens": 33637066.0, "step": 14695 }, { "entropy": 5.6511941909790036, "epoch": 1.453143534994069, "grad_norm": 1.421875, "learning_rate": 0.00047954334282651357, "loss": 5.4694, "mean_token_accuracy": 0.17673402577638625, "num_tokens": 33648213.0, "step": 14700 }, { "entropy": 5.667943525314331, "epoch": 1.4536378015025702, "grad_norm": 2.390625, "learning_rate": 0.0004795286378592499, "loss": 5.3321, "mean_token_accuracy": 0.18379795253276826, "num_tokens": 33661582.0, "step": 14705 }, { "entropy": 5.605260801315308, "epoch": 1.4541320680110716, "grad_norm": 1.375, "learning_rate": 0.0004795139278605501, "loss": 5.3244, "mean_token_accuracy": 0.18694020211696624, "num_tokens": 33673122.0, "step": 14710 }, { "entropy": 5.66150803565979, "epoch": 1.454626334519573, "grad_norm": 1.734375, "learning_rate": 0.00047949921283077594, "loss": 5.3201, "mean_token_accuracy": 0.18457397520542146, "num_tokens": 33683926.0, "step": 14715 }, { "entropy": 5.630133533477784, "epoch": 1.4551206010280744, "grad_norm": 1.5546875, "learning_rate": 0.0004794844927702894, "loss": 5.3744, "mean_token_accuracy": 0.18353369385004042, "num_tokens": 33694529.0, "step": 14720 }, { "entropy": 5.634875106811523, "epoch": 1.4556148675365757, "grad_norm": 1.578125, "learning_rate": 0.0004794697676794526, "loss": 5.3737, "mean_token_accuracy": 0.18258169889450074, "num_tokens": 33704618.0, "step": 14725 }, { "entropy": 5.579412269592285, "epoch": 1.4561091340450771, "grad_norm": 1.2421875, "learning_rate": 0.0004794550375586278, "loss": 5.3126, "mean_token_accuracy": 0.17945686131715774, "num_tokens": 33716354.0, "step": 14730 }, { "entropy": 5.59295973777771, "epoch": 1.4566034005535786, "grad_norm": 1.4375, "learning_rate": 0.0004794403024081774, "loss": 5.2918, "mean_token_accuracy": 0.19096234291791916, "num_tokens": 33728065.0, "step": 14735 }, { "entropy": 5.6533135890960695, "epoch": 1.4570976670620799, "grad_norm": 1.4453125, "learning_rate": 0.0004794255622284638, "loss": 5.3909, "mean_token_accuracy": 0.1789734572172165, "num_tokens": 33740207.0, "step": 14740 }, { "entropy": 5.674638748168945, "epoch": 1.4575919335705811, "grad_norm": 1.4765625, "learning_rate": 0.00047941081701984966, "loss": 5.3328, "mean_token_accuracy": 0.1822485476732254, "num_tokens": 33750768.0, "step": 14745 }, { "entropy": 5.612480306625367, "epoch": 1.4580862000790826, "grad_norm": 1.3828125, "learning_rate": 0.00047939606678269774, "loss": 5.3852, "mean_token_accuracy": 0.1883511036634445, "num_tokens": 33762029.0, "step": 14750 }, { "entropy": 5.574562501907349, "epoch": 1.4585804665875841, "grad_norm": 1.359375, "learning_rate": 0.0004793813115173708, "loss": 5.2925, "mean_token_accuracy": 0.19058095961809157, "num_tokens": 33773483.0, "step": 14755 }, { "entropy": 5.6138105392456055, "epoch": 1.4590747330960854, "grad_norm": 1.5390625, "learning_rate": 0.000479366551224232, "loss": 5.336, "mean_token_accuracy": 0.18321554660797118, "num_tokens": 33784404.0, "step": 14760 }, { "entropy": 5.57039155960083, "epoch": 1.4595689996045869, "grad_norm": 1.75, "learning_rate": 0.0004793517859036443, "loss": 5.3379, "mean_token_accuracy": 0.18563806414604186, "num_tokens": 33794625.0, "step": 14765 }, { "entropy": 5.6151659965515135, "epoch": 1.4600632661130881, "grad_norm": 1.5625, "learning_rate": 0.0004793370155559709, "loss": 5.3813, "mean_token_accuracy": 0.18430256098508835, "num_tokens": 33805872.0, "step": 14770 }, { "entropy": 5.544369125366211, "epoch": 1.4605575326215896, "grad_norm": 1.625, "learning_rate": 0.0004793222401815753, "loss": 5.2082, "mean_token_accuracy": 0.19724307656288148, "num_tokens": 33815979.0, "step": 14775 }, { "entropy": 5.6172308921813965, "epoch": 1.4610517991300909, "grad_norm": 1.8359375, "learning_rate": 0.0004793074597808208, "loss": 5.4079, "mean_token_accuracy": 0.1793598398566246, "num_tokens": 33827571.0, "step": 14780 }, { "entropy": 5.597890138626099, "epoch": 1.4615460656385924, "grad_norm": 1.4453125, "learning_rate": 0.00047929267435407115, "loss": 5.3719, "mean_token_accuracy": 0.17711426466703414, "num_tokens": 33838749.0, "step": 14785 }, { "entropy": 5.662248945236206, "epoch": 1.4620403321470938, "grad_norm": 1.53125, "learning_rate": 0.00047927788390168997, "loss": 5.3564, "mean_token_accuracy": 0.1814606159925461, "num_tokens": 33849494.0, "step": 14790 }, { "entropy": 5.693349552154541, "epoch": 1.462534598655595, "grad_norm": 1.4921875, "learning_rate": 0.00047926308842404126, "loss": 5.4203, "mean_token_accuracy": 0.17738244980573653, "num_tokens": 33860586.0, "step": 14795 }, { "entropy": 5.560922241210937, "epoch": 1.4630288651640964, "grad_norm": 1.4375, "learning_rate": 0.0004792482879214888, "loss": 5.1987, "mean_token_accuracy": 0.19594061523675918, "num_tokens": 33871261.0, "step": 14800 }, { "entropy": 5.586266946792603, "epoch": 1.4635231316725978, "grad_norm": 1.296875, "learning_rate": 0.0004792334823943968, "loss": 5.339, "mean_token_accuracy": 0.19146328121423722, "num_tokens": 33883160.0, "step": 14805 }, { "entropy": 5.6598132133483885, "epoch": 1.4640173981810993, "grad_norm": 1.4375, "learning_rate": 0.0004792186718431294, "loss": 5.3454, "mean_token_accuracy": 0.18808734118938447, "num_tokens": 33894250.0, "step": 14810 }, { "entropy": 5.581802940368652, "epoch": 1.4645116646896006, "grad_norm": 1.46875, "learning_rate": 0.000479203856268051, "loss": 5.3342, "mean_token_accuracy": 0.18571853786706924, "num_tokens": 33905076.0, "step": 14815 }, { "entropy": 5.518166732788086, "epoch": 1.465005931198102, "grad_norm": 1.8203125, "learning_rate": 0.0004791890356695261, "loss": 5.3344, "mean_token_accuracy": 0.18704134076833726, "num_tokens": 33916982.0, "step": 14820 }, { "entropy": 5.71618881225586, "epoch": 1.4655001977066033, "grad_norm": 1.5234375, "learning_rate": 0.0004791742100479193, "loss": 5.4066, "mean_token_accuracy": 0.17929370254278182, "num_tokens": 33928306.0, "step": 14825 }, { "entropy": 5.745555257797241, "epoch": 1.4659944642151048, "grad_norm": 1.34375, "learning_rate": 0.0004791593794035952, "loss": 5.4343, "mean_token_accuracy": 0.17960487604141234, "num_tokens": 33940371.0, "step": 14830 }, { "entropy": 5.645412349700928, "epoch": 1.466488730723606, "grad_norm": 1.46875, "learning_rate": 0.0004791445437369187, "loss": 5.3945, "mean_token_accuracy": 0.1763386607170105, "num_tokens": 33952250.0, "step": 14835 }, { "entropy": 5.656629753112793, "epoch": 1.4669829972321076, "grad_norm": 1.53125, "learning_rate": 0.0004791297030482547, "loss": 5.3727, "mean_token_accuracy": 0.18149725198745728, "num_tokens": 33963426.0, "step": 14840 }, { "entropy": 5.589711332321167, "epoch": 1.467477263740609, "grad_norm": 1.328125, "learning_rate": 0.0004791148573379684, "loss": 5.3499, "mean_token_accuracy": 0.1780073583126068, "num_tokens": 33974982.0, "step": 14845 }, { "entropy": 5.5783624172210695, "epoch": 1.4679715302491103, "grad_norm": 1.390625, "learning_rate": 0.00047910000660642487, "loss": 5.3534, "mean_token_accuracy": 0.18175674527883529, "num_tokens": 33986413.0, "step": 14850 }, { "entropy": 5.66426191329956, "epoch": 1.4684657967576116, "grad_norm": 1.390625, "learning_rate": 0.0004790851508539896, "loss": 5.297, "mean_token_accuracy": 0.18410698622465133, "num_tokens": 33996821.0, "step": 14855 }, { "entropy": 5.592700386047364, "epoch": 1.468960063266113, "grad_norm": 1.2578125, "learning_rate": 0.0004790702900810279, "loss": 5.3648, "mean_token_accuracy": 0.17952213436365128, "num_tokens": 34008817.0, "step": 14860 }, { "entropy": 5.567141056060791, "epoch": 1.4694543297746145, "grad_norm": 1.8359375, "learning_rate": 0.00047905542428790536, "loss": 5.358, "mean_token_accuracy": 0.18273835480213166, "num_tokens": 34020051.0, "step": 14865 }, { "entropy": 5.599887275695801, "epoch": 1.4699485962831158, "grad_norm": 1.5546875, "learning_rate": 0.0004790405534749878, "loss": 5.3029, "mean_token_accuracy": 0.1902901217341423, "num_tokens": 34032764.0, "step": 14870 }, { "entropy": 5.639361333847046, "epoch": 1.4704428627916173, "grad_norm": 1.5, "learning_rate": 0.000479025677642641, "loss": 5.3703, "mean_token_accuracy": 0.17783863842487335, "num_tokens": 34042868.0, "step": 14875 }, { "entropy": 5.629166746139527, "epoch": 1.4709371293001186, "grad_norm": 1.6484375, "learning_rate": 0.0004790107967912309, "loss": 5.3929, "mean_token_accuracy": 0.18257658332586288, "num_tokens": 34054807.0, "step": 14880 }, { "entropy": 5.662144660949707, "epoch": 1.47143139580862, "grad_norm": 1.859375, "learning_rate": 0.00047899591092112343, "loss": 5.4128, "mean_token_accuracy": 0.1783519834280014, "num_tokens": 34066378.0, "step": 14885 }, { "entropy": 5.615582084655761, "epoch": 1.4719256623171213, "grad_norm": 1.6484375, "learning_rate": 0.000478981020032685, "loss": 5.3865, "mean_token_accuracy": 0.17028851956129074, "num_tokens": 34078267.0, "step": 14890 }, { "entropy": 5.645502710342408, "epoch": 1.4724199288256228, "grad_norm": 1.4140625, "learning_rate": 0.00047896612412628184, "loss": 5.4083, "mean_token_accuracy": 0.17240892648696898, "num_tokens": 34090356.0, "step": 14895 }, { "entropy": 5.6976823806762695, "epoch": 1.4729141953341243, "grad_norm": 1.65625, "learning_rate": 0.00047895122320228026, "loss": 5.3396, "mean_token_accuracy": 0.1850088730454445, "num_tokens": 34101143.0, "step": 14900 }, { "entropy": 5.593738746643067, "epoch": 1.4734084618426255, "grad_norm": 1.2890625, "learning_rate": 0.00047893631726104703, "loss": 5.3688, "mean_token_accuracy": 0.18088444620370864, "num_tokens": 34112655.0, "step": 14905 }, { "entropy": 5.615711688995361, "epoch": 1.4739027283511268, "grad_norm": 1.5859375, "learning_rate": 0.0004789214063029488, "loss": 5.3873, "mean_token_accuracy": 0.18227738440036773, "num_tokens": 34123825.0, "step": 14910 }, { "entropy": 5.62659273147583, "epoch": 1.4743969948596283, "grad_norm": 1.3828125, "learning_rate": 0.00047890649032835233, "loss": 5.3672, "mean_token_accuracy": 0.18306371867656707, "num_tokens": 34135416.0, "step": 14915 }, { "entropy": 5.672122526168823, "epoch": 1.4748912613681298, "grad_norm": 1.4375, "learning_rate": 0.0004788915693376245, "loss": 5.402, "mean_token_accuracy": 0.180454520881176, "num_tokens": 34146797.0, "step": 14920 }, { "entropy": 5.705274295806885, "epoch": 1.475385527876631, "grad_norm": 1.9609375, "learning_rate": 0.00047887664333113244, "loss": 5.4239, "mean_token_accuracy": 0.1766470640897751, "num_tokens": 34158749.0, "step": 14925 }, { "entropy": 5.603371286392212, "epoch": 1.4758797943851325, "grad_norm": 1.5390625, "learning_rate": 0.0004788617123092434, "loss": 5.2922, "mean_token_accuracy": 0.1885598421096802, "num_tokens": 34169694.0, "step": 14930 }, { "entropy": 5.615245246887207, "epoch": 1.4763740608936338, "grad_norm": 2.21875, "learning_rate": 0.0004788467762723245, "loss": 5.4114, "mean_token_accuracy": 0.1805598571896553, "num_tokens": 34182166.0, "step": 14935 }, { "entropy": 5.634717798233032, "epoch": 1.4768683274021353, "grad_norm": 1.2578125, "learning_rate": 0.00047883183522074335, "loss": 5.3035, "mean_token_accuracy": 0.18629665821790695, "num_tokens": 34193651.0, "step": 14940 }, { "entropy": 5.6833878517150875, "epoch": 1.4773625939106365, "grad_norm": 1.3359375, "learning_rate": 0.00047881688915486743, "loss": 5.4213, "mean_token_accuracy": 0.17869849354028702, "num_tokens": 34204173.0, "step": 14945 }, { "entropy": 5.597486066818237, "epoch": 1.477856860419138, "grad_norm": 1.4609375, "learning_rate": 0.00047880193807506446, "loss": 5.3334, "mean_token_accuracy": 0.19496313184499742, "num_tokens": 34214872.0, "step": 14950 }, { "entropy": 5.629118156433106, "epoch": 1.4783511269276395, "grad_norm": 1.640625, "learning_rate": 0.0004787869819817021, "loss": 5.3415, "mean_token_accuracy": 0.18141088783740997, "num_tokens": 34226433.0, "step": 14955 }, { "entropy": 5.576784658432007, "epoch": 1.4788453934361407, "grad_norm": 1.9296875, "learning_rate": 0.00047877202087514843, "loss": 5.3673, "mean_token_accuracy": 0.18549707531929016, "num_tokens": 34238047.0, "step": 14960 }, { "entropy": 5.634697961807251, "epoch": 1.4793396599446422, "grad_norm": 1.3125, "learning_rate": 0.0004787570547557715, "loss": 5.3913, "mean_token_accuracy": 0.18384256958961487, "num_tokens": 34250445.0, "step": 14965 }, { "entropy": 5.6461282730102536, "epoch": 1.4798339264531435, "grad_norm": 1.4609375, "learning_rate": 0.00047874208362393925, "loss": 5.2671, "mean_token_accuracy": 0.18621405214071274, "num_tokens": 34261324.0, "step": 14970 }, { "entropy": 5.609235572814941, "epoch": 1.480328192961645, "grad_norm": 1.4453125, "learning_rate": 0.00047872710748002024, "loss": 5.3665, "mean_token_accuracy": 0.18379658907651902, "num_tokens": 34272074.0, "step": 14975 }, { "entropy": 5.549933052062988, "epoch": 1.4808224594701462, "grad_norm": 1.5078125, "learning_rate": 0.0004787121263243827, "loss": 5.3333, "mean_token_accuracy": 0.18016744703054427, "num_tokens": 34282958.0, "step": 14980 }, { "entropy": 5.621416664123535, "epoch": 1.4813167259786477, "grad_norm": 1.4453125, "learning_rate": 0.00047869714015739533, "loss": 5.2779, "mean_token_accuracy": 0.18833871483802794, "num_tokens": 34294999.0, "step": 14985 }, { "entropy": 5.649327230453491, "epoch": 1.4818109924871492, "grad_norm": 1.5390625, "learning_rate": 0.00047868214897942675, "loss": 5.3175, "mean_token_accuracy": 0.18065880984067917, "num_tokens": 34305363.0, "step": 14990 }, { "entropy": 5.6238977909088135, "epoch": 1.4823052589956505, "grad_norm": 1.375, "learning_rate": 0.0004786671527908456, "loss": 5.4132, "mean_token_accuracy": 0.1785098761320114, "num_tokens": 34317467.0, "step": 14995 }, { "entropy": 5.6816877841949465, "epoch": 1.4827995255041517, "grad_norm": 1.65625, "learning_rate": 0.000478652151592021, "loss": 5.4319, "mean_token_accuracy": 0.17484955340623856, "num_tokens": 34331058.0, "step": 15000 }, { "epoch": 1.4827995255041517, "eval_entropy": 5.423371398874168, "eval_loss": 5.422661304473877, "eval_mean_token_accuracy": 0.1868826922308768, "eval_num_tokens": 34331058.0, "eval_runtime": 26.577, "eval_samples_per_second": 1223.349, "eval_steps_per_second": 152.952, "step": 15000 }, { "entropy": 5.617215776443482, "epoch": 1.4832937920126532, "grad_norm": 1.5859375, "learning_rate": 0.0004786371453833217, "loss": 5.4065, "mean_token_accuracy": 0.18247174173593522, "num_tokens": 34342593.0, "step": 15005 }, { "entropy": 5.674700450897217, "epoch": 1.4837880585211547, "grad_norm": 1.4296875, "learning_rate": 0.00047862213416511717, "loss": 5.3839, "mean_token_accuracy": 0.17913443297147752, "num_tokens": 34353507.0, "step": 15010 }, { "entropy": 5.575383567810059, "epoch": 1.484282325029656, "grad_norm": 1.359375, "learning_rate": 0.0004786071179377766, "loss": 5.2837, "mean_token_accuracy": 0.1940351888537407, "num_tokens": 34365606.0, "step": 15015 }, { "entropy": 5.60756778717041, "epoch": 1.4847765915381574, "grad_norm": 1.609375, "learning_rate": 0.0004785920967016692, "loss": 5.3131, "mean_token_accuracy": 0.18299914747476578, "num_tokens": 34375925.0, "step": 15020 }, { "entropy": 5.669091081619262, "epoch": 1.4852708580466587, "grad_norm": 1.4765625, "learning_rate": 0.00047857707045716473, "loss": 5.4123, "mean_token_accuracy": 0.18027361631393432, "num_tokens": 34387806.0, "step": 15025 }, { "entropy": 5.611959981918335, "epoch": 1.4857651245551602, "grad_norm": 1.4453125, "learning_rate": 0.00047856203920463273, "loss": 5.2747, "mean_token_accuracy": 0.1909378230571747, "num_tokens": 34400367.0, "step": 15030 }, { "entropy": 5.576943254470825, "epoch": 1.4862593910636615, "grad_norm": 1.8671875, "learning_rate": 0.000478547002944443, "loss": 5.3497, "mean_token_accuracy": 0.18589189946651458, "num_tokens": 34412082.0, "step": 15035 }, { "entropy": 5.598098707199097, "epoch": 1.486753657572163, "grad_norm": 1.5234375, "learning_rate": 0.0004785319616769654, "loss": 5.3018, "mean_token_accuracy": 0.18902516961097718, "num_tokens": 34423315.0, "step": 15040 }, { "entropy": 5.659210872650147, "epoch": 1.4872479240806644, "grad_norm": 1.625, "learning_rate": 0.00047851691540256995, "loss": 5.3467, "mean_token_accuracy": 0.17677914798259736, "num_tokens": 34433748.0, "step": 15045 }, { "entropy": 5.602761507034302, "epoch": 1.4877421905891657, "grad_norm": 1.671875, "learning_rate": 0.00047850186412162684, "loss": 5.3128, "mean_token_accuracy": 0.1851986452937126, "num_tokens": 34444425.0, "step": 15050 }, { "entropy": 5.604499626159668, "epoch": 1.488236457097667, "grad_norm": 1.609375, "learning_rate": 0.0004784868078345063, "loss": 5.371, "mean_token_accuracy": 0.17852768152952195, "num_tokens": 34456350.0, "step": 15055 }, { "entropy": 5.699484825134277, "epoch": 1.4887307236061684, "grad_norm": 2.234375, "learning_rate": 0.0004784717465415787, "loss": 5.4423, "mean_token_accuracy": 0.17603701055049897, "num_tokens": 34466606.0, "step": 15060 }, { "entropy": 5.644379138946533, "epoch": 1.48922499011467, "grad_norm": 1.3203125, "learning_rate": 0.00047845668024321455, "loss": 5.3416, "mean_token_accuracy": 0.17729568034410476, "num_tokens": 34478085.0, "step": 15065 }, { "entropy": 5.585989332199096, "epoch": 1.4897192566231712, "grad_norm": 1.8046875, "learning_rate": 0.0004784416089397846, "loss": 5.4402, "mean_token_accuracy": 0.17838693410158157, "num_tokens": 34488437.0, "step": 15070 }, { "entropy": 5.661489820480346, "epoch": 1.4902135231316727, "grad_norm": 1.3203125, "learning_rate": 0.0004784265326316594, "loss": 5.3424, "mean_token_accuracy": 0.1784212201833725, "num_tokens": 34499999.0, "step": 15075 }, { "entropy": 5.649656057357788, "epoch": 1.490707789640174, "grad_norm": 1.6328125, "learning_rate": 0.00047841145131921, "loss": 5.3981, "mean_token_accuracy": 0.18453755974769592, "num_tokens": 34510509.0, "step": 15080 }, { "entropy": 5.631809711456299, "epoch": 1.4912020561486754, "grad_norm": 1.3828125, "learning_rate": 0.00047839636500280724, "loss": 5.3683, "mean_token_accuracy": 0.18088580518960953, "num_tokens": 34521192.0, "step": 15085 }, { "entropy": 5.712775325775146, "epoch": 1.4916963226571767, "grad_norm": 1.8515625, "learning_rate": 0.0004783812736828225, "loss": 5.3719, "mean_token_accuracy": 0.18623314797878265, "num_tokens": 34532401.0, "step": 15090 }, { "entropy": 5.645899915695191, "epoch": 1.4921905891656781, "grad_norm": 1.5390625, "learning_rate": 0.00047836617735962675, "loss": 5.3545, "mean_token_accuracy": 0.1802325502038002, "num_tokens": 34544306.0, "step": 15095 }, { "entropy": 5.545193767547607, "epoch": 1.4926848556741796, "grad_norm": 1.2734375, "learning_rate": 0.0004783510760335915, "loss": 5.3018, "mean_token_accuracy": 0.18025859892368318, "num_tokens": 34557122.0, "step": 15100 }, { "entropy": 5.589693403244018, "epoch": 1.493179122182681, "grad_norm": 1.4609375, "learning_rate": 0.0004783359697050883, "loss": 5.3085, "mean_token_accuracy": 0.18609167486429215, "num_tokens": 34568302.0, "step": 15105 }, { "entropy": 5.639269113540649, "epoch": 1.4936733886911822, "grad_norm": 1.34375, "learning_rate": 0.00047832085837448864, "loss": 5.2383, "mean_token_accuracy": 0.19049194008111953, "num_tokens": 34578536.0, "step": 15110 }, { "entropy": 5.596101903915406, "epoch": 1.4941676551996836, "grad_norm": 1.6953125, "learning_rate": 0.00047830574204216436, "loss": 5.3497, "mean_token_accuracy": 0.17946695685386657, "num_tokens": 34590333.0, "step": 15115 }, { "entropy": 5.646733188629151, "epoch": 1.4946619217081851, "grad_norm": 1.5859375, "learning_rate": 0.0004782906207084873, "loss": 5.3667, "mean_token_accuracy": 0.17681428641080857, "num_tokens": 34601447.0, "step": 15120 }, { "entropy": 5.644145345687866, "epoch": 1.4951561882166864, "grad_norm": 1.71875, "learning_rate": 0.0004782754943738294, "loss": 5.3793, "mean_token_accuracy": 0.17728787213563918, "num_tokens": 34613559.0, "step": 15125 }, { "entropy": 5.623290920257569, "epoch": 1.4956504547251879, "grad_norm": 1.765625, "learning_rate": 0.0004782603630385628, "loss": 5.3809, "mean_token_accuracy": 0.18217939585447313, "num_tokens": 34624354.0, "step": 15130 }, { "entropy": 5.635566759109497, "epoch": 1.4961447212336891, "grad_norm": 1.2890625, "learning_rate": 0.0004782452267030598, "loss": 5.4486, "mean_token_accuracy": 0.1808988034725189, "num_tokens": 34636093.0, "step": 15135 }, { "entropy": 5.705580520629883, "epoch": 1.4966389877421906, "grad_norm": 1.3125, "learning_rate": 0.0004782300853676926, "loss": 5.2759, "mean_token_accuracy": 0.19083803296089172, "num_tokens": 34647503.0, "step": 15140 }, { "entropy": 5.601016902923584, "epoch": 1.4971332542506919, "grad_norm": 1.4765625, "learning_rate": 0.00047821493903283383, "loss": 5.4302, "mean_token_accuracy": 0.1819182351231575, "num_tokens": 34660258.0, "step": 15145 }, { "entropy": 5.619529151916504, "epoch": 1.4976275207591934, "grad_norm": 1.671875, "learning_rate": 0.000478199787698856, "loss": 5.3236, "mean_token_accuracy": 0.18092080652713777, "num_tokens": 34672199.0, "step": 15150 }, { "entropy": 5.632478189468384, "epoch": 1.4981217872676948, "grad_norm": 1.3125, "learning_rate": 0.00047818463136613184, "loss": 5.3093, "mean_token_accuracy": 0.18756650537252426, "num_tokens": 34684419.0, "step": 15155 }, { "entropy": 5.436056900024414, "epoch": 1.498616053776196, "grad_norm": 1.5390625, "learning_rate": 0.00047816947003503425, "loss": 5.1478, "mean_token_accuracy": 0.2000817134976387, "num_tokens": 34695649.0, "step": 15160 }, { "entropy": 5.639167928695679, "epoch": 1.4991103202846974, "grad_norm": 1.8203125, "learning_rate": 0.00047815430370593627, "loss": 5.3857, "mean_token_accuracy": 0.18156712800264357, "num_tokens": 34707019.0, "step": 15165 }, { "entropy": 5.627761268615723, "epoch": 1.4996045867931989, "grad_norm": 1.5, "learning_rate": 0.00047813913237921077, "loss": 5.296, "mean_token_accuracy": 0.19009427428245546, "num_tokens": 34717609.0, "step": 15170 }, { "entropy": 5.643815708160401, "epoch": 1.5000988533017003, "grad_norm": 1.5390625, "learning_rate": 0.0004781239560552312, "loss": 5.3758, "mean_token_accuracy": 0.18448631167411805, "num_tokens": 34728607.0, "step": 15175 }, { "entropy": 5.513981771469116, "epoch": 1.5005931198102016, "grad_norm": 1.3046875, "learning_rate": 0.00047810877473437077, "loss": 5.2648, "mean_token_accuracy": 0.18595848977565765, "num_tokens": 34739537.0, "step": 15180 }, { "entropy": 5.592280387878418, "epoch": 1.501087386318703, "grad_norm": 1.359375, "learning_rate": 0.00047809358841700297, "loss": 5.3778, "mean_token_accuracy": 0.18015966415405274, "num_tokens": 34751814.0, "step": 15185 }, { "entropy": 5.681809139251709, "epoch": 1.5015816528272046, "grad_norm": 1.40625, "learning_rate": 0.0004780783971035014, "loss": 5.298, "mean_token_accuracy": 0.18646501898765563, "num_tokens": 34762647.0, "step": 15190 }, { "entropy": 5.6360191822052, "epoch": 1.5020759193357058, "grad_norm": 1.6484375, "learning_rate": 0.0004780632007942397, "loss": 5.3899, "mean_token_accuracy": 0.17677464336156845, "num_tokens": 34774157.0, "step": 15195 }, { "entropy": 5.596209096908569, "epoch": 1.502570185844207, "grad_norm": 1.5625, "learning_rate": 0.0004780479994895918, "loss": 5.2364, "mean_token_accuracy": 0.18311847001314163, "num_tokens": 34785244.0, "step": 15200 }, { "entropy": 5.628902387619019, "epoch": 1.5030644523527086, "grad_norm": 1.6796875, "learning_rate": 0.0004780327931899316, "loss": 5.3163, "mean_token_accuracy": 0.18666891753673553, "num_tokens": 34797090.0, "step": 15205 }, { "entropy": 5.581091642379761, "epoch": 1.50355871886121, "grad_norm": 1.234375, "learning_rate": 0.00047801758189563315, "loss": 5.333, "mean_token_accuracy": 0.18319434970617293, "num_tokens": 34808598.0, "step": 15210 }, { "entropy": 5.613069725036621, "epoch": 1.5040529853697113, "grad_norm": 2.234375, "learning_rate": 0.00047800236560707076, "loss": 5.3919, "mean_token_accuracy": 0.1822893887758255, "num_tokens": 34820619.0, "step": 15215 }, { "entropy": 5.636681747436524, "epoch": 1.5045472518782126, "grad_norm": 1.3984375, "learning_rate": 0.00047798714432461864, "loss": 5.384, "mean_token_accuracy": 0.18434231877326965, "num_tokens": 34832463.0, "step": 15220 }, { "entropy": 5.657518005371093, "epoch": 1.505041518386714, "grad_norm": 1.9609375, "learning_rate": 0.0004779719180486513, "loss": 5.3848, "mean_token_accuracy": 0.17879601269960405, "num_tokens": 34844255.0, "step": 15225 }, { "entropy": 5.565562343597412, "epoch": 1.5055357848952156, "grad_norm": 1.4296875, "learning_rate": 0.0004779566867795433, "loss": 5.3796, "mean_token_accuracy": 0.1832110434770584, "num_tokens": 34857215.0, "step": 15230 }, { "entropy": 5.569212818145752, "epoch": 1.5060300514037168, "grad_norm": 1.546875, "learning_rate": 0.00047794145051766935, "loss": 5.2977, "mean_token_accuracy": 0.18866186439990998, "num_tokens": 34868831.0, "step": 15235 }, { "entropy": 5.690900421142578, "epoch": 1.5065243179122183, "grad_norm": 1.25, "learning_rate": 0.0004779262092634042, "loss": 5.2405, "mean_token_accuracy": 0.1928907588124275, "num_tokens": 34879258.0, "step": 15240 }, { "entropy": 5.61680793762207, "epoch": 1.5070185844207198, "grad_norm": 1.3671875, "learning_rate": 0.00047791096301712276, "loss": 5.3827, "mean_token_accuracy": 0.17970270216464995, "num_tokens": 34891492.0, "step": 15245 }, { "entropy": 5.550572633743286, "epoch": 1.507512850929221, "grad_norm": 1.609375, "learning_rate": 0.00047789571177920024, "loss": 5.2608, "mean_token_accuracy": 0.1808638244867325, "num_tokens": 34901836.0, "step": 15250 }, { "entropy": 5.590566205978393, "epoch": 1.5080071174377223, "grad_norm": 1.953125, "learning_rate": 0.0004778804555500117, "loss": 5.3904, "mean_token_accuracy": 0.18146324008703232, "num_tokens": 34913892.0, "step": 15255 }, { "entropy": 5.681615972518921, "epoch": 1.5085013839462238, "grad_norm": 1.40625, "learning_rate": 0.0004778651943299324, "loss": 5.4219, "mean_token_accuracy": 0.17938367873430253, "num_tokens": 34925657.0, "step": 15260 }, { "entropy": 5.6409605026245115, "epoch": 1.5089956504547253, "grad_norm": 1.296875, "learning_rate": 0.000477849928119338, "loss": 5.3731, "mean_token_accuracy": 0.17458854913711547, "num_tokens": 34937921.0, "step": 15265 }, { "entropy": 5.601303052902222, "epoch": 1.5094899169632265, "grad_norm": 1.390625, "learning_rate": 0.0004778346569186038, "loss": 5.3644, "mean_token_accuracy": 0.18017712980508804, "num_tokens": 34948742.0, "step": 15270 }, { "entropy": 5.589604139328003, "epoch": 1.5099841834717278, "grad_norm": 1.34375, "learning_rate": 0.00047781938072810555, "loss": 5.3525, "mean_token_accuracy": 0.18522555977106095, "num_tokens": 34960912.0, "step": 15275 }, { "entropy": 5.65964641571045, "epoch": 1.5104784499802293, "grad_norm": 3.40625, "learning_rate": 0.00047780409954821914, "loss": 5.3997, "mean_token_accuracy": 0.17724638432264328, "num_tokens": 34971188.0, "step": 15280 }, { "entropy": 5.617594957351685, "epoch": 1.5109727164887308, "grad_norm": 1.4140625, "learning_rate": 0.00047778881337932037, "loss": 5.3253, "mean_token_accuracy": 0.17985613346099855, "num_tokens": 34983316.0, "step": 15285 }, { "entropy": 5.699150085449219, "epoch": 1.511466982997232, "grad_norm": 1.6484375, "learning_rate": 0.00047777352222178537, "loss": 5.4325, "mean_token_accuracy": 0.1703278660774231, "num_tokens": 34995698.0, "step": 15290 }, { "entropy": 5.606994342803955, "epoch": 1.5119612495057335, "grad_norm": 1.40625, "learning_rate": 0.00047775822607599023, "loss": 5.3422, "mean_token_accuracy": 0.1865560382604599, "num_tokens": 35007296.0, "step": 15295 }, { "entropy": 5.688381290435791, "epoch": 1.512455516014235, "grad_norm": 1.8984375, "learning_rate": 0.0004777429249423113, "loss": 5.3922, "mean_token_accuracy": 0.1801751211285591, "num_tokens": 35019126.0, "step": 15300 }, { "entropy": 5.591096115112305, "epoch": 1.5129497825227363, "grad_norm": 1.4609375, "learning_rate": 0.00047772761882112493, "loss": 5.304, "mean_token_accuracy": 0.1849311724305153, "num_tokens": 35030213.0, "step": 15305 }, { "entropy": 5.54937252998352, "epoch": 1.5134440490312375, "grad_norm": 1.1875, "learning_rate": 0.0004777123077128077, "loss": 5.2888, "mean_token_accuracy": 0.1802014023065567, "num_tokens": 35043134.0, "step": 15310 }, { "entropy": 5.677251100540161, "epoch": 1.513938315539739, "grad_norm": 1.3515625, "learning_rate": 0.0004776969916177363, "loss": 5.3966, "mean_token_accuracy": 0.1778102621436119, "num_tokens": 35055484.0, "step": 15315 }, { "entropy": 5.667330169677735, "epoch": 1.5144325820482405, "grad_norm": 1.453125, "learning_rate": 0.0004776816705362874, "loss": 5.3822, "mean_token_accuracy": 0.18275257647037507, "num_tokens": 35067037.0, "step": 15320 }, { "entropy": 5.573491811752319, "epoch": 1.5149268485567418, "grad_norm": 1.4375, "learning_rate": 0.0004776663444688381, "loss": 5.3004, "mean_token_accuracy": 0.18107000291347503, "num_tokens": 35078340.0, "step": 15325 }, { "entropy": 5.604687261581421, "epoch": 1.515421115065243, "grad_norm": 1.375, "learning_rate": 0.0004776510134157651, "loss": 5.3984, "mean_token_accuracy": 0.1840140089392662, "num_tokens": 35090526.0, "step": 15330 }, { "entropy": 5.63254017829895, "epoch": 1.5159153815737447, "grad_norm": 1.4765625, "learning_rate": 0.00047763567737744576, "loss": 5.425, "mean_token_accuracy": 0.1753411650657654, "num_tokens": 35103757.0, "step": 15335 }, { "entropy": 5.624457502365113, "epoch": 1.516409648082246, "grad_norm": 1.5234375, "learning_rate": 0.0004776203363542574, "loss": 5.2841, "mean_token_accuracy": 0.18666779547929763, "num_tokens": 35115694.0, "step": 15340 }, { "entropy": 5.590429639816284, "epoch": 1.5169039145907472, "grad_norm": 1.234375, "learning_rate": 0.0004776049903465773, "loss": 5.288, "mean_token_accuracy": 0.18901096284389496, "num_tokens": 35126691.0, "step": 15345 }, { "entropy": 5.584354209899902, "epoch": 1.5173981810992487, "grad_norm": 1.4453125, "learning_rate": 0.000477589639354783, "loss": 5.3153, "mean_token_accuracy": 0.18446731865406035, "num_tokens": 35137851.0, "step": 15350 }, { "entropy": 5.603511905670166, "epoch": 1.5178924476077502, "grad_norm": 1.5078125, "learning_rate": 0.0004775742833792521, "loss": 5.342, "mean_token_accuracy": 0.18033986687660217, "num_tokens": 35148583.0, "step": 15355 }, { "entropy": 5.627356958389282, "epoch": 1.5183867141162515, "grad_norm": 1.3984375, "learning_rate": 0.0004775589224203625, "loss": 5.3673, "mean_token_accuracy": 0.17984215170145035, "num_tokens": 35161469.0, "step": 15360 }, { "entropy": 5.60552659034729, "epoch": 1.5188809806247527, "grad_norm": 1.390625, "learning_rate": 0.00047754355647849185, "loss": 5.2445, "mean_token_accuracy": 0.19505372643470764, "num_tokens": 35172349.0, "step": 15365 }, { "entropy": 5.565273380279541, "epoch": 1.5193752471332542, "grad_norm": 1.265625, "learning_rate": 0.00047752818555401845, "loss": 5.2737, "mean_token_accuracy": 0.18398473858833314, "num_tokens": 35183118.0, "step": 15370 }, { "entropy": 5.685931777954101, "epoch": 1.5198695136417557, "grad_norm": 1.3515625, "learning_rate": 0.00047751280964732014, "loss": 5.329, "mean_token_accuracy": 0.18145417124032975, "num_tokens": 35195702.0, "step": 15375 }, { "entropy": 5.727619886398315, "epoch": 1.520363780150257, "grad_norm": 1.375, "learning_rate": 0.00047749742875877535, "loss": 5.4801, "mean_token_accuracy": 0.17211327850818633, "num_tokens": 35207356.0, "step": 15380 }, { "entropy": 5.616939640045166, "epoch": 1.5208580466587585, "grad_norm": 1.7890625, "learning_rate": 0.0004774820428887624, "loss": 5.3531, "mean_token_accuracy": 0.1812470391392708, "num_tokens": 35219207.0, "step": 15385 }, { "entropy": 5.580738639831543, "epoch": 1.52135231316726, "grad_norm": 1.6328125, "learning_rate": 0.0004774666520376597, "loss": 5.3034, "mean_token_accuracy": 0.18335646986961365, "num_tokens": 35230396.0, "step": 15390 }, { "entropy": 5.595555925369263, "epoch": 1.5218465796757612, "grad_norm": 1.40625, "learning_rate": 0.0004774512562058461, "loss": 5.3771, "mean_token_accuracy": 0.18237807005643844, "num_tokens": 35242320.0, "step": 15395 }, { "entropy": 5.710798025131226, "epoch": 1.5223408461842625, "grad_norm": 1.4375, "learning_rate": 0.0004774358553937001, "loss": 5.4071, "mean_token_accuracy": 0.17716021537780763, "num_tokens": 35252926.0, "step": 15400 }, { "entropy": 5.7017210006713865, "epoch": 1.522835112692764, "grad_norm": 1.6484375, "learning_rate": 0.0004774204496016006, "loss": 5.4309, "mean_token_accuracy": 0.17283237874507903, "num_tokens": 35263833.0, "step": 15405 }, { "entropy": 5.605069303512574, "epoch": 1.5233293792012654, "grad_norm": 1.578125, "learning_rate": 0.00047740503882992677, "loss": 5.3906, "mean_token_accuracy": 0.1789207637310028, "num_tokens": 35274951.0, "step": 15410 }, { "entropy": 5.672837018966675, "epoch": 1.5238236457097667, "grad_norm": 1.53125, "learning_rate": 0.0004773896230790575, "loss": 5.4184, "mean_token_accuracy": 0.1774936020374298, "num_tokens": 35287940.0, "step": 15415 }, { "entropy": 5.564551210403442, "epoch": 1.524317912218268, "grad_norm": 1.4140625, "learning_rate": 0.00047737420234937215, "loss": 5.3367, "mean_token_accuracy": 0.18867705762386322, "num_tokens": 35299321.0, "step": 15420 }, { "entropy": 5.593753147125244, "epoch": 1.5248121787267694, "grad_norm": 1.4140625, "learning_rate": 0.00047735877664125, "loss": 5.3143, "mean_token_accuracy": 0.1857372283935547, "num_tokens": 35310181.0, "step": 15425 }, { "entropy": 5.668422603607178, "epoch": 1.525306445235271, "grad_norm": 1.5859375, "learning_rate": 0.00047734334595507045, "loss": 5.3434, "mean_token_accuracy": 0.18003177791833877, "num_tokens": 35320435.0, "step": 15430 }, { "entropy": 5.6462079048156735, "epoch": 1.5258007117437722, "grad_norm": 1.5625, "learning_rate": 0.0004773279102912134, "loss": 5.4235, "mean_token_accuracy": 0.1774923861026764, "num_tokens": 35332533.0, "step": 15435 }, { "entropy": 5.571061515808106, "epoch": 1.5262949782522737, "grad_norm": 1.7890625, "learning_rate": 0.0004773124696500582, "loss": 5.307, "mean_token_accuracy": 0.1932358369231224, "num_tokens": 35344289.0, "step": 15440 }, { "entropy": 5.596386289596557, "epoch": 1.5267892447607752, "grad_norm": 1.5703125, "learning_rate": 0.0004772970240319849, "loss": 5.2816, "mean_token_accuracy": 0.191512893140316, "num_tokens": 35355679.0, "step": 15445 }, { "entropy": 5.571349477767944, "epoch": 1.5272835112692764, "grad_norm": 1.34375, "learning_rate": 0.00047728157343737346, "loss": 5.3003, "mean_token_accuracy": 0.18744294792413713, "num_tokens": 35367489.0, "step": 15450 }, { "entropy": 5.565728282928466, "epoch": 1.5277777777777777, "grad_norm": 1.34375, "learning_rate": 0.00047726611786660396, "loss": 5.2218, "mean_token_accuracy": 0.18942863643169403, "num_tokens": 35378349.0, "step": 15455 }, { "entropy": 5.6377938747406, "epoch": 1.5282720442862792, "grad_norm": 1.4921875, "learning_rate": 0.00047725065732005654, "loss": 5.3806, "mean_token_accuracy": 0.18526216149330138, "num_tokens": 35388927.0, "step": 15460 }, { "entropy": 5.587651300430298, "epoch": 1.5287663107947806, "grad_norm": 1.4375, "learning_rate": 0.0004772351917981115, "loss": 5.3059, "mean_token_accuracy": 0.1870112270116806, "num_tokens": 35401859.0, "step": 15465 }, { "entropy": 5.659857892990113, "epoch": 1.529260577303282, "grad_norm": 1.3046875, "learning_rate": 0.0004772197213011494, "loss": 5.3437, "mean_token_accuracy": 0.18049770146608352, "num_tokens": 35412735.0, "step": 15470 }, { "entropy": 5.573085069656372, "epoch": 1.5297548438117832, "grad_norm": 2.234375, "learning_rate": 0.0004772042458295509, "loss": 5.3084, "mean_token_accuracy": 0.18320072442293167, "num_tokens": 35422960.0, "step": 15475 }, { "entropy": 5.676775074005127, "epoch": 1.5302491103202847, "grad_norm": 1.703125, "learning_rate": 0.00047718876538369655, "loss": 5.4291, "mean_token_accuracy": 0.1745563790202141, "num_tokens": 35435054.0, "step": 15480 }, { "entropy": 5.651961374282837, "epoch": 1.5307433768287861, "grad_norm": 1.5703125, "learning_rate": 0.00047717327996396716, "loss": 5.3786, "mean_token_accuracy": 0.1803923726081848, "num_tokens": 35447388.0, "step": 15485 }, { "entropy": 5.688505458831787, "epoch": 1.5312376433372874, "grad_norm": 2.28125, "learning_rate": 0.0004771577895707437, "loss": 5.3644, "mean_token_accuracy": 0.18185846358537675, "num_tokens": 35459181.0, "step": 15490 }, { "entropy": 5.530900859832764, "epoch": 1.5317319098457889, "grad_norm": 1.578125, "learning_rate": 0.0004771422942044073, "loss": 5.2051, "mean_token_accuracy": 0.18724495470523833, "num_tokens": 35469978.0, "step": 15495 }, { "entropy": 5.540166616439819, "epoch": 1.5322261763542904, "grad_norm": 1.8125, "learning_rate": 0.0004771267938653391, "loss": 5.3127, "mean_token_accuracy": 0.1894787386059761, "num_tokens": 35482196.0, "step": 15500 }, { "entropy": 5.575621795654297, "epoch": 1.5327204428627916, "grad_norm": 1.5, "learning_rate": 0.0004771112885539204, "loss": 5.2472, "mean_token_accuracy": 0.1961321771144867, "num_tokens": 35493025.0, "step": 15505 }, { "entropy": 5.54494423866272, "epoch": 1.533214709371293, "grad_norm": 1.3515625, "learning_rate": 0.00047709577827053257, "loss": 5.3411, "mean_token_accuracy": 0.18795692324638366, "num_tokens": 35504379.0, "step": 15510 }, { "entropy": 5.630211114883423, "epoch": 1.5337089758797944, "grad_norm": 1.65625, "learning_rate": 0.00047708026301555736, "loss": 5.2935, "mean_token_accuracy": 0.1893584430217743, "num_tokens": 35515401.0, "step": 15515 }, { "entropy": 5.6996245861053465, "epoch": 1.5342032423882959, "grad_norm": 1.25, "learning_rate": 0.00047706474278937626, "loss": 5.3724, "mean_token_accuracy": 0.18451106250286103, "num_tokens": 35527625.0, "step": 15520 }, { "entropy": 5.608449029922485, "epoch": 1.5346975088967971, "grad_norm": 1.3984375, "learning_rate": 0.00047704921759237116, "loss": 5.3286, "mean_token_accuracy": 0.181321482360363, "num_tokens": 35539484.0, "step": 15525 }, { "entropy": 5.678898477554322, "epoch": 1.5351917754052984, "grad_norm": 1.7265625, "learning_rate": 0.00047703368742492403, "loss": 5.3431, "mean_token_accuracy": 0.17915442436933518, "num_tokens": 35550362.0, "step": 15530 }, { "entropy": 5.677475261688232, "epoch": 1.5356860419137999, "grad_norm": 1.453125, "learning_rate": 0.0004770181522874167, "loss": 5.3221, "mean_token_accuracy": 0.18542334884405137, "num_tokens": 35561564.0, "step": 15535 }, { "entropy": 5.6013877391815186, "epoch": 1.5361803084223014, "grad_norm": 1.7890625, "learning_rate": 0.0004770026121802316, "loss": 5.2701, "mean_token_accuracy": 0.18590582013130189, "num_tokens": 35572216.0, "step": 15540 }, { "entropy": 5.5432319164276125, "epoch": 1.5366745749308026, "grad_norm": 1.609375, "learning_rate": 0.0004769870671037509, "loss": 5.2353, "mean_token_accuracy": 0.19741733223199845, "num_tokens": 35584471.0, "step": 15545 }, { "entropy": 5.587041139602661, "epoch": 1.537168841439304, "grad_norm": 1.4140625, "learning_rate": 0.00047697151705835693, "loss": 5.3102, "mean_token_accuracy": 0.1844884932041168, "num_tokens": 35596551.0, "step": 15550 }, { "entropy": 5.627885103225708, "epoch": 1.5376631079478056, "grad_norm": 1.375, "learning_rate": 0.0004769559620444324, "loss": 5.3237, "mean_token_accuracy": 0.1878990888595581, "num_tokens": 35607425.0, "step": 15555 }, { "entropy": 5.5082183361053465, "epoch": 1.5381573744563068, "grad_norm": 1.4765625, "learning_rate": 0.00047694040206235983, "loss": 5.2775, "mean_token_accuracy": 0.1897694483399391, "num_tokens": 35618900.0, "step": 15560 }, { "entropy": 5.622366571426392, "epoch": 1.538651640964808, "grad_norm": 1.4921875, "learning_rate": 0.000476924837112522, "loss": 5.2953, "mean_token_accuracy": 0.18988023847341537, "num_tokens": 35630126.0, "step": 15565 }, { "entropy": 5.60708441734314, "epoch": 1.5391459074733096, "grad_norm": 1.5546875, "learning_rate": 0.00047690926719530193, "loss": 5.3599, "mean_token_accuracy": 0.18527670949697495, "num_tokens": 35642406.0, "step": 15570 }, { "entropy": 5.5634284019470215, "epoch": 1.539640173981811, "grad_norm": 1.9765625, "learning_rate": 0.00047689369231108253, "loss": 5.357, "mean_token_accuracy": 0.18218495100736617, "num_tokens": 35654701.0, "step": 15575 }, { "entropy": 5.7010178565979, "epoch": 1.5401344404903123, "grad_norm": 1.5703125, "learning_rate": 0.000476878112460247, "loss": 5.4242, "mean_token_accuracy": 0.17453216910362243, "num_tokens": 35665668.0, "step": 15580 }, { "entropy": 5.609474086761475, "epoch": 1.5406287069988136, "grad_norm": 1.65625, "learning_rate": 0.00047686252764317854, "loss": 5.3296, "mean_token_accuracy": 0.18516783863306047, "num_tokens": 35676940.0, "step": 15585 }, { "entropy": 5.6635418891906735, "epoch": 1.5411229735073153, "grad_norm": 1.3984375, "learning_rate": 0.00047684693786026054, "loss": 5.4186, "mean_token_accuracy": 0.17526114284992217, "num_tokens": 35687860.0, "step": 15590 }, { "entropy": 5.582547950744629, "epoch": 1.5416172400158166, "grad_norm": 1.3203125, "learning_rate": 0.00047683134311187663, "loss": 5.2703, "mean_token_accuracy": 0.1913952797651291, "num_tokens": 35698349.0, "step": 15595 }, { "entropy": 5.566019010543823, "epoch": 1.5421115065243178, "grad_norm": 1.359375, "learning_rate": 0.00047681574339841044, "loss": 5.3376, "mean_token_accuracy": 0.18827067464590072, "num_tokens": 35709649.0, "step": 15600 }, { "entropy": 5.566201066970825, "epoch": 1.5426057730328193, "grad_norm": 1.453125, "learning_rate": 0.00047680013872024546, "loss": 5.2468, "mean_token_accuracy": 0.18854983896017075, "num_tokens": 35720806.0, "step": 15605 }, { "entropy": 5.624632406234741, "epoch": 1.5431000395413208, "grad_norm": 1.6640625, "learning_rate": 0.0004767845290777659, "loss": 5.2942, "mean_token_accuracy": 0.1844210222363472, "num_tokens": 35732044.0, "step": 15610 }, { "entropy": 5.577399349212646, "epoch": 1.543594306049822, "grad_norm": 1.484375, "learning_rate": 0.0004767689144713556, "loss": 5.3506, "mean_token_accuracy": 0.18211054801940918, "num_tokens": 35743758.0, "step": 15615 }, { "entropy": 5.645985889434814, "epoch": 1.5440885725583233, "grad_norm": 1.3984375, "learning_rate": 0.00047675329490139866, "loss": 5.2863, "mean_token_accuracy": 0.1800716131925583, "num_tokens": 35756184.0, "step": 15620 }, { "entropy": 5.590408897399902, "epoch": 1.5445828390668248, "grad_norm": 1.5546875, "learning_rate": 0.00047673767036827947, "loss": 5.3153, "mean_token_accuracy": 0.18041884899139404, "num_tokens": 35768255.0, "step": 15625 }, { "entropy": 5.592480325698853, "epoch": 1.5450771055753263, "grad_norm": 1.5625, "learning_rate": 0.0004767220408723822, "loss": 5.3666, "mean_token_accuracy": 0.17498636841773987, "num_tokens": 35779111.0, "step": 15630 }, { "entropy": 5.657261562347412, "epoch": 1.5455713720838276, "grad_norm": 2.671875, "learning_rate": 0.0004767064064140915, "loss": 5.3822, "mean_token_accuracy": 0.18287851214408873, "num_tokens": 35791676.0, "step": 15635 }, { "entropy": 5.601535701751709, "epoch": 1.546065638592329, "grad_norm": 1.5234375, "learning_rate": 0.0004766907669937919, "loss": 5.2741, "mean_token_accuracy": 0.19282286912202834, "num_tokens": 35801868.0, "step": 15640 }, { "entropy": 5.667299222946167, "epoch": 1.5465599051008305, "grad_norm": 1.4140625, "learning_rate": 0.000476675122611868, "loss": 5.4693, "mean_token_accuracy": 0.17500021457672119, "num_tokens": 35812428.0, "step": 15645 }, { "entropy": 5.625846576690674, "epoch": 1.5470541716093318, "grad_norm": 1.484375, "learning_rate": 0.000476659473268705, "loss": 5.3086, "mean_token_accuracy": 0.1865147680044174, "num_tokens": 35823600.0, "step": 15650 }, { "entropy": 5.625600957870484, "epoch": 1.547548438117833, "grad_norm": 2.046875, "learning_rate": 0.0004766438189646876, "loss": 5.34, "mean_token_accuracy": 0.18703303933143617, "num_tokens": 35834988.0, "step": 15655 }, { "entropy": 5.617691516876221, "epoch": 1.5480427046263345, "grad_norm": 1.5546875, "learning_rate": 0.00047662815970020086, "loss": 5.3453, "mean_token_accuracy": 0.1862446442246437, "num_tokens": 35846110.0, "step": 15660 }, { "entropy": 5.529103136062622, "epoch": 1.548536971134836, "grad_norm": 1.2578125, "learning_rate": 0.0004766124954756302, "loss": 5.3164, "mean_token_accuracy": 0.18625538796186447, "num_tokens": 35858276.0, "step": 15665 }, { "entropy": 5.711389350891113, "epoch": 1.5490312376433373, "grad_norm": 1.328125, "learning_rate": 0.00047659682629136094, "loss": 5.3977, "mean_token_accuracy": 0.1807095542550087, "num_tokens": 35870705.0, "step": 15670 }, { "entropy": 5.649735975265503, "epoch": 1.5495255041518385, "grad_norm": 1.5625, "learning_rate": 0.0004765811521477784, "loss": 5.3286, "mean_token_accuracy": 0.18542488515377045, "num_tokens": 35882298.0, "step": 15675 }, { "entropy": 5.538140392303466, "epoch": 1.55001977066034, "grad_norm": 1.2890625, "learning_rate": 0.0004765654730452682, "loss": 5.2647, "mean_token_accuracy": 0.19012416154146194, "num_tokens": 35894665.0, "step": 15680 }, { "entropy": 5.627080726623535, "epoch": 1.5505140371688415, "grad_norm": 1.421875, "learning_rate": 0.0004765497889842161, "loss": 5.3343, "mean_token_accuracy": 0.18909312933683395, "num_tokens": 35905893.0, "step": 15685 }, { "entropy": 5.624281024932861, "epoch": 1.5510083036773428, "grad_norm": 2.359375, "learning_rate": 0.00047653409996500803, "loss": 5.2838, "mean_token_accuracy": 0.1896094098687172, "num_tokens": 35917883.0, "step": 15690 }, { "entropy": 5.620629692077637, "epoch": 1.5515025701858443, "grad_norm": 1.265625, "learning_rate": 0.00047651840598802976, "loss": 5.3608, "mean_token_accuracy": 0.18712644875049592, "num_tokens": 35929863.0, "step": 15695 }, { "entropy": 5.6553479671478275, "epoch": 1.5519968366943457, "grad_norm": 1.5625, "learning_rate": 0.0004765027070536674, "loss": 5.3804, "mean_token_accuracy": 0.18213234543800355, "num_tokens": 35940843.0, "step": 15700 }, { "entropy": 5.579813432693482, "epoch": 1.552491103202847, "grad_norm": 1.5078125, "learning_rate": 0.0004764870031623073, "loss": 5.2457, "mean_token_accuracy": 0.18896625339984893, "num_tokens": 35953516.0, "step": 15705 }, { "entropy": 5.545122337341309, "epoch": 1.5529853697113483, "grad_norm": 1.7578125, "learning_rate": 0.00047647129431433566, "loss": 5.3128, "mean_token_accuracy": 0.18391638547182082, "num_tokens": 35965481.0, "step": 15710 }, { "entropy": 5.627437734603882, "epoch": 1.5534796362198497, "grad_norm": 1.4140625, "learning_rate": 0.0004764555805101388, "loss": 5.3941, "mean_token_accuracy": 0.18486918061971663, "num_tokens": 35976434.0, "step": 15715 }, { "entropy": 5.619044017791748, "epoch": 1.5539739027283512, "grad_norm": 1.6640625, "learning_rate": 0.0004764398617501035, "loss": 5.28, "mean_token_accuracy": 0.18788978457450867, "num_tokens": 35987644.0, "step": 15720 }, { "entropy": 5.628942060470581, "epoch": 1.5544681692368525, "grad_norm": 1.3359375, "learning_rate": 0.0004764241380346163, "loss": 5.3736, "mean_token_accuracy": 0.18167052417993546, "num_tokens": 35999630.0, "step": 15725 }, { "entropy": 5.698288631439209, "epoch": 1.5549624357453538, "grad_norm": 1.4609375, "learning_rate": 0.0004764084093640641, "loss": 5.4317, "mean_token_accuracy": 0.18579235970973967, "num_tokens": 36011889.0, "step": 15730 }, { "entropy": 5.65256633758545, "epoch": 1.5554567022538552, "grad_norm": 1.4765625, "learning_rate": 0.0004763926757388338, "loss": 5.4058, "mean_token_accuracy": 0.17793132364749908, "num_tokens": 36024131.0, "step": 15735 }, { "entropy": 5.6088632106781, "epoch": 1.5559509687623567, "grad_norm": 1.265625, "learning_rate": 0.0004763769371593124, "loss": 5.3134, "mean_token_accuracy": 0.19488660544157027, "num_tokens": 36035759.0, "step": 15740 }, { "entropy": 5.632501840591431, "epoch": 1.556445235270858, "grad_norm": 1.9140625, "learning_rate": 0.0004763611936258871, "loss": 5.3827, "mean_token_accuracy": 0.1786652162671089, "num_tokens": 36047882.0, "step": 15745 }, { "entropy": 5.5827916145324705, "epoch": 1.5569395017793595, "grad_norm": 1.421875, "learning_rate": 0.0004763454451389452, "loss": 5.3428, "mean_token_accuracy": 0.181227470934391, "num_tokens": 36058268.0, "step": 15750 }, { "entropy": 5.680436992645264, "epoch": 1.557433768287861, "grad_norm": 1.4375, "learning_rate": 0.00047632969169887407, "loss": 5.3659, "mean_token_accuracy": 0.18153930008411406, "num_tokens": 36070797.0, "step": 15755 }, { "entropy": 5.607543659210205, "epoch": 1.5579280347963622, "grad_norm": 1.5546875, "learning_rate": 0.0004763139333060613, "loss": 5.3827, "mean_token_accuracy": 0.1859066367149353, "num_tokens": 36082858.0, "step": 15760 }, { "entropy": 5.621573448181152, "epoch": 1.5584223013048635, "grad_norm": 1.5625, "learning_rate": 0.00047629816996089464, "loss": 5.3434, "mean_token_accuracy": 0.1824665665626526, "num_tokens": 36094825.0, "step": 15765 }, { "entropy": 5.663739156723023, "epoch": 1.558916567813365, "grad_norm": 1.390625, "learning_rate": 0.00047628240166376173, "loss": 5.3562, "mean_token_accuracy": 0.1769666850566864, "num_tokens": 36106379.0, "step": 15770 }, { "entropy": 5.542728328704834, "epoch": 1.5594108343218664, "grad_norm": 1.2265625, "learning_rate": 0.00047626662841505045, "loss": 5.2548, "mean_token_accuracy": 0.18893215656280518, "num_tokens": 36117137.0, "step": 15775 }, { "entropy": 5.597761726379394, "epoch": 1.5599051008303677, "grad_norm": 1.4765625, "learning_rate": 0.000476250850215149, "loss": 5.3735, "mean_token_accuracy": 0.1764802649617195, "num_tokens": 36128420.0, "step": 15780 }, { "entropy": 5.660768747329712, "epoch": 1.560399367338869, "grad_norm": 1.46875, "learning_rate": 0.0004762350670644453, "loss": 5.294, "mean_token_accuracy": 0.18913516253232956, "num_tokens": 36139017.0, "step": 15785 }, { "entropy": 5.613294553756714, "epoch": 1.5608936338473705, "grad_norm": 1.65625, "learning_rate": 0.0004762192789633278, "loss": 5.3995, "mean_token_accuracy": 0.1834932953119278, "num_tokens": 36151748.0, "step": 15790 }, { "entropy": 5.630767488479615, "epoch": 1.561387900355872, "grad_norm": 1.4765625, "learning_rate": 0.00047620348591218475, "loss": 5.3672, "mean_token_accuracy": 0.18219092190265657, "num_tokens": 36163114.0, "step": 15795 }, { "entropy": 5.632153034210205, "epoch": 1.5618821668643732, "grad_norm": 1.84375, "learning_rate": 0.0004761876879114048, "loss": 5.3777, "mean_token_accuracy": 0.18503647148609162, "num_tokens": 36174601.0, "step": 15800 }, { "entropy": 5.632711267471313, "epoch": 1.5623764333728747, "grad_norm": 1.6171875, "learning_rate": 0.0004761718849613765, "loss": 5.305, "mean_token_accuracy": 0.187123903632164, "num_tokens": 36185081.0, "step": 15805 }, { "entropy": 5.618956899642944, "epoch": 1.5628706998813762, "grad_norm": 1.5234375, "learning_rate": 0.0004761560770624886, "loss": 5.3568, "mean_token_accuracy": 0.18568941950798035, "num_tokens": 36196547.0, "step": 15810 }, { "entropy": 5.615840435028076, "epoch": 1.5633649663898774, "grad_norm": 1.7109375, "learning_rate": 0.0004761402642151301, "loss": 5.2683, "mean_token_accuracy": 0.19079804569482803, "num_tokens": 36208115.0, "step": 15815 }, { "entropy": 5.630123519897461, "epoch": 1.5638592328983787, "grad_norm": 1.9453125, "learning_rate": 0.0004761244464196897, "loss": 5.33, "mean_token_accuracy": 0.1871498331427574, "num_tokens": 36219571.0, "step": 15820 }, { "entropy": 5.619361352920532, "epoch": 1.5643534994068802, "grad_norm": 1.4609375, "learning_rate": 0.0004761086236765569, "loss": 5.3559, "mean_token_accuracy": 0.18395351320505143, "num_tokens": 36232219.0, "step": 15825 }, { "entropy": 5.60046420097351, "epoch": 1.5648477659153817, "grad_norm": 1.5, "learning_rate": 0.0004760927959861206, "loss": 5.3412, "mean_token_accuracy": 0.18310203701257705, "num_tokens": 36243761.0, "step": 15830 }, { "entropy": 5.575168752670288, "epoch": 1.565342032423883, "grad_norm": 1.6015625, "learning_rate": 0.0004760769633487704, "loss": 5.3183, "mean_token_accuracy": 0.18504491746425628, "num_tokens": 36255466.0, "step": 15835 }, { "entropy": 5.591471767425537, "epoch": 1.5658362989323842, "grad_norm": 1.5, "learning_rate": 0.00047606112576489574, "loss": 5.3694, "mean_token_accuracy": 0.17849458903074264, "num_tokens": 36267252.0, "step": 15840 }, { "entropy": 5.676768827438354, "epoch": 1.566330565440886, "grad_norm": 1.5234375, "learning_rate": 0.0004760452832348862, "loss": 5.3434, "mean_token_accuracy": 0.19355549216270446, "num_tokens": 36278149.0, "step": 15845 }, { "entropy": 5.784940767288208, "epoch": 1.5668248319493872, "grad_norm": 1.6875, "learning_rate": 0.00047602943575913146, "loss": 5.3878, "mean_token_accuracy": 0.1894302859902382, "num_tokens": 36290583.0, "step": 15850 }, { "entropy": 5.626826572418213, "epoch": 1.5673190984578884, "grad_norm": 1.6796875, "learning_rate": 0.0004760135833380214, "loss": 5.3527, "mean_token_accuracy": 0.17807947248220443, "num_tokens": 36301508.0, "step": 15855 }, { "entropy": 5.574789237976074, "epoch": 1.56781336496639, "grad_norm": 1.421875, "learning_rate": 0.000475997725971946, "loss": 5.2702, "mean_token_accuracy": 0.19079479277133943, "num_tokens": 36312488.0, "step": 15860 }, { "entropy": 5.63427586555481, "epoch": 1.5683076314748914, "grad_norm": 1.7265625, "learning_rate": 0.0004759818636612954, "loss": 5.2799, "mean_token_accuracy": 0.18527939766645432, "num_tokens": 36323263.0, "step": 15865 }, { "entropy": 5.601292610168457, "epoch": 1.5688018979833926, "grad_norm": 1.671875, "learning_rate": 0.00047596599640645974, "loss": 5.3287, "mean_token_accuracy": 0.17838988304138184, "num_tokens": 36336095.0, "step": 15870 }, { "entropy": 5.574136352539062, "epoch": 1.569296164491894, "grad_norm": 1.5859375, "learning_rate": 0.00047595012420782946, "loss": 5.3711, "mean_token_accuracy": 0.18640863448381423, "num_tokens": 36346653.0, "step": 15875 }, { "entropy": 5.610943984985352, "epoch": 1.5697904310003954, "grad_norm": 1.8359375, "learning_rate": 0.0004759342470657949, "loss": 5.3091, "mean_token_accuracy": 0.18667134642601013, "num_tokens": 36358190.0, "step": 15880 }, { "entropy": 5.63078088760376, "epoch": 1.5702846975088969, "grad_norm": 1.671875, "learning_rate": 0.0004759183649807467, "loss": 5.3503, "mean_token_accuracy": 0.1857827052474022, "num_tokens": 36369037.0, "step": 15885 }, { "entropy": 5.651617813110351, "epoch": 1.5707789640173981, "grad_norm": 1.6796875, "learning_rate": 0.0004759024779530755, "loss": 5.3171, "mean_token_accuracy": 0.18673258870840073, "num_tokens": 36379881.0, "step": 15890 }, { "entropy": 5.641597414016724, "epoch": 1.5712732305258994, "grad_norm": 1.234375, "learning_rate": 0.00047588658598317227, "loss": 5.2663, "mean_token_accuracy": 0.19190889745950698, "num_tokens": 36390927.0, "step": 15895 }, { "entropy": 5.6638843536376955, "epoch": 1.571767497034401, "grad_norm": 1.34375, "learning_rate": 0.00047587068907142783, "loss": 5.4153, "mean_token_accuracy": 0.18489917516708373, "num_tokens": 36402398.0, "step": 15900 }, { "entropy": 5.55378794670105, "epoch": 1.5722617635429024, "grad_norm": 1.390625, "learning_rate": 0.0004758547872182332, "loss": 5.2635, "mean_token_accuracy": 0.18673126250505448, "num_tokens": 36413991.0, "step": 15905 }, { "entropy": 5.541579818725586, "epoch": 1.5727560300514036, "grad_norm": 1.6796875, "learning_rate": 0.0004758388804239797, "loss": 5.3296, "mean_token_accuracy": 0.1853797420859337, "num_tokens": 36425807.0, "step": 15910 }, { "entropy": 5.701465177536011, "epoch": 1.5732502965599051, "grad_norm": 1.4453125, "learning_rate": 0.0004758229686890586, "loss": 5.3825, "mean_token_accuracy": 0.18051216751337051, "num_tokens": 36437968.0, "step": 15915 }, { "entropy": 5.669748830795288, "epoch": 1.5737445630684066, "grad_norm": 1.390625, "learning_rate": 0.00047580705201386134, "loss": 5.3541, "mean_token_accuracy": 0.17972855120897294, "num_tokens": 36449803.0, "step": 15920 }, { "entropy": 5.6376667499542235, "epoch": 1.5742388295769079, "grad_norm": 1.5, "learning_rate": 0.0004757911303987794, "loss": 5.427, "mean_token_accuracy": 0.17511660605669022, "num_tokens": 36461849.0, "step": 15925 }, { "entropy": 5.622438859939575, "epoch": 1.5747330960854091, "grad_norm": 1.5546875, "learning_rate": 0.0004757752038442045, "loss": 5.2888, "mean_token_accuracy": 0.1888489231467247, "num_tokens": 36473324.0, "step": 15930 }, { "entropy": 5.675995826721191, "epoch": 1.5752273625939106, "grad_norm": 1.34375, "learning_rate": 0.0004757592723505284, "loss": 5.3378, "mean_token_accuracy": 0.1818197563290596, "num_tokens": 36483949.0, "step": 15935 }, { "entropy": 5.529774618148804, "epoch": 1.575721629102412, "grad_norm": 1.1953125, "learning_rate": 0.0004757433359181431, "loss": 5.2579, "mean_token_accuracy": 0.1928209513425827, "num_tokens": 36495308.0, "step": 15940 }, { "entropy": 5.525200986862183, "epoch": 1.5762158956109134, "grad_norm": 1.625, "learning_rate": 0.00047572739454744057, "loss": 5.3082, "mean_token_accuracy": 0.1916145220398903, "num_tokens": 36506052.0, "step": 15945 }, { "entropy": 5.522533226013183, "epoch": 1.5767101621194148, "grad_norm": 1.2890625, "learning_rate": 0.000475711448238813, "loss": 5.2459, "mean_token_accuracy": 0.19694708287715912, "num_tokens": 36519175.0, "step": 15950 }, { "entropy": 5.659843587875367, "epoch": 1.5772044286279163, "grad_norm": 1.4375, "learning_rate": 0.00047569549699265275, "loss": 5.3167, "mean_token_accuracy": 0.1867457538843155, "num_tokens": 36529736.0, "step": 15955 }, { "entropy": 5.558991813659668, "epoch": 1.5776986951364176, "grad_norm": 1.546875, "learning_rate": 0.00047567954080935206, "loss": 5.2563, "mean_token_accuracy": 0.1849062830209732, "num_tokens": 36541715.0, "step": 15960 }, { "entropy": 5.637162828445435, "epoch": 1.5781929616449188, "grad_norm": 1.328125, "learning_rate": 0.0004756635796893036, "loss": 5.3477, "mean_token_accuracy": 0.1868065819144249, "num_tokens": 36553807.0, "step": 15965 }, { "entropy": 5.679484033584595, "epoch": 1.5786872281534203, "grad_norm": 1.4921875, "learning_rate": 0.0004756476136328998, "loss": 5.3842, "mean_token_accuracy": 0.18059302419424056, "num_tokens": 36566053.0, "step": 15970 }, { "entropy": 5.6261743068695065, "epoch": 1.5791814946619218, "grad_norm": 1.4375, "learning_rate": 0.00047563164264053374, "loss": 5.378, "mean_token_accuracy": 0.1833268404006958, "num_tokens": 36577637.0, "step": 15975 }, { "entropy": 5.624777889251709, "epoch": 1.579675761170423, "grad_norm": 1.3984375, "learning_rate": 0.00047561566671259803, "loss": 5.3129, "mean_token_accuracy": 0.18292995393276215, "num_tokens": 36587767.0, "step": 15980 }, { "entropy": 5.534054374694824, "epoch": 1.5801700276789243, "grad_norm": 1.296875, "learning_rate": 0.00047559968584948587, "loss": 5.2268, "mean_token_accuracy": 0.19400970488786698, "num_tokens": 36599163.0, "step": 15985 }, { "entropy": 5.61691107749939, "epoch": 1.5806642941874258, "grad_norm": 1.5390625, "learning_rate": 0.0004755837000515903, "loss": 5.3975, "mean_token_accuracy": 0.17972329407930374, "num_tokens": 36611170.0, "step": 15990 }, { "entropy": 5.720366668701172, "epoch": 1.5811585606959273, "grad_norm": 1.3203125, "learning_rate": 0.0004755677093193046, "loss": 5.4726, "mean_token_accuracy": 0.17461608797311784, "num_tokens": 36622907.0, "step": 15995 }, { "entropy": 5.636205244064331, "epoch": 1.5816528272044286, "grad_norm": 1.3828125, "learning_rate": 0.0004755517136530221, "loss": 5.3581, "mean_token_accuracy": 0.18401266932487487, "num_tokens": 36635197.0, "step": 16000 }, { "entropy": 5.6060850620269775, "epoch": 1.58214709371293, "grad_norm": 1.3671875, "learning_rate": 0.00047553571305313636, "loss": 5.2775, "mean_token_accuracy": 0.18767874985933303, "num_tokens": 36646965.0, "step": 16005 }, { "entropy": 5.530509090423584, "epoch": 1.5826413602214315, "grad_norm": 1.3203125, "learning_rate": 0.00047551970752004097, "loss": 5.2665, "mean_token_accuracy": 0.20047152787446976, "num_tokens": 36657344.0, "step": 16010 }, { "entropy": 5.524829912185669, "epoch": 1.5831356267299328, "grad_norm": 1.28125, "learning_rate": 0.00047550369705412964, "loss": 5.2687, "mean_token_accuracy": 0.19154494553804396, "num_tokens": 36668833.0, "step": 16015 }, { "entropy": 5.599942874908447, "epoch": 1.583629893238434, "grad_norm": 1.2890625, "learning_rate": 0.0004754876816557963, "loss": 5.261, "mean_token_accuracy": 0.1909753382205963, "num_tokens": 36680902.0, "step": 16020 }, { "entropy": 5.574006414413452, "epoch": 1.5841241597469355, "grad_norm": 1.5, "learning_rate": 0.00047547166132543483, "loss": 5.2627, "mean_token_accuracy": 0.19489651471376418, "num_tokens": 36691312.0, "step": 16025 }, { "entropy": 5.588957500457764, "epoch": 1.584618426255437, "grad_norm": 1.3125, "learning_rate": 0.00047545563606343945, "loss": 5.3141, "mean_token_accuracy": 0.1848904609680176, "num_tokens": 36701091.0, "step": 16030 }, { "entropy": 5.630921983718872, "epoch": 1.5851126927639383, "grad_norm": 1.3359375, "learning_rate": 0.0004754396058702043, "loss": 5.355, "mean_token_accuracy": 0.1891075000166893, "num_tokens": 36712524.0, "step": 16035 }, { "entropy": 5.652781963348389, "epoch": 1.5856069592724396, "grad_norm": 1.3046875, "learning_rate": 0.00047542357074612375, "loss": 5.3693, "mean_token_accuracy": 0.1796592429280281, "num_tokens": 36724181.0, "step": 16040 }, { "entropy": 5.607776737213134, "epoch": 1.586101225780941, "grad_norm": 1.296875, "learning_rate": 0.00047540753069159224, "loss": 5.271, "mean_token_accuracy": 0.19027665108442307, "num_tokens": 36734777.0, "step": 16045 }, { "entropy": 5.624070930480957, "epoch": 1.5865954922894425, "grad_norm": 1.296875, "learning_rate": 0.00047539148570700443, "loss": 5.3444, "mean_token_accuracy": 0.1836364358663559, "num_tokens": 36746437.0, "step": 16050 }, { "entropy": 5.701212692260742, "epoch": 1.5870897587979438, "grad_norm": 1.4765625, "learning_rate": 0.00047537543579275496, "loss": 5.479, "mean_token_accuracy": 0.177655591070652, "num_tokens": 36759615.0, "step": 16055 }, { "entropy": 5.629216146469116, "epoch": 1.5875840253064453, "grad_norm": 1.359375, "learning_rate": 0.0004753593809492387, "loss": 5.3266, "mean_token_accuracy": 0.18154437094926834, "num_tokens": 36770762.0, "step": 16060 }, { "entropy": 5.618433475494385, "epoch": 1.5880782918149468, "grad_norm": 1.3828125, "learning_rate": 0.0004753433211768506, "loss": 5.3087, "mean_token_accuracy": 0.18189213126897813, "num_tokens": 36781410.0, "step": 16065 }, { "entropy": 5.6102643489837645, "epoch": 1.588572558323448, "grad_norm": 2.34375, "learning_rate": 0.00047532725647598563, "loss": 5.333, "mean_token_accuracy": 0.18333612531423568, "num_tokens": 36792737.0, "step": 16070 }, { "entropy": 5.574700546264649, "epoch": 1.5890668248319493, "grad_norm": 1.4609375, "learning_rate": 0.00047531118684703916, "loss": 5.2375, "mean_token_accuracy": 0.18918032348155975, "num_tokens": 36804626.0, "step": 16075 }, { "entropy": 5.582992458343506, "epoch": 1.5895610913404508, "grad_norm": 1.4375, "learning_rate": 0.0004752951122904064, "loss": 5.3336, "mean_token_accuracy": 0.18058971762657167, "num_tokens": 36815964.0, "step": 16080 }, { "entropy": 5.6143965244293215, "epoch": 1.5900553578489522, "grad_norm": 1.28125, "learning_rate": 0.0004752790328064828, "loss": 5.2576, "mean_token_accuracy": 0.19323818981647492, "num_tokens": 36828180.0, "step": 16085 }, { "entropy": 5.568392133712768, "epoch": 1.5905496243574535, "grad_norm": 1.4140625, "learning_rate": 0.00047526294839566393, "loss": 5.2713, "mean_token_accuracy": 0.1873632401227951, "num_tokens": 36839589.0, "step": 16090 }, { "entropy": 5.591415548324585, "epoch": 1.5910438908659548, "grad_norm": 1.3828125, "learning_rate": 0.0004752468590583454, "loss": 5.2573, "mean_token_accuracy": 0.1895088165998459, "num_tokens": 36850392.0, "step": 16095 }, { "entropy": 5.534626626968384, "epoch": 1.5915381573744563, "grad_norm": 1.53125, "learning_rate": 0.0004752307647949232, "loss": 5.2631, "mean_token_accuracy": 0.19192342609167098, "num_tokens": 36862334.0, "step": 16100 }, { "entropy": 5.5994960308074955, "epoch": 1.5920324238829577, "grad_norm": 1.4765625, "learning_rate": 0.000475214665605793, "loss": 5.2902, "mean_token_accuracy": 0.18753493577241898, "num_tokens": 36874837.0, "step": 16105 }, { "entropy": 5.619603300094605, "epoch": 1.592526690391459, "grad_norm": 1.46875, "learning_rate": 0.000475198561491351, "loss": 5.3064, "mean_token_accuracy": 0.1915009081363678, "num_tokens": 36886375.0, "step": 16110 }, { "entropy": 5.618808841705322, "epoch": 1.5930209568999605, "grad_norm": 2.234375, "learning_rate": 0.0004751824524519934, "loss": 5.3447, "mean_token_accuracy": 0.18166275769472123, "num_tokens": 36897731.0, "step": 16115 }, { "entropy": 5.592964029312133, "epoch": 1.593515223408462, "grad_norm": 1.4921875, "learning_rate": 0.0004751663384881163, "loss": 5.3723, "mean_token_accuracy": 0.1810892716050148, "num_tokens": 36909647.0, "step": 16120 }, { "entropy": 5.582522249221801, "epoch": 1.5940094899169632, "grad_norm": 1.3359375, "learning_rate": 0.0004751502196001163, "loss": 5.3169, "mean_token_accuracy": 0.18631683588027953, "num_tokens": 36919960.0, "step": 16125 }, { "entropy": 5.639509057998657, "epoch": 1.5945037564254645, "grad_norm": 1.453125, "learning_rate": 0.0004751340957883898, "loss": 5.34, "mean_token_accuracy": 0.18041442185640336, "num_tokens": 36930520.0, "step": 16130 }, { "entropy": 5.668814468383789, "epoch": 1.594998022933966, "grad_norm": 1.6015625, "learning_rate": 0.0004751179670533335, "loss": 5.3237, "mean_token_accuracy": 0.18239227086305618, "num_tokens": 36942627.0, "step": 16135 }, { "entropy": 5.598042011260986, "epoch": 1.5954922894424675, "grad_norm": 1.71875, "learning_rate": 0.0004751018333953442, "loss": 5.3671, "mean_token_accuracy": 0.18338391780853272, "num_tokens": 36954276.0, "step": 16140 }, { "entropy": 5.5386909484863285, "epoch": 1.5959865559509687, "grad_norm": 1.3125, "learning_rate": 0.0004750856948148187, "loss": 5.3036, "mean_token_accuracy": 0.19186697751283646, "num_tokens": 36965840.0, "step": 16145 }, { "entropy": 5.584394693374634, "epoch": 1.59648082245947, "grad_norm": 1.1484375, "learning_rate": 0.0004750695513121541, "loss": 5.2215, "mean_token_accuracy": 0.1885249361395836, "num_tokens": 36977133.0, "step": 16150 }, { "entropy": 5.63659405708313, "epoch": 1.5969750889679717, "grad_norm": 1.3515625, "learning_rate": 0.0004750534028877475, "loss": 5.3085, "mean_token_accuracy": 0.18535743057727813, "num_tokens": 36989013.0, "step": 16155 }, { "entropy": 5.546811771392822, "epoch": 1.597469355476473, "grad_norm": 1.2890625, "learning_rate": 0.0004750372495419962, "loss": 5.2693, "mean_token_accuracy": 0.18440254777669907, "num_tokens": 37000324.0, "step": 16160 }, { "entropy": 5.623281574249267, "epoch": 1.5979636219849742, "grad_norm": 1.2734375, "learning_rate": 0.0004750210912752975, "loss": 5.3469, "mean_token_accuracy": 0.18501806557178496, "num_tokens": 37010551.0, "step": 16165 }, { "entropy": 5.712255382537842, "epoch": 1.5984578884934757, "grad_norm": 1.5625, "learning_rate": 0.0004750049280880489, "loss": 5.3869, "mean_token_accuracy": 0.17981976121664048, "num_tokens": 37022732.0, "step": 16170 }, { "entropy": 5.61658091545105, "epoch": 1.5989521550019772, "grad_norm": 1.3671875, "learning_rate": 0.00047498875998064805, "loss": 5.3244, "mean_token_accuracy": 0.1808415398001671, "num_tokens": 37033230.0, "step": 16175 }, { "entropy": 5.555230951309204, "epoch": 1.5994464215104784, "grad_norm": 1.171875, "learning_rate": 0.0004749725869534926, "loss": 5.2248, "mean_token_accuracy": 0.1938748687505722, "num_tokens": 37043854.0, "step": 16180 }, { "entropy": 5.626410484313965, "epoch": 1.5999406880189797, "grad_norm": 1.46875, "learning_rate": 0.00047495640900698064, "loss": 5.3321, "mean_token_accuracy": 0.18536791801452637, "num_tokens": 37055208.0, "step": 16185 }, { "entropy": 5.60192174911499, "epoch": 1.6004349545274812, "grad_norm": 1.3671875, "learning_rate": 0.00047494022614150995, "loss": 5.4013, "mean_token_accuracy": 0.17959013283252717, "num_tokens": 37065938.0, "step": 16190 }, { "entropy": 5.597919464111328, "epoch": 1.6009292210359827, "grad_norm": 1.7421875, "learning_rate": 0.0004749240383574786, "loss": 5.2311, "mean_token_accuracy": 0.18632403314113616, "num_tokens": 37077252.0, "step": 16195 }, { "entropy": 5.576686239242553, "epoch": 1.601423487544484, "grad_norm": 1.453125, "learning_rate": 0.000474907845655285, "loss": 5.2873, "mean_token_accuracy": 0.19015153646469116, "num_tokens": 37087443.0, "step": 16200 }, { "entropy": 5.550740718841553, "epoch": 1.6019177540529854, "grad_norm": 1.484375, "learning_rate": 0.0004748916480353273, "loss": 5.1721, "mean_token_accuracy": 0.20141243636608125, "num_tokens": 37097621.0, "step": 16205 }, { "entropy": 5.580372714996338, "epoch": 1.602412020561487, "grad_norm": 1.4375, "learning_rate": 0.00047487544549800403, "loss": 5.3682, "mean_token_accuracy": 0.18480129688978195, "num_tokens": 37110026.0, "step": 16210 }, { "entropy": 5.553441381454467, "epoch": 1.6029062870699882, "grad_norm": 1.453125, "learning_rate": 0.0004748592380437138, "loss": 5.2897, "mean_token_accuracy": 0.18632829785346985, "num_tokens": 37121447.0, "step": 16215 }, { "entropy": 5.615175247192383, "epoch": 1.6034005535784894, "grad_norm": 1.3046875, "learning_rate": 0.0004748430256728554, "loss": 5.3293, "mean_token_accuracy": 0.18522191047668457, "num_tokens": 37132245.0, "step": 16220 }, { "entropy": 5.720344877243042, "epoch": 1.603894820086991, "grad_norm": 1.2421875, "learning_rate": 0.00047482680838582754, "loss": 5.3626, "mean_token_accuracy": 0.18131855726242066, "num_tokens": 37144135.0, "step": 16225 }, { "entropy": 5.659983491897583, "epoch": 1.6043890865954924, "grad_norm": 1.734375, "learning_rate": 0.0004748105861830292, "loss": 5.3905, "mean_token_accuracy": 0.1781242623925209, "num_tokens": 37155716.0, "step": 16230 }, { "entropy": 5.665464925765991, "epoch": 1.6048833531039937, "grad_norm": 1.421875, "learning_rate": 0.0004747943590648594, "loss": 5.413, "mean_token_accuracy": 0.1751346319913864, "num_tokens": 37166701.0, "step": 16235 }, { "entropy": 5.645764589309692, "epoch": 1.605377619612495, "grad_norm": 1.28125, "learning_rate": 0.00047477812703171737, "loss": 5.3582, "mean_token_accuracy": 0.17787411212921142, "num_tokens": 37177655.0, "step": 16240 }, { "entropy": 5.611736822128296, "epoch": 1.6058718861209964, "grad_norm": 1.3046875, "learning_rate": 0.00047476189008400246, "loss": 5.3171, "mean_token_accuracy": 0.1821049377322197, "num_tokens": 37189925.0, "step": 16245 }, { "entropy": 5.587080430984497, "epoch": 1.606366152629498, "grad_norm": 1.296875, "learning_rate": 0.000474745648222114, "loss": 5.288, "mean_token_accuracy": 0.1887748658657074, "num_tokens": 37200756.0, "step": 16250 }, { "entropy": 5.621827220916748, "epoch": 1.6068604191379992, "grad_norm": 1.234375, "learning_rate": 0.0004747294014464516, "loss": 5.3373, "mean_token_accuracy": 0.18284670561552047, "num_tokens": 37213252.0, "step": 16255 }, { "entropy": 5.698238182067871, "epoch": 1.6073546856465006, "grad_norm": 1.2421875, "learning_rate": 0.000474713149757415, "loss": 5.3153, "mean_token_accuracy": 0.18241272121667862, "num_tokens": 37223754.0, "step": 16260 }, { "entropy": 5.612072324752807, "epoch": 1.6078489521550021, "grad_norm": 1.2890625, "learning_rate": 0.00047469689315540395, "loss": 5.4125, "mean_token_accuracy": 0.17724613547325135, "num_tokens": 37235930.0, "step": 16265 }, { "entropy": 5.559077358245849, "epoch": 1.6083432186635034, "grad_norm": 1.328125, "learning_rate": 0.00047468063164081826, "loss": 5.1992, "mean_token_accuracy": 0.19498272836208344, "num_tokens": 37246794.0, "step": 16270 }, { "entropy": 5.570011711120605, "epoch": 1.6088374851720046, "grad_norm": 1.3828125, "learning_rate": 0.0004746643652140581, "loss": 5.2809, "mean_token_accuracy": 0.18514157086610794, "num_tokens": 37257523.0, "step": 16275 }, { "entropy": 5.5720607280731205, "epoch": 1.6093317516805061, "grad_norm": 1.3046875, "learning_rate": 0.00047464809387552366, "loss": 5.3975, "mean_token_accuracy": 0.1843038469552994, "num_tokens": 37269505.0, "step": 16280 }, { "entropy": 5.665265703201294, "epoch": 1.6098260181890076, "grad_norm": 1.1875, "learning_rate": 0.000474631817625615, "loss": 5.2979, "mean_token_accuracy": 0.18875951766967775, "num_tokens": 37281139.0, "step": 16285 }, { "entropy": 5.5413368225097654, "epoch": 1.6103202846975089, "grad_norm": 1.28125, "learning_rate": 0.0004746155364647327, "loss": 5.2781, "mean_token_accuracy": 0.18880391567945481, "num_tokens": 37291784.0, "step": 16290 }, { "entropy": 5.616222238540649, "epoch": 1.6108145512060101, "grad_norm": 1.34375, "learning_rate": 0.00047459925039327727, "loss": 5.3411, "mean_token_accuracy": 0.18243536949157715, "num_tokens": 37302754.0, "step": 16295 }, { "entropy": 5.56536831855774, "epoch": 1.6113088177145116, "grad_norm": 1.3046875, "learning_rate": 0.00047458295941164933, "loss": 5.2721, "mean_token_accuracy": 0.18999520540237427, "num_tokens": 37313478.0, "step": 16300 }, { "entropy": 5.568728113174439, "epoch": 1.611803084223013, "grad_norm": 1.3125, "learning_rate": 0.0004745666635202496, "loss": 5.301, "mean_token_accuracy": 0.18519092500209808, "num_tokens": 37325223.0, "step": 16305 }, { "entropy": 5.628871822357178, "epoch": 1.6122973507315144, "grad_norm": 1.2578125, "learning_rate": 0.000474550362719479, "loss": 5.3034, "mean_token_accuracy": 0.18422407805919647, "num_tokens": 37336794.0, "step": 16310 }, { "entropy": 5.72665753364563, "epoch": 1.6127916172400159, "grad_norm": 1.4140625, "learning_rate": 0.00047453405700973844, "loss": 5.4531, "mean_token_accuracy": 0.17323654890060425, "num_tokens": 37349171.0, "step": 16315 }, { "entropy": 5.633377599716186, "epoch": 1.6132858837485173, "grad_norm": 1.359375, "learning_rate": 0.0004745177463914292, "loss": 5.4265, "mean_token_accuracy": 0.17821444123983382, "num_tokens": 37362201.0, "step": 16320 }, { "entropy": 5.654541254043579, "epoch": 1.6137801502570186, "grad_norm": 1.2265625, "learning_rate": 0.00047450143086495244, "loss": 5.3534, "mean_token_accuracy": 0.1801922008395195, "num_tokens": 37373858.0, "step": 16325 }, { "entropy": 5.64607801437378, "epoch": 1.6142744167655199, "grad_norm": 1.3125, "learning_rate": 0.0004744851104307095, "loss": 5.358, "mean_token_accuracy": 0.1817267581820488, "num_tokens": 37385973.0, "step": 16330 }, { "entropy": 5.644533395767212, "epoch": 1.6147686832740213, "grad_norm": 1.34375, "learning_rate": 0.00047446878508910194, "loss": 5.3912, "mean_token_accuracy": 0.18212875872850418, "num_tokens": 37398054.0, "step": 16335 }, { "entropy": 5.673584794998169, "epoch": 1.6152629497825228, "grad_norm": 1.3671875, "learning_rate": 0.00047445245484053133, "loss": 5.3355, "mean_token_accuracy": 0.18101910054683684, "num_tokens": 37408656.0, "step": 16340 }, { "entropy": 5.547592878341675, "epoch": 1.615757216291024, "grad_norm": 1.390625, "learning_rate": 0.0004744361196853994, "loss": 5.2153, "mean_token_accuracy": 0.19336293935775756, "num_tokens": 37420454.0, "step": 16345 }, { "entropy": 5.612527751922608, "epoch": 1.6162514827995254, "grad_norm": 1.2421875, "learning_rate": 0.0004744197796241079, "loss": 5.3322, "mean_token_accuracy": 0.1863848313689232, "num_tokens": 37431879.0, "step": 16350 }, { "entropy": 5.631636095046997, "epoch": 1.6167457493080268, "grad_norm": 1.375, "learning_rate": 0.0004744034346570589, "loss": 5.3597, "mean_token_accuracy": 0.18099877387285232, "num_tokens": 37443487.0, "step": 16355 }, { "entropy": 5.544313859939575, "epoch": 1.6172400158165283, "grad_norm": 1.515625, "learning_rate": 0.0004743870847846546, "loss": 5.2609, "mean_token_accuracy": 0.18936059176921843, "num_tokens": 37455726.0, "step": 16360 }, { "entropy": 5.625551223754883, "epoch": 1.6177342823250296, "grad_norm": 1.6640625, "learning_rate": 0.0004743707300072969, "loss": 5.349, "mean_token_accuracy": 0.1823552057147026, "num_tokens": 37466735.0, "step": 16365 }, { "entropy": 5.668590641021728, "epoch": 1.618228548833531, "grad_norm": 1.359375, "learning_rate": 0.00047435437032538843, "loss": 5.4241, "mean_token_accuracy": 0.18433574587106705, "num_tokens": 37479599.0, "step": 16370 }, { "entropy": 5.549736022949219, "epoch": 1.6187228153420326, "grad_norm": 1.4296875, "learning_rate": 0.00047433800573933147, "loss": 5.3036, "mean_token_accuracy": 0.1854292258620262, "num_tokens": 37490896.0, "step": 16375 }, { "entropy": 5.54924168586731, "epoch": 1.6192170818505338, "grad_norm": 1.3984375, "learning_rate": 0.00047432163624952874, "loss": 5.3313, "mean_token_accuracy": 0.1861521676182747, "num_tokens": 37501474.0, "step": 16380 }, { "entropy": 5.5916643142700195, "epoch": 1.619711348359035, "grad_norm": 1.59375, "learning_rate": 0.0004743052618563827, "loss": 5.3492, "mean_token_accuracy": 0.18559490293264388, "num_tokens": 37513410.0, "step": 16385 }, { "entropy": 5.5729100704193115, "epoch": 1.6202056148675366, "grad_norm": 1.3671875, "learning_rate": 0.0004742888825602964, "loss": 5.2347, "mean_token_accuracy": 0.1972057580947876, "num_tokens": 37522612.0, "step": 16390 }, { "entropy": 5.712789106369018, "epoch": 1.620699881376038, "grad_norm": 1.296875, "learning_rate": 0.0004742724983616726, "loss": 5.3924, "mean_token_accuracy": 0.17707159370183945, "num_tokens": 37534320.0, "step": 16395 }, { "entropy": 5.630206823348999, "epoch": 1.6211941478845393, "grad_norm": 1.5390625, "learning_rate": 0.00047425610926091444, "loss": 5.3685, "mean_token_accuracy": 0.17957195192575454, "num_tokens": 37545599.0, "step": 16400 }, { "entropy": 5.619510316848755, "epoch": 1.6216884143930406, "grad_norm": 1.328125, "learning_rate": 0.0004742397152584251, "loss": 5.4126, "mean_token_accuracy": 0.190477953851223, "num_tokens": 37558002.0, "step": 16405 }, { "entropy": 5.5778505325317385, "epoch": 1.6221826809015423, "grad_norm": 1.3671875, "learning_rate": 0.00047422331635460784, "loss": 5.2928, "mean_token_accuracy": 0.18724770545959474, "num_tokens": 37570808.0, "step": 16410 }, { "entropy": 5.650541353225708, "epoch": 1.6226769474100435, "grad_norm": 1.4609375, "learning_rate": 0.00047420691254986615, "loss": 5.3349, "mean_token_accuracy": 0.18815899789333343, "num_tokens": 37581065.0, "step": 16415 }, { "entropy": 5.616580963134766, "epoch": 1.6231712139185448, "grad_norm": 1.3671875, "learning_rate": 0.00047419050384460345, "loss": 5.3149, "mean_token_accuracy": 0.1897153675556183, "num_tokens": 37592472.0, "step": 16420 }, { "entropy": 5.612893772125244, "epoch": 1.6236654804270463, "grad_norm": 1.484375, "learning_rate": 0.0004741740902392235, "loss": 5.3053, "mean_token_accuracy": 0.1877980872988701, "num_tokens": 37604601.0, "step": 16425 }, { "entropy": 5.626508188247681, "epoch": 1.6241597469355478, "grad_norm": 1.21875, "learning_rate": 0.0004741576717341299, "loss": 5.2873, "mean_token_accuracy": 0.187255597114563, "num_tokens": 37615978.0, "step": 16430 }, { "entropy": 5.523616456985474, "epoch": 1.624654013444049, "grad_norm": 1.578125, "learning_rate": 0.0004741412483297268, "loss": 5.2555, "mean_token_accuracy": 0.1919064223766327, "num_tokens": 37627532.0, "step": 16435 }, { "entropy": 5.601925039291382, "epoch": 1.6251482799525503, "grad_norm": 1.421875, "learning_rate": 0.0004741248200264181, "loss": 5.3752, "mean_token_accuracy": 0.1803853392601013, "num_tokens": 37640508.0, "step": 16440 }, { "entropy": 5.604682588577271, "epoch": 1.6256425464610518, "grad_norm": 1.65625, "learning_rate": 0.0004741083868246079, "loss": 5.2514, "mean_token_accuracy": 0.1836131200194359, "num_tokens": 37652095.0, "step": 16445 }, { "entropy": 5.555622911453247, "epoch": 1.6261368129695533, "grad_norm": 1.3984375, "learning_rate": 0.0004740919487247005, "loss": 5.2743, "mean_token_accuracy": 0.19207785427570342, "num_tokens": 37663481.0, "step": 16450 }, { "entropy": 5.618346166610718, "epoch": 1.6266310794780545, "grad_norm": 1.3828125, "learning_rate": 0.0004740755057271003, "loss": 5.2936, "mean_token_accuracy": 0.18932325541973113, "num_tokens": 37675259.0, "step": 16455 }, { "entropy": 5.566410541534424, "epoch": 1.627125345986556, "grad_norm": 1.3359375, "learning_rate": 0.00047405905783221177, "loss": 5.2691, "mean_token_accuracy": 0.18333564102649688, "num_tokens": 37686006.0, "step": 16460 }, { "entropy": 5.579566097259521, "epoch": 1.6276196124950575, "grad_norm": 1.578125, "learning_rate": 0.00047404260504043945, "loss": 5.3272, "mean_token_accuracy": 0.18431832492351533, "num_tokens": 37697642.0, "step": 16465 }, { "entropy": 5.660151815414428, "epoch": 1.6281138790035588, "grad_norm": 1.40625, "learning_rate": 0.00047402614735218824, "loss": 5.3415, "mean_token_accuracy": 0.18479539901018144, "num_tokens": 37707714.0, "step": 16470 }, { "entropy": 5.603965520858765, "epoch": 1.62860814551206, "grad_norm": 1.4921875, "learning_rate": 0.0004740096847678629, "loss": 5.3334, "mean_token_accuracy": 0.18693797290325165, "num_tokens": 37719562.0, "step": 16475 }, { "entropy": 5.567446994781494, "epoch": 1.6291024120205615, "grad_norm": 1.5234375, "learning_rate": 0.0004739932172878685, "loss": 5.2968, "mean_token_accuracy": 0.18708339482545852, "num_tokens": 37731521.0, "step": 16480 }, { "entropy": 5.675037574768067, "epoch": 1.629596678529063, "grad_norm": 1.8515625, "learning_rate": 0.00047397674491261003, "loss": 5.3605, "mean_token_accuracy": 0.18157930076122283, "num_tokens": 37743015.0, "step": 16485 }, { "entropy": 5.62669267654419, "epoch": 1.6300909450375642, "grad_norm": 1.3671875, "learning_rate": 0.00047396026764249285, "loss": 5.3398, "mean_token_accuracy": 0.17811971306800842, "num_tokens": 37754219.0, "step": 16490 }, { "entropy": 5.547645044326782, "epoch": 1.6305852115460655, "grad_norm": 1.6796875, "learning_rate": 0.0004739437854779222, "loss": 5.3645, "mean_token_accuracy": 0.1810488909482956, "num_tokens": 37765738.0, "step": 16495 }, { "entropy": 5.436764430999756, "epoch": 1.631079478054567, "grad_norm": 1.4921875, "learning_rate": 0.00047392729841930345, "loss": 5.1029, "mean_token_accuracy": 0.20867561250925065, "num_tokens": 37778647.0, "step": 16500 }, { "entropy": 5.607191371917724, "epoch": 1.6315737445630685, "grad_norm": 1.2578125, "learning_rate": 0.00047391080646704237, "loss": 5.311, "mean_token_accuracy": 0.18862325698137283, "num_tokens": 37790380.0, "step": 16505 }, { "entropy": 5.565876245498657, "epoch": 1.6320680110715697, "grad_norm": 1.375, "learning_rate": 0.00047389430962154464, "loss": 5.3182, "mean_token_accuracy": 0.17928051203489304, "num_tokens": 37802474.0, "step": 16510 }, { "entropy": 5.5442015647888185, "epoch": 1.6325622775800712, "grad_norm": 1.6015625, "learning_rate": 0.00047387780788321594, "loss": 5.3816, "mean_token_accuracy": 0.17658133208751678, "num_tokens": 37814154.0, "step": 16515 }, { "entropy": 5.692914152145386, "epoch": 1.6330565440885727, "grad_norm": 1.5, "learning_rate": 0.0004738613012524624, "loss": 5.3094, "mean_token_accuracy": 0.18607857823371887, "num_tokens": 37825371.0, "step": 16520 }, { "entropy": 5.652116012573242, "epoch": 1.633550810597074, "grad_norm": 1.625, "learning_rate": 0.00047384478972968997, "loss": 5.3403, "mean_token_accuracy": 0.18100840896368026, "num_tokens": 37836475.0, "step": 16525 }, { "entropy": 5.636460876464843, "epoch": 1.6340450771055752, "grad_norm": 1.234375, "learning_rate": 0.00047382827331530483, "loss": 5.3688, "mean_token_accuracy": 0.1857140064239502, "num_tokens": 37848413.0, "step": 16530 }, { "entropy": 5.556559610366821, "epoch": 1.6345393436140767, "grad_norm": 1.4765625, "learning_rate": 0.0004738117520097133, "loss": 5.2299, "mean_token_accuracy": 0.1951899230480194, "num_tokens": 37858174.0, "step": 16535 }, { "entropy": 5.601485538482666, "epoch": 1.6350336101225782, "grad_norm": 1.6015625, "learning_rate": 0.000473795225813322, "loss": 5.364, "mean_token_accuracy": 0.18491999059915543, "num_tokens": 37869987.0, "step": 16540 }, { "entropy": 5.5809314250946045, "epoch": 1.6355278766310795, "grad_norm": 1.359375, "learning_rate": 0.00047377869472653704, "loss": 5.2519, "mean_token_accuracy": 0.19710858911275864, "num_tokens": 37882050.0, "step": 16545 }, { "entropy": 5.611066007614136, "epoch": 1.6360221431395807, "grad_norm": 1.5625, "learning_rate": 0.0004737621587497655, "loss": 5.2973, "mean_token_accuracy": 0.1831185296177864, "num_tokens": 37894537.0, "step": 16550 }, { "entropy": 5.640512275695801, "epoch": 1.6365164096480822, "grad_norm": 1.2890625, "learning_rate": 0.000473745617883414, "loss": 5.2467, "mean_token_accuracy": 0.1942311331629753, "num_tokens": 37905795.0, "step": 16555 }, { "entropy": 5.5917558670043945, "epoch": 1.6370106761565837, "grad_norm": 1.484375, "learning_rate": 0.00047372907212788953, "loss": 5.3249, "mean_token_accuracy": 0.1859632760286331, "num_tokens": 37918778.0, "step": 16560 }, { "entropy": 5.649238777160645, "epoch": 1.637504942665085, "grad_norm": 1.4296875, "learning_rate": 0.00047371252148359897, "loss": 5.3954, "mean_token_accuracy": 0.1771112322807312, "num_tokens": 37930963.0, "step": 16565 }, { "entropy": 5.634269762039184, "epoch": 1.6379992091735864, "grad_norm": 1.3125, "learning_rate": 0.0004736959659509496, "loss": 5.3853, "mean_token_accuracy": 0.1860823005437851, "num_tokens": 37943067.0, "step": 16570 }, { "entropy": 5.605807065963745, "epoch": 1.638493475682088, "grad_norm": 1.8359375, "learning_rate": 0.0004736794055303487, "loss": 5.3529, "mean_token_accuracy": 0.18497975617647172, "num_tokens": 37953425.0, "step": 16575 }, { "entropy": 5.5283989906311035, "epoch": 1.6389877421905892, "grad_norm": 1.4921875, "learning_rate": 0.00047366284022220346, "loss": 5.2605, "mean_token_accuracy": 0.18783415257930755, "num_tokens": 37965801.0, "step": 16580 }, { "entropy": 5.683371210098267, "epoch": 1.6394820086990904, "grad_norm": 1.4609375, "learning_rate": 0.0004736462700269216, "loss": 5.3586, "mean_token_accuracy": 0.1798913896083832, "num_tokens": 37978169.0, "step": 16585 }, { "entropy": 5.63033618927002, "epoch": 1.639976275207592, "grad_norm": 1.234375, "learning_rate": 0.00047362969494491063, "loss": 5.3284, "mean_token_accuracy": 0.18879836350679396, "num_tokens": 37990154.0, "step": 16590 }, { "entropy": 5.617295026779175, "epoch": 1.6404705417160934, "grad_norm": 1.1796875, "learning_rate": 0.00047361311497657845, "loss": 5.2305, "mean_token_accuracy": 0.19250458329916, "num_tokens": 38001249.0, "step": 16595 }, { "entropy": 5.53756685256958, "epoch": 1.6409648082245947, "grad_norm": 1.375, "learning_rate": 0.0004735965301223328, "loss": 5.283, "mean_token_accuracy": 0.19124522656202317, "num_tokens": 38013453.0, "step": 16600 }, { "entropy": 5.620217370986938, "epoch": 1.641459074733096, "grad_norm": 1.3828125, "learning_rate": 0.00047357994038258166, "loss": 5.4104, "mean_token_accuracy": 0.17685119509696962, "num_tokens": 38024463.0, "step": 16605 }, { "entropy": 5.6609179973602295, "epoch": 1.6419533412415974, "grad_norm": 1.5703125, "learning_rate": 0.00047356334575773324, "loss": 5.3709, "mean_token_accuracy": 0.18480053395032883, "num_tokens": 38036131.0, "step": 16610 }, { "entropy": 5.5884881019592285, "epoch": 1.642447607750099, "grad_norm": 1.2578125, "learning_rate": 0.0004735467462481956, "loss": 5.2971, "mean_token_accuracy": 0.18905212134122848, "num_tokens": 38047428.0, "step": 16615 }, { "entropy": 5.5827028274536135, "epoch": 1.6429418742586002, "grad_norm": 1.359375, "learning_rate": 0.0004735301418543773, "loss": 5.3279, "mean_token_accuracy": 0.18912371695041658, "num_tokens": 38059864.0, "step": 16620 }, { "entropy": 5.6316742420196535, "epoch": 1.6434361407671016, "grad_norm": 1.4765625, "learning_rate": 0.00047351353257668675, "loss": 5.3442, "mean_token_accuracy": 0.17932978868484498, "num_tokens": 38071356.0, "step": 16625 }, { "entropy": 5.6271758556365965, "epoch": 1.6439304072756031, "grad_norm": 1.5, "learning_rate": 0.0004734969184155324, "loss": 5.3443, "mean_token_accuracy": 0.17520896345376968, "num_tokens": 38082124.0, "step": 16630 }, { "entropy": 5.642376804351807, "epoch": 1.6444246737841044, "grad_norm": 1.6484375, "learning_rate": 0.00047348029937132306, "loss": 5.3438, "mean_token_accuracy": 0.1800471603870392, "num_tokens": 38093451.0, "step": 16635 }, { "entropy": 5.5985941886901855, "epoch": 1.6449189402926057, "grad_norm": 1.328125, "learning_rate": 0.00047346367544446753, "loss": 5.3464, "mean_token_accuracy": 0.17877690345048905, "num_tokens": 38105078.0, "step": 16640 }, { "entropy": 5.5512065410614015, "epoch": 1.6454132068011071, "grad_norm": 1.3359375, "learning_rate": 0.0004734470466353749, "loss": 5.1954, "mean_token_accuracy": 0.19351691603660584, "num_tokens": 38114953.0, "step": 16645 }, { "entropy": 5.576357316970825, "epoch": 1.6459074733096086, "grad_norm": 1.3984375, "learning_rate": 0.0004734304129444542, "loss": 5.2643, "mean_token_accuracy": 0.18573001325130462, "num_tokens": 38126465.0, "step": 16650 }, { "entropy": 5.688961219787598, "epoch": 1.6464017398181099, "grad_norm": 1.421875, "learning_rate": 0.0004734137743721144, "loss": 5.3989, "mean_token_accuracy": 0.18103523552417755, "num_tokens": 38139223.0, "step": 16655 }, { "entropy": 5.517856693267822, "epoch": 1.6468960063266112, "grad_norm": 1.484375, "learning_rate": 0.000473397130918765, "loss": 5.278, "mean_token_accuracy": 0.19320471286773683, "num_tokens": 38151676.0, "step": 16660 }, { "entropy": 5.570414400100708, "epoch": 1.6473902728351129, "grad_norm": 1.3515625, "learning_rate": 0.00047338048258481545, "loss": 5.288, "mean_token_accuracy": 0.1813721239566803, "num_tokens": 38162759.0, "step": 16665 }, { "entropy": 5.579239845275879, "epoch": 1.6478845393436141, "grad_norm": 1.578125, "learning_rate": 0.0004733638293706752, "loss": 5.2953, "mean_token_accuracy": 0.1891671448945999, "num_tokens": 38174820.0, "step": 16670 }, { "entropy": 5.528016471862793, "epoch": 1.6483788058521154, "grad_norm": 1.3515625, "learning_rate": 0.000473347171276754, "loss": 5.1845, "mean_token_accuracy": 0.19763631820678712, "num_tokens": 38185558.0, "step": 16675 }, { "entropy": 5.577135324478149, "epoch": 1.6488730723606169, "grad_norm": 1.5703125, "learning_rate": 0.0004733305083034617, "loss": 5.3602, "mean_token_accuracy": 0.1821441262960434, "num_tokens": 38198231.0, "step": 16680 }, { "entropy": 5.645250463485718, "epoch": 1.6493673388691183, "grad_norm": 1.375, "learning_rate": 0.00047331384045120803, "loss": 5.3279, "mean_token_accuracy": 0.18815534561872482, "num_tokens": 38209539.0, "step": 16685 }, { "entropy": 5.629117488861084, "epoch": 1.6498616053776196, "grad_norm": 1.640625, "learning_rate": 0.0004732971677204031, "loss": 5.3586, "mean_token_accuracy": 0.17826489508152008, "num_tokens": 38220873.0, "step": 16690 }, { "entropy": 5.61576828956604, "epoch": 1.6503558718861209, "grad_norm": 1.2265625, "learning_rate": 0.00047328049011145714, "loss": 5.2584, "mean_token_accuracy": 0.19291307777166367, "num_tokens": 38231186.0, "step": 16695 }, { "entropy": 5.634268760681152, "epoch": 1.6508501383946224, "grad_norm": 1.2734375, "learning_rate": 0.0004732638076247804, "loss": 5.384, "mean_token_accuracy": 0.17331185787916184, "num_tokens": 38242152.0, "step": 16700 }, { "entropy": 5.664009284973145, "epoch": 1.6513444049031238, "grad_norm": 1.34375, "learning_rate": 0.00047324712026078315, "loss": 5.3286, "mean_token_accuracy": 0.18384687900543212, "num_tokens": 38254281.0, "step": 16705 }, { "entropy": 5.559139442443848, "epoch": 1.651838671411625, "grad_norm": 1.4296875, "learning_rate": 0.000473230428019876, "loss": 5.1981, "mean_token_accuracy": 0.1868847668170929, "num_tokens": 38265120.0, "step": 16710 }, { "entropy": 5.592050409317016, "epoch": 1.6523329379201266, "grad_norm": 1.4921875, "learning_rate": 0.00047321373090246957, "loss": 5.2522, "mean_token_accuracy": 0.19010176956653596, "num_tokens": 38275509.0, "step": 16715 }, { "entropy": 5.543418598175049, "epoch": 1.652827204428628, "grad_norm": 1.4765625, "learning_rate": 0.00047319702890897457, "loss": 5.2443, "mean_token_accuracy": 0.19703299701213836, "num_tokens": 38285586.0, "step": 16720 }, { "entropy": 5.586500930786133, "epoch": 1.6533214709371293, "grad_norm": 1.7734375, "learning_rate": 0.000473180322039802, "loss": 5.2679, "mean_token_accuracy": 0.1873980015516281, "num_tokens": 38296091.0, "step": 16725 }, { "entropy": 5.597022199630738, "epoch": 1.6538157374456306, "grad_norm": 1.5390625, "learning_rate": 0.0004731636102953627, "loss": 5.3475, "mean_token_accuracy": 0.18359087109565736, "num_tokens": 38308520.0, "step": 16730 }, { "entropy": 5.635043001174926, "epoch": 1.654310003954132, "grad_norm": 1.34375, "learning_rate": 0.0004731468936760679, "loss": 5.3257, "mean_token_accuracy": 0.1828442320227623, "num_tokens": 38320584.0, "step": 16735 }, { "entropy": 5.59954867362976, "epoch": 1.6548042704626336, "grad_norm": 1.2578125, "learning_rate": 0.0004731301721823287, "loss": 5.2892, "mean_token_accuracy": 0.18667288422584533, "num_tokens": 38332646.0, "step": 16740 }, { "entropy": 5.630438184738159, "epoch": 1.6552985369711348, "grad_norm": 1.296875, "learning_rate": 0.0004731134458145566, "loss": 5.3275, "mean_token_accuracy": 0.18137831836938859, "num_tokens": 38343382.0, "step": 16745 }, { "entropy": 5.69502820968628, "epoch": 1.655792803479636, "grad_norm": 1.2890625, "learning_rate": 0.00047309671457316295, "loss": 5.3761, "mean_token_accuracy": 0.17543837130069734, "num_tokens": 38354809.0, "step": 16750 }, { "entropy": 5.583798122406006, "epoch": 1.6562870699881376, "grad_norm": 1.3359375, "learning_rate": 0.00047307997845855946, "loss": 5.3126, "mean_token_accuracy": 0.1855696126818657, "num_tokens": 38366524.0, "step": 16755 }, { "entropy": 5.5409763813018795, "epoch": 1.656781336496639, "grad_norm": 1.3984375, "learning_rate": 0.0004730632374711578, "loss": 5.2419, "mean_token_accuracy": 0.19076735526323318, "num_tokens": 38377645.0, "step": 16760 }, { "entropy": 5.6520342350006105, "epoch": 1.6572756030051403, "grad_norm": 1.34375, "learning_rate": 0.0004730464916113696, "loss": 5.3838, "mean_token_accuracy": 0.1905674546957016, "num_tokens": 38389633.0, "step": 16765 }, { "entropy": 5.6495801448822025, "epoch": 1.6577698695136418, "grad_norm": 1.4609375, "learning_rate": 0.00047302974087960704, "loss": 5.3665, "mean_token_accuracy": 0.18001354038715361, "num_tokens": 38401255.0, "step": 16770 }, { "entropy": 5.6040256977081295, "epoch": 1.6582641360221433, "grad_norm": 1.59375, "learning_rate": 0.0004730129852762822, "loss": 5.3101, "mean_token_accuracy": 0.18237418830394744, "num_tokens": 38413160.0, "step": 16775 }, { "entropy": 5.593385553359985, "epoch": 1.6587584025306445, "grad_norm": 1.53125, "learning_rate": 0.00047299622480180716, "loss": 5.3571, "mean_token_accuracy": 0.1793212816119194, "num_tokens": 38423789.0, "step": 16780 }, { "entropy": 5.61279182434082, "epoch": 1.6592526690391458, "grad_norm": 1.34375, "learning_rate": 0.00047297945945659424, "loss": 5.3137, "mean_token_accuracy": 0.18210093080997466, "num_tokens": 38435031.0, "step": 16785 }, { "entropy": 5.595762157440186, "epoch": 1.6597469355476473, "grad_norm": 1.3828125, "learning_rate": 0.00047296268924105594, "loss": 5.2917, "mean_token_accuracy": 0.19297283589839936, "num_tokens": 38445146.0, "step": 16790 }, { "entropy": 5.646050357818604, "epoch": 1.6602412020561488, "grad_norm": 1.3828125, "learning_rate": 0.00047294591415560484, "loss": 5.3501, "mean_token_accuracy": 0.1796015441417694, "num_tokens": 38457429.0, "step": 16795 }, { "entropy": 5.633969354629516, "epoch": 1.66073546856465, "grad_norm": 1.3359375, "learning_rate": 0.0004729291342006535, "loss": 5.3239, "mean_token_accuracy": 0.188394233584404, "num_tokens": 38468218.0, "step": 16800 }, { "entropy": 5.651690578460693, "epoch": 1.6612297350731513, "grad_norm": 1.21875, "learning_rate": 0.0004729123493766147, "loss": 5.3682, "mean_token_accuracy": 0.18079716563224793, "num_tokens": 38480841.0, "step": 16805 }, { "entropy": 5.5538781642913815, "epoch": 1.6617240015816528, "grad_norm": 1.171875, "learning_rate": 0.0004728955596839014, "loss": 5.2478, "mean_token_accuracy": 0.184818834066391, "num_tokens": 38493115.0, "step": 16810 }, { "entropy": 5.6409104347229, "epoch": 1.6622182680901543, "grad_norm": 1.1484375, "learning_rate": 0.0004728787651229267, "loss": 5.2922, "mean_token_accuracy": 0.18741248697042465, "num_tokens": 38505187.0, "step": 16815 }, { "entropy": 5.62151689529419, "epoch": 1.6627125345986555, "grad_norm": 1.34375, "learning_rate": 0.00047286196569410366, "loss": 5.4234, "mean_token_accuracy": 0.17665693461894988, "num_tokens": 38518736.0, "step": 16820 }, { "entropy": 5.54524941444397, "epoch": 1.663206801107157, "grad_norm": 1.3203125, "learning_rate": 0.00047284516139784556, "loss": 5.2484, "mean_token_accuracy": 0.19550250321626664, "num_tokens": 38529703.0, "step": 16825 }, { "entropy": 5.582247686386109, "epoch": 1.6637010676156585, "grad_norm": 1.390625, "learning_rate": 0.0004728283522345658, "loss": 5.3141, "mean_token_accuracy": 0.178050996363163, "num_tokens": 38542200.0, "step": 16830 }, { "entropy": 5.633548259735107, "epoch": 1.6641953341241598, "grad_norm": 1.515625, "learning_rate": 0.0004728115382046779, "loss": 5.3515, "mean_token_accuracy": 0.18050352483987808, "num_tokens": 38552921.0, "step": 16835 }, { "entropy": 5.61789493560791, "epoch": 1.664689600632661, "grad_norm": 1.2578125, "learning_rate": 0.0004727947193085954, "loss": 5.3661, "mean_token_accuracy": 0.18265555948019027, "num_tokens": 38564837.0, "step": 16840 }, { "entropy": 5.625684118270874, "epoch": 1.6651838671411625, "grad_norm": 1.3984375, "learning_rate": 0.00047277789554673217, "loss": 5.319, "mean_token_accuracy": 0.18435919731855394, "num_tokens": 38575786.0, "step": 16845 }, { "entropy": 5.649453401565552, "epoch": 1.665678133649664, "grad_norm": 1.265625, "learning_rate": 0.00047276106691950204, "loss": 5.357, "mean_token_accuracy": 0.17883790731430055, "num_tokens": 38588232.0, "step": 16850 }, { "entropy": 5.615127325057983, "epoch": 1.6661724001581653, "grad_norm": 1.484375, "learning_rate": 0.00047274423342731896, "loss": 5.2989, "mean_token_accuracy": 0.182313534617424, "num_tokens": 38600276.0, "step": 16855 }, { "entropy": 5.621436691284179, "epoch": 1.6666666666666665, "grad_norm": 1.40625, "learning_rate": 0.0004727273950705971, "loss": 5.3232, "mean_token_accuracy": 0.18429888784885406, "num_tokens": 38611879.0, "step": 16860 }, { "entropy": 5.612408685684204, "epoch": 1.667160933175168, "grad_norm": 1.3515625, "learning_rate": 0.00047271055184975057, "loss": 5.3806, "mean_token_accuracy": 0.17519059628248215, "num_tokens": 38623032.0, "step": 16865 }, { "entropy": 5.678209400177002, "epoch": 1.6676551996836695, "grad_norm": 1.1796875, "learning_rate": 0.0004726937037651939, "loss": 5.3433, "mean_token_accuracy": 0.18555716872215272, "num_tokens": 38633864.0, "step": 16870 }, { "entropy": 5.558736944198609, "epoch": 1.6681494661921707, "grad_norm": 1.484375, "learning_rate": 0.00047267685081734133, "loss": 5.2968, "mean_token_accuracy": 0.1855804815888405, "num_tokens": 38645208.0, "step": 16875 }, { "entropy": 5.527917814254761, "epoch": 1.6686437327006722, "grad_norm": 1.3515625, "learning_rate": 0.0004726599930066076, "loss": 5.2524, "mean_token_accuracy": 0.18979646563529967, "num_tokens": 38655181.0, "step": 16880 }, { "entropy": 5.700963878631592, "epoch": 1.6691379992091737, "grad_norm": 1.3828125, "learning_rate": 0.0004726431303334074, "loss": 5.3787, "mean_token_accuracy": 0.18114294111728668, "num_tokens": 38667381.0, "step": 16885 }, { "entropy": 5.640314674377441, "epoch": 1.669632265717675, "grad_norm": 1.2578125, "learning_rate": 0.00047262626279815555, "loss": 5.337, "mean_token_accuracy": 0.18546753078699113, "num_tokens": 38680479.0, "step": 16890 }, { "entropy": 5.619797801971435, "epoch": 1.6701265322261762, "grad_norm": 1.3828125, "learning_rate": 0.000472609390401267, "loss": 5.3317, "mean_token_accuracy": 0.18610499650239945, "num_tokens": 38691737.0, "step": 16895 }, { "entropy": 5.60442419052124, "epoch": 1.6706207987346777, "grad_norm": 1.3046875, "learning_rate": 0.0004725925131431567, "loss": 5.2764, "mean_token_accuracy": 0.19037256091833116, "num_tokens": 38703306.0, "step": 16900 }, { "entropy": 5.617859268188477, "epoch": 1.6711150652431792, "grad_norm": 1.4296875, "learning_rate": 0.00047257563102424, "loss": 5.313, "mean_token_accuracy": 0.18335749804973603, "num_tokens": 38714683.0, "step": 16905 }, { "entropy": 5.633234119415283, "epoch": 1.6716093317516805, "grad_norm": 1.328125, "learning_rate": 0.0004725587440449321, "loss": 5.3991, "mean_token_accuracy": 0.1770082876086235, "num_tokens": 38727705.0, "step": 16910 }, { "entropy": 5.6590173721313475, "epoch": 1.6721035982601817, "grad_norm": 1.3046875, "learning_rate": 0.00047254185220564843, "loss": 5.3825, "mean_token_accuracy": 0.1855751559138298, "num_tokens": 38738687.0, "step": 16915 }, { "entropy": 5.5989988327026365, "epoch": 1.6725978647686834, "grad_norm": 1.3125, "learning_rate": 0.00047252495550680453, "loss": 5.2853, "mean_token_accuracy": 0.18258834034204482, "num_tokens": 38749437.0, "step": 16920 }, { "entropy": 5.50099630355835, "epoch": 1.6730921312771847, "grad_norm": 1.4453125, "learning_rate": 0.0004725080539488162, "loss": 5.1821, "mean_token_accuracy": 0.20848096907138824, "num_tokens": 38761342.0, "step": 16925 }, { "entropy": 5.627041053771973, "epoch": 1.673586397785686, "grad_norm": 2.296875, "learning_rate": 0.00047249114753209896, "loss": 5.3708, "mean_token_accuracy": 0.18091026842594146, "num_tokens": 38773019.0, "step": 16930 }, { "entropy": 5.709657430648804, "epoch": 1.6740806642941874, "grad_norm": 1.2265625, "learning_rate": 0.00047247423625706894, "loss": 5.3533, "mean_token_accuracy": 0.18081678599119186, "num_tokens": 38785291.0, "step": 16935 }, { "entropy": 5.614141654968262, "epoch": 1.674574930802689, "grad_norm": 1.453125, "learning_rate": 0.000472457320124142, "loss": 5.3245, "mean_token_accuracy": 0.18269609063863754, "num_tokens": 38796926.0, "step": 16940 }, { "entropy": 5.640139865875244, "epoch": 1.6750691973111902, "grad_norm": 1.4765625, "learning_rate": 0.00047244039913373444, "loss": 5.3089, "mean_token_accuracy": 0.18822263777256013, "num_tokens": 38809839.0, "step": 16945 }, { "entropy": 5.665899753570557, "epoch": 1.6755634638196915, "grad_norm": 1.34375, "learning_rate": 0.0004724234732862624, "loss": 5.4078, "mean_token_accuracy": 0.174242602288723, "num_tokens": 38823059.0, "step": 16950 }, { "entropy": 5.56723051071167, "epoch": 1.676057730328193, "grad_norm": 1.2890625, "learning_rate": 0.0004724065425821422, "loss": 5.2031, "mean_token_accuracy": 0.19865086078643798, "num_tokens": 38834275.0, "step": 16955 }, { "entropy": 5.579958963394165, "epoch": 1.6765519968366944, "grad_norm": 1.3515625, "learning_rate": 0.0004723896070217905, "loss": 5.2993, "mean_token_accuracy": 0.18667323440313338, "num_tokens": 38845992.0, "step": 16960 }, { "entropy": 5.631908941268921, "epoch": 1.6770462633451957, "grad_norm": 1.2421875, "learning_rate": 0.0004723726666056239, "loss": 5.3728, "mean_token_accuracy": 0.18548421561717987, "num_tokens": 38857269.0, "step": 16965 }, { "entropy": 5.625741910934448, "epoch": 1.677540529853697, "grad_norm": 1.6484375, "learning_rate": 0.00047235572133405904, "loss": 5.3806, "mean_token_accuracy": 0.18023659884929658, "num_tokens": 38869393.0, "step": 16970 }, { "entropy": 5.69693169593811, "epoch": 1.6780347963621987, "grad_norm": 1.3359375, "learning_rate": 0.00047233877120751277, "loss": 5.345, "mean_token_accuracy": 0.18244201838970184, "num_tokens": 38881625.0, "step": 16975 }, { "entropy": 5.61612720489502, "epoch": 1.6785290628707, "grad_norm": 1.1484375, "learning_rate": 0.00047232181622640216, "loss": 5.3105, "mean_token_accuracy": 0.1850807934999466, "num_tokens": 38892452.0, "step": 16980 }, { "entropy": 5.599652290344238, "epoch": 1.6790233293792012, "grad_norm": 1.1875, "learning_rate": 0.0004723048563911443, "loss": 5.1921, "mean_token_accuracy": 0.19920271188020705, "num_tokens": 38902415.0, "step": 16985 }, { "entropy": 5.559013795852661, "epoch": 1.6795175958877027, "grad_norm": 1.453125, "learning_rate": 0.00047228789170215623, "loss": 5.2564, "mean_token_accuracy": 0.1962148904800415, "num_tokens": 38912655.0, "step": 16990 }, { "entropy": 5.604779148101807, "epoch": 1.6800118623962041, "grad_norm": 1.6171875, "learning_rate": 0.00047227092215985553, "loss": 5.3137, "mean_token_accuracy": 0.1834467902779579, "num_tokens": 38923295.0, "step": 16995 }, { "entropy": 5.628239107131958, "epoch": 1.6805061289047054, "grad_norm": 1.203125, "learning_rate": 0.0004722539477646595, "loss": 5.3356, "mean_token_accuracy": 0.1802532345056534, "num_tokens": 38934879.0, "step": 17000 }, { "entropy": 5.684195280075073, "epoch": 1.6810003954132067, "grad_norm": 1.4921875, "learning_rate": 0.00047223696851698575, "loss": 5.4377, "mean_token_accuracy": 0.17668186277151107, "num_tokens": 38946574.0, "step": 17005 }, { "entropy": 5.59917459487915, "epoch": 1.6814946619217082, "grad_norm": 1.3671875, "learning_rate": 0.000472219984417252, "loss": 5.3444, "mean_token_accuracy": 0.18711143136024475, "num_tokens": 38958136.0, "step": 17010 }, { "entropy": 5.639297246932983, "epoch": 1.6819889284302096, "grad_norm": 1.359375, "learning_rate": 0.0004722029954658761, "loss": 5.2896, "mean_token_accuracy": 0.19137297570705414, "num_tokens": 38969353.0, "step": 17015 }, { "entropy": 5.525437068939209, "epoch": 1.682483194938711, "grad_norm": 1.2890625, "learning_rate": 0.0004721860016632758, "loss": 5.2684, "mean_token_accuracy": 0.19085678160190583, "num_tokens": 38979878.0, "step": 17020 }, { "entropy": 5.611176776885986, "epoch": 1.6829774614472124, "grad_norm": 1.4296875, "learning_rate": 0.0004721690030098693, "loss": 5.4148, "mean_token_accuracy": 0.18562639951705934, "num_tokens": 38992847.0, "step": 17025 }, { "entropy": 5.622990417480469, "epoch": 1.6834717279557139, "grad_norm": 1.3203125, "learning_rate": 0.0004721519995060748, "loss": 5.2991, "mean_token_accuracy": 0.18584561347961426, "num_tokens": 39003874.0, "step": 17030 }, { "entropy": 5.617108631134033, "epoch": 1.6839659944642151, "grad_norm": 1.4765625, "learning_rate": 0.00047213499115231043, "loss": 5.2694, "mean_token_accuracy": 0.18640926629304885, "num_tokens": 39014327.0, "step": 17035 }, { "entropy": 5.605392789840698, "epoch": 1.6844602609727164, "grad_norm": 1.5078125, "learning_rate": 0.0004721179779489948, "loss": 5.2492, "mean_token_accuracy": 0.18275727033615113, "num_tokens": 39024507.0, "step": 17040 }, { "entropy": 5.529019927978515, "epoch": 1.6849545274812179, "grad_norm": 1.3671875, "learning_rate": 0.00047210095989654624, "loss": 5.2665, "mean_token_accuracy": 0.18543069660663605, "num_tokens": 39036184.0, "step": 17045 }, { "entropy": 5.532121562957764, "epoch": 1.6854487939897194, "grad_norm": 1.3671875, "learning_rate": 0.00047208393699538356, "loss": 5.233, "mean_token_accuracy": 0.19430117756128312, "num_tokens": 39047649.0, "step": 17050 }, { "entropy": 5.548897743225098, "epoch": 1.6859430604982206, "grad_norm": 1.4765625, "learning_rate": 0.00047206690924592545, "loss": 5.2543, "mean_token_accuracy": 0.18739078044891358, "num_tokens": 39058167.0, "step": 17055 }, { "entropy": 5.60099229812622, "epoch": 1.6864373270067219, "grad_norm": 1.3828125, "learning_rate": 0.0004720498766485907, "loss": 5.301, "mean_token_accuracy": 0.1867012232542038, "num_tokens": 39070099.0, "step": 17060 }, { "entropy": 5.612334156036377, "epoch": 1.6869315935152234, "grad_norm": 1.375, "learning_rate": 0.00047203283920379846, "loss": 5.2228, "mean_token_accuracy": 0.19435063153505325, "num_tokens": 39080337.0, "step": 17065 }, { "entropy": 5.710967493057251, "epoch": 1.6874258600237249, "grad_norm": 1.2734375, "learning_rate": 0.00047201579691196784, "loss": 5.4926, "mean_token_accuracy": 0.17481014579534532, "num_tokens": 39093455.0, "step": 17070 }, { "entropy": 5.619350147247315, "epoch": 1.6879201265322261, "grad_norm": 1.2421875, "learning_rate": 0.00047199874977351807, "loss": 5.3148, "mean_token_accuracy": 0.18065599948167801, "num_tokens": 39105424.0, "step": 17075 }, { "entropy": 5.576512002944947, "epoch": 1.6884143930407276, "grad_norm": 1.5390625, "learning_rate": 0.0004719816977888685, "loss": 5.253, "mean_token_accuracy": 0.19569894522428513, "num_tokens": 39117441.0, "step": 17080 }, { "entropy": 5.5913372993469235, "epoch": 1.688908659549229, "grad_norm": 1.328125, "learning_rate": 0.00047196464095843857, "loss": 5.3498, "mean_token_accuracy": 0.18002158999443055, "num_tokens": 39129853.0, "step": 17085 }, { "entropy": 5.618453884124756, "epoch": 1.6894029260577303, "grad_norm": 1.3359375, "learning_rate": 0.0004719475792826479, "loss": 5.2688, "mean_token_accuracy": 0.19096520990133287, "num_tokens": 39141132.0, "step": 17090 }, { "entropy": 5.5063755989074705, "epoch": 1.6898971925662316, "grad_norm": 1.71875, "learning_rate": 0.0004719305127619162, "loss": 5.2697, "mean_token_accuracy": 0.1976846918463707, "num_tokens": 39153892.0, "step": 17095 }, { "entropy": 5.623325443267822, "epoch": 1.690391459074733, "grad_norm": 1.765625, "learning_rate": 0.0004719134413966635, "loss": 5.2339, "mean_token_accuracy": 0.191673544049263, "num_tokens": 39164410.0, "step": 17100 }, { "entropy": 5.5699601650238035, "epoch": 1.6908857255832346, "grad_norm": 1.40625, "learning_rate": 0.00047189636518730945, "loss": 5.2189, "mean_token_accuracy": 0.19667695760726928, "num_tokens": 39174612.0, "step": 17105 }, { "entropy": 5.593900680541992, "epoch": 1.6913799920917358, "grad_norm": 1.3203125, "learning_rate": 0.00047187928413427424, "loss": 5.2981, "mean_token_accuracy": 0.1875629559159279, "num_tokens": 39187355.0, "step": 17110 }, { "entropy": 5.61171407699585, "epoch": 1.691874258600237, "grad_norm": 1.8046875, "learning_rate": 0.00047186219823797815, "loss": 5.3324, "mean_token_accuracy": 0.18161751180887223, "num_tokens": 39199145.0, "step": 17115 }, { "entropy": 5.686924171447754, "epoch": 1.6923685251087386, "grad_norm": 1.484375, "learning_rate": 0.00047184510749884146, "loss": 5.3753, "mean_token_accuracy": 0.18694525361061096, "num_tokens": 39210589.0, "step": 17120 }, { "entropy": 5.5554056644439695, "epoch": 1.69286279161724, "grad_norm": 1.453125, "learning_rate": 0.0004718280119172846, "loss": 5.2507, "mean_token_accuracy": 0.18905833512544631, "num_tokens": 39222657.0, "step": 17125 }, { "entropy": 5.543187284469605, "epoch": 1.6933570581257413, "grad_norm": 1.640625, "learning_rate": 0.00047181091149372807, "loss": 5.2296, "mean_token_accuracy": 0.20157125890254973, "num_tokens": 39233439.0, "step": 17130 }, { "entropy": 5.5260087013244625, "epoch": 1.6938513246342428, "grad_norm": 1.6796875, "learning_rate": 0.0004717938062285926, "loss": 5.2488, "mean_token_accuracy": 0.1965789318084717, "num_tokens": 39243787.0, "step": 17135 }, { "entropy": 5.625337028503418, "epoch": 1.6943455911427443, "grad_norm": 1.390625, "learning_rate": 0.00047177669612229894, "loss": 5.3315, "mean_token_accuracy": 0.18010910451412201, "num_tokens": 39255658.0, "step": 17140 }, { "entropy": 5.640790319442749, "epoch": 1.6948398576512456, "grad_norm": 1.2734375, "learning_rate": 0.00047175958117526805, "loss": 5.3526, "mean_token_accuracy": 0.1809498891234398, "num_tokens": 39269480.0, "step": 17145 }, { "entropy": 5.632169532775879, "epoch": 1.6953341241597468, "grad_norm": 1.3125, "learning_rate": 0.00047174246138792096, "loss": 5.3408, "mean_token_accuracy": 0.18934381157159805, "num_tokens": 39281063.0, "step": 17150 }, { "entropy": 5.624203538894653, "epoch": 1.6958283906682483, "grad_norm": 1.421875, "learning_rate": 0.00047172533676067874, "loss": 5.2909, "mean_token_accuracy": 0.18480647206306458, "num_tokens": 39292188.0, "step": 17155 }, { "entropy": 5.606174564361572, "epoch": 1.6963226571767498, "grad_norm": 1.1484375, "learning_rate": 0.0004717082072939628, "loss": 5.3258, "mean_token_accuracy": 0.183785642683506, "num_tokens": 39303661.0, "step": 17160 }, { "entropy": 5.593181324005127, "epoch": 1.696816923685251, "grad_norm": 1.3125, "learning_rate": 0.0004716910729881944, "loss": 5.3035, "mean_token_accuracy": 0.1838001474738121, "num_tokens": 39315028.0, "step": 17165 }, { "entropy": 5.4845743656158445, "epoch": 1.6973111901937523, "grad_norm": 1.3359375, "learning_rate": 0.00047167393384379513, "loss": 5.222, "mean_token_accuracy": 0.19210754185914994, "num_tokens": 39326629.0, "step": 17170 }, { "entropy": 5.49462661743164, "epoch": 1.6978054567022538, "grad_norm": 1.515625, "learning_rate": 0.00047165678986118653, "loss": 5.2112, "mean_token_accuracy": 0.19728889763355256, "num_tokens": 39338821.0, "step": 17175 }, { "entropy": 5.590615892410279, "epoch": 1.6982997232107553, "grad_norm": 1.3125, "learning_rate": 0.0004716396410407904, "loss": 5.2055, "mean_token_accuracy": 0.19036183804273604, "num_tokens": 39350093.0, "step": 17180 }, { "entropy": 5.522876310348511, "epoch": 1.6987939897192565, "grad_norm": 1.390625, "learning_rate": 0.0004716224873830286, "loss": 5.2128, "mean_token_accuracy": 0.19431255161762237, "num_tokens": 39361120.0, "step": 17185 }, { "entropy": 5.584937524795532, "epoch": 1.699288256227758, "grad_norm": 1.703125, "learning_rate": 0.00047160532888832315, "loss": 5.3103, "mean_token_accuracy": 0.18529399782419204, "num_tokens": 39373040.0, "step": 17190 }, { "entropy": 5.607525396347046, "epoch": 1.6997825227362595, "grad_norm": 1.421875, "learning_rate": 0.00047158816555709597, "loss": 5.2519, "mean_token_accuracy": 0.18857672810554504, "num_tokens": 39384576.0, "step": 17195 }, { "entropy": 5.600713062286377, "epoch": 1.7002767892447608, "grad_norm": 1.6875, "learning_rate": 0.0004715709973897696, "loss": 5.2405, "mean_token_accuracy": 0.19286413490772247, "num_tokens": 39397550.0, "step": 17200 }, { "entropy": 5.60021390914917, "epoch": 1.700771055753262, "grad_norm": 1.46875, "learning_rate": 0.00047155382438676604, "loss": 5.3157, "mean_token_accuracy": 0.1889979660511017, "num_tokens": 39407474.0, "step": 17205 }, { "entropy": 5.577948570251465, "epoch": 1.7012653222617635, "grad_norm": 1.59375, "learning_rate": 0.00047153664654850803, "loss": 5.2856, "mean_token_accuracy": 0.18776836693286897, "num_tokens": 39420104.0, "step": 17210 }, { "entropy": 5.661645793914795, "epoch": 1.701759588770265, "grad_norm": 1.4140625, "learning_rate": 0.00047151946387541795, "loss": 5.4216, "mean_token_accuracy": 0.17575209438800812, "num_tokens": 39431887.0, "step": 17215 }, { "entropy": 5.553757047653198, "epoch": 1.7022538552787663, "grad_norm": 1.6484375, "learning_rate": 0.0004715022763679185, "loss": 5.2569, "mean_token_accuracy": 0.18703849911689757, "num_tokens": 39442772.0, "step": 17220 }, { "entropy": 5.6448485374450685, "epoch": 1.7027481217872675, "grad_norm": 1.2578125, "learning_rate": 0.00047148508402643273, "loss": 5.3712, "mean_token_accuracy": 0.18131782710552216, "num_tokens": 39455067.0, "step": 17225 }, { "entropy": 5.580223608016968, "epoch": 1.7032423882957692, "grad_norm": 1.4921875, "learning_rate": 0.0004714678868513834, "loss": 5.3584, "mean_token_accuracy": 0.1831586554646492, "num_tokens": 39466700.0, "step": 17230 }, { "entropy": 5.6199592590332035, "epoch": 1.7037366548042705, "grad_norm": 1.46875, "learning_rate": 0.0004714506848431935, "loss": 5.3319, "mean_token_accuracy": 0.19206959754228592, "num_tokens": 39477591.0, "step": 17235 }, { "entropy": 5.5991654872894285, "epoch": 1.7042309213127718, "grad_norm": 1.2890625, "learning_rate": 0.00047143347800228624, "loss": 5.3127, "mean_token_accuracy": 0.18071477562189103, "num_tokens": 39488615.0, "step": 17240 }, { "entropy": 5.656261301040649, "epoch": 1.7047251878212732, "grad_norm": 1.546875, "learning_rate": 0.000471416266329085, "loss": 5.3277, "mean_token_accuracy": 0.1849161058664322, "num_tokens": 39499610.0, "step": 17245 }, { "entropy": 5.652618741989135, "epoch": 1.7052194543297747, "grad_norm": 1.3984375, "learning_rate": 0.0004713990498240131, "loss": 5.3008, "mean_token_accuracy": 0.1860312044620514, "num_tokens": 39511180.0, "step": 17250 }, { "entropy": 5.580204868316651, "epoch": 1.705713720838276, "grad_norm": 1.4140625, "learning_rate": 0.00047138182848749415, "loss": 5.3333, "mean_token_accuracy": 0.19335238486528397, "num_tokens": 39523271.0, "step": 17255 }, { "entropy": 5.5935310363769535, "epoch": 1.7062079873467773, "grad_norm": 1.1953125, "learning_rate": 0.0004713646023199518, "loss": 5.338, "mean_token_accuracy": 0.19217924773693085, "num_tokens": 39534334.0, "step": 17260 }, { "entropy": 5.581711387634277, "epoch": 1.7067022538552787, "grad_norm": 1.2890625, "learning_rate": 0.0004713473713218097, "loss": 5.2431, "mean_token_accuracy": 0.19212531447410583, "num_tokens": 39545937.0, "step": 17265 }, { "entropy": 5.646730279922485, "epoch": 1.7071965203637802, "grad_norm": 1.5625, "learning_rate": 0.0004713301354934918, "loss": 5.3665, "mean_token_accuracy": 0.18449095785617828, "num_tokens": 39558129.0, "step": 17270 }, { "entropy": 5.6310755729675295, "epoch": 1.7076907868722815, "grad_norm": 1.3984375, "learning_rate": 0.0004713128948354221, "loss": 5.3526, "mean_token_accuracy": 0.18579082638025285, "num_tokens": 39569649.0, "step": 17275 }, { "entropy": 5.620336723327637, "epoch": 1.708185053380783, "grad_norm": 1.5234375, "learning_rate": 0.0004712956493480248, "loss": 5.3703, "mean_token_accuracy": 0.1837715446949005, "num_tokens": 39581051.0, "step": 17280 }, { "entropy": 5.6267365455627445, "epoch": 1.7086793198892845, "grad_norm": 1.640625, "learning_rate": 0.000471278399031724, "loss": 5.3297, "mean_token_accuracy": 0.18477394729852675, "num_tokens": 39591225.0, "step": 17285 }, { "entropy": 5.576082992553711, "epoch": 1.7091735863977857, "grad_norm": 1.3515625, "learning_rate": 0.0004712611438869442, "loss": 5.2126, "mean_token_accuracy": 0.19559209942817687, "num_tokens": 39601270.0, "step": 17290 }, { "entropy": 5.540659236907959, "epoch": 1.709667852906287, "grad_norm": 1.3671875, "learning_rate": 0.00047124388391410975, "loss": 5.1512, "mean_token_accuracy": 0.19379169195890428, "num_tokens": 39611574.0, "step": 17295 }, { "entropy": 5.541296529769897, "epoch": 1.7101621194147885, "grad_norm": 1.8125, "learning_rate": 0.0004712266191136453, "loss": 5.2399, "mean_token_accuracy": 0.19656410962343215, "num_tokens": 39622889.0, "step": 17300 }, { "entropy": 5.607184553146363, "epoch": 1.71065638592329, "grad_norm": 1.3359375, "learning_rate": 0.0004712093494859757, "loss": 5.2887, "mean_token_accuracy": 0.18673118352890014, "num_tokens": 39634286.0, "step": 17305 }, { "entropy": 5.590369510650635, "epoch": 1.7111506524317912, "grad_norm": 1.3671875, "learning_rate": 0.0004711920750315255, "loss": 5.369, "mean_token_accuracy": 0.18006061762571335, "num_tokens": 39646653.0, "step": 17310 }, { "entropy": 5.610978651046753, "epoch": 1.7116449189402925, "grad_norm": 1.78125, "learning_rate": 0.0004711747957507199, "loss": 5.2906, "mean_token_accuracy": 0.1871691957116127, "num_tokens": 39658027.0, "step": 17315 }, { "entropy": 5.638408565521241, "epoch": 1.712139185448794, "grad_norm": 1.515625, "learning_rate": 0.00047115751164398395, "loss": 5.3227, "mean_token_accuracy": 0.18452032208442687, "num_tokens": 39669912.0, "step": 17320 }, { "entropy": 5.520593500137329, "epoch": 1.7126334519572954, "grad_norm": 1.40625, "learning_rate": 0.0004711402227117427, "loss": 5.3015, "mean_token_accuracy": 0.1873263418674469, "num_tokens": 39680857.0, "step": 17325 }, { "entropy": 5.610478162765503, "epoch": 1.7131277184657967, "grad_norm": 1.2890625, "learning_rate": 0.00047112292895442156, "loss": 5.2755, "mean_token_accuracy": 0.19037665128707887, "num_tokens": 39692301.0, "step": 17330 }, { "entropy": 5.624378061294555, "epoch": 1.7136219849742982, "grad_norm": 1.3046875, "learning_rate": 0.000471105630372446, "loss": 5.3229, "mean_token_accuracy": 0.1820497214794159, "num_tokens": 39703641.0, "step": 17335 }, { "entropy": 5.589098167419434, "epoch": 1.7141162514827997, "grad_norm": 1.625, "learning_rate": 0.00047108832696624145, "loss": 5.2684, "mean_token_accuracy": 0.1971456900238991, "num_tokens": 39714919.0, "step": 17340 }, { "entropy": 5.574347686767578, "epoch": 1.714610517991301, "grad_norm": 1.4453125, "learning_rate": 0.0004710710187362336, "loss": 5.2917, "mean_token_accuracy": 0.1871811717748642, "num_tokens": 39725658.0, "step": 17345 }, { "entropy": 5.559394073486328, "epoch": 1.7151047844998022, "grad_norm": 1.390625, "learning_rate": 0.00047105370568284834, "loss": 5.2285, "mean_token_accuracy": 0.19985225200653076, "num_tokens": 39736899.0, "step": 17350 }, { "entropy": 5.624191617965698, "epoch": 1.7155990510083037, "grad_norm": 1.3515625, "learning_rate": 0.0004710363878065115, "loss": 5.3855, "mean_token_accuracy": 0.17339082807302475, "num_tokens": 39747875.0, "step": 17355 }, { "entropy": 5.688376426696777, "epoch": 1.7160933175168052, "grad_norm": 1.3203125, "learning_rate": 0.0004710190651076491, "loss": 5.3452, "mean_token_accuracy": 0.18529719859361649, "num_tokens": 39760253.0, "step": 17360 }, { "entropy": 5.62997407913208, "epoch": 1.7165875840253064, "grad_norm": 1.25, "learning_rate": 0.0004710017375866872, "loss": 5.3118, "mean_token_accuracy": 0.18715773969888688, "num_tokens": 39771031.0, "step": 17365 }, { "entropy": 5.48432297706604, "epoch": 1.7170818505338077, "grad_norm": 1.265625, "learning_rate": 0.00047098440524405227, "loss": 5.2458, "mean_token_accuracy": 0.19431071132421493, "num_tokens": 39780850.0, "step": 17370 }, { "entropy": 5.607624244689942, "epoch": 1.7175761170423092, "grad_norm": 1.2890625, "learning_rate": 0.0004709670680801705, "loss": 5.3411, "mean_token_accuracy": 0.19476141929626464, "num_tokens": 39792975.0, "step": 17375 }, { "entropy": 5.631660604476929, "epoch": 1.7180703835508107, "grad_norm": 1.21875, "learning_rate": 0.0004709497260954685, "loss": 5.3154, "mean_token_accuracy": 0.19129008650779725, "num_tokens": 39803574.0, "step": 17380 }, { "entropy": 5.542653369903564, "epoch": 1.718564650059312, "grad_norm": 1.2421875, "learning_rate": 0.00047093237929037284, "loss": 5.2919, "mean_token_accuracy": 0.18613855987787248, "num_tokens": 39814907.0, "step": 17385 }, { "entropy": 5.583449792861939, "epoch": 1.7190589165678134, "grad_norm": 1.2421875, "learning_rate": 0.0004709150276653101, "loss": 5.273, "mean_token_accuracy": 0.1841133266687393, "num_tokens": 39826344.0, "step": 17390 }, { "entropy": 5.594506120681762, "epoch": 1.7195531830763149, "grad_norm": 1.3984375, "learning_rate": 0.00047089767122070756, "loss": 5.307, "mean_token_accuracy": 0.18551286458969116, "num_tokens": 39838516.0, "step": 17395 }, { "entropy": 5.831244707107544, "epoch": 1.7200474495848161, "grad_norm": 1.1875, "learning_rate": 0.00047088030995699173, "loss": 5.5101, "mean_token_accuracy": 0.17570637315511703, "num_tokens": 39850757.0, "step": 17400 }, { "entropy": 5.704502773284912, "epoch": 1.7205417160933174, "grad_norm": 1.203125, "learning_rate": 0.0004708629438745899, "loss": 5.3871, "mean_token_accuracy": 0.1781456157565117, "num_tokens": 39861105.0, "step": 17405 }, { "entropy": 5.628919792175293, "epoch": 1.721035982601819, "grad_norm": 1.5546875, "learning_rate": 0.0004708455729739293, "loss": 5.3607, "mean_token_accuracy": 0.1796714797616005, "num_tokens": 39873999.0, "step": 17410 }, { "entropy": 5.579667377471924, "epoch": 1.7215302491103204, "grad_norm": 1.296875, "learning_rate": 0.00047082819725543726, "loss": 5.3267, "mean_token_accuracy": 0.1815303936600685, "num_tokens": 39885768.0, "step": 17415 }, { "entropy": 5.73689341545105, "epoch": 1.7220245156188216, "grad_norm": 1.265625, "learning_rate": 0.0004708108167195411, "loss": 5.3578, "mean_token_accuracy": 0.18284257799386977, "num_tokens": 39897548.0, "step": 17420 }, { "entropy": 5.575407457351685, "epoch": 1.722518782127323, "grad_norm": 1.9296875, "learning_rate": 0.0004707934313666685, "loss": 5.277, "mean_token_accuracy": 0.19429749846458436, "num_tokens": 39909192.0, "step": 17425 }, { "entropy": 5.582723236083984, "epoch": 1.7230130486358244, "grad_norm": 1.4609375, "learning_rate": 0.0004707760411972471, "loss": 5.2786, "mean_token_accuracy": 0.18955908715724945, "num_tokens": 39921279.0, "step": 17430 }, { "entropy": 5.62904462814331, "epoch": 1.7235073151443259, "grad_norm": 1.40625, "learning_rate": 0.0004707586462117048, "loss": 5.3231, "mean_token_accuracy": 0.18266988098621367, "num_tokens": 39931638.0, "step": 17435 }, { "entropy": 5.656722688674927, "epoch": 1.7240015816528271, "grad_norm": 1.2265625, "learning_rate": 0.00047074124641046934, "loss": 5.3128, "mean_token_accuracy": 0.18738672584295274, "num_tokens": 39944239.0, "step": 17440 }, { "entropy": 5.688676738739014, "epoch": 1.7244958481613286, "grad_norm": 1.2421875, "learning_rate": 0.0004707238417939689, "loss": 5.3812, "mean_token_accuracy": 0.1788727968931198, "num_tokens": 39956486.0, "step": 17445 }, { "entropy": 5.446270942687988, "epoch": 1.72499011466983, "grad_norm": 1.234375, "learning_rate": 0.0004707064323626316, "loss": 5.1634, "mean_token_accuracy": 0.196450312435627, "num_tokens": 39966271.0, "step": 17450 }, { "entropy": 5.569846725463867, "epoch": 1.7254843811783314, "grad_norm": 1.28125, "learning_rate": 0.00047068901811688564, "loss": 5.3496, "mean_token_accuracy": 0.18431257903575898, "num_tokens": 39978810.0, "step": 17455 }, { "entropy": 5.5953551769256595, "epoch": 1.7259786476868326, "grad_norm": 1.234375, "learning_rate": 0.0004706715990571595, "loss": 5.2432, "mean_token_accuracy": 0.1884813740849495, "num_tokens": 39989331.0, "step": 17460 }, { "entropy": 5.5677149295806885, "epoch": 1.726472914195334, "grad_norm": 1.5390625, "learning_rate": 0.0004706541751838817, "loss": 5.2346, "mean_token_accuracy": 0.189345982670784, "num_tokens": 39999931.0, "step": 17465 }, { "entropy": 5.599851417541504, "epoch": 1.7269671807038356, "grad_norm": 1.203125, "learning_rate": 0.0004706367464974808, "loss": 5.2322, "mean_token_accuracy": 0.18586724251508713, "num_tokens": 40010702.0, "step": 17470 }, { "entropy": 5.6359021186828615, "epoch": 1.7274614472123369, "grad_norm": 1.28125, "learning_rate": 0.00047061931299838554, "loss": 5.3409, "mean_token_accuracy": 0.18703936487436296, "num_tokens": 40022897.0, "step": 17475 }, { "entropy": 5.550184345245361, "epoch": 1.7279557137208381, "grad_norm": 1.453125, "learning_rate": 0.000470601874687025, "loss": 5.2823, "mean_token_accuracy": 0.18598002195358276, "num_tokens": 40034057.0, "step": 17480 }, { "entropy": 5.614707040786743, "epoch": 1.7284499802293398, "grad_norm": 1.34375, "learning_rate": 0.0004705844315638279, "loss": 5.3032, "mean_token_accuracy": 0.18859024047851564, "num_tokens": 40044595.0, "step": 17485 }, { "entropy": 5.629191207885742, "epoch": 1.728944246737841, "grad_norm": 1.3203125, "learning_rate": 0.0004705669836292234, "loss": 5.2644, "mean_token_accuracy": 0.18638714998960496, "num_tokens": 40055175.0, "step": 17490 }, { "entropy": 5.557345151901245, "epoch": 1.7294385132463423, "grad_norm": 1.171875, "learning_rate": 0.0004705495308836408, "loss": 5.1877, "mean_token_accuracy": 0.1965081125497818, "num_tokens": 40065276.0, "step": 17495 }, { "entropy": 5.616838836669922, "epoch": 1.7299327797548438, "grad_norm": 1.3125, "learning_rate": 0.0004705320733275094, "loss": 5.336, "mean_token_accuracy": 0.1858326554298401, "num_tokens": 40077230.0, "step": 17500 }, { "entropy": 5.531122255325317, "epoch": 1.7304270462633453, "grad_norm": 1.328125, "learning_rate": 0.0004705146109612587, "loss": 5.1687, "mean_token_accuracy": 0.19542232453823088, "num_tokens": 40088058.0, "step": 17505 }, { "entropy": 5.479264450073242, "epoch": 1.7309213127718466, "grad_norm": 1.234375, "learning_rate": 0.0004704971437853182, "loss": 5.2536, "mean_token_accuracy": 0.18729754239320756, "num_tokens": 40099618.0, "step": 17510 }, { "entropy": 5.636681604385376, "epoch": 1.7314155792803478, "grad_norm": 1.2265625, "learning_rate": 0.0004704796718001176, "loss": 5.3534, "mean_token_accuracy": 0.19434620887041093, "num_tokens": 40111088.0, "step": 17515 }, { "entropy": 5.655070877075195, "epoch": 1.7319098457888493, "grad_norm": 1.265625, "learning_rate": 0.00047046219500608685, "loss": 5.3281, "mean_token_accuracy": 0.1856656551361084, "num_tokens": 40122191.0, "step": 17520 }, { "entropy": 5.606954717636109, "epoch": 1.7324041122973508, "grad_norm": 1.25, "learning_rate": 0.0004704447134036557, "loss": 5.3506, "mean_token_accuracy": 0.17780194580554962, "num_tokens": 40133764.0, "step": 17525 }, { "entropy": 5.582091045379639, "epoch": 1.732898378805852, "grad_norm": 1.171875, "learning_rate": 0.00047042722699325426, "loss": 5.2376, "mean_token_accuracy": 0.19495914727449418, "num_tokens": 40144502.0, "step": 17530 }, { "entropy": 5.591317462921142, "epoch": 1.7333926453143536, "grad_norm": 1.375, "learning_rate": 0.0004704097357753128, "loss": 5.2876, "mean_token_accuracy": 0.18989259749650955, "num_tokens": 40155606.0, "step": 17535 }, { "entropy": 5.542151260375976, "epoch": 1.733886911822855, "grad_norm": 1.3828125, "learning_rate": 0.0004703922397502614, "loss": 5.2254, "mean_token_accuracy": 0.19372633397579192, "num_tokens": 40166551.0, "step": 17540 }, { "entropy": 5.652794981002808, "epoch": 1.7343811783313563, "grad_norm": 1.234375, "learning_rate": 0.00047037473891853066, "loss": 5.4524, "mean_token_accuracy": 0.18176266849040984, "num_tokens": 40178804.0, "step": 17545 }, { "entropy": 5.646605539321899, "epoch": 1.7348754448398576, "grad_norm": 1.234375, "learning_rate": 0.00047035723328055104, "loss": 5.3123, "mean_token_accuracy": 0.1861835315823555, "num_tokens": 40189861.0, "step": 17550 }, { "entropy": 5.54687819480896, "epoch": 1.735369711348359, "grad_norm": 1.203125, "learning_rate": 0.0004703397228367532, "loss": 5.2289, "mean_token_accuracy": 0.1919678419828415, "num_tokens": 40202619.0, "step": 17555 }, { "entropy": 5.542559719085693, "epoch": 1.7358639778568605, "grad_norm": 1.1640625, "learning_rate": 0.00047032220758756786, "loss": 5.2547, "mean_token_accuracy": 0.18909469544887542, "num_tokens": 40213509.0, "step": 17560 }, { "entropy": 5.6481256008148195, "epoch": 1.7363582443653618, "grad_norm": 1.3359375, "learning_rate": 0.0004703046875334259, "loss": 5.3139, "mean_token_accuracy": 0.18515729606151582, "num_tokens": 40224960.0, "step": 17565 }, { "entropy": 5.597984170913696, "epoch": 1.736852510873863, "grad_norm": 1.359375, "learning_rate": 0.00047028716267475827, "loss": 5.2978, "mean_token_accuracy": 0.1903235450387001, "num_tokens": 40238516.0, "step": 17570 }, { "entropy": 5.625869846343994, "epoch": 1.7373467773823645, "grad_norm": 1.1953125, "learning_rate": 0.0004702696330119963, "loss": 5.3755, "mean_token_accuracy": 0.1815244063735008, "num_tokens": 40249123.0, "step": 17575 }, { "entropy": 5.6585776805877686, "epoch": 1.737841043890866, "grad_norm": 1.34375, "learning_rate": 0.0004702520985455709, "loss": 5.3214, "mean_token_accuracy": 0.19243215918540954, "num_tokens": 40260168.0, "step": 17580 }, { "entropy": 5.6365001678466795, "epoch": 1.7383353103993673, "grad_norm": 1.296875, "learning_rate": 0.00047023455927591365, "loss": 5.386, "mean_token_accuracy": 0.17834709733724594, "num_tokens": 40273183.0, "step": 17585 }, { "entropy": 5.615384292602539, "epoch": 1.7388295769078688, "grad_norm": 1.3671875, "learning_rate": 0.00047021701520345594, "loss": 5.3319, "mean_token_accuracy": 0.18291830271482468, "num_tokens": 40284452.0, "step": 17590 }, { "entropy": 5.592526245117187, "epoch": 1.7393238434163703, "grad_norm": 1.2734375, "learning_rate": 0.00047019946632862944, "loss": 5.2221, "mean_token_accuracy": 0.19508425295352935, "num_tokens": 40295267.0, "step": 17595 }, { "entropy": 5.554788827896118, "epoch": 1.7398181099248715, "grad_norm": 1.234375, "learning_rate": 0.00047018191265186566, "loss": 5.2266, "mean_token_accuracy": 0.19118803441524507, "num_tokens": 40306766.0, "step": 17600 }, { "entropy": 5.570209789276123, "epoch": 1.7403123764333728, "grad_norm": 1.28125, "learning_rate": 0.00047016435417359667, "loss": 5.2406, "mean_token_accuracy": 0.1879921957850456, "num_tokens": 40317382.0, "step": 17605 }, { "entropy": 5.579920673370362, "epoch": 1.7408066429418743, "grad_norm": 1.3203125, "learning_rate": 0.00047014679089425423, "loss": 5.3162, "mean_token_accuracy": 0.1875707507133484, "num_tokens": 40328273.0, "step": 17610 }, { "entropy": 5.622617149353028, "epoch": 1.7413009094503757, "grad_norm": 1.3046875, "learning_rate": 0.00047012922281427046, "loss": 5.3317, "mean_token_accuracy": 0.18957780450582504, "num_tokens": 40340550.0, "step": 17615 }, { "entropy": 5.690776443481445, "epoch": 1.741795175958877, "grad_norm": 1.875, "learning_rate": 0.00047011164993407753, "loss": 5.366, "mean_token_accuracy": 0.1877758741378784, "num_tokens": 40351752.0, "step": 17620 }, { "entropy": 5.564198160171509, "epoch": 1.7422894424673783, "grad_norm": 1.7265625, "learning_rate": 0.00047009407225410776, "loss": 5.2312, "mean_token_accuracy": 0.19071638584136963, "num_tokens": 40363330.0, "step": 17625 }, { "entropy": 5.507275009155274, "epoch": 1.7427837089758798, "grad_norm": 1.453125, "learning_rate": 0.0004700764897747936, "loss": 5.1795, "mean_token_accuracy": 0.20213651657104492, "num_tokens": 40375674.0, "step": 17630 }, { "entropy": 5.527492570877075, "epoch": 1.7432779754843812, "grad_norm": 1.328125, "learning_rate": 0.0004700589024965674, "loss": 5.2826, "mean_token_accuracy": 0.18857021033763885, "num_tokens": 40387120.0, "step": 17635 }, { "entropy": 5.586859512329101, "epoch": 1.7437722419928825, "grad_norm": 1.25, "learning_rate": 0.000470041310419862, "loss": 5.2899, "mean_token_accuracy": 0.19089189320802688, "num_tokens": 40399196.0, "step": 17640 }, { "entropy": 5.596062469482422, "epoch": 1.744266508501384, "grad_norm": 1.328125, "learning_rate": 0.0004700237135451101, "loss": 5.2864, "mean_token_accuracy": 0.1881484404206276, "num_tokens": 40411693.0, "step": 17645 }, { "entropy": 5.50392255783081, "epoch": 1.7447607750098855, "grad_norm": 1.5234375, "learning_rate": 0.0004700061118727446, "loss": 5.1799, "mean_token_accuracy": 0.201791650056839, "num_tokens": 40422866.0, "step": 17650 }, { "entropy": 5.556821727752686, "epoch": 1.7452550415183867, "grad_norm": 1.5859375, "learning_rate": 0.0004699885054031985, "loss": 5.3388, "mean_token_accuracy": 0.19352139234542848, "num_tokens": 40435028.0, "step": 17655 }, { "entropy": 5.692240762710571, "epoch": 1.745749308026888, "grad_norm": 1.421875, "learning_rate": 0.000469970894136905, "loss": 5.4389, "mean_token_accuracy": 0.18137546479701996, "num_tokens": 40446802.0, "step": 17660 }, { "entropy": 5.704209566116333, "epoch": 1.7462435745353895, "grad_norm": 1.421875, "learning_rate": 0.00046995327807429715, "loss": 5.3588, "mean_token_accuracy": 0.1850094825029373, "num_tokens": 40459025.0, "step": 17665 }, { "entropy": 5.663491249084473, "epoch": 1.746737841043891, "grad_norm": 1.5, "learning_rate": 0.00046993565721580846, "loss": 5.3921, "mean_token_accuracy": 0.17885632663965226, "num_tokens": 40471486.0, "step": 17670 }, { "entropy": 5.588140773773193, "epoch": 1.7472321075523922, "grad_norm": 1.1484375, "learning_rate": 0.0004699180315618723, "loss": 5.2497, "mean_token_accuracy": 0.18945779651403427, "num_tokens": 40483163.0, "step": 17675 }, { "entropy": 5.590656995773315, "epoch": 1.7477263740608935, "grad_norm": 1.296875, "learning_rate": 0.0004699004011129224, "loss": 5.2453, "mean_token_accuracy": 0.1831422969698906, "num_tokens": 40494475.0, "step": 17680 }, { "entropy": 5.529447078704834, "epoch": 1.748220640569395, "grad_norm": 1.3203125, "learning_rate": 0.00046988276586939234, "loss": 5.2886, "mean_token_accuracy": 0.18727412223815917, "num_tokens": 40504557.0, "step": 17685 }, { "entropy": 5.521021842956543, "epoch": 1.7487149070778965, "grad_norm": 1.390625, "learning_rate": 0.0004698651258317161, "loss": 5.2393, "mean_token_accuracy": 0.1954387068748474, "num_tokens": 40516147.0, "step": 17690 }, { "entropy": 5.563278532028198, "epoch": 1.7492091735863977, "grad_norm": 1.2890625, "learning_rate": 0.0004698474810003274, "loss": 5.2377, "mean_token_accuracy": 0.19631812423467637, "num_tokens": 40527238.0, "step": 17695 }, { "entropy": 5.5441900253295895, "epoch": 1.7497034400948992, "grad_norm": 1.328125, "learning_rate": 0.0004698298313756605, "loss": 5.2054, "mean_token_accuracy": 0.1930094137787819, "num_tokens": 40537470.0, "step": 17700 }, { "entropy": 5.543980407714844, "epoch": 1.7501977066034007, "grad_norm": 1.2734375, "learning_rate": 0.00046981217695814953, "loss": 5.2303, "mean_token_accuracy": 0.19392044693231583, "num_tokens": 40549865.0, "step": 17705 }, { "entropy": 5.655466508865357, "epoch": 1.750691973111902, "grad_norm": 1.109375, "learning_rate": 0.0004697945177482287, "loss": 5.3484, "mean_token_accuracy": 0.17952707260847092, "num_tokens": 40561796.0, "step": 17710 }, { "entropy": 5.545645618438721, "epoch": 1.7511862396204032, "grad_norm": 1.296875, "learning_rate": 0.00046977685374633267, "loss": 5.2035, "mean_token_accuracy": 0.19220599681138992, "num_tokens": 40574597.0, "step": 17715 }, { "entropy": 5.5153602123260494, "epoch": 1.7516805061289047, "grad_norm": 1.2109375, "learning_rate": 0.00046975918495289576, "loss": 5.2882, "mean_token_accuracy": 0.18653754889965057, "num_tokens": 40586549.0, "step": 17720 }, { "entropy": 5.571998977661133, "epoch": 1.7521747726374062, "grad_norm": 1.328125, "learning_rate": 0.0004697415113683527, "loss": 5.2617, "mean_token_accuracy": 0.19211031794548034, "num_tokens": 40597808.0, "step": 17725 }, { "entropy": 5.673518419265747, "epoch": 1.7526690391459074, "grad_norm": 1.2265625, "learning_rate": 0.00046972383299313813, "loss": 5.4096, "mean_token_accuracy": 0.18321943581104277, "num_tokens": 40608636.0, "step": 17730 }, { "entropy": 5.638261222839356, "epoch": 1.7531633056544087, "grad_norm": 1.359375, "learning_rate": 0.0004697061498276872, "loss": 5.2918, "mean_token_accuracy": 0.1893991634249687, "num_tokens": 40619099.0, "step": 17735 }, { "entropy": 5.526123428344727, "epoch": 1.7536575721629104, "grad_norm": 1.515625, "learning_rate": 0.00046968846187243473, "loss": 5.2339, "mean_token_accuracy": 0.1968296140432358, "num_tokens": 40630436.0, "step": 17740 }, { "entropy": 5.561237144470215, "epoch": 1.7541518386714117, "grad_norm": 1.28125, "learning_rate": 0.00046967076912781585, "loss": 5.3045, "mean_token_accuracy": 0.1918693706393242, "num_tokens": 40643078.0, "step": 17745 }, { "entropy": 5.586308002471924, "epoch": 1.754646105179913, "grad_norm": 1.34375, "learning_rate": 0.00046965307159426594, "loss": 5.247, "mean_token_accuracy": 0.1936090588569641, "num_tokens": 40653368.0, "step": 17750 }, { "entropy": 5.581864833831787, "epoch": 1.7551403716884144, "grad_norm": 1.3515625, "learning_rate": 0.0004696353692722202, "loss": 5.2931, "mean_token_accuracy": 0.18677907586097717, "num_tokens": 40665377.0, "step": 17755 }, { "entropy": 5.620696687698365, "epoch": 1.755634638196916, "grad_norm": 1.3203125, "learning_rate": 0.0004696176621621143, "loss": 5.3719, "mean_token_accuracy": 0.18811169117689133, "num_tokens": 40676599.0, "step": 17760 }, { "entropy": 5.601365947723389, "epoch": 1.7561289047054172, "grad_norm": 1.5234375, "learning_rate": 0.0004695999502643836, "loss": 5.2585, "mean_token_accuracy": 0.197500604391098, "num_tokens": 40687619.0, "step": 17765 }, { "entropy": 5.526253795623779, "epoch": 1.7566231712139184, "grad_norm": 1.265625, "learning_rate": 0.00046958223357946395, "loss": 5.2577, "mean_token_accuracy": 0.19111137539148332, "num_tokens": 40699410.0, "step": 17770 }, { "entropy": 5.60101637840271, "epoch": 1.75711743772242, "grad_norm": 1.21875, "learning_rate": 0.00046956451210779113, "loss": 5.2971, "mean_token_accuracy": 0.18093891590833663, "num_tokens": 40711149.0, "step": 17775 }, { "entropy": 5.5357701778411865, "epoch": 1.7576117042309214, "grad_norm": 1.3359375, "learning_rate": 0.00046954678584980113, "loss": 5.2769, "mean_token_accuracy": 0.19323269724845887, "num_tokens": 40722997.0, "step": 17780 }, { "entropy": 5.644488525390625, "epoch": 1.7581059707394227, "grad_norm": 1.65625, "learning_rate": 0.00046952905480593014, "loss": 5.3274, "mean_token_accuracy": 0.1910620853304863, "num_tokens": 40733786.0, "step": 17785 }, { "entropy": 5.643467903137207, "epoch": 1.758600237247924, "grad_norm": 1.3515625, "learning_rate": 0.00046951131897661415, "loss": 5.3881, "mean_token_accuracy": 0.18358676135540009, "num_tokens": 40745925.0, "step": 17790 }, { "entropy": 5.64861044883728, "epoch": 1.7590945037564256, "grad_norm": 1.25, "learning_rate": 0.00046949357836228946, "loss": 5.3557, "mean_token_accuracy": 0.18385769575834274, "num_tokens": 40760031.0, "step": 17795 }, { "entropy": 5.606079721450806, "epoch": 1.7595887702649269, "grad_norm": 1.375, "learning_rate": 0.00046947583296339266, "loss": 5.3676, "mean_token_accuracy": 0.18572872132062912, "num_tokens": 40771557.0, "step": 17800 }, { "entropy": 5.600269317626953, "epoch": 1.7600830367734281, "grad_norm": 1.4375, "learning_rate": 0.00046945808278036017, "loss": 5.3521, "mean_token_accuracy": 0.1796276643872261, "num_tokens": 40783557.0, "step": 17805 }, { "entropy": 5.607090711593628, "epoch": 1.7605773032819296, "grad_norm": 1.65625, "learning_rate": 0.0004694403278136287, "loss": 5.1765, "mean_token_accuracy": 0.2001905098557472, "num_tokens": 40794213.0, "step": 17810 }, { "entropy": 5.480912780761718, "epoch": 1.7610715697904311, "grad_norm": 1.3828125, "learning_rate": 0.00046942256806363497, "loss": 5.2025, "mean_token_accuracy": 0.19493167102336884, "num_tokens": 40805753.0, "step": 17815 }, { "entropy": 5.588007402420044, "epoch": 1.7615658362989324, "grad_norm": 1.34375, "learning_rate": 0.00046940480353081587, "loss": 5.3982, "mean_token_accuracy": 0.18515846580266954, "num_tokens": 40818315.0, "step": 17820 }, { "entropy": 5.572773551940918, "epoch": 1.7620601028074336, "grad_norm": 1.2734375, "learning_rate": 0.0004693870342156085, "loss": 5.2151, "mean_token_accuracy": 0.2017627850174904, "num_tokens": 40828740.0, "step": 17825 }, { "entropy": 5.560178565979004, "epoch": 1.7625543693159351, "grad_norm": 2.203125, "learning_rate": 0.0004693692601184499, "loss": 5.3196, "mean_token_accuracy": 0.18602558225393295, "num_tokens": 40841035.0, "step": 17830 }, { "entropy": 5.544559144973755, "epoch": 1.7630486358244366, "grad_norm": 1.1640625, "learning_rate": 0.0004693514812397774, "loss": 5.276, "mean_token_accuracy": 0.1928926795721054, "num_tokens": 40851857.0, "step": 17835 }, { "entropy": 5.655282020568848, "epoch": 1.7635429023329379, "grad_norm": 1.265625, "learning_rate": 0.0004693336975800283, "loss": 5.3279, "mean_token_accuracy": 0.1861262395977974, "num_tokens": 40863964.0, "step": 17840 }, { "entropy": 5.622573041915894, "epoch": 1.7640371688414394, "grad_norm": 1.2578125, "learning_rate": 0.00046931590913964013, "loss": 5.3072, "mean_token_accuracy": 0.18961825519800185, "num_tokens": 40876076.0, "step": 17845 }, { "entropy": 5.6621355533599855, "epoch": 1.7645314353499408, "grad_norm": 1.28125, "learning_rate": 0.00046929811591905034, "loss": 5.391, "mean_token_accuracy": 0.18338590413331984, "num_tokens": 40887839.0, "step": 17850 }, { "entropy": 5.636042261123658, "epoch": 1.765025701858442, "grad_norm": 1.25, "learning_rate": 0.0004692803179186968, "loss": 5.356, "mean_token_accuracy": 0.18774719685316085, "num_tokens": 40898978.0, "step": 17855 }, { "entropy": 5.660222101211548, "epoch": 1.7655199683669434, "grad_norm": 1.21875, "learning_rate": 0.0004692625151390173, "loss": 5.2867, "mean_token_accuracy": 0.18315183222293854, "num_tokens": 40910990.0, "step": 17860 }, { "entropy": 5.522454023361206, "epoch": 1.7660142348754448, "grad_norm": 1.1875, "learning_rate": 0.0004692447075804498, "loss": 5.2366, "mean_token_accuracy": 0.19687196463346482, "num_tokens": 40922299.0, "step": 17865 }, { "entropy": 5.601914930343628, "epoch": 1.7665085013839463, "grad_norm": 1.6640625, "learning_rate": 0.0004692268952434324, "loss": 5.3086, "mean_token_accuracy": 0.18722081780433655, "num_tokens": 40933181.0, "step": 17870 }, { "entropy": 5.551723337173462, "epoch": 1.7670027678924476, "grad_norm": 1.1640625, "learning_rate": 0.0004692090781284032, "loss": 5.3011, "mean_token_accuracy": 0.18664287328720092, "num_tokens": 40944101.0, "step": 17875 }, { "entropy": 5.617815780639648, "epoch": 1.7674970344009489, "grad_norm": 1.3359375, "learning_rate": 0.0004691912562358006, "loss": 5.2959, "mean_token_accuracy": 0.1888287827372551, "num_tokens": 40956492.0, "step": 17880 }, { "entropy": 5.656340646743774, "epoch": 1.7679913009094503, "grad_norm": 1.109375, "learning_rate": 0.00046917342956606287, "loss": 5.3508, "mean_token_accuracy": 0.18149456083774568, "num_tokens": 40967477.0, "step": 17885 }, { "entropy": 5.63769760131836, "epoch": 1.7684855674179518, "grad_norm": 1.1875, "learning_rate": 0.0004691555981196287, "loss": 5.3563, "mean_token_accuracy": 0.18836382478475572, "num_tokens": 40978756.0, "step": 17890 }, { "entropy": 5.561192035675049, "epoch": 1.768979833926453, "grad_norm": 1.265625, "learning_rate": 0.0004691377618969367, "loss": 5.309, "mean_token_accuracy": 0.18930543810129166, "num_tokens": 40990583.0, "step": 17895 }, { "entropy": 5.577971363067627, "epoch": 1.7694741004349546, "grad_norm": 1.21875, "learning_rate": 0.00046911992089842565, "loss": 5.2247, "mean_token_accuracy": 0.1916408732533455, "num_tokens": 41002197.0, "step": 17900 }, { "entropy": 5.565328741073609, "epoch": 1.769968366943456, "grad_norm": 1.265625, "learning_rate": 0.0004691020751245344, "loss": 5.3145, "mean_token_accuracy": 0.18819564282894136, "num_tokens": 41014038.0, "step": 17905 }, { "entropy": 5.556237030029297, "epoch": 1.7704626334519573, "grad_norm": 1.1328125, "learning_rate": 0.000469084224575702, "loss": 5.2391, "mean_token_accuracy": 0.19091471135616303, "num_tokens": 41025752.0, "step": 17910 }, { "entropy": 5.554512023925781, "epoch": 1.7709568999604586, "grad_norm": 1.2578125, "learning_rate": 0.0004690663692523676, "loss": 5.2766, "mean_token_accuracy": 0.19569144695997237, "num_tokens": 41035974.0, "step": 17915 }, { "entropy": 5.561146450042725, "epoch": 1.77145116646896, "grad_norm": 1.2109375, "learning_rate": 0.00046904850915497037, "loss": 5.2441, "mean_token_accuracy": 0.18578066527843476, "num_tokens": 41047669.0, "step": 17920 }, { "entropy": 5.6602232456207275, "epoch": 1.7719454329774615, "grad_norm": 1.2734375, "learning_rate": 0.0004690306442839497, "loss": 5.3399, "mean_token_accuracy": 0.18088099211454392, "num_tokens": 41059123.0, "step": 17925 }, { "entropy": 5.528279161453247, "epoch": 1.7724396994859628, "grad_norm": 1.25, "learning_rate": 0.0004690127746397451, "loss": 5.2243, "mean_token_accuracy": 0.19681421369314195, "num_tokens": 41070382.0, "step": 17930 }, { "entropy": 5.582224130630493, "epoch": 1.772933965994464, "grad_norm": 1.1796875, "learning_rate": 0.00046899490022279613, "loss": 5.303, "mean_token_accuracy": 0.19314546436071395, "num_tokens": 41081672.0, "step": 17935 }, { "entropy": 5.68007607460022, "epoch": 1.7734282325029656, "grad_norm": 1.265625, "learning_rate": 0.00046897702103354256, "loss": 5.3072, "mean_token_accuracy": 0.19346420019865035, "num_tokens": 41092448.0, "step": 17940 }, { "entropy": 5.614037275314331, "epoch": 1.773922499011467, "grad_norm": 1.578125, "learning_rate": 0.00046895913707242423, "loss": 5.2501, "mean_token_accuracy": 0.1935768410563469, "num_tokens": 41103316.0, "step": 17945 }, { "entropy": 5.550587177276611, "epoch": 1.7744167655199683, "grad_norm": 1.2109375, "learning_rate": 0.0004689412483398809, "loss": 5.2551, "mean_token_accuracy": 0.19109326750040054, "num_tokens": 41114991.0, "step": 17950 }, { "entropy": 5.57541823387146, "epoch": 1.7749110320284698, "grad_norm": 1.140625, "learning_rate": 0.00046892335483635284, "loss": 5.2308, "mean_token_accuracy": 0.18891442567110062, "num_tokens": 41126693.0, "step": 17955 }, { "entropy": 5.603558301925659, "epoch": 1.7754052985369713, "grad_norm": 1.1484375, "learning_rate": 0.0004689054565622801, "loss": 5.2821, "mean_token_accuracy": 0.1939552679657936, "num_tokens": 41138344.0, "step": 17960 }, { "entropy": 5.5450798034667965, "epoch": 1.7758995650454725, "grad_norm": 1.3046875, "learning_rate": 0.0004688875535181032, "loss": 5.2758, "mean_token_accuracy": 0.1896183580160141, "num_tokens": 41148962.0, "step": 17965 }, { "entropy": 5.525328159332275, "epoch": 1.7763938315539738, "grad_norm": 1.1953125, "learning_rate": 0.00046886964570426226, "loss": 5.1638, "mean_token_accuracy": 0.19493757635354997, "num_tokens": 41159317.0, "step": 17970 }, { "entropy": 5.621600914001465, "epoch": 1.7768880980624753, "grad_norm": 1.40625, "learning_rate": 0.0004688517331211981, "loss": 5.2586, "mean_token_accuracy": 0.19220978170633315, "num_tokens": 41170646.0, "step": 17975 }, { "entropy": 5.56419267654419, "epoch": 1.7773823645709768, "grad_norm": 1.25, "learning_rate": 0.0004688338157693511, "loss": 5.3111, "mean_token_accuracy": 0.1828644186258316, "num_tokens": 41182868.0, "step": 17980 }, { "entropy": 5.507730484008789, "epoch": 1.777876631079478, "grad_norm": 1.3359375, "learning_rate": 0.00046881589364916224, "loss": 5.2121, "mean_token_accuracy": 0.19631679654121398, "num_tokens": 41194556.0, "step": 17985 }, { "entropy": 5.652327251434326, "epoch": 1.7783708975879793, "grad_norm": 1.25, "learning_rate": 0.0004687979667610722, "loss": 5.2741, "mean_token_accuracy": 0.19276719391345978, "num_tokens": 41207082.0, "step": 17990 }, { "entropy": 5.597120857238769, "epoch": 1.778865164096481, "grad_norm": 1.3671875, "learning_rate": 0.00046878003510552224, "loss": 5.2631, "mean_token_accuracy": 0.19122608453035356, "num_tokens": 41217436.0, "step": 17995 }, { "entropy": 5.532157897949219, "epoch": 1.7793594306049823, "grad_norm": 1.21875, "learning_rate": 0.0004687620986829533, "loss": 5.2523, "mean_token_accuracy": 0.18658482879400254, "num_tokens": 41228750.0, "step": 18000 }, { "epoch": 1.7793594306049823, "eval_entropy": 5.330345546832677, "eval_loss": 5.35257625579834, "eval_mean_token_accuracy": 0.19242417482798976, "eval_num_tokens": 41228750.0, "eval_runtime": 26.5963, "eval_samples_per_second": 1222.464, "eval_steps_per_second": 152.841, "step": 18000 }, { "entropy": 5.541408967971802, "epoch": 1.7798536971134835, "grad_norm": 1.4375, "learning_rate": 0.00046874415749380673, "loss": 5.2687, "mean_token_accuracy": 0.18772680163383484, "num_tokens": 41239110.0, "step": 18005 }, { "entropy": 5.622101354598999, "epoch": 1.780347963621985, "grad_norm": 1.34375, "learning_rate": 0.0004687262115385237, "loss": 5.2924, "mean_token_accuracy": 0.1887261003255844, "num_tokens": 41251239.0, "step": 18010 }, { "entropy": 5.636102485656738, "epoch": 1.7808422301304865, "grad_norm": 1.234375, "learning_rate": 0.000468708260817546, "loss": 5.3234, "mean_token_accuracy": 0.1871577426791191, "num_tokens": 41263996.0, "step": 18015 }, { "entropy": 5.680250120162964, "epoch": 1.7813364966389877, "grad_norm": 1.4140625, "learning_rate": 0.00046869030533131493, "loss": 5.3904, "mean_token_accuracy": 0.18110288679599762, "num_tokens": 41277210.0, "step": 18020 }, { "entropy": 5.559522914886474, "epoch": 1.781830763147489, "grad_norm": 1.234375, "learning_rate": 0.0004686723450802723, "loss": 5.2895, "mean_token_accuracy": 0.18636482954025269, "num_tokens": 41288383.0, "step": 18025 }, { "entropy": 5.544947814941406, "epoch": 1.7823250296559905, "grad_norm": 1.1484375, "learning_rate": 0.00046865438006486, "loss": 5.2633, "mean_token_accuracy": 0.18996478915214537, "num_tokens": 41300970.0, "step": 18030 }, { "entropy": 5.650715732574463, "epoch": 1.782819296164492, "grad_norm": 1.234375, "learning_rate": 0.00046863641028551984, "loss": 5.3236, "mean_token_accuracy": 0.18326372057199478, "num_tokens": 41312289.0, "step": 18035 }, { "entropy": 5.570932102203369, "epoch": 1.7833135626729932, "grad_norm": 1.2421875, "learning_rate": 0.00046861843574269395, "loss": 5.2099, "mean_token_accuracy": 0.18888334333896636, "num_tokens": 41323562.0, "step": 18040 }, { "entropy": 5.579482316970825, "epoch": 1.7838078291814945, "grad_norm": 1.6953125, "learning_rate": 0.0004686004564368245, "loss": 5.2525, "mean_token_accuracy": 0.1889817014336586, "num_tokens": 41335175.0, "step": 18045 }, { "entropy": 5.581819725036621, "epoch": 1.7843020956899962, "grad_norm": 1.2109375, "learning_rate": 0.0004685824723683538, "loss": 5.2594, "mean_token_accuracy": 0.19679524302482604, "num_tokens": 41346160.0, "step": 18050 }, { "entropy": 5.6147631168365475, "epoch": 1.7847963621984975, "grad_norm": 1.609375, "learning_rate": 0.0004685644835377242, "loss": 5.4026, "mean_token_accuracy": 0.17842501103878022, "num_tokens": 41358619.0, "step": 18055 }, { "entropy": 5.657603168487549, "epoch": 1.7852906287069987, "grad_norm": 1.28125, "learning_rate": 0.00046854648994537835, "loss": 5.2553, "mean_token_accuracy": 0.19548789262771607, "num_tokens": 41369034.0, "step": 18060 }, { "entropy": 5.63514666557312, "epoch": 1.7857848952155002, "grad_norm": 1.3359375, "learning_rate": 0.0004685284915917588, "loss": 5.2915, "mean_token_accuracy": 0.18678614646196365, "num_tokens": 41380700.0, "step": 18065 }, { "entropy": 5.597020769119263, "epoch": 1.7862791617240017, "grad_norm": 1.4296875, "learning_rate": 0.00046851048847730835, "loss": 5.3346, "mean_token_accuracy": 0.18356600701808928, "num_tokens": 41391297.0, "step": 18070 }, { "entropy": 5.616900491714477, "epoch": 1.786773428232503, "grad_norm": 1.21875, "learning_rate": 0.00046849248060246986, "loss": 5.3764, "mean_token_accuracy": 0.1827303022146225, "num_tokens": 41403418.0, "step": 18075 }, { "entropy": 5.651558446884155, "epoch": 1.7872676947410042, "grad_norm": 1.328125, "learning_rate": 0.00046847446796768633, "loss": 5.295, "mean_token_accuracy": 0.18457084745168686, "num_tokens": 41414220.0, "step": 18080 }, { "entropy": 5.6176307678222654, "epoch": 1.7877619612495057, "grad_norm": 1.3359375, "learning_rate": 0.0004684564505734008, "loss": 5.319, "mean_token_accuracy": 0.18934998661279678, "num_tokens": 41425933.0, "step": 18085 }, { "entropy": 5.523052167892456, "epoch": 1.7882562277580072, "grad_norm": 1.265625, "learning_rate": 0.00046843842842005665, "loss": 5.2598, "mean_token_accuracy": 0.18879807293415068, "num_tokens": 41438413.0, "step": 18090 }, { "entropy": 5.524044036865234, "epoch": 1.7887504942665085, "grad_norm": 1.3046875, "learning_rate": 0.0004684204015080971, "loss": 5.2038, "mean_token_accuracy": 0.19859365224838257, "num_tokens": 41449104.0, "step": 18095 }, { "entropy": 5.631772136688232, "epoch": 1.78924476077501, "grad_norm": 1.1953125, "learning_rate": 0.0004684023698379657, "loss": 5.4023, "mean_token_accuracy": 0.17777305692434311, "num_tokens": 41460766.0, "step": 18100 }, { "entropy": 5.654554224014282, "epoch": 1.7897390272835114, "grad_norm": 1.296875, "learning_rate": 0.0004683843334101061, "loss": 5.3514, "mean_token_accuracy": 0.17843175083398818, "num_tokens": 41471872.0, "step": 18105 }, { "entropy": 5.747128486633301, "epoch": 1.7902332937920127, "grad_norm": 1.28125, "learning_rate": 0.00046836629222496174, "loss": 5.3528, "mean_token_accuracy": 0.18410602062940598, "num_tokens": 41483313.0, "step": 18110 }, { "entropy": 5.535778570175171, "epoch": 1.790727560300514, "grad_norm": 1.2421875, "learning_rate": 0.0004683482462829766, "loss": 5.2054, "mean_token_accuracy": 0.19946459978818892, "num_tokens": 41492935.0, "step": 18115 }, { "entropy": 5.57140851020813, "epoch": 1.7912218268090154, "grad_norm": 1.2421875, "learning_rate": 0.0004683301955845947, "loss": 5.3799, "mean_token_accuracy": 0.1868179604411125, "num_tokens": 41504159.0, "step": 18120 }, { "entropy": 5.574690485000611, "epoch": 1.791716093317517, "grad_norm": 1.09375, "learning_rate": 0.00046831214013025996, "loss": 5.2038, "mean_token_accuracy": 0.19764899611473083, "num_tokens": 41515812.0, "step": 18125 }, { "entropy": 5.5512162208557125, "epoch": 1.7922103598260182, "grad_norm": 1.296875, "learning_rate": 0.0004682940799204165, "loss": 5.1252, "mean_token_accuracy": 0.20095156580209733, "num_tokens": 41527109.0, "step": 18130 }, { "entropy": 5.544265174865723, "epoch": 1.7927046263345194, "grad_norm": 1.09375, "learning_rate": 0.00046827601495550884, "loss": 5.2606, "mean_token_accuracy": 0.18564793914556504, "num_tokens": 41537183.0, "step": 18135 }, { "entropy": 5.548152256011963, "epoch": 1.793198892843021, "grad_norm": 1.25, "learning_rate": 0.0004682579452359811, "loss": 5.2213, "mean_token_accuracy": 0.1960213914513588, "num_tokens": 41548170.0, "step": 18140 }, { "entropy": 5.5665185928344725, "epoch": 1.7936931593515224, "grad_norm": 1.3046875, "learning_rate": 0.000468239870762278, "loss": 5.2995, "mean_token_accuracy": 0.18844516575336456, "num_tokens": 41558737.0, "step": 18145 }, { "entropy": 5.5536998271942135, "epoch": 1.7941874258600237, "grad_norm": 1.4921875, "learning_rate": 0.000468221791534844, "loss": 5.2082, "mean_token_accuracy": 0.1973348006606102, "num_tokens": 41570096.0, "step": 18150 }, { "entropy": 5.51496114730835, "epoch": 1.7946816923685251, "grad_norm": 1.2578125, "learning_rate": 0.000468203707554124, "loss": 5.2106, "mean_token_accuracy": 0.19616491943597794, "num_tokens": 41582670.0, "step": 18155 }, { "entropy": 5.502422952651978, "epoch": 1.7951759588770266, "grad_norm": 1.2265625, "learning_rate": 0.0004681856188205629, "loss": 5.2035, "mean_token_accuracy": 0.1993554025888443, "num_tokens": 41594300.0, "step": 18160 }, { "entropy": 5.604350566864014, "epoch": 1.795670225385528, "grad_norm": 1.359375, "learning_rate": 0.0004681675253346055, "loss": 5.2849, "mean_token_accuracy": 0.18577527701854707, "num_tokens": 41606021.0, "step": 18165 }, { "entropy": 5.566544103622436, "epoch": 1.7961644918940292, "grad_norm": 1.3671875, "learning_rate": 0.0004681494270966971, "loss": 5.2349, "mean_token_accuracy": 0.19252312928438187, "num_tokens": 41617338.0, "step": 18170 }, { "entropy": 5.558285474777222, "epoch": 1.7966587584025306, "grad_norm": 1.375, "learning_rate": 0.0004681313241072828, "loss": 5.2868, "mean_token_accuracy": 0.18772979825735092, "num_tokens": 41628407.0, "step": 18175 }, { "entropy": 5.51392502784729, "epoch": 1.7971530249110321, "grad_norm": 1.390625, "learning_rate": 0.00046811321636680797, "loss": 5.2451, "mean_token_accuracy": 0.18794981241226197, "num_tokens": 41639715.0, "step": 18180 }, { "entropy": 5.622610569000244, "epoch": 1.7976472914195334, "grad_norm": 1.2578125, "learning_rate": 0.00046809510387571806, "loss": 5.3152, "mean_token_accuracy": 0.1852630317211151, "num_tokens": 41651078.0, "step": 18185 }, { "entropy": 5.602420282363892, "epoch": 1.7981415579280347, "grad_norm": 1.4296875, "learning_rate": 0.0004680769866344586, "loss": 5.3216, "mean_token_accuracy": 0.1861319899559021, "num_tokens": 41661848.0, "step": 18190 }, { "entropy": 5.615753889083862, "epoch": 1.7986358244365361, "grad_norm": 1.25, "learning_rate": 0.0004680588646434753, "loss": 5.3316, "mean_token_accuracy": 0.18385694473981856, "num_tokens": 41673452.0, "step": 18195 }, { "entropy": 5.664385557174683, "epoch": 1.7991300909450376, "grad_norm": 1.25, "learning_rate": 0.00046804073790321403, "loss": 5.3704, "mean_token_accuracy": 0.17711468786001205, "num_tokens": 41685312.0, "step": 18200 }, { "entropy": 5.582038927078247, "epoch": 1.7996243574535389, "grad_norm": 1.3515625, "learning_rate": 0.00046802260641412065, "loss": 5.2588, "mean_token_accuracy": 0.1892946571111679, "num_tokens": 41696849.0, "step": 18205 }, { "entropy": 5.591065692901611, "epoch": 1.8001186239620404, "grad_norm": 1.40625, "learning_rate": 0.0004680044701766413, "loss": 5.2621, "mean_token_accuracy": 0.19078711718320845, "num_tokens": 41707506.0, "step": 18210 }, { "entropy": 5.597609138488769, "epoch": 1.8006128904705418, "grad_norm": 1.40625, "learning_rate": 0.0004679863291912219, "loss": 5.257, "mean_token_accuracy": 0.18123914897441865, "num_tokens": 41718981.0, "step": 18215 }, { "entropy": 5.602350664138794, "epoch": 1.8011071569790431, "grad_norm": 1.3984375, "learning_rate": 0.0004679681834583089, "loss": 5.3541, "mean_token_accuracy": 0.18708458989858628, "num_tokens": 41731638.0, "step": 18220 }, { "entropy": 5.548145198822022, "epoch": 1.8016014234875444, "grad_norm": 1.3515625, "learning_rate": 0.00046795003297834864, "loss": 5.2092, "mean_token_accuracy": 0.1994609072804451, "num_tokens": 41742820.0, "step": 18225 }, { "entropy": 5.4864260196685795, "epoch": 1.8020956899960459, "grad_norm": 1.3125, "learning_rate": 0.00046793187775178764, "loss": 5.2635, "mean_token_accuracy": 0.18753628432750702, "num_tokens": 41754933.0, "step": 18230 }, { "entropy": 5.585482263565064, "epoch": 1.8025899565045473, "grad_norm": 1.265625, "learning_rate": 0.0004679137177790725, "loss": 5.2866, "mean_token_accuracy": 0.19378014504909516, "num_tokens": 41767078.0, "step": 18235 }, { "entropy": 5.631111192703247, "epoch": 1.8030842230130486, "grad_norm": 1.46875, "learning_rate": 0.0004678955530606501, "loss": 5.3253, "mean_token_accuracy": 0.18589173257350922, "num_tokens": 41778456.0, "step": 18240 }, { "entropy": 5.634024906158447, "epoch": 1.8035784895215499, "grad_norm": 1.3203125, "learning_rate": 0.00046787738359696697, "loss": 5.3016, "mean_token_accuracy": 0.18533339202404023, "num_tokens": 41791226.0, "step": 18245 }, { "entropy": 5.549139165878296, "epoch": 1.8040727560300513, "grad_norm": 2.078125, "learning_rate": 0.0004678592093884704, "loss": 5.2701, "mean_token_accuracy": 0.1962038204073906, "num_tokens": 41803765.0, "step": 18250 }, { "entropy": 5.520734882354736, "epoch": 1.8045670225385528, "grad_norm": 1.71875, "learning_rate": 0.00046784103043560736, "loss": 5.3042, "mean_token_accuracy": 0.18670569360256195, "num_tokens": 41815983.0, "step": 18255 }, { "entropy": 5.505499267578125, "epoch": 1.805061289047054, "grad_norm": 1.5078125, "learning_rate": 0.00046782284673882506, "loss": 5.2377, "mean_token_accuracy": 0.19942699521780013, "num_tokens": 41826517.0, "step": 18260 }, { "entropy": 5.677127408981323, "epoch": 1.8055555555555556, "grad_norm": 1.28125, "learning_rate": 0.0004678046582985708, "loss": 5.3327, "mean_token_accuracy": 0.19110236316919327, "num_tokens": 41837064.0, "step": 18265 }, { "entropy": 5.551936531066895, "epoch": 1.806049822064057, "grad_norm": 1.4609375, "learning_rate": 0.000467786465115292, "loss": 5.2202, "mean_token_accuracy": 0.1949343591928482, "num_tokens": 41849109.0, "step": 18270 }, { "entropy": 5.51414794921875, "epoch": 1.8065440885725583, "grad_norm": 1.203125, "learning_rate": 0.0004677682671894364, "loss": 5.2323, "mean_token_accuracy": 0.1962486356496811, "num_tokens": 41859349.0, "step": 18275 }, { "entropy": 5.50361270904541, "epoch": 1.8070383550810596, "grad_norm": 1.28125, "learning_rate": 0.00046775006452145135, "loss": 5.2342, "mean_token_accuracy": 0.19619107842445374, "num_tokens": 41870002.0, "step": 18280 }, { "entropy": 5.596113586425782, "epoch": 1.807532621589561, "grad_norm": 1.4921875, "learning_rate": 0.0004677318571117849, "loss": 5.2776, "mean_token_accuracy": 0.18862443566322326, "num_tokens": 41881219.0, "step": 18285 }, { "entropy": 5.616438722610473, "epoch": 1.8080268880980626, "grad_norm": 1.4921875, "learning_rate": 0.00046771364496088475, "loss": 5.2625, "mean_token_accuracy": 0.19454481452703476, "num_tokens": 41893318.0, "step": 18290 }, { "entropy": 5.529006004333496, "epoch": 1.8085211546065638, "grad_norm": 1.4375, "learning_rate": 0.00046769542806919913, "loss": 5.2582, "mean_token_accuracy": 0.19175457060337067, "num_tokens": 41904816.0, "step": 18295 }, { "entropy": 5.583883571624756, "epoch": 1.809015421115065, "grad_norm": 1.2890625, "learning_rate": 0.0004676772064371761, "loss": 5.3018, "mean_token_accuracy": 0.18779680281877517, "num_tokens": 41916293.0, "step": 18300 }, { "entropy": 5.568851470947266, "epoch": 1.8095096876235668, "grad_norm": 1.265625, "learning_rate": 0.00046765898006526384, "loss": 5.2312, "mean_token_accuracy": 0.19844731092453002, "num_tokens": 41926654.0, "step": 18305 }, { "entropy": 5.514491987228394, "epoch": 1.810003954132068, "grad_norm": 1.25, "learning_rate": 0.00046764074895391084, "loss": 5.1967, "mean_token_accuracy": 0.1925481826066971, "num_tokens": 41937141.0, "step": 18310 }, { "entropy": 5.605545520782471, "epoch": 1.8104982206405693, "grad_norm": 1.375, "learning_rate": 0.00046762251310356544, "loss": 5.3676, "mean_token_accuracy": 0.18483726680278778, "num_tokens": 41947793.0, "step": 18315 }, { "entropy": 5.667014932632446, "epoch": 1.8109924871490708, "grad_norm": 1.5625, "learning_rate": 0.0004676042725146764, "loss": 5.2242, "mean_token_accuracy": 0.19247771799564362, "num_tokens": 41958524.0, "step": 18320 }, { "entropy": 5.6089780807495115, "epoch": 1.8114867536575723, "grad_norm": 1.3359375, "learning_rate": 0.00046758602718769245, "loss": 5.2966, "mean_token_accuracy": 0.18608249723911285, "num_tokens": 41969654.0, "step": 18325 }, { "entropy": 5.482597970962525, "epoch": 1.8119810201660735, "grad_norm": 1.4765625, "learning_rate": 0.00046756777712306225, "loss": 5.2454, "mean_token_accuracy": 0.19596764594316482, "num_tokens": 41980881.0, "step": 18330 }, { "entropy": 5.67239933013916, "epoch": 1.8124752866745748, "grad_norm": 1.3671875, "learning_rate": 0.0004675495223212349, "loss": 5.298, "mean_token_accuracy": 0.18897332847118378, "num_tokens": 41992490.0, "step": 18335 }, { "entropy": 5.516888236999511, "epoch": 1.8129695531830763, "grad_norm": 1.4296875, "learning_rate": 0.0004675312627826594, "loss": 5.1787, "mean_token_accuracy": 0.2016163647174835, "num_tokens": 42001765.0, "step": 18340 }, { "entropy": 5.507339382171631, "epoch": 1.8134638196915778, "grad_norm": 1.328125, "learning_rate": 0.000467512998507785, "loss": 5.2147, "mean_token_accuracy": 0.1981933295726776, "num_tokens": 42013122.0, "step": 18345 }, { "entropy": 5.679361009597779, "epoch": 1.813958086200079, "grad_norm": 1.3984375, "learning_rate": 0.00046749472949706095, "loss": 5.3879, "mean_token_accuracy": 0.183884696662426, "num_tokens": 42023369.0, "step": 18350 }, { "entropy": 5.660796403884888, "epoch": 1.8144523527085805, "grad_norm": 1.2421875, "learning_rate": 0.0004674764557509367, "loss": 5.416, "mean_token_accuracy": 0.17849403172731398, "num_tokens": 42036054.0, "step": 18355 }, { "entropy": 5.584282064437867, "epoch": 1.814946619217082, "grad_norm": 1.3828125, "learning_rate": 0.0004674581772698618, "loss": 5.245, "mean_token_accuracy": 0.18998811542987823, "num_tokens": 42048782.0, "step": 18360 }, { "entropy": 5.6189008235931395, "epoch": 1.8154408857255833, "grad_norm": 1.3125, "learning_rate": 0.00046743989405428584, "loss": 5.276, "mean_token_accuracy": 0.18751917034387589, "num_tokens": 42059438.0, "step": 18365 }, { "entropy": 5.626202964782715, "epoch": 1.8159351522340845, "grad_norm": 1.1875, "learning_rate": 0.0004674216061046587, "loss": 5.304, "mean_token_accuracy": 0.18751108646392822, "num_tokens": 42070767.0, "step": 18370 }, { "entropy": 5.562888813018799, "epoch": 1.816429418742586, "grad_norm": 1.359375, "learning_rate": 0.0004674033134214301, "loss": 5.2734, "mean_token_accuracy": 0.19426854848861694, "num_tokens": 42081782.0, "step": 18375 }, { "entropy": 5.5661766052246096, "epoch": 1.8169236852510875, "grad_norm": 1.2734375, "learning_rate": 0.00046738501600505016, "loss": 5.2641, "mean_token_accuracy": 0.18902918994426726, "num_tokens": 42094402.0, "step": 18380 }, { "entropy": 5.648767709732056, "epoch": 1.8174179517595888, "grad_norm": 1.3984375, "learning_rate": 0.000467366713855969, "loss": 5.3283, "mean_token_accuracy": 0.18363415598869323, "num_tokens": 42106772.0, "step": 18385 }, { "entropy": 5.590387916564941, "epoch": 1.81791221826809, "grad_norm": 1.2734375, "learning_rate": 0.00046734840697463685, "loss": 5.2532, "mean_token_accuracy": 0.19400646090507506, "num_tokens": 42118093.0, "step": 18390 }, { "entropy": 5.568007087707519, "epoch": 1.8184064847765915, "grad_norm": 1.4375, "learning_rate": 0.00046733009536150413, "loss": 5.277, "mean_token_accuracy": 0.18508214205503465, "num_tokens": 42130319.0, "step": 18395 }, { "entropy": 5.649022960662842, "epoch": 1.818900751285093, "grad_norm": 1.40625, "learning_rate": 0.0004673117790170211, "loss": 5.271, "mean_token_accuracy": 0.19134919643402098, "num_tokens": 42140867.0, "step": 18400 }, { "entropy": 5.558538341522217, "epoch": 1.8193950177935942, "grad_norm": 1.3046875, "learning_rate": 0.00046729345794163847, "loss": 5.2922, "mean_token_accuracy": 0.1920735239982605, "num_tokens": 42151425.0, "step": 18405 }, { "entropy": 5.669665861129761, "epoch": 1.8198892843020957, "grad_norm": 1.28125, "learning_rate": 0.00046727513213580703, "loss": 5.4033, "mean_token_accuracy": 0.17599879801273347, "num_tokens": 42163553.0, "step": 18410 }, { "entropy": 5.610687971115112, "epoch": 1.8203835508105972, "grad_norm": 1.2890625, "learning_rate": 0.0004672568015999774, "loss": 5.3269, "mean_token_accuracy": 0.17906906753778457, "num_tokens": 42174968.0, "step": 18415 }, { "entropy": 5.6283410549163815, "epoch": 1.8208778173190985, "grad_norm": 1.2109375, "learning_rate": 0.00046723846633460074, "loss": 5.3065, "mean_token_accuracy": 0.18652440905570983, "num_tokens": 42186944.0, "step": 18420 }, { "entropy": 5.6403772830963135, "epoch": 1.8213720838275997, "grad_norm": 1.34375, "learning_rate": 0.00046722012634012794, "loss": 5.2676, "mean_token_accuracy": 0.18944794088602065, "num_tokens": 42198096.0, "step": 18425 }, { "entropy": 5.581000709533692, "epoch": 1.8218663503361012, "grad_norm": 1.3671875, "learning_rate": 0.00046720178161701014, "loss": 5.2835, "mean_token_accuracy": 0.19017768800258636, "num_tokens": 42208782.0, "step": 18430 }, { "entropy": 5.669473934173584, "epoch": 1.8223606168446027, "grad_norm": 1.2734375, "learning_rate": 0.0004671834321656988, "loss": 5.3425, "mean_token_accuracy": 0.1841800943017006, "num_tokens": 42219925.0, "step": 18435 }, { "entropy": 5.618187761306762, "epoch": 1.822854883353104, "grad_norm": 1.28125, "learning_rate": 0.00046716507798664515, "loss": 5.2487, "mean_token_accuracy": 0.193385711312294, "num_tokens": 42231140.0, "step": 18440 }, { "entropy": 5.596238994598389, "epoch": 1.8233491498616052, "grad_norm": 1.5234375, "learning_rate": 0.0004671467190803008, "loss": 5.3435, "mean_token_accuracy": 0.18742116242647172, "num_tokens": 42245025.0, "step": 18445 }, { "entropy": 5.581628847122192, "epoch": 1.8238434163701067, "grad_norm": 1.6484375, "learning_rate": 0.0004671283554471174, "loss": 5.265, "mean_token_accuracy": 0.19457059502601623, "num_tokens": 42255776.0, "step": 18450 }, { "entropy": 5.585838747024536, "epoch": 1.8243376828786082, "grad_norm": 1.171875, "learning_rate": 0.0004671099870875465, "loss": 5.2988, "mean_token_accuracy": 0.18524395674467087, "num_tokens": 42268016.0, "step": 18455 }, { "entropy": 5.596515226364136, "epoch": 1.8248319493871095, "grad_norm": 1.3359375, "learning_rate": 0.00046709161400204034, "loss": 5.2664, "mean_token_accuracy": 0.19261734038591385, "num_tokens": 42279521.0, "step": 18460 }, { "entropy": 5.578329133987427, "epoch": 1.825326215895611, "grad_norm": 1.4765625, "learning_rate": 0.00046707323619105053, "loss": 5.2403, "mean_token_accuracy": 0.1931838795542717, "num_tokens": 42290537.0, "step": 18465 }, { "entropy": 5.614188957214355, "epoch": 1.8258204824041124, "grad_norm": 1.2890625, "learning_rate": 0.00046705485365502926, "loss": 5.2462, "mean_token_accuracy": 0.19025925695896148, "num_tokens": 42303119.0, "step": 18470 }, { "entropy": 5.641482257843018, "epoch": 1.8263147489126137, "grad_norm": 1.2421875, "learning_rate": 0.00046703646639442893, "loss": 5.2776, "mean_token_accuracy": 0.19422879368066787, "num_tokens": 42314408.0, "step": 18475 }, { "entropy": 5.491457939147949, "epoch": 1.826809015421115, "grad_norm": 1.1328125, "learning_rate": 0.0004670180744097017, "loss": 5.1801, "mean_token_accuracy": 0.19038643985986708, "num_tokens": 42325848.0, "step": 18480 }, { "entropy": 5.610499095916748, "epoch": 1.8273032819296164, "grad_norm": 1.3984375, "learning_rate": 0.0004669996777013, "loss": 5.2892, "mean_token_accuracy": 0.18619169294834137, "num_tokens": 42337737.0, "step": 18485 }, { "entropy": 5.537673044204712, "epoch": 1.827797548438118, "grad_norm": 1.2578125, "learning_rate": 0.00046698127626967645, "loss": 5.2006, "mean_token_accuracy": 0.19505991637706757, "num_tokens": 42348418.0, "step": 18490 }, { "entropy": 5.578427410125732, "epoch": 1.8282918149466192, "grad_norm": 1.2734375, "learning_rate": 0.0004669628701152837, "loss": 5.2924, "mean_token_accuracy": 0.18723042607307433, "num_tokens": 42358665.0, "step": 18495 }, { "entropy": 5.639978218078613, "epoch": 1.8287860814551204, "grad_norm": 1.4296875, "learning_rate": 0.0004669444592385746, "loss": 5.2455, "mean_token_accuracy": 0.2033316284418106, "num_tokens": 42369030.0, "step": 18500 }, { "entropy": 5.573538446426392, "epoch": 1.829280347963622, "grad_norm": 1.484375, "learning_rate": 0.00046692604364000203, "loss": 5.2671, "mean_token_accuracy": 0.18693264126777648, "num_tokens": 42380751.0, "step": 18505 }, { "entropy": 5.532770872116089, "epoch": 1.8297746144721234, "grad_norm": 1.453125, "learning_rate": 0.000466907623320019, "loss": 5.2881, "mean_token_accuracy": 0.18852583914995194, "num_tokens": 42391945.0, "step": 18510 }, { "entropy": 5.622081851959228, "epoch": 1.8302688809806247, "grad_norm": 1.203125, "learning_rate": 0.00046688919827907866, "loss": 5.2771, "mean_token_accuracy": 0.185960952937603, "num_tokens": 42403346.0, "step": 18515 }, { "entropy": 5.570225095748901, "epoch": 1.8307631474891262, "grad_norm": 1.3828125, "learning_rate": 0.00046687076851763433, "loss": 5.3272, "mean_token_accuracy": 0.18314879685640334, "num_tokens": 42414895.0, "step": 18520 }, { "entropy": 5.502289581298828, "epoch": 1.8312574139976276, "grad_norm": 1.21875, "learning_rate": 0.00046685233403613927, "loss": 5.219, "mean_token_accuracy": 0.19286630302667618, "num_tokens": 42426951.0, "step": 18525 }, { "entropy": 5.600601100921631, "epoch": 1.831751680506129, "grad_norm": 1.46875, "learning_rate": 0.00046683389483504704, "loss": 5.2678, "mean_token_accuracy": 0.1882234901189804, "num_tokens": 42438313.0, "step": 18530 }, { "entropy": 5.558518648147583, "epoch": 1.8322459470146302, "grad_norm": 1.421875, "learning_rate": 0.0004668154509148112, "loss": 5.265, "mean_token_accuracy": 0.1879659563302994, "num_tokens": 42448592.0, "step": 18535 }, { "entropy": 5.5985595703125, "epoch": 1.8327402135231317, "grad_norm": 1.359375, "learning_rate": 0.00046679700227588556, "loss": 5.2908, "mean_token_accuracy": 0.18764979392290115, "num_tokens": 42460732.0, "step": 18540 }, { "entropy": 5.670887756347656, "epoch": 1.8332344800316331, "grad_norm": 1.25, "learning_rate": 0.00046677854891872384, "loss": 5.2736, "mean_token_accuracy": 0.190063539147377, "num_tokens": 42472862.0, "step": 18545 }, { "entropy": 5.540297412872315, "epoch": 1.8337287465401344, "grad_norm": 1.2890625, "learning_rate": 0.0004667600908437802, "loss": 5.2134, "mean_token_accuracy": 0.1941196545958519, "num_tokens": 42483227.0, "step": 18550 }, { "entropy": 5.462173700332642, "epoch": 1.8342230130486357, "grad_norm": 1.2421875, "learning_rate": 0.00046674162805150843, "loss": 5.0999, "mean_token_accuracy": 0.20233284831047058, "num_tokens": 42495414.0, "step": 18555 }, { "entropy": 5.503639793395996, "epoch": 1.8347172795571374, "grad_norm": 1.2734375, "learning_rate": 0.00046672316054236293, "loss": 5.3033, "mean_token_accuracy": 0.18969578593969344, "num_tokens": 42507908.0, "step": 18560 }, { "entropy": 5.509304571151733, "epoch": 1.8352115460656386, "grad_norm": 1.703125, "learning_rate": 0.00046670468831679795, "loss": 5.1632, "mean_token_accuracy": 0.196702441573143, "num_tokens": 42519228.0, "step": 18565 }, { "entropy": 5.529495525360107, "epoch": 1.83570581257414, "grad_norm": 1.2265625, "learning_rate": 0.0004666862113752679, "loss": 5.2081, "mean_token_accuracy": 0.19709310680627823, "num_tokens": 42530571.0, "step": 18570 }, { "entropy": 5.568110704421997, "epoch": 1.8362000790826414, "grad_norm": 1.2109375, "learning_rate": 0.0004666677297182273, "loss": 5.2792, "mean_token_accuracy": 0.19249682277441024, "num_tokens": 42541781.0, "step": 18575 }, { "entropy": 5.59364423751831, "epoch": 1.8366943455911429, "grad_norm": 1.171875, "learning_rate": 0.0004666492433461308, "loss": 5.3208, "mean_token_accuracy": 0.18383362889289856, "num_tokens": 42553912.0, "step": 18580 }, { "entropy": 5.508568954467774, "epoch": 1.8371886120996441, "grad_norm": 1.1171875, "learning_rate": 0.0004666307522594332, "loss": 5.1763, "mean_token_accuracy": 0.2015312060713768, "num_tokens": 42565812.0, "step": 18585 }, { "entropy": 5.565052461624146, "epoch": 1.8376828786081454, "grad_norm": 1.2109375, "learning_rate": 0.0004666122564585893, "loss": 5.2557, "mean_token_accuracy": 0.1809048607945442, "num_tokens": 42578177.0, "step": 18590 }, { "entropy": 5.582100915908813, "epoch": 1.8381771451166469, "grad_norm": 1.34375, "learning_rate": 0.00046659375594405427, "loss": 5.3378, "mean_token_accuracy": 0.18963935673236848, "num_tokens": 42590336.0, "step": 18595 }, { "entropy": 5.642604160308838, "epoch": 1.8386714116251484, "grad_norm": 1.375, "learning_rate": 0.00046657525071628307, "loss": 5.2479, "mean_token_accuracy": 0.18759679794311523, "num_tokens": 42601438.0, "step": 18600 }, { "entropy": 5.527330636978149, "epoch": 1.8391656781336496, "grad_norm": 1.421875, "learning_rate": 0.00046655674077573104, "loss": 5.2364, "mean_token_accuracy": 0.19379695355892182, "num_tokens": 42612572.0, "step": 18605 }, { "entropy": 5.589715051651001, "epoch": 1.839659944642151, "grad_norm": 1.3125, "learning_rate": 0.00046653822612285336, "loss": 5.3361, "mean_token_accuracy": 0.1899073138833046, "num_tokens": 42623138.0, "step": 18610 }, { "entropy": 5.506485176086426, "epoch": 1.8401542111506526, "grad_norm": 1.375, "learning_rate": 0.00046651970675810574, "loss": 5.2378, "mean_token_accuracy": 0.19500716477632524, "num_tokens": 42635694.0, "step": 18615 }, { "entropy": 5.7109466075897215, "epoch": 1.8406484776591538, "grad_norm": 1.421875, "learning_rate": 0.0004665011826819435, "loss": 5.3667, "mean_token_accuracy": 0.18470097929239274, "num_tokens": 42648371.0, "step": 18620 }, { "entropy": 5.624104356765747, "epoch": 1.841142744167655, "grad_norm": 1.171875, "learning_rate": 0.00046648265389482245, "loss": 5.2692, "mean_token_accuracy": 0.18536249101161956, "num_tokens": 42659229.0, "step": 18625 }, { "entropy": 5.483868980407715, "epoch": 1.8416370106761566, "grad_norm": 1.3828125, "learning_rate": 0.0004664641203971985, "loss": 5.2407, "mean_token_accuracy": 0.19081413596868516, "num_tokens": 42669991.0, "step": 18630 }, { "entropy": 5.513874149322509, "epoch": 1.842131277184658, "grad_norm": 1.1328125, "learning_rate": 0.00046644558218952745, "loss": 5.1632, "mean_token_accuracy": 0.19989305436611177, "num_tokens": 42681091.0, "step": 18635 }, { "entropy": 5.596211624145508, "epoch": 1.8426255436931593, "grad_norm": 1.171875, "learning_rate": 0.00046642703927226534, "loss": 5.2613, "mean_token_accuracy": 0.18828439563512803, "num_tokens": 42691928.0, "step": 18640 }, { "entropy": 5.541527462005615, "epoch": 1.8431198102016606, "grad_norm": 1.2578125, "learning_rate": 0.0004664084916458684, "loss": 5.2494, "mean_token_accuracy": 0.18935770243406297, "num_tokens": 42704611.0, "step": 18645 }, { "entropy": 5.60752682685852, "epoch": 1.843614076710162, "grad_norm": 1.4453125, "learning_rate": 0.0004663899393107929, "loss": 5.2701, "mean_token_accuracy": 0.19085991531610488, "num_tokens": 42715223.0, "step": 18650 }, { "entropy": 5.494353199005127, "epoch": 1.8441083432186636, "grad_norm": 1.28125, "learning_rate": 0.0004663713822674952, "loss": 5.1885, "mean_token_accuracy": 0.19425834268331527, "num_tokens": 42728177.0, "step": 18655 }, { "entropy": 5.6537891864776615, "epoch": 1.8446026097271648, "grad_norm": 1.484375, "learning_rate": 0.00046635282051643166, "loss": 5.3245, "mean_token_accuracy": 0.1818065509200096, "num_tokens": 42738469.0, "step": 18660 }, { "entropy": 5.554398918151856, "epoch": 1.8450968762356663, "grad_norm": 1.296875, "learning_rate": 0.0004663342540580593, "loss": 5.1918, "mean_token_accuracy": 0.19732003659009933, "num_tokens": 42749915.0, "step": 18665 }, { "entropy": 5.6051685333251955, "epoch": 1.8455911427441678, "grad_norm": 1.4765625, "learning_rate": 0.0004663156828928344, "loss": 5.3715, "mean_token_accuracy": 0.1835647091269493, "num_tokens": 42762679.0, "step": 18670 }, { "entropy": 5.658066606521606, "epoch": 1.846085409252669, "grad_norm": 1.3046875, "learning_rate": 0.0004662971070212141, "loss": 5.3072, "mean_token_accuracy": 0.19209382832050323, "num_tokens": 42775351.0, "step": 18675 }, { "entropy": 5.551802062988282, "epoch": 1.8465796757611703, "grad_norm": 1.3203125, "learning_rate": 0.00046627852644365525, "loss": 5.2712, "mean_token_accuracy": 0.18978420346975328, "num_tokens": 42785435.0, "step": 18680 }, { "entropy": 5.584657335281372, "epoch": 1.8470739422696718, "grad_norm": 1.3515625, "learning_rate": 0.00046625994116061505, "loss": 5.32, "mean_token_accuracy": 0.1863328516483307, "num_tokens": 42795737.0, "step": 18685 }, { "entropy": 5.61513319015503, "epoch": 1.8475682087781733, "grad_norm": 1.234375, "learning_rate": 0.0004662413511725506, "loss": 5.3147, "mean_token_accuracy": 0.18654535263776778, "num_tokens": 42806965.0, "step": 18690 }, { "entropy": 5.642132377624511, "epoch": 1.8480624752866746, "grad_norm": 1.2265625, "learning_rate": 0.0004662227564799192, "loss": 5.2769, "mean_token_accuracy": 0.18391224443912507, "num_tokens": 42818346.0, "step": 18695 }, { "entropy": 5.493491172790527, "epoch": 1.8485567417951758, "grad_norm": 1.3046875, "learning_rate": 0.00046620415708317834, "loss": 5.2342, "mean_token_accuracy": 0.1959983929991722, "num_tokens": 42829838.0, "step": 18700 }, { "entropy": 5.62834062576294, "epoch": 1.8490510083036773, "grad_norm": 1.2265625, "learning_rate": 0.0004661855529827856, "loss": 5.2891, "mean_token_accuracy": 0.19320822954177858, "num_tokens": 42841212.0, "step": 18705 }, { "entropy": 5.536891317367553, "epoch": 1.8495452748121788, "grad_norm": 1.3671875, "learning_rate": 0.00046616694417919854, "loss": 5.1798, "mean_token_accuracy": 0.19862732887268067, "num_tokens": 42853237.0, "step": 18710 }, { "entropy": 5.5685107707977295, "epoch": 1.85003954132068, "grad_norm": 1.3515625, "learning_rate": 0.00046614833067287504, "loss": 5.2833, "mean_token_accuracy": 0.18617384284734725, "num_tokens": 42864000.0, "step": 18715 }, { "entropy": 5.560598230361938, "epoch": 1.8505338078291815, "grad_norm": 1.1953125, "learning_rate": 0.00046612971246427293, "loss": 5.1688, "mean_token_accuracy": 0.19578854739665985, "num_tokens": 42874491.0, "step": 18720 }, { "entropy": 5.579421901702881, "epoch": 1.851028074337683, "grad_norm": 1.484375, "learning_rate": 0.00046611108955385024, "loss": 5.3854, "mean_token_accuracy": 0.1749049425125122, "num_tokens": 42885947.0, "step": 18725 }, { "entropy": 5.542092037200928, "epoch": 1.8515223408461843, "grad_norm": 1.5234375, "learning_rate": 0.0004660924619420651, "loss": 5.2946, "mean_token_accuracy": 0.18822437822818755, "num_tokens": 42897907.0, "step": 18730 }, { "entropy": 5.586062812805176, "epoch": 1.8520166073546855, "grad_norm": 1.3125, "learning_rate": 0.0004660738296293758, "loss": 5.2199, "mean_token_accuracy": 0.19404203891754152, "num_tokens": 42909332.0, "step": 18735 }, { "entropy": 5.642909049987793, "epoch": 1.852510873863187, "grad_norm": 2.15625, "learning_rate": 0.00046605519261624055, "loss": 5.3511, "mean_token_accuracy": 0.18243160843849182, "num_tokens": 42921877.0, "step": 18740 }, { "entropy": 5.587498998641967, "epoch": 1.8530051403716885, "grad_norm": 1.4921875, "learning_rate": 0.00046603655090311796, "loss": 5.2754, "mean_token_accuracy": 0.18601575195789338, "num_tokens": 42933381.0, "step": 18745 }, { "entropy": 5.642437076568603, "epoch": 1.8534994068801898, "grad_norm": 1.640625, "learning_rate": 0.0004660179044904666, "loss": 5.2904, "mean_token_accuracy": 0.1857299402356148, "num_tokens": 42944756.0, "step": 18750 }, { "entropy": 5.64343900680542, "epoch": 1.853993673388691, "grad_norm": 1.46875, "learning_rate": 0.00046599925337874516, "loss": 5.3174, "mean_token_accuracy": 0.18462852984666825, "num_tokens": 42955587.0, "step": 18755 }, { "entropy": 5.669891691207885, "epoch": 1.8544879398971925, "grad_norm": 1.3515625, "learning_rate": 0.00046598059756841246, "loss": 5.3501, "mean_token_accuracy": 0.18596279621124268, "num_tokens": 42966150.0, "step": 18760 }, { "entropy": 5.612529373168945, "epoch": 1.854982206405694, "grad_norm": 1.4296875, "learning_rate": 0.0004659619370599274, "loss": 5.3032, "mean_token_accuracy": 0.18246298879384995, "num_tokens": 42978626.0, "step": 18765 }, { "entropy": 5.549655961990356, "epoch": 1.8554764729141953, "grad_norm": 1.21875, "learning_rate": 0.00046594327185374906, "loss": 5.1531, "mean_token_accuracy": 0.1991766169667244, "num_tokens": 42989194.0, "step": 18770 }, { "entropy": 5.487170886993408, "epoch": 1.8559707394226967, "grad_norm": 1.25, "learning_rate": 0.00046592460195033663, "loss": 5.1962, "mean_token_accuracy": 0.19495876133441925, "num_tokens": 43000589.0, "step": 18775 }, { "entropy": 5.531355333328247, "epoch": 1.8564650059311982, "grad_norm": 1.3359375, "learning_rate": 0.0004659059273501494, "loss": 5.187, "mean_token_accuracy": 0.2011738732457161, "num_tokens": 43011417.0, "step": 18780 }, { "entropy": 5.615150213241577, "epoch": 1.8569592724396995, "grad_norm": 1.2890625, "learning_rate": 0.0004658872480536467, "loss": 5.2745, "mean_token_accuracy": 0.18746360689401625, "num_tokens": 43023178.0, "step": 18785 }, { "entropy": 5.614170503616333, "epoch": 1.8574535389482008, "grad_norm": 1.2890625, "learning_rate": 0.00046586856406128805, "loss": 5.327, "mean_token_accuracy": 0.18413175493478776, "num_tokens": 43035526.0, "step": 18790 }, { "entropy": 5.5767356872558596, "epoch": 1.8579478054567022, "grad_norm": 1.296875, "learning_rate": 0.0004658498753735332, "loss": 5.2589, "mean_token_accuracy": 0.19100056290626527, "num_tokens": 43046681.0, "step": 18795 }, { "entropy": 5.5651201725006105, "epoch": 1.8584420719652037, "grad_norm": 1.203125, "learning_rate": 0.00046583118199084177, "loss": 5.2506, "mean_token_accuracy": 0.19438367187976838, "num_tokens": 43058514.0, "step": 18800 }, { "entropy": 5.591277074813843, "epoch": 1.858936338473705, "grad_norm": 1.2890625, "learning_rate": 0.0004658124839136737, "loss": 5.3186, "mean_token_accuracy": 0.18576408922672272, "num_tokens": 43069588.0, "step": 18805 }, { "entropy": 5.552458763122559, "epoch": 1.8594306049822062, "grad_norm": 1.4296875, "learning_rate": 0.0004657937811424889, "loss": 5.2594, "mean_token_accuracy": 0.19273126423358916, "num_tokens": 43080811.0, "step": 18810 }, { "entropy": 5.677523946762085, "epoch": 1.859924871490708, "grad_norm": 1.2109375, "learning_rate": 0.0004657750736777474, "loss": 5.3091, "mean_token_accuracy": 0.18513265550136565, "num_tokens": 43093506.0, "step": 18815 }, { "entropy": 5.507422304153442, "epoch": 1.8604191379992092, "grad_norm": 1.21875, "learning_rate": 0.00046575636151990955, "loss": 5.2082, "mean_token_accuracy": 0.1954442411661148, "num_tokens": 43105272.0, "step": 18820 }, { "entropy": 5.554544591903687, "epoch": 1.8609134045077105, "grad_norm": 1.46875, "learning_rate": 0.00046573764466943565, "loss": 5.249, "mean_token_accuracy": 0.18816939294338225, "num_tokens": 43116070.0, "step": 18825 }, { "entropy": 5.594967699050903, "epoch": 1.861407671016212, "grad_norm": 1.375, "learning_rate": 0.00046571892312678606, "loss": 5.2974, "mean_token_accuracy": 0.18564522564411162, "num_tokens": 43126347.0, "step": 18830 }, { "entropy": 5.652983951568603, "epoch": 1.8619019375247134, "grad_norm": 1.2734375, "learning_rate": 0.00046570019689242136, "loss": 5.3466, "mean_token_accuracy": 0.1833465501666069, "num_tokens": 43138752.0, "step": 18835 }, { "entropy": 5.643504524230957, "epoch": 1.8623962040332147, "grad_norm": 1.2421875, "learning_rate": 0.0004656814659668023, "loss": 5.4081, "mean_token_accuracy": 0.17944862246513366, "num_tokens": 43151283.0, "step": 18840 }, { "entropy": 5.6380236625671385, "epoch": 1.862890470541716, "grad_norm": 1.2265625, "learning_rate": 0.00046566273035038953, "loss": 5.2691, "mean_token_accuracy": 0.18652819991111755, "num_tokens": 43161643.0, "step": 18845 }, { "entropy": 5.612396478652954, "epoch": 1.8633847370502175, "grad_norm": 1.15625, "learning_rate": 0.00046564399004364403, "loss": 5.2541, "mean_token_accuracy": 0.18873074650764465, "num_tokens": 43171966.0, "step": 18850 }, { "entropy": 5.556411170959473, "epoch": 1.863879003558719, "grad_norm": 1.328125, "learning_rate": 0.00046562524504702683, "loss": 5.2804, "mean_token_accuracy": 0.19142732173204421, "num_tokens": 43183022.0, "step": 18855 }, { "entropy": 5.605290365219116, "epoch": 1.8643732700672202, "grad_norm": 1.765625, "learning_rate": 0.00046560649536099905, "loss": 5.2911, "mean_token_accuracy": 0.1898275911808014, "num_tokens": 43194927.0, "step": 18860 }, { "entropy": 5.533089065551758, "epoch": 1.8648675365757215, "grad_norm": 1.4609375, "learning_rate": 0.0004655877409860218, "loss": 5.1955, "mean_token_accuracy": 0.20584086030721666, "num_tokens": 43205519.0, "step": 18865 }, { "entropy": 5.548800230026245, "epoch": 1.8653618030842232, "grad_norm": 1.390625, "learning_rate": 0.00046556898192255664, "loss": 5.3366, "mean_token_accuracy": 0.1795489251613617, "num_tokens": 43217805.0, "step": 18870 }, { "entropy": 5.573772764205932, "epoch": 1.8658560695927244, "grad_norm": 1.2421875, "learning_rate": 0.00046555021817106494, "loss": 5.293, "mean_token_accuracy": 0.18664428740739822, "num_tokens": 43228394.0, "step": 18875 }, { "entropy": 5.606089496612549, "epoch": 1.8663503361012257, "grad_norm": 1.3125, "learning_rate": 0.00046553144973200835, "loss": 5.2537, "mean_token_accuracy": 0.19243418276309968, "num_tokens": 43240204.0, "step": 18880 }, { "entropy": 5.637154960632325, "epoch": 1.8668446026097272, "grad_norm": 1.3125, "learning_rate": 0.0004655126766058485, "loss": 5.3775, "mean_token_accuracy": 0.18233660459518433, "num_tokens": 43251103.0, "step": 18885 }, { "entropy": 5.504503679275513, "epoch": 1.8673388691182287, "grad_norm": 1.1875, "learning_rate": 0.00046549389879304724, "loss": 5.2004, "mean_token_accuracy": 0.19156041443347932, "num_tokens": 43263653.0, "step": 18890 }, { "entropy": 5.582380962371826, "epoch": 1.86783313562673, "grad_norm": 1.3671875, "learning_rate": 0.0004654751162940665, "loss": 5.2296, "mean_token_accuracy": 0.19206803143024445, "num_tokens": 43274893.0, "step": 18895 }, { "entropy": 5.5891376495361325, "epoch": 1.8683274021352312, "grad_norm": 1.1484375, "learning_rate": 0.0004654563291093684, "loss": 5.2327, "mean_token_accuracy": 0.19600287079811096, "num_tokens": 43287510.0, "step": 18900 }, { "entropy": 5.570928621292114, "epoch": 1.8688216686437327, "grad_norm": 1.3203125, "learning_rate": 0.0004654375372394151, "loss": 5.3247, "mean_token_accuracy": 0.1864650085568428, "num_tokens": 43299735.0, "step": 18905 }, { "entropy": 5.585889577865601, "epoch": 1.8693159351522342, "grad_norm": 1.34375, "learning_rate": 0.00046541874068466876, "loss": 5.2192, "mean_token_accuracy": 0.202897310256958, "num_tokens": 43310401.0, "step": 18910 }, { "entropy": 5.557915449142456, "epoch": 1.8698102016607354, "grad_norm": 1.2265625, "learning_rate": 0.00046539993944559187, "loss": 5.2178, "mean_token_accuracy": 0.1919250711798668, "num_tokens": 43321300.0, "step": 18915 }, { "entropy": 5.555347490310669, "epoch": 1.870304468169237, "grad_norm": 1.5546875, "learning_rate": 0.000465381133522647, "loss": 5.2243, "mean_token_accuracy": 0.1899488687515259, "num_tokens": 43332304.0, "step": 18920 }, { "entropy": 5.563818407058716, "epoch": 1.8707987346777384, "grad_norm": 1.21875, "learning_rate": 0.0004653623229162966, "loss": 5.2768, "mean_token_accuracy": 0.18771232813596725, "num_tokens": 43343524.0, "step": 18925 }, { "entropy": 5.618774032592773, "epoch": 1.8712930011862396, "grad_norm": 1.28125, "learning_rate": 0.00046534350762700354, "loss": 5.2483, "mean_token_accuracy": 0.18217865377664566, "num_tokens": 43353364.0, "step": 18930 }, { "entropy": 5.497668838500976, "epoch": 1.871787267694741, "grad_norm": 1.1796875, "learning_rate": 0.00046532468765523075, "loss": 5.143, "mean_token_accuracy": 0.20881021916866302, "num_tokens": 43365660.0, "step": 18935 }, { "entropy": 5.636999845504761, "epoch": 1.8722815342032424, "grad_norm": 1.140625, "learning_rate": 0.00046530586300144104, "loss": 5.3554, "mean_token_accuracy": 0.18636872321367265, "num_tokens": 43376882.0, "step": 18940 }, { "entropy": 5.628673505783081, "epoch": 1.8727758007117439, "grad_norm": 1.2734375, "learning_rate": 0.00046528703366609757, "loss": 5.2655, "mean_token_accuracy": 0.19539225697517396, "num_tokens": 43387872.0, "step": 18945 }, { "entropy": 5.614740705490112, "epoch": 1.8732700672202451, "grad_norm": 1.25, "learning_rate": 0.00046526819964966363, "loss": 5.3383, "mean_token_accuracy": 0.18545145392417908, "num_tokens": 43399162.0, "step": 18950 }, { "entropy": 5.564567518234253, "epoch": 1.8737643337287464, "grad_norm": 1.328125, "learning_rate": 0.0004652493609526024, "loss": 5.2372, "mean_token_accuracy": 0.18610263466835023, "num_tokens": 43410163.0, "step": 18955 }, { "entropy": 5.598093271255493, "epoch": 1.8742586002372479, "grad_norm": 1.40625, "learning_rate": 0.0004652305175753774, "loss": 5.2685, "mean_token_accuracy": 0.18761257231235504, "num_tokens": 43421841.0, "step": 18960 }, { "entropy": 5.600408363342285, "epoch": 1.8747528667457494, "grad_norm": 1.4765625, "learning_rate": 0.0004652116695184521, "loss": 5.2245, "mean_token_accuracy": 0.19539880007505417, "num_tokens": 43432301.0, "step": 18965 }, { "entropy": 5.621077060699463, "epoch": 1.8752471332542506, "grad_norm": 1.28125, "learning_rate": 0.0004651928167822903, "loss": 5.3126, "mean_token_accuracy": 0.18520933240652085, "num_tokens": 43443531.0, "step": 18970 }, { "entropy": 5.500466680526733, "epoch": 1.8757413997627521, "grad_norm": 1.3515625, "learning_rate": 0.0004651739593673556, "loss": 5.1751, "mean_token_accuracy": 0.1960080534219742, "num_tokens": 43455230.0, "step": 18975 }, { "entropy": 5.578135299682617, "epoch": 1.8762356662712536, "grad_norm": 1.2578125, "learning_rate": 0.0004651550972741121, "loss": 5.3406, "mean_token_accuracy": 0.18186864107847214, "num_tokens": 43466342.0, "step": 18980 }, { "entropy": 5.641259622573853, "epoch": 1.8767299327797549, "grad_norm": 1.25, "learning_rate": 0.0004651362305030237, "loss": 5.3558, "mean_token_accuracy": 0.18394186198711396, "num_tokens": 43477962.0, "step": 18985 }, { "entropy": 5.553733062744141, "epoch": 1.8772241992882561, "grad_norm": 1.1953125, "learning_rate": 0.0004651173590545545, "loss": 5.2919, "mean_token_accuracy": 0.19252508878707886, "num_tokens": 43489252.0, "step": 18990 }, { "entropy": 5.650105571746826, "epoch": 1.8777184657967576, "grad_norm": 1.1796875, "learning_rate": 0.00046509848292916877, "loss": 5.2526, "mean_token_accuracy": 0.19828298240900039, "num_tokens": 43499199.0, "step": 18995 }, { "entropy": 5.534240865707398, "epoch": 1.878212732305259, "grad_norm": 1.40625, "learning_rate": 0.00046507960212733093, "loss": 5.241, "mean_token_accuracy": 0.1918190285563469, "num_tokens": 43509812.0, "step": 19000 }, { "entropy": 5.481629514694214, "epoch": 1.8787069988137604, "grad_norm": 1.203125, "learning_rate": 0.00046506071664950525, "loss": 5.2458, "mean_token_accuracy": 0.19882641285657882, "num_tokens": 43521197.0, "step": 19005 }, { "entropy": 5.569634914398193, "epoch": 1.8792012653222616, "grad_norm": 1.4453125, "learning_rate": 0.00046504182649615664, "loss": 5.275, "mean_token_accuracy": 0.19473995566368102, "num_tokens": 43532826.0, "step": 19010 }, { "entropy": 5.63658037185669, "epoch": 1.879695531830763, "grad_norm": 1.203125, "learning_rate": 0.00046502293166774945, "loss": 5.2724, "mean_token_accuracy": 0.1822723925113678, "num_tokens": 43544617.0, "step": 19015 }, { "entropy": 5.493009328842163, "epoch": 1.8801897983392646, "grad_norm": 1.21875, "learning_rate": 0.0004650040321647487, "loss": 5.1501, "mean_token_accuracy": 0.20155085921287536, "num_tokens": 43556006.0, "step": 19020 }, { "entropy": 5.587058591842651, "epoch": 1.8806840648477658, "grad_norm": 1.4140625, "learning_rate": 0.0004649851279876193, "loss": 5.2547, "mean_token_accuracy": 0.19055272042751312, "num_tokens": 43567112.0, "step": 19025 }, { "entropy": 5.578532886505127, "epoch": 1.8811783313562673, "grad_norm": 1.421875, "learning_rate": 0.0004649662191368263, "loss": 5.315, "mean_token_accuracy": 0.19133198708295823, "num_tokens": 43577974.0, "step": 19030 }, { "entropy": 5.521011304855347, "epoch": 1.8816725978647688, "grad_norm": 1.25, "learning_rate": 0.0004649473056128349, "loss": 5.164, "mean_token_accuracy": 0.19877071380615235, "num_tokens": 43588723.0, "step": 19035 }, { "entropy": 5.542726278305054, "epoch": 1.88216686437327, "grad_norm": 1.328125, "learning_rate": 0.0004649283874161102, "loss": 5.1933, "mean_token_accuracy": 0.1949515625834465, "num_tokens": 43599721.0, "step": 19040 }, { "entropy": 5.649376487731933, "epoch": 1.8826611308817713, "grad_norm": 1.15625, "learning_rate": 0.0004649094645471177, "loss": 5.3023, "mean_token_accuracy": 0.18710735738277434, "num_tokens": 43610517.0, "step": 19045 }, { "entropy": 5.62946834564209, "epoch": 1.8831553973902728, "grad_norm": 1.1171875, "learning_rate": 0.000464890537006323, "loss": 5.3393, "mean_token_accuracy": 0.18687674254179001, "num_tokens": 43622547.0, "step": 19050 }, { "entropy": 5.601474237442017, "epoch": 1.8836496638987743, "grad_norm": 1.9765625, "learning_rate": 0.0004648716047941916, "loss": 5.1951, "mean_token_accuracy": 0.19289742410182953, "num_tokens": 43633982.0, "step": 19055 }, { "entropy": 5.507806730270386, "epoch": 1.8841439304072756, "grad_norm": 1.3046875, "learning_rate": 0.0004648526679111892, "loss": 5.2357, "mean_token_accuracy": 0.19724133461713791, "num_tokens": 43644888.0, "step": 19060 }, { "entropy": 5.590801668167114, "epoch": 1.8846381969157768, "grad_norm": 1.1796875, "learning_rate": 0.0004648337263577818, "loss": 5.2691, "mean_token_accuracy": 0.19030485600233077, "num_tokens": 43658352.0, "step": 19065 }, { "entropy": 5.530408668518066, "epoch": 1.8851324634242785, "grad_norm": 1.515625, "learning_rate": 0.00046481478013443527, "loss": 5.1343, "mean_token_accuracy": 0.19978090077638627, "num_tokens": 43669127.0, "step": 19070 }, { "entropy": 5.571334505081177, "epoch": 1.8856267299327798, "grad_norm": 1.09375, "learning_rate": 0.0004647958292416157, "loss": 5.2541, "mean_token_accuracy": 0.19033319503068924, "num_tokens": 43681504.0, "step": 19075 }, { "entropy": 5.510461378097534, "epoch": 1.886120996441281, "grad_norm": 1.1796875, "learning_rate": 0.0004647768736797893, "loss": 5.1728, "mean_token_accuracy": 0.19345988631248473, "num_tokens": 43691396.0, "step": 19080 }, { "entropy": 5.574536609649658, "epoch": 1.8866152629497825, "grad_norm": 1.1953125, "learning_rate": 0.00046475791344942227, "loss": 5.25, "mean_token_accuracy": 0.19868419021368028, "num_tokens": 43703761.0, "step": 19085 }, { "entropy": 5.51921238899231, "epoch": 1.887109529458284, "grad_norm": 1.140625, "learning_rate": 0.0004647389485509812, "loss": 5.2152, "mean_token_accuracy": 0.19704494178295134, "num_tokens": 43715041.0, "step": 19090 }, { "entropy": 5.600714588165284, "epoch": 1.8876037959667853, "grad_norm": 1.125, "learning_rate": 0.00046471997898493256, "loss": 5.3376, "mean_token_accuracy": 0.18485677540302276, "num_tokens": 43727060.0, "step": 19095 }, { "entropy": 5.628681612014771, "epoch": 1.8880980624752866, "grad_norm": 1.28125, "learning_rate": 0.000464701004751743, "loss": 5.3286, "mean_token_accuracy": 0.1794735386967659, "num_tokens": 43738996.0, "step": 19100 }, { "entropy": 5.541102695465088, "epoch": 1.888592328983788, "grad_norm": 1.328125, "learning_rate": 0.0004646820258518793, "loss": 5.1586, "mean_token_accuracy": 0.19014810770750046, "num_tokens": 43749415.0, "step": 19105 }, { "entropy": 5.492815637588501, "epoch": 1.8890865954922895, "grad_norm": 1.4296875, "learning_rate": 0.0004646630422858083, "loss": 5.2728, "mean_token_accuracy": 0.19310049414634706, "num_tokens": 43760289.0, "step": 19110 }, { "entropy": 5.620342254638672, "epoch": 1.8895808620007908, "grad_norm": 1.4453125, "learning_rate": 0.00046464405405399707, "loss": 5.269, "mean_token_accuracy": 0.1939537540078163, "num_tokens": 43771267.0, "step": 19115 }, { "entropy": 5.679547834396362, "epoch": 1.890075128509292, "grad_norm": 1.2265625, "learning_rate": 0.00046462506115691274, "loss": 5.2826, "mean_token_accuracy": 0.19144418090581894, "num_tokens": 43782584.0, "step": 19120 }, { "entropy": 5.619050025939941, "epoch": 1.8905693950177938, "grad_norm": 1.2109375, "learning_rate": 0.00046460606359502237, "loss": 5.3289, "mean_token_accuracy": 0.18353534787893294, "num_tokens": 43792738.0, "step": 19125 }, { "entropy": 5.537538766860962, "epoch": 1.891063661526295, "grad_norm": 1.2578125, "learning_rate": 0.00046458706136879354, "loss": 5.3112, "mean_token_accuracy": 0.1930339217185974, "num_tokens": 43804117.0, "step": 19130 }, { "entropy": 5.658473205566406, "epoch": 1.8915579280347963, "grad_norm": 1.0859375, "learning_rate": 0.0004645680544786935, "loss": 5.3089, "mean_token_accuracy": 0.18483688086271285, "num_tokens": 43817367.0, "step": 19135 }, { "entropy": 5.63974666595459, "epoch": 1.8920521945432978, "grad_norm": 1.7421875, "learning_rate": 0.00046454904292518996, "loss": 5.2813, "mean_token_accuracy": 0.19192086905241013, "num_tokens": 43829213.0, "step": 19140 }, { "entropy": 5.596264791488648, "epoch": 1.8925464610517992, "grad_norm": 1.5546875, "learning_rate": 0.00046453002670875055, "loss": 5.2566, "mean_token_accuracy": 0.19487277269363404, "num_tokens": 43839939.0, "step": 19145 }, { "entropy": 5.591429853439331, "epoch": 1.8930407275603005, "grad_norm": 1.21875, "learning_rate": 0.00046451100582984304, "loss": 5.2305, "mean_token_accuracy": 0.19448020607233046, "num_tokens": 43850411.0, "step": 19150 }, { "entropy": 5.525946044921875, "epoch": 1.8935349940688018, "grad_norm": 1.2890625, "learning_rate": 0.0004644919802889354, "loss": 5.2163, "mean_token_accuracy": 0.18922030925750732, "num_tokens": 43861083.0, "step": 19155 }, { "entropy": 5.619222021102905, "epoch": 1.8940292605773033, "grad_norm": 1.4453125, "learning_rate": 0.00046447295008649576, "loss": 5.1924, "mean_token_accuracy": 0.19049459844827651, "num_tokens": 43871712.0, "step": 19160 }, { "entropy": 5.640578985214233, "epoch": 1.8945235270858047, "grad_norm": 1.390625, "learning_rate": 0.00046445391522299204, "loss": 5.3008, "mean_token_accuracy": 0.18398344814777373, "num_tokens": 43884617.0, "step": 19165 }, { "entropy": 5.559560298919678, "epoch": 1.895017793594306, "grad_norm": 1.1796875, "learning_rate": 0.00046443487569889264, "loss": 5.2857, "mean_token_accuracy": 0.18895656764507293, "num_tokens": 43895533.0, "step": 19170 }, { "entropy": 5.585369825363159, "epoch": 1.8955120601028075, "grad_norm": 1.3046875, "learning_rate": 0.00046441583151466586, "loss": 5.3073, "mean_token_accuracy": 0.18859479576349258, "num_tokens": 43906616.0, "step": 19175 }, { "entropy": 5.582727289199829, "epoch": 1.896006326611309, "grad_norm": 1.234375, "learning_rate": 0.0004643967826707803, "loss": 5.2478, "mean_token_accuracy": 0.1877148762345314, "num_tokens": 43917389.0, "step": 19180 }, { "entropy": 5.606839275360107, "epoch": 1.8965005931198102, "grad_norm": 1.5, "learning_rate": 0.0004643777291677045, "loss": 5.3168, "mean_token_accuracy": 0.18657988160848618, "num_tokens": 43929239.0, "step": 19185 }, { "entropy": 5.675457000732422, "epoch": 1.8969948596283115, "grad_norm": 1.5078125, "learning_rate": 0.0004643586710059072, "loss": 5.3219, "mean_token_accuracy": 0.1873270958662033, "num_tokens": 43940267.0, "step": 19190 }, { "entropy": 5.661898469924926, "epoch": 1.897489126136813, "grad_norm": 1.34375, "learning_rate": 0.00046433960818585717, "loss": 5.2356, "mean_token_accuracy": 0.19179625064134598, "num_tokens": 43951505.0, "step": 19195 }, { "entropy": 5.537387275695801, "epoch": 1.8979833926453145, "grad_norm": 1.6171875, "learning_rate": 0.00046432054070802344, "loss": 5.28, "mean_token_accuracy": 0.1934808686375618, "num_tokens": 43963669.0, "step": 19200 }, { "entropy": 5.526686668395996, "epoch": 1.8984776591538157, "grad_norm": 1.3125, "learning_rate": 0.00046430146857287497, "loss": 5.2309, "mean_token_accuracy": 0.19396394044160842, "num_tokens": 43975814.0, "step": 19205 }, { "entropy": 5.576409101486206, "epoch": 1.898971925662317, "grad_norm": 1.203125, "learning_rate": 0.00046428239178088106, "loss": 5.2433, "mean_token_accuracy": 0.18827661573886872, "num_tokens": 43987305.0, "step": 19210 }, { "entropy": 5.621536540985107, "epoch": 1.8994661921708185, "grad_norm": 1.28125, "learning_rate": 0.00046426331033251096, "loss": 5.2437, "mean_token_accuracy": 0.1932136073708534, "num_tokens": 43997441.0, "step": 19215 }, { "entropy": 5.622320127487183, "epoch": 1.89996045867932, "grad_norm": 1.21875, "learning_rate": 0.000464244224228234, "loss": 5.2615, "mean_token_accuracy": 0.1928959906101227, "num_tokens": 44008718.0, "step": 19220 }, { "entropy": 5.561352062225342, "epoch": 1.9004547251878212, "grad_norm": 1.2421875, "learning_rate": 0.0004642251334685199, "loss": 5.2884, "mean_token_accuracy": 0.19002583175897597, "num_tokens": 44020785.0, "step": 19225 }, { "entropy": 5.527784729003907, "epoch": 1.9009489916963227, "grad_norm": 1.3984375, "learning_rate": 0.00046420603805383796, "loss": 5.2101, "mean_token_accuracy": 0.1950098916888237, "num_tokens": 44031360.0, "step": 19230 }, { "entropy": 5.5717713832855225, "epoch": 1.9014432582048242, "grad_norm": 1.3125, "learning_rate": 0.0004641869379846583, "loss": 5.1933, "mean_token_accuracy": 0.1987429991364479, "num_tokens": 44042510.0, "step": 19235 }, { "entropy": 5.591089200973511, "epoch": 1.9019375247133254, "grad_norm": 1.375, "learning_rate": 0.00046416783326145065, "loss": 5.2326, "mean_token_accuracy": 0.1879960536956787, "num_tokens": 44053800.0, "step": 19240 }, { "entropy": 5.478452539443969, "epoch": 1.9024317912218267, "grad_norm": 1.3203125, "learning_rate": 0.0004641487238846848, "loss": 5.2645, "mean_token_accuracy": 0.1952885791659355, "num_tokens": 44066727.0, "step": 19245 }, { "entropy": 5.646203517913818, "epoch": 1.9029260577303282, "grad_norm": 1.3515625, "learning_rate": 0.00046412960985483105, "loss": 5.2935, "mean_token_accuracy": 0.1888258159160614, "num_tokens": 44077863.0, "step": 19250 }, { "entropy": 5.523417901992798, "epoch": 1.9034203242388297, "grad_norm": 1.265625, "learning_rate": 0.0004641104911723596, "loss": 5.181, "mean_token_accuracy": 0.20215461254119874, "num_tokens": 44088218.0, "step": 19255 }, { "entropy": 5.661336231231689, "epoch": 1.903914590747331, "grad_norm": 1.2109375, "learning_rate": 0.0004640913678377407, "loss": 5.3853, "mean_token_accuracy": 0.18510138243436813, "num_tokens": 44101236.0, "step": 19260 }, { "entropy": 5.56536979675293, "epoch": 1.9044088572558322, "grad_norm": 1.2578125, "learning_rate": 0.0004640722398514448, "loss": 5.3066, "mean_token_accuracy": 0.18754377961158752, "num_tokens": 44114185.0, "step": 19265 }, { "entropy": 5.535950374603272, "epoch": 1.9049031237643337, "grad_norm": 1.25, "learning_rate": 0.00046405310721394245, "loss": 5.1991, "mean_token_accuracy": 0.19078827202320098, "num_tokens": 44126060.0, "step": 19270 }, { "entropy": 5.553313493728638, "epoch": 1.9053973902728352, "grad_norm": 1.359375, "learning_rate": 0.0004640339699257044, "loss": 5.3101, "mean_token_accuracy": 0.19053225666284562, "num_tokens": 44137709.0, "step": 19275 }, { "entropy": 5.558320093154907, "epoch": 1.9058916567813364, "grad_norm": 2.109375, "learning_rate": 0.0004640148279872013, "loss": 5.2505, "mean_token_accuracy": 0.19185083061456681, "num_tokens": 44150042.0, "step": 19280 }, { "entropy": 5.609388780593872, "epoch": 1.906385923289838, "grad_norm": 1.2265625, "learning_rate": 0.00046399568139890413, "loss": 5.3202, "mean_token_accuracy": 0.19049898386001587, "num_tokens": 44162926.0, "step": 19285 }, { "entropy": 5.575820970535278, "epoch": 1.9068801897983394, "grad_norm": 1.2421875, "learning_rate": 0.00046397653016128396, "loss": 5.1967, "mean_token_accuracy": 0.19688263684511184, "num_tokens": 44174211.0, "step": 19290 }, { "entropy": 5.615792608261108, "epoch": 1.9073744563068407, "grad_norm": 1.625, "learning_rate": 0.0004639573742748117, "loss": 5.3636, "mean_token_accuracy": 0.17644112855195998, "num_tokens": 44187127.0, "step": 19295 }, { "entropy": 5.570122337341308, "epoch": 1.907868722815342, "grad_norm": 1.328125, "learning_rate": 0.00046393821373995884, "loss": 5.2659, "mean_token_accuracy": 0.18965860158205033, "num_tokens": 44199335.0, "step": 19300 }, { "entropy": 5.549188899993896, "epoch": 1.9083629893238434, "grad_norm": 1.25, "learning_rate": 0.00046391904855719654, "loss": 5.1533, "mean_token_accuracy": 0.20120538771152496, "num_tokens": 44209911.0, "step": 19305 }, { "entropy": 5.506358337402344, "epoch": 1.908857255832345, "grad_norm": 1.234375, "learning_rate": 0.00046389987872699637, "loss": 5.1678, "mean_token_accuracy": 0.195081427693367, "num_tokens": 44221391.0, "step": 19310 }, { "entropy": 5.571594524383545, "epoch": 1.9093515223408462, "grad_norm": 1.2734375, "learning_rate": 0.00046388070424982985, "loss": 5.1906, "mean_token_accuracy": 0.20262186825275422, "num_tokens": 44233138.0, "step": 19315 }, { "entropy": 5.564644527435303, "epoch": 1.9098457888493474, "grad_norm": 1.1796875, "learning_rate": 0.0004638615251261687, "loss": 5.2129, "mean_token_accuracy": 0.19723872542381288, "num_tokens": 44244353.0, "step": 19320 }, { "entropy": 5.579747581481934, "epoch": 1.910340055357849, "grad_norm": 1.2734375, "learning_rate": 0.00046384234135648475, "loss": 5.2998, "mean_token_accuracy": 0.1896692395210266, "num_tokens": 44256369.0, "step": 19325 }, { "entropy": 5.5785175323486325, "epoch": 1.9108343218663504, "grad_norm": 1.171875, "learning_rate": 0.00046382315294124987, "loss": 5.2647, "mean_token_accuracy": 0.18858565837144853, "num_tokens": 44267958.0, "step": 19330 }, { "entropy": 5.535160303115845, "epoch": 1.9113285883748516, "grad_norm": 1.2109375, "learning_rate": 0.0004638039598809361, "loss": 5.26, "mean_token_accuracy": 0.19505301266908645, "num_tokens": 44279379.0, "step": 19335 }, { "entropy": 5.598449993133545, "epoch": 1.9118228548833531, "grad_norm": 1.4609375, "learning_rate": 0.0004637847621760158, "loss": 5.2252, "mean_token_accuracy": 0.18962267637252808, "num_tokens": 44289655.0, "step": 19340 }, { "entropy": 5.628275203704834, "epoch": 1.9123171213918546, "grad_norm": 1.546875, "learning_rate": 0.00046376555982696093, "loss": 5.321, "mean_token_accuracy": 0.18700777292251586, "num_tokens": 44301642.0, "step": 19345 }, { "entropy": 5.604733324050903, "epoch": 1.9128113879003559, "grad_norm": 1.25, "learning_rate": 0.000463746352834244, "loss": 5.2167, "mean_token_accuracy": 0.19029637724161147, "num_tokens": 44313260.0, "step": 19350 }, { "entropy": 5.610768890380859, "epoch": 1.9133056544088571, "grad_norm": 1.203125, "learning_rate": 0.0004637271411983375, "loss": 5.2406, "mean_token_accuracy": 0.18816908448934555, "num_tokens": 44325095.0, "step": 19355 }, { "entropy": 5.591111850738526, "epoch": 1.9137999209173586, "grad_norm": 1.4140625, "learning_rate": 0.0004637079249197141, "loss": 5.2855, "mean_token_accuracy": 0.19288601726293564, "num_tokens": 44337381.0, "step": 19360 }, { "entropy": 5.538823032379151, "epoch": 1.91429418742586, "grad_norm": 1.3046875, "learning_rate": 0.00046368870399884644, "loss": 5.1961, "mean_token_accuracy": 0.20184044688940048, "num_tokens": 44348487.0, "step": 19365 }, { "entropy": 5.496457242965699, "epoch": 1.9147884539343614, "grad_norm": 1.3359375, "learning_rate": 0.00046366947843620737, "loss": 5.1652, "mean_token_accuracy": 0.19834334403276443, "num_tokens": 44358645.0, "step": 19370 }, { "entropy": 5.52705717086792, "epoch": 1.9152827204428626, "grad_norm": 1.5859375, "learning_rate": 0.00046365024823226994, "loss": 5.2059, "mean_token_accuracy": 0.1986442506313324, "num_tokens": 44369924.0, "step": 19375 }, { "entropy": 5.563433265686035, "epoch": 1.9157769869513643, "grad_norm": 1.1484375, "learning_rate": 0.0004636310133875071, "loss": 5.2122, "mean_token_accuracy": 0.1914411172270775, "num_tokens": 44381684.0, "step": 19380 }, { "entropy": 5.684081363677978, "epoch": 1.9162712534598656, "grad_norm": 1.265625, "learning_rate": 0.00046361177390239204, "loss": 5.3546, "mean_token_accuracy": 0.18746418803930281, "num_tokens": 44392780.0, "step": 19385 }, { "entropy": 5.595615720748901, "epoch": 1.9167655199683669, "grad_norm": 1.2734375, "learning_rate": 0.0004635925297773981, "loss": 5.2996, "mean_token_accuracy": 0.18767099529504777, "num_tokens": 44405330.0, "step": 19390 }, { "entropy": 5.633752918243408, "epoch": 1.9172597864768683, "grad_norm": 1.203125, "learning_rate": 0.0004635732810129987, "loss": 5.3216, "mean_token_accuracy": 0.18701830208301545, "num_tokens": 44416307.0, "step": 19395 }, { "entropy": 5.641895198822022, "epoch": 1.9177540529853698, "grad_norm": 1.3359375, "learning_rate": 0.0004635540276096673, "loss": 5.2841, "mean_token_accuracy": 0.18638513535261153, "num_tokens": 44427481.0, "step": 19400 }, { "entropy": 5.508263206481933, "epoch": 1.918248319493871, "grad_norm": 1.25, "learning_rate": 0.00046353476956787756, "loss": 5.2103, "mean_token_accuracy": 0.19185469597578048, "num_tokens": 44439462.0, "step": 19405 }, { "entropy": 5.573173761367798, "epoch": 1.9187425860023724, "grad_norm": 1.21875, "learning_rate": 0.00046351550688810317, "loss": 5.3033, "mean_token_accuracy": 0.18386206030845642, "num_tokens": 44452206.0, "step": 19410 }, { "entropy": 5.587518358230591, "epoch": 1.9192368525108738, "grad_norm": 1.3046875, "learning_rate": 0.0004634962395708182, "loss": 5.2369, "mean_token_accuracy": 0.19774142205715178, "num_tokens": 44463598.0, "step": 19415 }, { "entropy": 5.5582528591156, "epoch": 1.9197311190193753, "grad_norm": 1.3515625, "learning_rate": 0.00046347696761649647, "loss": 5.2498, "mean_token_accuracy": 0.2010146588087082, "num_tokens": 44475606.0, "step": 19420 }, { "entropy": 5.539303159713745, "epoch": 1.9202253855278766, "grad_norm": 1.1171875, "learning_rate": 0.000463457691025612, "loss": 5.2539, "mean_token_accuracy": 0.19006529748439788, "num_tokens": 44486948.0, "step": 19425 }, { "entropy": 5.555096673965454, "epoch": 1.920719652036378, "grad_norm": 1.28125, "learning_rate": 0.00046343840979863924, "loss": 5.2116, "mean_token_accuracy": 0.19313639849424363, "num_tokens": 44497408.0, "step": 19430 }, { "entropy": 5.623652982711792, "epoch": 1.9212139185448796, "grad_norm": 1.1796875, "learning_rate": 0.00046341912393605225, "loss": 5.2348, "mean_token_accuracy": 0.19569095075130463, "num_tokens": 44508246.0, "step": 19435 }, { "entropy": 5.506088018417358, "epoch": 1.9217081850533808, "grad_norm": 1.2265625, "learning_rate": 0.0004633998334383256, "loss": 5.1685, "mean_token_accuracy": 0.20250879228115082, "num_tokens": 44520207.0, "step": 19440 }, { "entropy": 5.50420298576355, "epoch": 1.922202451561882, "grad_norm": 1.2578125, "learning_rate": 0.00046338053830593384, "loss": 5.1961, "mean_token_accuracy": 0.19127237498760224, "num_tokens": 44532290.0, "step": 19445 }, { "entropy": 5.614888095855713, "epoch": 1.9226967180703836, "grad_norm": 1.1328125, "learning_rate": 0.0004633612385393516, "loss": 5.3001, "mean_token_accuracy": 0.18473622500896453, "num_tokens": 44544305.0, "step": 19450 }, { "entropy": 5.586585569381714, "epoch": 1.923190984578885, "grad_norm": 1.2734375, "learning_rate": 0.0004633419341390537, "loss": 5.2952, "mean_token_accuracy": 0.18646225333213806, "num_tokens": 44556753.0, "step": 19455 }, { "entropy": 5.598245286941529, "epoch": 1.9236852510873863, "grad_norm": 1.140625, "learning_rate": 0.000463322625105515, "loss": 5.2421, "mean_token_accuracy": 0.1869811698794365, "num_tokens": 44567891.0, "step": 19460 }, { "entropy": 5.536292028427124, "epoch": 1.9241795175958876, "grad_norm": 1.171875, "learning_rate": 0.00046330331143921045, "loss": 5.1625, "mean_token_accuracy": 0.20117648541927338, "num_tokens": 44579060.0, "step": 19465 }, { "entropy": 5.558172512054443, "epoch": 1.924673784104389, "grad_norm": 1.6015625, "learning_rate": 0.00046328399314061525, "loss": 5.2799, "mean_token_accuracy": 0.19366924464702606, "num_tokens": 44591748.0, "step": 19470 }, { "entropy": 5.55849175453186, "epoch": 1.9251680506128905, "grad_norm": 1.15625, "learning_rate": 0.0004632646702102046, "loss": 5.1861, "mean_token_accuracy": 0.19845863580703735, "num_tokens": 44603119.0, "step": 19475 }, { "entropy": 5.5738222122192385, "epoch": 1.9256623171213918, "grad_norm": 1.2421875, "learning_rate": 0.0004632453426484539, "loss": 5.2988, "mean_token_accuracy": 0.18786921054124833, "num_tokens": 44614391.0, "step": 19480 }, { "entropy": 5.524324750900268, "epoch": 1.9261565836298933, "grad_norm": 1.1875, "learning_rate": 0.00046322601045583863, "loss": 5.1292, "mean_token_accuracy": 0.20615734159946442, "num_tokens": 44623950.0, "step": 19485 }, { "entropy": 5.514659833908081, "epoch": 1.9266508501383948, "grad_norm": 1.140625, "learning_rate": 0.0004632066736328342, "loss": 5.1967, "mean_token_accuracy": 0.2011448174715042, "num_tokens": 44635177.0, "step": 19490 }, { "entropy": 5.570940351486206, "epoch": 1.927145116646896, "grad_norm": 1.21875, "learning_rate": 0.0004631873321799164, "loss": 5.356, "mean_token_accuracy": 0.18559570461511612, "num_tokens": 44646956.0, "step": 19495 }, { "entropy": 5.632038164138794, "epoch": 1.9276393831553973, "grad_norm": 1.28125, "learning_rate": 0.000463167986097561, "loss": 5.2515, "mean_token_accuracy": 0.18865224421024324, "num_tokens": 44658161.0, "step": 19500 }, { "entropy": 5.520165205001831, "epoch": 1.9281336496638988, "grad_norm": 1.8671875, "learning_rate": 0.00046314863538624403, "loss": 5.2165, "mean_token_accuracy": 0.1907589241862297, "num_tokens": 44668823.0, "step": 19505 }, { "entropy": 5.529860305786133, "epoch": 1.9286279161724003, "grad_norm": 1.125, "learning_rate": 0.0004631292800464414, "loss": 5.3278, "mean_token_accuracy": 0.18145890831947326, "num_tokens": 44682285.0, "step": 19510 }, { "entropy": 5.661611318588257, "epoch": 1.9291221826809015, "grad_norm": 1.3125, "learning_rate": 0.00046310992007862935, "loss": 5.3051, "mean_token_accuracy": 0.19078746885061265, "num_tokens": 44694031.0, "step": 19515 }, { "entropy": 5.594558238983154, "epoch": 1.9296164491894028, "grad_norm": 1.1796875, "learning_rate": 0.000463090555483284, "loss": 5.2558, "mean_token_accuracy": 0.18729052990674971, "num_tokens": 44705636.0, "step": 19520 }, { "entropy": 5.582792520523071, "epoch": 1.9301107156979043, "grad_norm": 1.1484375, "learning_rate": 0.00046307118626088184, "loss": 5.2928, "mean_token_accuracy": 0.1860485255718231, "num_tokens": 44716505.0, "step": 19525 }, { "entropy": 5.551295423507691, "epoch": 1.9306049822064058, "grad_norm": 1.2421875, "learning_rate": 0.0004630518124118994, "loss": 5.2939, "mean_token_accuracy": 0.18172208666801454, "num_tokens": 44729298.0, "step": 19530 }, { "entropy": 5.572073221206665, "epoch": 1.931099248714907, "grad_norm": 1.09375, "learning_rate": 0.00046303243393681307, "loss": 5.2346, "mean_token_accuracy": 0.1893751561641693, "num_tokens": 44740456.0, "step": 19535 }, { "entropy": 5.5821935653686525, "epoch": 1.9315935152234085, "grad_norm": 1.3125, "learning_rate": 0.00046301305083609973, "loss": 5.2512, "mean_token_accuracy": 0.19513129144907, "num_tokens": 44752311.0, "step": 19540 }, { "entropy": 5.643353366851807, "epoch": 1.93208778173191, "grad_norm": 1.125, "learning_rate": 0.00046299366311023624, "loss": 5.292, "mean_token_accuracy": 0.1904216766357422, "num_tokens": 44763704.0, "step": 19545 }, { "entropy": 5.529926109313965, "epoch": 1.9325820482404112, "grad_norm": 1.3671875, "learning_rate": 0.0004629742707596994, "loss": 5.2597, "mean_token_accuracy": 0.19365395605564117, "num_tokens": 44775053.0, "step": 19550 }, { "entropy": 5.6153411865234375, "epoch": 1.9330763147489125, "grad_norm": 2.515625, "learning_rate": 0.00046295487378496643, "loss": 5.3611, "mean_token_accuracy": 0.18268836587667464, "num_tokens": 44786734.0, "step": 19555 }, { "entropy": 5.739839267730713, "epoch": 1.933570581257414, "grad_norm": 1.1640625, "learning_rate": 0.00046293547218651427, "loss": 5.406, "mean_token_accuracy": 0.1813743904232979, "num_tokens": 44798151.0, "step": 19560 }, { "entropy": 5.652517223358155, "epoch": 1.9340648477659155, "grad_norm": 1.3203125, "learning_rate": 0.0004629160659648204, "loss": 5.3439, "mean_token_accuracy": 0.18635807633399964, "num_tokens": 44809354.0, "step": 19565 }, { "entropy": 5.535543537139892, "epoch": 1.9345591142744167, "grad_norm": 1.2265625, "learning_rate": 0.0004628966551203622, "loss": 5.2561, "mean_token_accuracy": 0.18832801580429076, "num_tokens": 44820994.0, "step": 19570 }, { "entropy": 5.636121320724487, "epoch": 1.935053380782918, "grad_norm": 1.2578125, "learning_rate": 0.00046287723965361704, "loss": 5.3551, "mean_token_accuracy": 0.1882003977894783, "num_tokens": 44831486.0, "step": 19575 }, { "entropy": 5.614482831954956, "epoch": 1.9355476472914195, "grad_norm": 1.1875, "learning_rate": 0.0004628578195650628, "loss": 5.3167, "mean_token_accuracy": 0.1886990875005722, "num_tokens": 44844078.0, "step": 19580 }, { "entropy": 5.519651317596436, "epoch": 1.936041913799921, "grad_norm": 1.1953125, "learning_rate": 0.0004628383948551769, "loss": 5.2105, "mean_token_accuracy": 0.19270310699939727, "num_tokens": 44854722.0, "step": 19585 }, { "entropy": 5.577307558059692, "epoch": 1.9365361803084222, "grad_norm": 1.6015625, "learning_rate": 0.0004628189655244374, "loss": 5.2608, "mean_token_accuracy": 0.19222649186849594, "num_tokens": 44866337.0, "step": 19590 }, { "entropy": 5.608915758132935, "epoch": 1.9370304468169237, "grad_norm": 1.1953125, "learning_rate": 0.0004627995315733222, "loss": 5.3141, "mean_token_accuracy": 0.18868790119886397, "num_tokens": 44878686.0, "step": 19595 }, { "entropy": 5.5957568168640135, "epoch": 1.9375247133254252, "grad_norm": 1.2734375, "learning_rate": 0.00046278009300230945, "loss": 5.2387, "mean_token_accuracy": 0.18517884612083435, "num_tokens": 44890339.0, "step": 19600 }, { "entropy": 5.669606637954712, "epoch": 1.9380189798339265, "grad_norm": 1.203125, "learning_rate": 0.0004627606498118772, "loss": 5.3651, "mean_token_accuracy": 0.1811843380331993, "num_tokens": 44902850.0, "step": 19605 }, { "entropy": 5.57137770652771, "epoch": 1.9385132463424277, "grad_norm": 1.375, "learning_rate": 0.0004627412020025039, "loss": 5.2311, "mean_token_accuracy": 0.19209009706974028, "num_tokens": 44914074.0, "step": 19610 }, { "entropy": 5.588099431991577, "epoch": 1.9390075128509292, "grad_norm": 1.328125, "learning_rate": 0.00046272174957466783, "loss": 5.2868, "mean_token_accuracy": 0.18897171318531036, "num_tokens": 44925665.0, "step": 19615 }, { "entropy": 5.611680364608764, "epoch": 1.9395017793594307, "grad_norm": 1.40625, "learning_rate": 0.0004627022925288476, "loss": 5.3356, "mean_token_accuracy": 0.19216190725564958, "num_tokens": 44936584.0, "step": 19620 }, { "entropy": 5.598427104949951, "epoch": 1.939996045867932, "grad_norm": 1.3125, "learning_rate": 0.0004626828308655219, "loss": 5.2192, "mean_token_accuracy": 0.1929556742310524, "num_tokens": 44948028.0, "step": 19625 }, { "entropy": 5.545696115493774, "epoch": 1.9404903123764332, "grad_norm": 1.1640625, "learning_rate": 0.00046266336458516944, "loss": 5.1576, "mean_token_accuracy": 0.1987527310848236, "num_tokens": 44959504.0, "step": 19630 }, { "entropy": 5.580860614776611, "epoch": 1.940984578884935, "grad_norm": 1.2265625, "learning_rate": 0.0004626438936882691, "loss": 5.3012, "mean_token_accuracy": 0.18677317053079606, "num_tokens": 44971518.0, "step": 19635 }, { "entropy": 5.520154142379761, "epoch": 1.9414788453934362, "grad_norm": 1.1640625, "learning_rate": 0.00046262441817529986, "loss": 5.2001, "mean_token_accuracy": 0.19911773949861528, "num_tokens": 44982514.0, "step": 19640 }, { "entropy": 5.540999984741211, "epoch": 1.9419731119019374, "grad_norm": 1.203125, "learning_rate": 0.0004626049380467408, "loss": 5.2016, "mean_token_accuracy": 0.19832732975482942, "num_tokens": 44995198.0, "step": 19645 }, { "entropy": 5.582744216918945, "epoch": 1.942467378410439, "grad_norm": 1.171875, "learning_rate": 0.00046258545330307124, "loss": 5.2156, "mean_token_accuracy": 0.19470031857490538, "num_tokens": 45008014.0, "step": 19650 }, { "entropy": 5.571939516067505, "epoch": 1.9429616449189404, "grad_norm": 1.1484375, "learning_rate": 0.00046256596394477037, "loss": 5.2797, "mean_token_accuracy": 0.19575897455215455, "num_tokens": 45021169.0, "step": 19655 }, { "entropy": 5.535858583450318, "epoch": 1.9434559114274417, "grad_norm": 1.3828125, "learning_rate": 0.0004625464699723177, "loss": 5.1601, "mean_token_accuracy": 0.1978980556130409, "num_tokens": 45032703.0, "step": 19660 }, { "entropy": 5.506058692932129, "epoch": 1.943950177935943, "grad_norm": 1.421875, "learning_rate": 0.0004625269713861928, "loss": 5.2352, "mean_token_accuracy": 0.19318510591983795, "num_tokens": 45044350.0, "step": 19665 }, { "entropy": 5.517756128311158, "epoch": 1.9444444444444444, "grad_norm": 1.2421875, "learning_rate": 0.0004625074681868753, "loss": 5.2197, "mean_token_accuracy": 0.20157890170812606, "num_tokens": 45055431.0, "step": 19670 }, { "entropy": 5.59564619064331, "epoch": 1.944938710952946, "grad_norm": 1.4296875, "learning_rate": 0.0004624879603748449, "loss": 5.2484, "mean_token_accuracy": 0.19636425524950027, "num_tokens": 45066801.0, "step": 19675 }, { "entropy": 5.5482871532440186, "epoch": 1.9454329774614472, "grad_norm": 1.6640625, "learning_rate": 0.0004624684479505817, "loss": 5.2189, "mean_token_accuracy": 0.1945919543504715, "num_tokens": 45078393.0, "step": 19680 }, { "entropy": 5.569502639770508, "epoch": 1.9459272439699487, "grad_norm": 1.171875, "learning_rate": 0.0004624489309145655, "loss": 5.2608, "mean_token_accuracy": 0.191505765914917, "num_tokens": 45090782.0, "step": 19685 }, { "entropy": 5.568394994735717, "epoch": 1.9464215104784501, "grad_norm": 1.1875, "learning_rate": 0.0004624294092672766, "loss": 5.2325, "mean_token_accuracy": 0.2008551374077797, "num_tokens": 45102079.0, "step": 19690 }, { "entropy": 5.561351156234741, "epoch": 1.9469157769869514, "grad_norm": 1.4609375, "learning_rate": 0.0004624098830091951, "loss": 5.2328, "mean_token_accuracy": 0.2017618164420128, "num_tokens": 45112947.0, "step": 19695 }, { "entropy": 5.5489341735839846, "epoch": 1.9474100434954527, "grad_norm": 1.21875, "learning_rate": 0.00046239035214080146, "loss": 5.2599, "mean_token_accuracy": 0.190461228787899, "num_tokens": 45124577.0, "step": 19700 }, { "entropy": 5.572587490081787, "epoch": 1.9479043100039541, "grad_norm": 1.2578125, "learning_rate": 0.0004623708166625761, "loss": 5.2623, "mean_token_accuracy": 0.18926297426223754, "num_tokens": 45135380.0, "step": 19705 }, { "entropy": 5.61161732673645, "epoch": 1.9483985765124556, "grad_norm": 1.3203125, "learning_rate": 0.00046235127657499945, "loss": 5.2401, "mean_token_accuracy": 0.19348111897706985, "num_tokens": 45146926.0, "step": 19710 }, { "entropy": 5.5252272605896, "epoch": 1.9488928430209569, "grad_norm": 1.203125, "learning_rate": 0.0004623317318785524, "loss": 5.2651, "mean_token_accuracy": 0.19426850080490113, "num_tokens": 45157662.0, "step": 19715 }, { "entropy": 5.451500654220581, "epoch": 1.9493871095294582, "grad_norm": 1.2109375, "learning_rate": 0.0004623121825737158, "loss": 5.1567, "mean_token_accuracy": 0.20491967350244522, "num_tokens": 45170239.0, "step": 19720 }, { "entropy": 5.568098068237305, "epoch": 1.9498813760379596, "grad_norm": 1.21875, "learning_rate": 0.00046229262866097034, "loss": 5.2303, "mean_token_accuracy": 0.18728385120630264, "num_tokens": 45180979.0, "step": 19725 }, { "entropy": 5.532364797592163, "epoch": 1.9503756425464611, "grad_norm": 1.609375, "learning_rate": 0.0004622730701407971, "loss": 5.2183, "mean_token_accuracy": 0.1994457483291626, "num_tokens": 45191160.0, "step": 19730 }, { "entropy": 5.560722923278808, "epoch": 1.9508699090549624, "grad_norm": 1.203125, "learning_rate": 0.0004622535070136774, "loss": 5.236, "mean_token_accuracy": 0.20027394443750382, "num_tokens": 45202865.0, "step": 19735 }, { "entropy": 5.61088376045227, "epoch": 1.9513641755634639, "grad_norm": 1.2578125, "learning_rate": 0.00046223393928009233, "loss": 5.2397, "mean_token_accuracy": 0.19022582322359086, "num_tokens": 45214831.0, "step": 19740 }, { "entropy": 5.6594212532043455, "epoch": 1.9518584420719653, "grad_norm": 1.2734375, "learning_rate": 0.00046221436694052334, "loss": 5.359, "mean_token_accuracy": 0.19217007011175155, "num_tokens": 45226453.0, "step": 19745 }, { "entropy": 5.640673685073852, "epoch": 1.9523527085804666, "grad_norm": 1.3203125, "learning_rate": 0.00046219478999545184, "loss": 5.3133, "mean_token_accuracy": 0.1876315340399742, "num_tokens": 45237292.0, "step": 19750 }, { "entropy": 5.483549308776856, "epoch": 1.9528469750889679, "grad_norm": 1.359375, "learning_rate": 0.0004621752084453595, "loss": 5.1399, "mean_token_accuracy": 0.20296119302511215, "num_tokens": 45248117.0, "step": 19755 }, { "entropy": 5.517328548431396, "epoch": 1.9533412415974694, "grad_norm": 1.3359375, "learning_rate": 0.00046215562229072796, "loss": 5.2874, "mean_token_accuracy": 0.17995953261852266, "num_tokens": 45259120.0, "step": 19760 }, { "entropy": 5.57343864440918, "epoch": 1.9538355081059708, "grad_norm": 1.3046875, "learning_rate": 0.00046213603153203906, "loss": 5.1818, "mean_token_accuracy": 0.20038791596889496, "num_tokens": 45269554.0, "step": 19765 }, { "entropy": 5.552782297134399, "epoch": 1.954329774614472, "grad_norm": 1.4453125, "learning_rate": 0.0004621164361697748, "loss": 5.2209, "mean_token_accuracy": 0.19018377661705016, "num_tokens": 45281055.0, "step": 19770 }, { "entropy": 5.516794729232788, "epoch": 1.9548240411229734, "grad_norm": 1.375, "learning_rate": 0.0004620968362044172, "loss": 5.1802, "mean_token_accuracy": 0.21001689583063127, "num_tokens": 45292430.0, "step": 19775 }, { "entropy": 5.536257076263428, "epoch": 1.9553183076314749, "grad_norm": 1.2734375, "learning_rate": 0.0004620772316364483, "loss": 5.1572, "mean_token_accuracy": 0.19214885234832763, "num_tokens": 45303417.0, "step": 19780 }, { "entropy": 5.577347135543823, "epoch": 1.9558125741399763, "grad_norm": 1.71875, "learning_rate": 0.0004620576224663506, "loss": 5.3206, "mean_token_accuracy": 0.18164298683404922, "num_tokens": 45315243.0, "step": 19785 }, { "entropy": 5.540080928802491, "epoch": 1.9563068406484776, "grad_norm": 1.15625, "learning_rate": 0.0004620380086946063, "loss": 5.2297, "mean_token_accuracy": 0.19591670483350754, "num_tokens": 45326746.0, "step": 19790 }, { "entropy": 5.538619613647461, "epoch": 1.956801107156979, "grad_norm": 1.2109375, "learning_rate": 0.00046201839032169794, "loss": 5.1899, "mean_token_accuracy": 0.19956814646720886, "num_tokens": 45338199.0, "step": 19795 }, { "entropy": 5.616135883331299, "epoch": 1.9572953736654806, "grad_norm": 1.3515625, "learning_rate": 0.0004619987673481082, "loss": 5.2128, "mean_token_accuracy": 0.1970521867275238, "num_tokens": 45349470.0, "step": 19800 }, { "entropy": 5.597288179397583, "epoch": 1.9577896401739818, "grad_norm": 1.25, "learning_rate": 0.00046197913977431983, "loss": 5.2605, "mean_token_accuracy": 0.18897920548915864, "num_tokens": 45359735.0, "step": 19805 }, { "entropy": 5.648198366165161, "epoch": 1.958283906682483, "grad_norm": 1.671875, "learning_rate": 0.00046195950760081556, "loss": 5.3978, "mean_token_accuracy": 0.18056899458169937, "num_tokens": 45372960.0, "step": 19810 }, { "entropy": 5.627838563919068, "epoch": 1.9587781731909846, "grad_norm": 1.4140625, "learning_rate": 0.0004619398708280784, "loss": 5.3193, "mean_token_accuracy": 0.1901567593216896, "num_tokens": 45385174.0, "step": 19815 }, { "entropy": 5.529311275482177, "epoch": 1.959272439699486, "grad_norm": 1.1875, "learning_rate": 0.0004619202294565914, "loss": 5.2064, "mean_token_accuracy": 0.1971341550350189, "num_tokens": 45397013.0, "step": 19820 }, { "entropy": 5.724609422683716, "epoch": 1.9597667062079873, "grad_norm": 1.4375, "learning_rate": 0.0004619005834868378, "loss": 5.4052, "mean_token_accuracy": 0.17449079304933549, "num_tokens": 45408863.0, "step": 19825 }, { "entropy": 5.578535842895508, "epoch": 1.9602609727164886, "grad_norm": 1.125, "learning_rate": 0.0004618809329193008, "loss": 5.2465, "mean_token_accuracy": 0.195696596801281, "num_tokens": 45420630.0, "step": 19830 }, { "entropy": 5.6050084114074705, "epoch": 1.96075523922499, "grad_norm": 1.375, "learning_rate": 0.0004618612777544639, "loss": 5.2312, "mean_token_accuracy": 0.1926379457116127, "num_tokens": 45431427.0, "step": 19835 }, { "entropy": 5.581892967224121, "epoch": 1.9612495057334915, "grad_norm": 1.1953125, "learning_rate": 0.00046184161799281057, "loss": 5.1469, "mean_token_accuracy": 0.20311880707740784, "num_tokens": 45442649.0, "step": 19840 }, { "entropy": 5.522710466384888, "epoch": 1.9617437722419928, "grad_norm": 1.40625, "learning_rate": 0.00046182195363482444, "loss": 5.2331, "mean_token_accuracy": 0.19719004184007644, "num_tokens": 45454032.0, "step": 19845 }, { "entropy": 5.532337713241577, "epoch": 1.9622380387504943, "grad_norm": 1.25, "learning_rate": 0.00046180228468098927, "loss": 5.2572, "mean_token_accuracy": 0.18732471913099288, "num_tokens": 45464706.0, "step": 19850 }, { "entropy": 5.687468719482422, "epoch": 1.9627323052589958, "grad_norm": 2.046875, "learning_rate": 0.00046178261113178894, "loss": 5.3788, "mean_token_accuracy": 0.17826322168111802, "num_tokens": 45476292.0, "step": 19855 }, { "entropy": 5.522291469573974, "epoch": 1.963226571767497, "grad_norm": 1.234375, "learning_rate": 0.0004617629329877074, "loss": 5.1848, "mean_token_accuracy": 0.2006040558218956, "num_tokens": 45488189.0, "step": 19860 }, { "entropy": 5.610484457015991, "epoch": 1.9637208382759983, "grad_norm": 1.40625, "learning_rate": 0.0004617432502492287, "loss": 5.2163, "mean_token_accuracy": 0.19530561864376067, "num_tokens": 45499825.0, "step": 19865 }, { "entropy": 5.510534763336182, "epoch": 1.9642151047844998, "grad_norm": 1.28125, "learning_rate": 0.0004617235629168371, "loss": 5.1981, "mean_token_accuracy": 0.19429436922073365, "num_tokens": 45511164.0, "step": 19870 }, { "entropy": 5.567736387252808, "epoch": 1.9647093712930013, "grad_norm": 1.3203125, "learning_rate": 0.0004617038709910168, "loss": 5.3016, "mean_token_accuracy": 0.18901262283325196, "num_tokens": 45521506.0, "step": 19875 }, { "entropy": 5.661199903488159, "epoch": 1.9652036378015025, "grad_norm": 3.1875, "learning_rate": 0.0004616841744722524, "loss": 5.3351, "mean_token_accuracy": 0.18875936716794967, "num_tokens": 45531622.0, "step": 19880 }, { "entropy": 5.582238960266113, "epoch": 1.9656979043100038, "grad_norm": 1.2578125, "learning_rate": 0.00046166447336102836, "loss": 5.1977, "mean_token_accuracy": 0.19730779081583022, "num_tokens": 45541565.0, "step": 19885 }, { "entropy": 5.603276014328003, "epoch": 1.9661921708185055, "grad_norm": 1.0859375, "learning_rate": 0.00046164476765782927, "loss": 5.209, "mean_token_accuracy": 0.19174007922410966, "num_tokens": 45552943.0, "step": 19890 }, { "entropy": 5.526623392105103, "epoch": 1.9666864373270068, "grad_norm": 1.2265625, "learning_rate": 0.00046162505736313997, "loss": 5.2833, "mean_token_accuracy": 0.19296058565378188, "num_tokens": 45563914.0, "step": 19895 }, { "entropy": 5.498500633239746, "epoch": 1.967180703835508, "grad_norm": 1.2890625, "learning_rate": 0.0004616053424774453, "loss": 5.1767, "mean_token_accuracy": 0.1936721086502075, "num_tokens": 45575730.0, "step": 19900 }, { "entropy": 5.649481534957886, "epoch": 1.9676749703440095, "grad_norm": 1.40625, "learning_rate": 0.00046158562300123023, "loss": 5.3087, "mean_token_accuracy": 0.18902114033699036, "num_tokens": 45588369.0, "step": 19905 }, { "entropy": 5.5415239334106445, "epoch": 1.968169236852511, "grad_norm": 1.2578125, "learning_rate": 0.00046156589893498, "loss": 5.1559, "mean_token_accuracy": 0.1993715688586235, "num_tokens": 45599235.0, "step": 19910 }, { "entropy": 5.510575819015503, "epoch": 1.9686635033610123, "grad_norm": 1.5078125, "learning_rate": 0.00046154617027917955, "loss": 5.1911, "mean_token_accuracy": 0.2003573387861252, "num_tokens": 45610066.0, "step": 19915 }, { "entropy": 5.511261463165283, "epoch": 1.9691577698695135, "grad_norm": 1.328125, "learning_rate": 0.00046152643703431447, "loss": 5.1971, "mean_token_accuracy": 0.19434211552143096, "num_tokens": 45621543.0, "step": 19920 }, { "entropy": 5.552016305923462, "epoch": 1.969652036378015, "grad_norm": 1.1796875, "learning_rate": 0.00046150669920087004, "loss": 5.334, "mean_token_accuracy": 0.180738465487957, "num_tokens": 45634984.0, "step": 19925 }, { "entropy": 5.662458992004394, "epoch": 1.9701463028865165, "grad_norm": 1.328125, "learning_rate": 0.0004614869567793319, "loss": 5.267, "mean_token_accuracy": 0.1927230551838875, "num_tokens": 45646778.0, "step": 19930 }, { "entropy": 5.557553482055664, "epoch": 1.9706405693950177, "grad_norm": 1.3359375, "learning_rate": 0.00046146720977018567, "loss": 5.2277, "mean_token_accuracy": 0.19547680467367173, "num_tokens": 45658103.0, "step": 19935 }, { "entropy": 5.553086471557617, "epoch": 1.971134835903519, "grad_norm": 1.21875, "learning_rate": 0.0004614474581739172, "loss": 5.1842, "mean_token_accuracy": 0.19174272269010545, "num_tokens": 45669166.0, "step": 19940 }, { "entropy": 5.522197628021241, "epoch": 1.9716291024120207, "grad_norm": 1.484375, "learning_rate": 0.0004614277019910123, "loss": 5.2439, "mean_token_accuracy": 0.18804922252893447, "num_tokens": 45680667.0, "step": 19945 }, { "entropy": 5.582298374176025, "epoch": 1.972123368920522, "grad_norm": 1.2734375, "learning_rate": 0.0004614079412219571, "loss": 5.3445, "mean_token_accuracy": 0.18462157100439072, "num_tokens": 45692347.0, "step": 19950 }, { "entropy": 5.664348840713501, "epoch": 1.9726176354290232, "grad_norm": 1.4375, "learning_rate": 0.0004613881758672375, "loss": 5.3019, "mean_token_accuracy": 0.19526259005069732, "num_tokens": 45703972.0, "step": 19955 }, { "entropy": 5.551305627822876, "epoch": 1.9731119019375247, "grad_norm": 1.2578125, "learning_rate": 0.00046136840592733995, "loss": 5.2061, "mean_token_accuracy": 0.19083081036806107, "num_tokens": 45715446.0, "step": 19960 }, { "entropy": 5.506358575820923, "epoch": 1.9736061684460262, "grad_norm": 2.109375, "learning_rate": 0.00046134863140275066, "loss": 5.2027, "mean_token_accuracy": 0.20202235132455826, "num_tokens": 45727210.0, "step": 19965 }, { "entropy": 5.619771718978882, "epoch": 1.9741004349545275, "grad_norm": 1.2109375, "learning_rate": 0.00046132885229395606, "loss": 5.24, "mean_token_accuracy": 0.19156670421361924, "num_tokens": 45738235.0, "step": 19970 }, { "entropy": 5.591773176193238, "epoch": 1.9745947014630287, "grad_norm": 1.234375, "learning_rate": 0.0004613090686014429, "loss": 5.2398, "mean_token_accuracy": 0.19855031371116638, "num_tokens": 45750743.0, "step": 19975 }, { "entropy": 5.606315803527832, "epoch": 1.9750889679715302, "grad_norm": 1.1875, "learning_rate": 0.00046128928032569775, "loss": 5.2601, "mean_token_accuracy": 0.1904052436351776, "num_tokens": 45761989.0, "step": 19980 }, { "entropy": 5.526347351074219, "epoch": 1.9755832344800317, "grad_norm": 1.921875, "learning_rate": 0.0004612694874672073, "loss": 5.3045, "mean_token_accuracy": 0.19031201153993607, "num_tokens": 45775046.0, "step": 19985 }, { "entropy": 5.676477527618408, "epoch": 1.976077500988533, "grad_norm": 1.203125, "learning_rate": 0.0004612496900264586, "loss": 5.3397, "mean_token_accuracy": 0.18965043425559996, "num_tokens": 45786776.0, "step": 19990 }, { "entropy": 5.619040203094483, "epoch": 1.9765717674970344, "grad_norm": 1.2421875, "learning_rate": 0.0004612298880039387, "loss": 5.2079, "mean_token_accuracy": 0.193252994120121, "num_tokens": 45797675.0, "step": 19995 }, { "entropy": 5.565063953399658, "epoch": 1.977066034005536, "grad_norm": 1.2109375, "learning_rate": 0.0004612100814001346, "loss": 5.2542, "mean_token_accuracy": 0.1882918357849121, "num_tokens": 45809897.0, "step": 20000 }, { "entropy": 5.6252992153167725, "epoch": 1.9775603005140372, "grad_norm": 1.3359375, "learning_rate": 0.0004611902702155336, "loss": 5.3711, "mean_token_accuracy": 0.18630560785531997, "num_tokens": 45822330.0, "step": 20005 }, { "entropy": 5.611008071899414, "epoch": 1.9780545670225385, "grad_norm": 1.1484375, "learning_rate": 0.0004611704544506232, "loss": 5.2279, "mean_token_accuracy": 0.1941098690032959, "num_tokens": 45834705.0, "step": 20010 }, { "entropy": 5.553883600234985, "epoch": 1.97854883353104, "grad_norm": 1.4453125, "learning_rate": 0.0004611506341058906, "loss": 5.2876, "mean_token_accuracy": 0.1864999607205391, "num_tokens": 45846646.0, "step": 20015 }, { "entropy": 5.532613134384155, "epoch": 1.9790431000395414, "grad_norm": 1.203125, "learning_rate": 0.00046113080918182346, "loss": 5.2062, "mean_token_accuracy": 0.20140762329101564, "num_tokens": 45857252.0, "step": 20020 }, { "entropy": 5.5130424976348875, "epoch": 1.9795373665480427, "grad_norm": 1.71875, "learning_rate": 0.00046111097967890975, "loss": 5.171, "mean_token_accuracy": 0.2004624754190445, "num_tokens": 45867780.0, "step": 20025 }, { "entropy": 5.648492479324341, "epoch": 1.980031633056544, "grad_norm": 1.171875, "learning_rate": 0.0004610911455976369, "loss": 5.2898, "mean_token_accuracy": 0.18554428219795227, "num_tokens": 45878998.0, "step": 20030 }, { "entropy": 5.550714015960693, "epoch": 1.9805258995650454, "grad_norm": 1.125, "learning_rate": 0.00046107130693849303, "loss": 5.1342, "mean_token_accuracy": 0.1965284526348114, "num_tokens": 45889685.0, "step": 20035 }, { "entropy": 5.527384567260742, "epoch": 1.981020166073547, "grad_norm": 1.25, "learning_rate": 0.0004610514637019662, "loss": 5.2493, "mean_token_accuracy": 0.19591145664453508, "num_tokens": 45900887.0, "step": 20040 }, { "entropy": 5.505190896987915, "epoch": 1.9815144325820482, "grad_norm": 1.15625, "learning_rate": 0.0004610316158885444, "loss": 5.3216, "mean_token_accuracy": 0.18752169162034987, "num_tokens": 45913860.0, "step": 20045 }, { "entropy": 5.571532678604126, "epoch": 1.9820086990905497, "grad_norm": 1.234375, "learning_rate": 0.0004610117634987161, "loss": 5.2101, "mean_token_accuracy": 0.19395423978567122, "num_tokens": 45924669.0, "step": 20050 }, { "entropy": 5.547738027572632, "epoch": 1.9825029655990511, "grad_norm": 1.1875, "learning_rate": 0.00046099190653296946, "loss": 5.1991, "mean_token_accuracy": 0.18883865773677827, "num_tokens": 45937013.0, "step": 20055 }, { "entropy": 5.5249800205230715, "epoch": 1.9829972321075524, "grad_norm": 1.1796875, "learning_rate": 0.0004609720449917932, "loss": 5.1931, "mean_token_accuracy": 0.19548698663711547, "num_tokens": 45950063.0, "step": 20060 }, { "entropy": 5.554518175125122, "epoch": 1.9834914986160537, "grad_norm": 1.25, "learning_rate": 0.00046095217887567565, "loss": 5.2767, "mean_token_accuracy": 0.19285016506910324, "num_tokens": 45962136.0, "step": 20065 }, { "entropy": 5.560231637954712, "epoch": 1.9839857651245552, "grad_norm": 1.375, "learning_rate": 0.0004609323081851057, "loss": 5.1507, "mean_token_accuracy": 0.1959804281592369, "num_tokens": 45974712.0, "step": 20070 }, { "entropy": 5.526361465454102, "epoch": 1.9844800316330566, "grad_norm": 1.375, "learning_rate": 0.0004609124329205721, "loss": 5.2555, "mean_token_accuracy": 0.19503979980945588, "num_tokens": 45985670.0, "step": 20075 }, { "entropy": 5.606738519668579, "epoch": 1.984974298141558, "grad_norm": 1.359375, "learning_rate": 0.0004608925530825638, "loss": 5.334, "mean_token_accuracy": 0.18032826632261276, "num_tokens": 45997215.0, "step": 20080 }, { "entropy": 5.538951253890991, "epoch": 1.9854685646500592, "grad_norm": 1.3203125, "learning_rate": 0.00046087266867156997, "loss": 5.2456, "mean_token_accuracy": 0.1949484020471573, "num_tokens": 46008479.0, "step": 20085 }, { "entropy": 5.596453428268433, "epoch": 1.9859628311585606, "grad_norm": 1.1796875, "learning_rate": 0.00046085277968807955, "loss": 5.2074, "mean_token_accuracy": 0.19372638463973998, "num_tokens": 46019504.0, "step": 20090 }, { "entropy": 5.560030174255371, "epoch": 1.9864570976670621, "grad_norm": 1.1796875, "learning_rate": 0.0004608328861325819, "loss": 5.2727, "mean_token_accuracy": 0.18828368782997132, "num_tokens": 46030218.0, "step": 20095 }, { "entropy": 5.595650482177734, "epoch": 1.9869513641755634, "grad_norm": 1.3203125, "learning_rate": 0.0004608129880055665, "loss": 5.2661, "mean_token_accuracy": 0.19005829095840454, "num_tokens": 46041767.0, "step": 20100 }, { "entropy": 5.541061592102051, "epoch": 1.9874456306840649, "grad_norm": 1.3671875, "learning_rate": 0.00046079308530752274, "loss": 5.1328, "mean_token_accuracy": 0.20187895596027375, "num_tokens": 46052792.0, "step": 20105 }, { "entropy": 5.5828554153442385, "epoch": 1.9879398971925664, "grad_norm": 1.3828125, "learning_rate": 0.00046077317803894024, "loss": 5.3241, "mean_token_accuracy": 0.18713027834892274, "num_tokens": 46064609.0, "step": 20110 }, { "entropy": 5.525623846054077, "epoch": 1.9884341637010676, "grad_norm": 1.4609375, "learning_rate": 0.00046075326620030876, "loss": 5.1805, "mean_token_accuracy": 0.19658640623092652, "num_tokens": 46075624.0, "step": 20115 }, { "entropy": 5.547412109375, "epoch": 1.9889284302095689, "grad_norm": 1.2890625, "learning_rate": 0.00046073334979211813, "loss": 5.2219, "mean_token_accuracy": 0.19744790941476822, "num_tokens": 46086455.0, "step": 20120 }, { "entropy": 5.584542846679687, "epoch": 1.9894226967180704, "grad_norm": 1.3203125, "learning_rate": 0.0004607134288148582, "loss": 5.2892, "mean_token_accuracy": 0.18693042546510696, "num_tokens": 46097362.0, "step": 20125 }, { "entropy": 5.507166481018066, "epoch": 1.9899169632265719, "grad_norm": 1.140625, "learning_rate": 0.00046069350326901915, "loss": 5.1803, "mean_token_accuracy": 0.19810830801725388, "num_tokens": 46107811.0, "step": 20130 }, { "entropy": 5.628103399276734, "epoch": 1.9904112297350731, "grad_norm": 1.21875, "learning_rate": 0.0004606735731550912, "loss": 5.4053, "mean_token_accuracy": 0.1753584623336792, "num_tokens": 46120178.0, "step": 20135 }, { "entropy": 5.713874816894531, "epoch": 1.9909054962435744, "grad_norm": 1.359375, "learning_rate": 0.00046065363847356443, "loss": 5.3044, "mean_token_accuracy": 0.1894799068570137, "num_tokens": 46131416.0, "step": 20140 }, { "entropy": 5.628296899795532, "epoch": 1.991399762752076, "grad_norm": 1.3046875, "learning_rate": 0.00046063369922492943, "loss": 5.2631, "mean_token_accuracy": 0.19796158224344254, "num_tokens": 46142195.0, "step": 20145 }, { "entropy": 5.518492078781128, "epoch": 1.9918940292605773, "grad_norm": 1.0703125, "learning_rate": 0.0004606137554096766, "loss": 5.2909, "mean_token_accuracy": 0.18575461953878403, "num_tokens": 46154537.0, "step": 20150 }, { "entropy": 5.626855516433716, "epoch": 1.9923882957690786, "grad_norm": 1.234375, "learning_rate": 0.0004605938070282965, "loss": 5.2422, "mean_token_accuracy": 0.19054343849420546, "num_tokens": 46166711.0, "step": 20155 }, { "entropy": 5.5353936672210695, "epoch": 1.99288256227758, "grad_norm": 1.25, "learning_rate": 0.00046057385408128013, "loss": 5.1891, "mean_token_accuracy": 0.19557373225688934, "num_tokens": 46178509.0, "step": 20160 }, { "entropy": 5.51286129951477, "epoch": 1.9933768287860816, "grad_norm": 1.2578125, "learning_rate": 0.000460553896569118, "loss": 5.231, "mean_token_accuracy": 0.19280512928962706, "num_tokens": 46188413.0, "step": 20165 }, { "entropy": 5.508239459991455, "epoch": 1.9938710952945828, "grad_norm": 1.1484375, "learning_rate": 0.0004605339344923014, "loss": 5.2405, "mean_token_accuracy": 0.19172760993242263, "num_tokens": 46199708.0, "step": 20170 }, { "entropy": 5.539658546447754, "epoch": 1.994365361803084, "grad_norm": 1.1796875, "learning_rate": 0.00046051396785132113, "loss": 5.2213, "mean_token_accuracy": 0.1972035989165306, "num_tokens": 46210670.0, "step": 20175 }, { "entropy": 5.573497486114502, "epoch": 1.9948596283115856, "grad_norm": 1.25, "learning_rate": 0.0004604939966466684, "loss": 5.2151, "mean_token_accuracy": 0.19435738474130632, "num_tokens": 46220935.0, "step": 20180 }, { "entropy": 5.565096092224121, "epoch": 1.995353894820087, "grad_norm": 1.234375, "learning_rate": 0.0004604740208788347, "loss": 5.2452, "mean_token_accuracy": 0.19673842191696167, "num_tokens": 46232651.0, "step": 20185 }, { "entropy": 5.59782395362854, "epoch": 1.9958481613285883, "grad_norm": 1.3515625, "learning_rate": 0.00046045404054831124, "loss": 5.2138, "mean_token_accuracy": 0.19382842779159545, "num_tokens": 46244308.0, "step": 20190 }, { "entropy": 5.639287376403809, "epoch": 1.9963424278370896, "grad_norm": 1.265625, "learning_rate": 0.00046043405565558964, "loss": 5.3238, "mean_token_accuracy": 0.18887805789709092, "num_tokens": 46256941.0, "step": 20195 }, { "entropy": 5.567622137069702, "epoch": 1.9968366943455913, "grad_norm": 1.34375, "learning_rate": 0.00046041406620116144, "loss": 5.3042, "mean_token_accuracy": 0.18454636186361312, "num_tokens": 46270557.0, "step": 20200 }, { "entropy": 5.614986753463745, "epoch": 1.9973309608540926, "grad_norm": 1.21875, "learning_rate": 0.0004603940721855185, "loss": 5.2085, "mean_token_accuracy": 0.19403827637434007, "num_tokens": 46280940.0, "step": 20205 }, { "entropy": 5.518739032745361, "epoch": 1.9978252273625938, "grad_norm": 1.1328125, "learning_rate": 0.0004603740736091527, "loss": 5.2957, "mean_token_accuracy": 0.19323249459266661, "num_tokens": 46292358.0, "step": 20210 }, { "entropy": 5.60916051864624, "epoch": 1.9983194938710953, "grad_norm": 1.296875, "learning_rate": 0.0004603540704725558, "loss": 5.321, "mean_token_accuracy": 0.19341258853673934, "num_tokens": 46303210.0, "step": 20215 }, { "entropy": 5.530276966094971, "epoch": 1.9988137603795968, "grad_norm": 1.2578125, "learning_rate": 0.0004603340627762201, "loss": 5.1948, "mean_token_accuracy": 0.19728601574897767, "num_tokens": 46315152.0, "step": 20220 }, { "entropy": 5.531363010406494, "epoch": 1.999308026888098, "grad_norm": 1.203125, "learning_rate": 0.00046031405052063756, "loss": 5.205, "mean_token_accuracy": 0.19989322274923324, "num_tokens": 46325776.0, "step": 20225 }, { "entropy": 5.550169897079468, "epoch": 1.9998022933965993, "grad_norm": 1.2265625, "learning_rate": 0.00046029403370630086, "loss": 5.2009, "mean_token_accuracy": 0.20072553753852845, "num_tokens": 46336797.0, "step": 20230 }, { "entropy": 5.584086227416992, "epoch": 2.000296559905101, "grad_norm": 1.1640625, "learning_rate": 0.00046027401233370203, "loss": 5.2196, "mean_token_accuracy": 0.19337949752807618, "num_tokens": 46346327.0, "step": 20235 }, { "entropy": 5.507830953598022, "epoch": 2.0007908264136023, "grad_norm": 1.21875, "learning_rate": 0.00046025398640333373, "loss": 5.1679, "mean_token_accuracy": 0.1936369851231575, "num_tokens": 46358056.0, "step": 20240 }, { "entropy": 5.529959011077881, "epoch": 2.0012850929221035, "grad_norm": 1.0859375, "learning_rate": 0.00046023395591568867, "loss": 5.1209, "mean_token_accuracy": 0.1993355333805084, "num_tokens": 46369792.0, "step": 20245 }, { "entropy": 5.609037208557129, "epoch": 2.001779359430605, "grad_norm": 1.28125, "learning_rate": 0.00046021392087125957, "loss": 5.2188, "mean_token_accuracy": 0.19570821076631545, "num_tokens": 46381224.0, "step": 20250 }, { "entropy": 5.621746253967285, "epoch": 2.0022736259391065, "grad_norm": 1.2109375, "learning_rate": 0.0004601938812705393, "loss": 5.2133, "mean_token_accuracy": 0.19333819150924683, "num_tokens": 46393788.0, "step": 20255 }, { "entropy": 5.520979309082032, "epoch": 2.002767892447608, "grad_norm": 1.25, "learning_rate": 0.00046017383711402076, "loss": 5.1367, "mean_token_accuracy": 0.19376198053359986, "num_tokens": 46405742.0, "step": 20260 }, { "entropy": 5.5541774272918705, "epoch": 2.003262158956109, "grad_norm": 1.1953125, "learning_rate": 0.0004601537884021972, "loss": 5.2214, "mean_token_accuracy": 0.19490304589271545, "num_tokens": 46417276.0, "step": 20265 }, { "entropy": 5.494325923919678, "epoch": 2.0037564254646103, "grad_norm": 1.2890625, "learning_rate": 0.0004601337351355617, "loss": 5.1115, "mean_token_accuracy": 0.20242203772068024, "num_tokens": 46427950.0, "step": 20270 }, { "entropy": 5.497605562210083, "epoch": 2.004250691973112, "grad_norm": 1.1953125, "learning_rate": 0.0004601136773146075, "loss": 5.1688, "mean_token_accuracy": 0.20465146601200104, "num_tokens": 46439200.0, "step": 20275 }, { "entropy": 5.633645677566529, "epoch": 2.0047449584816133, "grad_norm": 1.4140625, "learning_rate": 0.0004600936149398282, "loss": 5.2613, "mean_token_accuracy": 0.19165722131729127, "num_tokens": 46451176.0, "step": 20280 }, { "entropy": 5.562808418273926, "epoch": 2.0052392249901145, "grad_norm": 1.5390625, "learning_rate": 0.00046007354801171725, "loss": 5.1771, "mean_token_accuracy": 0.198166361451149, "num_tokens": 46462798.0, "step": 20285 }, { "entropy": 5.555772829055786, "epoch": 2.0057334914986162, "grad_norm": 1.140625, "learning_rate": 0.0004600534765307682, "loss": 5.1953, "mean_token_accuracy": 0.19553897380828858, "num_tokens": 46473914.0, "step": 20290 }, { "entropy": 5.646041584014893, "epoch": 2.0062277580071175, "grad_norm": 1.4375, "learning_rate": 0.00046003340049747513, "loss": 5.2398, "mean_token_accuracy": 0.19778451919555665, "num_tokens": 46485089.0, "step": 20295 }, { "entropy": 5.589870405197144, "epoch": 2.0067220245156188, "grad_norm": 1.0703125, "learning_rate": 0.0004600133199123316, "loss": 5.1901, "mean_token_accuracy": 0.19143034666776657, "num_tokens": 46497115.0, "step": 20300 }, { "entropy": 5.4115537166595455, "epoch": 2.00721629102412, "grad_norm": 1.2265625, "learning_rate": 0.0004599932347758316, "loss": 5.0796, "mean_token_accuracy": 0.20637826174497603, "num_tokens": 46508845.0, "step": 20305 }, { "entropy": 5.435155630111694, "epoch": 2.0077105575326217, "grad_norm": 1.328125, "learning_rate": 0.0004599731450884694, "loss": 5.0944, "mean_token_accuracy": 0.20173050016164779, "num_tokens": 46520105.0, "step": 20310 }, { "entropy": 5.506902456283569, "epoch": 2.008204824041123, "grad_norm": 1.25, "learning_rate": 0.0004599530508507392, "loss": 5.12, "mean_token_accuracy": 0.1984819293022156, "num_tokens": 46530701.0, "step": 20315 }, { "entropy": 5.581664371490478, "epoch": 2.0086990905496243, "grad_norm": 1.203125, "learning_rate": 0.0004599329520631351, "loss": 5.1905, "mean_token_accuracy": 0.19773726910352707, "num_tokens": 46542614.0, "step": 20320 }, { "entropy": 5.552907419204712, "epoch": 2.009193357058126, "grad_norm": 1.203125, "learning_rate": 0.00045991284872615184, "loss": 5.1529, "mean_token_accuracy": 0.20513053387403488, "num_tokens": 46553624.0, "step": 20325 }, { "entropy": 5.506176328659057, "epoch": 2.0096876235666272, "grad_norm": 1.125, "learning_rate": 0.00045989274084028375, "loss": 5.1627, "mean_token_accuracy": 0.19421325176954268, "num_tokens": 46565599.0, "step": 20330 }, { "entropy": 5.5152122497558596, "epoch": 2.0101818900751285, "grad_norm": 1.2109375, "learning_rate": 0.0004598726284060256, "loss": 5.1574, "mean_token_accuracy": 0.20479942858219147, "num_tokens": 46576730.0, "step": 20335 }, { "entropy": 5.581531286239624, "epoch": 2.0106761565836297, "grad_norm": 1.140625, "learning_rate": 0.000459852511423872, "loss": 5.1799, "mean_token_accuracy": 0.19118578135967254, "num_tokens": 46587435.0, "step": 20340 }, { "entropy": 5.497976541519165, "epoch": 2.0111704230921315, "grad_norm": 1.1640625, "learning_rate": 0.0004598323898943181, "loss": 5.0724, "mean_token_accuracy": 0.19877846986055375, "num_tokens": 46598431.0, "step": 20345 }, { "entropy": 5.551491165161133, "epoch": 2.0116646896006327, "grad_norm": 1.2265625, "learning_rate": 0.0004598122638178586, "loss": 5.2097, "mean_token_accuracy": 0.18891131281852722, "num_tokens": 46609343.0, "step": 20350 }, { "entropy": 5.633590412139893, "epoch": 2.012158956109134, "grad_norm": 1.21875, "learning_rate": 0.00045979213319498883, "loss": 5.2134, "mean_token_accuracy": 0.19764048457145691, "num_tokens": 46621844.0, "step": 20355 }, { "entropy": 5.499310493469238, "epoch": 2.0126532226176352, "grad_norm": 1.3359375, "learning_rate": 0.0004597719980262039, "loss": 5.1519, "mean_token_accuracy": 0.19989294558763504, "num_tokens": 46633278.0, "step": 20360 }, { "entropy": 5.514910316467285, "epoch": 2.013147489126137, "grad_norm": 1.1328125, "learning_rate": 0.0004597518583119991, "loss": 5.1832, "mean_token_accuracy": 0.1948420986533165, "num_tokens": 46644375.0, "step": 20365 }, { "entropy": 5.591037178039551, "epoch": 2.013641755634638, "grad_norm": 1.1171875, "learning_rate": 0.0004597317140528699, "loss": 5.2331, "mean_token_accuracy": 0.19293177723884583, "num_tokens": 46655631.0, "step": 20370 }, { "entropy": 5.474056386947632, "epoch": 2.0141360221431395, "grad_norm": 1.0625, "learning_rate": 0.00045971156524931195, "loss": 5.0927, "mean_token_accuracy": 0.21048218309879302, "num_tokens": 46667095.0, "step": 20375 }, { "entropy": 5.573895978927612, "epoch": 2.014630288651641, "grad_norm": 1.2109375, "learning_rate": 0.0004596914119018209, "loss": 5.1783, "mean_token_accuracy": 0.19378681778907775, "num_tokens": 46678524.0, "step": 20380 }, { "entropy": 5.5605268478393555, "epoch": 2.0151245551601424, "grad_norm": 1.2265625, "learning_rate": 0.00045967125401089233, "loss": 5.1498, "mean_token_accuracy": 0.19463196992874146, "num_tokens": 46689785.0, "step": 20385 }, { "entropy": 5.568623876571655, "epoch": 2.0156188216686437, "grad_norm": 1.0625, "learning_rate": 0.0004596510915770223, "loss": 5.1786, "mean_token_accuracy": 0.1896626442670822, "num_tokens": 46701109.0, "step": 20390 }, { "entropy": 5.53907995223999, "epoch": 2.016113088177145, "grad_norm": 1.1875, "learning_rate": 0.0004596309246007068, "loss": 5.1325, "mean_token_accuracy": 0.19810078740119935, "num_tokens": 46711381.0, "step": 20395 }, { "entropy": 5.593878984451294, "epoch": 2.0166073546856467, "grad_norm": 1.28125, "learning_rate": 0.0004596107530824419, "loss": 5.2077, "mean_token_accuracy": 0.19844861477613449, "num_tokens": 46722237.0, "step": 20400 }, { "entropy": 5.501253890991211, "epoch": 2.017101621194148, "grad_norm": 1.109375, "learning_rate": 0.00045959057702272383, "loss": 5.1584, "mean_token_accuracy": 0.20107773393392564, "num_tokens": 46733679.0, "step": 20405 }, { "entropy": 5.591819763183594, "epoch": 2.017595887702649, "grad_norm": 1.2421875, "learning_rate": 0.0004595703964220489, "loss": 5.2617, "mean_token_accuracy": 0.1872195914387703, "num_tokens": 46746207.0, "step": 20410 }, { "entropy": 5.557614374160766, "epoch": 2.0180901542111505, "grad_norm": 1.234375, "learning_rate": 0.0004595502112809137, "loss": 5.1789, "mean_token_accuracy": 0.1948267251253128, "num_tokens": 46756607.0, "step": 20415 }, { "entropy": 5.5202168941497805, "epoch": 2.018584420719652, "grad_norm": 1.2109375, "learning_rate": 0.0004595300215998145, "loss": 5.2106, "mean_token_accuracy": 0.1983547255396843, "num_tokens": 46768383.0, "step": 20420 }, { "entropy": 5.623150157928467, "epoch": 2.0190786872281534, "grad_norm": 1.1796875, "learning_rate": 0.0004595098273792482, "loss": 5.2043, "mean_token_accuracy": 0.1905844032764435, "num_tokens": 46779511.0, "step": 20425 }, { "entropy": 5.540560531616211, "epoch": 2.0195729537366547, "grad_norm": 1.234375, "learning_rate": 0.0004594896286197116, "loss": 5.1727, "mean_token_accuracy": 0.19906250536441802, "num_tokens": 46791281.0, "step": 20430 }, { "entropy": 5.48981614112854, "epoch": 2.0200672202451564, "grad_norm": 1.21875, "learning_rate": 0.00045946942532170147, "loss": 5.1499, "mean_token_accuracy": 0.20337039828300477, "num_tokens": 46802090.0, "step": 20435 }, { "entropy": 5.548567438125611, "epoch": 2.0205614867536577, "grad_norm": 1.5390625, "learning_rate": 0.0004594492174857149, "loss": 5.1877, "mean_token_accuracy": 0.19649834781885148, "num_tokens": 46814688.0, "step": 20440 }, { "entropy": 5.597362470626831, "epoch": 2.021055753262159, "grad_norm": 1.1328125, "learning_rate": 0.00045942900511224886, "loss": 5.2055, "mean_token_accuracy": 0.19544486105442047, "num_tokens": 46826212.0, "step": 20445 }, { "entropy": 5.524536418914795, "epoch": 2.02155001977066, "grad_norm": 1.1953125, "learning_rate": 0.0004594087882018008, "loss": 5.1379, "mean_token_accuracy": 0.20085811764001846, "num_tokens": 46836583.0, "step": 20450 }, { "entropy": 5.520880031585693, "epoch": 2.022044286279162, "grad_norm": 1.1796875, "learning_rate": 0.0004593885667548679, "loss": 5.1799, "mean_token_accuracy": 0.19211812317371368, "num_tokens": 46847973.0, "step": 20455 }, { "entropy": 5.4943647384643555, "epoch": 2.022538552787663, "grad_norm": 1.296875, "learning_rate": 0.00045936834077194754, "loss": 5.1649, "mean_token_accuracy": 0.19420519918203355, "num_tokens": 46860113.0, "step": 20460 }, { "entropy": 5.648628282546997, "epoch": 2.0230328192961644, "grad_norm": 1.171875, "learning_rate": 0.0004593481102535375, "loss": 5.2685, "mean_token_accuracy": 0.20077752619981765, "num_tokens": 46871578.0, "step": 20465 }, { "entropy": 5.544854164123535, "epoch": 2.0235270858046657, "grad_norm": 1.21875, "learning_rate": 0.00045932787520013533, "loss": 5.1581, "mean_token_accuracy": 0.19711616188287734, "num_tokens": 46883701.0, "step": 20470 }, { "entropy": 5.459692001342773, "epoch": 2.0240213523131674, "grad_norm": 1.140625, "learning_rate": 0.0004593076356122389, "loss": 5.115, "mean_token_accuracy": 0.1996801182627678, "num_tokens": 46895107.0, "step": 20475 }, { "entropy": 5.450007581710816, "epoch": 2.0245156188216686, "grad_norm": 1.296875, "learning_rate": 0.000459287391490346, "loss": 5.0208, "mean_token_accuracy": 0.20859412848949432, "num_tokens": 46906984.0, "step": 20480 }, { "entropy": 5.53294415473938, "epoch": 2.02500988533017, "grad_norm": 1.296875, "learning_rate": 0.00045926714283495466, "loss": 5.2098, "mean_token_accuracy": 0.1961056888103485, "num_tokens": 46918582.0, "step": 20485 }, { "entropy": 5.573688268661499, "epoch": 2.0255041518386716, "grad_norm": 1.2890625, "learning_rate": 0.00045924688964656303, "loss": 5.2018, "mean_token_accuracy": 0.19821869134902953, "num_tokens": 46930799.0, "step": 20490 }, { "entropy": 5.5752997398376465, "epoch": 2.025998418347173, "grad_norm": 1.2421875, "learning_rate": 0.00045922663192566926, "loss": 5.1261, "mean_token_accuracy": 0.19986872375011444, "num_tokens": 46941517.0, "step": 20495 }, { "entropy": 5.560674953460693, "epoch": 2.026492684855674, "grad_norm": 1.2265625, "learning_rate": 0.00045920636967277187, "loss": 5.234, "mean_token_accuracy": 0.19469612538814546, "num_tokens": 46953160.0, "step": 20500 }, { "entropy": 5.5225818157196045, "epoch": 2.0269869513641754, "grad_norm": 1.171875, "learning_rate": 0.00045918610288836915, "loss": 5.049, "mean_token_accuracy": 0.20391114205121993, "num_tokens": 46964284.0, "step": 20505 }, { "entropy": 5.531648349761963, "epoch": 2.027481217872677, "grad_norm": 1.25, "learning_rate": 0.0004591658315729598, "loss": 5.2003, "mean_token_accuracy": 0.19108957648277283, "num_tokens": 46975402.0, "step": 20510 }, { "entropy": 5.544076728820801, "epoch": 2.0279754843811784, "grad_norm": 1.28125, "learning_rate": 0.0004591455557270423, "loss": 5.2042, "mean_token_accuracy": 0.19728613495826722, "num_tokens": 46988629.0, "step": 20515 }, { "entropy": 5.557766532897949, "epoch": 2.0284697508896796, "grad_norm": 1.140625, "learning_rate": 0.00045912527535111567, "loss": 5.2003, "mean_token_accuracy": 0.20109121054410933, "num_tokens": 47000497.0, "step": 20520 }, { "entropy": 5.503021335601806, "epoch": 2.028964017398181, "grad_norm": 1.328125, "learning_rate": 0.00045910499044567865, "loss": 5.1748, "mean_token_accuracy": 0.19138241559267044, "num_tokens": 47010841.0, "step": 20525 }, { "entropy": 5.507014369964599, "epoch": 2.0294582839066826, "grad_norm": 1.3203125, "learning_rate": 0.0004590847010112303, "loss": 5.1287, "mean_token_accuracy": 0.1996312364935875, "num_tokens": 47023131.0, "step": 20530 }, { "entropy": 5.610878610610962, "epoch": 2.029952550415184, "grad_norm": 1.21875, "learning_rate": 0.00045906440704826973, "loss": 5.2343, "mean_token_accuracy": 0.19512814581394194, "num_tokens": 47034363.0, "step": 20535 }, { "entropy": 5.517018508911133, "epoch": 2.030446816923685, "grad_norm": 1.25, "learning_rate": 0.0004590441085572962, "loss": 5.1967, "mean_token_accuracy": 0.19620057344436645, "num_tokens": 47045584.0, "step": 20540 }, { "entropy": 5.522439098358154, "epoch": 2.030941083432187, "grad_norm": 1.2421875, "learning_rate": 0.00045902380553880913, "loss": 5.1675, "mean_token_accuracy": 0.19280802607536315, "num_tokens": 47056245.0, "step": 20545 }, { "entropy": 5.5482017517089846, "epoch": 2.031435349940688, "grad_norm": 1.1015625, "learning_rate": 0.0004590034979933078, "loss": 5.1058, "mean_token_accuracy": 0.19932733327150345, "num_tokens": 47067856.0, "step": 20550 }, { "entropy": 5.501329565048218, "epoch": 2.0319296164491893, "grad_norm": 1.234375, "learning_rate": 0.00045898318592129197, "loss": 5.1196, "mean_token_accuracy": 0.20489915013313292, "num_tokens": 47079316.0, "step": 20555 }, { "entropy": 5.523725509643555, "epoch": 2.0324238829576906, "grad_norm": 1.140625, "learning_rate": 0.00045896286932326115, "loss": 5.1895, "mean_token_accuracy": 0.18756190985441207, "num_tokens": 47090268.0, "step": 20560 }, { "entropy": 5.562956619262695, "epoch": 2.0329181494661923, "grad_norm": 1.1796875, "learning_rate": 0.0004589425481997152, "loss": 5.1572, "mean_token_accuracy": 0.20081699192523955, "num_tokens": 47100980.0, "step": 20565 }, { "entropy": 5.557186031341553, "epoch": 2.0334124159746936, "grad_norm": 1.15625, "learning_rate": 0.000458922222551154, "loss": 5.1091, "mean_token_accuracy": 0.19957223981618882, "num_tokens": 47112548.0, "step": 20570 }, { "entropy": 5.478365278244018, "epoch": 2.033906682483195, "grad_norm": 1.2421875, "learning_rate": 0.0004589018923780777, "loss": 5.2108, "mean_token_accuracy": 0.1920792877674103, "num_tokens": 47123378.0, "step": 20575 }, { "entropy": 5.525159454345703, "epoch": 2.0344009489916965, "grad_norm": 1.2421875, "learning_rate": 0.0004588815576809862, "loss": 5.2262, "mean_token_accuracy": 0.1833912506699562, "num_tokens": 47135279.0, "step": 20580 }, { "entropy": 5.644260263442993, "epoch": 2.034895215500198, "grad_norm": 1.2421875, "learning_rate": 0.00045886121846037996, "loss": 5.2084, "mean_token_accuracy": 0.1981610283255577, "num_tokens": 47146510.0, "step": 20585 }, { "entropy": 5.547625494003296, "epoch": 2.035389482008699, "grad_norm": 1.34375, "learning_rate": 0.00045884087471675917, "loss": 5.1133, "mean_token_accuracy": 0.20044450461864471, "num_tokens": 47158275.0, "step": 20590 }, { "entropy": 5.53369140625, "epoch": 2.0358837485172003, "grad_norm": 1.359375, "learning_rate": 0.00045882052645062433, "loss": 5.2101, "mean_token_accuracy": 0.19684501737356186, "num_tokens": 47170530.0, "step": 20595 }, { "entropy": 5.548107528686524, "epoch": 2.036378015025702, "grad_norm": 1.2578125, "learning_rate": 0.000458800173662476, "loss": 5.1824, "mean_token_accuracy": 0.19195338934659958, "num_tokens": 47182092.0, "step": 20600 }, { "entropy": 5.622240734100342, "epoch": 2.0368722815342033, "grad_norm": 1.171875, "learning_rate": 0.00045877981635281497, "loss": 5.2062, "mean_token_accuracy": 0.19466145038604737, "num_tokens": 47193184.0, "step": 20605 }, { "entropy": 5.564381074905396, "epoch": 2.0373665480427046, "grad_norm": 1.328125, "learning_rate": 0.00045875945452214186, "loss": 5.1809, "mean_token_accuracy": 0.19054548889398576, "num_tokens": 47205032.0, "step": 20610 }, { "entropy": 5.592906761169433, "epoch": 2.037860814551206, "grad_norm": 1.2890625, "learning_rate": 0.00045873908817095773, "loss": 5.2117, "mean_token_accuracy": 0.19142548888921737, "num_tokens": 47217553.0, "step": 20615 }, { "entropy": 5.5924633026123045, "epoch": 2.0383550810597075, "grad_norm": 1.1875, "learning_rate": 0.0004587187172997635, "loss": 5.2373, "mean_token_accuracy": 0.19821246713399887, "num_tokens": 47230625.0, "step": 20620 }, { "entropy": 5.548401880264282, "epoch": 2.038849347568209, "grad_norm": 1.1328125, "learning_rate": 0.0004586983419090603, "loss": 5.1422, "mean_token_accuracy": 0.19793572276830673, "num_tokens": 47240703.0, "step": 20625 }, { "entropy": 5.488960695266724, "epoch": 2.03934361407671, "grad_norm": 1.1953125, "learning_rate": 0.00045867796199934943, "loss": 5.1519, "mean_token_accuracy": 0.20213185101747513, "num_tokens": 47253768.0, "step": 20630 }, { "entropy": 5.562997913360595, "epoch": 2.0398378805852118, "grad_norm": 1.265625, "learning_rate": 0.0004586575775711322, "loss": 5.121, "mean_token_accuracy": 0.1955211952328682, "num_tokens": 47264226.0, "step": 20635 }, { "entropy": 5.52231068611145, "epoch": 2.040332147093713, "grad_norm": 1.3984375, "learning_rate": 0.00045863718862491, "loss": 5.1961, "mean_token_accuracy": 0.19778646826744078, "num_tokens": 47276675.0, "step": 20640 }, { "entropy": 5.5680882930755615, "epoch": 2.0408264136022143, "grad_norm": 1.2734375, "learning_rate": 0.00045861679516118447, "loss": 5.2459, "mean_token_accuracy": 0.196078522503376, "num_tokens": 47288876.0, "step": 20645 }, { "entropy": 5.520850419998169, "epoch": 2.0413206801107155, "grad_norm": 1.2734375, "learning_rate": 0.0004585963971804574, "loss": 5.1428, "mean_token_accuracy": 0.19315340667963027, "num_tokens": 47300430.0, "step": 20650 }, { "entropy": 5.547067546844483, "epoch": 2.0418149466192173, "grad_norm": 1.3046875, "learning_rate": 0.0004585759946832304, "loss": 5.2118, "mean_token_accuracy": 0.1966462329030037, "num_tokens": 47310822.0, "step": 20655 }, { "entropy": 5.550311708450318, "epoch": 2.0423092131277185, "grad_norm": 1.21875, "learning_rate": 0.00045855558767000546, "loss": 5.2195, "mean_token_accuracy": 0.19339940696954727, "num_tokens": 47323042.0, "step": 20660 }, { "entropy": 5.514761114120484, "epoch": 2.0428034796362198, "grad_norm": 1.1640625, "learning_rate": 0.0004585351761412846, "loss": 5.1702, "mean_token_accuracy": 0.19792895317077636, "num_tokens": 47334003.0, "step": 20665 }, { "entropy": 5.52094874382019, "epoch": 2.043297746144721, "grad_norm": 1.2265625, "learning_rate": 0.0004585147600975699, "loss": 5.1514, "mean_token_accuracy": 0.19315087348222731, "num_tokens": 47346279.0, "step": 20670 }, { "entropy": 5.529201078414917, "epoch": 2.0437920126532227, "grad_norm": 1.2578125, "learning_rate": 0.0004584943395393637, "loss": 5.1287, "mean_token_accuracy": 0.194491945207119, "num_tokens": 47357655.0, "step": 20675 }, { "entropy": 5.515044546127319, "epoch": 2.044286279161724, "grad_norm": 1.203125, "learning_rate": 0.00045847391446716826, "loss": 5.1513, "mean_token_accuracy": 0.1985543340444565, "num_tokens": 47369494.0, "step": 20680 }, { "entropy": 5.522799348831176, "epoch": 2.0447805456702253, "grad_norm": 1.2109375, "learning_rate": 0.000458453484881486, "loss": 5.1918, "mean_token_accuracy": 0.1998739868402481, "num_tokens": 47380221.0, "step": 20685 }, { "entropy": 5.486823892593383, "epoch": 2.045274812178727, "grad_norm": 1.1953125, "learning_rate": 0.0004584330507828196, "loss": 5.0958, "mean_token_accuracy": 0.20503304153680801, "num_tokens": 47391119.0, "step": 20690 }, { "entropy": 5.584002876281739, "epoch": 2.0457690786872282, "grad_norm": 1.1484375, "learning_rate": 0.0004584126121716717, "loss": 5.1464, "mean_token_accuracy": 0.19933037757873534, "num_tokens": 47401828.0, "step": 20695 }, { "entropy": 5.4566038131713865, "epoch": 2.0462633451957295, "grad_norm": 1.15625, "learning_rate": 0.0004583921690485451, "loss": 5.1275, "mean_token_accuracy": 0.20225608050823213, "num_tokens": 47412921.0, "step": 20700 }, { "entropy": 5.541837072372436, "epoch": 2.0467576117042308, "grad_norm": 1.046875, "learning_rate": 0.0004583717214139427, "loss": 5.1991, "mean_token_accuracy": 0.19362544715404512, "num_tokens": 47424117.0, "step": 20705 }, { "entropy": 5.525685119628906, "epoch": 2.0472518782127325, "grad_norm": 1.1328125, "learning_rate": 0.00045835126926836744, "loss": 5.1639, "mean_token_accuracy": 0.19853021949529648, "num_tokens": 47434457.0, "step": 20710 }, { "entropy": 5.573009252548218, "epoch": 2.0477461447212337, "grad_norm": 1.1328125, "learning_rate": 0.0004583308126123225, "loss": 5.2282, "mean_token_accuracy": 0.19634588658809662, "num_tokens": 47446108.0, "step": 20715 }, { "entropy": 5.535366010665894, "epoch": 2.048240411229735, "grad_norm": 1.4453125, "learning_rate": 0.00045831035144631115, "loss": 5.0795, "mean_token_accuracy": 0.20150321274995803, "num_tokens": 47458735.0, "step": 20720 }, { "entropy": 5.6063214302062985, "epoch": 2.0487346777382363, "grad_norm": 1.109375, "learning_rate": 0.00045828988577083674, "loss": 5.1917, "mean_token_accuracy": 0.1986448734998703, "num_tokens": 47471726.0, "step": 20725 }, { "entropy": 5.6269289493560795, "epoch": 2.049228944246738, "grad_norm": 1.2421875, "learning_rate": 0.0004582694155864027, "loss": 5.2066, "mean_token_accuracy": 0.18992726504802704, "num_tokens": 47483940.0, "step": 20730 }, { "entropy": 5.440764141082764, "epoch": 2.0497232107552392, "grad_norm": 1.2265625, "learning_rate": 0.00045824894089351265, "loss": 5.1249, "mean_token_accuracy": 0.19728759974241256, "num_tokens": 47494723.0, "step": 20735 }, { "entropy": 5.498567533493042, "epoch": 2.0502174772637405, "grad_norm": 1.2734375, "learning_rate": 0.0004582284616926702, "loss": 5.2001, "mean_token_accuracy": 0.19118748903274535, "num_tokens": 47506454.0, "step": 20740 }, { "entropy": 5.593333148956299, "epoch": 2.050711743772242, "grad_norm": 1.25, "learning_rate": 0.0004582079779843791, "loss": 5.2849, "mean_token_accuracy": 0.19144766479730607, "num_tokens": 47518366.0, "step": 20745 }, { "entropy": 5.528135585784912, "epoch": 2.0512060102807435, "grad_norm": 1.3125, "learning_rate": 0.0004581874897691434, "loss": 5.1853, "mean_token_accuracy": 0.19747180342674256, "num_tokens": 47530635.0, "step": 20750 }, { "entropy": 5.552562522888183, "epoch": 2.0517002767892447, "grad_norm": 1.2890625, "learning_rate": 0.000458166997047467, "loss": 5.2601, "mean_token_accuracy": 0.1970040410757065, "num_tokens": 47541158.0, "step": 20755 }, { "entropy": 5.568430948257446, "epoch": 2.052194543297746, "grad_norm": 1.140625, "learning_rate": 0.00045814649981985406, "loss": 5.1902, "mean_token_accuracy": 0.19020578265190125, "num_tokens": 47552392.0, "step": 20760 }, { "entropy": 5.6111804962158205, "epoch": 2.0526888098062477, "grad_norm": 1.1328125, "learning_rate": 0.0004581259980868088, "loss": 5.1998, "mean_token_accuracy": 0.1971875935792923, "num_tokens": 47565079.0, "step": 20765 }, { "entropy": 5.603356218338012, "epoch": 2.053183076314749, "grad_norm": 1.1328125, "learning_rate": 0.0004581054918488356, "loss": 5.1926, "mean_token_accuracy": 0.19807939678430558, "num_tokens": 47575529.0, "step": 20770 }, { "entropy": 5.448172855377197, "epoch": 2.05367734282325, "grad_norm": 1.2265625, "learning_rate": 0.00045808498110643886, "loss": 5.1086, "mean_token_accuracy": 0.19796554148197174, "num_tokens": 47587289.0, "step": 20775 }, { "entropy": 5.528416347503662, "epoch": 2.0541716093317515, "grad_norm": 1.1015625, "learning_rate": 0.00045806446586012326, "loss": 5.1598, "mean_token_accuracy": 0.19505753070116044, "num_tokens": 47599184.0, "step": 20780 }, { "entropy": 5.486471366882324, "epoch": 2.054665875840253, "grad_norm": 1.3046875, "learning_rate": 0.0004580439461103933, "loss": 5.0424, "mean_token_accuracy": 0.21222029477357865, "num_tokens": 47609651.0, "step": 20785 }, { "entropy": 5.578895950317383, "epoch": 2.0551601423487544, "grad_norm": 1.2890625, "learning_rate": 0.0004580234218577539, "loss": 5.1866, "mean_token_accuracy": 0.19902318716049194, "num_tokens": 47621138.0, "step": 20790 }, { "entropy": 5.498895883560181, "epoch": 2.0556544088572557, "grad_norm": 1.4921875, "learning_rate": 0.00045800289310270995, "loss": 5.1802, "mean_token_accuracy": 0.20277549773454667, "num_tokens": 47631492.0, "step": 20795 }, { "entropy": 5.482671165466309, "epoch": 2.0561486753657574, "grad_norm": 1.1796875, "learning_rate": 0.0004579823598457664, "loss": 5.1431, "mean_token_accuracy": 0.20404961258172988, "num_tokens": 47643088.0, "step": 20800 }, { "entropy": 5.46958212852478, "epoch": 2.0566429418742587, "grad_norm": 1.1640625, "learning_rate": 0.00045796182208742846, "loss": 5.0631, "mean_token_accuracy": 0.21121376156806945, "num_tokens": 47653393.0, "step": 20805 }, { "entropy": 5.496805810928345, "epoch": 2.05713720838276, "grad_norm": 1.15625, "learning_rate": 0.0004579412798282013, "loss": 5.1553, "mean_token_accuracy": 0.20107391625642776, "num_tokens": 47665879.0, "step": 20810 }, { "entropy": 5.4519476890563965, "epoch": 2.057631474891261, "grad_norm": 1.28125, "learning_rate": 0.0004579207330685902, "loss": 5.1289, "mean_token_accuracy": 0.20296097844839095, "num_tokens": 47678339.0, "step": 20815 }, { "entropy": 5.5129491806030275, "epoch": 2.058125741399763, "grad_norm": 1.171875, "learning_rate": 0.0004579001818091009, "loss": 5.1721, "mean_token_accuracy": 0.20384158790111542, "num_tokens": 47688867.0, "step": 20820 }, { "entropy": 5.554760456085205, "epoch": 2.058620007908264, "grad_norm": 1.1328125, "learning_rate": 0.0004578796260502385, "loss": 5.2394, "mean_token_accuracy": 0.19736232608556747, "num_tokens": 47700265.0, "step": 20825 }, { "entropy": 5.603539848327637, "epoch": 2.0591142744167654, "grad_norm": 1.203125, "learning_rate": 0.0004578590657925091, "loss": 5.2519, "mean_token_accuracy": 0.189376100897789, "num_tokens": 47711539.0, "step": 20830 }, { "entropy": 5.581753444671631, "epoch": 2.059608540925267, "grad_norm": 1.1640625, "learning_rate": 0.0004578385010364182, "loss": 5.1808, "mean_token_accuracy": 0.19475315660238265, "num_tokens": 47722433.0, "step": 20835 }, { "entropy": 5.476624965667725, "epoch": 2.0601028074337684, "grad_norm": 1.1640625, "learning_rate": 0.00045781793178247194, "loss": 5.1377, "mean_token_accuracy": 0.20019441992044448, "num_tokens": 47734001.0, "step": 20840 }, { "entropy": 5.4575958251953125, "epoch": 2.0605970739422697, "grad_norm": 1.1640625, "learning_rate": 0.0004577973580311761, "loss": 5.1112, "mean_token_accuracy": 0.20995286405086516, "num_tokens": 47744903.0, "step": 20845 }, { "entropy": 5.600017356872558, "epoch": 2.061091340450771, "grad_norm": 1.328125, "learning_rate": 0.0004577767797830369, "loss": 5.1671, "mean_token_accuracy": 0.20072797536849976, "num_tokens": 47756571.0, "step": 20850 }, { "entropy": 5.510620641708374, "epoch": 2.0615856069592726, "grad_norm": 1.40625, "learning_rate": 0.00045775619703856057, "loss": 5.1228, "mean_token_accuracy": 0.19831173568964006, "num_tokens": 47767555.0, "step": 20855 }, { "entropy": 5.638478469848633, "epoch": 2.062079873467774, "grad_norm": 1.2265625, "learning_rate": 0.00045773560979825347, "loss": 5.2054, "mean_token_accuracy": 0.20082833915948867, "num_tokens": 47779577.0, "step": 20860 }, { "entropy": 5.547027683258056, "epoch": 2.062574139976275, "grad_norm": 1.2265625, "learning_rate": 0.00045771501806262196, "loss": 5.2093, "mean_token_accuracy": 0.19598483443260192, "num_tokens": 47790898.0, "step": 20865 }, { "entropy": 5.53073558807373, "epoch": 2.0630684064847764, "grad_norm": 1.203125, "learning_rate": 0.00045769442183217273, "loss": 5.1745, "mean_token_accuracy": 0.20367027819156647, "num_tokens": 47802008.0, "step": 20870 }, { "entropy": 5.51125922203064, "epoch": 2.063562672993278, "grad_norm": 1.171875, "learning_rate": 0.0004576738211074123, "loss": 5.136, "mean_token_accuracy": 0.20050776302814483, "num_tokens": 47813544.0, "step": 20875 }, { "entropy": 5.562144756317139, "epoch": 2.0640569395017794, "grad_norm": 1.2890625, "learning_rate": 0.0004576532158888476, "loss": 5.1843, "mean_token_accuracy": 0.19587933123111725, "num_tokens": 47824313.0, "step": 20880 }, { "entropy": 5.615613603591919, "epoch": 2.0645512060102806, "grad_norm": 1.15625, "learning_rate": 0.0004576326061769854, "loss": 5.1574, "mean_token_accuracy": 0.19965433776378633, "num_tokens": 47836653.0, "step": 20885 }, { "entropy": 5.561070680618286, "epoch": 2.065045472518782, "grad_norm": 1.328125, "learning_rate": 0.00045761199197233285, "loss": 5.2082, "mean_token_accuracy": 0.1971917361021042, "num_tokens": 47848237.0, "step": 20890 }, { "entropy": 5.4977771759033205, "epoch": 2.0655397390272836, "grad_norm": 1.109375, "learning_rate": 0.00045759137327539684, "loss": 5.2041, "mean_token_accuracy": 0.19317791163921355, "num_tokens": 47859686.0, "step": 20895 }, { "entropy": 5.480271291732788, "epoch": 2.066034005535785, "grad_norm": 1.1015625, "learning_rate": 0.0004575707500866848, "loss": 5.1205, "mean_token_accuracy": 0.19809692353010178, "num_tokens": 47871730.0, "step": 20900 }, { "entropy": 5.616372728347779, "epoch": 2.066528272044286, "grad_norm": 1.140625, "learning_rate": 0.00045755012240670395, "loss": 5.2169, "mean_token_accuracy": 0.1914566159248352, "num_tokens": 47883927.0, "step": 20905 }, { "entropy": 5.5164111137390135, "epoch": 2.067022538552788, "grad_norm": 1.1953125, "learning_rate": 0.0004575294902359618, "loss": 5.0331, "mean_token_accuracy": 0.20936899483203888, "num_tokens": 47894885.0, "step": 20910 }, { "entropy": 5.583211851119995, "epoch": 2.067516805061289, "grad_norm": 1.3984375, "learning_rate": 0.00045750885357496583, "loss": 5.213, "mean_token_accuracy": 0.1913083329796791, "num_tokens": 47906183.0, "step": 20915 }, { "entropy": 5.467278957366943, "epoch": 2.0680110715697904, "grad_norm": 1.1796875, "learning_rate": 0.0004574882124242238, "loss": 5.1751, "mean_token_accuracy": 0.19382926523685456, "num_tokens": 47918002.0, "step": 20920 }, { "entropy": 5.4840000629425045, "epoch": 2.0685053380782916, "grad_norm": 1.1484375, "learning_rate": 0.00045746756678424343, "loss": 5.0848, "mean_token_accuracy": 0.20050887763500214, "num_tokens": 47928300.0, "step": 20925 }, { "entropy": 5.485995578765869, "epoch": 2.0689996045867933, "grad_norm": 1.09375, "learning_rate": 0.00045744691665553254, "loss": 5.1043, "mean_token_accuracy": 0.20007977783679962, "num_tokens": 47939591.0, "step": 20930 }, { "entropy": 5.615813398361206, "epoch": 2.0694938710952946, "grad_norm": 1.1015625, "learning_rate": 0.0004574262620385993, "loss": 5.2231, "mean_token_accuracy": 0.19402552247047425, "num_tokens": 47953075.0, "step": 20935 }, { "entropy": 5.634069156646729, "epoch": 2.069988137603796, "grad_norm": 1.2265625, "learning_rate": 0.00045740560293395166, "loss": 5.262, "mean_token_accuracy": 0.18457178324460982, "num_tokens": 47964795.0, "step": 20940 }, { "entropy": 5.449629259109497, "epoch": 2.0704824041122976, "grad_norm": 1.1171875, "learning_rate": 0.0004573849393420979, "loss": 5.0673, "mean_token_accuracy": 0.21239512115716935, "num_tokens": 47975175.0, "step": 20945 }, { "entropy": 5.493186664581299, "epoch": 2.070976670620799, "grad_norm": 1.25, "learning_rate": 0.0004573642712635463, "loss": 5.2022, "mean_token_accuracy": 0.1958724305033684, "num_tokens": 47986548.0, "step": 20950 }, { "entropy": 5.572441673278808, "epoch": 2.0714709371293, "grad_norm": 1.3046875, "learning_rate": 0.00045734359869880535, "loss": 5.2584, "mean_token_accuracy": 0.18303977847099304, "num_tokens": 47998759.0, "step": 20955 }, { "entropy": 5.527265453338623, "epoch": 2.0719652036378013, "grad_norm": 1.2421875, "learning_rate": 0.0004573229216483836, "loss": 5.1349, "mean_token_accuracy": 0.2040463611483574, "num_tokens": 48010404.0, "step": 20960 }, { "entropy": 5.460834789276123, "epoch": 2.072459470146303, "grad_norm": 1.203125, "learning_rate": 0.0004573022401127897, "loss": 5.0665, "mean_token_accuracy": 0.20826467424631118, "num_tokens": 48019729.0, "step": 20965 }, { "entropy": 5.544267368316651, "epoch": 2.0729537366548043, "grad_norm": 1.1796875, "learning_rate": 0.00045728155409253236, "loss": 5.1807, "mean_token_accuracy": 0.19063322246074677, "num_tokens": 48031142.0, "step": 20970 }, { "entropy": 5.614737224578858, "epoch": 2.0734480031633056, "grad_norm": 1.1015625, "learning_rate": 0.0004572608635881206, "loss": 5.1588, "mean_token_accuracy": 0.20325768738985062, "num_tokens": 48043051.0, "step": 20975 }, { "entropy": 5.471118307113647, "epoch": 2.073942269671807, "grad_norm": 1.3359375, "learning_rate": 0.0004572401686000633, "loss": 5.125, "mean_token_accuracy": 0.20493268370628356, "num_tokens": 48053721.0, "step": 20980 }, { "entropy": 5.36272497177124, "epoch": 2.0744365361803085, "grad_norm": 1.2578125, "learning_rate": 0.00045721946912886957, "loss": 5.075, "mean_token_accuracy": 0.2090740829706192, "num_tokens": 48065208.0, "step": 20985 }, { "entropy": 5.587690639495849, "epoch": 2.07493080268881, "grad_norm": 1.1328125, "learning_rate": 0.0004571987651750486, "loss": 5.2475, "mean_token_accuracy": 0.19670464247465133, "num_tokens": 48076416.0, "step": 20990 }, { "entropy": 5.577077770233155, "epoch": 2.075425069197311, "grad_norm": 1.1953125, "learning_rate": 0.0004571780567391098, "loss": 5.1777, "mean_token_accuracy": 0.1944845661520958, "num_tokens": 48087496.0, "step": 20995 }, { "entropy": 5.57269434928894, "epoch": 2.0759193357058128, "grad_norm": 1.640625, "learning_rate": 0.00045715734382156245, "loss": 5.1941, "mean_token_accuracy": 0.19725523442029952, "num_tokens": 48098920.0, "step": 21000 }, { "epoch": 2.0759193357058128, "eval_entropy": 5.334154620117807, "eval_loss": 5.277682304382324, "eval_mean_token_accuracy": 0.19912817763922985, "eval_num_tokens": 48098920.0, "eval_runtime": 26.4824, "eval_samples_per_second": 1227.72, "eval_steps_per_second": 153.498, "step": 21000 }, { "entropy": 5.528890895843506, "epoch": 2.076413602214314, "grad_norm": 1.1875, "learning_rate": 0.0004571366264229162, "loss": 5.2237, "mean_token_accuracy": 0.19388963133096696, "num_tokens": 48109813.0, "step": 21005 }, { "entropy": 5.542822360992432, "epoch": 2.0769078687228153, "grad_norm": 1.296875, "learning_rate": 0.0004571159045436807, "loss": 5.1668, "mean_token_accuracy": 0.20029381662607193, "num_tokens": 48120736.0, "step": 21010 }, { "entropy": 5.488102293014526, "epoch": 2.0774021352313166, "grad_norm": 1.171875, "learning_rate": 0.0004570951781843657, "loss": 5.1165, "mean_token_accuracy": 0.20595585107803344, "num_tokens": 48131631.0, "step": 21015 }, { "entropy": 5.487272691726685, "epoch": 2.0778964017398183, "grad_norm": 1.203125, "learning_rate": 0.00045707444734548116, "loss": 5.0808, "mean_token_accuracy": 0.2042886048555374, "num_tokens": 48141662.0, "step": 21020 }, { "entropy": 5.462234830856323, "epoch": 2.0783906682483195, "grad_norm": 1.2265625, "learning_rate": 0.0004570537120275369, "loss": 5.1137, "mean_token_accuracy": 0.20591005831956863, "num_tokens": 48152752.0, "step": 21025 }, { "entropy": 5.545647811889649, "epoch": 2.078884934756821, "grad_norm": 1.1796875, "learning_rate": 0.000457032972231043, "loss": 5.1766, "mean_token_accuracy": 0.1942004829645157, "num_tokens": 48163510.0, "step": 21030 }, { "entropy": 5.47556881904602, "epoch": 2.079379201265322, "grad_norm": 1.234375, "learning_rate": 0.0004570122279565098, "loss": 5.2163, "mean_token_accuracy": 0.19330684691667557, "num_tokens": 48174241.0, "step": 21035 }, { "entropy": 5.593160629272461, "epoch": 2.0798734677738238, "grad_norm": 1.1796875, "learning_rate": 0.00045699147920444757, "loss": 5.2045, "mean_token_accuracy": 0.1897025316953659, "num_tokens": 48186062.0, "step": 21040 }, { "entropy": 5.538670587539673, "epoch": 2.080367734282325, "grad_norm": 1.296875, "learning_rate": 0.0004569707259753667, "loss": 5.0412, "mean_token_accuracy": 0.20270233154296874, "num_tokens": 48197108.0, "step": 21045 }, { "entropy": 5.416890430450439, "epoch": 2.0808620007908263, "grad_norm": 1.4609375, "learning_rate": 0.0004569499682697778, "loss": 5.0998, "mean_token_accuracy": 0.21021183729171752, "num_tokens": 48208780.0, "step": 21050 }, { "entropy": 5.519730567932129, "epoch": 2.081356267299328, "grad_norm": 1.1328125, "learning_rate": 0.0004569292060881914, "loss": 5.1655, "mean_token_accuracy": 0.1987949550151825, "num_tokens": 48223164.0, "step": 21055 }, { "entropy": 5.5092614650726315, "epoch": 2.0818505338078293, "grad_norm": 1.2578125, "learning_rate": 0.00045690843943111824, "loss": 5.0778, "mean_token_accuracy": 0.20350499004125594, "num_tokens": 48234402.0, "step": 21060 }, { "entropy": 5.522765254974365, "epoch": 2.0823448003163305, "grad_norm": 1.484375, "learning_rate": 0.00045688766829906936, "loss": 5.144, "mean_token_accuracy": 0.19374675452709197, "num_tokens": 48245147.0, "step": 21065 }, { "entropy": 5.593550968170166, "epoch": 2.0828390668248318, "grad_norm": 1.1484375, "learning_rate": 0.0004568668926925556, "loss": 5.2298, "mean_token_accuracy": 0.1885303184390068, "num_tokens": 48256787.0, "step": 21070 }, { "entropy": 5.507479572296143, "epoch": 2.0833333333333335, "grad_norm": 1.2890625, "learning_rate": 0.000456846112612088, "loss": 5.1447, "mean_token_accuracy": 0.19519422352313995, "num_tokens": 48267648.0, "step": 21075 }, { "entropy": 5.459123134613037, "epoch": 2.0838275998418347, "grad_norm": 1.21875, "learning_rate": 0.00045682532805817796, "loss": 5.1561, "mean_token_accuracy": 0.19162509292364122, "num_tokens": 48279274.0, "step": 21080 }, { "entropy": 5.553543186187744, "epoch": 2.084321866350336, "grad_norm": 1.1640625, "learning_rate": 0.0004568045390313365, "loss": 5.1676, "mean_token_accuracy": 0.1966897279024124, "num_tokens": 48290849.0, "step": 21085 }, { "entropy": 5.527925682067871, "epoch": 2.0848161328588377, "grad_norm": 1.1640625, "learning_rate": 0.00045678374553207525, "loss": 5.2091, "mean_token_accuracy": 0.1925302505493164, "num_tokens": 48301271.0, "step": 21090 }, { "entropy": 5.561384582519532, "epoch": 2.085310399367339, "grad_norm": 1.2578125, "learning_rate": 0.00045676294756090565, "loss": 5.1561, "mean_token_accuracy": 0.19214406460523606, "num_tokens": 48311869.0, "step": 21095 }, { "entropy": 5.5914044857025145, "epoch": 2.0858046658758402, "grad_norm": 1.1328125, "learning_rate": 0.0004567421451183393, "loss": 5.1962, "mean_token_accuracy": 0.20460759103298187, "num_tokens": 48324907.0, "step": 21100 }, { "entropy": 5.540077161788941, "epoch": 2.0862989323843415, "grad_norm": 1.265625, "learning_rate": 0.000456721338204888, "loss": 5.1115, "mean_token_accuracy": 0.2043887421488762, "num_tokens": 48335887.0, "step": 21105 }, { "entropy": 5.555528974533081, "epoch": 2.086793198892843, "grad_norm": 1.2109375, "learning_rate": 0.0004567005268210636, "loss": 5.1219, "mean_token_accuracy": 0.19903927594423293, "num_tokens": 48348190.0, "step": 21110 }, { "entropy": 5.5656030654907225, "epoch": 2.0872874654013445, "grad_norm": 1.4296875, "learning_rate": 0.00045667971096737805, "loss": 5.2903, "mean_token_accuracy": 0.18635109663009644, "num_tokens": 48360113.0, "step": 21115 }, { "entropy": 5.5635510921478275, "epoch": 2.0877817319098457, "grad_norm": 1.2109375, "learning_rate": 0.0004566588906443434, "loss": 5.2029, "mean_token_accuracy": 0.19759729951620103, "num_tokens": 48371463.0, "step": 21120 }, { "entropy": 5.600057697296142, "epoch": 2.088275998418347, "grad_norm": 1.2734375, "learning_rate": 0.0004566380658524719, "loss": 5.273, "mean_token_accuracy": 0.18369587808847426, "num_tokens": 48383969.0, "step": 21125 }, { "entropy": 5.518441915512085, "epoch": 2.0887702649268487, "grad_norm": 1.265625, "learning_rate": 0.0004566172365922758, "loss": 5.1087, "mean_token_accuracy": 0.20205163061618805, "num_tokens": 48395551.0, "step": 21130 }, { "entropy": 5.518635702133179, "epoch": 2.08926453143535, "grad_norm": 1.203125, "learning_rate": 0.0004565964028642675, "loss": 5.1333, "mean_token_accuracy": 0.20412324368953705, "num_tokens": 48408154.0, "step": 21135 }, { "entropy": 5.405503940582276, "epoch": 2.089758797943851, "grad_norm": 1.2265625, "learning_rate": 0.0004565755646689595, "loss": 5.1097, "mean_token_accuracy": 0.2058487504720688, "num_tokens": 48420060.0, "step": 21140 }, { "entropy": 5.508947467803955, "epoch": 2.0902530644523525, "grad_norm": 1.234375, "learning_rate": 0.0004565547220068644, "loss": 5.2114, "mean_token_accuracy": 0.19615855813026428, "num_tokens": 48432347.0, "step": 21145 }, { "entropy": 5.661038637161255, "epoch": 2.090747330960854, "grad_norm": 1.578125, "learning_rate": 0.0004565338748784951, "loss": 5.2518, "mean_token_accuracy": 0.18711526542901993, "num_tokens": 48443177.0, "step": 21150 }, { "entropy": 5.598845624923706, "epoch": 2.0912415974693555, "grad_norm": 1.265625, "learning_rate": 0.0004565130232843642, "loss": 5.1559, "mean_token_accuracy": 0.19312859177589417, "num_tokens": 48453605.0, "step": 21155 }, { "entropy": 5.565904569625855, "epoch": 2.0917358639778567, "grad_norm": 1.1796875, "learning_rate": 0.0004564921672249848, "loss": 5.1892, "mean_token_accuracy": 0.1960737019777298, "num_tokens": 48465364.0, "step": 21160 }, { "entropy": 5.4654029369354244, "epoch": 2.0922301304863584, "grad_norm": 1.234375, "learning_rate": 0.00045647130670086996, "loss": 5.1312, "mean_token_accuracy": 0.19819717556238176, "num_tokens": 48477255.0, "step": 21165 }, { "entropy": 5.50226058959961, "epoch": 2.0927243969948597, "grad_norm": 1.1796875, "learning_rate": 0.0004564504417125328, "loss": 5.1623, "mean_token_accuracy": 0.2010049507021904, "num_tokens": 48487551.0, "step": 21170 }, { "entropy": 5.627320575714111, "epoch": 2.093218663503361, "grad_norm": 1.2109375, "learning_rate": 0.00045642957226048667, "loss": 5.1579, "mean_token_accuracy": 0.19381139427423477, "num_tokens": 48500422.0, "step": 21175 }, { "entropy": 5.462879276275634, "epoch": 2.093712930011862, "grad_norm": 1.1796875, "learning_rate": 0.00045640869834524486, "loss": 5.1188, "mean_token_accuracy": 0.2099028706550598, "num_tokens": 48511588.0, "step": 21180 }, { "entropy": 5.531794500350952, "epoch": 2.094207196520364, "grad_norm": 1.2109375, "learning_rate": 0.0004563878199673209, "loss": 5.2162, "mean_token_accuracy": 0.19897359758615493, "num_tokens": 48522700.0, "step": 21185 }, { "entropy": 5.625210285186768, "epoch": 2.094701463028865, "grad_norm": 1.25, "learning_rate": 0.0004563669371272285, "loss": 5.2277, "mean_token_accuracy": 0.19862253963947296, "num_tokens": 48534253.0, "step": 21190 }, { "entropy": 5.48061785697937, "epoch": 2.0951957295373664, "grad_norm": 1.2578125, "learning_rate": 0.00045634604982548125, "loss": 5.1177, "mean_token_accuracy": 0.20375279784202577, "num_tokens": 48545543.0, "step": 21195 }, { "entropy": 5.540404462814331, "epoch": 2.095689996045868, "grad_norm": 1.171875, "learning_rate": 0.00045632515806259306, "loss": 5.2148, "mean_token_accuracy": 0.19447827488183975, "num_tokens": 48557433.0, "step": 21200 }, { "entropy": 5.576367807388306, "epoch": 2.0961842625543694, "grad_norm": 1.234375, "learning_rate": 0.00045630426183907786, "loss": 5.1964, "mean_token_accuracy": 0.19374802708625793, "num_tokens": 48570271.0, "step": 21205 }, { "entropy": 5.52334189414978, "epoch": 2.0966785290628707, "grad_norm": 1.203125, "learning_rate": 0.0004562833611554497, "loss": 5.1462, "mean_token_accuracy": 0.19547879993915557, "num_tokens": 48582376.0, "step": 21210 }, { "entropy": 5.539679431915284, "epoch": 2.097172795571372, "grad_norm": 1.2109375, "learning_rate": 0.0004562624560122227, "loss": 5.1931, "mean_token_accuracy": 0.1963004246354103, "num_tokens": 48595188.0, "step": 21215 }, { "entropy": 5.515546417236328, "epoch": 2.0976670620798736, "grad_norm": 1.2578125, "learning_rate": 0.0004562415464099112, "loss": 5.0824, "mean_token_accuracy": 0.19943149089813234, "num_tokens": 48606093.0, "step": 21220 }, { "entropy": 5.574150323867798, "epoch": 2.098161328588375, "grad_norm": 1.4140625, "learning_rate": 0.0004562206323490295, "loss": 5.2353, "mean_token_accuracy": 0.19594648480415344, "num_tokens": 48618163.0, "step": 21225 }, { "entropy": 5.5406811237335205, "epoch": 2.098655595096876, "grad_norm": 1.3125, "learning_rate": 0.00045619971383009216, "loss": 5.2012, "mean_token_accuracy": 0.1962972328066826, "num_tokens": 48629771.0, "step": 21230 }, { "entropy": 5.521897411346435, "epoch": 2.0991498616053774, "grad_norm": 1.5, "learning_rate": 0.0004561787908536138, "loss": 5.1483, "mean_token_accuracy": 0.19210223257541656, "num_tokens": 48640409.0, "step": 21235 }, { "entropy": 5.489107227325439, "epoch": 2.099644128113879, "grad_norm": 1.171875, "learning_rate": 0.00045615786342010896, "loss": 5.1487, "mean_token_accuracy": 0.201000614464283, "num_tokens": 48652223.0, "step": 21240 }, { "entropy": 5.554998111724854, "epoch": 2.1001383946223804, "grad_norm": 1.3125, "learning_rate": 0.00045613693153009264, "loss": 5.0645, "mean_token_accuracy": 0.20431340783834456, "num_tokens": 48663667.0, "step": 21245 }, { "entropy": 5.550862169265747, "epoch": 2.1006326611308817, "grad_norm": 1.265625, "learning_rate": 0.0004561159951840797, "loss": 5.2162, "mean_token_accuracy": 0.19332771003246307, "num_tokens": 48674691.0, "step": 21250 }, { "entropy": 5.48462553024292, "epoch": 2.1011269276393834, "grad_norm": 1.28125, "learning_rate": 0.0004560950543825852, "loss": 5.1772, "mean_token_accuracy": 0.19521435499191284, "num_tokens": 48686888.0, "step": 21255 }, { "entropy": 5.511814212799072, "epoch": 2.1016211941478846, "grad_norm": 1.234375, "learning_rate": 0.00045607410912612426, "loss": 5.1689, "mean_token_accuracy": 0.19298310875892638, "num_tokens": 48698666.0, "step": 21260 }, { "entropy": 5.543023920059204, "epoch": 2.102115460656386, "grad_norm": 1.2734375, "learning_rate": 0.0004560531594152121, "loss": 5.1103, "mean_token_accuracy": 0.20415060371160507, "num_tokens": 48709793.0, "step": 21265 }, { "entropy": 5.403988075256348, "epoch": 2.102609727164887, "grad_norm": 1.3203125, "learning_rate": 0.0004560322052503642, "loss": 5.0596, "mean_token_accuracy": 0.20458496809005738, "num_tokens": 48720835.0, "step": 21270 }, { "entropy": 5.615757846832276, "epoch": 2.103103993673389, "grad_norm": 1.2578125, "learning_rate": 0.0004560112466320959, "loss": 5.3145, "mean_token_accuracy": 0.18941870033740998, "num_tokens": 48732990.0, "step": 21275 }, { "entropy": 5.553078365325928, "epoch": 2.10359826018189, "grad_norm": 1.234375, "learning_rate": 0.00045599028356092293, "loss": 5.1296, "mean_token_accuracy": 0.1998555451631546, "num_tokens": 48744985.0, "step": 21280 }, { "entropy": 5.417953014373779, "epoch": 2.1040925266903914, "grad_norm": 1.4140625, "learning_rate": 0.0004559693160373608, "loss": 5.0637, "mean_token_accuracy": 0.21073752343654634, "num_tokens": 48755328.0, "step": 21285 }, { "entropy": 5.461286020278931, "epoch": 2.1045867931988926, "grad_norm": 1.28125, "learning_rate": 0.0004559483440619255, "loss": 5.1214, "mean_token_accuracy": 0.20690563172101975, "num_tokens": 48766666.0, "step": 21290 }, { "entropy": 5.61240701675415, "epoch": 2.1050810597073943, "grad_norm": 1.21875, "learning_rate": 0.00045592736763513285, "loss": 5.1694, "mean_token_accuracy": 0.1963336333632469, "num_tokens": 48779134.0, "step": 21295 }, { "entropy": 5.584633636474609, "epoch": 2.1055753262158956, "grad_norm": 1.0625, "learning_rate": 0.0004559063867574989, "loss": 5.2133, "mean_token_accuracy": 0.18171284943819047, "num_tokens": 48791338.0, "step": 21300 }, { "entropy": 5.505694770812989, "epoch": 2.106069592724397, "grad_norm": 1.265625, "learning_rate": 0.00045588540142953973, "loss": 5.105, "mean_token_accuracy": 0.20337445735931398, "num_tokens": 48802711.0, "step": 21305 }, { "entropy": 5.468663024902344, "epoch": 2.1065638592328986, "grad_norm": 1.234375, "learning_rate": 0.0004558644116517717, "loss": 5.1363, "mean_token_accuracy": 0.20200977474451065, "num_tokens": 48815219.0, "step": 21310 }, { "entropy": 5.475671195983887, "epoch": 2.1070581257414, "grad_norm": 1.15625, "learning_rate": 0.00045584341742471095, "loss": 5.1588, "mean_token_accuracy": 0.19961438477039337, "num_tokens": 48826075.0, "step": 21315 }, { "entropy": 5.483574295043946, "epoch": 2.107552392249901, "grad_norm": 1.171875, "learning_rate": 0.0004558224187488742, "loss": 5.0535, "mean_token_accuracy": 0.19951361119747163, "num_tokens": 48837375.0, "step": 21320 }, { "entropy": 5.543083572387696, "epoch": 2.1080466587584024, "grad_norm": 1.125, "learning_rate": 0.00045580141562477785, "loss": 5.1814, "mean_token_accuracy": 0.1939372792840004, "num_tokens": 48849205.0, "step": 21325 }, { "entropy": 5.492909240722656, "epoch": 2.108540925266904, "grad_norm": 1.1875, "learning_rate": 0.00045578040805293864, "loss": 5.1621, "mean_token_accuracy": 0.19909158498048782, "num_tokens": 48861700.0, "step": 21330 }, { "entropy": 5.553277444839478, "epoch": 2.1090351917754053, "grad_norm": 1.1328125, "learning_rate": 0.00045575939603387336, "loss": 5.2921, "mean_token_accuracy": 0.18944236338138581, "num_tokens": 48873510.0, "step": 21335 }, { "entropy": 5.598937034606934, "epoch": 2.1095294582839066, "grad_norm": 1.234375, "learning_rate": 0.0004557383795680988, "loss": 5.1557, "mean_token_accuracy": 0.19448843598365784, "num_tokens": 48885011.0, "step": 21340 }, { "entropy": 5.522098970413208, "epoch": 2.1100237247924083, "grad_norm": 1.1328125, "learning_rate": 0.00045571735865613215, "loss": 5.1191, "mean_token_accuracy": 0.1973096564412117, "num_tokens": 48895767.0, "step": 21345 }, { "entropy": 5.533459138870239, "epoch": 2.1105179913009096, "grad_norm": 1.0546875, "learning_rate": 0.00045569633329849043, "loss": 5.2381, "mean_token_accuracy": 0.18424018770456313, "num_tokens": 48906616.0, "step": 21350 }, { "entropy": 5.543784523010254, "epoch": 2.111012257809411, "grad_norm": 1.15625, "learning_rate": 0.0004556753034956909, "loss": 5.167, "mean_token_accuracy": 0.19859943240880967, "num_tokens": 48916841.0, "step": 21355 }, { "entropy": 5.471170711517334, "epoch": 2.111506524317912, "grad_norm": 1.3203125, "learning_rate": 0.0004556542692482508, "loss": 5.1391, "mean_token_accuracy": 0.20517609566450118, "num_tokens": 48928798.0, "step": 21360 }, { "entropy": 5.477427244186401, "epoch": 2.112000790826414, "grad_norm": 1.0859375, "learning_rate": 0.0004556332305566877, "loss": 5.1247, "mean_token_accuracy": 0.20221721082925798, "num_tokens": 48940235.0, "step": 21365 }, { "entropy": 5.527065801620483, "epoch": 2.112495057334915, "grad_norm": 1.109375, "learning_rate": 0.0004556121874215191, "loss": 5.1281, "mean_token_accuracy": 0.20175862610340117, "num_tokens": 48951718.0, "step": 21370 }, { "entropy": 5.51894588470459, "epoch": 2.1129893238434163, "grad_norm": 1.25, "learning_rate": 0.0004555911398432627, "loss": 5.1193, "mean_token_accuracy": 0.2022763729095459, "num_tokens": 48963215.0, "step": 21375 }, { "entropy": 5.568140697479248, "epoch": 2.1134835903519176, "grad_norm": 1.03125, "learning_rate": 0.00045557008782243626, "loss": 5.2373, "mean_token_accuracy": 0.19304773956537247, "num_tokens": 48975761.0, "step": 21380 }, { "entropy": 5.500147342681885, "epoch": 2.1139778568604193, "grad_norm": 1.0859375, "learning_rate": 0.0004555490313595575, "loss": 5.1233, "mean_token_accuracy": 0.20306147038936614, "num_tokens": 48987192.0, "step": 21385 }, { "entropy": 5.4811516284942625, "epoch": 2.1144721233689205, "grad_norm": 1.1015625, "learning_rate": 0.0004555279704551447, "loss": 5.0893, "mean_token_accuracy": 0.20535937547683716, "num_tokens": 48999503.0, "step": 21390 }, { "entropy": 5.536003065109253, "epoch": 2.114966389877422, "grad_norm": 1.078125, "learning_rate": 0.0004555069051097158, "loss": 5.1674, "mean_token_accuracy": 0.1897236704826355, "num_tokens": 49010046.0, "step": 21395 }, { "entropy": 5.497274017333984, "epoch": 2.115460656385923, "grad_norm": 1.2265625, "learning_rate": 0.00045548583532378903, "loss": 5.1516, "mean_token_accuracy": 0.20265138447284697, "num_tokens": 49021028.0, "step": 21400 }, { "entropy": 5.572155714035034, "epoch": 2.1159549228944248, "grad_norm": 1.1953125, "learning_rate": 0.0004554647610978827, "loss": 5.267, "mean_token_accuracy": 0.19370944499969484, "num_tokens": 49034522.0, "step": 21405 }, { "entropy": 5.5810693264007565, "epoch": 2.116449189402926, "grad_norm": 1.1328125, "learning_rate": 0.0004554436824325152, "loss": 5.2047, "mean_token_accuracy": 0.19548682868480682, "num_tokens": 49045034.0, "step": 21410 }, { "entropy": 5.458191728591919, "epoch": 2.1169434559114273, "grad_norm": 1.1484375, "learning_rate": 0.00045542259932820515, "loss": 5.1583, "mean_token_accuracy": 0.19981651604175568, "num_tokens": 49056350.0, "step": 21415 }, { "entropy": 5.576247358322144, "epoch": 2.117437722419929, "grad_norm": 1.1484375, "learning_rate": 0.0004554015117854712, "loss": 5.189, "mean_token_accuracy": 0.2013806641101837, "num_tokens": 49067362.0, "step": 21420 }, { "entropy": 5.52940993309021, "epoch": 2.1179319889284303, "grad_norm": 1.171875, "learning_rate": 0.0004553804198048321, "loss": 5.141, "mean_token_accuracy": 0.1986973136663437, "num_tokens": 49078067.0, "step": 21425 }, { "entropy": 5.468345785140992, "epoch": 2.1184262554369315, "grad_norm": 1.09375, "learning_rate": 0.00045535932338680655, "loss": 5.1616, "mean_token_accuracy": 0.2026003271341324, "num_tokens": 49090205.0, "step": 21430 }, { "entropy": 5.464451313018799, "epoch": 2.118920521945433, "grad_norm": 1.1796875, "learning_rate": 0.0004553382225319138, "loss": 5.1459, "mean_token_accuracy": 0.20440313667058946, "num_tokens": 49101134.0, "step": 21435 }, { "entropy": 5.607928705215454, "epoch": 2.1194147884539345, "grad_norm": 1.296875, "learning_rate": 0.0004553171172406728, "loss": 5.177, "mean_token_accuracy": 0.18961822837591172, "num_tokens": 49112282.0, "step": 21440 }, { "entropy": 5.509439611434937, "epoch": 2.1199090549624358, "grad_norm": 1.2578125, "learning_rate": 0.0004552960075136027, "loss": 5.1136, "mean_token_accuracy": 0.19439624547958373, "num_tokens": 49123228.0, "step": 21445 }, { "entropy": 5.470113706588745, "epoch": 2.120403321470937, "grad_norm": 1.1484375, "learning_rate": 0.00045527489335122284, "loss": 5.149, "mean_token_accuracy": 0.20207837224006653, "num_tokens": 49134769.0, "step": 21450 }, { "entropy": 5.448904657363892, "epoch": 2.1208975879794387, "grad_norm": 1.25, "learning_rate": 0.00045525377475405266, "loss": 5.0752, "mean_token_accuracy": 0.20799223184585572, "num_tokens": 49146096.0, "step": 21455 }, { "entropy": 5.5035545349121096, "epoch": 2.12139185448794, "grad_norm": 1.09375, "learning_rate": 0.00045523265172261155, "loss": 5.159, "mean_token_accuracy": 0.19232870936393737, "num_tokens": 49156829.0, "step": 21460 }, { "entropy": 5.516164350509643, "epoch": 2.1218861209964412, "grad_norm": 1.1640625, "learning_rate": 0.00045521152425741934, "loss": 5.1992, "mean_token_accuracy": 0.1983991637825966, "num_tokens": 49167364.0, "step": 21465 }, { "entropy": 5.516932249069214, "epoch": 2.1223803875049425, "grad_norm": 1.140625, "learning_rate": 0.00045519039235899573, "loss": 5.1927, "mean_token_accuracy": 0.199073189496994, "num_tokens": 49178283.0, "step": 21470 }, { "entropy": 5.629363059997559, "epoch": 2.122874654013444, "grad_norm": 1.0859375, "learning_rate": 0.00045516925602786043, "loss": 5.2529, "mean_token_accuracy": 0.19027069061994553, "num_tokens": 49190466.0, "step": 21475 }, { "entropy": 5.534385395050049, "epoch": 2.1233689205219455, "grad_norm": 1.0859375, "learning_rate": 0.0004551481152645335, "loss": 5.1327, "mean_token_accuracy": 0.19836584776639937, "num_tokens": 49202601.0, "step": 21480 }, { "entropy": 5.410324048995972, "epoch": 2.1238631870304467, "grad_norm": 1.1484375, "learning_rate": 0.00045512697006953504, "loss": 4.9985, "mean_token_accuracy": 0.21097538322210313, "num_tokens": 49214228.0, "step": 21485 }, { "entropy": 5.4403187274932865, "epoch": 2.124357453538948, "grad_norm": 1.140625, "learning_rate": 0.00045510582044338513, "loss": 5.1078, "mean_token_accuracy": 0.19763224422931672, "num_tokens": 49225495.0, "step": 21490 }, { "entropy": 5.542464351654052, "epoch": 2.1248517200474497, "grad_norm": 1.2734375, "learning_rate": 0.000455084666386604, "loss": 5.164, "mean_token_accuracy": 0.20189469158649445, "num_tokens": 49237348.0, "step": 21495 }, { "entropy": 5.511417245864868, "epoch": 2.125345986555951, "grad_norm": 1.125, "learning_rate": 0.00045506350789971227, "loss": 5.1915, "mean_token_accuracy": 0.19231386929750444, "num_tokens": 49247691.0, "step": 21500 }, { "entropy": 5.498218202590943, "epoch": 2.1258402530644522, "grad_norm": 1.15625, "learning_rate": 0.0004550423449832302, "loss": 5.1303, "mean_token_accuracy": 0.20230920165777205, "num_tokens": 49259191.0, "step": 21505 }, { "entropy": 5.517141723632813, "epoch": 2.126334519572954, "grad_norm": 1.140625, "learning_rate": 0.0004550211776376787, "loss": 5.1028, "mean_token_accuracy": 0.19951507151126863, "num_tokens": 49271760.0, "step": 21510 }, { "entropy": 5.513000011444092, "epoch": 2.126828786081455, "grad_norm": 1.125, "learning_rate": 0.00045500000586357807, "loss": 5.2236, "mean_token_accuracy": 0.19550841748714448, "num_tokens": 49283918.0, "step": 21515 }, { "entropy": 5.532028245925903, "epoch": 2.1273230525899565, "grad_norm": 1.140625, "learning_rate": 0.00045497882966144955, "loss": 5.0703, "mean_token_accuracy": 0.20106528401374818, "num_tokens": 49294313.0, "step": 21520 }, { "entropy": 5.430132675170898, "epoch": 2.1278173190984577, "grad_norm": 1.2109375, "learning_rate": 0.0004549576490318138, "loss": 5.0849, "mean_token_accuracy": 0.20017001628875733, "num_tokens": 49305213.0, "step": 21525 }, { "entropy": 5.481860733032226, "epoch": 2.1283115856069594, "grad_norm": 1.140625, "learning_rate": 0.000454936463975192, "loss": 5.0905, "mean_token_accuracy": 0.20660116225481034, "num_tokens": 49317245.0, "step": 21530 }, { "entropy": 5.59033613204956, "epoch": 2.1288058521154607, "grad_norm": 1.109375, "learning_rate": 0.0004549152744921053, "loss": 5.2196, "mean_token_accuracy": 0.19397821724414827, "num_tokens": 49328400.0, "step": 21535 }, { "entropy": 5.595189237594605, "epoch": 2.129300118623962, "grad_norm": 1.1953125, "learning_rate": 0.0004548940805830749, "loss": 5.2373, "mean_token_accuracy": 0.19453509896993637, "num_tokens": 49341094.0, "step": 21540 }, { "entropy": 5.469591188430786, "epoch": 2.129794385132463, "grad_norm": 1.2421875, "learning_rate": 0.00045487288224862224, "loss": 5.1287, "mean_token_accuracy": 0.20355660170316697, "num_tokens": 49352472.0, "step": 21545 }, { "entropy": 5.428672981262207, "epoch": 2.130288651640965, "grad_norm": 1.125, "learning_rate": 0.00045485167948926876, "loss": 5.1174, "mean_token_accuracy": 0.19694542437791823, "num_tokens": 49362432.0, "step": 21550 }, { "entropy": 5.472903394699097, "epoch": 2.130782918149466, "grad_norm": 1.3359375, "learning_rate": 0.000454830472305536, "loss": 5.1363, "mean_token_accuracy": 0.20871778577566147, "num_tokens": 49373857.0, "step": 21555 }, { "entropy": 5.593730497360229, "epoch": 2.1312771846579674, "grad_norm": 1.1796875, "learning_rate": 0.0004548092606979458, "loss": 5.2135, "mean_token_accuracy": 0.19492797404527665, "num_tokens": 49387545.0, "step": 21560 }, { "entropy": 5.5043810367584225, "epoch": 2.131771451166469, "grad_norm": 1.09375, "learning_rate": 0.00045478804466701984, "loss": 5.1438, "mean_token_accuracy": 0.2008009672164917, "num_tokens": 49398273.0, "step": 21565 }, { "entropy": 5.548471403121948, "epoch": 2.1322657176749704, "grad_norm": 1.125, "learning_rate": 0.00045476682421328015, "loss": 5.1496, "mean_token_accuracy": 0.19599671065807342, "num_tokens": 49408662.0, "step": 21570 }, { "entropy": 5.542198657989502, "epoch": 2.1327599841834717, "grad_norm": 1.203125, "learning_rate": 0.00045474559933724866, "loss": 5.2569, "mean_token_accuracy": 0.19440645575523377, "num_tokens": 49421189.0, "step": 21575 }, { "entropy": 5.559695625305176, "epoch": 2.133254250691973, "grad_norm": 1.1640625, "learning_rate": 0.00045472437003944753, "loss": 5.2208, "mean_token_accuracy": 0.19633277952671052, "num_tokens": 49432878.0, "step": 21580 }, { "entropy": 5.55558557510376, "epoch": 2.1337485172004746, "grad_norm": 1.203125, "learning_rate": 0.0004547031363203991, "loss": 5.2395, "mean_token_accuracy": 0.19586218446493148, "num_tokens": 49444058.0, "step": 21585 }, { "entropy": 5.5462547779083256, "epoch": 2.134242783708976, "grad_norm": 1.1328125, "learning_rate": 0.00045468189818062554, "loss": 5.1538, "mean_token_accuracy": 0.19348617941141127, "num_tokens": 49456602.0, "step": 21590 }, { "entropy": 5.514054775238037, "epoch": 2.134737050217477, "grad_norm": 1.171875, "learning_rate": 0.0004546606556206494, "loss": 5.157, "mean_token_accuracy": 0.19638571590185167, "num_tokens": 49467287.0, "step": 21595 }, { "entropy": 5.544499683380127, "epoch": 2.135231316725979, "grad_norm": 1.2265625, "learning_rate": 0.0004546394086409933, "loss": 5.102, "mean_token_accuracy": 0.19600446075201033, "num_tokens": 49478662.0, "step": 21600 }, { "entropy": 5.468817853927613, "epoch": 2.13572558323448, "grad_norm": 1.359375, "learning_rate": 0.00045461815724217984, "loss": 5.1732, "mean_token_accuracy": 0.20004867464303971, "num_tokens": 49489365.0, "step": 21605 }, { "entropy": 5.518802499771118, "epoch": 2.1362198497429814, "grad_norm": 1.203125, "learning_rate": 0.00045459690142473193, "loss": 5.208, "mean_token_accuracy": 0.19705337584018706, "num_tokens": 49501318.0, "step": 21610 }, { "entropy": 5.586258745193481, "epoch": 2.1367141162514827, "grad_norm": 1.140625, "learning_rate": 0.0004545756411891723, "loss": 5.2171, "mean_token_accuracy": 0.19001415967941285, "num_tokens": 49512138.0, "step": 21615 }, { "entropy": 5.5695287704467775, "epoch": 2.1372083827599844, "grad_norm": 1.2578125, "learning_rate": 0.0004545543765360241, "loss": 5.1393, "mean_token_accuracy": 0.19415713399648665, "num_tokens": 49523325.0, "step": 21620 }, { "entropy": 5.435473775863647, "epoch": 2.1377026492684856, "grad_norm": 1.1875, "learning_rate": 0.00045453310746581036, "loss": 5.0925, "mean_token_accuracy": 0.2022656336426735, "num_tokens": 49535382.0, "step": 21625 }, { "entropy": 5.486438798904419, "epoch": 2.138196915776987, "grad_norm": 1.1328125, "learning_rate": 0.0004545118339790543, "loss": 5.0742, "mean_token_accuracy": 0.20641831308603287, "num_tokens": 49546151.0, "step": 21630 }, { "entropy": 5.452876615524292, "epoch": 2.138691182285488, "grad_norm": 1.0234375, "learning_rate": 0.0004544905560762793, "loss": 5.1523, "mean_token_accuracy": 0.20317295491695403, "num_tokens": 49558617.0, "step": 21635 }, { "entropy": 5.494188022613526, "epoch": 2.13918544879399, "grad_norm": 1.2734375, "learning_rate": 0.00045446927375800876, "loss": 5.0676, "mean_token_accuracy": 0.2069677084684372, "num_tokens": 49568494.0, "step": 21640 }, { "entropy": 5.559956884384155, "epoch": 2.139679715302491, "grad_norm": 1.2265625, "learning_rate": 0.00045444798702476625, "loss": 5.1597, "mean_token_accuracy": 0.20608499348163606, "num_tokens": 49579763.0, "step": 21645 }, { "entropy": 5.473138952255249, "epoch": 2.1401739818109924, "grad_norm": 1.109375, "learning_rate": 0.0004544266958770755, "loss": 5.0756, "mean_token_accuracy": 0.203498013317585, "num_tokens": 49591631.0, "step": 21650 }, { "entropy": 5.485914611816407, "epoch": 2.1406682483194936, "grad_norm": 1.3984375, "learning_rate": 0.00045440540031546004, "loss": 5.157, "mean_token_accuracy": 0.19545343071222304, "num_tokens": 49603458.0, "step": 21655 }, { "entropy": 5.479412460327149, "epoch": 2.1411625148279954, "grad_norm": 1.21875, "learning_rate": 0.00045438410034044397, "loss": 5.1098, "mean_token_accuracy": 0.19994595795869827, "num_tokens": 49614076.0, "step": 21660 }, { "entropy": 5.535571908950805, "epoch": 2.1416567813364966, "grad_norm": 1.1484375, "learning_rate": 0.00045436279595255125, "loss": 5.2348, "mean_token_accuracy": 0.19829751253128053, "num_tokens": 49624982.0, "step": 21665 }, { "entropy": 5.504553031921387, "epoch": 2.142151047844998, "grad_norm": 1.3359375, "learning_rate": 0.0004543414871523059, "loss": 5.104, "mean_token_accuracy": 0.20362628549337386, "num_tokens": 49635897.0, "step": 21670 }, { "entropy": 5.470793914794922, "epoch": 2.1426453143534996, "grad_norm": 1.234375, "learning_rate": 0.0004543201739402321, "loss": 5.1085, "mean_token_accuracy": 0.2038417413830757, "num_tokens": 49647023.0, "step": 21675 }, { "entropy": 5.541865301132202, "epoch": 2.143139580862001, "grad_norm": 1.1171875, "learning_rate": 0.00045429885631685424, "loss": 5.209, "mean_token_accuracy": 0.18845810145139694, "num_tokens": 49658578.0, "step": 21680 }, { "entropy": 5.552652645111084, "epoch": 2.143633847370502, "grad_norm": 1.15625, "learning_rate": 0.0004542775342826967, "loss": 5.14, "mean_token_accuracy": 0.20193170011043549, "num_tokens": 49670978.0, "step": 21685 }, { "entropy": 5.424201250076294, "epoch": 2.1441281138790034, "grad_norm": 1.3046875, "learning_rate": 0.00045425620783828396, "loss": 5.1407, "mean_token_accuracy": 0.2037213549017906, "num_tokens": 49682553.0, "step": 21690 }, { "entropy": 5.517558479309082, "epoch": 2.144622380387505, "grad_norm": 1.1171875, "learning_rate": 0.0004542348769841407, "loss": 5.1459, "mean_token_accuracy": 0.19859371036291124, "num_tokens": 49694589.0, "step": 21695 }, { "entropy": 5.533109378814697, "epoch": 2.1451166468960063, "grad_norm": 1.2421875, "learning_rate": 0.00045421354172079173, "loss": 5.1679, "mean_token_accuracy": 0.20135858058929443, "num_tokens": 49706530.0, "step": 21700 }, { "entropy": 5.475673723220825, "epoch": 2.1456109134045076, "grad_norm": 1.2578125, "learning_rate": 0.00045419220204876175, "loss": 5.1499, "mean_token_accuracy": 0.20309580713510514, "num_tokens": 49718524.0, "step": 21705 }, { "entropy": 5.5505389213562015, "epoch": 2.1461051799130093, "grad_norm": 1.15625, "learning_rate": 0.00045417085796857596, "loss": 5.1651, "mean_token_accuracy": 0.19750214070081712, "num_tokens": 49729555.0, "step": 21710 }, { "entropy": 5.5415137767791744, "epoch": 2.1465994464215106, "grad_norm": 1.2109375, "learning_rate": 0.00045414950948075906, "loss": 5.2184, "mean_token_accuracy": 0.19754463583230972, "num_tokens": 49739708.0, "step": 21715 }, { "entropy": 5.568691921234131, "epoch": 2.147093712930012, "grad_norm": 1.1875, "learning_rate": 0.00045412815658583657, "loss": 5.1886, "mean_token_accuracy": 0.1967131555080414, "num_tokens": 49750997.0, "step": 21720 }, { "entropy": 5.493296432495117, "epoch": 2.147587979438513, "grad_norm": 1.140625, "learning_rate": 0.0004541067992843336, "loss": 5.1439, "mean_token_accuracy": 0.2032516360282898, "num_tokens": 49761508.0, "step": 21725 }, { "entropy": 5.4815867900848385, "epoch": 2.148082245947015, "grad_norm": 1.46875, "learning_rate": 0.00045408543757677555, "loss": 5.0441, "mean_token_accuracy": 0.20154463797807692, "num_tokens": 49772821.0, "step": 21730 }, { "entropy": 5.428773832321167, "epoch": 2.148576512455516, "grad_norm": 1.234375, "learning_rate": 0.000454064071463688, "loss": 5.0733, "mean_token_accuracy": 0.2097561851143837, "num_tokens": 49783932.0, "step": 21735 }, { "entropy": 5.495036220550537, "epoch": 2.1490707789640173, "grad_norm": 1.515625, "learning_rate": 0.0004540427009455965, "loss": 5.1224, "mean_token_accuracy": 0.19908437877893448, "num_tokens": 49795126.0, "step": 21740 }, { "entropy": 5.501727437973022, "epoch": 2.1495650454725186, "grad_norm": 1.2421875, "learning_rate": 0.0004540213260230267, "loss": 5.1596, "mean_token_accuracy": 0.19532833695411683, "num_tokens": 49806110.0, "step": 21745 }, { "entropy": 5.616278839111328, "epoch": 2.1500593119810203, "grad_norm": 1.21875, "learning_rate": 0.0004539999466965046, "loss": 5.2958, "mean_token_accuracy": 0.1889016091823578, "num_tokens": 49818879.0, "step": 21750 }, { "entropy": 5.524253177642822, "epoch": 2.1505535784895216, "grad_norm": 1.1640625, "learning_rate": 0.00045397856296655603, "loss": 5.1064, "mean_token_accuracy": 0.1991901069879532, "num_tokens": 49828986.0, "step": 21755 }, { "entropy": 5.518258571624756, "epoch": 2.151047844998023, "grad_norm": 1.1015625, "learning_rate": 0.00045395717483370703, "loss": 5.187, "mean_token_accuracy": 0.1985077053308487, "num_tokens": 49841987.0, "step": 21760 }, { "entropy": 5.504703712463379, "epoch": 2.1515421115065245, "grad_norm": 1.359375, "learning_rate": 0.00045393578229848373, "loss": 5.1672, "mean_token_accuracy": 0.1920861229300499, "num_tokens": 49854151.0, "step": 21765 }, { "entropy": 5.524015855789185, "epoch": 2.152036378015026, "grad_norm": 1.171875, "learning_rate": 0.00045391438536141257, "loss": 5.1838, "mean_token_accuracy": 0.2024367183446884, "num_tokens": 49866531.0, "step": 21770 }, { "entropy": 5.503477001190186, "epoch": 2.152530644523527, "grad_norm": 1.1328125, "learning_rate": 0.00045389298402301965, "loss": 5.1038, "mean_token_accuracy": 0.20770833343267442, "num_tokens": 49877737.0, "step": 21775 }, { "entropy": 5.616457605361939, "epoch": 2.1530249110320283, "grad_norm": 1.328125, "learning_rate": 0.0004538715782838316, "loss": 5.1967, "mean_token_accuracy": 0.19559425264596939, "num_tokens": 49889214.0, "step": 21780 }, { "entropy": 5.513102626800537, "epoch": 2.15351917754053, "grad_norm": 1.2578125, "learning_rate": 0.00045385016814437494, "loss": 5.1657, "mean_token_accuracy": 0.20539307594299316, "num_tokens": 49900293.0, "step": 21785 }, { "entropy": 5.570395803451538, "epoch": 2.1540134440490313, "grad_norm": 1.1171875, "learning_rate": 0.00045382875360517645, "loss": 5.24, "mean_token_accuracy": 0.18594724535942078, "num_tokens": 49912193.0, "step": 21790 }, { "entropy": 5.564964246749878, "epoch": 2.1545077105575325, "grad_norm": 1.109375, "learning_rate": 0.0004538073346667628, "loss": 5.1221, "mean_token_accuracy": 0.20388921201229096, "num_tokens": 49922780.0, "step": 21795 }, { "entropy": 5.469277191162109, "epoch": 2.155001977066034, "grad_norm": 1.203125, "learning_rate": 0.00045378591132966105, "loss": 5.0884, "mean_token_accuracy": 0.2023615777492523, "num_tokens": 49934551.0, "step": 21800 }, { "entropy": 5.51720085144043, "epoch": 2.1554962435745355, "grad_norm": 1.1171875, "learning_rate": 0.0004537644835943982, "loss": 5.1404, "mean_token_accuracy": 0.2002007856965065, "num_tokens": 49945779.0, "step": 21805 }, { "entropy": 5.473114347457885, "epoch": 2.1559905100830368, "grad_norm": 1.3515625, "learning_rate": 0.0004537430514615012, "loss": 5.0267, "mean_token_accuracy": 0.20844293385744095, "num_tokens": 49957127.0, "step": 21810 }, { "entropy": 5.497587776184082, "epoch": 2.156484776591538, "grad_norm": 1.1953125, "learning_rate": 0.00045372161493149746, "loss": 5.1075, "mean_token_accuracy": 0.20073380023241044, "num_tokens": 49968679.0, "step": 21815 }, { "entropy": 5.512000274658203, "epoch": 2.1569790431000397, "grad_norm": 1.15625, "learning_rate": 0.0004537001740049142, "loss": 5.1339, "mean_token_accuracy": 0.20407009720802308, "num_tokens": 49979924.0, "step": 21820 }, { "entropy": 5.5685670375823975, "epoch": 2.157473309608541, "grad_norm": 1.328125, "learning_rate": 0.000453678728682279, "loss": 5.1637, "mean_token_accuracy": 0.19451797902584075, "num_tokens": 49991318.0, "step": 21825 }, { "entropy": 5.411525678634644, "epoch": 2.1579675761170423, "grad_norm": 1.140625, "learning_rate": 0.0004536572789641193, "loss": 5.0614, "mean_token_accuracy": 0.2094429239630699, "num_tokens": 50003096.0, "step": 21830 }, { "entropy": 5.4729186534881595, "epoch": 2.1584618426255435, "grad_norm": 1.1328125, "learning_rate": 0.00045363582485096295, "loss": 5.1098, "mean_token_accuracy": 0.20159204304218292, "num_tokens": 50013953.0, "step": 21835 }, { "entropy": 5.529362201690674, "epoch": 2.1589561091340452, "grad_norm": 1.15625, "learning_rate": 0.0004536143663433375, "loss": 5.1217, "mean_token_accuracy": 0.19942850917577742, "num_tokens": 50025696.0, "step": 21840 }, { "entropy": 5.517219161987304, "epoch": 2.1594503756425465, "grad_norm": 1.125, "learning_rate": 0.00045359290344177094, "loss": 5.1176, "mean_token_accuracy": 0.20553035736083985, "num_tokens": 50036880.0, "step": 21845 }, { "entropy": 5.46474175453186, "epoch": 2.1599446421510478, "grad_norm": 1.1484375, "learning_rate": 0.0004535714361467913, "loss": 5.1819, "mean_token_accuracy": 0.19759765714406968, "num_tokens": 50048746.0, "step": 21850 }, { "entropy": 5.488521242141724, "epoch": 2.1604389086595495, "grad_norm": 1.21875, "learning_rate": 0.0004535499644589266, "loss": 5.1115, "mean_token_accuracy": 0.20375827699899673, "num_tokens": 50060711.0, "step": 21855 }, { "entropy": 5.525929641723633, "epoch": 2.1609331751680507, "grad_norm": 1.1640625, "learning_rate": 0.00045352848837870496, "loss": 5.1121, "mean_token_accuracy": 0.20056418627500533, "num_tokens": 50071878.0, "step": 21860 }, { "entropy": 5.5766599655151365, "epoch": 2.161427441676552, "grad_norm": 1.265625, "learning_rate": 0.000453507007906655, "loss": 5.1843, "mean_token_accuracy": 0.19560859203338624, "num_tokens": 50084600.0, "step": 21865 }, { "entropy": 5.427535343170166, "epoch": 2.1619217081850532, "grad_norm": 1.21875, "learning_rate": 0.0004534855230433048, "loss": 5.0292, "mean_token_accuracy": 0.2078049898147583, "num_tokens": 50095814.0, "step": 21870 }, { "entropy": 5.470051288604736, "epoch": 2.162415974693555, "grad_norm": 2.015625, "learning_rate": 0.00045346403378918314, "loss": 5.1804, "mean_token_accuracy": 0.19895249158143996, "num_tokens": 50108390.0, "step": 21875 }, { "entropy": 5.52471776008606, "epoch": 2.162910241202056, "grad_norm": 1.2421875, "learning_rate": 0.0004534425401448185, "loss": 5.2202, "mean_token_accuracy": 0.2009907454252243, "num_tokens": 50118939.0, "step": 21880 }, { "entropy": 5.466049480438232, "epoch": 2.1634045077105575, "grad_norm": 1.2578125, "learning_rate": 0.0004534210421107397, "loss": 5.0865, "mean_token_accuracy": 0.21050201058387757, "num_tokens": 50129510.0, "step": 21885 }, { "entropy": 5.485499715805053, "epoch": 2.1638987742190587, "grad_norm": 1.171875, "learning_rate": 0.0004533995396874756, "loss": 5.1496, "mean_token_accuracy": 0.20328801423311232, "num_tokens": 50140611.0, "step": 21890 }, { "entropy": 5.525869512557984, "epoch": 2.1643930407275604, "grad_norm": 1.09375, "learning_rate": 0.00045337803287555525, "loss": 5.1817, "mean_token_accuracy": 0.19648308008909227, "num_tokens": 50152214.0, "step": 21895 }, { "entropy": 5.619536066055298, "epoch": 2.1648873072360617, "grad_norm": 1.15625, "learning_rate": 0.0004533565216755075, "loss": 5.2606, "mean_token_accuracy": 0.18822956085205078, "num_tokens": 50164201.0, "step": 21900 }, { "entropy": 5.503797435760498, "epoch": 2.165381573744563, "grad_norm": 1.15625, "learning_rate": 0.0004533350060878615, "loss": 5.1109, "mean_token_accuracy": 0.20617415457963945, "num_tokens": 50176515.0, "step": 21905 }, { "entropy": 5.535329151153564, "epoch": 2.1658758402530642, "grad_norm": 1.1796875, "learning_rate": 0.0004533134861131469, "loss": 5.1539, "mean_token_accuracy": 0.19906970709562302, "num_tokens": 50187624.0, "step": 21910 }, { "entropy": 5.3744159698486325, "epoch": 2.166370106761566, "grad_norm": 1.1328125, "learning_rate": 0.0004532919617518929, "loss": 4.9829, "mean_token_accuracy": 0.21052872240543366, "num_tokens": 50199549.0, "step": 21915 }, { "entropy": 5.500524520874023, "epoch": 2.166864373270067, "grad_norm": 1.109375, "learning_rate": 0.00045327043300462887, "loss": 5.1831, "mean_token_accuracy": 0.19515424221754074, "num_tokens": 50210920.0, "step": 21920 }, { "entropy": 5.524771451950073, "epoch": 2.1673586397785685, "grad_norm": 1.4296875, "learning_rate": 0.0004532488998718846, "loss": 5.1081, "mean_token_accuracy": 0.2101850390434265, "num_tokens": 50221335.0, "step": 21925 }, { "entropy": 5.548227214813233, "epoch": 2.16785290628707, "grad_norm": 1.3359375, "learning_rate": 0.00045322736235418973, "loss": 5.207, "mean_token_accuracy": 0.19192128479480744, "num_tokens": 50235138.0, "step": 21930 }, { "entropy": 5.502050495147705, "epoch": 2.1683471727955714, "grad_norm": 1.234375, "learning_rate": 0.00045320582045207405, "loss": 5.1108, "mean_token_accuracy": 0.20652009546756744, "num_tokens": 50246454.0, "step": 21935 }, { "entropy": 5.497928428649902, "epoch": 2.1688414393040727, "grad_norm": 1.171875, "learning_rate": 0.0004531842741660675, "loss": 5.1537, "mean_token_accuracy": 0.1955179199576378, "num_tokens": 50257591.0, "step": 21940 }, { "entropy": 5.530389356613159, "epoch": 2.169335705812574, "grad_norm": 1.078125, "learning_rate": 0.0004531627234967003, "loss": 5.1275, "mean_token_accuracy": 0.2016258120536804, "num_tokens": 50268557.0, "step": 21945 }, { "entropy": 5.583495569229126, "epoch": 2.1698299723210757, "grad_norm": 1.1171875, "learning_rate": 0.0004531411684445024, "loss": 5.2668, "mean_token_accuracy": 0.1932716965675354, "num_tokens": 50280617.0, "step": 21950 }, { "entropy": 5.485199451446533, "epoch": 2.170324238829577, "grad_norm": 1.203125, "learning_rate": 0.00045311960901000403, "loss": 5.1042, "mean_token_accuracy": 0.19730470329523087, "num_tokens": 50292071.0, "step": 21955 }, { "entropy": 5.487246084213257, "epoch": 2.170818505338078, "grad_norm": 1.2265625, "learning_rate": 0.0004530980451937358, "loss": 5.1204, "mean_token_accuracy": 0.19923310726881027, "num_tokens": 50303389.0, "step": 21960 }, { "entropy": 5.498326826095581, "epoch": 2.17131277184658, "grad_norm": 1.140625, "learning_rate": 0.0004530764769962279, "loss": 5.1802, "mean_token_accuracy": 0.20463499724864959, "num_tokens": 50315088.0, "step": 21965 }, { "entropy": 5.506351566314697, "epoch": 2.171807038355081, "grad_norm": 1.1171875, "learning_rate": 0.0004530549044180111, "loss": 5.1188, "mean_token_accuracy": 0.20129501968622207, "num_tokens": 50326177.0, "step": 21970 }, { "entropy": 5.532204484939575, "epoch": 2.1723013048635824, "grad_norm": 1.1484375, "learning_rate": 0.00045303332745961605, "loss": 5.1246, "mean_token_accuracy": 0.20290366113185881, "num_tokens": 50337333.0, "step": 21975 }, { "entropy": 5.550925159454346, "epoch": 2.1727955713720837, "grad_norm": 1.1875, "learning_rate": 0.00045301174612157345, "loss": 5.1486, "mean_token_accuracy": 0.20356634110212327, "num_tokens": 50348406.0, "step": 21980 }, { "entropy": 5.458467435836792, "epoch": 2.1732898378805854, "grad_norm": 1.1484375, "learning_rate": 0.0004529901604044143, "loss": 5.0808, "mean_token_accuracy": 0.20767980813980103, "num_tokens": 50360057.0, "step": 21985 }, { "entropy": 5.5037603855133055, "epoch": 2.1737841043890866, "grad_norm": 1.234375, "learning_rate": 0.0004529685703086697, "loss": 5.1361, "mean_token_accuracy": 0.20416694432497023, "num_tokens": 50370355.0, "step": 21990 }, { "entropy": 5.534438848495483, "epoch": 2.174278370897588, "grad_norm": 1.2421875, "learning_rate": 0.00045294697583487056, "loss": 5.1543, "mean_token_accuracy": 0.2005469873547554, "num_tokens": 50382193.0, "step": 21995 }, { "entropy": 5.465809488296509, "epoch": 2.174772637406089, "grad_norm": 1.15625, "learning_rate": 0.00045292537698354824, "loss": 5.0979, "mean_token_accuracy": 0.20017559677362443, "num_tokens": 50394383.0, "step": 22000 }, { "entropy": 5.49526572227478, "epoch": 2.175266903914591, "grad_norm": 1.6015625, "learning_rate": 0.000452903773755234, "loss": 5.061, "mean_token_accuracy": 0.20688024759292603, "num_tokens": 50405006.0, "step": 22005 }, { "entropy": 5.586110162734985, "epoch": 2.175761170423092, "grad_norm": 1.1171875, "learning_rate": 0.0004528821661504594, "loss": 5.2197, "mean_token_accuracy": 0.1991715431213379, "num_tokens": 50416940.0, "step": 22010 }, { "entropy": 5.469919347763062, "epoch": 2.1762554369315934, "grad_norm": 1.2578125, "learning_rate": 0.0004528605541697558, "loss": 5.144, "mean_token_accuracy": 0.20250431448221207, "num_tokens": 50428506.0, "step": 22015 }, { "entropy": 5.571971225738525, "epoch": 2.176749703440095, "grad_norm": 1.1953125, "learning_rate": 0.00045283893781365513, "loss": 5.1986, "mean_token_accuracy": 0.19555224925279618, "num_tokens": 50440421.0, "step": 22020 }, { "entropy": 5.550393438339233, "epoch": 2.1772439699485964, "grad_norm": 1.109375, "learning_rate": 0.0004528173170826889, "loss": 5.1978, "mean_token_accuracy": 0.1958077847957611, "num_tokens": 50451819.0, "step": 22025 }, { "entropy": 5.615447998046875, "epoch": 2.1777382364570976, "grad_norm": 1.203125, "learning_rate": 0.0004527956919773891, "loss": 5.2848, "mean_token_accuracy": 0.18724677860736846, "num_tokens": 50464382.0, "step": 22030 }, { "entropy": 5.556777286529541, "epoch": 2.178232502965599, "grad_norm": 1.21875, "learning_rate": 0.0004527740624982877, "loss": 5.1492, "mean_token_accuracy": 0.20277251452207565, "num_tokens": 50474773.0, "step": 22035 }, { "entropy": 5.494979286193848, "epoch": 2.1787267694741006, "grad_norm": 1.0625, "learning_rate": 0.00045275242864591683, "loss": 5.08, "mean_token_accuracy": 0.2024929478764534, "num_tokens": 50485626.0, "step": 22040 }, { "entropy": 5.479667377471924, "epoch": 2.179221035982602, "grad_norm": 1.171875, "learning_rate": 0.00045273079042080854, "loss": 5.0967, "mean_token_accuracy": 0.20122305303812027, "num_tokens": 50496130.0, "step": 22045 }, { "entropy": 5.480082607269287, "epoch": 2.179715302491103, "grad_norm": 1.1484375, "learning_rate": 0.00045270914782349534, "loss": 5.1887, "mean_token_accuracy": 0.2030102089047432, "num_tokens": 50506578.0, "step": 22050 }, { "entropy": 5.520930814743042, "epoch": 2.1802095689996044, "grad_norm": 1.1015625, "learning_rate": 0.00045268750085450946, "loss": 5.2351, "mean_token_accuracy": 0.18985148519277573, "num_tokens": 50517398.0, "step": 22055 }, { "entropy": 5.456039094924927, "epoch": 2.180703835508106, "grad_norm": 1.1171875, "learning_rate": 0.0004526658495143835, "loss": 5.0484, "mean_token_accuracy": 0.21241284161806107, "num_tokens": 50528577.0, "step": 22060 }, { "entropy": 5.5150164604187015, "epoch": 2.1811981020166074, "grad_norm": 1.34375, "learning_rate": 0.0004526441938036501, "loss": 5.1234, "mean_token_accuracy": 0.20830536335706712, "num_tokens": 50539118.0, "step": 22065 }, { "entropy": 5.462718534469604, "epoch": 2.1816923685251086, "grad_norm": 1.3359375, "learning_rate": 0.00045262253372284193, "loss": 5.1802, "mean_token_accuracy": 0.19968547224998473, "num_tokens": 50549934.0, "step": 22070 }, { "entropy": 5.5227500915527346, "epoch": 2.1821866350336103, "grad_norm": 1.203125, "learning_rate": 0.00045260086927249193, "loss": 5.1329, "mean_token_accuracy": 0.20440291613340378, "num_tokens": 50560661.0, "step": 22075 }, { "entropy": 5.557682609558105, "epoch": 2.1826809015421116, "grad_norm": 1.125, "learning_rate": 0.000452579200453133, "loss": 5.196, "mean_token_accuracy": 0.19065165966749192, "num_tokens": 50573304.0, "step": 22080 }, { "entropy": 5.5410960674285885, "epoch": 2.183175168050613, "grad_norm": 1.15625, "learning_rate": 0.0004525575272652981, "loss": 5.1909, "mean_token_accuracy": 0.19336317777633666, "num_tokens": 50584166.0, "step": 22085 }, { "entropy": 5.614899730682373, "epoch": 2.183669434559114, "grad_norm": 1.1015625, "learning_rate": 0.0004525358497095206, "loss": 5.1677, "mean_token_accuracy": 0.192666257917881, "num_tokens": 50596425.0, "step": 22090 }, { "entropy": 5.468387079238892, "epoch": 2.184163701067616, "grad_norm": 1.1875, "learning_rate": 0.00045251416778633354, "loss": 5.0842, "mean_token_accuracy": 0.207627472281456, "num_tokens": 50607483.0, "step": 22095 }, { "entropy": 5.465862512588501, "epoch": 2.184657967576117, "grad_norm": 1.1953125, "learning_rate": 0.00045249248149627046, "loss": 5.0862, "mean_token_accuracy": 0.20716465413570403, "num_tokens": 50619655.0, "step": 22100 }, { "entropy": 5.51420407295227, "epoch": 2.1851522340846183, "grad_norm": 1.203125, "learning_rate": 0.00045247079083986485, "loss": 5.1804, "mean_token_accuracy": 0.19372120201587678, "num_tokens": 50631323.0, "step": 22105 }, { "entropy": 5.511419153213501, "epoch": 2.18564650059312, "grad_norm": 1.0703125, "learning_rate": 0.0004524490958176502, "loss": 5.0746, "mean_token_accuracy": 0.2087537795305252, "num_tokens": 50642931.0, "step": 22110 }, { "entropy": 5.442334318161011, "epoch": 2.1861407671016213, "grad_norm": 1.1328125, "learning_rate": 0.0004524273964301603, "loss": 5.0537, "mean_token_accuracy": 0.2096376121044159, "num_tokens": 50655396.0, "step": 22115 }, { "entropy": 5.4266410827636715, "epoch": 2.1866350336101226, "grad_norm": 1.359375, "learning_rate": 0.00045240569267792887, "loss": 5.1726, "mean_token_accuracy": 0.20235062539577484, "num_tokens": 50667264.0, "step": 22120 }, { "entropy": 5.413727807998657, "epoch": 2.187129300118624, "grad_norm": 1.171875, "learning_rate": 0.00045238398456148995, "loss": 5.0766, "mean_token_accuracy": 0.20579549074172973, "num_tokens": 50679073.0, "step": 22125 }, { "entropy": 5.568247842788696, "epoch": 2.1876235666271255, "grad_norm": 1.1875, "learning_rate": 0.00045236227208137744, "loss": 5.1456, "mean_token_accuracy": 0.19937388300895692, "num_tokens": 50689554.0, "step": 22130 }, { "entropy": 5.555780267715454, "epoch": 2.188117833135627, "grad_norm": 1.1875, "learning_rate": 0.0004523405552381256, "loss": 5.1793, "mean_token_accuracy": 0.19624852985143662, "num_tokens": 50702419.0, "step": 22135 }, { "entropy": 5.506539630889892, "epoch": 2.188612099644128, "grad_norm": 1.15625, "learning_rate": 0.0004523188340322685, "loss": 5.0861, "mean_token_accuracy": 0.20108540058135987, "num_tokens": 50713016.0, "step": 22140 }, { "entropy": 5.541036796569824, "epoch": 2.1891063661526293, "grad_norm": 1.140625, "learning_rate": 0.0004522971084643406, "loss": 5.1759, "mean_token_accuracy": 0.19601734727621078, "num_tokens": 50723936.0, "step": 22145 }, { "entropy": 5.5003172874450685, "epoch": 2.189600632661131, "grad_norm": 1.140625, "learning_rate": 0.00045227537853487627, "loss": 5.1047, "mean_token_accuracy": 0.19951000660657883, "num_tokens": 50734339.0, "step": 22150 }, { "entropy": 5.555885648727417, "epoch": 2.1900948991696323, "grad_norm": 1.03125, "learning_rate": 0.00045225364424441016, "loss": 5.2213, "mean_token_accuracy": 0.19235749989748002, "num_tokens": 50746262.0, "step": 22155 }, { "entropy": 5.538311958312988, "epoch": 2.1905891656781336, "grad_norm": 1.078125, "learning_rate": 0.000452231905593477, "loss": 5.1252, "mean_token_accuracy": 0.2023879736661911, "num_tokens": 50758218.0, "step": 22160 }, { "entropy": 5.561844730377198, "epoch": 2.191083432186635, "grad_norm": 1.21875, "learning_rate": 0.0004522101625826113, "loss": 5.2138, "mean_token_accuracy": 0.19490393698215486, "num_tokens": 50769263.0, "step": 22165 }, { "entropy": 5.3979555606842045, "epoch": 2.1915776986951365, "grad_norm": 1.1953125, "learning_rate": 0.0004521884152123482, "loss": 5.0137, "mean_token_accuracy": 0.21521006673574447, "num_tokens": 50780049.0, "step": 22170 }, { "entropy": 5.488247966766357, "epoch": 2.192071965203638, "grad_norm": 1.2421875, "learning_rate": 0.0004521666634832227, "loss": 5.1471, "mean_token_accuracy": 0.19518774896860122, "num_tokens": 50791817.0, "step": 22175 }, { "entropy": 5.51728367805481, "epoch": 2.192566231712139, "grad_norm": 1.1484375, "learning_rate": 0.0004521449073957697, "loss": 5.1347, "mean_token_accuracy": 0.20143390446901321, "num_tokens": 50802669.0, "step": 22180 }, { "entropy": 5.518154668807983, "epoch": 2.1930604982206408, "grad_norm": 1.0625, "learning_rate": 0.00045212314695052447, "loss": 5.1208, "mean_token_accuracy": 0.20137811899185182, "num_tokens": 50813920.0, "step": 22185 }, { "entropy": 5.5540753364562985, "epoch": 2.193554764729142, "grad_norm": 1.1484375, "learning_rate": 0.00045210138214802227, "loss": 5.1983, "mean_token_accuracy": 0.19635826349258423, "num_tokens": 50825828.0, "step": 22190 }, { "entropy": 5.5389691352844235, "epoch": 2.1940490312376433, "grad_norm": 1.15625, "learning_rate": 0.00045207961298879875, "loss": 5.2044, "mean_token_accuracy": 0.19437855631113052, "num_tokens": 50837425.0, "step": 22195 }, { "entropy": 5.55733208656311, "epoch": 2.1945432977461445, "grad_norm": 1.2265625, "learning_rate": 0.0004520578394733892, "loss": 5.1613, "mean_token_accuracy": 0.202816841006279, "num_tokens": 50848720.0, "step": 22200 }, { "entropy": 5.482304906845092, "epoch": 2.1950375642546462, "grad_norm": 1.1875, "learning_rate": 0.00045203606160232936, "loss": 5.1109, "mean_token_accuracy": 0.19998920559883118, "num_tokens": 50860304.0, "step": 22205 }, { "entropy": 5.464160203933716, "epoch": 2.1955318307631475, "grad_norm": 1.21875, "learning_rate": 0.0004520142793761549, "loss": 5.1447, "mean_token_accuracy": 0.19810025691986083, "num_tokens": 50872099.0, "step": 22210 }, { "entropy": 5.612827968597412, "epoch": 2.1960260972716488, "grad_norm": 1.1484375, "learning_rate": 0.0004519924927954017, "loss": 5.2604, "mean_token_accuracy": 0.1948183462023735, "num_tokens": 50884116.0, "step": 22215 }, { "entropy": 5.519051885604858, "epoch": 2.1965203637801505, "grad_norm": 1.1796875, "learning_rate": 0.0004519707018606059, "loss": 5.0711, "mean_token_accuracy": 0.20548426806926728, "num_tokens": 50896293.0, "step": 22220 }, { "entropy": 5.4370691776275635, "epoch": 2.1970146302886517, "grad_norm": 1.046875, "learning_rate": 0.00045194890657230315, "loss": 5.0511, "mean_token_accuracy": 0.20947284549474715, "num_tokens": 50908633.0, "step": 22225 }, { "entropy": 5.494141864776611, "epoch": 2.197508896797153, "grad_norm": 1.0703125, "learning_rate": 0.00045192710693103, "loss": 5.1052, "mean_token_accuracy": 0.20547571033239365, "num_tokens": 50919524.0, "step": 22230 }, { "entropy": 5.4792809009552, "epoch": 2.1980031633056543, "grad_norm": 1.140625, "learning_rate": 0.0004519053029373224, "loss": 5.1585, "mean_token_accuracy": 0.197202630341053, "num_tokens": 50930157.0, "step": 22235 }, { "entropy": 5.625102424621582, "epoch": 2.198497429814156, "grad_norm": 1.1328125, "learning_rate": 0.000451883494591717, "loss": 5.2223, "mean_token_accuracy": 0.1938192754983902, "num_tokens": 50942474.0, "step": 22240 }, { "entropy": 5.57127423286438, "epoch": 2.1989916963226572, "grad_norm": 1.03125, "learning_rate": 0.00045186168189475026, "loss": 5.2041, "mean_token_accuracy": 0.1902976557612419, "num_tokens": 50954847.0, "step": 22245 }, { "entropy": 5.490539026260376, "epoch": 2.1994859628311585, "grad_norm": 1.0390625, "learning_rate": 0.0004518398648469586, "loss": 5.1814, "mean_token_accuracy": 0.20104799121618272, "num_tokens": 50966446.0, "step": 22250 }, { "entropy": 5.464949321746826, "epoch": 2.1999802293396598, "grad_norm": 1.1796875, "learning_rate": 0.00045181804344887887, "loss": 5.1314, "mean_token_accuracy": 0.20553895682096482, "num_tokens": 50977949.0, "step": 22255 }, { "entropy": 5.51120343208313, "epoch": 2.2004744958481615, "grad_norm": 1.1015625, "learning_rate": 0.00045179621770104786, "loss": 5.1674, "mean_token_accuracy": 0.20135581493377686, "num_tokens": 50989297.0, "step": 22260 }, { "entropy": 5.575305509567261, "epoch": 2.2009687623566627, "grad_norm": 1.375, "learning_rate": 0.00045177438760400244, "loss": 5.1951, "mean_token_accuracy": 0.19927078485488892, "num_tokens": 51001616.0, "step": 22265 }, { "entropy": 5.547829914093017, "epoch": 2.201463028865164, "grad_norm": 1.0703125, "learning_rate": 0.0004517525531582797, "loss": 5.1749, "mean_token_accuracy": 0.1956998363137245, "num_tokens": 51012870.0, "step": 22270 }, { "entropy": 5.464755201339722, "epoch": 2.2019572953736652, "grad_norm": 1.40625, "learning_rate": 0.00045173071436441665, "loss": 5.1265, "mean_token_accuracy": 0.20448900908231735, "num_tokens": 51025368.0, "step": 22275 }, { "entropy": 5.522630929946899, "epoch": 2.202451561882167, "grad_norm": 1.15625, "learning_rate": 0.0004517088712229507, "loss": 5.1027, "mean_token_accuracy": 0.20338659435510636, "num_tokens": 51035964.0, "step": 22280 }, { "entropy": 5.535574340820313, "epoch": 2.202945828390668, "grad_norm": 1.1953125, "learning_rate": 0.00045168702373441904, "loss": 5.1153, "mean_token_accuracy": 0.1960943043231964, "num_tokens": 51048313.0, "step": 22285 }, { "entropy": 5.482205104827881, "epoch": 2.2034400948991695, "grad_norm": 1.25, "learning_rate": 0.00045166517189935924, "loss": 5.121, "mean_token_accuracy": 0.20774466693401336, "num_tokens": 51060503.0, "step": 22290 }, { "entropy": 5.436234045028686, "epoch": 2.203934361407671, "grad_norm": 1.125, "learning_rate": 0.00045164331571830875, "loss": 5.0379, "mean_token_accuracy": 0.20530752390623092, "num_tokens": 51070865.0, "step": 22295 }, { "entropy": 5.568738698959351, "epoch": 2.2044286279161724, "grad_norm": 1.1875, "learning_rate": 0.00045162145519180534, "loss": 5.148, "mean_token_accuracy": 0.19823688715696336, "num_tokens": 51081158.0, "step": 22300 }, { "entropy": 5.46003098487854, "epoch": 2.2049228944246737, "grad_norm": 1.234375, "learning_rate": 0.0004515995903203867, "loss": 5.0211, "mean_token_accuracy": 0.2167837902903557, "num_tokens": 51090661.0, "step": 22305 }, { "entropy": 5.4276769161224365, "epoch": 2.205417160933175, "grad_norm": 1.2421875, "learning_rate": 0.0004515777211045908, "loss": 5.127, "mean_token_accuracy": 0.19683904349803924, "num_tokens": 51101825.0, "step": 22310 }, { "entropy": 5.470873737335205, "epoch": 2.2059114274416767, "grad_norm": 1.21875, "learning_rate": 0.00045155584754495546, "loss": 5.1635, "mean_token_accuracy": 0.20107779055833816, "num_tokens": 51114546.0, "step": 22315 }, { "entropy": 5.537352800369263, "epoch": 2.206405693950178, "grad_norm": 1.140625, "learning_rate": 0.0004515339696420189, "loss": 5.1222, "mean_token_accuracy": 0.201772840321064, "num_tokens": 51124888.0, "step": 22320 }, { "entropy": 5.430833196640014, "epoch": 2.206899960458679, "grad_norm": 1.125, "learning_rate": 0.0004515120873963194, "loss": 5.0289, "mean_token_accuracy": 0.21231637597084047, "num_tokens": 51135892.0, "step": 22325 }, { "entropy": 5.490753078460694, "epoch": 2.207394226967181, "grad_norm": 1.125, "learning_rate": 0.0004514902008083951, "loss": 5.1369, "mean_token_accuracy": 0.19497858732938766, "num_tokens": 51147513.0, "step": 22330 }, { "entropy": 5.543672513961792, "epoch": 2.207888493475682, "grad_norm": 1.2109375, "learning_rate": 0.0004514683098787845, "loss": 5.1545, "mean_token_accuracy": 0.20054354816675185, "num_tokens": 51159514.0, "step": 22335 }, { "entropy": 5.566498517990112, "epoch": 2.2083827599841834, "grad_norm": 1.1171875, "learning_rate": 0.0004514464146080261, "loss": 5.2124, "mean_token_accuracy": 0.19934438169002533, "num_tokens": 51171245.0, "step": 22340 }, { "entropy": 5.507154893875122, "epoch": 2.2088770264926847, "grad_norm": 1.21875, "learning_rate": 0.00045142451499665846, "loss": 5.1167, "mean_token_accuracy": 0.20402316600084305, "num_tokens": 51182763.0, "step": 22345 }, { "entropy": 5.561678552627564, "epoch": 2.2093712930011864, "grad_norm": 1.109375, "learning_rate": 0.00045140261104522044, "loss": 5.1567, "mean_token_accuracy": 0.19880735427141188, "num_tokens": 51193811.0, "step": 22350 }, { "entropy": 5.451747703552246, "epoch": 2.2098655595096877, "grad_norm": 1.1796875, "learning_rate": 0.0004513807027542508, "loss": 5.066, "mean_token_accuracy": 0.20757050663232804, "num_tokens": 51203963.0, "step": 22355 }, { "entropy": 5.455369281768799, "epoch": 2.210359826018189, "grad_norm": 1.0625, "learning_rate": 0.0004513587901242886, "loss": 5.0383, "mean_token_accuracy": 0.20728101432323456, "num_tokens": 51215128.0, "step": 22360 }, { "entropy": 5.4400492191314695, "epoch": 2.21085409252669, "grad_norm": 1.109375, "learning_rate": 0.00045133687315587263, "loss": 5.063, "mean_token_accuracy": 0.20726129710674285, "num_tokens": 51226773.0, "step": 22365 }, { "entropy": 5.443158340454102, "epoch": 2.211348359035192, "grad_norm": 1.1953125, "learning_rate": 0.0004513149518495424, "loss": 5.1112, "mean_token_accuracy": 0.2014615133404732, "num_tokens": 51238226.0, "step": 22370 }, { "entropy": 5.5417955875396725, "epoch": 2.211842625543693, "grad_norm": 1.1875, "learning_rate": 0.00045129302620583683, "loss": 5.1354, "mean_token_accuracy": 0.20179601162672042, "num_tokens": 51249096.0, "step": 22375 }, { "entropy": 5.542620038986206, "epoch": 2.2123368920521944, "grad_norm": 1.21875, "learning_rate": 0.00045127109622529563, "loss": 5.1383, "mean_token_accuracy": 0.20518684834241868, "num_tokens": 51259709.0, "step": 22380 }, { "entropy": 5.427329730987549, "epoch": 2.212831158560696, "grad_norm": 1.1875, "learning_rate": 0.00045124916190845797, "loss": 5.1409, "mean_token_accuracy": 0.20966077893972396, "num_tokens": 51271787.0, "step": 22385 }, { "entropy": 5.616235589981079, "epoch": 2.2133254250691974, "grad_norm": 1.1015625, "learning_rate": 0.00045122722325586373, "loss": 5.1933, "mean_token_accuracy": 0.1969411239027977, "num_tokens": 51284093.0, "step": 22390 }, { "entropy": 5.584792518615723, "epoch": 2.2138196915776986, "grad_norm": 1.4375, "learning_rate": 0.00045120528026805235, "loss": 5.1653, "mean_token_accuracy": 0.20590700507164, "num_tokens": 51295659.0, "step": 22395 }, { "entropy": 5.476453065872192, "epoch": 2.2143139580862, "grad_norm": 1.078125, "learning_rate": 0.00045118333294556377, "loss": 5.2022, "mean_token_accuracy": 0.19549500495195388, "num_tokens": 51307960.0, "step": 22400 }, { "entropy": 5.459325885772705, "epoch": 2.2148082245947016, "grad_norm": 1.171875, "learning_rate": 0.0004511613812889379, "loss": 5.0289, "mean_token_accuracy": 0.21107092052698134, "num_tokens": 51319366.0, "step": 22405 }, { "entropy": 5.477718544006348, "epoch": 2.215302491103203, "grad_norm": 1.1640625, "learning_rate": 0.00045113942529871473, "loss": 5.0859, "mean_token_accuracy": 0.20231460630893708, "num_tokens": 51332445.0, "step": 22410 }, { "entropy": 5.42995319366455, "epoch": 2.215796757611704, "grad_norm": 1.1796875, "learning_rate": 0.0004511174649754343, "loss": 5.0418, "mean_token_accuracy": 0.20715775340795517, "num_tokens": 51342900.0, "step": 22415 }, { "entropy": 5.41667742729187, "epoch": 2.2162910241202054, "grad_norm": 1.125, "learning_rate": 0.000451095500319637, "loss": 5.1392, "mean_token_accuracy": 0.2025244042277336, "num_tokens": 51354437.0, "step": 22420 }, { "entropy": 5.424160051345825, "epoch": 2.216785290628707, "grad_norm": 1.078125, "learning_rate": 0.000451073531331863, "loss": 5.0326, "mean_token_accuracy": 0.20858192443847656, "num_tokens": 51364630.0, "step": 22425 }, { "entropy": 5.527617788314819, "epoch": 2.2172795571372084, "grad_norm": 1.0625, "learning_rate": 0.0004510515580126528, "loss": 5.2078, "mean_token_accuracy": 0.19514022916555404, "num_tokens": 51376547.0, "step": 22430 }, { "entropy": 5.600302267074585, "epoch": 2.2177738236457096, "grad_norm": 1.1640625, "learning_rate": 0.000451029580362547, "loss": 5.1648, "mean_token_accuracy": 0.20315398275852203, "num_tokens": 51388704.0, "step": 22435 }, { "entropy": 5.65431170463562, "epoch": 2.2182680901542113, "grad_norm": 1.1484375, "learning_rate": 0.0004510075983820862, "loss": 5.3464, "mean_token_accuracy": 0.1848840370774269, "num_tokens": 51400884.0, "step": 22440 }, { "entropy": 5.50028715133667, "epoch": 2.2187623566627126, "grad_norm": 1.1328125, "learning_rate": 0.00045098561207181114, "loss": 5.06, "mean_token_accuracy": 0.20976512879133224, "num_tokens": 51412946.0, "step": 22445 }, { "entropy": 5.4981241703033445, "epoch": 2.219256623171214, "grad_norm": 1.1484375, "learning_rate": 0.0004509636214322628, "loss": 5.2081, "mean_token_accuracy": 0.20081951171159745, "num_tokens": 51425860.0, "step": 22450 }, { "entropy": 5.51390233039856, "epoch": 2.219750889679715, "grad_norm": 1.203125, "learning_rate": 0.0004509416264639821, "loss": 5.127, "mean_token_accuracy": 0.20241011530160904, "num_tokens": 51438812.0, "step": 22455 }, { "entropy": 5.5867030143737795, "epoch": 2.220245156188217, "grad_norm": 1.3203125, "learning_rate": 0.0004509196271675101, "loss": 5.2399, "mean_token_accuracy": 0.19625402688980104, "num_tokens": 51449881.0, "step": 22460 }, { "entropy": 5.484631109237671, "epoch": 2.220739422696718, "grad_norm": 1.1171875, "learning_rate": 0.00045089762354338784, "loss": 5.0769, "mean_token_accuracy": 0.2054135710000992, "num_tokens": 51460403.0, "step": 22465 }, { "entropy": 5.507558298110962, "epoch": 2.2212336892052194, "grad_norm": 1.21875, "learning_rate": 0.00045087561559215683, "loss": 5.1563, "mean_token_accuracy": 0.19342798739671707, "num_tokens": 51471414.0, "step": 22470 }, { "entropy": 5.41144208908081, "epoch": 2.221727955713721, "grad_norm": 1.09375, "learning_rate": 0.00045085360331435835, "loss": 5.0816, "mean_token_accuracy": 0.20704265236854552, "num_tokens": 51482855.0, "step": 22475 }, { "entropy": 5.598956155776977, "epoch": 2.2222222222222223, "grad_norm": 1.1015625, "learning_rate": 0.000450831586710534, "loss": 5.213, "mean_token_accuracy": 0.1966195896267891, "num_tokens": 51495363.0, "step": 22480 }, { "entropy": 5.498496723175049, "epoch": 2.2227164887307236, "grad_norm": 1.1015625, "learning_rate": 0.00045080956578122535, "loss": 5.1111, "mean_token_accuracy": 0.2004269391298294, "num_tokens": 51506678.0, "step": 22485 }, { "entropy": 5.519071817398071, "epoch": 2.223210755239225, "grad_norm": 1.140625, "learning_rate": 0.00045078754052697406, "loss": 5.176, "mean_token_accuracy": 0.19880853593349457, "num_tokens": 51518596.0, "step": 22490 }, { "entropy": 5.553566312789917, "epoch": 2.2237050217477266, "grad_norm": 1.625, "learning_rate": 0.00045076551094832206, "loss": 5.2656, "mean_token_accuracy": 0.18756288588047026, "num_tokens": 51531292.0, "step": 22495 }, { "entropy": 5.490634965896606, "epoch": 2.224199288256228, "grad_norm": 1.15625, "learning_rate": 0.00045074347704581114, "loss": 5.0935, "mean_token_accuracy": 0.2068154737353325, "num_tokens": 51542507.0, "step": 22500 }, { "entropy": 5.494726228713989, "epoch": 2.224693554764729, "grad_norm": 1.140625, "learning_rate": 0.00045072143881998345, "loss": 5.1149, "mean_token_accuracy": 0.20549058318138122, "num_tokens": 51553895.0, "step": 22505 }, { "entropy": 5.518519735336303, "epoch": 2.2251878212732303, "grad_norm": 1.09375, "learning_rate": 0.0004506993962713812, "loss": 5.2088, "mean_token_accuracy": 0.19290893524885178, "num_tokens": 51566533.0, "step": 22510 }, { "entropy": 5.533729934692383, "epoch": 2.225682087781732, "grad_norm": 1.15625, "learning_rate": 0.00045067734940054644, "loss": 5.1399, "mean_token_accuracy": 0.19883281290531157, "num_tokens": 51576308.0, "step": 22515 }, { "entropy": 5.480108737945557, "epoch": 2.2261763542902333, "grad_norm": 1.1875, "learning_rate": 0.00045065529820802165, "loss": 5.0762, "mean_token_accuracy": 0.2030370369553566, "num_tokens": 51589844.0, "step": 22520 }, { "entropy": 5.4806859493255615, "epoch": 2.2266706207987346, "grad_norm": 1.1640625, "learning_rate": 0.00045063324269434924, "loss": 5.0694, "mean_token_accuracy": 0.20250414311885834, "num_tokens": 51601685.0, "step": 22525 }, { "entropy": 5.505438137054443, "epoch": 2.227164887307236, "grad_norm": 1.1484375, "learning_rate": 0.0004506111828600719, "loss": 5.1401, "mean_token_accuracy": 0.20779650211334227, "num_tokens": 51613258.0, "step": 22530 }, { "entropy": 5.585435056686402, "epoch": 2.2276591538157375, "grad_norm": 1.171875, "learning_rate": 0.0004505891187057322, "loss": 5.1681, "mean_token_accuracy": 0.2065178394317627, "num_tokens": 51624088.0, "step": 22535 }, { "entropy": 5.498156404495239, "epoch": 2.228153420324239, "grad_norm": 1.0078125, "learning_rate": 0.0004505670502318729, "loss": 5.1006, "mean_token_accuracy": 0.20892043709754943, "num_tokens": 51636617.0, "step": 22540 }, { "entropy": 5.5169140815734865, "epoch": 2.22864768683274, "grad_norm": 1.21875, "learning_rate": 0.00045054497743903687, "loss": 5.1876, "mean_token_accuracy": 0.1927280232310295, "num_tokens": 51647777.0, "step": 22545 }, { "entropy": 5.510875511169433, "epoch": 2.2291419533412418, "grad_norm": 1.328125, "learning_rate": 0.0004505229003277673, "loss": 5.201, "mean_token_accuracy": 0.18906791061162947, "num_tokens": 51660505.0, "step": 22550 }, { "entropy": 5.574018764495849, "epoch": 2.229636219849743, "grad_norm": 1.234375, "learning_rate": 0.00045050081889860713, "loss": 5.1678, "mean_token_accuracy": 0.2038664773106575, "num_tokens": 51672296.0, "step": 22555 }, { "entropy": 5.482110118865966, "epoch": 2.2301304863582443, "grad_norm": 1.1171875, "learning_rate": 0.00045047873315209945, "loss": 5.145, "mean_token_accuracy": 0.2070688009262085, "num_tokens": 51684437.0, "step": 22560 }, { "entropy": 5.428293085098266, "epoch": 2.2306247528667456, "grad_norm": 1.1171875, "learning_rate": 0.0004504566430887878, "loss": 4.9732, "mean_token_accuracy": 0.21568287312984466, "num_tokens": 51694919.0, "step": 22565 }, { "entropy": 5.4811194896697994, "epoch": 2.2311190193752473, "grad_norm": 1.0703125, "learning_rate": 0.00045043454870921553, "loss": 5.1101, "mean_token_accuracy": 0.20445645451545716, "num_tokens": 51705273.0, "step": 22570 }, { "entropy": 5.53201994895935, "epoch": 2.2316132858837485, "grad_norm": 1.203125, "learning_rate": 0.0004504124500139261, "loss": 5.1519, "mean_token_accuracy": 0.19600190222263336, "num_tokens": 51717048.0, "step": 22575 }, { "entropy": 5.5662352561950685, "epoch": 2.23210755239225, "grad_norm": 1.1640625, "learning_rate": 0.0004503903470034632, "loss": 5.2155, "mean_token_accuracy": 0.1910916820168495, "num_tokens": 51729208.0, "step": 22580 }, { "entropy": 5.4474719047546385, "epoch": 2.2326018189007515, "grad_norm": 1.171875, "learning_rate": 0.00045036823967837066, "loss": 5.0749, "mean_token_accuracy": 0.21341143548488617, "num_tokens": 51740393.0, "step": 22585 }, { "entropy": 5.535370540618897, "epoch": 2.2330960854092528, "grad_norm": 1.265625, "learning_rate": 0.0004503461280391921, "loss": 5.1325, "mean_token_accuracy": 0.20634863674640655, "num_tokens": 51751044.0, "step": 22590 }, { "entropy": 5.5139857769012455, "epoch": 2.233590351917754, "grad_norm": 2.140625, "learning_rate": 0.0004503240120864716, "loss": 5.1398, "mean_token_accuracy": 0.19938633292913438, "num_tokens": 51761969.0, "step": 22595 }, { "entropy": 5.510321378707886, "epoch": 2.2340846184262553, "grad_norm": 1.109375, "learning_rate": 0.0004503018918207532, "loss": 5.1617, "mean_token_accuracy": 0.19652422815561293, "num_tokens": 51774185.0, "step": 22600 }, { "entropy": 5.55922384262085, "epoch": 2.234578884934757, "grad_norm": 1.03125, "learning_rate": 0.0004502797672425811, "loss": 5.1112, "mean_token_accuracy": 0.20445195883512496, "num_tokens": 51786155.0, "step": 22605 }, { "entropy": 5.472774600982666, "epoch": 2.2350731514432582, "grad_norm": 1.0859375, "learning_rate": 0.00045025763835249957, "loss": 5.1444, "mean_token_accuracy": 0.20036866068840026, "num_tokens": 51797125.0, "step": 22610 }, { "entropy": 5.555926036834717, "epoch": 2.2355674179517595, "grad_norm": 1.078125, "learning_rate": 0.0004502355051510528, "loss": 5.2559, "mean_token_accuracy": 0.19540160447359084, "num_tokens": 51809046.0, "step": 22615 }, { "entropy": 5.586334991455078, "epoch": 2.2360616844602608, "grad_norm": 1.125, "learning_rate": 0.00045021336763878555, "loss": 5.2851, "mean_token_accuracy": 0.1851371705532074, "num_tokens": 51821857.0, "step": 22620 }, { "entropy": 5.598964262008667, "epoch": 2.2365559509687625, "grad_norm": 1.3515625, "learning_rate": 0.00045019122581624224, "loss": 5.1011, "mean_token_accuracy": 0.20264934599399567, "num_tokens": 51833504.0, "step": 22625 }, { "entropy": 5.407631254196167, "epoch": 2.2370502174772637, "grad_norm": 1.21875, "learning_rate": 0.00045016907968396764, "loss": 5.1649, "mean_token_accuracy": 0.20398636013269425, "num_tokens": 51844166.0, "step": 22630 }, { "entropy": 5.5200096607208256, "epoch": 2.237544483985765, "grad_norm": 1.0859375, "learning_rate": 0.0004501469292425064, "loss": 5.1457, "mean_token_accuracy": 0.20060763955116273, "num_tokens": 51855674.0, "step": 22635 }, { "entropy": 5.474892950057983, "epoch": 2.2380387504942667, "grad_norm": 1.171875, "learning_rate": 0.00045012477449240363, "loss": 5.1089, "mean_token_accuracy": 0.204365636408329, "num_tokens": 51866128.0, "step": 22640 }, { "entropy": 5.49126558303833, "epoch": 2.238533017002768, "grad_norm": 1.1484375, "learning_rate": 0.00045010261543420416, "loss": 5.2041, "mean_token_accuracy": 0.2029258891940117, "num_tokens": 51877036.0, "step": 22645 }, { "entropy": 5.556707668304443, "epoch": 2.2390272835112692, "grad_norm": 1.21875, "learning_rate": 0.0004500804520684532, "loss": 5.1224, "mean_token_accuracy": 0.2015409290790558, "num_tokens": 51888331.0, "step": 22650 }, { "entropy": 5.545964145660401, "epoch": 2.2395215500197705, "grad_norm": 1.0703125, "learning_rate": 0.00045005828439569594, "loss": 5.1574, "mean_token_accuracy": 0.19484515339136124, "num_tokens": 51899843.0, "step": 22655 }, { "entropy": 5.576833772659302, "epoch": 2.240015816528272, "grad_norm": 1.21875, "learning_rate": 0.00045003611241647783, "loss": 5.186, "mean_token_accuracy": 0.19256659895181655, "num_tokens": 51911429.0, "step": 22660 }, { "entropy": 5.4972223281860355, "epoch": 2.2405100830367735, "grad_norm": 1.1171875, "learning_rate": 0.00045001393613134413, "loss": 5.1267, "mean_token_accuracy": 0.19981478601694108, "num_tokens": 51923154.0, "step": 22665 }, { "entropy": 5.520114755630493, "epoch": 2.2410043495452747, "grad_norm": 1.0546875, "learning_rate": 0.0004499917555408405, "loss": 5.1595, "mean_token_accuracy": 0.1968149498105049, "num_tokens": 51935126.0, "step": 22670 }, { "entropy": 5.537693977355957, "epoch": 2.241498616053776, "grad_norm": 1.3359375, "learning_rate": 0.00044996957064551244, "loss": 5.1756, "mean_token_accuracy": 0.19135907888412476, "num_tokens": 51947629.0, "step": 22675 }, { "entropy": 5.519244766235351, "epoch": 2.2419928825622777, "grad_norm": 1.203125, "learning_rate": 0.0004499473814459059, "loss": 5.166, "mean_token_accuracy": 0.19891617000102996, "num_tokens": 51957631.0, "step": 22680 }, { "entropy": 5.5661708354949955, "epoch": 2.242487149070779, "grad_norm": 1.1953125, "learning_rate": 0.00044992518794256657, "loss": 5.184, "mean_token_accuracy": 0.19683127254247665, "num_tokens": 51969854.0, "step": 22685 }, { "entropy": 5.561238622665405, "epoch": 2.24298141557928, "grad_norm": 1.109375, "learning_rate": 0.00044990299013604045, "loss": 5.1745, "mean_token_accuracy": 0.19718017429113388, "num_tokens": 51980501.0, "step": 22690 }, { "entropy": 5.512120389938355, "epoch": 2.243475682087782, "grad_norm": 1.2109375, "learning_rate": 0.00044988078802687373, "loss": 5.1536, "mean_token_accuracy": 0.19805895984172822, "num_tokens": 51991336.0, "step": 22695 }, { "entropy": 5.533081817626953, "epoch": 2.243969948596283, "grad_norm": 1.328125, "learning_rate": 0.0004498585816156124, "loss": 5.2178, "mean_token_accuracy": 0.19303175657987595, "num_tokens": 52003215.0, "step": 22700 }, { "entropy": 5.587298107147217, "epoch": 2.2444642151047844, "grad_norm": 1.1953125, "learning_rate": 0.0004498363709028029, "loss": 5.1825, "mean_token_accuracy": 0.19353781193494796, "num_tokens": 52014772.0, "step": 22705 }, { "entropy": 5.525957250595093, "epoch": 2.2449584816132857, "grad_norm": 1.203125, "learning_rate": 0.00044981415588899153, "loss": 5.1658, "mean_token_accuracy": 0.19591038823127746, "num_tokens": 52025808.0, "step": 22710 }, { "entropy": 5.512095022201538, "epoch": 2.2454527481217874, "grad_norm": 1.15625, "learning_rate": 0.0004497919365747248, "loss": 5.1987, "mean_token_accuracy": 0.19656058847904206, "num_tokens": 52037397.0, "step": 22715 }, { "entropy": 5.4825758934021, "epoch": 2.2459470146302887, "grad_norm": 1.484375, "learning_rate": 0.00044976971296054936, "loss": 5.0948, "mean_token_accuracy": 0.2112068608403206, "num_tokens": 52048874.0, "step": 22720 }, { "entropy": 5.514915657043457, "epoch": 2.24644128113879, "grad_norm": 1.1875, "learning_rate": 0.0004497474850470118, "loss": 5.228, "mean_token_accuracy": 0.19076688587665558, "num_tokens": 52061180.0, "step": 22725 }, { "entropy": 5.537062120437622, "epoch": 2.2469355476472916, "grad_norm": 1.3125, "learning_rate": 0.000449725252834659, "loss": 5.1209, "mean_token_accuracy": 0.19823426753282547, "num_tokens": 52073400.0, "step": 22730 }, { "entropy": 5.515083885192871, "epoch": 2.247429814155793, "grad_norm": 1.1328125, "learning_rate": 0.00044970301632403796, "loss": 5.1852, "mean_token_accuracy": 0.20362466424703599, "num_tokens": 52084737.0, "step": 22735 }, { "entropy": 5.4838320255279545, "epoch": 2.247924080664294, "grad_norm": 1.125, "learning_rate": 0.00044968077551569554, "loss": 5.1114, "mean_token_accuracy": 0.2066636100411415, "num_tokens": 52096044.0, "step": 22740 }, { "entropy": 5.577515268325806, "epoch": 2.2484183471727954, "grad_norm": 1.078125, "learning_rate": 0.000449658530410179, "loss": 5.1216, "mean_token_accuracy": 0.20124562680721284, "num_tokens": 52108701.0, "step": 22745 }, { "entropy": 5.523634719848633, "epoch": 2.248912613681297, "grad_norm": 1.125, "learning_rate": 0.0004496362810080354, "loss": 5.1604, "mean_token_accuracy": 0.20224442183971406, "num_tokens": 52119797.0, "step": 22750 }, { "entropy": 5.494365501403808, "epoch": 2.2494068801897984, "grad_norm": 1.0546875, "learning_rate": 0.0004496140273098123, "loss": 5.2043, "mean_token_accuracy": 0.19335196912288666, "num_tokens": 52132557.0, "step": 22755 }, { "entropy": 5.453974819183349, "epoch": 2.2499011466982997, "grad_norm": 1.0546875, "learning_rate": 0.00044959176931605704, "loss": 5.0079, "mean_token_accuracy": 0.20661089271306993, "num_tokens": 52144058.0, "step": 22760 }, { "entropy": 5.515575885772705, "epoch": 2.250395413206801, "grad_norm": 1.171875, "learning_rate": 0.00044956950702731714, "loss": 5.1447, "mean_token_accuracy": 0.20024342834949493, "num_tokens": 52155432.0, "step": 22765 }, { "entropy": 5.466350889205932, "epoch": 2.2508896797153026, "grad_norm": 1.1953125, "learning_rate": 0.0004495472404441403, "loss": 5.1019, "mean_token_accuracy": 0.20359287410974503, "num_tokens": 52166925.0, "step": 22770 }, { "entropy": 5.418187522888184, "epoch": 2.251383946223804, "grad_norm": 1.28125, "learning_rate": 0.0004495249695670742, "loss": 5.1046, "mean_token_accuracy": 0.19748883694410324, "num_tokens": 52177452.0, "step": 22775 }, { "entropy": 5.524319791793824, "epoch": 2.251878212732305, "grad_norm": 1.1640625, "learning_rate": 0.0004495026943966669, "loss": 5.1067, "mean_token_accuracy": 0.19903458505868912, "num_tokens": 52189288.0, "step": 22780 }, { "entropy": 5.449623775482178, "epoch": 2.2523724792408064, "grad_norm": 1.0546875, "learning_rate": 0.00044948041493346615, "loss": 5.0824, "mean_token_accuracy": 0.208235402405262, "num_tokens": 52199963.0, "step": 22785 }, { "entropy": 5.447674798965454, "epoch": 2.252866745749308, "grad_norm": 1.140625, "learning_rate": 0.0004494581311780202, "loss": 5.1508, "mean_token_accuracy": 0.197057144343853, "num_tokens": 52210727.0, "step": 22790 }, { "entropy": 5.535758781433105, "epoch": 2.2533610122578094, "grad_norm": 1.28125, "learning_rate": 0.00044943584313087705, "loss": 5.1514, "mean_token_accuracy": 0.1999640628695488, "num_tokens": 52222211.0, "step": 22795 }, { "entropy": 5.530038452148437, "epoch": 2.2538552787663106, "grad_norm": 1.1953125, "learning_rate": 0.00044941355079258517, "loss": 5.1971, "mean_token_accuracy": 0.1978902041912079, "num_tokens": 52234453.0, "step": 22800 }, { "entropy": 5.458242797851563, "epoch": 2.2543495452748123, "grad_norm": 1.1484375, "learning_rate": 0.0004493912541636928, "loss": 5.1292, "mean_token_accuracy": 0.2034463718533516, "num_tokens": 52246324.0, "step": 22805 }, { "entropy": 5.5805047988891605, "epoch": 2.2548438117833136, "grad_norm": 1.2421875, "learning_rate": 0.0004493689532447486, "loss": 5.1982, "mean_token_accuracy": 0.19785178899765016, "num_tokens": 52258223.0, "step": 22810 }, { "entropy": 5.531656694412232, "epoch": 2.255338078291815, "grad_norm": 1.1484375, "learning_rate": 0.0004493466480363011, "loss": 5.1814, "mean_token_accuracy": 0.2084525614976883, "num_tokens": 52270066.0, "step": 22815 }, { "entropy": 5.599063205718994, "epoch": 2.255832344800316, "grad_norm": 1.1796875, "learning_rate": 0.00044932433853889903, "loss": 5.2021, "mean_token_accuracy": 0.19684071838855743, "num_tokens": 52281366.0, "step": 22820 }, { "entropy": 5.526471471786499, "epoch": 2.256326611308818, "grad_norm": 1.1015625, "learning_rate": 0.0004493020247530912, "loss": 5.1876, "mean_token_accuracy": 0.1980804532766342, "num_tokens": 52292109.0, "step": 22825 }, { "entropy": 5.4550696849823, "epoch": 2.256820877817319, "grad_norm": 1.28125, "learning_rate": 0.0004492797066794264, "loss": 5.0005, "mean_token_accuracy": 0.21735651195049285, "num_tokens": 52302707.0, "step": 22830 }, { "entropy": 5.467882537841797, "epoch": 2.2573151443258204, "grad_norm": 1.1484375, "learning_rate": 0.00044925738431845385, "loss": 5.1137, "mean_token_accuracy": 0.20674028098583222, "num_tokens": 52313715.0, "step": 22835 }, { "entropy": 5.518535566329956, "epoch": 2.257809410834322, "grad_norm": 1.21875, "learning_rate": 0.00044923505767072267, "loss": 5.1412, "mean_token_accuracy": 0.19324890226125718, "num_tokens": 52325612.0, "step": 22840 }, { "entropy": 5.39333930015564, "epoch": 2.2583036773428233, "grad_norm": 1.1171875, "learning_rate": 0.00044921272673678197, "loss": 5.0204, "mean_token_accuracy": 0.21226562708616256, "num_tokens": 52338233.0, "step": 22845 }, { "entropy": 5.438125228881836, "epoch": 2.2587979438513246, "grad_norm": 1.0703125, "learning_rate": 0.0004491903915171812, "loss": 5.0594, "mean_token_accuracy": 0.20817974358797073, "num_tokens": 52348792.0, "step": 22850 }, { "entropy": 5.519145822525024, "epoch": 2.259292210359826, "grad_norm": 1.0546875, "learning_rate": 0.00044916805201246975, "loss": 5.1888, "mean_token_accuracy": 0.19983006715774537, "num_tokens": 52359334.0, "step": 22855 }, { "entropy": 5.510724115371704, "epoch": 2.2597864768683276, "grad_norm": 1.1953125, "learning_rate": 0.00044914570822319723, "loss": 5.1675, "mean_token_accuracy": 0.19261475503444672, "num_tokens": 52370600.0, "step": 22860 }, { "entropy": 5.573188018798828, "epoch": 2.260280743376829, "grad_norm": 1.0859375, "learning_rate": 0.0004491233601499132, "loss": 5.1712, "mean_token_accuracy": 0.19635389149188995, "num_tokens": 52382783.0, "step": 22865 }, { "entropy": 5.471719980239868, "epoch": 2.26077500988533, "grad_norm": 1.1015625, "learning_rate": 0.00044910100779316757, "loss": 5.0286, "mean_token_accuracy": 0.21403787583112716, "num_tokens": 52393372.0, "step": 22870 }, { "entropy": 5.4192633628845215, "epoch": 2.261269276393832, "grad_norm": 1.125, "learning_rate": 0.0004490786511535102, "loss": 5.0947, "mean_token_accuracy": 0.20197679698467255, "num_tokens": 52405181.0, "step": 22875 }, { "entropy": 5.521694707870483, "epoch": 2.261763542902333, "grad_norm": 1.0703125, "learning_rate": 0.00044905629023149084, "loss": 5.1169, "mean_token_accuracy": 0.2001598671078682, "num_tokens": 52417371.0, "step": 22880 }, { "entropy": 5.537524890899658, "epoch": 2.2622578094108343, "grad_norm": 1.125, "learning_rate": 0.0004490339250276598, "loss": 5.1677, "mean_token_accuracy": 0.19754072427749633, "num_tokens": 52428712.0, "step": 22885 }, { "entropy": 5.4326623439788815, "epoch": 2.2627520759193356, "grad_norm": 1.0703125, "learning_rate": 0.0004490115555425672, "loss": 5.1899, "mean_token_accuracy": 0.1943548008799553, "num_tokens": 52439764.0, "step": 22890 }, { "entropy": 5.508354759216308, "epoch": 2.263246342427837, "grad_norm": 1.1015625, "learning_rate": 0.0004489891817767634, "loss": 5.1601, "mean_token_accuracy": 0.19721818566322327, "num_tokens": 52451409.0, "step": 22895 }, { "entropy": 5.537233161926269, "epoch": 2.2637406089363385, "grad_norm": 1.1953125, "learning_rate": 0.00044896680373079874, "loss": 5.1405, "mean_token_accuracy": 0.19666795134544374, "num_tokens": 52461471.0, "step": 22900 }, { "entropy": 5.492299890518188, "epoch": 2.26423487544484, "grad_norm": 1.1875, "learning_rate": 0.00044894442140522365, "loss": 5.1408, "mean_token_accuracy": 0.19994232803583145, "num_tokens": 52472693.0, "step": 22905 }, { "entropy": 5.450560235977173, "epoch": 2.264729141953341, "grad_norm": 1.1015625, "learning_rate": 0.0004489220348005889, "loss": 5.0447, "mean_token_accuracy": 0.20792285203933716, "num_tokens": 52483449.0, "step": 22910 }, { "entropy": 5.461733865737915, "epoch": 2.265223408461843, "grad_norm": 1.1796875, "learning_rate": 0.000448899643917445, "loss": 5.1567, "mean_token_accuracy": 0.2060289889574051, "num_tokens": 52494048.0, "step": 22915 }, { "entropy": 5.463822650909424, "epoch": 2.265717674970344, "grad_norm": 1.2265625, "learning_rate": 0.0004488772487563429, "loss": 5.1581, "mean_token_accuracy": 0.19794767946004868, "num_tokens": 52506224.0, "step": 22920 }, { "entropy": 5.541604137420654, "epoch": 2.2662119414788453, "grad_norm": 1.0625, "learning_rate": 0.0004488548493178336, "loss": 5.1224, "mean_token_accuracy": 0.19185584932565689, "num_tokens": 52517157.0, "step": 22925 }, { "entropy": 5.5390482425689695, "epoch": 2.2667062079873466, "grad_norm": 1.1484375, "learning_rate": 0.00044883244560246793, "loss": 5.1923, "mean_token_accuracy": 0.1975897505879402, "num_tokens": 52528826.0, "step": 22930 }, { "entropy": 5.4939353466033936, "epoch": 2.2672004744958483, "grad_norm": 1.203125, "learning_rate": 0.0004488100376107972, "loss": 5.0324, "mean_token_accuracy": 0.20322360545396806, "num_tokens": 52540068.0, "step": 22935 }, { "entropy": 5.419287586212159, "epoch": 2.2676947410043495, "grad_norm": 1.2578125, "learning_rate": 0.0004487876253433726, "loss": 5.0789, "mean_token_accuracy": 0.20609167367219924, "num_tokens": 52552611.0, "step": 22940 }, { "entropy": 5.447744369506836, "epoch": 2.268189007512851, "grad_norm": 1.0859375, "learning_rate": 0.0004487652088007454, "loss": 5.137, "mean_token_accuracy": 0.20004348158836366, "num_tokens": 52564532.0, "step": 22945 }, { "entropy": 5.553086376190185, "epoch": 2.2686832740213525, "grad_norm": 1.2421875, "learning_rate": 0.0004487427879834671, "loss": 5.1752, "mean_token_accuracy": 0.19216422885656356, "num_tokens": 52576110.0, "step": 22950 }, { "entropy": 5.503455114364624, "epoch": 2.2691775405298538, "grad_norm": 1.125, "learning_rate": 0.00044872036289208926, "loss": 5.1293, "mean_token_accuracy": 0.19535443782806397, "num_tokens": 52586890.0, "step": 22955 }, { "entropy": 5.500127077102661, "epoch": 2.269671807038355, "grad_norm": 1.3515625, "learning_rate": 0.0004486979335271635, "loss": 5.096, "mean_token_accuracy": 0.20473039001226426, "num_tokens": 52598597.0, "step": 22960 }, { "entropy": 5.487302589416504, "epoch": 2.2701660735468563, "grad_norm": 1.1640625, "learning_rate": 0.00044867549988924176, "loss": 5.1021, "mean_token_accuracy": 0.20413933098316192, "num_tokens": 52609361.0, "step": 22965 }, { "entropy": 5.564129877090454, "epoch": 2.270660340055358, "grad_norm": 1.1328125, "learning_rate": 0.00044865306197887573, "loss": 5.1871, "mean_token_accuracy": 0.19465567469596862, "num_tokens": 52620954.0, "step": 22970 }, { "entropy": 5.533117437362671, "epoch": 2.2711546065638593, "grad_norm": 1.1015625, "learning_rate": 0.00044863061979661745, "loss": 5.2166, "mean_token_accuracy": 0.19608749449253082, "num_tokens": 52631944.0, "step": 22975 }, { "entropy": 5.546460723876953, "epoch": 2.2716488730723605, "grad_norm": 1.1484375, "learning_rate": 0.0004486081733430189, "loss": 5.1554, "mean_token_accuracy": 0.19546399414539337, "num_tokens": 52642517.0, "step": 22980 }, { "entropy": 5.534183692932129, "epoch": 2.2721431395808622, "grad_norm": 1.3359375, "learning_rate": 0.00044858572261863245, "loss": 5.2213, "mean_token_accuracy": 0.1979176253080368, "num_tokens": 52653654.0, "step": 22985 }, { "entropy": 5.535181665420533, "epoch": 2.2726374060893635, "grad_norm": 1.1875, "learning_rate": 0.0004485632676240102, "loss": 5.1827, "mean_token_accuracy": 0.1969092771410942, "num_tokens": 52666068.0, "step": 22990 }, { "entropy": 5.525499296188355, "epoch": 2.2731316725978647, "grad_norm": 1.25, "learning_rate": 0.0004485408083597047, "loss": 5.1275, "mean_token_accuracy": 0.1998702585697174, "num_tokens": 52677797.0, "step": 22995 }, { "entropy": 5.495450735092163, "epoch": 2.273625939106366, "grad_norm": 1.09375, "learning_rate": 0.0004485183448262684, "loss": 5.0917, "mean_token_accuracy": 0.20326270908117294, "num_tokens": 52688947.0, "step": 23000 }, { "entropy": 5.468483924865723, "epoch": 2.2741202056148677, "grad_norm": 1.15625, "learning_rate": 0.0004484958770242538, "loss": 5.1516, "mean_token_accuracy": 0.19325748682022095, "num_tokens": 52700357.0, "step": 23005 }, { "entropy": 5.555229949951172, "epoch": 2.274614472123369, "grad_norm": 1.078125, "learning_rate": 0.00044847340495421384, "loss": 5.2149, "mean_token_accuracy": 0.19237735420465468, "num_tokens": 52712602.0, "step": 23010 }, { "entropy": 5.545125246047974, "epoch": 2.2751087386318702, "grad_norm": 1.125, "learning_rate": 0.00044845092861670114, "loss": 5.117, "mean_token_accuracy": 0.20498985499143602, "num_tokens": 52723480.0, "step": 23015 }, { "entropy": 5.464772462844849, "epoch": 2.2756030051403715, "grad_norm": 1.1796875, "learning_rate": 0.0004484284480122688, "loss": 5.116, "mean_token_accuracy": 0.19864934980869292, "num_tokens": 52735418.0, "step": 23020 }, { "entropy": 5.438072538375854, "epoch": 2.276097271648873, "grad_norm": 1.109375, "learning_rate": 0.00044840596314146955, "loss": 5.0741, "mean_token_accuracy": 0.20668940246105194, "num_tokens": 52746308.0, "step": 23025 }, { "entropy": 5.442927551269531, "epoch": 2.2765915381573745, "grad_norm": 1.2265625, "learning_rate": 0.0004483834740048568, "loss": 5.0099, "mean_token_accuracy": 0.21110846549272538, "num_tokens": 52756834.0, "step": 23030 }, { "entropy": 5.47628870010376, "epoch": 2.2770858046658757, "grad_norm": 1.109375, "learning_rate": 0.0004483609806029837, "loss": 5.1298, "mean_token_accuracy": 0.19860559701919556, "num_tokens": 52768398.0, "step": 23035 }, { "entropy": 5.54872145652771, "epoch": 2.277580071174377, "grad_norm": 1.0703125, "learning_rate": 0.00044833848293640354, "loss": 5.2009, "mean_token_accuracy": 0.1981884017586708, "num_tokens": 52780062.0, "step": 23040 }, { "entropy": 5.513368606567383, "epoch": 2.2780743376828787, "grad_norm": 1.4375, "learning_rate": 0.00044831598100566984, "loss": 5.09, "mean_token_accuracy": 0.20428134500980377, "num_tokens": 52791760.0, "step": 23045 }, { "entropy": 5.465321445465088, "epoch": 2.27856860419138, "grad_norm": 1.15625, "learning_rate": 0.00044829347481133613, "loss": 5.036, "mean_token_accuracy": 0.20732480138540268, "num_tokens": 52802638.0, "step": 23050 }, { "entropy": 5.427728366851807, "epoch": 2.2790628706998812, "grad_norm": 1.2265625, "learning_rate": 0.000448270964353956, "loss": 5.1121, "mean_token_accuracy": 0.20298752635717393, "num_tokens": 52813590.0, "step": 23055 }, { "entropy": 5.48470025062561, "epoch": 2.279557137208383, "grad_norm": 1.203125, "learning_rate": 0.0004482484496340833, "loss": 5.1594, "mean_token_accuracy": 0.2083876460790634, "num_tokens": 52824177.0, "step": 23060 }, { "entropy": 5.59813232421875, "epoch": 2.280051403716884, "grad_norm": 1.1171875, "learning_rate": 0.0004482259306522719, "loss": 5.2527, "mean_token_accuracy": 0.19162196964025496, "num_tokens": 52834637.0, "step": 23065 }, { "entropy": 5.567384958267212, "epoch": 2.2805456702253855, "grad_norm": 1.1484375, "learning_rate": 0.00044820340740907565, "loss": 5.1801, "mean_token_accuracy": 0.1954122707247734, "num_tokens": 52847893.0, "step": 23070 }, { "entropy": 5.489695930480957, "epoch": 2.2810399367338867, "grad_norm": 1.2578125, "learning_rate": 0.0004481808799050488, "loss": 5.0891, "mean_token_accuracy": 0.2005574718117714, "num_tokens": 52859339.0, "step": 23075 }, { "entropy": 5.5077661037445065, "epoch": 2.2815342032423884, "grad_norm": 1.0859375, "learning_rate": 0.00044815834814074544, "loss": 5.1531, "mean_token_accuracy": 0.19729001671075821, "num_tokens": 52872405.0, "step": 23080 }, { "entropy": 5.452637004852295, "epoch": 2.2820284697508897, "grad_norm": 1.0859375, "learning_rate": 0.0004481358121167198, "loss": 5.0118, "mean_token_accuracy": 0.2136598214507103, "num_tokens": 52882187.0, "step": 23085 }, { "entropy": 5.449151563644409, "epoch": 2.282522736259391, "grad_norm": 1.1875, "learning_rate": 0.00044811327183352627, "loss": 5.0662, "mean_token_accuracy": 0.2134748011827469, "num_tokens": 52894004.0, "step": 23090 }, { "entropy": 5.593410968780518, "epoch": 2.2830170027678927, "grad_norm": 1.234375, "learning_rate": 0.0004480907272917195, "loss": 5.181, "mean_token_accuracy": 0.19056494385004044, "num_tokens": 52904749.0, "step": 23095 }, { "entropy": 5.482621431350708, "epoch": 2.283511269276394, "grad_norm": 1.1015625, "learning_rate": 0.0004480681784918539, "loss": 5.1273, "mean_token_accuracy": 0.19679268300533295, "num_tokens": 52915794.0, "step": 23100 }, { "entropy": 5.47328667640686, "epoch": 2.284005535784895, "grad_norm": 1.140625, "learning_rate": 0.00044804562543448436, "loss": 5.0791, "mean_token_accuracy": 0.20068948417901994, "num_tokens": 52926695.0, "step": 23105 }, { "entropy": 5.484558534622193, "epoch": 2.2844998022933964, "grad_norm": 1.234375, "learning_rate": 0.0004480230681201655, "loss": 5.0685, "mean_token_accuracy": 0.20456236600875854, "num_tokens": 52937824.0, "step": 23110 }, { "entropy": 5.471761465072632, "epoch": 2.284994068801898, "grad_norm": 1.125, "learning_rate": 0.00044800050654945233, "loss": 5.1097, "mean_token_accuracy": 0.20041943937540055, "num_tokens": 52949174.0, "step": 23115 }, { "entropy": 5.470703506469727, "epoch": 2.2854883353103994, "grad_norm": 1.3125, "learning_rate": 0.00044797794072289987, "loss": 5.1861, "mean_token_accuracy": 0.20034543722867965, "num_tokens": 52960675.0, "step": 23120 }, { "entropy": 5.4820891380310055, "epoch": 2.2859826018189007, "grad_norm": 1.3125, "learning_rate": 0.00044795537064106335, "loss": 5.1212, "mean_token_accuracy": 0.20402951240539552, "num_tokens": 52971705.0, "step": 23125 }, { "entropy": 5.525818157196045, "epoch": 2.2864768683274024, "grad_norm": 1.0703125, "learning_rate": 0.00044793279630449777, "loss": 5.1499, "mean_token_accuracy": 0.19926250576972962, "num_tokens": 52983025.0, "step": 23130 }, { "entropy": 5.524250793457031, "epoch": 2.2869711348359036, "grad_norm": 1.09375, "learning_rate": 0.0004479102177137586, "loss": 5.131, "mean_token_accuracy": 0.19605901688337327, "num_tokens": 52993810.0, "step": 23135 }, { "entropy": 5.489673519134522, "epoch": 2.287465401344405, "grad_norm": 1.0546875, "learning_rate": 0.0004478876348694012, "loss": 5.1244, "mean_token_accuracy": 0.19711627215147018, "num_tokens": 53005902.0, "step": 23140 }, { "entropy": 5.5297948837280275, "epoch": 2.287959667852906, "grad_norm": 1.2265625, "learning_rate": 0.0004478650477719812, "loss": 5.1486, "mean_token_accuracy": 0.19510836154222488, "num_tokens": 53017511.0, "step": 23145 }, { "entropy": 5.435140991210938, "epoch": 2.2884539343614074, "grad_norm": 1.0859375, "learning_rate": 0.0004478424564220542, "loss": 5.0261, "mean_token_accuracy": 0.2113171711564064, "num_tokens": 53028514.0, "step": 23150 }, { "entropy": 5.4668066024780275, "epoch": 2.288948200869909, "grad_norm": 1.140625, "learning_rate": 0.00044781986082017595, "loss": 5.0937, "mean_token_accuracy": 0.20100184082984923, "num_tokens": 53039338.0, "step": 23155 }, { "entropy": 5.510946655273438, "epoch": 2.2894424673784104, "grad_norm": 1.140625, "learning_rate": 0.00044779726096690227, "loss": 5.0705, "mean_token_accuracy": 0.2000217169523239, "num_tokens": 53050877.0, "step": 23160 }, { "entropy": 5.512349271774292, "epoch": 2.2899367338869117, "grad_norm": 1.15625, "learning_rate": 0.0004477746568627892, "loss": 5.128, "mean_token_accuracy": 0.19688339978456498, "num_tokens": 53062819.0, "step": 23165 }, { "entropy": 5.520561408996582, "epoch": 2.2904310003954134, "grad_norm": 1.28125, "learning_rate": 0.00044775204850839277, "loss": 5.1851, "mean_token_accuracy": 0.20069462358951567, "num_tokens": 53073486.0, "step": 23170 }, { "entropy": 5.466833448410034, "epoch": 2.2909252669039146, "grad_norm": 1.3125, "learning_rate": 0.0004477294359042692, "loss": 5.0868, "mean_token_accuracy": 0.20201147049665452, "num_tokens": 53084499.0, "step": 23175 }, { "entropy": 5.455143833160401, "epoch": 2.291419533412416, "grad_norm": 1.03125, "learning_rate": 0.0004477068190509747, "loss": 5.1603, "mean_token_accuracy": 0.1973249763250351, "num_tokens": 53097181.0, "step": 23180 }, { "entropy": 5.588787698745728, "epoch": 2.291913799920917, "grad_norm": 1.3125, "learning_rate": 0.00044768419794906556, "loss": 5.2094, "mean_token_accuracy": 0.20154581665992738, "num_tokens": 53108586.0, "step": 23185 }, { "entropy": 5.55732741355896, "epoch": 2.292408066429419, "grad_norm": 1.1171875, "learning_rate": 0.00044766157259909853, "loss": 5.0929, "mean_token_accuracy": 0.19937171489000322, "num_tokens": 53119481.0, "step": 23190 }, { "entropy": 5.515818977355957, "epoch": 2.29290233293792, "grad_norm": 1.1640625, "learning_rate": 0.0004476389430016299, "loss": 5.0843, "mean_token_accuracy": 0.20422664731740953, "num_tokens": 53129482.0, "step": 23195 }, { "entropy": 5.4313812255859375, "epoch": 2.2933965994464214, "grad_norm": 1.0859375, "learning_rate": 0.00044761630915721645, "loss": 5.1087, "mean_token_accuracy": 0.20126821249723434, "num_tokens": 53142311.0, "step": 23200 }, { "entropy": 5.453479480743408, "epoch": 2.293890865954923, "grad_norm": 1.0859375, "learning_rate": 0.0004475936710664151, "loss": 5.0825, "mean_token_accuracy": 0.1988782837986946, "num_tokens": 53153485.0, "step": 23205 }, { "entropy": 5.480115556716919, "epoch": 2.2943851324634243, "grad_norm": 1.15625, "learning_rate": 0.0004475710287297826, "loss": 5.1159, "mean_token_accuracy": 0.2007051572203636, "num_tokens": 53164121.0, "step": 23210 }, { "entropy": 5.506258010864258, "epoch": 2.2948793989719256, "grad_norm": 1.90625, "learning_rate": 0.0004475483821478761, "loss": 5.1076, "mean_token_accuracy": 0.19337636530399321, "num_tokens": 53174949.0, "step": 23215 }, { "entropy": 5.462037229537964, "epoch": 2.295373665480427, "grad_norm": 1.125, "learning_rate": 0.00044752573132125263, "loss": 5.0712, "mean_token_accuracy": 0.2067439004778862, "num_tokens": 53186762.0, "step": 23220 }, { "entropy": 5.4800573825836185, "epoch": 2.2958679319889286, "grad_norm": 1.1171875, "learning_rate": 0.0004475030762504694, "loss": 5.1167, "mean_token_accuracy": 0.20075072348117828, "num_tokens": 53198261.0, "step": 23225 }, { "entropy": 5.4227396011352536, "epoch": 2.29636219849743, "grad_norm": 1.125, "learning_rate": 0.0004474804169360836, "loss": 5.0288, "mean_token_accuracy": 0.20761310756206514, "num_tokens": 53209143.0, "step": 23230 }, { "entropy": 5.5744444847106935, "epoch": 2.296856465005931, "grad_norm": 1.078125, "learning_rate": 0.00044745775337865293, "loss": 5.2812, "mean_token_accuracy": 0.1950062021613121, "num_tokens": 53222619.0, "step": 23235 }, { "entropy": 5.494481086730957, "epoch": 2.297350731514433, "grad_norm": 1.15625, "learning_rate": 0.00044743508557873473, "loss": 5.0608, "mean_token_accuracy": 0.20697817504405974, "num_tokens": 53233829.0, "step": 23240 }, { "entropy": 5.536629629135132, "epoch": 2.297844998022934, "grad_norm": 1.1484375, "learning_rate": 0.00044741241353688665, "loss": 5.1472, "mean_token_accuracy": 0.19830814599990845, "num_tokens": 53244248.0, "step": 23245 }, { "entropy": 5.5566905498504635, "epoch": 2.2983392645314353, "grad_norm": 1.140625, "learning_rate": 0.0004473897372536665, "loss": 5.1643, "mean_token_accuracy": 0.1976460799574852, "num_tokens": 53255638.0, "step": 23250 }, { "entropy": 5.483745908737182, "epoch": 2.2988335310399366, "grad_norm": 1.2578125, "learning_rate": 0.000447367056729632, "loss": 5.1147, "mean_token_accuracy": 0.19571523219347, "num_tokens": 53265798.0, "step": 23255 }, { "entropy": 5.465081357955933, "epoch": 2.2993277975484383, "grad_norm": 1.265625, "learning_rate": 0.0004473443719653412, "loss": 5.141, "mean_token_accuracy": 0.19944766014814377, "num_tokens": 53278001.0, "step": 23260 }, { "entropy": 5.589875316619873, "epoch": 2.2998220640569396, "grad_norm": 1.1328125, "learning_rate": 0.00044732168296135217, "loss": 5.1673, "mean_token_accuracy": 0.2008986458182335, "num_tokens": 53289742.0, "step": 23265 }, { "entropy": 5.528914499282837, "epoch": 2.300316330565441, "grad_norm": 1.1171875, "learning_rate": 0.00044729898971822296, "loss": 5.0955, "mean_token_accuracy": 0.20144775360822678, "num_tokens": 53301285.0, "step": 23270 }, { "entropy": 5.405538702011109, "epoch": 2.300810597073942, "grad_norm": 1.1328125, "learning_rate": 0.0004472762922365118, "loss": 5.0221, "mean_token_accuracy": 0.20915012955665588, "num_tokens": 53312883.0, "step": 23275 }, { "entropy": 5.51207013130188, "epoch": 2.301304863582444, "grad_norm": 1.1328125, "learning_rate": 0.0004472535905167773, "loss": 5.1753, "mean_token_accuracy": 0.195101198554039, "num_tokens": 53325215.0, "step": 23280 }, { "entropy": 5.562971067428589, "epoch": 2.301799130090945, "grad_norm": 1.1015625, "learning_rate": 0.0004472308845595776, "loss": 5.186, "mean_token_accuracy": 0.19648344069719315, "num_tokens": 53337104.0, "step": 23285 }, { "entropy": 5.499239587783814, "epoch": 2.3022933965994463, "grad_norm": 1.1171875, "learning_rate": 0.0004472081743654715, "loss": 5.1639, "mean_token_accuracy": 0.1996285080909729, "num_tokens": 53348097.0, "step": 23290 }, { "entropy": 5.487429618835449, "epoch": 2.3027876631079476, "grad_norm": 1.1640625, "learning_rate": 0.00044718545993501754, "loss": 5.0453, "mean_token_accuracy": 0.21309808343648912, "num_tokens": 53358405.0, "step": 23295 }, { "entropy": 5.486831521987915, "epoch": 2.3032819296164493, "grad_norm": 1.1640625, "learning_rate": 0.0004471627412687745, "loss": 5.1517, "mean_token_accuracy": 0.19874357283115388, "num_tokens": 53370012.0, "step": 23300 }, { "entropy": 5.5608631610870365, "epoch": 2.3037761961249505, "grad_norm": 1.0703125, "learning_rate": 0.00044714001836730145, "loss": 5.2464, "mean_token_accuracy": 0.19255422353744506, "num_tokens": 53383214.0, "step": 23305 }, { "entropy": 5.5540711879730225, "epoch": 2.304270462633452, "grad_norm": 1.1171875, "learning_rate": 0.00044711729123115716, "loss": 5.1807, "mean_token_accuracy": 0.19741398990154266, "num_tokens": 53395672.0, "step": 23310 }, { "entropy": 5.493957901000977, "epoch": 2.3047647291419535, "grad_norm": 1.1015625, "learning_rate": 0.00044709455986090084, "loss": 5.1103, "mean_token_accuracy": 0.20291218608617784, "num_tokens": 53407577.0, "step": 23315 }, { "entropy": 5.465126323699951, "epoch": 2.305258995650455, "grad_norm": 1.125, "learning_rate": 0.0004470718242570916, "loss": 5.0536, "mean_token_accuracy": 0.20453666001558304, "num_tokens": 53417772.0, "step": 23320 }, { "entropy": 5.504280376434326, "epoch": 2.305753262158956, "grad_norm": 1.125, "learning_rate": 0.0004470490844202889, "loss": 5.1383, "mean_token_accuracy": 0.1986495777964592, "num_tokens": 53429675.0, "step": 23325 }, { "entropy": 5.475494337081909, "epoch": 2.3062475286674573, "grad_norm": 1.09375, "learning_rate": 0.0004470263403510519, "loss": 5.1488, "mean_token_accuracy": 0.19634604156017305, "num_tokens": 53442352.0, "step": 23330 }, { "entropy": 5.575124979019165, "epoch": 2.306741795175959, "grad_norm": 1.1015625, "learning_rate": 0.00044700359204994034, "loss": 5.297, "mean_token_accuracy": 0.19076389372348784, "num_tokens": 53453710.0, "step": 23335 }, { "entropy": 5.560633802413941, "epoch": 2.3072360616844603, "grad_norm": 1.1953125, "learning_rate": 0.00044698083951751365, "loss": 5.0994, "mean_token_accuracy": 0.21239494532346725, "num_tokens": 53464764.0, "step": 23340 }, { "entropy": 5.466793012619019, "epoch": 2.3077303281929615, "grad_norm": 1.0859375, "learning_rate": 0.0004469580827543318, "loss": 5.0604, "mean_token_accuracy": 0.20844493955373763, "num_tokens": 53476495.0, "step": 23345 }, { "entropy": 5.478285503387451, "epoch": 2.3082245947014632, "grad_norm": 1.3359375, "learning_rate": 0.0004469353217609542, "loss": 5.1509, "mean_token_accuracy": 0.19525968730449678, "num_tokens": 53488613.0, "step": 23350 }, { "entropy": 5.556738948822021, "epoch": 2.3087188612099645, "grad_norm": 1.1015625, "learning_rate": 0.0004469125565379411, "loss": 5.2414, "mean_token_accuracy": 0.1921929031610489, "num_tokens": 53501851.0, "step": 23355 }, { "entropy": 5.520310640335083, "epoch": 2.3092131277184658, "grad_norm": 1.078125, "learning_rate": 0.0004468897870858525, "loss": 5.1446, "mean_token_accuracy": 0.19475848972797394, "num_tokens": 53514325.0, "step": 23360 }, { "entropy": 5.602771520614624, "epoch": 2.309707394226967, "grad_norm": 1.1171875, "learning_rate": 0.00044686701340524836, "loss": 5.1037, "mean_token_accuracy": 0.2014873206615448, "num_tokens": 53525717.0, "step": 23365 }, { "entropy": 5.486196565628052, "epoch": 2.3102016607354687, "grad_norm": 1.15625, "learning_rate": 0.0004468442354966891, "loss": 5.1321, "mean_token_accuracy": 0.19803317934274672, "num_tokens": 53536488.0, "step": 23370 }, { "entropy": 5.55515341758728, "epoch": 2.31069592724397, "grad_norm": 1.125, "learning_rate": 0.000446821453360735, "loss": 5.2405, "mean_token_accuracy": 0.19185070991516112, "num_tokens": 53547230.0, "step": 23375 }, { "entropy": 5.568988847732544, "epoch": 2.3111901937524713, "grad_norm": 1.15625, "learning_rate": 0.00044679866699794644, "loss": 5.243, "mean_token_accuracy": 0.19400170147418977, "num_tokens": 53558673.0, "step": 23380 }, { "entropy": 5.493989706039429, "epoch": 2.311684460260973, "grad_norm": 1.203125, "learning_rate": 0.0004467758764088841, "loss": 5.0809, "mean_token_accuracy": 0.20522097051143645, "num_tokens": 53570088.0, "step": 23385 }, { "entropy": 5.450780439376831, "epoch": 2.3121787267694742, "grad_norm": 1.34375, "learning_rate": 0.0004467530815941085, "loss": 5.1452, "mean_token_accuracy": 0.20699031352996827, "num_tokens": 53582115.0, "step": 23390 }, { "entropy": 5.466097831726074, "epoch": 2.3126729932779755, "grad_norm": 1.4296875, "learning_rate": 0.00044673028255418047, "loss": 5.1537, "mean_token_accuracy": 0.1980408251285553, "num_tokens": 53594719.0, "step": 23395 }, { "entropy": 5.394616746902466, "epoch": 2.3131672597864767, "grad_norm": 1.171875, "learning_rate": 0.0004467074792896608, "loss": 4.9782, "mean_token_accuracy": 0.21327086687088012, "num_tokens": 53606453.0, "step": 23400 }, { "entropy": 5.504375743865967, "epoch": 2.313661526294978, "grad_norm": 1.140625, "learning_rate": 0.00044668467180111054, "loss": 5.1087, "mean_token_accuracy": 0.20375683009624482, "num_tokens": 53617038.0, "step": 23405 }, { "entropy": 5.565079164505005, "epoch": 2.3141557928034797, "grad_norm": 1.1328125, "learning_rate": 0.00044666186008909077, "loss": 5.1332, "mean_token_accuracy": 0.20720221996307372, "num_tokens": 53627230.0, "step": 23410 }, { "entropy": 5.537656307220459, "epoch": 2.314650059311981, "grad_norm": 1.1875, "learning_rate": 0.00044663904415416245, "loss": 5.2022, "mean_token_accuracy": 0.19191043674945832, "num_tokens": 53638247.0, "step": 23415 }, { "entropy": 5.55374002456665, "epoch": 2.3151443258204822, "grad_norm": 1.1171875, "learning_rate": 0.0004466162239968871, "loss": 5.1032, "mean_token_accuracy": 0.20352677553892135, "num_tokens": 53648643.0, "step": 23420 }, { "entropy": 5.445544576644897, "epoch": 2.315638592328984, "grad_norm": 1.1953125, "learning_rate": 0.0004465933996178261, "loss": 5.0522, "mean_token_accuracy": 0.21596429944038392, "num_tokens": 53659715.0, "step": 23425 }, { "entropy": 5.412439489364624, "epoch": 2.316132858837485, "grad_norm": 1.078125, "learning_rate": 0.00044657057101754073, "loss": 5.0942, "mean_token_accuracy": 0.20142505466938018, "num_tokens": 53671119.0, "step": 23430 }, { "entropy": 5.525711870193481, "epoch": 2.3166271253459865, "grad_norm": 1.1953125, "learning_rate": 0.00044654773819659277, "loss": 5.098, "mean_token_accuracy": 0.20247145742177963, "num_tokens": 53682145.0, "step": 23435 }, { "entropy": 5.512628793716431, "epoch": 2.3171213918544877, "grad_norm": 1.125, "learning_rate": 0.00044652490115554386, "loss": 5.0789, "mean_token_accuracy": 0.20571796894073485, "num_tokens": 53693882.0, "step": 23440 }, { "entropy": 5.491055965423584, "epoch": 2.3176156583629894, "grad_norm": 1.15625, "learning_rate": 0.0004465020598949557, "loss": 5.1466, "mean_token_accuracy": 0.1952258065342903, "num_tokens": 53706010.0, "step": 23445 }, { "entropy": 5.506443643569947, "epoch": 2.3181099248714907, "grad_norm": 1.1171875, "learning_rate": 0.0004464792144153903, "loss": 5.1684, "mean_token_accuracy": 0.19902730435132981, "num_tokens": 53717657.0, "step": 23450 }, { "entropy": 5.496538877487183, "epoch": 2.318604191379992, "grad_norm": 1.1171875, "learning_rate": 0.0004464563647174096, "loss": 5.1168, "mean_token_accuracy": 0.20432027280330659, "num_tokens": 53729181.0, "step": 23455 }, { "entropy": 5.463153886795044, "epoch": 2.3190984578884937, "grad_norm": 1.1328125, "learning_rate": 0.0004464335108015757, "loss": 5.1124, "mean_token_accuracy": 0.20904105603694917, "num_tokens": 53740864.0, "step": 23460 }, { "entropy": 5.427383089065552, "epoch": 2.319592724396995, "grad_norm": 1.1640625, "learning_rate": 0.0004464106526684509, "loss": 5.0849, "mean_token_accuracy": 0.19871028363704682, "num_tokens": 53751726.0, "step": 23465 }, { "entropy": 5.548200511932373, "epoch": 2.320086990905496, "grad_norm": 1.125, "learning_rate": 0.0004463877903185974, "loss": 5.1608, "mean_token_accuracy": 0.20029897391796112, "num_tokens": 53763629.0, "step": 23470 }, { "entropy": 5.4977686405181885, "epoch": 2.3205812574139975, "grad_norm": 1.1015625, "learning_rate": 0.0004463649237525777, "loss": 5.1087, "mean_token_accuracy": 0.2064816877245903, "num_tokens": 53774814.0, "step": 23475 }, { "entropy": 5.508954572677612, "epoch": 2.321075523922499, "grad_norm": 1.0859375, "learning_rate": 0.0004463420529709543, "loss": 5.1188, "mean_token_accuracy": 0.20268789529800416, "num_tokens": 53786298.0, "step": 23480 }, { "entropy": 5.4936525344848635, "epoch": 2.3215697904310004, "grad_norm": 1.1640625, "learning_rate": 0.00044631917797428985, "loss": 5.1336, "mean_token_accuracy": 0.20196058750152587, "num_tokens": 53798509.0, "step": 23485 }, { "entropy": 5.538892650604248, "epoch": 2.3220640569395017, "grad_norm": 1.09375, "learning_rate": 0.000446296298763147, "loss": 5.2041, "mean_token_accuracy": 0.19422084987163543, "num_tokens": 53810689.0, "step": 23490 }, { "entropy": 5.552839946746826, "epoch": 2.3225583234480034, "grad_norm": 1.140625, "learning_rate": 0.0004462734153380886, "loss": 5.167, "mean_token_accuracy": 0.19996706545352935, "num_tokens": 53822432.0, "step": 23495 }, { "entropy": 5.472344160079956, "epoch": 2.3230525899565047, "grad_norm": 1.203125, "learning_rate": 0.00044625052769967766, "loss": 5.1063, "mean_token_accuracy": 0.20293254554271697, "num_tokens": 53833701.0, "step": 23500 }, { "entropy": 5.4395078182220455, "epoch": 2.323546856465006, "grad_norm": 1.1640625, "learning_rate": 0.00044622763584847716, "loss": 5.0618, "mean_token_accuracy": 0.20664691776037217, "num_tokens": 53844413.0, "step": 23505 }, { "entropy": 5.444320011138916, "epoch": 2.324041122973507, "grad_norm": 1.5078125, "learning_rate": 0.00044620473978505023, "loss": 5.0284, "mean_token_accuracy": 0.20945281833410262, "num_tokens": 53856392.0, "step": 23510 }, { "entropy": 5.525319910049438, "epoch": 2.324535389482009, "grad_norm": 1.1953125, "learning_rate": 0.00044618183950996017, "loss": 5.1319, "mean_token_accuracy": 0.20306480377912522, "num_tokens": 53867938.0, "step": 23515 }, { "entropy": 5.41705470085144, "epoch": 2.32502965599051, "grad_norm": 1.109375, "learning_rate": 0.0004461589350237702, "loss": 4.9996, "mean_token_accuracy": 0.21202801167964935, "num_tokens": 53878153.0, "step": 23520 }, { "entropy": 5.391370391845703, "epoch": 2.3255239224990114, "grad_norm": 1.3203125, "learning_rate": 0.000446136026327044, "loss": 5.0413, "mean_token_accuracy": 0.20732551962137222, "num_tokens": 53889090.0, "step": 23525 }, { "entropy": 5.479256916046142, "epoch": 2.3260181890075127, "grad_norm": 1.21875, "learning_rate": 0.00044611311342034494, "loss": 5.0974, "mean_token_accuracy": 0.20184465795755385, "num_tokens": 53900459.0, "step": 23530 }, { "entropy": 5.505434036254883, "epoch": 2.3265124555160144, "grad_norm": 1.1015625, "learning_rate": 0.0004460901963042368, "loss": 5.0879, "mean_token_accuracy": 0.2103040859103203, "num_tokens": 53912815.0, "step": 23535 }, { "entropy": 5.393052387237549, "epoch": 2.3270067220245156, "grad_norm": 1.140625, "learning_rate": 0.00044606727497928324, "loss": 5.0335, "mean_token_accuracy": 0.2069545015692711, "num_tokens": 53924387.0, "step": 23540 }, { "entropy": 5.533142518997193, "epoch": 2.327500988533017, "grad_norm": 1.171875, "learning_rate": 0.00044604434944604826, "loss": 5.1462, "mean_token_accuracy": 0.19943773448467256, "num_tokens": 53936147.0, "step": 23545 }, { "entropy": 5.487486839294434, "epoch": 2.327995255041518, "grad_norm": 1.1484375, "learning_rate": 0.0004460214197050956, "loss": 5.1502, "mean_token_accuracy": 0.20245511084794998, "num_tokens": 53948102.0, "step": 23550 }, { "entropy": 5.495618772506714, "epoch": 2.32848952155002, "grad_norm": 1.109375, "learning_rate": 0.0004459984857569896, "loss": 5.16, "mean_token_accuracy": 0.1969030112028122, "num_tokens": 53959721.0, "step": 23555 }, { "entropy": 5.493838167190551, "epoch": 2.328983788058521, "grad_norm": 1.1328125, "learning_rate": 0.00044597554760229433, "loss": 5.1014, "mean_token_accuracy": 0.20428686290979386, "num_tokens": 53970302.0, "step": 23560 }, { "entropy": 5.56297116279602, "epoch": 2.3294780545670224, "grad_norm": 1.0859375, "learning_rate": 0.000445952605241574, "loss": 5.2023, "mean_token_accuracy": 0.19855889081954955, "num_tokens": 53982198.0, "step": 23565 }, { "entropy": 5.57087082862854, "epoch": 2.329972321075524, "grad_norm": 0.984375, "learning_rate": 0.00044592965867539306, "loss": 5.2452, "mean_token_accuracy": 0.1899275541305542, "num_tokens": 53994443.0, "step": 23570 }, { "entropy": 5.49559383392334, "epoch": 2.3304665875840254, "grad_norm": 1.140625, "learning_rate": 0.00044590670790431604, "loss": 5.0914, "mean_token_accuracy": 0.1998365491628647, "num_tokens": 54005666.0, "step": 23575 }, { "entropy": 5.490523338317871, "epoch": 2.3309608540925266, "grad_norm": 1.046875, "learning_rate": 0.0004458837529289074, "loss": 5.06, "mean_token_accuracy": 0.20578380674123764, "num_tokens": 54016173.0, "step": 23580 }, { "entropy": 5.459340524673462, "epoch": 2.331455120601028, "grad_norm": 1.109375, "learning_rate": 0.0004458607937497321, "loss": 5.1898, "mean_token_accuracy": 0.1971178501844406, "num_tokens": 54027743.0, "step": 23585 }, { "entropy": 5.569420003890992, "epoch": 2.3319493871095296, "grad_norm": 1.15625, "learning_rate": 0.0004458378303673546, "loss": 5.2056, "mean_token_accuracy": 0.19677744656801224, "num_tokens": 54039804.0, "step": 23590 }, { "entropy": 5.541219663619995, "epoch": 2.332443653618031, "grad_norm": 1.2734375, "learning_rate": 0.0004458148627823401, "loss": 5.1573, "mean_token_accuracy": 0.2018059328198433, "num_tokens": 54050202.0, "step": 23595 }, { "entropy": 5.513109111785889, "epoch": 2.332937920126532, "grad_norm": 1.171875, "learning_rate": 0.00044579189099525334, "loss": 5.0865, "mean_token_accuracy": 0.20463416576385499, "num_tokens": 54061088.0, "step": 23600 }, { "entropy": 5.384110307693481, "epoch": 2.333432186635034, "grad_norm": 1.0546875, "learning_rate": 0.00044576891500665967, "loss": 5.0507, "mean_token_accuracy": 0.2078115776181221, "num_tokens": 54072524.0, "step": 23605 }, { "entropy": 5.491816186904908, "epoch": 2.333926453143535, "grad_norm": 1.1328125, "learning_rate": 0.0004457459348171242, "loss": 5.1273, "mean_token_accuracy": 0.20243655890226364, "num_tokens": 54083265.0, "step": 23610 }, { "entropy": 5.497485733032226, "epoch": 2.3344207196520363, "grad_norm": 1.15625, "learning_rate": 0.00044572295042721215, "loss": 5.0544, "mean_token_accuracy": 0.21348097324371337, "num_tokens": 54093848.0, "step": 23615 }, { "entropy": 5.3828592777252195, "epoch": 2.3349149861605376, "grad_norm": 1.1640625, "learning_rate": 0.00044569996183748913, "loss": 5.0863, "mean_token_accuracy": 0.21013254076242446, "num_tokens": 54104595.0, "step": 23620 }, { "entropy": 5.390149164199829, "epoch": 2.3354092526690393, "grad_norm": 1.078125, "learning_rate": 0.00044567696904852057, "loss": 4.9934, "mean_token_accuracy": 0.2143635034561157, "num_tokens": 54115577.0, "step": 23625 }, { "entropy": 5.453815269470215, "epoch": 2.3359035191775406, "grad_norm": 1.2109375, "learning_rate": 0.000445653972060872, "loss": 5.0591, "mean_token_accuracy": 0.21048001050949097, "num_tokens": 54125579.0, "step": 23630 }, { "entropy": 5.481170225143432, "epoch": 2.336397785686042, "grad_norm": 1.1328125, "learning_rate": 0.00044563097087510934, "loss": 5.1833, "mean_token_accuracy": 0.1960402324795723, "num_tokens": 54137895.0, "step": 23635 }, { "entropy": 5.5386457443237305, "epoch": 2.3368920521945435, "grad_norm": 1.125, "learning_rate": 0.00044560796549179826, "loss": 5.1736, "mean_token_accuracy": 0.19894063472747803, "num_tokens": 54149423.0, "step": 23640 }, { "entropy": 5.584706878662109, "epoch": 2.337386318703045, "grad_norm": 1.1328125, "learning_rate": 0.0004455849559115048, "loss": 5.1806, "mean_token_accuracy": 0.19322724342346193, "num_tokens": 54160743.0, "step": 23645 }, { "entropy": 5.536889839172363, "epoch": 2.337880585211546, "grad_norm": 1.1875, "learning_rate": 0.0004455619421347949, "loss": 5.179, "mean_token_accuracy": 0.2005209058523178, "num_tokens": 54171517.0, "step": 23650 }, { "entropy": 5.476043319702148, "epoch": 2.3383748517200473, "grad_norm": 1.1171875, "learning_rate": 0.00044553892416223485, "loss": 5.0418, "mean_token_accuracy": 0.20947880148887635, "num_tokens": 54182959.0, "step": 23655 }, { "entropy": 5.507992935180664, "epoch": 2.3388691182285486, "grad_norm": 1.140625, "learning_rate": 0.00044551590199439075, "loss": 5.1434, "mean_token_accuracy": 0.2021603763103485, "num_tokens": 54194577.0, "step": 23660 }, { "entropy": 5.538587045669556, "epoch": 2.3393633847370503, "grad_norm": 1.0625, "learning_rate": 0.000445492875631829, "loss": 5.2715, "mean_token_accuracy": 0.18710128962993622, "num_tokens": 54207423.0, "step": 23665 }, { "entropy": 5.534144544601441, "epoch": 2.3398576512455516, "grad_norm": 1.140625, "learning_rate": 0.0004454698450751161, "loss": 5.1083, "mean_token_accuracy": 0.2027324616909027, "num_tokens": 54218776.0, "step": 23670 }, { "entropy": 5.4754339218139645, "epoch": 2.340351917754053, "grad_norm": 1.015625, "learning_rate": 0.0004454468103248186, "loss": 5.0326, "mean_token_accuracy": 0.21028360724449158, "num_tokens": 54229508.0, "step": 23675 }, { "entropy": 5.491382312774658, "epoch": 2.3408461842625545, "grad_norm": 1.046875, "learning_rate": 0.000445423771381503, "loss": 5.2049, "mean_token_accuracy": 0.19385700821876525, "num_tokens": 54240546.0, "step": 23680 }, { "entropy": 5.504705762863159, "epoch": 2.341340450771056, "grad_norm": 1.1328125, "learning_rate": 0.0004454007282457364, "loss": 5.1434, "mean_token_accuracy": 0.20375026017427444, "num_tokens": 54252486.0, "step": 23685 }, { "entropy": 5.573255968093872, "epoch": 2.341834717279557, "grad_norm": 1.140625, "learning_rate": 0.00044537768091808516, "loss": 5.1426, "mean_token_accuracy": 0.19717117697000502, "num_tokens": 54264240.0, "step": 23690 }, { "entropy": 5.467287826538086, "epoch": 2.3423289837880583, "grad_norm": 1.1875, "learning_rate": 0.0004453546293991168, "loss": 5.0862, "mean_token_accuracy": 0.2083623930811882, "num_tokens": 54275894.0, "step": 23695 }, { "entropy": 5.546685075759887, "epoch": 2.34282325029656, "grad_norm": 1.109375, "learning_rate": 0.000445331573689398, "loss": 5.1677, "mean_token_accuracy": 0.19838058948516846, "num_tokens": 54287697.0, "step": 23700 }, { "entropy": 5.477003860473633, "epoch": 2.3433175168050613, "grad_norm": 1.21875, "learning_rate": 0.000445308513789496, "loss": 5.052, "mean_token_accuracy": 0.21468464881181717, "num_tokens": 54300327.0, "step": 23705 }, { "entropy": 5.496341800689697, "epoch": 2.3438117833135625, "grad_norm": 1.109375, "learning_rate": 0.00044528544969997823, "loss": 5.1978, "mean_token_accuracy": 0.19531141966581345, "num_tokens": 54311949.0, "step": 23710 }, { "entropy": 5.486055850982666, "epoch": 2.3443060498220643, "grad_norm": 1.1484375, "learning_rate": 0.00044526238142141196, "loss": 5.0846, "mean_token_accuracy": 0.20470067113637924, "num_tokens": 54322134.0, "step": 23715 }, { "entropy": 5.525734996795654, "epoch": 2.3448003163305655, "grad_norm": 0.99609375, "learning_rate": 0.00044523930895436475, "loss": 5.2081, "mean_token_accuracy": 0.1906544268131256, "num_tokens": 54334579.0, "step": 23720 }, { "entropy": 5.53402533531189, "epoch": 2.3452945828390668, "grad_norm": 1.2890625, "learning_rate": 0.00044521623229940407, "loss": 5.126, "mean_token_accuracy": 0.19673534482717514, "num_tokens": 54346624.0, "step": 23725 }, { "entropy": 5.449519395828247, "epoch": 2.345788849347568, "grad_norm": 1.3046875, "learning_rate": 0.00044519315145709765, "loss": 5.0788, "mean_token_accuracy": 0.2061922326683998, "num_tokens": 54356455.0, "step": 23730 }, { "entropy": 5.579105615615845, "epoch": 2.3462831158560697, "grad_norm": 1.125, "learning_rate": 0.0004451700664280133, "loss": 5.2369, "mean_token_accuracy": 0.19721528589725495, "num_tokens": 54368141.0, "step": 23735 }, { "entropy": 5.509838581085205, "epoch": 2.346777382364571, "grad_norm": 1.4375, "learning_rate": 0.000445146977212719, "loss": 5.1471, "mean_token_accuracy": 0.20064401030540466, "num_tokens": 54379304.0, "step": 23740 }, { "entropy": 5.4684936046600345, "epoch": 2.3472716488730723, "grad_norm": 1.1328125, "learning_rate": 0.0004451238838117826, "loss": 5.0844, "mean_token_accuracy": 0.21057066172361374, "num_tokens": 54391462.0, "step": 23745 }, { "entropy": 5.455559349060058, "epoch": 2.347765915381574, "grad_norm": 1.8203125, "learning_rate": 0.0004451007862257723, "loss": 5.0684, "mean_token_accuracy": 0.21585457473993303, "num_tokens": 54402325.0, "step": 23750 }, { "entropy": 5.400908279418945, "epoch": 2.3482601818900752, "grad_norm": 1.25, "learning_rate": 0.0004450776844552562, "loss": 5.0447, "mean_token_accuracy": 0.2044763073325157, "num_tokens": 54413874.0, "step": 23755 }, { "entropy": 5.490333938598633, "epoch": 2.3487544483985765, "grad_norm": 1.1484375, "learning_rate": 0.0004450545785008027, "loss": 5.147, "mean_token_accuracy": 0.20435102581977843, "num_tokens": 54426266.0, "step": 23760 }, { "entropy": 5.468487787246704, "epoch": 2.3492487149070778, "grad_norm": 1.203125, "learning_rate": 0.00044503146836298026, "loss": 5.1317, "mean_token_accuracy": 0.20383675694465636, "num_tokens": 54436682.0, "step": 23765 }, { "entropy": 5.477557945251465, "epoch": 2.3497429814155795, "grad_norm": 1.1484375, "learning_rate": 0.00044500835404235727, "loss": 5.1036, "mean_token_accuracy": 0.20383972078561782, "num_tokens": 54447462.0, "step": 23770 }, { "entropy": 5.581313896179199, "epoch": 2.3502372479240807, "grad_norm": 0.95703125, "learning_rate": 0.0004449852355395024, "loss": 5.1637, "mean_token_accuracy": 0.20379960238933564, "num_tokens": 54460116.0, "step": 23775 }, { "entropy": 5.523346328735352, "epoch": 2.350731514432582, "grad_norm": 1.1875, "learning_rate": 0.00044496211285498434, "loss": 5.1205, "mean_token_accuracy": 0.20514213144779206, "num_tokens": 54471016.0, "step": 23780 }, { "entropy": 5.434674167633057, "epoch": 2.3512257809410833, "grad_norm": 1.140625, "learning_rate": 0.000444938985989372, "loss": 5.0443, "mean_token_accuracy": 0.20904642194509507, "num_tokens": 54482410.0, "step": 23785 }, { "entropy": 5.456105661392212, "epoch": 2.351720047449585, "grad_norm": 1.15625, "learning_rate": 0.00044491585494323415, "loss": 5.1075, "mean_token_accuracy": 0.20677542686462402, "num_tokens": 54495555.0, "step": 23790 }, { "entropy": 5.499029684066772, "epoch": 2.3522143139580862, "grad_norm": 1.1484375, "learning_rate": 0.00044489271971713995, "loss": 5.1345, "mean_token_accuracy": 0.20220936685800553, "num_tokens": 54505658.0, "step": 23795 }, { "entropy": 5.398524618148803, "epoch": 2.3527085804665875, "grad_norm": 1.4296875, "learning_rate": 0.00044486958031165856, "loss": 5.0665, "mean_token_accuracy": 0.20745669007301332, "num_tokens": 54518633.0, "step": 23800 }, { "entropy": 5.556973934173584, "epoch": 2.3532028469750887, "grad_norm": 1.1015625, "learning_rate": 0.00044484643672735907, "loss": 5.2666, "mean_token_accuracy": 0.1949191078543663, "num_tokens": 54531451.0, "step": 23805 }, { "entropy": 5.485000848770142, "epoch": 2.3536971134835905, "grad_norm": 1.0859375, "learning_rate": 0.0004448232889648109, "loss": 5.051, "mean_token_accuracy": 0.209907403588295, "num_tokens": 54542798.0, "step": 23810 }, { "entropy": 5.486566829681396, "epoch": 2.3541913799920917, "grad_norm": 1.15625, "learning_rate": 0.0004448001370245835, "loss": 5.163, "mean_token_accuracy": 0.19694053679704665, "num_tokens": 54554551.0, "step": 23815 }, { "entropy": 5.596773386001587, "epoch": 2.354685646500593, "grad_norm": 1.1015625, "learning_rate": 0.00044477698090724635, "loss": 5.1654, "mean_token_accuracy": 0.20056671947240828, "num_tokens": 54564711.0, "step": 23820 }, { "entropy": 5.516957187652588, "epoch": 2.3551799130090947, "grad_norm": 1.0390625, "learning_rate": 0.00044475382061336913, "loss": 5.1803, "mean_token_accuracy": 0.19257331490516663, "num_tokens": 54576096.0, "step": 23825 }, { "entropy": 5.505116510391235, "epoch": 2.355674179517596, "grad_norm": 1.109375, "learning_rate": 0.0004447306561435215, "loss": 5.1496, "mean_token_accuracy": 0.19757141470909118, "num_tokens": 54587939.0, "step": 23830 }, { "entropy": 5.549318838119507, "epoch": 2.356168446026097, "grad_norm": 1.109375, "learning_rate": 0.00044470748749827354, "loss": 5.0406, "mean_token_accuracy": 0.20754163712263107, "num_tokens": 54598470.0, "step": 23835 }, { "entropy": 5.523328971862793, "epoch": 2.3566627125345985, "grad_norm": 1.203125, "learning_rate": 0.00044468431467819505, "loss": 5.1368, "mean_token_accuracy": 0.2010859191417694, "num_tokens": 54608840.0, "step": 23840 }, { "entropy": 5.464947605133057, "epoch": 2.3571569790431, "grad_norm": 1.1484375, "learning_rate": 0.000444661137683856, "loss": 5.0881, "mean_token_accuracy": 0.20052892714738846, "num_tokens": 54619319.0, "step": 23845 }, { "entropy": 5.4659031391143795, "epoch": 2.3576512455516014, "grad_norm": 1.1484375, "learning_rate": 0.0004446379565158268, "loss": 5.1063, "mean_token_accuracy": 0.2052032843232155, "num_tokens": 54630410.0, "step": 23850 }, { "entropy": 5.542837047576905, "epoch": 2.3581455120601027, "grad_norm": 1.125, "learning_rate": 0.0004446147711746774, "loss": 5.2246, "mean_token_accuracy": 0.19140036553144454, "num_tokens": 54642376.0, "step": 23855 }, { "entropy": 5.474863529205322, "epoch": 2.3586397785686044, "grad_norm": 1.5546875, "learning_rate": 0.0004445915816609784, "loss": 5.1145, "mean_token_accuracy": 0.2047329604625702, "num_tokens": 54654378.0, "step": 23860 }, { "entropy": 5.492846441268921, "epoch": 2.3591340450771057, "grad_norm": 1.28125, "learning_rate": 0.00044456838797530006, "loss": 5.0813, "mean_token_accuracy": 0.20095590949058534, "num_tokens": 54664879.0, "step": 23865 }, { "entropy": 5.458337736129761, "epoch": 2.359628311585607, "grad_norm": 1.078125, "learning_rate": 0.0004445451901182132, "loss": 5.1164, "mean_token_accuracy": 0.2028850108385086, "num_tokens": 54677251.0, "step": 23870 }, { "entropy": 5.487436437606812, "epoch": 2.360122578094108, "grad_norm": 1.1328125, "learning_rate": 0.0004445219880902884, "loss": 5.0734, "mean_token_accuracy": 0.20168025493621827, "num_tokens": 54688827.0, "step": 23875 }, { "entropy": 5.470152473449707, "epoch": 2.36061684460261, "grad_norm": 1.3046875, "learning_rate": 0.0004444987818920963, "loss": 5.1431, "mean_token_accuracy": 0.1998108595609665, "num_tokens": 54701046.0, "step": 23880 }, { "entropy": 5.56888370513916, "epoch": 2.361111111111111, "grad_norm": 1.1171875, "learning_rate": 0.0004444755715242078, "loss": 5.2098, "mean_token_accuracy": 0.19205886870622635, "num_tokens": 54713254.0, "step": 23885 }, { "entropy": 5.500604152679443, "epoch": 2.3616053776196124, "grad_norm": 1.109375, "learning_rate": 0.00044445235698719406, "loss": 5.0713, "mean_token_accuracy": 0.20636613816022872, "num_tokens": 54723734.0, "step": 23890 }, { "entropy": 5.497933959960937, "epoch": 2.362099644128114, "grad_norm": 1.1171875, "learning_rate": 0.000444429138281626, "loss": 5.1357, "mean_token_accuracy": 0.19890673756599425, "num_tokens": 54735080.0, "step": 23895 }, { "entropy": 5.430173635482788, "epoch": 2.3625939106366154, "grad_norm": 1.2578125, "learning_rate": 0.00044440591540807496, "loss": 5.0233, "mean_token_accuracy": 0.21318188756704332, "num_tokens": 54745164.0, "step": 23900 }, { "entropy": 5.465091753005981, "epoch": 2.3630881771451167, "grad_norm": 1.171875, "learning_rate": 0.000444382688367112, "loss": 5.1448, "mean_token_accuracy": 0.20126674324274063, "num_tokens": 54757350.0, "step": 23905 }, { "entropy": 5.4750429630279545, "epoch": 2.363582443653618, "grad_norm": 1.3203125, "learning_rate": 0.00044435945715930864, "loss": 5.0279, "mean_token_accuracy": 0.20452284514904023, "num_tokens": 54768290.0, "step": 23910 }, { "entropy": 5.501429843902588, "epoch": 2.364076710162119, "grad_norm": 1.1171875, "learning_rate": 0.0004443362217852364, "loss": 5.1582, "mean_token_accuracy": 0.20043061673641205, "num_tokens": 54779053.0, "step": 23915 }, { "entropy": 5.588014411926269, "epoch": 2.364570976670621, "grad_norm": 1.0078125, "learning_rate": 0.0004443129822454668, "loss": 5.2659, "mean_token_accuracy": 0.18776739984750748, "num_tokens": 54789787.0, "step": 23920 }, { "entropy": 5.546839427947998, "epoch": 2.365065243179122, "grad_norm": 1.109375, "learning_rate": 0.00044428973854057164, "loss": 5.1557, "mean_token_accuracy": 0.20045240223407745, "num_tokens": 54802036.0, "step": 23925 }, { "entropy": 5.505240774154663, "epoch": 2.3655595096876234, "grad_norm": 1.1171875, "learning_rate": 0.00044426649067112257, "loss": 5.1542, "mean_token_accuracy": 0.20359872430562972, "num_tokens": 54811765.0, "step": 23930 }, { "entropy": 5.453181314468384, "epoch": 2.366053776196125, "grad_norm": 1.1484375, "learning_rate": 0.0004442432386376916, "loss": 5.0991, "mean_token_accuracy": 0.20627350509166717, "num_tokens": 54823057.0, "step": 23935 }, { "entropy": 5.502063417434693, "epoch": 2.3665480427046264, "grad_norm": 1.09375, "learning_rate": 0.00044421998244085066, "loss": 5.1144, "mean_token_accuracy": 0.20075902044773103, "num_tokens": 54834070.0, "step": 23940 }, { "entropy": 5.486255168914795, "epoch": 2.3670423092131276, "grad_norm": 1.0859375, "learning_rate": 0.00044419672208117204, "loss": 5.1167, "mean_token_accuracy": 0.1963752716779709, "num_tokens": 54845913.0, "step": 23945 }, { "entropy": 5.483513355255127, "epoch": 2.367536575721629, "grad_norm": 1.0859375, "learning_rate": 0.0004441734575592276, "loss": 5.1383, "mean_token_accuracy": 0.201385959982872, "num_tokens": 54856721.0, "step": 23950 }, { "entropy": 5.565858983993531, "epoch": 2.3680308422301306, "grad_norm": 1.078125, "learning_rate": 0.00044415018887559, "loss": 5.1626, "mean_token_accuracy": 0.1989971309900284, "num_tokens": 54868652.0, "step": 23955 }, { "entropy": 5.462923812866211, "epoch": 2.368525108738632, "grad_norm": 1.125, "learning_rate": 0.0004441269160308315, "loss": 5.0395, "mean_token_accuracy": 0.21349249929189681, "num_tokens": 54880753.0, "step": 23960 }, { "entropy": 5.409200239181518, "epoch": 2.369019375247133, "grad_norm": 1.578125, "learning_rate": 0.00044410363902552466, "loss": 5.0181, "mean_token_accuracy": 0.21645736396312715, "num_tokens": 54891724.0, "step": 23965 }, { "entropy": 5.492698335647583, "epoch": 2.369513641755635, "grad_norm": 1.1171875, "learning_rate": 0.000444080357860242, "loss": 5.1398, "mean_token_accuracy": 0.20223337709903716, "num_tokens": 54902516.0, "step": 23970 }, { "entropy": 5.485365915298462, "epoch": 2.370007908264136, "grad_norm": 1.046875, "learning_rate": 0.00044405707253555626, "loss": 5.1465, "mean_token_accuracy": 0.20234702080488204, "num_tokens": 54914392.0, "step": 23975 }, { "entropy": 5.468743562698364, "epoch": 2.3705021747726374, "grad_norm": 1.1484375, "learning_rate": 0.0004440337830520404, "loss": 5.024, "mean_token_accuracy": 0.21231903433799743, "num_tokens": 54925209.0, "step": 23980 }, { "entropy": 5.500132465362549, "epoch": 2.3709964412811386, "grad_norm": 1.1953125, "learning_rate": 0.00044401048941026725, "loss": 5.0484, "mean_token_accuracy": 0.201961487531662, "num_tokens": 54935972.0, "step": 23985 }, { "entropy": 5.45325722694397, "epoch": 2.3714907077896403, "grad_norm": 1.125, "learning_rate": 0.0004439871916108098, "loss": 5.0542, "mean_token_accuracy": 0.2077438160777092, "num_tokens": 54945631.0, "step": 23990 }, { "entropy": 5.474172449111938, "epoch": 2.3719849742981416, "grad_norm": 1.0859375, "learning_rate": 0.00044396388965424124, "loss": 5.1131, "mean_token_accuracy": 0.19927688390016557, "num_tokens": 54955734.0, "step": 23995 }, { "entropy": 5.484754180908203, "epoch": 2.372479240806643, "grad_norm": 1.1015625, "learning_rate": 0.0004439405835411348, "loss": 5.1763, "mean_token_accuracy": 0.19966885596513748, "num_tokens": 54968506.0, "step": 24000 }, { "epoch": 2.372479240806643, "eval_entropy": 5.347727731174502, "eval_loss": 5.2096967697143555, "eval_mean_token_accuracy": 0.2052016352283852, "eval_num_tokens": 54968506.0, "eval_runtime": 26.489, "eval_samples_per_second": 1227.417, "eval_steps_per_second": 153.46, "step": 24000 }, { "entropy": 5.4953700542449955, "epoch": 2.3729735073151446, "grad_norm": 1.0546875, "learning_rate": 0.0004439172732720637, "loss": 5.0653, "mean_token_accuracy": 0.21215397566556932, "num_tokens": 54979809.0, "step": 24005 }, { "entropy": 5.538318395614624, "epoch": 2.373467773823646, "grad_norm": 1.203125, "learning_rate": 0.0004438939588476016, "loss": 5.2399, "mean_token_accuracy": 0.19654985666275024, "num_tokens": 54991276.0, "step": 24010 }, { "entropy": 5.516181516647339, "epoch": 2.373962040332147, "grad_norm": 1.390625, "learning_rate": 0.00044387064026832183, "loss": 5.096, "mean_token_accuracy": 0.2019803062081337, "num_tokens": 55002320.0, "step": 24015 }, { "entropy": 5.362782430648804, "epoch": 2.3744563068406483, "grad_norm": 1.046875, "learning_rate": 0.00044384731753479813, "loss": 4.9517, "mean_token_accuracy": 0.22503859400749207, "num_tokens": 55012995.0, "step": 24020 }, { "entropy": 5.486984014511108, "epoch": 2.37495057334915, "grad_norm": 1.140625, "learning_rate": 0.00044382399064760424, "loss": 5.1643, "mean_token_accuracy": 0.19842659384012223, "num_tokens": 55025342.0, "step": 24025 }, { "entropy": 5.454856729507446, "epoch": 2.3754448398576513, "grad_norm": 1.09375, "learning_rate": 0.000443800659607314, "loss": 5.1311, "mean_token_accuracy": 0.20662947446107865, "num_tokens": 55036925.0, "step": 24030 }, { "entropy": 5.516967248916626, "epoch": 2.3759391063661526, "grad_norm": 1.0859375, "learning_rate": 0.0004437773244145013, "loss": 5.1137, "mean_token_accuracy": 0.20011163949966432, "num_tokens": 55048913.0, "step": 24035 }, { "entropy": 5.48542537689209, "epoch": 2.376433372874654, "grad_norm": 1.1171875, "learning_rate": 0.0004437539850697403, "loss": 5.0949, "mean_token_accuracy": 0.2043862521648407, "num_tokens": 55059654.0, "step": 24040 }, { "entropy": 5.557176780700684, "epoch": 2.3769276393831555, "grad_norm": 1.140625, "learning_rate": 0.00044373064157360504, "loss": 5.178, "mean_token_accuracy": 0.1968182221055031, "num_tokens": 55071077.0, "step": 24045 }, { "entropy": 5.50376615524292, "epoch": 2.377421905891657, "grad_norm": 1.1640625, "learning_rate": 0.0004437072939266698, "loss": 5.1216, "mean_token_accuracy": 0.20217968374490738, "num_tokens": 55082659.0, "step": 24050 }, { "entropy": 5.400593900680542, "epoch": 2.377916172400158, "grad_norm": 1.09375, "learning_rate": 0.00044368394212950896, "loss": 5.1698, "mean_token_accuracy": 0.20113613605499267, "num_tokens": 55093938.0, "step": 24055 }, { "entropy": 5.5777500629425045, "epoch": 2.3784104389086593, "grad_norm": 1.0625, "learning_rate": 0.00044366058618269707, "loss": 5.1513, "mean_token_accuracy": 0.20259769409894943, "num_tokens": 55105491.0, "step": 24060 }, { "entropy": 5.467372941970825, "epoch": 2.378904705417161, "grad_norm": 1.09375, "learning_rate": 0.0004436372260868085, "loss": 4.9973, "mean_token_accuracy": 0.21586406230926514, "num_tokens": 55116941.0, "step": 24065 }, { "entropy": 5.559657764434815, "epoch": 2.3793989719256623, "grad_norm": 1.1953125, "learning_rate": 0.00044361386184241805, "loss": 5.1512, "mean_token_accuracy": 0.19971656054258347, "num_tokens": 55128294.0, "step": 24070 }, { "entropy": 5.55187201499939, "epoch": 2.3798932384341636, "grad_norm": 1.2109375, "learning_rate": 0.00044359049345010044, "loss": 5.154, "mean_token_accuracy": 0.20051767081022262, "num_tokens": 55139781.0, "step": 24075 }, { "entropy": 5.472703742980957, "epoch": 2.3803875049426653, "grad_norm": 1.0859375, "learning_rate": 0.0004435671209104305, "loss": 5.0995, "mean_token_accuracy": 0.20488187223672866, "num_tokens": 55151517.0, "step": 24080 }, { "entropy": 5.390579032897949, "epoch": 2.3808817714511665, "grad_norm": 1.1484375, "learning_rate": 0.0004435437442239833, "loss": 5.0892, "mean_token_accuracy": 0.20299521833658218, "num_tokens": 55163029.0, "step": 24085 }, { "entropy": 5.469687604904175, "epoch": 2.381376037959668, "grad_norm": 1.1328125, "learning_rate": 0.0004435203633913337, "loss": 5.0533, "mean_token_accuracy": 0.21242140382528304, "num_tokens": 55174262.0, "step": 24090 }, { "entropy": 5.4816405296325685, "epoch": 2.381870304468169, "grad_norm": 1.1328125, "learning_rate": 0.00044349697841305715, "loss": 5.0926, "mean_token_accuracy": 0.2117959141731262, "num_tokens": 55185047.0, "step": 24095 }, { "entropy": 5.449206686019897, "epoch": 2.3823645709766708, "grad_norm": 1.203125, "learning_rate": 0.00044347358928972883, "loss": 5.1236, "mean_token_accuracy": 0.20197117030620576, "num_tokens": 55196396.0, "step": 24100 }, { "entropy": 5.529635572433472, "epoch": 2.382858837485172, "grad_norm": 1.140625, "learning_rate": 0.0004434501960219239, "loss": 5.1444, "mean_token_accuracy": 0.20481221824884416, "num_tokens": 55208774.0, "step": 24105 }, { "entropy": 5.52050371170044, "epoch": 2.3833531039936733, "grad_norm": 1.15625, "learning_rate": 0.0004434267986102181, "loss": 5.1317, "mean_token_accuracy": 0.19644552022218703, "num_tokens": 55219946.0, "step": 24110 }, { "entropy": 5.472808074951172, "epoch": 2.383847370502175, "grad_norm": 1.4140625, "learning_rate": 0.000443403397055187, "loss": 5.1969, "mean_token_accuracy": 0.20116210579872132, "num_tokens": 55231926.0, "step": 24115 }, { "entropy": 5.489148712158203, "epoch": 2.3843416370106763, "grad_norm": 1.0625, "learning_rate": 0.00044337999135740614, "loss": 5.0589, "mean_token_accuracy": 0.2045910194516182, "num_tokens": 55245240.0, "step": 24120 }, { "entropy": 5.537826061248779, "epoch": 2.3848359035191775, "grad_norm": 1.15625, "learning_rate": 0.0004433565815174514, "loss": 5.1473, "mean_token_accuracy": 0.20090622305870057, "num_tokens": 55256862.0, "step": 24125 }, { "entropy": 5.507908821105957, "epoch": 2.3853301700276788, "grad_norm": 1.1015625, "learning_rate": 0.00044333316753589864, "loss": 5.0999, "mean_token_accuracy": 0.19921667575836183, "num_tokens": 55268157.0, "step": 24130 }, { "entropy": 5.53131136894226, "epoch": 2.3858244365361805, "grad_norm": 1.078125, "learning_rate": 0.0004433097494133238, "loss": 5.1637, "mean_token_accuracy": 0.19946774691343308, "num_tokens": 55279580.0, "step": 24135 }, { "entropy": 5.617420244216919, "epoch": 2.3863187030446817, "grad_norm": 1.25, "learning_rate": 0.00044328632715030303, "loss": 5.33, "mean_token_accuracy": 0.18546686172485352, "num_tokens": 55292067.0, "step": 24140 }, { "entropy": 5.460070943832397, "epoch": 2.386812969553183, "grad_norm": 1.1875, "learning_rate": 0.00044326290074741257, "loss": 5.0961, "mean_token_accuracy": 0.20935119390487672, "num_tokens": 55303338.0, "step": 24145 }, { "entropy": 5.492969608306884, "epoch": 2.3873072360616843, "grad_norm": 1.1953125, "learning_rate": 0.0004432394702052286, "loss": 5.1718, "mean_token_accuracy": 0.19402682185173034, "num_tokens": 55315165.0, "step": 24150 }, { "entropy": 5.54754672050476, "epoch": 2.387801502570186, "grad_norm": 1.0859375, "learning_rate": 0.00044321603552432753, "loss": 5.145, "mean_token_accuracy": 0.19918230026960373, "num_tokens": 55327928.0, "step": 24155 }, { "entropy": 5.449443340301514, "epoch": 2.3882957690786872, "grad_norm": 1.046875, "learning_rate": 0.00044319259670528595, "loss": 5.0567, "mean_token_accuracy": 0.2062981069087982, "num_tokens": 55338438.0, "step": 24160 }, { "entropy": 5.417128801345825, "epoch": 2.3887900355871885, "grad_norm": 1.0625, "learning_rate": 0.00044316915374868033, "loss": 5.0296, "mean_token_accuracy": 0.20826223641633987, "num_tokens": 55349513.0, "step": 24165 }, { "entropy": 5.460167026519775, "epoch": 2.3892843020956898, "grad_norm": 1.03125, "learning_rate": 0.00044314570665508746, "loss": 5.1546, "mean_token_accuracy": 0.20052433609962464, "num_tokens": 55362498.0, "step": 24170 }, { "entropy": 5.576184177398682, "epoch": 2.3897785686041915, "grad_norm": 1.125, "learning_rate": 0.0004431222554250841, "loss": 5.1317, "mean_token_accuracy": 0.19695977717638016, "num_tokens": 55374065.0, "step": 24175 }, { "entropy": 5.468780374526977, "epoch": 2.3902728351126927, "grad_norm": 1.125, "learning_rate": 0.00044309880005924726, "loss": 5.1166, "mean_token_accuracy": 0.20670635849237443, "num_tokens": 55385175.0, "step": 24180 }, { "entropy": 5.544585561752319, "epoch": 2.390767101621194, "grad_norm": 1.2265625, "learning_rate": 0.00044307534055815375, "loss": 5.1864, "mean_token_accuracy": 0.1976812779903412, "num_tokens": 55395457.0, "step": 24185 }, { "entropy": 5.5038244247436525, "epoch": 2.3912613681296957, "grad_norm": 1.046875, "learning_rate": 0.00044305187692238087, "loss": 5.1242, "mean_token_accuracy": 0.1999911606311798, "num_tokens": 55406341.0, "step": 24190 }, { "entropy": 5.50658950805664, "epoch": 2.391755634638197, "grad_norm": 1.1796875, "learning_rate": 0.00044302840915250575, "loss": 5.092, "mean_token_accuracy": 0.19989708214998245, "num_tokens": 55417893.0, "step": 24195 }, { "entropy": 5.518565368652344, "epoch": 2.392249901146698, "grad_norm": 1.1953125, "learning_rate": 0.0004430049372491056, "loss": 5.1715, "mean_token_accuracy": 0.19694544076919557, "num_tokens": 55428286.0, "step": 24200 }, { "entropy": 5.399940872192383, "epoch": 2.3927441676551995, "grad_norm": 1.1953125, "learning_rate": 0.00044298146121275804, "loss": 5.0358, "mean_token_accuracy": 0.20724110305309296, "num_tokens": 55439861.0, "step": 24205 }, { "entropy": 5.5473103523254395, "epoch": 2.393238434163701, "grad_norm": 1.0859375, "learning_rate": 0.0004429579810440404, "loss": 5.115, "mean_token_accuracy": 0.19754144847393035, "num_tokens": 55450971.0, "step": 24210 }, { "entropy": 5.4810456275939945, "epoch": 2.3937327006722025, "grad_norm": 1.1484375, "learning_rate": 0.0004429344967435305, "loss": 5.0928, "mean_token_accuracy": 0.19796846359968184, "num_tokens": 55460584.0, "step": 24215 }, { "entropy": 5.570596027374267, "epoch": 2.3942269671807037, "grad_norm": 1.1015625, "learning_rate": 0.00044291100831180577, "loss": 5.2274, "mean_token_accuracy": 0.1915025904774666, "num_tokens": 55471576.0, "step": 24220 }, { "entropy": 5.52740511894226, "epoch": 2.3947212336892054, "grad_norm": 1.1796875, "learning_rate": 0.0004428875157494442, "loss": 5.1252, "mean_token_accuracy": 0.20337176620960234, "num_tokens": 55483807.0, "step": 24225 }, { "entropy": 5.466325902938843, "epoch": 2.3952155001977067, "grad_norm": 1.1015625, "learning_rate": 0.00044286401905702376, "loss": 5.1302, "mean_token_accuracy": 0.20709213018417358, "num_tokens": 55495130.0, "step": 24230 }, { "entropy": 5.47646746635437, "epoch": 2.395709766706208, "grad_norm": 1.0703125, "learning_rate": 0.0004428405182351224, "loss": 5.0855, "mean_token_accuracy": 0.20969182401895523, "num_tokens": 55506460.0, "step": 24235 }, { "entropy": 5.5734693050384525, "epoch": 2.396204033214709, "grad_norm": 1.15625, "learning_rate": 0.0004428170132843182, "loss": 5.1847, "mean_token_accuracy": 0.201817487180233, "num_tokens": 55518401.0, "step": 24240 }, { "entropy": 5.5229939937591555, "epoch": 2.396698299723211, "grad_norm": 1.0234375, "learning_rate": 0.00044279350420518956, "loss": 5.097, "mean_token_accuracy": 0.20685291439294815, "num_tokens": 55530403.0, "step": 24245 }, { "entropy": 5.536352062225342, "epoch": 2.397192566231712, "grad_norm": 1.0078125, "learning_rate": 0.00044276999099831463, "loss": 5.1471, "mean_token_accuracy": 0.20163918435573577, "num_tokens": 55541422.0, "step": 24250 }, { "entropy": 5.446721172332763, "epoch": 2.3976868327402134, "grad_norm": 1.0234375, "learning_rate": 0.00044274647366427186, "loss": 5.0659, "mean_token_accuracy": 0.20509060174226762, "num_tokens": 55553798.0, "step": 24255 }, { "entropy": 5.455235195159912, "epoch": 2.398181099248715, "grad_norm": 1.1640625, "learning_rate": 0.00044272295220363977, "loss": 5.1239, "mean_token_accuracy": 0.20419947803020477, "num_tokens": 55565970.0, "step": 24260 }, { "entropy": 5.505720472335815, "epoch": 2.3986753657572164, "grad_norm": 1.0625, "learning_rate": 0.0004426994266169971, "loss": 5.1781, "mean_token_accuracy": 0.19681297689676286, "num_tokens": 55576385.0, "step": 24265 }, { "entropy": 5.449960517883301, "epoch": 2.3991696322657177, "grad_norm": 0.97265625, "learning_rate": 0.0004426758969049225, "loss": 5.0451, "mean_token_accuracy": 0.21620315909385682, "num_tokens": 55588752.0, "step": 24270 }, { "entropy": 5.451366329193116, "epoch": 2.399663898774219, "grad_norm": 1.15625, "learning_rate": 0.0004426523630679949, "loss": 5.0965, "mean_token_accuracy": 0.20305163264274598, "num_tokens": 55599348.0, "step": 24275 }, { "entropy": 5.473493909835815, "epoch": 2.4001581652827206, "grad_norm": 1.1015625, "learning_rate": 0.0004426288251067931, "loss": 5.0732, "mean_token_accuracy": 0.20013322234153746, "num_tokens": 55610168.0, "step": 24280 }, { "entropy": 5.496099424362183, "epoch": 2.400652431791222, "grad_norm": 1.375, "learning_rate": 0.00044260528302189617, "loss": 5.1399, "mean_token_accuracy": 0.20125294476747513, "num_tokens": 55622487.0, "step": 24285 }, { "entropy": 5.559060001373291, "epoch": 2.401146698299723, "grad_norm": 1.0703125, "learning_rate": 0.0004425817368138833, "loss": 5.1556, "mean_token_accuracy": 0.2029305398464203, "num_tokens": 55634486.0, "step": 24290 }, { "entropy": 5.510579347610474, "epoch": 2.4016409648082244, "grad_norm": 1.1015625, "learning_rate": 0.0004425581864833337, "loss": 5.1473, "mean_token_accuracy": 0.19999028295278548, "num_tokens": 55646642.0, "step": 24295 }, { "entropy": 5.397876358032226, "epoch": 2.402135231316726, "grad_norm": 1.140625, "learning_rate": 0.0004425346320308267, "loss": 4.9986, "mean_token_accuracy": 0.21957552284002305, "num_tokens": 55657921.0, "step": 24300 }, { "entropy": 5.441567993164062, "epoch": 2.4026294978252274, "grad_norm": 1.09375, "learning_rate": 0.0004425110734569418, "loss": 5.1156, "mean_token_accuracy": 0.20996900349855424, "num_tokens": 55669414.0, "step": 24305 }, { "entropy": 5.458219718933106, "epoch": 2.4031237643337287, "grad_norm": 1.1171875, "learning_rate": 0.00044248751076225853, "loss": 5.056, "mean_token_accuracy": 0.20717837959527968, "num_tokens": 55681854.0, "step": 24310 }, { "entropy": 5.49722900390625, "epoch": 2.40361803084223, "grad_norm": 1.2109375, "learning_rate": 0.00044246394394735646, "loss": 5.0375, "mean_token_accuracy": 0.20497379899024964, "num_tokens": 55692458.0, "step": 24315 }, { "entropy": 5.525239181518555, "epoch": 2.4041122973507316, "grad_norm": 1.1796875, "learning_rate": 0.00044244037301281535, "loss": 5.1282, "mean_token_accuracy": 0.2021837279200554, "num_tokens": 55703676.0, "step": 24320 }, { "entropy": 5.514711332321167, "epoch": 2.404606563859233, "grad_norm": 1.09375, "learning_rate": 0.0004424167979592152, "loss": 5.1258, "mean_token_accuracy": 0.19684544950723648, "num_tokens": 55714372.0, "step": 24325 }, { "entropy": 5.469604349136352, "epoch": 2.405100830367734, "grad_norm": 1.1328125, "learning_rate": 0.0004423932187871358, "loss": 5.0726, "mean_token_accuracy": 0.20633845180273055, "num_tokens": 55724342.0, "step": 24330 }, { "entropy": 5.489522981643677, "epoch": 2.405595096876236, "grad_norm": 1.046875, "learning_rate": 0.0004423696354971572, "loss": 5.1874, "mean_token_accuracy": 0.19932929128408433, "num_tokens": 55736272.0, "step": 24335 }, { "entropy": 5.507037591934204, "epoch": 2.406089363384737, "grad_norm": 1.140625, "learning_rate": 0.0004423460480898596, "loss": 5.0819, "mean_token_accuracy": 0.21597340255975722, "num_tokens": 55747174.0, "step": 24340 }, { "entropy": 5.40907654762268, "epoch": 2.4065836298932384, "grad_norm": 1.1953125, "learning_rate": 0.0004423224565658233, "loss": 5.0199, "mean_token_accuracy": 0.20998756289482118, "num_tokens": 55759676.0, "step": 24345 }, { "entropy": 5.454511117935181, "epoch": 2.4070778964017396, "grad_norm": 1.1875, "learning_rate": 0.0004422988609256286, "loss": 5.1376, "mean_token_accuracy": 0.19554717242717742, "num_tokens": 55772140.0, "step": 24350 }, { "entropy": 5.467319822311401, "epoch": 2.4075721629102413, "grad_norm": 1.1015625, "learning_rate": 0.000442275261169856, "loss": 5.0505, "mean_token_accuracy": 0.20849403291940688, "num_tokens": 55783639.0, "step": 24355 }, { "entropy": 5.532367849349976, "epoch": 2.4080664294187426, "grad_norm": 1.1640625, "learning_rate": 0.00044225165729908604, "loss": 5.2054, "mean_token_accuracy": 0.19538605064153672, "num_tokens": 55795867.0, "step": 24360 }, { "entropy": 5.373350048065186, "epoch": 2.408560695927244, "grad_norm": 1.0625, "learning_rate": 0.00044222804931389934, "loss": 5.0225, "mean_token_accuracy": 0.2171737089753151, "num_tokens": 55807528.0, "step": 24365 }, { "entropy": 5.502852153778076, "epoch": 2.4090549624357456, "grad_norm": 1.09375, "learning_rate": 0.0004422044372148766, "loss": 5.0497, "mean_token_accuracy": 0.20848052054643632, "num_tokens": 55817547.0, "step": 24370 }, { "entropy": 5.419193935394287, "epoch": 2.409549228944247, "grad_norm": 1.09375, "learning_rate": 0.00044218082100259883, "loss": 5.0321, "mean_token_accuracy": 0.21471346616744996, "num_tokens": 55828474.0, "step": 24375 }, { "entropy": 5.444436120986938, "epoch": 2.410043495452748, "grad_norm": 1.21875, "learning_rate": 0.00044215720067764696, "loss": 5.0505, "mean_token_accuracy": 0.20983597487211228, "num_tokens": 55838485.0, "step": 24380 }, { "entropy": 5.4874927520751955, "epoch": 2.4105377619612494, "grad_norm": 1.140625, "learning_rate": 0.000442133576240602, "loss": 5.1367, "mean_token_accuracy": 0.21096194088459014, "num_tokens": 55850219.0, "step": 24385 }, { "entropy": 5.449599742889404, "epoch": 2.411032028469751, "grad_norm": 1.109375, "learning_rate": 0.0004421099476920451, "loss": 5.0031, "mean_token_accuracy": 0.2150494083762169, "num_tokens": 55860241.0, "step": 24390 }, { "entropy": 5.5127543926239015, "epoch": 2.4115262949782523, "grad_norm": 1.0625, "learning_rate": 0.0004420863150325575, "loss": 5.2229, "mean_token_accuracy": 0.19013428092002868, "num_tokens": 55871201.0, "step": 24395 }, { "entropy": 5.457510232925415, "epoch": 2.4120205614867536, "grad_norm": 1.125, "learning_rate": 0.0004420626782627208, "loss": 5.0179, "mean_token_accuracy": 0.2111206203699112, "num_tokens": 55881758.0, "step": 24400 }, { "entropy": 5.4877049922943115, "epoch": 2.412514827995255, "grad_norm": 1.0390625, "learning_rate": 0.00044203903738311616, "loss": 5.1013, "mean_token_accuracy": 0.20375279933214188, "num_tokens": 55892931.0, "step": 24405 }, { "entropy": 5.53276309967041, "epoch": 2.4130090945037566, "grad_norm": 1.265625, "learning_rate": 0.00044201539239432534, "loss": 5.0876, "mean_token_accuracy": 0.20771762132644653, "num_tokens": 55903376.0, "step": 24410 }, { "entropy": 5.5666814804077145, "epoch": 2.413503361012258, "grad_norm": 1.2578125, "learning_rate": 0.00044199174329693, "loss": 5.1631, "mean_token_accuracy": 0.19881929010152816, "num_tokens": 55913821.0, "step": 24415 }, { "entropy": 5.442328023910522, "epoch": 2.413997627520759, "grad_norm": 1.140625, "learning_rate": 0.00044196809009151183, "loss": 5.1209, "mean_token_accuracy": 0.20072400122880935, "num_tokens": 55925085.0, "step": 24420 }, { "entropy": 5.467133474349976, "epoch": 2.4144918940292603, "grad_norm": 1.1328125, "learning_rate": 0.0004419444327786527, "loss": 5.129, "mean_token_accuracy": 0.19822475761175157, "num_tokens": 55937572.0, "step": 24425 }, { "entropy": 5.480417394638062, "epoch": 2.414986160537762, "grad_norm": 1.0859375, "learning_rate": 0.0004419207713589347, "loss": 5.1034, "mean_token_accuracy": 0.20375400185585021, "num_tokens": 55948890.0, "step": 24430 }, { "entropy": 5.469589138031006, "epoch": 2.4154804270462633, "grad_norm": 1.1484375, "learning_rate": 0.0004418971058329398, "loss": 5.1769, "mean_token_accuracy": 0.19648048132658005, "num_tokens": 55959319.0, "step": 24435 }, { "entropy": 5.534429931640625, "epoch": 2.4159746935547646, "grad_norm": 1.0703125, "learning_rate": 0.00044187343620125016, "loss": 5.1612, "mean_token_accuracy": 0.1967574030160904, "num_tokens": 55970922.0, "step": 24440 }, { "entropy": 5.45665340423584, "epoch": 2.4164689600632663, "grad_norm": 1.0625, "learning_rate": 0.00044184976246444815, "loss": 5.1177, "mean_token_accuracy": 0.20160169154405594, "num_tokens": 55982610.0, "step": 24445 }, { "entropy": 5.47747220993042, "epoch": 2.4169632265717675, "grad_norm": 1.0234375, "learning_rate": 0.00044182608462311606, "loss": 5.0358, "mean_token_accuracy": 0.2117295503616333, "num_tokens": 55994393.0, "step": 24450 }, { "entropy": 5.427250719070434, "epoch": 2.417457493080269, "grad_norm": 1.0546875, "learning_rate": 0.00044180240267783637, "loss": 5.0084, "mean_token_accuracy": 0.21002840995788574, "num_tokens": 56005705.0, "step": 24455 }, { "entropy": 5.497283935546875, "epoch": 2.41795175958877, "grad_norm": 1.2265625, "learning_rate": 0.00044177871662919184, "loss": 5.1164, "mean_token_accuracy": 0.20299535542726516, "num_tokens": 56016942.0, "step": 24460 }, { "entropy": 5.517076730728149, "epoch": 2.4184460260972718, "grad_norm": 1.046875, "learning_rate": 0.00044175502647776486, "loss": 5.1307, "mean_token_accuracy": 0.19543941617012023, "num_tokens": 56028495.0, "step": 24465 }, { "entropy": 5.521891403198242, "epoch": 2.418940292605773, "grad_norm": 1.234375, "learning_rate": 0.00044173133222413845, "loss": 5.1734, "mean_token_accuracy": 0.20578213781118393, "num_tokens": 56039654.0, "step": 24470 }, { "entropy": 5.4873748302459715, "epoch": 2.4194345591142743, "grad_norm": 1.09375, "learning_rate": 0.0004417076338688954, "loss": 5.0872, "mean_token_accuracy": 0.20901118814945222, "num_tokens": 56051392.0, "step": 24475 }, { "entropy": 5.406898450851441, "epoch": 2.419928825622776, "grad_norm": 1.125, "learning_rate": 0.00044168393141261864, "loss": 4.9999, "mean_token_accuracy": 0.21457445174455642, "num_tokens": 56062574.0, "step": 24480 }, { "entropy": 5.456973505020142, "epoch": 2.4204230921312773, "grad_norm": 1.109375, "learning_rate": 0.00044166022485589136, "loss": 5.0162, "mean_token_accuracy": 0.20823191553354264, "num_tokens": 56072637.0, "step": 24485 }, { "entropy": 5.4129579067230225, "epoch": 2.4209173586397785, "grad_norm": 1.125, "learning_rate": 0.00044163651419929667, "loss": 5.0523, "mean_token_accuracy": 0.20744042992591857, "num_tokens": 56083573.0, "step": 24490 }, { "entropy": 5.446558046340942, "epoch": 2.42141162514828, "grad_norm": 1.0625, "learning_rate": 0.00044161279944341785, "loss": 5.0881, "mean_token_accuracy": 0.20395224839448928, "num_tokens": 56094833.0, "step": 24495 }, { "entropy": 5.43768081665039, "epoch": 2.4219058916567815, "grad_norm": 1.0390625, "learning_rate": 0.0004415890805888383, "loss": 5.0732, "mean_token_accuracy": 0.20282193422317504, "num_tokens": 56107750.0, "step": 24500 }, { "entropy": 5.49199481010437, "epoch": 2.4224001581652828, "grad_norm": 1.4140625, "learning_rate": 0.00044156535763614167, "loss": 5.0553, "mean_token_accuracy": 0.2118619292974472, "num_tokens": 56118815.0, "step": 24505 }, { "entropy": 5.460046339035034, "epoch": 2.422894424673784, "grad_norm": 1.125, "learning_rate": 0.0004415416305859113, "loss": 5.1299, "mean_token_accuracy": 0.20109503716230392, "num_tokens": 56129120.0, "step": 24510 }, { "entropy": 5.417664670944214, "epoch": 2.4233886911822857, "grad_norm": 1.1015625, "learning_rate": 0.00044151789943873095, "loss": 5.0363, "mean_token_accuracy": 0.20678567439317702, "num_tokens": 56140293.0, "step": 24515 }, { "entropy": 5.591537427902222, "epoch": 2.423882957690787, "grad_norm": 0.98828125, "learning_rate": 0.0004414941641951845, "loss": 5.166, "mean_token_accuracy": 0.19427590668201447, "num_tokens": 56151942.0, "step": 24520 }, { "entropy": 5.491158437728882, "epoch": 2.4243772241992882, "grad_norm": 1.1328125, "learning_rate": 0.00044147042485585575, "loss": 5.0884, "mean_token_accuracy": 0.20904184877872467, "num_tokens": 56163088.0, "step": 24525 }, { "entropy": 5.439865303039551, "epoch": 2.4248714907077895, "grad_norm": 1.0859375, "learning_rate": 0.0004414466814213287, "loss": 5.1084, "mean_token_accuracy": 0.20518146455287933, "num_tokens": 56174879.0, "step": 24530 }, { "entropy": 5.527640914916992, "epoch": 2.425365757216291, "grad_norm": 1.046875, "learning_rate": 0.0004414229338921875, "loss": 5.1311, "mean_token_accuracy": 0.20211424827575683, "num_tokens": 56187407.0, "step": 24535 }, { "entropy": 5.472452688217163, "epoch": 2.4258600237247925, "grad_norm": 1.15625, "learning_rate": 0.00044139918226901627, "loss": 5.0298, "mean_token_accuracy": 0.21303242594003677, "num_tokens": 56198830.0, "step": 24540 }, { "entropy": 5.552091598510742, "epoch": 2.4263542902332937, "grad_norm": 1.0, "learning_rate": 0.00044137542655239945, "loss": 5.194, "mean_token_accuracy": 0.19474708735942842, "num_tokens": 56210779.0, "step": 24545 }, { "entropy": 5.43374981880188, "epoch": 2.426848556741795, "grad_norm": 1.1484375, "learning_rate": 0.0004413516667429212, "loss": 5.0951, "mean_token_accuracy": 0.20230225324630738, "num_tokens": 56222258.0, "step": 24550 }, { "entropy": 5.400051641464233, "epoch": 2.4273428232502967, "grad_norm": 1.1328125, "learning_rate": 0.0004413279028411662, "loss": 5.0546, "mean_token_accuracy": 0.2163394182920456, "num_tokens": 56232834.0, "step": 24555 }, { "entropy": 5.436425590515137, "epoch": 2.427837089758798, "grad_norm": 1.1171875, "learning_rate": 0.000441304134847719, "loss": 5.0192, "mean_token_accuracy": 0.20468443781137466, "num_tokens": 56244517.0, "step": 24560 }, { "entropy": 5.582173871994018, "epoch": 2.4283313562672992, "grad_norm": 1.1484375, "learning_rate": 0.00044128036276316424, "loss": 5.2103, "mean_token_accuracy": 0.1959197700023651, "num_tokens": 56256629.0, "step": 24565 }, { "entropy": 5.553802061080932, "epoch": 2.4288256227758005, "grad_norm": 1.0859375, "learning_rate": 0.00044125658658808676, "loss": 5.2411, "mean_token_accuracy": 0.19048468619585038, "num_tokens": 56268992.0, "step": 24570 }, { "entropy": 5.430667400360107, "epoch": 2.429319889284302, "grad_norm": 1.0859375, "learning_rate": 0.0004412328063230715, "loss": 5.0315, "mean_token_accuracy": 0.2153841346502304, "num_tokens": 56281588.0, "step": 24575 }, { "entropy": 5.5612630367279055, "epoch": 2.4298141557928035, "grad_norm": 0.9921875, "learning_rate": 0.0004412090219687034, "loss": 5.2208, "mean_token_accuracy": 0.19102327823638915, "num_tokens": 56292587.0, "step": 24580 }, { "entropy": 5.505627155303955, "epoch": 2.4303084223013047, "grad_norm": 1.0625, "learning_rate": 0.00044118523352556756, "loss": 5.0932, "mean_token_accuracy": 0.20477480739355086, "num_tokens": 56304873.0, "step": 24585 }, { "entropy": 5.413132286071777, "epoch": 2.4308026888098064, "grad_norm": 1.1171875, "learning_rate": 0.0004411614409942492, "loss": 5.0737, "mean_token_accuracy": 0.20850208401679993, "num_tokens": 56316048.0, "step": 24590 }, { "entropy": 5.474745225906372, "epoch": 2.4312969553183077, "grad_norm": 1.0546875, "learning_rate": 0.00044113764437533356, "loss": 5.0977, "mean_token_accuracy": 0.20837050825357437, "num_tokens": 56328185.0, "step": 24595 }, { "entropy": 5.536024951934815, "epoch": 2.431791221826809, "grad_norm": 0.94140625, "learning_rate": 0.0004411138436694062, "loss": 5.1992, "mean_token_accuracy": 0.19488661885261535, "num_tokens": 56341533.0, "step": 24600 }, { "entropy": 5.623372173309326, "epoch": 2.43228548833531, "grad_norm": 1.3828125, "learning_rate": 0.00044109003887705245, "loss": 5.2632, "mean_token_accuracy": 0.19504843652248383, "num_tokens": 56351610.0, "step": 24605 }, { "entropy": 5.517627906799317, "epoch": 2.432779754843812, "grad_norm": 1.109375, "learning_rate": 0.000441066229998858, "loss": 5.1318, "mean_token_accuracy": 0.21082397550344467, "num_tokens": 56361822.0, "step": 24610 }, { "entropy": 5.4779948711395265, "epoch": 2.433274021352313, "grad_norm": 1.109375, "learning_rate": 0.00044104241703540854, "loss": 5.0989, "mean_token_accuracy": 0.2033616706728935, "num_tokens": 56373432.0, "step": 24615 }, { "entropy": 5.458730173110962, "epoch": 2.4337682878608144, "grad_norm": 1.1171875, "learning_rate": 0.0004410185999872898, "loss": 5.0957, "mean_token_accuracy": 0.20270515233278275, "num_tokens": 56385086.0, "step": 24620 }, { "entropy": 5.515968894958496, "epoch": 2.434262554369316, "grad_norm": 1.1015625, "learning_rate": 0.00044099477885508774, "loss": 5.0693, "mean_token_accuracy": 0.20813625454902648, "num_tokens": 56395963.0, "step": 24625 }, { "entropy": 5.521343183517456, "epoch": 2.4347568208778174, "grad_norm": 1.1484375, "learning_rate": 0.00044097095363938843, "loss": 5.1533, "mean_token_accuracy": 0.19692583233118058, "num_tokens": 56407685.0, "step": 24630 }, { "entropy": 5.524341297149658, "epoch": 2.4352510873863187, "grad_norm": 1.1015625, "learning_rate": 0.0004409471243407779, "loss": 5.1008, "mean_token_accuracy": 0.20853097438812257, "num_tokens": 56418570.0, "step": 24635 }, { "entropy": 5.505349016189575, "epoch": 2.43574535389482, "grad_norm": 1.125, "learning_rate": 0.0004409232909598424, "loss": 5.1409, "mean_token_accuracy": 0.20602805465459822, "num_tokens": 56430312.0, "step": 24640 }, { "entropy": 5.582175302505493, "epoch": 2.4362396204033216, "grad_norm": 1.0703125, "learning_rate": 0.0004408994534971682, "loss": 5.1993, "mean_token_accuracy": 0.1931255653500557, "num_tokens": 56441847.0, "step": 24645 }, { "entropy": 5.46953239440918, "epoch": 2.436733886911823, "grad_norm": 1.09375, "learning_rate": 0.00044087561195334165, "loss": 5.1078, "mean_token_accuracy": 0.20379755645990372, "num_tokens": 56453567.0, "step": 24650 }, { "entropy": 5.47821159362793, "epoch": 2.437228153420324, "grad_norm": 1.1171875, "learning_rate": 0.0004408517663289493, "loss": 5.1033, "mean_token_accuracy": 0.19907173961400987, "num_tokens": 56464726.0, "step": 24655 }, { "entropy": 5.492896032333374, "epoch": 2.4377224199288254, "grad_norm": 1.1171875, "learning_rate": 0.0004408279166245778, "loss": 5.1088, "mean_token_accuracy": 0.20372008681297302, "num_tokens": 56475989.0, "step": 24660 }, { "entropy": 5.540158462524414, "epoch": 2.438216686437327, "grad_norm": 1.09375, "learning_rate": 0.00044080406284081387, "loss": 5.1158, "mean_token_accuracy": 0.20692139863967896, "num_tokens": 56487782.0, "step": 24665 }, { "entropy": 5.479180479049683, "epoch": 2.4387109529458284, "grad_norm": 1.15625, "learning_rate": 0.0004407802049782442, "loss": 5.1135, "mean_token_accuracy": 0.20168498754501343, "num_tokens": 56500529.0, "step": 24670 }, { "entropy": 5.390605449676514, "epoch": 2.4392052194543297, "grad_norm": 1.0, "learning_rate": 0.0004407563430374558, "loss": 5.044, "mean_token_accuracy": 0.20880429893732072, "num_tokens": 56512411.0, "step": 24675 }, { "entropy": 5.428992176055909, "epoch": 2.439699485962831, "grad_norm": 1.078125, "learning_rate": 0.0004407324770190357, "loss": 4.973, "mean_token_accuracy": 0.21480999141931534, "num_tokens": 56522983.0, "step": 24680 }, { "entropy": 5.430551528930664, "epoch": 2.4401937524713326, "grad_norm": 1.078125, "learning_rate": 0.00044070860692357086, "loss": 5.142, "mean_token_accuracy": 0.2067538946866989, "num_tokens": 56534380.0, "step": 24685 }, { "entropy": 5.515534734725952, "epoch": 2.440688018979834, "grad_norm": 1.1015625, "learning_rate": 0.00044068473275164863, "loss": 5.1171, "mean_token_accuracy": 0.20013733953237534, "num_tokens": 56546003.0, "step": 24690 }, { "entropy": 5.444821453094482, "epoch": 2.441182285488335, "grad_norm": 1.1328125, "learning_rate": 0.0004406608545038563, "loss": 5.007, "mean_token_accuracy": 0.2121601089835167, "num_tokens": 56556006.0, "step": 24695 }, { "entropy": 5.430108880996704, "epoch": 2.441676551996837, "grad_norm": 1.1640625, "learning_rate": 0.0004406369721807812, "loss": 5.0358, "mean_token_accuracy": 0.20903393775224685, "num_tokens": 56567569.0, "step": 24700 }, { "entropy": 5.478749513626099, "epoch": 2.442170818505338, "grad_norm": 1.109375, "learning_rate": 0.0004406130857830109, "loss": 5.1485, "mean_token_accuracy": 0.20527566224336624, "num_tokens": 56580143.0, "step": 24705 }, { "entropy": 5.455153560638427, "epoch": 2.4426650850138394, "grad_norm": 1.03125, "learning_rate": 0.000440589195311133, "loss": 5.0382, "mean_token_accuracy": 0.21119300723075868, "num_tokens": 56591169.0, "step": 24710 }, { "entropy": 5.4638916015625, "epoch": 2.4431593515223406, "grad_norm": 1.1484375, "learning_rate": 0.00044056530076573515, "loss": 5.1079, "mean_token_accuracy": 0.20415205359458924, "num_tokens": 56602556.0, "step": 24715 }, { "entropy": 5.522335195541382, "epoch": 2.4436536180308424, "grad_norm": 1.0546875, "learning_rate": 0.0004405414021474053, "loss": 5.0889, "mean_token_accuracy": 0.20856422334909439, "num_tokens": 56614854.0, "step": 24720 }, { "entropy": 5.440070009231567, "epoch": 2.4441478845393436, "grad_norm": 1.109375, "learning_rate": 0.0004405174994567313, "loss": 5.0132, "mean_token_accuracy": 0.2098423272371292, "num_tokens": 56626004.0, "step": 24725 }, { "entropy": 5.560739040374756, "epoch": 2.444642151047845, "grad_norm": 1.1640625, "learning_rate": 0.00044049359269430105, "loss": 5.1482, "mean_token_accuracy": 0.19802184402942657, "num_tokens": 56636373.0, "step": 24730 }, { "entropy": 5.441765069961548, "epoch": 2.4451364175563466, "grad_norm": 1.203125, "learning_rate": 0.0004404696818607028, "loss": 4.9975, "mean_token_accuracy": 0.20928096473217012, "num_tokens": 56648414.0, "step": 24735 }, { "entropy": 5.454145193099976, "epoch": 2.445630684064848, "grad_norm": 1.0703125, "learning_rate": 0.00044044576695652463, "loss": 5.0901, "mean_token_accuracy": 0.2045057475566864, "num_tokens": 56660430.0, "step": 24740 }, { "entropy": 5.5101110458374025, "epoch": 2.446124950573349, "grad_norm": 1.109375, "learning_rate": 0.000440421847982355, "loss": 5.0962, "mean_token_accuracy": 0.20624202191829683, "num_tokens": 56671133.0, "step": 24745 }, { "entropy": 5.491914939880371, "epoch": 2.4466192170818504, "grad_norm": 1.0234375, "learning_rate": 0.0004403979249387822, "loss": 5.1786, "mean_token_accuracy": 0.19465420842170716, "num_tokens": 56682788.0, "step": 24750 }, { "entropy": 5.434906959533691, "epoch": 2.447113483590352, "grad_norm": 1.0859375, "learning_rate": 0.0004403739978263948, "loss": 5.1049, "mean_token_accuracy": 0.20493227243423462, "num_tokens": 56693832.0, "step": 24755 }, { "entropy": 5.5496758937835695, "epoch": 2.4476077500988533, "grad_norm": 1.0859375, "learning_rate": 0.00044035006664578145, "loss": 5.1738, "mean_token_accuracy": 0.19455254226922988, "num_tokens": 56705915.0, "step": 24760 }, { "entropy": 5.468791103363037, "epoch": 2.4481020166073546, "grad_norm": 1.140625, "learning_rate": 0.00044032613139753077, "loss": 5.0909, "mean_token_accuracy": 0.20960814356803895, "num_tokens": 56717461.0, "step": 24765 }, { "entropy": 5.411565494537354, "epoch": 2.4485962831158563, "grad_norm": 1.0546875, "learning_rate": 0.0004403021920822316, "loss": 4.9504, "mean_token_accuracy": 0.2178207442164421, "num_tokens": 56728695.0, "step": 24770 }, { "entropy": 5.412420845031738, "epoch": 2.4490905496243576, "grad_norm": 1.171875, "learning_rate": 0.0004402782487004728, "loss": 5.0535, "mean_token_accuracy": 0.203393816947937, "num_tokens": 56740520.0, "step": 24775 }, { "entropy": 5.396411514282226, "epoch": 2.449584816132859, "grad_norm": 1.046875, "learning_rate": 0.00044025430125284353, "loss": 5.0021, "mean_token_accuracy": 0.21679751127958297, "num_tokens": 56751071.0, "step": 24780 }, { "entropy": 5.5069197654724125, "epoch": 2.45007908264136, "grad_norm": 1.078125, "learning_rate": 0.0004402303497399329, "loss": 5.1577, "mean_token_accuracy": 0.19686210602521897, "num_tokens": 56764759.0, "step": 24785 }, { "entropy": 5.555088710784912, "epoch": 2.4505733491498614, "grad_norm": 1.265625, "learning_rate": 0.00044020639416232984, "loss": 5.1564, "mean_token_accuracy": 0.2036934807896614, "num_tokens": 56775592.0, "step": 24790 }, { "entropy": 5.51851372718811, "epoch": 2.451067615658363, "grad_norm": 1.2421875, "learning_rate": 0.000440182434520624, "loss": 5.1963, "mean_token_accuracy": 0.19388588964939119, "num_tokens": 56786860.0, "step": 24795 }, { "entropy": 5.528635692596436, "epoch": 2.4515618821668643, "grad_norm": 1.125, "learning_rate": 0.0004401584708154045, "loss": 5.1398, "mean_token_accuracy": 0.2015665054321289, "num_tokens": 56798741.0, "step": 24800 }, { "entropy": 5.510555458068848, "epoch": 2.4520561486753656, "grad_norm": 1.09375, "learning_rate": 0.00044013450304726114, "loss": 5.0734, "mean_token_accuracy": 0.20401668846607207, "num_tokens": 56810612.0, "step": 24805 }, { "entropy": 5.480600357055664, "epoch": 2.4525504151838673, "grad_norm": 1.28125, "learning_rate": 0.0004401105312167833, "loss": 5.1233, "mean_token_accuracy": 0.2056616112589836, "num_tokens": 56822169.0, "step": 24810 }, { "entropy": 5.446529817581177, "epoch": 2.4530446816923686, "grad_norm": 1.109375, "learning_rate": 0.0004400865553245608, "loss": 5.0524, "mean_token_accuracy": 0.20780978202819825, "num_tokens": 56833873.0, "step": 24815 }, { "entropy": 5.495194149017334, "epoch": 2.45353894820087, "grad_norm": 1.1328125, "learning_rate": 0.00044006257537118344, "loss": 5.0034, "mean_token_accuracy": 0.21442195475101472, "num_tokens": 56844616.0, "step": 24820 }, { "entropy": 5.456418752670288, "epoch": 2.454033214709371, "grad_norm": 1.03125, "learning_rate": 0.0004400385913572412, "loss": 5.0941, "mean_token_accuracy": 0.1964623361825943, "num_tokens": 56855877.0, "step": 24825 }, { "entropy": 5.507020425796509, "epoch": 2.454527481217873, "grad_norm": 1.2109375, "learning_rate": 0.00044001460328332387, "loss": 5.1006, "mean_token_accuracy": 0.20555953681468964, "num_tokens": 56868103.0, "step": 24830 }, { "entropy": 5.523243713378906, "epoch": 2.455021747726374, "grad_norm": 1.015625, "learning_rate": 0.0004399906111500218, "loss": 5.21, "mean_token_accuracy": 0.19425486028194427, "num_tokens": 56878957.0, "step": 24835 }, { "entropy": 5.5970892906188965, "epoch": 2.4555160142348753, "grad_norm": 1.125, "learning_rate": 0.000439966614957925, "loss": 5.1359, "mean_token_accuracy": 0.19487901479005815, "num_tokens": 56891915.0, "step": 24840 }, { "entropy": 5.481054449081421, "epoch": 2.456010280743377, "grad_norm": 1.2265625, "learning_rate": 0.0004399426147076239, "loss": 5.0808, "mean_token_accuracy": 0.20580538511276245, "num_tokens": 56902322.0, "step": 24845 }, { "entropy": 5.522133684158325, "epoch": 2.4565045472518783, "grad_norm": 1.0625, "learning_rate": 0.000439918610399709, "loss": 5.1613, "mean_token_accuracy": 0.1908208027482033, "num_tokens": 56913560.0, "step": 24850 }, { "entropy": 5.490698385238647, "epoch": 2.4569988137603795, "grad_norm": 1.125, "learning_rate": 0.00043989460203477053, "loss": 5.0835, "mean_token_accuracy": 0.20346077531576157, "num_tokens": 56924235.0, "step": 24855 }, { "entropy": 5.387242698669434, "epoch": 2.457493080268881, "grad_norm": 1.15625, "learning_rate": 0.00043987058961339937, "loss": 4.9477, "mean_token_accuracy": 0.21069643795490264, "num_tokens": 56935257.0, "step": 24860 }, { "entropy": 5.461850261688232, "epoch": 2.4579873467773825, "grad_norm": 1.0625, "learning_rate": 0.00043984657313618616, "loss": 5.1089, "mean_token_accuracy": 0.20711364448070527, "num_tokens": 56945896.0, "step": 24865 }, { "entropy": 5.526152944564819, "epoch": 2.4584816132858838, "grad_norm": 1.0234375, "learning_rate": 0.0004398225526037216, "loss": 5.2315, "mean_token_accuracy": 0.1939054474234581, "num_tokens": 56957274.0, "step": 24870 }, { "entropy": 5.474370336532592, "epoch": 2.458975879794385, "grad_norm": 1.0703125, "learning_rate": 0.00043979852801659673, "loss": 5.0508, "mean_token_accuracy": 0.20531777739524842, "num_tokens": 56969647.0, "step": 24875 }, { "entropy": 5.5560894966125485, "epoch": 2.4594701463028867, "grad_norm": 1.0390625, "learning_rate": 0.0004397744993754025, "loss": 5.0783, "mean_token_accuracy": 0.20568324029445648, "num_tokens": 56981443.0, "step": 24880 }, { "entropy": 5.455016422271728, "epoch": 2.459964412811388, "grad_norm": 1.125, "learning_rate": 0.00043975046668072996, "loss": 5.0613, "mean_token_accuracy": 0.21121497750282286, "num_tokens": 56992482.0, "step": 24885 }, { "entropy": 5.478019952774048, "epoch": 2.4604586793198893, "grad_norm": 1.1484375, "learning_rate": 0.00043972642993317043, "loss": 5.1238, "mean_token_accuracy": 0.2063273996114731, "num_tokens": 57003172.0, "step": 24890 }, { "entropy": 5.553106594085693, "epoch": 2.4609529458283905, "grad_norm": 1.109375, "learning_rate": 0.00043970238913331513, "loss": 5.2015, "mean_token_accuracy": 0.19956048130989074, "num_tokens": 57014763.0, "step": 24895 }, { "entropy": 5.472220802307129, "epoch": 2.4614472123368922, "grad_norm": 1.1640625, "learning_rate": 0.00043967834428175565, "loss": 5.1008, "mean_token_accuracy": 0.21199352741241456, "num_tokens": 57025564.0, "step": 24900 }, { "entropy": 5.475388669967652, "epoch": 2.4619414788453935, "grad_norm": 1.1328125, "learning_rate": 0.00043965429537908316, "loss": 5.0859, "mean_token_accuracy": 0.20371516942977905, "num_tokens": 57036121.0, "step": 24905 }, { "entropy": 5.504273414611816, "epoch": 2.4624357453538948, "grad_norm": 1.109375, "learning_rate": 0.0004396302424258896, "loss": 5.23, "mean_token_accuracy": 0.19250302910804748, "num_tokens": 57048759.0, "step": 24910 }, { "entropy": 5.4025146007537845, "epoch": 2.462930011862396, "grad_norm": 1.09375, "learning_rate": 0.0004396061854227665, "loss": 5.0325, "mean_token_accuracy": 0.20790684819221497, "num_tokens": 57060791.0, "step": 24915 }, { "entropy": 5.4440961360931395, "epoch": 2.4634242783708977, "grad_norm": 1.2265625, "learning_rate": 0.00043958212437030566, "loss": 5.0462, "mean_token_accuracy": 0.20593809932470322, "num_tokens": 57070788.0, "step": 24920 }, { "entropy": 5.49532527923584, "epoch": 2.463918544879399, "grad_norm": 1.1640625, "learning_rate": 0.000439558059269099, "loss": 5.1473, "mean_token_accuracy": 0.20224593728780746, "num_tokens": 57082008.0, "step": 24925 }, { "entropy": 5.496189165115356, "epoch": 2.4644128113879002, "grad_norm": 1.1796875, "learning_rate": 0.0004395339901197386, "loss": 5.0753, "mean_token_accuracy": 0.2049644336104393, "num_tokens": 57093081.0, "step": 24930 }, { "entropy": 5.390702390670777, "epoch": 2.4649070778964015, "grad_norm": 1.109375, "learning_rate": 0.0004395099169228166, "loss": 5.0253, "mean_token_accuracy": 0.20953360497951506, "num_tokens": 57103294.0, "step": 24935 }, { "entropy": 5.440811967849731, "epoch": 2.465401344404903, "grad_norm": 1.0234375, "learning_rate": 0.00043948583967892495, "loss": 5.006, "mean_token_accuracy": 0.21172278076410295, "num_tokens": 57114509.0, "step": 24940 }, { "entropy": 5.5770281791687015, "epoch": 2.4658956109134045, "grad_norm": 1.109375, "learning_rate": 0.0004394617583886563, "loss": 5.1707, "mean_token_accuracy": 0.19137718975543977, "num_tokens": 57126481.0, "step": 24945 }, { "entropy": 5.461055946350098, "epoch": 2.4663898774219057, "grad_norm": 1.15625, "learning_rate": 0.0004394376730526028, "loss": 5.0777, "mean_token_accuracy": 0.2014887735247612, "num_tokens": 57138235.0, "step": 24950 }, { "entropy": 5.475442743301391, "epoch": 2.4668841439304074, "grad_norm": 0.92578125, "learning_rate": 0.00043941358367135706, "loss": 5.0945, "mean_token_accuracy": 0.2053341507911682, "num_tokens": 57150731.0, "step": 24955 }, { "entropy": 5.49628381729126, "epoch": 2.4673784104389087, "grad_norm": 1.40625, "learning_rate": 0.00043938949024551155, "loss": 5.1084, "mean_token_accuracy": 0.19958603531122207, "num_tokens": 57162729.0, "step": 24960 }, { "entropy": 5.497325372695923, "epoch": 2.46787267694741, "grad_norm": 1.09375, "learning_rate": 0.00043936539277565916, "loss": 5.1003, "mean_token_accuracy": 0.2059482827782631, "num_tokens": 57173855.0, "step": 24965 }, { "entropy": 5.431111669540405, "epoch": 2.4683669434559112, "grad_norm": 1.1328125, "learning_rate": 0.00043934129126239256, "loss": 5.0562, "mean_token_accuracy": 0.20922463536262512, "num_tokens": 57184829.0, "step": 24970 }, { "entropy": 5.548756122589111, "epoch": 2.468861209964413, "grad_norm": 1.2578125, "learning_rate": 0.0004393171857063048, "loss": 5.1462, "mean_token_accuracy": 0.20031761080026628, "num_tokens": 57195679.0, "step": 24975 }, { "entropy": 5.521723079681396, "epoch": 2.469355476472914, "grad_norm": 1.2578125, "learning_rate": 0.00043929307610798867, "loss": 5.0809, "mean_token_accuracy": 0.20107638835906982, "num_tokens": 57208022.0, "step": 24980 }, { "entropy": 5.412291574478149, "epoch": 2.4698497429814155, "grad_norm": 1.140625, "learning_rate": 0.0004392689624680375, "loss": 5.0094, "mean_token_accuracy": 0.21692616790533065, "num_tokens": 57218699.0, "step": 24985 }, { "entropy": 5.460743713378906, "epoch": 2.470344009489917, "grad_norm": 1.0390625, "learning_rate": 0.0004392448447870443, "loss": 5.1466, "mean_token_accuracy": 0.20303266644477844, "num_tokens": 57231333.0, "step": 24990 }, { "entropy": 5.563371562957764, "epoch": 2.4708382759984184, "grad_norm": 1.109375, "learning_rate": 0.0004392207230656024, "loss": 5.1274, "mean_token_accuracy": 0.199388787150383, "num_tokens": 57242748.0, "step": 24995 }, { "entropy": 5.479325628280639, "epoch": 2.4713325425069197, "grad_norm": 1.0703125, "learning_rate": 0.0004391965973043053, "loss": 5.0923, "mean_token_accuracy": 0.20689608454704284, "num_tokens": 57255438.0, "step": 25000 }, { "entropy": 5.554194355010987, "epoch": 2.471826809015421, "grad_norm": 0.984375, "learning_rate": 0.0004391724675037464, "loss": 5.1902, "mean_token_accuracy": 0.1978789046406746, "num_tokens": 57267472.0, "step": 25005 }, { "entropy": 5.4828859806060795, "epoch": 2.4723210755239227, "grad_norm": 1.0546875, "learning_rate": 0.00043914833366451934, "loss": 5.0851, "mean_token_accuracy": 0.20473093986511232, "num_tokens": 57277921.0, "step": 25010 }, { "entropy": 5.46669750213623, "epoch": 2.472815342032424, "grad_norm": 1.0703125, "learning_rate": 0.0004391241957872178, "loss": 5.0955, "mean_token_accuracy": 0.20800813734531404, "num_tokens": 57290207.0, "step": 25015 }, { "entropy": 5.494811391830444, "epoch": 2.473309608540925, "grad_norm": 1.0859375, "learning_rate": 0.00043910005387243564, "loss": 5.0396, "mean_token_accuracy": 0.20656308978796006, "num_tokens": 57300599.0, "step": 25020 }, { "entropy": 5.477337074279785, "epoch": 2.473803875049427, "grad_norm": 1.1015625, "learning_rate": 0.00043907590792076665, "loss": 5.163, "mean_token_accuracy": 0.19489261507987976, "num_tokens": 57313035.0, "step": 25025 }, { "entropy": 5.505033302307129, "epoch": 2.474298141557928, "grad_norm": 1.1328125, "learning_rate": 0.0004390517579328048, "loss": 5.0978, "mean_token_accuracy": 0.2065257340669632, "num_tokens": 57325141.0, "step": 25030 }, { "entropy": 5.513743925094604, "epoch": 2.4747924080664294, "grad_norm": 1.09375, "learning_rate": 0.0004390276039091443, "loss": 5.131, "mean_token_accuracy": 0.20462456345558167, "num_tokens": 57336824.0, "step": 25035 }, { "entropy": 5.538777112960815, "epoch": 2.4752866745749307, "grad_norm": 1.1640625, "learning_rate": 0.00043900344585037933, "loss": 5.1935, "mean_token_accuracy": 0.19034961313009263, "num_tokens": 57347078.0, "step": 25040 }, { "entropy": 5.459711074829102, "epoch": 2.475780941083432, "grad_norm": 1.0859375, "learning_rate": 0.00043897928375710417, "loss": 5.0509, "mean_token_accuracy": 0.20723038166761398, "num_tokens": 57359320.0, "step": 25045 }, { "entropy": 5.523319673538208, "epoch": 2.4762752075919336, "grad_norm": 1.1328125, "learning_rate": 0.0004389551176299132, "loss": 5.1199, "mean_token_accuracy": 0.1993309736251831, "num_tokens": 57370642.0, "step": 25050 }, { "entropy": 5.465310955047608, "epoch": 2.476769474100435, "grad_norm": 1.09375, "learning_rate": 0.0004389309474694008, "loss": 5.097, "mean_token_accuracy": 0.2100017175078392, "num_tokens": 57382082.0, "step": 25055 }, { "entropy": 5.47874345779419, "epoch": 2.477263740608936, "grad_norm": 1.171875, "learning_rate": 0.0004389067732761617, "loss": 5.1853, "mean_token_accuracy": 0.19917632192373275, "num_tokens": 57393591.0, "step": 25060 }, { "entropy": 5.44642972946167, "epoch": 2.477758007117438, "grad_norm": 1.1953125, "learning_rate": 0.00043888259505079063, "loss": 5.0274, "mean_token_accuracy": 0.2053271070122719, "num_tokens": 57404999.0, "step": 25065 }, { "entropy": 5.47453818321228, "epoch": 2.478252273625939, "grad_norm": 1.1328125, "learning_rate": 0.0004388584127938822, "loss": 5.1419, "mean_token_accuracy": 0.2057407319545746, "num_tokens": 57416467.0, "step": 25070 }, { "entropy": 5.556550598144531, "epoch": 2.4787465401344404, "grad_norm": 1.0078125, "learning_rate": 0.0004388342265060314, "loss": 5.1772, "mean_token_accuracy": 0.20119862109422684, "num_tokens": 57427201.0, "step": 25075 }, { "entropy": 5.550575399398804, "epoch": 2.4792408066429417, "grad_norm": 1.109375, "learning_rate": 0.00043881003618783326, "loss": 5.1619, "mean_token_accuracy": 0.19863881915807724, "num_tokens": 57438345.0, "step": 25080 }, { "entropy": 5.504270887374878, "epoch": 2.4797350731514434, "grad_norm": 1.1875, "learning_rate": 0.0004387858418398828, "loss": 5.1548, "mean_token_accuracy": 0.2047478049993515, "num_tokens": 57449818.0, "step": 25085 }, { "entropy": 5.515871524810791, "epoch": 2.4802293396599446, "grad_norm": 1.09375, "learning_rate": 0.0004387616434627753, "loss": 5.1212, "mean_token_accuracy": 0.2020190730690956, "num_tokens": 57461961.0, "step": 25090 }, { "entropy": 5.449320268630982, "epoch": 2.480723606168446, "grad_norm": 1.1875, "learning_rate": 0.00043873744105710585, "loss": 5.0566, "mean_token_accuracy": 0.2140592947602272, "num_tokens": 57473422.0, "step": 25095 }, { "entropy": 5.507005786895752, "epoch": 2.4812178726769476, "grad_norm": 1.0390625, "learning_rate": 0.00043871323462347, "loss": 5.0359, "mean_token_accuracy": 0.22032095193862916, "num_tokens": 57484618.0, "step": 25100 }, { "entropy": 5.46153450012207, "epoch": 2.481712139185449, "grad_norm": 1.1640625, "learning_rate": 0.0004386890241624631, "loss": 4.9377, "mean_token_accuracy": 0.2145286336541176, "num_tokens": 57493521.0, "step": 25105 }, { "entropy": 5.436525344848633, "epoch": 2.48220640569395, "grad_norm": 1.0703125, "learning_rate": 0.0004386648096746809, "loss": 5.1013, "mean_token_accuracy": 0.20619928240776061, "num_tokens": 57505693.0, "step": 25110 }, { "entropy": 5.460772132873535, "epoch": 2.4827006722024514, "grad_norm": 1.09375, "learning_rate": 0.00043864059116071897, "loss": 5.0549, "mean_token_accuracy": 0.21243076026439667, "num_tokens": 57517734.0, "step": 25115 }, { "entropy": 5.4907745838165285, "epoch": 2.483194938710953, "grad_norm": 1.0703125, "learning_rate": 0.0004386163686211731, "loss": 5.1261, "mean_token_accuracy": 0.20214656442403794, "num_tokens": 57529393.0, "step": 25120 }, { "entropy": 5.397996234893799, "epoch": 2.4836892052194544, "grad_norm": 1.046875, "learning_rate": 0.00043859214205663915, "loss": 5.0012, "mean_token_accuracy": 0.21629233956336974, "num_tokens": 57541109.0, "step": 25125 }, { "entropy": 5.561869525909424, "epoch": 2.4841834717279556, "grad_norm": 1.171875, "learning_rate": 0.00043856791146771327, "loss": 5.165, "mean_token_accuracy": 0.19821611493825914, "num_tokens": 57551869.0, "step": 25130 }, { "entropy": 5.480923461914062, "epoch": 2.4846777382364573, "grad_norm": 1.140625, "learning_rate": 0.0004385436768549912, "loss": 5.0822, "mean_token_accuracy": 0.2116673082113266, "num_tokens": 57564174.0, "step": 25135 }, { "entropy": 5.543782186508179, "epoch": 2.4851720047449586, "grad_norm": 1.140625, "learning_rate": 0.00043851943821906944, "loss": 5.1575, "mean_token_accuracy": 0.2018676593899727, "num_tokens": 57575110.0, "step": 25140 }, { "entropy": 5.452737665176391, "epoch": 2.48566627125346, "grad_norm": 1.0703125, "learning_rate": 0.00043849519556054406, "loss": 5.0748, "mean_token_accuracy": 0.20832909494638444, "num_tokens": 57587143.0, "step": 25145 }, { "entropy": 5.418619108200073, "epoch": 2.486160537761961, "grad_norm": 1.109375, "learning_rate": 0.00043847094888001156, "loss": 5.0489, "mean_token_accuracy": 0.20842526108026505, "num_tokens": 57598828.0, "step": 25150 }, { "entropy": 5.545168352127075, "epoch": 2.486654804270463, "grad_norm": 1.046875, "learning_rate": 0.0004384466981780683, "loss": 5.1117, "mean_token_accuracy": 0.19912556558847427, "num_tokens": 57609598.0, "step": 25155 }, { "entropy": 5.507103300094604, "epoch": 2.487149070778964, "grad_norm": 1.078125, "learning_rate": 0.00043842244345531094, "loss": 5.0746, "mean_token_accuracy": 0.207445028424263, "num_tokens": 57620702.0, "step": 25160 }, { "entropy": 5.493671989440918, "epoch": 2.4876433372874653, "grad_norm": 1.2109375, "learning_rate": 0.00043839818471233614, "loss": 5.1259, "mean_token_accuracy": 0.19632306843996047, "num_tokens": 57632996.0, "step": 25165 }, { "entropy": 5.4382984161376955, "epoch": 2.4881376037959666, "grad_norm": 1.1015625, "learning_rate": 0.0004383739219497406, "loss": 5.109, "mean_token_accuracy": 0.203692626953125, "num_tokens": 57644222.0, "step": 25170 }, { "entropy": 5.450685834884643, "epoch": 2.4886318703044683, "grad_norm": 1.1328125, "learning_rate": 0.00043834965516812124, "loss": 5.0794, "mean_token_accuracy": 0.20437074452638626, "num_tokens": 57656399.0, "step": 25175 }, { "entropy": 5.586425685882569, "epoch": 2.4891261368129696, "grad_norm": 1.1640625, "learning_rate": 0.00043832538436807506, "loss": 5.1498, "mean_token_accuracy": 0.19669721722602845, "num_tokens": 57668229.0, "step": 25180 }, { "entropy": 5.4174130916595455, "epoch": 2.489620403321471, "grad_norm": 1.0546875, "learning_rate": 0.00043830110955019903, "loss": 5.0521, "mean_token_accuracy": 0.20735956728458405, "num_tokens": 57679828.0, "step": 25185 }, { "entropy": 5.515197992324829, "epoch": 2.490114669829972, "grad_norm": 1.1875, "learning_rate": 0.00043827683071509044, "loss": 5.1247, "mean_token_accuracy": 0.19781017452478408, "num_tokens": 57692248.0, "step": 25190 }, { "entropy": 5.516388273239135, "epoch": 2.490608936338474, "grad_norm": 1.109375, "learning_rate": 0.00043825254786334646, "loss": 5.1188, "mean_token_accuracy": 0.20316905677318572, "num_tokens": 57704123.0, "step": 25195 }, { "entropy": 5.403844404220581, "epoch": 2.491103202846975, "grad_norm": 1.046875, "learning_rate": 0.00043822826099556444, "loss": 4.9788, "mean_token_accuracy": 0.20711625814437867, "num_tokens": 57715867.0, "step": 25200 }, { "entropy": 5.547531270980835, "epoch": 2.4915974693554763, "grad_norm": 1.109375, "learning_rate": 0.00043820397011234193, "loss": 5.1802, "mean_token_accuracy": 0.193709833920002, "num_tokens": 57727551.0, "step": 25205 }, { "entropy": 5.504286289215088, "epoch": 2.492091735863978, "grad_norm": 1.09375, "learning_rate": 0.0004381796752142764, "loss": 5.0491, "mean_token_accuracy": 0.2111051544547081, "num_tokens": 57738872.0, "step": 25210 }, { "entropy": 5.411252832412719, "epoch": 2.4925860023724793, "grad_norm": 1.125, "learning_rate": 0.0004381553763019655, "loss": 4.9921, "mean_token_accuracy": 0.21423764079809188, "num_tokens": 57748323.0, "step": 25215 }, { "entropy": 5.469523859024048, "epoch": 2.4930802688809806, "grad_norm": 1.078125, "learning_rate": 0.00043813107337600717, "loss": 5.1332, "mean_token_accuracy": 0.2021828681230545, "num_tokens": 57759697.0, "step": 25220 }, { "entropy": 5.465771865844727, "epoch": 2.493574535389482, "grad_norm": 1.0078125, "learning_rate": 0.000438106766436999, "loss": 5.0622, "mean_token_accuracy": 0.20388637334108353, "num_tokens": 57772532.0, "step": 25225 }, { "entropy": 5.378614711761474, "epoch": 2.4940688018979835, "grad_norm": 1.15625, "learning_rate": 0.00043808245548553916, "loss": 5.0229, "mean_token_accuracy": 0.21199197471141815, "num_tokens": 57783895.0, "step": 25230 }, { "entropy": 5.402005910873413, "epoch": 2.494563068406485, "grad_norm": 1.0546875, "learning_rate": 0.00043805814052222554, "loss": 5.0323, "mean_token_accuracy": 0.20967167168855666, "num_tokens": 57795566.0, "step": 25235 }, { "entropy": 5.46422176361084, "epoch": 2.495057334914986, "grad_norm": 1.09375, "learning_rate": 0.0004380338215476564, "loss": 5.1338, "mean_token_accuracy": 0.2008281096816063, "num_tokens": 57807792.0, "step": 25240 }, { "entropy": 5.505619764328003, "epoch": 2.4955516014234878, "grad_norm": 1.03125, "learning_rate": 0.00043800949856242995, "loss": 5.0604, "mean_token_accuracy": 0.21342795938253403, "num_tokens": 57817771.0, "step": 25245 }, { "entropy": 5.525988483428955, "epoch": 2.496045867931989, "grad_norm": 0.97265625, "learning_rate": 0.0004379851715671445, "loss": 5.1338, "mean_token_accuracy": 0.2059691146016121, "num_tokens": 57828442.0, "step": 25250 }, { "entropy": 5.5657049179077145, "epoch": 2.4965401344404903, "grad_norm": 1.1875, "learning_rate": 0.00043796084056239864, "loss": 5.2022, "mean_token_accuracy": 0.1981976345181465, "num_tokens": 57840537.0, "step": 25255 }, { "entropy": 5.548855590820312, "epoch": 2.4970344009489915, "grad_norm": 1.1328125, "learning_rate": 0.00043793650554879075, "loss": 5.2333, "mean_token_accuracy": 0.1963667690753937, "num_tokens": 57851645.0, "step": 25260 }, { "entropy": 5.454617071151733, "epoch": 2.4975286674574932, "grad_norm": 1.1171875, "learning_rate": 0.0004379121665269196, "loss": 5.0197, "mean_token_accuracy": 0.20639844387769699, "num_tokens": 57863812.0, "step": 25265 }, { "entropy": 5.498637437820435, "epoch": 2.4980229339659945, "grad_norm": 1.515625, "learning_rate": 0.00043788782349738387, "loss": 5.2147, "mean_token_accuracy": 0.19475086331367492, "num_tokens": 57876472.0, "step": 25270 }, { "entropy": 5.5039009094238285, "epoch": 2.4985172004744958, "grad_norm": 1.140625, "learning_rate": 0.0004378634764607824, "loss": 5.0363, "mean_token_accuracy": 0.20650025755167006, "num_tokens": 57887905.0, "step": 25275 }, { "entropy": 5.440869140625, "epoch": 2.4990114669829975, "grad_norm": 1.0703125, "learning_rate": 0.0004378391254177141, "loss": 5.0229, "mean_token_accuracy": 0.2094441443681717, "num_tokens": 57899084.0, "step": 25280 }, { "entropy": 5.387057638168335, "epoch": 2.4995057334914987, "grad_norm": 1.0078125, "learning_rate": 0.00043781477036877807, "loss": 5.0569, "mean_token_accuracy": 0.2079085662961006, "num_tokens": 57910134.0, "step": 25285 }, { "entropy": 5.505024719238281, "epoch": 2.5, "grad_norm": 1.109375, "learning_rate": 0.0004377904113145735, "loss": 5.0823, "mean_token_accuracy": 0.21174312382936478, "num_tokens": 57921957.0, "step": 25290 }, { "entropy": 5.404270601272583, "epoch": 2.5004942665085013, "grad_norm": 1.078125, "learning_rate": 0.0004377660482556995, "loss": 5.0239, "mean_token_accuracy": 0.21161014437675477, "num_tokens": 57932924.0, "step": 25295 }, { "entropy": 5.4153509616851805, "epoch": 2.5009885330170025, "grad_norm": 1.140625, "learning_rate": 0.00043774168119275553, "loss": 5.0758, "mean_token_accuracy": 0.2098454013466835, "num_tokens": 57945275.0, "step": 25300 }, { "entropy": 5.446534633636475, "epoch": 2.5014827995255042, "grad_norm": 1.296875, "learning_rate": 0.00043771731012634085, "loss": 5.0935, "mean_token_accuracy": 0.21138486713171006, "num_tokens": 57957933.0, "step": 25305 }, { "entropy": 5.468757963180542, "epoch": 2.5019770660340055, "grad_norm": 1.0546875, "learning_rate": 0.0004376929350570551, "loss": 5.0753, "mean_token_accuracy": 0.20457536429166795, "num_tokens": 57970401.0, "step": 25310 }, { "entropy": 5.535120010375977, "epoch": 2.5024713325425068, "grad_norm": 1.1328125, "learning_rate": 0.000437668555985498, "loss": 5.0973, "mean_token_accuracy": 0.20259498655796052, "num_tokens": 57981433.0, "step": 25315 }, { "entropy": 5.488575649261475, "epoch": 2.5029655990510085, "grad_norm": 1.1328125, "learning_rate": 0.0004376441729122691, "loss": 5.074, "mean_token_accuracy": 0.20786820650100707, "num_tokens": 57992288.0, "step": 25320 }, { "entropy": 5.508282947540283, "epoch": 2.5034598655595097, "grad_norm": 1.1171875, "learning_rate": 0.0004376197858379684, "loss": 5.1707, "mean_token_accuracy": 0.2027887687087059, "num_tokens": 58004156.0, "step": 25325 }, { "entropy": 5.448185443878174, "epoch": 2.503954132068011, "grad_norm": 6.09375, "learning_rate": 0.0004375953947631957, "loss": 5.0545, "mean_token_accuracy": 0.21164609044790267, "num_tokens": 58014949.0, "step": 25330 }, { "entropy": 5.438953495025634, "epoch": 2.5044483985765122, "grad_norm": 1.1328125, "learning_rate": 0.00043757099968855104, "loss": 5.0338, "mean_token_accuracy": 0.2044109120965004, "num_tokens": 58025664.0, "step": 25335 }, { "entropy": 5.480745267868042, "epoch": 2.504942665085014, "grad_norm": 1.0625, "learning_rate": 0.0004375466006146346, "loss": 5.1223, "mean_token_accuracy": 0.20828879177570342, "num_tokens": 58037550.0, "step": 25340 }, { "entropy": 5.4701801300048825, "epoch": 2.505436931593515, "grad_norm": 1.0703125, "learning_rate": 0.0004375221975420465, "loss": 5.0367, "mean_token_accuracy": 0.2033163473010063, "num_tokens": 58048292.0, "step": 25345 }, { "entropy": 5.442317199707031, "epoch": 2.5059311981020165, "grad_norm": 1.0390625, "learning_rate": 0.0004374977904713872, "loss": 5.0713, "mean_token_accuracy": 0.2078281044960022, "num_tokens": 58060471.0, "step": 25350 }, { "entropy": 5.486228609085083, "epoch": 2.506425464610518, "grad_norm": 1.1171875, "learning_rate": 0.000437473379403257, "loss": 5.0606, "mean_token_accuracy": 0.2062642306089401, "num_tokens": 58072205.0, "step": 25355 }, { "entropy": 5.484630346298218, "epoch": 2.5069197311190194, "grad_norm": 1.0390625, "learning_rate": 0.00043744896433825655, "loss": 5.0677, "mean_token_accuracy": 0.20787267684936522, "num_tokens": 58083789.0, "step": 25360 }, { "entropy": 5.45786485671997, "epoch": 2.5074139976275207, "grad_norm": 1.1484375, "learning_rate": 0.0004374245452769863, "loss": 5.2117, "mean_token_accuracy": 0.20523021817207338, "num_tokens": 58096064.0, "step": 25365 }, { "entropy": 5.533016157150269, "epoch": 2.507908264136022, "grad_norm": 1.109375, "learning_rate": 0.00043740012222004697, "loss": 5.1528, "mean_token_accuracy": 0.20319538712501525, "num_tokens": 58106935.0, "step": 25370 }, { "entropy": 5.444779109954834, "epoch": 2.5084025306445237, "grad_norm": 1.046875, "learning_rate": 0.00043737569516803955, "loss": 5.0765, "mean_token_accuracy": 0.20627350956201554, "num_tokens": 58119204.0, "step": 25375 }, { "entropy": 5.446405506134033, "epoch": 2.508896797153025, "grad_norm": 1.0625, "learning_rate": 0.00043735126412156484, "loss": 5.0601, "mean_token_accuracy": 0.20352013707160949, "num_tokens": 58132006.0, "step": 25380 }, { "entropy": 5.534933280944824, "epoch": 2.509391063661526, "grad_norm": 1.09375, "learning_rate": 0.0004373268290812238, "loss": 5.169, "mean_token_accuracy": 0.19522662162780763, "num_tokens": 58143845.0, "step": 25385 }, { "entropy": 5.407278394699096, "epoch": 2.509885330170028, "grad_norm": 1.0390625, "learning_rate": 0.00043730239004761756, "loss": 4.9695, "mean_token_accuracy": 0.216986683011055, "num_tokens": 58154838.0, "step": 25390 }, { "entropy": 5.549399900436401, "epoch": 2.510379596678529, "grad_norm": 1.0859375, "learning_rate": 0.00043727794702134743, "loss": 5.1686, "mean_token_accuracy": 0.20060989409685134, "num_tokens": 58165446.0, "step": 25395 }, { "entropy": 5.3782330513000485, "epoch": 2.5108738631870304, "grad_norm": 1.1640625, "learning_rate": 0.00043725350000301455, "loss": 4.9852, "mean_token_accuracy": 0.2172129347920418, "num_tokens": 58177815.0, "step": 25400 }, { "entropy": 5.463104295730591, "epoch": 2.5113681296955317, "grad_norm": 1.0390625, "learning_rate": 0.0004372290489932204, "loss": 5.0953, "mean_token_accuracy": 0.20444085896015168, "num_tokens": 58190296.0, "step": 25405 }, { "entropy": 5.480475330352784, "epoch": 2.511862396204033, "grad_norm": 1.1796875, "learning_rate": 0.0004372045939925665, "loss": 5.0466, "mean_token_accuracy": 0.2100695088505745, "num_tokens": 58200293.0, "step": 25410 }, { "entropy": 5.416175651550293, "epoch": 2.5123566627125347, "grad_norm": 1.0546875, "learning_rate": 0.0004371801350016545, "loss": 5.1276, "mean_token_accuracy": 0.199514901638031, "num_tokens": 58212263.0, "step": 25415 }, { "entropy": 5.579802703857422, "epoch": 2.512850929221036, "grad_norm": 1.1328125, "learning_rate": 0.00043715567202108597, "loss": 5.146, "mean_token_accuracy": 0.20056370198726653, "num_tokens": 58222961.0, "step": 25420 }, { "entropy": 5.57877287864685, "epoch": 2.5133451957295376, "grad_norm": 1.03125, "learning_rate": 0.0004371312050514626, "loss": 5.1003, "mean_token_accuracy": 0.20480694770812988, "num_tokens": 58233514.0, "step": 25425 }, { "entropy": 5.460144901275635, "epoch": 2.513839462238039, "grad_norm": 1.2265625, "learning_rate": 0.00043710673409338665, "loss": 5.0228, "mean_token_accuracy": 0.21181508302688598, "num_tokens": 58243637.0, "step": 25430 }, { "entropy": 5.412405490875244, "epoch": 2.51433372874654, "grad_norm": 1.078125, "learning_rate": 0.0004370822591474598, "loss": 5.0505, "mean_token_accuracy": 0.2127783253788948, "num_tokens": 58256603.0, "step": 25435 }, { "entropy": 5.396742534637451, "epoch": 2.5148279952550414, "grad_norm": 1.0390625, "learning_rate": 0.0004370577802142842, "loss": 5.0146, "mean_token_accuracy": 0.20932749956846236, "num_tokens": 58268112.0, "step": 25440 }, { "entropy": 5.523680925369263, "epoch": 2.5153222617635427, "grad_norm": 1.21875, "learning_rate": 0.00043703329729446213, "loss": 5.1644, "mean_token_accuracy": 0.20320967584848404, "num_tokens": 58281026.0, "step": 25445 }, { "entropy": 5.478973627090454, "epoch": 2.5158165282720444, "grad_norm": 1.1875, "learning_rate": 0.0004370088103885958, "loss": 5.1327, "mean_token_accuracy": 0.20354149341583253, "num_tokens": 58292749.0, "step": 25450 }, { "entropy": 5.5251110076904295, "epoch": 2.5163107947805456, "grad_norm": 1.046875, "learning_rate": 0.0004369843194972876, "loss": 5.1493, "mean_token_accuracy": 0.19624797701835633, "num_tokens": 58304019.0, "step": 25455 }, { "entropy": 5.519231748580933, "epoch": 2.516805061289047, "grad_norm": 1.1875, "learning_rate": 0.00043695982462114, "loss": 5.1413, "mean_token_accuracy": 0.20545008331537246, "num_tokens": 58315998.0, "step": 25460 }, { "entropy": 5.507953643798828, "epoch": 2.5172993277975486, "grad_norm": 1.1953125, "learning_rate": 0.00043693532576075556, "loss": 5.1076, "mean_token_accuracy": 0.19968424141407012, "num_tokens": 58327839.0, "step": 25465 }, { "entropy": 5.460997438430786, "epoch": 2.51779359430605, "grad_norm": 0.98828125, "learning_rate": 0.000436910822916737, "loss": 5.0473, "mean_token_accuracy": 0.20713820308446884, "num_tokens": 58339847.0, "step": 25470 }, { "entropy": 5.4520563125610355, "epoch": 2.518287860814551, "grad_norm": 1.0546875, "learning_rate": 0.000436886316089687, "loss": 5.0223, "mean_token_accuracy": 0.21081761121749878, "num_tokens": 58351727.0, "step": 25475 }, { "entropy": 5.397040796279907, "epoch": 2.5187821273230524, "grad_norm": 1.15625, "learning_rate": 0.00043686180528020865, "loss": 5.0752, "mean_token_accuracy": 0.2062039703130722, "num_tokens": 58362519.0, "step": 25480 }, { "entropy": 5.507416820526123, "epoch": 2.519276393831554, "grad_norm": 1.1875, "learning_rate": 0.0004368372904889047, "loss": 5.1373, "mean_token_accuracy": 0.20928605943918227, "num_tokens": 58373747.0, "step": 25485 }, { "entropy": 5.454503345489502, "epoch": 2.5197706603400554, "grad_norm": 1.203125, "learning_rate": 0.0004368127717163783, "loss": 5.0417, "mean_token_accuracy": 0.20597781985998154, "num_tokens": 58385196.0, "step": 25490 }, { "entropy": 5.4363383769989015, "epoch": 2.5202649268485566, "grad_norm": 1.21875, "learning_rate": 0.0004367882489632327, "loss": 5.1329, "mean_token_accuracy": 0.20246631950139998, "num_tokens": 58397005.0, "step": 25495 }, { "entropy": 5.362036323547363, "epoch": 2.5207591933570583, "grad_norm": 1.03125, "learning_rate": 0.00043676372223007095, "loss": 5.0151, "mean_token_accuracy": 0.21005190461874007, "num_tokens": 58407685.0, "step": 25500 }, { "entropy": 5.418642473220825, "epoch": 2.5212534598655596, "grad_norm": 1.15625, "learning_rate": 0.0004367391915174966, "loss": 5.0683, "mean_token_accuracy": 0.20876320004463195, "num_tokens": 58419250.0, "step": 25505 }, { "entropy": 5.535060787200928, "epoch": 2.521747726374061, "grad_norm": 1.1328125, "learning_rate": 0.0004367146568261131, "loss": 5.0959, "mean_token_accuracy": 0.20361196994781494, "num_tokens": 58431135.0, "step": 25510 }, { "entropy": 5.5453839778900145, "epoch": 2.522241992882562, "grad_norm": 1.046875, "learning_rate": 0.0004366901181565239, "loss": 5.1526, "mean_token_accuracy": 0.19703492969274522, "num_tokens": 58443865.0, "step": 25515 }, { "entropy": 5.531009864807129, "epoch": 2.5227362593910634, "grad_norm": 1.0390625, "learning_rate": 0.00043666557550933266, "loss": 5.1433, "mean_token_accuracy": 0.2097615659236908, "num_tokens": 58456484.0, "step": 25520 }, { "entropy": 5.4832288265228275, "epoch": 2.523230525899565, "grad_norm": 1.15625, "learning_rate": 0.0004366410288851433, "loss": 5.1147, "mean_token_accuracy": 0.20213446915149688, "num_tokens": 58468384.0, "step": 25525 }, { "entropy": 5.442923259735108, "epoch": 2.5237247924080664, "grad_norm": 1.0546875, "learning_rate": 0.00043661647828455944, "loss": 5.0743, "mean_token_accuracy": 0.20265950113534928, "num_tokens": 58479703.0, "step": 25530 }, { "entropy": 5.5766970157623295, "epoch": 2.524219058916568, "grad_norm": 1.125, "learning_rate": 0.0004365919237081852, "loss": 5.2102, "mean_token_accuracy": 0.19806513786315919, "num_tokens": 58491313.0, "step": 25535 }, { "entropy": 5.525884294509888, "epoch": 2.5247133254250693, "grad_norm": 1.0234375, "learning_rate": 0.00043656736515662457, "loss": 5.1232, "mean_token_accuracy": 0.1975715383887291, "num_tokens": 58503323.0, "step": 25540 }, { "entropy": 5.483131456375122, "epoch": 2.5252075919335706, "grad_norm": 1.265625, "learning_rate": 0.0004365428026304816, "loss": 5.0568, "mean_token_accuracy": 0.210589799284935, "num_tokens": 58514935.0, "step": 25545 }, { "entropy": 5.620908164978028, "epoch": 2.525701858442072, "grad_norm": 1.0078125, "learning_rate": 0.0004365182361303607, "loss": 5.2412, "mean_token_accuracy": 0.19156759679317475, "num_tokens": 58525724.0, "step": 25550 }, { "entropy": 5.5009866714477536, "epoch": 2.526196124950573, "grad_norm": 1.1015625, "learning_rate": 0.00043649366565686615, "loss": 5.1263, "mean_token_accuracy": 0.2070714831352234, "num_tokens": 58536868.0, "step": 25555 }, { "entropy": 5.443649673461914, "epoch": 2.526690391459075, "grad_norm": 1.078125, "learning_rate": 0.00043646909121060237, "loss": 5.1073, "mean_token_accuracy": 0.20141696631908418, "num_tokens": 58547285.0, "step": 25560 }, { "entropy": 5.5117950439453125, "epoch": 2.527184657967576, "grad_norm": 1.09375, "learning_rate": 0.0004364445127921738, "loss": 5.1133, "mean_token_accuracy": 0.20147760659456254, "num_tokens": 58559960.0, "step": 25565 }, { "entropy": 5.536963081359863, "epoch": 2.5276789244760773, "grad_norm": 1.0390625, "learning_rate": 0.0004364199304021853, "loss": 5.071, "mean_token_accuracy": 0.2032789409160614, "num_tokens": 58571229.0, "step": 25570 }, { "entropy": 5.477812957763672, "epoch": 2.528173190984579, "grad_norm": 1.1796875, "learning_rate": 0.0004363953440412414, "loss": 5.1563, "mean_token_accuracy": 0.20263191908597947, "num_tokens": 58580988.0, "step": 25575 }, { "entropy": 5.481512832641601, "epoch": 2.5286674574930803, "grad_norm": 1.2109375, "learning_rate": 0.000436370753709947, "loss": 5.1044, "mean_token_accuracy": 0.207915036380291, "num_tokens": 58592547.0, "step": 25580 }, { "entropy": 5.525057554244995, "epoch": 2.5291617240015816, "grad_norm": 1.0390625, "learning_rate": 0.0004363461594089071, "loss": 5.1423, "mean_token_accuracy": 0.20642145872116088, "num_tokens": 58604820.0, "step": 25585 }, { "entropy": 5.452645254135132, "epoch": 2.529655990510083, "grad_norm": 1.09375, "learning_rate": 0.00043632156113872656, "loss": 5.0395, "mean_token_accuracy": 0.21131696850061416, "num_tokens": 58615635.0, "step": 25590 }, { "entropy": 5.507434940338134, "epoch": 2.5301502570185845, "grad_norm": 1.078125, "learning_rate": 0.00043629695890001064, "loss": 5.0877, "mean_token_accuracy": 0.20697855055332184, "num_tokens": 58628799.0, "step": 25595 }, { "entropy": 5.431208372116089, "epoch": 2.530644523527086, "grad_norm": 0.98828125, "learning_rate": 0.0004362723526933645, "loss": 5.0812, "mean_token_accuracy": 0.2099124938249588, "num_tokens": 58641514.0, "step": 25600 }, { "entropy": 5.393680763244629, "epoch": 2.531138790035587, "grad_norm": 1.0625, "learning_rate": 0.0004362477425193934, "loss": 5.0277, "mean_token_accuracy": 0.21237764060497283, "num_tokens": 58651719.0, "step": 25605 }, { "entropy": 5.52293643951416, "epoch": 2.5316330565440888, "grad_norm": 1.0625, "learning_rate": 0.0004362231283787029, "loss": 5.0727, "mean_token_accuracy": 0.2066674590110779, "num_tokens": 58663032.0, "step": 25610 }, { "entropy": 5.39792103767395, "epoch": 2.53212732305259, "grad_norm": 1.0390625, "learning_rate": 0.0004361985102718984, "loss": 5.007, "mean_token_accuracy": 0.21407516300678253, "num_tokens": 58674188.0, "step": 25615 }, { "entropy": 5.392745447158814, "epoch": 2.5326215895610913, "grad_norm": 1.0390625, "learning_rate": 0.00043617388819958554, "loss": 4.97, "mean_token_accuracy": 0.2179355338215828, "num_tokens": 58684892.0, "step": 25620 }, { "entropy": 5.408490800857544, "epoch": 2.5331158560695926, "grad_norm": 1.0390625, "learning_rate": 0.00043614926216237, "loss": 5.0126, "mean_token_accuracy": 0.21216772347688675, "num_tokens": 58695520.0, "step": 25625 }, { "entropy": 5.450341463088989, "epoch": 2.5336101225780943, "grad_norm": 1.2421875, "learning_rate": 0.0004361246321608577, "loss": 5.0068, "mean_token_accuracy": 0.21002770513296126, "num_tokens": 58706579.0, "step": 25630 }, { "entropy": 5.502708530426025, "epoch": 2.5341043890865955, "grad_norm": 1.109375, "learning_rate": 0.0004360999981956544, "loss": 5.1039, "mean_token_accuracy": 0.20209251791238786, "num_tokens": 58717292.0, "step": 25635 }, { "entropy": 5.473971319198609, "epoch": 2.534598655595097, "grad_norm": 1.0703125, "learning_rate": 0.00043607536026736603, "loss": 5.131, "mean_token_accuracy": 0.19884008467197417, "num_tokens": 58728761.0, "step": 25640 }, { "entropy": 5.470366907119751, "epoch": 2.5350929221035985, "grad_norm": 1.1328125, "learning_rate": 0.000436050718376599, "loss": 4.9813, "mean_token_accuracy": 0.2147522062063217, "num_tokens": 58739494.0, "step": 25645 }, { "entropy": 5.528844547271729, "epoch": 2.5355871886120998, "grad_norm": 1.0625, "learning_rate": 0.0004360260725239592, "loss": 5.1839, "mean_token_accuracy": 0.20093917101621628, "num_tokens": 58750119.0, "step": 25650 }, { "entropy": 5.47432050704956, "epoch": 2.536081455120601, "grad_norm": 1.0390625, "learning_rate": 0.00043600142271005304, "loss": 5.0427, "mean_token_accuracy": 0.2014262318611145, "num_tokens": 58760438.0, "step": 25655 }, { "entropy": 5.518746757507325, "epoch": 2.5365757216291023, "grad_norm": 1.078125, "learning_rate": 0.000435976768935487, "loss": 5.1483, "mean_token_accuracy": 0.1982058048248291, "num_tokens": 58771484.0, "step": 25660 }, { "entropy": 5.504497051239014, "epoch": 2.5370699881376035, "grad_norm": 1.09375, "learning_rate": 0.0004359521112008674, "loss": 5.0963, "mean_token_accuracy": 0.20272475928068162, "num_tokens": 58782716.0, "step": 25665 }, { "entropy": 5.517631769180298, "epoch": 2.5375642546461052, "grad_norm": 1.078125, "learning_rate": 0.0004359274495068009, "loss": 5.1422, "mean_token_accuracy": 0.20292294919490814, "num_tokens": 58793557.0, "step": 25670 }, { "entropy": 5.445505905151367, "epoch": 2.5380585211546065, "grad_norm": 1.0078125, "learning_rate": 0.0004359027838538941, "loss": 5.0566, "mean_token_accuracy": 0.2045275539159775, "num_tokens": 58804225.0, "step": 25675 }, { "entropy": 5.440919351577759, "epoch": 2.538552787663108, "grad_norm": 1.1796875, "learning_rate": 0.000435878114242754, "loss": 5.0209, "mean_token_accuracy": 0.21195252537727355, "num_tokens": 58814368.0, "step": 25680 }, { "entropy": 5.464352607727051, "epoch": 2.5390470541716095, "grad_norm": 1.125, "learning_rate": 0.00043585344067398725, "loss": 5.0326, "mean_token_accuracy": 0.21023503839969634, "num_tokens": 58825925.0, "step": 25685 }, { "entropy": 5.52657790184021, "epoch": 2.5395413206801107, "grad_norm": 1.171875, "learning_rate": 0.0004358287631482009, "loss": 5.134, "mean_token_accuracy": 0.19989823997020723, "num_tokens": 58837334.0, "step": 25690 }, { "entropy": 5.507832813262939, "epoch": 2.540035587188612, "grad_norm": 1.1015625, "learning_rate": 0.00043580408166600206, "loss": 5.0708, "mean_token_accuracy": 0.20861420929431915, "num_tokens": 58848045.0, "step": 25695 }, { "entropy": 5.462322854995728, "epoch": 2.5405298536971133, "grad_norm": 0.98046875, "learning_rate": 0.00043577939622799786, "loss": 5.0475, "mean_token_accuracy": 0.21379576176404952, "num_tokens": 58858186.0, "step": 25700 }, { "entropy": 5.409792137145996, "epoch": 2.541024120205615, "grad_norm": 1.0390625, "learning_rate": 0.0004357547068347955, "loss": 5.011, "mean_token_accuracy": 0.21509841233491897, "num_tokens": 58870102.0, "step": 25705 }, { "entropy": 5.525062131881714, "epoch": 2.5415183867141162, "grad_norm": 1.03125, "learning_rate": 0.0004357300134870025, "loss": 5.0979, "mean_token_accuracy": 0.1990061953663826, "num_tokens": 58881246.0, "step": 25710 }, { "entropy": 5.527791547775268, "epoch": 2.5420126532226175, "grad_norm": 1.09375, "learning_rate": 0.0004357053161852262, "loss": 5.1938, "mean_token_accuracy": 0.1975237935781479, "num_tokens": 58893722.0, "step": 25715 }, { "entropy": 5.439000606536865, "epoch": 2.542506919731119, "grad_norm": 1.0390625, "learning_rate": 0.0004356806149300742, "loss": 4.9523, "mean_token_accuracy": 0.2172499492764473, "num_tokens": 58904703.0, "step": 25720 }, { "entropy": 5.37617244720459, "epoch": 2.5430011862396205, "grad_norm": 1.046875, "learning_rate": 0.0004356559097221541, "loss": 4.9975, "mean_token_accuracy": 0.21296435445547104, "num_tokens": 58916626.0, "step": 25725 }, { "entropy": 5.451753091812134, "epoch": 2.5434954527481217, "grad_norm": 1.046875, "learning_rate": 0.00043563120056207375, "loss": 5.125, "mean_token_accuracy": 0.2034957453608513, "num_tokens": 58927943.0, "step": 25730 }, { "entropy": 5.577938032150269, "epoch": 2.543989719256623, "grad_norm": 1.03125, "learning_rate": 0.0004356064874504409, "loss": 5.1738, "mean_token_accuracy": 0.20399570614099502, "num_tokens": 58940086.0, "step": 25735 }, { "entropy": 5.550048303604126, "epoch": 2.5444839857651247, "grad_norm": 1.078125, "learning_rate": 0.0004355817703878637, "loss": 5.0875, "mean_token_accuracy": 0.20873271822929382, "num_tokens": 58952280.0, "step": 25740 }, { "entropy": 5.520841217041015, "epoch": 2.544978252273626, "grad_norm": 1.0078125, "learning_rate": 0.0004355570493749498, "loss": 5.108, "mean_token_accuracy": 0.20368714034557342, "num_tokens": 58963726.0, "step": 25745 }, { "entropy": 5.477183151245117, "epoch": 2.545472518782127, "grad_norm": 1.0390625, "learning_rate": 0.0004355323244123077, "loss": 5.105, "mean_token_accuracy": 0.20496445000171662, "num_tokens": 58974941.0, "step": 25750 }, { "entropy": 5.446059703826904, "epoch": 2.545966785290629, "grad_norm": 1.1171875, "learning_rate": 0.00043550759550054554, "loss": 5.0849, "mean_token_accuracy": 0.20758278220891951, "num_tokens": 58985234.0, "step": 25755 }, { "entropy": 5.441429471969604, "epoch": 2.54646105179913, "grad_norm": 1.09375, "learning_rate": 0.00043548286264027155, "loss": 5.0062, "mean_token_accuracy": 0.2124189779162407, "num_tokens": 58996781.0, "step": 25760 }, { "entropy": 5.4362006187438965, "epoch": 2.5469553183076314, "grad_norm": 1.0390625, "learning_rate": 0.00043545812583209426, "loss": 5.0581, "mean_token_accuracy": 0.20466673225164414, "num_tokens": 59008044.0, "step": 25765 }, { "entropy": 5.455527400970459, "epoch": 2.5474495848161327, "grad_norm": 1.03125, "learning_rate": 0.00043543338507662227, "loss": 5.1323, "mean_token_accuracy": 0.20451315343379975, "num_tokens": 59021579.0, "step": 25770 }, { "entropy": 5.528790092468261, "epoch": 2.547943851324634, "grad_norm": 1.125, "learning_rate": 0.0004354086403744641, "loss": 5.1221, "mean_token_accuracy": 0.20080033540725709, "num_tokens": 59033541.0, "step": 25775 }, { "entropy": 5.470633602142334, "epoch": 2.5484381178331357, "grad_norm": 1.078125, "learning_rate": 0.0004353838917262284, "loss": 5.0637, "mean_token_accuracy": 0.20321372300386428, "num_tokens": 59044067.0, "step": 25780 }, { "entropy": 5.359145307540894, "epoch": 2.548932384341637, "grad_norm": 1.0546875, "learning_rate": 0.0004353591391325241, "loss": 4.9939, "mean_token_accuracy": 0.21232887208461762, "num_tokens": 59056758.0, "step": 25785 }, { "entropy": 5.3897607803344725, "epoch": 2.5494266508501386, "grad_norm": 1.1171875, "learning_rate": 0.00043533438259396015, "loss": 4.9958, "mean_token_accuracy": 0.21601679027080536, "num_tokens": 59067681.0, "step": 25790 }, { "entropy": 5.483454275131225, "epoch": 2.54992091735864, "grad_norm": 1.0859375, "learning_rate": 0.00043530962211114547, "loss": 5.0963, "mean_token_accuracy": 0.21015080362558364, "num_tokens": 59079148.0, "step": 25795 }, { "entropy": 5.516743135452271, "epoch": 2.550415183867141, "grad_norm": 1.171875, "learning_rate": 0.0004352848576846893, "loss": 5.1451, "mean_token_accuracy": 0.20016193985939026, "num_tokens": 59090597.0, "step": 25800 }, { "entropy": 5.43180570602417, "epoch": 2.5509094503756424, "grad_norm": 1.3515625, "learning_rate": 0.00043526008931520067, "loss": 5.0112, "mean_token_accuracy": 0.21306267976760865, "num_tokens": 59102445.0, "step": 25805 }, { "entropy": 5.475431108474732, "epoch": 2.5514037168841437, "grad_norm": 1.1171875, "learning_rate": 0.000435235317003289, "loss": 5.1398, "mean_token_accuracy": 0.1937178537249565, "num_tokens": 59113470.0, "step": 25810 }, { "entropy": 5.398521852493286, "epoch": 2.5518979833926454, "grad_norm": 1.046875, "learning_rate": 0.00043521054074956367, "loss": 4.9623, "mean_token_accuracy": 0.2216824099421501, "num_tokens": 59124370.0, "step": 25815 }, { "entropy": 5.497758388519287, "epoch": 2.5523922499011467, "grad_norm": 1.09375, "learning_rate": 0.00043518576055463423, "loss": 5.1437, "mean_token_accuracy": 0.2056589886546135, "num_tokens": 59135783.0, "step": 25820 }, { "entropy": 5.484558820724487, "epoch": 2.552886516409648, "grad_norm": 1.140625, "learning_rate": 0.0004351609764191102, "loss": 5.0883, "mean_token_accuracy": 0.20761982798576356, "num_tokens": 59146729.0, "step": 25825 }, { "entropy": 5.561499691009521, "epoch": 2.5533807829181496, "grad_norm": 1.0859375, "learning_rate": 0.0004351361883436014, "loss": 5.1488, "mean_token_accuracy": 0.20425196141004562, "num_tokens": 59159413.0, "step": 25830 }, { "entropy": 5.431789302825928, "epoch": 2.553875049426651, "grad_norm": 1.0078125, "learning_rate": 0.0004351113963287173, "loss": 5.0332, "mean_token_accuracy": 0.20214271396398545, "num_tokens": 59171013.0, "step": 25835 }, { "entropy": 5.48479323387146, "epoch": 2.554369315935152, "grad_norm": 1.0, "learning_rate": 0.00043508660037506813, "loss": 5.105, "mean_token_accuracy": 0.20411466658115388, "num_tokens": 59182571.0, "step": 25840 }, { "entropy": 5.436587142944336, "epoch": 2.5548635824436534, "grad_norm": 0.9609375, "learning_rate": 0.0004350618004832638, "loss": 5.0124, "mean_token_accuracy": 0.2166304498910904, "num_tokens": 59194310.0, "step": 25845 }, { "entropy": 5.472873210906982, "epoch": 2.555357848952155, "grad_norm": 1.0, "learning_rate": 0.0004350369966539143, "loss": 5.0917, "mean_token_accuracy": 0.2050582692027092, "num_tokens": 59206656.0, "step": 25850 }, { "entropy": 5.512592363357544, "epoch": 2.5558521154606564, "grad_norm": 1.140625, "learning_rate": 0.00043501218888762985, "loss": 5.1855, "mean_token_accuracy": 0.20180006474256515, "num_tokens": 59219180.0, "step": 25855 }, { "entropy": 5.413117742538452, "epoch": 2.5563463819691576, "grad_norm": 1.109375, "learning_rate": 0.0004349873771850208, "loss": 5.0288, "mean_token_accuracy": 0.21067819446325303, "num_tokens": 59230879.0, "step": 25860 }, { "entropy": 5.576191663742065, "epoch": 2.5568406484776594, "grad_norm": 1.0859375, "learning_rate": 0.0004349625615466974, "loss": 5.1423, "mean_token_accuracy": 0.19706527143716812, "num_tokens": 59242283.0, "step": 25865 }, { "entropy": 5.427069187164307, "epoch": 2.5573349149861606, "grad_norm": 1.0234375, "learning_rate": 0.00043493774197327014, "loss": 4.999, "mean_token_accuracy": 0.21658221185207366, "num_tokens": 59253655.0, "step": 25870 }, { "entropy": 5.489561891555786, "epoch": 2.557829181494662, "grad_norm": 1.03125, "learning_rate": 0.00043491291846534965, "loss": 5.0811, "mean_token_accuracy": 0.19935698956251144, "num_tokens": 59266600.0, "step": 25875 }, { "entropy": 5.545461559295655, "epoch": 2.558323448003163, "grad_norm": 1.125, "learning_rate": 0.00043488809102354653, "loss": 5.1603, "mean_token_accuracy": 0.19824885725975036, "num_tokens": 59277422.0, "step": 25880 }, { "entropy": 5.420630836486817, "epoch": 2.558817714511665, "grad_norm": 1.0390625, "learning_rate": 0.00043486325964847163, "loss": 5.0252, "mean_token_accuracy": 0.21108732372522354, "num_tokens": 59289179.0, "step": 25885 }, { "entropy": 5.38097128868103, "epoch": 2.559311981020166, "grad_norm": 0.96484375, "learning_rate": 0.00043483842434073567, "loss": 4.9641, "mean_token_accuracy": 0.22336167544126512, "num_tokens": 59299692.0, "step": 25890 }, { "entropy": 5.481780576705932, "epoch": 2.5598062475286674, "grad_norm": 1.3203125, "learning_rate": 0.0004348135851009497, "loss": 5.0482, "mean_token_accuracy": 0.203604955971241, "num_tokens": 59310797.0, "step": 25895 }, { "entropy": 5.3913411617279055, "epoch": 2.560300514037169, "grad_norm": 1.0625, "learning_rate": 0.0004347887419297247, "loss": 5.0623, "mean_token_accuracy": 0.20897647589445115, "num_tokens": 59323167.0, "step": 25900 }, { "entropy": 5.419101095199585, "epoch": 2.5607947805456703, "grad_norm": 1.0859375, "learning_rate": 0.00043476389482767193, "loss": 5.0867, "mean_token_accuracy": 0.20849373936653137, "num_tokens": 59335956.0, "step": 25905 }, { "entropy": 5.551991510391235, "epoch": 2.5612890470541716, "grad_norm": 1.109375, "learning_rate": 0.0004347390437954026, "loss": 5.1173, "mean_token_accuracy": 0.20107119530439377, "num_tokens": 59348090.0, "step": 25910 }, { "entropy": 5.447291660308838, "epoch": 2.561783313562673, "grad_norm": 1.1328125, "learning_rate": 0.0004347141888335279, "loss": 5.0887, "mean_token_accuracy": 0.2058752343058586, "num_tokens": 59360276.0, "step": 25915 }, { "entropy": 5.499720335006714, "epoch": 2.562277580071174, "grad_norm": 1.1640625, "learning_rate": 0.0004346893299426595, "loss": 5.1277, "mean_token_accuracy": 0.19745977371931075, "num_tokens": 59372049.0, "step": 25920 }, { "entropy": 5.5342559814453125, "epoch": 2.562771846579676, "grad_norm": 1.0703125, "learning_rate": 0.00043466446712340866, "loss": 5.0763, "mean_token_accuracy": 0.2055215984582901, "num_tokens": 59384017.0, "step": 25925 }, { "entropy": 5.546181678771973, "epoch": 2.563266113088177, "grad_norm": 1.171875, "learning_rate": 0.0004346396003763873, "loss": 5.1655, "mean_token_accuracy": 0.19704237431287766, "num_tokens": 59395966.0, "step": 25930 }, { "entropy": 5.436600971221924, "epoch": 2.563760379596679, "grad_norm": 1.078125, "learning_rate": 0.0004346147297022069, "loss": 5.0676, "mean_token_accuracy": 0.20828012526035308, "num_tokens": 59405815.0, "step": 25935 }, { "entropy": 5.47698941230774, "epoch": 2.56425464610518, "grad_norm": 1.0703125, "learning_rate": 0.00043458985510147946, "loss": 5.074, "mean_token_accuracy": 0.20358948707580565, "num_tokens": 59416662.0, "step": 25940 }, { "entropy": 5.521800994873047, "epoch": 2.5647489126136813, "grad_norm": 1.1484375, "learning_rate": 0.0004345649765748168, "loss": 5.1075, "mean_token_accuracy": 0.20760411620140076, "num_tokens": 59427143.0, "step": 25945 }, { "entropy": 5.4276646137237545, "epoch": 2.5652431791221826, "grad_norm": 1.1015625, "learning_rate": 0.00043454009412283097, "loss": 5.0809, "mean_token_accuracy": 0.20239093601703645, "num_tokens": 59439657.0, "step": 25950 }, { "entropy": 5.483403158187866, "epoch": 2.565737445630684, "grad_norm": 1.109375, "learning_rate": 0.00043451520774613405, "loss": 5.0886, "mean_token_accuracy": 0.20373429358005524, "num_tokens": 59452313.0, "step": 25955 }, { "entropy": 5.437200307846069, "epoch": 2.5662317121391856, "grad_norm": 1.0859375, "learning_rate": 0.00043449031744533824, "loss": 5.0041, "mean_token_accuracy": 0.2102823704481125, "num_tokens": 59462412.0, "step": 25960 }, { "entropy": 5.491439437866211, "epoch": 2.566725978647687, "grad_norm": 0.94921875, "learning_rate": 0.00043446542322105595, "loss": 5.0782, "mean_token_accuracy": 0.20713732689619063, "num_tokens": 59474784.0, "step": 25965 }, { "entropy": 5.420276355743408, "epoch": 2.567220245156188, "grad_norm": 1.0390625, "learning_rate": 0.0004344405250738994, "loss": 4.9843, "mean_token_accuracy": 0.21068878173828126, "num_tokens": 59487006.0, "step": 25970 }, { "entropy": 5.44613208770752, "epoch": 2.56771451166469, "grad_norm": 1.0078125, "learning_rate": 0.00043441562300448134, "loss": 5.0726, "mean_token_accuracy": 0.20465949177742004, "num_tokens": 59498625.0, "step": 25975 }, { "entropy": 5.413465929031372, "epoch": 2.568208778173191, "grad_norm": 1.015625, "learning_rate": 0.0004343907170134142, "loss": 4.954, "mean_token_accuracy": 0.21782627254724501, "num_tokens": 59509257.0, "step": 25980 }, { "entropy": 5.471138620376587, "epoch": 2.5687030446816923, "grad_norm": 1.09375, "learning_rate": 0.0004343658071013106, "loss": 5.1869, "mean_token_accuracy": 0.19876190423965454, "num_tokens": 59520876.0, "step": 25985 }, { "entropy": 5.442031145095825, "epoch": 2.5691973111901936, "grad_norm": 1.234375, "learning_rate": 0.00043434089326878356, "loss": 5.0171, "mean_token_accuracy": 0.20690550804138183, "num_tokens": 59532047.0, "step": 25990 }, { "entropy": 5.464065408706665, "epoch": 2.5696915776986953, "grad_norm": 1.0859375, "learning_rate": 0.0004343159755164457, "loss": 5.103, "mean_token_accuracy": 0.20479633957147597, "num_tokens": 59543831.0, "step": 25995 }, { "entropy": 5.433709287643433, "epoch": 2.5701858442071965, "grad_norm": 0.9453125, "learning_rate": 0.0004342910538449102, "loss": 4.9804, "mean_token_accuracy": 0.2126169756054878, "num_tokens": 59555298.0, "step": 26000 }, { "entropy": 5.512145757675171, "epoch": 2.570680110715698, "grad_norm": 1.0859375, "learning_rate": 0.00043426612825479003, "loss": 5.0807, "mean_token_accuracy": 0.20384642630815505, "num_tokens": 59566204.0, "step": 26005 }, { "entropy": 5.4690773487091064, "epoch": 2.5711743772241995, "grad_norm": 1.0703125, "learning_rate": 0.0004342411987466984, "loss": 5.1668, "mean_token_accuracy": 0.19438787847757338, "num_tokens": 59577505.0, "step": 26010 }, { "entropy": 5.505500650405883, "epoch": 2.5716686437327008, "grad_norm": 1.03125, "learning_rate": 0.0004342162653212486, "loss": 5.1348, "mean_token_accuracy": 0.20243036299943923, "num_tokens": 59589430.0, "step": 26015 }, { "entropy": 5.4255115509033205, "epoch": 2.572162910241202, "grad_norm": 1.03125, "learning_rate": 0.0004341913279790539, "loss": 5.0199, "mean_token_accuracy": 0.21482257395982743, "num_tokens": 59600328.0, "step": 26020 }, { "entropy": 5.4620726108551025, "epoch": 2.5726571767497033, "grad_norm": 1.078125, "learning_rate": 0.0004341663867207279, "loss": 5.0698, "mean_token_accuracy": 0.20392953604459763, "num_tokens": 59611643.0, "step": 26025 }, { "entropy": 5.510752820968628, "epoch": 2.5731514432582046, "grad_norm": 1.0703125, "learning_rate": 0.00043414144154688405, "loss": 5.1701, "mean_token_accuracy": 0.208053095638752, "num_tokens": 59622586.0, "step": 26030 }, { "entropy": 5.577480125427246, "epoch": 2.5736457097667063, "grad_norm": 1.1171875, "learning_rate": 0.00043411649245813613, "loss": 5.1597, "mean_token_accuracy": 0.20617804527282715, "num_tokens": 59632719.0, "step": 26035 }, { "entropy": 5.47836856842041, "epoch": 2.5741399762752075, "grad_norm": 1.109375, "learning_rate": 0.0004340915394550977, "loss": 5.024, "mean_token_accuracy": 0.21188221722841263, "num_tokens": 59643788.0, "step": 26040 }, { "entropy": 5.448640537261963, "epoch": 2.5746342427837092, "grad_norm": 1.0859375, "learning_rate": 0.0004340665825383828, "loss": 5.0571, "mean_token_accuracy": 0.21054611951112748, "num_tokens": 59655355.0, "step": 26045 }, { "entropy": 5.530148649215699, "epoch": 2.5751285092922105, "grad_norm": 1.046875, "learning_rate": 0.00043404162170860525, "loss": 5.1857, "mean_token_accuracy": 0.19971430003643037, "num_tokens": 59667099.0, "step": 26050 }, { "entropy": 5.464069175720215, "epoch": 2.5756227758007118, "grad_norm": 1.1640625, "learning_rate": 0.0004340166569663792, "loss": 5.1498, "mean_token_accuracy": 0.19777952879667282, "num_tokens": 59679514.0, "step": 26055 }, { "entropy": 5.6031379222869875, "epoch": 2.576117042309213, "grad_norm": 1.046875, "learning_rate": 0.00043399168831231865, "loss": 5.218, "mean_token_accuracy": 0.19847166091203688, "num_tokens": 59691569.0, "step": 26060 }, { "entropy": 5.5251699924469, "epoch": 2.5766113088177143, "grad_norm": 1.15625, "learning_rate": 0.0004339667157470379, "loss": 5.145, "mean_token_accuracy": 0.2035716250538826, "num_tokens": 59702841.0, "step": 26065 }, { "entropy": 5.4570536613464355, "epoch": 2.577105575326216, "grad_norm": 1.0625, "learning_rate": 0.0004339417392711513, "loss": 5.0584, "mean_token_accuracy": 0.20833969712257386, "num_tokens": 59714834.0, "step": 26070 }, { "entropy": 5.525702953338623, "epoch": 2.5775998418347172, "grad_norm": 1.15625, "learning_rate": 0.0004339167588852733, "loss": 5.122, "mean_token_accuracy": 0.1981703370809555, "num_tokens": 59726863.0, "step": 26075 }, { "entropy": 5.468962955474853, "epoch": 2.5780941083432185, "grad_norm": 1.09375, "learning_rate": 0.0004338917745900183, "loss": 5.1427, "mean_token_accuracy": 0.20276612937450408, "num_tokens": 59738952.0, "step": 26080 }, { "entropy": 5.452627944946289, "epoch": 2.57858837485172, "grad_norm": 0.99609375, "learning_rate": 0.0004338667863860011, "loss": 5.054, "mean_token_accuracy": 0.2119163081049919, "num_tokens": 59750445.0, "step": 26085 }, { "entropy": 5.4511988162994385, "epoch": 2.5790826413602215, "grad_norm": 1.078125, "learning_rate": 0.0004338417942738362, "loss": 5.0739, "mean_token_accuracy": 0.20618994683027267, "num_tokens": 59762447.0, "step": 26090 }, { "entropy": 5.394779300689697, "epoch": 2.5795769078687227, "grad_norm": 1.046875, "learning_rate": 0.0004338167982541386, "loss": 4.9822, "mean_token_accuracy": 0.21389454156160354, "num_tokens": 59773122.0, "step": 26095 }, { "entropy": 5.560962152481079, "epoch": 2.580071174377224, "grad_norm": 1.078125, "learning_rate": 0.00043379179832752306, "loss": 5.1372, "mean_token_accuracy": 0.20742413103580476, "num_tokens": 59784355.0, "step": 26100 }, { "entropy": 5.464340782165527, "epoch": 2.5805654408857257, "grad_norm": 1.015625, "learning_rate": 0.00043376679449460463, "loss": 4.9969, "mean_token_accuracy": 0.2158476710319519, "num_tokens": 59796529.0, "step": 26105 }, { "entropy": 5.466800260543823, "epoch": 2.581059707394227, "grad_norm": 1.203125, "learning_rate": 0.00043374178675599853, "loss": 5.059, "mean_token_accuracy": 0.20189632177352906, "num_tokens": 59807510.0, "step": 26110 }, { "entropy": 5.449657154083252, "epoch": 2.5815539739027282, "grad_norm": 1.0625, "learning_rate": 0.00043371677511231977, "loss": 5.0751, "mean_token_accuracy": 0.20399401634931563, "num_tokens": 59819355.0, "step": 26115 }, { "entropy": 5.434161186218262, "epoch": 2.58204824041123, "grad_norm": 1.125, "learning_rate": 0.0004336917595641838, "loss": 5.0438, "mean_token_accuracy": 0.2003992572426796, "num_tokens": 59830780.0, "step": 26120 }, { "entropy": 5.452296018600464, "epoch": 2.582542506919731, "grad_norm": 1.078125, "learning_rate": 0.0004336667401122058, "loss": 5.1161, "mean_token_accuracy": 0.2084857478737831, "num_tokens": 59842031.0, "step": 26125 }, { "entropy": 5.516363096237183, "epoch": 2.5830367734282325, "grad_norm": 1.0859375, "learning_rate": 0.0004336417167570015, "loss": 5.0795, "mean_token_accuracy": 0.2099551409482956, "num_tokens": 59852788.0, "step": 26130 }, { "entropy": 5.4264037132263185, "epoch": 2.5835310399367337, "grad_norm": 0.98828125, "learning_rate": 0.00043361668949918627, "loss": 5.0877, "mean_token_accuracy": 0.2121927633881569, "num_tokens": 59865618.0, "step": 26135 }, { "entropy": 5.457371187210083, "epoch": 2.5840253064452354, "grad_norm": 1.078125, "learning_rate": 0.0004335916583393759, "loss": 5.0609, "mean_token_accuracy": 0.20406586974859237, "num_tokens": 59877053.0, "step": 26140 }, { "entropy": 5.4266472339630125, "epoch": 2.5845195729537367, "grad_norm": 1.0625, "learning_rate": 0.0004335666232781861, "loss": 4.9977, "mean_token_accuracy": 0.21431368440389634, "num_tokens": 59888730.0, "step": 26145 }, { "entropy": 5.458841991424561, "epoch": 2.585013839462238, "grad_norm": 1.09375, "learning_rate": 0.0004335415843162328, "loss": 5.1012, "mean_token_accuracy": 0.20518300384283067, "num_tokens": 59900255.0, "step": 26150 }, { "entropy": 5.472054195404053, "epoch": 2.5855081059707397, "grad_norm": 1.1640625, "learning_rate": 0.00043351654145413197, "loss": 5.1191, "mean_token_accuracy": 0.20492274910211564, "num_tokens": 59910705.0, "step": 26155 }, { "entropy": 5.378151369094849, "epoch": 2.586002372479241, "grad_norm": 1.015625, "learning_rate": 0.0004334914946924996, "loss": 4.966, "mean_token_accuracy": 0.2115619659423828, "num_tokens": 59923199.0, "step": 26160 }, { "entropy": 5.515431547164917, "epoch": 2.586496638987742, "grad_norm": 1.03125, "learning_rate": 0.00043346644403195186, "loss": 5.0516, "mean_token_accuracy": 0.20314325243234635, "num_tokens": 59934098.0, "step": 26165 }, { "entropy": 5.508603906631469, "epoch": 2.5869909054962434, "grad_norm": 0.984375, "learning_rate": 0.000433441389473105, "loss": 5.0894, "mean_token_accuracy": 0.2059381127357483, "num_tokens": 59945566.0, "step": 26170 }, { "entropy": 5.507591390609742, "epoch": 2.5874851720047447, "grad_norm": 1.015625, "learning_rate": 0.0004334163310165754, "loss": 5.1511, "mean_token_accuracy": 0.2025526985526085, "num_tokens": 59956354.0, "step": 26175 }, { "entropy": 5.444117021560669, "epoch": 2.5879794385132464, "grad_norm": 1.0703125, "learning_rate": 0.00043339126866297943, "loss": 5.0909, "mean_token_accuracy": 0.2051892399787903, "num_tokens": 59967413.0, "step": 26180 }, { "entropy": 5.513080072402954, "epoch": 2.5884737050217477, "grad_norm": 1.1015625, "learning_rate": 0.0004333662024129337, "loss": 5.0713, "mean_token_accuracy": 0.20803989619016647, "num_tokens": 59977936.0, "step": 26185 }, { "entropy": 5.50823860168457, "epoch": 2.5889679715302494, "grad_norm": 1.1484375, "learning_rate": 0.0004333411322670549, "loss": 5.0927, "mean_token_accuracy": 0.205030357837677, "num_tokens": 59989566.0, "step": 26190 }, { "entropy": 5.451539993286133, "epoch": 2.5894622380387506, "grad_norm": 0.98046875, "learning_rate": 0.00043331605822595964, "loss": 5.0615, "mean_token_accuracy": 0.2113240748643875, "num_tokens": 60000339.0, "step": 26195 }, { "entropy": 5.455885124206543, "epoch": 2.589956504547252, "grad_norm": 1.1328125, "learning_rate": 0.00043329098029026484, "loss": 5.0294, "mean_token_accuracy": 0.2087863564491272, "num_tokens": 60012903.0, "step": 26200 }, { "entropy": 5.471307945251465, "epoch": 2.590450771055753, "grad_norm": 1.0625, "learning_rate": 0.00043326589846058724, "loss": 5.1217, "mean_token_accuracy": 0.2106748953461647, "num_tokens": 60024135.0, "step": 26205 }, { "entropy": 5.433697700500488, "epoch": 2.5909450375642544, "grad_norm": 1.0078125, "learning_rate": 0.00043324081273754403, "loss": 5.0857, "mean_token_accuracy": 0.20609477162361145, "num_tokens": 60036314.0, "step": 26210 }, { "entropy": 5.531763982772827, "epoch": 2.591439304072756, "grad_norm": 1.1328125, "learning_rate": 0.00043321572312175234, "loss": 5.0631, "mean_token_accuracy": 0.20795445293188095, "num_tokens": 60047337.0, "step": 26215 }, { "entropy": 5.528925609588623, "epoch": 2.5919335705812574, "grad_norm": 1.1171875, "learning_rate": 0.00043319062961382924, "loss": 5.1085, "mean_token_accuracy": 0.2030316486954689, "num_tokens": 60057875.0, "step": 26220 }, { "entropy": 5.4021995067596436, "epoch": 2.5924278370897587, "grad_norm": 0.99609375, "learning_rate": 0.00043316553221439214, "loss": 5.0849, "mean_token_accuracy": 0.20612587332725524, "num_tokens": 60069577.0, "step": 26225 }, { "entropy": 5.524349498748779, "epoch": 2.5929221035982604, "grad_norm": 1.0390625, "learning_rate": 0.00043314043092405836, "loss": 5.145, "mean_token_accuracy": 0.19848928600549698, "num_tokens": 60081744.0, "step": 26230 }, { "entropy": 5.538342905044556, "epoch": 2.5934163701067616, "grad_norm": 1.015625, "learning_rate": 0.0004331153257434455, "loss": 5.1336, "mean_token_accuracy": 0.20093371868133544, "num_tokens": 60092837.0, "step": 26235 }, { "entropy": 5.4161949634552, "epoch": 2.593910636615263, "grad_norm": 1.046875, "learning_rate": 0.0004330902166731711, "loss": 5.0822, "mean_token_accuracy": 0.20455933064222337, "num_tokens": 60104512.0, "step": 26240 }, { "entropy": 5.413430261611938, "epoch": 2.594404903123764, "grad_norm": 1.0546875, "learning_rate": 0.0004330651037138529, "loss": 5.0509, "mean_token_accuracy": 0.2118354469537735, "num_tokens": 60115652.0, "step": 26245 }, { "entropy": 5.494190359115601, "epoch": 2.594899169632266, "grad_norm": 1.15625, "learning_rate": 0.0004330399868661085, "loss": 5.0933, "mean_token_accuracy": 0.20735854506492615, "num_tokens": 60127834.0, "step": 26250 }, { "entropy": 5.498034858703614, "epoch": 2.595393436140767, "grad_norm": 1.0390625, "learning_rate": 0.000433014866130556, "loss": 5.1078, "mean_token_accuracy": 0.20279533565044403, "num_tokens": 60140200.0, "step": 26255 }, { "entropy": 5.507016563415528, "epoch": 2.5958877026492684, "grad_norm": 1.03125, "learning_rate": 0.00043298974150781326, "loss": 5.1522, "mean_token_accuracy": 0.208327217400074, "num_tokens": 60150506.0, "step": 26260 }, { "entropy": 5.520722246170044, "epoch": 2.59638196915777, "grad_norm": 1.078125, "learning_rate": 0.00043296461299849835, "loss": 5.2044, "mean_token_accuracy": 0.19973582327365874, "num_tokens": 60162107.0, "step": 26265 }, { "entropy": 5.550403022766114, "epoch": 2.5968762356662713, "grad_norm": 1.2109375, "learning_rate": 0.00043293948060322944, "loss": 5.1625, "mean_token_accuracy": 0.20080641359090806, "num_tokens": 60174435.0, "step": 26270 }, { "entropy": 5.498379039764404, "epoch": 2.5973705021747726, "grad_norm": 1.1953125, "learning_rate": 0.0004329143443226249, "loss": 5.2042, "mean_token_accuracy": 0.19971993565559387, "num_tokens": 60186319.0, "step": 26275 }, { "entropy": 5.512925815582276, "epoch": 2.597864768683274, "grad_norm": 1.0390625, "learning_rate": 0.0004328892041573029, "loss": 5.1285, "mean_token_accuracy": 0.20593624114990233, "num_tokens": 60197981.0, "step": 26280 }, { "entropy": 5.477794742584228, "epoch": 2.598359035191775, "grad_norm": 1.0, "learning_rate": 0.000432864060107882, "loss": 4.9758, "mean_token_accuracy": 0.21213001608848572, "num_tokens": 60209086.0, "step": 26285 }, { "entropy": 5.420455884933472, "epoch": 2.598853301700277, "grad_norm": 1.1328125, "learning_rate": 0.00043283891217498074, "loss": 5.053, "mean_token_accuracy": 0.21611824184656142, "num_tokens": 60221040.0, "step": 26290 }, { "entropy": 5.376713609695434, "epoch": 2.599347568208778, "grad_norm": 1.109375, "learning_rate": 0.0004328137603592177, "loss": 4.9808, "mean_token_accuracy": 0.2165214866399765, "num_tokens": 60232709.0, "step": 26295 }, { "entropy": 5.487830781936646, "epoch": 2.59984183471728, "grad_norm": 1.03125, "learning_rate": 0.0004327886046612117, "loss": 5.0771, "mean_token_accuracy": 0.20377163589000702, "num_tokens": 60244539.0, "step": 26300 }, { "entropy": 5.501164484024048, "epoch": 2.600336101225781, "grad_norm": 1.140625, "learning_rate": 0.0004327634450815817, "loss": 5.0579, "mean_token_accuracy": 0.2056467801332474, "num_tokens": 60255124.0, "step": 26305 }, { "entropy": 5.545708274841308, "epoch": 2.6008303677342823, "grad_norm": 1.046875, "learning_rate": 0.00043273828162094624, "loss": 5.2157, "mean_token_accuracy": 0.19296193718910218, "num_tokens": 60267819.0, "step": 26310 }, { "entropy": 5.514840126037598, "epoch": 2.6013246342427836, "grad_norm": 1.1328125, "learning_rate": 0.0004327131142799247, "loss": 5.1171, "mean_token_accuracy": 0.20716441720724105, "num_tokens": 60279694.0, "step": 26315 }, { "entropy": 5.508053398132324, "epoch": 2.601818900751285, "grad_norm": 1.0703125, "learning_rate": 0.0004326879430591361, "loss": 5.1317, "mean_token_accuracy": 0.19925848692655562, "num_tokens": 60291215.0, "step": 26320 }, { "entropy": 5.474817609786987, "epoch": 2.6023131672597866, "grad_norm": 1.0546875, "learning_rate": 0.00043266276795919954, "loss": 5.0348, "mean_token_accuracy": 0.20297530591487883, "num_tokens": 60303639.0, "step": 26325 }, { "entropy": 5.462808895111084, "epoch": 2.602807433768288, "grad_norm": 1.0390625, "learning_rate": 0.0004326375889807345, "loss": 5.0705, "mean_token_accuracy": 0.20270152091979982, "num_tokens": 60315290.0, "step": 26330 }, { "entropy": 5.4940886974334715, "epoch": 2.603301700276789, "grad_norm": 1.171875, "learning_rate": 0.0004326124061243603, "loss": 5.0741, "mean_token_accuracy": 0.21007844507694245, "num_tokens": 60325391.0, "step": 26335 }, { "entropy": 5.43610258102417, "epoch": 2.603795966785291, "grad_norm": 1.1953125, "learning_rate": 0.0004325872193906965, "loss": 4.9974, "mean_token_accuracy": 0.2205174446105957, "num_tokens": 60335758.0, "step": 26340 }, { "entropy": 5.497511386871338, "epoch": 2.604290233293792, "grad_norm": 1.0859375, "learning_rate": 0.00043256202878036264, "loss": 5.0612, "mean_token_accuracy": 0.20659103840589524, "num_tokens": 60347365.0, "step": 26345 }, { "entropy": 5.38678731918335, "epoch": 2.6047844998022933, "grad_norm": 1.0234375, "learning_rate": 0.00043253683429397843, "loss": 4.9503, "mean_token_accuracy": 0.21219963431358338, "num_tokens": 60359222.0, "step": 26350 }, { "entropy": 5.499383592605591, "epoch": 2.6052787663107946, "grad_norm": 1.0546875, "learning_rate": 0.00043251163593216365, "loss": 5.1614, "mean_token_accuracy": 0.1955256789922714, "num_tokens": 60370730.0, "step": 26355 }, { "entropy": 5.40680947303772, "epoch": 2.6057730328192963, "grad_norm": 1.0, "learning_rate": 0.00043248643369553813, "loss": 5.0133, "mean_token_accuracy": 0.2191762626171112, "num_tokens": 60381955.0, "step": 26360 }, { "entropy": 5.513626623153686, "epoch": 2.6062672993277975, "grad_norm": 1.078125, "learning_rate": 0.000432461227584722, "loss": 5.1445, "mean_token_accuracy": 0.19840544164180757, "num_tokens": 60395331.0, "step": 26365 }, { "entropy": 5.442679119110108, "epoch": 2.606761565836299, "grad_norm": 1.046875, "learning_rate": 0.0004324360176003352, "loss": 5.0153, "mean_token_accuracy": 0.2100110948085785, "num_tokens": 60407179.0, "step": 26370 }, { "entropy": 5.393788528442383, "epoch": 2.6072558323448005, "grad_norm": 1.171875, "learning_rate": 0.0004324108037429979, "loss": 5.0632, "mean_token_accuracy": 0.2075355812907219, "num_tokens": 60418377.0, "step": 26375 }, { "entropy": 5.4761566638946535, "epoch": 2.607750098853302, "grad_norm": 1.34375, "learning_rate": 0.0004323855860133305, "loss": 5.0548, "mean_token_accuracy": 0.20840090811252593, "num_tokens": 60428802.0, "step": 26380 }, { "entropy": 5.514241933822632, "epoch": 2.608244365361803, "grad_norm": 1.0703125, "learning_rate": 0.0004323603644119532, "loss": 5.1036, "mean_token_accuracy": 0.20701534152030945, "num_tokens": 60440445.0, "step": 26385 }, { "entropy": 5.424113368988037, "epoch": 2.6087386318703043, "grad_norm": 1.1171875, "learning_rate": 0.00043233513893948654, "loss": 5.0391, "mean_token_accuracy": 0.20562277138233184, "num_tokens": 60451040.0, "step": 26390 }, { "entropy": 5.508267259597778, "epoch": 2.609232898378806, "grad_norm": 1.078125, "learning_rate": 0.0004323099095965511, "loss": 5.1796, "mean_token_accuracy": 0.19670177549123763, "num_tokens": 60463820.0, "step": 26395 }, { "entropy": 5.480975866317749, "epoch": 2.6097271648873073, "grad_norm": 1.078125, "learning_rate": 0.0004322846763837674, "loss": 5.0508, "mean_token_accuracy": 0.21566741913557053, "num_tokens": 60474285.0, "step": 26400 }, { "entropy": 5.381169176101684, "epoch": 2.6102214313958085, "grad_norm": 1.125, "learning_rate": 0.00043225943930175626, "loss": 4.993, "mean_token_accuracy": 0.22108036875724793, "num_tokens": 60484475.0, "step": 26405 }, { "entropy": 5.465008306503296, "epoch": 2.6107156979043102, "grad_norm": 1.125, "learning_rate": 0.0004322341983511386, "loss": 5.0155, "mean_token_accuracy": 0.21417828947305678, "num_tokens": 60494182.0, "step": 26410 }, { "entropy": 5.417870378494262, "epoch": 2.6112099644128115, "grad_norm": 1.0625, "learning_rate": 0.00043220895353253516, "loss": 5.0619, "mean_token_accuracy": 0.21032250672578812, "num_tokens": 60505455.0, "step": 26415 }, { "entropy": 5.393094491958618, "epoch": 2.6117042309213128, "grad_norm": 1.0234375, "learning_rate": 0.00043218370484656717, "loss": 4.9958, "mean_token_accuracy": 0.21256716251373292, "num_tokens": 60518040.0, "step": 26420 }, { "entropy": 5.475756120681763, "epoch": 2.612198497429814, "grad_norm": 1.03125, "learning_rate": 0.00043215845229385567, "loss": 5.0994, "mean_token_accuracy": 0.2092757284641266, "num_tokens": 60528896.0, "step": 26425 }, { "entropy": 5.454882574081421, "epoch": 2.6126927639383153, "grad_norm": 1.0546875, "learning_rate": 0.00043213319587502173, "loss": 5.0122, "mean_token_accuracy": 0.2114014893770218, "num_tokens": 60539505.0, "step": 26430 }, { "entropy": 5.437011003494263, "epoch": 2.613187030446817, "grad_norm": 1.1015625, "learning_rate": 0.0004321079355906869, "loss": 5.0648, "mean_token_accuracy": 0.2086468294262886, "num_tokens": 60550544.0, "step": 26435 }, { "entropy": 5.544268035888672, "epoch": 2.6136812969553183, "grad_norm": 1.046875, "learning_rate": 0.00043208267144147244, "loss": 5.163, "mean_token_accuracy": 0.1958056643605232, "num_tokens": 60561697.0, "step": 26440 }, { "entropy": 5.389890193939209, "epoch": 2.61417556346382, "grad_norm": 1.0, "learning_rate": 0.00043205740342799995, "loss": 4.9761, "mean_token_accuracy": 0.21673928052186966, "num_tokens": 60572817.0, "step": 26445 }, { "entropy": 5.477241182327271, "epoch": 2.6146698299723212, "grad_norm": 1.0625, "learning_rate": 0.00043203213155089095, "loss": 5.0631, "mean_token_accuracy": 0.207886503636837, "num_tokens": 60584679.0, "step": 26450 }, { "entropy": 5.440163421630859, "epoch": 2.6151640964808225, "grad_norm": 1.0859375, "learning_rate": 0.0004320068558107671, "loss": 5.0891, "mean_token_accuracy": 0.20481555610895158, "num_tokens": 60594871.0, "step": 26455 }, { "entropy": 5.43923716545105, "epoch": 2.6156583629893237, "grad_norm": 1.0546875, "learning_rate": 0.00043198157620825023, "loss": 5.0671, "mean_token_accuracy": 0.21116907596588136, "num_tokens": 60605626.0, "step": 26460 }, { "entropy": 5.436730098724365, "epoch": 2.616152629497825, "grad_norm": 1.0234375, "learning_rate": 0.00043195629274396237, "loss": 5.0885, "mean_token_accuracy": 0.21786459684371948, "num_tokens": 60617802.0, "step": 26465 }, { "entropy": 5.502986764907837, "epoch": 2.6166468960063267, "grad_norm": 1.0234375, "learning_rate": 0.00043193100541852526, "loss": 5.1397, "mean_token_accuracy": 0.20379660576581954, "num_tokens": 60629044.0, "step": 26470 }, { "entropy": 5.429233694076538, "epoch": 2.617141162514828, "grad_norm": 1.0390625, "learning_rate": 0.000431905714232561, "loss": 5.0217, "mean_token_accuracy": 0.21311260610818863, "num_tokens": 60639729.0, "step": 26475 }, { "entropy": 5.4653191566467285, "epoch": 2.6176354290233292, "grad_norm": 1.078125, "learning_rate": 0.00043188041918669197, "loss": 5.1361, "mean_token_accuracy": 0.2030935451388359, "num_tokens": 60650499.0, "step": 26480 }, { "entropy": 5.5962292671203615, "epoch": 2.618129695531831, "grad_norm": 3.390625, "learning_rate": 0.0004318551202815402, "loss": 5.2017, "mean_token_accuracy": 0.19315394014120102, "num_tokens": 60661453.0, "step": 26485 }, { "entropy": 5.480583620071411, "epoch": 2.618623962040332, "grad_norm": 1.1328125, "learning_rate": 0.00043182981751772816, "loss": 5.0554, "mean_token_accuracy": 0.20832203328609467, "num_tokens": 60672748.0, "step": 26490 }, { "entropy": 5.437837219238281, "epoch": 2.6191182285488335, "grad_norm": 1.09375, "learning_rate": 0.0004318045108958783, "loss": 5.0296, "mean_token_accuracy": 0.211034794151783, "num_tokens": 60683679.0, "step": 26495 }, { "entropy": 5.4222112655639645, "epoch": 2.6196124950573347, "grad_norm": 1.078125, "learning_rate": 0.00043177920041661313, "loss": 5.0262, "mean_token_accuracy": 0.2086041808128357, "num_tokens": 60696988.0, "step": 26500 }, { "entropy": 5.466078042984009, "epoch": 2.6201067615658364, "grad_norm": 1.0078125, "learning_rate": 0.0004317538860805553, "loss": 5.1961, "mean_token_accuracy": 0.19980721473693847, "num_tokens": 60709817.0, "step": 26505 }, { "entropy": 5.531041431427002, "epoch": 2.6206010280743377, "grad_norm": 1.1875, "learning_rate": 0.00043172856788832755, "loss": 5.1067, "mean_token_accuracy": 0.21104227155447006, "num_tokens": 60720941.0, "step": 26510 }, { "entropy": 5.5365966796875, "epoch": 2.621095294582839, "grad_norm": 1.1484375, "learning_rate": 0.00043170324584055275, "loss": 5.2056, "mean_token_accuracy": 0.19685383290052413, "num_tokens": 60731873.0, "step": 26515 }, { "entropy": 5.434489774703979, "epoch": 2.6215895610913407, "grad_norm": 1.0234375, "learning_rate": 0.00043167791993785375, "loss": 5.0962, "mean_token_accuracy": 0.2112856924533844, "num_tokens": 60744361.0, "step": 26520 }, { "entropy": 5.5674567222595215, "epoch": 2.622083827599842, "grad_norm": 1.0859375, "learning_rate": 0.0004316525901808536, "loss": 5.1244, "mean_token_accuracy": 0.20559146702289582, "num_tokens": 60756111.0, "step": 26525 }, { "entropy": 5.4759602546691895, "epoch": 2.622578094108343, "grad_norm": 1.078125, "learning_rate": 0.00043162725657017544, "loss": 4.9882, "mean_token_accuracy": 0.2184994637966156, "num_tokens": 60766602.0, "step": 26530 }, { "entropy": 5.463848733901978, "epoch": 2.6230723606168445, "grad_norm": 1.140625, "learning_rate": 0.00043160191910644253, "loss": 5.1117, "mean_token_accuracy": 0.20356844067573548, "num_tokens": 60778670.0, "step": 26535 }, { "entropy": 5.488467216491699, "epoch": 2.6235666271253457, "grad_norm": 1.125, "learning_rate": 0.0004315765777902781, "loss": 5.1716, "mean_token_accuracy": 0.19680868536233903, "num_tokens": 60790026.0, "step": 26540 }, { "entropy": 5.472838830947876, "epoch": 2.6240608936338474, "grad_norm": 1.09375, "learning_rate": 0.0004315512326223055, "loss": 5.1312, "mean_token_accuracy": 0.20088608264923097, "num_tokens": 60801325.0, "step": 26545 }, { "entropy": 5.52078104019165, "epoch": 2.6245551601423487, "grad_norm": 1.1875, "learning_rate": 0.0004315258836031483, "loss": 5.1208, "mean_token_accuracy": 0.20107238590717316, "num_tokens": 60813421.0, "step": 26550 }, { "entropy": 5.54648175239563, "epoch": 2.6250494266508504, "grad_norm": 0.953125, "learning_rate": 0.0004315005307334301, "loss": 5.1191, "mean_token_accuracy": 0.19864647835493088, "num_tokens": 60826447.0, "step": 26555 }, { "entropy": 5.461081171035767, "epoch": 2.6255436931593517, "grad_norm": 1.078125, "learning_rate": 0.0004314751740137746, "loss": 5.0733, "mean_token_accuracy": 0.20090051591396332, "num_tokens": 60837663.0, "step": 26560 }, { "entropy": 5.46001935005188, "epoch": 2.626037959667853, "grad_norm": 1.09375, "learning_rate": 0.00043144981344480553, "loss": 5.0635, "mean_token_accuracy": 0.19907326698303224, "num_tokens": 60849040.0, "step": 26565 }, { "entropy": 5.442444801330566, "epoch": 2.626532226176354, "grad_norm": 1.046875, "learning_rate": 0.00043142444902714676, "loss": 5.1298, "mean_token_accuracy": 0.20175640434026718, "num_tokens": 60862112.0, "step": 26570 }, { "entropy": 5.440461301803589, "epoch": 2.6270264926848554, "grad_norm": 1.078125, "learning_rate": 0.00043139908076142224, "loss": 5.049, "mean_token_accuracy": 0.2075262725353241, "num_tokens": 60872822.0, "step": 26575 }, { "entropy": 5.49421877861023, "epoch": 2.627520759193357, "grad_norm": 1.015625, "learning_rate": 0.0004313737086482562, "loss": 5.1459, "mean_token_accuracy": 0.2012254476547241, "num_tokens": 60884374.0, "step": 26580 }, { "entropy": 5.469945573806763, "epoch": 2.6280150257018584, "grad_norm": 1.0546875, "learning_rate": 0.0004313483326882725, "loss": 5.1148, "mean_token_accuracy": 0.2062963977456093, "num_tokens": 60895490.0, "step": 26585 }, { "entropy": 5.382683801651001, "epoch": 2.6285092922103597, "grad_norm": 1.109375, "learning_rate": 0.0004313229528820957, "loss": 4.9652, "mean_token_accuracy": 0.2191467374563217, "num_tokens": 60906190.0, "step": 26590 }, { "entropy": 5.479799509048462, "epoch": 2.6290035587188614, "grad_norm": 1.1953125, "learning_rate": 0.00043129756923034995, "loss": 5.0981, "mean_token_accuracy": 0.21025551855564117, "num_tokens": 60918466.0, "step": 26595 }, { "entropy": 5.386405181884766, "epoch": 2.6294978252273626, "grad_norm": 1.0625, "learning_rate": 0.0004312721817336597, "loss": 4.9745, "mean_token_accuracy": 0.21411477476358415, "num_tokens": 60930202.0, "step": 26600 }, { "entropy": 5.492415094375611, "epoch": 2.629992091735864, "grad_norm": 1.0546875, "learning_rate": 0.00043124679039264964, "loss": 5.1096, "mean_token_accuracy": 0.20260215997695924, "num_tokens": 60942089.0, "step": 26605 }, { "entropy": 5.488260698318482, "epoch": 2.630486358244365, "grad_norm": 1.0390625, "learning_rate": 0.00043122139520794425, "loss": 5.0397, "mean_token_accuracy": 0.20462982654571532, "num_tokens": 60954493.0, "step": 26610 }, { "entropy": 5.418860816955567, "epoch": 2.630980624752867, "grad_norm": 1.3046875, "learning_rate": 0.00043119599618016824, "loss": 5.0818, "mean_token_accuracy": 0.20976886600255967, "num_tokens": 60965888.0, "step": 26615 }, { "entropy": 5.438356876373291, "epoch": 2.631474891261368, "grad_norm": 1.078125, "learning_rate": 0.0004311705933099466, "loss": 5.0117, "mean_token_accuracy": 0.2073403149843216, "num_tokens": 60976414.0, "step": 26620 }, { "entropy": 5.448660182952881, "epoch": 2.6319691577698694, "grad_norm": 1.1015625, "learning_rate": 0.0004311451865979041, "loss": 5.012, "mean_token_accuracy": 0.2099453791975975, "num_tokens": 60986353.0, "step": 26625 }, { "entropy": 5.45160813331604, "epoch": 2.632463424278371, "grad_norm": 1.1015625, "learning_rate": 0.00043111977604466575, "loss": 5.0387, "mean_token_accuracy": 0.21607030928134918, "num_tokens": 60996916.0, "step": 26630 }, { "entropy": 5.342118644714356, "epoch": 2.6329576907868724, "grad_norm": 1.0546875, "learning_rate": 0.0004310943616508567, "loss": 4.9957, "mean_token_accuracy": 0.21445899456739426, "num_tokens": 61008741.0, "step": 26635 }, { "entropy": 5.511223268508911, "epoch": 2.6334519572953736, "grad_norm": 1.125, "learning_rate": 0.0004310689434171022, "loss": 5.1891, "mean_token_accuracy": 0.1967450961470604, "num_tokens": 61019988.0, "step": 26640 }, { "entropy": 5.539672708511352, "epoch": 2.633946223803875, "grad_norm": 1.046875, "learning_rate": 0.00043104352134402734, "loss": 5.1157, "mean_token_accuracy": 0.20142392218112945, "num_tokens": 61031667.0, "step": 26645 }, { "entropy": 5.456628370285034, "epoch": 2.6344404903123766, "grad_norm": 1.1171875, "learning_rate": 0.00043101809543225777, "loss": 5.0283, "mean_token_accuracy": 0.21000753939151764, "num_tokens": 61042203.0, "step": 26650 }, { "entropy": 5.443127679824829, "epoch": 2.634934756820878, "grad_norm": 1.0703125, "learning_rate": 0.00043099266568241885, "loss": 5.0423, "mean_token_accuracy": 0.2038487523794174, "num_tokens": 61054243.0, "step": 26655 }, { "entropy": 5.342503356933594, "epoch": 2.635429023329379, "grad_norm": 1.0390625, "learning_rate": 0.00043096723209513606, "loss": 4.8997, "mean_token_accuracy": 0.22634548097848892, "num_tokens": 61064068.0, "step": 26660 }, { "entropy": 5.357486343383789, "epoch": 2.635923289837881, "grad_norm": 1.0390625, "learning_rate": 0.0004309417946710352, "loss": 4.9875, "mean_token_accuracy": 0.21721184253692627, "num_tokens": 61075273.0, "step": 26665 }, { "entropy": 5.499697875976563, "epoch": 2.636417556346382, "grad_norm": 1.1015625, "learning_rate": 0.000430916353410742, "loss": 5.0841, "mean_token_accuracy": 0.20613777339458467, "num_tokens": 61086536.0, "step": 26670 }, { "entropy": 5.44303674697876, "epoch": 2.6369118228548833, "grad_norm": 1.03125, "learning_rate": 0.0004308909083148824, "loss": 5.0504, "mean_token_accuracy": 0.2095375418663025, "num_tokens": 61097567.0, "step": 26675 }, { "entropy": 5.459296464920044, "epoch": 2.6374060893633846, "grad_norm": 1.2421875, "learning_rate": 0.0004308654593840822, "loss": 5.0471, "mean_token_accuracy": 0.20929599404335023, "num_tokens": 61108379.0, "step": 26680 }, { "entropy": 5.350851202011109, "epoch": 2.637900355871886, "grad_norm": 1.078125, "learning_rate": 0.00043084000661896757, "loss": 5.0269, "mean_token_accuracy": 0.20912112146615983, "num_tokens": 61119715.0, "step": 26685 }, { "entropy": 5.519884395599365, "epoch": 2.6383946223803876, "grad_norm": 1.109375, "learning_rate": 0.0004308145500201645, "loss": 5.1525, "mean_token_accuracy": 0.2016537070274353, "num_tokens": 61131810.0, "step": 26690 }, { "entropy": 5.433495283126831, "epoch": 2.638888888888889, "grad_norm": 1.09375, "learning_rate": 0.00043078908958829945, "loss": 5.0097, "mean_token_accuracy": 0.21264057457447053, "num_tokens": 61142771.0, "step": 26695 }, { "entropy": 5.382149171829224, "epoch": 2.6393831553973905, "grad_norm": 1.171875, "learning_rate": 0.00043076362532399855, "loss": 5.0759, "mean_token_accuracy": 0.204647296667099, "num_tokens": 61154105.0, "step": 26700 }, { "entropy": 5.490643835067749, "epoch": 2.639877421905892, "grad_norm": 1.0546875, "learning_rate": 0.0004307381572278882, "loss": 4.9739, "mean_token_accuracy": 0.21394731253385543, "num_tokens": 61164574.0, "step": 26705 }, { "entropy": 5.45215539932251, "epoch": 2.640371688414393, "grad_norm": 1.0546875, "learning_rate": 0.0004307126853005952, "loss": 5.1332, "mean_token_accuracy": 0.20109274089336396, "num_tokens": 61177085.0, "step": 26710 }, { "entropy": 5.440183925628662, "epoch": 2.6408659549228943, "grad_norm": 1.0703125, "learning_rate": 0.0004306872095427459, "loss": 5.0312, "mean_token_accuracy": 0.2124553382396698, "num_tokens": 61188313.0, "step": 26715 }, { "entropy": 5.392519187927246, "epoch": 2.6413602214313956, "grad_norm": 0.9921875, "learning_rate": 0.0004306617299549672, "loss": 4.9626, "mean_token_accuracy": 0.21787741929292678, "num_tokens": 61199726.0, "step": 26720 }, { "entropy": 5.410009431838989, "epoch": 2.6418544879398973, "grad_norm": 1.171875, "learning_rate": 0.0004306362465378857, "loss": 5.0746, "mean_token_accuracy": 0.20545369237661362, "num_tokens": 61211861.0, "step": 26725 }, { "entropy": 5.420197296142578, "epoch": 2.6423487544483986, "grad_norm": 0.98046875, "learning_rate": 0.00043061075929212836, "loss": 5.0362, "mean_token_accuracy": 0.2091488778591156, "num_tokens": 61222464.0, "step": 26730 }, { "entropy": 5.490419244766235, "epoch": 2.6428430209569, "grad_norm": 1.046875, "learning_rate": 0.0004305852682183222, "loss": 5.028, "mean_token_accuracy": 0.20403672009706497, "num_tokens": 61233678.0, "step": 26735 }, { "entropy": 5.432313632965088, "epoch": 2.6433372874654015, "grad_norm": 1.015625, "learning_rate": 0.0004305597733170944, "loss": 5.0998, "mean_token_accuracy": 0.20257449746131898, "num_tokens": 61244636.0, "step": 26740 }, { "entropy": 5.529808282852173, "epoch": 2.643831553973903, "grad_norm": 1.0625, "learning_rate": 0.00043053427458907196, "loss": 5.078, "mean_token_accuracy": 0.20320031940937042, "num_tokens": 61256334.0, "step": 26745 }, { "entropy": 5.47851333618164, "epoch": 2.644325820482404, "grad_norm": 0.94140625, "learning_rate": 0.0004305087720348823, "loss": 5.0992, "mean_token_accuracy": 0.21004230976104737, "num_tokens": 61268614.0, "step": 26750 }, { "entropy": 5.484437370300293, "epoch": 2.6448200869909053, "grad_norm": 1.109375, "learning_rate": 0.00043048326565515267, "loss": 5.1569, "mean_token_accuracy": 0.19599247276782988, "num_tokens": 61280220.0, "step": 26755 }, { "entropy": 5.474890804290771, "epoch": 2.645314353499407, "grad_norm": 1.078125, "learning_rate": 0.00043045775545051055, "loss": 4.9947, "mean_token_accuracy": 0.21295276135206223, "num_tokens": 61290796.0, "step": 26760 }, { "entropy": 5.437591934204102, "epoch": 2.6458086200079083, "grad_norm": 1.015625, "learning_rate": 0.0004304322414215836, "loss": 5.0929, "mean_token_accuracy": 0.20901717990636826, "num_tokens": 61303645.0, "step": 26765 }, { "entropy": 5.446726894378662, "epoch": 2.6463028865164095, "grad_norm": 1.0078125, "learning_rate": 0.00043040672356899946, "loss": 5.0861, "mean_token_accuracy": 0.20499373972415924, "num_tokens": 61316641.0, "step": 26770 }, { "entropy": 5.511597728729248, "epoch": 2.6467971530249113, "grad_norm": 1.0625, "learning_rate": 0.00043038120189338566, "loss": 5.1653, "mean_token_accuracy": 0.19674562364816667, "num_tokens": 61329314.0, "step": 26775 }, { "entropy": 5.503765201568603, "epoch": 2.6472914195334125, "grad_norm": 0.98828125, "learning_rate": 0.00043035567639537026, "loss": 5.16, "mean_token_accuracy": 0.20136458426713943, "num_tokens": 61340847.0, "step": 26780 }, { "entropy": 5.565564870834351, "epoch": 2.6477856860419138, "grad_norm": 1.0625, "learning_rate": 0.00043033014707558113, "loss": 5.1369, "mean_token_accuracy": 0.20283611863851547, "num_tokens": 61351875.0, "step": 26785 }, { "entropy": 5.46535062789917, "epoch": 2.648279952550415, "grad_norm": 0.98046875, "learning_rate": 0.0004303046139346462, "loss": 5.1046, "mean_token_accuracy": 0.2105036199092865, "num_tokens": 61364441.0, "step": 26790 }, { "entropy": 5.412400817871093, "epoch": 2.6487742190589163, "grad_norm": 1.0078125, "learning_rate": 0.0004302790769731938, "loss": 5.0532, "mean_token_accuracy": 0.20345621854066848, "num_tokens": 61375084.0, "step": 26795 }, { "entropy": 5.517037677764892, "epoch": 2.649268485567418, "grad_norm": 1.0546875, "learning_rate": 0.00043025353619185195, "loss": 5.1402, "mean_token_accuracy": 0.20046569854021073, "num_tokens": 61386036.0, "step": 26800 }, { "entropy": 5.508811283111572, "epoch": 2.6497627520759193, "grad_norm": 1.0234375, "learning_rate": 0.00043022799159124904, "loss": 5.0772, "mean_token_accuracy": 0.2088192507624626, "num_tokens": 61396006.0, "step": 26805 }, { "entropy": 5.483269786834716, "epoch": 2.650257018584421, "grad_norm": 1.2421875, "learning_rate": 0.00043020244317201344, "loss": 5.1567, "mean_token_accuracy": 0.1989763006567955, "num_tokens": 61406453.0, "step": 26810 }, { "entropy": 5.51816234588623, "epoch": 2.6507512850929222, "grad_norm": 1.078125, "learning_rate": 0.0004301768909347737, "loss": 5.1564, "mean_token_accuracy": 0.20571520328521728, "num_tokens": 61418271.0, "step": 26815 }, { "entropy": 5.55323224067688, "epoch": 2.6512455516014235, "grad_norm": 0.953125, "learning_rate": 0.0004301513348801583, "loss": 5.0889, "mean_token_accuracy": 0.199857459962368, "num_tokens": 61430575.0, "step": 26820 }, { "entropy": 5.360191583633423, "epoch": 2.6517398181099248, "grad_norm": 0.9609375, "learning_rate": 0.000430125775008796, "loss": 4.9965, "mean_token_accuracy": 0.21166138648986815, "num_tokens": 61442336.0, "step": 26825 }, { "entropy": 5.469023084640503, "epoch": 2.652234084618426, "grad_norm": 0.9921875, "learning_rate": 0.00043010021132131564, "loss": 5.0747, "mean_token_accuracy": 0.20623867511749266, "num_tokens": 61453945.0, "step": 26830 }, { "entropy": 5.489079141616822, "epoch": 2.6527283511269277, "grad_norm": 1.0703125, "learning_rate": 0.000430074643818346, "loss": 5.0425, "mean_token_accuracy": 0.21198657900094986, "num_tokens": 61463877.0, "step": 26835 }, { "entropy": 5.446172046661377, "epoch": 2.653222617635429, "grad_norm": 1.1796875, "learning_rate": 0.00043004907250051606, "loss": 4.9775, "mean_token_accuracy": 0.21135786771774293, "num_tokens": 61473278.0, "step": 26840 }, { "entropy": 5.550709342956543, "epoch": 2.6537168841439303, "grad_norm": 1.03125, "learning_rate": 0.0004300234973684548, "loss": 5.168, "mean_token_accuracy": 0.201534004509449, "num_tokens": 61486038.0, "step": 26845 }, { "entropy": 5.468103408813477, "epoch": 2.654211150652432, "grad_norm": 1.0546875, "learning_rate": 0.0004299979184227916, "loss": 5.0906, "mean_token_accuracy": 0.20338857173919678, "num_tokens": 61497722.0, "step": 26850 }, { "entropy": 5.415162372589111, "epoch": 2.6547054171609332, "grad_norm": 1.078125, "learning_rate": 0.00042997233566415547, "loss": 5.0362, "mean_token_accuracy": 0.20714619755744934, "num_tokens": 61508791.0, "step": 26855 }, { "entropy": 5.467224073410034, "epoch": 2.6551996836694345, "grad_norm": 1.109375, "learning_rate": 0.00042994674909317584, "loss": 5.0141, "mean_token_accuracy": 0.21556785702705383, "num_tokens": 61520047.0, "step": 26860 }, { "entropy": 5.444084167480469, "epoch": 2.6556939501779357, "grad_norm": 1.1171875, "learning_rate": 0.00042992115871048214, "loss": 5.0257, "mean_token_accuracy": 0.2081543743610382, "num_tokens": 61531005.0, "step": 26865 }, { "entropy": 5.409723520278931, "epoch": 2.6561882166864375, "grad_norm": 1.109375, "learning_rate": 0.00042989556451670396, "loss": 5.0781, "mean_token_accuracy": 0.20670622438192368, "num_tokens": 61542087.0, "step": 26870 }, { "entropy": 5.452761220932007, "epoch": 2.6566824831949387, "grad_norm": 1.09375, "learning_rate": 0.0004298699665124708, "loss": 5.155, "mean_token_accuracy": 0.20421219915151595, "num_tokens": 61553575.0, "step": 26875 }, { "entropy": 5.582581949234009, "epoch": 2.65717674970344, "grad_norm": 1.1171875, "learning_rate": 0.00042984436469841245, "loss": 5.1373, "mean_token_accuracy": 0.2018783912062645, "num_tokens": 61564833.0, "step": 26880 }, { "entropy": 5.415939044952393, "epoch": 2.6576710162119417, "grad_norm": 1.015625, "learning_rate": 0.00042981875907515874, "loss": 4.9372, "mean_token_accuracy": 0.21965519785881044, "num_tokens": 61575721.0, "step": 26885 }, { "entropy": 5.471623086929322, "epoch": 2.658165282720443, "grad_norm": 1.125, "learning_rate": 0.00042979314964333953, "loss": 5.0992, "mean_token_accuracy": 0.20798233300447463, "num_tokens": 61587022.0, "step": 26890 }, { "entropy": 5.452496528625488, "epoch": 2.658659549228944, "grad_norm": 1.1171875, "learning_rate": 0.0004297675364035848, "loss": 5.0425, "mean_token_accuracy": 0.20675941407680512, "num_tokens": 61597610.0, "step": 26895 }, { "entropy": 5.549894571304321, "epoch": 2.6591538157374455, "grad_norm": 1.1484375, "learning_rate": 0.0004297419193565247, "loss": 5.1466, "mean_token_accuracy": 0.19942129850387574, "num_tokens": 61608254.0, "step": 26900 }, { "entropy": 5.477271461486817, "epoch": 2.659648082245947, "grad_norm": 1.0, "learning_rate": 0.00042971629850278924, "loss": 5.0503, "mean_token_accuracy": 0.20788105428218842, "num_tokens": 61619937.0, "step": 26905 }, { "entropy": 5.419719552993774, "epoch": 2.6601423487544484, "grad_norm": 1.0546875, "learning_rate": 0.00042969067384300905, "loss": 5.0893, "mean_token_accuracy": 0.20655132234096527, "num_tokens": 61630460.0, "step": 26910 }, { "entropy": 5.455670738220215, "epoch": 2.6606366152629497, "grad_norm": 1.0625, "learning_rate": 0.00042966504537781416, "loss": 5.0139, "mean_token_accuracy": 0.21229053139686585, "num_tokens": 61640855.0, "step": 26915 }, { "entropy": 5.56550350189209, "epoch": 2.6611308817714514, "grad_norm": 1.078125, "learning_rate": 0.0004296394131078351, "loss": 5.1356, "mean_token_accuracy": 0.20096256732940673, "num_tokens": 61652405.0, "step": 26920 }, { "entropy": 5.459198141098023, "epoch": 2.6616251482799527, "grad_norm": 1.0703125, "learning_rate": 0.00042961377703370265, "loss": 5.0121, "mean_token_accuracy": 0.20885648280382157, "num_tokens": 61664379.0, "step": 26925 }, { "entropy": 5.444211769104004, "epoch": 2.662119414788454, "grad_norm": 1.046875, "learning_rate": 0.0004295881371560472, "loss": 5.0363, "mean_token_accuracy": 0.21038832217454911, "num_tokens": 61675259.0, "step": 26930 }, { "entropy": 5.418305683135986, "epoch": 2.662613681296955, "grad_norm": 1.078125, "learning_rate": 0.00042956249347549964, "loss": 5.0662, "mean_token_accuracy": 0.20536253452301026, "num_tokens": 61687035.0, "step": 26935 }, { "entropy": 5.529556465148926, "epoch": 2.6631079478054565, "grad_norm": 1.125, "learning_rate": 0.0004295368459926907, "loss": 5.103, "mean_token_accuracy": 0.20379627794027327, "num_tokens": 61698082.0, "step": 26940 }, { "entropy": 5.485279846191406, "epoch": 2.663602214313958, "grad_norm": 1.0703125, "learning_rate": 0.00042951119470825146, "loss": 5.0762, "mean_token_accuracy": 0.19980324804782867, "num_tokens": 61708533.0, "step": 26945 }, { "entropy": 5.520138072967529, "epoch": 2.6640964808224594, "grad_norm": 1.0546875, "learning_rate": 0.00042948553962281286, "loss": 5.0981, "mean_token_accuracy": 0.2021261289715767, "num_tokens": 61719301.0, "step": 26950 }, { "entropy": 5.4330301761627195, "epoch": 2.664590747330961, "grad_norm": 1.171875, "learning_rate": 0.0004294598807370059, "loss": 5.0357, "mean_token_accuracy": 0.21138217598199843, "num_tokens": 61732225.0, "step": 26955 }, { "entropy": 5.364568758010864, "epoch": 2.6650850138394624, "grad_norm": 1.0390625, "learning_rate": 0.000429434218051462, "loss": 5.0185, "mean_token_accuracy": 0.21513096392154693, "num_tokens": 61743901.0, "step": 26960 }, { "entropy": 5.517559814453125, "epoch": 2.6655792803479637, "grad_norm": 1.5234375, "learning_rate": 0.0004294085515668123, "loss": 5.0511, "mean_token_accuracy": 0.21002853959798812, "num_tokens": 61756047.0, "step": 26965 }, { "entropy": 5.472736930847168, "epoch": 2.666073546856465, "grad_norm": 1.0, "learning_rate": 0.00042938288128368835, "loss": 5.0314, "mean_token_accuracy": 0.21113575696945192, "num_tokens": 61767784.0, "step": 26970 }, { "entropy": 5.440064191818237, "epoch": 2.666567813364966, "grad_norm": 1.0625, "learning_rate": 0.00042935720720272156, "loss": 5.1486, "mean_token_accuracy": 0.20169439613819123, "num_tokens": 61778915.0, "step": 26975 }, { "entropy": 5.424635314941407, "epoch": 2.667062079873468, "grad_norm": 1.0390625, "learning_rate": 0.0004293315293245435, "loss": 5.0386, "mean_token_accuracy": 0.21064051985740662, "num_tokens": 61791046.0, "step": 26980 }, { "entropy": 5.468916416168213, "epoch": 2.667556346381969, "grad_norm": 1.0546875, "learning_rate": 0.00042930584764978597, "loss": 5.0401, "mean_token_accuracy": 0.2153873398900032, "num_tokens": 61802135.0, "step": 26985 }, { "entropy": 5.5550189971923825, "epoch": 2.6680506128904704, "grad_norm": 0.97265625, "learning_rate": 0.00042928016217908053, "loss": 5.1007, "mean_token_accuracy": 0.2072929099202156, "num_tokens": 61815077.0, "step": 26990 }, { "entropy": 5.405262088775634, "epoch": 2.668544879398972, "grad_norm": 1.046875, "learning_rate": 0.0004292544729130592, "loss": 4.9867, "mean_token_accuracy": 0.2124576225876808, "num_tokens": 61826031.0, "step": 26995 }, { "entropy": 5.393457460403442, "epoch": 2.6690391459074734, "grad_norm": 1.0, "learning_rate": 0.00042922877985235395, "loss": 5.0121, "mean_token_accuracy": 0.21686503291130066, "num_tokens": 61836372.0, "step": 27000 }, { "epoch": 2.6690391459074734, "eval_entropy": 5.19592115905452, "eval_loss": 5.143263816833496, "eval_mean_token_accuracy": 0.2119038778257546, "eval_num_tokens": 61836372.0, "eval_runtime": 26.4994, "eval_samples_per_second": 1226.933, "eval_steps_per_second": 153.4, "step": 27000 }, { "entropy": 5.376849269866943, "epoch": 2.6695334124159746, "grad_norm": 1.0625, "learning_rate": 0.00042920308299759677, "loss": 4.995, "mean_token_accuracy": 0.21264728009700776, "num_tokens": 61847829.0, "step": 27005 }, { "entropy": 5.4404786109924315, "epoch": 2.670027678924476, "grad_norm": 1.1015625, "learning_rate": 0.0004291773823494198, "loss": 5.072, "mean_token_accuracy": 0.20994795113801956, "num_tokens": 61859074.0, "step": 27010 }, { "entropy": 5.5471666812896725, "epoch": 2.6705219454329776, "grad_norm": 1.078125, "learning_rate": 0.00042915167790845535, "loss": 5.1732, "mean_token_accuracy": 0.19429955631494522, "num_tokens": 61868596.0, "step": 27015 }, { "entropy": 5.411706495285034, "epoch": 2.671016211941479, "grad_norm": 1.0390625, "learning_rate": 0.0004291259696753356, "loss": 5.0581, "mean_token_accuracy": 0.21059284508228301, "num_tokens": 61879173.0, "step": 27020 }, { "entropy": 5.4422389507293705, "epoch": 2.67151047844998, "grad_norm": 1.0390625, "learning_rate": 0.0004291002576506932, "loss": 5.0285, "mean_token_accuracy": 0.21663536578416825, "num_tokens": 61889784.0, "step": 27025 }, { "entropy": 5.544349336624146, "epoch": 2.672004744958482, "grad_norm": 1.078125, "learning_rate": 0.00042907454183516055, "loss": 5.0784, "mean_token_accuracy": 0.21403243094682695, "num_tokens": 61900295.0, "step": 27030 }, { "entropy": 5.407369327545166, "epoch": 2.672499011466983, "grad_norm": 1.0625, "learning_rate": 0.0004290488222293702, "loss": 5.0137, "mean_token_accuracy": 0.21434864401817322, "num_tokens": 61911938.0, "step": 27035 }, { "entropy": 5.396992111206055, "epoch": 2.6729932779754844, "grad_norm": 1.2734375, "learning_rate": 0.00042902309883395497, "loss": 5.0672, "mean_token_accuracy": 0.20752326399087906, "num_tokens": 61922609.0, "step": 27040 }, { "entropy": 5.39989709854126, "epoch": 2.6734875444839856, "grad_norm": 1.1484375, "learning_rate": 0.0004289973716495476, "loss": 5.013, "mean_token_accuracy": 0.20684352219104768, "num_tokens": 61932744.0, "step": 27045 }, { "entropy": 5.403465700149536, "epoch": 2.673981810992487, "grad_norm": 1.0859375, "learning_rate": 0.00042897164067678094, "loss": 5.0443, "mean_token_accuracy": 0.21280886083841324, "num_tokens": 61944099.0, "step": 27050 }, { "entropy": 5.499967098236084, "epoch": 2.6744760775009886, "grad_norm": 1.03125, "learning_rate": 0.00042894590591628813, "loss": 5.135, "mean_token_accuracy": 0.20270054638385773, "num_tokens": 61955241.0, "step": 27055 }, { "entropy": 5.3820994853973385, "epoch": 2.67497034400949, "grad_norm": 1.0, "learning_rate": 0.00042892016736870213, "loss": 5.0122, "mean_token_accuracy": 0.2121971696615219, "num_tokens": 61966578.0, "step": 27060 }, { "entropy": 5.396243524551392, "epoch": 2.6754646105179916, "grad_norm": 1.0, "learning_rate": 0.00042889442503465616, "loss": 4.9962, "mean_token_accuracy": 0.2186695635318756, "num_tokens": 61977628.0, "step": 27065 }, { "entropy": 5.600973892211914, "epoch": 2.675958877026493, "grad_norm": 1.0234375, "learning_rate": 0.00042886867891478344, "loss": 5.16, "mean_token_accuracy": 0.1974322810769081, "num_tokens": 61988904.0, "step": 27070 }, { "entropy": 5.475010585784912, "epoch": 2.676453143534994, "grad_norm": 1.1015625, "learning_rate": 0.0004288429290097173, "loss": 5.1404, "mean_token_accuracy": 0.20540257543325424, "num_tokens": 62000977.0, "step": 27075 }, { "entropy": 5.45012321472168, "epoch": 2.6769474100434953, "grad_norm": 1.03125, "learning_rate": 0.00042881717532009125, "loss": 5.0962, "mean_token_accuracy": 0.20464272648096085, "num_tokens": 62011023.0, "step": 27080 }, { "entropy": 5.477319812774658, "epoch": 2.6774416765519966, "grad_norm": 1.0625, "learning_rate": 0.00042879141784653887, "loss": 5.0876, "mean_token_accuracy": 0.2068314343690872, "num_tokens": 62022679.0, "step": 27085 }, { "entropy": 5.46135835647583, "epoch": 2.6779359430604983, "grad_norm": 1.0546875, "learning_rate": 0.00042876565658969375, "loss": 4.9993, "mean_token_accuracy": 0.2068876639008522, "num_tokens": 62033922.0, "step": 27090 }, { "entropy": 5.471785974502564, "epoch": 2.6784302095689996, "grad_norm": 1.09375, "learning_rate": 0.00042873989155018955, "loss": 5.1392, "mean_token_accuracy": 0.20213527977466583, "num_tokens": 62045511.0, "step": 27095 }, { "entropy": 5.373157072067261, "epoch": 2.678924476077501, "grad_norm": 1.046875, "learning_rate": 0.0004287141227286602, "loss": 4.9359, "mean_token_accuracy": 0.22093926519155502, "num_tokens": 62055113.0, "step": 27100 }, { "entropy": 5.559252309799194, "epoch": 2.6794187425860025, "grad_norm": 1.0703125, "learning_rate": 0.0004286883501257396, "loss": 5.1986, "mean_token_accuracy": 0.19876435548067092, "num_tokens": 62067808.0, "step": 27105 }, { "entropy": 5.4390770435333256, "epoch": 2.679913009094504, "grad_norm": 1.0546875, "learning_rate": 0.00042866257374206174, "loss": 5.0101, "mean_token_accuracy": 0.20870517641305925, "num_tokens": 62078266.0, "step": 27110 }, { "entropy": 5.460529327392578, "epoch": 2.680407275603005, "grad_norm": 0.96484375, "learning_rate": 0.00042863679357826076, "loss": 5.1102, "mean_token_accuracy": 0.1978542074561119, "num_tokens": 62091612.0, "step": 27115 }, { "entropy": 5.442612171173096, "epoch": 2.6809015421115063, "grad_norm": 1.0078125, "learning_rate": 0.0004286110096349708, "loss": 5.0819, "mean_token_accuracy": 0.20319596081972122, "num_tokens": 62104198.0, "step": 27120 }, { "entropy": 5.4053990840911865, "epoch": 2.681395808620008, "grad_norm": 1.0078125, "learning_rate": 0.0004285852219128261, "loss": 5.0108, "mean_token_accuracy": 0.20899137407541274, "num_tokens": 62115155.0, "step": 27125 }, { "entropy": 5.485495328903198, "epoch": 2.6818900751285093, "grad_norm": 1.078125, "learning_rate": 0.0004285594304124612, "loss": 5.126, "mean_token_accuracy": 0.20180237144231797, "num_tokens": 62126555.0, "step": 27130 }, { "entropy": 5.505683279037475, "epoch": 2.6823843416370106, "grad_norm": 1.1015625, "learning_rate": 0.00042853363513451056, "loss": 5.0797, "mean_token_accuracy": 0.20305417627096176, "num_tokens": 62138976.0, "step": 27135 }, { "entropy": 5.480543851852417, "epoch": 2.6828786081455123, "grad_norm": 1.0078125, "learning_rate": 0.00042850783607960855, "loss": 5.1428, "mean_token_accuracy": 0.20103807747364044, "num_tokens": 62150453.0, "step": 27140 }, { "entropy": 5.386187314987183, "epoch": 2.6833728746540135, "grad_norm": 1.046875, "learning_rate": 0.00042848203324839, "loss": 4.9057, "mean_token_accuracy": 0.22359127700328826, "num_tokens": 62162342.0, "step": 27145 }, { "entropy": 5.40433349609375, "epoch": 2.683867141162515, "grad_norm": 1.046875, "learning_rate": 0.0004284562266414896, "loss": 5.0805, "mean_token_accuracy": 0.20785312056541444, "num_tokens": 62173850.0, "step": 27150 }, { "entropy": 5.3674815654754635, "epoch": 2.684361407671016, "grad_norm": 1.078125, "learning_rate": 0.00042843041625954223, "loss": 4.989, "mean_token_accuracy": 0.20567018836736678, "num_tokens": 62185410.0, "step": 27155 }, { "entropy": 5.442239999771118, "epoch": 2.6848556741795178, "grad_norm": 1.0234375, "learning_rate": 0.0004284046021031828, "loss": 5.031, "mean_token_accuracy": 0.21022606492042542, "num_tokens": 62197620.0, "step": 27160 }, { "entropy": 5.4070922374725345, "epoch": 2.685349940688019, "grad_norm": 0.9765625, "learning_rate": 0.0004283787841730464, "loss": 5.0416, "mean_token_accuracy": 0.210693122446537, "num_tokens": 62209435.0, "step": 27165 }, { "entropy": 5.415926694869995, "epoch": 2.6858442071965203, "grad_norm": 1.0234375, "learning_rate": 0.00042835296246976806, "loss": 5.0616, "mean_token_accuracy": 0.20783940702676773, "num_tokens": 62219948.0, "step": 27170 }, { "entropy": 5.4536645889282225, "epoch": 2.686338473705022, "grad_norm": 1.1171875, "learning_rate": 0.0004283271369939831, "loss": 5.072, "mean_token_accuracy": 0.20454054921865464, "num_tokens": 62230299.0, "step": 27175 }, { "entropy": 5.492748689651489, "epoch": 2.6868327402135233, "grad_norm": 1.0703125, "learning_rate": 0.00042830130774632687, "loss": 5.0476, "mean_token_accuracy": 0.21218666732311248, "num_tokens": 62241952.0, "step": 27180 }, { "entropy": 5.465061044692993, "epoch": 2.6873270067220245, "grad_norm": 1.03125, "learning_rate": 0.0004282754747274345, "loss": 5.0821, "mean_token_accuracy": 0.20951579362154008, "num_tokens": 62253200.0, "step": 27185 }, { "entropy": 5.4542553424835205, "epoch": 2.6878212732305258, "grad_norm": 1.125, "learning_rate": 0.00042824963793794174, "loss": 5.0542, "mean_token_accuracy": 0.21183974295854568, "num_tokens": 62264203.0, "step": 27190 }, { "entropy": 5.5155284881591795, "epoch": 2.688315539739027, "grad_norm": 1.078125, "learning_rate": 0.00042822379737848424, "loss": 5.0442, "mean_token_accuracy": 0.2059824988245964, "num_tokens": 62276296.0, "step": 27195 }, { "entropy": 5.496863651275635, "epoch": 2.6888098062475287, "grad_norm": 1.1015625, "learning_rate": 0.0004281979530496974, "loss": 5.0938, "mean_token_accuracy": 0.20391029268503189, "num_tokens": 62287827.0, "step": 27200 }, { "entropy": 5.518351745605469, "epoch": 2.68930407275603, "grad_norm": 1.0546875, "learning_rate": 0.0004281721049522172, "loss": 5.1173, "mean_token_accuracy": 0.19997261017560958, "num_tokens": 62299451.0, "step": 27205 }, { "entropy": 5.4263482093811035, "epoch": 2.6897983392645317, "grad_norm": 1.03125, "learning_rate": 0.00042814625308667945, "loss": 5.0588, "mean_token_accuracy": 0.20434576272964478, "num_tokens": 62311508.0, "step": 27210 }, { "entropy": 5.481621170043946, "epoch": 2.690292605773033, "grad_norm": 1.0390625, "learning_rate": 0.00042812039745372004, "loss": 5.0282, "mean_token_accuracy": 0.22057853490114213, "num_tokens": 62323279.0, "step": 27215 }, { "entropy": 5.553976106643677, "epoch": 2.6907868722815342, "grad_norm": 1.203125, "learning_rate": 0.00042809453805397525, "loss": 5.1674, "mean_token_accuracy": 0.20084467232227327, "num_tokens": 62335897.0, "step": 27220 }, { "entropy": 5.468023204803467, "epoch": 2.6912811387900355, "grad_norm": 0.98046875, "learning_rate": 0.000428068674888081, "loss": 5.0745, "mean_token_accuracy": 0.20778805017471313, "num_tokens": 62347090.0, "step": 27225 }, { "entropy": 5.480611276626587, "epoch": 2.6917754052985368, "grad_norm": 1.125, "learning_rate": 0.00042804280795667363, "loss": 5.0644, "mean_token_accuracy": 0.20592082291841507, "num_tokens": 62358211.0, "step": 27230 }, { "entropy": 5.440846920013428, "epoch": 2.6922696718070385, "grad_norm": 1.1015625, "learning_rate": 0.0004280169372603894, "loss": 5.0577, "mean_token_accuracy": 0.21047901064157487, "num_tokens": 62368628.0, "step": 27235 }, { "entropy": 5.444861125946045, "epoch": 2.6927639383155397, "grad_norm": 1.046875, "learning_rate": 0.0004279910627998647, "loss": 5.066, "mean_token_accuracy": 0.20430624783039092, "num_tokens": 62380633.0, "step": 27240 }, { "entropy": 5.511349391937256, "epoch": 2.693258204824041, "grad_norm": 1.109375, "learning_rate": 0.00042796518457573625, "loss": 5.1343, "mean_token_accuracy": 0.20013356506824492, "num_tokens": 62392615.0, "step": 27245 }, { "entropy": 5.460319995880127, "epoch": 2.6937524713325427, "grad_norm": 1.0546875, "learning_rate": 0.0004279393025886405, "loss": 5.0446, "mean_token_accuracy": 0.21847428679466246, "num_tokens": 62403087.0, "step": 27250 }, { "entropy": 5.512298202514648, "epoch": 2.694246737841044, "grad_norm": 1.078125, "learning_rate": 0.00042791341683921417, "loss": 5.0894, "mean_token_accuracy": 0.2014314502477646, "num_tokens": 62415487.0, "step": 27255 }, { "entropy": 5.389772081375122, "epoch": 2.694741004349545, "grad_norm": 1.015625, "learning_rate": 0.0004278875273280941, "loss": 5.0265, "mean_token_accuracy": 0.21235078871250151, "num_tokens": 62428123.0, "step": 27260 }, { "entropy": 5.458454656600952, "epoch": 2.6952352708580465, "grad_norm": 1.0546875, "learning_rate": 0.0004278616340559171, "loss": 5.0621, "mean_token_accuracy": 0.20406317114830017, "num_tokens": 62440250.0, "step": 27265 }, { "entropy": 5.457391452789307, "epoch": 2.695729537366548, "grad_norm": 1.15625, "learning_rate": 0.00042783573702332014, "loss": 5.0262, "mean_token_accuracy": 0.2083328604698181, "num_tokens": 62451500.0, "step": 27270 }, { "entropy": 5.446199989318847, "epoch": 2.6962238038750495, "grad_norm": 1.109375, "learning_rate": 0.00042780983623094037, "loss": 5.0518, "mean_token_accuracy": 0.21355418711900712, "num_tokens": 62461839.0, "step": 27275 }, { "entropy": 5.3950074195861815, "epoch": 2.6967180703835507, "grad_norm": 1.125, "learning_rate": 0.0004277839316794149, "loss": 5.0532, "mean_token_accuracy": 0.20838071256875992, "num_tokens": 62473650.0, "step": 27280 }, { "entropy": 5.475646591186523, "epoch": 2.6972123368920524, "grad_norm": 1.078125, "learning_rate": 0.00042775802336938106, "loss": 5.0796, "mean_token_accuracy": 0.20373637229204178, "num_tokens": 62484024.0, "step": 27285 }, { "entropy": 5.504436016082764, "epoch": 2.6977066034005537, "grad_norm": 1.0234375, "learning_rate": 0.0004277321113014762, "loss": 5.0704, "mean_token_accuracy": 0.2018016442656517, "num_tokens": 62495958.0, "step": 27290 }, { "entropy": 5.459137296676635, "epoch": 2.698200869909055, "grad_norm": 1.09375, "learning_rate": 0.00042770619547633767, "loss": 5.1683, "mean_token_accuracy": 0.20532295107841492, "num_tokens": 62508474.0, "step": 27295 }, { "entropy": 5.470155715942383, "epoch": 2.698695136417556, "grad_norm": 1.1015625, "learning_rate": 0.00042768027589460295, "loss": 5.0796, "mean_token_accuracy": 0.21067889779806137, "num_tokens": 62520281.0, "step": 27300 }, { "entropy": 5.514051628112793, "epoch": 2.6991894029260575, "grad_norm": 1.09375, "learning_rate": 0.0004276543525569098, "loss": 5.083, "mean_token_accuracy": 0.2080689936876297, "num_tokens": 62532242.0, "step": 27305 }, { "entropy": 5.416023111343383, "epoch": 2.699683669434559, "grad_norm": 1.015625, "learning_rate": 0.00042762842546389593, "loss": 5.0818, "mean_token_accuracy": 0.2080347642302513, "num_tokens": 62544416.0, "step": 27310 }, { "entropy": 5.469554901123047, "epoch": 2.7001779359430604, "grad_norm": 1.0703125, "learning_rate": 0.00042760249461619914, "loss": 5.0897, "mean_token_accuracy": 0.20498355925083162, "num_tokens": 62555932.0, "step": 27315 }, { "entropy": 5.36395788192749, "epoch": 2.700672202451562, "grad_norm": 1.0625, "learning_rate": 0.00042757656001445727, "loss": 4.9818, "mean_token_accuracy": 0.21798075735569, "num_tokens": 62567322.0, "step": 27320 }, { "entropy": 5.404558372497559, "epoch": 2.7011664689600634, "grad_norm": 1.0390625, "learning_rate": 0.0004275506216593083, "loss": 5.019, "mean_token_accuracy": 0.2134648784995079, "num_tokens": 62577491.0, "step": 27325 }, { "entropy": 5.45589690208435, "epoch": 2.7016607354685647, "grad_norm": 1.0859375, "learning_rate": 0.0004275246795513904, "loss": 5.0758, "mean_token_accuracy": 0.21003155708312987, "num_tokens": 62589912.0, "step": 27330 }, { "entropy": 5.398430824279785, "epoch": 2.702155001977066, "grad_norm": 1.0078125, "learning_rate": 0.0004274987336913418, "loss": 5.0774, "mean_token_accuracy": 0.21025702804327012, "num_tokens": 62601571.0, "step": 27335 }, { "entropy": 5.444499397277832, "epoch": 2.702649268485567, "grad_norm": 1.078125, "learning_rate": 0.0004274727840798007, "loss": 5.0811, "mean_token_accuracy": 0.20036977976560594, "num_tokens": 62615006.0, "step": 27340 }, { "entropy": 5.524222040176392, "epoch": 2.703143534994069, "grad_norm": 0.99609375, "learning_rate": 0.00042744683071740524, "loss": 5.1513, "mean_token_accuracy": 0.2061564400792122, "num_tokens": 62626678.0, "step": 27345 }, { "entropy": 5.3929688930511475, "epoch": 2.70363780150257, "grad_norm": 1.0859375, "learning_rate": 0.0004274208736047944, "loss": 5.011, "mean_token_accuracy": 0.21418582797050476, "num_tokens": 62637819.0, "step": 27350 }, { "entropy": 5.354187965393066, "epoch": 2.7041320680110714, "grad_norm": 1.1171875, "learning_rate": 0.00042739491274260615, "loss": 4.9462, "mean_token_accuracy": 0.2202274441719055, "num_tokens": 62649705.0, "step": 27355 }, { "entropy": 5.379169130325318, "epoch": 2.704626334519573, "grad_norm": 1.0234375, "learning_rate": 0.00042736894813147954, "loss": 4.9763, "mean_token_accuracy": 0.20851344615221024, "num_tokens": 62661695.0, "step": 27360 }, { "entropy": 5.575306749343872, "epoch": 2.7051206010280744, "grad_norm": 1.0703125, "learning_rate": 0.00042734297977205325, "loss": 5.1858, "mean_token_accuracy": 0.19385486841201782, "num_tokens": 62674102.0, "step": 27365 }, { "entropy": 5.534251880645752, "epoch": 2.7056148675365757, "grad_norm": 1.015625, "learning_rate": 0.00042731700766496586, "loss": 5.121, "mean_token_accuracy": 0.2099744826555252, "num_tokens": 62685562.0, "step": 27370 }, { "entropy": 5.451116847991943, "epoch": 2.706109134045077, "grad_norm": 1.0859375, "learning_rate": 0.0004272910318108565, "loss": 5.06, "mean_token_accuracy": 0.20875783413648605, "num_tokens": 62696653.0, "step": 27375 }, { "entropy": 5.464148378372192, "epoch": 2.7066034005535786, "grad_norm": 1.015625, "learning_rate": 0.00042726505221036415, "loss": 5.0649, "mean_token_accuracy": 0.2096223697066307, "num_tokens": 62708760.0, "step": 27380 }, { "entropy": 5.5038727760314945, "epoch": 2.70709766706208, "grad_norm": 1.0703125, "learning_rate": 0.0004272390688641279, "loss": 5.0587, "mean_token_accuracy": 0.2037187173962593, "num_tokens": 62718548.0, "step": 27385 }, { "entropy": 5.4387062072753904, "epoch": 2.707591933570581, "grad_norm": 0.984375, "learning_rate": 0.00042721308177278696, "loss": 5.0368, "mean_token_accuracy": 0.20857273787260056, "num_tokens": 62730792.0, "step": 27390 }, { "entropy": 5.499172115325928, "epoch": 2.708086200079083, "grad_norm": 1.1484375, "learning_rate": 0.00042718709093698054, "loss": 5.0955, "mean_token_accuracy": 0.2078446701169014, "num_tokens": 62741528.0, "step": 27395 }, { "entropy": 5.4290628910064695, "epoch": 2.708580466587584, "grad_norm": 1.125, "learning_rate": 0.00042716109635734806, "loss": 5.0048, "mean_token_accuracy": 0.2135871633887291, "num_tokens": 62751650.0, "step": 27400 }, { "entropy": 5.441471338272095, "epoch": 2.7090747330960854, "grad_norm": 1.0703125, "learning_rate": 0.00042713509803452904, "loss": 5.048, "mean_token_accuracy": 0.21088856011629104, "num_tokens": 62763248.0, "step": 27405 }, { "entropy": 5.467253971099853, "epoch": 2.7095689996045866, "grad_norm": 1.0, "learning_rate": 0.00042710909596916307, "loss": 5.0747, "mean_token_accuracy": 0.20864329040050505, "num_tokens": 62775696.0, "step": 27410 }, { "entropy": 5.43760838508606, "epoch": 2.7100632661130883, "grad_norm": 0.98046875, "learning_rate": 0.00042708309016188965, "loss": 4.9803, "mean_token_accuracy": 0.2213533490896225, "num_tokens": 62786564.0, "step": 27415 }, { "entropy": 5.416453504562378, "epoch": 2.7105575326215896, "grad_norm": 1.0234375, "learning_rate": 0.0004270570806133486, "loss": 5.0772, "mean_token_accuracy": 0.2080509305000305, "num_tokens": 62799235.0, "step": 27420 }, { "entropy": 5.412689971923828, "epoch": 2.711051799130091, "grad_norm": 1.078125, "learning_rate": 0.0004270310673241799, "loss": 5.0303, "mean_token_accuracy": 0.2080045834183693, "num_tokens": 62809605.0, "step": 27425 }, { "entropy": 5.442185163497925, "epoch": 2.7115460656385926, "grad_norm": 1.0703125, "learning_rate": 0.0004270050502950233, "loss": 5.0367, "mean_token_accuracy": 0.2093183919787407, "num_tokens": 62820900.0, "step": 27430 }, { "entropy": 5.376932048797608, "epoch": 2.712040332147094, "grad_norm": 0.98828125, "learning_rate": 0.0004269790295265189, "loss": 4.9765, "mean_token_accuracy": 0.21994495391845703, "num_tokens": 62831761.0, "step": 27435 }, { "entropy": 5.526027488708496, "epoch": 2.712534598655595, "grad_norm": 1.140625, "learning_rate": 0.00042695300501930674, "loss": 5.1199, "mean_token_accuracy": 0.20050384551286698, "num_tokens": 62842512.0, "step": 27440 }, { "entropy": 5.463005018234253, "epoch": 2.7130288651640964, "grad_norm": 1.015625, "learning_rate": 0.0004269269767740271, "loss": 5.0904, "mean_token_accuracy": 0.20866186767816544, "num_tokens": 62853495.0, "step": 27445 }, { "entropy": 5.393105792999267, "epoch": 2.7135231316725976, "grad_norm": 1.0546875, "learning_rate": 0.00042690094479132023, "loss": 4.9651, "mean_token_accuracy": 0.22447549998760224, "num_tokens": 62864524.0, "step": 27450 }, { "entropy": 5.474991416931152, "epoch": 2.7140173981810993, "grad_norm": 1.109375, "learning_rate": 0.00042687490907182665, "loss": 5.1734, "mean_token_accuracy": 0.19940508008003235, "num_tokens": 62874522.0, "step": 27455 }, { "entropy": 5.479139280319214, "epoch": 2.7145116646896006, "grad_norm": 1.03125, "learning_rate": 0.00042684886961618664, "loss": 5.0437, "mean_token_accuracy": 0.20800797492265702, "num_tokens": 62885477.0, "step": 27460 }, { "entropy": 5.4705112934112545, "epoch": 2.715005931198102, "grad_norm": 1.0625, "learning_rate": 0.00042682282642504096, "loss": 5.079, "mean_token_accuracy": 0.21376798897981644, "num_tokens": 62896140.0, "step": 27465 }, { "entropy": 5.538098764419556, "epoch": 2.7155001977066036, "grad_norm": 1.1015625, "learning_rate": 0.00042679677949903017, "loss": 5.1384, "mean_token_accuracy": 0.2000359058380127, "num_tokens": 62907707.0, "step": 27470 }, { "entropy": 5.530870151519776, "epoch": 2.715994464215105, "grad_norm": 1.078125, "learning_rate": 0.00042677072883879496, "loss": 5.1663, "mean_token_accuracy": 0.20053110122680665, "num_tokens": 62919209.0, "step": 27475 }, { "entropy": 5.3769608497619625, "epoch": 2.716488730723606, "grad_norm": 0.98046875, "learning_rate": 0.00042674467444497644, "loss": 4.9039, "mean_token_accuracy": 0.22954662889242172, "num_tokens": 62931971.0, "step": 27480 }, { "entropy": 5.45075421333313, "epoch": 2.7169829972321073, "grad_norm": 1.0, "learning_rate": 0.0004267186163182153, "loss": 5.1173, "mean_token_accuracy": 0.20684964209794998, "num_tokens": 62944246.0, "step": 27485 }, { "entropy": 5.489340114593506, "epoch": 2.717477263740609, "grad_norm": 0.99609375, "learning_rate": 0.0004266925544591527, "loss": 5.1544, "mean_token_accuracy": 0.20345284044742584, "num_tokens": 62956973.0, "step": 27490 }, { "entropy": 5.530171728134155, "epoch": 2.7179715302491103, "grad_norm": 1.015625, "learning_rate": 0.0004266664888684297, "loss": 5.1356, "mean_token_accuracy": 0.1969824105501175, "num_tokens": 62968590.0, "step": 27495 }, { "entropy": 5.491403293609619, "epoch": 2.7184657967576116, "grad_norm": 1.0, "learning_rate": 0.00042664041954668753, "loss": 5.0693, "mean_token_accuracy": 0.21268833428621292, "num_tokens": 62980382.0, "step": 27500 }, { "entropy": 5.420768737792969, "epoch": 2.7189600632661133, "grad_norm": 1.046875, "learning_rate": 0.0004266143464945675, "loss": 5.0492, "mean_token_accuracy": 0.20863761156797409, "num_tokens": 62990432.0, "step": 27505 }, { "entropy": 5.466956424713135, "epoch": 2.7194543297746145, "grad_norm": 1.015625, "learning_rate": 0.00042658826971271103, "loss": 5.1129, "mean_token_accuracy": 0.20202534049749374, "num_tokens": 63003341.0, "step": 27510 }, { "entropy": 5.52876844406128, "epoch": 2.719948596283116, "grad_norm": 1.0078125, "learning_rate": 0.00042656218920175963, "loss": 5.1073, "mean_token_accuracy": 0.2001764729619026, "num_tokens": 63015527.0, "step": 27515 }, { "entropy": 5.497215366363525, "epoch": 2.720442862791617, "grad_norm": 1.0, "learning_rate": 0.000426536104962355, "loss": 5.0633, "mean_token_accuracy": 0.2107557475566864, "num_tokens": 63026995.0, "step": 27520 }, { "entropy": 5.41289439201355, "epoch": 2.7209371293001188, "grad_norm": 1.0, "learning_rate": 0.0004265100169951385, "loss": 4.9735, "mean_token_accuracy": 0.21499338746070862, "num_tokens": 63037156.0, "step": 27525 }, { "entropy": 5.4538195610046385, "epoch": 2.72143139580862, "grad_norm": 1.0234375, "learning_rate": 0.0004264839253007521, "loss": 5.0969, "mean_token_accuracy": 0.21453964114189147, "num_tokens": 63047513.0, "step": 27530 }, { "entropy": 5.44812273979187, "epoch": 2.7219256623171213, "grad_norm": 0.96875, "learning_rate": 0.00042645782987983763, "loss": 5.0133, "mean_token_accuracy": 0.20725918412208558, "num_tokens": 63059968.0, "step": 27535 }, { "entropy": 5.415910005569458, "epoch": 2.722419928825623, "grad_norm": 1.078125, "learning_rate": 0.00042643173073303713, "loss": 5.051, "mean_token_accuracy": 0.20527620911598204, "num_tokens": 63071514.0, "step": 27540 }, { "entropy": 5.516444492340088, "epoch": 2.7229141953341243, "grad_norm": 0.98046875, "learning_rate": 0.00042640562786099245, "loss": 5.079, "mean_token_accuracy": 0.2103402942419052, "num_tokens": 63082810.0, "step": 27545 }, { "entropy": 5.489263868331909, "epoch": 2.7234084618426255, "grad_norm": 1.0546875, "learning_rate": 0.00042637952126434593, "loss": 5.0581, "mean_token_accuracy": 0.21370716840028764, "num_tokens": 63093324.0, "step": 27550 }, { "entropy": 5.4249077320098875, "epoch": 2.723902728351127, "grad_norm": 1.1328125, "learning_rate": 0.0004263534109437397, "loss": 5.0982, "mean_token_accuracy": 0.2104247182607651, "num_tokens": 63104834.0, "step": 27555 }, { "entropy": 5.443571281433106, "epoch": 2.724396994859628, "grad_norm": 1.1484375, "learning_rate": 0.00042632729689981604, "loss": 5.0736, "mean_token_accuracy": 0.207258041203022, "num_tokens": 63116625.0, "step": 27560 }, { "entropy": 5.470551252365112, "epoch": 2.7248912613681298, "grad_norm": 1.0390625, "learning_rate": 0.00042630117913321734, "loss": 5.0632, "mean_token_accuracy": 0.20198529958724976, "num_tokens": 63127616.0, "step": 27565 }, { "entropy": 5.384239768981933, "epoch": 2.725385527876631, "grad_norm": 0.99609375, "learning_rate": 0.00042627505764458626, "loss": 5.0587, "mean_token_accuracy": 0.21460792124271394, "num_tokens": 63140546.0, "step": 27570 }, { "entropy": 5.411870956420898, "epoch": 2.7258797943851327, "grad_norm": 1.0546875, "learning_rate": 0.0004262489324345652, "loss": 4.9648, "mean_token_accuracy": 0.2166174441576004, "num_tokens": 63151693.0, "step": 27575 }, { "entropy": 5.448649835586548, "epoch": 2.726374060893634, "grad_norm": 1.125, "learning_rate": 0.0004262228035037971, "loss": 4.9926, "mean_token_accuracy": 0.20525157898664476, "num_tokens": 63162569.0, "step": 27580 }, { "entropy": 5.324292802810669, "epoch": 2.7268683274021353, "grad_norm": 1.046875, "learning_rate": 0.0004261966708529244, "loss": 4.9166, "mean_token_accuracy": 0.22584639340639115, "num_tokens": 63174073.0, "step": 27585 }, { "entropy": 5.462039232254028, "epoch": 2.7273625939106365, "grad_norm": 1.0625, "learning_rate": 0.00042617053448259026, "loss": 5.0254, "mean_token_accuracy": 0.21396956145763396, "num_tokens": 63184752.0, "step": 27590 }, { "entropy": 5.391912269592285, "epoch": 2.7278568604191378, "grad_norm": 1.0234375, "learning_rate": 0.0004261443943934375, "loss": 4.9913, "mean_token_accuracy": 0.21298307776451111, "num_tokens": 63197682.0, "step": 27595 }, { "entropy": 5.519440174102783, "epoch": 2.7283511269276395, "grad_norm": 1.2109375, "learning_rate": 0.00042611825058610917, "loss": 5.1228, "mean_token_accuracy": 0.19199850857257844, "num_tokens": 63208868.0, "step": 27600 }, { "entropy": 5.4924345970153805, "epoch": 2.7288453934361407, "grad_norm": 1.03125, "learning_rate": 0.0004260921030612483, "loss": 5.153, "mean_token_accuracy": 0.20959761440753938, "num_tokens": 63220418.0, "step": 27605 }, { "entropy": 5.45736026763916, "epoch": 2.729339659944642, "grad_norm": 0.94921875, "learning_rate": 0.0004260659518194985, "loss": 5.0231, "mean_token_accuracy": 0.21358337253332138, "num_tokens": 63231431.0, "step": 27610 }, { "entropy": 5.424257850646972, "epoch": 2.7298339264531437, "grad_norm": 0.96875, "learning_rate": 0.0004260397968615027, "loss": 5.0552, "mean_token_accuracy": 0.2042704552412033, "num_tokens": 63243994.0, "step": 27615 }, { "entropy": 5.3735960006713865, "epoch": 2.730328192961645, "grad_norm": 1.0859375, "learning_rate": 0.0004260136381879045, "loss": 4.9751, "mean_token_accuracy": 0.22144197076559066, "num_tokens": 63255414.0, "step": 27620 }, { "entropy": 5.493383836746216, "epoch": 2.7308224594701462, "grad_norm": 1.0546875, "learning_rate": 0.00042598747579934736, "loss": 5.156, "mean_token_accuracy": 0.20417538583278655, "num_tokens": 63266289.0, "step": 27625 }, { "entropy": 5.448935508728027, "epoch": 2.7313167259786475, "grad_norm": 1.0625, "learning_rate": 0.00042596130969647494, "loss": 4.9666, "mean_token_accuracy": 0.21250412315130235, "num_tokens": 63276497.0, "step": 27630 }, { "entropy": 5.43988184928894, "epoch": 2.731810992487149, "grad_norm": 1.046875, "learning_rate": 0.0004259351398799308, "loss": 5.0213, "mean_token_accuracy": 0.21391626596450805, "num_tokens": 63286892.0, "step": 27635 }, { "entropy": 5.471703815460205, "epoch": 2.7323052589956505, "grad_norm": 0.9609375, "learning_rate": 0.00042590896635035885, "loss": 5.0975, "mean_token_accuracy": 0.2043243631720543, "num_tokens": 63299978.0, "step": 27640 }, { "entropy": 5.45467095375061, "epoch": 2.7327995255041517, "grad_norm": 1.203125, "learning_rate": 0.00042588278910840296, "loss": 5.0739, "mean_token_accuracy": 0.2128247633576393, "num_tokens": 63311916.0, "step": 27645 }, { "entropy": 5.445849752426147, "epoch": 2.7332937920126534, "grad_norm": 1.078125, "learning_rate": 0.000425856608154707, "loss": 5.027, "mean_token_accuracy": 0.20853590071201325, "num_tokens": 63322994.0, "step": 27650 }, { "entropy": 5.524616289138794, "epoch": 2.7337880585211547, "grad_norm": 1.0078125, "learning_rate": 0.0004258304234899151, "loss": 5.108, "mean_token_accuracy": 0.20361389517784118, "num_tokens": 63334708.0, "step": 27655 }, { "entropy": 5.420170688629151, "epoch": 2.734282325029656, "grad_norm": 1.046875, "learning_rate": 0.0004258042351146713, "loss": 5.0071, "mean_token_accuracy": 0.20895163118839263, "num_tokens": 63346823.0, "step": 27660 }, { "entropy": 5.48543791770935, "epoch": 2.734776591538157, "grad_norm": 1.125, "learning_rate": 0.00042577804302961994, "loss": 5.056, "mean_token_accuracy": 0.20693513453006745, "num_tokens": 63357677.0, "step": 27665 }, { "entropy": 5.35520920753479, "epoch": 2.7352708580466585, "grad_norm": 1.0078125, "learning_rate": 0.00042575184723540546, "loss": 4.9336, "mean_token_accuracy": 0.21335779279470443, "num_tokens": 63369685.0, "step": 27670 }, { "entropy": 5.487816953659058, "epoch": 2.73576512455516, "grad_norm": 1.03125, "learning_rate": 0.00042572564773267203, "loss": 5.0938, "mean_token_accuracy": 0.20345963537693024, "num_tokens": 63380340.0, "step": 27675 }, { "entropy": 5.438711023330688, "epoch": 2.7362593910636615, "grad_norm": 1.03125, "learning_rate": 0.0004256994445220643, "loss": 5.0813, "mean_token_accuracy": 0.21313631683588027, "num_tokens": 63390868.0, "step": 27680 }, { "entropy": 5.439948415756225, "epoch": 2.736753657572163, "grad_norm": 1.40625, "learning_rate": 0.0004256732376042269, "loss": 5.0371, "mean_token_accuracy": 0.21079247295856476, "num_tokens": 63401669.0, "step": 27685 }, { "entropy": 5.436453533172608, "epoch": 2.7372479240806644, "grad_norm": 0.9765625, "learning_rate": 0.0004256470269798044, "loss": 5.0228, "mean_token_accuracy": 0.21370188444852828, "num_tokens": 63412593.0, "step": 27690 }, { "entropy": 5.449593734741211, "epoch": 2.7377421905891657, "grad_norm": 1.078125, "learning_rate": 0.00042562081264944175, "loss": 5.0853, "mean_token_accuracy": 0.21506880670785905, "num_tokens": 63423952.0, "step": 27695 }, { "entropy": 5.484494066238403, "epoch": 2.738236457097667, "grad_norm": 1.03125, "learning_rate": 0.00042559459461378367, "loss": 5.0926, "mean_token_accuracy": 0.20260501205921172, "num_tokens": 63435152.0, "step": 27700 }, { "entropy": 5.40783724784851, "epoch": 2.738730723606168, "grad_norm": 1.0625, "learning_rate": 0.00042556837287347524, "loss": 4.9209, "mean_token_accuracy": 0.22029463052749634, "num_tokens": 63445977.0, "step": 27705 }, { "entropy": 5.444705581665039, "epoch": 2.73922499011467, "grad_norm": 1.0078125, "learning_rate": 0.00042554214742916154, "loss": 5.1358, "mean_token_accuracy": 0.20119498819112777, "num_tokens": 63456790.0, "step": 27710 }, { "entropy": 5.448411178588867, "epoch": 2.739719256623171, "grad_norm": 1.0859375, "learning_rate": 0.0004255159182814876, "loss": 5.0343, "mean_token_accuracy": 0.2181098908185959, "num_tokens": 63467775.0, "step": 27715 }, { "entropy": 5.518222951889038, "epoch": 2.7402135231316724, "grad_norm": 1.0625, "learning_rate": 0.0004254896854310987, "loss": 5.1537, "mean_token_accuracy": 0.19921877533197402, "num_tokens": 63479445.0, "step": 27720 }, { "entropy": 5.510286331176758, "epoch": 2.740707789640174, "grad_norm": 1.2265625, "learning_rate": 0.0004254634488786402, "loss": 5.143, "mean_token_accuracy": 0.1973639115691185, "num_tokens": 63489938.0, "step": 27725 }, { "entropy": 5.4932373046875, "epoch": 2.7412020561486754, "grad_norm": 1.59375, "learning_rate": 0.00042543720862475747, "loss": 5.0473, "mean_token_accuracy": 0.21136311441659927, "num_tokens": 63501509.0, "step": 27730 }, { "entropy": 5.411088848114014, "epoch": 2.7416963226571767, "grad_norm": 1.0390625, "learning_rate": 0.00042541096467009617, "loss": 5.0005, "mean_token_accuracy": 0.21368778347969056, "num_tokens": 63512222.0, "step": 27735 }, { "entropy": 5.449278211593628, "epoch": 2.742190589165678, "grad_norm": 1.1328125, "learning_rate": 0.00042538471701530174, "loss": 5.155, "mean_token_accuracy": 0.20174836069345475, "num_tokens": 63524841.0, "step": 27740 }, { "entropy": 5.489743947982788, "epoch": 2.7426848556741796, "grad_norm": 1.1015625, "learning_rate": 0.00042535846566102, "loss": 5.026, "mean_token_accuracy": 0.20561160296201705, "num_tokens": 63536167.0, "step": 27745 }, { "entropy": 5.453299570083618, "epoch": 2.743179122182681, "grad_norm": 1.0390625, "learning_rate": 0.0004253322106078966, "loss": 5.0374, "mean_token_accuracy": 0.2143303319811821, "num_tokens": 63547774.0, "step": 27750 }, { "entropy": 5.490023469924926, "epoch": 2.743673388691182, "grad_norm": 1.2421875, "learning_rate": 0.00042530595185657756, "loss": 5.1652, "mean_token_accuracy": 0.20143587440252303, "num_tokens": 63560712.0, "step": 27755 }, { "entropy": 5.472793054580689, "epoch": 2.744167655199684, "grad_norm": 1.0546875, "learning_rate": 0.00042527968940770874, "loss": 5.1069, "mean_token_accuracy": 0.2109362468123436, "num_tokens": 63572587.0, "step": 27760 }, { "entropy": 5.519396781921387, "epoch": 2.744661921708185, "grad_norm": 0.99609375, "learning_rate": 0.00042525342326193624, "loss": 5.1323, "mean_token_accuracy": 0.20220906138420106, "num_tokens": 63584694.0, "step": 27765 }, { "entropy": 5.463712692260742, "epoch": 2.7451561882166864, "grad_norm": 0.9140625, "learning_rate": 0.00042522715341990625, "loss": 5.0849, "mean_token_accuracy": 0.20479255467653273, "num_tokens": 63597894.0, "step": 27770 }, { "entropy": 5.4457048892974855, "epoch": 2.7456504547251877, "grad_norm": 1.0625, "learning_rate": 0.000425200879882265, "loss": 5.1013, "mean_token_accuracy": 0.2055336356163025, "num_tokens": 63608873.0, "step": 27775 }, { "entropy": 5.531204605102539, "epoch": 2.7461447212336894, "grad_norm": 1.09375, "learning_rate": 0.0004251746026496588, "loss": 5.1105, "mean_token_accuracy": 0.2069559320807457, "num_tokens": 63621013.0, "step": 27780 }, { "entropy": 5.52852611541748, "epoch": 2.7466389877421906, "grad_norm": 1.03125, "learning_rate": 0.00042514832172273404, "loss": 5.1722, "mean_token_accuracy": 0.19898469895124435, "num_tokens": 63633438.0, "step": 27785 }, { "entropy": 5.460723781585694, "epoch": 2.747133254250692, "grad_norm": 1.15625, "learning_rate": 0.00042512203710213733, "loss": 4.9892, "mean_token_accuracy": 0.20972118079662322, "num_tokens": 63645032.0, "step": 27790 }, { "entropy": 5.425799751281739, "epoch": 2.7476275207591936, "grad_norm": 1.0078125, "learning_rate": 0.0004250957487885151, "loss": 5.0036, "mean_token_accuracy": 0.21543105244636535, "num_tokens": 63657747.0, "step": 27795 }, { "entropy": 5.412010526657104, "epoch": 2.748121787267695, "grad_norm": 1.0703125, "learning_rate": 0.0004250694567825143, "loss": 5.0146, "mean_token_accuracy": 0.20998825132846832, "num_tokens": 63669472.0, "step": 27800 }, { "entropy": 5.424338054656983, "epoch": 2.748616053776196, "grad_norm": 1.140625, "learning_rate": 0.00042504316108478153, "loss": 5.0666, "mean_token_accuracy": 0.21615904718637466, "num_tokens": 63681498.0, "step": 27805 }, { "entropy": 5.349238491058349, "epoch": 2.7491103202846974, "grad_norm": 1.0703125, "learning_rate": 0.00042501686169596367, "loss": 4.9549, "mean_token_accuracy": 0.22451326996088028, "num_tokens": 63692628.0, "step": 27810 }, { "entropy": 5.458430385589599, "epoch": 2.7496045867931986, "grad_norm": 1.1015625, "learning_rate": 0.00042499055861670783, "loss": 5.0326, "mean_token_accuracy": 0.20796682238578795, "num_tokens": 63704732.0, "step": 27815 }, { "entropy": 5.5318440914154055, "epoch": 2.7500988533017003, "grad_norm": 1.0625, "learning_rate": 0.0004249642518476609, "loss": 5.1085, "mean_token_accuracy": 0.20424683392047882, "num_tokens": 63716346.0, "step": 27820 }, { "entropy": 5.473616027832032, "epoch": 2.7505931198102016, "grad_norm": 1.0234375, "learning_rate": 0.00042493794138947013, "loss": 5.0789, "mean_token_accuracy": 0.2096447989344597, "num_tokens": 63728320.0, "step": 27825 }, { "entropy": 5.426529121398926, "epoch": 2.7510873863187033, "grad_norm": 1.015625, "learning_rate": 0.00042491162724278276, "loss": 5.112, "mean_token_accuracy": 0.20659882873296737, "num_tokens": 63740211.0, "step": 27830 }, { "entropy": 5.430647134780884, "epoch": 2.7515816528272046, "grad_norm": 1.078125, "learning_rate": 0.00042488530940824616, "loss": 4.9574, "mean_token_accuracy": 0.2154908522963524, "num_tokens": 63751706.0, "step": 27835 }, { "entropy": 5.458653593063355, "epoch": 2.752075919335706, "grad_norm": 1.0859375, "learning_rate": 0.0004248589878865076, "loss": 5.076, "mean_token_accuracy": 0.20776806771755219, "num_tokens": 63764045.0, "step": 27840 }, { "entropy": 5.407937383651733, "epoch": 2.752570185844207, "grad_norm": 1.0859375, "learning_rate": 0.0004248326626782147, "loss": 4.9849, "mean_token_accuracy": 0.21759278923273087, "num_tokens": 63774148.0, "step": 27845 }, { "entropy": 5.450107145309448, "epoch": 2.7530644523527084, "grad_norm": 1.0703125, "learning_rate": 0.00042480633378401503, "loss": 5.008, "mean_token_accuracy": 0.21652012914419175, "num_tokens": 63785202.0, "step": 27850 }, { "entropy": 5.486587619781494, "epoch": 2.75355871886121, "grad_norm": 1.0546875, "learning_rate": 0.0004247800012045564, "loss": 5.0352, "mean_token_accuracy": 0.20686526000499725, "num_tokens": 63796990.0, "step": 27855 }, { "entropy": 5.385894393920898, "epoch": 2.7540529853697113, "grad_norm": 1.0546875, "learning_rate": 0.00042475366494048645, "loss": 4.9545, "mean_token_accuracy": 0.22018436789512635, "num_tokens": 63807201.0, "step": 27860 }, { "entropy": 5.407347297668457, "epoch": 2.7545472518782126, "grad_norm": 1.0234375, "learning_rate": 0.00042472732499245316, "loss": 5.0352, "mean_token_accuracy": 0.2168760195374489, "num_tokens": 63818805.0, "step": 27865 }, { "entropy": 5.438308429718018, "epoch": 2.7550415183867143, "grad_norm": 1.046875, "learning_rate": 0.00042470098136110444, "loss": 4.987, "mean_token_accuracy": 0.21575102359056472, "num_tokens": 63829444.0, "step": 27870 }, { "entropy": 5.389496183395385, "epoch": 2.7555357848952156, "grad_norm": 1.171875, "learning_rate": 0.00042467463404708826, "loss": 5.0168, "mean_token_accuracy": 0.21383088678121567, "num_tokens": 63840868.0, "step": 27875 }, { "entropy": 5.41587986946106, "epoch": 2.756030051403717, "grad_norm": 1.0234375, "learning_rate": 0.00042464828305105283, "loss": 5.0487, "mean_token_accuracy": 0.2067001923918724, "num_tokens": 63851992.0, "step": 27880 }, { "entropy": 5.463610696792602, "epoch": 2.756524317912218, "grad_norm": 1.046875, "learning_rate": 0.00042462192837364654, "loss": 5.0521, "mean_token_accuracy": 0.20601622462272645, "num_tokens": 63863362.0, "step": 27885 }, { "entropy": 5.4817568302154545, "epoch": 2.75701858442072, "grad_norm": 0.93359375, "learning_rate": 0.00042459557001551764, "loss": 5.119, "mean_token_accuracy": 0.20808735340833664, "num_tokens": 63875712.0, "step": 27890 }, { "entropy": 5.502285003662109, "epoch": 2.757512850929221, "grad_norm": 1.0390625, "learning_rate": 0.00042456920797731443, "loss": 5.021, "mean_token_accuracy": 0.2129630535840988, "num_tokens": 63887253.0, "step": 27895 }, { "entropy": 5.50234088897705, "epoch": 2.7580071174377223, "grad_norm": 1.1328125, "learning_rate": 0.00042454284225968553, "loss": 5.138, "mean_token_accuracy": 0.20281088948249817, "num_tokens": 63898328.0, "step": 27900 }, { "entropy": 5.396198081970215, "epoch": 2.758501383946224, "grad_norm": 1.03125, "learning_rate": 0.0004245164728632795, "loss": 4.9217, "mean_token_accuracy": 0.22561803013086318, "num_tokens": 63908080.0, "step": 27905 }, { "entropy": 5.4357017993927, "epoch": 2.7589956504547253, "grad_norm": 1.0859375, "learning_rate": 0.000424490099788745, "loss": 5.1029, "mean_token_accuracy": 0.20584024488925934, "num_tokens": 63918860.0, "step": 27910 }, { "entropy": 5.459130859375, "epoch": 2.7594899169632265, "grad_norm": 1.0703125, "learning_rate": 0.0004244637230367309, "loss": 5.0101, "mean_token_accuracy": 0.21050338745117186, "num_tokens": 63929601.0, "step": 27915 }, { "entropy": 5.456412220001221, "epoch": 2.759984183471728, "grad_norm": 1.0859375, "learning_rate": 0.000424437342607886, "loss": 5.0588, "mean_token_accuracy": 0.21508972048759462, "num_tokens": 63941170.0, "step": 27920 }, { "entropy": 5.392394924163819, "epoch": 2.760478449980229, "grad_norm": 1.1484375, "learning_rate": 0.0004244109585028593, "loss": 5.0093, "mean_token_accuracy": 0.2207762598991394, "num_tokens": 63951907.0, "step": 27925 }, { "entropy": 5.433092880249023, "epoch": 2.7609727164887308, "grad_norm": 1.0390625, "learning_rate": 0.00042438457072229986, "loss": 5.0568, "mean_token_accuracy": 0.2078884318470955, "num_tokens": 63963140.0, "step": 27930 }, { "entropy": 5.4470666408538815, "epoch": 2.761466982997232, "grad_norm": 1.0, "learning_rate": 0.00042435817926685684, "loss": 5.0383, "mean_token_accuracy": 0.20354804992675782, "num_tokens": 63974445.0, "step": 27935 }, { "entropy": 5.440000295639038, "epoch": 2.7619612495057337, "grad_norm": 1.0625, "learning_rate": 0.0004243317841371793, "loss": 4.999, "mean_token_accuracy": 0.21949042826890947, "num_tokens": 63985463.0, "step": 27940 }, { "entropy": 5.453473520278931, "epoch": 2.762455516014235, "grad_norm": 1.09375, "learning_rate": 0.00042430538533391683, "loss": 5.0757, "mean_token_accuracy": 0.20680534690618516, "num_tokens": 63997120.0, "step": 27945 }, { "entropy": 5.424569368362427, "epoch": 2.7629497825227363, "grad_norm": 1.046875, "learning_rate": 0.00042427898285771865, "loss": 5.0475, "mean_token_accuracy": 0.2080203875899315, "num_tokens": 64009195.0, "step": 27950 }, { "entropy": 5.492969036102295, "epoch": 2.7634440490312375, "grad_norm": 1.109375, "learning_rate": 0.0004242525767092344, "loss": 5.0701, "mean_token_accuracy": 0.21110433489084243, "num_tokens": 64020915.0, "step": 27955 }, { "entropy": 5.420156574249267, "epoch": 2.763938315539739, "grad_norm": 1.078125, "learning_rate": 0.0004242261668891135, "loss": 5.0045, "mean_token_accuracy": 0.21134259253740312, "num_tokens": 64031187.0, "step": 27960 }, { "entropy": 5.415789651870727, "epoch": 2.7644325820482405, "grad_norm": 1.0546875, "learning_rate": 0.0004241997533980059, "loss": 5.0574, "mean_token_accuracy": 0.2055559501051903, "num_tokens": 64043045.0, "step": 27965 }, { "entropy": 5.578073787689209, "epoch": 2.7649268485567418, "grad_norm": 1.125, "learning_rate": 0.00042417333623656113, "loss": 5.1845, "mean_token_accuracy": 0.20065457373857498, "num_tokens": 64054030.0, "step": 27970 }, { "entropy": 5.520448637008667, "epoch": 2.765421115065243, "grad_norm": 1.1015625, "learning_rate": 0.00042414691540542917, "loss": 5.0666, "mean_token_accuracy": 0.2161511093378067, "num_tokens": 64064179.0, "step": 27975 }, { "entropy": 5.50725417137146, "epoch": 2.7659153815737447, "grad_norm": 1.0234375, "learning_rate": 0.00042412049090525996, "loss": 5.1302, "mean_token_accuracy": 0.19654364734888077, "num_tokens": 64075812.0, "step": 27980 }, { "entropy": 5.406628799438477, "epoch": 2.766409648082246, "grad_norm": 1.0703125, "learning_rate": 0.0004240940627367035, "loss": 5.0437, "mean_token_accuracy": 0.21193777769804, "num_tokens": 64086848.0, "step": 27985 }, { "entropy": 5.450288724899292, "epoch": 2.7669039145907472, "grad_norm": 1.09375, "learning_rate": 0.00042406763090040996, "loss": 5.0645, "mean_token_accuracy": 0.20912527590990065, "num_tokens": 64098879.0, "step": 27990 }, { "entropy": 5.4657680034637455, "epoch": 2.7673981810992485, "grad_norm": 1.0390625, "learning_rate": 0.00042404119539702956, "loss": 5.0815, "mean_token_accuracy": 0.20548973828554154, "num_tokens": 64109946.0, "step": 27995 }, { "entropy": 5.519073534011841, "epoch": 2.76789244760775, "grad_norm": 0.99609375, "learning_rate": 0.00042401475622721264, "loss": 5.1419, "mean_token_accuracy": 0.20594579875469207, "num_tokens": 64122219.0, "step": 28000 }, { "entropy": 5.466803693771363, "epoch": 2.7683867141162515, "grad_norm": 1.1484375, "learning_rate": 0.0004239883133916097, "loss": 5.0273, "mean_token_accuracy": 0.21092600524425506, "num_tokens": 64132950.0, "step": 28005 }, { "entropy": 5.470190191268921, "epoch": 2.7688809806247527, "grad_norm": 1.078125, "learning_rate": 0.0004239618668908711, "loss": 5.1212, "mean_token_accuracy": 0.20221826583147048, "num_tokens": 64145060.0, "step": 28010 }, { "entropy": 5.5050252914428714, "epoch": 2.7693752471332544, "grad_norm": 1.3125, "learning_rate": 0.0004239354167256474, "loss": 5.1326, "mean_token_accuracy": 0.20182606130838393, "num_tokens": 64157294.0, "step": 28015 }, { "entropy": 5.492866945266724, "epoch": 2.7698695136417557, "grad_norm": 1.0, "learning_rate": 0.00042390896289658936, "loss": 5.0841, "mean_token_accuracy": 0.20653266608715057, "num_tokens": 64169001.0, "step": 28020 }, { "entropy": 5.3837135314941404, "epoch": 2.770363780150257, "grad_norm": 1.0078125, "learning_rate": 0.0004238825054043477, "loss": 5.0074, "mean_token_accuracy": 0.21395400762557984, "num_tokens": 64180525.0, "step": 28025 }, { "entropy": 5.419885635375977, "epoch": 2.7708580466587582, "grad_norm": 0.97265625, "learning_rate": 0.00042385604424957337, "loss": 4.9943, "mean_token_accuracy": 0.21156293600797654, "num_tokens": 64192398.0, "step": 28030 }, { "entropy": 5.436616373062134, "epoch": 2.77135231316726, "grad_norm": 1.0703125, "learning_rate": 0.0004238295794329172, "loss": 5.0749, "mean_token_accuracy": 0.20443775355815888, "num_tokens": 64203485.0, "step": 28035 }, { "entropy": 5.485711193084716, "epoch": 2.771846579675761, "grad_norm": 1.0625, "learning_rate": 0.00042380311095503037, "loss": 5.0232, "mean_token_accuracy": 0.21363509446382523, "num_tokens": 64214226.0, "step": 28040 }, { "entropy": 5.429607725143432, "epoch": 2.7723408461842625, "grad_norm": 1.0, "learning_rate": 0.00042377663881656394, "loss": 4.9907, "mean_token_accuracy": 0.21144504398107528, "num_tokens": 64225873.0, "step": 28045 }, { "entropy": 5.569371891021729, "epoch": 2.772835112692764, "grad_norm": 1.2265625, "learning_rate": 0.00042375016301816903, "loss": 5.2284, "mean_token_accuracy": 0.19292194098234178, "num_tokens": 64238023.0, "step": 28050 }, { "entropy": 5.4937074184417725, "epoch": 2.7733293792012654, "grad_norm": 1.09375, "learning_rate": 0.0004237236835604971, "loss": 5.0886, "mean_token_accuracy": 0.19927995949983596, "num_tokens": 64248533.0, "step": 28055 }, { "entropy": 5.499326610565186, "epoch": 2.7738236457097667, "grad_norm": 0.9921875, "learning_rate": 0.0004236972004441994, "loss": 5.1322, "mean_token_accuracy": 0.20386985093355178, "num_tokens": 64260539.0, "step": 28060 }, { "entropy": 5.440857410430908, "epoch": 2.774317912218268, "grad_norm": 1.0859375, "learning_rate": 0.00042367071366992753, "loss": 5.0397, "mean_token_accuracy": 0.20603834241628646, "num_tokens": 64271280.0, "step": 28065 }, { "entropy": 5.453833103179932, "epoch": 2.774812178726769, "grad_norm": 1.03125, "learning_rate": 0.00042364422323833313, "loss": 5.0905, "mean_token_accuracy": 0.20637732446193696, "num_tokens": 64282728.0, "step": 28070 }, { "entropy": 5.470165538787842, "epoch": 2.775306445235271, "grad_norm": 1.0078125, "learning_rate": 0.00042361772915006763, "loss": 5.0852, "mean_token_accuracy": 0.20544882863759995, "num_tokens": 64294728.0, "step": 28075 }, { "entropy": 5.452522945404053, "epoch": 2.775800711743772, "grad_norm": 1.078125, "learning_rate": 0.0004235912314057831, "loss": 5.1287, "mean_token_accuracy": 0.20635941177606582, "num_tokens": 64305873.0, "step": 28080 }, { "entropy": 5.401246690750122, "epoch": 2.776294978252274, "grad_norm": 0.96484375, "learning_rate": 0.0004235647300061311, "loss": 4.9733, "mean_token_accuracy": 0.21105220168828964, "num_tokens": 64318892.0, "step": 28085 }, { "entropy": 5.392233037948609, "epoch": 2.776789244760775, "grad_norm": 0.98046875, "learning_rate": 0.0004235382249517637, "loss": 4.9692, "mean_token_accuracy": 0.21376692056655883, "num_tokens": 64328918.0, "step": 28090 }, { "entropy": 5.383206176757812, "epoch": 2.7772835112692764, "grad_norm": 1.046875, "learning_rate": 0.00042351171624333293, "loss": 5.0177, "mean_token_accuracy": 0.21142184734344482, "num_tokens": 64338670.0, "step": 28095 }, { "entropy": 5.45309591293335, "epoch": 2.7777777777777777, "grad_norm": 0.9375, "learning_rate": 0.00042348520388149093, "loss": 5.0173, "mean_token_accuracy": 0.20620488822460176, "num_tokens": 64350503.0, "step": 28100 }, { "entropy": 5.422789144515991, "epoch": 2.778272044286279, "grad_norm": 1.1640625, "learning_rate": 0.0004234586878668899, "loss": 4.9506, "mean_token_accuracy": 0.22056611776351928, "num_tokens": 64361176.0, "step": 28105 }, { "entropy": 5.434823989868164, "epoch": 2.7787663107947806, "grad_norm": 1.0390625, "learning_rate": 0.0004234321682001821, "loss": 5.0892, "mean_token_accuracy": 0.20408917665481568, "num_tokens": 64373397.0, "step": 28110 }, { "entropy": 5.379253149032593, "epoch": 2.779260577303282, "grad_norm": 1.1171875, "learning_rate": 0.00042340564488201987, "loss": 5.0072, "mean_token_accuracy": 0.20698851495981216, "num_tokens": 64384910.0, "step": 28115 }, { "entropy": 5.369167327880859, "epoch": 2.779754843811783, "grad_norm": 1.015625, "learning_rate": 0.0004233791179130559, "loss": 5.0321, "mean_token_accuracy": 0.20789069086313247, "num_tokens": 64396787.0, "step": 28120 }, { "entropy": 5.438919878005981, "epoch": 2.780249110320285, "grad_norm": 1.046875, "learning_rate": 0.0004233525872939424, "loss": 5.0751, "mean_token_accuracy": 0.20410680025815964, "num_tokens": 64407911.0, "step": 28125 }, { "entropy": 5.572028493881225, "epoch": 2.780743376828786, "grad_norm": 1.1015625, "learning_rate": 0.00042332605302533246, "loss": 5.1452, "mean_token_accuracy": 0.20519044548273085, "num_tokens": 64420697.0, "step": 28130 }, { "entropy": 5.446814012527466, "epoch": 2.7812376433372874, "grad_norm": 0.91796875, "learning_rate": 0.00042329951510787847, "loss": 4.9825, "mean_token_accuracy": 0.21768329441547393, "num_tokens": 64431675.0, "step": 28135 }, { "entropy": 5.445724821090698, "epoch": 2.7817319098457887, "grad_norm": 0.93359375, "learning_rate": 0.00042327297354223346, "loss": 5.0513, "mean_token_accuracy": 0.21032214760780335, "num_tokens": 64443398.0, "step": 28140 }, { "entropy": 5.4173455238342285, "epoch": 2.7822261763542904, "grad_norm": 1.0859375, "learning_rate": 0.0004232464283290502, "loss": 5.0681, "mean_token_accuracy": 0.2088153064250946, "num_tokens": 64455306.0, "step": 28145 }, { "entropy": 5.407170963287354, "epoch": 2.7827204428627916, "grad_norm": 1.078125, "learning_rate": 0.0004232198794689819, "loss": 5.0175, "mean_token_accuracy": 0.22061744928359986, "num_tokens": 64466475.0, "step": 28150 }, { "entropy": 5.40111517906189, "epoch": 2.783214709371293, "grad_norm": 1.125, "learning_rate": 0.0004231933269626815, "loss": 5.0219, "mean_token_accuracy": 0.21246253848075866, "num_tokens": 64476729.0, "step": 28155 }, { "entropy": 5.528533267974853, "epoch": 2.7837089758797946, "grad_norm": 1.0546875, "learning_rate": 0.0004231667708108024, "loss": 5.1127, "mean_token_accuracy": 0.20727159976959228, "num_tokens": 64489403.0, "step": 28160 }, { "entropy": 5.445553827285766, "epoch": 2.784203242388296, "grad_norm": 0.984375, "learning_rate": 0.00042314021101399763, "loss": 5.0273, "mean_token_accuracy": 0.22125994861125947, "num_tokens": 64501000.0, "step": 28165 }, { "entropy": 5.408338499069214, "epoch": 2.784697508896797, "grad_norm": 0.98046875, "learning_rate": 0.0004231136475729207, "loss": 5.0032, "mean_token_accuracy": 0.21040546000003815, "num_tokens": 64513504.0, "step": 28170 }, { "entropy": 5.378835201263428, "epoch": 2.7851917754052984, "grad_norm": 1.109375, "learning_rate": 0.00042308708048822513, "loss": 4.9783, "mean_token_accuracy": 0.21552161872386932, "num_tokens": 64525522.0, "step": 28175 }, { "entropy": 5.48802227973938, "epoch": 2.7856860419137996, "grad_norm": 1.03125, "learning_rate": 0.0004230605097605644, "loss": 5.096, "mean_token_accuracy": 0.20565718710422515, "num_tokens": 64537261.0, "step": 28180 }, { "entropy": 5.456069278717041, "epoch": 2.7861803084223014, "grad_norm": 0.99609375, "learning_rate": 0.00042303393539059204, "loss": 4.9789, "mean_token_accuracy": 0.21787464916706084, "num_tokens": 64548527.0, "step": 28185 }, { "entropy": 5.332040166854858, "epoch": 2.7866745749308026, "grad_norm": 1.0078125, "learning_rate": 0.000423007357378962, "loss": 4.9562, "mean_token_accuracy": 0.22125230282545089, "num_tokens": 64560196.0, "step": 28190 }, { "entropy": 5.49363431930542, "epoch": 2.7871688414393043, "grad_norm": 1.1171875, "learning_rate": 0.000422980775726328, "loss": 5.105, "mean_token_accuracy": 0.21046043336391448, "num_tokens": 64570828.0, "step": 28195 }, { "entropy": 5.516827487945557, "epoch": 2.7876631079478056, "grad_norm": 1.0859375, "learning_rate": 0.0004229541904333439, "loss": 5.1219, "mean_token_accuracy": 0.2023715227842331, "num_tokens": 64581845.0, "step": 28200 }, { "entropy": 5.458334732055664, "epoch": 2.788157374456307, "grad_norm": 1.0625, "learning_rate": 0.00042292760150066386, "loss": 5.0773, "mean_token_accuracy": 0.20569535344839096, "num_tokens": 64593105.0, "step": 28205 }, { "entropy": 5.440145874023438, "epoch": 2.788651640964808, "grad_norm": 1.03125, "learning_rate": 0.00042290100892894184, "loss": 5.0509, "mean_token_accuracy": 0.2111356034874916, "num_tokens": 64605075.0, "step": 28210 }, { "entropy": 5.420182895660401, "epoch": 2.7891459074733094, "grad_norm": 1.015625, "learning_rate": 0.00042287441271883204, "loss": 5.0719, "mean_token_accuracy": 0.2085297644138336, "num_tokens": 64617091.0, "step": 28215 }, { "entropy": 5.461166000366211, "epoch": 2.789640173981811, "grad_norm": 1.0625, "learning_rate": 0.0004228478128709888, "loss": 4.978, "mean_token_accuracy": 0.2131640285253525, "num_tokens": 64627870.0, "step": 28220 }, { "entropy": 5.379143905639649, "epoch": 2.7901344404903123, "grad_norm": 1.0234375, "learning_rate": 0.0004228212093860664, "loss": 5.0623, "mean_token_accuracy": 0.20517639964818954, "num_tokens": 64639583.0, "step": 28225 }, { "entropy": 5.465548849105835, "epoch": 2.7906287069988136, "grad_norm": 0.984375, "learning_rate": 0.0004227946022647192, "loss": 5.0039, "mean_token_accuracy": 0.21015277355909348, "num_tokens": 64650477.0, "step": 28230 }, { "entropy": 5.475518894195557, "epoch": 2.7911229735073153, "grad_norm": 1.0546875, "learning_rate": 0.000422767991507602, "loss": 5.0474, "mean_token_accuracy": 0.21396049857139587, "num_tokens": 64660994.0, "step": 28235 }, { "entropy": 5.417670440673828, "epoch": 2.7916172400158166, "grad_norm": 1.0703125, "learning_rate": 0.0004227413771153692, "loss": 5.0727, "mean_token_accuracy": 0.21750295907258987, "num_tokens": 64672348.0, "step": 28240 }, { "entropy": 5.459055376052857, "epoch": 2.792111506524318, "grad_norm": 1.03125, "learning_rate": 0.00042271475908867563, "loss": 5.0456, "mean_token_accuracy": 0.20169767886400222, "num_tokens": 64683352.0, "step": 28245 }, { "entropy": 5.481772375106812, "epoch": 2.792605773032819, "grad_norm": 1.0390625, "learning_rate": 0.0004226881374281761, "loss": 5.0918, "mean_token_accuracy": 0.20454653054475785, "num_tokens": 64695429.0, "step": 28250 }, { "entropy": 5.3621031761169435, "epoch": 2.793100039541321, "grad_norm": 1.078125, "learning_rate": 0.0004226615121345254, "loss": 4.9596, "mean_token_accuracy": 0.21337895095348358, "num_tokens": 64706438.0, "step": 28255 }, { "entropy": 5.451272964477539, "epoch": 2.793594306049822, "grad_norm": 1.0546875, "learning_rate": 0.0004226348832083787, "loss": 5.0313, "mean_token_accuracy": 0.20661709308624268, "num_tokens": 64717991.0, "step": 28260 }, { "entropy": 5.450286197662353, "epoch": 2.7940885725583233, "grad_norm": 1.1171875, "learning_rate": 0.00042260825065039095, "loss": 5.1039, "mean_token_accuracy": 0.20481336563825608, "num_tokens": 64730196.0, "step": 28265 }, { "entropy": 5.411657094955444, "epoch": 2.794582839066825, "grad_norm": 1.03125, "learning_rate": 0.0004225816144612173, "loss": 5.0777, "mean_token_accuracy": 0.20436010360717774, "num_tokens": 64742977.0, "step": 28270 }, { "entropy": 5.484560871124268, "epoch": 2.7950771055753263, "grad_norm": 1.03125, "learning_rate": 0.00042255497464151307, "loss": 5.0664, "mean_token_accuracy": 0.20762816220521926, "num_tokens": 64754101.0, "step": 28275 }, { "entropy": 5.415189981460571, "epoch": 2.7955713720838276, "grad_norm": 0.98828125, "learning_rate": 0.00042252833119193345, "loss": 5.0577, "mean_token_accuracy": 0.20904034227132798, "num_tokens": 64766611.0, "step": 28280 }, { "entropy": 5.416021013259888, "epoch": 2.796065638592329, "grad_norm": 1.0390625, "learning_rate": 0.00042250168411313413, "loss": 5.065, "mean_token_accuracy": 0.21142401546239853, "num_tokens": 64778764.0, "step": 28285 }, { "entropy": 5.434243440628052, "epoch": 2.7965599051008305, "grad_norm": 1.015625, "learning_rate": 0.00042247503340577046, "loss": 5.0162, "mean_token_accuracy": 0.21078031957149507, "num_tokens": 64790208.0, "step": 28290 }, { "entropy": 5.428766965866089, "epoch": 2.797054171609332, "grad_norm": 1.0546875, "learning_rate": 0.0004224483790704981, "loss": 5.0932, "mean_token_accuracy": 0.20621077865362167, "num_tokens": 64801692.0, "step": 28295 }, { "entropy": 5.44076361656189, "epoch": 2.797548438117833, "grad_norm": 1.1796875, "learning_rate": 0.00042242172110797273, "loss": 4.9692, "mean_token_accuracy": 0.21063510030508042, "num_tokens": 64811919.0, "step": 28300 }, { "entropy": 5.423096132278443, "epoch": 2.7980427046263348, "grad_norm": 1.078125, "learning_rate": 0.00042239505951885013, "loss": 4.9955, "mean_token_accuracy": 0.2161523461341858, "num_tokens": 64821679.0, "step": 28305 }, { "entropy": 5.407114171981812, "epoch": 2.798536971134836, "grad_norm": 0.9921875, "learning_rate": 0.00042236839430378624, "loss": 5.0423, "mean_token_accuracy": 0.21406506597995759, "num_tokens": 64833295.0, "step": 28310 }, { "entropy": 5.381708288192749, "epoch": 2.7990312376433373, "grad_norm": 1.1015625, "learning_rate": 0.00042234172546343695, "loss": 4.9453, "mean_token_accuracy": 0.2197033077478409, "num_tokens": 64844970.0, "step": 28315 }, { "entropy": 5.434743928909302, "epoch": 2.7995255041518385, "grad_norm": 1.1640625, "learning_rate": 0.00042231505299845836, "loss": 4.9401, "mean_token_accuracy": 0.21513905823230745, "num_tokens": 64855496.0, "step": 28320 }, { "entropy": 5.39394793510437, "epoch": 2.80001977066034, "grad_norm": 1.046875, "learning_rate": 0.00042228837690950664, "loss": 5.0022, "mean_token_accuracy": 0.2134407252073288, "num_tokens": 64866836.0, "step": 28325 }, { "entropy": 5.359603548049927, "epoch": 2.8005140371688415, "grad_norm": 0.98828125, "learning_rate": 0.00042226169719723793, "loss": 5.0357, "mean_token_accuracy": 0.2154480680823326, "num_tokens": 64879105.0, "step": 28330 }, { "entropy": 5.5322788715362545, "epoch": 2.8010083036773428, "grad_norm": 1.09375, "learning_rate": 0.0004222350138623087, "loss": 5.0502, "mean_token_accuracy": 0.21348078697919845, "num_tokens": 64891227.0, "step": 28335 }, { "entropy": 5.418788433074951, "epoch": 2.8015025701858445, "grad_norm": 1.0703125, "learning_rate": 0.00042220832690537525, "loss": 5.0299, "mean_token_accuracy": 0.20542630702257156, "num_tokens": 64904070.0, "step": 28340 }, { "entropy": 5.397738885879517, "epoch": 2.8019968366943457, "grad_norm": 1.1015625, "learning_rate": 0.0004221816363270941, "loss": 4.9814, "mean_token_accuracy": 0.2145321935415268, "num_tokens": 64915087.0, "step": 28345 }, { "entropy": 5.371378374099732, "epoch": 2.802491103202847, "grad_norm": 1.0546875, "learning_rate": 0.00042215494212812193, "loss": 4.9284, "mean_token_accuracy": 0.22041096836328505, "num_tokens": 64926163.0, "step": 28350 }, { "entropy": 5.366522884368896, "epoch": 2.8029853697113483, "grad_norm": 1.1015625, "learning_rate": 0.00042212824430911533, "loss": 4.9901, "mean_token_accuracy": 0.21784412115812302, "num_tokens": 64936513.0, "step": 28355 }, { "entropy": 5.318961334228516, "epoch": 2.8034796362198495, "grad_norm": 1.0546875, "learning_rate": 0.0004221015428707311, "loss": 4.9056, "mean_token_accuracy": 0.22387145906686784, "num_tokens": 64947232.0, "step": 28360 }, { "entropy": 5.504414463043213, "epoch": 2.8039739027283512, "grad_norm": 1.1015625, "learning_rate": 0.000422074837813626, "loss": 5.0786, "mean_token_accuracy": 0.20795378237962722, "num_tokens": 64958622.0, "step": 28365 }, { "entropy": 5.477715539932251, "epoch": 2.8044681692368525, "grad_norm": 1.0546875, "learning_rate": 0.00042204812913845726, "loss": 5.0509, "mean_token_accuracy": 0.21152992099523543, "num_tokens": 64969975.0, "step": 28370 }, { "entropy": 5.407004928588867, "epoch": 2.8049624357453538, "grad_norm": 1.109375, "learning_rate": 0.00042202141684588156, "loss": 4.9566, "mean_token_accuracy": 0.2120935320854187, "num_tokens": 64981195.0, "step": 28375 }, { "entropy": 5.492878818511963, "epoch": 2.8054567022538555, "grad_norm": 1.1171875, "learning_rate": 0.0004219947009365563, "loss": 5.1183, "mean_token_accuracy": 0.20944650173187257, "num_tokens": 64992265.0, "step": 28380 }, { "entropy": 5.47233476638794, "epoch": 2.8059509687623567, "grad_norm": 1.046875, "learning_rate": 0.0004219679814111386, "loss": 5.0757, "mean_token_accuracy": 0.2086569920182228, "num_tokens": 65003613.0, "step": 28385 }, { "entropy": 5.376001310348511, "epoch": 2.806445235270858, "grad_norm": 1.1484375, "learning_rate": 0.0004219412582702857, "loss": 5.0015, "mean_token_accuracy": 0.21682388633489608, "num_tokens": 65014768.0, "step": 28390 }, { "entropy": 5.423770427703857, "epoch": 2.8069395017793592, "grad_norm": 1.0859375, "learning_rate": 0.00042191453151465506, "loss": 5.0232, "mean_token_accuracy": 0.20888259261846542, "num_tokens": 65026425.0, "step": 28395 }, { "entropy": 5.472204303741455, "epoch": 2.807433768287861, "grad_norm": 1.1015625, "learning_rate": 0.00042188780114490413, "loss": 5.0379, "mean_token_accuracy": 0.20887178778648377, "num_tokens": 65037624.0, "step": 28400 }, { "entropy": 5.470787906646729, "epoch": 2.807928034796362, "grad_norm": 1.1640625, "learning_rate": 0.0004218610671616905, "loss": 5.1279, "mean_token_accuracy": 0.21145582497119902, "num_tokens": 65048659.0, "step": 28405 }, { "entropy": 5.431805229187011, "epoch": 2.8084223013048635, "grad_norm": 0.98828125, "learning_rate": 0.00042183432956567184, "loss": 4.9314, "mean_token_accuracy": 0.22886100560426711, "num_tokens": 65059084.0, "step": 28410 }, { "entropy": 5.430448961257935, "epoch": 2.808916567813365, "grad_norm": 1.0625, "learning_rate": 0.00042180758835750595, "loss": 5.0147, "mean_token_accuracy": 0.21786174178123474, "num_tokens": 65071525.0, "step": 28415 }, { "entropy": 5.410004329681397, "epoch": 2.8094108343218664, "grad_norm": 1.078125, "learning_rate": 0.0004217808435378506, "loss": 5.0765, "mean_token_accuracy": 0.21156519651412964, "num_tokens": 65082738.0, "step": 28420 }, { "entropy": 5.483507108688355, "epoch": 2.8099051008303677, "grad_norm": 1.0234375, "learning_rate": 0.0004217540951073637, "loss": 5.081, "mean_token_accuracy": 0.20905945748090743, "num_tokens": 65094988.0, "step": 28425 }, { "entropy": 5.430683851242065, "epoch": 2.810399367338869, "grad_norm": 1.0390625, "learning_rate": 0.0004217273430667033, "loss": 5.0533, "mean_token_accuracy": 0.20987478494644166, "num_tokens": 65106412.0, "step": 28430 }, { "entropy": 5.41854248046875, "epoch": 2.8108936338473702, "grad_norm": 1.0078125, "learning_rate": 0.0004217005874165274, "loss": 5.0448, "mean_token_accuracy": 0.2156478375196457, "num_tokens": 65117756.0, "step": 28435 }, { "entropy": 5.457470035552978, "epoch": 2.811387900355872, "grad_norm": 1.0625, "learning_rate": 0.0004216738281574944, "loss": 5.0944, "mean_token_accuracy": 0.20926827043294907, "num_tokens": 65129368.0, "step": 28440 }, { "entropy": 5.4730747699737545, "epoch": 2.811882166864373, "grad_norm": 1.0390625, "learning_rate": 0.00042164706529026255, "loss": 5.0858, "mean_token_accuracy": 0.20692606419324874, "num_tokens": 65140553.0, "step": 28445 }, { "entropy": 5.398244857788086, "epoch": 2.812376433372875, "grad_norm": 1.078125, "learning_rate": 0.0004216202988154901, "loss": 4.9965, "mean_token_accuracy": 0.21188055723905563, "num_tokens": 65152047.0, "step": 28450 }, { "entropy": 5.427066135406494, "epoch": 2.812870699881376, "grad_norm": 1.0390625, "learning_rate": 0.0004215935287338354, "loss": 5.0105, "mean_token_accuracy": 0.21325698047876357, "num_tokens": 65164001.0, "step": 28455 }, { "entropy": 5.419220924377441, "epoch": 2.8133649663898774, "grad_norm": 1.0390625, "learning_rate": 0.0004215667550459573, "loss": 5.0261, "mean_token_accuracy": 0.2111202135682106, "num_tokens": 65175949.0, "step": 28460 }, { "entropy": 5.469588136672973, "epoch": 2.8138592328983787, "grad_norm": 1.125, "learning_rate": 0.0004215399777525142, "loss": 5.0348, "mean_token_accuracy": 0.2180962383747101, "num_tokens": 65186725.0, "step": 28465 }, { "entropy": 5.456300973892212, "epoch": 2.81435349940688, "grad_norm": 1.1015625, "learning_rate": 0.000421513196854165, "loss": 5.0273, "mean_token_accuracy": 0.21134413927793502, "num_tokens": 65198489.0, "step": 28470 }, { "entropy": 5.356208610534668, "epoch": 2.8148477659153817, "grad_norm": 0.95703125, "learning_rate": 0.0004214864123515684, "loss": 4.9651, "mean_token_accuracy": 0.21576543748378754, "num_tokens": 65210572.0, "step": 28475 }, { "entropy": 5.423062467575074, "epoch": 2.815342032423883, "grad_norm": 1.2578125, "learning_rate": 0.00042145962424538336, "loss": 5.0535, "mean_token_accuracy": 0.20608833581209182, "num_tokens": 65221785.0, "step": 28480 }, { "entropy": 5.502148151397705, "epoch": 2.815836298932384, "grad_norm": 1.0, "learning_rate": 0.0004214328325362687, "loss": 5.085, "mean_token_accuracy": 0.2033339187502861, "num_tokens": 65233998.0, "step": 28485 }, { "entropy": 5.477193450927734, "epoch": 2.816330565440886, "grad_norm": 1.015625, "learning_rate": 0.0004214060372248838, "loss": 5.0574, "mean_token_accuracy": 0.2020837187767029, "num_tokens": 65243907.0, "step": 28490 }, { "entropy": 5.422337436676026, "epoch": 2.816824831949387, "grad_norm": 0.97265625, "learning_rate": 0.00042137923831188763, "loss": 5.0218, "mean_token_accuracy": 0.21004620641469957, "num_tokens": 65254555.0, "step": 28495 }, { "entropy": 5.4710005760192875, "epoch": 2.8173190984578884, "grad_norm": 1.03125, "learning_rate": 0.00042135243579793946, "loss": 5.0387, "mean_token_accuracy": 0.20894381850957872, "num_tokens": 65265751.0, "step": 28500 }, { "entropy": 5.389526271820069, "epoch": 2.8178133649663897, "grad_norm": 0.98828125, "learning_rate": 0.00042132562968369864, "loss": 4.9751, "mean_token_accuracy": 0.21284334361553192, "num_tokens": 65275839.0, "step": 28505 }, { "entropy": 5.426601552963257, "epoch": 2.8183076314748914, "grad_norm": 1.0546875, "learning_rate": 0.0004212988199698247, "loss": 5.0075, "mean_token_accuracy": 0.21365518122911453, "num_tokens": 65287796.0, "step": 28510 }, { "entropy": 5.48567566871643, "epoch": 2.8188018979833926, "grad_norm": 0.9296875, "learning_rate": 0.00042127200665697715, "loss": 5.0818, "mean_token_accuracy": 0.21423664540052414, "num_tokens": 65299014.0, "step": 28515 }, { "entropy": 5.412119722366333, "epoch": 2.819296164491894, "grad_norm": 1.0078125, "learning_rate": 0.00042124518974581536, "loss": 5.0079, "mean_token_accuracy": 0.2147382378578186, "num_tokens": 65309830.0, "step": 28520 }, { "entropy": 5.482333850860596, "epoch": 2.8197904310003956, "grad_norm": 0.95703125, "learning_rate": 0.0004212183692369994, "loss": 5.1074, "mean_token_accuracy": 0.20084495842456818, "num_tokens": 65321921.0, "step": 28525 }, { "entropy": 5.436908149719239, "epoch": 2.820284697508897, "grad_norm": 1.0859375, "learning_rate": 0.0004211915451311887, "loss": 5.0313, "mean_token_accuracy": 0.2132962614297867, "num_tokens": 65334175.0, "step": 28530 }, { "entropy": 5.462993240356445, "epoch": 2.820778964017398, "grad_norm": 1.046875, "learning_rate": 0.0004211647174290434, "loss": 5.0934, "mean_token_accuracy": 0.2148503839969635, "num_tokens": 65345460.0, "step": 28535 }, { "entropy": 5.464183950424195, "epoch": 2.8212732305258994, "grad_norm": 0.984375, "learning_rate": 0.00042113788613122333, "loss": 5.0084, "mean_token_accuracy": 0.2155225932598114, "num_tokens": 65357252.0, "step": 28540 }, { "entropy": 5.47107892036438, "epoch": 2.821767497034401, "grad_norm": 1.015625, "learning_rate": 0.0004211110512383887, "loss": 5.1547, "mean_token_accuracy": 0.20428680628538132, "num_tokens": 65370195.0, "step": 28545 }, { "entropy": 5.368879413604736, "epoch": 2.8222617635429024, "grad_norm": 1.0625, "learning_rate": 0.0004210842127511995, "loss": 5.0087, "mean_token_accuracy": 0.21406644433736802, "num_tokens": 65382531.0, "step": 28550 }, { "entropy": 5.516090154647827, "epoch": 2.8227560300514036, "grad_norm": 1.125, "learning_rate": 0.0004210573706703159, "loss": 5.1205, "mean_token_accuracy": 0.20873817205429077, "num_tokens": 65393829.0, "step": 28555 }, { "entropy": 5.442989110946655, "epoch": 2.8232502965599053, "grad_norm": 1.1328125, "learning_rate": 0.0004210305249963984, "loss": 5.0316, "mean_token_accuracy": 0.21122439652681352, "num_tokens": 65404479.0, "step": 28560 }, { "entropy": 5.487104177474976, "epoch": 2.8237445630684066, "grad_norm": 1.140625, "learning_rate": 0.0004210036757301073, "loss": 5.1095, "mean_token_accuracy": 0.20648325830698014, "num_tokens": 65415468.0, "step": 28565 }, { "entropy": 5.3704681396484375, "epoch": 2.824238829576908, "grad_norm": 1.0078125, "learning_rate": 0.0004209768228721032, "loss": 4.9328, "mean_token_accuracy": 0.22169162034988404, "num_tokens": 65425994.0, "step": 28570 }, { "entropy": 5.407183504104614, "epoch": 2.824733096085409, "grad_norm": 1.203125, "learning_rate": 0.00042094996642304657, "loss": 5.0608, "mean_token_accuracy": 0.20824696570634843, "num_tokens": 65438394.0, "step": 28575 }, { "entropy": 5.458730554580688, "epoch": 2.8252273625939104, "grad_norm": 1.0625, "learning_rate": 0.0004209231063835981, "loss": 5.1024, "mean_token_accuracy": 0.20825848430395127, "num_tokens": 65450248.0, "step": 28580 }, { "entropy": 5.454391670227051, "epoch": 2.825721629102412, "grad_norm": 1.078125, "learning_rate": 0.00042089624275441865, "loss": 5.0393, "mean_token_accuracy": 0.20841936022043228, "num_tokens": 65460803.0, "step": 28585 }, { "entropy": 5.4210961818695065, "epoch": 2.8262158956109134, "grad_norm": 1.0546875, "learning_rate": 0.0004208693755361689, "loss": 5.0462, "mean_token_accuracy": 0.2115780904889107, "num_tokens": 65471899.0, "step": 28590 }, { "entropy": 5.444215106964111, "epoch": 2.826710162119415, "grad_norm": 0.98828125, "learning_rate": 0.0004208425047295099, "loss": 5.0551, "mean_token_accuracy": 0.213706636428833, "num_tokens": 65483767.0, "step": 28595 }, { "entropy": 5.392724227905274, "epoch": 2.8272044286279163, "grad_norm": 1.0625, "learning_rate": 0.0004208156303351027, "loss": 4.9165, "mean_token_accuracy": 0.21858488768339157, "num_tokens": 65494859.0, "step": 28600 }, { "entropy": 5.510323762893677, "epoch": 2.8276986951364176, "grad_norm": 1.0, "learning_rate": 0.00042078875235360835, "loss": 5.1335, "mean_token_accuracy": 0.20347557961940765, "num_tokens": 65506411.0, "step": 28605 }, { "entropy": 5.491088438034057, "epoch": 2.828192961644919, "grad_norm": 1.0234375, "learning_rate": 0.00042076187078568804, "loss": 4.9975, "mean_token_accuracy": 0.21039482355117797, "num_tokens": 65516655.0, "step": 28610 }, { "entropy": 5.286016368865967, "epoch": 2.82868722815342, "grad_norm": 1.078125, "learning_rate": 0.0004207349856320031, "loss": 4.975, "mean_token_accuracy": 0.21509698927402496, "num_tokens": 65529305.0, "step": 28615 }, { "entropy": 5.462048482894898, "epoch": 2.829181494661922, "grad_norm": 1.0546875, "learning_rate": 0.00042070809689321497, "loss": 5.0466, "mean_token_accuracy": 0.2105020761489868, "num_tokens": 65542129.0, "step": 28620 }, { "entropy": 5.408416318893432, "epoch": 2.829675761170423, "grad_norm": 0.9609375, "learning_rate": 0.000420681204569985, "loss": 4.9923, "mean_token_accuracy": 0.2233053922653198, "num_tokens": 65554240.0, "step": 28625 }, { "entropy": 5.3401312828063965, "epoch": 2.8301700276789243, "grad_norm": 1.0234375, "learning_rate": 0.00042065430866297486, "loss": 4.9445, "mean_token_accuracy": 0.2213255926966667, "num_tokens": 65564994.0, "step": 28630 }, { "entropy": 5.445550966262817, "epoch": 2.830664294187426, "grad_norm": 1.1171875, "learning_rate": 0.0004206274091728461, "loss": 5.0144, "mean_token_accuracy": 0.2138695552945137, "num_tokens": 65575986.0, "step": 28635 }, { "entropy": 5.520591068267822, "epoch": 2.8311585606959273, "grad_norm": 1.078125, "learning_rate": 0.0004206005061002604, "loss": 5.127, "mean_token_accuracy": 0.21299002021551133, "num_tokens": 65587792.0, "step": 28640 }, { "entropy": 5.527397346496582, "epoch": 2.8316528272044286, "grad_norm": 1.1171875, "learning_rate": 0.0004205735994458798, "loss": 5.2198, "mean_token_accuracy": 0.19350966364145278, "num_tokens": 65599845.0, "step": 28645 }, { "entropy": 5.493664312362671, "epoch": 2.83214709371293, "grad_norm": 1.15625, "learning_rate": 0.0004205466892103659, "loss": 5.0909, "mean_token_accuracy": 0.20469158589839936, "num_tokens": 65611796.0, "step": 28650 }, { "entropy": 5.589280033111573, "epoch": 2.8326413602214315, "grad_norm": 1.0859375, "learning_rate": 0.00042051977539438103, "loss": 5.138, "mean_token_accuracy": 0.19820379316806794, "num_tokens": 65622319.0, "step": 28655 }, { "entropy": 5.403728342056274, "epoch": 2.833135626729933, "grad_norm": 1.078125, "learning_rate": 0.00042049285799858707, "loss": 5.0045, "mean_token_accuracy": 0.2140220209956169, "num_tokens": 65634403.0, "step": 28660 }, { "entropy": 5.399525594711304, "epoch": 2.833629893238434, "grad_norm": 1.1171875, "learning_rate": 0.00042046593702364614, "loss": 5.035, "mean_token_accuracy": 0.21251134276390077, "num_tokens": 65644719.0, "step": 28665 }, { "entropy": 5.597980213165283, "epoch": 2.8341241597469358, "grad_norm": 1.0546875, "learning_rate": 0.0004204390124702207, "loss": 5.1401, "mean_token_accuracy": 0.20101604014635086, "num_tokens": 65657083.0, "step": 28670 }, { "entropy": 5.413203954696655, "epoch": 2.834618426255437, "grad_norm": 1.0859375, "learning_rate": 0.0004204120843389729, "loss": 5.0593, "mean_token_accuracy": 0.21174242943525315, "num_tokens": 65667579.0, "step": 28675 }, { "entropy": 5.425848817825317, "epoch": 2.8351126927639383, "grad_norm": 1.0625, "learning_rate": 0.00042038515263056537, "loss": 5.0218, "mean_token_accuracy": 0.21818395406007768, "num_tokens": 65679066.0, "step": 28680 }, { "entropy": 5.491365098953247, "epoch": 2.8356069592724396, "grad_norm": 1.0625, "learning_rate": 0.0004203582173456604, "loss": 5.1196, "mean_token_accuracy": 0.2053641274571419, "num_tokens": 65690785.0, "step": 28685 }, { "entropy": 5.440450763702392, "epoch": 2.836101225780941, "grad_norm": 1.0234375, "learning_rate": 0.00042033127848492086, "loss": 5.0539, "mean_token_accuracy": 0.21911954432725905, "num_tokens": 65701613.0, "step": 28690 }, { "entropy": 5.458510875701904, "epoch": 2.8365954922894425, "grad_norm": 1.046875, "learning_rate": 0.0004203043360490093, "loss": 5.043, "mean_token_accuracy": 0.21063696444034577, "num_tokens": 65713146.0, "step": 28695 }, { "entropy": 5.46273193359375, "epoch": 2.837089758797944, "grad_norm": 1.046875, "learning_rate": 0.00042027739003858855, "loss": 5.0669, "mean_token_accuracy": 0.20314407497644424, "num_tokens": 65724216.0, "step": 28700 }, { "entropy": 5.37620325088501, "epoch": 2.8375840253064455, "grad_norm": 1.03125, "learning_rate": 0.0004202504404543214, "loss": 4.9685, "mean_token_accuracy": 0.21216566860675812, "num_tokens": 65735357.0, "step": 28705 }, { "entropy": 5.441872882843017, "epoch": 2.8380782918149468, "grad_norm": 1.0234375, "learning_rate": 0.0004202234872968709, "loss": 5.0238, "mean_token_accuracy": 0.20495211333036423, "num_tokens": 65747679.0, "step": 28710 }, { "entropy": 5.467099714279175, "epoch": 2.838572558323448, "grad_norm": 0.94140625, "learning_rate": 0.0004201965305669001, "loss": 5.0027, "mean_token_accuracy": 0.21413648277521133, "num_tokens": 65759126.0, "step": 28715 }, { "entropy": 5.457605504989624, "epoch": 2.8390668248319493, "grad_norm": 1.015625, "learning_rate": 0.00042016957026507206, "loss": 5.0821, "mean_token_accuracy": 0.2066372349858284, "num_tokens": 65771240.0, "step": 28720 }, { "entropy": 5.4145081520080565, "epoch": 2.8395610913404505, "grad_norm": 0.98828125, "learning_rate": 0.0004201426063920501, "loss": 4.9547, "mean_token_accuracy": 0.2189878061413765, "num_tokens": 65783323.0, "step": 28725 }, { "entropy": 5.371854448318482, "epoch": 2.8400553578489522, "grad_norm": 1.09375, "learning_rate": 0.00042011563894849756, "loss": 4.9632, "mean_token_accuracy": 0.21307497322559357, "num_tokens": 65794165.0, "step": 28730 }, { "entropy": 5.373121643066407, "epoch": 2.8405496243574535, "grad_norm": 1.0234375, "learning_rate": 0.0004200886679350778, "loss": 4.9595, "mean_token_accuracy": 0.21789026111364365, "num_tokens": 65804541.0, "step": 28735 }, { "entropy": 5.413978815078735, "epoch": 2.8410438908659548, "grad_norm": 1.171875, "learning_rate": 0.0004200616933524542, "loss": 5.0579, "mean_token_accuracy": 0.20826001912355424, "num_tokens": 65816986.0, "step": 28740 }, { "entropy": 5.406021976470948, "epoch": 2.8415381573744565, "grad_norm": 0.96875, "learning_rate": 0.0004200347152012905, "loss": 5.0276, "mean_token_accuracy": 0.20835131108760835, "num_tokens": 65828711.0, "step": 28745 }, { "entropy": 5.496225643157959, "epoch": 2.8420324238829577, "grad_norm": 0.99609375, "learning_rate": 0.0004200077334822503, "loss": 5.0378, "mean_token_accuracy": 0.21068355441093445, "num_tokens": 65840525.0, "step": 28750 }, { "entropy": 5.393509340286255, "epoch": 2.842526690391459, "grad_norm": 1.0703125, "learning_rate": 0.0004199807481959973, "loss": 4.9461, "mean_token_accuracy": 0.22170021682977675, "num_tokens": 65851663.0, "step": 28755 }, { "entropy": 5.406895637512207, "epoch": 2.8430209568999603, "grad_norm": 1.125, "learning_rate": 0.0004199537593431955, "loss": 5.0142, "mean_token_accuracy": 0.21615724563598632, "num_tokens": 65863337.0, "step": 28760 }, { "entropy": 5.545959329605102, "epoch": 2.843515223408462, "grad_norm": 0.97265625, "learning_rate": 0.0004199267669245087, "loss": 5.1735, "mean_token_accuracy": 0.19357152432203292, "num_tokens": 65875581.0, "step": 28765 }, { "entropy": 5.4703444480896, "epoch": 2.8440094899169632, "grad_norm": 1.0546875, "learning_rate": 0.00041989977094060096, "loss": 5.0366, "mean_token_accuracy": 0.20807341933250428, "num_tokens": 65886577.0, "step": 28770 }, { "entropy": 5.360303735733032, "epoch": 2.8445037564254645, "grad_norm": 1.0625, "learning_rate": 0.0004198727713921364, "loss": 5.0367, "mean_token_accuracy": 0.20737203508615493, "num_tokens": 65897914.0, "step": 28775 }, { "entropy": 5.410736417770385, "epoch": 2.844998022933966, "grad_norm": 0.94140625, "learning_rate": 0.0004198457682797791, "loss": 5.0354, "mean_token_accuracy": 0.216299407184124, "num_tokens": 65909781.0, "step": 28780 }, { "entropy": 5.449419927597046, "epoch": 2.8454922894424675, "grad_norm": 1.0703125, "learning_rate": 0.00041981876160419353, "loss": 5.0091, "mean_token_accuracy": 0.2140233263373375, "num_tokens": 65921107.0, "step": 28785 }, { "entropy": 5.475045871734619, "epoch": 2.8459865559509687, "grad_norm": 1.0625, "learning_rate": 0.00041979175136604385, "loss": 5.0377, "mean_token_accuracy": 0.2162925958633423, "num_tokens": 65931166.0, "step": 28790 }, { "entropy": 5.509069871902466, "epoch": 2.84648082245947, "grad_norm": 1.0078125, "learning_rate": 0.0004197647375659947, "loss": 5.1517, "mean_token_accuracy": 0.20443524569272994, "num_tokens": 65943835.0, "step": 28795 }, { "entropy": 5.408158588409424, "epoch": 2.8469750889679717, "grad_norm": 0.9609375, "learning_rate": 0.00041973772020471054, "loss": 5.0078, "mean_token_accuracy": 0.21722477674484253, "num_tokens": 65956961.0, "step": 28800 }, { "entropy": 5.488613128662109, "epoch": 2.847469355476473, "grad_norm": 0.94140625, "learning_rate": 0.00041971069928285596, "loss": 5.0728, "mean_token_accuracy": 0.20766416788101197, "num_tokens": 65967774.0, "step": 28805 }, { "entropy": 5.395430374145508, "epoch": 2.847963621984974, "grad_norm": 1.0234375, "learning_rate": 0.00041968367480109577, "loss": 5.0164, "mean_token_accuracy": 0.21161174774169922, "num_tokens": 65978318.0, "step": 28810 }, { "entropy": 5.454450607299805, "epoch": 2.848457888493476, "grad_norm": 1.0546875, "learning_rate": 0.0004196566467600947, "loss": 4.9899, "mean_token_accuracy": 0.21338155418634414, "num_tokens": 65989763.0, "step": 28815 }, { "entropy": 5.374890422821045, "epoch": 2.848952155001977, "grad_norm": 0.99609375, "learning_rate": 0.00041962961516051777, "loss": 4.9676, "mean_token_accuracy": 0.21946410983800888, "num_tokens": 66001117.0, "step": 28820 }, { "entropy": 5.460238122940064, "epoch": 2.8494464215104784, "grad_norm": 1.0078125, "learning_rate": 0.0004196025800030298, "loss": 5.0642, "mean_token_accuracy": 0.20710013061761856, "num_tokens": 66012340.0, "step": 28825 }, { "entropy": 5.380323600769043, "epoch": 2.8499406880189797, "grad_norm": 0.9921875, "learning_rate": 0.0004195755412882959, "loss": 5.0285, "mean_token_accuracy": 0.2171403020620346, "num_tokens": 66023151.0, "step": 28830 }, { "entropy": 5.348619365692139, "epoch": 2.850434954527481, "grad_norm": 1.0703125, "learning_rate": 0.00041954849901698133, "loss": 4.8907, "mean_token_accuracy": 0.22517501413822175, "num_tokens": 66033399.0, "step": 28835 }, { "entropy": 5.373459339141846, "epoch": 2.8509292210359827, "grad_norm": 1.015625, "learning_rate": 0.00041952145318975114, "loss": 5.0377, "mean_token_accuracy": 0.2155236452817917, "num_tokens": 66045817.0, "step": 28840 }, { "entropy": 5.535502767562866, "epoch": 2.851423487544484, "grad_norm": 1.0703125, "learning_rate": 0.0004194944038072709, "loss": 5.1554, "mean_token_accuracy": 0.20260321497917175, "num_tokens": 66058696.0, "step": 28845 }, { "entropy": 5.4878850936889645, "epoch": 2.8519177540529856, "grad_norm": 1.078125, "learning_rate": 0.00041946735087020586, "loss": 4.9903, "mean_token_accuracy": 0.2148006796836853, "num_tokens": 66070197.0, "step": 28850 }, { "entropy": 5.358147144317627, "epoch": 2.852412020561487, "grad_norm": 1.1015625, "learning_rate": 0.0004194402943792216, "loss": 4.8468, "mean_token_accuracy": 0.2272876963019371, "num_tokens": 66080250.0, "step": 28855 }, { "entropy": 5.425247240066528, "epoch": 2.852906287069988, "grad_norm": 1.0078125, "learning_rate": 0.0004194132343349837, "loss": 5.0649, "mean_token_accuracy": 0.21172251999378205, "num_tokens": 66090957.0, "step": 28860 }, { "entropy": 5.378398466110229, "epoch": 2.8534005535784894, "grad_norm": 0.9609375, "learning_rate": 0.0004193861707381578, "loss": 4.9615, "mean_token_accuracy": 0.21455155164003373, "num_tokens": 66103042.0, "step": 28865 }, { "entropy": 5.437839984893799, "epoch": 2.8538948200869907, "grad_norm": 1.0703125, "learning_rate": 0.00041935910358940974, "loss": 5.0211, "mean_token_accuracy": 0.21466942131519318, "num_tokens": 66113832.0, "step": 28870 }, { "entropy": 5.407901763916016, "epoch": 2.8543890865954924, "grad_norm": 0.9453125, "learning_rate": 0.0004193320328894053, "loss": 4.946, "mean_token_accuracy": 0.22254039943218232, "num_tokens": 66126268.0, "step": 28875 }, { "entropy": 5.369946622848511, "epoch": 2.8548833531039937, "grad_norm": 1.078125, "learning_rate": 0.0004193049586388105, "loss": 4.9414, "mean_token_accuracy": 0.20930675268173218, "num_tokens": 66137590.0, "step": 28880 }, { "entropy": 5.299560451507569, "epoch": 2.855377619612495, "grad_norm": 1.0390625, "learning_rate": 0.00041927788083829127, "loss": 4.9763, "mean_token_accuracy": 0.21806904971599578, "num_tokens": 66149110.0, "step": 28885 }, { "entropy": 5.416442966461181, "epoch": 2.8558718861209966, "grad_norm": 1.078125, "learning_rate": 0.0004192507994885137, "loss": 4.9582, "mean_token_accuracy": 0.21779021322727204, "num_tokens": 66160116.0, "step": 28890 }, { "entropy": 5.518072319030762, "epoch": 2.856366152629498, "grad_norm": 1.078125, "learning_rate": 0.0004192237145901443, "loss": 5.1029, "mean_token_accuracy": 0.20488617122173308, "num_tokens": 66170743.0, "step": 28895 }, { "entropy": 5.509412479400635, "epoch": 2.856860419137999, "grad_norm": 1.015625, "learning_rate": 0.000419196626143849, "loss": 5.0308, "mean_token_accuracy": 0.2063233435153961, "num_tokens": 66182280.0, "step": 28900 }, { "entropy": 5.44746675491333, "epoch": 2.8573546856465004, "grad_norm": 1.0859375, "learning_rate": 0.00041916953415029447, "loss": 5.0845, "mean_token_accuracy": 0.20638009905815125, "num_tokens": 66193387.0, "step": 28905 }, { "entropy": 5.420180797576904, "epoch": 2.857848952155002, "grad_norm": 1.046875, "learning_rate": 0.0004191424386101469, "loss": 5.0304, "mean_token_accuracy": 0.20419544875621795, "num_tokens": 66206180.0, "step": 28910 }, { "entropy": 5.362782382965088, "epoch": 2.8583432186635034, "grad_norm": 1.09375, "learning_rate": 0.000419115339524073, "loss": 4.96, "mean_token_accuracy": 0.2170044645667076, "num_tokens": 66217495.0, "step": 28915 }, { "entropy": 5.455839490890503, "epoch": 2.8588374851720046, "grad_norm": 1.0859375, "learning_rate": 0.0004190882368927394, "loss": 5.051, "mean_token_accuracy": 0.2046976640820503, "num_tokens": 66229107.0, "step": 28920 }, { "entropy": 5.423680019378662, "epoch": 2.8593317516805064, "grad_norm": 1.0, "learning_rate": 0.0004190611307168128, "loss": 4.9937, "mean_token_accuracy": 0.2228888288140297, "num_tokens": 66240480.0, "step": 28925 }, { "entropy": 5.322403860092163, "epoch": 2.8598260181890076, "grad_norm": 1.1171875, "learning_rate": 0.00041903402099696007, "loss": 4.9747, "mean_token_accuracy": 0.22297030687332153, "num_tokens": 66251785.0, "step": 28930 }, { "entropy": 5.411808586120605, "epoch": 2.860320284697509, "grad_norm": 1.15625, "learning_rate": 0.0004190069077338481, "loss": 4.9429, "mean_token_accuracy": 0.2188699409365654, "num_tokens": 66262557.0, "step": 28935 }, { "entropy": 5.47333402633667, "epoch": 2.86081455120601, "grad_norm": 1.0390625, "learning_rate": 0.0004189797909281438, "loss": 5.0855, "mean_token_accuracy": 0.20751052498817443, "num_tokens": 66272931.0, "step": 28940 }, { "entropy": 5.441748142242432, "epoch": 2.8613088177145114, "grad_norm": 0.98828125, "learning_rate": 0.00041895267058051434, "loss": 5.0151, "mean_token_accuracy": 0.21667002588510514, "num_tokens": 66283550.0, "step": 28945 }, { "entropy": 5.3790491104125975, "epoch": 2.861803084223013, "grad_norm": 1.0234375, "learning_rate": 0.00041892554669162687, "loss": 5.0467, "mean_token_accuracy": 0.21014563292264937, "num_tokens": 66294740.0, "step": 28950 }, { "entropy": 5.3559685230255125, "epoch": 2.8622973507315144, "grad_norm": 1.0078125, "learning_rate": 0.00041889841926214856, "loss": 4.9323, "mean_token_accuracy": 0.21505227088928222, "num_tokens": 66306241.0, "step": 28955 }, { "entropy": 5.488435745239258, "epoch": 2.862791617240016, "grad_norm": 0.9609375, "learning_rate": 0.00041887128829274685, "loss": 5.0506, "mean_token_accuracy": 0.20568871647119522, "num_tokens": 66320006.0, "step": 28960 }, { "entropy": 5.457212352752686, "epoch": 2.8632858837485173, "grad_norm": 0.99609375, "learning_rate": 0.00041884415378408917, "loss": 5.0068, "mean_token_accuracy": 0.2104433223605156, "num_tokens": 66330810.0, "step": 28965 }, { "entropy": 5.451360559463501, "epoch": 2.8637801502570186, "grad_norm": 0.9921875, "learning_rate": 0.0004188170157368429, "loss": 5.0485, "mean_token_accuracy": 0.21119442880153655, "num_tokens": 66341858.0, "step": 28970 }, { "entropy": 5.399813270568847, "epoch": 2.86427441676552, "grad_norm": 1.03125, "learning_rate": 0.0004187898741516758, "loss": 5.0278, "mean_token_accuracy": 0.21459172666072845, "num_tokens": 66353175.0, "step": 28975 }, { "entropy": 5.452212810516357, "epoch": 2.864768683274021, "grad_norm": 1.2109375, "learning_rate": 0.0004187627290292555, "loss": 5.0227, "mean_token_accuracy": 0.21673197001218797, "num_tokens": 66364245.0, "step": 28980 }, { "entropy": 5.3820422172546385, "epoch": 2.865262949782523, "grad_norm": 1.03125, "learning_rate": 0.00041873558037024974, "loss": 5.05, "mean_token_accuracy": 0.20762303918600084, "num_tokens": 66376793.0, "step": 28985 }, { "entropy": 5.472010374069214, "epoch": 2.865757216291024, "grad_norm": 1.046875, "learning_rate": 0.0004187084281753264, "loss": 5.0659, "mean_token_accuracy": 0.20549626499414445, "num_tokens": 66388130.0, "step": 28990 }, { "entropy": 5.5225176334381105, "epoch": 2.8662514827995254, "grad_norm": 1.09375, "learning_rate": 0.00041868127244515336, "loss": 5.0763, "mean_token_accuracy": 0.20701929926872253, "num_tokens": 66400784.0, "step": 28995 }, { "entropy": 5.435283279418945, "epoch": 2.866745749308027, "grad_norm": 1.0078125, "learning_rate": 0.00041865411318039883, "loss": 5.0256, "mean_token_accuracy": 0.21093764007091523, "num_tokens": 66412159.0, "step": 29000 }, { "entropy": 5.442742919921875, "epoch": 2.8672400158165283, "grad_norm": 1.0390625, "learning_rate": 0.00041862695038173085, "loss": 4.9939, "mean_token_accuracy": 0.21506983786821365, "num_tokens": 66423471.0, "step": 29005 }, { "entropy": 5.534247159957886, "epoch": 2.8677342823250296, "grad_norm": 1.0390625, "learning_rate": 0.0004185997840498175, "loss": 5.1456, "mean_token_accuracy": 0.19756857454776763, "num_tokens": 66436889.0, "step": 29010 }, { "entropy": 5.494853401184082, "epoch": 2.868228548833531, "grad_norm": 1.0234375, "learning_rate": 0.0004185726141853272, "loss": 5.0857, "mean_token_accuracy": 0.2067474365234375, "num_tokens": 66448157.0, "step": 29015 }, { "entropy": 5.319740676879883, "epoch": 2.8687228153420326, "grad_norm": 1.0546875, "learning_rate": 0.0004185454407889284, "loss": 4.9137, "mean_token_accuracy": 0.22362101525068284, "num_tokens": 66459877.0, "step": 29020 }, { "entropy": 5.463305711746216, "epoch": 2.869217081850534, "grad_norm": 1.1640625, "learning_rate": 0.0004185182638612895, "loss": 4.974, "mean_token_accuracy": 0.21965937465429305, "num_tokens": 66469648.0, "step": 29025 }, { "entropy": 5.448493480682373, "epoch": 2.869711348359035, "grad_norm": 0.9375, "learning_rate": 0.00041849108340307893, "loss": 5.1009, "mean_token_accuracy": 0.20633881241083146, "num_tokens": 66480878.0, "step": 29030 }, { "entropy": 5.52951488494873, "epoch": 2.870205614867537, "grad_norm": 1.046875, "learning_rate": 0.00041846389941496557, "loss": 5.1282, "mean_token_accuracy": 0.20393907725811006, "num_tokens": 66492099.0, "step": 29035 }, { "entropy": 5.524483633041382, "epoch": 2.870699881376038, "grad_norm": 1.015625, "learning_rate": 0.00041843671189761795, "loss": 5.0704, "mean_token_accuracy": 0.20663715451955794, "num_tokens": 66503194.0, "step": 29040 }, { "entropy": 5.466691875457764, "epoch": 2.8711941478845393, "grad_norm": 1.1015625, "learning_rate": 0.000418409520851705, "loss": 5.0651, "mean_token_accuracy": 0.20576851814985275, "num_tokens": 66513393.0, "step": 29045 }, { "entropy": 5.415179014205933, "epoch": 2.8716884143930406, "grad_norm": 0.94921875, "learning_rate": 0.0004183823262778955, "loss": 5.0136, "mean_token_accuracy": 0.2205430820584297, "num_tokens": 66524042.0, "step": 29050 }, { "entropy": 5.491376972198486, "epoch": 2.8721826809015423, "grad_norm": 1.1015625, "learning_rate": 0.0004183551281768586, "loss": 5.0668, "mean_token_accuracy": 0.20981571972370147, "num_tokens": 66534111.0, "step": 29055 }, { "entropy": 5.444293785095215, "epoch": 2.8726769474100435, "grad_norm": 1.1640625, "learning_rate": 0.00041832792654926333, "loss": 5.0503, "mean_token_accuracy": 0.2121535837650299, "num_tokens": 66545605.0, "step": 29060 }, { "entropy": 5.397779512405395, "epoch": 2.873171213918545, "grad_norm": 1.1015625, "learning_rate": 0.00041830072139577886, "loss": 5.0129, "mean_token_accuracy": 0.21744753122329713, "num_tokens": 66556579.0, "step": 29065 }, { "entropy": 5.420639133453369, "epoch": 2.8736654804270465, "grad_norm": 0.96484375, "learning_rate": 0.00041827351271707435, "loss": 5.0416, "mean_token_accuracy": 0.20862719118595124, "num_tokens": 66570262.0, "step": 29070 }, { "entropy": 5.52435712814331, "epoch": 2.8741597469355478, "grad_norm": 1.0859375, "learning_rate": 0.00041824630051381917, "loss": 5.0917, "mean_token_accuracy": 0.19899357557296754, "num_tokens": 66581159.0, "step": 29075 }, { "entropy": 5.406038093566894, "epoch": 2.874654013444049, "grad_norm": 1.09375, "learning_rate": 0.00041821908478668283, "loss": 5.0044, "mean_token_accuracy": 0.22269929945468903, "num_tokens": 66591641.0, "step": 29080 }, { "entropy": 5.349451398849487, "epoch": 2.8751482799525503, "grad_norm": 1.2265625, "learning_rate": 0.00041819186553633476, "loss": 5.0629, "mean_token_accuracy": 0.2039193645119667, "num_tokens": 66603737.0, "step": 29085 }, { "entropy": 5.468878746032715, "epoch": 2.8756425464610516, "grad_norm": 1.0625, "learning_rate": 0.00041816464276344463, "loss": 5.0534, "mean_token_accuracy": 0.20736332088708878, "num_tokens": 66615874.0, "step": 29090 }, { "entropy": 5.5321571826934814, "epoch": 2.8761368129695533, "grad_norm": 1.078125, "learning_rate": 0.00041813741646868204, "loss": 5.0871, "mean_token_accuracy": 0.20669715851545334, "num_tokens": 66627297.0, "step": 29095 }, { "entropy": 5.521060848236084, "epoch": 2.8766310794780545, "grad_norm": 1.296875, "learning_rate": 0.0004181101866527168, "loss": 5.1055, "mean_token_accuracy": 0.2055671274662018, "num_tokens": 66638342.0, "step": 29100 }, { "entropy": 5.453798151016235, "epoch": 2.8771253459865562, "grad_norm": 0.99609375, "learning_rate": 0.0004180829533162188, "loss": 4.9793, "mean_token_accuracy": 0.21441750675439836, "num_tokens": 66648599.0, "step": 29105 }, { "entropy": 5.308062553405762, "epoch": 2.8776196124950575, "grad_norm": 1.078125, "learning_rate": 0.0004180557164598579, "loss": 4.9655, "mean_token_accuracy": 0.21880108416080474, "num_tokens": 66660850.0, "step": 29110 }, { "entropy": 5.361252927780152, "epoch": 2.8781138790035588, "grad_norm": 1.0859375, "learning_rate": 0.0004180284760843042, "loss": 5.0115, "mean_token_accuracy": 0.21193771213293075, "num_tokens": 66672577.0, "step": 29115 }, { "entropy": 5.532903861999512, "epoch": 2.87860814551206, "grad_norm": 1.015625, "learning_rate": 0.00041800123219022786, "loss": 5.0706, "mean_token_accuracy": 0.20973120182752608, "num_tokens": 66683720.0, "step": 29120 }, { "entropy": 5.514287614822388, "epoch": 2.8791024120205613, "grad_norm": 1.0859375, "learning_rate": 0.0004179739847782989, "loss": 5.1069, "mean_token_accuracy": 0.20648871958255768, "num_tokens": 66696492.0, "step": 29125 }, { "entropy": 5.402522277832031, "epoch": 2.879596678529063, "grad_norm": 1.046875, "learning_rate": 0.0004179467338491878, "loss": 5.0591, "mean_token_accuracy": 0.2091243639588356, "num_tokens": 66707203.0, "step": 29130 }, { "entropy": 5.4554685115814205, "epoch": 2.8800909450375642, "grad_norm": 1.125, "learning_rate": 0.0004179194794035649, "loss": 5.0239, "mean_token_accuracy": 0.20720912516117096, "num_tokens": 66717433.0, "step": 29135 }, { "entropy": 5.389675760269165, "epoch": 2.8805852115460655, "grad_norm": 1.046875, "learning_rate": 0.00041789222144210066, "loss": 4.9107, "mean_token_accuracy": 0.22658638805150985, "num_tokens": 66729452.0, "step": 29140 }, { "entropy": 5.383780765533447, "epoch": 2.881079478054567, "grad_norm": 1.0546875, "learning_rate": 0.00041786495996546546, "loss": 5.0445, "mean_token_accuracy": 0.21312773525714873, "num_tokens": 66741360.0, "step": 29145 }, { "entropy": 5.422603464126587, "epoch": 2.8815737445630685, "grad_norm": 1.1015625, "learning_rate": 0.0004178376949743302, "loss": 5.0384, "mean_token_accuracy": 0.2102280631661415, "num_tokens": 66752585.0, "step": 29150 }, { "entropy": 5.407947969436646, "epoch": 2.8820680110715697, "grad_norm": 1.046875, "learning_rate": 0.0004178104264693655, "loss": 5.016, "mean_token_accuracy": 0.21438546627759933, "num_tokens": 66763898.0, "step": 29155 }, { "entropy": 5.357155990600586, "epoch": 2.882562277580071, "grad_norm": 1.03125, "learning_rate": 0.000417783154451242, "loss": 4.8964, "mean_token_accuracy": 0.22477778494358064, "num_tokens": 66774272.0, "step": 29160 }, { "entropy": 5.414708948135376, "epoch": 2.8830565440885727, "grad_norm": 1.0234375, "learning_rate": 0.00041775587892063095, "loss": 4.9726, "mean_token_accuracy": 0.2168130725622177, "num_tokens": 66784943.0, "step": 29165 }, { "entropy": 5.572418737411499, "epoch": 2.883550810597074, "grad_norm": 1.015625, "learning_rate": 0.000417728599878203, "loss": 5.1095, "mean_token_accuracy": 0.20130929946899415, "num_tokens": 66796449.0, "step": 29170 }, { "entropy": 5.412405633926392, "epoch": 2.8840450771055752, "grad_norm": 1.015625, "learning_rate": 0.0004177013173246294, "loss": 5.0455, "mean_token_accuracy": 0.21262743473052978, "num_tokens": 66809936.0, "step": 29175 }, { "entropy": 5.483620548248291, "epoch": 2.884539343614077, "grad_norm": 1.1015625, "learning_rate": 0.0004176740312605813, "loss": 5.0774, "mean_token_accuracy": 0.20734924226999282, "num_tokens": 66820846.0, "step": 29180 }, { "entropy": 5.499366760253906, "epoch": 2.885033610122578, "grad_norm": 1.015625, "learning_rate": 0.0004176467416867298, "loss": 5.038, "mean_token_accuracy": 0.20632170885801315, "num_tokens": 66832919.0, "step": 29185 }, { "entropy": 5.382720184326172, "epoch": 2.8855278766310795, "grad_norm": 0.9765625, "learning_rate": 0.00041761944860374637, "loss": 4.9553, "mean_token_accuracy": 0.22057608515024185, "num_tokens": 66844944.0, "step": 29190 }, { "entropy": 5.383631372451783, "epoch": 2.8860221431395807, "grad_norm": 0.98828125, "learning_rate": 0.0004175921520123023, "loss": 5.0302, "mean_token_accuracy": 0.20763741433620453, "num_tokens": 66857987.0, "step": 29195 }, { "entropy": 5.4278984546661375, "epoch": 2.886516409648082, "grad_norm": 1.0234375, "learning_rate": 0.0004175648519130693, "loss": 4.9715, "mean_token_accuracy": 0.21713627129793167, "num_tokens": 66869100.0, "step": 29200 }, { "entropy": 5.386370754241943, "epoch": 2.8870106761565837, "grad_norm": 1.0390625, "learning_rate": 0.00041753754830671876, "loss": 4.9808, "mean_token_accuracy": 0.21103835552930833, "num_tokens": 66881168.0, "step": 29205 }, { "entropy": 5.4128196239471436, "epoch": 2.887504942665085, "grad_norm": 1.0625, "learning_rate": 0.0004175102411939224, "loss": 5.0532, "mean_token_accuracy": 0.21214286386966705, "num_tokens": 66894080.0, "step": 29210 }, { "entropy": 5.425430679321289, "epoch": 2.8879992091735867, "grad_norm": 1.171875, "learning_rate": 0.00041748293057535207, "loss": 5.0386, "mean_token_accuracy": 0.21126446574926377, "num_tokens": 66906155.0, "step": 29215 }, { "entropy": 5.434283590316772, "epoch": 2.888493475682088, "grad_norm": 1.125, "learning_rate": 0.00041745561645167953, "loss": 4.956, "mean_token_accuracy": 0.2202584519982338, "num_tokens": 66915745.0, "step": 29220 }, { "entropy": 5.472662353515625, "epoch": 2.888987742190589, "grad_norm": 1.046875, "learning_rate": 0.0004174282988235767, "loss": 5.0641, "mean_token_accuracy": 0.21087280958890914, "num_tokens": 66927722.0, "step": 29225 }, { "entropy": 5.447684574127197, "epoch": 2.8894820086990904, "grad_norm": 1.015625, "learning_rate": 0.0004174009776917156, "loss": 5.0496, "mean_token_accuracy": 0.20940049290657042, "num_tokens": 66939063.0, "step": 29230 }, { "entropy": 5.396454763412476, "epoch": 2.8899762752075917, "grad_norm": 0.9921875, "learning_rate": 0.0004173736530567684, "loss": 4.9423, "mean_token_accuracy": 0.2206297680735588, "num_tokens": 66950596.0, "step": 29235 }, { "entropy": 5.369441366195678, "epoch": 2.8904705417160934, "grad_norm": 1.140625, "learning_rate": 0.0004173463249194072, "loss": 4.9796, "mean_token_accuracy": 0.2126283824443817, "num_tokens": 66961836.0, "step": 29240 }, { "entropy": 5.481157302856445, "epoch": 2.8909648082245947, "grad_norm": 1.03125, "learning_rate": 0.00041731899328030443, "loss": 5.1406, "mean_token_accuracy": 0.20322689414024353, "num_tokens": 66976064.0, "step": 29245 }, { "entropy": 5.398590755462647, "epoch": 2.891459074733096, "grad_norm": 1.0625, "learning_rate": 0.0004172916581401322, "loss": 4.9137, "mean_token_accuracy": 0.22454738318920137, "num_tokens": 66987572.0, "step": 29250 }, { "entropy": 5.363443326950073, "epoch": 2.8919533412415976, "grad_norm": 1.0859375, "learning_rate": 0.0004172643194995632, "loss": 4.9412, "mean_token_accuracy": 0.2234678491950035, "num_tokens": 66998668.0, "step": 29255 }, { "entropy": 5.414989471435547, "epoch": 2.892447607750099, "grad_norm": 1.09375, "learning_rate": 0.0004172369773592699, "loss": 5.0579, "mean_token_accuracy": 0.21215982586145402, "num_tokens": 67010140.0, "step": 29260 }, { "entropy": 5.326801490783692, "epoch": 2.8929418742586, "grad_norm": 1.0390625, "learning_rate": 0.0004172096317199248, "loss": 4.878, "mean_token_accuracy": 0.2305400550365448, "num_tokens": 67021727.0, "step": 29265 }, { "entropy": 5.379196310043335, "epoch": 2.8934361407671014, "grad_norm": 1.0234375, "learning_rate": 0.0004171822825822007, "loss": 5.0152, "mean_token_accuracy": 0.21398012936115265, "num_tokens": 67033327.0, "step": 29270 }, { "entropy": 5.503091335296631, "epoch": 2.893930407275603, "grad_norm": 1.03125, "learning_rate": 0.0004171549299467704, "loss": 5.0833, "mean_token_accuracy": 0.21331964135169984, "num_tokens": 67044827.0, "step": 29275 }, { "entropy": 5.465588188171386, "epoch": 2.8944246737841044, "grad_norm": 1.0078125, "learning_rate": 0.0004171275738143068, "loss": 4.9373, "mean_token_accuracy": 0.21313460171222687, "num_tokens": 67056042.0, "step": 29280 }, { "entropy": 5.467501831054688, "epoch": 2.8949189402926057, "grad_norm": 1.1171875, "learning_rate": 0.00041710021418548283, "loss": 5.0435, "mean_token_accuracy": 0.21317075788974763, "num_tokens": 67068346.0, "step": 29285 }, { "entropy": 5.366368341445923, "epoch": 2.8954132068011074, "grad_norm": 1.15625, "learning_rate": 0.0004170728510609716, "loss": 4.9473, "mean_token_accuracy": 0.2216492161154747, "num_tokens": 67078282.0, "step": 29290 }, { "entropy": 5.403209543228149, "epoch": 2.8959074733096086, "grad_norm": 0.99609375, "learning_rate": 0.00041704548444144605, "loss": 5.0205, "mean_token_accuracy": 0.2127322033047676, "num_tokens": 67089958.0, "step": 29295 }, { "entropy": 5.456916475296021, "epoch": 2.89640173981811, "grad_norm": 1.0, "learning_rate": 0.00041701811432757964, "loss": 5.0311, "mean_token_accuracy": 0.212491375207901, "num_tokens": 67101672.0, "step": 29300 }, { "entropy": 5.404790544509888, "epoch": 2.896896006326611, "grad_norm": 1.078125, "learning_rate": 0.0004169907407200456, "loss": 4.9678, "mean_token_accuracy": 0.20835311859846115, "num_tokens": 67113334.0, "step": 29305 }, { "entropy": 5.480239343643189, "epoch": 2.897390272835113, "grad_norm": 1.1015625, "learning_rate": 0.00041696336361951727, "loss": 5.0483, "mean_token_accuracy": 0.20734936892986297, "num_tokens": 67123880.0, "step": 29310 }, { "entropy": 5.421977853775024, "epoch": 2.897884539343614, "grad_norm": 0.98046875, "learning_rate": 0.0004169359830266682, "loss": 5.05, "mean_token_accuracy": 0.20636602491140366, "num_tokens": 67134966.0, "step": 29315 }, { "entropy": 5.403618240356446, "epoch": 2.8983788058521154, "grad_norm": 1.0625, "learning_rate": 0.0004169085989421719, "loss": 4.9974, "mean_token_accuracy": 0.21643251031637192, "num_tokens": 67145407.0, "step": 29320 }, { "entropy": 5.408173561096191, "epoch": 2.898873072360617, "grad_norm": 1.0, "learning_rate": 0.0004168812113667021, "loss": 5.0213, "mean_token_accuracy": 0.21050399988889695, "num_tokens": 67156201.0, "step": 29325 }, { "entropy": 5.390816497802734, "epoch": 2.8993673388691183, "grad_norm": 0.96875, "learning_rate": 0.00041685382030093245, "loss": 5.0013, "mean_token_accuracy": 0.21631201952695847, "num_tokens": 67168851.0, "step": 29330 }, { "entropy": 5.335356569290161, "epoch": 2.8998616053776196, "grad_norm": 1.0546875, "learning_rate": 0.00041682642574553683, "loss": 4.8736, "mean_token_accuracy": 0.23464400619268416, "num_tokens": 67180559.0, "step": 29335 }, { "entropy": 5.434173631668091, "epoch": 2.900355871886121, "grad_norm": 1.0546875, "learning_rate": 0.00041679902770118914, "loss": 5.0402, "mean_token_accuracy": 0.20814952850341797, "num_tokens": 67192494.0, "step": 29340 }, { "entropy": 5.410094404220581, "epoch": 2.900850138394622, "grad_norm": 1.0703125, "learning_rate": 0.00041677162616856337, "loss": 5.0181, "mean_token_accuracy": 0.21588039994239808, "num_tokens": 67203846.0, "step": 29345 }, { "entropy": 5.481628179550171, "epoch": 2.901344404903124, "grad_norm": 0.92578125, "learning_rate": 0.00041674422114833357, "loss": 5.0053, "mean_token_accuracy": 0.20902076810598375, "num_tokens": 67214528.0, "step": 29350 }, { "entropy": 5.40119423866272, "epoch": 2.901838671411625, "grad_norm": 0.9921875, "learning_rate": 0.0004167168126411739, "loss": 5.0556, "mean_token_accuracy": 0.21299450546503068, "num_tokens": 67225798.0, "step": 29355 }, { "entropy": 5.525965738296509, "epoch": 2.902332937920127, "grad_norm": 1.0625, "learning_rate": 0.0004166894006477587, "loss": 5.1571, "mean_token_accuracy": 0.20394525974988936, "num_tokens": 67237245.0, "step": 29360 }, { "entropy": 5.491499567031861, "epoch": 2.902827204428628, "grad_norm": 1.0390625, "learning_rate": 0.0004166619851687623, "loss": 5.0392, "mean_token_accuracy": 0.20619229674339296, "num_tokens": 67249741.0, "step": 29365 }, { "entropy": 5.458441877365113, "epoch": 2.9033214709371293, "grad_norm": 1.0234375, "learning_rate": 0.00041663456620485913, "loss": 5.0922, "mean_token_accuracy": 0.2089219644665718, "num_tokens": 67261452.0, "step": 29370 }, { "entropy": 5.479209613800049, "epoch": 2.9038157374456306, "grad_norm": 0.92578125, "learning_rate": 0.0004166071437567236, "loss": 5.0353, "mean_token_accuracy": 0.21224239766597747, "num_tokens": 67273420.0, "step": 29375 }, { "entropy": 5.478652715682983, "epoch": 2.904310003954132, "grad_norm": 1.0, "learning_rate": 0.0004165797178250303, "loss": 5.0892, "mean_token_accuracy": 0.20319828689098357, "num_tokens": 67284853.0, "step": 29380 }, { "entropy": 5.32659683227539, "epoch": 2.9048042704626336, "grad_norm": 1.0625, "learning_rate": 0.00041655228841045404, "loss": 4.8902, "mean_token_accuracy": 0.2282964378595352, "num_tokens": 67295956.0, "step": 29385 }, { "entropy": 5.436525583267212, "epoch": 2.905298536971135, "grad_norm": 1.0546875, "learning_rate": 0.00041652485551366955, "loss": 5.029, "mean_token_accuracy": 0.21798741519451142, "num_tokens": 67307150.0, "step": 29390 }, { "entropy": 5.407930469512939, "epoch": 2.905792803479636, "grad_norm": 0.984375, "learning_rate": 0.0004164974191353516, "loss": 4.9151, "mean_token_accuracy": 0.22059123516082763, "num_tokens": 67318012.0, "step": 29395 }, { "entropy": 5.35202693939209, "epoch": 2.906287069988138, "grad_norm": 1.0078125, "learning_rate": 0.0004164699792761753, "loss": 5.0086, "mean_token_accuracy": 0.21235252767801285, "num_tokens": 67331335.0, "step": 29400 }, { "entropy": 5.489719438552856, "epoch": 2.906781336496639, "grad_norm": 1.0625, "learning_rate": 0.00041644253593681543, "loss": 5.051, "mean_token_accuracy": 0.20618800818920135, "num_tokens": 67342595.0, "step": 29405 }, { "entropy": 5.460517358779907, "epoch": 2.9072756030051403, "grad_norm": 0.9453125, "learning_rate": 0.00041641508911794724, "loss": 5.0206, "mean_token_accuracy": 0.21091959327459336, "num_tokens": 67355620.0, "step": 29410 }, { "entropy": 5.444975519180298, "epoch": 2.9077698695136416, "grad_norm": 1.0546875, "learning_rate": 0.000416387638820246, "loss": 5.0063, "mean_token_accuracy": 0.21085948050022124, "num_tokens": 67366600.0, "step": 29415 }, { "entropy": 5.4302386283874515, "epoch": 2.9082641360221433, "grad_norm": 1.078125, "learning_rate": 0.00041636018504438683, "loss": 5.016, "mean_token_accuracy": 0.21166083663702012, "num_tokens": 67377122.0, "step": 29420 }, { "entropy": 5.431444549560547, "epoch": 2.9087584025306445, "grad_norm": 1.140625, "learning_rate": 0.0004163327277910452, "loss": 5.0779, "mean_token_accuracy": 0.20935009568929672, "num_tokens": 67387572.0, "step": 29425 }, { "entropy": 5.399361181259155, "epoch": 2.909252669039146, "grad_norm": 1.0234375, "learning_rate": 0.00041630526706089657, "loss": 4.9452, "mean_token_accuracy": 0.21774937510490416, "num_tokens": 67399608.0, "step": 29430 }, { "entropy": 5.472567081451416, "epoch": 2.9097469355476475, "grad_norm": 1.0078125, "learning_rate": 0.00041627780285461645, "loss": 5.106, "mean_token_accuracy": 0.1999306008219719, "num_tokens": 67410144.0, "step": 29435 }, { "entropy": 5.454007482528686, "epoch": 2.910241202056149, "grad_norm": 1.1015625, "learning_rate": 0.00041625033517288045, "loss": 5.0067, "mean_token_accuracy": 0.2140176549553871, "num_tokens": 67422777.0, "step": 29440 }, { "entropy": 5.43764009475708, "epoch": 2.91073546856465, "grad_norm": 0.95703125, "learning_rate": 0.0004162228640163643, "loss": 5.0945, "mean_token_accuracy": 0.20747531354427337, "num_tokens": 67434226.0, "step": 29445 }, { "entropy": 5.513816976547242, "epoch": 2.9112297350731513, "grad_norm": 0.9921875, "learning_rate": 0.0004161953893857438, "loss": 5.1023, "mean_token_accuracy": 0.20979815423488618, "num_tokens": 67445316.0, "step": 29450 }, { "entropy": 5.450288200378418, "epoch": 2.9117240015816526, "grad_norm": 1.078125, "learning_rate": 0.0004161679112816948, "loss": 5.0611, "mean_token_accuracy": 0.20746947526931764, "num_tokens": 67456973.0, "step": 29455 }, { "entropy": 5.339000797271728, "epoch": 2.9122182680901543, "grad_norm": 1.1171875, "learning_rate": 0.00041614042970489326, "loss": 4.9281, "mean_token_accuracy": 0.22249667197465897, "num_tokens": 67468134.0, "step": 29460 }, { "entropy": 5.464120578765869, "epoch": 2.9127125345986555, "grad_norm": 1.0546875, "learning_rate": 0.00041611294465601525, "loss": 5.0719, "mean_token_accuracy": 0.2054212436079979, "num_tokens": 67479973.0, "step": 29465 }, { "entropy": 5.461737489700317, "epoch": 2.9132068011071572, "grad_norm": 1.203125, "learning_rate": 0.00041608545613573694, "loss": 5.0215, "mean_token_accuracy": 0.2158416450023651, "num_tokens": 67491469.0, "step": 29470 }, { "entropy": 5.4495023727417, "epoch": 2.9137010676156585, "grad_norm": 1.109375, "learning_rate": 0.0004160579641447345, "loss": 5.103, "mean_token_accuracy": 0.20878621190786362, "num_tokens": 67502911.0, "step": 29475 }, { "entropy": 5.496672058105469, "epoch": 2.9141953341241598, "grad_norm": 1.171875, "learning_rate": 0.00041603046868368427, "loss": 5.1399, "mean_token_accuracy": 0.20336408913135529, "num_tokens": 67513958.0, "step": 29480 }, { "entropy": 5.4117344379425045, "epoch": 2.914689600632661, "grad_norm": 1.0859375, "learning_rate": 0.00041600296975326267, "loss": 5.0302, "mean_token_accuracy": 0.21220000088214874, "num_tokens": 67524894.0, "step": 29485 }, { "entropy": 5.406762170791626, "epoch": 2.9151838671411623, "grad_norm": 0.9921875, "learning_rate": 0.0004159754673541461, "loss": 4.9453, "mean_token_accuracy": 0.22098466604948044, "num_tokens": 67536256.0, "step": 29490 }, { "entropy": 5.430414056777954, "epoch": 2.915678133649664, "grad_norm": 0.96484375, "learning_rate": 0.00041594796148701116, "loss": 4.9947, "mean_token_accuracy": 0.21433212459087372, "num_tokens": 67548064.0, "step": 29495 }, { "entropy": 5.470881938934326, "epoch": 2.9161724001581653, "grad_norm": 1.0078125, "learning_rate": 0.0004159204521525345, "loss": 5.0271, "mean_token_accuracy": 0.2102196842432022, "num_tokens": 67559530.0, "step": 29500 }, { "entropy": 5.45843095779419, "epoch": 2.9166666666666665, "grad_norm": 1.0390625, "learning_rate": 0.0004158929393513929, "loss": 5.1169, "mean_token_accuracy": 0.21055484414100648, "num_tokens": 67571633.0, "step": 29505 }, { "entropy": 5.467301845550537, "epoch": 2.9171609331751682, "grad_norm": 0.98828125, "learning_rate": 0.00041586542308426306, "loss": 4.9826, "mean_token_accuracy": 0.21196904629468918, "num_tokens": 67583778.0, "step": 29510 }, { "entropy": 5.3847614288330075, "epoch": 2.9176551996836695, "grad_norm": 0.96875, "learning_rate": 0.00041583790335182196, "loss": 4.9428, "mean_token_accuracy": 0.22037430107593536, "num_tokens": 67595803.0, "step": 29515 }, { "entropy": 5.35503625869751, "epoch": 2.9181494661921707, "grad_norm": 1.1640625, "learning_rate": 0.00041581038015474673, "loss": 5.0153, "mean_token_accuracy": 0.2126976504921913, "num_tokens": 67606030.0, "step": 29520 }, { "entropy": 5.471170043945312, "epoch": 2.918643732700672, "grad_norm": 1.1640625, "learning_rate": 0.00041578285349371414, "loss": 5.1335, "mean_token_accuracy": 0.20745330601930617, "num_tokens": 67617632.0, "step": 29525 }, { "entropy": 5.472629690170288, "epoch": 2.9191379992091737, "grad_norm": 1.0859375, "learning_rate": 0.0004157553233694016, "loss": 4.9894, "mean_token_accuracy": 0.21809024661779403, "num_tokens": 67627954.0, "step": 29530 }, { "entropy": 5.399608850479126, "epoch": 2.919632265717675, "grad_norm": 1.03125, "learning_rate": 0.0004157277897824862, "loss": 5.0145, "mean_token_accuracy": 0.21048288494348527, "num_tokens": 67639180.0, "step": 29535 }, { "entropy": 5.388995552062989, "epoch": 2.9201265322261762, "grad_norm": 0.9921875, "learning_rate": 0.0004157002527336454, "loss": 5.106, "mean_token_accuracy": 0.20704077929258347, "num_tokens": 67651834.0, "step": 29540 }, { "entropy": 5.442848491668701, "epoch": 2.920620798734678, "grad_norm": 0.984375, "learning_rate": 0.00041567271222355657, "loss": 4.9851, "mean_token_accuracy": 0.2132923573255539, "num_tokens": 67663263.0, "step": 29545 }, { "entropy": 5.473592853546142, "epoch": 2.921115065243179, "grad_norm": 1.1015625, "learning_rate": 0.0004156451682528971, "loss": 5.0195, "mean_token_accuracy": 0.20816118121147156, "num_tokens": 67673970.0, "step": 29550 }, { "entropy": 5.541548538208008, "epoch": 2.9216093317516805, "grad_norm": 1.046875, "learning_rate": 0.00041561762082234467, "loss": 5.1055, "mean_token_accuracy": 0.20621173977851867, "num_tokens": 67685668.0, "step": 29555 }, { "entropy": 5.3782542705535885, "epoch": 2.9221035982601817, "grad_norm": 1.046875, "learning_rate": 0.000415590069932577, "loss": 4.9419, "mean_token_accuracy": 0.22660989463329315, "num_tokens": 67696169.0, "step": 29560 }, { "entropy": 5.498178100585937, "epoch": 2.9225978647686834, "grad_norm": 1.1171875, "learning_rate": 0.0004155625155842719, "loss": 5.0873, "mean_token_accuracy": 0.20074700117111205, "num_tokens": 67709211.0, "step": 29565 }, { "entropy": 5.469609546661377, "epoch": 2.9230921312771847, "grad_norm": 1.046875, "learning_rate": 0.000415534957778107, "loss": 5.0974, "mean_token_accuracy": 0.2067451223731041, "num_tokens": 67720967.0, "step": 29570 }, { "entropy": 5.430124378204345, "epoch": 2.923586397785686, "grad_norm": 1.09375, "learning_rate": 0.0004155073965147604, "loss": 4.945, "mean_token_accuracy": 0.21931995302438737, "num_tokens": 67733099.0, "step": 29575 }, { "entropy": 5.390460348129272, "epoch": 2.9240806642941877, "grad_norm": 1.0390625, "learning_rate": 0.00041547983179491, "loss": 5.0073, "mean_token_accuracy": 0.21467345654964448, "num_tokens": 67744739.0, "step": 29580 }, { "entropy": 5.403063631057739, "epoch": 2.924574930802689, "grad_norm": 1.078125, "learning_rate": 0.00041545226361923394, "loss": 5.0877, "mean_token_accuracy": 0.21051979959011077, "num_tokens": 67756944.0, "step": 29585 }, { "entropy": 5.508056592941284, "epoch": 2.92506919731119, "grad_norm": 1.0234375, "learning_rate": 0.00041542469198841043, "loss": 5.11, "mean_token_accuracy": 0.2051416426897049, "num_tokens": 67769018.0, "step": 29590 }, { "entropy": 5.469253206253052, "epoch": 2.9255634638196915, "grad_norm": 1.015625, "learning_rate": 0.0004153971169031177, "loss": 5.0022, "mean_token_accuracy": 0.21390393525362014, "num_tokens": 67780164.0, "step": 29595 }, { "entropy": 5.462141847610473, "epoch": 2.9260577303281927, "grad_norm": 1.1484375, "learning_rate": 0.0004153695383640341, "loss": 5.0358, "mean_token_accuracy": 0.21115020513534546, "num_tokens": 67790841.0, "step": 29600 }, { "entropy": 5.4433776378631595, "epoch": 2.9265519968366944, "grad_norm": 1.03125, "learning_rate": 0.00041534195637183807, "loss": 5.0333, "mean_token_accuracy": 0.2089438945055008, "num_tokens": 67802397.0, "step": 29605 }, { "entropy": 5.437507629394531, "epoch": 2.9270462633451957, "grad_norm": 1.15625, "learning_rate": 0.0004153143709272082, "loss": 5.0451, "mean_token_accuracy": 0.21321855783462523, "num_tokens": 67814079.0, "step": 29610 }, { "entropy": 5.473219871520996, "epoch": 2.927540529853697, "grad_norm": 1.015625, "learning_rate": 0.000415286782030823, "loss": 5.0869, "mean_token_accuracy": 0.20599968880414962, "num_tokens": 67825377.0, "step": 29615 }, { "entropy": 5.370988655090332, "epoch": 2.9280347963621987, "grad_norm": 0.98046875, "learning_rate": 0.00041525918968336116, "loss": 4.9968, "mean_token_accuracy": 0.22287837862968446, "num_tokens": 67838277.0, "step": 29620 }, { "entropy": 5.4456212520599365, "epoch": 2.9285290628707, "grad_norm": 1.09375, "learning_rate": 0.00041523159388550155, "loss": 5.0376, "mean_token_accuracy": 0.21056950688362122, "num_tokens": 67849720.0, "step": 29625 }, { "entropy": 5.4076502323150635, "epoch": 2.929023329379201, "grad_norm": 1.09375, "learning_rate": 0.00041520399463792297, "loss": 4.9846, "mean_token_accuracy": 0.2173058345913887, "num_tokens": 67860994.0, "step": 29630 }, { "entropy": 5.394793605804443, "epoch": 2.9295175958877024, "grad_norm": 0.94140625, "learning_rate": 0.00041517639194130435, "loss": 5.1036, "mean_token_accuracy": 0.20377420485019684, "num_tokens": 67874445.0, "step": 29635 }, { "entropy": 5.426474905014038, "epoch": 2.930011862396204, "grad_norm": 0.984375, "learning_rate": 0.00041514878579632477, "loss": 4.9666, "mean_token_accuracy": 0.21433853656053542, "num_tokens": 67886789.0, "step": 29640 }, { "entropy": 5.513182497024536, "epoch": 2.9305061289047054, "grad_norm": 1.1796875, "learning_rate": 0.0004151211762036632, "loss": 5.0627, "mean_token_accuracy": 0.2147467166185379, "num_tokens": 67898839.0, "step": 29645 }, { "entropy": 5.43680510520935, "epoch": 2.9310003954132067, "grad_norm": 1.03125, "learning_rate": 0.00041509356316399916, "loss": 5.0764, "mean_token_accuracy": 0.20469371676445008, "num_tokens": 67909419.0, "step": 29650 }, { "entropy": 5.370168781280517, "epoch": 2.9314946619217084, "grad_norm": 0.984375, "learning_rate": 0.00041506594667801164, "loss": 5.0222, "mean_token_accuracy": 0.2114386036992073, "num_tokens": 67922011.0, "step": 29655 }, { "entropy": 5.510838317871094, "epoch": 2.9319889284302096, "grad_norm": 0.9921875, "learning_rate": 0.00041503832674638, "loss": 5.1727, "mean_token_accuracy": 0.19935372620820999, "num_tokens": 67934445.0, "step": 29660 }, { "entropy": 5.5285179138183596, "epoch": 2.932483194938711, "grad_norm": 1.0390625, "learning_rate": 0.0004150107033697839, "loss": 5.0974, "mean_token_accuracy": 0.2022954374551773, "num_tokens": 67944914.0, "step": 29665 }, { "entropy": 5.417542791366577, "epoch": 2.932977461447212, "grad_norm": 1.0703125, "learning_rate": 0.0004149830765489028, "loss": 5.0579, "mean_token_accuracy": 0.21152153611183167, "num_tokens": 67955375.0, "step": 29670 }, { "entropy": 5.486369180679321, "epoch": 2.933471727955714, "grad_norm": 1.0546875, "learning_rate": 0.00041495544628441627, "loss": 5.0195, "mean_token_accuracy": 0.21479301750659943, "num_tokens": 67968453.0, "step": 29675 }, { "entropy": 5.47714319229126, "epoch": 2.933965994464215, "grad_norm": 1.0625, "learning_rate": 0.00041492781257700405, "loss": 5.0378, "mean_token_accuracy": 0.20948146730661393, "num_tokens": 67979099.0, "step": 29680 }, { "entropy": 5.426479864120483, "epoch": 2.9344602609727164, "grad_norm": 0.97265625, "learning_rate": 0.00041490017542734594, "loss": 5.0022, "mean_token_accuracy": 0.21084415763616562, "num_tokens": 67989399.0, "step": 29685 }, { "entropy": 5.432713890075684, "epoch": 2.934954527481218, "grad_norm": 1.078125, "learning_rate": 0.00041487253483612173, "loss": 4.9375, "mean_token_accuracy": 0.22332856953144073, "num_tokens": 68001255.0, "step": 29690 }, { "entropy": 5.423839569091797, "epoch": 2.9354487939897194, "grad_norm": 1.0078125, "learning_rate": 0.0004148448908040116, "loss": 5.0283, "mean_token_accuracy": 0.21043030321598052, "num_tokens": 68012844.0, "step": 29695 }, { "entropy": 5.377053594589233, "epoch": 2.9359430604982206, "grad_norm": 1.1328125, "learning_rate": 0.0004148172433316954, "loss": 5.025, "mean_token_accuracy": 0.21104152947664262, "num_tokens": 68024986.0, "step": 29700 }, { "entropy": 5.496196317672729, "epoch": 2.936437327006722, "grad_norm": 0.99609375, "learning_rate": 0.0004147895924198533, "loss": 5.0002, "mean_token_accuracy": 0.2192436307668686, "num_tokens": 68036081.0, "step": 29705 }, { "entropy": 5.456634140014648, "epoch": 2.936931593515223, "grad_norm": 0.9609375, "learning_rate": 0.00041476193806916557, "loss": 5.0424, "mean_token_accuracy": 0.2120230183005333, "num_tokens": 68049054.0, "step": 29710 }, { "entropy": 5.479152870178223, "epoch": 2.937425860023725, "grad_norm": 1.1875, "learning_rate": 0.0004147342802803124, "loss": 5.0652, "mean_token_accuracy": 0.21160530000925065, "num_tokens": 68060440.0, "step": 29715 }, { "entropy": 5.34980263710022, "epoch": 2.937920126532226, "grad_norm": 1.0703125, "learning_rate": 0.0004147066190539744, "loss": 5.053, "mean_token_accuracy": 0.21492915451526642, "num_tokens": 68072260.0, "step": 29720 }, { "entropy": 5.431468152999878, "epoch": 2.938414393040728, "grad_norm": 0.94921875, "learning_rate": 0.0004146789543908318, "loss": 5.0006, "mean_token_accuracy": 0.20896161049604417, "num_tokens": 68084737.0, "step": 29725 }, { "entropy": 5.444734525680542, "epoch": 2.938908659549229, "grad_norm": 1.0390625, "learning_rate": 0.0004146512862915653, "loss": 4.9945, "mean_token_accuracy": 0.21797845065593718, "num_tokens": 68097146.0, "step": 29730 }, { "entropy": 5.523804616928101, "epoch": 2.9394029260577303, "grad_norm": 1.09375, "learning_rate": 0.0004146236147568554, "loss": 5.1032, "mean_token_accuracy": 0.20520014315843582, "num_tokens": 68108158.0, "step": 29735 }, { "entropy": 5.357573461532593, "epoch": 2.9398971925662316, "grad_norm": 1.0, "learning_rate": 0.0004145959397873831, "loss": 4.9716, "mean_token_accuracy": 0.2156193658709526, "num_tokens": 68120242.0, "step": 29740 }, { "entropy": 5.45639181137085, "epoch": 2.940391459074733, "grad_norm": 1.0234375, "learning_rate": 0.00041456826138382884, "loss": 5.0986, "mean_token_accuracy": 0.20665988177061081, "num_tokens": 68131372.0, "step": 29745 }, { "entropy": 5.4489704132080075, "epoch": 2.9408857255832346, "grad_norm": 1.046875, "learning_rate": 0.0004145405795468738, "loss": 5.0631, "mean_token_accuracy": 0.21649622917175293, "num_tokens": 68142828.0, "step": 29750 }, { "entropy": 5.445520401000977, "epoch": 2.941379992091736, "grad_norm": 1.03125, "learning_rate": 0.0004145128942771988, "loss": 5.1082, "mean_token_accuracy": 0.2005729541182518, "num_tokens": 68154398.0, "step": 29755 }, { "entropy": 5.4622945308685305, "epoch": 2.941874258600237, "grad_norm": 0.99609375, "learning_rate": 0.000414485205575485, "loss": 5.0797, "mean_token_accuracy": 0.20611651688814164, "num_tokens": 68166645.0, "step": 29760 }, { "entropy": 5.480318880081176, "epoch": 2.942368525108739, "grad_norm": 1.0390625, "learning_rate": 0.00041445751344241344, "loss": 4.9827, "mean_token_accuracy": 0.2160264030098915, "num_tokens": 68176800.0, "step": 29765 }, { "entropy": 5.446160173416137, "epoch": 2.94286279161724, "grad_norm": 1.09375, "learning_rate": 0.00041442981787866547, "loss": 5.0479, "mean_token_accuracy": 0.21194081157445907, "num_tokens": 68187933.0, "step": 29770 }, { "entropy": 5.458788824081421, "epoch": 2.9433570581257413, "grad_norm": 0.9296875, "learning_rate": 0.0004144021188849223, "loss": 5.1331, "mean_token_accuracy": 0.20279710590839387, "num_tokens": 68199925.0, "step": 29775 }, { "entropy": 5.37613525390625, "epoch": 2.9438513246342426, "grad_norm": 1.0078125, "learning_rate": 0.0004143744164618655, "loss": 4.9579, "mean_token_accuracy": 0.2154856115579605, "num_tokens": 68211313.0, "step": 29780 }, { "entropy": 5.450648450851441, "epoch": 2.9443455911427443, "grad_norm": 1.015625, "learning_rate": 0.00041434671061017634, "loss": 5.0538, "mean_token_accuracy": 0.20749825239181519, "num_tokens": 68223148.0, "step": 29785 }, { "entropy": 5.4024779319763185, "epoch": 2.9448398576512456, "grad_norm": 1.015625, "learning_rate": 0.0004143190013305364, "loss": 5.0097, "mean_token_accuracy": 0.21971790939569474, "num_tokens": 68234369.0, "step": 29790 }, { "entropy": 5.428864908218384, "epoch": 2.945334124159747, "grad_norm": 1.1015625, "learning_rate": 0.00041429128862362756, "loss": 5.009, "mean_token_accuracy": 0.21110998839139938, "num_tokens": 68243903.0, "step": 29795 }, { "entropy": 5.454585361480713, "epoch": 2.9458283906682485, "grad_norm": 0.99609375, "learning_rate": 0.0004142635724901313, "loss": 5.0245, "mean_token_accuracy": 0.20784134566783904, "num_tokens": 68254997.0, "step": 29800 }, { "entropy": 5.381480026245117, "epoch": 2.94632265717675, "grad_norm": 1.015625, "learning_rate": 0.0004142358529307296, "loss": 4.9511, "mean_token_accuracy": 0.21778082102537155, "num_tokens": 68266203.0, "step": 29805 }, { "entropy": 5.444616413116455, "epoch": 2.946816923685251, "grad_norm": 1.1171875, "learning_rate": 0.0004142081299461044, "loss": 5.0297, "mean_token_accuracy": 0.21376969218254088, "num_tokens": 68275930.0, "step": 29810 }, { "entropy": 5.432279491424561, "epoch": 2.9473111901937523, "grad_norm": 1.015625, "learning_rate": 0.0004141804035369375, "loss": 5.0059, "mean_token_accuracy": 0.21652431339025496, "num_tokens": 68287468.0, "step": 29815 }, { "entropy": 5.416721439361572, "epoch": 2.9478054567022536, "grad_norm": 1.0703125, "learning_rate": 0.0004141526737039111, "loss": 4.9901, "mean_token_accuracy": 0.20955535471439363, "num_tokens": 68299151.0, "step": 29820 }, { "entropy": 5.475926780700684, "epoch": 2.9482997232107553, "grad_norm": 1.0390625, "learning_rate": 0.0004141249404477074, "loss": 5.0812, "mean_token_accuracy": 0.19960540682077407, "num_tokens": 68310874.0, "step": 29825 }, { "entropy": 5.474725008010864, "epoch": 2.9487939897192565, "grad_norm": 0.96875, "learning_rate": 0.0004140972037690085, "loss": 5.0172, "mean_token_accuracy": 0.21428060084581374, "num_tokens": 68323449.0, "step": 29830 }, { "entropy": 5.402032852172852, "epoch": 2.9492882562277583, "grad_norm": 1.015625, "learning_rate": 0.00041406946366849686, "loss": 5.0158, "mean_token_accuracy": 0.217159466445446, "num_tokens": 68334799.0, "step": 29835 }, { "entropy": 5.371946382522583, "epoch": 2.9497825227362595, "grad_norm": 1.0390625, "learning_rate": 0.00041404172014685483, "loss": 4.9902, "mean_token_accuracy": 0.2194390505552292, "num_tokens": 68348019.0, "step": 29840 }, { "entropy": 5.523121643066406, "epoch": 2.9502767892447608, "grad_norm": 1.0, "learning_rate": 0.0004140139732047649, "loss": 5.0408, "mean_token_accuracy": 0.20583546608686448, "num_tokens": 68360969.0, "step": 29845 }, { "entropy": 5.450361061096191, "epoch": 2.950771055753262, "grad_norm": 1.0703125, "learning_rate": 0.0004139862228429097, "loss": 5.0556, "mean_token_accuracy": 0.21377750337123871, "num_tokens": 68373245.0, "step": 29850 }, { "entropy": 5.3475220680236815, "epoch": 2.9512653222617633, "grad_norm": 1.0, "learning_rate": 0.00041395846906197174, "loss": 4.972, "mean_token_accuracy": 0.22119609117507935, "num_tokens": 68385278.0, "step": 29855 }, { "entropy": 5.428192281723023, "epoch": 2.951759588770265, "grad_norm": 1.09375, "learning_rate": 0.00041393071186263396, "loss": 4.9914, "mean_token_accuracy": 0.20961822867393493, "num_tokens": 68396624.0, "step": 29860 }, { "entropy": 5.452015829086304, "epoch": 2.9522538552787663, "grad_norm": 1.0390625, "learning_rate": 0.0004139029512455791, "loss": 4.9811, "mean_token_accuracy": 0.21468058675527574, "num_tokens": 68408656.0, "step": 29865 }, { "entropy": 5.423299551010132, "epoch": 2.9527481217872675, "grad_norm": 1.0390625, "learning_rate": 0.0004138751872114902, "loss": 4.9609, "mean_token_accuracy": 0.21442710161209105, "num_tokens": 68421150.0, "step": 29870 }, { "entropy": 5.496262407302856, "epoch": 2.9532423882957692, "grad_norm": 1.0, "learning_rate": 0.00041384741976105004, "loss": 5.0633, "mean_token_accuracy": 0.20297735780477524, "num_tokens": 68432446.0, "step": 29875 }, { "entropy": 5.375298595428466, "epoch": 2.9537366548042705, "grad_norm": 0.9921875, "learning_rate": 0.00041381964889494185, "loss": 5.0744, "mean_token_accuracy": 0.2089361071586609, "num_tokens": 68443508.0, "step": 29880 }, { "entropy": 5.421127462387085, "epoch": 2.9542309213127718, "grad_norm": 1.0234375, "learning_rate": 0.0004137918746138487, "loss": 5.0491, "mean_token_accuracy": 0.20866889953613282, "num_tokens": 68454425.0, "step": 29885 }, { "entropy": 5.423910856246948, "epoch": 2.954725187821273, "grad_norm": 1.0546875, "learning_rate": 0.00041376409691845395, "loss": 4.9974, "mean_token_accuracy": 0.21270785480737686, "num_tokens": 68467759.0, "step": 29890 }, { "entropy": 5.433946228027343, "epoch": 2.9552194543297747, "grad_norm": 1.171875, "learning_rate": 0.00041373631580944093, "loss": 5.0112, "mean_token_accuracy": 0.2177659884095192, "num_tokens": 68478447.0, "step": 29895 }, { "entropy": 5.4856034278869625, "epoch": 2.955713720838276, "grad_norm": 1.078125, "learning_rate": 0.000413708531287493, "loss": 5.1154, "mean_token_accuracy": 0.20548634678125383, "num_tokens": 68489056.0, "step": 29900 }, { "entropy": 5.495143890380859, "epoch": 2.9562079873467773, "grad_norm": 1.0390625, "learning_rate": 0.0004136807433532936, "loss": 5.1022, "mean_token_accuracy": 0.2039782300591469, "num_tokens": 68500697.0, "step": 29905 }, { "entropy": 5.455454730987549, "epoch": 2.956702253855279, "grad_norm": 1.1484375, "learning_rate": 0.0004136529520075265, "loss": 4.9922, "mean_token_accuracy": 0.2124455526471138, "num_tokens": 68510594.0, "step": 29910 }, { "entropy": 5.410472202301025, "epoch": 2.9571965203637802, "grad_norm": 1.0546875, "learning_rate": 0.00041362515725087523, "loss": 5.0492, "mean_token_accuracy": 0.20675116777420044, "num_tokens": 68521293.0, "step": 29915 }, { "entropy": 5.399221277236938, "epoch": 2.9576907868722815, "grad_norm": 1.0390625, "learning_rate": 0.00041359735908402356, "loss": 4.9828, "mean_token_accuracy": 0.22450968325138093, "num_tokens": 68532380.0, "step": 29920 }, { "entropy": 5.445450782775879, "epoch": 2.9581850533807827, "grad_norm": 1.0390625, "learning_rate": 0.00041356955750765535, "loss": 5.0248, "mean_token_accuracy": 0.21461350172758104, "num_tokens": 68543510.0, "step": 29925 }, { "entropy": 5.4660967826843265, "epoch": 2.9586793198892845, "grad_norm": 1.1171875, "learning_rate": 0.0004135417525224546, "loss": 5.0983, "mean_token_accuracy": 0.20471111238002776, "num_tokens": 68556191.0, "step": 29930 }, { "entropy": 5.502834177017212, "epoch": 2.9591735863977857, "grad_norm": 1.0234375, "learning_rate": 0.0004135139441291052, "loss": 5.1435, "mean_token_accuracy": 0.2034518301486969, "num_tokens": 68568225.0, "step": 29935 }, { "entropy": 5.549093866348267, "epoch": 2.959667852906287, "grad_norm": 1.09375, "learning_rate": 0.0004134861323282913, "loss": 5.0724, "mean_token_accuracy": 0.20381063967943192, "num_tokens": 68580040.0, "step": 29940 }, { "entropy": 5.409531450271606, "epoch": 2.9601621194147887, "grad_norm": 0.98828125, "learning_rate": 0.00041345831712069696, "loss": 4.9844, "mean_token_accuracy": 0.20694458335638047, "num_tokens": 68590338.0, "step": 29945 }, { "entropy": 5.413264179229737, "epoch": 2.96065638592329, "grad_norm": 1.0625, "learning_rate": 0.00041343049850700673, "loss": 5.0419, "mean_token_accuracy": 0.2098769351840019, "num_tokens": 68601153.0, "step": 29950 }, { "entropy": 5.451947116851807, "epoch": 2.961150652431791, "grad_norm": 1.0390625, "learning_rate": 0.00041340267648790464, "loss": 5.0294, "mean_token_accuracy": 0.21531984806060792, "num_tokens": 68612665.0, "step": 29955 }, { "entropy": 5.376000118255615, "epoch": 2.9616449189402925, "grad_norm": 1.03125, "learning_rate": 0.0004133748510640752, "loss": 4.9735, "mean_token_accuracy": 0.2169503316283226, "num_tokens": 68624229.0, "step": 29960 }, { "entropy": 5.4725548267364506, "epoch": 2.9621391854487937, "grad_norm": 1.0078125, "learning_rate": 0.00041334702223620306, "loss": 5.054, "mean_token_accuracy": 0.20738171339035033, "num_tokens": 68635811.0, "step": 29965 }, { "entropy": 5.405178546905518, "epoch": 2.9626334519572954, "grad_norm": 0.984375, "learning_rate": 0.00041331919000497263, "loss": 4.9824, "mean_token_accuracy": 0.2144791975617409, "num_tokens": 68647518.0, "step": 29970 }, { "entropy": 5.4682763576507565, "epoch": 2.9631277184657967, "grad_norm": 1.1796875, "learning_rate": 0.00041329135437106866, "loss": 5.1861, "mean_token_accuracy": 0.20350570380687713, "num_tokens": 68658739.0, "step": 29975 }, { "entropy": 5.414107608795166, "epoch": 2.9636219849742984, "grad_norm": 0.9921875, "learning_rate": 0.00041326351533517604, "loss": 4.978, "mean_token_accuracy": 0.22001911848783492, "num_tokens": 68670317.0, "step": 29980 }, { "entropy": 5.420254755020141, "epoch": 2.9641162514827997, "grad_norm": 1.1171875, "learning_rate": 0.0004132356728979794, "loss": 4.9938, "mean_token_accuracy": 0.22395044714212417, "num_tokens": 68681584.0, "step": 29985 }, { "entropy": 5.354911613464355, "epoch": 2.964610517991301, "grad_norm": 0.9609375, "learning_rate": 0.00041320782706016375, "loss": 4.9501, "mean_token_accuracy": 0.2232272669672966, "num_tokens": 68694296.0, "step": 29990 }, { "entropy": 5.3138494968414305, "epoch": 2.965104784499802, "grad_norm": 0.9609375, "learning_rate": 0.0004131799778224142, "loss": 4.8981, "mean_token_accuracy": 0.2237188771367073, "num_tokens": 68705281.0, "step": 29995 }, { "entropy": 5.365420198440551, "epoch": 2.9655990510083035, "grad_norm": 1.0078125, "learning_rate": 0.00041315212518541565, "loss": 4.8691, "mean_token_accuracy": 0.22169061601161957, "num_tokens": 68716146.0, "step": 30000 }, { "epoch": 2.9655990510083035, "eval_entropy": 5.2244182545613835, "eval_loss": 5.084600925445557, "eval_mean_token_accuracy": 0.21783759948622256, "eval_num_tokens": 68716146.0, "eval_runtime": 26.5243, "eval_samples_per_second": 1225.783, "eval_steps_per_second": 153.256, "step": 30000 }, { "entropy": 5.374813413619995, "epoch": 2.966093317516805, "grad_norm": 1.0390625, "learning_rate": 0.0004131242691498534, "loss": 5.0081, "mean_token_accuracy": 0.21937230080366135, "num_tokens": 68728812.0, "step": 30005 }, { "entropy": 5.398124265670776, "epoch": 2.9665875840253064, "grad_norm": 0.96484375, "learning_rate": 0.00041309640971641276, "loss": 5.0504, "mean_token_accuracy": 0.2035959243774414, "num_tokens": 68741283.0, "step": 30010 }, { "entropy": 5.433569812774659, "epoch": 2.9670818505338077, "grad_norm": 1.09375, "learning_rate": 0.000413068546885779, "loss": 4.9419, "mean_token_accuracy": 0.2216383546590805, "num_tokens": 68752701.0, "step": 30015 }, { "entropy": 5.339234113693237, "epoch": 2.9675761170423094, "grad_norm": 1.0234375, "learning_rate": 0.0004130406806586375, "loss": 4.9358, "mean_token_accuracy": 0.22480463236570358, "num_tokens": 68763133.0, "step": 30020 }, { "entropy": 5.34029369354248, "epoch": 2.9680703835508107, "grad_norm": 0.98046875, "learning_rate": 0.000413012811035674, "loss": 5.0004, "mean_token_accuracy": 0.21680634766817092, "num_tokens": 68774692.0, "step": 30025 }, { "entropy": 5.447988653182984, "epoch": 2.968564650059312, "grad_norm": 1.0859375, "learning_rate": 0.0004129849380175738, "loss": 5.0195, "mean_token_accuracy": 0.20923581421375276, "num_tokens": 68786233.0, "step": 30030 }, { "entropy": 5.386737871170044, "epoch": 2.969058916567813, "grad_norm": 1.1015625, "learning_rate": 0.0004129570616050227, "loss": 5.0184, "mean_token_accuracy": 0.20901082456111908, "num_tokens": 68799674.0, "step": 30035 }, { "entropy": 5.428809309005738, "epoch": 2.969553183076315, "grad_norm": 0.9765625, "learning_rate": 0.00041292918179870665, "loss": 5.0359, "mean_token_accuracy": 0.21005220115184783, "num_tokens": 68811163.0, "step": 30040 }, { "entropy": 5.478037738800049, "epoch": 2.970047449584816, "grad_norm": 1.046875, "learning_rate": 0.0004129012985993112, "loss": 5.0011, "mean_token_accuracy": 0.211514151096344, "num_tokens": 68822781.0, "step": 30045 }, { "entropy": 5.418920373916626, "epoch": 2.9705417160933174, "grad_norm": 1.171875, "learning_rate": 0.00041287341200752235, "loss": 5.0359, "mean_token_accuracy": 0.21865557432174682, "num_tokens": 68834908.0, "step": 30050 }, { "entropy": 5.336770915985108, "epoch": 2.971035982601819, "grad_norm": 1.0234375, "learning_rate": 0.00041284552202402634, "loss": 4.8938, "mean_token_accuracy": 0.2242880642414093, "num_tokens": 68844253.0, "step": 30055 }, { "entropy": 5.394455051422119, "epoch": 2.9715302491103204, "grad_norm": 1.09375, "learning_rate": 0.000412817628649509, "loss": 4.9613, "mean_token_accuracy": 0.21909925937652588, "num_tokens": 68856132.0, "step": 30060 }, { "entropy": 5.431913423538208, "epoch": 2.9720245156188216, "grad_norm": 1.0078125, "learning_rate": 0.00041278973188465655, "loss": 5.0175, "mean_token_accuracy": 0.21180320531129837, "num_tokens": 68867536.0, "step": 30065 }, { "entropy": 5.338440608978272, "epoch": 2.972518782127323, "grad_norm": 1.0078125, "learning_rate": 0.0004127618317301555, "loss": 5.0174, "mean_token_accuracy": 0.21350359320640563, "num_tokens": 68880544.0, "step": 30070 }, { "entropy": 5.437804174423218, "epoch": 2.973013048635824, "grad_norm": 0.96875, "learning_rate": 0.00041273392818669193, "loss": 5.1065, "mean_token_accuracy": 0.21149717569351195, "num_tokens": 68890755.0, "step": 30075 }, { "entropy": 5.527105283737183, "epoch": 2.973507315144326, "grad_norm": 0.98046875, "learning_rate": 0.00041270602125495227, "loss": 5.0946, "mean_token_accuracy": 0.19919875562191008, "num_tokens": 68902280.0, "step": 30080 }, { "entropy": 5.500098180770874, "epoch": 2.974001581652827, "grad_norm": 1.03125, "learning_rate": 0.00041267811093562325, "loss": 5.0941, "mean_token_accuracy": 0.21007563024759293, "num_tokens": 68913674.0, "step": 30085 }, { "entropy": 5.484152030944824, "epoch": 2.974495848161329, "grad_norm": 1.015625, "learning_rate": 0.00041265019722939127, "loss": 5.0329, "mean_token_accuracy": 0.2125246748328209, "num_tokens": 68925129.0, "step": 30090 }, { "entropy": 5.382931661605835, "epoch": 2.97499011466983, "grad_norm": 1.09375, "learning_rate": 0.00041262228013694307, "loss": 4.9408, "mean_token_accuracy": 0.21873839199543, "num_tokens": 68935157.0, "step": 30095 }, { "entropy": 5.386719608306885, "epoch": 2.9754843811783314, "grad_norm": 1.078125, "learning_rate": 0.00041259435965896555, "loss": 4.9996, "mean_token_accuracy": 0.2097771406173706, "num_tokens": 68946752.0, "step": 30100 }, { "entropy": 5.447910165786743, "epoch": 2.9759786476868326, "grad_norm": 0.953125, "learning_rate": 0.0004125664357961453, "loss": 5.0005, "mean_token_accuracy": 0.2104752317070961, "num_tokens": 68958078.0, "step": 30105 }, { "entropy": 5.484065532684326, "epoch": 2.976472914195334, "grad_norm": 0.96484375, "learning_rate": 0.00041253850854916946, "loss": 5.0522, "mean_token_accuracy": 0.20692237764596938, "num_tokens": 68970384.0, "step": 30110 }, { "entropy": 5.409961891174317, "epoch": 2.9769671807038356, "grad_norm": 0.9453125, "learning_rate": 0.00041251057791872497, "loss": 4.9962, "mean_token_accuracy": 0.2119045689702034, "num_tokens": 68983209.0, "step": 30115 }, { "entropy": 5.517865610122681, "epoch": 2.977461447212337, "grad_norm": 1.078125, "learning_rate": 0.00041248264390549884, "loss": 5.135, "mean_token_accuracy": 0.20450677573680878, "num_tokens": 68994710.0, "step": 30120 }, { "entropy": 5.441586971282959, "epoch": 2.977955713720838, "grad_norm": 1.0546875, "learning_rate": 0.00041245470651017846, "loss": 5.0686, "mean_token_accuracy": 0.2117442160844803, "num_tokens": 69005457.0, "step": 30125 }, { "entropy": 5.43292818069458, "epoch": 2.97844998022934, "grad_norm": 0.953125, "learning_rate": 0.00041242676573345096, "loss": 4.9552, "mean_token_accuracy": 0.2197311520576477, "num_tokens": 69018379.0, "step": 30130 }, { "entropy": 5.499438238143921, "epoch": 2.978944246737841, "grad_norm": 0.95703125, "learning_rate": 0.0004123988215760036, "loss": 5.0582, "mean_token_accuracy": 0.20787317603826522, "num_tokens": 69029608.0, "step": 30135 }, { "entropy": 5.388748836517334, "epoch": 2.9794385132463423, "grad_norm": 1.078125, "learning_rate": 0.000412370874038524, "loss": 5.0204, "mean_token_accuracy": 0.21486295908689498, "num_tokens": 69040341.0, "step": 30140 }, { "entropy": 5.397605943679809, "epoch": 2.9799327797548436, "grad_norm": 1.0703125, "learning_rate": 0.00041234292312169964, "loss": 5.0725, "mean_token_accuracy": 0.20575768798589705, "num_tokens": 69050814.0, "step": 30145 }, { "entropy": 5.532184886932373, "epoch": 2.9804270462633453, "grad_norm": 0.94921875, "learning_rate": 0.0004123149688262179, "loss": 5.1236, "mean_token_accuracy": 0.20521850287914276, "num_tokens": 69063087.0, "step": 30150 }, { "entropy": 5.524083662033081, "epoch": 2.9809213127718466, "grad_norm": 0.94921875, "learning_rate": 0.0004122870111527668, "loss": 5.0957, "mean_token_accuracy": 0.20572248995304107, "num_tokens": 69075342.0, "step": 30155 }, { "entropy": 5.508407354354858, "epoch": 2.981415579280348, "grad_norm": 0.96875, "learning_rate": 0.00041225905010203385, "loss": 5.0773, "mean_token_accuracy": 0.205494287610054, "num_tokens": 69087616.0, "step": 30160 }, { "entropy": 5.508612108230591, "epoch": 2.9819098457888495, "grad_norm": 0.9921875, "learning_rate": 0.00041223108567470696, "loss": 5.0288, "mean_token_accuracy": 0.20066885501146317, "num_tokens": 69099816.0, "step": 30165 }, { "entropy": 5.345908784866333, "epoch": 2.982404112297351, "grad_norm": 1.0625, "learning_rate": 0.00041220311787147407, "loss": 4.8819, "mean_token_accuracy": 0.2250371754169464, "num_tokens": 69111806.0, "step": 30170 }, { "entropy": 5.364367914199829, "epoch": 2.982898378805852, "grad_norm": 0.9765625, "learning_rate": 0.0004121751466930232, "loss": 5.0271, "mean_token_accuracy": 0.21128880828619004, "num_tokens": 69123479.0, "step": 30175 }, { "entropy": 5.5502983093261715, "epoch": 2.9833926453143533, "grad_norm": 0.9921875, "learning_rate": 0.0004121471721400424, "loss": 5.1208, "mean_token_accuracy": 0.20105748772621154, "num_tokens": 69134541.0, "step": 30180 }, { "entropy": 5.449119997024536, "epoch": 2.983886911822855, "grad_norm": 1.0546875, "learning_rate": 0.00041211919421322, "loss": 4.9867, "mean_token_accuracy": 0.21370634883642198, "num_tokens": 69144765.0, "step": 30185 }, { "entropy": 5.478382730484009, "epoch": 2.9843811783313563, "grad_norm": 1.015625, "learning_rate": 0.0004120912129132441, "loss": 5.0276, "mean_token_accuracy": 0.20873027443885803, "num_tokens": 69156761.0, "step": 30190 }, { "entropy": 5.399588775634766, "epoch": 2.9848754448398576, "grad_norm": 1.1015625, "learning_rate": 0.0004120632282408031, "loss": 4.9931, "mean_token_accuracy": 0.21574910283088683, "num_tokens": 69167968.0, "step": 30195 }, { "entropy": 5.461322355270386, "epoch": 2.9853697113483593, "grad_norm": 1.015625, "learning_rate": 0.0004120352401965854, "loss": 5.0288, "mean_token_accuracy": 0.22156336456537246, "num_tokens": 69178356.0, "step": 30200 }, { "entropy": 5.44198784828186, "epoch": 2.9858639778568605, "grad_norm": 0.98046875, "learning_rate": 0.00041200724878127953, "loss": 4.9395, "mean_token_accuracy": 0.22379438430070878, "num_tokens": 69188777.0, "step": 30205 }, { "entropy": 5.42715744972229, "epoch": 2.986358244365362, "grad_norm": 1.046875, "learning_rate": 0.00041197925399557407, "loss": 4.9515, "mean_token_accuracy": 0.21258749365806578, "num_tokens": 69199166.0, "step": 30210 }, { "entropy": 5.368791484832764, "epoch": 2.986852510873863, "grad_norm": 1.0859375, "learning_rate": 0.0004119512558401578, "loss": 4.969, "mean_token_accuracy": 0.21709192246198655, "num_tokens": 69211062.0, "step": 30215 }, { "entropy": 5.487198972702027, "epoch": 2.9873467773823643, "grad_norm": 1.125, "learning_rate": 0.00041192325431571933, "loss": 5.0695, "mean_token_accuracy": 0.21078742146492005, "num_tokens": 69222263.0, "step": 30220 }, { "entropy": 5.458101272583008, "epoch": 2.987841043890866, "grad_norm": 0.98046875, "learning_rate": 0.00041189524942294753, "loss": 5.0663, "mean_token_accuracy": 0.2123659998178482, "num_tokens": 69234888.0, "step": 30225 }, { "entropy": 5.47477388381958, "epoch": 2.9883353103993673, "grad_norm": 1.046875, "learning_rate": 0.0004118672411625314, "loss": 5.0614, "mean_token_accuracy": 0.2158815085887909, "num_tokens": 69244618.0, "step": 30230 }, { "entropy": 5.4674101829528805, "epoch": 2.988829576907869, "grad_norm": 1.0234375, "learning_rate": 0.00041183922953515987, "loss": 4.9613, "mean_token_accuracy": 0.21999464482069014, "num_tokens": 69254687.0, "step": 30235 }, { "entropy": 5.407430362701416, "epoch": 2.9893238434163703, "grad_norm": 1.0703125, "learning_rate": 0.000411811214541522, "loss": 5.076, "mean_token_accuracy": 0.20625722855329515, "num_tokens": 69267029.0, "step": 30240 }, { "entropy": 5.461917400360107, "epoch": 2.9898181099248715, "grad_norm": 1.0546875, "learning_rate": 0.0004117831961823072, "loss": 5.0344, "mean_token_accuracy": 0.21315219551324843, "num_tokens": 69278001.0, "step": 30245 }, { "entropy": 5.425647115707397, "epoch": 2.9903123764333728, "grad_norm": 0.91796875, "learning_rate": 0.0004117551744582045, "loss": 4.9945, "mean_token_accuracy": 0.2177058830857277, "num_tokens": 69290591.0, "step": 30250 }, { "entropy": 5.461457061767578, "epoch": 2.990806642941874, "grad_norm": 0.99609375, "learning_rate": 0.0004117271493699032, "loss": 5.1132, "mean_token_accuracy": 0.19877080321311952, "num_tokens": 69301977.0, "step": 30255 }, { "entropy": 5.398529958724976, "epoch": 2.9913009094503757, "grad_norm": 1.0078125, "learning_rate": 0.00041169912091809294, "loss": 5.0178, "mean_token_accuracy": 0.21599252820014953, "num_tokens": 69313457.0, "step": 30260 }, { "entropy": 5.390436410903931, "epoch": 2.991795175958877, "grad_norm": 1.203125, "learning_rate": 0.000411671089103463, "loss": 5.0043, "mean_token_accuracy": 0.22034430950880052, "num_tokens": 69324860.0, "step": 30265 }, { "entropy": 5.482173252105713, "epoch": 2.9922894424673783, "grad_norm": 1.078125, "learning_rate": 0.0004116430539267031, "loss": 5.0296, "mean_token_accuracy": 0.20768877267837524, "num_tokens": 69335609.0, "step": 30270 }, { "entropy": 5.471250343322754, "epoch": 2.99278370897588, "grad_norm": 1.1171875, "learning_rate": 0.00041161501538850286, "loss": 5.0855, "mean_token_accuracy": 0.2077333837747574, "num_tokens": 69346952.0, "step": 30275 }, { "entropy": 5.365226888656617, "epoch": 2.9932779754843812, "grad_norm": 1.0390625, "learning_rate": 0.000411586973489552, "loss": 4.9269, "mean_token_accuracy": 0.22048699110746384, "num_tokens": 69357875.0, "step": 30280 }, { "entropy": 5.390284776687622, "epoch": 2.9937722419928825, "grad_norm": 1.0703125, "learning_rate": 0.00041155892823054046, "loss": 5.0124, "mean_token_accuracy": 0.21204376220703125, "num_tokens": 69370371.0, "step": 30285 }, { "entropy": 5.474743509292603, "epoch": 2.9942665085013838, "grad_norm": 1.078125, "learning_rate": 0.0004115308796121582, "loss": 5.0906, "mean_token_accuracy": 0.20433961153030394, "num_tokens": 69381567.0, "step": 30290 }, { "entropy": 5.4392476081848145, "epoch": 2.9947607750098855, "grad_norm": 0.91015625, "learning_rate": 0.000411502827635095, "loss": 5.0011, "mean_token_accuracy": 0.20772162079811096, "num_tokens": 69393559.0, "step": 30295 }, { "entropy": 5.451076221466065, "epoch": 2.9952550415183867, "grad_norm": 0.96875, "learning_rate": 0.00041147477230004103, "loss": 5.0336, "mean_token_accuracy": 0.21130805909633638, "num_tokens": 69404727.0, "step": 30300 }, { "entropy": 5.416012811660766, "epoch": 2.995749308026888, "grad_norm": 1.09375, "learning_rate": 0.00041144671360768655, "loss": 4.9729, "mean_token_accuracy": 0.2153286412358284, "num_tokens": 69414919.0, "step": 30305 }, { "entropy": 5.424667596817017, "epoch": 2.9962435745353897, "grad_norm": 0.9609375, "learning_rate": 0.0004114186515587218, "loss": 4.9847, "mean_token_accuracy": 0.22588408440351487, "num_tokens": 69426362.0, "step": 30310 }, { "entropy": 5.40551643371582, "epoch": 2.996737841043891, "grad_norm": 1.0390625, "learning_rate": 0.00041139058615383703, "loss": 5.0441, "mean_token_accuracy": 0.20775208324193956, "num_tokens": 69438641.0, "step": 30315 }, { "entropy": 5.412407732009887, "epoch": 2.997232107552392, "grad_norm": 1.0703125, "learning_rate": 0.0004113625173937226, "loss": 5.0183, "mean_token_accuracy": 0.21528330445289612, "num_tokens": 69449237.0, "step": 30320 }, { "entropy": 5.455360984802246, "epoch": 2.9977263740608935, "grad_norm": 1.0234375, "learning_rate": 0.0004113344452790691, "loss": 5.023, "mean_token_accuracy": 0.2116187885403633, "num_tokens": 69460423.0, "step": 30325 }, { "entropy": 5.382966041564941, "epoch": 2.9982206405693947, "grad_norm": 1.0234375, "learning_rate": 0.00041130636981056716, "loss": 4.9035, "mean_token_accuracy": 0.22321608960628508, "num_tokens": 69470999.0, "step": 30330 }, { "entropy": 5.506158018112183, "epoch": 2.9987149070778965, "grad_norm": 1.09375, "learning_rate": 0.0004112782909889074, "loss": 5.1062, "mean_token_accuracy": 0.20230512470006942, "num_tokens": 69481517.0, "step": 30335 }, { "entropy": 5.409990024566651, "epoch": 2.9992091735863977, "grad_norm": 1.015625, "learning_rate": 0.0004112502088147804, "loss": 5.0697, "mean_token_accuracy": 0.21306455731391907, "num_tokens": 69493387.0, "step": 30340 }, { "entropy": 5.407167720794678, "epoch": 2.9997034400948994, "grad_norm": 1.0078125, "learning_rate": 0.00041122212328887725, "loss": 4.9653, "mean_token_accuracy": 0.21770255416631698, "num_tokens": 69504715.0, "step": 30345 }, { "entropy": 5.470080137252808, "epoch": 3.0001977066034007, "grad_norm": 1.1015625, "learning_rate": 0.00041119403441188874, "loss": 5.1344, "mean_token_accuracy": 0.20098523646593094, "num_tokens": 69515558.0, "step": 30350 }, { "entropy": 5.479523229598999, "epoch": 3.000691973111902, "grad_norm": 0.9765625, "learning_rate": 0.0004111659421845058, "loss": 5.0024, "mean_token_accuracy": 0.21217188239097595, "num_tokens": 69528195.0, "step": 30355 }, { "entropy": 5.5197916507720945, "epoch": 3.001186239620403, "grad_norm": 0.98046875, "learning_rate": 0.00041113784660741954, "loss": 4.977, "mean_token_accuracy": 0.2103230059146881, "num_tokens": 69539565.0, "step": 30360 }, { "entropy": 5.337203741073608, "epoch": 3.001680506128905, "grad_norm": 1.046875, "learning_rate": 0.0004111097476813212, "loss": 4.8943, "mean_token_accuracy": 0.21753544807434083, "num_tokens": 69550827.0, "step": 30365 }, { "entropy": 5.476755571365357, "epoch": 3.002174772637406, "grad_norm": 1.0234375, "learning_rate": 0.00041108164540690196, "loss": 5.0289, "mean_token_accuracy": 0.216603983938694, "num_tokens": 69564205.0, "step": 30370 }, { "entropy": 5.486319541931152, "epoch": 3.0026690391459074, "grad_norm": 1.03125, "learning_rate": 0.00041105353978485303, "loss": 4.9702, "mean_token_accuracy": 0.22316693365573884, "num_tokens": 69577353.0, "step": 30375 }, { "entropy": 5.368816471099853, "epoch": 3.0031633056544087, "grad_norm": 1.0546875, "learning_rate": 0.00041102543081586603, "loss": 4.9209, "mean_token_accuracy": 0.22770458608865737, "num_tokens": 69588401.0, "step": 30380 }, { "entropy": 5.444299364089966, "epoch": 3.0036575721629104, "grad_norm": 0.98046875, "learning_rate": 0.0004109973185006322, "loss": 4.9754, "mean_token_accuracy": 0.21429192125797272, "num_tokens": 69599966.0, "step": 30385 }, { "entropy": 5.438836336135864, "epoch": 3.0041518386714117, "grad_norm": 0.98828125, "learning_rate": 0.00041096920283984335, "loss": 4.9641, "mean_token_accuracy": 0.2159617781639099, "num_tokens": 69611264.0, "step": 30390 }, { "entropy": 5.408601760864258, "epoch": 3.004646105179913, "grad_norm": 1.0390625, "learning_rate": 0.000410941083834191, "loss": 4.9557, "mean_token_accuracy": 0.21699421852827072, "num_tokens": 69621638.0, "step": 30395 }, { "entropy": 5.39887752532959, "epoch": 3.005140371688414, "grad_norm": 0.9921875, "learning_rate": 0.0004109129614843669, "loss": 4.9003, "mean_token_accuracy": 0.2281687006354332, "num_tokens": 69633236.0, "step": 30400 }, { "entropy": 5.392551565170288, "epoch": 3.005634638196916, "grad_norm": 1.015625, "learning_rate": 0.0004108848357910628, "loss": 4.9095, "mean_token_accuracy": 0.21926873326301574, "num_tokens": 69644672.0, "step": 30405 }, { "entropy": 5.411789083480835, "epoch": 3.006128904705417, "grad_norm": 0.97265625, "learning_rate": 0.00041085670675497065, "loss": 4.9462, "mean_token_accuracy": 0.21901183873414992, "num_tokens": 69655580.0, "step": 30410 }, { "entropy": 5.422664213180542, "epoch": 3.0066231712139184, "grad_norm": 0.93359375, "learning_rate": 0.0004108285743767825, "loss": 4.9873, "mean_token_accuracy": 0.21415219604969024, "num_tokens": 69668692.0, "step": 30415 }, { "entropy": 5.482473659515381, "epoch": 3.00711743772242, "grad_norm": 1.0703125, "learning_rate": 0.00041080043865719033, "loss": 5.0156, "mean_token_accuracy": 0.21315995305776597, "num_tokens": 69679885.0, "step": 30420 }, { "entropy": 5.429695320129395, "epoch": 3.0076117042309214, "grad_norm": 1.0625, "learning_rate": 0.0004107722995968863, "loss": 5.0141, "mean_token_accuracy": 0.21658846437931062, "num_tokens": 69691395.0, "step": 30425 }, { "entropy": 5.370427513122559, "epoch": 3.0081059707394227, "grad_norm": 1.015625, "learning_rate": 0.0004107441571965627, "loss": 4.8535, "mean_token_accuracy": 0.21821608245372773, "num_tokens": 69701777.0, "step": 30430 }, { "entropy": 5.410035943984985, "epoch": 3.008600237247924, "grad_norm": 1.1015625, "learning_rate": 0.0004107160114569117, "loss": 4.9403, "mean_token_accuracy": 0.22258511334657669, "num_tokens": 69712922.0, "step": 30435 }, { "entropy": 5.40771894454956, "epoch": 3.0090945037564256, "grad_norm": 1.0390625, "learning_rate": 0.0004106878623786258, "loss": 4.9111, "mean_token_accuracy": 0.21988439559936523, "num_tokens": 69724342.0, "step": 30440 }, { "entropy": 5.351280736923218, "epoch": 3.009588770264927, "grad_norm": 1.015625, "learning_rate": 0.0004106597099623974, "loss": 4.904, "mean_token_accuracy": 0.22288720458745956, "num_tokens": 69735650.0, "step": 30445 }, { "entropy": 5.385583019256591, "epoch": 3.010083036773428, "grad_norm": 1.046875, "learning_rate": 0.0004106315542089191, "loss": 4.887, "mean_token_accuracy": 0.22392853796482087, "num_tokens": 69746745.0, "step": 30450 }, { "entropy": 5.437001132965088, "epoch": 3.0105773032819294, "grad_norm": 1.0234375, "learning_rate": 0.0004106033951188835, "loss": 4.8734, "mean_token_accuracy": 0.21626591235399245, "num_tokens": 69759315.0, "step": 30455 }, { "entropy": 5.404405546188355, "epoch": 3.011071569790431, "grad_norm": 1.078125, "learning_rate": 0.00041057523269298336, "loss": 4.9352, "mean_token_accuracy": 0.21534991562366484, "num_tokens": 69769883.0, "step": 30460 }, { "entropy": 5.3852126121521, "epoch": 3.0115658362989324, "grad_norm": 1.0859375, "learning_rate": 0.0004105470669319115, "loss": 4.9482, "mean_token_accuracy": 0.21387778371572494, "num_tokens": 69781449.0, "step": 30465 }, { "entropy": 5.314585876464844, "epoch": 3.0120601028074336, "grad_norm": 1.0546875, "learning_rate": 0.0004105188978363608, "loss": 4.8801, "mean_token_accuracy": 0.2294148787856102, "num_tokens": 69793952.0, "step": 30470 }, { "entropy": 5.422433185577392, "epoch": 3.0125543693159353, "grad_norm": 1.015625, "learning_rate": 0.0004104907254070241, "loss": 4.9342, "mean_token_accuracy": 0.2228323370218277, "num_tokens": 69805705.0, "step": 30475 }, { "entropy": 5.4462769508361815, "epoch": 3.0130486358244366, "grad_norm": 1.0078125, "learning_rate": 0.0004104625496445946, "loss": 5.027, "mean_token_accuracy": 0.2082013815641403, "num_tokens": 69817298.0, "step": 30480 }, { "entropy": 5.472079658508301, "epoch": 3.013542902332938, "grad_norm": 1.046875, "learning_rate": 0.00041043437054976524, "loss": 5.0091, "mean_token_accuracy": 0.21154625713825226, "num_tokens": 69829280.0, "step": 30485 }, { "entropy": 5.35842752456665, "epoch": 3.014037168841439, "grad_norm": 1.0078125, "learning_rate": 0.0004104061881232295, "loss": 4.8667, "mean_token_accuracy": 0.2250947117805481, "num_tokens": 69841500.0, "step": 30490 }, { "entropy": 5.404494905471802, "epoch": 3.014531435349941, "grad_norm": 1.0390625, "learning_rate": 0.00041037800236568044, "loss": 4.9184, "mean_token_accuracy": 0.22083764672279357, "num_tokens": 69852651.0, "step": 30495 }, { "entropy": 5.398337507247925, "epoch": 3.015025701858442, "grad_norm": 0.96484375, "learning_rate": 0.0004103498132778116, "loss": 4.942, "mean_token_accuracy": 0.2207941621541977, "num_tokens": 69864746.0, "step": 30500 }, { "entropy": 5.333256673812866, "epoch": 3.0155199683669434, "grad_norm": 1.03125, "learning_rate": 0.0004103216208603163, "loss": 4.8734, "mean_token_accuracy": 0.22742423713207244, "num_tokens": 69875696.0, "step": 30505 }, { "entropy": 5.409759950637818, "epoch": 3.0160142348754446, "grad_norm": 1.109375, "learning_rate": 0.0004102934251138881, "loss": 4.8463, "mean_token_accuracy": 0.2300860121846199, "num_tokens": 69887363.0, "step": 30510 }, { "entropy": 5.4117772579193115, "epoch": 3.0165085013839463, "grad_norm": 1.1328125, "learning_rate": 0.00041026522603922075, "loss": 4.9517, "mean_token_accuracy": 0.21733166873455048, "num_tokens": 69898561.0, "step": 30515 }, { "entropy": 5.404744338989258, "epoch": 3.0170027678924476, "grad_norm": 1.046875, "learning_rate": 0.0004102370236370077, "loss": 5.008, "mean_token_accuracy": 0.21028438508510588, "num_tokens": 69910297.0, "step": 30520 }, { "entropy": 5.416772794723511, "epoch": 3.017497034400949, "grad_norm": 1.0390625, "learning_rate": 0.00041020881790794305, "loss": 4.9829, "mean_token_accuracy": 0.21758916079998017, "num_tokens": 69922435.0, "step": 30525 }, { "entropy": 5.383396434783935, "epoch": 3.0179913009094506, "grad_norm": 0.93359375, "learning_rate": 0.00041018060885272047, "loss": 4.9189, "mean_token_accuracy": 0.22540755420923234, "num_tokens": 69935151.0, "step": 30530 }, { "entropy": 5.434050130844116, "epoch": 3.018485567417952, "grad_norm": 1.0390625, "learning_rate": 0.00041015239647203386, "loss": 4.96, "mean_token_accuracy": 0.21290067285299302, "num_tokens": 69945915.0, "step": 30535 }, { "entropy": 5.391369152069092, "epoch": 3.018979833926453, "grad_norm": 1.1015625, "learning_rate": 0.00041012418076657737, "loss": 4.9103, "mean_token_accuracy": 0.22301845997571945, "num_tokens": 69957016.0, "step": 30540 }, { "entropy": 5.32572112083435, "epoch": 3.0194741004349543, "grad_norm": 1.078125, "learning_rate": 0.00041009596173704506, "loss": 4.8365, "mean_token_accuracy": 0.22583547979593277, "num_tokens": 69967863.0, "step": 30545 }, { "entropy": 5.44273009300232, "epoch": 3.019968366943456, "grad_norm": 1.0390625, "learning_rate": 0.00041006773938413114, "loss": 5.0109, "mean_token_accuracy": 0.20767912417650222, "num_tokens": 69978901.0, "step": 30550 }, { "entropy": 5.34404821395874, "epoch": 3.0204626334519573, "grad_norm": 1.0546875, "learning_rate": 0.0004100395137085299, "loss": 4.9098, "mean_token_accuracy": 0.2203651860356331, "num_tokens": 69990829.0, "step": 30555 }, { "entropy": 5.426419591903686, "epoch": 3.0209568999604586, "grad_norm": 1.09375, "learning_rate": 0.0004100112847109357, "loss": 4.896, "mean_token_accuracy": 0.22002136409282685, "num_tokens": 70002130.0, "step": 30560 }, { "entropy": 5.429311513900757, "epoch": 3.0214511664689603, "grad_norm": 1.0078125, "learning_rate": 0.0004099830523920429, "loss": 4.9508, "mean_token_accuracy": 0.2205308571457863, "num_tokens": 70012913.0, "step": 30565 }, { "entropy": 5.405665874481201, "epoch": 3.0219454329774615, "grad_norm": 0.96875, "learning_rate": 0.00040995481675254616, "loss": 4.9496, "mean_token_accuracy": 0.21888624578714372, "num_tokens": 70024689.0, "step": 30570 }, { "entropy": 5.393888711929321, "epoch": 3.022439699485963, "grad_norm": 1.0234375, "learning_rate": 0.0004099265777931398, "loss": 4.9389, "mean_token_accuracy": 0.21826994568109512, "num_tokens": 70036153.0, "step": 30575 }, { "entropy": 5.365143585205078, "epoch": 3.022933965994464, "grad_norm": 1.0625, "learning_rate": 0.00040989833551451885, "loss": 4.9663, "mean_token_accuracy": 0.2144753485918045, "num_tokens": 70049190.0, "step": 30580 }, { "entropy": 5.399091529846191, "epoch": 3.0234282325029658, "grad_norm": 1.015625, "learning_rate": 0.00040987008991737786, "loss": 4.8693, "mean_token_accuracy": 0.21980566680431365, "num_tokens": 70061391.0, "step": 30585 }, { "entropy": 5.329920721054077, "epoch": 3.023922499011467, "grad_norm": 1.09375, "learning_rate": 0.0004098418410024118, "loss": 4.8351, "mean_token_accuracy": 0.22599011808633804, "num_tokens": 70072811.0, "step": 30590 }, { "entropy": 5.372668600082397, "epoch": 3.0244167655199683, "grad_norm": 1.0078125, "learning_rate": 0.00040981358877031546, "loss": 4.8567, "mean_token_accuracy": 0.22677309811115265, "num_tokens": 70083776.0, "step": 30595 }, { "entropy": 5.3922264099121096, "epoch": 3.0249110320284696, "grad_norm": 0.95703125, "learning_rate": 0.0004097853332217839, "loss": 4.9897, "mean_token_accuracy": 0.21422107815742492, "num_tokens": 70095720.0, "step": 30600 }, { "entropy": 5.41444239616394, "epoch": 3.0254052985369713, "grad_norm": 1.09375, "learning_rate": 0.0004097570743575123, "loss": 4.9744, "mean_token_accuracy": 0.2142170250415802, "num_tokens": 70106315.0, "step": 30605 }, { "entropy": 5.4558929920196535, "epoch": 3.0258995650454725, "grad_norm": 1.0, "learning_rate": 0.00040972881217819573, "loss": 4.9907, "mean_token_accuracy": 0.21169532984495162, "num_tokens": 70118018.0, "step": 30610 }, { "entropy": 5.415301704406739, "epoch": 3.026393831553974, "grad_norm": 1.0234375, "learning_rate": 0.0004097005466845295, "loss": 4.9226, "mean_token_accuracy": 0.22231138944625856, "num_tokens": 70130543.0, "step": 30615 }, { "entropy": 5.3317783832550045, "epoch": 3.0268880980624755, "grad_norm": 1.015625, "learning_rate": 0.0004096722778772089, "loss": 4.8639, "mean_token_accuracy": 0.22819124311208724, "num_tokens": 70142582.0, "step": 30620 }, { "entropy": 5.436104011535645, "epoch": 3.0273823645709768, "grad_norm": 0.96484375, "learning_rate": 0.00040964400575692946, "loss": 4.9807, "mean_token_accuracy": 0.21840066760778426, "num_tokens": 70155002.0, "step": 30625 }, { "entropy": 5.478664445877075, "epoch": 3.027876631079478, "grad_norm": 1.0390625, "learning_rate": 0.00040961573032438647, "loss": 4.9619, "mean_token_accuracy": 0.21520168632268905, "num_tokens": 70167354.0, "step": 30630 }, { "entropy": 5.397228240966797, "epoch": 3.0283708975879793, "grad_norm": 1.09375, "learning_rate": 0.0004095874515802757, "loss": 5.0005, "mean_token_accuracy": 0.2179683968424797, "num_tokens": 70178561.0, "step": 30635 }, { "entropy": 5.412921810150147, "epoch": 3.028865164096481, "grad_norm": 0.96484375, "learning_rate": 0.00040955916952529277, "loss": 4.9377, "mean_token_accuracy": 0.22295175939798356, "num_tokens": 70189954.0, "step": 30640 }, { "entropy": 5.437738561630249, "epoch": 3.0293594306049823, "grad_norm": 1.0703125, "learning_rate": 0.00040953088416013325, "loss": 5.0096, "mean_token_accuracy": 0.20835305899381637, "num_tokens": 70200595.0, "step": 30645 }, { "entropy": 5.407878112792969, "epoch": 3.0298536971134835, "grad_norm": 0.98828125, "learning_rate": 0.0004095025954854933, "loss": 4.9579, "mean_token_accuracy": 0.21726207733154296, "num_tokens": 70211757.0, "step": 30650 }, { "entropy": 5.257646322250366, "epoch": 3.0303479636219848, "grad_norm": 1.0234375, "learning_rate": 0.0004094743035020685, "loss": 4.8358, "mean_token_accuracy": 0.22766544818878173, "num_tokens": 70223404.0, "step": 30655 }, { "entropy": 5.532404994964599, "epoch": 3.0308422301304865, "grad_norm": 1.078125, "learning_rate": 0.00040944600821055506, "loss": 5.0552, "mean_token_accuracy": 0.2062969148159027, "num_tokens": 70234022.0, "step": 30660 }, { "entropy": 5.438463401794434, "epoch": 3.0313364966389877, "grad_norm": 1.1484375, "learning_rate": 0.0004094177096116489, "loss": 4.958, "mean_token_accuracy": 0.21756165474653244, "num_tokens": 70245279.0, "step": 30665 }, { "entropy": 5.3319604873657225, "epoch": 3.031830763147489, "grad_norm": 1.0703125, "learning_rate": 0.00040938940770604624, "loss": 4.9262, "mean_token_accuracy": 0.22059249728918076, "num_tokens": 70256561.0, "step": 30670 }, { "entropy": 5.355877113342285, "epoch": 3.0323250296559907, "grad_norm": 0.98046875, "learning_rate": 0.00040936110249444323, "loss": 4.8562, "mean_token_accuracy": 0.22982880622148513, "num_tokens": 70268535.0, "step": 30675 }, { "entropy": 5.366777515411377, "epoch": 3.032819296164492, "grad_norm": 1.015625, "learning_rate": 0.0004093327939775364, "loss": 4.9119, "mean_token_accuracy": 0.23053721934556962, "num_tokens": 70279681.0, "step": 30680 }, { "entropy": 5.359801483154297, "epoch": 3.0333135626729932, "grad_norm": 1.015625, "learning_rate": 0.0004093044821560219, "loss": 4.8859, "mean_token_accuracy": 0.22680379450321198, "num_tokens": 70290796.0, "step": 30685 }, { "entropy": 5.366371917724609, "epoch": 3.0338078291814945, "grad_norm": 1.0390625, "learning_rate": 0.00040927616703059636, "loss": 4.8738, "mean_token_accuracy": 0.22066937386989594, "num_tokens": 70302254.0, "step": 30690 }, { "entropy": 5.30592098236084, "epoch": 3.034302095689996, "grad_norm": 1.0234375, "learning_rate": 0.0004092478486019562, "loss": 4.842, "mean_token_accuracy": 0.23007274121046067, "num_tokens": 70313022.0, "step": 30695 }, { "entropy": 5.413453483581543, "epoch": 3.0347963621984975, "grad_norm": 1.109375, "learning_rate": 0.00040921952687079824, "loss": 4.9298, "mean_token_accuracy": 0.21921290159225465, "num_tokens": 70325356.0, "step": 30700 }, { "entropy": 5.4563432216644285, "epoch": 3.0352906287069987, "grad_norm": 0.96484375, "learning_rate": 0.000409191201837819, "loss": 5.0157, "mean_token_accuracy": 0.21103538423776627, "num_tokens": 70336622.0, "step": 30705 }, { "entropy": 5.434011030197143, "epoch": 3.0357848952155, "grad_norm": 1.125, "learning_rate": 0.00040916287350371546, "loss": 4.9493, "mean_token_accuracy": 0.21375397741794586, "num_tokens": 70347799.0, "step": 30710 }, { "entropy": 5.371381378173828, "epoch": 3.0362791617240017, "grad_norm": 0.96875, "learning_rate": 0.00040913454186918436, "loss": 4.9203, "mean_token_accuracy": 0.22277666628360748, "num_tokens": 70358918.0, "step": 30715 }, { "entropy": 5.416863536834716, "epoch": 3.036773428232503, "grad_norm": 1.0, "learning_rate": 0.00040910620693492277, "loss": 5.04, "mean_token_accuracy": 0.20856893807649612, "num_tokens": 70371853.0, "step": 30720 }, { "entropy": 5.435876703262329, "epoch": 3.037267694741004, "grad_norm": 1.046875, "learning_rate": 0.0004090778687016276, "loss": 4.9792, "mean_token_accuracy": 0.21008629053831102, "num_tokens": 70383696.0, "step": 30725 }, { "entropy": 5.360678434371948, "epoch": 3.037761961249506, "grad_norm": 0.95703125, "learning_rate": 0.00040904952716999617, "loss": 4.8971, "mean_token_accuracy": 0.21712495386600494, "num_tokens": 70395651.0, "step": 30730 }, { "entropy": 5.424138832092285, "epoch": 3.038256227758007, "grad_norm": 1.03125, "learning_rate": 0.0004090211823407255, "loss": 4.9624, "mean_token_accuracy": 0.21351974308490754, "num_tokens": 70408621.0, "step": 30735 }, { "entropy": 5.306193542480469, "epoch": 3.0387504942665085, "grad_norm": 0.984375, "learning_rate": 0.000408992834214513, "loss": 4.8243, "mean_token_accuracy": 0.22526150792837143, "num_tokens": 70419627.0, "step": 30740 }, { "entropy": 5.381680536270141, "epoch": 3.0392447607750097, "grad_norm": 1.0, "learning_rate": 0.0004089644827920559, "loss": 4.9145, "mean_token_accuracy": 0.22642378360033036, "num_tokens": 70431795.0, "step": 30745 }, { "entropy": 5.372473192214966, "epoch": 3.0397390272835114, "grad_norm": 1.046875, "learning_rate": 0.00040893612807405184, "loss": 4.8781, "mean_token_accuracy": 0.23239432871341706, "num_tokens": 70444086.0, "step": 30750 }, { "entropy": 5.422641086578369, "epoch": 3.0402332937920127, "grad_norm": 1.0, "learning_rate": 0.0004089077700611982, "loss": 4.9372, "mean_token_accuracy": 0.22059000432491302, "num_tokens": 70454844.0, "step": 30755 }, { "entropy": 5.439218473434448, "epoch": 3.040727560300514, "grad_norm": 1.078125, "learning_rate": 0.00040887940875419267, "loss": 5.0055, "mean_token_accuracy": 0.21494870334863664, "num_tokens": 70466003.0, "step": 30760 }, { "entropy": 5.461134624481201, "epoch": 3.041221826809015, "grad_norm": 1.15625, "learning_rate": 0.0004088510441537329, "loss": 4.9111, "mean_token_accuracy": 0.2241834282875061, "num_tokens": 70476586.0, "step": 30765 }, { "entropy": 5.41762228012085, "epoch": 3.041716093317517, "grad_norm": 1.1015625, "learning_rate": 0.00040882267626051664, "loss": 5.0205, "mean_token_accuracy": 0.2086621031165123, "num_tokens": 70488561.0, "step": 30770 }, { "entropy": 5.399963903427124, "epoch": 3.042210359826018, "grad_norm": 1.0390625, "learning_rate": 0.0004087943050752419, "loss": 4.9468, "mean_token_accuracy": 0.20916391015052796, "num_tokens": 70499454.0, "step": 30775 }, { "entropy": 5.466132020950317, "epoch": 3.0427046263345194, "grad_norm": 1.0078125, "learning_rate": 0.0004087659305986064, "loss": 4.9669, "mean_token_accuracy": 0.21167234033346177, "num_tokens": 70510880.0, "step": 30780 }, { "entropy": 5.411253929138184, "epoch": 3.043198892843021, "grad_norm": 0.93359375, "learning_rate": 0.00040873755283130824, "loss": 4.9514, "mean_token_accuracy": 0.21867942959070205, "num_tokens": 70523199.0, "step": 30785 }, { "entropy": 5.3632300853729244, "epoch": 3.0436931593515224, "grad_norm": 0.984375, "learning_rate": 0.0004087091717740456, "loss": 4.895, "mean_token_accuracy": 0.21445599794387818, "num_tokens": 70535124.0, "step": 30790 }, { "entropy": 5.383294916152954, "epoch": 3.0441874258600237, "grad_norm": 0.96875, "learning_rate": 0.00040868078742751655, "loss": 4.9058, "mean_token_accuracy": 0.22451711744070052, "num_tokens": 70547543.0, "step": 30795 }, { "entropy": 5.396477365493775, "epoch": 3.044681692368525, "grad_norm": 0.91015625, "learning_rate": 0.00040865239979241946, "loss": 4.906, "mean_token_accuracy": 0.22317237854003907, "num_tokens": 70559788.0, "step": 30800 }, { "entropy": 5.3785358428955075, "epoch": 3.0451759588770266, "grad_norm": 1.1015625, "learning_rate": 0.0004086240088694525, "loss": 4.9204, "mean_token_accuracy": 0.22607837617397308, "num_tokens": 70570303.0, "step": 30805 }, { "entropy": 5.312200355529785, "epoch": 3.045670225385528, "grad_norm": 1.0546875, "learning_rate": 0.00040859561465931426, "loss": 4.8663, "mean_token_accuracy": 0.22607066184282304, "num_tokens": 70580924.0, "step": 30810 }, { "entropy": 5.430265235900879, "epoch": 3.046164491894029, "grad_norm": 0.9921875, "learning_rate": 0.00040856721716270316, "loss": 4.9288, "mean_token_accuracy": 0.22272013127803802, "num_tokens": 70592557.0, "step": 30815 }, { "entropy": 5.279453992843628, "epoch": 3.046658758402531, "grad_norm": 1.0078125, "learning_rate": 0.0004085388163803178, "loss": 4.8054, "mean_token_accuracy": 0.2347233086824417, "num_tokens": 70604374.0, "step": 30820 }, { "entropy": 5.39760103225708, "epoch": 3.047153024911032, "grad_norm": 1.125, "learning_rate": 0.0004085104123128568, "loss": 4.9426, "mean_token_accuracy": 0.2144983798265457, "num_tokens": 70616380.0, "step": 30825 }, { "entropy": 5.437837171554565, "epoch": 3.0476472914195334, "grad_norm": 0.98828125, "learning_rate": 0.00040848200496101895, "loss": 4.9902, "mean_token_accuracy": 0.21941965967416763, "num_tokens": 70628297.0, "step": 30830 }, { "entropy": 5.498921918869018, "epoch": 3.0481415579280347, "grad_norm": 1.046875, "learning_rate": 0.0004084535943255031, "loss": 4.963, "mean_token_accuracy": 0.21315976828336716, "num_tokens": 70639815.0, "step": 30835 }, { "entropy": 5.413691711425781, "epoch": 3.0486358244365364, "grad_norm": 1.046875, "learning_rate": 0.00040842518040700815, "loss": 4.9753, "mean_token_accuracy": 0.21351510137319565, "num_tokens": 70651283.0, "step": 30840 }, { "entropy": 5.392809772491455, "epoch": 3.0491300909450376, "grad_norm": 1.125, "learning_rate": 0.000408396763206233, "loss": 4.8942, "mean_token_accuracy": 0.2247121050953865, "num_tokens": 70662465.0, "step": 30845 }, { "entropy": 5.4868518829345705, "epoch": 3.049624357453539, "grad_norm": 1.0234375, "learning_rate": 0.0004083683427238768, "loss": 5.0363, "mean_token_accuracy": 0.21093931198120117, "num_tokens": 70674301.0, "step": 30850 }, { "entropy": 5.390825653076172, "epoch": 3.05011862396204, "grad_norm": 1.0703125, "learning_rate": 0.0004083399189606387, "loss": 4.9514, "mean_token_accuracy": 0.22158412039279937, "num_tokens": 70685423.0, "step": 30855 }, { "entropy": 5.416312408447266, "epoch": 3.050612890470542, "grad_norm": 1.078125, "learning_rate": 0.0004083114919172179, "loss": 4.8487, "mean_token_accuracy": 0.22390309125185012, "num_tokens": 70697043.0, "step": 30860 }, { "entropy": 5.4309204578399655, "epoch": 3.051107156979043, "grad_norm": 1.046875, "learning_rate": 0.0004082830615943137, "loss": 4.9734, "mean_token_accuracy": 0.21805118024349213, "num_tokens": 70708585.0, "step": 30865 }, { "entropy": 5.330524110794068, "epoch": 3.0516014234875444, "grad_norm": 1.0078125, "learning_rate": 0.0004082546279926256, "loss": 4.8688, "mean_token_accuracy": 0.2197417512536049, "num_tokens": 70720703.0, "step": 30870 }, { "entropy": 5.413475751876831, "epoch": 3.052095689996046, "grad_norm": 1.109375, "learning_rate": 0.00040822619111285284, "loss": 4.9585, "mean_token_accuracy": 0.21656543463468553, "num_tokens": 70731146.0, "step": 30875 }, { "entropy": 5.355567407608032, "epoch": 3.0525899565045473, "grad_norm": 0.9765625, "learning_rate": 0.00040819775095569515, "loss": 4.9074, "mean_token_accuracy": 0.22070125192403794, "num_tokens": 70742393.0, "step": 30880 }, { "entropy": 5.379467248916626, "epoch": 3.0530842230130486, "grad_norm": 1.03125, "learning_rate": 0.0004081693075218522, "loss": 4.8261, "mean_token_accuracy": 0.22518666088581085, "num_tokens": 70753419.0, "step": 30885 }, { "entropy": 5.338520956039429, "epoch": 3.05357848952155, "grad_norm": 0.9375, "learning_rate": 0.00040814086081202364, "loss": 4.8771, "mean_token_accuracy": 0.23138557374477386, "num_tokens": 70765445.0, "step": 30890 }, { "entropy": 5.396488857269287, "epoch": 3.0540727560300516, "grad_norm": 1.0390625, "learning_rate": 0.00040811241082690914, "loss": 4.9309, "mean_token_accuracy": 0.2177235007286072, "num_tokens": 70776598.0, "step": 30895 }, { "entropy": 5.426545333862305, "epoch": 3.054567022538553, "grad_norm": 1.1328125, "learning_rate": 0.0004080839575672087, "loss": 4.9552, "mean_token_accuracy": 0.21597821563482283, "num_tokens": 70787982.0, "step": 30900 }, { "entropy": 5.38010311126709, "epoch": 3.055061289047054, "grad_norm": 1.0078125, "learning_rate": 0.00040805550103362225, "loss": 4.8911, "mean_token_accuracy": 0.22319617867469788, "num_tokens": 70799080.0, "step": 30905 }, { "entropy": 5.3277545928955075, "epoch": 3.0555555555555554, "grad_norm": 0.9765625, "learning_rate": 0.00040802704122684994, "loss": 4.898, "mean_token_accuracy": 0.2252265527844429, "num_tokens": 70809831.0, "step": 30910 }, { "entropy": 5.3703197002410885, "epoch": 3.056049822064057, "grad_norm": 1.0546875, "learning_rate": 0.00040799857814759167, "loss": 4.9964, "mean_token_accuracy": 0.21615443229675294, "num_tokens": 70821623.0, "step": 30915 }, { "entropy": 5.515080261230469, "epoch": 3.0565440885725583, "grad_norm": 1.046875, "learning_rate": 0.0004079701117965477, "loss": 5.0308, "mean_token_accuracy": 0.20916198641061784, "num_tokens": 70833875.0, "step": 30920 }, { "entropy": 5.366548156738281, "epoch": 3.0570383550810596, "grad_norm": 0.9921875, "learning_rate": 0.0004079416421744185, "loss": 4.9406, "mean_token_accuracy": 0.21883416622877122, "num_tokens": 70845287.0, "step": 30925 }, { "entropy": 5.475229024887085, "epoch": 3.0575326215895613, "grad_norm": 1.0546875, "learning_rate": 0.00040791316928190423, "loss": 4.9492, "mean_token_accuracy": 0.21836733520030976, "num_tokens": 70856294.0, "step": 30930 }, { "entropy": 5.381893444061279, "epoch": 3.0580268880980626, "grad_norm": 1.1171875, "learning_rate": 0.00040788469311970525, "loss": 4.9624, "mean_token_accuracy": 0.21809504479169844, "num_tokens": 70867490.0, "step": 30935 }, { "entropy": 5.3736796379089355, "epoch": 3.058521154606564, "grad_norm": 1.0078125, "learning_rate": 0.00040785621368852234, "loss": 4.9473, "mean_token_accuracy": 0.22061517387628554, "num_tokens": 70877991.0, "step": 30940 }, { "entropy": 5.431356954574585, "epoch": 3.059015421115065, "grad_norm": 1.0625, "learning_rate": 0.00040782773098905594, "loss": 4.9651, "mean_token_accuracy": 0.21861248314380646, "num_tokens": 70888439.0, "step": 30945 }, { "entropy": 5.369113779067993, "epoch": 3.059509687623567, "grad_norm": 1.0546875, "learning_rate": 0.0004077992450220068, "loss": 4.8822, "mean_token_accuracy": 0.22857068926095964, "num_tokens": 70898331.0, "step": 30950 }, { "entropy": 5.380788660049438, "epoch": 3.060003954132068, "grad_norm": 1.140625, "learning_rate": 0.0004077707557880755, "loss": 4.8872, "mean_token_accuracy": 0.22493885457515717, "num_tokens": 70908221.0, "step": 30955 }, { "entropy": 5.394108057022095, "epoch": 3.0604982206405693, "grad_norm": 1.046875, "learning_rate": 0.00040774226328796315, "loss": 4.8639, "mean_token_accuracy": 0.22668589800596237, "num_tokens": 70919720.0, "step": 30960 }, { "entropy": 5.463345384597778, "epoch": 3.0609924871490706, "grad_norm": 1.0859375, "learning_rate": 0.0004077137675223704, "loss": 4.9375, "mean_token_accuracy": 0.21904116421937941, "num_tokens": 70931322.0, "step": 30965 }, { "entropy": 5.366185092926026, "epoch": 3.0614867536575723, "grad_norm": 1.0859375, "learning_rate": 0.0004076852684919985, "loss": 4.9716, "mean_token_accuracy": 0.21896986067295074, "num_tokens": 70943124.0, "step": 30970 }, { "entropy": 5.411995077133179, "epoch": 3.0619810201660735, "grad_norm": 1.03125, "learning_rate": 0.0004076567661975484, "loss": 4.9034, "mean_token_accuracy": 0.22310545593500136, "num_tokens": 70954986.0, "step": 30975 }, { "entropy": 5.3533241748809814, "epoch": 3.062475286674575, "grad_norm": 1.0859375, "learning_rate": 0.0004076282606397211, "loss": 4.8592, "mean_token_accuracy": 0.22208243906497954, "num_tokens": 70965500.0, "step": 30980 }, { "entropy": 5.361663341522217, "epoch": 3.0629695531830765, "grad_norm": 0.98046875, "learning_rate": 0.0004075997518192182, "loss": 4.8759, "mean_token_accuracy": 0.21764241755008698, "num_tokens": 70976717.0, "step": 30985 }, { "entropy": 5.364130306243896, "epoch": 3.0634638196915778, "grad_norm": 1.046875, "learning_rate": 0.0004075712397367408, "loss": 4.9403, "mean_token_accuracy": 0.2222544103860855, "num_tokens": 70987286.0, "step": 30990 }, { "entropy": 5.517619943618774, "epoch": 3.063958086200079, "grad_norm": 1.1484375, "learning_rate": 0.00040754272439299025, "loss": 5.0224, "mean_token_accuracy": 0.20722428411245347, "num_tokens": 70998710.0, "step": 30995 }, { "entropy": 5.37889256477356, "epoch": 3.0644523527085803, "grad_norm": 1.0703125, "learning_rate": 0.00040751420578866816, "loss": 4.9573, "mean_token_accuracy": 0.2150046482682228, "num_tokens": 71010725.0, "step": 31000 }, { "entropy": 5.406433534622193, "epoch": 3.064946619217082, "grad_norm": 1.015625, "learning_rate": 0.0004074856839244761, "loss": 4.9983, "mean_token_accuracy": 0.2200597956776619, "num_tokens": 71021723.0, "step": 31005 }, { "entropy": 5.397740221023559, "epoch": 3.0654408857255833, "grad_norm": 1.1015625, "learning_rate": 0.0004074571588011156, "loss": 4.8892, "mean_token_accuracy": 0.2221280738711357, "num_tokens": 71032744.0, "step": 31010 }, { "entropy": 5.339925718307495, "epoch": 3.0659351522340845, "grad_norm": 1.125, "learning_rate": 0.00040742863041928854, "loss": 4.8455, "mean_token_accuracy": 0.22274887859821318, "num_tokens": 71044296.0, "step": 31015 }, { "entropy": 5.385367155075073, "epoch": 3.066429418742586, "grad_norm": 1.0390625, "learning_rate": 0.00040740009877969654, "loss": 4.9754, "mean_token_accuracy": 0.22018209397792815, "num_tokens": 71054636.0, "step": 31020 }, { "entropy": 5.443326568603515, "epoch": 3.0669236852510875, "grad_norm": 1.0390625, "learning_rate": 0.0004073715638830415, "loss": 4.9921, "mean_token_accuracy": 0.22188208252191544, "num_tokens": 71067350.0, "step": 31025 }, { "entropy": 5.461763191223144, "epoch": 3.0674179517595888, "grad_norm": 1.046875, "learning_rate": 0.00040734302573002565, "loss": 4.9734, "mean_token_accuracy": 0.2189631298184395, "num_tokens": 71078951.0, "step": 31030 }, { "entropy": 5.351203966140747, "epoch": 3.06791221826809, "grad_norm": 0.94140625, "learning_rate": 0.0004073144843213507, "loss": 4.8951, "mean_token_accuracy": 0.22432831674814224, "num_tokens": 71090039.0, "step": 31035 }, { "entropy": 5.2922282218933105, "epoch": 3.0684064847765917, "grad_norm": 0.9921875, "learning_rate": 0.00040728593965771895, "loss": 4.8832, "mean_token_accuracy": 0.22834322601556778, "num_tokens": 71101203.0, "step": 31040 }, { "entropy": 5.361834383010864, "epoch": 3.068900751285093, "grad_norm": 1.046875, "learning_rate": 0.00040725739173983253, "loss": 4.8568, "mean_token_accuracy": 0.22096928656101228, "num_tokens": 71112720.0, "step": 31045 }, { "entropy": 5.462894058227539, "epoch": 3.0693950177935942, "grad_norm": 1.046875, "learning_rate": 0.0004072288405683938, "loss": 5.0034, "mean_token_accuracy": 0.21408717036247255, "num_tokens": 71123126.0, "step": 31050 }, { "entropy": 5.387087774276734, "epoch": 3.0698892843020955, "grad_norm": 0.98046875, "learning_rate": 0.00040720028614410497, "loss": 4.8691, "mean_token_accuracy": 0.21910379976034164, "num_tokens": 71135555.0, "step": 31055 }, { "entropy": 5.378819370269776, "epoch": 3.070383550810597, "grad_norm": 1.0234375, "learning_rate": 0.0004071717284676687, "loss": 4.8809, "mean_token_accuracy": 0.2264954060316086, "num_tokens": 71147304.0, "step": 31060 }, { "entropy": 5.393623876571655, "epoch": 3.0708778173190985, "grad_norm": 1.1015625, "learning_rate": 0.0004071431675397874, "loss": 4.9361, "mean_token_accuracy": 0.21454462707042693, "num_tokens": 71157564.0, "step": 31065 }, { "entropy": 5.2822497367858885, "epoch": 3.0713720838275997, "grad_norm": 1.0, "learning_rate": 0.00040711460336116364, "loss": 4.7838, "mean_token_accuracy": 0.23773422986268997, "num_tokens": 71168994.0, "step": 31070 }, { "entropy": 5.422020387649536, "epoch": 3.0718663503361014, "grad_norm": 0.97265625, "learning_rate": 0.00040708603593250016, "loss": 4.9406, "mean_token_accuracy": 0.22453244030475616, "num_tokens": 71180736.0, "step": 31075 }, { "entropy": 5.3104777336120605, "epoch": 3.0723606168446027, "grad_norm": 1.0234375, "learning_rate": 0.00040705746525449964, "loss": 4.8672, "mean_token_accuracy": 0.22726356089115143, "num_tokens": 71193187.0, "step": 31080 }, { "entropy": 5.355903625488281, "epoch": 3.072854883353104, "grad_norm": 1.0, "learning_rate": 0.00040702889132786507, "loss": 4.8529, "mean_token_accuracy": 0.23288288861513137, "num_tokens": 71204294.0, "step": 31085 }, { "entropy": 5.395114326477051, "epoch": 3.0733491498616052, "grad_norm": 1.15625, "learning_rate": 0.0004070003141532994, "loss": 4.912, "mean_token_accuracy": 0.2149900808930397, "num_tokens": 71215259.0, "step": 31090 }, { "entropy": 5.360031986236573, "epoch": 3.073843416370107, "grad_norm": 0.984375, "learning_rate": 0.0004069717337315053, "loss": 4.9146, "mean_token_accuracy": 0.22238492965698242, "num_tokens": 71227008.0, "step": 31095 }, { "entropy": 5.404832744598389, "epoch": 3.074337682878608, "grad_norm": 0.9765625, "learning_rate": 0.00040694315006318616, "loss": 4.9444, "mean_token_accuracy": 0.2207683727145195, "num_tokens": 71238190.0, "step": 31100 }, { "entropy": 5.465323400497437, "epoch": 3.0748319493871095, "grad_norm": 1.0078125, "learning_rate": 0.00040691456314904506, "loss": 4.9754, "mean_token_accuracy": 0.2101695105433464, "num_tokens": 71250534.0, "step": 31105 }, { "entropy": 5.354959344863891, "epoch": 3.0753262158956107, "grad_norm": 1.0703125, "learning_rate": 0.00040688597298978526, "loss": 4.8938, "mean_token_accuracy": 0.22911267429590226, "num_tokens": 71261432.0, "step": 31110 }, { "entropy": 5.371334505081177, "epoch": 3.0758204824041124, "grad_norm": 1.0390625, "learning_rate": 0.0004068573795861101, "loss": 4.9785, "mean_token_accuracy": 0.2108052685856819, "num_tokens": 71272090.0, "step": 31115 }, { "entropy": 5.381827688217163, "epoch": 3.0763147489126137, "grad_norm": 0.97265625, "learning_rate": 0.0004068287829387229, "loss": 4.9233, "mean_token_accuracy": 0.2179894044995308, "num_tokens": 71284696.0, "step": 31120 }, { "entropy": 5.381552028656006, "epoch": 3.076809015421115, "grad_norm": 1.046875, "learning_rate": 0.00040680018304832717, "loss": 4.8956, "mean_token_accuracy": 0.2265668570995331, "num_tokens": 71295701.0, "step": 31125 }, { "entropy": 5.379792308807373, "epoch": 3.0773032819296167, "grad_norm": 1.03125, "learning_rate": 0.00040677157991562653, "loss": 4.918, "mean_token_accuracy": 0.23010421097278594, "num_tokens": 71306798.0, "step": 31130 }, { "entropy": 5.4131556987762455, "epoch": 3.077797548438118, "grad_norm": 1.0234375, "learning_rate": 0.0004067429735413245, "loss": 4.9092, "mean_token_accuracy": 0.21743375808000565, "num_tokens": 71319171.0, "step": 31135 }, { "entropy": 5.399747848510742, "epoch": 3.078291814946619, "grad_norm": 1.0, "learning_rate": 0.000406714363926125, "loss": 4.9369, "mean_token_accuracy": 0.21440124809741973, "num_tokens": 71331479.0, "step": 31140 }, { "entropy": 5.346318340301513, "epoch": 3.0787860814551204, "grad_norm": 0.98046875, "learning_rate": 0.00040668575107073165, "loss": 4.9041, "mean_token_accuracy": 0.22555935978889466, "num_tokens": 71343044.0, "step": 31145 }, { "entropy": 5.524312686920166, "epoch": 3.079280347963622, "grad_norm": 1.0703125, "learning_rate": 0.00040665713497584836, "loss": 4.9776, "mean_token_accuracy": 0.21446940153837205, "num_tokens": 71354552.0, "step": 31150 }, { "entropy": 5.341790008544922, "epoch": 3.0797746144721234, "grad_norm": 1.0, "learning_rate": 0.00040662851564217915, "loss": 4.8821, "mean_token_accuracy": 0.2279602110385895, "num_tokens": 71366201.0, "step": 31155 }, { "entropy": 5.384427165985107, "epoch": 3.0802688809806247, "grad_norm": 0.92578125, "learning_rate": 0.00040659989307042816, "loss": 4.8928, "mean_token_accuracy": 0.2159039244055748, "num_tokens": 71377966.0, "step": 31160 }, { "entropy": 5.424661779403687, "epoch": 3.080763147489126, "grad_norm": 1.0234375, "learning_rate": 0.00040657126726129924, "loss": 4.9465, "mean_token_accuracy": 0.22257007658481598, "num_tokens": 71388927.0, "step": 31165 }, { "entropy": 5.378629970550537, "epoch": 3.0812574139976276, "grad_norm": 1.0859375, "learning_rate": 0.0004065426382154968, "loss": 4.9496, "mean_token_accuracy": 0.22233583331108092, "num_tokens": 71401728.0, "step": 31170 }, { "entropy": 5.457248687744141, "epoch": 3.081751680506129, "grad_norm": 1.0078125, "learning_rate": 0.000406514005933725, "loss": 5.0882, "mean_token_accuracy": 0.2037815496325493, "num_tokens": 71413694.0, "step": 31175 }, { "entropy": 5.37805700302124, "epoch": 3.08224594701463, "grad_norm": 1.0703125, "learning_rate": 0.0004064853704166883, "loss": 4.8822, "mean_token_accuracy": 0.22784789204597472, "num_tokens": 71425485.0, "step": 31180 }, { "entropy": 5.404892349243164, "epoch": 3.082740213523132, "grad_norm": 0.9765625, "learning_rate": 0.000406456731665091, "loss": 4.9193, "mean_token_accuracy": 0.2195939764380455, "num_tokens": 71437320.0, "step": 31185 }, { "entropy": 5.423341894149781, "epoch": 3.083234480031633, "grad_norm": 1.0390625, "learning_rate": 0.00040642808967963787, "loss": 4.9461, "mean_token_accuracy": 0.21681167781352997, "num_tokens": 71448948.0, "step": 31190 }, { "entropy": 5.385015249252319, "epoch": 3.0837287465401344, "grad_norm": 0.9921875, "learning_rate": 0.00040639944446103324, "loss": 4.8721, "mean_token_accuracy": 0.2233794316649437, "num_tokens": 71460997.0, "step": 31195 }, { "entropy": 5.344717121124267, "epoch": 3.0842230130486357, "grad_norm": 1.0234375, "learning_rate": 0.00040637079600998186, "loss": 4.8856, "mean_token_accuracy": 0.22196568101644515, "num_tokens": 71472174.0, "step": 31200 }, { "entropy": 5.376114988327027, "epoch": 3.0847172795571374, "grad_norm": 1.0, "learning_rate": 0.0004063421443271885, "loss": 4.9573, "mean_token_accuracy": 0.21956509947776795, "num_tokens": 71484306.0, "step": 31205 }, { "entropy": 5.395713472366333, "epoch": 3.0852115460656386, "grad_norm": 1.09375, "learning_rate": 0.00040631348941335814, "loss": 4.889, "mean_token_accuracy": 0.22074636369943618, "num_tokens": 71494866.0, "step": 31210 }, { "entropy": 5.409148502349853, "epoch": 3.08570581257414, "grad_norm": 1.046875, "learning_rate": 0.0004062848312691955, "loss": 4.8938, "mean_token_accuracy": 0.22326148003339769, "num_tokens": 71505591.0, "step": 31215 }, { "entropy": 5.407227277755737, "epoch": 3.086200079082641, "grad_norm": 1.0625, "learning_rate": 0.00040625616989540565, "loss": 4.9401, "mean_token_accuracy": 0.21782163232564927, "num_tokens": 71517651.0, "step": 31220 }, { "entropy": 5.447109365463257, "epoch": 3.086694345591143, "grad_norm": 1.1015625, "learning_rate": 0.0004062275052926936, "loss": 4.9522, "mean_token_accuracy": 0.21395166367292404, "num_tokens": 71529301.0, "step": 31225 }, { "entropy": 5.2454078674316404, "epoch": 3.087188612099644, "grad_norm": 1.0390625, "learning_rate": 0.0004061988374617646, "loss": 4.7839, "mean_token_accuracy": 0.23325910419225693, "num_tokens": 71539971.0, "step": 31230 }, { "entropy": 5.385706424713135, "epoch": 3.0876828786081454, "grad_norm": 0.96875, "learning_rate": 0.0004061701664033239, "loss": 4.9797, "mean_token_accuracy": 0.21628005653619767, "num_tokens": 71551905.0, "step": 31235 }, { "entropy": 5.398733282089234, "epoch": 3.088177145116647, "grad_norm": 1.0703125, "learning_rate": 0.0004061414921180767, "loss": 4.8953, "mean_token_accuracy": 0.22348379641771315, "num_tokens": 71562945.0, "step": 31240 }, { "entropy": 5.416925144195557, "epoch": 3.0886714116251484, "grad_norm": 1.0625, "learning_rate": 0.00040611281460672846, "loss": 5.014, "mean_token_accuracy": 0.21070448756217958, "num_tokens": 71574429.0, "step": 31245 }, { "entropy": 5.4225428104400635, "epoch": 3.0891656781336496, "grad_norm": 1.140625, "learning_rate": 0.0004060841338699847, "loss": 4.9695, "mean_token_accuracy": 0.21581717282533647, "num_tokens": 71584827.0, "step": 31250 }, { "entropy": 5.402391767501831, "epoch": 3.089659944642151, "grad_norm": 1.0234375, "learning_rate": 0.00040605544990855074, "loss": 4.8709, "mean_token_accuracy": 0.21529546827077867, "num_tokens": 71595729.0, "step": 31255 }, { "entropy": 5.386199188232422, "epoch": 3.0901542111506526, "grad_norm": 1.0390625, "learning_rate": 0.00040602676272313257, "loss": 4.925, "mean_token_accuracy": 0.2200094774365425, "num_tokens": 71606912.0, "step": 31260 }, { "entropy": 5.3592897891998295, "epoch": 3.090648477659154, "grad_norm": 1.046875, "learning_rate": 0.00040599807231443566, "loss": 4.9733, "mean_token_accuracy": 0.22121639251708985, "num_tokens": 71618706.0, "step": 31265 }, { "entropy": 5.368315076828003, "epoch": 3.091142744167655, "grad_norm": 1.03125, "learning_rate": 0.0004059693786831658, "loss": 4.8915, "mean_token_accuracy": 0.22769914269447328, "num_tokens": 71630826.0, "step": 31270 }, { "entropy": 5.456730222702026, "epoch": 3.0916370106761564, "grad_norm": 1.03125, "learning_rate": 0.000405940681830029, "loss": 4.99, "mean_token_accuracy": 0.2148710310459137, "num_tokens": 71643914.0, "step": 31275 }, { "entropy": 5.393510341644287, "epoch": 3.092131277184658, "grad_norm": 1.0078125, "learning_rate": 0.000405911981755731, "loss": 4.8724, "mean_token_accuracy": 0.2283584237098694, "num_tokens": 71655523.0, "step": 31280 }, { "entropy": 5.350870990753174, "epoch": 3.0926255436931593, "grad_norm": 0.97265625, "learning_rate": 0.0004058832784609779, "loss": 4.8912, "mean_token_accuracy": 0.2224075213074684, "num_tokens": 71667423.0, "step": 31285 }, { "entropy": 5.3328886985778805, "epoch": 3.0931198102016606, "grad_norm": 1.03125, "learning_rate": 0.00040585457194647595, "loss": 4.8832, "mean_token_accuracy": 0.21815989166498184, "num_tokens": 71678116.0, "step": 31290 }, { "entropy": 5.420734596252442, "epoch": 3.0936140767101623, "grad_norm": 1.0234375, "learning_rate": 0.00040582586221293127, "loss": 4.9783, "mean_token_accuracy": 0.2150306671857834, "num_tokens": 71690109.0, "step": 31295 }, { "entropy": 5.439567804336548, "epoch": 3.0941083432186636, "grad_norm": 1.0078125, "learning_rate": 0.00040579714926105, "loss": 5.0233, "mean_token_accuracy": 0.21238171607255935, "num_tokens": 71702640.0, "step": 31300 }, { "entropy": 5.398792934417725, "epoch": 3.094602609727165, "grad_norm": 0.98046875, "learning_rate": 0.0004057684330915386, "loss": 4.8879, "mean_token_accuracy": 0.2197289064526558, "num_tokens": 71714537.0, "step": 31305 }, { "entropy": 5.367176675796509, "epoch": 3.095096876235666, "grad_norm": 1.09375, "learning_rate": 0.00040573971370510344, "loss": 4.9955, "mean_token_accuracy": 0.2143272802233696, "num_tokens": 71724901.0, "step": 31310 }, { "entropy": 5.427648258209229, "epoch": 3.095591142744168, "grad_norm": 0.91015625, "learning_rate": 0.000405710991102451, "loss": 4.9692, "mean_token_accuracy": 0.21403862088918685, "num_tokens": 71736640.0, "step": 31315 }, { "entropy": 5.432495880126953, "epoch": 3.096085409252669, "grad_norm": 1.15625, "learning_rate": 0.00040568226528428795, "loss": 4.9688, "mean_token_accuracy": 0.21255689710378647, "num_tokens": 71747193.0, "step": 31320 }, { "entropy": 5.420435237884521, "epoch": 3.0965796757611703, "grad_norm": 1.03125, "learning_rate": 0.000405653536251321, "loss": 5.024, "mean_token_accuracy": 0.20597499012947082, "num_tokens": 71759073.0, "step": 31325 }, { "entropy": 5.454598999023437, "epoch": 3.097073942269672, "grad_norm": 0.9765625, "learning_rate": 0.0004056248040042566, "loss": 4.9412, "mean_token_accuracy": 0.21655234545469285, "num_tokens": 71770486.0, "step": 31330 }, { "entropy": 5.466549205780029, "epoch": 3.0975682087781733, "grad_norm": 1.0546875, "learning_rate": 0.00040559606854380186, "loss": 5.0116, "mean_token_accuracy": 0.2191604793071747, "num_tokens": 71781536.0, "step": 31335 }, { "entropy": 5.421922922134399, "epoch": 3.0980624752866746, "grad_norm": 1.0078125, "learning_rate": 0.00040556732987066357, "loss": 4.992, "mean_token_accuracy": 0.21619280576705932, "num_tokens": 71792521.0, "step": 31340 }, { "entropy": 5.3545595645904545, "epoch": 3.098556741795176, "grad_norm": 0.98046875, "learning_rate": 0.0004055385879855487, "loss": 4.9587, "mean_token_accuracy": 0.21848182529211044, "num_tokens": 71804150.0, "step": 31345 }, { "entropy": 5.363057565689087, "epoch": 3.0990510083036775, "grad_norm": 1.0546875, "learning_rate": 0.00040550984288916436, "loss": 4.91, "mean_token_accuracy": 0.230670328438282, "num_tokens": 71815842.0, "step": 31350 }, { "entropy": 5.4817955017089846, "epoch": 3.099545274812179, "grad_norm": 1.0546875, "learning_rate": 0.00040548109458221756, "loss": 4.945, "mean_token_accuracy": 0.2173105150461197, "num_tokens": 71827243.0, "step": 31355 }, { "entropy": 5.40636100769043, "epoch": 3.10003954132068, "grad_norm": 1.078125, "learning_rate": 0.0004054523430654156, "loss": 4.986, "mean_token_accuracy": 0.21955959349870682, "num_tokens": 71839424.0, "step": 31360 }, { "entropy": 5.391243124008179, "epoch": 3.1005338078291813, "grad_norm": 1.046875, "learning_rate": 0.00040542358833946577, "loss": 4.9982, "mean_token_accuracy": 0.2187706470489502, "num_tokens": 71851709.0, "step": 31365 }, { "entropy": 5.391156339645386, "epoch": 3.101028074337683, "grad_norm": 0.9765625, "learning_rate": 0.0004053948304050755, "loss": 4.9196, "mean_token_accuracy": 0.2206217274069786, "num_tokens": 71862841.0, "step": 31370 }, { "entropy": 5.403653764724732, "epoch": 3.1015223408461843, "grad_norm": 1.03125, "learning_rate": 0.00040536606926295203, "loss": 4.911, "mean_token_accuracy": 0.2273534953594208, "num_tokens": 71873104.0, "step": 31375 }, { "entropy": 5.449539995193481, "epoch": 3.1020166073546855, "grad_norm": 1.046875, "learning_rate": 0.00040533730491380316, "loss": 5.0252, "mean_token_accuracy": 0.21418839693069458, "num_tokens": 71884809.0, "step": 31380 }, { "entropy": 5.403022241592407, "epoch": 3.102510873863187, "grad_norm": 1.0390625, "learning_rate": 0.0004053085373583363, "loss": 4.925, "mean_token_accuracy": 0.22159834653139115, "num_tokens": 71896625.0, "step": 31385 }, { "entropy": 5.371267318725586, "epoch": 3.1030051403716885, "grad_norm": 1.0234375, "learning_rate": 0.0004052797665972593, "loss": 4.9183, "mean_token_accuracy": 0.2240040495991707, "num_tokens": 71908628.0, "step": 31390 }, { "entropy": 5.404375076293945, "epoch": 3.1034994068801898, "grad_norm": 1.0703125, "learning_rate": 0.00040525099263127976, "loss": 4.944, "mean_token_accuracy": 0.2187753990292549, "num_tokens": 71919971.0, "step": 31395 }, { "entropy": 5.420210647583008, "epoch": 3.103993673388691, "grad_norm": 1.015625, "learning_rate": 0.00040522221546110556, "loss": 5.0062, "mean_token_accuracy": 0.21275546848773957, "num_tokens": 71931240.0, "step": 31400 }, { "entropy": 5.343015098571778, "epoch": 3.1044879398971927, "grad_norm": 0.96484375, "learning_rate": 0.00040519343508744473, "loss": 4.9394, "mean_token_accuracy": 0.22236475944519044, "num_tokens": 71942735.0, "step": 31405 }, { "entropy": 5.32021427154541, "epoch": 3.104982206405694, "grad_norm": 1.046875, "learning_rate": 0.00040516465151100515, "loss": 4.875, "mean_token_accuracy": 0.2349018082022667, "num_tokens": 71953685.0, "step": 31410 }, { "entropy": 5.411223554611206, "epoch": 3.1054764729141953, "grad_norm": 1.078125, "learning_rate": 0.00040513586473249496, "loss": 4.9482, "mean_token_accuracy": 0.21441251188516616, "num_tokens": 71966061.0, "step": 31415 }, { "entropy": 5.453322887420654, "epoch": 3.1059707394226965, "grad_norm": 1.3125, "learning_rate": 0.0004051070747526223, "loss": 4.9788, "mean_token_accuracy": 0.21059480160474778, "num_tokens": 71978002.0, "step": 31420 }, { "entropy": 5.345702886581421, "epoch": 3.1064650059311982, "grad_norm": 1.078125, "learning_rate": 0.00040507828157209546, "loss": 4.8359, "mean_token_accuracy": 0.23058629482984544, "num_tokens": 71988504.0, "step": 31425 }, { "entropy": 5.35727858543396, "epoch": 3.1069592724396995, "grad_norm": 1.0234375, "learning_rate": 0.00040504948519162276, "loss": 4.9915, "mean_token_accuracy": 0.2080179750919342, "num_tokens": 72000900.0, "step": 31430 }, { "entropy": 5.463846635818482, "epoch": 3.1074535389482008, "grad_norm": 1.078125, "learning_rate": 0.0004050206856119124, "loss": 4.992, "mean_token_accuracy": 0.21868247985839845, "num_tokens": 72011134.0, "step": 31435 }, { "entropy": 5.375261640548706, "epoch": 3.1079478054567025, "grad_norm": 1.046875, "learning_rate": 0.0004049918828336732, "loss": 4.892, "mean_token_accuracy": 0.2202080473303795, "num_tokens": 72022784.0, "step": 31440 }, { "entropy": 5.332051944732666, "epoch": 3.1084420719652037, "grad_norm": 1.046875, "learning_rate": 0.0004049630768576133, "loss": 4.8455, "mean_token_accuracy": 0.2305077686905861, "num_tokens": 72033353.0, "step": 31445 }, { "entropy": 5.4143595695495605, "epoch": 3.108936338473705, "grad_norm": 1.046875, "learning_rate": 0.00040493426768444164, "loss": 4.935, "mean_token_accuracy": 0.21477026492357254, "num_tokens": 72044182.0, "step": 31450 }, { "entropy": 5.455833053588867, "epoch": 3.1094306049822062, "grad_norm": 0.95703125, "learning_rate": 0.0004049054553148668, "loss": 4.992, "mean_token_accuracy": 0.21190426349639893, "num_tokens": 72056365.0, "step": 31455 }, { "entropy": 5.328071784973145, "epoch": 3.109924871490708, "grad_norm": 1.0859375, "learning_rate": 0.0004048766397495977, "loss": 4.9127, "mean_token_accuracy": 0.21887015104293822, "num_tokens": 72066580.0, "step": 31460 }, { "entropy": 5.364016199111939, "epoch": 3.110419137999209, "grad_norm": 1.0, "learning_rate": 0.00040484782098934303, "loss": 4.9479, "mean_token_accuracy": 0.22352479100227357, "num_tokens": 72077731.0, "step": 31465 }, { "entropy": 5.446867942810059, "epoch": 3.1109134045077105, "grad_norm": 1.25, "learning_rate": 0.0004048189990348119, "loss": 4.9528, "mean_token_accuracy": 0.21751641035079955, "num_tokens": 72088785.0, "step": 31470 }, { "entropy": 5.362438631057739, "epoch": 3.1114076710162117, "grad_norm": 1.0234375, "learning_rate": 0.00040479017388671317, "loss": 4.9167, "mean_token_accuracy": 0.22526904940605164, "num_tokens": 72100235.0, "step": 31475 }, { "entropy": 5.321478366851807, "epoch": 3.1119019375247134, "grad_norm": 1.015625, "learning_rate": 0.00040476134554575613, "loss": 4.8661, "mean_token_accuracy": 0.2253323972225189, "num_tokens": 72112124.0, "step": 31480 }, { "entropy": 5.447280359268189, "epoch": 3.1123962040332147, "grad_norm": 0.99609375, "learning_rate": 0.0004047325140126497, "loss": 4.928, "mean_token_accuracy": 0.21651099473237992, "num_tokens": 72124138.0, "step": 31485 }, { "entropy": 5.428809785842896, "epoch": 3.112890470541716, "grad_norm": 1.03125, "learning_rate": 0.00040470367928810343, "loss": 4.9175, "mean_token_accuracy": 0.2161221444606781, "num_tokens": 72134330.0, "step": 31490 }, { "entropy": 5.477111148834228, "epoch": 3.1133847370502177, "grad_norm": 0.98046875, "learning_rate": 0.00040467484137282644, "loss": 5.0524, "mean_token_accuracy": 0.20785557329654694, "num_tokens": 72146999.0, "step": 31495 }, { "entropy": 5.3855945587158205, "epoch": 3.113879003558719, "grad_norm": 1.015625, "learning_rate": 0.00040464600026752834, "loss": 4.9342, "mean_token_accuracy": 0.2198129877448082, "num_tokens": 72158648.0, "step": 31500 }, { "entropy": 5.412158632278443, "epoch": 3.11437327006722, "grad_norm": 0.96875, "learning_rate": 0.0004046171559729184, "loss": 4.9338, "mean_token_accuracy": 0.22022552341222762, "num_tokens": 72169621.0, "step": 31505 }, { "entropy": 5.352029800415039, "epoch": 3.1148675365757215, "grad_norm": 1.0078125, "learning_rate": 0.0004045883084897064, "loss": 4.8555, "mean_token_accuracy": 0.22678750306367873, "num_tokens": 72179928.0, "step": 31510 }, { "entropy": 5.354543972015381, "epoch": 3.115361803084223, "grad_norm": 0.984375, "learning_rate": 0.00040455945781860185, "loss": 4.8919, "mean_token_accuracy": 0.22088756412267685, "num_tokens": 72190699.0, "step": 31515 }, { "entropy": 5.374576663970947, "epoch": 3.1158560695927244, "grad_norm": 0.984375, "learning_rate": 0.0004045306039603146, "loss": 4.9549, "mean_token_accuracy": 0.2160742238163948, "num_tokens": 72202893.0, "step": 31520 }, { "entropy": 5.416742992401123, "epoch": 3.1163503361012257, "grad_norm": 1.0859375, "learning_rate": 0.00040450174691555434, "loss": 5.0209, "mean_token_accuracy": 0.215982648730278, "num_tokens": 72214614.0, "step": 31525 }, { "entropy": 5.371134567260742, "epoch": 3.116844602609727, "grad_norm": 1.0625, "learning_rate": 0.0004044728866850311, "loss": 4.9136, "mean_token_accuracy": 0.22836748510599136, "num_tokens": 72225882.0, "step": 31530 }, { "entropy": 5.445662593841552, "epoch": 3.1173388691182287, "grad_norm": 1.1484375, "learning_rate": 0.0004044440232694547, "loss": 4.9401, "mean_token_accuracy": 0.21767502427101135, "num_tokens": 72236264.0, "step": 31535 }, { "entropy": 5.399515914916992, "epoch": 3.11783313562673, "grad_norm": 1.0, "learning_rate": 0.0004044151566695353, "loss": 5.0062, "mean_token_accuracy": 0.2138653352856636, "num_tokens": 72247380.0, "step": 31540 }, { "entropy": 5.389342212677002, "epoch": 3.118327402135231, "grad_norm": 1.078125, "learning_rate": 0.00040438628688598287, "loss": 4.8524, "mean_token_accuracy": 0.22732233852148057, "num_tokens": 72259141.0, "step": 31545 }, { "entropy": 5.3546709537506105, "epoch": 3.118821668643733, "grad_norm": 1.046875, "learning_rate": 0.0004043574139195078, "loss": 4.8124, "mean_token_accuracy": 0.2260691612958908, "num_tokens": 72269549.0, "step": 31550 }, { "entropy": 5.313196992874145, "epoch": 3.119315935152234, "grad_norm": 1.015625, "learning_rate": 0.00040432853777082025, "loss": 4.915, "mean_token_accuracy": 0.22924906015396118, "num_tokens": 72281589.0, "step": 31555 }, { "entropy": 5.3704828262329105, "epoch": 3.1198102016607354, "grad_norm": 1.0703125, "learning_rate": 0.0004042996584406305, "loss": 5.0143, "mean_token_accuracy": 0.20906869620084761, "num_tokens": 72294239.0, "step": 31560 }, { "entropy": 5.368531560897827, "epoch": 3.1203044681692367, "grad_norm": 1.09375, "learning_rate": 0.00040427077592964923, "loss": 4.9811, "mean_token_accuracy": 0.21467864960432054, "num_tokens": 72306153.0, "step": 31565 }, { "entropy": 5.444409036636353, "epoch": 3.1207987346777384, "grad_norm": 1.0078125, "learning_rate": 0.0004042418902385868, "loss": 4.924, "mean_token_accuracy": 0.21923563927412032, "num_tokens": 72317270.0, "step": 31570 }, { "entropy": 5.399342727661133, "epoch": 3.1212930011862396, "grad_norm": 1.0, "learning_rate": 0.00040421300136815375, "loss": 4.961, "mean_token_accuracy": 0.21719055920839309, "num_tokens": 72329073.0, "step": 31575 }, { "entropy": 5.32893853187561, "epoch": 3.121787267694741, "grad_norm": 1.0546875, "learning_rate": 0.0004041841093190609, "loss": 4.8975, "mean_token_accuracy": 0.22465674430131913, "num_tokens": 72339677.0, "step": 31580 }, { "entropy": 5.417914962768554, "epoch": 3.1222815342032426, "grad_norm": 1.0859375, "learning_rate": 0.0004041552140920189, "loss": 4.9468, "mean_token_accuracy": 0.22710075378417968, "num_tokens": 72350527.0, "step": 31585 }, { "entropy": 5.439721775054932, "epoch": 3.122775800711744, "grad_norm": 0.9921875, "learning_rate": 0.0004041263156877386, "loss": 4.948, "mean_token_accuracy": 0.22070085257291794, "num_tokens": 72362740.0, "step": 31590 }, { "entropy": 5.354420804977417, "epoch": 3.123270067220245, "grad_norm": 1.0390625, "learning_rate": 0.00040409741410693084, "loss": 4.919, "mean_token_accuracy": 0.2167448952794075, "num_tokens": 72372705.0, "step": 31595 }, { "entropy": 5.251502418518067, "epoch": 3.1237643337287464, "grad_norm": 1.0234375, "learning_rate": 0.00040406850935030677, "loss": 4.8502, "mean_token_accuracy": 0.23087685853242873, "num_tokens": 72385085.0, "step": 31600 }, { "entropy": 5.402199172973633, "epoch": 3.124258600237248, "grad_norm": 1.0546875, "learning_rate": 0.00040403960141857724, "loss": 4.9619, "mean_token_accuracy": 0.2238198161125183, "num_tokens": 72397017.0, "step": 31605 }, { "entropy": 5.39735746383667, "epoch": 3.1247528667457494, "grad_norm": 1.0625, "learning_rate": 0.0004040106903124536, "loss": 4.9275, "mean_token_accuracy": 0.22010526955127716, "num_tokens": 72409378.0, "step": 31610 }, { "entropy": 5.406848955154419, "epoch": 3.1252471332542506, "grad_norm": 1.0234375, "learning_rate": 0.0004039817760326469, "loss": 4.9687, "mean_token_accuracy": 0.21038103550672532, "num_tokens": 72420585.0, "step": 31615 }, { "entropy": 5.493139743804932, "epoch": 3.125741399762752, "grad_norm": 0.99609375, "learning_rate": 0.00040395285857986845, "loss": 5.0677, "mean_token_accuracy": 0.2071381613612175, "num_tokens": 72431779.0, "step": 31620 }, { "entropy": 5.404197645187378, "epoch": 3.1262356662712536, "grad_norm": 1.0, "learning_rate": 0.0004039239379548298, "loss": 4.8775, "mean_token_accuracy": 0.22189362496137618, "num_tokens": 72441421.0, "step": 31625 }, { "entropy": 5.4007243633270265, "epoch": 3.126729932779755, "grad_norm": 1.0546875, "learning_rate": 0.0004038950141582422, "loss": 4.9403, "mean_token_accuracy": 0.2159806951880455, "num_tokens": 72452664.0, "step": 31630 }, { "entropy": 5.350979661941528, "epoch": 3.127224199288256, "grad_norm": 0.984375, "learning_rate": 0.0004038660871908173, "loss": 4.8457, "mean_token_accuracy": 0.22348916977643968, "num_tokens": 72464008.0, "step": 31635 }, { "entropy": 5.460098218917847, "epoch": 3.1277184657967574, "grad_norm": 1.046875, "learning_rate": 0.00040383715705326665, "loss": 5.0126, "mean_token_accuracy": 0.2143450438976288, "num_tokens": 72475782.0, "step": 31640 }, { "entropy": 5.360867547988891, "epoch": 3.128212732305259, "grad_norm": 0.9765625, "learning_rate": 0.0004038082237463019, "loss": 4.9662, "mean_token_accuracy": 0.21342115700244904, "num_tokens": 72487770.0, "step": 31645 }, { "entropy": 5.3050302028656, "epoch": 3.1287069988137604, "grad_norm": 0.9609375, "learning_rate": 0.00040377928727063485, "loss": 4.8601, "mean_token_accuracy": 0.2245774507522583, "num_tokens": 72499336.0, "step": 31650 }, { "entropy": 5.353214168548584, "epoch": 3.1292012653222616, "grad_norm": 0.94140625, "learning_rate": 0.00040375034762697736, "loss": 4.9044, "mean_token_accuracy": 0.21769764870405198, "num_tokens": 72510658.0, "step": 31655 }, { "entropy": 5.400566720962525, "epoch": 3.1296955318307633, "grad_norm": 1.046875, "learning_rate": 0.0004037214048160415, "loss": 4.9384, "mean_token_accuracy": 0.21332341134548188, "num_tokens": 72522617.0, "step": 31660 }, { "entropy": 5.379146718978882, "epoch": 3.1301897983392646, "grad_norm": 1.015625, "learning_rate": 0.0004036924588385389, "loss": 4.8237, "mean_token_accuracy": 0.23479813039302827, "num_tokens": 72532829.0, "step": 31665 }, { "entropy": 5.350657653808594, "epoch": 3.130684064847766, "grad_norm": 1.046875, "learning_rate": 0.00040366350969518196, "loss": 4.9004, "mean_token_accuracy": 0.22724444568157195, "num_tokens": 72543556.0, "step": 31670 }, { "entropy": 5.446150922775269, "epoch": 3.131178331356267, "grad_norm": 1.03125, "learning_rate": 0.0004036345573866827, "loss": 4.9468, "mean_token_accuracy": 0.21405071914196014, "num_tokens": 72554545.0, "step": 31675 }, { "entropy": 5.4809637546539305, "epoch": 3.131672597864769, "grad_norm": 0.9921875, "learning_rate": 0.00040360560191375335, "loss": 5.0305, "mean_token_accuracy": 0.21018345803022384, "num_tokens": 72566158.0, "step": 31680 }, { "entropy": 5.426585483551025, "epoch": 3.13216686437327, "grad_norm": 1.0, "learning_rate": 0.0004035766432771063, "loss": 5.057, "mean_token_accuracy": 0.21679708808660508, "num_tokens": 72578229.0, "step": 31685 }, { "entropy": 5.3285027027130125, "epoch": 3.1326611308817713, "grad_norm": 1.0859375, "learning_rate": 0.00040354768147745387, "loss": 4.8339, "mean_token_accuracy": 0.22811528593301772, "num_tokens": 72589237.0, "step": 31690 }, { "entropy": 5.420715808868408, "epoch": 3.133155397390273, "grad_norm": 0.9921875, "learning_rate": 0.0004035187165155085, "loss": 4.9489, "mean_token_accuracy": 0.2195846125483513, "num_tokens": 72600531.0, "step": 31695 }, { "entropy": 5.37408480644226, "epoch": 3.1336496638987743, "grad_norm": 1.015625, "learning_rate": 0.0004034897483919827, "loss": 4.8816, "mean_token_accuracy": 0.22504348456859588, "num_tokens": 72611861.0, "step": 31700 }, { "entropy": 5.399639129638672, "epoch": 3.1341439304072756, "grad_norm": 1.015625, "learning_rate": 0.0004034607771075893, "loss": 4.9678, "mean_token_accuracy": 0.22025686651468276, "num_tokens": 72624142.0, "step": 31705 }, { "entropy": 5.369750118255615, "epoch": 3.134638196915777, "grad_norm": 1.109375, "learning_rate": 0.00040343180266304074, "loss": 4.873, "mean_token_accuracy": 0.2192170351743698, "num_tokens": 72634995.0, "step": 31710 }, { "entropy": 5.423182582855224, "epoch": 3.1351324634242785, "grad_norm": 0.95703125, "learning_rate": 0.00040340282505904997, "loss": 5.0036, "mean_token_accuracy": 0.21890877038240433, "num_tokens": 72646798.0, "step": 31715 }, { "entropy": 5.428723955154419, "epoch": 3.13562672993278, "grad_norm": 1.0, "learning_rate": 0.00040337384429632974, "loss": 4.9292, "mean_token_accuracy": 0.22421688884496688, "num_tokens": 72657938.0, "step": 31720 }, { "entropy": 5.454217100143433, "epoch": 3.136120996441281, "grad_norm": 0.9609375, "learning_rate": 0.000403344860375593, "loss": 5.003, "mean_token_accuracy": 0.2139722988009453, "num_tokens": 72671069.0, "step": 31725 }, { "entropy": 5.37121171951294, "epoch": 3.1366152629497823, "grad_norm": 1.015625, "learning_rate": 0.0004033158732975529, "loss": 4.9461, "mean_token_accuracy": 0.2167557120323181, "num_tokens": 72682695.0, "step": 31730 }, { "entropy": 5.40613489151001, "epoch": 3.137109529458284, "grad_norm": 0.94921875, "learning_rate": 0.0004032868830629223, "loss": 4.976, "mean_token_accuracy": 0.22074110209941863, "num_tokens": 72694514.0, "step": 31735 }, { "entropy": 5.360488414764404, "epoch": 3.1376037959667853, "grad_norm": 1.0234375, "learning_rate": 0.00040325788967241453, "loss": 4.872, "mean_token_accuracy": 0.21971508413553237, "num_tokens": 72705427.0, "step": 31740 }, { "entropy": 5.319887733459472, "epoch": 3.1380980624752866, "grad_norm": 1.09375, "learning_rate": 0.00040322889312674275, "loss": 4.8495, "mean_token_accuracy": 0.22729218751192093, "num_tokens": 72716877.0, "step": 31745 }, { "entropy": 5.331980514526367, "epoch": 3.1385923289837883, "grad_norm": 1.0234375, "learning_rate": 0.00040319989342662036, "loss": 4.872, "mean_token_accuracy": 0.22580246329307557, "num_tokens": 72727927.0, "step": 31750 }, { "entropy": 5.428868579864502, "epoch": 3.1390865954922895, "grad_norm": 1.1015625, "learning_rate": 0.00040317089057276067, "loss": 5.0252, "mean_token_accuracy": 0.21703898459672927, "num_tokens": 72739645.0, "step": 31755 }, { "entropy": 5.461847829818725, "epoch": 3.139580862000791, "grad_norm": 0.9453125, "learning_rate": 0.0004031418845658772, "loss": 5.0022, "mean_token_accuracy": 0.20884791016578674, "num_tokens": 72750961.0, "step": 31760 }, { "entropy": 5.440127515792847, "epoch": 3.140075128509292, "grad_norm": 1.1015625, "learning_rate": 0.00040311287540668346, "loss": 4.9883, "mean_token_accuracy": 0.21199798583984375, "num_tokens": 72763599.0, "step": 31765 }, { "entropy": 5.377119350433349, "epoch": 3.1405693950177938, "grad_norm": 0.98046875, "learning_rate": 0.00040308386309589314, "loss": 4.8961, "mean_token_accuracy": 0.22561048567295075, "num_tokens": 72775807.0, "step": 31770 }, { "entropy": 5.389883232116699, "epoch": 3.141063661526295, "grad_norm": 1.1171875, "learning_rate": 0.0004030548476342199, "loss": 4.9096, "mean_token_accuracy": 0.22096057534217833, "num_tokens": 72786161.0, "step": 31775 }, { "entropy": 5.403966283798217, "epoch": 3.1415579280347963, "grad_norm": 1.015625, "learning_rate": 0.00040302582902237755, "loss": 4.9828, "mean_token_accuracy": 0.21934870034456252, "num_tokens": 72798211.0, "step": 31780 }, { "entropy": 5.434576845169067, "epoch": 3.1420521945432975, "grad_norm": 0.94140625, "learning_rate": 0.00040299680726107995, "loss": 4.9783, "mean_token_accuracy": 0.21553680002689363, "num_tokens": 72809187.0, "step": 31785 }, { "entropy": 5.373623180389404, "epoch": 3.1425464610517992, "grad_norm": 0.9765625, "learning_rate": 0.00040296778235104105, "loss": 4.9146, "mean_token_accuracy": 0.22289526462554932, "num_tokens": 72820486.0, "step": 31790 }, { "entropy": 5.322180080413818, "epoch": 3.1430407275603005, "grad_norm": 1.0546875, "learning_rate": 0.0004029387542929748, "loss": 4.8525, "mean_token_accuracy": 0.23025185018777847, "num_tokens": 72831442.0, "step": 31795 }, { "entropy": 5.368121814727783, "epoch": 3.1435349940688018, "grad_norm": 1.0546875, "learning_rate": 0.00040290972308759535, "loss": 4.8835, "mean_token_accuracy": 0.2250526249408722, "num_tokens": 72841902.0, "step": 31800 }, { "entropy": 5.288333320617676, "epoch": 3.1440292605773035, "grad_norm": 1.03125, "learning_rate": 0.00040288068873561687, "loss": 4.7973, "mean_token_accuracy": 0.23452527672052384, "num_tokens": 72852327.0, "step": 31805 }, { "entropy": 5.406289434432983, "epoch": 3.1445235270858047, "grad_norm": 1.0625, "learning_rate": 0.0004028516512377537, "loss": 4.9435, "mean_token_accuracy": 0.20876182466745377, "num_tokens": 72862643.0, "step": 31810 }, { "entropy": 5.346348810195923, "epoch": 3.145017793594306, "grad_norm": 0.9765625, "learning_rate": 0.00040282261059471997, "loss": 4.9435, "mean_token_accuracy": 0.21532326936721802, "num_tokens": 72874081.0, "step": 31815 }, { "entropy": 5.411605739593506, "epoch": 3.1455120601028073, "grad_norm": 0.95703125, "learning_rate": 0.00040279356680723025, "loss": 4.9311, "mean_token_accuracy": 0.2198442131280899, "num_tokens": 72885472.0, "step": 31820 }, { "entropy": 5.401024675369262, "epoch": 3.146006326611309, "grad_norm": 1.0078125, "learning_rate": 0.0004027645198759988, "loss": 4.9145, "mean_token_accuracy": 0.2271820932626724, "num_tokens": 72896626.0, "step": 31825 }, { "entropy": 5.380189085006714, "epoch": 3.1465005931198102, "grad_norm": 1.078125, "learning_rate": 0.0004027354698017405, "loss": 4.9274, "mean_token_accuracy": 0.22124247550964354, "num_tokens": 72907782.0, "step": 31830 }, { "entropy": 5.353755712509155, "epoch": 3.1469948596283115, "grad_norm": 0.99609375, "learning_rate": 0.00040270641658516986, "loss": 4.8882, "mean_token_accuracy": 0.21811637729406358, "num_tokens": 72919024.0, "step": 31835 }, { "entropy": 5.393744707107544, "epoch": 3.147489126136813, "grad_norm": 1.0234375, "learning_rate": 0.0004026773602270015, "loss": 4.9435, "mean_token_accuracy": 0.2233407124876976, "num_tokens": 72930576.0, "step": 31840 }, { "entropy": 5.416038560867309, "epoch": 3.1479833926453145, "grad_norm": 1.09375, "learning_rate": 0.00040264830072795027, "loss": 4.9904, "mean_token_accuracy": 0.21649879217147827, "num_tokens": 72942489.0, "step": 31845 }, { "entropy": 5.44717001914978, "epoch": 3.1484776591538157, "grad_norm": 1.109375, "learning_rate": 0.0004026192380887311, "loss": 5.0102, "mean_token_accuracy": 0.20751241594552994, "num_tokens": 72954209.0, "step": 31850 }, { "entropy": 5.45564866065979, "epoch": 3.148971925662317, "grad_norm": 1.1171875, "learning_rate": 0.0004025901723100588, "loss": 5.0308, "mean_token_accuracy": 0.21578427255153657, "num_tokens": 72965939.0, "step": 31855 }, { "entropy": 5.375657749176026, "epoch": 3.1494661921708187, "grad_norm": 1.0, "learning_rate": 0.0004025611033926484, "loss": 4.8697, "mean_token_accuracy": 0.22631241828203202, "num_tokens": 72977114.0, "step": 31860 }, { "entropy": 5.429088401794433, "epoch": 3.14996045867932, "grad_norm": 0.98828125, "learning_rate": 0.00040253203133721515, "loss": 4.9948, "mean_token_accuracy": 0.21727503091096878, "num_tokens": 72989726.0, "step": 31865 }, { "entropy": 5.303113174438477, "epoch": 3.150454725187821, "grad_norm": 0.9921875, "learning_rate": 0.0004025029561444742, "loss": 4.9174, "mean_token_accuracy": 0.2209486961364746, "num_tokens": 73000055.0, "step": 31870 }, { "entropy": 5.313371324539185, "epoch": 3.1509489916963225, "grad_norm": 1.03125, "learning_rate": 0.00040247387781514065, "loss": 4.9158, "mean_token_accuracy": 0.221088208258152, "num_tokens": 73010769.0, "step": 31875 }, { "entropy": 5.46993932723999, "epoch": 3.151443258204824, "grad_norm": 0.9453125, "learning_rate": 0.00040244479634992997, "loss": 4.9782, "mean_token_accuracy": 0.21680374145507814, "num_tokens": 73022032.0, "step": 31880 }, { "entropy": 5.358133220672608, "epoch": 3.1519375247133254, "grad_norm": 1.0703125, "learning_rate": 0.00040241571174955755, "loss": 4.9203, "mean_token_accuracy": 0.21705729514360428, "num_tokens": 73033877.0, "step": 31885 }, { "entropy": 5.351234340667725, "epoch": 3.1524317912218267, "grad_norm": 0.97265625, "learning_rate": 0.0004023866240147389, "loss": 4.8757, "mean_token_accuracy": 0.21882398128509523, "num_tokens": 73045670.0, "step": 31890 }, { "entropy": 5.301354646682739, "epoch": 3.152926057730328, "grad_norm": 1.0546875, "learning_rate": 0.0004023575331461894, "loss": 4.92, "mean_token_accuracy": 0.2239979699254036, "num_tokens": 73056879.0, "step": 31895 }, { "entropy": 5.388696146011353, "epoch": 3.1534203242388297, "grad_norm": 1.09375, "learning_rate": 0.00040232843914462493, "loss": 4.9598, "mean_token_accuracy": 0.212164968252182, "num_tokens": 73068422.0, "step": 31900 }, { "entropy": 5.407004117965698, "epoch": 3.153914590747331, "grad_norm": 0.9921875, "learning_rate": 0.0004022993420107611, "loss": 4.8649, "mean_token_accuracy": 0.2228280708193779, "num_tokens": 73079883.0, "step": 31905 }, { "entropy": 5.354489421844482, "epoch": 3.154408857255832, "grad_norm": 1.125, "learning_rate": 0.00040227024174531364, "loss": 4.934, "mean_token_accuracy": 0.2211434632539749, "num_tokens": 73090832.0, "step": 31910 }, { "entropy": 5.334781455993652, "epoch": 3.154903123764334, "grad_norm": 1.1171875, "learning_rate": 0.0004022411383489985, "loss": 4.8762, "mean_token_accuracy": 0.22714847773313523, "num_tokens": 73102154.0, "step": 31915 }, { "entropy": 5.40356183052063, "epoch": 3.155397390272835, "grad_norm": 1.03125, "learning_rate": 0.0004022120318225317, "loss": 4.9525, "mean_token_accuracy": 0.22355523258447646, "num_tokens": 73113530.0, "step": 31920 }, { "entropy": 5.464871644973755, "epoch": 3.1558916567813364, "grad_norm": 1.03125, "learning_rate": 0.00040218292216662903, "loss": 5.0099, "mean_token_accuracy": 0.21506910920143127, "num_tokens": 73124379.0, "step": 31925 }, { "entropy": 5.337626218795776, "epoch": 3.1563859232898377, "grad_norm": 0.99609375, "learning_rate": 0.00040215380938200693, "loss": 4.9465, "mean_token_accuracy": 0.21807491332292556, "num_tokens": 73136406.0, "step": 31930 }, { "entropy": 5.4622725486755375, "epoch": 3.1568801897983394, "grad_norm": 0.9609375, "learning_rate": 0.00040212469346938127, "loss": 4.9911, "mean_token_accuracy": 0.21763025969266891, "num_tokens": 73149302.0, "step": 31935 }, { "entropy": 5.361596584320068, "epoch": 3.1573744563068407, "grad_norm": 1.0703125, "learning_rate": 0.0004020955744294685, "loss": 4.9368, "mean_token_accuracy": 0.2116974651813507, "num_tokens": 73160462.0, "step": 31940 }, { "entropy": 5.325572109222412, "epoch": 3.157868722815342, "grad_norm": 1.03125, "learning_rate": 0.00040206645226298484, "loss": 4.832, "mean_token_accuracy": 0.22986166179180145, "num_tokens": 73171849.0, "step": 31945 }, { "entropy": 5.326461219787598, "epoch": 3.1583629893238436, "grad_norm": 1.1328125, "learning_rate": 0.0004020373269706468, "loss": 4.8834, "mean_token_accuracy": 0.22431587129831315, "num_tokens": 73182132.0, "step": 31950 }, { "entropy": 5.4314525604248045, "epoch": 3.158857255832345, "grad_norm": 1.015625, "learning_rate": 0.0004020081985531706, "loss": 4.9867, "mean_token_accuracy": 0.21719207167625426, "num_tokens": 73194527.0, "step": 31955 }, { "entropy": 5.338670158386231, "epoch": 3.159351522340846, "grad_norm": 0.98046875, "learning_rate": 0.0004019790670112733, "loss": 4.9093, "mean_token_accuracy": 0.22252341955900193, "num_tokens": 73206104.0, "step": 31960 }, { "entropy": 5.308073091506958, "epoch": 3.1598457888493474, "grad_norm": 1.0078125, "learning_rate": 0.00040194993234567107, "loss": 4.9158, "mean_token_accuracy": 0.22295881509780885, "num_tokens": 73217665.0, "step": 31965 }, { "entropy": 5.413907527923584, "epoch": 3.160340055357849, "grad_norm": 1.015625, "learning_rate": 0.00040192079455708083, "loss": 4.9342, "mean_token_accuracy": 0.21799944043159486, "num_tokens": 73229677.0, "step": 31970 }, { "entropy": 5.442161321640015, "epoch": 3.1608343218663504, "grad_norm": 1.0859375, "learning_rate": 0.00040189165364621943, "loss": 4.9647, "mean_token_accuracy": 0.21902752071619033, "num_tokens": 73240806.0, "step": 31975 }, { "entropy": 5.363771724700928, "epoch": 3.1613285883748516, "grad_norm": 0.99609375, "learning_rate": 0.0004018625096138036, "loss": 4.8617, "mean_token_accuracy": 0.2169555678963661, "num_tokens": 73252016.0, "step": 31980 }, { "entropy": 5.392846345901489, "epoch": 3.161822854883353, "grad_norm": 0.984375, "learning_rate": 0.00040183336246055033, "loss": 4.8977, "mean_token_accuracy": 0.21520236283540725, "num_tokens": 73262790.0, "step": 31985 }, { "entropy": 5.413765335083008, "epoch": 3.1623171213918546, "grad_norm": 0.984375, "learning_rate": 0.0004018042121871767, "loss": 5.0099, "mean_token_accuracy": 0.21065073162317277, "num_tokens": 73275424.0, "step": 31990 }, { "entropy": 5.3123939037323, "epoch": 3.162811387900356, "grad_norm": 1.1328125, "learning_rate": 0.00040177505879439984, "loss": 4.901, "mean_token_accuracy": 0.22359256446361542, "num_tokens": 73286790.0, "step": 31995 }, { "entropy": 5.453336715698242, "epoch": 3.163305654408857, "grad_norm": 0.98828125, "learning_rate": 0.0004017459022829368, "loss": 5.0565, "mean_token_accuracy": 0.20937722325325012, "num_tokens": 73298876.0, "step": 32000 }, { "entropy": 5.389720010757446, "epoch": 3.163799920917359, "grad_norm": 0.9453125, "learning_rate": 0.00040171674265350487, "loss": 4.9266, "mean_token_accuracy": 0.21936736404895782, "num_tokens": 73310635.0, "step": 32005 }, { "entropy": 5.450805377960205, "epoch": 3.16429418742586, "grad_norm": 1.03125, "learning_rate": 0.0004016875799068215, "loss": 4.9988, "mean_token_accuracy": 0.21439515948295593, "num_tokens": 73321998.0, "step": 32010 }, { "entropy": 5.359823179244995, "epoch": 3.1647884539343614, "grad_norm": 1.03125, "learning_rate": 0.0004016584140436039, "loss": 4.9091, "mean_token_accuracy": 0.22614518254995347, "num_tokens": 73332979.0, "step": 32015 }, { "entropy": 5.371836948394775, "epoch": 3.1652827204428626, "grad_norm": 0.96484375, "learning_rate": 0.0004016292450645698, "loss": 4.9673, "mean_token_accuracy": 0.21279709041118622, "num_tokens": 73344405.0, "step": 32020 }, { "entropy": 5.407127141952515, "epoch": 3.1657769869513643, "grad_norm": 1.046875, "learning_rate": 0.00040160007297043655, "loss": 4.9479, "mean_token_accuracy": 0.22183094620704652, "num_tokens": 73356291.0, "step": 32025 }, { "entropy": 5.418062734603882, "epoch": 3.1662712534598656, "grad_norm": 0.98828125, "learning_rate": 0.00040157089776192184, "loss": 4.9688, "mean_token_accuracy": 0.2266653746366501, "num_tokens": 73368299.0, "step": 32030 }, { "entropy": 5.404416704177857, "epoch": 3.166765519968367, "grad_norm": 0.984375, "learning_rate": 0.00040154171943974345, "loss": 4.9896, "mean_token_accuracy": 0.2193855032324791, "num_tokens": 73380527.0, "step": 32035 }, { "entropy": 5.370492839813233, "epoch": 3.167259786476868, "grad_norm": 0.96484375, "learning_rate": 0.00040151253800461913, "loss": 4.9496, "mean_token_accuracy": 0.2171730473637581, "num_tokens": 73392547.0, "step": 32040 }, { "entropy": 5.343085718154907, "epoch": 3.16775405298537, "grad_norm": 1.0390625, "learning_rate": 0.0004014833534572667, "loss": 4.8933, "mean_token_accuracy": 0.22689200192689896, "num_tokens": 73404293.0, "step": 32045 }, { "entropy": 5.398412609100342, "epoch": 3.168248319493871, "grad_norm": 1.046875, "learning_rate": 0.0004014541657984043, "loss": 4.848, "mean_token_accuracy": 0.22503772079944612, "num_tokens": 73414581.0, "step": 32050 }, { "entropy": 5.384239530563354, "epoch": 3.1687425860023724, "grad_norm": 1.078125, "learning_rate": 0.00040142497502874963, "loss": 5.0017, "mean_token_accuracy": 0.21043816059827805, "num_tokens": 73426485.0, "step": 32055 }, { "entropy": 5.422813844680786, "epoch": 3.169236852510874, "grad_norm": 1.09375, "learning_rate": 0.00040139578114902104, "loss": 5.0201, "mean_token_accuracy": 0.2133195236325264, "num_tokens": 73438481.0, "step": 32060 }, { "entropy": 5.442287635803223, "epoch": 3.1697311190193753, "grad_norm": 1.03125, "learning_rate": 0.00040136658415993663, "loss": 4.8985, "mean_token_accuracy": 0.21722345054149628, "num_tokens": 73448552.0, "step": 32065 }, { "entropy": 5.359316396713257, "epoch": 3.1702253855278766, "grad_norm": 1.1484375, "learning_rate": 0.0004013373840622146, "loss": 4.905, "mean_token_accuracy": 0.21567890793085098, "num_tokens": 73459354.0, "step": 32070 }, { "entropy": 5.3637388229370115, "epoch": 3.170719652036378, "grad_norm": 1.0625, "learning_rate": 0.00040130818085657333, "loss": 4.9151, "mean_token_accuracy": 0.2169932022690773, "num_tokens": 73470718.0, "step": 32075 }, { "entropy": 5.4414391040802, "epoch": 3.1712139185448796, "grad_norm": 1.0390625, "learning_rate": 0.0004012789745437313, "loss": 5.0483, "mean_token_accuracy": 0.20973199605941772, "num_tokens": 73483133.0, "step": 32080 }, { "entropy": 5.414180326461792, "epoch": 3.171708185053381, "grad_norm": 1.1953125, "learning_rate": 0.0004012497651244068, "loss": 4.9298, "mean_token_accuracy": 0.21286708414554595, "num_tokens": 73494675.0, "step": 32085 }, { "entropy": 5.340225172042847, "epoch": 3.172202451561882, "grad_norm": 1.0390625, "learning_rate": 0.00040122055259931856, "loss": 4.904, "mean_token_accuracy": 0.23085100650787355, "num_tokens": 73505412.0, "step": 32090 }, { "entropy": 5.293953609466553, "epoch": 3.172696718070384, "grad_norm": 1.015625, "learning_rate": 0.00040119133696918515, "loss": 4.811, "mean_token_accuracy": 0.23139822334051133, "num_tokens": 73515835.0, "step": 32095 }, { "entropy": 5.400915431976318, "epoch": 3.173190984578885, "grad_norm": 1.0703125, "learning_rate": 0.0004011621182347252, "loss": 4.9264, "mean_token_accuracy": 0.22256221771240234, "num_tokens": 73526943.0, "step": 32100 }, { "entropy": 5.394599533081054, "epoch": 3.1736852510873863, "grad_norm": 0.96484375, "learning_rate": 0.00040113289639665765, "loss": 4.9203, "mean_token_accuracy": 0.22208186388015747, "num_tokens": 73540076.0, "step": 32105 }, { "entropy": 5.450634717941284, "epoch": 3.1741795175958876, "grad_norm": 0.9375, "learning_rate": 0.00040110367145570125, "loss": 4.988, "mean_token_accuracy": 0.21733183711767196, "num_tokens": 73552265.0, "step": 32110 }, { "entropy": 5.349441719055176, "epoch": 3.1746737841043893, "grad_norm": 1.0859375, "learning_rate": 0.000401074443412575, "loss": 4.9203, "mean_token_accuracy": 0.22119634747505187, "num_tokens": 73562581.0, "step": 32115 }, { "entropy": 5.4000505924224855, "epoch": 3.1751680506128905, "grad_norm": 1.1953125, "learning_rate": 0.00040104521226799777, "loss": 4.915, "mean_token_accuracy": 0.2272097185254097, "num_tokens": 73573478.0, "step": 32120 }, { "entropy": 5.436168813705445, "epoch": 3.175662317121392, "grad_norm": 1.0078125, "learning_rate": 0.00040101597802268883, "loss": 4.9395, "mean_token_accuracy": 0.219424007833004, "num_tokens": 73584639.0, "step": 32125 }, { "entropy": 5.367035675048828, "epoch": 3.176156583629893, "grad_norm": 1.015625, "learning_rate": 0.0004009867406773673, "loss": 4.9673, "mean_token_accuracy": 0.2182232677936554, "num_tokens": 73596084.0, "step": 32130 }, { "entropy": 5.40050368309021, "epoch": 3.1766508501383948, "grad_norm": 1.0234375, "learning_rate": 0.00040095750023275243, "loss": 4.9402, "mean_token_accuracy": 0.22098592668771744, "num_tokens": 73606551.0, "step": 32135 }, { "entropy": 5.395291757583618, "epoch": 3.177145116646896, "grad_norm": 1.0546875, "learning_rate": 0.0004009282566895635, "loss": 4.8628, "mean_token_accuracy": 0.22460100799798965, "num_tokens": 73616134.0, "step": 32140 }, { "entropy": 5.320925998687744, "epoch": 3.1776393831553973, "grad_norm": 1.0078125, "learning_rate": 0.0004008990100485199, "loss": 4.8145, "mean_token_accuracy": 0.23015804439783097, "num_tokens": 73626813.0, "step": 32145 }, { "entropy": 5.330163621902466, "epoch": 3.1781336496638986, "grad_norm": 1.0078125, "learning_rate": 0.00040086976031034104, "loss": 4.9287, "mean_token_accuracy": 0.223099085688591, "num_tokens": 73638205.0, "step": 32150 }, { "entropy": 5.5047728538513185, "epoch": 3.1786279161724003, "grad_norm": 0.9375, "learning_rate": 0.00040084050747574666, "loss": 5.0448, "mean_token_accuracy": 0.20947058796882628, "num_tokens": 73652276.0, "step": 32155 }, { "entropy": 5.452353239059448, "epoch": 3.1791221826809015, "grad_norm": 0.9609375, "learning_rate": 0.0004008112515454562, "loss": 5.0694, "mean_token_accuracy": 0.21353176534175872, "num_tokens": 73665516.0, "step": 32160 }, { "entropy": 5.3728560447692875, "epoch": 3.179616449189403, "grad_norm": 1.0703125, "learning_rate": 0.0004007819925201895, "loss": 4.8885, "mean_token_accuracy": 0.23020555675029755, "num_tokens": 73675783.0, "step": 32165 }, { "entropy": 5.436239004135132, "epoch": 3.1801107156979045, "grad_norm": 0.99609375, "learning_rate": 0.0004007527304006663, "loss": 4.9953, "mean_token_accuracy": 0.2108194947242737, "num_tokens": 73687853.0, "step": 32170 }, { "entropy": 5.372262048721313, "epoch": 3.1806049822064058, "grad_norm": 1.0, "learning_rate": 0.00040072346518760634, "loss": 4.8765, "mean_token_accuracy": 0.22489214688539505, "num_tokens": 73699189.0, "step": 32175 }, { "entropy": 5.449042654037475, "epoch": 3.181099248714907, "grad_norm": 0.890625, "learning_rate": 0.00040069419688172967, "loss": 5.0609, "mean_token_accuracy": 0.21041840463876724, "num_tokens": 73711003.0, "step": 32180 }, { "entropy": 5.454993152618409, "epoch": 3.1815935152234083, "grad_norm": 1.015625, "learning_rate": 0.00040066492548375627, "loss": 5.0211, "mean_token_accuracy": 0.21032641977071762, "num_tokens": 73723311.0, "step": 32185 }, { "entropy": 5.454977083206177, "epoch": 3.18208778173191, "grad_norm": 1.078125, "learning_rate": 0.00040063565099440616, "loss": 4.9962, "mean_token_accuracy": 0.2210969015955925, "num_tokens": 73734155.0, "step": 32190 }, { "entropy": 5.323065567016601, "epoch": 3.1825820482404112, "grad_norm": 0.97265625, "learning_rate": 0.0004006063734143996, "loss": 4.8956, "mean_token_accuracy": 0.22565834522247313, "num_tokens": 73745289.0, "step": 32195 }, { "entropy": 5.347533941268921, "epoch": 3.1830763147489125, "grad_norm": 1.1015625, "learning_rate": 0.0004005770927444567, "loss": 4.9211, "mean_token_accuracy": 0.21814856231212615, "num_tokens": 73756955.0, "step": 32200 }, { "entropy": 5.418862056732178, "epoch": 3.183570581257414, "grad_norm": 1.03125, "learning_rate": 0.0004005478089852979, "loss": 4.9057, "mean_token_accuracy": 0.21892037540674208, "num_tokens": 73768676.0, "step": 32205 }, { "entropy": 5.334467363357544, "epoch": 3.1840648477659155, "grad_norm": 1.078125, "learning_rate": 0.0004005185221376435, "loss": 4.9082, "mean_token_accuracy": 0.22764068096876144, "num_tokens": 73779505.0, "step": 32210 }, { "entropy": 5.388941049575806, "epoch": 3.1845591142744167, "grad_norm": 1.0078125, "learning_rate": 0.00040048923220221397, "loss": 4.9573, "mean_token_accuracy": 0.21513389497995378, "num_tokens": 73790785.0, "step": 32215 }, { "entropy": 5.396496391296386, "epoch": 3.185053380782918, "grad_norm": 1.1171875, "learning_rate": 0.00040045993917972985, "loss": 4.9242, "mean_token_accuracy": 0.21771674305200578, "num_tokens": 73802689.0, "step": 32220 }, { "entropy": 5.331830883026123, "epoch": 3.1855476472914197, "grad_norm": 0.98046875, "learning_rate": 0.0004004306430709118, "loss": 4.9076, "mean_token_accuracy": 0.22164315730333328, "num_tokens": 73815029.0, "step": 32225 }, { "entropy": 5.4280784130096436, "epoch": 3.186041913799921, "grad_norm": 1.0625, "learning_rate": 0.00040040134387648045, "loss": 4.9463, "mean_token_accuracy": 0.22016408592462539, "num_tokens": 73825509.0, "step": 32230 }, { "entropy": 5.410914611816406, "epoch": 3.1865361803084222, "grad_norm": 1.0390625, "learning_rate": 0.0004003720415971566, "loss": 4.967, "mean_token_accuracy": 0.21901264935731887, "num_tokens": 73836014.0, "step": 32235 }, { "entropy": 5.306758117675781, "epoch": 3.1870304468169235, "grad_norm": 1.03125, "learning_rate": 0.0004003427362336611, "loss": 4.8711, "mean_token_accuracy": 0.2245720788836479, "num_tokens": 73847044.0, "step": 32240 }, { "entropy": 5.38459849357605, "epoch": 3.187524713325425, "grad_norm": 0.96875, "learning_rate": 0.00040031342778671476, "loss": 4.9229, "mean_token_accuracy": 0.2230529084801674, "num_tokens": 73859748.0, "step": 32245 }, { "entropy": 5.366387891769409, "epoch": 3.1880189798339265, "grad_norm": 1.0, "learning_rate": 0.0004002841162570387, "loss": 4.8874, "mean_token_accuracy": 0.22334673702716829, "num_tokens": 73870450.0, "step": 32250 }, { "entropy": 5.41474723815918, "epoch": 3.1885132463424277, "grad_norm": 1.046875, "learning_rate": 0.00040025480164535405, "loss": 5.0072, "mean_token_accuracy": 0.21244468092918395, "num_tokens": 73882533.0, "step": 32255 }, { "entropy": 5.441440057754517, "epoch": 3.1890075128509294, "grad_norm": 1.0546875, "learning_rate": 0.00040022548395238173, "loss": 4.954, "mean_token_accuracy": 0.22020991295576095, "num_tokens": 73894247.0, "step": 32260 }, { "entropy": 5.396122217178345, "epoch": 3.1895017793594307, "grad_norm": 0.98046875, "learning_rate": 0.0004001961631788431, "loss": 4.9165, "mean_token_accuracy": 0.22600238621234894, "num_tokens": 73905246.0, "step": 32265 }, { "entropy": 5.332942390441895, "epoch": 3.189996045867932, "grad_norm": 1.0625, "learning_rate": 0.00040016683932545937, "loss": 4.8861, "mean_token_accuracy": 0.22444458305835724, "num_tokens": 73915906.0, "step": 32270 }, { "entropy": 5.390687894821167, "epoch": 3.190490312376433, "grad_norm": 1.09375, "learning_rate": 0.000400137512392952, "loss": 4.9243, "mean_token_accuracy": 0.21948201805353165, "num_tokens": 73928629.0, "step": 32275 }, { "entropy": 5.47108039855957, "epoch": 3.190984578884935, "grad_norm": 1.0390625, "learning_rate": 0.00040010818238204256, "loss": 4.9977, "mean_token_accuracy": 0.21575254052877427, "num_tokens": 73940474.0, "step": 32280 }, { "entropy": 5.367278003692627, "epoch": 3.191478845393436, "grad_norm": 0.98046875, "learning_rate": 0.00040007884929345224, "loss": 4.8889, "mean_token_accuracy": 0.2212388977408409, "num_tokens": 73951636.0, "step": 32285 }, { "entropy": 5.319686937332153, "epoch": 3.1919731119019374, "grad_norm": 1.046875, "learning_rate": 0.0004000495131279029, "loss": 4.868, "mean_token_accuracy": 0.227410988509655, "num_tokens": 73963253.0, "step": 32290 }, { "entropy": 5.337161350250244, "epoch": 3.1924673784104387, "grad_norm": 1.21875, "learning_rate": 0.0004000201738861162, "loss": 4.8528, "mean_token_accuracy": 0.22322608530521393, "num_tokens": 73974215.0, "step": 32295 }, { "entropy": 5.420774650573731, "epoch": 3.1929616449189404, "grad_norm": 0.9609375, "learning_rate": 0.0003999908315688137, "loss": 4.9595, "mean_token_accuracy": 0.22171608954668046, "num_tokens": 73986127.0, "step": 32300 }, { "entropy": 5.454508829116821, "epoch": 3.1934559114274417, "grad_norm": 1.09375, "learning_rate": 0.00039996148617671743, "loss": 4.941, "mean_token_accuracy": 0.22343740016222, "num_tokens": 73996998.0, "step": 32305 }, { "entropy": 5.366781949996948, "epoch": 3.193950177935943, "grad_norm": 1.0703125, "learning_rate": 0.0003999321377105492, "loss": 4.9136, "mean_token_accuracy": 0.2248337149620056, "num_tokens": 74009432.0, "step": 32310 }, { "entropy": 5.3012172222137455, "epoch": 3.1944444444444446, "grad_norm": 0.98828125, "learning_rate": 0.000399902786171031, "loss": 4.921, "mean_token_accuracy": 0.21944795846939086, "num_tokens": 74021242.0, "step": 32315 }, { "entropy": 5.4300682067871096, "epoch": 3.194938710952946, "grad_norm": 0.92578125, "learning_rate": 0.00039987343155888484, "loss": 4.942, "mean_token_accuracy": 0.20683617442846297, "num_tokens": 74032865.0, "step": 32320 }, { "entropy": 5.389030694961548, "epoch": 3.195432977461447, "grad_norm": 0.95703125, "learning_rate": 0.000399844073874833, "loss": 4.8883, "mean_token_accuracy": 0.2226030319929123, "num_tokens": 74044505.0, "step": 32325 }, { "entropy": 5.3718267440795895, "epoch": 3.1959272439699484, "grad_norm": 1.0390625, "learning_rate": 0.00039981471311959746, "loss": 4.9364, "mean_token_accuracy": 0.21708377301692963, "num_tokens": 74056551.0, "step": 32330 }, { "entropy": 5.390479278564453, "epoch": 3.19642151047845, "grad_norm": 1.0, "learning_rate": 0.00039978534929390066, "loss": 4.8975, "mean_token_accuracy": 0.22459932863712312, "num_tokens": 74066746.0, "step": 32335 }, { "entropy": 5.392752027511596, "epoch": 3.1969157769869514, "grad_norm": 0.9921875, "learning_rate": 0.00039975598239846494, "loss": 4.9516, "mean_token_accuracy": 0.21600686758756638, "num_tokens": 74078493.0, "step": 32340 }, { "entropy": 5.3416375637054445, "epoch": 3.1974100434954527, "grad_norm": 1.0546875, "learning_rate": 0.00039972661243401267, "loss": 4.853, "mean_token_accuracy": 0.22139085233211517, "num_tokens": 74089484.0, "step": 32345 }, { "entropy": 5.442918491363526, "epoch": 3.1979043100039544, "grad_norm": 1.046875, "learning_rate": 0.0003996972394012664, "loss": 4.9454, "mean_token_accuracy": 0.219377800822258, "num_tokens": 74101038.0, "step": 32350 }, { "entropy": 5.473010778427124, "epoch": 3.1983985765124556, "grad_norm": 1.0078125, "learning_rate": 0.0003996678633009486, "loss": 5.023, "mean_token_accuracy": 0.21315684765577317, "num_tokens": 74112708.0, "step": 32355 }, { "entropy": 5.396411323547364, "epoch": 3.198892843020957, "grad_norm": 1.0703125, "learning_rate": 0.0003996384841337822, "loss": 4.9571, "mean_token_accuracy": 0.21799690872430802, "num_tokens": 74123899.0, "step": 32360 }, { "entropy": 5.357379388809204, "epoch": 3.199387109529458, "grad_norm": 0.94140625, "learning_rate": 0.0003996091019004896, "loss": 4.9318, "mean_token_accuracy": 0.21749658286571502, "num_tokens": 74136025.0, "step": 32365 }, { "entropy": 5.470479440689087, "epoch": 3.19988137603796, "grad_norm": 1.0078125, "learning_rate": 0.0003995797166017938, "loss": 5.0779, "mean_token_accuracy": 0.21105027943849564, "num_tokens": 74149140.0, "step": 32370 }, { "entropy": 5.478125476837159, "epoch": 3.200375642546461, "grad_norm": 1.078125, "learning_rate": 0.00039955032823841766, "loss": 4.9423, "mean_token_accuracy": 0.2196016415953636, "num_tokens": 74160849.0, "step": 32375 }, { "entropy": 5.428229331970215, "epoch": 3.2008699090549624, "grad_norm": 1.03125, "learning_rate": 0.00039952093681108416, "loss": 4.9609, "mean_token_accuracy": 0.2232427030801773, "num_tokens": 74171678.0, "step": 32380 }, { "entropy": 5.328751564025879, "epoch": 3.2013641755634636, "grad_norm": 1.078125, "learning_rate": 0.0003994915423205162, "loss": 4.8935, "mean_token_accuracy": 0.2230215400457382, "num_tokens": 74183000.0, "step": 32385 }, { "entropy": 5.468348550796509, "epoch": 3.2018584420719653, "grad_norm": 0.9765625, "learning_rate": 0.0003994621447674371, "loss": 5.0012, "mean_token_accuracy": 0.21578442454338073, "num_tokens": 74195495.0, "step": 32390 }, { "entropy": 5.429653835296631, "epoch": 3.2023527085804666, "grad_norm": 1.125, "learning_rate": 0.0003994327441525699, "loss": 4.9702, "mean_token_accuracy": 0.21309554427862168, "num_tokens": 74206023.0, "step": 32395 }, { "entropy": 5.399688339233398, "epoch": 3.202846975088968, "grad_norm": 1.0390625, "learning_rate": 0.0003994033404766378, "loss": 4.9696, "mean_token_accuracy": 0.21778280884027482, "num_tokens": 74217943.0, "step": 32400 }, { "entropy": 5.422229480743408, "epoch": 3.203341241597469, "grad_norm": 1.0859375, "learning_rate": 0.0003993739337403643, "loss": 4.9939, "mean_token_accuracy": 0.2150809422135353, "num_tokens": 74228142.0, "step": 32405 }, { "entropy": 5.455906915664673, "epoch": 3.203835508105971, "grad_norm": 1.1484375, "learning_rate": 0.0003993445239444728, "loss": 4.9907, "mean_token_accuracy": 0.22167946100234986, "num_tokens": 74239692.0, "step": 32410 }, { "entropy": 5.426267433166504, "epoch": 3.204329774614472, "grad_norm": 0.96875, "learning_rate": 0.0003993151110896866, "loss": 4.9575, "mean_token_accuracy": 0.22039847671985627, "num_tokens": 74251010.0, "step": 32415 }, { "entropy": 5.314350891113281, "epoch": 3.2048240411229734, "grad_norm": 0.94921875, "learning_rate": 0.0003992856951767294, "loss": 4.8286, "mean_token_accuracy": 0.22832494527101516, "num_tokens": 74262579.0, "step": 32420 }, { "entropy": 5.395722723007202, "epoch": 3.205318307631475, "grad_norm": 1.1015625, "learning_rate": 0.00039925627620632486, "loss": 4.8619, "mean_token_accuracy": 0.22499454468488694, "num_tokens": 74272833.0, "step": 32425 }, { "entropy": 5.410754442214966, "epoch": 3.2058125741399763, "grad_norm": 0.99609375, "learning_rate": 0.0003992268541791967, "loss": 4.9854, "mean_token_accuracy": 0.21471409350633622, "num_tokens": 74284565.0, "step": 32430 }, { "entropy": 5.285041999816895, "epoch": 3.2063068406484776, "grad_norm": 1.046875, "learning_rate": 0.0003991974290960685, "loss": 4.8126, "mean_token_accuracy": 0.24158210903406144, "num_tokens": 74295473.0, "step": 32435 }, { "entropy": 5.42221155166626, "epoch": 3.206801107156979, "grad_norm": 1.125, "learning_rate": 0.00039916800095766443, "loss": 5.0117, "mean_token_accuracy": 0.20981270521879197, "num_tokens": 74305688.0, "step": 32440 }, { "entropy": 5.348579406738281, "epoch": 3.2072953736654806, "grad_norm": 0.93359375, "learning_rate": 0.00039913856976470823, "loss": 4.8916, "mean_token_accuracy": 0.22253837883472444, "num_tokens": 74318268.0, "step": 32445 }, { "entropy": 5.452938032150269, "epoch": 3.207789640173982, "grad_norm": 1.0234375, "learning_rate": 0.0003991091355179239, "loss": 5.01, "mean_token_accuracy": 0.20986150950193405, "num_tokens": 74330310.0, "step": 32450 }, { "entropy": 5.404800891876221, "epoch": 3.208283906682483, "grad_norm": 1.0078125, "learning_rate": 0.0003990796982180356, "loss": 4.9708, "mean_token_accuracy": 0.21881929636001587, "num_tokens": 74342040.0, "step": 32455 }, { "entropy": 5.476469278335571, "epoch": 3.208778173190985, "grad_norm": 1.03125, "learning_rate": 0.00039905025786576755, "loss": 5.0246, "mean_token_accuracy": 0.2059953436255455, "num_tokens": 74354502.0, "step": 32460 }, { "entropy": 5.45098910331726, "epoch": 3.209272439699486, "grad_norm": 1.1328125, "learning_rate": 0.0003990208144618438, "loss": 4.9305, "mean_token_accuracy": 0.21893686503171922, "num_tokens": 74366100.0, "step": 32465 }, { "entropy": 5.459633684158325, "epoch": 3.2097667062079873, "grad_norm": 1.0859375, "learning_rate": 0.00039899136800698883, "loss": 5.031, "mean_token_accuracy": 0.20270186960697173, "num_tokens": 74377627.0, "step": 32470 }, { "entropy": 5.34204134941101, "epoch": 3.2102609727164886, "grad_norm": 1.0, "learning_rate": 0.000398961918501927, "loss": 4.9088, "mean_token_accuracy": 0.22563174664974212, "num_tokens": 74389689.0, "step": 32475 }, { "entropy": 5.463394498825073, "epoch": 3.2107552392249903, "grad_norm": 1.09375, "learning_rate": 0.0003989324659473827, "loss": 5.0459, "mean_token_accuracy": 0.20966026335954666, "num_tokens": 74399902.0, "step": 32480 }, { "entropy": 5.4572875022888185, "epoch": 3.2112495057334915, "grad_norm": 0.96875, "learning_rate": 0.00039890301034408056, "loss": 4.9974, "mean_token_accuracy": 0.21277348548173905, "num_tokens": 74410935.0, "step": 32485 }, { "entropy": 5.4490913391113285, "epoch": 3.211743772241993, "grad_norm": 0.9609375, "learning_rate": 0.0003988735516927451, "loss": 4.9105, "mean_token_accuracy": 0.22563932538032533, "num_tokens": 74421850.0, "step": 32490 }, { "entropy": 5.371338653564453, "epoch": 3.212238038750494, "grad_norm": 0.97265625, "learning_rate": 0.00039884408999410107, "loss": 4.9024, "mean_token_accuracy": 0.2234208583831787, "num_tokens": 74434104.0, "step": 32495 }, { "entropy": 5.412356615066528, "epoch": 3.212732305258996, "grad_norm": 0.953125, "learning_rate": 0.0003988146252488732, "loss": 5.0078, "mean_token_accuracy": 0.2166041389107704, "num_tokens": 74446738.0, "step": 32500 }, { "entropy": 5.535458421707153, "epoch": 3.213226571767497, "grad_norm": 0.96875, "learning_rate": 0.0003987851574577863, "loss": 5.0898, "mean_token_accuracy": 0.2095863252878189, "num_tokens": 74458202.0, "step": 32505 }, { "entropy": 5.472123146057129, "epoch": 3.2137208382759983, "grad_norm": 1.0234375, "learning_rate": 0.0003987556866215654, "loss": 4.9999, "mean_token_accuracy": 0.21904619336128234, "num_tokens": 74470349.0, "step": 32510 }, { "entropy": 5.346045398712159, "epoch": 3.2142151047845, "grad_norm": 0.953125, "learning_rate": 0.0003987262127409354, "loss": 4.8714, "mean_token_accuracy": 0.2259410172700882, "num_tokens": 74482569.0, "step": 32515 }, { "entropy": 5.37182207107544, "epoch": 3.2147093712930013, "grad_norm": 0.953125, "learning_rate": 0.0003986967358166213, "loss": 4.9002, "mean_token_accuracy": 0.21836068332195283, "num_tokens": 74495425.0, "step": 32520 }, { "entropy": 5.460014390945434, "epoch": 3.2152036378015025, "grad_norm": 1.015625, "learning_rate": 0.00039866725584934834, "loss": 4.9953, "mean_token_accuracy": 0.21120498180389405, "num_tokens": 74506429.0, "step": 32525 }, { "entropy": 5.443718290328979, "epoch": 3.215697904310004, "grad_norm": 1.0703125, "learning_rate": 0.00039863777283984174, "loss": 4.9768, "mean_token_accuracy": 0.21571776419878005, "num_tokens": 74517426.0, "step": 32530 }, { "entropy": 5.446964931488037, "epoch": 3.2161921708185055, "grad_norm": 1.1640625, "learning_rate": 0.00039860828678882674, "loss": 4.9676, "mean_token_accuracy": 0.21266179233789445, "num_tokens": 74528777.0, "step": 32535 }, { "entropy": 5.404529190063476, "epoch": 3.2166864373270068, "grad_norm": 0.97265625, "learning_rate": 0.0003985787976970287, "loss": 4.917, "mean_token_accuracy": 0.21307890564203263, "num_tokens": 74540384.0, "step": 32540 }, { "entropy": 5.373161125183105, "epoch": 3.217180703835508, "grad_norm": 1.0078125, "learning_rate": 0.000398549305565173, "loss": 4.87, "mean_token_accuracy": 0.22038756757974626, "num_tokens": 74551698.0, "step": 32545 }, { "entropy": 5.376799631118774, "epoch": 3.2176749703440093, "grad_norm": 1.0703125, "learning_rate": 0.00039851981039398527, "loss": 4.9433, "mean_token_accuracy": 0.2257494166493416, "num_tokens": 74563467.0, "step": 32550 }, { "entropy": 5.310831785202026, "epoch": 3.218169236852511, "grad_norm": 0.90234375, "learning_rate": 0.00039849031218419114, "loss": 4.8745, "mean_token_accuracy": 0.22689485996961595, "num_tokens": 74575341.0, "step": 32555 }, { "entropy": 5.330077981948852, "epoch": 3.2186635033610123, "grad_norm": 1.0, "learning_rate": 0.000398460810936516, "loss": 4.813, "mean_token_accuracy": 0.22998543530702592, "num_tokens": 74587706.0, "step": 32560 }, { "entropy": 5.400575828552246, "epoch": 3.2191577698695135, "grad_norm": 0.98828125, "learning_rate": 0.00039843130665168585, "loss": 4.9246, "mean_token_accuracy": 0.22073059231042863, "num_tokens": 74599310.0, "step": 32565 }, { "entropy": 5.449219751358032, "epoch": 3.2196520363780152, "grad_norm": 0.9453125, "learning_rate": 0.00039840179933042644, "loss": 5.0508, "mean_token_accuracy": 0.2097255527973175, "num_tokens": 74610436.0, "step": 32570 }, { "entropy": 5.47999792098999, "epoch": 3.2201463028865165, "grad_norm": 0.984375, "learning_rate": 0.00039837228897346357, "loss": 4.9256, "mean_token_accuracy": 0.21416904032230377, "num_tokens": 74621788.0, "step": 32575 }, { "entropy": 5.426194286346435, "epoch": 3.2206405693950177, "grad_norm": 1.0, "learning_rate": 0.00039834277558152326, "loss": 4.9523, "mean_token_accuracy": 0.22077723741531372, "num_tokens": 74633345.0, "step": 32580 }, { "entropy": 5.388727617263794, "epoch": 3.221134835903519, "grad_norm": 0.9921875, "learning_rate": 0.0003983132591553315, "loss": 4.9749, "mean_token_accuracy": 0.21887448132038118, "num_tokens": 74646217.0, "step": 32585 }, { "entropy": 5.378500890731812, "epoch": 3.2216291024120207, "grad_norm": 0.9921875, "learning_rate": 0.0003982837396956145, "loss": 4.943, "mean_token_accuracy": 0.22191304862499237, "num_tokens": 74657935.0, "step": 32590 }, { "entropy": 5.377217435836792, "epoch": 3.222123368920522, "grad_norm": 1.046875, "learning_rate": 0.00039825421720309835, "loss": 4.9778, "mean_token_accuracy": 0.21892588287591935, "num_tokens": 74668547.0, "step": 32595 }, { "entropy": 5.491641187667847, "epoch": 3.2226176354290232, "grad_norm": 1.140625, "learning_rate": 0.0003982246916785093, "loss": 5.0227, "mean_token_accuracy": 0.20635757893323897, "num_tokens": 74680013.0, "step": 32600 }, { "entropy": 5.432769536972046, "epoch": 3.223111901937525, "grad_norm": 1.09375, "learning_rate": 0.0003981951631225738, "loss": 4.9012, "mean_token_accuracy": 0.22637124061584474, "num_tokens": 74689927.0, "step": 32605 }, { "entropy": 5.396711826324463, "epoch": 3.223606168446026, "grad_norm": 1.0703125, "learning_rate": 0.0003981656315360181, "loss": 4.9684, "mean_token_accuracy": 0.21589536666870118, "num_tokens": 74701854.0, "step": 32610 }, { "entropy": 5.356378984451294, "epoch": 3.2241004349545275, "grad_norm": 1.078125, "learning_rate": 0.00039813609691956883, "loss": 4.9306, "mean_token_accuracy": 0.220461343228817, "num_tokens": 74713974.0, "step": 32615 }, { "entropy": 5.456284427642823, "epoch": 3.2245947014630287, "grad_norm": 1.0546875, "learning_rate": 0.0003981065592739524, "loss": 5.0203, "mean_token_accuracy": 0.21066245436668396, "num_tokens": 74725367.0, "step": 32620 }, { "entropy": 5.452782535552979, "epoch": 3.2250889679715304, "grad_norm": 1.03125, "learning_rate": 0.00039807701859989554, "loss": 4.9356, "mean_token_accuracy": 0.2184978798031807, "num_tokens": 74736801.0, "step": 32625 }, { "entropy": 5.364739561080933, "epoch": 3.2255832344800317, "grad_norm": 1.0390625, "learning_rate": 0.00039804747489812495, "loss": 4.929, "mean_token_accuracy": 0.2210173040628433, "num_tokens": 74747949.0, "step": 32630 }, { "entropy": 5.343549156188965, "epoch": 3.226077500988533, "grad_norm": 1.1484375, "learning_rate": 0.0003980179281693674, "loss": 4.9228, "mean_token_accuracy": 0.2271590694785118, "num_tokens": 74759985.0, "step": 32635 }, { "entropy": 5.386345243453979, "epoch": 3.2265717674970342, "grad_norm": 0.99609375, "learning_rate": 0.00039798837841434966, "loss": 4.9059, "mean_token_accuracy": 0.21878810673952104, "num_tokens": 74770981.0, "step": 32640 }, { "entropy": 5.3279430866241455, "epoch": 3.227066034005536, "grad_norm": 0.95703125, "learning_rate": 0.00039795882563379876, "loss": 4.8664, "mean_token_accuracy": 0.23160792589187623, "num_tokens": 74783120.0, "step": 32645 }, { "entropy": 5.31374454498291, "epoch": 3.227560300514037, "grad_norm": 1.0625, "learning_rate": 0.0003979292698284417, "loss": 4.8478, "mean_token_accuracy": 0.22931768149137496, "num_tokens": 74793492.0, "step": 32650 }, { "entropy": 5.319516801834107, "epoch": 3.2280545670225385, "grad_norm": 1.0390625, "learning_rate": 0.00039789971099900545, "loss": 4.9108, "mean_token_accuracy": 0.22170383483171463, "num_tokens": 74805333.0, "step": 32655 }, { "entropy": 5.377570867538452, "epoch": 3.2285488335310397, "grad_norm": 1.0703125, "learning_rate": 0.0003978701491462174, "loss": 4.8781, "mean_token_accuracy": 0.22457063049077988, "num_tokens": 74816269.0, "step": 32660 }, { "entropy": 5.40594072341919, "epoch": 3.2290431000395414, "grad_norm": 1.0546875, "learning_rate": 0.0003978405842708045, "loss": 4.8964, "mean_token_accuracy": 0.226781465113163, "num_tokens": 74826901.0, "step": 32665 }, { "entropy": 5.355334234237671, "epoch": 3.2295373665480427, "grad_norm": 1.0390625, "learning_rate": 0.00039781101637349417, "loss": 4.9403, "mean_token_accuracy": 0.22345403879880904, "num_tokens": 74837373.0, "step": 32670 }, { "entropy": 5.40598201751709, "epoch": 3.230031633056544, "grad_norm": 1.015625, "learning_rate": 0.00039778144545501374, "loss": 4.9128, "mean_token_accuracy": 0.21659032851457596, "num_tokens": 74848609.0, "step": 32675 }, { "entropy": 5.3725837707519535, "epoch": 3.2305258995650457, "grad_norm": 1.0546875, "learning_rate": 0.0003977518715160908, "loss": 4.9401, "mean_token_accuracy": 0.21664578169584275, "num_tokens": 74859953.0, "step": 32680 }, { "entropy": 5.406901454925537, "epoch": 3.231020166073547, "grad_norm": 1.203125, "learning_rate": 0.00039772229455745285, "loss": 4.9444, "mean_token_accuracy": 0.21986195743083953, "num_tokens": 74872173.0, "step": 32685 }, { "entropy": 5.391617774963379, "epoch": 3.231514432582048, "grad_norm": 0.96875, "learning_rate": 0.00039769271457982733, "loss": 4.8884, "mean_token_accuracy": 0.22647606134414672, "num_tokens": 74884060.0, "step": 32690 }, { "entropy": 5.391271114349365, "epoch": 3.2320086990905494, "grad_norm": 1.046875, "learning_rate": 0.0003976631315839419, "loss": 4.9213, "mean_token_accuracy": 0.22046476751565933, "num_tokens": 74895660.0, "step": 32695 }, { "entropy": 5.394249391555786, "epoch": 3.232502965599051, "grad_norm": 1.0234375, "learning_rate": 0.0003976335455705245, "loss": 4.9339, "mean_token_accuracy": 0.2172132357954979, "num_tokens": 74907228.0, "step": 32700 }, { "entropy": 5.368260860443115, "epoch": 3.2329972321075524, "grad_norm": 1.09375, "learning_rate": 0.0003976039565403029, "loss": 4.9667, "mean_token_accuracy": 0.21886109411716462, "num_tokens": 74919062.0, "step": 32705 }, { "entropy": 5.354167509078979, "epoch": 3.2334914986160537, "grad_norm": 1.109375, "learning_rate": 0.00039757436449400484, "loss": 4.887, "mean_token_accuracy": 0.22820591777563096, "num_tokens": 74930551.0, "step": 32710 }, { "entropy": 5.388807725906372, "epoch": 3.2339857651245554, "grad_norm": 1.03125, "learning_rate": 0.0003975447694323585, "loss": 4.8764, "mean_token_accuracy": 0.22623901218175888, "num_tokens": 74941219.0, "step": 32715 }, { "entropy": 5.4520079612731935, "epoch": 3.2344800316330566, "grad_norm": 1.1484375, "learning_rate": 0.0003975151713560918, "loss": 4.9636, "mean_token_accuracy": 0.21810445487499236, "num_tokens": 74951857.0, "step": 32720 }, { "entropy": 5.327975082397461, "epoch": 3.234974298141558, "grad_norm": 0.9140625, "learning_rate": 0.0003974855702659328, "loss": 4.7741, "mean_token_accuracy": 0.22978077381849288, "num_tokens": 74963807.0, "step": 32725 }, { "entropy": 5.303542423248291, "epoch": 3.235468564650059, "grad_norm": 1.0625, "learning_rate": 0.00039745596616260983, "loss": 4.8858, "mean_token_accuracy": 0.22933170795440674, "num_tokens": 74975646.0, "step": 32730 }, { "entropy": 5.387570381164551, "epoch": 3.235962831158561, "grad_norm": 1.1796875, "learning_rate": 0.0003974263590468511, "loss": 4.9939, "mean_token_accuracy": 0.2190198227763176, "num_tokens": 74987197.0, "step": 32735 }, { "entropy": 5.375151300430298, "epoch": 3.236457097667062, "grad_norm": 1.015625, "learning_rate": 0.0003973967489193849, "loss": 4.934, "mean_token_accuracy": 0.22435315549373627, "num_tokens": 74999020.0, "step": 32740 }, { "entropy": 5.415841960906983, "epoch": 3.2369513641755634, "grad_norm": 1.109375, "learning_rate": 0.00039736713578093975, "loss": 4.9683, "mean_token_accuracy": 0.22276031076908112, "num_tokens": 75010889.0, "step": 32745 }, { "entropy": 5.421621036529541, "epoch": 3.2374456306840647, "grad_norm": 1.0, "learning_rate": 0.000397337519632244, "loss": 4.9601, "mean_token_accuracy": 0.21610680222511292, "num_tokens": 75021934.0, "step": 32750 }, { "entropy": 5.303825426101684, "epoch": 3.2379398971925664, "grad_norm": 1.046875, "learning_rate": 0.00039730790047402635, "loss": 4.8692, "mean_token_accuracy": 0.2264394298195839, "num_tokens": 75032337.0, "step": 32755 }, { "entropy": 5.374797630310058, "epoch": 3.2384341637010676, "grad_norm": 1.1171875, "learning_rate": 0.00039727827830701533, "loss": 4.8576, "mean_token_accuracy": 0.22494217455387117, "num_tokens": 75043094.0, "step": 32760 }, { "entropy": 5.332032632827759, "epoch": 3.238928430209569, "grad_norm": 1.125, "learning_rate": 0.00039724865313193976, "loss": 4.8684, "mean_token_accuracy": 0.22277786135673522, "num_tokens": 75055108.0, "step": 32765 }, { "entropy": 5.3155396461486815, "epoch": 3.23942269671807, "grad_norm": 1.0390625, "learning_rate": 0.0003972190249495283, "loss": 4.8991, "mean_token_accuracy": 0.2223450005054474, "num_tokens": 75065388.0, "step": 32770 }, { "entropy": 5.408094120025635, "epoch": 3.239916963226572, "grad_norm": 0.984375, "learning_rate": 0.0003971893937605099, "loss": 4.9246, "mean_token_accuracy": 0.21939627826213837, "num_tokens": 75077390.0, "step": 32775 }, { "entropy": 5.420478439331054, "epoch": 3.240411229735073, "grad_norm": 0.98828125, "learning_rate": 0.00039715975956561343, "loss": 4.9099, "mean_token_accuracy": 0.21839433461427687, "num_tokens": 75088795.0, "step": 32780 }, { "entropy": 5.361070823669434, "epoch": 3.2409054962435744, "grad_norm": 1.0546875, "learning_rate": 0.00039713012236556797, "loss": 4.9693, "mean_token_accuracy": 0.2168997898697853, "num_tokens": 75100336.0, "step": 32785 }, { "entropy": 5.428211641311646, "epoch": 3.241399762752076, "grad_norm": 1.078125, "learning_rate": 0.0003971004821611025, "loss": 4.9762, "mean_token_accuracy": 0.21381666362285615, "num_tokens": 75111639.0, "step": 32790 }, { "entropy": 5.368367099761963, "epoch": 3.2418940292605773, "grad_norm": 1.109375, "learning_rate": 0.00039707083895294625, "loss": 4.8383, "mean_token_accuracy": 0.2314461812376976, "num_tokens": 75122006.0, "step": 32795 }, { "entropy": 5.407904529571534, "epoch": 3.2423882957690786, "grad_norm": 1.0859375, "learning_rate": 0.00039704119274182835, "loss": 4.9763, "mean_token_accuracy": 0.21481959968805314, "num_tokens": 75132406.0, "step": 32800 }, { "entropy": 5.361754369735718, "epoch": 3.24288256227758, "grad_norm": 1.03125, "learning_rate": 0.0003970115435284783, "loss": 4.9176, "mean_token_accuracy": 0.22165888249874116, "num_tokens": 75145444.0, "step": 32805 }, { "entropy": 5.394265174865723, "epoch": 3.2433768287860816, "grad_norm": 1.015625, "learning_rate": 0.00039698189131362526, "loss": 4.8663, "mean_token_accuracy": 0.22916646748781205, "num_tokens": 75156069.0, "step": 32810 }, { "entropy": 5.3999810218811035, "epoch": 3.243871095294583, "grad_norm": 1.03125, "learning_rate": 0.00039695223609799885, "loss": 4.9563, "mean_token_accuracy": 0.21861810535192489, "num_tokens": 75167075.0, "step": 32815 }, { "entropy": 5.324251461029053, "epoch": 3.244365361803084, "grad_norm": 0.98828125, "learning_rate": 0.0003969225778823285, "loss": 4.8574, "mean_token_accuracy": 0.22367113679647446, "num_tokens": 75178464.0, "step": 32820 }, { "entropy": 5.293191242218017, "epoch": 3.244859628311586, "grad_norm": 0.97265625, "learning_rate": 0.0003968929166673438, "loss": 4.7987, "mean_token_accuracy": 0.22804713249206543, "num_tokens": 75189803.0, "step": 32825 }, { "entropy": 5.400164175033569, "epoch": 3.245353894820087, "grad_norm": 1.0, "learning_rate": 0.00039686325245377437, "loss": 4.9826, "mean_token_accuracy": 0.2165562093257904, "num_tokens": 75201207.0, "step": 32830 }, { "entropy": 5.417500782012939, "epoch": 3.2458481613285883, "grad_norm": 0.9765625, "learning_rate": 0.0003968335852423501, "loss": 5.0082, "mean_token_accuracy": 0.21177451759576799, "num_tokens": 75214092.0, "step": 32835 }, { "entropy": 5.390856313705444, "epoch": 3.2463424278370896, "grad_norm": 1.0390625, "learning_rate": 0.0003968039150338007, "loss": 4.8983, "mean_token_accuracy": 0.21975431740283966, "num_tokens": 75226139.0, "step": 32840 }, { "entropy": 5.395218467712402, "epoch": 3.2468366943455913, "grad_norm": 1.0078125, "learning_rate": 0.00039677424182885606, "loss": 4.8732, "mean_token_accuracy": 0.22600615471601487, "num_tokens": 75238273.0, "step": 32845 }, { "entropy": 5.403037071228027, "epoch": 3.2473309608540926, "grad_norm": 0.9921875, "learning_rate": 0.0003967445656282462, "loss": 4.9977, "mean_token_accuracy": 0.21605613827705383, "num_tokens": 75250356.0, "step": 32850 }, { "entropy": 5.399277591705323, "epoch": 3.247825227362594, "grad_norm": 1.1953125, "learning_rate": 0.0003967148864327012, "loss": 4.9335, "mean_token_accuracy": 0.21497711688280105, "num_tokens": 75260329.0, "step": 32855 }, { "entropy": 5.408873128890991, "epoch": 3.248319493871095, "grad_norm": 1.0234375, "learning_rate": 0.0003966852042429511, "loss": 4.9941, "mean_token_accuracy": 0.213995960354805, "num_tokens": 75271405.0, "step": 32860 }, { "entropy": 5.459861183166504, "epoch": 3.248813760379597, "grad_norm": 1.03125, "learning_rate": 0.00039665551905972607, "loss": 5.077, "mean_token_accuracy": 0.20924915373325348, "num_tokens": 75283033.0, "step": 32865 }, { "entropy": 5.442206907272339, "epoch": 3.249308026888098, "grad_norm": 1.0703125, "learning_rate": 0.0003966258308837564, "loss": 4.935, "mean_token_accuracy": 0.21764641851186753, "num_tokens": 75293582.0, "step": 32870 }, { "entropy": 5.385214567184448, "epoch": 3.2498022933965993, "grad_norm": 1.015625, "learning_rate": 0.0003965961397157724, "loss": 4.9321, "mean_token_accuracy": 0.22123805284500123, "num_tokens": 75306500.0, "step": 32875 }, { "entropy": 5.36683874130249, "epoch": 3.250296559905101, "grad_norm": 0.96875, "learning_rate": 0.00039656644555650456, "loss": 4.8915, "mean_token_accuracy": 0.224776192009449, "num_tokens": 75318562.0, "step": 32880 }, { "entropy": 5.389555597305298, "epoch": 3.2507908264136023, "grad_norm": 1.0078125, "learning_rate": 0.00039653674840668326, "loss": 4.9689, "mean_token_accuracy": 0.21936971694231033, "num_tokens": 75330211.0, "step": 32885 }, { "entropy": 5.388100242614746, "epoch": 3.2512850929221035, "grad_norm": 0.9921875, "learning_rate": 0.0003965070482670391, "loss": 4.8617, "mean_token_accuracy": 0.22920366525650024, "num_tokens": 75341244.0, "step": 32890 }, { "entropy": 5.3360130310058596, "epoch": 3.251779359430605, "grad_norm": 0.97265625, "learning_rate": 0.0003964773451383027, "loss": 4.8599, "mean_token_accuracy": 0.22387697398662568, "num_tokens": 75353381.0, "step": 32895 }, { "entropy": 5.351694583892822, "epoch": 3.2522736259391065, "grad_norm": 1.078125, "learning_rate": 0.00039644763902120473, "loss": 4.8789, "mean_token_accuracy": 0.22591210454702376, "num_tokens": 75364777.0, "step": 32900 }, { "entropy": 5.389423179626465, "epoch": 3.252767892447608, "grad_norm": 1.0625, "learning_rate": 0.00039641792991647605, "loss": 4.9414, "mean_token_accuracy": 0.22352657467126846, "num_tokens": 75375677.0, "step": 32905 }, { "entropy": 5.427908802032471, "epoch": 3.253262158956109, "grad_norm": 1.078125, "learning_rate": 0.0003963882178248475, "loss": 4.9536, "mean_token_accuracy": 0.2233499363064766, "num_tokens": 75387925.0, "step": 32910 }, { "entropy": 5.283987331390381, "epoch": 3.2537564254646103, "grad_norm": 1.0, "learning_rate": 0.0003963585027470498, "loss": 4.7727, "mean_token_accuracy": 0.23631056696176528, "num_tokens": 75399000.0, "step": 32915 }, { "entropy": 5.327047300338745, "epoch": 3.254250691973112, "grad_norm": 0.9921875, "learning_rate": 0.0003963287846838142, "loss": 4.8504, "mean_token_accuracy": 0.22150594145059585, "num_tokens": 75409930.0, "step": 32920 }, { "entropy": 5.407949209213257, "epoch": 3.2547449584816133, "grad_norm": 1.03125, "learning_rate": 0.00039629906363587177, "loss": 4.9509, "mean_token_accuracy": 0.21806704998016357, "num_tokens": 75421621.0, "step": 32925 }, { "entropy": 5.483580493927002, "epoch": 3.2552392249901145, "grad_norm": 1.078125, "learning_rate": 0.00039626933960395345, "loss": 5.0444, "mean_token_accuracy": 0.21340982466936112, "num_tokens": 75434339.0, "step": 32930 }, { "entropy": 5.384823799133301, "epoch": 3.2557334914986162, "grad_norm": 1.0234375, "learning_rate": 0.00039623961258879057, "loss": 4.9982, "mean_token_accuracy": 0.22143218964338302, "num_tokens": 75446720.0, "step": 32935 }, { "entropy": 5.337284708023072, "epoch": 3.2562277580071175, "grad_norm": 0.9921875, "learning_rate": 0.0003962098825911144, "loss": 4.8874, "mean_token_accuracy": 0.22609578669071198, "num_tokens": 75459354.0, "step": 32940 }, { "entropy": 5.454944658279419, "epoch": 3.2567220245156188, "grad_norm": 1.1015625, "learning_rate": 0.00039618014961165633, "loss": 5.0068, "mean_token_accuracy": 0.21245534121990203, "num_tokens": 75471704.0, "step": 32945 }, { "entropy": 5.479271316528321, "epoch": 3.25721629102412, "grad_norm": 1.03125, "learning_rate": 0.0003961504136511478, "loss": 5.0383, "mean_token_accuracy": 0.21522038131952287, "num_tokens": 75483145.0, "step": 32950 }, { "entropy": 5.387699460983276, "epoch": 3.2577105575326217, "grad_norm": 1.09375, "learning_rate": 0.00039612067471032024, "loss": 4.893, "mean_token_accuracy": 0.22120036631822587, "num_tokens": 75493678.0, "step": 32955 }, { "entropy": 5.362654542922973, "epoch": 3.258204824041123, "grad_norm": 0.98828125, "learning_rate": 0.0003960909327899053, "loss": 4.8968, "mean_token_accuracy": 0.22074384093284607, "num_tokens": 75504581.0, "step": 32960 }, { "entropy": 5.335285758972168, "epoch": 3.2586990905496243, "grad_norm": 1.1015625, "learning_rate": 0.0003960611878906347, "loss": 4.8394, "mean_token_accuracy": 0.2247749850153923, "num_tokens": 75515116.0, "step": 32965 }, { "entropy": 5.341491842269898, "epoch": 3.259193357058126, "grad_norm": 1.0078125, "learning_rate": 0.0003960314400132401, "loss": 4.8567, "mean_token_accuracy": 0.22782252430915834, "num_tokens": 75527001.0, "step": 32970 }, { "entropy": 5.400572299957275, "epoch": 3.2596876235666272, "grad_norm": 1.078125, "learning_rate": 0.0003960016891584532, "loss": 4.9137, "mean_token_accuracy": 0.22772835046052933, "num_tokens": 75537641.0, "step": 32975 }, { "entropy": 5.349691247940063, "epoch": 3.2601818900751285, "grad_norm": 1.0390625, "learning_rate": 0.0003959719353270061, "loss": 4.9123, "mean_token_accuracy": 0.2220082625746727, "num_tokens": 75551225.0, "step": 32980 }, { "entropy": 5.296876382827759, "epoch": 3.2606761565836297, "grad_norm": 1.0078125, "learning_rate": 0.00039594217851963054, "loss": 4.877, "mean_token_accuracy": 0.22837100327014923, "num_tokens": 75563112.0, "step": 32985 }, { "entropy": 5.326445865631103, "epoch": 3.2611704230921315, "grad_norm": 1.03125, "learning_rate": 0.00039591241873705864, "loss": 4.8494, "mean_token_accuracy": 0.22929680496454238, "num_tokens": 75573709.0, "step": 32990 }, { "entropy": 5.394075059890747, "epoch": 3.2616646896006327, "grad_norm": 1.0234375, "learning_rate": 0.0003958826559800225, "loss": 4.9538, "mean_token_accuracy": 0.22167688757181167, "num_tokens": 75585269.0, "step": 32995 }, { "entropy": 5.396078062057495, "epoch": 3.262158956109134, "grad_norm": 0.9765625, "learning_rate": 0.0003958528902492543, "loss": 4.9532, "mean_token_accuracy": 0.2148666575551033, "num_tokens": 75597084.0, "step": 33000 }, { "epoch": 3.262158956109134, "eval_entropy": 5.189067420924282, "eval_loss": 5.038053035736084, "eval_mean_token_accuracy": 0.22311703603609315, "eval_num_tokens": 75597084.0, "eval_runtime": 26.9434, "eval_samples_per_second": 1206.715, "eval_steps_per_second": 150.872, "step": 33000 }, { "entropy": 5.333249092102051, "epoch": 3.2626532226176352, "grad_norm": 0.984375, "learning_rate": 0.00039582312154548614, "loss": 4.8716, "mean_token_accuracy": 0.23040277510881424, "num_tokens": 75608948.0, "step": 33005 }, { "entropy": 5.396775484085083, "epoch": 3.263147489126137, "grad_norm": 0.95703125, "learning_rate": 0.00039579334986945055, "loss": 4.9344, "mean_token_accuracy": 0.2203484371304512, "num_tokens": 75619845.0, "step": 33010 }, { "entropy": 5.401003646850586, "epoch": 3.263641755634638, "grad_norm": 1.0, "learning_rate": 0.0003957635752218797, "loss": 5.0082, "mean_token_accuracy": 0.21123508512973785, "num_tokens": 75632116.0, "step": 33015 }, { "entropy": 5.377741050720215, "epoch": 3.2641360221431395, "grad_norm": 1.0078125, "learning_rate": 0.0003957337976035063, "loss": 4.9135, "mean_token_accuracy": 0.2185782015323639, "num_tokens": 75643675.0, "step": 33020 }, { "entropy": 5.434565830230713, "epoch": 3.2646302886516407, "grad_norm": 1.0625, "learning_rate": 0.0003957040170150626, "loss": 4.9373, "mean_token_accuracy": 0.22162001430988312, "num_tokens": 75654451.0, "step": 33025 }, { "entropy": 5.306909465789795, "epoch": 3.2651245551601424, "grad_norm": 0.9921875, "learning_rate": 0.0003956742334572815, "loss": 4.833, "mean_token_accuracy": 0.23065955936908722, "num_tokens": 75666260.0, "step": 33030 }, { "entropy": 5.3937944889068605, "epoch": 3.2656188216686437, "grad_norm": 1.0390625, "learning_rate": 0.0003956444469308955, "loss": 4.9523, "mean_token_accuracy": 0.21924472153186797, "num_tokens": 75678785.0, "step": 33035 }, { "entropy": 5.376312351226806, "epoch": 3.266113088177145, "grad_norm": 0.9921875, "learning_rate": 0.0003956146574366374, "loss": 4.8952, "mean_token_accuracy": 0.22618096619844436, "num_tokens": 75690500.0, "step": 33040 }, { "entropy": 5.2899340152740475, "epoch": 3.2666073546856467, "grad_norm": 0.93359375, "learning_rate": 0.0003955848649752399, "loss": 4.8799, "mean_token_accuracy": 0.2316228747367859, "num_tokens": 75703616.0, "step": 33045 }, { "entropy": 5.330752801895142, "epoch": 3.267101621194148, "grad_norm": 1.078125, "learning_rate": 0.00039555506954743613, "loss": 4.883, "mean_token_accuracy": 0.22277265340089797, "num_tokens": 75713996.0, "step": 33050 }, { "entropy": 5.447803068161011, "epoch": 3.267595887702649, "grad_norm": 0.95703125, "learning_rate": 0.00039552527115395896, "loss": 5.0082, "mean_token_accuracy": 0.2129393383860588, "num_tokens": 75726746.0, "step": 33055 }, { "entropy": 5.447826862335205, "epoch": 3.2680901542111505, "grad_norm": 0.9921875, "learning_rate": 0.00039549546979554133, "loss": 5.0132, "mean_token_accuracy": 0.21259796172380446, "num_tokens": 75738441.0, "step": 33060 }, { "entropy": 5.328391361236572, "epoch": 3.268584420719652, "grad_norm": 0.96875, "learning_rate": 0.0003954656654729166, "loss": 4.9824, "mean_token_accuracy": 0.21579799056053162, "num_tokens": 75749592.0, "step": 33065 }, { "entropy": 5.501325416564941, "epoch": 3.2690786872281534, "grad_norm": 1.0, "learning_rate": 0.00039543585818681764, "loss": 5.082, "mean_token_accuracy": 0.20892251580953597, "num_tokens": 75761668.0, "step": 33070 }, { "entropy": 5.450222539901733, "epoch": 3.2695729537366547, "grad_norm": 1.0234375, "learning_rate": 0.0003954060479379779, "loss": 4.9634, "mean_token_accuracy": 0.21851823031902312, "num_tokens": 75773277.0, "step": 33075 }, { "entropy": 5.334537601470947, "epoch": 3.2700672202451564, "grad_norm": 1.0859375, "learning_rate": 0.0003953762347271308, "loss": 4.9197, "mean_token_accuracy": 0.22264908403158187, "num_tokens": 75783888.0, "step": 33080 }, { "entropy": 5.31234040260315, "epoch": 3.2705614867536577, "grad_norm": 0.984375, "learning_rate": 0.00039534641855500964, "loss": 4.918, "mean_token_accuracy": 0.22322579473257065, "num_tokens": 75796157.0, "step": 33085 }, { "entropy": 5.315906238555908, "epoch": 3.271055753262159, "grad_norm": 1.0078125, "learning_rate": 0.00039531659942234785, "loss": 4.7878, "mean_token_accuracy": 0.2390444815158844, "num_tokens": 75807523.0, "step": 33090 }, { "entropy": 5.434315299987793, "epoch": 3.27155001977066, "grad_norm": 0.984375, "learning_rate": 0.00039528677732987913, "loss": 4.9892, "mean_token_accuracy": 0.21224308758974075, "num_tokens": 75819383.0, "step": 33095 }, { "entropy": 5.355528879165649, "epoch": 3.272044286279162, "grad_norm": 1.0078125, "learning_rate": 0.000395256952278337, "loss": 4.9885, "mean_token_accuracy": 0.22014871686697007, "num_tokens": 75830957.0, "step": 33100 }, { "entropy": 5.398595809936523, "epoch": 3.272538552787663, "grad_norm": 1.0234375, "learning_rate": 0.00039522712426845507, "loss": 4.9023, "mean_token_accuracy": 0.22013138830661774, "num_tokens": 75841260.0, "step": 33105 }, { "entropy": 5.41156964302063, "epoch": 3.2730328192961644, "grad_norm": 1.03125, "learning_rate": 0.00039519729330096735, "loss": 4.9388, "mean_token_accuracy": 0.22359984666109084, "num_tokens": 75852803.0, "step": 33110 }, { "entropy": 5.425392150878906, "epoch": 3.273527085804666, "grad_norm": 1.03125, "learning_rate": 0.0003951674593766076, "loss": 4.9389, "mean_token_accuracy": 0.21920476257801055, "num_tokens": 75863989.0, "step": 33115 }, { "entropy": 5.333084201812744, "epoch": 3.2740213523131674, "grad_norm": 0.9921875, "learning_rate": 0.0003951376224961096, "loss": 4.8652, "mean_token_accuracy": 0.22816912680864335, "num_tokens": 75875381.0, "step": 33120 }, { "entropy": 5.321984958648682, "epoch": 3.2745156188216686, "grad_norm": 0.99609375, "learning_rate": 0.0003951077826602075, "loss": 4.8376, "mean_token_accuracy": 0.2276059091091156, "num_tokens": 75887204.0, "step": 33125 }, { "entropy": 5.356298351287842, "epoch": 3.27500988533017, "grad_norm": 1.1015625, "learning_rate": 0.0003950779398696353, "loss": 4.9493, "mean_token_accuracy": 0.21966141909360887, "num_tokens": 75898666.0, "step": 33130 }, { "entropy": 5.359775733947754, "epoch": 3.275504151838671, "grad_norm": 1.0546875, "learning_rate": 0.00039504809412512724, "loss": 4.8834, "mean_token_accuracy": 0.22104412615299224, "num_tokens": 75910151.0, "step": 33135 }, { "entropy": 5.394236993789673, "epoch": 3.275998418347173, "grad_norm": 1.109375, "learning_rate": 0.0003950182454274173, "loss": 4.9513, "mean_token_accuracy": 0.22307956963777542, "num_tokens": 75920533.0, "step": 33140 }, { "entropy": 5.400747680664063, "epoch": 3.276492684855674, "grad_norm": 0.93359375, "learning_rate": 0.00039498839377723996, "loss": 4.8987, "mean_token_accuracy": 0.2286425918340683, "num_tokens": 75932335.0, "step": 33145 }, { "entropy": 5.472214078903198, "epoch": 3.2769869513641754, "grad_norm": 1.015625, "learning_rate": 0.0003949585391753295, "loss": 4.9762, "mean_token_accuracy": 0.222672675549984, "num_tokens": 75943741.0, "step": 33150 }, { "entropy": 5.323811674118042, "epoch": 3.277481217872677, "grad_norm": 1.0390625, "learning_rate": 0.0003949286816224204, "loss": 4.9179, "mean_token_accuracy": 0.22773498743772508, "num_tokens": 75955755.0, "step": 33155 }, { "entropy": 5.372470188140869, "epoch": 3.2779754843811784, "grad_norm": 1.03125, "learning_rate": 0.0003948988211192471, "loss": 4.8702, "mean_token_accuracy": 0.22397494316101074, "num_tokens": 75967057.0, "step": 33160 }, { "entropy": 5.342099380493164, "epoch": 3.2784697508896796, "grad_norm": 1.03125, "learning_rate": 0.0003948689576665443, "loss": 4.9184, "mean_token_accuracy": 0.22534862905740738, "num_tokens": 75978367.0, "step": 33165 }, { "entropy": 5.464762020111084, "epoch": 3.278964017398181, "grad_norm": 0.9765625, "learning_rate": 0.00039483909126504643, "loss": 5.0162, "mean_token_accuracy": 0.21369384378194808, "num_tokens": 75990738.0, "step": 33170 }, { "entropy": 5.405552721023559, "epoch": 3.2794582839066826, "grad_norm": 1.015625, "learning_rate": 0.0003948092219154883, "loss": 4.9756, "mean_token_accuracy": 0.2139458552002907, "num_tokens": 76003058.0, "step": 33175 }, { "entropy": 5.37271203994751, "epoch": 3.279952550415184, "grad_norm": 1.1875, "learning_rate": 0.0003947793496186048, "loss": 4.8752, "mean_token_accuracy": 0.22626155912876128, "num_tokens": 76013743.0, "step": 33180 }, { "entropy": 5.414726066589355, "epoch": 3.280446816923685, "grad_norm": 1.0234375, "learning_rate": 0.0003947494743751307, "loss": 4.9461, "mean_token_accuracy": 0.21824132651090622, "num_tokens": 76024346.0, "step": 33185 }, { "entropy": 5.421266269683838, "epoch": 3.280941083432187, "grad_norm": 1.0546875, "learning_rate": 0.00039471959618580095, "loss": 4.9412, "mean_token_accuracy": 0.21763127148151398, "num_tokens": 76035444.0, "step": 33190 }, { "entropy": 5.280162906646728, "epoch": 3.281435349940688, "grad_norm": 1.015625, "learning_rate": 0.0003946897150513506, "loss": 4.8708, "mean_token_accuracy": 0.23251291066408158, "num_tokens": 76047363.0, "step": 33195 }, { "entropy": 5.3771833896636965, "epoch": 3.2819296164491893, "grad_norm": 1.1015625, "learning_rate": 0.0003946598309725146, "loss": 4.9583, "mean_token_accuracy": 0.21591981649398803, "num_tokens": 76059581.0, "step": 33200 }, { "entropy": 5.366854286193847, "epoch": 3.2824238829576906, "grad_norm": 0.92578125, "learning_rate": 0.0003946299439500283, "loss": 4.8647, "mean_token_accuracy": 0.23014160692691804, "num_tokens": 76071455.0, "step": 33205 }, { "entropy": 5.307225704193115, "epoch": 3.2829181494661923, "grad_norm": 1.0234375, "learning_rate": 0.0003946000539846267, "loss": 4.8654, "mean_token_accuracy": 0.2253640830516815, "num_tokens": 76083794.0, "step": 33210 }, { "entropy": 5.4104081153869625, "epoch": 3.2834124159746936, "grad_norm": 0.96484375, "learning_rate": 0.0003945701610770453, "loss": 4.9444, "mean_token_accuracy": 0.21654590368270873, "num_tokens": 76095690.0, "step": 33215 }, { "entropy": 5.342202615737915, "epoch": 3.283906682483195, "grad_norm": 1.046875, "learning_rate": 0.0003945402652280193, "loss": 4.8679, "mean_token_accuracy": 0.22139070332050323, "num_tokens": 76106730.0, "step": 33220 }, { "entropy": 5.3227495670318605, "epoch": 3.2844009489916965, "grad_norm": 1.03125, "learning_rate": 0.0003945103664382844, "loss": 4.9515, "mean_token_accuracy": 0.21724514663219452, "num_tokens": 76117333.0, "step": 33225 }, { "entropy": 5.347023677825928, "epoch": 3.284895215500198, "grad_norm": 1.0234375, "learning_rate": 0.0003944804647085759, "loss": 4.8623, "mean_token_accuracy": 0.22841713279485704, "num_tokens": 76129060.0, "step": 33230 }, { "entropy": 5.354047203063965, "epoch": 3.285389482008699, "grad_norm": 1.125, "learning_rate": 0.0003944505600396294, "loss": 4.8513, "mean_token_accuracy": 0.2321026399731636, "num_tokens": 76140724.0, "step": 33235 }, { "entropy": 5.276392889022827, "epoch": 3.2858837485172003, "grad_norm": 1.0625, "learning_rate": 0.0003944206524321805, "loss": 4.8738, "mean_token_accuracy": 0.230803744494915, "num_tokens": 76153021.0, "step": 33240 }, { "entropy": 5.359737825393677, "epoch": 3.286378015025702, "grad_norm": 1.015625, "learning_rate": 0.00039439074188696516, "loss": 4.9115, "mean_token_accuracy": 0.2254365250468254, "num_tokens": 76165759.0, "step": 33245 }, { "entropy": 5.418773746490478, "epoch": 3.2868722815342033, "grad_norm": 0.9921875, "learning_rate": 0.0003943608284047189, "loss": 4.9172, "mean_token_accuracy": 0.21975175738334657, "num_tokens": 76178645.0, "step": 33250 }, { "entropy": 5.376545047760009, "epoch": 3.2873665480427046, "grad_norm": 1.015625, "learning_rate": 0.0003943309119861779, "loss": 4.875, "mean_token_accuracy": 0.22064872980117797, "num_tokens": 76189320.0, "step": 33255 }, { "entropy": 5.433485460281372, "epoch": 3.287860814551206, "grad_norm": 1.046875, "learning_rate": 0.0003943009926320778, "loss": 5.0367, "mean_token_accuracy": 0.2148431658744812, "num_tokens": 76200672.0, "step": 33260 }, { "entropy": 5.343992805480957, "epoch": 3.2883550810597075, "grad_norm": 1.109375, "learning_rate": 0.0003942710703431548, "loss": 4.8888, "mean_token_accuracy": 0.22837442457675933, "num_tokens": 76211035.0, "step": 33265 }, { "entropy": 5.398343658447265, "epoch": 3.288849347568209, "grad_norm": 1.28125, "learning_rate": 0.0003942411451201451, "loss": 4.9467, "mean_token_accuracy": 0.21951565593481065, "num_tokens": 76222262.0, "step": 33270 }, { "entropy": 5.4242250442504885, "epoch": 3.28934361407671, "grad_norm": 1.0234375, "learning_rate": 0.00039421121696378466, "loss": 4.9654, "mean_token_accuracy": 0.2216469407081604, "num_tokens": 76234346.0, "step": 33275 }, { "entropy": 5.3626867771148685, "epoch": 3.2898378805852113, "grad_norm": 0.98828125, "learning_rate": 0.0003941812858748098, "loss": 4.9136, "mean_token_accuracy": 0.22503640204668046, "num_tokens": 76244536.0, "step": 33280 }, { "entropy": 5.360766744613647, "epoch": 3.290332147093713, "grad_norm": 1.0390625, "learning_rate": 0.0003941513518539568, "loss": 4.9299, "mean_token_accuracy": 0.22251774370670319, "num_tokens": 76256080.0, "step": 33285 }, { "entropy": 5.35719633102417, "epoch": 3.2908264136022143, "grad_norm": 0.9921875, "learning_rate": 0.00039412141490196206, "loss": 4.8865, "mean_token_accuracy": 0.22919877618551254, "num_tokens": 76266741.0, "step": 33290 }, { "entropy": 5.293213367462158, "epoch": 3.2913206801107155, "grad_norm": 1.046875, "learning_rate": 0.000394091475019562, "loss": 4.9008, "mean_token_accuracy": 0.2169655054807663, "num_tokens": 76279099.0, "step": 33295 }, { "entropy": 5.428159141540528, "epoch": 3.2918149466192173, "grad_norm": 1.09375, "learning_rate": 0.0003940615322074932, "loss": 5.05, "mean_token_accuracy": 0.21708894670009612, "num_tokens": 76290692.0, "step": 33300 }, { "entropy": 5.41946234703064, "epoch": 3.2923092131277185, "grad_norm": 0.98046875, "learning_rate": 0.00039403158646649227, "loss": 4.9044, "mean_token_accuracy": 0.22026312947273255, "num_tokens": 76302003.0, "step": 33305 }, { "entropy": 5.303877639770508, "epoch": 3.2928034796362198, "grad_norm": 1.046875, "learning_rate": 0.0003940016377972958, "loss": 4.9124, "mean_token_accuracy": 0.22323793768882752, "num_tokens": 76313255.0, "step": 33310 }, { "entropy": 5.3094110012054445, "epoch": 3.293297746144721, "grad_norm": 1.09375, "learning_rate": 0.00039397168620064065, "loss": 4.8586, "mean_token_accuracy": 0.23006775081157685, "num_tokens": 76323154.0, "step": 33315 }, { "entropy": 5.449469757080078, "epoch": 3.2937920126532227, "grad_norm": 1.2265625, "learning_rate": 0.00039394173167726346, "loss": 4.9465, "mean_token_accuracy": 0.2136124223470688, "num_tokens": 76333168.0, "step": 33320 }, { "entropy": 5.434146451950073, "epoch": 3.294286279161724, "grad_norm": 0.98828125, "learning_rate": 0.0003939117742279013, "loss": 4.9932, "mean_token_accuracy": 0.21460400968790055, "num_tokens": 76344916.0, "step": 33325 }, { "entropy": 5.453251647949219, "epoch": 3.2947805456702253, "grad_norm": 1.0546875, "learning_rate": 0.000393881813853291, "loss": 4.9332, "mean_token_accuracy": 0.21773354709148407, "num_tokens": 76357124.0, "step": 33330 }, { "entropy": 5.447827339172363, "epoch": 3.295274812178727, "grad_norm": 0.98046875, "learning_rate": 0.00039385185055416965, "loss": 5.0019, "mean_token_accuracy": 0.2152120754122734, "num_tokens": 76368784.0, "step": 33335 }, { "entropy": 5.4210724353790285, "epoch": 3.2957690786872282, "grad_norm": 1.0, "learning_rate": 0.00039382188433127437, "loss": 4.9705, "mean_token_accuracy": 0.21075177788734437, "num_tokens": 76379864.0, "step": 33340 }, { "entropy": 5.431576681137085, "epoch": 3.2962633451957295, "grad_norm": 1.109375, "learning_rate": 0.0003937919151853422, "loss": 4.934, "mean_token_accuracy": 0.21875980198383332, "num_tokens": 76392184.0, "step": 33345 }, { "entropy": 5.43218765258789, "epoch": 3.2967576117042308, "grad_norm": 0.96875, "learning_rate": 0.0003937619431171107, "loss": 4.8875, "mean_token_accuracy": 0.2202820137143135, "num_tokens": 76404312.0, "step": 33350 }, { "entropy": 5.351992845535278, "epoch": 3.2972518782127325, "grad_norm": 1.046875, "learning_rate": 0.0003937319681273168, "loss": 4.994, "mean_token_accuracy": 0.21723760515451432, "num_tokens": 76414351.0, "step": 33355 }, { "entropy": 5.430846405029297, "epoch": 3.2977461447212337, "grad_norm": 0.99609375, "learning_rate": 0.0003937019902166981, "loss": 4.9861, "mean_token_accuracy": 0.21242332309484482, "num_tokens": 76425851.0, "step": 33360 }, { "entropy": 5.3695393085479735, "epoch": 3.298240411229735, "grad_norm": 1.046875, "learning_rate": 0.000393672009385992, "loss": 4.8973, "mean_token_accuracy": 0.226909901201725, "num_tokens": 76437669.0, "step": 33365 }, { "entropy": 5.3629718780517575, "epoch": 3.2987346777382367, "grad_norm": 0.94140625, "learning_rate": 0.0003936420256359361, "loss": 4.8502, "mean_token_accuracy": 0.2292870655655861, "num_tokens": 76449589.0, "step": 33370 }, { "entropy": 5.40869255065918, "epoch": 3.299228944246738, "grad_norm": 1.015625, "learning_rate": 0.000393612038967268, "loss": 5.0212, "mean_token_accuracy": 0.21748004257678985, "num_tokens": 76462143.0, "step": 33375 }, { "entropy": 5.39310998916626, "epoch": 3.2997232107552392, "grad_norm": 1.0078125, "learning_rate": 0.00039358204938072527, "loss": 4.9117, "mean_token_accuracy": 0.22305780351161958, "num_tokens": 76473731.0, "step": 33380 }, { "entropy": 5.3966583728790285, "epoch": 3.3002174772637405, "grad_norm": 0.9453125, "learning_rate": 0.00039355205687704575, "loss": 4.9191, "mean_token_accuracy": 0.2204673781991005, "num_tokens": 76484287.0, "step": 33385 }, { "entropy": 5.339991331100464, "epoch": 3.3007117437722417, "grad_norm": 0.98046875, "learning_rate": 0.0003935220614569672, "loss": 4.9028, "mean_token_accuracy": 0.2242744043469429, "num_tokens": 76495940.0, "step": 33390 }, { "entropy": 5.37202091217041, "epoch": 3.3012060102807435, "grad_norm": 1.046875, "learning_rate": 0.00039349206312122765, "loss": 4.8527, "mean_token_accuracy": 0.23563077449798583, "num_tokens": 76507890.0, "step": 33395 }, { "entropy": 5.362610101699829, "epoch": 3.3017002767892447, "grad_norm": 1.046875, "learning_rate": 0.0003934620618705649, "loss": 4.9089, "mean_token_accuracy": 0.22457995265722275, "num_tokens": 76519654.0, "step": 33400 }, { "entropy": 5.362840890884399, "epoch": 3.302194543297746, "grad_norm": 1.046875, "learning_rate": 0.000393432057705717, "loss": 4.8911, "mean_token_accuracy": 0.21823182255029677, "num_tokens": 76532026.0, "step": 33405 }, { "entropy": 5.347477006912231, "epoch": 3.3026888098062477, "grad_norm": 0.9609375, "learning_rate": 0.0003934020506274222, "loss": 4.8595, "mean_token_accuracy": 0.23167002499103545, "num_tokens": 76543629.0, "step": 33410 }, { "entropy": 5.450390863418579, "epoch": 3.303183076314749, "grad_norm": 1.0078125, "learning_rate": 0.0003933720406364185, "loss": 4.9403, "mean_token_accuracy": 0.22513831555843353, "num_tokens": 76554069.0, "step": 33415 }, { "entropy": 5.345998096466064, "epoch": 3.30367734282325, "grad_norm": 0.95703125, "learning_rate": 0.00039334202773344437, "loss": 4.8741, "mean_token_accuracy": 0.2238425150513649, "num_tokens": 76566148.0, "step": 33420 }, { "entropy": 5.342526197433472, "epoch": 3.3041716093317515, "grad_norm": 0.98828125, "learning_rate": 0.00039331201191923794, "loss": 4.8986, "mean_token_accuracy": 0.2182041421532631, "num_tokens": 76577208.0, "step": 33425 }, { "entropy": 5.312380123138428, "epoch": 3.304665875840253, "grad_norm": 0.9765625, "learning_rate": 0.0003932819931945375, "loss": 4.8683, "mean_token_accuracy": 0.23641083687543868, "num_tokens": 76588532.0, "step": 33430 }, { "entropy": 5.416561651229858, "epoch": 3.3051601423487544, "grad_norm": 1.0078125, "learning_rate": 0.0003932519715600819, "loss": 4.9788, "mean_token_accuracy": 0.21638747900724412, "num_tokens": 76600054.0, "step": 33435 }, { "entropy": 5.44054765701294, "epoch": 3.3056544088572557, "grad_norm": 0.98828125, "learning_rate": 0.00039322194701660936, "loss": 4.9512, "mean_token_accuracy": 0.22497459650039672, "num_tokens": 76612571.0, "step": 33440 }, { "entropy": 5.426646518707275, "epoch": 3.3061486753657574, "grad_norm": 1.0, "learning_rate": 0.00039319191956485854, "loss": 4.9827, "mean_token_accuracy": 0.21273379623889924, "num_tokens": 76625435.0, "step": 33445 }, { "entropy": 5.349206018447876, "epoch": 3.3066429418742587, "grad_norm": 1.15625, "learning_rate": 0.0003931618892055682, "loss": 4.8585, "mean_token_accuracy": 0.23163534253835677, "num_tokens": 76635529.0, "step": 33450 }, { "entropy": 5.251764392852783, "epoch": 3.30713720838276, "grad_norm": 0.98046875, "learning_rate": 0.00039313185593947713, "loss": 4.7924, "mean_token_accuracy": 0.23351703584194183, "num_tokens": 76645819.0, "step": 33455 }, { "entropy": 5.483918046951294, "epoch": 3.307631474891261, "grad_norm": 0.953125, "learning_rate": 0.00039310181976732404, "loss": 5.0777, "mean_token_accuracy": 0.20413907021284103, "num_tokens": 76657803.0, "step": 33460 }, { "entropy": 5.48245062828064, "epoch": 3.308125741399763, "grad_norm": 1.0625, "learning_rate": 0.00039307178068984783, "loss": 5.0505, "mean_token_accuracy": 0.20711697190999984, "num_tokens": 76670260.0, "step": 33465 }, { "entropy": 5.346644258499145, "epoch": 3.308620007908264, "grad_norm": 1.015625, "learning_rate": 0.0003930417387077875, "loss": 4.8822, "mean_token_accuracy": 0.22450132369995118, "num_tokens": 76682591.0, "step": 33470 }, { "entropy": 5.3553873062133786, "epoch": 3.3091142744167654, "grad_norm": 0.9765625, "learning_rate": 0.0003930116938218821, "loss": 4.8914, "mean_token_accuracy": 0.22261531203985213, "num_tokens": 76694147.0, "step": 33475 }, { "entropy": 5.389763259887696, "epoch": 3.309608540925267, "grad_norm": 0.9375, "learning_rate": 0.00039298164603287063, "loss": 5.0014, "mean_token_accuracy": 0.22221826612949372, "num_tokens": 76706325.0, "step": 33480 }, { "entropy": 5.421973657608032, "epoch": 3.3101028074337684, "grad_norm": 1.0078125, "learning_rate": 0.0003929515953414926, "loss": 4.9382, "mean_token_accuracy": 0.22265520095825195, "num_tokens": 76719574.0, "step": 33485 }, { "entropy": 5.332542037963867, "epoch": 3.3105970739422697, "grad_norm": 1.0078125, "learning_rate": 0.0003929215417484868, "loss": 4.8567, "mean_token_accuracy": 0.2235609397292137, "num_tokens": 76731820.0, "step": 33490 }, { "entropy": 5.27767424583435, "epoch": 3.311091340450771, "grad_norm": 1.0390625, "learning_rate": 0.00039289148525459283, "loss": 4.8013, "mean_token_accuracy": 0.23237260431051254, "num_tokens": 76742849.0, "step": 33495 }, { "entropy": 5.442330646514892, "epoch": 3.3115856069592726, "grad_norm": 1.0546875, "learning_rate": 0.00039286142586055005, "loss": 4.9921, "mean_token_accuracy": 0.21917519569396973, "num_tokens": 76754747.0, "step": 33500 }, { "entropy": 5.32992582321167, "epoch": 3.312079873467774, "grad_norm": 0.95703125, "learning_rate": 0.000392831363567098, "loss": 4.8508, "mean_token_accuracy": 0.22816484421491623, "num_tokens": 76766738.0, "step": 33505 }, { "entropy": 5.316068887710571, "epoch": 3.312574139976275, "grad_norm": 1.0703125, "learning_rate": 0.00039280129837497595, "loss": 4.9319, "mean_token_accuracy": 0.21944709569215776, "num_tokens": 76777457.0, "step": 33510 }, { "entropy": 5.433663654327392, "epoch": 3.3130684064847764, "grad_norm": 0.98828125, "learning_rate": 0.00039277123028492376, "loss": 4.9983, "mean_token_accuracy": 0.20827572345733641, "num_tokens": 76788335.0, "step": 33515 }, { "entropy": 5.471884393692017, "epoch": 3.313562672993278, "grad_norm": 1.0078125, "learning_rate": 0.0003927411592976811, "loss": 4.8966, "mean_token_accuracy": 0.22105845510959626, "num_tokens": 76800471.0, "step": 33520 }, { "entropy": 5.306353425979614, "epoch": 3.3140569395017794, "grad_norm": 1.046875, "learning_rate": 0.00039271108541398753, "loss": 4.9065, "mean_token_accuracy": 0.23003062903881072, "num_tokens": 76811792.0, "step": 33525 }, { "entropy": 5.318279695510864, "epoch": 3.3145512060102806, "grad_norm": 1.078125, "learning_rate": 0.0003926810086345831, "loss": 4.839, "mean_token_accuracy": 0.22707404643297197, "num_tokens": 76824332.0, "step": 33530 }, { "entropy": 5.451320314407349, "epoch": 3.315045472518782, "grad_norm": 1.0625, "learning_rate": 0.00039265092896020767, "loss": 4.9444, "mean_token_accuracy": 0.2167900413274765, "num_tokens": 76835712.0, "step": 33535 }, { "entropy": 5.344161748886108, "epoch": 3.3155397390272836, "grad_norm": 1.015625, "learning_rate": 0.000392620846391601, "loss": 4.8768, "mean_token_accuracy": 0.23346701860427857, "num_tokens": 76847915.0, "step": 33540 }, { "entropy": 5.338288497924805, "epoch": 3.316034005535785, "grad_norm": 1.0390625, "learning_rate": 0.00039259076092950333, "loss": 4.9512, "mean_token_accuracy": 0.21920739710330964, "num_tokens": 76859982.0, "step": 33545 }, { "entropy": 5.300202178955078, "epoch": 3.316528272044286, "grad_norm": 0.98046875, "learning_rate": 0.0003925606725746547, "loss": 4.869, "mean_token_accuracy": 0.23055555373430253, "num_tokens": 76870743.0, "step": 33550 }, { "entropy": 5.242681550979614, "epoch": 3.317022538552788, "grad_norm": 1.0234375, "learning_rate": 0.0003925305813277952, "loss": 4.8327, "mean_token_accuracy": 0.22515660226345063, "num_tokens": 76882118.0, "step": 33555 }, { "entropy": 5.366752481460571, "epoch": 3.317516805061289, "grad_norm": 1.078125, "learning_rate": 0.00039250048718966524, "loss": 4.927, "mean_token_accuracy": 0.2165424183011055, "num_tokens": 76893658.0, "step": 33560 }, { "entropy": 5.425343322753906, "epoch": 3.3180110715697904, "grad_norm": 1.046875, "learning_rate": 0.00039247039016100514, "loss": 4.9071, "mean_token_accuracy": 0.2201566904783249, "num_tokens": 76904974.0, "step": 33565 }, { "entropy": 5.368563795089722, "epoch": 3.3185053380782916, "grad_norm": 1.0390625, "learning_rate": 0.00039244029024255506, "loss": 4.9054, "mean_token_accuracy": 0.22674650847911834, "num_tokens": 76915972.0, "step": 33570 }, { "entropy": 5.3593607425689695, "epoch": 3.3189996045867933, "grad_norm": 1.015625, "learning_rate": 0.0003924101874350557, "loss": 4.9148, "mean_token_accuracy": 0.21904488205909728, "num_tokens": 76927397.0, "step": 33575 }, { "entropy": 5.390121936798096, "epoch": 3.3194938710952946, "grad_norm": 0.9453125, "learning_rate": 0.0003923800817392475, "loss": 4.9053, "mean_token_accuracy": 0.2155536949634552, "num_tokens": 76939744.0, "step": 33580 }, { "entropy": 5.442476797103882, "epoch": 3.319988137603796, "grad_norm": 1.015625, "learning_rate": 0.00039234997315587105, "loss": 5.041, "mean_token_accuracy": 0.21334196478128434, "num_tokens": 76951747.0, "step": 33585 }, { "entropy": 5.393838119506836, "epoch": 3.3204824041122976, "grad_norm": 1.109375, "learning_rate": 0.0003923198616856671, "loss": 4.92, "mean_token_accuracy": 0.22689845860004426, "num_tokens": 76961734.0, "step": 33590 }, { "entropy": 5.396941137313843, "epoch": 3.320976670620799, "grad_norm": 1.0546875, "learning_rate": 0.00039228974732937637, "loss": 4.9382, "mean_token_accuracy": 0.21828213185071946, "num_tokens": 76972566.0, "step": 33595 }, { "entropy": 5.407994174957276, "epoch": 3.3214709371293, "grad_norm": 1.03125, "learning_rate": 0.0003922596300877396, "loss": 4.9418, "mean_token_accuracy": 0.2156861662864685, "num_tokens": 76983446.0, "step": 33600 }, { "entropy": 5.3977141857147215, "epoch": 3.3219652036378013, "grad_norm": 0.98046875, "learning_rate": 0.0003922295099614978, "loss": 4.8974, "mean_token_accuracy": 0.21930639892816545, "num_tokens": 76994292.0, "step": 33605 }, { "entropy": 5.356265068054199, "epoch": 3.322459470146303, "grad_norm": 1.015625, "learning_rate": 0.00039219938695139186, "loss": 4.9351, "mean_token_accuracy": 0.2184906616806984, "num_tokens": 77007095.0, "step": 33610 }, { "entropy": 5.386044025421143, "epoch": 3.3229537366548043, "grad_norm": 0.96484375, "learning_rate": 0.0003921692610581628, "loss": 4.8916, "mean_token_accuracy": 0.21931139677762984, "num_tokens": 77017358.0, "step": 33615 }, { "entropy": 5.336177015304566, "epoch": 3.3234480031633056, "grad_norm": 0.9609375, "learning_rate": 0.0003921391322825517, "loss": 4.8381, "mean_token_accuracy": 0.22498152405023575, "num_tokens": 77028794.0, "step": 33620 }, { "entropy": 5.271046543121338, "epoch": 3.3239422696718073, "grad_norm": 1.0, "learning_rate": 0.00039210900062529986, "loss": 4.8912, "mean_token_accuracy": 0.2239728018641472, "num_tokens": 77040795.0, "step": 33625 }, { "entropy": 5.390525197982788, "epoch": 3.3244365361803085, "grad_norm": 1.0546875, "learning_rate": 0.0003920788660871483, "loss": 4.9159, "mean_token_accuracy": 0.22753553390502929, "num_tokens": 77051810.0, "step": 33630 }, { "entropy": 5.416570615768433, "epoch": 3.32493080268881, "grad_norm": 0.99609375, "learning_rate": 0.00039204872866883863, "loss": 5.0195, "mean_token_accuracy": 0.21929581165313722, "num_tokens": 77064504.0, "step": 33635 }, { "entropy": 5.413747644424438, "epoch": 3.325425069197311, "grad_norm": 1.0078125, "learning_rate": 0.000392018588371112, "loss": 4.9209, "mean_token_accuracy": 0.21761177033185958, "num_tokens": 77075163.0, "step": 33640 }, { "entropy": 5.382626724243164, "epoch": 3.3259193357058123, "grad_norm": 1.1015625, "learning_rate": 0.00039198844519470994, "loss": 4.9325, "mean_token_accuracy": 0.2229388937354088, "num_tokens": 77086871.0, "step": 33645 }, { "entropy": 5.304977893829346, "epoch": 3.326413602214314, "grad_norm": 1.0703125, "learning_rate": 0.000391958299140374, "loss": 4.8426, "mean_token_accuracy": 0.23287004828453065, "num_tokens": 77097285.0, "step": 33650 }, { "entropy": 5.252664184570312, "epoch": 3.3269078687228153, "grad_norm": 1.0390625, "learning_rate": 0.0003919281502088457, "loss": 4.794, "mean_token_accuracy": 0.2384445458650589, "num_tokens": 77107035.0, "step": 33655 }, { "entropy": 5.41862850189209, "epoch": 3.3274021352313166, "grad_norm": 0.91796875, "learning_rate": 0.0003918979984008668, "loss": 4.9472, "mean_token_accuracy": 0.21224371045827867, "num_tokens": 77119449.0, "step": 33660 }, { "entropy": 5.415667486190796, "epoch": 3.3278964017398183, "grad_norm": 1.0703125, "learning_rate": 0.00039186784371717903, "loss": 4.9272, "mean_token_accuracy": 0.22217332273721696, "num_tokens": 77130508.0, "step": 33665 }, { "entropy": 5.392439460754394, "epoch": 3.3283906682483195, "grad_norm": 1.0859375, "learning_rate": 0.0003918376861585242, "loss": 4.9313, "mean_token_accuracy": 0.21787269711494445, "num_tokens": 77142080.0, "step": 33670 }, { "entropy": 5.4059410572052, "epoch": 3.328884934756821, "grad_norm": 1.0625, "learning_rate": 0.00039180752572564405, "loss": 4.9724, "mean_token_accuracy": 0.21855347156524657, "num_tokens": 77152366.0, "step": 33675 }, { "entropy": 5.384652709960937, "epoch": 3.329379201265322, "grad_norm": 1.046875, "learning_rate": 0.0003917773624192808, "loss": 5.0076, "mean_token_accuracy": 0.21514663994312286, "num_tokens": 77164984.0, "step": 33680 }, { "entropy": 5.44873194694519, "epoch": 3.3298734677738238, "grad_norm": 1.09375, "learning_rate": 0.0003917471962401762, "loss": 4.9911, "mean_token_accuracy": 0.21500820070505142, "num_tokens": 77176870.0, "step": 33685 }, { "entropy": 5.315370893478393, "epoch": 3.330367734282325, "grad_norm": 0.94921875, "learning_rate": 0.0003917170271890724, "loss": 4.826, "mean_token_accuracy": 0.23330404609441757, "num_tokens": 77188376.0, "step": 33690 }, { "entropy": 5.336959934234619, "epoch": 3.3308620007908263, "grad_norm": 1.125, "learning_rate": 0.0003916868552667118, "loss": 4.8716, "mean_token_accuracy": 0.23045846074819565, "num_tokens": 77198556.0, "step": 33695 }, { "entropy": 5.3706443309783936, "epoch": 3.331356267299328, "grad_norm": 1.0703125, "learning_rate": 0.00039165668047383634, "loss": 4.9689, "mean_token_accuracy": 0.2217753201723099, "num_tokens": 77209409.0, "step": 33700 }, { "entropy": 5.418371868133545, "epoch": 3.3318505338078293, "grad_norm": 1.0, "learning_rate": 0.0003916265028111886, "loss": 4.9434, "mean_token_accuracy": 0.21837315261363982, "num_tokens": 77219986.0, "step": 33705 }, { "entropy": 5.399960041046143, "epoch": 3.3323448003163305, "grad_norm": 1.0625, "learning_rate": 0.00039159632227951066, "loss": 4.9446, "mean_token_accuracy": 0.21917613744735717, "num_tokens": 77231380.0, "step": 33710 }, { "entropy": 5.325772428512574, "epoch": 3.3328390668248318, "grad_norm": 1.0078125, "learning_rate": 0.000391566138879545, "loss": 4.9422, "mean_token_accuracy": 0.2255724176764488, "num_tokens": 77241765.0, "step": 33715 }, { "entropy": 5.368354558944702, "epoch": 3.3333333333333335, "grad_norm": 1.1328125, "learning_rate": 0.0003915359526120344, "loss": 4.964, "mean_token_accuracy": 0.21786848306655884, "num_tokens": 77256091.0, "step": 33720 }, { "entropy": 5.485012817382812, "epoch": 3.3338275998418347, "grad_norm": 1.1328125, "learning_rate": 0.0003915057634777213, "loss": 4.993, "mean_token_accuracy": 0.21501253247261048, "num_tokens": 77267084.0, "step": 33725 }, { "entropy": 5.515783357620239, "epoch": 3.334321866350336, "grad_norm": 1.078125, "learning_rate": 0.0003914755714773483, "loss": 4.9605, "mean_token_accuracy": 0.21667275726795196, "num_tokens": 77278435.0, "step": 33730 }, { "entropy": 5.350251579284668, "epoch": 3.3348161328588377, "grad_norm": 1.0390625, "learning_rate": 0.0003914453766116581, "loss": 4.9563, "mean_token_accuracy": 0.21631327122449875, "num_tokens": 77290971.0, "step": 33735 }, { "entropy": 5.351337862014771, "epoch": 3.335310399367339, "grad_norm": 1.0, "learning_rate": 0.0003914151788813937, "loss": 4.9033, "mean_token_accuracy": 0.22512815445661544, "num_tokens": 77302704.0, "step": 33740 }, { "entropy": 5.3679790019989015, "epoch": 3.3358046658758402, "grad_norm": 0.953125, "learning_rate": 0.00039138497828729773, "loss": 4.8536, "mean_token_accuracy": 0.23604413568973542, "num_tokens": 77314107.0, "step": 33745 }, { "entropy": 5.44464693069458, "epoch": 3.3362989323843415, "grad_norm": 1.03125, "learning_rate": 0.0003913547748301133, "loss": 4.9148, "mean_token_accuracy": 0.22416321635246278, "num_tokens": 77324040.0, "step": 33750 }, { "entropy": 5.279737567901611, "epoch": 3.336793198892843, "grad_norm": 1.0, "learning_rate": 0.0003913245685105834, "loss": 4.8683, "mean_token_accuracy": 0.23330911844968796, "num_tokens": 77336471.0, "step": 33755 }, { "entropy": 5.397892093658447, "epoch": 3.3372874654013445, "grad_norm": 1.0703125, "learning_rate": 0.00039129435932945094, "loss": 4.952, "mean_token_accuracy": 0.22048970311880112, "num_tokens": 77346947.0, "step": 33760 }, { "entropy": 5.382558059692383, "epoch": 3.3377817319098457, "grad_norm": 1.0703125, "learning_rate": 0.0003912641472874593, "loss": 4.8554, "mean_token_accuracy": 0.23307389318943023, "num_tokens": 77357995.0, "step": 33765 }, { "entropy": 5.32887225151062, "epoch": 3.338275998418347, "grad_norm": 1.0859375, "learning_rate": 0.0003912339323853516, "loss": 4.8779, "mean_token_accuracy": 0.22487757205963135, "num_tokens": 77368910.0, "step": 33770 }, { "entropy": 5.428550100326538, "epoch": 3.3387702649268487, "grad_norm": 0.95703125, "learning_rate": 0.00039120371462387105, "loss": 4.9732, "mean_token_accuracy": 0.21811838150024415, "num_tokens": 77381010.0, "step": 33775 }, { "entropy": 5.406692600250244, "epoch": 3.33926453143535, "grad_norm": 1.0234375, "learning_rate": 0.00039117349400376116, "loss": 5.0094, "mean_token_accuracy": 0.21354680955410005, "num_tokens": 77392182.0, "step": 33780 }, { "entropy": 5.436107158660889, "epoch": 3.339758797943851, "grad_norm": 1.0078125, "learning_rate": 0.00039114327052576525, "loss": 5.0195, "mean_token_accuracy": 0.21025025546550752, "num_tokens": 77403574.0, "step": 33785 }, { "entropy": 5.277062273025512, "epoch": 3.3402530644523525, "grad_norm": 1.046875, "learning_rate": 0.00039111304419062686, "loss": 4.7949, "mean_token_accuracy": 0.22950299829244614, "num_tokens": 77414941.0, "step": 33790 }, { "entropy": 5.388889360427856, "epoch": 3.340747330960854, "grad_norm": 0.953125, "learning_rate": 0.0003910828149990897, "loss": 4.9596, "mean_token_accuracy": 0.21883899569511414, "num_tokens": 77426361.0, "step": 33795 }, { "entropy": 5.398156595230103, "epoch": 3.3412415974693555, "grad_norm": 1.0078125, "learning_rate": 0.00039105258295189717, "loss": 4.9743, "mean_token_accuracy": 0.22055567502975465, "num_tokens": 77438366.0, "step": 33800 }, { "entropy": 5.355645084381104, "epoch": 3.3417358639778567, "grad_norm": 1.1328125, "learning_rate": 0.00039102234804979307, "loss": 4.8865, "mean_token_accuracy": 0.23479216694831848, "num_tokens": 77448662.0, "step": 33805 }, { "entropy": 5.353066778182983, "epoch": 3.3422301304863584, "grad_norm": 1.0390625, "learning_rate": 0.0003909921102935213, "loss": 4.8408, "mean_token_accuracy": 0.23334318846464158, "num_tokens": 77459806.0, "step": 33810 }, { "entropy": 5.3951879978179935, "epoch": 3.3427243969948597, "grad_norm": 1.0546875, "learning_rate": 0.00039096186968382555, "loss": 4.9798, "mean_token_accuracy": 0.22152237296104432, "num_tokens": 77470571.0, "step": 33815 }, { "entropy": 5.373051738739013, "epoch": 3.343218663503361, "grad_norm": 1.0, "learning_rate": 0.0003909316262214498, "loss": 4.9064, "mean_token_accuracy": 0.22443777173757554, "num_tokens": 77483365.0, "step": 33820 }, { "entropy": 5.3990129947662355, "epoch": 3.343712930011862, "grad_norm": 1.0546875, "learning_rate": 0.00039090137990713817, "loss": 4.8675, "mean_token_accuracy": 0.22349267452955246, "num_tokens": 77493710.0, "step": 33825 }, { "entropy": 5.3637778759002686, "epoch": 3.344207196520364, "grad_norm": 1.0625, "learning_rate": 0.0003908711307416345, "loss": 4.8706, "mean_token_accuracy": 0.22645164132118226, "num_tokens": 77505153.0, "step": 33830 }, { "entropy": 5.434598207473755, "epoch": 3.344701463028865, "grad_norm": 1.0078125, "learning_rate": 0.0003908408787256831, "loss": 5.0168, "mean_token_accuracy": 0.21272971630096435, "num_tokens": 77516370.0, "step": 33835 }, { "entropy": 5.433268594741821, "epoch": 3.3451957295373664, "grad_norm": 1.0078125, "learning_rate": 0.0003908106238600281, "loss": 4.9967, "mean_token_accuracy": 0.22129547744989395, "num_tokens": 77526660.0, "step": 33840 }, { "entropy": 5.29403166770935, "epoch": 3.345689996045868, "grad_norm": 0.99609375, "learning_rate": 0.00039078036614541376, "loss": 4.8235, "mean_token_accuracy": 0.23171166330575943, "num_tokens": 77538112.0, "step": 33845 }, { "entropy": 5.2873132705688475, "epoch": 3.3461842625543694, "grad_norm": 1.1171875, "learning_rate": 0.0003907501055825845, "loss": 4.8856, "mean_token_accuracy": 0.22381557673215866, "num_tokens": 77548807.0, "step": 33850 }, { "entropy": 5.308782863616943, "epoch": 3.3466785290628707, "grad_norm": 1.015625, "learning_rate": 0.00039071984217228464, "loss": 4.906, "mean_token_accuracy": 0.22866106629371644, "num_tokens": 77559803.0, "step": 33855 }, { "entropy": 5.415783977508545, "epoch": 3.347172795571372, "grad_norm": 1.0, "learning_rate": 0.00039068957591525873, "loss": 4.9141, "mean_token_accuracy": 0.22099430561065675, "num_tokens": 77570973.0, "step": 33860 }, { "entropy": 5.391210556030273, "epoch": 3.3476670620798736, "grad_norm": 1.0546875, "learning_rate": 0.0003906593068122513, "loss": 4.949, "mean_token_accuracy": 0.21853359639644623, "num_tokens": 77583614.0, "step": 33865 }, { "entropy": 5.367411375045776, "epoch": 3.348161328588375, "grad_norm": 1.078125, "learning_rate": 0.000390629034864007, "loss": 4.9546, "mean_token_accuracy": 0.22670968621969223, "num_tokens": 77595086.0, "step": 33870 }, { "entropy": 5.404358053207398, "epoch": 3.348655595096876, "grad_norm": 1.125, "learning_rate": 0.00039059876007127044, "loss": 4.9249, "mean_token_accuracy": 0.2182835668325424, "num_tokens": 77605492.0, "step": 33875 }, { "entropy": 5.354220771789551, "epoch": 3.349149861605378, "grad_norm": 0.98828125, "learning_rate": 0.0003905684824347865, "loss": 4.8997, "mean_token_accuracy": 0.22284364104270935, "num_tokens": 77618123.0, "step": 33880 }, { "entropy": 5.420915365219116, "epoch": 3.349644128113879, "grad_norm": 0.99609375, "learning_rate": 0.0003905382019553, "loss": 4.9492, "mean_token_accuracy": 0.22250049859285354, "num_tokens": 77630733.0, "step": 33885 }, { "entropy": 5.391465473175049, "epoch": 3.3501383946223804, "grad_norm": 1.0703125, "learning_rate": 0.00039050791863355573, "loss": 4.9675, "mean_token_accuracy": 0.22079341262578964, "num_tokens": 77641337.0, "step": 33890 }, { "entropy": 5.396787834167481, "epoch": 3.3506326611308817, "grad_norm": 0.9765625, "learning_rate": 0.00039047763247029876, "loss": 4.9635, "mean_token_accuracy": 0.2206554263830185, "num_tokens": 77652567.0, "step": 33895 }, { "entropy": 5.422830247879029, "epoch": 3.351126927639383, "grad_norm": 1.0, "learning_rate": 0.0003904473434662741, "loss": 4.9973, "mean_token_accuracy": 0.21841063648462294, "num_tokens": 77664146.0, "step": 33900 }, { "entropy": 5.452880239486694, "epoch": 3.3516211941478846, "grad_norm": 1.0703125, "learning_rate": 0.0003904170516222269, "loss": 4.9461, "mean_token_accuracy": 0.22160077840089798, "num_tokens": 77675406.0, "step": 33905 }, { "entropy": 5.348075723648071, "epoch": 3.352115460656386, "grad_norm": 1.03125, "learning_rate": 0.0003903867569389024, "loss": 4.9357, "mean_token_accuracy": 0.2238214209675789, "num_tokens": 77686846.0, "step": 33910 }, { "entropy": 5.387111520767212, "epoch": 3.352609727164887, "grad_norm": 0.9921875, "learning_rate": 0.0003903564594170457, "loss": 4.9086, "mean_token_accuracy": 0.21831238269805908, "num_tokens": 77697136.0, "step": 33915 }, { "entropy": 5.49753589630127, "epoch": 3.353103993673389, "grad_norm": 1.03125, "learning_rate": 0.00039032615905740226, "loss": 4.994, "mean_token_accuracy": 0.21247973293066025, "num_tokens": 77708056.0, "step": 33920 }, { "entropy": 5.361322355270386, "epoch": 3.35359826018189, "grad_norm": 1.0234375, "learning_rate": 0.0003902958558607173, "loss": 4.9409, "mean_token_accuracy": 0.21844601929187774, "num_tokens": 77718582.0, "step": 33925 }, { "entropy": 5.379973840713501, "epoch": 3.3540925266903914, "grad_norm": 1.0625, "learning_rate": 0.0003902655498277366, "loss": 4.9328, "mean_token_accuracy": 0.2242838129401207, "num_tokens": 77729388.0, "step": 33930 }, { "entropy": 5.417075109481812, "epoch": 3.3545867931988926, "grad_norm": 1.0234375, "learning_rate": 0.00039023524095920534, "loss": 4.8292, "mean_token_accuracy": 0.22499683797359465, "num_tokens": 77739952.0, "step": 33935 }, { "entropy": 5.302096176147461, "epoch": 3.3550810597073943, "grad_norm": 0.953125, "learning_rate": 0.0003902049292558693, "loss": 4.9108, "mean_token_accuracy": 0.22599294781684875, "num_tokens": 77752415.0, "step": 33940 }, { "entropy": 5.293969774246216, "epoch": 3.3555753262158956, "grad_norm": 1.0859375, "learning_rate": 0.00039017461471847417, "loss": 4.8217, "mean_token_accuracy": 0.22671417891979218, "num_tokens": 77764102.0, "step": 33945 }, { "entropy": 5.359054756164551, "epoch": 3.356069592724397, "grad_norm": 1.0703125, "learning_rate": 0.0003901442973477656, "loss": 4.9089, "mean_token_accuracy": 0.22155204117298127, "num_tokens": 77774908.0, "step": 33950 }, { "entropy": 5.415456485748291, "epoch": 3.3565638592328986, "grad_norm": 1.0625, "learning_rate": 0.0003901139771444894, "loss": 4.9841, "mean_token_accuracy": 0.2191945418715477, "num_tokens": 77785913.0, "step": 33955 }, { "entropy": 5.369298124313355, "epoch": 3.3570581257414, "grad_norm": 0.95703125, "learning_rate": 0.0003900836541093916, "loss": 4.9224, "mean_token_accuracy": 0.2211829200387001, "num_tokens": 77797539.0, "step": 33960 }, { "entropy": 5.3753527164459225, "epoch": 3.357552392249901, "grad_norm": 0.94140625, "learning_rate": 0.000390053328243218, "loss": 4.9391, "mean_token_accuracy": 0.2193540796637535, "num_tokens": 77809777.0, "step": 33965 }, { "entropy": 5.378765869140625, "epoch": 3.3580466587584024, "grad_norm": 1.0859375, "learning_rate": 0.0003900229995467147, "loss": 4.864, "mean_token_accuracy": 0.22592062056064605, "num_tokens": 77820401.0, "step": 33970 }, { "entropy": 5.371637344360352, "epoch": 3.358540925266904, "grad_norm": 1.1328125, "learning_rate": 0.0003899926680206278, "loss": 4.8979, "mean_token_accuracy": 0.2189282774925232, "num_tokens": 77832235.0, "step": 33975 }, { "entropy": 5.375926876068116, "epoch": 3.3590351917754053, "grad_norm": 0.94140625, "learning_rate": 0.00038996233366570335, "loss": 4.9442, "mean_token_accuracy": 0.22109284549951552, "num_tokens": 77843938.0, "step": 33980 }, { "entropy": 5.402053451538086, "epoch": 3.3595294582839066, "grad_norm": 1.109375, "learning_rate": 0.00038993199648268775, "loss": 4.937, "mean_token_accuracy": 0.21671762466430664, "num_tokens": 77853921.0, "step": 33985 }, { "entropy": 5.311585330963135, "epoch": 3.3600237247924083, "grad_norm": 1.078125, "learning_rate": 0.00038990165647232713, "loss": 4.7784, "mean_token_accuracy": 0.23718335181474687, "num_tokens": 77864661.0, "step": 33990 }, { "entropy": 5.517502069473267, "epoch": 3.3605179913009096, "grad_norm": 1.0625, "learning_rate": 0.0003898713136353679, "loss": 5.0692, "mean_token_accuracy": 0.20248904824256897, "num_tokens": 77875743.0, "step": 33995 }, { "entropy": 5.370690107345581, "epoch": 3.361012257809411, "grad_norm": 1.0078125, "learning_rate": 0.0003898409679725566, "loss": 4.9169, "mean_token_accuracy": 0.2217498689889908, "num_tokens": 77888575.0, "step": 34000 }, { "entropy": 5.487114524841308, "epoch": 3.361506524317912, "grad_norm": 1.0625, "learning_rate": 0.0003898106194846396, "loss": 5.0735, "mean_token_accuracy": 0.21143750697374344, "num_tokens": 77901212.0, "step": 34005 }, { "entropy": 5.352934122085571, "epoch": 3.362000790826414, "grad_norm": 1.0703125, "learning_rate": 0.00038978026817236365, "loss": 4.8812, "mean_token_accuracy": 0.2320416271686554, "num_tokens": 77911905.0, "step": 34010 }, { "entropy": 5.425566053390503, "epoch": 3.362495057334915, "grad_norm": 0.96484375, "learning_rate": 0.00038974991403647536, "loss": 4.9569, "mean_token_accuracy": 0.21426244229078292, "num_tokens": 77923710.0, "step": 34015 }, { "entropy": 5.412097549438476, "epoch": 3.3629893238434163, "grad_norm": 1.0859375, "learning_rate": 0.00038971955707772126, "loss": 4.9209, "mean_token_accuracy": 0.22057076096534728, "num_tokens": 77934501.0, "step": 34020 }, { "entropy": 5.329768657684326, "epoch": 3.3634835903519176, "grad_norm": 1.0625, "learning_rate": 0.0003896891972968482, "loss": 4.886, "mean_token_accuracy": 0.22223179936408996, "num_tokens": 77944512.0, "step": 34025 }, { "entropy": 5.361877822875977, "epoch": 3.3639778568604193, "grad_norm": 1.0234375, "learning_rate": 0.0003896588346946033, "loss": 4.8644, "mean_token_accuracy": 0.23420026749372483, "num_tokens": 77955253.0, "step": 34030 }, { "entropy": 5.318459177017212, "epoch": 3.3644721233689205, "grad_norm": 1.0546875, "learning_rate": 0.00038962846927173306, "loss": 4.8199, "mean_token_accuracy": 0.2307724416255951, "num_tokens": 77967193.0, "step": 34035 }, { "entropy": 5.354242420196533, "epoch": 3.364966389877422, "grad_norm": 1.078125, "learning_rate": 0.0003895981010289848, "loss": 4.9987, "mean_token_accuracy": 0.21727477759122849, "num_tokens": 77977105.0, "step": 34040 }, { "entropy": 5.384107065200806, "epoch": 3.365460656385923, "grad_norm": 1.03125, "learning_rate": 0.00038956772996710554, "loss": 4.9492, "mean_token_accuracy": 0.2220601335167885, "num_tokens": 77989517.0, "step": 34045 }, { "entropy": 5.45135498046875, "epoch": 3.3659549228944248, "grad_norm": 0.93359375, "learning_rate": 0.00038953735608684216, "loss": 4.9278, "mean_token_accuracy": 0.2151881605386734, "num_tokens": 78000797.0, "step": 34050 }, { "entropy": 5.275989770889282, "epoch": 3.366449189402926, "grad_norm": 0.96875, "learning_rate": 0.0003895069793889422, "loss": 4.7745, "mean_token_accuracy": 0.2426856517791748, "num_tokens": 78012470.0, "step": 34055 }, { "entropy": 5.353229951858521, "epoch": 3.3669434559114273, "grad_norm": 1.1171875, "learning_rate": 0.0003894765998741528, "loss": 4.8679, "mean_token_accuracy": 0.22156235277652742, "num_tokens": 78023774.0, "step": 34060 }, { "entropy": 5.3370583057403564, "epoch": 3.367437722419929, "grad_norm": 0.953125, "learning_rate": 0.0003894462175432212, "loss": 4.968, "mean_token_accuracy": 0.21899116039276123, "num_tokens": 78035181.0, "step": 34065 }, { "entropy": 5.415081739425659, "epoch": 3.3679319889284303, "grad_norm": 1.046875, "learning_rate": 0.00038941583239689495, "loss": 4.925, "mean_token_accuracy": 0.21794160455465317, "num_tokens": 78045728.0, "step": 34070 }, { "entropy": 5.439558029174805, "epoch": 3.3684262554369315, "grad_norm": 1.0078125, "learning_rate": 0.00038938544443592146, "loss": 4.9613, "mean_token_accuracy": 0.21791402697563172, "num_tokens": 78056675.0, "step": 34075 }, { "entropy": 5.341196537017822, "epoch": 3.368920521945433, "grad_norm": 1.015625, "learning_rate": 0.0003893550536610483, "loss": 4.8371, "mean_token_accuracy": 0.23003219366073607, "num_tokens": 78067686.0, "step": 34080 }, { "entropy": 5.298730659484863, "epoch": 3.3694147884539345, "grad_norm": 1.0859375, "learning_rate": 0.000389324660073023, "loss": 4.884, "mean_token_accuracy": 0.23259907215833664, "num_tokens": 78078063.0, "step": 34085 }, { "entropy": 5.44101128578186, "epoch": 3.3699090549624358, "grad_norm": 1.0546875, "learning_rate": 0.0003892942636725934, "loss": 5.0217, "mean_token_accuracy": 0.2214057818055153, "num_tokens": 78088729.0, "step": 34090 }, { "entropy": 5.28401370048523, "epoch": 3.370403321470937, "grad_norm": 1.0546875, "learning_rate": 0.0003892638644605072, "loss": 4.8409, "mean_token_accuracy": 0.23488483130931853, "num_tokens": 78100468.0, "step": 34095 }, { "entropy": 5.355393648147583, "epoch": 3.3708975879794387, "grad_norm": 1.1015625, "learning_rate": 0.00038923346243751217, "loss": 4.9442, "mean_token_accuracy": 0.22354098856449128, "num_tokens": 78111911.0, "step": 34100 }, { "entropy": 5.3077263832092285, "epoch": 3.37139185448794, "grad_norm": 1.1328125, "learning_rate": 0.00038920305760435626, "loss": 4.829, "mean_token_accuracy": 0.22860943973064424, "num_tokens": 78122411.0, "step": 34105 }, { "entropy": 5.45547251701355, "epoch": 3.3718861209964412, "grad_norm": 1.03125, "learning_rate": 0.0003891726499617874, "loss": 4.9935, "mean_token_accuracy": 0.21136883348226548, "num_tokens": 78134313.0, "step": 34110 }, { "entropy": 5.262450790405273, "epoch": 3.3723803875049425, "grad_norm": 1.1328125, "learning_rate": 0.0003891422395105536, "loss": 4.7271, "mean_token_accuracy": 0.23711652755737306, "num_tokens": 78144753.0, "step": 34115 }, { "entropy": 5.271003150939942, "epoch": 3.372874654013444, "grad_norm": 0.99609375, "learning_rate": 0.00038911182625140305, "loss": 4.8246, "mean_token_accuracy": 0.23160648196935654, "num_tokens": 78154772.0, "step": 34120 }, { "entropy": 5.332530736923218, "epoch": 3.3733689205219455, "grad_norm": 0.984375, "learning_rate": 0.00038908141018508387, "loss": 4.8975, "mean_token_accuracy": 0.23049889355897904, "num_tokens": 78166876.0, "step": 34125 }, { "entropy": 5.381187486648559, "epoch": 3.3738631870304467, "grad_norm": 1.1015625, "learning_rate": 0.00038905099131234433, "loss": 4.8825, "mean_token_accuracy": 0.23446121364831923, "num_tokens": 78177530.0, "step": 34130 }, { "entropy": 5.332113265991211, "epoch": 3.3743574535389484, "grad_norm": 0.9765625, "learning_rate": 0.00038902056963393265, "loss": 4.8659, "mean_token_accuracy": 0.22584918290376663, "num_tokens": 78187986.0, "step": 34135 }, { "entropy": 5.305330753326416, "epoch": 3.3748517200474497, "grad_norm": 0.95703125, "learning_rate": 0.00038899014515059735, "loss": 4.8961, "mean_token_accuracy": 0.22376441061496735, "num_tokens": 78199874.0, "step": 34140 }, { "entropy": 5.3618138313293455, "epoch": 3.375345986555951, "grad_norm": 1.0234375, "learning_rate": 0.0003889597178630867, "loss": 4.8785, "mean_token_accuracy": 0.22781001776456833, "num_tokens": 78210995.0, "step": 34145 }, { "entropy": 5.36954779624939, "epoch": 3.3758402530644522, "grad_norm": 0.98828125, "learning_rate": 0.0003889292877721493, "loss": 4.8542, "mean_token_accuracy": 0.22493356168270112, "num_tokens": 78221792.0, "step": 34150 }, { "entropy": 5.285779666900635, "epoch": 3.3763345195729535, "grad_norm": 1.015625, "learning_rate": 0.00038889885487853384, "loss": 4.8771, "mean_token_accuracy": 0.2388073295354843, "num_tokens": 78232799.0, "step": 34155 }, { "entropy": 5.412586688995361, "epoch": 3.376828786081455, "grad_norm": 1.046875, "learning_rate": 0.0003888684191829889, "loss": 4.9448, "mean_token_accuracy": 0.2174442321062088, "num_tokens": 78243784.0, "step": 34160 }, { "entropy": 5.3730456829071045, "epoch": 3.3773230525899565, "grad_norm": 1.078125, "learning_rate": 0.00038883798068626305, "loss": 4.8222, "mean_token_accuracy": 0.23194272667169571, "num_tokens": 78255161.0, "step": 34165 }, { "entropy": 5.280057096481324, "epoch": 3.3778173190984577, "grad_norm": 1.03125, "learning_rate": 0.00038880753938910523, "loss": 4.86, "mean_token_accuracy": 0.22354026287794113, "num_tokens": 78266462.0, "step": 34170 }, { "entropy": 5.3405842781066895, "epoch": 3.3783115856069594, "grad_norm": 1.0859375, "learning_rate": 0.00038877709529226446, "loss": 4.9237, "mean_token_accuracy": 0.21859470009803772, "num_tokens": 78278136.0, "step": 34175 }, { "entropy": 5.420118093490601, "epoch": 3.3788058521154607, "grad_norm": 0.9375, "learning_rate": 0.0003887466483964893, "loss": 4.9368, "mean_token_accuracy": 0.215442955493927, "num_tokens": 78290046.0, "step": 34180 }, { "entropy": 5.375010347366333, "epoch": 3.379300118623962, "grad_norm": 0.9453125, "learning_rate": 0.00038871619870252904, "loss": 4.8909, "mean_token_accuracy": 0.22480558604002, "num_tokens": 78301636.0, "step": 34185 }, { "entropy": 5.382464838027954, "epoch": 3.379794385132463, "grad_norm": 1.0390625, "learning_rate": 0.00038868574621113265, "loss": 4.9007, "mean_token_accuracy": 0.22122861444950104, "num_tokens": 78313326.0, "step": 34190 }, { "entropy": 5.392512369155884, "epoch": 3.380288651640965, "grad_norm": 0.90234375, "learning_rate": 0.0003886552909230492, "loss": 4.9613, "mean_token_accuracy": 0.2138638973236084, "num_tokens": 78325214.0, "step": 34195 }, { "entropy": 5.325533723831176, "epoch": 3.380782918149466, "grad_norm": 1.03125, "learning_rate": 0.000388624832839028, "loss": 4.8566, "mean_token_accuracy": 0.22787874937057495, "num_tokens": 78336461.0, "step": 34200 }, { "entropy": 5.374352645874024, "epoch": 3.3812771846579674, "grad_norm": 1.078125, "learning_rate": 0.00038859437195981833, "loss": 4.9311, "mean_token_accuracy": 0.22009425163269042, "num_tokens": 78347852.0, "step": 34205 }, { "entropy": 5.428445720672608, "epoch": 3.381771451166469, "grad_norm": 1.1015625, "learning_rate": 0.00038856390828616945, "loss": 4.9114, "mean_token_accuracy": 0.21112205386161803, "num_tokens": 78358736.0, "step": 34210 }, { "entropy": 5.468721151351929, "epoch": 3.3822657176749704, "grad_norm": 1.0625, "learning_rate": 0.0003885334418188308, "loss": 5.0686, "mean_token_accuracy": 0.21147384643554687, "num_tokens": 78370842.0, "step": 34215 }, { "entropy": 5.297071504592895, "epoch": 3.3827599841834717, "grad_norm": 1.015625, "learning_rate": 0.00038850297255855186, "loss": 4.8045, "mean_token_accuracy": 0.22888566106557845, "num_tokens": 78382159.0, "step": 34220 }, { "entropy": 5.385731363296509, "epoch": 3.383254250691973, "grad_norm": 1.09375, "learning_rate": 0.00038847250050608217, "loss": 5.0142, "mean_token_accuracy": 0.21420636773109436, "num_tokens": 78392130.0, "step": 34225 }, { "entropy": 5.373178958892822, "epoch": 3.3837485172004746, "grad_norm": 1.03125, "learning_rate": 0.00038844202566217146, "loss": 4.9099, "mean_token_accuracy": 0.22126138508319854, "num_tokens": 78403271.0, "step": 34230 }, { "entropy": 5.392863702774048, "epoch": 3.384242783708976, "grad_norm": 0.984375, "learning_rate": 0.00038841154802756925, "loss": 4.9223, "mean_token_accuracy": 0.21964584290981293, "num_tokens": 78414621.0, "step": 34235 }, { "entropy": 5.493626737594605, "epoch": 3.384737050217477, "grad_norm": 0.8984375, "learning_rate": 0.00038838106760302537, "loss": 5.0524, "mean_token_accuracy": 0.21165242195129394, "num_tokens": 78427708.0, "step": 34240 }, { "entropy": 5.383589410781861, "epoch": 3.385231316725979, "grad_norm": 1.0, "learning_rate": 0.00038835058438928965, "loss": 4.8728, "mean_token_accuracy": 0.2254788801074028, "num_tokens": 78438736.0, "step": 34245 }, { "entropy": 5.31712965965271, "epoch": 3.38572558323448, "grad_norm": 1.1171875, "learning_rate": 0.000388320098387112, "loss": 4.9109, "mean_token_accuracy": 0.22821611613035203, "num_tokens": 78449118.0, "step": 34250 }, { "entropy": 5.398679590225219, "epoch": 3.3862198497429814, "grad_norm": 1.0703125, "learning_rate": 0.00038828960959724225, "loss": 4.9621, "mean_token_accuracy": 0.2192313238978386, "num_tokens": 78460027.0, "step": 34255 }, { "entropy": 5.327192926406861, "epoch": 3.3867141162514827, "grad_norm": 0.98046875, "learning_rate": 0.00038825911802043057, "loss": 4.8343, "mean_token_accuracy": 0.22823193818330764, "num_tokens": 78471251.0, "step": 34260 }, { "entropy": 5.385414695739746, "epoch": 3.3872083827599844, "grad_norm": 1.046875, "learning_rate": 0.00038822862365742704, "loss": 4.9488, "mean_token_accuracy": 0.2186719924211502, "num_tokens": 78482042.0, "step": 34265 }, { "entropy": 5.330732965469361, "epoch": 3.3877026492684856, "grad_norm": 0.99609375, "learning_rate": 0.0003881981265089818, "loss": 4.8427, "mean_token_accuracy": 0.2274144247174263, "num_tokens": 78492941.0, "step": 34270 }, { "entropy": 5.3614898204803465, "epoch": 3.388196915776987, "grad_norm": 0.984375, "learning_rate": 0.0003881676265758451, "loss": 4.9176, "mean_token_accuracy": 0.21566414088010788, "num_tokens": 78506108.0, "step": 34275 }, { "entropy": 5.390552663803101, "epoch": 3.388691182285488, "grad_norm": 0.96875, "learning_rate": 0.00038813712385876714, "loss": 4.8909, "mean_token_accuracy": 0.22801575660705567, "num_tokens": 78517784.0, "step": 34280 }, { "entropy": 5.361949157714844, "epoch": 3.38918544879399, "grad_norm": 1.1328125, "learning_rate": 0.00038810661835849845, "loss": 4.951, "mean_token_accuracy": 0.21690807938575746, "num_tokens": 78528795.0, "step": 34285 }, { "entropy": 5.368957281112671, "epoch": 3.389679715302491, "grad_norm": 0.89453125, "learning_rate": 0.00038807611007578947, "loss": 4.8305, "mean_token_accuracy": 0.23518289476633072, "num_tokens": 78540724.0, "step": 34290 }, { "entropy": 5.4847158908844, "epoch": 3.3901739818109924, "grad_norm": 1.1015625, "learning_rate": 0.0003880455990113905, "loss": 5.0081, "mean_token_accuracy": 0.21639263778924941, "num_tokens": 78552569.0, "step": 34295 }, { "entropy": 5.361520385742187, "epoch": 3.3906682483194936, "grad_norm": 1.0234375, "learning_rate": 0.0003880150851660524, "loss": 4.9444, "mean_token_accuracy": 0.22136489003896714, "num_tokens": 78564785.0, "step": 34300 }, { "entropy": 5.3645061492919925, "epoch": 3.3911625148279954, "grad_norm": 1.0234375, "learning_rate": 0.00038798456854052555, "loss": 4.9401, "mean_token_accuracy": 0.2191367119550705, "num_tokens": 78576323.0, "step": 34305 }, { "entropy": 5.4595530986785885, "epoch": 3.3916567813364966, "grad_norm": 1.078125, "learning_rate": 0.00038795404913556083, "loss": 4.996, "mean_token_accuracy": 0.2143404632806778, "num_tokens": 78586978.0, "step": 34310 }, { "entropy": 5.390563440322876, "epoch": 3.392151047844998, "grad_norm": 1.0078125, "learning_rate": 0.00038792352695190895, "loss": 4.9493, "mean_token_accuracy": 0.22530075609683992, "num_tokens": 78597591.0, "step": 34315 }, { "entropy": 5.368131828308106, "epoch": 3.3926453143534996, "grad_norm": 1.09375, "learning_rate": 0.0003878930019903209, "loss": 4.8681, "mean_token_accuracy": 0.22552868723869324, "num_tokens": 78608189.0, "step": 34320 }, { "entropy": 5.395864534378052, "epoch": 3.393139580862001, "grad_norm": 1.125, "learning_rate": 0.0003878624742515474, "loss": 4.9676, "mean_token_accuracy": 0.22675816267728804, "num_tokens": 78620170.0, "step": 34325 }, { "entropy": 5.408623838424683, "epoch": 3.393633847370502, "grad_norm": 1.09375, "learning_rate": 0.00038783194373633956, "loss": 4.9327, "mean_token_accuracy": 0.22023035883903502, "num_tokens": 78632423.0, "step": 34330 }, { "entropy": 5.380444431304932, "epoch": 3.3941281138790034, "grad_norm": 1.0625, "learning_rate": 0.00038780141044544836, "loss": 4.9527, "mean_token_accuracy": 0.22786918729543687, "num_tokens": 78644138.0, "step": 34335 }, { "entropy": 5.3805702209472654, "epoch": 3.394622380387505, "grad_norm": 0.94140625, "learning_rate": 0.000387770874379625, "loss": 4.9427, "mean_token_accuracy": 0.21810621470212938, "num_tokens": 78655659.0, "step": 34340 }, { "entropy": 5.302137327194214, "epoch": 3.3951166468960063, "grad_norm": 0.98046875, "learning_rate": 0.0003877403355396206, "loss": 4.8884, "mean_token_accuracy": 0.22721552848815918, "num_tokens": 78665625.0, "step": 34345 }, { "entropy": 5.377222537994385, "epoch": 3.3956109134045076, "grad_norm": 1.015625, "learning_rate": 0.0003877097939261865, "loss": 4.919, "mean_token_accuracy": 0.22234344482421875, "num_tokens": 78677253.0, "step": 34350 }, { "entropy": 5.43311448097229, "epoch": 3.3961051799130093, "grad_norm": 1.0, "learning_rate": 0.00038767924954007387, "loss": 4.9034, "mean_token_accuracy": 0.22785402536392213, "num_tokens": 78688574.0, "step": 34355 }, { "entropy": 5.361625242233276, "epoch": 3.3965994464215106, "grad_norm": 0.96875, "learning_rate": 0.0003876487023820343, "loss": 4.8596, "mean_token_accuracy": 0.2304435685276985, "num_tokens": 78700537.0, "step": 34360 }, { "entropy": 5.290830659866333, "epoch": 3.397093712930012, "grad_norm": 1.078125, "learning_rate": 0.00038761815245281925, "loss": 4.8416, "mean_token_accuracy": 0.23075627982616426, "num_tokens": 78710257.0, "step": 34365 }, { "entropy": 5.364655303955078, "epoch": 3.397587979438513, "grad_norm": 1.0390625, "learning_rate": 0.00038758759975318006, "loss": 4.8775, "mean_token_accuracy": 0.2282530203461647, "num_tokens": 78722503.0, "step": 34370 }, { "entropy": 5.355743408203125, "epoch": 3.398082245947015, "grad_norm": 1.03125, "learning_rate": 0.0003875570442838686, "loss": 4.9273, "mean_token_accuracy": 0.22537087351083757, "num_tokens": 78734476.0, "step": 34375 }, { "entropy": 5.4768712520599365, "epoch": 3.398576512455516, "grad_norm": 1.0703125, "learning_rate": 0.0003875264860456362, "loss": 4.9847, "mean_token_accuracy": 0.2231973811984062, "num_tokens": 78745685.0, "step": 34380 }, { "entropy": 5.444960737228394, "epoch": 3.3990707789640173, "grad_norm": 0.9453125, "learning_rate": 0.00038749592503923484, "loss": 4.9647, "mean_token_accuracy": 0.21849963963031768, "num_tokens": 78758977.0, "step": 34385 }, { "entropy": 5.344271469116211, "epoch": 3.399565045472519, "grad_norm": 0.96484375, "learning_rate": 0.0003874653612654164, "loss": 4.893, "mean_token_accuracy": 0.2171176090836525, "num_tokens": 78770702.0, "step": 34390 }, { "entropy": 5.367283582687378, "epoch": 3.4000593119810203, "grad_norm": 1.078125, "learning_rate": 0.0003874347947249325, "loss": 4.9295, "mean_token_accuracy": 0.21808202415704728, "num_tokens": 78781763.0, "step": 34395 }, { "entropy": 5.442790508270264, "epoch": 3.4005535784895216, "grad_norm": 1.046875, "learning_rate": 0.00038740422541853523, "loss": 4.9304, "mean_token_accuracy": 0.22123486399650574, "num_tokens": 78792341.0, "step": 34400 }, { "entropy": 5.375040102005005, "epoch": 3.401047844998023, "grad_norm": 0.97265625, "learning_rate": 0.00038737365334697656, "loss": 4.8727, "mean_token_accuracy": 0.2255553662776947, "num_tokens": 78803947.0, "step": 34405 }, { "entropy": 5.2559435844421385, "epoch": 3.401542111506524, "grad_norm": 1.015625, "learning_rate": 0.00038734307851100863, "loss": 4.7495, "mean_token_accuracy": 0.23775913566350937, "num_tokens": 78815503.0, "step": 34410 }, { "entropy": 5.3592897891998295, "epoch": 3.402036378015026, "grad_norm": 1.1015625, "learning_rate": 0.0003873125009113835, "loss": 4.9463, "mean_token_accuracy": 0.2192987620830536, "num_tokens": 78826206.0, "step": 34415 }, { "entropy": 5.3875932693481445, "epoch": 3.402530644523527, "grad_norm": 1.0546875, "learning_rate": 0.00038728192054885346, "loss": 4.8755, "mean_token_accuracy": 0.22509803175926207, "num_tokens": 78837472.0, "step": 34420 }, { "entropy": 5.453868627548218, "epoch": 3.4030249110320283, "grad_norm": 1.0, "learning_rate": 0.0003872513374241707, "loss": 5.0213, "mean_token_accuracy": 0.21520039886236192, "num_tokens": 78848005.0, "step": 34425 }, { "entropy": 5.37598614692688, "epoch": 3.40351917754053, "grad_norm": 1.015625, "learning_rate": 0.00038722075153808764, "loss": 4.8834, "mean_token_accuracy": 0.22352307438850402, "num_tokens": 78859577.0, "step": 34430 }, { "entropy": 5.373977565765381, "epoch": 3.4040134440490313, "grad_norm": 1.0703125, "learning_rate": 0.0003871901628913568, "loss": 4.9316, "mean_token_accuracy": 0.21942528188228608, "num_tokens": 78871527.0, "step": 34435 }, { "entropy": 5.359360313415527, "epoch": 3.4045077105575325, "grad_norm": 1.015625, "learning_rate": 0.0003871595714847304, "loss": 4.918, "mean_token_accuracy": 0.22698676586151123, "num_tokens": 78882557.0, "step": 34440 }, { "entropy": 5.340625, "epoch": 3.405001977066034, "grad_norm": 1.0625, "learning_rate": 0.00038712897731896126, "loss": 4.8864, "mean_token_accuracy": 0.22179235517978668, "num_tokens": 78893191.0, "step": 34445 }, { "entropy": 5.380088853836059, "epoch": 3.4054962435745355, "grad_norm": 1.0703125, "learning_rate": 0.0003870983803948017, "loss": 4.9413, "mean_token_accuracy": 0.22095131874084473, "num_tokens": 78904397.0, "step": 34450 }, { "entropy": 5.421801137924194, "epoch": 3.4059905100830368, "grad_norm": 0.95703125, "learning_rate": 0.0003870677807130047, "loss": 4.9357, "mean_token_accuracy": 0.2246629536151886, "num_tokens": 78916765.0, "step": 34455 }, { "entropy": 5.434466028213501, "epoch": 3.406484776591538, "grad_norm": 0.99609375, "learning_rate": 0.000387037178274323, "loss": 4.8977, "mean_token_accuracy": 0.21882708221673966, "num_tokens": 78929745.0, "step": 34460 }, { "entropy": 5.350763845443725, "epoch": 3.4069790431000397, "grad_norm": 0.96875, "learning_rate": 0.00038700657307950926, "loss": 4.8943, "mean_token_accuracy": 0.2250893533229828, "num_tokens": 78941158.0, "step": 34465 }, { "entropy": 5.315621042251587, "epoch": 3.407473309608541, "grad_norm": 1.0078125, "learning_rate": 0.00038697596512931643, "loss": 4.8717, "mean_token_accuracy": 0.221297724545002, "num_tokens": 78953465.0, "step": 34470 }, { "entropy": 5.384997844696045, "epoch": 3.4079675761170423, "grad_norm": 1.046875, "learning_rate": 0.0003869453544244975, "loss": 4.9159, "mean_token_accuracy": 0.22321389764547347, "num_tokens": 78964841.0, "step": 34475 }, { "entropy": 5.407142591476441, "epoch": 3.4084618426255435, "grad_norm": 1.046875, "learning_rate": 0.00038691474096580545, "loss": 4.9232, "mean_token_accuracy": 0.226350137591362, "num_tokens": 78975173.0, "step": 34480 }, { "entropy": 5.343042802810669, "epoch": 3.4089561091340452, "grad_norm": 0.99609375, "learning_rate": 0.0003868841247539934, "loss": 4.9084, "mean_token_accuracy": 0.22551754862070084, "num_tokens": 78986020.0, "step": 34485 }, { "entropy": 5.375292253494263, "epoch": 3.4094503756425465, "grad_norm": 1.0859375, "learning_rate": 0.0003868535057898146, "loss": 4.8983, "mean_token_accuracy": 0.2185765489935875, "num_tokens": 78997906.0, "step": 34490 }, { "entropy": 5.45292067527771, "epoch": 3.4099446421510478, "grad_norm": 1.0546875, "learning_rate": 0.00038682288407402215, "loss": 4.9785, "mean_token_accuracy": 0.21217100322246552, "num_tokens": 79009322.0, "step": 34495 }, { "entropy": 5.313228178024292, "epoch": 3.4104389086595495, "grad_norm": 1.0859375, "learning_rate": 0.0003867922596073694, "loss": 4.8306, "mean_token_accuracy": 0.22980786710977555, "num_tokens": 79020940.0, "step": 34500 }, { "entropy": 5.408861112594605, "epoch": 3.4109331751680507, "grad_norm": 1.09375, "learning_rate": 0.0003867616323906098, "loss": 4.9656, "mean_token_accuracy": 0.21851980835199356, "num_tokens": 79033002.0, "step": 34505 }, { "entropy": 5.290494441986084, "epoch": 3.411427441676552, "grad_norm": 0.9921875, "learning_rate": 0.00038673100242449666, "loss": 4.8414, "mean_token_accuracy": 0.22964343577623367, "num_tokens": 79044129.0, "step": 34510 }, { "entropy": 5.330547046661377, "epoch": 3.4119217081850532, "grad_norm": 1.0859375, "learning_rate": 0.0003867003697097835, "loss": 4.8822, "mean_token_accuracy": 0.22968688160181044, "num_tokens": 79054961.0, "step": 34515 }, { "entropy": 5.431367444992065, "epoch": 3.412415974693555, "grad_norm": 1.1171875, "learning_rate": 0.0003866697342472239, "loss": 4.9456, "mean_token_accuracy": 0.21347442418336868, "num_tokens": 79066136.0, "step": 34520 }, { "entropy": 5.32498140335083, "epoch": 3.412910241202056, "grad_norm": 1.046875, "learning_rate": 0.0003866390960375716, "loss": 4.931, "mean_token_accuracy": 0.2204502761363983, "num_tokens": 79077821.0, "step": 34525 }, { "entropy": 5.356904792785644, "epoch": 3.4134045077105575, "grad_norm": 1.109375, "learning_rate": 0.0003866084550815801, "loss": 4.8688, "mean_token_accuracy": 0.22440022230148315, "num_tokens": 79087554.0, "step": 34530 }, { "entropy": 5.471297311782837, "epoch": 3.4138987742190587, "grad_norm": 1.0703125, "learning_rate": 0.00038657781138000337, "loss": 4.9972, "mean_token_accuracy": 0.2158384919166565, "num_tokens": 79098434.0, "step": 34535 }, { "entropy": 5.392957067489624, "epoch": 3.4143930407275604, "grad_norm": 1.046875, "learning_rate": 0.00038654716493359515, "loss": 4.8861, "mean_token_accuracy": 0.2250680595636368, "num_tokens": 79108962.0, "step": 34540 }, { "entropy": 5.291246938705444, "epoch": 3.4148873072360617, "grad_norm": 0.98828125, "learning_rate": 0.0003865165157431093, "loss": 4.8818, "mean_token_accuracy": 0.22493674904108046, "num_tokens": 79119592.0, "step": 34545 }, { "entropy": 5.365667390823364, "epoch": 3.415381573744563, "grad_norm": 1.0, "learning_rate": 0.0003864858638093, "loss": 4.849, "mean_token_accuracy": 0.2237905368208885, "num_tokens": 79130170.0, "step": 34550 }, { "entropy": 5.394690465927124, "epoch": 3.4158758402530642, "grad_norm": 1.0546875, "learning_rate": 0.00038645520913292117, "loss": 4.904, "mean_token_accuracy": 0.2250271201133728, "num_tokens": 79140949.0, "step": 34555 }, { "entropy": 5.3765043258667, "epoch": 3.416370106761566, "grad_norm": 1.1328125, "learning_rate": 0.00038642455171472676, "loss": 4.915, "mean_token_accuracy": 0.21994384974241257, "num_tokens": 79151508.0, "step": 34560 }, { "entropy": 5.407494068145752, "epoch": 3.416864373270067, "grad_norm": 1.03125, "learning_rate": 0.0003863938915554711, "loss": 4.9224, "mean_token_accuracy": 0.22397559881210327, "num_tokens": 79163062.0, "step": 34565 }, { "entropy": 5.387100553512573, "epoch": 3.4173586397785685, "grad_norm": 1.09375, "learning_rate": 0.0003863632286559085, "loss": 4.9053, "mean_token_accuracy": 0.22685438096523286, "num_tokens": 79174025.0, "step": 34570 }, { "entropy": 5.343644475936889, "epoch": 3.41785290628707, "grad_norm": 1.0390625, "learning_rate": 0.0003863325630167932, "loss": 4.801, "mean_token_accuracy": 0.23368772864341736, "num_tokens": 79185169.0, "step": 34575 }, { "entropy": 5.3502466678619385, "epoch": 3.4183471727955714, "grad_norm": 1.09375, "learning_rate": 0.00038630189463887955, "loss": 4.9055, "mean_token_accuracy": 0.22347963154315947, "num_tokens": 79196503.0, "step": 34580 }, { "entropy": 5.3405845165252686, "epoch": 3.4188414393040727, "grad_norm": 1.0078125, "learning_rate": 0.00038627122352292206, "loss": 4.8976, "mean_token_accuracy": 0.2198534280061722, "num_tokens": 79207887.0, "step": 34585 }, { "entropy": 5.340464353561401, "epoch": 3.419335705812574, "grad_norm": 1.046875, "learning_rate": 0.00038624054966967516, "loss": 4.8637, "mean_token_accuracy": 0.219783715903759, "num_tokens": 79219339.0, "step": 34590 }, { "entropy": 5.368650817871094, "epoch": 3.4198299723210757, "grad_norm": 0.9609375, "learning_rate": 0.00038620987307989347, "loss": 4.9314, "mean_token_accuracy": 0.21905310004949569, "num_tokens": 79231454.0, "step": 34595 }, { "entropy": 5.426078033447266, "epoch": 3.420324238829577, "grad_norm": 1.03125, "learning_rate": 0.00038617919375433176, "loss": 4.9058, "mean_token_accuracy": 0.22011983394622803, "num_tokens": 79241761.0, "step": 34600 }, { "entropy": 5.402372264862061, "epoch": 3.420818505338078, "grad_norm": 0.9609375, "learning_rate": 0.00038614851169374456, "loss": 4.8793, "mean_token_accuracy": 0.22196827083826065, "num_tokens": 79252272.0, "step": 34605 }, { "entropy": 5.34308762550354, "epoch": 3.42131277184658, "grad_norm": 1.1015625, "learning_rate": 0.0003861178268988867, "loss": 4.8583, "mean_token_accuracy": 0.2242792949080467, "num_tokens": 79263612.0, "step": 34610 }, { "entropy": 5.294901704788208, "epoch": 3.421807038355081, "grad_norm": 1.046875, "learning_rate": 0.0003860871393705131, "loss": 4.8686, "mean_token_accuracy": 0.22705257683992386, "num_tokens": 79275361.0, "step": 34615 }, { "entropy": 5.377409887313843, "epoch": 3.4223013048635824, "grad_norm": 1.0703125, "learning_rate": 0.00038605644910937856, "loss": 4.8927, "mean_token_accuracy": 0.2278641551733017, "num_tokens": 79285277.0, "step": 34620 }, { "entropy": 5.250478315353393, "epoch": 3.4227955713720837, "grad_norm": 1.0, "learning_rate": 0.00038602575611623827, "loss": 4.75, "mean_token_accuracy": 0.23823626190423966, "num_tokens": 79296713.0, "step": 34625 }, { "entropy": 5.37995138168335, "epoch": 3.4232898378805854, "grad_norm": 1.0546875, "learning_rate": 0.000385995060391847, "loss": 4.9246, "mean_token_accuracy": 0.21905192136764526, "num_tokens": 79308363.0, "step": 34630 }, { "entropy": 5.390201377868652, "epoch": 3.4237841043890866, "grad_norm": 1.03125, "learning_rate": 0.00038596436193696015, "loss": 4.9834, "mean_token_accuracy": 0.2163274735212326, "num_tokens": 79319626.0, "step": 34635 }, { "entropy": 5.362008285522461, "epoch": 3.424278370897588, "grad_norm": 1.0234375, "learning_rate": 0.0003859336607523327, "loss": 4.8872, "mean_token_accuracy": 0.22105125188827515, "num_tokens": 79330628.0, "step": 34640 }, { "entropy": 5.316167545318604, "epoch": 3.424772637406089, "grad_norm": 1.0390625, "learning_rate": 0.00038590295683872005, "loss": 4.8742, "mean_token_accuracy": 0.22724528908729552, "num_tokens": 79342323.0, "step": 34645 }, { "entropy": 5.290068578720093, "epoch": 3.425266903914591, "grad_norm": 0.96875, "learning_rate": 0.0003858722501968774, "loss": 4.7944, "mean_token_accuracy": 0.23574014753103256, "num_tokens": 79354108.0, "step": 34650 }, { "entropy": 5.361473560333252, "epoch": 3.425761170423092, "grad_norm": 0.95703125, "learning_rate": 0.00038584154082756036, "loss": 4.9303, "mean_token_accuracy": 0.22985867857933046, "num_tokens": 79365494.0, "step": 34655 }, { "entropy": 5.265077400207519, "epoch": 3.4262554369315934, "grad_norm": 1.078125, "learning_rate": 0.000385810828731524, "loss": 4.7353, "mean_token_accuracy": 0.23472481071949006, "num_tokens": 79376881.0, "step": 34660 }, { "entropy": 5.3192946434021, "epoch": 3.4267497034400947, "grad_norm": 1.0, "learning_rate": 0.0003857801139095242, "loss": 4.844, "mean_token_accuracy": 0.23531267940998077, "num_tokens": 79388154.0, "step": 34665 }, { "entropy": 5.429132413864136, "epoch": 3.4272439699485964, "grad_norm": 1.1484375, "learning_rate": 0.00038574939636231635, "loss": 4.9345, "mean_token_accuracy": 0.22201031744480132, "num_tokens": 79398995.0, "step": 34670 }, { "entropy": 5.389501714706421, "epoch": 3.4277382364570976, "grad_norm": 0.96875, "learning_rate": 0.0003857186760906562, "loss": 4.9626, "mean_token_accuracy": 0.22202810943126677, "num_tokens": 79410697.0, "step": 34675 }, { "entropy": 5.379842329025268, "epoch": 3.428232502965599, "grad_norm": 0.96875, "learning_rate": 0.00038568795309529947, "loss": 4.9337, "mean_token_accuracy": 0.22680349946022033, "num_tokens": 79421862.0, "step": 34680 }, { "entropy": 5.418475246429443, "epoch": 3.4287267694741006, "grad_norm": 1.03125, "learning_rate": 0.00038565722737700185, "loss": 4.9212, "mean_token_accuracy": 0.2204930379986763, "num_tokens": 79432610.0, "step": 34685 }, { "entropy": 5.418197345733643, "epoch": 3.429221035982602, "grad_norm": 1.1171875, "learning_rate": 0.00038562649893651924, "loss": 4.9427, "mean_token_accuracy": 0.22385623604059218, "num_tokens": 79443386.0, "step": 34690 }, { "entropy": 5.38770432472229, "epoch": 3.429715302491103, "grad_norm": 1.0625, "learning_rate": 0.0003855957677746077, "loss": 4.9573, "mean_token_accuracy": 0.22566352039575577, "num_tokens": 79454334.0, "step": 34695 }, { "entropy": 5.453788328170776, "epoch": 3.4302095689996044, "grad_norm": 0.9921875, "learning_rate": 0.0003855650338920231, "loss": 4.9028, "mean_token_accuracy": 0.2223539501428604, "num_tokens": 79465489.0, "step": 34700 }, { "entropy": 5.404337596893311, "epoch": 3.430703835508106, "grad_norm": 1.0703125, "learning_rate": 0.00038553429728952144, "loss": 4.9346, "mean_token_accuracy": 0.21787726432085036, "num_tokens": 79477293.0, "step": 34705 }, { "entropy": 5.407230234146118, "epoch": 3.4311981020166074, "grad_norm": 0.984375, "learning_rate": 0.00038550355796785897, "loss": 4.9782, "mean_token_accuracy": 0.21467052698135375, "num_tokens": 79488995.0, "step": 34710 }, { "entropy": 5.432978725433349, "epoch": 3.4316923685251086, "grad_norm": 0.96484375, "learning_rate": 0.00038547281592779184, "loss": 5.0104, "mean_token_accuracy": 0.21857332140207292, "num_tokens": 79502757.0, "step": 34715 }, { "entropy": 5.412739610671997, "epoch": 3.4321866350336103, "grad_norm": 0.98828125, "learning_rate": 0.0003854420711700763, "loss": 4.9399, "mean_token_accuracy": 0.2203126460313797, "num_tokens": 79515220.0, "step": 34720 }, { "entropy": 5.452446508407593, "epoch": 3.4326809015421116, "grad_norm": 1.0234375, "learning_rate": 0.00038541132369546865, "loss": 4.9898, "mean_token_accuracy": 0.2169725701212883, "num_tokens": 79527577.0, "step": 34725 }, { "entropy": 5.38204870223999, "epoch": 3.433175168050613, "grad_norm": 0.9609375, "learning_rate": 0.0003853805735047253, "loss": 4.8912, "mean_token_accuracy": 0.2210562616586685, "num_tokens": 79539136.0, "step": 34730 }, { "entropy": 5.315843343734741, "epoch": 3.433669434559114, "grad_norm": 0.984375, "learning_rate": 0.00038534982059860274, "loss": 4.8004, "mean_token_accuracy": 0.237005053460598, "num_tokens": 79550123.0, "step": 34735 }, { "entropy": 5.422584962844849, "epoch": 3.434163701067616, "grad_norm": 1.046875, "learning_rate": 0.00038531906497785753, "loss": 5.0047, "mean_token_accuracy": 0.21353789418935776, "num_tokens": 79563072.0, "step": 34740 }, { "entropy": 5.391173458099365, "epoch": 3.434657967576117, "grad_norm": 1.0390625, "learning_rate": 0.00038528830664324613, "loss": 4.8913, "mean_token_accuracy": 0.2232232227921486, "num_tokens": 79573901.0, "step": 34745 }, { "entropy": 5.329513835906982, "epoch": 3.4351522340846183, "grad_norm": 0.96484375, "learning_rate": 0.00038525754559552526, "loss": 4.8869, "mean_token_accuracy": 0.22773543000221252, "num_tokens": 79585384.0, "step": 34750 }, { "entropy": 5.391636943817138, "epoch": 3.43564650059312, "grad_norm": 1.046875, "learning_rate": 0.0003852267818354517, "loss": 4.9792, "mean_token_accuracy": 0.2183568462729454, "num_tokens": 79597277.0, "step": 34755 }, { "entropy": 5.433878660202026, "epoch": 3.4361407671016213, "grad_norm": 0.98828125, "learning_rate": 0.0003851960153637822, "loss": 5.0053, "mean_token_accuracy": 0.21485636085271836, "num_tokens": 79609797.0, "step": 34760 }, { "entropy": 5.384763097763061, "epoch": 3.4366350336101226, "grad_norm": 0.96875, "learning_rate": 0.00038516524618127364, "loss": 4.897, "mean_token_accuracy": 0.2271730661392212, "num_tokens": 79621247.0, "step": 34765 }, { "entropy": 5.423787307739258, "epoch": 3.437129300118624, "grad_norm": 1.0078125, "learning_rate": 0.0003851344742886829, "loss": 4.9656, "mean_token_accuracy": 0.21451084911823273, "num_tokens": 79632892.0, "step": 34770 }, { "entropy": 5.395720672607422, "epoch": 3.4376235666271255, "grad_norm": 0.9609375, "learning_rate": 0.00038510369968676705, "loss": 4.9566, "mean_token_accuracy": 0.2155747652053833, "num_tokens": 79644426.0, "step": 34775 }, { "entropy": 5.377327156066895, "epoch": 3.438117833135627, "grad_norm": 1.0859375, "learning_rate": 0.0003850729223762831, "loss": 4.8378, "mean_token_accuracy": 0.23031335026025773, "num_tokens": 79656414.0, "step": 34780 }, { "entropy": 5.346804475784301, "epoch": 3.438612099644128, "grad_norm": 1.0234375, "learning_rate": 0.0003850421423579882, "loss": 4.9233, "mean_token_accuracy": 0.22731201350688934, "num_tokens": 79667244.0, "step": 34785 }, { "entropy": 5.373436689376831, "epoch": 3.4391063661526293, "grad_norm": 1.015625, "learning_rate": 0.00038501135963263947, "loss": 4.9186, "mean_token_accuracy": 0.221695414185524, "num_tokens": 79677837.0, "step": 34790 }, { "entropy": 5.429844522476197, "epoch": 3.439600632661131, "grad_norm": 1.0234375, "learning_rate": 0.00038498057420099425, "loss": 4.9699, "mean_token_accuracy": 0.21675306260585786, "num_tokens": 79689500.0, "step": 34795 }, { "entropy": 5.3419231414794925, "epoch": 3.4400948991696323, "grad_norm": 0.984375, "learning_rate": 0.00038494978606380984, "loss": 4.8506, "mean_token_accuracy": 0.22827258706092834, "num_tokens": 79701621.0, "step": 34800 }, { "entropy": 5.306184768676758, "epoch": 3.4405891656781336, "grad_norm": 1.03125, "learning_rate": 0.0003849189952218436, "loss": 4.913, "mean_token_accuracy": 0.2285364493727684, "num_tokens": 79712635.0, "step": 34805 }, { "entropy": 5.434918737411499, "epoch": 3.441083432186635, "grad_norm": 0.99609375, "learning_rate": 0.0003848882016758531, "loss": 4.9763, "mean_token_accuracy": 0.21368080526590347, "num_tokens": 79723626.0, "step": 34810 }, { "entropy": 5.40279598236084, "epoch": 3.4415776986951365, "grad_norm": 1.0546875, "learning_rate": 0.00038485740542659573, "loss": 4.9526, "mean_token_accuracy": 0.2160220503807068, "num_tokens": 79734983.0, "step": 34815 }, { "entropy": 5.429786157608032, "epoch": 3.442071965203638, "grad_norm": 0.98046875, "learning_rate": 0.0003848266064748292, "loss": 4.9316, "mean_token_accuracy": 0.218422794342041, "num_tokens": 79746767.0, "step": 34820 }, { "entropy": 5.415806818008423, "epoch": 3.442566231712139, "grad_norm": 1.046875, "learning_rate": 0.0003847958048213111, "loss": 4.9324, "mean_token_accuracy": 0.2198669731616974, "num_tokens": 79759062.0, "step": 34825 }, { "entropy": 5.334010314941406, "epoch": 3.4430604982206408, "grad_norm": 0.9609375, "learning_rate": 0.00038476500046679915, "loss": 4.8459, "mean_token_accuracy": 0.2314682587981224, "num_tokens": 79769962.0, "step": 34830 }, { "entropy": 5.293807888031006, "epoch": 3.443554764729142, "grad_norm": 1.0546875, "learning_rate": 0.00038473419341205115, "loss": 4.8751, "mean_token_accuracy": 0.22174903452396394, "num_tokens": 79781279.0, "step": 34835 }, { "entropy": 5.38449444770813, "epoch": 3.4440490312376433, "grad_norm": 1.1015625, "learning_rate": 0.000384703383657825, "loss": 4.9469, "mean_token_accuracy": 0.22278484851121902, "num_tokens": 79792406.0, "step": 34840 }, { "entropy": 5.433879566192627, "epoch": 3.4445432977461445, "grad_norm": 1.09375, "learning_rate": 0.0003846725712048786, "loss": 4.9669, "mean_token_accuracy": 0.2145937889814377, "num_tokens": 79804150.0, "step": 34845 }, { "entropy": 5.377838277816773, "epoch": 3.4450375642546462, "grad_norm": 1.09375, "learning_rate": 0.0003846417560539699, "loss": 4.8412, "mean_token_accuracy": 0.23103207647800444, "num_tokens": 79814267.0, "step": 34850 }, { "entropy": 5.32079849243164, "epoch": 3.4455318307631475, "grad_norm": 1.0390625, "learning_rate": 0.000384610938205857, "loss": 4.8888, "mean_token_accuracy": 0.22784971445798874, "num_tokens": 79824887.0, "step": 34855 }, { "entropy": 5.399475336074829, "epoch": 3.4460260972716488, "grad_norm": 1.0234375, "learning_rate": 0.00038458011766129795, "loss": 4.9568, "mean_token_accuracy": 0.21606847196817397, "num_tokens": 79836840.0, "step": 34860 }, { "entropy": 5.358064651489258, "epoch": 3.4465203637801505, "grad_norm": 1.0546875, "learning_rate": 0.00038454929442105105, "loss": 4.8479, "mean_token_accuracy": 0.2297658547759056, "num_tokens": 79846876.0, "step": 34865 }, { "entropy": 5.387265205383301, "epoch": 3.4470146302886517, "grad_norm": 0.9765625, "learning_rate": 0.0003845184684858746, "loss": 4.9453, "mean_token_accuracy": 0.21692655980587006, "num_tokens": 79859271.0, "step": 34870 }, { "entropy": 5.389416742324829, "epoch": 3.447508896797153, "grad_norm": 0.97265625, "learning_rate": 0.00038448763985652674, "loss": 4.9953, "mean_token_accuracy": 0.21735395044088363, "num_tokens": 79871938.0, "step": 34875 }, { "entropy": 5.443049192428589, "epoch": 3.4480031633056543, "grad_norm": 1.015625, "learning_rate": 0.0003844568085337659, "loss": 4.9559, "mean_token_accuracy": 0.21973032951354982, "num_tokens": 79883202.0, "step": 34880 }, { "entropy": 5.351394319534302, "epoch": 3.448497429814156, "grad_norm": 0.96875, "learning_rate": 0.00038442597451835076, "loss": 4.8857, "mean_token_accuracy": 0.227353535592556, "num_tokens": 79895794.0, "step": 34885 }, { "entropy": 5.375788307189941, "epoch": 3.4489916963226572, "grad_norm": 1.140625, "learning_rate": 0.0003843951378110396, "loss": 4.8724, "mean_token_accuracy": 0.225347638130188, "num_tokens": 79906548.0, "step": 34890 }, { "entropy": 5.363926362991333, "epoch": 3.4494859628311585, "grad_norm": 0.99609375, "learning_rate": 0.000384364298412591, "loss": 4.9583, "mean_token_accuracy": 0.21985134184360505, "num_tokens": 79918116.0, "step": 34895 }, { "entropy": 5.361332845687866, "epoch": 3.4499802293396598, "grad_norm": 0.99609375, "learning_rate": 0.00038433345632376376, "loss": 4.9503, "mean_token_accuracy": 0.22752606272697448, "num_tokens": 79930791.0, "step": 34900 }, { "entropy": 5.305279636383057, "epoch": 3.4504744958481615, "grad_norm": 3.546875, "learning_rate": 0.00038430261154531655, "loss": 4.8206, "mean_token_accuracy": 0.23466309905052185, "num_tokens": 79942359.0, "step": 34905 }, { "entropy": 5.327594995498657, "epoch": 3.4509687623566627, "grad_norm": 1.046875, "learning_rate": 0.0003842717640780081, "loss": 4.8593, "mean_token_accuracy": 0.22191991209983825, "num_tokens": 79954424.0, "step": 34910 }, { "entropy": 5.340651988983154, "epoch": 3.451463028865164, "grad_norm": 1.0390625, "learning_rate": 0.00038424091392259737, "loss": 4.8565, "mean_token_accuracy": 0.22657064348459244, "num_tokens": 79965704.0, "step": 34915 }, { "entropy": 5.370573329925537, "epoch": 3.4519572953736652, "grad_norm": 1.078125, "learning_rate": 0.0003842100610798431, "loss": 4.8827, "mean_token_accuracy": 0.22257652282714843, "num_tokens": 79977891.0, "step": 34920 }, { "entropy": 5.334797763824463, "epoch": 3.452451561882167, "grad_norm": 1.015625, "learning_rate": 0.00038417920555050447, "loss": 4.9096, "mean_token_accuracy": 0.22360444962978362, "num_tokens": 79988709.0, "step": 34925 }, { "entropy": 5.380033826828003, "epoch": 3.452945828390668, "grad_norm": 1.03125, "learning_rate": 0.00038414834733534046, "loss": 4.8938, "mean_token_accuracy": 0.22453713715076445, "num_tokens": 80000349.0, "step": 34930 }, { "entropy": 5.330774116516113, "epoch": 3.4534400948991695, "grad_norm": 1.1015625, "learning_rate": 0.0003841174864351101, "loss": 4.7868, "mean_token_accuracy": 0.23438074290752411, "num_tokens": 80011317.0, "step": 34935 }, { "entropy": 5.375869703292847, "epoch": 3.453934361407671, "grad_norm": 0.99609375, "learning_rate": 0.00038408662285057267, "loss": 4.9693, "mean_token_accuracy": 0.22311795502901077, "num_tokens": 80023471.0, "step": 34940 }, { "entropy": 5.4005248069763185, "epoch": 3.4544286279161724, "grad_norm": 0.96484375, "learning_rate": 0.00038405575658248737, "loss": 4.9064, "mean_token_accuracy": 0.2192446067929268, "num_tokens": 80035937.0, "step": 34945 }, { "entropy": 5.357674694061279, "epoch": 3.4549228944246737, "grad_norm": 0.97265625, "learning_rate": 0.0003840248876316135, "loss": 4.8915, "mean_token_accuracy": 0.22633458375930787, "num_tokens": 80048435.0, "step": 34950 }, { "entropy": 5.340887928009034, "epoch": 3.455417160933175, "grad_norm": 1.015625, "learning_rate": 0.0003839940159987106, "loss": 4.8972, "mean_token_accuracy": 0.22777303010225297, "num_tokens": 80059675.0, "step": 34955 }, { "entropy": 5.449123239517212, "epoch": 3.4559114274416767, "grad_norm": 1.0078125, "learning_rate": 0.00038396314168453793, "loss": 4.9536, "mean_token_accuracy": 0.21783632785081863, "num_tokens": 80071232.0, "step": 34960 }, { "entropy": 5.347108364105225, "epoch": 3.456405693950178, "grad_norm": 1.0703125, "learning_rate": 0.0003839322646898551, "loss": 4.8735, "mean_token_accuracy": 0.2254775047302246, "num_tokens": 80083331.0, "step": 34965 }, { "entropy": 5.431919908523559, "epoch": 3.456899960458679, "grad_norm": 1.0703125, "learning_rate": 0.00038390138501542164, "loss": 4.9686, "mean_token_accuracy": 0.22217265218496324, "num_tokens": 80095883.0, "step": 34970 }, { "entropy": 5.340282011032104, "epoch": 3.457394226967181, "grad_norm": 1.1171875, "learning_rate": 0.0003838705026619972, "loss": 4.9147, "mean_token_accuracy": 0.22169393599033355, "num_tokens": 80108098.0, "step": 34975 }, { "entropy": 5.325607490539551, "epoch": 3.457888493475682, "grad_norm": 1.0078125, "learning_rate": 0.0003838396176303416, "loss": 4.9074, "mean_token_accuracy": 0.22087820023298263, "num_tokens": 80121184.0, "step": 34980 }, { "entropy": 5.407978153228759, "epoch": 3.4583827599841834, "grad_norm": 1.0546875, "learning_rate": 0.0003838087299212144, "loss": 4.862, "mean_token_accuracy": 0.22226207554340363, "num_tokens": 80132862.0, "step": 34985 }, { "entropy": 5.329229879379272, "epoch": 3.4588770264926847, "grad_norm": 1.0234375, "learning_rate": 0.00038377783953537565, "loss": 4.8866, "mean_token_accuracy": 0.22380609363317489, "num_tokens": 80143756.0, "step": 34990 }, { "entropy": 5.352037668228149, "epoch": 3.4593712930011864, "grad_norm": 1.0, "learning_rate": 0.0003837469464735851, "loss": 4.8866, "mean_token_accuracy": 0.22633173763751985, "num_tokens": 80154570.0, "step": 34995 }, { "entropy": 5.357908868789673, "epoch": 3.4598655595096877, "grad_norm": 0.9921875, "learning_rate": 0.00038371605073660284, "loss": 4.8879, "mean_token_accuracy": 0.22478317767381667, "num_tokens": 80165968.0, "step": 35000 }, { "entropy": 5.343455982208252, "epoch": 3.460359826018189, "grad_norm": 1.0703125, "learning_rate": 0.00038368515232518885, "loss": 4.8937, "mean_token_accuracy": 0.21958194822072982, "num_tokens": 80177584.0, "step": 35005 }, { "entropy": 5.3588173389434814, "epoch": 3.4608540925266906, "grad_norm": 0.95703125, "learning_rate": 0.0003836542512401033, "loss": 4.9053, "mean_token_accuracy": 0.22101389318704606, "num_tokens": 80190113.0, "step": 35010 }, { "entropy": 5.433740901947021, "epoch": 3.461348359035192, "grad_norm": 1.1015625, "learning_rate": 0.0003836233474821063, "loss": 4.9684, "mean_token_accuracy": 0.21682923138141633, "num_tokens": 80201074.0, "step": 35015 }, { "entropy": 5.335023641586304, "epoch": 3.461842625543693, "grad_norm": 0.984375, "learning_rate": 0.00038359244105195807, "loss": 4.9322, "mean_token_accuracy": 0.22437410950660705, "num_tokens": 80212248.0, "step": 35020 }, { "entropy": 5.335826206207275, "epoch": 3.4623368920521944, "grad_norm": 1.03125, "learning_rate": 0.00038356153195041886, "loss": 4.8362, "mean_token_accuracy": 0.2207690566778183, "num_tokens": 80223151.0, "step": 35025 }, { "entropy": 5.333377981185913, "epoch": 3.462831158560696, "grad_norm": 1.078125, "learning_rate": 0.00038353062017824923, "loss": 4.8079, "mean_token_accuracy": 0.22640860229730606, "num_tokens": 80234978.0, "step": 35030 }, { "entropy": 5.343447303771972, "epoch": 3.4633254250691974, "grad_norm": 1.0625, "learning_rate": 0.0003834997057362096, "loss": 4.8664, "mean_token_accuracy": 0.22885859459638597, "num_tokens": 80246297.0, "step": 35035 }, { "entropy": 5.433044004440307, "epoch": 3.4638196915776986, "grad_norm": 1.0859375, "learning_rate": 0.0003834687886250602, "loss": 4.9611, "mean_token_accuracy": 0.21328379213809967, "num_tokens": 80258628.0, "step": 35040 }, { "entropy": 5.386111927032471, "epoch": 3.4643139580862, "grad_norm": 1.015625, "learning_rate": 0.0003834378688455618, "loss": 4.8582, "mean_token_accuracy": 0.22875118553638457, "num_tokens": 80270694.0, "step": 35045 }, { "entropy": 5.32470121383667, "epoch": 3.4648082245947016, "grad_norm": 1.03125, "learning_rate": 0.0003834069463984751, "loss": 4.912, "mean_token_accuracy": 0.22508965730667113, "num_tokens": 80282032.0, "step": 35050 }, { "entropy": 5.334949254989624, "epoch": 3.465302491103203, "grad_norm": 0.9765625, "learning_rate": 0.0003833760212845605, "loss": 4.8701, "mean_token_accuracy": 0.2228470116853714, "num_tokens": 80294033.0, "step": 35055 }, { "entropy": 5.346255540847778, "epoch": 3.465796757611704, "grad_norm": 1.140625, "learning_rate": 0.00038334509350457913, "loss": 4.7949, "mean_token_accuracy": 0.2312503233551979, "num_tokens": 80304273.0, "step": 35060 }, { "entropy": 5.250077915191651, "epoch": 3.4662910241202054, "grad_norm": 1.0078125, "learning_rate": 0.0003833141630592916, "loss": 4.8149, "mean_token_accuracy": 0.23373170495033263, "num_tokens": 80314049.0, "step": 35065 }, { "entropy": 5.416063451766968, "epoch": 3.466785290628707, "grad_norm": 1.046875, "learning_rate": 0.00038328322994945883, "loss": 4.9886, "mean_token_accuracy": 0.21375520676374435, "num_tokens": 80324632.0, "step": 35070 }, { "entropy": 5.337831830978393, "epoch": 3.4672795571372084, "grad_norm": 0.9375, "learning_rate": 0.00038325229417584194, "loss": 4.834, "mean_token_accuracy": 0.23133582025766372, "num_tokens": 80335824.0, "step": 35075 }, { "entropy": 5.333151960372925, "epoch": 3.4677738236457096, "grad_norm": 0.98046875, "learning_rate": 0.00038322135573920176, "loss": 4.8556, "mean_token_accuracy": 0.21455931216478347, "num_tokens": 80346537.0, "step": 35080 }, { "entropy": 5.363255405426026, "epoch": 3.4682680901542113, "grad_norm": 0.8828125, "learning_rate": 0.0003831904146402994, "loss": 4.8552, "mean_token_accuracy": 0.23108550608158113, "num_tokens": 80358446.0, "step": 35085 }, { "entropy": 5.311655950546265, "epoch": 3.4687623566627126, "grad_norm": 0.96875, "learning_rate": 0.000383159470879896, "loss": 4.87, "mean_token_accuracy": 0.23010483235120774, "num_tokens": 80370219.0, "step": 35090 }, { "entropy": 5.354640007019043, "epoch": 3.469256623171214, "grad_norm": 1.078125, "learning_rate": 0.0003831285244587529, "loss": 4.9134, "mean_token_accuracy": 0.22385768592357635, "num_tokens": 80380886.0, "step": 35095 }, { "entropy": 5.337466430664063, "epoch": 3.469750889679715, "grad_norm": 1.0234375, "learning_rate": 0.0003830975753776314, "loss": 4.8335, "mean_token_accuracy": 0.22811726480722427, "num_tokens": 80391171.0, "step": 35100 }, { "entropy": 5.340829277038575, "epoch": 3.470245156188217, "grad_norm": 0.984375, "learning_rate": 0.0003830666236372927, "loss": 4.8661, "mean_token_accuracy": 0.2247500643134117, "num_tokens": 80403527.0, "step": 35105 }, { "entropy": 5.411605882644653, "epoch": 3.470739422696718, "grad_norm": 1.0, "learning_rate": 0.00038303566923849827, "loss": 4.989, "mean_token_accuracy": 0.21747735589742662, "num_tokens": 80414992.0, "step": 35110 }, { "entropy": 5.359706544876099, "epoch": 3.4712336892052194, "grad_norm": 1.046875, "learning_rate": 0.00038300471218200965, "loss": 4.8998, "mean_token_accuracy": 0.21905082911252977, "num_tokens": 80426167.0, "step": 35115 }, { "entropy": 5.3413280010223385, "epoch": 3.471727955713721, "grad_norm": 0.984375, "learning_rate": 0.00038297375246858835, "loss": 4.877, "mean_token_accuracy": 0.22599556148052216, "num_tokens": 80438063.0, "step": 35120 }, { "entropy": 5.312160158157349, "epoch": 3.4722222222222223, "grad_norm": 0.98046875, "learning_rate": 0.000382942790098996, "loss": 4.8972, "mean_token_accuracy": 0.21451212614774703, "num_tokens": 80449898.0, "step": 35125 }, { "entropy": 5.379366779327393, "epoch": 3.4727164887307236, "grad_norm": 1.0078125, "learning_rate": 0.00038291182507399425, "loss": 4.8729, "mean_token_accuracy": 0.23261666893959046, "num_tokens": 80461623.0, "step": 35130 }, { "entropy": 5.3715729236602785, "epoch": 3.473210755239225, "grad_norm": 0.97265625, "learning_rate": 0.00038288085739434486, "loss": 4.8516, "mean_token_accuracy": 0.2293989896774292, "num_tokens": 80472627.0, "step": 35135 }, { "entropy": 5.318172216415405, "epoch": 3.4737050217477266, "grad_norm": 0.97265625, "learning_rate": 0.0003828498870608096, "loss": 4.8696, "mean_token_accuracy": 0.22925539016723634, "num_tokens": 80483494.0, "step": 35140 }, { "entropy": 5.32388277053833, "epoch": 3.474199288256228, "grad_norm": 1.0703125, "learning_rate": 0.00038281891407415046, "loss": 4.843, "mean_token_accuracy": 0.22897504419088363, "num_tokens": 80495122.0, "step": 35145 }, { "entropy": 5.294313383102417, "epoch": 3.474693554764729, "grad_norm": 0.96875, "learning_rate": 0.00038278793843512935, "loss": 4.8565, "mean_token_accuracy": 0.23140700459480285, "num_tokens": 80506639.0, "step": 35150 }, { "entropy": 5.367994737625122, "epoch": 3.4751878212732303, "grad_norm": 1.015625, "learning_rate": 0.0003827569601445081, "loss": 4.895, "mean_token_accuracy": 0.22339883744716643, "num_tokens": 80517897.0, "step": 35155 }, { "entropy": 5.427991247177124, "epoch": 3.475682087781732, "grad_norm": 0.953125, "learning_rate": 0.000382725979203049, "loss": 4.8953, "mean_token_accuracy": 0.217093725502491, "num_tokens": 80530112.0, "step": 35160 }, { "entropy": 5.369055938720703, "epoch": 3.4761763542902333, "grad_norm": 0.97265625, "learning_rate": 0.00038269499561151407, "loss": 4.8436, "mean_token_accuracy": 0.23295638114213943, "num_tokens": 80541811.0, "step": 35165 }, { "entropy": 5.3344573974609375, "epoch": 3.4766706207987346, "grad_norm": 1.0546875, "learning_rate": 0.00038266400937066555, "loss": 4.9158, "mean_token_accuracy": 0.23322578221559526, "num_tokens": 80553107.0, "step": 35170 }, { "entropy": 5.431958436965942, "epoch": 3.477164887307236, "grad_norm": 1.0234375, "learning_rate": 0.00038263302048126567, "loss": 4.9484, "mean_token_accuracy": 0.2215990886092186, "num_tokens": 80562916.0, "step": 35175 }, { "entropy": 5.347736883163452, "epoch": 3.4776591538157375, "grad_norm": 1.0546875, "learning_rate": 0.0003826020289440768, "loss": 4.8682, "mean_token_accuracy": 0.22408616542816162, "num_tokens": 80573179.0, "step": 35180 }, { "entropy": 5.2815220832824705, "epoch": 3.478153420324239, "grad_norm": 0.9765625, "learning_rate": 0.00038257103475986134, "loss": 4.8841, "mean_token_accuracy": 0.22795872688293456, "num_tokens": 80583494.0, "step": 35185 }, { "entropy": 5.307571887969971, "epoch": 3.47864768683274, "grad_norm": 0.953125, "learning_rate": 0.00038254003792938176, "loss": 4.9274, "mean_token_accuracy": 0.22886021435260773, "num_tokens": 80595926.0, "step": 35190 }, { "entropy": 5.333722496032715, "epoch": 3.4791419533412418, "grad_norm": 0.94921875, "learning_rate": 0.00038250903845340057, "loss": 4.8784, "mean_token_accuracy": 0.23345627039670944, "num_tokens": 80607449.0, "step": 35195 }, { "entropy": 5.375921678543091, "epoch": 3.479636219849743, "grad_norm": 0.98828125, "learning_rate": 0.0003824780363326803, "loss": 4.8961, "mean_token_accuracy": 0.22520331740379335, "num_tokens": 80619201.0, "step": 35200 }, { "entropy": 5.394715070724487, "epoch": 3.4801304863582443, "grad_norm": 1.015625, "learning_rate": 0.00038244703156798364, "loss": 4.9819, "mean_token_accuracy": 0.21950269341468812, "num_tokens": 80632068.0, "step": 35205 }, { "entropy": 5.384284973144531, "epoch": 3.4806247528667456, "grad_norm": 0.98828125, "learning_rate": 0.0003824160241600734, "loss": 4.8777, "mean_token_accuracy": 0.216710364818573, "num_tokens": 80643569.0, "step": 35210 }, { "entropy": 5.380399131774903, "epoch": 3.4811190193752473, "grad_norm": 1.0234375, "learning_rate": 0.00038238501410971226, "loss": 4.8776, "mean_token_accuracy": 0.22461363971233367, "num_tokens": 80656000.0, "step": 35215 }, { "entropy": 5.350134086608887, "epoch": 3.4816132858837485, "grad_norm": 1.140625, "learning_rate": 0.00038235400141766314, "loss": 4.8787, "mean_token_accuracy": 0.22634776830673217, "num_tokens": 80667473.0, "step": 35220 }, { "entropy": 5.488603258132935, "epoch": 3.48210755239225, "grad_norm": 0.89453125, "learning_rate": 0.00038232298608468894, "loss": 5.0155, "mean_token_accuracy": 0.22015490978956223, "num_tokens": 80679322.0, "step": 35225 }, { "entropy": 5.506798124313354, "epoch": 3.4826018189007515, "grad_norm": 1.0390625, "learning_rate": 0.0003822919681115526, "loss": 5.0154, "mean_token_accuracy": 0.21678259074687958, "num_tokens": 80690907.0, "step": 35230 }, { "entropy": 5.286512279510498, "epoch": 3.4830960854092528, "grad_norm": 1.015625, "learning_rate": 0.0003822609474990172, "loss": 4.8006, "mean_token_accuracy": 0.2317992016673088, "num_tokens": 80702012.0, "step": 35235 }, { "entropy": 5.443157052993774, "epoch": 3.483590351917754, "grad_norm": 1.0078125, "learning_rate": 0.000382229924247846, "loss": 5.0184, "mean_token_accuracy": 0.21097750216722488, "num_tokens": 80714283.0, "step": 35240 }, { "entropy": 5.322410345077515, "epoch": 3.4840846184262553, "grad_norm": 1.0546875, "learning_rate": 0.0003821988983588018, "loss": 4.8471, "mean_token_accuracy": 0.23458994477987288, "num_tokens": 80724964.0, "step": 35245 }, { "entropy": 5.3958815574646, "epoch": 3.484578884934757, "grad_norm": 1.0078125, "learning_rate": 0.00038216786983264817, "loss": 4.8924, "mean_token_accuracy": 0.22375074326992034, "num_tokens": 80735934.0, "step": 35250 }, { "entropy": 5.442958974838257, "epoch": 3.4850731514432582, "grad_norm": 0.9765625, "learning_rate": 0.00038213683867014824, "loss": 4.9911, "mean_token_accuracy": 0.2130389168858528, "num_tokens": 80746988.0, "step": 35255 }, { "entropy": 5.424798440933228, "epoch": 3.4855674179517595, "grad_norm": 0.9609375, "learning_rate": 0.00038210580487206563, "loss": 4.9724, "mean_token_accuracy": 0.2100682571530342, "num_tokens": 80759300.0, "step": 35260 }, { "entropy": 5.3273814678192135, "epoch": 3.486061684460261, "grad_norm": 0.9296875, "learning_rate": 0.0003820747684391636, "loss": 4.9307, "mean_token_accuracy": 0.22200098633766174, "num_tokens": 80771055.0, "step": 35265 }, { "entropy": 5.30106749534607, "epoch": 3.4865559509687625, "grad_norm": 1.0234375, "learning_rate": 0.0003820437293722054, "loss": 4.8218, "mean_token_accuracy": 0.2328087329864502, "num_tokens": 80782803.0, "step": 35270 }, { "entropy": 5.381383800506592, "epoch": 3.4870502174772637, "grad_norm": 1.0390625, "learning_rate": 0.0003820126876719551, "loss": 4.9052, "mean_token_accuracy": 0.22208563685417176, "num_tokens": 80793833.0, "step": 35275 }, { "entropy": 5.367293834686279, "epoch": 3.487544483985765, "grad_norm": 1.0234375, "learning_rate": 0.000381981643339176, "loss": 4.8708, "mean_token_accuracy": 0.23207556009292601, "num_tokens": 80804800.0, "step": 35280 }, { "entropy": 5.401548528671265, "epoch": 3.4880387504942663, "grad_norm": 1.0703125, "learning_rate": 0.0003819505963746318, "loss": 4.8888, "mean_token_accuracy": 0.22003807127475739, "num_tokens": 80815934.0, "step": 35285 }, { "entropy": 5.386237049102784, "epoch": 3.488533017002768, "grad_norm": 1.03125, "learning_rate": 0.0003819195467790864, "loss": 4.9165, "mean_token_accuracy": 0.21976712346076965, "num_tokens": 80826971.0, "step": 35290 }, { "entropy": 5.361319065093994, "epoch": 3.4890272835112692, "grad_norm": 1.0, "learning_rate": 0.0003818884945533036, "loss": 4.9559, "mean_token_accuracy": 0.21476338803768158, "num_tokens": 80839847.0, "step": 35295 }, { "entropy": 5.41700439453125, "epoch": 3.4895215500197705, "grad_norm": 1.1640625, "learning_rate": 0.0003818574396980472, "loss": 4.9214, "mean_token_accuracy": 0.22057391405105592, "num_tokens": 80852937.0, "step": 35300 }, { "entropy": 5.380382776260376, "epoch": 3.490015816528272, "grad_norm": 1.0625, "learning_rate": 0.0003818263822140812, "loss": 4.8456, "mean_token_accuracy": 0.22506628483533858, "num_tokens": 80862978.0, "step": 35305 }, { "entropy": 5.336280632019043, "epoch": 3.4905100830367735, "grad_norm": 1.0390625, "learning_rate": 0.00038179532210216974, "loss": 4.8835, "mean_token_accuracy": 0.2255462199449539, "num_tokens": 80874446.0, "step": 35310 }, { "entropy": 5.299367380142212, "epoch": 3.4910043495452747, "grad_norm": 1.0234375, "learning_rate": 0.0003817642593630767, "loss": 4.9428, "mean_token_accuracy": 0.22643188685178756, "num_tokens": 80886289.0, "step": 35315 }, { "entropy": 5.38615984916687, "epoch": 3.491498616053776, "grad_norm": 0.92578125, "learning_rate": 0.00038173319399756626, "loss": 4.9259, "mean_token_accuracy": 0.2203057363629341, "num_tokens": 80897363.0, "step": 35320 }, { "entropy": 5.435445070266724, "epoch": 3.4919928825622777, "grad_norm": 1.0390625, "learning_rate": 0.0003817021260064028, "loss": 4.9101, "mean_token_accuracy": 0.22135420739650727, "num_tokens": 80907850.0, "step": 35325 }, { "entropy": 5.39670958518982, "epoch": 3.492487149070779, "grad_norm": 1.1796875, "learning_rate": 0.0003816710553903504, "loss": 4.9232, "mean_token_accuracy": 0.21810300797224044, "num_tokens": 80918512.0, "step": 35330 }, { "entropy": 5.359760379791259, "epoch": 3.49298141557928, "grad_norm": 1.03125, "learning_rate": 0.0003816399821501736, "loss": 4.8988, "mean_token_accuracy": 0.2290360614657402, "num_tokens": 80929550.0, "step": 35335 }, { "entropy": 5.338519430160522, "epoch": 3.493475682087782, "grad_norm": 0.9609375, "learning_rate": 0.00038160890628663663, "loss": 4.8717, "mean_token_accuracy": 0.22589582651853563, "num_tokens": 80941129.0, "step": 35340 }, { "entropy": 5.360996532440185, "epoch": 3.493969948596283, "grad_norm": 0.953125, "learning_rate": 0.000381577827800504, "loss": 4.8599, "mean_token_accuracy": 0.22563497126102447, "num_tokens": 80951804.0, "step": 35345 }, { "entropy": 5.291131925582886, "epoch": 3.4944642151047844, "grad_norm": 1.0, "learning_rate": 0.0003815467466925402, "loss": 4.8482, "mean_token_accuracy": 0.23483843952417374, "num_tokens": 80962556.0, "step": 35350 }, { "entropy": 5.405055856704712, "epoch": 3.4949584816132857, "grad_norm": 1.0078125, "learning_rate": 0.00038151566296351, "loss": 5.0183, "mean_token_accuracy": 0.21757636368274688, "num_tokens": 80974550.0, "step": 35355 }, { "entropy": 5.408387756347656, "epoch": 3.4954527481217874, "grad_norm": 1.03125, "learning_rate": 0.000381484576614178, "loss": 4.8875, "mean_token_accuracy": 0.22002579569816588, "num_tokens": 80987033.0, "step": 35360 }, { "entropy": 5.343898868560791, "epoch": 3.4959470146302887, "grad_norm": 1.0078125, "learning_rate": 0.00038145348764530887, "loss": 4.829, "mean_token_accuracy": 0.22586225271224974, "num_tokens": 80998216.0, "step": 35365 }, { "entropy": 5.349352693557739, "epoch": 3.49644128113879, "grad_norm": 1.015625, "learning_rate": 0.00038142239605766737, "loss": 4.8914, "mean_token_accuracy": 0.22209430634975433, "num_tokens": 81010276.0, "step": 35370 }, { "entropy": 5.341150522232056, "epoch": 3.4969355476472916, "grad_norm": 0.99609375, "learning_rate": 0.00038139130185201845, "loss": 4.8634, "mean_token_accuracy": 0.22152438014745712, "num_tokens": 81020892.0, "step": 35375 }, { "entropy": 5.2937572479248045, "epoch": 3.497429814155793, "grad_norm": 1.015625, "learning_rate": 0.00038136020502912705, "loss": 4.8109, "mean_token_accuracy": 0.2360413044691086, "num_tokens": 81032390.0, "step": 35380 }, { "entropy": 5.330139684677124, "epoch": 3.497924080664294, "grad_norm": 1.015625, "learning_rate": 0.0003813291055897581, "loss": 4.8452, "mean_token_accuracy": 0.23186170011758805, "num_tokens": 81043433.0, "step": 35385 }, { "entropy": 5.357116556167602, "epoch": 3.4984183471727954, "grad_norm": 1.0859375, "learning_rate": 0.0003812980035346766, "loss": 4.868, "mean_token_accuracy": 0.22528961598873137, "num_tokens": 81054798.0, "step": 35390 }, { "entropy": 5.316542148590088, "epoch": 3.498912613681297, "grad_norm": 1.09375, "learning_rate": 0.0003812668988646477, "loss": 4.943, "mean_token_accuracy": 0.2176274314522743, "num_tokens": 81067746.0, "step": 35395 }, { "entropy": 5.397860193252564, "epoch": 3.4994068801897984, "grad_norm": 1.1015625, "learning_rate": 0.0003812357915804366, "loss": 4.9329, "mean_token_accuracy": 0.21818071305751802, "num_tokens": 81079328.0, "step": 35400 }, { "entropy": 5.407144165039062, "epoch": 3.4999011466982997, "grad_norm": 1.046875, "learning_rate": 0.0003812046816828086, "loss": 4.9109, "mean_token_accuracy": 0.22632373571395875, "num_tokens": 81091447.0, "step": 35405 }, { "entropy": 5.413412857055664, "epoch": 3.5003954132068014, "grad_norm": 1.03125, "learning_rate": 0.000381173569172529, "loss": 4.97, "mean_token_accuracy": 0.2185871735215187, "num_tokens": 81103614.0, "step": 35410 }, { "entropy": 5.46408429145813, "epoch": 3.5008896797153026, "grad_norm": 0.99609375, "learning_rate": 0.000381142454050363, "loss": 5.0109, "mean_token_accuracy": 0.21528606712818146, "num_tokens": 81115387.0, "step": 35415 }, { "entropy": 5.40613317489624, "epoch": 3.501383946223804, "grad_norm": 1.0, "learning_rate": 0.00038111133631707624, "loss": 4.9272, "mean_token_accuracy": 0.22027081102132798, "num_tokens": 81128063.0, "step": 35420 }, { "entropy": 5.41538405418396, "epoch": 3.501878212732305, "grad_norm": 1.046875, "learning_rate": 0.0003810802159734342, "loss": 4.9126, "mean_token_accuracy": 0.22631302773952483, "num_tokens": 81139137.0, "step": 35425 }, { "entropy": 5.389663887023926, "epoch": 3.5023724792408064, "grad_norm": 0.9609375, "learning_rate": 0.0003810490930202023, "loss": 5.0344, "mean_token_accuracy": 0.21445220559835435, "num_tokens": 81151896.0, "step": 35430 }, { "entropy": 5.463431072235108, "epoch": 3.502866745749308, "grad_norm": 1.0078125, "learning_rate": 0.0003810179674581463, "loss": 4.8794, "mean_token_accuracy": 0.22319562882184982, "num_tokens": 81162843.0, "step": 35435 }, { "entropy": 5.463798379898071, "epoch": 3.5033610122578094, "grad_norm": 1.015625, "learning_rate": 0.00038098683928803186, "loss": 5.0475, "mean_token_accuracy": 0.2118205189704895, "num_tokens": 81176316.0, "step": 35440 }, { "entropy": 5.453320503234863, "epoch": 3.5038552787663106, "grad_norm": 0.953125, "learning_rate": 0.00038095570851062467, "loss": 4.9006, "mean_token_accuracy": 0.22157826870679856, "num_tokens": 81187956.0, "step": 35445 }, { "entropy": 5.373100614547729, "epoch": 3.5043495452748123, "grad_norm": 0.9375, "learning_rate": 0.00038092457512669067, "loss": 4.8912, "mean_token_accuracy": 0.22848647385835646, "num_tokens": 81199575.0, "step": 35450 }, { "entropy": 5.2962781429290775, "epoch": 3.5048438117833136, "grad_norm": 1.1328125, "learning_rate": 0.0003808934391369957, "loss": 4.8405, "mean_token_accuracy": 0.23707397729158403, "num_tokens": 81211959.0, "step": 35455 }, { "entropy": 5.307772207260132, "epoch": 3.505338078291815, "grad_norm": 1.0390625, "learning_rate": 0.0003808623005423057, "loss": 4.8313, "mean_token_accuracy": 0.23189762532711028, "num_tokens": 81222358.0, "step": 35460 }, { "entropy": 5.40881118774414, "epoch": 3.505832344800316, "grad_norm": 1.078125, "learning_rate": 0.00038083115934338667, "loss": 4.8963, "mean_token_accuracy": 0.22693750411272048, "num_tokens": 81233674.0, "step": 35465 }, { "entropy": 5.343675661087036, "epoch": 3.506326611308818, "grad_norm": 1.0234375, "learning_rate": 0.00038080001554100467, "loss": 4.8585, "mean_token_accuracy": 0.23475908041000365, "num_tokens": 81243885.0, "step": 35470 }, { "entropy": 5.439158010482788, "epoch": 3.506820877817319, "grad_norm": 1.0546875, "learning_rate": 0.0003807688691359259, "loss": 5.0236, "mean_token_accuracy": 0.21338081508874893, "num_tokens": 81255869.0, "step": 35475 }, { "entropy": 5.372809553146363, "epoch": 3.5073151443258204, "grad_norm": 1.0546875, "learning_rate": 0.0003807377201289165, "loss": 4.8966, "mean_token_accuracy": 0.21953511536121367, "num_tokens": 81266746.0, "step": 35480 }, { "entropy": 5.360100221633911, "epoch": 3.507809410834322, "grad_norm": 1.1328125, "learning_rate": 0.0003807065685207429, "loss": 4.8979, "mean_token_accuracy": 0.2245924264192581, "num_tokens": 81277356.0, "step": 35485 }, { "entropy": 5.397751140594482, "epoch": 3.5083036773428233, "grad_norm": 0.98046875, "learning_rate": 0.0003806754143121712, "loss": 4.9546, "mean_token_accuracy": 0.22313296794891357, "num_tokens": 81288926.0, "step": 35490 }, { "entropy": 5.4592162609100345, "epoch": 3.5087979438513246, "grad_norm": 1.015625, "learning_rate": 0.00038064425750396793, "loss": 4.9237, "mean_token_accuracy": 0.22758299857378006, "num_tokens": 81300990.0, "step": 35495 }, { "entropy": 5.2832671165466305, "epoch": 3.509292210359826, "grad_norm": 1.0390625, "learning_rate": 0.00038061309809689955, "loss": 4.8364, "mean_token_accuracy": 0.23108351677656175, "num_tokens": 81312964.0, "step": 35500 }, { "entropy": 5.361547565460205, "epoch": 3.5097864768683276, "grad_norm": 0.984375, "learning_rate": 0.00038058193609173256, "loss": 4.9203, "mean_token_accuracy": 0.22482313215732574, "num_tokens": 81324196.0, "step": 35505 }, { "entropy": 5.388671970367431, "epoch": 3.510280743376829, "grad_norm": 1.0390625, "learning_rate": 0.0003805507714892336, "loss": 4.8993, "mean_token_accuracy": 0.22257969975471498, "num_tokens": 81334723.0, "step": 35510 }, { "entropy": 5.372091436386109, "epoch": 3.51077500988533, "grad_norm": 1.03125, "learning_rate": 0.00038051960429016923, "loss": 4.9409, "mean_token_accuracy": 0.21985040307044984, "num_tokens": 81346126.0, "step": 35515 }, { "entropy": 5.3360363960266115, "epoch": 3.511269276393832, "grad_norm": 1.0234375, "learning_rate": 0.0003804884344953063, "loss": 4.882, "mean_token_accuracy": 0.2258705511689186, "num_tokens": 81358093.0, "step": 35520 }, { "entropy": 5.40121898651123, "epoch": 3.511763542902333, "grad_norm": 1.1171875, "learning_rate": 0.00038045726210541144, "loss": 4.9516, "mean_token_accuracy": 0.22141797840595245, "num_tokens": 81369734.0, "step": 35525 }, { "entropy": 5.349990653991699, "epoch": 3.5122578094108343, "grad_norm": 1.0234375, "learning_rate": 0.0003804260871212516, "loss": 4.9087, "mean_token_accuracy": 0.22574088275432586, "num_tokens": 81381474.0, "step": 35530 }, { "entropy": 5.300096559524536, "epoch": 3.5127520759193356, "grad_norm": 1.0078125, "learning_rate": 0.0003803949095435937, "loss": 4.8499, "mean_token_accuracy": 0.22507714480161667, "num_tokens": 81394661.0, "step": 35535 }, { "entropy": 5.445417785644532, "epoch": 3.513246342427837, "grad_norm": 1.09375, "learning_rate": 0.0003803637293732046, "loss": 4.9966, "mean_token_accuracy": 0.21807651668787004, "num_tokens": 81405591.0, "step": 35540 }, { "entropy": 5.40941162109375, "epoch": 3.5137406089363385, "grad_norm": 0.9921875, "learning_rate": 0.00038033254661085146, "loss": 5.0131, "mean_token_accuracy": 0.21807652860879898, "num_tokens": 81417561.0, "step": 35545 }, { "entropy": 5.443903207778931, "epoch": 3.51423487544484, "grad_norm": 1.046875, "learning_rate": 0.00038030136125730135, "loss": 4.9726, "mean_token_accuracy": 0.21926791667938234, "num_tokens": 81430502.0, "step": 35550 }, { "entropy": 5.3760340213775635, "epoch": 3.5147291419533415, "grad_norm": 1.0078125, "learning_rate": 0.0003802701733133214, "loss": 4.9141, "mean_token_accuracy": 0.22555883079767228, "num_tokens": 81441717.0, "step": 35555 }, { "entropy": 5.320801019668579, "epoch": 3.515223408461843, "grad_norm": 1.09375, "learning_rate": 0.00038023898277967885, "loss": 4.8553, "mean_token_accuracy": 0.22992610931396484, "num_tokens": 81453282.0, "step": 35560 }, { "entropy": 5.3407166481018065, "epoch": 3.515717674970344, "grad_norm": 1.046875, "learning_rate": 0.000380207789657141, "loss": 4.8864, "mean_token_accuracy": 0.22186102569103242, "num_tokens": 81463582.0, "step": 35565 }, { "entropy": 5.326526165008545, "epoch": 3.5162119414788453, "grad_norm": 0.96875, "learning_rate": 0.0003801765939464752, "loss": 4.8804, "mean_token_accuracy": 0.22806383967399596, "num_tokens": 81475490.0, "step": 35570 }, { "entropy": 5.3576818943023685, "epoch": 3.5167062079873466, "grad_norm": 0.93359375, "learning_rate": 0.0003801453956484489, "loss": 4.8435, "mean_token_accuracy": 0.23497522324323655, "num_tokens": 81486939.0, "step": 35575 }, { "entropy": 5.3534018993377686, "epoch": 3.5172004744958483, "grad_norm": 1.015625, "learning_rate": 0.0003801141947638295, "loss": 4.9016, "mean_token_accuracy": 0.22537907510995864, "num_tokens": 81498260.0, "step": 35580 }, { "entropy": 5.379961109161377, "epoch": 3.5176947410043495, "grad_norm": 1.0078125, "learning_rate": 0.00038008299129338463, "loss": 4.8389, "mean_token_accuracy": 0.233942674100399, "num_tokens": 81508788.0, "step": 35585 }, { "entropy": 5.398923110961914, "epoch": 3.518189007512851, "grad_norm": 1.0234375, "learning_rate": 0.00038005178523788184, "loss": 4.9484, "mean_token_accuracy": 0.21832203567028047, "num_tokens": 81520500.0, "step": 35590 }, { "entropy": 5.293336868286133, "epoch": 3.5186832740213525, "grad_norm": 1.0, "learning_rate": 0.00038002057659808884, "loss": 4.8977, "mean_token_accuracy": 0.22243375033140184, "num_tokens": 81531617.0, "step": 35595 }, { "entropy": 5.40934009552002, "epoch": 3.5191775405298538, "grad_norm": 1.0390625, "learning_rate": 0.0003799893653747735, "loss": 4.8827, "mean_token_accuracy": 0.22816220670938492, "num_tokens": 81542814.0, "step": 35600 }, { "entropy": 5.32665867805481, "epoch": 3.519671807038355, "grad_norm": 1.125, "learning_rate": 0.00037995815156870334, "loss": 4.8074, "mean_token_accuracy": 0.235041606426239, "num_tokens": 81552551.0, "step": 35605 }, { "entropy": 5.388699626922607, "epoch": 3.5201660735468563, "grad_norm": 1.03125, "learning_rate": 0.00037992693518064635, "loss": 5.0332, "mean_token_accuracy": 0.21169514656066896, "num_tokens": 81564576.0, "step": 35610 }, { "entropy": 5.36256594657898, "epoch": 3.520660340055358, "grad_norm": 0.96484375, "learning_rate": 0.00037989571621137053, "loss": 4.8818, "mean_token_accuracy": 0.2299272358417511, "num_tokens": 81575639.0, "step": 35615 }, { "entropy": 5.418667793273926, "epoch": 3.5211546065638593, "grad_norm": 1.0625, "learning_rate": 0.00037986449466164383, "loss": 4.9189, "mean_token_accuracy": 0.21851727068424226, "num_tokens": 81587012.0, "step": 35620 }, { "entropy": 5.369828701019287, "epoch": 3.5216488730723605, "grad_norm": 0.98046875, "learning_rate": 0.0003798332705322343, "loss": 4.8991, "mean_token_accuracy": 0.22809659391641618, "num_tokens": 81598194.0, "step": 35625 }, { "entropy": 5.359159469604492, "epoch": 3.5221431395808622, "grad_norm": 1.109375, "learning_rate": 0.0003798020438239101, "loss": 4.9222, "mean_token_accuracy": 0.2231315165758133, "num_tokens": 81608702.0, "step": 35630 }, { "entropy": 5.3343226432800295, "epoch": 3.5226374060893635, "grad_norm": 0.9296875, "learning_rate": 0.0003797708145374392, "loss": 4.8925, "mean_token_accuracy": 0.2302893027663231, "num_tokens": 81619598.0, "step": 35635 }, { "entropy": 5.380286693572998, "epoch": 3.5231316725978647, "grad_norm": 0.97265625, "learning_rate": 0.0003797395826735901, "loss": 4.9128, "mean_token_accuracy": 0.21611912548542023, "num_tokens": 81631928.0, "step": 35640 }, { "entropy": 5.494489526748657, "epoch": 3.523625939106366, "grad_norm": 0.9921875, "learning_rate": 0.00037970834823313106, "loss": 5.0482, "mean_token_accuracy": 0.2140463784337044, "num_tokens": 81644553.0, "step": 35645 }, { "entropy": 5.460727262496948, "epoch": 3.5241202056148673, "grad_norm": 1.046875, "learning_rate": 0.00037967711121683037, "loss": 4.9965, "mean_token_accuracy": 0.2166570708155632, "num_tokens": 81656633.0, "step": 35650 }, { "entropy": 5.378783178329468, "epoch": 3.524614472123369, "grad_norm": 0.9765625, "learning_rate": 0.0003796458716254565, "loss": 4.8998, "mean_token_accuracy": 0.22698196917772293, "num_tokens": 81669287.0, "step": 35655 }, { "entropy": 5.303140354156494, "epoch": 3.5251087386318702, "grad_norm": 1.109375, "learning_rate": 0.00037961462945977794, "loss": 4.794, "mean_token_accuracy": 0.23135911375284196, "num_tokens": 81680298.0, "step": 35660 }, { "entropy": 5.375480222702026, "epoch": 3.525603005140372, "grad_norm": 1.1015625, "learning_rate": 0.0003795833847205633, "loss": 4.9641, "mean_token_accuracy": 0.2174853965640068, "num_tokens": 81691088.0, "step": 35665 }, { "entropy": 5.398610162734985, "epoch": 3.526097271648873, "grad_norm": 0.96484375, "learning_rate": 0.0003795521374085811, "loss": 4.914, "mean_token_accuracy": 0.22223890721797943, "num_tokens": 81701791.0, "step": 35670 }, { "entropy": 5.476521110534668, "epoch": 3.5265915381573745, "grad_norm": 1.046875, "learning_rate": 0.00037952088752460025, "loss": 5.0159, "mean_token_accuracy": 0.216519333422184, "num_tokens": 81713682.0, "step": 35675 }, { "entropy": 5.3094910144805905, "epoch": 3.5270858046658757, "grad_norm": 1.125, "learning_rate": 0.0003794896350693893, "loss": 4.7579, "mean_token_accuracy": 0.2445613369345665, "num_tokens": 81724857.0, "step": 35680 }, { "entropy": 5.386565065383911, "epoch": 3.527580071174377, "grad_norm": 1.1328125, "learning_rate": 0.000379458380043717, "loss": 4.9098, "mean_token_accuracy": 0.2245212808251381, "num_tokens": 81737074.0, "step": 35685 }, { "entropy": 5.452234077453613, "epoch": 3.5280743376828787, "grad_norm": 1.078125, "learning_rate": 0.0003794271224483524, "loss": 4.9988, "mean_token_accuracy": 0.21030569076538086, "num_tokens": 81749679.0, "step": 35690 }, { "entropy": 5.368377447128296, "epoch": 3.52856860419138, "grad_norm": 1.046875, "learning_rate": 0.00037939586228406445, "loss": 4.906, "mean_token_accuracy": 0.22342533320188523, "num_tokens": 81761165.0, "step": 35695 }, { "entropy": 5.329142141342163, "epoch": 3.5290628706998812, "grad_norm": 0.9921875, "learning_rate": 0.00037936459955162204, "loss": 4.7725, "mean_token_accuracy": 0.2392613783478737, "num_tokens": 81773289.0, "step": 35700 }, { "entropy": 5.367126893997193, "epoch": 3.529557137208383, "grad_norm": 0.99609375, "learning_rate": 0.0003793333342517943, "loss": 4.856, "mean_token_accuracy": 0.22544315010309218, "num_tokens": 81785021.0, "step": 35705 }, { "entropy": 5.316310596466065, "epoch": 3.530051403716884, "grad_norm": 1.0078125, "learning_rate": 0.0003793020663853503, "loss": 4.8602, "mean_token_accuracy": 0.22383590638637543, "num_tokens": 81796111.0, "step": 35710 }, { "entropy": 5.356758117675781, "epoch": 3.5305456702253855, "grad_norm": 0.9609375, "learning_rate": 0.0003792707959530594, "loss": 4.8452, "mean_token_accuracy": 0.22855856418609619, "num_tokens": 81806927.0, "step": 35715 }, { "entropy": 5.410068702697754, "epoch": 3.5310399367338867, "grad_norm": 0.9765625, "learning_rate": 0.0003792395229556907, "loss": 5.0262, "mean_token_accuracy": 0.21530334055423736, "num_tokens": 81819942.0, "step": 35720 }, { "entropy": 5.3535853862762455, "epoch": 3.5315342032423884, "grad_norm": 1.078125, "learning_rate": 0.0003792082473940135, "loss": 4.9107, "mean_token_accuracy": 0.22415890097618102, "num_tokens": 81831192.0, "step": 35725 }, { "entropy": 5.4085243225097654, "epoch": 3.5320284697508897, "grad_norm": 0.8984375, "learning_rate": 0.0003791769692687973, "loss": 4.9287, "mean_token_accuracy": 0.2243881031870842, "num_tokens": 81844684.0, "step": 35730 }, { "entropy": 5.400975704193115, "epoch": 3.532522736259391, "grad_norm": 0.95703125, "learning_rate": 0.00037914568858081146, "loss": 4.9489, "mean_token_accuracy": 0.22354546338319778, "num_tokens": 81855379.0, "step": 35735 }, { "entropy": 5.321661520004272, "epoch": 3.5330170027678927, "grad_norm": 0.98046875, "learning_rate": 0.0003791144053308256, "loss": 4.7546, "mean_token_accuracy": 0.23168833255767823, "num_tokens": 81867560.0, "step": 35740 }, { "entropy": 5.321735525131226, "epoch": 3.533511269276394, "grad_norm": 1.0859375, "learning_rate": 0.00037908311951960916, "loss": 4.9066, "mean_token_accuracy": 0.22142521440982818, "num_tokens": 81879298.0, "step": 35745 }, { "entropy": 5.35098786354065, "epoch": 3.534005535784895, "grad_norm": 1.0234375, "learning_rate": 0.0003790518311479318, "loss": 4.8961, "mean_token_accuracy": 0.22518471479415894, "num_tokens": 81891323.0, "step": 35750 }, { "entropy": 5.337911939620971, "epoch": 3.5344998022933964, "grad_norm": 1.046875, "learning_rate": 0.0003790205402165633, "loss": 4.8164, "mean_token_accuracy": 0.23768679797649384, "num_tokens": 81901324.0, "step": 35755 }, { "entropy": 5.389211368560791, "epoch": 3.534994068801898, "grad_norm": 1.1171875, "learning_rate": 0.00037898924672627346, "loss": 4.9456, "mean_token_accuracy": 0.22096111625432968, "num_tokens": 81911740.0, "step": 35760 }, { "entropy": 5.3115562915802, "epoch": 3.5354883353103994, "grad_norm": 1.0390625, "learning_rate": 0.00037895795067783184, "loss": 4.8163, "mean_token_accuracy": 0.22595912963151932, "num_tokens": 81922685.0, "step": 35765 }, { "entropy": 5.326155948638916, "epoch": 3.5359826018189007, "grad_norm": 1.046875, "learning_rate": 0.0003789266520720086, "loss": 4.9066, "mean_token_accuracy": 0.22974238842725753, "num_tokens": 81935822.0, "step": 35770 }, { "entropy": 5.327796888351441, "epoch": 3.5364768683274024, "grad_norm": 1.1171875, "learning_rate": 0.0003788953509095736, "loss": 4.8639, "mean_token_accuracy": 0.2318188801407814, "num_tokens": 81948420.0, "step": 35775 }, { "entropy": 5.400712013244629, "epoch": 3.5369711348359036, "grad_norm": 1.046875, "learning_rate": 0.0003788640471912968, "loss": 4.9138, "mean_token_accuracy": 0.22621310353279114, "num_tokens": 81959740.0, "step": 35780 }, { "entropy": 5.333722400665283, "epoch": 3.537465401344405, "grad_norm": 1.0078125, "learning_rate": 0.00037883274091794837, "loss": 4.858, "mean_token_accuracy": 0.22978856712579726, "num_tokens": 81971334.0, "step": 35785 }, { "entropy": 5.357579040527344, "epoch": 3.537959667852906, "grad_norm": 1.109375, "learning_rate": 0.00037880143209029844, "loss": 4.8838, "mean_token_accuracy": 0.22318846881389617, "num_tokens": 81981740.0, "step": 35790 }, { "entropy": 5.363036060333252, "epoch": 3.5384539343614074, "grad_norm": 1.0703125, "learning_rate": 0.0003787701207091171, "loss": 4.9381, "mean_token_accuracy": 0.22171318680047988, "num_tokens": 81992987.0, "step": 35795 }, { "entropy": 5.379034042358398, "epoch": 3.538948200869909, "grad_norm": 1.0859375, "learning_rate": 0.00037873880677517476, "loss": 4.9048, "mean_token_accuracy": 0.223313008248806, "num_tokens": 82003590.0, "step": 35800 }, { "entropy": 5.457319927215576, "epoch": 3.5394424673784104, "grad_norm": 0.984375, "learning_rate": 0.0003787074902892416, "loss": 4.9589, "mean_token_accuracy": 0.21598458886146546, "num_tokens": 82014894.0, "step": 35805 }, { "entropy": 5.328961420059204, "epoch": 3.5399367338869117, "grad_norm": 1.1015625, "learning_rate": 0.00037867617125208813, "loss": 4.8392, "mean_token_accuracy": 0.22856746315956117, "num_tokens": 82025214.0, "step": 35810 }, { "entropy": 5.312014532089234, "epoch": 3.5404310003954134, "grad_norm": 0.97265625, "learning_rate": 0.0003786448496644848, "loss": 4.8642, "mean_token_accuracy": 0.22681592255830765, "num_tokens": 82038866.0, "step": 35815 }, { "entropy": 5.390064668655396, "epoch": 3.5409252669039146, "grad_norm": 1.0625, "learning_rate": 0.000378613525527202, "loss": 4.9874, "mean_token_accuracy": 0.21908834725618362, "num_tokens": 82051114.0, "step": 35820 }, { "entropy": 5.320617294311523, "epoch": 3.541419533412416, "grad_norm": 0.953125, "learning_rate": 0.00037858219884101047, "loss": 4.9006, "mean_token_accuracy": 0.22503003031015395, "num_tokens": 82063091.0, "step": 35825 }, { "entropy": 5.371501827239991, "epoch": 3.541913799920917, "grad_norm": 1.03125, "learning_rate": 0.0003785508696066808, "loss": 4.8504, "mean_token_accuracy": 0.22753026932477952, "num_tokens": 82073363.0, "step": 35830 }, { "entropy": 5.409093809127808, "epoch": 3.542408066429419, "grad_norm": 1.1015625, "learning_rate": 0.00037851953782498367, "loss": 4.9432, "mean_token_accuracy": 0.21445583254098893, "num_tokens": 82083477.0, "step": 35835 }, { "entropy": 5.363201379776001, "epoch": 3.54290233293792, "grad_norm": 0.96484375, "learning_rate": 0.0003784882034966898, "loss": 4.8267, "mean_token_accuracy": 0.22567698806524278, "num_tokens": 82094738.0, "step": 35840 }, { "entropy": 5.362297487258911, "epoch": 3.5433965994464214, "grad_norm": 1.015625, "learning_rate": 0.00037845686662257, "loss": 4.8927, "mean_token_accuracy": 0.2260923519730568, "num_tokens": 82105769.0, "step": 35845 }, { "entropy": 5.377329921722412, "epoch": 3.543890865954923, "grad_norm": 0.9921875, "learning_rate": 0.0003784255272033954, "loss": 4.937, "mean_token_accuracy": 0.22094734907150268, "num_tokens": 82117644.0, "step": 35850 }, { "entropy": 5.348103094100952, "epoch": 3.5443851324634243, "grad_norm": 0.9765625, "learning_rate": 0.00037839418523993667, "loss": 4.8496, "mean_token_accuracy": 0.2295177161693573, "num_tokens": 82129716.0, "step": 35855 }, { "entropy": 5.265044832229615, "epoch": 3.5448793989719256, "grad_norm": 1.109375, "learning_rate": 0.000378362840732965, "loss": 4.7803, "mean_token_accuracy": 0.23901551216840744, "num_tokens": 82142378.0, "step": 35860 }, { "entropy": 5.284296607971191, "epoch": 3.545373665480427, "grad_norm": 1.046875, "learning_rate": 0.00037833149368325143, "loss": 4.8001, "mean_token_accuracy": 0.23130851984024048, "num_tokens": 82152893.0, "step": 35865 }, { "entropy": 5.359723138809204, "epoch": 3.5458679319889286, "grad_norm": 0.96875, "learning_rate": 0.000378300144091567, "loss": 4.952, "mean_token_accuracy": 0.22596070170402527, "num_tokens": 82165813.0, "step": 35870 }, { "entropy": 5.33999719619751, "epoch": 3.54636219849743, "grad_norm": 1.0234375, "learning_rate": 0.000378268791958683, "loss": 4.8975, "mean_token_accuracy": 0.21875406950712203, "num_tokens": 82177641.0, "step": 35875 }, { "entropy": 5.422315835952759, "epoch": 3.546856465005931, "grad_norm": 1.0546875, "learning_rate": 0.0003782374372853708, "loss": 4.8711, "mean_token_accuracy": 0.22439011484384536, "num_tokens": 82187594.0, "step": 35880 }, { "entropy": 5.341062450408936, "epoch": 3.547350731514433, "grad_norm": 1.0234375, "learning_rate": 0.0003782060800724016, "loss": 4.8912, "mean_token_accuracy": 0.22224678993225097, "num_tokens": 82199177.0, "step": 35885 }, { "entropy": 5.371145296096802, "epoch": 3.547844998022934, "grad_norm": 1.09375, "learning_rate": 0.0003781747203205468, "loss": 4.9005, "mean_token_accuracy": 0.2173135071992874, "num_tokens": 82211176.0, "step": 35890 }, { "entropy": 5.325938320159912, "epoch": 3.5483392645314353, "grad_norm": 0.94921875, "learning_rate": 0.00037814335803057773, "loss": 4.8029, "mean_token_accuracy": 0.22973656207323073, "num_tokens": 82222767.0, "step": 35895 }, { "entropy": 5.379412508010864, "epoch": 3.5488335310399366, "grad_norm": 0.98828125, "learning_rate": 0.0003781119932032662, "loss": 4.9242, "mean_token_accuracy": 0.22057341784238815, "num_tokens": 82234060.0, "step": 35900 }, { "entropy": 5.390061950683593, "epoch": 3.549327797548438, "grad_norm": 1.09375, "learning_rate": 0.00037808062583938367, "loss": 4.9069, "mean_token_accuracy": 0.22166765630245208, "num_tokens": 82244910.0, "step": 35905 }, { "entropy": 5.405637407302857, "epoch": 3.5498220640569396, "grad_norm": 0.94140625, "learning_rate": 0.0003780492559397017, "loss": 4.9862, "mean_token_accuracy": 0.21612415313720704, "num_tokens": 82257730.0, "step": 35910 }, { "entropy": 5.339308452606201, "epoch": 3.550316330565441, "grad_norm": 1.015625, "learning_rate": 0.0003780178835049921, "loss": 4.8383, "mean_token_accuracy": 0.2383595108985901, "num_tokens": 82268688.0, "step": 35915 }, { "entropy": 5.343853616714478, "epoch": 3.5508105970739425, "grad_norm": 1.09375, "learning_rate": 0.0003779865085360265, "loss": 4.912, "mean_token_accuracy": 0.22326348721981049, "num_tokens": 82279562.0, "step": 35920 }, { "entropy": 5.384601879119873, "epoch": 3.551304863582444, "grad_norm": 1.015625, "learning_rate": 0.0003779551310335768, "loss": 4.8489, "mean_token_accuracy": 0.22973953038454056, "num_tokens": 82289945.0, "step": 35925 }, { "entropy": 5.414995908737183, "epoch": 3.551799130090945, "grad_norm": 1.0, "learning_rate": 0.00037792375099841505, "loss": 4.9355, "mean_token_accuracy": 0.2279105380177498, "num_tokens": 82301878.0, "step": 35930 }, { "entropy": 5.372233486175537, "epoch": 3.5522933965994463, "grad_norm": 1.0703125, "learning_rate": 0.00037789236843131297, "loss": 4.9363, "mean_token_accuracy": 0.2245788171887398, "num_tokens": 82313565.0, "step": 35935 }, { "entropy": 5.382424640655517, "epoch": 3.5527876631079476, "grad_norm": 1.03125, "learning_rate": 0.0003778609833330426, "loss": 4.9338, "mean_token_accuracy": 0.2176203414797783, "num_tokens": 82324375.0, "step": 35940 }, { "entropy": 5.455204963684082, "epoch": 3.5532819296164493, "grad_norm": 0.9921875, "learning_rate": 0.0003778295957043761, "loss": 5.0362, "mean_token_accuracy": 0.21008071750402452, "num_tokens": 82335642.0, "step": 35945 }, { "entropy": 5.345562076568603, "epoch": 3.5537761961249505, "grad_norm": 1.03125, "learning_rate": 0.0003777982055460857, "loss": 4.7872, "mean_token_accuracy": 0.24031329303979873, "num_tokens": 82345847.0, "step": 35950 }, { "entropy": 5.465438938140869, "epoch": 3.554270462633452, "grad_norm": 1.0546875, "learning_rate": 0.0003777668128589434, "loss": 5.0075, "mean_token_accuracy": 0.21809862107038497, "num_tokens": 82358249.0, "step": 35955 }, { "entropy": 5.354618692398072, "epoch": 3.5547647291419535, "grad_norm": 1.0234375, "learning_rate": 0.0003777354176437216, "loss": 4.8856, "mean_token_accuracy": 0.22534047067165375, "num_tokens": 82369996.0, "step": 35960 }, { "entropy": 5.402975130081177, "epoch": 3.555258995650455, "grad_norm": 1.0546875, "learning_rate": 0.0003777040199011926, "loss": 4.8414, "mean_token_accuracy": 0.23164844810962676, "num_tokens": 82381569.0, "step": 35965 }, { "entropy": 5.312043905258179, "epoch": 3.555753262158956, "grad_norm": 1.046875, "learning_rate": 0.00037767261963212866, "loss": 4.9236, "mean_token_accuracy": 0.21461534053087233, "num_tokens": 82392343.0, "step": 35970 }, { "entropy": 5.306873369216919, "epoch": 3.5562475286674573, "grad_norm": 1.0625, "learning_rate": 0.00037764121683730247, "loss": 4.9222, "mean_token_accuracy": 0.2222127765417099, "num_tokens": 82403681.0, "step": 35975 }, { "entropy": 5.396149063110352, "epoch": 3.556741795175959, "grad_norm": 0.99609375, "learning_rate": 0.00037760981151748645, "loss": 4.9545, "mean_token_accuracy": 0.21818052232265472, "num_tokens": 82415773.0, "step": 35980 }, { "entropy": 5.353687286376953, "epoch": 3.5572360616844603, "grad_norm": 1.078125, "learning_rate": 0.0003775784036734531, "loss": 4.7992, "mean_token_accuracy": 0.2325186848640442, "num_tokens": 82426636.0, "step": 35985 }, { "entropy": 5.484178924560547, "epoch": 3.5577303281929615, "grad_norm": 1.0234375, "learning_rate": 0.0003775469933059751, "loss": 4.9894, "mean_token_accuracy": 0.21849699169397355, "num_tokens": 82438546.0, "step": 35990 }, { "entropy": 5.3433209419250485, "epoch": 3.5582245947014632, "grad_norm": 0.98828125, "learning_rate": 0.00037751558041582514, "loss": 4.9139, "mean_token_accuracy": 0.21960765570402146, "num_tokens": 82451911.0, "step": 35995 }, { "entropy": 5.370611572265625, "epoch": 3.5587188612099645, "grad_norm": 1.078125, "learning_rate": 0.000377484165003776, "loss": 4.8445, "mean_token_accuracy": 0.22619989663362502, "num_tokens": 82464691.0, "step": 36000 }, { "epoch": 3.5587188612099645, "eval_entropy": 5.1553237261074205, "eval_loss": 4.991928577423096, "eval_mean_token_accuracy": 0.22754630471727505, "eval_num_tokens": 82464691.0, "eval_runtime": 26.4644, "eval_samples_per_second": 1228.557, "eval_steps_per_second": 153.603, "step": 36000 }, { "entropy": 5.3582721710205075, "epoch": 3.5592131277184658, "grad_norm": 1.015625, "learning_rate": 0.00037745274707060055, "loss": 4.9246, "mean_token_accuracy": 0.22260909229516984, "num_tokens": 82476498.0, "step": 36005 }, { "entropy": 5.296879386901855, "epoch": 3.559707394226967, "grad_norm": 0.9375, "learning_rate": 0.00037742132661707157, "loss": 4.8461, "mean_token_accuracy": 0.23117797076702118, "num_tokens": 82488434.0, "step": 36010 }, { "entropy": 5.335042428970337, "epoch": 3.5602016607354683, "grad_norm": 0.9765625, "learning_rate": 0.00037738990364396207, "loss": 4.8197, "mean_token_accuracy": 0.2264535829424858, "num_tokens": 82500277.0, "step": 36015 }, { "entropy": 5.418668365478515, "epoch": 3.56069592724397, "grad_norm": 1.0078125, "learning_rate": 0.00037735847815204503, "loss": 4.955, "mean_token_accuracy": 0.22316774725914001, "num_tokens": 82513107.0, "step": 36020 }, { "entropy": 5.401876926422119, "epoch": 3.5611901937524713, "grad_norm": 1.0078125, "learning_rate": 0.00037732705014209366, "loss": 4.9222, "mean_token_accuracy": 0.22162585854530334, "num_tokens": 82524967.0, "step": 36025 }, { "entropy": 5.340512657165528, "epoch": 3.561684460260973, "grad_norm": 1.171875, "learning_rate": 0.0003772956196148809, "loss": 4.8799, "mean_token_accuracy": 0.22124444097280502, "num_tokens": 82536721.0, "step": 36030 }, { "entropy": 5.429541969299317, "epoch": 3.5621787267694742, "grad_norm": 0.92578125, "learning_rate": 0.00037726418657118004, "loss": 4.9385, "mean_token_accuracy": 0.2233225643634796, "num_tokens": 82549386.0, "step": 36035 }, { "entropy": 5.3624509334564205, "epoch": 3.5626729932779755, "grad_norm": 0.96875, "learning_rate": 0.00037723275101176436, "loss": 4.8076, "mean_token_accuracy": 0.23480848520994185, "num_tokens": 82560207.0, "step": 36040 }, { "entropy": 5.3558636665344235, "epoch": 3.5631672597864767, "grad_norm": 1.046875, "learning_rate": 0.0003772013129374071, "loss": 4.9349, "mean_token_accuracy": 0.22056962847709655, "num_tokens": 82570484.0, "step": 36045 }, { "entropy": 5.347987461090088, "epoch": 3.563661526294978, "grad_norm": 1.0078125, "learning_rate": 0.0003771698723488817, "loss": 4.8538, "mean_token_accuracy": 0.221049901843071, "num_tokens": 82581833.0, "step": 36050 }, { "entropy": 5.28921594619751, "epoch": 3.5641557928034797, "grad_norm": 0.98828125, "learning_rate": 0.00037713842924696155, "loss": 4.8016, "mean_token_accuracy": 0.23402377665042878, "num_tokens": 82593351.0, "step": 36055 }, { "entropy": 5.395655393600464, "epoch": 3.564650059311981, "grad_norm": 1.0625, "learning_rate": 0.0003771069836324203, "loss": 4.937, "mean_token_accuracy": 0.21493322253227234, "num_tokens": 82606644.0, "step": 36060 }, { "entropy": 5.326463794708252, "epoch": 3.5651443258204822, "grad_norm": 1.0234375, "learning_rate": 0.0003770755355060313, "loss": 4.933, "mean_token_accuracy": 0.22492736279964448, "num_tokens": 82618779.0, "step": 36065 }, { "entropy": 5.345552015304565, "epoch": 3.565638592328984, "grad_norm": 1.046875, "learning_rate": 0.0003770440848685683, "loss": 4.8574, "mean_token_accuracy": 0.225765398144722, "num_tokens": 82629968.0, "step": 36070 }, { "entropy": 5.34907169342041, "epoch": 3.566132858837485, "grad_norm": 0.98046875, "learning_rate": 0.00037701263172080514, "loss": 4.8672, "mean_token_accuracy": 0.23132342100143433, "num_tokens": 82641586.0, "step": 36075 }, { "entropy": 5.412793874740601, "epoch": 3.5666271253459865, "grad_norm": 1.0, "learning_rate": 0.00037698117606351525, "loss": 4.9796, "mean_token_accuracy": 0.21982377171516418, "num_tokens": 82651901.0, "step": 36080 }, { "entropy": 5.282834672927857, "epoch": 3.5671213918544877, "grad_norm": 0.96875, "learning_rate": 0.0003769497178974726, "loss": 4.8374, "mean_token_accuracy": 0.2314256712794304, "num_tokens": 82663055.0, "step": 36085 }, { "entropy": 5.280278921127319, "epoch": 3.5676156583629894, "grad_norm": 0.98828125, "learning_rate": 0.0003769182572234512, "loss": 4.7923, "mean_token_accuracy": 0.23667036592960358, "num_tokens": 82674709.0, "step": 36090 }, { "entropy": 5.365299940109253, "epoch": 3.5681099248714907, "grad_norm": 1.015625, "learning_rate": 0.0003768867940422248, "loss": 4.7973, "mean_token_accuracy": 0.2387310281395912, "num_tokens": 82685215.0, "step": 36095 }, { "entropy": 5.409591388702393, "epoch": 3.568604191379992, "grad_norm": 1.03125, "learning_rate": 0.0003768553283545674, "loss": 4.9585, "mean_token_accuracy": 0.22036982625722884, "num_tokens": 82697473.0, "step": 36100 }, { "entropy": 5.278342580795288, "epoch": 3.5690984578884937, "grad_norm": 1.078125, "learning_rate": 0.0003768238601612532, "loss": 4.8395, "mean_token_accuracy": 0.22933488339185715, "num_tokens": 82708033.0, "step": 36105 }, { "entropy": 5.3069933414459225, "epoch": 3.569592724396995, "grad_norm": 1.109375, "learning_rate": 0.0003767923894630562, "loss": 4.8386, "mean_token_accuracy": 0.22580899745225907, "num_tokens": 82719410.0, "step": 36110 }, { "entropy": 5.388894987106323, "epoch": 3.570086990905496, "grad_norm": 1.09375, "learning_rate": 0.00037676091626075056, "loss": 4.794, "mean_token_accuracy": 0.22915762960910796, "num_tokens": 82730648.0, "step": 36115 }, { "entropy": 5.3518335819244385, "epoch": 3.5705812574139975, "grad_norm": 1.078125, "learning_rate": 0.0003767294405551107, "loss": 4.9016, "mean_token_accuracy": 0.22254659831523896, "num_tokens": 82742041.0, "step": 36120 }, { "entropy": 5.387453174591064, "epoch": 3.571075523922499, "grad_norm": 1.15625, "learning_rate": 0.0003766979623469108, "loss": 4.929, "mean_token_accuracy": 0.2192847266793251, "num_tokens": 82754083.0, "step": 36125 }, { "entropy": 5.430908346176148, "epoch": 3.5715697904310004, "grad_norm": 0.94140625, "learning_rate": 0.0003766664816369252, "loss": 4.9768, "mean_token_accuracy": 0.21282288879156114, "num_tokens": 82766735.0, "step": 36130 }, { "entropy": 5.434899997711182, "epoch": 3.5720640569395017, "grad_norm": 1.078125, "learning_rate": 0.00037663499842592845, "loss": 5.0163, "mean_token_accuracy": 0.21411536782979965, "num_tokens": 82778498.0, "step": 36135 }, { "entropy": 5.475568151473999, "epoch": 3.5725583234480034, "grad_norm": 1.109375, "learning_rate": 0.00037660351271469496, "loss": 5.001, "mean_token_accuracy": 0.2114973321557045, "num_tokens": 82789927.0, "step": 36140 }, { "entropy": 5.40434308052063, "epoch": 3.5730525899565047, "grad_norm": 1.0078125, "learning_rate": 0.0003765720245039993, "loss": 4.8875, "mean_token_accuracy": 0.22115093916654588, "num_tokens": 82800846.0, "step": 36145 }, { "entropy": 5.323550844192505, "epoch": 3.573546856465006, "grad_norm": 1.078125, "learning_rate": 0.00037654053379461606, "loss": 4.9014, "mean_token_accuracy": 0.22038141191005706, "num_tokens": 82812912.0, "step": 36150 }, { "entropy": 5.386518096923828, "epoch": 3.574041122973507, "grad_norm": 0.98046875, "learning_rate": 0.0003765090405873199, "loss": 4.9479, "mean_token_accuracy": 0.2225004956126213, "num_tokens": 82824186.0, "step": 36155 }, { "entropy": 5.349151372909546, "epoch": 3.5745353894820084, "grad_norm": 1.015625, "learning_rate": 0.0003764775448828856, "loss": 4.9261, "mean_token_accuracy": 0.22722647190093995, "num_tokens": 82835599.0, "step": 36160 }, { "entropy": 5.323567628860474, "epoch": 3.57502965599051, "grad_norm": 1.0234375, "learning_rate": 0.00037644604668208805, "loss": 4.7879, "mean_token_accuracy": 0.2287730097770691, "num_tokens": 82846272.0, "step": 36165 }, { "entropy": 5.3890900135040285, "epoch": 3.5755239224990114, "grad_norm": 1.1328125, "learning_rate": 0.0003764145459857019, "loss": 4.9139, "mean_token_accuracy": 0.21889124661684037, "num_tokens": 82858245.0, "step": 36170 }, { "entropy": 5.403174495697021, "epoch": 3.576018189007513, "grad_norm": 1.0546875, "learning_rate": 0.00037638304279450225, "loss": 4.925, "mean_token_accuracy": 0.2238876312971115, "num_tokens": 82869951.0, "step": 36175 }, { "entropy": 5.3100879192352295, "epoch": 3.5765124555160144, "grad_norm": 1.1015625, "learning_rate": 0.00037635153710926394, "loss": 4.8249, "mean_token_accuracy": 0.23399822413921356, "num_tokens": 82880489.0, "step": 36180 }, { "entropy": 5.3540952682495115, "epoch": 3.5770067220245156, "grad_norm": 0.984375, "learning_rate": 0.00037632002893076217, "loss": 4.9593, "mean_token_accuracy": 0.2208590552210808, "num_tokens": 82892188.0, "step": 36185 }, { "entropy": 5.350983333587647, "epoch": 3.577500988533017, "grad_norm": 1.109375, "learning_rate": 0.000376288518259772, "loss": 4.8617, "mean_token_accuracy": 0.22965113520622255, "num_tokens": 82903504.0, "step": 36190 }, { "entropy": 5.319399118423462, "epoch": 3.577995255041518, "grad_norm": 0.97265625, "learning_rate": 0.0003762570050970685, "loss": 4.8039, "mean_token_accuracy": 0.22818130552768706, "num_tokens": 82914396.0, "step": 36195 }, { "entropy": 5.2737305641174315, "epoch": 3.57848952155002, "grad_norm": 0.95703125, "learning_rate": 0.000376225489443427, "loss": 4.7998, "mean_token_accuracy": 0.23316608518362045, "num_tokens": 82925759.0, "step": 36200 }, { "entropy": 5.330904245376587, "epoch": 3.578983788058521, "grad_norm": 1.0625, "learning_rate": 0.0003761939712996227, "loss": 4.8618, "mean_token_accuracy": 0.22488100677728654, "num_tokens": 82937474.0, "step": 36205 }, { "entropy": 5.423814201354981, "epoch": 3.5794780545670224, "grad_norm": 1.09375, "learning_rate": 0.0003761624506664311, "loss": 4.9433, "mean_token_accuracy": 0.21881335377693176, "num_tokens": 82948686.0, "step": 36210 }, { "entropy": 5.390163564682007, "epoch": 3.579972321075524, "grad_norm": 1.015625, "learning_rate": 0.0003761309275446274, "loss": 4.9292, "mean_token_accuracy": 0.22747351825237275, "num_tokens": 82960099.0, "step": 36215 }, { "entropy": 5.353944635391235, "epoch": 3.5804665875840254, "grad_norm": 1.0, "learning_rate": 0.0003760994019349873, "loss": 4.8491, "mean_token_accuracy": 0.2233394980430603, "num_tokens": 82971415.0, "step": 36220 }, { "entropy": 5.375739526748657, "epoch": 3.5809608540925266, "grad_norm": 1.0234375, "learning_rate": 0.0003760678738382862, "loss": 4.9412, "mean_token_accuracy": 0.21731544584035872, "num_tokens": 82983581.0, "step": 36225 }, { "entropy": 5.393738698959351, "epoch": 3.581455120601028, "grad_norm": 0.98828125, "learning_rate": 0.0003760363432552997, "loss": 4.9001, "mean_token_accuracy": 0.2250516891479492, "num_tokens": 82994817.0, "step": 36230 }, { "entropy": 5.303756761550903, "epoch": 3.5819493871095296, "grad_norm": 1.09375, "learning_rate": 0.0003760048101868035, "loss": 4.7979, "mean_token_accuracy": 0.23693961799144744, "num_tokens": 83004620.0, "step": 36235 }, { "entropy": 5.337575769424438, "epoch": 3.582443653618031, "grad_norm": 1.0859375, "learning_rate": 0.00037597327463357336, "loss": 4.9117, "mean_token_accuracy": 0.2175038769841194, "num_tokens": 83015257.0, "step": 36240 }, { "entropy": 5.258402585983276, "epoch": 3.582937920126532, "grad_norm": 1.0078125, "learning_rate": 0.0003759417365963849, "loss": 4.7494, "mean_token_accuracy": 0.23803631961345673, "num_tokens": 83026765.0, "step": 36245 }, { "entropy": 5.373844003677368, "epoch": 3.583432186635034, "grad_norm": 0.94140625, "learning_rate": 0.00037591019607601407, "loss": 4.9184, "mean_token_accuracy": 0.22234239876270295, "num_tokens": 83038893.0, "step": 36250 }, { "entropy": 5.2905220031738285, "epoch": 3.583926453143535, "grad_norm": 0.9765625, "learning_rate": 0.00037587865307323683, "loss": 4.8669, "mean_token_accuracy": 0.23194096982479095, "num_tokens": 83050615.0, "step": 36255 }, { "entropy": 5.418975830078125, "epoch": 3.5844207196520363, "grad_norm": 0.96484375, "learning_rate": 0.00037584710758882897, "loss": 4.9402, "mean_token_accuracy": 0.2200712338089943, "num_tokens": 83062459.0, "step": 36260 }, { "entropy": 5.445836067199707, "epoch": 3.5849149861605376, "grad_norm": 0.90625, "learning_rate": 0.00037581555962356666, "loss": 4.9978, "mean_token_accuracy": 0.21745892465114594, "num_tokens": 83073563.0, "step": 36265 }, { "entropy": 5.415084457397461, "epoch": 3.585409252669039, "grad_norm": 1.0703125, "learning_rate": 0.00037578400917822604, "loss": 4.9377, "mean_token_accuracy": 0.21675791144371032, "num_tokens": 83084831.0, "step": 36270 }, { "entropy": 5.36310715675354, "epoch": 3.5859035191775406, "grad_norm": 0.97265625, "learning_rate": 0.000375752456253583, "loss": 4.8521, "mean_token_accuracy": 0.2282091796398163, "num_tokens": 83096504.0, "step": 36275 }, { "entropy": 5.327261257171631, "epoch": 3.586397785686042, "grad_norm": 1.0625, "learning_rate": 0.000375720900850414, "loss": 4.9297, "mean_token_accuracy": 0.22356237322092057, "num_tokens": 83108312.0, "step": 36280 }, { "entropy": 5.310328531265259, "epoch": 3.5868920521945435, "grad_norm": 1.0703125, "learning_rate": 0.0003756893429694952, "loss": 4.8304, "mean_token_accuracy": 0.2325567916035652, "num_tokens": 83119040.0, "step": 36285 }, { "entropy": 5.377159643173218, "epoch": 3.587386318703045, "grad_norm": 1.0078125, "learning_rate": 0.00037565778261160296, "loss": 4.7752, "mean_token_accuracy": 0.23957739770412445, "num_tokens": 83129803.0, "step": 36290 }, { "entropy": 5.303463315963745, "epoch": 3.587880585211546, "grad_norm": 1.0234375, "learning_rate": 0.0003756262197775137, "loss": 4.8519, "mean_token_accuracy": 0.2304352268576622, "num_tokens": 83142364.0, "step": 36295 }, { "entropy": 5.27993803024292, "epoch": 3.5883748517200473, "grad_norm": 1.0859375, "learning_rate": 0.00037559465446800364, "loss": 4.8809, "mean_token_accuracy": 0.2229409098625183, "num_tokens": 83152813.0, "step": 36300 }, { "entropy": 5.465881490707398, "epoch": 3.5888691182285486, "grad_norm": 1.0703125, "learning_rate": 0.00037556308668384964, "loss": 5.0218, "mean_token_accuracy": 0.21707602590322495, "num_tokens": 83164052.0, "step": 36305 }, { "entropy": 5.398655748367309, "epoch": 3.5893633847370503, "grad_norm": 0.97265625, "learning_rate": 0.00037553151642582807, "loss": 4.8686, "mean_token_accuracy": 0.22257529497146605, "num_tokens": 83176236.0, "step": 36310 }, { "entropy": 5.330732011795044, "epoch": 3.5898576512455516, "grad_norm": 1.0390625, "learning_rate": 0.0003754999436947156, "loss": 4.9124, "mean_token_accuracy": 0.22084331810474395, "num_tokens": 83187173.0, "step": 36315 }, { "entropy": 5.37593674659729, "epoch": 3.590351917754053, "grad_norm": 0.99609375, "learning_rate": 0.0003754683684912889, "loss": 4.8957, "mean_token_accuracy": 0.22767562866210939, "num_tokens": 83199628.0, "step": 36320 }, { "entropy": 5.449776220321655, "epoch": 3.5908461842625545, "grad_norm": 1.109375, "learning_rate": 0.00037543679081632474, "loss": 4.9336, "mean_token_accuracy": 0.22522548586130142, "num_tokens": 83211748.0, "step": 36325 }, { "entropy": 5.283000326156616, "epoch": 3.591340450771056, "grad_norm": 1.140625, "learning_rate": 0.0003754052106706, "loss": 4.812, "mean_token_accuracy": 0.23188331723213196, "num_tokens": 83223078.0, "step": 36330 }, { "entropy": 5.363790273666382, "epoch": 3.591834717279557, "grad_norm": 1.046875, "learning_rate": 0.00037537362805489143, "loss": 4.8745, "mean_token_accuracy": 0.2306692823767662, "num_tokens": 83234046.0, "step": 36335 }, { "entropy": 5.378996276855469, "epoch": 3.5923289837880583, "grad_norm": 1.0546875, "learning_rate": 0.0003753420429699761, "loss": 4.9269, "mean_token_accuracy": 0.21831649392843247, "num_tokens": 83244121.0, "step": 36340 }, { "entropy": 5.413927316665649, "epoch": 3.59282325029656, "grad_norm": 1.1171875, "learning_rate": 0.0003753104554166309, "loss": 4.8769, "mean_token_accuracy": 0.22316502779722214, "num_tokens": 83254182.0, "step": 36345 }, { "entropy": 5.356520700454712, "epoch": 3.5933175168050613, "grad_norm": 1.015625, "learning_rate": 0.0003752788653956329, "loss": 4.8531, "mean_token_accuracy": 0.22837089151144027, "num_tokens": 83264527.0, "step": 36350 }, { "entropy": 5.395730304718017, "epoch": 3.5938117833135625, "grad_norm": 1.03125, "learning_rate": 0.0003752472729077593, "loss": 4.8969, "mean_token_accuracy": 0.2169907882809639, "num_tokens": 83275186.0, "step": 36355 }, { "entropy": 5.451711654663086, "epoch": 3.5943060498220643, "grad_norm": 1.0625, "learning_rate": 0.0003752156779537873, "loss": 5.0201, "mean_token_accuracy": 0.21423997282981871, "num_tokens": 83286919.0, "step": 36360 }, { "entropy": 5.390353536605835, "epoch": 3.5948003163305655, "grad_norm": 1.0078125, "learning_rate": 0.00037518408053449404, "loss": 4.8688, "mean_token_accuracy": 0.22217227518558502, "num_tokens": 83298112.0, "step": 36365 }, { "entropy": 5.332046318054199, "epoch": 3.5952945828390668, "grad_norm": 0.98828125, "learning_rate": 0.0003751524806506568, "loss": 4.9454, "mean_token_accuracy": 0.22163941115140914, "num_tokens": 83308978.0, "step": 36370 }, { "entropy": 5.397374010086059, "epoch": 3.595788849347568, "grad_norm": 1.046875, "learning_rate": 0.00037512087830305306, "loss": 4.9842, "mean_token_accuracy": 0.2149580627679825, "num_tokens": 83320780.0, "step": 36375 }, { "entropy": 5.4503217220306395, "epoch": 3.5962831158560697, "grad_norm": 1.1640625, "learning_rate": 0.0003750892734924601, "loss": 4.9769, "mean_token_accuracy": 0.21490403711795808, "num_tokens": 83332070.0, "step": 36380 }, { "entropy": 5.403571033477784, "epoch": 3.596777382364571, "grad_norm": 1.0234375, "learning_rate": 0.0003750576662196556, "loss": 4.9235, "mean_token_accuracy": 0.22100280821323395, "num_tokens": 83345506.0, "step": 36385 }, { "entropy": 5.452732753753662, "epoch": 3.5972716488730723, "grad_norm": 1.0390625, "learning_rate": 0.0003750260564854169, "loss": 5.0079, "mean_token_accuracy": 0.21736557334661483, "num_tokens": 83357097.0, "step": 36390 }, { "entropy": 5.322962236404419, "epoch": 3.597765915381574, "grad_norm": 1.0234375, "learning_rate": 0.0003749944442905217, "loss": 4.7998, "mean_token_accuracy": 0.23713620454072953, "num_tokens": 83369088.0, "step": 36395 }, { "entropy": 5.382613277435302, "epoch": 3.5982601818900752, "grad_norm": 0.8984375, "learning_rate": 0.0003749628296357477, "loss": 4.9192, "mean_token_accuracy": 0.22792432010173796, "num_tokens": 83381249.0, "step": 36400 }, { "entropy": 5.333266019821167, "epoch": 3.5987544483985765, "grad_norm": 1.046875, "learning_rate": 0.00037493121252187256, "loss": 4.8635, "mean_token_accuracy": 0.22568015605211258, "num_tokens": 83392000.0, "step": 36405 }, { "entropy": 5.324226665496826, "epoch": 3.5992487149070778, "grad_norm": 0.9375, "learning_rate": 0.0003748995929496741, "loss": 4.7883, "mean_token_accuracy": 0.23469123542308806, "num_tokens": 83403841.0, "step": 36410 }, { "entropy": 5.385702753067017, "epoch": 3.599742981415579, "grad_norm": 1.0234375, "learning_rate": 0.00037486797091993015, "loss": 4.9064, "mean_token_accuracy": 0.22474417537450792, "num_tokens": 83415114.0, "step": 36415 }, { "entropy": 5.375254535675049, "epoch": 3.6002372479240807, "grad_norm": 0.98828125, "learning_rate": 0.00037483634643341866, "loss": 4.9531, "mean_token_accuracy": 0.21599696278572084, "num_tokens": 83428158.0, "step": 36420 }, { "entropy": 5.44150562286377, "epoch": 3.600731514432582, "grad_norm": 0.98046875, "learning_rate": 0.0003748047194909175, "loss": 4.9325, "mean_token_accuracy": 0.22725801169872284, "num_tokens": 83439535.0, "step": 36425 }, { "entropy": 5.354701089859009, "epoch": 3.6012257809410837, "grad_norm": 1.0234375, "learning_rate": 0.00037477309009320477, "loss": 4.9223, "mean_token_accuracy": 0.22424223124980927, "num_tokens": 83451215.0, "step": 36430 }, { "entropy": 5.402597904205322, "epoch": 3.601720047449585, "grad_norm": 1.046875, "learning_rate": 0.00037474145824105854, "loss": 4.8879, "mean_token_accuracy": 0.2199832335114479, "num_tokens": 83461750.0, "step": 36435 }, { "entropy": 5.35029706954956, "epoch": 3.6022143139580862, "grad_norm": 0.97265625, "learning_rate": 0.00037470982393525697, "loss": 4.8818, "mean_token_accuracy": 0.22946826964616776, "num_tokens": 83473790.0, "step": 36440 }, { "entropy": 5.342877960205078, "epoch": 3.6027085804665875, "grad_norm": 1.015625, "learning_rate": 0.00037467818717657825, "loss": 4.8597, "mean_token_accuracy": 0.2287721484899521, "num_tokens": 83485470.0, "step": 36445 }, { "entropy": 5.3918922424316404, "epoch": 3.6032028469750887, "grad_norm": 1.046875, "learning_rate": 0.0003746465479658007, "loss": 4.8911, "mean_token_accuracy": 0.22231501638889312, "num_tokens": 83496007.0, "step": 36450 }, { "entropy": 5.414427089691162, "epoch": 3.6036971134835905, "grad_norm": 1.078125, "learning_rate": 0.0003746149063037026, "loss": 4.9833, "mean_token_accuracy": 0.21907393485307694, "num_tokens": 83508620.0, "step": 36455 }, { "entropy": 5.333643579483033, "epoch": 3.6041913799920917, "grad_norm": 1.0390625, "learning_rate": 0.0003745832621910623, "loss": 4.8658, "mean_token_accuracy": 0.22993077486753463, "num_tokens": 83520323.0, "step": 36460 }, { "entropy": 5.262320470809937, "epoch": 3.604685646500593, "grad_norm": 1.0078125, "learning_rate": 0.00037455161562865833, "loss": 4.8119, "mean_token_accuracy": 0.23296705186367034, "num_tokens": 83532471.0, "step": 36465 }, { "entropy": 5.337418937683106, "epoch": 3.6051799130090947, "grad_norm": 1.0234375, "learning_rate": 0.0003745199666172692, "loss": 4.8417, "mean_token_accuracy": 0.23423704653978347, "num_tokens": 83544156.0, "step": 36470 }, { "entropy": 5.418204212188721, "epoch": 3.605674179517596, "grad_norm": 0.94140625, "learning_rate": 0.00037448831515767353, "loss": 4.8841, "mean_token_accuracy": 0.22467339783906937, "num_tokens": 83556321.0, "step": 36475 }, { "entropy": 5.338177728652954, "epoch": 3.606168446026097, "grad_norm": 1.0703125, "learning_rate": 0.0003744566612506497, "loss": 4.8737, "mean_token_accuracy": 0.22403129786252976, "num_tokens": 83566604.0, "step": 36480 }, { "entropy": 5.361013317108155, "epoch": 3.6066627125345985, "grad_norm": 1.03125, "learning_rate": 0.00037442500489697666, "loss": 4.869, "mean_token_accuracy": 0.22904723435640334, "num_tokens": 83578349.0, "step": 36485 }, { "entropy": 5.37205286026001, "epoch": 3.6071569790431, "grad_norm": 1.1328125, "learning_rate": 0.0003743933460974331, "loss": 4.8877, "mean_token_accuracy": 0.22562311142683028, "num_tokens": 83589198.0, "step": 36490 }, { "entropy": 5.448660945892334, "epoch": 3.6076512455516014, "grad_norm": 0.96875, "learning_rate": 0.00037436168485279777, "loss": 4.9502, "mean_token_accuracy": 0.22046404480934143, "num_tokens": 83602076.0, "step": 36495 }, { "entropy": 5.377399253845215, "epoch": 3.6081455120601027, "grad_norm": 1.046875, "learning_rate": 0.00037433002116384957, "loss": 4.861, "mean_token_accuracy": 0.22547683566808702, "num_tokens": 83613340.0, "step": 36500 }, { "entropy": 5.307501268386841, "epoch": 3.6086397785686044, "grad_norm": 1.09375, "learning_rate": 0.00037429835503136744, "loss": 4.9111, "mean_token_accuracy": 0.2243644818663597, "num_tokens": 83624715.0, "step": 36505 }, { "entropy": 5.309962129592895, "epoch": 3.6091340450771057, "grad_norm": 1.078125, "learning_rate": 0.0003742666864561304, "loss": 4.9161, "mean_token_accuracy": 0.2332532748579979, "num_tokens": 83635833.0, "step": 36510 }, { "entropy": 5.381388807296753, "epoch": 3.609628311585607, "grad_norm": 1.0546875, "learning_rate": 0.0003742350154389174, "loss": 4.8492, "mean_token_accuracy": 0.22707187831401826, "num_tokens": 83647281.0, "step": 36515 }, { "entropy": 5.393423843383789, "epoch": 3.610122578094108, "grad_norm": 1.0234375, "learning_rate": 0.00037420334198050775, "loss": 4.9302, "mean_token_accuracy": 0.223509019613266, "num_tokens": 83658745.0, "step": 36520 }, { "entropy": 5.389162158966064, "epoch": 3.6106168446026095, "grad_norm": 1.0859375, "learning_rate": 0.0003741716660816804, "loss": 4.9029, "mean_token_accuracy": 0.2229568988084793, "num_tokens": 83671580.0, "step": 36525 }, { "entropy": 5.389196157455444, "epoch": 3.611111111111111, "grad_norm": 1.03125, "learning_rate": 0.00037413998774321475, "loss": 4.9107, "mean_token_accuracy": 0.2231159493327141, "num_tokens": 83682667.0, "step": 36530 }, { "entropy": 5.339846420288086, "epoch": 3.6116053776196124, "grad_norm": 1.078125, "learning_rate": 0.00037410830696588994, "loss": 4.8356, "mean_token_accuracy": 0.2271808370947838, "num_tokens": 83693276.0, "step": 36535 }, { "entropy": 5.342306280136109, "epoch": 3.612099644128114, "grad_norm": 0.96875, "learning_rate": 0.00037407662375048544, "loss": 4.9308, "mean_token_accuracy": 0.22439689189195633, "num_tokens": 83705304.0, "step": 36540 }, { "entropy": 5.331595849990845, "epoch": 3.6125939106366154, "grad_norm": 0.98828125, "learning_rate": 0.00037404493809778063, "loss": 4.8989, "mean_token_accuracy": 0.2246134966611862, "num_tokens": 83717166.0, "step": 36545 }, { "entropy": 5.366345977783203, "epoch": 3.6130881771451167, "grad_norm": 1.109375, "learning_rate": 0.00037401325000855495, "loss": 4.8401, "mean_token_accuracy": 0.2327850878238678, "num_tokens": 83727322.0, "step": 36550 }, { "entropy": 5.36159315109253, "epoch": 3.613582443653618, "grad_norm": 1.0234375, "learning_rate": 0.00037398155948358805, "loss": 4.8438, "mean_token_accuracy": 0.22833312749862672, "num_tokens": 83738721.0, "step": 36555 }, { "entropy": 5.291883754730224, "epoch": 3.614076710162119, "grad_norm": 0.9921875, "learning_rate": 0.0003739498665236593, "loss": 4.8753, "mean_token_accuracy": 0.23352148979902268, "num_tokens": 83750622.0, "step": 36560 }, { "entropy": 5.382266044616699, "epoch": 3.614570976670621, "grad_norm": 1.0, "learning_rate": 0.0003739181711295485, "loss": 4.9561, "mean_token_accuracy": 0.2155703902244568, "num_tokens": 83761755.0, "step": 36565 }, { "entropy": 5.321734189987183, "epoch": 3.615065243179122, "grad_norm": 1.0703125, "learning_rate": 0.00037388647330203545, "loss": 4.8055, "mean_token_accuracy": 0.23482843935489656, "num_tokens": 83772335.0, "step": 36570 }, { "entropy": 5.325783920288086, "epoch": 3.6155595096876234, "grad_norm": 0.9296875, "learning_rate": 0.0003738547730418999, "loss": 4.926, "mean_token_accuracy": 0.22703629583120347, "num_tokens": 83784949.0, "step": 36575 }, { "entropy": 5.347792482376098, "epoch": 3.616053776196125, "grad_norm": 1.0390625, "learning_rate": 0.0003738230703499213, "loss": 4.8806, "mean_token_accuracy": 0.22740814387798308, "num_tokens": 83795555.0, "step": 36580 }, { "entropy": 5.327791404724121, "epoch": 3.6165480427046264, "grad_norm": 1.03125, "learning_rate": 0.00037379136522688, "loss": 4.8393, "mean_token_accuracy": 0.22769590616226196, "num_tokens": 83806682.0, "step": 36585 }, { "entropy": 5.348587989807129, "epoch": 3.6170423092131276, "grad_norm": 1.03125, "learning_rate": 0.00037375965767355584, "loss": 4.8652, "mean_token_accuracy": 0.2256679654121399, "num_tokens": 83818485.0, "step": 36590 }, { "entropy": 5.261403560638428, "epoch": 3.617536575721629, "grad_norm": 1.03125, "learning_rate": 0.0003737279476907287, "loss": 4.802, "mean_token_accuracy": 0.23808386772871018, "num_tokens": 83829757.0, "step": 36595 }, { "entropy": 5.36194953918457, "epoch": 3.6180308422301306, "grad_norm": 0.96484375, "learning_rate": 0.00037369623527917876, "loss": 4.915, "mean_token_accuracy": 0.22493782490491868, "num_tokens": 83841827.0, "step": 36600 }, { "entropy": 5.276743221282959, "epoch": 3.618525108738632, "grad_norm": 0.98828125, "learning_rate": 0.0003736645204396861, "loss": 4.731, "mean_token_accuracy": 0.2410330817103386, "num_tokens": 83852471.0, "step": 36605 }, { "entropy": 5.320824193954468, "epoch": 3.619019375247133, "grad_norm": 1.1015625, "learning_rate": 0.0003736328031730309, "loss": 4.8325, "mean_token_accuracy": 0.2330484449863434, "num_tokens": 83864322.0, "step": 36610 }, { "entropy": 5.374589300155639, "epoch": 3.619513641755635, "grad_norm": 1.046875, "learning_rate": 0.0003736010834799936, "loss": 4.9269, "mean_token_accuracy": 0.2262087881565094, "num_tokens": 83875286.0, "step": 36615 }, { "entropy": 5.320151424407959, "epoch": 3.620007908264136, "grad_norm": 1.0078125, "learning_rate": 0.0003735693613613542, "loss": 4.7911, "mean_token_accuracy": 0.2374019667506218, "num_tokens": 83887794.0, "step": 36620 }, { "entropy": 5.371251058578491, "epoch": 3.6205021747726374, "grad_norm": 0.9375, "learning_rate": 0.0003735376368178932, "loss": 4.896, "mean_token_accuracy": 0.22413357645273208, "num_tokens": 83898644.0, "step": 36625 }, { "entropy": 5.380478096008301, "epoch": 3.6209964412811386, "grad_norm": 1.0703125, "learning_rate": 0.0003735059098503911, "loss": 4.9225, "mean_token_accuracy": 0.21952511221170426, "num_tokens": 83909944.0, "step": 36630 }, { "entropy": 5.360162448883057, "epoch": 3.6214907077896403, "grad_norm": 1.0078125, "learning_rate": 0.0003734741804596284, "loss": 4.8936, "mean_token_accuracy": 0.2248098596930504, "num_tokens": 83920928.0, "step": 36635 }, { "entropy": 5.341647434234619, "epoch": 3.6219849742981416, "grad_norm": 1.046875, "learning_rate": 0.0003734424486463855, "loss": 4.8068, "mean_token_accuracy": 0.23733924627304076, "num_tokens": 83933519.0, "step": 36640 }, { "entropy": 5.420714855194092, "epoch": 3.622479240806643, "grad_norm": 0.953125, "learning_rate": 0.00037341071441144316, "loss": 4.9682, "mean_token_accuracy": 0.2225632354617119, "num_tokens": 83946933.0, "step": 36645 }, { "entropy": 5.3279835224151615, "epoch": 3.6229735073151446, "grad_norm": 1.0546875, "learning_rate": 0.0003733789777555819, "loss": 4.8632, "mean_token_accuracy": 0.2297317162156105, "num_tokens": 83957858.0, "step": 36650 }, { "entropy": 5.326677227020264, "epoch": 3.623467773823646, "grad_norm": 1.0, "learning_rate": 0.00037334723867958256, "loss": 4.8429, "mean_token_accuracy": 0.23162795901298522, "num_tokens": 83968363.0, "step": 36655 }, { "entropy": 5.349777364730835, "epoch": 3.623962040332147, "grad_norm": 1.03125, "learning_rate": 0.0003733154971842259, "loss": 4.8453, "mean_token_accuracy": 0.23122699558734894, "num_tokens": 83978719.0, "step": 36660 }, { "entropy": 5.301551580429077, "epoch": 3.6244563068406483, "grad_norm": 1.0390625, "learning_rate": 0.00037328375327029274, "loss": 4.8348, "mean_token_accuracy": 0.22420499622821807, "num_tokens": 83990195.0, "step": 36665 }, { "entropy": 5.3063499450683596, "epoch": 3.6249505733491496, "grad_norm": 0.984375, "learning_rate": 0.00037325200693856406, "loss": 4.9345, "mean_token_accuracy": 0.2208761379122734, "num_tokens": 84002068.0, "step": 36670 }, { "entropy": 5.357392263412476, "epoch": 3.6254448398576513, "grad_norm": 0.9765625, "learning_rate": 0.0003732202581898206, "loss": 4.8667, "mean_token_accuracy": 0.22409599423408508, "num_tokens": 84013405.0, "step": 36675 }, { "entropy": 5.4420802116394045, "epoch": 3.6259391063661526, "grad_norm": 0.96875, "learning_rate": 0.0003731885070248437, "loss": 4.97, "mean_token_accuracy": 0.21321644484996796, "num_tokens": 84025650.0, "step": 36680 }, { "entropy": 5.265451574325562, "epoch": 3.6264333728746543, "grad_norm": 0.9375, "learning_rate": 0.00037315675344441426, "loss": 4.7806, "mean_token_accuracy": 0.24111033380031585, "num_tokens": 84036753.0, "step": 36685 }, { "entropy": 5.458128547668457, "epoch": 3.6269276393831555, "grad_norm": 1.0703125, "learning_rate": 0.0003731249974493135, "loss": 4.9771, "mean_token_accuracy": 0.22219886332750322, "num_tokens": 84049082.0, "step": 36690 }, { "entropy": 5.388784551620484, "epoch": 3.627421905891657, "grad_norm": 1.0078125, "learning_rate": 0.00037309323904032254, "loss": 4.8837, "mean_token_accuracy": 0.2212057039141655, "num_tokens": 84059471.0, "step": 36695 }, { "entropy": 5.322232389450074, "epoch": 3.627916172400158, "grad_norm": 1.0, "learning_rate": 0.0003730614782182226, "loss": 4.8996, "mean_token_accuracy": 0.2337486118078232, "num_tokens": 84071475.0, "step": 36700 }, { "entropy": 5.359746217727661, "epoch": 3.6284104389086593, "grad_norm": 1.015625, "learning_rate": 0.0003730297149837952, "loss": 4.9073, "mean_token_accuracy": 0.22454703897237777, "num_tokens": 84082465.0, "step": 36705 }, { "entropy": 5.337502193450928, "epoch": 3.628904705417161, "grad_norm": 1.265625, "learning_rate": 0.0003729979493378215, "loss": 4.8432, "mean_token_accuracy": 0.2250938132405281, "num_tokens": 84093845.0, "step": 36710 }, { "entropy": 5.386278963088989, "epoch": 3.6293989719256623, "grad_norm": 1.0625, "learning_rate": 0.00037296618128108316, "loss": 4.8957, "mean_token_accuracy": 0.22552331984043122, "num_tokens": 84105865.0, "step": 36715 }, { "entropy": 5.362513780593872, "epoch": 3.6298932384341636, "grad_norm": 1.0859375, "learning_rate": 0.00037293441081436154, "loss": 4.8928, "mean_token_accuracy": 0.2250848591327667, "num_tokens": 84116376.0, "step": 36720 }, { "entropy": 5.331195068359375, "epoch": 3.6303875049426653, "grad_norm": 1.03125, "learning_rate": 0.0003729026379384381, "loss": 4.7998, "mean_token_accuracy": 0.2327029064297676, "num_tokens": 84126806.0, "step": 36725 }, { "entropy": 5.382214879989624, "epoch": 3.6308817714511665, "grad_norm": 1.0078125, "learning_rate": 0.0003728708626540948, "loss": 4.8927, "mean_token_accuracy": 0.23157044649124145, "num_tokens": 84136750.0, "step": 36730 }, { "entropy": 5.398047351837159, "epoch": 3.631376037959668, "grad_norm": 1.046875, "learning_rate": 0.00037283908496211295, "loss": 4.9792, "mean_token_accuracy": 0.21441410183906556, "num_tokens": 84148614.0, "step": 36735 }, { "entropy": 5.4482917308807375, "epoch": 3.631870304468169, "grad_norm": 1.0859375, "learning_rate": 0.0003728073048632744, "loss": 4.9704, "mean_token_accuracy": 0.21500234156847, "num_tokens": 84160347.0, "step": 36740 }, { "entropy": 5.388708925247192, "epoch": 3.6323645709766708, "grad_norm": 1.0390625, "learning_rate": 0.00037277552235836104, "loss": 4.9327, "mean_token_accuracy": 0.22186036556959152, "num_tokens": 84172240.0, "step": 36745 }, { "entropy": 5.401154708862305, "epoch": 3.632858837485172, "grad_norm": 1.0078125, "learning_rate": 0.00037274373744815466, "loss": 4.9244, "mean_token_accuracy": 0.22853055745363235, "num_tokens": 84184050.0, "step": 36750 }, { "entropy": 5.370966386795044, "epoch": 3.6333531039936733, "grad_norm": 1.03125, "learning_rate": 0.0003727119501334371, "loss": 4.8796, "mean_token_accuracy": 0.22564692795276642, "num_tokens": 84194661.0, "step": 36755 }, { "entropy": 5.353967189788818, "epoch": 3.633847370502175, "grad_norm": 1.0234375, "learning_rate": 0.00037268016041499055, "loss": 4.8641, "mean_token_accuracy": 0.22966067492961884, "num_tokens": 84205677.0, "step": 36760 }, { "entropy": 5.370859670639038, "epoch": 3.6343416370106763, "grad_norm": 0.984375, "learning_rate": 0.0003726483682935968, "loss": 4.8734, "mean_token_accuracy": 0.22522821724414827, "num_tokens": 84217342.0, "step": 36765 }, { "entropy": 5.373274326324463, "epoch": 3.6348359035191775, "grad_norm": 1.015625, "learning_rate": 0.00037261657377003803, "loss": 4.902, "mean_token_accuracy": 0.22258375883102416, "num_tokens": 84229637.0, "step": 36770 }, { "entropy": 5.422550916671753, "epoch": 3.6353301700276788, "grad_norm": 0.9765625, "learning_rate": 0.0003725847768450964, "loss": 4.9378, "mean_token_accuracy": 0.21780333817005157, "num_tokens": 84241156.0, "step": 36775 }, { "entropy": 5.438250494003296, "epoch": 3.63582443653618, "grad_norm": 1.0, "learning_rate": 0.0003725529775195542, "loss": 4.9215, "mean_token_accuracy": 0.2223355457186699, "num_tokens": 84253172.0, "step": 36780 }, { "entropy": 5.323154497146606, "epoch": 3.6363187030446817, "grad_norm": 1.046875, "learning_rate": 0.00037252117579419355, "loss": 4.8387, "mean_token_accuracy": 0.22752950191497803, "num_tokens": 84265349.0, "step": 36785 }, { "entropy": 5.2843529224395756, "epoch": 3.636812969553183, "grad_norm": 1.046875, "learning_rate": 0.00037248937166979687, "loss": 4.8131, "mean_token_accuracy": 0.23492369502782823, "num_tokens": 84275931.0, "step": 36790 }, { "entropy": 5.355429697036743, "epoch": 3.6373072360616847, "grad_norm": 1.0078125, "learning_rate": 0.0003724575651471465, "loss": 4.8951, "mean_token_accuracy": 0.22533716410398483, "num_tokens": 84286502.0, "step": 36795 }, { "entropy": 5.393918180465699, "epoch": 3.637801502570186, "grad_norm": 1.0078125, "learning_rate": 0.0003724257562270249, "loss": 4.9556, "mean_token_accuracy": 0.21121064126491546, "num_tokens": 84297748.0, "step": 36800 }, { "entropy": 5.392804431915283, "epoch": 3.6382957690786872, "grad_norm": 1.09375, "learning_rate": 0.00037239394491021463, "loss": 4.9367, "mean_token_accuracy": 0.22384822517633438, "num_tokens": 84309733.0, "step": 36805 }, { "entropy": 5.434682703018188, "epoch": 3.6387900355871885, "grad_norm": 1.03125, "learning_rate": 0.00037236213119749823, "loss": 4.9565, "mean_token_accuracy": 0.21578225642442703, "num_tokens": 84320606.0, "step": 36810 }, { "entropy": 5.332182598114014, "epoch": 3.6392843020956898, "grad_norm": 0.9609375, "learning_rate": 0.00037233031508965823, "loss": 4.8586, "mean_token_accuracy": 0.22566750049591064, "num_tokens": 84331149.0, "step": 36815 }, { "entropy": 5.397786808013916, "epoch": 3.6397785686041915, "grad_norm": 1.0703125, "learning_rate": 0.0003722984965874774, "loss": 4.9138, "mean_token_accuracy": 0.2253658413887024, "num_tokens": 84343016.0, "step": 36820 }, { "entropy": 5.397837495803833, "epoch": 3.6402728351126927, "grad_norm": 0.97265625, "learning_rate": 0.0003722666756917385, "loss": 4.9305, "mean_token_accuracy": 0.22284920364618302, "num_tokens": 84354846.0, "step": 36825 }, { "entropy": 5.338949537277221, "epoch": 3.640767101621194, "grad_norm": 1.0234375, "learning_rate": 0.0003722348524032242, "loss": 4.8771, "mean_token_accuracy": 0.22435445189476014, "num_tokens": 84366698.0, "step": 36830 }, { "entropy": 5.3655980110168455, "epoch": 3.6412613681296957, "grad_norm": 0.99609375, "learning_rate": 0.00037220302672271756, "loss": 4.9012, "mean_token_accuracy": 0.2269018679857254, "num_tokens": 84378186.0, "step": 36835 }, { "entropy": 5.440581846237182, "epoch": 3.641755634638197, "grad_norm": 0.98828125, "learning_rate": 0.00037217119865100127, "loss": 4.9859, "mean_token_accuracy": 0.21867185682058335, "num_tokens": 84390301.0, "step": 36840 }, { "entropy": 5.331853151321411, "epoch": 3.642249901146698, "grad_norm": 1.046875, "learning_rate": 0.00037213936818885853, "loss": 4.8997, "mean_token_accuracy": 0.2267444059252739, "num_tokens": 84401134.0, "step": 36845 }, { "entropy": 5.350849914550781, "epoch": 3.6427441676551995, "grad_norm": 1.046875, "learning_rate": 0.00037210753533707214, "loss": 4.8607, "mean_token_accuracy": 0.2309836983680725, "num_tokens": 84411734.0, "step": 36850 }, { "entropy": 5.403667211532593, "epoch": 3.643238434163701, "grad_norm": 1.140625, "learning_rate": 0.00037207570009642536, "loss": 4.9637, "mean_token_accuracy": 0.21293123960494995, "num_tokens": 84422952.0, "step": 36855 }, { "entropy": 5.384668350219727, "epoch": 3.6437327006722025, "grad_norm": 1.0234375, "learning_rate": 0.0003720438624677014, "loss": 4.8181, "mean_token_accuracy": 0.23322306871414183, "num_tokens": 84433048.0, "step": 36860 }, { "entropy": 5.369571256637573, "epoch": 3.6442269671807037, "grad_norm": 1.0, "learning_rate": 0.0003720120224516832, "loss": 4.8903, "mean_token_accuracy": 0.21995196491479874, "num_tokens": 84443318.0, "step": 36865 }, { "entropy": 5.372448539733886, "epoch": 3.6447212336892054, "grad_norm": 1.0234375, "learning_rate": 0.0003719801800491543, "loss": 4.8605, "mean_token_accuracy": 0.22919123619794846, "num_tokens": 84453441.0, "step": 36870 }, { "entropy": 5.312135410308838, "epoch": 3.6452155001977067, "grad_norm": 1.046875, "learning_rate": 0.00037194833526089797, "loss": 4.8895, "mean_token_accuracy": 0.22450451403856278, "num_tokens": 84465290.0, "step": 36875 }, { "entropy": 5.399795293807983, "epoch": 3.645709766706208, "grad_norm": 0.9921875, "learning_rate": 0.0003719164880876975, "loss": 4.9191, "mean_token_accuracy": 0.22377658635377884, "num_tokens": 84476482.0, "step": 36880 }, { "entropy": 5.335363960266113, "epoch": 3.646204033214709, "grad_norm": 0.98046875, "learning_rate": 0.0003718846385303363, "loss": 4.8183, "mean_token_accuracy": 0.23134245425462724, "num_tokens": 84488641.0, "step": 36885 }, { "entropy": 5.345751237869263, "epoch": 3.646698299723211, "grad_norm": 0.99609375, "learning_rate": 0.0003718527865895981, "loss": 4.9313, "mean_token_accuracy": 0.22859867960214614, "num_tokens": 84501967.0, "step": 36890 }, { "entropy": 5.404613494873047, "epoch": 3.647192566231712, "grad_norm": 0.97265625, "learning_rate": 0.0003718209322662662, "loss": 4.8878, "mean_token_accuracy": 0.21708727926015853, "num_tokens": 84513982.0, "step": 36895 }, { "entropy": 5.3517796993255615, "epoch": 3.6476868327402134, "grad_norm": 1.0859375, "learning_rate": 0.0003717890755611244, "loss": 4.8622, "mean_token_accuracy": 0.2245517775416374, "num_tokens": 84523395.0, "step": 36900 }, { "entropy": 5.295890140533447, "epoch": 3.648181099248715, "grad_norm": 1.0234375, "learning_rate": 0.00037175721647495635, "loss": 4.8601, "mean_token_accuracy": 0.23574294298887252, "num_tokens": 84536019.0, "step": 36905 }, { "entropy": 5.337387752532959, "epoch": 3.6486753657572164, "grad_norm": 0.9453125, "learning_rate": 0.0003717253550085458, "loss": 4.8831, "mean_token_accuracy": 0.22999414801597595, "num_tokens": 84546882.0, "step": 36910 }, { "entropy": 5.391915798187256, "epoch": 3.6491696322657177, "grad_norm": 1.015625, "learning_rate": 0.00037169349116267643, "loss": 4.9074, "mean_token_accuracy": 0.22693344801664353, "num_tokens": 84560195.0, "step": 36915 }, { "entropy": 5.449013423919678, "epoch": 3.649663898774219, "grad_norm": 0.9921875, "learning_rate": 0.00037166162493813224, "loss": 4.9914, "mean_token_accuracy": 0.22236735373735428, "num_tokens": 84573165.0, "step": 36920 }, { "entropy": 5.307663440704346, "epoch": 3.65015816528272, "grad_norm": 1.078125, "learning_rate": 0.00037162975633569704, "loss": 4.7478, "mean_token_accuracy": 0.2359714090824127, "num_tokens": 84584871.0, "step": 36925 }, { "entropy": 5.373053646087646, "epoch": 3.650652431791222, "grad_norm": 1.046875, "learning_rate": 0.00037159788535615486, "loss": 4.9446, "mean_token_accuracy": 0.2162610948085785, "num_tokens": 84596122.0, "step": 36930 }, { "entropy": 5.372900295257568, "epoch": 3.651146698299723, "grad_norm": 1.0390625, "learning_rate": 0.00037156601200028975, "loss": 4.9032, "mean_token_accuracy": 0.22475857883691788, "num_tokens": 84607432.0, "step": 36935 }, { "entropy": 5.358575534820557, "epoch": 3.651640964808225, "grad_norm": 1.0703125, "learning_rate": 0.0003715341362688857, "loss": 4.8054, "mean_token_accuracy": 0.23150832056999207, "num_tokens": 84618440.0, "step": 36940 }, { "entropy": 5.2888916492462155, "epoch": 3.652135231316726, "grad_norm": 1.09375, "learning_rate": 0.0003715022581627269, "loss": 4.8048, "mean_token_accuracy": 0.23704465627670288, "num_tokens": 84629173.0, "step": 36945 }, { "entropy": 5.314864540100098, "epoch": 3.6526294978252274, "grad_norm": 1.015625, "learning_rate": 0.0003714703776825976, "loss": 4.7762, "mean_token_accuracy": 0.23005301356315613, "num_tokens": 84639770.0, "step": 36950 }, { "entropy": 5.352747106552124, "epoch": 3.6531237643337287, "grad_norm": 1.0546875, "learning_rate": 0.0003714384948292821, "loss": 4.9152, "mean_token_accuracy": 0.2208740457892418, "num_tokens": 84651405.0, "step": 36955 }, { "entropy": 5.3103289127349855, "epoch": 3.65361803084223, "grad_norm": 1.0, "learning_rate": 0.0003714066096035646, "loss": 4.7603, "mean_token_accuracy": 0.24185348749160768, "num_tokens": 84663136.0, "step": 36960 }, { "entropy": 5.317334365844727, "epoch": 3.6541122973507316, "grad_norm": 1.0546875, "learning_rate": 0.0003713747220062296, "loss": 4.8103, "mean_token_accuracy": 0.23086691796779632, "num_tokens": 84675432.0, "step": 36965 }, { "entropy": 5.30422625541687, "epoch": 3.654606563859233, "grad_norm": 0.984375, "learning_rate": 0.0003713428320380614, "loss": 4.8161, "mean_token_accuracy": 0.2357401505112648, "num_tokens": 84686961.0, "step": 36970 }, { "entropy": 5.296778011322021, "epoch": 3.655100830367734, "grad_norm": 1.0390625, "learning_rate": 0.0003713109396998447, "loss": 4.7811, "mean_token_accuracy": 0.2357327163219452, "num_tokens": 84697316.0, "step": 36975 }, { "entropy": 5.371257638931274, "epoch": 3.655595096876236, "grad_norm": 1.0, "learning_rate": 0.00037127904499236386, "loss": 4.9525, "mean_token_accuracy": 0.22163959890604018, "num_tokens": 84709228.0, "step": 36980 }, { "entropy": 5.412351036071778, "epoch": 3.656089363384737, "grad_norm": 1.0078125, "learning_rate": 0.00037124714791640363, "loss": 4.8648, "mean_token_accuracy": 0.21919483691453934, "num_tokens": 84721300.0, "step": 36985 }, { "entropy": 5.3403558254241945, "epoch": 3.6565836298932384, "grad_norm": 1.0390625, "learning_rate": 0.00037121524847274855, "loss": 4.8797, "mean_token_accuracy": 0.22751695960760115, "num_tokens": 84732264.0, "step": 36990 }, { "entropy": 5.273571586608886, "epoch": 3.6570778964017396, "grad_norm": 1.0078125, "learning_rate": 0.0003711833466621835, "loss": 4.8327, "mean_token_accuracy": 0.222713865339756, "num_tokens": 84743636.0, "step": 36995 }, { "entropy": 5.329427337646484, "epoch": 3.6575721629102413, "grad_norm": 1.078125, "learning_rate": 0.00037115144248549324, "loss": 4.8472, "mean_token_accuracy": 0.22944098860025405, "num_tokens": 84754696.0, "step": 37000 }, { "entropy": 5.450957202911377, "epoch": 3.6580664294187426, "grad_norm": 1.125, "learning_rate": 0.00037111953594346256, "loss": 4.8986, "mean_token_accuracy": 0.2210584431886673, "num_tokens": 84766026.0, "step": 37005 }, { "entropy": 5.384374380111694, "epoch": 3.658560695927244, "grad_norm": 1.0625, "learning_rate": 0.00037108762703687634, "loss": 4.8743, "mean_token_accuracy": 0.23002879321575165, "num_tokens": 84777265.0, "step": 37010 }, { "entropy": 5.28236665725708, "epoch": 3.6590549624357456, "grad_norm": 1.0234375, "learning_rate": 0.0003710557157665196, "loss": 4.8443, "mean_token_accuracy": 0.2285000666975975, "num_tokens": 84787715.0, "step": 37015 }, { "entropy": 5.399721765518189, "epoch": 3.659549228944247, "grad_norm": 1.046875, "learning_rate": 0.0003710238021331773, "loss": 4.9737, "mean_token_accuracy": 0.22135744243860245, "num_tokens": 84798874.0, "step": 37020 }, { "entropy": 5.412326955795288, "epoch": 3.660043495452748, "grad_norm": 0.9921875, "learning_rate": 0.0003709918861376346, "loss": 4.9712, "mean_token_accuracy": 0.2162778005003929, "num_tokens": 84810072.0, "step": 37025 }, { "entropy": 5.417651748657226, "epoch": 3.6605377619612494, "grad_norm": 1.078125, "learning_rate": 0.00037095996778067664, "loss": 4.8633, "mean_token_accuracy": 0.232083822786808, "num_tokens": 84820831.0, "step": 37030 }, { "entropy": 5.285230207443237, "epoch": 3.6610320284697506, "grad_norm": 0.99609375, "learning_rate": 0.0003709280470630886, "loss": 4.7646, "mean_token_accuracy": 0.23941393047571183, "num_tokens": 84832329.0, "step": 37035 }, { "entropy": 5.34065523147583, "epoch": 3.6615262949782523, "grad_norm": 1.0, "learning_rate": 0.0003708961239856557, "loss": 4.9043, "mean_token_accuracy": 0.22205893993377684, "num_tokens": 84844239.0, "step": 37040 }, { "entropy": 5.317165660858154, "epoch": 3.6620205614867536, "grad_norm": 0.97265625, "learning_rate": 0.00037086419854916327, "loss": 4.8689, "mean_token_accuracy": 0.2310461461544037, "num_tokens": 84855939.0, "step": 37045 }, { "entropy": 5.347628831863403, "epoch": 3.6625148279952553, "grad_norm": 0.9921875, "learning_rate": 0.0003708322707543967, "loss": 4.8523, "mean_token_accuracy": 0.2235839322209358, "num_tokens": 84867170.0, "step": 37050 }, { "entropy": 5.370975923538208, "epoch": 3.6630090945037566, "grad_norm": 1.203125, "learning_rate": 0.00037080034060214134, "loss": 4.8773, "mean_token_accuracy": 0.23343184292316438, "num_tokens": 84877986.0, "step": 37055 }, { "entropy": 5.2930474281311035, "epoch": 3.663503361012258, "grad_norm": 0.984375, "learning_rate": 0.0003707684080931827, "loss": 4.7803, "mean_token_accuracy": 0.23917830139398574, "num_tokens": 84888795.0, "step": 37060 }, { "entropy": 5.2725005626678465, "epoch": 3.663997627520759, "grad_norm": 1.046875, "learning_rate": 0.00037073647322830657, "loss": 4.8444, "mean_token_accuracy": 0.23543160855770112, "num_tokens": 84900569.0, "step": 37065 }, { "entropy": 5.365699577331543, "epoch": 3.6644918940292603, "grad_norm": 1.1484375, "learning_rate": 0.0003707045360082982, "loss": 4.9457, "mean_token_accuracy": 0.22274716943502426, "num_tokens": 84912018.0, "step": 37070 }, { "entropy": 5.42576265335083, "epoch": 3.664986160537762, "grad_norm": 1.09375, "learning_rate": 0.0003706725964339434, "loss": 4.9115, "mean_token_accuracy": 0.21912020891904832, "num_tokens": 84923088.0, "step": 37075 }, { "entropy": 5.330938196182251, "epoch": 3.6654804270462633, "grad_norm": 0.9453125, "learning_rate": 0.000370640654506028, "loss": 4.8609, "mean_token_accuracy": 0.2320971205830574, "num_tokens": 84933838.0, "step": 37080 }, { "entropy": 5.319458961486816, "epoch": 3.6659746935547646, "grad_norm": 1.09375, "learning_rate": 0.0003706087102253375, "loss": 4.8317, "mean_token_accuracy": 0.22839322537183762, "num_tokens": 84945208.0, "step": 37085 }, { "entropy": 5.271191263198853, "epoch": 3.6664689600632663, "grad_norm": 0.9609375, "learning_rate": 0.000370576763592658, "loss": 4.7915, "mean_token_accuracy": 0.23921951055526733, "num_tokens": 84956224.0, "step": 37090 }, { "entropy": 5.394811820983887, "epoch": 3.6669632265717675, "grad_norm": 1.0, "learning_rate": 0.0003705448146087752, "loss": 4.9325, "mean_token_accuracy": 0.23088499903678894, "num_tokens": 84967507.0, "step": 37095 }, { "entropy": 5.351563787460327, "epoch": 3.667457493080269, "grad_norm": 0.9765625, "learning_rate": 0.00037051286327447527, "loss": 4.8363, "mean_token_accuracy": 0.2297585517168045, "num_tokens": 84979578.0, "step": 37100 }, { "entropy": 5.459745979309082, "epoch": 3.66795175958877, "grad_norm": 1.0546875, "learning_rate": 0.0003704809095905439, "loss": 5.0377, "mean_token_accuracy": 0.21018216460943223, "num_tokens": 84990875.0, "step": 37105 }, { "entropy": 5.296231126785278, "epoch": 3.6684460260972718, "grad_norm": 1.078125, "learning_rate": 0.00037044895355776747, "loss": 4.8057, "mean_token_accuracy": 0.23377428501844405, "num_tokens": 85001787.0, "step": 37110 }, { "entropy": 5.39904294013977, "epoch": 3.668940292605773, "grad_norm": 1.0078125, "learning_rate": 0.000370416995176932, "loss": 4.9544, "mean_token_accuracy": 0.2177300363779068, "num_tokens": 85015189.0, "step": 37115 }, { "entropy": 5.377111196517944, "epoch": 3.6694345591142743, "grad_norm": 1.046875, "learning_rate": 0.0003703850344488236, "loss": 4.8965, "mean_token_accuracy": 0.23029059916734695, "num_tokens": 85026267.0, "step": 37120 }, { "entropy": 5.335699605941772, "epoch": 3.669928825622776, "grad_norm": 0.97265625, "learning_rate": 0.00037035307137422855, "loss": 4.8478, "mean_token_accuracy": 0.22860579788684846, "num_tokens": 85038296.0, "step": 37125 }, { "entropy": 5.318237066268921, "epoch": 3.6704230921312773, "grad_norm": 1.0234375, "learning_rate": 0.00037032110595393313, "loss": 4.8748, "mean_token_accuracy": 0.23026354014873504, "num_tokens": 85050518.0, "step": 37130 }, { "entropy": 5.3926276683807375, "epoch": 3.6709173586397785, "grad_norm": 1.1015625, "learning_rate": 0.00037028913818872375, "loss": 4.8754, "mean_token_accuracy": 0.22115449160337447, "num_tokens": 85062002.0, "step": 37135 }, { "entropy": 5.388245248794556, "epoch": 3.67141162514828, "grad_norm": 1.0546875, "learning_rate": 0.00037025716807938676, "loss": 4.9072, "mean_token_accuracy": 0.23021192103624344, "num_tokens": 85072818.0, "step": 37140 }, { "entropy": 5.315536832809448, "epoch": 3.6719058916567815, "grad_norm": 1.0703125, "learning_rate": 0.0003702251956267087, "loss": 4.8165, "mean_token_accuracy": 0.2368546187877655, "num_tokens": 85083747.0, "step": 37145 }, { "entropy": 5.338272571563721, "epoch": 3.6724001581652828, "grad_norm": 0.99609375, "learning_rate": 0.000370193220831476, "loss": 4.8378, "mean_token_accuracy": 0.23062866926193237, "num_tokens": 85095546.0, "step": 37150 }, { "entropy": 5.345551490783691, "epoch": 3.672894424673784, "grad_norm": 1.1328125, "learning_rate": 0.00037016124369447533, "loss": 4.8893, "mean_token_accuracy": 0.22542488873004912, "num_tokens": 85105891.0, "step": 37155 }, { "entropy": 5.341178321838379, "epoch": 3.6733886911822857, "grad_norm": 0.92578125, "learning_rate": 0.0003701292642164933, "loss": 4.8985, "mean_token_accuracy": 0.2209042266011238, "num_tokens": 85118378.0, "step": 37160 }, { "entropy": 5.3939813613891605, "epoch": 3.673882957690787, "grad_norm": 1.015625, "learning_rate": 0.00037009728239831665, "loss": 4.9374, "mean_token_accuracy": 0.22148457020521164, "num_tokens": 85130111.0, "step": 37165 }, { "entropy": 5.389163255691528, "epoch": 3.6743772241992882, "grad_norm": 1.1328125, "learning_rate": 0.0003700652982407321, "loss": 4.9425, "mean_token_accuracy": 0.22257527858018875, "num_tokens": 85140037.0, "step": 37170 }, { "entropy": 5.3506749153137205, "epoch": 3.6748714907077895, "grad_norm": 0.9921875, "learning_rate": 0.0003700333117445264, "loss": 4.8325, "mean_token_accuracy": 0.233109450340271, "num_tokens": 85152398.0, "step": 37175 }, { "entropy": 5.434806632995605, "epoch": 3.6753657572162908, "grad_norm": 0.9609375, "learning_rate": 0.00037000132291048655, "loss": 4.9393, "mean_token_accuracy": 0.22201527804136276, "num_tokens": 85164793.0, "step": 37180 }, { "entropy": 5.368464231491089, "epoch": 3.6758600237247925, "grad_norm": 1.0390625, "learning_rate": 0.00036996933173939935, "loss": 4.9324, "mean_token_accuracy": 0.21793834567070008, "num_tokens": 85176291.0, "step": 37185 }, { "entropy": 5.329867506027222, "epoch": 3.6763542902332937, "grad_norm": 1.03125, "learning_rate": 0.0003699373382320519, "loss": 4.89, "mean_token_accuracy": 0.22061939686536788, "num_tokens": 85188706.0, "step": 37190 }, { "entropy": 5.401124382019043, "epoch": 3.6768485567417954, "grad_norm": 1.09375, "learning_rate": 0.00036990534238923124, "loss": 4.9526, "mean_token_accuracy": 0.22581952214241027, "num_tokens": 85200771.0, "step": 37195 }, { "entropy": 5.367476320266723, "epoch": 3.6773428232502967, "grad_norm": 1.015625, "learning_rate": 0.00036987334421172434, "loss": 4.9231, "mean_token_accuracy": 0.22476439774036408, "num_tokens": 85211209.0, "step": 37200 }, { "entropy": 5.331131410598755, "epoch": 3.677837089758798, "grad_norm": 1.0234375, "learning_rate": 0.00036984134370031846, "loss": 4.8203, "mean_token_accuracy": 0.23611721247434617, "num_tokens": 85222370.0, "step": 37205 }, { "entropy": 5.334611463546753, "epoch": 3.6783313562672992, "grad_norm": 0.99609375, "learning_rate": 0.0003698093408558009, "loss": 4.8096, "mean_token_accuracy": 0.22926597893238068, "num_tokens": 85234210.0, "step": 37210 }, { "entropy": 5.351852607727051, "epoch": 3.6788256227758005, "grad_norm": 1.046875, "learning_rate": 0.0003697773356789588, "loss": 4.8795, "mean_token_accuracy": 0.23031645268201828, "num_tokens": 85245506.0, "step": 37215 }, { "entropy": 5.3380146503448485, "epoch": 3.679319889284302, "grad_norm": 1.0703125, "learning_rate": 0.00036974532817057946, "loss": 4.8541, "mean_token_accuracy": 0.22823161780834197, "num_tokens": 85256904.0, "step": 37220 }, { "entropy": 5.32533860206604, "epoch": 3.6798141557928035, "grad_norm": 0.98046875, "learning_rate": 0.0003697133183314505, "loss": 4.8754, "mean_token_accuracy": 0.2229703426361084, "num_tokens": 85268660.0, "step": 37225 }, { "entropy": 5.350935792922973, "epoch": 3.6803084223013047, "grad_norm": 1.0078125, "learning_rate": 0.0003696813061623591, "loss": 4.9164, "mean_token_accuracy": 0.22102297395467757, "num_tokens": 85280292.0, "step": 37230 }, { "entropy": 5.364089584350586, "epoch": 3.6808026888098064, "grad_norm": 1.140625, "learning_rate": 0.00036964929166409294, "loss": 4.8966, "mean_token_accuracy": 0.22385205328464508, "num_tokens": 85292029.0, "step": 37235 }, { "entropy": 5.267552280426026, "epoch": 3.6812969553183077, "grad_norm": 0.94921875, "learning_rate": 0.00036961727483743957, "loss": 4.7705, "mean_token_accuracy": 0.22518443316221237, "num_tokens": 85304350.0, "step": 37240 }, { "entropy": 5.341428947448731, "epoch": 3.681791221826809, "grad_norm": 0.9921875, "learning_rate": 0.00036958525568318645, "loss": 4.8969, "mean_token_accuracy": 0.2259019359946251, "num_tokens": 85315646.0, "step": 37245 }, { "entropy": 5.469727468490601, "epoch": 3.68228548833531, "grad_norm": 0.98828125, "learning_rate": 0.0003695532342021214, "loss": 4.8912, "mean_token_accuracy": 0.2215048760175705, "num_tokens": 85328779.0, "step": 37250 }, { "entropy": 5.286429691314697, "epoch": 3.682779754843812, "grad_norm": 0.97265625, "learning_rate": 0.0003695212103950321, "loss": 4.8019, "mean_token_accuracy": 0.22999473065137863, "num_tokens": 85339916.0, "step": 37255 }, { "entropy": 5.34763879776001, "epoch": 3.683274021352313, "grad_norm": 1.078125, "learning_rate": 0.00036948918426270646, "loss": 4.9578, "mean_token_accuracy": 0.2180489867925644, "num_tokens": 85351381.0, "step": 37260 }, { "entropy": 5.3334955215454105, "epoch": 3.6837682878608144, "grad_norm": 0.99609375, "learning_rate": 0.00036945715580593213, "loss": 4.8975, "mean_token_accuracy": 0.2207340866327286, "num_tokens": 85362166.0, "step": 37265 }, { "entropy": 5.342495393753052, "epoch": 3.684262554369316, "grad_norm": 1.0234375, "learning_rate": 0.0003694251250254971, "loss": 4.8197, "mean_token_accuracy": 0.22968224287033082, "num_tokens": 85373626.0, "step": 37270 }, { "entropy": 5.390260791778564, "epoch": 3.6847568208778174, "grad_norm": 0.953125, "learning_rate": 0.00036939309192218946, "loss": 4.8884, "mean_token_accuracy": 0.21760563403367997, "num_tokens": 85385217.0, "step": 37275 }, { "entropy": 5.3575116157531735, "epoch": 3.6852510873863187, "grad_norm": 1.1171875, "learning_rate": 0.000369361056496797, "loss": 4.8818, "mean_token_accuracy": 0.22889053225517272, "num_tokens": 85395944.0, "step": 37280 }, { "entropy": 5.36527099609375, "epoch": 3.68574535389482, "grad_norm": 1.0546875, "learning_rate": 0.00036932901875010797, "loss": 4.8948, "mean_token_accuracy": 0.22553078085184097, "num_tokens": 85407614.0, "step": 37285 }, { "entropy": 5.278856897354126, "epoch": 3.686239620403321, "grad_norm": 1.03125, "learning_rate": 0.00036929697868291045, "loss": 4.8748, "mean_token_accuracy": 0.2310721442103386, "num_tokens": 85419006.0, "step": 37290 }, { "entropy": 5.344970750808716, "epoch": 3.686733886911823, "grad_norm": 1.03125, "learning_rate": 0.00036926493629599257, "loss": 4.8397, "mean_token_accuracy": 0.24039324820041658, "num_tokens": 85430267.0, "step": 37295 }, { "entropy": 5.368427705764771, "epoch": 3.687228153420324, "grad_norm": 1.046875, "learning_rate": 0.0003692328915901427, "loss": 4.8716, "mean_token_accuracy": 0.2288208469748497, "num_tokens": 85441424.0, "step": 37300 }, { "entropy": 5.294268417358398, "epoch": 3.687722419928826, "grad_norm": 0.98828125, "learning_rate": 0.0003692008445661491, "loss": 4.809, "mean_token_accuracy": 0.2325630307197571, "num_tokens": 85452606.0, "step": 37305 }, { "entropy": 5.324365472793579, "epoch": 3.688216686437327, "grad_norm": 0.98828125, "learning_rate": 0.00036916879522480003, "loss": 4.8631, "mean_token_accuracy": 0.2328535497188568, "num_tokens": 85463532.0, "step": 37310 }, { "entropy": 5.397299575805664, "epoch": 3.6887109529458284, "grad_norm": 1.03125, "learning_rate": 0.000369136743566884, "loss": 4.9099, "mean_token_accuracy": 0.22854031026363372, "num_tokens": 85476014.0, "step": 37315 }, { "entropy": 5.339652681350708, "epoch": 3.6892052194543297, "grad_norm": 1.1171875, "learning_rate": 0.0003691046895931895, "loss": 4.8356, "mean_token_accuracy": 0.23448090106248856, "num_tokens": 85488296.0, "step": 37320 }, { "entropy": 5.392187643051147, "epoch": 3.689699485962831, "grad_norm": 0.97265625, "learning_rate": 0.00036907263330450505, "loss": 4.9393, "mean_token_accuracy": 0.22416726797819136, "num_tokens": 85498579.0, "step": 37325 }, { "entropy": 5.359186792373658, "epoch": 3.6901937524713326, "grad_norm": 1.0390625, "learning_rate": 0.00036904057470161914, "loss": 4.869, "mean_token_accuracy": 0.22490999847650528, "num_tokens": 85509978.0, "step": 37330 }, { "entropy": 5.382182979583741, "epoch": 3.690688018979834, "grad_norm": 1.0703125, "learning_rate": 0.00036900851378532065, "loss": 4.9204, "mean_token_accuracy": 0.22402578592300415, "num_tokens": 85522277.0, "step": 37335 }, { "entropy": 5.309179973602295, "epoch": 3.691182285488335, "grad_norm": 1.0078125, "learning_rate": 0.00036897645055639794, "loss": 4.8767, "mean_token_accuracy": 0.22820470929145814, "num_tokens": 85532880.0, "step": 37340 }, { "entropy": 5.311588954925537, "epoch": 3.691676551996837, "grad_norm": 1.09375, "learning_rate": 0.0003689443850156401, "loss": 4.7849, "mean_token_accuracy": 0.23696347326040268, "num_tokens": 85543714.0, "step": 37345 }, { "entropy": 5.305025053024292, "epoch": 3.692170818505338, "grad_norm": 1.015625, "learning_rate": 0.0003689123171638358, "loss": 4.8212, "mean_token_accuracy": 0.23167711347341538, "num_tokens": 85555870.0, "step": 37350 }, { "entropy": 5.248937320709229, "epoch": 3.6926650850138394, "grad_norm": 0.98828125, "learning_rate": 0.000368880247001774, "loss": 4.7671, "mean_token_accuracy": 0.2432101011276245, "num_tokens": 85567607.0, "step": 37355 }, { "entropy": 5.296472215652466, "epoch": 3.6931593515223406, "grad_norm": 1.09375, "learning_rate": 0.0003688481745302435, "loss": 4.8573, "mean_token_accuracy": 0.23187728822231293, "num_tokens": 85578448.0, "step": 37360 }, { "entropy": 5.397369432449341, "epoch": 3.6936536180308424, "grad_norm": 1.015625, "learning_rate": 0.0003688160997500332, "loss": 4.9485, "mean_token_accuracy": 0.21830458790063859, "num_tokens": 85589220.0, "step": 37365 }, { "entropy": 5.451288843154908, "epoch": 3.6941478845393436, "grad_norm": 1.0859375, "learning_rate": 0.00036878402266193243, "loss": 5.0329, "mean_token_accuracy": 0.21796121299266816, "num_tokens": 85600095.0, "step": 37370 }, { "entropy": 5.379939174652099, "epoch": 3.694642151047845, "grad_norm": 1.015625, "learning_rate": 0.00036875194326673025, "loss": 4.8851, "mean_token_accuracy": 0.2243768259882927, "num_tokens": 85612188.0, "step": 37375 }, { "entropy": 5.316216897964478, "epoch": 3.6951364175563466, "grad_norm": 1.078125, "learning_rate": 0.00036871986156521554, "loss": 4.7904, "mean_token_accuracy": 0.23131428211927413, "num_tokens": 85623262.0, "step": 37380 }, { "entropy": 5.326744174957275, "epoch": 3.695630684064848, "grad_norm": 1.0625, "learning_rate": 0.00036868777755817776, "loss": 4.8814, "mean_token_accuracy": 0.22689824253320695, "num_tokens": 85634811.0, "step": 37385 }, { "entropy": 5.3951582431793215, "epoch": 3.696124950573349, "grad_norm": 1.015625, "learning_rate": 0.0003686556912464062, "loss": 4.9782, "mean_token_accuracy": 0.22041257917881013, "num_tokens": 85645739.0, "step": 37390 }, { "entropy": 5.370418691635132, "epoch": 3.6966192170818504, "grad_norm": 1.0078125, "learning_rate": 0.00036862360263069, "loss": 4.8712, "mean_token_accuracy": 0.2315293326973915, "num_tokens": 85657124.0, "step": 37395 }, { "entropy": 5.417504405975341, "epoch": 3.697113483590352, "grad_norm": 1.0859375, "learning_rate": 0.0003685915117118187, "loss": 4.8805, "mean_token_accuracy": 0.22560217529535292, "num_tokens": 85667750.0, "step": 37400 }, { "entropy": 5.295740938186645, "epoch": 3.6976077500988533, "grad_norm": 1.0390625, "learning_rate": 0.0003685594184905817, "loss": 4.874, "mean_token_accuracy": 0.2303482860326767, "num_tokens": 85679009.0, "step": 37405 }, { "entropy": 5.367545652389526, "epoch": 3.6981020166073546, "grad_norm": 1.0703125, "learning_rate": 0.0003685273229677684, "loss": 4.9233, "mean_token_accuracy": 0.22301653176546096, "num_tokens": 85690925.0, "step": 37410 }, { "entropy": 5.480771064758301, "epoch": 3.6985962831158563, "grad_norm": 1.046875, "learning_rate": 0.00036849522514416854, "loss": 5.0001, "mean_token_accuracy": 0.21524980664253235, "num_tokens": 85702045.0, "step": 37415 }, { "entropy": 5.337428188323974, "epoch": 3.6990905496243576, "grad_norm": 1.0, "learning_rate": 0.0003684631250205716, "loss": 4.8878, "mean_token_accuracy": 0.22536301761865615, "num_tokens": 85713589.0, "step": 37420 }, { "entropy": 5.321285724639893, "epoch": 3.699584816132859, "grad_norm": 0.94921875, "learning_rate": 0.00036843102259776736, "loss": 4.8243, "mean_token_accuracy": 0.23445389568805694, "num_tokens": 85726060.0, "step": 37425 }, { "entropy": 5.501253271102906, "epoch": 3.70007908264136, "grad_norm": 1.0859375, "learning_rate": 0.0003683989178765454, "loss": 4.9881, "mean_token_accuracy": 0.2160787671804428, "num_tokens": 85737473.0, "step": 37430 }, { "entropy": 5.394416570663452, "epoch": 3.7005733491498614, "grad_norm": 1.03125, "learning_rate": 0.0003683668108576955, "loss": 4.9019, "mean_token_accuracy": 0.22621079236268998, "num_tokens": 85749392.0, "step": 37435 }, { "entropy": 5.373353672027588, "epoch": 3.701067615658363, "grad_norm": 0.953125, "learning_rate": 0.00036833470154200765, "loss": 4.9057, "mean_token_accuracy": 0.2211281478404999, "num_tokens": 85761180.0, "step": 37440 }, { "entropy": 5.271851396560669, "epoch": 3.7015618821668643, "grad_norm": 0.9375, "learning_rate": 0.0003683025899302717, "loss": 4.8243, "mean_token_accuracy": 0.2373792812228203, "num_tokens": 85772230.0, "step": 37445 }, { "entropy": 5.377283525466919, "epoch": 3.702056148675366, "grad_norm": 1.109375, "learning_rate": 0.00036827047602327757, "loss": 4.9038, "mean_token_accuracy": 0.22940150648355484, "num_tokens": 85783413.0, "step": 37450 }, { "entropy": 5.397137260437011, "epoch": 3.7025504151838673, "grad_norm": 0.99609375, "learning_rate": 0.00036823835982181515, "loss": 4.8916, "mean_token_accuracy": 0.22874766141176223, "num_tokens": 85794057.0, "step": 37455 }, { "entropy": 5.369738054275513, "epoch": 3.7030446816923686, "grad_norm": 1.0078125, "learning_rate": 0.00036820624132667467, "loss": 4.8143, "mean_token_accuracy": 0.22291359901428223, "num_tokens": 85805379.0, "step": 37460 }, { "entropy": 5.404136800765992, "epoch": 3.70353894820087, "grad_norm": 1.0078125, "learning_rate": 0.00036817412053864626, "loss": 4.8703, "mean_token_accuracy": 0.22723647952079773, "num_tokens": 85817177.0, "step": 37465 }, { "entropy": 5.293812656402588, "epoch": 3.704033214709371, "grad_norm": 0.96875, "learning_rate": 0.00036814199745851997, "loss": 4.8663, "mean_token_accuracy": 0.2314177095890045, "num_tokens": 85830017.0, "step": 37470 }, { "entropy": 5.329754209518432, "epoch": 3.704527481217873, "grad_norm": 1.125, "learning_rate": 0.00036810987208708607, "loss": 4.976, "mean_token_accuracy": 0.21888710260391236, "num_tokens": 85840835.0, "step": 37475 }, { "entropy": 5.353043079376221, "epoch": 3.705021747726374, "grad_norm": 1.0078125, "learning_rate": 0.00036807774442513495, "loss": 4.859, "mean_token_accuracy": 0.23001932203769684, "num_tokens": 85852492.0, "step": 37480 }, { "entropy": 5.365503740310669, "epoch": 3.7055160142348753, "grad_norm": 0.95703125, "learning_rate": 0.0003680456144734567, "loss": 4.8556, "mean_token_accuracy": 0.22784620225429536, "num_tokens": 85864570.0, "step": 37485 }, { "entropy": 5.3175300598144535, "epoch": 3.706010280743377, "grad_norm": 1.078125, "learning_rate": 0.0003680134822328421, "loss": 4.8595, "mean_token_accuracy": 0.2264627695083618, "num_tokens": 85875516.0, "step": 37490 }, { "entropy": 5.355171489715576, "epoch": 3.7065045472518783, "grad_norm": 0.97265625, "learning_rate": 0.0003679813477040814, "loss": 4.868, "mean_token_accuracy": 0.22997350841760636, "num_tokens": 85886051.0, "step": 37495 }, { "entropy": 5.373681116104126, "epoch": 3.7069988137603795, "grad_norm": 1.0390625, "learning_rate": 0.000367949210887965, "loss": 4.9491, "mean_token_accuracy": 0.2235301598906517, "num_tokens": 85897996.0, "step": 37500 }, { "entropy": 5.315188884735107, "epoch": 3.707493080268881, "grad_norm": 1.0625, "learning_rate": 0.00036791707178528355, "loss": 4.7756, "mean_token_accuracy": 0.2352730616927147, "num_tokens": 85908562.0, "step": 37505 }, { "entropy": 5.3776054859161375, "epoch": 3.7079873467773825, "grad_norm": 1.046875, "learning_rate": 0.0003678849303968278, "loss": 4.9066, "mean_token_accuracy": 0.22013149708509444, "num_tokens": 85920859.0, "step": 37510 }, { "entropy": 5.259235286712647, "epoch": 3.7084816132858838, "grad_norm": 0.96875, "learning_rate": 0.0003678527867233884, "loss": 4.8466, "mean_token_accuracy": 0.22778060883283616, "num_tokens": 85932919.0, "step": 37515 }, { "entropy": 5.295482206344604, "epoch": 3.708975879794385, "grad_norm": 0.9921875, "learning_rate": 0.00036782064076575603, "loss": 4.7815, "mean_token_accuracy": 0.23084331601858138, "num_tokens": 85943399.0, "step": 37520 }, { "entropy": 5.413701438903809, "epoch": 3.7094701463028867, "grad_norm": 1.078125, "learning_rate": 0.00036778849252472144, "loss": 4.8931, "mean_token_accuracy": 0.2234555169939995, "num_tokens": 85954110.0, "step": 37525 }, { "entropy": 5.390600919723511, "epoch": 3.709964412811388, "grad_norm": 1.0546875, "learning_rate": 0.0003677563420010755, "loss": 4.8787, "mean_token_accuracy": 0.23031336665153504, "num_tokens": 85965955.0, "step": 37530 }, { "entropy": 5.340165853500366, "epoch": 3.7104586793198893, "grad_norm": 1.015625, "learning_rate": 0.00036772418919560937, "loss": 4.824, "mean_token_accuracy": 0.22824975997209548, "num_tokens": 85977475.0, "step": 37535 }, { "entropy": 5.318088102340698, "epoch": 3.7109529458283905, "grad_norm": 1.0078125, "learning_rate": 0.0003676920341091136, "loss": 4.8726, "mean_token_accuracy": 0.22235322147607803, "num_tokens": 85987995.0, "step": 37540 }, { "entropy": 5.355809116363526, "epoch": 3.711447212336892, "grad_norm": 1.0234375, "learning_rate": 0.0003676598767423795, "loss": 4.9973, "mean_token_accuracy": 0.21126776784658433, "num_tokens": 86000379.0, "step": 37545 }, { "entropy": 5.397480535507202, "epoch": 3.7119414788453935, "grad_norm": 1.125, "learning_rate": 0.000367627717096198, "loss": 4.8551, "mean_token_accuracy": 0.22699600458145142, "num_tokens": 86011959.0, "step": 37550 }, { "entropy": 5.40672197341919, "epoch": 3.7124357453538948, "grad_norm": 1.0, "learning_rate": 0.0003675955551713603, "loss": 4.8895, "mean_token_accuracy": 0.2211748942732811, "num_tokens": 86023015.0, "step": 37555 }, { "entropy": 5.2837486743927, "epoch": 3.7129300118623965, "grad_norm": 1.0546875, "learning_rate": 0.0003675633909686576, "loss": 4.8265, "mean_token_accuracy": 0.2310906708240509, "num_tokens": 86032802.0, "step": 37560 }, { "entropy": 5.373885011672973, "epoch": 3.7134242783708977, "grad_norm": 0.984375, "learning_rate": 0.00036753122448888114, "loss": 4.8699, "mean_token_accuracy": 0.2324053794145584, "num_tokens": 86043499.0, "step": 37565 }, { "entropy": 5.3693140029907225, "epoch": 3.713918544879399, "grad_norm": 1.015625, "learning_rate": 0.00036749905573282214, "loss": 4.8885, "mean_token_accuracy": 0.2202165961265564, "num_tokens": 86054327.0, "step": 37570 }, { "entropy": 5.435192108154297, "epoch": 3.7144128113879002, "grad_norm": 0.9609375, "learning_rate": 0.00036746688470127214, "loss": 5.0107, "mean_token_accuracy": 0.2128878727555275, "num_tokens": 86067023.0, "step": 37575 }, { "entropy": 5.377259922027588, "epoch": 3.7149070778964015, "grad_norm": 0.97265625, "learning_rate": 0.00036743471139502235, "loss": 4.8547, "mean_token_accuracy": 0.22782364785671233, "num_tokens": 86079906.0, "step": 37580 }, { "entropy": 5.370411968231201, "epoch": 3.715401344404903, "grad_norm": 1.0625, "learning_rate": 0.0003674025358148643, "loss": 4.8779, "mean_token_accuracy": 0.2297048956155777, "num_tokens": 86090467.0, "step": 37585 }, { "entropy": 5.290926885604859, "epoch": 3.7158956109134045, "grad_norm": 1.0078125, "learning_rate": 0.0003673703579615895, "loss": 4.8481, "mean_token_accuracy": 0.2268904849886894, "num_tokens": 86102908.0, "step": 37590 }, { "entropy": 5.254464721679687, "epoch": 3.7163898774219057, "grad_norm": 1.0078125, "learning_rate": 0.00036733817783598973, "loss": 4.753, "mean_token_accuracy": 0.24840002804994582, "num_tokens": 86114588.0, "step": 37595 }, { "entropy": 5.370078897476196, "epoch": 3.7168841439304074, "grad_norm": 0.94921875, "learning_rate": 0.0003673059954388563, "loss": 4.8947, "mean_token_accuracy": 0.2252398133277893, "num_tokens": 86126800.0, "step": 37600 }, { "entropy": 5.373450660705567, "epoch": 3.7173784104389087, "grad_norm": 0.984375, "learning_rate": 0.0003672738107709811, "loss": 4.8965, "mean_token_accuracy": 0.22675887048244475, "num_tokens": 86138703.0, "step": 37605 }, { "entropy": 5.3448103904724125, "epoch": 3.71787267694741, "grad_norm": 1.1171875, "learning_rate": 0.00036724162383315584, "loss": 4.8047, "mean_token_accuracy": 0.2295199990272522, "num_tokens": 86148856.0, "step": 37610 }, { "entropy": 5.452143716812134, "epoch": 3.7183669434559112, "grad_norm": 1.109375, "learning_rate": 0.00036720943462617236, "loss": 4.9172, "mean_token_accuracy": 0.22458101361989974, "num_tokens": 86160108.0, "step": 37615 }, { "entropy": 5.362561511993408, "epoch": 3.718861209964413, "grad_norm": 1.046875, "learning_rate": 0.00036717724315082245, "loss": 4.8892, "mean_token_accuracy": 0.2268182247877121, "num_tokens": 86170065.0, "step": 37620 }, { "entropy": 5.336143732070923, "epoch": 3.719355476472914, "grad_norm": 1.03125, "learning_rate": 0.000367145049407898, "loss": 4.8658, "mean_token_accuracy": 0.22561706304550172, "num_tokens": 86180469.0, "step": 37625 }, { "entropy": 5.422434234619141, "epoch": 3.7198497429814155, "grad_norm": 1.0625, "learning_rate": 0.00036711285339819115, "loss": 4.9821, "mean_token_accuracy": 0.22278884798288345, "num_tokens": 86191801.0, "step": 37630 }, { "entropy": 5.3249329090118405, "epoch": 3.720344009489917, "grad_norm": 1.0859375, "learning_rate": 0.0003670806551224938, "loss": 4.8314, "mean_token_accuracy": 0.22526707798242568, "num_tokens": 86202967.0, "step": 37635 }, { "entropy": 5.398179149627685, "epoch": 3.7208382759984184, "grad_norm": 1.015625, "learning_rate": 0.00036704845458159803, "loss": 4.9841, "mean_token_accuracy": 0.21622924655675888, "num_tokens": 86215225.0, "step": 37640 }, { "entropy": 5.411929798126221, "epoch": 3.7213325425069197, "grad_norm": 1.09375, "learning_rate": 0.00036701625177629595, "loss": 4.9662, "mean_token_accuracy": 0.21607402414083482, "num_tokens": 86227417.0, "step": 37645 }, { "entropy": 5.348657751083374, "epoch": 3.721826809015421, "grad_norm": 1.0859375, "learning_rate": 0.0003669840467073798, "loss": 4.839, "mean_token_accuracy": 0.2351645991206169, "num_tokens": 86238749.0, "step": 37650 }, { "entropy": 5.334732341766357, "epoch": 3.7223210755239227, "grad_norm": 1.015625, "learning_rate": 0.0003669518393756419, "loss": 4.943, "mean_token_accuracy": 0.22031576782464982, "num_tokens": 86250146.0, "step": 37655 }, { "entropy": 5.415461921691895, "epoch": 3.722815342032424, "grad_norm": 1.015625, "learning_rate": 0.0003669196297818745, "loss": 4.9312, "mean_token_accuracy": 0.22262810319662094, "num_tokens": 86262086.0, "step": 37660 }, { "entropy": 5.42926025390625, "epoch": 3.723309608540925, "grad_norm": 1.1640625, "learning_rate": 0.00036688741792686985, "loss": 4.9532, "mean_token_accuracy": 0.22329955846071242, "num_tokens": 86273937.0, "step": 37665 }, { "entropy": 5.396841621398925, "epoch": 3.723803875049427, "grad_norm": 1.046875, "learning_rate": 0.0003668552038114205, "loss": 4.9186, "mean_token_accuracy": 0.226019886136055, "num_tokens": 86284451.0, "step": 37670 }, { "entropy": 5.366309022903442, "epoch": 3.724298141557928, "grad_norm": 0.9609375, "learning_rate": 0.0003668229874363189, "loss": 4.8536, "mean_token_accuracy": 0.23373554944992064, "num_tokens": 86296406.0, "step": 37675 }, { "entropy": 5.307525491714477, "epoch": 3.7247924080664294, "grad_norm": 0.97265625, "learning_rate": 0.00036679076880235764, "loss": 4.8175, "mean_token_accuracy": 0.2322388544678688, "num_tokens": 86306922.0, "step": 37680 }, { "entropy": 5.317340230941772, "epoch": 3.7252866745749307, "grad_norm": 1.0546875, "learning_rate": 0.00036675854791032916, "loss": 4.8281, "mean_token_accuracy": 0.23478362262248992, "num_tokens": 86317785.0, "step": 37685 }, { "entropy": 5.469619226455689, "epoch": 3.725780941083432, "grad_norm": 1.0625, "learning_rate": 0.0003667263247610261, "loss": 4.9695, "mean_token_accuracy": 0.21636180430650712, "num_tokens": 86329271.0, "step": 37690 }, { "entropy": 5.388055753707886, "epoch": 3.7262752075919336, "grad_norm": 1.078125, "learning_rate": 0.00036669409935524136, "loss": 4.9219, "mean_token_accuracy": 0.22021329253911973, "num_tokens": 86339739.0, "step": 37695 }, { "entropy": 5.263347864151001, "epoch": 3.726769474100435, "grad_norm": 1.03125, "learning_rate": 0.0003666618716937674, "loss": 4.8011, "mean_token_accuracy": 0.23168611973524095, "num_tokens": 86351111.0, "step": 37700 }, { "entropy": 5.3821934223175045, "epoch": 3.7272637406089366, "grad_norm": 1.0703125, "learning_rate": 0.0003666296417773973, "loss": 4.9257, "mean_token_accuracy": 0.2253758803009987, "num_tokens": 86363320.0, "step": 37705 }, { "entropy": 5.444052886962891, "epoch": 3.727758007117438, "grad_norm": 1.0546875, "learning_rate": 0.0003665974096069237, "loss": 4.932, "mean_token_accuracy": 0.22425027191638947, "num_tokens": 86374372.0, "step": 37710 }, { "entropy": 5.452753639221191, "epoch": 3.728252273625939, "grad_norm": 1.015625, "learning_rate": 0.0003665651751831397, "loss": 4.9271, "mean_token_accuracy": 0.21717116683721543, "num_tokens": 86385545.0, "step": 37715 }, { "entropy": 5.317073106765747, "epoch": 3.7287465401344404, "grad_norm": 0.96875, "learning_rate": 0.00036653293850683803, "loss": 4.8728, "mean_token_accuracy": 0.23135519921779632, "num_tokens": 86398240.0, "step": 37720 }, { "entropy": 5.340314674377441, "epoch": 3.7292408066429417, "grad_norm": 0.98828125, "learning_rate": 0.0003665006995788121, "loss": 4.8857, "mean_token_accuracy": 0.22791634649038314, "num_tokens": 86409024.0, "step": 37725 }, { "entropy": 5.45699667930603, "epoch": 3.7297350731514434, "grad_norm": 0.97265625, "learning_rate": 0.00036646845839985464, "loss": 4.9097, "mean_token_accuracy": 0.22176747024059296, "num_tokens": 86422114.0, "step": 37730 }, { "entropy": 5.39141263961792, "epoch": 3.7302293396599446, "grad_norm": 0.9453125, "learning_rate": 0.00036643621497075895, "loss": 4.936, "mean_token_accuracy": 0.21898404508829117, "num_tokens": 86435230.0, "step": 37735 }, { "entropy": 5.3408417224884035, "epoch": 3.730723606168446, "grad_norm": 1.0, "learning_rate": 0.00036640396929231813, "loss": 4.9824, "mean_token_accuracy": 0.21672510653734206, "num_tokens": 86446449.0, "step": 37740 }, { "entropy": 5.3964801788330075, "epoch": 3.7312178726769476, "grad_norm": 1.1640625, "learning_rate": 0.0003663717213653255, "loss": 4.8835, "mean_token_accuracy": 0.22500354498624803, "num_tokens": 86456814.0, "step": 37745 }, { "entropy": 5.390552043914795, "epoch": 3.731712139185449, "grad_norm": 1.015625, "learning_rate": 0.0003663394711905744, "loss": 4.8402, "mean_token_accuracy": 0.22391951978206634, "num_tokens": 86468135.0, "step": 37750 }, { "entropy": 5.42072548866272, "epoch": 3.73220640569395, "grad_norm": 1.046875, "learning_rate": 0.00036630721876885813, "loss": 4.9552, "mean_token_accuracy": 0.22633278071880342, "num_tokens": 86480268.0, "step": 37755 }, { "entropy": 5.323319721221924, "epoch": 3.7327006722024514, "grad_norm": 1.015625, "learning_rate": 0.00036627496410097005, "loss": 4.811, "mean_token_accuracy": 0.23501592129468918, "num_tokens": 86492660.0, "step": 37760 }, { "entropy": 5.346138334274292, "epoch": 3.733194938710953, "grad_norm": 1.0390625, "learning_rate": 0.00036624270718770376, "loss": 4.9111, "mean_token_accuracy": 0.22300967425107956, "num_tokens": 86504638.0, "step": 37765 }, { "entropy": 5.314207887649536, "epoch": 3.7336892052194544, "grad_norm": 0.99609375, "learning_rate": 0.0003662104480298527, "loss": 4.8008, "mean_token_accuracy": 0.23697238564491271, "num_tokens": 86514225.0, "step": 37770 }, { "entropy": 5.3790826320648195, "epoch": 3.7341834717279556, "grad_norm": 1.015625, "learning_rate": 0.0003661781866282104, "loss": 4.9003, "mean_token_accuracy": 0.2297806113958359, "num_tokens": 86525370.0, "step": 37775 }, { "entropy": 5.308582878112793, "epoch": 3.7346777382364573, "grad_norm": 1.1015625, "learning_rate": 0.0003661459229835707, "loss": 4.8067, "mean_token_accuracy": 0.23344469517469407, "num_tokens": 86535137.0, "step": 37780 }, { "entropy": 5.263848495483399, "epoch": 3.7351720047449586, "grad_norm": 1.125, "learning_rate": 0.00036611365709672707, "loss": 4.7681, "mean_token_accuracy": 0.23744950741529464, "num_tokens": 86546922.0, "step": 37785 }, { "entropy": 5.403316783905029, "epoch": 3.73566627125346, "grad_norm": 0.98828125, "learning_rate": 0.0003660813889684733, "loss": 4.9454, "mean_token_accuracy": 0.2184808999300003, "num_tokens": 86559356.0, "step": 37790 }, { "entropy": 5.30443172454834, "epoch": 3.736160537761961, "grad_norm": 0.9765625, "learning_rate": 0.0003660491185996033, "loss": 4.7535, "mean_token_accuracy": 0.24112751185894013, "num_tokens": 86571515.0, "step": 37795 }, { "entropy": 5.3521645069122314, "epoch": 3.7366548042704624, "grad_norm": 1.09375, "learning_rate": 0.0003660168459909109, "loss": 4.8497, "mean_token_accuracy": 0.2254160851240158, "num_tokens": 86581641.0, "step": 37800 }, { "entropy": 5.290193748474121, "epoch": 3.737149070778964, "grad_norm": 0.97265625, "learning_rate": 0.00036598457114318984, "loss": 4.8661, "mean_token_accuracy": 0.22370484322309495, "num_tokens": 86594478.0, "step": 37805 }, { "entropy": 5.344572591781616, "epoch": 3.7376433372874653, "grad_norm": 1.015625, "learning_rate": 0.0003659522940572343, "loss": 4.8347, "mean_token_accuracy": 0.22966650128364563, "num_tokens": 86605496.0, "step": 37810 }, { "entropy": 5.360835790634155, "epoch": 3.738137603795967, "grad_norm": 1.0078125, "learning_rate": 0.00036592001473383817, "loss": 4.8361, "mean_token_accuracy": 0.22982072681188584, "num_tokens": 86616745.0, "step": 37815 }, { "entropy": 5.374407958984375, "epoch": 3.7386318703044683, "grad_norm": 1.0625, "learning_rate": 0.0003658877331737956, "loss": 4.9072, "mean_token_accuracy": 0.21839386820793152, "num_tokens": 86628094.0, "step": 37820 }, { "entropy": 5.365602111816406, "epoch": 3.7391261368129696, "grad_norm": 1.0078125, "learning_rate": 0.00036585544937790067, "loss": 4.8707, "mean_token_accuracy": 0.23322008699178695, "num_tokens": 86639421.0, "step": 37825 }, { "entropy": 5.270666027069092, "epoch": 3.739620403321471, "grad_norm": 1.0859375, "learning_rate": 0.00036582316334694766, "loss": 4.844, "mean_token_accuracy": 0.2352962464094162, "num_tokens": 86650653.0, "step": 37830 }, { "entropy": 5.40148229598999, "epoch": 3.740114669829972, "grad_norm": 0.99609375, "learning_rate": 0.0003657908750817307, "loss": 4.8453, "mean_token_accuracy": 0.23131305128335952, "num_tokens": 86660954.0, "step": 37835 }, { "entropy": 5.398519706726074, "epoch": 3.740608936338474, "grad_norm": 0.9140625, "learning_rate": 0.00036575858458304407, "loss": 4.9471, "mean_token_accuracy": 0.2154250130057335, "num_tokens": 86671983.0, "step": 37840 }, { "entropy": 5.290555620193482, "epoch": 3.741103202846975, "grad_norm": 1.0625, "learning_rate": 0.00036572629185168223, "loss": 4.7695, "mean_token_accuracy": 0.23971644788980484, "num_tokens": 86682634.0, "step": 37845 }, { "entropy": 5.359875345230103, "epoch": 3.7415974693554763, "grad_norm": 1.046875, "learning_rate": 0.0003656939968884396, "loss": 4.903, "mean_token_accuracy": 0.2207307606935501, "num_tokens": 86693516.0, "step": 37850 }, { "entropy": 5.429385566711426, "epoch": 3.742091735863978, "grad_norm": 1.046875, "learning_rate": 0.00036566169969411047, "loss": 4.9368, "mean_token_accuracy": 0.21972199231386186, "num_tokens": 86705350.0, "step": 37855 }, { "entropy": 5.3876160144805905, "epoch": 3.7425860023724793, "grad_norm": 1.0625, "learning_rate": 0.0003656294002694895, "loss": 4.8447, "mean_token_accuracy": 0.22443049103021623, "num_tokens": 86715647.0, "step": 37860 }, { "entropy": 5.3528906345367435, "epoch": 3.7430802688809806, "grad_norm": 1.046875, "learning_rate": 0.0003655970986153712, "loss": 4.9797, "mean_token_accuracy": 0.21694946736097337, "num_tokens": 86726453.0, "step": 37865 }, { "entropy": 5.333933925628662, "epoch": 3.743574535389482, "grad_norm": 0.9765625, "learning_rate": 0.0003655647947325503, "loss": 4.8831, "mean_token_accuracy": 0.2264312118291855, "num_tokens": 86737400.0, "step": 37870 }, { "entropy": 5.451200723648071, "epoch": 3.7440688018979835, "grad_norm": 1.109375, "learning_rate": 0.0003655324886218213, "loss": 4.9975, "mean_token_accuracy": 0.22252598851919175, "num_tokens": 86748667.0, "step": 37875 }, { "entropy": 5.355406856536865, "epoch": 3.744563068406485, "grad_norm": 1.078125, "learning_rate": 0.00036550018028397915, "loss": 4.8622, "mean_token_accuracy": 0.23090711534023284, "num_tokens": 86761081.0, "step": 37880 }, { "entropy": 5.421183252334595, "epoch": 3.745057334914986, "grad_norm": 1.078125, "learning_rate": 0.0003654678697198184, "loss": 4.9303, "mean_token_accuracy": 0.2251483365893364, "num_tokens": 86770823.0, "step": 37885 }, { "entropy": 5.391869354248047, "epoch": 3.7455516014234878, "grad_norm": 1.0234375, "learning_rate": 0.00036543555693013406, "loss": 4.9073, "mean_token_accuracy": 0.22635042071342468, "num_tokens": 86784362.0, "step": 37890 }, { "entropy": 5.401109266281128, "epoch": 3.746045867931989, "grad_norm": 1.1015625, "learning_rate": 0.0003654032419157211, "loss": 4.9357, "mean_token_accuracy": 0.22845033556222916, "num_tokens": 86796679.0, "step": 37895 }, { "entropy": 5.3401796340942385, "epoch": 3.7465401344404903, "grad_norm": 1.046875, "learning_rate": 0.0003653709246773743, "loss": 4.9115, "mean_token_accuracy": 0.23093120455741883, "num_tokens": 86808272.0, "step": 37900 }, { "entropy": 5.406108427047729, "epoch": 3.7470344009489915, "grad_norm": 0.96484375, "learning_rate": 0.0003653386052158886, "loss": 4.905, "mean_token_accuracy": 0.22383288890123368, "num_tokens": 86819428.0, "step": 37905 }, { "entropy": 5.327954530715942, "epoch": 3.7475286674574932, "grad_norm": 1.046875, "learning_rate": 0.0003653062835320593, "loss": 4.8884, "mean_token_accuracy": 0.22125830501317978, "num_tokens": 86831373.0, "step": 37910 }, { "entropy": 5.288205671310425, "epoch": 3.7480229339659945, "grad_norm": 1.0234375, "learning_rate": 0.00036527395962668145, "loss": 4.7903, "mean_token_accuracy": 0.23108956664800645, "num_tokens": 86843196.0, "step": 37915 }, { "entropy": 5.4184177875518795, "epoch": 3.7485172004744958, "grad_norm": 0.921875, "learning_rate": 0.0003652416335005502, "loss": 4.8846, "mean_token_accuracy": 0.22523870766162873, "num_tokens": 86855233.0, "step": 37920 }, { "entropy": 5.394596195220947, "epoch": 3.7490114669829975, "grad_norm": 1.0859375, "learning_rate": 0.0003652093051544607, "loss": 4.8376, "mean_token_accuracy": 0.22645198404788972, "num_tokens": 86865994.0, "step": 37925 }, { "entropy": 5.3088610649108885, "epoch": 3.7495057334914987, "grad_norm": 1.0390625, "learning_rate": 0.00036517697458920837, "loss": 4.8209, "mean_token_accuracy": 0.22754251658916474, "num_tokens": 86877451.0, "step": 37930 }, { "entropy": 5.311286926269531, "epoch": 3.75, "grad_norm": 1.109375, "learning_rate": 0.00036514464180558836, "loss": 4.8438, "mean_token_accuracy": 0.22704618722200393, "num_tokens": 86888390.0, "step": 37935 }, { "entropy": 5.359607553482055, "epoch": 3.7504942665085013, "grad_norm": 1.015625, "learning_rate": 0.0003651123068043963, "loss": 4.9451, "mean_token_accuracy": 0.2212749943137169, "num_tokens": 86899703.0, "step": 37940 }, { "entropy": 5.383024978637695, "epoch": 3.7509885330170025, "grad_norm": 0.91796875, "learning_rate": 0.00036507996958642746, "loss": 4.8817, "mean_token_accuracy": 0.23018389642238618, "num_tokens": 86911753.0, "step": 37945 }, { "entropy": 5.5081065654754635, "epoch": 3.7514827995255042, "grad_norm": 0.90625, "learning_rate": 0.0003650476301524773, "loss": 5.0456, "mean_token_accuracy": 0.22067539244890214, "num_tokens": 86924165.0, "step": 37950 }, { "entropy": 5.392571687698364, "epoch": 3.7519770660340055, "grad_norm": 0.94140625, "learning_rate": 0.0003650152885033416, "loss": 4.9233, "mean_token_accuracy": 0.2235248178243637, "num_tokens": 86935848.0, "step": 37955 }, { "entropy": 5.313085079193115, "epoch": 3.7524713325425068, "grad_norm": 0.9765625, "learning_rate": 0.00036498294463981583, "loss": 4.8171, "mean_token_accuracy": 0.22586697190999985, "num_tokens": 86946816.0, "step": 37960 }, { "entropy": 5.418202495574951, "epoch": 3.7529655990510085, "grad_norm": 1.0234375, "learning_rate": 0.00036495059856269556, "loss": 4.9111, "mean_token_accuracy": 0.2251382663846016, "num_tokens": 86958436.0, "step": 37965 }, { "entropy": 5.4179126739501955, "epoch": 3.7534598655595097, "grad_norm": 0.96875, "learning_rate": 0.0003649182502727768, "loss": 4.8706, "mean_token_accuracy": 0.22353545874357222, "num_tokens": 86970338.0, "step": 37970 }, { "entropy": 5.335784530639648, "epoch": 3.753954132068011, "grad_norm": 0.98046875, "learning_rate": 0.00036488589977085495, "loss": 4.8616, "mean_token_accuracy": 0.22124839425086976, "num_tokens": 86981796.0, "step": 37975 }, { "entropy": 5.257256984710693, "epoch": 3.7544483985765122, "grad_norm": 1.0234375, "learning_rate": 0.00036485354705772605, "loss": 4.8133, "mean_token_accuracy": 0.2379045844078064, "num_tokens": 86993681.0, "step": 37980 }, { "entropy": 5.4019153118133545, "epoch": 3.754942665085014, "grad_norm": 1.0703125, "learning_rate": 0.00036482119213418604, "loss": 5.0293, "mean_token_accuracy": 0.21565725207328795, "num_tokens": 87005621.0, "step": 37985 }, { "entropy": 5.346227216720581, "epoch": 3.755436931593515, "grad_norm": 1.0, "learning_rate": 0.00036478883500103067, "loss": 4.8778, "mean_token_accuracy": 0.23000551909208297, "num_tokens": 87016054.0, "step": 37990 }, { "entropy": 5.377190256118775, "epoch": 3.7559311981020165, "grad_norm": 0.9765625, "learning_rate": 0.0003647564756590561, "loss": 4.8593, "mean_token_accuracy": 0.22651178687810897, "num_tokens": 87026603.0, "step": 37995 }, { "entropy": 5.363053703308106, "epoch": 3.756425464610518, "grad_norm": 1.0234375, "learning_rate": 0.0003647241141090583, "loss": 4.8837, "mean_token_accuracy": 0.22475794702768326, "num_tokens": 87037036.0, "step": 38000 }, { "entropy": 5.3225304126739506, "epoch": 3.7569197311190194, "grad_norm": 1.1015625, "learning_rate": 0.0003646917503518333, "loss": 4.8107, "mean_token_accuracy": 0.23683008402585984, "num_tokens": 87047360.0, "step": 38005 }, { "entropy": 5.2651878833770756, "epoch": 3.7574139976275207, "grad_norm": 1.0234375, "learning_rate": 0.00036465938438817735, "loss": 4.8111, "mean_token_accuracy": 0.23411089330911636, "num_tokens": 87058580.0, "step": 38010 }, { "entropy": 5.318077468872071, "epoch": 3.757908264136022, "grad_norm": 1.0390625, "learning_rate": 0.0003646270162188867, "loss": 4.9272, "mean_token_accuracy": 0.22590129673480988, "num_tokens": 87070176.0, "step": 38015 }, { "entropy": 5.415104150772095, "epoch": 3.7584025306445237, "grad_norm": 0.85546875, "learning_rate": 0.0003645946458447575, "loss": 4.8855, "mean_token_accuracy": 0.23313356339931487, "num_tokens": 87082188.0, "step": 38020 }, { "entropy": 5.393975114822387, "epoch": 3.758896797153025, "grad_norm": 0.97265625, "learning_rate": 0.0003645622732665862, "loss": 4.9015, "mean_token_accuracy": 0.22035285979509353, "num_tokens": 87093784.0, "step": 38025 }, { "entropy": 5.302675533294678, "epoch": 3.759391063661526, "grad_norm": 1.109375, "learning_rate": 0.00036452989848516896, "loss": 4.8382, "mean_token_accuracy": 0.2278170794248581, "num_tokens": 87105102.0, "step": 38030 }, { "entropy": 5.285956859588623, "epoch": 3.759885330170028, "grad_norm": 1.015625, "learning_rate": 0.00036449752150130235, "loss": 4.8005, "mean_token_accuracy": 0.23450107574462892, "num_tokens": 87115956.0, "step": 38035 }, { "entropy": 5.273462438583374, "epoch": 3.760379596678529, "grad_norm": 1.1015625, "learning_rate": 0.00036446514231578287, "loss": 4.8225, "mean_token_accuracy": 0.23392489701509475, "num_tokens": 87126514.0, "step": 38040 }, { "entropy": 5.336463928222656, "epoch": 3.7608738631870304, "grad_norm": 0.98046875, "learning_rate": 0.00036443276092940703, "loss": 4.855, "mean_token_accuracy": 0.22503628581762314, "num_tokens": 87137249.0, "step": 38045 }, { "entropy": 5.400457954406738, "epoch": 3.7613681296955317, "grad_norm": 0.9765625, "learning_rate": 0.00036440037734297134, "loss": 4.9187, "mean_token_accuracy": 0.230281962454319, "num_tokens": 87148593.0, "step": 38050 }, { "entropy": 5.422585678100586, "epoch": 3.761862396204033, "grad_norm": 1.0703125, "learning_rate": 0.00036436799155727253, "loss": 4.9102, "mean_token_accuracy": 0.22507024705410003, "num_tokens": 87160085.0, "step": 38055 }, { "entropy": 5.362833261489868, "epoch": 3.7623566627125347, "grad_norm": 0.9609375, "learning_rate": 0.00036433560357310727, "loss": 4.8397, "mean_token_accuracy": 0.22409479767084123, "num_tokens": 87171427.0, "step": 38060 }, { "entropy": 5.319900369644165, "epoch": 3.762850929221036, "grad_norm": 0.96875, "learning_rate": 0.0003643032133912723, "loss": 4.8509, "mean_token_accuracy": 0.23050184100866317, "num_tokens": 87183073.0, "step": 38065 }, { "entropy": 5.354214096069336, "epoch": 3.7633451957295376, "grad_norm": 1.140625, "learning_rate": 0.0003642708210125644, "loss": 4.8618, "mean_token_accuracy": 0.2307318389415741, "num_tokens": 87193199.0, "step": 38070 }, { "entropy": 5.415476369857788, "epoch": 3.763839462238039, "grad_norm": 1.1015625, "learning_rate": 0.00036423842643778045, "loss": 4.9146, "mean_token_accuracy": 0.22255075871944427, "num_tokens": 87205052.0, "step": 38075 }, { "entropy": 5.409682130813598, "epoch": 3.76433372874654, "grad_norm": 1.046875, "learning_rate": 0.00036420602966771734, "loss": 4.9537, "mean_token_accuracy": 0.22160982936620713, "num_tokens": 87217485.0, "step": 38080 }, { "entropy": 5.340493011474609, "epoch": 3.7648279952550414, "grad_norm": 1.0625, "learning_rate": 0.0003641736307031721, "loss": 4.8455, "mean_token_accuracy": 0.23244841545820236, "num_tokens": 87228184.0, "step": 38085 }, { "entropy": 5.336638975143432, "epoch": 3.7653222617635427, "grad_norm": 0.9453125, "learning_rate": 0.00036414122954494177, "loss": 4.9452, "mean_token_accuracy": 0.22317275255918503, "num_tokens": 87240713.0, "step": 38090 }, { "entropy": 5.369870615005493, "epoch": 3.7658165282720444, "grad_norm": 0.9765625, "learning_rate": 0.0003641088261938233, "loss": 4.9503, "mean_token_accuracy": 0.21695732772350312, "num_tokens": 87252739.0, "step": 38095 }, { "entropy": 5.283787584304809, "epoch": 3.7663107947805456, "grad_norm": 1.0859375, "learning_rate": 0.0003640764206506138, "loss": 4.7652, "mean_token_accuracy": 0.24448940008878708, "num_tokens": 87263034.0, "step": 38100 }, { "entropy": 5.363323450088501, "epoch": 3.766805061289047, "grad_norm": 0.9609375, "learning_rate": 0.0003640440129161107, "loss": 4.8927, "mean_token_accuracy": 0.229938106238842, "num_tokens": 87275384.0, "step": 38105 }, { "entropy": 5.393299865722656, "epoch": 3.7672993277975486, "grad_norm": 1.0625, "learning_rate": 0.00036401160299111095, "loss": 4.9507, "mean_token_accuracy": 0.21932601183652878, "num_tokens": 87286568.0, "step": 38110 }, { "entropy": 5.3443763732910154, "epoch": 3.76779359430605, "grad_norm": 0.94140625, "learning_rate": 0.000363979190876412, "loss": 4.8495, "mean_token_accuracy": 0.23037409037351608, "num_tokens": 87297972.0, "step": 38115 }, { "entropy": 5.423915147781372, "epoch": 3.768287860814551, "grad_norm": 1.0625, "learning_rate": 0.00036394677657281113, "loss": 4.8392, "mean_token_accuracy": 0.23136909753084184, "num_tokens": 87309137.0, "step": 38120 }, { "entropy": 5.324648714065551, "epoch": 3.7687821273230524, "grad_norm": 1.015625, "learning_rate": 0.00036391436008110573, "loss": 4.9098, "mean_token_accuracy": 0.22938600927591324, "num_tokens": 87320097.0, "step": 38125 }, { "entropy": 5.297325658798218, "epoch": 3.769276393831554, "grad_norm": 1.0546875, "learning_rate": 0.00036388194140209336, "loss": 4.8531, "mean_token_accuracy": 0.2341489836573601, "num_tokens": 87332662.0, "step": 38130 }, { "entropy": 5.40741605758667, "epoch": 3.7697706603400554, "grad_norm": 1.03125, "learning_rate": 0.00036384952053657144, "loss": 4.875, "mean_token_accuracy": 0.2403239369392395, "num_tokens": 87344118.0, "step": 38135 }, { "entropy": 5.268925285339355, "epoch": 3.7702649268485566, "grad_norm": 1.015625, "learning_rate": 0.00036381709748533746, "loss": 4.8179, "mean_token_accuracy": 0.23086515218019485, "num_tokens": 87355787.0, "step": 38140 }, { "entropy": 5.330609321594238, "epoch": 3.7707591933570583, "grad_norm": 1.0546875, "learning_rate": 0.0003637846722491892, "loss": 4.8305, "mean_token_accuracy": 0.2314717710018158, "num_tokens": 87367332.0, "step": 38145 }, { "entropy": 5.345599222183227, "epoch": 3.7712534598655596, "grad_norm": 0.97265625, "learning_rate": 0.0003637522448289241, "loss": 4.834, "mean_token_accuracy": 0.23608337193727494, "num_tokens": 87378968.0, "step": 38150 }, { "entropy": 5.3243310928344725, "epoch": 3.771747726374061, "grad_norm": 0.96484375, "learning_rate": 0.0003637198152253401, "loss": 4.8685, "mean_token_accuracy": 0.23133375495672226, "num_tokens": 87391573.0, "step": 38155 }, { "entropy": 5.345226383209228, "epoch": 3.772241992882562, "grad_norm": 1.1015625, "learning_rate": 0.0003636873834392349, "loss": 4.8835, "mean_token_accuracy": 0.22699294686317445, "num_tokens": 87402431.0, "step": 38160 }, { "entropy": 5.325432682037354, "epoch": 3.7727362593910634, "grad_norm": 0.9375, "learning_rate": 0.0003636549494714062, "loss": 4.918, "mean_token_accuracy": 0.22692957371473313, "num_tokens": 87414156.0, "step": 38165 }, { "entropy": 5.326112747192383, "epoch": 3.773230525899565, "grad_norm": 0.953125, "learning_rate": 0.00036362251332265204, "loss": 4.8509, "mean_token_accuracy": 0.22909048199653625, "num_tokens": 87425878.0, "step": 38170 }, { "entropy": 5.365592384338379, "epoch": 3.7737247924080664, "grad_norm": 1.046875, "learning_rate": 0.0003635900749937703, "loss": 4.8864, "mean_token_accuracy": 0.23072891235351561, "num_tokens": 87437171.0, "step": 38175 }, { "entropy": 5.332992458343506, "epoch": 3.774219058916568, "grad_norm": 1.0703125, "learning_rate": 0.000363557634485559, "loss": 4.8301, "mean_token_accuracy": 0.2271296426653862, "num_tokens": 87448465.0, "step": 38180 }, { "entropy": 5.293912267684936, "epoch": 3.7747133254250693, "grad_norm": 1.078125, "learning_rate": 0.0003635251917988162, "loss": 4.8148, "mean_token_accuracy": 0.2318248674273491, "num_tokens": 87458800.0, "step": 38185 }, { "entropy": 5.3281519412994385, "epoch": 3.7752075919335706, "grad_norm": 0.9921875, "learning_rate": 0.0003634927469343399, "loss": 4.8141, "mean_token_accuracy": 0.23595484644174575, "num_tokens": 87470427.0, "step": 38190 }, { "entropy": 5.336515426635742, "epoch": 3.775701858442072, "grad_norm": 1.0, "learning_rate": 0.0003634602998929282, "loss": 4.837, "mean_token_accuracy": 0.23225877583026885, "num_tokens": 87481498.0, "step": 38195 }, { "entropy": 5.271830081939697, "epoch": 3.776196124950573, "grad_norm": 1.0546875, "learning_rate": 0.0003634278506753795, "loss": 4.8081, "mean_token_accuracy": 0.2363478273153305, "num_tokens": 87493578.0, "step": 38200 }, { "entropy": 5.402250671386719, "epoch": 3.776690391459075, "grad_norm": 1.125, "learning_rate": 0.000363395399282492, "loss": 4.9207, "mean_token_accuracy": 0.21721294522285461, "num_tokens": 87504387.0, "step": 38205 }, { "entropy": 5.4143274307250975, "epoch": 3.777184657967576, "grad_norm": 1.0390625, "learning_rate": 0.00036336294571506387, "loss": 4.8452, "mean_token_accuracy": 0.2269751861691475, "num_tokens": 87514231.0, "step": 38210 }, { "entropy": 5.3479022026062015, "epoch": 3.7776789244760773, "grad_norm": 1.046875, "learning_rate": 0.00036333048997389363, "loss": 4.8981, "mean_token_accuracy": 0.2273597612977028, "num_tokens": 87526483.0, "step": 38215 }, { "entropy": 5.34328179359436, "epoch": 3.778173190984579, "grad_norm": 0.984375, "learning_rate": 0.0003632980320597797, "loss": 4.8851, "mean_token_accuracy": 0.22264324128627777, "num_tokens": 87537931.0, "step": 38220 }, { "entropy": 5.343886089324951, "epoch": 3.7786674574930803, "grad_norm": 1.0234375, "learning_rate": 0.0003632655719735203, "loss": 4.8533, "mean_token_accuracy": 0.2284371718764305, "num_tokens": 87549486.0, "step": 38225 }, { "entropy": 5.421779584884644, "epoch": 3.7791617240015816, "grad_norm": 0.953125, "learning_rate": 0.0003632331097159143, "loss": 4.9387, "mean_token_accuracy": 0.22603436708450317, "num_tokens": 87562232.0, "step": 38230 }, { "entropy": 5.394529485702515, "epoch": 3.779655990510083, "grad_norm": 0.96875, "learning_rate": 0.00036320064528776, "loss": 4.8211, "mean_token_accuracy": 0.23128775358200074, "num_tokens": 87574246.0, "step": 38235 }, { "entropy": 5.361046934127808, "epoch": 3.7801502570185845, "grad_norm": 1.1015625, "learning_rate": 0.0003631681786898562, "loss": 4.8475, "mean_token_accuracy": 0.22932169437408448, "num_tokens": 87586033.0, "step": 38240 }, { "entropy": 5.3254115104675295, "epoch": 3.780644523527086, "grad_norm": 1.078125, "learning_rate": 0.0003631357099230015, "loss": 4.8678, "mean_token_accuracy": 0.22787068635225297, "num_tokens": 87596468.0, "step": 38245 }, { "entropy": 5.393712711334229, "epoch": 3.781138790035587, "grad_norm": 0.94921875, "learning_rate": 0.0003631032389879947, "loss": 4.9209, "mean_token_accuracy": 0.22521136254072188, "num_tokens": 87608577.0, "step": 38250 }, { "entropy": 5.336244201660156, "epoch": 3.7816330565440888, "grad_norm": 0.92578125, "learning_rate": 0.0003630707658856345, "loss": 4.9027, "mean_token_accuracy": 0.22325571924448012, "num_tokens": 87620773.0, "step": 38255 }, { "entropy": 5.415024900436402, "epoch": 3.78212732305259, "grad_norm": 1.015625, "learning_rate": 0.00036303829061671986, "loss": 4.9224, "mean_token_accuracy": 0.22455300837755204, "num_tokens": 87633248.0, "step": 38260 }, { "entropy": 5.398361778259277, "epoch": 3.7826215895610913, "grad_norm": 1.03125, "learning_rate": 0.0003630058131820495, "loss": 4.8928, "mean_token_accuracy": 0.22102607488632203, "num_tokens": 87644710.0, "step": 38265 }, { "entropy": 5.3185759544372555, "epoch": 3.7831158560695926, "grad_norm": 0.9921875, "learning_rate": 0.0003629733335824226, "loss": 4.8241, "mean_token_accuracy": 0.23241257071495056, "num_tokens": 87655297.0, "step": 38270 }, { "entropy": 5.324174880981445, "epoch": 3.7836101225780943, "grad_norm": 1.0234375, "learning_rate": 0.000362940851818638, "loss": 4.8376, "mean_token_accuracy": 0.23247567117214202, "num_tokens": 87667595.0, "step": 38275 }, { "entropy": 5.327319860458374, "epoch": 3.7841043890865955, "grad_norm": 0.9453125, "learning_rate": 0.00036290836789149483, "loss": 4.8494, "mean_token_accuracy": 0.22743949592113494, "num_tokens": 87680041.0, "step": 38280 }, { "entropy": 5.3841451644897464, "epoch": 3.784598655595097, "grad_norm": 1.0390625, "learning_rate": 0.00036287588180179215, "loss": 4.927, "mean_token_accuracy": 0.22256843894720077, "num_tokens": 87691287.0, "step": 38285 }, { "entropy": 5.367755794525147, "epoch": 3.7850929221035985, "grad_norm": 1.0859375, "learning_rate": 0.0003628433935503291, "loss": 4.9023, "mean_token_accuracy": 0.22961652427911758, "num_tokens": 87704224.0, "step": 38290 }, { "entropy": 5.353496122360229, "epoch": 3.7855871886120998, "grad_norm": 1.109375, "learning_rate": 0.000362810903137905, "loss": 4.8646, "mean_token_accuracy": 0.2328616887331009, "num_tokens": 87714449.0, "step": 38295 }, { "entropy": 5.364243698120117, "epoch": 3.786081455120601, "grad_norm": 1.0, "learning_rate": 0.000362778410565319, "loss": 4.8797, "mean_token_accuracy": 0.22384672611951828, "num_tokens": 87725348.0, "step": 38300 }, { "entropy": 5.373865127563477, "epoch": 3.7865757216291023, "grad_norm": 1.0859375, "learning_rate": 0.00036274591583337055, "loss": 4.871, "mean_token_accuracy": 0.2292153373360634, "num_tokens": 87737244.0, "step": 38305 }, { "entropy": 5.296612405776978, "epoch": 3.7870699881376035, "grad_norm": 0.953125, "learning_rate": 0.00036271341894285894, "loss": 4.8715, "mean_token_accuracy": 0.2200282484292984, "num_tokens": 87748710.0, "step": 38310 }, { "entropy": 5.336021804809571, "epoch": 3.7875642546461052, "grad_norm": 1.0, "learning_rate": 0.00036268091989458357, "loss": 4.9501, "mean_token_accuracy": 0.22037243247032165, "num_tokens": 87759944.0, "step": 38315 }, { "entropy": 5.418487501144409, "epoch": 3.7880585211546065, "grad_norm": 1.0703125, "learning_rate": 0.0003626484186893441, "loss": 4.8825, "mean_token_accuracy": 0.22596318274736404, "num_tokens": 87771201.0, "step": 38320 }, { "entropy": 5.368275690078735, "epoch": 3.788552787663108, "grad_norm": 1.0, "learning_rate": 0.0003626159153279398, "loss": 4.8358, "mean_token_accuracy": 0.2353709116578102, "num_tokens": 87782129.0, "step": 38325 }, { "entropy": 5.293320655822754, "epoch": 3.7890470541716095, "grad_norm": 1.03125, "learning_rate": 0.00036258340981117044, "loss": 4.834, "mean_token_accuracy": 0.23037270158529283, "num_tokens": 87792915.0, "step": 38330 }, { "entropy": 5.326624584197998, "epoch": 3.7895413206801107, "grad_norm": 1.0, "learning_rate": 0.00036255090213983555, "loss": 4.8162, "mean_token_accuracy": 0.22929777055978776, "num_tokens": 87803301.0, "step": 38335 }, { "entropy": 5.4223309516906735, "epoch": 3.790035587188612, "grad_norm": 1.0234375, "learning_rate": 0.00036251839231473494, "loss": 4.947, "mean_token_accuracy": 0.2223178267478943, "num_tokens": 87815167.0, "step": 38340 }, { "entropy": 5.356593275070191, "epoch": 3.7905298536971133, "grad_norm": 1.03125, "learning_rate": 0.0003624858803366684, "loss": 4.889, "mean_token_accuracy": 0.22587422281503677, "num_tokens": 87827348.0, "step": 38345 }, { "entropy": 5.296116781234741, "epoch": 3.791024120205615, "grad_norm": 1.0234375, "learning_rate": 0.0003624533662064355, "loss": 4.8227, "mean_token_accuracy": 0.24096131324768066, "num_tokens": 87837986.0, "step": 38350 }, { "entropy": 5.310147285461426, "epoch": 3.7915183867141162, "grad_norm": 1.1015625, "learning_rate": 0.0003624208499248362, "loss": 4.7822, "mean_token_accuracy": 0.23434026539325714, "num_tokens": 87847992.0, "step": 38355 }, { "entropy": 5.394367933273315, "epoch": 3.7920126532226175, "grad_norm": 0.9765625, "learning_rate": 0.0003623883314926705, "loss": 5.0051, "mean_token_accuracy": 0.21825725585222244, "num_tokens": 87859768.0, "step": 38360 }, { "entropy": 5.359997415542603, "epoch": 3.792506919731119, "grad_norm": 1.046875, "learning_rate": 0.0003623558109107383, "loss": 4.8759, "mean_token_accuracy": 0.22261158674955367, "num_tokens": 87871366.0, "step": 38365 }, { "entropy": 5.325900602340698, "epoch": 3.7930011862396205, "grad_norm": 1.109375, "learning_rate": 0.0003623232881798395, "loss": 4.8614, "mean_token_accuracy": 0.23714397549629213, "num_tokens": 87883074.0, "step": 38370 }, { "entropy": 5.324184799194336, "epoch": 3.7934954527481217, "grad_norm": 1.0390625, "learning_rate": 0.00036229076330077445, "loss": 4.8427, "mean_token_accuracy": 0.22796983271837234, "num_tokens": 87894906.0, "step": 38375 }, { "entropy": 5.344142818450928, "epoch": 3.793989719256623, "grad_norm": 1.0078125, "learning_rate": 0.0003622582362743429, "loss": 4.7806, "mean_token_accuracy": 0.23789840191602707, "num_tokens": 87906027.0, "step": 38380 }, { "entropy": 5.311930227279663, "epoch": 3.7944839857651247, "grad_norm": 1.0234375, "learning_rate": 0.0003622257071013453, "loss": 4.8668, "mean_token_accuracy": 0.22572862058877946, "num_tokens": 87916348.0, "step": 38385 }, { "entropy": 5.329049348831177, "epoch": 3.794978252273626, "grad_norm": 1.03125, "learning_rate": 0.0003621931757825817, "loss": 4.8607, "mean_token_accuracy": 0.2262539356946945, "num_tokens": 87928397.0, "step": 38390 }, { "entropy": 5.409074878692627, "epoch": 3.795472518782127, "grad_norm": 0.99609375, "learning_rate": 0.00036216064231885255, "loss": 4.8935, "mean_token_accuracy": 0.22128913402557374, "num_tokens": 87939925.0, "step": 38395 }, { "entropy": 5.338060426712036, "epoch": 3.795966785290629, "grad_norm": 1.03125, "learning_rate": 0.00036212810671095797, "loss": 4.8852, "mean_token_accuracy": 0.23139142990112305, "num_tokens": 87951166.0, "step": 38400 }, { "entropy": 5.335096979141236, "epoch": 3.79646105179913, "grad_norm": 1.03125, "learning_rate": 0.00036209556895969847, "loss": 4.8103, "mean_token_accuracy": 0.2354331061244011, "num_tokens": 87962861.0, "step": 38405 }, { "entropy": 5.282854509353638, "epoch": 3.7969553183076314, "grad_norm": 0.97265625, "learning_rate": 0.0003620630290658745, "loss": 4.717, "mean_token_accuracy": 0.2399861440062523, "num_tokens": 87974362.0, "step": 38410 }, { "entropy": 5.364345741271973, "epoch": 3.7974495848161327, "grad_norm": 1.0234375, "learning_rate": 0.0003620304870302865, "loss": 4.8671, "mean_token_accuracy": 0.2263699248433113, "num_tokens": 87984982.0, "step": 38415 }, { "entropy": 5.3159984111785885, "epoch": 3.797943851324634, "grad_norm": 0.96484375, "learning_rate": 0.00036199794285373505, "loss": 4.8386, "mean_token_accuracy": 0.2292311742901802, "num_tokens": 87996980.0, "step": 38420 }, { "entropy": 5.360739040374756, "epoch": 3.7984381178331357, "grad_norm": 1.046875, "learning_rate": 0.00036196539653702073, "loss": 4.8417, "mean_token_accuracy": 0.23049808889627457, "num_tokens": 88008585.0, "step": 38425 }, { "entropy": 5.2831724166870115, "epoch": 3.798932384341637, "grad_norm": 1.0390625, "learning_rate": 0.000361932848080944, "loss": 4.8257, "mean_token_accuracy": 0.23755874037742614, "num_tokens": 88020779.0, "step": 38430 }, { "entropy": 5.380709791183472, "epoch": 3.7994266508501386, "grad_norm": 1.0390625, "learning_rate": 0.0003619002974863059, "loss": 4.9326, "mean_token_accuracy": 0.22018684148788453, "num_tokens": 88033003.0, "step": 38435 }, { "entropy": 5.381381177902222, "epoch": 3.79992091735864, "grad_norm": 0.921875, "learning_rate": 0.00036186774475390686, "loss": 4.8244, "mean_token_accuracy": 0.2334182381629944, "num_tokens": 88044095.0, "step": 38440 }, { "entropy": 5.393739652633667, "epoch": 3.800415183867141, "grad_norm": 1.078125, "learning_rate": 0.00036183518988454794, "loss": 4.9341, "mean_token_accuracy": 0.22692109942436217, "num_tokens": 88056487.0, "step": 38445 }, { "entropy": 5.308628892898559, "epoch": 3.8009094503756424, "grad_norm": 0.984375, "learning_rate": 0.0003618026328790299, "loss": 4.8881, "mean_token_accuracy": 0.23089361786842347, "num_tokens": 88067803.0, "step": 38450 }, { "entropy": 5.415417432785034, "epoch": 3.8014037168841437, "grad_norm": 1.03125, "learning_rate": 0.0003617700737381535, "loss": 4.8922, "mean_token_accuracy": 0.23220450580120086, "num_tokens": 88078914.0, "step": 38455 }, { "entropy": 5.377992916107178, "epoch": 3.8018979833926454, "grad_norm": 1.109375, "learning_rate": 0.0003617375124627199, "loss": 4.8629, "mean_token_accuracy": 0.22476836144924164, "num_tokens": 88090567.0, "step": 38460 }, { "entropy": 5.358003091812134, "epoch": 3.8023922499011467, "grad_norm": 1.046875, "learning_rate": 0.00036170494905352996, "loss": 4.8804, "mean_token_accuracy": 0.22413631677627563, "num_tokens": 88101171.0, "step": 38465 }, { "entropy": 5.373101997375488, "epoch": 3.802886516409648, "grad_norm": 0.984375, "learning_rate": 0.00036167238351138487, "loss": 4.8891, "mean_token_accuracy": 0.22952985614538193, "num_tokens": 88111629.0, "step": 38470 }, { "entropy": 5.412649393081665, "epoch": 3.8033807829181496, "grad_norm": 1.0859375, "learning_rate": 0.00036163981583708574, "loss": 4.8945, "mean_token_accuracy": 0.22377551198005677, "num_tokens": 88122354.0, "step": 38475 }, { "entropy": 5.297402620315552, "epoch": 3.803875049426651, "grad_norm": 1.0546875, "learning_rate": 0.0003616072460314336, "loss": 4.8497, "mean_token_accuracy": 0.23153023272752762, "num_tokens": 88134830.0, "step": 38480 }, { "entropy": 5.300182867050171, "epoch": 3.804369315935152, "grad_norm": 1.0859375, "learning_rate": 0.00036157467409522986, "loss": 4.7884, "mean_token_accuracy": 0.23461138755083083, "num_tokens": 88145995.0, "step": 38485 }, { "entropy": 5.390954303741455, "epoch": 3.8048635824436534, "grad_norm": 1.109375, "learning_rate": 0.0003615421000292757, "loss": 4.9015, "mean_token_accuracy": 0.22602294534444808, "num_tokens": 88157777.0, "step": 38490 }, { "entropy": 5.413525581359863, "epoch": 3.805357848952155, "grad_norm": 1.0234375, "learning_rate": 0.00036150952383437246, "loss": 4.9329, "mean_token_accuracy": 0.21816909015178682, "num_tokens": 88169971.0, "step": 38495 }, { "entropy": 5.315480756759643, "epoch": 3.8058521154606564, "grad_norm": 1.0546875, "learning_rate": 0.0003614769455113215, "loss": 4.7986, "mean_token_accuracy": 0.22978946417570115, "num_tokens": 88181317.0, "step": 38500 }, { "entropy": 5.4178986072540285, "epoch": 3.8063463819691576, "grad_norm": 0.93359375, "learning_rate": 0.0003614443650609242, "loss": 5.0009, "mean_token_accuracy": 0.21558564454317092, "num_tokens": 88194603.0, "step": 38505 }, { "entropy": 5.4000084400177, "epoch": 3.8068406484776594, "grad_norm": 0.984375, "learning_rate": 0.0003614117824839822, "loss": 4.9455, "mean_token_accuracy": 0.2203699216246605, "num_tokens": 88205775.0, "step": 38510 }, { "entropy": 5.356663846969605, "epoch": 3.8073349149861606, "grad_norm": 1.0234375, "learning_rate": 0.0003613791977812969, "loss": 4.9034, "mean_token_accuracy": 0.2205299913883209, "num_tokens": 88216784.0, "step": 38515 }, { "entropy": 5.427613925933838, "epoch": 3.807829181494662, "grad_norm": 1.1015625, "learning_rate": 0.00036134661095367, "loss": 4.8446, "mean_token_accuracy": 0.23139554858207703, "num_tokens": 88228861.0, "step": 38520 }, { "entropy": 5.410721921920777, "epoch": 3.808323448003163, "grad_norm": 0.9765625, "learning_rate": 0.00036131402200190296, "loss": 4.866, "mean_token_accuracy": 0.23002018481492997, "num_tokens": 88241134.0, "step": 38525 }, { "entropy": 5.316413879394531, "epoch": 3.808817714511665, "grad_norm": 1.046875, "learning_rate": 0.00036128143092679764, "loss": 4.8536, "mean_token_accuracy": 0.22681862264871597, "num_tokens": 88253295.0, "step": 38530 }, { "entropy": 5.36937518119812, "epoch": 3.809311981020166, "grad_norm": 0.9765625, "learning_rate": 0.00036124883772915573, "loss": 4.8939, "mean_token_accuracy": 0.2213737979531288, "num_tokens": 88265906.0, "step": 38535 }, { "entropy": 5.307774639129638, "epoch": 3.8098062475286674, "grad_norm": 1.046875, "learning_rate": 0.0003612162424097791, "loss": 4.778, "mean_token_accuracy": 0.2374565064907074, "num_tokens": 88276928.0, "step": 38540 }, { "entropy": 5.297874450683594, "epoch": 3.810300514037169, "grad_norm": 1.0, "learning_rate": 0.00036118364496946943, "loss": 4.8348, "mean_token_accuracy": 0.23539720326662064, "num_tokens": 88288125.0, "step": 38545 }, { "entropy": 5.348841333389283, "epoch": 3.8107947805456703, "grad_norm": 1.1015625, "learning_rate": 0.0003611510454090288, "loss": 4.8706, "mean_token_accuracy": 0.22641536295413972, "num_tokens": 88298778.0, "step": 38550 }, { "entropy": 5.383422470092773, "epoch": 3.8112890470541716, "grad_norm": 1.09375, "learning_rate": 0.000361118443729259, "loss": 4.8676, "mean_token_accuracy": 0.23242599219083787, "num_tokens": 88309086.0, "step": 38555 }, { "entropy": 5.349318170547486, "epoch": 3.811783313562673, "grad_norm": 0.94921875, "learning_rate": 0.0003610858399309622, "loss": 4.9103, "mean_token_accuracy": 0.2235589638352394, "num_tokens": 88320358.0, "step": 38560 }, { "entropy": 5.34122257232666, "epoch": 3.812277580071174, "grad_norm": 1.015625, "learning_rate": 0.0003610532340149404, "loss": 4.7822, "mean_token_accuracy": 0.23881173580884935, "num_tokens": 88331767.0, "step": 38565 }, { "entropy": 5.314900255203247, "epoch": 3.812771846579676, "grad_norm": 1.0234375, "learning_rate": 0.00036102062598199566, "loss": 4.774, "mean_token_accuracy": 0.23315003365278245, "num_tokens": 88342197.0, "step": 38570 }, { "entropy": 5.3448474407196045, "epoch": 3.813266113088177, "grad_norm": 1.046875, "learning_rate": 0.0003609880158329301, "loss": 4.8438, "mean_token_accuracy": 0.22857076078653335, "num_tokens": 88353378.0, "step": 38575 }, { "entropy": 5.2246129512786865, "epoch": 3.813760379596679, "grad_norm": 1.0, "learning_rate": 0.0003609554035685462, "loss": 4.778, "mean_token_accuracy": 0.23535057306289672, "num_tokens": 88366006.0, "step": 38580 }, { "entropy": 5.401881885528565, "epoch": 3.81425464610518, "grad_norm": 1.0390625, "learning_rate": 0.0003609227891896459, "loss": 4.9599, "mean_token_accuracy": 0.22324532121419907, "num_tokens": 88378132.0, "step": 38585 }, { "entropy": 5.327497434616089, "epoch": 3.8147489126136813, "grad_norm": 1.0703125, "learning_rate": 0.00036089017269703164, "loss": 4.8015, "mean_token_accuracy": 0.23151977956295014, "num_tokens": 88389760.0, "step": 38590 }, { "entropy": 5.321097755432129, "epoch": 3.8152431791221826, "grad_norm": 1.078125, "learning_rate": 0.00036085755409150577, "loss": 4.856, "mean_token_accuracy": 0.23330127894878389, "num_tokens": 88402518.0, "step": 38595 }, { "entropy": 5.379788875579834, "epoch": 3.815737445630684, "grad_norm": 1.0546875, "learning_rate": 0.0003608249333738709, "loss": 4.9005, "mean_token_accuracy": 0.21971990168094635, "num_tokens": 88413359.0, "step": 38600 }, { "entropy": 5.369346284866333, "epoch": 3.8162317121391856, "grad_norm": 1.0703125, "learning_rate": 0.0003607923105449292, "loss": 4.879, "mean_token_accuracy": 0.22521990537643433, "num_tokens": 88424966.0, "step": 38605 }, { "entropy": 5.275629043579102, "epoch": 3.816725978647687, "grad_norm": 1.03125, "learning_rate": 0.00036075968560548346, "loss": 4.7323, "mean_token_accuracy": 0.23908917754888534, "num_tokens": 88435826.0, "step": 38610 }, { "entropy": 5.270106506347656, "epoch": 3.817220245156188, "grad_norm": 1.046875, "learning_rate": 0.00036072705855633613, "loss": 4.7968, "mean_token_accuracy": 0.23496506214141846, "num_tokens": 88447136.0, "step": 38615 }, { "entropy": 5.216276359558106, "epoch": 3.81771451166469, "grad_norm": 1.1484375, "learning_rate": 0.0003606944293982898, "loss": 4.739, "mean_token_accuracy": 0.24501573890447617, "num_tokens": 88458394.0, "step": 38620 }, { "entropy": 5.370578861236572, "epoch": 3.818208778173191, "grad_norm": 0.90625, "learning_rate": 0.0003606617981321473, "loss": 4.8558, "mean_token_accuracy": 0.22987488508224488, "num_tokens": 88469573.0, "step": 38625 }, { "entropy": 5.351563358306885, "epoch": 3.8187030446816923, "grad_norm": 1.140625, "learning_rate": 0.00036062916475871124, "loss": 4.8048, "mean_token_accuracy": 0.23460220247507096, "num_tokens": 88479561.0, "step": 38630 }, { "entropy": 5.304766273498535, "epoch": 3.8191973111901936, "grad_norm": 0.97265625, "learning_rate": 0.00036059652927878446, "loss": 4.885, "mean_token_accuracy": 0.23363392949104309, "num_tokens": 88492296.0, "step": 38635 }, { "entropy": 5.446779251098633, "epoch": 3.8196915776986953, "grad_norm": 1.078125, "learning_rate": 0.00036056389169316977, "loss": 4.987, "mean_token_accuracy": 0.22411785423755645, "num_tokens": 88504993.0, "step": 38640 }, { "entropy": 5.354978752136231, "epoch": 3.8201858442071965, "grad_norm": 1.0078125, "learning_rate": 0.00036053125200267, "loss": 4.8376, "mean_token_accuracy": 0.23644086122512817, "num_tokens": 88516126.0, "step": 38645 }, { "entropy": 5.3660839080810545, "epoch": 3.820680110715698, "grad_norm": 1.078125, "learning_rate": 0.0003604986102080882, "loss": 4.8928, "mean_token_accuracy": 0.21806873828172685, "num_tokens": 88527327.0, "step": 38650 }, { "entropy": 5.269163179397583, "epoch": 3.8211743772241995, "grad_norm": 0.984375, "learning_rate": 0.0003604659663102274, "loss": 4.7529, "mean_token_accuracy": 0.233850659430027, "num_tokens": 88539088.0, "step": 38655 }, { "entropy": 5.252378940582275, "epoch": 3.8216686437327008, "grad_norm": 1.015625, "learning_rate": 0.0003604333203098905, "loss": 4.8215, "mean_token_accuracy": 0.2327428475022316, "num_tokens": 88551539.0, "step": 38660 }, { "entropy": 5.342427778244018, "epoch": 3.822162910241202, "grad_norm": 0.9921875, "learning_rate": 0.00036040067220788075, "loss": 4.8429, "mean_token_accuracy": 0.22641442120075225, "num_tokens": 88563111.0, "step": 38665 }, { "entropy": 5.332728290557862, "epoch": 3.8226571767497033, "grad_norm": 1.140625, "learning_rate": 0.0003603680220050011, "loss": 4.8759, "mean_token_accuracy": 0.2311147227883339, "num_tokens": 88574181.0, "step": 38670 }, { "entropy": 5.358493995666504, "epoch": 3.8231514432582046, "grad_norm": 1.0234375, "learning_rate": 0.00036033536970205487, "loss": 4.9027, "mean_token_accuracy": 0.22481439709663392, "num_tokens": 88584965.0, "step": 38675 }, { "entropy": 5.465213108062744, "epoch": 3.8236457097667063, "grad_norm": 1.2265625, "learning_rate": 0.00036030271529984535, "loss": 4.9611, "mean_token_accuracy": 0.21721139997243882, "num_tokens": 88597390.0, "step": 38680 }, { "entropy": 5.412862110137939, "epoch": 3.8241399762752075, "grad_norm": 1.0078125, "learning_rate": 0.0003602700587991759, "loss": 4.8649, "mean_token_accuracy": 0.23177101612091064, "num_tokens": 88609470.0, "step": 38685 }, { "entropy": 5.3563840866088865, "epoch": 3.8246342427837092, "grad_norm": 1.1015625, "learning_rate": 0.00036023740020084963, "loss": 4.8482, "mean_token_accuracy": 0.23222074210643767, "num_tokens": 88620858.0, "step": 38690 }, { "entropy": 5.337638807296753, "epoch": 3.8251285092922105, "grad_norm": 1.09375, "learning_rate": 0.0003602047395056701, "loss": 4.8995, "mean_token_accuracy": 0.23071579933166503, "num_tokens": 88632191.0, "step": 38695 }, { "entropy": 5.391883134841919, "epoch": 3.8256227758007118, "grad_norm": 1.0703125, "learning_rate": 0.00036017207671444086, "loss": 4.8842, "mean_token_accuracy": 0.22145015895366668, "num_tokens": 88643405.0, "step": 38700 }, { "entropy": 5.2909448623657225, "epoch": 3.826117042309213, "grad_norm": 1.046875, "learning_rate": 0.00036013941182796516, "loss": 4.7111, "mean_token_accuracy": 0.2445885121822357, "num_tokens": 88653765.0, "step": 38705 }, { "entropy": 5.340324878692627, "epoch": 3.8266113088177143, "grad_norm": 1.0, "learning_rate": 0.00036010674484704684, "loss": 4.9087, "mean_token_accuracy": 0.22366599291563033, "num_tokens": 88665038.0, "step": 38710 }, { "entropy": 5.3206642150878904, "epoch": 3.827105575326216, "grad_norm": 1.0546875, "learning_rate": 0.0003600740757724894, "loss": 4.8182, "mean_token_accuracy": 0.2365850940346718, "num_tokens": 88675172.0, "step": 38715 }, { "entropy": 5.333687829971313, "epoch": 3.8275998418347172, "grad_norm": 0.97265625, "learning_rate": 0.00036004140460509646, "loss": 4.8654, "mean_token_accuracy": 0.22959543466567994, "num_tokens": 88687393.0, "step": 38720 }, { "entropy": 5.429917860031128, "epoch": 3.8280941083432185, "grad_norm": 1.078125, "learning_rate": 0.0003600087313456718, "loss": 4.9491, "mean_token_accuracy": 0.2174512967467308, "num_tokens": 88700117.0, "step": 38725 }, { "entropy": 5.358299732208252, "epoch": 3.82858837485172, "grad_norm": 1.1796875, "learning_rate": 0.00035997605599501914, "loss": 4.8521, "mean_token_accuracy": 0.23116564899682998, "num_tokens": 88711329.0, "step": 38730 }, { "entropy": 5.446119928359986, "epoch": 3.8290826413602215, "grad_norm": 1.0234375, "learning_rate": 0.0003599433785539423, "loss": 4.9222, "mean_token_accuracy": 0.2237999677658081, "num_tokens": 88722017.0, "step": 38735 }, { "entropy": 5.296647644042968, "epoch": 3.8295769078687227, "grad_norm": 0.99609375, "learning_rate": 0.00035991069902324517, "loss": 4.8223, "mean_token_accuracy": 0.23357392251491546, "num_tokens": 88733749.0, "step": 38740 }, { "entropy": 5.367882013320923, "epoch": 3.830071174377224, "grad_norm": 1.046875, "learning_rate": 0.0003598780174037318, "loss": 4.8423, "mean_token_accuracy": 0.2276182472705841, "num_tokens": 88745885.0, "step": 38745 }, { "entropy": 5.452992296218872, "epoch": 3.8305654408857257, "grad_norm": 1.0703125, "learning_rate": 0.0003598453336962059, "loss": 5.0202, "mean_token_accuracy": 0.21784991174936294, "num_tokens": 88759216.0, "step": 38750 }, { "entropy": 5.350735282897949, "epoch": 3.831059707394227, "grad_norm": 1.0234375, "learning_rate": 0.00035981264790147167, "loss": 4.9069, "mean_token_accuracy": 0.2278805047273636, "num_tokens": 88770272.0, "step": 38755 }, { "entropy": 5.278324174880981, "epoch": 3.8315539739027282, "grad_norm": 0.97265625, "learning_rate": 0.0003597799600203331, "loss": 4.7816, "mean_token_accuracy": 0.24329739511013032, "num_tokens": 88781509.0, "step": 38760 }, { "entropy": 5.328139734268189, "epoch": 3.83204824041123, "grad_norm": 1.171875, "learning_rate": 0.00035974727005359434, "loss": 4.8873, "mean_token_accuracy": 0.22978536039590836, "num_tokens": 88791770.0, "step": 38765 }, { "entropy": 5.360169363021851, "epoch": 3.832542506919731, "grad_norm": 1.140625, "learning_rate": 0.0003597145780020597, "loss": 4.8782, "mean_token_accuracy": 0.2295731097459793, "num_tokens": 88804344.0, "step": 38770 }, { "entropy": 5.299268341064453, "epoch": 3.8330367734282325, "grad_norm": 1.015625, "learning_rate": 0.0003596818838665333, "loss": 4.7899, "mean_token_accuracy": 0.2365250125527382, "num_tokens": 88816251.0, "step": 38775 }, { "entropy": 5.291674280166626, "epoch": 3.8335310399367337, "grad_norm": 1.015625, "learning_rate": 0.0003596491876478193, "loss": 4.8398, "mean_token_accuracy": 0.22594382762908935, "num_tokens": 88827805.0, "step": 38780 }, { "entropy": 5.355212926864624, "epoch": 3.8340253064452354, "grad_norm": 0.9921875, "learning_rate": 0.0003596164893467222, "loss": 4.8451, "mean_token_accuracy": 0.23164054304361342, "num_tokens": 88839237.0, "step": 38785 }, { "entropy": 5.463304615020752, "epoch": 3.8345195729537367, "grad_norm": 1.1796875, "learning_rate": 0.00035958378896404635, "loss": 4.9499, "mean_token_accuracy": 0.2250041037797928, "num_tokens": 88850950.0, "step": 38790 }, { "entropy": 5.330179214477539, "epoch": 3.835013839462238, "grad_norm": 0.99609375, "learning_rate": 0.00035955108650059613, "loss": 4.8136, "mean_token_accuracy": 0.23652007132768632, "num_tokens": 88863743.0, "step": 38795 }, { "entropy": 5.284814929962158, "epoch": 3.8355081059707397, "grad_norm": 0.95703125, "learning_rate": 0.00035951838195717614, "loss": 4.7795, "mean_token_accuracy": 0.23637140691280364, "num_tokens": 88875375.0, "step": 38800 }, { "entropy": 5.379338788986206, "epoch": 3.836002372479241, "grad_norm": 1.046875, "learning_rate": 0.00035948567533459076, "loss": 4.9069, "mean_token_accuracy": 0.22986321300268173, "num_tokens": 88885890.0, "step": 38805 }, { "entropy": 5.385086297988892, "epoch": 3.836496638987742, "grad_norm": 0.96484375, "learning_rate": 0.00035945296663364467, "loss": 4.8483, "mean_token_accuracy": 0.22942228615283966, "num_tokens": 88897783.0, "step": 38810 }, { "entropy": 5.368971633911133, "epoch": 3.8369909054962434, "grad_norm": 1.0, "learning_rate": 0.00035942025585514257, "loss": 4.8962, "mean_token_accuracy": 0.22794905453920364, "num_tokens": 88908982.0, "step": 38815 }, { "entropy": 5.263632106781006, "epoch": 3.8374851720047447, "grad_norm": 1.046875, "learning_rate": 0.000359387542999889, "loss": 4.7684, "mean_token_accuracy": 0.24553241729736328, "num_tokens": 88921059.0, "step": 38820 }, { "entropy": 5.38988151550293, "epoch": 3.8379794385132464, "grad_norm": 1.0234375, "learning_rate": 0.0003593548280686889, "loss": 4.9714, "mean_token_accuracy": 0.22016989141702653, "num_tokens": 88932988.0, "step": 38825 }, { "entropy": 5.359765148162841, "epoch": 3.8384737050217477, "grad_norm": 1.0234375, "learning_rate": 0.0003593221110623468, "loss": 4.8587, "mean_token_accuracy": 0.23190755099058152, "num_tokens": 88944890.0, "step": 38830 }, { "entropy": 5.341831254959106, "epoch": 3.8389679715302494, "grad_norm": 1.0, "learning_rate": 0.00035928939198166777, "loss": 4.8515, "mean_token_accuracy": 0.22803628891706468, "num_tokens": 88956936.0, "step": 38835 }, { "entropy": 5.345082187652588, "epoch": 3.8394622380387506, "grad_norm": 1.0625, "learning_rate": 0.0003592566708274566, "loss": 4.9039, "mean_token_accuracy": 0.22817659825086595, "num_tokens": 88968705.0, "step": 38840 }, { "entropy": 5.334768199920655, "epoch": 3.839956504547252, "grad_norm": 0.98046875, "learning_rate": 0.0003592239476005183, "loss": 4.7929, "mean_token_accuracy": 0.23676215261220931, "num_tokens": 88979977.0, "step": 38845 }, { "entropy": 5.372999238967895, "epoch": 3.840450771055753, "grad_norm": 1.0234375, "learning_rate": 0.0003591912223016578, "loss": 4.9113, "mean_token_accuracy": 0.22296611070632935, "num_tokens": 88991974.0, "step": 38850 }, { "entropy": 5.281067419052124, "epoch": 3.8409450375642544, "grad_norm": 1.0078125, "learning_rate": 0.0003591584949316801, "loss": 4.7982, "mean_token_accuracy": 0.2399026036262512, "num_tokens": 89003733.0, "step": 38855 }, { "entropy": 5.4002148628234865, "epoch": 3.841439304072756, "grad_norm": 1.0, "learning_rate": 0.0003591257654913904, "loss": 4.9445, "mean_token_accuracy": 0.2151666358113289, "num_tokens": 89015701.0, "step": 38860 }, { "entropy": 5.409009647369385, "epoch": 3.8419335705812574, "grad_norm": 0.984375, "learning_rate": 0.0003590930339815938, "loss": 4.9253, "mean_token_accuracy": 0.22643686830997467, "num_tokens": 89027216.0, "step": 38865 }, { "entropy": 5.366315174102783, "epoch": 3.8424278370897587, "grad_norm": 0.98828125, "learning_rate": 0.0003590603004030956, "loss": 4.8483, "mean_token_accuracy": 0.22920263260602952, "num_tokens": 89039305.0, "step": 38870 }, { "entropy": 5.300953006744384, "epoch": 3.8429221035982604, "grad_norm": 0.95703125, "learning_rate": 0.000359027564756701, "loss": 4.7723, "mean_token_accuracy": 0.24024063646793364, "num_tokens": 89049982.0, "step": 38875 }, { "entropy": 5.3493781089782715, "epoch": 3.8434163701067616, "grad_norm": 0.97265625, "learning_rate": 0.0003589948270432151, "loss": 4.8543, "mean_token_accuracy": 0.23386740535497666, "num_tokens": 89062039.0, "step": 38880 }, { "entropy": 5.3854574203491214, "epoch": 3.843910636615263, "grad_norm": 1.0, "learning_rate": 0.0003589620872634436, "loss": 4.8478, "mean_token_accuracy": 0.22997320294380189, "num_tokens": 89072621.0, "step": 38885 }, { "entropy": 5.368063354492188, "epoch": 3.844404903123764, "grad_norm": 1.0703125, "learning_rate": 0.0003589293454181916, "loss": 4.8192, "mean_token_accuracy": 0.230879545211792, "num_tokens": 89084019.0, "step": 38890 }, { "entropy": 5.337488603591919, "epoch": 3.844899169632266, "grad_norm": 1.046875, "learning_rate": 0.00035889660150826473, "loss": 4.8772, "mean_token_accuracy": 0.2260674476623535, "num_tokens": 89094305.0, "step": 38895 }, { "entropy": 5.3130467414855955, "epoch": 3.845393436140767, "grad_norm": 1.03125, "learning_rate": 0.00035886385553446853, "loss": 4.8662, "mean_token_accuracy": 0.2209334909915924, "num_tokens": 89106261.0, "step": 38900 }, { "entropy": 5.2739804744720455, "epoch": 3.8458877026492684, "grad_norm": 1.1171875, "learning_rate": 0.00035883110749760836, "loss": 4.8112, "mean_token_accuracy": 0.2366209387779236, "num_tokens": 89118171.0, "step": 38905 }, { "entropy": 5.4105119705200195, "epoch": 3.84638196915777, "grad_norm": 1.0859375, "learning_rate": 0.00035879835739848994, "loss": 4.9508, "mean_token_accuracy": 0.2265930637717247, "num_tokens": 89129953.0, "step": 38910 }, { "entropy": 5.293031835556031, "epoch": 3.8468762356662713, "grad_norm": 1.03125, "learning_rate": 0.000358765605237919, "loss": 4.7458, "mean_token_accuracy": 0.24137990772724152, "num_tokens": 89143284.0, "step": 38915 }, { "entropy": 5.339274978637695, "epoch": 3.8473705021747726, "grad_norm": 1.1171875, "learning_rate": 0.0003587328510167012, "loss": 4.893, "mean_token_accuracy": 0.22630639970302582, "num_tokens": 89154675.0, "step": 38920 }, { "entropy": 5.39530382156372, "epoch": 3.847864768683274, "grad_norm": 1.0859375, "learning_rate": 0.0003587000947356421, "loss": 4.9267, "mean_token_accuracy": 0.21936150044202804, "num_tokens": 89164576.0, "step": 38925 }, { "entropy": 5.344863986968994, "epoch": 3.848359035191775, "grad_norm": 0.9765625, "learning_rate": 0.00035866733639554777, "loss": 4.9307, "mean_token_accuracy": 0.21964293122291564, "num_tokens": 89176106.0, "step": 38930 }, { "entropy": 5.359806537628174, "epoch": 3.848853301700277, "grad_norm": 0.98046875, "learning_rate": 0.000358634575997224, "loss": 4.8484, "mean_token_accuracy": 0.22418383061885833, "num_tokens": 89187214.0, "step": 38935 }, { "entropy": 5.265488386154175, "epoch": 3.849347568208778, "grad_norm": 1.1328125, "learning_rate": 0.0003586018135414767, "loss": 4.7239, "mean_token_accuracy": 0.2363439306616783, "num_tokens": 89198366.0, "step": 38940 }, { "entropy": 5.314633560180664, "epoch": 3.84984183471728, "grad_norm": 1.0859375, "learning_rate": 0.0003585690490291119, "loss": 4.9177, "mean_token_accuracy": 0.22793875485658646, "num_tokens": 89209122.0, "step": 38945 }, { "entropy": 5.413237905502319, "epoch": 3.850336101225781, "grad_norm": 0.99609375, "learning_rate": 0.0003585362824609354, "loss": 4.9217, "mean_token_accuracy": 0.22476533204317092, "num_tokens": 89221104.0, "step": 38950 }, { "entropy": 5.410201597213745, "epoch": 3.8508303677342823, "grad_norm": 1.0625, "learning_rate": 0.0003585035138377534, "loss": 4.8859, "mean_token_accuracy": 0.23163299560546874, "num_tokens": 89231087.0, "step": 38955 }, { "entropy": 5.380070447921753, "epoch": 3.8513246342427836, "grad_norm": 1.078125, "learning_rate": 0.00035847074316037206, "loss": 4.9493, "mean_token_accuracy": 0.2215514987707138, "num_tokens": 89243198.0, "step": 38960 }, { "entropy": 5.312656688690185, "epoch": 3.851818900751285, "grad_norm": 1.03125, "learning_rate": 0.0003584379704295975, "loss": 4.8308, "mean_token_accuracy": 0.2345993012189865, "num_tokens": 89254408.0, "step": 38965 }, { "entropy": 5.409298133850098, "epoch": 3.8523131672597866, "grad_norm": 1.0390625, "learning_rate": 0.0003584051956462359, "loss": 4.9138, "mean_token_accuracy": 0.22906606048345565, "num_tokens": 89266087.0, "step": 38970 }, { "entropy": 5.31666841506958, "epoch": 3.852807433768288, "grad_norm": 0.93359375, "learning_rate": 0.0003583724188110936, "loss": 4.8014, "mean_token_accuracy": 0.22748318910598755, "num_tokens": 89277039.0, "step": 38975 }, { "entropy": 5.400131320953369, "epoch": 3.853301700276789, "grad_norm": 1.0703125, "learning_rate": 0.00035833963992497667, "loss": 4.9247, "mean_token_accuracy": 0.22615182548761367, "num_tokens": 89288940.0, "step": 38980 }, { "entropy": 5.359665632247925, "epoch": 3.853795966785291, "grad_norm": 0.96484375, "learning_rate": 0.0003583068589886919, "loss": 4.8278, "mean_token_accuracy": 0.22810934782028197, "num_tokens": 89301460.0, "step": 38985 }, { "entropy": 5.353357267379761, "epoch": 3.854290233293792, "grad_norm": 0.98828125, "learning_rate": 0.00035827407600304533, "loss": 4.8963, "mean_token_accuracy": 0.2213057443499565, "num_tokens": 89312421.0, "step": 38990 }, { "entropy": 5.3401388168334964, "epoch": 3.8547844998022933, "grad_norm": 1.0234375, "learning_rate": 0.0003582412909688436, "loss": 4.8549, "mean_token_accuracy": 0.2279989540576935, "num_tokens": 89323552.0, "step": 38995 }, { "entropy": 5.400350618362427, "epoch": 3.8552787663107946, "grad_norm": 0.98828125, "learning_rate": 0.0003582085038868932, "loss": 4.8827, "mean_token_accuracy": 0.22004474997520446, "num_tokens": 89333911.0, "step": 39000 }, { "epoch": 3.8552787663107946, "eval_entropy": 5.180456919394443, "eval_loss": 4.952737808227539, "eval_mean_token_accuracy": 0.2317748072292532, "eval_num_tokens": 89333911.0, "eval_runtime": 26.5918, "eval_samples_per_second": 1222.668, "eval_steps_per_second": 152.866, "step": 39000 }, { "entropy": 5.447663927078247, "epoch": 3.8557730328192963, "grad_norm": 1.0078125, "learning_rate": 0.0003581757147580007, "loss": 4.9731, "mean_token_accuracy": 0.22081824243068696, "num_tokens": 89344632.0, "step": 39005 }, { "entropy": 5.320850038528443, "epoch": 3.8562672993277975, "grad_norm": 1.03125, "learning_rate": 0.00035814292358297273, "loss": 4.8488, "mean_token_accuracy": 0.23656653761863708, "num_tokens": 89354443.0, "step": 39010 }, { "entropy": 5.348056077957153, "epoch": 3.856761565836299, "grad_norm": 1.015625, "learning_rate": 0.000358110130362616, "loss": 4.9065, "mean_token_accuracy": 0.2304864853620529, "num_tokens": 89365292.0, "step": 39015 }, { "entropy": 5.421355390548706, "epoch": 3.8572558323448005, "grad_norm": 0.99609375, "learning_rate": 0.00035807733509773704, "loss": 4.9769, "mean_token_accuracy": 0.22165902107954025, "num_tokens": 89378280.0, "step": 39020 }, { "entropy": 5.441005420684815, "epoch": 3.857750098853302, "grad_norm": 1.1171875, "learning_rate": 0.0003580445377891428, "loss": 4.8804, "mean_token_accuracy": 0.22670079171657562, "num_tokens": 89390360.0, "step": 39025 }, { "entropy": 5.410392618179321, "epoch": 3.858244365361803, "grad_norm": 1.0390625, "learning_rate": 0.0003580117384376401, "loss": 4.9054, "mean_token_accuracy": 0.2289506420493126, "num_tokens": 89402057.0, "step": 39030 }, { "entropy": 5.306419086456299, "epoch": 3.8587386318703043, "grad_norm": 1.0390625, "learning_rate": 0.0003579789370440358, "loss": 4.827, "mean_token_accuracy": 0.22828393429517746, "num_tokens": 89413057.0, "step": 39035 }, { "entropy": 5.357796764373779, "epoch": 3.859232898378806, "grad_norm": 0.97265625, "learning_rate": 0.00035794613360913666, "loss": 4.9304, "mean_token_accuracy": 0.223772831261158, "num_tokens": 89425565.0, "step": 39040 }, { "entropy": 5.364382123947143, "epoch": 3.8597271648873073, "grad_norm": 1.078125, "learning_rate": 0.00035791332813374973, "loss": 4.871, "mean_token_accuracy": 0.22957610338926315, "num_tokens": 89436806.0, "step": 39045 }, { "entropy": 5.4171377658844, "epoch": 3.8602214313958085, "grad_norm": 1.0234375, "learning_rate": 0.00035788052061868215, "loss": 4.9441, "mean_token_accuracy": 0.2213951587677002, "num_tokens": 89448745.0, "step": 39050 }, { "entropy": 5.390992259979248, "epoch": 3.8607156979043102, "grad_norm": 1.0390625, "learning_rate": 0.0003578477110647409, "loss": 4.8837, "mean_token_accuracy": 0.23208559602499007, "num_tokens": 89460236.0, "step": 39055 }, { "entropy": 5.351096677780151, "epoch": 3.8612099644128115, "grad_norm": 1.03125, "learning_rate": 0.0003578148994727331, "loss": 4.8991, "mean_token_accuracy": 0.22690802067518234, "num_tokens": 89471534.0, "step": 39060 }, { "entropy": 5.4151958465576175, "epoch": 3.8617042309213128, "grad_norm": 0.95703125, "learning_rate": 0.0003577820858434659, "loss": 4.9139, "mean_token_accuracy": 0.22417684346437455, "num_tokens": 89483803.0, "step": 39065 }, { "entropy": 5.370829296112061, "epoch": 3.862198497429814, "grad_norm": 1.078125, "learning_rate": 0.00035774927017774653, "loss": 4.8647, "mean_token_accuracy": 0.2208304911851883, "num_tokens": 89494236.0, "step": 39070 }, { "entropy": 5.349783802032471, "epoch": 3.8626927639383153, "grad_norm": 0.99609375, "learning_rate": 0.00035771645247638243, "loss": 4.8668, "mean_token_accuracy": 0.2250627562403679, "num_tokens": 89506101.0, "step": 39075 }, { "entropy": 5.370531177520752, "epoch": 3.863187030446817, "grad_norm": 0.96875, "learning_rate": 0.00035768363274018064, "loss": 4.8544, "mean_token_accuracy": 0.23113704174757005, "num_tokens": 89518820.0, "step": 39080 }, { "entropy": 5.284267425537109, "epoch": 3.8636812969553183, "grad_norm": 1.0625, "learning_rate": 0.00035765081096994863, "loss": 4.7655, "mean_token_accuracy": 0.23451478481292726, "num_tokens": 89530337.0, "step": 39085 }, { "entropy": 5.295401096343994, "epoch": 3.86417556346382, "grad_norm": 0.99609375, "learning_rate": 0.00035761798716649385, "loss": 4.8117, "mean_token_accuracy": 0.2336484372615814, "num_tokens": 89541516.0, "step": 39090 }, { "entropy": 5.378813934326172, "epoch": 3.8646698299723212, "grad_norm": 0.99609375, "learning_rate": 0.0003575851613306238, "loss": 4.918, "mean_token_accuracy": 0.2246623620390892, "num_tokens": 89553544.0, "step": 39095 }, { "entropy": 5.35691614151001, "epoch": 3.8651640964808225, "grad_norm": 1.0078125, "learning_rate": 0.00035755233346314595, "loss": 4.8607, "mean_token_accuracy": 0.23641018718481063, "num_tokens": 89564472.0, "step": 39100 }, { "entropy": 5.37445855140686, "epoch": 3.8656583629893237, "grad_norm": 1.1953125, "learning_rate": 0.00035751950356486796, "loss": 4.9046, "mean_token_accuracy": 0.22790425568819045, "num_tokens": 89575708.0, "step": 39105 }, { "entropy": 5.361227798461914, "epoch": 3.866152629497825, "grad_norm": 1.046875, "learning_rate": 0.00035748667163659737, "loss": 4.818, "mean_token_accuracy": 0.23434745967388154, "num_tokens": 89585643.0, "step": 39110 }, { "entropy": 5.239386653900146, "epoch": 3.8666468960063267, "grad_norm": 1.078125, "learning_rate": 0.0003574538376791418, "loss": 4.8016, "mean_token_accuracy": 0.2366333231329918, "num_tokens": 89597069.0, "step": 39115 }, { "entropy": 5.439111328125, "epoch": 3.867141162514828, "grad_norm": 1.0546875, "learning_rate": 0.00035742100169330903, "loss": 5.0163, "mean_token_accuracy": 0.21446311324834824, "num_tokens": 89608469.0, "step": 39120 }, { "entropy": 5.411836767196656, "epoch": 3.8676354290233292, "grad_norm": 1.09375, "learning_rate": 0.0003573881636799068, "loss": 4.9303, "mean_token_accuracy": 0.21992632895708084, "num_tokens": 89620132.0, "step": 39125 }, { "entropy": 5.289271688461303, "epoch": 3.868129695531831, "grad_norm": 1.046875, "learning_rate": 0.00035735532363974305, "loss": 4.8414, "mean_token_accuracy": 0.2316564917564392, "num_tokens": 89631565.0, "step": 39130 }, { "entropy": 5.333270740509033, "epoch": 3.868623962040332, "grad_norm": 1.0625, "learning_rate": 0.0003573224815736256, "loss": 4.7928, "mean_token_accuracy": 0.2299969509243965, "num_tokens": 89641530.0, "step": 39135 }, { "entropy": 5.390349006652832, "epoch": 3.8691182285488335, "grad_norm": 1.09375, "learning_rate": 0.0003572896374823622, "loss": 4.9168, "mean_token_accuracy": 0.22412951588630675, "num_tokens": 89653588.0, "step": 39140 }, { "entropy": 5.454044771194458, "epoch": 3.8696124950573347, "grad_norm": 1.0, "learning_rate": 0.00035725679136676104, "loss": 4.9828, "mean_token_accuracy": 0.22378212362527847, "num_tokens": 89665506.0, "step": 39145 }, { "entropy": 5.356758499145508, "epoch": 3.8701067615658364, "grad_norm": 1.0234375, "learning_rate": 0.00035722394322763, "loss": 4.8412, "mean_token_accuracy": 0.231740540266037, "num_tokens": 89678133.0, "step": 39150 }, { "entropy": 5.356416940689087, "epoch": 3.8706010280743377, "grad_norm": 1.0234375, "learning_rate": 0.0003571910930657773, "loss": 4.809, "mean_token_accuracy": 0.24089254438877106, "num_tokens": 89690102.0, "step": 39155 }, { "entropy": 5.277207899093628, "epoch": 3.871095294582839, "grad_norm": 0.96875, "learning_rate": 0.0003571582408820109, "loss": 4.767, "mean_token_accuracy": 0.23779998868703842, "num_tokens": 89701434.0, "step": 39160 }, { "entropy": 5.378966188430786, "epoch": 3.8715895610913407, "grad_norm": 1.1875, "learning_rate": 0.00035712538667713895, "loss": 4.9569, "mean_token_accuracy": 0.22295167297124863, "num_tokens": 89711812.0, "step": 39165 }, { "entropy": 5.380758285522461, "epoch": 3.872083827599842, "grad_norm": 1.0859375, "learning_rate": 0.00035709253045196977, "loss": 4.8788, "mean_token_accuracy": 0.23119960576295853, "num_tokens": 89723077.0, "step": 39170 }, { "entropy": 5.332770586013794, "epoch": 3.872578094108343, "grad_norm": 1.1015625, "learning_rate": 0.0003570596722073117, "loss": 4.8484, "mean_token_accuracy": 0.22773722559213638, "num_tokens": 89733964.0, "step": 39175 }, { "entropy": 5.356016206741333, "epoch": 3.8730723606168445, "grad_norm": 1.0078125, "learning_rate": 0.000357026811943973, "loss": 4.8791, "mean_token_accuracy": 0.2295287922024727, "num_tokens": 89745086.0, "step": 39180 }, { "entropy": 5.401879787445068, "epoch": 3.8735666271253457, "grad_norm": 1.03125, "learning_rate": 0.00035699394966276184, "loss": 4.8796, "mean_token_accuracy": 0.22327834665775298, "num_tokens": 89756075.0, "step": 39185 }, { "entropy": 5.331236457824707, "epoch": 3.8740608936338474, "grad_norm": 1.0234375, "learning_rate": 0.00035696108536448684, "loss": 4.7887, "mean_token_accuracy": 0.2359560340642929, "num_tokens": 89766271.0, "step": 39190 }, { "entropy": 5.383989858627319, "epoch": 3.8745551601423487, "grad_norm": 0.984375, "learning_rate": 0.00035692821904995646, "loss": 4.9276, "mean_token_accuracy": 0.2281288668513298, "num_tokens": 89778408.0, "step": 39195 }, { "entropy": 5.364943885803223, "epoch": 3.8750494266508504, "grad_norm": 1.1328125, "learning_rate": 0.00035689535071997913, "loss": 4.8766, "mean_token_accuracy": 0.2305650606751442, "num_tokens": 89789670.0, "step": 39200 }, { "entropy": 5.319234228134155, "epoch": 3.8755436931593517, "grad_norm": 1.0078125, "learning_rate": 0.00035686248037536356, "loss": 4.8835, "mean_token_accuracy": 0.23137340247631072, "num_tokens": 89802269.0, "step": 39205 }, { "entropy": 5.360890436172485, "epoch": 3.876037959667853, "grad_norm": 1.015625, "learning_rate": 0.0003568296080169182, "loss": 4.8441, "mean_token_accuracy": 0.22855329662561416, "num_tokens": 89814168.0, "step": 39210 }, { "entropy": 5.378626108169556, "epoch": 3.876532226176354, "grad_norm": 1.03125, "learning_rate": 0.0003567967336454518, "loss": 4.8879, "mean_token_accuracy": 0.22415258586406708, "num_tokens": 89826494.0, "step": 39215 }, { "entropy": 5.331607389450073, "epoch": 3.8770264926848554, "grad_norm": 1.0078125, "learning_rate": 0.0003567638572617731, "loss": 4.8158, "mean_token_accuracy": 0.23229811042547227, "num_tokens": 89838266.0, "step": 39220 }, { "entropy": 5.312772417068482, "epoch": 3.877520759193357, "grad_norm": 1.1328125, "learning_rate": 0.00035673097886669086, "loss": 4.8258, "mean_token_accuracy": 0.23467059880495073, "num_tokens": 89848941.0, "step": 39225 }, { "entropy": 5.304987049102783, "epoch": 3.8780150257018584, "grad_norm": 1.015625, "learning_rate": 0.00035669809846101383, "loss": 4.8299, "mean_token_accuracy": 0.22886772453784943, "num_tokens": 89859878.0, "step": 39230 }, { "entropy": 5.322571229934693, "epoch": 3.8785092922103597, "grad_norm": 1.03125, "learning_rate": 0.0003566652160455508, "loss": 4.8745, "mean_token_accuracy": 0.23295118659734726, "num_tokens": 89872044.0, "step": 39235 }, { "entropy": 5.359917259216308, "epoch": 3.8790035587188614, "grad_norm": 1.0234375, "learning_rate": 0.0003566323316211109, "loss": 4.8733, "mean_token_accuracy": 0.22910814732313156, "num_tokens": 89883950.0, "step": 39240 }, { "entropy": 5.384847688674927, "epoch": 3.8794978252273626, "grad_norm": 1.0078125, "learning_rate": 0.0003565994451885029, "loss": 4.9346, "mean_token_accuracy": 0.22533925026655197, "num_tokens": 89895944.0, "step": 39245 }, { "entropy": 5.408069038391114, "epoch": 3.879992091735864, "grad_norm": 0.98046875, "learning_rate": 0.00035656655674853595, "loss": 4.8998, "mean_token_accuracy": 0.229347562789917, "num_tokens": 89907413.0, "step": 39250 }, { "entropy": 5.318785381317139, "epoch": 3.880486358244365, "grad_norm": 1.0234375, "learning_rate": 0.00035653366630201906, "loss": 4.7921, "mean_token_accuracy": 0.23438847213983535, "num_tokens": 89918910.0, "step": 39255 }, { "entropy": 5.416632509231567, "epoch": 3.880980624752867, "grad_norm": 0.99609375, "learning_rate": 0.0003565007738497612, "loss": 4.9968, "mean_token_accuracy": 0.2208801969885826, "num_tokens": 89931928.0, "step": 39260 }, { "entropy": 5.330264234542847, "epoch": 3.881474891261368, "grad_norm": 1.1875, "learning_rate": 0.0003564678793925718, "loss": 4.8621, "mean_token_accuracy": 0.22916968315839767, "num_tokens": 89942963.0, "step": 39265 }, { "entropy": 5.259358692169189, "epoch": 3.8819691577698694, "grad_norm": 1.09375, "learning_rate": 0.00035643498293125997, "loss": 4.7987, "mean_token_accuracy": 0.23398587852716446, "num_tokens": 89953706.0, "step": 39270 }, { "entropy": 5.2807213306427006, "epoch": 3.882463424278371, "grad_norm": 0.96484375, "learning_rate": 0.0003564020844666348, "loss": 4.862, "mean_token_accuracy": 0.22836955785751342, "num_tokens": 89964243.0, "step": 39275 }, { "entropy": 5.45682373046875, "epoch": 3.8829576907868724, "grad_norm": 1.1328125, "learning_rate": 0.0003563691839995058, "loss": 4.8936, "mean_token_accuracy": 0.22101730704307557, "num_tokens": 89974708.0, "step": 39280 }, { "entropy": 5.336704254150391, "epoch": 3.8834519572953736, "grad_norm": 1.078125, "learning_rate": 0.00035633628153068213, "loss": 4.8094, "mean_token_accuracy": 0.2395901396870613, "num_tokens": 89984950.0, "step": 39285 }, { "entropy": 5.310738229751587, "epoch": 3.883946223803875, "grad_norm": 1.09375, "learning_rate": 0.0003563033770609734, "loss": 4.7825, "mean_token_accuracy": 0.23064330369234085, "num_tokens": 89995605.0, "step": 39290 }, { "entropy": 5.27730393409729, "epoch": 3.8844404903123766, "grad_norm": 0.9609375, "learning_rate": 0.00035627047059118907, "loss": 4.8058, "mean_token_accuracy": 0.2366136595606804, "num_tokens": 90007209.0, "step": 39295 }, { "entropy": 5.307649326324463, "epoch": 3.884934756820878, "grad_norm": 0.95703125, "learning_rate": 0.00035623756212213847, "loss": 4.8183, "mean_token_accuracy": 0.23489940017461777, "num_tokens": 90019042.0, "step": 39300 }, { "entropy": 5.348787641525268, "epoch": 3.885429023329379, "grad_norm": 1.046875, "learning_rate": 0.00035620465165463124, "loss": 4.8544, "mean_token_accuracy": 0.23263980001211165, "num_tokens": 90030466.0, "step": 39305 }, { "entropy": 5.346904659271241, "epoch": 3.885923289837881, "grad_norm": 0.9765625, "learning_rate": 0.00035617173918947695, "loss": 4.7836, "mean_token_accuracy": 0.2299058496952057, "num_tokens": 90041308.0, "step": 39310 }, { "entropy": 5.3229724884033205, "epoch": 3.886417556346382, "grad_norm": 1.0, "learning_rate": 0.0003561388247274853, "loss": 4.9175, "mean_token_accuracy": 0.2231524258852005, "num_tokens": 90052655.0, "step": 39315 }, { "entropy": 5.365181922912598, "epoch": 3.8869118228548833, "grad_norm": 1.0390625, "learning_rate": 0.000356105908269466, "loss": 4.9223, "mean_token_accuracy": 0.2183106243610382, "num_tokens": 90063643.0, "step": 39320 }, { "entropy": 5.273942327499389, "epoch": 3.8874060893633846, "grad_norm": 1.1171875, "learning_rate": 0.00035607298981622885, "loss": 4.7951, "mean_token_accuracy": 0.23751793950796127, "num_tokens": 90076293.0, "step": 39325 }, { "entropy": 5.418290424346924, "epoch": 3.887900355871886, "grad_norm": 1.1015625, "learning_rate": 0.00035604006936858343, "loss": 4.9153, "mean_token_accuracy": 0.22492800801992416, "num_tokens": 90086423.0, "step": 39330 }, { "entropy": 5.3789002895355225, "epoch": 3.8883946223803876, "grad_norm": 1.0078125, "learning_rate": 0.00035600714692733974, "loss": 4.7873, "mean_token_accuracy": 0.23855358809232713, "num_tokens": 90097330.0, "step": 39335 }, { "entropy": 5.423736476898194, "epoch": 3.888888888888889, "grad_norm": 0.97265625, "learning_rate": 0.0003559742224933078, "loss": 4.949, "mean_token_accuracy": 0.22713375091552734, "num_tokens": 90109532.0, "step": 39340 }, { "entropy": 5.4447917461395265, "epoch": 3.8893831553973905, "grad_norm": 0.9453125, "learning_rate": 0.0003559412960672972, "loss": 4.9798, "mean_token_accuracy": 0.21455249488353728, "num_tokens": 90121655.0, "step": 39345 }, { "entropy": 5.321659135818481, "epoch": 3.889877421905892, "grad_norm": 1.015625, "learning_rate": 0.0003559083676501184, "loss": 4.8417, "mean_token_accuracy": 0.23354811668395997, "num_tokens": 90133515.0, "step": 39350 }, { "entropy": 5.415385007858276, "epoch": 3.890371688414393, "grad_norm": 0.9609375, "learning_rate": 0.0003558754372425811, "loss": 4.887, "mean_token_accuracy": 0.22056093364953994, "num_tokens": 90146364.0, "step": 39355 }, { "entropy": 5.370696640014648, "epoch": 3.8908659549228943, "grad_norm": 1.09375, "learning_rate": 0.00035584250484549547, "loss": 4.8645, "mean_token_accuracy": 0.22878375202417373, "num_tokens": 90158568.0, "step": 39360 }, { "entropy": 5.328295564651489, "epoch": 3.8913602214313956, "grad_norm": 0.98046875, "learning_rate": 0.0003558095704596717, "loss": 4.8383, "mean_token_accuracy": 0.23453895896673202, "num_tokens": 90169252.0, "step": 39365 }, { "entropy": 5.430701112747192, "epoch": 3.8918544879398973, "grad_norm": 1.046875, "learning_rate": 0.00035577663408592003, "loss": 4.9535, "mean_token_accuracy": 0.2291266590356827, "num_tokens": 90180398.0, "step": 39370 }, { "entropy": 5.312560749053955, "epoch": 3.8923487544483986, "grad_norm": 0.96875, "learning_rate": 0.00035574369572505054, "loss": 4.7958, "mean_token_accuracy": 0.23274372965097428, "num_tokens": 90191991.0, "step": 39375 }, { "entropy": 5.37863335609436, "epoch": 3.8928430209569, "grad_norm": 1.0078125, "learning_rate": 0.0003557107553778736, "loss": 4.869, "mean_token_accuracy": 0.22820313423871993, "num_tokens": 90203812.0, "step": 39380 }, { "entropy": 5.373959398269653, "epoch": 3.8933372874654015, "grad_norm": 1.0625, "learning_rate": 0.0003556778130451997, "loss": 4.8703, "mean_token_accuracy": 0.22420135140419006, "num_tokens": 90214793.0, "step": 39385 }, { "entropy": 5.3183821678161625, "epoch": 3.893831553973903, "grad_norm": 1.046875, "learning_rate": 0.0003556448687278389, "loss": 4.7939, "mean_token_accuracy": 0.2283734545111656, "num_tokens": 90225145.0, "step": 39390 }, { "entropy": 5.249739646911621, "epoch": 3.894325820482404, "grad_norm": 1.046875, "learning_rate": 0.00035561192242660193, "loss": 4.8609, "mean_token_accuracy": 0.22966769933700562, "num_tokens": 90236394.0, "step": 39395 }, { "entropy": 5.3748561382293705, "epoch": 3.8948200869909053, "grad_norm": 1.078125, "learning_rate": 0.0003555789741422991, "loss": 4.8422, "mean_token_accuracy": 0.22848148494958878, "num_tokens": 90246649.0, "step": 39400 }, { "entropy": 5.408113670349121, "epoch": 3.895314353499407, "grad_norm": 1.0546875, "learning_rate": 0.00035554602387574105, "loss": 4.8841, "mean_token_accuracy": 0.2265431672334671, "num_tokens": 90258047.0, "step": 39405 }, { "entropy": 5.41491961479187, "epoch": 3.8958086200079083, "grad_norm": 0.98828125, "learning_rate": 0.0003555130716277383, "loss": 4.9942, "mean_token_accuracy": 0.2181795582175255, "num_tokens": 90269848.0, "step": 39410 }, { "entropy": 5.4061469554901125, "epoch": 3.8963028865164095, "grad_norm": 0.98046875, "learning_rate": 0.0003554801173991016, "loss": 4.9192, "mean_token_accuracy": 0.22141509354114533, "num_tokens": 90281614.0, "step": 39415 }, { "entropy": 5.365747404098511, "epoch": 3.8967971530249113, "grad_norm": 1.0546875, "learning_rate": 0.0003554471611906414, "loss": 4.855, "mean_token_accuracy": 0.22786431163549423, "num_tokens": 90292857.0, "step": 39420 }, { "entropy": 5.331999635696411, "epoch": 3.8972914195334125, "grad_norm": 1.0625, "learning_rate": 0.0003554142030031685, "loss": 4.9044, "mean_token_accuracy": 0.21864114850759506, "num_tokens": 90304558.0, "step": 39425 }, { "entropy": 5.3564375877380375, "epoch": 3.8977856860419138, "grad_norm": 1.0078125, "learning_rate": 0.00035538124283749387, "loss": 4.8494, "mean_token_accuracy": 0.2265275612473488, "num_tokens": 90315914.0, "step": 39430 }, { "entropy": 5.334528160095215, "epoch": 3.898279952550415, "grad_norm": 0.99609375, "learning_rate": 0.0003553482806944281, "loss": 4.7891, "mean_token_accuracy": 0.23071038573980332, "num_tokens": 90327165.0, "step": 39435 }, { "entropy": 5.255070924758911, "epoch": 3.8987742190589163, "grad_norm": 0.9296875, "learning_rate": 0.0003553153165747822, "loss": 4.7717, "mean_token_accuracy": 0.23879783004522323, "num_tokens": 90338755.0, "step": 39440 }, { "entropy": 5.300873708724976, "epoch": 3.899268485567418, "grad_norm": 1.0625, "learning_rate": 0.000355282350479367, "loss": 4.8657, "mean_token_accuracy": 0.22746930718421937, "num_tokens": 90349694.0, "step": 39445 }, { "entropy": 5.400910329818726, "epoch": 3.8997627520759193, "grad_norm": 1.03125, "learning_rate": 0.0003552493824089936, "loss": 4.813, "mean_token_accuracy": 0.2325472801923752, "num_tokens": 90359604.0, "step": 39450 }, { "entropy": 5.2465887546539305, "epoch": 3.900257018584421, "grad_norm": 1.0703125, "learning_rate": 0.00035521641236447297, "loss": 4.7087, "mean_token_accuracy": 0.2425785705447197, "num_tokens": 90370607.0, "step": 39455 }, { "entropy": 5.271363925933838, "epoch": 3.9007512850929222, "grad_norm": 1.1171875, "learning_rate": 0.00035518344034661607, "loss": 4.7727, "mean_token_accuracy": 0.2376730412244797, "num_tokens": 90381429.0, "step": 39460 }, { "entropy": 5.31145453453064, "epoch": 3.9012455516014235, "grad_norm": 1.0625, "learning_rate": 0.00035515046635623416, "loss": 4.8238, "mean_token_accuracy": 0.23413081020116805, "num_tokens": 90393550.0, "step": 39465 }, { "entropy": 5.278102779388428, "epoch": 3.9017398181099248, "grad_norm": 1.0859375, "learning_rate": 0.0003551174903941383, "loss": 4.8916, "mean_token_accuracy": 0.22700220942497254, "num_tokens": 90404380.0, "step": 39470 }, { "entropy": 5.404043960571289, "epoch": 3.902234084618426, "grad_norm": 1.0703125, "learning_rate": 0.0003550845124611397, "loss": 4.8474, "mean_token_accuracy": 0.22617976665496825, "num_tokens": 90414374.0, "step": 39475 }, { "entropy": 5.336901044845581, "epoch": 3.9027283511269277, "grad_norm": 0.96875, "learning_rate": 0.0003550515325580498, "loss": 4.8223, "mean_token_accuracy": 0.23613815605640412, "num_tokens": 90426682.0, "step": 39480 }, { "entropy": 5.263393497467041, "epoch": 3.903222617635429, "grad_norm": 1.0703125, "learning_rate": 0.0003550185506856797, "loss": 4.7796, "mean_token_accuracy": 0.23286054879426957, "num_tokens": 90437992.0, "step": 39485 }, { "entropy": 5.351845121383667, "epoch": 3.9037168841439303, "grad_norm": 1.0, "learning_rate": 0.00035498556684484086, "loss": 4.9506, "mean_token_accuracy": 0.22411617934703826, "num_tokens": 90450589.0, "step": 39490 }, { "entropy": 5.278913593292236, "epoch": 3.904211150652432, "grad_norm": 0.9765625, "learning_rate": 0.0003549525810363446, "loss": 4.802, "mean_token_accuracy": 0.23478586971759796, "num_tokens": 90461723.0, "step": 39495 }, { "entropy": 5.348165702819824, "epoch": 3.9047054171609332, "grad_norm": 1.1328125, "learning_rate": 0.00035491959326100253, "loss": 4.8489, "mean_token_accuracy": 0.23687492311000824, "num_tokens": 90472972.0, "step": 39500 }, { "entropy": 5.380801486968994, "epoch": 3.9051996836694345, "grad_norm": 1.03125, "learning_rate": 0.000354886603519626, "loss": 4.9212, "mean_token_accuracy": 0.21749961376190186, "num_tokens": 90483995.0, "step": 39505 }, { "entropy": 5.321781253814697, "epoch": 3.9056939501779357, "grad_norm": 1.03125, "learning_rate": 0.0003548536118130267, "loss": 4.7745, "mean_token_accuracy": 0.23878519237041473, "num_tokens": 90495999.0, "step": 39510 }, { "entropy": 5.364587354660034, "epoch": 3.9061882166864375, "grad_norm": 1.015625, "learning_rate": 0.00035482061814201614, "loss": 4.9213, "mean_token_accuracy": 0.22446125596761704, "num_tokens": 90507906.0, "step": 39515 }, { "entropy": 5.319458103179931, "epoch": 3.9066824831949387, "grad_norm": 1.046875, "learning_rate": 0.00035478762250740594, "loss": 4.8453, "mean_token_accuracy": 0.23578628152608871, "num_tokens": 90517938.0, "step": 39520 }, { "entropy": 5.355031871795655, "epoch": 3.90717674970344, "grad_norm": 1.1015625, "learning_rate": 0.0003547546249100079, "loss": 4.8737, "mean_token_accuracy": 0.22720691859722136, "num_tokens": 90528163.0, "step": 39525 }, { "entropy": 5.353658533096313, "epoch": 3.9076710162119417, "grad_norm": 0.984375, "learning_rate": 0.00035472162535063375, "loss": 4.8537, "mean_token_accuracy": 0.22999523878097533, "num_tokens": 90539846.0, "step": 39530 }, { "entropy": 5.308818674087524, "epoch": 3.908165282720443, "grad_norm": 1.0703125, "learning_rate": 0.00035468862383009514, "loss": 4.7656, "mean_token_accuracy": 0.24055245518684387, "num_tokens": 90550290.0, "step": 39535 }, { "entropy": 5.3617230415344235, "epoch": 3.908659549228944, "grad_norm": 1.1015625, "learning_rate": 0.00035465562034920413, "loss": 4.8332, "mean_token_accuracy": 0.23451945036649705, "num_tokens": 90561052.0, "step": 39540 }, { "entropy": 5.348221302032471, "epoch": 3.9091538157374455, "grad_norm": 1.078125, "learning_rate": 0.0003546226149087724, "loss": 4.9068, "mean_token_accuracy": 0.2278766319155693, "num_tokens": 90572007.0, "step": 39545 }, { "entropy": 5.363459205627441, "epoch": 3.909648082245947, "grad_norm": 1.03125, "learning_rate": 0.00035458960750961205, "loss": 4.8955, "mean_token_accuracy": 0.22434477061033248, "num_tokens": 90583538.0, "step": 39550 }, { "entropy": 5.386643314361573, "epoch": 3.9101423487544484, "grad_norm": 0.97265625, "learning_rate": 0.000354556598152535, "loss": 4.8507, "mean_token_accuracy": 0.2377389818429947, "num_tokens": 90595464.0, "step": 39555 }, { "entropy": 5.379800033569336, "epoch": 3.9106366152629497, "grad_norm": 1.0625, "learning_rate": 0.0003545235868383533, "loss": 4.9402, "mean_token_accuracy": 0.22513910979032517, "num_tokens": 90607593.0, "step": 39560 }, { "entropy": 5.450019311904907, "epoch": 3.9111308817714514, "grad_norm": 1.078125, "learning_rate": 0.000354490573567879, "loss": 4.9509, "mean_token_accuracy": 0.21934615224599838, "num_tokens": 90618779.0, "step": 39565 }, { "entropy": 5.362884616851806, "epoch": 3.9116251482799527, "grad_norm": 0.90625, "learning_rate": 0.00035445755834192426, "loss": 4.8698, "mean_token_accuracy": 0.2281707540154457, "num_tokens": 90630355.0, "step": 39570 }, { "entropy": 5.402760171890259, "epoch": 3.912119414788454, "grad_norm": 1.0, "learning_rate": 0.0003544245411613013, "loss": 4.9128, "mean_token_accuracy": 0.22247470170259476, "num_tokens": 90642042.0, "step": 39575 }, { "entropy": 5.361256313323975, "epoch": 3.912613681296955, "grad_norm": 1.0625, "learning_rate": 0.0003543915220268223, "loss": 4.8419, "mean_token_accuracy": 0.22105530351400376, "num_tokens": 90653659.0, "step": 39580 }, { "entropy": 5.327917623519897, "epoch": 3.9131079478054565, "grad_norm": 0.9765625, "learning_rate": 0.0003543585009392996, "loss": 4.7845, "mean_token_accuracy": 0.23739096969366075, "num_tokens": 90664525.0, "step": 39585 }, { "entropy": 5.311344480514526, "epoch": 3.913602214313958, "grad_norm": 1.0234375, "learning_rate": 0.0003543254778995453, "loss": 4.8808, "mean_token_accuracy": 0.2206052213907242, "num_tokens": 90676231.0, "step": 39590 }, { "entropy": 5.426728582382202, "epoch": 3.9140964808224594, "grad_norm": 1.0625, "learning_rate": 0.00035429245290837197, "loss": 4.9306, "mean_token_accuracy": 0.21395007967948915, "num_tokens": 90686996.0, "step": 39595 }, { "entropy": 5.412732744216919, "epoch": 3.914590747330961, "grad_norm": 0.89453125, "learning_rate": 0.00035425942596659213, "loss": 4.8937, "mean_token_accuracy": 0.2231263756752014, "num_tokens": 90699329.0, "step": 39600 }, { "entropy": 5.315811491012573, "epoch": 3.9150850138394624, "grad_norm": 0.99609375, "learning_rate": 0.000354226397075018, "loss": 4.8578, "mean_token_accuracy": 0.22888243496417998, "num_tokens": 90710835.0, "step": 39605 }, { "entropy": 5.261366605758667, "epoch": 3.9155792803479637, "grad_norm": 0.9921875, "learning_rate": 0.0003541933662344623, "loss": 4.7466, "mean_token_accuracy": 0.24059724658727646, "num_tokens": 90722793.0, "step": 39610 }, { "entropy": 5.355832147598266, "epoch": 3.916073546856465, "grad_norm": 1.015625, "learning_rate": 0.00035416033344573745, "loss": 4.8875, "mean_token_accuracy": 0.21960004419088364, "num_tokens": 90733380.0, "step": 39615 }, { "entropy": 5.353565454483032, "epoch": 3.916567813364966, "grad_norm": 1.09375, "learning_rate": 0.00035412729870965606, "loss": 4.9339, "mean_token_accuracy": 0.2197966232895851, "num_tokens": 90744801.0, "step": 39620 }, { "entropy": 5.39687032699585, "epoch": 3.917062079873468, "grad_norm": 1.0546875, "learning_rate": 0.00035409426202703093, "loss": 4.8525, "mean_token_accuracy": 0.2348606288433075, "num_tokens": 90755826.0, "step": 39625 }, { "entropy": 5.403790140151978, "epoch": 3.917556346381969, "grad_norm": 0.9921875, "learning_rate": 0.0003540612233986747, "loss": 4.8554, "mean_token_accuracy": 0.23155285269021988, "num_tokens": 90766943.0, "step": 39630 }, { "entropy": 5.44960036277771, "epoch": 3.9180506128904704, "grad_norm": 0.9609375, "learning_rate": 0.00035402818282540005, "loss": 5.0721, "mean_token_accuracy": 0.21881239116191864, "num_tokens": 90780413.0, "step": 39635 }, { "entropy": 5.388444423675537, "epoch": 3.918544879398972, "grad_norm": 0.95703125, "learning_rate": 0.00035399514030801983, "loss": 4.8742, "mean_token_accuracy": 0.23022750914096832, "num_tokens": 90792923.0, "step": 39640 }, { "entropy": 5.310229921340943, "epoch": 3.9190391459074734, "grad_norm": 0.99609375, "learning_rate": 0.00035396209584734697, "loss": 4.7937, "mean_token_accuracy": 0.23048390597105026, "num_tokens": 90803457.0, "step": 39645 }, { "entropy": 5.33443922996521, "epoch": 3.9195334124159746, "grad_norm": 1.0546875, "learning_rate": 0.00035392904944419424, "loss": 4.8157, "mean_token_accuracy": 0.23134013265371323, "num_tokens": 90815499.0, "step": 39650 }, { "entropy": 5.3410474300384525, "epoch": 3.920027678924476, "grad_norm": 0.9921875, "learning_rate": 0.0003538960010993747, "loss": 4.841, "mean_token_accuracy": 0.2250755548477173, "num_tokens": 90827263.0, "step": 39655 }, { "entropy": 5.362495613098145, "epoch": 3.9205219454329776, "grad_norm": 1.0390625, "learning_rate": 0.00035386295081370125, "loss": 4.8345, "mean_token_accuracy": 0.2421850711107254, "num_tokens": 90837804.0, "step": 39660 }, { "entropy": 5.3117334842681885, "epoch": 3.921016211941479, "grad_norm": 1.03125, "learning_rate": 0.00035382989858798695, "loss": 4.8714, "mean_token_accuracy": 0.23504357486963273, "num_tokens": 90849331.0, "step": 39665 }, { "entropy": 5.318756055831909, "epoch": 3.92151047844998, "grad_norm": 1.03125, "learning_rate": 0.00035379684442304497, "loss": 4.893, "mean_token_accuracy": 0.22391015738248826, "num_tokens": 90861164.0, "step": 39670 }, { "entropy": 5.425446033477783, "epoch": 3.922004744958482, "grad_norm": 1.0625, "learning_rate": 0.00035376378831968844, "loss": 4.9904, "mean_token_accuracy": 0.21135921627283097, "num_tokens": 90872453.0, "step": 39675 }, { "entropy": 5.270627641677857, "epoch": 3.922499011466983, "grad_norm": 1.0625, "learning_rate": 0.0003537307302787304, "loss": 4.7943, "mean_token_accuracy": 0.23908957988023757, "num_tokens": 90882111.0, "step": 39680 }, { "entropy": 5.348468923568726, "epoch": 3.9229932779754844, "grad_norm": 1.09375, "learning_rate": 0.00035369767030098424, "loss": 4.8693, "mean_token_accuracy": 0.23385863602161408, "num_tokens": 90894501.0, "step": 39685 }, { "entropy": 5.332434892654419, "epoch": 3.9234875444839856, "grad_norm": 1.03125, "learning_rate": 0.00035366460838726316, "loss": 4.7496, "mean_token_accuracy": 0.23691753745079042, "num_tokens": 90905629.0, "step": 39690 }, { "entropy": 5.340956401824951, "epoch": 3.923981810992487, "grad_norm": 0.96484375, "learning_rate": 0.0003536315445383805, "loss": 4.8635, "mean_token_accuracy": 0.22966877073049546, "num_tokens": 90916710.0, "step": 39695 }, { "entropy": 5.300541019439697, "epoch": 3.9244760775009886, "grad_norm": 1.0703125, "learning_rate": 0.0003535984787551497, "loss": 4.84, "mean_token_accuracy": 0.2289536789059639, "num_tokens": 90927463.0, "step": 39700 }, { "entropy": 5.364529323577881, "epoch": 3.92497034400949, "grad_norm": 1.046875, "learning_rate": 0.0003535654110383841, "loss": 4.8338, "mean_token_accuracy": 0.22381253391504288, "num_tokens": 90938387.0, "step": 39705 }, { "entropy": 5.337878608703614, "epoch": 3.9254646105179916, "grad_norm": 1.0546875, "learning_rate": 0.0003535323413888972, "loss": 4.8363, "mean_token_accuracy": 0.23587435185909272, "num_tokens": 90950326.0, "step": 39710 }, { "entropy": 5.337531280517578, "epoch": 3.925958877026493, "grad_norm": 1.03125, "learning_rate": 0.0003534992698075025, "loss": 4.8892, "mean_token_accuracy": 0.22943746894598008, "num_tokens": 90962598.0, "step": 39715 }, { "entropy": 5.336196660995483, "epoch": 3.926453143534994, "grad_norm": 0.97265625, "learning_rate": 0.0003534661962950136, "loss": 4.9034, "mean_token_accuracy": 0.22487962543964385, "num_tokens": 90975048.0, "step": 39720 }, { "entropy": 5.384274482727051, "epoch": 3.9269474100434953, "grad_norm": 1.0625, "learning_rate": 0.00035343312085224407, "loss": 4.8761, "mean_token_accuracy": 0.23362447321414948, "num_tokens": 90985768.0, "step": 39725 }, { "entropy": 5.396181631088257, "epoch": 3.9274416765519966, "grad_norm": 1.0625, "learning_rate": 0.00035340004348000765, "loss": 4.9107, "mean_token_accuracy": 0.2214501142501831, "num_tokens": 90998448.0, "step": 39730 }, { "entropy": 5.364041042327881, "epoch": 3.9279359430604983, "grad_norm": 1.0703125, "learning_rate": 0.000353366964179118, "loss": 4.9145, "mean_token_accuracy": 0.22340380549430847, "num_tokens": 91010463.0, "step": 39735 }, { "entropy": 5.402339220046997, "epoch": 3.9284302095689996, "grad_norm": 0.96484375, "learning_rate": 0.0003533338829503888, "loss": 4.7974, "mean_token_accuracy": 0.22778771221637725, "num_tokens": 91022188.0, "step": 39740 }, { "entropy": 5.363168716430664, "epoch": 3.928924476077501, "grad_norm": 1.015625, "learning_rate": 0.00035330079979463397, "loss": 4.8831, "mean_token_accuracy": 0.2312870129942894, "num_tokens": 91033272.0, "step": 39745 }, { "entropy": 5.307899761199951, "epoch": 3.9294187425860025, "grad_norm": 1.109375, "learning_rate": 0.00035326771471266735, "loss": 4.8717, "mean_token_accuracy": 0.22611719369888306, "num_tokens": 91044014.0, "step": 39750 }, { "entropy": 5.3168598175048825, "epoch": 3.929913009094504, "grad_norm": 1.09375, "learning_rate": 0.0003532346277053028, "loss": 4.8555, "mean_token_accuracy": 0.23023408502340317, "num_tokens": 91055601.0, "step": 39755 }, { "entropy": 5.329298686981201, "epoch": 3.930407275603005, "grad_norm": 0.953125, "learning_rate": 0.00035320153877335415, "loss": 4.8269, "mean_token_accuracy": 0.2327350527048111, "num_tokens": 91066384.0, "step": 39760 }, { "entropy": 5.311450386047364, "epoch": 3.9309015421115063, "grad_norm": 1.1796875, "learning_rate": 0.0003531684479176356, "loss": 4.7952, "mean_token_accuracy": 0.23276244550943376, "num_tokens": 91076675.0, "step": 39765 }, { "entropy": 5.321725606918335, "epoch": 3.931395808620008, "grad_norm": 0.984375, "learning_rate": 0.0003531353551389611, "loss": 4.862, "mean_token_accuracy": 0.23000586032867432, "num_tokens": 91088900.0, "step": 39770 }, { "entropy": 5.388885021209717, "epoch": 3.9318900751285093, "grad_norm": 1.015625, "learning_rate": 0.0003531022604381448, "loss": 4.7729, "mean_token_accuracy": 0.23801409304142, "num_tokens": 91100483.0, "step": 39775 }, { "entropy": 5.396412897109985, "epoch": 3.9323843416370106, "grad_norm": 1.03125, "learning_rate": 0.0003530691638160007, "loss": 4.9918, "mean_token_accuracy": 0.21769022047519684, "num_tokens": 91112310.0, "step": 39780 }, { "entropy": 5.376067066192627, "epoch": 3.9328786081455123, "grad_norm": 1.0625, "learning_rate": 0.00035303606527334314, "loss": 4.8826, "mean_token_accuracy": 0.22632896900177002, "num_tokens": 91124086.0, "step": 39785 }, { "entropy": 5.262717962265015, "epoch": 3.9333728746540135, "grad_norm": 0.98828125, "learning_rate": 0.0003530029648109862, "loss": 4.8031, "mean_token_accuracy": 0.23254094272851944, "num_tokens": 91135044.0, "step": 39790 }, { "entropy": 5.386564064025879, "epoch": 3.933867141162515, "grad_norm": 1.0703125, "learning_rate": 0.0003529698624297442, "loss": 4.8855, "mean_token_accuracy": 0.2300127252936363, "num_tokens": 91145606.0, "step": 39795 }, { "entropy": 5.37140645980835, "epoch": 3.934361407671016, "grad_norm": 1.0546875, "learning_rate": 0.0003529367581304316, "loss": 4.8393, "mean_token_accuracy": 0.2334474578499794, "num_tokens": 91155709.0, "step": 39800 }, { "entropy": 5.294501781463623, "epoch": 3.9348556741795178, "grad_norm": 0.99609375, "learning_rate": 0.0003529036519138626, "loss": 4.8261, "mean_token_accuracy": 0.23449955880641937, "num_tokens": 91166511.0, "step": 39805 }, { "entropy": 5.3038887023925785, "epoch": 3.935349940688019, "grad_norm": 1.015625, "learning_rate": 0.0003528705437808516, "loss": 4.8131, "mean_token_accuracy": 0.2315727189183235, "num_tokens": 91178441.0, "step": 39810 }, { "entropy": 5.388254880905151, "epoch": 3.9358442071965203, "grad_norm": 1.03125, "learning_rate": 0.00035283743373221323, "loss": 4.9372, "mean_token_accuracy": 0.22555987536907196, "num_tokens": 91189958.0, "step": 39815 }, { "entropy": 5.360604286193848, "epoch": 3.936338473705022, "grad_norm": 1.0234375, "learning_rate": 0.000352804321768762, "loss": 4.8466, "mean_token_accuracy": 0.22832064479589462, "num_tokens": 91201461.0, "step": 39820 }, { "entropy": 5.3162132740020756, "epoch": 3.9368327402135233, "grad_norm": 1.0703125, "learning_rate": 0.00035277120789131217, "loss": 4.8112, "mean_token_accuracy": 0.23343529254198075, "num_tokens": 91212626.0, "step": 39825 }, { "entropy": 5.334246110916138, "epoch": 3.9373270067220245, "grad_norm": 1.0390625, "learning_rate": 0.0003527380921006787, "loss": 4.8417, "mean_token_accuracy": 0.2324007347226143, "num_tokens": 91224425.0, "step": 39830 }, { "entropy": 5.3559814453125, "epoch": 3.9378212732305258, "grad_norm": 1.0390625, "learning_rate": 0.00035270497439767606, "loss": 4.7532, "mean_token_accuracy": 0.23961358070373534, "num_tokens": 91234989.0, "step": 39835 }, { "entropy": 5.3061141014099125, "epoch": 3.938315539739027, "grad_norm": 1.0234375, "learning_rate": 0.00035267185478311895, "loss": 4.7545, "mean_token_accuracy": 0.2425835460424423, "num_tokens": 91245713.0, "step": 39840 }, { "entropy": 5.268789672851563, "epoch": 3.9388098062475287, "grad_norm": 1.0, "learning_rate": 0.0003526387332578223, "loss": 4.8117, "mean_token_accuracy": 0.23519749492406844, "num_tokens": 91256719.0, "step": 39845 }, { "entropy": 5.344355058670044, "epoch": 3.93930407275603, "grad_norm": 1.0234375, "learning_rate": 0.0003526056098226007, "loss": 4.9461, "mean_token_accuracy": 0.22382374107837677, "num_tokens": 91268167.0, "step": 39850 }, { "entropy": 5.400772619247436, "epoch": 3.9397983392645317, "grad_norm": 1.1640625, "learning_rate": 0.000352572484478269, "loss": 4.9036, "mean_token_accuracy": 0.22423539608716964, "num_tokens": 91280182.0, "step": 39855 }, { "entropy": 5.369412040710449, "epoch": 3.940292605773033, "grad_norm": 1.0625, "learning_rate": 0.00035253935722564215, "loss": 4.9181, "mean_token_accuracy": 0.2221055507659912, "num_tokens": 91291755.0, "step": 39860 }, { "entropy": 5.376197099685669, "epoch": 3.9407868722815342, "grad_norm": 1.0078125, "learning_rate": 0.00035250622806553525, "loss": 4.7937, "mean_token_accuracy": 0.2398162767291069, "num_tokens": 91302389.0, "step": 39865 }, { "entropy": 5.370993614196777, "epoch": 3.9412811387900355, "grad_norm": 1.078125, "learning_rate": 0.00035247309699876293, "loss": 4.8424, "mean_token_accuracy": 0.23385093808174134, "num_tokens": 91313354.0, "step": 39870 }, { "entropy": 5.328248596191406, "epoch": 3.9417754052985368, "grad_norm": 0.94140625, "learning_rate": 0.0003524399640261404, "loss": 4.9614, "mean_token_accuracy": 0.22425028532743455, "num_tokens": 91325939.0, "step": 39875 }, { "entropy": 5.328912305831909, "epoch": 3.9422696718070385, "grad_norm": 1.0703125, "learning_rate": 0.0003524068291484829, "loss": 4.8355, "mean_token_accuracy": 0.23320215195417404, "num_tokens": 91336637.0, "step": 39880 }, { "entropy": 5.333451461791992, "epoch": 3.9427639383155397, "grad_norm": 1.0, "learning_rate": 0.00035237369236660525, "loss": 4.8722, "mean_token_accuracy": 0.2256808504462242, "num_tokens": 91348058.0, "step": 39885 }, { "entropy": 5.352625370025635, "epoch": 3.943258204824041, "grad_norm": 1.015625, "learning_rate": 0.0003523405536813229, "loss": 4.8016, "mean_token_accuracy": 0.2357986330986023, "num_tokens": 91358630.0, "step": 39890 }, { "entropy": 5.361729717254638, "epoch": 3.9437524713325427, "grad_norm": 0.98828125, "learning_rate": 0.0003523074130934509, "loss": 4.842, "mean_token_accuracy": 0.22374155670404433, "num_tokens": 91369989.0, "step": 39895 }, { "entropy": 5.3338611125946045, "epoch": 3.944246737841044, "grad_norm": 0.953125, "learning_rate": 0.00035227427060380436, "loss": 4.8914, "mean_token_accuracy": 0.22231329679489137, "num_tokens": 91382145.0, "step": 39900 }, { "entropy": 5.339505290985107, "epoch": 3.944741004349545, "grad_norm": 1.09375, "learning_rate": 0.000352241126213199, "loss": 4.8027, "mean_token_accuracy": 0.23367551267147063, "num_tokens": 91392952.0, "step": 39905 }, { "entropy": 5.331672716140747, "epoch": 3.9452352708580465, "grad_norm": 1.015625, "learning_rate": 0.0003522079799224499, "loss": 4.8722, "mean_token_accuracy": 0.22882410287857055, "num_tokens": 91404050.0, "step": 39910 }, { "entropy": 5.286484622955323, "epoch": 3.945729537366548, "grad_norm": 1.1015625, "learning_rate": 0.0003521748317323724, "loss": 4.7826, "mean_token_accuracy": 0.2357404574751854, "num_tokens": 91414326.0, "step": 39915 }, { "entropy": 5.41082615852356, "epoch": 3.9462238038750495, "grad_norm": 1.0390625, "learning_rate": 0.0003521416816437822, "loss": 4.8897, "mean_token_accuracy": 0.22580254673957825, "num_tokens": 91426774.0, "step": 39920 }, { "entropy": 5.3731059551239015, "epoch": 3.9467180703835507, "grad_norm": 0.9375, "learning_rate": 0.0003521085296574945, "loss": 4.8476, "mean_token_accuracy": 0.233173730969429, "num_tokens": 91438303.0, "step": 39925 }, { "entropy": 5.358786249160767, "epoch": 3.9472123368920524, "grad_norm": 1.0625, "learning_rate": 0.00035207537577432516, "loss": 4.8732, "mean_token_accuracy": 0.23154789954423904, "num_tokens": 91449310.0, "step": 39930 }, { "entropy": 5.33154330253601, "epoch": 3.9477066034005537, "grad_norm": 1.03125, "learning_rate": 0.0003520422199950896, "loss": 4.8366, "mean_token_accuracy": 0.23151590526103974, "num_tokens": 91460665.0, "step": 39935 }, { "entropy": 5.405113363265992, "epoch": 3.948200869909055, "grad_norm": 1.15625, "learning_rate": 0.0003520090623206034, "loss": 4.8927, "mean_token_accuracy": 0.2251478612422943, "num_tokens": 91471111.0, "step": 39940 }, { "entropy": 5.260266733169556, "epoch": 3.948695136417556, "grad_norm": 1.0390625, "learning_rate": 0.00035197590275168247, "loss": 4.8042, "mean_token_accuracy": 0.23944417238235474, "num_tokens": 91483525.0, "step": 39945 }, { "entropy": 5.316655206680298, "epoch": 3.9491894029260575, "grad_norm": 1.0625, "learning_rate": 0.0003519427412891422, "loss": 4.8181, "mean_token_accuracy": 0.22831547111272812, "num_tokens": 91494718.0, "step": 39950 }, { "entropy": 5.341066884994507, "epoch": 3.949683669434559, "grad_norm": 0.95703125, "learning_rate": 0.0003519095779337987, "loss": 4.7975, "mean_token_accuracy": 0.23304396867752075, "num_tokens": 91507286.0, "step": 39955 }, { "entropy": 5.282913112640381, "epoch": 3.9501779359430604, "grad_norm": 1.2265625, "learning_rate": 0.00035187641268646756, "loss": 4.7059, "mean_token_accuracy": 0.24805891066789626, "num_tokens": 91517590.0, "step": 39960 }, { "entropy": 5.319975662231445, "epoch": 3.950672202451562, "grad_norm": 1.0390625, "learning_rate": 0.00035184324554796484, "loss": 4.7376, "mean_token_accuracy": 0.24051276296377183, "num_tokens": 91527995.0, "step": 39965 }, { "entropy": 5.401109504699707, "epoch": 3.9511664689600634, "grad_norm": 1.1171875, "learning_rate": 0.00035181007651910624, "loss": 4.8908, "mean_token_accuracy": 0.22353238463401795, "num_tokens": 91539457.0, "step": 39970 }, { "entropy": 5.277064037322998, "epoch": 3.9516607354685647, "grad_norm": 1.0859375, "learning_rate": 0.0003517769056007079, "loss": 4.8245, "mean_token_accuracy": 0.23158616125583648, "num_tokens": 91551104.0, "step": 39975 }, { "entropy": 5.371853065490723, "epoch": 3.952155001977066, "grad_norm": 1.046875, "learning_rate": 0.00035174373279358586, "loss": 4.8441, "mean_token_accuracy": 0.2267309010028839, "num_tokens": 91561558.0, "step": 39980 }, { "entropy": 5.428329086303711, "epoch": 3.952649268485567, "grad_norm": 1.09375, "learning_rate": 0.0003517105580985559, "loss": 4.9881, "mean_token_accuracy": 0.22411048263311387, "num_tokens": 91573179.0, "step": 39985 }, { "entropy": 5.369089937210083, "epoch": 3.953143534994069, "grad_norm": 1.1171875, "learning_rate": 0.0003516773815164345, "loss": 4.8985, "mean_token_accuracy": 0.227798992395401, "num_tokens": 91584973.0, "step": 39990 }, { "entropy": 5.3311295986175535, "epoch": 3.95363780150257, "grad_norm": 0.93359375, "learning_rate": 0.0003516442030480375, "loss": 4.7948, "mean_token_accuracy": 0.23682393431663512, "num_tokens": 91596681.0, "step": 39995 }, { "entropy": 5.311963939666748, "epoch": 3.9541320680110714, "grad_norm": 1.03125, "learning_rate": 0.0003516110226941812, "loss": 4.7994, "mean_token_accuracy": 0.23136058151721955, "num_tokens": 91608382.0, "step": 40000 }, { "entropy": 5.402717256546021, "epoch": 3.954626334519573, "grad_norm": 1.03125, "learning_rate": 0.00035157784045568194, "loss": 4.8804, "mean_token_accuracy": 0.22486139982938766, "num_tokens": 91619619.0, "step": 40005 }, { "entropy": 5.378870010375977, "epoch": 3.9551206010280744, "grad_norm": 0.9375, "learning_rate": 0.0003515446563333559, "loss": 4.9085, "mean_token_accuracy": 0.2170392394065857, "num_tokens": 91631889.0, "step": 40010 }, { "entropy": 5.399372529983521, "epoch": 3.9556148675365757, "grad_norm": 1.0078125, "learning_rate": 0.00035151147032801947, "loss": 4.9397, "mean_token_accuracy": 0.22109360247850418, "num_tokens": 91643982.0, "step": 40015 }, { "entropy": 5.377419757843017, "epoch": 3.956109134045077, "grad_norm": 1.0234375, "learning_rate": 0.00035147828244048887, "loss": 4.9075, "mean_token_accuracy": 0.22660742402076722, "num_tokens": 91656322.0, "step": 40020 }, { "entropy": 5.327892303466797, "epoch": 3.9566034005535786, "grad_norm": 0.96875, "learning_rate": 0.0003514450926715808, "loss": 4.885, "mean_token_accuracy": 0.22473589479923248, "num_tokens": 91669419.0, "step": 40025 }, { "entropy": 5.3512537479400635, "epoch": 3.95709766706208, "grad_norm": 1.0390625, "learning_rate": 0.0003514119010221115, "loss": 4.7702, "mean_token_accuracy": 0.24089371263980866, "num_tokens": 91679919.0, "step": 40030 }, { "entropy": 5.317242193222046, "epoch": 3.957591933570581, "grad_norm": 1.1015625, "learning_rate": 0.0003513787074928976, "loss": 4.775, "mean_token_accuracy": 0.23996343910694123, "num_tokens": 91690985.0, "step": 40035 }, { "entropy": 5.292612457275391, "epoch": 3.958086200079083, "grad_norm": 0.9609375, "learning_rate": 0.0003513455120847557, "loss": 4.8352, "mean_token_accuracy": 0.2318171590566635, "num_tokens": 91702944.0, "step": 40040 }, { "entropy": 5.345801734924317, "epoch": 3.958580466587584, "grad_norm": 1.046875, "learning_rate": 0.00035131231479850226, "loss": 4.7977, "mean_token_accuracy": 0.23561763614416123, "num_tokens": 91713608.0, "step": 40045 }, { "entropy": 5.394589567184449, "epoch": 3.9590747330960854, "grad_norm": 0.9921875, "learning_rate": 0.0003512791156349541, "loss": 4.8619, "mean_token_accuracy": 0.22798121273517608, "num_tokens": 91725970.0, "step": 40050 }, { "entropy": 5.291582250595093, "epoch": 3.9595689996045866, "grad_norm": 1.015625, "learning_rate": 0.0003512459145949279, "loss": 4.7868, "mean_token_accuracy": 0.23041202276945114, "num_tokens": 91738001.0, "step": 40055 }, { "entropy": 5.315451145172119, "epoch": 3.9600632661130883, "grad_norm": 1.1953125, "learning_rate": 0.00035121271167924033, "loss": 4.7777, "mean_token_accuracy": 0.23599110692739486, "num_tokens": 91747050.0, "step": 40060 }, { "entropy": 5.330843162536621, "epoch": 3.9605575326215896, "grad_norm": 1.1484375, "learning_rate": 0.0003511795068887082, "loss": 4.828, "mean_token_accuracy": 0.2316245838999748, "num_tokens": 91757298.0, "step": 40065 }, { "entropy": 5.40718355178833, "epoch": 3.961051799130091, "grad_norm": 0.97265625, "learning_rate": 0.0003511463002241485, "loss": 4.93, "mean_token_accuracy": 0.22236980497837067, "num_tokens": 91768276.0, "step": 40070 }, { "entropy": 5.371375799179077, "epoch": 3.9615460656385926, "grad_norm": 1.046875, "learning_rate": 0.0003511130916863779, "loss": 4.824, "mean_token_accuracy": 0.23352506160736083, "num_tokens": 91779186.0, "step": 40075 }, { "entropy": 5.337411165237427, "epoch": 3.962040332147094, "grad_norm": 0.96875, "learning_rate": 0.0003510798812762134, "loss": 4.8931, "mean_token_accuracy": 0.23003126084804534, "num_tokens": 91790503.0, "step": 40080 }, { "entropy": 5.361076545715332, "epoch": 3.962534598655595, "grad_norm": 1.0390625, "learning_rate": 0.0003510466689944721, "loss": 4.8553, "mean_token_accuracy": 0.23125389963388443, "num_tokens": 91802526.0, "step": 40085 }, { "entropy": 5.389792203903198, "epoch": 3.9630288651640964, "grad_norm": 1.078125, "learning_rate": 0.0003510134548419709, "loss": 4.8602, "mean_token_accuracy": 0.2359295129776001, "num_tokens": 91814116.0, "step": 40090 }, { "entropy": 5.336909770965576, "epoch": 3.9635231316725976, "grad_norm": 1.0234375, "learning_rate": 0.0003509802388195269, "loss": 4.8711, "mean_token_accuracy": 0.23229179680347442, "num_tokens": 91825459.0, "step": 40095 }, { "entropy": 5.396314001083374, "epoch": 3.9640173981810993, "grad_norm": 0.9453125, "learning_rate": 0.00035094702092795734, "loss": 4.9289, "mean_token_accuracy": 0.22714129835367203, "num_tokens": 91837656.0, "step": 40100 }, { "entropy": 5.3377602100372314, "epoch": 3.9645116646896006, "grad_norm": 1.0078125, "learning_rate": 0.0003509138011680792, "loss": 4.8581, "mean_token_accuracy": 0.22904568612575532, "num_tokens": 91849384.0, "step": 40105 }, { "entropy": 5.271754407882691, "epoch": 3.965005931198102, "grad_norm": 0.96484375, "learning_rate": 0.0003508805795407097, "loss": 4.7925, "mean_token_accuracy": 0.23368844389915466, "num_tokens": 91861508.0, "step": 40110 }, { "entropy": 5.38617467880249, "epoch": 3.9655001977066036, "grad_norm": 0.9921875, "learning_rate": 0.00035084735604666627, "loss": 4.9296, "mean_token_accuracy": 0.22615646868944167, "num_tokens": 91874439.0, "step": 40115 }, { "entropy": 5.429339647293091, "epoch": 3.965994464215105, "grad_norm": 1.015625, "learning_rate": 0.0003508141306867662, "loss": 4.8646, "mean_token_accuracy": 0.23063723891973495, "num_tokens": 91884949.0, "step": 40120 }, { "entropy": 5.334367036819458, "epoch": 3.966488730723606, "grad_norm": 1.0625, "learning_rate": 0.0003507809034618267, "loss": 4.853, "mean_token_accuracy": 0.23373188376426696, "num_tokens": 91895636.0, "step": 40125 }, { "entropy": 5.353457450866699, "epoch": 3.9669829972321073, "grad_norm": 0.9765625, "learning_rate": 0.00035074767437266507, "loss": 4.8422, "mean_token_accuracy": 0.2299313560128212, "num_tokens": 91908392.0, "step": 40130 }, { "entropy": 5.398638486862183, "epoch": 3.967477263740609, "grad_norm": 1.078125, "learning_rate": 0.000350714443420099, "loss": 4.8948, "mean_token_accuracy": 0.22361868172883986, "num_tokens": 91919976.0, "step": 40135 }, { "entropy": 5.314912462234497, "epoch": 3.9679715302491103, "grad_norm": 1.09375, "learning_rate": 0.00035068121060494596, "loss": 4.837, "mean_token_accuracy": 0.2277220904827118, "num_tokens": 91930770.0, "step": 40140 }, { "entropy": 5.445459461212158, "epoch": 3.9684657967576116, "grad_norm": 0.99609375, "learning_rate": 0.0003506479759280233, "loss": 4.9674, "mean_token_accuracy": 0.22309337556362152, "num_tokens": 91943317.0, "step": 40145 }, { "entropy": 5.369079446792602, "epoch": 3.9689600632661133, "grad_norm": 0.9921875, "learning_rate": 0.0003506147393901487, "loss": 4.8439, "mean_token_accuracy": 0.22656961679458618, "num_tokens": 91954949.0, "step": 40150 }, { "entropy": 5.3592346668243405, "epoch": 3.9694543297746145, "grad_norm": 1.09375, "learning_rate": 0.0003505815009921398, "loss": 4.8516, "mean_token_accuracy": 0.2266456142067909, "num_tokens": 91967392.0, "step": 40155 }, { "entropy": 5.35434365272522, "epoch": 3.969948596283116, "grad_norm": 0.984375, "learning_rate": 0.0003505482607348142, "loss": 4.7979, "mean_token_accuracy": 0.2309319332242012, "num_tokens": 91979116.0, "step": 40160 }, { "entropy": 5.361352729797363, "epoch": 3.970442862791617, "grad_norm": 1.0625, "learning_rate": 0.0003505150186189898, "loss": 4.8673, "mean_token_accuracy": 0.22901637852191925, "num_tokens": 91989811.0, "step": 40165 }, { "entropy": 5.30138201713562, "epoch": 3.9709371293001188, "grad_norm": 1.1484375, "learning_rate": 0.0003504817746454841, "loss": 4.8413, "mean_token_accuracy": 0.23187425583600998, "num_tokens": 92000043.0, "step": 40170 }, { "entropy": 5.389993143081665, "epoch": 3.97143139580862, "grad_norm": 0.98046875, "learning_rate": 0.00035044852881511507, "loss": 4.952, "mean_token_accuracy": 0.22172085493803023, "num_tokens": 92013475.0, "step": 40175 }, { "entropy": 5.4103282451629635, "epoch": 3.9719256623171213, "grad_norm": 1.1328125, "learning_rate": 0.00035041528112870053, "loss": 4.9062, "mean_token_accuracy": 0.22174635976552964, "num_tokens": 92025369.0, "step": 40180 }, { "entropy": 5.370468950271606, "epoch": 3.972419928825623, "grad_norm": 1.0625, "learning_rate": 0.0003503820315870583, "loss": 4.8575, "mean_token_accuracy": 0.22712050676345824, "num_tokens": 92035682.0, "step": 40185 }, { "entropy": 5.396420955657959, "epoch": 3.9729141953341243, "grad_norm": 1.03125, "learning_rate": 0.0003503487801910065, "loss": 4.8682, "mean_token_accuracy": 0.22961417883634566, "num_tokens": 92046735.0, "step": 40190 }, { "entropy": 5.32827410697937, "epoch": 3.9734084618426255, "grad_norm": 1.0625, "learning_rate": 0.000350315526941363, "loss": 4.8255, "mean_token_accuracy": 0.23189446777105333, "num_tokens": 92057802.0, "step": 40195 }, { "entropy": 5.360832071304321, "epoch": 3.973902728351127, "grad_norm": 1.0, "learning_rate": 0.0003502822718389459, "loss": 4.8788, "mean_token_accuracy": 0.22771911174058915, "num_tokens": 92068656.0, "step": 40200 }, { "entropy": 5.32575249671936, "epoch": 3.974396994859628, "grad_norm": 1.0234375, "learning_rate": 0.0003502490148845732, "loss": 4.8059, "mean_token_accuracy": 0.2352384641766548, "num_tokens": 92079403.0, "step": 40205 }, { "entropy": 5.36091423034668, "epoch": 3.9748912613681298, "grad_norm": 1.03125, "learning_rate": 0.00035021575607906304, "loss": 4.8883, "mean_token_accuracy": 0.224441859126091, "num_tokens": 92091482.0, "step": 40210 }, { "entropy": 5.410396957397461, "epoch": 3.975385527876631, "grad_norm": 1.1328125, "learning_rate": 0.00035018249542323357, "loss": 4.9173, "mean_token_accuracy": 0.2216590717434883, "num_tokens": 92101906.0, "step": 40215 }, { "entropy": 5.397600317001343, "epoch": 3.9758797943851327, "grad_norm": 0.98828125, "learning_rate": 0.0003501492329179031, "loss": 4.9289, "mean_token_accuracy": 0.21863505840301514, "num_tokens": 92114683.0, "step": 40220 }, { "entropy": 5.430489110946655, "epoch": 3.976374060893634, "grad_norm": 1.046875, "learning_rate": 0.0003501159685638898, "loss": 4.9275, "mean_token_accuracy": 0.22403301745653154, "num_tokens": 92126108.0, "step": 40225 }, { "entropy": 5.34387731552124, "epoch": 3.9768683274021353, "grad_norm": 0.95703125, "learning_rate": 0.000350082702362012, "loss": 4.853, "mean_token_accuracy": 0.22682178318500518, "num_tokens": 92136970.0, "step": 40230 }, { "entropy": 5.365846347808838, "epoch": 3.9773625939106365, "grad_norm": 1.0546875, "learning_rate": 0.00035004943431308816, "loss": 4.9482, "mean_token_accuracy": 0.22344014793634415, "num_tokens": 92148919.0, "step": 40235 }, { "entropy": 5.321615600585938, "epoch": 3.9778568604191378, "grad_norm": 1.0546875, "learning_rate": 0.0003500161644179366, "loss": 4.7513, "mean_token_accuracy": 0.23589558601379396, "num_tokens": 92159492.0, "step": 40240 }, { "entropy": 5.420327758789062, "epoch": 3.9783511269276395, "grad_norm": 1.140625, "learning_rate": 0.0003499828926773757, "loss": 4.8628, "mean_token_accuracy": 0.23244974613189698, "num_tokens": 92171324.0, "step": 40245 }, { "entropy": 5.283923196792602, "epoch": 3.9788453934361407, "grad_norm": 1.0546875, "learning_rate": 0.00034994961909222405, "loss": 4.7725, "mean_token_accuracy": 0.23341252654790878, "num_tokens": 92182336.0, "step": 40250 }, { "entropy": 5.2994777202606205, "epoch": 3.979339659944642, "grad_norm": 1.0625, "learning_rate": 0.00034991634366330005, "loss": 4.767, "mean_token_accuracy": 0.23451495319604873, "num_tokens": 92193965.0, "step": 40255 }, { "entropy": 5.297297954559326, "epoch": 3.9798339264531437, "grad_norm": 1.03125, "learning_rate": 0.0003498830663914224, "loss": 4.7886, "mean_token_accuracy": 0.23747898489236832, "num_tokens": 92204921.0, "step": 40260 }, { "entropy": 5.32825231552124, "epoch": 3.980328192961645, "grad_norm": 1.0390625, "learning_rate": 0.00034984978727740977, "loss": 4.8397, "mean_token_accuracy": 0.22901930510997773, "num_tokens": 92216557.0, "step": 40265 }, { "entropy": 5.341748905181885, "epoch": 3.9808224594701462, "grad_norm": 1.0703125, "learning_rate": 0.0003498165063220808, "loss": 4.795, "mean_token_accuracy": 0.2292151391506195, "num_tokens": 92227346.0, "step": 40270 }, { "entropy": 5.319154405593872, "epoch": 3.9813167259786475, "grad_norm": 1.09375, "learning_rate": 0.0003497832235262541, "loss": 4.7955, "mean_token_accuracy": 0.24031589925289154, "num_tokens": 92240099.0, "step": 40275 }, { "entropy": 5.336941337585449, "epoch": 3.981810992487149, "grad_norm": 1.0, "learning_rate": 0.00034974993889074846, "loss": 4.8825, "mean_token_accuracy": 0.22621572017669678, "num_tokens": 92251194.0, "step": 40280 }, { "entropy": 5.378085947036743, "epoch": 3.9823052589956505, "grad_norm": 1.046875, "learning_rate": 0.0003497166524163827, "loss": 4.8777, "mean_token_accuracy": 0.23052478581666946, "num_tokens": 92261926.0, "step": 40285 }, { "entropy": 5.35083794593811, "epoch": 3.9827995255041517, "grad_norm": 1.0703125, "learning_rate": 0.00034968336410397586, "loss": 4.8205, "mean_token_accuracy": 0.2364308148622513, "num_tokens": 92274292.0, "step": 40290 }, { "entropy": 5.318950510025024, "epoch": 3.9832937920126534, "grad_norm": 0.984375, "learning_rate": 0.00034965007395434657, "loss": 4.8581, "mean_token_accuracy": 0.22910142242908477, "num_tokens": 92285803.0, "step": 40295 }, { "entropy": 5.306775093078613, "epoch": 3.9837880585211547, "grad_norm": 1.0234375, "learning_rate": 0.0003496167819683138, "loss": 4.8359, "mean_token_accuracy": 0.22998355627059935, "num_tokens": 92297729.0, "step": 40300 }, { "entropy": 5.351577425003052, "epoch": 3.984282325029656, "grad_norm": 1.109375, "learning_rate": 0.0003495834881466967, "loss": 4.8475, "mean_token_accuracy": 0.23530908972024916, "num_tokens": 92309215.0, "step": 40305 }, { "entropy": 5.378206014633179, "epoch": 3.984776591538157, "grad_norm": 1.03125, "learning_rate": 0.0003495501924903143, "loss": 4.863, "mean_token_accuracy": 0.22395335584878923, "num_tokens": 92320320.0, "step": 40310 }, { "entropy": 5.364840412139893, "epoch": 3.9852708580466585, "grad_norm": 1.0078125, "learning_rate": 0.0003495168949999855, "loss": 4.8937, "mean_token_accuracy": 0.22684552520513535, "num_tokens": 92333054.0, "step": 40315 }, { "entropy": 5.292163467407226, "epoch": 3.98576512455516, "grad_norm": 1.0703125, "learning_rate": 0.0003494835956765295, "loss": 4.8051, "mean_token_accuracy": 0.23023744225502013, "num_tokens": 92345558.0, "step": 40320 }, { "entropy": 5.345791435241699, "epoch": 3.9862593910636615, "grad_norm": 1.09375, "learning_rate": 0.0003494502945207656, "loss": 4.8103, "mean_token_accuracy": 0.22864662110805511, "num_tokens": 92356782.0, "step": 40325 }, { "entropy": 5.423436164855957, "epoch": 3.986753657572163, "grad_norm": 1.078125, "learning_rate": 0.00034941699153351286, "loss": 4.9549, "mean_token_accuracy": 0.22279216200113297, "num_tokens": 92368600.0, "step": 40330 }, { "entropy": 5.3496561527252195, "epoch": 3.9872479240806644, "grad_norm": 1.0390625, "learning_rate": 0.0003493836867155905, "loss": 4.8123, "mean_token_accuracy": 0.23402131199836732, "num_tokens": 92380694.0, "step": 40335 }, { "entropy": 5.320859384536743, "epoch": 3.9877421905891657, "grad_norm": 0.9375, "learning_rate": 0.00034935038006781805, "loss": 4.8405, "mean_token_accuracy": 0.23268289864063263, "num_tokens": 92392518.0, "step": 40340 }, { "entropy": 5.304585552215576, "epoch": 3.988236457097667, "grad_norm": 1.0625, "learning_rate": 0.00034931707159101467, "loss": 4.8684, "mean_token_accuracy": 0.23138098120689393, "num_tokens": 92403631.0, "step": 40345 }, { "entropy": 5.482143878936768, "epoch": 3.988730723606168, "grad_norm": 1.015625, "learning_rate": 0.0003492837612859997, "loss": 5.0742, "mean_token_accuracy": 0.21317655593156815, "num_tokens": 92414606.0, "step": 40350 }, { "entropy": 5.338964319229126, "epoch": 3.98922499011467, "grad_norm": 1.15625, "learning_rate": 0.0003492504491535928, "loss": 4.8059, "mean_token_accuracy": 0.2366069257259369, "num_tokens": 92425384.0, "step": 40355 }, { "entropy": 5.280147647857666, "epoch": 3.989719256623171, "grad_norm": 1.015625, "learning_rate": 0.0003492171351946133, "loss": 4.7686, "mean_token_accuracy": 0.23911650478839874, "num_tokens": 92436179.0, "step": 40360 }, { "entropy": 5.258172988891602, "epoch": 3.9902135231316724, "grad_norm": 1.0, "learning_rate": 0.00034918381940988075, "loss": 4.7989, "mean_token_accuracy": 0.23981783390045167, "num_tokens": 92447615.0, "step": 40365 }, { "entropy": 5.356751012802124, "epoch": 3.990707789640174, "grad_norm": 1.1171875, "learning_rate": 0.0003491505018002147, "loss": 4.8623, "mean_token_accuracy": 0.23313144445419312, "num_tokens": 92458900.0, "step": 40370 }, { "entropy": 5.329048442840576, "epoch": 3.9912020561486754, "grad_norm": 1.0390625, "learning_rate": 0.0003491171823664348, "loss": 4.766, "mean_token_accuracy": 0.24705801159143448, "num_tokens": 92470065.0, "step": 40375 }, { "entropy": 5.4267964363098145, "epoch": 3.9916963226571767, "grad_norm": 1.0859375, "learning_rate": 0.00034908386110936077, "loss": 4.9562, "mean_token_accuracy": 0.227079114317894, "num_tokens": 92482157.0, "step": 40380 }, { "entropy": 5.323853874206543, "epoch": 3.992190589165678, "grad_norm": 0.97265625, "learning_rate": 0.0003490505380298122, "loss": 4.8976, "mean_token_accuracy": 0.21955063045024872, "num_tokens": 92496438.0, "step": 40385 }, { "entropy": 5.309552001953125, "epoch": 3.9926848556741796, "grad_norm": 1.109375, "learning_rate": 0.000349017213128609, "loss": 4.7838, "mean_token_accuracy": 0.24072130620479584, "num_tokens": 92507832.0, "step": 40390 }, { "entropy": 5.341729736328125, "epoch": 3.993179122182681, "grad_norm": 1.0390625, "learning_rate": 0.0003489838864065708, "loss": 4.8231, "mean_token_accuracy": 0.23348956257104875, "num_tokens": 92519465.0, "step": 40395 }, { "entropy": 5.319020366668701, "epoch": 3.993673388691182, "grad_norm": 1.078125, "learning_rate": 0.0003489505578645175, "loss": 4.8675, "mean_token_accuracy": 0.22736720293760299, "num_tokens": 92531051.0, "step": 40400 }, { "entropy": 5.312643671035767, "epoch": 3.994167655199684, "grad_norm": 0.98828125, "learning_rate": 0.00034891722750326907, "loss": 4.862, "mean_token_accuracy": 0.22921500205993653, "num_tokens": 92543654.0, "step": 40405 }, { "entropy": 5.384975814819336, "epoch": 3.994661921708185, "grad_norm": 1.046875, "learning_rate": 0.00034888389532364533, "loss": 4.8755, "mean_token_accuracy": 0.22712205946445466, "num_tokens": 92554126.0, "step": 40410 }, { "entropy": 5.413172388076783, "epoch": 3.9951561882166864, "grad_norm": 0.9375, "learning_rate": 0.00034885056132646637, "loss": 4.9816, "mean_token_accuracy": 0.22353312969207764, "num_tokens": 92567205.0, "step": 40415 }, { "entropy": 5.36478967666626, "epoch": 3.9956504547251877, "grad_norm": 1.0859375, "learning_rate": 0.00034881722551255206, "loss": 4.8282, "mean_token_accuracy": 0.23636850267648696, "num_tokens": 92579402.0, "step": 40420 }, { "entropy": 5.419604349136352, "epoch": 3.9961447212336894, "grad_norm": 0.984375, "learning_rate": 0.0003487838878827225, "loss": 4.8807, "mean_token_accuracy": 0.2242361605167389, "num_tokens": 92592514.0, "step": 40425 }, { "entropy": 5.328106546401978, "epoch": 3.9966389877421906, "grad_norm": 1.109375, "learning_rate": 0.00034875054843779804, "loss": 4.8245, "mean_token_accuracy": 0.23432273864746095, "num_tokens": 92604571.0, "step": 40430 }, { "entropy": 5.260188484191895, "epoch": 3.997133254250692, "grad_norm": 1.03125, "learning_rate": 0.0003487172071785985, "loss": 4.8915, "mean_token_accuracy": 0.23011210858821868, "num_tokens": 92616867.0, "step": 40435 }, { "entropy": 5.330633163452148, "epoch": 3.9976275207591936, "grad_norm": 0.98828125, "learning_rate": 0.0003486838641059443, "loss": 4.8489, "mean_token_accuracy": 0.23067866265773773, "num_tokens": 92628958.0, "step": 40440 }, { "entropy": 5.366149377822876, "epoch": 3.998121787267695, "grad_norm": 1.0078125, "learning_rate": 0.00034865051922065556, "loss": 4.8633, "mean_token_accuracy": 0.23245127648115158, "num_tokens": 92639076.0, "step": 40445 }, { "entropy": 5.437234163284302, "epoch": 3.998616053776196, "grad_norm": 0.99609375, "learning_rate": 0.00034861717252355264, "loss": 4.9367, "mean_token_accuracy": 0.21973177194595336, "num_tokens": 92650824.0, "step": 40450 }, { "entropy": 5.391062498092651, "epoch": 3.9991103202846974, "grad_norm": 1.0, "learning_rate": 0.0003485838240154559, "loss": 4.9715, "mean_token_accuracy": 0.21907725930213928, "num_tokens": 92662371.0, "step": 40455 }, { "entropy": 5.452279472351075, "epoch": 3.9996045867931986, "grad_norm": 1.046875, "learning_rate": 0.00034855047369718563, "loss": 4.9663, "mean_token_accuracy": 0.22054788172245027, "num_tokens": 92673604.0, "step": 40460 }, { "entropy": 5.361011743545532, "epoch": 4.0000988533017, "grad_norm": 0.921875, "learning_rate": 0.00034851712156956226, "loss": 4.8638, "mean_token_accuracy": 0.22348599135875702, "num_tokens": 92684130.0, "step": 40465 }, { "entropy": 5.30580768585205, "epoch": 4.000593119810202, "grad_norm": 1.0234375, "learning_rate": 0.00034848376763340635, "loss": 4.7225, "mean_token_accuracy": 0.23922200053930281, "num_tokens": 92694625.0, "step": 40470 }, { "entropy": 5.316306495666504, "epoch": 4.001087386318703, "grad_norm": 1.0390625, "learning_rate": 0.00034845041188953836, "loss": 4.8518, "mean_token_accuracy": 0.22704501450061798, "num_tokens": 92705243.0, "step": 40475 }, { "entropy": 5.267105054855347, "epoch": 4.001581652827205, "grad_norm": 1.046875, "learning_rate": 0.0003484170543387788, "loss": 4.6494, "mean_token_accuracy": 0.24435345828533173, "num_tokens": 92716064.0, "step": 40480 }, { "entropy": 5.368187189102173, "epoch": 4.002075919335706, "grad_norm": 1.1171875, "learning_rate": 0.0003483836949819483, "loss": 4.7889, "mean_token_accuracy": 0.23174483925104142, "num_tokens": 92726910.0, "step": 40485 }, { "entropy": 5.370808935165405, "epoch": 4.002570185844207, "grad_norm": 1.09375, "learning_rate": 0.00034835033381986757, "loss": 4.8284, "mean_token_accuracy": 0.2331431597471237, "num_tokens": 92738847.0, "step": 40490 }, { "entropy": 5.323280286788941, "epoch": 4.003064452352708, "grad_norm": 1.046875, "learning_rate": 0.0003483169708533572, "loss": 4.8418, "mean_token_accuracy": 0.22667862027883529, "num_tokens": 92750471.0, "step": 40495 }, { "entropy": 5.290471315383911, "epoch": 4.00355871886121, "grad_norm": 1.0078125, "learning_rate": 0.0003482836060832381, "loss": 4.7319, "mean_token_accuracy": 0.24109200090169908, "num_tokens": 92762619.0, "step": 40500 }, { "entropy": 5.25319995880127, "epoch": 4.004052985369712, "grad_norm": 1.0625, "learning_rate": 0.0003482502395103309, "loss": 4.6893, "mean_token_accuracy": 0.2440693646669388, "num_tokens": 92774308.0, "step": 40505 }, { "entropy": 5.34149866104126, "epoch": 4.004547251878213, "grad_norm": 0.98828125, "learning_rate": 0.00034821687113545624, "loss": 4.8626, "mean_token_accuracy": 0.22844673246145247, "num_tokens": 92784408.0, "step": 40510 }, { "entropy": 5.390696001052857, "epoch": 4.005041518386714, "grad_norm": 1.078125, "learning_rate": 0.00034818350095943535, "loss": 4.8577, "mean_token_accuracy": 0.23472728431224824, "num_tokens": 92795615.0, "step": 40515 }, { "entropy": 5.422899055480957, "epoch": 4.005535784895216, "grad_norm": 1.0625, "learning_rate": 0.00034815012898308894, "loss": 4.8622, "mean_token_accuracy": 0.22771256268024445, "num_tokens": 92807850.0, "step": 40520 }, { "entropy": 5.435121011734009, "epoch": 4.006030051403717, "grad_norm": 1.0625, "learning_rate": 0.000348116755207238, "loss": 4.8604, "mean_token_accuracy": 0.22536608278751374, "num_tokens": 92818462.0, "step": 40525 }, { "entropy": 5.3116882801055905, "epoch": 4.006524317912218, "grad_norm": 0.98828125, "learning_rate": 0.00034808337963270364, "loss": 4.7243, "mean_token_accuracy": 0.24208070039749147, "num_tokens": 92830716.0, "step": 40530 }, { "entropy": 5.351921415328979, "epoch": 4.007018584420719, "grad_norm": 0.984375, "learning_rate": 0.00034805000226030677, "loss": 4.8509, "mean_token_accuracy": 0.2298220619559288, "num_tokens": 92842576.0, "step": 40535 }, { "entropy": 5.37802677154541, "epoch": 4.007512850929221, "grad_norm": 0.98046875, "learning_rate": 0.0003480166230908683, "loss": 4.8259, "mean_token_accuracy": 0.2305607259273529, "num_tokens": 92853981.0, "step": 40540 }, { "entropy": 5.387612533569336, "epoch": 4.008007117437723, "grad_norm": 1.0234375, "learning_rate": 0.0003479832421252098, "loss": 4.8432, "mean_token_accuracy": 0.2229489728808403, "num_tokens": 92866059.0, "step": 40545 }, { "entropy": 5.357319736480713, "epoch": 4.008501383946224, "grad_norm": 1.1015625, "learning_rate": 0.0003479498593641522, "loss": 4.7802, "mean_token_accuracy": 0.23576551377773286, "num_tokens": 92877362.0, "step": 40550 }, { "entropy": 5.388556051254272, "epoch": 4.008995650454725, "grad_norm": 1.0234375, "learning_rate": 0.0003479164748085167, "loss": 4.8638, "mean_token_accuracy": 0.22943638116121293, "num_tokens": 92890910.0, "step": 40555 }, { "entropy": 5.352285575866699, "epoch": 4.0094899169632265, "grad_norm": 1.1328125, "learning_rate": 0.00034788308845912463, "loss": 4.7493, "mean_token_accuracy": 0.2405357003211975, "num_tokens": 92901463.0, "step": 40560 }, { "entropy": 5.326690435409546, "epoch": 4.009984183471728, "grad_norm": 1.0625, "learning_rate": 0.0003478497003167972, "loss": 4.7585, "mean_token_accuracy": 0.23581480085849763, "num_tokens": 92912964.0, "step": 40565 }, { "entropy": 5.293004655838013, "epoch": 4.010478449980229, "grad_norm": 1.109375, "learning_rate": 0.00034781631038235597, "loss": 4.7221, "mean_token_accuracy": 0.24373070746660233, "num_tokens": 92923725.0, "step": 40570 }, { "entropy": 5.254113817214966, "epoch": 4.01097271648873, "grad_norm": 1.0703125, "learning_rate": 0.0003477829186566221, "loss": 4.8128, "mean_token_accuracy": 0.23747635036706924, "num_tokens": 92934982.0, "step": 40575 }, { "entropy": 5.369433450698852, "epoch": 4.0114669829972325, "grad_norm": 1.15625, "learning_rate": 0.0003477495251404172, "loss": 4.8137, "mean_token_accuracy": 0.23202908486127855, "num_tokens": 92945525.0, "step": 40580 }, { "entropy": 5.305727005004883, "epoch": 4.011961249505734, "grad_norm": 0.9921875, "learning_rate": 0.0003477161298345627, "loss": 4.7536, "mean_token_accuracy": 0.23975563943386077, "num_tokens": 92957802.0, "step": 40585 }, { "entropy": 5.4646828174591064, "epoch": 4.012455516014235, "grad_norm": 1.109375, "learning_rate": 0.00034768273273988004, "loss": 4.8395, "mean_token_accuracy": 0.23157545626163484, "num_tokens": 92969010.0, "step": 40590 }, { "entropy": 5.40182204246521, "epoch": 4.012949782522736, "grad_norm": 1.0078125, "learning_rate": 0.0003476493338571909, "loss": 4.8917, "mean_token_accuracy": 0.23226115703582764, "num_tokens": 92979342.0, "step": 40595 }, { "entropy": 5.379171133041382, "epoch": 4.0134440490312375, "grad_norm": 1.1171875, "learning_rate": 0.00034761593318731704, "loss": 4.8166, "mean_token_accuracy": 0.2358802452683449, "num_tokens": 92990092.0, "step": 40600 }, { "entropy": 5.331842422485352, "epoch": 4.013938315539739, "grad_norm": 1.0625, "learning_rate": 0.00034758253073107983, "loss": 4.7132, "mean_token_accuracy": 0.24057099968194962, "num_tokens": 92999658.0, "step": 40605 }, { "entropy": 5.34054856300354, "epoch": 4.01443258204824, "grad_norm": 1.046875, "learning_rate": 0.0003475491264893011, "loss": 4.826, "mean_token_accuracy": 0.2325947642326355, "num_tokens": 93010771.0, "step": 40610 }, { "entropy": 5.383745241165161, "epoch": 4.014926848556742, "grad_norm": 1.03125, "learning_rate": 0.00034751572046280254, "loss": 4.7573, "mean_token_accuracy": 0.23448209911584855, "num_tokens": 93020993.0, "step": 40615 }, { "entropy": 5.395478630065918, "epoch": 4.0154211150652435, "grad_norm": 1.0859375, "learning_rate": 0.00034748231265240617, "loss": 4.8663, "mean_token_accuracy": 0.23009089082479478, "num_tokens": 93032072.0, "step": 40620 }, { "entropy": 5.401557445526123, "epoch": 4.015915381573745, "grad_norm": 1.0859375, "learning_rate": 0.00034744890305893355, "loss": 4.9111, "mean_token_accuracy": 0.2254735827445984, "num_tokens": 93042768.0, "step": 40625 }, { "entropy": 5.415952110290528, "epoch": 4.016409648082246, "grad_norm": 1.03125, "learning_rate": 0.0003474154916832067, "loss": 4.8488, "mean_token_accuracy": 0.23737420588731767, "num_tokens": 93054162.0, "step": 40630 }, { "entropy": 5.282187843322754, "epoch": 4.016903914590747, "grad_norm": 1.0390625, "learning_rate": 0.00034738207852604746, "loss": 4.6351, "mean_token_accuracy": 0.24959323257207872, "num_tokens": 93065124.0, "step": 40635 }, { "entropy": 5.329008436203003, "epoch": 4.0173981810992485, "grad_norm": 0.94921875, "learning_rate": 0.00034734866358827795, "loss": 4.8181, "mean_token_accuracy": 0.23936621844768524, "num_tokens": 93076439.0, "step": 40640 }, { "entropy": 5.326653861999512, "epoch": 4.01789244760775, "grad_norm": 1.0390625, "learning_rate": 0.00034731524687072005, "loss": 4.7761, "mean_token_accuracy": 0.22702086269855498, "num_tokens": 93087441.0, "step": 40645 }, { "entropy": 5.44214448928833, "epoch": 4.018386714116252, "grad_norm": 1.09375, "learning_rate": 0.0003472818283741959, "loss": 4.8959, "mean_token_accuracy": 0.21963559240102767, "num_tokens": 93099098.0, "step": 40650 }, { "entropy": 5.318582248687744, "epoch": 4.018880980624753, "grad_norm": 1.078125, "learning_rate": 0.0003472484080995275, "loss": 4.7677, "mean_token_accuracy": 0.241671422123909, "num_tokens": 93109927.0, "step": 40655 }, { "entropy": 5.309227752685547, "epoch": 4.0193752471332544, "grad_norm": 1.15625, "learning_rate": 0.00034721498604753706, "loss": 4.6916, "mean_token_accuracy": 0.24136652201414108, "num_tokens": 93121910.0, "step": 40660 }, { "entropy": 5.2502593994140625, "epoch": 4.019869513641756, "grad_norm": 1.171875, "learning_rate": 0.00034718156221904677, "loss": 4.786, "mean_token_accuracy": 0.24079766869544983, "num_tokens": 93133598.0, "step": 40665 }, { "entropy": 5.291032695770264, "epoch": 4.020363780150257, "grad_norm": 1.078125, "learning_rate": 0.0003471481366148789, "loss": 4.7794, "mean_token_accuracy": 0.23469625860452653, "num_tokens": 93145189.0, "step": 40670 }, { "entropy": 5.3495481491088865, "epoch": 4.020858046658758, "grad_norm": 1.109375, "learning_rate": 0.00034711470923585563, "loss": 4.7962, "mean_token_accuracy": 0.2379508212208748, "num_tokens": 93157630.0, "step": 40675 }, { "entropy": 5.312327146530151, "epoch": 4.0213523131672595, "grad_norm": 1.0625, "learning_rate": 0.0003470812800827993, "loss": 4.7158, "mean_token_accuracy": 0.24588777869939804, "num_tokens": 93167640.0, "step": 40680 }, { "entropy": 5.294595861434937, "epoch": 4.021846579675761, "grad_norm": 1.0546875, "learning_rate": 0.0003470478491565323, "loss": 4.7144, "mean_token_accuracy": 0.24113523364067077, "num_tokens": 93179088.0, "step": 40685 }, { "entropy": 5.353123569488526, "epoch": 4.022340846184263, "grad_norm": 1.0546875, "learning_rate": 0.00034701441645787706, "loss": 4.8109, "mean_token_accuracy": 0.24048725366592408, "num_tokens": 93190345.0, "step": 40690 }, { "entropy": 5.358305311203003, "epoch": 4.022835112692764, "grad_norm": 1.0859375, "learning_rate": 0.0003469809819876561, "loss": 4.8087, "mean_token_accuracy": 0.22774050235748292, "num_tokens": 93201206.0, "step": 40695 }, { "entropy": 5.298151302337646, "epoch": 4.023329379201265, "grad_norm": 0.9765625, "learning_rate": 0.00034694754574669166, "loss": 4.7219, "mean_token_accuracy": 0.241067473590374, "num_tokens": 93212204.0, "step": 40700 }, { "entropy": 5.311906623840332, "epoch": 4.023823645709767, "grad_norm": 1.0546875, "learning_rate": 0.00034691410773580653, "loss": 4.7088, "mean_token_accuracy": 0.24335103929042817, "num_tokens": 93224530.0, "step": 40705 }, { "entropy": 5.355059289932251, "epoch": 4.024317912218268, "grad_norm": 1.078125, "learning_rate": 0.0003468806679558231, "loss": 4.7936, "mean_token_accuracy": 0.24239301234483718, "num_tokens": 93237403.0, "step": 40710 }, { "entropy": 5.350390434265137, "epoch": 4.024812178726769, "grad_norm": 1.0546875, "learning_rate": 0.00034684722640756415, "loss": 4.7799, "mean_token_accuracy": 0.2403684139251709, "num_tokens": 93249168.0, "step": 40715 }, { "entropy": 5.300939273834229, "epoch": 4.0253064452352705, "grad_norm": 1.109375, "learning_rate": 0.0003468137830918523, "loss": 4.7889, "mean_token_accuracy": 0.23439410477876663, "num_tokens": 93260050.0, "step": 40720 }, { "entropy": 5.32436170578003, "epoch": 4.025800711743773, "grad_norm": 0.94140625, "learning_rate": 0.0003467803380095102, "loss": 4.784, "mean_token_accuracy": 0.23613336235284804, "num_tokens": 93272514.0, "step": 40725 }, { "entropy": 5.326321458816528, "epoch": 4.026294978252274, "grad_norm": 0.98046875, "learning_rate": 0.00034674689116136073, "loss": 4.8134, "mean_token_accuracy": 0.23655072450637818, "num_tokens": 93283824.0, "step": 40730 }, { "entropy": 5.336786937713623, "epoch": 4.026789244760775, "grad_norm": 1.015625, "learning_rate": 0.00034671344254822654, "loss": 4.7565, "mean_token_accuracy": 0.24122773110866547, "num_tokens": 93294864.0, "step": 40735 }, { "entropy": 5.334187984466553, "epoch": 4.027283511269276, "grad_norm": 1.0390625, "learning_rate": 0.00034667999217093056, "loss": 4.8595, "mean_token_accuracy": 0.23487420082092286, "num_tokens": 93306166.0, "step": 40740 }, { "entropy": 5.339128065109253, "epoch": 4.027777777777778, "grad_norm": 0.97265625, "learning_rate": 0.0003466465400302956, "loss": 4.8719, "mean_token_accuracy": 0.22829228192567824, "num_tokens": 93318622.0, "step": 40745 }, { "entropy": 5.297981882095337, "epoch": 4.028272044286279, "grad_norm": 1.0625, "learning_rate": 0.0003466130861271447, "loss": 4.7419, "mean_token_accuracy": 0.24814711809158324, "num_tokens": 93330487.0, "step": 40750 }, { "entropy": 5.390638303756714, "epoch": 4.02876631079478, "grad_norm": 1.0625, "learning_rate": 0.0003465796304623007, "loss": 4.8787, "mean_token_accuracy": 0.22416745871305466, "num_tokens": 93342639.0, "step": 40755 }, { "entropy": 5.317140197753906, "epoch": 4.029260577303282, "grad_norm": 0.96875, "learning_rate": 0.0003465461730365868, "loss": 4.7445, "mean_token_accuracy": 0.23992759138345718, "num_tokens": 93355696.0, "step": 40760 }, { "entropy": 5.34321141242981, "epoch": 4.029754843811784, "grad_norm": 1.0234375, "learning_rate": 0.0003465127138508259, "loss": 4.7712, "mean_token_accuracy": 0.23352866917848586, "num_tokens": 93367913.0, "step": 40765 }, { "entropy": 5.331715250015259, "epoch": 4.030249110320285, "grad_norm": 1.0859375, "learning_rate": 0.00034647925290584114, "loss": 4.8055, "mean_token_accuracy": 0.23541221618652344, "num_tokens": 93378872.0, "step": 40770 }, { "entropy": 5.341114950180054, "epoch": 4.030743376828786, "grad_norm": 1.0625, "learning_rate": 0.0003464457902024556, "loss": 4.8036, "mean_token_accuracy": 0.23877628594636918, "num_tokens": 93390029.0, "step": 40775 }, { "entropy": 5.353989458084106, "epoch": 4.031237643337287, "grad_norm": 1.0, "learning_rate": 0.00034641232574149263, "loss": 4.7992, "mean_token_accuracy": 0.23531924337148666, "num_tokens": 93401518.0, "step": 40780 }, { "entropy": 5.3427599430084225, "epoch": 4.031731909845789, "grad_norm": 1.1328125, "learning_rate": 0.0003463788595237753, "loss": 4.7184, "mean_token_accuracy": 0.2395166963338852, "num_tokens": 93412399.0, "step": 40785 }, { "entropy": 5.356636095046997, "epoch": 4.03222617635429, "grad_norm": 1.046875, "learning_rate": 0.00034634539155012703, "loss": 4.826, "mean_token_accuracy": 0.22923811823129653, "num_tokens": 93423815.0, "step": 40790 }, { "entropy": 5.364684295654297, "epoch": 4.032720442862791, "grad_norm": 1.0, "learning_rate": 0.000346311921821371, "loss": 4.7806, "mean_token_accuracy": 0.23521196097135544, "num_tokens": 93434635.0, "step": 40795 }, { "entropy": 5.339227867126465, "epoch": 4.033214709371293, "grad_norm": 1.0625, "learning_rate": 0.00034627845033833053, "loss": 4.8172, "mean_token_accuracy": 0.23494058847427368, "num_tokens": 93445138.0, "step": 40800 }, { "entropy": 5.3601902484893795, "epoch": 4.033708975879795, "grad_norm": 1.03125, "learning_rate": 0.0003462449771018293, "loss": 4.8069, "mean_token_accuracy": 0.23784373104572296, "num_tokens": 93456249.0, "step": 40805 }, { "entropy": 5.396612930297851, "epoch": 4.034203242388296, "grad_norm": 0.98046875, "learning_rate": 0.0003462115021126906, "loss": 4.8437, "mean_token_accuracy": 0.23043204993009567, "num_tokens": 93468576.0, "step": 40810 }, { "entropy": 5.338978385925293, "epoch": 4.034697508896797, "grad_norm": 1.078125, "learning_rate": 0.0003461780253717378, "loss": 4.7675, "mean_token_accuracy": 0.23563183695077897, "num_tokens": 93479643.0, "step": 40815 }, { "entropy": 5.323619079589844, "epoch": 4.035191775405298, "grad_norm": 1.0390625, "learning_rate": 0.0003461445468797946, "loss": 4.7428, "mean_token_accuracy": 0.24191125929355622, "num_tokens": 93490619.0, "step": 40820 }, { "entropy": 5.265968370437622, "epoch": 4.0356860419138, "grad_norm": 1.015625, "learning_rate": 0.00034611106663768443, "loss": 4.7136, "mean_token_accuracy": 0.23828792273998262, "num_tokens": 93501763.0, "step": 40825 }, { "entropy": 5.277312612533569, "epoch": 4.036180308422301, "grad_norm": 1.0546875, "learning_rate": 0.000346077584646231, "loss": 4.6961, "mean_token_accuracy": 0.2397167205810547, "num_tokens": 93513851.0, "step": 40830 }, { "entropy": 5.268322420120239, "epoch": 4.036674574930803, "grad_norm": 1.0703125, "learning_rate": 0.00034604410090625795, "loss": 4.8103, "mean_token_accuracy": 0.23547207117080687, "num_tokens": 93525049.0, "step": 40835 }, { "entropy": 5.33333044052124, "epoch": 4.037168841439304, "grad_norm": 1.03125, "learning_rate": 0.0003460106154185891, "loss": 4.7831, "mean_token_accuracy": 0.24052630811929704, "num_tokens": 93537068.0, "step": 40840 }, { "entropy": 5.365639019012451, "epoch": 4.037663107947806, "grad_norm": 0.99609375, "learning_rate": 0.00034597712818404793, "loss": 4.773, "mean_token_accuracy": 0.24563219845294954, "num_tokens": 93548787.0, "step": 40845 }, { "entropy": 5.301506280899048, "epoch": 4.038157374456307, "grad_norm": 1.0625, "learning_rate": 0.0003459436392034585, "loss": 4.7787, "mean_token_accuracy": 0.24404914677143097, "num_tokens": 93559781.0, "step": 40850 }, { "entropy": 5.311756658554077, "epoch": 4.038651640964808, "grad_norm": 1.046875, "learning_rate": 0.00034591014847764457, "loss": 4.7783, "mean_token_accuracy": 0.23403863608837128, "num_tokens": 93570775.0, "step": 40855 }, { "entropy": 5.338885736465454, "epoch": 4.039145907473309, "grad_norm": 1.2109375, "learning_rate": 0.0003458766560074299, "loss": 4.7384, "mean_token_accuracy": 0.24406493604183196, "num_tokens": 93581222.0, "step": 40860 }, { "entropy": 5.371444988250732, "epoch": 4.039640173981811, "grad_norm": 1.0, "learning_rate": 0.0003458431617936386, "loss": 4.8322, "mean_token_accuracy": 0.22542924731969832, "num_tokens": 93592071.0, "step": 40865 }, { "entropy": 5.323893213272095, "epoch": 4.040134440490313, "grad_norm": 1.1015625, "learning_rate": 0.0003458096658370944, "loss": 4.8106, "mean_token_accuracy": 0.2344515085220337, "num_tokens": 93603570.0, "step": 40870 }, { "entropy": 5.35434045791626, "epoch": 4.040628706998814, "grad_norm": 1.0546875, "learning_rate": 0.0003457761681386215, "loss": 4.7889, "mean_token_accuracy": 0.2351144313812256, "num_tokens": 93614552.0, "step": 40875 }, { "entropy": 5.372851467132568, "epoch": 4.041122973507315, "grad_norm": 1.1171875, "learning_rate": 0.0003457426686990439, "loss": 4.8027, "mean_token_accuracy": 0.24737192690372467, "num_tokens": 93625593.0, "step": 40880 }, { "entropy": 5.3115888118743895, "epoch": 4.041617240015817, "grad_norm": 1.109375, "learning_rate": 0.0003457091675191857, "loss": 4.7877, "mean_token_accuracy": 0.24268886148929597, "num_tokens": 93635420.0, "step": 40885 }, { "entropy": 5.327992963790893, "epoch": 4.042111506524318, "grad_norm": 1.0390625, "learning_rate": 0.000345675664599871, "loss": 4.7386, "mean_token_accuracy": 0.24171728193759917, "num_tokens": 93647458.0, "step": 40890 }, { "entropy": 5.330284643173218, "epoch": 4.042605773032819, "grad_norm": 1.03125, "learning_rate": 0.0003456421599419239, "loss": 4.7507, "mean_token_accuracy": 0.23328316658735276, "num_tokens": 93658867.0, "step": 40895 }, { "entropy": 5.362849235534668, "epoch": 4.04310003954132, "grad_norm": 1.078125, "learning_rate": 0.00034560865354616875, "loss": 4.8229, "mean_token_accuracy": 0.2319914862513542, "num_tokens": 93670391.0, "step": 40900 }, { "entropy": 5.305878067016602, "epoch": 4.0435943060498225, "grad_norm": 0.97265625, "learning_rate": 0.0003455751454134298, "loss": 4.7567, "mean_token_accuracy": 0.23869061917066575, "num_tokens": 93681670.0, "step": 40905 }, { "entropy": 5.3114197731018065, "epoch": 4.044088572558324, "grad_norm": 1.09375, "learning_rate": 0.0003455416355445313, "loss": 4.7517, "mean_token_accuracy": 0.23130689114332198, "num_tokens": 93692529.0, "step": 40910 }, { "entropy": 5.363271045684814, "epoch": 4.044582839066825, "grad_norm": 0.9765625, "learning_rate": 0.00034550812394029765, "loss": 4.7695, "mean_token_accuracy": 0.2334127902984619, "num_tokens": 93704259.0, "step": 40915 }, { "entropy": 5.277552604675293, "epoch": 4.045077105575326, "grad_norm": 1.03125, "learning_rate": 0.00034547461060155317, "loss": 4.7758, "mean_token_accuracy": 0.2358102858066559, "num_tokens": 93715832.0, "step": 40920 }, { "entropy": 5.3416839122772215, "epoch": 4.0455713720838276, "grad_norm": 1.0390625, "learning_rate": 0.0003454410955291224, "loss": 4.8057, "mean_token_accuracy": 0.23060721904039383, "num_tokens": 93728022.0, "step": 40925 }, { "entropy": 5.37052698135376, "epoch": 4.046065638592329, "grad_norm": 1.0625, "learning_rate": 0.00034540757872382965, "loss": 4.77, "mean_token_accuracy": 0.24147921204566955, "num_tokens": 93739445.0, "step": 40930 }, { "entropy": 5.231707048416138, "epoch": 4.04655990510083, "grad_norm": 0.94921875, "learning_rate": 0.0003453740601864997, "loss": 4.741, "mean_token_accuracy": 0.244822259247303, "num_tokens": 93752132.0, "step": 40935 }, { "entropy": 5.3304205417633055, "epoch": 4.047054171609331, "grad_norm": 0.93359375, "learning_rate": 0.00034534053991795683, "loss": 4.8248, "mean_token_accuracy": 0.23038806319236754, "num_tokens": 93763346.0, "step": 40940 }, { "entropy": 5.378659915924072, "epoch": 4.0475484381178335, "grad_norm": 1.0703125, "learning_rate": 0.00034530701791902574, "loss": 4.8265, "mean_token_accuracy": 0.23173937499523162, "num_tokens": 93775877.0, "step": 40945 }, { "entropy": 5.349325799942017, "epoch": 4.048042704626335, "grad_norm": 0.94140625, "learning_rate": 0.00034527349419053116, "loss": 4.8304, "mean_token_accuracy": 0.2332194820046425, "num_tokens": 93788741.0, "step": 40950 }, { "entropy": 5.3343277931213375, "epoch": 4.048536971134836, "grad_norm": 0.99609375, "learning_rate": 0.0003452399687332978, "loss": 4.8044, "mean_token_accuracy": 0.23698555529117585, "num_tokens": 93798865.0, "step": 40955 }, { "entropy": 5.365371513366699, "epoch": 4.049031237643337, "grad_norm": 1.1015625, "learning_rate": 0.0003452064415481502, "loss": 4.8027, "mean_token_accuracy": 0.24177295416593553, "num_tokens": 93810131.0, "step": 40960 }, { "entropy": 5.295240688323974, "epoch": 4.0495255041518385, "grad_norm": 0.9921875, "learning_rate": 0.0003451729126359132, "loss": 4.7883, "mean_token_accuracy": 0.2369248777627945, "num_tokens": 93821696.0, "step": 40965 }, { "entropy": 5.361817979812622, "epoch": 4.05001977066034, "grad_norm": 1.0234375, "learning_rate": 0.0003451393819974118, "loss": 4.818, "mean_token_accuracy": 0.23278516978025438, "num_tokens": 93833297.0, "step": 40970 }, { "entropy": 5.337248611450195, "epoch": 4.050514037168841, "grad_norm": 1.015625, "learning_rate": 0.00034510584963347063, "loss": 4.8168, "mean_token_accuracy": 0.23718780875205994, "num_tokens": 93844573.0, "step": 40975 }, { "entropy": 5.386278057098389, "epoch": 4.051008303677343, "grad_norm": 1.078125, "learning_rate": 0.0003450723155449148, "loss": 4.7954, "mean_token_accuracy": 0.23425594270229338, "num_tokens": 93856542.0, "step": 40980 }, { "entropy": 5.321901512145996, "epoch": 4.0515025701858445, "grad_norm": 1.015625, "learning_rate": 0.000345038779732569, "loss": 4.7725, "mean_token_accuracy": 0.22716933190822602, "num_tokens": 93868750.0, "step": 40985 }, { "entropy": 5.3032666683197025, "epoch": 4.051996836694346, "grad_norm": 1.0625, "learning_rate": 0.0003450052421972583, "loss": 4.7552, "mean_token_accuracy": 0.24104494154453276, "num_tokens": 93879506.0, "step": 40990 }, { "entropy": 5.2990100383758545, "epoch": 4.052491103202847, "grad_norm": 1.09375, "learning_rate": 0.00034497170293980794, "loss": 4.7507, "mean_token_accuracy": 0.2359050616621971, "num_tokens": 93890068.0, "step": 40995 }, { "entropy": 5.333014822006225, "epoch": 4.052985369711348, "grad_norm": 0.9609375, "learning_rate": 0.0003449381619610428, "loss": 4.8722, "mean_token_accuracy": 0.22975541651248932, "num_tokens": 93902869.0, "step": 41000 }, { "entropy": 5.396384334564209, "epoch": 4.0534796362198495, "grad_norm": 0.9453125, "learning_rate": 0.00034490461926178794, "loss": 4.8453, "mean_token_accuracy": 0.2319128543138504, "num_tokens": 93915403.0, "step": 41005 }, { "entropy": 5.351936721801758, "epoch": 4.053973902728351, "grad_norm": 1.0546875, "learning_rate": 0.00034487107484286873, "loss": 4.7527, "mean_token_accuracy": 0.24144677221775054, "num_tokens": 93926616.0, "step": 41010 }, { "entropy": 5.344962072372437, "epoch": 4.054468169236853, "grad_norm": 1.0390625, "learning_rate": 0.00034483752870511015, "loss": 4.7441, "mean_token_accuracy": 0.23593956530094146, "num_tokens": 93938840.0, "step": 41015 }, { "entropy": 5.315841245651245, "epoch": 4.054962435745354, "grad_norm": 1.0625, "learning_rate": 0.0003448039808493375, "loss": 4.7974, "mean_token_accuracy": 0.23689198046922683, "num_tokens": 93951294.0, "step": 41020 }, { "entropy": 5.299281740188599, "epoch": 4.0554567022538555, "grad_norm": 1.03125, "learning_rate": 0.0003447704312763762, "loss": 4.7775, "mean_token_accuracy": 0.23499729633331298, "num_tokens": 93962596.0, "step": 41025 }, { "entropy": 5.401890611648559, "epoch": 4.055950968762357, "grad_norm": 1.0078125, "learning_rate": 0.00034473687998705144, "loss": 4.8508, "mean_token_accuracy": 0.22779292464256287, "num_tokens": 93973699.0, "step": 41030 }, { "entropy": 5.332564401626587, "epoch": 4.056445235270858, "grad_norm": 1.0390625, "learning_rate": 0.00034470332698218853, "loss": 4.7544, "mean_token_accuracy": 0.23318400084972382, "num_tokens": 93984711.0, "step": 41035 }, { "entropy": 5.35316219329834, "epoch": 4.056939501779359, "grad_norm": 1.015625, "learning_rate": 0.00034466977226261305, "loss": 4.9074, "mean_token_accuracy": 0.22757416516542434, "num_tokens": 93996217.0, "step": 41040 }, { "entropy": 5.3205324649810795, "epoch": 4.0574337682878605, "grad_norm": 1.046875, "learning_rate": 0.0003446362158291503, "loss": 4.7996, "mean_token_accuracy": 0.23246342986822127, "num_tokens": 94007738.0, "step": 41045 }, { "entropy": 5.345628452301026, "epoch": 4.057928034796362, "grad_norm": 1.0625, "learning_rate": 0.0003446026576826258, "loss": 4.7859, "mean_token_accuracy": 0.23386438339948654, "num_tokens": 94018473.0, "step": 41050 }, { "entropy": 5.350277042388916, "epoch": 4.058422301304864, "grad_norm": 1.0546875, "learning_rate": 0.0003445690978238653, "loss": 4.8425, "mean_token_accuracy": 0.23149924576282502, "num_tokens": 94029461.0, "step": 41055 }, { "entropy": 5.325476551055909, "epoch": 4.058916567813365, "grad_norm": 1.03125, "learning_rate": 0.00034453553625369405, "loss": 4.8341, "mean_token_accuracy": 0.23513286113739013, "num_tokens": 94042399.0, "step": 41060 }, { "entropy": 5.404037427902222, "epoch": 4.0594108343218664, "grad_norm": 0.984375, "learning_rate": 0.00034450197297293783, "loss": 4.7655, "mean_token_accuracy": 0.2349960058927536, "num_tokens": 94054694.0, "step": 41065 }, { "entropy": 5.347100257873535, "epoch": 4.059905100830368, "grad_norm": 1.0546875, "learning_rate": 0.0003444684079824223, "loss": 4.8101, "mean_token_accuracy": 0.23461164087057113, "num_tokens": 94065426.0, "step": 41070 }, { "entropy": 5.283083963394165, "epoch": 4.060399367338869, "grad_norm": 1.0546875, "learning_rate": 0.00034443484128297326, "loss": 4.6988, "mean_token_accuracy": 0.24032177478075029, "num_tokens": 94078119.0, "step": 41075 }, { "entropy": 5.288095140457154, "epoch": 4.06089363384737, "grad_norm": 1.21875, "learning_rate": 0.0003444012728754162, "loss": 4.7749, "mean_token_accuracy": 0.23684295564889907, "num_tokens": 94089157.0, "step": 41080 }, { "entropy": 5.30208306312561, "epoch": 4.0613879003558715, "grad_norm": 1.0, "learning_rate": 0.00034436770276057715, "loss": 4.7691, "mean_token_accuracy": 0.2322230964899063, "num_tokens": 94101534.0, "step": 41085 }, { "entropy": 5.314623880386352, "epoch": 4.061882166864374, "grad_norm": 1.015625, "learning_rate": 0.0003443341309392818, "loss": 4.8179, "mean_token_accuracy": 0.2266111344099045, "num_tokens": 94113310.0, "step": 41090 }, { "entropy": 5.320668458938599, "epoch": 4.062376433372875, "grad_norm": 0.9765625, "learning_rate": 0.00034430055741235615, "loss": 4.7511, "mean_token_accuracy": 0.2382815659046173, "num_tokens": 94124189.0, "step": 41095 }, { "entropy": 5.3298393249511715, "epoch": 4.062870699881376, "grad_norm": 1.0234375, "learning_rate": 0.00034426698218062603, "loss": 4.7421, "mean_token_accuracy": 0.24028319865465164, "num_tokens": 94135458.0, "step": 41100 }, { "entropy": 5.261276531219482, "epoch": 4.063364966389877, "grad_norm": 1.09375, "learning_rate": 0.00034423340524491737, "loss": 4.7758, "mean_token_accuracy": 0.23798420280218124, "num_tokens": 94146270.0, "step": 41105 }, { "entropy": 5.340866804122925, "epoch": 4.063859232898379, "grad_norm": 0.984375, "learning_rate": 0.0003441998266060561, "loss": 4.7502, "mean_token_accuracy": 0.24156956225633622, "num_tokens": 94157814.0, "step": 41110 }, { "entropy": 5.407472467422485, "epoch": 4.06435349940688, "grad_norm": 1.0703125, "learning_rate": 0.00034416624626486855, "loss": 4.8358, "mean_token_accuracy": 0.2410178005695343, "num_tokens": 94170424.0, "step": 41115 }, { "entropy": 5.370017957687378, "epoch": 4.064847765915381, "grad_norm": 0.97265625, "learning_rate": 0.0003441326642221805, "loss": 4.7873, "mean_token_accuracy": 0.23456022292375564, "num_tokens": 94181913.0, "step": 41120 }, { "entropy": 5.247804069519043, "epoch": 4.065342032423883, "grad_norm": 1.015625, "learning_rate": 0.0003440990804788182, "loss": 4.7796, "mean_token_accuracy": 0.2345325008034706, "num_tokens": 94193370.0, "step": 41125 }, { "entropy": 5.283896589279175, "epoch": 4.065836298932385, "grad_norm": 1.0, "learning_rate": 0.0003440654950356078, "loss": 4.7029, "mean_token_accuracy": 0.24131494015455246, "num_tokens": 94204176.0, "step": 41130 }, { "entropy": 5.3638018608093265, "epoch": 4.066330565440886, "grad_norm": 1.046875, "learning_rate": 0.00034403190789337546, "loss": 4.8157, "mean_token_accuracy": 0.23674567192792892, "num_tokens": 94214355.0, "step": 41135 }, { "entropy": 5.322928762435913, "epoch": 4.066824831949387, "grad_norm": 1.140625, "learning_rate": 0.0003439983190529476, "loss": 4.8426, "mean_token_accuracy": 0.23158618807792664, "num_tokens": 94226248.0, "step": 41140 }, { "entropy": 5.340381479263305, "epoch": 4.067319098457888, "grad_norm": 1.078125, "learning_rate": 0.0003439647285151503, "loss": 4.7371, "mean_token_accuracy": 0.24212750792503357, "num_tokens": 94236847.0, "step": 41145 }, { "entropy": 5.346883106231689, "epoch": 4.06781336496639, "grad_norm": 1.0078125, "learning_rate": 0.00034393113628080994, "loss": 4.8184, "mean_token_accuracy": 0.23063847571611404, "num_tokens": 94248387.0, "step": 41150 }, { "entropy": 5.327528047561645, "epoch": 4.068307631474891, "grad_norm": 1.0546875, "learning_rate": 0.00034389754235075303, "loss": 4.7473, "mean_token_accuracy": 0.2426051214337349, "num_tokens": 94259069.0, "step": 41155 }, { "entropy": 5.31607460975647, "epoch": 4.068801897983393, "grad_norm": 1.078125, "learning_rate": 0.00034386394672580585, "loss": 4.7373, "mean_token_accuracy": 0.24334619343280792, "num_tokens": 94270390.0, "step": 41160 }, { "entropy": 5.334020709991455, "epoch": 4.069296164491894, "grad_norm": 1.1171875, "learning_rate": 0.0003438303494067949, "loss": 4.8319, "mean_token_accuracy": 0.23495843410491943, "num_tokens": 94281712.0, "step": 41165 }, { "entropy": 5.296165513992309, "epoch": 4.069790431000396, "grad_norm": 0.98046875, "learning_rate": 0.0003437967503945467, "loss": 4.7484, "mean_token_accuracy": 0.24332232922315597, "num_tokens": 94292277.0, "step": 41170 }, { "entropy": 5.335902404785156, "epoch": 4.070284697508897, "grad_norm": 1.0390625, "learning_rate": 0.00034376314968988773, "loss": 4.8575, "mean_token_accuracy": 0.22728285938501358, "num_tokens": 94303276.0, "step": 41175 }, { "entropy": 5.296884346008301, "epoch": 4.070778964017398, "grad_norm": 1.1640625, "learning_rate": 0.00034372954729364457, "loss": 4.7107, "mean_token_accuracy": 0.24681790322065353, "num_tokens": 94313692.0, "step": 41180 }, { "entropy": 5.36692590713501, "epoch": 4.071273230525899, "grad_norm": 1.046875, "learning_rate": 0.000343695943206644, "loss": 4.7922, "mean_token_accuracy": 0.2390448734164238, "num_tokens": 94326859.0, "step": 41185 }, { "entropy": 5.37627534866333, "epoch": 4.071767497034401, "grad_norm": 1.046875, "learning_rate": 0.0003436623374297125, "loss": 4.8444, "mean_token_accuracy": 0.23296325355768205, "num_tokens": 94339417.0, "step": 41190 }, { "entropy": 5.412415266036987, "epoch": 4.072261763542902, "grad_norm": 1.09375, "learning_rate": 0.0003436287299636768, "loss": 4.8843, "mean_token_accuracy": 0.22795470654964448, "num_tokens": 94351462.0, "step": 41195 }, { "entropy": 5.3033623695373535, "epoch": 4.072756030051404, "grad_norm": 1.1171875, "learning_rate": 0.0003435951208093638, "loss": 4.735, "mean_token_accuracy": 0.23657696843147277, "num_tokens": 94362455.0, "step": 41200 }, { "entropy": 5.279903554916382, "epoch": 4.073250296559905, "grad_norm": 1.1171875, "learning_rate": 0.0003435615099676001, "loss": 4.7695, "mean_token_accuracy": 0.2364173486828804, "num_tokens": 94373005.0, "step": 41205 }, { "entropy": 5.333450841903686, "epoch": 4.073744563068407, "grad_norm": 1.015625, "learning_rate": 0.0003435278974392126, "loss": 4.7769, "mean_token_accuracy": 0.2449967309832573, "num_tokens": 94385619.0, "step": 41210 }, { "entropy": 5.389485120773315, "epoch": 4.074238829576908, "grad_norm": 1.0625, "learning_rate": 0.0003434942832250283, "loss": 4.8114, "mean_token_accuracy": 0.2355737119913101, "num_tokens": 94397281.0, "step": 41215 }, { "entropy": 5.329785346984863, "epoch": 4.074733096085409, "grad_norm": 1.1796875, "learning_rate": 0.00034346066732587394, "loss": 4.8292, "mean_token_accuracy": 0.23391690850257874, "num_tokens": 94408222.0, "step": 41220 }, { "entropy": 5.335302209854126, "epoch": 4.07522736259391, "grad_norm": 1.109375, "learning_rate": 0.00034342704974257653, "loss": 4.8375, "mean_token_accuracy": 0.23663181960582733, "num_tokens": 94419540.0, "step": 41225 }, { "entropy": 5.323643779754638, "epoch": 4.075721629102412, "grad_norm": 1.1953125, "learning_rate": 0.0003433934304759631, "loss": 4.7882, "mean_token_accuracy": 0.23668063730001448, "num_tokens": 94431372.0, "step": 41230 }, { "entropy": 5.354653215408325, "epoch": 4.076215895610914, "grad_norm": 1.0859375, "learning_rate": 0.00034335980952686064, "loss": 4.7277, "mean_token_accuracy": 0.24100696742534639, "num_tokens": 94441922.0, "step": 41235 }, { "entropy": 5.252225399017334, "epoch": 4.076710162119415, "grad_norm": 1.0390625, "learning_rate": 0.0003433261868960964, "loss": 4.6738, "mean_token_accuracy": 0.24321702420711516, "num_tokens": 94453031.0, "step": 41240 }, { "entropy": 5.355708932876587, "epoch": 4.077204428627916, "grad_norm": 1.1171875, "learning_rate": 0.00034329256258449725, "loss": 4.842, "mean_token_accuracy": 0.2291879341006279, "num_tokens": 94463952.0, "step": 41245 }, { "entropy": 5.363630485534668, "epoch": 4.077698695136418, "grad_norm": 1.140625, "learning_rate": 0.0003432589365928904, "loss": 4.7818, "mean_token_accuracy": 0.23306504338979722, "num_tokens": 94474811.0, "step": 41250 }, { "entropy": 5.285136365890503, "epoch": 4.078192961644919, "grad_norm": 1.0546875, "learning_rate": 0.00034322530892210324, "loss": 4.7414, "mean_token_accuracy": 0.2343598261475563, "num_tokens": 94485901.0, "step": 41255 }, { "entropy": 5.293406534194946, "epoch": 4.07868722815342, "grad_norm": 0.96484375, "learning_rate": 0.0003431916795729628, "loss": 4.7905, "mean_token_accuracy": 0.23894161432981492, "num_tokens": 94498147.0, "step": 41260 }, { "entropy": 5.318519449234008, "epoch": 4.079181494661921, "grad_norm": 1.046875, "learning_rate": 0.0003431580485462966, "loss": 4.7351, "mean_token_accuracy": 0.23720674067735673, "num_tokens": 94510787.0, "step": 41265 }, { "entropy": 5.310748863220215, "epoch": 4.0796757611704235, "grad_norm": 1.0390625, "learning_rate": 0.0003431244158429317, "loss": 4.8746, "mean_token_accuracy": 0.22546374499797822, "num_tokens": 94523459.0, "step": 41270 }, { "entropy": 5.318791007995605, "epoch": 4.080170027678925, "grad_norm": 1.1328125, "learning_rate": 0.00034309078146369567, "loss": 4.7794, "mean_token_accuracy": 0.23820801079273224, "num_tokens": 94534579.0, "step": 41275 }, { "entropy": 5.436222982406616, "epoch": 4.080664294187426, "grad_norm": 1.09375, "learning_rate": 0.0003430571454094158, "loss": 4.8675, "mean_token_accuracy": 0.23007042557001114, "num_tokens": 94545233.0, "step": 41280 }, { "entropy": 5.389164161682129, "epoch": 4.081158560695927, "grad_norm": 1.1015625, "learning_rate": 0.00034302350768091963, "loss": 4.8119, "mean_token_accuracy": 0.23482560366392136, "num_tokens": 94555189.0, "step": 41285 }, { "entropy": 5.423567438125611, "epoch": 4.081652827204429, "grad_norm": 1.125, "learning_rate": 0.00034298986827903464, "loss": 4.8447, "mean_token_accuracy": 0.22795448154211045, "num_tokens": 94566001.0, "step": 41290 }, { "entropy": 5.2105471134185795, "epoch": 4.08214709371293, "grad_norm": 0.98828125, "learning_rate": 0.0003429562272045883, "loss": 4.7017, "mean_token_accuracy": 0.24639315158128738, "num_tokens": 94577578.0, "step": 41295 }, { "entropy": 5.292587184906006, "epoch": 4.082641360221431, "grad_norm": 1.0390625, "learning_rate": 0.00034292258445840816, "loss": 4.7043, "mean_token_accuracy": 0.24601498991250992, "num_tokens": 94589162.0, "step": 41300 }, { "entropy": 5.386844539642334, "epoch": 4.083135626729932, "grad_norm": 1.0546875, "learning_rate": 0.00034288894004132203, "loss": 4.8931, "mean_token_accuracy": 0.2265755131840706, "num_tokens": 94601883.0, "step": 41305 }, { "entropy": 5.354817724227905, "epoch": 4.0836298932384345, "grad_norm": 1.0546875, "learning_rate": 0.00034285529395415744, "loss": 4.8201, "mean_token_accuracy": 0.23125199228525162, "num_tokens": 94612944.0, "step": 41310 }, { "entropy": 5.314499139785767, "epoch": 4.084124159746936, "grad_norm": 1.1796875, "learning_rate": 0.000342821646197742, "loss": 4.7633, "mean_token_accuracy": 0.23888029158115387, "num_tokens": 94624042.0, "step": 41315 }, { "entropy": 5.265916013717652, "epoch": 4.084618426255437, "grad_norm": 1.0546875, "learning_rate": 0.00034278799677290363, "loss": 4.7191, "mean_token_accuracy": 0.2444293037056923, "num_tokens": 94635149.0, "step": 41320 }, { "entropy": 5.2728852272033695, "epoch": 4.085112692763938, "grad_norm": 1.1171875, "learning_rate": 0.00034275434568047, "loss": 4.78, "mean_token_accuracy": 0.23991936445236206, "num_tokens": 94646586.0, "step": 41325 }, { "entropy": 5.290728807449341, "epoch": 4.0856069592724396, "grad_norm": 1.03125, "learning_rate": 0.0003427206929212689, "loss": 4.8609, "mean_token_accuracy": 0.22712045460939406, "num_tokens": 94658602.0, "step": 41330 }, { "entropy": 5.354510068893433, "epoch": 4.086101225780941, "grad_norm": 1.0859375, "learning_rate": 0.0003426870384961283, "loss": 4.7767, "mean_token_accuracy": 0.23248463720083237, "num_tokens": 94668472.0, "step": 41335 }, { "entropy": 5.388646459579467, "epoch": 4.086595492289442, "grad_norm": 1.0078125, "learning_rate": 0.000342653382405876, "loss": 4.7808, "mean_token_accuracy": 0.23665909469127655, "num_tokens": 94679397.0, "step": 41340 }, { "entropy": 5.406352949142456, "epoch": 4.087089758797944, "grad_norm": 1.0078125, "learning_rate": 0.0003426197246513401, "loss": 4.8513, "mean_token_accuracy": 0.2328798934817314, "num_tokens": 94690770.0, "step": 41345 }, { "entropy": 5.319546031951904, "epoch": 4.0875840253064455, "grad_norm": 1.03125, "learning_rate": 0.00034258606523334843, "loss": 4.7946, "mean_token_accuracy": 0.23560641407966615, "num_tokens": 94702426.0, "step": 41350 }, { "entropy": 5.251481533050537, "epoch": 4.088078291814947, "grad_norm": 1.2109375, "learning_rate": 0.00034255240415272906, "loss": 4.6764, "mean_token_accuracy": 0.24513724744319915, "num_tokens": 94713403.0, "step": 41355 }, { "entropy": 5.363135242462159, "epoch": 4.088572558323448, "grad_norm": 1.171875, "learning_rate": 0.0003425187414103101, "loss": 4.7987, "mean_token_accuracy": 0.23286383599042892, "num_tokens": 94724441.0, "step": 41360 }, { "entropy": 5.294834947586059, "epoch": 4.089066824831949, "grad_norm": 1.3359375, "learning_rate": 0.00034248507700691957, "loss": 4.8154, "mean_token_accuracy": 0.23463148921728133, "num_tokens": 94735048.0, "step": 41365 }, { "entropy": 5.398585557937622, "epoch": 4.0895610913404505, "grad_norm": 1.125, "learning_rate": 0.0003424514109433857, "loss": 4.8353, "mean_token_accuracy": 0.2326846167445183, "num_tokens": 94745435.0, "step": 41370 }, { "entropy": 5.303225326538086, "epoch": 4.090055357848952, "grad_norm": 1.0859375, "learning_rate": 0.0003424177432205366, "loss": 4.7434, "mean_token_accuracy": 0.23825249075889587, "num_tokens": 94756495.0, "step": 41375 }, { "entropy": 5.277566909790039, "epoch": 4.090549624357454, "grad_norm": 1.015625, "learning_rate": 0.0003423840738392007, "loss": 4.7709, "mean_token_accuracy": 0.235087114572525, "num_tokens": 94767876.0, "step": 41380 }, { "entropy": 5.352441072463989, "epoch": 4.091043890865955, "grad_norm": 1.1171875, "learning_rate": 0.000342350402800206, "loss": 4.7831, "mean_token_accuracy": 0.23277161419391632, "num_tokens": 94778855.0, "step": 41385 }, { "entropy": 5.378786087036133, "epoch": 4.0915381573744565, "grad_norm": 1.1171875, "learning_rate": 0.00034231673010438104, "loss": 4.7475, "mean_token_accuracy": 0.24009976536035538, "num_tokens": 94788433.0, "step": 41390 }, { "entropy": 5.205373620986938, "epoch": 4.092032423882958, "grad_norm": 1.015625, "learning_rate": 0.00034228305575255397, "loss": 4.6729, "mean_token_accuracy": 0.24963365644216537, "num_tokens": 94799630.0, "step": 41395 }, { "entropy": 5.280584716796875, "epoch": 4.092526690391459, "grad_norm": 0.9609375, "learning_rate": 0.00034224937974555334, "loss": 4.7048, "mean_token_accuracy": 0.23611417710781096, "num_tokens": 94811696.0, "step": 41400 }, { "entropy": 5.394282627105713, "epoch": 4.09302095689996, "grad_norm": 1.0625, "learning_rate": 0.00034221570208420755, "loss": 4.8403, "mean_token_accuracy": 0.23330367654561995, "num_tokens": 94822648.0, "step": 41405 }, { "entropy": 5.2985986232757565, "epoch": 4.0935152234084615, "grad_norm": 1.0234375, "learning_rate": 0.00034218202276934507, "loss": 4.7421, "mean_token_accuracy": 0.23539548218250275, "num_tokens": 94833690.0, "step": 41410 }, { "entropy": 5.235115194320679, "epoch": 4.094009489916964, "grad_norm": 0.99609375, "learning_rate": 0.0003421483418017944, "loss": 4.7151, "mean_token_accuracy": 0.24773516058921813, "num_tokens": 94843859.0, "step": 41415 }, { "entropy": 5.305673122406006, "epoch": 4.094503756425465, "grad_norm": 1.0546875, "learning_rate": 0.0003421146591823841, "loss": 4.7609, "mean_token_accuracy": 0.23842639476060867, "num_tokens": 94855156.0, "step": 41420 }, { "entropy": 5.397890710830689, "epoch": 4.094998022933966, "grad_norm": 1.1484375, "learning_rate": 0.0003420809749119427, "loss": 4.8731, "mean_token_accuracy": 0.226597560942173, "num_tokens": 94867082.0, "step": 41425 }, { "entropy": 5.294578313827515, "epoch": 4.0954922894424675, "grad_norm": 1.140625, "learning_rate": 0.0003420472889912991, "loss": 4.6947, "mean_token_accuracy": 0.24384544491767884, "num_tokens": 94877606.0, "step": 41430 }, { "entropy": 5.320827054977417, "epoch": 4.095986555950969, "grad_norm": 1.1640625, "learning_rate": 0.00034201360142128165, "loss": 4.7125, "mean_token_accuracy": 0.24692744612693787, "num_tokens": 94888114.0, "step": 41435 }, { "entropy": 5.265082120895386, "epoch": 4.09648082245947, "grad_norm": 1.0234375, "learning_rate": 0.0003419799122027192, "loss": 4.6958, "mean_token_accuracy": 0.24311646521091462, "num_tokens": 94900135.0, "step": 41440 }, { "entropy": 5.321168994903564, "epoch": 4.096975088967971, "grad_norm": 1.0390625, "learning_rate": 0.0003419462213364405, "loss": 4.7686, "mean_token_accuracy": 0.23880405128002166, "num_tokens": 94911444.0, "step": 41445 }, { "entropy": 5.283177232742309, "epoch": 4.0974693554764725, "grad_norm": 1.078125, "learning_rate": 0.0003419125288232745, "loss": 4.7516, "mean_token_accuracy": 0.23693655133247377, "num_tokens": 94923378.0, "step": 41450 }, { "entropy": 5.2659821033477785, "epoch": 4.097963621984975, "grad_norm": 1.0234375, "learning_rate": 0.0003418788346640498, "loss": 4.7176, "mean_token_accuracy": 0.23704862594604492, "num_tokens": 94933784.0, "step": 41455 }, { "entropy": 5.266560411453247, "epoch": 4.098457888493476, "grad_norm": 0.98046875, "learning_rate": 0.00034184513885959544, "loss": 4.7488, "mean_token_accuracy": 0.2332770049571991, "num_tokens": 94945814.0, "step": 41460 }, { "entropy": 5.321646118164063, "epoch": 4.098952155001977, "grad_norm": 0.94921875, "learning_rate": 0.00034181144141074023, "loss": 4.8127, "mean_token_accuracy": 0.23069051951169967, "num_tokens": 94957792.0, "step": 41465 }, { "entropy": 5.319583797454834, "epoch": 4.0994464215104784, "grad_norm": 1.0625, "learning_rate": 0.00034177774231831324, "loss": 4.7477, "mean_token_accuracy": 0.24011195749044417, "num_tokens": 94968524.0, "step": 41470 }, { "entropy": 5.3153712272644045, "epoch": 4.09994068801898, "grad_norm": 1.046875, "learning_rate": 0.00034174404158314345, "loss": 4.7977, "mean_token_accuracy": 0.23444986194372178, "num_tokens": 94979213.0, "step": 41475 }, { "entropy": 5.242700290679932, "epoch": 4.100434954527481, "grad_norm": 1.0078125, "learning_rate": 0.0003417103392060599, "loss": 4.7049, "mean_token_accuracy": 0.24497763216495513, "num_tokens": 94991068.0, "step": 41480 }, { "entropy": 5.315452527999878, "epoch": 4.100929221035982, "grad_norm": 1.1015625, "learning_rate": 0.00034167663518789156, "loss": 4.8117, "mean_token_accuracy": 0.23657665252685547, "num_tokens": 95001780.0, "step": 41485 }, { "entropy": 5.397996854782105, "epoch": 4.101423487544484, "grad_norm": 1.1875, "learning_rate": 0.0003416429295294677, "loss": 4.8568, "mean_token_accuracy": 0.22845108211040496, "num_tokens": 95013244.0, "step": 41490 }, { "entropy": 5.316025924682617, "epoch": 4.101917754052986, "grad_norm": 0.9921875, "learning_rate": 0.00034160922223161743, "loss": 4.7243, "mean_token_accuracy": 0.23837634176015854, "num_tokens": 95024103.0, "step": 41495 }, { "entropy": 5.262353038787841, "epoch": 4.102412020561487, "grad_norm": 1.09375, "learning_rate": 0.0003415755132951699, "loss": 4.7249, "mean_token_accuracy": 0.24809272587299347, "num_tokens": 95034132.0, "step": 41500 }, { "entropy": 5.2794637203216555, "epoch": 4.102906287069988, "grad_norm": 1.0078125, "learning_rate": 0.0003415418027209546, "loss": 4.7413, "mean_token_accuracy": 0.23743457794189454, "num_tokens": 95046735.0, "step": 41505 }, { "entropy": 5.291577577590942, "epoch": 4.103400553578489, "grad_norm": 1.09375, "learning_rate": 0.0003415080905098005, "loss": 4.7014, "mean_token_accuracy": 0.23994328826665878, "num_tokens": 95058538.0, "step": 41510 }, { "entropy": 5.30620551109314, "epoch": 4.103894820086991, "grad_norm": 1.015625, "learning_rate": 0.0003414743766625371, "loss": 4.7273, "mean_token_accuracy": 0.2405495449900627, "num_tokens": 95070049.0, "step": 41515 }, { "entropy": 5.284703350067138, "epoch": 4.104389086595492, "grad_norm": 1.0703125, "learning_rate": 0.00034144066117999366, "loss": 4.7912, "mean_token_accuracy": 0.2389552190899849, "num_tokens": 95081702.0, "step": 41520 }, { "entropy": 5.351805591583252, "epoch": 4.104883353103994, "grad_norm": 1.0546875, "learning_rate": 0.0003414069440629997, "loss": 4.8624, "mean_token_accuracy": 0.22614290118217467, "num_tokens": 95093831.0, "step": 41525 }, { "entropy": 5.301115655899048, "epoch": 4.105377619612495, "grad_norm": 1.03125, "learning_rate": 0.0003413732253123846, "loss": 4.6988, "mean_token_accuracy": 0.24623472541570662, "num_tokens": 95104960.0, "step": 41530 }, { "entropy": 5.330562257766724, "epoch": 4.105871886120997, "grad_norm": 1.015625, "learning_rate": 0.0003413395049289778, "loss": 4.8683, "mean_token_accuracy": 0.23050092458724974, "num_tokens": 95115578.0, "step": 41535 }, { "entropy": 5.335994100570678, "epoch": 4.106366152629498, "grad_norm": 1.0703125, "learning_rate": 0.0003413057829136089, "loss": 4.7854, "mean_token_accuracy": 0.22864966988563537, "num_tokens": 95129237.0, "step": 41540 }, { "entropy": 5.412833023071289, "epoch": 4.106860419137999, "grad_norm": 1.0859375, "learning_rate": 0.00034127205926710755, "loss": 4.8835, "mean_token_accuracy": 0.22228354215621948, "num_tokens": 95141500.0, "step": 41545 }, { "entropy": 5.310884428024292, "epoch": 4.1073546856465, "grad_norm": 1.1171875, "learning_rate": 0.00034123833399030324, "loss": 4.7232, "mean_token_accuracy": 0.24482790231704712, "num_tokens": 95152669.0, "step": 41550 }, { "entropy": 5.379882287979126, "epoch": 4.107848952155002, "grad_norm": 1.1875, "learning_rate": 0.0003412046070840256, "loss": 4.7635, "mean_token_accuracy": 0.23560424596071244, "num_tokens": 95163181.0, "step": 41555 }, { "entropy": 5.384448003768921, "epoch": 4.108343218663503, "grad_norm": 1.015625, "learning_rate": 0.00034117087854910436, "loss": 4.8622, "mean_token_accuracy": 0.22203850746154785, "num_tokens": 95176321.0, "step": 41560 }, { "entropy": 5.290171146392822, "epoch": 4.108837485172005, "grad_norm": 0.984375, "learning_rate": 0.0003411371483863692, "loss": 4.7788, "mean_token_accuracy": 0.24079939275979995, "num_tokens": 95188097.0, "step": 41565 }, { "entropy": 5.219679355621338, "epoch": 4.109331751680506, "grad_norm": 0.98046875, "learning_rate": 0.00034110341659665, "loss": 4.707, "mean_token_accuracy": 0.2497803047299385, "num_tokens": 95199629.0, "step": 41570 }, { "entropy": 5.390869617462158, "epoch": 4.109826018189008, "grad_norm": 0.94140625, "learning_rate": 0.0003410696831807765, "loss": 4.8374, "mean_token_accuracy": 0.23002303540706634, "num_tokens": 95212035.0, "step": 41575 }, { "entropy": 5.407761192321777, "epoch": 4.110320284697509, "grad_norm": 1.1640625, "learning_rate": 0.00034103594813957846, "loss": 4.8499, "mean_token_accuracy": 0.22972461879253386, "num_tokens": 95222705.0, "step": 41580 }, { "entropy": 5.306540250778198, "epoch": 4.11081455120601, "grad_norm": 1.0390625, "learning_rate": 0.0003410022114738859, "loss": 4.8221, "mean_token_accuracy": 0.2333255797624588, "num_tokens": 95234806.0, "step": 41585 }, { "entropy": 5.304784917831421, "epoch": 4.111308817714511, "grad_norm": 1.015625, "learning_rate": 0.0003409684731845287, "loss": 4.7104, "mean_token_accuracy": 0.23967814296483994, "num_tokens": 95245789.0, "step": 41590 }, { "entropy": 5.382983922958374, "epoch": 4.111803084223013, "grad_norm": 0.92578125, "learning_rate": 0.0003409347332723369, "loss": 4.8181, "mean_token_accuracy": 0.23235649913549422, "num_tokens": 95258295.0, "step": 41595 }, { "entropy": 5.363683700561523, "epoch": 4.112297350731515, "grad_norm": 1.1171875, "learning_rate": 0.0003409009917381403, "loss": 4.8097, "mean_token_accuracy": 0.22576821446418763, "num_tokens": 95270704.0, "step": 41600 }, { "entropy": 5.308614492416382, "epoch": 4.112791617240016, "grad_norm": 1.0, "learning_rate": 0.00034086724858276913, "loss": 4.8064, "mean_token_accuracy": 0.2361372321844101, "num_tokens": 95283321.0, "step": 41605 }, { "entropy": 5.334533834457398, "epoch": 4.113285883748517, "grad_norm": 1.078125, "learning_rate": 0.00034083350380705344, "loss": 4.8157, "mean_token_accuracy": 0.23707782328128815, "num_tokens": 95294592.0, "step": 41610 }, { "entropy": 5.32501449584961, "epoch": 4.113780150257019, "grad_norm": 1.0625, "learning_rate": 0.00034079975741182334, "loss": 4.7728, "mean_token_accuracy": 0.245015949010849, "num_tokens": 95306619.0, "step": 41615 }, { "entropy": 5.269251203536987, "epoch": 4.11427441676552, "grad_norm": 0.9765625, "learning_rate": 0.00034076600939790904, "loss": 4.7392, "mean_token_accuracy": 0.23939996659755708, "num_tokens": 95318660.0, "step": 41620 }, { "entropy": 5.309854650497437, "epoch": 4.114768683274021, "grad_norm": 1.1015625, "learning_rate": 0.0003407322597661407, "loss": 4.8276, "mean_token_accuracy": 0.23165032416582107, "num_tokens": 95330355.0, "step": 41625 }, { "entropy": 5.351277589797974, "epoch": 4.115262949782522, "grad_norm": 1.09375, "learning_rate": 0.0003406985085173484, "loss": 4.789, "mean_token_accuracy": 0.23859204202890397, "num_tokens": 95343390.0, "step": 41630 }, { "entropy": 5.292542743682861, "epoch": 4.1157572162910245, "grad_norm": 1.09375, "learning_rate": 0.0003406647556523628, "loss": 4.789, "mean_token_accuracy": 0.23160750716924666, "num_tokens": 95355379.0, "step": 41635 }, { "entropy": 5.301462316513062, "epoch": 4.116251482799526, "grad_norm": 1.0, "learning_rate": 0.000340631001172014, "loss": 4.8489, "mean_token_accuracy": 0.22904921770095826, "num_tokens": 95367166.0, "step": 41640 }, { "entropy": 5.36003794670105, "epoch": 4.116745749308027, "grad_norm": 1.078125, "learning_rate": 0.0003405972450771323, "loss": 4.6866, "mean_token_accuracy": 0.24431024938821794, "num_tokens": 95377692.0, "step": 41645 }, { "entropy": 5.372322273254395, "epoch": 4.117240015816528, "grad_norm": 1.0546875, "learning_rate": 0.0003405634873685483, "loss": 4.8058, "mean_token_accuracy": 0.2361721619963646, "num_tokens": 95390057.0, "step": 41650 }, { "entropy": 5.336236906051636, "epoch": 4.11773428232503, "grad_norm": 1.03125, "learning_rate": 0.00034052972804709224, "loss": 4.7675, "mean_token_accuracy": 0.24114496558904647, "num_tokens": 95401525.0, "step": 41655 }, { "entropy": 5.360613870620727, "epoch": 4.118228548833531, "grad_norm": 1.109375, "learning_rate": 0.00034049596711359473, "loss": 4.8026, "mean_token_accuracy": 0.22484928667545317, "num_tokens": 95413659.0, "step": 41660 }, { "entropy": 5.349648904800415, "epoch": 4.118722815342032, "grad_norm": 1.1328125, "learning_rate": 0.00034046220456888633, "loss": 4.8377, "mean_token_accuracy": 0.23633578568696975, "num_tokens": 95424269.0, "step": 41665 }, { "entropy": 5.300803709030151, "epoch": 4.119217081850534, "grad_norm": 1.0625, "learning_rate": 0.0003404284404137975, "loss": 4.7547, "mean_token_accuracy": 0.2404254212975502, "num_tokens": 95434683.0, "step": 41670 }, { "entropy": 5.313321495056153, "epoch": 4.1197113483590355, "grad_norm": 0.9609375, "learning_rate": 0.00034039467464915885, "loss": 4.867, "mean_token_accuracy": 0.23449331074953078, "num_tokens": 95446561.0, "step": 41675 }, { "entropy": 5.363091850280762, "epoch": 4.120205614867537, "grad_norm": 1.140625, "learning_rate": 0.00034036090727580104, "loss": 4.802, "mean_token_accuracy": 0.22686389237642288, "num_tokens": 95458716.0, "step": 41680 }, { "entropy": 5.394586420059204, "epoch": 4.120699881376038, "grad_norm": 1.015625, "learning_rate": 0.00034032713829455487, "loss": 4.8396, "mean_token_accuracy": 0.2344275951385498, "num_tokens": 95470628.0, "step": 41685 }, { "entropy": 5.299654197692871, "epoch": 4.121194147884539, "grad_norm": 1.078125, "learning_rate": 0.00034029336770625095, "loss": 4.739, "mean_token_accuracy": 0.2404567375779152, "num_tokens": 95481995.0, "step": 41690 }, { "entropy": 5.238547897338867, "epoch": 4.121688414393041, "grad_norm": 1.046875, "learning_rate": 0.00034025959551172005, "loss": 4.6828, "mean_token_accuracy": 0.24869525134563447, "num_tokens": 95493518.0, "step": 41695 }, { "entropy": 5.377348947525024, "epoch": 4.122182680901542, "grad_norm": 1.296875, "learning_rate": 0.00034022582171179284, "loss": 4.8432, "mean_token_accuracy": 0.23123255372047424, "num_tokens": 95504089.0, "step": 41700 }, { "entropy": 5.392654371261597, "epoch": 4.122676947410043, "grad_norm": 1.140625, "learning_rate": 0.00034019204630730045, "loss": 4.8084, "mean_token_accuracy": 0.23027864545583726, "num_tokens": 95513658.0, "step": 41705 }, { "entropy": 5.316020059585571, "epoch": 4.123171213918545, "grad_norm": 1.0859375, "learning_rate": 0.00034015826929907357, "loss": 4.798, "mean_token_accuracy": 0.23675069063901902, "num_tokens": 95524969.0, "step": 41710 }, { "entropy": 5.39645471572876, "epoch": 4.1236654804270465, "grad_norm": 1.09375, "learning_rate": 0.0003401244906879431, "loss": 4.8787, "mean_token_accuracy": 0.22847124189138412, "num_tokens": 95535432.0, "step": 41715 }, { "entropy": 5.404804992675781, "epoch": 4.124159746935548, "grad_norm": 0.98046875, "learning_rate": 0.00034009071047474016, "loss": 4.8028, "mean_token_accuracy": 0.23762217462062835, "num_tokens": 95546389.0, "step": 41720 }, { "entropy": 5.278282594680786, "epoch": 4.124654013444049, "grad_norm": 1.125, "learning_rate": 0.0003400569286602955, "loss": 4.7625, "mean_token_accuracy": 0.2405349776148796, "num_tokens": 95558398.0, "step": 41725 }, { "entropy": 5.302069807052613, "epoch": 4.12514827995255, "grad_norm": 1.0234375, "learning_rate": 0.0003400231452454404, "loss": 4.8369, "mean_token_accuracy": 0.23371669948101043, "num_tokens": 95570707.0, "step": 41730 }, { "entropy": 5.342931652069092, "epoch": 4.1256425464610516, "grad_norm": 1.1015625, "learning_rate": 0.00033998936023100585, "loss": 4.8042, "mean_token_accuracy": 0.2335703507065773, "num_tokens": 95583187.0, "step": 41735 }, { "entropy": 5.3886106491088865, "epoch": 4.126136812969553, "grad_norm": 0.9921875, "learning_rate": 0.000339955573617823, "loss": 4.8277, "mean_token_accuracy": 0.23247213065624237, "num_tokens": 95595121.0, "step": 41740 }, { "entropy": 5.376502990722656, "epoch": 4.126631079478055, "grad_norm": 0.94921875, "learning_rate": 0.00033992178540672287, "loss": 4.8684, "mean_token_accuracy": 0.23056178987026216, "num_tokens": 95606992.0, "step": 41745 }, { "entropy": 5.311745595932007, "epoch": 4.127125345986556, "grad_norm": 1.1484375, "learning_rate": 0.00033988799559853675, "loss": 4.7693, "mean_token_accuracy": 0.24044139832258224, "num_tokens": 95618460.0, "step": 41750 }, { "entropy": 5.396635961532593, "epoch": 4.1276196124950575, "grad_norm": 1.0234375, "learning_rate": 0.000339854204194096, "loss": 4.8329, "mean_token_accuracy": 0.23552424609661102, "num_tokens": 95629690.0, "step": 41755 }, { "entropy": 5.169600772857666, "epoch": 4.128113879003559, "grad_norm": 1.234375, "learning_rate": 0.00033982041119423156, "loss": 4.5992, "mean_token_accuracy": 0.2578437998890877, "num_tokens": 95640732.0, "step": 41760 }, { "entropy": 5.261126613616943, "epoch": 4.12860814551206, "grad_norm": 1.015625, "learning_rate": 0.0003397866165997751, "loss": 4.7646, "mean_token_accuracy": 0.2438531383872032, "num_tokens": 95651292.0, "step": 41765 }, { "entropy": 5.3221080780029295, "epoch": 4.129102412020561, "grad_norm": 1.0625, "learning_rate": 0.0003397528204115578, "loss": 4.766, "mean_token_accuracy": 0.2406686767935753, "num_tokens": 95662499.0, "step": 41770 }, { "entropy": 5.348952388763427, "epoch": 4.1295966785290625, "grad_norm": 1.0, "learning_rate": 0.000339719022630411, "loss": 4.8059, "mean_token_accuracy": 0.23675923198461532, "num_tokens": 95674097.0, "step": 41775 }, { "entropy": 5.3366388320922855, "epoch": 4.130090945037564, "grad_norm": 1.1640625, "learning_rate": 0.0003396852232571663, "loss": 4.7676, "mean_token_accuracy": 0.23069848865270615, "num_tokens": 95684917.0, "step": 41780 }, { "entropy": 5.393209552764892, "epoch": 4.130585211546066, "grad_norm": 1.0234375, "learning_rate": 0.000339651422292655, "loss": 4.8654, "mean_token_accuracy": 0.2232743665575981, "num_tokens": 95696588.0, "step": 41785 }, { "entropy": 5.316815280914307, "epoch": 4.131079478054567, "grad_norm": 1.015625, "learning_rate": 0.00033961761973770865, "loss": 4.7613, "mean_token_accuracy": 0.2403385579586029, "num_tokens": 95707246.0, "step": 41790 }, { "entropy": 5.337235069274902, "epoch": 4.1315737445630685, "grad_norm": 1.1640625, "learning_rate": 0.0003395838155931589, "loss": 4.7958, "mean_token_accuracy": 0.23345627039670944, "num_tokens": 95717432.0, "step": 41795 }, { "entropy": 5.346525239944458, "epoch": 4.13206801107157, "grad_norm": 1.09375, "learning_rate": 0.00033955000985983727, "loss": 4.7796, "mean_token_accuracy": 0.2376331090927124, "num_tokens": 95728102.0, "step": 41800 }, { "entropy": 5.358744192123413, "epoch": 4.132562277580071, "grad_norm": 1.109375, "learning_rate": 0.0003395162025385753, "loss": 4.7662, "mean_token_accuracy": 0.23741636127233506, "num_tokens": 95738691.0, "step": 41805 }, { "entropy": 5.323165655136108, "epoch": 4.133056544088572, "grad_norm": 1.0234375, "learning_rate": 0.0003394823936302048, "loss": 4.8017, "mean_token_accuracy": 0.23096239268779756, "num_tokens": 95750716.0, "step": 41810 }, { "entropy": 5.312616682052612, "epoch": 4.1335508105970735, "grad_norm": 1.0859375, "learning_rate": 0.0003394485831355574, "loss": 4.7411, "mean_token_accuracy": 0.23709991872310637, "num_tokens": 95764130.0, "step": 41815 }, { "entropy": 5.34147539138794, "epoch": 4.134045077105576, "grad_norm": 1.03125, "learning_rate": 0.00033941477105546493, "loss": 4.8182, "mean_token_accuracy": 0.23270495533943175, "num_tokens": 95776222.0, "step": 41820 }, { "entropy": 5.344922876358032, "epoch": 4.134539343614077, "grad_norm": 1.1171875, "learning_rate": 0.00033938095739075903, "loss": 4.7561, "mean_token_accuracy": 0.23487693965435028, "num_tokens": 95786986.0, "step": 41825 }, { "entropy": 5.297839117050171, "epoch": 4.135033610122578, "grad_norm": 1.0703125, "learning_rate": 0.00033934714214227163, "loss": 4.7178, "mean_token_accuracy": 0.2455140843987465, "num_tokens": 95797206.0, "step": 41830 }, { "entropy": 5.321779823303222, "epoch": 4.1355278766310795, "grad_norm": 1.0234375, "learning_rate": 0.00033931332531083447, "loss": 4.8477, "mean_token_accuracy": 0.2353069916367531, "num_tokens": 95809277.0, "step": 41835 }, { "entropy": 5.39509391784668, "epoch": 4.136022143139581, "grad_norm": 0.953125, "learning_rate": 0.0003392795068972796, "loss": 4.8419, "mean_token_accuracy": 0.22908393889665604, "num_tokens": 95820981.0, "step": 41840 }, { "entropy": 5.3830162525177006, "epoch": 4.136516409648082, "grad_norm": 1.0390625, "learning_rate": 0.00033924568690243885, "loss": 4.7887, "mean_token_accuracy": 0.22970491647720337, "num_tokens": 95832287.0, "step": 41845 }, { "entropy": 5.297011804580689, "epoch": 4.137010676156583, "grad_norm": 1.015625, "learning_rate": 0.00033921186532714426, "loss": 4.7703, "mean_token_accuracy": 0.23739654421806336, "num_tokens": 95842650.0, "step": 41850 }, { "entropy": 5.338014078140259, "epoch": 4.137504942665085, "grad_norm": 1.2109375, "learning_rate": 0.0003391780421722279, "loss": 4.8404, "mean_token_accuracy": 0.23386852592229843, "num_tokens": 95852946.0, "step": 41855 }, { "entropy": 5.31417326927185, "epoch": 4.137999209173587, "grad_norm": 1.171875, "learning_rate": 0.0003391442174385216, "loss": 4.8307, "mean_token_accuracy": 0.23469152599573134, "num_tokens": 95864373.0, "step": 41860 }, { "entropy": 5.353775978088379, "epoch": 4.138493475682088, "grad_norm": 1.078125, "learning_rate": 0.00033911039112685773, "loss": 4.7934, "mean_token_accuracy": 0.2398062154650688, "num_tokens": 95875932.0, "step": 41865 }, { "entropy": 5.365305185317993, "epoch": 4.138987742190589, "grad_norm": 0.9609375, "learning_rate": 0.0003390765632380681, "loss": 4.7779, "mean_token_accuracy": 0.2365504577755928, "num_tokens": 95887677.0, "step": 41870 }, { "entropy": 5.325211668014527, "epoch": 4.13948200869909, "grad_norm": 1.0859375, "learning_rate": 0.0003390427337729852, "loss": 4.8122, "mean_token_accuracy": 0.2317598655819893, "num_tokens": 95898966.0, "step": 41875 }, { "entropy": 5.33437671661377, "epoch": 4.139976275207592, "grad_norm": 1.0234375, "learning_rate": 0.00033900890273244117, "loss": 4.827, "mean_token_accuracy": 0.23153076320886612, "num_tokens": 95909645.0, "step": 41880 }, { "entropy": 5.3462213516235355, "epoch": 4.140470541716093, "grad_norm": 1.0703125, "learning_rate": 0.00033897507011726815, "loss": 4.773, "mean_token_accuracy": 0.2377312809228897, "num_tokens": 95920365.0, "step": 41885 }, { "entropy": 5.389680480957031, "epoch": 4.140964808224595, "grad_norm": 1.0234375, "learning_rate": 0.00033894123592829843, "loss": 4.8299, "mean_token_accuracy": 0.23195583522319793, "num_tokens": 95932770.0, "step": 41890 }, { "entropy": 5.339258909225464, "epoch": 4.141459074733096, "grad_norm": 1.078125, "learning_rate": 0.00033890740016636445, "loss": 4.7463, "mean_token_accuracy": 0.23784008324146272, "num_tokens": 95942792.0, "step": 41895 }, { "entropy": 5.267242956161499, "epoch": 4.141953341241598, "grad_norm": 1.09375, "learning_rate": 0.0003388735628322985, "loss": 4.7151, "mean_token_accuracy": 0.23962074369192124, "num_tokens": 95953286.0, "step": 41900 }, { "entropy": 5.321206951141358, "epoch": 4.142447607750099, "grad_norm": 1.015625, "learning_rate": 0.00033883972392693295, "loss": 4.8287, "mean_token_accuracy": 0.22671952545642854, "num_tokens": 95964419.0, "step": 41905 }, { "entropy": 5.380394983291626, "epoch": 4.1429418742586, "grad_norm": 0.95703125, "learning_rate": 0.00033880588345110044, "loss": 4.8453, "mean_token_accuracy": 0.227846759557724, "num_tokens": 95975558.0, "step": 41910 }, { "entropy": 5.4177600860595705, "epoch": 4.143436140767101, "grad_norm": 1.2109375, "learning_rate": 0.0003387720414056331, "loss": 4.9297, "mean_token_accuracy": 0.2211672618985176, "num_tokens": 95987421.0, "step": 41915 }, { "entropy": 5.403283882141113, "epoch": 4.143930407275603, "grad_norm": 1.0, "learning_rate": 0.00033873819779136374, "loss": 4.8117, "mean_token_accuracy": 0.23333678692579268, "num_tokens": 95999765.0, "step": 41920 }, { "entropy": 5.321062850952148, "epoch": 4.144424673784105, "grad_norm": 1.1328125, "learning_rate": 0.0003387043526091248, "loss": 4.7958, "mean_token_accuracy": 0.23600251972675323, "num_tokens": 96010795.0, "step": 41925 }, { "entropy": 5.338825511932373, "epoch": 4.144918940292606, "grad_norm": 1.1640625, "learning_rate": 0.000338670505859749, "loss": 4.8297, "mean_token_accuracy": 0.23833069801330567, "num_tokens": 96022885.0, "step": 41930 }, { "entropy": 5.281180334091187, "epoch": 4.145413206801107, "grad_norm": 1.0078125, "learning_rate": 0.00033863665754406874, "loss": 4.7834, "mean_token_accuracy": 0.24088027477264404, "num_tokens": 96034636.0, "step": 41935 }, { "entropy": 5.355309247970581, "epoch": 4.145907473309609, "grad_norm": 1.1328125, "learning_rate": 0.0003386028076629169, "loss": 4.7852, "mean_token_accuracy": 0.22882652431726455, "num_tokens": 96044880.0, "step": 41940 }, { "entropy": 5.384540033340454, "epoch": 4.14640173981811, "grad_norm": 1.0859375, "learning_rate": 0.0003385689562171261, "loss": 4.856, "mean_token_accuracy": 0.22526754438877106, "num_tokens": 96056856.0, "step": 41945 }, { "entropy": 5.288919734954834, "epoch": 4.146896006326611, "grad_norm": 1.140625, "learning_rate": 0.0003385351032075291, "loss": 4.7343, "mean_token_accuracy": 0.236665940284729, "num_tokens": 96068843.0, "step": 41950 }, { "entropy": 5.290477848052978, "epoch": 4.147390272835112, "grad_norm": 1.078125, "learning_rate": 0.0003385012486349588, "loss": 4.7681, "mean_token_accuracy": 0.23960754573345183, "num_tokens": 96079780.0, "step": 41955 }, { "entropy": 5.262749862670899, "epoch": 4.147884539343614, "grad_norm": 1.0859375, "learning_rate": 0.0003384673925002478, "loss": 4.7225, "mean_token_accuracy": 0.24816317558288575, "num_tokens": 96090747.0, "step": 41960 }, { "entropy": 5.295580959320068, "epoch": 4.148378805852116, "grad_norm": 1.0234375, "learning_rate": 0.00033843353480422924, "loss": 4.7055, "mean_token_accuracy": 0.2452581986784935, "num_tokens": 96102895.0, "step": 41965 }, { "entropy": 5.320926332473755, "epoch": 4.148873072360617, "grad_norm": 1.03125, "learning_rate": 0.0003383996755477358, "loss": 4.7615, "mean_token_accuracy": 0.23795069009065628, "num_tokens": 96113860.0, "step": 41970 }, { "entropy": 5.299332857131958, "epoch": 4.149367338869118, "grad_norm": 1.09375, "learning_rate": 0.0003383658147316006, "loss": 4.7381, "mean_token_accuracy": 0.2428075850009918, "num_tokens": 96124154.0, "step": 41975 }, { "entropy": 5.347956800460816, "epoch": 4.14986160537762, "grad_norm": 1.0078125, "learning_rate": 0.00033833195235665636, "loss": 4.8281, "mean_token_accuracy": 0.2288776382803917, "num_tokens": 96137137.0, "step": 41980 }, { "entropy": 5.3054443359375, "epoch": 4.150355871886121, "grad_norm": 1.0, "learning_rate": 0.00033829808842373633, "loss": 4.7866, "mean_token_accuracy": 0.23850253820419312, "num_tokens": 96148683.0, "step": 41985 }, { "entropy": 5.234829950332641, "epoch": 4.150850138394622, "grad_norm": 1.078125, "learning_rate": 0.00033826422293367354, "loss": 4.6951, "mean_token_accuracy": 0.24551786184310914, "num_tokens": 96159240.0, "step": 41990 }, { "entropy": 5.383164310455323, "epoch": 4.151344404903123, "grad_norm": 1.0390625, "learning_rate": 0.000338230355887301, "loss": 4.8592, "mean_token_accuracy": 0.23485683351755143, "num_tokens": 96170479.0, "step": 41995 }, { "entropy": 5.400681495666504, "epoch": 4.1518386714116255, "grad_norm": 1.125, "learning_rate": 0.000338196487285452, "loss": 4.8229, "mean_token_accuracy": 0.23320941776037216, "num_tokens": 96181242.0, "step": 42000 }, { "epoch": 4.1518386714116255, "eval_entropy": 5.110127836135921, "eval_loss": 4.926168441772461, "eval_mean_token_accuracy": 0.2356974443184787, "eval_num_tokens": 96181242.0, "eval_runtime": 26.6069, "eval_samples_per_second": 1221.975, "eval_steps_per_second": 152.78, "step": 42000 }, { "entropy": 5.384756374359131, "epoch": 4.152332937920127, "grad_norm": 1.1484375, "learning_rate": 0.0003381626171289595, "loss": 4.8675, "mean_token_accuracy": 0.2334569811820984, "num_tokens": 96192049.0, "step": 42005 }, { "entropy": 5.331325960159302, "epoch": 4.152827204428628, "grad_norm": 1.140625, "learning_rate": 0.00033812874541865685, "loss": 4.7514, "mean_token_accuracy": 0.24220793545246125, "num_tokens": 96203334.0, "step": 42010 }, { "entropy": 5.311798048019409, "epoch": 4.153321470937129, "grad_norm": 1.046875, "learning_rate": 0.0003380948721553773, "loss": 4.801, "mean_token_accuracy": 0.23227284252643585, "num_tokens": 96214790.0, "step": 42015 }, { "entropy": 5.359228992462159, "epoch": 4.153815737445631, "grad_norm": 1.0703125, "learning_rate": 0.0003380609973399541, "loss": 4.8741, "mean_token_accuracy": 0.2282458707690239, "num_tokens": 96227832.0, "step": 42020 }, { "entropy": 5.45112247467041, "epoch": 4.154310003954132, "grad_norm": 1.0390625, "learning_rate": 0.0003380271209732205, "loss": 4.9475, "mean_token_accuracy": 0.22769798785448075, "num_tokens": 96238501.0, "step": 42025 }, { "entropy": 5.336483144760132, "epoch": 4.154804270462633, "grad_norm": 1.109375, "learning_rate": 0.00033799324305601, "loss": 4.7946, "mean_token_accuracy": 0.23970842808485032, "num_tokens": 96249605.0, "step": 42030 }, { "entropy": 5.316549491882324, "epoch": 4.155298536971134, "grad_norm": 1.0390625, "learning_rate": 0.00033795936358915594, "loss": 4.863, "mean_token_accuracy": 0.23093790411949158, "num_tokens": 96259754.0, "step": 42035 }, { "entropy": 5.337087345123291, "epoch": 4.1557928034796365, "grad_norm": 1.046875, "learning_rate": 0.00033792548257349184, "loss": 4.7859, "mean_token_accuracy": 0.23629071563482285, "num_tokens": 96272566.0, "step": 42040 }, { "entropy": 5.399363327026367, "epoch": 4.156287069988138, "grad_norm": 1.0078125, "learning_rate": 0.0003378916000098511, "loss": 4.8031, "mean_token_accuracy": 0.23158445060253144, "num_tokens": 96283560.0, "step": 42045 }, { "entropy": 5.35421724319458, "epoch": 4.156781336496639, "grad_norm": 1.0390625, "learning_rate": 0.00033785771589906724, "loss": 4.7823, "mean_token_accuracy": 0.23796643912792206, "num_tokens": 96295892.0, "step": 42050 }, { "entropy": 5.353775882720948, "epoch": 4.15727560300514, "grad_norm": 1.0546875, "learning_rate": 0.00033782383024197365, "loss": 4.8279, "mean_token_accuracy": 0.2307879164814949, "num_tokens": 96307561.0, "step": 42055 }, { "entropy": 5.250480127334595, "epoch": 4.157769869513642, "grad_norm": 1.03125, "learning_rate": 0.0003377899430394043, "loss": 4.6879, "mean_token_accuracy": 0.2448171243071556, "num_tokens": 96318782.0, "step": 42060 }, { "entropy": 5.316363382339477, "epoch": 4.158264136022143, "grad_norm": 1.0859375, "learning_rate": 0.0003377560542921925, "loss": 4.7893, "mean_token_accuracy": 0.24425241351127625, "num_tokens": 96329090.0, "step": 42065 }, { "entropy": 5.423479413986206, "epoch": 4.158758402530644, "grad_norm": 1.109375, "learning_rate": 0.00033772216400117206, "loss": 4.8813, "mean_token_accuracy": 0.228091798722744, "num_tokens": 96338681.0, "step": 42070 }, { "entropy": 5.304449081420898, "epoch": 4.159252669039146, "grad_norm": 1.0703125, "learning_rate": 0.00033768827216717676, "loss": 4.7305, "mean_token_accuracy": 0.23792081475257873, "num_tokens": 96348772.0, "step": 42075 }, { "entropy": 5.308181524276733, "epoch": 4.1597469355476475, "grad_norm": 1.09375, "learning_rate": 0.00033765437879104004, "loss": 4.8243, "mean_token_accuracy": 0.23202521950006486, "num_tokens": 96360772.0, "step": 42080 }, { "entropy": 5.343043088912964, "epoch": 4.160241202056149, "grad_norm": 1.0625, "learning_rate": 0.00033762048387359593, "loss": 4.8449, "mean_token_accuracy": 0.23239922076463698, "num_tokens": 96371729.0, "step": 42085 }, { "entropy": 5.315097951889038, "epoch": 4.16073546856465, "grad_norm": 1.140625, "learning_rate": 0.0003375865874156783, "loss": 4.8195, "mean_token_accuracy": 0.23254393935203552, "num_tokens": 96382422.0, "step": 42090 }, { "entropy": 5.361581420898437, "epoch": 4.161229735073151, "grad_norm": 1.109375, "learning_rate": 0.0003375526894181208, "loss": 4.8401, "mean_token_accuracy": 0.23114973306655884, "num_tokens": 96393411.0, "step": 42095 }, { "entropy": 5.276297760009766, "epoch": 4.161724001581653, "grad_norm": 1.046875, "learning_rate": 0.0003375187898817575, "loss": 4.7244, "mean_token_accuracy": 0.24395783841609955, "num_tokens": 96404133.0, "step": 42100 }, { "entropy": 5.37007737159729, "epoch": 4.162218268090154, "grad_norm": 0.99609375, "learning_rate": 0.0003374848888074223, "loss": 4.8333, "mean_token_accuracy": 0.22907216101884842, "num_tokens": 96416651.0, "step": 42105 }, { "entropy": 5.395104217529297, "epoch": 4.162712534598656, "grad_norm": 1.03125, "learning_rate": 0.00033745098619594906, "loss": 4.8563, "mean_token_accuracy": 0.23136295527219772, "num_tokens": 96429831.0, "step": 42110 }, { "entropy": 5.276064014434814, "epoch": 4.163206801107157, "grad_norm": 1.015625, "learning_rate": 0.000337417082048172, "loss": 4.7371, "mean_token_accuracy": 0.24587250649929046, "num_tokens": 96440227.0, "step": 42115 }, { "entropy": 5.381582832336425, "epoch": 4.1637010676156585, "grad_norm": 1.0234375, "learning_rate": 0.00033738317636492496, "loss": 4.8233, "mean_token_accuracy": 0.23320611715316772, "num_tokens": 96451975.0, "step": 42120 }, { "entropy": 5.267349576950073, "epoch": 4.16419533412416, "grad_norm": 1.0703125, "learning_rate": 0.0003373492691470421, "loss": 4.6921, "mean_token_accuracy": 0.24233636409044265, "num_tokens": 96462416.0, "step": 42125 }, { "entropy": 5.347037982940674, "epoch": 4.164689600632661, "grad_norm": 1.15625, "learning_rate": 0.00033731536039535747, "loss": 4.7908, "mean_token_accuracy": 0.23976798951625825, "num_tokens": 96475450.0, "step": 42130 }, { "entropy": 5.402261114120483, "epoch": 4.165183867141162, "grad_norm": 1.0, "learning_rate": 0.00033728145011070537, "loss": 4.8774, "mean_token_accuracy": 0.22522175461053848, "num_tokens": 96486885.0, "step": 42135 }, { "entropy": 5.28121018409729, "epoch": 4.1656781336496636, "grad_norm": 1.1953125, "learning_rate": 0.00033724753829391996, "loss": 4.7666, "mean_token_accuracy": 0.23936983644962312, "num_tokens": 96498401.0, "step": 42140 }, { "entropy": 5.292751359939575, "epoch": 4.166172400158166, "grad_norm": 1.0078125, "learning_rate": 0.0003372136249458355, "loss": 4.7874, "mean_token_accuracy": 0.23808875530958176, "num_tokens": 96509824.0, "step": 42145 }, { "entropy": 5.328923034667969, "epoch": 4.166666666666667, "grad_norm": 1.03125, "learning_rate": 0.0003371797100672861, "loss": 4.784, "mean_token_accuracy": 0.24210574626922607, "num_tokens": 96521261.0, "step": 42150 }, { "entropy": 5.359980869293213, "epoch": 4.167160933175168, "grad_norm": 1.0703125, "learning_rate": 0.00033714579365910617, "loss": 4.8169, "mean_token_accuracy": 0.23262932598590852, "num_tokens": 96533015.0, "step": 42155 }, { "entropy": 5.353190946578979, "epoch": 4.1676551996836695, "grad_norm": 1.1875, "learning_rate": 0.0003371118757221302, "loss": 4.7775, "mean_token_accuracy": 0.23732135593891143, "num_tokens": 96543076.0, "step": 42160 }, { "entropy": 5.2710254192352295, "epoch": 4.168149466192171, "grad_norm": 1.015625, "learning_rate": 0.00033707795625719243, "loss": 4.7334, "mean_token_accuracy": 0.23572733551263808, "num_tokens": 96554003.0, "step": 42165 }, { "entropy": 5.264140939712524, "epoch": 4.168643732700672, "grad_norm": 0.96484375, "learning_rate": 0.0003370440352651273, "loss": 4.7213, "mean_token_accuracy": 0.2377329185605049, "num_tokens": 96567005.0, "step": 42170 }, { "entropy": 5.307427453994751, "epoch": 4.169137999209173, "grad_norm": 1.03125, "learning_rate": 0.00033701011274676917, "loss": 4.7788, "mean_token_accuracy": 0.2320228785276413, "num_tokens": 96577403.0, "step": 42175 }, { "entropy": 5.37234582901001, "epoch": 4.169632265717675, "grad_norm": 1.0546875, "learning_rate": 0.00033697618870295274, "loss": 4.7767, "mean_token_accuracy": 0.23895858228206635, "num_tokens": 96588511.0, "step": 42180 }, { "entropy": 5.422223997116089, "epoch": 4.170126532226177, "grad_norm": 1.078125, "learning_rate": 0.0003369422631345124, "loss": 4.8527, "mean_token_accuracy": 0.2361580714583397, "num_tokens": 96599422.0, "step": 42185 }, { "entropy": 5.341722249984741, "epoch": 4.170620798734678, "grad_norm": 1.015625, "learning_rate": 0.00033690833604228283, "loss": 4.8402, "mean_token_accuracy": 0.23313033133745192, "num_tokens": 96611230.0, "step": 42190 }, { "entropy": 5.215124845504761, "epoch": 4.171115065243179, "grad_norm": 1.0703125, "learning_rate": 0.0003368744074270986, "loss": 4.7361, "mean_token_accuracy": 0.24837030619382858, "num_tokens": 96622341.0, "step": 42195 }, { "entropy": 5.33415961265564, "epoch": 4.1716093317516805, "grad_norm": 1.109375, "learning_rate": 0.00033684047728979426, "loss": 4.7487, "mean_token_accuracy": 0.23628276437520981, "num_tokens": 96632987.0, "step": 42200 }, { "entropy": 5.337310934066773, "epoch": 4.172103598260182, "grad_norm": 1.0546875, "learning_rate": 0.0003368065456312047, "loss": 4.7979, "mean_token_accuracy": 0.24224146008491515, "num_tokens": 96645262.0, "step": 42205 }, { "entropy": 5.265729665756226, "epoch": 4.172597864768683, "grad_norm": 1.0546875, "learning_rate": 0.00033677261245216444, "loss": 4.7806, "mean_token_accuracy": 0.2394173786044121, "num_tokens": 96657873.0, "step": 42210 }, { "entropy": 5.339577674865723, "epoch": 4.173092131277184, "grad_norm": 1.078125, "learning_rate": 0.0003367386777535084, "loss": 4.8313, "mean_token_accuracy": 0.2366847202181816, "num_tokens": 96668845.0, "step": 42215 }, { "entropy": 5.307401180267334, "epoch": 4.173586397785686, "grad_norm": 1.0703125, "learning_rate": 0.00033670474153607127, "loss": 4.744, "mean_token_accuracy": 0.24584420323371886, "num_tokens": 96680787.0, "step": 42220 }, { "entropy": 5.336154985427856, "epoch": 4.174080664294188, "grad_norm": 1.0703125, "learning_rate": 0.00033667080380068786, "loss": 4.7896, "mean_token_accuracy": 0.23656032979488373, "num_tokens": 96692783.0, "step": 42225 }, { "entropy": 5.46220645904541, "epoch": 4.174574930802689, "grad_norm": 1.0546875, "learning_rate": 0.00033663686454819326, "loss": 4.9731, "mean_token_accuracy": 0.21615297347307205, "num_tokens": 96704000.0, "step": 42230 }, { "entropy": 5.338226652145385, "epoch": 4.17506919731119, "grad_norm": 1.0078125, "learning_rate": 0.0003366029237794221, "loss": 4.8433, "mean_token_accuracy": 0.2312968209385872, "num_tokens": 96715791.0, "step": 42235 }, { "entropy": 5.341615819931031, "epoch": 4.1755634638196915, "grad_norm": 1.0390625, "learning_rate": 0.0003365689814952095, "loss": 4.7385, "mean_token_accuracy": 0.23429572731256484, "num_tokens": 96726510.0, "step": 42240 }, { "entropy": 5.354557371139526, "epoch": 4.176057730328193, "grad_norm": 1.0234375, "learning_rate": 0.00033653503769639045, "loss": 4.7781, "mean_token_accuracy": 0.23488426953554153, "num_tokens": 96738147.0, "step": 42245 }, { "entropy": 5.2859930992126465, "epoch": 4.176551996836694, "grad_norm": 1.203125, "learning_rate": 0.0003365010923837999, "loss": 4.8181, "mean_token_accuracy": 0.23897273540496827, "num_tokens": 96749553.0, "step": 42250 }, { "entropy": 5.369712543487549, "epoch": 4.177046263345196, "grad_norm": 1.0703125, "learning_rate": 0.0003364671455582729, "loss": 4.7937, "mean_token_accuracy": 0.22979427874088287, "num_tokens": 96761728.0, "step": 42255 }, { "entropy": 5.322461128234863, "epoch": 4.177540529853697, "grad_norm": 1.0703125, "learning_rate": 0.00033643319722064457, "loss": 4.7717, "mean_token_accuracy": 0.24014077186584473, "num_tokens": 96772382.0, "step": 42260 }, { "entropy": 5.153347778320312, "epoch": 4.178034796362199, "grad_norm": 1.0390625, "learning_rate": 0.0003363992473717502, "loss": 4.606, "mean_token_accuracy": 0.26103377938270567, "num_tokens": 96783844.0, "step": 42265 }, { "entropy": 5.3126380443573, "epoch": 4.1785290628707, "grad_norm": 0.984375, "learning_rate": 0.0003363652960124246, "loss": 4.8652, "mean_token_accuracy": 0.22945505678653716, "num_tokens": 96795256.0, "step": 42270 }, { "entropy": 5.369009733200073, "epoch": 4.179023329379201, "grad_norm": 1.09375, "learning_rate": 0.00033633134314350335, "loss": 4.8408, "mean_token_accuracy": 0.23539575189352036, "num_tokens": 96807085.0, "step": 42275 }, { "entropy": 5.333640909194946, "epoch": 4.179517595887702, "grad_norm": 1.109375, "learning_rate": 0.00033629738876582156, "loss": 4.7437, "mean_token_accuracy": 0.23732164949178697, "num_tokens": 96818351.0, "step": 42280 }, { "entropy": 5.278719806671143, "epoch": 4.180011862396204, "grad_norm": 1.0625, "learning_rate": 0.00033626343288021437, "loss": 4.7477, "mean_token_accuracy": 0.2406910017132759, "num_tokens": 96830093.0, "step": 42285 }, { "entropy": 5.357566070556641, "epoch": 4.180506128904705, "grad_norm": 1.0390625, "learning_rate": 0.00033622947548751737, "loss": 4.7911, "mean_token_accuracy": 0.23548037856817244, "num_tokens": 96842124.0, "step": 42290 }, { "entropy": 5.320289039611817, "epoch": 4.181000395413207, "grad_norm": 1.15625, "learning_rate": 0.00033619551658856567, "loss": 4.8338, "mean_token_accuracy": 0.2244575008749962, "num_tokens": 96853764.0, "step": 42295 }, { "entropy": 5.3261645317077635, "epoch": 4.181494661921708, "grad_norm": 1.171875, "learning_rate": 0.0003361615561841948, "loss": 4.7774, "mean_token_accuracy": 0.23418943732976913, "num_tokens": 96865356.0, "step": 42300 }, { "entropy": 5.328014945983886, "epoch": 4.18198892843021, "grad_norm": 1.125, "learning_rate": 0.00033612759427524016, "loss": 4.7769, "mean_token_accuracy": 0.23874126523733138, "num_tokens": 96876747.0, "step": 42305 }, { "entropy": 5.289068126678467, "epoch": 4.182483194938711, "grad_norm": 1.0546875, "learning_rate": 0.00033609363086253727, "loss": 4.7448, "mean_token_accuracy": 0.2407989799976349, "num_tokens": 96888723.0, "step": 42310 }, { "entropy": 5.351002740859985, "epoch": 4.182977461447212, "grad_norm": 1.125, "learning_rate": 0.0003360596659469215, "loss": 4.8182, "mean_token_accuracy": 0.23666032254695893, "num_tokens": 96900772.0, "step": 42315 }, { "entropy": 5.416171407699585, "epoch": 4.183471727955713, "grad_norm": 1.0390625, "learning_rate": 0.0003360256995292285, "loss": 4.8206, "mean_token_accuracy": 0.2341357171535492, "num_tokens": 96911739.0, "step": 42320 }, { "entropy": 5.321265077590942, "epoch": 4.183965994464215, "grad_norm": 1.046875, "learning_rate": 0.00033599173161029383, "loss": 4.7596, "mean_token_accuracy": 0.23804285526275634, "num_tokens": 96923135.0, "step": 42325 }, { "entropy": 5.300636100769043, "epoch": 4.184460260972717, "grad_norm": 1.03125, "learning_rate": 0.0003359577621909531, "loss": 4.7648, "mean_token_accuracy": 0.2399965390563011, "num_tokens": 96934835.0, "step": 42330 }, { "entropy": 5.372843456268311, "epoch": 4.184954527481218, "grad_norm": 1.234375, "learning_rate": 0.000335923791272042, "loss": 4.8801, "mean_token_accuracy": 0.23516935110092163, "num_tokens": 96944870.0, "step": 42335 }, { "entropy": 5.39614462852478, "epoch": 4.185448793989719, "grad_norm": 1.15625, "learning_rate": 0.0003358898188543961, "loss": 4.8882, "mean_token_accuracy": 0.227268585562706, "num_tokens": 96955562.0, "step": 42340 }, { "entropy": 5.267979431152344, "epoch": 4.185943060498221, "grad_norm": 1.015625, "learning_rate": 0.00033585584493885123, "loss": 4.7818, "mean_token_accuracy": 0.2386494591832161, "num_tokens": 96966445.0, "step": 42345 }, { "entropy": 5.399060440063477, "epoch": 4.186437327006722, "grad_norm": 1.03125, "learning_rate": 0.00033582186952624314, "loss": 4.9005, "mean_token_accuracy": 0.22290173470973967, "num_tokens": 96978162.0, "step": 42350 }, { "entropy": 5.398553943634033, "epoch": 4.186931593515223, "grad_norm": 0.953125, "learning_rate": 0.00033578789261740766, "loss": 4.8014, "mean_token_accuracy": 0.23242709636688233, "num_tokens": 96989348.0, "step": 42355 }, { "entropy": 5.406059503555298, "epoch": 4.187425860023724, "grad_norm": 1.1015625, "learning_rate": 0.00033575391421318063, "loss": 4.8331, "mean_token_accuracy": 0.2358851045370102, "num_tokens": 97001291.0, "step": 42360 }, { "entropy": 5.327775573730468, "epoch": 4.187920126532227, "grad_norm": 0.984375, "learning_rate": 0.00033571993431439777, "loss": 4.8873, "mean_token_accuracy": 0.22651691734790802, "num_tokens": 97013568.0, "step": 42365 }, { "entropy": 5.341685152053833, "epoch": 4.188414393040728, "grad_norm": 1.109375, "learning_rate": 0.0003356859529218952, "loss": 4.7553, "mean_token_accuracy": 0.23570404201745987, "num_tokens": 97024009.0, "step": 42370 }, { "entropy": 5.296084022521972, "epoch": 4.188908659549229, "grad_norm": 1.1015625, "learning_rate": 0.00033565197003650876, "loss": 4.8145, "mean_token_accuracy": 0.23038175851106643, "num_tokens": 97035582.0, "step": 42375 }, { "entropy": 5.312583112716675, "epoch": 4.18940292605773, "grad_norm": 1.109375, "learning_rate": 0.0003356179856590744, "loss": 4.8435, "mean_token_accuracy": 0.2299030214548111, "num_tokens": 97048193.0, "step": 42380 }, { "entropy": 5.3817237377166744, "epoch": 4.189897192566232, "grad_norm": 1.21875, "learning_rate": 0.00033558399979042826, "loss": 4.815, "mean_token_accuracy": 0.24164119064807893, "num_tokens": 97058977.0, "step": 42385 }, { "entropy": 5.385688400268554, "epoch": 4.190391459074733, "grad_norm": 1.1015625, "learning_rate": 0.00033555001243140627, "loss": 4.8325, "mean_token_accuracy": 0.23046234995126724, "num_tokens": 97070757.0, "step": 42390 }, { "entropy": 5.391685485839844, "epoch": 4.190885725583234, "grad_norm": 1.0703125, "learning_rate": 0.0003355160235828446, "loss": 4.8206, "mean_token_accuracy": 0.23292884230613708, "num_tokens": 97081062.0, "step": 42395 }, { "entropy": 5.3495830535888675, "epoch": 4.191379992091736, "grad_norm": 1.1171875, "learning_rate": 0.00033548203324557937, "loss": 4.8155, "mean_token_accuracy": 0.22963235527276993, "num_tokens": 97093090.0, "step": 42400 }, { "entropy": 5.331288909912109, "epoch": 4.1918742586002375, "grad_norm": 0.984375, "learning_rate": 0.00033544804142044673, "loss": 4.8183, "mean_token_accuracy": 0.23165452778339385, "num_tokens": 97103936.0, "step": 42405 }, { "entropy": 5.387961387634277, "epoch": 4.192368525108739, "grad_norm": 1.0703125, "learning_rate": 0.00033541404810828284, "loss": 4.8141, "mean_token_accuracy": 0.2291749745607376, "num_tokens": 97115797.0, "step": 42410 }, { "entropy": 5.375203943252563, "epoch": 4.19286279161724, "grad_norm": 1.25, "learning_rate": 0.00033538005330992405, "loss": 4.8522, "mean_token_accuracy": 0.2354544773697853, "num_tokens": 97126920.0, "step": 42415 }, { "entropy": 5.280441474914551, "epoch": 4.193357058125741, "grad_norm": 1.015625, "learning_rate": 0.0003353460570262066, "loss": 4.6273, "mean_token_accuracy": 0.2519181311130524, "num_tokens": 97138236.0, "step": 42420 }, { "entropy": 5.365032148361206, "epoch": 4.193851324634243, "grad_norm": 1.015625, "learning_rate": 0.00033531205925796674, "loss": 4.8303, "mean_token_accuracy": 0.22935027927160262, "num_tokens": 97150666.0, "step": 42425 }, { "entropy": 5.385840320587159, "epoch": 4.194345591142744, "grad_norm": 1.0234375, "learning_rate": 0.0003352780600060409, "loss": 4.7528, "mean_token_accuracy": 0.24075054824352266, "num_tokens": 97161747.0, "step": 42430 }, { "entropy": 5.313215208053589, "epoch": 4.194839857651246, "grad_norm": 1.0390625, "learning_rate": 0.00033524405927126536, "loss": 4.7945, "mean_token_accuracy": 0.23326583355665206, "num_tokens": 97173582.0, "step": 42435 }, { "entropy": 5.292622709274292, "epoch": 4.195334124159747, "grad_norm": 1.015625, "learning_rate": 0.0003352100570544767, "loss": 4.7176, "mean_token_accuracy": 0.24358515590429305, "num_tokens": 97184707.0, "step": 42440 }, { "entropy": 5.33841986656189, "epoch": 4.1958283906682485, "grad_norm": 1.140625, "learning_rate": 0.0003351760533565113, "loss": 4.7815, "mean_token_accuracy": 0.23643434196710586, "num_tokens": 97196496.0, "step": 42445 }, { "entropy": 5.313119792938233, "epoch": 4.19632265717675, "grad_norm": 1.1484375, "learning_rate": 0.00033514204817820564, "loss": 4.7724, "mean_token_accuracy": 0.23454810827970504, "num_tokens": 97207291.0, "step": 42450 }, { "entropy": 5.376970672607422, "epoch": 4.196816923685251, "grad_norm": 1.0859375, "learning_rate": 0.0003351080415203962, "loss": 4.8464, "mean_token_accuracy": 0.2402739942073822, "num_tokens": 97219001.0, "step": 42455 }, { "entropy": 5.367410898208618, "epoch": 4.197311190193752, "grad_norm": 1.0859375, "learning_rate": 0.0003350740333839197, "loss": 4.7877, "mean_token_accuracy": 0.2346538335084915, "num_tokens": 97230451.0, "step": 42460 }, { "entropy": 5.387454891204834, "epoch": 4.197805456702254, "grad_norm": 1.078125, "learning_rate": 0.0003350400237696126, "loss": 4.8121, "mean_token_accuracy": 0.23649833500385284, "num_tokens": 97241752.0, "step": 42465 }, { "entropy": 5.300050210952759, "epoch": 4.198299723210755, "grad_norm": 1.0546875, "learning_rate": 0.00033500601267831163, "loss": 4.8001, "mean_token_accuracy": 0.23751890361309053, "num_tokens": 97253453.0, "step": 42470 }, { "entropy": 5.316939210891723, "epoch": 4.198793989719257, "grad_norm": 0.95703125, "learning_rate": 0.00033497200011085344, "loss": 4.7414, "mean_token_accuracy": 0.24616254568099977, "num_tokens": 97265963.0, "step": 42475 }, { "entropy": 5.250778532028198, "epoch": 4.199288256227758, "grad_norm": 1.0, "learning_rate": 0.0003349379860680747, "loss": 4.7377, "mean_token_accuracy": 0.23959011882543563, "num_tokens": 97278311.0, "step": 42480 }, { "entropy": 5.375354480743408, "epoch": 4.1997825227362595, "grad_norm": 1.0625, "learning_rate": 0.0003349039705508123, "loss": 4.7779, "mean_token_accuracy": 0.2360570415854454, "num_tokens": 97289437.0, "step": 42485 }, { "entropy": 5.257706356048584, "epoch": 4.200276789244761, "grad_norm": 1.078125, "learning_rate": 0.0003348699535599028, "loss": 4.7322, "mean_token_accuracy": 0.24276755303144454, "num_tokens": 97300623.0, "step": 42490 }, { "entropy": 5.346074771881104, "epoch": 4.200771055753262, "grad_norm": 1.03125, "learning_rate": 0.0003348359350961833, "loss": 4.8089, "mean_token_accuracy": 0.23722879886627196, "num_tokens": 97311584.0, "step": 42495 }, { "entropy": 5.325239658355713, "epoch": 4.201265322261763, "grad_norm": 1.0625, "learning_rate": 0.0003348019151604904, "loss": 4.7832, "mean_token_accuracy": 0.23428394347429277, "num_tokens": 97323536.0, "step": 42500 }, { "entropy": 5.285841846466065, "epoch": 4.201759588770265, "grad_norm": 1.109375, "learning_rate": 0.00033476789375366106, "loss": 4.7786, "mean_token_accuracy": 0.23768991827964783, "num_tokens": 97333203.0, "step": 42505 }, { "entropy": 5.29251618385315, "epoch": 4.202253855278767, "grad_norm": 1.0625, "learning_rate": 0.00033473387087653244, "loss": 4.7746, "mean_token_accuracy": 0.23335553407669068, "num_tokens": 97343970.0, "step": 42510 }, { "entropy": 5.349156999588013, "epoch": 4.202748121787268, "grad_norm": 1.171875, "learning_rate": 0.0003346998465299412, "loss": 4.8189, "mean_token_accuracy": 0.23127457052469252, "num_tokens": 97355636.0, "step": 42515 }, { "entropy": 5.387165451049805, "epoch": 4.203242388295769, "grad_norm": 1.1875, "learning_rate": 0.00033466582071472453, "loss": 4.8291, "mean_token_accuracy": 0.23721641600131987, "num_tokens": 97366756.0, "step": 42520 }, { "entropy": 5.346764993667603, "epoch": 4.2037366548042705, "grad_norm": 1.0234375, "learning_rate": 0.0003346317934317194, "loss": 4.8707, "mean_token_accuracy": 0.23197416961193085, "num_tokens": 97379304.0, "step": 42525 }, { "entropy": 5.284057235717773, "epoch": 4.204230921312772, "grad_norm": 1.03125, "learning_rate": 0.0003345977646817629, "loss": 4.747, "mean_token_accuracy": 0.23941375762224198, "num_tokens": 97390162.0, "step": 42530 }, { "entropy": 5.358303546905518, "epoch": 4.204725187821273, "grad_norm": 1.0546875, "learning_rate": 0.0003345637344656921, "loss": 4.8318, "mean_token_accuracy": 0.2300497069954872, "num_tokens": 97401380.0, "step": 42535 }, { "entropy": 5.312769937515259, "epoch": 4.205219454329774, "grad_norm": 1.09375, "learning_rate": 0.00033452970278434425, "loss": 4.8591, "mean_token_accuracy": 0.22911786586046218, "num_tokens": 97413056.0, "step": 42540 }, { "entropy": 5.310713100433349, "epoch": 4.2057137208382755, "grad_norm": 0.9453125, "learning_rate": 0.00033449566963855644, "loss": 4.781, "mean_token_accuracy": 0.23484326601028443, "num_tokens": 97424143.0, "step": 42545 }, { "entropy": 5.318261671066284, "epoch": 4.206207987346778, "grad_norm": 1.1640625, "learning_rate": 0.000334461635029166, "loss": 4.7748, "mean_token_accuracy": 0.23478712886571884, "num_tokens": 97435417.0, "step": 42550 }, { "entropy": 5.396165180206299, "epoch": 4.206702253855279, "grad_norm": 1.015625, "learning_rate": 0.00033442759895701, "loss": 4.9008, "mean_token_accuracy": 0.22324385046958922, "num_tokens": 97446769.0, "step": 42555 }, { "entropy": 5.360140609741211, "epoch": 4.20719652036378, "grad_norm": 1.0703125, "learning_rate": 0.00033439356142292594, "loss": 4.8602, "mean_token_accuracy": 0.2321368783712387, "num_tokens": 97456878.0, "step": 42560 }, { "entropy": 5.315714979171753, "epoch": 4.2076907868722815, "grad_norm": 1.0859375, "learning_rate": 0.00033435952242775096, "loss": 4.7857, "mean_token_accuracy": 0.23720212429761886, "num_tokens": 97467593.0, "step": 42565 }, { "entropy": 5.324829387664795, "epoch": 4.208185053380783, "grad_norm": 1.0390625, "learning_rate": 0.0003343254819723226, "loss": 4.7733, "mean_token_accuracy": 0.23432217240333558, "num_tokens": 97478024.0, "step": 42570 }, { "entropy": 5.238394832611084, "epoch": 4.208679319889284, "grad_norm": 1.0546875, "learning_rate": 0.0003342914400574782, "loss": 4.681, "mean_token_accuracy": 0.24341147243976594, "num_tokens": 97489028.0, "step": 42575 }, { "entropy": 5.267219877243042, "epoch": 4.209173586397785, "grad_norm": 1.1328125, "learning_rate": 0.00033425739668405515, "loss": 4.7543, "mean_token_accuracy": 0.23347635865211486, "num_tokens": 97500521.0, "step": 42580 }, { "entropy": 5.463055229187011, "epoch": 4.209667852906287, "grad_norm": 1.125, "learning_rate": 0.00033422335185289093, "loss": 4.9549, "mean_token_accuracy": 0.22462202608585358, "num_tokens": 97511781.0, "step": 42585 }, { "entropy": 5.3581160545349125, "epoch": 4.210162119414789, "grad_norm": 1.0703125, "learning_rate": 0.00033418930556482305, "loss": 4.7565, "mean_token_accuracy": 0.2339083194732666, "num_tokens": 97523232.0, "step": 42590 }, { "entropy": 5.269699621200561, "epoch": 4.21065638592329, "grad_norm": 1.0390625, "learning_rate": 0.0003341552578206891, "loss": 4.7468, "mean_token_accuracy": 0.24245600402355194, "num_tokens": 97534072.0, "step": 42595 }, { "entropy": 5.298760795593262, "epoch": 4.211150652431791, "grad_norm": 1.03125, "learning_rate": 0.0003341212086213266, "loss": 4.7536, "mean_token_accuracy": 0.24268517643213272, "num_tokens": 97546480.0, "step": 42600 }, { "entropy": 5.348390388488769, "epoch": 4.2116449189402925, "grad_norm": 1.1015625, "learning_rate": 0.00033408715796757316, "loss": 4.7637, "mean_token_accuracy": 0.2346019372344017, "num_tokens": 97557840.0, "step": 42605 }, { "entropy": 5.376966524124145, "epoch": 4.212139185448794, "grad_norm": 1.03125, "learning_rate": 0.0003340531058602666, "loss": 4.8213, "mean_token_accuracy": 0.23534514456987382, "num_tokens": 97570244.0, "step": 42610 }, { "entropy": 5.231751012802124, "epoch": 4.212633451957295, "grad_norm": 1.0, "learning_rate": 0.0003340190523002444, "loss": 4.6003, "mean_token_accuracy": 0.25383916199207307, "num_tokens": 97580093.0, "step": 42615 }, { "entropy": 5.343075275421143, "epoch": 4.213127718465797, "grad_norm": 1.0234375, "learning_rate": 0.00033398499728834436, "loss": 4.8415, "mean_token_accuracy": 0.2360192909836769, "num_tokens": 97592134.0, "step": 42620 }, { "entropy": 5.361737203598023, "epoch": 4.213621984974298, "grad_norm": 1.0078125, "learning_rate": 0.0003339509408254042, "loss": 4.8156, "mean_token_accuracy": 0.2317640334367752, "num_tokens": 97604881.0, "step": 42625 }, { "entropy": 5.307841873168945, "epoch": 4.2141162514828, "grad_norm": 1.171875, "learning_rate": 0.0003339168829122618, "loss": 4.783, "mean_token_accuracy": 0.2330275759100914, "num_tokens": 97615916.0, "step": 42630 }, { "entropy": 5.343351697921753, "epoch": 4.214610517991301, "grad_norm": 1.078125, "learning_rate": 0.0003338828235497549, "loss": 4.8073, "mean_token_accuracy": 0.2392779216170311, "num_tokens": 97627184.0, "step": 42635 }, { "entropy": 5.369142770767212, "epoch": 4.215104784499802, "grad_norm": 1.15625, "learning_rate": 0.00033384876273872145, "loss": 4.8137, "mean_token_accuracy": 0.2283033087849617, "num_tokens": 97637981.0, "step": 42640 }, { "entropy": 5.367418575286865, "epoch": 4.2155990510083035, "grad_norm": 1.09375, "learning_rate": 0.0003338147004799993, "loss": 4.8725, "mean_token_accuracy": 0.2315814197063446, "num_tokens": 97649103.0, "step": 42645 }, { "entropy": 5.319882345199585, "epoch": 4.216093317516805, "grad_norm": 1.046875, "learning_rate": 0.0003337806367744263, "loss": 4.7343, "mean_token_accuracy": 0.24149537533521653, "num_tokens": 97661380.0, "step": 42650 }, { "entropy": 5.3547485828399655, "epoch": 4.216587584025307, "grad_norm": 0.94140625, "learning_rate": 0.0003337465716228406, "loss": 4.8173, "mean_token_accuracy": 0.23527842015028, "num_tokens": 97672283.0, "step": 42655 }, { "entropy": 5.372689199447632, "epoch": 4.217081850533808, "grad_norm": 1.1328125, "learning_rate": 0.00033371250502608015, "loss": 4.8159, "mean_token_accuracy": 0.22934712916612626, "num_tokens": 97683918.0, "step": 42660 }, { "entropy": 5.350550365447998, "epoch": 4.217576117042309, "grad_norm": 1.25, "learning_rate": 0.0003336784369849829, "loss": 4.7527, "mean_token_accuracy": 0.24121271222829818, "num_tokens": 97695391.0, "step": 42665 }, { "entropy": 5.328643560409546, "epoch": 4.218070383550811, "grad_norm": 1.046875, "learning_rate": 0.0003336443675003871, "loss": 4.8063, "mean_token_accuracy": 0.23784839510917663, "num_tokens": 97705932.0, "step": 42670 }, { "entropy": 5.3131123065948485, "epoch": 4.218564650059312, "grad_norm": 1.0859375, "learning_rate": 0.0003336102965731306, "loss": 4.7865, "mean_token_accuracy": 0.23985977917909623, "num_tokens": 97717298.0, "step": 42675 }, { "entropy": 5.278339099884033, "epoch": 4.219058916567813, "grad_norm": 1.1640625, "learning_rate": 0.0003335762242040519, "loss": 4.7781, "mean_token_accuracy": 0.23303160518407823, "num_tokens": 97727631.0, "step": 42680 }, { "entropy": 5.30044379234314, "epoch": 4.219553183076314, "grad_norm": 1.171875, "learning_rate": 0.00033354215039398886, "loss": 4.7384, "mean_token_accuracy": 0.24633879214525223, "num_tokens": 97738363.0, "step": 42685 }, { "entropy": 5.388928413391113, "epoch": 4.220047449584817, "grad_norm": 1.140625, "learning_rate": 0.0003335080751437799, "loss": 4.784, "mean_token_accuracy": 0.23674770593643188, "num_tokens": 97750413.0, "step": 42690 }, { "entropy": 5.383850383758545, "epoch": 4.220541716093318, "grad_norm": 1.078125, "learning_rate": 0.0003334739984542632, "loss": 4.902, "mean_token_accuracy": 0.22204589545726777, "num_tokens": 97762284.0, "step": 42695 }, { "entropy": 5.259121894836426, "epoch": 4.221035982601819, "grad_norm": 1.0078125, "learning_rate": 0.0003334399203262771, "loss": 4.7409, "mean_token_accuracy": 0.24281421154737473, "num_tokens": 97774006.0, "step": 42700 }, { "entropy": 5.450127410888672, "epoch": 4.22153024911032, "grad_norm": 1.140625, "learning_rate": 0.0003334058407606598, "loss": 4.8634, "mean_token_accuracy": 0.2310248851776123, "num_tokens": 97785373.0, "step": 42705 }, { "entropy": 5.369297170639038, "epoch": 4.222024515618822, "grad_norm": 1.1015625, "learning_rate": 0.00033337175975824986, "loss": 4.8203, "mean_token_accuracy": 0.23418814986944197, "num_tokens": 97796455.0, "step": 42710 }, { "entropy": 5.3311295986175535, "epoch": 4.222518782127323, "grad_norm": 1.0234375, "learning_rate": 0.00033333767731988557, "loss": 4.7692, "mean_token_accuracy": 0.23777157813310623, "num_tokens": 97808248.0, "step": 42715 }, { "entropy": 5.376941394805908, "epoch": 4.223013048635824, "grad_norm": 1.0, "learning_rate": 0.0003333035934464052, "loss": 4.8242, "mean_token_accuracy": 0.23113659024238586, "num_tokens": 97821318.0, "step": 42720 }, { "entropy": 5.275626707077026, "epoch": 4.223507315144325, "grad_norm": 1.09375, "learning_rate": 0.0003332695081386476, "loss": 4.756, "mean_token_accuracy": 0.23383527100086213, "num_tokens": 97832213.0, "step": 42725 }, { "entropy": 5.422960567474365, "epoch": 4.224001581652828, "grad_norm": 1.03125, "learning_rate": 0.00033323542139745093, "loss": 4.9804, "mean_token_accuracy": 0.21294731944799422, "num_tokens": 97844577.0, "step": 42730 }, { "entropy": 5.382520008087158, "epoch": 4.224495848161329, "grad_norm": 1.015625, "learning_rate": 0.00033320133322365395, "loss": 4.7998, "mean_token_accuracy": 0.23778896778821945, "num_tokens": 97857366.0, "step": 42735 }, { "entropy": 5.348938035964966, "epoch": 4.22499011466983, "grad_norm": 1.0625, "learning_rate": 0.0003331672436180951, "loss": 4.8279, "mean_token_accuracy": 0.2323216527700424, "num_tokens": 97869107.0, "step": 42740 }, { "entropy": 5.31851601600647, "epoch": 4.225484381178331, "grad_norm": 1.1015625, "learning_rate": 0.000333133152581613, "loss": 4.757, "mean_token_accuracy": 0.24495879858732222, "num_tokens": 97879741.0, "step": 42745 }, { "entropy": 5.372412395477295, "epoch": 4.225978647686833, "grad_norm": 1.1953125, "learning_rate": 0.00033309906011504635, "loss": 4.8443, "mean_token_accuracy": 0.22936820536851882, "num_tokens": 97890025.0, "step": 42750 }, { "entropy": 5.301336431503296, "epoch": 4.226472914195334, "grad_norm": 1.015625, "learning_rate": 0.00033306496621923385, "loss": 4.7403, "mean_token_accuracy": 0.23741008192300797, "num_tokens": 97901584.0, "step": 42755 }, { "entropy": 5.327861547470093, "epoch": 4.226967180703835, "grad_norm": 1.109375, "learning_rate": 0.0003330308708950141, "loss": 4.7413, "mean_token_accuracy": 0.24828638434410094, "num_tokens": 97912264.0, "step": 42760 }, { "entropy": 5.3399311065673825, "epoch": 4.227461447212337, "grad_norm": 1.0390625, "learning_rate": 0.000332996774143226, "loss": 4.7726, "mean_token_accuracy": 0.23149902522563934, "num_tokens": 97922971.0, "step": 42765 }, { "entropy": 5.2983091354370115, "epoch": 4.227955713720839, "grad_norm": 1.046875, "learning_rate": 0.0003329626759647082, "loss": 4.7664, "mean_token_accuracy": 0.24226422905921935, "num_tokens": 97934528.0, "step": 42770 }, { "entropy": 5.3267905712127686, "epoch": 4.22844998022934, "grad_norm": 1.1015625, "learning_rate": 0.0003329285763602996, "loss": 4.8264, "mean_token_accuracy": 0.2395428463816643, "num_tokens": 97947426.0, "step": 42775 }, { "entropy": 5.325899219512939, "epoch": 4.228944246737841, "grad_norm": 0.98828125, "learning_rate": 0.000332894475330839, "loss": 4.7772, "mean_token_accuracy": 0.23547518998384476, "num_tokens": 97958675.0, "step": 42780 }, { "entropy": 5.276549673080444, "epoch": 4.229438513246342, "grad_norm": 1.0703125, "learning_rate": 0.00033286037287716543, "loss": 4.6601, "mean_token_accuracy": 0.2514510706067085, "num_tokens": 97970100.0, "step": 42785 }, { "entropy": 5.368840456008911, "epoch": 4.229932779754844, "grad_norm": 1.0703125, "learning_rate": 0.00033282626900011763, "loss": 4.8572, "mean_token_accuracy": 0.22620319128036498, "num_tokens": 97982265.0, "step": 42790 }, { "entropy": 5.284393358230591, "epoch": 4.230427046263345, "grad_norm": 1.125, "learning_rate": 0.0003327921637005346, "loss": 4.701, "mean_token_accuracy": 0.2442137584090233, "num_tokens": 97993804.0, "step": 42795 }, { "entropy": 5.342191886901856, "epoch": 4.230921312771846, "grad_norm": 1.0390625, "learning_rate": 0.0003327580569792554, "loss": 4.7949, "mean_token_accuracy": 0.23729234039783478, "num_tokens": 98005377.0, "step": 42800 }, { "entropy": 5.314744281768799, "epoch": 4.231415579280348, "grad_norm": 1.109375, "learning_rate": 0.00033272394883711916, "loss": 4.7566, "mean_token_accuracy": 0.24188794195652008, "num_tokens": 98016492.0, "step": 42805 }, { "entropy": 5.29534649848938, "epoch": 4.2319098457888495, "grad_norm": 1.0546875, "learning_rate": 0.0003326898392749647, "loss": 4.7399, "mean_token_accuracy": 0.2393405854701996, "num_tokens": 98027924.0, "step": 42810 }, { "entropy": 5.287148904800415, "epoch": 4.232404112297351, "grad_norm": 1.15625, "learning_rate": 0.00033265572829363125, "loss": 4.738, "mean_token_accuracy": 0.24499602168798446, "num_tokens": 98039993.0, "step": 42815 }, { "entropy": 5.284514999389648, "epoch": 4.232898378805852, "grad_norm": 1.0859375, "learning_rate": 0.00033262161589395797, "loss": 4.7474, "mean_token_accuracy": 0.23865434676408767, "num_tokens": 98051292.0, "step": 42820 }, { "entropy": 5.37974910736084, "epoch": 4.233392645314353, "grad_norm": 1.0703125, "learning_rate": 0.00033258750207678403, "loss": 4.8266, "mean_token_accuracy": 0.23669475167989731, "num_tokens": 98063462.0, "step": 42825 }, { "entropy": 5.303751277923584, "epoch": 4.233886911822855, "grad_norm": 1.0078125, "learning_rate": 0.00033255338684294854, "loss": 4.7768, "mean_token_accuracy": 0.23657925724983214, "num_tokens": 98074960.0, "step": 42830 }, { "entropy": 5.36429123878479, "epoch": 4.234381178331356, "grad_norm": 1.0703125, "learning_rate": 0.0003325192701932908, "loss": 4.7578, "mean_token_accuracy": 0.2429024249315262, "num_tokens": 98086266.0, "step": 42835 }, { "entropy": 5.370718050003052, "epoch": 4.234875444839858, "grad_norm": 1.1171875, "learning_rate": 0.0003324851521286501, "loss": 4.8454, "mean_token_accuracy": 0.23079055845737456, "num_tokens": 98097276.0, "step": 42840 }, { "entropy": 5.3900994777679445, "epoch": 4.235369711348359, "grad_norm": 1.046875, "learning_rate": 0.0003324510326498658, "loss": 4.86, "mean_token_accuracy": 0.230018749833107, "num_tokens": 98108462.0, "step": 42845 }, { "entropy": 5.292459392547608, "epoch": 4.2358639778568605, "grad_norm": 1.109375, "learning_rate": 0.0003324169117577771, "loss": 4.7656, "mean_token_accuracy": 0.240992970764637, "num_tokens": 98120384.0, "step": 42850 }, { "entropy": 5.322602796554565, "epoch": 4.236358244365362, "grad_norm": 1.1328125, "learning_rate": 0.0003323827894532236, "loss": 4.7696, "mean_token_accuracy": 0.24220128804445268, "num_tokens": 98132281.0, "step": 42855 }, { "entropy": 5.36089243888855, "epoch": 4.236852510873863, "grad_norm": 1.125, "learning_rate": 0.00033234866573704443, "loss": 4.8353, "mean_token_accuracy": 0.22713492065668106, "num_tokens": 98142027.0, "step": 42860 }, { "entropy": 5.361900520324707, "epoch": 4.237346777382364, "grad_norm": 1.171875, "learning_rate": 0.0003323145406100792, "loss": 4.7735, "mean_token_accuracy": 0.23446973860263826, "num_tokens": 98152452.0, "step": 42865 }, { "entropy": 5.353715181350708, "epoch": 4.237841043890866, "grad_norm": 1.0625, "learning_rate": 0.00033228041407316753, "loss": 4.8375, "mean_token_accuracy": 0.23109537065029145, "num_tokens": 98162968.0, "step": 42870 }, { "entropy": 5.312089681625366, "epoch": 4.238335310399368, "grad_norm": 1.1640625, "learning_rate": 0.00033224628612714863, "loss": 4.7349, "mean_token_accuracy": 0.240973536670208, "num_tokens": 98174768.0, "step": 42875 }, { "entropy": 5.406459188461303, "epoch": 4.238829576907869, "grad_norm": 1.09375, "learning_rate": 0.0003322121567728623, "loss": 4.9017, "mean_token_accuracy": 0.22769683003425598, "num_tokens": 98185602.0, "step": 42880 }, { "entropy": 5.3368573665618895, "epoch": 4.23932384341637, "grad_norm": 1.140625, "learning_rate": 0.000332178026011148, "loss": 4.6936, "mean_token_accuracy": 0.24795664697885514, "num_tokens": 98197142.0, "step": 42885 }, { "entropy": 5.35450930595398, "epoch": 4.2398181099248715, "grad_norm": 1.0625, "learning_rate": 0.00033214389384284536, "loss": 4.8785, "mean_token_accuracy": 0.22945676147937774, "num_tokens": 98209396.0, "step": 42890 }, { "entropy": 5.338319253921509, "epoch": 4.240312376433373, "grad_norm": 1.1640625, "learning_rate": 0.0003321097602687941, "loss": 4.792, "mean_token_accuracy": 0.23637172281742097, "num_tokens": 98221099.0, "step": 42895 }, { "entropy": 5.25361442565918, "epoch": 4.240806642941874, "grad_norm": 1.0703125, "learning_rate": 0.0003320756252898339, "loss": 4.7384, "mean_token_accuracy": 0.2473552018404007, "num_tokens": 98232475.0, "step": 42900 }, { "entropy": 5.331340980529785, "epoch": 4.241300909450375, "grad_norm": 1.03125, "learning_rate": 0.0003320414889068044, "loss": 4.803, "mean_token_accuracy": 0.23939184993505477, "num_tokens": 98243819.0, "step": 42905 }, { "entropy": 5.402944135665893, "epoch": 4.2417951759588775, "grad_norm": 1.0625, "learning_rate": 0.0003320073511205454, "loss": 4.829, "mean_token_accuracy": 0.23498664647340775, "num_tokens": 98254695.0, "step": 42910 }, { "entropy": 5.29288682937622, "epoch": 4.242289442467379, "grad_norm": 1.046875, "learning_rate": 0.00033197321193189684, "loss": 4.749, "mean_token_accuracy": 0.23812704533338547, "num_tokens": 98265882.0, "step": 42915 }, { "entropy": 5.275533294677734, "epoch": 4.24278370897588, "grad_norm": 1.0234375, "learning_rate": 0.0003319390713416984, "loss": 4.7371, "mean_token_accuracy": 0.24654473066329957, "num_tokens": 98277273.0, "step": 42920 }, { "entropy": 5.242871236801148, "epoch": 4.243277975484381, "grad_norm": 1.1796875, "learning_rate": 0.0003319049293507899, "loss": 4.6559, "mean_token_accuracy": 0.249835304915905, "num_tokens": 98287197.0, "step": 42925 }, { "entropy": 5.3329386711120605, "epoch": 4.2437722419928825, "grad_norm": 1.1171875, "learning_rate": 0.00033187078596001143, "loss": 4.8343, "mean_token_accuracy": 0.23463867008686065, "num_tokens": 98299264.0, "step": 42930 }, { "entropy": 5.304174280166626, "epoch": 4.244266508501384, "grad_norm": 1.0703125, "learning_rate": 0.00033183664117020266, "loss": 4.7656, "mean_token_accuracy": 0.23299144953489304, "num_tokens": 98310521.0, "step": 42935 }, { "entropy": 5.331927919387818, "epoch": 4.244760775009885, "grad_norm": 1.03125, "learning_rate": 0.0003318024949822038, "loss": 4.8533, "mean_token_accuracy": 0.2336234614253044, "num_tokens": 98322806.0, "step": 42940 }, { "entropy": 5.36851315498352, "epoch": 4.245255041518386, "grad_norm": 1.0234375, "learning_rate": 0.0003317683473968547, "loss": 4.7961, "mean_token_accuracy": 0.23478849828243256, "num_tokens": 98334825.0, "step": 42945 }, { "entropy": 5.2850987911224365, "epoch": 4.245749308026888, "grad_norm": 1.046875, "learning_rate": 0.00033173419841499546, "loss": 4.8554, "mean_token_accuracy": 0.2386896565556526, "num_tokens": 98346331.0, "step": 42950 }, { "entropy": 5.338139486312866, "epoch": 4.24624357453539, "grad_norm": 0.93359375, "learning_rate": 0.00033170004803746613, "loss": 4.781, "mean_token_accuracy": 0.23913035094738005, "num_tokens": 98357523.0, "step": 42955 }, { "entropy": 5.366272640228272, "epoch": 4.246737841043891, "grad_norm": 0.98046875, "learning_rate": 0.00033166589626510676, "loss": 4.7784, "mean_token_accuracy": 0.23127381652593612, "num_tokens": 98368552.0, "step": 42960 }, { "entropy": 5.315654039382935, "epoch": 4.247232107552392, "grad_norm": 1.0390625, "learning_rate": 0.00033163174309875764, "loss": 4.7911, "mean_token_accuracy": 0.24099546372890474, "num_tokens": 98380473.0, "step": 42965 }, { "entropy": 5.278071165084839, "epoch": 4.2477263740608935, "grad_norm": 1.125, "learning_rate": 0.0003315975885392589, "loss": 4.7193, "mean_token_accuracy": 0.24679630994796753, "num_tokens": 98391018.0, "step": 42970 }, { "entropy": 5.391857433319092, "epoch": 4.248220640569395, "grad_norm": 1.15625, "learning_rate": 0.00033156343258745067, "loss": 4.8564, "mean_token_accuracy": 0.23445035070180892, "num_tokens": 98403177.0, "step": 42975 }, { "entropy": 5.3848498344421385, "epoch": 4.248714907077896, "grad_norm": 1.0078125, "learning_rate": 0.0003315292752441731, "loss": 4.8726, "mean_token_accuracy": 0.23406767845153809, "num_tokens": 98415118.0, "step": 42980 }, { "entropy": 5.265834903717041, "epoch": 4.249209173586398, "grad_norm": 1.0390625, "learning_rate": 0.00033149511651026667, "loss": 4.6998, "mean_token_accuracy": 0.2422094687819481, "num_tokens": 98427951.0, "step": 42985 }, { "entropy": 5.338726472854614, "epoch": 4.249703440094899, "grad_norm": 1.046875, "learning_rate": 0.00033146095638657166, "loss": 4.7963, "mean_token_accuracy": 0.23975907266139984, "num_tokens": 98440935.0, "step": 42990 }, { "entropy": 5.282770776748658, "epoch": 4.250197706603401, "grad_norm": 1.109375, "learning_rate": 0.0003314267948739283, "loss": 4.7189, "mean_token_accuracy": 0.2430857926607132, "num_tokens": 98452950.0, "step": 42995 }, { "entropy": 5.348018646240234, "epoch": 4.250691973111902, "grad_norm": 1.1015625, "learning_rate": 0.00033139263197317704, "loss": 4.8168, "mean_token_accuracy": 0.2329355612397194, "num_tokens": 98463725.0, "step": 43000 }, { "entropy": 5.308806133270264, "epoch": 4.251186239620403, "grad_norm": 1.1015625, "learning_rate": 0.0003313584676851583, "loss": 4.7939, "mean_token_accuracy": 0.23601025044918061, "num_tokens": 98475244.0, "step": 43005 }, { "entropy": 5.300024461746216, "epoch": 4.2516805061289045, "grad_norm": 1.1015625, "learning_rate": 0.0003313243020107125, "loss": 4.7732, "mean_token_accuracy": 0.23600367158651353, "num_tokens": 98485625.0, "step": 43010 }, { "entropy": 5.450569295883179, "epoch": 4.252174772637406, "grad_norm": 1.125, "learning_rate": 0.00033129013495068017, "loss": 4.8733, "mean_token_accuracy": 0.22805398106575012, "num_tokens": 98496572.0, "step": 43015 }, { "entropy": 5.393940448760986, "epoch": 4.252669039145908, "grad_norm": 1.03125, "learning_rate": 0.0003312559665059017, "loss": 4.9296, "mean_token_accuracy": 0.22584612369537355, "num_tokens": 98509460.0, "step": 43020 }, { "entropy": 5.304210090637207, "epoch": 4.253163305654409, "grad_norm": 1.0234375, "learning_rate": 0.0003312217966772178, "loss": 4.8371, "mean_token_accuracy": 0.24059753865003586, "num_tokens": 98521415.0, "step": 43025 }, { "entropy": 5.344356632232666, "epoch": 4.25365757216291, "grad_norm": 1.203125, "learning_rate": 0.00033118762546546895, "loss": 4.7093, "mean_token_accuracy": 0.2429088234901428, "num_tokens": 98532188.0, "step": 43030 }, { "entropy": 5.31381630897522, "epoch": 4.254151838671412, "grad_norm": 1.078125, "learning_rate": 0.0003311534528714959, "loss": 4.7943, "mean_token_accuracy": 0.23885130882263184, "num_tokens": 98544112.0, "step": 43035 }, { "entropy": 5.320889854431153, "epoch": 4.254646105179913, "grad_norm": 1.078125, "learning_rate": 0.00033111927889613904, "loss": 4.7289, "mean_token_accuracy": 0.23669717013835906, "num_tokens": 98555054.0, "step": 43040 }, { "entropy": 5.322078704833984, "epoch": 4.255140371688414, "grad_norm": 1.1484375, "learning_rate": 0.0003310851035402393, "loss": 4.7827, "mean_token_accuracy": 0.23734069913625716, "num_tokens": 98565956.0, "step": 43045 }, { "entropy": 5.354560279846192, "epoch": 4.2556346381969155, "grad_norm": 0.984375, "learning_rate": 0.00033105092680463726, "loss": 4.8489, "mean_token_accuracy": 0.23636978417634963, "num_tokens": 98577976.0, "step": 43050 }, { "entropy": 5.395650005340576, "epoch": 4.256128904705417, "grad_norm": 1.0, "learning_rate": 0.00033101674869017377, "loss": 4.8184, "mean_token_accuracy": 0.23943312466144562, "num_tokens": 98589143.0, "step": 43055 }, { "entropy": 5.327303266525268, "epoch": 4.256623171213919, "grad_norm": 1.1953125, "learning_rate": 0.0003309825691976896, "loss": 4.7591, "mean_token_accuracy": 0.2371342211961746, "num_tokens": 98599323.0, "step": 43060 }, { "entropy": 5.323106575012207, "epoch": 4.25711743772242, "grad_norm": 1.09375, "learning_rate": 0.00033094838832802546, "loss": 4.9149, "mean_token_accuracy": 0.23079630136489868, "num_tokens": 98610869.0, "step": 43065 }, { "entropy": 5.312269783020019, "epoch": 4.257611704230921, "grad_norm": 1.109375, "learning_rate": 0.00033091420608202235, "loss": 4.7205, "mean_token_accuracy": 0.23782753199338913, "num_tokens": 98622022.0, "step": 43070 }, { "entropy": 5.364992284774781, "epoch": 4.258105970739423, "grad_norm": 1.0, "learning_rate": 0.00033088002246052105, "loss": 4.8129, "mean_token_accuracy": 0.23765429556369783, "num_tokens": 98634110.0, "step": 43075 }, { "entropy": 5.337115240097046, "epoch": 4.258600237247924, "grad_norm": 1.0234375, "learning_rate": 0.0003308458374643626, "loss": 4.8144, "mean_token_accuracy": 0.23297784030437468, "num_tokens": 98645182.0, "step": 43080 }, { "entropy": 5.377927684783936, "epoch": 4.259094503756425, "grad_norm": 1.140625, "learning_rate": 0.0003308116510943878, "loss": 4.8323, "mean_token_accuracy": 0.2333748534321785, "num_tokens": 98655651.0, "step": 43085 }, { "entropy": 5.375620698928833, "epoch": 4.259588770264926, "grad_norm": 1.109375, "learning_rate": 0.0003307774633514378, "loss": 4.7424, "mean_token_accuracy": 0.24300811737775802, "num_tokens": 98668191.0, "step": 43090 }, { "entropy": 5.302175569534302, "epoch": 4.260083036773429, "grad_norm": 1.1328125, "learning_rate": 0.00033074327423635356, "loss": 4.7604, "mean_token_accuracy": 0.23582562804222107, "num_tokens": 98678479.0, "step": 43095 }, { "entropy": 5.258258247375489, "epoch": 4.26057730328193, "grad_norm": 1.1171875, "learning_rate": 0.00033070908374997597, "loss": 4.6547, "mean_token_accuracy": 0.2525493800640106, "num_tokens": 98688702.0, "step": 43100 }, { "entropy": 5.291916942596435, "epoch": 4.261071569790431, "grad_norm": 1.03125, "learning_rate": 0.00033067489189314645, "loss": 4.7856, "mean_token_accuracy": 0.23797888606786727, "num_tokens": 98700131.0, "step": 43105 }, { "entropy": 5.311026096343994, "epoch": 4.261565836298932, "grad_norm": 1.109375, "learning_rate": 0.0003306406986667059, "loss": 4.7558, "mean_token_accuracy": 0.23726388067007065, "num_tokens": 98711134.0, "step": 43110 }, { "entropy": 5.3538641929626465, "epoch": 4.262060102807434, "grad_norm": 1.078125, "learning_rate": 0.0003306065040714955, "loss": 4.8008, "mean_token_accuracy": 0.24390111565589906, "num_tokens": 98721892.0, "step": 43115 }, { "entropy": 5.246548318862915, "epoch": 4.262554369315935, "grad_norm": 0.9375, "learning_rate": 0.0003305723081083565, "loss": 4.8017, "mean_token_accuracy": 0.2374800592660904, "num_tokens": 98734663.0, "step": 43120 }, { "entropy": 5.315846300125122, "epoch": 4.263048635824436, "grad_norm": 0.96484375, "learning_rate": 0.0003305381107781301, "loss": 4.7574, "mean_token_accuracy": 0.2368331253528595, "num_tokens": 98746216.0, "step": 43125 }, { "entropy": 5.313595247268677, "epoch": 4.263542902332938, "grad_norm": 1.1640625, "learning_rate": 0.00033050391208165755, "loss": 4.6811, "mean_token_accuracy": 0.23346201926469803, "num_tokens": 98756322.0, "step": 43130 }, { "entropy": 5.363434219360352, "epoch": 4.26403716884144, "grad_norm": 1.078125, "learning_rate": 0.00033046971201978017, "loss": 4.8832, "mean_token_accuracy": 0.2341509699821472, "num_tokens": 98768256.0, "step": 43135 }, { "entropy": 5.37886643409729, "epoch": 4.264531435349941, "grad_norm": 1.0859375, "learning_rate": 0.0003304355105933393, "loss": 4.8021, "mean_token_accuracy": 0.2332156255841255, "num_tokens": 98780787.0, "step": 43140 }, { "entropy": 5.3663873195648195, "epoch": 4.265025701858442, "grad_norm": 1.0859375, "learning_rate": 0.00033040130780317615, "loss": 4.8293, "mean_token_accuracy": 0.23271043300628663, "num_tokens": 98791965.0, "step": 43145 }, { "entropy": 5.3045738697052, "epoch": 4.265519968366943, "grad_norm": 1.0859375, "learning_rate": 0.00033036710365013234, "loss": 4.7725, "mean_token_accuracy": 0.2354791656136513, "num_tokens": 98803087.0, "step": 43150 }, { "entropy": 5.368118190765381, "epoch": 4.266014234875445, "grad_norm": 1.0234375, "learning_rate": 0.00033033289813504916, "loss": 4.8914, "mean_token_accuracy": 0.22618015259504318, "num_tokens": 98814829.0, "step": 43155 }, { "entropy": 5.31566309928894, "epoch": 4.266508501383946, "grad_norm": 1.0234375, "learning_rate": 0.0003302986912587681, "loss": 4.7884, "mean_token_accuracy": 0.23376249372959138, "num_tokens": 98826144.0, "step": 43160 }, { "entropy": 5.377212238311768, "epoch": 4.267002767892448, "grad_norm": 1.0390625, "learning_rate": 0.0003302644830221307, "loss": 4.8244, "mean_token_accuracy": 0.2347167655825615, "num_tokens": 98836233.0, "step": 43165 }, { "entropy": 5.327815198898316, "epoch": 4.267497034400949, "grad_norm": 1.0859375, "learning_rate": 0.0003302302734259784, "loss": 4.8253, "mean_token_accuracy": 0.23879427462816238, "num_tokens": 98849011.0, "step": 43170 }, { "entropy": 5.297722291946411, "epoch": 4.267991300909451, "grad_norm": 1.109375, "learning_rate": 0.00033019606247115276, "loss": 4.749, "mean_token_accuracy": 0.24481269270181655, "num_tokens": 98859843.0, "step": 43175 }, { "entropy": 5.312877941131592, "epoch": 4.268485567417952, "grad_norm": 1.0234375, "learning_rate": 0.00033016185015849545, "loss": 4.7995, "mean_token_accuracy": 0.23271819800138474, "num_tokens": 98871261.0, "step": 43180 }, { "entropy": 5.3448981761932375, "epoch": 4.268979833926453, "grad_norm": 1.1328125, "learning_rate": 0.00033012763648884806, "loss": 4.8068, "mean_token_accuracy": 0.24007268846035004, "num_tokens": 98882046.0, "step": 43185 }, { "entropy": 5.327058267593384, "epoch": 4.269474100434954, "grad_norm": 1.0, "learning_rate": 0.00033009342146305234, "loss": 4.8252, "mean_token_accuracy": 0.23589015305042266, "num_tokens": 98894337.0, "step": 43190 }, { "entropy": 5.340063762664795, "epoch": 4.269968366943456, "grad_norm": 1.09375, "learning_rate": 0.0003300592050819498, "loss": 4.7758, "mean_token_accuracy": 0.24024170488119126, "num_tokens": 98904766.0, "step": 43195 }, { "entropy": 5.314675760269165, "epoch": 4.270462633451958, "grad_norm": 0.96484375, "learning_rate": 0.00033002498734638233, "loss": 4.8539, "mean_token_accuracy": 0.23220335692167282, "num_tokens": 98917278.0, "step": 43200 }, { "entropy": 5.434206342697143, "epoch": 4.270956899960459, "grad_norm": 0.96484375, "learning_rate": 0.00032999076825719165, "loss": 4.8954, "mean_token_accuracy": 0.22957926243543625, "num_tokens": 98930417.0, "step": 43205 }, { "entropy": 5.4007903099060055, "epoch": 4.27145116646896, "grad_norm": 1.0546875, "learning_rate": 0.0003299565478152196, "loss": 4.8152, "mean_token_accuracy": 0.23022074848413468, "num_tokens": 98941105.0, "step": 43210 }, { "entropy": 5.323261165618897, "epoch": 4.2719454329774615, "grad_norm": 0.9765625, "learning_rate": 0.0003299223260213078, "loss": 4.7659, "mean_token_accuracy": 0.24253180325031282, "num_tokens": 98953178.0, "step": 43215 }, { "entropy": 5.341381788253784, "epoch": 4.272439699485963, "grad_norm": 1.078125, "learning_rate": 0.00032988810287629827, "loss": 4.7714, "mean_token_accuracy": 0.23790508657693862, "num_tokens": 98964394.0, "step": 43220 }, { "entropy": 5.39450855255127, "epoch": 4.272933965994464, "grad_norm": 0.98046875, "learning_rate": 0.00032985387838103296, "loss": 4.8436, "mean_token_accuracy": 0.23269788026809693, "num_tokens": 98975522.0, "step": 43225 }, { "entropy": 5.3558460712432865, "epoch": 4.273428232502965, "grad_norm": 1.0390625, "learning_rate": 0.0003298196525363537, "loss": 4.7482, "mean_token_accuracy": 0.2361828550696373, "num_tokens": 98987965.0, "step": 43230 }, { "entropy": 5.215766954421997, "epoch": 4.273922499011467, "grad_norm": 0.96875, "learning_rate": 0.0003297854253431025, "loss": 4.7256, "mean_token_accuracy": 0.24526316523551941, "num_tokens": 98999773.0, "step": 43235 }, { "entropy": 5.3371001243591305, "epoch": 4.274416765519969, "grad_norm": 1.1171875, "learning_rate": 0.0003297511968021214, "loss": 4.7793, "mean_token_accuracy": 0.23110785484313964, "num_tokens": 99010487.0, "step": 43240 }, { "entropy": 5.303388977050782, "epoch": 4.27491103202847, "grad_norm": 1.09375, "learning_rate": 0.00032971696691425225, "loss": 4.8113, "mean_token_accuracy": 0.23267461955547333, "num_tokens": 99021876.0, "step": 43245 }, { "entropy": 5.3256415843963625, "epoch": 4.275405298536971, "grad_norm": 1.0390625, "learning_rate": 0.0003296827356803373, "loss": 4.7598, "mean_token_accuracy": 0.23386134654283525, "num_tokens": 99032507.0, "step": 43250 }, { "entropy": 5.375972747802734, "epoch": 4.2758995650454725, "grad_norm": 1.078125, "learning_rate": 0.0003296485031012186, "loss": 4.8208, "mean_token_accuracy": 0.22739346325397491, "num_tokens": 99043139.0, "step": 43255 }, { "entropy": 5.412531995773316, "epoch": 4.276393831553974, "grad_norm": 1.1640625, "learning_rate": 0.0003296142691777382, "loss": 4.8761, "mean_token_accuracy": 0.2289556995034218, "num_tokens": 99053966.0, "step": 43260 }, { "entropy": 5.390116786956787, "epoch": 4.276888098062475, "grad_norm": 1.0390625, "learning_rate": 0.00032958003391073826, "loss": 4.8731, "mean_token_accuracy": 0.22984440624713898, "num_tokens": 99066118.0, "step": 43265 }, { "entropy": 5.267308902740479, "epoch": 4.277382364570976, "grad_norm": 1.0, "learning_rate": 0.0003295457973010611, "loss": 4.6899, "mean_token_accuracy": 0.24290973246097564, "num_tokens": 99078898.0, "step": 43270 }, { "entropy": 5.345128345489502, "epoch": 4.2778766310794785, "grad_norm": 1.1484375, "learning_rate": 0.00032951155934954877, "loss": 4.7944, "mean_token_accuracy": 0.23503824323415756, "num_tokens": 99089816.0, "step": 43275 }, { "entropy": 5.354590797424317, "epoch": 4.27837089758798, "grad_norm": 1.0859375, "learning_rate": 0.0003294773200570437, "loss": 4.7925, "mean_token_accuracy": 0.23732564300298692, "num_tokens": 99101033.0, "step": 43280 }, { "entropy": 5.263298177719117, "epoch": 4.278865164096481, "grad_norm": 1.0703125, "learning_rate": 0.0003294430794243881, "loss": 4.7126, "mean_token_accuracy": 0.24131736755371094, "num_tokens": 99111706.0, "step": 43285 }, { "entropy": 5.2434123992919925, "epoch": 4.279359430604982, "grad_norm": 0.98828125, "learning_rate": 0.00032940883745242425, "loss": 4.7106, "mean_token_accuracy": 0.24717034846544267, "num_tokens": 99123461.0, "step": 43290 }, { "entropy": 5.264443016052246, "epoch": 4.2798536971134835, "grad_norm": 1.1171875, "learning_rate": 0.0003293745941419946, "loss": 4.7109, "mean_token_accuracy": 0.24658769369125366, "num_tokens": 99134309.0, "step": 43295 }, { "entropy": 5.308482456207275, "epoch": 4.280347963621985, "grad_norm": 1.1875, "learning_rate": 0.0003293403494939415, "loss": 4.8022, "mean_token_accuracy": 0.23904214650392533, "num_tokens": 99145416.0, "step": 43300 }, { "entropy": 5.308979940414429, "epoch": 4.280842230130486, "grad_norm": 1.265625, "learning_rate": 0.00032930610350910734, "loss": 4.7803, "mean_token_accuracy": 0.24067213088274003, "num_tokens": 99157004.0, "step": 43305 }, { "entropy": 5.355445432662964, "epoch": 4.281336496638987, "grad_norm": 1.0703125, "learning_rate": 0.0003292718561883346, "loss": 4.7625, "mean_token_accuracy": 0.23958608955144883, "num_tokens": 99168563.0, "step": 43310 }, { "entropy": 5.331803703308106, "epoch": 4.2818307631474894, "grad_norm": 1.09375, "learning_rate": 0.0003292376075324658, "loss": 4.7631, "mean_token_accuracy": 0.2394796833395958, "num_tokens": 99180522.0, "step": 43315 }, { "entropy": 5.307262897491455, "epoch": 4.282325029655991, "grad_norm": 1.0546875, "learning_rate": 0.00032920335754234347, "loss": 4.7776, "mean_token_accuracy": 0.23479599505662918, "num_tokens": 99192487.0, "step": 43320 }, { "entropy": 5.262441539764405, "epoch": 4.282819296164492, "grad_norm": 1.1015625, "learning_rate": 0.00032916910621881015, "loss": 4.7423, "mean_token_accuracy": 0.24069931507110595, "num_tokens": 99203808.0, "step": 43325 }, { "entropy": 5.323029375076294, "epoch": 4.283313562672993, "grad_norm": 1.0234375, "learning_rate": 0.00032913485356270833, "loss": 4.8096, "mean_token_accuracy": 0.23693685829639435, "num_tokens": 99216459.0, "step": 43330 }, { "entropy": 5.335708475112915, "epoch": 4.2838078291814945, "grad_norm": 1.0625, "learning_rate": 0.00032910059957488077, "loss": 4.7336, "mean_token_accuracy": 0.23938195258378983, "num_tokens": 99227244.0, "step": 43335 }, { "entropy": 5.3516417980194095, "epoch": 4.284302095689996, "grad_norm": 1.046875, "learning_rate": 0.0003290663442561701, "loss": 4.7973, "mean_token_accuracy": 0.2352978318929672, "num_tokens": 99239034.0, "step": 43340 }, { "entropy": 5.266291618347168, "epoch": 4.284796362198497, "grad_norm": 1.0546875, "learning_rate": 0.00032903208760741887, "loss": 4.7328, "mean_token_accuracy": 0.24543497264385222, "num_tokens": 99250466.0, "step": 43345 }, { "entropy": 5.315716886520386, "epoch": 4.285290628706999, "grad_norm": 1.03125, "learning_rate": 0.00032899782962947, "loss": 4.8122, "mean_token_accuracy": 0.233647358417511, "num_tokens": 99261720.0, "step": 43350 }, { "entropy": 5.383193588256836, "epoch": 4.2857848952155, "grad_norm": 1.0546875, "learning_rate": 0.0003289635703231662, "loss": 4.8055, "mean_token_accuracy": 0.23930665850639343, "num_tokens": 99272597.0, "step": 43355 }, { "entropy": 5.308804702758789, "epoch": 4.286279161724002, "grad_norm": 1.1171875, "learning_rate": 0.00032892930968934995, "loss": 4.7688, "mean_token_accuracy": 0.24305022209882737, "num_tokens": 99284941.0, "step": 43360 }, { "entropy": 5.353890085220337, "epoch": 4.286773428232503, "grad_norm": 1.1328125, "learning_rate": 0.00032889504772886454, "loss": 4.8011, "mean_token_accuracy": 0.2344000980257988, "num_tokens": 99296096.0, "step": 43365 }, { "entropy": 5.260878181457519, "epoch": 4.287267694741004, "grad_norm": 1.1796875, "learning_rate": 0.0003288607844425526, "loss": 4.7422, "mean_token_accuracy": 0.2444363534450531, "num_tokens": 99307779.0, "step": 43370 }, { "entropy": 5.354849624633789, "epoch": 4.2877619612495055, "grad_norm": 1.0625, "learning_rate": 0.0003288265198312568, "loss": 4.8601, "mean_token_accuracy": 0.23483308553695678, "num_tokens": 99319179.0, "step": 43375 }, { "entropy": 5.39574408531189, "epoch": 4.288256227758007, "grad_norm": 1.0234375, "learning_rate": 0.0003287922538958205, "loss": 4.8809, "mean_token_accuracy": 0.2248179644346237, "num_tokens": 99331706.0, "step": 43380 }, { "entropy": 5.332489967346191, "epoch": 4.288750494266509, "grad_norm": 1.125, "learning_rate": 0.00032875798663708626, "loss": 4.8841, "mean_token_accuracy": 0.22813206762075425, "num_tokens": 99343527.0, "step": 43385 }, { "entropy": 5.298887538909912, "epoch": 4.28924476077501, "grad_norm": 1.0703125, "learning_rate": 0.00032872371805589724, "loss": 4.8299, "mean_token_accuracy": 0.2370663657784462, "num_tokens": 99354593.0, "step": 43390 }, { "entropy": 5.377990484237671, "epoch": 4.289739027283511, "grad_norm": 0.95703125, "learning_rate": 0.0003286894481530964, "loss": 4.8578, "mean_token_accuracy": 0.2269003137946129, "num_tokens": 99367204.0, "step": 43395 }, { "entropy": 5.341128158569336, "epoch": 4.290233293792013, "grad_norm": 1.046875, "learning_rate": 0.0003286551769295269, "loss": 4.776, "mean_token_accuracy": 0.23772181272506715, "num_tokens": 99377846.0, "step": 43400 }, { "entropy": 5.336634016036987, "epoch": 4.290727560300514, "grad_norm": 1.109375, "learning_rate": 0.0003286209043860317, "loss": 4.8787, "mean_token_accuracy": 0.22558375746011733, "num_tokens": 99388894.0, "step": 43405 }, { "entropy": 5.300992155075074, "epoch": 4.291221826809015, "grad_norm": 1.109375, "learning_rate": 0.0003285866305234539, "loss": 4.786, "mean_token_accuracy": 0.23845785558223725, "num_tokens": 99399666.0, "step": 43410 }, { "entropy": 5.313047075271607, "epoch": 4.2917160933175165, "grad_norm": 0.9296875, "learning_rate": 0.0003285523553426367, "loss": 4.7299, "mean_token_accuracy": 0.2386908233165741, "num_tokens": 99412390.0, "step": 43415 }, { "entropy": 5.347855567932129, "epoch": 4.292210359826019, "grad_norm": 1.1796875, "learning_rate": 0.0003285180788444232, "loss": 4.7856, "mean_token_accuracy": 0.23522891700267792, "num_tokens": 99424572.0, "step": 43420 }, { "entropy": 5.363104152679443, "epoch": 4.29270462633452, "grad_norm": 1.0234375, "learning_rate": 0.0003284838010296567, "loss": 4.8717, "mean_token_accuracy": 0.23060312271118164, "num_tokens": 99436911.0, "step": 43425 }, { "entropy": 5.376633739471435, "epoch": 4.293198892843021, "grad_norm": 0.9765625, "learning_rate": 0.0003284495218991803, "loss": 4.8163, "mean_token_accuracy": 0.23269210904836654, "num_tokens": 99448259.0, "step": 43430 }, { "entropy": 5.341022920608521, "epoch": 4.293693159351522, "grad_norm": 1.1171875, "learning_rate": 0.0003284152414538374, "loss": 4.8045, "mean_token_accuracy": 0.23955277502536773, "num_tokens": 99459807.0, "step": 43435 }, { "entropy": 5.361745738983155, "epoch": 4.294187425860024, "grad_norm": 1.09375, "learning_rate": 0.00032838095969447143, "loss": 4.8528, "mean_token_accuracy": 0.23514179289340972, "num_tokens": 99471204.0, "step": 43440 }, { "entropy": 5.3602673530578615, "epoch": 4.294681692368525, "grad_norm": 1.0390625, "learning_rate": 0.00032834667662192546, "loss": 4.8251, "mean_token_accuracy": 0.24040009826421738, "num_tokens": 99483906.0, "step": 43445 }, { "entropy": 5.286819171905518, "epoch": 4.295175958877026, "grad_norm": 0.9921875, "learning_rate": 0.000328312392237043, "loss": 4.7131, "mean_token_accuracy": 0.24053275883197783, "num_tokens": 99494088.0, "step": 43450 }, { "entropy": 5.277828979492187, "epoch": 4.295670225385528, "grad_norm": 1.0546875, "learning_rate": 0.0003282781065406674, "loss": 4.7757, "mean_token_accuracy": 0.2378443270921707, "num_tokens": 99504398.0, "step": 43455 }, { "entropy": 5.308355236053467, "epoch": 4.29616449189403, "grad_norm": 1.015625, "learning_rate": 0.00032824381953364205, "loss": 4.7875, "mean_token_accuracy": 0.23581496775150299, "num_tokens": 99515574.0, "step": 43460 }, { "entropy": 5.320512771606445, "epoch": 4.296658758402531, "grad_norm": 0.9765625, "learning_rate": 0.0003282095312168106, "loss": 4.7335, "mean_token_accuracy": 0.23878690749406814, "num_tokens": 99528322.0, "step": 43465 }, { "entropy": 5.29053840637207, "epoch": 4.297153024911032, "grad_norm": 1.1015625, "learning_rate": 0.00032817524159101634, "loss": 4.7637, "mean_token_accuracy": 0.24072079062461854, "num_tokens": 99539202.0, "step": 43470 }, { "entropy": 5.3343218803405765, "epoch": 4.297647291419533, "grad_norm": 1.0703125, "learning_rate": 0.0003281409506571029, "loss": 4.8303, "mean_token_accuracy": 0.23095897436141968, "num_tokens": 99552190.0, "step": 43475 }, { "entropy": 5.344204330444336, "epoch": 4.298141557928035, "grad_norm": 1.03125, "learning_rate": 0.0003281066584159138, "loss": 4.8456, "mean_token_accuracy": 0.2330071061849594, "num_tokens": 99564125.0, "step": 43480 }, { "entropy": 5.308827829360962, "epoch": 4.298635824436536, "grad_norm": 1.109375, "learning_rate": 0.00032807236486829275, "loss": 4.7811, "mean_token_accuracy": 0.2391999289393425, "num_tokens": 99575607.0, "step": 43485 }, { "entropy": 5.328232002258301, "epoch": 4.299130090945037, "grad_norm": 1.1015625, "learning_rate": 0.00032803807001508326, "loss": 4.8654, "mean_token_accuracy": 0.23355187773704528, "num_tokens": 99587054.0, "step": 43490 }, { "entropy": 5.3977278709411625, "epoch": 4.299624357453539, "grad_norm": 1.015625, "learning_rate": 0.000328003773857129, "loss": 4.8114, "mean_token_accuracy": 0.2326570823788643, "num_tokens": 99598839.0, "step": 43495 }, { "entropy": 5.3128807067871096, "epoch": 4.300118623962041, "grad_norm": 1.2265625, "learning_rate": 0.00032796947639527366, "loss": 4.7272, "mean_token_accuracy": 0.2503126636147499, "num_tokens": 99609953.0, "step": 43500 }, { "entropy": 5.223013114929199, "epoch": 4.300612890470542, "grad_norm": 1.1328125, "learning_rate": 0.000327935177630361, "loss": 4.6939, "mean_token_accuracy": 0.24088863134384156, "num_tokens": 99620916.0, "step": 43505 }, { "entropy": 5.328922319412231, "epoch": 4.301107156979043, "grad_norm": 1.1015625, "learning_rate": 0.00032790087756323476, "loss": 4.7945, "mean_token_accuracy": 0.23052822947502136, "num_tokens": 99632615.0, "step": 43510 }, { "entropy": 5.40207257270813, "epoch": 4.301601423487544, "grad_norm": 1.1328125, "learning_rate": 0.00032786657619473874, "loss": 4.7795, "mean_token_accuracy": 0.24328188151121138, "num_tokens": 99643140.0, "step": 43515 }, { "entropy": 5.2731047630310055, "epoch": 4.302095689996046, "grad_norm": 1.0390625, "learning_rate": 0.0003278322735257167, "loss": 4.7764, "mean_token_accuracy": 0.23298387974500656, "num_tokens": 99654514.0, "step": 43520 }, { "entropy": 5.357127857208252, "epoch": 4.302589956504547, "grad_norm": 1.109375, "learning_rate": 0.0003277979695570126, "loss": 4.8265, "mean_token_accuracy": 0.23185338079929352, "num_tokens": 99666168.0, "step": 43525 }, { "entropy": 5.361637210845947, "epoch": 4.303084223013049, "grad_norm": 1.0859375, "learning_rate": 0.00032776366428947023, "loss": 4.7848, "mean_token_accuracy": 0.23060792684555054, "num_tokens": 99677911.0, "step": 43530 }, { "entropy": 5.333684921264648, "epoch": 4.30357848952155, "grad_norm": 1.0546875, "learning_rate": 0.00032772935772393356, "loss": 4.756, "mean_token_accuracy": 0.23993706554174424, "num_tokens": 99688805.0, "step": 43535 }, { "entropy": 5.355072116851806, "epoch": 4.304072756030052, "grad_norm": 1.0703125, "learning_rate": 0.0003276950498612465, "loss": 4.8286, "mean_token_accuracy": 0.22951583713293075, "num_tokens": 99699613.0, "step": 43540 }, { "entropy": 5.348568439483643, "epoch": 4.304567022538553, "grad_norm": 1.078125, "learning_rate": 0.00032766074070225297, "loss": 4.7684, "mean_token_accuracy": 0.2337216094136238, "num_tokens": 99709687.0, "step": 43545 }, { "entropy": 5.323691272735596, "epoch": 4.305061289047054, "grad_norm": 1.0703125, "learning_rate": 0.0003276264302477971, "loss": 4.795, "mean_token_accuracy": 0.24107859283685684, "num_tokens": 99721105.0, "step": 43550 }, { "entropy": 5.316651487350464, "epoch": 4.305555555555555, "grad_norm": 1.140625, "learning_rate": 0.0003275921184987229, "loss": 4.7699, "mean_token_accuracy": 0.24725228548049927, "num_tokens": 99732979.0, "step": 43555 }, { "entropy": 5.307096004486084, "epoch": 4.306049822064057, "grad_norm": 1.015625, "learning_rate": 0.00032755780545587444, "loss": 4.7644, "mean_token_accuracy": 0.23665122985839843, "num_tokens": 99743964.0, "step": 43560 }, { "entropy": 5.315440082550049, "epoch": 4.306544088572558, "grad_norm": 1.03125, "learning_rate": 0.0003275234911200958, "loss": 4.7579, "mean_token_accuracy": 0.24075516015291215, "num_tokens": 99755313.0, "step": 43565 }, { "entropy": 5.337100839614868, "epoch": 4.30703835508106, "grad_norm": 1.109375, "learning_rate": 0.00032748917549223113, "loss": 4.7405, "mean_token_accuracy": 0.24343288987874984, "num_tokens": 99765807.0, "step": 43570 }, { "entropy": 5.404327440261841, "epoch": 4.307532621589561, "grad_norm": 1.03125, "learning_rate": 0.0003274548585731245, "loss": 4.8604, "mean_token_accuracy": 0.22505220472812654, "num_tokens": 99777167.0, "step": 43575 }, { "entropy": 5.2877685070037845, "epoch": 4.308026888098063, "grad_norm": 1.109375, "learning_rate": 0.0003274205403636203, "loss": 4.7656, "mean_token_accuracy": 0.23451413810253144, "num_tokens": 99787022.0, "step": 43580 }, { "entropy": 5.405334234237671, "epoch": 4.308521154606564, "grad_norm": 1.3125, "learning_rate": 0.0003273862208645627, "loss": 4.8961, "mean_token_accuracy": 0.2238166093826294, "num_tokens": 99798498.0, "step": 43585 }, { "entropy": 5.326485919952392, "epoch": 4.309015421115065, "grad_norm": 1.1640625, "learning_rate": 0.0003273519000767959, "loss": 4.8093, "mean_token_accuracy": 0.2396859645843506, "num_tokens": 99808462.0, "step": 43590 }, { "entropy": 5.395417881011963, "epoch": 4.309509687623566, "grad_norm": 1.0703125, "learning_rate": 0.00032731757800116417, "loss": 4.8887, "mean_token_accuracy": 0.22576309442520143, "num_tokens": 99820403.0, "step": 43595 }, { "entropy": 5.223902082443237, "epoch": 4.310003954132068, "grad_norm": 0.98046875, "learning_rate": 0.000327283254638512, "loss": 4.6654, "mean_token_accuracy": 0.2506034091114998, "num_tokens": 99831802.0, "step": 43600 }, { "entropy": 5.317898225784302, "epoch": 4.31049822064057, "grad_norm": 1.0234375, "learning_rate": 0.0003272489299896837, "loss": 4.7051, "mean_token_accuracy": 0.23997894376516343, "num_tokens": 99844433.0, "step": 43605 }, { "entropy": 5.353861141204834, "epoch": 4.310992487149071, "grad_norm": 0.9765625, "learning_rate": 0.0003272146040555235, "loss": 4.8095, "mean_token_accuracy": 0.23769827038049698, "num_tokens": 99856425.0, "step": 43610 }, { "entropy": 5.32326078414917, "epoch": 4.311486753657572, "grad_norm": 1.078125, "learning_rate": 0.000327180276836876, "loss": 4.8609, "mean_token_accuracy": 0.2308804288506508, "num_tokens": 99868091.0, "step": 43615 }, { "entropy": 5.2736931324005125, "epoch": 4.3119810201660735, "grad_norm": 1.09375, "learning_rate": 0.00032714594833458554, "loss": 4.7356, "mean_token_accuracy": 0.24349724799394606, "num_tokens": 99880118.0, "step": 43620 }, { "entropy": 5.391688442230224, "epoch": 4.312475286674575, "grad_norm": 1.1015625, "learning_rate": 0.00032711161854949666, "loss": 4.8354, "mean_token_accuracy": 0.23284956365823745, "num_tokens": 99891397.0, "step": 43625 }, { "entropy": 5.3485064029693605, "epoch": 4.312969553183076, "grad_norm": 0.9765625, "learning_rate": 0.00032707728748245397, "loss": 4.7573, "mean_token_accuracy": 0.2454682394862175, "num_tokens": 99903184.0, "step": 43630 }, { "entropy": 5.3540788173675535, "epoch": 4.313463819691577, "grad_norm": 1.140625, "learning_rate": 0.0003270429551343019, "loss": 4.8407, "mean_token_accuracy": 0.2287519320845604, "num_tokens": 99913946.0, "step": 43635 }, { "entropy": 5.30650691986084, "epoch": 4.3139580862000795, "grad_norm": 1.1015625, "learning_rate": 0.00032700862150588506, "loss": 4.7354, "mean_token_accuracy": 0.24486244171857835, "num_tokens": 99925367.0, "step": 43640 }, { "entropy": 5.296687841415405, "epoch": 4.314452352708581, "grad_norm": 1.125, "learning_rate": 0.00032697428659804803, "loss": 4.7731, "mean_token_accuracy": 0.23887925297021867, "num_tokens": 99937605.0, "step": 43645 }, { "entropy": 5.347714567184449, "epoch": 4.314946619217082, "grad_norm": 1.078125, "learning_rate": 0.0003269399504116355, "loss": 4.8378, "mean_token_accuracy": 0.2304942786693573, "num_tokens": 99948508.0, "step": 43650 }, { "entropy": 5.37615213394165, "epoch": 4.315440885725583, "grad_norm": 1.15625, "learning_rate": 0.0003269056129474921, "loss": 4.8275, "mean_token_accuracy": 0.23282120376825333, "num_tokens": 99959436.0, "step": 43655 }, { "entropy": 5.346037864685059, "epoch": 4.3159351522340845, "grad_norm": 1.1171875, "learning_rate": 0.0003268712742064626, "loss": 4.783, "mean_token_accuracy": 0.23479018360376358, "num_tokens": 99970164.0, "step": 43660 }, { "entropy": 5.327993011474609, "epoch": 4.316429418742586, "grad_norm": 1.0859375, "learning_rate": 0.00032683693418939175, "loss": 4.793, "mean_token_accuracy": 0.24232977926731109, "num_tokens": 99982571.0, "step": 43665 }, { "entropy": 5.228792572021485, "epoch": 4.316923685251087, "grad_norm": 1.1015625, "learning_rate": 0.00032680259289712414, "loss": 4.669, "mean_token_accuracy": 0.23879678547382355, "num_tokens": 99994482.0, "step": 43670 }, { "entropy": 5.362671995162964, "epoch": 4.317417951759589, "grad_norm": 0.984375, "learning_rate": 0.0003267682503305049, "loss": 4.8348, "mean_token_accuracy": 0.23180480748414994, "num_tokens": 100006962.0, "step": 43675 }, { "entropy": 5.4089936256408695, "epoch": 4.3179122182680905, "grad_norm": 1.0546875, "learning_rate": 0.00032673390649037853, "loss": 4.896, "mean_token_accuracy": 0.233766071498394, "num_tokens": 100018804.0, "step": 43680 }, { "entropy": 5.2480292320251465, "epoch": 4.318406484776592, "grad_norm": 1.1328125, "learning_rate": 0.0003266995613775901, "loss": 4.7539, "mean_token_accuracy": 0.24327150583267212, "num_tokens": 100029876.0, "step": 43685 }, { "entropy": 5.330488157272339, "epoch": 4.318900751285093, "grad_norm": 0.9609375, "learning_rate": 0.0003266652149929844, "loss": 4.8017, "mean_token_accuracy": 0.22931593805551528, "num_tokens": 100042368.0, "step": 43690 }, { "entropy": 5.37755446434021, "epoch": 4.319395017793594, "grad_norm": 1.0703125, "learning_rate": 0.00032663086733740644, "loss": 4.9022, "mean_token_accuracy": 0.2289140820503235, "num_tokens": 100054800.0, "step": 43695 }, { "entropy": 5.246553373336792, "epoch": 4.3198892843020955, "grad_norm": 1.046875, "learning_rate": 0.0003265965184117011, "loss": 4.7493, "mean_token_accuracy": 0.24105035960674287, "num_tokens": 100067480.0, "step": 43700 }, { "entropy": 5.346568059921265, "epoch": 4.320383550810597, "grad_norm": 0.984375, "learning_rate": 0.0003265621682167135, "loss": 4.817, "mean_token_accuracy": 0.2367657706141472, "num_tokens": 100080414.0, "step": 43705 }, { "entropy": 5.4235039234161375, "epoch": 4.320877817319099, "grad_norm": 1.0390625, "learning_rate": 0.0003265278167532884, "loss": 4.8534, "mean_token_accuracy": 0.23290876299142838, "num_tokens": 100090909.0, "step": 43710 }, { "entropy": 5.280160188674927, "epoch": 4.3213720838276, "grad_norm": 1.0625, "learning_rate": 0.0003264934640222711, "loss": 4.7507, "mean_token_accuracy": 0.23665447831153869, "num_tokens": 100101892.0, "step": 43715 }, { "entropy": 5.360473775863648, "epoch": 4.3218663503361014, "grad_norm": 0.98046875, "learning_rate": 0.0003264591100245066, "loss": 4.8284, "mean_token_accuracy": 0.22880495190620423, "num_tokens": 100115158.0, "step": 43720 }, { "entropy": 5.308194351196289, "epoch": 4.322360616844603, "grad_norm": 1.0859375, "learning_rate": 0.00032642475476084, "loss": 4.7463, "mean_token_accuracy": 0.23372405022382736, "num_tokens": 100125732.0, "step": 43725 }, { "entropy": 5.273852872848511, "epoch": 4.322854883353104, "grad_norm": 0.984375, "learning_rate": 0.0003263903982321164, "loss": 4.7375, "mean_token_accuracy": 0.23938657641410827, "num_tokens": 100138500.0, "step": 43730 }, { "entropy": 5.318027305603027, "epoch": 4.323349149861605, "grad_norm": 0.953125, "learning_rate": 0.0003263560404391811, "loss": 4.8064, "mean_token_accuracy": 0.23841096758842467, "num_tokens": 100151320.0, "step": 43735 }, { "entropy": 5.332428312301635, "epoch": 4.3238434163701065, "grad_norm": 1.015625, "learning_rate": 0.00032632168138287923, "loss": 4.7592, "mean_token_accuracy": 0.23683458268642427, "num_tokens": 100161839.0, "step": 43740 }, { "entropy": 5.348184299468994, "epoch": 4.324337682878608, "grad_norm": 0.98828125, "learning_rate": 0.000326287321064056, "loss": 4.816, "mean_token_accuracy": 0.23992809951305388, "num_tokens": 100174077.0, "step": 43745 }, { "entropy": 5.335487174987793, "epoch": 4.32483194938711, "grad_norm": 1.125, "learning_rate": 0.00032625295948355675, "loss": 4.8125, "mean_token_accuracy": 0.23923393189907075, "num_tokens": 100186971.0, "step": 43750 }, { "entropy": 5.314707040786743, "epoch": 4.325326215895611, "grad_norm": 1.03125, "learning_rate": 0.00032621859664222675, "loss": 4.7541, "mean_token_accuracy": 0.24242174625396729, "num_tokens": 100198976.0, "step": 43755 }, { "entropy": 5.324145269393921, "epoch": 4.325820482404112, "grad_norm": 1.0390625, "learning_rate": 0.00032618423254091136, "loss": 4.7701, "mean_token_accuracy": 0.23784543722867965, "num_tokens": 100210052.0, "step": 43760 }, { "entropy": 5.363352918624878, "epoch": 4.326314748912614, "grad_norm": 1.140625, "learning_rate": 0.00032614986718045583, "loss": 4.8563, "mean_token_accuracy": 0.2295169398188591, "num_tokens": 100221360.0, "step": 43765 }, { "entropy": 5.288644409179687, "epoch": 4.326809015421115, "grad_norm": 1.09375, "learning_rate": 0.0003261155005617056, "loss": 4.7273, "mean_token_accuracy": 0.24255914092063904, "num_tokens": 100232746.0, "step": 43770 }, { "entropy": 5.315880966186524, "epoch": 4.327303281929616, "grad_norm": 1.1171875, "learning_rate": 0.0003260811326855063, "loss": 4.7195, "mean_token_accuracy": 0.23547987788915634, "num_tokens": 100243604.0, "step": 43775 }, { "entropy": 5.275210618972778, "epoch": 4.3277975484381175, "grad_norm": 1.0390625, "learning_rate": 0.0003260467635527031, "loss": 4.712, "mean_token_accuracy": 0.24721470475196838, "num_tokens": 100255139.0, "step": 43780 }, { "entropy": 5.416538286209106, "epoch": 4.32829181494662, "grad_norm": 0.91796875, "learning_rate": 0.00032601239316414147, "loss": 4.8519, "mean_token_accuracy": 0.2321143254637718, "num_tokens": 100266925.0, "step": 43785 }, { "entropy": 5.385304021835327, "epoch": 4.328786081455121, "grad_norm": 1.125, "learning_rate": 0.00032597802152066724, "loss": 4.8256, "mean_token_accuracy": 0.2263998955488205, "num_tokens": 100277237.0, "step": 43790 }, { "entropy": 5.256079149246216, "epoch": 4.329280347963622, "grad_norm": 1.046875, "learning_rate": 0.0003259436486231257, "loss": 4.754, "mean_token_accuracy": 0.24739737063646317, "num_tokens": 100289212.0, "step": 43795 }, { "entropy": 5.311206674575805, "epoch": 4.329774614472123, "grad_norm": 1.09375, "learning_rate": 0.0003259092744723625, "loss": 4.8218, "mean_token_accuracy": 0.23535127490758895, "num_tokens": 100300749.0, "step": 43800 }, { "entropy": 5.341289615631103, "epoch": 4.330268880980625, "grad_norm": 1.1015625, "learning_rate": 0.00032587489906922334, "loss": 4.7347, "mean_token_accuracy": 0.24237549155950547, "num_tokens": 100309895.0, "step": 43805 }, { "entropy": 5.301108360290527, "epoch": 4.330763147489126, "grad_norm": 1.0625, "learning_rate": 0.00032584052241455366, "loss": 4.7387, "mean_token_accuracy": 0.23789992779493332, "num_tokens": 100321639.0, "step": 43810 }, { "entropy": 5.290609312057495, "epoch": 4.331257413997627, "grad_norm": 1.015625, "learning_rate": 0.00032580614450919925, "loss": 4.8246, "mean_token_accuracy": 0.23460270911455156, "num_tokens": 100334461.0, "step": 43815 }, { "entropy": 5.3564142227172855, "epoch": 4.3317516805061285, "grad_norm": 1.0859375, "learning_rate": 0.0003257717653540059, "loss": 4.8264, "mean_token_accuracy": 0.2351074308156967, "num_tokens": 100345404.0, "step": 43820 }, { "entropy": 5.353143501281738, "epoch": 4.332245947014631, "grad_norm": 1.0703125, "learning_rate": 0.00032573738494981913, "loss": 4.7704, "mean_token_accuracy": 0.23537587970495225, "num_tokens": 100356229.0, "step": 43825 }, { "entropy": 5.3608112812042235, "epoch": 4.332740213523132, "grad_norm": 1.0390625, "learning_rate": 0.00032570300329748495, "loss": 4.7984, "mean_token_accuracy": 0.23848335891962053, "num_tokens": 100367965.0, "step": 43830 }, { "entropy": 5.337514925003052, "epoch": 4.333234480031633, "grad_norm": 1.09375, "learning_rate": 0.00032566862039784886, "loss": 4.8046, "mean_token_accuracy": 0.2352360412478447, "num_tokens": 100380435.0, "step": 43835 }, { "entropy": 5.2341001510620115, "epoch": 4.333728746540134, "grad_norm": 1.15625, "learning_rate": 0.0003256342362517569, "loss": 4.6995, "mean_token_accuracy": 0.24677940905094148, "num_tokens": 100391811.0, "step": 43840 }, { "entropy": 5.25815052986145, "epoch": 4.334223013048636, "grad_norm": 1.1015625, "learning_rate": 0.0003255998508600549, "loss": 4.8406, "mean_token_accuracy": 0.2309338316321373, "num_tokens": 100403124.0, "step": 43845 }, { "entropy": 5.3468352317810055, "epoch": 4.334717279557137, "grad_norm": 1.0, "learning_rate": 0.0003255654642235888, "loss": 4.816, "mean_token_accuracy": 0.2348576620221138, "num_tokens": 100416047.0, "step": 43850 }, { "entropy": 5.341943407058716, "epoch": 4.335211546065638, "grad_norm": 0.9765625, "learning_rate": 0.0003255310763432043, "loss": 4.7795, "mean_token_accuracy": 0.2340405508875847, "num_tokens": 100427730.0, "step": 43855 }, { "entropy": 5.339884805679321, "epoch": 4.33570581257414, "grad_norm": 1.109375, "learning_rate": 0.0003254966872197475, "loss": 4.8159, "mean_token_accuracy": 0.233950175344944, "num_tokens": 100439108.0, "step": 43860 }, { "entropy": 5.3548798084259035, "epoch": 4.336200079082642, "grad_norm": 1.078125, "learning_rate": 0.0003254622968540645, "loss": 4.7987, "mean_token_accuracy": 0.23849139958620072, "num_tokens": 100451240.0, "step": 43865 }, { "entropy": 5.357322835922242, "epoch": 4.336694345591143, "grad_norm": 1.0703125, "learning_rate": 0.000325427905247001, "loss": 4.7965, "mean_token_accuracy": 0.23381129205226897, "num_tokens": 100462875.0, "step": 43870 }, { "entropy": 5.29806694984436, "epoch": 4.337188612099644, "grad_norm": 1.1171875, "learning_rate": 0.0003253935123994033, "loss": 4.7131, "mean_token_accuracy": 0.2495898649096489, "num_tokens": 100473206.0, "step": 43875 }, { "entropy": 5.261806392669678, "epoch": 4.337682878608145, "grad_norm": 1.1171875, "learning_rate": 0.0003253591183121173, "loss": 4.7144, "mean_token_accuracy": 0.24522362947463988, "num_tokens": 100483905.0, "step": 43880 }, { "entropy": 5.286119890213013, "epoch": 4.338177145116647, "grad_norm": 1.203125, "learning_rate": 0.00032532472298598926, "loss": 4.7049, "mean_token_accuracy": 0.24531617760658264, "num_tokens": 100495432.0, "step": 43885 }, { "entropy": 5.314106369018555, "epoch": 4.338671411625148, "grad_norm": 1.0, "learning_rate": 0.00032529032642186523, "loss": 4.7886, "mean_token_accuracy": 0.23629280924797058, "num_tokens": 100507300.0, "step": 43890 }, { "entropy": 5.297312641143799, "epoch": 4.33916567813365, "grad_norm": 1.0390625, "learning_rate": 0.00032525592862059133, "loss": 4.7857, "mean_token_accuracy": 0.23414232283830644, "num_tokens": 100518797.0, "step": 43895 }, { "entropy": 5.330451107025146, "epoch": 4.339659944642151, "grad_norm": 0.9921875, "learning_rate": 0.0003252215295830138, "loss": 4.8552, "mean_token_accuracy": 0.23259180337190627, "num_tokens": 100530250.0, "step": 43900 }, { "entropy": 5.288701057434082, "epoch": 4.340154211150653, "grad_norm": 1.0546875, "learning_rate": 0.0003251871293099788, "loss": 4.7582, "mean_token_accuracy": 0.24412366449832917, "num_tokens": 100541711.0, "step": 43905 }, { "entropy": 5.362044811248779, "epoch": 4.340648477659154, "grad_norm": 1.0625, "learning_rate": 0.0003251527278023327, "loss": 4.7623, "mean_token_accuracy": 0.23784874081611634, "num_tokens": 100553322.0, "step": 43910 }, { "entropy": 5.357764816284179, "epoch": 4.341142744167655, "grad_norm": 1.03125, "learning_rate": 0.0003251183250609217, "loss": 4.7809, "mean_token_accuracy": 0.2315188929438591, "num_tokens": 100564891.0, "step": 43915 }, { "entropy": 5.343333721160889, "epoch": 4.341637010676156, "grad_norm": 1.1796875, "learning_rate": 0.00032508392108659213, "loss": 4.7907, "mean_token_accuracy": 0.23414197117090224, "num_tokens": 100575211.0, "step": 43920 }, { "entropy": 5.279355049133301, "epoch": 4.342131277184658, "grad_norm": 1.046875, "learning_rate": 0.00032504951588019034, "loss": 4.7617, "mean_token_accuracy": 0.23723210841417314, "num_tokens": 100586785.0, "step": 43925 }, { "entropy": 5.36357045173645, "epoch": 4.34262554369316, "grad_norm": 1.15625, "learning_rate": 0.00032501510944256266, "loss": 4.8281, "mean_token_accuracy": 0.2331278696656227, "num_tokens": 100596834.0, "step": 43930 }, { "entropy": 5.2940551280975345, "epoch": 4.343119810201661, "grad_norm": 1.015625, "learning_rate": 0.0003249807017745555, "loss": 4.7865, "mean_token_accuracy": 0.23342131525278093, "num_tokens": 100608059.0, "step": 43935 }, { "entropy": 5.386624956130982, "epoch": 4.343614076710162, "grad_norm": 1.0390625, "learning_rate": 0.00032494629287701545, "loss": 4.8201, "mean_token_accuracy": 0.23732152581214905, "num_tokens": 100619134.0, "step": 43940 }, { "entropy": 5.289836597442627, "epoch": 4.344108343218664, "grad_norm": 1.3046875, "learning_rate": 0.0003249118827507887, "loss": 4.7511, "mean_token_accuracy": 0.24182987362146377, "num_tokens": 100629963.0, "step": 43945 }, { "entropy": 5.410674381256103, "epoch": 4.344602609727165, "grad_norm": 1.1171875, "learning_rate": 0.0003248774713967219, "loss": 4.9302, "mean_token_accuracy": 0.22326735854148866, "num_tokens": 100641267.0, "step": 43950 }, { "entropy": 5.352747917175293, "epoch": 4.345096876235666, "grad_norm": 1.0703125, "learning_rate": 0.0003248430588156616, "loss": 4.8108, "mean_token_accuracy": 0.23874279707670212, "num_tokens": 100652664.0, "step": 43955 }, { "entropy": 5.368550539016724, "epoch": 4.345591142744167, "grad_norm": 1.0078125, "learning_rate": 0.0003248086450084544, "loss": 4.777, "mean_token_accuracy": 0.2419946625828743, "num_tokens": 100664792.0, "step": 43960 }, { "entropy": 5.403084945678711, "epoch": 4.3460854092526695, "grad_norm": 0.875, "learning_rate": 0.0003247742299759468, "loss": 4.86, "mean_token_accuracy": 0.22922454923391342, "num_tokens": 100679028.0, "step": 43965 }, { "entropy": 5.273432064056396, "epoch": 4.346579675761171, "grad_norm": 1.015625, "learning_rate": 0.00032473981371898536, "loss": 4.7313, "mean_token_accuracy": 0.24948326349258423, "num_tokens": 100691119.0, "step": 43970 }, { "entropy": 5.248290777206421, "epoch": 4.347073942269672, "grad_norm": 1.09375, "learning_rate": 0.00032470539623841675, "loss": 4.7554, "mean_token_accuracy": 0.2443403035402298, "num_tokens": 100702046.0, "step": 43975 }, { "entropy": 5.32190432548523, "epoch": 4.347568208778173, "grad_norm": 1.0078125, "learning_rate": 0.00032467097753508775, "loss": 4.7921, "mean_token_accuracy": 0.24239624291658401, "num_tokens": 100714345.0, "step": 43980 }, { "entropy": 5.304919338226318, "epoch": 4.3480624752866746, "grad_norm": 1.109375, "learning_rate": 0.00032463655760984496, "loss": 4.7584, "mean_token_accuracy": 0.24634104818105698, "num_tokens": 100724526.0, "step": 43985 }, { "entropy": 5.393564081192016, "epoch": 4.348556741795176, "grad_norm": 0.96484375, "learning_rate": 0.0003246021364635352, "loss": 4.8143, "mean_token_accuracy": 0.23351355791091918, "num_tokens": 100736413.0, "step": 43990 }, { "entropy": 5.387916707992554, "epoch": 4.349051008303677, "grad_norm": 1.0703125, "learning_rate": 0.00032456771409700516, "loss": 4.8954, "mean_token_accuracy": 0.22766732424497604, "num_tokens": 100747431.0, "step": 43995 }, { "entropy": 5.3198929786682125, "epoch": 4.349545274812178, "grad_norm": 1.1171875, "learning_rate": 0.00032453329051110156, "loss": 4.7845, "mean_token_accuracy": 0.24117101430892945, "num_tokens": 100758475.0, "step": 44000 }, { "entropy": 5.3012213706970215, "epoch": 4.3500395413206805, "grad_norm": 1.0546875, "learning_rate": 0.0003244988657066715, "loss": 4.7051, "mean_token_accuracy": 0.2454161450266838, "num_tokens": 100769145.0, "step": 44005 }, { "entropy": 5.264379596710205, "epoch": 4.350533807829182, "grad_norm": 0.91015625, "learning_rate": 0.00032446443968456166, "loss": 4.7501, "mean_token_accuracy": 0.24306197017431258, "num_tokens": 100780074.0, "step": 44010 }, { "entropy": 5.309531593322754, "epoch": 4.351028074337683, "grad_norm": 1.078125, "learning_rate": 0.00032443001244561876, "loss": 4.7557, "mean_token_accuracy": 0.23610669523477554, "num_tokens": 100790752.0, "step": 44015 }, { "entropy": 5.328971290588379, "epoch": 4.351522340846184, "grad_norm": 0.95703125, "learning_rate": 0.00032439558399069006, "loss": 4.8689, "mean_token_accuracy": 0.2335515394806862, "num_tokens": 100801803.0, "step": 44020 }, { "entropy": 5.307066774368286, "epoch": 4.3520166073546855, "grad_norm": 1.0625, "learning_rate": 0.00032436115432062226, "loss": 4.725, "mean_token_accuracy": 0.24294476062059403, "num_tokens": 100813221.0, "step": 44025 }, { "entropy": 5.364497518539428, "epoch": 4.352510873863187, "grad_norm": 1.140625, "learning_rate": 0.00032432672343626234, "loss": 4.7504, "mean_token_accuracy": 0.23762557357549668, "num_tokens": 100825159.0, "step": 44030 }, { "entropy": 5.367633914947509, "epoch": 4.353005140371688, "grad_norm": 1.109375, "learning_rate": 0.00032429229133845743, "loss": 4.7949, "mean_token_accuracy": 0.230307137966156, "num_tokens": 100836282.0, "step": 44035 }, { "entropy": 5.316570711135864, "epoch": 4.35349940688019, "grad_norm": 1.0390625, "learning_rate": 0.0003242578580280546, "loss": 4.7531, "mean_token_accuracy": 0.23402047902345657, "num_tokens": 100847543.0, "step": 44040 }, { "entropy": 5.246166849136353, "epoch": 4.3539936733886915, "grad_norm": 1.1640625, "learning_rate": 0.00032422342350590065, "loss": 4.7106, "mean_token_accuracy": 0.24792563170194626, "num_tokens": 100859038.0, "step": 44045 }, { "entropy": 5.341276979446411, "epoch": 4.354487939897193, "grad_norm": 1.0625, "learning_rate": 0.00032418898777284295, "loss": 4.7939, "mean_token_accuracy": 0.23395656198263168, "num_tokens": 100869678.0, "step": 44050 }, { "entropy": 5.3538929462432865, "epoch": 4.354982206405694, "grad_norm": 1.09375, "learning_rate": 0.0003241545508297285, "loss": 4.7794, "mean_token_accuracy": 0.23283051401376725, "num_tokens": 100881305.0, "step": 44055 }, { "entropy": 5.341913270950317, "epoch": 4.355476472914195, "grad_norm": 1.1640625, "learning_rate": 0.00032412011267740447, "loss": 4.8198, "mean_token_accuracy": 0.2331520363688469, "num_tokens": 100892085.0, "step": 44060 }, { "entropy": 5.448115444183349, "epoch": 4.3559707394226965, "grad_norm": 1.1953125, "learning_rate": 0.0003240856733167181, "loss": 4.952, "mean_token_accuracy": 0.22262182533740998, "num_tokens": 100903558.0, "step": 44065 }, { "entropy": 5.338313865661621, "epoch": 4.356465005931198, "grad_norm": 1.1796875, "learning_rate": 0.00032405123274851643, "loss": 4.7633, "mean_token_accuracy": 0.23917740285396577, "num_tokens": 100914219.0, "step": 44070 }, { "entropy": 5.364229154586792, "epoch": 4.356959272439699, "grad_norm": 0.97265625, "learning_rate": 0.0003240167909736469, "loss": 4.8413, "mean_token_accuracy": 0.23137188851833343, "num_tokens": 100926846.0, "step": 44075 }, { "entropy": 5.331101274490356, "epoch": 4.357453538948201, "grad_norm": 1.1015625, "learning_rate": 0.0003239823479929567, "loss": 4.8025, "mean_token_accuracy": 0.2385060518980026, "num_tokens": 100937502.0, "step": 44080 }, { "entropy": 5.295206499099732, "epoch": 4.3579478054567025, "grad_norm": 1.0703125, "learning_rate": 0.00032394790380729316, "loss": 4.812, "mean_token_accuracy": 0.23739813566207885, "num_tokens": 100949797.0, "step": 44085 }, { "entropy": 5.287460517883301, "epoch": 4.358442071965204, "grad_norm": 1.046875, "learning_rate": 0.00032391345841750356, "loss": 4.7428, "mean_token_accuracy": 0.24556821286678315, "num_tokens": 100960952.0, "step": 44090 }, { "entropy": 5.357002305984497, "epoch": 4.358936338473705, "grad_norm": 1.1015625, "learning_rate": 0.0003238790118244353, "loss": 4.8153, "mean_token_accuracy": 0.23624259531497954, "num_tokens": 100971691.0, "step": 44095 }, { "entropy": 5.280117225646973, "epoch": 4.359430604982206, "grad_norm": 1.21875, "learning_rate": 0.0003238445640289358, "loss": 4.7063, "mean_token_accuracy": 0.24339420944452286, "num_tokens": 100982872.0, "step": 44100 }, { "entropy": 5.281553268432617, "epoch": 4.3599248714907075, "grad_norm": 1.0234375, "learning_rate": 0.00032381011503185243, "loss": 4.7302, "mean_token_accuracy": 0.24181388169527054, "num_tokens": 100994435.0, "step": 44105 }, { "entropy": 5.362699937820435, "epoch": 4.360419137999209, "grad_norm": 1.1171875, "learning_rate": 0.00032377566483403266, "loss": 4.8156, "mean_token_accuracy": 0.23600297272205353, "num_tokens": 101006647.0, "step": 44110 }, { "entropy": 5.295404529571533, "epoch": 4.360913404507711, "grad_norm": 1.0625, "learning_rate": 0.00032374121343632396, "loss": 4.716, "mean_token_accuracy": 0.245149464905262, "num_tokens": 101018156.0, "step": 44115 }, { "entropy": 5.335127449035644, "epoch": 4.361407671016212, "grad_norm": 1.15625, "learning_rate": 0.0003237067608395738, "loss": 4.8075, "mean_token_accuracy": 0.2344482123851776, "num_tokens": 101028691.0, "step": 44120 }, { "entropy": 5.342743921279907, "epoch": 4.3619019375247134, "grad_norm": 1.1171875, "learning_rate": 0.00032367230704462985, "loss": 4.8139, "mean_token_accuracy": 0.2311120629310608, "num_tokens": 101040658.0, "step": 44125 }, { "entropy": 5.371750259399414, "epoch": 4.362396204033215, "grad_norm": 1.046875, "learning_rate": 0.00032363785205233954, "loss": 4.8271, "mean_token_accuracy": 0.2309667006134987, "num_tokens": 101052879.0, "step": 44130 }, { "entropy": 5.342494821548462, "epoch": 4.362890470541716, "grad_norm": 1.0546875, "learning_rate": 0.00032360339586355054, "loss": 4.7894, "mean_token_accuracy": 0.23381114453077317, "num_tokens": 101064349.0, "step": 44135 }, { "entropy": 5.304430103302002, "epoch": 4.363384737050217, "grad_norm": 0.99609375, "learning_rate": 0.00032356893847911044, "loss": 4.6998, "mean_token_accuracy": 0.24220327883958817, "num_tokens": 101078624.0, "step": 44140 }, { "entropy": 5.269860029220581, "epoch": 4.3638790035587185, "grad_norm": 0.98046875, "learning_rate": 0.00032353447989986697, "loss": 4.681, "mean_token_accuracy": 0.24624003022909163, "num_tokens": 101089822.0, "step": 44145 }, { "entropy": 5.257296133041382, "epoch": 4.364373270067221, "grad_norm": 1.078125, "learning_rate": 0.0003235000201266678, "loss": 4.6911, "mean_token_accuracy": 0.2472910389304161, "num_tokens": 101100499.0, "step": 44150 }, { "entropy": 5.162185573577881, "epoch": 4.364867536575722, "grad_norm": 1.0859375, "learning_rate": 0.00032346555916036053, "loss": 4.614, "mean_token_accuracy": 0.2518194615840912, "num_tokens": 101112331.0, "step": 44155 }, { "entropy": 5.395601415634156, "epoch": 4.365361803084223, "grad_norm": 1.1328125, "learning_rate": 0.00032343109700179294, "loss": 4.8945, "mean_token_accuracy": 0.22631900757551193, "num_tokens": 101123491.0, "step": 44160 }, { "entropy": 5.29633903503418, "epoch": 4.365856069592724, "grad_norm": 1.1328125, "learning_rate": 0.0003233966336518129, "loss": 4.7628, "mean_token_accuracy": 0.24230888336896897, "num_tokens": 101134039.0, "step": 44165 }, { "entropy": 5.412230014801025, "epoch": 4.366350336101226, "grad_norm": 0.99609375, "learning_rate": 0.0003233621691112683, "loss": 4.8352, "mean_token_accuracy": 0.2343962997198105, "num_tokens": 101145910.0, "step": 44170 }, { "entropy": 5.371070909500122, "epoch": 4.366844602609727, "grad_norm": 1.125, "learning_rate": 0.00032332770338100664, "loss": 4.8412, "mean_token_accuracy": 0.23354553878307344, "num_tokens": 101155924.0, "step": 44175 }, { "entropy": 5.306935834884643, "epoch": 4.367338869118228, "grad_norm": 1.0390625, "learning_rate": 0.0003232932364618761, "loss": 4.7555, "mean_token_accuracy": 0.2371943399310112, "num_tokens": 101166656.0, "step": 44180 }, { "entropy": 5.402417278289795, "epoch": 4.36783313562673, "grad_norm": 0.99609375, "learning_rate": 0.00032325876835472445, "loss": 4.8835, "mean_token_accuracy": 0.2361859694123268, "num_tokens": 101177868.0, "step": 44185 }, { "entropy": 5.345723819732666, "epoch": 4.368327402135232, "grad_norm": 1.1015625, "learning_rate": 0.0003232242990603995, "loss": 4.7991, "mean_token_accuracy": 0.23946808874607087, "num_tokens": 101190114.0, "step": 44190 }, { "entropy": 5.3198834419250485, "epoch": 4.368821668643733, "grad_norm": 1.0078125, "learning_rate": 0.0003231898285797494, "loss": 4.8151, "mean_token_accuracy": 0.23657589554786682, "num_tokens": 101202417.0, "step": 44195 }, { "entropy": 5.3726770877838135, "epoch": 4.369315935152234, "grad_norm": 1.1328125, "learning_rate": 0.000323155356913622, "loss": 4.8116, "mean_token_accuracy": 0.23049331754446029, "num_tokens": 101214416.0, "step": 44200 }, { "entropy": 5.284670352935791, "epoch": 4.369810201660735, "grad_norm": 1.046875, "learning_rate": 0.00032312088406286543, "loss": 4.7279, "mean_token_accuracy": 0.234794020652771, "num_tokens": 101225304.0, "step": 44205 }, { "entropy": 5.314754581451416, "epoch": 4.370304468169237, "grad_norm": 0.95703125, "learning_rate": 0.0003230864100283276, "loss": 4.8328, "mean_token_accuracy": 0.23556348383426667, "num_tokens": 101236988.0, "step": 44210 }, { "entropy": 5.16937894821167, "epoch": 4.370798734677738, "grad_norm": 1.03125, "learning_rate": 0.0003230519348108566, "loss": 4.5778, "mean_token_accuracy": 0.2669889211654663, "num_tokens": 101248105.0, "step": 44215 }, { "entropy": 5.3402026176452635, "epoch": 4.37129300118624, "grad_norm": 0.9921875, "learning_rate": 0.0003230174584113005, "loss": 4.8388, "mean_token_accuracy": 0.2302054762840271, "num_tokens": 101260180.0, "step": 44220 }, { "entropy": 5.355409908294678, "epoch": 4.371787267694741, "grad_norm": 0.921875, "learning_rate": 0.00032298298083050756, "loss": 4.788, "mean_token_accuracy": 0.2403148278594017, "num_tokens": 101271799.0, "step": 44225 }, { "entropy": 5.253536987304687, "epoch": 4.372281534203243, "grad_norm": 1.078125, "learning_rate": 0.0003229485020693259, "loss": 4.6771, "mean_token_accuracy": 0.24777886569499968, "num_tokens": 101283111.0, "step": 44230 }, { "entropy": 5.284565782546997, "epoch": 4.372775800711744, "grad_norm": 1.0078125, "learning_rate": 0.00032291402212860347, "loss": 4.8044, "mean_token_accuracy": 0.23232778906822205, "num_tokens": 101295419.0, "step": 44235 }, { "entropy": 5.406502294540405, "epoch": 4.373270067220245, "grad_norm": 0.99609375, "learning_rate": 0.00032287954100918877, "loss": 4.9012, "mean_token_accuracy": 0.22281800657510759, "num_tokens": 101307431.0, "step": 44240 }, { "entropy": 5.368036127090454, "epoch": 4.373764333728746, "grad_norm": 1.0859375, "learning_rate": 0.00032284505871193, "loss": 4.7339, "mean_token_accuracy": 0.23967129737138748, "num_tokens": 101318080.0, "step": 44245 }, { "entropy": 5.326686716079712, "epoch": 4.374258600237248, "grad_norm": 1.03125, "learning_rate": 0.00032281057523767524, "loss": 4.7676, "mean_token_accuracy": 0.24297931492328645, "num_tokens": 101330628.0, "step": 44250 }, { "entropy": 5.299991512298584, "epoch": 4.374752866745749, "grad_norm": 1.0703125, "learning_rate": 0.00032277609058727297, "loss": 4.7741, "mean_token_accuracy": 0.24519831985235213, "num_tokens": 101340823.0, "step": 44255 }, { "entropy": 5.291479396820068, "epoch": 4.375247133254251, "grad_norm": 1.046875, "learning_rate": 0.0003227416047615714, "loss": 4.7357, "mean_token_accuracy": 0.24126608818769454, "num_tokens": 101352329.0, "step": 44260 }, { "entropy": 5.359721994400024, "epoch": 4.375741399762752, "grad_norm": 1.125, "learning_rate": 0.00032270711776141904, "loss": 4.8594, "mean_token_accuracy": 0.2289846196770668, "num_tokens": 101364223.0, "step": 44265 }, { "entropy": 5.356234312057495, "epoch": 4.376235666271254, "grad_norm": 1.0390625, "learning_rate": 0.0003226726295876642, "loss": 4.7848, "mean_token_accuracy": 0.23546517938375472, "num_tokens": 101375935.0, "step": 44270 }, { "entropy": 5.248296451568604, "epoch": 4.376729932779755, "grad_norm": 0.98828125, "learning_rate": 0.00032263814024115515, "loss": 4.6923, "mean_token_accuracy": 0.2404218316078186, "num_tokens": 101386751.0, "step": 44275 }, { "entropy": 5.325278043746948, "epoch": 4.377224199288256, "grad_norm": 1.109375, "learning_rate": 0.0003226036497227406, "loss": 4.8145, "mean_token_accuracy": 0.2320996940135956, "num_tokens": 101397863.0, "step": 44280 }, { "entropy": 5.263373231887817, "epoch": 4.377718465796757, "grad_norm": 1.1015625, "learning_rate": 0.00032256915803326874, "loss": 4.7575, "mean_token_accuracy": 0.23874174654483796, "num_tokens": 101408912.0, "step": 44285 }, { "entropy": 5.262326765060425, "epoch": 4.378212732305259, "grad_norm": 1.0, "learning_rate": 0.0003225346651735883, "loss": 4.6774, "mean_token_accuracy": 0.2470167890191078, "num_tokens": 101419784.0, "step": 44290 }, { "entropy": 5.288525009155274, "epoch": 4.37870699881376, "grad_norm": 1.1015625, "learning_rate": 0.00032250017114454773, "loss": 4.7298, "mean_token_accuracy": 0.23877475708723067, "num_tokens": 101431148.0, "step": 44295 }, { "entropy": 5.2667543411254885, "epoch": 4.379201265322262, "grad_norm": 0.97265625, "learning_rate": 0.0003224656759469956, "loss": 4.7938, "mean_token_accuracy": 0.23919251263141633, "num_tokens": 101443034.0, "step": 44300 }, { "entropy": 5.317812585830689, "epoch": 4.379695531830763, "grad_norm": 1.03125, "learning_rate": 0.00032243117958178036, "loss": 4.7893, "mean_token_accuracy": 0.2390042096376419, "num_tokens": 101455242.0, "step": 44305 }, { "entropy": 5.324315166473388, "epoch": 4.380189798339265, "grad_norm": 1.09375, "learning_rate": 0.0003223966820497508, "loss": 4.8489, "mean_token_accuracy": 0.23638201355934144, "num_tokens": 101466838.0, "step": 44310 }, { "entropy": 5.423720359802246, "epoch": 4.380684064847766, "grad_norm": 1.015625, "learning_rate": 0.0003223621833517555, "loss": 4.8545, "mean_token_accuracy": 0.23965927064418793, "num_tokens": 101479333.0, "step": 44315 }, { "entropy": 5.314926862716675, "epoch": 4.381178331356267, "grad_norm": 1.0390625, "learning_rate": 0.00032232768348864314, "loss": 4.7591, "mean_token_accuracy": 0.23834274262189864, "num_tokens": 101490891.0, "step": 44320 }, { "entropy": 5.458762836456299, "epoch": 4.381672597864768, "grad_norm": 1.0625, "learning_rate": 0.0003222931824612626, "loss": 4.9217, "mean_token_accuracy": 0.2222340524196625, "num_tokens": 101502146.0, "step": 44325 }, { "entropy": 5.340889930725098, "epoch": 4.38216686437327, "grad_norm": 0.9609375, "learning_rate": 0.0003222586802704622, "loss": 4.7843, "mean_token_accuracy": 0.24339946806430818, "num_tokens": 101514619.0, "step": 44330 }, { "entropy": 5.408047533035278, "epoch": 4.382661130881772, "grad_norm": 1.1875, "learning_rate": 0.00032222417691709097, "loss": 4.8432, "mean_token_accuracy": 0.22990763932466507, "num_tokens": 101526103.0, "step": 44335 }, { "entropy": 5.294088983535767, "epoch": 4.383155397390273, "grad_norm": 1.0, "learning_rate": 0.00032218967240199776, "loss": 4.7098, "mean_token_accuracy": 0.2444948747754097, "num_tokens": 101538503.0, "step": 44340 }, { "entropy": 5.321189069747925, "epoch": 4.383649663898774, "grad_norm": 1.0390625, "learning_rate": 0.0003221551667260313, "loss": 4.8491, "mean_token_accuracy": 0.22699005603790284, "num_tokens": 101549854.0, "step": 44345 }, { "entropy": 5.3864821434021, "epoch": 4.384143930407276, "grad_norm": 1.15625, "learning_rate": 0.00032212065989004036, "loss": 4.8552, "mean_token_accuracy": 0.23516956418752671, "num_tokens": 101561272.0, "step": 44350 }, { "entropy": 5.333758926391601, "epoch": 4.384638196915777, "grad_norm": 1.09375, "learning_rate": 0.0003220861518948738, "loss": 4.7004, "mean_token_accuracy": 0.24567063003778458, "num_tokens": 101570941.0, "step": 44355 }, { "entropy": 5.2293041229248045, "epoch": 4.385132463424278, "grad_norm": 1.0625, "learning_rate": 0.00032205164274138075, "loss": 4.7015, "mean_token_accuracy": 0.2499863922595978, "num_tokens": 101582530.0, "step": 44360 }, { "entropy": 5.3790586471557615, "epoch": 4.385626729932779, "grad_norm": 1.140625, "learning_rate": 0.0003220171324304099, "loss": 4.8929, "mean_token_accuracy": 0.23234436064958572, "num_tokens": 101594402.0, "step": 44365 }, { "entropy": 5.308555459976196, "epoch": 4.3861209964412815, "grad_norm": 1.1171875, "learning_rate": 0.0003219826209628103, "loss": 4.7484, "mean_token_accuracy": 0.241133813560009, "num_tokens": 101606399.0, "step": 44370 }, { "entropy": 5.314817428588867, "epoch": 4.386615262949783, "grad_norm": 0.9921875, "learning_rate": 0.0003219481083394309, "loss": 4.7604, "mean_token_accuracy": 0.23288825303316116, "num_tokens": 101618403.0, "step": 44375 }, { "entropy": 5.3288098812103275, "epoch": 4.387109529458284, "grad_norm": 1.171875, "learning_rate": 0.00032191359456112083, "loss": 4.8328, "mean_token_accuracy": 0.2383051335811615, "num_tokens": 101630553.0, "step": 44380 }, { "entropy": 5.351312589645386, "epoch": 4.387603795966785, "grad_norm": 1.1015625, "learning_rate": 0.0003218790796287291, "loss": 4.7848, "mean_token_accuracy": 0.23963430523872375, "num_tokens": 101642188.0, "step": 44385 }, { "entropy": 5.312469244003296, "epoch": 4.3880980624752866, "grad_norm": 1.09375, "learning_rate": 0.00032184456354310465, "loss": 4.7637, "mean_token_accuracy": 0.24277186542749404, "num_tokens": 101654202.0, "step": 44390 }, { "entropy": 5.36070613861084, "epoch": 4.388592328983788, "grad_norm": 1.2109375, "learning_rate": 0.0003218100463050967, "loss": 4.7771, "mean_token_accuracy": 0.23270287960767747, "num_tokens": 101665017.0, "step": 44395 }, { "entropy": 5.319602632522583, "epoch": 4.389086595492289, "grad_norm": 1.03125, "learning_rate": 0.0003217755279155543, "loss": 4.7672, "mean_token_accuracy": 0.23359879702329636, "num_tokens": 101675662.0, "step": 44400 }, { "entropy": 5.331365776062012, "epoch": 4.389580862000791, "grad_norm": 1.0703125, "learning_rate": 0.0003217410083753267, "loss": 4.7717, "mean_token_accuracy": 0.23566506505012513, "num_tokens": 101687707.0, "step": 44405 }, { "entropy": 5.269408750534057, "epoch": 4.3900751285092925, "grad_norm": 0.96484375, "learning_rate": 0.000321706487685263, "loss": 4.7523, "mean_token_accuracy": 0.23665716350078583, "num_tokens": 101701557.0, "step": 44410 }, { "entropy": 5.2354347705841064, "epoch": 4.390569395017794, "grad_norm": 1.015625, "learning_rate": 0.00032167196584621257, "loss": 4.6611, "mean_token_accuracy": 0.24785362035036088, "num_tokens": 101713305.0, "step": 44415 }, { "entropy": 5.27853946685791, "epoch": 4.391063661526295, "grad_norm": 1.015625, "learning_rate": 0.00032163744285902446, "loss": 4.7381, "mean_token_accuracy": 0.23855285197496415, "num_tokens": 101725390.0, "step": 44420 }, { "entropy": 5.370114278793335, "epoch": 4.391557928034796, "grad_norm": 1.0703125, "learning_rate": 0.000321602918724548, "loss": 4.8624, "mean_token_accuracy": 0.23722628355026246, "num_tokens": 101737191.0, "step": 44425 }, { "entropy": 5.343218898773193, "epoch": 4.3920521945432975, "grad_norm": 1.0390625, "learning_rate": 0.0003215683934436325, "loss": 4.8054, "mean_token_accuracy": 0.2352883532643318, "num_tokens": 101747326.0, "step": 44430 }, { "entropy": 5.295591354370117, "epoch": 4.392546461051799, "grad_norm": 1.1875, "learning_rate": 0.00032153386701712735, "loss": 4.7979, "mean_token_accuracy": 0.2439703866839409, "num_tokens": 101758214.0, "step": 44435 }, { "entropy": 5.270522689819336, "epoch": 4.393040727560301, "grad_norm": 0.984375, "learning_rate": 0.0003214993394458818, "loss": 4.7366, "mean_token_accuracy": 0.24267341643571855, "num_tokens": 101769045.0, "step": 44440 }, { "entropy": 5.346443367004395, "epoch": 4.393534994068802, "grad_norm": 1.03125, "learning_rate": 0.0003214648107307454, "loss": 4.805, "mean_token_accuracy": 0.2346317559480667, "num_tokens": 101780358.0, "step": 44445 }, { "entropy": 5.2738227367401125, "epoch": 4.3940292605773035, "grad_norm": 1.0546875, "learning_rate": 0.0003214302808725673, "loss": 4.8146, "mean_token_accuracy": 0.23389782160520553, "num_tokens": 101792370.0, "step": 44450 }, { "entropy": 5.320689058303833, "epoch": 4.394523527085805, "grad_norm": 1.125, "learning_rate": 0.0003213957498721971, "loss": 4.7582, "mean_token_accuracy": 0.2420494258403778, "num_tokens": 101803105.0, "step": 44455 }, { "entropy": 5.298312711715698, "epoch": 4.395017793594306, "grad_norm": 1.140625, "learning_rate": 0.00032136121773048445, "loss": 4.7496, "mean_token_accuracy": 0.24580717086791992, "num_tokens": 101814237.0, "step": 44460 }, { "entropy": 5.405577945709228, "epoch": 4.395512060102807, "grad_norm": 1.0390625, "learning_rate": 0.00032132668444827847, "loss": 4.8048, "mean_token_accuracy": 0.2326985329389572, "num_tokens": 101825190.0, "step": 44465 }, { "entropy": 5.321452999114991, "epoch": 4.3960063266113085, "grad_norm": 1.1640625, "learning_rate": 0.00032129215002642893, "loss": 4.7585, "mean_token_accuracy": 0.24131916612386703, "num_tokens": 101835512.0, "step": 44470 }, { "entropy": 5.32987265586853, "epoch": 4.39650059311981, "grad_norm": 1.171875, "learning_rate": 0.0003212576144657852, "loss": 4.8497, "mean_token_accuracy": 0.22903407067060472, "num_tokens": 101847329.0, "step": 44475 }, { "entropy": 5.379023504257202, "epoch": 4.396994859628312, "grad_norm": 1.0859375, "learning_rate": 0.0003212230777671971, "loss": 4.906, "mean_token_accuracy": 0.22582843154668808, "num_tokens": 101858371.0, "step": 44480 }, { "entropy": 5.382827615737915, "epoch": 4.397489126136813, "grad_norm": 1.0390625, "learning_rate": 0.0003211885399315141, "loss": 4.8271, "mean_token_accuracy": 0.23481577038764953, "num_tokens": 101869011.0, "step": 44485 }, { "entropy": 5.344636058807373, "epoch": 4.3979833926453145, "grad_norm": 1.09375, "learning_rate": 0.00032115400095958585, "loss": 4.777, "mean_token_accuracy": 0.24100314378738402, "num_tokens": 101880147.0, "step": 44490 }, { "entropy": 5.332358455657959, "epoch": 4.398477659153816, "grad_norm": 1.1640625, "learning_rate": 0.000321119460852262, "loss": 4.7588, "mean_token_accuracy": 0.2339308053255081, "num_tokens": 101891519.0, "step": 44495 }, { "entropy": 5.2399779796600345, "epoch": 4.398971925662317, "grad_norm": 1.0859375, "learning_rate": 0.0003210849196103922, "loss": 4.6941, "mean_token_accuracy": 0.2437155470252037, "num_tokens": 101902575.0, "step": 44500 }, { "entropy": 5.298125982284546, "epoch": 4.399466192170818, "grad_norm": 1.0625, "learning_rate": 0.00032105037723482635, "loss": 4.7744, "mean_token_accuracy": 0.23850204646587372, "num_tokens": 101913717.0, "step": 44505 }, { "entropy": 5.3282585620880125, "epoch": 4.3999604586793195, "grad_norm": 0.98828125, "learning_rate": 0.00032101583372641404, "loss": 4.7393, "mean_token_accuracy": 0.24297213256359101, "num_tokens": 101925196.0, "step": 44510 }, { "entropy": 5.3274153709411625, "epoch": 4.400454725187822, "grad_norm": 1.09375, "learning_rate": 0.00032098128908600505, "loss": 4.7383, "mean_token_accuracy": 0.24244192838668824, "num_tokens": 101936430.0, "step": 44515 }, { "entropy": 5.313299942016601, "epoch": 4.400948991696323, "grad_norm": 1.1015625, "learning_rate": 0.0003209467433144492, "loss": 4.7594, "mean_token_accuracy": 0.23450904041528703, "num_tokens": 101947368.0, "step": 44520 }, { "entropy": 5.288051319122315, "epoch": 4.401443258204824, "grad_norm": 1.1015625, "learning_rate": 0.00032091219641259633, "loss": 4.7298, "mean_token_accuracy": 0.24469181299209594, "num_tokens": 101957474.0, "step": 44525 }, { "entropy": 5.367305946350098, "epoch": 4.4019375247133254, "grad_norm": 0.98828125, "learning_rate": 0.00032087764838129636, "loss": 4.9145, "mean_token_accuracy": 0.2304232820868492, "num_tokens": 101970141.0, "step": 44530 }, { "entropy": 5.386394739151001, "epoch": 4.402431791221827, "grad_norm": 1.0703125, "learning_rate": 0.00032084309922139907, "loss": 4.8435, "mean_token_accuracy": 0.22941281646490097, "num_tokens": 101980851.0, "step": 44535 }, { "entropy": 5.328720998764038, "epoch": 4.402926057730328, "grad_norm": 1.078125, "learning_rate": 0.00032080854893375447, "loss": 4.7894, "mean_token_accuracy": 0.23573654145002365, "num_tokens": 101992716.0, "step": 44540 }, { "entropy": 5.301068639755249, "epoch": 4.403420324238829, "grad_norm": 1.1484375, "learning_rate": 0.0003207739975192124, "loss": 4.7686, "mean_token_accuracy": 0.2307778775691986, "num_tokens": 102003419.0, "step": 44545 }, { "entropy": 5.341284561157226, "epoch": 4.4039145907473305, "grad_norm": 1.140625, "learning_rate": 0.0003207394449786231, "loss": 4.7855, "mean_token_accuracy": 0.23583525270223618, "num_tokens": 102014188.0, "step": 44550 }, { "entropy": 5.339761590957641, "epoch": 4.404408857255833, "grad_norm": 1.0703125, "learning_rate": 0.0003207048913128361, "loss": 4.7769, "mean_token_accuracy": 0.2375202566385269, "num_tokens": 102024925.0, "step": 44555 }, { "entropy": 5.258391857147217, "epoch": 4.404903123764334, "grad_norm": 1.0078125, "learning_rate": 0.0003206703365227018, "loss": 4.7547, "mean_token_accuracy": 0.2412910968065262, "num_tokens": 102036846.0, "step": 44560 }, { "entropy": 5.29480619430542, "epoch": 4.405397390272835, "grad_norm": 1.0, "learning_rate": 0.0003206357806090701, "loss": 4.7751, "mean_token_accuracy": 0.23555887043476104, "num_tokens": 102050187.0, "step": 44565 }, { "entropy": 5.334451675415039, "epoch": 4.405891656781336, "grad_norm": 1.046875, "learning_rate": 0.0003206012235727911, "loss": 4.807, "mean_token_accuracy": 0.23780345022678376, "num_tokens": 102062071.0, "step": 44570 }, { "entropy": 5.358473396301269, "epoch": 4.406385923289838, "grad_norm": 1.078125, "learning_rate": 0.00032056666541471497, "loss": 4.7652, "mean_token_accuracy": 0.24153703153133393, "num_tokens": 102073641.0, "step": 44575 }, { "entropy": 5.312619590759278, "epoch": 4.406880189798339, "grad_norm": 1.0546875, "learning_rate": 0.0003205321061356918, "loss": 4.7367, "mean_token_accuracy": 0.23820281028747559, "num_tokens": 102085328.0, "step": 44580 }, { "entropy": 5.286960077285767, "epoch": 4.40737445630684, "grad_norm": 1.1171875, "learning_rate": 0.00032049754573657176, "loss": 4.7929, "mean_token_accuracy": 0.2471661701798439, "num_tokens": 102096866.0, "step": 44585 }, { "entropy": 5.2595702648162845, "epoch": 4.407868722815342, "grad_norm": 1.1328125, "learning_rate": 0.000320462984218205, "loss": 4.7644, "mean_token_accuracy": 0.2370558574795723, "num_tokens": 102107823.0, "step": 44590 }, { "entropy": 5.295246553421021, "epoch": 4.408362989323844, "grad_norm": 1.0546875, "learning_rate": 0.00032042842158144173, "loss": 4.7017, "mean_token_accuracy": 0.2462336853146553, "num_tokens": 102118443.0, "step": 44595 }, { "entropy": 5.314772510528565, "epoch": 4.408857255832345, "grad_norm": 1.0546875, "learning_rate": 0.0003203938578271324, "loss": 4.7786, "mean_token_accuracy": 0.24243153333663942, "num_tokens": 102131745.0, "step": 44600 }, { "entropy": 5.315486717224121, "epoch": 4.409351522340846, "grad_norm": 1.15625, "learning_rate": 0.00032035929295612695, "loss": 4.7845, "mean_token_accuracy": 0.23420797735452653, "num_tokens": 102143275.0, "step": 44605 }, { "entropy": 5.305042695999146, "epoch": 4.409845788849347, "grad_norm": 1.0390625, "learning_rate": 0.000320324726969276, "loss": 4.7422, "mean_token_accuracy": 0.24095912426710128, "num_tokens": 102156125.0, "step": 44610 }, { "entropy": 5.2748627185821535, "epoch": 4.410340055357849, "grad_norm": 1.125, "learning_rate": 0.00032029015986742966, "loss": 4.7107, "mean_token_accuracy": 0.2418316975235939, "num_tokens": 102166599.0, "step": 44615 }, { "entropy": 5.226603889465332, "epoch": 4.41083432186635, "grad_norm": 1.03125, "learning_rate": 0.0003202555916514384, "loss": 4.6685, "mean_token_accuracy": 0.24858974367380143, "num_tokens": 102179320.0, "step": 44620 }, { "entropy": 5.3689531803131105, "epoch": 4.411328588374852, "grad_norm": 1.1484375, "learning_rate": 0.0003202210223221525, "loss": 4.8501, "mean_token_accuracy": 0.23513493090867996, "num_tokens": 102191786.0, "step": 44625 }, { "entropy": 5.330149602890015, "epoch": 4.411822854883353, "grad_norm": 1.1484375, "learning_rate": 0.0003201864518804225, "loss": 4.7318, "mean_token_accuracy": 0.24742392748594283, "num_tokens": 102202955.0, "step": 44630 }, { "entropy": 5.285430860519409, "epoch": 4.412317121391855, "grad_norm": 1.0390625, "learning_rate": 0.0003201518803270987, "loss": 4.6914, "mean_token_accuracy": 0.24753852784633637, "num_tokens": 102214930.0, "step": 44635 }, { "entropy": 5.335450077056885, "epoch": 4.412811387900356, "grad_norm": 1.15625, "learning_rate": 0.00032011730766303163, "loss": 4.7449, "mean_token_accuracy": 0.2442651942372322, "num_tokens": 102226009.0, "step": 44640 }, { "entropy": 5.30215311050415, "epoch": 4.413305654408857, "grad_norm": 1.0390625, "learning_rate": 0.0003200827338890719, "loss": 4.7072, "mean_token_accuracy": 0.24356864839792253, "num_tokens": 102237486.0, "step": 44645 }, { "entropy": 5.257518148422241, "epoch": 4.413799920917358, "grad_norm": 1.125, "learning_rate": 0.00032004815900606994, "loss": 4.7565, "mean_token_accuracy": 0.24063818007707596, "num_tokens": 102249094.0, "step": 44650 }, { "entropy": 5.288208389282227, "epoch": 4.41429418742586, "grad_norm": 1.015625, "learning_rate": 0.0003200135830148762, "loss": 4.8481, "mean_token_accuracy": 0.23232053071260453, "num_tokens": 102260388.0, "step": 44655 }, { "entropy": 5.336198377609253, "epoch": 4.414788453934362, "grad_norm": 1.0078125, "learning_rate": 0.0003199790059163414, "loss": 4.7905, "mean_token_accuracy": 0.2263990432024002, "num_tokens": 102272745.0, "step": 44660 }, { "entropy": 5.30090479850769, "epoch": 4.415282720442863, "grad_norm": 1.0390625, "learning_rate": 0.0003199444277113159, "loss": 4.7116, "mean_token_accuracy": 0.24071767926216125, "num_tokens": 102283566.0, "step": 44665 }, { "entropy": 5.3831559181213375, "epoch": 4.415776986951364, "grad_norm": 1.078125, "learning_rate": 0.0003199098484006507, "loss": 4.8297, "mean_token_accuracy": 0.23694909363985062, "num_tokens": 102296125.0, "step": 44670 }, { "entropy": 5.368324041366577, "epoch": 4.416271253459866, "grad_norm": 1.1171875, "learning_rate": 0.00031987526798519616, "loss": 4.7744, "mean_token_accuracy": 0.2362901970744133, "num_tokens": 102307925.0, "step": 44675 }, { "entropy": 5.37773871421814, "epoch": 4.416765519968367, "grad_norm": 1.1015625, "learning_rate": 0.00031984068646580315, "loss": 4.8204, "mean_token_accuracy": 0.23622073829174042, "num_tokens": 102318913.0, "step": 44680 }, { "entropy": 5.26620397567749, "epoch": 4.417259786476868, "grad_norm": 1.078125, "learning_rate": 0.0003198061038433222, "loss": 4.7202, "mean_token_accuracy": 0.24574780315160752, "num_tokens": 102330659.0, "step": 44685 }, { "entropy": 5.324231672286987, "epoch": 4.417754052985369, "grad_norm": 0.98828125, "learning_rate": 0.00031977152011860416, "loss": 4.764, "mean_token_accuracy": 0.23448027968406676, "num_tokens": 102342389.0, "step": 44690 }, { "entropy": 5.391245889663696, "epoch": 4.4182483194938715, "grad_norm": 1.09375, "learning_rate": 0.00031973693529249985, "loss": 4.833, "mean_token_accuracy": 0.23431337624788284, "num_tokens": 102354810.0, "step": 44695 }, { "entropy": 5.346545124053955, "epoch": 4.418742586002373, "grad_norm": 1.1328125, "learning_rate": 0.00031970234936585997, "loss": 4.7747, "mean_token_accuracy": 0.235736083984375, "num_tokens": 102366078.0, "step": 44700 }, { "entropy": 5.286738681793213, "epoch": 4.419236852510874, "grad_norm": 1.0859375, "learning_rate": 0.00031966776233953534, "loss": 4.7991, "mean_token_accuracy": 0.2422297105193138, "num_tokens": 102378480.0, "step": 44705 }, { "entropy": 5.288644409179687, "epoch": 4.419731119019375, "grad_norm": 1.0546875, "learning_rate": 0.00031963317421437675, "loss": 4.7076, "mean_token_accuracy": 0.24682599902153016, "num_tokens": 102389493.0, "step": 44710 }, { "entropy": 5.454363632202148, "epoch": 4.420225385527877, "grad_norm": 0.94140625, "learning_rate": 0.0003195985849912353, "loss": 4.8756, "mean_token_accuracy": 0.21839552223682404, "num_tokens": 102401543.0, "step": 44715 }, { "entropy": 5.324281549453735, "epoch": 4.420719652036378, "grad_norm": 1.0625, "learning_rate": 0.0003195639946709616, "loss": 4.8478, "mean_token_accuracy": 0.23013288676738738, "num_tokens": 102412758.0, "step": 44720 }, { "entropy": 5.288941240310669, "epoch": 4.421213918544879, "grad_norm": 1.0546875, "learning_rate": 0.00031952940325440685, "loss": 4.7393, "mean_token_accuracy": 0.2418810471892357, "num_tokens": 102422297.0, "step": 44725 }, { "entropy": 5.273317003250122, "epoch": 4.42170818505338, "grad_norm": 1.03125, "learning_rate": 0.00031949481074242174, "loss": 4.7354, "mean_token_accuracy": 0.2391085594892502, "num_tokens": 102433838.0, "step": 44730 }, { "entropy": 5.3785217761993405, "epoch": 4.4222024515618825, "grad_norm": 1.0390625, "learning_rate": 0.00031946021713585745, "loss": 4.7988, "mean_token_accuracy": 0.23561548292636872, "num_tokens": 102445138.0, "step": 44735 }, { "entropy": 5.3093983173370365, "epoch": 4.422696718070384, "grad_norm": 1.015625, "learning_rate": 0.0003194256224355649, "loss": 4.7164, "mean_token_accuracy": 0.24521076381206514, "num_tokens": 102457346.0, "step": 44740 }, { "entropy": 5.2663031101226805, "epoch": 4.423190984578885, "grad_norm": 1.0625, "learning_rate": 0.0003193910266423952, "loss": 4.7918, "mean_token_accuracy": 0.23781366497278214, "num_tokens": 102469463.0, "step": 44745 }, { "entropy": 5.2638274192810055, "epoch": 4.423685251087386, "grad_norm": 1.09375, "learning_rate": 0.00031935642975719936, "loss": 4.7542, "mean_token_accuracy": 0.24216633588075637, "num_tokens": 102480623.0, "step": 44750 }, { "entropy": 5.319796991348267, "epoch": 4.424179517595888, "grad_norm": 1.015625, "learning_rate": 0.0003193218317808284, "loss": 4.7654, "mean_token_accuracy": 0.2377212703227997, "num_tokens": 102492768.0, "step": 44755 }, { "entropy": 5.339050579071045, "epoch": 4.424673784104389, "grad_norm": 1.171875, "learning_rate": 0.0003192872327141335, "loss": 4.7362, "mean_token_accuracy": 0.24023153632879257, "num_tokens": 102503592.0, "step": 44760 }, { "entropy": 5.280449533462525, "epoch": 4.42516805061289, "grad_norm": 1.046875, "learning_rate": 0.00031925263255796587, "loss": 4.7722, "mean_token_accuracy": 0.23620197027921677, "num_tokens": 102515056.0, "step": 44765 }, { "entropy": 5.3257981300354, "epoch": 4.425662317121392, "grad_norm": 1.0390625, "learning_rate": 0.00031921803131317657, "loss": 4.7591, "mean_token_accuracy": 0.2385366752743721, "num_tokens": 102525749.0, "step": 44770 }, { "entropy": 5.3412172317504885, "epoch": 4.4261565836298935, "grad_norm": 1.0625, "learning_rate": 0.0003191834289806169, "loss": 4.7762, "mean_token_accuracy": 0.2406819447875023, "num_tokens": 102537760.0, "step": 44775 }, { "entropy": 5.395323467254639, "epoch": 4.426650850138395, "grad_norm": 1.1328125, "learning_rate": 0.0003191488255611379, "loss": 4.8942, "mean_token_accuracy": 0.2282566398382187, "num_tokens": 102548997.0, "step": 44780 }, { "entropy": 5.330176544189453, "epoch": 4.427145116646896, "grad_norm": 0.9609375, "learning_rate": 0.000319114221055591, "loss": 4.8028, "mean_token_accuracy": 0.23870514035224916, "num_tokens": 102562056.0, "step": 44785 }, { "entropy": 5.264283800125122, "epoch": 4.427639383155397, "grad_norm": 1.03125, "learning_rate": 0.0003190796154648275, "loss": 4.605, "mean_token_accuracy": 0.2558325111865997, "num_tokens": 102573336.0, "step": 44790 }, { "entropy": 5.299646806716919, "epoch": 4.4281336496638986, "grad_norm": 1.0546875, "learning_rate": 0.0003190450087896986, "loss": 4.7547, "mean_token_accuracy": 0.2362130030989647, "num_tokens": 102583929.0, "step": 44795 }, { "entropy": 5.221726512908935, "epoch": 4.4286279161724, "grad_norm": 1.1015625, "learning_rate": 0.00031901040103105553, "loss": 4.675, "mean_token_accuracy": 0.24717530757188796, "num_tokens": 102594444.0, "step": 44800 }, { "entropy": 5.29032154083252, "epoch": 4.429122182680901, "grad_norm": 0.94921875, "learning_rate": 0.0003189757921897498, "loss": 4.7937, "mean_token_accuracy": 0.23155249059200286, "num_tokens": 102606357.0, "step": 44805 }, { "entropy": 5.352351427078247, "epoch": 4.429616449189403, "grad_norm": 1.0859375, "learning_rate": 0.0003189411822666329, "loss": 4.8056, "mean_token_accuracy": 0.23855644315481186, "num_tokens": 102617798.0, "step": 44810 }, { "entropy": 5.316144180297852, "epoch": 4.4301107156979045, "grad_norm": 1.1171875, "learning_rate": 0.00031890657126255596, "loss": 4.7349, "mean_token_accuracy": 0.24511200040578843, "num_tokens": 102630104.0, "step": 44815 }, { "entropy": 5.2944420337677, "epoch": 4.430604982206406, "grad_norm": 1.0859375, "learning_rate": 0.00031887195917837066, "loss": 4.694, "mean_token_accuracy": 0.24577483534812927, "num_tokens": 102641469.0, "step": 44820 }, { "entropy": 5.322935247421265, "epoch": 4.431099248714907, "grad_norm": 1.109375, "learning_rate": 0.00031883734601492823, "loss": 4.8004, "mean_token_accuracy": 0.23395672738552092, "num_tokens": 102653023.0, "step": 44825 }, { "entropy": 5.369780111312866, "epoch": 4.431593515223408, "grad_norm": 0.95703125, "learning_rate": 0.0003188027317730803, "loss": 4.8039, "mean_token_accuracy": 0.23297622203826904, "num_tokens": 102665074.0, "step": 44830 }, { "entropy": 5.2748301982879635, "epoch": 4.4320877817319095, "grad_norm": 1.0078125, "learning_rate": 0.0003187681164536785, "loss": 4.7285, "mean_token_accuracy": 0.24411728233098984, "num_tokens": 102677277.0, "step": 44835 }, { "entropy": 5.334950733184814, "epoch": 4.432582048240411, "grad_norm": 1.171875, "learning_rate": 0.00031873350005757415, "loss": 4.7849, "mean_token_accuracy": 0.238698311150074, "num_tokens": 102687375.0, "step": 44840 }, { "entropy": 5.324442958831787, "epoch": 4.433076314748913, "grad_norm": 1.0859375, "learning_rate": 0.00031869888258561897, "loss": 4.7353, "mean_token_accuracy": 0.23639559298753737, "num_tokens": 102698305.0, "step": 44845 }, { "entropy": 5.305786514282227, "epoch": 4.433570581257414, "grad_norm": 1.15625, "learning_rate": 0.00031866426403866444, "loss": 4.7659, "mean_token_accuracy": 0.23916202783584595, "num_tokens": 102711887.0, "step": 44850 }, { "entropy": 5.35248064994812, "epoch": 4.4340648477659155, "grad_norm": 1.0703125, "learning_rate": 0.00031862964441756224, "loss": 4.7364, "mean_token_accuracy": 0.23751001358032225, "num_tokens": 102723187.0, "step": 44855 }, { "entropy": 5.204977321624756, "epoch": 4.434559114274417, "grad_norm": 1.1796875, "learning_rate": 0.0003185950237231641, "loss": 4.6912, "mean_token_accuracy": 0.2456397145986557, "num_tokens": 102733380.0, "step": 44860 }, { "entropy": 5.244981384277343, "epoch": 4.435053380782918, "grad_norm": 1.0078125, "learning_rate": 0.00031856040195632154, "loss": 4.7873, "mean_token_accuracy": 0.23379866778850555, "num_tokens": 102746371.0, "step": 44865 }, { "entropy": 5.316905212402344, "epoch": 4.435547647291419, "grad_norm": 1.140625, "learning_rate": 0.00031852577911788637, "loss": 4.73, "mean_token_accuracy": 0.24885126799345017, "num_tokens": 102757069.0, "step": 44870 }, { "entropy": 5.305469655990601, "epoch": 4.4360419137999205, "grad_norm": 1.046875, "learning_rate": 0.00031849115520871026, "loss": 4.7577, "mean_token_accuracy": 0.2469604179263115, "num_tokens": 102768323.0, "step": 44875 }, { "entropy": 5.36767349243164, "epoch": 4.436536180308423, "grad_norm": 1.09375, "learning_rate": 0.0003184565302296449, "loss": 4.8043, "mean_token_accuracy": 0.22915268689393997, "num_tokens": 102779330.0, "step": 44880 }, { "entropy": 5.312134504318237, "epoch": 4.437030446816924, "grad_norm": 1.1484375, "learning_rate": 0.00031842190418154235, "loss": 4.7285, "mean_token_accuracy": 0.24563467800617217, "num_tokens": 102790288.0, "step": 44885 }, { "entropy": 5.247840070724488, "epoch": 4.437524713325425, "grad_norm": 1.171875, "learning_rate": 0.00031838727706525404, "loss": 4.6484, "mean_token_accuracy": 0.24984206408262252, "num_tokens": 102800799.0, "step": 44890 }, { "entropy": 5.321243095397949, "epoch": 4.4380189798339265, "grad_norm": 1.0078125, "learning_rate": 0.0003183526488816321, "loss": 4.7643, "mean_token_accuracy": 0.23940523862838745, "num_tokens": 102811811.0, "step": 44895 }, { "entropy": 5.306449222564697, "epoch": 4.438513246342428, "grad_norm": 1.03125, "learning_rate": 0.0003183180196315282, "loss": 4.7871, "mean_token_accuracy": 0.23253554999828338, "num_tokens": 102822851.0, "step": 44900 }, { "entropy": 5.306042337417603, "epoch": 4.439007512850929, "grad_norm": 1.0703125, "learning_rate": 0.0003182833893157943, "loss": 4.7398, "mean_token_accuracy": 0.23799540251493453, "num_tokens": 102833333.0, "step": 44905 }, { "entropy": 5.340388011932373, "epoch": 4.43950177935943, "grad_norm": 1.1328125, "learning_rate": 0.0003182487579352824, "loss": 4.7429, "mean_token_accuracy": 0.2400245562195778, "num_tokens": 102844667.0, "step": 44910 }, { "entropy": 5.3750087261199955, "epoch": 4.439996045867932, "grad_norm": 1.0078125, "learning_rate": 0.00031821412549084426, "loss": 4.8347, "mean_token_accuracy": 0.23729630410671235, "num_tokens": 102856701.0, "step": 44915 }, { "entropy": 5.302827501296997, "epoch": 4.440490312376434, "grad_norm": 1.0, "learning_rate": 0.0003181794919833319, "loss": 4.7599, "mean_token_accuracy": 0.23986883610486984, "num_tokens": 102869518.0, "step": 44920 }, { "entropy": 5.294432926177978, "epoch": 4.440984578884935, "grad_norm": 1.0, "learning_rate": 0.0003181448574135974, "loss": 4.7715, "mean_token_accuracy": 0.24151033461093901, "num_tokens": 102879839.0, "step": 44925 }, { "entropy": 5.319858503341675, "epoch": 4.441478845393436, "grad_norm": 1.0703125, "learning_rate": 0.0003181102217824927, "loss": 4.7383, "mean_token_accuracy": 0.23569960594177247, "num_tokens": 102892034.0, "step": 44930 }, { "entropy": 5.316538715362549, "epoch": 4.441973111901937, "grad_norm": 1.109375, "learning_rate": 0.00031807558509086987, "loss": 4.824, "mean_token_accuracy": 0.23455118834972383, "num_tokens": 102903683.0, "step": 44935 }, { "entropy": 5.397793388366699, "epoch": 4.442467378410439, "grad_norm": 1.1171875, "learning_rate": 0.000318040947339581, "loss": 4.8121, "mean_token_accuracy": 0.23504947870969772, "num_tokens": 102915115.0, "step": 44940 }, { "entropy": 5.366979026794434, "epoch": 4.44296164491894, "grad_norm": 1.125, "learning_rate": 0.000318006308529478, "loss": 4.763, "mean_token_accuracy": 0.23534921556711197, "num_tokens": 102925765.0, "step": 44945 }, { "entropy": 5.2675940036773685, "epoch": 4.443455911427442, "grad_norm": 0.98828125, "learning_rate": 0.0003179716686614133, "loss": 4.7557, "mean_token_accuracy": 0.23794179409742355, "num_tokens": 102937611.0, "step": 44950 }, { "entropy": 5.251340675354004, "epoch": 4.443950177935943, "grad_norm": 1.1328125, "learning_rate": 0.00031793702773623883, "loss": 4.7357, "mean_token_accuracy": 0.24671413004398346, "num_tokens": 102947975.0, "step": 44955 }, { "entropy": 5.290724277496338, "epoch": 4.444444444444445, "grad_norm": 1.0625, "learning_rate": 0.0003179023857548068, "loss": 4.7958, "mean_token_accuracy": 0.2348385125398636, "num_tokens": 102960040.0, "step": 44960 }, { "entropy": 5.433968782424927, "epoch": 4.444938710952946, "grad_norm": 1.1640625, "learning_rate": 0.0003178677427179694, "loss": 4.9251, "mean_token_accuracy": 0.22639469057321548, "num_tokens": 102971723.0, "step": 44965 }, { "entropy": 5.317710113525391, "epoch": 4.445432977461447, "grad_norm": 1.0078125, "learning_rate": 0.00031783309862657897, "loss": 4.7662, "mean_token_accuracy": 0.2373162105679512, "num_tokens": 102982776.0, "step": 44970 }, { "entropy": 5.414293813705444, "epoch": 4.445927243969948, "grad_norm": 1.15625, "learning_rate": 0.0003177984534814875, "loss": 4.8922, "mean_token_accuracy": 0.22919866144657136, "num_tokens": 102994043.0, "step": 44975 }, { "entropy": 5.373827981948852, "epoch": 4.44642151047845, "grad_norm": 1.0234375, "learning_rate": 0.0003177638072835476, "loss": 4.7587, "mean_token_accuracy": 0.23890901058912278, "num_tokens": 103005863.0, "step": 44980 }, { "entropy": 5.355798530578613, "epoch": 4.446915776986951, "grad_norm": 1.015625, "learning_rate": 0.00031772916003361136, "loss": 4.802, "mean_token_accuracy": 0.2338832288980484, "num_tokens": 103017584.0, "step": 44985 }, { "entropy": 5.255394077301025, "epoch": 4.447410043495453, "grad_norm": 0.99609375, "learning_rate": 0.00031769451173253117, "loss": 4.7778, "mean_token_accuracy": 0.2371091678738594, "num_tokens": 103029505.0, "step": 44990 }, { "entropy": 5.3134690284729, "epoch": 4.447904310003954, "grad_norm": 1.09375, "learning_rate": 0.0003176598623811593, "loss": 4.6928, "mean_token_accuracy": 0.24596187174320222, "num_tokens": 103039897.0, "step": 44995 }, { "entropy": 5.347834682464599, "epoch": 4.448398576512456, "grad_norm": 1.03125, "learning_rate": 0.0003176252119803483, "loss": 4.8304, "mean_token_accuracy": 0.23712922185659407, "num_tokens": 103052674.0, "step": 45000 }, { "epoch": 4.448398576512456, "eval_entropy": 5.097357267764515, "eval_loss": 4.901370048522949, "eval_mean_token_accuracy": 0.2384523722060199, "eval_num_tokens": 103052674.0, "eval_runtime": 26.6162, "eval_samples_per_second": 1221.549, "eval_steps_per_second": 152.727, "step": 45000 }, { "entropy": 5.3235749244689945, "epoch": 4.448892843020957, "grad_norm": 1.078125, "learning_rate": 0.00031759056053095035, "loss": 4.8142, "mean_token_accuracy": 0.23598869293928146, "num_tokens": 103063772.0, "step": 45005 }, { "entropy": 5.344790124893189, "epoch": 4.449387109529458, "grad_norm": 1.109375, "learning_rate": 0.00031755590803381813, "loss": 4.7455, "mean_token_accuracy": 0.2424705684185028, "num_tokens": 103074784.0, "step": 45010 }, { "entropy": 5.291651916503906, "epoch": 4.449881376037959, "grad_norm": 1.125, "learning_rate": 0.0003175212544898038, "loss": 4.6722, "mean_token_accuracy": 0.24612373858690262, "num_tokens": 103085552.0, "step": 45015 }, { "entropy": 5.319845581054688, "epoch": 4.450375642546461, "grad_norm": 1.1328125, "learning_rate": 0.0003174865998997602, "loss": 4.768, "mean_token_accuracy": 0.24583592712879182, "num_tokens": 103096499.0, "step": 45020 }, { "entropy": 5.2793214321136475, "epoch": 4.450869909054963, "grad_norm": 1.0390625, "learning_rate": 0.00031745194426453956, "loss": 4.7674, "mean_token_accuracy": 0.24172718971967697, "num_tokens": 103107669.0, "step": 45025 }, { "entropy": 5.338429594039917, "epoch": 4.451364175563464, "grad_norm": 1.0859375, "learning_rate": 0.00031741728758499457, "loss": 4.7493, "mean_token_accuracy": 0.24371614903211594, "num_tokens": 103118661.0, "step": 45030 }, { "entropy": 5.4166487693786625, "epoch": 4.451858442071965, "grad_norm": 1.2109375, "learning_rate": 0.0003173826298619776, "loss": 4.9018, "mean_token_accuracy": 0.23154225647449495, "num_tokens": 103130131.0, "step": 45035 }, { "entropy": 5.325664329528808, "epoch": 4.452352708580467, "grad_norm": 1.0546875, "learning_rate": 0.00031734797109634147, "loss": 4.829, "mean_token_accuracy": 0.23666592240333556, "num_tokens": 103141985.0, "step": 45040 }, { "entropy": 5.348501396179199, "epoch": 4.452846975088968, "grad_norm": 1.1171875, "learning_rate": 0.00031731331128893864, "loss": 4.8457, "mean_token_accuracy": 0.23330815732479096, "num_tokens": 103152442.0, "step": 45045 }, { "entropy": 5.314914131164551, "epoch": 4.453341241597469, "grad_norm": 1.140625, "learning_rate": 0.00031727865044062177, "loss": 4.7372, "mean_token_accuracy": 0.24168676435947417, "num_tokens": 103163196.0, "step": 45050 }, { "entropy": 5.366395664215088, "epoch": 4.45383550810597, "grad_norm": 1.0703125, "learning_rate": 0.0003172439885522436, "loss": 4.7798, "mean_token_accuracy": 0.24390466660261154, "num_tokens": 103173933.0, "step": 45055 }, { "entropy": 5.314244127273559, "epoch": 4.454329774614472, "grad_norm": 1.046875, "learning_rate": 0.00031720932562465673, "loss": 4.8023, "mean_token_accuracy": 0.23018215894699096, "num_tokens": 103186445.0, "step": 45060 }, { "entropy": 5.311834716796875, "epoch": 4.454824041122974, "grad_norm": 1.140625, "learning_rate": 0.00031717466165871386, "loss": 4.7448, "mean_token_accuracy": 0.24048415422439576, "num_tokens": 103198381.0, "step": 45065 }, { "entropy": 5.275209617614746, "epoch": 4.455318307631475, "grad_norm": 1.0234375, "learning_rate": 0.00031713999665526784, "loss": 4.7119, "mean_token_accuracy": 0.24209453761577607, "num_tokens": 103209668.0, "step": 45070 }, { "entropy": 5.360803508758545, "epoch": 4.455812574139976, "grad_norm": 1.078125, "learning_rate": 0.0003171053306151713, "loss": 4.8114, "mean_token_accuracy": 0.23009600937366487, "num_tokens": 103222601.0, "step": 45075 }, { "entropy": 5.2758220672607425, "epoch": 4.456306840648478, "grad_norm": 1.0546875, "learning_rate": 0.0003170706635392771, "loss": 4.7216, "mean_token_accuracy": 0.23839585334062577, "num_tokens": 103233224.0, "step": 45080 }, { "entropy": 5.27682785987854, "epoch": 4.456801107156979, "grad_norm": 1.109375, "learning_rate": 0.0003170359954284381, "loss": 4.7054, "mean_token_accuracy": 0.24136397391557693, "num_tokens": 103244276.0, "step": 45085 }, { "entropy": 5.338492727279663, "epoch": 4.45729537366548, "grad_norm": 1.21875, "learning_rate": 0.00031700132628350696, "loss": 4.8073, "mean_token_accuracy": 0.2418893665075302, "num_tokens": 103254063.0, "step": 45090 }, { "entropy": 5.366290760040283, "epoch": 4.457789640173981, "grad_norm": 1.0234375, "learning_rate": 0.0003169666561053368, "loss": 4.8069, "mean_token_accuracy": 0.23494321703910828, "num_tokens": 103266634.0, "step": 45095 }, { "entropy": 5.328021240234375, "epoch": 4.4582839066824835, "grad_norm": 1.1328125, "learning_rate": 0.0003169319848947805, "loss": 4.6952, "mean_token_accuracy": 0.24502723067998886, "num_tokens": 103276858.0, "step": 45100 }, { "entropy": 5.348114109039306, "epoch": 4.458778173190985, "grad_norm": 0.98828125, "learning_rate": 0.00031689731265269064, "loss": 4.8165, "mean_token_accuracy": 0.2337719738483429, "num_tokens": 103287582.0, "step": 45105 }, { "entropy": 5.277117109298706, "epoch": 4.459272439699486, "grad_norm": 1.234375, "learning_rate": 0.00031686263937992054, "loss": 4.7433, "mean_token_accuracy": 0.2408021494746208, "num_tokens": 103298628.0, "step": 45110 }, { "entropy": 5.359623050689697, "epoch": 4.459766706207987, "grad_norm": 1.09375, "learning_rate": 0.0003168279650773229, "loss": 4.7844, "mean_token_accuracy": 0.24031671434640883, "num_tokens": 103310055.0, "step": 45115 }, { "entropy": 5.315308141708374, "epoch": 4.460260972716489, "grad_norm": 1.0390625, "learning_rate": 0.0003167932897457509, "loss": 4.8204, "mean_token_accuracy": 0.23105403482913972, "num_tokens": 103321337.0, "step": 45120 }, { "entropy": 5.348187446594238, "epoch": 4.46075523922499, "grad_norm": 1.1171875, "learning_rate": 0.0003167586133860575, "loss": 4.8378, "mean_token_accuracy": 0.2386050134897232, "num_tokens": 103333753.0, "step": 45125 }, { "entropy": 5.3016866683959964, "epoch": 4.461249505733491, "grad_norm": 1.0234375, "learning_rate": 0.0003167239359990957, "loss": 4.6498, "mean_token_accuracy": 0.24676349759101868, "num_tokens": 103345106.0, "step": 45130 }, { "entropy": 5.349206066131591, "epoch": 4.461743772241993, "grad_norm": 1.140625, "learning_rate": 0.00031668925758571864, "loss": 4.7906, "mean_token_accuracy": 0.23478831797838212, "num_tokens": 103355470.0, "step": 45135 }, { "entropy": 5.365764570236206, "epoch": 4.4622380387504945, "grad_norm": 1.0078125, "learning_rate": 0.0003166545781467793, "loss": 4.7781, "mean_token_accuracy": 0.23720471560955048, "num_tokens": 103366422.0, "step": 45140 }, { "entropy": 5.224481153488159, "epoch": 4.462732305258996, "grad_norm": 1.0234375, "learning_rate": 0.0003166198976831309, "loss": 4.6137, "mean_token_accuracy": 0.25111106038093567, "num_tokens": 103377721.0, "step": 45145 }, { "entropy": 5.297552967071534, "epoch": 4.463226571767497, "grad_norm": 1.0390625, "learning_rate": 0.00031658521619562665, "loss": 4.8329, "mean_token_accuracy": 0.23455906063318252, "num_tokens": 103389399.0, "step": 45150 }, { "entropy": 5.231218862533569, "epoch": 4.463720838275998, "grad_norm": 1.140625, "learning_rate": 0.00031655053368511956, "loss": 4.7565, "mean_token_accuracy": 0.24606156200170518, "num_tokens": 103400664.0, "step": 45155 }, { "entropy": 5.304515647888183, "epoch": 4.4642151047845, "grad_norm": 1.109375, "learning_rate": 0.0003165158501524629, "loss": 4.7517, "mean_token_accuracy": 0.23145880550146103, "num_tokens": 103411220.0, "step": 45160 }, { "entropy": 5.304278087615967, "epoch": 4.464709371293001, "grad_norm": 1.1015625, "learning_rate": 0.00031648116559850986, "loss": 4.6385, "mean_token_accuracy": 0.2549774140119553, "num_tokens": 103421987.0, "step": 45165 }, { "entropy": 5.231236839294434, "epoch": 4.465203637801503, "grad_norm": 1.0625, "learning_rate": 0.00031644648002411373, "loss": 4.6906, "mean_token_accuracy": 0.24982571005821227, "num_tokens": 103433397.0, "step": 45170 }, { "entropy": 5.346783304214478, "epoch": 4.465697904310004, "grad_norm": 1.0703125, "learning_rate": 0.0003164117934301278, "loss": 4.8637, "mean_token_accuracy": 0.2327238216996193, "num_tokens": 103445332.0, "step": 45175 }, { "entropy": 5.341798782348633, "epoch": 4.4661921708185055, "grad_norm": 1.0390625, "learning_rate": 0.0003163771058174053, "loss": 4.7747, "mean_token_accuracy": 0.23255295902490616, "num_tokens": 103456052.0, "step": 45180 }, { "entropy": 5.332927656173706, "epoch": 4.466686437327007, "grad_norm": 1.1015625, "learning_rate": 0.0003163424171867996, "loss": 4.8106, "mean_token_accuracy": 0.233597931265831, "num_tokens": 103467341.0, "step": 45185 }, { "entropy": 5.2562602996826175, "epoch": 4.467180703835508, "grad_norm": 1.078125, "learning_rate": 0.000316307727539164, "loss": 4.6716, "mean_token_accuracy": 0.25342101603746414, "num_tokens": 103479383.0, "step": 45190 }, { "entropy": 5.310628032684326, "epoch": 4.467674970344009, "grad_norm": 0.984375, "learning_rate": 0.0003162730368753518, "loss": 4.7742, "mean_token_accuracy": 0.2305297628045082, "num_tokens": 103491650.0, "step": 45195 }, { "entropy": 5.367680883407592, "epoch": 4.4681692368525106, "grad_norm": 1.1015625, "learning_rate": 0.00031623834519621665, "loss": 4.8535, "mean_token_accuracy": 0.23577567487955092, "num_tokens": 103503276.0, "step": 45200 }, { "entropy": 5.328364992141724, "epoch": 4.468663503361013, "grad_norm": 0.984375, "learning_rate": 0.00031620365250261176, "loss": 4.7813, "mean_token_accuracy": 0.2379692628979683, "num_tokens": 103515425.0, "step": 45205 }, { "entropy": 5.265983200073242, "epoch": 4.469157769869514, "grad_norm": 1.171875, "learning_rate": 0.00031616895879539055, "loss": 4.7422, "mean_token_accuracy": 0.24156718850135803, "num_tokens": 103526166.0, "step": 45210 }, { "entropy": 5.382370328903198, "epoch": 4.469652036378015, "grad_norm": 1.03125, "learning_rate": 0.00031613426407540665, "loss": 4.8669, "mean_token_accuracy": 0.23366296142339707, "num_tokens": 103537679.0, "step": 45215 }, { "entropy": 5.318039751052856, "epoch": 4.4701463028865165, "grad_norm": 1.0078125, "learning_rate": 0.00031609956834351344, "loss": 4.7051, "mean_token_accuracy": 0.24594036787748336, "num_tokens": 103548792.0, "step": 45220 }, { "entropy": 5.337471532821655, "epoch": 4.470640569395018, "grad_norm": 1.0390625, "learning_rate": 0.0003160648716005645, "loss": 4.8044, "mean_token_accuracy": 0.234286367893219, "num_tokens": 103559900.0, "step": 45225 }, { "entropy": 5.339948272705078, "epoch": 4.471134835903519, "grad_norm": 1.109375, "learning_rate": 0.0003160301738474133, "loss": 4.8117, "mean_token_accuracy": 0.23987378776073456, "num_tokens": 103571820.0, "step": 45230 }, { "entropy": 5.334152030944824, "epoch": 4.47162910241202, "grad_norm": 1.1171875, "learning_rate": 0.0003159954750849135, "loss": 4.7443, "mean_token_accuracy": 0.23757017105817796, "num_tokens": 103583246.0, "step": 45235 }, { "entropy": 5.378422260284424, "epoch": 4.4721233689205215, "grad_norm": 0.97265625, "learning_rate": 0.00031596077531391865, "loss": 4.8063, "mean_token_accuracy": 0.2308234006166458, "num_tokens": 103594951.0, "step": 45240 }, { "entropy": 5.3613118648529055, "epoch": 4.472617635429024, "grad_norm": 1.1015625, "learning_rate": 0.00031592607453528236, "loss": 4.8332, "mean_token_accuracy": 0.23745821118354798, "num_tokens": 103608304.0, "step": 45245 }, { "entropy": 5.356850051879883, "epoch": 4.473111901937525, "grad_norm": 1.1796875, "learning_rate": 0.00031589137274985827, "loss": 4.7981, "mean_token_accuracy": 0.23268035650253296, "num_tokens": 103619051.0, "step": 45250 }, { "entropy": 5.3569082736969, "epoch": 4.473606168446026, "grad_norm": 1.1015625, "learning_rate": 0.0003158566699585001, "loss": 4.822, "mean_token_accuracy": 0.236280857026577, "num_tokens": 103630330.0, "step": 45255 }, { "entropy": 5.431278467178345, "epoch": 4.4741004349545275, "grad_norm": 1.015625, "learning_rate": 0.00031582196616206147, "loss": 4.8938, "mean_token_accuracy": 0.23507480770349504, "num_tokens": 103642450.0, "step": 45260 }, { "entropy": 5.404820919036865, "epoch": 4.474594701463029, "grad_norm": 1.1484375, "learning_rate": 0.00031578726136139617, "loss": 4.8193, "mean_token_accuracy": 0.23232553005218506, "num_tokens": 103653389.0, "step": 45265 }, { "entropy": 5.310563421249389, "epoch": 4.47508896797153, "grad_norm": 1.125, "learning_rate": 0.0003157525555573579, "loss": 4.7876, "mean_token_accuracy": 0.2357054978609085, "num_tokens": 103664586.0, "step": 45270 }, { "entropy": 5.328178882598877, "epoch": 4.475583234480031, "grad_norm": 1.046875, "learning_rate": 0.0003157178487508005, "loss": 4.7925, "mean_token_accuracy": 0.23777661621570587, "num_tokens": 103675987.0, "step": 45275 }, { "entropy": 5.337384605407715, "epoch": 4.476077500988533, "grad_norm": 1.1171875, "learning_rate": 0.00031568314094257763, "loss": 4.78, "mean_token_accuracy": 0.23199060559272766, "num_tokens": 103688649.0, "step": 45280 }, { "entropy": 5.336140394210815, "epoch": 4.476571767497035, "grad_norm": 0.98046875, "learning_rate": 0.0003156484321335432, "loss": 4.8124, "mean_token_accuracy": 0.24451253563165665, "num_tokens": 103700582.0, "step": 45285 }, { "entropy": 5.413109064102173, "epoch": 4.477066034005536, "grad_norm": 1.125, "learning_rate": 0.00031561372232455105, "loss": 4.9546, "mean_token_accuracy": 0.22668446749448776, "num_tokens": 103712705.0, "step": 45290 }, { "entropy": 5.274565315246582, "epoch": 4.477560300514037, "grad_norm": 1.046875, "learning_rate": 0.0003155790115164551, "loss": 4.7313, "mean_token_accuracy": 0.24139836728572844, "num_tokens": 103723128.0, "step": 45295 }, { "entropy": 5.332700204849243, "epoch": 4.4780545670225385, "grad_norm": 1.2421875, "learning_rate": 0.00031554429971010907, "loss": 4.768, "mean_token_accuracy": 0.23650712221860887, "num_tokens": 103734443.0, "step": 45300 }, { "entropy": 5.266205501556397, "epoch": 4.47854883353104, "grad_norm": 1.078125, "learning_rate": 0.00031550958690636693, "loss": 4.7178, "mean_token_accuracy": 0.24819025099277497, "num_tokens": 103746838.0, "step": 45305 }, { "entropy": 5.366889142990113, "epoch": 4.479043100039541, "grad_norm": 1.0625, "learning_rate": 0.00031547487310608276, "loss": 4.817, "mean_token_accuracy": 0.2442092403769493, "num_tokens": 103756924.0, "step": 45310 }, { "entropy": 5.3568707466125485, "epoch": 4.479537366548042, "grad_norm": 1.03125, "learning_rate": 0.0003154401583101104, "loss": 4.8195, "mean_token_accuracy": 0.22387807965278625, "num_tokens": 103769332.0, "step": 45315 }, { "entropy": 5.310038709640503, "epoch": 4.480031633056544, "grad_norm": 1.046875, "learning_rate": 0.0003154054425193039, "loss": 4.7538, "mean_token_accuracy": 0.24322154819965364, "num_tokens": 103781149.0, "step": 45320 }, { "entropy": 5.40117712020874, "epoch": 4.480525899565046, "grad_norm": 1.109375, "learning_rate": 0.00031537072573451717, "loss": 4.8577, "mean_token_accuracy": 0.2286880210042, "num_tokens": 103792217.0, "step": 45325 }, { "entropy": 5.273325634002686, "epoch": 4.481020166073547, "grad_norm": 0.9921875, "learning_rate": 0.0003153360079566044, "loss": 4.747, "mean_token_accuracy": 0.24424363374710084, "num_tokens": 103803628.0, "step": 45330 }, { "entropy": 5.284600448608399, "epoch": 4.481514432582048, "grad_norm": 1.0625, "learning_rate": 0.0003153012891864196, "loss": 4.749, "mean_token_accuracy": 0.23786057233810426, "num_tokens": 103814735.0, "step": 45335 }, { "entropy": 5.3317375659942625, "epoch": 4.482008699090549, "grad_norm": 1.0703125, "learning_rate": 0.00031526656942481673, "loss": 4.7729, "mean_token_accuracy": 0.24002905786037446, "num_tokens": 103825952.0, "step": 45340 }, { "entropy": 5.277061033248901, "epoch": 4.482502965599051, "grad_norm": 1.0390625, "learning_rate": 0.00031523184867265013, "loss": 4.7698, "mean_token_accuracy": 0.23269715756177903, "num_tokens": 103836558.0, "step": 45345 }, { "entropy": 5.368397569656372, "epoch": 4.482997232107552, "grad_norm": 1.0546875, "learning_rate": 0.00031519712693077375, "loss": 4.8149, "mean_token_accuracy": 0.23327893316745757, "num_tokens": 103848453.0, "step": 45350 }, { "entropy": 5.300528860092163, "epoch": 4.483491498616054, "grad_norm": 1.078125, "learning_rate": 0.0003151624042000418, "loss": 4.6884, "mean_token_accuracy": 0.2507427975535393, "num_tokens": 103860603.0, "step": 45355 }, { "entropy": 5.269286489486694, "epoch": 4.483985765124555, "grad_norm": 1.0703125, "learning_rate": 0.00031512768048130846, "loss": 4.7852, "mean_token_accuracy": 0.24232959002256393, "num_tokens": 103870678.0, "step": 45360 }, { "entropy": 5.268273735046387, "epoch": 4.484480031633057, "grad_norm": 1.109375, "learning_rate": 0.00031509295577542804, "loss": 4.7471, "mean_token_accuracy": 0.23615771234035493, "num_tokens": 103881139.0, "step": 45365 }, { "entropy": 5.294133472442627, "epoch": 4.484974298141558, "grad_norm": 1.09375, "learning_rate": 0.0003150582300832546, "loss": 4.7307, "mean_token_accuracy": 0.2426274061203003, "num_tokens": 103892623.0, "step": 45370 }, { "entropy": 5.406141710281372, "epoch": 4.485468564650059, "grad_norm": 1.0078125, "learning_rate": 0.0003150235034056425, "loss": 4.787, "mean_token_accuracy": 0.2364817276597023, "num_tokens": 103905278.0, "step": 45375 }, { "entropy": 5.356379079818725, "epoch": 4.48596283115856, "grad_norm": 1.0234375, "learning_rate": 0.00031498877574344603, "loss": 4.7614, "mean_token_accuracy": 0.23693743348121643, "num_tokens": 103916363.0, "step": 45380 }, { "entropy": 5.258120489120484, "epoch": 4.486457097667062, "grad_norm": 0.9296875, "learning_rate": 0.00031495404709751945, "loss": 4.76, "mean_token_accuracy": 0.23494971096515654, "num_tokens": 103927764.0, "step": 45385 }, { "entropy": 5.262948083877563, "epoch": 4.486951364175564, "grad_norm": 1.1953125, "learning_rate": 0.00031491931746871715, "loss": 4.7599, "mean_token_accuracy": 0.24051707684993745, "num_tokens": 103938415.0, "step": 45390 }, { "entropy": 5.275095129013062, "epoch": 4.487445630684065, "grad_norm": 1.078125, "learning_rate": 0.0003148845868578934, "loss": 4.6633, "mean_token_accuracy": 0.25200310796499253, "num_tokens": 103949282.0, "step": 45395 }, { "entropy": 5.254300928115844, "epoch": 4.487939897192566, "grad_norm": 1.078125, "learning_rate": 0.0003148498552659026, "loss": 4.746, "mean_token_accuracy": 0.23297962844371795, "num_tokens": 103960896.0, "step": 45400 }, { "entropy": 5.290627908706665, "epoch": 4.488434163701068, "grad_norm": 1.1953125, "learning_rate": 0.0003148151226935993, "loss": 4.7031, "mean_token_accuracy": 0.25113596618175504, "num_tokens": 103970696.0, "step": 45405 }, { "entropy": 5.490932893753052, "epoch": 4.488928430209569, "grad_norm": 1.0703125, "learning_rate": 0.00031478038914183764, "loss": 4.9857, "mean_token_accuracy": 0.2179810270667076, "num_tokens": 103984218.0, "step": 45410 }, { "entropy": 5.305544471740722, "epoch": 4.48942269671807, "grad_norm": 1.1484375, "learning_rate": 0.00031474565461147235, "loss": 4.7503, "mean_token_accuracy": 0.24562203586101533, "num_tokens": 103994871.0, "step": 45415 }, { "entropy": 5.151294088363647, "epoch": 4.489916963226571, "grad_norm": 1.0546875, "learning_rate": 0.0003147109191033578, "loss": 4.5613, "mean_token_accuracy": 0.260965895652771, "num_tokens": 104005629.0, "step": 45420 }, { "entropy": 5.267220497131348, "epoch": 4.490411229735074, "grad_norm": 1.1640625, "learning_rate": 0.0003146761826183484, "loss": 4.6713, "mean_token_accuracy": 0.250591504573822, "num_tokens": 104016257.0, "step": 45425 }, { "entropy": 5.274311590194702, "epoch": 4.490905496243575, "grad_norm": 1.0546875, "learning_rate": 0.0003146414451572988, "loss": 4.6863, "mean_token_accuracy": 0.24554616957902908, "num_tokens": 104028322.0, "step": 45430 }, { "entropy": 5.3448484420776365, "epoch": 4.491399762752076, "grad_norm": 1.078125, "learning_rate": 0.00031460670672106355, "loss": 4.7234, "mean_token_accuracy": 0.24165437370538712, "num_tokens": 104039349.0, "step": 45435 }, { "entropy": 5.328880786895752, "epoch": 4.491894029260577, "grad_norm": 1.0390625, "learning_rate": 0.0003145719673104971, "loss": 4.8252, "mean_token_accuracy": 0.2269369199872017, "num_tokens": 104050585.0, "step": 45440 }, { "entropy": 5.244352769851685, "epoch": 4.492388295769079, "grad_norm": 1.1171875, "learning_rate": 0.00031453722692645407, "loss": 4.6728, "mean_token_accuracy": 0.24379865378141402, "num_tokens": 104060623.0, "step": 45445 }, { "entropy": 5.254893445968628, "epoch": 4.49288256227758, "grad_norm": 1.125, "learning_rate": 0.00031450248556978927, "loss": 4.7208, "mean_token_accuracy": 0.2430357590317726, "num_tokens": 104070880.0, "step": 45450 }, { "entropy": 5.3498132705688475, "epoch": 4.493376828786081, "grad_norm": 1.0234375, "learning_rate": 0.0003144677432413571, "loss": 4.8307, "mean_token_accuracy": 0.23359207808971405, "num_tokens": 104082686.0, "step": 45455 }, { "entropy": 5.292243909835816, "epoch": 4.493871095294583, "grad_norm": 1.1796875, "learning_rate": 0.00031443299994201234, "loss": 4.8149, "mean_token_accuracy": 0.23548031747341155, "num_tokens": 104093746.0, "step": 45460 }, { "entropy": 5.33357310295105, "epoch": 4.4943653618030845, "grad_norm": 1.0859375, "learning_rate": 0.0003143982556726097, "loss": 4.7704, "mean_token_accuracy": 0.2444693073630333, "num_tokens": 104104843.0, "step": 45465 }, { "entropy": 5.253156280517578, "epoch": 4.494859628311586, "grad_norm": 1.140625, "learning_rate": 0.0003143635104340037, "loss": 4.6489, "mean_token_accuracy": 0.25492510199546814, "num_tokens": 104115317.0, "step": 45470 }, { "entropy": 5.280341768264771, "epoch": 4.495353894820087, "grad_norm": 0.96484375, "learning_rate": 0.00031432876422704943, "loss": 4.7174, "mean_token_accuracy": 0.24093780517578126, "num_tokens": 104126775.0, "step": 45475 }, { "entropy": 5.256389570236206, "epoch": 4.495848161328588, "grad_norm": 0.97265625, "learning_rate": 0.0003142940170526014, "loss": 4.722, "mean_token_accuracy": 0.24002980291843415, "num_tokens": 104138343.0, "step": 45480 }, { "entropy": 5.4016335010528564, "epoch": 4.49634242783709, "grad_norm": 1.1328125, "learning_rate": 0.0003142592689115145, "loss": 4.8174, "mean_token_accuracy": 0.23423982411623, "num_tokens": 104149406.0, "step": 45485 }, { "entropy": 5.321445274353027, "epoch": 4.496836694345591, "grad_norm": 1.0390625, "learning_rate": 0.0003142245198046434, "loss": 4.7996, "mean_token_accuracy": 0.2323540762066841, "num_tokens": 104159665.0, "step": 45490 }, { "entropy": 5.361899900436401, "epoch": 4.497330960854092, "grad_norm": 1.0625, "learning_rate": 0.0003141897697328431, "loss": 4.8295, "mean_token_accuracy": 0.2322099268436432, "num_tokens": 104171195.0, "step": 45495 }, { "entropy": 5.3592103004455565, "epoch": 4.497825227362594, "grad_norm": 1.21875, "learning_rate": 0.0003141550186969683, "loss": 4.7593, "mean_token_accuracy": 0.24361200332641603, "num_tokens": 104182035.0, "step": 45500 }, { "entropy": 5.34439263343811, "epoch": 4.4983194938710955, "grad_norm": 1.1171875, "learning_rate": 0.000314120266697874, "loss": 4.7453, "mean_token_accuracy": 0.23612823486328124, "num_tokens": 104192643.0, "step": 45505 }, { "entropy": 5.219141244888306, "epoch": 4.498813760379597, "grad_norm": 0.96875, "learning_rate": 0.00031408551373641514, "loss": 4.6859, "mean_token_accuracy": 0.24282098263502122, "num_tokens": 104205079.0, "step": 45510 }, { "entropy": 5.2682373046875, "epoch": 4.499308026888098, "grad_norm": 1.125, "learning_rate": 0.0003140507598134465, "loss": 4.8054, "mean_token_accuracy": 0.23074979335069656, "num_tokens": 104216495.0, "step": 45515 }, { "entropy": 5.376262998580932, "epoch": 4.499802293396599, "grad_norm": 1.15625, "learning_rate": 0.0003140160049298231, "loss": 4.8775, "mean_token_accuracy": 0.23433203548192977, "num_tokens": 104228115.0, "step": 45520 }, { "entropy": 5.3544128894805905, "epoch": 4.500296559905101, "grad_norm": 0.9375, "learning_rate": 0.00031398124908639996, "loss": 4.7594, "mean_token_accuracy": 0.23606119751930238, "num_tokens": 104241184.0, "step": 45525 }, { "entropy": 5.355668640136718, "epoch": 4.500790826413602, "grad_norm": 0.9921875, "learning_rate": 0.00031394649228403207, "loss": 4.808, "mean_token_accuracy": 0.23421383202075957, "num_tokens": 104253039.0, "step": 45530 }, { "entropy": 5.265957164764404, "epoch": 4.501285092922103, "grad_norm": 1.1640625, "learning_rate": 0.0003139117345235744, "loss": 4.689, "mean_token_accuracy": 0.2444515958428383, "num_tokens": 104263536.0, "step": 45535 }, { "entropy": 5.229597759246826, "epoch": 4.501779359430605, "grad_norm": 1.09375, "learning_rate": 0.000313876975805882, "loss": 4.6886, "mean_token_accuracy": 0.24844601303339003, "num_tokens": 104275744.0, "step": 45540 }, { "entropy": 5.239278984069824, "epoch": 4.5022736259391065, "grad_norm": 1.0078125, "learning_rate": 0.00031384221613181, "loss": 4.7036, "mean_token_accuracy": 0.24594670236110688, "num_tokens": 104286338.0, "step": 45545 }, { "entropy": 5.2955015182495115, "epoch": 4.502767892447608, "grad_norm": 0.921875, "learning_rate": 0.00031380745550221346, "loss": 4.7445, "mean_token_accuracy": 0.24687621593475342, "num_tokens": 104298641.0, "step": 45550 }, { "entropy": 5.337742471694947, "epoch": 4.503262158956109, "grad_norm": 1.046875, "learning_rate": 0.00031377269391794744, "loss": 4.7762, "mean_token_accuracy": 0.23243581652641296, "num_tokens": 104308973.0, "step": 45555 }, { "entropy": 5.257543468475342, "epoch": 4.50375642546461, "grad_norm": 1.21875, "learning_rate": 0.00031373793137986724, "loss": 4.7068, "mean_token_accuracy": 0.2514402523636818, "num_tokens": 104320949.0, "step": 45560 }, { "entropy": 5.3374035358428955, "epoch": 4.504250691973112, "grad_norm": 1.1171875, "learning_rate": 0.0003137031678888278, "loss": 4.7911, "mean_token_accuracy": 0.24023229032754898, "num_tokens": 104332190.0, "step": 45565 }, { "entropy": 5.32873272895813, "epoch": 4.504744958481613, "grad_norm": 1.0390625, "learning_rate": 0.00031366840344568443, "loss": 4.782, "mean_token_accuracy": 0.237511944770813, "num_tokens": 104342936.0, "step": 45570 }, { "entropy": 5.341787719726563, "epoch": 4.505239224990115, "grad_norm": 1.1875, "learning_rate": 0.0003136336380512925, "loss": 4.7965, "mean_token_accuracy": 0.2401089698076248, "num_tokens": 104353556.0, "step": 45575 }, { "entropy": 5.364342784881591, "epoch": 4.505733491498616, "grad_norm": 1.0859375, "learning_rate": 0.00031359887170650695, "loss": 4.8053, "mean_token_accuracy": 0.23167426139116287, "num_tokens": 104364960.0, "step": 45580 }, { "entropy": 5.382161855697632, "epoch": 4.5062277580071175, "grad_norm": 1.09375, "learning_rate": 0.0003135641044121831, "loss": 4.7989, "mean_token_accuracy": 0.23382475227117538, "num_tokens": 104376101.0, "step": 45585 }, { "entropy": 5.354340362548828, "epoch": 4.506722024515619, "grad_norm": 1.125, "learning_rate": 0.00031352933616917637, "loss": 4.8211, "mean_token_accuracy": 0.23475082963705063, "num_tokens": 104386981.0, "step": 45590 }, { "entropy": 5.275776767730713, "epoch": 4.50721629102412, "grad_norm": 1.109375, "learning_rate": 0.00031349456697834203, "loss": 4.7437, "mean_token_accuracy": 0.23354615718126298, "num_tokens": 104398275.0, "step": 45595 }, { "entropy": 5.354321765899658, "epoch": 4.507710557532621, "grad_norm": 1.0, "learning_rate": 0.0003134597968405354, "loss": 4.8406, "mean_token_accuracy": 0.22934765815734864, "num_tokens": 104409337.0, "step": 45600 }, { "entropy": 5.330263280868531, "epoch": 4.5082048240411225, "grad_norm": 1.0859375, "learning_rate": 0.00031342502575661173, "loss": 4.8037, "mean_token_accuracy": 0.242253777384758, "num_tokens": 104420880.0, "step": 45605 }, { "entropy": 5.266698217391967, "epoch": 4.508699090549625, "grad_norm": 1.1171875, "learning_rate": 0.00031339025372742647, "loss": 4.6946, "mean_token_accuracy": 0.2478156566619873, "num_tokens": 104432398.0, "step": 45610 }, { "entropy": 5.2932116985321045, "epoch": 4.509193357058126, "grad_norm": 1.1015625, "learning_rate": 0.00031335548075383504, "loss": 4.7724, "mean_token_accuracy": 0.23927080780267715, "num_tokens": 104444008.0, "step": 45615 }, { "entropy": 5.368634128570557, "epoch": 4.509687623566627, "grad_norm": 1.09375, "learning_rate": 0.0003133207068366928, "loss": 4.8157, "mean_token_accuracy": 0.23456242233514785, "num_tokens": 104456059.0, "step": 45620 }, { "entropy": 5.299785184860229, "epoch": 4.5101818900751285, "grad_norm": 1.078125, "learning_rate": 0.0003132859319768553, "loss": 4.7979, "mean_token_accuracy": 0.2428646132349968, "num_tokens": 104467757.0, "step": 45625 }, { "entropy": 5.31520299911499, "epoch": 4.51067615658363, "grad_norm": 1.0625, "learning_rate": 0.00031325115617517784, "loss": 4.8, "mean_token_accuracy": 0.23599509298801422, "num_tokens": 104479102.0, "step": 45630 }, { "entropy": 5.287164688110352, "epoch": 4.511170423092131, "grad_norm": 1.125, "learning_rate": 0.000313216379432516, "loss": 4.7145, "mean_token_accuracy": 0.2450511246919632, "num_tokens": 104490515.0, "step": 45635 }, { "entropy": 5.350171327590942, "epoch": 4.511664689600632, "grad_norm": 1.1328125, "learning_rate": 0.0003131816017497254, "loss": 4.7881, "mean_token_accuracy": 0.23871975988149643, "num_tokens": 104502539.0, "step": 45640 }, { "entropy": 5.3319731712341305, "epoch": 4.512158956109134, "grad_norm": 1.078125, "learning_rate": 0.0003131468231276614, "loss": 4.7441, "mean_token_accuracy": 0.23473820239305496, "num_tokens": 104514763.0, "step": 45645 }, { "entropy": 5.362921237945557, "epoch": 4.512653222617636, "grad_norm": 0.984375, "learning_rate": 0.00031311204356717964, "loss": 4.7981, "mean_token_accuracy": 0.2290801465511322, "num_tokens": 104527192.0, "step": 45650 }, { "entropy": 5.299463844299316, "epoch": 4.513147489126137, "grad_norm": 1.1875, "learning_rate": 0.0003130772630691357, "loss": 4.7536, "mean_token_accuracy": 0.24591185450553893, "num_tokens": 104539482.0, "step": 45655 }, { "entropy": 5.328038501739502, "epoch": 4.513641755634638, "grad_norm": 1.125, "learning_rate": 0.00031304248163438513, "loss": 4.7663, "mean_token_accuracy": 0.237922240793705, "num_tokens": 104551168.0, "step": 45660 }, { "entropy": 5.366964673995971, "epoch": 4.5141360221431395, "grad_norm": 1.0859375, "learning_rate": 0.00031300769926378367, "loss": 4.8325, "mean_token_accuracy": 0.22915346920490265, "num_tokens": 104562516.0, "step": 45665 }, { "entropy": 5.337435722351074, "epoch": 4.514630288651641, "grad_norm": 1.0546875, "learning_rate": 0.00031297291595818697, "loss": 4.784, "mean_token_accuracy": 0.24642402827739715, "num_tokens": 104573665.0, "step": 45670 }, { "entropy": 5.263093423843384, "epoch": 4.515124555160142, "grad_norm": 1.0234375, "learning_rate": 0.0003129381317184506, "loss": 4.6949, "mean_token_accuracy": 0.2449507638812065, "num_tokens": 104584596.0, "step": 45675 }, { "entropy": 5.216248035430908, "epoch": 4.515618821668644, "grad_norm": 1.0546875, "learning_rate": 0.0003129033465454303, "loss": 4.7435, "mean_token_accuracy": 0.23816710114479064, "num_tokens": 104596961.0, "step": 45680 }, { "entropy": 5.355479669570923, "epoch": 4.516113088177145, "grad_norm": 1.015625, "learning_rate": 0.00031286856043998175, "loss": 4.8345, "mean_token_accuracy": 0.24063436836004257, "num_tokens": 104609479.0, "step": 45685 }, { "entropy": 5.39530668258667, "epoch": 4.516607354685647, "grad_norm": 0.9609375, "learning_rate": 0.0003128337734029607, "loss": 4.8245, "mean_token_accuracy": 0.23273638933897017, "num_tokens": 104622690.0, "step": 45690 }, { "entropy": 5.32144684791565, "epoch": 4.517101621194148, "grad_norm": 1.109375, "learning_rate": 0.0003127989854352231, "loss": 4.7057, "mean_token_accuracy": 0.2410956472158432, "num_tokens": 104633005.0, "step": 45695 }, { "entropy": 5.312747001647949, "epoch": 4.517595887702649, "grad_norm": 1.0, "learning_rate": 0.0003127641965376245, "loss": 4.8031, "mean_token_accuracy": 0.2362053722143173, "num_tokens": 104646209.0, "step": 45700 }, { "entropy": 5.304976558685302, "epoch": 4.5180901542111505, "grad_norm": 1.0625, "learning_rate": 0.0003127294067110208, "loss": 4.7778, "mean_token_accuracy": 0.23761324733495712, "num_tokens": 104657833.0, "step": 45705 }, { "entropy": 5.357633352279663, "epoch": 4.518584420719652, "grad_norm": 1.0, "learning_rate": 0.00031269461595626784, "loss": 4.8097, "mean_token_accuracy": 0.23381997495889664, "num_tokens": 104668858.0, "step": 45710 }, { "entropy": 5.312533855438232, "epoch": 4.519078687228154, "grad_norm": 1.09375, "learning_rate": 0.00031265982427422154, "loss": 4.7386, "mean_token_accuracy": 0.23816150277853013, "num_tokens": 104681231.0, "step": 45715 }, { "entropy": 5.373809432983398, "epoch": 4.519572953736655, "grad_norm": 1.0, "learning_rate": 0.00031262503166573776, "loss": 4.8683, "mean_token_accuracy": 0.23806046098470687, "num_tokens": 104693543.0, "step": 45720 }, { "entropy": 5.309687566757202, "epoch": 4.520067220245156, "grad_norm": 1.1328125, "learning_rate": 0.00031259023813167227, "loss": 4.7369, "mean_token_accuracy": 0.23520494401454925, "num_tokens": 104704642.0, "step": 45725 }, { "entropy": 5.3266185283660885, "epoch": 4.520561486753658, "grad_norm": 1.0, "learning_rate": 0.0003125554436728811, "loss": 4.7683, "mean_token_accuracy": 0.23504368215799332, "num_tokens": 104715931.0, "step": 45730 }, { "entropy": 5.298538875579834, "epoch": 4.521055753262159, "grad_norm": 1.03125, "learning_rate": 0.00031252064829022017, "loss": 4.733, "mean_token_accuracy": 0.24307476133108138, "num_tokens": 104727561.0, "step": 45735 }, { "entropy": 5.358933401107788, "epoch": 4.52155001977066, "grad_norm": 1.0390625, "learning_rate": 0.00031248585198454556, "loss": 4.812, "mean_token_accuracy": 0.23284924030303955, "num_tokens": 104740127.0, "step": 45740 }, { "entropy": 5.302150869369507, "epoch": 4.522044286279161, "grad_norm": 1.109375, "learning_rate": 0.00031245105475671305, "loss": 4.7705, "mean_token_accuracy": 0.24083108752965926, "num_tokens": 104752255.0, "step": 45745 }, { "entropy": 5.336704444885254, "epoch": 4.522538552787664, "grad_norm": 1.1171875, "learning_rate": 0.00031241625660757887, "loss": 4.842, "mean_token_accuracy": 0.22925037294626235, "num_tokens": 104763956.0, "step": 45750 }, { "entropy": 5.303063821792603, "epoch": 4.523032819296165, "grad_norm": 0.98046875, "learning_rate": 0.00031238145753799895, "loss": 4.7307, "mean_token_accuracy": 0.23883327692747117, "num_tokens": 104775608.0, "step": 45755 }, { "entropy": 5.3243848323822025, "epoch": 4.523527085804666, "grad_norm": 0.9609375, "learning_rate": 0.00031234665754882937, "loss": 4.7172, "mean_token_accuracy": 0.2361874148249626, "num_tokens": 104786958.0, "step": 45760 }, { "entropy": 5.352754163742065, "epoch": 4.524021352313167, "grad_norm": 1.03125, "learning_rate": 0.00031231185664092623, "loss": 4.8483, "mean_token_accuracy": 0.23189760744571686, "num_tokens": 104798155.0, "step": 45765 }, { "entropy": 5.321776723861694, "epoch": 4.524515618821669, "grad_norm": 1.046875, "learning_rate": 0.00031227705481514566, "loss": 4.7316, "mean_token_accuracy": 0.24182731956243514, "num_tokens": 104809378.0, "step": 45770 }, { "entropy": 5.2598601341247555, "epoch": 4.52500988533017, "grad_norm": 1.0625, "learning_rate": 0.00031224225207234375, "loss": 4.6983, "mean_token_accuracy": 0.24432355761528016, "num_tokens": 104820223.0, "step": 45775 }, { "entropy": 5.330684566497803, "epoch": 4.525504151838671, "grad_norm": 0.97265625, "learning_rate": 0.0003122074484133766, "loss": 4.7788, "mean_token_accuracy": 0.23790156841278076, "num_tokens": 104833665.0, "step": 45780 }, { "entropy": 5.320053386688232, "epoch": 4.525998418347172, "grad_norm": 1.03125, "learning_rate": 0.0003121726438391005, "loss": 4.7633, "mean_token_accuracy": 0.24264712035655975, "num_tokens": 104845405.0, "step": 45785 }, { "entropy": 5.353195524215698, "epoch": 4.526492684855674, "grad_norm": 1.0703125, "learning_rate": 0.0003121378383503716, "loss": 4.8619, "mean_token_accuracy": 0.22677465677261352, "num_tokens": 104856388.0, "step": 45790 }, { "entropy": 5.349732971191406, "epoch": 4.526986951364176, "grad_norm": 1.0, "learning_rate": 0.0003121030319480461, "loss": 4.7492, "mean_token_accuracy": 0.23952741473913192, "num_tokens": 104868214.0, "step": 45795 }, { "entropy": 5.284990501403809, "epoch": 4.527481217872677, "grad_norm": 1.046875, "learning_rate": 0.00031206822463298017, "loss": 4.7093, "mean_token_accuracy": 0.24558840990066527, "num_tokens": 104880894.0, "step": 45800 }, { "entropy": 5.28939642906189, "epoch": 4.527975484381178, "grad_norm": 1.3203125, "learning_rate": 0.0003120334164060303, "loss": 4.7945, "mean_token_accuracy": 0.23777732849121094, "num_tokens": 104894244.0, "step": 45805 }, { "entropy": 5.310774135589599, "epoch": 4.52846975088968, "grad_norm": 1.0859375, "learning_rate": 0.0003119986072680526, "loss": 4.7134, "mean_token_accuracy": 0.24359154105186462, "num_tokens": 104904960.0, "step": 45810 }, { "entropy": 5.347202396392822, "epoch": 4.528964017398181, "grad_norm": 1.015625, "learning_rate": 0.0003119637972199034, "loss": 4.8464, "mean_token_accuracy": 0.23455883264541627, "num_tokens": 104917574.0, "step": 45815 }, { "entropy": 5.251883602142334, "epoch": 4.529458283906682, "grad_norm": 1.0390625, "learning_rate": 0.00031192898626243907, "loss": 4.6513, "mean_token_accuracy": 0.24901916235685348, "num_tokens": 104928131.0, "step": 45820 }, { "entropy": 5.3437103748321535, "epoch": 4.529952550415183, "grad_norm": 1.15625, "learning_rate": 0.00031189417439651584, "loss": 4.78, "mean_token_accuracy": 0.23181951195001602, "num_tokens": 104939166.0, "step": 45825 }, { "entropy": 5.267369508743286, "epoch": 4.530446816923686, "grad_norm": 1.140625, "learning_rate": 0.0003118593616229904, "loss": 4.7647, "mean_token_accuracy": 0.2415927141904831, "num_tokens": 104949595.0, "step": 45830 }, { "entropy": 5.337538957595825, "epoch": 4.530941083432187, "grad_norm": 1.0546875, "learning_rate": 0.0003118245479427188, "loss": 4.7583, "mean_token_accuracy": 0.24011070281267166, "num_tokens": 104961089.0, "step": 45835 }, { "entropy": 5.330636358261108, "epoch": 4.531435349940688, "grad_norm": 1.03125, "learning_rate": 0.0003117897333565577, "loss": 4.8049, "mean_token_accuracy": 0.2384817346930504, "num_tokens": 104972199.0, "step": 45840 }, { "entropy": 5.2840046882629395, "epoch": 4.531929616449189, "grad_norm": 1.0234375, "learning_rate": 0.0003117549178653634, "loss": 4.7371, "mean_token_accuracy": 0.25049690157175064, "num_tokens": 104984286.0, "step": 45845 }, { "entropy": 5.346341609954834, "epoch": 4.532423882957691, "grad_norm": 1.1484375, "learning_rate": 0.0003117201014699924, "loss": 4.7131, "mean_token_accuracy": 0.24124073088169098, "num_tokens": 104995339.0, "step": 45850 }, { "entropy": 5.384561252593994, "epoch": 4.532918149466192, "grad_norm": 1.0234375, "learning_rate": 0.0003116852841713012, "loss": 4.8619, "mean_token_accuracy": 0.22610248178243636, "num_tokens": 105006199.0, "step": 45855 }, { "entropy": 5.285719919204712, "epoch": 4.533412415974693, "grad_norm": 1.0390625, "learning_rate": 0.0003116504659701463, "loss": 4.7723, "mean_token_accuracy": 0.2435317799448967, "num_tokens": 105017222.0, "step": 45860 }, { "entropy": 5.2594109058380125, "epoch": 4.533906682483195, "grad_norm": 1.0234375, "learning_rate": 0.00031161564686738437, "loss": 4.7366, "mean_token_accuracy": 0.24208298474550247, "num_tokens": 105028260.0, "step": 45865 }, { "entropy": 5.31702675819397, "epoch": 4.5344009489916965, "grad_norm": 1.1953125, "learning_rate": 0.00031158082686387175, "loss": 4.7413, "mean_token_accuracy": 0.23987960070371628, "num_tokens": 105040397.0, "step": 45870 }, { "entropy": 5.355904865264892, "epoch": 4.534895215500198, "grad_norm": 1.1171875, "learning_rate": 0.0003115460059604652, "loss": 4.806, "mean_token_accuracy": 0.23765857368707657, "num_tokens": 105051291.0, "step": 45875 }, { "entropy": 5.406417369842529, "epoch": 4.535389482008699, "grad_norm": 1.109375, "learning_rate": 0.0003115111841580211, "loss": 4.8614, "mean_token_accuracy": 0.23292483240365983, "num_tokens": 105063224.0, "step": 45880 }, { "entropy": 5.368041849136352, "epoch": 4.5358837485172, "grad_norm": 1.0625, "learning_rate": 0.00031147636145739633, "loss": 4.8049, "mean_token_accuracy": 0.2397485837340355, "num_tokens": 105074750.0, "step": 45885 }, { "entropy": 5.320951986312866, "epoch": 4.536378015025702, "grad_norm": 0.98046875, "learning_rate": 0.0003114415378594473, "loss": 4.7386, "mean_token_accuracy": 0.2445179745554924, "num_tokens": 105086782.0, "step": 45890 }, { "entropy": 5.380559253692627, "epoch": 4.536872281534203, "grad_norm": 0.9765625, "learning_rate": 0.00031140671336503086, "loss": 4.9354, "mean_token_accuracy": 0.22467004805803298, "num_tokens": 105099540.0, "step": 45895 }, { "entropy": 5.378453254699707, "epoch": 4.537366548042705, "grad_norm": 1.0625, "learning_rate": 0.00031137188797500365, "loss": 4.8841, "mean_token_accuracy": 0.2310177803039551, "num_tokens": 105112212.0, "step": 45900 }, { "entropy": 5.373162317276001, "epoch": 4.537860814551206, "grad_norm": 1.0859375, "learning_rate": 0.0003113370616902223, "loss": 4.8277, "mean_token_accuracy": 0.23544398695230484, "num_tokens": 105124397.0, "step": 45905 }, { "entropy": 5.3682355880737305, "epoch": 4.5383550810597075, "grad_norm": 0.98828125, "learning_rate": 0.0003113022345115436, "loss": 4.8669, "mean_token_accuracy": 0.23416759371757506, "num_tokens": 105138114.0, "step": 45910 }, { "entropy": 5.397798490524292, "epoch": 4.538849347568209, "grad_norm": 1.0703125, "learning_rate": 0.00031126740643982434, "loss": 4.7951, "mean_token_accuracy": 0.23719389438629152, "num_tokens": 105148967.0, "step": 45915 }, { "entropy": 5.277900218963623, "epoch": 4.53934361407671, "grad_norm": 1.0390625, "learning_rate": 0.00031123257747592113, "loss": 4.6887, "mean_token_accuracy": 0.2530701383948326, "num_tokens": 105161472.0, "step": 45920 }, { "entropy": 5.29261360168457, "epoch": 4.539837880585211, "grad_norm": 1.0, "learning_rate": 0.00031119774762069103, "loss": 4.7443, "mean_token_accuracy": 0.24043069779872894, "num_tokens": 105174213.0, "step": 45925 }, { "entropy": 5.373764181137085, "epoch": 4.540332147093713, "grad_norm": 1.15625, "learning_rate": 0.00031116291687499067, "loss": 4.879, "mean_token_accuracy": 0.22906987816095353, "num_tokens": 105186011.0, "step": 45930 }, { "entropy": 5.300619649887085, "epoch": 4.540826413602215, "grad_norm": 1.0390625, "learning_rate": 0.00031112808523967695, "loss": 4.7666, "mean_token_accuracy": 0.23838156163692475, "num_tokens": 105197605.0, "step": 45935 }, { "entropy": 5.376411104202271, "epoch": 4.541320680110716, "grad_norm": 1.078125, "learning_rate": 0.0003110932527156067, "loss": 4.8764, "mean_token_accuracy": 0.23218790888786317, "num_tokens": 105209030.0, "step": 45940 }, { "entropy": 5.319708395004272, "epoch": 4.541814946619217, "grad_norm": 1.0859375, "learning_rate": 0.00031105841930363686, "loss": 4.6658, "mean_token_accuracy": 0.2546701580286026, "num_tokens": 105220167.0, "step": 45945 }, { "entropy": 5.27241530418396, "epoch": 4.5423092131277185, "grad_norm": 1.125, "learning_rate": 0.00031102358500462434, "loss": 4.7191, "mean_token_accuracy": 0.24388473629951476, "num_tokens": 105231646.0, "step": 45950 }, { "entropy": 5.332018947601318, "epoch": 4.54280347963622, "grad_norm": 1.1484375, "learning_rate": 0.000310988749819426, "loss": 4.8047, "mean_token_accuracy": 0.23618009239435195, "num_tokens": 105243822.0, "step": 45955 }, { "entropy": 5.344430828094483, "epoch": 4.543297746144721, "grad_norm": 1.046875, "learning_rate": 0.00031095391374889885, "loss": 4.8246, "mean_token_accuracy": 0.23731618076562883, "num_tokens": 105256267.0, "step": 45960 }, { "entropy": 5.324924612045288, "epoch": 4.543792012653222, "grad_norm": 1.0390625, "learning_rate": 0.00031091907679389985, "loss": 4.8109, "mean_token_accuracy": 0.23692091554403305, "num_tokens": 105267748.0, "step": 45965 }, { "entropy": 5.417560005187989, "epoch": 4.5442862791617245, "grad_norm": 1.1015625, "learning_rate": 0.000310884238955286, "loss": 4.8343, "mean_token_accuracy": 0.23629748225212097, "num_tokens": 105278696.0, "step": 45970 }, { "entropy": 5.318538475036621, "epoch": 4.544780545670226, "grad_norm": 1.1171875, "learning_rate": 0.0003108494002339143, "loss": 4.696, "mean_token_accuracy": 0.2494835689663887, "num_tokens": 105290053.0, "step": 45975 }, { "entropy": 5.379360485076904, "epoch": 4.545274812178727, "grad_norm": 1.0859375, "learning_rate": 0.0003108145606306417, "loss": 4.7928, "mean_token_accuracy": 0.24417671263217927, "num_tokens": 105301196.0, "step": 45980 }, { "entropy": 5.3296425342559814, "epoch": 4.545769078687228, "grad_norm": 1.1015625, "learning_rate": 0.00031077972014632545, "loss": 4.818, "mean_token_accuracy": 0.2338682308793068, "num_tokens": 105312799.0, "step": 45985 }, { "entropy": 5.401496362686157, "epoch": 4.5462633451957295, "grad_norm": 1.0078125, "learning_rate": 0.0003107448787818225, "loss": 4.8324, "mean_token_accuracy": 0.23217811435461044, "num_tokens": 105324818.0, "step": 45990 }, { "entropy": 5.251231575012207, "epoch": 4.546757611704231, "grad_norm": 1.0546875, "learning_rate": 0.00031071003653799, "loss": 4.7481, "mean_token_accuracy": 0.24656011313199996, "num_tokens": 105335916.0, "step": 45995 }, { "entropy": 5.308732175827027, "epoch": 4.547251878212732, "grad_norm": 1.03125, "learning_rate": 0.00031067519341568506, "loss": 4.7083, "mean_token_accuracy": 0.2481163114309311, "num_tokens": 105347257.0, "step": 46000 }, { "entropy": 5.410985803604126, "epoch": 4.547746144721234, "grad_norm": 1.0390625, "learning_rate": 0.0003106403494157649, "loss": 4.8803, "mean_token_accuracy": 0.22617262303829194, "num_tokens": 105359285.0, "step": 46005 }, { "entropy": 5.407247543334961, "epoch": 4.548240411229735, "grad_norm": 1.1171875, "learning_rate": 0.0003106055045390865, "loss": 4.901, "mean_token_accuracy": 0.23024703711271285, "num_tokens": 105372809.0, "step": 46010 }, { "entropy": 5.288892936706543, "epoch": 4.548734677738237, "grad_norm": 1.0703125, "learning_rate": 0.00031057065878650715, "loss": 4.6939, "mean_token_accuracy": 0.24852800518274307, "num_tokens": 105384341.0, "step": 46015 }, { "entropy": 5.291445398330689, "epoch": 4.549228944246738, "grad_norm": 1.0, "learning_rate": 0.00031053581215888417, "loss": 4.7515, "mean_token_accuracy": 0.23806431740522385, "num_tokens": 105397222.0, "step": 46020 }, { "entropy": 5.258544635772705, "epoch": 4.549723210755239, "grad_norm": 1.140625, "learning_rate": 0.00031050096465707466, "loss": 4.7155, "mean_token_accuracy": 0.24225863814353943, "num_tokens": 105407924.0, "step": 46025 }, { "entropy": 5.282110118865967, "epoch": 4.5502174772637405, "grad_norm": 0.98828125, "learning_rate": 0.0003104661162819359, "loss": 4.813, "mean_token_accuracy": 0.2387745350599289, "num_tokens": 105419390.0, "step": 46030 }, { "entropy": 5.366766309738159, "epoch": 4.550711743772242, "grad_norm": 1.15625, "learning_rate": 0.0003104312670343252, "loss": 4.773, "mean_token_accuracy": 0.24183510690927507, "num_tokens": 105430963.0, "step": 46035 }, { "entropy": 5.271313810348511, "epoch": 4.551206010280743, "grad_norm": 1.109375, "learning_rate": 0.00031039641691509983, "loss": 4.7205, "mean_token_accuracy": 0.24307508021593094, "num_tokens": 105443176.0, "step": 46040 }, { "entropy": 5.3403462886810305, "epoch": 4.551700276789244, "grad_norm": 1.0078125, "learning_rate": 0.0003103615659251171, "loss": 4.7393, "mean_token_accuracy": 0.2425253689289093, "num_tokens": 105454523.0, "step": 46045 }, { "entropy": 5.292881679534912, "epoch": 4.552194543297746, "grad_norm": 1.0234375, "learning_rate": 0.0003103267140652344, "loss": 4.7594, "mean_token_accuracy": 0.24051546007394792, "num_tokens": 105466523.0, "step": 46050 }, { "entropy": 5.305054330825806, "epoch": 4.552688809806248, "grad_norm": 1.109375, "learning_rate": 0.000310291861336309, "loss": 4.7457, "mean_token_accuracy": 0.2399974673986435, "num_tokens": 105478799.0, "step": 46055 }, { "entropy": 5.35771336555481, "epoch": 4.553183076314749, "grad_norm": 1.046875, "learning_rate": 0.00031025700773919837, "loss": 4.8135, "mean_token_accuracy": 0.2325750321149826, "num_tokens": 105491088.0, "step": 46060 }, { "entropy": 5.342064237594604, "epoch": 4.55367734282325, "grad_norm": 1.0390625, "learning_rate": 0.0003102221532747598, "loss": 4.7642, "mean_token_accuracy": 0.2402760311961174, "num_tokens": 105502258.0, "step": 46065 }, { "entropy": 5.3188680648803714, "epoch": 4.5541716093317515, "grad_norm": 0.9375, "learning_rate": 0.0003101872979438509, "loss": 4.7666, "mean_token_accuracy": 0.24127933830022813, "num_tokens": 105514414.0, "step": 46070 }, { "entropy": 5.288008689880371, "epoch": 4.554665875840253, "grad_norm": 1.03125, "learning_rate": 0.000310152441747329, "loss": 4.7278, "mean_token_accuracy": 0.24781912416219712, "num_tokens": 105526023.0, "step": 46075 }, { "entropy": 5.2758135318756105, "epoch": 4.555160142348754, "grad_norm": 1.015625, "learning_rate": 0.0003101175846860515, "loss": 4.7814, "mean_token_accuracy": 0.2377654120326042, "num_tokens": 105538593.0, "step": 46080 }, { "entropy": 5.296210384368896, "epoch": 4.555654408857256, "grad_norm": 1.1171875, "learning_rate": 0.0003100827267608761, "loss": 4.7116, "mean_token_accuracy": 0.24095897227525712, "num_tokens": 105549854.0, "step": 46085 }, { "entropy": 5.317349767684936, "epoch": 4.556148675365757, "grad_norm": 1.046875, "learning_rate": 0.00031004786797266004, "loss": 4.8329, "mean_token_accuracy": 0.2308525413274765, "num_tokens": 105561778.0, "step": 46090 }, { "entropy": 5.362176895141602, "epoch": 4.556642941874259, "grad_norm": 1.0390625, "learning_rate": 0.00031001300832226105, "loss": 4.8275, "mean_token_accuracy": 0.23139584362506865, "num_tokens": 105573829.0, "step": 46095 }, { "entropy": 5.287926054000854, "epoch": 4.55713720838276, "grad_norm": 1.015625, "learning_rate": 0.00030997814781053663, "loss": 4.7318, "mean_token_accuracy": 0.24885366410017012, "num_tokens": 105585456.0, "step": 46100 }, { "entropy": 5.352023458480835, "epoch": 4.557631474891261, "grad_norm": 1.0859375, "learning_rate": 0.00030994328643834437, "loss": 4.7899, "mean_token_accuracy": 0.24055362343788148, "num_tokens": 105596926.0, "step": 46105 }, { "entropy": 5.386295175552368, "epoch": 4.5581257413997625, "grad_norm": 1.140625, "learning_rate": 0.00030990842420654176, "loss": 4.8948, "mean_token_accuracy": 0.23069569021463393, "num_tokens": 105608316.0, "step": 46110 }, { "entropy": 5.316753244400024, "epoch": 4.558620007908264, "grad_norm": 1.015625, "learning_rate": 0.0003098735611159866, "loss": 4.7659, "mean_token_accuracy": 0.2399437829852104, "num_tokens": 105618921.0, "step": 46115 }, { "entropy": 5.361058568954467, "epoch": 4.559114274416766, "grad_norm": 1.0234375, "learning_rate": 0.0003098386971675364, "loss": 4.8742, "mean_token_accuracy": 0.2255961164832115, "num_tokens": 105629981.0, "step": 46120 }, { "entropy": 5.426955652236939, "epoch": 4.559608540925267, "grad_norm": 1.09375, "learning_rate": 0.00030980383236204885, "loss": 4.8396, "mean_token_accuracy": 0.23606272488832475, "num_tokens": 105640975.0, "step": 46125 }, { "entropy": 5.25029239654541, "epoch": 4.560102807433768, "grad_norm": 1.0234375, "learning_rate": 0.00030976896670038156, "loss": 4.7369, "mean_token_accuracy": 0.24010101109743118, "num_tokens": 105652075.0, "step": 46130 }, { "entropy": 5.385785865783691, "epoch": 4.56059707394227, "grad_norm": 1.0546875, "learning_rate": 0.00030973410018339233, "loss": 4.888, "mean_token_accuracy": 0.22286843061447142, "num_tokens": 105663016.0, "step": 46135 }, { "entropy": 5.304477596282959, "epoch": 4.561091340450771, "grad_norm": 1.0625, "learning_rate": 0.00030969923281193887, "loss": 4.7396, "mean_token_accuracy": 0.23873922675848008, "num_tokens": 105674032.0, "step": 46140 }, { "entropy": 5.346174001693726, "epoch": 4.561585606959272, "grad_norm": 1.078125, "learning_rate": 0.00030966436458687883, "loss": 4.7861, "mean_token_accuracy": 0.23991650342941284, "num_tokens": 105685411.0, "step": 46145 }, { "entropy": 5.249520397186279, "epoch": 4.562079873467773, "grad_norm": 1.15625, "learning_rate": 0.00030962949550907015, "loss": 4.6952, "mean_token_accuracy": 0.24196603000164033, "num_tokens": 105695898.0, "step": 46150 }, { "entropy": 5.350488567352295, "epoch": 4.562574139976276, "grad_norm": 1.0625, "learning_rate": 0.0003095946255793705, "loss": 4.8178, "mean_token_accuracy": 0.23556257784366608, "num_tokens": 105706889.0, "step": 46155 }, { "entropy": 5.307861423492431, "epoch": 4.563068406484777, "grad_norm": 1.0078125, "learning_rate": 0.0003095597547986376, "loss": 4.7859, "mean_token_accuracy": 0.23630695939064025, "num_tokens": 105718700.0, "step": 46160 }, { "entropy": 5.252548885345459, "epoch": 4.563562672993278, "grad_norm": 1.1171875, "learning_rate": 0.0003095248831677294, "loss": 4.6508, "mean_token_accuracy": 0.24824587553739547, "num_tokens": 105729790.0, "step": 46165 }, { "entropy": 5.319172191619873, "epoch": 4.564056939501779, "grad_norm": 1.09375, "learning_rate": 0.0003094900106875037, "loss": 4.7491, "mean_token_accuracy": 0.24545961171388625, "num_tokens": 105740370.0, "step": 46170 }, { "entropy": 5.371364688873291, "epoch": 4.564551206010281, "grad_norm": 1.203125, "learning_rate": 0.0003094551373588185, "loss": 4.7385, "mean_token_accuracy": 0.2394310340285301, "num_tokens": 105749992.0, "step": 46175 }, { "entropy": 5.292880535125732, "epoch": 4.565045472518782, "grad_norm": 1.109375, "learning_rate": 0.00030942026318253146, "loss": 4.7275, "mean_token_accuracy": 0.24325801730155944, "num_tokens": 105760491.0, "step": 46180 }, { "entropy": 5.222695398330688, "epoch": 4.565539739027283, "grad_norm": 1.0234375, "learning_rate": 0.0003093853881595006, "loss": 4.7291, "mean_token_accuracy": 0.24983414262533188, "num_tokens": 105772307.0, "step": 46185 }, { "entropy": 5.314553737640381, "epoch": 4.566034005535785, "grad_norm": 1.0078125, "learning_rate": 0.000309350512290584, "loss": 4.7745, "mean_token_accuracy": 0.2344156965613365, "num_tokens": 105784108.0, "step": 46190 }, { "entropy": 5.291177892684937, "epoch": 4.566528272044287, "grad_norm": 1.046875, "learning_rate": 0.00030931563557663934, "loss": 4.7555, "mean_token_accuracy": 0.24196866005659104, "num_tokens": 105795833.0, "step": 46195 }, { "entropy": 5.388841056823731, "epoch": 4.567022538552788, "grad_norm": 0.9921875, "learning_rate": 0.00030928075801852473, "loss": 4.783, "mean_token_accuracy": 0.24028868973255157, "num_tokens": 105807170.0, "step": 46200 }, { "entropy": 5.377444267272949, "epoch": 4.567516805061289, "grad_norm": 1.0546875, "learning_rate": 0.0003092458796170982, "loss": 4.8091, "mean_token_accuracy": 0.2341519773006439, "num_tokens": 105818620.0, "step": 46205 }, { "entropy": 5.297230815887451, "epoch": 4.56801107156979, "grad_norm": 1.125, "learning_rate": 0.00030921100037321767, "loss": 4.7157, "mean_token_accuracy": 0.24843240082263945, "num_tokens": 105830872.0, "step": 46210 }, { "entropy": 5.203405523300171, "epoch": 4.568505338078292, "grad_norm": 1.15625, "learning_rate": 0.00030917612028774123, "loss": 4.6241, "mean_token_accuracy": 0.2610205441713333, "num_tokens": 105840132.0, "step": 46215 }, { "entropy": 5.303403568267822, "epoch": 4.568999604586793, "grad_norm": 1.078125, "learning_rate": 0.000309141239361527, "loss": 4.7731, "mean_token_accuracy": 0.24459660798311234, "num_tokens": 105851949.0, "step": 46220 }, { "entropy": 5.352255153656006, "epoch": 4.569493871095295, "grad_norm": 1.109375, "learning_rate": 0.0003091063575954329, "loss": 4.7374, "mean_token_accuracy": 0.2398654118180275, "num_tokens": 105863340.0, "step": 46225 }, { "entropy": 5.365938997268676, "epoch": 4.569988137603796, "grad_norm": 0.9921875, "learning_rate": 0.0003090714749903171, "loss": 4.8834, "mean_token_accuracy": 0.23603958487510682, "num_tokens": 105875158.0, "step": 46230 }, { "entropy": 5.294112348556519, "epoch": 4.570482404112298, "grad_norm": 1.15625, "learning_rate": 0.00030903659154703786, "loss": 4.8028, "mean_token_accuracy": 0.24010302722454072, "num_tokens": 105886369.0, "step": 46235 }, { "entropy": 5.3540120124816895, "epoch": 4.570976670620799, "grad_norm": 1.1796875, "learning_rate": 0.000309001707266453, "loss": 4.7566, "mean_token_accuracy": 0.24470293372869492, "num_tokens": 105897341.0, "step": 46240 }, { "entropy": 5.306479501724243, "epoch": 4.5714709371293, "grad_norm": 1.2265625, "learning_rate": 0.00030896682214942106, "loss": 4.7575, "mean_token_accuracy": 0.23834220170974732, "num_tokens": 105909132.0, "step": 46245 }, { "entropy": 5.368557405471802, "epoch": 4.571965203637801, "grad_norm": 1.0390625, "learning_rate": 0.00030893193619679985, "loss": 4.8025, "mean_token_accuracy": 0.23229178190231323, "num_tokens": 105919916.0, "step": 46250 }, { "entropy": 5.3083470344543455, "epoch": 4.572459470146303, "grad_norm": 1.140625, "learning_rate": 0.0003088970494094479, "loss": 4.782, "mean_token_accuracy": 0.2366945445537567, "num_tokens": 105930104.0, "step": 46255 }, { "entropy": 5.315156602859497, "epoch": 4.572953736654805, "grad_norm": 1.046875, "learning_rate": 0.0003088621617882232, "loss": 4.7243, "mean_token_accuracy": 0.24096668958663942, "num_tokens": 105942382.0, "step": 46260 }, { "entropy": 5.296706962585449, "epoch": 4.573448003163306, "grad_norm": 0.98046875, "learning_rate": 0.0003088272733339841, "loss": 4.7597, "mean_token_accuracy": 0.2388281464576721, "num_tokens": 105954878.0, "step": 46265 }, { "entropy": 5.244213581085205, "epoch": 4.573942269671807, "grad_norm": 1.078125, "learning_rate": 0.0003087923840475888, "loss": 4.6924, "mean_token_accuracy": 0.24633745700120926, "num_tokens": 105965277.0, "step": 46270 }, { "entropy": 5.362932777404785, "epoch": 4.5744365361803085, "grad_norm": 0.9609375, "learning_rate": 0.00030875749392989557, "loss": 4.8314, "mean_token_accuracy": 0.23898105919361115, "num_tokens": 105977660.0, "step": 46275 }, { "entropy": 5.296509456634522, "epoch": 4.57493080268881, "grad_norm": 1.0703125, "learning_rate": 0.0003087226029817628, "loss": 4.7713, "mean_token_accuracy": 0.2419987440109253, "num_tokens": 105989401.0, "step": 46280 }, { "entropy": 5.356947183609009, "epoch": 4.575425069197311, "grad_norm": 1.03125, "learning_rate": 0.0003086877112040487, "loss": 4.7709, "mean_token_accuracy": 0.24139515608549117, "num_tokens": 105999801.0, "step": 46285 }, { "entropy": 5.268112993240356, "epoch": 4.575919335705812, "grad_norm": 0.91015625, "learning_rate": 0.0003086528185976118, "loss": 4.7685, "mean_token_accuracy": 0.22964999377727507, "num_tokens": 106011263.0, "step": 46290 }, { "entropy": 5.30888180732727, "epoch": 4.576413602214314, "grad_norm": 1.0390625, "learning_rate": 0.0003086179251633103, "loss": 4.7945, "mean_token_accuracy": 0.23688402771949768, "num_tokens": 106023166.0, "step": 46295 }, { "entropy": 5.361755847930908, "epoch": 4.576907868722815, "grad_norm": 1.078125, "learning_rate": 0.00030858303090200255, "loss": 4.8257, "mean_token_accuracy": 0.23919113129377365, "num_tokens": 106036143.0, "step": 46300 }, { "entropy": 5.3170568466186525, "epoch": 4.577402135231317, "grad_norm": 1.1640625, "learning_rate": 0.00030854813581454707, "loss": 4.6897, "mean_token_accuracy": 0.24679994136095046, "num_tokens": 106047160.0, "step": 46305 }, { "entropy": 5.313509082794189, "epoch": 4.577896401739818, "grad_norm": 0.9609375, "learning_rate": 0.0003085132399018023, "loss": 4.7507, "mean_token_accuracy": 0.24554871618747712, "num_tokens": 106059384.0, "step": 46310 }, { "entropy": 5.293914890289306, "epoch": 4.5783906682483195, "grad_norm": 1.125, "learning_rate": 0.0003084783431646266, "loss": 4.781, "mean_token_accuracy": 0.23680222630500794, "num_tokens": 106069859.0, "step": 46315 }, { "entropy": 5.296546554565429, "epoch": 4.578884934756821, "grad_norm": 1.109375, "learning_rate": 0.00030844344560387844, "loss": 4.753, "mean_token_accuracy": 0.2371966004371643, "num_tokens": 106081292.0, "step": 46320 }, { "entropy": 5.329649496078491, "epoch": 4.579379201265322, "grad_norm": 1.015625, "learning_rate": 0.0003084085472204163, "loss": 4.7402, "mean_token_accuracy": 0.23817619681358337, "num_tokens": 106093236.0, "step": 46325 }, { "entropy": 5.335464572906494, "epoch": 4.579873467773823, "grad_norm": 1.015625, "learning_rate": 0.00030837364801509874, "loss": 4.7608, "mean_token_accuracy": 0.23696758598089218, "num_tokens": 106104386.0, "step": 46330 }, { "entropy": 5.27182559967041, "epoch": 4.580367734282325, "grad_norm": 1.1328125, "learning_rate": 0.00030833874798878437, "loss": 4.7212, "mean_token_accuracy": 0.24797256737947465, "num_tokens": 106114812.0, "step": 46335 }, { "entropy": 5.265547513961792, "epoch": 4.580862000790827, "grad_norm": 1.0625, "learning_rate": 0.00030830384714233155, "loss": 4.7213, "mean_token_accuracy": 0.24136936962604522, "num_tokens": 106125434.0, "step": 46340 }, { "entropy": 5.287922143936157, "epoch": 4.581356267299328, "grad_norm": 1.109375, "learning_rate": 0.00030826894547659876, "loss": 4.8014, "mean_token_accuracy": 0.23558620363473892, "num_tokens": 106138218.0, "step": 46345 }, { "entropy": 5.266700696945191, "epoch": 4.581850533807829, "grad_norm": 1.046875, "learning_rate": 0.00030823404299244495, "loss": 4.6729, "mean_token_accuracy": 0.2467038229107857, "num_tokens": 106149408.0, "step": 46350 }, { "entropy": 5.436547470092774, "epoch": 4.5823448003163305, "grad_norm": 1.171875, "learning_rate": 0.0003081991396907285, "loss": 4.9417, "mean_token_accuracy": 0.22747867703437805, "num_tokens": 106162589.0, "step": 46355 }, { "entropy": 5.332763719558716, "epoch": 4.582839066824832, "grad_norm": 1.03125, "learning_rate": 0.00030816423557230807, "loss": 4.8317, "mean_token_accuracy": 0.24091246873140335, "num_tokens": 106175539.0, "step": 46360 }, { "entropy": 5.34825587272644, "epoch": 4.583333333333333, "grad_norm": 1.171875, "learning_rate": 0.00030812933063804226, "loss": 4.8032, "mean_token_accuracy": 0.23721416890621186, "num_tokens": 106187545.0, "step": 46365 }, { "entropy": 5.314373111724853, "epoch": 4.583827599841834, "grad_norm": 1.0703125, "learning_rate": 0.00030809442488878976, "loss": 4.7501, "mean_token_accuracy": 0.23798197507858276, "num_tokens": 106199512.0, "step": 46370 }, { "entropy": 5.3221776485443115, "epoch": 4.5843218663503364, "grad_norm": 1.1328125, "learning_rate": 0.0003080595183254093, "loss": 4.8028, "mean_token_accuracy": 0.2326689690351486, "num_tokens": 106211185.0, "step": 46375 }, { "entropy": 5.335288429260254, "epoch": 4.584816132858838, "grad_norm": 1.125, "learning_rate": 0.0003080246109487596, "loss": 4.801, "mean_token_accuracy": 0.23506732136011124, "num_tokens": 106222604.0, "step": 46380 }, { "entropy": 5.378701162338257, "epoch": 4.585310399367339, "grad_norm": 1.046875, "learning_rate": 0.0003079897027596992, "loss": 4.8419, "mean_token_accuracy": 0.23420726507902145, "num_tokens": 106236134.0, "step": 46385 }, { "entropy": 5.344173955917358, "epoch": 4.58580466587584, "grad_norm": 1.0390625, "learning_rate": 0.0003079547937590872, "loss": 4.7794, "mean_token_accuracy": 0.23909322917461395, "num_tokens": 106247553.0, "step": 46390 }, { "entropy": 5.29997296333313, "epoch": 4.5862989323843415, "grad_norm": 1.078125, "learning_rate": 0.000307919883947782, "loss": 4.7074, "mean_token_accuracy": 0.2500392645597458, "num_tokens": 106258356.0, "step": 46395 }, { "entropy": 5.373227834701538, "epoch": 4.586793198892843, "grad_norm": 1.1171875, "learning_rate": 0.0003078849733266426, "loss": 4.8362, "mean_token_accuracy": 0.23233679234981536, "num_tokens": 106269428.0, "step": 46400 }, { "entropy": 5.244698858261108, "epoch": 4.587287465401344, "grad_norm": 1.03125, "learning_rate": 0.0003078500618965278, "loss": 4.6592, "mean_token_accuracy": 0.24803805351257324, "num_tokens": 106280600.0, "step": 46405 }, { "entropy": 5.348250961303711, "epoch": 4.587781731909846, "grad_norm": 1.1171875, "learning_rate": 0.00030781514965829636, "loss": 4.7445, "mean_token_accuracy": 0.23413638323545455, "num_tokens": 106291720.0, "step": 46410 }, { "entropy": 5.269946575164795, "epoch": 4.588275998418347, "grad_norm": 1.0546875, "learning_rate": 0.0003077802366128071, "loss": 4.7576, "mean_token_accuracy": 0.23698088824748992, "num_tokens": 106303156.0, "step": 46415 }, { "entropy": 5.303151607513428, "epoch": 4.588770264926849, "grad_norm": 1.0703125, "learning_rate": 0.000307745322760919, "loss": 4.7602, "mean_token_accuracy": 0.23712416738271713, "num_tokens": 106314671.0, "step": 46420 }, { "entropy": 5.285700035095215, "epoch": 4.58926453143535, "grad_norm": 0.91015625, "learning_rate": 0.0003077104081034909, "loss": 4.7296, "mean_token_accuracy": 0.2432905524969101, "num_tokens": 106327246.0, "step": 46425 }, { "entropy": 5.3259974956512455, "epoch": 4.589758797943851, "grad_norm": 1.203125, "learning_rate": 0.00030767549264138156, "loss": 4.7112, "mean_token_accuracy": 0.24210051894187928, "num_tokens": 106337632.0, "step": 46430 }, { "entropy": 5.32859320640564, "epoch": 4.5902530644523525, "grad_norm": 1.0390625, "learning_rate": 0.0003076405763754501, "loss": 4.8054, "mean_token_accuracy": 0.23827482163906097, "num_tokens": 106348885.0, "step": 46435 }, { "entropy": 5.361138200759887, "epoch": 4.590747330960854, "grad_norm": 1.1171875, "learning_rate": 0.00030760565930655544, "loss": 4.7573, "mean_token_accuracy": 0.2399568662047386, "num_tokens": 106359369.0, "step": 46440 }, { "entropy": 5.238091611862183, "epoch": 4.591241597469356, "grad_norm": 1.125, "learning_rate": 0.0003075707414355564, "loss": 4.7121, "mean_token_accuracy": 0.24042764455080032, "num_tokens": 106371198.0, "step": 46445 }, { "entropy": 5.352580261230469, "epoch": 4.591735863977857, "grad_norm": 1.078125, "learning_rate": 0.0003075358227633122, "loss": 4.8333, "mean_token_accuracy": 0.23665257394313813, "num_tokens": 106382874.0, "step": 46450 }, { "entropy": 5.4014143466949465, "epoch": 4.592230130486358, "grad_norm": 1.0234375, "learning_rate": 0.00030750090329068167, "loss": 4.8978, "mean_token_accuracy": 0.2269972324371338, "num_tokens": 106394329.0, "step": 46455 }, { "entropy": 5.282790470123291, "epoch": 4.59272439699486, "grad_norm": 0.984375, "learning_rate": 0.0003074659830185238, "loss": 4.7668, "mean_token_accuracy": 0.24933858811855317, "num_tokens": 106407223.0, "step": 46460 }, { "entropy": 5.338649129867553, "epoch": 4.593218663503361, "grad_norm": 1.0625, "learning_rate": 0.0003074310619476978, "loss": 4.8198, "mean_token_accuracy": 0.24000953137874603, "num_tokens": 106418622.0, "step": 46465 }, { "entropy": 5.312146949768066, "epoch": 4.593712930011862, "grad_norm": 1.078125, "learning_rate": 0.0003073961400790626, "loss": 4.7983, "mean_token_accuracy": 0.23593563735485076, "num_tokens": 106430575.0, "step": 46470 }, { "entropy": 5.291008996963501, "epoch": 4.5942071965203635, "grad_norm": 1.09375, "learning_rate": 0.0003073612174134773, "loss": 4.7315, "mean_token_accuracy": 0.23859204202890397, "num_tokens": 106441707.0, "step": 46475 }, { "entropy": 5.345534324645996, "epoch": 4.594701463028866, "grad_norm": 1.0546875, "learning_rate": 0.0003073262939518011, "loss": 4.7894, "mean_token_accuracy": 0.23691368401050567, "num_tokens": 106453470.0, "step": 46480 }, { "entropy": 5.331584310531616, "epoch": 4.595195729537367, "grad_norm": 1.0625, "learning_rate": 0.000307291369694893, "loss": 4.7282, "mean_token_accuracy": 0.24766307026147844, "num_tokens": 106464140.0, "step": 46485 }, { "entropy": 5.317227506637574, "epoch": 4.595689996045868, "grad_norm": 1.0390625, "learning_rate": 0.0003072564446436122, "loss": 4.7171, "mean_token_accuracy": 0.24090434610843658, "num_tokens": 106476052.0, "step": 46490 }, { "entropy": 5.233542585372925, "epoch": 4.596184262554369, "grad_norm": 1.1171875, "learning_rate": 0.00030722151879881786, "loss": 4.6857, "mean_token_accuracy": 0.24778105616569518, "num_tokens": 106486568.0, "step": 46495 }, { "entropy": 5.2455932140350345, "epoch": 4.596678529062871, "grad_norm": 0.98046875, "learning_rate": 0.00030718659216136924, "loss": 4.7374, "mean_token_accuracy": 0.24533480256795884, "num_tokens": 106498770.0, "step": 46500 }, { "entropy": 5.342388725280761, "epoch": 4.597172795571372, "grad_norm": 1.1484375, "learning_rate": 0.0003071516647321254, "loss": 4.7841, "mean_token_accuracy": 0.23662391006946565, "num_tokens": 106510384.0, "step": 46505 }, { "entropy": 5.258494853973389, "epoch": 4.597667062079873, "grad_norm": 1.0703125, "learning_rate": 0.0003071167365119455, "loss": 4.7156, "mean_token_accuracy": 0.24214761704206467, "num_tokens": 106522197.0, "step": 46510 }, { "entropy": 5.3055071353912355, "epoch": 4.598161328588375, "grad_norm": 1.0390625, "learning_rate": 0.0003070818075016891, "loss": 4.7539, "mean_token_accuracy": 0.23959665447473527, "num_tokens": 106533218.0, "step": 46515 }, { "entropy": 5.318193483352661, "epoch": 4.598655595096877, "grad_norm": 1.1015625, "learning_rate": 0.0003070468777022151, "loss": 4.7283, "mean_token_accuracy": 0.2423129513859749, "num_tokens": 106545391.0, "step": 46520 }, { "entropy": 5.364313983917237, "epoch": 4.599149861605378, "grad_norm": 1.0859375, "learning_rate": 0.00030701194711438306, "loss": 4.7901, "mean_token_accuracy": 0.24109046459197997, "num_tokens": 106556122.0, "step": 46525 }, { "entropy": 5.325183248519897, "epoch": 4.599644128113879, "grad_norm": 0.97265625, "learning_rate": 0.00030697701573905204, "loss": 4.7555, "mean_token_accuracy": 0.23618641793727874, "num_tokens": 106567876.0, "step": 46530 }, { "entropy": 5.229588365554809, "epoch": 4.60013839462238, "grad_norm": 1.0625, "learning_rate": 0.0003069420835770816, "loss": 4.6813, "mean_token_accuracy": 0.2435942620038986, "num_tokens": 106578083.0, "step": 46535 }, { "entropy": 5.304369688034058, "epoch": 4.600632661130882, "grad_norm": 1.03125, "learning_rate": 0.0003069071506293308, "loss": 4.8039, "mean_token_accuracy": 0.23491773009300232, "num_tokens": 106589986.0, "step": 46540 }, { "entropy": 5.370417547225952, "epoch": 4.601126927639383, "grad_norm": 0.93359375, "learning_rate": 0.0003068722168966593, "loss": 4.8003, "mean_token_accuracy": 0.23910237848758698, "num_tokens": 106602055.0, "step": 46545 }, { "entropy": 5.39693660736084, "epoch": 4.601621194147884, "grad_norm": 1.0859375, "learning_rate": 0.00030683728237992626, "loss": 4.729, "mean_token_accuracy": 0.2415338337421417, "num_tokens": 106613394.0, "step": 46550 }, { "entropy": 5.307285404205322, "epoch": 4.602115460656385, "grad_norm": 1.046875, "learning_rate": 0.00030680234707999117, "loss": 4.646, "mean_token_accuracy": 0.24641015529632568, "num_tokens": 106624190.0, "step": 46555 }, { "entropy": 5.2730201244354244, "epoch": 4.602609727164888, "grad_norm": 1.0234375, "learning_rate": 0.0003067674109977133, "loss": 4.7676, "mean_token_accuracy": 0.2306116223335266, "num_tokens": 106636030.0, "step": 46560 }, { "entropy": 5.346750354766845, "epoch": 4.603103993673389, "grad_norm": 1.0, "learning_rate": 0.0003067324741339523, "loss": 4.8252, "mean_token_accuracy": 0.2304486885666847, "num_tokens": 106648648.0, "step": 46565 }, { "entropy": 5.241068410873413, "epoch": 4.60359826018189, "grad_norm": 1.09375, "learning_rate": 0.00030669753648956743, "loss": 4.7, "mean_token_accuracy": 0.24314745962619783, "num_tokens": 106659902.0, "step": 46570 }, { "entropy": 5.353117322921753, "epoch": 4.604092526690391, "grad_norm": 1.03125, "learning_rate": 0.00030666259806541823, "loss": 4.8255, "mean_token_accuracy": 0.22968601286411286, "num_tokens": 106670768.0, "step": 46575 }, { "entropy": 5.324463129043579, "epoch": 4.604586793198893, "grad_norm": 1.1015625, "learning_rate": 0.0003066276588623643, "loss": 4.7466, "mean_token_accuracy": 0.23987704515457153, "num_tokens": 106682331.0, "step": 46580 }, { "entropy": 5.348349714279175, "epoch": 4.605081059707394, "grad_norm": 1.1328125, "learning_rate": 0.000306592718881265, "loss": 4.8475, "mean_token_accuracy": 0.23022715449333192, "num_tokens": 106692562.0, "step": 46585 }, { "entropy": 5.266795015335083, "epoch": 4.605575326215895, "grad_norm": 1.0390625, "learning_rate": 0.0003065577781229799, "loss": 4.7234, "mean_token_accuracy": 0.24627836048603058, "num_tokens": 106705208.0, "step": 46590 }, { "entropy": 5.441021919250488, "epoch": 4.606069592724397, "grad_norm": 1.09375, "learning_rate": 0.0003065228365883686, "loss": 4.9064, "mean_token_accuracy": 0.22732217162847518, "num_tokens": 106717875.0, "step": 46595 }, { "entropy": 5.3476073265075685, "epoch": 4.606563859232899, "grad_norm": 1.0, "learning_rate": 0.00030648789427829067, "loss": 4.7742, "mean_token_accuracy": 0.23782961964607238, "num_tokens": 106729237.0, "step": 46600 }, { "entropy": 5.337458658218384, "epoch": 4.6070581257414, "grad_norm": 1.109375, "learning_rate": 0.00030645295119360557, "loss": 4.851, "mean_token_accuracy": 0.2397244930267334, "num_tokens": 106740805.0, "step": 46605 }, { "entropy": 5.309431886672973, "epoch": 4.607552392249901, "grad_norm": 1.1015625, "learning_rate": 0.000306418007335173, "loss": 4.7406, "mean_token_accuracy": 0.24283396899700166, "num_tokens": 106752069.0, "step": 46610 }, { "entropy": 5.501082515716552, "epoch": 4.608046658758402, "grad_norm": 1.09375, "learning_rate": 0.00030638306270385266, "loss": 4.9255, "mean_token_accuracy": 0.22549811750650406, "num_tokens": 106764885.0, "step": 46615 }, { "entropy": 5.328059959411621, "epoch": 4.608540925266904, "grad_norm": 1.125, "learning_rate": 0.000306348117300504, "loss": 4.7951, "mean_token_accuracy": 0.23794317096471787, "num_tokens": 106775712.0, "step": 46620 }, { "entropy": 5.3345174312591555, "epoch": 4.609035191775405, "grad_norm": 0.984375, "learning_rate": 0.0003063131711259868, "loss": 4.7608, "mean_token_accuracy": 0.24387193620204925, "num_tokens": 106788068.0, "step": 46625 }, { "entropy": 5.300780153274536, "epoch": 4.609529458283907, "grad_norm": 1.0234375, "learning_rate": 0.00030627822418116083, "loss": 4.7636, "mean_token_accuracy": 0.24259671419858933, "num_tokens": 106798984.0, "step": 46630 }, { "entropy": 5.367342329025268, "epoch": 4.610023724792408, "grad_norm": 1.109375, "learning_rate": 0.0003062432764668856, "loss": 4.788, "mean_token_accuracy": 0.23784360885620118, "num_tokens": 106811447.0, "step": 46635 }, { "entropy": 5.30296483039856, "epoch": 4.61051799130091, "grad_norm": 1.0546875, "learning_rate": 0.000306208327984021, "loss": 4.8201, "mean_token_accuracy": 0.23157528042793274, "num_tokens": 106823622.0, "step": 46640 }, { "entropy": 5.3566559791564945, "epoch": 4.611012257809411, "grad_norm": 0.96875, "learning_rate": 0.00030617337873342664, "loss": 4.8608, "mean_token_accuracy": 0.23000825494527816, "num_tokens": 106836767.0, "step": 46645 }, { "entropy": 5.420834016799927, "epoch": 4.611506524317912, "grad_norm": 1.0859375, "learning_rate": 0.0003061384287159623, "loss": 4.8828, "mean_token_accuracy": 0.22950863242149352, "num_tokens": 106849027.0, "step": 46650 }, { "entropy": 5.318598127365112, "epoch": 4.612000790826413, "grad_norm": 1.0703125, "learning_rate": 0.0003061034779324878, "loss": 4.7272, "mean_token_accuracy": 0.24533609449863433, "num_tokens": 106859543.0, "step": 46655 }, { "entropy": 5.280698966979981, "epoch": 4.612495057334915, "grad_norm": 1.1796875, "learning_rate": 0.00030606852638386304, "loss": 4.713, "mean_token_accuracy": 0.24652789533138275, "num_tokens": 106870300.0, "step": 46660 }, { "entropy": 5.309361791610717, "epoch": 4.612989323843417, "grad_norm": 1.1953125, "learning_rate": 0.0003060335740709475, "loss": 4.7093, "mean_token_accuracy": 0.2504499673843384, "num_tokens": 106880706.0, "step": 46665 }, { "entropy": 5.33143162727356, "epoch": 4.613483590351918, "grad_norm": 1.109375, "learning_rate": 0.0003059986209946014, "loss": 4.8405, "mean_token_accuracy": 0.23317849338054658, "num_tokens": 106890906.0, "step": 46670 }, { "entropy": 5.3500292778015135, "epoch": 4.613977856860419, "grad_norm": 1.0390625, "learning_rate": 0.0003059636671556843, "loss": 4.7964, "mean_token_accuracy": 0.2345868766307831, "num_tokens": 106902175.0, "step": 46675 }, { "entropy": 5.382107305526733, "epoch": 4.6144721233689205, "grad_norm": 1.109375, "learning_rate": 0.00030592871255505615, "loss": 4.8706, "mean_token_accuracy": 0.22460970878601075, "num_tokens": 106913267.0, "step": 46680 }, { "entropy": 5.294682312011719, "epoch": 4.614966389877422, "grad_norm": 0.9609375, "learning_rate": 0.00030589375719357705, "loss": 4.7757, "mean_token_accuracy": 0.23821062743663787, "num_tokens": 106925603.0, "step": 46685 }, { "entropy": 5.3165247440338135, "epoch": 4.615460656385923, "grad_norm": 1.1640625, "learning_rate": 0.00030585880107210654, "loss": 4.7782, "mean_token_accuracy": 0.24084232449531556, "num_tokens": 106937038.0, "step": 46690 }, { "entropy": 5.314494323730469, "epoch": 4.615954922894424, "grad_norm": 1.0546875, "learning_rate": 0.0003058238441915049, "loss": 4.6679, "mean_token_accuracy": 0.24119011163711548, "num_tokens": 106948302.0, "step": 46695 }, { "entropy": 5.262599182128906, "epoch": 4.6164491894029265, "grad_norm": 1.1328125, "learning_rate": 0.0003057888865526318, "loss": 4.6783, "mean_token_accuracy": 0.24825618416070938, "num_tokens": 106958347.0, "step": 46700 }, { "entropy": 5.299594306945801, "epoch": 4.616943455911428, "grad_norm": 1.015625, "learning_rate": 0.0003057539281563473, "loss": 4.8213, "mean_token_accuracy": 0.23551650643348693, "num_tokens": 106969816.0, "step": 46705 }, { "entropy": 5.357821416854859, "epoch": 4.617437722419929, "grad_norm": 1.1015625, "learning_rate": 0.00030571896900351156, "loss": 4.8136, "mean_token_accuracy": 0.23644735366106034, "num_tokens": 106981100.0, "step": 46710 }, { "entropy": 5.258654069900513, "epoch": 4.61793198892843, "grad_norm": 1.125, "learning_rate": 0.0003056840090949843, "loss": 4.7333, "mean_token_accuracy": 0.24425366371870041, "num_tokens": 106993135.0, "step": 46715 }, { "entropy": 5.372873735427857, "epoch": 4.6184262554369315, "grad_norm": 1.125, "learning_rate": 0.0003056490484316256, "loss": 4.8031, "mean_token_accuracy": 0.23637422323226928, "num_tokens": 107005375.0, "step": 46720 }, { "entropy": 5.397593545913696, "epoch": 4.618920521945433, "grad_norm": 1.078125, "learning_rate": 0.0003056140870142957, "loss": 4.8054, "mean_token_accuracy": 0.23728708326816558, "num_tokens": 107017932.0, "step": 46725 }, { "entropy": 5.327650165557861, "epoch": 4.619414788453934, "grad_norm": 1.015625, "learning_rate": 0.0003055791248438544, "loss": 4.7076, "mean_token_accuracy": 0.2390981525182724, "num_tokens": 107029122.0, "step": 46730 }, { "entropy": 5.2617326259613035, "epoch": 4.619909054962436, "grad_norm": 1.1171875, "learning_rate": 0.00030554416192116185, "loss": 4.7943, "mean_token_accuracy": 0.24130612015724182, "num_tokens": 107041501.0, "step": 46735 }, { "entropy": 5.29696249961853, "epoch": 4.6204033214709375, "grad_norm": 1.09375, "learning_rate": 0.0003055091982470783, "loss": 4.7695, "mean_token_accuracy": 0.24470363706350326, "num_tokens": 107051948.0, "step": 46740 }, { "entropy": 5.363325548171997, "epoch": 4.620897587979439, "grad_norm": 1.109375, "learning_rate": 0.00030547423382246364, "loss": 4.7568, "mean_token_accuracy": 0.2424144923686981, "num_tokens": 107063186.0, "step": 46745 }, { "entropy": 5.26838231086731, "epoch": 4.62139185448794, "grad_norm": 1.1640625, "learning_rate": 0.0003054392686481781, "loss": 4.7399, "mean_token_accuracy": 0.24386406540870667, "num_tokens": 107075617.0, "step": 46750 }, { "entropy": 5.353669261932373, "epoch": 4.621886120996441, "grad_norm": 1.109375, "learning_rate": 0.00030540430272508193, "loss": 4.8105, "mean_token_accuracy": 0.2418176919221878, "num_tokens": 107087505.0, "step": 46755 }, { "entropy": 5.336716222763061, "epoch": 4.6223803875049425, "grad_norm": 1.0546875, "learning_rate": 0.00030536933605403513, "loss": 4.7476, "mean_token_accuracy": 0.24366955310106278, "num_tokens": 107099062.0, "step": 46760 }, { "entropy": 5.258093976974488, "epoch": 4.622874654013444, "grad_norm": 1.0234375, "learning_rate": 0.00030533436863589794, "loss": 4.7026, "mean_token_accuracy": 0.24420574307441711, "num_tokens": 107112014.0, "step": 46765 }, { "entropy": 5.25746111869812, "epoch": 4.623368920521946, "grad_norm": 1.0703125, "learning_rate": 0.0003052994004715306, "loss": 4.7207, "mean_token_accuracy": 0.24580239355564118, "num_tokens": 107124458.0, "step": 46770 }, { "entropy": 5.397492933273315, "epoch": 4.623863187030447, "grad_norm": 1.1640625, "learning_rate": 0.00030526443156179327, "loss": 4.8482, "mean_token_accuracy": 0.22668864578008652, "num_tokens": 107135701.0, "step": 46775 }, { "entropy": 5.332167243957519, "epoch": 4.6243574535389484, "grad_norm": 0.97265625, "learning_rate": 0.00030522946190754624, "loss": 4.7483, "mean_token_accuracy": 0.24329694211483002, "num_tokens": 107147347.0, "step": 46780 }, { "entropy": 5.378030490875244, "epoch": 4.62485172004745, "grad_norm": 1.078125, "learning_rate": 0.0003051944915096498, "loss": 4.821, "mean_token_accuracy": 0.23717807084321976, "num_tokens": 107159287.0, "step": 46785 }, { "entropy": 5.322234296798706, "epoch": 4.625345986555951, "grad_norm": 1.0625, "learning_rate": 0.0003051595203689642, "loss": 4.8219, "mean_token_accuracy": 0.2324742019176483, "num_tokens": 107170445.0, "step": 46790 }, { "entropy": 5.355663394927978, "epoch": 4.625840253064452, "grad_norm": 0.98046875, "learning_rate": 0.00030512454848634964, "loss": 4.8424, "mean_token_accuracy": 0.22514314502477645, "num_tokens": 107182676.0, "step": 46795 }, { "entropy": 5.3327854633331295, "epoch": 4.6263345195729535, "grad_norm": 1.0859375, "learning_rate": 0.00030508957586266656, "loss": 4.8189, "mean_token_accuracy": 0.23721090853214263, "num_tokens": 107192929.0, "step": 46800 }, { "entropy": 5.303879165649414, "epoch": 4.626828786081455, "grad_norm": 1.0546875, "learning_rate": 0.00030505460249877523, "loss": 4.7018, "mean_token_accuracy": 0.24960702657699585, "num_tokens": 107204649.0, "step": 46805 }, { "entropy": 5.309306812286377, "epoch": 4.627323052589956, "grad_norm": 1.1171875, "learning_rate": 0.00030501962839553603, "loss": 4.7725, "mean_token_accuracy": 0.2421204552054405, "num_tokens": 107216784.0, "step": 46810 }, { "entropy": 5.287709379196167, "epoch": 4.627817319098458, "grad_norm": 1.078125, "learning_rate": 0.0003049846535538094, "loss": 4.7232, "mean_token_accuracy": 0.2437044560909271, "num_tokens": 107228265.0, "step": 46815 }, { "entropy": 5.397508430480957, "epoch": 4.628311585606959, "grad_norm": 1.0234375, "learning_rate": 0.0003049496779744555, "loss": 4.8416, "mean_token_accuracy": 0.23160129189491271, "num_tokens": 107239433.0, "step": 46820 }, { "entropy": 5.339365005493164, "epoch": 4.628805852115461, "grad_norm": 1.0625, "learning_rate": 0.00030491470165833483, "loss": 4.7387, "mean_token_accuracy": 0.24660664051771164, "num_tokens": 107250780.0, "step": 46825 }, { "entropy": 5.231286287307739, "epoch": 4.629300118623962, "grad_norm": 1.1328125, "learning_rate": 0.00030487972460630804, "loss": 4.7164, "mean_token_accuracy": 0.24701065570116043, "num_tokens": 107261914.0, "step": 46830 }, { "entropy": 5.281617021560669, "epoch": 4.629794385132463, "grad_norm": 1.109375, "learning_rate": 0.00030484474681923533, "loss": 4.759, "mean_token_accuracy": 0.24022321552038192, "num_tokens": 107272697.0, "step": 46835 }, { "entropy": 5.399513673782349, "epoch": 4.6302886516409645, "grad_norm": 1.1875, "learning_rate": 0.0003048097682979772, "loss": 4.8383, "mean_token_accuracy": 0.24192980229854583, "num_tokens": 107283722.0, "step": 46840 }, { "entropy": 5.370867013931274, "epoch": 4.630782918149466, "grad_norm": 1.0625, "learning_rate": 0.00030477478904339405, "loss": 4.8325, "mean_token_accuracy": 0.23314640969038009, "num_tokens": 107296605.0, "step": 46845 }, { "entropy": 5.325264835357666, "epoch": 4.631277184657968, "grad_norm": 0.97265625, "learning_rate": 0.00030473980905634655, "loss": 4.824, "mean_token_accuracy": 0.23559605479240417, "num_tokens": 107309564.0, "step": 46850 }, { "entropy": 5.317524433135986, "epoch": 4.631771451166469, "grad_norm": 1.015625, "learning_rate": 0.0003047048283376952, "loss": 4.7323, "mean_token_accuracy": 0.23934549540281297, "num_tokens": 107321400.0, "step": 46855 }, { "entropy": 5.380433845520019, "epoch": 4.63226571767497, "grad_norm": 1.046875, "learning_rate": 0.0003046698468883004, "loss": 4.8463, "mean_token_accuracy": 0.23079747557640076, "num_tokens": 107333242.0, "step": 46860 }, { "entropy": 5.226701402664185, "epoch": 4.632759984183472, "grad_norm": 0.984375, "learning_rate": 0.0003046348647090227, "loss": 4.6469, "mean_token_accuracy": 0.2512676686048508, "num_tokens": 107346641.0, "step": 46865 }, { "entropy": 5.314192581176758, "epoch": 4.633254250691973, "grad_norm": 1.0234375, "learning_rate": 0.0003045998818007228, "loss": 4.6826, "mean_token_accuracy": 0.24870558083057404, "num_tokens": 107358274.0, "step": 46870 }, { "entropy": 5.355138349533081, "epoch": 4.633748517200474, "grad_norm": 1.140625, "learning_rate": 0.00030456489816426123, "loss": 4.8114, "mean_token_accuracy": 0.23460664004087448, "num_tokens": 107370984.0, "step": 46875 }, { "entropy": 5.271267461776733, "epoch": 4.6342427837089755, "grad_norm": 1.015625, "learning_rate": 0.0003045299138004986, "loss": 4.8085, "mean_token_accuracy": 0.2439315661787987, "num_tokens": 107383416.0, "step": 46880 }, { "entropy": 5.2852271556854244, "epoch": 4.634737050217478, "grad_norm": 0.96875, "learning_rate": 0.0003044949287102955, "loss": 4.712, "mean_token_accuracy": 0.24128298461437225, "num_tokens": 107394949.0, "step": 46885 }, { "entropy": 5.306475734710693, "epoch": 4.635231316725979, "grad_norm": 1.09375, "learning_rate": 0.0003044599428945125, "loss": 4.7734, "mean_token_accuracy": 0.23934780955314636, "num_tokens": 107406310.0, "step": 46890 }, { "entropy": 5.369635057449341, "epoch": 4.63572558323448, "grad_norm": 1.0390625, "learning_rate": 0.0003044249563540104, "loss": 4.806, "mean_token_accuracy": 0.23668270260095597, "num_tokens": 107417988.0, "step": 46895 }, { "entropy": 5.286064529418946, "epoch": 4.636219849742981, "grad_norm": 1.015625, "learning_rate": 0.00030438996908964985, "loss": 4.7166, "mean_token_accuracy": 0.24353177100419998, "num_tokens": 107430254.0, "step": 46900 }, { "entropy": 5.320332288742065, "epoch": 4.636714116251483, "grad_norm": 1.0625, "learning_rate": 0.00030435498110229143, "loss": 4.754, "mean_token_accuracy": 0.24606273621320723, "num_tokens": 107441674.0, "step": 46905 }, { "entropy": 5.358366918563843, "epoch": 4.637208382759984, "grad_norm": 1.140625, "learning_rate": 0.0003043199923927959, "loss": 4.7932, "mean_token_accuracy": 0.23647991567850113, "num_tokens": 107452019.0, "step": 46910 }, { "entropy": 5.393128538131714, "epoch": 4.637702649268485, "grad_norm": 1.1640625, "learning_rate": 0.000304285002962024, "loss": 4.9005, "mean_token_accuracy": 0.22800888866186142, "num_tokens": 107463254.0, "step": 46915 }, { "entropy": 5.313248157501221, "epoch": 4.638196915776987, "grad_norm": 1.09375, "learning_rate": 0.0003042500128108366, "loss": 4.7571, "mean_token_accuracy": 0.23969299495220184, "num_tokens": 107474674.0, "step": 46920 }, { "entropy": 5.337032318115234, "epoch": 4.638691182285489, "grad_norm": 1.0078125, "learning_rate": 0.00030421502194009426, "loss": 4.8147, "mean_token_accuracy": 0.23805329948663712, "num_tokens": 107486374.0, "step": 46925 }, { "entropy": 5.375564193725586, "epoch": 4.63918544879399, "grad_norm": 1.046875, "learning_rate": 0.00030418003035065784, "loss": 4.7684, "mean_token_accuracy": 0.23353808969259263, "num_tokens": 107497759.0, "step": 46930 }, { "entropy": 5.3161906719207765, "epoch": 4.639679715302491, "grad_norm": 1.0859375, "learning_rate": 0.0003041450380433882, "loss": 4.7296, "mean_token_accuracy": 0.24464945495128632, "num_tokens": 107509693.0, "step": 46935 }, { "entropy": 5.20213828086853, "epoch": 4.640173981810992, "grad_norm": 1.0703125, "learning_rate": 0.00030411004501914603, "loss": 4.6985, "mean_token_accuracy": 0.23977856934070588, "num_tokens": 107521453.0, "step": 46940 }, { "entropy": 5.252995729446411, "epoch": 4.640668248319494, "grad_norm": 1.1640625, "learning_rate": 0.0003040750512787923, "loss": 4.7082, "mean_token_accuracy": 0.2527642086148262, "num_tokens": 107533401.0, "step": 46945 }, { "entropy": 5.325837326049805, "epoch": 4.641162514827995, "grad_norm": 1.0234375, "learning_rate": 0.0003040400568231878, "loss": 4.7325, "mean_token_accuracy": 0.2416178345680237, "num_tokens": 107545126.0, "step": 46950 }, { "entropy": 5.424925804138184, "epoch": 4.641656781336497, "grad_norm": 1.03125, "learning_rate": 0.00030400506165319333, "loss": 4.8923, "mean_token_accuracy": 0.2330072358250618, "num_tokens": 107555774.0, "step": 46955 }, { "entropy": 5.379643535614013, "epoch": 4.642151047844998, "grad_norm": 1.0703125, "learning_rate": 0.0003039700657696699, "loss": 4.868, "mean_token_accuracy": 0.23254959285259247, "num_tokens": 107567522.0, "step": 46960 }, { "entropy": 5.261021471023559, "epoch": 4.6426453143535, "grad_norm": 1.1171875, "learning_rate": 0.00030393506917347833, "loss": 4.6835, "mean_token_accuracy": 0.25411146581172944, "num_tokens": 107578637.0, "step": 46965 }, { "entropy": 5.274419593811035, "epoch": 4.643139580862001, "grad_norm": 1.09375, "learning_rate": 0.00030390007186547956, "loss": 4.7465, "mean_token_accuracy": 0.23960900455713272, "num_tokens": 107590750.0, "step": 46970 }, { "entropy": 5.332150554656982, "epoch": 4.643633847370502, "grad_norm": 1.109375, "learning_rate": 0.0003038650738465347, "loss": 4.7327, "mean_token_accuracy": 0.2412520930171013, "num_tokens": 107600660.0, "step": 46975 }, { "entropy": 5.3005187034606935, "epoch": 4.644128113879003, "grad_norm": 1.078125, "learning_rate": 0.0003038300751175044, "loss": 4.8119, "mean_token_accuracy": 0.2343987211585045, "num_tokens": 107612880.0, "step": 46980 }, { "entropy": 5.27240514755249, "epoch": 4.644622380387505, "grad_norm": 1.078125, "learning_rate": 0.0003037950756792497, "loss": 4.7635, "mean_token_accuracy": 0.24863413125276565, "num_tokens": 107625651.0, "step": 46985 }, { "entropy": 5.341445875167847, "epoch": 4.645116646896007, "grad_norm": 1.1328125, "learning_rate": 0.0003037600755326317, "loss": 4.7585, "mean_token_accuracy": 0.2366329774260521, "num_tokens": 107636418.0, "step": 46990 }, { "entropy": 5.365891075134277, "epoch": 4.645610913404508, "grad_norm": 1.078125, "learning_rate": 0.00030372507467851155, "loss": 4.8377, "mean_token_accuracy": 0.2386238694190979, "num_tokens": 107648643.0, "step": 46995 }, { "entropy": 5.325975799560547, "epoch": 4.646105179913009, "grad_norm": 1.0390625, "learning_rate": 0.00030369007311775, "loss": 4.7938, "mean_token_accuracy": 0.23426760733127594, "num_tokens": 107660183.0, "step": 47000 }, { "entropy": 5.332058334350586, "epoch": 4.646599446421511, "grad_norm": 1.0390625, "learning_rate": 0.0003036550708512082, "loss": 4.8026, "mean_token_accuracy": 0.24294869750738143, "num_tokens": 107670868.0, "step": 47005 }, { "entropy": 5.325595855712891, "epoch": 4.647093712930012, "grad_norm": 1.046875, "learning_rate": 0.0003036200678797471, "loss": 4.7581, "mean_token_accuracy": 0.2467600166797638, "num_tokens": 107682502.0, "step": 47010 }, { "entropy": 5.3444281101226805, "epoch": 4.647587979438513, "grad_norm": 1.09375, "learning_rate": 0.000303585064204228, "loss": 4.7837, "mean_token_accuracy": 0.23907345980405809, "num_tokens": 107694490.0, "step": 47015 }, { "entropy": 5.386691331863403, "epoch": 4.648082245947014, "grad_norm": 0.97265625, "learning_rate": 0.000303550059825512, "loss": 4.7972, "mean_token_accuracy": 0.23474095463752748, "num_tokens": 107707172.0, "step": 47020 }, { "entropy": 5.284240484237671, "epoch": 4.6485765124555165, "grad_norm": 1.171875, "learning_rate": 0.00030351505474445997, "loss": 4.7121, "mean_token_accuracy": 0.2448695793747902, "num_tokens": 107718919.0, "step": 47025 }, { "entropy": 5.338914203643799, "epoch": 4.649070778964018, "grad_norm": 1.0625, "learning_rate": 0.0003034800489619332, "loss": 4.7916, "mean_token_accuracy": 0.2386801451444626, "num_tokens": 107729839.0, "step": 47030 }, { "entropy": 5.268869781494141, "epoch": 4.649565045472519, "grad_norm": 1.03125, "learning_rate": 0.00030344504247879273, "loss": 4.7052, "mean_token_accuracy": 0.24688744097948073, "num_tokens": 107740551.0, "step": 47035 }, { "entropy": 5.367434978485107, "epoch": 4.65005931198102, "grad_norm": 1.015625, "learning_rate": 0.0003034100352958999, "loss": 4.8817, "mean_token_accuracy": 0.22954519987106323, "num_tokens": 107754594.0, "step": 47040 }, { "entropy": 5.3613245487213135, "epoch": 4.6505535784895216, "grad_norm": 1.046875, "learning_rate": 0.0003033750274141157, "loss": 4.7988, "mean_token_accuracy": 0.23825611919164658, "num_tokens": 107765957.0, "step": 47045 }, { "entropy": 5.36299877166748, "epoch": 4.651047844998023, "grad_norm": 1.140625, "learning_rate": 0.0003033400188343015, "loss": 4.75, "mean_token_accuracy": 0.24088921695947646, "num_tokens": 107776336.0, "step": 47050 }, { "entropy": 5.228418684005737, "epoch": 4.651542111506524, "grad_norm": 0.96484375, "learning_rate": 0.0003033050095573185, "loss": 4.682, "mean_token_accuracy": 0.2477120578289032, "num_tokens": 107788394.0, "step": 47055 }, { "entropy": 5.346856784820557, "epoch": 4.652036378015025, "grad_norm": 0.9609375, "learning_rate": 0.0003032699995840277, "loss": 4.8107, "mean_token_accuracy": 0.23590920120477676, "num_tokens": 107800398.0, "step": 47060 }, { "entropy": 5.357201814651489, "epoch": 4.652530644523527, "grad_norm": 1.0234375, "learning_rate": 0.0003032349889152907, "loss": 4.8062, "mean_token_accuracy": 0.23618725538253785, "num_tokens": 107810906.0, "step": 47065 }, { "entropy": 5.271135377883911, "epoch": 4.653024911032029, "grad_norm": 1.0390625, "learning_rate": 0.0003031999775519685, "loss": 4.6651, "mean_token_accuracy": 0.25349645912647245, "num_tokens": 107821864.0, "step": 47070 }, { "entropy": 5.285683536529541, "epoch": 4.65351917754053, "grad_norm": 1.046875, "learning_rate": 0.00030316496549492243, "loss": 4.7136, "mean_token_accuracy": 0.24192750453948975, "num_tokens": 107832898.0, "step": 47075 }, { "entropy": 5.305432891845703, "epoch": 4.654013444049031, "grad_norm": 1.1484375, "learning_rate": 0.0003031299527450139, "loss": 4.7958, "mean_token_accuracy": 0.24402466416358948, "num_tokens": 107845075.0, "step": 47080 }, { "entropy": 5.410228252410889, "epoch": 4.6545077105575325, "grad_norm": 1.0234375, "learning_rate": 0.00030309493930310416, "loss": 4.8775, "mean_token_accuracy": 0.22365982532501222, "num_tokens": 107856735.0, "step": 47085 }, { "entropy": 5.294452238082886, "epoch": 4.655001977066034, "grad_norm": 1.1328125, "learning_rate": 0.0003030599251700546, "loss": 4.7209, "mean_token_accuracy": 0.25012856870889666, "num_tokens": 107868224.0, "step": 47090 }, { "entropy": 5.337784481048584, "epoch": 4.655496243574535, "grad_norm": 1.15625, "learning_rate": 0.0003030249103467265, "loss": 4.8127, "mean_token_accuracy": 0.23503818809986116, "num_tokens": 107879332.0, "step": 47095 }, { "entropy": 5.307474565505982, "epoch": 4.655990510083036, "grad_norm": 1.0078125, "learning_rate": 0.0003029898948339812, "loss": 4.7559, "mean_token_accuracy": 0.24204273372888566, "num_tokens": 107891537.0, "step": 47100 }, { "entropy": 5.2638976097106935, "epoch": 4.6564847765915385, "grad_norm": 1.0859375, "learning_rate": 0.00030295487863268015, "loss": 4.6817, "mean_token_accuracy": 0.25024507492780684, "num_tokens": 107904127.0, "step": 47105 }, { "entropy": 5.359409046173096, "epoch": 4.65697904310004, "grad_norm": 1.0546875, "learning_rate": 0.00030291986174368484, "loss": 4.7834, "mean_token_accuracy": 0.23351689726114272, "num_tokens": 107915436.0, "step": 47110 }, { "entropy": 5.20597996711731, "epoch": 4.657473309608541, "grad_norm": 1.15625, "learning_rate": 0.00030288484416785656, "loss": 4.6347, "mean_token_accuracy": 0.2510534942150116, "num_tokens": 107927335.0, "step": 47115 }, { "entropy": 5.309620380401611, "epoch": 4.657967576117042, "grad_norm": 0.97265625, "learning_rate": 0.00030284982590605687, "loss": 4.7928, "mean_token_accuracy": 0.23534860610961914, "num_tokens": 107938941.0, "step": 47120 }, { "entropy": 5.3780261993408205, "epoch": 4.6584618426255435, "grad_norm": 1.046875, "learning_rate": 0.00030281480695914696, "loss": 4.8021, "mean_token_accuracy": 0.23991491943597792, "num_tokens": 107950333.0, "step": 47125 }, { "entropy": 5.3564859390258786, "epoch": 4.658956109134045, "grad_norm": 1.109375, "learning_rate": 0.00030277978732798854, "loss": 4.7983, "mean_token_accuracy": 0.24019641131162645, "num_tokens": 107960951.0, "step": 47130 }, { "entropy": 5.325196886062622, "epoch": 4.659450375642546, "grad_norm": 1.0703125, "learning_rate": 0.00030274476701344313, "loss": 4.8161, "mean_token_accuracy": 0.23579718172550201, "num_tokens": 107972383.0, "step": 47135 }, { "entropy": 5.278750896453857, "epoch": 4.659944642151048, "grad_norm": 1.15625, "learning_rate": 0.00030270974601637207, "loss": 4.699, "mean_token_accuracy": 0.24394385069608687, "num_tokens": 107984562.0, "step": 47140 }, { "entropy": 5.258649730682373, "epoch": 4.6604389086595495, "grad_norm": 1.1484375, "learning_rate": 0.000302674724337637, "loss": 4.706, "mean_token_accuracy": 0.24879777580499648, "num_tokens": 107995445.0, "step": 47145 }, { "entropy": 5.365177297592163, "epoch": 4.660933175168051, "grad_norm": 1.03125, "learning_rate": 0.00030263970197809935, "loss": 4.8524, "mean_token_accuracy": 0.23357087075710298, "num_tokens": 108007444.0, "step": 47150 }, { "entropy": 5.387779188156128, "epoch": 4.661427441676552, "grad_norm": 1.1015625, "learning_rate": 0.00030260467893862086, "loss": 4.7972, "mean_token_accuracy": 0.23584404587745667, "num_tokens": 108019813.0, "step": 47155 }, { "entropy": 5.285441637039185, "epoch": 4.661921708185053, "grad_norm": 1.078125, "learning_rate": 0.0003025696552200629, "loss": 4.6615, "mean_token_accuracy": 0.2515841335058212, "num_tokens": 108031309.0, "step": 47160 }, { "entropy": 5.24527678489685, "epoch": 4.6624159746935545, "grad_norm": 1.1875, "learning_rate": 0.0003025346308232872, "loss": 4.7225, "mean_token_accuracy": 0.24608304649591445, "num_tokens": 108042480.0, "step": 47165 }, { "entropy": 5.308374691009521, "epoch": 4.662910241202056, "grad_norm": 1.0703125, "learning_rate": 0.00030249960574915523, "loss": 4.7454, "mean_token_accuracy": 0.23844481110572815, "num_tokens": 108054297.0, "step": 47170 }, { "entropy": 5.342446947097779, "epoch": 4.663404507710558, "grad_norm": 1.0625, "learning_rate": 0.0003024645799985287, "loss": 4.8422, "mean_token_accuracy": 0.23338902443647386, "num_tokens": 108066065.0, "step": 47175 }, { "entropy": 5.409089708328247, "epoch": 4.663898774219059, "grad_norm": 1.0, "learning_rate": 0.0003024295535722693, "loss": 4.8407, "mean_token_accuracy": 0.23102143555879592, "num_tokens": 108078421.0, "step": 47180 }, { "entropy": 5.347243070602417, "epoch": 4.6643930407275604, "grad_norm": 1.125, "learning_rate": 0.0003023945264712386, "loss": 4.8089, "mean_token_accuracy": 0.23769120424985885, "num_tokens": 108090022.0, "step": 47185 }, { "entropy": 5.31127233505249, "epoch": 4.664887307236062, "grad_norm": 1.03125, "learning_rate": 0.0003023594986962984, "loss": 4.7918, "mean_token_accuracy": 0.23844168484210967, "num_tokens": 108102425.0, "step": 47190 }, { "entropy": 5.319750356674194, "epoch": 4.665381573744563, "grad_norm": 1.0390625, "learning_rate": 0.00030232447024831015, "loss": 4.8005, "mean_token_accuracy": 0.2400336429476738, "num_tokens": 108114801.0, "step": 47195 }, { "entropy": 5.334781551361084, "epoch": 4.665875840253064, "grad_norm": 1.09375, "learning_rate": 0.00030228944112813567, "loss": 4.7353, "mean_token_accuracy": 0.24580594003200532, "num_tokens": 108126089.0, "step": 47200 }, { "entropy": 5.265328454971313, "epoch": 4.6663701067615655, "grad_norm": 1.109375, "learning_rate": 0.0003022544113366368, "loss": 4.6695, "mean_token_accuracy": 0.2496148467063904, "num_tokens": 108137500.0, "step": 47205 }, { "entropy": 5.3061493873596195, "epoch": 4.666864373270068, "grad_norm": 1.0546875, "learning_rate": 0.00030221938087467517, "loss": 4.8406, "mean_token_accuracy": 0.22720620930194854, "num_tokens": 108148645.0, "step": 47210 }, { "entropy": 5.3541772842407225, "epoch": 4.667358639778569, "grad_norm": 1.0078125, "learning_rate": 0.0003021843497431125, "loss": 4.8102, "mean_token_accuracy": 0.23268915563821793, "num_tokens": 108159227.0, "step": 47215 }, { "entropy": 5.315416669845581, "epoch": 4.66785290628707, "grad_norm": 1.1015625, "learning_rate": 0.0003021493179428107, "loss": 4.7555, "mean_token_accuracy": 0.2438724622130394, "num_tokens": 108170686.0, "step": 47220 }, { "entropy": 5.371852540969849, "epoch": 4.668347172795571, "grad_norm": 1.125, "learning_rate": 0.0003021142854746314, "loss": 4.8108, "mean_token_accuracy": 0.23432353734970093, "num_tokens": 108182170.0, "step": 47225 }, { "entropy": 5.24407925605774, "epoch": 4.668841439304073, "grad_norm": 1.0703125, "learning_rate": 0.0003020792523394364, "loss": 4.6975, "mean_token_accuracy": 0.24745487421751022, "num_tokens": 108193638.0, "step": 47230 }, { "entropy": 5.3181287288665775, "epoch": 4.669335705812574, "grad_norm": 1.109375, "learning_rate": 0.00030204421853808765, "loss": 4.7993, "mean_token_accuracy": 0.23567969501018524, "num_tokens": 108205455.0, "step": 47235 }, { "entropy": 5.357159233093261, "epoch": 4.669829972321075, "grad_norm": 1.046875, "learning_rate": 0.000302009184071447, "loss": 4.7762, "mean_token_accuracy": 0.2376583695411682, "num_tokens": 108216949.0, "step": 47240 }, { "entropy": 5.3362785339355465, "epoch": 4.670324238829577, "grad_norm": 1.0390625, "learning_rate": 0.0003019741489403762, "loss": 4.7786, "mean_token_accuracy": 0.23437432199716568, "num_tokens": 108227792.0, "step": 47245 }, { "entropy": 5.26515302658081, "epoch": 4.670818505338079, "grad_norm": 1.0078125, "learning_rate": 0.0003019391131457371, "loss": 4.7519, "mean_token_accuracy": 0.24639555662870408, "num_tokens": 108239167.0, "step": 47250 }, { "entropy": 5.389997768402099, "epoch": 4.67131277184658, "grad_norm": 1.0234375, "learning_rate": 0.0003019040766883917, "loss": 4.875, "mean_token_accuracy": 0.22825537472963334, "num_tokens": 108251241.0, "step": 47255 }, { "entropy": 5.29542760848999, "epoch": 4.671807038355081, "grad_norm": 1.015625, "learning_rate": 0.00030186903956920183, "loss": 4.6951, "mean_token_accuracy": 0.24512355625629426, "num_tokens": 108262287.0, "step": 47260 }, { "entropy": 5.2615196228027346, "epoch": 4.672301304863582, "grad_norm": 1.03125, "learning_rate": 0.0003018340017890294, "loss": 4.6769, "mean_token_accuracy": 0.24863240420818328, "num_tokens": 108275126.0, "step": 47265 }, { "entropy": 5.2727161884307865, "epoch": 4.672795571372084, "grad_norm": 1.171875, "learning_rate": 0.0003017989633487363, "loss": 4.7296, "mean_token_accuracy": 0.2361090287566185, "num_tokens": 108287021.0, "step": 47270 }, { "entropy": 5.309374189376831, "epoch": 4.673289837880585, "grad_norm": 1.046875, "learning_rate": 0.0003017639242491846, "loss": 4.6918, "mean_token_accuracy": 0.24228296428918839, "num_tokens": 108298512.0, "step": 47275 }, { "entropy": 5.234072065353393, "epoch": 4.673784104389087, "grad_norm": 1.0234375, "learning_rate": 0.0003017288844912362, "loss": 4.6791, "mean_token_accuracy": 0.24832548052072526, "num_tokens": 108309505.0, "step": 47280 }, { "entropy": 5.298725938796997, "epoch": 4.674278370897588, "grad_norm": 1.0625, "learning_rate": 0.00030169384407575315, "loss": 4.7594, "mean_token_accuracy": 0.24490859359502792, "num_tokens": 108320404.0, "step": 47285 }, { "entropy": 5.304827451705933, "epoch": 4.67477263740609, "grad_norm": 1.1015625, "learning_rate": 0.0003016588030035973, "loss": 4.8196, "mean_token_accuracy": 0.23249178975820542, "num_tokens": 108332221.0, "step": 47290 }, { "entropy": 5.34052300453186, "epoch": 4.675266903914591, "grad_norm": 1.03125, "learning_rate": 0.00030162376127563085, "loss": 4.8027, "mean_token_accuracy": 0.2350878432393074, "num_tokens": 108344962.0, "step": 47295 }, { "entropy": 5.259157991409301, "epoch": 4.675761170423092, "grad_norm": 1.1171875, "learning_rate": 0.00030158871889271574, "loss": 4.6673, "mean_token_accuracy": 0.24501744508743287, "num_tokens": 108356515.0, "step": 47300 }, { "entropy": 5.336945724487305, "epoch": 4.676255436931593, "grad_norm": 1.0859375, "learning_rate": 0.00030155367585571393, "loss": 4.7665, "mean_token_accuracy": 0.24376631379127503, "num_tokens": 108367807.0, "step": 47305 }, { "entropy": 5.381283712387085, "epoch": 4.676749703440095, "grad_norm": 1.125, "learning_rate": 0.0003015186321654877, "loss": 4.8462, "mean_token_accuracy": 0.23337942957878113, "num_tokens": 108381296.0, "step": 47310 }, { "entropy": 5.320196533203125, "epoch": 4.677243969948596, "grad_norm": 1.1328125, "learning_rate": 0.00030148358782289893, "loss": 4.8292, "mean_token_accuracy": 0.2402046114206314, "num_tokens": 108392331.0, "step": 47315 }, { "entropy": 5.325354051589966, "epoch": 4.677738236457097, "grad_norm": 1.1171875, "learning_rate": 0.00030144854282880974, "loss": 4.7106, "mean_token_accuracy": 0.24916242361068724, "num_tokens": 108402523.0, "step": 47320 }, { "entropy": 5.388751363754272, "epoch": 4.678232502965599, "grad_norm": 1.078125, "learning_rate": 0.00030141349718408237, "loss": 4.8332, "mean_token_accuracy": 0.24046432375907897, "num_tokens": 108413828.0, "step": 47325 }, { "entropy": 5.295213317871093, "epoch": 4.678726769474101, "grad_norm": 1.0703125, "learning_rate": 0.0003013784508895788, "loss": 4.69, "mean_token_accuracy": 0.23926427811384202, "num_tokens": 108424273.0, "step": 47330 }, { "entropy": 5.32061014175415, "epoch": 4.679221035982602, "grad_norm": 0.91796875, "learning_rate": 0.00030134340394616133, "loss": 4.8149, "mean_token_accuracy": 0.23833653777837754, "num_tokens": 108435620.0, "step": 47335 }, { "entropy": 5.1892008781433105, "epoch": 4.679715302491103, "grad_norm": 1.1484375, "learning_rate": 0.000301308356354692, "loss": 4.6233, "mean_token_accuracy": 0.24698080420494078, "num_tokens": 108445947.0, "step": 47340 }, { "entropy": 5.305894088745117, "epoch": 4.680209568999604, "grad_norm": 1.0078125, "learning_rate": 0.00030127330811603297, "loss": 4.7365, "mean_token_accuracy": 0.23843827545642854, "num_tokens": 108457343.0, "step": 47345 }, { "entropy": 5.240265655517578, "epoch": 4.680703835508106, "grad_norm": 1.015625, "learning_rate": 0.0003012382592310466, "loss": 4.6268, "mean_token_accuracy": 0.2514446124434471, "num_tokens": 108468393.0, "step": 47350 }, { "entropy": 5.387611818313599, "epoch": 4.681198102016607, "grad_norm": 1.125, "learning_rate": 0.00030120320970059494, "loss": 4.836, "mean_token_accuracy": 0.23236145526170732, "num_tokens": 108479170.0, "step": 47355 }, { "entropy": 5.348564195632934, "epoch": 4.681692368525109, "grad_norm": 1.0625, "learning_rate": 0.0003011681595255402, "loss": 4.7625, "mean_token_accuracy": 0.243373541533947, "num_tokens": 108490807.0, "step": 47360 }, { "entropy": 5.427990913391113, "epoch": 4.68218663503361, "grad_norm": 1.0859375, "learning_rate": 0.0003011331087067447, "loss": 4.9086, "mean_token_accuracy": 0.22570134848356246, "num_tokens": 108501582.0, "step": 47365 }, { "entropy": 5.342696285247802, "epoch": 4.682680901542112, "grad_norm": 0.984375, "learning_rate": 0.00030109805724507074, "loss": 4.7588, "mean_token_accuracy": 0.24446606934070586, "num_tokens": 108513805.0, "step": 47370 }, { "entropy": 5.401850843429566, "epoch": 4.683175168050613, "grad_norm": 1.0078125, "learning_rate": 0.0003010630051413804, "loss": 4.809, "mean_token_accuracy": 0.2284792795777321, "num_tokens": 108525486.0, "step": 47375 }, { "entropy": 5.33667516708374, "epoch": 4.683669434559114, "grad_norm": 0.98828125, "learning_rate": 0.0003010279523965362, "loss": 4.7951, "mean_token_accuracy": 0.23992688506841658, "num_tokens": 108537194.0, "step": 47380 }, { "entropy": 5.373246479034424, "epoch": 4.684163701067615, "grad_norm": 1.0859375, "learning_rate": 0.0003009928990114003, "loss": 4.8324, "mean_token_accuracy": 0.23521832525730133, "num_tokens": 108548422.0, "step": 47385 }, { "entropy": 5.3679094314575195, "epoch": 4.684657967576117, "grad_norm": 1.140625, "learning_rate": 0.000300957844986835, "loss": 4.8232, "mean_token_accuracy": 0.2318892240524292, "num_tokens": 108559604.0, "step": 47390 }, { "entropy": 5.357061100006104, "epoch": 4.685152234084619, "grad_norm": 1.078125, "learning_rate": 0.0003009227903237027, "loss": 4.8472, "mean_token_accuracy": 0.2279631331562996, "num_tokens": 108570878.0, "step": 47395 }, { "entropy": 5.276707553863526, "epoch": 4.68564650059312, "grad_norm": 1.046875, "learning_rate": 0.0003008877350228659, "loss": 4.7047, "mean_token_accuracy": 0.2465611144900322, "num_tokens": 108582687.0, "step": 47400 }, { "entropy": 5.314570808410645, "epoch": 4.686140767101621, "grad_norm": 1.078125, "learning_rate": 0.0003008526790851866, "loss": 4.7657, "mean_token_accuracy": 0.24039581865072251, "num_tokens": 108593505.0, "step": 47405 }, { "entropy": 5.288825941085816, "epoch": 4.686635033610123, "grad_norm": 1.0234375, "learning_rate": 0.00030081762251152745, "loss": 4.6987, "mean_token_accuracy": 0.2450062468647957, "num_tokens": 108604809.0, "step": 47410 }, { "entropy": 5.283283805847168, "epoch": 4.687129300118624, "grad_norm": 1.0078125, "learning_rate": 0.00030078256530275077, "loss": 4.7505, "mean_token_accuracy": 0.24216887801885606, "num_tokens": 108616601.0, "step": 47415 }, { "entropy": 5.299146223068237, "epoch": 4.687623566627125, "grad_norm": 1.125, "learning_rate": 0.000300747507459719, "loss": 4.6991, "mean_token_accuracy": 0.24895023554563522, "num_tokens": 108627521.0, "step": 47420 }, { "entropy": 5.351247072219849, "epoch": 4.688117833135626, "grad_norm": 0.98046875, "learning_rate": 0.00030071244898329457, "loss": 4.8254, "mean_token_accuracy": 0.23297270983457566, "num_tokens": 108639602.0, "step": 47425 }, { "entropy": 5.435061502456665, "epoch": 4.6886120996441285, "grad_norm": 0.92578125, "learning_rate": 0.0003006773898743399, "loss": 4.8591, "mean_token_accuracy": 0.22704935669898987, "num_tokens": 108652546.0, "step": 47430 }, { "entropy": 5.294757413864136, "epoch": 4.68910636615263, "grad_norm": 1.0390625, "learning_rate": 0.0003006423301337174, "loss": 4.6832, "mean_token_accuracy": 0.24295653402805328, "num_tokens": 108663772.0, "step": 47435 }, { "entropy": 5.311721420288086, "epoch": 4.689600632661131, "grad_norm": 1.0859375, "learning_rate": 0.00030060726976228964, "loss": 4.7709, "mean_token_accuracy": 0.23740090876817704, "num_tokens": 108674865.0, "step": 47440 }, { "entropy": 5.363456439971924, "epoch": 4.690094899169632, "grad_norm": 1.0859375, "learning_rate": 0.0003005722087609191, "loss": 4.8943, "mean_token_accuracy": 0.22966046929359435, "num_tokens": 108687127.0, "step": 47445 }, { "entropy": 5.364550399780273, "epoch": 4.6905891656781336, "grad_norm": 1.1484375, "learning_rate": 0.00030053714713046826, "loss": 4.7811, "mean_token_accuracy": 0.24404753744602203, "num_tokens": 108698119.0, "step": 47450 }, { "entropy": 5.3167736530303955, "epoch": 4.691083432186635, "grad_norm": 1.015625, "learning_rate": 0.0003005020848717996, "loss": 4.7463, "mean_token_accuracy": 0.24358149319887162, "num_tokens": 108709104.0, "step": 47455 }, { "entropy": 5.238837862014771, "epoch": 4.691577698695136, "grad_norm": 1.0546875, "learning_rate": 0.0003004670219857757, "loss": 4.7268, "mean_token_accuracy": 0.24895744770765305, "num_tokens": 108720111.0, "step": 47460 }, { "entropy": 5.326755332946777, "epoch": 4.692071965203638, "grad_norm": 1.0703125, "learning_rate": 0.0003004319584732591, "loss": 4.8139, "mean_token_accuracy": 0.23076773434877396, "num_tokens": 108731496.0, "step": 47465 }, { "entropy": 5.312597608566284, "epoch": 4.6925662317121395, "grad_norm": 1.0703125, "learning_rate": 0.00030039689433511234, "loss": 4.7542, "mean_token_accuracy": 0.243699312210083, "num_tokens": 108742760.0, "step": 47470 }, { "entropy": 5.232499647140503, "epoch": 4.693060498220641, "grad_norm": 1.078125, "learning_rate": 0.0003003618295721982, "loss": 4.6731, "mean_token_accuracy": 0.2547798067331314, "num_tokens": 108754554.0, "step": 47475 }, { "entropy": 5.311293077468872, "epoch": 4.693554764729142, "grad_norm": 1.0234375, "learning_rate": 0.0003003267641853789, "loss": 4.7535, "mean_token_accuracy": 0.2440798044204712, "num_tokens": 108765832.0, "step": 47480 }, { "entropy": 5.335140037536621, "epoch": 4.694049031237643, "grad_norm": 0.9921875, "learning_rate": 0.00030029169817551746, "loss": 4.7586, "mean_token_accuracy": 0.24131054878234864, "num_tokens": 108776898.0, "step": 47485 }, { "entropy": 5.257440376281738, "epoch": 4.6945432977461445, "grad_norm": 1.109375, "learning_rate": 0.00030025663154347615, "loss": 4.627, "mean_token_accuracy": 0.2559082880616188, "num_tokens": 108786724.0, "step": 47490 }, { "entropy": 5.283921480178833, "epoch": 4.695037564254646, "grad_norm": 1.1171875, "learning_rate": 0.00030022156429011787, "loss": 4.7748, "mean_token_accuracy": 0.2352953866124153, "num_tokens": 108797950.0, "step": 47495 }, { "entropy": 5.25652847290039, "epoch": 4.695531830763148, "grad_norm": 1.0703125, "learning_rate": 0.0003001864964163053, "loss": 4.7016, "mean_token_accuracy": 0.2463043749332428, "num_tokens": 108809931.0, "step": 47500 }, { "entropy": 5.30486478805542, "epoch": 4.696026097271649, "grad_norm": 1.125, "learning_rate": 0.00030015142792290086, "loss": 4.7986, "mean_token_accuracy": 0.2326479062438011, "num_tokens": 108820893.0, "step": 47505 }, { "entropy": 5.337909984588623, "epoch": 4.6965203637801505, "grad_norm": 1.0234375, "learning_rate": 0.0003001163588107674, "loss": 4.8223, "mean_token_accuracy": 0.2321161761879921, "num_tokens": 108832208.0, "step": 47510 }, { "entropy": 5.399611711502075, "epoch": 4.697014630288652, "grad_norm": 1.1171875, "learning_rate": 0.0003000812890807677, "loss": 4.8483, "mean_token_accuracy": 0.2266440510749817, "num_tokens": 108843297.0, "step": 47515 }, { "entropy": 5.366348552703857, "epoch": 4.697508896797153, "grad_norm": 1.078125, "learning_rate": 0.0003000462187337644, "loss": 4.7282, "mean_token_accuracy": 0.2421984478831291, "num_tokens": 108853503.0, "step": 47520 }, { "entropy": 5.329251432418824, "epoch": 4.698003163305654, "grad_norm": 1.0859375, "learning_rate": 0.00030001114777062016, "loss": 4.773, "mean_token_accuracy": 0.2412489950656891, "num_tokens": 108864305.0, "step": 47525 }, { "entropy": 5.1844642639160154, "epoch": 4.6984974298141555, "grad_norm": 1.109375, "learning_rate": 0.0002999760761921978, "loss": 4.6591, "mean_token_accuracy": 0.25485529452562333, "num_tokens": 108875096.0, "step": 47530 }, { "entropy": 5.282274150848389, "epoch": 4.698991696322658, "grad_norm": 0.9921875, "learning_rate": 0.00029994100399936016, "loss": 4.7319, "mean_token_accuracy": 0.24612376391887664, "num_tokens": 108886708.0, "step": 47535 }, { "entropy": 5.35664963722229, "epoch": 4.699485962831159, "grad_norm": 1.078125, "learning_rate": 0.00029990593119296995, "loss": 4.8, "mean_token_accuracy": 0.228480963408947, "num_tokens": 108897706.0, "step": 47540 }, { "entropy": 5.319053697586059, "epoch": 4.69998022933966, "grad_norm": 1.03125, "learning_rate": 0.00029987085777388994, "loss": 4.75, "mean_token_accuracy": 0.24282578080892564, "num_tokens": 108908356.0, "step": 47545 }, { "entropy": 5.391521453857422, "epoch": 4.7004744958481615, "grad_norm": 1.078125, "learning_rate": 0.000299835783742983, "loss": 4.7908, "mean_token_accuracy": 0.23753352016210555, "num_tokens": 108920090.0, "step": 47550 }, { "entropy": 5.286683845520019, "epoch": 4.700968762356663, "grad_norm": 1.09375, "learning_rate": 0.00029980070910111184, "loss": 4.6823, "mean_token_accuracy": 0.25119838416576384, "num_tokens": 108931171.0, "step": 47555 }, { "entropy": 5.3180248737335205, "epoch": 4.701463028865164, "grad_norm": 1.015625, "learning_rate": 0.0002997656338491395, "loss": 4.7797, "mean_token_accuracy": 0.24107125252485276, "num_tokens": 108941915.0, "step": 47560 }, { "entropy": 5.313052415847778, "epoch": 4.701957295373665, "grad_norm": 1.0703125, "learning_rate": 0.00029973055798792865, "loss": 4.7571, "mean_token_accuracy": 0.23584310412406922, "num_tokens": 108953983.0, "step": 47565 }, { "entropy": 5.252973651885986, "epoch": 4.7024515618821665, "grad_norm": 1.03125, "learning_rate": 0.00029969548151834223, "loss": 4.678, "mean_token_accuracy": 0.25475770235061646, "num_tokens": 108965372.0, "step": 47570 }, { "entropy": 5.321272611618042, "epoch": 4.702945828390668, "grad_norm": 1.1015625, "learning_rate": 0.0002996604044412431, "loss": 4.7726, "mean_token_accuracy": 0.23881149888038636, "num_tokens": 108975739.0, "step": 47575 }, { "entropy": 5.363643598556519, "epoch": 4.70344009489917, "grad_norm": 1.0703125, "learning_rate": 0.00029962532675749425, "loss": 4.8429, "mean_token_accuracy": 0.2303795337677002, "num_tokens": 108987005.0, "step": 47580 }, { "entropy": 5.332340717315674, "epoch": 4.703934361407671, "grad_norm": 1.1015625, "learning_rate": 0.0002995902484679586, "loss": 4.7505, "mean_token_accuracy": 0.23944716155529022, "num_tokens": 108998353.0, "step": 47585 }, { "entropy": 5.4410241603851315, "epoch": 4.7044286279161724, "grad_norm": 1.1171875, "learning_rate": 0.000299555169573499, "loss": 4.9798, "mean_token_accuracy": 0.2291873961687088, "num_tokens": 109010991.0, "step": 47590 }, { "entropy": 5.316464138031006, "epoch": 4.704922894424674, "grad_norm": 1.0546875, "learning_rate": 0.0002995200900749784, "loss": 4.6742, "mean_token_accuracy": 0.24641446769237518, "num_tokens": 109021850.0, "step": 47595 }, { "entropy": 5.362167882919311, "epoch": 4.705417160933175, "grad_norm": 1.0546875, "learning_rate": 0.00029948500997325974, "loss": 4.8205, "mean_token_accuracy": 0.23429409861564637, "num_tokens": 109032900.0, "step": 47600 }, { "entropy": 5.363618230819702, "epoch": 4.705911427441676, "grad_norm": 1.140625, "learning_rate": 0.00029944992926920604, "loss": 4.8545, "mean_token_accuracy": 0.2365209937095642, "num_tokens": 109043861.0, "step": 47605 }, { "entropy": 5.288335943222046, "epoch": 4.7064056939501775, "grad_norm": 1.0390625, "learning_rate": 0.0002994148479636803, "loss": 4.7174, "mean_token_accuracy": 0.24406524896621704, "num_tokens": 109054662.0, "step": 47610 }, { "entropy": 5.280620336532593, "epoch": 4.70689996045868, "grad_norm": 1.15625, "learning_rate": 0.0002993797660575456, "loss": 4.6675, "mean_token_accuracy": 0.2520031303167343, "num_tokens": 109065767.0, "step": 47615 }, { "entropy": 5.322697496414184, "epoch": 4.707394226967181, "grad_norm": 1.03125, "learning_rate": 0.00029934468355166476, "loss": 4.803, "mean_token_accuracy": 0.23598333746194838, "num_tokens": 109076984.0, "step": 47620 }, { "entropy": 5.352786684036255, "epoch": 4.707888493475682, "grad_norm": 1.0234375, "learning_rate": 0.0002993096004469009, "loss": 4.7734, "mean_token_accuracy": 0.23098441511392592, "num_tokens": 109089105.0, "step": 47625 }, { "entropy": 5.393524789810181, "epoch": 4.708382759984183, "grad_norm": 1.0234375, "learning_rate": 0.0002992745167441172, "loss": 4.7843, "mean_token_accuracy": 0.2357421875, "num_tokens": 109100918.0, "step": 47630 }, { "entropy": 5.327383756637573, "epoch": 4.708877026492685, "grad_norm": 1.0859375, "learning_rate": 0.00029923943244417663, "loss": 4.7267, "mean_token_accuracy": 0.23972640335559844, "num_tokens": 109112304.0, "step": 47635 }, { "entropy": 5.317223644256591, "epoch": 4.709371293001186, "grad_norm": 1.125, "learning_rate": 0.00029920434754794216, "loss": 4.8283, "mean_token_accuracy": 0.23777689188718795, "num_tokens": 109122651.0, "step": 47640 }, { "entropy": 5.2147387027740475, "epoch": 4.709865559509687, "grad_norm": 1.1640625, "learning_rate": 0.0002991692620562771, "loss": 4.6407, "mean_token_accuracy": 0.2509210377931595, "num_tokens": 109135064.0, "step": 47645 }, { "entropy": 5.348199033737183, "epoch": 4.710359826018189, "grad_norm": 1.1171875, "learning_rate": 0.0002991341759700443, "loss": 4.8006, "mean_token_accuracy": 0.23683081269264222, "num_tokens": 109148202.0, "step": 47650 }, { "entropy": 5.305933618545533, "epoch": 4.710854092526691, "grad_norm": 0.953125, "learning_rate": 0.00029909908929010715, "loss": 4.7498, "mean_token_accuracy": 0.24392561465501786, "num_tokens": 109160867.0, "step": 47655 }, { "entropy": 5.233462810516357, "epoch": 4.711348359035192, "grad_norm": 0.97265625, "learning_rate": 0.0002990640020173286, "loss": 4.7389, "mean_token_accuracy": 0.2379634365439415, "num_tokens": 109173107.0, "step": 47660 }, { "entropy": 5.3053731441497805, "epoch": 4.711842625543693, "grad_norm": 1.125, "learning_rate": 0.00029902891415257196, "loss": 4.7865, "mean_token_accuracy": 0.23503424376249313, "num_tokens": 109184148.0, "step": 47665 }, { "entropy": 5.310604000091553, "epoch": 4.712336892052194, "grad_norm": 1.0703125, "learning_rate": 0.00029899382569670025, "loss": 4.6589, "mean_token_accuracy": 0.2474014401435852, "num_tokens": 109194647.0, "step": 47670 }, { "entropy": 5.337910318374634, "epoch": 4.712831158560696, "grad_norm": 1.1015625, "learning_rate": 0.00029895873665057663, "loss": 4.7815, "mean_token_accuracy": 0.24480753988027573, "num_tokens": 109206495.0, "step": 47675 }, { "entropy": 5.27937536239624, "epoch": 4.713325425069197, "grad_norm": 1.2109375, "learning_rate": 0.0002989236470150644, "loss": 4.7956, "mean_token_accuracy": 0.2351779595017433, "num_tokens": 109217131.0, "step": 47680 }, { "entropy": 5.256400537490845, "epoch": 4.713819691577699, "grad_norm": 1.0390625, "learning_rate": 0.0002988885567910269, "loss": 4.7201, "mean_token_accuracy": 0.24450797885656356, "num_tokens": 109228785.0, "step": 47685 }, { "entropy": 5.352593326568604, "epoch": 4.7143139580862, "grad_norm": 1.0390625, "learning_rate": 0.00029885346597932703, "loss": 4.7881, "mean_token_accuracy": 0.2367198199033737, "num_tokens": 109240821.0, "step": 47690 }, { "entropy": 5.319564390182495, "epoch": 4.714808224594702, "grad_norm": 1.0703125, "learning_rate": 0.0002988183745808282, "loss": 4.7441, "mean_token_accuracy": 0.2431831479072571, "num_tokens": 109251982.0, "step": 47695 }, { "entropy": 5.302459383010865, "epoch": 4.715302491103203, "grad_norm": 1.1875, "learning_rate": 0.00029878328259639377, "loss": 4.7887, "mean_token_accuracy": 0.23635516315698624, "num_tokens": 109263176.0, "step": 47700 }, { "entropy": 5.315282011032105, "epoch": 4.715796757611704, "grad_norm": 1.0390625, "learning_rate": 0.0002987481900268868, "loss": 4.795, "mean_token_accuracy": 0.23215219080448152, "num_tokens": 109275076.0, "step": 47705 }, { "entropy": 5.347892808914184, "epoch": 4.716291024120205, "grad_norm": 1.140625, "learning_rate": 0.00029871309687317066, "loss": 4.7802, "mean_token_accuracy": 0.2353265881538391, "num_tokens": 109285872.0, "step": 47710 }, { "entropy": 5.3302453517913815, "epoch": 4.716785290628707, "grad_norm": 1.09375, "learning_rate": 0.0002986780031361087, "loss": 4.7879, "mean_token_accuracy": 0.23462251126766204, "num_tokens": 109298268.0, "step": 47715 }, { "entropy": 5.331278276443482, "epoch": 4.717279557137209, "grad_norm": 1.015625, "learning_rate": 0.00029864290881656427, "loss": 4.7615, "mean_token_accuracy": 0.23451149016618728, "num_tokens": 109309739.0, "step": 47720 }, { "entropy": 5.251359128952027, "epoch": 4.71777382364571, "grad_norm": 1.046875, "learning_rate": 0.00029860781391540046, "loss": 4.7228, "mean_token_accuracy": 0.24686916023492814, "num_tokens": 109321876.0, "step": 47725 }, { "entropy": 5.362071418762207, "epoch": 4.718268090154211, "grad_norm": 1.015625, "learning_rate": 0.0002985727184334809, "loss": 4.7355, "mean_token_accuracy": 0.24669393748044968, "num_tokens": 109333112.0, "step": 47730 }, { "entropy": 5.314636754989624, "epoch": 4.718762356662713, "grad_norm": 1.03125, "learning_rate": 0.0002985376223716688, "loss": 4.7634, "mean_token_accuracy": 0.24047335535287856, "num_tokens": 109344590.0, "step": 47735 }, { "entropy": 5.253002452850342, "epoch": 4.719256623171214, "grad_norm": 1.0703125, "learning_rate": 0.00029850252573082744, "loss": 4.7592, "mean_token_accuracy": 0.244578717648983, "num_tokens": 109355824.0, "step": 47740 }, { "entropy": 5.2640317440032955, "epoch": 4.719750889679715, "grad_norm": 1.0703125, "learning_rate": 0.0002984674285118203, "loss": 4.6697, "mean_token_accuracy": 0.2528020188212395, "num_tokens": 109366753.0, "step": 47745 }, { "entropy": 5.290370130538941, "epoch": 4.720245156188216, "grad_norm": 1.046875, "learning_rate": 0.00029843233071551086, "loss": 4.7581, "mean_token_accuracy": 0.23882023394107818, "num_tokens": 109378279.0, "step": 47750 }, { "entropy": 5.258923816680908, "epoch": 4.7207394226967185, "grad_norm": 0.9140625, "learning_rate": 0.0002983972323427624, "loss": 4.8009, "mean_token_accuracy": 0.24076892733573912, "num_tokens": 109390485.0, "step": 47755 }, { "entropy": 5.38144998550415, "epoch": 4.72123368920522, "grad_norm": 1.046875, "learning_rate": 0.0002983621333944384, "loss": 4.8287, "mean_token_accuracy": 0.23242940306663512, "num_tokens": 109402245.0, "step": 47760 }, { "entropy": 5.393896007537842, "epoch": 4.721727955713721, "grad_norm": 1.0390625, "learning_rate": 0.0002983270338714023, "loss": 4.8455, "mean_token_accuracy": 0.23008472174406053, "num_tokens": 109413531.0, "step": 47765 }, { "entropy": 5.29421591758728, "epoch": 4.722222222222222, "grad_norm": 0.95703125, "learning_rate": 0.0002982919337745175, "loss": 4.8026, "mean_token_accuracy": 0.24188939929008485, "num_tokens": 109424959.0, "step": 47770 }, { "entropy": 5.324122047424316, "epoch": 4.722716488730724, "grad_norm": 1.0546875, "learning_rate": 0.0002982568331046476, "loss": 4.796, "mean_token_accuracy": 0.23767856657505035, "num_tokens": 109436981.0, "step": 47775 }, { "entropy": 5.285688400268555, "epoch": 4.723210755239225, "grad_norm": 1.078125, "learning_rate": 0.00029822173186265597, "loss": 4.7273, "mean_token_accuracy": 0.24412321001291276, "num_tokens": 109448948.0, "step": 47780 }, { "entropy": 5.247050333023071, "epoch": 4.723705021747726, "grad_norm": 1.0546875, "learning_rate": 0.00029818663004940613, "loss": 4.7259, "mean_token_accuracy": 0.242711341381073, "num_tokens": 109459729.0, "step": 47785 }, { "entropy": 5.3195624351501465, "epoch": 4.724199288256228, "grad_norm": 1.0703125, "learning_rate": 0.0002981515276657616, "loss": 4.7406, "mean_token_accuracy": 0.24241117984056473, "num_tokens": 109471283.0, "step": 47790 }, { "entropy": 5.278203058242798, "epoch": 4.7246935547647295, "grad_norm": 1.3359375, "learning_rate": 0.0002981164247125859, "loss": 4.5848, "mean_token_accuracy": 0.25476169735193255, "num_tokens": 109482626.0, "step": 47795 }, { "entropy": 5.328096532821656, "epoch": 4.725187821273231, "grad_norm": 0.96875, "learning_rate": 0.0002980813211907426, "loss": 4.7578, "mean_token_accuracy": 0.24159764647483825, "num_tokens": 109495072.0, "step": 47800 }, { "entropy": 5.305235433578491, "epoch": 4.725682087781732, "grad_norm": 1.109375, "learning_rate": 0.00029804621710109513, "loss": 4.8153, "mean_token_accuracy": 0.24208030104637146, "num_tokens": 109506104.0, "step": 47805 }, { "entropy": 5.248424863815307, "epoch": 4.726176354290233, "grad_norm": 1.1328125, "learning_rate": 0.0002980111124445072, "loss": 4.6737, "mean_token_accuracy": 0.25447641909122465, "num_tokens": 109517001.0, "step": 47810 }, { "entropy": 5.259737586975097, "epoch": 4.726670620798735, "grad_norm": 1.09375, "learning_rate": 0.00029797600722184225, "loss": 4.6947, "mean_token_accuracy": 0.25332178026437757, "num_tokens": 109528432.0, "step": 47815 }, { "entropy": 5.310353565216064, "epoch": 4.727164887307236, "grad_norm": 1.046875, "learning_rate": 0.00029794090143396405, "loss": 4.7919, "mean_token_accuracy": 0.23853307962417603, "num_tokens": 109539584.0, "step": 47820 }, { "entropy": 5.273041486740112, "epoch": 4.727659153815737, "grad_norm": 1.015625, "learning_rate": 0.0002979057950817361, "loss": 4.6166, "mean_token_accuracy": 0.26244577020406723, "num_tokens": 109550795.0, "step": 47825 }, { "entropy": 5.271584463119507, "epoch": 4.728153420324238, "grad_norm": 1.0234375, "learning_rate": 0.0002978706881660221, "loss": 4.7355, "mean_token_accuracy": 0.2432773917913437, "num_tokens": 109561741.0, "step": 47830 }, { "entropy": 5.280307006835938, "epoch": 4.7286476868327405, "grad_norm": 0.96875, "learning_rate": 0.0002978355806876856, "loss": 4.7491, "mean_token_accuracy": 0.2375025898218155, "num_tokens": 109574246.0, "step": 47835 }, { "entropy": 5.392377805709839, "epoch": 4.729141953341242, "grad_norm": 1.1171875, "learning_rate": 0.00029780047264759015, "loss": 4.7803, "mean_token_accuracy": 0.24003217816352845, "num_tokens": 109584133.0, "step": 47840 }, { "entropy": 5.3092738628387455, "epoch": 4.729636219849743, "grad_norm": 1.046875, "learning_rate": 0.0002977653640465996, "loss": 4.7417, "mean_token_accuracy": 0.24245215058326722, "num_tokens": 109596128.0, "step": 47845 }, { "entropy": 5.235578203201294, "epoch": 4.730130486358244, "grad_norm": 1.0390625, "learning_rate": 0.0002977302548855776, "loss": 4.7342, "mean_token_accuracy": 0.24302422106266022, "num_tokens": 109608309.0, "step": 47850 }, { "entropy": 5.301189613342285, "epoch": 4.7306247528667456, "grad_norm": 1.140625, "learning_rate": 0.00029769514516538774, "loss": 4.7661, "mean_token_accuracy": 0.2408498242497444, "num_tokens": 109620153.0, "step": 47855 }, { "entropy": 5.260921907424927, "epoch": 4.731119019375247, "grad_norm": 1.1640625, "learning_rate": 0.0002976600348868939, "loss": 4.6693, "mean_token_accuracy": 0.2567707285284996, "num_tokens": 109630775.0, "step": 47860 }, { "entropy": 5.302408504486084, "epoch": 4.731613285883748, "grad_norm": 1.109375, "learning_rate": 0.0002976249240509595, "loss": 4.727, "mean_token_accuracy": 0.23993542194366455, "num_tokens": 109641623.0, "step": 47865 }, { "entropy": 5.2787446022033695, "epoch": 4.73210755239225, "grad_norm": 1.1640625, "learning_rate": 0.0002975898126584486, "loss": 4.7268, "mean_token_accuracy": 0.2474723443388939, "num_tokens": 109652071.0, "step": 47870 }, { "entropy": 5.381568717956543, "epoch": 4.7326018189007515, "grad_norm": 1.09375, "learning_rate": 0.0002975547007102248, "loss": 4.7424, "mean_token_accuracy": 0.23471135646104813, "num_tokens": 109662734.0, "step": 47875 }, { "entropy": 5.353764820098877, "epoch": 4.733096085409253, "grad_norm": 1.0234375, "learning_rate": 0.0002975195882071519, "loss": 4.8577, "mean_token_accuracy": 0.22911114990711212, "num_tokens": 109674419.0, "step": 47880 }, { "entropy": 5.342372798919678, "epoch": 4.733590351917754, "grad_norm": 1.0625, "learning_rate": 0.0002974844751500935, "loss": 4.72, "mean_token_accuracy": 0.24173336029052733, "num_tokens": 109686442.0, "step": 47885 }, { "entropy": 5.360749578475952, "epoch": 4.734084618426255, "grad_norm": 1.0546875, "learning_rate": 0.0002974493615399136, "loss": 4.7646, "mean_token_accuracy": 0.24690998941659928, "num_tokens": 109698191.0, "step": 47890 }, { "entropy": 5.3081341743469235, "epoch": 4.7345788849347565, "grad_norm": 1.046875, "learning_rate": 0.00029741424737747595, "loss": 4.7977, "mean_token_accuracy": 0.2324233829975128, "num_tokens": 109709822.0, "step": 47895 }, { "entropy": 5.3428596496582035, "epoch": 4.735073151443258, "grad_norm": 1.125, "learning_rate": 0.0002973791326636443, "loss": 4.804, "mean_token_accuracy": 0.23351143449544906, "num_tokens": 109720638.0, "step": 47900 }, { "entropy": 5.326806211471558, "epoch": 4.73556741795176, "grad_norm": 0.98828125, "learning_rate": 0.0002973440173992826, "loss": 4.761, "mean_token_accuracy": 0.23840725123882295, "num_tokens": 109731678.0, "step": 47905 }, { "entropy": 5.357243347167969, "epoch": 4.736061684460261, "grad_norm": 1.15625, "learning_rate": 0.00029730890158525446, "loss": 4.8137, "mean_token_accuracy": 0.24003777652978897, "num_tokens": 109742089.0, "step": 47910 }, { "entropy": 5.350939798355102, "epoch": 4.7365559509687625, "grad_norm": 1.1015625, "learning_rate": 0.00029727378522242395, "loss": 4.7702, "mean_token_accuracy": 0.24146436303853988, "num_tokens": 109754392.0, "step": 47915 }, { "entropy": 5.291542959213257, "epoch": 4.737050217477264, "grad_norm": 1.0703125, "learning_rate": 0.00029723866831165484, "loss": 4.8312, "mean_token_accuracy": 0.2343334823846817, "num_tokens": 109766019.0, "step": 47920 }, { "entropy": 5.264367961883545, "epoch": 4.737544483985765, "grad_norm": 1.1171875, "learning_rate": 0.0002972035508538112, "loss": 4.7184, "mean_token_accuracy": 0.24913251549005508, "num_tokens": 109776545.0, "step": 47925 }, { "entropy": 5.417330741882324, "epoch": 4.738038750494266, "grad_norm": 1.078125, "learning_rate": 0.0002971684328497565, "loss": 4.8529, "mean_token_accuracy": 0.23088762462139129, "num_tokens": 109789356.0, "step": 47930 }, { "entropy": 5.277120637893677, "epoch": 4.7385330170027675, "grad_norm": 1.109375, "learning_rate": 0.00029713331430035505, "loss": 4.7195, "mean_token_accuracy": 0.24199217259883882, "num_tokens": 109800823.0, "step": 47935 }, { "entropy": 5.301065397262573, "epoch": 4.73902728351127, "grad_norm": 1.1171875, "learning_rate": 0.0002970981952064707, "loss": 4.7717, "mean_token_accuracy": 0.2439078152179718, "num_tokens": 109812512.0, "step": 47940 }, { "entropy": 5.274113655090332, "epoch": 4.739521550019771, "grad_norm": 1.1484375, "learning_rate": 0.00029706307556896723, "loss": 4.6952, "mean_token_accuracy": 0.24449650645256044, "num_tokens": 109824026.0, "step": 47945 }, { "entropy": 5.311470556259155, "epoch": 4.740015816528272, "grad_norm": 1.1171875, "learning_rate": 0.00029702795538870874, "loss": 4.8099, "mean_token_accuracy": 0.23984183967113495, "num_tokens": 109834792.0, "step": 47950 }, { "entropy": 5.290168905258179, "epoch": 4.7405100830367735, "grad_norm": 1.0234375, "learning_rate": 0.000296992834666559, "loss": 4.7268, "mean_token_accuracy": 0.24869711548089982, "num_tokens": 109846435.0, "step": 47955 }, { "entropy": 5.238584232330322, "epoch": 4.741004349545275, "grad_norm": 1.09375, "learning_rate": 0.00029695771340338225, "loss": 4.672, "mean_token_accuracy": 0.24534205794334413, "num_tokens": 109857399.0, "step": 47960 }, { "entropy": 5.335509347915649, "epoch": 4.741498616053776, "grad_norm": 1.0390625, "learning_rate": 0.0002969225916000423, "loss": 4.7407, "mean_token_accuracy": 0.24141601771116256, "num_tokens": 109868872.0, "step": 47965 }, { "entropy": 5.317582511901856, "epoch": 4.741992882562277, "grad_norm": 0.98046875, "learning_rate": 0.0002968874692574032, "loss": 4.8165, "mean_token_accuracy": 0.23771364241838455, "num_tokens": 109880724.0, "step": 47970 }, { "entropy": 5.390929365158081, "epoch": 4.742487149070779, "grad_norm": 1.15625, "learning_rate": 0.00029685234637632894, "loss": 4.8024, "mean_token_accuracy": 0.24148489832878112, "num_tokens": 109891513.0, "step": 47975 }, { "entropy": 5.2819489479064945, "epoch": 4.742981415579281, "grad_norm": 1.015625, "learning_rate": 0.0002968172229576836, "loss": 4.7475, "mean_token_accuracy": 0.24424222558736802, "num_tokens": 109904148.0, "step": 47980 }, { "entropy": 5.356666803359985, "epoch": 4.743475682087782, "grad_norm": 1.046875, "learning_rate": 0.0002967820990023311, "loss": 4.7515, "mean_token_accuracy": 0.23823918104171754, "num_tokens": 109915835.0, "step": 47985 }, { "entropy": 5.312707471847534, "epoch": 4.743969948596283, "grad_norm": 1.09375, "learning_rate": 0.00029674697451113576, "loss": 4.8279, "mean_token_accuracy": 0.23251097202301024, "num_tokens": 109927538.0, "step": 47990 }, { "entropy": 5.396489238739013, "epoch": 4.744464215104784, "grad_norm": 1.109375, "learning_rate": 0.00029671184948496134, "loss": 4.8062, "mean_token_accuracy": 0.23572721779346467, "num_tokens": 109938379.0, "step": 47995 }, { "entropy": 5.268763446807862, "epoch": 4.744958481613286, "grad_norm": 1.203125, "learning_rate": 0.0002966767239246721, "loss": 4.6719, "mean_token_accuracy": 0.25058633387088775, "num_tokens": 109949155.0, "step": 48000 }, { "epoch": 4.744958481613286, "eval_entropy": 5.068930207084759, "eval_loss": 4.87665319442749, "eval_mean_token_accuracy": 0.24138986417361585, "eval_num_tokens": 109949155.0, "eval_runtime": 26.6284, "eval_samples_per_second": 1220.991, "eval_steps_per_second": 152.657, "step": 48000 }, { "entropy": 5.344982481002807, "epoch": 4.745452748121787, "grad_norm": 1.1171875, "learning_rate": 0.00029664159783113203, "loss": 4.7758, "mean_token_accuracy": 0.24061712622642517, "num_tokens": 109959968.0, "step": 48005 }, { "entropy": 5.405403327941895, "epoch": 4.745947014630289, "grad_norm": 1.078125, "learning_rate": 0.0002966064712052054, "loss": 4.8651, "mean_token_accuracy": 0.23010112196207047, "num_tokens": 109972247.0, "step": 48010 }, { "entropy": 5.339672994613648, "epoch": 4.74644128113879, "grad_norm": 1.140625, "learning_rate": 0.00029657134404775614, "loss": 4.7113, "mean_token_accuracy": 0.24326891005039214, "num_tokens": 109982905.0, "step": 48015 }, { "entropy": 5.343077707290649, "epoch": 4.746935547647292, "grad_norm": 1.140625, "learning_rate": 0.0002965362163596485, "loss": 4.865, "mean_token_accuracy": 0.23555836081504822, "num_tokens": 109994155.0, "step": 48020 }, { "entropy": 5.293031501770019, "epoch": 4.747429814155793, "grad_norm": 1.0859375, "learning_rate": 0.00029650108814174657, "loss": 4.7381, "mean_token_accuracy": 0.2481230840086937, "num_tokens": 110005642.0, "step": 48025 }, { "entropy": 5.289114141464234, "epoch": 4.747924080664294, "grad_norm": 1.0703125, "learning_rate": 0.0002964659593949146, "loss": 4.7115, "mean_token_accuracy": 0.2470971316099167, "num_tokens": 110016627.0, "step": 48030 }, { "entropy": 5.269683027267456, "epoch": 4.748418347172795, "grad_norm": 1.0859375, "learning_rate": 0.00029643083012001665, "loss": 4.6869, "mean_token_accuracy": 0.2455118328332901, "num_tokens": 110026758.0, "step": 48035 }, { "entropy": 5.382367420196533, "epoch": 4.748912613681297, "grad_norm": 1.03125, "learning_rate": 0.00029639570031791696, "loss": 4.8717, "mean_token_accuracy": 0.22949815690517425, "num_tokens": 110038652.0, "step": 48040 }, { "entropy": 5.36657075881958, "epoch": 4.749406880189798, "grad_norm": 1.0859375, "learning_rate": 0.00029636056998947973, "loss": 4.7819, "mean_token_accuracy": 0.24257462620735168, "num_tokens": 110049483.0, "step": 48045 }, { "entropy": 5.303296899795532, "epoch": 4.7499011466983, "grad_norm": 1.1171875, "learning_rate": 0.0002963254391355691, "loss": 4.776, "mean_token_accuracy": 0.2369137853384018, "num_tokens": 110059925.0, "step": 48050 }, { "entropy": 5.325395250320435, "epoch": 4.750395413206801, "grad_norm": 1.109375, "learning_rate": 0.00029629030775704944, "loss": 4.8256, "mean_token_accuracy": 0.23093054741621016, "num_tokens": 110071953.0, "step": 48055 }, { "entropy": 5.2946795463562015, "epoch": 4.750889679715303, "grad_norm": 1.0078125, "learning_rate": 0.0002962551758547849, "loss": 4.7187, "mean_token_accuracy": 0.24535288661718369, "num_tokens": 110083742.0, "step": 48060 }, { "entropy": 5.4371262550354, "epoch": 4.751383946223804, "grad_norm": 1.078125, "learning_rate": 0.0002962200434296397, "loss": 4.8244, "mean_token_accuracy": 0.23660449534654618, "num_tokens": 110094920.0, "step": 48065 }, { "entropy": 5.386715602874756, "epoch": 4.751878212732305, "grad_norm": 1.046875, "learning_rate": 0.0002961849104824782, "loss": 4.8569, "mean_token_accuracy": 0.23684289902448655, "num_tokens": 110107109.0, "step": 48070 }, { "entropy": 5.395057582855225, "epoch": 4.752372479240806, "grad_norm": 1.140625, "learning_rate": 0.0002961497770141645, "loss": 4.8356, "mean_token_accuracy": 0.23143983483314515, "num_tokens": 110117529.0, "step": 48075 }, { "entropy": 5.306261682510376, "epoch": 4.752866745749308, "grad_norm": 1.0390625, "learning_rate": 0.0002961146430255631, "loss": 4.7369, "mean_token_accuracy": 0.2460445538163185, "num_tokens": 110130356.0, "step": 48080 }, { "entropy": 5.269043064117431, "epoch": 4.753361012257809, "grad_norm": 1.046875, "learning_rate": 0.0002960795085175382, "loss": 4.676, "mean_token_accuracy": 0.24278541207313536, "num_tokens": 110142176.0, "step": 48085 }, { "entropy": 5.369420576095581, "epoch": 4.753855278766311, "grad_norm": 1.125, "learning_rate": 0.0002960443734909541, "loss": 4.8735, "mean_token_accuracy": 0.2321920856833458, "num_tokens": 110153777.0, "step": 48090 }, { "entropy": 5.33455491065979, "epoch": 4.754349545274812, "grad_norm": 0.98046875, "learning_rate": 0.00029600923794667524, "loss": 4.8134, "mean_token_accuracy": 0.23972879946231843, "num_tokens": 110165346.0, "step": 48095 }, { "entropy": 5.334349203109741, "epoch": 4.754843811783314, "grad_norm": 1.09375, "learning_rate": 0.0002959741018855658, "loss": 4.7359, "mean_token_accuracy": 0.2474536955356598, "num_tokens": 110175714.0, "step": 48100 }, { "entropy": 5.2394389629364015, "epoch": 4.755338078291815, "grad_norm": 1.1171875, "learning_rate": 0.00029593896530849014, "loss": 4.7189, "mean_token_accuracy": 0.24034710377454757, "num_tokens": 110187451.0, "step": 48105 }, { "entropy": 5.3063417911529545, "epoch": 4.755832344800316, "grad_norm": 1.078125, "learning_rate": 0.0002959038282163127, "loss": 4.7352, "mean_token_accuracy": 0.23383307904005052, "num_tokens": 110199199.0, "step": 48110 }, { "entropy": 5.35405969619751, "epoch": 4.756326611308817, "grad_norm": 1.15625, "learning_rate": 0.0002958686906098979, "loss": 4.7888, "mean_token_accuracy": 0.2383167564868927, "num_tokens": 110209936.0, "step": 48115 }, { "entropy": 5.283139562606811, "epoch": 4.756820877817319, "grad_norm": 1.140625, "learning_rate": 0.00029583355249011004, "loss": 4.754, "mean_token_accuracy": 0.24102532714605332, "num_tokens": 110220646.0, "step": 48120 }, { "entropy": 5.25841703414917, "epoch": 4.757315144325821, "grad_norm": 1.0390625, "learning_rate": 0.00029579841385781353, "loss": 4.6592, "mean_token_accuracy": 0.24964094310998916, "num_tokens": 110232314.0, "step": 48125 }, { "entropy": 5.3312835693359375, "epoch": 4.757809410834322, "grad_norm": 0.953125, "learning_rate": 0.00029576327471387285, "loss": 4.7508, "mean_token_accuracy": 0.2390656888484955, "num_tokens": 110245566.0, "step": 48130 }, { "entropy": 5.262554883956909, "epoch": 4.758303677342823, "grad_norm": 1.1015625, "learning_rate": 0.0002957281350591524, "loss": 4.6805, "mean_token_accuracy": 0.25115893632173536, "num_tokens": 110256133.0, "step": 48135 }, { "entropy": 5.323699998855591, "epoch": 4.758797943851325, "grad_norm": 1.125, "learning_rate": 0.0002956929948945166, "loss": 4.7725, "mean_token_accuracy": 0.243557371199131, "num_tokens": 110268080.0, "step": 48140 }, { "entropy": 5.333377361297607, "epoch": 4.759292210359826, "grad_norm": 1.03125, "learning_rate": 0.00029565785422082993, "loss": 4.7714, "mean_token_accuracy": 0.23829211443662643, "num_tokens": 110278940.0, "step": 48145 }, { "entropy": 5.309742403030396, "epoch": 4.759786476868327, "grad_norm": 1.03125, "learning_rate": 0.0002956227130389568, "loss": 4.7852, "mean_token_accuracy": 0.23790644407272338, "num_tokens": 110289610.0, "step": 48150 }, { "entropy": 5.294647121429444, "epoch": 4.760280743376828, "grad_norm": 1.2109375, "learning_rate": 0.0002955875713497617, "loss": 4.742, "mean_token_accuracy": 0.24294277876615525, "num_tokens": 110300563.0, "step": 48155 }, { "entropy": 5.324628448486328, "epoch": 4.7607750098853305, "grad_norm": 0.9765625, "learning_rate": 0.00029555242915410925, "loss": 4.8058, "mean_token_accuracy": 0.24245938211679458, "num_tokens": 110312352.0, "step": 48160 }, { "entropy": 5.341570615768433, "epoch": 4.761269276393832, "grad_norm": 1.0859375, "learning_rate": 0.0002955172864528638, "loss": 4.7906, "mean_token_accuracy": 0.24055126458406448, "num_tokens": 110323964.0, "step": 48165 }, { "entropy": 5.31601848602295, "epoch": 4.761763542902333, "grad_norm": 1.109375, "learning_rate": 0.00029548214324688995, "loss": 4.7842, "mean_token_accuracy": 0.24222567975521087, "num_tokens": 110337369.0, "step": 48170 }, { "entropy": 5.330166435241699, "epoch": 4.762257809410834, "grad_norm": 1.1328125, "learning_rate": 0.00029544699953705213, "loss": 4.7821, "mean_token_accuracy": 0.2365029126405716, "num_tokens": 110349554.0, "step": 48175 }, { "entropy": 5.323010778427124, "epoch": 4.762752075919336, "grad_norm": 1.1171875, "learning_rate": 0.000295411855324215, "loss": 4.7323, "mean_token_accuracy": 0.24193471521139145, "num_tokens": 110360254.0, "step": 48180 }, { "entropy": 5.30175552368164, "epoch": 4.763246342427837, "grad_norm": 1.0625, "learning_rate": 0.0002953767106092431, "loss": 4.7113, "mean_token_accuracy": 0.24022390246391295, "num_tokens": 110371765.0, "step": 48185 }, { "entropy": 5.244253730773925, "epoch": 4.763740608936338, "grad_norm": 1.0546875, "learning_rate": 0.0002953415653930009, "loss": 4.7231, "mean_token_accuracy": 0.25121314227581026, "num_tokens": 110383061.0, "step": 48190 }, { "entropy": 5.351978063583374, "epoch": 4.76423487544484, "grad_norm": 0.97265625, "learning_rate": 0.00029530641967635303, "loss": 4.8399, "mean_token_accuracy": 0.23265336602926254, "num_tokens": 110395851.0, "step": 48195 }, { "entropy": 5.409858226776123, "epoch": 4.7647291419533415, "grad_norm": 1.0234375, "learning_rate": 0.0002952712734601641, "loss": 4.8338, "mean_token_accuracy": 0.23341671973466874, "num_tokens": 110408221.0, "step": 48200 }, { "entropy": 5.3027088165283205, "epoch": 4.765223408461843, "grad_norm": 1.0078125, "learning_rate": 0.00029523612674529876, "loss": 4.7704, "mean_token_accuracy": 0.24384753555059432, "num_tokens": 110420390.0, "step": 48205 }, { "entropy": 5.340893077850342, "epoch": 4.765717674970344, "grad_norm": 1.140625, "learning_rate": 0.00029520097953262154, "loss": 4.7915, "mean_token_accuracy": 0.24060704410076142, "num_tokens": 110431365.0, "step": 48210 }, { "entropy": 5.242969417572022, "epoch": 4.766211941478845, "grad_norm": 1.078125, "learning_rate": 0.000295165831822997, "loss": 4.6962, "mean_token_accuracy": 0.25203735530376437, "num_tokens": 110442116.0, "step": 48215 }, { "entropy": 5.198431205749512, "epoch": 4.766706207987347, "grad_norm": 1.015625, "learning_rate": 0.0002951306836172899, "loss": 4.6155, "mean_token_accuracy": 0.2572623372077942, "num_tokens": 110453015.0, "step": 48220 }, { "entropy": 5.283610677719116, "epoch": 4.767200474495848, "grad_norm": 0.99609375, "learning_rate": 0.00029509553491636494, "loss": 4.7601, "mean_token_accuracy": 0.24235706478357316, "num_tokens": 110464957.0, "step": 48225 }, { "entropy": 5.395477533340454, "epoch": 4.76769474100435, "grad_norm": 1.0546875, "learning_rate": 0.0002950603857210867, "loss": 4.8467, "mean_token_accuracy": 0.2327297195792198, "num_tokens": 110477179.0, "step": 48230 }, { "entropy": 5.336150789260865, "epoch": 4.768189007512851, "grad_norm": 1.046875, "learning_rate": 0.00029502523603231975, "loss": 4.7275, "mean_token_accuracy": 0.24398207664489746, "num_tokens": 110488235.0, "step": 48235 }, { "entropy": 5.249004173278808, "epoch": 4.7686832740213525, "grad_norm": 1.078125, "learning_rate": 0.000294990085850929, "loss": 4.6879, "mean_token_accuracy": 0.24799855798482895, "num_tokens": 110501083.0, "step": 48240 }, { "entropy": 5.338439226150513, "epoch": 4.769177540529854, "grad_norm": 1.15625, "learning_rate": 0.0002949549351777789, "loss": 4.7894, "mean_token_accuracy": 0.23727768659591675, "num_tokens": 110511819.0, "step": 48245 }, { "entropy": 5.315905618667602, "epoch": 4.769671807038355, "grad_norm": 1.15625, "learning_rate": 0.00029491978401373435, "loss": 4.7652, "mean_token_accuracy": 0.24534651637077332, "num_tokens": 110522243.0, "step": 48250 }, { "entropy": 5.340923595428467, "epoch": 4.770166073546856, "grad_norm": 1.1171875, "learning_rate": 0.0002948846323596601, "loss": 4.7969, "mean_token_accuracy": 0.23247896432876586, "num_tokens": 110533069.0, "step": 48255 }, { "entropy": 5.303336524963379, "epoch": 4.7706603400553576, "grad_norm": 1.0859375, "learning_rate": 0.00029484948021642085, "loss": 4.7759, "mean_token_accuracy": 0.24325689822435378, "num_tokens": 110543740.0, "step": 48260 }, { "entropy": 5.385512733459473, "epoch": 4.77115460656386, "grad_norm": 1.1015625, "learning_rate": 0.00029481432758488106, "loss": 4.8045, "mean_token_accuracy": 0.22935088574886323, "num_tokens": 110555335.0, "step": 48265 }, { "entropy": 5.334543752670288, "epoch": 4.771648873072361, "grad_norm": 1.1796875, "learning_rate": 0.000294779174465906, "loss": 4.7712, "mean_token_accuracy": 0.23771208375692368, "num_tokens": 110566645.0, "step": 48270 }, { "entropy": 5.31080265045166, "epoch": 4.772143139580862, "grad_norm": 1.1875, "learning_rate": 0.0002947440208603601, "loss": 4.7301, "mean_token_accuracy": 0.24191170036792756, "num_tokens": 110578001.0, "step": 48275 }, { "entropy": 5.339419603347778, "epoch": 4.7726374060893635, "grad_norm": 1.03125, "learning_rate": 0.00029470886676910817, "loss": 4.7909, "mean_token_accuracy": 0.244886514544487, "num_tokens": 110589432.0, "step": 48280 }, { "entropy": 5.295604610443116, "epoch": 4.773131672597865, "grad_norm": 1.046875, "learning_rate": 0.0002946737121930151, "loss": 4.6825, "mean_token_accuracy": 0.24691593497991562, "num_tokens": 110601213.0, "step": 48285 }, { "entropy": 5.262271499633789, "epoch": 4.773625939106366, "grad_norm": 1.125, "learning_rate": 0.00029463855713294563, "loss": 4.742, "mean_token_accuracy": 0.23955961018800737, "num_tokens": 110612898.0, "step": 48290 }, { "entropy": 5.26202621459961, "epoch": 4.774120205614867, "grad_norm": 1.0234375, "learning_rate": 0.00029460340158976464, "loss": 4.74, "mean_token_accuracy": 0.2391189992427826, "num_tokens": 110624345.0, "step": 48295 }, { "entropy": 5.357306241989136, "epoch": 4.7746144721233685, "grad_norm": 1.09375, "learning_rate": 0.0002945682455643369, "loss": 4.7404, "mean_token_accuracy": 0.24231537729501723, "num_tokens": 110635758.0, "step": 48300 }, { "entropy": 5.3662034034729, "epoch": 4.775108738631871, "grad_norm": 1.15625, "learning_rate": 0.0002945330890575273, "loss": 4.7875, "mean_token_accuracy": 0.23471931368112564, "num_tokens": 110647641.0, "step": 48305 }, { "entropy": 5.335425186157226, "epoch": 4.775603005140372, "grad_norm": 1.0625, "learning_rate": 0.0002944979320702007, "loss": 4.7952, "mean_token_accuracy": 0.24303951263427734, "num_tokens": 110659498.0, "step": 48310 }, { "entropy": 5.2837261199951175, "epoch": 4.776097271648873, "grad_norm": 1.03125, "learning_rate": 0.0002944627746032219, "loss": 4.7362, "mean_token_accuracy": 0.24300208687782288, "num_tokens": 110671303.0, "step": 48315 }, { "entropy": 5.3507732391357425, "epoch": 4.7765915381573745, "grad_norm": 0.953125, "learning_rate": 0.00029442761665745583, "loss": 4.8531, "mean_token_accuracy": 0.230575592815876, "num_tokens": 110684377.0, "step": 48320 }, { "entropy": 5.273580169677734, "epoch": 4.777085804665876, "grad_norm": 1.4375, "learning_rate": 0.00029439245823376743, "loss": 4.7185, "mean_token_accuracy": 0.23922933489084244, "num_tokens": 110697433.0, "step": 48325 }, { "entropy": 5.398910760879517, "epoch": 4.777580071174377, "grad_norm": 1.0546875, "learning_rate": 0.0002943572993330215, "loss": 4.8544, "mean_token_accuracy": 0.23583381921052932, "num_tokens": 110709178.0, "step": 48330 }, { "entropy": 5.3554931640625, "epoch": 4.778074337682878, "grad_norm": 1.1796875, "learning_rate": 0.0002943221399560831, "loss": 4.7644, "mean_token_accuracy": 0.23296882808208466, "num_tokens": 110719512.0, "step": 48335 }, { "entropy": 5.297040939331055, "epoch": 4.7785686041913795, "grad_norm": 1.0234375, "learning_rate": 0.00029428698010381695, "loss": 4.6783, "mean_token_accuracy": 0.2500476807355881, "num_tokens": 110730726.0, "step": 48340 }, { "entropy": 5.301808786392212, "epoch": 4.779062870699882, "grad_norm": 1.078125, "learning_rate": 0.00029425181977708816, "loss": 4.8601, "mean_token_accuracy": 0.22834937423467636, "num_tokens": 110743767.0, "step": 48345 }, { "entropy": 5.2186953067779545, "epoch": 4.779557137208383, "grad_norm": 1.15625, "learning_rate": 0.00029421665897676154, "loss": 4.6269, "mean_token_accuracy": 0.2542570412158966, "num_tokens": 110753744.0, "step": 48350 }, { "entropy": 5.363951873779297, "epoch": 4.780051403716884, "grad_norm": 1.0625, "learning_rate": 0.00029418149770370217, "loss": 4.8965, "mean_token_accuracy": 0.23296679854393004, "num_tokens": 110766036.0, "step": 48355 }, { "entropy": 5.321249008178711, "epoch": 4.7805456702253855, "grad_norm": 1.0703125, "learning_rate": 0.00029414633595877497, "loss": 4.7096, "mean_token_accuracy": 0.2453983798623085, "num_tokens": 110778739.0, "step": 48360 }, { "entropy": 5.336614036560059, "epoch": 4.781039936733887, "grad_norm": 1.0546875, "learning_rate": 0.00029411117374284493, "loss": 4.7395, "mean_token_accuracy": 0.2495431810617447, "num_tokens": 110790675.0, "step": 48365 }, { "entropy": 5.297149324417115, "epoch": 4.781534203242388, "grad_norm": 1.0078125, "learning_rate": 0.00029407601105677707, "loss": 4.7948, "mean_token_accuracy": 0.23656640350818633, "num_tokens": 110803807.0, "step": 48370 }, { "entropy": 5.165996122360229, "epoch": 4.782028469750889, "grad_norm": 1.0859375, "learning_rate": 0.0002940408479014364, "loss": 4.5992, "mean_token_accuracy": 0.26223445385694505, "num_tokens": 110815543.0, "step": 48375 }, { "entropy": 5.347361660003662, "epoch": 4.782522736259391, "grad_norm": 1.125, "learning_rate": 0.00029400568427768786, "loss": 4.7358, "mean_token_accuracy": 0.2410058334469795, "num_tokens": 110826919.0, "step": 48380 }, { "entropy": 5.28839521408081, "epoch": 4.783017002767893, "grad_norm": 1.125, "learning_rate": 0.00029397052018639657, "loss": 4.7386, "mean_token_accuracy": 0.23726661801338195, "num_tokens": 110839314.0, "step": 48385 }, { "entropy": 5.339985799789429, "epoch": 4.783511269276394, "grad_norm": 1.078125, "learning_rate": 0.0002939353556284276, "loss": 4.7905, "mean_token_accuracy": 0.23970825523138045, "num_tokens": 110850762.0, "step": 48390 }, { "entropy": 5.252834892272949, "epoch": 4.784005535784895, "grad_norm": 1.0703125, "learning_rate": 0.0002939001906046458, "loss": 4.6759, "mean_token_accuracy": 0.2440657436847687, "num_tokens": 110862177.0, "step": 48395 }, { "entropy": 5.371952772140503, "epoch": 4.784499802293396, "grad_norm": 1.1640625, "learning_rate": 0.00029386502511591654, "loss": 4.8343, "mean_token_accuracy": 0.23673193901777267, "num_tokens": 110873647.0, "step": 48400 }, { "entropy": 5.357752656936645, "epoch": 4.784994068801898, "grad_norm": 1.2265625, "learning_rate": 0.00029382985916310466, "loss": 4.8053, "mean_token_accuracy": 0.23559269905090333, "num_tokens": 110885996.0, "step": 48405 }, { "entropy": 5.247005319595337, "epoch": 4.785488335310399, "grad_norm": 1.1015625, "learning_rate": 0.00029379469274707525, "loss": 4.66, "mean_token_accuracy": 0.24360357969999313, "num_tokens": 110897600.0, "step": 48410 }, { "entropy": 5.3579401016235355, "epoch": 4.785982601818901, "grad_norm": 1.0703125, "learning_rate": 0.00029375952586869363, "loss": 4.771, "mean_token_accuracy": 0.23751313537359237, "num_tokens": 110909853.0, "step": 48415 }, { "entropy": 5.31735372543335, "epoch": 4.786476868327402, "grad_norm": 1.03125, "learning_rate": 0.0002937243585288247, "loss": 4.7719, "mean_token_accuracy": 0.23429990857839583, "num_tokens": 110921938.0, "step": 48420 }, { "entropy": 5.347864961624145, "epoch": 4.786971134835904, "grad_norm": 1.1328125, "learning_rate": 0.0002936891907283336, "loss": 4.8504, "mean_token_accuracy": 0.23779534846544265, "num_tokens": 110932856.0, "step": 48425 }, { "entropy": 5.2941107749938965, "epoch": 4.787465401344405, "grad_norm": 1.1171875, "learning_rate": 0.0002936540224680855, "loss": 4.7015, "mean_token_accuracy": 0.24999372363090516, "num_tokens": 110944601.0, "step": 48430 }, { "entropy": 5.2995908737182615, "epoch": 4.787959667852906, "grad_norm": 1.0390625, "learning_rate": 0.00029361885374894566, "loss": 4.7195, "mean_token_accuracy": 0.2515990674495697, "num_tokens": 110955916.0, "step": 48435 }, { "entropy": 5.351103830337524, "epoch": 4.788453934361407, "grad_norm": 0.9921875, "learning_rate": 0.0002935836845717791, "loss": 4.7708, "mean_token_accuracy": 0.23682626187801362, "num_tokens": 110968068.0, "step": 48440 }, { "entropy": 5.28402156829834, "epoch": 4.788948200869909, "grad_norm": 1.0, "learning_rate": 0.000293548514937451, "loss": 4.7454, "mean_token_accuracy": 0.24570520371198654, "num_tokens": 110979251.0, "step": 48445 }, { "entropy": 5.324557733535767, "epoch": 4.789442467378411, "grad_norm": 1.078125, "learning_rate": 0.0002935133448468265, "loss": 4.775, "mean_token_accuracy": 0.24138802289962769, "num_tokens": 110991029.0, "step": 48450 }, { "entropy": 5.391868543624878, "epoch": 4.789936733886912, "grad_norm": 1.328125, "learning_rate": 0.0002934781743007709, "loss": 4.8387, "mean_token_accuracy": 0.23556462228298186, "num_tokens": 111001500.0, "step": 48455 }, { "entropy": 5.358047103881836, "epoch": 4.790431000395413, "grad_norm": 1.1015625, "learning_rate": 0.00029344300330014933, "loss": 4.7333, "mean_token_accuracy": 0.2421829268336296, "num_tokens": 111012838.0, "step": 48460 }, { "entropy": 5.321637296676636, "epoch": 4.790925266903915, "grad_norm": 1.0390625, "learning_rate": 0.000293407831845827, "loss": 4.8143, "mean_token_accuracy": 0.23733038306236268, "num_tokens": 111024937.0, "step": 48465 }, { "entropy": 5.3551098823547365, "epoch": 4.791419533412416, "grad_norm": 1.0703125, "learning_rate": 0.00029337265993866916, "loss": 4.8488, "mean_token_accuracy": 0.23220587968826295, "num_tokens": 111035700.0, "step": 48470 }, { "entropy": 5.268654870986938, "epoch": 4.791913799920917, "grad_norm": 0.98046875, "learning_rate": 0.0002933374875795411, "loss": 4.66, "mean_token_accuracy": 0.2532632127404213, "num_tokens": 111047605.0, "step": 48475 }, { "entropy": 5.361823701858521, "epoch": 4.792408066429418, "grad_norm": 1.046875, "learning_rate": 0.00029330231476930785, "loss": 4.7661, "mean_token_accuracy": 0.24592466950416564, "num_tokens": 111059209.0, "step": 48480 }, { "entropy": 5.354865312576294, "epoch": 4.792902332937921, "grad_norm": 1.171875, "learning_rate": 0.000293267141508835, "loss": 4.799, "mean_token_accuracy": 0.22867634892463684, "num_tokens": 111069862.0, "step": 48485 }, { "entropy": 5.310169315338134, "epoch": 4.793396599446422, "grad_norm": 1.0, "learning_rate": 0.0002932319677989875, "loss": 4.7798, "mean_token_accuracy": 0.2382734939455986, "num_tokens": 111081646.0, "step": 48490 }, { "entropy": 5.299759244918823, "epoch": 4.793890865954923, "grad_norm": 1.0859375, "learning_rate": 0.0002931967936406308, "loss": 4.7196, "mean_token_accuracy": 0.24033680260181428, "num_tokens": 111091763.0, "step": 48495 }, { "entropy": 5.276134061813354, "epoch": 4.794385132463424, "grad_norm": 1.078125, "learning_rate": 0.00029316161903463026, "loss": 4.713, "mean_token_accuracy": 0.2429734870791435, "num_tokens": 111103777.0, "step": 48500 }, { "entropy": 5.310709857940674, "epoch": 4.794879398971926, "grad_norm": 1.078125, "learning_rate": 0.00029312644398185096, "loss": 4.7663, "mean_token_accuracy": 0.2406497836112976, "num_tokens": 111115100.0, "step": 48505 }, { "entropy": 5.28202075958252, "epoch": 4.795373665480427, "grad_norm": 1.109375, "learning_rate": 0.0002930912684831583, "loss": 4.7237, "mean_token_accuracy": 0.24260013699531555, "num_tokens": 111125563.0, "step": 48510 }, { "entropy": 5.313377046585083, "epoch": 4.795867931988928, "grad_norm": 1.078125, "learning_rate": 0.0002930560925394177, "loss": 4.7567, "mean_token_accuracy": 0.24640168845653534, "num_tokens": 111136306.0, "step": 48515 }, { "entropy": 5.375203227996826, "epoch": 4.79636219849743, "grad_norm": 1.0234375, "learning_rate": 0.00029302091615149447, "loss": 4.7977, "mean_token_accuracy": 0.23143966346979142, "num_tokens": 111148533.0, "step": 48520 }, { "entropy": 5.279561614990234, "epoch": 4.7968564650059315, "grad_norm": 1.09375, "learning_rate": 0.00029298573932025373, "loss": 4.7597, "mean_token_accuracy": 0.24191612750291824, "num_tokens": 111160285.0, "step": 48525 }, { "entropy": 5.263668346405029, "epoch": 4.797350731514433, "grad_norm": 1.1171875, "learning_rate": 0.00029295056204656114, "loss": 4.7035, "mean_token_accuracy": 0.24571187794208527, "num_tokens": 111171803.0, "step": 48530 }, { "entropy": 5.348909330368042, "epoch": 4.797844998022934, "grad_norm": 1.0234375, "learning_rate": 0.0002929153843312819, "loss": 4.7569, "mean_token_accuracy": 0.2414960190653801, "num_tokens": 111184819.0, "step": 48535 }, { "entropy": 5.295044183731079, "epoch": 4.798339264531435, "grad_norm": 1.0859375, "learning_rate": 0.0002928802061752814, "loss": 4.7051, "mean_token_accuracy": 0.23994891792535783, "num_tokens": 111195592.0, "step": 48540 }, { "entropy": 5.286143636703491, "epoch": 4.798833531039937, "grad_norm": 1.015625, "learning_rate": 0.00029284502757942515, "loss": 4.7615, "mean_token_accuracy": 0.24249035269021987, "num_tokens": 111207300.0, "step": 48545 }, { "entropy": 5.263806343078613, "epoch": 4.799327797548438, "grad_norm": 1.1640625, "learning_rate": 0.00029280984854457835, "loss": 4.7403, "mean_token_accuracy": 0.24474813044071198, "num_tokens": 111217542.0, "step": 48550 }, { "entropy": 5.25710096359253, "epoch": 4.799822064056939, "grad_norm": 1.0703125, "learning_rate": 0.00029277466907160653, "loss": 4.6761, "mean_token_accuracy": 0.24979109615087508, "num_tokens": 111229422.0, "step": 48555 }, { "entropy": 5.358435392379761, "epoch": 4.800316330565441, "grad_norm": 1.0078125, "learning_rate": 0.0002927394891613752, "loss": 4.8336, "mean_token_accuracy": 0.2339560106396675, "num_tokens": 111241547.0, "step": 48560 }, { "entropy": 5.321352815628051, "epoch": 4.8008105970739425, "grad_norm": 1.15625, "learning_rate": 0.0002927043088147496, "loss": 4.7394, "mean_token_accuracy": 0.24254199862480164, "num_tokens": 111252123.0, "step": 48565 }, { "entropy": 5.319739294052124, "epoch": 4.801304863582444, "grad_norm": 1.046875, "learning_rate": 0.0002926691280325953, "loss": 4.7403, "mean_token_accuracy": 0.2457029327750206, "num_tokens": 111263862.0, "step": 48570 }, { "entropy": 5.308544731140136, "epoch": 4.801799130090945, "grad_norm": 1.15625, "learning_rate": 0.00029263394681577757, "loss": 4.7792, "mean_token_accuracy": 0.24060680717229843, "num_tokens": 111274525.0, "step": 48575 }, { "entropy": 5.385505342483521, "epoch": 4.802293396599446, "grad_norm": 1.140625, "learning_rate": 0.00029259876516516217, "loss": 4.7729, "mean_token_accuracy": 0.23593540936708451, "num_tokens": 111284972.0, "step": 48580 }, { "entropy": 5.314077091217041, "epoch": 4.802787663107948, "grad_norm": 1.140625, "learning_rate": 0.0002925635830816144, "loss": 4.8193, "mean_token_accuracy": 0.23993921726942063, "num_tokens": 111297214.0, "step": 48585 }, { "entropy": 5.271905040740966, "epoch": 4.803281929616449, "grad_norm": 1.171875, "learning_rate": 0.0002925284005659997, "loss": 4.6777, "mean_token_accuracy": 0.24641114175319673, "num_tokens": 111307731.0, "step": 48590 }, { "entropy": 5.364884519577027, "epoch": 4.80377619612495, "grad_norm": 1.0625, "learning_rate": 0.00029249321761918364, "loss": 4.8046, "mean_token_accuracy": 0.23517345041036605, "num_tokens": 111319474.0, "step": 48595 }, { "entropy": 5.2742760181427, "epoch": 4.804270462633452, "grad_norm": 1.1171875, "learning_rate": 0.00029245803424203173, "loss": 4.6806, "mean_token_accuracy": 0.2459687516093254, "num_tokens": 111329821.0, "step": 48600 }, { "entropy": 5.284956216812134, "epoch": 4.8047647291419535, "grad_norm": 1.109375, "learning_rate": 0.0002924228504354095, "loss": 4.7882, "mean_token_accuracy": 0.239039845764637, "num_tokens": 111340761.0, "step": 48605 }, { "entropy": 5.208277463912964, "epoch": 4.805258995650455, "grad_norm": 1.109375, "learning_rate": 0.00029238766620018244, "loss": 4.634, "mean_token_accuracy": 0.25759405046701433, "num_tokens": 111352208.0, "step": 48610 }, { "entropy": 5.3969902992248535, "epoch": 4.805753262158956, "grad_norm": 1.1484375, "learning_rate": 0.000292352481537216, "loss": 4.8346, "mean_token_accuracy": 0.23021542876958848, "num_tokens": 111363489.0, "step": 48615 }, { "entropy": 5.367597055435181, "epoch": 4.806247528667457, "grad_norm": 1.09375, "learning_rate": 0.00029231729644737587, "loss": 4.8168, "mean_token_accuracy": 0.2389044851064682, "num_tokens": 111375791.0, "step": 48620 }, { "entropy": 5.3504656791687015, "epoch": 4.806741795175959, "grad_norm": 1.140625, "learning_rate": 0.0002922821109315275, "loss": 4.7489, "mean_token_accuracy": 0.24096872210502623, "num_tokens": 111387349.0, "step": 48625 }, { "entropy": 5.265599966049194, "epoch": 4.80723606168446, "grad_norm": 1.015625, "learning_rate": 0.00029224692499053666, "loss": 4.7349, "mean_token_accuracy": 0.24590112566947936, "num_tokens": 111398342.0, "step": 48630 }, { "entropy": 5.304454946517945, "epoch": 4.807730328192962, "grad_norm": 1.109375, "learning_rate": 0.0002922117386252687, "loss": 4.7288, "mean_token_accuracy": 0.24939018338918686, "num_tokens": 111410208.0, "step": 48635 }, { "entropy": 5.327817821502686, "epoch": 4.808224594701463, "grad_norm": 1.078125, "learning_rate": 0.00029217655183658945, "loss": 4.7254, "mean_token_accuracy": 0.24150605797767638, "num_tokens": 111421273.0, "step": 48640 }, { "entropy": 5.3507421016693115, "epoch": 4.8087188612099645, "grad_norm": 0.984375, "learning_rate": 0.0002921413646253642, "loss": 4.7723, "mean_token_accuracy": 0.24816446453332902, "num_tokens": 111432496.0, "step": 48645 }, { "entropy": 5.3663757801055905, "epoch": 4.809213127718466, "grad_norm": 1.0625, "learning_rate": 0.0002921061769924587, "loss": 4.8444, "mean_token_accuracy": 0.23928557634353637, "num_tokens": 111443830.0, "step": 48650 }, { "entropy": 5.285394668579102, "epoch": 4.809707394226967, "grad_norm": 1.1015625, "learning_rate": 0.00029207098893873864, "loss": 4.7711, "mean_token_accuracy": 0.2433879554271698, "num_tokens": 111455056.0, "step": 48655 }, { "entropy": 5.333960628509521, "epoch": 4.810201660735468, "grad_norm": 1.0390625, "learning_rate": 0.00029203580046506967, "loss": 4.8004, "mean_token_accuracy": 0.23359092324972153, "num_tokens": 111466829.0, "step": 48660 }, { "entropy": 5.292240190505981, "epoch": 4.8106959272439695, "grad_norm": 1.078125, "learning_rate": 0.00029200061157231725, "loss": 4.7079, "mean_token_accuracy": 0.2454097494482994, "num_tokens": 111477967.0, "step": 48665 }, { "entropy": 5.3081786155700685, "epoch": 4.811190193752472, "grad_norm": 1.1875, "learning_rate": 0.00029196542226134724, "loss": 4.7567, "mean_token_accuracy": 0.2443145588040352, "num_tokens": 111488376.0, "step": 48670 }, { "entropy": 5.3154936790466305, "epoch": 4.811684460260973, "grad_norm": 1.0390625, "learning_rate": 0.00029193023253302515, "loss": 4.7794, "mean_token_accuracy": 0.24119799584150314, "num_tokens": 111500460.0, "step": 48675 }, { "entropy": 5.389456748962402, "epoch": 4.812178726769474, "grad_norm": 1.1640625, "learning_rate": 0.00029189504238821677, "loss": 4.7873, "mean_token_accuracy": 0.23263225704431534, "num_tokens": 111511229.0, "step": 48680 }, { "entropy": 5.357384586334229, "epoch": 4.8126729932779755, "grad_norm": 1.03125, "learning_rate": 0.00029185985182778767, "loss": 4.7505, "mean_token_accuracy": 0.24807796478271485, "num_tokens": 111521829.0, "step": 48685 }, { "entropy": 5.320094633102417, "epoch": 4.813167259786477, "grad_norm": 1.078125, "learning_rate": 0.00029182466085260364, "loss": 4.7301, "mean_token_accuracy": 0.240289406478405, "num_tokens": 111533674.0, "step": 48690 }, { "entropy": 5.3610114574432375, "epoch": 4.813661526294978, "grad_norm": 1.1015625, "learning_rate": 0.00029178946946353037, "loss": 4.8122, "mean_token_accuracy": 0.23916380405426024, "num_tokens": 111545588.0, "step": 48695 }, { "entropy": 5.287443447113037, "epoch": 4.814155792803479, "grad_norm": 1.0546875, "learning_rate": 0.0002917542776614335, "loss": 4.7087, "mean_token_accuracy": 0.24860818982124328, "num_tokens": 111557316.0, "step": 48700 }, { "entropy": 5.320913076400757, "epoch": 4.814650059311981, "grad_norm": 1.09375, "learning_rate": 0.0002917190854471788, "loss": 4.7822, "mean_token_accuracy": 0.24172141253948212, "num_tokens": 111569402.0, "step": 48705 }, { "entropy": 5.305059003829956, "epoch": 4.815144325820483, "grad_norm": 1.0234375, "learning_rate": 0.00029168389282163205, "loss": 4.7717, "mean_token_accuracy": 0.2381979614496231, "num_tokens": 111581155.0, "step": 48710 }, { "entropy": 5.263869094848633, "epoch": 4.815638592328984, "grad_norm": 1.0234375, "learning_rate": 0.0002916486997856588, "loss": 4.6659, "mean_token_accuracy": 0.24987962245941162, "num_tokens": 111592566.0, "step": 48715 }, { "entropy": 5.319861936569214, "epoch": 4.816132858837485, "grad_norm": 1.0859375, "learning_rate": 0.00029161350634012513, "loss": 4.788, "mean_token_accuracy": 0.24085634499788283, "num_tokens": 111604039.0, "step": 48720 }, { "entropy": 5.376752328872681, "epoch": 4.8166271253459865, "grad_norm": 1.1171875, "learning_rate": 0.00029157831248589655, "loss": 4.8587, "mean_token_accuracy": 0.22980426698923112, "num_tokens": 111614943.0, "step": 48725 }, { "entropy": 5.297205591201783, "epoch": 4.817121391854488, "grad_norm": 1.109375, "learning_rate": 0.0002915431182238389, "loss": 4.7131, "mean_token_accuracy": 0.25088960081338885, "num_tokens": 111626011.0, "step": 48730 }, { "entropy": 5.317419719696045, "epoch": 4.817615658362989, "grad_norm": 1.09375, "learning_rate": 0.00029150792355481806, "loss": 4.7283, "mean_token_accuracy": 0.24573203027248383, "num_tokens": 111636980.0, "step": 48735 }, { "entropy": 5.340959644317627, "epoch": 4.818109924871491, "grad_norm": 1.421875, "learning_rate": 0.0002914727284796996, "loss": 4.8183, "mean_token_accuracy": 0.23551931828260422, "num_tokens": 111649603.0, "step": 48740 }, { "entropy": 5.331497240066528, "epoch": 4.818604191379992, "grad_norm": 1.0390625, "learning_rate": 0.00029143753299934954, "loss": 4.8173, "mean_token_accuracy": 0.23076348155736923, "num_tokens": 111661554.0, "step": 48745 }, { "entropy": 5.380143642425537, "epoch": 4.819098457888494, "grad_norm": 1.09375, "learning_rate": 0.00029140233711463364, "loss": 4.7956, "mean_token_accuracy": 0.23400291204452514, "num_tokens": 111673938.0, "step": 48750 }, { "entropy": 5.342561197280884, "epoch": 4.819592724396995, "grad_norm": 1.0703125, "learning_rate": 0.0002913671408264177, "loss": 4.7314, "mean_token_accuracy": 0.2406270757317543, "num_tokens": 111685526.0, "step": 48755 }, { "entropy": 5.333497095108032, "epoch": 4.820086990905496, "grad_norm": 1.046875, "learning_rate": 0.0002913319441355675, "loss": 4.8803, "mean_token_accuracy": 0.23679576218128204, "num_tokens": 111698195.0, "step": 48760 }, { "entropy": 5.347843837738037, "epoch": 4.8205812574139975, "grad_norm": 1.09375, "learning_rate": 0.00029129674704294896, "loss": 4.8155, "mean_token_accuracy": 0.2413611128926277, "num_tokens": 111708793.0, "step": 48765 }, { "entropy": 5.3290080547332765, "epoch": 4.821075523922499, "grad_norm": 1.0234375, "learning_rate": 0.000291261549549428, "loss": 4.7448, "mean_token_accuracy": 0.2457394689321518, "num_tokens": 111720388.0, "step": 48770 }, { "entropy": 5.278064632415772, "epoch": 4.821569790431001, "grad_norm": 1.1171875, "learning_rate": 0.00029122635165587023, "loss": 4.7307, "mean_token_accuracy": 0.2447350174188614, "num_tokens": 111733178.0, "step": 48775 }, { "entropy": 5.272962856292724, "epoch": 4.822064056939502, "grad_norm": 1.0546875, "learning_rate": 0.00029119115336314185, "loss": 4.694, "mean_token_accuracy": 0.2488802671432495, "num_tokens": 111744131.0, "step": 48780 }, { "entropy": 5.320342540740967, "epoch": 4.822558323448003, "grad_norm": 1.0625, "learning_rate": 0.0002911559546721085, "loss": 4.7558, "mean_token_accuracy": 0.23809431493282318, "num_tokens": 111755926.0, "step": 48785 }, { "entropy": 5.278792047500611, "epoch": 4.823052589956505, "grad_norm": 1.09375, "learning_rate": 0.00029112075558363615, "loss": 4.6909, "mean_token_accuracy": 0.24523799866437912, "num_tokens": 111766252.0, "step": 48790 }, { "entropy": 5.237725019454956, "epoch": 4.823546856465006, "grad_norm": 1.046875, "learning_rate": 0.0002910855560985908, "loss": 4.6578, "mean_token_accuracy": 0.2496128797531128, "num_tokens": 111776703.0, "step": 48795 }, { "entropy": 5.228518772125244, "epoch": 4.824041122973507, "grad_norm": 1.0078125, "learning_rate": 0.0002910503562178382, "loss": 4.6569, "mean_token_accuracy": 0.24992904514074327, "num_tokens": 111788026.0, "step": 48800 }, { "entropy": 5.245304822921753, "epoch": 4.824535389482008, "grad_norm": 1.1640625, "learning_rate": 0.00029101515594224435, "loss": 4.654, "mean_token_accuracy": 0.2508305549621582, "num_tokens": 111798673.0, "step": 48805 }, { "entropy": 5.261360120773316, "epoch": 4.82502965599051, "grad_norm": 1.0546875, "learning_rate": 0.0002909799552726752, "loss": 4.7546, "mean_token_accuracy": 0.24088272154331208, "num_tokens": 111810502.0, "step": 48810 }, { "entropy": 5.367051839828491, "epoch": 4.825523922499012, "grad_norm": 0.984375, "learning_rate": 0.00029094475420999666, "loss": 4.8278, "mean_token_accuracy": 0.23152943402528764, "num_tokens": 111822597.0, "step": 48815 }, { "entropy": 5.33675627708435, "epoch": 4.826018189007513, "grad_norm": 1.140625, "learning_rate": 0.00029090955275507473, "loss": 4.7972, "mean_token_accuracy": 0.23851532489061356, "num_tokens": 111833372.0, "step": 48820 }, { "entropy": 5.344756078720093, "epoch": 4.826512455516014, "grad_norm": 1.0234375, "learning_rate": 0.00029087435090877534, "loss": 4.8156, "mean_token_accuracy": 0.23831722885370255, "num_tokens": 111845323.0, "step": 48825 }, { "entropy": 5.297845840454102, "epoch": 4.827006722024516, "grad_norm": 1.203125, "learning_rate": 0.0002908391486719644, "loss": 4.7289, "mean_token_accuracy": 0.24796277284622192, "num_tokens": 111855953.0, "step": 48830 }, { "entropy": 5.306819057464599, "epoch": 4.827500988533017, "grad_norm": 1.140625, "learning_rate": 0.00029080394604550795, "loss": 4.8014, "mean_token_accuracy": 0.2417280375957489, "num_tokens": 111866433.0, "step": 48835 }, { "entropy": 5.320916938781738, "epoch": 4.827995255041518, "grad_norm": 1.0546875, "learning_rate": 0.000290768743030272, "loss": 4.8258, "mean_token_accuracy": 0.24215843081474303, "num_tokens": 111877774.0, "step": 48840 }, { "entropy": 5.355295181274414, "epoch": 4.828489521550019, "grad_norm": 1.0859375, "learning_rate": 0.0002907335396271225, "loss": 4.8055, "mean_token_accuracy": 0.2372064247727394, "num_tokens": 111888966.0, "step": 48845 }, { "entropy": 5.36264476776123, "epoch": 4.828983788058521, "grad_norm": 1.2578125, "learning_rate": 0.00029069833583692553, "loss": 4.7921, "mean_token_accuracy": 0.24149104356765747, "num_tokens": 111899571.0, "step": 48850 }, { "entropy": 5.307000780105591, "epoch": 4.829478054567023, "grad_norm": 1.1328125, "learning_rate": 0.000290663131660547, "loss": 4.8171, "mean_token_accuracy": 0.23455978631973268, "num_tokens": 111911280.0, "step": 48855 }, { "entropy": 5.410956192016601, "epoch": 4.829972321075524, "grad_norm": 1.0703125, "learning_rate": 0.000290627927098853, "loss": 4.8906, "mean_token_accuracy": 0.22654264718294143, "num_tokens": 111922692.0, "step": 48860 }, { "entropy": 5.271888017654419, "epoch": 4.830466587584025, "grad_norm": 1.1171875, "learning_rate": 0.00029059272215270965, "loss": 4.7406, "mean_token_accuracy": 0.24513593018054963, "num_tokens": 111934910.0, "step": 48865 }, { "entropy": 5.280877113342285, "epoch": 4.830960854092527, "grad_norm": 1.0859375, "learning_rate": 0.00029055751682298295, "loss": 4.6867, "mean_token_accuracy": 0.24466370195150375, "num_tokens": 111945539.0, "step": 48870 }, { "entropy": 5.275964164733887, "epoch": 4.831455120601028, "grad_norm": 1.1875, "learning_rate": 0.0002905223111105388, "loss": 4.7317, "mean_token_accuracy": 0.24189331531524658, "num_tokens": 111956456.0, "step": 48875 }, { "entropy": 5.236647462844848, "epoch": 4.831949387109529, "grad_norm": 1.078125, "learning_rate": 0.0002904871050162434, "loss": 4.6775, "mean_token_accuracy": 0.246377569437027, "num_tokens": 111967054.0, "step": 48880 }, { "entropy": 5.261524248123169, "epoch": 4.83244365361803, "grad_norm": 1.125, "learning_rate": 0.0002904518985409629, "loss": 4.7356, "mean_token_accuracy": 0.24442675560712815, "num_tokens": 111978774.0, "step": 48885 }, { "entropy": 5.286593866348267, "epoch": 4.832937920126533, "grad_norm": 1.140625, "learning_rate": 0.00029041669168556315, "loss": 4.7043, "mean_token_accuracy": 0.25096504390239716, "num_tokens": 111989459.0, "step": 48890 }, { "entropy": 5.364242029190064, "epoch": 4.833432186635034, "grad_norm": 0.97265625, "learning_rate": 0.0002903814844509106, "loss": 4.8045, "mean_token_accuracy": 0.2349934235215187, "num_tokens": 112002016.0, "step": 48895 }, { "entropy": 5.39142427444458, "epoch": 4.833926453143535, "grad_norm": 1.0625, "learning_rate": 0.000290346276837871, "loss": 4.7569, "mean_token_accuracy": 0.23985040783882142, "num_tokens": 112014697.0, "step": 48900 }, { "entropy": 5.367173671722412, "epoch": 4.834420719652036, "grad_norm": 1.0859375, "learning_rate": 0.0002903110688473106, "loss": 4.7975, "mean_token_accuracy": 0.23929737359285355, "num_tokens": 112026425.0, "step": 48905 }, { "entropy": 5.307416152954102, "epoch": 4.834914986160538, "grad_norm": 1.078125, "learning_rate": 0.00029027586048009554, "loss": 4.7006, "mean_token_accuracy": 0.24970718026161193, "num_tokens": 112036980.0, "step": 48910 }, { "entropy": 5.277330493927002, "epoch": 4.835409252669039, "grad_norm": 1.0625, "learning_rate": 0.000290240651737092, "loss": 4.7988, "mean_token_accuracy": 0.2368501678109169, "num_tokens": 112048746.0, "step": 48915 }, { "entropy": 5.322356796264648, "epoch": 4.83590351917754, "grad_norm": 1.046875, "learning_rate": 0.000290205442619166, "loss": 4.7549, "mean_token_accuracy": 0.2413897156715393, "num_tokens": 112059635.0, "step": 48920 }, { "entropy": 5.402394342422485, "epoch": 4.836397785686042, "grad_norm": 1.0703125, "learning_rate": 0.00029017023312718387, "loss": 4.8583, "mean_token_accuracy": 0.2304858073592186, "num_tokens": 112070994.0, "step": 48925 }, { "entropy": 5.2833507537841795, "epoch": 4.8368920521945435, "grad_norm": 1.015625, "learning_rate": 0.0002901350232620116, "loss": 4.734, "mean_token_accuracy": 0.2505051717162132, "num_tokens": 112080897.0, "step": 48930 }, { "entropy": 5.3457794189453125, "epoch": 4.837386318703045, "grad_norm": 1.1796875, "learning_rate": 0.0002900998130245153, "loss": 4.7946, "mean_token_accuracy": 0.24531155228614807, "num_tokens": 112091658.0, "step": 48935 }, { "entropy": 5.370483779907227, "epoch": 4.837880585211546, "grad_norm": 1.0390625, "learning_rate": 0.00029006460241556137, "loss": 4.8218, "mean_token_accuracy": 0.2335045650601387, "num_tokens": 112103490.0, "step": 48940 }, { "entropy": 5.321983909606933, "epoch": 4.838374851720047, "grad_norm": 1.109375, "learning_rate": 0.00029002939143601584, "loss": 4.7712, "mean_token_accuracy": 0.24036282896995545, "num_tokens": 112115255.0, "step": 48945 }, { "entropy": 5.272202396392823, "epoch": 4.838869118228549, "grad_norm": 1.078125, "learning_rate": 0.000289994180086745, "loss": 4.7509, "mean_token_accuracy": 0.24146161824464799, "num_tokens": 112126188.0, "step": 48950 }, { "entropy": 5.3359862804412845, "epoch": 4.83936338473705, "grad_norm": 1.1875, "learning_rate": 0.0002899589683686149, "loss": 4.8031, "mean_token_accuracy": 0.23322246968746185, "num_tokens": 112138006.0, "step": 48955 }, { "entropy": 5.322775745391846, "epoch": 4.839857651245552, "grad_norm": 0.99609375, "learning_rate": 0.00028992375628249196, "loss": 4.7918, "mean_token_accuracy": 0.2358780488371849, "num_tokens": 112149828.0, "step": 48960 }, { "entropy": 5.277392053604126, "epoch": 4.840351917754053, "grad_norm": 1.0859375, "learning_rate": 0.0002898885438292423, "loss": 4.7832, "mean_token_accuracy": 0.24041500985622405, "num_tokens": 112161615.0, "step": 48965 }, { "entropy": 5.237493181228638, "epoch": 4.8408461842625545, "grad_norm": 1.09375, "learning_rate": 0.00028985333100973207, "loss": 4.6592, "mean_token_accuracy": 0.25819550454616547, "num_tokens": 112172116.0, "step": 48970 }, { "entropy": 5.3054862976074215, "epoch": 4.841340450771056, "grad_norm": 1.0859375, "learning_rate": 0.00028981811782482765, "loss": 4.7054, "mean_token_accuracy": 0.2429267942905426, "num_tokens": 112184469.0, "step": 48975 }, { "entropy": 5.30972638130188, "epoch": 4.841834717279557, "grad_norm": 1.046875, "learning_rate": 0.0002897829042753952, "loss": 4.7368, "mean_token_accuracy": 0.24203261435031892, "num_tokens": 112195473.0, "step": 48980 }, { "entropy": 5.383035039901733, "epoch": 4.842328983788058, "grad_norm": 1.09375, "learning_rate": 0.00028974769036230105, "loss": 4.8233, "mean_token_accuracy": 0.23490878641605378, "num_tokens": 112207339.0, "step": 48985 }, { "entropy": 5.266527271270752, "epoch": 4.84282325029656, "grad_norm": 1.1171875, "learning_rate": 0.00028971247608641136, "loss": 4.7116, "mean_token_accuracy": 0.25130351036787035, "num_tokens": 112218444.0, "step": 48990 }, { "entropy": 5.405886507034301, "epoch": 4.843317516805062, "grad_norm": 1.1484375, "learning_rate": 0.00028967726144859255, "loss": 4.8364, "mean_token_accuracy": 0.23368509262800216, "num_tokens": 112230108.0, "step": 48995 }, { "entropy": 5.257721757888794, "epoch": 4.843811783313563, "grad_norm": 1.0, "learning_rate": 0.00028964204644971083, "loss": 4.6959, "mean_token_accuracy": 0.2518449053168297, "num_tokens": 112241731.0, "step": 49000 }, { "entropy": 5.288273334503174, "epoch": 4.844306049822064, "grad_norm": 1.0625, "learning_rate": 0.00028960683109063244, "loss": 4.7231, "mean_token_accuracy": 0.23991921842098235, "num_tokens": 112253501.0, "step": 49005 }, { "entropy": 5.298108816146851, "epoch": 4.8448003163305655, "grad_norm": 1.140625, "learning_rate": 0.00028957161537222374, "loss": 4.6678, "mean_token_accuracy": 0.2551095113158226, "num_tokens": 112264128.0, "step": 49010 }, { "entropy": 5.353794717788697, "epoch": 4.845294582839067, "grad_norm": 1.1015625, "learning_rate": 0.00028953639929535114, "loss": 4.8157, "mean_token_accuracy": 0.23374708741903305, "num_tokens": 112275602.0, "step": 49015 }, { "entropy": 5.345532751083374, "epoch": 4.845788849347568, "grad_norm": 1.078125, "learning_rate": 0.0002895011828608808, "loss": 4.8033, "mean_token_accuracy": 0.2391786277294159, "num_tokens": 112287158.0, "step": 49020 }, { "entropy": 5.170825242996216, "epoch": 4.846283115856069, "grad_norm": 1.078125, "learning_rate": 0.0002894659660696791, "loss": 4.572, "mean_token_accuracy": 0.25882107615470884, "num_tokens": 112298764.0, "step": 49025 }, { "entropy": 5.220865774154663, "epoch": 4.8467773823645715, "grad_norm": 1.1328125, "learning_rate": 0.0002894307489226124, "loss": 4.6656, "mean_token_accuracy": 0.24957265257835387, "num_tokens": 112309976.0, "step": 49030 }, { "entropy": 5.343462514877319, "epoch": 4.847271648873073, "grad_norm": 1.0, "learning_rate": 0.000289395531420547, "loss": 4.7529, "mean_token_accuracy": 0.23740767538547516, "num_tokens": 112321950.0, "step": 49035 }, { "entropy": 5.233504962921143, "epoch": 4.847765915381574, "grad_norm": 1.03125, "learning_rate": 0.0002893603135643494, "loss": 4.623, "mean_token_accuracy": 0.2581573575735092, "num_tokens": 112332823.0, "step": 49040 }, { "entropy": 5.261725234985351, "epoch": 4.848260181890075, "grad_norm": 1.0078125, "learning_rate": 0.0002893250953548857, "loss": 4.7591, "mean_token_accuracy": 0.24489662945270538, "num_tokens": 112345374.0, "step": 49045 }, { "entropy": 5.390142297744751, "epoch": 4.8487544483985765, "grad_norm": 1.1015625, "learning_rate": 0.00028928987679302255, "loss": 4.8425, "mean_token_accuracy": 0.22998454421758652, "num_tokens": 112357963.0, "step": 49050 }, { "entropy": 5.339954662322998, "epoch": 4.849248714907078, "grad_norm": 1.125, "learning_rate": 0.0002892546578796262, "loss": 4.7802, "mean_token_accuracy": 0.2429508626461029, "num_tokens": 112368410.0, "step": 49055 }, { "entropy": 5.321515226364136, "epoch": 4.849742981415579, "grad_norm": 1.2109375, "learning_rate": 0.00028921943861556304, "loss": 4.7621, "mean_token_accuracy": 0.24556868970394136, "num_tokens": 112379202.0, "step": 49060 }, { "entropy": 5.211701679229736, "epoch": 4.85023724792408, "grad_norm": 1.078125, "learning_rate": 0.0002891842190016995, "loss": 4.663, "mean_token_accuracy": 0.24685144275426865, "num_tokens": 112389908.0, "step": 49065 }, { "entropy": 5.295388174057007, "epoch": 4.850731514432582, "grad_norm": 1.09375, "learning_rate": 0.00028914899903890193, "loss": 4.8122, "mean_token_accuracy": 0.24314975887537002, "num_tokens": 112400917.0, "step": 49070 }, { "entropy": 5.2384966850280765, "epoch": 4.851225780941084, "grad_norm": 1.125, "learning_rate": 0.00028911377872803683, "loss": 4.6837, "mean_token_accuracy": 0.24671712517738342, "num_tokens": 112413540.0, "step": 49075 }, { "entropy": 5.301168298721313, "epoch": 4.851720047449585, "grad_norm": 1.203125, "learning_rate": 0.00028907855806997057, "loss": 4.7302, "mean_token_accuracy": 0.2419606104493141, "num_tokens": 112423779.0, "step": 49080 }, { "entropy": 5.370909357070923, "epoch": 4.852214313958086, "grad_norm": 1.0390625, "learning_rate": 0.0002890433370655696, "loss": 4.8011, "mean_token_accuracy": 0.23729113191366197, "num_tokens": 112435705.0, "step": 49085 }, { "entropy": 5.323911952972412, "epoch": 4.8527085804665875, "grad_norm": 1.1015625, "learning_rate": 0.00028900811571570036, "loss": 4.7136, "mean_token_accuracy": 0.24572469294071198, "num_tokens": 112446138.0, "step": 49090 }, { "entropy": 5.270414066314697, "epoch": 4.853202846975089, "grad_norm": 1.0078125, "learning_rate": 0.0002889728940212293, "loss": 4.7606, "mean_token_accuracy": 0.24180003255605698, "num_tokens": 112457616.0, "step": 49095 }, { "entropy": 5.309480619430542, "epoch": 4.85369711348359, "grad_norm": 1.0859375, "learning_rate": 0.00028893767198302284, "loss": 4.786, "mean_token_accuracy": 0.23948232531547547, "num_tokens": 112470367.0, "step": 49100 }, { "entropy": 5.304914951324463, "epoch": 4.854191379992091, "grad_norm": 1.0859375, "learning_rate": 0.0002889024496019476, "loss": 4.7434, "mean_token_accuracy": 0.2449621230363846, "num_tokens": 112481075.0, "step": 49105 }, { "entropy": 5.286191606521607, "epoch": 4.854685646500593, "grad_norm": 0.984375, "learning_rate": 0.00028886722687886986, "loss": 4.7338, "mean_token_accuracy": 0.2440437287092209, "num_tokens": 112493846.0, "step": 49110 }, { "entropy": 5.2567321300506595, "epoch": 4.855179913009095, "grad_norm": 0.9609375, "learning_rate": 0.0002888320038146562, "loss": 4.7282, "mean_token_accuracy": 0.24328984469175338, "num_tokens": 112506464.0, "step": 49115 }, { "entropy": 5.310797882080078, "epoch": 4.855674179517596, "grad_norm": 1.0390625, "learning_rate": 0.00028879678041017297, "loss": 4.676, "mean_token_accuracy": 0.2489088073372841, "num_tokens": 112517603.0, "step": 49120 }, { "entropy": 5.317611026763916, "epoch": 4.856168446026097, "grad_norm": 1.03125, "learning_rate": 0.000288761556666287, "loss": 4.7179, "mean_token_accuracy": 0.23734698742628096, "num_tokens": 112528736.0, "step": 49125 }, { "entropy": 5.350393581390381, "epoch": 4.8566627125345985, "grad_norm": 1.078125, "learning_rate": 0.00028872633258386453, "loss": 4.8317, "mean_token_accuracy": 0.23657927364110948, "num_tokens": 112540864.0, "step": 49130 }, { "entropy": 5.296391773223877, "epoch": 4.8571569790431, "grad_norm": 1.15625, "learning_rate": 0.00028869110816377215, "loss": 4.7235, "mean_token_accuracy": 0.242226180434227, "num_tokens": 112551563.0, "step": 49135 }, { "entropy": 5.345118379592895, "epoch": 4.857651245551601, "grad_norm": 1.015625, "learning_rate": 0.00028865588340687637, "loss": 4.863, "mean_token_accuracy": 0.23039745390415192, "num_tokens": 112563445.0, "step": 49140 }, { "entropy": 5.360734128952027, "epoch": 4.858145512060103, "grad_norm": 1.2109375, "learning_rate": 0.0002886206583140437, "loss": 4.7927, "mean_token_accuracy": 0.23803452998399735, "num_tokens": 112573601.0, "step": 49145 }, { "entropy": 5.300910425186157, "epoch": 4.858639778568604, "grad_norm": 1.078125, "learning_rate": 0.0002885854328861407, "loss": 4.7596, "mean_token_accuracy": 0.24297953993082047, "num_tokens": 112584251.0, "step": 49150 }, { "entropy": 5.252087068557739, "epoch": 4.859134045077106, "grad_norm": 1.0546875, "learning_rate": 0.0002885502071240341, "loss": 4.6649, "mean_token_accuracy": 0.25391328036785127, "num_tokens": 112595580.0, "step": 49155 }, { "entropy": 5.275504875183105, "epoch": 4.859628311585607, "grad_norm": 1.03125, "learning_rate": 0.0002885149810285903, "loss": 4.7319, "mean_token_accuracy": 0.24378079026937485, "num_tokens": 112606806.0, "step": 49160 }, { "entropy": 5.312102794647217, "epoch": 4.860122578094108, "grad_norm": 0.984375, "learning_rate": 0.0002884797546006757, "loss": 4.7442, "mean_token_accuracy": 0.23792867213487626, "num_tokens": 112618508.0, "step": 49165 }, { "entropy": 5.26467809677124, "epoch": 4.8606168446026095, "grad_norm": 1.0390625, "learning_rate": 0.0002884445278411572, "loss": 4.6963, "mean_token_accuracy": 0.2446642264723778, "num_tokens": 112630830.0, "step": 49170 }, { "entropy": 5.336666440963745, "epoch": 4.861111111111111, "grad_norm": 0.99609375, "learning_rate": 0.0002884093007509012, "loss": 4.7391, "mean_token_accuracy": 0.24286174923181533, "num_tokens": 112642432.0, "step": 49175 }, { "entropy": 5.341714334487915, "epoch": 4.861605377619613, "grad_norm": 1.078125, "learning_rate": 0.0002883740733307742, "loss": 4.7562, "mean_token_accuracy": 0.24067822396755217, "num_tokens": 112653756.0, "step": 49180 }, { "entropy": 5.310150957107544, "epoch": 4.862099644128114, "grad_norm": 1.09375, "learning_rate": 0.000288338845581643, "loss": 4.7014, "mean_token_accuracy": 0.2440958261489868, "num_tokens": 112664495.0, "step": 49185 }, { "entropy": 5.367334842681885, "epoch": 4.862593910636615, "grad_norm": 1.0859375, "learning_rate": 0.0002883036175043742, "loss": 4.7672, "mean_token_accuracy": 0.23567418605089188, "num_tokens": 112676232.0, "step": 49190 }, { "entropy": 5.311871719360352, "epoch": 4.863088177145117, "grad_norm": 0.99609375, "learning_rate": 0.0002882683890998342, "loss": 4.7504, "mean_token_accuracy": 0.23524591475725173, "num_tokens": 112687145.0, "step": 49195 }, { "entropy": 5.290809440612793, "epoch": 4.863582443653618, "grad_norm": 1.0625, "learning_rate": 0.0002882331603688899, "loss": 4.7578, "mean_token_accuracy": 0.23927071541547776, "num_tokens": 112697231.0, "step": 49200 }, { "entropy": 5.252577304840088, "epoch": 4.864076710162119, "grad_norm": 1.0234375, "learning_rate": 0.0002881979313124078, "loss": 4.6671, "mean_token_accuracy": 0.2448927253484726, "num_tokens": 112708478.0, "step": 49205 }, { "entropy": 5.26760516166687, "epoch": 4.86457097667062, "grad_norm": 1.0703125, "learning_rate": 0.00028816270193125445, "loss": 4.6957, "mean_token_accuracy": 0.24541178345680237, "num_tokens": 112718564.0, "step": 49210 }, { "entropy": 5.298628854751587, "epoch": 4.865065243179123, "grad_norm": 1.015625, "learning_rate": 0.0002881274722262966, "loss": 4.7328, "mean_token_accuracy": 0.2411765217781067, "num_tokens": 112728913.0, "step": 49215 }, { "entropy": 5.2748034477233885, "epoch": 4.865559509687624, "grad_norm": 1.2734375, "learning_rate": 0.0002880922421984009, "loss": 4.6737, "mean_token_accuracy": 0.24495092332363128, "num_tokens": 112739136.0, "step": 49220 }, { "entropy": 5.243327379226685, "epoch": 4.866053776196125, "grad_norm": 1.1484375, "learning_rate": 0.00028805701184843406, "loss": 4.7032, "mean_token_accuracy": 0.2423911616206169, "num_tokens": 112750279.0, "step": 49225 }, { "entropy": 5.2882448673248295, "epoch": 4.866548042704626, "grad_norm": 1.1171875, "learning_rate": 0.0002880217811772627, "loss": 4.7475, "mean_token_accuracy": 0.24317160993814468, "num_tokens": 112761814.0, "step": 49230 }, { "entropy": 5.268621397018433, "epoch": 4.867042309213128, "grad_norm": 1.1953125, "learning_rate": 0.0002879865501857535, "loss": 4.6989, "mean_token_accuracy": 0.24195066541433335, "num_tokens": 112771806.0, "step": 49235 }, { "entropy": 5.24777512550354, "epoch": 4.867536575721629, "grad_norm": 1.140625, "learning_rate": 0.0002879513188747731, "loss": 4.6746, "mean_token_accuracy": 0.2484585389494896, "num_tokens": 112782071.0, "step": 49240 }, { "entropy": 5.24498176574707, "epoch": 4.86803084223013, "grad_norm": 1.1328125, "learning_rate": 0.00028791608724518833, "loss": 4.7642, "mean_token_accuracy": 0.24214653968811034, "num_tokens": 112793312.0, "step": 49245 }, { "entropy": 5.302461242675781, "epoch": 4.868525108738632, "grad_norm": 1.0234375, "learning_rate": 0.0002878808552978658, "loss": 4.7678, "mean_token_accuracy": 0.2436542272567749, "num_tokens": 112804925.0, "step": 49250 }, { "entropy": 5.349241113662719, "epoch": 4.869019375247134, "grad_norm": 1.046875, "learning_rate": 0.00028784562303367213, "loss": 4.7796, "mean_token_accuracy": 0.2417551100254059, "num_tokens": 112817947.0, "step": 49255 }, { "entropy": 5.40150637626648, "epoch": 4.869513641755635, "grad_norm": 1.09375, "learning_rate": 0.0002878103904534742, "loss": 4.8055, "mean_token_accuracy": 0.23932909071445466, "num_tokens": 112829182.0, "step": 49260 }, { "entropy": 5.3520220756530765, "epoch": 4.870007908264136, "grad_norm": 0.984375, "learning_rate": 0.00028777515755813867, "loss": 4.8095, "mean_token_accuracy": 0.2381925418972969, "num_tokens": 112841024.0, "step": 49265 }, { "entropy": 5.290309095382691, "epoch": 4.870502174772637, "grad_norm": 1.0, "learning_rate": 0.00028773992434853236, "loss": 4.7316, "mean_token_accuracy": 0.2414900094270706, "num_tokens": 112852175.0, "step": 49270 }, { "entropy": 5.241249370574951, "epoch": 4.870996441281139, "grad_norm": 1.03125, "learning_rate": 0.0002877046908255219, "loss": 4.6746, "mean_token_accuracy": 0.24870590567588807, "num_tokens": 112863392.0, "step": 49275 }, { "entropy": 5.360528182983399, "epoch": 4.87149070778964, "grad_norm": 0.99609375, "learning_rate": 0.00028766945698997397, "loss": 4.8306, "mean_token_accuracy": 0.2286213904619217, "num_tokens": 112876393.0, "step": 49280 }, { "entropy": 5.338554954528808, "epoch": 4.871984974298142, "grad_norm": 1.09375, "learning_rate": 0.00028763422284275547, "loss": 4.8046, "mean_token_accuracy": 0.23745541721582414, "num_tokens": 112886540.0, "step": 49285 }, { "entropy": 5.287475347518921, "epoch": 4.872479240806643, "grad_norm": 1.109375, "learning_rate": 0.0002875989883847332, "loss": 4.7156, "mean_token_accuracy": 0.24890963584184647, "num_tokens": 112898057.0, "step": 49290 }, { "entropy": 5.272068166732788, "epoch": 4.872973507315145, "grad_norm": 1.0625, "learning_rate": 0.0002875637536167738, "loss": 4.7072, "mean_token_accuracy": 0.24600473791360855, "num_tokens": 112910135.0, "step": 49295 }, { "entropy": 5.363156318664551, "epoch": 4.873467773823646, "grad_norm": 1.0859375, "learning_rate": 0.0002875285185397442, "loss": 4.8303, "mean_token_accuracy": 0.23580267876386643, "num_tokens": 112923374.0, "step": 49300 }, { "entropy": 5.253828048706055, "epoch": 4.873962040332147, "grad_norm": 1.1171875, "learning_rate": 0.000287493283154511, "loss": 4.71, "mean_token_accuracy": 0.24877531826496124, "num_tokens": 112934332.0, "step": 49305 }, { "entropy": 5.155717992782593, "epoch": 4.874456306840648, "grad_norm": 1.1171875, "learning_rate": 0.0002874580474619411, "loss": 4.6077, "mean_token_accuracy": 0.25729099065065386, "num_tokens": 112944630.0, "step": 49310 }, { "entropy": 5.331550645828247, "epoch": 4.87495057334915, "grad_norm": 0.94140625, "learning_rate": 0.0002874228114629014, "loss": 4.8033, "mean_token_accuracy": 0.23569670021533967, "num_tokens": 112957589.0, "step": 49315 }, { "entropy": 5.276178026199341, "epoch": 4.875444839857651, "grad_norm": 1.0390625, "learning_rate": 0.0002873875751582586, "loss": 4.6638, "mean_token_accuracy": 0.25598849207162855, "num_tokens": 112969052.0, "step": 49320 }, { "entropy": 5.34690146446228, "epoch": 4.875939106366152, "grad_norm": 1.1484375, "learning_rate": 0.0002873523385488794, "loss": 4.7247, "mean_token_accuracy": 0.24402555972337722, "num_tokens": 112979578.0, "step": 49325 }, { "entropy": 5.257665824890137, "epoch": 4.876433372874654, "grad_norm": 1.0078125, "learning_rate": 0.00028731710163563083, "loss": 4.6882, "mean_token_accuracy": 0.25076579451560976, "num_tokens": 112991353.0, "step": 49330 }, { "entropy": 5.349025869369507, "epoch": 4.8769276393831555, "grad_norm": 1.0546875, "learning_rate": 0.0002872818644193797, "loss": 4.8899, "mean_token_accuracy": 0.22343920022249222, "num_tokens": 113003918.0, "step": 49335 }, { "entropy": 5.3286761283874515, "epoch": 4.877421905891657, "grad_norm": 1.1015625, "learning_rate": 0.0002872466269009927, "loss": 4.8093, "mean_token_accuracy": 0.24271639585494995, "num_tokens": 113015251.0, "step": 49340 }, { "entropy": 5.3037477970123295, "epoch": 4.877916172400158, "grad_norm": 1.2734375, "learning_rate": 0.00028721138908133686, "loss": 4.6811, "mean_token_accuracy": 0.24615575522184371, "num_tokens": 113027076.0, "step": 49345 }, { "entropy": 5.374721908569336, "epoch": 4.878410438908659, "grad_norm": 1.140625, "learning_rate": 0.00028717615096127895, "loss": 4.8398, "mean_token_accuracy": 0.2352509990334511, "num_tokens": 113037622.0, "step": 49350 }, { "entropy": 5.362245750427246, "epoch": 4.878904705417161, "grad_norm": 1.0546875, "learning_rate": 0.00028714091254168574, "loss": 4.7421, "mean_token_accuracy": 0.24684743583202362, "num_tokens": 113048687.0, "step": 49355 }, { "entropy": 5.405386257171631, "epoch": 4.879398971925662, "grad_norm": 1.171875, "learning_rate": 0.00028710567382342426, "loss": 4.8847, "mean_token_accuracy": 0.23554971367120742, "num_tokens": 113060185.0, "step": 49360 }, { "entropy": 5.403331613540649, "epoch": 4.879893238434164, "grad_norm": 0.97265625, "learning_rate": 0.0002870704348073614, "loss": 4.8676, "mean_token_accuracy": 0.22987281680107116, "num_tokens": 113072743.0, "step": 49365 }, { "entropy": 5.357410478591919, "epoch": 4.880387504942665, "grad_norm": 1.1875, "learning_rate": 0.00028703519549436385, "loss": 4.8162, "mean_token_accuracy": 0.24000786989927292, "num_tokens": 113082990.0, "step": 49370 }, { "entropy": 5.407936906814575, "epoch": 4.8808817714511665, "grad_norm": 1.0703125, "learning_rate": 0.0002869999558852988, "loss": 4.7959, "mean_token_accuracy": 0.23288584500551224, "num_tokens": 113094316.0, "step": 49375 }, { "entropy": 5.312694931030274, "epoch": 4.881376037959668, "grad_norm": 1.0703125, "learning_rate": 0.0002869647159810327, "loss": 4.7777, "mean_token_accuracy": 0.2395765706896782, "num_tokens": 113105297.0, "step": 49380 }, { "entropy": 5.259246683120727, "epoch": 4.881870304468169, "grad_norm": 1.1484375, "learning_rate": 0.00028692947578243293, "loss": 4.6747, "mean_token_accuracy": 0.25164640992879866, "num_tokens": 113116851.0, "step": 49385 }, { "entropy": 5.287169933319092, "epoch": 4.88236457097667, "grad_norm": 1.140625, "learning_rate": 0.0002868942352903662, "loss": 4.6849, "mean_token_accuracy": 0.247382315993309, "num_tokens": 113127429.0, "step": 49390 }, { "entropy": 5.341093397140503, "epoch": 4.882858837485172, "grad_norm": 1.078125, "learning_rate": 0.0002868589945056994, "loss": 4.8025, "mean_token_accuracy": 0.23960017412900925, "num_tokens": 113140173.0, "step": 49395 }, { "entropy": 5.340591096878052, "epoch": 4.883353103993674, "grad_norm": 1.1171875, "learning_rate": 0.0002868237534292995, "loss": 4.7571, "mean_token_accuracy": 0.2454898864030838, "num_tokens": 113151147.0, "step": 49400 }, { "entropy": 5.312473201751709, "epoch": 4.883847370502175, "grad_norm": 1.015625, "learning_rate": 0.0002867885120620334, "loss": 4.7596, "mean_token_accuracy": 0.23275334239006043, "num_tokens": 113163308.0, "step": 49405 }, { "entropy": 5.388097047805786, "epoch": 4.884341637010676, "grad_norm": 1.1796875, "learning_rate": 0.0002867532704047681, "loss": 4.811, "mean_token_accuracy": 0.2358394980430603, "num_tokens": 113174405.0, "step": 49410 }, { "entropy": 5.305378389358521, "epoch": 4.8848359035191775, "grad_norm": 1.1171875, "learning_rate": 0.0002867180284583705, "loss": 4.7638, "mean_token_accuracy": 0.2463487505912781, "num_tokens": 113186662.0, "step": 49415 }, { "entropy": 5.222087001800537, "epoch": 4.885330170027679, "grad_norm": 1.0703125, "learning_rate": 0.00028668278622370763, "loss": 4.6893, "mean_token_accuracy": 0.25675798803567884, "num_tokens": 113198489.0, "step": 49420 }, { "entropy": 5.267529773712158, "epoch": 4.88582443653618, "grad_norm": 1.015625, "learning_rate": 0.0002866475437016464, "loss": 4.7775, "mean_token_accuracy": 0.2387880340218544, "num_tokens": 113210238.0, "step": 49425 }, { "entropy": 5.231282091140747, "epoch": 4.886318703044681, "grad_norm": 1.0859375, "learning_rate": 0.00028661230089305375, "loss": 4.7293, "mean_token_accuracy": 0.25132726430892943, "num_tokens": 113222008.0, "step": 49430 }, { "entropy": 5.309350633621216, "epoch": 4.8868129695531834, "grad_norm": 1.109375, "learning_rate": 0.0002865770577987967, "loss": 4.7465, "mean_token_accuracy": 0.24474303126335145, "num_tokens": 113234187.0, "step": 49435 }, { "entropy": 5.284567785263062, "epoch": 4.887307236061685, "grad_norm": 1.0546875, "learning_rate": 0.0002865418144197423, "loss": 4.7078, "mean_token_accuracy": 0.24858200699090957, "num_tokens": 113246418.0, "step": 49440 }, { "entropy": 5.268226909637451, "epoch": 4.887801502570186, "grad_norm": 1.09375, "learning_rate": 0.00028650657075675735, "loss": 4.7389, "mean_token_accuracy": 0.2432554006576538, "num_tokens": 113256561.0, "step": 49445 }, { "entropy": 5.2300232410430905, "epoch": 4.888295769078687, "grad_norm": 1.0703125, "learning_rate": 0.0002864713268107091, "loss": 4.7214, "mean_token_accuracy": 0.24410807639360427, "num_tokens": 113269145.0, "step": 49450 }, { "entropy": 5.317406368255615, "epoch": 4.8887900355871885, "grad_norm": 1.046875, "learning_rate": 0.0002864360825824643, "loss": 4.6966, "mean_token_accuracy": 0.2400673508644104, "num_tokens": 113280545.0, "step": 49455 }, { "entropy": 5.360315036773682, "epoch": 4.88928430209569, "grad_norm": 1.0859375, "learning_rate": 0.0002864008380728902, "loss": 4.7741, "mean_token_accuracy": 0.23919316828250886, "num_tokens": 113292276.0, "step": 49460 }, { "entropy": 5.327405405044556, "epoch": 4.889778568604191, "grad_norm": 1.03125, "learning_rate": 0.00028636559328285374, "loss": 4.7988, "mean_token_accuracy": 0.24030589759349824, "num_tokens": 113304486.0, "step": 49465 }, { "entropy": 5.293850564956665, "epoch": 4.890272835112693, "grad_norm": 1.015625, "learning_rate": 0.00028633034821322177, "loss": 4.7889, "mean_token_accuracy": 0.2375386029481888, "num_tokens": 113316374.0, "step": 49470 }, { "entropy": 5.326796388626098, "epoch": 4.890767101621194, "grad_norm": 1.109375, "learning_rate": 0.0002862951028648616, "loss": 4.6814, "mean_token_accuracy": 0.25092357099056245, "num_tokens": 113327151.0, "step": 49475 }, { "entropy": 5.2654616355896, "epoch": 4.891261368129696, "grad_norm": 1.265625, "learning_rate": 0.0002862598572386402, "loss": 4.7186, "mean_token_accuracy": 0.24975292533636093, "num_tokens": 113336314.0, "step": 49480 }, { "entropy": 5.2583558559417725, "epoch": 4.891755634638197, "grad_norm": 1.1015625, "learning_rate": 0.00028622461133542436, "loss": 4.7655, "mean_token_accuracy": 0.24132770746946336, "num_tokens": 113346671.0, "step": 49485 }, { "entropy": 5.3594717502594, "epoch": 4.892249901146698, "grad_norm": 1.140625, "learning_rate": 0.0002861893651560816, "loss": 4.802, "mean_token_accuracy": 0.23596129715442657, "num_tokens": 113357781.0, "step": 49490 }, { "entropy": 5.354639911651612, "epoch": 4.8927441676551995, "grad_norm": 1.046875, "learning_rate": 0.0002861541187014785, "loss": 4.7705, "mean_token_accuracy": 0.23772717416286468, "num_tokens": 113369691.0, "step": 49495 }, { "entropy": 5.337215089797974, "epoch": 4.893238434163701, "grad_norm": 1.1171875, "learning_rate": 0.0002861188719724824, "loss": 4.788, "mean_token_accuracy": 0.23657918572425843, "num_tokens": 113381586.0, "step": 49500 }, { "entropy": 5.327420473098755, "epoch": 4.893732700672203, "grad_norm": 1.046875, "learning_rate": 0.00028608362496996046, "loss": 4.7664, "mean_token_accuracy": 0.24548042565584183, "num_tokens": 113393551.0, "step": 49505 }, { "entropy": 5.3597653865814205, "epoch": 4.894226967180704, "grad_norm": 1.0390625, "learning_rate": 0.0002860483776947795, "loss": 4.7087, "mean_token_accuracy": 0.245390784740448, "num_tokens": 113404615.0, "step": 49510 }, { "entropy": 5.263274049758911, "epoch": 4.894721233689205, "grad_norm": 1.1015625, "learning_rate": 0.00028601313014780676, "loss": 4.7354, "mean_token_accuracy": 0.24507710784673692, "num_tokens": 113416186.0, "step": 49515 }, { "entropy": 5.285714721679687, "epoch": 4.895215500197707, "grad_norm": 1.03125, "learning_rate": 0.0002859778823299093, "loss": 4.7567, "mean_token_accuracy": 0.2394578590989113, "num_tokens": 113428037.0, "step": 49520 }, { "entropy": 5.313170289993286, "epoch": 4.895709766706208, "grad_norm": 1.3203125, "learning_rate": 0.0002859426342419543, "loss": 4.7032, "mean_token_accuracy": 0.25302412658929824, "num_tokens": 113439020.0, "step": 49525 }, { "entropy": 5.389795303344727, "epoch": 4.896204033214709, "grad_norm": 1.1171875, "learning_rate": 0.0002859073858848087, "loss": 4.8292, "mean_token_accuracy": 0.23545354306697847, "num_tokens": 113451060.0, "step": 49530 }, { "entropy": 5.369742202758789, "epoch": 4.8966982997232105, "grad_norm": 0.9921875, "learning_rate": 0.00028587213725933975, "loss": 4.7897, "mean_token_accuracy": 0.23918466717004777, "num_tokens": 113463485.0, "step": 49535 }, { "entropy": 5.258606386184693, "epoch": 4.897192566231713, "grad_norm": 1.0859375, "learning_rate": 0.0002858368883664146, "loss": 4.7244, "mean_token_accuracy": 0.24567676931619645, "num_tokens": 113476259.0, "step": 49540 }, { "entropy": 5.384962558746338, "epoch": 4.897686832740214, "grad_norm": 1.0625, "learning_rate": 0.00028580163920690016, "loss": 4.8406, "mean_token_accuracy": 0.23846709728240967, "num_tokens": 113487957.0, "step": 49545 }, { "entropy": 5.37954478263855, "epoch": 4.898181099248715, "grad_norm": 1.0859375, "learning_rate": 0.0002857663897816639, "loss": 4.8426, "mean_token_accuracy": 0.22913991361856462, "num_tokens": 113500066.0, "step": 49550 }, { "entropy": 5.242548942565918, "epoch": 4.898675365757216, "grad_norm": 0.99609375, "learning_rate": 0.0002857311400915726, "loss": 4.6223, "mean_token_accuracy": 0.2505697444081306, "num_tokens": 113511032.0, "step": 49555 }, { "entropy": 5.227991104125977, "epoch": 4.899169632265718, "grad_norm": 1.0390625, "learning_rate": 0.00028569589013749375, "loss": 4.6506, "mean_token_accuracy": 0.25645952820777895, "num_tokens": 113522472.0, "step": 49560 }, { "entropy": 5.265258693695069, "epoch": 4.899663898774219, "grad_norm": 1.046875, "learning_rate": 0.0002856606399202943, "loss": 4.7724, "mean_token_accuracy": 0.24356948733329772, "num_tokens": 113534841.0, "step": 49565 }, { "entropy": 5.371298837661743, "epoch": 4.90015816528272, "grad_norm": 1.046875, "learning_rate": 0.00028562538944084135, "loss": 4.8013, "mean_token_accuracy": 0.2401801809668541, "num_tokens": 113545659.0, "step": 49570 }, { "entropy": 5.327930641174317, "epoch": 4.9006524317912215, "grad_norm": 1.140625, "learning_rate": 0.0002855901387000023, "loss": 4.7943, "mean_token_accuracy": 0.24638112783432006, "num_tokens": 113557293.0, "step": 49575 }, { "entropy": 5.33608717918396, "epoch": 4.901146698299723, "grad_norm": 1.0546875, "learning_rate": 0.0002855548876986442, "loss": 4.7716, "mean_token_accuracy": 0.2386688694357872, "num_tokens": 113568270.0, "step": 49580 }, { "entropy": 5.319252395629883, "epoch": 4.901640964808225, "grad_norm": 1.03125, "learning_rate": 0.0002855196364376341, "loss": 4.7423, "mean_token_accuracy": 0.24117294549942017, "num_tokens": 113579838.0, "step": 49585 }, { "entropy": 5.355424642562866, "epoch": 4.902135231316726, "grad_norm": 1.09375, "learning_rate": 0.0002854843849178395, "loss": 4.7932, "mean_token_accuracy": 0.2510181665420532, "num_tokens": 113590817.0, "step": 49590 }, { "entropy": 5.311360168457031, "epoch": 4.902629497825227, "grad_norm": 1.2578125, "learning_rate": 0.0002854491331401273, "loss": 4.7369, "mean_token_accuracy": 0.2474435031414032, "num_tokens": 113602912.0, "step": 49595 }, { "entropy": 5.301824474334717, "epoch": 4.903123764333729, "grad_norm": 1.0546875, "learning_rate": 0.0002854138811053647, "loss": 4.7503, "mean_token_accuracy": 0.23851701319217683, "num_tokens": 113613508.0, "step": 49600 }, { "entropy": 5.321084499359131, "epoch": 4.90361803084223, "grad_norm": 1.0859375, "learning_rate": 0.00028537862881441913, "loss": 4.8145, "mean_token_accuracy": 0.23915353119373323, "num_tokens": 113625221.0, "step": 49605 }, { "entropy": 5.260891580581665, "epoch": 4.904112297350731, "grad_norm": 1.1171875, "learning_rate": 0.0002853433762681577, "loss": 4.6855, "mean_token_accuracy": 0.2459561988711357, "num_tokens": 113636367.0, "step": 49610 }, { "entropy": 5.347170448303222, "epoch": 4.904606563859232, "grad_norm": 1.0390625, "learning_rate": 0.00028530812346744754, "loss": 4.7939, "mean_token_accuracy": 0.2380167782306671, "num_tokens": 113648667.0, "step": 49615 }, { "entropy": 5.3389623165130615, "epoch": 4.905100830367735, "grad_norm": 1.09375, "learning_rate": 0.000285272870413156, "loss": 4.7857, "mean_token_accuracy": 0.2460715651512146, "num_tokens": 113659331.0, "step": 49620 }, { "entropy": 5.275571393966675, "epoch": 4.905595096876236, "grad_norm": 1.0703125, "learning_rate": 0.00028523761710615023, "loss": 4.7191, "mean_token_accuracy": 0.2473654940724373, "num_tokens": 113669874.0, "step": 49625 }, { "entropy": 5.388087368011474, "epoch": 4.906089363384737, "grad_norm": 1.3671875, "learning_rate": 0.0002852023635472974, "loss": 4.798, "mean_token_accuracy": 0.23344703912734985, "num_tokens": 113681626.0, "step": 49630 }, { "entropy": 5.366983699798584, "epoch": 4.906583629893238, "grad_norm": 1.0859375, "learning_rate": 0.000285167109737465, "loss": 4.8252, "mean_token_accuracy": 0.23522439152002333, "num_tokens": 113692778.0, "step": 49635 }, { "entropy": 5.30156569480896, "epoch": 4.90707789640174, "grad_norm": 1.046875, "learning_rate": 0.00028513185567752004, "loss": 4.7634, "mean_token_accuracy": 0.2458128958940506, "num_tokens": 113704061.0, "step": 49640 }, { "entropy": 5.267050552368164, "epoch": 4.907572162910241, "grad_norm": 1.1796875, "learning_rate": 0.00028509660136832984, "loss": 4.6907, "mean_token_accuracy": 0.25127614140510557, "num_tokens": 113715184.0, "step": 49645 }, { "entropy": 5.311280107498169, "epoch": 4.908066429418742, "grad_norm": 1.0234375, "learning_rate": 0.0002850613468107617, "loss": 4.7922, "mean_token_accuracy": 0.24252779632806779, "num_tokens": 113726987.0, "step": 49650 }, { "entropy": 5.343241739273071, "epoch": 4.908560695927244, "grad_norm": 1.0859375, "learning_rate": 0.000285026092005683, "loss": 4.8135, "mean_token_accuracy": 0.24315719455480575, "num_tokens": 113738516.0, "step": 49655 }, { "entropy": 5.410608434677124, "epoch": 4.909054962435746, "grad_norm": 1.1171875, "learning_rate": 0.0002849908369539607, "loss": 4.9316, "mean_token_accuracy": 0.22704224288463593, "num_tokens": 113750087.0, "step": 49660 }, { "entropy": 5.209540367126465, "epoch": 4.909549228944247, "grad_norm": 1.1171875, "learning_rate": 0.0002849555816564623, "loss": 4.5778, "mean_token_accuracy": 0.265383717417717, "num_tokens": 113760837.0, "step": 49665 }, { "entropy": 5.379271125793457, "epoch": 4.910043495452748, "grad_norm": 1.2734375, "learning_rate": 0.00028492032611405506, "loss": 4.7592, "mean_token_accuracy": 0.24567826837301254, "num_tokens": 113770496.0, "step": 49670 }, { "entropy": 5.367253255844116, "epoch": 4.910537761961249, "grad_norm": 1.1796875, "learning_rate": 0.0002848850703276062, "loss": 4.8232, "mean_token_accuracy": 0.22899519205093383, "num_tokens": 113781720.0, "step": 49675 }, { "entropy": 5.264127540588379, "epoch": 4.911032028469751, "grad_norm": 1.0234375, "learning_rate": 0.00028484981429798326, "loss": 4.6813, "mean_token_accuracy": 0.2499254435300827, "num_tokens": 113793140.0, "step": 49680 }, { "entropy": 5.360173749923706, "epoch": 4.911526294978252, "grad_norm": 1.1328125, "learning_rate": 0.0002848145580260532, "loss": 4.7979, "mean_token_accuracy": 0.23284406810998917, "num_tokens": 113804584.0, "step": 49685 }, { "entropy": 5.24306583404541, "epoch": 4.912020561486754, "grad_norm": 1.015625, "learning_rate": 0.0002847793015126835, "loss": 4.6993, "mean_token_accuracy": 0.2432761088013649, "num_tokens": 113815701.0, "step": 49690 }, { "entropy": 5.222919034957886, "epoch": 4.912514827995255, "grad_norm": 1.0703125, "learning_rate": 0.00028474404475874155, "loss": 4.6622, "mean_token_accuracy": 0.24375876486301423, "num_tokens": 113826878.0, "step": 49695 }, { "entropy": 5.2538676261901855, "epoch": 4.913009094503757, "grad_norm": 1.109375, "learning_rate": 0.0002847087877650946, "loss": 4.7182, "mean_token_accuracy": 0.24917463213205338, "num_tokens": 113837320.0, "step": 49700 }, { "entropy": 5.43332200050354, "epoch": 4.913503361012258, "grad_norm": 1.046875, "learning_rate": 0.0002846735305326098, "loss": 4.9525, "mean_token_accuracy": 0.2239035874605179, "num_tokens": 113849460.0, "step": 49705 }, { "entropy": 5.266210746765137, "epoch": 4.913997627520759, "grad_norm": 1.1640625, "learning_rate": 0.0002846382730621548, "loss": 4.6904, "mean_token_accuracy": 0.2523275300860405, "num_tokens": 113860998.0, "step": 49710 }, { "entropy": 5.290461540222168, "epoch": 4.91449189402926, "grad_norm": 1.0859375, "learning_rate": 0.0002846030153545967, "loss": 4.7344, "mean_token_accuracy": 0.24110435992479323, "num_tokens": 113873100.0, "step": 49715 }, { "entropy": 5.328704118728638, "epoch": 4.914986160537762, "grad_norm": 1.046875, "learning_rate": 0.00028456775741080297, "loss": 4.8315, "mean_token_accuracy": 0.229140405356884, "num_tokens": 113885444.0, "step": 49720 }, { "entropy": 5.325035476684571, "epoch": 4.915480427046264, "grad_norm": 1.109375, "learning_rate": 0.00028453249923164094, "loss": 4.7748, "mean_token_accuracy": 0.23890559673309325, "num_tokens": 113897198.0, "step": 49725 }, { "entropy": 5.351389646530151, "epoch": 4.915974693554765, "grad_norm": 1.1171875, "learning_rate": 0.00028449724081797796, "loss": 4.7759, "mean_token_accuracy": 0.24213607460260392, "num_tokens": 113908436.0, "step": 49730 }, { "entropy": 5.358146095275879, "epoch": 4.916468960063266, "grad_norm": 1.0859375, "learning_rate": 0.00028446198217068133, "loss": 4.8241, "mean_token_accuracy": 0.23938765078783036, "num_tokens": 113918955.0, "step": 49735 }, { "entropy": 5.274000930786133, "epoch": 4.9169632265717675, "grad_norm": 1.1171875, "learning_rate": 0.00028442672329061854, "loss": 4.7839, "mean_token_accuracy": 0.24640340805053712, "num_tokens": 113931299.0, "step": 49740 }, { "entropy": 5.327531242370606, "epoch": 4.917457493080269, "grad_norm": 1.046875, "learning_rate": 0.0002843914641786568, "loss": 4.7768, "mean_token_accuracy": 0.239276285469532, "num_tokens": 113942396.0, "step": 49745 }, { "entropy": 5.365940570831299, "epoch": 4.91795175958877, "grad_norm": 1.1328125, "learning_rate": 0.00028435620483566366, "loss": 4.7848, "mean_token_accuracy": 0.23703458309173583, "num_tokens": 113953815.0, "step": 49750 }, { "entropy": 5.370501327514648, "epoch": 4.918446026097271, "grad_norm": 1.0546875, "learning_rate": 0.0002843209452625064, "loss": 4.8282, "mean_token_accuracy": 0.2419566184282303, "num_tokens": 113965567.0, "step": 49755 }, { "entropy": 5.312122631072998, "epoch": 4.9189402926057735, "grad_norm": 1.03125, "learning_rate": 0.0002842856854600524, "loss": 4.7944, "mean_token_accuracy": 0.24046526998281478, "num_tokens": 113977350.0, "step": 49760 }, { "entropy": 5.389744901657105, "epoch": 4.919434559114275, "grad_norm": 1.109375, "learning_rate": 0.00028425042542916916, "loss": 4.8793, "mean_token_accuracy": 0.23093685358762742, "num_tokens": 113987997.0, "step": 49765 }, { "entropy": 5.271676969528198, "epoch": 4.919928825622776, "grad_norm": 1.109375, "learning_rate": 0.00028421516517072404, "loss": 4.6561, "mean_token_accuracy": 0.2459659531712532, "num_tokens": 113998754.0, "step": 49770 }, { "entropy": 5.298133897781372, "epoch": 4.920423092131277, "grad_norm": 1.0625, "learning_rate": 0.00028417990468558433, "loss": 4.7489, "mean_token_accuracy": 0.2423016145825386, "num_tokens": 114009619.0, "step": 49775 }, { "entropy": 5.2624499797821045, "epoch": 4.9209173586397785, "grad_norm": 1.171875, "learning_rate": 0.0002841446439746176, "loss": 4.6775, "mean_token_accuracy": 0.24939918518066406, "num_tokens": 114020581.0, "step": 49780 }, { "entropy": 5.296330881118775, "epoch": 4.92141162514828, "grad_norm": 1.0546875, "learning_rate": 0.00028410938303869126, "loss": 4.731, "mean_token_accuracy": 0.24700694978237153, "num_tokens": 114031796.0, "step": 49785 }, { "entropy": 5.340845680236816, "epoch": 4.921905891656781, "grad_norm": 1.1328125, "learning_rate": 0.0002840741218786726, "loss": 4.781, "mean_token_accuracy": 0.2402311623096466, "num_tokens": 114042125.0, "step": 49790 }, { "entropy": 5.310670661926269, "epoch": 4.922400158165283, "grad_norm": 1.0078125, "learning_rate": 0.0002840388604954292, "loss": 4.779, "mean_token_accuracy": 0.24056896716356277, "num_tokens": 114054546.0, "step": 49795 }, { "entropy": 5.346387481689453, "epoch": 4.9228944246737845, "grad_norm": 1.2578125, "learning_rate": 0.0002840035988898284, "loss": 4.7561, "mean_token_accuracy": 0.24700016677379608, "num_tokens": 114065290.0, "step": 49800 }, { "entropy": 5.354505634307861, "epoch": 4.923388691182286, "grad_norm": 1.078125, "learning_rate": 0.0002839683370627377, "loss": 4.7458, "mean_token_accuracy": 0.2420007824897766, "num_tokens": 114075560.0, "step": 49805 }, { "entropy": 5.216576862335205, "epoch": 4.923882957690787, "grad_norm": 1.0234375, "learning_rate": 0.0002839330750150244, "loss": 4.6082, "mean_token_accuracy": 0.2546635553240776, "num_tokens": 114086806.0, "step": 49810 }, { "entropy": 5.254082202911377, "epoch": 4.924377224199288, "grad_norm": 1.078125, "learning_rate": 0.00028389781274755624, "loss": 4.7703, "mean_token_accuracy": 0.24628224074840546, "num_tokens": 114098204.0, "step": 49815 }, { "entropy": 5.290704011917114, "epoch": 4.9248714907077895, "grad_norm": 0.93359375, "learning_rate": 0.0002838625502612004, "loss": 4.7604, "mean_token_accuracy": 0.2427856668829918, "num_tokens": 114111331.0, "step": 49820 }, { "entropy": 5.335913801193238, "epoch": 4.925365757216291, "grad_norm": 1.078125, "learning_rate": 0.00028382728755682444, "loss": 4.8057, "mean_token_accuracy": 0.24688946455717087, "num_tokens": 114122878.0, "step": 49825 }, { "entropy": 5.347719001770019, "epoch": 4.925860023724792, "grad_norm": 1.109375, "learning_rate": 0.00028379202463529586, "loss": 4.7372, "mean_token_accuracy": 0.24019323885440827, "num_tokens": 114133320.0, "step": 49830 }, { "entropy": 5.272241115570068, "epoch": 4.926354290233293, "grad_norm": 1.0859375, "learning_rate": 0.00028375676149748207, "loss": 4.7131, "mean_token_accuracy": 0.2450934201478958, "num_tokens": 114145975.0, "step": 49835 }, { "entropy": 5.310037422180176, "epoch": 4.9268485567417954, "grad_norm": 1.0859375, "learning_rate": 0.0002837214981442507, "loss": 4.7688, "mean_token_accuracy": 0.2351676270365715, "num_tokens": 114156812.0, "step": 49840 }, { "entropy": 5.346796464920044, "epoch": 4.927342823250297, "grad_norm": 1.15625, "learning_rate": 0.0002836862345764691, "loss": 4.8378, "mean_token_accuracy": 0.23633658438920974, "num_tokens": 114169009.0, "step": 49845 }, { "entropy": 5.293643045425415, "epoch": 4.927837089758798, "grad_norm": 1.0625, "learning_rate": 0.00028365097079500475, "loss": 4.7127, "mean_token_accuracy": 0.24444656521081926, "num_tokens": 114181427.0, "step": 49850 }, { "entropy": 5.342588138580322, "epoch": 4.928331356267299, "grad_norm": 1.0703125, "learning_rate": 0.00028361570680072507, "loss": 4.8143, "mean_token_accuracy": 0.23126609325408937, "num_tokens": 114192427.0, "step": 49855 }, { "entropy": 5.304003381729126, "epoch": 4.9288256227758005, "grad_norm": 1.09375, "learning_rate": 0.00028358044259449785, "loss": 4.6964, "mean_token_accuracy": 0.25085282772779466, "num_tokens": 114202914.0, "step": 49860 }, { "entropy": 5.265294933319092, "epoch": 4.929319889284302, "grad_norm": 1.0703125, "learning_rate": 0.00028354517817719024, "loss": 4.7222, "mean_token_accuracy": 0.253849059343338, "num_tokens": 114214359.0, "step": 49865 }, { "entropy": 5.356111240386963, "epoch": 4.929814155792803, "grad_norm": 1.1875, "learning_rate": 0.00028350991354967003, "loss": 4.8928, "mean_token_accuracy": 0.23981594741344453, "num_tokens": 114225766.0, "step": 49870 }, { "entropy": 5.311764764785766, "epoch": 4.930308422301305, "grad_norm": 1.0390625, "learning_rate": 0.0002834746487128046, "loss": 4.792, "mean_token_accuracy": 0.24154099076986313, "num_tokens": 114236488.0, "step": 49875 }, { "entropy": 5.373332452774048, "epoch": 4.930802688809806, "grad_norm": 0.9921875, "learning_rate": 0.0002834393836674615, "loss": 4.7717, "mean_token_accuracy": 0.24039449840784072, "num_tokens": 114248524.0, "step": 49880 }, { "entropy": 5.278536939620972, "epoch": 4.931296955318308, "grad_norm": 1.09375, "learning_rate": 0.0002834041184145082, "loss": 4.6949, "mean_token_accuracy": 0.2545274317264557, "num_tokens": 114260523.0, "step": 49885 }, { "entropy": 5.2788115501403805, "epoch": 4.931791221826809, "grad_norm": 1.0390625, "learning_rate": 0.0002833688529548124, "loss": 4.6799, "mean_token_accuracy": 0.25112665444612503, "num_tokens": 114272150.0, "step": 49890 }, { "entropy": 5.340403127670288, "epoch": 4.93228548833531, "grad_norm": 1.0859375, "learning_rate": 0.0002833335872892414, "loss": 4.8311, "mean_token_accuracy": 0.22969332784414292, "num_tokens": 114284127.0, "step": 49895 }, { "entropy": 5.392646455764771, "epoch": 4.9327797548438115, "grad_norm": 1.1875, "learning_rate": 0.0002832983214186629, "loss": 4.8666, "mean_token_accuracy": 0.2279591828584671, "num_tokens": 114295995.0, "step": 49900 }, { "entropy": 5.356379556655884, "epoch": 4.933274021352313, "grad_norm": 1.046875, "learning_rate": 0.0002832630553439444, "loss": 4.811, "mean_token_accuracy": 0.23557477295398713, "num_tokens": 114307148.0, "step": 49905 }, { "entropy": 5.290843200683594, "epoch": 4.933768287860815, "grad_norm": 0.984375, "learning_rate": 0.0002832277890659535, "loss": 4.782, "mean_token_accuracy": 0.24368538409471513, "num_tokens": 114319062.0, "step": 49910 }, { "entropy": 5.307108974456787, "epoch": 4.934262554369316, "grad_norm": 1.125, "learning_rate": 0.0002831925225855577, "loss": 4.76, "mean_token_accuracy": 0.24089347422122956, "num_tokens": 114330958.0, "step": 49915 }, { "entropy": 5.377454710006714, "epoch": 4.934756820877817, "grad_norm": 1.09375, "learning_rate": 0.0002831572559036245, "loss": 4.7977, "mean_token_accuracy": 0.237497878074646, "num_tokens": 114342249.0, "step": 49920 }, { "entropy": 5.375114965438843, "epoch": 4.935251087386319, "grad_norm": 1.09375, "learning_rate": 0.00028312198902102166, "loss": 4.7567, "mean_token_accuracy": 0.2400498330593109, "num_tokens": 114352834.0, "step": 49925 }, { "entropy": 5.3903693675994875, "epoch": 4.93574535389482, "grad_norm": 1.0703125, "learning_rate": 0.0002830867219386166, "loss": 4.8307, "mean_token_accuracy": 0.23860280811786652, "num_tokens": 114364397.0, "step": 49930 }, { "entropy": 5.22853364944458, "epoch": 4.936239620403321, "grad_norm": 1.15625, "learning_rate": 0.0002830514546572768, "loss": 4.6575, "mean_token_accuracy": 0.251353320479393, "num_tokens": 114375588.0, "step": 49935 }, { "entropy": 5.346378421783447, "epoch": 4.9367338869118225, "grad_norm": 0.953125, "learning_rate": 0.00028301618717787013, "loss": 4.836, "mean_token_accuracy": 0.2328450486063957, "num_tokens": 114387467.0, "step": 49940 }, { "entropy": 5.331255340576172, "epoch": 4.937228153420325, "grad_norm": 1.03125, "learning_rate": 0.0002829809195012639, "loss": 4.7925, "mean_token_accuracy": 0.23751590847969056, "num_tokens": 114399024.0, "step": 49945 }, { "entropy": 5.273663949966431, "epoch": 4.937722419928826, "grad_norm": 1.1484375, "learning_rate": 0.00028294565162832584, "loss": 4.7181, "mean_token_accuracy": 0.24400398433208464, "num_tokens": 114409441.0, "step": 49950 }, { "entropy": 5.285363435745239, "epoch": 4.938216686437327, "grad_norm": 1.078125, "learning_rate": 0.00028291038355992356, "loss": 4.7091, "mean_token_accuracy": 0.24822520911693574, "num_tokens": 114422033.0, "step": 49955 }, { "entropy": 5.325929641723633, "epoch": 4.938710952945828, "grad_norm": 1.015625, "learning_rate": 0.00028287511529692465, "loss": 4.6959, "mean_token_accuracy": 0.2509312450885773, "num_tokens": 114432850.0, "step": 49960 }, { "entropy": 5.370437908172607, "epoch": 4.93920521945433, "grad_norm": 1.0625, "learning_rate": 0.0002828398468401966, "loss": 4.8035, "mean_token_accuracy": 0.2407582923769951, "num_tokens": 114444381.0, "step": 49965 }, { "entropy": 5.327160406112671, "epoch": 4.939699485962831, "grad_norm": 1.0859375, "learning_rate": 0.00028280457819060704, "loss": 4.7876, "mean_token_accuracy": 0.24370415955781938, "num_tokens": 114456052.0, "step": 49970 }, { "entropy": 5.301059770584106, "epoch": 4.940193752471332, "grad_norm": 1.1875, "learning_rate": 0.00028276930934902376, "loss": 4.6919, "mean_token_accuracy": 0.25045703202486036, "num_tokens": 114466933.0, "step": 49975 }, { "entropy": 5.299062585830688, "epoch": 4.940688018979834, "grad_norm": 1.125, "learning_rate": 0.0002827340403163143, "loss": 4.7649, "mean_token_accuracy": 0.23846931308507918, "num_tokens": 114478688.0, "step": 49980 }, { "entropy": 5.352247095108032, "epoch": 4.941182285488336, "grad_norm": 1.0546875, "learning_rate": 0.0002826987710933462, "loss": 4.78, "mean_token_accuracy": 0.2397884398698807, "num_tokens": 114489655.0, "step": 49985 }, { "entropy": 5.302749824523926, "epoch": 4.941676551996837, "grad_norm": 1.015625, "learning_rate": 0.00028266350168098706, "loss": 4.6701, "mean_token_accuracy": 0.2521473690867424, "num_tokens": 114500791.0, "step": 49990 }, { "entropy": 5.34368200302124, "epoch": 4.942170818505338, "grad_norm": 1.0546875, "learning_rate": 0.00028262823208010464, "loss": 4.8328, "mean_token_accuracy": 0.23764526546001435, "num_tokens": 114513562.0, "step": 49995 }, { "entropy": 5.322977495193482, "epoch": 4.942665085013839, "grad_norm": 1.0078125, "learning_rate": 0.0002825929622915665, "loss": 4.7974, "mean_token_accuracy": 0.23670391291379927, "num_tokens": 114524973.0, "step": 50000 }, { "entropy": 5.3892374515533445, "epoch": 4.943159351522341, "grad_norm": 1.0703125, "learning_rate": 0.0002825576923162404, "loss": 4.7813, "mean_token_accuracy": 0.23928794115781785, "num_tokens": 114536511.0, "step": 50005 }, { "entropy": 5.40794882774353, "epoch": 4.943653618030842, "grad_norm": 0.97265625, "learning_rate": 0.00028252242215499385, "loss": 4.8505, "mean_token_accuracy": 0.23178610801696778, "num_tokens": 114548544.0, "step": 50010 }, { "entropy": 5.3340456008911135, "epoch": 4.944147884539344, "grad_norm": 1.171875, "learning_rate": 0.00028248715180869457, "loss": 4.7292, "mean_token_accuracy": 0.24611633270978928, "num_tokens": 114559759.0, "step": 50015 }, { "entropy": 5.304026412963867, "epoch": 4.944642151047845, "grad_norm": 1.078125, "learning_rate": 0.00028245188127821015, "loss": 4.7109, "mean_token_accuracy": 0.24858637005090714, "num_tokens": 114570746.0, "step": 50020 }, { "entropy": 5.328725862503052, "epoch": 4.945136417556347, "grad_norm": 1.1328125, "learning_rate": 0.00028241661056440824, "loss": 4.7816, "mean_token_accuracy": 0.24331432580947876, "num_tokens": 114582411.0, "step": 50025 }, { "entropy": 5.256792831420898, "epoch": 4.945630684064848, "grad_norm": 1.0703125, "learning_rate": 0.00028238133966815667, "loss": 4.7201, "mean_token_accuracy": 0.2512384444475174, "num_tokens": 114594692.0, "step": 50030 }, { "entropy": 5.2843665599823, "epoch": 4.946124950573349, "grad_norm": 1.0625, "learning_rate": 0.00028234606859032303, "loss": 4.6988, "mean_token_accuracy": 0.24595481753349305, "num_tokens": 114606346.0, "step": 50035 }, { "entropy": 5.341402816772461, "epoch": 4.94661921708185, "grad_norm": 1.0390625, "learning_rate": 0.0002823107973317748, "loss": 4.793, "mean_token_accuracy": 0.24303826838731765, "num_tokens": 114617657.0, "step": 50040 }, { "entropy": 5.312157201766968, "epoch": 4.947113483590352, "grad_norm": 1.0859375, "learning_rate": 0.0002822755258933799, "loss": 4.7239, "mean_token_accuracy": 0.2479980319738388, "num_tokens": 114629203.0, "step": 50045 }, { "entropy": 5.3234845161437985, "epoch": 4.947607750098854, "grad_norm": 1.1171875, "learning_rate": 0.00028224025427600597, "loss": 4.8268, "mean_token_accuracy": 0.23200251460075377, "num_tokens": 114640441.0, "step": 50050 }, { "entropy": 5.332494115829467, "epoch": 4.948102016607355, "grad_norm": 1.09375, "learning_rate": 0.00028220498248052064, "loss": 4.7593, "mean_token_accuracy": 0.24111834317445754, "num_tokens": 114651095.0, "step": 50055 }, { "entropy": 5.262952470779419, "epoch": 4.948596283115856, "grad_norm": 1.09375, "learning_rate": 0.00028216971050779163, "loss": 4.729, "mean_token_accuracy": 0.2425839811563492, "num_tokens": 114662691.0, "step": 50060 }, { "entropy": 5.319922256469726, "epoch": 4.949090549624358, "grad_norm": 0.9765625, "learning_rate": 0.00028213443835868655, "loss": 4.7161, "mean_token_accuracy": 0.24261604845523835, "num_tokens": 114674618.0, "step": 50065 }, { "entropy": 5.366525316238404, "epoch": 4.949584816132859, "grad_norm": 1.265625, "learning_rate": 0.00028209916603407333, "loss": 4.7833, "mean_token_accuracy": 0.23397217839956283, "num_tokens": 114685832.0, "step": 50070 }, { "entropy": 5.333819437026977, "epoch": 4.95007908264136, "grad_norm": 1.1328125, "learning_rate": 0.0002820638935348194, "loss": 4.6969, "mean_token_accuracy": 0.24886882454156875, "num_tokens": 114696723.0, "step": 50075 }, { "entropy": 5.349514579772949, "epoch": 4.950573349149861, "grad_norm": 1.15625, "learning_rate": 0.0002820286208617926, "loss": 4.7706, "mean_token_accuracy": 0.23812033832073212, "num_tokens": 114707064.0, "step": 50080 }, { "entropy": 5.3221581935882565, "epoch": 4.951067615658363, "grad_norm": 1.1328125, "learning_rate": 0.0002819933480158607, "loss": 4.7232, "mean_token_accuracy": 0.250044958293438, "num_tokens": 114717121.0, "step": 50085 }, { "entropy": 5.289471673965454, "epoch": 4.951561882166864, "grad_norm": 1.0078125, "learning_rate": 0.0002819580749978913, "loss": 4.6901, "mean_token_accuracy": 0.25143570452928543, "num_tokens": 114728539.0, "step": 50090 }, { "entropy": 5.267059421539306, "epoch": 4.952056148675366, "grad_norm": 1.09375, "learning_rate": 0.0002819228018087522, "loss": 4.6886, "mean_token_accuracy": 0.24428323656320572, "num_tokens": 114739318.0, "step": 50095 }, { "entropy": 5.362774610519409, "epoch": 4.952550415183867, "grad_norm": 1.0546875, "learning_rate": 0.00028188752844931115, "loss": 4.802, "mean_token_accuracy": 0.2375205412507057, "num_tokens": 114751118.0, "step": 50100 }, { "entropy": 5.298147869110108, "epoch": 4.953044681692369, "grad_norm": 1.0625, "learning_rate": 0.0002818522549204358, "loss": 4.7276, "mean_token_accuracy": 0.24077844321727754, "num_tokens": 114762309.0, "step": 50105 }, { "entropy": 5.334074258804321, "epoch": 4.95353894820087, "grad_norm": 0.95703125, "learning_rate": 0.0002818169812229939, "loss": 4.7664, "mean_token_accuracy": 0.23565346300601958, "num_tokens": 114774279.0, "step": 50110 }, { "entropy": 5.319270753860474, "epoch": 4.954033214709371, "grad_norm": 1.1640625, "learning_rate": 0.00028178170735785316, "loss": 4.8277, "mean_token_accuracy": 0.2371860682964325, "num_tokens": 114786188.0, "step": 50115 }, { "entropy": 5.246934461593628, "epoch": 4.954527481217872, "grad_norm": 1.078125, "learning_rate": 0.00028174643332588145, "loss": 4.6737, "mean_token_accuracy": 0.24911347776651382, "num_tokens": 114797720.0, "step": 50120 }, { "entropy": 5.29478087425232, "epoch": 4.955021747726374, "grad_norm": 1.0703125, "learning_rate": 0.00028171115912794636, "loss": 4.7742, "mean_token_accuracy": 0.24629873037338257, "num_tokens": 114809717.0, "step": 50125 }, { "entropy": 5.341569519042968, "epoch": 4.955516014234876, "grad_norm": 1.0703125, "learning_rate": 0.0002816758847649158, "loss": 4.7356, "mean_token_accuracy": 0.24416320770978928, "num_tokens": 114819900.0, "step": 50130 }, { "entropy": 5.36375470161438, "epoch": 4.956010280743377, "grad_norm": 0.98046875, "learning_rate": 0.0002816406102376574, "loss": 4.7868, "mean_token_accuracy": 0.2373060405254364, "num_tokens": 114832089.0, "step": 50135 }, { "entropy": 5.337986755371094, "epoch": 4.956504547251878, "grad_norm": 0.92578125, "learning_rate": 0.00028160533554703887, "loss": 4.8825, "mean_token_accuracy": 0.23615030199289322, "num_tokens": 114844261.0, "step": 50140 }, { "entropy": 5.285746669769287, "epoch": 4.9569988137603795, "grad_norm": 1.1640625, "learning_rate": 0.00028157006069392816, "loss": 4.7126, "mean_token_accuracy": 0.2455922156572342, "num_tokens": 114854903.0, "step": 50145 }, { "entropy": 5.323085689544678, "epoch": 4.957493080268881, "grad_norm": 1.046875, "learning_rate": 0.00028153478567919293, "loss": 4.7046, "mean_token_accuracy": 0.24586471915245056, "num_tokens": 114865997.0, "step": 50150 }, { "entropy": 5.3470663070678714, "epoch": 4.957987346777382, "grad_norm": 1.0546875, "learning_rate": 0.00028149951050370094, "loss": 4.8544, "mean_token_accuracy": 0.23394463658332826, "num_tokens": 114878522.0, "step": 50155 }, { "entropy": 5.351144027709961, "epoch": 4.958481613285883, "grad_norm": 1.171875, "learning_rate": 0.00028146423516831997, "loss": 4.765, "mean_token_accuracy": 0.23896743059158326, "num_tokens": 114890277.0, "step": 50160 }, { "entropy": 5.246102142333984, "epoch": 4.9589758797943855, "grad_norm": 0.98046875, "learning_rate": 0.00028142895967391793, "loss": 4.6789, "mean_token_accuracy": 0.25053186267614364, "num_tokens": 114902019.0, "step": 50165 }, { "entropy": 5.256345272064209, "epoch": 4.959470146302887, "grad_norm": 1.0625, "learning_rate": 0.0002813936840213623, "loss": 4.7546, "mean_token_accuracy": 0.24098258465528488, "num_tokens": 114913375.0, "step": 50170 }, { "entropy": 5.321775913238525, "epoch": 4.959964412811388, "grad_norm": 1.09375, "learning_rate": 0.0002813584082115212, "loss": 4.7349, "mean_token_accuracy": 0.24661492556333542, "num_tokens": 114924793.0, "step": 50175 }, { "entropy": 5.319557476043701, "epoch": 4.960458679319889, "grad_norm": 1.0546875, "learning_rate": 0.00028132313224526226, "loss": 4.7548, "mean_token_accuracy": 0.24555227905511856, "num_tokens": 114936255.0, "step": 50180 }, { "entropy": 5.326931428909302, "epoch": 4.9609529458283905, "grad_norm": 1.109375, "learning_rate": 0.0002812878561234531, "loss": 4.7602, "mean_token_accuracy": 0.24191157519817352, "num_tokens": 114947832.0, "step": 50185 }, { "entropy": 5.274086904525757, "epoch": 4.961447212336892, "grad_norm": 1.125, "learning_rate": 0.00028125257984696185, "loss": 4.76, "mean_token_accuracy": 0.2443736881017685, "num_tokens": 114960245.0, "step": 50190 }, { "entropy": 5.320461273193359, "epoch": 4.961941478845393, "grad_norm": 1.1171875, "learning_rate": 0.00028121730341665617, "loss": 4.7497, "mean_token_accuracy": 0.23993146568536758, "num_tokens": 114970931.0, "step": 50195 }, { "entropy": 5.319922399520874, "epoch": 4.962435745353895, "grad_norm": 1.0390625, "learning_rate": 0.0002811820268334038, "loss": 4.7584, "mean_token_accuracy": 0.24307889342308045, "num_tokens": 114982106.0, "step": 50200 }, { "entropy": 5.374406623840332, "epoch": 4.9629300118623965, "grad_norm": 1.0703125, "learning_rate": 0.0002811467500980727, "loss": 4.7822, "mean_token_accuracy": 0.23834760189056398, "num_tokens": 114994194.0, "step": 50205 }, { "entropy": 5.259132766723633, "epoch": 4.963424278370898, "grad_norm": 0.98046875, "learning_rate": 0.0002811114732115305, "loss": 4.7627, "mean_token_accuracy": 0.24213029444217682, "num_tokens": 115006526.0, "step": 50210 }, { "entropy": 5.292881631851197, "epoch": 4.963918544879399, "grad_norm": 1.015625, "learning_rate": 0.0002810761961746452, "loss": 4.7568, "mean_token_accuracy": 0.2436197206377983, "num_tokens": 115017863.0, "step": 50215 }, { "entropy": 5.3203479766845705, "epoch": 4.9644128113879, "grad_norm": 1.0390625, "learning_rate": 0.00028104091898828454, "loss": 4.7398, "mean_token_accuracy": 0.24225275665521623, "num_tokens": 115029597.0, "step": 50220 }, { "entropy": 5.301740550994873, "epoch": 4.9649070778964015, "grad_norm": 1.1171875, "learning_rate": 0.0002810056416533162, "loss": 4.7477, "mean_token_accuracy": 0.24269054383039473, "num_tokens": 115041027.0, "step": 50225 }, { "entropy": 5.298941421508789, "epoch": 4.965401344404903, "grad_norm": 1.1015625, "learning_rate": 0.0002809703641706083, "loss": 4.7534, "mean_token_accuracy": 0.24278221130371094, "num_tokens": 115051508.0, "step": 50230 }, { "entropy": 5.227017545700074, "epoch": 4.965895610913405, "grad_norm": 0.99609375, "learning_rate": 0.0002809350865410284, "loss": 4.6563, "mean_token_accuracy": 0.2503090962767601, "num_tokens": 115061766.0, "step": 50235 }, { "entropy": 5.336287784576416, "epoch": 4.966389877421906, "grad_norm": 1.1328125, "learning_rate": 0.0002808998087654445, "loss": 4.7697, "mean_token_accuracy": 0.24449640810489653, "num_tokens": 115072858.0, "step": 50240 }, { "entropy": 5.39161787033081, "epoch": 4.9668841439304074, "grad_norm": 1.125, "learning_rate": 0.00028086453084472443, "loss": 4.8808, "mean_token_accuracy": 0.23361073732376098, "num_tokens": 115084714.0, "step": 50245 }, { "entropy": 5.232700681686401, "epoch": 4.967378410438909, "grad_norm": 1.140625, "learning_rate": 0.00028082925277973596, "loss": 4.7255, "mean_token_accuracy": 0.24587859511375426, "num_tokens": 115095647.0, "step": 50250 }, { "entropy": 5.292182588577271, "epoch": 4.96787267694741, "grad_norm": 1.0234375, "learning_rate": 0.0002807939745713469, "loss": 4.7251, "mean_token_accuracy": 0.2400584876537323, "num_tokens": 115106030.0, "step": 50255 }, { "entropy": 5.4418614387512205, "epoch": 4.968366943455911, "grad_norm": 1.046875, "learning_rate": 0.0002807586962204252, "loss": 4.9079, "mean_token_accuracy": 0.22666609287261963, "num_tokens": 115117941.0, "step": 50260 }, { "entropy": 5.292720651626587, "epoch": 4.9688612099644125, "grad_norm": 1.0078125, "learning_rate": 0.0002807234177278388, "loss": 4.6351, "mean_token_accuracy": 0.2520221993327141, "num_tokens": 115130230.0, "step": 50265 }, { "entropy": 5.272434711456299, "epoch": 4.969355476472915, "grad_norm": 1.2265625, "learning_rate": 0.00028068813909445527, "loss": 4.7518, "mean_token_accuracy": 0.24162401556968688, "num_tokens": 115141925.0, "step": 50270 }, { "entropy": 5.286534023284912, "epoch": 4.969849742981416, "grad_norm": 1.0546875, "learning_rate": 0.00028065286032114266, "loss": 4.767, "mean_token_accuracy": 0.24270831644535065, "num_tokens": 115154295.0, "step": 50275 }, { "entropy": 5.252262592315674, "epoch": 4.970344009489917, "grad_norm": 1.171875, "learning_rate": 0.0002806175814087689, "loss": 4.6411, "mean_token_accuracy": 0.2554264470934868, "num_tokens": 115165133.0, "step": 50280 }, { "entropy": 5.299946546554565, "epoch": 4.970838275998418, "grad_norm": 0.96484375, "learning_rate": 0.0002805823023582017, "loss": 4.7327, "mean_token_accuracy": 0.24473607391119004, "num_tokens": 115176570.0, "step": 50285 }, { "entropy": 5.320768165588379, "epoch": 4.97133254250692, "grad_norm": 1.1328125, "learning_rate": 0.000280547023170309, "loss": 4.8296, "mean_token_accuracy": 0.2311922013759613, "num_tokens": 115188464.0, "step": 50290 }, { "entropy": 5.385010147094727, "epoch": 4.971826809015421, "grad_norm": 1.0859375, "learning_rate": 0.00028051174384595873, "loss": 4.8364, "mean_token_accuracy": 0.2318882629275322, "num_tokens": 115199422.0, "step": 50295 }, { "entropy": 5.357542037963867, "epoch": 4.972321075523922, "grad_norm": 1.2265625, "learning_rate": 0.00028047646438601867, "loss": 4.7783, "mean_token_accuracy": 0.23517627716064454, "num_tokens": 115211281.0, "step": 50300 }, { "entropy": 5.4093035697937015, "epoch": 4.972815342032424, "grad_norm": 1.0546875, "learning_rate": 0.0002804411847913567, "loss": 4.8613, "mean_token_accuracy": 0.2354535222053528, "num_tokens": 115223194.0, "step": 50305 }, { "entropy": 5.297347211837769, "epoch": 4.973309608540926, "grad_norm": 1.0390625, "learning_rate": 0.00028040590506284076, "loss": 4.7358, "mean_token_accuracy": 0.24035276770591735, "num_tokens": 115233919.0, "step": 50310 }, { "entropy": 5.414046049118042, "epoch": 4.973803875049427, "grad_norm": 1.0703125, "learning_rate": 0.0002803706252013387, "loss": 4.8724, "mean_token_accuracy": 0.23549332469701767, "num_tokens": 115246245.0, "step": 50315 }, { "entropy": 5.258101463317871, "epoch": 4.974298141557928, "grad_norm": 1.1328125, "learning_rate": 0.0002803353452077185, "loss": 4.6734, "mean_token_accuracy": 0.24929913878440857, "num_tokens": 115257247.0, "step": 50320 }, { "entropy": 5.339825439453125, "epoch": 4.974792408066429, "grad_norm": 1.0390625, "learning_rate": 0.0002803000650828479, "loss": 4.8212, "mean_token_accuracy": 0.2401138111948967, "num_tokens": 115268962.0, "step": 50325 }, { "entropy": 5.298595428466797, "epoch": 4.975286674574931, "grad_norm": 1.0703125, "learning_rate": 0.00028026478482759485, "loss": 4.7071, "mean_token_accuracy": 0.24338867366313935, "num_tokens": 115281034.0, "step": 50330 }, { "entropy": 5.341971158981323, "epoch": 4.975780941083432, "grad_norm": 1.125, "learning_rate": 0.0002802295044428274, "loss": 4.8068, "mean_token_accuracy": 0.23703516870737076, "num_tokens": 115292904.0, "step": 50335 }, { "entropy": 5.3758780002594, "epoch": 4.976275207591933, "grad_norm": 1.0390625, "learning_rate": 0.0002801942239294133, "loss": 4.7945, "mean_token_accuracy": 0.23639553040266037, "num_tokens": 115304723.0, "step": 50340 }, { "entropy": 5.307611989974975, "epoch": 4.9767694741004345, "grad_norm": 1.09375, "learning_rate": 0.0002801589432882204, "loss": 4.8082, "mean_token_accuracy": 0.23952323198318481, "num_tokens": 115316106.0, "step": 50345 }, { "entropy": 5.324207925796509, "epoch": 4.977263740608937, "grad_norm": 1.0390625, "learning_rate": 0.00028012366252011674, "loss": 4.765, "mean_token_accuracy": 0.24304572641849517, "num_tokens": 115328981.0, "step": 50350 }, { "entropy": 5.4056848049163815, "epoch": 4.977758007117438, "grad_norm": 1.0703125, "learning_rate": 0.0002800883816259702, "loss": 4.8222, "mean_token_accuracy": 0.231366391479969, "num_tokens": 115340655.0, "step": 50355 }, { "entropy": 5.231250762939453, "epoch": 4.978252273625939, "grad_norm": 1.0859375, "learning_rate": 0.00028005310060664866, "loss": 4.6475, "mean_token_accuracy": 0.25360778719186783, "num_tokens": 115352130.0, "step": 50360 }, { "entropy": 5.289690446853638, "epoch": 4.97874654013444, "grad_norm": 1.1171875, "learning_rate": 0.0002800178194630201, "loss": 4.7297, "mean_token_accuracy": 0.2428830862045288, "num_tokens": 115363419.0, "step": 50365 }, { "entropy": 5.294567966461182, "epoch": 4.979240806642942, "grad_norm": 1.1171875, "learning_rate": 0.00027998253819595234, "loss": 4.6667, "mean_token_accuracy": 0.2501699700951576, "num_tokens": 115374008.0, "step": 50370 }, { "entropy": 5.317559099197387, "epoch": 4.979735073151443, "grad_norm": 1.0234375, "learning_rate": 0.00027994725680631336, "loss": 4.7745, "mean_token_accuracy": 0.23541662693023682, "num_tokens": 115385829.0, "step": 50375 }, { "entropy": 5.301268672943115, "epoch": 4.980229339659944, "grad_norm": 1.2109375, "learning_rate": 0.0002799119752949712, "loss": 4.7342, "mean_token_accuracy": 0.24261467456817626, "num_tokens": 115396747.0, "step": 50380 }, { "entropy": 5.30980429649353, "epoch": 4.980723606168446, "grad_norm": 1.0546875, "learning_rate": 0.00027987669366279363, "loss": 4.6929, "mean_token_accuracy": 0.24528355300426483, "num_tokens": 115407436.0, "step": 50385 }, { "entropy": 5.311186981201172, "epoch": 4.981217872676948, "grad_norm": 1.0546875, "learning_rate": 0.0002798414119106487, "loss": 4.7727, "mean_token_accuracy": 0.242727130651474, "num_tokens": 115418395.0, "step": 50390 }, { "entropy": 5.32293734550476, "epoch": 4.981712139185449, "grad_norm": 1.1484375, "learning_rate": 0.0002798061300394041, "loss": 4.7207, "mean_token_accuracy": 0.24924180805683135, "num_tokens": 115428501.0, "step": 50395 }, { "entropy": 5.284813165664673, "epoch": 4.98220640569395, "grad_norm": 1.140625, "learning_rate": 0.00027977084804992807, "loss": 4.7044, "mean_token_accuracy": 0.24728926718235017, "num_tokens": 115440557.0, "step": 50400 }, { "entropy": 5.373666143417358, "epoch": 4.982700672202451, "grad_norm": 1.1328125, "learning_rate": 0.0002797355659430885, "loss": 4.8314, "mean_token_accuracy": 0.23415331095457076, "num_tokens": 115451349.0, "step": 50405 }, { "entropy": 5.356225395202637, "epoch": 4.983194938710953, "grad_norm": 1.1484375, "learning_rate": 0.0002797002837197532, "loss": 4.745, "mean_token_accuracy": 0.23672315925359727, "num_tokens": 115461816.0, "step": 50410 }, { "entropy": 5.2465291023254395, "epoch": 4.983689205219454, "grad_norm": 1.0546875, "learning_rate": 0.0002796650013807902, "loss": 4.6395, "mean_token_accuracy": 0.25334244072437284, "num_tokens": 115473670.0, "step": 50415 }, { "entropy": 5.311927747726441, "epoch": 4.984183471727956, "grad_norm": 0.97265625, "learning_rate": 0.0002796297189270675, "loss": 4.773, "mean_token_accuracy": 0.24067906886339188, "num_tokens": 115485533.0, "step": 50420 }, { "entropy": 5.261803865432739, "epoch": 4.984677738236457, "grad_norm": 1.0625, "learning_rate": 0.00027959443635945295, "loss": 4.6612, "mean_token_accuracy": 0.25186868011951447, "num_tokens": 115497226.0, "step": 50425 }, { "entropy": 5.2979217052459715, "epoch": 4.985172004744959, "grad_norm": 1.0390625, "learning_rate": 0.00027955915367881444, "loss": 4.7459, "mean_token_accuracy": 0.23990243822336196, "num_tokens": 115509202.0, "step": 50430 }, { "entropy": 5.319822120666504, "epoch": 4.98566627125346, "grad_norm": 1.1953125, "learning_rate": 0.0002795238708860202, "loss": 4.7677, "mean_token_accuracy": 0.24518343955278396, "num_tokens": 115520548.0, "step": 50435 }, { "entropy": 5.245585012435913, "epoch": 4.986160537761961, "grad_norm": 1.0625, "learning_rate": 0.00027948858798193803, "loss": 4.6914, "mean_token_accuracy": 0.24480580240488053, "num_tokens": 115532016.0, "step": 50440 }, { "entropy": 5.325269365310669, "epoch": 4.986654804270462, "grad_norm": 1.0859375, "learning_rate": 0.00027945330496743584, "loss": 4.7695, "mean_token_accuracy": 0.2409144550561905, "num_tokens": 115542420.0, "step": 50445 }, { "entropy": 5.3204797267913815, "epoch": 4.987149070778964, "grad_norm": 1.0390625, "learning_rate": 0.0002794180218433816, "loss": 4.7025, "mean_token_accuracy": 0.2445626065135002, "num_tokens": 115552947.0, "step": 50450 }, { "entropy": 5.282430934906006, "epoch": 4.987643337287466, "grad_norm": 1.03125, "learning_rate": 0.0002793827386106435, "loss": 4.7575, "mean_token_accuracy": 0.24630273282527923, "num_tokens": 115564564.0, "step": 50455 }, { "entropy": 5.294006872177124, "epoch": 4.988137603795967, "grad_norm": 1.109375, "learning_rate": 0.0002793474552700892, "loss": 4.7462, "mean_token_accuracy": 0.24649225622415544, "num_tokens": 115575235.0, "step": 50460 }, { "entropy": 5.347432041168213, "epoch": 4.988631870304468, "grad_norm": 1.1015625, "learning_rate": 0.00027931217182258696, "loss": 4.7957, "mean_token_accuracy": 0.23763776570558548, "num_tokens": 115587142.0, "step": 50465 }, { "entropy": 5.293096351623535, "epoch": 4.98912613681297, "grad_norm": 1.078125, "learning_rate": 0.0002792768882690045, "loss": 4.7094, "mean_token_accuracy": 0.24630031138658523, "num_tokens": 115597895.0, "step": 50470 }, { "entropy": 5.361085510253906, "epoch": 4.989620403321471, "grad_norm": 1.15625, "learning_rate": 0.00027924160461020994, "loss": 4.7685, "mean_token_accuracy": 0.24511950612068176, "num_tokens": 115609606.0, "step": 50475 }, { "entropy": 5.215856122970581, "epoch": 4.990114669829972, "grad_norm": 1.0625, "learning_rate": 0.0002792063208470713, "loss": 4.6848, "mean_token_accuracy": 0.2485540822148323, "num_tokens": 115620280.0, "step": 50480 }, { "entropy": 5.380795335769653, "epoch": 4.990608936338473, "grad_norm": 1.109375, "learning_rate": 0.0002791710369804565, "loss": 4.786, "mean_token_accuracy": 0.2465546026825905, "num_tokens": 115631970.0, "step": 50485 }, { "entropy": 5.332133626937866, "epoch": 4.9911032028469755, "grad_norm": 1.046875, "learning_rate": 0.00027913575301123357, "loss": 4.6569, "mean_token_accuracy": 0.2400880053639412, "num_tokens": 115642186.0, "step": 50490 }, { "entropy": 5.268102073669434, "epoch": 4.991597469355477, "grad_norm": 1.1171875, "learning_rate": 0.0002791004689402704, "loss": 4.6913, "mean_token_accuracy": 0.2484916180372238, "num_tokens": 115653658.0, "step": 50495 }, { "entropy": 5.2693115234375, "epoch": 4.992091735863978, "grad_norm": 1.078125, "learning_rate": 0.00027906518476843514, "loss": 4.6904, "mean_token_accuracy": 0.2515706241130829, "num_tokens": 115665517.0, "step": 50500 }, { "entropy": 5.305290079116821, "epoch": 4.992586002372479, "grad_norm": 1.0234375, "learning_rate": 0.0002790299004965956, "loss": 4.7459, "mean_token_accuracy": 0.24558742195367814, "num_tokens": 115677317.0, "step": 50505 }, { "entropy": 5.376385498046875, "epoch": 4.9930802688809806, "grad_norm": 1.0390625, "learning_rate": 0.00027899461612562005, "loss": 4.8558, "mean_token_accuracy": 0.2309532955288887, "num_tokens": 115689732.0, "step": 50510 }, { "entropy": 5.283005285263061, "epoch": 4.993574535389482, "grad_norm": 1.0390625, "learning_rate": 0.00027895933165637615, "loss": 4.6938, "mean_token_accuracy": 0.24985937476158143, "num_tokens": 115701660.0, "step": 50515 }, { "entropy": 5.351260137557984, "epoch": 4.994068801897983, "grad_norm": 1.1484375, "learning_rate": 0.0002789240470897322, "loss": 4.7489, "mean_token_accuracy": 0.23761994987726212, "num_tokens": 115713113.0, "step": 50520 }, { "entropy": 5.278686809539795, "epoch": 4.994563068406485, "grad_norm": 1.078125, "learning_rate": 0.000278888762426556, "loss": 4.7448, "mean_token_accuracy": 0.24190910905599594, "num_tokens": 115725613.0, "step": 50525 }, { "entropy": 5.28763632774353, "epoch": 4.9950573349149865, "grad_norm": 1.109375, "learning_rate": 0.0002788534776677157, "loss": 4.7383, "mean_token_accuracy": 0.2492547497153282, "num_tokens": 115737680.0, "step": 50530 }, { "entropy": 5.296732187271118, "epoch": 4.995551601423488, "grad_norm": 1.0859375, "learning_rate": 0.0002788181928140792, "loss": 4.7506, "mean_token_accuracy": 0.24317091703414917, "num_tokens": 115747847.0, "step": 50535 }, { "entropy": 5.313287734985352, "epoch": 4.996045867931989, "grad_norm": 1.0546875, "learning_rate": 0.00027878290786651454, "loss": 4.8222, "mean_token_accuracy": 0.23840893507003785, "num_tokens": 115758679.0, "step": 50540 }, { "entropy": 5.4075158596038815, "epoch": 4.99654013444049, "grad_norm": 0.95703125, "learning_rate": 0.0002787476228258898, "loss": 4.8273, "mean_token_accuracy": 0.23358442336320878, "num_tokens": 115769496.0, "step": 50545 }, { "entropy": 5.352255725860596, "epoch": 4.9970344009489915, "grad_norm": 1.1796875, "learning_rate": 0.000278712337693073, "loss": 4.7212, "mean_token_accuracy": 0.24389414638280868, "num_tokens": 115781422.0, "step": 50550 }, { "entropy": 5.379045200347901, "epoch": 4.997528667457493, "grad_norm": 1.0859375, "learning_rate": 0.0002786770524689321, "loss": 4.8584, "mean_token_accuracy": 0.23807763010263444, "num_tokens": 115792612.0, "step": 50555 }, { "entropy": 5.30287184715271, "epoch": 4.998022933965995, "grad_norm": 1.03125, "learning_rate": 0.00027864176715433517, "loss": 4.778, "mean_token_accuracy": 0.24124819934368133, "num_tokens": 115805479.0, "step": 50560 }, { "entropy": 5.267482614517212, "epoch": 4.998517200474496, "grad_norm": 1.0234375, "learning_rate": 0.00027860648175015006, "loss": 4.6558, "mean_token_accuracy": 0.25189920514822006, "num_tokens": 115817582.0, "step": 50565 }, { "entropy": 5.2855939865112305, "epoch": 4.9990114669829975, "grad_norm": 0.984375, "learning_rate": 0.0002785711962572451, "loss": 4.7583, "mean_token_accuracy": 0.2423169806599617, "num_tokens": 115829413.0, "step": 50570 }, { "entropy": 5.249648904800415, "epoch": 4.999505733491499, "grad_norm": 1.1015625, "learning_rate": 0.00027853591067648805, "loss": 4.6783, "mean_token_accuracy": 0.24860359728336334, "num_tokens": 115840247.0, "step": 50575 }, { "entropy": 5.19763879776001, "epoch": 5.0, "grad_norm": 1.296875, "learning_rate": 0.0002785006250087471, "loss": 4.5773, "mean_token_accuracy": 0.25571167320013044, "num_tokens": 115851460.0, "step": 50580 }, { "entropy": 5.297359323501587, "epoch": 5.000494266508501, "grad_norm": 1.0390625, "learning_rate": 0.0002784653392548902, "loss": 4.6514, "mean_token_accuracy": 0.25775195062160494, "num_tokens": 115863069.0, "step": 50585 }, { "entropy": 5.27783989906311, "epoch": 5.0009885330170025, "grad_norm": 1.09375, "learning_rate": 0.00027843005341578544, "loss": 4.6078, "mean_token_accuracy": 0.25350565165281297, "num_tokens": 115875628.0, "step": 50590 }, { "entropy": 5.315345716476441, "epoch": 5.001482799525504, "grad_norm": 1.140625, "learning_rate": 0.00027839476749230084, "loss": 4.7134, "mean_token_accuracy": 0.24708280265331267, "num_tokens": 115886404.0, "step": 50595 }, { "entropy": 5.2874308109283445, "epoch": 5.001977066034006, "grad_norm": 1.09375, "learning_rate": 0.0002783594814853045, "loss": 4.6083, "mean_token_accuracy": 0.25451004654169085, "num_tokens": 115897927.0, "step": 50600 }, { "entropy": 5.2743326187133786, "epoch": 5.002471332542507, "grad_norm": 1.0625, "learning_rate": 0.00027832419539566426, "loss": 4.695, "mean_token_accuracy": 0.2426049992442131, "num_tokens": 115908908.0, "step": 50605 }, { "entropy": 5.26667628288269, "epoch": 5.0029655990510085, "grad_norm": 1.1796875, "learning_rate": 0.00027828890922424837, "loss": 4.633, "mean_token_accuracy": 0.2525383308529854, "num_tokens": 115919783.0, "step": 50610 }, { "entropy": 5.359327125549316, "epoch": 5.00345986555951, "grad_norm": 1.125, "learning_rate": 0.0002782536229719248, "loss": 4.6984, "mean_token_accuracy": 0.24000356793403627, "num_tokens": 115931939.0, "step": 50615 }, { "entropy": 5.339048385620117, "epoch": 5.003954132068011, "grad_norm": 1.1875, "learning_rate": 0.0002782183366395616, "loss": 4.7054, "mean_token_accuracy": 0.24613474905490876, "num_tokens": 115943606.0, "step": 50620 }, { "entropy": 5.1460083484649655, "epoch": 5.004448398576512, "grad_norm": 1.1484375, "learning_rate": 0.0002781830502280268, "loss": 4.5777, "mean_token_accuracy": 0.26044428944587705, "num_tokens": 115955121.0, "step": 50625 }, { "entropy": 5.286685371398926, "epoch": 5.0049426650850135, "grad_norm": 1.2421875, "learning_rate": 0.00027814776373818854, "loss": 4.6958, "mean_token_accuracy": 0.24860541820526122, "num_tokens": 115965720.0, "step": 50630 }, { "entropy": 5.309101581573486, "epoch": 5.005436931593516, "grad_norm": 1.03125, "learning_rate": 0.00027811247717091466, "loss": 4.7013, "mean_token_accuracy": 0.2481689751148224, "num_tokens": 115977318.0, "step": 50635 }, { "entropy": 5.205461597442627, "epoch": 5.005931198102017, "grad_norm": 1.078125, "learning_rate": 0.0002780771905270735, "loss": 4.608, "mean_token_accuracy": 0.26506012827157976, "num_tokens": 115989541.0, "step": 50640 }, { "entropy": 5.2088109970092775, "epoch": 5.006425464610518, "grad_norm": 1.0859375, "learning_rate": 0.0002780419038075329, "loss": 4.467, "mean_token_accuracy": 0.2741231232881546, "num_tokens": 116000227.0, "step": 50645 }, { "entropy": 5.3214891910552975, "epoch": 5.0069197311190194, "grad_norm": 1.109375, "learning_rate": 0.00027800661701316096, "loss": 4.7579, "mean_token_accuracy": 0.24010510891675949, "num_tokens": 116012822.0, "step": 50650 }, { "entropy": 5.379070520401001, "epoch": 5.007413997627521, "grad_norm": 1.15625, "learning_rate": 0.0002779713301448259, "loss": 4.7871, "mean_token_accuracy": 0.2417548805475235, "num_tokens": 116024113.0, "step": 50655 }, { "entropy": 5.25814471244812, "epoch": 5.007908264136022, "grad_norm": 1.1015625, "learning_rate": 0.00027793604320339556, "loss": 4.6702, "mean_token_accuracy": 0.2591333553195, "num_tokens": 116035381.0, "step": 50660 }, { "entropy": 5.258616018295288, "epoch": 5.008402530644523, "grad_norm": 1.0625, "learning_rate": 0.0002779007561897381, "loss": 4.6166, "mean_token_accuracy": 0.25661206245422363, "num_tokens": 116045673.0, "step": 50665 }, { "entropy": 5.351685953140259, "epoch": 5.0088967971530245, "grad_norm": 1.09375, "learning_rate": 0.00027786546910472167, "loss": 4.745, "mean_token_accuracy": 0.24265303760766982, "num_tokens": 116057010.0, "step": 50670 }, { "entropy": 5.321011400222778, "epoch": 5.009391063661527, "grad_norm": 1.0859375, "learning_rate": 0.00027783018194921423, "loss": 4.6767, "mean_token_accuracy": 0.24510133713483812, "num_tokens": 116067197.0, "step": 50675 }, { "entropy": 5.317904424667359, "epoch": 5.009885330170028, "grad_norm": 1.0703125, "learning_rate": 0.0002777948947240838, "loss": 4.6687, "mean_token_accuracy": 0.2535227969288826, "num_tokens": 116080409.0, "step": 50680 }, { "entropy": 5.318977117538452, "epoch": 5.010379596678529, "grad_norm": 1.1015625, "learning_rate": 0.00027775960743019857, "loss": 4.7194, "mean_token_accuracy": 0.24328310489654542, "num_tokens": 116091935.0, "step": 50685 }, { "entropy": 5.320685482025146, "epoch": 5.01087386318703, "grad_norm": 1.0703125, "learning_rate": 0.0002777243200684266, "loss": 4.7019, "mean_token_accuracy": 0.24752887487411498, "num_tokens": 116103326.0, "step": 50690 }, { "entropy": 5.237175464630127, "epoch": 5.011368129695532, "grad_norm": 1.046875, "learning_rate": 0.0002776890326396359, "loss": 4.5558, "mean_token_accuracy": 0.26191631704568863, "num_tokens": 116114711.0, "step": 50695 }, { "entropy": 5.2392457008361815, "epoch": 5.011862396204033, "grad_norm": 1.0703125, "learning_rate": 0.00027765374514469453, "loss": 4.6505, "mean_token_accuracy": 0.2541749581694603, "num_tokens": 116126023.0, "step": 50700 }, { "entropy": 5.244155502319336, "epoch": 5.012356662712534, "grad_norm": 1.0859375, "learning_rate": 0.0002776184575844707, "loss": 4.6558, "mean_token_accuracy": 0.255479684472084, "num_tokens": 116137847.0, "step": 50705 }, { "entropy": 5.206640195846558, "epoch": 5.012850929221036, "grad_norm": 1.09375, "learning_rate": 0.00027758316995983237, "loss": 4.6079, "mean_token_accuracy": 0.25204376578330995, "num_tokens": 116148635.0, "step": 50710 }, { "entropy": 5.197890949249268, "epoch": 5.013345195729538, "grad_norm": 1.0703125, "learning_rate": 0.00027754788227164767, "loss": 4.6386, "mean_token_accuracy": 0.2580334782600403, "num_tokens": 116159312.0, "step": 50715 }, { "entropy": 5.3594176292419435, "epoch": 5.013839462238039, "grad_norm": 1.125, "learning_rate": 0.00027751259452078465, "loss": 4.7801, "mean_token_accuracy": 0.24040220379829408, "num_tokens": 116171754.0, "step": 50720 }, { "entropy": 5.373762464523315, "epoch": 5.01433372874654, "grad_norm": 1.09375, "learning_rate": 0.0002774773067081114, "loss": 4.743, "mean_token_accuracy": 0.23918843120336533, "num_tokens": 116182691.0, "step": 50725 }, { "entropy": 5.363048076629639, "epoch": 5.014827995255041, "grad_norm": 1.046875, "learning_rate": 0.0002774420188344961, "loss": 4.7946, "mean_token_accuracy": 0.2324823409318924, "num_tokens": 116194580.0, "step": 50730 }, { "entropy": 5.3428332805633545, "epoch": 5.015322261763543, "grad_norm": 1.0859375, "learning_rate": 0.0002774067309008067, "loss": 4.7269, "mean_token_accuracy": 0.2364451840519905, "num_tokens": 116205634.0, "step": 50735 }, { "entropy": 5.280161285400391, "epoch": 5.015816528272044, "grad_norm": 1.0546875, "learning_rate": 0.00027737144290791135, "loss": 4.6628, "mean_token_accuracy": 0.25269490480422974, "num_tokens": 116217246.0, "step": 50740 }, { "entropy": 5.364782619476318, "epoch": 5.016310794780546, "grad_norm": 1.046875, "learning_rate": 0.00027733615485667825, "loss": 4.7784, "mean_token_accuracy": 0.2353098839521408, "num_tokens": 116229725.0, "step": 50745 }, { "entropy": 5.304046106338501, "epoch": 5.016805061289047, "grad_norm": 1.1328125, "learning_rate": 0.00027730086674797517, "loss": 4.6387, "mean_token_accuracy": 0.25735432654619217, "num_tokens": 116240706.0, "step": 50750 }, { "entropy": 5.316853857040405, "epoch": 5.017299327797549, "grad_norm": 1.03125, "learning_rate": 0.00027726557858267055, "loss": 4.6759, "mean_token_accuracy": 0.2505439013242722, "num_tokens": 116251750.0, "step": 50755 }, { "entropy": 5.317034196853638, "epoch": 5.01779359430605, "grad_norm": 1.09375, "learning_rate": 0.0002772302903616323, "loss": 4.7023, "mean_token_accuracy": 0.2435301199555397, "num_tokens": 116263116.0, "step": 50760 }, { "entropy": 5.390891885757446, "epoch": 5.018287860814551, "grad_norm": 1.0390625, "learning_rate": 0.00027719500208572855, "loss": 4.8008, "mean_token_accuracy": 0.23472829908132553, "num_tokens": 116274425.0, "step": 50765 }, { "entropy": 5.286919689178466, "epoch": 5.018782127323052, "grad_norm": 0.98828125, "learning_rate": 0.0002771597137558274, "loss": 4.6312, "mean_token_accuracy": 0.2598934605717659, "num_tokens": 116287535.0, "step": 50770 }, { "entropy": 5.264038562774658, "epoch": 5.019276393831554, "grad_norm": 1.078125, "learning_rate": 0.000277124425372797, "loss": 4.6911, "mean_token_accuracy": 0.24466102719306945, "num_tokens": 116299530.0, "step": 50775 }, { "entropy": 5.261541509628296, "epoch": 5.019770660340055, "grad_norm": 1.234375, "learning_rate": 0.0002770891369375054, "loss": 4.7326, "mean_token_accuracy": 0.2469469800591469, "num_tokens": 116311114.0, "step": 50780 }, { "entropy": 5.302174472808838, "epoch": 5.020264926848557, "grad_norm": 1.125, "learning_rate": 0.0002770538484508207, "loss": 4.6932, "mean_token_accuracy": 0.2476201742887497, "num_tokens": 116322149.0, "step": 50785 }, { "entropy": 5.208545112609864, "epoch": 5.020759193357058, "grad_norm": 1.1171875, "learning_rate": 0.0002770185599136111, "loss": 4.5802, "mean_token_accuracy": 0.25340664982795713, "num_tokens": 116333905.0, "step": 50790 }, { "entropy": 5.361913061141967, "epoch": 5.02125345986556, "grad_norm": 1.0703125, "learning_rate": 0.0002769832713267445, "loss": 4.6906, "mean_token_accuracy": 0.2488646239042282, "num_tokens": 116344415.0, "step": 50795 }, { "entropy": 5.40093731880188, "epoch": 5.021747726374061, "grad_norm": 1.0859375, "learning_rate": 0.0002769479826910891, "loss": 4.8168, "mean_token_accuracy": 0.23967744708061217, "num_tokens": 116358272.0, "step": 50800 }, { "entropy": 5.359015798568725, "epoch": 5.022241992882562, "grad_norm": 0.9921875, "learning_rate": 0.00027691269400751306, "loss": 4.7208, "mean_token_accuracy": 0.23946303725242615, "num_tokens": 116370880.0, "step": 50805 }, { "entropy": 5.269351530075073, "epoch": 5.022736259391063, "grad_norm": 1.0234375, "learning_rate": 0.00027687740527688445, "loss": 4.7015, "mean_token_accuracy": 0.2508235529065132, "num_tokens": 116382525.0, "step": 50810 }, { "entropy": 5.252383613586426, "epoch": 5.023230525899565, "grad_norm": 1.0390625, "learning_rate": 0.0002768421165000714, "loss": 4.637, "mean_token_accuracy": 0.2574846312403679, "num_tokens": 116393810.0, "step": 50815 }, { "entropy": 5.267555093765258, "epoch": 5.023724792408067, "grad_norm": 1.15625, "learning_rate": 0.000276806827677942, "loss": 4.6702, "mean_token_accuracy": 0.24951876252889632, "num_tokens": 116405935.0, "step": 50820 }, { "entropy": 5.359050607681274, "epoch": 5.024219058916568, "grad_norm": 1.171875, "learning_rate": 0.0002767715388113643, "loss": 4.741, "mean_token_accuracy": 0.2468499630689621, "num_tokens": 116416026.0, "step": 50825 }, { "entropy": 5.343650007247925, "epoch": 5.024713325425069, "grad_norm": 1.140625, "learning_rate": 0.00027673624990120653, "loss": 4.7435, "mean_token_accuracy": 0.23563047796487807, "num_tokens": 116426387.0, "step": 50830 }, { "entropy": 5.359513521194458, "epoch": 5.025207591933571, "grad_norm": 1.1015625, "learning_rate": 0.00027670096094833675, "loss": 4.7861, "mean_token_accuracy": 0.24020010083913804, "num_tokens": 116438793.0, "step": 50835 }, { "entropy": 5.333175134658814, "epoch": 5.025701858442072, "grad_norm": 1.125, "learning_rate": 0.000276665671953623, "loss": 4.6582, "mean_token_accuracy": 0.25014407485723494, "num_tokens": 116451524.0, "step": 50840 }, { "entropy": 5.277068424224853, "epoch": 5.026196124950573, "grad_norm": 1.0625, "learning_rate": 0.00027663038291793357, "loss": 4.6779, "mean_token_accuracy": 0.25244506299495695, "num_tokens": 116462856.0, "step": 50845 }, { "entropy": 5.257211399078369, "epoch": 5.026690391459074, "grad_norm": 1.234375, "learning_rate": 0.00027659509384213635, "loss": 4.6965, "mean_token_accuracy": 0.24705388098955156, "num_tokens": 116473355.0, "step": 50850 }, { "entropy": 5.314145612716675, "epoch": 5.0271846579675765, "grad_norm": 1.03125, "learning_rate": 0.0002765598047270996, "loss": 4.7016, "mean_token_accuracy": 0.24581383168697357, "num_tokens": 116485286.0, "step": 50855 }, { "entropy": 5.319527053833008, "epoch": 5.027678924476078, "grad_norm": 1.03125, "learning_rate": 0.0002765245155736915, "loss": 4.7212, "mean_token_accuracy": 0.24924864619970322, "num_tokens": 116497962.0, "step": 50860 }, { "entropy": 5.282780551910401, "epoch": 5.028173190984579, "grad_norm": 1.2265625, "learning_rate": 0.00027648922638278, "loss": 4.6606, "mean_token_accuracy": 0.2500160500407219, "num_tokens": 116510085.0, "step": 50865 }, { "entropy": 5.210911083221435, "epoch": 5.02866745749308, "grad_norm": 1.1640625, "learning_rate": 0.0002764539371552333, "loss": 4.5218, "mean_token_accuracy": 0.26936480551958086, "num_tokens": 116520547.0, "step": 50870 }, { "entropy": 5.2423591136932375, "epoch": 5.029161724001582, "grad_norm": 1.0, "learning_rate": 0.0002764186478919195, "loss": 4.663, "mean_token_accuracy": 0.2537155017256737, "num_tokens": 116531181.0, "step": 50875 }, { "entropy": 5.223254203796387, "epoch": 5.029655990510083, "grad_norm": 1.109375, "learning_rate": 0.00027638335859370676, "loss": 4.6534, "mean_token_accuracy": 0.2579238563776016, "num_tokens": 116543262.0, "step": 50880 }, { "entropy": 5.292874479293824, "epoch": 5.030150257018584, "grad_norm": 1.015625, "learning_rate": 0.0002763480692614632, "loss": 4.7093, "mean_token_accuracy": 0.24850204437971116, "num_tokens": 116555942.0, "step": 50885 }, { "entropy": 5.300270891189575, "epoch": 5.030644523527086, "grad_norm": 1.140625, "learning_rate": 0.00027631277989605704, "loss": 4.6981, "mean_token_accuracy": 0.2496719554066658, "num_tokens": 116566964.0, "step": 50890 }, { "entropy": 5.259486389160156, "epoch": 5.0311387900355875, "grad_norm": 1.1953125, "learning_rate": 0.0002762774904983561, "loss": 4.6013, "mean_token_accuracy": 0.25892250835895536, "num_tokens": 116578731.0, "step": 50895 }, { "entropy": 5.2819984436035154, "epoch": 5.031633056544089, "grad_norm": 1.0390625, "learning_rate": 0.00027624220106922876, "loss": 4.6693, "mean_token_accuracy": 0.2491343215107918, "num_tokens": 116590010.0, "step": 50900 }, { "entropy": 5.312283992767334, "epoch": 5.03212732305259, "grad_norm": 1.1171875, "learning_rate": 0.00027620691160954315, "loss": 4.6465, "mean_token_accuracy": 0.24901384860277176, "num_tokens": 116601477.0, "step": 50905 }, { "entropy": 5.318562269210815, "epoch": 5.032621589561091, "grad_norm": 1.1171875, "learning_rate": 0.0002761716221201672, "loss": 4.7103, "mean_token_accuracy": 0.2508587971329689, "num_tokens": 116612543.0, "step": 50910 }, { "entropy": 5.288304424285888, "epoch": 5.0331158560695926, "grad_norm": 1.1875, "learning_rate": 0.0002761363326019693, "loss": 4.8138, "mean_token_accuracy": 0.24393232613801957, "num_tokens": 116626754.0, "step": 50915 }, { "entropy": 5.249146509170532, "epoch": 5.033610122578094, "grad_norm": 1.0859375, "learning_rate": 0.0002761010430558173, "loss": 4.5971, "mean_token_accuracy": 0.2591761127114296, "num_tokens": 116636486.0, "step": 50920 }, { "entropy": 5.305322551727295, "epoch": 5.034104389086595, "grad_norm": 1.2578125, "learning_rate": 0.0002760657534825796, "loss": 4.691, "mean_token_accuracy": 0.2447580635547638, "num_tokens": 116647455.0, "step": 50925 }, { "entropy": 5.340738344192505, "epoch": 5.034598655595097, "grad_norm": 1.140625, "learning_rate": 0.00027603046388312416, "loss": 4.735, "mean_token_accuracy": 0.2424795389175415, "num_tokens": 116659505.0, "step": 50930 }, { "entropy": 5.283910465240479, "epoch": 5.0350929221035985, "grad_norm": 1.078125, "learning_rate": 0.00027599517425831916, "loss": 4.6577, "mean_token_accuracy": 0.24771107882261276, "num_tokens": 116672275.0, "step": 50935 }, { "entropy": 5.255203056335449, "epoch": 5.0355871886121, "grad_norm": 1.125, "learning_rate": 0.00027595988460903266, "loss": 4.631, "mean_token_accuracy": 0.24376793950796127, "num_tokens": 116684834.0, "step": 50940 }, { "entropy": 5.313797855377198, "epoch": 5.036081455120601, "grad_norm": 1.1953125, "learning_rate": 0.0002759245949361329, "loss": 4.7592, "mean_token_accuracy": 0.24584122449159623, "num_tokens": 116696651.0, "step": 50945 }, { "entropy": 5.229893350601197, "epoch": 5.036575721629102, "grad_norm": 1.140625, "learning_rate": 0.0002758893052404879, "loss": 4.6101, "mean_token_accuracy": 0.2573116883635521, "num_tokens": 116707726.0, "step": 50950 }, { "entropy": 5.374856472015381, "epoch": 5.0370699881376035, "grad_norm": 1.0390625, "learning_rate": 0.0002758540155229659, "loss": 4.7678, "mean_token_accuracy": 0.23855805397033691, "num_tokens": 116720014.0, "step": 50955 }, { "entropy": 5.286119890213013, "epoch": 5.037564254646105, "grad_norm": 1.109375, "learning_rate": 0.000275818725784435, "loss": 4.6115, "mean_token_accuracy": 0.2592913120985031, "num_tokens": 116731361.0, "step": 50960 }, { "entropy": 5.284363269805908, "epoch": 5.038058521154607, "grad_norm": 1.03125, "learning_rate": 0.0002757834360257633, "loss": 4.688, "mean_token_accuracy": 0.25693379491567614, "num_tokens": 116742962.0, "step": 50965 }, { "entropy": 5.273931789398193, "epoch": 5.038552787663108, "grad_norm": 1.0546875, "learning_rate": 0.0002757481462478189, "loss": 4.6832, "mean_token_accuracy": 0.2535900086164474, "num_tokens": 116756177.0, "step": 50970 }, { "entropy": 5.253196287155151, "epoch": 5.0390470541716095, "grad_norm": 1.1484375, "learning_rate": 0.00027571285645147013, "loss": 4.6752, "mean_token_accuracy": 0.24943776577711105, "num_tokens": 116766671.0, "step": 50975 }, { "entropy": 5.270780277252197, "epoch": 5.039541320680111, "grad_norm": 1.234375, "learning_rate": 0.00027567756663758494, "loss": 4.6812, "mean_token_accuracy": 0.24476251304149627, "num_tokens": 116777815.0, "step": 50980 }, { "entropy": 5.279926204681397, "epoch": 5.040035587188612, "grad_norm": 1.1171875, "learning_rate": 0.0002756422768070314, "loss": 4.6397, "mean_token_accuracy": 0.2511684939265251, "num_tokens": 116788125.0, "step": 50985 }, { "entropy": 5.340728044509888, "epoch": 5.040529853697113, "grad_norm": 1.0546875, "learning_rate": 0.00027560698696067775, "loss": 4.7547, "mean_token_accuracy": 0.24343528151512145, "num_tokens": 116800548.0, "step": 50990 }, { "entropy": 5.249677515029907, "epoch": 5.0410241202056145, "grad_norm": 1.0546875, "learning_rate": 0.00027557169709939227, "loss": 4.6003, "mean_token_accuracy": 0.25570170432329176, "num_tokens": 116812807.0, "step": 50995 }, { "entropy": 5.337784385681152, "epoch": 5.041518386714117, "grad_norm": 1.1796875, "learning_rate": 0.00027553640722404284, "loss": 4.7303, "mean_token_accuracy": 0.24665698856115342, "num_tokens": 116823751.0, "step": 51000 }, { "epoch": 5.041518386714117, "eval_entropy": 5.057314232559955, "eval_loss": 4.858959197998047, "eval_mean_token_accuracy": 0.24495218693476908, "eval_num_tokens": 116823751.0, "eval_runtime": 26.6, "eval_samples_per_second": 1222.294, "eval_steps_per_second": 152.82, "step": 51000 }, { "entropy": 5.26634783744812, "epoch": 5.042012653222618, "grad_norm": 1.078125, "learning_rate": 0.00027550111733549775, "loss": 4.6826, "mean_token_accuracy": 0.2523290291428566, "num_tokens": 116834903.0, "step": 51005 }, { "entropy": 5.262899160385132, "epoch": 5.042506919731119, "grad_norm": 1.0859375, "learning_rate": 0.00027546582743462507, "loss": 4.6215, "mean_token_accuracy": 0.2513506323099136, "num_tokens": 116846399.0, "step": 51010 }, { "entropy": 5.349827718734741, "epoch": 5.0430011862396205, "grad_norm": 1.109375, "learning_rate": 0.00027543053752229296, "loss": 4.6711, "mean_token_accuracy": 0.24725883156061174, "num_tokens": 116858114.0, "step": 51015 }, { "entropy": 5.293020248413086, "epoch": 5.043495452748122, "grad_norm": 1.03125, "learning_rate": 0.0002753952475993696, "loss": 4.6978, "mean_token_accuracy": 0.2564500868320465, "num_tokens": 116869447.0, "step": 51020 }, { "entropy": 5.222346019744873, "epoch": 5.043989719256623, "grad_norm": 1.09375, "learning_rate": 0.00027535995766672313, "loss": 4.6078, "mean_token_accuracy": 0.25222009122371675, "num_tokens": 116880527.0, "step": 51025 }, { "entropy": 5.219427013397217, "epoch": 5.044483985765124, "grad_norm": 1.1484375, "learning_rate": 0.00027532466772522155, "loss": 4.6298, "mean_token_accuracy": 0.25039167106151583, "num_tokens": 116892521.0, "step": 51030 }, { "entropy": 5.290518569946289, "epoch": 5.0449782522736255, "grad_norm": 1.046875, "learning_rate": 0.000275289377775733, "loss": 4.7522, "mean_token_accuracy": 0.24728820472955704, "num_tokens": 116905032.0, "step": 51035 }, { "entropy": 5.293419408798218, "epoch": 5.045472518782128, "grad_norm": 1.0859375, "learning_rate": 0.0002752540878191259, "loss": 4.6955, "mean_token_accuracy": 0.24862765222787858, "num_tokens": 116916388.0, "step": 51040 }, { "entropy": 5.3146748542785645, "epoch": 5.045966785290629, "grad_norm": 1.21875, "learning_rate": 0.0002752187978562681, "loss": 4.6319, "mean_token_accuracy": 0.25198309272527697, "num_tokens": 116928825.0, "step": 51045 }, { "entropy": 5.389971160888672, "epoch": 5.04646105179913, "grad_norm": 1.1171875, "learning_rate": 0.00027518350788802794, "loss": 4.7767, "mean_token_accuracy": 0.24361299574375153, "num_tokens": 116940230.0, "step": 51050 }, { "entropy": 5.289988374710083, "epoch": 5.046955318307631, "grad_norm": 1.3125, "learning_rate": 0.00027514821791527335, "loss": 4.6642, "mean_token_accuracy": 0.2567900881171227, "num_tokens": 116951967.0, "step": 51055 }, { "entropy": 5.379084491729737, "epoch": 5.047449584816133, "grad_norm": 1.0546875, "learning_rate": 0.0002751129279388726, "loss": 4.802, "mean_token_accuracy": 0.23649494647979735, "num_tokens": 116962727.0, "step": 51060 }, { "entropy": 5.272632026672364, "epoch": 5.047943851324634, "grad_norm": 1.171875, "learning_rate": 0.0002750776379596938, "loss": 4.6309, "mean_token_accuracy": 0.25486159324645996, "num_tokens": 116974429.0, "step": 51065 }, { "entropy": 5.275061511993409, "epoch": 5.048438117833135, "grad_norm": 1.1015625, "learning_rate": 0.00027504234797860516, "loss": 4.7197, "mean_token_accuracy": 0.24848200976848603, "num_tokens": 116986095.0, "step": 51070 }, { "entropy": 5.285924911499023, "epoch": 5.048932384341637, "grad_norm": 1.1328125, "learning_rate": 0.0002750070579964747, "loss": 4.6454, "mean_token_accuracy": 0.25605944395065305, "num_tokens": 116997725.0, "step": 51075 }, { "entropy": 5.267214727401734, "epoch": 5.049426650850139, "grad_norm": 1.171875, "learning_rate": 0.0002749717680141707, "loss": 4.6197, "mean_token_accuracy": 0.260746631026268, "num_tokens": 117007764.0, "step": 51080 }, { "entropy": 5.229416847229004, "epoch": 5.04992091735864, "grad_norm": 1.046875, "learning_rate": 0.0002749364780325611, "loss": 4.6653, "mean_token_accuracy": 0.2568840026855469, "num_tokens": 117019289.0, "step": 51085 }, { "entropy": 5.251974773406983, "epoch": 5.050415183867141, "grad_norm": 1.125, "learning_rate": 0.0002749011880525142, "loss": 4.6833, "mean_token_accuracy": 0.24806411266326905, "num_tokens": 117030397.0, "step": 51090 }, { "entropy": 5.275615882873535, "epoch": 5.050909450375642, "grad_norm": 0.98046875, "learning_rate": 0.000274865898074898, "loss": 4.684, "mean_token_accuracy": 0.2522835597395897, "num_tokens": 117042224.0, "step": 51095 }, { "entropy": 5.3688500881195065, "epoch": 5.051403716884144, "grad_norm": 1.203125, "learning_rate": 0.00027483060810058085, "loss": 4.7464, "mean_token_accuracy": 0.2454526886343956, "num_tokens": 117053172.0, "step": 51100 }, { "entropy": 5.339156293869019, "epoch": 5.051897983392645, "grad_norm": 1.125, "learning_rate": 0.00027479531813043073, "loss": 4.7251, "mean_token_accuracy": 0.23948660641908645, "num_tokens": 117065171.0, "step": 51105 }, { "entropy": 5.2800546169281, "epoch": 5.052392249901147, "grad_norm": 1.0625, "learning_rate": 0.0002747600281653158, "loss": 4.6887, "mean_token_accuracy": 0.255174295604229, "num_tokens": 117076718.0, "step": 51110 }, { "entropy": 5.307605981826782, "epoch": 5.052886516409648, "grad_norm": 1.0703125, "learning_rate": 0.0002747247382061042, "loss": 4.7064, "mean_token_accuracy": 0.2506124898791313, "num_tokens": 117089439.0, "step": 51115 }, { "entropy": 5.351280307769775, "epoch": 5.05338078291815, "grad_norm": 1.1875, "learning_rate": 0.00027468944825366406, "loss": 4.6977, "mean_token_accuracy": 0.23933766037225723, "num_tokens": 117102022.0, "step": 51120 }, { "entropy": 5.29838604927063, "epoch": 5.053875049426651, "grad_norm": 1.0625, "learning_rate": 0.00027465415830886357, "loss": 4.6873, "mean_token_accuracy": 0.24916392415761948, "num_tokens": 117113379.0, "step": 51125 }, { "entropy": 5.274610471725464, "epoch": 5.054369315935152, "grad_norm": 1.296875, "learning_rate": 0.0002746188683725709, "loss": 4.6438, "mean_token_accuracy": 0.24893948435783386, "num_tokens": 117123859.0, "step": 51130 }, { "entropy": 5.350523471832275, "epoch": 5.054863582443653, "grad_norm": 1.171875, "learning_rate": 0.00027458357844565407, "loss": 4.7514, "mean_token_accuracy": 0.24243625104427338, "num_tokens": 117134556.0, "step": 51135 }, { "entropy": 5.26468710899353, "epoch": 5.055357848952155, "grad_norm": 1.09375, "learning_rate": 0.00027454828852898136, "loss": 4.6193, "mean_token_accuracy": 0.2605912730097771, "num_tokens": 117146210.0, "step": 51140 }, { "entropy": 5.292809057235718, "epoch": 5.055852115460657, "grad_norm": 0.9921875, "learning_rate": 0.0002745129986234207, "loss": 4.6784, "mean_token_accuracy": 0.2546195209026337, "num_tokens": 117158932.0, "step": 51145 }, { "entropy": 5.337626838684082, "epoch": 5.056346381969158, "grad_norm": 1.2109375, "learning_rate": 0.00027447770872984035, "loss": 4.7304, "mean_token_accuracy": 0.23931197971105575, "num_tokens": 117170591.0, "step": 51150 }, { "entropy": 5.306822156906128, "epoch": 5.056840648477659, "grad_norm": 1.140625, "learning_rate": 0.0002744424188491085, "loss": 4.7396, "mean_token_accuracy": 0.2465837061405182, "num_tokens": 117182513.0, "step": 51155 }, { "entropy": 5.2628988265991214, "epoch": 5.057334914986161, "grad_norm": 1.1796875, "learning_rate": 0.00027440712898209324, "loss": 4.6432, "mean_token_accuracy": 0.24581001102924346, "num_tokens": 117193924.0, "step": 51160 }, { "entropy": 5.268917894363403, "epoch": 5.057829181494662, "grad_norm": 1.109375, "learning_rate": 0.0002743718391296627, "loss": 4.6381, "mean_token_accuracy": 0.25890849977731706, "num_tokens": 117204309.0, "step": 51165 }, { "entropy": 5.3293914794921875, "epoch": 5.058323448003163, "grad_norm": 1.15625, "learning_rate": 0.00027433654929268504, "loss": 4.7407, "mean_token_accuracy": 0.24791801273822783, "num_tokens": 117215936.0, "step": 51170 }, { "entropy": 5.199970960617065, "epoch": 5.058817714511664, "grad_norm": 1.09375, "learning_rate": 0.0002743012594720283, "loss": 4.5871, "mean_token_accuracy": 0.2597485795617104, "num_tokens": 117226392.0, "step": 51175 }, { "entropy": 5.23292121887207, "epoch": 5.059311981020166, "grad_norm": 1.1171875, "learning_rate": 0.0002742659696685607, "loss": 4.6125, "mean_token_accuracy": 0.2593171626329422, "num_tokens": 117238149.0, "step": 51180 }, { "entropy": 5.303282165527344, "epoch": 5.059806247528668, "grad_norm": 1.0703125, "learning_rate": 0.00027423067988315036, "loss": 4.693, "mean_token_accuracy": 0.25081819742918016, "num_tokens": 117248686.0, "step": 51185 }, { "entropy": 5.353799486160279, "epoch": 5.060300514037169, "grad_norm": 1.0390625, "learning_rate": 0.00027419539011666545, "loss": 4.7309, "mean_token_accuracy": 0.24027098715305328, "num_tokens": 117260894.0, "step": 51190 }, { "entropy": 5.278121423721314, "epoch": 5.06079478054567, "grad_norm": 1.0859375, "learning_rate": 0.00027416010036997407, "loss": 4.6985, "mean_token_accuracy": 0.25606450736522673, "num_tokens": 117272860.0, "step": 51195 }, { "entropy": 5.275756168365478, "epoch": 5.061289047054172, "grad_norm": 1.078125, "learning_rate": 0.00027412481064394427, "loss": 4.6875, "mean_token_accuracy": 0.2539641439914703, "num_tokens": 117285068.0, "step": 51200 }, { "entropy": 5.366375255584717, "epoch": 5.061783313562673, "grad_norm": 1.1953125, "learning_rate": 0.0002740895209394444, "loss": 4.7545, "mean_token_accuracy": 0.23772997558116912, "num_tokens": 117297451.0, "step": 51205 }, { "entropy": 5.301423740386963, "epoch": 5.062277580071174, "grad_norm": 1.1640625, "learning_rate": 0.0002740542312573423, "loss": 4.6259, "mean_token_accuracy": 0.2537060290575027, "num_tokens": 117307257.0, "step": 51210 }, { "entropy": 5.269359064102173, "epoch": 5.062771846579675, "grad_norm": 1.1015625, "learning_rate": 0.0002740189415985063, "loss": 4.6606, "mean_token_accuracy": 0.2522635474801064, "num_tokens": 117317920.0, "step": 51215 }, { "entropy": 5.287095451354981, "epoch": 5.0632661130881775, "grad_norm": 1.171875, "learning_rate": 0.0002739836519638046, "loss": 4.7167, "mean_token_accuracy": 0.24904747754335405, "num_tokens": 117328858.0, "step": 51220 }, { "entropy": 5.268568277359009, "epoch": 5.063760379596679, "grad_norm": 1.109375, "learning_rate": 0.0002739483623541051, "loss": 4.6804, "mean_token_accuracy": 0.25296822637319566, "num_tokens": 117340155.0, "step": 51225 }, { "entropy": 5.32505841255188, "epoch": 5.06425464610518, "grad_norm": 0.99609375, "learning_rate": 0.00027391307277027616, "loss": 4.7041, "mean_token_accuracy": 0.24399242848157882, "num_tokens": 117351905.0, "step": 51230 }, { "entropy": 5.364369869232178, "epoch": 5.064748912613681, "grad_norm": 1.046875, "learning_rate": 0.0002738777832131857, "loss": 4.7453, "mean_token_accuracy": 0.24179650992155075, "num_tokens": 117363415.0, "step": 51235 }, { "entropy": 5.278235244750976, "epoch": 5.065243179122183, "grad_norm": 1.1171875, "learning_rate": 0.00027384249368370194, "loss": 4.6927, "mean_token_accuracy": 0.2541768908500671, "num_tokens": 117374073.0, "step": 51240 }, { "entropy": 5.334166145324707, "epoch": 5.065737445630684, "grad_norm": 1.109375, "learning_rate": 0.00027380720418269304, "loss": 4.7071, "mean_token_accuracy": 0.24452720284461976, "num_tokens": 117385208.0, "step": 51245 }, { "entropy": 5.328171253204346, "epoch": 5.066231712139185, "grad_norm": 1.1484375, "learning_rate": 0.00027377191471102716, "loss": 4.7035, "mean_token_accuracy": 0.24763935506343843, "num_tokens": 117396218.0, "step": 51250 }, { "entropy": 5.28312611579895, "epoch": 5.066725978647687, "grad_norm": 1.15625, "learning_rate": 0.00027373662526957235, "loss": 4.615, "mean_token_accuracy": 0.2608413130044937, "num_tokens": 117407453.0, "step": 51255 }, { "entropy": 5.233467054367066, "epoch": 5.0672202451561885, "grad_norm": 1.0078125, "learning_rate": 0.0002737013358591967, "loss": 4.6664, "mean_token_accuracy": 0.24524239748716353, "num_tokens": 117419223.0, "step": 51260 }, { "entropy": 5.245126581192016, "epoch": 5.06771451166469, "grad_norm": 1.1640625, "learning_rate": 0.0002736660464807685, "loss": 4.6074, "mean_token_accuracy": 0.2522110342979431, "num_tokens": 117430182.0, "step": 51265 }, { "entropy": 5.373526859283447, "epoch": 5.068208778173191, "grad_norm": 1.125, "learning_rate": 0.00027363075713515554, "loss": 4.7059, "mean_token_accuracy": 0.2409182608127594, "num_tokens": 117441006.0, "step": 51270 }, { "entropy": 5.273236227035523, "epoch": 5.068703044681692, "grad_norm": 1.15625, "learning_rate": 0.0002735954678232263, "loss": 4.7032, "mean_token_accuracy": 0.2490989774465561, "num_tokens": 117452320.0, "step": 51275 }, { "entropy": 5.251883792877197, "epoch": 5.069197311190194, "grad_norm": 1.140625, "learning_rate": 0.0002735601785458488, "loss": 4.656, "mean_token_accuracy": 0.24976410418748857, "num_tokens": 117462783.0, "step": 51280 }, { "entropy": 5.376624822616577, "epoch": 5.069691577698695, "grad_norm": 1.1796875, "learning_rate": 0.0002735248893038912, "loss": 4.7511, "mean_token_accuracy": 0.23944065123796462, "num_tokens": 117473078.0, "step": 51285 }, { "entropy": 5.2112609386444095, "epoch": 5.070185844207196, "grad_norm": 1.0859375, "learning_rate": 0.0002734896000982215, "loss": 4.5628, "mean_token_accuracy": 0.26147469878196716, "num_tokens": 117484592.0, "step": 51290 }, { "entropy": 5.2628326416015625, "epoch": 5.070680110715698, "grad_norm": 1.078125, "learning_rate": 0.0002734543109297077, "loss": 4.7238, "mean_token_accuracy": 0.24253509044647217, "num_tokens": 117496039.0, "step": 51295 }, { "entropy": 5.264045143127442, "epoch": 5.0711743772241995, "grad_norm": 1.1484375, "learning_rate": 0.00027341902179921825, "loss": 4.7011, "mean_token_accuracy": 0.2498561829328537, "num_tokens": 117507284.0, "step": 51300 }, { "entropy": 5.377263593673706, "epoch": 5.071668643732701, "grad_norm": 1.1484375, "learning_rate": 0.00027338373270762107, "loss": 4.718, "mean_token_accuracy": 0.2379172459244728, "num_tokens": 117519389.0, "step": 51305 }, { "entropy": 5.307904958724976, "epoch": 5.072162910241202, "grad_norm": 1.171875, "learning_rate": 0.0002733484436557844, "loss": 4.6894, "mean_token_accuracy": 0.24838754236698152, "num_tokens": 117530727.0, "step": 51310 }, { "entropy": 5.323824262619018, "epoch": 5.072657176749703, "grad_norm": 1.1953125, "learning_rate": 0.0002733131546445762, "loss": 4.7263, "mean_token_accuracy": 0.2420806035399437, "num_tokens": 117543079.0, "step": 51315 }, { "entropy": 5.3396461486816404, "epoch": 5.0731514432582046, "grad_norm": 1.078125, "learning_rate": 0.00027327786567486463, "loss": 4.7301, "mean_token_accuracy": 0.24457284510135652, "num_tokens": 117555128.0, "step": 51320 }, { "entropy": 5.305529069900513, "epoch": 5.073645709766706, "grad_norm": 1.0703125, "learning_rate": 0.0002732425767475178, "loss": 4.6334, "mean_token_accuracy": 0.25784423053264616, "num_tokens": 117566394.0, "step": 51325 }, { "entropy": 5.302836656570435, "epoch": 5.074139976275208, "grad_norm": 1.15625, "learning_rate": 0.00027320728786340393, "loss": 4.6919, "mean_token_accuracy": 0.24451075494289398, "num_tokens": 117577247.0, "step": 51330 }, { "entropy": 5.264125871658325, "epoch": 5.074634242783709, "grad_norm": 1.078125, "learning_rate": 0.0002731719990233911, "loss": 4.7501, "mean_token_accuracy": 0.24820357114076613, "num_tokens": 117589976.0, "step": 51335 }, { "entropy": 5.328924608230591, "epoch": 5.0751285092922105, "grad_norm": 1.1015625, "learning_rate": 0.0002731367102283474, "loss": 4.7113, "mean_token_accuracy": 0.24687261432409285, "num_tokens": 117599963.0, "step": 51340 }, { "entropy": 5.225184392929077, "epoch": 5.075622775800712, "grad_norm": 1.1484375, "learning_rate": 0.00027310142147914075, "loss": 4.6196, "mean_token_accuracy": 0.25342524647712705, "num_tokens": 117612396.0, "step": 51345 }, { "entropy": 5.238721418380737, "epoch": 5.076117042309213, "grad_norm": 1.1484375, "learning_rate": 0.0002730661327766395, "loss": 4.6756, "mean_token_accuracy": 0.2534433454275131, "num_tokens": 117624815.0, "step": 51350 }, { "entropy": 5.308840799331665, "epoch": 5.076611308817714, "grad_norm": 1.1328125, "learning_rate": 0.00027303084412171166, "loss": 4.7093, "mean_token_accuracy": 0.2479487106204033, "num_tokens": 117636962.0, "step": 51355 }, { "entropy": 5.3268012523651125, "epoch": 5.0771055753262155, "grad_norm": 1.1484375, "learning_rate": 0.0002729955555152254, "loss": 4.7032, "mean_token_accuracy": 0.24934772700071334, "num_tokens": 117648484.0, "step": 51360 }, { "entropy": 5.3308358669281, "epoch": 5.077599841834718, "grad_norm": 1.125, "learning_rate": 0.0002729602669580488, "loss": 4.7236, "mean_token_accuracy": 0.24245707094669341, "num_tokens": 117661590.0, "step": 51365 }, { "entropy": 5.306222724914551, "epoch": 5.078094108343219, "grad_norm": 1.078125, "learning_rate": 0.0002729249784510499, "loss": 4.6685, "mean_token_accuracy": 0.2446040317416191, "num_tokens": 117673860.0, "step": 51370 }, { "entropy": 5.307064056396484, "epoch": 5.07858837485172, "grad_norm": 1.09375, "learning_rate": 0.00027288968999509693, "loss": 4.7735, "mean_token_accuracy": 0.23743697106838227, "num_tokens": 117686602.0, "step": 51375 }, { "entropy": 5.264371538162232, "epoch": 5.0790826413602215, "grad_norm": 1.0546875, "learning_rate": 0.0002728544015910579, "loss": 4.7163, "mean_token_accuracy": 0.25190327763557435, "num_tokens": 117698267.0, "step": 51380 }, { "entropy": 5.262999725341797, "epoch": 5.079576907868723, "grad_norm": 1.1171875, "learning_rate": 0.0002728191132398008, "loss": 4.6284, "mean_token_accuracy": 0.25645981431007386, "num_tokens": 117709542.0, "step": 51385 }, { "entropy": 5.237056303024292, "epoch": 5.080071174377224, "grad_norm": 1.21875, "learning_rate": 0.000272783824942194, "loss": 4.5805, "mean_token_accuracy": 0.259981869161129, "num_tokens": 117720413.0, "step": 51390 }, { "entropy": 5.318583726882935, "epoch": 5.080565440885725, "grad_norm": 1.2265625, "learning_rate": 0.00027274853669910536, "loss": 4.7673, "mean_token_accuracy": 0.24564386457204818, "num_tokens": 117732115.0, "step": 51395 }, { "entropy": 5.247705125808716, "epoch": 5.0810597073942265, "grad_norm": 1.0546875, "learning_rate": 0.00027271324851140314, "loss": 4.6722, "mean_token_accuracy": 0.25017288625240325, "num_tokens": 117742571.0, "step": 51400 }, { "entropy": 5.366797065734863, "epoch": 5.081553973902729, "grad_norm": 1.1484375, "learning_rate": 0.00027267796037995534, "loss": 4.7717, "mean_token_accuracy": 0.23514636009931564, "num_tokens": 117755159.0, "step": 51405 }, { "entropy": 5.34105372428894, "epoch": 5.08204824041123, "grad_norm": 1.171875, "learning_rate": 0.00027264267230563014, "loss": 4.741, "mean_token_accuracy": 0.24329847246408462, "num_tokens": 117765482.0, "step": 51410 }, { "entropy": 5.307419967651367, "epoch": 5.082542506919731, "grad_norm": 1.0546875, "learning_rate": 0.0002726073842892954, "loss": 4.7197, "mean_token_accuracy": 0.24743370562791825, "num_tokens": 117776878.0, "step": 51415 }, { "entropy": 5.24933967590332, "epoch": 5.0830367734282325, "grad_norm": 1.0859375, "learning_rate": 0.00027257209633181937, "loss": 4.6278, "mean_token_accuracy": 0.2550931617617607, "num_tokens": 117788873.0, "step": 51420 }, { "entropy": 5.237240362167358, "epoch": 5.083531039936734, "grad_norm": 1.0078125, "learning_rate": 0.0002725368084340703, "loss": 4.5678, "mean_token_accuracy": 0.2620782032608986, "num_tokens": 117799497.0, "step": 51425 }, { "entropy": 5.313196897506714, "epoch": 5.084025306445235, "grad_norm": 1.15625, "learning_rate": 0.0002725015205969161, "loss": 4.7359, "mean_token_accuracy": 0.23805277347564696, "num_tokens": 117810203.0, "step": 51430 }, { "entropy": 5.251989698410034, "epoch": 5.084519572953736, "grad_norm": 1.0859375, "learning_rate": 0.0002724662328212248, "loss": 4.6602, "mean_token_accuracy": 0.2604252651333809, "num_tokens": 117821057.0, "step": 51435 }, { "entropy": 5.233779668807983, "epoch": 5.085013839462238, "grad_norm": 1.046875, "learning_rate": 0.0002724309451078646, "loss": 4.6445, "mean_token_accuracy": 0.24455168098211288, "num_tokens": 117832294.0, "step": 51440 }, { "entropy": 5.284059143066406, "epoch": 5.08550810597074, "grad_norm": 1.015625, "learning_rate": 0.0002723956574577035, "loss": 4.6636, "mean_token_accuracy": 0.24622811377048492, "num_tokens": 117842909.0, "step": 51445 }, { "entropy": 5.350510454177856, "epoch": 5.086002372479241, "grad_norm": 1.0234375, "learning_rate": 0.0002723603698716097, "loss": 4.7848, "mean_token_accuracy": 0.23609481751918793, "num_tokens": 117855881.0, "step": 51450 }, { "entropy": 5.315020751953125, "epoch": 5.086496638987742, "grad_norm": 1.2109375, "learning_rate": 0.0002723250823504513, "loss": 4.7445, "mean_token_accuracy": 0.25018947422504423, "num_tokens": 117867716.0, "step": 51455 }, { "entropy": 5.296530628204346, "epoch": 5.086990905496243, "grad_norm": 1.15625, "learning_rate": 0.0002722897948950962, "loss": 4.6841, "mean_token_accuracy": 0.25253390073776244, "num_tokens": 117878049.0, "step": 51460 }, { "entropy": 5.371315145492554, "epoch": 5.087485172004745, "grad_norm": 1.0234375, "learning_rate": 0.00027225450750641253, "loss": 4.8139, "mean_token_accuracy": 0.23502296805381775, "num_tokens": 117889593.0, "step": 51465 }, { "entropy": 5.252313566207886, "epoch": 5.087979438513246, "grad_norm": 1.2734375, "learning_rate": 0.0002722192201852683, "loss": 4.6637, "mean_token_accuracy": 0.2567290112376213, "num_tokens": 117900012.0, "step": 51470 }, { "entropy": 5.316760587692261, "epoch": 5.088473705021748, "grad_norm": 1.0703125, "learning_rate": 0.00027218393293253185, "loss": 4.7231, "mean_token_accuracy": 0.24930882304906846, "num_tokens": 117911483.0, "step": 51475 }, { "entropy": 5.299344825744629, "epoch": 5.088967971530249, "grad_norm": 1.140625, "learning_rate": 0.00027214864574907113, "loss": 4.7646, "mean_token_accuracy": 0.2438977599143982, "num_tokens": 117923718.0, "step": 51480 }, { "entropy": 5.253166627883911, "epoch": 5.089462238038751, "grad_norm": 1.0390625, "learning_rate": 0.0002721133586357541, "loss": 4.6561, "mean_token_accuracy": 0.249849833548069, "num_tokens": 117936014.0, "step": 51485 }, { "entropy": 5.272280550003051, "epoch": 5.089956504547252, "grad_norm": 1.1171875, "learning_rate": 0.0002720780715934488, "loss": 4.6349, "mean_token_accuracy": 0.249187108874321, "num_tokens": 117947593.0, "step": 51490 }, { "entropy": 5.374217987060547, "epoch": 5.090450771055753, "grad_norm": 1.109375, "learning_rate": 0.0002720427846230235, "loss": 4.73, "mean_token_accuracy": 0.24395344853401185, "num_tokens": 117959155.0, "step": 51495 }, { "entropy": 5.346504640579224, "epoch": 5.090945037564254, "grad_norm": 1.1171875, "learning_rate": 0.00027200749772534607, "loss": 4.715, "mean_token_accuracy": 0.24601780027151107, "num_tokens": 117970580.0, "step": 51500 }, { "entropy": 5.273640394210815, "epoch": 5.091439304072756, "grad_norm": 1.109375, "learning_rate": 0.00027197221090128476, "loss": 4.6521, "mean_token_accuracy": 0.25189019590616224, "num_tokens": 117983026.0, "step": 51505 }, { "entropy": 5.260152959823609, "epoch": 5.091933570581258, "grad_norm": 1.15625, "learning_rate": 0.0002719369241517075, "loss": 4.7087, "mean_token_accuracy": 0.24754347056150436, "num_tokens": 117994317.0, "step": 51510 }, { "entropy": 5.267887258529663, "epoch": 5.092427837089759, "grad_norm": 1.0703125, "learning_rate": 0.0002719016374774824, "loss": 4.6952, "mean_token_accuracy": 0.24744661450386046, "num_tokens": 118005825.0, "step": 51515 }, { "entropy": 5.366345643997192, "epoch": 5.09292210359826, "grad_norm": 1.1640625, "learning_rate": 0.0002718663508794775, "loss": 4.7177, "mean_token_accuracy": 0.24405981600284576, "num_tokens": 118017437.0, "step": 51520 }, { "entropy": 5.25747447013855, "epoch": 5.093416370106762, "grad_norm": 1.1328125, "learning_rate": 0.0002718310643585608, "loss": 4.6395, "mean_token_accuracy": 0.25678135454654694, "num_tokens": 118029714.0, "step": 51525 }, { "entropy": 5.451819705963135, "epoch": 5.093910636615263, "grad_norm": 1.0234375, "learning_rate": 0.0002717957779156004, "loss": 4.8715, "mean_token_accuracy": 0.23452398777008057, "num_tokens": 118042102.0, "step": 51530 }, { "entropy": 5.381647348403931, "epoch": 5.094404903123764, "grad_norm": 1.1484375, "learning_rate": 0.0002717604915514644, "loss": 4.6736, "mean_token_accuracy": 0.24597008675336837, "num_tokens": 118052985.0, "step": 51535 }, { "entropy": 5.322505617141724, "epoch": 5.094899169632265, "grad_norm": 1.0859375, "learning_rate": 0.0002717252052670208, "loss": 4.7639, "mean_token_accuracy": 0.24331100434064865, "num_tokens": 118064969.0, "step": 51540 }, { "entropy": 5.147585248947143, "epoch": 5.095393436140767, "grad_norm": 1.0625, "learning_rate": 0.0002716899190631377, "loss": 4.5258, "mean_token_accuracy": 0.26336410641670227, "num_tokens": 118076489.0, "step": 51545 }, { "entropy": 5.244887256622315, "epoch": 5.095887702649269, "grad_norm": 1.125, "learning_rate": 0.000271654632940683, "loss": 4.6909, "mean_token_accuracy": 0.2541833683848381, "num_tokens": 118087512.0, "step": 51550 }, { "entropy": 5.379126691818238, "epoch": 5.09638196915777, "grad_norm": 1.0859375, "learning_rate": 0.000271619346900525, "loss": 4.7584, "mean_token_accuracy": 0.24525517970323563, "num_tokens": 118099797.0, "step": 51555 }, { "entropy": 5.268577957153321, "epoch": 5.096876235666271, "grad_norm": 1.0546875, "learning_rate": 0.0002715840609435314, "loss": 4.591, "mean_token_accuracy": 0.25836175978183745, "num_tokens": 118111854.0, "step": 51560 }, { "entropy": 5.33638710975647, "epoch": 5.097370502174773, "grad_norm": 1.1484375, "learning_rate": 0.0002715487750705706, "loss": 4.7445, "mean_token_accuracy": 0.24205303341150283, "num_tokens": 118123901.0, "step": 51565 }, { "entropy": 5.2392387866973875, "epoch": 5.097864768683274, "grad_norm": 1.1484375, "learning_rate": 0.0002715134892825104, "loss": 4.5796, "mean_token_accuracy": 0.2651001542806625, "num_tokens": 118133844.0, "step": 51570 }, { "entropy": 5.279445362091065, "epoch": 5.098359035191775, "grad_norm": 1.1484375, "learning_rate": 0.0002714782035802189, "loss": 4.6828, "mean_token_accuracy": 0.24997508376836777, "num_tokens": 118145978.0, "step": 51575 }, { "entropy": 5.32615385055542, "epoch": 5.098853301700276, "grad_norm": 1.140625, "learning_rate": 0.00027144291796456417, "loss": 4.7513, "mean_token_accuracy": 0.2432667687535286, "num_tokens": 118157532.0, "step": 51580 }, { "entropy": 5.334401416778564, "epoch": 5.0993475682087785, "grad_norm": 1.1328125, "learning_rate": 0.0002714076324364142, "loss": 4.7288, "mean_token_accuracy": 0.2357117772102356, "num_tokens": 118168700.0, "step": 51585 }, { "entropy": 5.303398990631104, "epoch": 5.09984183471728, "grad_norm": 1.21875, "learning_rate": 0.0002713723469966369, "loss": 4.6717, "mean_token_accuracy": 0.24825630486011505, "num_tokens": 118178961.0, "step": 51590 }, { "entropy": 5.298382043838501, "epoch": 5.100336101225781, "grad_norm": 1.28125, "learning_rate": 0.0002713370616461006, "loss": 4.6548, "mean_token_accuracy": 0.24971245229244232, "num_tokens": 118189074.0, "step": 51595 }, { "entropy": 5.329969453811645, "epoch": 5.100830367734282, "grad_norm": 1.1328125, "learning_rate": 0.00027130177638567314, "loss": 4.6924, "mean_token_accuracy": 0.25146829783916474, "num_tokens": 118201606.0, "step": 51600 }, { "entropy": 5.303834915161133, "epoch": 5.101324634242784, "grad_norm": 1.1484375, "learning_rate": 0.00027126649121622247, "loss": 4.7391, "mean_token_accuracy": 0.24344300478696823, "num_tokens": 118212645.0, "step": 51605 }, { "entropy": 5.252542638778687, "epoch": 5.101818900751285, "grad_norm": 1.09375, "learning_rate": 0.0002712312061386168, "loss": 4.6427, "mean_token_accuracy": 0.24846998900175093, "num_tokens": 118223870.0, "step": 51610 }, { "entropy": 5.322938585281372, "epoch": 5.102313167259786, "grad_norm": 1.1015625, "learning_rate": 0.0002711959211537239, "loss": 4.7262, "mean_token_accuracy": 0.24459700137376786, "num_tokens": 118235144.0, "step": 51615 }, { "entropy": 5.271816921234131, "epoch": 5.102807433768288, "grad_norm": 1.109375, "learning_rate": 0.000271160636262412, "loss": 4.6472, "mean_token_accuracy": 0.2514683842658997, "num_tokens": 118246006.0, "step": 51620 }, { "entropy": 5.297314214706421, "epoch": 5.1033017002767895, "grad_norm": 1.109375, "learning_rate": 0.00027112535146554915, "loss": 4.6994, "mean_token_accuracy": 0.24505382627248765, "num_tokens": 118258486.0, "step": 51625 }, { "entropy": 5.336579513549805, "epoch": 5.103795966785291, "grad_norm": 1.15625, "learning_rate": 0.00027109006676400305, "loss": 4.7028, "mean_token_accuracy": 0.24756578505039215, "num_tokens": 118269266.0, "step": 51630 }, { "entropy": 5.307202768325806, "epoch": 5.104290233293792, "grad_norm": 1.1328125, "learning_rate": 0.0002710547821586421, "loss": 4.7441, "mean_token_accuracy": 0.24866348505020142, "num_tokens": 118280586.0, "step": 51635 }, { "entropy": 5.226383209228516, "epoch": 5.104784499802293, "grad_norm": 1.1171875, "learning_rate": 0.0002710194976503341, "loss": 4.6143, "mean_token_accuracy": 0.2538349643349648, "num_tokens": 118292463.0, "step": 51640 }, { "entropy": 5.2067633152008055, "epoch": 5.105278766310795, "grad_norm": 1.1953125, "learning_rate": 0.0002709842132399469, "loss": 4.6241, "mean_token_accuracy": 0.25344966650009154, "num_tokens": 118304777.0, "step": 51645 }, { "entropy": 5.354971027374267, "epoch": 5.105773032819296, "grad_norm": 1.2109375, "learning_rate": 0.0002709489289283488, "loss": 4.7022, "mean_token_accuracy": 0.24317965656518936, "num_tokens": 118315402.0, "step": 51650 }, { "entropy": 5.334447050094605, "epoch": 5.106267299327797, "grad_norm": 1.0546875, "learning_rate": 0.00027091364471640766, "loss": 4.7102, "mean_token_accuracy": 0.2433721512556076, "num_tokens": 118328933.0, "step": 51655 }, { "entropy": 5.251829433441162, "epoch": 5.106761565836299, "grad_norm": 1.0625, "learning_rate": 0.00027087836060499156, "loss": 4.6082, "mean_token_accuracy": 0.2564482569694519, "num_tokens": 118340724.0, "step": 51660 }, { "entropy": 5.296762418746948, "epoch": 5.1072558323448005, "grad_norm": 1.0234375, "learning_rate": 0.0002708430765949684, "loss": 4.7699, "mean_token_accuracy": 0.23945082277059554, "num_tokens": 118353524.0, "step": 51665 }, { "entropy": 5.284958696365356, "epoch": 5.107750098853302, "grad_norm": 1.171875, "learning_rate": 0.00027080779268720616, "loss": 4.657, "mean_token_accuracy": 0.25002265721559525, "num_tokens": 118365038.0, "step": 51670 }, { "entropy": 5.27296633720398, "epoch": 5.108244365361803, "grad_norm": 1.1015625, "learning_rate": 0.0002707725088825728, "loss": 4.6769, "mean_token_accuracy": 0.24696871638298035, "num_tokens": 118377230.0, "step": 51675 }, { "entropy": 5.309058618545532, "epoch": 5.108738631870304, "grad_norm": 1.125, "learning_rate": 0.00027073722518193647, "loss": 4.6387, "mean_token_accuracy": 0.2536747559905052, "num_tokens": 118387407.0, "step": 51680 }, { "entropy": 5.288978242874146, "epoch": 5.109232898378806, "grad_norm": 1.0703125, "learning_rate": 0.00027070194158616514, "loss": 4.6823, "mean_token_accuracy": 0.2490016371011734, "num_tokens": 118398116.0, "step": 51685 }, { "entropy": 5.237459564208985, "epoch": 5.109727164887307, "grad_norm": 1.1484375, "learning_rate": 0.0002706666580961266, "loss": 4.6328, "mean_token_accuracy": 0.251356315612793, "num_tokens": 118409486.0, "step": 51690 }, { "entropy": 5.2037865161895756, "epoch": 5.110221431395809, "grad_norm": 1.15625, "learning_rate": 0.000270631374712689, "loss": 4.5968, "mean_token_accuracy": 0.2589375972747803, "num_tokens": 118420469.0, "step": 51695 }, { "entropy": 5.292125558853149, "epoch": 5.11071569790431, "grad_norm": 1.078125, "learning_rate": 0.00027059609143672024, "loss": 4.7148, "mean_token_accuracy": 0.2504046350717545, "num_tokens": 118431506.0, "step": 51700 }, { "entropy": 5.23886775970459, "epoch": 5.1112099644128115, "grad_norm": 1.1875, "learning_rate": 0.0002705608082690882, "loss": 4.6901, "mean_token_accuracy": 0.25668629109859464, "num_tokens": 118443311.0, "step": 51705 }, { "entropy": 5.2760608196258545, "epoch": 5.111704230921313, "grad_norm": 1.03125, "learning_rate": 0.00027052552521066107, "loss": 4.6659, "mean_token_accuracy": 0.2500570297241211, "num_tokens": 118454997.0, "step": 51710 }, { "entropy": 5.2678611278533936, "epoch": 5.112198497429814, "grad_norm": 1.0546875, "learning_rate": 0.0002704902422623068, "loss": 4.6288, "mean_token_accuracy": 0.2555118530988693, "num_tokens": 118468145.0, "step": 51715 }, { "entropy": 5.305486679077148, "epoch": 5.112692763938315, "grad_norm": 1.015625, "learning_rate": 0.0002704549594248932, "loss": 4.6886, "mean_token_accuracy": 0.24875788688659667, "num_tokens": 118479904.0, "step": 51720 }, { "entropy": 5.196054410934448, "epoch": 5.1131870304468166, "grad_norm": 1.03125, "learning_rate": 0.0002704196766992883, "loss": 4.5668, "mean_token_accuracy": 0.2671535864472389, "num_tokens": 118491227.0, "step": 51725 }, { "entropy": 5.266023302078247, "epoch": 5.113681296955319, "grad_norm": 1.1953125, "learning_rate": 0.00027038439408636004, "loss": 4.6541, "mean_token_accuracy": 0.25617580115795135, "num_tokens": 118501910.0, "step": 51730 }, { "entropy": 5.351049137115479, "epoch": 5.11417556346382, "grad_norm": 1.0859375, "learning_rate": 0.00027034911158697634, "loss": 4.7814, "mean_token_accuracy": 0.2444879412651062, "num_tokens": 118512972.0, "step": 51735 }, { "entropy": 5.191973638534546, "epoch": 5.114669829972321, "grad_norm": 1.1640625, "learning_rate": 0.0002703138292020053, "loss": 4.6789, "mean_token_accuracy": 0.2505947008728981, "num_tokens": 118523105.0, "step": 51740 }, { "entropy": 5.370001173019409, "epoch": 5.1151640964808225, "grad_norm": 1.1328125, "learning_rate": 0.00027027854693231486, "loss": 4.7701, "mean_token_accuracy": 0.23576484322547914, "num_tokens": 118532938.0, "step": 51745 }, { "entropy": 5.360149765014649, "epoch": 5.115658362989324, "grad_norm": 1.109375, "learning_rate": 0.0002702432647787728, "loss": 4.6894, "mean_token_accuracy": 0.24429493695497512, "num_tokens": 118543863.0, "step": 51750 }, { "entropy": 5.314883661270142, "epoch": 5.116152629497825, "grad_norm": 1.140625, "learning_rate": 0.0002702079827422472, "loss": 4.7372, "mean_token_accuracy": 0.2512091562151909, "num_tokens": 118554406.0, "step": 51755 }, { "entropy": 5.2676229000091555, "epoch": 5.116646896006326, "grad_norm": 0.98046875, "learning_rate": 0.00027017270082360585, "loss": 4.6923, "mean_token_accuracy": 0.24895281344652176, "num_tokens": 118566881.0, "step": 51760 }, { "entropy": 5.371098279953003, "epoch": 5.117141162514828, "grad_norm": 1.0859375, "learning_rate": 0.0002701374190237169, "loss": 4.7954, "mean_token_accuracy": 0.23997110724449158, "num_tokens": 118578591.0, "step": 51765 }, { "entropy": 5.351074266433716, "epoch": 5.11763542902333, "grad_norm": 1.0703125, "learning_rate": 0.00027010213734344823, "loss": 4.7356, "mean_token_accuracy": 0.24399936497211455, "num_tokens": 118590618.0, "step": 51770 }, { "entropy": 5.374035787582398, "epoch": 5.118129695531831, "grad_norm": 1.1484375, "learning_rate": 0.00027006685578366774, "loss": 4.7835, "mean_token_accuracy": 0.2357199713587761, "num_tokens": 118603064.0, "step": 51775 }, { "entropy": 5.2251791000366214, "epoch": 5.118623962040332, "grad_norm": 1.1171875, "learning_rate": 0.00027003157434524335, "loss": 4.6063, "mean_token_accuracy": 0.2621436908841133, "num_tokens": 118613604.0, "step": 51780 }, { "entropy": 5.294984531402588, "epoch": 5.1191182285488335, "grad_norm": 1.0859375, "learning_rate": 0.00026999629302904303, "loss": 4.6689, "mean_token_accuracy": 0.24549057185649872, "num_tokens": 118625430.0, "step": 51785 }, { "entropy": 5.204217338562012, "epoch": 5.119612495057335, "grad_norm": 1.0390625, "learning_rate": 0.00026996101183593456, "loss": 4.6453, "mean_token_accuracy": 0.25057216733694077, "num_tokens": 118636844.0, "step": 51790 }, { "entropy": 5.262881851196289, "epoch": 5.120106761565836, "grad_norm": 1.1640625, "learning_rate": 0.0002699257307667861, "loss": 4.679, "mean_token_accuracy": 0.24997058808803557, "num_tokens": 118648143.0, "step": 51795 }, { "entropy": 5.347143459320068, "epoch": 5.120601028074337, "grad_norm": 1.1484375, "learning_rate": 0.00026989044982246536, "loss": 4.7342, "mean_token_accuracy": 0.2464341476559639, "num_tokens": 118659110.0, "step": 51800 }, { "entropy": 5.341040706634521, "epoch": 5.121095294582839, "grad_norm": 1.1484375, "learning_rate": 0.00026985516900384043, "loss": 4.6795, "mean_token_accuracy": 0.24954063445329666, "num_tokens": 118670641.0, "step": 51805 }, { "entropy": 5.336953496932983, "epoch": 5.121589561091341, "grad_norm": 1.1640625, "learning_rate": 0.00026981988831177914, "loss": 4.7883, "mean_token_accuracy": 0.23853349536657334, "num_tokens": 118682308.0, "step": 51810 }, { "entropy": 5.328740501403809, "epoch": 5.122083827599842, "grad_norm": 1.0703125, "learning_rate": 0.00026978460774714934, "loss": 4.7639, "mean_token_accuracy": 0.23772122114896774, "num_tokens": 118695631.0, "step": 51815 }, { "entropy": 5.2471702098846436, "epoch": 5.122578094108343, "grad_norm": 1.0078125, "learning_rate": 0.00026974932731081903, "loss": 4.651, "mean_token_accuracy": 0.25844722241163254, "num_tokens": 118706961.0, "step": 51820 }, { "entropy": 5.310181570053101, "epoch": 5.1230723606168445, "grad_norm": 1.1484375, "learning_rate": 0.000269714047003656, "loss": 4.6757, "mean_token_accuracy": 0.24809779822826386, "num_tokens": 118718809.0, "step": 51825 }, { "entropy": 5.27054271697998, "epoch": 5.123566627125346, "grad_norm": 1.140625, "learning_rate": 0.00026967876682652836, "loss": 4.6559, "mean_token_accuracy": 0.2521665543317795, "num_tokens": 118732278.0, "step": 51830 }, { "entropy": 5.280632019042969, "epoch": 5.124060893633847, "grad_norm": 1.125, "learning_rate": 0.00026964348678030386, "loss": 4.7148, "mean_token_accuracy": 0.24638290405273439, "num_tokens": 118743446.0, "step": 51835 }, { "entropy": 5.322160339355468, "epoch": 5.124555160142349, "grad_norm": 1.1953125, "learning_rate": 0.00026960820686585036, "loss": 4.706, "mean_token_accuracy": 0.24442951381206512, "num_tokens": 118754220.0, "step": 51840 }, { "entropy": 5.3521984100341795, "epoch": 5.12504942665085, "grad_norm": 1.2109375, "learning_rate": 0.00026957292708403594, "loss": 4.7841, "mean_token_accuracy": 0.2420893654227257, "num_tokens": 118765422.0, "step": 51845 }, { "entropy": 5.248721361160278, "epoch": 5.125543693159352, "grad_norm": 1.15625, "learning_rate": 0.0002695376474357281, "loss": 4.6133, "mean_token_accuracy": 0.26154232323169707, "num_tokens": 118777244.0, "step": 51850 }, { "entropy": 5.292483901977539, "epoch": 5.126037959667853, "grad_norm": 1.125, "learning_rate": 0.0002695023679217952, "loss": 4.668, "mean_token_accuracy": 0.2460813820362091, "num_tokens": 118789142.0, "step": 51855 }, { "entropy": 5.3416728496551515, "epoch": 5.126532226176354, "grad_norm": 1.140625, "learning_rate": 0.0002694670885431049, "loss": 4.6976, "mean_token_accuracy": 0.24620849192142485, "num_tokens": 118800697.0, "step": 51860 }, { "entropy": 5.3232848167419435, "epoch": 5.127026492684855, "grad_norm": 1.109375, "learning_rate": 0.00026943180930052497, "loss": 4.7288, "mean_token_accuracy": 0.2550159260630608, "num_tokens": 118813200.0, "step": 51865 }, { "entropy": 5.409914779663086, "epoch": 5.127520759193357, "grad_norm": 1.0, "learning_rate": 0.0002693965301949234, "loss": 4.799, "mean_token_accuracy": 0.23796069025993347, "num_tokens": 118827037.0, "step": 51870 }, { "entropy": 5.272514057159424, "epoch": 5.128015025701859, "grad_norm": 1.1484375, "learning_rate": 0.00026936125122716816, "loss": 4.6457, "mean_token_accuracy": 0.2519144803285599, "num_tokens": 118837579.0, "step": 51875 }, { "entropy": 5.3038746356964115, "epoch": 5.12850929221036, "grad_norm": 1.015625, "learning_rate": 0.0002693259723981269, "loss": 4.6855, "mean_token_accuracy": 0.2504124194383621, "num_tokens": 118849270.0, "step": 51880 }, { "entropy": 5.170465660095215, "epoch": 5.129003558718861, "grad_norm": 1.1171875, "learning_rate": 0.00026929069370866765, "loss": 4.6422, "mean_token_accuracy": 0.2486152321100235, "num_tokens": 118861521.0, "step": 51885 }, { "entropy": 5.2933125495910645, "epoch": 5.129497825227363, "grad_norm": 1.1484375, "learning_rate": 0.00026925541515965826, "loss": 4.6552, "mean_token_accuracy": 0.25538612604141236, "num_tokens": 118872617.0, "step": 51890 }, { "entropy": 5.339510345458985, "epoch": 5.129992091735864, "grad_norm": 1.0234375, "learning_rate": 0.0002692201367519665, "loss": 4.7105, "mean_token_accuracy": 0.2522690325975418, "num_tokens": 118884831.0, "step": 51895 }, { "entropy": 5.241164684295654, "epoch": 5.130486358244365, "grad_norm": 1.140625, "learning_rate": 0.0002691848584864603, "loss": 4.6334, "mean_token_accuracy": 0.2538405731320381, "num_tokens": 118896468.0, "step": 51900 }, { "entropy": 5.235436868667603, "epoch": 5.130980624752866, "grad_norm": 1.1484375, "learning_rate": 0.0002691495803640075, "loss": 4.5929, "mean_token_accuracy": 0.25933749973773956, "num_tokens": 118907605.0, "step": 51905 }, { "entropy": 5.242041778564453, "epoch": 5.131474891261368, "grad_norm": 1.1328125, "learning_rate": 0.00026911430238547586, "loss": 4.6598, "mean_token_accuracy": 0.25393999069929124, "num_tokens": 118919767.0, "step": 51910 }, { "entropy": 5.363014364242554, "epoch": 5.13196915776987, "grad_norm": 1.0703125, "learning_rate": 0.0002690790245517333, "loss": 4.7474, "mean_token_accuracy": 0.23677845895290375, "num_tokens": 118931964.0, "step": 51915 }, { "entropy": 5.264167785644531, "epoch": 5.132463424278371, "grad_norm": 1.109375, "learning_rate": 0.0002690437468636477, "loss": 4.6273, "mean_token_accuracy": 0.25380643308162687, "num_tokens": 118943738.0, "step": 51920 }, { "entropy": 5.321183538436889, "epoch": 5.132957690786872, "grad_norm": 1.1640625, "learning_rate": 0.00026900846932208683, "loss": 4.76, "mean_token_accuracy": 0.2331345036625862, "num_tokens": 118954700.0, "step": 51925 }, { "entropy": 5.30618839263916, "epoch": 5.133451957295374, "grad_norm": 1.265625, "learning_rate": 0.0002689731919279186, "loss": 4.7096, "mean_token_accuracy": 0.24969912469387054, "num_tokens": 118966422.0, "step": 51930 }, { "entropy": 5.3073179721832275, "epoch": 5.133946223803875, "grad_norm": 1.1875, "learning_rate": 0.0002689379146820106, "loss": 4.6823, "mean_token_accuracy": 0.24816905409097673, "num_tokens": 118977166.0, "step": 51935 }, { "entropy": 5.223870849609375, "epoch": 5.134440490312376, "grad_norm": 1.1796875, "learning_rate": 0.00026890263758523104, "loss": 4.5891, "mean_token_accuracy": 0.2615833505988121, "num_tokens": 118987611.0, "step": 51940 }, { "entropy": 5.27802882194519, "epoch": 5.134934756820877, "grad_norm": 1.0625, "learning_rate": 0.0002688673606384475, "loss": 4.6987, "mean_token_accuracy": 0.2523714005947113, "num_tokens": 118998565.0, "step": 51945 }, { "entropy": 5.353179025650024, "epoch": 5.13542902332938, "grad_norm": 1.15625, "learning_rate": 0.00026883208384252785, "loss": 4.7347, "mean_token_accuracy": 0.23810120522975922, "num_tokens": 119009528.0, "step": 51950 }, { "entropy": 5.316327095031738, "epoch": 5.135923289837881, "grad_norm": 1.0390625, "learning_rate": 0.0002687968071983399, "loss": 4.7592, "mean_token_accuracy": 0.24146548062562942, "num_tokens": 119021663.0, "step": 51955 }, { "entropy": 5.373543930053711, "epoch": 5.136417556346382, "grad_norm": 1.0234375, "learning_rate": 0.00026876153070675134, "loss": 4.782, "mean_token_accuracy": 0.24816054701805115, "num_tokens": 119034357.0, "step": 51960 }, { "entropy": 5.3347385883331295, "epoch": 5.136911822854883, "grad_norm": 1.171875, "learning_rate": 0.00026872625436863006, "loss": 4.7015, "mean_token_accuracy": 0.2505513772368431, "num_tokens": 119044049.0, "step": 51965 }, { "entropy": 5.28684549331665, "epoch": 5.137406089363385, "grad_norm": 1.0859375, "learning_rate": 0.0002686909781848441, "loss": 4.6767, "mean_token_accuracy": 0.2506240099668503, "num_tokens": 119055359.0, "step": 51970 }, { "entropy": 5.257515335083008, "epoch": 5.137900355871886, "grad_norm": 1.171875, "learning_rate": 0.00026865570215626095, "loss": 4.5981, "mean_token_accuracy": 0.25270034819841386, "num_tokens": 119065984.0, "step": 51975 }, { "entropy": 5.297820806503296, "epoch": 5.138394622380387, "grad_norm": 1.078125, "learning_rate": 0.00026862042628374855, "loss": 4.6772, "mean_token_accuracy": 0.2540633261203766, "num_tokens": 119077260.0, "step": 51980 }, { "entropy": 5.247831583023071, "epoch": 5.138888888888889, "grad_norm": 1.234375, "learning_rate": 0.00026858515056817463, "loss": 4.7068, "mean_token_accuracy": 0.2407260701060295, "num_tokens": 119088370.0, "step": 51985 }, { "entropy": 5.290091466903687, "epoch": 5.1393831553973905, "grad_norm": 1.1328125, "learning_rate": 0.000268549875010407, "loss": 4.6707, "mean_token_accuracy": 0.25105638056993484, "num_tokens": 119099566.0, "step": 51990 }, { "entropy": 5.333283758163452, "epoch": 5.139877421905892, "grad_norm": 1.1484375, "learning_rate": 0.00026851459961131337, "loss": 4.698, "mean_token_accuracy": 0.24727785885334014, "num_tokens": 119111144.0, "step": 51995 }, { "entropy": 5.306880235671997, "epoch": 5.140371688414393, "grad_norm": 1.15625, "learning_rate": 0.0002684793243717617, "loss": 4.6711, "mean_token_accuracy": 0.2467302516102791, "num_tokens": 119122936.0, "step": 52000 }, { "entropy": 5.292727756500244, "epoch": 5.140865954922894, "grad_norm": 1.109375, "learning_rate": 0.00026844404929261963, "loss": 4.7147, "mean_token_accuracy": 0.24604290425777436, "num_tokens": 119134794.0, "step": 52005 }, { "entropy": 5.2721672534942625, "epoch": 5.141360221431396, "grad_norm": 1.0859375, "learning_rate": 0.0002684087743747549, "loss": 4.6699, "mean_token_accuracy": 0.24657227247953414, "num_tokens": 119146114.0, "step": 52010 }, { "entropy": 5.309328985214234, "epoch": 5.141854487939897, "grad_norm": 0.96875, "learning_rate": 0.00026837349961903546, "loss": 4.7458, "mean_token_accuracy": 0.24034470617771148, "num_tokens": 119158137.0, "step": 52015 }, { "entropy": 5.392049884796142, "epoch": 5.142348754448399, "grad_norm": 1.0546875, "learning_rate": 0.0002683382250263289, "loss": 4.7357, "mean_token_accuracy": 0.2376552030444145, "num_tokens": 119170422.0, "step": 52020 }, { "entropy": 5.23318772315979, "epoch": 5.1428430209569, "grad_norm": 1.0625, "learning_rate": 0.00026830295059750305, "loss": 4.5747, "mean_token_accuracy": 0.259259520471096, "num_tokens": 119182250.0, "step": 52025 }, { "entropy": 5.353585815429687, "epoch": 5.1433372874654015, "grad_norm": 1.265625, "learning_rate": 0.0002682676763334256, "loss": 4.752, "mean_token_accuracy": 0.24407225400209426, "num_tokens": 119192810.0, "step": 52030 }, { "entropy": 5.303802394866944, "epoch": 5.143831553973903, "grad_norm": 1.0546875, "learning_rate": 0.00026823240223496444, "loss": 4.6455, "mean_token_accuracy": 0.25390292406082154, "num_tokens": 119203754.0, "step": 52035 }, { "entropy": 5.265208005905151, "epoch": 5.144325820482404, "grad_norm": 1.2421875, "learning_rate": 0.0002681971283029872, "loss": 4.6843, "mean_token_accuracy": 0.24654948264360427, "num_tokens": 119214956.0, "step": 52040 }, { "entropy": 5.294733238220215, "epoch": 5.144820086990905, "grad_norm": 1.0625, "learning_rate": 0.00026816185453836167, "loss": 4.6638, "mean_token_accuracy": 0.25465783327817915, "num_tokens": 119227608.0, "step": 52045 }, { "entropy": 5.374356460571289, "epoch": 5.145314353499407, "grad_norm": 1.078125, "learning_rate": 0.0002681265809419555, "loss": 4.7837, "mean_token_accuracy": 0.2385628342628479, "num_tokens": 119239700.0, "step": 52050 }, { "entropy": 5.344587516784668, "epoch": 5.145808620007908, "grad_norm": 1.0859375, "learning_rate": 0.0002680913075146366, "loss": 4.7172, "mean_token_accuracy": 0.24734630733728408, "num_tokens": 119250803.0, "step": 52055 }, { "entropy": 5.264275121688843, "epoch": 5.14630288651641, "grad_norm": 1.0625, "learning_rate": 0.00026805603425727255, "loss": 4.6578, "mean_token_accuracy": 0.25558852553367617, "num_tokens": 119261574.0, "step": 52060 }, { "entropy": 5.253581142425537, "epoch": 5.146797153024911, "grad_norm": 1.1484375, "learning_rate": 0.0002680207611707312, "loss": 4.6704, "mean_token_accuracy": 0.25690223425626757, "num_tokens": 119274558.0, "step": 52065 }, { "entropy": 5.333030748367309, "epoch": 5.1472914195334125, "grad_norm": 1.109375, "learning_rate": 0.00026798548825588016, "loss": 4.69, "mean_token_accuracy": 0.24532731026411056, "num_tokens": 119286262.0, "step": 52070 }, { "entropy": 5.335546827316284, "epoch": 5.147785686041914, "grad_norm": 1.21875, "learning_rate": 0.0002679502155135872, "loss": 4.7917, "mean_token_accuracy": 0.2499406859278679, "num_tokens": 119297345.0, "step": 52075 }, { "entropy": 5.2985435962677006, "epoch": 5.148279952550415, "grad_norm": 1.234375, "learning_rate": 0.00026791494294472004, "loss": 4.6853, "mean_token_accuracy": 0.2462422251701355, "num_tokens": 119309356.0, "step": 52080 }, { "entropy": 5.314981889724732, "epoch": 5.148774219058916, "grad_norm": 1.0234375, "learning_rate": 0.00026787967055014633, "loss": 4.6959, "mean_token_accuracy": 0.2441386952996254, "num_tokens": 119321614.0, "step": 52085 }, { "entropy": 5.257158517837524, "epoch": 5.149268485567418, "grad_norm": 1.1875, "learning_rate": 0.00026784439833073395, "loss": 4.5787, "mean_token_accuracy": 0.2599606066942215, "num_tokens": 119332568.0, "step": 52090 }, { "entropy": 5.151639223098755, "epoch": 5.14976275207592, "grad_norm": 1.1015625, "learning_rate": 0.0002678091262873504, "loss": 4.5477, "mean_token_accuracy": 0.26201648712158204, "num_tokens": 119343424.0, "step": 52095 }, { "entropy": 5.252702713012695, "epoch": 5.150257018584421, "grad_norm": 1.171875, "learning_rate": 0.0002677738544208635, "loss": 4.6838, "mean_token_accuracy": 0.24938495457172394, "num_tokens": 119354630.0, "step": 52100 }, { "entropy": 5.2754778385162355, "epoch": 5.150751285092922, "grad_norm": 1.125, "learning_rate": 0.00026773858273214087, "loss": 4.7066, "mean_token_accuracy": 0.248318612575531, "num_tokens": 119365222.0, "step": 52105 }, { "entropy": 5.260428333282471, "epoch": 5.1512455516014235, "grad_norm": 1.15625, "learning_rate": 0.0002677033112220501, "loss": 4.6114, "mean_token_accuracy": 0.2589202433824539, "num_tokens": 119377510.0, "step": 52110 }, { "entropy": 5.337987756729126, "epoch": 5.151739818109925, "grad_norm": 1.1328125, "learning_rate": 0.0002676680398914592, "loss": 4.7409, "mean_token_accuracy": 0.2488446205854416, "num_tokens": 119389168.0, "step": 52115 }, { "entropy": 5.269764518737793, "epoch": 5.152234084618426, "grad_norm": 1.1953125, "learning_rate": 0.0002676327687412356, "loss": 4.6448, "mean_token_accuracy": 0.24998245239257813, "num_tokens": 119399739.0, "step": 52120 }, { "entropy": 5.350704622268677, "epoch": 5.152728351126927, "grad_norm": 1.0703125, "learning_rate": 0.0002675974977722471, "loss": 4.7754, "mean_token_accuracy": 0.23867651373147963, "num_tokens": 119411654.0, "step": 52125 }, { "entropy": 5.326960325241089, "epoch": 5.153222617635429, "grad_norm": 1.0859375, "learning_rate": 0.0002675622269853612, "loss": 4.7668, "mean_token_accuracy": 0.24483895003795625, "num_tokens": 119423003.0, "step": 52130 }, { "entropy": 5.325661993026733, "epoch": 5.153716884143931, "grad_norm": 1.140625, "learning_rate": 0.0002675269563814457, "loss": 4.6753, "mean_token_accuracy": 0.25535333901643753, "num_tokens": 119435359.0, "step": 52135 }, { "entropy": 5.27390341758728, "epoch": 5.154211150652432, "grad_norm": 1.2265625, "learning_rate": 0.00026749168596136813, "loss": 4.7076, "mean_token_accuracy": 0.24889658242464066, "num_tokens": 119445740.0, "step": 52140 }, { "entropy": 5.302455711364746, "epoch": 5.154705417160933, "grad_norm": 1.1328125, "learning_rate": 0.00026745641572599644, "loss": 4.7244, "mean_token_accuracy": 0.24969217628240586, "num_tokens": 119456862.0, "step": 52145 }, { "entropy": 5.34647765159607, "epoch": 5.1551996836694345, "grad_norm": 1.140625, "learning_rate": 0.000267421145676198, "loss": 4.7395, "mean_token_accuracy": 0.24273741692304612, "num_tokens": 119469405.0, "step": 52150 }, { "entropy": 5.211421918869019, "epoch": 5.155693950177936, "grad_norm": 1.203125, "learning_rate": 0.0002673858758128405, "loss": 4.5867, "mean_token_accuracy": 0.25706051141023634, "num_tokens": 119481739.0, "step": 52155 }, { "entropy": 5.23999810218811, "epoch": 5.156188216686437, "grad_norm": 1.0625, "learning_rate": 0.00026735060613679177, "loss": 4.663, "mean_token_accuracy": 0.2504904016852379, "num_tokens": 119494542.0, "step": 52160 }, { "entropy": 5.309938621520996, "epoch": 5.156682483194938, "grad_norm": 1.0390625, "learning_rate": 0.00026731533664891926, "loss": 4.6977, "mean_token_accuracy": 0.2499018982052803, "num_tokens": 119506360.0, "step": 52165 }, { "entropy": 5.376883840560913, "epoch": 5.15717674970344, "grad_norm": 1.1640625, "learning_rate": 0.00026728006735009057, "loss": 4.7774, "mean_token_accuracy": 0.24295531809329987, "num_tokens": 119517401.0, "step": 52170 }, { "entropy": 5.262770366668701, "epoch": 5.157671016211942, "grad_norm": 1.1875, "learning_rate": 0.00026724479824117355, "loss": 4.628, "mean_token_accuracy": 0.2557032734155655, "num_tokens": 119528486.0, "step": 52175 }, { "entropy": 5.343741035461425, "epoch": 5.158165282720443, "grad_norm": 1.09375, "learning_rate": 0.0002672095293230356, "loss": 4.7662, "mean_token_accuracy": 0.2445943534374237, "num_tokens": 119539549.0, "step": 52180 }, { "entropy": 5.277260684967041, "epoch": 5.158659549228944, "grad_norm": 1.15625, "learning_rate": 0.00026717426059654447, "loss": 4.6651, "mean_token_accuracy": 0.25477796941995623, "num_tokens": 119550895.0, "step": 52185 }, { "entropy": 5.297889471054077, "epoch": 5.1591538157374455, "grad_norm": 1.109375, "learning_rate": 0.0002671389920625678, "loss": 4.6684, "mean_token_accuracy": 0.25821276307106017, "num_tokens": 119561950.0, "step": 52190 }, { "entropy": 5.279378461837768, "epoch": 5.159648082245947, "grad_norm": 1.1953125, "learning_rate": 0.00026710372372197306, "loss": 4.7285, "mean_token_accuracy": 0.24108315706253053, "num_tokens": 119573002.0, "step": 52195 }, { "entropy": 5.303028106689453, "epoch": 5.160142348754448, "grad_norm": 1.109375, "learning_rate": 0.000267068455575628, "loss": 4.5949, "mean_token_accuracy": 0.2579564079642296, "num_tokens": 119585056.0, "step": 52200 }, { "entropy": 5.234138631820679, "epoch": 5.16063661526295, "grad_norm": 1.1953125, "learning_rate": 0.00026703318762440003, "loss": 4.6663, "mean_token_accuracy": 0.25112451761960985, "num_tokens": 119597048.0, "step": 52205 }, { "entropy": 5.32590012550354, "epoch": 5.161130881771451, "grad_norm": 1.1328125, "learning_rate": 0.0002669979198691571, "loss": 4.7456, "mean_token_accuracy": 0.245346362888813, "num_tokens": 119609094.0, "step": 52210 }, { "entropy": 5.281382989883423, "epoch": 5.161625148279953, "grad_norm": 1.2109375, "learning_rate": 0.0002669626523107664, "loss": 4.6818, "mean_token_accuracy": 0.24835965782403946, "num_tokens": 119619598.0, "step": 52215 }, { "entropy": 5.298113632202148, "epoch": 5.162119414788454, "grad_norm": 1.0546875, "learning_rate": 0.0002669273849500958, "loss": 4.6413, "mean_token_accuracy": 0.2558857426047325, "num_tokens": 119632024.0, "step": 52220 }, { "entropy": 5.366993379592896, "epoch": 5.162613681296955, "grad_norm": 1.0078125, "learning_rate": 0.0002668921177880128, "loss": 4.7567, "mean_token_accuracy": 0.24288102090358735, "num_tokens": 119644609.0, "step": 52225 }, { "entropy": 5.317667293548584, "epoch": 5.1631079478054565, "grad_norm": 1.046875, "learning_rate": 0.00026685685082538486, "loss": 4.7206, "mean_token_accuracy": 0.24588739573955537, "num_tokens": 119657029.0, "step": 52230 }, { "entropy": 5.286806583404541, "epoch": 5.163602214313958, "grad_norm": 1.234375, "learning_rate": 0.00026682158406307973, "loss": 4.7175, "mean_token_accuracy": 0.2517784103751183, "num_tokens": 119669104.0, "step": 52235 }, { "entropy": 5.240847253799439, "epoch": 5.16409648082246, "grad_norm": 1.1171875, "learning_rate": 0.00026678631750196485, "loss": 4.7084, "mean_token_accuracy": 0.2510884076356888, "num_tokens": 119679772.0, "step": 52240 }, { "entropy": 5.283333253860474, "epoch": 5.164590747330961, "grad_norm": 1.1796875, "learning_rate": 0.00026675105114290786, "loss": 4.669, "mean_token_accuracy": 0.25536770820617677, "num_tokens": 119691481.0, "step": 52245 }, { "entropy": 5.240502500534058, "epoch": 5.165085013839462, "grad_norm": 1.25, "learning_rate": 0.00026671578498677637, "loss": 4.6503, "mean_token_accuracy": 0.2543665647506714, "num_tokens": 119703593.0, "step": 52250 }, { "entropy": 5.295808029174805, "epoch": 5.165579280347964, "grad_norm": 1.0859375, "learning_rate": 0.0002666805190344377, "loss": 4.6781, "mean_token_accuracy": 0.253509184718132, "num_tokens": 119715362.0, "step": 52255 }, { "entropy": 5.285721492767334, "epoch": 5.166073546856465, "grad_norm": 1.09375, "learning_rate": 0.00026664525328675965, "loss": 4.7123, "mean_token_accuracy": 0.24649003148078918, "num_tokens": 119726975.0, "step": 52260 }, { "entropy": 5.227625322341919, "epoch": 5.166567813364966, "grad_norm": 1.109375, "learning_rate": 0.00026660998774460964, "loss": 4.5928, "mean_token_accuracy": 0.2601802423596382, "num_tokens": 119738093.0, "step": 52265 }, { "entropy": 5.313509464263916, "epoch": 5.167062079873467, "grad_norm": 1.078125, "learning_rate": 0.00026657472240885523, "loss": 4.7324, "mean_token_accuracy": 0.2500416532158852, "num_tokens": 119750136.0, "step": 52270 }, { "entropy": 5.2474452495574955, "epoch": 5.16755634638197, "grad_norm": 1.078125, "learning_rate": 0.000266539457280364, "loss": 4.6446, "mean_token_accuracy": 0.25532484650611875, "num_tokens": 119760954.0, "step": 52275 }, { "entropy": 5.2407886505126955, "epoch": 5.168050612890471, "grad_norm": 1.1484375, "learning_rate": 0.0002665041923600034, "loss": 4.5895, "mean_token_accuracy": 0.25263047963380814, "num_tokens": 119771330.0, "step": 52280 }, { "entropy": 5.2243751049041744, "epoch": 5.168544879398972, "grad_norm": 1.1171875, "learning_rate": 0.00026646892764864096, "loss": 4.6718, "mean_token_accuracy": 0.2564418241381645, "num_tokens": 119782269.0, "step": 52285 }, { "entropy": 5.276740694046021, "epoch": 5.169039145907473, "grad_norm": 1.0625, "learning_rate": 0.00026643366314714424, "loss": 4.7302, "mean_token_accuracy": 0.23915645629167556, "num_tokens": 119793671.0, "step": 52290 }, { "entropy": 5.286659002304077, "epoch": 5.169533412415975, "grad_norm": 1.0625, "learning_rate": 0.00026639839885638075, "loss": 4.6499, "mean_token_accuracy": 0.251363579928875, "num_tokens": 119804416.0, "step": 52295 }, { "entropy": 5.272660970687866, "epoch": 5.170027678924476, "grad_norm": 1.171875, "learning_rate": 0.00026636313477721796, "loss": 4.618, "mean_token_accuracy": 0.2534186363220215, "num_tokens": 119816269.0, "step": 52300 }, { "entropy": 5.2957947731018065, "epoch": 5.170521945432977, "grad_norm": 1.2578125, "learning_rate": 0.00026632787091052345, "loss": 4.683, "mean_token_accuracy": 0.2463958218693733, "num_tokens": 119827899.0, "step": 52305 }, { "entropy": 5.342215728759766, "epoch": 5.171016211941478, "grad_norm": 1.1484375, "learning_rate": 0.00026629260725716464, "loss": 4.6796, "mean_token_accuracy": 0.2444053500890732, "num_tokens": 119840300.0, "step": 52310 }, { "entropy": 5.318472576141358, "epoch": 5.171510478449981, "grad_norm": 1.109375, "learning_rate": 0.000266257343818009, "loss": 4.7253, "mean_token_accuracy": 0.24473014920949937, "num_tokens": 119852260.0, "step": 52315 }, { "entropy": 5.251895570755005, "epoch": 5.172004744958482, "grad_norm": 1.109375, "learning_rate": 0.000266222080593924, "loss": 4.6624, "mean_token_accuracy": 0.25457297563552855, "num_tokens": 119864348.0, "step": 52320 }, { "entropy": 5.266898965835571, "epoch": 5.172499011466983, "grad_norm": 1.1171875, "learning_rate": 0.0002661868175857773, "loss": 4.6147, "mean_token_accuracy": 0.2553324595093727, "num_tokens": 119875667.0, "step": 52325 }, { "entropy": 5.277383852005005, "epoch": 5.172993277975484, "grad_norm": 1.0390625, "learning_rate": 0.00026615155479443626, "loss": 4.6405, "mean_token_accuracy": 0.2514821752905846, "num_tokens": 119886944.0, "step": 52330 }, { "entropy": 5.302349328994751, "epoch": 5.173487544483986, "grad_norm": 1.0078125, "learning_rate": 0.00026611629222076825, "loss": 4.7024, "mean_token_accuracy": 0.24775285124778748, "num_tokens": 119898477.0, "step": 52335 }, { "entropy": 5.331802749633789, "epoch": 5.173981810992487, "grad_norm": 1.015625, "learning_rate": 0.00026608102986564093, "loss": 4.7335, "mean_token_accuracy": 0.24269116222858428, "num_tokens": 119910500.0, "step": 52340 }, { "entropy": 5.268471050262451, "epoch": 5.174476077500988, "grad_norm": 1.0234375, "learning_rate": 0.0002660457677299215, "loss": 4.6394, "mean_token_accuracy": 0.25790593326091765, "num_tokens": 119922493.0, "step": 52345 }, { "entropy": 5.354622220993042, "epoch": 5.17497034400949, "grad_norm": 1.15625, "learning_rate": 0.0002660105058144777, "loss": 4.6706, "mean_token_accuracy": 0.24591519236564635, "num_tokens": 119933215.0, "step": 52350 }, { "entropy": 5.321277093887329, "epoch": 5.175464610517992, "grad_norm": 1.09375, "learning_rate": 0.0002659752441201769, "loss": 4.8001, "mean_token_accuracy": 0.24095368683338164, "num_tokens": 119945337.0, "step": 52355 }, { "entropy": 5.262045431137085, "epoch": 5.175958877026493, "grad_norm": 1.125, "learning_rate": 0.00026593998264788643, "loss": 4.6166, "mean_token_accuracy": 0.2545079305768013, "num_tokens": 119955027.0, "step": 52360 }, { "entropy": 5.322196960449219, "epoch": 5.176453143534994, "grad_norm": 1.1015625, "learning_rate": 0.00026590472139847375, "loss": 4.7979, "mean_token_accuracy": 0.24436910450458527, "num_tokens": 119966994.0, "step": 52365 }, { "entropy": 5.276728105545044, "epoch": 5.176947410043495, "grad_norm": 1.1796875, "learning_rate": 0.0002658694603728064, "loss": 4.6386, "mean_token_accuracy": 0.2517379805445671, "num_tokens": 119977412.0, "step": 52370 }, { "entropy": 5.347804689407349, "epoch": 5.177441676551997, "grad_norm": 1.0234375, "learning_rate": 0.00026583419957175165, "loss": 4.7588, "mean_token_accuracy": 0.2424492731690407, "num_tokens": 119990088.0, "step": 52375 }, { "entropy": 5.332733917236328, "epoch": 5.177935943060498, "grad_norm": 1.125, "learning_rate": 0.0002657989389961771, "loss": 4.7059, "mean_token_accuracy": 0.2500728860497475, "num_tokens": 120000284.0, "step": 52380 }, { "entropy": 5.281662034988403, "epoch": 5.178430209569, "grad_norm": 1.0390625, "learning_rate": 0.00026576367864695013, "loss": 4.6471, "mean_token_accuracy": 0.25381528586149216, "num_tokens": 120011805.0, "step": 52385 }, { "entropy": 5.320217514038086, "epoch": 5.178924476077501, "grad_norm": 1.0234375, "learning_rate": 0.000265728418524938, "loss": 4.7248, "mean_token_accuracy": 0.24558564871549607, "num_tokens": 120023391.0, "step": 52390 }, { "entropy": 5.2718507766723635, "epoch": 5.1794187425860025, "grad_norm": 1.1015625, "learning_rate": 0.00026569315863100824, "loss": 4.6333, "mean_token_accuracy": 0.25241448134183886, "num_tokens": 120034613.0, "step": 52395 }, { "entropy": 5.330946588516236, "epoch": 5.179913009094504, "grad_norm": 1.0859375, "learning_rate": 0.00026565789896602817, "loss": 4.779, "mean_token_accuracy": 0.23986578732728958, "num_tokens": 120046843.0, "step": 52400 }, { "entropy": 5.345502042770386, "epoch": 5.180407275603005, "grad_norm": 1.1015625, "learning_rate": 0.0002656226395308653, "loss": 4.7436, "mean_token_accuracy": 0.2453184738755226, "num_tokens": 120058823.0, "step": 52405 }, { "entropy": 5.332313299179077, "epoch": 5.180901542111506, "grad_norm": 1.0546875, "learning_rate": 0.00026558738032638694, "loss": 4.7286, "mean_token_accuracy": 0.2494245231151581, "num_tokens": 120071082.0, "step": 52410 }, { "entropy": 5.3487390041351315, "epoch": 5.181395808620008, "grad_norm": 1.0390625, "learning_rate": 0.00026555212135346044, "loss": 4.8212, "mean_token_accuracy": 0.2387567028403282, "num_tokens": 120084009.0, "step": 52415 }, { "entropy": 5.274907493591309, "epoch": 5.181890075128509, "grad_norm": 1.2578125, "learning_rate": 0.00026551686261295333, "loss": 4.6678, "mean_token_accuracy": 0.24743813276290894, "num_tokens": 120094927.0, "step": 52420 }, { "entropy": 5.300985527038574, "epoch": 5.182384341637011, "grad_norm": 1.1796875, "learning_rate": 0.0002654816041057328, "loss": 4.7264, "mean_token_accuracy": 0.24367655813694, "num_tokens": 120108343.0, "step": 52425 }, { "entropy": 5.304584789276123, "epoch": 5.182878608145512, "grad_norm": 1.1484375, "learning_rate": 0.00026544634583266623, "loss": 4.7071, "mean_token_accuracy": 0.24798854142427446, "num_tokens": 120119660.0, "step": 52430 }, { "entropy": 5.285998821258545, "epoch": 5.1833728746540135, "grad_norm": 1.0859375, "learning_rate": 0.00026541108779462114, "loss": 4.6727, "mean_token_accuracy": 0.24585142135620117, "num_tokens": 120130827.0, "step": 52435 }, { "entropy": 5.305643033981323, "epoch": 5.183867141162515, "grad_norm": 1.0859375, "learning_rate": 0.00026537582999246466, "loss": 4.6621, "mean_token_accuracy": 0.25193188339471817, "num_tokens": 120142243.0, "step": 52440 }, { "entropy": 5.196123218536377, "epoch": 5.184361407671016, "grad_norm": 1.0546875, "learning_rate": 0.0002653405724270644, "loss": 4.5861, "mean_token_accuracy": 0.26045640408992765, "num_tokens": 120153419.0, "step": 52445 }, { "entropy": 5.279943418502808, "epoch": 5.184855674179517, "grad_norm": 1.078125, "learning_rate": 0.00026530531509928745, "loss": 4.6599, "mean_token_accuracy": 0.2560811161994934, "num_tokens": 120165622.0, "step": 52450 }, { "entropy": 5.341957712173462, "epoch": 5.185349940688019, "grad_norm": 1.0703125, "learning_rate": 0.00026527005801000133, "loss": 4.7166, "mean_token_accuracy": 0.24743922501802446, "num_tokens": 120176333.0, "step": 52455 }, { "entropy": 5.296721172332764, "epoch": 5.185844207196521, "grad_norm": 1.046875, "learning_rate": 0.0002652348011600732, "loss": 4.6825, "mean_token_accuracy": 0.24616971611976624, "num_tokens": 120187910.0, "step": 52460 }, { "entropy": 5.2442512035369875, "epoch": 5.186338473705022, "grad_norm": 1.140625, "learning_rate": 0.0002651995445503705, "loss": 4.6755, "mean_token_accuracy": 0.25008628219366075, "num_tokens": 120199169.0, "step": 52465 }, { "entropy": 5.2806487560272215, "epoch": 5.186832740213523, "grad_norm": 1.1640625, "learning_rate": 0.00026516428818176054, "loss": 4.6244, "mean_token_accuracy": 0.2512551933526993, "num_tokens": 120209230.0, "step": 52470 }, { "entropy": 5.319065809249878, "epoch": 5.1873270067220245, "grad_norm": 1.046875, "learning_rate": 0.0002651290320551107, "loss": 4.7365, "mean_token_accuracy": 0.24069249033927917, "num_tokens": 120220681.0, "step": 52475 }, { "entropy": 5.2926740646362305, "epoch": 5.187821273230526, "grad_norm": 1.0234375, "learning_rate": 0.00026509377617128804, "loss": 4.7042, "mean_token_accuracy": 0.24807685166597365, "num_tokens": 120232823.0, "step": 52480 }, { "entropy": 5.331215906143188, "epoch": 5.188315539739027, "grad_norm": 1.0078125, "learning_rate": 0.0002650585205311602, "loss": 4.6911, "mean_token_accuracy": 0.24881658852100372, "num_tokens": 120244319.0, "step": 52485 }, { "entropy": 5.298726558685303, "epoch": 5.188809806247528, "grad_norm": 1.03125, "learning_rate": 0.0002650232651355941, "loss": 4.6556, "mean_token_accuracy": 0.256694620847702, "num_tokens": 120255415.0, "step": 52490 }, { "entropy": 5.287528800964355, "epoch": 5.1893040727560305, "grad_norm": 1.078125, "learning_rate": 0.00026498800998545736, "loss": 4.6816, "mean_token_accuracy": 0.24721550643444062, "num_tokens": 120266074.0, "step": 52495 }, { "entropy": 5.225148439407349, "epoch": 5.189798339264532, "grad_norm": 1.0859375, "learning_rate": 0.0002649527550816171, "loss": 4.6798, "mean_token_accuracy": 0.2497141629457474, "num_tokens": 120277491.0, "step": 52500 }, { "entropy": 5.245315313339233, "epoch": 5.190292605773033, "grad_norm": 1.1953125, "learning_rate": 0.0002649175004249406, "loss": 4.6033, "mean_token_accuracy": 0.25724650323390963, "num_tokens": 120288190.0, "step": 52505 }, { "entropy": 5.22502179145813, "epoch": 5.190786872281534, "grad_norm": 1.265625, "learning_rate": 0.00026488224601629526, "loss": 4.6157, "mean_token_accuracy": 0.2550001174211502, "num_tokens": 120299001.0, "step": 52510 }, { "entropy": 5.241379117965698, "epoch": 5.1912811387900355, "grad_norm": 1.09375, "learning_rate": 0.0002648469918565481, "loss": 4.5871, "mean_token_accuracy": 0.26215454190969467, "num_tokens": 120310965.0, "step": 52515 }, { "entropy": 5.245040988922119, "epoch": 5.191775405298537, "grad_norm": 1.0859375, "learning_rate": 0.00026481173794656653, "loss": 4.6403, "mean_token_accuracy": 0.24899076521396638, "num_tokens": 120322954.0, "step": 52520 }, { "entropy": 5.200983238220215, "epoch": 5.192269671807038, "grad_norm": 1.0546875, "learning_rate": 0.0002647764842872179, "loss": 4.5767, "mean_token_accuracy": 0.25874626487493513, "num_tokens": 120335131.0, "step": 52525 }, { "entropy": 5.203858184814453, "epoch": 5.19276393831554, "grad_norm": 0.9921875, "learning_rate": 0.00026474123087936926, "loss": 4.5878, "mean_token_accuracy": 0.2591703325510025, "num_tokens": 120346068.0, "step": 52530 }, { "entropy": 5.225022792816162, "epoch": 5.193258204824041, "grad_norm": 1.203125, "learning_rate": 0.0002647059777238879, "loss": 4.6298, "mean_token_accuracy": 0.26066632717847826, "num_tokens": 120357781.0, "step": 52535 }, { "entropy": 5.181512880325317, "epoch": 5.193752471332543, "grad_norm": 1.234375, "learning_rate": 0.0002646707248216412, "loss": 4.5312, "mean_token_accuracy": 0.26833189427852633, "num_tokens": 120367910.0, "step": 52540 }, { "entropy": 5.258957719802856, "epoch": 5.194246737841044, "grad_norm": 1.0234375, "learning_rate": 0.0002646354721734962, "loss": 4.653, "mean_token_accuracy": 0.24531923681497575, "num_tokens": 120381215.0, "step": 52545 }, { "entropy": 5.338909864425659, "epoch": 5.194741004349545, "grad_norm": 1.1328125, "learning_rate": 0.0002646002197803201, "loss": 4.7406, "mean_token_accuracy": 0.24854326099157334, "num_tokens": 120392733.0, "step": 52550 }, { "entropy": 5.291522645950318, "epoch": 5.1952352708580465, "grad_norm": 1.1796875, "learning_rate": 0.00026456496764298035, "loss": 4.7207, "mean_token_accuracy": 0.24355419725179672, "num_tokens": 120403668.0, "step": 52555 }, { "entropy": 5.3467999458312985, "epoch": 5.195729537366548, "grad_norm": 1.1171875, "learning_rate": 0.000264529715762344, "loss": 4.7982, "mean_token_accuracy": 0.23590194135904313, "num_tokens": 120416104.0, "step": 52560 }, { "entropy": 5.277906370162964, "epoch": 5.196223803875049, "grad_norm": 1.171875, "learning_rate": 0.00026449446413927816, "loss": 4.6197, "mean_token_accuracy": 0.2541847497224808, "num_tokens": 120426460.0, "step": 52565 }, { "entropy": 5.307222509384156, "epoch": 5.196718070383551, "grad_norm": 1.1640625, "learning_rate": 0.0002644592127746503, "loss": 4.7238, "mean_token_accuracy": 0.23857320994138717, "num_tokens": 120437236.0, "step": 52570 }, { "entropy": 5.289474153518677, "epoch": 5.197212336892052, "grad_norm": 1.1171875, "learning_rate": 0.00026442396166932725, "loss": 4.6757, "mean_token_accuracy": 0.2473506897687912, "num_tokens": 120448054.0, "step": 52575 }, { "entropy": 5.312021160125733, "epoch": 5.197706603400554, "grad_norm": 1.015625, "learning_rate": 0.0002643887108241765, "loss": 4.7307, "mean_token_accuracy": 0.25089711099863055, "num_tokens": 120460284.0, "step": 52580 }, { "entropy": 5.274532318115234, "epoch": 5.198200869909055, "grad_norm": 1.0546875, "learning_rate": 0.0002643534602400651, "loss": 4.699, "mean_token_accuracy": 0.24461843073368073, "num_tokens": 120472268.0, "step": 52585 }, { "entropy": 5.332812070846558, "epoch": 5.198695136417556, "grad_norm": 1.09375, "learning_rate": 0.0002643182099178602, "loss": 4.7459, "mean_token_accuracy": 0.24422868937253953, "num_tokens": 120483117.0, "step": 52590 }, { "entropy": 5.316246604919433, "epoch": 5.1991894029260575, "grad_norm": 1.0234375, "learning_rate": 0.00026428295985842903, "loss": 4.6551, "mean_token_accuracy": 0.24750132411718367, "num_tokens": 120494493.0, "step": 52595 }, { "entropy": 5.278694486618042, "epoch": 5.199683669434559, "grad_norm": 1.0859375, "learning_rate": 0.00026424771006263863, "loss": 4.6512, "mean_token_accuracy": 0.25100384205579757, "num_tokens": 120504737.0, "step": 52600 }, { "entropy": 5.180533313751221, "epoch": 5.200177935943061, "grad_norm": 1.140625, "learning_rate": 0.00026421246053135627, "loss": 4.6042, "mean_token_accuracy": 0.2636828988790512, "num_tokens": 120516516.0, "step": 52605 }, { "entropy": 5.236062049865723, "epoch": 5.200672202451562, "grad_norm": 1.1796875, "learning_rate": 0.0002641772112654491, "loss": 4.6126, "mean_token_accuracy": 0.25339198410511016, "num_tokens": 120527327.0, "step": 52610 }, { "entropy": 5.29351487159729, "epoch": 5.201166468960063, "grad_norm": 1.1875, "learning_rate": 0.00026414196226578416, "loss": 4.6806, "mean_token_accuracy": 0.2514839038252831, "num_tokens": 120538578.0, "step": 52615 }, { "entropy": 5.269202041625976, "epoch": 5.201660735468565, "grad_norm": 1.109375, "learning_rate": 0.0002641067135332287, "loss": 4.6934, "mean_token_accuracy": 0.24963723719120026, "num_tokens": 120550682.0, "step": 52620 }, { "entropy": 5.15133752822876, "epoch": 5.202155001977066, "grad_norm": 1.171875, "learning_rate": 0.00026407146506864977, "loss": 4.5349, "mean_token_accuracy": 0.2687233626842499, "num_tokens": 120561110.0, "step": 52625 }, { "entropy": 5.2694933891296385, "epoch": 5.202649268485567, "grad_norm": 1.0703125, "learning_rate": 0.0002640362168729145, "loss": 4.6503, "mean_token_accuracy": 0.25926791727542875, "num_tokens": 120572104.0, "step": 52630 }, { "entropy": 5.239456558227539, "epoch": 5.2031435349940685, "grad_norm": 1.171875, "learning_rate": 0.00026400096894688987, "loss": 4.6606, "mean_token_accuracy": 0.24393679350614547, "num_tokens": 120582639.0, "step": 52635 }, { "entropy": 5.2630726337432865, "epoch": 5.203637801502571, "grad_norm": 1.171875, "learning_rate": 0.0002639657212914432, "loss": 4.6673, "mean_token_accuracy": 0.2550617948174477, "num_tokens": 120594615.0, "step": 52640 }, { "entropy": 5.282408666610718, "epoch": 5.204132068011072, "grad_norm": 1.1328125, "learning_rate": 0.0002639304739074415, "loss": 4.7027, "mean_token_accuracy": 0.24870335161685944, "num_tokens": 120604970.0, "step": 52645 }, { "entropy": 5.266178131103516, "epoch": 5.204626334519573, "grad_norm": 1.234375, "learning_rate": 0.0002638952267957518, "loss": 4.661, "mean_token_accuracy": 0.2529104664921761, "num_tokens": 120616280.0, "step": 52650 }, { "entropy": 5.251731061935425, "epoch": 5.205120601028074, "grad_norm": 1.1328125, "learning_rate": 0.00026385997995724135, "loss": 4.688, "mean_token_accuracy": 0.2521435901522636, "num_tokens": 120628790.0, "step": 52655 }, { "entropy": 5.3246184349060055, "epoch": 5.205614867536576, "grad_norm": 1.0234375, "learning_rate": 0.00026382473339277713, "loss": 4.7349, "mean_token_accuracy": 0.24089710265398026, "num_tokens": 120639906.0, "step": 52660 }, { "entropy": 5.229251909255981, "epoch": 5.206109134045077, "grad_norm": 1.1484375, "learning_rate": 0.0002637894871032261, "loss": 4.6474, "mean_token_accuracy": 0.24998425245285033, "num_tokens": 120651429.0, "step": 52665 }, { "entropy": 5.150034713745117, "epoch": 5.206603400553578, "grad_norm": 1.125, "learning_rate": 0.00026375424108945547, "loss": 4.4704, "mean_token_accuracy": 0.26997181922197344, "num_tokens": 120662119.0, "step": 52670 }, { "entropy": 5.225613164901733, "epoch": 5.207097667062079, "grad_norm": 1.1015625, "learning_rate": 0.00026371899535233216, "loss": 4.6303, "mean_token_accuracy": 0.2589568689465523, "num_tokens": 120672719.0, "step": 52675 }, { "entropy": 5.292468404769897, "epoch": 5.207591933570582, "grad_norm": 1.203125, "learning_rate": 0.00026368374989272345, "loss": 4.7125, "mean_token_accuracy": 0.24750584065914155, "num_tokens": 120683287.0, "step": 52680 }, { "entropy": 5.276952123641967, "epoch": 5.208086200079083, "grad_norm": 1.15625, "learning_rate": 0.00026364850471149624, "loss": 4.7507, "mean_token_accuracy": 0.24944329261779785, "num_tokens": 120693867.0, "step": 52685 }, { "entropy": 5.298101568222046, "epoch": 5.208580466587584, "grad_norm": 1.015625, "learning_rate": 0.0002636132598095175, "loss": 4.6809, "mean_token_accuracy": 0.2474446937441826, "num_tokens": 120706068.0, "step": 52690 }, { "entropy": 5.29556622505188, "epoch": 5.209074733096085, "grad_norm": 1.125, "learning_rate": 0.0002635780151876544, "loss": 4.6773, "mean_token_accuracy": 0.257780422270298, "num_tokens": 120717111.0, "step": 52695 }, { "entropy": 5.323505306243897, "epoch": 5.209568999604587, "grad_norm": 1.1015625, "learning_rate": 0.00026354277084677386, "loss": 4.6792, "mean_token_accuracy": 0.2553821936249733, "num_tokens": 120729468.0, "step": 52700 }, { "entropy": 5.317428159713745, "epoch": 5.210063266113088, "grad_norm": 1.171875, "learning_rate": 0.000263507526787743, "loss": 4.7643, "mean_token_accuracy": 0.24395948946475982, "num_tokens": 120740101.0, "step": 52705 }, { "entropy": 5.293540668487549, "epoch": 5.210557532621589, "grad_norm": 1.1328125, "learning_rate": 0.0002634722830114287, "loss": 4.7304, "mean_token_accuracy": 0.24426728785037993, "num_tokens": 120750250.0, "step": 52710 }, { "entropy": 5.243372774124145, "epoch": 5.211051799130091, "grad_norm": 1.1640625, "learning_rate": 0.00026343703951869804, "loss": 4.6088, "mean_token_accuracy": 0.25253770053386687, "num_tokens": 120761955.0, "step": 52715 }, { "entropy": 5.238249397277832, "epoch": 5.211546065638593, "grad_norm": 1.1640625, "learning_rate": 0.00026340179631041796, "loss": 4.5907, "mean_token_accuracy": 0.2541317522525787, "num_tokens": 120773660.0, "step": 52720 }, { "entropy": 5.31777663230896, "epoch": 5.212040332147094, "grad_norm": 1.15625, "learning_rate": 0.0002633665533874555, "loss": 4.6939, "mean_token_accuracy": 0.24311886131763458, "num_tokens": 120785571.0, "step": 52725 }, { "entropy": 5.315840101242065, "epoch": 5.212534598655595, "grad_norm": 1.125, "learning_rate": 0.0002633313107506777, "loss": 4.7483, "mean_token_accuracy": 0.2469790205359459, "num_tokens": 120799292.0, "step": 52730 }, { "entropy": 5.268481826782226, "epoch": 5.213028865164096, "grad_norm": 1.0625, "learning_rate": 0.00026329606840095146, "loss": 4.6911, "mean_token_accuracy": 0.24939125329256057, "num_tokens": 120811839.0, "step": 52735 }, { "entropy": 5.323260164260864, "epoch": 5.213523131672598, "grad_norm": 1.1484375, "learning_rate": 0.00026326082633914373, "loss": 4.6502, "mean_token_accuracy": 0.25691008418798444, "num_tokens": 120822859.0, "step": 52740 }, { "entropy": 5.353596973419189, "epoch": 5.214017398181099, "grad_norm": 1.0390625, "learning_rate": 0.00026322558456612144, "loss": 4.7427, "mean_token_accuracy": 0.2360887795686722, "num_tokens": 120833146.0, "step": 52745 }, { "entropy": 5.354168176651001, "epoch": 5.214511664689601, "grad_norm": 1.203125, "learning_rate": 0.00026319034308275156, "loss": 4.7451, "mean_token_accuracy": 0.2455828979611397, "num_tokens": 120843229.0, "step": 52750 }, { "entropy": 5.237830686569214, "epoch": 5.215005931198102, "grad_norm": 1.1171875, "learning_rate": 0.0002631551018899012, "loss": 4.6675, "mean_token_accuracy": 0.25568145215511323, "num_tokens": 120855374.0, "step": 52755 }, { "entropy": 5.283204698562622, "epoch": 5.215500197706604, "grad_norm": 1.0546875, "learning_rate": 0.00026311986098843715, "loss": 4.6944, "mean_token_accuracy": 0.24578651934862136, "num_tokens": 120867762.0, "step": 52760 }, { "entropy": 5.3097446918487545, "epoch": 5.215994464215105, "grad_norm": 1.171875, "learning_rate": 0.00026308462037922636, "loss": 4.6526, "mean_token_accuracy": 0.24796281307935714, "num_tokens": 120879235.0, "step": 52765 }, { "entropy": 5.29406623840332, "epoch": 5.216488730723606, "grad_norm": 1.1171875, "learning_rate": 0.00026304938006313565, "loss": 4.7058, "mean_token_accuracy": 0.252125558257103, "num_tokens": 120890500.0, "step": 52770 }, { "entropy": 5.268316555023193, "epoch": 5.216982997232107, "grad_norm": 1.1953125, "learning_rate": 0.0002630141400410322, "loss": 4.7905, "mean_token_accuracy": 0.2416975826025009, "num_tokens": 120901812.0, "step": 52775 }, { "entropy": 5.3555292129516605, "epoch": 5.217477263740609, "grad_norm": 1.1328125, "learning_rate": 0.00026297890031378265, "loss": 4.6965, "mean_token_accuracy": 0.24883441627025604, "num_tokens": 120913934.0, "step": 52780 }, { "entropy": 5.33347864151001, "epoch": 5.217971530249111, "grad_norm": 1.203125, "learning_rate": 0.00026294366088225405, "loss": 4.6932, "mean_token_accuracy": 0.24560063034296037, "num_tokens": 120924851.0, "step": 52785 }, { "entropy": 5.234576082229614, "epoch": 5.218465796757612, "grad_norm": 1.1484375, "learning_rate": 0.00026290842174731335, "loss": 4.5748, "mean_token_accuracy": 0.2550928920507431, "num_tokens": 120935986.0, "step": 52790 }, { "entropy": 5.349830961227417, "epoch": 5.218960063266113, "grad_norm": 1.15625, "learning_rate": 0.0002628731829098272, "loss": 4.8068, "mean_token_accuracy": 0.23389682024717331, "num_tokens": 120948153.0, "step": 52795 }, { "entropy": 5.337299108505249, "epoch": 5.2194543297746145, "grad_norm": 1.078125, "learning_rate": 0.0002628379443706627, "loss": 4.7037, "mean_token_accuracy": 0.24968620389699936, "num_tokens": 120958524.0, "step": 52800 }, { "entropy": 5.301404762268066, "epoch": 5.219948596283116, "grad_norm": 1.15625, "learning_rate": 0.00026280270613068666, "loss": 4.6908, "mean_token_accuracy": 0.24537620693445206, "num_tokens": 120970332.0, "step": 52805 }, { "entropy": 5.32641749382019, "epoch": 5.220442862791617, "grad_norm": 1.078125, "learning_rate": 0.0002627674681907659, "loss": 4.7496, "mean_token_accuracy": 0.24063123166561126, "num_tokens": 120982315.0, "step": 52810 }, { "entropy": 5.200874710083008, "epoch": 5.220937129300118, "grad_norm": 1.1328125, "learning_rate": 0.0002627322305517674, "loss": 4.5708, "mean_token_accuracy": 0.264797231554985, "num_tokens": 120993631.0, "step": 52815 }, { "entropy": 5.228395318984985, "epoch": 5.22143139580862, "grad_norm": 1.1171875, "learning_rate": 0.0002626969932145579, "loss": 4.6462, "mean_token_accuracy": 0.25219531208276746, "num_tokens": 121005392.0, "step": 52820 }, { "entropy": 5.192958402633667, "epoch": 5.221925662317122, "grad_norm": 1.21875, "learning_rate": 0.00026266175618000427, "loss": 4.5357, "mean_token_accuracy": 0.26475129276514053, "num_tokens": 121015775.0, "step": 52825 }, { "entropy": 5.3055003643035885, "epoch": 5.222419928825623, "grad_norm": 1.09375, "learning_rate": 0.0002626265194489734, "loss": 4.6978, "mean_token_accuracy": 0.24657813757658004, "num_tokens": 121026635.0, "step": 52830 }, { "entropy": 5.264363241195679, "epoch": 5.222914195334124, "grad_norm": 1.2109375, "learning_rate": 0.000262591283022332, "loss": 4.6591, "mean_token_accuracy": 0.26405507773160936, "num_tokens": 121037643.0, "step": 52835 }, { "entropy": 5.351356792449951, "epoch": 5.2234084618426255, "grad_norm": 1.0859375, "learning_rate": 0.00026255604690094694, "loss": 4.7939, "mean_token_accuracy": 0.2422276645898819, "num_tokens": 121049936.0, "step": 52840 }, { "entropy": 5.21829514503479, "epoch": 5.223902728351127, "grad_norm": 1.0859375, "learning_rate": 0.0002625208110856851, "loss": 4.558, "mean_token_accuracy": 0.26442056596279145, "num_tokens": 121062594.0, "step": 52845 }, { "entropy": 5.255821228027344, "epoch": 5.224396994859628, "grad_norm": 1.140625, "learning_rate": 0.0002624855755774133, "loss": 4.6568, "mean_token_accuracy": 0.2554952472448349, "num_tokens": 121074129.0, "step": 52850 }, { "entropy": 5.387523889541626, "epoch": 5.224891261368129, "grad_norm": 1.078125, "learning_rate": 0.0002624503403769982, "loss": 4.7927, "mean_token_accuracy": 0.23830924332141876, "num_tokens": 121085829.0, "step": 52855 }, { "entropy": 5.322052907943726, "epoch": 5.2253855278766315, "grad_norm": 1.1328125, "learning_rate": 0.0002624151054853067, "loss": 4.7571, "mean_token_accuracy": 0.23971261084079742, "num_tokens": 121096645.0, "step": 52860 }, { "entropy": 5.252929306030273, "epoch": 5.225879794385133, "grad_norm": 1.1796875, "learning_rate": 0.0002623798709032056, "loss": 4.6642, "mean_token_accuracy": 0.2542861685156822, "num_tokens": 121109236.0, "step": 52865 }, { "entropy": 5.196520853042602, "epoch": 5.226374060893634, "grad_norm": 1.109375, "learning_rate": 0.0002623446366315615, "loss": 4.6499, "mean_token_accuracy": 0.25220329165458677, "num_tokens": 121121139.0, "step": 52870 }, { "entropy": 5.300334501266479, "epoch": 5.226868327402135, "grad_norm": 1.390625, "learning_rate": 0.00026230940267124136, "loss": 4.6659, "mean_token_accuracy": 0.25323723405599596, "num_tokens": 121133112.0, "step": 52875 }, { "entropy": 5.309898805618286, "epoch": 5.2273625939106365, "grad_norm": 1.1171875, "learning_rate": 0.00026227416902311197, "loss": 4.6683, "mean_token_accuracy": 0.24871404021978377, "num_tokens": 121144414.0, "step": 52880 }, { "entropy": 5.243544340133667, "epoch": 5.227856860419138, "grad_norm": 1.078125, "learning_rate": 0.00026223893568803994, "loss": 4.636, "mean_token_accuracy": 0.24899447113275527, "num_tokens": 121156742.0, "step": 52885 }, { "entropy": 5.229231595993042, "epoch": 5.228351126927639, "grad_norm": 1.125, "learning_rate": 0.0002622037026668921, "loss": 4.6853, "mean_token_accuracy": 0.2565105974674225, "num_tokens": 121169494.0, "step": 52890 }, { "entropy": 5.382072639465332, "epoch": 5.228845393436141, "grad_norm": 1.078125, "learning_rate": 0.0002621684699605351, "loss": 4.824, "mean_token_accuracy": 0.23997849225997925, "num_tokens": 121181700.0, "step": 52895 }, { "entropy": 5.296277904510498, "epoch": 5.2293396599446424, "grad_norm": 1.1328125, "learning_rate": 0.0002621332375698357, "loss": 4.6416, "mean_token_accuracy": 0.2579190194606781, "num_tokens": 121193428.0, "step": 52900 }, { "entropy": 5.2863387107849125, "epoch": 5.229833926453144, "grad_norm": 1.1328125, "learning_rate": 0.0002620980054956608, "loss": 4.6968, "mean_token_accuracy": 0.25331621766090395, "num_tokens": 121205103.0, "step": 52905 }, { "entropy": 5.307123851776123, "epoch": 5.230328192961645, "grad_norm": 1.1015625, "learning_rate": 0.0002620627737388768, "loss": 4.7012, "mean_token_accuracy": 0.2480512961745262, "num_tokens": 121217149.0, "step": 52910 }, { "entropy": 5.364186477661133, "epoch": 5.230822459470146, "grad_norm": 1.09375, "learning_rate": 0.0002620275423003507, "loss": 4.7723, "mean_token_accuracy": 0.24370466768741608, "num_tokens": 121228604.0, "step": 52915 }, { "entropy": 5.289281129837036, "epoch": 5.2313167259786475, "grad_norm": 1.1328125, "learning_rate": 0.00026199231118094907, "loss": 4.6863, "mean_token_accuracy": 0.24886002391576767, "num_tokens": 121240290.0, "step": 52920 }, { "entropy": 5.285661220550537, "epoch": 5.231810992487149, "grad_norm": 1.046875, "learning_rate": 0.0002619570803815385, "loss": 4.6979, "mean_token_accuracy": 0.24785097539424897, "num_tokens": 121252294.0, "step": 52925 }, { "entropy": 5.358822965621949, "epoch": 5.23230525899565, "grad_norm": 1.140625, "learning_rate": 0.00026192184990298585, "loss": 4.7425, "mean_token_accuracy": 0.24663203060626984, "num_tokens": 121263709.0, "step": 52930 }, { "entropy": 5.206558322906494, "epoch": 5.232799525504152, "grad_norm": 1.0546875, "learning_rate": 0.0002618866197461577, "loss": 4.5339, "mean_token_accuracy": 0.26224095821380616, "num_tokens": 121275218.0, "step": 52935 }, { "entropy": 5.234896516799926, "epoch": 5.233293792012653, "grad_norm": 1.0078125, "learning_rate": 0.00026185138991192074, "loss": 4.5898, "mean_token_accuracy": 0.25811371952295303, "num_tokens": 121287236.0, "step": 52940 }, { "entropy": 5.283105945587158, "epoch": 5.233788058521155, "grad_norm": 1.1328125, "learning_rate": 0.00026181616040114164, "loss": 4.669, "mean_token_accuracy": 0.24688317626714706, "num_tokens": 121299510.0, "step": 52945 }, { "entropy": 5.275447130203247, "epoch": 5.234282325029656, "grad_norm": 1.0703125, "learning_rate": 0.0002617809312146871, "loss": 4.6821, "mean_token_accuracy": 0.24760538339614868, "num_tokens": 121311222.0, "step": 52950 }, { "entropy": 5.267986297607422, "epoch": 5.234776591538157, "grad_norm": 1.03125, "learning_rate": 0.00026174570235342354, "loss": 4.6611, "mean_token_accuracy": 0.25253393054008483, "num_tokens": 121322217.0, "step": 52955 }, { "entropy": 5.286654615402222, "epoch": 5.2352708580466585, "grad_norm": 1.1484375, "learning_rate": 0.00026171047381821786, "loss": 4.7046, "mean_token_accuracy": 0.24850789159536363, "num_tokens": 121333386.0, "step": 52960 }, { "entropy": 5.261395502090454, "epoch": 5.23576512455516, "grad_norm": 1.078125, "learning_rate": 0.0002616752456099366, "loss": 4.6739, "mean_token_accuracy": 0.25215506106615065, "num_tokens": 121345492.0, "step": 52965 }, { "entropy": 5.2926552295684814, "epoch": 5.236259391063662, "grad_norm": 1.0859375, "learning_rate": 0.0002616400177294463, "loss": 4.6852, "mean_token_accuracy": 0.2515890792012215, "num_tokens": 121356953.0, "step": 52970 }, { "entropy": 5.289097261428833, "epoch": 5.236753657572163, "grad_norm": 1.15625, "learning_rate": 0.0002616047901776138, "loss": 4.7057, "mean_token_accuracy": 0.24980539530515672, "num_tokens": 121368366.0, "step": 52975 }, { "entropy": 5.3780632495880125, "epoch": 5.237247924080664, "grad_norm": 1.0859375, "learning_rate": 0.0002615695629553054, "loss": 4.7864, "mean_token_accuracy": 0.24349626004695893, "num_tokens": 121379541.0, "step": 52980 }, { "entropy": 5.354631996154785, "epoch": 5.237742190589166, "grad_norm": 1.140625, "learning_rate": 0.00026153433606338774, "loss": 4.768, "mean_token_accuracy": 0.25059315711259844, "num_tokens": 121391745.0, "step": 52985 }, { "entropy": 5.28386960029602, "epoch": 5.238236457097667, "grad_norm": 1.0625, "learning_rate": 0.00026149910950272763, "loss": 4.6821, "mean_token_accuracy": 0.2536856606602669, "num_tokens": 121402880.0, "step": 52990 }, { "entropy": 5.335107088088989, "epoch": 5.238730723606168, "grad_norm": 1.1875, "learning_rate": 0.00026146388327419155, "loss": 4.8057, "mean_token_accuracy": 0.24058790802955626, "num_tokens": 121414061.0, "step": 52995 }, { "entropy": 5.314831638336182, "epoch": 5.2392249901146695, "grad_norm": 1.0703125, "learning_rate": 0.000261428657378646, "loss": 4.7109, "mean_token_accuracy": 0.2421488955616951, "num_tokens": 121425016.0, "step": 53000 }, { "entropy": 5.3645348072052, "epoch": 5.239719256623172, "grad_norm": 0.98046875, "learning_rate": 0.0002613934318169576, "loss": 4.7459, "mean_token_accuracy": 0.24688776582479477, "num_tokens": 121436955.0, "step": 53005 }, { "entropy": 5.2939026832580565, "epoch": 5.240213523131673, "grad_norm": 1.0625, "learning_rate": 0.0002613582065899929, "loss": 4.6791, "mean_token_accuracy": 0.2465851530432701, "num_tokens": 121449690.0, "step": 53010 }, { "entropy": 5.331370306015015, "epoch": 5.240707789640174, "grad_norm": 1.078125, "learning_rate": 0.00026132298169861837, "loss": 4.7502, "mean_token_accuracy": 0.24309019297361373, "num_tokens": 121462009.0, "step": 53015 }, { "entropy": 5.292693424224853, "epoch": 5.241202056148675, "grad_norm": 1.09375, "learning_rate": 0.0002612877571437006, "loss": 4.6908, "mean_token_accuracy": 0.2437356486916542, "num_tokens": 121474416.0, "step": 53020 }, { "entropy": 5.330023908615113, "epoch": 5.241696322657177, "grad_norm": 1.1015625, "learning_rate": 0.00026125253292610625, "loss": 4.759, "mean_token_accuracy": 0.24435316920280456, "num_tokens": 121485990.0, "step": 53025 }, { "entropy": 5.322727680206299, "epoch": 5.242190589165678, "grad_norm": 1.1171875, "learning_rate": 0.0002612173090467016, "loss": 4.6575, "mean_token_accuracy": 0.24885155856609345, "num_tokens": 121496924.0, "step": 53030 }, { "entropy": 5.304015731811523, "epoch": 5.242684855674179, "grad_norm": 1.09375, "learning_rate": 0.00026118208550635335, "loss": 4.7001, "mean_token_accuracy": 0.2513530567288399, "num_tokens": 121508601.0, "step": 53035 }, { "entropy": 5.34534068107605, "epoch": 5.243179122182681, "grad_norm": 1.0625, "learning_rate": 0.00026114686230592797, "loss": 4.7866, "mean_token_accuracy": 0.24295675605535508, "num_tokens": 121521004.0, "step": 53040 }, { "entropy": 5.331583738327026, "epoch": 5.243673388691183, "grad_norm": 1.09375, "learning_rate": 0.0002611116394462918, "loss": 4.6923, "mean_token_accuracy": 0.2435682624578476, "num_tokens": 121531660.0, "step": 53045 }, { "entropy": 5.2769674301147464, "epoch": 5.244167655199684, "grad_norm": 1.078125, "learning_rate": 0.0002610764169283116, "loss": 4.6431, "mean_token_accuracy": 0.25360510498285294, "num_tokens": 121542614.0, "step": 53050 }, { "entropy": 5.33082389831543, "epoch": 5.244661921708185, "grad_norm": 1.2109375, "learning_rate": 0.0002610411947528536, "loss": 4.7441, "mean_token_accuracy": 0.24868266582489013, "num_tokens": 121553428.0, "step": 53055 }, { "entropy": 5.377456188201904, "epoch": 5.245156188216686, "grad_norm": 1.0546875, "learning_rate": 0.00026100597292078444, "loss": 4.7818, "mean_token_accuracy": 0.23465190678834916, "num_tokens": 121565957.0, "step": 53060 }, { "entropy": 5.229843997955323, "epoch": 5.245650454725188, "grad_norm": 1.1640625, "learning_rate": 0.0002609707514329705, "loss": 4.6053, "mean_token_accuracy": 0.2568775162100792, "num_tokens": 121576229.0, "step": 53065 }, { "entropy": 5.223861408233643, "epoch": 5.246144721233689, "grad_norm": 1.140625, "learning_rate": 0.00026093553029027817, "loss": 4.695, "mean_token_accuracy": 0.24543559551239014, "num_tokens": 121587938.0, "step": 53070 }, { "entropy": 5.203254556655883, "epoch": 5.24663898774219, "grad_norm": 1.171875, "learning_rate": 0.0002609003094935741, "loss": 4.6539, "mean_token_accuracy": 0.2569454789161682, "num_tokens": 121598605.0, "step": 53075 }, { "entropy": 5.266915273666382, "epoch": 5.247133254250692, "grad_norm": 1.078125, "learning_rate": 0.00026086508904372453, "loss": 4.6803, "mean_token_accuracy": 0.2527714133262634, "num_tokens": 121611963.0, "step": 53080 }, { "entropy": 5.328538417816162, "epoch": 5.247627520759194, "grad_norm": 1.09375, "learning_rate": 0.00026082986894159605, "loss": 4.7079, "mean_token_accuracy": 0.24799129068851472, "num_tokens": 121623510.0, "step": 53085 }, { "entropy": 5.362918281555176, "epoch": 5.248121787267695, "grad_norm": 1.0234375, "learning_rate": 0.00026079464918805494, "loss": 4.7458, "mean_token_accuracy": 0.24306371659040452, "num_tokens": 121635337.0, "step": 53090 }, { "entropy": 5.280591726303101, "epoch": 5.248616053776196, "grad_norm": 1.125, "learning_rate": 0.0002607594297839676, "loss": 4.6502, "mean_token_accuracy": 0.25020322799682615, "num_tokens": 121645682.0, "step": 53095 }, { "entropy": 5.369611692428589, "epoch": 5.249110320284697, "grad_norm": 1.0390625, "learning_rate": 0.00026072421073020053, "loss": 4.8297, "mean_token_accuracy": 0.24017771631479262, "num_tokens": 121658531.0, "step": 53100 }, { "entropy": 5.259315395355225, "epoch": 5.249604586793199, "grad_norm": 1.0859375, "learning_rate": 0.00026068899202762007, "loss": 4.6951, "mean_token_accuracy": 0.2568816766142845, "num_tokens": 121669721.0, "step": 53105 }, { "entropy": 5.346552038192749, "epoch": 5.2500988533017, "grad_norm": 1.0390625, "learning_rate": 0.00026065377367709273, "loss": 4.7394, "mean_token_accuracy": 0.24052856862545013, "num_tokens": 121680438.0, "step": 53110 }, { "entropy": 5.344961881637573, "epoch": 5.250593119810202, "grad_norm": 1.09375, "learning_rate": 0.00026061855567948474, "loss": 4.7516, "mean_token_accuracy": 0.24214646816253663, "num_tokens": 121691342.0, "step": 53115 }, { "entropy": 5.269466924667358, "epoch": 5.251087386318703, "grad_norm": 0.99609375, "learning_rate": 0.0002605833380356625, "loss": 4.6545, "mean_token_accuracy": 0.2510835349559784, "num_tokens": 121703022.0, "step": 53120 }, { "entropy": 5.291525554656983, "epoch": 5.251581652827205, "grad_norm": 1.2890625, "learning_rate": 0.0002605481207464924, "loss": 4.7001, "mean_token_accuracy": 0.2486137256026268, "num_tokens": 121713738.0, "step": 53125 }, { "entropy": 5.2632842540740965, "epoch": 5.252075919335706, "grad_norm": 1.21875, "learning_rate": 0.00026051290381284067, "loss": 4.6506, "mean_token_accuracy": 0.24818307906389236, "num_tokens": 121724640.0, "step": 53130 }, { "entropy": 5.331920480728149, "epoch": 5.252570185844207, "grad_norm": 1.0234375, "learning_rate": 0.00026047768723557385, "loss": 4.7853, "mean_token_accuracy": 0.23901816904544831, "num_tokens": 121737469.0, "step": 53135 }, { "entropy": 5.340210342407227, "epoch": 5.253064452352708, "grad_norm": 1.1328125, "learning_rate": 0.0002604424710155582, "loss": 4.7587, "mean_token_accuracy": 0.24264090061187743, "num_tokens": 121749483.0, "step": 53140 }, { "entropy": 5.37483434677124, "epoch": 5.25355871886121, "grad_norm": 1.1328125, "learning_rate": 0.0002604072551536599, "loss": 4.7844, "mean_token_accuracy": 0.24424971044063568, "num_tokens": 121761065.0, "step": 53145 }, { "entropy": 5.330370712280273, "epoch": 5.254052985369711, "grad_norm": 1.1875, "learning_rate": 0.0002603720396507455, "loss": 4.7415, "mean_token_accuracy": 0.24580170214176178, "num_tokens": 121772382.0, "step": 53150 }, { "entropy": 5.3599800109863285, "epoch": 5.254547251878213, "grad_norm": 1.1328125, "learning_rate": 0.0002603368245076812, "loss": 4.7393, "mean_token_accuracy": 0.25051274597644807, "num_tokens": 121783565.0, "step": 53155 }, { "entropy": 5.326224851608276, "epoch": 5.255041518386714, "grad_norm": 1.109375, "learning_rate": 0.00026030160972533316, "loss": 4.7291, "mean_token_accuracy": 0.24152946025133132, "num_tokens": 121795560.0, "step": 53160 }, { "entropy": 5.313626861572265, "epoch": 5.255535784895216, "grad_norm": 1.1171875, "learning_rate": 0.00026026639530456793, "loss": 4.7644, "mean_token_accuracy": 0.2426612377166748, "num_tokens": 121807199.0, "step": 53165 }, { "entropy": 5.271484756469727, "epoch": 5.256030051403717, "grad_norm": 1.1328125, "learning_rate": 0.0002602311812462516, "loss": 4.6861, "mean_token_accuracy": 0.24982203394174576, "num_tokens": 121818923.0, "step": 53170 }, { "entropy": 5.2945739269256595, "epoch": 5.256524317912218, "grad_norm": 1.15625, "learning_rate": 0.0002601959675512505, "loss": 4.7001, "mean_token_accuracy": 0.24571583271026612, "num_tokens": 121830544.0, "step": 53175 }, { "entropy": 5.3083329677581785, "epoch": 5.257018584420719, "grad_norm": 1.109375, "learning_rate": 0.000260160754220431, "loss": 4.7032, "mean_token_accuracy": 0.24080028235912324, "num_tokens": 121842557.0, "step": 53180 }, { "entropy": 5.288518285751342, "epoch": 5.257512850929221, "grad_norm": 1.140625, "learning_rate": 0.0002601255412546592, "loss": 4.6791, "mean_token_accuracy": 0.2531542494893074, "num_tokens": 121855207.0, "step": 53185 }, { "entropy": 5.31013708114624, "epoch": 5.258007117437723, "grad_norm": 1.171875, "learning_rate": 0.0002600903286548013, "loss": 4.7973, "mean_token_accuracy": 0.2379968285560608, "num_tokens": 121867516.0, "step": 53190 }, { "entropy": 5.3025675296783445, "epoch": 5.258501383946224, "grad_norm": 1.1015625, "learning_rate": 0.00026005511642172364, "loss": 4.6778, "mean_token_accuracy": 0.2495085060596466, "num_tokens": 121879036.0, "step": 53195 }, { "entropy": 5.3465752601623535, "epoch": 5.258995650454725, "grad_norm": 1.1171875, "learning_rate": 0.0002600199045562925, "loss": 4.7638, "mean_token_accuracy": 0.24580202847719193, "num_tokens": 121891575.0, "step": 53200 }, { "entropy": 5.363471269607544, "epoch": 5.2594899169632265, "grad_norm": 1.0625, "learning_rate": 0.00025998469305937405, "loss": 4.7413, "mean_token_accuracy": 0.24250403195619583, "num_tokens": 121902665.0, "step": 53205 }, { "entropy": 5.239278841018677, "epoch": 5.259984183471728, "grad_norm": 1.0703125, "learning_rate": 0.0002599494819318345, "loss": 4.6363, "mean_token_accuracy": 0.255228690803051, "num_tokens": 121914045.0, "step": 53210 }, { "entropy": 5.155976629257202, "epoch": 5.260478449980229, "grad_norm": 1.078125, "learning_rate": 0.0002599142711745399, "loss": 4.543, "mean_token_accuracy": 0.2618172526359558, "num_tokens": 121925183.0, "step": 53215 }, { "entropy": 5.293841600418091, "epoch": 5.26097271648873, "grad_norm": 1.0625, "learning_rate": 0.0002598790607883566, "loss": 4.7285, "mean_token_accuracy": 0.24727573543787001, "num_tokens": 121936742.0, "step": 53220 }, { "entropy": 5.292818975448609, "epoch": 5.2614669829972325, "grad_norm": 1.078125, "learning_rate": 0.0002598438507741508, "loss": 4.6621, "mean_token_accuracy": 0.2582381024956703, "num_tokens": 121948832.0, "step": 53225 }, { "entropy": 5.311560010910034, "epoch": 5.261961249505734, "grad_norm": 1.0703125, "learning_rate": 0.00025980864113278867, "loss": 4.7326, "mean_token_accuracy": 0.2502515003085136, "num_tokens": 121959603.0, "step": 53230 }, { "entropy": 5.280962991714477, "epoch": 5.262455516014235, "grad_norm": 1.15625, "learning_rate": 0.0002597734318651363, "loss": 4.6896, "mean_token_accuracy": 0.24947467744350432, "num_tokens": 121970646.0, "step": 53235 }, { "entropy": 5.250629949569702, "epoch": 5.262949782522736, "grad_norm": 1.0625, "learning_rate": 0.0002597382229720598, "loss": 4.5744, "mean_token_accuracy": 0.26059533655643463, "num_tokens": 121981704.0, "step": 53240 }, { "entropy": 5.267565679550171, "epoch": 5.2634440490312375, "grad_norm": 1.109375, "learning_rate": 0.00025970301445442536, "loss": 4.7048, "mean_token_accuracy": 0.24842062890529631, "num_tokens": 121993328.0, "step": 53245 }, { "entropy": 5.301402282714844, "epoch": 5.263938315539739, "grad_norm": 1.078125, "learning_rate": 0.00025966780631309923, "loss": 4.6975, "mean_token_accuracy": 0.2514139249920845, "num_tokens": 122003672.0, "step": 53250 }, { "entropy": 5.321757173538208, "epoch": 5.26443258204824, "grad_norm": 1.1328125, "learning_rate": 0.0002596325985489474, "loss": 4.7113, "mean_token_accuracy": 0.2568355917930603, "num_tokens": 122013690.0, "step": 53255 }, { "entropy": 5.311616134643555, "epoch": 5.264926848556742, "grad_norm": 1.109375, "learning_rate": 0.0002595973911628361, "loss": 4.6372, "mean_token_accuracy": 0.25779360830783843, "num_tokens": 122026636.0, "step": 53260 }, { "entropy": 5.342161083221436, "epoch": 5.2654211150652435, "grad_norm": 1.1328125, "learning_rate": 0.00025956218415563125, "loss": 4.7401, "mean_token_accuracy": 0.23951679170131684, "num_tokens": 122037543.0, "step": 53265 }, { "entropy": 5.329519414901734, "epoch": 5.265915381573745, "grad_norm": 1.1875, "learning_rate": 0.0002595269775281992, "loss": 4.7301, "mean_token_accuracy": 0.24272242337465286, "num_tokens": 122048833.0, "step": 53270 }, { "entropy": 5.279802942276001, "epoch": 5.266409648082246, "grad_norm": 1.2421875, "learning_rate": 0.0002594917712814057, "loss": 4.7379, "mean_token_accuracy": 0.24838257133960723, "num_tokens": 122060294.0, "step": 53275 }, { "entropy": 5.2397254467010494, "epoch": 5.266903914590747, "grad_norm": 1.03125, "learning_rate": 0.0002594565654161172, "loss": 4.608, "mean_token_accuracy": 0.25069058388471605, "num_tokens": 122071551.0, "step": 53280 }, { "entropy": 5.254323577880859, "epoch": 5.2673981810992485, "grad_norm": 1.078125, "learning_rate": 0.0002594213599331996, "loss": 4.6357, "mean_token_accuracy": 0.24473890513181687, "num_tokens": 122082331.0, "step": 53285 }, { "entropy": 5.286121082305908, "epoch": 5.26789244760775, "grad_norm": 1.1484375, "learning_rate": 0.0002593861548335189, "loss": 4.7098, "mean_token_accuracy": 0.24244339019060135, "num_tokens": 122094303.0, "step": 53290 }, { "entropy": 5.231330251693725, "epoch": 5.268386714116252, "grad_norm": 1.125, "learning_rate": 0.0002593509501179413, "loss": 4.63, "mean_token_accuracy": 0.25637276768684386, "num_tokens": 122104435.0, "step": 53295 }, { "entropy": 5.331670236587525, "epoch": 5.268880980624753, "grad_norm": 1.0859375, "learning_rate": 0.0002593157457873327, "loss": 4.7325, "mean_token_accuracy": 0.24402838498353957, "num_tokens": 122115623.0, "step": 53300 }, { "entropy": 5.349249076843262, "epoch": 5.2693752471332544, "grad_norm": 0.99609375, "learning_rate": 0.0002592805418425591, "loss": 4.7504, "mean_token_accuracy": 0.244571690261364, "num_tokens": 122127128.0, "step": 53305 }, { "entropy": 5.3355841636657715, "epoch": 5.269869513641756, "grad_norm": 1.1015625, "learning_rate": 0.0002592453382844867, "loss": 4.7631, "mean_token_accuracy": 0.24180496335029603, "num_tokens": 122138305.0, "step": 53310 }, { "entropy": 5.286672925949096, "epoch": 5.270363780150257, "grad_norm": 1.125, "learning_rate": 0.00025921013511398137, "loss": 4.6651, "mean_token_accuracy": 0.24774886816740035, "num_tokens": 122149092.0, "step": 53315 }, { "entropy": 5.286123180389405, "epoch": 5.270858046658758, "grad_norm": 1.15625, "learning_rate": 0.00025917493233190925, "loss": 4.6682, "mean_token_accuracy": 0.24986427873373032, "num_tokens": 122160152.0, "step": 53320 }, { "entropy": 5.2890722274780275, "epoch": 5.2713523131672595, "grad_norm": 1.1484375, "learning_rate": 0.00025913972993913623, "loss": 4.6814, "mean_token_accuracy": 0.2555972754955292, "num_tokens": 122170889.0, "step": 53325 }, { "entropy": 5.358703565597534, "epoch": 5.271846579675761, "grad_norm": 1.3046875, "learning_rate": 0.0002591045279365283, "loss": 4.7937, "mean_token_accuracy": 0.2352383702993393, "num_tokens": 122182881.0, "step": 53330 }, { "entropy": 5.2390350818634035, "epoch": 5.272340846184263, "grad_norm": 1.125, "learning_rate": 0.00025906932632495145, "loss": 4.5947, "mean_token_accuracy": 0.2589756101369858, "num_tokens": 122194258.0, "step": 53335 }, { "entropy": 5.263083267211914, "epoch": 5.272835112692764, "grad_norm": 1.046875, "learning_rate": 0.0002590341251052716, "loss": 4.6562, "mean_token_accuracy": 0.24987694770097732, "num_tokens": 122205678.0, "step": 53340 }, { "entropy": 5.290248584747315, "epoch": 5.273329379201265, "grad_norm": 1.0625, "learning_rate": 0.00025899892427835473, "loss": 4.7082, "mean_token_accuracy": 0.24963341802358627, "num_tokens": 122217446.0, "step": 53345 }, { "entropy": 5.281411361694336, "epoch": 5.273823645709767, "grad_norm": 1.0546875, "learning_rate": 0.00025896372384506697, "loss": 4.6924, "mean_token_accuracy": 0.2527328312397003, "num_tokens": 122228466.0, "step": 53350 }, { "entropy": 5.283797645568848, "epoch": 5.274317912218268, "grad_norm": 1.1171875, "learning_rate": 0.0002589285238062739, "loss": 4.7315, "mean_token_accuracy": 0.24798336923122405, "num_tokens": 122240528.0, "step": 53355 }, { "entropy": 5.344595146179199, "epoch": 5.274812178726769, "grad_norm": 1.0703125, "learning_rate": 0.00025889332416284175, "loss": 4.7378, "mean_token_accuracy": 0.24791087657213212, "num_tokens": 122251267.0, "step": 53360 }, { "entropy": 5.416463184356689, "epoch": 5.2753064452352705, "grad_norm": 1.1015625, "learning_rate": 0.00025885812491563626, "loss": 4.7832, "mean_token_accuracy": 0.2406398817896843, "num_tokens": 122262999.0, "step": 53365 }, { "entropy": 5.401288318634033, "epoch": 5.275800711743773, "grad_norm": 1.0703125, "learning_rate": 0.00025882292606552344, "loss": 4.7585, "mean_token_accuracy": 0.24062940776348113, "num_tokens": 122275216.0, "step": 53370 }, { "entropy": 5.242643737792969, "epoch": 5.276294978252274, "grad_norm": 1.1484375, "learning_rate": 0.00025878772761336915, "loss": 4.5719, "mean_token_accuracy": 0.2640536919236183, "num_tokens": 122285385.0, "step": 53375 }, { "entropy": 5.281848621368408, "epoch": 5.276789244760775, "grad_norm": 1.1796875, "learning_rate": 0.00025875252956003927, "loss": 4.6847, "mean_token_accuracy": 0.25288466066122056, "num_tokens": 122296386.0, "step": 53380 }, { "entropy": 5.248887205123902, "epoch": 5.277283511269276, "grad_norm": 1.171875, "learning_rate": 0.00025871733190639966, "loss": 4.6478, "mean_token_accuracy": 0.2523078829050064, "num_tokens": 122307339.0, "step": 53385 }, { "entropy": 5.279818344116211, "epoch": 5.277777777777778, "grad_norm": 1.3125, "learning_rate": 0.0002586821346533162, "loss": 4.6322, "mean_token_accuracy": 0.25755843967199327, "num_tokens": 122318712.0, "step": 53390 }, { "entropy": 5.273811388015747, "epoch": 5.278272044286279, "grad_norm": 1.1328125, "learning_rate": 0.00025864693780165476, "loss": 4.648, "mean_token_accuracy": 0.2535210907459259, "num_tokens": 122329890.0, "step": 53395 }, { "entropy": 5.254382753372193, "epoch": 5.27876631079478, "grad_norm": 1.125, "learning_rate": 0.0002586117413522813, "loss": 4.6725, "mean_token_accuracy": 0.2531907379627228, "num_tokens": 122340582.0, "step": 53400 }, { "entropy": 5.31660213470459, "epoch": 5.2792605773032815, "grad_norm": 1.125, "learning_rate": 0.0002585765453060615, "loss": 4.7511, "mean_token_accuracy": 0.24003609716892244, "num_tokens": 122353661.0, "step": 53405 }, { "entropy": 5.383347749710083, "epoch": 5.279754843811784, "grad_norm": 1.1640625, "learning_rate": 0.0002585413496638611, "loss": 4.8191, "mean_token_accuracy": 0.24604599177837372, "num_tokens": 122365223.0, "step": 53410 }, { "entropy": 5.306574583053589, "epoch": 5.280249110320285, "grad_norm": 1.125, "learning_rate": 0.00025850615442654624, "loss": 4.6946, "mean_token_accuracy": 0.2534451514482498, "num_tokens": 122376148.0, "step": 53415 }, { "entropy": 5.263646793365479, "epoch": 5.280743376828786, "grad_norm": 1.09375, "learning_rate": 0.00025847095959498237, "loss": 4.74, "mean_token_accuracy": 0.24251807034015654, "num_tokens": 122388108.0, "step": 53420 }, { "entropy": 5.293937826156617, "epoch": 5.281237643337287, "grad_norm": 1.0859375, "learning_rate": 0.0002584357651700355, "loss": 4.6767, "mean_token_accuracy": 0.2524500504136086, "num_tokens": 122400999.0, "step": 53425 }, { "entropy": 5.249952793121338, "epoch": 5.281731909845789, "grad_norm": 1.0, "learning_rate": 0.00025840057115257147, "loss": 4.6267, "mean_token_accuracy": 0.25469763576984406, "num_tokens": 122412398.0, "step": 53430 }, { "entropy": 5.357367277145386, "epoch": 5.28222617635429, "grad_norm": 1.2265625, "learning_rate": 0.0002583653775434559, "loss": 4.7229, "mean_token_accuracy": 0.25007281452417374, "num_tokens": 122423877.0, "step": 53435 }, { "entropy": 5.252276372909546, "epoch": 5.282720442862791, "grad_norm": 1.1328125, "learning_rate": 0.00025833018434355466, "loss": 4.6458, "mean_token_accuracy": 0.2488086998462677, "num_tokens": 122435030.0, "step": 53440 }, { "entropy": 5.331720018386841, "epoch": 5.283214709371293, "grad_norm": 1.1015625, "learning_rate": 0.00025829499155373344, "loss": 4.7876, "mean_token_accuracy": 0.24324083626270293, "num_tokens": 122446550.0, "step": 53445 }, { "entropy": 5.350930833816529, "epoch": 5.283708975879795, "grad_norm": 1.1015625, "learning_rate": 0.00025825979917485796, "loss": 4.7354, "mean_token_accuracy": 0.23932373225688935, "num_tokens": 122457662.0, "step": 53450 }, { "entropy": 5.282639026641846, "epoch": 5.284203242388296, "grad_norm": 1.1171875, "learning_rate": 0.0002582246072077941, "loss": 4.7278, "mean_token_accuracy": 0.25166589468717576, "num_tokens": 122469514.0, "step": 53455 }, { "entropy": 5.353560543060302, "epoch": 5.284697508896797, "grad_norm": 1.109375, "learning_rate": 0.0002581894156534075, "loss": 4.7621, "mean_token_accuracy": 0.24113335460424423, "num_tokens": 122480795.0, "step": 53460 }, { "entropy": 5.264560556411743, "epoch": 5.285191775405298, "grad_norm": 1.0546875, "learning_rate": 0.0002581542245125639, "loss": 4.6267, "mean_token_accuracy": 0.26096857637166976, "num_tokens": 122492018.0, "step": 53465 }, { "entropy": 5.2192706108093265, "epoch": 5.2856860419138, "grad_norm": 1.140625, "learning_rate": 0.00025811903378612896, "loss": 4.609, "mean_token_accuracy": 0.2543609768152237, "num_tokens": 122503551.0, "step": 53470 }, { "entropy": 5.270279264450073, "epoch": 5.286180308422301, "grad_norm": 1.1640625, "learning_rate": 0.0002580838434749684, "loss": 4.6545, "mean_token_accuracy": 0.25322472900152204, "num_tokens": 122515145.0, "step": 53475 }, { "entropy": 5.31558313369751, "epoch": 5.286674574930803, "grad_norm": 1.046875, "learning_rate": 0.00025804865357994785, "loss": 4.7358, "mean_token_accuracy": 0.24576020389795303, "num_tokens": 122527399.0, "step": 53480 }, { "entropy": 5.28123288154602, "epoch": 5.287168841439304, "grad_norm": 1.0625, "learning_rate": 0.0002580134641019331, "loss": 4.6229, "mean_token_accuracy": 0.2606315493583679, "num_tokens": 122537608.0, "step": 53485 }, { "entropy": 5.283609676361084, "epoch": 5.287663107947806, "grad_norm": 1.09375, "learning_rate": 0.0002579782750417898, "loss": 4.6962, "mean_token_accuracy": 0.24714914262294768, "num_tokens": 122548289.0, "step": 53490 }, { "entropy": 5.341195201873779, "epoch": 5.288157374456307, "grad_norm": 1.2109375, "learning_rate": 0.0002579430864003836, "loss": 4.7936, "mean_token_accuracy": 0.24747347682714463, "num_tokens": 122560787.0, "step": 53495 }, { "entropy": 5.340498161315918, "epoch": 5.288651640964808, "grad_norm": 1.1015625, "learning_rate": 0.00025790789817858005, "loss": 4.7285, "mean_token_accuracy": 0.24145877361297607, "num_tokens": 122572794.0, "step": 53500 }, { "entropy": 5.29969539642334, "epoch": 5.289145907473309, "grad_norm": 1.015625, "learning_rate": 0.00025787271037724496, "loss": 4.6917, "mean_token_accuracy": 0.2547972366213799, "num_tokens": 122586200.0, "step": 53505 }, { "entropy": 5.367553472518921, "epoch": 5.289640173981811, "grad_norm": 1.078125, "learning_rate": 0.00025783752299724373, "loss": 4.858, "mean_token_accuracy": 0.23743117451667786, "num_tokens": 122597392.0, "step": 53510 }, { "entropy": 5.289792203903199, "epoch": 5.290134440490313, "grad_norm": 1.1875, "learning_rate": 0.00025780233603944216, "loss": 4.6813, "mean_token_accuracy": 0.24252982139587403, "num_tokens": 122608907.0, "step": 53515 }, { "entropy": 5.2677513599395756, "epoch": 5.290628706998814, "grad_norm": 1.2109375, "learning_rate": 0.0002577671495047058, "loss": 4.5899, "mean_token_accuracy": 0.2650768607854843, "num_tokens": 122619792.0, "step": 53520 }, { "entropy": 5.294852447509766, "epoch": 5.291122973507315, "grad_norm": 1.1328125, "learning_rate": 0.00025773196339390017, "loss": 4.6433, "mean_token_accuracy": 0.2518832594156265, "num_tokens": 122630113.0, "step": 53525 }, { "entropy": 5.287214565277099, "epoch": 5.291617240015817, "grad_norm": 1.109375, "learning_rate": 0.000257696777707891, "loss": 4.7571, "mean_token_accuracy": 0.24255139380693436, "num_tokens": 122642045.0, "step": 53530 }, { "entropy": 5.193799924850464, "epoch": 5.292111506524318, "grad_norm": 1.1640625, "learning_rate": 0.00025766159244754367, "loss": 4.5794, "mean_token_accuracy": 0.2664041772484779, "num_tokens": 122654148.0, "step": 53535 }, { "entropy": 5.322488021850586, "epoch": 5.292605773032819, "grad_norm": 1.0546875, "learning_rate": 0.00025762640761372397, "loss": 4.7262, "mean_token_accuracy": 0.24975793510675431, "num_tokens": 122665012.0, "step": 53540 }, { "entropy": 5.300961637496949, "epoch": 5.29310003954132, "grad_norm": 1.0078125, "learning_rate": 0.0002575912232072973, "loss": 4.6632, "mean_token_accuracy": 0.2515000537037849, "num_tokens": 122677009.0, "step": 53545 }, { "entropy": 5.2947286605834964, "epoch": 5.2935943060498225, "grad_norm": 1.1796875, "learning_rate": 0.00025755603922912926, "loss": 4.674, "mean_token_accuracy": 0.25119019746780397, "num_tokens": 122688828.0, "step": 53550 }, { "entropy": 5.268280792236328, "epoch": 5.294088572558324, "grad_norm": 1.2109375, "learning_rate": 0.00025752085568008534, "loss": 4.7002, "mean_token_accuracy": 0.24911192208528518, "num_tokens": 122699408.0, "step": 53555 }, { "entropy": 5.327212905883789, "epoch": 5.294582839066825, "grad_norm": 1.046875, "learning_rate": 0.0002574856725610311, "loss": 4.6988, "mean_token_accuracy": 0.24814992845058442, "num_tokens": 122711885.0, "step": 53560 }, { "entropy": 5.249513959884643, "epoch": 5.295077105575326, "grad_norm": 1.0703125, "learning_rate": 0.00025745048987283197, "loss": 4.5496, "mean_token_accuracy": 0.2593224957585335, "num_tokens": 122722805.0, "step": 53565 }, { "entropy": 5.2308838844299315, "epoch": 5.2955713720838276, "grad_norm": 1.1640625, "learning_rate": 0.00025741530761635355, "loss": 4.5858, "mean_token_accuracy": 0.2551025733351707, "num_tokens": 122734595.0, "step": 53570 }, { "entropy": 5.238473558425904, "epoch": 5.296065638592329, "grad_norm": 1.09375, "learning_rate": 0.0002573801257924613, "loss": 4.6607, "mean_token_accuracy": 0.25357767194509506, "num_tokens": 122747299.0, "step": 53575 }, { "entropy": 5.310798072814942, "epoch": 5.29655990510083, "grad_norm": 1.109375, "learning_rate": 0.00025734494440202073, "loss": 4.7369, "mean_token_accuracy": 0.23827910870313646, "num_tokens": 122759504.0, "step": 53580 }, { "entropy": 5.318895387649536, "epoch": 5.297054171609331, "grad_norm": 1.0234375, "learning_rate": 0.0002573097634458972, "loss": 4.694, "mean_token_accuracy": 0.24926139265298844, "num_tokens": 122772220.0, "step": 53585 }, { "entropy": 5.251720142364502, "epoch": 5.2975484381178335, "grad_norm": 1.1640625, "learning_rate": 0.0002572745829249563, "loss": 4.6378, "mean_token_accuracy": 0.25281545966863633, "num_tokens": 122784585.0, "step": 53590 }, { "entropy": 5.358306217193603, "epoch": 5.298042704626335, "grad_norm": 1.234375, "learning_rate": 0.0002572394028400633, "loss": 4.7137, "mean_token_accuracy": 0.24644577652215957, "num_tokens": 122795465.0, "step": 53595 }, { "entropy": 5.176448202133178, "epoch": 5.298536971134836, "grad_norm": 1.0625, "learning_rate": 0.0002572042231920838, "loss": 4.6353, "mean_token_accuracy": 0.25519137978553774, "num_tokens": 122807129.0, "step": 53600 }, { "entropy": 5.278620386123658, "epoch": 5.299031237643337, "grad_norm": 1.0546875, "learning_rate": 0.00025716904398188326, "loss": 4.6736, "mean_token_accuracy": 0.24551908522844315, "num_tokens": 122818201.0, "step": 53605 }, { "entropy": 5.345571804046631, "epoch": 5.2995255041518385, "grad_norm": 1.2421875, "learning_rate": 0.00025713386521032693, "loss": 4.7124, "mean_token_accuracy": 0.24326689541339874, "num_tokens": 122828540.0, "step": 53610 }, { "entropy": 5.328421258926392, "epoch": 5.30001977066034, "grad_norm": 1.171875, "learning_rate": 0.0002570986868782803, "loss": 4.7286, "mean_token_accuracy": 0.2499762699007988, "num_tokens": 122840829.0, "step": 53615 }, { "entropy": 5.250832414627075, "epoch": 5.300514037168841, "grad_norm": 1.0625, "learning_rate": 0.00025706350898660875, "loss": 4.6847, "mean_token_accuracy": 0.25124371647834776, "num_tokens": 122853131.0, "step": 53620 }, { "entropy": 5.341748809814453, "epoch": 5.301008303677343, "grad_norm": 1.0859375, "learning_rate": 0.00025702833153617755, "loss": 4.7198, "mean_token_accuracy": 0.2415199100971222, "num_tokens": 122865062.0, "step": 53625 }, { "entropy": 5.291502332687378, "epoch": 5.3015025701858445, "grad_norm": 1.28125, "learning_rate": 0.0002569931545278523, "loss": 4.6769, "mean_token_accuracy": 0.24783553332090377, "num_tokens": 122875696.0, "step": 53630 }, { "entropy": 5.313140726089477, "epoch": 5.301996836694346, "grad_norm": 1.0390625, "learning_rate": 0.00025695797796249824, "loss": 4.7189, "mean_token_accuracy": 0.24588965028524398, "num_tokens": 122888383.0, "step": 53635 }, { "entropy": 5.295430850982666, "epoch": 5.302491103202847, "grad_norm": 1.3984375, "learning_rate": 0.0002569228018409807, "loss": 4.6843, "mean_token_accuracy": 0.24708214849233628, "num_tokens": 122899345.0, "step": 53640 }, { "entropy": 5.36716103553772, "epoch": 5.302985369711348, "grad_norm": 1.1171875, "learning_rate": 0.00025688762616416503, "loss": 4.8455, "mean_token_accuracy": 0.2399102732539177, "num_tokens": 122911104.0, "step": 53645 }, { "entropy": 5.297065734863281, "epoch": 5.3034796362198495, "grad_norm": 1.046875, "learning_rate": 0.00025685245093291667, "loss": 4.6572, "mean_token_accuracy": 0.2523206189274788, "num_tokens": 122921844.0, "step": 53650 }, { "entropy": 5.288438701629639, "epoch": 5.303973902728351, "grad_norm": 1.21875, "learning_rate": 0.00025681727614810065, "loss": 4.7009, "mean_token_accuracy": 0.2547128930687904, "num_tokens": 122932774.0, "step": 53655 }, { "entropy": 5.269225597381592, "epoch": 5.304468169236852, "grad_norm": 1.140625, "learning_rate": 0.00025678210181058253, "loss": 4.7051, "mean_token_accuracy": 0.24414094984531404, "num_tokens": 122944565.0, "step": 53660 }, { "entropy": 5.2279315948486325, "epoch": 5.304962435745354, "grad_norm": 1.0703125, "learning_rate": 0.0002567469279212276, "loss": 4.5442, "mean_token_accuracy": 0.26312705129384995, "num_tokens": 122955989.0, "step": 53665 }, { "entropy": 5.279714584350586, "epoch": 5.3054567022538555, "grad_norm": 1.0703125, "learning_rate": 0.000256711754480901, "loss": 4.664, "mean_token_accuracy": 0.251164348423481, "num_tokens": 122967862.0, "step": 53670 }, { "entropy": 5.342661809921265, "epoch": 5.305950968762357, "grad_norm": 1.046875, "learning_rate": 0.00025667658149046814, "loss": 4.7048, "mean_token_accuracy": 0.24855540692806244, "num_tokens": 122978832.0, "step": 53675 }, { "entropy": 5.2776326656341555, "epoch": 5.306445235270858, "grad_norm": 1.109375, "learning_rate": 0.0002566414089507942, "loss": 4.6071, "mean_token_accuracy": 0.2582573637366295, "num_tokens": 122991342.0, "step": 53680 }, { "entropy": 5.223801851272583, "epoch": 5.306939501779359, "grad_norm": 1.03125, "learning_rate": 0.0002566062368627443, "loss": 4.6299, "mean_token_accuracy": 0.2599038079380989, "num_tokens": 123003377.0, "step": 53685 }, { "entropy": 5.236195802688599, "epoch": 5.3074337682878605, "grad_norm": 1.0703125, "learning_rate": 0.000256571065227184, "loss": 4.5704, "mean_token_accuracy": 0.2608728528022766, "num_tokens": 123013797.0, "step": 53690 }, { "entropy": 5.3059450626373295, "epoch": 5.307928034796362, "grad_norm": 1.15625, "learning_rate": 0.0002565358940449783, "loss": 4.6542, "mean_token_accuracy": 0.2532937124371529, "num_tokens": 123023858.0, "step": 53695 }, { "entropy": 5.273256587982178, "epoch": 5.308422301304864, "grad_norm": 1.21875, "learning_rate": 0.0002565007233169925, "loss": 4.7302, "mean_token_accuracy": 0.24633661210536956, "num_tokens": 123034410.0, "step": 53700 }, { "entropy": 5.219504404067993, "epoch": 5.308916567813365, "grad_norm": 1.171875, "learning_rate": 0.0002564655530440918, "loss": 4.6165, "mean_token_accuracy": 0.25317929685115814, "num_tokens": 123045422.0, "step": 53705 }, { "entropy": 5.367059135437012, "epoch": 5.3094108343218664, "grad_norm": 1.1875, "learning_rate": 0.00025643038322714125, "loss": 4.7397, "mean_token_accuracy": 0.24378642439842224, "num_tokens": 123056549.0, "step": 53710 }, { "entropy": 5.360862302780151, "epoch": 5.309905100830368, "grad_norm": 1.109375, "learning_rate": 0.00025639521386700627, "loss": 4.7405, "mean_token_accuracy": 0.24992591589689256, "num_tokens": 123067983.0, "step": 53715 }, { "entropy": 5.305232810974121, "epoch": 5.310399367338869, "grad_norm": 1.0234375, "learning_rate": 0.00025636004496455185, "loss": 4.7451, "mean_token_accuracy": 0.24254781007766724, "num_tokens": 123080332.0, "step": 53720 }, { "entropy": 5.368947601318359, "epoch": 5.31089363384737, "grad_norm": 1.15625, "learning_rate": 0.0002563248765206432, "loss": 4.7857, "mean_token_accuracy": 0.2413279578089714, "num_tokens": 123092905.0, "step": 53725 }, { "entropy": 5.362369346618652, "epoch": 5.3113879003558715, "grad_norm": 1.1484375, "learning_rate": 0.00025628970853614565, "loss": 4.7074, "mean_token_accuracy": 0.24640742540359498, "num_tokens": 123105042.0, "step": 53730 }, { "entropy": 5.28936800956726, "epoch": 5.311882166864374, "grad_norm": 1.0234375, "learning_rate": 0.000256254541011924, "loss": 4.6921, "mean_token_accuracy": 0.25131234228610994, "num_tokens": 123115986.0, "step": 53735 }, { "entropy": 5.406979894638061, "epoch": 5.312376433372875, "grad_norm": 1.109375, "learning_rate": 0.0002562193739488436, "loss": 4.8505, "mean_token_accuracy": 0.23415014147758484, "num_tokens": 123127453.0, "step": 53740 }, { "entropy": 5.3714601516723635, "epoch": 5.312870699881376, "grad_norm": 1.171875, "learning_rate": 0.00025618420734776945, "loss": 4.7824, "mean_token_accuracy": 0.24304330497980117, "num_tokens": 123138806.0, "step": 53745 }, { "entropy": 5.319638681411743, "epoch": 5.313364966389877, "grad_norm": 1.109375, "learning_rate": 0.0002561490412095668, "loss": 4.6875, "mean_token_accuracy": 0.2549930840730667, "num_tokens": 123149498.0, "step": 53750 }, { "entropy": 5.263814449310303, "epoch": 5.313859232898379, "grad_norm": 1.1875, "learning_rate": 0.00025611387553510067, "loss": 4.6665, "mean_token_accuracy": 0.2463844209909439, "num_tokens": 123160669.0, "step": 53755 }, { "entropy": 5.254792785644531, "epoch": 5.31435349940688, "grad_norm": 1.140625, "learning_rate": 0.0002560787103252361, "loss": 4.619, "mean_token_accuracy": 0.25300550907850267, "num_tokens": 123171330.0, "step": 53760 }, { "entropy": 5.302219867706299, "epoch": 5.314847765915381, "grad_norm": 1.140625, "learning_rate": 0.0002560435455808382, "loss": 4.7248, "mean_token_accuracy": 0.2490320920944214, "num_tokens": 123183449.0, "step": 53765 }, { "entropy": 5.272320890426636, "epoch": 5.315342032423883, "grad_norm": 1.0703125, "learning_rate": 0.0002560083813027719, "loss": 4.6796, "mean_token_accuracy": 0.25509092062711713, "num_tokens": 123194904.0, "step": 53770 }, { "entropy": 5.323369789123535, "epoch": 5.315836298932385, "grad_norm": 1.1953125, "learning_rate": 0.0002559732174919026, "loss": 4.6202, "mean_token_accuracy": 0.24860999137163162, "num_tokens": 123206240.0, "step": 53775 }, { "entropy": 5.33658652305603, "epoch": 5.316330565440886, "grad_norm": 1.1796875, "learning_rate": 0.0002559380541490949, "loss": 4.6661, "mean_token_accuracy": 0.2501580104231834, "num_tokens": 123217277.0, "step": 53780 }, { "entropy": 5.204512310028076, "epoch": 5.316824831949387, "grad_norm": 1.171875, "learning_rate": 0.00025590289127521413, "loss": 4.5922, "mean_token_accuracy": 0.261431896686554, "num_tokens": 123228074.0, "step": 53785 }, { "entropy": 5.238047885894775, "epoch": 5.317319098457888, "grad_norm": 1.09375, "learning_rate": 0.0002558677288711252, "loss": 4.6413, "mean_token_accuracy": 0.24933912456035615, "num_tokens": 123238030.0, "step": 53790 }, { "entropy": 5.245896577835083, "epoch": 5.31781336496639, "grad_norm": 1.2109375, "learning_rate": 0.0002558325669376931, "loss": 4.6981, "mean_token_accuracy": 0.24831452816724778, "num_tokens": 123248716.0, "step": 53795 }, { "entropy": 5.248541688919067, "epoch": 5.318307631474891, "grad_norm": 0.99609375, "learning_rate": 0.0002557974054757827, "loss": 4.5942, "mean_token_accuracy": 0.25794236809015275, "num_tokens": 123260235.0, "step": 53800 }, { "entropy": 5.307414770126343, "epoch": 5.318801897983393, "grad_norm": 1.234375, "learning_rate": 0.0002557622444862593, "loss": 4.6675, "mean_token_accuracy": 0.2609457612037659, "num_tokens": 123272214.0, "step": 53805 }, { "entropy": 5.290539693832398, "epoch": 5.319296164491894, "grad_norm": 1.1328125, "learning_rate": 0.00025572708396998757, "loss": 4.6859, "mean_token_accuracy": 0.24773803800344468, "num_tokens": 123283644.0, "step": 53810 }, { "entropy": 5.246548366546631, "epoch": 5.319790431000396, "grad_norm": 1.1015625, "learning_rate": 0.00025569192392783257, "loss": 4.632, "mean_token_accuracy": 0.25633982121944426, "num_tokens": 123295487.0, "step": 53815 }, { "entropy": 5.311654424667358, "epoch": 5.320284697508897, "grad_norm": 1.1484375, "learning_rate": 0.0002556567643606593, "loss": 4.6895, "mean_token_accuracy": 0.253307543694973, "num_tokens": 123306912.0, "step": 53820 }, { "entropy": 5.3119361877441404, "epoch": 5.320778964017398, "grad_norm": 1.125, "learning_rate": 0.0002556216052693325, "loss": 4.6835, "mean_token_accuracy": 0.24600641578435897, "num_tokens": 123318875.0, "step": 53825 }, { "entropy": 5.288479232788086, "epoch": 5.321273230525899, "grad_norm": 1.0859375, "learning_rate": 0.0002555864466547173, "loss": 4.7211, "mean_token_accuracy": 0.24974568337202072, "num_tokens": 123330877.0, "step": 53830 }, { "entropy": 5.219062757492066, "epoch": 5.321767497034401, "grad_norm": 1.1015625, "learning_rate": 0.00025555128851767846, "loss": 4.5693, "mean_token_accuracy": 0.2705734968185425, "num_tokens": 123341720.0, "step": 53835 }, { "entropy": 5.28962459564209, "epoch": 5.322261763542902, "grad_norm": 1.0390625, "learning_rate": 0.000255516130859081, "loss": 4.6847, "mean_token_accuracy": 0.2533470928668976, "num_tokens": 123353160.0, "step": 53840 }, { "entropy": 5.26413745880127, "epoch": 5.322756030051404, "grad_norm": 1.1328125, "learning_rate": 0.0002554809736797898, "loss": 4.661, "mean_token_accuracy": 0.2522304832935333, "num_tokens": 123363726.0, "step": 53845 }, { "entropy": 5.327324247360229, "epoch": 5.323250296559905, "grad_norm": 1.140625, "learning_rate": 0.00025544581698066967, "loss": 4.6889, "mean_token_accuracy": 0.24605195075273514, "num_tokens": 123375152.0, "step": 53850 }, { "entropy": 5.281286287307739, "epoch": 5.323744563068407, "grad_norm": 1.203125, "learning_rate": 0.00025541066076258535, "loss": 4.6557, "mean_token_accuracy": 0.25206560641527176, "num_tokens": 123386266.0, "step": 53855 }, { "entropy": 5.2763865947723385, "epoch": 5.324238829576908, "grad_norm": 1.203125, "learning_rate": 0.00025537550502640184, "loss": 4.6247, "mean_token_accuracy": 0.26171732097864153, "num_tokens": 123396423.0, "step": 53860 }, { "entropy": 5.330676031112671, "epoch": 5.324733096085409, "grad_norm": 1.1171875, "learning_rate": 0.00025534034977298396, "loss": 4.7133, "mean_token_accuracy": 0.2484806224703789, "num_tokens": 123407907.0, "step": 53865 }, { "entropy": 5.295506811141967, "epoch": 5.32522736259391, "grad_norm": 1.0859375, "learning_rate": 0.0002553051950031966, "loss": 4.7318, "mean_token_accuracy": 0.24204422086477279, "num_tokens": 123419968.0, "step": 53870 }, { "entropy": 5.3424512386322025, "epoch": 5.325721629102412, "grad_norm": 1.1640625, "learning_rate": 0.0002552700407179045, "loss": 4.7679, "mean_token_accuracy": 0.2419187232851982, "num_tokens": 123432089.0, "step": 53875 }, { "entropy": 5.303827476501465, "epoch": 5.326215895610914, "grad_norm": 1.1328125, "learning_rate": 0.00025523488691797235, "loss": 4.6783, "mean_token_accuracy": 0.25416277498006823, "num_tokens": 123443623.0, "step": 53880 }, { "entropy": 5.370646810531616, "epoch": 5.326710162119415, "grad_norm": 1.140625, "learning_rate": 0.00025519973360426507, "loss": 4.7159, "mean_token_accuracy": 0.24902843683958054, "num_tokens": 123454200.0, "step": 53885 }, { "entropy": 5.391429996490478, "epoch": 5.327204428627916, "grad_norm": 1.2109375, "learning_rate": 0.0002551645807776475, "loss": 4.7761, "mean_token_accuracy": 0.2436844751238823, "num_tokens": 123466361.0, "step": 53890 }, { "entropy": 5.315594720840454, "epoch": 5.327698695136418, "grad_norm": 1.1640625, "learning_rate": 0.0002551294284389843, "loss": 4.7252, "mean_token_accuracy": 0.24284348338842393, "num_tokens": 123478355.0, "step": 53895 }, { "entropy": 5.25052399635315, "epoch": 5.328192961644919, "grad_norm": 1.0546875, "learning_rate": 0.00025509427658914024, "loss": 4.6594, "mean_token_accuracy": 0.2537122666835785, "num_tokens": 123489463.0, "step": 53900 }, { "entropy": 5.306036186218262, "epoch": 5.32868722815342, "grad_norm": 1.109375, "learning_rate": 0.00025505912522898, "loss": 4.6567, "mean_token_accuracy": 0.254491800069809, "num_tokens": 123500924.0, "step": 53905 }, { "entropy": 5.267603206634521, "epoch": 5.329181494661921, "grad_norm": 1.1171875, "learning_rate": 0.00025502397435936847, "loss": 4.5368, "mean_token_accuracy": 0.2614602863788605, "num_tokens": 123511414.0, "step": 53910 }, { "entropy": 5.221489763259887, "epoch": 5.329675761170423, "grad_norm": 1.125, "learning_rate": 0.0002549888239811701, "loss": 4.5872, "mean_token_accuracy": 0.26104251146316526, "num_tokens": 123521741.0, "step": 53915 }, { "entropy": 5.168415641784668, "epoch": 5.330170027678925, "grad_norm": 1.1484375, "learning_rate": 0.0002549536740952499, "loss": 4.6133, "mean_token_accuracy": 0.25633710324764253, "num_tokens": 123532469.0, "step": 53920 }, { "entropy": 5.230343198776245, "epoch": 5.330664294187426, "grad_norm": 1.09375, "learning_rate": 0.0002549185247024725, "loss": 4.6082, "mean_token_accuracy": 0.2626496896147728, "num_tokens": 123544931.0, "step": 53925 }, { "entropy": 5.358964586257935, "epoch": 5.331158560695927, "grad_norm": 1.125, "learning_rate": 0.00025488337580370236, "loss": 4.7326, "mean_token_accuracy": 0.2497574895620346, "num_tokens": 123557042.0, "step": 53930 }, { "entropy": 5.302344226837159, "epoch": 5.331652827204429, "grad_norm": 1.1640625, "learning_rate": 0.0002548482273998044, "loss": 4.6244, "mean_token_accuracy": 0.24739812165498734, "num_tokens": 123567740.0, "step": 53935 }, { "entropy": 5.2955526351928714, "epoch": 5.33214709371293, "grad_norm": 1.2578125, "learning_rate": 0.0002548130794916432, "loss": 4.6901, "mean_token_accuracy": 0.24735261201858522, "num_tokens": 123577756.0, "step": 53940 }, { "entropy": 5.288100481033325, "epoch": 5.332641360221431, "grad_norm": 1.09375, "learning_rate": 0.00025477793208008323, "loss": 4.7411, "mean_token_accuracy": 0.24835767596960068, "num_tokens": 123590160.0, "step": 53945 }, { "entropy": 5.2539245128631595, "epoch": 5.333135626729932, "grad_norm": 0.99609375, "learning_rate": 0.0002547427851659893, "loss": 4.6171, "mean_token_accuracy": 0.2544841766357422, "num_tokens": 123602240.0, "step": 53950 }, { "entropy": 5.3813543796539305, "epoch": 5.3336298932384345, "grad_norm": 1.0078125, "learning_rate": 0.000254707638750226, "loss": 4.7694, "mean_token_accuracy": 0.24031484723091126, "num_tokens": 123613634.0, "step": 53955 }, { "entropy": 5.3035320281982425, "epoch": 5.334124159746936, "grad_norm": 1.078125, "learning_rate": 0.000254672492833658, "loss": 4.6957, "mean_token_accuracy": 0.250347888469696, "num_tokens": 123625094.0, "step": 53960 }, { "entropy": 5.311476993560791, "epoch": 5.334618426255437, "grad_norm": 1.1953125, "learning_rate": 0.00025463734741714984, "loss": 4.7201, "mean_token_accuracy": 0.24490259289741517, "num_tokens": 123636481.0, "step": 53965 }, { "entropy": 5.206267070770264, "epoch": 5.335112692763938, "grad_norm": 1.15625, "learning_rate": 0.000254602202501566, "loss": 4.5431, "mean_token_accuracy": 0.2626090720295906, "num_tokens": 123645674.0, "step": 53970 }, { "entropy": 5.2194740772247314, "epoch": 5.3356069592724396, "grad_norm": 1.0078125, "learning_rate": 0.0002545670580877712, "loss": 4.5703, "mean_token_accuracy": 0.25792066752910614, "num_tokens": 123656592.0, "step": 53975 }, { "entropy": 5.244803619384766, "epoch": 5.336101225780941, "grad_norm": 1.1875, "learning_rate": 0.0002545319141766299, "loss": 4.6606, "mean_token_accuracy": 0.24904990792274476, "num_tokens": 123668084.0, "step": 53980 }, { "entropy": 5.360618019104004, "epoch": 5.336595492289442, "grad_norm": 1.1171875, "learning_rate": 0.0002544967707690068, "loss": 4.8282, "mean_token_accuracy": 0.24045540988445283, "num_tokens": 123679416.0, "step": 53985 }, { "entropy": 5.310838985443115, "epoch": 5.337089758797944, "grad_norm": 1.1484375, "learning_rate": 0.00025446162786576626, "loss": 4.6643, "mean_token_accuracy": 0.24614173769950867, "num_tokens": 123690165.0, "step": 53990 }, { "entropy": 5.352542543411255, "epoch": 5.3375840253064455, "grad_norm": 0.9921875, "learning_rate": 0.0002544264854677728, "loss": 4.7485, "mean_token_accuracy": 0.2430441752076149, "num_tokens": 123702294.0, "step": 53995 }, { "entropy": 5.3384466648101805, "epoch": 5.338078291814947, "grad_norm": 1.1171875, "learning_rate": 0.00025439134357589107, "loss": 4.696, "mean_token_accuracy": 0.25227421671152117, "num_tokens": 123712872.0, "step": 54000 }, { "epoch": 5.338078291814947, "eval_entropy": 5.075707807752039, "eval_loss": 4.842234134674072, "eval_mean_token_accuracy": 0.24680353956798787, "eval_num_tokens": 123712872.0, "eval_runtime": 26.6323, "eval_samples_per_second": 1220.81, "eval_steps_per_second": 152.634, "step": 54000 }, { "entropy": 5.28097939491272, "epoch": 5.338572558323448, "grad_norm": 1.0625, "learning_rate": 0.0002543562021909854, "loss": 4.6769, "mean_token_accuracy": 0.2510912373661995, "num_tokens": 123724550.0, "step": 54005 }, { "entropy": 5.304819107055664, "epoch": 5.339066824831949, "grad_norm": 1.046875, "learning_rate": 0.0002543210613139204, "loss": 4.7238, "mean_token_accuracy": 0.23940031081438065, "num_tokens": 123736027.0, "step": 54010 }, { "entropy": 5.401049709320068, "epoch": 5.3395610913404505, "grad_norm": 1.203125, "learning_rate": 0.00025428592094556057, "loss": 4.8185, "mean_token_accuracy": 0.23491065353155136, "num_tokens": 123746986.0, "step": 54015 }, { "entropy": 5.353581190109253, "epoch": 5.340055357848952, "grad_norm": 1.140625, "learning_rate": 0.0002542507810867702, "loss": 4.7088, "mean_token_accuracy": 0.24775775223970414, "num_tokens": 123757170.0, "step": 54020 }, { "entropy": 5.28901515007019, "epoch": 5.340549624357454, "grad_norm": 1.0703125, "learning_rate": 0.0002542156417384139, "loss": 4.7229, "mean_token_accuracy": 0.2497846931219101, "num_tokens": 123768925.0, "step": 54025 }, { "entropy": 5.303956174850464, "epoch": 5.341043890865955, "grad_norm": 1.1640625, "learning_rate": 0.00025418050290135593, "loss": 4.703, "mean_token_accuracy": 0.2442299410700798, "num_tokens": 123779274.0, "step": 54030 }, { "entropy": 5.3652125835418705, "epoch": 5.3415381573744565, "grad_norm": 1.1015625, "learning_rate": 0.0002541453645764609, "loss": 4.8386, "mean_token_accuracy": 0.2352303996682167, "num_tokens": 123791146.0, "step": 54035 }, { "entropy": 5.285414791107177, "epoch": 5.342032423882958, "grad_norm": 1.1640625, "learning_rate": 0.00025411022676459315, "loss": 4.6539, "mean_token_accuracy": 0.24997459203004838, "num_tokens": 123802137.0, "step": 54040 }, { "entropy": 5.26641354560852, "epoch": 5.342526690391459, "grad_norm": 1.109375, "learning_rate": 0.0002540750894666171, "loss": 4.6131, "mean_token_accuracy": 0.2548798218369484, "num_tokens": 123813055.0, "step": 54045 }, { "entropy": 5.305633449554444, "epoch": 5.34302095689996, "grad_norm": 1.15625, "learning_rate": 0.000254039952683397, "loss": 4.7238, "mean_token_accuracy": 0.2576647728681564, "num_tokens": 123824480.0, "step": 54050 }, { "entropy": 5.360873174667359, "epoch": 5.3435152234084615, "grad_norm": 1.171875, "learning_rate": 0.00025400481641579744, "loss": 4.6972, "mean_token_accuracy": 0.2541563928127289, "num_tokens": 123834681.0, "step": 54055 }, { "entropy": 5.29359540939331, "epoch": 5.344009489916964, "grad_norm": 1.15625, "learning_rate": 0.00025396968066468243, "loss": 4.7409, "mean_token_accuracy": 0.24856852144002914, "num_tokens": 123846054.0, "step": 54060 }, { "entropy": 5.270547199249267, "epoch": 5.344503756425465, "grad_norm": 1.1640625, "learning_rate": 0.0002539345454309168, "loss": 4.6683, "mean_token_accuracy": 0.25091507136821745, "num_tokens": 123857418.0, "step": 54065 }, { "entropy": 5.215301418304444, "epoch": 5.344998022933966, "grad_norm": 1.078125, "learning_rate": 0.0002538994107153644, "loss": 4.5707, "mean_token_accuracy": 0.25740703791379926, "num_tokens": 123868434.0, "step": 54070 }, { "entropy": 5.232172441482544, "epoch": 5.3454922894424675, "grad_norm": 1.015625, "learning_rate": 0.00025386427651888995, "loss": 4.6721, "mean_token_accuracy": 0.257812038064003, "num_tokens": 123880502.0, "step": 54075 }, { "entropy": 5.369088745117187, "epoch": 5.345986555950969, "grad_norm": 1.0859375, "learning_rate": 0.0002538291428423575, "loss": 4.795, "mean_token_accuracy": 0.24566221833229065, "num_tokens": 123891352.0, "step": 54080 }, { "entropy": 5.2876911640167235, "epoch": 5.34648082245947, "grad_norm": 1.0546875, "learning_rate": 0.00025379400968663144, "loss": 4.7062, "mean_token_accuracy": 0.24692760556936263, "num_tokens": 123902615.0, "step": 54085 }, { "entropy": 5.269077777862549, "epoch": 5.346975088967971, "grad_norm": 1.1171875, "learning_rate": 0.00025375887705257594, "loss": 4.6504, "mean_token_accuracy": 0.25054749846458435, "num_tokens": 123915214.0, "step": 54090 }, { "entropy": 5.319334316253662, "epoch": 5.3474693554764725, "grad_norm": 1.0703125, "learning_rate": 0.0002537237449410554, "loss": 4.762, "mean_token_accuracy": 0.23744243234395981, "num_tokens": 123925659.0, "step": 54095 }, { "entropy": 5.302032470703125, "epoch": 5.347963621984975, "grad_norm": 1.0859375, "learning_rate": 0.0002536886133529341, "loss": 4.7191, "mean_token_accuracy": 0.24782695174217223, "num_tokens": 123938814.0, "step": 54100 }, { "entropy": 5.410184001922607, "epoch": 5.348457888493476, "grad_norm": 1.0390625, "learning_rate": 0.0002536534822890762, "loss": 4.7635, "mean_token_accuracy": 0.2443752869963646, "num_tokens": 123949417.0, "step": 54105 }, { "entropy": 5.298951148986816, "epoch": 5.348952155001977, "grad_norm": 1.109375, "learning_rate": 0.0002536183517503459, "loss": 4.6979, "mean_token_accuracy": 0.2511679992079735, "num_tokens": 123961019.0, "step": 54110 }, { "entropy": 5.264599227905274, "epoch": 5.3494464215104784, "grad_norm": 1.0625, "learning_rate": 0.0002535832217376075, "loss": 4.6735, "mean_token_accuracy": 0.2556931585073471, "num_tokens": 123972524.0, "step": 54115 }, { "entropy": 5.255339336395264, "epoch": 5.34994068801898, "grad_norm": 1.109375, "learning_rate": 0.00025354809225172517, "loss": 4.6742, "mean_token_accuracy": 0.25559237599372864, "num_tokens": 123984749.0, "step": 54120 }, { "entropy": 5.410820055007934, "epoch": 5.350434954527481, "grad_norm": 1.1796875, "learning_rate": 0.000253512963293563, "loss": 4.772, "mean_token_accuracy": 0.2427709773182869, "num_tokens": 123995178.0, "step": 54125 }, { "entropy": 5.3074499607086185, "epoch": 5.350929221035982, "grad_norm": 1.09375, "learning_rate": 0.0002534778348639854, "loss": 4.6489, "mean_token_accuracy": 0.24903591573238373, "num_tokens": 124006337.0, "step": 54130 }, { "entropy": 5.366962909698486, "epoch": 5.351423487544484, "grad_norm": 1.1875, "learning_rate": 0.0002534427069638564, "loss": 4.8028, "mean_token_accuracy": 0.23935225903987883, "num_tokens": 124017393.0, "step": 54135 }, { "entropy": 5.259323024749756, "epoch": 5.351917754052986, "grad_norm": 1.0234375, "learning_rate": 0.0002534075795940401, "loss": 4.636, "mean_token_accuracy": 0.25222055315971376, "num_tokens": 124029376.0, "step": 54140 }, { "entropy": 5.37720046043396, "epoch": 5.352412020561487, "grad_norm": 1.15625, "learning_rate": 0.00025337245275540074, "loss": 4.6976, "mean_token_accuracy": 0.24547610878944398, "num_tokens": 124040613.0, "step": 54145 }, { "entropy": 5.339360570907592, "epoch": 5.352906287069988, "grad_norm": 1.09375, "learning_rate": 0.00025333732644880225, "loss": 4.7261, "mean_token_accuracy": 0.2508332282304764, "num_tokens": 124051207.0, "step": 54150 }, { "entropy": 5.313760614395141, "epoch": 5.353400553578489, "grad_norm": 1.109375, "learning_rate": 0.000253302200675109, "loss": 4.6824, "mean_token_accuracy": 0.24604411721229552, "num_tokens": 124063573.0, "step": 54155 }, { "entropy": 5.296550369262695, "epoch": 5.353894820086991, "grad_norm": 1.3203125, "learning_rate": 0.000253267075435185, "loss": 4.6952, "mean_token_accuracy": 0.24816329926252365, "num_tokens": 124074861.0, "step": 54160 }, { "entropy": 5.247271585464477, "epoch": 5.354389086595492, "grad_norm": 1.109375, "learning_rate": 0.0002532319507298943, "loss": 4.5964, "mean_token_accuracy": 0.2560767725110054, "num_tokens": 124085165.0, "step": 54165 }, { "entropy": 5.319640350341797, "epoch": 5.354883353103993, "grad_norm": 1.15625, "learning_rate": 0.00025319682656010104, "loss": 4.7711, "mean_token_accuracy": 0.24814376682043077, "num_tokens": 124095853.0, "step": 54170 }, { "entropy": 5.323901081085205, "epoch": 5.355377619612495, "grad_norm": 1.234375, "learning_rate": 0.0002531617029266691, "loss": 4.6582, "mean_token_accuracy": 0.2517841517925262, "num_tokens": 124106323.0, "step": 54175 }, { "entropy": 5.3107428550720215, "epoch": 5.355871886120997, "grad_norm": 1.0390625, "learning_rate": 0.0002531265798304627, "loss": 4.7506, "mean_token_accuracy": 0.2457740753889084, "num_tokens": 124118242.0, "step": 54180 }, { "entropy": 5.347803401947021, "epoch": 5.356366152629498, "grad_norm": 1.2109375, "learning_rate": 0.0002530914572723459, "loss": 4.7162, "mean_token_accuracy": 0.2464449167251587, "num_tokens": 124129096.0, "step": 54185 }, { "entropy": 5.3141885757446286, "epoch": 5.356860419137999, "grad_norm": 1.140625, "learning_rate": 0.00025305633525318257, "loss": 4.7135, "mean_token_accuracy": 0.24680417776107788, "num_tokens": 124139829.0, "step": 54190 }, { "entropy": 5.226624155044556, "epoch": 5.3573546856465, "grad_norm": 1.09375, "learning_rate": 0.0002530212137738369, "loss": 4.6047, "mean_token_accuracy": 0.25653236359357834, "num_tokens": 124151221.0, "step": 54195 }, { "entropy": 5.335521268844604, "epoch": 5.357848952155002, "grad_norm": 1.15625, "learning_rate": 0.00025298609283517273, "loss": 4.7573, "mean_token_accuracy": 0.23918902724981309, "num_tokens": 124162274.0, "step": 54200 }, { "entropy": 5.321603536605835, "epoch": 5.358343218663503, "grad_norm": 1.1875, "learning_rate": 0.00025295097243805396, "loss": 4.6039, "mean_token_accuracy": 0.2617741793394089, "num_tokens": 124172849.0, "step": 54205 }, { "entropy": 5.271273469924926, "epoch": 5.358837485172005, "grad_norm": 1.234375, "learning_rate": 0.00025291585258334484, "loss": 4.6638, "mean_token_accuracy": 0.25552326142787934, "num_tokens": 124183473.0, "step": 54210 }, { "entropy": 5.332057046890259, "epoch": 5.359331751680506, "grad_norm": 1.171875, "learning_rate": 0.00025288073327190915, "loss": 4.7558, "mean_token_accuracy": 0.24244979321956633, "num_tokens": 124196226.0, "step": 54215 }, { "entropy": 5.236352109909058, "epoch": 5.359826018189008, "grad_norm": 1.203125, "learning_rate": 0.00025284561450461085, "loss": 4.7375, "mean_token_accuracy": 0.2482965037226677, "num_tokens": 124208321.0, "step": 54220 }, { "entropy": 5.29271354675293, "epoch": 5.360320284697509, "grad_norm": 1.1484375, "learning_rate": 0.00025281049628231387, "loss": 4.7149, "mean_token_accuracy": 0.2540722131729126, "num_tokens": 124219520.0, "step": 54225 }, { "entropy": 5.432508897781372, "epoch": 5.36081455120601, "grad_norm": 1.1171875, "learning_rate": 0.0002527753786058821, "loss": 4.8174, "mean_token_accuracy": 0.23873639106750488, "num_tokens": 124231655.0, "step": 54230 }, { "entropy": 5.351326322555542, "epoch": 5.361308817714511, "grad_norm": 1.1328125, "learning_rate": 0.00025274026147617946, "loss": 4.7433, "mean_token_accuracy": 0.24719476699829102, "num_tokens": 124244417.0, "step": 54235 }, { "entropy": 5.273208045959473, "epoch": 5.361803084223013, "grad_norm": 1.265625, "learning_rate": 0.0002527051448940698, "loss": 4.6234, "mean_token_accuracy": 0.2556925356388092, "num_tokens": 124255816.0, "step": 54240 }, { "entropy": 5.398664665222168, "epoch": 5.362297350731515, "grad_norm": 1.09375, "learning_rate": 0.0002526700288604171, "loss": 4.7562, "mean_token_accuracy": 0.2476442962884903, "num_tokens": 124267356.0, "step": 54245 }, { "entropy": 5.313869380950928, "epoch": 5.362791617240016, "grad_norm": 1.1328125, "learning_rate": 0.00025263491337608517, "loss": 4.695, "mean_token_accuracy": 0.24773548692464828, "num_tokens": 124278926.0, "step": 54250 }, { "entropy": 5.1810227394104, "epoch": 5.363285883748517, "grad_norm": 1.1484375, "learning_rate": 0.00025259979844193794, "loss": 4.556, "mean_token_accuracy": 0.26466346681118014, "num_tokens": 124289680.0, "step": 54255 }, { "entropy": 5.293625211715698, "epoch": 5.363780150257019, "grad_norm": 1.1640625, "learning_rate": 0.00025256468405883897, "loss": 4.6827, "mean_token_accuracy": 0.2524278238415718, "num_tokens": 124301558.0, "step": 54260 }, { "entropy": 5.371429395675659, "epoch": 5.36427441676552, "grad_norm": 1.1171875, "learning_rate": 0.00025252957022765224, "loss": 4.7984, "mean_token_accuracy": 0.23933090418577194, "num_tokens": 124314358.0, "step": 54265 }, { "entropy": 5.284126043319702, "epoch": 5.364768683274021, "grad_norm": 1.21875, "learning_rate": 0.0002524944569492416, "loss": 4.7326, "mean_token_accuracy": 0.2478663817048073, "num_tokens": 124325046.0, "step": 54270 }, { "entropy": 5.317949295043945, "epoch": 5.365262949782522, "grad_norm": 1.140625, "learning_rate": 0.00025245934422447094, "loss": 4.7001, "mean_token_accuracy": 0.2557242065668106, "num_tokens": 124337204.0, "step": 54275 }, { "entropy": 5.264107513427734, "epoch": 5.3657572162910245, "grad_norm": 1.1875, "learning_rate": 0.00025242423205420377, "loss": 4.6274, "mean_token_accuracy": 0.2558572947978973, "num_tokens": 124350049.0, "step": 54280 }, { "entropy": 5.2096781730651855, "epoch": 5.366251482799526, "grad_norm": 1.1328125, "learning_rate": 0.0002523891204393041, "loss": 4.625, "mean_token_accuracy": 0.25626456886529925, "num_tokens": 124361586.0, "step": 54285 }, { "entropy": 5.323943662643432, "epoch": 5.366745749308027, "grad_norm": 1.1171875, "learning_rate": 0.00025235400938063547, "loss": 4.8013, "mean_token_accuracy": 0.24654000401496887, "num_tokens": 124373152.0, "step": 54290 }, { "entropy": 5.377172374725342, "epoch": 5.367240015816528, "grad_norm": 1.0390625, "learning_rate": 0.00025231889887906175, "loss": 4.7947, "mean_token_accuracy": 0.2425898090004921, "num_tokens": 124385401.0, "step": 54295 }, { "entropy": 5.278111267089844, "epoch": 5.36773428232503, "grad_norm": 1.1328125, "learning_rate": 0.0002522837889354466, "loss": 4.6542, "mean_token_accuracy": 0.25532076954841615, "num_tokens": 124396132.0, "step": 54300 }, { "entropy": 5.2911265850067135, "epoch": 5.368228548833531, "grad_norm": 1.078125, "learning_rate": 0.0002522486795506538, "loss": 4.7199, "mean_token_accuracy": 0.2548220783472061, "num_tokens": 124407884.0, "step": 54305 }, { "entropy": 5.321082639694214, "epoch": 5.368722815342032, "grad_norm": 1.125, "learning_rate": 0.00025221357072554706, "loss": 4.686, "mean_token_accuracy": 0.2517186179757118, "num_tokens": 124418497.0, "step": 54310 }, { "entropy": 5.2770607471466064, "epoch": 5.369217081850534, "grad_norm": 1.0859375, "learning_rate": 0.00025217846246099, "loss": 4.6639, "mean_token_accuracy": 0.2514487773180008, "num_tokens": 124430333.0, "step": 54315 }, { "entropy": 5.411149024963379, "epoch": 5.3697113483590355, "grad_norm": 1.203125, "learning_rate": 0.00025214335475784634, "loss": 4.8098, "mean_token_accuracy": 0.23829082399606705, "num_tokens": 124441504.0, "step": 54320 }, { "entropy": 5.290459537506104, "epoch": 5.370205614867537, "grad_norm": 1.1015625, "learning_rate": 0.00025210824761697957, "loss": 4.7105, "mean_token_accuracy": 0.24572601914405823, "num_tokens": 124454384.0, "step": 54325 }, { "entropy": 5.355165290832519, "epoch": 5.370699881376038, "grad_norm": 1.0703125, "learning_rate": 0.00025207314103925353, "loss": 4.766, "mean_token_accuracy": 0.24113469421863556, "num_tokens": 124466589.0, "step": 54330 }, { "entropy": 5.277112197875977, "epoch": 5.371194147884539, "grad_norm": 1.140625, "learning_rate": 0.0002520380350255318, "loss": 4.6519, "mean_token_accuracy": 0.25520854741334914, "num_tokens": 124477884.0, "step": 54335 }, { "entropy": 5.324514579772949, "epoch": 5.371688414393041, "grad_norm": 1.109375, "learning_rate": 0.000252002929576678, "loss": 4.6825, "mean_token_accuracy": 0.25273856371641157, "num_tokens": 124489007.0, "step": 54340 }, { "entropy": 5.315210771560669, "epoch": 5.372182680901542, "grad_norm": 1.1484375, "learning_rate": 0.00025196782469355566, "loss": 4.7368, "mean_token_accuracy": 0.25099447518587115, "num_tokens": 124499918.0, "step": 54345 }, { "entropy": 5.310817384719849, "epoch": 5.372676947410043, "grad_norm": 1.078125, "learning_rate": 0.0002519327203770283, "loss": 4.7014, "mean_token_accuracy": 0.2518401280045509, "num_tokens": 124510960.0, "step": 54350 }, { "entropy": 5.272677373886109, "epoch": 5.373171213918545, "grad_norm": 1.109375, "learning_rate": 0.00025189761662795974, "loss": 4.632, "mean_token_accuracy": 0.24941671788692474, "num_tokens": 124522037.0, "step": 54355 }, { "entropy": 5.262759113311768, "epoch": 5.3736654804270465, "grad_norm": 1.1015625, "learning_rate": 0.00025186251344721334, "loss": 4.7163, "mean_token_accuracy": 0.24423142224550248, "num_tokens": 124534530.0, "step": 54360 }, { "entropy": 5.321040153503418, "epoch": 5.374159746935548, "grad_norm": 1.1171875, "learning_rate": 0.00025182741083565276, "loss": 4.6616, "mean_token_accuracy": 0.2518792450428009, "num_tokens": 124546633.0, "step": 54365 }, { "entropy": 5.366517066955566, "epoch": 5.374654013444049, "grad_norm": 1.1796875, "learning_rate": 0.0002517923087941414, "loss": 4.7435, "mean_token_accuracy": 0.24747716039419174, "num_tokens": 124557561.0, "step": 54370 }, { "entropy": 5.305030298233032, "epoch": 5.37514827995255, "grad_norm": 1.125, "learning_rate": 0.00025175720732354285, "loss": 4.678, "mean_token_accuracy": 0.24415096789598464, "num_tokens": 124570302.0, "step": 54375 }, { "entropy": 5.295708894729614, "epoch": 5.3756425464610516, "grad_norm": 1.0390625, "learning_rate": 0.0002517221064247206, "loss": 4.7199, "mean_token_accuracy": 0.24965900778770447, "num_tokens": 124582437.0, "step": 54380 }, { "entropy": 5.360160827636719, "epoch": 5.376136812969553, "grad_norm": 1.1328125, "learning_rate": 0.00025168700609853813, "loss": 4.7538, "mean_token_accuracy": 0.2481842517852783, "num_tokens": 124594240.0, "step": 54385 }, { "entropy": 5.3141107082366945, "epoch": 5.376631079478055, "grad_norm": 1.09375, "learning_rate": 0.000251651906345859, "loss": 4.6917, "mean_token_accuracy": 0.24943288713693618, "num_tokens": 124605420.0, "step": 54390 }, { "entropy": 5.255263948440552, "epoch": 5.377125345986556, "grad_norm": 1.1484375, "learning_rate": 0.0002516168071675466, "loss": 4.6744, "mean_token_accuracy": 0.24669965207576752, "num_tokens": 124616435.0, "step": 54395 }, { "entropy": 5.229502725601196, "epoch": 5.3776196124950575, "grad_norm": 1.078125, "learning_rate": 0.0002515817085644643, "loss": 4.6488, "mean_token_accuracy": 0.2543462201952934, "num_tokens": 124628156.0, "step": 54400 }, { "entropy": 5.221582746505737, "epoch": 5.378113879003559, "grad_norm": 1.1953125, "learning_rate": 0.0002515466105374756, "loss": 4.6291, "mean_token_accuracy": 0.2577522426843643, "num_tokens": 124639470.0, "step": 54405 }, { "entropy": 5.3137736320495605, "epoch": 5.37860814551206, "grad_norm": 1.2109375, "learning_rate": 0.0002515115130874439, "loss": 4.7458, "mean_token_accuracy": 0.24263215512037278, "num_tokens": 124650774.0, "step": 54410 }, { "entropy": 5.27650899887085, "epoch": 5.379102412020561, "grad_norm": 1.1015625, "learning_rate": 0.00025147641621523273, "loss": 4.7046, "mean_token_accuracy": 0.252636244893074, "num_tokens": 124661644.0, "step": 54415 }, { "entropy": 5.355701875686646, "epoch": 5.3795966785290625, "grad_norm": 1.0390625, "learning_rate": 0.0002514413199217053, "loss": 4.7065, "mean_token_accuracy": 0.24878741353750228, "num_tokens": 124674388.0, "step": 54420 }, { "entropy": 5.214543676376342, "epoch": 5.380090945037564, "grad_norm": 1.265625, "learning_rate": 0.00025140622420772506, "loss": 4.622, "mean_token_accuracy": 0.2600251376628876, "num_tokens": 124685397.0, "step": 54425 }, { "entropy": 5.292530918121338, "epoch": 5.380585211546066, "grad_norm": 1.1796875, "learning_rate": 0.0002513711290741554, "loss": 4.6955, "mean_token_accuracy": 0.2509011417627335, "num_tokens": 124697564.0, "step": 54430 }, { "entropy": 5.3332232475280765, "epoch": 5.381079478054567, "grad_norm": 1.09375, "learning_rate": 0.0002513360345218596, "loss": 4.7284, "mean_token_accuracy": 0.2453512206673622, "num_tokens": 124709979.0, "step": 54435 }, { "entropy": 5.314540433883667, "epoch": 5.3815737445630685, "grad_norm": 1.1015625, "learning_rate": 0.00025130094055170096, "loss": 4.7682, "mean_token_accuracy": 0.24132150113582612, "num_tokens": 124720682.0, "step": 54440 }, { "entropy": 5.349083280563354, "epoch": 5.38206801107157, "grad_norm": 1.1171875, "learning_rate": 0.0002512658471645429, "loss": 4.6978, "mean_token_accuracy": 0.2541658625006676, "num_tokens": 124731481.0, "step": 54445 }, { "entropy": 5.341960430145264, "epoch": 5.382562277580071, "grad_norm": 1.1640625, "learning_rate": 0.0002512307543612488, "loss": 4.7331, "mean_token_accuracy": 0.24179432392120362, "num_tokens": 124743075.0, "step": 54450 }, { "entropy": 5.2652393817901615, "epoch": 5.383056544088572, "grad_norm": 1.140625, "learning_rate": 0.0002511956621426817, "loss": 4.6323, "mean_token_accuracy": 0.25814961045980456, "num_tokens": 124754941.0, "step": 54455 }, { "entropy": 5.308457612991333, "epoch": 5.3835508105970735, "grad_norm": 1.1328125, "learning_rate": 0.000251160570509705, "loss": 4.767, "mean_token_accuracy": 0.2410098508000374, "num_tokens": 124766476.0, "step": 54460 }, { "entropy": 5.309614467620849, "epoch": 5.384045077105576, "grad_norm": 1.0234375, "learning_rate": 0.0002511254794631821, "loss": 4.7303, "mean_token_accuracy": 0.2445019230246544, "num_tokens": 124778320.0, "step": 54465 }, { "entropy": 5.3166032314300535, "epoch": 5.384539343614077, "grad_norm": 1.2109375, "learning_rate": 0.0002510903890039759, "loss": 4.6456, "mean_token_accuracy": 0.2528969466686249, "num_tokens": 124789604.0, "step": 54470 }, { "entropy": 5.306866884231567, "epoch": 5.385033610122578, "grad_norm": 1.109375, "learning_rate": 0.00025105529913294994, "loss": 4.7132, "mean_token_accuracy": 0.2462393343448639, "num_tokens": 124801358.0, "step": 54475 }, { "entropy": 5.235066366195679, "epoch": 5.3855278766310795, "grad_norm": 1.0859375, "learning_rate": 0.00025102020985096735, "loss": 4.6084, "mean_token_accuracy": 0.2632215961813927, "num_tokens": 124813131.0, "step": 54480 }, { "entropy": 5.293150949478149, "epoch": 5.386022143139581, "grad_norm": 1.1328125, "learning_rate": 0.0002509851211588913, "loss": 4.7075, "mean_token_accuracy": 0.24517110288143157, "num_tokens": 124825871.0, "step": 54485 }, { "entropy": 5.438725709915161, "epoch": 5.386516409648082, "grad_norm": 1.25, "learning_rate": 0.0002509500330575851, "loss": 4.8642, "mean_token_accuracy": 0.2392392486333847, "num_tokens": 124838028.0, "step": 54490 }, { "entropy": 5.327217626571655, "epoch": 5.387010676156583, "grad_norm": 1.140625, "learning_rate": 0.0002509149455479116, "loss": 4.7237, "mean_token_accuracy": 0.24868057072162628, "num_tokens": 124849114.0, "step": 54495 }, { "entropy": 5.387674999237061, "epoch": 5.387504942665085, "grad_norm": 1.109375, "learning_rate": 0.0002508798586307343, "loss": 4.7825, "mean_token_accuracy": 0.23677728921175004, "num_tokens": 124860308.0, "step": 54500 }, { "entropy": 5.235039234161377, "epoch": 5.387999209173587, "grad_norm": 1.0859375, "learning_rate": 0.0002508447723069163, "loss": 4.5721, "mean_token_accuracy": 0.261725427210331, "num_tokens": 124871865.0, "step": 54505 }, { "entropy": 5.389509296417236, "epoch": 5.388493475682088, "grad_norm": 1.125, "learning_rate": 0.00025080968657732055, "loss": 4.7929, "mean_token_accuracy": 0.24253715574741364, "num_tokens": 124884095.0, "step": 54510 }, { "entropy": 5.297238206863403, "epoch": 5.388987742190589, "grad_norm": 1.09375, "learning_rate": 0.0002507746014428103, "loss": 4.708, "mean_token_accuracy": 0.2545713886618614, "num_tokens": 124896758.0, "step": 54515 }, { "entropy": 5.3591673374176025, "epoch": 5.38948200869909, "grad_norm": 1.1484375, "learning_rate": 0.0002507395169042486, "loss": 4.7671, "mean_token_accuracy": 0.24168764650821686, "num_tokens": 124907989.0, "step": 54520 }, { "entropy": 5.269884061813355, "epoch": 5.389976275207592, "grad_norm": 1.1328125, "learning_rate": 0.00025070443296249846, "loss": 4.6315, "mean_token_accuracy": 0.2583016812801361, "num_tokens": 124918494.0, "step": 54525 }, { "entropy": 5.256152772903443, "epoch": 5.390470541716093, "grad_norm": 1.1484375, "learning_rate": 0.00025066934961842316, "loss": 4.6963, "mean_token_accuracy": 0.24274996668100357, "num_tokens": 124929147.0, "step": 54530 }, { "entropy": 5.295071315765381, "epoch": 5.390964808224595, "grad_norm": 1.1875, "learning_rate": 0.0002506342668728856, "loss": 4.6248, "mean_token_accuracy": 0.26125991344451904, "num_tokens": 124940645.0, "step": 54535 }, { "entropy": 5.309243535995483, "epoch": 5.391459074733096, "grad_norm": 1.015625, "learning_rate": 0.00025059918472674893, "loss": 4.7498, "mean_token_accuracy": 0.25184638500213624, "num_tokens": 124953588.0, "step": 54540 }, { "entropy": 5.3014894962310795, "epoch": 5.391953341241598, "grad_norm": 1.109375, "learning_rate": 0.00025056410318087595, "loss": 4.7636, "mean_token_accuracy": 0.24066958278417588, "num_tokens": 124965398.0, "step": 54545 }, { "entropy": 5.313441514968872, "epoch": 5.392447607750099, "grad_norm": 1.1484375, "learning_rate": 0.00025052902223612997, "loss": 4.7072, "mean_token_accuracy": 0.24811821579933166, "num_tokens": 124976940.0, "step": 54550 }, { "entropy": 5.341824626922607, "epoch": 5.3929418742586, "grad_norm": 1.0234375, "learning_rate": 0.00025049394189337364, "loss": 4.7277, "mean_token_accuracy": 0.24411911368370057, "num_tokens": 124989711.0, "step": 54555 }, { "entropy": 5.328802537918091, "epoch": 5.393436140767101, "grad_norm": 1.140625, "learning_rate": 0.0002504588621534703, "loss": 4.6534, "mean_token_accuracy": 0.2519780367612839, "num_tokens": 125001024.0, "step": 54560 }, { "entropy": 5.263501119613648, "epoch": 5.393930407275603, "grad_norm": 1.1015625, "learning_rate": 0.00025042378301728274, "loss": 4.6313, "mean_token_accuracy": 0.2503176063299179, "num_tokens": 125011581.0, "step": 54565 }, { "entropy": 5.346520328521729, "epoch": 5.394424673784105, "grad_norm": 1.1640625, "learning_rate": 0.0002503887044856739, "loss": 4.8036, "mean_token_accuracy": 0.23727761656045915, "num_tokens": 125022933.0, "step": 54570 }, { "entropy": 5.40823540687561, "epoch": 5.394918940292606, "grad_norm": 1.109375, "learning_rate": 0.0002503536265595068, "loss": 4.8553, "mean_token_accuracy": 0.23105435222387313, "num_tokens": 125034298.0, "step": 54575 }, { "entropy": 5.35101900100708, "epoch": 5.395413206801107, "grad_norm": 1.125, "learning_rate": 0.0002503185492396443, "loss": 4.7715, "mean_token_accuracy": 0.24174124747514725, "num_tokens": 125045615.0, "step": 54580 }, { "entropy": 5.2506708145141605, "epoch": 5.395907473309609, "grad_norm": 1.09375, "learning_rate": 0.0002502834725269492, "loss": 4.6361, "mean_token_accuracy": 0.25905500948429105, "num_tokens": 125057548.0, "step": 54585 }, { "entropy": 5.286833190917969, "epoch": 5.39640173981811, "grad_norm": 1.171875, "learning_rate": 0.00025024839642228465, "loss": 4.749, "mean_token_accuracy": 0.24669033139944077, "num_tokens": 125068002.0, "step": 54590 }, { "entropy": 5.2690833568572994, "epoch": 5.396896006326611, "grad_norm": 1.1328125, "learning_rate": 0.00025021332092651334, "loss": 4.7024, "mean_token_accuracy": 0.24996379315853118, "num_tokens": 125078749.0, "step": 54595 }, { "entropy": 5.26826663017273, "epoch": 5.397390272835112, "grad_norm": 1.15625, "learning_rate": 0.0002501782460404982, "loss": 4.6397, "mean_token_accuracy": 0.25115690678358077, "num_tokens": 125090361.0, "step": 54600 }, { "entropy": 5.349127864837646, "epoch": 5.397884539343614, "grad_norm": 1.109375, "learning_rate": 0.000250143171765102, "loss": 4.7275, "mean_token_accuracy": 0.2513625144958496, "num_tokens": 125102047.0, "step": 54605 }, { "entropy": 5.3204851150512695, "epoch": 5.398378805852116, "grad_norm": 1.0859375, "learning_rate": 0.0002501080981011877, "loss": 4.7129, "mean_token_accuracy": 0.2502386629581451, "num_tokens": 125113461.0, "step": 54610 }, { "entropy": 5.349670457839966, "epoch": 5.398873072360617, "grad_norm": 1.0625, "learning_rate": 0.000250073025049618, "loss": 4.7112, "mean_token_accuracy": 0.24463685601949692, "num_tokens": 125125148.0, "step": 54615 }, { "entropy": 5.2866783618927, "epoch": 5.399367338869118, "grad_norm": 1.015625, "learning_rate": 0.0002500379526112557, "loss": 4.6592, "mean_token_accuracy": 0.24816088676452636, "num_tokens": 125136035.0, "step": 54620 }, { "entropy": 5.333376121520996, "epoch": 5.39986160537762, "grad_norm": 1.1640625, "learning_rate": 0.00025000288078696375, "loss": 4.7848, "mean_token_accuracy": 0.23826611936092376, "num_tokens": 125147224.0, "step": 54625 }, { "entropy": 5.27142105102539, "epoch": 5.400355871886121, "grad_norm": 1.0546875, "learning_rate": 0.0002499678095776048, "loss": 4.7026, "mean_token_accuracy": 0.2445573851466179, "num_tokens": 125159475.0, "step": 54630 }, { "entropy": 5.382077693939209, "epoch": 5.400850138394622, "grad_norm": 1.03125, "learning_rate": 0.00024993273898404157, "loss": 4.7491, "mean_token_accuracy": 0.2444719448685646, "num_tokens": 125171884.0, "step": 54635 }, { "entropy": 5.319127750396729, "epoch": 5.401344404903123, "grad_norm": 1.1640625, "learning_rate": 0.00024989766900713686, "loss": 4.7225, "mean_token_accuracy": 0.2509410694241524, "num_tokens": 125182899.0, "step": 54640 }, { "entropy": 5.283676385879517, "epoch": 5.4018386714116255, "grad_norm": 1.125, "learning_rate": 0.00024986259964775333, "loss": 4.6236, "mean_token_accuracy": 0.2586446553468704, "num_tokens": 125194780.0, "step": 54645 }, { "entropy": 5.319912481307983, "epoch": 5.402332937920127, "grad_norm": 1.1640625, "learning_rate": 0.0002498275309067538, "loss": 4.7157, "mean_token_accuracy": 0.24630524218082428, "num_tokens": 125205440.0, "step": 54650 }, { "entropy": 5.2926007270812985, "epoch": 5.402827204428628, "grad_norm": 1.234375, "learning_rate": 0.000249792462785001, "loss": 4.7099, "mean_token_accuracy": 0.24854111671447754, "num_tokens": 125217222.0, "step": 54655 }, { "entropy": 5.311425876617432, "epoch": 5.403321470937129, "grad_norm": 1.0859375, "learning_rate": 0.0002497573952833574, "loss": 4.7488, "mean_token_accuracy": 0.24358682930469513, "num_tokens": 125229594.0, "step": 54660 }, { "entropy": 5.37691707611084, "epoch": 5.403815737445631, "grad_norm": 1.171875, "learning_rate": 0.00024972232840268587, "loss": 4.7651, "mean_token_accuracy": 0.24104098826646805, "num_tokens": 125241627.0, "step": 54665 }, { "entropy": 5.3332267761230465, "epoch": 5.404310003954132, "grad_norm": 1.0625, "learning_rate": 0.0002496872621438489, "loss": 4.692, "mean_token_accuracy": 0.2451614484190941, "num_tokens": 125253095.0, "step": 54670 }, { "entropy": 5.269335508346558, "epoch": 5.404804270462633, "grad_norm": 1.078125, "learning_rate": 0.00024965219650770925, "loss": 4.6753, "mean_token_accuracy": 0.2454006403684616, "num_tokens": 125264864.0, "step": 54675 }, { "entropy": 5.407517290115356, "epoch": 5.405298536971134, "grad_norm": 1.1640625, "learning_rate": 0.00024961713149512956, "loss": 4.8244, "mean_token_accuracy": 0.24487448036670684, "num_tokens": 125277115.0, "step": 54680 }, { "entropy": 5.218597745895385, "epoch": 5.4057928034796365, "grad_norm": 1.2890625, "learning_rate": 0.0002495820671069723, "loss": 4.6091, "mean_token_accuracy": 0.25321724861860273, "num_tokens": 125287821.0, "step": 54685 }, { "entropy": 5.266390752792359, "epoch": 5.406287069988138, "grad_norm": 1.1796875, "learning_rate": 0.0002495470033441002, "loss": 4.6646, "mean_token_accuracy": 0.2521823137998581, "num_tokens": 125299240.0, "step": 54690 }, { "entropy": 5.300536489486694, "epoch": 5.406781336496639, "grad_norm": 1.171875, "learning_rate": 0.0002495119402073757, "loss": 4.6958, "mean_token_accuracy": 0.24655677378177643, "num_tokens": 125309505.0, "step": 54695 }, { "entropy": 5.225590944290161, "epoch": 5.40727560300514, "grad_norm": 1.1328125, "learning_rate": 0.0002494768776976614, "loss": 4.6271, "mean_token_accuracy": 0.2553113326430321, "num_tokens": 125320614.0, "step": 54700 }, { "entropy": 5.2466942310333256, "epoch": 5.407769869513642, "grad_norm": 1.1171875, "learning_rate": 0.00024944181581581994, "loss": 4.6163, "mean_token_accuracy": 0.2595012277364731, "num_tokens": 125332563.0, "step": 54705 }, { "entropy": 5.277787446975708, "epoch": 5.408264136022143, "grad_norm": 1.1171875, "learning_rate": 0.0002494067545627138, "loss": 4.6762, "mean_token_accuracy": 0.256892603635788, "num_tokens": 125343412.0, "step": 54710 }, { "entropy": 5.290104103088379, "epoch": 5.408758402530644, "grad_norm": 1.1328125, "learning_rate": 0.0002493716939392054, "loss": 4.729, "mean_token_accuracy": 0.24413849860429765, "num_tokens": 125354943.0, "step": 54715 }, { "entropy": 5.276319169998169, "epoch": 5.409252669039146, "grad_norm": 1.078125, "learning_rate": 0.00024933663394615735, "loss": 4.6837, "mean_token_accuracy": 0.25353932082653047, "num_tokens": 125365708.0, "step": 54720 }, { "entropy": 5.204464912414551, "epoch": 5.4097469355476475, "grad_norm": 1.078125, "learning_rate": 0.00024930157458443207, "loss": 4.5944, "mean_token_accuracy": 0.2614551603794098, "num_tokens": 125377153.0, "step": 54725 }, { "entropy": 5.309331226348877, "epoch": 5.410241202056149, "grad_norm": 1.0703125, "learning_rate": 0.00024926651585489195, "loss": 4.7229, "mean_token_accuracy": 0.2460546150803566, "num_tokens": 125389773.0, "step": 54730 }, { "entropy": 5.354002666473389, "epoch": 5.41073546856465, "grad_norm": 1.28125, "learning_rate": 0.0002492314577583997, "loss": 4.7213, "mean_token_accuracy": 0.24616692960262299, "num_tokens": 125401044.0, "step": 54735 }, { "entropy": 5.383538103103637, "epoch": 5.411229735073151, "grad_norm": 1.125, "learning_rate": 0.0002491964002958174, "loss": 4.7558, "mean_token_accuracy": 0.24156080335378646, "num_tokens": 125411803.0, "step": 54740 }, { "entropy": 5.338275718688965, "epoch": 5.411724001581653, "grad_norm": 1.015625, "learning_rate": 0.0002491613434680078, "loss": 4.7615, "mean_token_accuracy": 0.2375292122364044, "num_tokens": 125425655.0, "step": 54745 }, { "entropy": 5.343262481689453, "epoch": 5.412218268090154, "grad_norm": 1.078125, "learning_rate": 0.0002491262872758331, "loss": 4.7888, "mean_token_accuracy": 0.24319223314523697, "num_tokens": 125437578.0, "step": 54750 }, { "entropy": 5.297002935409546, "epoch": 5.412712534598656, "grad_norm": 1.1171875, "learning_rate": 0.0002490912317201558, "loss": 4.7705, "mean_token_accuracy": 0.2418442815542221, "num_tokens": 125448859.0, "step": 54755 }, { "entropy": 5.34789080619812, "epoch": 5.413206801107157, "grad_norm": 1.0859375, "learning_rate": 0.0002490561768018382, "loss": 4.7162, "mean_token_accuracy": 0.24720336645841598, "num_tokens": 125460378.0, "step": 54760 }, { "entropy": 5.398679304122925, "epoch": 5.4137010676156585, "grad_norm": 1.1953125, "learning_rate": 0.0002490211225217426, "loss": 4.7292, "mean_token_accuracy": 0.2434353709220886, "num_tokens": 125471090.0, "step": 54765 }, { "entropy": 5.3356053829193115, "epoch": 5.41419533412416, "grad_norm": 1.109375, "learning_rate": 0.0002489860688807315, "loss": 4.7225, "mean_token_accuracy": 0.2446142241358757, "num_tokens": 125482972.0, "step": 54770 }, { "entropy": 5.3362287998199465, "epoch": 5.414689600632661, "grad_norm": 1.125, "learning_rate": 0.0002489510158796671, "loss": 4.7438, "mean_token_accuracy": 0.2428985893726349, "num_tokens": 125494189.0, "step": 54775 }, { "entropy": 5.309819984436035, "epoch": 5.415183867141162, "grad_norm": 1.0625, "learning_rate": 0.0002489159635194118, "loss": 4.7237, "mean_token_accuracy": 0.2476641520857811, "num_tokens": 125506619.0, "step": 54780 }, { "entropy": 5.282542085647583, "epoch": 5.4156781336496636, "grad_norm": 1.1953125, "learning_rate": 0.0002488809118008278, "loss": 4.6739, "mean_token_accuracy": 0.2504089519381523, "num_tokens": 125516903.0, "step": 54785 }, { "entropy": 5.366609859466553, "epoch": 5.416172400158166, "grad_norm": 1.1015625, "learning_rate": 0.0002488458607247774, "loss": 4.8187, "mean_token_accuracy": 0.2425577834248543, "num_tokens": 125528558.0, "step": 54790 }, { "entropy": 5.319036483764648, "epoch": 5.416666666666667, "grad_norm": 1.1953125, "learning_rate": 0.0002488108102921229, "loss": 4.7479, "mean_token_accuracy": 0.24093546867370605, "num_tokens": 125539303.0, "step": 54795 }, { "entropy": 5.273860692977905, "epoch": 5.417160933175168, "grad_norm": 0.9765625, "learning_rate": 0.0002487757605037266, "loss": 4.6676, "mean_token_accuracy": 0.2576308012008667, "num_tokens": 125552201.0, "step": 54800 }, { "entropy": 5.329394340515137, "epoch": 5.4176551996836695, "grad_norm": 1.1328125, "learning_rate": 0.0002487407113604506, "loss": 4.6808, "mean_token_accuracy": 0.2510450094938278, "num_tokens": 125562928.0, "step": 54805 }, { "entropy": 5.1989405155181885, "epoch": 5.418149466192171, "grad_norm": 1.0859375, "learning_rate": 0.00024870566286315716, "loss": 4.6078, "mean_token_accuracy": 0.2654865369200706, "num_tokens": 125574510.0, "step": 54810 }, { "entropy": 5.251977825164795, "epoch": 5.418643732700672, "grad_norm": 1.1015625, "learning_rate": 0.0002486706150127085, "loss": 4.623, "mean_token_accuracy": 0.25116897076368333, "num_tokens": 125586789.0, "step": 54815 }, { "entropy": 5.259971570968628, "epoch": 5.419137999209173, "grad_norm": 1.0, "learning_rate": 0.00024863556780996683, "loss": 4.6676, "mean_token_accuracy": 0.25474713891744616, "num_tokens": 125598177.0, "step": 54820 }, { "entropy": 5.404052448272705, "epoch": 5.419632265717675, "grad_norm": 1.171875, "learning_rate": 0.00024860052125579425, "loss": 4.8391, "mean_token_accuracy": 0.23239607065916063, "num_tokens": 125608102.0, "step": 54825 }, { "entropy": 5.327032470703125, "epoch": 5.420126532226177, "grad_norm": 1.234375, "learning_rate": 0.00024856547535105297, "loss": 4.7406, "mean_token_accuracy": 0.24907578378915787, "num_tokens": 125618251.0, "step": 54830 }, { "entropy": 5.278388738632202, "epoch": 5.420620798734678, "grad_norm": 1.0625, "learning_rate": 0.0002485304300966051, "loss": 4.7121, "mean_token_accuracy": 0.25318115800619123, "num_tokens": 125629403.0, "step": 54835 }, { "entropy": 5.22768759727478, "epoch": 5.421115065243179, "grad_norm": 1.109375, "learning_rate": 0.0002484953854933127, "loss": 4.6369, "mean_token_accuracy": 0.2464595168828964, "num_tokens": 125641414.0, "step": 54840 }, { "entropy": 5.332108402252198, "epoch": 5.4216093317516805, "grad_norm": 1.140625, "learning_rate": 0.0002484603415420379, "loss": 4.6783, "mean_token_accuracy": 0.24484322518110274, "num_tokens": 125652246.0, "step": 54845 }, { "entropy": 5.347117900848389, "epoch": 5.422103598260182, "grad_norm": 1.078125, "learning_rate": 0.0002484252982436429, "loss": 4.6824, "mean_token_accuracy": 0.24318132996559144, "num_tokens": 125663801.0, "step": 54850 }, { "entropy": 5.295184564590454, "epoch": 5.422597864768683, "grad_norm": 1.046875, "learning_rate": 0.00024839025559898964, "loss": 4.6561, "mean_token_accuracy": 0.24958828538656236, "num_tokens": 125676755.0, "step": 54855 }, { "entropy": 5.331411361694336, "epoch": 5.423092131277184, "grad_norm": 1.1796875, "learning_rate": 0.0002483552136089403, "loss": 4.7566, "mean_token_accuracy": 0.23866088837385177, "num_tokens": 125689384.0, "step": 54860 }, { "entropy": 5.316695022583008, "epoch": 5.423586397785686, "grad_norm": 1.09375, "learning_rate": 0.00024832017227435684, "loss": 4.7733, "mean_token_accuracy": 0.24209561198949814, "num_tokens": 125701672.0, "step": 54865 }, { "entropy": 5.291084051132202, "epoch": 5.424080664294188, "grad_norm": 1.140625, "learning_rate": 0.0002482851315961012, "loss": 4.7032, "mean_token_accuracy": 0.24664337188005447, "num_tokens": 125713022.0, "step": 54870 }, { "entropy": 5.326122570037842, "epoch": 5.424574930802689, "grad_norm": 1.1328125, "learning_rate": 0.0002482500915750354, "loss": 4.6849, "mean_token_accuracy": 0.24576317965984346, "num_tokens": 125723433.0, "step": 54875 }, { "entropy": 5.2957868576049805, "epoch": 5.42506919731119, "grad_norm": 1.140625, "learning_rate": 0.00024821505221202163, "loss": 4.7356, "mean_token_accuracy": 0.24717543572187423, "num_tokens": 125735602.0, "step": 54880 }, { "entropy": 5.2850182056427, "epoch": 5.4255634638196915, "grad_norm": 1.1640625, "learning_rate": 0.0002481800135079217, "loss": 4.6994, "mean_token_accuracy": 0.24820964336395263, "num_tokens": 125746638.0, "step": 54885 }, { "entropy": 5.305837392807007, "epoch": 5.426057730328193, "grad_norm": 1.015625, "learning_rate": 0.0002481449754635976, "loss": 4.736, "mean_token_accuracy": 0.24547225683927537, "num_tokens": 125758690.0, "step": 54890 }, { "entropy": 5.2579026222229, "epoch": 5.426551996836694, "grad_norm": 1.1640625, "learning_rate": 0.00024810993807991127, "loss": 4.6807, "mean_token_accuracy": 0.25680258870124817, "num_tokens": 125769097.0, "step": 54895 }, { "entropy": 5.367283153533935, "epoch": 5.427046263345196, "grad_norm": 1.125, "learning_rate": 0.00024807490135772466, "loss": 4.8091, "mean_token_accuracy": 0.2363589197397232, "num_tokens": 125781526.0, "step": 54900 }, { "entropy": 5.2496541976928714, "epoch": 5.427540529853697, "grad_norm": 1.09375, "learning_rate": 0.0002480398652978995, "loss": 4.6788, "mean_token_accuracy": 0.25144377499818804, "num_tokens": 125792386.0, "step": 54905 }, { "entropy": 5.303486919403076, "epoch": 5.428034796362199, "grad_norm": 1.09375, "learning_rate": 0.00024800482990129804, "loss": 4.7223, "mean_token_accuracy": 0.24964593797922136, "num_tokens": 125804095.0, "step": 54910 }, { "entropy": 5.336030721664429, "epoch": 5.4285290628707, "grad_norm": 1.0390625, "learning_rate": 0.00024796979516878185, "loss": 4.6748, "mean_token_accuracy": 0.24706069231033326, "num_tokens": 125815077.0, "step": 54915 }, { "entropy": 5.207082653045655, "epoch": 5.429023329379201, "grad_norm": 1.0390625, "learning_rate": 0.0002479347611012129, "loss": 4.5429, "mean_token_accuracy": 0.26210571974515917, "num_tokens": 125826659.0, "step": 54920 }, { "entropy": 5.310075473785401, "epoch": 5.429517595887702, "grad_norm": 1.046875, "learning_rate": 0.0002478997276994531, "loss": 4.732, "mean_token_accuracy": 0.24142799526453018, "num_tokens": 125838012.0, "step": 54925 }, { "entropy": 5.312786674499511, "epoch": 5.430011862396204, "grad_norm": 1.0625, "learning_rate": 0.0002478646949643641, "loss": 4.7662, "mean_token_accuracy": 0.24694980680942535, "num_tokens": 125850155.0, "step": 54930 }, { "entropy": 5.35676589012146, "epoch": 5.430506128904705, "grad_norm": 1.1171875, "learning_rate": 0.0002478296628968078, "loss": 4.6936, "mean_token_accuracy": 0.24647932201623918, "num_tokens": 125863410.0, "step": 54935 }, { "entropy": 5.1924450397491455, "epoch": 5.431000395413207, "grad_norm": 1.1484375, "learning_rate": 0.0002477946314976461, "loss": 4.6145, "mean_token_accuracy": 0.2609817236661911, "num_tokens": 125874256.0, "step": 54940 }, { "entropy": 5.238568210601807, "epoch": 5.431494661921708, "grad_norm": 1.1484375, "learning_rate": 0.00024775960076774063, "loss": 4.6246, "mean_token_accuracy": 0.25234796553850175, "num_tokens": 125884880.0, "step": 54945 }, { "entropy": 5.334098625183105, "epoch": 5.43198892843021, "grad_norm": 1.1484375, "learning_rate": 0.0002477245707079532, "loss": 4.699, "mean_token_accuracy": 0.25349395126104357, "num_tokens": 125896669.0, "step": 54950 }, { "entropy": 5.3139269828796385, "epoch": 5.432483194938711, "grad_norm": 1.125, "learning_rate": 0.00024768954131914564, "loss": 4.744, "mean_token_accuracy": 0.24585174918174743, "num_tokens": 125907934.0, "step": 54955 }, { "entropy": 5.377219772338867, "epoch": 5.432977461447212, "grad_norm": 1.25, "learning_rate": 0.00024765451260217955, "loss": 4.7941, "mean_token_accuracy": 0.24150939136743546, "num_tokens": 125918217.0, "step": 54960 }, { "entropy": 5.2430144309997555, "epoch": 5.433471727955713, "grad_norm": 1.1328125, "learning_rate": 0.0002476194845579166, "loss": 4.5763, "mean_token_accuracy": 0.26104813516139985, "num_tokens": 125929133.0, "step": 54965 }, { "entropy": 5.403341436386109, "epoch": 5.433965994464215, "grad_norm": 1.15625, "learning_rate": 0.00024758445718721866, "loss": 4.789, "mean_token_accuracy": 0.24364319443702698, "num_tokens": 125940629.0, "step": 54970 }, { "entropy": 5.327122783660888, "epoch": 5.434460260972717, "grad_norm": 1.171875, "learning_rate": 0.00024754943049094737, "loss": 4.7633, "mean_token_accuracy": 0.240283203125, "num_tokens": 125953241.0, "step": 54975 }, { "entropy": 5.297335815429688, "epoch": 5.434954527481218, "grad_norm": 1.1796875, "learning_rate": 0.0002475144044699643, "loss": 4.6769, "mean_token_accuracy": 0.25331700295209886, "num_tokens": 125964096.0, "step": 54980 }, { "entropy": 5.273301124572754, "epoch": 5.435448793989719, "grad_norm": 1.203125, "learning_rate": 0.0002474793791251312, "loss": 4.6548, "mean_token_accuracy": 0.24913372248411178, "num_tokens": 125974687.0, "step": 54985 }, { "entropy": 5.308544683456421, "epoch": 5.435943060498221, "grad_norm": 1.140625, "learning_rate": 0.0002474443544573095, "loss": 4.72, "mean_token_accuracy": 0.2520058438181877, "num_tokens": 125985256.0, "step": 54990 }, { "entropy": 5.310995626449585, "epoch": 5.436437327006722, "grad_norm": 1.1484375, "learning_rate": 0.0002474093304673611, "loss": 4.768, "mean_token_accuracy": 0.250801557302475, "num_tokens": 125996601.0, "step": 54995 }, { "entropy": 5.34598388671875, "epoch": 5.436931593515223, "grad_norm": 1.171875, "learning_rate": 0.0002473743071561474, "loss": 4.7034, "mean_token_accuracy": 0.2506325036287308, "num_tokens": 126007901.0, "step": 55000 }, { "entropy": 5.367867279052734, "epoch": 5.437425860023724, "grad_norm": 1.0078125, "learning_rate": 0.00024733928452453003, "loss": 4.6734, "mean_token_accuracy": 0.25349328070878985, "num_tokens": 126019961.0, "step": 55005 }, { "entropy": 5.4483363151550295, "epoch": 5.437920126532227, "grad_norm": 1.0703125, "learning_rate": 0.0002473042625733706, "loss": 4.8562, "mean_token_accuracy": 0.23283614665269853, "num_tokens": 126032279.0, "step": 55010 }, { "entropy": 5.278757333755493, "epoch": 5.438414393040728, "grad_norm": 1.109375, "learning_rate": 0.00024726924130353054, "loss": 4.6805, "mean_token_accuracy": 0.2439067080616951, "num_tokens": 126044364.0, "step": 55015 }, { "entropy": 5.312346506118774, "epoch": 5.438908659549229, "grad_norm": 1.1640625, "learning_rate": 0.00024723422071587145, "loss": 4.7299, "mean_token_accuracy": 0.25287437736988067, "num_tokens": 126056344.0, "step": 55020 }, { "entropy": 5.238050699234009, "epoch": 5.43940292605773, "grad_norm": 1.109375, "learning_rate": 0.0002471992008112548, "loss": 4.5936, "mean_token_accuracy": 0.25626726597547533, "num_tokens": 126068297.0, "step": 55025 }, { "entropy": 5.328805255889892, "epoch": 5.439897192566232, "grad_norm": 1.1796875, "learning_rate": 0.0002471641815905422, "loss": 4.6675, "mean_token_accuracy": 0.24226814806461333, "num_tokens": 126079445.0, "step": 55030 }, { "entropy": 5.350405263900757, "epoch": 5.440391459074733, "grad_norm": 1.125, "learning_rate": 0.00024712916305459507, "loss": 4.7134, "mean_token_accuracy": 0.24690318256616592, "num_tokens": 126090501.0, "step": 55035 }, { "entropy": 5.284374856948853, "epoch": 5.440885725583234, "grad_norm": 1.125, "learning_rate": 0.00024709414520427477, "loss": 4.7513, "mean_token_accuracy": 0.24580248743295668, "num_tokens": 126102866.0, "step": 55040 }, { "entropy": 5.296164512634277, "epoch": 5.441379992091736, "grad_norm": 1.125, "learning_rate": 0.0002470591280404429, "loss": 4.6749, "mean_token_accuracy": 0.24824172854423524, "num_tokens": 126115353.0, "step": 55045 }, { "entropy": 5.285512447357178, "epoch": 5.4418742586002375, "grad_norm": 1.125, "learning_rate": 0.0002470241115639607, "loss": 4.6993, "mean_token_accuracy": 0.2512720674276352, "num_tokens": 126126785.0, "step": 55050 }, { "entropy": 5.27655725479126, "epoch": 5.442368525108739, "grad_norm": 1.140625, "learning_rate": 0.00024698909577568976, "loss": 4.7067, "mean_token_accuracy": 0.24646718204021453, "num_tokens": 126139503.0, "step": 55055 }, { "entropy": 5.279294204711914, "epoch": 5.44286279161724, "grad_norm": 1.21875, "learning_rate": 0.0002469540806764915, "loss": 4.6874, "mean_token_accuracy": 0.25050589740276336, "num_tokens": 126152311.0, "step": 55060 }, { "entropy": 5.303874921798706, "epoch": 5.443357058125741, "grad_norm": 1.0390625, "learning_rate": 0.0002469190662672272, "loss": 4.6247, "mean_token_accuracy": 0.253151623904705, "num_tokens": 126164214.0, "step": 55065 }, { "entropy": 5.305798816680908, "epoch": 5.443851324634243, "grad_norm": 1.1953125, "learning_rate": 0.0002468840525487581, "loss": 4.678, "mean_token_accuracy": 0.25252514481544497, "num_tokens": 126176575.0, "step": 55070 }, { "entropy": 5.307393360137939, "epoch": 5.444345591142744, "grad_norm": 1.078125, "learning_rate": 0.00024684903952194577, "loss": 4.7184, "mean_token_accuracy": 0.23948657214641572, "num_tokens": 126188645.0, "step": 55075 }, { "entropy": 5.302175045013428, "epoch": 5.444839857651246, "grad_norm": 1.0859375, "learning_rate": 0.0002468140271876513, "loss": 4.7214, "mean_token_accuracy": 0.2444784626364708, "num_tokens": 126199628.0, "step": 55080 }, { "entropy": 5.331772232055664, "epoch": 5.445334124159747, "grad_norm": 1.1953125, "learning_rate": 0.00024677901554673624, "loss": 4.6592, "mean_token_accuracy": 0.25481979846954345, "num_tokens": 126208999.0, "step": 55085 }, { "entropy": 5.288388442993164, "epoch": 5.4458283906682485, "grad_norm": 1.1171875, "learning_rate": 0.0002467440046000618, "loss": 4.7068, "mean_token_accuracy": 0.24857372790575027, "num_tokens": 126220774.0, "step": 55090 }, { "entropy": 5.27800874710083, "epoch": 5.44632265717675, "grad_norm": 1.15625, "learning_rate": 0.0002467089943484892, "loss": 4.6148, "mean_token_accuracy": 0.25686505287885664, "num_tokens": 126231617.0, "step": 55095 }, { "entropy": 5.235676050186157, "epoch": 5.446816923685251, "grad_norm": 1.125, "learning_rate": 0.0002466739847928797, "loss": 4.6578, "mean_token_accuracy": 0.2635219022631645, "num_tokens": 126243641.0, "step": 55100 }, { "entropy": 5.299403381347656, "epoch": 5.447311190193752, "grad_norm": 1.1171875, "learning_rate": 0.0002466389759340947, "loss": 4.716, "mean_token_accuracy": 0.24653125703334808, "num_tokens": 126253902.0, "step": 55105 }, { "entropy": 5.319586133956909, "epoch": 5.447805456702254, "grad_norm": 1.078125, "learning_rate": 0.0002466039677729951, "loss": 4.7394, "mean_token_accuracy": 0.2468997970223427, "num_tokens": 126265186.0, "step": 55110 }, { "entropy": 5.362597179412842, "epoch": 5.448299723210755, "grad_norm": 1.203125, "learning_rate": 0.0002465689603104423, "loss": 4.7703, "mean_token_accuracy": 0.23988498449325563, "num_tokens": 126277639.0, "step": 55115 }, { "entropy": 5.318655920028687, "epoch": 5.448793989719257, "grad_norm": 1.2734375, "learning_rate": 0.0002465339535472976, "loss": 4.6934, "mean_token_accuracy": 0.24586155265569687, "num_tokens": 126289368.0, "step": 55120 }, { "entropy": 5.202057790756226, "epoch": 5.449288256227758, "grad_norm": 1.1328125, "learning_rate": 0.0002464989474844221, "loss": 4.5411, "mean_token_accuracy": 0.2644264981150627, "num_tokens": 126300573.0, "step": 55125 }, { "entropy": 5.292071723937989, "epoch": 5.4497825227362595, "grad_norm": 1.265625, "learning_rate": 0.0002464639421226768, "loss": 4.6261, "mean_token_accuracy": 0.2515244290232658, "num_tokens": 126310497.0, "step": 55130 }, { "entropy": 5.325670433044434, "epoch": 5.450276789244761, "grad_norm": 1.1015625, "learning_rate": 0.000246428937462923, "loss": 4.7982, "mean_token_accuracy": 0.23600456565618516, "num_tokens": 126321199.0, "step": 55135 }, { "entropy": 5.35867166519165, "epoch": 5.450771055753262, "grad_norm": 1.109375, "learning_rate": 0.0002463939335060217, "loss": 4.6884, "mean_token_accuracy": 0.25068228542804716, "num_tokens": 126331988.0, "step": 55140 }, { "entropy": 5.278896617889404, "epoch": 5.451265322261763, "grad_norm": 1.234375, "learning_rate": 0.0002463589302528342, "loss": 4.6678, "mean_token_accuracy": 0.2562635511159897, "num_tokens": 126344770.0, "step": 55145 }, { "entropy": 5.359508037567139, "epoch": 5.451759588770265, "grad_norm": 1.1484375, "learning_rate": 0.0002463239277042214, "loss": 4.7791, "mean_token_accuracy": 0.23812373876571655, "num_tokens": 126356885.0, "step": 55150 }, { "entropy": 5.299158954620362, "epoch": 5.452253855278767, "grad_norm": 1.171875, "learning_rate": 0.00024628892586104446, "loss": 4.6156, "mean_token_accuracy": 0.2567132070660591, "num_tokens": 126367619.0, "step": 55155 }, { "entropy": 5.2924519062042235, "epoch": 5.452748121787268, "grad_norm": 1.0234375, "learning_rate": 0.0002462539247241643, "loss": 4.7446, "mean_token_accuracy": 0.24519453197717667, "num_tokens": 126380580.0, "step": 55160 }, { "entropy": 5.326826667785644, "epoch": 5.453242388295769, "grad_norm": 0.99609375, "learning_rate": 0.000246218924294442, "loss": 4.7514, "mean_token_accuracy": 0.23907581418752671, "num_tokens": 126393204.0, "step": 55165 }, { "entropy": 5.2611448764801025, "epoch": 5.4537366548042705, "grad_norm": 1.1796875, "learning_rate": 0.0002461839245727388, "loss": 4.5955, "mean_token_accuracy": 0.25740269273519517, "num_tokens": 126403273.0, "step": 55170 }, { "entropy": 5.3955165386199955, "epoch": 5.454230921312772, "grad_norm": 1.15625, "learning_rate": 0.0002461489255599155, "loss": 4.7465, "mean_token_accuracy": 0.2412145644426346, "num_tokens": 126414626.0, "step": 55175 }, { "entropy": 5.270166015625, "epoch": 5.454725187821273, "grad_norm": 1.125, "learning_rate": 0.0002461139272568331, "loss": 4.6908, "mean_token_accuracy": 0.24711892753839493, "num_tokens": 126425210.0, "step": 55180 }, { "entropy": 5.352889776229858, "epoch": 5.455219454329774, "grad_norm": 1.2890625, "learning_rate": 0.00024607892966435255, "loss": 4.8064, "mean_token_accuracy": 0.23986150324344635, "num_tokens": 126437377.0, "step": 55185 }, { "entropy": 5.323265457153321, "epoch": 5.4557137208382755, "grad_norm": 1.15625, "learning_rate": 0.00024604393278333483, "loss": 4.7242, "mean_token_accuracy": 0.24309488385915756, "num_tokens": 126448484.0, "step": 55190 }, { "entropy": 5.345036792755127, "epoch": 5.456207987346778, "grad_norm": 1.0703125, "learning_rate": 0.00024600893661464075, "loss": 4.7297, "mean_token_accuracy": 0.24638111889362335, "num_tokens": 126459937.0, "step": 55195 }, { "entropy": 5.308593368530273, "epoch": 5.456702253855279, "grad_norm": 1.1796875, "learning_rate": 0.0002459739411591314, "loss": 4.7107, "mean_token_accuracy": 0.25436613112688067, "num_tokens": 126470899.0, "step": 55200 }, { "entropy": 5.344057655334472, "epoch": 5.45719652036378, "grad_norm": 1.171875, "learning_rate": 0.00024593894641766767, "loss": 4.7056, "mean_token_accuracy": 0.24395893514156342, "num_tokens": 126480653.0, "step": 55205 }, { "entropy": 5.303871726989746, "epoch": 5.4576907868722815, "grad_norm": 1.1875, "learning_rate": 0.0002459039523911103, "loss": 4.6893, "mean_token_accuracy": 0.2504302427172661, "num_tokens": 126491610.0, "step": 55210 }, { "entropy": 5.293354034423828, "epoch": 5.458185053380783, "grad_norm": 1.171875, "learning_rate": 0.0002458689590803202, "loss": 4.6632, "mean_token_accuracy": 0.25144782960414885, "num_tokens": 126501933.0, "step": 55215 }, { "entropy": 5.288463497161866, "epoch": 5.458679319889284, "grad_norm": 1.109375, "learning_rate": 0.0002458339664861583, "loss": 4.6833, "mean_token_accuracy": 0.24627024233341216, "num_tokens": 126513292.0, "step": 55220 }, { "entropy": 5.26653037071228, "epoch": 5.459173586397785, "grad_norm": 1.1796875, "learning_rate": 0.00024579897460948527, "loss": 4.5878, "mean_token_accuracy": 0.25722173154354094, "num_tokens": 126523550.0, "step": 55225 }, { "entropy": 5.351178073883057, "epoch": 5.459667852906287, "grad_norm": 1.1171875, "learning_rate": 0.000245763983451162, "loss": 4.7859, "mean_token_accuracy": 0.24128771871328353, "num_tokens": 126535969.0, "step": 55230 }, { "entropy": 5.248917531967163, "epoch": 5.460162119414789, "grad_norm": 1.5078125, "learning_rate": 0.0002457289930120493, "loss": 4.6825, "mean_token_accuracy": 0.25211001932621, "num_tokens": 126548174.0, "step": 55235 }, { "entropy": 5.306639766693115, "epoch": 5.46065638592329, "grad_norm": 1.1953125, "learning_rate": 0.0002456940032930079, "loss": 4.7066, "mean_token_accuracy": 0.2514589875936508, "num_tokens": 126558514.0, "step": 55240 }, { "entropy": 5.342851781845093, "epoch": 5.461150652431791, "grad_norm": 1.078125, "learning_rate": 0.0002456590142948986, "loss": 4.7646, "mean_token_accuracy": 0.23501600325107574, "num_tokens": 126570665.0, "step": 55245 }, { "entropy": 5.279558944702148, "epoch": 5.4616449189402925, "grad_norm": 1.1015625, "learning_rate": 0.0002456240260185821, "loss": 4.6788, "mean_token_accuracy": 0.25674069225788115, "num_tokens": 126581998.0, "step": 55250 }, { "entropy": 5.288615798950195, "epoch": 5.462139185448794, "grad_norm": 1.2265625, "learning_rate": 0.000245589038464919, "loss": 4.6335, "mean_token_accuracy": 0.25254533141851426, "num_tokens": 126592804.0, "step": 55255 }, { "entropy": 5.355202627182007, "epoch": 5.462633451957295, "grad_norm": 1.078125, "learning_rate": 0.00024555405163477023, "loss": 4.8043, "mean_token_accuracy": 0.22887861281633376, "num_tokens": 126605446.0, "step": 55260 }, { "entropy": 5.343054151535034, "epoch": 5.463127718465797, "grad_norm": 1.109375, "learning_rate": 0.0002455190655289963, "loss": 4.7755, "mean_token_accuracy": 0.23962896913290024, "num_tokens": 126615426.0, "step": 55265 }, { "entropy": 5.263855981826782, "epoch": 5.463621984974298, "grad_norm": 1.0625, "learning_rate": 0.0002454840801484581, "loss": 4.6326, "mean_token_accuracy": 0.24874890446662903, "num_tokens": 126627822.0, "step": 55270 }, { "entropy": 5.439459991455078, "epoch": 5.4641162514828, "grad_norm": 1.09375, "learning_rate": 0.0002454490954940159, "loss": 4.8301, "mean_token_accuracy": 0.23781850636005403, "num_tokens": 126639454.0, "step": 55275 }, { "entropy": 5.361241865158081, "epoch": 5.464610517991301, "grad_norm": 1.0390625, "learning_rate": 0.00024541411156653065, "loss": 4.8263, "mean_token_accuracy": 0.23587756156921386, "num_tokens": 126651409.0, "step": 55280 }, { "entropy": 5.307921934127807, "epoch": 5.465104784499802, "grad_norm": 1.1484375, "learning_rate": 0.00024537912836686276, "loss": 4.6366, "mean_token_accuracy": 0.25111053287982943, "num_tokens": 126662288.0, "step": 55285 }, { "entropy": 5.30540280342102, "epoch": 5.4655990510083035, "grad_norm": 1.015625, "learning_rate": 0.00024534414589587295, "loss": 4.6692, "mean_token_accuracy": 0.25233530551195144, "num_tokens": 126674399.0, "step": 55290 }, { "entropy": 5.2123242855072025, "epoch": 5.466093317516805, "grad_norm": 1.203125, "learning_rate": 0.0002453091641544218, "loss": 4.6092, "mean_token_accuracy": 0.26056900918483733, "num_tokens": 126684447.0, "step": 55295 }, { "entropy": 5.211442565917968, "epoch": 5.466587584025307, "grad_norm": 1.1953125, "learning_rate": 0.00024527418314336974, "loss": 4.6086, "mean_token_accuracy": 0.2524043321609497, "num_tokens": 126695424.0, "step": 55300 }, { "entropy": 5.307858562469482, "epoch": 5.467081850533808, "grad_norm": 1.109375, "learning_rate": 0.0002452392028635774, "loss": 4.7136, "mean_token_accuracy": 0.2498016357421875, "num_tokens": 126707930.0, "step": 55305 }, { "entropy": 5.254524803161621, "epoch": 5.467576117042309, "grad_norm": 1.0703125, "learning_rate": 0.00024520422331590527, "loss": 4.6347, "mean_token_accuracy": 0.2570390716195107, "num_tokens": 126719218.0, "step": 55310 }, { "entropy": 5.308149242401123, "epoch": 5.468070383550811, "grad_norm": 1.0703125, "learning_rate": 0.0002451692445012139, "loss": 4.7191, "mean_token_accuracy": 0.24753482341766359, "num_tokens": 126729897.0, "step": 55315 }, { "entropy": 5.314435052871704, "epoch": 5.468564650059312, "grad_norm": 1.1328125, "learning_rate": 0.0002451342664203638, "loss": 4.7374, "mean_token_accuracy": 0.24782268851995468, "num_tokens": 126742051.0, "step": 55320 }, { "entropy": 5.323646116256714, "epoch": 5.469058916567813, "grad_norm": 1.0859375, "learning_rate": 0.0002450992890742153, "loss": 4.6823, "mean_token_accuracy": 0.24997538626194, "num_tokens": 126752763.0, "step": 55325 }, { "entropy": 5.294638442993164, "epoch": 5.469553183076314, "grad_norm": 1.1015625, "learning_rate": 0.000245064312463629, "loss": 4.6696, "mean_token_accuracy": 0.25387580394744874, "num_tokens": 126764021.0, "step": 55330 }, { "entropy": 5.2980340957641605, "epoch": 5.470047449584817, "grad_norm": 1.140625, "learning_rate": 0.00024502933658946524, "loss": 4.6618, "mean_token_accuracy": 0.2499234214425087, "num_tokens": 126775392.0, "step": 55335 }, { "entropy": 5.349928998947144, "epoch": 5.470541716093318, "grad_norm": 1.203125, "learning_rate": 0.00024499436145258434, "loss": 4.6989, "mean_token_accuracy": 0.24172550886869432, "num_tokens": 126785870.0, "step": 55340 }, { "entropy": 5.241976308822632, "epoch": 5.471035982601819, "grad_norm": 1.140625, "learning_rate": 0.0002449593870538469, "loss": 4.6522, "mean_token_accuracy": 0.2550095483660698, "num_tokens": 126797749.0, "step": 55345 }, { "entropy": 5.23099536895752, "epoch": 5.47153024911032, "grad_norm": 1.046875, "learning_rate": 0.00024492441339411315, "loss": 4.6611, "mean_token_accuracy": 0.24687276929616928, "num_tokens": 126808304.0, "step": 55350 }, { "entropy": 5.295022439956665, "epoch": 5.472024515618822, "grad_norm": 1.140625, "learning_rate": 0.00024488944047424354, "loss": 4.627, "mean_token_accuracy": 0.25520738661289216, "num_tokens": 126819557.0, "step": 55355 }, { "entropy": 5.262377166748047, "epoch": 5.472518782127323, "grad_norm": 1.1484375, "learning_rate": 0.00024485446829509836, "loss": 4.6707, "mean_token_accuracy": 0.2469145730137825, "num_tokens": 126832752.0, "step": 55360 }, { "entropy": 5.206840848922729, "epoch": 5.473013048635824, "grad_norm": 1.1484375, "learning_rate": 0.00024481949685753804, "loss": 4.6503, "mean_token_accuracy": 0.24888878017663957, "num_tokens": 126844415.0, "step": 55365 }, { "entropy": 5.294107389450073, "epoch": 5.473507315144325, "grad_norm": 1.125, "learning_rate": 0.00024478452616242256, "loss": 4.6791, "mean_token_accuracy": 0.2534191682934761, "num_tokens": 126854913.0, "step": 55370 }, { "entropy": 5.265897989273071, "epoch": 5.474001581652828, "grad_norm": 1.0625, "learning_rate": 0.00024474955621061256, "loss": 4.6222, "mean_token_accuracy": 0.25807336419820787, "num_tokens": 126866665.0, "step": 55375 }, { "entropy": 5.306263160705567, "epoch": 5.474495848161329, "grad_norm": 1.078125, "learning_rate": 0.00024471458700296814, "loss": 4.6862, "mean_token_accuracy": 0.24370273798704148, "num_tokens": 126880004.0, "step": 55380 }, { "entropy": 5.346442699432373, "epoch": 5.47499011466983, "grad_norm": 1.1484375, "learning_rate": 0.0002446796185403496, "loss": 4.7699, "mean_token_accuracy": 0.24902644753456116, "num_tokens": 126891501.0, "step": 55385 }, { "entropy": 5.271532678604126, "epoch": 5.475484381178331, "grad_norm": 1.1875, "learning_rate": 0.00024464465082361714, "loss": 4.6585, "mean_token_accuracy": 0.25232723355293274, "num_tokens": 126902458.0, "step": 55390 }, { "entropy": 5.241397047042847, "epoch": 5.475978647686833, "grad_norm": 1.0703125, "learning_rate": 0.00024460968385363097, "loss": 4.6112, "mean_token_accuracy": 0.2599184438586235, "num_tokens": 126914023.0, "step": 55395 }, { "entropy": 5.286488819122314, "epoch": 5.476472914195334, "grad_norm": 1.1171875, "learning_rate": 0.00024457471763125125, "loss": 4.7152, "mean_token_accuracy": 0.24807263910770416, "num_tokens": 126926154.0, "step": 55400 }, { "entropy": 5.320331716537476, "epoch": 5.476967180703835, "grad_norm": 1.125, "learning_rate": 0.00024453975215733826, "loss": 4.7345, "mean_token_accuracy": 0.24189997166395188, "num_tokens": 126937166.0, "step": 55405 }, { "entropy": 5.389372253417969, "epoch": 5.477461447212337, "grad_norm": 1.140625, "learning_rate": 0.0002445047874327521, "loss": 4.7249, "mean_token_accuracy": 0.2456130713224411, "num_tokens": 126948951.0, "step": 55410 }, { "entropy": 5.313214635848999, "epoch": 5.477955713720839, "grad_norm": 1.109375, "learning_rate": 0.0002444698234583529, "loss": 4.7019, "mean_token_accuracy": 0.24396925270557404, "num_tokens": 126961035.0, "step": 55415 }, { "entropy": 5.317860317230225, "epoch": 5.47844998022934, "grad_norm": 1.0703125, "learning_rate": 0.00024443486023500066, "loss": 4.7277, "mean_token_accuracy": 0.2503254637122154, "num_tokens": 126971984.0, "step": 55420 }, { "entropy": 5.217605257034302, "epoch": 5.478944246737841, "grad_norm": 1.0703125, "learning_rate": 0.00024439989776355573, "loss": 4.6202, "mean_token_accuracy": 0.2547196537256241, "num_tokens": 126982877.0, "step": 55425 }, { "entropy": 5.2199615955352785, "epoch": 5.479438513246342, "grad_norm": 1.1171875, "learning_rate": 0.00024436493604487795, "loss": 4.5972, "mean_token_accuracy": 0.25868025571107867, "num_tokens": 126993658.0, "step": 55430 }, { "entropy": 5.365839672088623, "epoch": 5.479932779754844, "grad_norm": 1.046875, "learning_rate": 0.00024432997507982764, "loss": 4.7364, "mean_token_accuracy": 0.23938772231340408, "num_tokens": 127006144.0, "step": 55435 }, { "entropy": 5.29896879196167, "epoch": 5.480427046263345, "grad_norm": 1.1171875, "learning_rate": 0.0002442950148692646, "loss": 4.7003, "mean_token_accuracy": 0.24749273508787156, "num_tokens": 127017993.0, "step": 55440 }, { "entropy": 5.2767397403717045, "epoch": 5.480921312771846, "grad_norm": 1.1328125, "learning_rate": 0.000244260055414049, "loss": 4.6798, "mean_token_accuracy": 0.24800121933221816, "num_tokens": 127030489.0, "step": 55445 }, { "entropy": 5.3410478115081785, "epoch": 5.481415579280348, "grad_norm": 1.1328125, "learning_rate": 0.00024422509671504086, "loss": 4.7439, "mean_token_accuracy": 0.24613877683877944, "num_tokens": 127041570.0, "step": 55450 }, { "entropy": 5.222020626068115, "epoch": 5.4819098457888495, "grad_norm": 1.03125, "learning_rate": 0.00024419013877310003, "loss": 4.6744, "mean_token_accuracy": 0.2532689794898033, "num_tokens": 127053203.0, "step": 55455 }, { "entropy": 5.198299551010132, "epoch": 5.482404112297351, "grad_norm": 1.171875, "learning_rate": 0.0002441551815890865, "loss": 4.616, "mean_token_accuracy": 0.2628627821803093, "num_tokens": 127064606.0, "step": 55460 }, { "entropy": 5.179099607467651, "epoch": 5.482898378805852, "grad_norm": 1.2265625, "learning_rate": 0.0002441202251638604, "loss": 4.5479, "mean_token_accuracy": 0.2629066795110703, "num_tokens": 127074997.0, "step": 55465 }, { "entropy": 5.242294979095459, "epoch": 5.483392645314353, "grad_norm": 1.25, "learning_rate": 0.00024408526949828152, "loss": 4.5898, "mean_token_accuracy": 0.26193042248487475, "num_tokens": 127085844.0, "step": 55470 }, { "entropy": 5.336407041549682, "epoch": 5.483886911822855, "grad_norm": 1.265625, "learning_rate": 0.00024405031459320982, "loss": 4.7742, "mean_token_accuracy": 0.24302490204572677, "num_tokens": 127097730.0, "step": 55475 }, { "entropy": 5.286353969573975, "epoch": 5.484381178331356, "grad_norm": 1.1171875, "learning_rate": 0.00024401536044950522, "loss": 4.7003, "mean_token_accuracy": 0.24573515355587006, "num_tokens": 127109031.0, "step": 55480 }, { "entropy": 5.259292411804199, "epoch": 5.484875444839858, "grad_norm": 1.0859375, "learning_rate": 0.00024398040706802743, "loss": 4.6274, "mean_token_accuracy": 0.2541817009449005, "num_tokens": 127121159.0, "step": 55485 }, { "entropy": 5.290611028671265, "epoch": 5.485369711348359, "grad_norm": 1.203125, "learning_rate": 0.0002439454544496365, "loss": 4.6591, "mean_token_accuracy": 0.25081404447555544, "num_tokens": 127131921.0, "step": 55490 }, { "entropy": 5.248747682571411, "epoch": 5.4858639778568605, "grad_norm": 1.0390625, "learning_rate": 0.00024391050259519226, "loss": 4.6246, "mean_token_accuracy": 0.25264451205730437, "num_tokens": 127143287.0, "step": 55495 }, { "entropy": 5.322216987609863, "epoch": 5.486358244365362, "grad_norm": 1.2109375, "learning_rate": 0.00024387555150555447, "loss": 4.7914, "mean_token_accuracy": 0.2398051917552948, "num_tokens": 127154594.0, "step": 55500 }, { "entropy": 5.384451293945313, "epoch": 5.486852510873863, "grad_norm": 1.0390625, "learning_rate": 0.00024384060118158292, "loss": 4.7937, "mean_token_accuracy": 0.23928272128105163, "num_tokens": 127165933.0, "step": 55505 }, { "entropy": 5.331782484054566, "epoch": 5.487346777382364, "grad_norm": 1.21875, "learning_rate": 0.00024380565162413748, "loss": 4.6854, "mean_token_accuracy": 0.24061611741781236, "num_tokens": 127175895.0, "step": 55510 }, { "entropy": 5.3176842212677, "epoch": 5.487841043890866, "grad_norm": 1.140625, "learning_rate": 0.0002437707028340777, "loss": 4.7479, "mean_token_accuracy": 0.24402299672365188, "num_tokens": 127187638.0, "step": 55515 }, { "entropy": 5.249473619461059, "epoch": 5.488335310399368, "grad_norm": 1.171875, "learning_rate": 0.0002437357548122635, "loss": 4.6147, "mean_token_accuracy": 0.2572218984365463, "num_tokens": 127198404.0, "step": 55520 }, { "entropy": 5.31009874343872, "epoch": 5.488829576907869, "grad_norm": 1.1171875, "learning_rate": 0.00024370080755955464, "loss": 4.7129, "mean_token_accuracy": 0.244246007502079, "num_tokens": 127210050.0, "step": 55525 }, { "entropy": 5.27332067489624, "epoch": 5.48932384341637, "grad_norm": 1.125, "learning_rate": 0.00024366586107681083, "loss": 4.6453, "mean_token_accuracy": 0.2503774747252464, "num_tokens": 127221398.0, "step": 55530 }, { "entropy": 5.314368629455567, "epoch": 5.4898181099248715, "grad_norm": 1.125, "learning_rate": 0.00024363091536489168, "loss": 4.7578, "mean_token_accuracy": 0.23929852843284607, "num_tokens": 127233495.0, "step": 55535 }, { "entropy": 5.379466581344604, "epoch": 5.490312376433373, "grad_norm": 1.0625, "learning_rate": 0.0002435959704246568, "loss": 4.8165, "mean_token_accuracy": 0.23747196793556213, "num_tokens": 127246160.0, "step": 55540 }, { "entropy": 5.345769596099854, "epoch": 5.490806642941874, "grad_norm": 1.1015625, "learning_rate": 0.00024356102625696592, "loss": 4.7144, "mean_token_accuracy": 0.2512213379144669, "num_tokens": 127257539.0, "step": 55545 }, { "entropy": 5.250670289993286, "epoch": 5.491300909450375, "grad_norm": 1.125, "learning_rate": 0.00024352608286267875, "loss": 4.5992, "mean_token_accuracy": 0.25826428532600404, "num_tokens": 127268208.0, "step": 55550 }, { "entropy": 5.295281076431275, "epoch": 5.4917951759588775, "grad_norm": 1.3203125, "learning_rate": 0.0002434911402426548, "loss": 4.6859, "mean_token_accuracy": 0.2515248581767082, "num_tokens": 127278146.0, "step": 55555 }, { "entropy": 5.2190690517425535, "epoch": 5.492289442467379, "grad_norm": 1.078125, "learning_rate": 0.00024345619839775368, "loss": 4.6414, "mean_token_accuracy": 0.258575402200222, "num_tokens": 127289652.0, "step": 55560 }, { "entropy": 5.314713335037231, "epoch": 5.49278370897588, "grad_norm": 1.1328125, "learning_rate": 0.0002434212573288349, "loss": 4.6635, "mean_token_accuracy": 0.24900385588407517, "num_tokens": 127300518.0, "step": 55565 }, { "entropy": 5.320767545700074, "epoch": 5.493277975484381, "grad_norm": 1.0859375, "learning_rate": 0.00024338631703675823, "loss": 4.7316, "mean_token_accuracy": 0.248509381711483, "num_tokens": 127312654.0, "step": 55570 }, { "entropy": 5.236820459365845, "epoch": 5.4937722419928825, "grad_norm": 1.171875, "learning_rate": 0.0002433513775223829, "loss": 4.6959, "mean_token_accuracy": 0.24338169991970063, "num_tokens": 127324452.0, "step": 55575 }, { "entropy": 5.277018117904663, "epoch": 5.494266508501384, "grad_norm": 1.1640625, "learning_rate": 0.00024331643878656872, "loss": 4.6998, "mean_token_accuracy": 0.25226347595453263, "num_tokens": 127335901.0, "step": 55580 }, { "entropy": 5.205955219268799, "epoch": 5.494760775009885, "grad_norm": 1.1953125, "learning_rate": 0.00024328150083017502, "loss": 4.5704, "mean_token_accuracy": 0.2615370601415634, "num_tokens": 127346237.0, "step": 55585 }, { "entropy": 5.3109776973724365, "epoch": 5.495255041518387, "grad_norm": 1.2265625, "learning_rate": 0.00024324656365406127, "loss": 4.714, "mean_token_accuracy": 0.2532210111618042, "num_tokens": 127357830.0, "step": 55590 }, { "entropy": 5.328834676742554, "epoch": 5.495749308026888, "grad_norm": 1.109375, "learning_rate": 0.00024321162725908708, "loss": 4.7007, "mean_token_accuracy": 0.24093661904335023, "num_tokens": 127369992.0, "step": 55595 }, { "entropy": 5.280531120300293, "epoch": 5.49624357453539, "grad_norm": 1.09375, "learning_rate": 0.00024317669164611178, "loss": 4.7131, "mean_token_accuracy": 0.24693669080734254, "num_tokens": 127381747.0, "step": 55600 }, { "entropy": 5.256944847106934, "epoch": 5.496737841043891, "grad_norm": 1.1875, "learning_rate": 0.00024314175681599472, "loss": 4.6638, "mean_token_accuracy": 0.24914004355669023, "num_tokens": 127392851.0, "step": 55605 }, { "entropy": 5.330003118515014, "epoch": 5.497232107552392, "grad_norm": 1.171875, "learning_rate": 0.00024310682276959544, "loss": 4.7341, "mean_token_accuracy": 0.2480670690536499, "num_tokens": 127404166.0, "step": 55610 }, { "entropy": 5.295334768295288, "epoch": 5.4977263740608935, "grad_norm": 1.0703125, "learning_rate": 0.00024307188950777327, "loss": 4.7189, "mean_token_accuracy": 0.24778328239917755, "num_tokens": 127416503.0, "step": 55615 }, { "entropy": 5.337554311752319, "epoch": 5.498220640569395, "grad_norm": 1.1796875, "learning_rate": 0.0002430369570313875, "loss": 4.7168, "mean_token_accuracy": 0.24913134574890136, "num_tokens": 127427582.0, "step": 55620 }, { "entropy": 5.281960439682007, "epoch": 5.498714907077896, "grad_norm": 1.1171875, "learning_rate": 0.00024300202534129767, "loss": 4.5956, "mean_token_accuracy": 0.25653568655252457, "num_tokens": 127438769.0, "step": 55625 }, { "entropy": 5.375503349304199, "epoch": 5.499209173586398, "grad_norm": 1.171875, "learning_rate": 0.00024296709443836286, "loss": 4.7598, "mean_token_accuracy": 0.24686604291200637, "num_tokens": 127450804.0, "step": 55630 }, { "entropy": 5.275649452209473, "epoch": 5.499703440094899, "grad_norm": 1.15625, "learning_rate": 0.00024293216432344256, "loss": 4.6762, "mean_token_accuracy": 0.2531318187713623, "num_tokens": 127462121.0, "step": 55635 }, { "entropy": 5.282828044891358, "epoch": 5.500197706603401, "grad_norm": 1.140625, "learning_rate": 0.00024289723499739598, "loss": 4.669, "mean_token_accuracy": 0.250963594019413, "num_tokens": 127473872.0, "step": 55640 }, { "entropy": 5.239655780792236, "epoch": 5.500691973111902, "grad_norm": 0.99609375, "learning_rate": 0.00024286230646108242, "loss": 4.5909, "mean_token_accuracy": 0.2570249855518341, "num_tokens": 127487222.0, "step": 55645 }, { "entropy": 5.3272590160369875, "epoch": 5.501186239620403, "grad_norm": 1.0546875, "learning_rate": 0.00024282737871536108, "loss": 4.7682, "mean_token_accuracy": 0.24608877003192903, "num_tokens": 127499160.0, "step": 55650 }, { "entropy": 5.32165379524231, "epoch": 5.5016805061289045, "grad_norm": 1.125, "learning_rate": 0.0002427924517610912, "loss": 4.707, "mean_token_accuracy": 0.24464457035064696, "num_tokens": 127510122.0, "step": 55655 }, { "entropy": 5.3027238845825195, "epoch": 5.502174772637406, "grad_norm": 1.1171875, "learning_rate": 0.00024275752559913205, "loss": 4.7053, "mean_token_accuracy": 0.24588518291711808, "num_tokens": 127521549.0, "step": 55660 }, { "entropy": 5.371329927444458, "epoch": 5.502669039145907, "grad_norm": 1.2578125, "learning_rate": 0.0002427226002303427, "loss": 4.7449, "mean_token_accuracy": 0.24045091718435288, "num_tokens": 127531426.0, "step": 55665 }, { "entropy": 5.266946458816529, "epoch": 5.503163305654409, "grad_norm": 1.0546875, "learning_rate": 0.00024268767565558248, "loss": 4.69, "mean_token_accuracy": 0.24799342155456544, "num_tokens": 127543417.0, "step": 55670 }, { "entropy": 5.333221054077148, "epoch": 5.50365757216291, "grad_norm": 1.125, "learning_rate": 0.00024265275187571045, "loss": 4.7084, "mean_token_accuracy": 0.2543249621987343, "num_tokens": 127555653.0, "step": 55675 }, { "entropy": 5.258586025238037, "epoch": 5.504151838671412, "grad_norm": 1.03125, "learning_rate": 0.00024261782889158567, "loss": 4.6449, "mean_token_accuracy": 0.25685678124427797, "num_tokens": 127567858.0, "step": 55680 }, { "entropy": 5.340765714645386, "epoch": 5.504646105179913, "grad_norm": 1.15625, "learning_rate": 0.0002425829067040674, "loss": 4.7505, "mean_token_accuracy": 0.24584836661815643, "num_tokens": 127578817.0, "step": 55685 }, { "entropy": 5.192212390899658, "epoch": 5.505140371688414, "grad_norm": 1.1953125, "learning_rate": 0.00024254798531401456, "loss": 4.557, "mean_token_accuracy": 0.2636120796203613, "num_tokens": 127589836.0, "step": 55690 }, { "entropy": 5.231137323379516, "epoch": 5.5056346381969155, "grad_norm": 1.09375, "learning_rate": 0.00024251306472228634, "loss": 4.6378, "mean_token_accuracy": 0.25850477516651155, "num_tokens": 127601135.0, "step": 55695 }, { "entropy": 5.301917600631714, "epoch": 5.506128904705417, "grad_norm": 1.1015625, "learning_rate": 0.00024247814492974184, "loss": 4.7026, "mean_token_accuracy": 0.2530211314558983, "num_tokens": 127612769.0, "step": 55700 }, { "entropy": 5.264979028701783, "epoch": 5.506623171213919, "grad_norm": 1.0859375, "learning_rate": 0.00024244322593724, "loss": 4.7077, "mean_token_accuracy": 0.2517613396048546, "num_tokens": 127624332.0, "step": 55705 }, { "entropy": 5.317571020126342, "epoch": 5.50711743772242, "grad_norm": 1.0859375, "learning_rate": 0.00024240830774563982, "loss": 4.677, "mean_token_accuracy": 0.25083639472723007, "num_tokens": 127635496.0, "step": 55710 }, { "entropy": 5.325910472869873, "epoch": 5.507611704230921, "grad_norm": 1.2109375, "learning_rate": 0.00024237339035580036, "loss": 4.6574, "mean_token_accuracy": 0.2519206881523132, "num_tokens": 127648278.0, "step": 55715 }, { "entropy": 5.324223566055298, "epoch": 5.508105970739423, "grad_norm": 1.078125, "learning_rate": 0.00024233847376858047, "loss": 4.7406, "mean_token_accuracy": 0.25206234157085416, "num_tokens": 127660342.0, "step": 55720 }, { "entropy": 5.239643812179565, "epoch": 5.508600237247924, "grad_norm": 1.109375, "learning_rate": 0.00024230355798483927, "loss": 4.623, "mean_token_accuracy": 0.25438870042562484, "num_tokens": 127672971.0, "step": 55725 }, { "entropy": 5.281494522094727, "epoch": 5.509094503756425, "grad_norm": 1.296875, "learning_rate": 0.00024226864300543562, "loss": 4.6829, "mean_token_accuracy": 0.24994096010923386, "num_tokens": 127682571.0, "step": 55730 }, { "entropy": 5.26580777168274, "epoch": 5.509588770264926, "grad_norm": 1.09375, "learning_rate": 0.0002422337288312284, "loss": 4.6078, "mean_token_accuracy": 0.2625021353363991, "num_tokens": 127695255.0, "step": 55735 }, { "entropy": 5.289486980438232, "epoch": 5.510083036773429, "grad_norm": 1.0859375, "learning_rate": 0.0002421988154630766, "loss": 4.7307, "mean_token_accuracy": 0.24494832754135132, "num_tokens": 127707203.0, "step": 55740 }, { "entropy": 5.292838764190674, "epoch": 5.51057730328193, "grad_norm": 1.1015625, "learning_rate": 0.00024216390290183898, "loss": 4.6635, "mean_token_accuracy": 0.2528723910450935, "num_tokens": 127717783.0, "step": 55745 }, { "entropy": 5.390399312973022, "epoch": 5.511071569790431, "grad_norm": 1.15625, "learning_rate": 0.00024212899114837438, "loss": 4.8534, "mean_token_accuracy": 0.23319959193468093, "num_tokens": 127730635.0, "step": 55750 }, { "entropy": 5.247437429428101, "epoch": 5.511565836298932, "grad_norm": 1.0625, "learning_rate": 0.00024209408020354174, "loss": 4.6105, "mean_token_accuracy": 0.2597069352865219, "num_tokens": 127742835.0, "step": 55755 }, { "entropy": 5.2905601978302, "epoch": 5.512060102807434, "grad_norm": 1.1875, "learning_rate": 0.00024205917006819987, "loss": 4.697, "mean_token_accuracy": 0.2529838591814041, "num_tokens": 127753689.0, "step": 55760 }, { "entropy": 5.280547189712524, "epoch": 5.512554369315935, "grad_norm": 1.15625, "learning_rate": 0.0002420242607432075, "loss": 4.6998, "mean_token_accuracy": 0.2460751011967659, "num_tokens": 127764708.0, "step": 55765 }, { "entropy": 5.362080144882202, "epoch": 5.513048635824436, "grad_norm": 1.1171875, "learning_rate": 0.0002419893522294235, "loss": 4.7245, "mean_token_accuracy": 0.24476915895938872, "num_tokens": 127775431.0, "step": 55770 }, { "entropy": 5.265283870697021, "epoch": 5.513542902332938, "grad_norm": 1.1015625, "learning_rate": 0.00024195444452770643, "loss": 4.6273, "mean_token_accuracy": 0.2621916890144348, "num_tokens": 127787222.0, "step": 55775 }, { "entropy": 5.292777729034424, "epoch": 5.51403716884144, "grad_norm": 1.171875, "learning_rate": 0.00024191953763891516, "loss": 4.7015, "mean_token_accuracy": 0.2423810750246048, "num_tokens": 127798012.0, "step": 55780 }, { "entropy": 5.213937616348266, "epoch": 5.514531435349941, "grad_norm": 1.15625, "learning_rate": 0.00024188463156390845, "loss": 4.6159, "mean_token_accuracy": 0.26182945519685746, "num_tokens": 127808159.0, "step": 55785 }, { "entropy": 5.2120520114898685, "epoch": 5.515025701858442, "grad_norm": 1.171875, "learning_rate": 0.00024184972630354496, "loss": 4.6637, "mean_token_accuracy": 0.2529076382517815, "num_tokens": 127820016.0, "step": 55790 }, { "entropy": 5.407167768478393, "epoch": 5.515519968366943, "grad_norm": 1.0625, "learning_rate": 0.00024181482185868338, "loss": 4.8603, "mean_token_accuracy": 0.2331865131855011, "num_tokens": 127831788.0, "step": 55795 }, { "entropy": 5.349922037124633, "epoch": 5.516014234875445, "grad_norm": 1.1953125, "learning_rate": 0.00024177991823018226, "loss": 4.6709, "mean_token_accuracy": 0.24583810567855835, "num_tokens": 127843422.0, "step": 55800 }, { "entropy": 5.335353851318359, "epoch": 5.516508501383946, "grad_norm": 1.0625, "learning_rate": 0.00024174501541890026, "loss": 4.6567, "mean_token_accuracy": 0.2563280418515205, "num_tokens": 127854578.0, "step": 55805 }, { "entropy": 5.274279642105102, "epoch": 5.517002767892448, "grad_norm": 1.15625, "learning_rate": 0.0002417101134256961, "loss": 4.6464, "mean_token_accuracy": 0.25445313900709154, "num_tokens": 127866029.0, "step": 55810 }, { "entropy": 5.237730503082275, "epoch": 5.517497034400949, "grad_norm": 1.1171875, "learning_rate": 0.0002416752122514283, "loss": 4.6462, "mean_token_accuracy": 0.24762496054172517, "num_tokens": 127877994.0, "step": 55815 }, { "entropy": 5.231328058242798, "epoch": 5.517991300909451, "grad_norm": 0.98046875, "learning_rate": 0.0002416403118969555, "loss": 4.603, "mean_token_accuracy": 0.2542802974581718, "num_tokens": 127890374.0, "step": 55820 }, { "entropy": 5.249169111251831, "epoch": 5.518485567417952, "grad_norm": 1.1796875, "learning_rate": 0.00024160541236313617, "loss": 4.6161, "mean_token_accuracy": 0.2597433999180794, "num_tokens": 127901011.0, "step": 55825 }, { "entropy": 5.194408655166626, "epoch": 5.518979833926453, "grad_norm": 1.171875, "learning_rate": 0.00024157051365082888, "loss": 4.5213, "mean_token_accuracy": 0.2696997344493866, "num_tokens": 127911941.0, "step": 55830 }, { "entropy": 5.26285400390625, "epoch": 5.519474100434954, "grad_norm": 1.046875, "learning_rate": 0.00024153561576089206, "loss": 4.6673, "mean_token_accuracy": 0.252576456964016, "num_tokens": 127925102.0, "step": 55835 }, { "entropy": 5.289052486419678, "epoch": 5.519968366943456, "grad_norm": 1.109375, "learning_rate": 0.0002415007186941844, "loss": 4.7005, "mean_token_accuracy": 0.24357887506484985, "num_tokens": 127936959.0, "step": 55840 }, { "entropy": 5.443057584762573, "epoch": 5.520462633451958, "grad_norm": 1.2109375, "learning_rate": 0.00024146582245156424, "loss": 4.7909, "mean_token_accuracy": 0.23403842598199845, "num_tokens": 127948898.0, "step": 55845 }, { "entropy": 5.26243896484375, "epoch": 5.520956899960459, "grad_norm": 1.0625, "learning_rate": 0.00024143092703388997, "loss": 4.6453, "mean_token_accuracy": 0.255283585190773, "num_tokens": 127960907.0, "step": 55850 }, { "entropy": 5.3388622283935545, "epoch": 5.52145116646896, "grad_norm": 1.0703125, "learning_rate": 0.00024139603244202018, "loss": 4.7654, "mean_token_accuracy": 0.2477823942899704, "num_tokens": 127972601.0, "step": 55855 }, { "entropy": 5.290210247039795, "epoch": 5.5219454329774615, "grad_norm": 1.25, "learning_rate": 0.00024136113867681325, "loss": 4.6817, "mean_token_accuracy": 0.24361344873905183, "num_tokens": 127983637.0, "step": 55860 }, { "entropy": 5.36868634223938, "epoch": 5.522439699485963, "grad_norm": 1.140625, "learning_rate": 0.00024132624573912736, "loss": 4.8028, "mean_token_accuracy": 0.23932270109653472, "num_tokens": 127995218.0, "step": 55865 }, { "entropy": 5.261622142791748, "epoch": 5.522933965994464, "grad_norm": 1.1328125, "learning_rate": 0.00024129135362982118, "loss": 4.641, "mean_token_accuracy": 0.2533038079738617, "num_tokens": 128006446.0, "step": 55870 }, { "entropy": 5.26730170249939, "epoch": 5.523428232502965, "grad_norm": 1.1796875, "learning_rate": 0.0002412564623497529, "loss": 4.6662, "mean_token_accuracy": 0.24989633709192277, "num_tokens": 128017769.0, "step": 55875 }, { "entropy": 5.319350004196167, "epoch": 5.5239224990114675, "grad_norm": 1.203125, "learning_rate": 0.00024122157189978088, "loss": 4.6654, "mean_token_accuracy": 0.24845308363437651, "num_tokens": 128027809.0, "step": 55880 }, { "entropy": 5.329959964752197, "epoch": 5.524416765519969, "grad_norm": 1.0703125, "learning_rate": 0.00024118668228076347, "loss": 4.6872, "mean_token_accuracy": 0.2554832652211189, "num_tokens": 128038577.0, "step": 55885 }, { "entropy": 5.229745531082154, "epoch": 5.52491103202847, "grad_norm": 1.140625, "learning_rate": 0.00024115179349355886, "loss": 4.5261, "mean_token_accuracy": 0.2662688747048378, "num_tokens": 128048820.0, "step": 55890 }, { "entropy": 5.355234146118164, "epoch": 5.525405298536971, "grad_norm": 1.1015625, "learning_rate": 0.00024111690553902537, "loss": 4.7733, "mean_token_accuracy": 0.23914975970983504, "num_tokens": 128060887.0, "step": 55895 }, { "entropy": 5.355198240280151, "epoch": 5.5258995650454725, "grad_norm": 1.0859375, "learning_rate": 0.00024108201841802125, "loss": 4.8222, "mean_token_accuracy": 0.2415619432926178, "num_tokens": 128072941.0, "step": 55900 }, { "entropy": 5.390593147277832, "epoch": 5.526393831553974, "grad_norm": 1.0625, "learning_rate": 0.00024104713213140484, "loss": 4.7367, "mean_token_accuracy": 0.24888797253370284, "num_tokens": 128084127.0, "step": 55905 }, { "entropy": 5.310800266265869, "epoch": 5.526888098062475, "grad_norm": 1.0, "learning_rate": 0.00024101224668003418, "loss": 4.7465, "mean_token_accuracy": 0.251066754758358, "num_tokens": 128096056.0, "step": 55910 }, { "entropy": 5.3344684600830075, "epoch": 5.527382364570976, "grad_norm": 1.1640625, "learning_rate": 0.00024097736206476757, "loss": 4.6938, "mean_token_accuracy": 0.25085737407207487, "num_tokens": 128107084.0, "step": 55915 }, { "entropy": 5.25883846282959, "epoch": 5.527876631079478, "grad_norm": 1.0859375, "learning_rate": 0.0002409424782864631, "loss": 4.6656, "mean_token_accuracy": 0.26225283592939375, "num_tokens": 128118303.0, "step": 55920 }, { "entropy": 5.337216758728028, "epoch": 5.52837089758798, "grad_norm": 1.0546875, "learning_rate": 0.00024090759534597884, "loss": 4.7139, "mean_token_accuracy": 0.25068595707416536, "num_tokens": 128130197.0, "step": 55925 }, { "entropy": 5.316674423217774, "epoch": 5.528865164096481, "grad_norm": 1.0390625, "learning_rate": 0.00024087271324417322, "loss": 4.6542, "mean_token_accuracy": 0.24628981053829194, "num_tokens": 128140924.0, "step": 55930 }, { "entropy": 5.296173620223999, "epoch": 5.529359430604982, "grad_norm": 1.1328125, "learning_rate": 0.000240837831981904, "loss": 4.6935, "mean_token_accuracy": 0.2556986227631569, "num_tokens": 128151167.0, "step": 55935 }, { "entropy": 5.1972612857818605, "epoch": 5.5298536971134835, "grad_norm": 1.15625, "learning_rate": 0.00024080295156002945, "loss": 4.6339, "mean_token_accuracy": 0.2621228829026222, "num_tokens": 128161954.0, "step": 55940 }, { "entropy": 5.372203540802002, "epoch": 5.530347963621985, "grad_norm": 1.1875, "learning_rate": 0.00024076807197940763, "loss": 4.7506, "mean_token_accuracy": 0.24505898654460906, "num_tokens": 128172253.0, "step": 55945 }, { "entropy": 5.32056884765625, "epoch": 5.530842230130486, "grad_norm": 1.171875, "learning_rate": 0.00024073319324089648, "loss": 4.7089, "mean_token_accuracy": 0.25430251359939576, "num_tokens": 128182798.0, "step": 55950 }, { "entropy": 5.304376554489136, "epoch": 5.531336496638987, "grad_norm": 1.15625, "learning_rate": 0.00024069831534535418, "loss": 4.715, "mean_token_accuracy": 0.2448189601302147, "num_tokens": 128194454.0, "step": 55955 }, { "entropy": 5.264535522460937, "epoch": 5.5318307631474894, "grad_norm": 1.2265625, "learning_rate": 0.00024066343829363862, "loss": 4.6237, "mean_token_accuracy": 0.2605246379971504, "num_tokens": 128205025.0, "step": 55960 }, { "entropy": 5.286056995391846, "epoch": 5.532325029655991, "grad_norm": 1.078125, "learning_rate": 0.00024062856208660778, "loss": 4.7043, "mean_token_accuracy": 0.24793637543916702, "num_tokens": 128215754.0, "step": 55965 }, { "entropy": 5.333595561981201, "epoch": 5.532819296164492, "grad_norm": 1.0234375, "learning_rate": 0.00024059368672511971, "loss": 4.7051, "mean_token_accuracy": 0.24478119015693664, "num_tokens": 128227024.0, "step": 55970 }, { "entropy": 5.399800634384155, "epoch": 5.533313562672993, "grad_norm": 1.2109375, "learning_rate": 0.00024055881221003223, "loss": 4.7867, "mean_token_accuracy": 0.24265518933534622, "num_tokens": 128237935.0, "step": 55975 }, { "entropy": 5.2357464790344235, "epoch": 5.5338078291814945, "grad_norm": 1.1171875, "learning_rate": 0.0002405239385422033, "loss": 4.6236, "mean_token_accuracy": 0.26089049577713014, "num_tokens": 128249229.0, "step": 55980 }, { "entropy": 5.228539562225341, "epoch": 5.534302095689996, "grad_norm": 1.03125, "learning_rate": 0.00024048906572249085, "loss": 4.6081, "mean_token_accuracy": 0.2548478737473488, "num_tokens": 128259950.0, "step": 55985 }, { "entropy": 5.275198936462402, "epoch": 5.534796362198497, "grad_norm": 1.203125, "learning_rate": 0.0002404541937517527, "loss": 4.7004, "mean_token_accuracy": 0.24799634367227555, "num_tokens": 128270690.0, "step": 55990 }, { "entropy": 5.272854280471802, "epoch": 5.535290628706999, "grad_norm": 1.3515625, "learning_rate": 0.0002404193226308468, "loss": 4.6588, "mean_token_accuracy": 0.2542233467102051, "num_tokens": 128282073.0, "step": 55995 }, { "entropy": 5.354849433898925, "epoch": 5.5357848952155, "grad_norm": 1.0546875, "learning_rate": 0.00024038445236063095, "loss": 4.8117, "mean_token_accuracy": 0.2400954470038414, "num_tokens": 128293798.0, "step": 56000 }, { "entropy": 5.3171471118927, "epoch": 5.536279161724002, "grad_norm": 1.1171875, "learning_rate": 0.0002403495829419629, "loss": 4.791, "mean_token_accuracy": 0.23586840480566024, "num_tokens": 128305692.0, "step": 56005 }, { "entropy": 5.332275867462158, "epoch": 5.536773428232503, "grad_norm": 1.2265625, "learning_rate": 0.0002403147143757004, "loss": 4.6639, "mean_token_accuracy": 0.25346231907606126, "num_tokens": 128316586.0, "step": 56010 }, { "entropy": 5.355028200149536, "epoch": 5.537267694741004, "grad_norm": 1.0390625, "learning_rate": 0.00024027984666270135, "loss": 4.7343, "mean_token_accuracy": 0.2425906851887703, "num_tokens": 128328478.0, "step": 56015 }, { "entropy": 5.231324243545532, "epoch": 5.5377619612495055, "grad_norm": 1.1484375, "learning_rate": 0.00024024497980382355, "loss": 4.5644, "mean_token_accuracy": 0.2653771176934242, "num_tokens": 128338523.0, "step": 56020 }, { "entropy": 5.321380281448365, "epoch": 5.538256227758007, "grad_norm": 1.1484375, "learning_rate": 0.00024021011379992462, "loss": 4.7279, "mean_token_accuracy": 0.244245508313179, "num_tokens": 128350704.0, "step": 56025 }, { "entropy": 5.320354795455932, "epoch": 5.538750494266509, "grad_norm": 1.1640625, "learning_rate": 0.0002401752486518623, "loss": 4.6818, "mean_token_accuracy": 0.24670785963535308, "num_tokens": 128361695.0, "step": 56030 }, { "entropy": 5.284438037872315, "epoch": 5.53924476077501, "grad_norm": 1.140625, "learning_rate": 0.00024014038436049418, "loss": 4.7218, "mean_token_accuracy": 0.2501894861459732, "num_tokens": 128373402.0, "step": 56035 }, { "entropy": 5.269022226333618, "epoch": 5.539739027283511, "grad_norm": 1.2109375, "learning_rate": 0.00024010552092667802, "loss": 4.6655, "mean_token_accuracy": 0.2528718188405037, "num_tokens": 128384162.0, "step": 56040 }, { "entropy": 5.347290754318237, "epoch": 5.540233293792013, "grad_norm": 1.1171875, "learning_rate": 0.00024007065835127144, "loss": 4.7362, "mean_token_accuracy": 0.24882130920886994, "num_tokens": 128396040.0, "step": 56045 }, { "entropy": 5.395370578765869, "epoch": 5.540727560300514, "grad_norm": 1.0859375, "learning_rate": 0.0002400357966351322, "loss": 4.7447, "mean_token_accuracy": 0.24181834161281585, "num_tokens": 128408028.0, "step": 56050 }, { "entropy": 5.40490403175354, "epoch": 5.541221826809015, "grad_norm": 1.0078125, "learning_rate": 0.00024000093577911775, "loss": 4.8774, "mean_token_accuracy": 0.2327907934784889, "num_tokens": 128420524.0, "step": 56055 }, { "entropy": 5.244313907623291, "epoch": 5.5417160933175165, "grad_norm": 0.97265625, "learning_rate": 0.00023996607578408564, "loss": 4.6205, "mean_token_accuracy": 0.2561644360423088, "num_tokens": 128432536.0, "step": 56060 }, { "entropy": 5.272387886047364, "epoch": 5.542210359826019, "grad_norm": 1.046875, "learning_rate": 0.00023993121665089357, "loss": 4.703, "mean_token_accuracy": 0.24753852635622026, "num_tokens": 128443938.0, "step": 56065 }, { "entropy": 5.332794237136841, "epoch": 5.54270462633452, "grad_norm": 1.0703125, "learning_rate": 0.00023989635838039892, "loss": 4.6857, "mean_token_accuracy": 0.24896464198827745, "num_tokens": 128456317.0, "step": 56070 }, { "entropy": 5.37155122756958, "epoch": 5.543198892843021, "grad_norm": 1.109375, "learning_rate": 0.00023986150097345937, "loss": 4.7502, "mean_token_accuracy": 0.2401735454797745, "num_tokens": 128467518.0, "step": 56075 }, { "entropy": 5.311260461807251, "epoch": 5.543693159351522, "grad_norm": 1.15625, "learning_rate": 0.0002398266444309324, "loss": 4.7071, "mean_token_accuracy": 0.25311980992555616, "num_tokens": 128479220.0, "step": 56080 }, { "entropy": 5.24066276550293, "epoch": 5.544187425860024, "grad_norm": 1.1484375, "learning_rate": 0.00023979178875367535, "loss": 4.5854, "mean_token_accuracy": 0.2569675579667091, "num_tokens": 128490423.0, "step": 56085 }, { "entropy": 5.330945539474487, "epoch": 5.544681692368525, "grad_norm": 1.046875, "learning_rate": 0.00023975693394254576, "loss": 4.7123, "mean_token_accuracy": 0.24759711772203447, "num_tokens": 128502740.0, "step": 56090 }, { "entropy": 5.3046996116638185, "epoch": 5.545175958877026, "grad_norm": 1.1171875, "learning_rate": 0.00023972207999840113, "loss": 4.7466, "mean_token_accuracy": 0.24406117498874663, "num_tokens": 128513546.0, "step": 56095 }, { "entropy": 5.3124596118927006, "epoch": 5.545670225385528, "grad_norm": 1.09375, "learning_rate": 0.00023968722692209872, "loss": 4.6782, "mean_token_accuracy": 0.2516598254442215, "num_tokens": 128524583.0, "step": 56100 }, { "entropy": 5.216903734207153, "epoch": 5.54616449189403, "grad_norm": 1.078125, "learning_rate": 0.0002396523747144961, "loss": 4.6528, "mean_token_accuracy": 0.2511695072054863, "num_tokens": 128536266.0, "step": 56105 }, { "entropy": 5.349182367324829, "epoch": 5.546658758402531, "grad_norm": 1.0703125, "learning_rate": 0.00023961752337645043, "loss": 4.7731, "mean_token_accuracy": 0.23722411841154098, "num_tokens": 128547681.0, "step": 56110 }, { "entropy": 5.3333391666412355, "epoch": 5.547153024911032, "grad_norm": 1.109375, "learning_rate": 0.00023958267290881925, "loss": 4.6895, "mean_token_accuracy": 0.25073990821838377, "num_tokens": 128558563.0, "step": 56115 }, { "entropy": 5.36752610206604, "epoch": 5.547647291419533, "grad_norm": 1.171875, "learning_rate": 0.00023954782331245982, "loss": 4.7112, "mean_token_accuracy": 0.24535924941301346, "num_tokens": 128571259.0, "step": 56120 }, { "entropy": 5.310404443740845, "epoch": 5.548141557928035, "grad_norm": 1.125, "learning_rate": 0.00023951297458822934, "loss": 4.7305, "mean_token_accuracy": 0.240849506855011, "num_tokens": 128584215.0, "step": 56125 }, { "entropy": 5.315868616104126, "epoch": 5.548635824436536, "grad_norm": 1.0, "learning_rate": 0.00023947812673698527, "loss": 4.7488, "mean_token_accuracy": 0.24263228923082353, "num_tokens": 128596524.0, "step": 56130 }, { "entropy": 5.27368049621582, "epoch": 5.549130090945038, "grad_norm": 1.0625, "learning_rate": 0.0002394432797595848, "loss": 4.5929, "mean_token_accuracy": 0.25928939431905745, "num_tokens": 128607793.0, "step": 56135 }, { "entropy": 5.28754506111145, "epoch": 5.549624357453539, "grad_norm": 1.2421875, "learning_rate": 0.00023940843365688515, "loss": 4.6986, "mean_token_accuracy": 0.24603625237941742, "num_tokens": 128617657.0, "step": 56140 }, { "entropy": 5.308396053314209, "epoch": 5.550118623962041, "grad_norm": 1.0625, "learning_rate": 0.0002393735884297436, "loss": 4.6655, "mean_token_accuracy": 0.25237559974193574, "num_tokens": 128628546.0, "step": 56145 }, { "entropy": 5.2915912628173825, "epoch": 5.550612890470542, "grad_norm": 1.03125, "learning_rate": 0.00023933874407901728, "loss": 4.7307, "mean_token_accuracy": 0.24412377923727036, "num_tokens": 128640618.0, "step": 56150 }, { "entropy": 5.3315832138061525, "epoch": 5.551107156979043, "grad_norm": 1.0625, "learning_rate": 0.00023930390060556328, "loss": 4.6811, "mean_token_accuracy": 0.24492739289999008, "num_tokens": 128652259.0, "step": 56155 }, { "entropy": 5.225549364089966, "epoch": 5.551601423487544, "grad_norm": 1.1171875, "learning_rate": 0.0002392690580102389, "loss": 4.547, "mean_token_accuracy": 0.2593983218073845, "num_tokens": 128662609.0, "step": 56160 }, { "entropy": 5.253681325912476, "epoch": 5.552095689996046, "grad_norm": 1.2109375, "learning_rate": 0.00023923421629390136, "loss": 4.6415, "mean_token_accuracy": 0.2551733925938606, "num_tokens": 128673236.0, "step": 56165 }, { "entropy": 5.336396932601929, "epoch": 5.552589956504547, "grad_norm": 1.109375, "learning_rate": 0.00023919937545740754, "loss": 4.6857, "mean_token_accuracy": 0.24970831573009492, "num_tokens": 128684578.0, "step": 56170 }, { "entropy": 5.341998100280762, "epoch": 5.553084223013048, "grad_norm": 1.234375, "learning_rate": 0.00023916453550161472, "loss": 4.7228, "mean_token_accuracy": 0.25175429284572604, "num_tokens": 128695078.0, "step": 56175 }, { "entropy": 5.333054876327514, "epoch": 5.55357848952155, "grad_norm": 1.1328125, "learning_rate": 0.00023912969642737986, "loss": 4.6417, "mean_token_accuracy": 0.2515516132116318, "num_tokens": 128707069.0, "step": 56180 }, { "entropy": 5.248471879959107, "epoch": 5.554072756030052, "grad_norm": 1.125, "learning_rate": 0.00023909485823555993, "loss": 4.7171, "mean_token_accuracy": 0.24877826422452926, "num_tokens": 128718843.0, "step": 56185 }, { "entropy": 5.261846971511841, "epoch": 5.554567022538553, "grad_norm": 1.15625, "learning_rate": 0.00023906002092701214, "loss": 4.6531, "mean_token_accuracy": 0.24681066274642943, "num_tokens": 128730149.0, "step": 56190 }, { "entropy": 5.259304571151733, "epoch": 5.555061289047054, "grad_norm": 1.1875, "learning_rate": 0.00023902518450259343, "loss": 4.6856, "mean_token_accuracy": 0.2527159810066223, "num_tokens": 128740849.0, "step": 56195 }, { "entropy": 5.301090097427368, "epoch": 5.555555555555555, "grad_norm": 1.3125, "learning_rate": 0.00023899034896316074, "loss": 4.767, "mean_token_accuracy": 0.24399377554655075, "num_tokens": 128751923.0, "step": 56200 }, { "entropy": 5.155952644348145, "epoch": 5.556049822064057, "grad_norm": 1.1875, "learning_rate": 0.000238955514309571, "loss": 4.5395, "mean_token_accuracy": 0.2626119896769524, "num_tokens": 128762978.0, "step": 56205 }, { "entropy": 5.207277727127075, "epoch": 5.556544088572558, "grad_norm": 1.0625, "learning_rate": 0.0002389206805426813, "loss": 4.5364, "mean_token_accuracy": 0.2642128497362137, "num_tokens": 128773104.0, "step": 56210 }, { "entropy": 5.281203126907348, "epoch": 5.55703835508106, "grad_norm": 1.1328125, "learning_rate": 0.00023888584766334835, "loss": 4.6064, "mean_token_accuracy": 0.25544271767139437, "num_tokens": 128783976.0, "step": 56215 }, { "entropy": 5.3690389633178714, "epoch": 5.557532621589561, "grad_norm": 1.1875, "learning_rate": 0.00023885101567242922, "loss": 4.75, "mean_token_accuracy": 0.2449238806962967, "num_tokens": 128794719.0, "step": 56220 }, { "entropy": 5.311289501190186, "epoch": 5.558026888098063, "grad_norm": 1.0390625, "learning_rate": 0.00023881618457078074, "loss": 4.6433, "mean_token_accuracy": 0.2541781336069107, "num_tokens": 128807531.0, "step": 56225 }, { "entropy": 5.274290418624878, "epoch": 5.558521154606564, "grad_norm": 1.203125, "learning_rate": 0.00023878135435925968, "loss": 4.6488, "mean_token_accuracy": 0.2530894592404366, "num_tokens": 128818413.0, "step": 56230 }, { "entropy": 5.207281017303467, "epoch": 5.559015421115065, "grad_norm": 1.2109375, "learning_rate": 0.00023874652503872297, "loss": 4.6276, "mean_token_accuracy": 0.25689992904663084, "num_tokens": 128828417.0, "step": 56235 }, { "entropy": 5.2705718040466305, "epoch": 5.559509687623566, "grad_norm": 1.09375, "learning_rate": 0.00023871169661002735, "loss": 4.6006, "mean_token_accuracy": 0.2599856570363045, "num_tokens": 128839548.0, "step": 56240 }, { "entropy": 5.312712860107422, "epoch": 5.560003954132068, "grad_norm": 1.109375, "learning_rate": 0.00023867686907402951, "loss": 4.7253, "mean_token_accuracy": 0.2482533037662506, "num_tokens": 128852358.0, "step": 56245 }, { "entropy": 5.263342237472534, "epoch": 5.56049822064057, "grad_norm": 1.1484375, "learning_rate": 0.00023864204243158644, "loss": 4.6726, "mean_token_accuracy": 0.24891960471868516, "num_tokens": 128863260.0, "step": 56250 }, { "entropy": 5.2727703094482425, "epoch": 5.560992487149071, "grad_norm": 1.2890625, "learning_rate": 0.00023860721668355473, "loss": 4.6145, "mean_token_accuracy": 0.2503901243209839, "num_tokens": 128873768.0, "step": 56255 }, { "entropy": 5.337655448913575, "epoch": 5.561486753657572, "grad_norm": 1.296875, "learning_rate": 0.00023857239183079122, "loss": 4.8127, "mean_token_accuracy": 0.23969575464725495, "num_tokens": 128884627.0, "step": 56260 }, { "entropy": 5.3099507808685305, "epoch": 5.5619810201660735, "grad_norm": 1.1328125, "learning_rate": 0.00023853756787415242, "loss": 4.7176, "mean_token_accuracy": 0.25006999671459196, "num_tokens": 128896105.0, "step": 56265 }, { "entropy": 5.3699378490448, "epoch": 5.562475286674575, "grad_norm": 1.1640625, "learning_rate": 0.00023850274481449507, "loss": 4.7702, "mean_token_accuracy": 0.24796089977025987, "num_tokens": 128908213.0, "step": 56270 }, { "entropy": 5.227234363555908, "epoch": 5.562969553183076, "grad_norm": 1.09375, "learning_rate": 0.00023846792265267596, "loss": 4.5697, "mean_token_accuracy": 0.2706023246049881, "num_tokens": 128919445.0, "step": 56275 }, { "entropy": 5.289241456985474, "epoch": 5.563463819691577, "grad_norm": 1.296875, "learning_rate": 0.00023843310138955154, "loss": 4.7303, "mean_token_accuracy": 0.24902836382389068, "num_tokens": 128931150.0, "step": 56280 }, { "entropy": 5.293516683578491, "epoch": 5.5639580862000795, "grad_norm": 1.1640625, "learning_rate": 0.0002383982810259786, "loss": 4.6574, "mean_token_accuracy": 0.2548282340168953, "num_tokens": 128943280.0, "step": 56285 }, { "entropy": 5.367139101028442, "epoch": 5.564452352708581, "grad_norm": 1.15625, "learning_rate": 0.00023836346156281364, "loss": 4.7624, "mean_token_accuracy": 0.24246811121702194, "num_tokens": 128954529.0, "step": 56290 }, { "entropy": 5.344999313354492, "epoch": 5.564946619217082, "grad_norm": 1.1328125, "learning_rate": 0.00023832864300091312, "loss": 4.7164, "mean_token_accuracy": 0.24810728877782823, "num_tokens": 128965169.0, "step": 56295 }, { "entropy": 5.26039752960205, "epoch": 5.565440885725583, "grad_norm": 1.0859375, "learning_rate": 0.00023829382534113364, "loss": 4.6248, "mean_token_accuracy": 0.24919700473546982, "num_tokens": 128976482.0, "step": 56300 }, { "entropy": 5.264256286621094, "epoch": 5.5659351522340845, "grad_norm": 1.1015625, "learning_rate": 0.0002382590085843318, "loss": 4.7061, "mean_token_accuracy": 0.2475555956363678, "num_tokens": 128987384.0, "step": 56305 }, { "entropy": 5.359313249588013, "epoch": 5.566429418742586, "grad_norm": 1.140625, "learning_rate": 0.00023822419273136409, "loss": 4.7976, "mean_token_accuracy": 0.23508672863245011, "num_tokens": 128998568.0, "step": 56310 }, { "entropy": 5.325368785858155, "epoch": 5.566923685251087, "grad_norm": 1.0625, "learning_rate": 0.0002381893777830869, "loss": 4.6925, "mean_token_accuracy": 0.24590012282133103, "num_tokens": 129009286.0, "step": 56315 }, { "entropy": 5.2404947757720945, "epoch": 5.567417951759589, "grad_norm": 1.1796875, "learning_rate": 0.00023815456374035672, "loss": 4.6263, "mean_token_accuracy": 0.25268927216529846, "num_tokens": 129021483.0, "step": 56320 }, { "entropy": 5.341607666015625, "epoch": 5.5679122182680905, "grad_norm": 1.2109375, "learning_rate": 0.00023811975060403, "loss": 4.7309, "mean_token_accuracy": 0.24140190184116364, "num_tokens": 129032058.0, "step": 56325 }, { "entropy": 5.282655668258667, "epoch": 5.568406484776592, "grad_norm": 1.1953125, "learning_rate": 0.00023808493837496308, "loss": 4.6619, "mean_token_accuracy": 0.25155454576015474, "num_tokens": 129042976.0, "step": 56330 }, { "entropy": 5.267822408676148, "epoch": 5.568900751285093, "grad_norm": 1.0703125, "learning_rate": 0.00023805012705401253, "loss": 4.7084, "mean_token_accuracy": 0.250954681634903, "num_tokens": 129054903.0, "step": 56335 }, { "entropy": 5.298233699798584, "epoch": 5.569395017793594, "grad_norm": 0.99609375, "learning_rate": 0.0002380153166420345, "loss": 4.7165, "mean_token_accuracy": 0.24575848281383514, "num_tokens": 129067888.0, "step": 56340 }, { "entropy": 5.249930334091187, "epoch": 5.5698892843020955, "grad_norm": 1.2265625, "learning_rate": 0.00023798050713988545, "loss": 4.6146, "mean_token_accuracy": 0.2615681394934654, "num_tokens": 129078151.0, "step": 56345 }, { "entropy": 5.359312105178833, "epoch": 5.570383550810597, "grad_norm": 1.09375, "learning_rate": 0.00023794569854842168, "loss": 4.8119, "mean_token_accuracy": 0.24244721680879594, "num_tokens": 129090066.0, "step": 56350 }, { "entropy": 5.259067535400391, "epoch": 5.570877817319099, "grad_norm": 1.1328125, "learning_rate": 0.0002379108908684995, "loss": 4.6288, "mean_token_accuracy": 0.2582040324807167, "num_tokens": 129100838.0, "step": 56355 }, { "entropy": 5.28650164604187, "epoch": 5.5713720838276, "grad_norm": 1.1484375, "learning_rate": 0.000237876084100975, "loss": 4.6692, "mean_token_accuracy": 0.25020421743392945, "num_tokens": 129112042.0, "step": 56360 }, { "entropy": 5.291776371002197, "epoch": 5.5718663503361014, "grad_norm": 1.203125, "learning_rate": 0.0002378412782467047, "loss": 4.66, "mean_token_accuracy": 0.2563962861895561, "num_tokens": 129123360.0, "step": 56365 }, { "entropy": 5.338279962539673, "epoch": 5.572360616844603, "grad_norm": 1.1484375, "learning_rate": 0.00023780647330654475, "loss": 4.7891, "mean_token_accuracy": 0.24257845133543016, "num_tokens": 129134131.0, "step": 56370 }, { "entropy": 5.321979618072509, "epoch": 5.572854883353104, "grad_norm": 1.140625, "learning_rate": 0.0002377716692813513, "loss": 4.8006, "mean_token_accuracy": 0.24082432240247725, "num_tokens": 129146878.0, "step": 56375 }, { "entropy": 5.272183752059936, "epoch": 5.573349149861605, "grad_norm": 1.078125, "learning_rate": 0.0002377368661719806, "loss": 4.6674, "mean_token_accuracy": 0.25491359680891035, "num_tokens": 129157842.0, "step": 56380 }, { "entropy": 5.334016275405884, "epoch": 5.5738434163701065, "grad_norm": 1.1953125, "learning_rate": 0.00023770206397928873, "loss": 4.6546, "mean_token_accuracy": 0.2516240611672401, "num_tokens": 129168500.0, "step": 56385 }, { "entropy": 5.253410196304321, "epoch": 5.574337682878608, "grad_norm": 1.125, "learning_rate": 0.0002376672627041318, "loss": 4.6485, "mean_token_accuracy": 0.26100636273622513, "num_tokens": 129178941.0, "step": 56390 }, { "entropy": 5.289076519012451, "epoch": 5.57483194938711, "grad_norm": 1.078125, "learning_rate": 0.00023763246234736609, "loss": 4.7012, "mean_token_accuracy": 0.24547899663448333, "num_tokens": 129192011.0, "step": 56395 }, { "entropy": 5.282413816452026, "epoch": 5.575326215895611, "grad_norm": 1.1484375, "learning_rate": 0.00023759766290984758, "loss": 4.6739, "mean_token_accuracy": 0.25515530705451966, "num_tokens": 129203980.0, "step": 56400 }, { "entropy": 5.289396333694458, "epoch": 5.575820482404112, "grad_norm": 1.09375, "learning_rate": 0.00023756286439243241, "loss": 4.6374, "mean_token_accuracy": 0.25302947610616683, "num_tokens": 129215441.0, "step": 56405 }, { "entropy": 5.366976261138916, "epoch": 5.576314748912614, "grad_norm": 1.2890625, "learning_rate": 0.00023752806679597655, "loss": 4.7453, "mean_token_accuracy": 0.24484077990055084, "num_tokens": 129226399.0, "step": 56410 }, { "entropy": 5.311278867721557, "epoch": 5.576809015421115, "grad_norm": 1.2734375, "learning_rate": 0.00023749327012133602, "loss": 4.6146, "mean_token_accuracy": 0.2554610580205917, "num_tokens": 129238778.0, "step": 56415 }, { "entropy": 5.345841646194458, "epoch": 5.577303281929616, "grad_norm": 1.03125, "learning_rate": 0.00023745847436936686, "loss": 4.7307, "mean_token_accuracy": 0.24247158616781234, "num_tokens": 129250222.0, "step": 56420 }, { "entropy": 5.305808687210083, "epoch": 5.5777975484381175, "grad_norm": 1.1328125, "learning_rate": 0.00023742367954092508, "loss": 4.7258, "mean_token_accuracy": 0.24622658938169478, "num_tokens": 129261589.0, "step": 56425 }, { "entropy": 5.208749914169312, "epoch": 5.578291814946619, "grad_norm": 1.1171875, "learning_rate": 0.00023738888563686666, "loss": 4.5959, "mean_token_accuracy": 0.25821133852005007, "num_tokens": 129272988.0, "step": 56430 }, { "entropy": 5.286700057983398, "epoch": 5.578786081455121, "grad_norm": 1.0703125, "learning_rate": 0.00023735409265804747, "loss": 4.7223, "mean_token_accuracy": 0.25506189167499543, "num_tokens": 129284719.0, "step": 56435 }, { "entropy": 5.317419862747192, "epoch": 5.579280347963622, "grad_norm": 1.1328125, "learning_rate": 0.00023731930060532343, "loss": 4.6867, "mean_token_accuracy": 0.25023899525403975, "num_tokens": 129295547.0, "step": 56440 }, { "entropy": 5.272624683380127, "epoch": 5.579774614472123, "grad_norm": 1.15625, "learning_rate": 0.00023728450947955033, "loss": 4.5862, "mean_token_accuracy": 0.2617754116654396, "num_tokens": 129307293.0, "step": 56445 }, { "entropy": 5.317401933670044, "epoch": 5.580268880980625, "grad_norm": 1.1875, "learning_rate": 0.00023724971928158428, "loss": 4.6928, "mean_token_accuracy": 0.2467855006456375, "num_tokens": 129317874.0, "step": 56450 }, { "entropy": 5.250114870071411, "epoch": 5.580763147489126, "grad_norm": 1.1015625, "learning_rate": 0.000237214930012281, "loss": 4.6704, "mean_token_accuracy": 0.2445533499121666, "num_tokens": 129328769.0, "step": 56455 }, { "entropy": 5.252302646636963, "epoch": 5.581257413997627, "grad_norm": 1.1484375, "learning_rate": 0.0002371801416724963, "loss": 4.7084, "mean_token_accuracy": 0.2523835629224777, "num_tokens": 129339986.0, "step": 56460 }, { "entropy": 5.226134204864502, "epoch": 5.5817516805061285, "grad_norm": 1.265625, "learning_rate": 0.00023714535426308593, "loss": 4.6636, "mean_token_accuracy": 0.2576289251446724, "num_tokens": 129350348.0, "step": 56465 }, { "entropy": 5.3129395008087155, "epoch": 5.582245947014631, "grad_norm": 1.046875, "learning_rate": 0.00023711056778490575, "loss": 4.7337, "mean_token_accuracy": 0.2419821172952652, "num_tokens": 129361212.0, "step": 56470 }, { "entropy": 5.38929443359375, "epoch": 5.582740213523132, "grad_norm": 1.1953125, "learning_rate": 0.00023707578223881143, "loss": 4.7397, "mean_token_accuracy": 0.24166643619537354, "num_tokens": 129370949.0, "step": 56475 }, { "entropy": 5.315732860565186, "epoch": 5.583234480031633, "grad_norm": 1.0, "learning_rate": 0.00023704099762565878, "loss": 4.6836, "mean_token_accuracy": 0.24867248237133027, "num_tokens": 129382646.0, "step": 56480 }, { "entropy": 5.241917514801026, "epoch": 5.583728746540134, "grad_norm": 1.1015625, "learning_rate": 0.00023700621394630352, "loss": 4.653, "mean_token_accuracy": 0.25402335077524185, "num_tokens": 129394795.0, "step": 56485 }, { "entropy": 5.244583415985107, "epoch": 5.584223013048636, "grad_norm": 1.0546875, "learning_rate": 0.00023697143120160125, "loss": 4.6781, "mean_token_accuracy": 0.25104846656322477, "num_tokens": 129406705.0, "step": 56490 }, { "entropy": 5.320243215560913, "epoch": 5.584717279557137, "grad_norm": 1.203125, "learning_rate": 0.00023693664939240772, "loss": 4.6866, "mean_token_accuracy": 0.244322307407856, "num_tokens": 129417088.0, "step": 56495 }, { "entropy": 5.33309907913208, "epoch": 5.585211546065638, "grad_norm": 1.2265625, "learning_rate": 0.00023690186851957847, "loss": 4.6961, "mean_token_accuracy": 0.2536003664135933, "num_tokens": 129429134.0, "step": 56500 }, { "entropy": 5.266968441009522, "epoch": 5.58570581257414, "grad_norm": 1.171875, "learning_rate": 0.0002368670885839691, "loss": 4.6195, "mean_token_accuracy": 0.251650670170784, "num_tokens": 129439581.0, "step": 56505 }, { "entropy": 5.226275968551636, "epoch": 5.586200079082642, "grad_norm": 1.234375, "learning_rate": 0.00023683230958643537, "loss": 4.654, "mean_token_accuracy": 0.25884957164525985, "num_tokens": 129450299.0, "step": 56510 }, { "entropy": 5.367195463180542, "epoch": 5.586694345591143, "grad_norm": 1.171875, "learning_rate": 0.00023679753152783267, "loss": 4.7962, "mean_token_accuracy": 0.23975649923086167, "num_tokens": 129462202.0, "step": 56515 }, { "entropy": 5.371835994720459, "epoch": 5.587188612099644, "grad_norm": 1.0625, "learning_rate": 0.00023676275440901674, "loss": 4.6739, "mean_token_accuracy": 0.25049456506967543, "num_tokens": 129473544.0, "step": 56520 }, { "entropy": 5.349793004989624, "epoch": 5.587682878608145, "grad_norm": 1.0625, "learning_rate": 0.0002367279782308429, "loss": 4.7275, "mean_token_accuracy": 0.24946573972702027, "num_tokens": 129486351.0, "step": 56525 }, { "entropy": 5.188578081130982, "epoch": 5.588177145116647, "grad_norm": 1.078125, "learning_rate": 0.00023669320299416676, "loss": 4.558, "mean_token_accuracy": 0.25980132520198823, "num_tokens": 129496995.0, "step": 56530 }, { "entropy": 5.228303718566894, "epoch": 5.588671411625148, "grad_norm": 1.109375, "learning_rate": 0.00023665842869984371, "loss": 4.6308, "mean_token_accuracy": 0.25336930006742475, "num_tokens": 129509159.0, "step": 56535 }, { "entropy": 5.333912992477417, "epoch": 5.58916567813365, "grad_norm": 1.1640625, "learning_rate": 0.00023662365534872926, "loss": 4.7238, "mean_token_accuracy": 0.24492458254098892, "num_tokens": 129520678.0, "step": 56540 }, { "entropy": 5.3021564960479735, "epoch": 5.589659944642151, "grad_norm": 1.0625, "learning_rate": 0.00023658888294167895, "loss": 4.6727, "mean_token_accuracy": 0.24903537929058076, "num_tokens": 129532417.0, "step": 56545 }, { "entropy": 5.223353338241577, "epoch": 5.590154211150653, "grad_norm": 1.1875, "learning_rate": 0.00023655411147954802, "loss": 4.679, "mean_token_accuracy": 0.2572224155068398, "num_tokens": 129543048.0, "step": 56550 }, { "entropy": 5.239970111846924, "epoch": 5.590648477659154, "grad_norm": 1.046875, "learning_rate": 0.00023651934096319187, "loss": 4.6262, "mean_token_accuracy": 0.25697752833366394, "num_tokens": 129554585.0, "step": 56555 }, { "entropy": 5.181825733184814, "epoch": 5.591142744167655, "grad_norm": 1.15625, "learning_rate": 0.00023648457139346596, "loss": 4.5762, "mean_token_accuracy": 0.2672782361507416, "num_tokens": 129565844.0, "step": 56560 }, { "entropy": 5.311311388015747, "epoch": 5.591637010676156, "grad_norm": 1.15625, "learning_rate": 0.0002364498027712255, "loss": 4.6929, "mean_token_accuracy": 0.24581349343061448, "num_tokens": 129576630.0, "step": 56565 }, { "entropy": 5.267394495010376, "epoch": 5.592131277184658, "grad_norm": 1.171875, "learning_rate": 0.00023641503509732592, "loss": 4.6533, "mean_token_accuracy": 0.2605996713042259, "num_tokens": 129588399.0, "step": 56570 }, { "entropy": 5.355791759490967, "epoch": 5.59262554369316, "grad_norm": 1.109375, "learning_rate": 0.0002363802683726225, "loss": 4.8153, "mean_token_accuracy": 0.24373569041490556, "num_tokens": 129600935.0, "step": 56575 }, { "entropy": 5.213644027709961, "epoch": 5.593119810201661, "grad_norm": 1.140625, "learning_rate": 0.00023634550259797043, "loss": 4.5941, "mean_token_accuracy": 0.26274416595697403, "num_tokens": 129612949.0, "step": 56580 }, { "entropy": 5.321603059768677, "epoch": 5.593614076710162, "grad_norm": 1.0703125, "learning_rate": 0.000236310737774225, "loss": 4.685, "mean_token_accuracy": 0.25048823207616805, "num_tokens": 129625612.0, "step": 56585 }, { "entropy": 5.329578113555908, "epoch": 5.594108343218664, "grad_norm": 1.0859375, "learning_rate": 0.0002362759739022413, "loss": 4.7607, "mean_token_accuracy": 0.24462394565343856, "num_tokens": 129636774.0, "step": 56590 }, { "entropy": 5.273504257202148, "epoch": 5.594602609727165, "grad_norm": 1.0625, "learning_rate": 0.00023624121098287482, "loss": 4.6717, "mean_token_accuracy": 0.2531536057591438, "num_tokens": 129647711.0, "step": 56595 }, { "entropy": 5.314873361587525, "epoch": 5.595096876235666, "grad_norm": 1.125, "learning_rate": 0.00023620644901698056, "loss": 4.7417, "mean_token_accuracy": 0.24934722781181334, "num_tokens": 129658932.0, "step": 56600 }, { "entropy": 5.288256025314331, "epoch": 5.595591142744167, "grad_norm": 1.1171875, "learning_rate": 0.0002361716880054136, "loss": 4.6616, "mean_token_accuracy": 0.25158345848321917, "num_tokens": 129670882.0, "step": 56605 }, { "entropy": 5.339036083221435, "epoch": 5.5960854092526695, "grad_norm": 1.109375, "learning_rate": 0.00023613692794902918, "loss": 4.6915, "mean_token_accuracy": 0.25565988570451736, "num_tokens": 129682685.0, "step": 56610 }, { "entropy": 5.313941192626953, "epoch": 5.596579675761171, "grad_norm": 1.1015625, "learning_rate": 0.00023610216884868235, "loss": 4.7006, "mean_token_accuracy": 0.24821016043424607, "num_tokens": 129694404.0, "step": 56615 }, { "entropy": 5.368471097946167, "epoch": 5.597073942269672, "grad_norm": 1.1484375, "learning_rate": 0.00023606741070522814, "loss": 4.8011, "mean_token_accuracy": 0.24023527204990386, "num_tokens": 129705181.0, "step": 56620 }, { "entropy": 5.3922343254089355, "epoch": 5.597568208778173, "grad_norm": 1.0546875, "learning_rate": 0.00023603265351952173, "loss": 4.7877, "mean_token_accuracy": 0.23672627806663513, "num_tokens": 129716839.0, "step": 56625 }, { "entropy": 5.351445865631104, "epoch": 5.5980624752866746, "grad_norm": 1.2265625, "learning_rate": 0.00023599789729241804, "loss": 4.72, "mean_token_accuracy": 0.24170529544353486, "num_tokens": 129727707.0, "step": 56630 }, { "entropy": 5.372320079803467, "epoch": 5.598556741795176, "grad_norm": 1.203125, "learning_rate": 0.0002359631420247722, "loss": 4.8059, "mean_token_accuracy": 0.23934817165136338, "num_tokens": 129738748.0, "step": 56635 }, { "entropy": 5.2869971752166744, "epoch": 5.599051008303677, "grad_norm": 1.09375, "learning_rate": 0.00023592838771743912, "loss": 4.6319, "mean_token_accuracy": 0.2586037635803223, "num_tokens": 129749382.0, "step": 56640 }, { "entropy": 5.3234827518463135, "epoch": 5.599545274812178, "grad_norm": 1.1328125, "learning_rate": 0.00023589363437127376, "loss": 4.6969, "mean_token_accuracy": 0.24490612894296646, "num_tokens": 129760723.0, "step": 56645 }, { "entropy": 5.276397800445556, "epoch": 5.6000395413206805, "grad_norm": 1.0859375, "learning_rate": 0.00023585888198713096, "loss": 4.6321, "mean_token_accuracy": 0.2607151657342911, "num_tokens": 129771724.0, "step": 56650 }, { "entropy": 5.276231384277343, "epoch": 5.600533807829182, "grad_norm": 1.0859375, "learning_rate": 0.00023582413056586583, "loss": 4.6967, "mean_token_accuracy": 0.2469521090388298, "num_tokens": 129782874.0, "step": 56655 }, { "entropy": 5.3100556373596195, "epoch": 5.601028074337683, "grad_norm": 1.234375, "learning_rate": 0.00023578938010833313, "loss": 4.6844, "mean_token_accuracy": 0.24963811486959459, "num_tokens": 129794034.0, "step": 56660 }, { "entropy": 5.259279394149781, "epoch": 5.601522340846184, "grad_norm": 1.125, "learning_rate": 0.0002357546306153878, "loss": 4.6086, "mean_token_accuracy": 0.2541662633419037, "num_tokens": 129805354.0, "step": 56665 }, { "entropy": 5.296213579177857, "epoch": 5.6020166073546855, "grad_norm": 1.078125, "learning_rate": 0.00023571988208788465, "loss": 4.7599, "mean_token_accuracy": 0.24130327999591827, "num_tokens": 129816205.0, "step": 56670 }, { "entropy": 5.241795635223388, "epoch": 5.602510873863187, "grad_norm": 1.1484375, "learning_rate": 0.00023568513452667844, "loss": 4.6365, "mean_token_accuracy": 0.25476332306861876, "num_tokens": 129828253.0, "step": 56675 }, { "entropy": 5.324109601974487, "epoch": 5.603005140371688, "grad_norm": 1.140625, "learning_rate": 0.00023565038793262405, "loss": 4.6563, "mean_token_accuracy": 0.2570741981267929, "num_tokens": 129839222.0, "step": 56680 }, { "entropy": 5.312856531143188, "epoch": 5.603499406880189, "grad_norm": 1.234375, "learning_rate": 0.00023561564230657617, "loss": 4.666, "mean_token_accuracy": 0.2460535317659378, "num_tokens": 129848436.0, "step": 56685 }, { "entropy": 5.255201911926269, "epoch": 5.6039936733886915, "grad_norm": 1.125, "learning_rate": 0.00023558089764938968, "loss": 4.6135, "mean_token_accuracy": 0.2573419943451881, "num_tokens": 129859158.0, "step": 56690 }, { "entropy": 5.30212631225586, "epoch": 5.604487939897193, "grad_norm": 1.1796875, "learning_rate": 0.0002355461539619192, "loss": 4.7008, "mean_token_accuracy": 0.24427374303340912, "num_tokens": 129871443.0, "step": 56695 }, { "entropy": 5.319493675231934, "epoch": 5.604982206405694, "grad_norm": 1.2109375, "learning_rate": 0.00023551141124501944, "loss": 4.7573, "mean_token_accuracy": 0.24908835887908937, "num_tokens": 129882308.0, "step": 56700 }, { "entropy": 5.229597902297973, "epoch": 5.605476472914195, "grad_norm": 1.1015625, "learning_rate": 0.0002354766694995451, "loss": 4.6259, "mean_token_accuracy": 0.2571436032652855, "num_tokens": 129893176.0, "step": 56705 }, { "entropy": 5.298247861862182, "epoch": 5.6059707394226965, "grad_norm": 1.09375, "learning_rate": 0.00023544192872635073, "loss": 4.6929, "mean_token_accuracy": 0.2498332902789116, "num_tokens": 129903700.0, "step": 56710 }, { "entropy": 5.340976715087891, "epoch": 5.606465005931198, "grad_norm": 1.203125, "learning_rate": 0.0002354071889262912, "loss": 4.7561, "mean_token_accuracy": 0.23679780066013337, "num_tokens": 129914773.0, "step": 56715 }, { "entropy": 5.336865186691284, "epoch": 5.606959272439699, "grad_norm": 1.046875, "learning_rate": 0.0002353724501002209, "loss": 4.6262, "mean_token_accuracy": 0.2483152687549591, "num_tokens": 129926101.0, "step": 56720 }, { "entropy": 5.319532966613769, "epoch": 5.607453538948201, "grad_norm": 1.09375, "learning_rate": 0.00023533771224899447, "loss": 4.7698, "mean_token_accuracy": 0.2398456186056137, "num_tokens": 129937652.0, "step": 56725 }, { "entropy": 5.260452032089233, "epoch": 5.6079478054567025, "grad_norm": 1.09375, "learning_rate": 0.00023530297537346646, "loss": 4.6574, "mean_token_accuracy": 0.25436788648366926, "num_tokens": 129948572.0, "step": 56730 }, { "entropy": 5.35947003364563, "epoch": 5.608442071965204, "grad_norm": 1.125, "learning_rate": 0.0002352682394744915, "loss": 4.7536, "mean_token_accuracy": 0.24873143583536148, "num_tokens": 129961768.0, "step": 56735 }, { "entropy": 5.2605761051177975, "epoch": 5.608936338473705, "grad_norm": 1.265625, "learning_rate": 0.00023523350455292386, "loss": 4.6345, "mean_token_accuracy": 0.2581311106681824, "num_tokens": 129972651.0, "step": 56740 }, { "entropy": 5.341577768325806, "epoch": 5.609430604982206, "grad_norm": 1.0859375, "learning_rate": 0.00023519877060961824, "loss": 4.7596, "mean_token_accuracy": 0.24545811712741852, "num_tokens": 129983606.0, "step": 56745 }, { "entropy": 5.272844839096069, "epoch": 5.6099248714907075, "grad_norm": 1.1875, "learning_rate": 0.0002351640376454291, "loss": 4.6849, "mean_token_accuracy": 0.255159991979599, "num_tokens": 129995349.0, "step": 56750 }, { "entropy": 5.354969882965088, "epoch": 5.610419137999209, "grad_norm": 1.21875, "learning_rate": 0.00023512930566121077, "loss": 4.7099, "mean_token_accuracy": 0.24833090603351593, "num_tokens": 130005943.0, "step": 56755 }, { "entropy": 5.321932649612426, "epoch": 5.610913404507711, "grad_norm": 1.171875, "learning_rate": 0.00023509457465781776, "loss": 4.6655, "mean_token_accuracy": 0.25318370163440707, "num_tokens": 130018225.0, "step": 56760 }, { "entropy": 5.260446786880493, "epoch": 5.611407671016212, "grad_norm": 1.109375, "learning_rate": 0.00023505984463610425, "loss": 4.5812, "mean_token_accuracy": 0.2643589347600937, "num_tokens": 130029774.0, "step": 56765 }, { "entropy": 5.247237634658814, "epoch": 5.6119019375247134, "grad_norm": 1.265625, "learning_rate": 0.00023502511559692492, "loss": 4.6443, "mean_token_accuracy": 0.25310520082712173, "num_tokens": 130039687.0, "step": 56770 }, { "entropy": 5.143844509124756, "epoch": 5.612396204033215, "grad_norm": 1.1796875, "learning_rate": 0.00023499038754113384, "loss": 4.5243, "mean_token_accuracy": 0.2655485078692436, "num_tokens": 130050402.0, "step": 56775 }, { "entropy": 5.225368309020996, "epoch": 5.612890470541716, "grad_norm": 1.09375, "learning_rate": 0.0002349556604695855, "loss": 4.6655, "mean_token_accuracy": 0.25284072756767273, "num_tokens": 130061221.0, "step": 56780 }, { "entropy": 5.273916339874267, "epoch": 5.613384737050217, "grad_norm": 1.1640625, "learning_rate": 0.00023492093438313416, "loss": 4.6265, "mean_token_accuracy": 0.2524573847651482, "num_tokens": 130073013.0, "step": 56785 }, { "entropy": 5.296055269241333, "epoch": 5.6138790035587185, "grad_norm": 1.046875, "learning_rate": 0.000234886209282634, "loss": 4.6465, "mean_token_accuracy": 0.2477790892124176, "num_tokens": 130084936.0, "step": 56790 }, { "entropy": 5.339785575866699, "epoch": 5.614373270067221, "grad_norm": 1.109375, "learning_rate": 0.00023485148516893924, "loss": 4.7283, "mean_token_accuracy": 0.25286692231893537, "num_tokens": 130096089.0, "step": 56795 }, { "entropy": 5.317938423156738, "epoch": 5.614867536575722, "grad_norm": 1.1015625, "learning_rate": 0.00023481676204290425, "loss": 4.7325, "mean_token_accuracy": 0.24884345680475234, "num_tokens": 130108971.0, "step": 56800 }, { "entropy": 5.265090608596802, "epoch": 5.615361803084223, "grad_norm": 1.03125, "learning_rate": 0.00023478203990538317, "loss": 4.6931, "mean_token_accuracy": 0.2477421596646309, "num_tokens": 130120750.0, "step": 56805 }, { "entropy": 5.293233060836792, "epoch": 5.615856069592724, "grad_norm": 1.1484375, "learning_rate": 0.00023474731875723016, "loss": 4.7273, "mean_token_accuracy": 0.2495740532875061, "num_tokens": 130131839.0, "step": 56810 }, { "entropy": 5.2474684715271, "epoch": 5.616350336101226, "grad_norm": 1.0546875, "learning_rate": 0.00023471259859929926, "loss": 4.6763, "mean_token_accuracy": 0.2501946449279785, "num_tokens": 130144100.0, "step": 56815 }, { "entropy": 5.357354354858399, "epoch": 5.616844602609727, "grad_norm": 1.2109375, "learning_rate": 0.00023467787943244473, "loss": 4.7711, "mean_token_accuracy": 0.2396792620420456, "num_tokens": 130155346.0, "step": 56820 }, { "entropy": 5.319255733489991, "epoch": 5.617338869118228, "grad_norm": 1.0703125, "learning_rate": 0.0002346431612575206, "loss": 4.6451, "mean_token_accuracy": 0.2501435145735741, "num_tokens": 130166407.0, "step": 56825 }, { "entropy": 5.29992151260376, "epoch": 5.61783313562673, "grad_norm": 1.140625, "learning_rate": 0.00023460844407538101, "loss": 4.7169, "mean_token_accuracy": 0.2501977041363716, "num_tokens": 130177606.0, "step": 56830 }, { "entropy": 5.301975679397583, "epoch": 5.618327402135232, "grad_norm": 1.203125, "learning_rate": 0.00023457372788687997, "loss": 4.6814, "mean_token_accuracy": 0.25535513162612916, "num_tokens": 130189926.0, "step": 56835 }, { "entropy": 5.332492780685425, "epoch": 5.618821668643733, "grad_norm": 1.2109375, "learning_rate": 0.00023453901269287155, "loss": 4.68, "mean_token_accuracy": 0.2533415898680687, "num_tokens": 130200747.0, "step": 56840 }, { "entropy": 5.29605016708374, "epoch": 5.619315935152234, "grad_norm": 1.09375, "learning_rate": 0.00023450429849420956, "loss": 4.7209, "mean_token_accuracy": 0.24590897113084792, "num_tokens": 130214191.0, "step": 56845 }, { "entropy": 5.330018711090088, "epoch": 5.619810201660735, "grad_norm": 1.140625, "learning_rate": 0.00023446958529174815, "loss": 4.7235, "mean_token_accuracy": 0.24090166836977006, "num_tokens": 130225349.0, "step": 56850 }, { "entropy": 5.336422395706177, "epoch": 5.620304468169237, "grad_norm": 1.125, "learning_rate": 0.0002344348730863412, "loss": 4.7598, "mean_token_accuracy": 0.24665705114603043, "num_tokens": 130236649.0, "step": 56855 }, { "entropy": 5.279087209701538, "epoch": 5.620798734677738, "grad_norm": 1.0390625, "learning_rate": 0.00023440016187884277, "loss": 4.6263, "mean_token_accuracy": 0.25248309671878816, "num_tokens": 130248715.0, "step": 56860 }, { "entropy": 5.358359003067017, "epoch": 5.62129300118624, "grad_norm": 1.125, "learning_rate": 0.00023436545167010659, "loss": 4.7652, "mean_token_accuracy": 0.2472807064652443, "num_tokens": 130259247.0, "step": 56865 }, { "entropy": 5.2460884094238285, "epoch": 5.621787267694741, "grad_norm": 1.28125, "learning_rate": 0.00023433074246098656, "loss": 4.629, "mean_token_accuracy": 0.2505724087357521, "num_tokens": 130269986.0, "step": 56870 }, { "entropy": 5.229977178573608, "epoch": 5.622281534203243, "grad_norm": 1.171875, "learning_rate": 0.0002342960342523367, "loss": 4.654, "mean_token_accuracy": 0.24895808845758438, "num_tokens": 130282908.0, "step": 56875 }, { "entropy": 5.3209153175354, "epoch": 5.622775800711744, "grad_norm": 1.1875, "learning_rate": 0.00023426132704501063, "loss": 4.7295, "mean_token_accuracy": 0.24733631163835526, "num_tokens": 130294376.0, "step": 56880 }, { "entropy": 5.3393449783325195, "epoch": 5.623270067220245, "grad_norm": 1.28125, "learning_rate": 0.0002342266208398622, "loss": 4.7038, "mean_token_accuracy": 0.24857618510723115, "num_tokens": 130306060.0, "step": 56885 }, { "entropy": 5.3078165531158445, "epoch": 5.623764333728746, "grad_norm": 1.2890625, "learning_rate": 0.00023419191563774528, "loss": 4.6657, "mean_token_accuracy": 0.24961885958909988, "num_tokens": 130316706.0, "step": 56890 }, { "entropy": 5.222683095932007, "epoch": 5.624258600237248, "grad_norm": 1.1484375, "learning_rate": 0.00023415721143951352, "loss": 4.5691, "mean_token_accuracy": 0.2556833103299141, "num_tokens": 130327018.0, "step": 56895 }, { "entropy": 5.387352561950683, "epoch": 5.624752866745749, "grad_norm": 1.078125, "learning_rate": 0.00023412250824602073, "loss": 4.7848, "mean_token_accuracy": 0.23817467242479323, "num_tokens": 130337999.0, "step": 56900 }, { "entropy": 5.319403600692749, "epoch": 5.625247133254251, "grad_norm": 1.1015625, "learning_rate": 0.00023408780605812062, "loss": 4.7144, "mean_token_accuracy": 0.2467424139380455, "num_tokens": 130350461.0, "step": 56905 }, { "entropy": 5.320430564880371, "epoch": 5.625741399762752, "grad_norm": 1.15625, "learning_rate": 0.0002340531048766667, "loss": 4.7324, "mean_token_accuracy": 0.24701434671878814, "num_tokens": 130362299.0, "step": 56910 }, { "entropy": 5.228667497634888, "epoch": 5.626235666271254, "grad_norm": 1.0703125, "learning_rate": 0.00023401840470251286, "loss": 4.6218, "mean_token_accuracy": 0.25296592265367507, "num_tokens": 130374172.0, "step": 56915 }, { "entropy": 5.222447729110717, "epoch": 5.626729932779755, "grad_norm": 1.0703125, "learning_rate": 0.00023398370553651254, "loss": 4.6367, "mean_token_accuracy": 0.25784873217344284, "num_tokens": 130386523.0, "step": 56920 }, { "entropy": 5.294389963150024, "epoch": 5.627224199288256, "grad_norm": 1.203125, "learning_rate": 0.00023394900737951958, "loss": 4.6849, "mean_token_accuracy": 0.24871037900447845, "num_tokens": 130397249.0, "step": 56925 }, { "entropy": 5.328156852722168, "epoch": 5.627718465796757, "grad_norm": 1.234375, "learning_rate": 0.0002339143102323873, "loss": 4.749, "mean_token_accuracy": 0.2443566858768463, "num_tokens": 130409403.0, "step": 56930 }, { "entropy": 5.194670152664185, "epoch": 5.628212732305259, "grad_norm": 1.1640625, "learning_rate": 0.00023387961409596935, "loss": 4.6249, "mean_token_accuracy": 0.251826311647892, "num_tokens": 130421043.0, "step": 56935 }, { "entropy": 5.262348985671997, "epoch": 5.62870699881376, "grad_norm": 1.1171875, "learning_rate": 0.00023384491897111926, "loss": 4.6669, "mean_token_accuracy": 0.2478190168738365, "num_tokens": 130432904.0, "step": 56940 }, { "entropy": 5.341384553909302, "epoch": 5.629201265322262, "grad_norm": 1.140625, "learning_rate": 0.00023381022485869057, "loss": 4.6716, "mean_token_accuracy": 0.25058900713920595, "num_tokens": 130444382.0, "step": 56945 }, { "entropy": 5.318771314620972, "epoch": 5.629695531830763, "grad_norm": 1.140625, "learning_rate": 0.00023377553175953674, "loss": 4.7269, "mean_token_accuracy": 0.24384621530771255, "num_tokens": 130455183.0, "step": 56950 }, { "entropy": 5.28576135635376, "epoch": 5.630189798339265, "grad_norm": 1.2421875, "learning_rate": 0.0002337408396745113, "loss": 4.6821, "mean_token_accuracy": 0.2555607959628105, "num_tokens": 130465626.0, "step": 56955 }, { "entropy": 5.151157808303833, "epoch": 5.630684064847766, "grad_norm": 1.1875, "learning_rate": 0.00023370614860446755, "loss": 4.5151, "mean_token_accuracy": 0.26419913619756696, "num_tokens": 130477981.0, "step": 56960 }, { "entropy": 5.359890460968018, "epoch": 5.631178331356267, "grad_norm": 1.0234375, "learning_rate": 0.00023367145855025895, "loss": 4.7622, "mean_token_accuracy": 0.23792312145233155, "num_tokens": 130489532.0, "step": 56965 }, { "entropy": 5.261657953262329, "epoch": 5.631672597864768, "grad_norm": 1.1796875, "learning_rate": 0.00023363676951273878, "loss": 4.6454, "mean_token_accuracy": 0.2538450911641121, "num_tokens": 130500655.0, "step": 56970 }, { "entropy": 5.249275541305542, "epoch": 5.63216686437327, "grad_norm": 1.0625, "learning_rate": 0.00023360208149276064, "loss": 4.66, "mean_token_accuracy": 0.26082118004560473, "num_tokens": 130512250.0, "step": 56975 }, { "entropy": 5.293246650695801, "epoch": 5.632661130881772, "grad_norm": 1.140625, "learning_rate": 0.0002335673944911777, "loss": 4.6475, "mean_token_accuracy": 0.2507603675127029, "num_tokens": 130523730.0, "step": 56980 }, { "entropy": 5.326362991333008, "epoch": 5.633155397390273, "grad_norm": 1.1015625, "learning_rate": 0.00023353270850884317, "loss": 4.7312, "mean_token_accuracy": 0.2517833665013313, "num_tokens": 130535567.0, "step": 56985 }, { "entropy": 5.283675861358643, "epoch": 5.633649663898774, "grad_norm": 1.1640625, "learning_rate": 0.0002334980235466106, "loss": 4.7065, "mean_token_accuracy": 0.24901963919401168, "num_tokens": 130548197.0, "step": 56990 }, { "entropy": 5.294387912750244, "epoch": 5.634143930407276, "grad_norm": 1.0859375, "learning_rate": 0.00023346333960533306, "loss": 4.6966, "mean_token_accuracy": 0.25185666531324385, "num_tokens": 130559428.0, "step": 56995 }, { "entropy": 5.2628227233886715, "epoch": 5.634638196915777, "grad_norm": 1.1015625, "learning_rate": 0.00023342865668586366, "loss": 4.6273, "mean_token_accuracy": 0.25473671704530715, "num_tokens": 130570264.0, "step": 57000 }, { "epoch": 5.634638196915777, "eval_entropy": 5.050012143570266, "eval_loss": 4.827846527099609, "eval_mean_token_accuracy": 0.24908090897665106, "eval_num_tokens": 130570264.0, "eval_runtime": 26.4198, "eval_samples_per_second": 1230.631, "eval_steps_per_second": 153.862, "step": 57000 }, { "entropy": 5.306900262832642, "epoch": 5.635132463424278, "grad_norm": 0.96875, "learning_rate": 0.00023339397478905588, "loss": 4.7067, "mean_token_accuracy": 0.24994042068719863, "num_tokens": 130582269.0, "step": 57005 }, { "entropy": 5.271239280700684, "epoch": 5.635626729932779, "grad_norm": 1.0859375, "learning_rate": 0.00023335929391576273, "loss": 4.6654, "mean_token_accuracy": 0.2483162224292755, "num_tokens": 130594894.0, "step": 57010 }, { "entropy": 5.405216550827026, "epoch": 5.6361209964412815, "grad_norm": 1.171875, "learning_rate": 0.00023332461406683748, "loss": 4.8599, "mean_token_accuracy": 0.23327201902866362, "num_tokens": 130607720.0, "step": 57015 }, { "entropy": 5.355471134185791, "epoch": 5.636615262949783, "grad_norm": 1.171875, "learning_rate": 0.00023328993524313312, "loss": 4.7156, "mean_token_accuracy": 0.24536579847335815, "num_tokens": 130618341.0, "step": 57020 }, { "entropy": 5.342041110992431, "epoch": 5.637109529458284, "grad_norm": 1.1796875, "learning_rate": 0.00023325525744550285, "loss": 4.7245, "mean_token_accuracy": 0.24445382058620452, "num_tokens": 130629809.0, "step": 57025 }, { "entropy": 5.181710815429687, "epoch": 5.637603795966785, "grad_norm": 1.0546875, "learning_rate": 0.0002332205806747997, "loss": 4.6387, "mean_token_accuracy": 0.25795392841100695, "num_tokens": 130642238.0, "step": 57030 }, { "entropy": 5.293557119369507, "epoch": 5.6380980624752866, "grad_norm": 1.109375, "learning_rate": 0.00023318590493187676, "loss": 4.7056, "mean_token_accuracy": 0.24439736008644103, "num_tokens": 130653202.0, "step": 57035 }, { "entropy": 5.334222650527954, "epoch": 5.638592328983788, "grad_norm": 1.046875, "learning_rate": 0.00023315123021758706, "loss": 4.6735, "mean_token_accuracy": 0.24791480004787445, "num_tokens": 130665769.0, "step": 57040 }, { "entropy": 5.355919456481933, "epoch": 5.639086595492289, "grad_norm": 1.140625, "learning_rate": 0.00023311655653278357, "loss": 4.7174, "mean_token_accuracy": 0.24568842500448226, "num_tokens": 130677429.0, "step": 57045 }, { "entropy": 5.255595350265503, "epoch": 5.639580862000791, "grad_norm": 1.15625, "learning_rate": 0.00023308188387831936, "loss": 4.697, "mean_token_accuracy": 0.24802872389554978, "num_tokens": 130687723.0, "step": 57050 }, { "entropy": 5.293422222137451, "epoch": 5.6400751285092925, "grad_norm": 1.2109375, "learning_rate": 0.0002330472122550472, "loss": 4.6234, "mean_token_accuracy": 0.25919986218214036, "num_tokens": 130697979.0, "step": 57055 }, { "entropy": 5.206180047988892, "epoch": 5.640569395017794, "grad_norm": 1.234375, "learning_rate": 0.00023301254166382008, "loss": 4.5733, "mean_token_accuracy": 0.25825880020856856, "num_tokens": 130708669.0, "step": 57060 }, { "entropy": 5.275370788574219, "epoch": 5.641063661526295, "grad_norm": 1.1953125, "learning_rate": 0.00023297787210549108, "loss": 4.6488, "mean_token_accuracy": 0.25789414942264555, "num_tokens": 130719263.0, "step": 57065 }, { "entropy": 5.2923112392425535, "epoch": 5.641557928034796, "grad_norm": 1.1171875, "learning_rate": 0.00023294320358091292, "loss": 4.7318, "mean_token_accuracy": 0.250382062792778, "num_tokens": 130730949.0, "step": 57070 }, { "entropy": 5.2930131435394285, "epoch": 5.6420521945432975, "grad_norm": 1.0546875, "learning_rate": 0.00023290853609093847, "loss": 4.7196, "mean_token_accuracy": 0.2486476257443428, "num_tokens": 130743707.0, "step": 57075 }, { "entropy": 5.328030061721802, "epoch": 5.642546461051799, "grad_norm": 1.1171875, "learning_rate": 0.0002328738696364206, "loss": 4.7441, "mean_token_accuracy": 0.24371728599071502, "num_tokens": 130755504.0, "step": 57080 }, { "entropy": 5.3394266128540036, "epoch": 5.643040727560301, "grad_norm": 1.2734375, "learning_rate": 0.00023283920421821193, "loss": 4.7017, "mean_token_accuracy": 0.24869904965162276, "num_tokens": 130765627.0, "step": 57085 }, { "entropy": 5.333390617370606, "epoch": 5.643534994068802, "grad_norm": 1.2265625, "learning_rate": 0.00023280453983716548, "loss": 4.708, "mean_token_accuracy": 0.246653014421463, "num_tokens": 130777120.0, "step": 57090 }, { "entropy": 5.278913593292236, "epoch": 5.6440292605773035, "grad_norm": 1.1328125, "learning_rate": 0.00023276987649413394, "loss": 4.6807, "mean_token_accuracy": 0.25254703015089036, "num_tokens": 130787488.0, "step": 57095 }, { "entropy": 5.218399858474731, "epoch": 5.644523527085805, "grad_norm": 1.1875, "learning_rate": 0.00023273521418996996, "loss": 4.5963, "mean_token_accuracy": 0.25879122912883756, "num_tokens": 130797995.0, "step": 57100 }, { "entropy": 5.307299613952637, "epoch": 5.645017793594306, "grad_norm": 1.1484375, "learning_rate": 0.0002327005529255262, "loss": 4.7567, "mean_token_accuracy": 0.24614608138799668, "num_tokens": 130810260.0, "step": 57105 }, { "entropy": 5.307709169387818, "epoch": 5.645512060102807, "grad_norm": 1.015625, "learning_rate": 0.0002326658927016555, "loss": 4.7299, "mean_token_accuracy": 0.2453875184059143, "num_tokens": 130823028.0, "step": 57110 }, { "entropy": 5.328354692459106, "epoch": 5.6460063266113085, "grad_norm": 1.15625, "learning_rate": 0.00023263123351921028, "loss": 4.6914, "mean_token_accuracy": 0.2477450281381607, "num_tokens": 130834368.0, "step": 57115 }, { "entropy": 5.3643982887268065, "epoch": 5.646500593119811, "grad_norm": 1.078125, "learning_rate": 0.00023259657537904338, "loss": 4.7415, "mean_token_accuracy": 0.24438949823379516, "num_tokens": 130844998.0, "step": 57120 }, { "entropy": 5.343300294876099, "epoch": 5.646994859628312, "grad_norm": 1.0546875, "learning_rate": 0.00023256191828200734, "loss": 4.7481, "mean_token_accuracy": 0.24246952831745147, "num_tokens": 130856416.0, "step": 57125 }, { "entropy": 5.318797016143799, "epoch": 5.647489126136813, "grad_norm": 1.0859375, "learning_rate": 0.0002325272622289546, "loss": 4.7584, "mean_token_accuracy": 0.24443450570106506, "num_tokens": 130868718.0, "step": 57130 }, { "entropy": 5.239288997650147, "epoch": 5.6479833926453145, "grad_norm": 1.078125, "learning_rate": 0.00023249260722073783, "loss": 4.6086, "mean_token_accuracy": 0.261251924932003, "num_tokens": 130879867.0, "step": 57135 }, { "entropy": 5.309328603744507, "epoch": 5.648477659153816, "grad_norm": 1.140625, "learning_rate": 0.00023245795325820963, "loss": 4.7739, "mean_token_accuracy": 0.23520867824554442, "num_tokens": 130891582.0, "step": 57140 }, { "entropy": 5.303898906707763, "epoch": 5.648971925662317, "grad_norm": 1.09375, "learning_rate": 0.00023242330034222214, "loss": 4.6905, "mean_token_accuracy": 0.24824101030826567, "num_tokens": 130903922.0, "step": 57145 }, { "entropy": 5.301079416275025, "epoch": 5.649466192170818, "grad_norm": 1.1171875, "learning_rate": 0.00023238864847362824, "loss": 4.7007, "mean_token_accuracy": 0.24796098172664643, "num_tokens": 130915182.0, "step": 57150 }, { "entropy": 5.335935735702515, "epoch": 5.6499604586793195, "grad_norm": 1.0390625, "learning_rate": 0.00023235399765328014, "loss": 4.682, "mean_token_accuracy": 0.25097973495721815, "num_tokens": 130926842.0, "step": 57155 }, { "entropy": 5.284447431564331, "epoch": 5.650454725187822, "grad_norm": 1.203125, "learning_rate": 0.00023231934788203035, "loss": 4.6875, "mean_token_accuracy": 0.25076640844345094, "num_tokens": 130939009.0, "step": 57160 }, { "entropy": 5.223640632629395, "epoch": 5.650948991696323, "grad_norm": 1.0546875, "learning_rate": 0.00023228469916073124, "loss": 4.5797, "mean_token_accuracy": 0.2515497386455536, "num_tokens": 130950795.0, "step": 57165 }, { "entropy": 5.227486801147461, "epoch": 5.651443258204824, "grad_norm": 1.171875, "learning_rate": 0.00023225005149023515, "loss": 4.6027, "mean_token_accuracy": 0.2558708056807518, "num_tokens": 130961434.0, "step": 57170 }, { "entropy": 5.3674671173095705, "epoch": 5.6519375247133254, "grad_norm": 1.0625, "learning_rate": 0.00023221540487139436, "loss": 4.7869, "mean_token_accuracy": 0.24396152347326278, "num_tokens": 130973868.0, "step": 57175 }, { "entropy": 5.311964607238769, "epoch": 5.652431791221827, "grad_norm": 1.1953125, "learning_rate": 0.00023218075930506123, "loss": 4.7085, "mean_token_accuracy": 0.25285303592681885, "num_tokens": 130986117.0, "step": 57180 }, { "entropy": 5.239650106430053, "epoch": 5.652926057730328, "grad_norm": 1.1328125, "learning_rate": 0.00023214611479208818, "loss": 4.6359, "mean_token_accuracy": 0.257244573533535, "num_tokens": 130997787.0, "step": 57185 }, { "entropy": 5.258141279220581, "epoch": 5.653420324238829, "grad_norm": 1.1796875, "learning_rate": 0.00023211147133332734, "loss": 4.6587, "mean_token_accuracy": 0.2554791808128357, "num_tokens": 131008751.0, "step": 57190 }, { "entropy": 5.298512315750122, "epoch": 5.6539145907473305, "grad_norm": 1.1796875, "learning_rate": 0.0002320768289296309, "loss": 4.692, "mean_token_accuracy": 0.24980676621198655, "num_tokens": 131019588.0, "step": 57195 }, { "entropy": 5.282025623321533, "epoch": 5.654408857255833, "grad_norm": 1.1328125, "learning_rate": 0.00023204218758185113, "loss": 4.6316, "mean_token_accuracy": 0.259344208240509, "num_tokens": 131029972.0, "step": 57200 }, { "entropy": 5.268991613388062, "epoch": 5.654903123764334, "grad_norm": 1.1796875, "learning_rate": 0.00023200754729084017, "loss": 4.6652, "mean_token_accuracy": 0.25213237255811694, "num_tokens": 131042012.0, "step": 57205 }, { "entropy": 5.343695545196534, "epoch": 5.655397390272835, "grad_norm": 1.203125, "learning_rate": 0.0002319729080574503, "loss": 4.7792, "mean_token_accuracy": 0.24294638335704805, "num_tokens": 131054474.0, "step": 57210 }, { "entropy": 5.297196006774902, "epoch": 5.655891656781336, "grad_norm": 1.0546875, "learning_rate": 0.00023193826988253353, "loss": 4.7478, "mean_token_accuracy": 0.248092482984066, "num_tokens": 131066886.0, "step": 57215 }, { "entropy": 5.323228216171264, "epoch": 5.656385923289838, "grad_norm": 1.203125, "learning_rate": 0.000231903632766942, "loss": 4.7009, "mean_token_accuracy": 0.24539440423250197, "num_tokens": 131078310.0, "step": 57220 }, { "entropy": 5.285614967346191, "epoch": 5.656880189798339, "grad_norm": 1.1171875, "learning_rate": 0.00023186899671152783, "loss": 4.6921, "mean_token_accuracy": 0.24899947345256807, "num_tokens": 131090497.0, "step": 57225 }, { "entropy": 5.2523010730743405, "epoch": 5.65737445630684, "grad_norm": 1.1015625, "learning_rate": 0.00023183436171714288, "loss": 4.6621, "mean_token_accuracy": 0.25928337275981905, "num_tokens": 131102794.0, "step": 57230 }, { "entropy": 5.263782787322998, "epoch": 5.657868722815342, "grad_norm": 1.1328125, "learning_rate": 0.00023179972778463953, "loss": 4.6872, "mean_token_accuracy": 0.24300441443920134, "num_tokens": 131113517.0, "step": 57235 }, { "entropy": 5.251773023605347, "epoch": 5.658362989323844, "grad_norm": 1.0625, "learning_rate": 0.00023176509491486952, "loss": 4.63, "mean_token_accuracy": 0.2562224820256233, "num_tokens": 131124724.0, "step": 57240 }, { "entropy": 5.333812713623047, "epoch": 5.658857255832345, "grad_norm": 1.1953125, "learning_rate": 0.00023173046310868484, "loss": 4.7822, "mean_token_accuracy": 0.2442709684371948, "num_tokens": 131136807.0, "step": 57245 }, { "entropy": 5.400388908386231, "epoch": 5.659351522340846, "grad_norm": 1.1953125, "learning_rate": 0.00023169583236693752, "loss": 4.796, "mean_token_accuracy": 0.24467578083276748, "num_tokens": 131149762.0, "step": 57250 }, { "entropy": 5.28330283164978, "epoch": 5.659845788849347, "grad_norm": 1.234375, "learning_rate": 0.00023166120269047942, "loss": 4.6906, "mean_token_accuracy": 0.2521614745259285, "num_tokens": 131160760.0, "step": 57255 }, { "entropy": 5.3610138416290285, "epoch": 5.660340055357849, "grad_norm": 1.03125, "learning_rate": 0.00023162657408016242, "loss": 4.773, "mean_token_accuracy": 0.24443921446800232, "num_tokens": 131172445.0, "step": 57260 }, { "entropy": 5.279070901870727, "epoch": 5.66083432186635, "grad_norm": 1.2890625, "learning_rate": 0.00023159194653683845, "loss": 4.6978, "mean_token_accuracy": 0.24487993270158767, "num_tokens": 131183325.0, "step": 57265 }, { "entropy": 5.245789051055908, "epoch": 5.661328588374852, "grad_norm": 1.0625, "learning_rate": 0.00023155732006135933, "loss": 4.6368, "mean_token_accuracy": 0.25267777889966964, "num_tokens": 131194880.0, "step": 57270 }, { "entropy": 5.256219434738159, "epoch": 5.661822854883353, "grad_norm": 0.99609375, "learning_rate": 0.00023152269465457693, "loss": 4.6466, "mean_token_accuracy": 0.2577242121100426, "num_tokens": 131207104.0, "step": 57275 }, { "entropy": 5.3094298362731935, "epoch": 5.662317121391855, "grad_norm": 1.0234375, "learning_rate": 0.00023148807031734292, "loss": 4.7594, "mean_token_accuracy": 0.23906680941581726, "num_tokens": 131218847.0, "step": 57280 }, { "entropy": 5.272982931137085, "epoch": 5.662811387900356, "grad_norm": 1.0703125, "learning_rate": 0.0002314534470505092, "loss": 4.6841, "mean_token_accuracy": 0.2536267966032028, "num_tokens": 131230197.0, "step": 57285 }, { "entropy": 5.365924978256226, "epoch": 5.663305654408857, "grad_norm": 1.0703125, "learning_rate": 0.00023141882485492733, "loss": 4.6939, "mean_token_accuracy": 0.2446802571415901, "num_tokens": 131241729.0, "step": 57290 }, { "entropy": 5.316468954086304, "epoch": 5.663799920917358, "grad_norm": 1.0625, "learning_rate": 0.0002313842037314492, "loss": 4.6807, "mean_token_accuracy": 0.2546107694506645, "num_tokens": 131253394.0, "step": 57295 }, { "entropy": 5.207607316970825, "epoch": 5.66429418742586, "grad_norm": 1.0859375, "learning_rate": 0.00023134958368092645, "loss": 4.6158, "mean_token_accuracy": 0.2526862308382988, "num_tokens": 131265007.0, "step": 57300 }, { "entropy": 5.1877508640289305, "epoch": 5.664788453934362, "grad_norm": 1.1796875, "learning_rate": 0.00023131496470421065, "loss": 4.5561, "mean_token_accuracy": 0.26491944640874865, "num_tokens": 131276452.0, "step": 57305 }, { "entropy": 5.33934383392334, "epoch": 5.665282720442863, "grad_norm": 1.09375, "learning_rate": 0.00023128034680215359, "loss": 4.687, "mean_token_accuracy": 0.24585478901863098, "num_tokens": 131288004.0, "step": 57310 }, { "entropy": 5.384471321105957, "epoch": 5.665776986951364, "grad_norm": 1.2109375, "learning_rate": 0.00023124572997560672, "loss": 4.8087, "mean_token_accuracy": 0.24061752259731292, "num_tokens": 131300764.0, "step": 57315 }, { "entropy": 5.3328444480896, "epoch": 5.666271253459866, "grad_norm": 1.0390625, "learning_rate": 0.00023121111422542157, "loss": 4.7291, "mean_token_accuracy": 0.24947358220815657, "num_tokens": 131312561.0, "step": 57320 }, { "entropy": 5.283848571777344, "epoch": 5.666765519968367, "grad_norm": 1.0625, "learning_rate": 0.00023117649955244995, "loss": 4.681, "mean_token_accuracy": 0.2533491149544716, "num_tokens": 131324496.0, "step": 57325 }, { "entropy": 5.222231197357178, "epoch": 5.667259786476868, "grad_norm": 1.078125, "learning_rate": 0.0002311418859575432, "loss": 4.6107, "mean_token_accuracy": 0.25884408950805665, "num_tokens": 131335284.0, "step": 57330 }, { "entropy": 5.279043579101563, "epoch": 5.667754052985369, "grad_norm": 1.1875, "learning_rate": 0.0002311072734415529, "loss": 4.6949, "mean_token_accuracy": 0.25191054344177244, "num_tokens": 131345676.0, "step": 57335 }, { "entropy": 5.372975635528564, "epoch": 5.6682483194938715, "grad_norm": 1.0703125, "learning_rate": 0.00023107266200533044, "loss": 4.7696, "mean_token_accuracy": 0.23716354072093965, "num_tokens": 131357691.0, "step": 57340 }, { "entropy": 5.349139785766601, "epoch": 5.668742586002373, "grad_norm": 1.1875, "learning_rate": 0.0002310380516497273, "loss": 4.6885, "mean_token_accuracy": 0.2494807705283165, "num_tokens": 131368748.0, "step": 57345 }, { "entropy": 5.271928501129151, "epoch": 5.669236852510874, "grad_norm": 1.125, "learning_rate": 0.0002310034423755949, "loss": 4.6197, "mean_token_accuracy": 0.256433567404747, "num_tokens": 131379711.0, "step": 57350 }, { "entropy": 5.238827562332153, "epoch": 5.669731119019375, "grad_norm": 1.109375, "learning_rate": 0.00023096883418378467, "loss": 4.6108, "mean_token_accuracy": 0.26292259246110916, "num_tokens": 131390550.0, "step": 57355 }, { "entropy": 5.2278341293334964, "epoch": 5.670225385527877, "grad_norm": 1.2578125, "learning_rate": 0.000230934227075148, "loss": 4.5956, "mean_token_accuracy": 0.26009865254163744, "num_tokens": 131400444.0, "step": 57360 }, { "entropy": 5.293358325958252, "epoch": 5.670719652036378, "grad_norm": 1.046875, "learning_rate": 0.00023089962105053607, "loss": 4.6402, "mean_token_accuracy": 0.2548224270343781, "num_tokens": 131411908.0, "step": 57365 }, { "entropy": 5.245597314834595, "epoch": 5.671213918544879, "grad_norm": 1.109375, "learning_rate": 0.0002308650161108004, "loss": 4.621, "mean_token_accuracy": 0.25818119049072263, "num_tokens": 131422956.0, "step": 57370 }, { "entropy": 5.195031929016113, "epoch": 5.671708185053381, "grad_norm": 1.015625, "learning_rate": 0.0002308304122567922, "loss": 4.5843, "mean_token_accuracy": 0.2575164660811424, "num_tokens": 131433658.0, "step": 57375 }, { "entropy": 5.298720073699951, "epoch": 5.6722024515618825, "grad_norm": 1.1171875, "learning_rate": 0.0002307958094893625, "loss": 4.6837, "mean_token_accuracy": 0.24698431342840194, "num_tokens": 131444270.0, "step": 57380 }, { "entropy": 5.324151611328125, "epoch": 5.672696718070384, "grad_norm": 1.1328125, "learning_rate": 0.00023076120780936293, "loss": 4.7604, "mean_token_accuracy": 0.2489669516682625, "num_tokens": 131457437.0, "step": 57385 }, { "entropy": 5.293859148025513, "epoch": 5.673190984578885, "grad_norm": 1.203125, "learning_rate": 0.0002307266072176445, "loss": 4.6352, "mean_token_accuracy": 0.2583257108926773, "num_tokens": 131467421.0, "step": 57390 }, { "entropy": 5.355331325531006, "epoch": 5.673685251087386, "grad_norm": 1.0859375, "learning_rate": 0.0002306920077150584, "loss": 4.7781, "mean_token_accuracy": 0.24647438824176787, "num_tokens": 131479254.0, "step": 57395 }, { "entropy": 5.334286642074585, "epoch": 5.674179517595888, "grad_norm": 1.25, "learning_rate": 0.00023065740930245578, "loss": 4.7006, "mean_token_accuracy": 0.2532671481370926, "num_tokens": 131490731.0, "step": 57400 }, { "entropy": 5.296295118331909, "epoch": 5.674673784104389, "grad_norm": 1.296875, "learning_rate": 0.00023062281198068767, "loss": 4.7062, "mean_token_accuracy": 0.24375918805599212, "num_tokens": 131501173.0, "step": 57405 }, { "entropy": 5.331467580795288, "epoch": 5.67516805061289, "grad_norm": 1.0625, "learning_rate": 0.0002305882157506054, "loss": 4.7449, "mean_token_accuracy": 0.24451270550489426, "num_tokens": 131512973.0, "step": 57410 }, { "entropy": 5.2957679271698, "epoch": 5.675662317121392, "grad_norm": 1.0625, "learning_rate": 0.0002305536206130598, "loss": 4.6665, "mean_token_accuracy": 0.2569324404001236, "num_tokens": 131525889.0, "step": 57415 }, { "entropy": 5.3215651512146, "epoch": 5.6761565836298935, "grad_norm": 1.140625, "learning_rate": 0.0002305190265689021, "loss": 4.7114, "mean_token_accuracy": 0.24600157737731934, "num_tokens": 131536179.0, "step": 57420 }, { "entropy": 5.29550404548645, "epoch": 5.676650850138395, "grad_norm": 1.140625, "learning_rate": 0.00023048443361898331, "loss": 4.7033, "mean_token_accuracy": 0.24976979047060013, "num_tokens": 131547743.0, "step": 57425 }, { "entropy": 5.328491449356079, "epoch": 5.677145116646896, "grad_norm": 1.0078125, "learning_rate": 0.00023044984176415429, "loss": 4.7846, "mean_token_accuracy": 0.24885974526405336, "num_tokens": 131562072.0, "step": 57430 }, { "entropy": 5.271196413040161, "epoch": 5.677639383155397, "grad_norm": 1.15625, "learning_rate": 0.000230415251005266, "loss": 4.6708, "mean_token_accuracy": 0.2547661244869232, "num_tokens": 131573990.0, "step": 57435 }, { "entropy": 5.336210441589356, "epoch": 5.6781336496638986, "grad_norm": 1.09375, "learning_rate": 0.00023038066134316955, "loss": 4.7784, "mean_token_accuracy": 0.2514977648854256, "num_tokens": 131584720.0, "step": 57440 }, { "entropy": 5.320510530471802, "epoch": 5.6786279161724, "grad_norm": 1.1484375, "learning_rate": 0.00023034607277871573, "loss": 4.7418, "mean_token_accuracy": 0.24393243342638016, "num_tokens": 131595322.0, "step": 57445 }, { "entropy": 5.262543201446533, "epoch": 5.679122182680901, "grad_norm": 1.1015625, "learning_rate": 0.00023031148531275542, "loss": 4.658, "mean_token_accuracy": 0.25571413040161134, "num_tokens": 131607110.0, "step": 57450 }, { "entropy": 5.239520645141601, "epoch": 5.679616449189403, "grad_norm": 1.1328125, "learning_rate": 0.00023027689894613958, "loss": 4.6433, "mean_token_accuracy": 0.2519590064883232, "num_tokens": 131618130.0, "step": 57455 }, { "entropy": 5.3254376411437985, "epoch": 5.6801107156979045, "grad_norm": 1.234375, "learning_rate": 0.00023024231367971894, "loss": 4.7099, "mean_token_accuracy": 0.25127306431531904, "num_tokens": 131630295.0, "step": 57460 }, { "entropy": 5.28895320892334, "epoch": 5.680604982206406, "grad_norm": 1.109375, "learning_rate": 0.0002302077295143442, "loss": 4.602, "mean_token_accuracy": 0.2579094782471657, "num_tokens": 131642741.0, "step": 57465 }, { "entropy": 5.323436164855957, "epoch": 5.681099248714907, "grad_norm": 1.21875, "learning_rate": 0.00023017314645086635, "loss": 4.767, "mean_token_accuracy": 0.24421938210725785, "num_tokens": 131653730.0, "step": 57470 }, { "entropy": 5.344371938705445, "epoch": 5.681593515223408, "grad_norm": 1.0078125, "learning_rate": 0.0002301385644901361, "loss": 4.7188, "mean_token_accuracy": 0.24580823332071305, "num_tokens": 131664713.0, "step": 57475 }, { "entropy": 5.291471719741821, "epoch": 5.6820877817319095, "grad_norm": 1.3046875, "learning_rate": 0.0002301039836330041, "loss": 4.675, "mean_token_accuracy": 0.25116465240716934, "num_tokens": 131675873.0, "step": 57480 }, { "entropy": 5.308986043930053, "epoch": 5.682582048240411, "grad_norm": 1.0546875, "learning_rate": 0.00023006940388032104, "loss": 4.6696, "mean_token_accuracy": 0.24944207966327667, "num_tokens": 131686892.0, "step": 57485 }, { "entropy": 5.330875015258789, "epoch": 5.683076314748913, "grad_norm": 1.1171875, "learning_rate": 0.00023003482523293768, "loss": 4.6422, "mean_token_accuracy": 0.25336440801620486, "num_tokens": 131698143.0, "step": 57490 }, { "entropy": 5.320070266723633, "epoch": 5.683570581257414, "grad_norm": 1.234375, "learning_rate": 0.00023000024769170447, "loss": 4.7746, "mean_token_accuracy": 0.23730231672525406, "num_tokens": 131709718.0, "step": 57495 }, { "entropy": 5.30195689201355, "epoch": 5.6840648477659155, "grad_norm": 1.1640625, "learning_rate": 0.00022996567125747227, "loss": 4.7442, "mean_token_accuracy": 0.24179655015468599, "num_tokens": 131720509.0, "step": 57500 }, { "entropy": 5.187160587310791, "epoch": 5.684559114274417, "grad_norm": 1.09375, "learning_rate": 0.00022993109593109153, "loss": 4.5161, "mean_token_accuracy": 0.2612765669822693, "num_tokens": 131732041.0, "step": 57505 }, { "entropy": 5.32707405090332, "epoch": 5.685053380782918, "grad_norm": 1.1796875, "learning_rate": 0.00022989652171341267, "loss": 4.6734, "mean_token_accuracy": 0.2527173176407814, "num_tokens": 131743822.0, "step": 57510 }, { "entropy": 5.33913288116455, "epoch": 5.685547647291419, "grad_norm": 1.171875, "learning_rate": 0.0002298619486052866, "loss": 4.7113, "mean_token_accuracy": 0.24646973013877868, "num_tokens": 131755645.0, "step": 57515 }, { "entropy": 5.309484529495239, "epoch": 5.6860419137999205, "grad_norm": 1.234375, "learning_rate": 0.0002298273766075635, "loss": 4.7191, "mean_token_accuracy": 0.242035610973835, "num_tokens": 131766124.0, "step": 57520 }, { "entropy": 5.293072080612182, "epoch": 5.686536180308423, "grad_norm": 1.3046875, "learning_rate": 0.00022979280572109383, "loss": 4.7109, "mean_token_accuracy": 0.24816635996103287, "num_tokens": 131776887.0, "step": 57525 }, { "entropy": 5.284493160247803, "epoch": 5.687030446816924, "grad_norm": 1.1796875, "learning_rate": 0.0002297582359467283, "loss": 4.7004, "mean_token_accuracy": 0.25401672422885896, "num_tokens": 131788097.0, "step": 57530 }, { "entropy": 5.2691903591156, "epoch": 5.687524713325425, "grad_norm": 1.046875, "learning_rate": 0.00022972366728531713, "loss": 4.6148, "mean_token_accuracy": 0.2613116502761841, "num_tokens": 131800262.0, "step": 57535 }, { "entropy": 5.313456916809082, "epoch": 5.6880189798339265, "grad_norm": 1.15625, "learning_rate": 0.00022968909973771078, "loss": 4.6745, "mean_token_accuracy": 0.25710651874542234, "num_tokens": 131812867.0, "step": 57540 }, { "entropy": 5.221504831314087, "epoch": 5.688513246342428, "grad_norm": 1.171875, "learning_rate": 0.0002296545333047596, "loss": 4.6097, "mean_token_accuracy": 0.26509764790534973, "num_tokens": 131823433.0, "step": 57545 }, { "entropy": 5.256739950180053, "epoch": 5.689007512850929, "grad_norm": 1.0546875, "learning_rate": 0.0002296199679873139, "loss": 4.5948, "mean_token_accuracy": 0.2565651834011078, "num_tokens": 131834864.0, "step": 57550 }, { "entropy": 5.272516345977783, "epoch": 5.68950177935943, "grad_norm": 1.109375, "learning_rate": 0.00022958540378622405, "loss": 4.6829, "mean_token_accuracy": 0.2519970864057541, "num_tokens": 131846035.0, "step": 57555 }, { "entropy": 5.234661054611206, "epoch": 5.689996045867932, "grad_norm": 1.1796875, "learning_rate": 0.00022955084070234034, "loss": 4.5597, "mean_token_accuracy": 0.25638065338134763, "num_tokens": 131857086.0, "step": 57560 }, { "entropy": 5.346517896652221, "epoch": 5.690490312376434, "grad_norm": 1.1640625, "learning_rate": 0.00022951627873651304, "loss": 4.7703, "mean_token_accuracy": 0.24208673387765883, "num_tokens": 131867886.0, "step": 57565 }, { "entropy": 5.233294439315796, "epoch": 5.690984578884935, "grad_norm": 1.1484375, "learning_rate": 0.00022948171788959228, "loss": 4.5934, "mean_token_accuracy": 0.25213466584682465, "num_tokens": 131878742.0, "step": 57570 }, { "entropy": 5.314962148666382, "epoch": 5.691478845393436, "grad_norm": 1.2109375, "learning_rate": 0.00022944715816242828, "loss": 4.674, "mean_token_accuracy": 0.2510431483387947, "num_tokens": 131890028.0, "step": 57575 }, { "entropy": 5.272064924240112, "epoch": 5.691973111901937, "grad_norm": 1.0546875, "learning_rate": 0.0002294125995558713, "loss": 4.7215, "mean_token_accuracy": 0.24326545149087905, "num_tokens": 131902133.0, "step": 57580 }, { "entropy": 5.308411550521851, "epoch": 5.692467378410439, "grad_norm": 1.2578125, "learning_rate": 0.00022937804207077145, "loss": 4.692, "mean_token_accuracy": 0.2578414767980576, "num_tokens": 131912698.0, "step": 57585 }, { "entropy": 5.373046159744263, "epoch": 5.69296164491894, "grad_norm": 1.1875, "learning_rate": 0.00022934348570797887, "loss": 4.8242, "mean_token_accuracy": 0.23352410197257994, "num_tokens": 131924323.0, "step": 57590 }, { "entropy": 5.256537961959839, "epoch": 5.693455911427442, "grad_norm": 1.078125, "learning_rate": 0.0002293089304683436, "loss": 4.6869, "mean_token_accuracy": 0.2556072503328323, "num_tokens": 131935485.0, "step": 57595 }, { "entropy": 5.29494571685791, "epoch": 5.693950177935943, "grad_norm": 1.203125, "learning_rate": 0.0002292743763527157, "loss": 4.6465, "mean_token_accuracy": 0.250989256799221, "num_tokens": 131947087.0, "step": 57600 }, { "entropy": 5.365462589263916, "epoch": 5.694444444444445, "grad_norm": 1.078125, "learning_rate": 0.00022923982336194525, "loss": 4.7057, "mean_token_accuracy": 0.24797246158123015, "num_tokens": 131959031.0, "step": 57605 }, { "entropy": 5.239974403381348, "epoch": 5.694938710952946, "grad_norm": 1.140625, "learning_rate": 0.0002292052714968822, "loss": 4.6597, "mean_token_accuracy": 0.25722167193889617, "num_tokens": 131970981.0, "step": 57610 }, { "entropy": 5.235261678695679, "epoch": 5.695432977461447, "grad_norm": 1.0625, "learning_rate": 0.00022917072075837665, "loss": 4.6875, "mean_token_accuracy": 0.24762078672647475, "num_tokens": 131983200.0, "step": 57615 }, { "entropy": 5.253287649154663, "epoch": 5.695927243969948, "grad_norm": 1.1328125, "learning_rate": 0.00022913617114727852, "loss": 4.5952, "mean_token_accuracy": 0.25602046251296995, "num_tokens": 131993716.0, "step": 57620 }, { "entropy": 5.283644676208496, "epoch": 5.69642151047845, "grad_norm": 1.0625, "learning_rate": 0.00022910162266443756, "loss": 4.6364, "mean_token_accuracy": 0.2551823452115059, "num_tokens": 132005399.0, "step": 57625 }, { "entropy": 5.3147759437561035, "epoch": 5.696915776986952, "grad_norm": 1.203125, "learning_rate": 0.00022906707531070392, "loss": 4.6721, "mean_token_accuracy": 0.2518556103110313, "num_tokens": 132016446.0, "step": 57630 }, { "entropy": 5.278943824768066, "epoch": 5.697410043495453, "grad_norm": 1.109375, "learning_rate": 0.00022903252908692734, "loss": 4.6099, "mean_token_accuracy": 0.25134730488061907, "num_tokens": 132026647.0, "step": 57635 }, { "entropy": 5.25604567527771, "epoch": 5.697904310003954, "grad_norm": 1.125, "learning_rate": 0.0002289979839939576, "loss": 4.655, "mean_token_accuracy": 0.24408329725265504, "num_tokens": 132038288.0, "step": 57640 }, { "entropy": 5.259721946716309, "epoch": 5.698398576512456, "grad_norm": 1.125, "learning_rate": 0.00022896344003264462, "loss": 4.6645, "mean_token_accuracy": 0.25758891403675077, "num_tokens": 132050207.0, "step": 57645 }, { "entropy": 5.3420322895050045, "epoch": 5.698892843020957, "grad_norm": 1.140625, "learning_rate": 0.0002289288972038382, "loss": 4.7595, "mean_token_accuracy": 0.2405192568898201, "num_tokens": 132061836.0, "step": 57650 }, { "entropy": 5.323115634918213, "epoch": 5.699387109529458, "grad_norm": 1.1953125, "learning_rate": 0.000228894355508388, "loss": 4.7351, "mean_token_accuracy": 0.24673528969287872, "num_tokens": 132072207.0, "step": 57655 }, { "entropy": 5.29438967704773, "epoch": 5.699881376037959, "grad_norm": 1.2578125, "learning_rate": 0.00022885981494714385, "loss": 4.7204, "mean_token_accuracy": 0.24790043979883195, "num_tokens": 132082160.0, "step": 57660 }, { "entropy": 5.3335247993469235, "epoch": 5.700375642546461, "grad_norm": 1.0859375, "learning_rate": 0.00022882527552095543, "loss": 4.7602, "mean_token_accuracy": 0.254617315530777, "num_tokens": 132093025.0, "step": 57665 }, { "entropy": 5.252161359786987, "epoch": 5.700869909054962, "grad_norm": 1.1796875, "learning_rate": 0.00022879073723067235, "loss": 4.6354, "mean_token_accuracy": 0.2481996551156044, "num_tokens": 132103723.0, "step": 57670 }, { "entropy": 5.351355457305909, "epoch": 5.701364175563464, "grad_norm": 1.1171875, "learning_rate": 0.00022875620007714427, "loss": 4.7846, "mean_token_accuracy": 0.23931209444999696, "num_tokens": 132114548.0, "step": 57675 }, { "entropy": 5.329810285568238, "epoch": 5.701858442071965, "grad_norm": 1.109375, "learning_rate": 0.00022872166406122092, "loss": 4.7289, "mean_token_accuracy": 0.2378512591123581, "num_tokens": 132127495.0, "step": 57680 }, { "entropy": 5.367780256271362, "epoch": 5.702352708580467, "grad_norm": 1.171875, "learning_rate": 0.0002286871291837518, "loss": 4.7335, "mean_token_accuracy": 0.2389159619808197, "num_tokens": 132138900.0, "step": 57685 }, { "entropy": 5.321587085723877, "epoch": 5.702846975088968, "grad_norm": 1.09375, "learning_rate": 0.00022865259544558648, "loss": 4.7472, "mean_token_accuracy": 0.24241352528333665, "num_tokens": 132150977.0, "step": 57690 }, { "entropy": 5.274596452713013, "epoch": 5.703341241597469, "grad_norm": 0.99609375, "learning_rate": 0.00022861806284757446, "loss": 4.5997, "mean_token_accuracy": 0.2581463098526001, "num_tokens": 132161680.0, "step": 57695 }, { "entropy": 5.291191053390503, "epoch": 5.70383550810597, "grad_norm": 1.0703125, "learning_rate": 0.00022858353139056526, "loss": 4.6426, "mean_token_accuracy": 0.2574837237596512, "num_tokens": 132173456.0, "step": 57700 }, { "entropy": 5.27687029838562, "epoch": 5.704329774614472, "grad_norm": 1.1796875, "learning_rate": 0.0002285490010754085, "loss": 4.6492, "mean_token_accuracy": 0.2505652293562889, "num_tokens": 132183189.0, "step": 57705 }, { "entropy": 5.234519958496094, "epoch": 5.704824041122974, "grad_norm": 1.21875, "learning_rate": 0.00022851447190295348, "loss": 4.5924, "mean_token_accuracy": 0.2618658602237701, "num_tokens": 132193731.0, "step": 57710 }, { "entropy": 5.392923164367676, "epoch": 5.705318307631475, "grad_norm": 1.234375, "learning_rate": 0.00022847994387404969, "loss": 4.7442, "mean_token_accuracy": 0.2513666033744812, "num_tokens": 132204583.0, "step": 57715 }, { "entropy": 5.382221651077271, "epoch": 5.705812574139976, "grad_norm": 1.1015625, "learning_rate": 0.0002284454169895464, "loss": 4.8186, "mean_token_accuracy": 0.23869770914316177, "num_tokens": 132216391.0, "step": 57720 }, { "entropy": 5.222993803024292, "epoch": 5.706306840648478, "grad_norm": 1.15625, "learning_rate": 0.00022841089125029307, "loss": 4.575, "mean_token_accuracy": 0.25861298441886904, "num_tokens": 132226194.0, "step": 57725 }, { "entropy": 5.381499576568603, "epoch": 5.706801107156979, "grad_norm": 1.1171875, "learning_rate": 0.00022837636665713914, "loss": 4.7329, "mean_token_accuracy": 0.24550043940544128, "num_tokens": 132237410.0, "step": 57730 }, { "entropy": 5.3140825748443605, "epoch": 5.70729537366548, "grad_norm": 1.15625, "learning_rate": 0.00022834184321093382, "loss": 4.7919, "mean_token_accuracy": 0.2383209601044655, "num_tokens": 132249150.0, "step": 57735 }, { "entropy": 5.3323486804962155, "epoch": 5.707789640173981, "grad_norm": 1.34375, "learning_rate": 0.00022830732091252636, "loss": 4.7236, "mean_token_accuracy": 0.24225391298532487, "num_tokens": 132259637.0, "step": 57740 }, { "entropy": 5.285576009750367, "epoch": 5.7082839066824835, "grad_norm": 1.1640625, "learning_rate": 0.00022827279976276604, "loss": 4.647, "mean_token_accuracy": 0.2556407004594803, "num_tokens": 132270541.0, "step": 57745 }, { "entropy": 5.3069921970367435, "epoch": 5.708778173190985, "grad_norm": 1.1640625, "learning_rate": 0.0002282382797625021, "loss": 4.6704, "mean_token_accuracy": 0.25143683403730394, "num_tokens": 132282771.0, "step": 57750 }, { "entropy": 5.339108514785766, "epoch": 5.709272439699486, "grad_norm": 1.15625, "learning_rate": 0.00022820376091258366, "loss": 4.7135, "mean_token_accuracy": 0.24490379840135573, "num_tokens": 132293569.0, "step": 57755 }, { "entropy": 5.24137315750122, "epoch": 5.709766706207987, "grad_norm": 1.203125, "learning_rate": 0.00022816924321386007, "loss": 4.6483, "mean_token_accuracy": 0.2497807651758194, "num_tokens": 132305515.0, "step": 57760 }, { "entropy": 5.218888759613037, "epoch": 5.710260972716489, "grad_norm": 1.1484375, "learning_rate": 0.00022813472666718038, "loss": 4.6305, "mean_token_accuracy": 0.2522079050540924, "num_tokens": 132315536.0, "step": 57765 }, { "entropy": 5.254555034637451, "epoch": 5.71075523922499, "grad_norm": 1.1484375, "learning_rate": 0.00022810021127339365, "loss": 4.6402, "mean_token_accuracy": 0.24843294322490692, "num_tokens": 132326473.0, "step": 57770 }, { "entropy": 5.391016244888306, "epoch": 5.711249505733491, "grad_norm": 1.1640625, "learning_rate": 0.00022806569703334896, "loss": 4.8348, "mean_token_accuracy": 0.23935663402080537, "num_tokens": 132338649.0, "step": 57775 }, { "entropy": 5.325965452194214, "epoch": 5.711743772241993, "grad_norm": 1.2265625, "learning_rate": 0.00022803118394789545, "loss": 4.707, "mean_token_accuracy": 0.24670770019292831, "num_tokens": 132349613.0, "step": 57780 }, { "entropy": 5.269085502624511, "epoch": 5.7122380387504945, "grad_norm": 1.0703125, "learning_rate": 0.00022799667201788205, "loss": 4.6221, "mean_token_accuracy": 0.2580881118774414, "num_tokens": 132360692.0, "step": 57785 }, { "entropy": 5.314215469360351, "epoch": 5.712732305258996, "grad_norm": 1.2421875, "learning_rate": 0.00022796216124415787, "loss": 4.696, "mean_token_accuracy": 0.2503270015120506, "num_tokens": 132372389.0, "step": 57790 }, { "entropy": 5.244259357452393, "epoch": 5.713226571767497, "grad_norm": 1.03125, "learning_rate": 0.00022792765162757173, "loss": 4.6637, "mean_token_accuracy": 0.25759068727493284, "num_tokens": 132384204.0, "step": 57795 }, { "entropy": 5.35129942893982, "epoch": 5.713720838275998, "grad_norm": 1.0703125, "learning_rate": 0.0002278931431689728, "loss": 4.7364, "mean_token_accuracy": 0.24942275732755662, "num_tokens": 132396341.0, "step": 57800 }, { "entropy": 5.251275205612183, "epoch": 5.7142151047845, "grad_norm": 1.171875, "learning_rate": 0.0002278586358692098, "loss": 4.6271, "mean_token_accuracy": 0.26578756868839265, "num_tokens": 132408979.0, "step": 57805 }, { "entropy": 5.301676034927368, "epoch": 5.714709371293001, "grad_norm": 1.1953125, "learning_rate": 0.00022782412972913163, "loss": 4.6692, "mean_token_accuracy": 0.2540575638413429, "num_tokens": 132419323.0, "step": 57810 }, { "entropy": 5.20073184967041, "epoch": 5.715203637801503, "grad_norm": 1.203125, "learning_rate": 0.00022778962474958713, "loss": 4.5518, "mean_token_accuracy": 0.2642880767583847, "num_tokens": 132430448.0, "step": 57815 }, { "entropy": 5.2153040885925295, "epoch": 5.715697904310004, "grad_norm": 1.140625, "learning_rate": 0.00022775512093142525, "loss": 4.5868, "mean_token_accuracy": 0.26149684339761736, "num_tokens": 132441778.0, "step": 57820 }, { "entropy": 5.361854505538941, "epoch": 5.7161921708185055, "grad_norm": 1.046875, "learning_rate": 0.0002277206182754948, "loss": 4.8044, "mean_token_accuracy": 0.24411183148622512, "num_tokens": 132454204.0, "step": 57825 }, { "entropy": 5.2810451030731205, "epoch": 5.716686437327007, "grad_norm": 1.171875, "learning_rate": 0.00022768611678264446, "loss": 4.6501, "mean_token_accuracy": 0.255566968023777, "num_tokens": 132465819.0, "step": 57830 }, { "entropy": 5.25588846206665, "epoch": 5.717180703835508, "grad_norm": 1.15625, "learning_rate": 0.00022765161645372289, "loss": 4.5816, "mean_token_accuracy": 0.2565752431750298, "num_tokens": 132476866.0, "step": 57835 }, { "entropy": 5.245371866226196, "epoch": 5.717674970344009, "grad_norm": 1.1015625, "learning_rate": 0.000227617117289579, "loss": 4.617, "mean_token_accuracy": 0.2632001370191574, "num_tokens": 132489193.0, "step": 57840 }, { "entropy": 5.314243412017822, "epoch": 5.7181692368525106, "grad_norm": 1.140625, "learning_rate": 0.00022758261929106127, "loss": 4.7494, "mean_token_accuracy": 0.2507398098707199, "num_tokens": 132501526.0, "step": 57845 }, { "entropy": 5.299304962158203, "epoch": 5.718663503361013, "grad_norm": 1.1171875, "learning_rate": 0.0002275481224590185, "loss": 4.6435, "mean_token_accuracy": 0.25716810673475266, "num_tokens": 132511839.0, "step": 57850 }, { "entropy": 5.269137573242188, "epoch": 5.719157769869514, "grad_norm": 1.1171875, "learning_rate": 0.0002275136267942993, "loss": 4.5982, "mean_token_accuracy": 0.2539814844727516, "num_tokens": 132523291.0, "step": 57855 }, { "entropy": 5.292388248443603, "epoch": 5.719652036378015, "grad_norm": 1.1953125, "learning_rate": 0.00022747913229775226, "loss": 4.7209, "mean_token_accuracy": 0.2511627361178398, "num_tokens": 132535356.0, "step": 57860 }, { "entropy": 5.353973770141602, "epoch": 5.7201463028865165, "grad_norm": 1.09375, "learning_rate": 0.00022744463897022595, "loss": 4.7704, "mean_token_accuracy": 0.2429497942328453, "num_tokens": 132547300.0, "step": 57865 }, { "entropy": 5.279416894912719, "epoch": 5.720640569395018, "grad_norm": 1.1640625, "learning_rate": 0.00022741014681256888, "loss": 4.6346, "mean_token_accuracy": 0.2583839774131775, "num_tokens": 132558275.0, "step": 57870 }, { "entropy": 5.333483505249023, "epoch": 5.721134835903519, "grad_norm": 1.15625, "learning_rate": 0.00022737565582562952, "loss": 4.7703, "mean_token_accuracy": 0.24051328003406525, "num_tokens": 132569906.0, "step": 57875 }, { "entropy": 5.233240985870362, "epoch": 5.72162910241202, "grad_norm": 1.03125, "learning_rate": 0.0002273411660102565, "loss": 4.6713, "mean_token_accuracy": 0.2547005593776703, "num_tokens": 132582416.0, "step": 57880 }, { "entropy": 5.296777772903442, "epoch": 5.722123368920522, "grad_norm": 1.25, "learning_rate": 0.00022730667736729817, "loss": 4.7054, "mean_token_accuracy": 0.2503006488084793, "num_tokens": 132594062.0, "step": 57885 }, { "entropy": 5.339023780822754, "epoch": 5.722617635429024, "grad_norm": 1.1328125, "learning_rate": 0.00022727218989760295, "loss": 4.7441, "mean_token_accuracy": 0.24305403530597686, "num_tokens": 132605186.0, "step": 57890 }, { "entropy": 5.371877861022949, "epoch": 5.723111901937525, "grad_norm": 1.15625, "learning_rate": 0.0002272377036020193, "loss": 4.8228, "mean_token_accuracy": 0.23926340341567992, "num_tokens": 132616552.0, "step": 57895 }, { "entropy": 5.31262731552124, "epoch": 5.723606168446026, "grad_norm": 1.1484375, "learning_rate": 0.00022720321848139548, "loss": 4.7199, "mean_token_accuracy": 0.2456975147128105, "num_tokens": 132627287.0, "step": 57900 }, { "entropy": 5.314227342605591, "epoch": 5.7241004349545275, "grad_norm": 1.1171875, "learning_rate": 0.00022716873453658, "loss": 4.6743, "mean_token_accuracy": 0.2491535633802414, "num_tokens": 132638419.0, "step": 57905 }, { "entropy": 5.334973001480103, "epoch": 5.724594701463029, "grad_norm": 1.0859375, "learning_rate": 0.00022713425176842096, "loss": 4.7234, "mean_token_accuracy": 0.24549960792064668, "num_tokens": 132650437.0, "step": 57910 }, { "entropy": 5.207449245452881, "epoch": 5.72508896797153, "grad_norm": 1.203125, "learning_rate": 0.00022709977017776683, "loss": 4.5603, "mean_token_accuracy": 0.26345359832048415, "num_tokens": 132661343.0, "step": 57915 }, { "entropy": 5.266640520095825, "epoch": 5.725583234480031, "grad_norm": 1.2109375, "learning_rate": 0.0002270652897654658, "loss": 4.6198, "mean_token_accuracy": 0.2486778423190117, "num_tokens": 132671988.0, "step": 57920 }, { "entropy": 5.283928489685058, "epoch": 5.7260775009885325, "grad_norm": 1.1328125, "learning_rate": 0.00022703081053236608, "loss": 4.6993, "mean_token_accuracy": 0.25419569462537767, "num_tokens": 132682811.0, "step": 57925 }, { "entropy": 5.271061944961548, "epoch": 5.726571767497035, "grad_norm": 0.95703125, "learning_rate": 0.0002269963324793158, "loss": 4.6559, "mean_token_accuracy": 0.2576999872922897, "num_tokens": 132695044.0, "step": 57930 }, { "entropy": 5.325743770599365, "epoch": 5.727066034005536, "grad_norm": 1.1875, "learning_rate": 0.00022696185560716316, "loss": 4.711, "mean_token_accuracy": 0.24534446448087693, "num_tokens": 132706404.0, "step": 57935 }, { "entropy": 5.243336772918701, "epoch": 5.727560300514037, "grad_norm": 1.1328125, "learning_rate": 0.00022692737991675637, "loss": 4.6724, "mean_token_accuracy": 0.25097331404685974, "num_tokens": 132717872.0, "step": 57940 }, { "entropy": 5.313098621368408, "epoch": 5.7280545670225385, "grad_norm": 1.234375, "learning_rate": 0.00022689290540894353, "loss": 4.6322, "mean_token_accuracy": 0.2558547303080559, "num_tokens": 132729540.0, "step": 57945 }, { "entropy": 5.329608535766601, "epoch": 5.72854883353104, "grad_norm": 1.09375, "learning_rate": 0.00022685843208457269, "loss": 4.7765, "mean_token_accuracy": 0.2366923287510872, "num_tokens": 132742359.0, "step": 57950 }, { "entropy": 5.286142492294312, "epoch": 5.729043100039541, "grad_norm": 1.0625, "learning_rate": 0.00022682395994449184, "loss": 4.6536, "mean_token_accuracy": 0.25303875207901, "num_tokens": 132753556.0, "step": 57955 }, { "entropy": 5.238936233520508, "epoch": 5.729537366548042, "grad_norm": 1.046875, "learning_rate": 0.000226789488989549, "loss": 4.5731, "mean_token_accuracy": 0.266544009745121, "num_tokens": 132764929.0, "step": 57960 }, { "entropy": 5.269048166275025, "epoch": 5.730031633056544, "grad_norm": 1.125, "learning_rate": 0.00022675501922059227, "loss": 4.6724, "mean_token_accuracy": 0.2506330877542496, "num_tokens": 132777564.0, "step": 57965 }, { "entropy": 5.26280403137207, "epoch": 5.730525899565046, "grad_norm": 1.1171875, "learning_rate": 0.00022672055063846958, "loss": 4.6406, "mean_token_accuracy": 0.2547264575958252, "num_tokens": 132788390.0, "step": 57970 }, { "entropy": 5.2308436870574955, "epoch": 5.731020166073547, "grad_norm": 1.0390625, "learning_rate": 0.00022668608324402883, "loss": 4.5976, "mean_token_accuracy": 0.25416515618562696, "num_tokens": 132800579.0, "step": 57975 }, { "entropy": 5.279307794570923, "epoch": 5.731514432582048, "grad_norm": 1.1328125, "learning_rate": 0.00022665161703811786, "loss": 4.6527, "mean_token_accuracy": 0.2531616285443306, "num_tokens": 132812246.0, "step": 57980 }, { "entropy": 5.287713098526001, "epoch": 5.732008699090549, "grad_norm": 1.1328125, "learning_rate": 0.00022661715202158472, "loss": 4.6753, "mean_token_accuracy": 0.24618453979492189, "num_tokens": 132824002.0, "step": 57985 }, { "entropy": 5.31668062210083, "epoch": 5.732502965599051, "grad_norm": 1.2578125, "learning_rate": 0.000226582688195277, "loss": 4.7409, "mean_token_accuracy": 0.24584252536296844, "num_tokens": 132834986.0, "step": 57990 }, { "entropy": 5.258219242095947, "epoch": 5.732997232107552, "grad_norm": 1.078125, "learning_rate": 0.00022654822556004278, "loss": 4.6639, "mean_token_accuracy": 0.25393005907535554, "num_tokens": 132845600.0, "step": 57995 }, { "entropy": 5.275312900543213, "epoch": 5.733491498616054, "grad_norm": 1.0859375, "learning_rate": 0.00022651376411672968, "loss": 4.5829, "mean_token_accuracy": 0.2611844792962074, "num_tokens": 132856762.0, "step": 58000 }, { "entropy": 5.292370796203613, "epoch": 5.733985765124555, "grad_norm": 1.109375, "learning_rate": 0.00022647930386618555, "loss": 4.6397, "mean_token_accuracy": 0.24922678321599961, "num_tokens": 132867678.0, "step": 58005 }, { "entropy": 5.24238224029541, "epoch": 5.734480031633057, "grad_norm": 1.1640625, "learning_rate": 0.00022644484480925802, "loss": 4.6239, "mean_token_accuracy": 0.26207087486982344, "num_tokens": 132877159.0, "step": 58010 }, { "entropy": 5.351479005813599, "epoch": 5.734974298141558, "grad_norm": 1.1171875, "learning_rate": 0.0002264103869467949, "loss": 4.8275, "mean_token_accuracy": 0.24088934510946275, "num_tokens": 132889303.0, "step": 58015 }, { "entropy": 5.338696098327636, "epoch": 5.735468564650059, "grad_norm": 1.109375, "learning_rate": 0.00022637593027964364, "loss": 4.7402, "mean_token_accuracy": 0.24943014085292817, "num_tokens": 132900524.0, "step": 58020 }, { "entropy": 5.276890516281128, "epoch": 5.73596283115856, "grad_norm": 1.203125, "learning_rate": 0.00022634147480865224, "loss": 4.631, "mean_token_accuracy": 0.26150826513767245, "num_tokens": 132912622.0, "step": 58025 }, { "entropy": 5.220653533935547, "epoch": 5.736457097667062, "grad_norm": 1.1015625, "learning_rate": 0.00022630702053466796, "loss": 4.5731, "mean_token_accuracy": 0.2600371539592743, "num_tokens": 132924801.0, "step": 58030 }, { "entropy": 5.251607656478882, "epoch": 5.736951364175564, "grad_norm": 1.109375, "learning_rate": 0.00022627256745853865, "loss": 4.7267, "mean_token_accuracy": 0.24694907516241074, "num_tokens": 132937395.0, "step": 58035 }, { "entropy": 5.334043836593628, "epoch": 5.737445630684065, "grad_norm": 1.1328125, "learning_rate": 0.00022623811558111174, "loss": 4.6558, "mean_token_accuracy": 0.25428868979215624, "num_tokens": 132948327.0, "step": 58040 }, { "entropy": 5.325162076950074, "epoch": 5.737939897192566, "grad_norm": 1.078125, "learning_rate": 0.00022620366490323456, "loss": 4.6571, "mean_token_accuracy": 0.2517021015286446, "num_tokens": 132960211.0, "step": 58045 }, { "entropy": 5.324404764175415, "epoch": 5.738434163701068, "grad_norm": 1.0, "learning_rate": 0.00022616921542575498, "loss": 4.7157, "mean_token_accuracy": 0.2435193419456482, "num_tokens": 132973152.0, "step": 58050 }, { "entropy": 5.280606937408447, "epoch": 5.738928430209569, "grad_norm": 1.1328125, "learning_rate": 0.0002261347671495202, "loss": 4.5981, "mean_token_accuracy": 0.2579453483223915, "num_tokens": 132983824.0, "step": 58055 }, { "entropy": 5.306209373474121, "epoch": 5.73942269671807, "grad_norm": 1.2265625, "learning_rate": 0.0002261003200753778, "loss": 4.7309, "mean_token_accuracy": 0.24418546855449677, "num_tokens": 132994542.0, "step": 58060 }, { "entropy": 5.202652788162231, "epoch": 5.739916963226571, "grad_norm": 1.1484375, "learning_rate": 0.00022606587420417507, "loss": 4.5839, "mean_token_accuracy": 0.26224773973226545, "num_tokens": 133004841.0, "step": 58065 }, { "entropy": 5.267319107055664, "epoch": 5.740411229735074, "grad_norm": 1.1875, "learning_rate": 0.00022603142953675948, "loss": 4.7071, "mean_token_accuracy": 0.24935183972120284, "num_tokens": 133015645.0, "step": 58070 }, { "entropy": 5.2674889087677, "epoch": 5.740905496243575, "grad_norm": 0.9921875, "learning_rate": 0.00022599698607397818, "loss": 4.6578, "mean_token_accuracy": 0.2564949616789818, "num_tokens": 133027295.0, "step": 58075 }, { "entropy": 5.321770143508911, "epoch": 5.741399762752076, "grad_norm": 1.296875, "learning_rate": 0.00022596254381667864, "loss": 4.7143, "mean_token_accuracy": 0.2537237346172333, "num_tokens": 133038529.0, "step": 58080 }, { "entropy": 5.343195581436158, "epoch": 5.741894029260577, "grad_norm": 1.15625, "learning_rate": 0.00022592810276570824, "loss": 4.6906, "mean_token_accuracy": 0.24570745080709458, "num_tokens": 133050611.0, "step": 58085 }, { "entropy": 5.246601104736328, "epoch": 5.742388295769079, "grad_norm": 1.1640625, "learning_rate": 0.0002258936629219141, "loss": 4.6344, "mean_token_accuracy": 0.2550733879208565, "num_tokens": 133062093.0, "step": 58090 }, { "entropy": 5.209120893478394, "epoch": 5.74288256227758, "grad_norm": 1.125, "learning_rate": 0.00022585922428614347, "loss": 4.715, "mean_token_accuracy": 0.2511590525507927, "num_tokens": 133073437.0, "step": 58095 }, { "entropy": 5.321460771560669, "epoch": 5.743376828786081, "grad_norm": 1.109375, "learning_rate": 0.00022582478685924352, "loss": 4.707, "mean_token_accuracy": 0.25459638983011246, "num_tokens": 133085431.0, "step": 58100 }, { "entropy": 5.325416088104248, "epoch": 5.743871095294583, "grad_norm": 1.1015625, "learning_rate": 0.00022579035064206138, "loss": 4.7203, "mean_token_accuracy": 0.2500782698392868, "num_tokens": 133096813.0, "step": 58105 }, { "entropy": 5.291686344146728, "epoch": 5.7443653618030845, "grad_norm": 1.2734375, "learning_rate": 0.00022575591563544435, "loss": 4.5535, "mean_token_accuracy": 0.2666448295116425, "num_tokens": 133107648.0, "step": 58110 }, { "entropy": 5.225449657440185, "epoch": 5.744859628311586, "grad_norm": 1.1640625, "learning_rate": 0.00022572148184023944, "loss": 4.6019, "mean_token_accuracy": 0.25666229873895646, "num_tokens": 133119921.0, "step": 58115 }, { "entropy": 5.238275003433228, "epoch": 5.745353894820087, "grad_norm": 1.09375, "learning_rate": 0.00022568704925729366, "loss": 4.6267, "mean_token_accuracy": 0.2501747578382492, "num_tokens": 133131895.0, "step": 58120 }, { "entropy": 5.2639237403869625, "epoch": 5.745848161328588, "grad_norm": 1.15625, "learning_rate": 0.00022565261788745416, "loss": 4.6648, "mean_token_accuracy": 0.2505182340741158, "num_tokens": 133141958.0, "step": 58125 }, { "entropy": 5.331505346298218, "epoch": 5.74634242783709, "grad_norm": 1.0703125, "learning_rate": 0.00022561818773156794, "loss": 4.7743, "mean_token_accuracy": 0.2383174866437912, "num_tokens": 133154204.0, "step": 58130 }, { "entropy": 5.334541463851929, "epoch": 5.746836694345591, "grad_norm": 1.0625, "learning_rate": 0.00022558375879048182, "loss": 4.7297, "mean_token_accuracy": 0.2480091080069542, "num_tokens": 133165022.0, "step": 58135 }, { "entropy": 5.315650272369385, "epoch": 5.747330960854093, "grad_norm": 1.109375, "learning_rate": 0.000225549331065043, "loss": 4.7263, "mean_token_accuracy": 0.24665829241275788, "num_tokens": 133177212.0, "step": 58140 }, { "entropy": 5.271982622146607, "epoch": 5.747825227362594, "grad_norm": 1.0859375, "learning_rate": 0.0002255149045560984, "loss": 4.621, "mean_token_accuracy": 0.25074609369039536, "num_tokens": 133188515.0, "step": 58145 }, { "entropy": 5.299093866348267, "epoch": 5.7483194938710955, "grad_norm": 1.109375, "learning_rate": 0.00022548047926449467, "loss": 4.6855, "mean_token_accuracy": 0.24457919895648955, "num_tokens": 133200044.0, "step": 58150 }, { "entropy": 5.281670093536377, "epoch": 5.748813760379597, "grad_norm": 1.1328125, "learning_rate": 0.00022544605519107892, "loss": 4.6944, "mean_token_accuracy": 0.249935145676136, "num_tokens": 133210717.0, "step": 58155 }, { "entropy": 5.296606969833374, "epoch": 5.749308026888098, "grad_norm": 1.0546875, "learning_rate": 0.00022541163233669794, "loss": 4.6899, "mean_token_accuracy": 0.25377783328294756, "num_tokens": 133222990.0, "step": 58160 }, { "entropy": 5.262725400924682, "epoch": 5.749802293396599, "grad_norm": 1.109375, "learning_rate": 0.0002253772107021983, "loss": 4.6324, "mean_token_accuracy": 0.25195199251174927, "num_tokens": 133234218.0, "step": 58165 }, { "entropy": 5.322982978820801, "epoch": 5.750296559905101, "grad_norm": 1.1328125, "learning_rate": 0.00022534279028842719, "loss": 4.7744, "mean_token_accuracy": 0.24277388602495192, "num_tokens": 133245485.0, "step": 58170 }, { "entropy": 5.354785346984864, "epoch": 5.750790826413602, "grad_norm": 1.0625, "learning_rate": 0.000225308371096231, "loss": 4.7391, "mean_token_accuracy": 0.2460245743393898, "num_tokens": 133258533.0, "step": 58175 }, { "entropy": 5.263186836242676, "epoch": 5.751285092922103, "grad_norm": 1.171875, "learning_rate": 0.0002252739531264567, "loss": 4.6082, "mean_token_accuracy": 0.2602584421634674, "num_tokens": 133269576.0, "step": 58180 }, { "entropy": 5.313267183303833, "epoch": 5.751779359430605, "grad_norm": 1.0234375, "learning_rate": 0.0002252395363799508, "loss": 4.6926, "mean_token_accuracy": 0.2464796632528305, "num_tokens": 133282386.0, "step": 58185 }, { "entropy": 5.205747604370117, "epoch": 5.7522736259391065, "grad_norm": 1.1171875, "learning_rate": 0.00022520512085756007, "loss": 4.5999, "mean_token_accuracy": 0.2581242650747299, "num_tokens": 133293839.0, "step": 58190 }, { "entropy": 5.2255433082580565, "epoch": 5.752767892447608, "grad_norm": 1.1640625, "learning_rate": 0.00022517070656013106, "loss": 4.5993, "mean_token_accuracy": 0.25917435735464095, "num_tokens": 133305206.0, "step": 58195 }, { "entropy": 5.288668775558472, "epoch": 5.753262158956109, "grad_norm": 1.078125, "learning_rate": 0.00022513629348851034, "loss": 4.7206, "mean_token_accuracy": 0.24887096136808395, "num_tokens": 133317549.0, "step": 58200 }, { "entropy": 5.368533897399902, "epoch": 5.75375642546461, "grad_norm": 1.1015625, "learning_rate": 0.0002251018816435446, "loss": 4.6636, "mean_token_accuracy": 0.2526640444993973, "num_tokens": 133329658.0, "step": 58205 }, { "entropy": 5.28093843460083, "epoch": 5.754250691973112, "grad_norm": 1.09375, "learning_rate": 0.00022506747102608038, "loss": 4.625, "mean_token_accuracy": 0.25476007610559465, "num_tokens": 133342569.0, "step": 58210 }, { "entropy": 5.163288497924805, "epoch": 5.754744958481613, "grad_norm": 1.203125, "learning_rate": 0.00022503306163696403, "loss": 4.4664, "mean_token_accuracy": 0.27484736442565916, "num_tokens": 133353875.0, "step": 58215 }, { "entropy": 5.318387413024903, "epoch": 5.755239224990115, "grad_norm": 1.0078125, "learning_rate": 0.00022499865347704213, "loss": 4.7613, "mean_token_accuracy": 0.24275372922420502, "num_tokens": 133366360.0, "step": 58220 }, { "entropy": 5.289477348327637, "epoch": 5.755733491498616, "grad_norm": 1.3125, "learning_rate": 0.00022496424654716107, "loss": 4.76, "mean_token_accuracy": 0.24768974632024765, "num_tokens": 133378209.0, "step": 58225 }, { "entropy": 5.27467303276062, "epoch": 5.7562277580071175, "grad_norm": 1.078125, "learning_rate": 0.00022492984084816737, "loss": 4.7075, "mean_token_accuracy": 0.2484324872493744, "num_tokens": 133390265.0, "step": 58230 }, { "entropy": 5.367352247238159, "epoch": 5.756722024515619, "grad_norm": 1.015625, "learning_rate": 0.00022489543638090737, "loss": 4.7534, "mean_token_accuracy": 0.23969967067241668, "num_tokens": 133402568.0, "step": 58235 }, { "entropy": 5.390883922576904, "epoch": 5.75721629102412, "grad_norm": 1.03125, "learning_rate": 0.00022486103314622735, "loss": 4.822, "mean_token_accuracy": 0.23768825978040695, "num_tokens": 133415455.0, "step": 58240 }, { "entropy": 5.359796857833862, "epoch": 5.757710557532621, "grad_norm": 1.1796875, "learning_rate": 0.00022482663114497376, "loss": 4.6892, "mean_token_accuracy": 0.24783572256565095, "num_tokens": 133426473.0, "step": 58245 }, { "entropy": 5.2914581298828125, "epoch": 5.7582048240411225, "grad_norm": 1.1640625, "learning_rate": 0.00022479223037799272, "loss": 4.6385, "mean_token_accuracy": 0.25385013073682783, "num_tokens": 133437488.0, "step": 58250 }, { "entropy": 5.329030275344849, "epoch": 5.758699090549625, "grad_norm": 1.09375, "learning_rate": 0.0002247578308461307, "loss": 4.7598, "mean_token_accuracy": 0.2471231162548065, "num_tokens": 133448724.0, "step": 58255 }, { "entropy": 5.304247713088989, "epoch": 5.759193357058126, "grad_norm": 1.234375, "learning_rate": 0.0002247234325502338, "loss": 4.704, "mean_token_accuracy": 0.25410580188035964, "num_tokens": 133460391.0, "step": 58260 }, { "entropy": 5.34708890914917, "epoch": 5.759687623566627, "grad_norm": 1.25, "learning_rate": 0.00022468903549114822, "loss": 4.7357, "mean_token_accuracy": 0.2473684385418892, "num_tokens": 133471200.0, "step": 58265 }, { "entropy": 5.2332018375396725, "epoch": 5.7601818900751285, "grad_norm": 1.078125, "learning_rate": 0.00022465463966972026, "loss": 4.6052, "mean_token_accuracy": 0.2602216571569443, "num_tokens": 133483273.0, "step": 58270 }, { "entropy": 5.2639524936676025, "epoch": 5.76067615658363, "grad_norm": 1.1640625, "learning_rate": 0.00022462024508679597, "loss": 4.6465, "mean_token_accuracy": 0.25419217348098755, "num_tokens": 133494807.0, "step": 58275 }, { "entropy": 5.271033096313476, "epoch": 5.761170423092131, "grad_norm": 1.171875, "learning_rate": 0.00022458585174322133, "loss": 4.6748, "mean_token_accuracy": 0.2515120133757591, "num_tokens": 133505687.0, "step": 58280 }, { "entropy": 5.279448366165161, "epoch": 5.761664689600632, "grad_norm": 1.109375, "learning_rate": 0.0002245514596398427, "loss": 4.6076, "mean_token_accuracy": 0.25596936643123624, "num_tokens": 133515676.0, "step": 58285 }, { "entropy": 5.3061353206634525, "epoch": 5.762158956109134, "grad_norm": 1.2109375, "learning_rate": 0.00022451706877750594, "loss": 4.7261, "mean_token_accuracy": 0.24415431022644044, "num_tokens": 133527106.0, "step": 58290 }, { "entropy": 5.306996917724609, "epoch": 5.762653222617636, "grad_norm": 1.171875, "learning_rate": 0.00022448267915705711, "loss": 4.743, "mean_token_accuracy": 0.2401997908949852, "num_tokens": 133538885.0, "step": 58295 }, { "entropy": 5.32370285987854, "epoch": 5.763147489126137, "grad_norm": 1.078125, "learning_rate": 0.00022444829077934226, "loss": 4.744, "mean_token_accuracy": 0.2451151952147484, "num_tokens": 133549749.0, "step": 58300 }, { "entropy": 5.280864906311035, "epoch": 5.763641755634638, "grad_norm": 1.2109375, "learning_rate": 0.0002244139036452073, "loss": 4.7033, "mean_token_accuracy": 0.24644977152347564, "num_tokens": 133561244.0, "step": 58305 }, { "entropy": 5.260138750076294, "epoch": 5.7641360221431395, "grad_norm": 1.1796875, "learning_rate": 0.00022437951775549804, "loss": 4.597, "mean_token_accuracy": 0.26054906100034714, "num_tokens": 133572006.0, "step": 58310 }, { "entropy": 5.320682573318481, "epoch": 5.764630288651641, "grad_norm": 1.3125, "learning_rate": 0.0002243451331110606, "loss": 4.718, "mean_token_accuracy": 0.2432727634906769, "num_tokens": 133583617.0, "step": 58315 }, { "entropy": 5.28360652923584, "epoch": 5.765124555160142, "grad_norm": 1.21875, "learning_rate": 0.00022431074971274067, "loss": 4.7347, "mean_token_accuracy": 0.2508953794836998, "num_tokens": 133593552.0, "step": 58320 }, { "entropy": 5.2887529850006105, "epoch": 5.765618821668644, "grad_norm": 1.125, "learning_rate": 0.00022427636756138425, "loss": 4.6799, "mean_token_accuracy": 0.2450931966304779, "num_tokens": 133604580.0, "step": 58325 }, { "entropy": 5.305352449417114, "epoch": 5.766113088177145, "grad_norm": 1.3046875, "learning_rate": 0.00022424198665783708, "loss": 4.716, "mean_token_accuracy": 0.24494758397340774, "num_tokens": 133614733.0, "step": 58330 }, { "entropy": 5.267515230178833, "epoch": 5.766607354685647, "grad_norm": 1.171875, "learning_rate": 0.00022420760700294485, "loss": 4.643, "mean_token_accuracy": 0.25810512751340864, "num_tokens": 133625744.0, "step": 58335 }, { "entropy": 5.337644290924072, "epoch": 5.767101621194148, "grad_norm": 1.09375, "learning_rate": 0.00022417322859755322, "loss": 4.8, "mean_token_accuracy": 0.24142191112041472, "num_tokens": 133638357.0, "step": 58340 }, { "entropy": 5.284945344924926, "epoch": 5.767595887702649, "grad_norm": 1.171875, "learning_rate": 0.0002241388514425083, "loss": 4.6963, "mean_token_accuracy": 0.25041296184062956, "num_tokens": 133650646.0, "step": 58345 }, { "entropy": 5.414713382720947, "epoch": 5.7680901542111505, "grad_norm": 1.1328125, "learning_rate": 0.00022410447553865542, "loss": 4.8282, "mean_token_accuracy": 0.23387734591960907, "num_tokens": 133662048.0, "step": 58350 }, { "entropy": 5.311100244522095, "epoch": 5.768584420719652, "grad_norm": 1.171875, "learning_rate": 0.00022407010088684037, "loss": 4.6872, "mean_token_accuracy": 0.25113103687763216, "num_tokens": 133673835.0, "step": 58355 }, { "entropy": 5.262610626220703, "epoch": 5.769078687228154, "grad_norm": 1.0703125, "learning_rate": 0.00022403572748790868, "loss": 4.6689, "mean_token_accuracy": 0.25057868510484693, "num_tokens": 133683833.0, "step": 58360 }, { "entropy": 5.24422173500061, "epoch": 5.769572953736655, "grad_norm": 1.171875, "learning_rate": 0.00022400135534270598, "loss": 4.647, "mean_token_accuracy": 0.2500268787145615, "num_tokens": 133694407.0, "step": 58365 }, { "entropy": 5.281543731689453, "epoch": 5.770067220245156, "grad_norm": 1.0625, "learning_rate": 0.0002239669844520779, "loss": 4.6427, "mean_token_accuracy": 0.2481420874595642, "num_tokens": 133706993.0, "step": 58370 }, { "entropy": 5.243767595291137, "epoch": 5.770561486753658, "grad_norm": 1.0859375, "learning_rate": 0.00022393261481686995, "loss": 4.6676, "mean_token_accuracy": 0.25551203191280364, "num_tokens": 133718800.0, "step": 58375 }, { "entropy": 5.235157871246338, "epoch": 5.771055753262159, "grad_norm": 1.2421875, "learning_rate": 0.00022389824643792762, "loss": 4.6046, "mean_token_accuracy": 0.258404004573822, "num_tokens": 133729074.0, "step": 58380 }, { "entropy": 5.295632362365723, "epoch": 5.77155001977066, "grad_norm": 1.15625, "learning_rate": 0.00022386387931609626, "loss": 4.7285, "mean_token_accuracy": 0.2546510025858879, "num_tokens": 133739937.0, "step": 58385 }, { "entropy": 5.272030973434449, "epoch": 5.772044286279161, "grad_norm": 1.1640625, "learning_rate": 0.0002238295134522215, "loss": 4.6387, "mean_token_accuracy": 0.2537156417965889, "num_tokens": 133750703.0, "step": 58390 }, { "entropy": 5.320473527908325, "epoch": 5.772538552787664, "grad_norm": 1.203125, "learning_rate": 0.00022379514884714852, "loss": 4.7191, "mean_token_accuracy": 0.24297914355993272, "num_tokens": 133761777.0, "step": 58395 }, { "entropy": 5.3028974533081055, "epoch": 5.773032819296165, "grad_norm": 1.2890625, "learning_rate": 0.0002237607855017229, "loss": 4.6871, "mean_token_accuracy": 0.2522012561559677, "num_tokens": 133772333.0, "step": 58400 }, { "entropy": 5.232520484924317, "epoch": 5.773527085804666, "grad_norm": 1.1015625, "learning_rate": 0.00022372642341678996, "loss": 4.5972, "mean_token_accuracy": 0.25841755270957945, "num_tokens": 133784394.0, "step": 58405 }, { "entropy": 5.330420684814453, "epoch": 5.774021352313167, "grad_norm": 1.015625, "learning_rate": 0.00022369206259319487, "loss": 4.7185, "mean_token_accuracy": 0.2431236371397972, "num_tokens": 133796667.0, "step": 58410 }, { "entropy": 5.266552400588989, "epoch": 5.774515618821669, "grad_norm": 1.125, "learning_rate": 0.00022365770303178306, "loss": 4.6736, "mean_token_accuracy": 0.2520233020186424, "num_tokens": 133808253.0, "step": 58415 }, { "entropy": 5.248264408111572, "epoch": 5.77500988533017, "grad_norm": 1.046875, "learning_rate": 0.00022362334473339973, "loss": 4.6798, "mean_token_accuracy": 0.25554369390010834, "num_tokens": 133819941.0, "step": 58420 }, { "entropy": 5.3379966735839846, "epoch": 5.775504151838671, "grad_norm": 1.0703125, "learning_rate": 0.00022358898769888998, "loss": 4.7756, "mean_token_accuracy": 0.24236756563186646, "num_tokens": 133831684.0, "step": 58425 }, { "entropy": 5.326915884017945, "epoch": 5.775998418347172, "grad_norm": 1.140625, "learning_rate": 0.00022355463192909919, "loss": 4.683, "mean_token_accuracy": 0.25424808710813523, "num_tokens": 133843523.0, "step": 58430 }, { "entropy": 5.360264110565185, "epoch": 5.776492684855674, "grad_norm": 1.21875, "learning_rate": 0.0002235202774248724, "loss": 4.7209, "mean_token_accuracy": 0.2486531913280487, "num_tokens": 133855671.0, "step": 58435 }, { "entropy": 5.379165124893189, "epoch": 5.776986951364176, "grad_norm": 1.1328125, "learning_rate": 0.0002234859241870548, "loss": 4.7297, "mean_token_accuracy": 0.2509832262992859, "num_tokens": 133866852.0, "step": 58440 }, { "entropy": 5.343399620056152, "epoch": 5.777481217872677, "grad_norm": 1.1875, "learning_rate": 0.00022345157221649147, "loss": 4.7143, "mean_token_accuracy": 0.24602787494659423, "num_tokens": 133877734.0, "step": 58445 }, { "entropy": 5.325904464721679, "epoch": 5.777975484381178, "grad_norm": 1.1015625, "learning_rate": 0.00022341722151402742, "loss": 4.7077, "mean_token_accuracy": 0.24280129373073578, "num_tokens": 133889661.0, "step": 58450 }, { "entropy": 5.2709380149841305, "epoch": 5.77846975088968, "grad_norm": 1.046875, "learning_rate": 0.00022338287208050774, "loss": 4.6088, "mean_token_accuracy": 0.2634891837835312, "num_tokens": 133902228.0, "step": 58455 }, { "entropy": 5.293496465682983, "epoch": 5.778964017398181, "grad_norm": 1.1875, "learning_rate": 0.0002233485239167774, "loss": 4.6799, "mean_token_accuracy": 0.24894750118255615, "num_tokens": 133914144.0, "step": 58460 }, { "entropy": 5.267547941207885, "epoch": 5.779458283906682, "grad_norm": 1.2421875, "learning_rate": 0.00022331417702368145, "loss": 4.6849, "mean_token_accuracy": 0.24889834821224213, "num_tokens": 133925710.0, "step": 58465 }, { "entropy": 5.34854564666748, "epoch": 5.779952550415183, "grad_norm": 1.125, "learning_rate": 0.00022327983140206476, "loss": 4.8477, "mean_token_accuracy": 0.230986388027668, "num_tokens": 133937733.0, "step": 58470 }, { "entropy": 5.271405363082886, "epoch": 5.780446816923686, "grad_norm": 1.1171875, "learning_rate": 0.00022324548705277214, "loss": 4.6959, "mean_token_accuracy": 0.2509229570627213, "num_tokens": 133949261.0, "step": 58475 }, { "entropy": 5.347052526473999, "epoch": 5.780941083432187, "grad_norm": 1.2109375, "learning_rate": 0.00022321114397664865, "loss": 4.6459, "mean_token_accuracy": 0.2572781518101692, "num_tokens": 133959809.0, "step": 58480 }, { "entropy": 5.243615531921387, "epoch": 5.781435349940688, "grad_norm": 1.1484375, "learning_rate": 0.00022317680217453896, "loss": 4.6078, "mean_token_accuracy": 0.25873886197805407, "num_tokens": 133970955.0, "step": 58485 }, { "entropy": 5.239582252502442, "epoch": 5.781929616449189, "grad_norm": 1.1875, "learning_rate": 0.00022314246164728812, "loss": 4.6093, "mean_token_accuracy": 0.2603365331888199, "num_tokens": 133981774.0, "step": 58490 }, { "entropy": 5.343015718460083, "epoch": 5.782423882957691, "grad_norm": 1.15625, "learning_rate": 0.0002231081223957407, "loss": 4.7951, "mean_token_accuracy": 0.2458416759967804, "num_tokens": 133992969.0, "step": 58495 }, { "entropy": 5.265866470336914, "epoch": 5.782918149466192, "grad_norm": 1.0625, "learning_rate": 0.0002230737844207415, "loss": 4.6704, "mean_token_accuracy": 0.2494973361492157, "num_tokens": 134004973.0, "step": 58500 }, { "entropy": 5.317444849014282, "epoch": 5.783412415974693, "grad_norm": 1.1640625, "learning_rate": 0.00022303944772313528, "loss": 4.6681, "mean_token_accuracy": 0.25121834874153137, "num_tokens": 134015747.0, "step": 58505 }, { "entropy": 5.363435411453247, "epoch": 5.783906682483195, "grad_norm": 1.21875, "learning_rate": 0.00022300511230376673, "loss": 4.746, "mean_token_accuracy": 0.25430058836936953, "num_tokens": 134027496.0, "step": 58510 }, { "entropy": 5.215198230743408, "epoch": 5.7844009489916965, "grad_norm": 1.0703125, "learning_rate": 0.0002229707781634804, "loss": 4.6822, "mean_token_accuracy": 0.2597003698348999, "num_tokens": 134039370.0, "step": 58515 }, { "entropy": 5.316715145111084, "epoch": 5.784895215500198, "grad_norm": 1.125, "learning_rate": 0.00022293644530312106, "loss": 4.7116, "mean_token_accuracy": 0.24420740604400634, "num_tokens": 134048992.0, "step": 58520 }, { "entropy": 5.270035266876221, "epoch": 5.785389482008699, "grad_norm": 1.1484375, "learning_rate": 0.00022290211372353325, "loss": 4.5493, "mean_token_accuracy": 0.26256915330886843, "num_tokens": 134059503.0, "step": 58525 }, { "entropy": 5.239801502227783, "epoch": 5.7858837485172, "grad_norm": 1.125, "learning_rate": 0.00022286778342556153, "loss": 4.6367, "mean_token_accuracy": 0.2487141892313957, "num_tokens": 134070695.0, "step": 58530 }, { "entropy": 5.24118938446045, "epoch": 5.786378015025702, "grad_norm": 1.0625, "learning_rate": 0.00022283345441005044, "loss": 4.6261, "mean_token_accuracy": 0.2536768287420273, "num_tokens": 134082131.0, "step": 58535 }, { "entropy": 5.159116125106811, "epoch": 5.786872281534203, "grad_norm": 1.1328125, "learning_rate": 0.0002227991266778443, "loss": 4.5039, "mean_token_accuracy": 0.2662407249212265, "num_tokens": 134093791.0, "step": 58540 }, { "entropy": 5.193332386016846, "epoch": 5.787366548042705, "grad_norm": 1.1171875, "learning_rate": 0.0002227648002297879, "loss": 4.5933, "mean_token_accuracy": 0.2645601660013199, "num_tokens": 134105890.0, "step": 58545 }, { "entropy": 5.293560981750488, "epoch": 5.787860814551206, "grad_norm": 1.0546875, "learning_rate": 0.0002227304750667255, "loss": 4.6811, "mean_token_accuracy": 0.25161905139684676, "num_tokens": 134117399.0, "step": 58550 }, { "entropy": 5.295502042770385, "epoch": 5.7883550810597075, "grad_norm": 0.9921875, "learning_rate": 0.00022269615118950155, "loss": 4.6224, "mean_token_accuracy": 0.2514536589384079, "num_tokens": 134129155.0, "step": 58555 }, { "entropy": 5.264515590667725, "epoch": 5.788849347568209, "grad_norm": 1.1875, "learning_rate": 0.00022266182859896033, "loss": 4.6127, "mean_token_accuracy": 0.253170308470726, "num_tokens": 134140636.0, "step": 58560 }, { "entropy": 5.25327787399292, "epoch": 5.78934361407671, "grad_norm": 1.0546875, "learning_rate": 0.00022262750729594633, "loss": 4.6154, "mean_token_accuracy": 0.26315763890743255, "num_tokens": 134151733.0, "step": 58565 }, { "entropy": 5.263627529144287, "epoch": 5.789837880585211, "grad_norm": 1.125, "learning_rate": 0.00022259318728130363, "loss": 4.6744, "mean_token_accuracy": 0.2544680044054985, "num_tokens": 134162618.0, "step": 58570 }, { "entropy": 5.241738271713257, "epoch": 5.790332147093713, "grad_norm": 1.171875, "learning_rate": 0.00022255886855587675, "loss": 4.5889, "mean_token_accuracy": 0.25726059526205064, "num_tokens": 134173899.0, "step": 58575 }, { "entropy": 5.2132354259490965, "epoch": 5.790826413602215, "grad_norm": 1.109375, "learning_rate": 0.00022252455112050984, "loss": 4.6174, "mean_token_accuracy": 0.256478975713253, "num_tokens": 134185969.0, "step": 58580 }, { "entropy": 5.314939022064209, "epoch": 5.791320680110716, "grad_norm": 1.21875, "learning_rate": 0.00022249023497604716, "loss": 4.7092, "mean_token_accuracy": 0.2502252757549286, "num_tokens": 134197311.0, "step": 58585 }, { "entropy": 5.266181755065918, "epoch": 5.791814946619217, "grad_norm": 1.1875, "learning_rate": 0.00022245592012333276, "loss": 4.6418, "mean_token_accuracy": 0.25312421172857286, "num_tokens": 134210147.0, "step": 58590 }, { "entropy": 5.390949678421021, "epoch": 5.7923092131277185, "grad_norm": 1.109375, "learning_rate": 0.00022242160656321092, "loss": 4.7622, "mean_token_accuracy": 0.24209215492010117, "num_tokens": 134221830.0, "step": 58595 }, { "entropy": 5.22404465675354, "epoch": 5.79280347963622, "grad_norm": 1.0859375, "learning_rate": 0.00022238729429652565, "loss": 4.625, "mean_token_accuracy": 0.25970207899808884, "num_tokens": 134233444.0, "step": 58600 }, { "entropy": 5.167392826080322, "epoch": 5.793297746144721, "grad_norm": 1.1484375, "learning_rate": 0.00022235298332412117, "loss": 4.6125, "mean_token_accuracy": 0.2588707208633423, "num_tokens": 134246278.0, "step": 58605 }, { "entropy": 5.2500921249389645, "epoch": 5.793792012653222, "grad_norm": 1.140625, "learning_rate": 0.00022231867364684143, "loss": 4.7069, "mean_token_accuracy": 0.24935767352581023, "num_tokens": 134257854.0, "step": 58610 }, { "entropy": 5.300990152359009, "epoch": 5.7942862791617245, "grad_norm": 1.140625, "learning_rate": 0.00022228436526553058, "loss": 4.7303, "mean_token_accuracy": 0.24712696224451064, "num_tokens": 134269415.0, "step": 58615 }, { "entropy": 5.3255408763885494, "epoch": 5.794780545670226, "grad_norm": 1.0546875, "learning_rate": 0.00022225005818103246, "loss": 4.6625, "mean_token_accuracy": 0.25666889548301697, "num_tokens": 134280747.0, "step": 58620 }, { "entropy": 5.341996335983277, "epoch": 5.795274812178727, "grad_norm": 1.1328125, "learning_rate": 0.00022221575239419106, "loss": 4.6776, "mean_token_accuracy": 0.24710836708545686, "num_tokens": 134291970.0, "step": 58625 }, { "entropy": 5.280681180953979, "epoch": 5.795769078687228, "grad_norm": 1.171875, "learning_rate": 0.00022218144790585033, "loss": 4.683, "mean_token_accuracy": 0.2489144429564476, "num_tokens": 134303478.0, "step": 58630 }, { "entropy": 5.272593688964844, "epoch": 5.7962633451957295, "grad_norm": 1.0703125, "learning_rate": 0.0002221471447168542, "loss": 4.7477, "mean_token_accuracy": 0.24089257270097733, "num_tokens": 134315528.0, "step": 58635 }, { "entropy": 5.303298854827881, "epoch": 5.796757611704231, "grad_norm": 1.046875, "learning_rate": 0.00022211284282804656, "loss": 4.6576, "mean_token_accuracy": 0.25733465403318406, "num_tokens": 134326815.0, "step": 58640 }, { "entropy": 5.274539422988892, "epoch": 5.797251878212732, "grad_norm": 1.0390625, "learning_rate": 0.00022207854224027114, "loss": 4.6587, "mean_token_accuracy": 0.2539809003472328, "num_tokens": 134339050.0, "step": 58645 }, { "entropy": 5.281454133987427, "epoch": 5.797746144721234, "grad_norm": 1.21875, "learning_rate": 0.0002220442429543718, "loss": 4.6147, "mean_token_accuracy": 0.25649524927139283, "num_tokens": 134349834.0, "step": 58650 }, { "entropy": 5.231969881057739, "epoch": 5.798240411229735, "grad_norm": 1.1484375, "learning_rate": 0.00022200994497119237, "loss": 4.685, "mean_token_accuracy": 0.2532213881611824, "num_tokens": 134361786.0, "step": 58655 }, { "entropy": 5.373126363754272, "epoch": 5.798734677738237, "grad_norm": 1.109375, "learning_rate": 0.00022197564829157642, "loss": 4.7982, "mean_token_accuracy": 0.23809561282396316, "num_tokens": 134374431.0, "step": 58660 }, { "entropy": 5.293670797348023, "epoch": 5.799228944246738, "grad_norm": 1.1640625, "learning_rate": 0.00022194135291636776, "loss": 4.6617, "mean_token_accuracy": 0.25439962148666384, "num_tokens": 134385810.0, "step": 58665 }, { "entropy": 5.285560512542725, "epoch": 5.799723210755239, "grad_norm": 1.203125, "learning_rate": 0.00022190705884641006, "loss": 4.6244, "mean_token_accuracy": 0.25589472651481626, "num_tokens": 134399032.0, "step": 58670 }, { "entropy": 5.312343883514404, "epoch": 5.8002174772637405, "grad_norm": 1.0625, "learning_rate": 0.00022187276608254697, "loss": 4.7533, "mean_token_accuracy": 0.2418547123670578, "num_tokens": 134410119.0, "step": 58675 }, { "entropy": 5.254340267181396, "epoch": 5.800711743772242, "grad_norm": 1.046875, "learning_rate": 0.00022183847462562206, "loss": 4.5904, "mean_token_accuracy": 0.2617155209183693, "num_tokens": 134420928.0, "step": 58680 }, { "entropy": 5.247456884384155, "epoch": 5.801206010280743, "grad_norm": 1.1328125, "learning_rate": 0.00022180418447647889, "loss": 4.6421, "mean_token_accuracy": 0.2471255585551262, "num_tokens": 134431689.0, "step": 58685 }, { "entropy": 5.2079462051391605, "epoch": 5.801700276789244, "grad_norm": 1.1484375, "learning_rate": 0.00022176989563596106, "loss": 4.5985, "mean_token_accuracy": 0.25714619308710096, "num_tokens": 134442567.0, "step": 58690 }, { "entropy": 5.282709407806396, "epoch": 5.802194543297746, "grad_norm": 1.046875, "learning_rate": 0.00022173560810491205, "loss": 4.6483, "mean_token_accuracy": 0.25325190275907516, "num_tokens": 134453659.0, "step": 58695 }, { "entropy": 5.241919279098511, "epoch": 5.802688809806248, "grad_norm": 1.1796875, "learning_rate": 0.00022170132188417536, "loss": 4.6341, "mean_token_accuracy": 0.25553099513053895, "num_tokens": 134463571.0, "step": 58700 }, { "entropy": 5.233944320678711, "epoch": 5.803183076314749, "grad_norm": 1.1328125, "learning_rate": 0.00022166703697459444, "loss": 4.554, "mean_token_accuracy": 0.26218636631965636, "num_tokens": 134474870.0, "step": 58705 }, { "entropy": 5.2167082786560055, "epoch": 5.80367734282325, "grad_norm": 1.1640625, "learning_rate": 0.00022163275337701272, "loss": 4.6599, "mean_token_accuracy": 0.25953456908464434, "num_tokens": 134485646.0, "step": 58710 }, { "entropy": 5.302739000320434, "epoch": 5.8041716093317515, "grad_norm": 1.109375, "learning_rate": 0.0002215984710922734, "loss": 4.6524, "mean_token_accuracy": 0.25442086458206176, "num_tokens": 134497712.0, "step": 58715 }, { "entropy": 5.273736000061035, "epoch": 5.804665875840253, "grad_norm": 1.2734375, "learning_rate": 0.00022156419012122003, "loss": 4.6499, "mean_token_accuracy": 0.24876031875610352, "num_tokens": 134507972.0, "step": 58720 }, { "entropy": 5.276202774047851, "epoch": 5.805160142348754, "grad_norm": 1.1796875, "learning_rate": 0.00022152991046469594, "loss": 4.6183, "mean_token_accuracy": 0.25442248284816743, "num_tokens": 134520347.0, "step": 58725 }, { "entropy": 5.250970697402954, "epoch": 5.805654408857256, "grad_norm": 1.203125, "learning_rate": 0.00022149563212354434, "loss": 4.6162, "mean_token_accuracy": 0.2571210443973541, "num_tokens": 134530101.0, "step": 58730 }, { "entropy": 5.314149856567383, "epoch": 5.806148675365757, "grad_norm": 1.2421875, "learning_rate": 0.00022146135509860848, "loss": 4.6963, "mean_token_accuracy": 0.24110815674066544, "num_tokens": 134539718.0, "step": 58735 }, { "entropy": 5.300875473022461, "epoch": 5.806642941874259, "grad_norm": 1.203125, "learning_rate": 0.00022142707939073154, "loss": 4.7888, "mean_token_accuracy": 0.2419223502278328, "num_tokens": 134551140.0, "step": 58740 }, { "entropy": 5.267445373535156, "epoch": 5.80713720838276, "grad_norm": 1.2109375, "learning_rate": 0.00022139280500075675, "loss": 4.6859, "mean_token_accuracy": 0.25342705845832825, "num_tokens": 134561776.0, "step": 58745 }, { "entropy": 5.317918586730957, "epoch": 5.807631474891261, "grad_norm": 1.140625, "learning_rate": 0.0002213585319295273, "loss": 4.7301, "mean_token_accuracy": 0.25171718597412107, "num_tokens": 134573673.0, "step": 58750 }, { "entropy": 5.2555413246154785, "epoch": 5.8081257413997625, "grad_norm": 1.03125, "learning_rate": 0.00022132426017788638, "loss": 4.592, "mean_token_accuracy": 0.2605235457420349, "num_tokens": 134585254.0, "step": 58755 }, { "entropy": 5.206793165206909, "epoch": 5.808620007908264, "grad_norm": 1.109375, "learning_rate": 0.00022128998974667692, "loss": 4.5944, "mean_token_accuracy": 0.265316341817379, "num_tokens": 134595750.0, "step": 58760 }, { "entropy": 5.3243332862854, "epoch": 5.809114274416766, "grad_norm": 1.2265625, "learning_rate": 0.00022125572063674205, "loss": 4.7306, "mean_token_accuracy": 0.2444848269224167, "num_tokens": 134608176.0, "step": 58765 }, { "entropy": 5.279867267608642, "epoch": 5.809608540925267, "grad_norm": 1.140625, "learning_rate": 0.00022122145284892474, "loss": 4.6899, "mean_token_accuracy": 0.2523126408457756, "num_tokens": 134619627.0, "step": 58770 }, { "entropy": 5.309829902648926, "epoch": 5.810102807433768, "grad_norm": 1.1796875, "learning_rate": 0.00022118718638406803, "loss": 4.6925, "mean_token_accuracy": 0.2496600404381752, "num_tokens": 134630605.0, "step": 58775 }, { "entropy": 5.251981782913208, "epoch": 5.81059707394227, "grad_norm": 1.078125, "learning_rate": 0.00022115292124301494, "loss": 4.6667, "mean_token_accuracy": 0.25148348659276965, "num_tokens": 134642504.0, "step": 58780 }, { "entropy": 5.2841796875, "epoch": 5.811091340450771, "grad_norm": 1.125, "learning_rate": 0.00022111865742660837, "loss": 4.7406, "mean_token_accuracy": 0.2500566512346268, "num_tokens": 134653912.0, "step": 58785 }, { "entropy": 5.240363359451294, "epoch": 5.811585606959272, "grad_norm": 1.140625, "learning_rate": 0.00022108439493569106, "loss": 4.5815, "mean_token_accuracy": 0.2589088544249535, "num_tokens": 134664608.0, "step": 58790 }, { "entropy": 5.285125732421875, "epoch": 5.812079873467773, "grad_norm": 1.0859375, "learning_rate": 0.00022105013377110612, "loss": 4.6089, "mean_token_accuracy": 0.2603655785322189, "num_tokens": 134676157.0, "step": 58795 }, { "entropy": 5.220536231994629, "epoch": 5.812574139976276, "grad_norm": 1.109375, "learning_rate": 0.00022101587393369621, "loss": 4.6353, "mean_token_accuracy": 0.25520820915699005, "num_tokens": 134688508.0, "step": 58800 }, { "entropy": 5.193213844299317, "epoch": 5.813068406484777, "grad_norm": 1.2265625, "learning_rate": 0.0002209816154243041, "loss": 4.6056, "mean_token_accuracy": 0.2593799069523811, "num_tokens": 134700191.0, "step": 58805 }, { "entropy": 5.360379457473755, "epoch": 5.813562672993278, "grad_norm": 1.1796875, "learning_rate": 0.00022094735824377277, "loss": 4.7721, "mean_token_accuracy": 0.23962850421667098, "num_tokens": 134711984.0, "step": 58810 }, { "entropy": 5.32660322189331, "epoch": 5.814056939501779, "grad_norm": 1.0625, "learning_rate": 0.0002209131023929447, "loss": 4.6938, "mean_token_accuracy": 0.24937905818223954, "num_tokens": 134723601.0, "step": 58815 }, { "entropy": 5.335115766525268, "epoch": 5.814551206010281, "grad_norm": 1.1875, "learning_rate": 0.00022087884787266282, "loss": 4.6583, "mean_token_accuracy": 0.2558426156640053, "num_tokens": 134735055.0, "step": 58820 }, { "entropy": 5.231081485748291, "epoch": 5.815045472518782, "grad_norm": 1.15625, "learning_rate": 0.0002208445946837696, "loss": 4.6262, "mean_token_accuracy": 0.25520171225070953, "num_tokens": 134745600.0, "step": 58825 }, { "entropy": 5.315569829940796, "epoch": 5.815539739027283, "grad_norm": 1.0625, "learning_rate": 0.00022081034282710776, "loss": 4.7604, "mean_token_accuracy": 0.24947092086076736, "num_tokens": 134759746.0, "step": 58830 }, { "entropy": 5.2771055698394775, "epoch": 5.816034005535785, "grad_norm": 1.09375, "learning_rate": 0.00022077609230351992, "loss": 4.6503, "mean_token_accuracy": 0.2543089985847473, "num_tokens": 134771076.0, "step": 58835 }, { "entropy": 5.329298830032348, "epoch": 5.816528272044287, "grad_norm": 1.0859375, "learning_rate": 0.00022074184311384853, "loss": 4.7266, "mean_token_accuracy": 0.24726477712392808, "num_tokens": 134783120.0, "step": 58840 }, { "entropy": 5.290977621078492, "epoch": 5.817022538552788, "grad_norm": 1.203125, "learning_rate": 0.00022070759525893635, "loss": 4.7101, "mean_token_accuracy": 0.250978884100914, "num_tokens": 134794022.0, "step": 58845 }, { "entropy": 5.2844884395599365, "epoch": 5.817516805061289, "grad_norm": 0.97265625, "learning_rate": 0.0002206733487396257, "loss": 4.6197, "mean_token_accuracy": 0.25355338007211686, "num_tokens": 134806130.0, "step": 58850 }, { "entropy": 5.294565963745117, "epoch": 5.81801107156979, "grad_norm": 1.2265625, "learning_rate": 0.0002206391035567591, "loss": 4.6744, "mean_token_accuracy": 0.25117832869291307, "num_tokens": 134818009.0, "step": 58855 }, { "entropy": 5.359572839736939, "epoch": 5.818505338078292, "grad_norm": 1.1484375, "learning_rate": 0.00022060485971117893, "loss": 4.8145, "mean_token_accuracy": 0.23874308317899703, "num_tokens": 134829389.0, "step": 58860 }, { "entropy": 5.282404899597168, "epoch": 5.818999604586793, "grad_norm": 1.078125, "learning_rate": 0.00022057061720372762, "loss": 4.6897, "mean_token_accuracy": 0.25053530633449556, "num_tokens": 134842214.0, "step": 58865 }, { "entropy": 5.337351703643799, "epoch": 5.819493871095295, "grad_norm": 1.1484375, "learning_rate": 0.00022053637603524774, "loss": 4.7048, "mean_token_accuracy": 0.24920283406972885, "num_tokens": 134853902.0, "step": 58870 }, { "entropy": 5.392829704284668, "epoch": 5.819988137603796, "grad_norm": 1.28125, "learning_rate": 0.00022050213620658133, "loss": 4.7543, "mean_token_accuracy": 0.24166710823774337, "num_tokens": 134865225.0, "step": 58875 }, { "entropy": 5.214576339721679, "epoch": 5.820482404112298, "grad_norm": 1.2421875, "learning_rate": 0.00022046789771857086, "loss": 4.561, "mean_token_accuracy": 0.2642866000533104, "num_tokens": 134875925.0, "step": 58880 }, { "entropy": 5.286276769638062, "epoch": 5.820976670620799, "grad_norm": 1.09375, "learning_rate": 0.00022043366057205856, "loss": 4.6948, "mean_token_accuracy": 0.24352830350399018, "num_tokens": 134887691.0, "step": 58885 }, { "entropy": 5.252752113342285, "epoch": 5.8214709371293, "grad_norm": 1.1796875, "learning_rate": 0.0002203994247678866, "loss": 4.6469, "mean_token_accuracy": 0.25844859033823014, "num_tokens": 134898238.0, "step": 58890 }, { "entropy": 5.309596681594849, "epoch": 5.821965203637801, "grad_norm": 1.171875, "learning_rate": 0.0002203651903068974, "loss": 4.7772, "mean_token_accuracy": 0.24665890336036683, "num_tokens": 134910153.0, "step": 58895 }, { "entropy": 5.2542037010192875, "epoch": 5.822459470146303, "grad_norm": 1.1171875, "learning_rate": 0.00022033095718993295, "loss": 4.6033, "mean_token_accuracy": 0.26204750686883926, "num_tokens": 134921074.0, "step": 58900 }, { "entropy": 5.2589430809021, "epoch": 5.822953736654805, "grad_norm": 1.0625, "learning_rate": 0.00022029672541783535, "loss": 4.6725, "mean_token_accuracy": 0.2574109837412834, "num_tokens": 134931727.0, "step": 58905 }, { "entropy": 5.240823459625244, "epoch": 5.823448003163306, "grad_norm": 1.15625, "learning_rate": 0.0002202624949914469, "loss": 4.6589, "mean_token_accuracy": 0.24777519553899766, "num_tokens": 134943123.0, "step": 58910 }, { "entropy": 5.241001987457276, "epoch": 5.823942269671807, "grad_norm": 1.1171875, "learning_rate": 0.00022022826591160954, "loss": 4.7049, "mean_token_accuracy": 0.25156059116125107, "num_tokens": 134954688.0, "step": 58915 }, { "entropy": 5.333988428115845, "epoch": 5.8244365361803085, "grad_norm": 1.1640625, "learning_rate": 0.0002201940381791653, "loss": 4.7906, "mean_token_accuracy": 0.24373519122600557, "num_tokens": 134964999.0, "step": 58920 }, { "entropy": 5.293003273010254, "epoch": 5.82493080268881, "grad_norm": 1.140625, "learning_rate": 0.00022015981179495625, "loss": 4.6853, "mean_token_accuracy": 0.24546810686588288, "num_tokens": 134975170.0, "step": 58925 }, { "entropy": 5.327208852767944, "epoch": 5.825425069197311, "grad_norm": 1.1640625, "learning_rate": 0.0002201255867598243, "loss": 4.7029, "mean_token_accuracy": 0.24767597913742065, "num_tokens": 134986944.0, "step": 58930 }, { "entropy": 5.328997564315796, "epoch": 5.825919335705812, "grad_norm": 1.15625, "learning_rate": 0.00022009136307461148, "loss": 4.7997, "mean_token_accuracy": 0.24832975268363952, "num_tokens": 134997773.0, "step": 58935 }, { "entropy": 5.299934339523316, "epoch": 5.826413602214314, "grad_norm": 1.2109375, "learning_rate": 0.00022005714074015964, "loss": 4.6858, "mean_token_accuracy": 0.24774719178676605, "num_tokens": 135009097.0, "step": 58940 }, { "entropy": 5.34398078918457, "epoch": 5.826907868722815, "grad_norm": 1.171875, "learning_rate": 0.00022002291975731065, "loss": 4.7508, "mean_token_accuracy": 0.2404843807220459, "num_tokens": 135020082.0, "step": 58945 }, { "entropy": 5.269090938568115, "epoch": 5.827402135231317, "grad_norm": 1.1328125, "learning_rate": 0.0002199887001269063, "loss": 4.6705, "mean_token_accuracy": 0.2600660026073456, "num_tokens": 135031524.0, "step": 58950 }, { "entropy": 5.283059453964233, "epoch": 5.827896401739818, "grad_norm": 1.15625, "learning_rate": 0.0002199544818497885, "loss": 4.6812, "mean_token_accuracy": 0.2585860908031464, "num_tokens": 135043007.0, "step": 58955 }, { "entropy": 5.249559926986694, "epoch": 5.8283906682483195, "grad_norm": 1.1953125, "learning_rate": 0.000219920264926799, "loss": 4.6623, "mean_token_accuracy": 0.2545494928956032, "num_tokens": 135053086.0, "step": 58960 }, { "entropy": 5.35224142074585, "epoch": 5.828884934756821, "grad_norm": 1.078125, "learning_rate": 0.0002198860493587796, "loss": 4.7282, "mean_token_accuracy": 0.24753096848726272, "num_tokens": 135064472.0, "step": 58965 }, { "entropy": 5.343652963638306, "epoch": 5.829379201265322, "grad_norm": 1.0546875, "learning_rate": 0.00021985183514657193, "loss": 4.7059, "mean_token_accuracy": 0.2450726568698883, "num_tokens": 135076142.0, "step": 58970 }, { "entropy": 5.334449195861817, "epoch": 5.829873467773823, "grad_norm": 1.203125, "learning_rate": 0.00021981762229101754, "loss": 4.7136, "mean_token_accuracy": 0.24301000237464904, "num_tokens": 135087201.0, "step": 58975 }, { "entropy": 5.289714813232422, "epoch": 5.830367734282325, "grad_norm": 1.09375, "learning_rate": 0.00021978341079295822, "loss": 4.6658, "mean_token_accuracy": 0.2550830259919167, "num_tokens": 135097947.0, "step": 58980 }, { "entropy": 5.264128017425537, "epoch": 5.830862000790827, "grad_norm": 1.15625, "learning_rate": 0.0002197492006532356, "loss": 4.6926, "mean_token_accuracy": 0.25140355080366134, "num_tokens": 135109414.0, "step": 58985 }, { "entropy": 5.291074228286743, "epoch": 5.831356267299328, "grad_norm": 1.21875, "learning_rate": 0.00021971499187269127, "loss": 4.6683, "mean_token_accuracy": 0.2556329116225243, "num_tokens": 135120657.0, "step": 58990 }, { "entropy": 5.359338712692261, "epoch": 5.831850533807829, "grad_norm": 1.09375, "learning_rate": 0.00021968078445216673, "loss": 4.6771, "mean_token_accuracy": 0.2550415202975273, "num_tokens": 135132895.0, "step": 58995 }, { "entropy": 5.347480535507202, "epoch": 5.8323448003163305, "grad_norm": 1.1328125, "learning_rate": 0.0002196465783925034, "loss": 4.7459, "mean_token_accuracy": 0.24412919878959655, "num_tokens": 135143932.0, "step": 59000 }, { "entropy": 5.285158395767212, "epoch": 5.832839066824832, "grad_norm": 1.1796875, "learning_rate": 0.00021961237369454278, "loss": 4.6737, "mean_token_accuracy": 0.2503816068172455, "num_tokens": 135155496.0, "step": 59005 }, { "entropy": 5.297105741500855, "epoch": 5.833333333333333, "grad_norm": 1.1875, "learning_rate": 0.00021957817035912647, "loss": 4.7179, "mean_token_accuracy": 0.24629144221544266, "num_tokens": 135167487.0, "step": 59010 }, { "entropy": 5.314064455032349, "epoch": 5.833827599841834, "grad_norm": 1.140625, "learning_rate": 0.00021954396838709574, "loss": 4.7106, "mean_token_accuracy": 0.24952812492847443, "num_tokens": 135178545.0, "step": 59015 }, { "entropy": 5.318432092666626, "epoch": 5.8343218663503364, "grad_norm": 1.1953125, "learning_rate": 0.000219509767779292, "loss": 4.747, "mean_token_accuracy": 0.2569466009736061, "num_tokens": 135189714.0, "step": 59020 }, { "entropy": 5.286470556259156, "epoch": 5.834816132858838, "grad_norm": 1.2421875, "learning_rate": 0.00021947556853655655, "loss": 4.6828, "mean_token_accuracy": 0.2520500808954239, "num_tokens": 135201090.0, "step": 59025 }, { "entropy": 5.283176755905151, "epoch": 5.835310399367339, "grad_norm": 1.1484375, "learning_rate": 0.00021944137065973073, "loss": 4.6744, "mean_token_accuracy": 0.24498919546604156, "num_tokens": 135212415.0, "step": 59030 }, { "entropy": 5.300303173065186, "epoch": 5.83580466587584, "grad_norm": 1.21875, "learning_rate": 0.0002194071741496557, "loss": 4.6676, "mean_token_accuracy": 0.2504953607916832, "num_tokens": 135223051.0, "step": 59035 }, { "entropy": 5.309351015090942, "epoch": 5.8362989323843415, "grad_norm": 1.265625, "learning_rate": 0.000219372979007173, "loss": 4.6536, "mean_token_accuracy": 0.2522044137120247, "num_tokens": 135234378.0, "step": 59040 }, { "entropy": 5.263465070724488, "epoch": 5.836793198892843, "grad_norm": 1.203125, "learning_rate": 0.0002193387852331236, "loss": 4.6253, "mean_token_accuracy": 0.25528488457202914, "num_tokens": 135246949.0, "step": 59045 }, { "entropy": 5.293906545639038, "epoch": 5.837287465401344, "grad_norm": 1.1484375, "learning_rate": 0.00021930459282834864, "loss": 4.7487, "mean_token_accuracy": 0.24743591696023942, "num_tokens": 135258887.0, "step": 59050 }, { "entropy": 5.362732982635498, "epoch": 5.837781731909846, "grad_norm": 1.0859375, "learning_rate": 0.00021927040179368944, "loss": 4.7971, "mean_token_accuracy": 0.23715146332979203, "num_tokens": 135271031.0, "step": 59055 }, { "entropy": 5.30018424987793, "epoch": 5.838275998418347, "grad_norm": 1.2265625, "learning_rate": 0.00021923621212998696, "loss": 4.6902, "mean_token_accuracy": 0.24938552379608153, "num_tokens": 135282385.0, "step": 59060 }, { "entropy": 5.40114278793335, "epoch": 5.838770264926849, "grad_norm": 1.265625, "learning_rate": 0.00021920202383808224, "loss": 4.7708, "mean_token_accuracy": 0.2430727154016495, "num_tokens": 135293246.0, "step": 59065 }, { "entropy": 5.350214099884033, "epoch": 5.83926453143535, "grad_norm": 1.1328125, "learning_rate": 0.0002191678369188165, "loss": 4.7174, "mean_token_accuracy": 0.24627089500427246, "num_tokens": 135305666.0, "step": 59070 }, { "entropy": 5.392301464080811, "epoch": 5.839758797943851, "grad_norm": 1.140625, "learning_rate": 0.00021913365137303054, "loss": 4.7655, "mean_token_accuracy": 0.2434181109070778, "num_tokens": 135316982.0, "step": 59075 }, { "entropy": 5.3127788543701175, "epoch": 5.8402530644523525, "grad_norm": 1.1953125, "learning_rate": 0.0002190994672015655, "loss": 4.6807, "mean_token_accuracy": 0.2443244770169258, "num_tokens": 135327723.0, "step": 59080 }, { "entropy": 5.289916944503784, "epoch": 5.840747330960854, "grad_norm": 1.125, "learning_rate": 0.00021906528440526226, "loss": 4.6746, "mean_token_accuracy": 0.2522829160094261, "num_tokens": 135338944.0, "step": 59085 }, { "entropy": 5.368556976318359, "epoch": 5.841241597469356, "grad_norm": 1.1484375, "learning_rate": 0.0002190311029849616, "loss": 4.8009, "mean_token_accuracy": 0.23297128230333328, "num_tokens": 135350665.0, "step": 59090 }, { "entropy": 5.2854796886444095, "epoch": 5.841735863977857, "grad_norm": 1.046875, "learning_rate": 0.00021899692294150453, "loss": 4.6613, "mean_token_accuracy": 0.25147641003131865, "num_tokens": 135362831.0, "step": 59095 }, { "entropy": 5.3414998054504395, "epoch": 5.842230130486358, "grad_norm": 1.0859375, "learning_rate": 0.00021896274427573182, "loss": 4.7507, "mean_token_accuracy": 0.2525544539093971, "num_tokens": 135374497.0, "step": 59100 }, { "entropy": 5.32112865447998, "epoch": 5.84272439699486, "grad_norm": 1.09375, "learning_rate": 0.00021892856698848434, "loss": 4.7068, "mean_token_accuracy": 0.2510536700487137, "num_tokens": 135385551.0, "step": 59105 }, { "entropy": 5.348419141769409, "epoch": 5.843218663503361, "grad_norm": 1.109375, "learning_rate": 0.00021889439108060282, "loss": 4.7121, "mean_token_accuracy": 0.246978197991848, "num_tokens": 135397358.0, "step": 59110 }, { "entropy": 5.215839147567749, "epoch": 5.843712930011862, "grad_norm": 1.171875, "learning_rate": 0.00021886021655292794, "loss": 4.6253, "mean_token_accuracy": 0.25873481035232543, "num_tokens": 135409192.0, "step": 59115 }, { "entropy": 5.216147089004517, "epoch": 5.8442071965203635, "grad_norm": 1.046875, "learning_rate": 0.00021882604340630054, "loss": 4.5723, "mean_token_accuracy": 0.26673097908496857, "num_tokens": 135420871.0, "step": 59120 }, { "entropy": 5.264221620559693, "epoch": 5.844701463028866, "grad_norm": 1.1640625, "learning_rate": 0.000218791871641561, "loss": 4.7075, "mean_token_accuracy": 0.255261255800724, "num_tokens": 135432427.0, "step": 59125 }, { "entropy": 5.240932893753052, "epoch": 5.845195729537367, "grad_norm": 1.140625, "learning_rate": 0.0002187577012595503, "loss": 4.5397, "mean_token_accuracy": 0.2674389749765396, "num_tokens": 135443406.0, "step": 59130 }, { "entropy": 5.284672641754151, "epoch": 5.845689996045868, "grad_norm": 1.125, "learning_rate": 0.00021872353226110882, "loss": 4.6448, "mean_token_accuracy": 0.25457633286714554, "num_tokens": 135455873.0, "step": 59135 }, { "entropy": 5.293640041351319, "epoch": 5.846184262554369, "grad_norm": 1.1640625, "learning_rate": 0.00021868936464707717, "loss": 4.7106, "mean_token_accuracy": 0.24513415545225142, "num_tokens": 135466888.0, "step": 59140 }, { "entropy": 5.278534603118897, "epoch": 5.846678529062871, "grad_norm": 1.140625, "learning_rate": 0.0002186551984182959, "loss": 4.6583, "mean_token_accuracy": 0.25583946108818056, "num_tokens": 135477600.0, "step": 59145 }, { "entropy": 5.3167482852935795, "epoch": 5.847172795571372, "grad_norm": 1.1640625, "learning_rate": 0.00021862103357560555, "loss": 4.6919, "mean_token_accuracy": 0.251224622130394, "num_tokens": 135487858.0, "step": 59150 }, { "entropy": 5.255182123184204, "epoch": 5.847667062079873, "grad_norm": 1.046875, "learning_rate": 0.00021858687011984634, "loss": 4.6798, "mean_token_accuracy": 0.2507259428501129, "num_tokens": 135499733.0, "step": 59155 }, { "entropy": 5.259638071060181, "epoch": 5.848161328588375, "grad_norm": 1.125, "learning_rate": 0.000218552708051859, "loss": 4.6713, "mean_token_accuracy": 0.2541329085826874, "num_tokens": 135511392.0, "step": 59160 }, { "entropy": 5.374933528900146, "epoch": 5.848655595096877, "grad_norm": 1.15625, "learning_rate": 0.00021851854737248378, "loss": 4.7313, "mean_token_accuracy": 0.25254554450511935, "num_tokens": 135522216.0, "step": 59165 }, { "entropy": 5.305680274963379, "epoch": 5.849149861605378, "grad_norm": 1.1171875, "learning_rate": 0.0002184843880825611, "loss": 4.718, "mean_token_accuracy": 0.24723748713731766, "num_tokens": 135532827.0, "step": 59170 }, { "entropy": 5.255806255340576, "epoch": 5.849644128113879, "grad_norm": 1.1796875, "learning_rate": 0.00021845023018293125, "loss": 4.6749, "mean_token_accuracy": 0.252411937713623, "num_tokens": 135543810.0, "step": 59175 }, { "entropy": 5.295376873016357, "epoch": 5.85013839462238, "grad_norm": 1.0, "learning_rate": 0.0002184160736744344, "loss": 4.6839, "mean_token_accuracy": 0.25459219366312025, "num_tokens": 135555739.0, "step": 59180 }, { "entropy": 5.3024389266967775, "epoch": 5.850632661130882, "grad_norm": 1.0859375, "learning_rate": 0.00021838191855791096, "loss": 4.6852, "mean_token_accuracy": 0.2539178103208542, "num_tokens": 135567401.0, "step": 59185 }, { "entropy": 5.217557907104492, "epoch": 5.851126927639383, "grad_norm": 1.1015625, "learning_rate": 0.00021834776483420116, "loss": 4.5829, "mean_token_accuracy": 0.26496785283088686, "num_tokens": 135578143.0, "step": 59190 }, { "entropy": 5.253014993667603, "epoch": 5.851621194147884, "grad_norm": 1.1328125, "learning_rate": 0.00021831361250414512, "loss": 4.6969, "mean_token_accuracy": 0.2519460663199425, "num_tokens": 135589723.0, "step": 59195 }, { "entropy": 5.207141256332397, "epoch": 5.852115460656385, "grad_norm": 1.1171875, "learning_rate": 0.00021827946156858304, "loss": 4.578, "mean_token_accuracy": 0.25915981233119967, "num_tokens": 135600470.0, "step": 59200 }, { "entropy": 5.2628013610839846, "epoch": 5.852609727164888, "grad_norm": 1.1796875, "learning_rate": 0.00021824531202835497, "loss": 4.6227, "mean_token_accuracy": 0.25310508757829664, "num_tokens": 135611336.0, "step": 59205 }, { "entropy": 5.280354404449463, "epoch": 5.853103993673389, "grad_norm": 1.0390625, "learning_rate": 0.0002182111638843009, "loss": 4.6368, "mean_token_accuracy": 0.25422000885009766, "num_tokens": 135623628.0, "step": 59210 }, { "entropy": 5.284532880783081, "epoch": 5.85359826018189, "grad_norm": 1.1796875, "learning_rate": 0.00021817701713726113, "loss": 4.7145, "mean_token_accuracy": 0.24630671441555024, "num_tokens": 135635680.0, "step": 59215 }, { "entropy": 5.287928533554077, "epoch": 5.854092526690391, "grad_norm": 1.21875, "learning_rate": 0.00021814287178807557, "loss": 4.6419, "mean_token_accuracy": 0.24865728616714478, "num_tokens": 135646942.0, "step": 59220 }, { "entropy": 5.22866473197937, "epoch": 5.854586793198893, "grad_norm": 1.125, "learning_rate": 0.00021810872783758418, "loss": 4.5849, "mean_token_accuracy": 0.2582583725452423, "num_tokens": 135657667.0, "step": 59225 }, { "entropy": 5.204240417480468, "epoch": 5.855081059707394, "grad_norm": 1.1015625, "learning_rate": 0.00021807458528662693, "loss": 4.5534, "mean_token_accuracy": 0.26129143238067626, "num_tokens": 135669871.0, "step": 59230 }, { "entropy": 5.2876664161682125, "epoch": 5.855575326215895, "grad_norm": 1.109375, "learning_rate": 0.00021804044413604364, "loss": 4.748, "mean_token_accuracy": 0.2504708915948868, "num_tokens": 135681816.0, "step": 59235 }, { "entropy": 5.208367729187012, "epoch": 5.856069592724397, "grad_norm": 1.1953125, "learning_rate": 0.00021800630438667423, "loss": 4.6015, "mean_token_accuracy": 0.26269115805625914, "num_tokens": 135692252.0, "step": 59240 }, { "entropy": 5.333643054962158, "epoch": 5.856563859232899, "grad_norm": 1.1796875, "learning_rate": 0.00021797216603935865, "loss": 4.6976, "mean_token_accuracy": 0.25068326890468595, "num_tokens": 135703310.0, "step": 59245 }, { "entropy": 5.257510089874268, "epoch": 5.8570581257414, "grad_norm": 1.140625, "learning_rate": 0.00021793802909493665, "loss": 4.6468, "mean_token_accuracy": 0.257533523440361, "num_tokens": 135714286.0, "step": 59250 }, { "entropy": 5.329185438156128, "epoch": 5.857552392249901, "grad_norm": 1.1640625, "learning_rate": 0.000217903893554248, "loss": 4.7447, "mean_token_accuracy": 0.24694261997938155, "num_tokens": 135726159.0, "step": 59255 }, { "entropy": 5.303728437423706, "epoch": 5.858046658758402, "grad_norm": 1.0859375, "learning_rate": 0.00021786975941813237, "loss": 4.6345, "mean_token_accuracy": 0.2541266202926636, "num_tokens": 135737804.0, "step": 59260 }, { "entropy": 5.289577674865723, "epoch": 5.858540925266904, "grad_norm": 1.1796875, "learning_rate": 0.00021783562668742956, "loss": 4.6367, "mean_token_accuracy": 0.2491637125611305, "num_tokens": 135748322.0, "step": 59265 }, { "entropy": 5.322493648529052, "epoch": 5.859035191775405, "grad_norm": 1.15625, "learning_rate": 0.0002178014953629791, "loss": 4.6778, "mean_token_accuracy": 0.255936761200428, "num_tokens": 135758205.0, "step": 59270 }, { "entropy": 5.225548934936524, "epoch": 5.859529458283907, "grad_norm": 1.015625, "learning_rate": 0.00021776736544562082, "loss": 4.6506, "mean_token_accuracy": 0.25581264644861224, "num_tokens": 135769990.0, "step": 59275 }, { "entropy": 5.301343393325806, "epoch": 5.860023724792408, "grad_norm": 1.109375, "learning_rate": 0.00021773323693619423, "loss": 4.7056, "mean_token_accuracy": 0.24641674458980561, "num_tokens": 135780076.0, "step": 59280 }, { "entropy": 5.31547441482544, "epoch": 5.86051799130091, "grad_norm": 1.0859375, "learning_rate": 0.00021769910983553887, "loss": 4.8152, "mean_token_accuracy": 0.2450167343020439, "num_tokens": 135791160.0, "step": 59285 }, { "entropy": 5.323437786102295, "epoch": 5.861012257809411, "grad_norm": 1.140625, "learning_rate": 0.00021766498414449431, "loss": 4.6778, "mean_token_accuracy": 0.25292503982782366, "num_tokens": 135802065.0, "step": 59290 }, { "entropy": 5.271481990814209, "epoch": 5.861506524317912, "grad_norm": 1.1640625, "learning_rate": 0.00021763085986390007, "loss": 4.5856, "mean_token_accuracy": 0.2604666709899902, "num_tokens": 135812805.0, "step": 59295 }, { "entropy": 5.336743450164795, "epoch": 5.862000790826413, "grad_norm": 1.125, "learning_rate": 0.00021759673699459547, "loss": 4.7538, "mean_token_accuracy": 0.24907075017690658, "num_tokens": 135823553.0, "step": 59300 }, { "entropy": 5.251452922821045, "epoch": 5.862495057334915, "grad_norm": 1.171875, "learning_rate": 0.0002175626155374202, "loss": 4.6867, "mean_token_accuracy": 0.25726501941680907, "num_tokens": 135834157.0, "step": 59305 }, { "entropy": 5.253528690338134, "epoch": 5.862989323843417, "grad_norm": 1.203125, "learning_rate": 0.00021752849549321336, "loss": 4.7023, "mean_token_accuracy": 0.24617719352245332, "num_tokens": 135847025.0, "step": 59310 }, { "entropy": 5.312701177597046, "epoch": 5.863483590351918, "grad_norm": 1.25, "learning_rate": 0.00021749437686281454, "loss": 4.7382, "mean_token_accuracy": 0.24263826310634612, "num_tokens": 135857461.0, "step": 59315 }, { "entropy": 5.267415761947632, "epoch": 5.863977856860419, "grad_norm": 1.1328125, "learning_rate": 0.00021746025964706296, "loss": 4.6347, "mean_token_accuracy": 0.25834050178527834, "num_tokens": 135867756.0, "step": 59320 }, { "entropy": 5.293230724334717, "epoch": 5.8644721233689205, "grad_norm": 1.2421875, "learning_rate": 0.0002174261438467978, "loss": 4.703, "mean_token_accuracy": 0.25109429806470873, "num_tokens": 135878339.0, "step": 59325 }, { "entropy": 5.265733146667481, "epoch": 5.864966389877422, "grad_norm": 1.234375, "learning_rate": 0.00021739202946285857, "loss": 4.6384, "mean_token_accuracy": 0.25802492499351504, "num_tokens": 135889069.0, "step": 59330 }, { "entropy": 5.196050357818604, "epoch": 5.865460656385923, "grad_norm": 1.1484375, "learning_rate": 0.00021735791649608426, "loss": 4.6021, "mean_token_accuracy": 0.2612492278218269, "num_tokens": 135900013.0, "step": 59335 }, { "entropy": 5.3074205875396725, "epoch": 5.865954922894424, "grad_norm": 1.109375, "learning_rate": 0.00021732380494731424, "loss": 4.6825, "mean_token_accuracy": 0.2507460653781891, "num_tokens": 135911888.0, "step": 59340 }, { "entropy": 5.23461127281189, "epoch": 5.8664491894029265, "grad_norm": 1.078125, "learning_rate": 0.00021728969481738758, "loss": 4.5792, "mean_token_accuracy": 0.25887693613767626, "num_tokens": 135922450.0, "step": 59345 }, { "entropy": 5.23225769996643, "epoch": 5.866943455911428, "grad_norm": 1.1640625, "learning_rate": 0.0002172555861071433, "loss": 4.6175, "mean_token_accuracy": 0.25881020575761793, "num_tokens": 135934557.0, "step": 59350 }, { "entropy": 5.192487955093384, "epoch": 5.867437722419929, "grad_norm": 1.0546875, "learning_rate": 0.0002172214788174205, "loss": 4.6124, "mean_token_accuracy": 0.25534365624189376, "num_tokens": 135946243.0, "step": 59355 }, { "entropy": 5.290240621566772, "epoch": 5.86793198892843, "grad_norm": 1.2421875, "learning_rate": 0.00021718737294905833, "loss": 4.7171, "mean_token_accuracy": 0.24565160423517227, "num_tokens": 135958639.0, "step": 59360 }, { "entropy": 5.3126438617706295, "epoch": 5.8684262554369315, "grad_norm": 1.140625, "learning_rate": 0.00021715326850289585, "loss": 4.7163, "mean_token_accuracy": 0.2543079242110252, "num_tokens": 135970702.0, "step": 59365 }, { "entropy": 5.2226509094238285, "epoch": 5.868920521945433, "grad_norm": 1.0625, "learning_rate": 0.00021711916547977189, "loss": 4.5937, "mean_token_accuracy": 0.2668456494808197, "num_tokens": 135982617.0, "step": 59370 }, { "entropy": 5.274036455154419, "epoch": 5.869414788453934, "grad_norm": 1.1015625, "learning_rate": 0.00021708506388052546, "loss": 4.699, "mean_token_accuracy": 0.2568742007017136, "num_tokens": 135994665.0, "step": 59375 }, { "entropy": 5.311414909362793, "epoch": 5.869909054962436, "grad_norm": 1.234375, "learning_rate": 0.00021705096370599537, "loss": 4.6965, "mean_token_accuracy": 0.25481265485286714, "num_tokens": 136004468.0, "step": 59380 }, { "entropy": 5.248099517822266, "epoch": 5.8704033214709375, "grad_norm": 1.0703125, "learning_rate": 0.00021701686495702056, "loss": 4.6134, "mean_token_accuracy": 0.2578641504049301, "num_tokens": 136015822.0, "step": 59385 }, { "entropy": 5.227519702911377, "epoch": 5.870897587979439, "grad_norm": 1.078125, "learning_rate": 0.0002169827676344399, "loss": 4.5877, "mean_token_accuracy": 0.26486303806304934, "num_tokens": 136027815.0, "step": 59390 }, { "entropy": 5.278123664855957, "epoch": 5.87139185448794, "grad_norm": 1.15625, "learning_rate": 0.00021694867173909223, "loss": 4.5994, "mean_token_accuracy": 0.25279889404773714, "num_tokens": 136039022.0, "step": 59395 }, { "entropy": 5.343494606018067, "epoch": 5.871886120996441, "grad_norm": 1.1015625, "learning_rate": 0.0002169145772718162, "loss": 4.7643, "mean_token_accuracy": 0.24922463446855544, "num_tokens": 136050247.0, "step": 59400 }, { "entropy": 5.293714904785157, "epoch": 5.8723803875049425, "grad_norm": 1.125, "learning_rate": 0.00021688048423345053, "loss": 4.6933, "mean_token_accuracy": 0.24742363691329955, "num_tokens": 136061344.0, "step": 59405 }, { "entropy": 5.179551792144776, "epoch": 5.872874654013444, "grad_norm": 1.2265625, "learning_rate": 0.00021684639262483402, "loss": 4.6097, "mean_token_accuracy": 0.264478300511837, "num_tokens": 136073127.0, "step": 59410 }, { "entropy": 5.248334074020386, "epoch": 5.873368920521946, "grad_norm": 1.078125, "learning_rate": 0.00021681230244680516, "loss": 4.6575, "mean_token_accuracy": 0.2593798041343689, "num_tokens": 136087595.0, "step": 59415 }, { "entropy": 5.3174444198608395, "epoch": 5.873863187030447, "grad_norm": 1.1171875, "learning_rate": 0.00021677821370020284, "loss": 4.7526, "mean_token_accuracy": 0.24758855253458023, "num_tokens": 136099695.0, "step": 59420 }, { "entropy": 5.332196235656738, "epoch": 5.8743574535389484, "grad_norm": 1.125, "learning_rate": 0.0002167441263858654, "loss": 4.7305, "mean_token_accuracy": 0.2445821911096573, "num_tokens": 136111540.0, "step": 59425 }, { "entropy": 5.328410243988037, "epoch": 5.87485172004745, "grad_norm": 1.1484375, "learning_rate": 0.0002167100405046315, "loss": 4.6536, "mean_token_accuracy": 0.24929152876138688, "num_tokens": 136123020.0, "step": 59430 }, { "entropy": 5.289794015884399, "epoch": 5.875345986555951, "grad_norm": 1.0078125, "learning_rate": 0.0002166759560573397, "loss": 4.6912, "mean_token_accuracy": 0.252080637216568, "num_tokens": 136134221.0, "step": 59435 }, { "entropy": 5.363857555389404, "epoch": 5.875840253064452, "grad_norm": 1.046875, "learning_rate": 0.0002166418730448284, "loss": 4.8022, "mean_token_accuracy": 0.23917666375637053, "num_tokens": 136146877.0, "step": 59440 }, { "entropy": 5.262921905517578, "epoch": 5.8763345195729535, "grad_norm": 1.1171875, "learning_rate": 0.000216607791467936, "loss": 4.6606, "mean_token_accuracy": 0.25821663737297057, "num_tokens": 136158582.0, "step": 59445 }, { "entropy": 5.13961443901062, "epoch": 5.876828786081455, "grad_norm": 1.109375, "learning_rate": 0.0002165737113275011, "loss": 4.537, "mean_token_accuracy": 0.26687351763248446, "num_tokens": 136169782.0, "step": 59450 }, { "entropy": 5.282361650466919, "epoch": 5.877323052589956, "grad_norm": 1.1875, "learning_rate": 0.00021653963262436188, "loss": 4.7039, "mean_token_accuracy": 0.24709629863500596, "num_tokens": 136180999.0, "step": 59455 }, { "entropy": 5.273737001419067, "epoch": 5.877817319098458, "grad_norm": 1.3125, "learning_rate": 0.00021650555535935684, "loss": 4.5984, "mean_token_accuracy": 0.26515246629714967, "num_tokens": 136191517.0, "step": 59460 }, { "entropy": 5.189001417160034, "epoch": 5.878311585606959, "grad_norm": 1.0625, "learning_rate": 0.00021647147953332424, "loss": 4.572, "mean_token_accuracy": 0.2631301924586296, "num_tokens": 136204154.0, "step": 59465 }, { "entropy": 5.267362785339356, "epoch": 5.878805852115461, "grad_norm": 1.234375, "learning_rate": 0.0002164374051471022, "loss": 4.6191, "mean_token_accuracy": 0.25841153264045713, "num_tokens": 136214884.0, "step": 59470 }, { "entropy": 5.27015061378479, "epoch": 5.879300118623962, "grad_norm": 1.09375, "learning_rate": 0.00021640333220152914, "loss": 4.6597, "mean_token_accuracy": 0.25499957650899885, "num_tokens": 136226117.0, "step": 59475 }, { "entropy": 5.2194970607757565, "epoch": 5.879794385132463, "grad_norm": 1.109375, "learning_rate": 0.00021636926069744318, "loss": 4.6533, "mean_token_accuracy": 0.257870015501976, "num_tokens": 136237369.0, "step": 59480 }, { "entropy": 5.26517276763916, "epoch": 5.8802886516409645, "grad_norm": 1.109375, "learning_rate": 0.00021633519063568251, "loss": 4.7079, "mean_token_accuracy": 0.24730570912361144, "num_tokens": 136248366.0, "step": 59485 }, { "entropy": 5.2436583042144775, "epoch": 5.880782918149466, "grad_norm": 1.0703125, "learning_rate": 0.00021630112201708536, "loss": 4.5994, "mean_token_accuracy": 0.2571489155292511, "num_tokens": 136259662.0, "step": 59490 }, { "entropy": 5.263917732238769, "epoch": 5.881277184657968, "grad_norm": 1.1015625, "learning_rate": 0.0002162670548424896, "loss": 4.623, "mean_token_accuracy": 0.26626481413841246, "num_tokens": 136269749.0, "step": 59495 }, { "entropy": 5.288874101638794, "epoch": 5.881771451166469, "grad_norm": 1.1015625, "learning_rate": 0.00021623298911273338, "loss": 4.6632, "mean_token_accuracy": 0.2564545661211014, "num_tokens": 136281075.0, "step": 59500 }, { "entropy": 5.270968055725097, "epoch": 5.88226571767497, "grad_norm": 1.140625, "learning_rate": 0.00021619892482865473, "loss": 4.6797, "mean_token_accuracy": 0.25307177752256393, "num_tokens": 136292122.0, "step": 59505 }, { "entropy": 5.3185834884643555, "epoch": 5.882759984183472, "grad_norm": 1.046875, "learning_rate": 0.00021616486199109176, "loss": 4.7631, "mean_token_accuracy": 0.24419911801815034, "num_tokens": 136304415.0, "step": 59510 }, { "entropy": 5.296946001052857, "epoch": 5.883254250691973, "grad_norm": 1.1640625, "learning_rate": 0.00021613080060088225, "loss": 4.6356, "mean_token_accuracy": 0.25518050193786623, "num_tokens": 136315121.0, "step": 59515 }, { "entropy": 5.316010808944702, "epoch": 5.883748517200474, "grad_norm": 1.1015625, "learning_rate": 0.0002160967406588642, "loss": 4.6865, "mean_token_accuracy": 0.2472602754831314, "num_tokens": 136326854.0, "step": 59520 }, { "entropy": 5.385586929321289, "epoch": 5.8842427837089755, "grad_norm": 1.140625, "learning_rate": 0.00021606268216587548, "loss": 4.7995, "mean_token_accuracy": 0.23686490207910538, "num_tokens": 136337667.0, "step": 59525 }, { "entropy": 5.256987237930298, "epoch": 5.884737050217478, "grad_norm": 1.125, "learning_rate": 0.00021602862512275385, "loss": 4.5928, "mean_token_accuracy": 0.2598725289106369, "num_tokens": 136349022.0, "step": 59530 }, { "entropy": 5.2693956851959225, "epoch": 5.885231316725979, "grad_norm": 1.125, "learning_rate": 0.00021599456953033726, "loss": 4.7066, "mean_token_accuracy": 0.25118523836135864, "num_tokens": 136360822.0, "step": 59535 }, { "entropy": 5.16657247543335, "epoch": 5.88572558323448, "grad_norm": 1.125, "learning_rate": 0.00021596051538946338, "loss": 4.5456, "mean_token_accuracy": 0.26898941546678545, "num_tokens": 136370695.0, "step": 59540 }, { "entropy": 5.395896005630493, "epoch": 5.886219849742981, "grad_norm": 1.0546875, "learning_rate": 0.00021592646270097, "loss": 4.7687, "mean_token_accuracy": 0.23900571018457412, "num_tokens": 136382539.0, "step": 59545 }, { "entropy": 5.22746262550354, "epoch": 5.886714116251483, "grad_norm": 1.0390625, "learning_rate": 0.00021589241146569482, "loss": 4.5965, "mean_token_accuracy": 0.25464722961187364, "num_tokens": 136394867.0, "step": 59550 }, { "entropy": 5.262306213378906, "epoch": 5.887208382759984, "grad_norm": 1.15625, "learning_rate": 0.00021585836168447548, "loss": 4.6242, "mean_token_accuracy": 0.2555686146020889, "num_tokens": 136405332.0, "step": 59555 }, { "entropy": 5.422399282455444, "epoch": 5.887702649268485, "grad_norm": 1.1328125, "learning_rate": 0.00021582431335814955, "loss": 4.7823, "mean_token_accuracy": 0.24231945723295212, "num_tokens": 136416960.0, "step": 59560 }, { "entropy": 5.266322040557862, "epoch": 5.888196915776987, "grad_norm": 1.2578125, "learning_rate": 0.00021579026648755473, "loss": 4.6554, "mean_token_accuracy": 0.25542468279600145, "num_tokens": 136427376.0, "step": 59565 }, { "entropy": 5.182742547988892, "epoch": 5.888691182285489, "grad_norm": 1.0546875, "learning_rate": 0.00021575622107352854, "loss": 4.5972, "mean_token_accuracy": 0.2586956799030304, "num_tokens": 136439663.0, "step": 59570 }, { "entropy": 5.260501050949097, "epoch": 5.88918544879399, "grad_norm": 1.0703125, "learning_rate": 0.00021572217711690855, "loss": 4.6167, "mean_token_accuracy": 0.25063482373952867, "num_tokens": 136451395.0, "step": 59575 }, { "entropy": 5.278705835342407, "epoch": 5.889679715302491, "grad_norm": 1.203125, "learning_rate": 0.0002156881346185322, "loss": 4.7163, "mean_token_accuracy": 0.24787995219230652, "num_tokens": 136461917.0, "step": 59580 }, { "entropy": 5.284893321990967, "epoch": 5.890173981810992, "grad_norm": 1.1875, "learning_rate": 0.00021565409357923694, "loss": 4.6761, "mean_token_accuracy": 0.25119067877531054, "num_tokens": 136472973.0, "step": 59585 }, { "entropy": 5.221964168548584, "epoch": 5.890668248319494, "grad_norm": 1.0625, "learning_rate": 0.00021562005399986006, "loss": 4.6247, "mean_token_accuracy": 0.25280887484550474, "num_tokens": 136484400.0, "step": 59590 }, { "entropy": 5.2676554203033445, "epoch": 5.891162514827995, "grad_norm": 1.1328125, "learning_rate": 0.00021558601588123917, "loss": 4.7129, "mean_token_accuracy": 0.25114126652479174, "num_tokens": 136496334.0, "step": 59595 }, { "entropy": 5.310128116607666, "epoch": 5.891656781336497, "grad_norm": 1.0859375, "learning_rate": 0.00021555197922421148, "loss": 4.73, "mean_token_accuracy": 0.24532498121261598, "num_tokens": 136508108.0, "step": 59600 }, { "entropy": 5.297619485855103, "epoch": 5.892151047844998, "grad_norm": 1.1796875, "learning_rate": 0.00021551794402961433, "loss": 4.7312, "mean_token_accuracy": 0.2439357027411461, "num_tokens": 136520356.0, "step": 59605 }, { "entropy": 5.230239486694336, "epoch": 5.8926453143535, "grad_norm": 1.140625, "learning_rate": 0.00021548391029828506, "loss": 4.5771, "mean_token_accuracy": 0.2592796355485916, "num_tokens": 136531636.0, "step": 59610 }, { "entropy": 5.281600713729858, "epoch": 5.893139580862001, "grad_norm": 1.1640625, "learning_rate": 0.00021544987803106074, "loss": 4.6664, "mean_token_accuracy": 0.25454442799091337, "num_tokens": 136543144.0, "step": 59615 }, { "entropy": 5.363063621520996, "epoch": 5.893633847370502, "grad_norm": 1.1015625, "learning_rate": 0.0002154158472287786, "loss": 4.7737, "mean_token_accuracy": 0.24196581393480301, "num_tokens": 136554630.0, "step": 59620 }, { "entropy": 5.306976747512818, "epoch": 5.894128113879003, "grad_norm": 1.1484375, "learning_rate": 0.00021538181789227596, "loss": 4.647, "mean_token_accuracy": 0.24737405329942702, "num_tokens": 136565906.0, "step": 59625 }, { "entropy": 5.35786075592041, "epoch": 5.894622380387505, "grad_norm": 1.1796875, "learning_rate": 0.00021534779002238986, "loss": 4.7844, "mean_token_accuracy": 0.2456753209233284, "num_tokens": 136578118.0, "step": 59630 }, { "entropy": 5.321265363693238, "epoch": 5.895116646896007, "grad_norm": 1.1328125, "learning_rate": 0.00021531376361995735, "loss": 4.7697, "mean_token_accuracy": 0.24114238917827607, "num_tokens": 136588870.0, "step": 59635 }, { "entropy": 5.41204571723938, "epoch": 5.895610913404508, "grad_norm": 1.171875, "learning_rate": 0.00021527973868581553, "loss": 4.8034, "mean_token_accuracy": 0.24065160602331162, "num_tokens": 136600662.0, "step": 59640 }, { "entropy": 5.3439501285552975, "epoch": 5.896105179913009, "grad_norm": 1.21875, "learning_rate": 0.00021524571522080126, "loss": 4.6931, "mean_token_accuracy": 0.25205252766609193, "num_tokens": 136611876.0, "step": 59645 }, { "entropy": 5.347116088867187, "epoch": 5.896599446421511, "grad_norm": 1.1875, "learning_rate": 0.00021521169322575185, "loss": 4.7725, "mean_token_accuracy": 0.2461436226963997, "num_tokens": 136623404.0, "step": 59650 }, { "entropy": 5.2283988952636715, "epoch": 5.897093712930012, "grad_norm": 1.1015625, "learning_rate": 0.000215177672701504, "loss": 4.6555, "mean_token_accuracy": 0.2552936479449272, "num_tokens": 136636301.0, "step": 59655 }, { "entropy": 5.3440549850463865, "epoch": 5.897587979438513, "grad_norm": 1.1328125, "learning_rate": 0.00021514365364889472, "loss": 4.7299, "mean_token_accuracy": 0.24940306097269058, "num_tokens": 136647892.0, "step": 59660 }, { "entropy": 5.2946892261505125, "epoch": 5.898082245947014, "grad_norm": 1.0703125, "learning_rate": 0.00021510963606876082, "loss": 4.6709, "mean_token_accuracy": 0.2537445992231369, "num_tokens": 136658946.0, "step": 59665 }, { "entropy": 5.261640501022339, "epoch": 5.8985765124555165, "grad_norm": 1.125, "learning_rate": 0.00021507561996193914, "loss": 4.6507, "mean_token_accuracy": 0.25824069082736967, "num_tokens": 136670148.0, "step": 59670 }, { "entropy": 5.35985951423645, "epoch": 5.899070778964018, "grad_norm": 1.1953125, "learning_rate": 0.00021504160532926647, "loss": 4.7832, "mean_token_accuracy": 0.23748346120119096, "num_tokens": 136681910.0, "step": 59675 }, { "entropy": 5.2258336544036865, "epoch": 5.899565045472519, "grad_norm": 1.1640625, "learning_rate": 0.00021500759217157967, "loss": 4.5583, "mean_token_accuracy": 0.2651487052440643, "num_tokens": 136693297.0, "step": 59680 }, { "entropy": 5.240484237670898, "epoch": 5.90005931198102, "grad_norm": 1.03125, "learning_rate": 0.00021497358048971544, "loss": 4.6487, "mean_token_accuracy": 0.2476037859916687, "num_tokens": 136704655.0, "step": 59685 }, { "entropy": 5.245847225189209, "epoch": 5.9005535784895216, "grad_norm": 1.1875, "learning_rate": 0.00021493957028451038, "loss": 4.6648, "mean_token_accuracy": 0.255948095023632, "num_tokens": 136715987.0, "step": 59690 }, { "entropy": 5.334214878082276, "epoch": 5.901047844998023, "grad_norm": 1.2109375, "learning_rate": 0.00021490556155680124, "loss": 4.7009, "mean_token_accuracy": 0.25280345380306246, "num_tokens": 136726677.0, "step": 59695 }, { "entropy": 5.214906978607178, "epoch": 5.901542111506524, "grad_norm": 1.15625, "learning_rate": 0.00021487155430742466, "loss": 4.5858, "mean_token_accuracy": 0.26250670701265333, "num_tokens": 136738248.0, "step": 59700 }, { "entropy": 5.250762224197388, "epoch": 5.902036378015025, "grad_norm": 1.1640625, "learning_rate": 0.00021483754853721698, "loss": 4.6189, "mean_token_accuracy": 0.25905684381723404, "num_tokens": 136750375.0, "step": 59705 }, { "entropy": 5.203765249252319, "epoch": 5.902530644523527, "grad_norm": 1.140625, "learning_rate": 0.0002148035442470151, "loss": 4.6302, "mean_token_accuracy": 0.25739995688199996, "num_tokens": 136762400.0, "step": 59710 }, { "entropy": 5.289454698562622, "epoch": 5.903024911032029, "grad_norm": 1.1953125, "learning_rate": 0.0002147695414376553, "loss": 4.661, "mean_token_accuracy": 0.25513860285282136, "num_tokens": 136773540.0, "step": 59715 }, { "entropy": 5.228146171569824, "epoch": 5.90351917754053, "grad_norm": 1.0859375, "learning_rate": 0.00021473554010997427, "loss": 4.6386, "mean_token_accuracy": 0.2554102882742882, "num_tokens": 136786104.0, "step": 59720 }, { "entropy": 5.307863998413086, "epoch": 5.904013444049031, "grad_norm": 1.234375, "learning_rate": 0.0002147015402648082, "loss": 4.7445, "mean_token_accuracy": 0.24968426078557968, "num_tokens": 136796718.0, "step": 59725 }, { "entropy": 5.368790245056152, "epoch": 5.9045077105575325, "grad_norm": 1.03125, "learning_rate": 0.00021466754190299354, "loss": 4.7761, "mean_token_accuracy": 0.23721333593130112, "num_tokens": 136809667.0, "step": 59730 }, { "entropy": 5.26820216178894, "epoch": 5.905001977066034, "grad_norm": 1.0859375, "learning_rate": 0.00021463354502536676, "loss": 4.5965, "mean_token_accuracy": 0.25941411405801773, "num_tokens": 136821728.0, "step": 59735 }, { "entropy": 5.298661375045777, "epoch": 5.905496243574535, "grad_norm": 1.1640625, "learning_rate": 0.00021459954963276413, "loss": 4.623, "mean_token_accuracy": 0.2528105705976486, "num_tokens": 136832590.0, "step": 59740 }, { "entropy": 5.2772722244262695, "epoch": 5.905990510083036, "grad_norm": 1.0859375, "learning_rate": 0.00021456555572602198, "loss": 4.6402, "mean_token_accuracy": 0.25797893702983854, "num_tokens": 136844488.0, "step": 59745 }, { "entropy": 5.27650408744812, "epoch": 5.9064847765915385, "grad_norm": 1.0234375, "learning_rate": 0.0002145315633059765, "loss": 4.6828, "mean_token_accuracy": 0.2488187685608864, "num_tokens": 136855737.0, "step": 59750 }, { "entropy": 5.213615083694458, "epoch": 5.90697904310004, "grad_norm": 1.140625, "learning_rate": 0.00021449757237346396, "loss": 4.6092, "mean_token_accuracy": 0.26293585151433946, "num_tokens": 136866929.0, "step": 59755 }, { "entropy": 5.266695261001587, "epoch": 5.907473309608541, "grad_norm": 1.203125, "learning_rate": 0.0002144635829293205, "loss": 4.6743, "mean_token_accuracy": 0.2487306997179985, "num_tokens": 136878138.0, "step": 59760 }, { "entropy": 5.297507286071777, "epoch": 5.907967576117042, "grad_norm": 1.1484375, "learning_rate": 0.00021442959497438224, "loss": 4.6412, "mean_token_accuracy": 0.2559524610638618, "num_tokens": 136889113.0, "step": 59765 }, { "entropy": 5.251412057876587, "epoch": 5.9084618426255435, "grad_norm": 1.1640625, "learning_rate": 0.00021439560850948549, "loss": 4.6198, "mean_token_accuracy": 0.2610245794057846, "num_tokens": 136900066.0, "step": 59770 }, { "entropy": 5.266734552383423, "epoch": 5.908956109134045, "grad_norm": 1.2109375, "learning_rate": 0.00021436162353546612, "loss": 4.6581, "mean_token_accuracy": 0.2513886734843254, "num_tokens": 136911559.0, "step": 59775 }, { "entropy": 5.237381362915039, "epoch": 5.909450375642546, "grad_norm": 1.0078125, "learning_rate": 0.00021432764005316013, "loss": 4.678, "mean_token_accuracy": 0.2514832764863968, "num_tokens": 136923784.0, "step": 59780 }, { "entropy": 5.309071588516235, "epoch": 5.909944642151048, "grad_norm": 1.125, "learning_rate": 0.00021429365806340374, "loss": 4.6832, "mean_token_accuracy": 0.25293323397636414, "num_tokens": 136933995.0, "step": 59785 }, { "entropy": 5.333651828765869, "epoch": 5.9104389086595495, "grad_norm": 1.265625, "learning_rate": 0.00021425967756703274, "loss": 4.7414, "mean_token_accuracy": 0.2507322981953621, "num_tokens": 136944735.0, "step": 59790 }, { "entropy": 5.33367166519165, "epoch": 5.910933175168051, "grad_norm": 1.15625, "learning_rate": 0.00021422569856488298, "loss": 4.7343, "mean_token_accuracy": 0.24918808788061142, "num_tokens": 136955803.0, "step": 59795 }, { "entropy": 5.225466918945313, "epoch": 5.911427441676552, "grad_norm": 1.25, "learning_rate": 0.00021419172105779057, "loss": 4.6041, "mean_token_accuracy": 0.2604833751916885, "num_tokens": 136965950.0, "step": 59800 }, { "entropy": 5.305571794509888, "epoch": 5.911921708185053, "grad_norm": 1.1171875, "learning_rate": 0.00021415774504659124, "loss": 4.6673, "mean_token_accuracy": 0.2596899107098579, "num_tokens": 136977297.0, "step": 59805 }, { "entropy": 5.347737455368042, "epoch": 5.9124159746935545, "grad_norm": 1.1015625, "learning_rate": 0.00021412377053212078, "loss": 4.7752, "mean_token_accuracy": 0.24813298434019088, "num_tokens": 136989662.0, "step": 59810 }, { "entropy": 5.440123176574707, "epoch": 5.912910241202056, "grad_norm": 1.1953125, "learning_rate": 0.00021408979751521507, "loss": 4.8516, "mean_token_accuracy": 0.23850353807210922, "num_tokens": 136999654.0, "step": 59815 }, { "entropy": 5.288244342803955, "epoch": 5.913404507710558, "grad_norm": 1.140625, "learning_rate": 0.0002140558259967097, "loss": 4.6617, "mean_token_accuracy": 0.2561812326312065, "num_tokens": 137011365.0, "step": 59820 }, { "entropy": 5.2764973640441895, "epoch": 5.913898774219059, "grad_norm": 1.078125, "learning_rate": 0.00021402185597744057, "loss": 4.6543, "mean_token_accuracy": 0.2597227647900581, "num_tokens": 137022436.0, "step": 59825 }, { "entropy": 5.2646583080291744, "epoch": 5.9143930407275604, "grad_norm": 1.21875, "learning_rate": 0.00021398788745824316, "loss": 4.7003, "mean_token_accuracy": 0.25234340131282806, "num_tokens": 137033271.0, "step": 59830 }, { "entropy": 5.207080888748169, "epoch": 5.914887307236062, "grad_norm": 1.09375, "learning_rate": 0.00021395392043995328, "loss": 4.649, "mean_token_accuracy": 0.2582075774669647, "num_tokens": 137045562.0, "step": 59835 }, { "entropy": 5.349876928329468, "epoch": 5.915381573744563, "grad_norm": 1.1015625, "learning_rate": 0.00021391995492340638, "loss": 4.7736, "mean_token_accuracy": 0.2484480157494545, "num_tokens": 137057727.0, "step": 59840 }, { "entropy": 5.3397153377532955, "epoch": 5.915875840253064, "grad_norm": 1.1328125, "learning_rate": 0.0002138859909094381, "loss": 4.7141, "mean_token_accuracy": 0.24258273243904113, "num_tokens": 137068147.0, "step": 59845 }, { "entropy": 5.279698181152344, "epoch": 5.9163701067615655, "grad_norm": 1.140625, "learning_rate": 0.0002138520283988838, "loss": 4.6434, "mean_token_accuracy": 0.25727186948060987, "num_tokens": 137078635.0, "step": 59850 }, { "entropy": 5.318808364868164, "epoch": 5.916864373270068, "grad_norm": 1.2734375, "learning_rate": 0.00021381806739257915, "loss": 4.6876, "mean_token_accuracy": 0.24766695648431777, "num_tokens": 137089959.0, "step": 59855 }, { "entropy": 5.1951347351074215, "epoch": 5.917358639778569, "grad_norm": 1.0546875, "learning_rate": 0.0002137841078913596, "loss": 4.5768, "mean_token_accuracy": 0.2627391219139099, "num_tokens": 137100809.0, "step": 59860 }, { "entropy": 5.289506530761718, "epoch": 5.91785290628707, "grad_norm": 1.1171875, "learning_rate": 0.00021375014989606045, "loss": 4.6772, "mean_token_accuracy": 0.2550777167081833, "num_tokens": 137112713.0, "step": 59865 }, { "entropy": 5.273782777786255, "epoch": 5.918347172795571, "grad_norm": 1.09375, "learning_rate": 0.00021371619340751713, "loss": 4.6573, "mean_token_accuracy": 0.24836371541023256, "num_tokens": 137124503.0, "step": 59870 }, { "entropy": 5.234775447845459, "epoch": 5.918841439304073, "grad_norm": 1.234375, "learning_rate": 0.00021368223842656493, "loss": 4.6199, "mean_token_accuracy": 0.2555977329611778, "num_tokens": 137135664.0, "step": 59875 }, { "entropy": 5.2974433422088625, "epoch": 5.919335705812574, "grad_norm": 1.25, "learning_rate": 0.00021364828495403916, "loss": 4.6342, "mean_token_accuracy": 0.2552985519170761, "num_tokens": 137146385.0, "step": 59880 }, { "entropy": 5.2522930145263675, "epoch": 5.919829972321075, "grad_norm": 1.2265625, "learning_rate": 0.00021361433299077516, "loss": 4.6485, "mean_token_accuracy": 0.2600468501448631, "num_tokens": 137157973.0, "step": 59885 }, { "entropy": 5.3380578517913815, "epoch": 5.920324238829577, "grad_norm": 1.25, "learning_rate": 0.00021358038253760803, "loss": 4.7467, "mean_token_accuracy": 0.24228793978691102, "num_tokens": 137169548.0, "step": 59890 }, { "entropy": 5.2571875095367435, "epoch": 5.920818505338079, "grad_norm": 1.078125, "learning_rate": 0.00021354643359537313, "loss": 4.632, "mean_token_accuracy": 0.2565244480967522, "num_tokens": 137181059.0, "step": 59895 }, { "entropy": 5.300220775604248, "epoch": 5.92131277184658, "grad_norm": 1.09375, "learning_rate": 0.00021351248616490538, "loss": 4.743, "mean_token_accuracy": 0.23924691379070281, "num_tokens": 137191830.0, "step": 59900 }, { "entropy": 5.229864549636841, "epoch": 5.921807038355081, "grad_norm": 1.0703125, "learning_rate": 0.00021347854024704005, "loss": 4.5972, "mean_token_accuracy": 0.2620153546333313, "num_tokens": 137203613.0, "step": 59905 }, { "entropy": 5.28881688117981, "epoch": 5.922301304863582, "grad_norm": 1.1328125, "learning_rate": 0.00021344459584261206, "loss": 4.6603, "mean_token_accuracy": 0.2501544550061226, "num_tokens": 137214507.0, "step": 59910 }, { "entropy": 5.278595781326294, "epoch": 5.922795571372084, "grad_norm": 1.078125, "learning_rate": 0.0002134106529524567, "loss": 4.6212, "mean_token_accuracy": 0.24751427322626113, "num_tokens": 137225066.0, "step": 59915 }, { "entropy": 5.293100643157959, "epoch": 5.923289837880585, "grad_norm": 1.171875, "learning_rate": 0.00021337671157740885, "loss": 4.7087, "mean_token_accuracy": 0.24607776552438737, "num_tokens": 137236799.0, "step": 59920 }, { "entropy": 5.286809301376342, "epoch": 5.923784104389087, "grad_norm": 1.2578125, "learning_rate": 0.00021334277171830335, "loss": 4.6711, "mean_token_accuracy": 0.25102903991937636, "num_tokens": 137247517.0, "step": 59925 }, { "entropy": 5.172989368438721, "epoch": 5.924278370897588, "grad_norm": 1.09375, "learning_rate": 0.00021330883337597535, "loss": 4.5897, "mean_token_accuracy": 0.2713688164949417, "num_tokens": 137259695.0, "step": 59930 }, { "entropy": 5.2670056343078615, "epoch": 5.92477263740609, "grad_norm": 1.125, "learning_rate": 0.0002132748965512596, "loss": 4.7118, "mean_token_accuracy": 0.2504877641797066, "num_tokens": 137270781.0, "step": 59935 }, { "entropy": 5.273150444030762, "epoch": 5.925266903914591, "grad_norm": 1.0859375, "learning_rate": 0.00021324096124499082, "loss": 4.6877, "mean_token_accuracy": 0.2514845564961433, "num_tokens": 137282768.0, "step": 59940 }, { "entropy": 5.333159923553467, "epoch": 5.925761170423092, "grad_norm": 1.0859375, "learning_rate": 0.00021320702745800414, "loss": 4.6831, "mean_token_accuracy": 0.24502671658992767, "num_tokens": 137294130.0, "step": 59945 }, { "entropy": 5.314053249359131, "epoch": 5.926255436931593, "grad_norm": 1.078125, "learning_rate": 0.0002131730951911341, "loss": 4.7486, "mean_token_accuracy": 0.24824512749910355, "num_tokens": 137307301.0, "step": 59950 }, { "entropy": 5.272387266159058, "epoch": 5.926749703440095, "grad_norm": 1.1015625, "learning_rate": 0.00021313916444521552, "loss": 4.7433, "mean_token_accuracy": 0.24766044616699218, "num_tokens": 137318629.0, "step": 59955 }, { "entropy": 5.285764169692993, "epoch": 5.927243969948596, "grad_norm": 1.1015625, "learning_rate": 0.00021310523522108312, "loss": 4.6912, "mean_token_accuracy": 0.251106308400631, "num_tokens": 137330557.0, "step": 59960 }, { "entropy": 5.291593170166015, "epoch": 5.927738236457097, "grad_norm": 1.1484375, "learning_rate": 0.00021307130751957145, "loss": 4.6593, "mean_token_accuracy": 0.2604203253984451, "num_tokens": 137341223.0, "step": 59965 }, { "entropy": 5.348234176635742, "epoch": 5.928232502965599, "grad_norm": 1.0390625, "learning_rate": 0.0002130373813415153, "loss": 4.7642, "mean_token_accuracy": 0.24672852456569672, "num_tokens": 137354058.0, "step": 59970 }, { "entropy": 5.296988773345947, "epoch": 5.928726769474101, "grad_norm": 1.1015625, "learning_rate": 0.0002130034566877492, "loss": 4.7211, "mean_token_accuracy": 0.25304197072982787, "num_tokens": 137366467.0, "step": 59975 }, { "entropy": 5.411295557022095, "epoch": 5.929221035982602, "grad_norm": 1.0546875, "learning_rate": 0.0002129695335591076, "loss": 4.7207, "mean_token_accuracy": 0.24456409513950347, "num_tokens": 137378834.0, "step": 59980 }, { "entropy": 5.260953569412232, "epoch": 5.929715302491103, "grad_norm": 1.15625, "learning_rate": 0.00021293561195642518, "loss": 4.6945, "mean_token_accuracy": 0.2517340540885925, "num_tokens": 137391281.0, "step": 59985 }, { "entropy": 5.247713184356689, "epoch": 5.930209568999604, "grad_norm": 1.296875, "learning_rate": 0.00021290169188053633, "loss": 4.6696, "mean_token_accuracy": 0.2490007221698761, "num_tokens": 137401371.0, "step": 59990 }, { "entropy": 5.322457885742187, "epoch": 5.930703835508106, "grad_norm": 1.203125, "learning_rate": 0.00021286777333227535, "loss": 4.7023, "mean_token_accuracy": 0.25132164508104327, "num_tokens": 137411971.0, "step": 59995 }, { "entropy": 5.294814825057983, "epoch": 5.931198102016607, "grad_norm": 1.1640625, "learning_rate": 0.00021283385631247687, "loss": 4.6454, "mean_token_accuracy": 0.25633516162633896, "num_tokens": 137423138.0, "step": 60000 }, { "epoch": 5.931198102016607, "eval_entropy": 5.0454384845414575, "eval_loss": 4.811396598815918, "eval_mean_token_accuracy": 0.2512085310922338, "eval_num_tokens": 137423138.0, "eval_runtime": 26.6122, "eval_samples_per_second": 1221.733, "eval_steps_per_second": 152.75, "step": 60000 }, { "entropy": 5.300804281234742, "epoch": 5.931692368525109, "grad_norm": 1.0625, "learning_rate": 0.0002127999408219753, "loss": 4.6656, "mean_token_accuracy": 0.24646405577659608, "num_tokens": 137434232.0, "step": 60005 }, { "entropy": 5.325595331192017, "epoch": 5.93218663503361, "grad_norm": 1.2734375, "learning_rate": 0.00021276602686160474, "loss": 4.7249, "mean_token_accuracy": 0.24567179530858993, "num_tokens": 137444959.0, "step": 60010 }, { "entropy": 5.3589166641235355, "epoch": 5.932680901542112, "grad_norm": 1.109375, "learning_rate": 0.0002127321144321996, "loss": 4.7496, "mean_token_accuracy": 0.24395158290863037, "num_tokens": 137457381.0, "step": 60015 }, { "entropy": 5.287054491043091, "epoch": 5.933175168050613, "grad_norm": 1.0625, "learning_rate": 0.000212698203534594, "loss": 4.6138, "mean_token_accuracy": 0.2556979149580002, "num_tokens": 137467982.0, "step": 60020 }, { "entropy": 5.31154055595398, "epoch": 5.933669434559114, "grad_norm": 1.2265625, "learning_rate": 0.0002126642941696223, "loss": 4.6794, "mean_token_accuracy": 0.24412113428115845, "num_tokens": 137479304.0, "step": 60025 }, { "entropy": 5.328098344802856, "epoch": 5.934163701067615, "grad_norm": 1.1953125, "learning_rate": 0.0002126303863381187, "loss": 4.783, "mean_token_accuracy": 0.23801518231630325, "num_tokens": 137491856.0, "step": 60030 }, { "entropy": 5.218593454360962, "epoch": 5.934657967576117, "grad_norm": 1.171875, "learning_rate": 0.00021259648004091726, "loss": 4.6664, "mean_token_accuracy": 0.24911384284496307, "num_tokens": 137503594.0, "step": 60035 }, { "entropy": 5.34909987449646, "epoch": 5.935152234084619, "grad_norm": 1.0703125, "learning_rate": 0.00021256257527885202, "loss": 4.7655, "mean_token_accuracy": 0.2441047191619873, "num_tokens": 137516244.0, "step": 60040 }, { "entropy": 5.435755825042724, "epoch": 5.93564650059312, "grad_norm": 1.2421875, "learning_rate": 0.00021252867205275716, "loss": 4.7881, "mean_token_accuracy": 0.23670005351305007, "num_tokens": 137528045.0, "step": 60045 }, { "entropy": 5.360827112197876, "epoch": 5.936140767101621, "grad_norm": 1.078125, "learning_rate": 0.0002124947703634667, "loss": 4.7281, "mean_token_accuracy": 0.246051687002182, "num_tokens": 137539873.0, "step": 60050 }, { "entropy": 5.273593854904175, "epoch": 5.936635033610123, "grad_norm": 1.078125, "learning_rate": 0.00021246087021181448, "loss": 4.6096, "mean_token_accuracy": 0.2582314804196358, "num_tokens": 137551415.0, "step": 60055 }, { "entropy": 5.3413941860198975, "epoch": 5.937129300118624, "grad_norm": 1.2109375, "learning_rate": 0.00021242697159863468, "loss": 4.7335, "mean_token_accuracy": 0.2481689438223839, "num_tokens": 137562348.0, "step": 60060 }, { "entropy": 5.298841667175293, "epoch": 5.937623566627125, "grad_norm": 1.1484375, "learning_rate": 0.00021239307452476102, "loss": 4.6733, "mean_token_accuracy": 0.2511277809739113, "num_tokens": 137572754.0, "step": 60065 }, { "entropy": 5.299303102493286, "epoch": 5.938117833135626, "grad_norm": 1.046875, "learning_rate": 0.00021235917899102742, "loss": 4.702, "mean_token_accuracy": 0.24978477507829666, "num_tokens": 137586145.0, "step": 60070 }, { "entropy": 5.297216749191284, "epoch": 5.9386120996441285, "grad_norm": 1.125, "learning_rate": 0.00021232528499826782, "loss": 4.6435, "mean_token_accuracy": 0.2501698613166809, "num_tokens": 137597281.0, "step": 60075 }, { "entropy": 5.339489936828613, "epoch": 5.93910636615263, "grad_norm": 1.1640625, "learning_rate": 0.0002122913925473159, "loss": 4.7275, "mean_token_accuracy": 0.25007708072662355, "num_tokens": 137608583.0, "step": 60080 }, { "entropy": 5.319508647918701, "epoch": 5.939600632661131, "grad_norm": 1.0703125, "learning_rate": 0.0002122575016390053, "loss": 4.6838, "mean_token_accuracy": 0.25323276668787004, "num_tokens": 137620155.0, "step": 60085 }, { "entropy": 5.265689563751221, "epoch": 5.940094899169632, "grad_norm": 1.1640625, "learning_rate": 0.00021222361227417008, "loss": 4.6379, "mean_token_accuracy": 0.25618157386779783, "num_tokens": 137631093.0, "step": 60090 }, { "entropy": 5.324207830429077, "epoch": 5.9405891656781336, "grad_norm": 1.03125, "learning_rate": 0.00021218972445364364, "loss": 4.7869, "mean_token_accuracy": 0.2399495244026184, "num_tokens": 137643029.0, "step": 60095 }, { "entropy": 5.301372098922729, "epoch": 5.941083432186635, "grad_norm": 1.1015625, "learning_rate": 0.0002121558381782598, "loss": 4.6778, "mean_token_accuracy": 0.25169984102249143, "num_tokens": 137654268.0, "step": 60100 }, { "entropy": 5.270351219177246, "epoch": 5.941577698695136, "grad_norm": 1.0234375, "learning_rate": 0.00021212195344885205, "loss": 4.6726, "mean_token_accuracy": 0.2468843936920166, "num_tokens": 137664583.0, "step": 60105 }, { "entropy": 5.38613486289978, "epoch": 5.942071965203638, "grad_norm": 1.3203125, "learning_rate": 0.00021208807026625398, "loss": 4.8072, "mean_token_accuracy": 0.24118888676166533, "num_tokens": 137675706.0, "step": 60110 }, { "entropy": 5.260094833374024, "epoch": 5.9425662317121395, "grad_norm": 1.078125, "learning_rate": 0.00021205418863129915, "loss": 4.63, "mean_token_accuracy": 0.2535815700888634, "num_tokens": 137688763.0, "step": 60115 }, { "entropy": 5.230860185623169, "epoch": 5.943060498220641, "grad_norm": 1.1640625, "learning_rate": 0.000212020308544821, "loss": 4.5765, "mean_token_accuracy": 0.2633879691362381, "num_tokens": 137699220.0, "step": 60120 }, { "entropy": 5.288889169692993, "epoch": 5.943554764729142, "grad_norm": 1.0859375, "learning_rate": 0.00021198643000765316, "loss": 4.6114, "mean_token_accuracy": 0.26269329637289046, "num_tokens": 137710278.0, "step": 60125 }, { "entropy": 5.284422731399536, "epoch": 5.944049031237643, "grad_norm": 1.125, "learning_rate": 0.00021195255302062884, "loss": 4.7312, "mean_token_accuracy": 0.25088097602128984, "num_tokens": 137721111.0, "step": 60130 }, { "entropy": 5.346682739257813, "epoch": 5.9445432977461445, "grad_norm": 1.1015625, "learning_rate": 0.00021191867758458145, "loss": 4.7161, "mean_token_accuracy": 0.252433018386364, "num_tokens": 137732645.0, "step": 60135 }, { "entropy": 5.412892627716064, "epoch": 5.945037564254646, "grad_norm": 1.0859375, "learning_rate": 0.00021188480370034441, "loss": 4.8541, "mean_token_accuracy": 0.23691177517175674, "num_tokens": 137745575.0, "step": 60140 }, { "entropy": 5.3085784912109375, "epoch": 5.945531830763148, "grad_norm": 1.1875, "learning_rate": 0.000211850931368751, "loss": 4.721, "mean_token_accuracy": 0.24422883093357087, "num_tokens": 137757722.0, "step": 60145 }, { "entropy": 5.154675102233886, "epoch": 5.946026097271649, "grad_norm": 1.078125, "learning_rate": 0.0002118170605906345, "loss": 4.563, "mean_token_accuracy": 0.2659430608153343, "num_tokens": 137770177.0, "step": 60150 }, { "entropy": 5.316598653793335, "epoch": 5.9465203637801505, "grad_norm": 1.234375, "learning_rate": 0.00021178319136682812, "loss": 4.6391, "mean_token_accuracy": 0.2593821495771408, "num_tokens": 137781551.0, "step": 60155 }, { "entropy": 5.286485958099365, "epoch": 5.947014630288652, "grad_norm": 1.25, "learning_rate": 0.00021174932369816501, "loss": 4.6737, "mean_token_accuracy": 0.24979926347732545, "num_tokens": 137792156.0, "step": 60160 }, { "entropy": 5.282478713989258, "epoch": 5.947508896797153, "grad_norm": 1.1171875, "learning_rate": 0.0002117154575854784, "loss": 4.6683, "mean_token_accuracy": 0.2552514776587486, "num_tokens": 137804607.0, "step": 60165 }, { "entropy": 5.272925996780396, "epoch": 5.948003163305654, "grad_norm": 1.1953125, "learning_rate": 0.00021168159302960122, "loss": 4.7222, "mean_token_accuracy": 0.25039438903331757, "num_tokens": 137816567.0, "step": 60170 }, { "entropy": 5.312344741821289, "epoch": 5.9484974298141555, "grad_norm": 1.09375, "learning_rate": 0.0002116477300313667, "loss": 4.6764, "mean_token_accuracy": 0.2542115584015846, "num_tokens": 137828494.0, "step": 60175 }, { "entropy": 5.249634027481079, "epoch": 5.948991696322658, "grad_norm": 1.125, "learning_rate": 0.00021161386859160802, "loss": 4.6678, "mean_token_accuracy": 0.2578001171350479, "num_tokens": 137838865.0, "step": 60180 }, { "entropy": 5.31496295928955, "epoch": 5.949485962831159, "grad_norm": 1.1328125, "learning_rate": 0.00021158000871115786, "loss": 4.6512, "mean_token_accuracy": 0.2563218727707863, "num_tokens": 137849306.0, "step": 60185 }, { "entropy": 5.308050727844238, "epoch": 5.94998022933966, "grad_norm": 1.1328125, "learning_rate": 0.0002115461503908494, "loss": 4.7093, "mean_token_accuracy": 0.24914603531360627, "num_tokens": 137860953.0, "step": 60190 }, { "entropy": 5.265167617797852, "epoch": 5.9504744958481615, "grad_norm": 1.1953125, "learning_rate": 0.00021151229363151547, "loss": 4.6183, "mean_token_accuracy": 0.24851543158292771, "num_tokens": 137872439.0, "step": 60195 }, { "entropy": 5.277523612976074, "epoch": 5.950968762356663, "grad_norm": 1.1796875, "learning_rate": 0.00021147843843398885, "loss": 4.6992, "mean_token_accuracy": 0.2444944441318512, "num_tokens": 137883085.0, "step": 60200 }, { "entropy": 5.338800477981567, "epoch": 5.951463028865164, "grad_norm": 1.15625, "learning_rate": 0.00021144458479910262, "loss": 4.6599, "mean_token_accuracy": 0.2503702059388161, "num_tokens": 137893932.0, "step": 60205 }, { "entropy": 5.277915525436401, "epoch": 5.951957295373665, "grad_norm": 1.0859375, "learning_rate": 0.0002114107327276894, "loss": 4.6542, "mean_token_accuracy": 0.2530976250767708, "num_tokens": 137905506.0, "step": 60210 }, { "entropy": 5.2867796421051025, "epoch": 5.9524515618821665, "grad_norm": 1.203125, "learning_rate": 0.00021137688222058203, "loss": 4.6803, "mean_token_accuracy": 0.25113610476255416, "num_tokens": 137916084.0, "step": 60215 }, { "entropy": 5.307426834106446, "epoch": 5.952945828390668, "grad_norm": 1.1484375, "learning_rate": 0.00021134303327861333, "loss": 4.6859, "mean_token_accuracy": 0.2524459734559059, "num_tokens": 137927557.0, "step": 60220 }, { "entropy": 5.232722377777099, "epoch": 5.95344009489917, "grad_norm": 1.140625, "learning_rate": 0.00021130918590261583, "loss": 4.6526, "mean_token_accuracy": 0.24886057376861573, "num_tokens": 137938537.0, "step": 60225 }, { "entropy": 5.30474328994751, "epoch": 5.953934361407671, "grad_norm": 1.0703125, "learning_rate": 0.00021127534009342215, "loss": 4.6895, "mean_token_accuracy": 0.25390962809324263, "num_tokens": 137951024.0, "step": 60230 }, { "entropy": 5.292814540863037, "epoch": 5.9544286279161724, "grad_norm": 1.1640625, "learning_rate": 0.00021124149585186497, "loss": 4.7028, "mean_token_accuracy": 0.24705983102321624, "num_tokens": 137962686.0, "step": 60235 }, { "entropy": 5.3222874164581295, "epoch": 5.954922894424674, "grad_norm": 1.1875, "learning_rate": 0.00021120765317877706, "loss": 4.7142, "mean_token_accuracy": 0.24355040341615677, "num_tokens": 137973816.0, "step": 60240 }, { "entropy": 5.255720376968384, "epoch": 5.955417160933175, "grad_norm": 1.1328125, "learning_rate": 0.00021117381207499071, "loss": 4.6857, "mean_token_accuracy": 0.24337424337863922, "num_tokens": 137985163.0, "step": 60245 }, { "entropy": 5.341061592102051, "epoch": 5.955911427441676, "grad_norm": 1.1796875, "learning_rate": 0.00021113997254133842, "loss": 4.7183, "mean_token_accuracy": 0.24689362943172455, "num_tokens": 137997219.0, "step": 60250 }, { "entropy": 5.302446126937866, "epoch": 5.9564056939501775, "grad_norm": 1.046875, "learning_rate": 0.00021110613457865274, "loss": 4.7038, "mean_token_accuracy": 0.24886955320835114, "num_tokens": 138010156.0, "step": 60255 }, { "entropy": 5.333405017852783, "epoch": 5.95689996045868, "grad_norm": 1.109375, "learning_rate": 0.000211072298187766, "loss": 4.645, "mean_token_accuracy": 0.25664797723293303, "num_tokens": 138021392.0, "step": 60260 }, { "entropy": 5.398432111740112, "epoch": 5.957394226967181, "grad_norm": 1.0625, "learning_rate": 0.00021103846336951077, "loss": 4.8422, "mean_token_accuracy": 0.2463697999715805, "num_tokens": 138033563.0, "step": 60265 }, { "entropy": 5.216529655456543, "epoch": 5.957888493475682, "grad_norm": 1.1640625, "learning_rate": 0.0002110046301247192, "loss": 4.5604, "mean_token_accuracy": 0.2571863502264023, "num_tokens": 138044761.0, "step": 60270 }, { "entropy": 5.247853851318359, "epoch": 5.958382759984183, "grad_norm": 1.125, "learning_rate": 0.00021097079845422374, "loss": 4.6899, "mean_token_accuracy": 0.2514843627810478, "num_tokens": 138056921.0, "step": 60275 }, { "entropy": 5.296789360046387, "epoch": 5.958877026492685, "grad_norm": 1.1484375, "learning_rate": 0.00021093696835885645, "loss": 4.7373, "mean_token_accuracy": 0.2487800806760788, "num_tokens": 138067667.0, "step": 60280 }, { "entropy": 5.270573520660401, "epoch": 5.959371293001186, "grad_norm": 1.0859375, "learning_rate": 0.00021090313983944975, "loss": 4.6246, "mean_token_accuracy": 0.25688083469867706, "num_tokens": 138078573.0, "step": 60285 }, { "entropy": 5.341410875320435, "epoch": 5.959865559509687, "grad_norm": 1.109375, "learning_rate": 0.0002108693128968357, "loss": 4.7002, "mean_token_accuracy": 0.24834010303020476, "num_tokens": 138089445.0, "step": 60290 }, { "entropy": 5.291460180282593, "epoch": 5.960359826018189, "grad_norm": 1.1953125, "learning_rate": 0.0002108354875318465, "loss": 4.7458, "mean_token_accuracy": 0.2392520636320114, "num_tokens": 138100716.0, "step": 60295 }, { "entropy": 5.286375093460083, "epoch": 5.960854092526691, "grad_norm": 1.1796875, "learning_rate": 0.00021080166374531434, "loss": 4.6789, "mean_token_accuracy": 0.25234765708446505, "num_tokens": 138112352.0, "step": 60300 }, { "entropy": 5.304668235778808, "epoch": 5.961348359035192, "grad_norm": 1.140625, "learning_rate": 0.00021076784153807116, "loss": 4.7027, "mean_token_accuracy": 0.25042565912008286, "num_tokens": 138123112.0, "step": 60305 }, { "entropy": 5.278977775573731, "epoch": 5.961842625543693, "grad_norm": 1.203125, "learning_rate": 0.00021073402091094902, "loss": 4.6804, "mean_token_accuracy": 0.2503417834639549, "num_tokens": 138134250.0, "step": 60310 }, { "entropy": 5.252076292037964, "epoch": 5.962336892052194, "grad_norm": 1.1484375, "learning_rate": 0.00021070020186477996, "loss": 4.6698, "mean_token_accuracy": 0.2522808909416199, "num_tokens": 138146028.0, "step": 60315 }, { "entropy": 5.328626251220703, "epoch": 5.962831158560696, "grad_norm": 1.0859375, "learning_rate": 0.00021066638440039588, "loss": 4.7382, "mean_token_accuracy": 0.2486450582742691, "num_tokens": 138158067.0, "step": 60320 }, { "entropy": 5.337867069244385, "epoch": 5.963325425069197, "grad_norm": 1.1328125, "learning_rate": 0.00021063256851862878, "loss": 4.7372, "mean_token_accuracy": 0.24247748404741287, "num_tokens": 138169390.0, "step": 60325 }, { "entropy": 5.298537731170654, "epoch": 5.963819691577699, "grad_norm": 1.1015625, "learning_rate": 0.00021059875422031044, "loss": 4.7152, "mean_token_accuracy": 0.2486185237765312, "num_tokens": 138181064.0, "step": 60330 }, { "entropy": 5.2775561809539795, "epoch": 5.9643139580862, "grad_norm": 1.1484375, "learning_rate": 0.00021056494150627282, "loss": 4.6662, "mean_token_accuracy": 0.2510833919048309, "num_tokens": 138192336.0, "step": 60335 }, { "entropy": 5.222867870330811, "epoch": 5.964808224594702, "grad_norm": 1.0234375, "learning_rate": 0.00021053113037734756, "loss": 4.5711, "mean_token_accuracy": 0.2562509775161743, "num_tokens": 138203464.0, "step": 60340 }, { "entropy": 5.238704633712769, "epoch": 5.965302491103203, "grad_norm": 1.1328125, "learning_rate": 0.0002104973208343664, "loss": 4.6731, "mean_token_accuracy": 0.2562548816204071, "num_tokens": 138216140.0, "step": 60345 }, { "entropy": 5.2230452537536625, "epoch": 5.965796757611704, "grad_norm": 1.0546875, "learning_rate": 0.00021046351287816133, "loss": 4.622, "mean_token_accuracy": 0.25211267322301867, "num_tokens": 138229219.0, "step": 60350 }, { "entropy": 5.259181070327759, "epoch": 5.966291024120205, "grad_norm": 1.09375, "learning_rate": 0.00021042970650956373, "loss": 4.586, "mean_token_accuracy": 0.2595504194498062, "num_tokens": 138241899.0, "step": 60355 }, { "entropy": 5.375200414657593, "epoch": 5.966785290628707, "grad_norm": 1.15625, "learning_rate": 0.0002103959017294054, "loss": 4.7605, "mean_token_accuracy": 0.24779195934534073, "num_tokens": 138254133.0, "step": 60360 }, { "entropy": 5.278614187240601, "epoch": 5.967279557137209, "grad_norm": 1.1640625, "learning_rate": 0.00021036209853851802, "loss": 4.6964, "mean_token_accuracy": 0.2502264127135277, "num_tokens": 138266460.0, "step": 60365 }, { "entropy": 5.261034345626831, "epoch": 5.96777382364571, "grad_norm": 1.1484375, "learning_rate": 0.00021032829693773292, "loss": 4.6455, "mean_token_accuracy": 0.2588516101241112, "num_tokens": 138277060.0, "step": 60370 }, { "entropy": 5.264335966110229, "epoch": 5.968268090154211, "grad_norm": 1.1640625, "learning_rate": 0.0002102944969278817, "loss": 4.6331, "mean_token_accuracy": 0.25587107688188554, "num_tokens": 138288231.0, "step": 60375 }, { "entropy": 5.2363543033599855, "epoch": 5.968762356662713, "grad_norm": 1.1171875, "learning_rate": 0.00021026069850979602, "loss": 4.6185, "mean_token_accuracy": 0.25744806230068207, "num_tokens": 138300518.0, "step": 60380 }, { "entropy": 5.307842159271241, "epoch": 5.969256623171214, "grad_norm": 1.125, "learning_rate": 0.00021022690168430712, "loss": 4.7186, "mean_token_accuracy": 0.24804929196834563, "num_tokens": 138312083.0, "step": 60385 }, { "entropy": 5.296657133102417, "epoch": 5.969750889679715, "grad_norm": 1.265625, "learning_rate": 0.0002101931064522466, "loss": 4.6627, "mean_token_accuracy": 0.24786906838417053, "num_tokens": 138322142.0, "step": 60390 }, { "entropy": 5.214157295227051, "epoch": 5.970245156188216, "grad_norm": 1.09375, "learning_rate": 0.00021015931281444556, "loss": 4.6363, "mean_token_accuracy": 0.26024034023284914, "num_tokens": 138333318.0, "step": 60395 }, { "entropy": 5.1896308898925785, "epoch": 5.9707394226967185, "grad_norm": 1.1640625, "learning_rate": 0.00021012552077173557, "loss": 4.5321, "mean_token_accuracy": 0.26641344726085664, "num_tokens": 138343907.0, "step": 60400 }, { "entropy": 5.2577704906463625, "epoch": 5.97123368920522, "grad_norm": 1.2109375, "learning_rate": 0.00021009173032494782, "loss": 4.6767, "mean_token_accuracy": 0.25648889392614366, "num_tokens": 138354491.0, "step": 60405 }, { "entropy": 5.290918159484863, "epoch": 5.971727955713721, "grad_norm": 1.21875, "learning_rate": 0.00021005794147491358, "loss": 4.6536, "mean_token_accuracy": 0.2512463092803955, "num_tokens": 138365594.0, "step": 60410 }, { "entropy": 5.256827735900879, "epoch": 5.972222222222222, "grad_norm": 1.171875, "learning_rate": 0.00021002415422246407, "loss": 4.6547, "mean_token_accuracy": 0.25354875028133395, "num_tokens": 138376776.0, "step": 60415 }, { "entropy": 5.320983982086181, "epoch": 5.972716488730724, "grad_norm": 1.1953125, "learning_rate": 0.0002099903685684304, "loss": 4.6703, "mean_token_accuracy": 0.2606713443994522, "num_tokens": 138389231.0, "step": 60420 }, { "entropy": 5.356675291061402, "epoch": 5.973210755239225, "grad_norm": 1.1484375, "learning_rate": 0.0002099565845136438, "loss": 4.7216, "mean_token_accuracy": 0.24653469324111937, "num_tokens": 138400556.0, "step": 60425 }, { "entropy": 5.2693188190460205, "epoch": 5.973705021747726, "grad_norm": 1.15625, "learning_rate": 0.00020992280205893533, "loss": 4.6823, "mean_token_accuracy": 0.2571202352643013, "num_tokens": 138412148.0, "step": 60430 }, { "entropy": 5.253555250167847, "epoch": 5.974199288256228, "grad_norm": 1.21875, "learning_rate": 0.00020988902120513592, "loss": 4.6719, "mean_token_accuracy": 0.25835205912590026, "num_tokens": 138423244.0, "step": 60435 }, { "entropy": 5.1860511302948, "epoch": 5.9746935547647295, "grad_norm": 1.1953125, "learning_rate": 0.00020985524195307677, "loss": 4.5616, "mean_token_accuracy": 0.2668794721364975, "num_tokens": 138434650.0, "step": 60440 }, { "entropy": 5.259559917449951, "epoch": 5.975187821273231, "grad_norm": 1.1171875, "learning_rate": 0.00020982146430358872, "loss": 4.6574, "mean_token_accuracy": 0.2568198963999748, "num_tokens": 138445898.0, "step": 60445 }, { "entropy": 5.227684545516968, "epoch": 5.975682087781732, "grad_norm": 1.0703125, "learning_rate": 0.00020978768825750282, "loss": 4.6405, "mean_token_accuracy": 0.25942489951848985, "num_tokens": 138456711.0, "step": 60450 }, { "entropy": 5.279528093338013, "epoch": 5.976176354290233, "grad_norm": 1.234375, "learning_rate": 0.0002097539138156499, "loss": 4.7121, "mean_token_accuracy": 0.25822732597589493, "num_tokens": 138467143.0, "step": 60455 }, { "entropy": 5.339109086990357, "epoch": 5.976670620798735, "grad_norm": 1.1484375, "learning_rate": 0.0002097201409788607, "loss": 4.7398, "mean_token_accuracy": 0.2409653440117836, "num_tokens": 138480739.0, "step": 60460 }, { "entropy": 5.366247081756592, "epoch": 5.977164887307236, "grad_norm": 1.09375, "learning_rate": 0.00020968636974796635, "loss": 4.8042, "mean_token_accuracy": 0.23830848485231398, "num_tokens": 138492165.0, "step": 60465 }, { "entropy": 5.33212685585022, "epoch": 5.977659153815737, "grad_norm": 1.2109375, "learning_rate": 0.00020965260012379734, "loss": 4.7088, "mean_token_accuracy": 0.24782086461782454, "num_tokens": 138503989.0, "step": 60470 }, { "entropy": 5.335946989059448, "epoch": 5.978153420324238, "grad_norm": 1.2890625, "learning_rate": 0.00020961883210718452, "loss": 4.6217, "mean_token_accuracy": 0.25858712047338483, "num_tokens": 138514105.0, "step": 60475 }, { "entropy": 5.259094285964966, "epoch": 5.9786476868327405, "grad_norm": 1.078125, "learning_rate": 0.00020958506569895857, "loss": 4.6747, "mean_token_accuracy": 0.25361559391021726, "num_tokens": 138527003.0, "step": 60480 }, { "entropy": 5.319077253341675, "epoch": 5.979141953341242, "grad_norm": 1.3828125, "learning_rate": 0.00020955130089995023, "loss": 4.643, "mean_token_accuracy": 0.24823284298181533, "num_tokens": 138537306.0, "step": 60485 }, { "entropy": 5.325379371643066, "epoch": 5.979636219849743, "grad_norm": 1.0703125, "learning_rate": 0.00020951753771098985, "loss": 4.7602, "mean_token_accuracy": 0.2482401415705681, "num_tokens": 138549624.0, "step": 60490 }, { "entropy": 5.3060180187225345, "epoch": 5.980130486358244, "grad_norm": 1.21875, "learning_rate": 0.00020948377613290832, "loss": 4.6973, "mean_token_accuracy": 0.24908123165369034, "num_tokens": 138560851.0, "step": 60495 }, { "entropy": 5.282018041610717, "epoch": 5.9806247528667456, "grad_norm": 1.171875, "learning_rate": 0.00020945001616653604, "loss": 4.6769, "mean_token_accuracy": 0.25647495687007904, "num_tokens": 138572155.0, "step": 60500 }, { "entropy": 5.2760655879974365, "epoch": 5.981119019375247, "grad_norm": 1.234375, "learning_rate": 0.00020941625781270356, "loss": 4.6891, "mean_token_accuracy": 0.25054413080215454, "num_tokens": 138583437.0, "step": 60505 }, { "entropy": 5.248066234588623, "epoch": 5.981613285883748, "grad_norm": 1.1796875, "learning_rate": 0.00020938250107224133, "loss": 4.5706, "mean_token_accuracy": 0.26100932210683825, "num_tokens": 138594121.0, "step": 60510 }, { "entropy": 5.310423135757446, "epoch": 5.98210755239225, "grad_norm": 1.1640625, "learning_rate": 0.0002093487459459797, "loss": 4.7107, "mean_token_accuracy": 0.24836920201778412, "num_tokens": 138606042.0, "step": 60515 }, { "entropy": 5.342690515518188, "epoch": 5.9826018189007515, "grad_norm": 1.25, "learning_rate": 0.00020931499243474904, "loss": 4.7293, "mean_token_accuracy": 0.24882637858390808, "num_tokens": 138617384.0, "step": 60520 }, { "entropy": 5.377263975143433, "epoch": 5.983096085409253, "grad_norm": 1.1875, "learning_rate": 0.0002092812405393799, "loss": 4.7489, "mean_token_accuracy": 0.24272970408201217, "num_tokens": 138630005.0, "step": 60525 }, { "entropy": 5.286742401123047, "epoch": 5.983590351917754, "grad_norm": 1.1015625, "learning_rate": 0.0002092474902607024, "loss": 4.6353, "mean_token_accuracy": 0.25650808960199356, "num_tokens": 138643159.0, "step": 60530 }, { "entropy": 5.317912817001343, "epoch": 5.984084618426255, "grad_norm": 1.171875, "learning_rate": 0.00020921374159954686, "loss": 4.6925, "mean_token_accuracy": 0.2553881347179413, "num_tokens": 138653655.0, "step": 60535 }, { "entropy": 5.198072195053101, "epoch": 5.9845788849347565, "grad_norm": 1.203125, "learning_rate": 0.00020917999455674342, "loss": 4.5792, "mean_token_accuracy": 0.25831622779369356, "num_tokens": 138665623.0, "step": 60540 }, { "entropy": 5.214996576309204, "epoch": 5.985073151443258, "grad_norm": 1.1796875, "learning_rate": 0.00020914624913312237, "loss": 4.6658, "mean_token_accuracy": 0.2545212939381599, "num_tokens": 138676481.0, "step": 60545 }, { "entropy": 5.2156171798706055, "epoch": 5.98556741795176, "grad_norm": 1.15625, "learning_rate": 0.0002091125053295137, "loss": 4.6137, "mean_token_accuracy": 0.266219861805439, "num_tokens": 138687346.0, "step": 60550 }, { "entropy": 5.191754770278931, "epoch": 5.986061684460261, "grad_norm": 1.1328125, "learning_rate": 0.00020907876314674772, "loss": 4.5946, "mean_token_accuracy": 0.25948911905288696, "num_tokens": 138698354.0, "step": 60555 }, { "entropy": 5.24883918762207, "epoch": 5.9865559509687625, "grad_norm": 1.078125, "learning_rate": 0.0002090450225856544, "loss": 4.6799, "mean_token_accuracy": 0.2583963260054588, "num_tokens": 138709735.0, "step": 60560 }, { "entropy": 5.29590744972229, "epoch": 5.987050217477264, "grad_norm": 1.2421875, "learning_rate": 0.00020901128364706373, "loss": 4.6301, "mean_token_accuracy": 0.2597810193896294, "num_tokens": 138720969.0, "step": 60565 }, { "entropy": 5.333996677398682, "epoch": 5.987544483985765, "grad_norm": 1.140625, "learning_rate": 0.00020897754633180572, "loss": 4.7678, "mean_token_accuracy": 0.2414033144712448, "num_tokens": 138733243.0, "step": 60570 }, { "entropy": 5.372233772277832, "epoch": 5.988038750494266, "grad_norm": 1.234375, "learning_rate": 0.00020894381064071038, "loss": 4.7555, "mean_token_accuracy": 0.24413672983646392, "num_tokens": 138746054.0, "step": 60575 }, { "entropy": 5.299894046783447, "epoch": 5.9885330170027675, "grad_norm": 1.0625, "learning_rate": 0.00020891007657460742, "loss": 4.7454, "mean_token_accuracy": 0.24119626581668854, "num_tokens": 138757692.0, "step": 60580 }, { "entropy": 5.258747816085815, "epoch": 5.98902728351127, "grad_norm": 1.171875, "learning_rate": 0.00020887634413432687, "loss": 4.6625, "mean_token_accuracy": 0.25727399438619614, "num_tokens": 138768559.0, "step": 60585 }, { "entropy": 5.309263038635254, "epoch": 5.989521550019771, "grad_norm": 1.1796875, "learning_rate": 0.00020884261332069853, "loss": 4.637, "mean_token_accuracy": 0.25133931040763857, "num_tokens": 138779911.0, "step": 60590 }, { "entropy": 5.340525054931641, "epoch": 5.990015816528272, "grad_norm": 1.0078125, "learning_rate": 0.0002088088841345522, "loss": 4.6769, "mean_token_accuracy": 0.2453706830739975, "num_tokens": 138791878.0, "step": 60595 }, { "entropy": 5.259049940109253, "epoch": 5.9905100830367735, "grad_norm": 1.0078125, "learning_rate": 0.0002087751565767176, "loss": 4.672, "mean_token_accuracy": 0.251205313205719, "num_tokens": 138803841.0, "step": 60600 }, { "entropy": 5.222165298461914, "epoch": 5.991004349545275, "grad_norm": 1.234375, "learning_rate": 0.00020874143064802432, "loss": 4.6188, "mean_token_accuracy": 0.2595421999692917, "num_tokens": 138814347.0, "step": 60605 }, { "entropy": 5.284568548202515, "epoch": 5.991498616053776, "grad_norm": 1.15625, "learning_rate": 0.0002087077063493022, "loss": 4.6706, "mean_token_accuracy": 0.2558294221758842, "num_tokens": 138824719.0, "step": 60610 }, { "entropy": 5.197277355194092, "epoch": 5.991992882562277, "grad_norm": 1.0390625, "learning_rate": 0.00020867398368138075, "loss": 4.637, "mean_token_accuracy": 0.2591789662837982, "num_tokens": 138836285.0, "step": 60615 }, { "entropy": 5.3281028270721436, "epoch": 5.992487149070779, "grad_norm": 1.1015625, "learning_rate": 0.0002086402626450896, "loss": 4.752, "mean_token_accuracy": 0.241623155772686, "num_tokens": 138848089.0, "step": 60620 }, { "entropy": 5.379049062728882, "epoch": 5.992981415579281, "grad_norm": 1.1015625, "learning_rate": 0.00020860654324125833, "loss": 4.7708, "mean_token_accuracy": 0.23854591101408004, "num_tokens": 138859398.0, "step": 60625 }, { "entropy": 5.403849363327026, "epoch": 5.993475682087782, "grad_norm": 1.1328125, "learning_rate": 0.00020857282547071638, "loss": 4.7306, "mean_token_accuracy": 0.24899407476186752, "num_tokens": 138869568.0, "step": 60630 }, { "entropy": 5.2394849300384525, "epoch": 5.993969948596283, "grad_norm": 1.0625, "learning_rate": 0.0002085391093342932, "loss": 4.6199, "mean_token_accuracy": 0.25435121059417726, "num_tokens": 138881589.0, "step": 60635 }, { "entropy": 5.265836524963379, "epoch": 5.994464215104784, "grad_norm": 1.15625, "learning_rate": 0.0002085053948328182, "loss": 4.6908, "mean_token_accuracy": 0.24684728533029557, "num_tokens": 138894429.0, "step": 60640 }, { "entropy": 5.346119499206543, "epoch": 5.994958481613286, "grad_norm": 1.09375, "learning_rate": 0.0002084716819671209, "loss": 4.7574, "mean_token_accuracy": 0.24375822842121125, "num_tokens": 138905292.0, "step": 60645 }, { "entropy": 5.263687467575073, "epoch": 5.995452748121787, "grad_norm": 1.1875, "learning_rate": 0.0002084379707380305, "loss": 4.6312, "mean_token_accuracy": 0.25682615786790847, "num_tokens": 138914727.0, "step": 60650 }, { "entropy": 5.338701438903809, "epoch": 5.995947014630289, "grad_norm": 1.2265625, "learning_rate": 0.0002084042611463764, "loss": 4.7533, "mean_token_accuracy": 0.2437427371740341, "num_tokens": 138926817.0, "step": 60655 }, { "entropy": 5.3972296714782715, "epoch": 5.99644128113879, "grad_norm": 1.171875, "learning_rate": 0.0002083705531929877, "loss": 4.8181, "mean_token_accuracy": 0.23876729011535644, "num_tokens": 138939723.0, "step": 60660 }, { "entropy": 5.327954816818237, "epoch": 5.996935547647292, "grad_norm": 1.2578125, "learning_rate": 0.00020833684687869376, "loss": 4.6732, "mean_token_accuracy": 0.25452177226543427, "num_tokens": 138950752.0, "step": 60665 }, { "entropy": 5.337128400802612, "epoch": 5.997429814155793, "grad_norm": 1.0859375, "learning_rate": 0.00020830314220432377, "loss": 4.756, "mean_token_accuracy": 0.24790402948856355, "num_tokens": 138963170.0, "step": 60670 }, { "entropy": 5.343394088745117, "epoch": 5.997924080664294, "grad_norm": 1.109375, "learning_rate": 0.00020826943917070685, "loss": 4.72, "mean_token_accuracy": 0.248143208026886, "num_tokens": 138974665.0, "step": 60675 }, { "entropy": 5.162658262252807, "epoch": 5.998418347172795, "grad_norm": 1.1171875, "learning_rate": 0.00020823573777867206, "loss": 4.5305, "mean_token_accuracy": 0.2691450282931328, "num_tokens": 138986036.0, "step": 60680 }, { "entropy": 5.285955142974854, "epoch": 5.998912613681297, "grad_norm": 1.1640625, "learning_rate": 0.0002082020380290484, "loss": 4.6646, "mean_token_accuracy": 0.25006717443466187, "num_tokens": 138997161.0, "step": 60685 }, { "entropy": 5.183177137374878, "epoch": 5.999406880189798, "grad_norm": 1.25, "learning_rate": 0.0002081683399226651, "loss": 4.5883, "mean_token_accuracy": 0.25901235491037367, "num_tokens": 139008325.0, "step": 60690 }, { "entropy": 5.2870899677276615, "epoch": 5.9999011466983, "grad_norm": 1.140625, "learning_rate": 0.00020813464346035082, "loss": 4.7331, "mean_token_accuracy": 0.24536699503660203, "num_tokens": 139020407.0, "step": 60695 }, { "entropy": 5.332102966308594, "epoch": 6.000395413206801, "grad_norm": 1.125, "learning_rate": 0.00020810094864293484, "loss": 4.7372, "mean_token_accuracy": 0.2464389532804489, "num_tokens": 139030883.0, "step": 60700 }, { "entropy": 5.232608413696289, "epoch": 6.000889679715303, "grad_norm": 1.1171875, "learning_rate": 0.0002080672554712459, "loss": 4.5671, "mean_token_accuracy": 0.26615551859140396, "num_tokens": 139042300.0, "step": 60705 }, { "entropy": 5.255750751495361, "epoch": 6.001383946223804, "grad_norm": 1.09375, "learning_rate": 0.00020803356394611278, "loss": 4.5462, "mean_token_accuracy": 0.26085290014743806, "num_tokens": 139053254.0, "step": 60710 }, { "entropy": 5.313240337371826, "epoch": 6.001878212732305, "grad_norm": 1.1875, "learning_rate": 0.0002079998740683644, "loss": 4.6879, "mean_token_accuracy": 0.2584942102432251, "num_tokens": 139064756.0, "step": 60715 }, { "entropy": 5.29210638999939, "epoch": 6.002372479240806, "grad_norm": 1.140625, "learning_rate": 0.0002079661858388296, "loss": 4.6467, "mean_token_accuracy": 0.2533493131399155, "num_tokens": 139077420.0, "step": 60720 }, { "entropy": 5.2842206954956055, "epoch": 6.002866745749308, "grad_norm": 1.0546875, "learning_rate": 0.00020793249925833685, "loss": 4.6473, "mean_token_accuracy": 0.26724501997232436, "num_tokens": 139088568.0, "step": 60725 }, { "entropy": 5.319478750228882, "epoch": 6.00336101225781, "grad_norm": 1.0625, "learning_rate": 0.00020789881432771518, "loss": 4.7011, "mean_token_accuracy": 0.2516015231609344, "num_tokens": 139100564.0, "step": 60730 }, { "entropy": 5.284015560150147, "epoch": 6.003855278766311, "grad_norm": 1.1875, "learning_rate": 0.00020786513104779298, "loss": 4.6555, "mean_token_accuracy": 0.25982567965984343, "num_tokens": 139112589.0, "step": 60735 }, { "entropy": 5.3649317741394045, "epoch": 6.004349545274812, "grad_norm": 1.109375, "learning_rate": 0.00020783144941939908, "loss": 4.7064, "mean_token_accuracy": 0.25299979746341705, "num_tokens": 139124227.0, "step": 60740 }, { "entropy": 5.385387992858886, "epoch": 6.004843811783314, "grad_norm": 1.1640625, "learning_rate": 0.00020779776944336188, "loss": 4.7189, "mean_token_accuracy": 0.24220700114965438, "num_tokens": 139136762.0, "step": 60745 }, { "entropy": 5.227450656890869, "epoch": 6.005338078291815, "grad_norm": 1.046875, "learning_rate": 0.00020776409112050997, "loss": 4.5456, "mean_token_accuracy": 0.26444542557001116, "num_tokens": 139147386.0, "step": 60750 }, { "entropy": 5.238335084915161, "epoch": 6.005832344800316, "grad_norm": 1.0703125, "learning_rate": 0.00020773041445167184, "loss": 4.6173, "mean_token_accuracy": 0.2574524238705635, "num_tokens": 139158675.0, "step": 60755 }, { "entropy": 5.2488600730896, "epoch": 6.006326611308817, "grad_norm": 1.0625, "learning_rate": 0.00020769673943767596, "loss": 4.6382, "mean_token_accuracy": 0.2564100205898285, "num_tokens": 139170509.0, "step": 60760 }, { "entropy": 5.290793418884277, "epoch": 6.006820877817319, "grad_norm": 1.1953125, "learning_rate": 0.00020766306607935075, "loss": 4.7229, "mean_token_accuracy": 0.25142349749803544, "num_tokens": 139182015.0, "step": 60765 }, { "entropy": 5.213461971282959, "epoch": 6.007315144325821, "grad_norm": 1.015625, "learning_rate": 0.0002076293943775246, "loss": 4.569, "mean_token_accuracy": 0.2728340685367584, "num_tokens": 139195671.0, "step": 60770 }, { "entropy": 5.330266666412354, "epoch": 6.007809410834322, "grad_norm": 1.0703125, "learning_rate": 0.00020759572433302575, "loss": 4.6479, "mean_token_accuracy": 0.25202338099479676, "num_tokens": 139208584.0, "step": 60775 }, { "entropy": 5.298229694366455, "epoch": 6.008303677342823, "grad_norm": 1.15625, "learning_rate": 0.00020756205594668248, "loss": 4.6223, "mean_token_accuracy": 0.25770739167928697, "num_tokens": 139219545.0, "step": 60780 }, { "entropy": 5.314758539199829, "epoch": 6.008797943851325, "grad_norm": 1.1953125, "learning_rate": 0.00020752838921932315, "loss": 4.6752, "mean_token_accuracy": 0.2540430098772049, "num_tokens": 139231521.0, "step": 60785 }, { "entropy": 5.250036764144897, "epoch": 6.009292210359826, "grad_norm": 1.0703125, "learning_rate": 0.00020749472415177594, "loss": 4.6168, "mean_token_accuracy": 0.259358911216259, "num_tokens": 139243692.0, "step": 60790 }, { "entropy": 5.265690851211548, "epoch": 6.009786476868327, "grad_norm": 1.21875, "learning_rate": 0.00020746106074486903, "loss": 4.5738, "mean_token_accuracy": 0.2569557636976242, "num_tokens": 139255341.0, "step": 60795 }, { "entropy": 5.274400234222412, "epoch": 6.010280743376828, "grad_norm": 1.109375, "learning_rate": 0.0002074273989994304, "loss": 4.6164, "mean_token_accuracy": 0.26082799434661863, "num_tokens": 139267289.0, "step": 60800 }, { "entropy": 5.134558868408203, "epoch": 6.0107750098853305, "grad_norm": 1.1015625, "learning_rate": 0.00020739373891628832, "loss": 4.502, "mean_token_accuracy": 0.2826137036085129, "num_tokens": 139279517.0, "step": 60805 }, { "entropy": 5.241431808471679, "epoch": 6.011269276393832, "grad_norm": 1.15625, "learning_rate": 0.00020736008049627064, "loss": 4.586, "mean_token_accuracy": 0.2660416603088379, "num_tokens": 139291393.0, "step": 60810 }, { "entropy": 5.217766141891479, "epoch": 6.011763542902333, "grad_norm": 1.109375, "learning_rate": 0.0002073264237402056, "loss": 4.5891, "mean_token_accuracy": 0.2601435288786888, "num_tokens": 139302837.0, "step": 60815 }, { "entropy": 5.296646642684936, "epoch": 6.012257809410834, "grad_norm": 0.984375, "learning_rate": 0.000207292768648921, "loss": 4.6697, "mean_token_accuracy": 0.25279406905174256, "num_tokens": 139316491.0, "step": 60820 }, { "entropy": 5.3200465679168705, "epoch": 6.012752075919336, "grad_norm": 1.25, "learning_rate": 0.00020725911522324477, "loss": 4.7119, "mean_token_accuracy": 0.24823843389749528, "num_tokens": 139328199.0, "step": 60825 }, { "entropy": 5.3165112972259525, "epoch": 6.013246342427837, "grad_norm": 1.171875, "learning_rate": 0.00020722546346400484, "loss": 4.6426, "mean_token_accuracy": 0.2504630878567696, "num_tokens": 139338511.0, "step": 60830 }, { "entropy": 5.293571329116821, "epoch": 6.013740608936338, "grad_norm": 1.3046875, "learning_rate": 0.00020719181337202903, "loss": 4.5992, "mean_token_accuracy": 0.2642966791987419, "num_tokens": 139349292.0, "step": 60835 }, { "entropy": 5.30792465209961, "epoch": 6.01423487544484, "grad_norm": 1.171875, "learning_rate": 0.000207158164948145, "loss": 4.6849, "mean_token_accuracy": 0.2530668154358864, "num_tokens": 139360896.0, "step": 60840 }, { "entropy": 5.307866764068604, "epoch": 6.0147291419533415, "grad_norm": 1.1875, "learning_rate": 0.0002071245181931808, "loss": 4.6068, "mean_token_accuracy": 0.25718089640140535, "num_tokens": 139371674.0, "step": 60845 }, { "entropy": 5.333890771865844, "epoch": 6.015223408461843, "grad_norm": 1.2265625, "learning_rate": 0.00020709087310796388, "loss": 4.6561, "mean_token_accuracy": 0.25462886691093445, "num_tokens": 139382262.0, "step": 60850 }, { "entropy": 5.229341077804565, "epoch": 6.015717674970344, "grad_norm": 1.1484375, "learning_rate": 0.00020705722969332214, "loss": 4.5473, "mean_token_accuracy": 0.2653395220637321, "num_tokens": 139393802.0, "step": 60855 }, { "entropy": 5.237138271331787, "epoch": 6.016211941478845, "grad_norm": 1.125, "learning_rate": 0.00020702358795008296, "loss": 4.6193, "mean_token_accuracy": 0.260567219555378, "num_tokens": 139404847.0, "step": 60860 }, { "entropy": 5.234899568557739, "epoch": 6.016706207987347, "grad_norm": 1.1640625, "learning_rate": 0.00020698994787907415, "loss": 4.5891, "mean_token_accuracy": 0.2665414109826088, "num_tokens": 139416106.0, "step": 60865 }, { "entropy": 5.2683909893035885, "epoch": 6.017200474495848, "grad_norm": 1.03125, "learning_rate": 0.0002069563094811231, "loss": 4.6298, "mean_token_accuracy": 0.25769973248243333, "num_tokens": 139427719.0, "step": 60870 }, { "entropy": 5.274837350845337, "epoch": 6.01769474100435, "grad_norm": 1.09375, "learning_rate": 0.0002069226727570574, "loss": 4.6309, "mean_token_accuracy": 0.25731356889009477, "num_tokens": 139439191.0, "step": 60875 }, { "entropy": 5.274396705627441, "epoch": 6.018189007512851, "grad_norm": 1.09375, "learning_rate": 0.00020688903770770456, "loss": 4.5663, "mean_token_accuracy": 0.2604427382349968, "num_tokens": 139450920.0, "step": 60880 }, { "entropy": 5.309282016754151, "epoch": 6.0186832740213525, "grad_norm": 1.1328125, "learning_rate": 0.00020685540433389193, "loss": 4.6857, "mean_token_accuracy": 0.2556750878691673, "num_tokens": 139462331.0, "step": 60885 }, { "entropy": 5.264173173904419, "epoch": 6.019177540529854, "grad_norm": 1.1015625, "learning_rate": 0.00020682177263644697, "loss": 4.6082, "mean_token_accuracy": 0.2621192529797554, "num_tokens": 139474494.0, "step": 60890 }, { "entropy": 5.267256784439087, "epoch": 6.019671807038355, "grad_norm": 1.109375, "learning_rate": 0.00020678814261619694, "loss": 4.6151, "mean_token_accuracy": 0.2581752613186836, "num_tokens": 139485546.0, "step": 60895 }, { "entropy": 5.3552727699279785, "epoch": 6.020166073546856, "grad_norm": 1.1796875, "learning_rate": 0.00020675451427396913, "loss": 4.7357, "mean_token_accuracy": 0.2427367314696312, "num_tokens": 139497494.0, "step": 60900 }, { "entropy": 5.2601988315582275, "epoch": 6.0206603400553576, "grad_norm": 1.125, "learning_rate": 0.00020672088761059093, "loss": 4.5841, "mean_token_accuracy": 0.26052805632352827, "num_tokens": 139509135.0, "step": 60905 }, { "entropy": 5.282078123092651, "epoch": 6.021154606563859, "grad_norm": 1.125, "learning_rate": 0.00020668726262688952, "loss": 4.5908, "mean_token_accuracy": 0.2593954727053642, "num_tokens": 139521308.0, "step": 60910 }, { "entropy": 5.219915246963501, "epoch": 6.021648873072361, "grad_norm": 1.1015625, "learning_rate": 0.00020665363932369202, "loss": 4.6047, "mean_token_accuracy": 0.25889774560928347, "num_tokens": 139533895.0, "step": 60915 }, { "entropy": 5.286780452728271, "epoch": 6.022143139580862, "grad_norm": 1.203125, "learning_rate": 0.00020662001770182554, "loss": 4.6144, "mean_token_accuracy": 0.2640254333615303, "num_tokens": 139545099.0, "step": 60920 }, { "entropy": 5.318821763992309, "epoch": 6.0226374060893635, "grad_norm": 1.1796875, "learning_rate": 0.0002065863977621173, "loss": 4.6572, "mean_token_accuracy": 0.26111459732055664, "num_tokens": 139556883.0, "step": 60925 }, { "entropy": 5.23949704170227, "epoch": 6.023131672597865, "grad_norm": 1.1328125, "learning_rate": 0.0002065527795053942, "loss": 4.5953, "mean_token_accuracy": 0.26442345678806306, "num_tokens": 139568357.0, "step": 60930 }, { "entropy": 5.199015283584595, "epoch": 6.023625939106366, "grad_norm": 1.140625, "learning_rate": 0.0002065191629324834, "loss": 4.5562, "mean_token_accuracy": 0.2621146410703659, "num_tokens": 139578551.0, "step": 60935 }, { "entropy": 5.199707078933716, "epoch": 6.024120205614867, "grad_norm": 1.0546875, "learning_rate": 0.00020648554804421183, "loss": 4.5781, "mean_token_accuracy": 0.2567227751016617, "num_tokens": 139589925.0, "step": 60940 }, { "entropy": 5.167860460281372, "epoch": 6.0246144721233685, "grad_norm": 1.078125, "learning_rate": 0.0002064519348414064, "loss": 4.575, "mean_token_accuracy": 0.268827910721302, "num_tokens": 139602531.0, "step": 60945 }, { "entropy": 5.2957761764526365, "epoch": 6.025108738631871, "grad_norm": 1.1328125, "learning_rate": 0.00020641832332489403, "loss": 4.6593, "mean_token_accuracy": 0.2520732879638672, "num_tokens": 139613836.0, "step": 60950 }, { "entropy": 5.329854965209961, "epoch": 6.025603005140372, "grad_norm": 1.1640625, "learning_rate": 0.00020638471349550142, "loss": 4.6309, "mean_token_accuracy": 0.25822543948888776, "num_tokens": 139624061.0, "step": 60955 }, { "entropy": 5.300002574920654, "epoch": 6.026097271648873, "grad_norm": 1.1640625, "learning_rate": 0.0002063511053540556, "loss": 4.624, "mean_token_accuracy": 0.25723918080329894, "num_tokens": 139634948.0, "step": 60960 }, { "entropy": 5.366563940048218, "epoch": 6.0265915381573745, "grad_norm": 1.3125, "learning_rate": 0.00020631749890138328, "loss": 4.7529, "mean_token_accuracy": 0.24698239117860793, "num_tokens": 139647212.0, "step": 60965 }, { "entropy": 5.223286104202271, "epoch": 6.027085804665876, "grad_norm": 1.1953125, "learning_rate": 0.00020628389413831106, "loss": 4.5624, "mean_token_accuracy": 0.26924321949481966, "num_tokens": 139658300.0, "step": 60970 }, { "entropy": 5.1934105396270756, "epoch": 6.027580071174377, "grad_norm": 1.1015625, "learning_rate": 0.0002062502910656658, "loss": 4.5184, "mean_token_accuracy": 0.2651080146431923, "num_tokens": 139669950.0, "step": 60975 }, { "entropy": 5.186528253555298, "epoch": 6.028074337682878, "grad_norm": 1.1796875, "learning_rate": 0.00020621668968427397, "loss": 4.6215, "mean_token_accuracy": 0.25598676055669783, "num_tokens": 139681711.0, "step": 60980 }, { "entropy": 5.337928247451782, "epoch": 6.02856860419138, "grad_norm": 1.21875, "learning_rate": 0.00020618308999496222, "loss": 4.6816, "mean_token_accuracy": 0.25488478094339373, "num_tokens": 139692698.0, "step": 60985 }, { "entropy": 5.293153762817383, "epoch": 6.029062870699882, "grad_norm": 1.15625, "learning_rate": 0.0002061494919985572, "loss": 4.7085, "mean_token_accuracy": 0.25010821521282195, "num_tokens": 139704856.0, "step": 60990 }, { "entropy": 5.241593551635742, "epoch": 6.029557137208383, "grad_norm": 1.0625, "learning_rate": 0.0002061158956958853, "loss": 4.5882, "mean_token_accuracy": 0.25884418934583664, "num_tokens": 139716525.0, "step": 60995 }, { "entropy": 5.289035892486572, "epoch": 6.030051403716884, "grad_norm": 1.1875, "learning_rate": 0.0002060823010877731, "loss": 4.6084, "mean_token_accuracy": 0.2605911776423454, "num_tokens": 139728061.0, "step": 61000 }, { "entropy": 5.313314771652221, "epoch": 6.0305456702253855, "grad_norm": 1.1875, "learning_rate": 0.000206048708175047, "loss": 4.6396, "mean_token_accuracy": 0.2525541126728058, "num_tokens": 139739539.0, "step": 61005 }, { "entropy": 5.165503597259521, "epoch": 6.031039936733887, "grad_norm": 1.421875, "learning_rate": 0.0002060151169585333, "loss": 4.4882, "mean_token_accuracy": 0.27052858769893645, "num_tokens": 139750749.0, "step": 61010 }, { "entropy": 5.219202327728271, "epoch": 6.031534203242388, "grad_norm": 1.109375, "learning_rate": 0.00020598152743905846, "loss": 4.5573, "mean_token_accuracy": 0.2632695555686951, "num_tokens": 139763084.0, "step": 61015 }, { "entropy": 5.298484563827515, "epoch": 6.032028469750889, "grad_norm": 1.0859375, "learning_rate": 0.0002059479396174488, "loss": 4.7228, "mean_token_accuracy": 0.2513610631227493, "num_tokens": 139775096.0, "step": 61020 }, { "entropy": 5.278057670593261, "epoch": 6.032522736259391, "grad_norm": 1.1171875, "learning_rate": 0.00020591435349453052, "loss": 4.6607, "mean_token_accuracy": 0.25456844717264177, "num_tokens": 139786886.0, "step": 61025 }, { "entropy": 5.291770076751709, "epoch": 6.033017002767893, "grad_norm": 1.15625, "learning_rate": 0.00020588076907112986, "loss": 4.6696, "mean_token_accuracy": 0.2578285872936249, "num_tokens": 139797548.0, "step": 61030 }, { "entropy": 5.238278102874756, "epoch": 6.033511269276394, "grad_norm": 1.21875, "learning_rate": 0.00020584718634807293, "loss": 4.639, "mean_token_accuracy": 0.25596373826265334, "num_tokens": 139808962.0, "step": 61035 }, { "entropy": 5.227921390533448, "epoch": 6.034005535784895, "grad_norm": 1.15625, "learning_rate": 0.00020581360532618604, "loss": 4.6185, "mean_token_accuracy": 0.2632951334118843, "num_tokens": 139819662.0, "step": 61040 }, { "entropy": 5.280294942855835, "epoch": 6.034499802293396, "grad_norm": 1.171875, "learning_rate": 0.0002057800260062951, "loss": 4.5952, "mean_token_accuracy": 0.26058178693056105, "num_tokens": 139831232.0, "step": 61045 }, { "entropy": 5.2560803413391115, "epoch": 6.034994068801898, "grad_norm": 1.171875, "learning_rate": 0.00020574644838922628, "loss": 4.5848, "mean_token_accuracy": 0.263701057434082, "num_tokens": 139842775.0, "step": 61050 }, { "entropy": 5.221063137054443, "epoch": 6.035488335310399, "grad_norm": 1.21875, "learning_rate": 0.00020571287247580567, "loss": 4.551, "mean_token_accuracy": 0.2641581118106842, "num_tokens": 139854726.0, "step": 61055 }, { "entropy": 5.280166435241699, "epoch": 6.035982601818901, "grad_norm": 1.1953125, "learning_rate": 0.00020567929826685905, "loss": 4.6606, "mean_token_accuracy": 0.25711689740419386, "num_tokens": 139866423.0, "step": 61060 }, { "entropy": 5.231636190414429, "epoch": 6.036476868327402, "grad_norm": 1.2421875, "learning_rate": 0.0002056457257632125, "loss": 4.5819, "mean_token_accuracy": 0.2682895764708519, "num_tokens": 139877812.0, "step": 61065 }, { "entropy": 5.325677061080933, "epoch": 6.036971134835904, "grad_norm": 1.1640625, "learning_rate": 0.00020561215496569185, "loss": 4.7163, "mean_token_accuracy": 0.24889951646327974, "num_tokens": 139888945.0, "step": 61070 }, { "entropy": 5.34915566444397, "epoch": 6.037465401344405, "grad_norm": 1.125, "learning_rate": 0.00020557858587512285, "loss": 4.6753, "mean_token_accuracy": 0.25303456783294676, "num_tokens": 139901716.0, "step": 61075 }, { "entropy": 5.2588037014007565, "epoch": 6.037959667852906, "grad_norm": 1.15625, "learning_rate": 0.00020554501849233154, "loss": 4.5904, "mean_token_accuracy": 0.2577541843056679, "num_tokens": 139914626.0, "step": 61080 }, { "entropy": 5.284672451019287, "epoch": 6.038453934361407, "grad_norm": 1.15625, "learning_rate": 0.0002055114528181435, "loss": 4.6157, "mean_token_accuracy": 0.25414783507585526, "num_tokens": 139926242.0, "step": 61085 }, { "entropy": 5.368589115142822, "epoch": 6.038948200869909, "grad_norm": 1.140625, "learning_rate": 0.00020547788885338453, "loss": 4.8317, "mean_token_accuracy": 0.24086401462554932, "num_tokens": 139938735.0, "step": 61090 }, { "entropy": 5.24082236289978, "epoch": 6.039442467378411, "grad_norm": 1.1875, "learning_rate": 0.00020544432659888023, "loss": 4.5711, "mean_token_accuracy": 0.26163480430841446, "num_tokens": 139949006.0, "step": 61095 }, { "entropy": 5.309702825546265, "epoch": 6.039936733886912, "grad_norm": 1.078125, "learning_rate": 0.00020541076605545627, "loss": 4.5933, "mean_token_accuracy": 0.2572226718068123, "num_tokens": 139961209.0, "step": 61100 }, { "entropy": 5.292744970321655, "epoch": 6.040431000395413, "grad_norm": 1.0859375, "learning_rate": 0.00020537720722393834, "loss": 4.6121, "mean_token_accuracy": 0.25734783709049225, "num_tokens": 139973369.0, "step": 61105 }, { "entropy": 5.334368944168091, "epoch": 6.040925266903915, "grad_norm": 1.125, "learning_rate": 0.00020534365010515182, "loss": 4.7041, "mean_token_accuracy": 0.24606849402189254, "num_tokens": 139985997.0, "step": 61110 }, { "entropy": 5.306404447555542, "epoch": 6.041419533412416, "grad_norm": 1.078125, "learning_rate": 0.0002053100946999224, "loss": 4.6869, "mean_token_accuracy": 0.250640669465065, "num_tokens": 139998676.0, "step": 61115 }, { "entropy": 5.286233377456665, "epoch": 6.041913799920917, "grad_norm": 1.1171875, "learning_rate": 0.00020527654100907543, "loss": 4.619, "mean_token_accuracy": 0.2543318152427673, "num_tokens": 140010421.0, "step": 61120 }, { "entropy": 5.251096773147583, "epoch": 6.042408066429418, "grad_norm": 1.140625, "learning_rate": 0.00020524298903343646, "loss": 4.6186, "mean_token_accuracy": 0.25904695838689806, "num_tokens": 140021705.0, "step": 61125 }, { "entropy": 5.255278158187866, "epoch": 6.042902332937921, "grad_norm": 1.2265625, "learning_rate": 0.0002052094387738306, "loss": 4.5874, "mean_token_accuracy": 0.26591535210609435, "num_tokens": 140032430.0, "step": 61130 }, { "entropy": 5.218718004226685, "epoch": 6.043396599446422, "grad_norm": 1.1484375, "learning_rate": 0.00020517589023108342, "loss": 4.588, "mean_token_accuracy": 0.25785375833511354, "num_tokens": 140043634.0, "step": 61135 }, { "entropy": 5.269227170944214, "epoch": 6.043890865954923, "grad_norm": 1.25, "learning_rate": 0.0002051423434060203, "loss": 4.6943, "mean_token_accuracy": 0.2502132743597031, "num_tokens": 140054230.0, "step": 61140 }, { "entropy": 5.268553304672241, "epoch": 6.044385132463424, "grad_norm": 1.2109375, "learning_rate": 0.00020510879829946626, "loss": 4.6285, "mean_token_accuracy": 0.25841093212366106, "num_tokens": 140065523.0, "step": 61145 }, { "entropy": 5.311369705200195, "epoch": 6.044879398971926, "grad_norm": 1.2734375, "learning_rate": 0.00020507525491224665, "loss": 4.7047, "mean_token_accuracy": 0.25652437955141066, "num_tokens": 140076969.0, "step": 61150 }, { "entropy": 5.277059078216553, "epoch": 6.045373665480427, "grad_norm": 1.1171875, "learning_rate": 0.00020504171324518662, "loss": 4.6277, "mean_token_accuracy": 0.2643318697810173, "num_tokens": 140087977.0, "step": 61155 }, { "entropy": 5.2934197902679445, "epoch": 6.045867931988928, "grad_norm": 1.109375, "learning_rate": 0.0002050081732991112, "loss": 4.6691, "mean_token_accuracy": 0.24843119233846664, "num_tokens": 140099249.0, "step": 61160 }, { "entropy": 5.29324517250061, "epoch": 6.046362198497429, "grad_norm": 1.171875, "learning_rate": 0.0002049746350748457, "loss": 4.6804, "mean_token_accuracy": 0.25078852027654647, "num_tokens": 140110824.0, "step": 61165 }, { "entropy": 5.204017162322998, "epoch": 6.0468564650059315, "grad_norm": 1.359375, "learning_rate": 0.00020494109857321504, "loss": 4.4821, "mean_token_accuracy": 0.2712095320224762, "num_tokens": 140120969.0, "step": 61170 }, { "entropy": 5.280119848251343, "epoch": 6.047350731514433, "grad_norm": 1.140625, "learning_rate": 0.00020490756379504423, "loss": 4.5849, "mean_token_accuracy": 0.25890160650014876, "num_tokens": 140132375.0, "step": 61175 }, { "entropy": 5.255607414245605, "epoch": 6.047844998022934, "grad_norm": 1.3046875, "learning_rate": 0.00020487403074115817, "loss": 4.6567, "mean_token_accuracy": 0.2564279541373253, "num_tokens": 140143246.0, "step": 61180 }, { "entropy": 5.284358167648316, "epoch": 6.048339264531435, "grad_norm": 1.1328125, "learning_rate": 0.00020484049941238186, "loss": 4.7026, "mean_token_accuracy": 0.2456412896513939, "num_tokens": 140155005.0, "step": 61185 }, { "entropy": 5.339369297027588, "epoch": 6.048833531039937, "grad_norm": 1.1328125, "learning_rate": 0.00020480696980954005, "loss": 4.7185, "mean_token_accuracy": 0.2524207577109337, "num_tokens": 140168027.0, "step": 61190 }, { "entropy": 5.3215922832489015, "epoch": 6.049327797548438, "grad_norm": 1.109375, "learning_rate": 0.00020477344193345782, "loss": 4.6206, "mean_token_accuracy": 0.2621557965874672, "num_tokens": 140179431.0, "step": 61195 }, { "entropy": 5.2818365573883055, "epoch": 6.049822064056939, "grad_norm": 1.1328125, "learning_rate": 0.00020473991578495975, "loss": 4.6181, "mean_token_accuracy": 0.2624098137021065, "num_tokens": 140190784.0, "step": 61200 }, { "entropy": 5.3259741306304935, "epoch": 6.050316330565441, "grad_norm": 1.15625, "learning_rate": 0.00020470639136487063, "loss": 4.7143, "mean_token_accuracy": 0.25067937821149827, "num_tokens": 140202065.0, "step": 61205 }, { "entropy": 5.260363292694092, "epoch": 6.0508105970739425, "grad_norm": 1.2578125, "learning_rate": 0.00020467286867401524, "loss": 4.6217, "mean_token_accuracy": 0.25903493762016294, "num_tokens": 140212666.0, "step": 61210 }, { "entropy": 5.230180788040161, "epoch": 6.051304863582444, "grad_norm": 1.140625, "learning_rate": 0.00020463934771321825, "loss": 4.5987, "mean_token_accuracy": 0.25593003183603286, "num_tokens": 140223070.0, "step": 61215 }, { "entropy": 5.2629234313964846, "epoch": 6.051799130090945, "grad_norm": 1.171875, "learning_rate": 0.00020460582848330405, "loss": 4.6143, "mean_token_accuracy": 0.2629036635160446, "num_tokens": 140233707.0, "step": 61220 }, { "entropy": 5.285286617279053, "epoch": 6.052293396599446, "grad_norm": 1.1484375, "learning_rate": 0.0002045723109850975, "loss": 4.5809, "mean_token_accuracy": 0.2617896169424057, "num_tokens": 140245286.0, "step": 61225 }, { "entropy": 5.259001302719116, "epoch": 6.052787663107948, "grad_norm": 1.25, "learning_rate": 0.00020453879521942293, "loss": 4.5908, "mean_token_accuracy": 0.25795823335647583, "num_tokens": 140256257.0, "step": 61230 }, { "entropy": 5.23993067741394, "epoch": 6.053281929616449, "grad_norm": 1.09375, "learning_rate": 0.00020450528118710505, "loss": 4.6012, "mean_token_accuracy": 0.257881273329258, "num_tokens": 140268410.0, "step": 61235 }, { "entropy": 5.285892963409424, "epoch": 6.053776196124951, "grad_norm": 1.125, "learning_rate": 0.00020447176888896813, "loss": 4.6325, "mean_token_accuracy": 0.25336759686470034, "num_tokens": 140279370.0, "step": 61240 }, { "entropy": 5.294944429397583, "epoch": 6.054270462633452, "grad_norm": 1.2109375, "learning_rate": 0.00020443825832583662, "loss": 4.6304, "mean_token_accuracy": 0.2597240135073662, "num_tokens": 140290281.0, "step": 61245 }, { "entropy": 5.235268926620483, "epoch": 6.0547647291419535, "grad_norm": 1.2109375, "learning_rate": 0.00020440474949853495, "loss": 4.5753, "mean_token_accuracy": 0.2637230932712555, "num_tokens": 140301394.0, "step": 61250 }, { "entropy": 5.283894157409668, "epoch": 6.055258995650455, "grad_norm": 1.1875, "learning_rate": 0.00020437124240788734, "loss": 4.6937, "mean_token_accuracy": 0.25704535841941833, "num_tokens": 140313436.0, "step": 61255 }, { "entropy": 5.33158016204834, "epoch": 6.055753262158956, "grad_norm": 1.2421875, "learning_rate": 0.0002043377370547182, "loss": 4.6416, "mean_token_accuracy": 0.25171867609024046, "num_tokens": 140323593.0, "step": 61260 }, { "entropy": 5.244850921630859, "epoch": 6.056247528667457, "grad_norm": 1.203125, "learning_rate": 0.00020430423343985166, "loss": 4.6397, "mean_token_accuracy": 0.25296230912208556, "num_tokens": 140334946.0, "step": 61265 }, { "entropy": 5.242374753952026, "epoch": 6.056741795175959, "grad_norm": 1.1875, "learning_rate": 0.0002042707315641119, "loss": 4.6126, "mean_token_accuracy": 0.256649611890316, "num_tokens": 140346354.0, "step": 61270 }, { "entropy": 5.29171199798584, "epoch": 6.05723606168446, "grad_norm": 1.1484375, "learning_rate": 0.0002042372314283231, "loss": 4.6413, "mean_token_accuracy": 0.25633695125579836, "num_tokens": 140358259.0, "step": 61275 }, { "entropy": 5.346139287948608, "epoch": 6.057730328192962, "grad_norm": 1.2421875, "learning_rate": 0.00020420373303330942, "loss": 4.739, "mean_token_accuracy": 0.24512550681829454, "num_tokens": 140369488.0, "step": 61280 }, { "entropy": 5.317365598678589, "epoch": 6.058224594701463, "grad_norm": 1.125, "learning_rate": 0.0002041702363798949, "loss": 4.6414, "mean_token_accuracy": 0.2549668148159981, "num_tokens": 140380479.0, "step": 61285 }, { "entropy": 5.313467645645142, "epoch": 6.0587188612099645, "grad_norm": 1.203125, "learning_rate": 0.0002041367414689036, "loss": 4.6285, "mean_token_accuracy": 0.25598473995924, "num_tokens": 140393133.0, "step": 61290 }, { "entropy": 5.235687112808227, "epoch": 6.059213127718466, "grad_norm": 1.15625, "learning_rate": 0.00020410324830115944, "loss": 4.6378, "mean_token_accuracy": 0.2549681022763252, "num_tokens": 140405919.0, "step": 61295 }, { "entropy": 5.249975538253784, "epoch": 6.059707394226967, "grad_norm": 1.359375, "learning_rate": 0.00020406975687748636, "loss": 4.5636, "mean_token_accuracy": 0.25902717709541323, "num_tokens": 140416090.0, "step": 61300 }, { "entropy": 5.230994033813476, "epoch": 6.060201660735468, "grad_norm": 1.1015625, "learning_rate": 0.00020403626719870817, "loss": 4.6621, "mean_token_accuracy": 0.2529013827443123, "num_tokens": 140428089.0, "step": 61305 }, { "entropy": 5.277666759490967, "epoch": 6.0606959272439695, "grad_norm": 1.2890625, "learning_rate": 0.00020400277926564887, "loss": 4.6407, "mean_token_accuracy": 0.2523605406284332, "num_tokens": 140438898.0, "step": 61310 }, { "entropy": 5.266914224624633, "epoch": 6.061190193752472, "grad_norm": 1.3359375, "learning_rate": 0.00020396929307913225, "loss": 4.6315, "mean_token_accuracy": 0.25675068497657777, "num_tokens": 140449651.0, "step": 61315 }, { "entropy": 5.232138299942017, "epoch": 6.061684460260973, "grad_norm": 1.1328125, "learning_rate": 0.00020393580863998207, "loss": 4.5497, "mean_token_accuracy": 0.2667127475142479, "num_tokens": 140460444.0, "step": 61320 }, { "entropy": 5.296182680130005, "epoch": 6.062178726769474, "grad_norm": 1.0078125, "learning_rate": 0.00020390232594902198, "loss": 4.6875, "mean_token_accuracy": 0.2532379046082497, "num_tokens": 140473869.0, "step": 61325 }, { "entropy": 5.256191205978394, "epoch": 6.0626729932779755, "grad_norm": 1.1640625, "learning_rate": 0.0002038688450070757, "loss": 4.5928, "mean_token_accuracy": 0.26023480445146563, "num_tokens": 140484551.0, "step": 61330 }, { "entropy": 5.21178879737854, "epoch": 6.063167259786477, "grad_norm": 1.09375, "learning_rate": 0.0002038353658149668, "loss": 4.6006, "mean_token_accuracy": 0.2635767489671707, "num_tokens": 140496731.0, "step": 61335 }, { "entropy": 5.282061147689819, "epoch": 6.063661526294978, "grad_norm": 1.0234375, "learning_rate": 0.00020380188837351904, "loss": 4.7052, "mean_token_accuracy": 0.2458624467253685, "num_tokens": 140510291.0, "step": 61340 }, { "entropy": 5.310865497589111, "epoch": 6.064155792803479, "grad_norm": 1.125, "learning_rate": 0.00020376841268355584, "loss": 4.7114, "mean_token_accuracy": 0.2500819131731987, "num_tokens": 140522796.0, "step": 61345 }, { "entropy": 5.242147636413574, "epoch": 6.064650059311981, "grad_norm": 1.2109375, "learning_rate": 0.00020373493874590071, "loss": 4.5748, "mean_token_accuracy": 0.25623233020305636, "num_tokens": 140533421.0, "step": 61350 }, { "entropy": 5.2970256328582765, "epoch": 6.065144325820483, "grad_norm": 1.234375, "learning_rate": 0.0002037014665613772, "loss": 4.6117, "mean_token_accuracy": 0.2504762336611748, "num_tokens": 140544443.0, "step": 61355 }, { "entropy": 5.288178968429565, "epoch": 6.065638592328984, "grad_norm": 1.1640625, "learning_rate": 0.00020366799613080866, "loss": 4.6307, "mean_token_accuracy": 0.25334192961454394, "num_tokens": 140556649.0, "step": 61360 }, { "entropy": 5.217345237731934, "epoch": 6.066132858837485, "grad_norm": 1.2734375, "learning_rate": 0.00020363452745501842, "loss": 4.516, "mean_token_accuracy": 0.2574292942881584, "num_tokens": 140567195.0, "step": 61365 }, { "entropy": 5.23370213508606, "epoch": 6.0666271253459865, "grad_norm": 1.1875, "learning_rate": 0.00020360106053482997, "loss": 4.5826, "mean_token_accuracy": 0.26768175661563876, "num_tokens": 140577461.0, "step": 61370 }, { "entropy": 5.267258977890014, "epoch": 6.067121391854488, "grad_norm": 1.171875, "learning_rate": 0.0002035675953710664, "loss": 4.6149, "mean_token_accuracy": 0.26167052090167997, "num_tokens": 140588531.0, "step": 61375 }, { "entropy": 5.299713516235352, "epoch": 6.067615658362989, "grad_norm": 1.1796875, "learning_rate": 0.00020353413196455116, "loss": 4.6884, "mean_token_accuracy": 0.25364255011081693, "num_tokens": 140600677.0, "step": 61380 }, { "entropy": 5.279131507873535, "epoch": 6.068109924871491, "grad_norm": 1.2421875, "learning_rate": 0.00020350067031610735, "loss": 4.6314, "mean_token_accuracy": 0.26450540125370026, "num_tokens": 140611847.0, "step": 61385 }, { "entropy": 5.257270050048828, "epoch": 6.068604191379992, "grad_norm": 1.203125, "learning_rate": 0.00020346721042655808, "loss": 4.5837, "mean_token_accuracy": 0.26463498175144196, "num_tokens": 140623457.0, "step": 61390 }, { "entropy": 5.229343891143799, "epoch": 6.069098457888494, "grad_norm": 1.109375, "learning_rate": 0.00020343375229672656, "loss": 4.6072, "mean_token_accuracy": 0.2556746765971184, "num_tokens": 140635239.0, "step": 61395 }, { "entropy": 5.25653829574585, "epoch": 6.069592724396995, "grad_norm": 1.0703125, "learning_rate": 0.0002034002959274358, "loss": 4.6969, "mean_token_accuracy": 0.24923175424337388, "num_tokens": 140647482.0, "step": 61400 }, { "entropy": 5.259640884399414, "epoch": 6.070086990905496, "grad_norm": 1.125, "learning_rate": 0.00020336684131950895, "loss": 4.6192, "mean_token_accuracy": 0.25697836130857465, "num_tokens": 140658837.0, "step": 61405 }, { "entropy": 5.213020372390747, "epoch": 6.0705812574139975, "grad_norm": 1.2890625, "learning_rate": 0.00020333338847376893, "loss": 4.6124, "mean_token_accuracy": 0.26332612335681915, "num_tokens": 140671035.0, "step": 61410 }, { "entropy": 5.261861276626587, "epoch": 6.071075523922499, "grad_norm": 1.125, "learning_rate": 0.0002032999373910386, "loss": 4.5784, "mean_token_accuracy": 0.2661094903945923, "num_tokens": 140683679.0, "step": 61415 }, { "entropy": 5.309759902954101, "epoch": 6.071569790431, "grad_norm": 1.03125, "learning_rate": 0.00020326648807214088, "loss": 4.682, "mean_token_accuracy": 0.25086618959903717, "num_tokens": 140696057.0, "step": 61420 }, { "entropy": 5.284438705444336, "epoch": 6.072064056939502, "grad_norm": 1.203125, "learning_rate": 0.00020323304051789875, "loss": 4.6675, "mean_token_accuracy": 0.25036803632974625, "num_tokens": 140707489.0, "step": 61425 }, { "entropy": 5.261046504974365, "epoch": 6.072558323448003, "grad_norm": 1.15625, "learning_rate": 0.00020319959472913502, "loss": 4.5975, "mean_token_accuracy": 0.2538428530097008, "num_tokens": 140718124.0, "step": 61430 }, { "entropy": 5.306775808334351, "epoch": 6.073052589956505, "grad_norm": 1.3203125, "learning_rate": 0.00020316615070667233, "loss": 4.6821, "mean_token_accuracy": 0.2494730606675148, "num_tokens": 140729275.0, "step": 61435 }, { "entropy": 5.304315137863159, "epoch": 6.073546856465006, "grad_norm": 1.140625, "learning_rate": 0.00020313270845133348, "loss": 4.6403, "mean_token_accuracy": 0.26012742072343825, "num_tokens": 140741717.0, "step": 61440 }, { "entropy": 5.252471780776977, "epoch": 6.074041122973507, "grad_norm": 1.1015625, "learning_rate": 0.00020309926796394117, "loss": 4.5913, "mean_token_accuracy": 0.2679335027933121, "num_tokens": 140752812.0, "step": 61445 }, { "entropy": 5.189150762557984, "epoch": 6.074535389482008, "grad_norm": 1.2265625, "learning_rate": 0.00020306582924531797, "loss": 4.529, "mean_token_accuracy": 0.2694786489009857, "num_tokens": 140763986.0, "step": 61450 }, { "entropy": 5.225768136978149, "epoch": 6.07502965599051, "grad_norm": 1.046875, "learning_rate": 0.00020303239229628656, "loss": 4.6456, "mean_token_accuracy": 0.25940542221069335, "num_tokens": 140776650.0, "step": 61455 }, { "entropy": 5.2865111351013185, "epoch": 6.075523922499012, "grad_norm": 1.0546875, "learning_rate": 0.0002029989571176695, "loss": 4.7078, "mean_token_accuracy": 0.25835839509963987, "num_tokens": 140789957.0, "step": 61460 }, { "entropy": 5.2509297847747805, "epoch": 6.076018189007513, "grad_norm": 1.2265625, "learning_rate": 0.00020296552371028927, "loss": 4.6268, "mean_token_accuracy": 0.25863475203514097, "num_tokens": 140802220.0, "step": 61465 }, { "entropy": 5.213498735427857, "epoch": 6.076512455516014, "grad_norm": 1.140625, "learning_rate": 0.00020293209207496832, "loss": 4.5404, "mean_token_accuracy": 0.2656314015388489, "num_tokens": 140812851.0, "step": 61470 }, { "entropy": 5.379096126556396, "epoch": 6.077006722024516, "grad_norm": 1.1015625, "learning_rate": 0.00020289866221252906, "loss": 4.6943, "mean_token_accuracy": 0.2547381266951561, "num_tokens": 140824526.0, "step": 61475 }, { "entropy": 5.2358095169067385, "epoch": 6.077500988533017, "grad_norm": 1.078125, "learning_rate": 0.00020286523412379383, "loss": 4.5345, "mean_token_accuracy": 0.27066502571105955, "num_tokens": 140835600.0, "step": 61480 }, { "entropy": 5.257580757141113, "epoch": 6.077995255041518, "grad_norm": 1.15625, "learning_rate": 0.00020283180780958514, "loss": 4.6152, "mean_token_accuracy": 0.26369100362062453, "num_tokens": 140846829.0, "step": 61485 }, { "entropy": 5.189456272125244, "epoch": 6.078489521550019, "grad_norm": 1.203125, "learning_rate": 0.00020279838327072513, "loss": 4.5705, "mean_token_accuracy": 0.268561190366745, "num_tokens": 140857864.0, "step": 61490 }, { "entropy": 5.232411050796509, "epoch": 6.078983788058522, "grad_norm": 1.28125, "learning_rate": 0.00020276496050803612, "loss": 4.6083, "mean_token_accuracy": 0.26020748615264894, "num_tokens": 140868329.0, "step": 61495 }, { "entropy": 5.2980711460113525, "epoch": 6.079478054567023, "grad_norm": 1.25, "learning_rate": 0.0002027315395223403, "loss": 4.6043, "mean_token_accuracy": 0.25762072056531904, "num_tokens": 140877913.0, "step": 61500 }, { "entropy": 5.306698656082153, "epoch": 6.079972321075524, "grad_norm": 1.21875, "learning_rate": 0.00020269812031445983, "loss": 4.6614, "mean_token_accuracy": 0.2524603858590126, "num_tokens": 140888982.0, "step": 61505 }, { "entropy": 5.292655181884766, "epoch": 6.080466587584025, "grad_norm": 1.1640625, "learning_rate": 0.00020266470288521666, "loss": 4.6601, "mean_token_accuracy": 0.2496751517057419, "num_tokens": 140901231.0, "step": 61510 }, { "entropy": 5.206697607040406, "epoch": 6.080960854092527, "grad_norm": 1.2265625, "learning_rate": 0.0002026312872354331, "loss": 4.543, "mean_token_accuracy": 0.2697418585419655, "num_tokens": 140912082.0, "step": 61515 }, { "entropy": 5.146818065643311, "epoch": 6.081455120601028, "grad_norm": 1.265625, "learning_rate": 0.00020259787336593117, "loss": 4.5233, "mean_token_accuracy": 0.27257741093635557, "num_tokens": 140923326.0, "step": 61520 }, { "entropy": 5.24399995803833, "epoch": 6.081949387109529, "grad_norm": 1.1953125, "learning_rate": 0.00020256446127753282, "loss": 4.5612, "mean_token_accuracy": 0.25788353234529493, "num_tokens": 140934173.0, "step": 61525 }, { "entropy": 5.191952037811279, "epoch": 6.08244365361803, "grad_norm": 1.1875, "learning_rate": 0.00020253105097105988, "loss": 4.5746, "mean_token_accuracy": 0.26371759474277495, "num_tokens": 140946321.0, "step": 61530 }, { "entropy": 5.3400016784667965, "epoch": 6.082937920126533, "grad_norm": 1.28125, "learning_rate": 0.00020249764244733431, "loss": 4.7165, "mean_token_accuracy": 0.24924378246068954, "num_tokens": 140958328.0, "step": 61535 }, { "entropy": 5.312329816818237, "epoch": 6.083432186635034, "grad_norm": 1.203125, "learning_rate": 0.00020246423570717797, "loss": 4.6211, "mean_token_accuracy": 0.2667196750640869, "num_tokens": 140968906.0, "step": 61540 }, { "entropy": 5.327394962310791, "epoch": 6.083926453143535, "grad_norm": 1.15625, "learning_rate": 0.00020243083075141278, "loss": 4.6319, "mean_token_accuracy": 0.25627290159463884, "num_tokens": 140981053.0, "step": 61545 }, { "entropy": 5.254121112823486, "epoch": 6.084420719652036, "grad_norm": 1.1015625, "learning_rate": 0.0002023974275808604, "loss": 4.6102, "mean_token_accuracy": 0.2591626837849617, "num_tokens": 140992967.0, "step": 61550 }, { "entropy": 5.23685393333435, "epoch": 6.084914986160538, "grad_norm": 1.1640625, "learning_rate": 0.00020236402619634253, "loss": 4.6275, "mean_token_accuracy": 0.25954188108444215, "num_tokens": 141005915.0, "step": 61555 }, { "entropy": 5.347068500518799, "epoch": 6.085409252669039, "grad_norm": 1.203125, "learning_rate": 0.00020233062659868084, "loss": 4.7118, "mean_token_accuracy": 0.24928627759218216, "num_tokens": 141016500.0, "step": 61560 }, { "entropy": 5.268948888778686, "epoch": 6.08590351917754, "grad_norm": 1.09375, "learning_rate": 0.00020229722878869704, "loss": 4.6177, "mean_token_accuracy": 0.25441867411136626, "num_tokens": 141027689.0, "step": 61565 }, { "entropy": 5.283556890487671, "epoch": 6.086397785686042, "grad_norm": 1.15625, "learning_rate": 0.00020226383276721266, "loss": 4.6512, "mean_token_accuracy": 0.25495388358831406, "num_tokens": 141038805.0, "step": 61570 }, { "entropy": 5.346760272979736, "epoch": 6.0868920521945435, "grad_norm": 1.2109375, "learning_rate": 0.00020223043853504936, "loss": 4.6999, "mean_token_accuracy": 0.24873000532388687, "num_tokens": 141049326.0, "step": 61575 }, { "entropy": 5.316886615753174, "epoch": 6.087386318703045, "grad_norm": 1.0234375, "learning_rate": 0.00020219704609302853, "loss": 4.6792, "mean_token_accuracy": 0.25408985167741777, "num_tokens": 141061990.0, "step": 61580 }, { "entropy": 5.23269829750061, "epoch": 6.087880585211546, "grad_norm": 1.2578125, "learning_rate": 0.0002021636554419717, "loss": 4.5392, "mean_token_accuracy": 0.2636398494243622, "num_tokens": 141072146.0, "step": 61585 }, { "entropy": 5.2407127857208256, "epoch": 6.088374851720047, "grad_norm": 1.21875, "learning_rate": 0.00020213026658270016, "loss": 4.5906, "mean_token_accuracy": 0.2652603954076767, "num_tokens": 141083700.0, "step": 61590 }, { "entropy": 5.250426006317139, "epoch": 6.088869118228549, "grad_norm": 1.2890625, "learning_rate": 0.00020209687951603533, "loss": 4.5741, "mean_token_accuracy": 0.2598252221941948, "num_tokens": 141095870.0, "step": 61595 }, { "entropy": 5.3170530796051025, "epoch": 6.08936338473705, "grad_norm": 1.1953125, "learning_rate": 0.00020206349424279867, "loss": 4.7101, "mean_token_accuracy": 0.24843612760305406, "num_tokens": 141108179.0, "step": 61600 }, { "entropy": 5.303242111206055, "epoch": 6.089857651245552, "grad_norm": 1.171875, "learning_rate": 0.00020203011076381133, "loss": 4.7028, "mean_token_accuracy": 0.24444691836833954, "num_tokens": 141119914.0, "step": 61605 }, { "entropy": 5.27273120880127, "epoch": 6.090351917754053, "grad_norm": 1.234375, "learning_rate": 0.00020199672907989462, "loss": 4.61, "mean_token_accuracy": 0.2536739110946655, "num_tokens": 141130616.0, "step": 61610 }, { "entropy": 5.236253833770752, "epoch": 6.0908461842625545, "grad_norm": 1.109375, "learning_rate": 0.0002019633491918697, "loss": 4.5847, "mean_token_accuracy": 0.2601908788084984, "num_tokens": 141142479.0, "step": 61615 }, { "entropy": 5.231588888168335, "epoch": 6.091340450771056, "grad_norm": 1.15625, "learning_rate": 0.0002019299711005577, "loss": 4.51, "mean_token_accuracy": 0.26837683767080306, "num_tokens": 141153397.0, "step": 61620 }, { "entropy": 5.368384313583374, "epoch": 6.091834717279557, "grad_norm": 1.2734375, "learning_rate": 0.0002018965948067797, "loss": 4.7017, "mean_token_accuracy": 0.25026568323373793, "num_tokens": 141164912.0, "step": 61625 }, { "entropy": 5.336282062530517, "epoch": 6.092328983788058, "grad_norm": 1.2890625, "learning_rate": 0.0002018632203113569, "loss": 4.7704, "mean_token_accuracy": 0.2430303230881691, "num_tokens": 141176732.0, "step": 61630 }, { "entropy": 5.2594505786895756, "epoch": 6.09282325029656, "grad_norm": 1.1640625, "learning_rate": 0.00020182984761511015, "loss": 4.5714, "mean_token_accuracy": 0.26041627675294876, "num_tokens": 141188570.0, "step": 61635 }, { "entropy": 5.272551393508911, "epoch": 6.093317516805062, "grad_norm": 1.1171875, "learning_rate": 0.00020179647671886053, "loss": 4.6314, "mean_token_accuracy": 0.25904942452907564, "num_tokens": 141200024.0, "step": 61640 }, { "entropy": 5.307760381698609, "epoch": 6.093811783313563, "grad_norm": 1.3671875, "learning_rate": 0.00020176310762342903, "loss": 4.6987, "mean_token_accuracy": 0.25473032146692276, "num_tokens": 141211941.0, "step": 61645 }, { "entropy": 5.225958347320557, "epoch": 6.094306049822064, "grad_norm": 1.1484375, "learning_rate": 0.00020172974032963632, "loss": 4.5901, "mean_token_accuracy": 0.2630156174302101, "num_tokens": 141223083.0, "step": 61650 }, { "entropy": 5.339312410354614, "epoch": 6.0948003163305655, "grad_norm": 1.1875, "learning_rate": 0.00020169637483830334, "loss": 4.6884, "mean_token_accuracy": 0.2522415593266487, "num_tokens": 141234592.0, "step": 61655 }, { "entropy": 5.346350049972534, "epoch": 6.095294582839067, "grad_norm": 1.265625, "learning_rate": 0.00020166301115025093, "loss": 4.6993, "mean_token_accuracy": 0.24909468591213227, "num_tokens": 141245783.0, "step": 61660 }, { "entropy": 5.329531478881836, "epoch": 6.095788849347568, "grad_norm": 1.109375, "learning_rate": 0.00020162964926629995, "loss": 4.6693, "mean_token_accuracy": 0.25077151507139206, "num_tokens": 141257120.0, "step": 61665 }, { "entropy": 5.238084077835083, "epoch": 6.096283115856069, "grad_norm": 1.25, "learning_rate": 0.00020159628918727085, "loss": 4.5762, "mean_token_accuracy": 0.2638279378414154, "num_tokens": 141266546.0, "step": 61670 }, { "entropy": 5.190869569778442, "epoch": 6.096777382364571, "grad_norm": 1.2109375, "learning_rate": 0.00020156293091398448, "loss": 4.5074, "mean_token_accuracy": 0.26725761890411376, "num_tokens": 141277449.0, "step": 61675 }, { "entropy": 5.272979593276977, "epoch": 6.097271648873073, "grad_norm": 1.1484375, "learning_rate": 0.0002015295744472614, "loss": 4.6761, "mean_token_accuracy": 0.25316005647182466, "num_tokens": 141289023.0, "step": 61680 }, { "entropy": 5.259251451492309, "epoch": 6.097765915381574, "grad_norm": 1.140625, "learning_rate": 0.00020149621978792208, "loss": 4.6308, "mean_token_accuracy": 0.25628542304039004, "num_tokens": 141300664.0, "step": 61685 }, { "entropy": 5.253793239593506, "epoch": 6.098260181890075, "grad_norm": 1.1875, "learning_rate": 0.00020146286693678735, "loss": 4.6138, "mean_token_accuracy": 0.26312232613563535, "num_tokens": 141311097.0, "step": 61690 }, { "entropy": 5.2400110244750975, "epoch": 6.0987544483985765, "grad_norm": 1.2890625, "learning_rate": 0.00020142951589467739, "loss": 4.5883, "mean_token_accuracy": 0.2697571411728859, "num_tokens": 141322014.0, "step": 61695 }, { "entropy": 5.310119342803955, "epoch": 6.099248714907078, "grad_norm": 1.1875, "learning_rate": 0.00020139616666241272, "loss": 4.5936, "mean_token_accuracy": 0.2608616858720779, "num_tokens": 141333742.0, "step": 61700 }, { "entropy": 5.2806017875671385, "epoch": 6.099742981415579, "grad_norm": 1.1796875, "learning_rate": 0.0002013628192408139, "loss": 4.635, "mean_token_accuracy": 0.25871962308883667, "num_tokens": 141344740.0, "step": 61705 }, { "entropy": 5.290483140945435, "epoch": 6.10023724792408, "grad_norm": 1.140625, "learning_rate": 0.00020132947363070108, "loss": 4.6789, "mean_token_accuracy": 0.25667045563459395, "num_tokens": 141357653.0, "step": 61710 }, { "entropy": 5.356573486328125, "epoch": 6.100731514432582, "grad_norm": 1.234375, "learning_rate": 0.00020129612983289458, "loss": 4.69, "mean_token_accuracy": 0.2492350310087204, "num_tokens": 141367330.0, "step": 61715 }, { "entropy": 5.297550201416016, "epoch": 6.101225780941084, "grad_norm": 1.21875, "learning_rate": 0.00020126278784821477, "loss": 4.65, "mean_token_accuracy": 0.2528353437781334, "num_tokens": 141378469.0, "step": 61720 }, { "entropy": 5.226047515869141, "epoch": 6.101720047449585, "grad_norm": 1.2109375, "learning_rate": 0.00020122944767748174, "loss": 4.574, "mean_token_accuracy": 0.2578940957784653, "num_tokens": 141389535.0, "step": 61725 }, { "entropy": 5.271423768997193, "epoch": 6.102214313958086, "grad_norm": 1.21875, "learning_rate": 0.00020119610932151587, "loss": 4.5881, "mean_token_accuracy": 0.2562718078494072, "num_tokens": 141399146.0, "step": 61730 }, { "entropy": 5.288701725006104, "epoch": 6.1027085804665875, "grad_norm": 1.21875, "learning_rate": 0.00020116277278113716, "loss": 4.7008, "mean_token_accuracy": 0.25050962865352633, "num_tokens": 141411666.0, "step": 61735 }, { "entropy": 5.235662412643433, "epoch": 6.103202846975089, "grad_norm": 1.015625, "learning_rate": 0.00020112943805716555, "loss": 4.6101, "mean_token_accuracy": 0.26443816125392916, "num_tokens": 141422982.0, "step": 61740 }, { "entropy": 5.313817262649536, "epoch": 6.10369711348359, "grad_norm": 1.2421875, "learning_rate": 0.0002010961051504213, "loss": 4.6659, "mean_token_accuracy": 0.256793686747551, "num_tokens": 141433330.0, "step": 61745 }, { "entropy": 5.354697275161743, "epoch": 6.104191379992092, "grad_norm": 1.25, "learning_rate": 0.00020106277406172434, "loss": 4.7266, "mean_token_accuracy": 0.24500198662281036, "num_tokens": 141444261.0, "step": 61750 }, { "entropy": 5.281562280654907, "epoch": 6.104685646500593, "grad_norm": 1.3125, "learning_rate": 0.00020102944479189467, "loss": 4.6077, "mean_token_accuracy": 0.2621674448251724, "num_tokens": 141455155.0, "step": 61755 }, { "entropy": 5.268698740005493, "epoch": 6.105179913009095, "grad_norm": 1.21875, "learning_rate": 0.00020099611734175206, "loss": 4.6005, "mean_token_accuracy": 0.25718810260295866, "num_tokens": 141467148.0, "step": 61760 }, { "entropy": 5.312645721435547, "epoch": 6.105674179517596, "grad_norm": 1.1796875, "learning_rate": 0.0002009627917121165, "loss": 4.6685, "mean_token_accuracy": 0.25576311647891997, "num_tokens": 141478983.0, "step": 61765 }, { "entropy": 5.322626161575317, "epoch": 6.106168446026097, "grad_norm": 1.203125, "learning_rate": 0.0002009294679038076, "loss": 4.7311, "mean_token_accuracy": 0.2481103539466858, "num_tokens": 141490367.0, "step": 61770 }, { "entropy": 5.333720397949219, "epoch": 6.1066627125345985, "grad_norm": 1.109375, "learning_rate": 0.00020089614591764537, "loss": 4.7201, "mean_token_accuracy": 0.24900643080472945, "num_tokens": 141501584.0, "step": 61775 }, { "entropy": 5.226499223709107, "epoch": 6.1071569790431, "grad_norm": 1.171875, "learning_rate": 0.00020086282575444952, "loss": 4.5853, "mean_token_accuracy": 0.2629512831568718, "num_tokens": 141512396.0, "step": 61780 }, { "entropy": 5.288858795166016, "epoch": 6.107651245551601, "grad_norm": 1.25, "learning_rate": 0.00020082950741503964, "loss": 4.6307, "mean_token_accuracy": 0.2625179454684258, "num_tokens": 141523487.0, "step": 61785 }, { "entropy": 5.28158049583435, "epoch": 6.108145512060103, "grad_norm": 1.0859375, "learning_rate": 0.00020079619090023536, "loss": 4.6954, "mean_token_accuracy": 0.24795955568552017, "num_tokens": 141535640.0, "step": 61790 }, { "entropy": 5.287606430053711, "epoch": 6.108639778568604, "grad_norm": 1.109375, "learning_rate": 0.00020076287621085626, "loss": 4.6024, "mean_token_accuracy": 0.2613579347729683, "num_tokens": 141546475.0, "step": 61795 }, { "entropy": 5.2873069763183596, "epoch": 6.109134045077106, "grad_norm": 1.2265625, "learning_rate": 0.00020072956334772185, "loss": 4.5752, "mean_token_accuracy": 0.2579574003815651, "num_tokens": 141558655.0, "step": 61800 }, { "entropy": 5.244334125518799, "epoch": 6.109628311585607, "grad_norm": 1.1796875, "learning_rate": 0.00020069625231165184, "loss": 4.6385, "mean_token_accuracy": 0.25938508808612826, "num_tokens": 141570177.0, "step": 61805 }, { "entropy": 5.2918267250061035, "epoch": 6.110122578094108, "grad_norm": 1.1484375, "learning_rate": 0.00020066294310346555, "loss": 4.6954, "mean_token_accuracy": 0.2518437370657921, "num_tokens": 141582244.0, "step": 61810 }, { "entropy": 5.17821192741394, "epoch": 6.1106168446026095, "grad_norm": 1.3125, "learning_rate": 0.00020062963572398235, "loss": 4.4544, "mean_token_accuracy": 0.27312536239624025, "num_tokens": 141592469.0, "step": 61815 }, { "entropy": 5.343114709854126, "epoch": 6.111111111111111, "grad_norm": 1.125, "learning_rate": 0.00020059633017402163, "loss": 4.6476, "mean_token_accuracy": 0.2562215507030487, "num_tokens": 141603378.0, "step": 61820 }, { "entropy": 5.232807350158692, "epoch": 6.111605377619613, "grad_norm": 1.1328125, "learning_rate": 0.00020056302645440278, "loss": 4.542, "mean_token_accuracy": 0.27195013910531995, "num_tokens": 141613697.0, "step": 61825 }, { "entropy": 5.2531090259552, "epoch": 6.112099644128114, "grad_norm": 1.1015625, "learning_rate": 0.00020052972456594494, "loss": 4.6347, "mean_token_accuracy": 0.2546517372131348, "num_tokens": 141626063.0, "step": 61830 }, { "entropy": 5.252562665939331, "epoch": 6.112593910636615, "grad_norm": 1.2265625, "learning_rate": 0.00020049642450946752, "loss": 4.625, "mean_token_accuracy": 0.26030905693769457, "num_tokens": 141637068.0, "step": 61835 }, { "entropy": 5.213108873367309, "epoch": 6.113088177145117, "grad_norm": 1.171875, "learning_rate": 0.00020046312628578961, "loss": 4.5271, "mean_token_accuracy": 0.2664070025086403, "num_tokens": 141648229.0, "step": 61840 }, { "entropy": 5.29741473197937, "epoch": 6.113582443653618, "grad_norm": 1.2265625, "learning_rate": 0.00020042982989573028, "loss": 4.696, "mean_token_accuracy": 0.2447816789150238, "num_tokens": 141660397.0, "step": 61845 }, { "entropy": 5.278991937637329, "epoch": 6.114076710162119, "grad_norm": 1.2109375, "learning_rate": 0.00020039653534010876, "loss": 4.6501, "mean_token_accuracy": 0.2562526285648346, "num_tokens": 141671614.0, "step": 61850 }, { "entropy": 5.3020885467529295, "epoch": 6.11457097667062, "grad_norm": 1.1328125, "learning_rate": 0.0002003632426197441, "loss": 4.6775, "mean_token_accuracy": 0.25193312764167786, "num_tokens": 141683080.0, "step": 61855 }, { "entropy": 5.329658794403076, "epoch": 6.115065243179123, "grad_norm": 1.140625, "learning_rate": 0.0002003299517354551, "loss": 4.6842, "mean_token_accuracy": 0.24756197184324263, "num_tokens": 141695737.0, "step": 61860 }, { "entropy": 5.250329399108887, "epoch": 6.115559509687624, "grad_norm": 1.125, "learning_rate": 0.00020029666268806096, "loss": 4.583, "mean_token_accuracy": 0.2589892327785492, "num_tokens": 141707463.0, "step": 61865 }, { "entropy": 5.225118732452392, "epoch": 6.116053776196125, "grad_norm": 1.15625, "learning_rate": 0.00020026337547838046, "loss": 4.5849, "mean_token_accuracy": 0.2618635058403015, "num_tokens": 141718267.0, "step": 61870 }, { "entropy": 5.256431150436401, "epoch": 6.116548042704626, "grad_norm": 1.15625, "learning_rate": 0.0002002300901072326, "loss": 4.5724, "mean_token_accuracy": 0.26007536202669146, "num_tokens": 141729322.0, "step": 61875 }, { "entropy": 5.27593960762024, "epoch": 6.117042309213128, "grad_norm": 1.25, "learning_rate": 0.00020019680657543614, "loss": 4.6753, "mean_token_accuracy": 0.24891797155141832, "num_tokens": 141741158.0, "step": 61880 }, { "entropy": 5.28523211479187, "epoch": 6.117536575721629, "grad_norm": 1.140625, "learning_rate": 0.00020016352488380978, "loss": 4.6167, "mean_token_accuracy": 0.2642629638314247, "num_tokens": 141752528.0, "step": 61885 }, { "entropy": 5.268239831924438, "epoch": 6.11803084223013, "grad_norm": 1.1953125, "learning_rate": 0.0002001302450331723, "loss": 4.5349, "mean_token_accuracy": 0.26732695996761324, "num_tokens": 141762168.0, "step": 61890 }, { "entropy": 5.270225286483765, "epoch": 6.118525108738632, "grad_norm": 1.2734375, "learning_rate": 0.0002000969670243424, "loss": 4.586, "mean_token_accuracy": 0.25563664436340333, "num_tokens": 141773312.0, "step": 61895 }, { "entropy": 5.2544264793396, "epoch": 6.119019375247134, "grad_norm": 1.1953125, "learning_rate": 0.00020006369085813882, "loss": 4.5981, "mean_token_accuracy": 0.25710653364658353, "num_tokens": 141785154.0, "step": 61900 }, { "entropy": 5.251720285415649, "epoch": 6.119513641755635, "grad_norm": 1.265625, "learning_rate": 0.00020003041653538002, "loss": 4.5776, "mean_token_accuracy": 0.2615646317601204, "num_tokens": 141796289.0, "step": 61905 }, { "entropy": 5.2699315547943115, "epoch": 6.120007908264136, "grad_norm": 1.125, "learning_rate": 0.00019999714405688452, "loss": 4.6658, "mean_token_accuracy": 0.25254175812005997, "num_tokens": 141808032.0, "step": 61910 }, { "entropy": 5.2478584289550785, "epoch": 6.120502174772637, "grad_norm": 1.171875, "learning_rate": 0.000199963873423471, "loss": 4.6274, "mean_token_accuracy": 0.264279343187809, "num_tokens": 141819231.0, "step": 61915 }, { "entropy": 5.317060279846191, "epoch": 6.120996441281139, "grad_norm": 1.21875, "learning_rate": 0.0001999306046359578, "loss": 4.6159, "mean_token_accuracy": 0.2530990928411484, "num_tokens": 141829918.0, "step": 61920 }, { "entropy": 5.302922916412354, "epoch": 6.12149070778964, "grad_norm": 1.2734375, "learning_rate": 0.00019989733769516338, "loss": 4.6043, "mean_token_accuracy": 0.25869853496551515, "num_tokens": 141840212.0, "step": 61925 }, { "entropy": 5.212445163726807, "epoch": 6.121984974298141, "grad_norm": 1.1484375, "learning_rate": 0.00019986407260190619, "loss": 4.6093, "mean_token_accuracy": 0.25973006188869474, "num_tokens": 141851547.0, "step": 61930 }, { "entropy": 5.192409181594849, "epoch": 6.122479240806643, "grad_norm": 1.28125, "learning_rate": 0.00019983080935700437, "loss": 4.483, "mean_token_accuracy": 0.27102130353450776, "num_tokens": 141861862.0, "step": 61935 }, { "entropy": 5.192320489883423, "epoch": 6.122973507315145, "grad_norm": 1.234375, "learning_rate": 0.00019979754796127635, "loss": 4.6163, "mean_token_accuracy": 0.2592999994754791, "num_tokens": 141872807.0, "step": 61940 }, { "entropy": 5.253113508224487, "epoch": 6.123467773823646, "grad_norm": 1.2109375, "learning_rate": 0.00019976428841554024, "loss": 4.5517, "mean_token_accuracy": 0.2715494602918625, "num_tokens": 141883232.0, "step": 61945 }, { "entropy": 5.271692419052124, "epoch": 6.123962040332147, "grad_norm": 1.1640625, "learning_rate": 0.00019973103072061437, "loss": 4.7022, "mean_token_accuracy": 0.2538216903805733, "num_tokens": 141894443.0, "step": 61950 }, { "entropy": 5.2332775592803955, "epoch": 6.124456306840648, "grad_norm": 1.1171875, "learning_rate": 0.00019969777487731683, "loss": 4.5488, "mean_token_accuracy": 0.2675755262374878, "num_tokens": 141905255.0, "step": 61955 }, { "entropy": 5.211709499359131, "epoch": 6.12495057334915, "grad_norm": 1.3125, "learning_rate": 0.00019966452088646575, "loss": 4.5367, "mean_token_accuracy": 0.25869639217853546, "num_tokens": 141915247.0, "step": 61960 }, { "entropy": 5.232854700088501, "epoch": 6.125444839857651, "grad_norm": 1.0, "learning_rate": 0.00019963126874887905, "loss": 4.5796, "mean_token_accuracy": 0.26300047487020495, "num_tokens": 141927920.0, "step": 61965 }, { "entropy": 5.269161367416382, "epoch": 6.125939106366153, "grad_norm": 1.3046875, "learning_rate": 0.0001995980184653749, "loss": 4.6641, "mean_token_accuracy": 0.2511465549468994, "num_tokens": 141939197.0, "step": 61970 }, { "entropy": 5.24084792137146, "epoch": 6.126433372874654, "grad_norm": 1.125, "learning_rate": 0.00019956477003677108, "loss": 4.5741, "mean_token_accuracy": 0.2648240074515343, "num_tokens": 141950006.0, "step": 61975 }, { "entropy": 5.235811376571656, "epoch": 6.1269276393831555, "grad_norm": 1.015625, "learning_rate": 0.00019953152346388576, "loss": 4.6003, "mean_token_accuracy": 0.25980029702186586, "num_tokens": 141962556.0, "step": 61980 }, { "entropy": 5.2366265773773195, "epoch": 6.127421905891657, "grad_norm": 1.1640625, "learning_rate": 0.00019949827874753663, "loss": 4.5881, "mean_token_accuracy": 0.2631884902715683, "num_tokens": 141974015.0, "step": 61985 }, { "entropy": 5.260027742385864, "epoch": 6.127916172400158, "grad_norm": 1.1953125, "learning_rate": 0.00019946503588854153, "loss": 4.6237, "mean_token_accuracy": 0.2581596463918686, "num_tokens": 141984734.0, "step": 61990 }, { "entropy": 5.267140913009643, "epoch": 6.128410438908659, "grad_norm": 1.1796875, "learning_rate": 0.00019943179488771828, "loss": 4.6204, "mean_token_accuracy": 0.2570501908659935, "num_tokens": 141995483.0, "step": 61995 }, { "entropy": 5.3082239627838135, "epoch": 6.128904705417161, "grad_norm": 1.171875, "learning_rate": 0.00019939855574588466, "loss": 4.6485, "mean_token_accuracy": 0.2528876677155495, "num_tokens": 142007619.0, "step": 62000 }, { "entropy": 5.331804656982422, "epoch": 6.129398971925663, "grad_norm": 1.203125, "learning_rate": 0.00019936531846385813, "loss": 4.6908, "mean_token_accuracy": 0.25425794571638105, "num_tokens": 142019760.0, "step": 62005 }, { "entropy": 5.215579509735107, "epoch": 6.129893238434164, "grad_norm": 1.1015625, "learning_rate": 0.0001993320830424566, "loss": 4.5571, "mean_token_accuracy": 0.27165507078170775, "num_tokens": 142029682.0, "step": 62010 }, { "entropy": 5.298440027236938, "epoch": 6.130387504942665, "grad_norm": 1.234375, "learning_rate": 0.00019929884948249754, "loss": 4.6611, "mean_token_accuracy": 0.25283770710229875, "num_tokens": 142043250.0, "step": 62015 }, { "entropy": 5.315809726715088, "epoch": 6.1308817714511665, "grad_norm": 1.1171875, "learning_rate": 0.00019926561778479862, "loss": 4.72, "mean_token_accuracy": 0.24857401400804519, "num_tokens": 142055617.0, "step": 62020 }, { "entropy": 5.3563313484191895, "epoch": 6.131376037959668, "grad_norm": 1.15625, "learning_rate": 0.00019923238795017717, "loss": 4.6816, "mean_token_accuracy": 0.25424935668706894, "num_tokens": 142067039.0, "step": 62025 }, { "entropy": 5.272707939147949, "epoch": 6.131870304468169, "grad_norm": 1.109375, "learning_rate": 0.00019919915997945075, "loss": 4.5973, "mean_token_accuracy": 0.26244083046913147, "num_tokens": 142079150.0, "step": 62030 }, { "entropy": 5.317389011383057, "epoch": 6.13236457097667, "grad_norm": 1.125, "learning_rate": 0.00019916593387343673, "loss": 4.6268, "mean_token_accuracy": 0.26190613508224486, "num_tokens": 142090495.0, "step": 62035 }, { "entropy": 5.265502262115478, "epoch": 6.132858837485172, "grad_norm": 1.2265625, "learning_rate": 0.0001991327096329525, "loss": 4.5594, "mean_token_accuracy": 0.2616343557834625, "num_tokens": 142100474.0, "step": 62040 }, { "entropy": 5.212046670913696, "epoch": 6.133353103993674, "grad_norm": 1.234375, "learning_rate": 0.00019909948725881543, "loss": 4.6207, "mean_token_accuracy": 0.25960010290145874, "num_tokens": 142113092.0, "step": 62045 }, { "entropy": 5.2089399814605715, "epoch": 6.133847370502175, "grad_norm": 1.1640625, "learning_rate": 0.00019906626675184275, "loss": 4.5852, "mean_token_accuracy": 0.2671074390411377, "num_tokens": 142124040.0, "step": 62050 }, { "entropy": 5.22674150466919, "epoch": 6.134341637010676, "grad_norm": 1.140625, "learning_rate": 0.00019903304811285166, "loss": 4.5416, "mean_token_accuracy": 0.2654396742582321, "num_tokens": 142136046.0, "step": 62055 }, { "entropy": 5.2730780124664305, "epoch": 6.1348359035191775, "grad_norm": 1.125, "learning_rate": 0.00019899983134265931, "loss": 4.5689, "mean_token_accuracy": 0.263011160492897, "num_tokens": 142146218.0, "step": 62060 }, { "entropy": 5.2413088321685795, "epoch": 6.135330170027679, "grad_norm": 1.21875, "learning_rate": 0.00019896661644208297, "loss": 4.5901, "mean_token_accuracy": 0.2622485548257828, "num_tokens": 142157267.0, "step": 62065 }, { "entropy": 5.26575198173523, "epoch": 6.13582443653618, "grad_norm": 1.203125, "learning_rate": 0.00019893340341193966, "loss": 4.639, "mean_token_accuracy": 0.2563705861568451, "num_tokens": 142169014.0, "step": 62070 }, { "entropy": 5.183057260513306, "epoch": 6.136318703044681, "grad_norm": 1.203125, "learning_rate": 0.00019890019225304645, "loss": 4.5177, "mean_token_accuracy": 0.26664199829101565, "num_tokens": 142180006.0, "step": 62075 }, { "entropy": 5.307321548461914, "epoch": 6.1368129695531834, "grad_norm": 1.21875, "learning_rate": 0.00019886698296622024, "loss": 4.6422, "mean_token_accuracy": 0.2569284290075302, "num_tokens": 142192387.0, "step": 62080 }, { "entropy": 5.332390975952149, "epoch": 6.137307236061685, "grad_norm": 1.25, "learning_rate": 0.00019883377555227817, "loss": 4.6657, "mean_token_accuracy": 0.25292988270521166, "num_tokens": 142204281.0, "step": 62085 }, { "entropy": 5.217992925643921, "epoch": 6.137801502570186, "grad_norm": 1.1171875, "learning_rate": 0.00019880057001203687, "loss": 4.5448, "mean_token_accuracy": 0.26920678913593293, "num_tokens": 142214713.0, "step": 62090 }, { "entropy": 5.20490608215332, "epoch": 6.138295769078687, "grad_norm": 1.140625, "learning_rate": 0.00019876736634631353, "loss": 4.5732, "mean_token_accuracy": 0.2683631286025047, "num_tokens": 142226909.0, "step": 62095 }, { "entropy": 5.297947406768799, "epoch": 6.1387900355871885, "grad_norm": 1.171875, "learning_rate": 0.00019873416455592474, "loss": 4.6744, "mean_token_accuracy": 0.25001769214868547, "num_tokens": 142237784.0, "step": 62100 }, { "entropy": 5.2389708995819095, "epoch": 6.13928430209569, "grad_norm": 1.21875, "learning_rate": 0.00019870096464168736, "loss": 4.5992, "mean_token_accuracy": 0.2583743274211884, "num_tokens": 142248429.0, "step": 62105 }, { "entropy": 5.249667024612426, "epoch": 6.139778568604191, "grad_norm": 1.3046875, "learning_rate": 0.0001986677666044181, "loss": 4.5991, "mean_token_accuracy": 0.26109896451234815, "num_tokens": 142259215.0, "step": 62110 }, { "entropy": 5.2289731979370115, "epoch": 6.140272835112693, "grad_norm": 1.1875, "learning_rate": 0.0001986345704449336, "loss": 4.5935, "mean_token_accuracy": 0.25744260251522066, "num_tokens": 142271415.0, "step": 62115 }, { "entropy": 5.333112716674805, "epoch": 6.140767101621194, "grad_norm": 1.2265625, "learning_rate": 0.00019860137616405045, "loss": 4.7372, "mean_token_accuracy": 0.25205940306186675, "num_tokens": 142283661.0, "step": 62120 }, { "entropy": 5.300688123703003, "epoch": 6.141261368129696, "grad_norm": 1.2109375, "learning_rate": 0.00019856818376258535, "loss": 4.6638, "mean_token_accuracy": 0.2541790515184402, "num_tokens": 142294345.0, "step": 62125 }, { "entropy": 5.17198920249939, "epoch": 6.141755634638197, "grad_norm": 1.1015625, "learning_rate": 0.00019853499324135477, "loss": 4.4971, "mean_token_accuracy": 0.26657742708921434, "num_tokens": 142305419.0, "step": 62130 }, { "entropy": 5.236756467819214, "epoch": 6.142249901146698, "grad_norm": 1.25, "learning_rate": 0.00019850180460117528, "loss": 4.6396, "mean_token_accuracy": 0.25991968214511874, "num_tokens": 142316635.0, "step": 62135 }, { "entropy": 5.265696859359741, "epoch": 6.1427441676551995, "grad_norm": 1.25, "learning_rate": 0.00019846861784286325, "loss": 4.6289, "mean_token_accuracy": 0.2583585798740387, "num_tokens": 142327997.0, "step": 62140 }, { "entropy": 5.369652986526489, "epoch": 6.143238434163701, "grad_norm": 1.15625, "learning_rate": 0.0001984354329672351, "loss": 4.7469, "mean_token_accuracy": 0.24250577986240388, "num_tokens": 142339269.0, "step": 62145 }, { "entropy": 5.202759075164795, "epoch": 6.143732700672203, "grad_norm": 1.1328125, "learning_rate": 0.00019840224997510708, "loss": 4.5861, "mean_token_accuracy": 0.26052088290452957, "num_tokens": 142350250.0, "step": 62150 }, { "entropy": 5.275285816192627, "epoch": 6.144226967180704, "grad_norm": 1.1328125, "learning_rate": 0.0001983690688672956, "loss": 4.6107, "mean_token_accuracy": 0.2601479724049568, "num_tokens": 142362650.0, "step": 62155 }, { "entropy": 5.219433689117432, "epoch": 6.144721233689205, "grad_norm": 1.2890625, "learning_rate": 0.000198335889644617, "loss": 4.5638, "mean_token_accuracy": 0.25727339684963224, "num_tokens": 142373592.0, "step": 62160 }, { "entropy": 5.290268182754517, "epoch": 6.145215500197707, "grad_norm": 1.03125, "learning_rate": 0.00019830271230788742, "loss": 4.6456, "mean_token_accuracy": 0.2559933289885521, "num_tokens": 142385053.0, "step": 62165 }, { "entropy": 5.327870273590088, "epoch": 6.145709766706208, "grad_norm": 1.2109375, "learning_rate": 0.000198269536857923, "loss": 4.7112, "mean_token_accuracy": 0.24933886379003525, "num_tokens": 142395784.0, "step": 62170 }, { "entropy": 5.248842048645019, "epoch": 6.146204033214709, "grad_norm": 1.109375, "learning_rate": 0.0001982363632955398, "loss": 4.5881, "mean_token_accuracy": 0.261028029024601, "num_tokens": 142406469.0, "step": 62175 }, { "entropy": 5.304548931121826, "epoch": 6.1466982997232105, "grad_norm": 1.1328125, "learning_rate": 0.00019820319162155398, "loss": 4.72, "mean_token_accuracy": 0.2511947602033615, "num_tokens": 142417608.0, "step": 62180 }, { "entropy": 5.270073366165161, "epoch": 6.147192566231712, "grad_norm": 1.203125, "learning_rate": 0.00019817002183678163, "loss": 4.6252, "mean_token_accuracy": 0.24977146536111833, "num_tokens": 142429390.0, "step": 62185 }, { "entropy": 5.293236589431762, "epoch": 6.147686832740214, "grad_norm": 1.234375, "learning_rate": 0.00019813685394203868, "loss": 4.6632, "mean_token_accuracy": 0.24856559336185455, "num_tokens": 142439933.0, "step": 62190 }, { "entropy": 5.330670404434204, "epoch": 6.148181099248715, "grad_norm": 1.21875, "learning_rate": 0.00019810368793814103, "loss": 4.6772, "mean_token_accuracy": 0.25001064985990523, "num_tokens": 142451872.0, "step": 62195 }, { "entropy": 5.252132558822632, "epoch": 6.148675365757216, "grad_norm": 1.2734375, "learning_rate": 0.0001980705238259045, "loss": 4.5306, "mean_token_accuracy": 0.2733609199523926, "num_tokens": 142463444.0, "step": 62200 }, { "entropy": 5.2467645645141605, "epoch": 6.149169632265718, "grad_norm": 1.1796875, "learning_rate": 0.00019803736160614515, "loss": 4.5638, "mean_token_accuracy": 0.2615795359015465, "num_tokens": 142474829.0, "step": 62205 }, { "entropy": 5.1859824657440186, "epoch": 6.149663898774219, "grad_norm": 1.2109375, "learning_rate": 0.00019800420127967844, "loss": 4.5488, "mean_token_accuracy": 0.266503769159317, "num_tokens": 142485291.0, "step": 62210 }, { "entropy": 5.28451452255249, "epoch": 6.15015816528272, "grad_norm": 1.1328125, "learning_rate": 0.00019797104284732055, "loss": 4.7197, "mean_token_accuracy": 0.24647772908210755, "num_tokens": 142498225.0, "step": 62215 }, { "entropy": 5.272522687911987, "epoch": 6.1506524317912215, "grad_norm": 1.140625, "learning_rate": 0.00019793788630988684, "loss": 4.5765, "mean_token_accuracy": 0.2586888924241066, "num_tokens": 142508804.0, "step": 62220 }, { "entropy": 5.282637214660644, "epoch": 6.151146698299724, "grad_norm": 1.1640625, "learning_rate": 0.00019790473166819312, "loss": 4.6089, "mean_token_accuracy": 0.2512251019477844, "num_tokens": 142520120.0, "step": 62225 }, { "entropy": 5.269571208953858, "epoch": 6.151640964808225, "grad_norm": 1.125, "learning_rate": 0.00019787157892305497, "loss": 4.6228, "mean_token_accuracy": 0.26356215626001356, "num_tokens": 142532219.0, "step": 62230 }, { "entropy": 5.347315931320191, "epoch": 6.152135231316726, "grad_norm": 1.2421875, "learning_rate": 0.00019783842807528785, "loss": 4.6864, "mean_token_accuracy": 0.25469007790088655, "num_tokens": 142543056.0, "step": 62235 }, { "entropy": 5.312595510482788, "epoch": 6.152629497825227, "grad_norm": 1.1953125, "learning_rate": 0.00019780527912570745, "loss": 4.6853, "mean_token_accuracy": 0.24218882322311402, "num_tokens": 142553889.0, "step": 62240 }, { "entropy": 5.16651177406311, "epoch": 6.153123764333729, "grad_norm": 1.1015625, "learning_rate": 0.00019777213207512918, "loss": 4.4944, "mean_token_accuracy": 0.26815216690301896, "num_tokens": 142565035.0, "step": 62245 }, { "entropy": 5.313024663925171, "epoch": 6.15361803084223, "grad_norm": 1.1875, "learning_rate": 0.00019773898692436836, "loss": 4.6759, "mean_token_accuracy": 0.24752986431121826, "num_tokens": 142577362.0, "step": 62250 }, { "entropy": 5.176617670059204, "epoch": 6.154112297350731, "grad_norm": 1.25, "learning_rate": 0.00019770584367424055, "loss": 4.536, "mean_token_accuracy": 0.26591227799654005, "num_tokens": 142588712.0, "step": 62255 }, { "entropy": 5.280558013916016, "epoch": 6.154606563859233, "grad_norm": 1.21875, "learning_rate": 0.00019767270232556094, "loss": 4.641, "mean_token_accuracy": 0.25084014534950255, "num_tokens": 142598823.0, "step": 62260 }, { "entropy": 5.307782888412476, "epoch": 6.155100830367735, "grad_norm": 1.2265625, "learning_rate": 0.00019763956287914474, "loss": 4.6694, "mean_token_accuracy": 0.25122298300266266, "num_tokens": 142610062.0, "step": 62265 }, { "entropy": 5.2318274974823, "epoch": 6.155595096876236, "grad_norm": 1.140625, "learning_rate": 0.00019760642533580747, "loss": 4.6115, "mean_token_accuracy": 0.261419714987278, "num_tokens": 142622546.0, "step": 62270 }, { "entropy": 5.31632285118103, "epoch": 6.156089363384737, "grad_norm": 1.15625, "learning_rate": 0.000197573289696364, "loss": 4.6763, "mean_token_accuracy": 0.2487537756562233, "num_tokens": 142634379.0, "step": 62275 }, { "entropy": 5.254207563400269, "epoch": 6.156583629893238, "grad_norm": 1.1015625, "learning_rate": 0.00019754015596162972, "loss": 4.6113, "mean_token_accuracy": 0.262397488951683, "num_tokens": 142646629.0, "step": 62280 }, { "entropy": 5.1642533302307125, "epoch": 6.15707789640174, "grad_norm": 1.15625, "learning_rate": 0.00019750702413241962, "loss": 4.4673, "mean_token_accuracy": 0.2744177535176277, "num_tokens": 142658841.0, "step": 62285 }, { "entropy": 5.146920680999756, "epoch": 6.157572162910241, "grad_norm": 1.1640625, "learning_rate": 0.00019747389420954865, "loss": 4.4262, "mean_token_accuracy": 0.27607678771018984, "num_tokens": 142669391.0, "step": 62290 }, { "entropy": 5.190667533874512, "epoch": 6.158066429418742, "grad_norm": 1.1328125, "learning_rate": 0.00019744076619383194, "loss": 4.5813, "mean_token_accuracy": 0.2633081629872322, "num_tokens": 142680383.0, "step": 62295 }, { "entropy": 5.398504018783569, "epoch": 6.158560695927244, "grad_norm": 1.1640625, "learning_rate": 0.00019740764008608443, "loss": 4.8, "mean_token_accuracy": 0.24279662519693374, "num_tokens": 142693279.0, "step": 62300 }, { "entropy": 5.2594749450683596, "epoch": 6.159054962435746, "grad_norm": 1.1015625, "learning_rate": 0.00019737451588712102, "loss": 4.6166, "mean_token_accuracy": 0.25935098230838777, "num_tokens": 142705261.0, "step": 62305 }, { "entropy": 5.328604650497437, "epoch": 6.159549228944247, "grad_norm": 1.171875, "learning_rate": 0.0001973413935977566, "loss": 4.707, "mean_token_accuracy": 0.24616982638835908, "num_tokens": 142716869.0, "step": 62310 }, { "entropy": 5.298706865310669, "epoch": 6.160043495452748, "grad_norm": 1.0546875, "learning_rate": 0.0001973082732188059, "loss": 4.6272, "mean_token_accuracy": 0.2559260606765747, "num_tokens": 142729499.0, "step": 62315 }, { "entropy": 5.264263248443603, "epoch": 6.160537761961249, "grad_norm": 1.140625, "learning_rate": 0.00019727515475108376, "loss": 4.6551, "mean_token_accuracy": 0.25704589784145354, "num_tokens": 142741331.0, "step": 62320 }, { "entropy": 5.288756561279297, "epoch": 6.161032028469751, "grad_norm": 1.21875, "learning_rate": 0.00019724203819540477, "loss": 4.6332, "mean_token_accuracy": 0.25420770794153214, "num_tokens": 142753117.0, "step": 62325 }, { "entropy": 5.251803731918335, "epoch": 6.161526294978252, "grad_norm": 1.171875, "learning_rate": 0.00019720892355258384, "loss": 4.5626, "mean_token_accuracy": 0.26322694271802904, "num_tokens": 142763830.0, "step": 62330 }, { "entropy": 5.301644992828369, "epoch": 6.162020561486754, "grad_norm": 1.1796875, "learning_rate": 0.0001971758108234354, "loss": 4.6041, "mean_token_accuracy": 0.2640880882740021, "num_tokens": 142775187.0, "step": 62335 }, { "entropy": 5.268835353851318, "epoch": 6.162514827995255, "grad_norm": 1.2109375, "learning_rate": 0.0001971427000087741, "loss": 4.6492, "mean_token_accuracy": 0.257722045481205, "num_tokens": 142785397.0, "step": 62340 }, { "entropy": 5.319804668426514, "epoch": 6.163009094503757, "grad_norm": 1.1328125, "learning_rate": 0.00019710959110941445, "loss": 4.7029, "mean_token_accuracy": 0.2525068923830986, "num_tokens": 142797555.0, "step": 62345 }, { "entropy": 5.276500034332275, "epoch": 6.163503361012258, "grad_norm": 1.234375, "learning_rate": 0.00019707648412617095, "loss": 4.7011, "mean_token_accuracy": 0.25004604160785676, "num_tokens": 142808665.0, "step": 62350 }, { "entropy": 5.332917642593384, "epoch": 6.163997627520759, "grad_norm": 1.2109375, "learning_rate": 0.00019704337905985793, "loss": 4.6681, "mean_token_accuracy": 0.2557767882943153, "num_tokens": 142819934.0, "step": 62355 }, { "entropy": 5.334272146224976, "epoch": 6.16449189402926, "grad_norm": 1.0859375, "learning_rate": 0.00019701027591129, "loss": 4.6795, "mean_token_accuracy": 0.25786224454641343, "num_tokens": 142832337.0, "step": 62360 }, { "entropy": 5.20040192604065, "epoch": 6.164986160537762, "grad_norm": 1.1171875, "learning_rate": 0.00019697717468128136, "loss": 4.4862, "mean_token_accuracy": 0.2684536576271057, "num_tokens": 142842581.0, "step": 62365 }, { "entropy": 5.239536285400391, "epoch": 6.165480427046264, "grad_norm": 1.328125, "learning_rate": 0.00019694407537064628, "loss": 4.6054, "mean_token_accuracy": 0.2554198920726776, "num_tokens": 142854158.0, "step": 62370 }, { "entropy": 5.231711292266846, "epoch": 6.165974693554765, "grad_norm": 1.2109375, "learning_rate": 0.0001969109779801992, "loss": 4.6217, "mean_token_accuracy": 0.2563156858086586, "num_tokens": 142864686.0, "step": 62375 }, { "entropy": 5.242080402374268, "epoch": 6.166468960063266, "grad_norm": 1.1328125, "learning_rate": 0.00019687788251075401, "loss": 4.5834, "mean_token_accuracy": 0.2585072726011276, "num_tokens": 142875708.0, "step": 62380 }, { "entropy": 5.241127395629883, "epoch": 6.1669632265717675, "grad_norm": 1.1953125, "learning_rate": 0.00019684478896312508, "loss": 4.5622, "mean_token_accuracy": 0.26625912487506864, "num_tokens": 142887544.0, "step": 62385 }, { "entropy": 5.348513221740722, "epoch": 6.167457493080269, "grad_norm": 1.0859375, "learning_rate": 0.00019681169733812642, "loss": 4.6468, "mean_token_accuracy": 0.2578503280878067, "num_tokens": 142900257.0, "step": 62390 }, { "entropy": 5.187266683578491, "epoch": 6.16795175958877, "grad_norm": 1.1796875, "learning_rate": 0.00019677860763657224, "loss": 4.4969, "mean_token_accuracy": 0.2682385638356209, "num_tokens": 142911221.0, "step": 62395 }, { "entropy": 5.253803157806397, "epoch": 6.168446026097271, "grad_norm": 1.265625, "learning_rate": 0.0001967455198592764, "loss": 4.6758, "mean_token_accuracy": 0.25487781018018724, "num_tokens": 142922549.0, "step": 62400 }, { "entropy": 5.263520336151123, "epoch": 6.1689402926057735, "grad_norm": 1.234375, "learning_rate": 0.00019671243400705296, "loss": 4.6711, "mean_token_accuracy": 0.2589269891381264, "num_tokens": 142933462.0, "step": 62405 }, { "entropy": 5.235149574279785, "epoch": 6.169434559114275, "grad_norm": 1.2578125, "learning_rate": 0.0001966793500807157, "loss": 4.6305, "mean_token_accuracy": 0.2570097357034683, "num_tokens": 142944129.0, "step": 62410 }, { "entropy": 5.2544286251068115, "epoch": 6.169928825622776, "grad_norm": 1.28125, "learning_rate": 0.00019664626808107855, "loss": 4.5915, "mean_token_accuracy": 0.25680557638406754, "num_tokens": 142956339.0, "step": 62415 }, { "entropy": 5.254062175750732, "epoch": 6.170423092131277, "grad_norm": 1.1953125, "learning_rate": 0.00019661318800895543, "loss": 4.5975, "mean_token_accuracy": 0.2593873873353004, "num_tokens": 142967407.0, "step": 62420 }, { "entropy": 5.2829687118530275, "epoch": 6.1709173586397785, "grad_norm": 1.0625, "learning_rate": 0.00019658010986516007, "loss": 4.6157, "mean_token_accuracy": 0.24948447942733765, "num_tokens": 142978656.0, "step": 62425 }, { "entropy": 5.256663751602173, "epoch": 6.17141162514828, "grad_norm": 1.1640625, "learning_rate": 0.0001965470336505062, "loss": 4.6481, "mean_token_accuracy": 0.25981451869010924, "num_tokens": 142990080.0, "step": 62430 }, { "entropy": 5.24415545463562, "epoch": 6.171905891656781, "grad_norm": 1.1796875, "learning_rate": 0.00019651395936580736, "loss": 4.5473, "mean_token_accuracy": 0.26500066071748735, "num_tokens": 143000440.0, "step": 62435 }, { "entropy": 5.271857500076294, "epoch": 6.172400158165282, "grad_norm": 1.1953125, "learning_rate": 0.00019648088701187727, "loss": 4.7061, "mean_token_accuracy": 0.2503623694181442, "num_tokens": 143011250.0, "step": 62440 }, { "entropy": 5.233630561828614, "epoch": 6.1728944246737845, "grad_norm": 1.203125, "learning_rate": 0.0001964478165895297, "loss": 4.6316, "mean_token_accuracy": 0.2534191504120827, "num_tokens": 143024352.0, "step": 62445 }, { "entropy": 5.307576417922974, "epoch": 6.173388691182286, "grad_norm": 1.1875, "learning_rate": 0.00019641474809957792, "loss": 4.6662, "mean_token_accuracy": 0.2559554144740105, "num_tokens": 143035251.0, "step": 62450 }, { "entropy": 5.291308212280273, "epoch": 6.173882957690787, "grad_norm": 1.1796875, "learning_rate": 0.00019638168154283565, "loss": 4.5848, "mean_token_accuracy": 0.26339873522520063, "num_tokens": 143045453.0, "step": 62455 }, { "entropy": 5.258207988739014, "epoch": 6.174377224199288, "grad_norm": 1.109375, "learning_rate": 0.00019634861692011606, "loss": 4.6326, "mean_token_accuracy": 0.25480522960424423, "num_tokens": 143058649.0, "step": 62460 }, { "entropy": 5.195185041427612, "epoch": 6.1748714907077895, "grad_norm": 1.28125, "learning_rate": 0.0001963155542322328, "loss": 4.5576, "mean_token_accuracy": 0.2690711885690689, "num_tokens": 143070004.0, "step": 62465 }, { "entropy": 5.2909040451049805, "epoch": 6.175365757216291, "grad_norm": 1.1171875, "learning_rate": 0.00019628249347999899, "loss": 4.6393, "mean_token_accuracy": 0.2550819829106331, "num_tokens": 143080645.0, "step": 62470 }, { "entropy": 5.291552019119263, "epoch": 6.175860023724792, "grad_norm": 1.15625, "learning_rate": 0.00019624943466422812, "loss": 4.6295, "mean_token_accuracy": 0.25161509215831757, "num_tokens": 143091980.0, "step": 62475 }, { "entropy": 5.233860969543457, "epoch": 6.176354290233294, "grad_norm": 1.1875, "learning_rate": 0.00019621637778573348, "loss": 4.6316, "mean_token_accuracy": 0.26008697748184206, "num_tokens": 143103266.0, "step": 62480 }, { "entropy": 5.280779123306274, "epoch": 6.1768485567417954, "grad_norm": 1.1484375, "learning_rate": 0.00019618332284532803, "loss": 4.6285, "mean_token_accuracy": 0.2572224155068398, "num_tokens": 143115956.0, "step": 62485 }, { "entropy": 5.273533630371094, "epoch": 6.177342823250297, "grad_norm": 1.1953125, "learning_rate": 0.00019615026984382512, "loss": 4.6058, "mean_token_accuracy": 0.25807836800813677, "num_tokens": 143127926.0, "step": 62490 }, { "entropy": 5.2486025333404545, "epoch": 6.177837089758798, "grad_norm": 1.2890625, "learning_rate": 0.0001961172187820378, "loss": 4.6253, "mean_token_accuracy": 0.25363020598888397, "num_tokens": 143138024.0, "step": 62495 }, { "entropy": 5.258368301391601, "epoch": 6.178331356267299, "grad_norm": 1.2578125, "learning_rate": 0.00019608416966077907, "loss": 4.5812, "mean_token_accuracy": 0.2546654582023621, "num_tokens": 143149173.0, "step": 62500 }, { "entropy": 5.285116195678711, "epoch": 6.1788256227758005, "grad_norm": 1.2265625, "learning_rate": 0.0001960511224808621, "loss": 4.6564, "mean_token_accuracy": 0.25276814550161364, "num_tokens": 143161103.0, "step": 62505 }, { "entropy": 5.333426856994629, "epoch": 6.179319889284302, "grad_norm": 1.234375, "learning_rate": 0.00019601807724309973, "loss": 4.6884, "mean_token_accuracy": 0.2594588860869408, "num_tokens": 143172788.0, "step": 62510 }, { "entropy": 5.275783729553223, "epoch": 6.179814155792804, "grad_norm": 1.1875, "learning_rate": 0.00019598503394830492, "loss": 4.6311, "mean_token_accuracy": 0.2580186933279037, "num_tokens": 143183332.0, "step": 62515 }, { "entropy": 5.258305501937866, "epoch": 6.180308422301305, "grad_norm": 1.2578125, "learning_rate": 0.00019595199259729058, "loss": 4.6373, "mean_token_accuracy": 0.2527870684862137, "num_tokens": 143194788.0, "step": 62520 }, { "entropy": 5.269037485122681, "epoch": 6.180802688809806, "grad_norm": 1.171875, "learning_rate": 0.0001959189531908694, "loss": 4.6987, "mean_token_accuracy": 0.25275774747133256, "num_tokens": 143208557.0, "step": 62525 }, { "entropy": 5.268329191207886, "epoch": 6.181296955318308, "grad_norm": 1.1484375, "learning_rate": 0.00019588591572985425, "loss": 4.571, "mean_token_accuracy": 0.2628967598080635, "num_tokens": 143219503.0, "step": 62530 }, { "entropy": 5.272716903686524, "epoch": 6.181791221826809, "grad_norm": 1.15625, "learning_rate": 0.00019585288021505787, "loss": 4.6239, "mean_token_accuracy": 0.25815356373786924, "num_tokens": 143230471.0, "step": 62535 }, { "entropy": 5.356713438034058, "epoch": 6.18228548833531, "grad_norm": 1.1640625, "learning_rate": 0.00019581984664729295, "loss": 4.7702, "mean_token_accuracy": 0.24166370034217835, "num_tokens": 143242106.0, "step": 62540 }, { "entropy": 5.244622421264649, "epoch": 6.1827797548438115, "grad_norm": 1.234375, "learning_rate": 0.00019578681502737205, "loss": 4.5854, "mean_token_accuracy": 0.26301529854536054, "num_tokens": 143251790.0, "step": 62545 }, { "entropy": 5.270095157623291, "epoch": 6.183274021352313, "grad_norm": 1.1484375, "learning_rate": 0.00019575378535610776, "loss": 4.6466, "mean_token_accuracy": 0.25460397750139235, "num_tokens": 143265647.0, "step": 62550 }, { "entropy": 5.27736120223999, "epoch": 6.183768287860815, "grad_norm": 1.21875, "learning_rate": 0.00019572075763431263, "loss": 4.5767, "mean_token_accuracy": 0.2627203270792961, "num_tokens": 143276030.0, "step": 62555 }, { "entropy": 5.225457000732422, "epoch": 6.184262554369316, "grad_norm": 1.1484375, "learning_rate": 0.0001956877318627992, "loss": 4.6317, "mean_token_accuracy": 0.2551548182964325, "num_tokens": 143288975.0, "step": 62560 }, { "entropy": 5.26470046043396, "epoch": 6.184756820877817, "grad_norm": 1.2265625, "learning_rate": 0.0001956547080423799, "loss": 4.6568, "mean_token_accuracy": 0.25020798444747927, "num_tokens": 143299876.0, "step": 62565 }, { "entropy": 5.3480079650878904, "epoch": 6.185251087386319, "grad_norm": 1.1796875, "learning_rate": 0.00019562168617386712, "loss": 4.7024, "mean_token_accuracy": 0.2566706195473671, "num_tokens": 143311135.0, "step": 62570 }, { "entropy": 5.278867864608765, "epoch": 6.18574535389482, "grad_norm": 1.1640625, "learning_rate": 0.00019558866625807308, "loss": 4.5953, "mean_token_accuracy": 0.2529448613524437, "num_tokens": 143323323.0, "step": 62575 }, { "entropy": 5.269559144973755, "epoch": 6.186239620403321, "grad_norm": 1.2265625, "learning_rate": 0.0001955556482958103, "loss": 4.6205, "mean_token_accuracy": 0.2596055671572685, "num_tokens": 143334703.0, "step": 62580 }, { "entropy": 5.260618352890015, "epoch": 6.1867338869118225, "grad_norm": 1.2265625, "learning_rate": 0.0001955226322878907, "loss": 4.6328, "mean_token_accuracy": 0.2563877210021019, "num_tokens": 143346374.0, "step": 62585 }, { "entropy": 5.226471614837647, "epoch": 6.187228153420325, "grad_norm": 1.2734375, "learning_rate": 0.0001954896182351268, "loss": 4.6304, "mean_token_accuracy": 0.25357068330049515, "num_tokens": 143357425.0, "step": 62590 }, { "entropy": 5.2834557056427, "epoch": 6.187722419928826, "grad_norm": 1.1171875, "learning_rate": 0.00019545660613833066, "loss": 4.6592, "mean_token_accuracy": 0.24871840327978134, "num_tokens": 143369143.0, "step": 62595 }, { "entropy": 5.25940170288086, "epoch": 6.188216686437327, "grad_norm": 1.2109375, "learning_rate": 0.00019542359599831428, "loss": 4.6193, "mean_token_accuracy": 0.256492380797863, "num_tokens": 143379593.0, "step": 62600 }, { "entropy": 5.282521295547485, "epoch": 6.188710952945828, "grad_norm": 1.078125, "learning_rate": 0.0001953905878158898, "loss": 4.6061, "mean_token_accuracy": 0.2601951971650124, "num_tokens": 143390885.0, "step": 62605 }, { "entropy": 5.321652269363403, "epoch": 6.18920521945433, "grad_norm": 1.3125, "learning_rate": 0.00019535758159186923, "loss": 4.7011, "mean_token_accuracy": 0.24698877781629563, "num_tokens": 143401994.0, "step": 62610 }, { "entropy": 5.297380495071411, "epoch": 6.189699485962831, "grad_norm": 1.2421875, "learning_rate": 0.00019532457732706444, "loss": 4.6303, "mean_token_accuracy": 0.2564345791935921, "num_tokens": 143413277.0, "step": 62615 }, { "entropy": 5.3068153858184814, "epoch": 6.190193752471332, "grad_norm": 1.2578125, "learning_rate": 0.00019529157502228751, "loss": 4.6815, "mean_token_accuracy": 0.24880153983831405, "num_tokens": 143423693.0, "step": 62620 }, { "entropy": 5.249828767776489, "epoch": 6.190688018979834, "grad_norm": 1.0546875, "learning_rate": 0.00019525857467835012, "loss": 4.6084, "mean_token_accuracy": 0.2570430651307106, "num_tokens": 143436416.0, "step": 62625 }, { "entropy": 5.245209693908691, "epoch": 6.191182285488336, "grad_norm": 1.1640625, "learning_rate": 0.0001952255762960642, "loss": 4.6523, "mean_token_accuracy": 0.2625500813126564, "num_tokens": 143447473.0, "step": 62630 }, { "entropy": 5.255846548080444, "epoch": 6.191676551996837, "grad_norm": 1.1875, "learning_rate": 0.00019519257987624152, "loss": 4.5861, "mean_token_accuracy": 0.2682203248143196, "num_tokens": 143458599.0, "step": 62635 }, { "entropy": 5.169486331939697, "epoch": 6.192170818505338, "grad_norm": 1.15625, "learning_rate": 0.00019515958541969368, "loss": 4.4742, "mean_token_accuracy": 0.27678726613521576, "num_tokens": 143468887.0, "step": 62640 }, { "entropy": 5.261334228515625, "epoch": 6.192665085013839, "grad_norm": 1.0859375, "learning_rate": 0.00019512659292723246, "loss": 4.6062, "mean_token_accuracy": 0.2572838693857193, "num_tokens": 143481058.0, "step": 62645 }, { "entropy": 5.1384162425994875, "epoch": 6.193159351522341, "grad_norm": 1.2421875, "learning_rate": 0.00019509360239966945, "loss": 4.5189, "mean_token_accuracy": 0.26689381897449493, "num_tokens": 143492093.0, "step": 62650 }, { "entropy": 5.203898239135742, "epoch": 6.193653618030842, "grad_norm": 1.203125, "learning_rate": 0.00019506061383781615, "loss": 4.5896, "mean_token_accuracy": 0.2581512644886971, "num_tokens": 143503047.0, "step": 62655 }, { "entropy": 5.218946123123169, "epoch": 6.194147884539344, "grad_norm": 1.2109375, "learning_rate": 0.00019502762724248429, "loss": 4.565, "mean_token_accuracy": 0.26179716885089876, "num_tokens": 143515319.0, "step": 62660 }, { "entropy": 5.330315685272216, "epoch": 6.194642151047845, "grad_norm": 1.2421875, "learning_rate": 0.00019499464261448513, "loss": 4.6624, "mean_token_accuracy": 0.2580876678228378, "num_tokens": 143526019.0, "step": 62665 }, { "entropy": 5.265640735626221, "epoch": 6.195136417556347, "grad_norm": 1.1953125, "learning_rate": 0.00019496165995463012, "loss": 4.5989, "mean_token_accuracy": 0.2584158927202225, "num_tokens": 143537215.0, "step": 62670 }, { "entropy": 5.2272954940795895, "epoch": 6.195630684064848, "grad_norm": 1.234375, "learning_rate": 0.00019492867926373077, "loss": 4.6362, "mean_token_accuracy": 0.25319128334522245, "num_tokens": 143547201.0, "step": 62675 }, { "entropy": 5.241850852966309, "epoch": 6.196124950573349, "grad_norm": 1.171875, "learning_rate": 0.00019489570054259827, "loss": 4.6338, "mean_token_accuracy": 0.25335714519023894, "num_tokens": 143559904.0, "step": 62680 }, { "entropy": 5.241365528106689, "epoch": 6.19661921708185, "grad_norm": 1.1015625, "learning_rate": 0.000194862723792044, "loss": 4.5934, "mean_token_accuracy": 0.26068387031555174, "num_tokens": 143571032.0, "step": 62685 }, { "entropy": 5.385373878479004, "epoch": 6.197113483590352, "grad_norm": 1.265625, "learning_rate": 0.00019482974901287913, "loss": 4.7391, "mean_token_accuracy": 0.24698869735002518, "num_tokens": 143582723.0, "step": 62690 }, { "entropy": 5.236051368713379, "epoch": 6.197607750098853, "grad_norm": 1.234375, "learning_rate": 0.0001947967762059149, "loss": 4.6212, "mean_token_accuracy": 0.2612538442015648, "num_tokens": 143594546.0, "step": 62695 }, { "entropy": 5.294096326828003, "epoch": 6.198102016607355, "grad_norm": 1.125, "learning_rate": 0.00019476380537196248, "loss": 4.6515, "mean_token_accuracy": 0.2535597041249275, "num_tokens": 143606784.0, "step": 62700 }, { "entropy": 5.294437217712402, "epoch": 6.198596283115856, "grad_norm": 1.1953125, "learning_rate": 0.0001947308365118327, "loss": 4.6148, "mean_token_accuracy": 0.2558369755744934, "num_tokens": 143618396.0, "step": 62705 }, { "entropy": 5.287989902496338, "epoch": 6.199090549624358, "grad_norm": 1.2265625, "learning_rate": 0.000194697869626337, "loss": 4.5726, "mean_token_accuracy": 0.2615138962864876, "num_tokens": 143629243.0, "step": 62710 }, { "entropy": 5.122325229644775, "epoch": 6.199584816132859, "grad_norm": 1.1484375, "learning_rate": 0.00019466490471628606, "loss": 4.5377, "mean_token_accuracy": 0.26384623646736144, "num_tokens": 143641359.0, "step": 62715 }, { "entropy": 5.286412906646729, "epoch": 6.20007908264136, "grad_norm": 1.1328125, "learning_rate": 0.00019463194178249098, "loss": 4.6707, "mean_token_accuracy": 0.2591313898563385, "num_tokens": 143653654.0, "step": 62720 }, { "entropy": 5.286317348480225, "epoch": 6.200573349149861, "grad_norm": 1.171875, "learning_rate": 0.00019459898082576255, "loss": 4.6422, "mean_token_accuracy": 0.2511521652340889, "num_tokens": 143663494.0, "step": 62725 }, { "entropy": 5.259114694595337, "epoch": 6.201067615658363, "grad_norm": 1.15625, "learning_rate": 0.00019456602184691164, "loss": 4.5723, "mean_token_accuracy": 0.2639646053314209, "num_tokens": 143673719.0, "step": 62730 }, { "entropy": 5.279468154907226, "epoch": 6.201561882166865, "grad_norm": 1.2265625, "learning_rate": 0.00019453306484674916, "loss": 4.6567, "mean_token_accuracy": 0.2581153467297554, "num_tokens": 143685570.0, "step": 62735 }, { "entropy": 5.265879774093628, "epoch": 6.202056148675366, "grad_norm": 1.1484375, "learning_rate": 0.00019450010982608574, "loss": 4.5351, "mean_token_accuracy": 0.26242081373929976, "num_tokens": 143696951.0, "step": 62740 }, { "entropy": 5.249331903457642, "epoch": 6.202550415183867, "grad_norm": 1.15625, "learning_rate": 0.00019446715678573214, "loss": 4.6413, "mean_token_accuracy": 0.2627863138914108, "num_tokens": 143708617.0, "step": 62745 }, { "entropy": 5.303283309936523, "epoch": 6.203044681692369, "grad_norm": 1.2734375, "learning_rate": 0.00019443420572649894, "loss": 4.6369, "mean_token_accuracy": 0.2543859541416168, "num_tokens": 143719293.0, "step": 62750 }, { "entropy": 5.279602575302124, "epoch": 6.20353894820087, "grad_norm": 1.15625, "learning_rate": 0.00019440125664919677, "loss": 4.6826, "mean_token_accuracy": 0.25787057876586916, "num_tokens": 143731088.0, "step": 62755 }, { "entropy": 5.284544515609741, "epoch": 6.204033214709371, "grad_norm": 1.1796875, "learning_rate": 0.00019436830955463615, "loss": 4.5996, "mean_token_accuracy": 0.27031996548175813, "num_tokens": 143742830.0, "step": 62760 }, { "entropy": 5.211758422851562, "epoch": 6.204527481217872, "grad_norm": 1.1953125, "learning_rate": 0.00019433536444362766, "loss": 4.4998, "mean_token_accuracy": 0.26444829255342484, "num_tokens": 143753791.0, "step": 62765 }, { "entropy": 5.198350620269776, "epoch": 6.205021747726374, "grad_norm": 1.09375, "learning_rate": 0.00019430242131698167, "loss": 4.5481, "mean_token_accuracy": 0.26509383469820025, "num_tokens": 143765103.0, "step": 62770 }, { "entropy": 5.300853824615478, "epoch": 6.205516014234876, "grad_norm": 1.1875, "learning_rate": 0.0001942694801755087, "loss": 4.6811, "mean_token_accuracy": 0.25180175602436067, "num_tokens": 143776975.0, "step": 62775 }, { "entropy": 5.284014177322388, "epoch": 6.206010280743377, "grad_norm": 1.140625, "learning_rate": 0.0001942365410200191, "loss": 4.6291, "mean_token_accuracy": 0.2595407247543335, "num_tokens": 143788670.0, "step": 62780 }, { "entropy": 5.203011846542358, "epoch": 6.206504547251878, "grad_norm": 1.2421875, "learning_rate": 0.00019420360385132308, "loss": 4.5664, "mean_token_accuracy": 0.2606837511062622, "num_tokens": 143799457.0, "step": 62785 }, { "entropy": 5.2545239448547365, "epoch": 6.2069988137603795, "grad_norm": 1.1875, "learning_rate": 0.0001941706686702308, "loss": 4.5813, "mean_token_accuracy": 0.26484241932630537, "num_tokens": 143810581.0, "step": 62790 }, { "entropy": 5.3080075740814205, "epoch": 6.207493080268881, "grad_norm": 1.125, "learning_rate": 0.0001941377354775527, "loss": 4.654, "mean_token_accuracy": 0.26108687967061994, "num_tokens": 143822968.0, "step": 62795 }, { "entropy": 5.346568632125854, "epoch": 6.207987346777382, "grad_norm": 1.1875, "learning_rate": 0.00019410480427409894, "loss": 4.7138, "mean_token_accuracy": 0.2528419002890587, "num_tokens": 143834964.0, "step": 62800 }, { "entropy": 5.217195796966553, "epoch": 6.208481613285883, "grad_norm": 1.125, "learning_rate": 0.00019407187506067947, "loss": 4.5981, "mean_token_accuracy": 0.26600175350904465, "num_tokens": 143847624.0, "step": 62805 }, { "entropy": 5.248994636535644, "epoch": 6.2089758797943855, "grad_norm": 1.28125, "learning_rate": 0.00019403894783810445, "loss": 4.5808, "mean_token_accuracy": 0.25714490115642546, "num_tokens": 143859377.0, "step": 62810 }, { "entropy": 5.202830076217651, "epoch": 6.209470146302887, "grad_norm": 1.25, "learning_rate": 0.00019400602260718385, "loss": 4.5684, "mean_token_accuracy": 0.27010516077280045, "num_tokens": 143869709.0, "step": 62815 }, { "entropy": 5.243685245513916, "epoch": 6.209964412811388, "grad_norm": 1.3046875, "learning_rate": 0.00019397309936872758, "loss": 4.5823, "mean_token_accuracy": 0.26329573392868044, "num_tokens": 143880322.0, "step": 62820 }, { "entropy": 5.21179723739624, "epoch": 6.210458679319889, "grad_norm": 1.1640625, "learning_rate": 0.00019394017812354576, "loss": 4.5593, "mean_token_accuracy": 0.26678045392036437, "num_tokens": 143891369.0, "step": 62825 }, { "entropy": 5.3283477306365965, "epoch": 6.2109529458283905, "grad_norm": 1.21875, "learning_rate": 0.00019390725887244808, "loss": 4.6809, "mean_token_accuracy": 0.2520200967788696, "num_tokens": 143903358.0, "step": 62830 }, { "entropy": 5.277570724487305, "epoch": 6.211447212336892, "grad_norm": 1.1484375, "learning_rate": 0.0001938743416162445, "loss": 4.5738, "mean_token_accuracy": 0.25583764761686323, "num_tokens": 143915257.0, "step": 62835 }, { "entropy": 5.284363174438477, "epoch": 6.211941478845393, "grad_norm": 1.203125, "learning_rate": 0.0001938414263557446, "loss": 4.6694, "mean_token_accuracy": 0.2517225697636604, "num_tokens": 143925327.0, "step": 62840 }, { "entropy": 5.165693235397339, "epoch": 6.212435745353895, "grad_norm": 1.234375, "learning_rate": 0.00019380851309175827, "loss": 4.511, "mean_token_accuracy": 0.2682532280683517, "num_tokens": 143936611.0, "step": 62845 }, { "entropy": 5.222180795669556, "epoch": 6.2129300118623965, "grad_norm": 1.140625, "learning_rate": 0.00019377560182509503, "loss": 4.5307, "mean_token_accuracy": 0.2672524869441986, "num_tokens": 143948961.0, "step": 62850 }, { "entropy": 5.209682989120483, "epoch": 6.213424278370898, "grad_norm": 1.2890625, "learning_rate": 0.00019374269255656462, "loss": 4.5719, "mean_token_accuracy": 0.26630068868398665, "num_tokens": 143960524.0, "step": 62855 }, { "entropy": 5.257960033416748, "epoch": 6.213918544879399, "grad_norm": 1.3203125, "learning_rate": 0.00019370978528697664, "loss": 4.6455, "mean_token_accuracy": 0.25477471947669983, "num_tokens": 143970529.0, "step": 62860 }, { "entropy": 5.278330516815186, "epoch": 6.2144128113879, "grad_norm": 1.203125, "learning_rate": 0.00019367688001714045, "loss": 4.6548, "mean_token_accuracy": 0.25973889231681824, "num_tokens": 143981960.0, "step": 62865 }, { "entropy": 5.2636548519134525, "epoch": 6.2149070778964015, "grad_norm": 1.1640625, "learning_rate": 0.0001936439767478657, "loss": 4.5998, "mean_token_accuracy": 0.2549736648797989, "num_tokens": 143992727.0, "step": 62870 }, { "entropy": 5.307521772384644, "epoch": 6.215401344404903, "grad_norm": 1.2109375, "learning_rate": 0.00019361107547996166, "loss": 4.6481, "mean_token_accuracy": 0.25198367685079576, "num_tokens": 144004254.0, "step": 62875 }, { "entropy": 5.29905481338501, "epoch": 6.215895610913405, "grad_norm": 1.2109375, "learning_rate": 0.0001935781762142379, "loss": 4.6439, "mean_token_accuracy": 0.25978243798017503, "num_tokens": 144014667.0, "step": 62880 }, { "entropy": 5.245318269729614, "epoch": 6.216389877421906, "grad_norm": 1.2265625, "learning_rate": 0.0001935452789515036, "loss": 4.5967, "mean_token_accuracy": 0.2561927616596222, "num_tokens": 144026449.0, "step": 62885 }, { "entropy": 5.2088006973266605, "epoch": 6.2168841439304074, "grad_norm": 1.3203125, "learning_rate": 0.00019351238369256807, "loss": 4.5592, "mean_token_accuracy": 0.26700170487165453, "num_tokens": 144037716.0, "step": 62890 }, { "entropy": 5.233507442474365, "epoch": 6.217378410438909, "grad_norm": 1.234375, "learning_rate": 0.00019347949043824054, "loss": 4.597, "mean_token_accuracy": 0.25908778309822084, "num_tokens": 144049203.0, "step": 62895 }, { "entropy": 5.319855642318726, "epoch": 6.21787267694741, "grad_norm": 1.046875, "learning_rate": 0.0001934465991893302, "loss": 4.6927, "mean_token_accuracy": 0.2520350441336632, "num_tokens": 144059906.0, "step": 62900 }, { "entropy": 5.326127338409424, "epoch": 6.218366943455911, "grad_norm": 1.1640625, "learning_rate": 0.0001934137099466461, "loss": 4.6663, "mean_token_accuracy": 0.25838159769773483, "num_tokens": 144072360.0, "step": 62905 }, { "entropy": 5.302771759033203, "epoch": 6.2188612099644125, "grad_norm": 1.2734375, "learning_rate": 0.0001933808227109975, "loss": 4.6241, "mean_token_accuracy": 0.2573126912117004, "num_tokens": 144082797.0, "step": 62910 }, { "entropy": 5.24921817779541, "epoch": 6.219355476472915, "grad_norm": 1.1171875, "learning_rate": 0.00019334793748319322, "loss": 4.6677, "mean_token_accuracy": 0.25452184677124023, "num_tokens": 144093983.0, "step": 62915 }, { "entropy": 5.297172164916992, "epoch": 6.219849742981416, "grad_norm": 1.1953125, "learning_rate": 0.00019331505426404245, "loss": 4.6402, "mean_token_accuracy": 0.25577185600996016, "num_tokens": 144105898.0, "step": 62920 }, { "entropy": 5.329453182220459, "epoch": 6.220344009489917, "grad_norm": 1.1953125, "learning_rate": 0.00019328217305435402, "loss": 4.6343, "mean_token_accuracy": 0.2562697932124138, "num_tokens": 144116258.0, "step": 62925 }, { "entropy": 5.325666189193726, "epoch": 6.220838275998418, "grad_norm": 1.1328125, "learning_rate": 0.00019324929385493671, "loss": 4.6852, "mean_token_accuracy": 0.24761914163827897, "num_tokens": 144128359.0, "step": 62930 }, { "entropy": 5.297986745834351, "epoch": 6.22133254250692, "grad_norm": 1.21875, "learning_rate": 0.00019321641666659946, "loss": 4.5834, "mean_token_accuracy": 0.2634988188743591, "num_tokens": 144139341.0, "step": 62935 }, { "entropy": 5.271041917800903, "epoch": 6.221826809015421, "grad_norm": 1.0546875, "learning_rate": 0.0001931835414901511, "loss": 4.6365, "mean_token_accuracy": 0.26029452979564666, "num_tokens": 144151649.0, "step": 62940 }, { "entropy": 5.306566572189331, "epoch": 6.222321075523922, "grad_norm": 1.2109375, "learning_rate": 0.00019315066832640033, "loss": 4.628, "mean_token_accuracy": 0.2586196795105934, "num_tokens": 144163196.0, "step": 62945 }, { "entropy": 5.3100532531738285, "epoch": 6.2228153420324235, "grad_norm": 1.1875, "learning_rate": 0.0001931177971761558, "loss": 4.6892, "mean_token_accuracy": 0.25648301243782046, "num_tokens": 144174684.0, "step": 62950 }, { "entropy": 5.252295780181885, "epoch": 6.223309608540926, "grad_norm": 1.1171875, "learning_rate": 0.00019308492804022615, "loss": 4.5999, "mean_token_accuracy": 0.2605011150240898, "num_tokens": 144185594.0, "step": 62955 }, { "entropy": 5.267908191680908, "epoch": 6.223803875049427, "grad_norm": 1.109375, "learning_rate": 0.00019305206091942002, "loss": 4.5749, "mean_token_accuracy": 0.2634379640221596, "num_tokens": 144196471.0, "step": 62960 }, { "entropy": 5.3177995681762695, "epoch": 6.224298141557928, "grad_norm": 1.171875, "learning_rate": 0.0001930191958145458, "loss": 4.6836, "mean_token_accuracy": 0.2639628335833549, "num_tokens": 144207866.0, "step": 62965 }, { "entropy": 5.244073104858399, "epoch": 6.224792408066429, "grad_norm": 1.15625, "learning_rate": 0.00019298633272641215, "loss": 4.57, "mean_token_accuracy": 0.26416184157133105, "num_tokens": 144218348.0, "step": 62970 }, { "entropy": 5.22965931892395, "epoch": 6.225286674574931, "grad_norm": 1.171875, "learning_rate": 0.0001929534716558275, "loss": 4.5907, "mean_token_accuracy": 0.26260224133729937, "num_tokens": 144229374.0, "step": 62975 }, { "entropy": 5.250682735443116, "epoch": 6.225780941083432, "grad_norm": 1.1171875, "learning_rate": 0.00019292061260360005, "loss": 4.575, "mean_token_accuracy": 0.25926308482885363, "num_tokens": 144239440.0, "step": 62980 }, { "entropy": 5.24084153175354, "epoch": 6.226275207591933, "grad_norm": 1.1328125, "learning_rate": 0.00019288775557053833, "loss": 4.6317, "mean_token_accuracy": 0.2576944097876549, "num_tokens": 144251133.0, "step": 62985 }, { "entropy": 5.337041282653809, "epoch": 6.226769474100435, "grad_norm": 1.25, "learning_rate": 0.00019285490055745059, "loss": 4.6997, "mean_token_accuracy": 0.2541074946522713, "num_tokens": 144262849.0, "step": 62990 }, { "entropy": 5.28419246673584, "epoch": 6.227263740608937, "grad_norm": 1.2734375, "learning_rate": 0.00019282204756514493, "loss": 4.586, "mean_token_accuracy": 0.2575799450278282, "num_tokens": 144273125.0, "step": 62995 }, { "entropy": 5.269256114959717, "epoch": 6.227758007117438, "grad_norm": 1.2109375, "learning_rate": 0.0001927891965944298, "loss": 4.5811, "mean_token_accuracy": 0.2588543936610222, "num_tokens": 144283946.0, "step": 63000 }, { "epoch": 6.227758007117438, "eval_entropy": 4.998052225488285, "eval_loss": 4.804255962371826, "eval_mean_token_accuracy": 0.25279095665555157, "eval_num_tokens": 144283946.0, "eval_runtime": 26.5952, "eval_samples_per_second": 1222.516, "eval_steps_per_second": 152.847, "step": 63000 }, { "entropy": 5.23221640586853, "epoch": 6.228252273625939, "grad_norm": 1.15625, "learning_rate": 0.00019275634764611305, "loss": 4.6264, "mean_token_accuracy": 0.25344138890504836, "num_tokens": 144294876.0, "step": 63005 }, { "entropy": 5.275026893615722, "epoch": 6.22874654013444, "grad_norm": 1.3359375, "learning_rate": 0.00019272350072100297, "loss": 4.5909, "mean_token_accuracy": 0.2609580412507057, "num_tokens": 144306002.0, "step": 63010 }, { "entropy": 5.2372137069702145, "epoch": 6.229240806642942, "grad_norm": 1.0859375, "learning_rate": 0.00019269065581990758, "loss": 4.6034, "mean_token_accuracy": 0.264798940718174, "num_tokens": 144317591.0, "step": 63015 }, { "entropy": 5.334174394607544, "epoch": 6.229735073151443, "grad_norm": 1.125, "learning_rate": 0.00019265781294363482, "loss": 4.7675, "mean_token_accuracy": 0.24032951891422272, "num_tokens": 144328496.0, "step": 63020 }, { "entropy": 5.286544370651245, "epoch": 6.230229339659944, "grad_norm": 1.2578125, "learning_rate": 0.00019262497209299252, "loss": 4.655, "mean_token_accuracy": 0.24819594174623488, "num_tokens": 144338872.0, "step": 63025 }, { "entropy": 5.266089057922363, "epoch": 6.230723606168446, "grad_norm": 1.3359375, "learning_rate": 0.00019259213326878877, "loss": 4.6048, "mean_token_accuracy": 0.25650009959936143, "num_tokens": 144349942.0, "step": 63030 }, { "entropy": 5.2820135116577145, "epoch": 6.231217872676948, "grad_norm": 1.234375, "learning_rate": 0.00019255929647183135, "loss": 4.6235, "mean_token_accuracy": 0.2576632291078568, "num_tokens": 144361074.0, "step": 63035 }, { "entropy": 5.294550037384033, "epoch": 6.231712139185449, "grad_norm": 1.2578125, "learning_rate": 0.00019252646170292797, "loss": 4.6667, "mean_token_accuracy": 0.25945469588041303, "num_tokens": 144372675.0, "step": 63040 }, { "entropy": 5.218867778778076, "epoch": 6.23220640569395, "grad_norm": 1.1484375, "learning_rate": 0.00019249362896288648, "loss": 4.5862, "mean_token_accuracy": 0.2631724804639816, "num_tokens": 144384657.0, "step": 63045 }, { "entropy": 5.32343864440918, "epoch": 6.232700672202451, "grad_norm": 1.0859375, "learning_rate": 0.00019246079825251445, "loss": 4.6836, "mean_token_accuracy": 0.2570447936654091, "num_tokens": 144397169.0, "step": 63050 }, { "entropy": 5.276147842407227, "epoch": 6.233194938710953, "grad_norm": 1.265625, "learning_rate": 0.0001924279695726196, "loss": 4.5469, "mean_token_accuracy": 0.2749042078852654, "num_tokens": 144408385.0, "step": 63055 }, { "entropy": 5.328680229187012, "epoch": 6.233689205219454, "grad_norm": 1.1484375, "learning_rate": 0.00019239514292400956, "loss": 4.6882, "mean_token_accuracy": 0.24720485657453536, "num_tokens": 144420245.0, "step": 63060 }, { "entropy": 5.238627004623413, "epoch": 6.234183471727956, "grad_norm": 1.1328125, "learning_rate": 0.0001923623183074918, "loss": 4.5891, "mean_token_accuracy": 0.2673640727996826, "num_tokens": 144432659.0, "step": 63065 }, { "entropy": 5.332703495025635, "epoch": 6.234677738236457, "grad_norm": 1.1875, "learning_rate": 0.00019232949572387388, "loss": 4.6596, "mean_token_accuracy": 0.2549180999398232, "num_tokens": 144444817.0, "step": 63070 }, { "entropy": 5.335840129852295, "epoch": 6.235172004744959, "grad_norm": 1.1015625, "learning_rate": 0.0001922966751739631, "loss": 4.6599, "mean_token_accuracy": 0.2555892959237099, "num_tokens": 144456738.0, "step": 63075 }, { "entropy": 5.245851707458496, "epoch": 6.23566627125346, "grad_norm": 1.1171875, "learning_rate": 0.0001922638566585669, "loss": 4.6796, "mean_token_accuracy": 0.2540546730160713, "num_tokens": 144467414.0, "step": 63080 }, { "entropy": 5.218273878097534, "epoch": 6.236160537761961, "grad_norm": 1.2578125, "learning_rate": 0.0001922310401784928, "loss": 4.621, "mean_token_accuracy": 0.2525709390640259, "num_tokens": 144477911.0, "step": 63085 }, { "entropy": 5.256556701660156, "epoch": 6.236654804270462, "grad_norm": 1.1953125, "learning_rate": 0.00019219822573454787, "loss": 4.6133, "mean_token_accuracy": 0.25777713507413863, "num_tokens": 144489698.0, "step": 63090 }, { "entropy": 5.229460048675537, "epoch": 6.237149070778964, "grad_norm": 1.203125, "learning_rate": 0.0001921654133275395, "loss": 4.5887, "mean_token_accuracy": 0.26103972643613815, "num_tokens": 144500813.0, "step": 63095 }, { "entropy": 5.376507902145386, "epoch": 6.237643337287466, "grad_norm": 1.3984375, "learning_rate": 0.00019213260295827472, "loss": 4.7294, "mean_token_accuracy": 0.24571975320577621, "num_tokens": 144513041.0, "step": 63100 }, { "entropy": 5.28208212852478, "epoch": 6.238137603795967, "grad_norm": 1.171875, "learning_rate": 0.00019209979462756082, "loss": 4.609, "mean_token_accuracy": 0.2602821886539459, "num_tokens": 144524740.0, "step": 63105 }, { "entropy": 5.305907487869263, "epoch": 6.238631870304468, "grad_norm": 1.2734375, "learning_rate": 0.00019206698833620477, "loss": 4.6809, "mean_token_accuracy": 0.25185772180557253, "num_tokens": 144535517.0, "step": 63110 }, { "entropy": 5.2688874244689945, "epoch": 6.23912613681297, "grad_norm": 1.2109375, "learning_rate": 0.00019203418408501378, "loss": 4.6268, "mean_token_accuracy": 0.25879444628953935, "num_tokens": 144546356.0, "step": 63115 }, { "entropy": 5.212415504455566, "epoch": 6.239620403321471, "grad_norm": 1.1953125, "learning_rate": 0.00019200138187479466, "loss": 4.5742, "mean_token_accuracy": 0.2663543224334717, "num_tokens": 144557572.0, "step": 63120 }, { "entropy": 5.33118748664856, "epoch": 6.240114669829972, "grad_norm": 1.1484375, "learning_rate": 0.00019196858170635446, "loss": 4.6888, "mean_token_accuracy": 0.25231893807649614, "num_tokens": 144568671.0, "step": 63125 }, { "entropy": 5.3154970645904545, "epoch": 6.240608936338473, "grad_norm": 1.1953125, "learning_rate": 0.0001919357835805, "loss": 4.6601, "mean_token_accuracy": 0.2516754627227783, "num_tokens": 144579884.0, "step": 63130 }, { "entropy": 5.205380439758301, "epoch": 6.2411032028469755, "grad_norm": 1.171875, "learning_rate": 0.00019190298749803818, "loss": 4.5738, "mean_token_accuracy": 0.25815352946519854, "num_tokens": 144591305.0, "step": 63135 }, { "entropy": 5.169626331329345, "epoch": 6.241597469355477, "grad_norm": 1.0703125, "learning_rate": 0.0001918701934597757, "loss": 4.5118, "mean_token_accuracy": 0.27531971633434293, "num_tokens": 144603485.0, "step": 63140 }, { "entropy": 5.242448806762695, "epoch": 6.242091735863978, "grad_norm": 1.2109375, "learning_rate": 0.0001918374014665194, "loss": 4.5794, "mean_token_accuracy": 0.26302544176578524, "num_tokens": 144615685.0, "step": 63145 }, { "entropy": 5.29837327003479, "epoch": 6.242586002372479, "grad_norm": 1.21875, "learning_rate": 0.00019180461151907592, "loss": 4.6375, "mean_token_accuracy": 0.2570688083767891, "num_tokens": 144627340.0, "step": 63150 }, { "entropy": 5.327152919769287, "epoch": 6.2430802688809806, "grad_norm": 1.2421875, "learning_rate": 0.00019177182361825192, "loss": 4.6532, "mean_token_accuracy": 0.25881337374448776, "num_tokens": 144637316.0, "step": 63155 }, { "entropy": 5.291606378555298, "epoch": 6.243574535389482, "grad_norm": 1.1953125, "learning_rate": 0.00019173903776485398, "loss": 4.5848, "mean_token_accuracy": 0.2642287239432335, "num_tokens": 144648889.0, "step": 63160 }, { "entropy": 5.220654678344727, "epoch": 6.244068801897983, "grad_norm": 1.140625, "learning_rate": 0.0001917062539596886, "loss": 4.5572, "mean_token_accuracy": 0.2628712624311447, "num_tokens": 144660423.0, "step": 63165 }, { "entropy": 5.260438776016235, "epoch": 6.244563068406485, "grad_norm": 1.171875, "learning_rate": 0.00019167347220356223, "loss": 4.5858, "mean_token_accuracy": 0.2619703099131584, "num_tokens": 144671345.0, "step": 63170 }, { "entropy": 5.252334403991699, "epoch": 6.2450573349149865, "grad_norm": 1.171875, "learning_rate": 0.00019164069249728144, "loss": 4.5367, "mean_token_accuracy": 0.26861115396022794, "num_tokens": 144683273.0, "step": 63175 }, { "entropy": 5.186072635650635, "epoch": 6.245551601423488, "grad_norm": 1.1171875, "learning_rate": 0.00019160791484165257, "loss": 4.5077, "mean_token_accuracy": 0.27038012593984606, "num_tokens": 144696475.0, "step": 63180 }, { "entropy": 5.312083387374878, "epoch": 6.246045867931989, "grad_norm": 1.234375, "learning_rate": 0.00019157513923748193, "loss": 4.674, "mean_token_accuracy": 0.25359891206026075, "num_tokens": 144706555.0, "step": 63185 }, { "entropy": 5.344737434387207, "epoch": 6.24654013444049, "grad_norm": 1.2734375, "learning_rate": 0.00019154236568557576, "loss": 4.6693, "mean_token_accuracy": 0.2576783999800682, "num_tokens": 144718134.0, "step": 63190 }, { "entropy": 5.2499048709869385, "epoch": 6.2470344009489915, "grad_norm": 1.203125, "learning_rate": 0.00019150959418674036, "loss": 4.5482, "mean_token_accuracy": 0.267683844268322, "num_tokens": 144728778.0, "step": 63195 }, { "entropy": 5.2750638961792, "epoch": 6.247528667457493, "grad_norm": 1.234375, "learning_rate": 0.00019147682474178186, "loss": 4.5889, "mean_token_accuracy": 0.25714532732963563, "num_tokens": 144740697.0, "step": 63200 }, { "entropy": 5.24913387298584, "epoch": 6.248022933965994, "grad_norm": 1.1484375, "learning_rate": 0.0001914440573515065, "loss": 4.6555, "mean_token_accuracy": 0.25345550030469893, "num_tokens": 144752202.0, "step": 63205 }, { "entropy": 5.274991607666015, "epoch": 6.248517200474496, "grad_norm": 1.203125, "learning_rate": 0.0001914112920167203, "loss": 4.7149, "mean_token_accuracy": 0.25331454128026965, "num_tokens": 144763530.0, "step": 63210 }, { "entropy": 5.246870040893555, "epoch": 6.2490114669829975, "grad_norm": 1.0859375, "learning_rate": 0.0001913785287382292, "loss": 4.5881, "mean_token_accuracy": 0.2623097985982895, "num_tokens": 144775691.0, "step": 63215 }, { "entropy": 5.291095542907715, "epoch": 6.249505733491499, "grad_norm": 1.1640625, "learning_rate": 0.00019134576751683936, "loss": 4.6245, "mean_token_accuracy": 0.2596579477190971, "num_tokens": 144787107.0, "step": 63220 }, { "entropy": 5.24299430847168, "epoch": 6.25, "grad_norm": 1.1796875, "learning_rate": 0.00019131300835335648, "loss": 4.57, "mean_token_accuracy": 0.2613136723637581, "num_tokens": 144798968.0, "step": 63225 }, { "entropy": 5.324158382415772, "epoch": 6.250494266508501, "grad_norm": 1.1953125, "learning_rate": 0.00019128025124858666, "loss": 4.7097, "mean_token_accuracy": 0.24473338723182678, "num_tokens": 144810797.0, "step": 63230 }, { "entropy": 5.287313795089721, "epoch": 6.2509885330170025, "grad_norm": 1.140625, "learning_rate": 0.0001912474962033357, "loss": 4.6451, "mean_token_accuracy": 0.2521270543336868, "num_tokens": 144822279.0, "step": 63235 }, { "entropy": 5.244729375839233, "epoch": 6.251482799525504, "grad_norm": 1.09375, "learning_rate": 0.0001912147432184093, "loss": 4.5438, "mean_token_accuracy": 0.2641787901520729, "num_tokens": 144833418.0, "step": 63240 }, { "entropy": 5.195466232299805, "epoch": 6.251977066034006, "grad_norm": 1.171875, "learning_rate": 0.0001911819922946132, "loss": 4.5746, "mean_token_accuracy": 0.26780813187360764, "num_tokens": 144844904.0, "step": 63245 }, { "entropy": 5.238626432418823, "epoch": 6.252471332542507, "grad_norm": 1.1484375, "learning_rate": 0.0001911492434327531, "loss": 4.6162, "mean_token_accuracy": 0.2623886585235596, "num_tokens": 144856984.0, "step": 63250 }, { "entropy": 5.251698684692383, "epoch": 6.2529655990510085, "grad_norm": 1.296875, "learning_rate": 0.00019111649663363457, "loss": 4.623, "mean_token_accuracy": 0.25955511778593066, "num_tokens": 144867671.0, "step": 63255 }, { "entropy": 5.20927324295044, "epoch": 6.25345986555951, "grad_norm": 1.0859375, "learning_rate": 0.00019108375189806327, "loss": 4.5716, "mean_token_accuracy": 0.2653411731123924, "num_tokens": 144879106.0, "step": 63260 }, { "entropy": 5.280550384521485, "epoch": 6.253954132068011, "grad_norm": 1.2109375, "learning_rate": 0.0001910510092268447, "loss": 4.6573, "mean_token_accuracy": 0.2526029169559479, "num_tokens": 144890288.0, "step": 63265 }, { "entropy": 5.322721195220947, "epoch": 6.254448398576512, "grad_norm": 1.2734375, "learning_rate": 0.0001910182686207843, "loss": 4.6627, "mean_token_accuracy": 0.25089825987815856, "num_tokens": 144901393.0, "step": 63270 }, { "entropy": 5.286629915237427, "epoch": 6.2549426650850135, "grad_norm": 1.203125, "learning_rate": 0.00019098553008068758, "loss": 4.6801, "mean_token_accuracy": 0.25673372894525526, "num_tokens": 144912894.0, "step": 63275 }, { "entropy": 5.194782876968384, "epoch": 6.255436931593515, "grad_norm": 1.0859375, "learning_rate": 0.00019095279360735985, "loss": 4.5654, "mean_token_accuracy": 0.2631946593523026, "num_tokens": 144924531.0, "step": 63280 }, { "entropy": 5.2231419563293455, "epoch": 6.255931198102017, "grad_norm": 1.21875, "learning_rate": 0.0001909200592016063, "loss": 4.5925, "mean_token_accuracy": 0.2568677067756653, "num_tokens": 144936445.0, "step": 63285 }, { "entropy": 5.265619516372681, "epoch": 6.256425464610518, "grad_norm": 1.25, "learning_rate": 0.0001908873268642325, "loss": 4.568, "mean_token_accuracy": 0.2586688563227654, "num_tokens": 144947408.0, "step": 63290 }, { "entropy": 5.309669828414917, "epoch": 6.2569197311190194, "grad_norm": 1.28125, "learning_rate": 0.00019085459659604344, "loss": 4.6481, "mean_token_accuracy": 0.2523460119962692, "num_tokens": 144959351.0, "step": 63295 }, { "entropy": 5.261592435836792, "epoch": 6.257413997627521, "grad_norm": 1.171875, "learning_rate": 0.0001908218683978444, "loss": 4.591, "mean_token_accuracy": 0.26086089462041856, "num_tokens": 144970355.0, "step": 63300 }, { "entropy": 5.271528339385986, "epoch": 6.257908264136022, "grad_norm": 1.0703125, "learning_rate": 0.00019078914227044043, "loss": 4.6061, "mean_token_accuracy": 0.26027697920799253, "num_tokens": 144981895.0, "step": 63305 }, { "entropy": 5.323054075241089, "epoch": 6.258402530644523, "grad_norm": 1.109375, "learning_rate": 0.00019075641821463657, "loss": 4.7027, "mean_token_accuracy": 0.24729706943035126, "num_tokens": 144993414.0, "step": 63310 }, { "entropy": 5.205632972717285, "epoch": 6.2588967971530245, "grad_norm": 1.3515625, "learning_rate": 0.00019072369623123793, "loss": 4.5517, "mean_token_accuracy": 0.2718086451292038, "num_tokens": 145005533.0, "step": 63315 }, { "entropy": 5.300869750976562, "epoch": 6.259391063661527, "grad_norm": 1.0703125, "learning_rate": 0.00019069097632104943, "loss": 4.6942, "mean_token_accuracy": 0.2488541081547737, "num_tokens": 145018214.0, "step": 63320 }, { "entropy": 5.260724592208862, "epoch": 6.259885330170028, "grad_norm": 1.078125, "learning_rate": 0.00019065825848487604, "loss": 4.5681, "mean_token_accuracy": 0.25811313688755033, "num_tokens": 145030615.0, "step": 63325 }, { "entropy": 5.181572818756104, "epoch": 6.260379596678529, "grad_norm": 1.09375, "learning_rate": 0.00019062554272352255, "loss": 4.5921, "mean_token_accuracy": 0.25956753045320513, "num_tokens": 145041847.0, "step": 63330 }, { "entropy": 5.2888453006744385, "epoch": 6.26087386318703, "grad_norm": 1.2421875, "learning_rate": 0.00019059282903779374, "loss": 4.5913, "mean_token_accuracy": 0.2587862715125084, "num_tokens": 145051281.0, "step": 63335 }, { "entropy": 5.249842929840088, "epoch": 6.261368129695532, "grad_norm": 1.15625, "learning_rate": 0.00019056011742849455, "loss": 4.5988, "mean_token_accuracy": 0.2618515968322754, "num_tokens": 145062946.0, "step": 63340 }, { "entropy": 5.255338144302368, "epoch": 6.261862396204033, "grad_norm": 1.1875, "learning_rate": 0.00019052740789642943, "loss": 4.6611, "mean_token_accuracy": 0.25251498222351076, "num_tokens": 145074850.0, "step": 63345 }, { "entropy": 5.2997047901153564, "epoch": 6.262356662712534, "grad_norm": 1.1171875, "learning_rate": 0.0001904947004424033, "loss": 4.6368, "mean_token_accuracy": 0.24695229679346084, "num_tokens": 145086466.0, "step": 63350 }, { "entropy": 5.248118162155151, "epoch": 6.262850929221036, "grad_norm": 1.109375, "learning_rate": 0.00019046199506722063, "loss": 4.6675, "mean_token_accuracy": 0.2570723116397858, "num_tokens": 145099248.0, "step": 63355 }, { "entropy": 5.303195333480835, "epoch": 6.263345195729538, "grad_norm": 1.1484375, "learning_rate": 0.00019042929177168588, "loss": 4.6297, "mean_token_accuracy": 0.2610512897372246, "num_tokens": 145112183.0, "step": 63360 }, { "entropy": 5.184034156799316, "epoch": 6.263839462238039, "grad_norm": 1.0625, "learning_rate": 0.00019039659055660385, "loss": 4.5085, "mean_token_accuracy": 0.27225034683942795, "num_tokens": 145124796.0, "step": 63365 }, { "entropy": 5.283278465270996, "epoch": 6.26433372874654, "grad_norm": 1.03125, "learning_rate": 0.00019036389142277864, "loss": 4.6547, "mean_token_accuracy": 0.25780085623264315, "num_tokens": 145138541.0, "step": 63370 }, { "entropy": 5.221917629241943, "epoch": 6.264827995255041, "grad_norm": 1.109375, "learning_rate": 0.00019033119437101493, "loss": 4.5715, "mean_token_accuracy": 0.25932961106300356, "num_tokens": 145150728.0, "step": 63375 }, { "entropy": 5.279409742355346, "epoch": 6.265322261763543, "grad_norm": 1.203125, "learning_rate": 0.00019029849940211698, "loss": 4.6825, "mean_token_accuracy": 0.2505705118179321, "num_tokens": 145162206.0, "step": 63380 }, { "entropy": 5.256850624084473, "epoch": 6.265816528272044, "grad_norm": 1.2421875, "learning_rate": 0.00019026580651688906, "loss": 4.6123, "mean_token_accuracy": 0.26298154294490816, "num_tokens": 145173948.0, "step": 63385 }, { "entropy": 5.311049747467041, "epoch": 6.266310794780546, "grad_norm": 1.0859375, "learning_rate": 0.00019023311571613545, "loss": 4.7272, "mean_token_accuracy": 0.24895789921283723, "num_tokens": 145186180.0, "step": 63390 }, { "entropy": 5.255868291854858, "epoch": 6.266805061289047, "grad_norm": 1.125, "learning_rate": 0.00019020042700066038, "loss": 4.6098, "mean_token_accuracy": 0.26786933839321136, "num_tokens": 145196749.0, "step": 63395 }, { "entropy": 5.244065523147583, "epoch": 6.267299327797549, "grad_norm": 1.109375, "learning_rate": 0.00019016774037126783, "loss": 4.6523, "mean_token_accuracy": 0.25545594096183777, "num_tokens": 145208021.0, "step": 63400 }, { "entropy": 5.28259425163269, "epoch": 6.26779359430605, "grad_norm": 1.1640625, "learning_rate": 0.00019013505582876218, "loss": 4.6622, "mean_token_accuracy": 0.2568397343158722, "num_tokens": 145221038.0, "step": 63405 }, { "entropy": 5.239816284179687, "epoch": 6.268287860814551, "grad_norm": 1.109375, "learning_rate": 0.00019010237337394726, "loss": 4.5678, "mean_token_accuracy": 0.26210820078849795, "num_tokens": 145232292.0, "step": 63410 }, { "entropy": 5.199551773071289, "epoch": 6.268782127323052, "grad_norm": 1.09375, "learning_rate": 0.00019006969300762715, "loss": 4.5293, "mean_token_accuracy": 0.27292409986257554, "num_tokens": 145243576.0, "step": 63415 }, { "entropy": 5.258856725692749, "epoch": 6.269276393831554, "grad_norm": 1.203125, "learning_rate": 0.00019003701473060576, "loss": 4.6554, "mean_token_accuracy": 0.25608216524124144, "num_tokens": 145255261.0, "step": 63420 }, { "entropy": 5.273378801345825, "epoch": 6.269770660340056, "grad_norm": 1.1484375, "learning_rate": 0.00019000433854368703, "loss": 4.6637, "mean_token_accuracy": 0.26135481894016266, "num_tokens": 145266583.0, "step": 63425 }, { "entropy": 5.314540004730224, "epoch": 6.270264926848557, "grad_norm": 1.2109375, "learning_rate": 0.0001899716644476746, "loss": 4.7189, "mean_token_accuracy": 0.25810773968696593, "num_tokens": 145278040.0, "step": 63430 }, { "entropy": 5.270242929458618, "epoch": 6.270759193357058, "grad_norm": 1.1796875, "learning_rate": 0.00018993899244337253, "loss": 4.5986, "mean_token_accuracy": 0.26290009915828705, "num_tokens": 145289617.0, "step": 63435 }, { "entropy": 5.269200468063355, "epoch": 6.27125345986556, "grad_norm": 1.1953125, "learning_rate": 0.00018990632253158447, "loss": 4.5873, "mean_token_accuracy": 0.2606074020266533, "num_tokens": 145300888.0, "step": 63440 }, { "entropy": 5.232440185546875, "epoch": 6.271747726374061, "grad_norm": 1.2109375, "learning_rate": 0.00018987365471311406, "loss": 4.645, "mean_token_accuracy": 0.2568108975887299, "num_tokens": 145312588.0, "step": 63445 }, { "entropy": 5.186362075805664, "epoch": 6.272241992882562, "grad_norm": 1.2421875, "learning_rate": 0.00018984098898876495, "loss": 4.5083, "mean_token_accuracy": 0.271895757317543, "num_tokens": 145323934.0, "step": 63450 }, { "entropy": 5.3289021968841555, "epoch": 6.272736259391063, "grad_norm": 1.2421875, "learning_rate": 0.00018980832535934068, "loss": 4.6874, "mean_token_accuracy": 0.2519566148519516, "num_tokens": 145335353.0, "step": 63455 }, { "entropy": 5.23563027381897, "epoch": 6.273230525899565, "grad_norm": 1.328125, "learning_rate": 0.0001897756638256448, "loss": 4.642, "mean_token_accuracy": 0.2553081691265106, "num_tokens": 145345851.0, "step": 63460 }, { "entropy": 5.210631513595581, "epoch": 6.273724792408067, "grad_norm": 1.1328125, "learning_rate": 0.00018974300438848085, "loss": 4.5759, "mean_token_accuracy": 0.2561367154121399, "num_tokens": 145357659.0, "step": 63465 }, { "entropy": 5.2043904781341555, "epoch": 6.274219058916568, "grad_norm": 1.15625, "learning_rate": 0.00018971034704865227, "loss": 4.5712, "mean_token_accuracy": 0.26881559640169145, "num_tokens": 145369867.0, "step": 63470 }, { "entropy": 5.348954868316651, "epoch": 6.274713325425069, "grad_norm": 1.1796875, "learning_rate": 0.00018967769180696238, "loss": 4.7041, "mean_token_accuracy": 0.24701699316501619, "num_tokens": 145381469.0, "step": 63475 }, { "entropy": 5.268449020385742, "epoch": 6.275207591933571, "grad_norm": 1.2109375, "learning_rate": 0.00018964503866421439, "loss": 4.5818, "mean_token_accuracy": 0.25838068425655364, "num_tokens": 145391952.0, "step": 63480 }, { "entropy": 5.295808887481689, "epoch": 6.275701858442072, "grad_norm": 1.0859375, "learning_rate": 0.0001896123876212118, "loss": 4.674, "mean_token_accuracy": 0.2509606584906578, "num_tokens": 145403670.0, "step": 63485 }, { "entropy": 5.303550815582275, "epoch": 6.276196124950573, "grad_norm": 1.1953125, "learning_rate": 0.00018957973867875767, "loss": 4.7116, "mean_token_accuracy": 0.25327507555484774, "num_tokens": 145415913.0, "step": 63490 }, { "entropy": 5.258833169937134, "epoch": 6.276690391459074, "grad_norm": 1.21875, "learning_rate": 0.00018954709183765522, "loss": 4.6017, "mean_token_accuracy": 0.2652935802936554, "num_tokens": 145426920.0, "step": 63495 }, { "entropy": 5.3103289127349855, "epoch": 6.2771846579675765, "grad_norm": 1.1484375, "learning_rate": 0.00018951444709870764, "loss": 4.6728, "mean_token_accuracy": 0.24693928360939027, "num_tokens": 145438594.0, "step": 63500 }, { "entropy": 5.235047483444214, "epoch": 6.277678924476078, "grad_norm": 1.1875, "learning_rate": 0.00018948180446271785, "loss": 4.5209, "mean_token_accuracy": 0.26721838116645813, "num_tokens": 145449839.0, "step": 63505 }, { "entropy": 5.293314361572266, "epoch": 6.278173190984579, "grad_norm": 1.1484375, "learning_rate": 0.000189449163930489, "loss": 4.6421, "mean_token_accuracy": 0.2618603020906448, "num_tokens": 145461830.0, "step": 63510 }, { "entropy": 5.2443459033966064, "epoch": 6.27866745749308, "grad_norm": 1.171875, "learning_rate": 0.00018941652550282385, "loss": 4.6304, "mean_token_accuracy": 0.2571512296795845, "num_tokens": 145474558.0, "step": 63515 }, { "entropy": 5.188647937774658, "epoch": 6.279161724001582, "grad_norm": 1.140625, "learning_rate": 0.00018938388918052557, "loss": 4.5713, "mean_token_accuracy": 0.2649729520082474, "num_tokens": 145487099.0, "step": 63520 }, { "entropy": 5.34167366027832, "epoch": 6.279655990510083, "grad_norm": 1.3046875, "learning_rate": 0.00018935125496439694, "loss": 4.6704, "mean_token_accuracy": 0.2500833600759506, "num_tokens": 145498353.0, "step": 63525 }, { "entropy": 5.333399820327759, "epoch": 6.280150257018584, "grad_norm": 1.2421875, "learning_rate": 0.0001893186228552406, "loss": 4.7207, "mean_token_accuracy": 0.2549161225557327, "num_tokens": 145510172.0, "step": 63530 }, { "entropy": 5.230057859420777, "epoch": 6.280644523527085, "grad_norm": 1.1171875, "learning_rate": 0.0001892859928538595, "loss": 4.6257, "mean_token_accuracy": 0.25867113620042803, "num_tokens": 145521094.0, "step": 63535 }, { "entropy": 5.226748275756836, "epoch": 6.2811387900355875, "grad_norm": 1.1484375, "learning_rate": 0.00018925336496105626, "loss": 4.5798, "mean_token_accuracy": 0.25995258092880247, "num_tokens": 145532601.0, "step": 63540 }, { "entropy": 5.233984804153442, "epoch": 6.281633056544089, "grad_norm": 1.1796875, "learning_rate": 0.00018922073917763355, "loss": 4.6597, "mean_token_accuracy": 0.2581388220191002, "num_tokens": 145543759.0, "step": 63545 }, { "entropy": 5.276887035369873, "epoch": 6.28212732305259, "grad_norm": 1.078125, "learning_rate": 0.00018918811550439396, "loss": 4.6193, "mean_token_accuracy": 0.2549325540661812, "num_tokens": 145556075.0, "step": 63550 }, { "entropy": 5.251775598526001, "epoch": 6.282621589561091, "grad_norm": 1.21875, "learning_rate": 0.00018915549394214, "loss": 4.6378, "mean_token_accuracy": 0.25471712946891784, "num_tokens": 145567353.0, "step": 63555 }, { "entropy": 5.303975296020508, "epoch": 6.2831158560695926, "grad_norm": 1.25, "learning_rate": 0.00018912287449167426, "loss": 4.6539, "mean_token_accuracy": 0.26095540821552277, "num_tokens": 145578656.0, "step": 63560 }, { "entropy": 5.256494998931885, "epoch": 6.283610122578094, "grad_norm": 1.1328125, "learning_rate": 0.00018909025715379917, "loss": 4.6348, "mean_token_accuracy": 0.2585896387696266, "num_tokens": 145590750.0, "step": 63565 }, { "entropy": 5.216139078140259, "epoch": 6.284104389086595, "grad_norm": 1.1640625, "learning_rate": 0.000189057641929317, "loss": 4.4933, "mean_token_accuracy": 0.27052893191576005, "num_tokens": 145601008.0, "step": 63570 }, { "entropy": 5.292511415481568, "epoch": 6.284598655595097, "grad_norm": 1.125, "learning_rate": 0.00018902502881903022, "loss": 4.6748, "mean_token_accuracy": 0.25303242206573484, "num_tokens": 145612505.0, "step": 63575 }, { "entropy": 5.175324296951294, "epoch": 6.2850929221035985, "grad_norm": 1.125, "learning_rate": 0.000188992417823741, "loss": 4.5922, "mean_token_accuracy": 0.26345405727624893, "num_tokens": 145623624.0, "step": 63580 }, { "entropy": 5.309278345108032, "epoch": 6.2855871886121, "grad_norm": 1.140625, "learning_rate": 0.00018895980894425174, "loss": 4.6626, "mean_token_accuracy": 0.2556645512580872, "num_tokens": 145634371.0, "step": 63585 }, { "entropy": 5.1960587978363035, "epoch": 6.286081455120601, "grad_norm": 1.1875, "learning_rate": 0.0001889272021813645, "loss": 4.4907, "mean_token_accuracy": 0.2693801775574684, "num_tokens": 145645381.0, "step": 63590 }, { "entropy": 5.320709180831909, "epoch": 6.286575721629102, "grad_norm": 1.296875, "learning_rate": 0.0001888945975358814, "loss": 4.7011, "mean_token_accuracy": 0.25164864361286166, "num_tokens": 145656981.0, "step": 63595 }, { "entropy": 5.25987606048584, "epoch": 6.2870699881376035, "grad_norm": 1.265625, "learning_rate": 0.00018886199500860464, "loss": 4.6446, "mean_token_accuracy": 0.2583372503519058, "num_tokens": 145667350.0, "step": 63600 }, { "entropy": 5.214835357666016, "epoch": 6.287564254646105, "grad_norm": 1.1015625, "learning_rate": 0.000188829394600336, "loss": 4.5742, "mean_token_accuracy": 0.2677645027637482, "num_tokens": 145678460.0, "step": 63605 }, { "entropy": 5.256568908691406, "epoch": 6.288058521154607, "grad_norm": 1.1171875, "learning_rate": 0.00018879679631187774, "loss": 4.5725, "mean_token_accuracy": 0.26648829877376556, "num_tokens": 145689135.0, "step": 63610 }, { "entropy": 5.209070158004761, "epoch": 6.288552787663108, "grad_norm": 1.1875, "learning_rate": 0.00018876420014403173, "loss": 4.5657, "mean_token_accuracy": 0.26724731773138044, "num_tokens": 145699924.0, "step": 63615 }, { "entropy": 5.300092506408691, "epoch": 6.2890470541716095, "grad_norm": 1.25, "learning_rate": 0.00018873160609759966, "loss": 4.6289, "mean_token_accuracy": 0.2587797656655312, "num_tokens": 145712188.0, "step": 63620 }, { "entropy": 5.33231554031372, "epoch": 6.289541320680111, "grad_norm": 1.265625, "learning_rate": 0.00018869901417338349, "loss": 4.6925, "mean_token_accuracy": 0.24843965470790863, "num_tokens": 145722788.0, "step": 63625 }, { "entropy": 5.1766866683959964, "epoch": 6.290035587188612, "grad_norm": 1.21875, "learning_rate": 0.000188666424372185, "loss": 4.5017, "mean_token_accuracy": 0.2682062268257141, "num_tokens": 145733563.0, "step": 63630 }, { "entropy": 5.251296710968018, "epoch": 6.290529853697113, "grad_norm": 1.1484375, "learning_rate": 0.00018863383669480576, "loss": 4.6527, "mean_token_accuracy": 0.2543038845062256, "num_tokens": 145745894.0, "step": 63635 }, { "entropy": 5.269617748260498, "epoch": 6.2910241202056145, "grad_norm": 1.2109375, "learning_rate": 0.00018860125114204763, "loss": 4.6291, "mean_token_accuracy": 0.2588984191417694, "num_tokens": 145757149.0, "step": 63640 }, { "entropy": 5.333670234680175, "epoch": 6.291518386714117, "grad_norm": 1.265625, "learning_rate": 0.0001885686677147121, "loss": 4.7209, "mean_token_accuracy": 0.2526822954416275, "num_tokens": 145767968.0, "step": 63645 }, { "entropy": 5.376948404312134, "epoch": 6.292012653222618, "grad_norm": 1.15625, "learning_rate": 0.00018853608641360083, "loss": 4.8075, "mean_token_accuracy": 0.23998739272356034, "num_tokens": 145780731.0, "step": 63650 }, { "entropy": 5.2942180156707765, "epoch": 6.292506919731119, "grad_norm": 1.0859375, "learning_rate": 0.0001885035072395152, "loss": 4.6149, "mean_token_accuracy": 0.25662920624017715, "num_tokens": 145791787.0, "step": 63655 }, { "entropy": 5.269202327728271, "epoch": 6.2930011862396205, "grad_norm": 1.21875, "learning_rate": 0.00018847093019325672, "loss": 4.604, "mean_token_accuracy": 0.260793961584568, "num_tokens": 145802110.0, "step": 63660 }, { "entropy": 5.312818002700806, "epoch": 6.293495452748122, "grad_norm": 1.1328125, "learning_rate": 0.00018843835527562663, "loss": 4.6382, "mean_token_accuracy": 0.2563983529806137, "num_tokens": 145812247.0, "step": 63665 }, { "entropy": 5.16495451927185, "epoch": 6.293989719256623, "grad_norm": 1.1484375, "learning_rate": 0.00018840578248742658, "loss": 4.4723, "mean_token_accuracy": 0.27477453649044037, "num_tokens": 145823356.0, "step": 63670 }, { "entropy": 5.229855728149414, "epoch": 6.294483985765124, "grad_norm": 1.1953125, "learning_rate": 0.00018837321182945765, "loss": 4.6055, "mean_token_accuracy": 0.2557839512825012, "num_tokens": 145834364.0, "step": 63675 }, { "entropy": 5.2494330406188965, "epoch": 6.294978252273626, "grad_norm": 1.25, "learning_rate": 0.0001883406433025212, "loss": 4.594, "mean_token_accuracy": 0.25913688689470293, "num_tokens": 145845557.0, "step": 63680 }, { "entropy": 5.278357791900635, "epoch": 6.295472518782128, "grad_norm": 1.296875, "learning_rate": 0.0001883080769074184, "loss": 4.6926, "mean_token_accuracy": 0.2516352340579033, "num_tokens": 145856105.0, "step": 63685 }, { "entropy": 5.232676601409912, "epoch": 6.295966785290629, "grad_norm": 1.140625, "learning_rate": 0.00018827551264495024, "loss": 4.5744, "mean_token_accuracy": 0.2636271134018898, "num_tokens": 145869243.0, "step": 63690 }, { "entropy": 5.327368068695068, "epoch": 6.29646105179913, "grad_norm": 1.1640625, "learning_rate": 0.00018824295051591793, "loss": 4.6885, "mean_token_accuracy": 0.2569307714700699, "num_tokens": 145882103.0, "step": 63695 }, { "entropy": 5.299642896652221, "epoch": 6.296955318307631, "grad_norm": 1.1953125, "learning_rate": 0.0001882103905211226, "loss": 4.6765, "mean_token_accuracy": 0.24927835464477538, "num_tokens": 145893293.0, "step": 63700 }, { "entropy": 5.218143033981323, "epoch": 6.297449584816133, "grad_norm": 1.125, "learning_rate": 0.00018817783266136513, "loss": 4.5637, "mean_token_accuracy": 0.25794467478990557, "num_tokens": 145905012.0, "step": 63705 }, { "entropy": 5.289752674102783, "epoch": 6.297943851324634, "grad_norm": 1.0859375, "learning_rate": 0.00018814527693744644, "loss": 4.6342, "mean_token_accuracy": 0.25929396897554396, "num_tokens": 145915553.0, "step": 63710 }, { "entropy": 5.221576356887818, "epoch": 6.298438117833135, "grad_norm": 1.2578125, "learning_rate": 0.00018811272335016733, "loss": 4.6208, "mean_token_accuracy": 0.25586773455142975, "num_tokens": 145926328.0, "step": 63715 }, { "entropy": 5.200047445297241, "epoch": 6.298932384341637, "grad_norm": 1.2578125, "learning_rate": 0.00018808017190032872, "loss": 4.5697, "mean_token_accuracy": 0.2637312710285187, "num_tokens": 145936989.0, "step": 63720 }, { "entropy": 5.303506851196289, "epoch": 6.299426650850139, "grad_norm": 1.1328125, "learning_rate": 0.00018804762258873138, "loss": 4.6276, "mean_token_accuracy": 0.26367784589529036, "num_tokens": 145948775.0, "step": 63725 }, { "entropy": 5.343750047683716, "epoch": 6.29992091735864, "grad_norm": 1.234375, "learning_rate": 0.00018801507541617608, "loss": 4.7339, "mean_token_accuracy": 0.25563586205244065, "num_tokens": 145960300.0, "step": 63730 }, { "entropy": 5.27452974319458, "epoch": 6.300415183867141, "grad_norm": 1.3125, "learning_rate": 0.00018798253038346336, "loss": 4.6357, "mean_token_accuracy": 0.2583797827363014, "num_tokens": 145971716.0, "step": 63735 }, { "entropy": 5.306391668319702, "epoch": 6.300909450375642, "grad_norm": 1.1171875, "learning_rate": 0.00018794998749139386, "loss": 4.7173, "mean_token_accuracy": 0.25330339670181273, "num_tokens": 145984297.0, "step": 63740 }, { "entropy": 5.35415415763855, "epoch": 6.301403716884144, "grad_norm": 1.046875, "learning_rate": 0.00018791744674076822, "loss": 4.7401, "mean_token_accuracy": 0.24695244580507278, "num_tokens": 145996628.0, "step": 63745 }, { "entropy": 5.293132686614991, "epoch": 6.301897983392645, "grad_norm": 1.1640625, "learning_rate": 0.00018788490813238684, "loss": 4.6527, "mean_token_accuracy": 0.2508159339427948, "num_tokens": 146007976.0, "step": 63750 }, { "entropy": 5.197361946105957, "epoch": 6.302392249901147, "grad_norm": 1.1953125, "learning_rate": 0.00018785237166705032, "loss": 4.5383, "mean_token_accuracy": 0.264316488802433, "num_tokens": 146018705.0, "step": 63755 }, { "entropy": 5.2452778816223145, "epoch": 6.302886516409648, "grad_norm": 1.203125, "learning_rate": 0.00018781983734555895, "loss": 4.5409, "mean_token_accuracy": 0.2613524064421654, "num_tokens": 146029680.0, "step": 63760 }, { "entropy": 5.195945167541504, "epoch": 6.30338078291815, "grad_norm": 1.1640625, "learning_rate": 0.00018778730516871305, "loss": 4.5576, "mean_token_accuracy": 0.26889577358961103, "num_tokens": 146041739.0, "step": 63765 }, { "entropy": 5.290023708343506, "epoch": 6.303875049426651, "grad_norm": 1.1015625, "learning_rate": 0.0001877547751373131, "loss": 4.6235, "mean_token_accuracy": 0.2638664171099663, "num_tokens": 146052599.0, "step": 63770 }, { "entropy": 5.2528046607971195, "epoch": 6.304369315935152, "grad_norm": 1.0859375, "learning_rate": 0.00018772224725215915, "loss": 4.5843, "mean_token_accuracy": 0.2597134917974472, "num_tokens": 146064621.0, "step": 63775 }, { "entropy": 5.30065131187439, "epoch": 6.304863582443653, "grad_norm": 1.1640625, "learning_rate": 0.00018768972151405138, "loss": 4.64, "mean_token_accuracy": 0.2533890575170517, "num_tokens": 146075850.0, "step": 63780 }, { "entropy": 5.2969037055969235, "epoch": 6.305357848952155, "grad_norm": 1.15625, "learning_rate": 0.00018765719792379005, "loss": 4.7153, "mean_token_accuracy": 0.24480556845664977, "num_tokens": 146087884.0, "step": 63785 }, { "entropy": 5.275647735595703, "epoch": 6.305852115460656, "grad_norm": 1.1171875, "learning_rate": 0.00018762467648217524, "loss": 4.6654, "mean_token_accuracy": 0.2595054253935814, "num_tokens": 146098350.0, "step": 63790 }, { "entropy": 5.2872474670410154, "epoch": 6.306346381969158, "grad_norm": 1.28125, "learning_rate": 0.00018759215719000693, "loss": 4.6128, "mean_token_accuracy": 0.26183275431394576, "num_tokens": 146108774.0, "step": 63795 }, { "entropy": 5.329749488830567, "epoch": 6.306840648477659, "grad_norm": 1.21875, "learning_rate": 0.00018755964004808513, "loss": 4.6586, "mean_token_accuracy": 0.2560023993253708, "num_tokens": 146120368.0, "step": 63800 }, { "entropy": 5.152572059631348, "epoch": 6.307334914986161, "grad_norm": 1.25, "learning_rate": 0.0001875271250572097, "loss": 4.5209, "mean_token_accuracy": 0.2670096859335899, "num_tokens": 146130765.0, "step": 63805 }, { "entropy": 5.268039751052856, "epoch": 6.307829181494662, "grad_norm": 1.109375, "learning_rate": 0.0001874946122181806, "loss": 4.6359, "mean_token_accuracy": 0.26018970012664794, "num_tokens": 146142317.0, "step": 63810 }, { "entropy": 5.254753971099854, "epoch": 6.308323448003163, "grad_norm": 1.1875, "learning_rate": 0.00018746210153179754, "loss": 4.6312, "mean_token_accuracy": 0.25760279446840284, "num_tokens": 146153417.0, "step": 63815 }, { "entropy": 5.289131355285645, "epoch": 6.308817714511664, "grad_norm": 1.1484375, "learning_rate": 0.0001874295929988605, "loss": 4.6791, "mean_token_accuracy": 0.2562838226556778, "num_tokens": 146165356.0, "step": 63820 }, { "entropy": 5.318119478225708, "epoch": 6.309311981020166, "grad_norm": 1.1640625, "learning_rate": 0.00018739708662016897, "loss": 4.6503, "mean_token_accuracy": 0.2574421316385269, "num_tokens": 146176499.0, "step": 63825 }, { "entropy": 5.282365417480468, "epoch": 6.309806247528668, "grad_norm": 1.1328125, "learning_rate": 0.00018736458239652272, "loss": 4.6818, "mean_token_accuracy": 0.25617826730012894, "num_tokens": 146186954.0, "step": 63830 }, { "entropy": 5.274301290512085, "epoch": 6.310300514037169, "grad_norm": 1.1796875, "learning_rate": 0.00018733208032872128, "loss": 4.6249, "mean_token_accuracy": 0.25556488037109376, "num_tokens": 146197192.0, "step": 63835 }, { "entropy": 5.278452634811401, "epoch": 6.31079478054567, "grad_norm": 1.1640625, "learning_rate": 0.00018729958041756434, "loss": 4.5947, "mean_token_accuracy": 0.25573621690273285, "num_tokens": 146208076.0, "step": 63840 }, { "entropy": 5.310364389419556, "epoch": 6.311289047054172, "grad_norm": 1.1484375, "learning_rate": 0.0001872670826638513, "loss": 4.6177, "mean_token_accuracy": 0.2519630596041679, "num_tokens": 146218667.0, "step": 63845 }, { "entropy": 5.2376837730407715, "epoch": 6.311783313562673, "grad_norm": 1.125, "learning_rate": 0.0001872345870683817, "loss": 4.6051, "mean_token_accuracy": 0.2622846975922585, "num_tokens": 146230574.0, "step": 63850 }, { "entropy": 5.188560247421265, "epoch": 6.312277580071174, "grad_norm": 1.2109375, "learning_rate": 0.00018720209363195478, "loss": 4.5048, "mean_token_accuracy": 0.2671357154846191, "num_tokens": 146240893.0, "step": 63855 }, { "entropy": 5.293078374862671, "epoch": 6.312771846579675, "grad_norm": 1.1796875, "learning_rate": 0.00018716960235537006, "loss": 4.6232, "mean_token_accuracy": 0.2582607179880142, "num_tokens": 146253164.0, "step": 63860 }, { "entropy": 5.297306203842163, "epoch": 6.3132661130881775, "grad_norm": 1.1171875, "learning_rate": 0.0001871371132394266, "loss": 4.6082, "mean_token_accuracy": 0.26186146289110185, "num_tokens": 146264957.0, "step": 63865 }, { "entropy": 5.259146213531494, "epoch": 6.313760379596679, "grad_norm": 1.2890625, "learning_rate": 0.0001871046262849239, "loss": 4.5659, "mean_token_accuracy": 0.26063989102840424, "num_tokens": 146276260.0, "step": 63870 }, { "entropy": 5.230500364303589, "epoch": 6.31425464610518, "grad_norm": 1.15625, "learning_rate": 0.00018707214149266105, "loss": 4.5862, "mean_token_accuracy": 0.2560099557042122, "num_tokens": 146287805.0, "step": 63875 }, { "entropy": 5.299919462203979, "epoch": 6.314748912613681, "grad_norm": 1.21875, "learning_rate": 0.0001870396588634371, "loss": 4.6837, "mean_token_accuracy": 0.24748204201459884, "num_tokens": 146298330.0, "step": 63880 }, { "entropy": 5.289206409454346, "epoch": 6.315243179122183, "grad_norm": 1.15625, "learning_rate": 0.00018700717839805126, "loss": 4.677, "mean_token_accuracy": 0.24950405806303025, "num_tokens": 146311208.0, "step": 63885 }, { "entropy": 5.225687503814697, "epoch": 6.315737445630684, "grad_norm": 1.21875, "learning_rate": 0.00018697470009730244, "loss": 4.607, "mean_token_accuracy": 0.26002471297979357, "num_tokens": 146322778.0, "step": 63890 }, { "entropy": 5.208648681640625, "epoch": 6.316231712139185, "grad_norm": 1.2109375, "learning_rate": 0.00018694222396198958, "loss": 4.5029, "mean_token_accuracy": 0.26920356750488283, "num_tokens": 146333517.0, "step": 63895 }, { "entropy": 5.189843034744262, "epoch": 6.316725978647687, "grad_norm": 1.234375, "learning_rate": 0.00018690974999291176, "loss": 4.5597, "mean_token_accuracy": 0.2648936972022057, "num_tokens": 146344269.0, "step": 63900 }, { "entropy": 5.215256881713867, "epoch": 6.3172202451561885, "grad_norm": 1.125, "learning_rate": 0.00018687727819086776, "loss": 4.5371, "mean_token_accuracy": 0.2625164449214935, "num_tokens": 146355247.0, "step": 63905 }, { "entropy": 5.354241991043091, "epoch": 6.31771451166469, "grad_norm": 1.171875, "learning_rate": 0.00018684480855665636, "loss": 4.7694, "mean_token_accuracy": 0.23971143811941148, "num_tokens": 146367515.0, "step": 63910 }, { "entropy": 5.290074634552002, "epoch": 6.318208778173191, "grad_norm": 1.203125, "learning_rate": 0.00018681234109107638, "loss": 4.6549, "mean_token_accuracy": 0.25204107612371446, "num_tokens": 146378671.0, "step": 63915 }, { "entropy": 5.278345584869385, "epoch": 6.318703044681692, "grad_norm": 1.15625, "learning_rate": 0.0001867798757949265, "loss": 4.6186, "mean_token_accuracy": 0.259838205575943, "num_tokens": 146389729.0, "step": 63920 }, { "entropy": 5.308989429473877, "epoch": 6.319197311190194, "grad_norm": 1.2421875, "learning_rate": 0.00018674741266900524, "loss": 4.7114, "mean_token_accuracy": 0.2482374295592308, "num_tokens": 146399585.0, "step": 63925 }, { "entropy": 5.257037019729614, "epoch": 6.319691577698695, "grad_norm": 1.09375, "learning_rate": 0.00018671495171411145, "loss": 4.5478, "mean_token_accuracy": 0.25971388071775436, "num_tokens": 146412760.0, "step": 63930 }, { "entropy": 5.2859728813171385, "epoch": 6.320185844207197, "grad_norm": 1.2421875, "learning_rate": 0.00018668249293104345, "loss": 4.6374, "mean_token_accuracy": 0.2576145902276039, "num_tokens": 146423440.0, "step": 63935 }, { "entropy": 5.290287637710572, "epoch": 6.320680110715698, "grad_norm": 1.15625, "learning_rate": 0.0001866500363205999, "loss": 4.7079, "mean_token_accuracy": 0.2495882034301758, "num_tokens": 146435142.0, "step": 63940 }, { "entropy": 5.254426050186157, "epoch": 6.3211743772241995, "grad_norm": 1.1875, "learning_rate": 0.00018661758188357914, "loss": 4.6343, "mean_token_accuracy": 0.25513074845075606, "num_tokens": 146447579.0, "step": 63945 }, { "entropy": 5.27015905380249, "epoch": 6.321668643732701, "grad_norm": 1.1484375, "learning_rate": 0.00018658512962077957, "loss": 4.5261, "mean_token_accuracy": 0.2653464496135712, "num_tokens": 146459660.0, "step": 63950 }, { "entropy": 5.199933576583862, "epoch": 6.322162910241202, "grad_norm": 1.1796875, "learning_rate": 0.0001865526795329995, "loss": 4.5215, "mean_token_accuracy": 0.2707317918539047, "num_tokens": 146471072.0, "step": 63955 }, { "entropy": 5.229966354370117, "epoch": 6.322657176749703, "grad_norm": 1.2734375, "learning_rate": 0.00018652023162103726, "loss": 4.5794, "mean_token_accuracy": 0.2641984611749649, "num_tokens": 146482012.0, "step": 63960 }, { "entropy": 5.23184027671814, "epoch": 6.3231514432582046, "grad_norm": 1.3125, "learning_rate": 0.00018648778588569104, "loss": 4.6027, "mean_token_accuracy": 0.2629678249359131, "num_tokens": 146493497.0, "step": 63965 }, { "entropy": 5.3042432308197025, "epoch": 6.323645709766706, "grad_norm": 1.1875, "learning_rate": 0.00018645534232775908, "loss": 4.6518, "mean_token_accuracy": 0.2567709103226662, "num_tokens": 146504953.0, "step": 63970 }, { "entropy": 5.2299901962280275, "epoch": 6.324139976275208, "grad_norm": 1.2421875, "learning_rate": 0.00018642290094803937, "loss": 4.5458, "mean_token_accuracy": 0.25972704887390136, "num_tokens": 146515680.0, "step": 63975 }, { "entropy": 5.1986973762512205, "epoch": 6.324634242783709, "grad_norm": 1.1796875, "learning_rate": 0.00018639046174733005, "loss": 4.5497, "mean_token_accuracy": 0.2651417747139931, "num_tokens": 146526450.0, "step": 63980 }, { "entropy": 5.309807968139649, "epoch": 6.3251285092922105, "grad_norm": 1.1875, "learning_rate": 0.00018635802472642904, "loss": 4.6592, "mean_token_accuracy": 0.2572013780474663, "num_tokens": 146537745.0, "step": 63985 }, { "entropy": 5.289096832275391, "epoch": 6.325622775800712, "grad_norm": 1.125, "learning_rate": 0.00018632558988613453, "loss": 4.6767, "mean_token_accuracy": 0.2510848566889763, "num_tokens": 146551015.0, "step": 63990 }, { "entropy": 5.156501913070679, "epoch": 6.326117042309213, "grad_norm": 1.21875, "learning_rate": 0.00018629315722724416, "loss": 4.4468, "mean_token_accuracy": 0.27704397439956663, "num_tokens": 146561719.0, "step": 63995 }, { "entropy": 5.23168683052063, "epoch": 6.326611308817714, "grad_norm": 1.25, "learning_rate": 0.00018626072675055594, "loss": 4.5757, "mean_token_accuracy": 0.2632460489869118, "num_tokens": 146573112.0, "step": 64000 }, { "entropy": 5.235148811340332, "epoch": 6.3271055753262155, "grad_norm": 1.1015625, "learning_rate": 0.00018622829845686763, "loss": 4.6369, "mean_token_accuracy": 0.25397766679525374, "num_tokens": 146584904.0, "step": 64005 }, { "entropy": 5.311576223373413, "epoch": 6.327599841834718, "grad_norm": 1.234375, "learning_rate": 0.00018619587234697677, "loss": 4.6859, "mean_token_accuracy": 0.24985582381486893, "num_tokens": 146595682.0, "step": 64010 }, { "entropy": 5.331441736221313, "epoch": 6.328094108343219, "grad_norm": 1.1171875, "learning_rate": 0.00018616344842168136, "loss": 4.6293, "mean_token_accuracy": 0.2636855736374855, "num_tokens": 146606551.0, "step": 64015 }, { "entropy": 5.289630270004272, "epoch": 6.32858837485172, "grad_norm": 1.1484375, "learning_rate": 0.00018613102668177902, "loss": 4.6453, "mean_token_accuracy": 0.25422112792730334, "num_tokens": 146617540.0, "step": 64020 }, { "entropy": 5.221593523025513, "epoch": 6.3290826413602215, "grad_norm": 1.1953125, "learning_rate": 0.00018609860712806697, "loss": 4.6333, "mean_token_accuracy": 0.26236302256584165, "num_tokens": 146629474.0, "step": 64025 }, { "entropy": 5.303733062744141, "epoch": 6.329576907868723, "grad_norm": 1.1640625, "learning_rate": 0.00018606618976134314, "loss": 4.6255, "mean_token_accuracy": 0.25368902534246446, "num_tokens": 146640392.0, "step": 64030 }, { "entropy": 5.230770444869995, "epoch": 6.330071174377224, "grad_norm": 1.1015625, "learning_rate": 0.00018603377458240483, "loss": 4.5426, "mean_token_accuracy": 0.2713990777730942, "num_tokens": 146652169.0, "step": 64035 }, { "entropy": 5.305034351348877, "epoch": 6.330565440885725, "grad_norm": 1.1875, "learning_rate": 0.0001860013615920494, "loss": 4.6346, "mean_token_accuracy": 0.25179030150175097, "num_tokens": 146663988.0, "step": 64040 }, { "entropy": 5.324458599090576, "epoch": 6.3310597073942265, "grad_norm": 1.1640625, "learning_rate": 0.00018596895079107435, "loss": 4.6687, "mean_token_accuracy": 0.2552496910095215, "num_tokens": 146675311.0, "step": 64045 }, { "entropy": 5.2270660400390625, "epoch": 6.331553973902729, "grad_norm": 1.1640625, "learning_rate": 0.00018593654218027685, "loss": 4.5823, "mean_token_accuracy": 0.26343256086111067, "num_tokens": 146687105.0, "step": 64050 }, { "entropy": 5.368081760406494, "epoch": 6.33204824041123, "grad_norm": 1.2109375, "learning_rate": 0.00018590413576045428, "loss": 4.7316, "mean_token_accuracy": 0.2459298074245453, "num_tokens": 146698541.0, "step": 64055 }, { "entropy": 5.2545702934265135, "epoch": 6.332542506919731, "grad_norm": 1.1796875, "learning_rate": 0.00018587173153240377, "loss": 4.6213, "mean_token_accuracy": 0.25889048874378207, "num_tokens": 146709507.0, "step": 64060 }, { "entropy": 5.296510457992554, "epoch": 6.3330367734282325, "grad_norm": 1.2421875, "learning_rate": 0.00018583932949692257, "loss": 4.6513, "mean_token_accuracy": 0.2569256603717804, "num_tokens": 146721018.0, "step": 64065 }, { "entropy": 5.290635108947754, "epoch": 6.333531039936734, "grad_norm": 1.2265625, "learning_rate": 0.00018580692965480757, "loss": 4.6227, "mean_token_accuracy": 0.2666870251297951, "num_tokens": 146732147.0, "step": 64070 }, { "entropy": 5.278877782821655, "epoch": 6.334025306445235, "grad_norm": 1.2578125, "learning_rate": 0.00018577453200685595, "loss": 4.6835, "mean_token_accuracy": 0.24873515218496323, "num_tokens": 146743322.0, "step": 64075 }, { "entropy": 5.222523927688599, "epoch": 6.334519572953736, "grad_norm": 1.2109375, "learning_rate": 0.00018574213655386473, "loss": 4.5656, "mean_token_accuracy": 0.26608161330223085, "num_tokens": 146754618.0, "step": 64080 }, { "entropy": 5.259436798095703, "epoch": 6.335013839462238, "grad_norm": 1.140625, "learning_rate": 0.0001857097432966308, "loss": 4.6428, "mean_token_accuracy": 0.2535648837685585, "num_tokens": 146767202.0, "step": 64085 }, { "entropy": 5.306725311279297, "epoch": 6.33550810597074, "grad_norm": 1.1953125, "learning_rate": 0.0001856773522359511, "loss": 4.6809, "mean_token_accuracy": 0.25768077075481416, "num_tokens": 146779133.0, "step": 64090 }, { "entropy": 5.2151857852935795, "epoch": 6.336002372479241, "grad_norm": 1.25, "learning_rate": 0.00018564496337262232, "loss": 4.5855, "mean_token_accuracy": 0.26605906039476396, "num_tokens": 146790744.0, "step": 64095 }, { "entropy": 5.162825965881348, "epoch": 6.336496638987742, "grad_norm": 1.2109375, "learning_rate": 0.00018561257670744125, "loss": 4.4739, "mean_token_accuracy": 0.26903037130832674, "num_tokens": 146801650.0, "step": 64100 }, { "entropy": 5.255616474151611, "epoch": 6.336990905496243, "grad_norm": 1.1640625, "learning_rate": 0.00018558019224120475, "loss": 4.6047, "mean_token_accuracy": 0.2613328754901886, "num_tokens": 146814034.0, "step": 64105 }, { "entropy": 5.206429529190063, "epoch": 6.337485172004745, "grad_norm": 1.2578125, "learning_rate": 0.0001855478099747094, "loss": 4.5595, "mean_token_accuracy": 0.265294674038887, "num_tokens": 146825475.0, "step": 64110 }, { "entropy": 5.262512683868408, "epoch": 6.337979438513246, "grad_norm": 1.15625, "learning_rate": 0.00018551542990875175, "loss": 4.706, "mean_token_accuracy": 0.2548963338136673, "num_tokens": 146837312.0, "step": 64115 }, { "entropy": 5.296552515029907, "epoch": 6.338473705021748, "grad_norm": 1.2890625, "learning_rate": 0.0001854830520441284, "loss": 4.6362, "mean_token_accuracy": 0.25706338286399844, "num_tokens": 146847771.0, "step": 64120 }, { "entropy": 5.271923446655274, "epoch": 6.338967971530249, "grad_norm": 1.265625, "learning_rate": 0.00018545067638163588, "loss": 4.6497, "mean_token_accuracy": 0.25836519449949263, "num_tokens": 146860162.0, "step": 64125 }, { "entropy": 5.24311375617981, "epoch": 6.339462238038751, "grad_norm": 1.2265625, "learning_rate": 0.00018541830292207056, "loss": 4.5629, "mean_token_accuracy": 0.2626432806253433, "num_tokens": 146871158.0, "step": 64130 }, { "entropy": 5.201505088806153, "epoch": 6.339956504547252, "grad_norm": 1.1796875, "learning_rate": 0.00018538593166622896, "loss": 4.5843, "mean_token_accuracy": 0.2644961684942245, "num_tokens": 146881740.0, "step": 64135 }, { "entropy": 5.1939520835876465, "epoch": 6.340450771055753, "grad_norm": 1.2890625, "learning_rate": 0.00018535356261490738, "loss": 4.5567, "mean_token_accuracy": 0.2695986941456795, "num_tokens": 146891788.0, "step": 64140 }, { "entropy": 5.30736665725708, "epoch": 6.340945037564254, "grad_norm": 1.1640625, "learning_rate": 0.00018532119576890194, "loss": 4.6915, "mean_token_accuracy": 0.24795080572366715, "num_tokens": 146902926.0, "step": 64145 }, { "entropy": 5.386371231079101, "epoch": 6.341439304072756, "grad_norm": 1.390625, "learning_rate": 0.00018528883112900913, "loss": 4.7226, "mean_token_accuracy": 0.2480746701359749, "num_tokens": 146914228.0, "step": 64150 }, { "entropy": 5.234416723251343, "epoch": 6.341933570581258, "grad_norm": 1.2578125, "learning_rate": 0.00018525646869602485, "loss": 4.5836, "mean_token_accuracy": 0.26002067923545835, "num_tokens": 146925272.0, "step": 64155 }, { "entropy": 5.228641366958618, "epoch": 6.342427837089759, "grad_norm": 1.21875, "learning_rate": 0.00018522410847074543, "loss": 4.5943, "mean_token_accuracy": 0.26425836235284805, "num_tokens": 146936887.0, "step": 64160 }, { "entropy": 5.265493249893188, "epoch": 6.34292210359826, "grad_norm": 1.1796875, "learning_rate": 0.00018519175045396692, "loss": 4.6712, "mean_token_accuracy": 0.2523875832557678, "num_tokens": 146949215.0, "step": 64165 }, { "entropy": 5.237683534622192, "epoch": 6.343416370106762, "grad_norm": 1.140625, "learning_rate": 0.00018515939464648523, "loss": 4.6128, "mean_token_accuracy": 0.2610723257064819, "num_tokens": 146960862.0, "step": 64170 }, { "entropy": 5.2773548603057865, "epoch": 6.343910636615263, "grad_norm": 1.28125, "learning_rate": 0.00018512704104909638, "loss": 4.6641, "mean_token_accuracy": 0.25371720641851425, "num_tokens": 146972881.0, "step": 64175 }, { "entropy": 5.262608289718628, "epoch": 6.344404903123764, "grad_norm": 1.125, "learning_rate": 0.0001850946896625963, "loss": 4.5901, "mean_token_accuracy": 0.25639439225196836, "num_tokens": 146985184.0, "step": 64180 }, { "entropy": 5.2711797714233395, "epoch": 6.344899169632265, "grad_norm": 1.0625, "learning_rate": 0.0001850623404877807, "loss": 4.5983, "mean_token_accuracy": 0.25868806838989256, "num_tokens": 146997194.0, "step": 64185 }, { "entropy": 5.334614324569702, "epoch": 6.345393436140768, "grad_norm": 1.2890625, "learning_rate": 0.00018502999352544553, "loss": 4.6451, "mean_token_accuracy": 0.2550989419221878, "num_tokens": 147008678.0, "step": 64190 }, { "entropy": 5.322035932540894, "epoch": 6.345887702649269, "grad_norm": 1.15625, "learning_rate": 0.00018499764877638649, "loss": 4.68, "mean_token_accuracy": 0.24437746554613113, "num_tokens": 147019947.0, "step": 64195 }, { "entropy": 5.292483282089234, "epoch": 6.34638196915777, "grad_norm": 1.1875, "learning_rate": 0.00018496530624139928, "loss": 4.7705, "mean_token_accuracy": 0.24938415884971618, "num_tokens": 147031833.0, "step": 64200 }, { "entropy": 5.29603214263916, "epoch": 6.346876235666271, "grad_norm": 1.2109375, "learning_rate": 0.0001849329659212795, "loss": 4.6247, "mean_token_accuracy": 0.2553966477513313, "num_tokens": 147043549.0, "step": 64205 }, { "entropy": 5.227880382537842, "epoch": 6.347370502174773, "grad_norm": 1.15625, "learning_rate": 0.00018490062781682264, "loss": 4.5922, "mean_token_accuracy": 0.2553561612963676, "num_tokens": 147054367.0, "step": 64210 }, { "entropy": 5.278451347351075, "epoch": 6.347864768683274, "grad_norm": 1.109375, "learning_rate": 0.00018486829192882438, "loss": 4.6021, "mean_token_accuracy": 0.2549572318792343, "num_tokens": 147066845.0, "step": 64215 }, { "entropy": 5.262003755569458, "epoch": 6.348359035191775, "grad_norm": 1.2265625, "learning_rate": 0.0001848359582580801, "loss": 4.5771, "mean_token_accuracy": 0.25988381505012514, "num_tokens": 147076780.0, "step": 64220 }, { "entropy": 5.253000688552857, "epoch": 6.348853301700276, "grad_norm": 1.1640625, "learning_rate": 0.00018480362680538525, "loss": 4.642, "mean_token_accuracy": 0.255100229382515, "num_tokens": 147089497.0, "step": 64225 }, { "entropy": 5.191877126693726, "epoch": 6.3493475682087785, "grad_norm": 1.1328125, "learning_rate": 0.00018477129757153528, "loss": 4.5036, "mean_token_accuracy": 0.26741548627614975, "num_tokens": 147100335.0, "step": 64230 }, { "entropy": 5.2768340587615965, "epoch": 6.34984183471728, "grad_norm": 1.171875, "learning_rate": 0.00018473897055732526, "loss": 4.6236, "mean_token_accuracy": 0.2558566674590111, "num_tokens": 147111514.0, "step": 64235 }, { "entropy": 5.326346302032471, "epoch": 6.350336101225781, "grad_norm": 1.1953125, "learning_rate": 0.00018470664576355057, "loss": 4.6748, "mean_token_accuracy": 0.25041793286800385, "num_tokens": 147122709.0, "step": 64240 }, { "entropy": 5.296704483032227, "epoch": 6.350830367734282, "grad_norm": 1.140625, "learning_rate": 0.00018467432319100636, "loss": 4.651, "mean_token_accuracy": 0.25024227052927017, "num_tokens": 147134297.0, "step": 64245 }, { "entropy": 5.298785066604614, "epoch": 6.351324634242784, "grad_norm": 1.203125, "learning_rate": 0.00018464200284048788, "loss": 4.6565, "mean_token_accuracy": 0.2506691202521324, "num_tokens": 147146623.0, "step": 64250 }, { "entropy": 5.196213912963867, "epoch": 6.351818900751285, "grad_norm": 1.140625, "learning_rate": 0.00018460968471279015, "loss": 4.5298, "mean_token_accuracy": 0.2676348239183426, "num_tokens": 147157237.0, "step": 64255 }, { "entropy": 5.30509238243103, "epoch": 6.352313167259786, "grad_norm": 1.171875, "learning_rate": 0.0001845773688087082, "loss": 4.7147, "mean_token_accuracy": 0.24552997648715974, "num_tokens": 147168077.0, "step": 64260 }, { "entropy": 5.317588949203492, "epoch": 6.352807433768288, "grad_norm": 1.109375, "learning_rate": 0.000184545055129037, "loss": 4.6466, "mean_token_accuracy": 0.2546116471290588, "num_tokens": 147178972.0, "step": 64265 }, { "entropy": 5.278741884231567, "epoch": 6.3533017002767895, "grad_norm": 1.203125, "learning_rate": 0.00018451274367457148, "loss": 4.6166, "mean_token_accuracy": 0.2576156213879585, "num_tokens": 147190111.0, "step": 64270 }, { "entropy": 5.184046936035156, "epoch": 6.353795966785291, "grad_norm": 1.125, "learning_rate": 0.00018448043444610647, "loss": 4.5358, "mean_token_accuracy": 0.2654313683509827, "num_tokens": 147202156.0, "step": 64275 }, { "entropy": 5.26580228805542, "epoch": 6.354290233293792, "grad_norm": 1.1484375, "learning_rate": 0.00018444812744443685, "loss": 4.6633, "mean_token_accuracy": 0.24982326179742814, "num_tokens": 147213206.0, "step": 64280 }, { "entropy": 5.261812973022461, "epoch": 6.354784499802293, "grad_norm": 1.21875, "learning_rate": 0.00018441582267035735, "loss": 4.6376, "mean_token_accuracy": 0.2521114870905876, "num_tokens": 147224858.0, "step": 64285 }, { "entropy": 5.36160306930542, "epoch": 6.355278766310795, "grad_norm": 1.140625, "learning_rate": 0.0001843835201246627, "loss": 4.7579, "mean_token_accuracy": 0.24739587157964707, "num_tokens": 147237595.0, "step": 64290 }, { "entropy": 5.218211221694946, "epoch": 6.355773032819296, "grad_norm": 1.1484375, "learning_rate": 0.00018435121980814746, "loss": 4.5391, "mean_token_accuracy": 0.26974954307079313, "num_tokens": 147249195.0, "step": 64295 }, { "entropy": 5.275304746627808, "epoch": 6.356267299327797, "grad_norm": 1.125, "learning_rate": 0.0001843189217216063, "loss": 4.5985, "mean_token_accuracy": 0.2546295702457428, "num_tokens": 147260404.0, "step": 64300 }, { "entropy": 5.251454782485962, "epoch": 6.356761565836299, "grad_norm": 1.1328125, "learning_rate": 0.0001842866258658336, "loss": 4.6303, "mean_token_accuracy": 0.2633585840463638, "num_tokens": 147272158.0, "step": 64305 }, { "entropy": 5.277611875534058, "epoch": 6.3572558323448005, "grad_norm": 1.265625, "learning_rate": 0.00018425433224162407, "loss": 4.6388, "mean_token_accuracy": 0.25127206891775133, "num_tokens": 147283890.0, "step": 64310 }, { "entropy": 5.266356325149536, "epoch": 6.357750098853302, "grad_norm": 1.1796875, "learning_rate": 0.00018422204084977213, "loss": 4.6039, "mean_token_accuracy": 0.25113082081079485, "num_tokens": 147295862.0, "step": 64315 }, { "entropy": 5.255914974212646, "epoch": 6.358244365361803, "grad_norm": 1.171875, "learning_rate": 0.00018418975169107204, "loss": 4.5653, "mean_token_accuracy": 0.26313009262084963, "num_tokens": 147306951.0, "step": 64320 }, { "entropy": 5.274370431900024, "epoch": 6.358738631870304, "grad_norm": 1.3046875, "learning_rate": 0.00018415746476631813, "loss": 4.6833, "mean_token_accuracy": 0.24932690113782882, "num_tokens": 147319638.0, "step": 64325 }, { "entropy": 5.311164283752442, "epoch": 6.359232898378806, "grad_norm": 1.1171875, "learning_rate": 0.00018412518007630458, "loss": 4.7194, "mean_token_accuracy": 0.24987323731184005, "num_tokens": 147332252.0, "step": 64330 }, { "entropy": 5.242695045471192, "epoch": 6.359727164887307, "grad_norm": 1.1796875, "learning_rate": 0.00018409289762182573, "loss": 4.5913, "mean_token_accuracy": 0.25979586243629454, "num_tokens": 147344532.0, "step": 64335 }, { "entropy": 5.262482976913452, "epoch": 6.360221431395809, "grad_norm": 1.2265625, "learning_rate": 0.0001840606174036758, "loss": 4.6587, "mean_token_accuracy": 0.2516398936510086, "num_tokens": 147355501.0, "step": 64340 }, { "entropy": 5.3383708000183105, "epoch": 6.36071569790431, "grad_norm": 1.2578125, "learning_rate": 0.00018402833942264874, "loss": 4.712, "mean_token_accuracy": 0.2520444571971893, "num_tokens": 147365712.0, "step": 64345 }, { "entropy": 5.316165018081665, "epoch": 6.3612099644128115, "grad_norm": 1.125, "learning_rate": 0.00018399606367953868, "loss": 4.6848, "mean_token_accuracy": 0.25764240473508837, "num_tokens": 147377747.0, "step": 64350 }, { "entropy": 5.2475954532623295, "epoch": 6.361704230921313, "grad_norm": 1.203125, "learning_rate": 0.00018396379017513947, "loss": 4.5815, "mean_token_accuracy": 0.26688401103019715, "num_tokens": 147388220.0, "step": 64355 }, { "entropy": 5.297852563858032, "epoch": 6.362198497429814, "grad_norm": 1.09375, "learning_rate": 0.00018393151891024517, "loss": 4.7365, "mean_token_accuracy": 0.25077313631772996, "num_tokens": 147400103.0, "step": 64360 }, { "entropy": 5.167467832565308, "epoch": 6.362692763938315, "grad_norm": 1.28125, "learning_rate": 0.0001838992498856497, "loss": 4.507, "mean_token_accuracy": 0.26333205997943876, "num_tokens": 147410662.0, "step": 64365 }, { "entropy": 5.262921380996704, "epoch": 6.3631870304468166, "grad_norm": 1.1171875, "learning_rate": 0.00018386698310214684, "loss": 4.7181, "mean_token_accuracy": 0.24906231611967086, "num_tokens": 147423411.0, "step": 64370 }, { "entropy": 5.310306072235107, "epoch": 6.363681296955319, "grad_norm": 1.25, "learning_rate": 0.0001838347185605303, "loss": 4.6098, "mean_token_accuracy": 0.258696885406971, "num_tokens": 147434205.0, "step": 64375 }, { "entropy": 5.2260809421539305, "epoch": 6.36417556346382, "grad_norm": 1.265625, "learning_rate": 0.0001838024562615938, "loss": 4.5564, "mean_token_accuracy": 0.2641119182109833, "num_tokens": 147445231.0, "step": 64380 }, { "entropy": 5.227181386947632, "epoch": 6.364669829972321, "grad_norm": 1.1015625, "learning_rate": 0.000183770196206131, "loss": 4.5608, "mean_token_accuracy": 0.2648233637213707, "num_tokens": 147456064.0, "step": 64385 }, { "entropy": 5.233048343658448, "epoch": 6.3651640964808225, "grad_norm": 1.09375, "learning_rate": 0.00018373793839493552, "loss": 4.6316, "mean_token_accuracy": 0.2544732093811035, "num_tokens": 147466884.0, "step": 64390 }, { "entropy": 5.273685789108276, "epoch": 6.365658362989324, "grad_norm": 1.3125, "learning_rate": 0.00018370568282880095, "loss": 4.6103, "mean_token_accuracy": 0.2540047526359558, "num_tokens": 147477439.0, "step": 64395 }, { "entropy": 5.275112009048462, "epoch": 6.366152629497825, "grad_norm": 1.0390625, "learning_rate": 0.0001836734295085208, "loss": 4.6581, "mean_token_accuracy": 0.25653978884220124, "num_tokens": 147489759.0, "step": 64400 }, { "entropy": 5.212631416320801, "epoch": 6.366646896006326, "grad_norm": 1.1640625, "learning_rate": 0.00018364117843488838, "loss": 4.5626, "mean_token_accuracy": 0.26602593809366226, "num_tokens": 147501245.0, "step": 64405 }, { "entropy": 5.2511927604675295, "epoch": 6.367141162514828, "grad_norm": 1.1796875, "learning_rate": 0.00018360892960869718, "loss": 4.6608, "mean_token_accuracy": 0.2531472995877266, "num_tokens": 147512526.0, "step": 64410 }, { "entropy": 5.15914101600647, "epoch": 6.36763542902333, "grad_norm": 1.1640625, "learning_rate": 0.0001835766830307405, "loss": 4.5301, "mean_token_accuracy": 0.2732470601797104, "num_tokens": 147524192.0, "step": 64415 }, { "entropy": 5.233197259902954, "epoch": 6.368129695531831, "grad_norm": 1.0859375, "learning_rate": 0.00018354443870181153, "loss": 4.5822, "mean_token_accuracy": 0.26058956831693647, "num_tokens": 147536603.0, "step": 64420 }, { "entropy": 5.23469500541687, "epoch": 6.368623962040332, "grad_norm": 1.140625, "learning_rate": 0.00018351219662270357, "loss": 4.5895, "mean_token_accuracy": 0.25480819791555404, "num_tokens": 147548259.0, "step": 64425 }, { "entropy": 5.235520124435425, "epoch": 6.3691182285488335, "grad_norm": 1.171875, "learning_rate": 0.00018347995679420982, "loss": 4.5448, "mean_token_accuracy": 0.26452492773532865, "num_tokens": 147558711.0, "step": 64430 }, { "entropy": 5.304136037826538, "epoch": 6.369612495057335, "grad_norm": 1.1875, "learning_rate": 0.00018344771921712332, "loss": 4.7104, "mean_token_accuracy": 0.24927348643541336, "num_tokens": 147570447.0, "step": 64435 }, { "entropy": 5.30981559753418, "epoch": 6.370106761565836, "grad_norm": 1.1484375, "learning_rate": 0.0001834154838922371, "loss": 4.6597, "mean_token_accuracy": 0.2541482552886009, "num_tokens": 147582158.0, "step": 64440 }, { "entropy": 5.348504304885864, "epoch": 6.370601028074338, "grad_norm": 1.28125, "learning_rate": 0.0001833832508203442, "loss": 4.7289, "mean_token_accuracy": 0.25024925768375395, "num_tokens": 147592971.0, "step": 64445 }, { "entropy": 5.284483146667481, "epoch": 6.371095294582839, "grad_norm": 1.3203125, "learning_rate": 0.00018335102000223752, "loss": 4.6451, "mean_token_accuracy": 0.2553674802184105, "num_tokens": 147603925.0, "step": 64450 }, { "entropy": 5.278299856185913, "epoch": 6.371589561091341, "grad_norm": 1.171875, "learning_rate": 0.00018331879143871, "loss": 4.7011, "mean_token_accuracy": 0.25286140888929365, "num_tokens": 147616062.0, "step": 64455 }, { "entropy": 5.2213939189910885, "epoch": 6.372083827599842, "grad_norm": 1.125, "learning_rate": 0.00018328656513055442, "loss": 4.5772, "mean_token_accuracy": 0.2609621658921242, "num_tokens": 147628596.0, "step": 64460 }, { "entropy": 5.297491931915284, "epoch": 6.372578094108343, "grad_norm": 1.1640625, "learning_rate": 0.0001832543410785636, "loss": 4.6464, "mean_token_accuracy": 0.2554957434535027, "num_tokens": 147640281.0, "step": 64465 }, { "entropy": 5.2582683086395265, "epoch": 6.3730723606168445, "grad_norm": 1.078125, "learning_rate": 0.00018322211928353016, "loss": 4.6175, "mean_token_accuracy": 0.25498951971530914, "num_tokens": 147652412.0, "step": 64470 }, { "entropy": 5.322502136230469, "epoch": 6.373566627125346, "grad_norm": 1.2265625, "learning_rate": 0.00018318989974624682, "loss": 4.6454, "mean_token_accuracy": 0.2586313605308533, "num_tokens": 147664934.0, "step": 64475 }, { "entropy": 5.346446561813354, "epoch": 6.374060893633847, "grad_norm": 1.234375, "learning_rate": 0.00018315768246750618, "loss": 4.6729, "mean_token_accuracy": 0.25812895894050597, "num_tokens": 147677190.0, "step": 64480 }, { "entropy": 5.260049295425415, "epoch": 6.374555160142349, "grad_norm": 1.0859375, "learning_rate": 0.00018312546744810094, "loss": 4.6502, "mean_token_accuracy": 0.25686805695295334, "num_tokens": 147688869.0, "step": 64485 }, { "entropy": 5.171279573440552, "epoch": 6.37504942665085, "grad_norm": 1.5078125, "learning_rate": 0.0001830932546888233, "loss": 4.4914, "mean_token_accuracy": 0.2666206553578377, "num_tokens": 147701325.0, "step": 64490 }, { "entropy": 5.254286527633667, "epoch": 6.375543693159352, "grad_norm": 1.15625, "learning_rate": 0.00018306104419046594, "loss": 4.6604, "mean_token_accuracy": 0.25536760687828064, "num_tokens": 147713289.0, "step": 64495 }, { "entropy": 5.18848557472229, "epoch": 6.376037959667853, "grad_norm": 1.265625, "learning_rate": 0.00018302883595382115, "loss": 4.5387, "mean_token_accuracy": 0.26813644021749494, "num_tokens": 147723973.0, "step": 64500 }, { "entropy": 5.205167579650879, "epoch": 6.376532226176354, "grad_norm": 1.1953125, "learning_rate": 0.00018299662997968113, "loss": 4.5531, "mean_token_accuracy": 0.26381474584341047, "num_tokens": 147735101.0, "step": 64505 }, { "entropy": 5.309395503997803, "epoch": 6.377026492684855, "grad_norm": 1.25, "learning_rate": 0.00018296442626883846, "loss": 4.7282, "mean_token_accuracy": 0.2492368534207344, "num_tokens": 147746077.0, "step": 64510 }, { "entropy": 5.193829298019409, "epoch": 6.377520759193357, "grad_norm": 1.203125, "learning_rate": 0.0001829322248220851, "loss": 4.5745, "mean_token_accuracy": 0.2675389856100082, "num_tokens": 147757158.0, "step": 64515 }, { "entropy": 5.238470411300659, "epoch": 6.378015025701859, "grad_norm": 1.203125, "learning_rate": 0.0001829000256402133, "loss": 4.6264, "mean_token_accuracy": 0.26350177526474, "num_tokens": 147768552.0, "step": 64520 }, { "entropy": 5.2916358470916744, "epoch": 6.37850929221036, "grad_norm": 1.171875, "learning_rate": 0.0001828678287240152, "loss": 4.6392, "mean_token_accuracy": 0.25273833721876143, "num_tokens": 147780582.0, "step": 64525 }, { "entropy": 5.3331114768981935, "epoch": 6.379003558718861, "grad_norm": 1.2421875, "learning_rate": 0.00018283563407428283, "loss": 4.6654, "mean_token_accuracy": 0.24742311984300613, "num_tokens": 147792460.0, "step": 64530 }, { "entropy": 5.235535478591919, "epoch": 6.379497825227363, "grad_norm": 1.1953125, "learning_rate": 0.000182803441691808, "loss": 4.6292, "mean_token_accuracy": 0.25847454369068146, "num_tokens": 147804119.0, "step": 64535 }, { "entropy": 5.280639934539795, "epoch": 6.379992091735864, "grad_norm": 1.2578125, "learning_rate": 0.00018277125157738295, "loss": 4.6219, "mean_token_accuracy": 0.25250909477472305, "num_tokens": 147815286.0, "step": 64540 }, { "entropy": 5.217385292053223, "epoch": 6.380486358244365, "grad_norm": 1.171875, "learning_rate": 0.00018273906373179934, "loss": 4.5753, "mean_token_accuracy": 0.26738403290510177, "num_tokens": 147827472.0, "step": 64545 }, { "entropy": 5.243446350097656, "epoch": 6.380980624752866, "grad_norm": 1.3046875, "learning_rate": 0.00018270687815584913, "loss": 4.6464, "mean_token_accuracy": 0.2581330344080925, "num_tokens": 147839324.0, "step": 64550 }, { "entropy": 5.212990665435791, "epoch": 6.381474891261368, "grad_norm": 1.125, "learning_rate": 0.00018267469485032405, "loss": 4.6269, "mean_token_accuracy": 0.2548069432377815, "num_tokens": 147852030.0, "step": 64555 }, { "entropy": 5.276724720001221, "epoch": 6.38196915776987, "grad_norm": 1.21875, "learning_rate": 0.0001826425138160158, "loss": 4.5935, "mean_token_accuracy": 0.26415823101997377, "num_tokens": 147862717.0, "step": 64560 }, { "entropy": 5.2096038341522215, "epoch": 6.382463424278371, "grad_norm": 1.28125, "learning_rate": 0.00018261033505371593, "loss": 4.6293, "mean_token_accuracy": 0.26127259284257887, "num_tokens": 147876142.0, "step": 64565 }, { "entropy": 5.2811150550842285, "epoch": 6.382957690786872, "grad_norm": 1.2109375, "learning_rate": 0.00018257815856421623, "loss": 4.6486, "mean_token_accuracy": 0.25178110748529436, "num_tokens": 147888105.0, "step": 64570 }, { "entropy": 5.291511154174804, "epoch": 6.383451957295374, "grad_norm": 1.2109375, "learning_rate": 0.0001825459843483082, "loss": 4.6391, "mean_token_accuracy": 0.25692166686058043, "num_tokens": 147899192.0, "step": 64575 }, { "entropy": 5.373161697387696, "epoch": 6.383946223803875, "grad_norm": 1.2109375, "learning_rate": 0.00018251381240678326, "loss": 4.7464, "mean_token_accuracy": 0.24336458891630172, "num_tokens": 147911264.0, "step": 64580 }, { "entropy": 5.194716501235962, "epoch": 6.384440490312376, "grad_norm": 1.1640625, "learning_rate": 0.00018248164274043294, "loss": 4.5307, "mean_token_accuracy": 0.26322649270296095, "num_tokens": 147922003.0, "step": 64585 }, { "entropy": 5.251118898391724, "epoch": 6.384934756820877, "grad_norm": 1.125, "learning_rate": 0.00018244947535004847, "loss": 4.6746, "mean_token_accuracy": 0.25096833407878877, "num_tokens": 147934123.0, "step": 64590 }, { "entropy": 5.287833118438721, "epoch": 6.38542902332938, "grad_norm": 1.171875, "learning_rate": 0.00018241731023642128, "loss": 4.5956, "mean_token_accuracy": 0.26081073433160784, "num_tokens": 147945202.0, "step": 64595 }, { "entropy": 5.262480211257935, "epoch": 6.385923289837881, "grad_norm": 1.15625, "learning_rate": 0.00018238514740034263, "loss": 4.6309, "mean_token_accuracy": 0.2607042357325554, "num_tokens": 147957253.0, "step": 64600 }, { "entropy": 5.283925104141235, "epoch": 6.386417556346382, "grad_norm": 1.2421875, "learning_rate": 0.00018235298684260377, "loss": 4.6256, "mean_token_accuracy": 0.2602628916501999, "num_tokens": 147968939.0, "step": 64605 }, { "entropy": 5.208903837203979, "epoch": 6.386911822854883, "grad_norm": 1.2265625, "learning_rate": 0.0001823208285639958, "loss": 4.559, "mean_token_accuracy": 0.26437928676605227, "num_tokens": 147981085.0, "step": 64610 }, { "entropy": 5.179702281951904, "epoch": 6.387406089363385, "grad_norm": 1.1953125, "learning_rate": 0.0001822886725653098, "loss": 4.5216, "mean_token_accuracy": 0.2693933069705963, "num_tokens": 147992151.0, "step": 64615 }, { "entropy": 5.252337503433227, "epoch": 6.387900355871886, "grad_norm": 1.1015625, "learning_rate": 0.00018225651884733684, "loss": 4.5941, "mean_token_accuracy": 0.25941227078437806, "num_tokens": 148002965.0, "step": 64620 }, { "entropy": 5.244693040847778, "epoch": 6.388394622380387, "grad_norm": 1.1953125, "learning_rate": 0.0001822243674108678, "loss": 4.5773, "mean_token_accuracy": 0.2625322252511978, "num_tokens": 148014597.0, "step": 64625 }, { "entropy": 5.26536111831665, "epoch": 6.388888888888889, "grad_norm": 1.2109375, "learning_rate": 0.00018219221825669385, "loss": 4.6147, "mean_token_accuracy": 0.25616046190261843, "num_tokens": 148026625.0, "step": 64630 }, { "entropy": 5.275593709945679, "epoch": 6.3893831553973905, "grad_norm": 1.2734375, "learning_rate": 0.00018216007138560576, "loss": 4.6198, "mean_token_accuracy": 0.25597780346870425, "num_tokens": 148036752.0, "step": 64635 }, { "entropy": 5.141404867172241, "epoch": 6.389877421905892, "grad_norm": 1.15625, "learning_rate": 0.0001821279267983942, "loss": 4.4835, "mean_token_accuracy": 0.274390771985054, "num_tokens": 148049413.0, "step": 64640 }, { "entropy": 5.206164169311523, "epoch": 6.390371688414393, "grad_norm": 1.1953125, "learning_rate": 0.00018209578449585013, "loss": 4.5468, "mean_token_accuracy": 0.25705698430538176, "num_tokens": 148060774.0, "step": 64645 }, { "entropy": 5.29824047088623, "epoch": 6.390865954922894, "grad_norm": 1.2578125, "learning_rate": 0.00018206364447876405, "loss": 4.678, "mean_token_accuracy": 0.25393723994493483, "num_tokens": 148072721.0, "step": 64650 }, { "entropy": 5.285691595077514, "epoch": 6.391360221431396, "grad_norm": 1.1015625, "learning_rate": 0.00018203150674792686, "loss": 4.6091, "mean_token_accuracy": 0.26026932448148726, "num_tokens": 148083954.0, "step": 64655 }, { "entropy": 5.312500810623169, "epoch": 6.391854487939897, "grad_norm": 1.203125, "learning_rate": 0.00018199937130412903, "loss": 4.7182, "mean_token_accuracy": 0.24900595396757125, "num_tokens": 148096063.0, "step": 64660 }, { "entropy": 5.291295957565308, "epoch": 6.392348754448399, "grad_norm": 1.1640625, "learning_rate": 0.00018196723814816102, "loss": 4.7025, "mean_token_accuracy": 0.25336098074913027, "num_tokens": 148109865.0, "step": 64665 }, { "entropy": 5.0780011177062985, "epoch": 6.3928430209569, "grad_norm": 1.2265625, "learning_rate": 0.00018193510728081342, "loss": 4.4293, "mean_token_accuracy": 0.2798286095261574, "num_tokens": 148121397.0, "step": 64670 }, { "entropy": 5.261053133010864, "epoch": 6.3933372874654015, "grad_norm": 1.1640625, "learning_rate": 0.00018190297870287664, "loss": 4.6097, "mean_token_accuracy": 0.2580567702651024, "num_tokens": 148133372.0, "step": 64675 }, { "entropy": 5.2728626251220705, "epoch": 6.393831553973903, "grad_norm": 1.296875, "learning_rate": 0.00018187085241514101, "loss": 4.6297, "mean_token_accuracy": 0.2615861788392067, "num_tokens": 148143596.0, "step": 64680 }, { "entropy": 5.198693418502808, "epoch": 6.394325820482404, "grad_norm": 1.2265625, "learning_rate": 0.00018183872841839684, "loss": 4.5812, "mean_token_accuracy": 0.2646595731377602, "num_tokens": 148155524.0, "step": 64685 }, { "entropy": 5.251911067962647, "epoch": 6.394820086990905, "grad_norm": 1.234375, "learning_rate": 0.00018180660671343442, "loss": 4.5713, "mean_token_accuracy": 0.2600355863571167, "num_tokens": 148165957.0, "step": 64690 }, { "entropy": 5.206647825241089, "epoch": 6.395314353499407, "grad_norm": 1.2421875, "learning_rate": 0.00018177448730104394, "loss": 4.5175, "mean_token_accuracy": 0.26625441759824753, "num_tokens": 148176213.0, "step": 64695 }, { "entropy": 5.216056871414184, "epoch": 6.395808620007909, "grad_norm": 1.2265625, "learning_rate": 0.00018174237018201556, "loss": 4.6018, "mean_token_accuracy": 0.2619232997298241, "num_tokens": 148187649.0, "step": 64700 }, { "entropy": 5.31928243637085, "epoch": 6.39630288651641, "grad_norm": 1.21875, "learning_rate": 0.00018171025535713932, "loss": 4.7431, "mean_token_accuracy": 0.2442692592740059, "num_tokens": 148199274.0, "step": 64705 }, { "entropy": 5.185774850845337, "epoch": 6.396797153024911, "grad_norm": 1.0703125, "learning_rate": 0.00018167814282720517, "loss": 4.549, "mean_token_accuracy": 0.2732959821820259, "num_tokens": 148212921.0, "step": 64710 }, { "entropy": 5.279995346069336, "epoch": 6.3972914195334125, "grad_norm": 1.203125, "learning_rate": 0.00018164603259300326, "loss": 4.6443, "mean_token_accuracy": 0.2524110287427902, "num_tokens": 148223602.0, "step": 64715 }, { "entropy": 5.279665994644165, "epoch": 6.397785686041914, "grad_norm": 1.109375, "learning_rate": 0.0001816139246553235, "loss": 4.6333, "mean_token_accuracy": 0.2629326954483986, "num_tokens": 148237220.0, "step": 64720 }, { "entropy": 5.177613973617554, "epoch": 6.398279952550415, "grad_norm": 1.21875, "learning_rate": 0.00018158181901495562, "loss": 4.4753, "mean_token_accuracy": 0.27626422643661497, "num_tokens": 148248378.0, "step": 64725 }, { "entropy": 5.175656509399414, "epoch": 6.398774219058916, "grad_norm": 1.1953125, "learning_rate": 0.00018154971567268952, "loss": 4.5618, "mean_token_accuracy": 0.26252264231443406, "num_tokens": 148259576.0, "step": 64730 }, { "entropy": 5.215558671951294, "epoch": 6.399268485567418, "grad_norm": 1.1484375, "learning_rate": 0.00018151761462931483, "loss": 4.6331, "mean_token_accuracy": 0.25019577592611314, "num_tokens": 148271286.0, "step": 64735 }, { "entropy": 5.164594936370849, "epoch": 6.39976275207592, "grad_norm": 1.125, "learning_rate": 0.00018148551588562133, "loss": 4.501, "mean_token_accuracy": 0.2783698633313179, "num_tokens": 148283176.0, "step": 64740 }, { "entropy": 5.310973167419434, "epoch": 6.400257018584421, "grad_norm": 1.296875, "learning_rate": 0.00018145341944239874, "loss": 4.6609, "mean_token_accuracy": 0.26163060516119, "num_tokens": 148294534.0, "step": 64745 }, { "entropy": 5.245720338821411, "epoch": 6.400751285092922, "grad_norm": 1.1015625, "learning_rate": 0.0001814213253004365, "loss": 4.6027, "mean_token_accuracy": 0.26172880083322525, "num_tokens": 148307984.0, "step": 64750 }, { "entropy": 5.2145383834838865, "epoch": 6.4012455516014235, "grad_norm": 1.203125, "learning_rate": 0.00018138923346052417, "loss": 4.5867, "mean_token_accuracy": 0.2643603101372719, "num_tokens": 148317727.0, "step": 64755 }, { "entropy": 5.283629131317139, "epoch": 6.401739818109925, "grad_norm": 1.15625, "learning_rate": 0.00018135714392345127, "loss": 4.6605, "mean_token_accuracy": 0.25758894830942153, "num_tokens": 148328157.0, "step": 64760 }, { "entropy": 5.316253995895385, "epoch": 6.402234084618426, "grad_norm": 1.2109375, "learning_rate": 0.0001813250566900071, "loss": 4.6708, "mean_token_accuracy": 0.25643204897642136, "num_tokens": 148339078.0, "step": 64765 }, { "entropy": 5.2981048107147215, "epoch": 6.402728351126927, "grad_norm": 1.1015625, "learning_rate": 0.00018129297176098103, "loss": 4.6131, "mean_token_accuracy": 0.25754823088645934, "num_tokens": 148351277.0, "step": 64770 }, { "entropy": 5.264933681488037, "epoch": 6.403222617635429, "grad_norm": 1.2421875, "learning_rate": 0.00018126088913716242, "loss": 4.6153, "mean_token_accuracy": 0.2509022444486618, "num_tokens": 148362915.0, "step": 64775 }, { "entropy": 5.2936179637908936, "epoch": 6.403716884143931, "grad_norm": 1.171875, "learning_rate": 0.00018122880881934046, "loss": 4.6465, "mean_token_accuracy": 0.2518296167254448, "num_tokens": 148374699.0, "step": 64780 }, { "entropy": 5.214248943328857, "epoch": 6.404211150652432, "grad_norm": 1.140625, "learning_rate": 0.00018119673080830445, "loss": 4.6106, "mean_token_accuracy": 0.26154008209705354, "num_tokens": 148385955.0, "step": 64785 }, { "entropy": 5.2314964771270756, "epoch": 6.404705417160933, "grad_norm": 1.1796875, "learning_rate": 0.0001811646551048433, "loss": 4.6305, "mean_token_accuracy": 0.25835506767034533, "num_tokens": 148396531.0, "step": 64790 }, { "entropy": 5.250784540176392, "epoch": 6.4051996836694345, "grad_norm": 1.21875, "learning_rate": 0.00018113258170974624, "loss": 4.5516, "mean_token_accuracy": 0.26212078481912615, "num_tokens": 148407477.0, "step": 64795 }, { "entropy": 5.286903333663941, "epoch": 6.405693950177936, "grad_norm": 1.1328125, "learning_rate": 0.00018110051062380223, "loss": 4.67, "mean_token_accuracy": 0.2580811813473701, "num_tokens": 148419930.0, "step": 64800 }, { "entropy": 5.239358758926391, "epoch": 6.406188216686437, "grad_norm": 1.171875, "learning_rate": 0.0001810684418478002, "loss": 4.5571, "mean_token_accuracy": 0.25867884010076525, "num_tokens": 148430935.0, "step": 64805 }, { "entropy": 5.282095623016358, "epoch": 6.406682483194938, "grad_norm": 1.0703125, "learning_rate": 0.00018103637538252916, "loss": 4.6103, "mean_token_accuracy": 0.2562751203775406, "num_tokens": 148443672.0, "step": 64810 }, { "entropy": 5.316033887863159, "epoch": 6.40717674970344, "grad_norm": 1.3125, "learning_rate": 0.00018100431122877782, "loss": 4.7405, "mean_token_accuracy": 0.24580034017562866, "num_tokens": 148453774.0, "step": 64815 }, { "entropy": 5.386725950241089, "epoch": 6.407671016211942, "grad_norm": 1.1875, "learning_rate": 0.00018097224938733498, "loss": 4.7222, "mean_token_accuracy": 0.24614698737859725, "num_tokens": 148465621.0, "step": 64820 }, { "entropy": 5.30543098449707, "epoch": 6.408165282720443, "grad_norm": 1.2421875, "learning_rate": 0.00018094018985898936, "loss": 4.6137, "mean_token_accuracy": 0.2629135429859161, "num_tokens": 148476993.0, "step": 64825 }, { "entropy": 5.396375131607056, "epoch": 6.408659549228944, "grad_norm": 1.15625, "learning_rate": 0.00018090813264452966, "loss": 4.7625, "mean_token_accuracy": 0.25013985484838486, "num_tokens": 148488996.0, "step": 64830 }, { "entropy": 5.281646585464477, "epoch": 6.4091538157374455, "grad_norm": 1.1015625, "learning_rate": 0.00018087607774474462, "loss": 4.625, "mean_token_accuracy": 0.25223237574100493, "num_tokens": 148499717.0, "step": 64835 }, { "entropy": 5.206545972824097, "epoch": 6.409648082245947, "grad_norm": 1.1484375, "learning_rate": 0.0001808440251604226, "loss": 4.6157, "mean_token_accuracy": 0.2663197323679924, "num_tokens": 148510841.0, "step": 64840 }, { "entropy": 5.22600793838501, "epoch": 6.410142348754448, "grad_norm": 1.1328125, "learning_rate": 0.00018081197489235214, "loss": 4.6111, "mean_token_accuracy": 0.260403023660183, "num_tokens": 148522277.0, "step": 64845 }, { "entropy": 5.198961067199707, "epoch": 6.41063661526295, "grad_norm": 1.109375, "learning_rate": 0.0001807799269413218, "loss": 4.5882, "mean_token_accuracy": 0.2633983254432678, "num_tokens": 148534052.0, "step": 64850 }, { "entropy": 5.240287590026855, "epoch": 6.411130881771451, "grad_norm": 1.1484375, "learning_rate": 0.00018074788130811965, "loss": 4.5933, "mean_token_accuracy": 0.26107064783573153, "num_tokens": 148545512.0, "step": 64855 }, { "entropy": 5.22231240272522, "epoch": 6.411625148279953, "grad_norm": 1.265625, "learning_rate": 0.00018071583799353447, "loss": 4.5424, "mean_token_accuracy": 0.2648379608988762, "num_tokens": 148556457.0, "step": 64860 }, { "entropy": 5.306633186340332, "epoch": 6.412119414788454, "grad_norm": 1.109375, "learning_rate": 0.0001806837969983542, "loss": 4.6593, "mean_token_accuracy": 0.25556961745023726, "num_tokens": 148567222.0, "step": 64865 }, { "entropy": 5.199706983566284, "epoch": 6.412613681296955, "grad_norm": 1.109375, "learning_rate": 0.00018065175832336717, "loss": 4.5882, "mean_token_accuracy": 0.26219354271888734, "num_tokens": 148579519.0, "step": 64870 }, { "entropy": 5.258410358428955, "epoch": 6.4131079478054565, "grad_norm": 1.125, "learning_rate": 0.00018061972196936155, "loss": 4.6125, "mean_token_accuracy": 0.2593932017683983, "num_tokens": 148591772.0, "step": 64875 }, { "entropy": 5.289685297012329, "epoch": 6.413602214313958, "grad_norm": 1.1875, "learning_rate": 0.00018058768793712543, "loss": 4.6949, "mean_token_accuracy": 0.2524294897913933, "num_tokens": 148605045.0, "step": 64880 }, { "entropy": 5.289934206008911, "epoch": 6.41409648082246, "grad_norm": 1.1484375, "learning_rate": 0.00018055565622744675, "loss": 4.659, "mean_token_accuracy": 0.24892620295286177, "num_tokens": 148617385.0, "step": 64885 }, { "entropy": 5.314442157745361, "epoch": 6.414590747330961, "grad_norm": 1.1796875, "learning_rate": 0.0001805236268411136, "loss": 4.629, "mean_token_accuracy": 0.2530303105711937, "num_tokens": 148628352.0, "step": 64890 }, { "entropy": 5.280125474929809, "epoch": 6.415085013839462, "grad_norm": 1.21875, "learning_rate": 0.0001804915997789139, "loss": 4.6152, "mean_token_accuracy": 0.2586047425866127, "num_tokens": 148639381.0, "step": 64895 }, { "entropy": 5.198141813278198, "epoch": 6.415579280347964, "grad_norm": 1.1171875, "learning_rate": 0.00018045957504163557, "loss": 4.5254, "mean_token_accuracy": 0.2626090466976166, "num_tokens": 148650958.0, "step": 64900 }, { "entropy": 5.248164081573487, "epoch": 6.416073546856465, "grad_norm": 1.203125, "learning_rate": 0.00018042755263006631, "loss": 4.7016, "mean_token_accuracy": 0.24846615940332412, "num_tokens": 148663245.0, "step": 64905 }, { "entropy": 5.214208936691284, "epoch": 6.416567813364966, "grad_norm": 1.2578125, "learning_rate": 0.0001803955325449939, "loss": 4.5545, "mean_token_accuracy": 0.26461650282144544, "num_tokens": 148674122.0, "step": 64910 }, { "entropy": 5.233008098602295, "epoch": 6.417062079873467, "grad_norm": 1.171875, "learning_rate": 0.00018036351478720603, "loss": 4.5876, "mean_token_accuracy": 0.2634698212146759, "num_tokens": 148685297.0, "step": 64915 }, { "entropy": 5.339017868041992, "epoch": 6.41755634638197, "grad_norm": 1.3515625, "learning_rate": 0.00018033149935749044, "loss": 4.6733, "mean_token_accuracy": 0.258177150785923, "num_tokens": 148696227.0, "step": 64920 }, { "entropy": 5.29752106666565, "epoch": 6.418050612890471, "grad_norm": 1.1796875, "learning_rate": 0.00018029948625663473, "loss": 4.6312, "mean_token_accuracy": 0.2576243504881859, "num_tokens": 148708176.0, "step": 64925 }, { "entropy": 5.240865468978882, "epoch": 6.418544879398972, "grad_norm": 1.140625, "learning_rate": 0.00018026747548542627, "loss": 4.6353, "mean_token_accuracy": 0.25254262536764144, "num_tokens": 148719036.0, "step": 64930 }, { "entropy": 5.276210069656372, "epoch": 6.419039145907473, "grad_norm": 1.1640625, "learning_rate": 0.00018023546704465254, "loss": 4.6451, "mean_token_accuracy": 0.2602316290140152, "num_tokens": 148731483.0, "step": 64935 }, { "entropy": 5.2700310230255125, "epoch": 6.419533412415975, "grad_norm": 1.0390625, "learning_rate": 0.0001802034609351012, "loss": 4.644, "mean_token_accuracy": 0.26041896641254425, "num_tokens": 148744202.0, "step": 64940 }, { "entropy": 5.296422910690308, "epoch": 6.420027678924476, "grad_norm": 1.296875, "learning_rate": 0.00018017145715755922, "loss": 4.6671, "mean_token_accuracy": 0.2538747310638428, "num_tokens": 148755486.0, "step": 64945 }, { "entropy": 5.311098337173462, "epoch": 6.420521945432977, "grad_norm": 1.0234375, "learning_rate": 0.00018013945571281425, "loss": 4.7151, "mean_token_accuracy": 0.25065519511699674, "num_tokens": 148769836.0, "step": 64950 }, { "entropy": 5.267784976959229, "epoch": 6.421016211941479, "grad_norm": 1.15625, "learning_rate": 0.00018010745660165334, "loss": 4.6167, "mean_token_accuracy": 0.254759381711483, "num_tokens": 148781050.0, "step": 64955 }, { "entropy": 5.280110692977905, "epoch": 6.421510478449981, "grad_norm": 1.1484375, "learning_rate": 0.00018007545982486368, "loss": 4.6287, "mean_token_accuracy": 0.26953560411930083, "num_tokens": 148791773.0, "step": 64960 }, { "entropy": 5.282128047943115, "epoch": 6.422004744958482, "grad_norm": 1.15625, "learning_rate": 0.00018004346538323259, "loss": 4.6245, "mean_token_accuracy": 0.2581208825111389, "num_tokens": 148803590.0, "step": 64965 }, { "entropy": 5.339776802062988, "epoch": 6.422499011466983, "grad_norm": 1.1875, "learning_rate": 0.00018001147327754673, "loss": 4.7075, "mean_token_accuracy": 0.24613450914621354, "num_tokens": 148816601.0, "step": 64970 }, { "entropy": 5.229752254486084, "epoch": 6.422993277975484, "grad_norm": 1.1796875, "learning_rate": 0.00017997948350859355, "loss": 4.6087, "mean_token_accuracy": 0.25811278373003005, "num_tokens": 148828955.0, "step": 64975 }, { "entropy": 5.309895324707031, "epoch": 6.423487544483986, "grad_norm": 1.140625, "learning_rate": 0.00017994749607715976, "loss": 4.6148, "mean_token_accuracy": 0.25304964929819107, "num_tokens": 148839441.0, "step": 64980 }, { "entropy": 5.292787265777588, "epoch": 6.423981810992487, "grad_norm": 1.2265625, "learning_rate": 0.0001799155109840323, "loss": 4.6589, "mean_token_accuracy": 0.25583387464284896, "num_tokens": 148850035.0, "step": 64985 }, { "entropy": 5.266998624801635, "epoch": 6.424476077500988, "grad_norm": 1.0390625, "learning_rate": 0.00017988352822999814, "loss": 4.6261, "mean_token_accuracy": 0.2573929101228714, "num_tokens": 148862377.0, "step": 64990 }, { "entropy": 5.261972093582154, "epoch": 6.42497034400949, "grad_norm": 1.0546875, "learning_rate": 0.0001798515478158438, "loss": 4.6427, "mean_token_accuracy": 0.26126480996608736, "num_tokens": 148874414.0, "step": 64995 }, { "entropy": 5.257567739486694, "epoch": 6.425464610517992, "grad_norm": 1.09375, "learning_rate": 0.00017981956974235614, "loss": 4.6672, "mean_token_accuracy": 0.2575865238904953, "num_tokens": 148886777.0, "step": 65000 }, { "entropy": 5.201216506958008, "epoch": 6.425958877026493, "grad_norm": 1.234375, "learning_rate": 0.0001797875940103219, "loss": 4.5554, "mean_token_accuracy": 0.26660707741975787, "num_tokens": 148897471.0, "step": 65005 }, { "entropy": 5.2233460426330565, "epoch": 6.426453143534994, "grad_norm": 1.1953125, "learning_rate": 0.00017975562062052757, "loss": 4.6222, "mean_token_accuracy": 0.25491098016500474, "num_tokens": 148909257.0, "step": 65010 }, { "entropy": 5.25065131187439, "epoch": 6.426947410043495, "grad_norm": 1.2890625, "learning_rate": 0.0001797236495737598, "loss": 4.6007, "mean_token_accuracy": 0.2546653226017952, "num_tokens": 148920640.0, "step": 65015 }, { "entropy": 5.232088088989258, "epoch": 6.427441676551997, "grad_norm": 1.140625, "learning_rate": 0.00017969168087080502, "loss": 4.566, "mean_token_accuracy": 0.26086983233690264, "num_tokens": 148932278.0, "step": 65020 }, { "entropy": 5.173021650314331, "epoch": 6.427935943060498, "grad_norm": 1.2734375, "learning_rate": 0.00017965971451244973, "loss": 4.5615, "mean_token_accuracy": 0.2676210343837738, "num_tokens": 148943719.0, "step": 65025 }, { "entropy": 5.272871637344361, "epoch": 6.428430209569, "grad_norm": 1.1796875, "learning_rate": 0.00017962775049948005, "loss": 4.6266, "mean_token_accuracy": 0.25373870581388475, "num_tokens": 148954916.0, "step": 65030 }, { "entropy": 5.294391107559204, "epoch": 6.428924476077501, "grad_norm": 1.1796875, "learning_rate": 0.00017959578883268264, "loss": 4.6682, "mean_token_accuracy": 0.25187097042798995, "num_tokens": 148966695.0, "step": 65035 }, { "entropy": 5.27433180809021, "epoch": 6.4294187425860025, "grad_norm": 1.1171875, "learning_rate": 0.0001795638295128437, "loss": 4.6609, "mean_token_accuracy": 0.2574670404195786, "num_tokens": 148979015.0, "step": 65040 }, { "entropy": 5.2909965991973875, "epoch": 6.429913009094504, "grad_norm": 1.2578125, "learning_rate": 0.00017953187254074926, "loss": 4.6006, "mean_token_accuracy": 0.2626977160573006, "num_tokens": 148989925.0, "step": 65045 }, { "entropy": 5.243914937973022, "epoch": 6.430407275603005, "grad_norm": 1.2109375, "learning_rate": 0.00017949991791718569, "loss": 4.5759, "mean_token_accuracy": 0.26417756974697115, "num_tokens": 148999457.0, "step": 65050 }, { "entropy": 5.22777943611145, "epoch": 6.430901542111506, "grad_norm": 1.0234375, "learning_rate": 0.00017946796564293881, "loss": 4.5577, "mean_token_accuracy": 0.2639399379491806, "num_tokens": 149011266.0, "step": 65055 }, { "entropy": 5.30032787322998, "epoch": 6.431395808620008, "grad_norm": 1.140625, "learning_rate": 0.0001794360157187947, "loss": 4.6856, "mean_token_accuracy": 0.26097241789102554, "num_tokens": 149022592.0, "step": 65060 }, { "entropy": 5.27249755859375, "epoch": 6.431890075128509, "grad_norm": 1.125, "learning_rate": 0.00017940406814553967, "loss": 4.6953, "mean_token_accuracy": 0.2512237370014191, "num_tokens": 149034173.0, "step": 65065 }, { "entropy": 5.284873676300049, "epoch": 6.432384341637011, "grad_norm": 1.2109375, "learning_rate": 0.00017937212292395928, "loss": 4.6745, "mean_token_accuracy": 0.25227820724248884, "num_tokens": 149045786.0, "step": 65070 }, { "entropy": 5.256215381622314, "epoch": 6.432878608145512, "grad_norm": 1.1796875, "learning_rate": 0.0001793401800548396, "loss": 4.6043, "mean_token_accuracy": 0.2553678140044212, "num_tokens": 149057427.0, "step": 65075 }, { "entropy": 5.33579158782959, "epoch": 6.4333728746540135, "grad_norm": 1.078125, "learning_rate": 0.0001793082395389662, "loss": 4.7167, "mean_token_accuracy": 0.24904377460479737, "num_tokens": 149067985.0, "step": 65080 }, { "entropy": 5.281973218917846, "epoch": 6.433867141162515, "grad_norm": 1.234375, "learning_rate": 0.00017927630137712497, "loss": 4.6196, "mean_token_accuracy": 0.2554525300860405, "num_tokens": 149080273.0, "step": 65085 }, { "entropy": 5.2826247215271, "epoch": 6.434361407671016, "grad_norm": 1.2265625, "learning_rate": 0.0001792443655701016, "loss": 4.6468, "mean_token_accuracy": 0.2557353377342224, "num_tokens": 149092633.0, "step": 65090 }, { "entropy": 5.22400484085083, "epoch": 6.434855674179517, "grad_norm": 1.1484375, "learning_rate": 0.00017921243211868165, "loss": 4.6396, "mean_token_accuracy": 0.2630337819457054, "num_tokens": 149103666.0, "step": 65095 }, { "entropy": 5.214694690704346, "epoch": 6.435349940688019, "grad_norm": 1.1875, "learning_rate": 0.0001791805010236509, "loss": 4.5559, "mean_token_accuracy": 0.2617817670106888, "num_tokens": 149114677.0, "step": 65100 }, { "entropy": 5.245944595336914, "epoch": 6.435844207196521, "grad_norm": 1.15625, "learning_rate": 0.0001791485722857945, "loss": 4.6423, "mean_token_accuracy": 0.2621185079216957, "num_tokens": 149125050.0, "step": 65105 }, { "entropy": 5.224955606460571, "epoch": 6.436338473705022, "grad_norm": 1.15625, "learning_rate": 0.00017911664590589815, "loss": 4.6189, "mean_token_accuracy": 0.26099276840686797, "num_tokens": 149136080.0, "step": 65110 }, { "entropy": 5.270728588104248, "epoch": 6.436832740213523, "grad_norm": 1.1015625, "learning_rate": 0.00017908472188474727, "loss": 4.5919, "mean_token_accuracy": 0.2663831949234009, "num_tokens": 149148241.0, "step": 65115 }, { "entropy": 5.33920316696167, "epoch": 6.4373270067220245, "grad_norm": 1.390625, "learning_rate": 0.00017905280022312693, "loss": 4.6924, "mean_token_accuracy": 0.245897476375103, "num_tokens": 149158512.0, "step": 65120 }, { "entropy": 5.248867654800415, "epoch": 6.437821273230526, "grad_norm": 1.1953125, "learning_rate": 0.00017902088092182277, "loss": 4.6282, "mean_token_accuracy": 0.2532737523317337, "num_tokens": 149170764.0, "step": 65125 }, { "entropy": 5.235356950759888, "epoch": 6.438315539739027, "grad_norm": 1.0703125, "learning_rate": 0.00017898896398161972, "loss": 4.6305, "mean_token_accuracy": 0.25755092948675157, "num_tokens": 149182766.0, "step": 65130 }, { "entropy": 5.113169622421265, "epoch": 6.438809806247528, "grad_norm": 1.28125, "learning_rate": 0.00017895704940330305, "loss": 4.4462, "mean_token_accuracy": 0.2779096096754074, "num_tokens": 149193190.0, "step": 65135 }, { "entropy": 5.285001468658447, "epoch": 6.4393040727560305, "grad_norm": 1.234375, "learning_rate": 0.00017892513718765796, "loss": 4.6247, "mean_token_accuracy": 0.2564979910850525, "num_tokens": 149203394.0, "step": 65140 }, { "entropy": 5.370683193206787, "epoch": 6.439798339264532, "grad_norm": 1.1328125, "learning_rate": 0.00017889322733546925, "loss": 4.7095, "mean_token_accuracy": 0.24931081235408784, "num_tokens": 149214252.0, "step": 65145 }, { "entropy": 5.254541397094727, "epoch": 6.440292605773033, "grad_norm": 1.0703125, "learning_rate": 0.00017886131984752224, "loss": 4.6345, "mean_token_accuracy": 0.26066380739212036, "num_tokens": 149226020.0, "step": 65150 }, { "entropy": 5.231151962280274, "epoch": 6.440786872281534, "grad_norm": 1.21875, "learning_rate": 0.00017882941472460156, "loss": 4.5979, "mean_token_accuracy": 0.2652933716773987, "num_tokens": 149236350.0, "step": 65155 }, { "entropy": 5.293511629104614, "epoch": 6.4412811387900355, "grad_norm": 1.09375, "learning_rate": 0.00017879751196749223, "loss": 4.6959, "mean_token_accuracy": 0.2505694806575775, "num_tokens": 149249122.0, "step": 65160 }, { "entropy": 5.211457252502441, "epoch": 6.441775405298537, "grad_norm": 1.265625, "learning_rate": 0.00017876561157697908, "loss": 4.6436, "mean_token_accuracy": 0.25968390256166457, "num_tokens": 149259749.0, "step": 65165 }, { "entropy": 5.264394283294678, "epoch": 6.442269671807038, "grad_norm": 1.1015625, "learning_rate": 0.00017873371355384672, "loss": 4.6379, "mean_token_accuracy": 0.25699178874492645, "num_tokens": 149270773.0, "step": 65170 }, { "entropy": 5.381973838806152, "epoch": 6.44276393831554, "grad_norm": 1.203125, "learning_rate": 0.00017870181789887997, "loss": 4.7211, "mean_token_accuracy": 0.24969478994607924, "num_tokens": 149282994.0, "step": 65175 }, { "entropy": 5.324275541305542, "epoch": 6.443258204824041, "grad_norm": 1.1796875, "learning_rate": 0.0001786699246128634, "loss": 4.6281, "mean_token_accuracy": 0.2687869071960449, "num_tokens": 149293803.0, "step": 65180 }, { "entropy": 5.3057585716247555, "epoch": 6.443752471332543, "grad_norm": 1.1484375, "learning_rate": 0.00017863803369658166, "loss": 4.6624, "mean_token_accuracy": 0.25772174447774887, "num_tokens": 149306947.0, "step": 65185 }, { "entropy": 5.271940040588379, "epoch": 6.444246737841044, "grad_norm": 1.0234375, "learning_rate": 0.0001786061451508193, "loss": 4.7182, "mean_token_accuracy": 0.25376108586788176, "num_tokens": 149319087.0, "step": 65190 }, { "entropy": 5.299091339111328, "epoch": 6.444741004349545, "grad_norm": 1.2421875, "learning_rate": 0.0001785742589763607, "loss": 4.6347, "mean_token_accuracy": 0.26011431515216826, "num_tokens": 149329679.0, "step": 65195 }, { "entropy": 5.201095962524414, "epoch": 6.4452352708580465, "grad_norm": 1.0703125, "learning_rate": 0.0001785423751739902, "loss": 4.551, "mean_token_accuracy": 0.257270859181881, "num_tokens": 149341202.0, "step": 65200 }, { "entropy": 5.275588941574097, "epoch": 6.445729537366548, "grad_norm": 1.1484375, "learning_rate": 0.0001785104937444923, "loss": 4.6339, "mean_token_accuracy": 0.26255287528038024, "num_tokens": 149353386.0, "step": 65205 }, { "entropy": 5.23087158203125, "epoch": 6.44622380387505, "grad_norm": 1.0625, "learning_rate": 0.00017847861468865117, "loss": 4.5905, "mean_token_accuracy": 0.26074498146772385, "num_tokens": 149365155.0, "step": 65210 }, { "entropy": 5.1889551162719725, "epoch": 6.446718070383551, "grad_norm": 1.203125, "learning_rate": 0.00017844673800725125, "loss": 4.6134, "mean_token_accuracy": 0.2611344248056412, "num_tokens": 149376416.0, "step": 65215 }, { "entropy": 5.2887654304504395, "epoch": 6.447212336892052, "grad_norm": 1.171875, "learning_rate": 0.00017841486370107646, "loss": 4.7311, "mean_token_accuracy": 0.24867397248744966, "num_tokens": 149388468.0, "step": 65220 }, { "entropy": 5.248929214477539, "epoch": 6.447706603400554, "grad_norm": 1.203125, "learning_rate": 0.00017838299177091093, "loss": 4.5821, "mean_token_accuracy": 0.26320150047540664, "num_tokens": 149399544.0, "step": 65225 }, { "entropy": 5.293735790252685, "epoch": 6.448200869909055, "grad_norm": 1.125, "learning_rate": 0.00017835112221753897, "loss": 4.5668, "mean_token_accuracy": 0.26040621250867846, "num_tokens": 149409496.0, "step": 65230 }, { "entropy": 5.280859184265137, "epoch": 6.448695136417556, "grad_norm": 1.171875, "learning_rate": 0.00017831925504174418, "loss": 4.6094, "mean_token_accuracy": 0.2587698847055435, "num_tokens": 149421153.0, "step": 65235 }, { "entropy": 5.312907934188843, "epoch": 6.4491894029260575, "grad_norm": 1.2265625, "learning_rate": 0.0001782873902443109, "loss": 4.7131, "mean_token_accuracy": 0.2441953867673874, "num_tokens": 149433026.0, "step": 65240 }, { "entropy": 5.24153504371643, "epoch": 6.449683669434559, "grad_norm": 1.1875, "learning_rate": 0.0001782555278260227, "loss": 4.5738, "mean_token_accuracy": 0.25845810025930405, "num_tokens": 149443910.0, "step": 65245 }, { "entropy": 5.267902565002442, "epoch": 6.450177935943061, "grad_norm": 1.2578125, "learning_rate": 0.00017822366778766358, "loss": 4.6346, "mean_token_accuracy": 0.26383725851774215, "num_tokens": 149453935.0, "step": 65250 }, { "entropy": 5.256795597076416, "epoch": 6.450672202451562, "grad_norm": 1.140625, "learning_rate": 0.00017819181013001729, "loss": 4.6329, "mean_token_accuracy": 0.2619438380002975, "num_tokens": 149465947.0, "step": 65255 }, { "entropy": 5.319718313217163, "epoch": 6.451166468960063, "grad_norm": 1.2109375, "learning_rate": 0.0001781599548538674, "loss": 4.6459, "mean_token_accuracy": 0.2527908802032471, "num_tokens": 149477415.0, "step": 65260 }, { "entropy": 5.165043544769287, "epoch": 6.451660735468565, "grad_norm": 1.171875, "learning_rate": 0.00017812810195999768, "loss": 4.4748, "mean_token_accuracy": 0.2750291958451271, "num_tokens": 149487723.0, "step": 65265 }, { "entropy": 5.267991638183593, "epoch": 6.452155001977066, "grad_norm": 1.140625, "learning_rate": 0.0001780962514491916, "loss": 4.6838, "mean_token_accuracy": 0.25573107600212097, "num_tokens": 149501037.0, "step": 65270 }, { "entropy": 5.268149948120117, "epoch": 6.452649268485567, "grad_norm": 1.15625, "learning_rate": 0.0001780644033222329, "loss": 4.6871, "mean_token_accuracy": 0.24586208462715148, "num_tokens": 149513857.0, "step": 65275 }, { "entropy": 5.178572750091552, "epoch": 6.4531435349940685, "grad_norm": 1.25, "learning_rate": 0.0001780325575799049, "loss": 4.5674, "mean_token_accuracy": 0.2674030676484108, "num_tokens": 149524508.0, "step": 65280 }, { "entropy": 5.274657154083252, "epoch": 6.45363780150257, "grad_norm": 1.125, "learning_rate": 0.00017800071422299096, "loss": 4.607, "mean_token_accuracy": 0.2624488025903702, "num_tokens": 149536582.0, "step": 65285 }, { "entropy": 5.323853254318237, "epoch": 6.454132068011072, "grad_norm": 1.0703125, "learning_rate": 0.0001779688732522745, "loss": 4.6499, "mean_token_accuracy": 0.2503499031066895, "num_tokens": 149547784.0, "step": 65290 }, { "entropy": 5.3175310611724855, "epoch": 6.454626334519573, "grad_norm": 1.171875, "learning_rate": 0.00017793703466853882, "loss": 4.6739, "mean_token_accuracy": 0.2572712987661362, "num_tokens": 149559814.0, "step": 65295 }, { "entropy": 5.324716520309448, "epoch": 6.455120601028074, "grad_norm": 1.140625, "learning_rate": 0.00017790519847256714, "loss": 4.7143, "mean_token_accuracy": 0.24909953027963638, "num_tokens": 149571416.0, "step": 65300 }, { "entropy": 5.260376787185669, "epoch": 6.455614867536576, "grad_norm": 1.0859375, "learning_rate": 0.00017787336466514275, "loss": 4.5658, "mean_token_accuracy": 0.26299417316913604, "num_tokens": 149582583.0, "step": 65305 }, { "entropy": 5.29218807220459, "epoch": 6.456109134045077, "grad_norm": 1.2578125, "learning_rate": 0.00017784153324704855, "loss": 4.7137, "mean_token_accuracy": 0.25089719593524934, "num_tokens": 149595032.0, "step": 65310 }, { "entropy": 5.300360441207886, "epoch": 6.456603400553578, "grad_norm": 1.1953125, "learning_rate": 0.00017780970421906768, "loss": 4.7352, "mean_token_accuracy": 0.24553539454936982, "num_tokens": 149606566.0, "step": 65315 }, { "entropy": 5.297990226745606, "epoch": 6.457097667062079, "grad_norm": 1.2265625, "learning_rate": 0.00017777787758198321, "loss": 4.6231, "mean_token_accuracy": 0.2569347068667412, "num_tokens": 149616693.0, "step": 65320 }, { "entropy": 5.298418474197388, "epoch": 6.457591933570582, "grad_norm": 1.1171875, "learning_rate": 0.000177746053336578, "loss": 4.6794, "mean_token_accuracy": 0.25892097800970076, "num_tokens": 149630096.0, "step": 65325 }, { "entropy": 5.295390319824219, "epoch": 6.458086200079083, "grad_norm": 1.3046875, "learning_rate": 0.0001777142314836351, "loss": 4.6624, "mean_token_accuracy": 0.25877455770969393, "num_tokens": 149640720.0, "step": 65330 }, { "entropy": 5.294517707824707, "epoch": 6.458580466587584, "grad_norm": 1.1875, "learning_rate": 0.0001776824120239371, "loss": 4.7253, "mean_token_accuracy": 0.25125821232795714, "num_tokens": 149652122.0, "step": 65335 }, { "entropy": 5.269295501708984, "epoch": 6.459074733096085, "grad_norm": 1.125, "learning_rate": 0.0001776505949582668, "loss": 4.6449, "mean_token_accuracy": 0.2573235109448433, "num_tokens": 149664457.0, "step": 65340 }, { "entropy": 5.365215682983399, "epoch": 6.459568999604587, "grad_norm": 1.1015625, "learning_rate": 0.00017761878028740708, "loss": 4.742, "mean_token_accuracy": 0.24347399771213532, "num_tokens": 149676252.0, "step": 65345 }, { "entropy": 5.270072555541992, "epoch": 6.460063266113088, "grad_norm": 1.0859375, "learning_rate": 0.0001775869680121403, "loss": 4.6, "mean_token_accuracy": 0.2618991702795029, "num_tokens": 149687898.0, "step": 65350 }, { "entropy": 5.302320098876953, "epoch": 6.460557532621589, "grad_norm": 1.0859375, "learning_rate": 0.00017755515813324947, "loss": 4.67, "mean_token_accuracy": 0.24942391216754914, "num_tokens": 149699940.0, "step": 65355 }, { "entropy": 5.321295261383057, "epoch": 6.461051799130091, "grad_norm": 1.2109375, "learning_rate": 0.0001775233506515167, "loss": 4.6857, "mean_token_accuracy": 0.25467064678668977, "num_tokens": 149713168.0, "step": 65360 }, { "entropy": 5.216805171966553, "epoch": 6.461546065638593, "grad_norm": 1.1328125, "learning_rate": 0.00017749154556772462, "loss": 4.5853, "mean_token_accuracy": 0.2608941212296486, "num_tokens": 149725200.0, "step": 65365 }, { "entropy": 5.236462593078613, "epoch": 6.462040332147094, "grad_norm": 1.2109375, "learning_rate": 0.00017745974288265576, "loss": 4.5787, "mean_token_accuracy": 0.2649705335497856, "num_tokens": 149736820.0, "step": 65370 }, { "entropy": 5.268098545074463, "epoch": 6.462534598655595, "grad_norm": 1.171875, "learning_rate": 0.00017742794259709228, "loss": 4.6073, "mean_token_accuracy": 0.2557699218392372, "num_tokens": 149747318.0, "step": 65375 }, { "entropy": 5.280847501754761, "epoch": 6.463028865164096, "grad_norm": 1.21875, "learning_rate": 0.00017739614471181653, "loss": 4.6052, "mean_token_accuracy": 0.25980456471443175, "num_tokens": 149757804.0, "step": 65380 }, { "entropy": 5.257609701156616, "epoch": 6.463523131672598, "grad_norm": 1.1328125, "learning_rate": 0.00017736434922761076, "loss": 4.6646, "mean_token_accuracy": 0.2535904198884964, "num_tokens": 149768488.0, "step": 65385 }, { "entropy": 5.282145690917969, "epoch": 6.464017398181099, "grad_norm": 1.296875, "learning_rate": 0.00017733255614525717, "loss": 4.6391, "mean_token_accuracy": 0.25767978876829145, "num_tokens": 149779291.0, "step": 65390 }, { "entropy": 5.29047908782959, "epoch": 6.464511664689601, "grad_norm": 1.1484375, "learning_rate": 0.0001773007654655379, "loss": 4.6523, "mean_token_accuracy": 0.24841434508562088, "num_tokens": 149791315.0, "step": 65395 }, { "entropy": 5.2672014236450195, "epoch": 6.465005931198102, "grad_norm": 1.109375, "learning_rate": 0.00017726897718923484, "loss": 4.6285, "mean_token_accuracy": 0.2548728346824646, "num_tokens": 149803367.0, "step": 65400 }, { "entropy": 5.193950033187866, "epoch": 6.465500197706604, "grad_norm": 1.2734375, "learning_rate": 0.00017723719131713017, "loss": 4.5364, "mean_token_accuracy": 0.26969036012887954, "num_tokens": 149813804.0, "step": 65405 }, { "entropy": 5.24654188156128, "epoch": 6.465994464215105, "grad_norm": 1.234375, "learning_rate": 0.00017720540785000572, "loss": 4.5828, "mean_token_accuracy": 0.26130860596895217, "num_tokens": 149824078.0, "step": 65410 }, { "entropy": 5.3559098720550535, "epoch": 6.466488730723606, "grad_norm": 1.2265625, "learning_rate": 0.00017717362678864345, "loss": 4.6953, "mean_token_accuracy": 0.2502946525812149, "num_tokens": 149835887.0, "step": 65415 }, { "entropy": 5.335286855697632, "epoch": 6.466982997232107, "grad_norm": 1.0703125, "learning_rate": 0.00017714184813382523, "loss": 4.7096, "mean_token_accuracy": 0.25808675587177277, "num_tokens": 149847403.0, "step": 65420 }, { "entropy": 5.170496416091919, "epoch": 6.467477263740609, "grad_norm": 1.1953125, "learning_rate": 0.0001771100718863326, "loss": 4.4724, "mean_token_accuracy": 0.27170020192861555, "num_tokens": 149857732.0, "step": 65425 }, { "entropy": 5.261399459838867, "epoch": 6.467971530249111, "grad_norm": 1.09375, "learning_rate": 0.00017707829804694742, "loss": 4.6327, "mean_token_accuracy": 0.2588344141840935, "num_tokens": 149867340.0, "step": 65430 }, { "entropy": 5.236028432846069, "epoch": 6.468465796757612, "grad_norm": 1.28125, "learning_rate": 0.00017704652661645139, "loss": 4.5953, "mean_token_accuracy": 0.26170487999916076, "num_tokens": 149878035.0, "step": 65435 }, { "entropy": 5.212064123153686, "epoch": 6.468960063266113, "grad_norm": 1.3125, "learning_rate": 0.00017701475759562574, "loss": 4.5848, "mean_token_accuracy": 0.25824393182992933, "num_tokens": 149889464.0, "step": 65440 }, { "entropy": 5.215967082977295, "epoch": 6.4694543297746145, "grad_norm": 1.203125, "learning_rate": 0.0001769829909852525, "loss": 4.5612, "mean_token_accuracy": 0.2609338715672493, "num_tokens": 149899991.0, "step": 65445 }, { "entropy": 5.249941825866699, "epoch": 6.469948596283116, "grad_norm": 1.171875, "learning_rate": 0.00017695122678611282, "loss": 4.5881, "mean_token_accuracy": 0.26000633239746096, "num_tokens": 149912373.0, "step": 65450 }, { "entropy": 5.350962924957275, "epoch": 6.470442862791617, "grad_norm": 1.2421875, "learning_rate": 0.00017691946499898814, "loss": 4.7623, "mean_token_accuracy": 0.250967338681221, "num_tokens": 149922444.0, "step": 65455 }, { "entropy": 5.3051636695861815, "epoch": 6.470937129300118, "grad_norm": 1.265625, "learning_rate": 0.00017688770562465994, "loss": 4.639, "mean_token_accuracy": 0.2561936050653458, "num_tokens": 149935582.0, "step": 65460 }, { "entropy": 5.33762674331665, "epoch": 6.4714313958086205, "grad_norm": 1.2421875, "learning_rate": 0.0001768559486639092, "loss": 4.6863, "mean_token_accuracy": 0.2571330890059471, "num_tokens": 149946544.0, "step": 65465 }, { "entropy": 5.245130825042724, "epoch": 6.471925662317122, "grad_norm": 1.15625, "learning_rate": 0.00017682419411751754, "loss": 4.5988, "mean_token_accuracy": 0.26432563066482545, "num_tokens": 149958938.0, "step": 65470 }, { "entropy": 5.227194118499756, "epoch": 6.472419928825623, "grad_norm": 1.09375, "learning_rate": 0.00017679244198626586, "loss": 4.5449, "mean_token_accuracy": 0.2643337413668633, "num_tokens": 149970472.0, "step": 65475 }, { "entropy": 5.169352340698242, "epoch": 6.472914195334124, "grad_norm": 1.140625, "learning_rate": 0.00017676069227093533, "loss": 4.5702, "mean_token_accuracy": 0.2595518440008163, "num_tokens": 149983213.0, "step": 65480 }, { "entropy": 5.229552745819092, "epoch": 6.4734084618426255, "grad_norm": 1.1796875, "learning_rate": 0.00017672894497230713, "loss": 4.5486, "mean_token_accuracy": 0.2665260821580887, "num_tokens": 149994380.0, "step": 65485 }, { "entropy": 5.23211259841919, "epoch": 6.473902728351127, "grad_norm": 1.1875, "learning_rate": 0.00017669720009116197, "loss": 4.601, "mean_token_accuracy": 0.25589644014835355, "num_tokens": 150005621.0, "step": 65490 }, { "entropy": 5.204607439041138, "epoch": 6.474396994859628, "grad_norm": 1.171875, "learning_rate": 0.000176665457628281, "loss": 4.5927, "mean_token_accuracy": 0.2672666758298874, "num_tokens": 150016881.0, "step": 65495 }, { "entropy": 5.2457723140716555, "epoch": 6.474891261368129, "grad_norm": 1.3515625, "learning_rate": 0.00017663371758444503, "loss": 4.5924, "mean_token_accuracy": 0.2613268345594406, "num_tokens": 150028670.0, "step": 65500 }, { "entropy": 5.303889894485474, "epoch": 6.4753855278766315, "grad_norm": 1.21875, "learning_rate": 0.00017660197996043482, "loss": 4.688, "mean_token_accuracy": 0.2535209819674492, "num_tokens": 150040685.0, "step": 65505 }, { "entropy": 5.26666579246521, "epoch": 6.475879794385133, "grad_norm": 1.1953125, "learning_rate": 0.00017657024475703132, "loss": 4.6028, "mean_token_accuracy": 0.2546363800764084, "num_tokens": 150052848.0, "step": 65510 }, { "entropy": 5.269637775421143, "epoch": 6.476374060893634, "grad_norm": 1.1484375, "learning_rate": 0.0001765385119750149, "loss": 4.6336, "mean_token_accuracy": 0.25252189487218857, "num_tokens": 150064416.0, "step": 65515 }, { "entropy": 5.315124130249023, "epoch": 6.476868327402135, "grad_norm": 1.21875, "learning_rate": 0.0001765067816151665, "loss": 4.7089, "mean_token_accuracy": 0.2501717507839203, "num_tokens": 150075930.0, "step": 65520 }, { "entropy": 5.2221324920654295, "epoch": 6.4773625939106365, "grad_norm": 1.40625, "learning_rate": 0.0001764750536782664, "loss": 4.5924, "mean_token_accuracy": 0.26452496945858, "num_tokens": 150087076.0, "step": 65525 }, { "entropy": 5.308472728729248, "epoch": 6.477856860419138, "grad_norm": 1.1640625, "learning_rate": 0.00017644332816509528, "loss": 4.6825, "mean_token_accuracy": 0.2483409523963928, "num_tokens": 150098158.0, "step": 65530 }, { "entropy": 5.23818531036377, "epoch": 6.478351126927639, "grad_norm": 1.1640625, "learning_rate": 0.00017641160507643372, "loss": 4.5991, "mean_token_accuracy": 0.2655510470271111, "num_tokens": 150109405.0, "step": 65535 }, { "entropy": 5.250123596191406, "epoch": 6.47884539343614, "grad_norm": 1.171875, "learning_rate": 0.00017637988441306186, "loss": 4.6082, "mean_token_accuracy": 0.2576518848538399, "num_tokens": 150120552.0, "step": 65540 }, { "entropy": 5.227397394180298, "epoch": 6.4793396599446424, "grad_norm": 1.21875, "learning_rate": 0.00017634816617576027, "loss": 4.691, "mean_token_accuracy": 0.2515375018119812, "num_tokens": 150131983.0, "step": 65545 }, { "entropy": 5.224107265472412, "epoch": 6.479833926453144, "grad_norm": 1.2265625, "learning_rate": 0.00017631645036530897, "loss": 4.5898, "mean_token_accuracy": 0.2579546391963959, "num_tokens": 150143539.0, "step": 65550 }, { "entropy": 5.23734335899353, "epoch": 6.480328192961645, "grad_norm": 1.15625, "learning_rate": 0.00017628473698248821, "loss": 4.6038, "mean_token_accuracy": 0.2617782697081566, "num_tokens": 150154239.0, "step": 65555 }, { "entropy": 5.355534410476684, "epoch": 6.480822459470146, "grad_norm": 1.1640625, "learning_rate": 0.00017625302602807842, "loss": 4.7436, "mean_token_accuracy": 0.24696848839521407, "num_tokens": 150165932.0, "step": 65560 }, { "entropy": 5.3331552028656, "epoch": 6.4813167259786475, "grad_norm": 1.2890625, "learning_rate": 0.0001762213175028594, "loss": 4.6722, "mean_token_accuracy": 0.24877893477678298, "num_tokens": 150176259.0, "step": 65565 }, { "entropy": 5.301178121566773, "epoch": 6.481810992487149, "grad_norm": 1.1796875, "learning_rate": 0.0001761896114076114, "loss": 4.5622, "mean_token_accuracy": 0.2683799833059311, "num_tokens": 150187130.0, "step": 65570 }, { "entropy": 5.169373512268066, "epoch": 6.48230525899565, "grad_norm": 1.171875, "learning_rate": 0.00017615790774311418, "loss": 4.4575, "mean_token_accuracy": 0.27487995475530624, "num_tokens": 150198248.0, "step": 65575 }, { "entropy": 5.254518175125122, "epoch": 6.482799525504152, "grad_norm": 1.2265625, "learning_rate": 0.00017612620651014782, "loss": 4.6048, "mean_token_accuracy": 0.2609608143568039, "num_tokens": 150210141.0, "step": 65580 }, { "entropy": 5.163390636444092, "epoch": 6.483293792012653, "grad_norm": 1.125, "learning_rate": 0.00017609450770949208, "loss": 4.5328, "mean_token_accuracy": 0.2636126518249512, "num_tokens": 150221889.0, "step": 65585 }, { "entropy": 5.275729179382324, "epoch": 6.483788058521155, "grad_norm": 1.1328125, "learning_rate": 0.0001760628113419268, "loss": 4.7003, "mean_token_accuracy": 0.25726671814918517, "num_tokens": 150234363.0, "step": 65590 }, { "entropy": 5.2604128360748295, "epoch": 6.484282325029656, "grad_norm": 1.15625, "learning_rate": 0.0001760311174082318, "loss": 4.6534, "mean_token_accuracy": 0.2534149646759033, "num_tokens": 150246389.0, "step": 65595 }, { "entropy": 5.321409463882446, "epoch": 6.484776591538157, "grad_norm": 1.0703125, "learning_rate": 0.00017599942590918656, "loss": 4.6257, "mean_token_accuracy": 0.2627656042575836, "num_tokens": 150259549.0, "step": 65600 }, { "entropy": 5.228473758697509, "epoch": 6.4852708580466585, "grad_norm": 1.2109375, "learning_rate": 0.00017596773684557082, "loss": 4.5632, "mean_token_accuracy": 0.26064191162586214, "num_tokens": 150271324.0, "step": 65605 }, { "entropy": 5.198176670074463, "epoch": 6.48576512455516, "grad_norm": 1.1640625, "learning_rate": 0.00017593605021816412, "loss": 4.5212, "mean_token_accuracy": 0.27142021656036375, "num_tokens": 150282152.0, "step": 65610 }, { "entropy": 5.306416082382202, "epoch": 6.486259391063662, "grad_norm": 1.1640625, "learning_rate": 0.00017590436602774596, "loss": 4.6358, "mean_token_accuracy": 0.2581855162978172, "num_tokens": 150293753.0, "step": 65615 }, { "entropy": 5.267396640777588, "epoch": 6.486753657572163, "grad_norm": 1.2265625, "learning_rate": 0.00017587268427509583, "loss": 4.5896, "mean_token_accuracy": 0.25423765629529954, "num_tokens": 150304945.0, "step": 65620 }, { "entropy": 5.284920597076416, "epoch": 6.487247924080664, "grad_norm": 1.1875, "learning_rate": 0.00017584100496099292, "loss": 4.6371, "mean_token_accuracy": 0.2563817992806435, "num_tokens": 150316853.0, "step": 65625 }, { "entropy": 5.1820464611053465, "epoch": 6.487742190589166, "grad_norm": 1.078125, "learning_rate": 0.00017580932808621675, "loss": 4.5219, "mean_token_accuracy": 0.2771503642201424, "num_tokens": 150328213.0, "step": 65630 }, { "entropy": 5.221623134613037, "epoch": 6.488236457097667, "grad_norm": 1.109375, "learning_rate": 0.00017577765365154658, "loss": 4.5262, "mean_token_accuracy": 0.269749416410923, "num_tokens": 150339253.0, "step": 65635 }, { "entropy": 5.307656145095825, "epoch": 6.488730723606168, "grad_norm": 1.1015625, "learning_rate": 0.00017574598165776128, "loss": 4.7078, "mean_token_accuracy": 0.24957626312971115, "num_tokens": 150352963.0, "step": 65640 }, { "entropy": 5.207482576370239, "epoch": 6.4892249901146695, "grad_norm": 1.2109375, "learning_rate": 0.00017571431210564048, "loss": 4.5356, "mean_token_accuracy": 0.26472183167934416, "num_tokens": 150363475.0, "step": 65645 }, { "entropy": 5.257002973556519, "epoch": 6.489719256623172, "grad_norm": 1.125, "learning_rate": 0.00017568264499596287, "loss": 4.6674, "mean_token_accuracy": 0.2516383916139603, "num_tokens": 150375816.0, "step": 65650 }, { "entropy": 5.220135116577149, "epoch": 6.490213523131673, "grad_norm": 1.2109375, "learning_rate": 0.0001756509803295076, "loss": 4.6145, "mean_token_accuracy": 0.2625983998179436, "num_tokens": 150386809.0, "step": 65655 }, { "entropy": 5.240346050262451, "epoch": 6.490707789640174, "grad_norm": 1.1640625, "learning_rate": 0.00017561931810705373, "loss": 4.5772, "mean_token_accuracy": 0.2654764011502266, "num_tokens": 150399656.0, "step": 65660 }, { "entropy": 5.237858438491822, "epoch": 6.491202056148675, "grad_norm": 1.15625, "learning_rate": 0.00017558765832937994, "loss": 4.5962, "mean_token_accuracy": 0.2617144137620926, "num_tokens": 150412233.0, "step": 65665 }, { "entropy": 5.329995155334473, "epoch": 6.491696322657177, "grad_norm": 1.2734375, "learning_rate": 0.0001755560009972652, "loss": 4.748, "mean_token_accuracy": 0.24735259264707565, "num_tokens": 150423641.0, "step": 65670 }, { "entropy": 5.349399614334106, "epoch": 6.492190589165678, "grad_norm": 1.2265625, "learning_rate": 0.00017552434611148833, "loss": 4.6672, "mean_token_accuracy": 0.25739906430244447, "num_tokens": 150435520.0, "step": 65675 }, { "entropy": 5.264787244796753, "epoch": 6.492684855674179, "grad_norm": 1.1328125, "learning_rate": 0.00017549269367282788, "loss": 4.6432, "mean_token_accuracy": 0.2648255810141563, "num_tokens": 150446567.0, "step": 65680 }, { "entropy": 5.2870903491973875, "epoch": 6.493179122182681, "grad_norm": 1.234375, "learning_rate": 0.00017546104368206273, "loss": 4.604, "mean_token_accuracy": 0.2596291437745094, "num_tokens": 150458092.0, "step": 65685 }, { "entropy": 5.301210021972656, "epoch": 6.493673388691183, "grad_norm": 1.171875, "learning_rate": 0.00017542939613997128, "loss": 4.6585, "mean_token_accuracy": 0.2554126620292664, "num_tokens": 150469159.0, "step": 65690 }, { "entropy": 5.286390352249145, "epoch": 6.494167655199684, "grad_norm": 1.09375, "learning_rate": 0.0001753977510473321, "loss": 4.6966, "mean_token_accuracy": 0.25432477295398714, "num_tokens": 150481279.0, "step": 65695 }, { "entropy": 5.219701957702637, "epoch": 6.494661921708185, "grad_norm": 1.109375, "learning_rate": 0.00017536610840492367, "loss": 4.5278, "mean_token_accuracy": 0.27019589990377424, "num_tokens": 150493135.0, "step": 65700 }, { "entropy": 5.19386248588562, "epoch": 6.495156188216686, "grad_norm": 1.171875, "learning_rate": 0.00017533446821352446, "loss": 4.4767, "mean_token_accuracy": 0.26949691623449323, "num_tokens": 150504143.0, "step": 65705 }, { "entropy": 5.243919754028321, "epoch": 6.495650454725188, "grad_norm": 1.1640625, "learning_rate": 0.00017530283047391287, "loss": 4.6632, "mean_token_accuracy": 0.25417875945568086, "num_tokens": 150516047.0, "step": 65710 }, { "entropy": 5.162918138504028, "epoch": 6.496144721233689, "grad_norm": 1.1640625, "learning_rate": 0.00017527119518686706, "loss": 4.5167, "mean_token_accuracy": 0.2709128499031067, "num_tokens": 150526920.0, "step": 65715 }, { "entropy": 5.212356662750244, "epoch": 6.49663898774219, "grad_norm": 1.2578125, "learning_rate": 0.0001752395623531653, "loss": 4.5545, "mean_token_accuracy": 0.2613501206040382, "num_tokens": 150537680.0, "step": 65720 }, { "entropy": 5.291179943084717, "epoch": 6.497133254250692, "grad_norm": 1.171875, "learning_rate": 0.00017520793197358587, "loss": 4.6264, "mean_token_accuracy": 0.2604701995849609, "num_tokens": 150548491.0, "step": 65725 }, { "entropy": 5.3671369552612305, "epoch": 6.497627520759194, "grad_norm": 1.203125, "learning_rate": 0.0001751763040489066, "loss": 4.7112, "mean_token_accuracy": 0.24801668524742126, "num_tokens": 150561042.0, "step": 65730 }, { "entropy": 5.250878047943115, "epoch": 6.498121787267695, "grad_norm": 1.125, "learning_rate": 0.00017514467857990596, "loss": 4.5615, "mean_token_accuracy": 0.25910052806138995, "num_tokens": 150571730.0, "step": 65735 }, { "entropy": 5.230429983139038, "epoch": 6.498616053776196, "grad_norm": 1.2265625, "learning_rate": 0.00017511305556736163, "loss": 4.5571, "mean_token_accuracy": 0.26391912549734114, "num_tokens": 150582192.0, "step": 65740 }, { "entropy": 5.2532281398773195, "epoch": 6.499110320284697, "grad_norm": 1.125, "learning_rate": 0.00017508143501205158, "loss": 4.6337, "mean_token_accuracy": 0.258080293238163, "num_tokens": 150593885.0, "step": 65745 }, { "entropy": 5.202002000808716, "epoch": 6.499604586793199, "grad_norm": 1.21875, "learning_rate": 0.00017504981691475384, "loss": 4.5972, "mean_token_accuracy": 0.25895971804857254, "num_tokens": 150604249.0, "step": 65750 }, { "entropy": 5.276130437850952, "epoch": 6.5000988533017, "grad_norm": 1.140625, "learning_rate": 0.000175018201276246, "loss": 4.699, "mean_token_accuracy": 0.24651762694120408, "num_tokens": 150615674.0, "step": 65755 }, { "entropy": 5.292005920410157, "epoch": 6.500593119810202, "grad_norm": 1.171875, "learning_rate": 0.00017498658809730598, "loss": 4.724, "mean_token_accuracy": 0.2522415220737457, "num_tokens": 150627667.0, "step": 65760 }, { "entropy": 5.329622411727906, "epoch": 6.501087386318703, "grad_norm": 1.1171875, "learning_rate": 0.0001749549773787114, "loss": 4.6602, "mean_token_accuracy": 0.2504644155502319, "num_tokens": 150639415.0, "step": 65765 }, { "entropy": 5.334972190856933, "epoch": 6.501581652827205, "grad_norm": 1.1484375, "learning_rate": 0.00017492336912123985, "loss": 4.6535, "mean_token_accuracy": 0.25988359600305555, "num_tokens": 150650454.0, "step": 65770 }, { "entropy": 5.216753721237183, "epoch": 6.502075919335706, "grad_norm": 1.171875, "learning_rate": 0.00017489176332566902, "loss": 4.588, "mean_token_accuracy": 0.2637714222073555, "num_tokens": 150662857.0, "step": 65775 }, { "entropy": 5.143326902389527, "epoch": 6.502570185844207, "grad_norm": 1.25, "learning_rate": 0.0001748601599927763, "loss": 4.5136, "mean_token_accuracy": 0.27183847576379777, "num_tokens": 150673629.0, "step": 65780 }, { "entropy": 5.189912271499634, "epoch": 6.503064452352708, "grad_norm": 1.1328125, "learning_rate": 0.00017482855912333918, "loss": 4.5447, "mean_token_accuracy": 0.2694542184472084, "num_tokens": 150684617.0, "step": 65785 }, { "entropy": 5.236875867843628, "epoch": 6.50355871886121, "grad_norm": 1.1875, "learning_rate": 0.00017479696071813502, "loss": 4.6369, "mean_token_accuracy": 0.25124566107988355, "num_tokens": 150695480.0, "step": 65790 }, { "entropy": 5.261838340759278, "epoch": 6.504052985369711, "grad_norm": 1.1875, "learning_rate": 0.00017476536477794118, "loss": 4.6261, "mean_token_accuracy": 0.25583932995796205, "num_tokens": 150706862.0, "step": 65795 }, { "entropy": 5.244923830032349, "epoch": 6.504547251878213, "grad_norm": 1.1484375, "learning_rate": 0.000174733771303535, "loss": 4.5548, "mean_token_accuracy": 0.2599612683057785, "num_tokens": 150718266.0, "step": 65800 }, { "entropy": 5.260794687271118, "epoch": 6.505041518386714, "grad_norm": 1.2109375, "learning_rate": 0.00017470218029569354, "loss": 4.6565, "mean_token_accuracy": 0.261382856965065, "num_tokens": 150730675.0, "step": 65805 }, { "entropy": 5.281985569000244, "epoch": 6.505535784895216, "grad_norm": 1.171875, "learning_rate": 0.00017467059175519395, "loss": 4.6657, "mean_token_accuracy": 0.256040658056736, "num_tokens": 150742577.0, "step": 65810 }, { "entropy": 5.225865983963013, "epoch": 6.506030051403717, "grad_norm": 1.15625, "learning_rate": 0.00017463900568281344, "loss": 4.5994, "mean_token_accuracy": 0.26241208165884017, "num_tokens": 150754017.0, "step": 65815 }, { "entropy": 5.23225884437561, "epoch": 6.506524317912218, "grad_norm": 1.1796875, "learning_rate": 0.0001746074220793289, "loss": 4.5859, "mean_token_accuracy": 0.2682233452796936, "num_tokens": 150765741.0, "step": 65820 }, { "entropy": 5.205271053314209, "epoch": 6.507018584420719, "grad_norm": 1.109375, "learning_rate": 0.00017457584094551746, "loss": 4.6132, "mean_token_accuracy": 0.2663917735219002, "num_tokens": 150778197.0, "step": 65825 }, { "entropy": 5.31296968460083, "epoch": 6.507512850929221, "grad_norm": 1.3359375, "learning_rate": 0.00017454426228215582, "loss": 4.6124, "mean_token_accuracy": 0.2604313656687737, "num_tokens": 150789177.0, "step": 65830 }, { "entropy": 5.259959077835083, "epoch": 6.508007117437723, "grad_norm": 1.1953125, "learning_rate": 0.0001745126860900209, "loss": 4.6143, "mean_token_accuracy": 0.2620948329567909, "num_tokens": 150800521.0, "step": 65835 }, { "entropy": 5.279160881042481, "epoch": 6.508501383946224, "grad_norm": 1.265625, "learning_rate": 0.0001744811123698896, "loss": 4.6167, "mean_token_accuracy": 0.2627714857459068, "num_tokens": 150812335.0, "step": 65840 }, { "entropy": 5.257746887207031, "epoch": 6.508995650454725, "grad_norm": 1.2578125, "learning_rate": 0.00017444954112253838, "loss": 4.6104, "mean_token_accuracy": 0.2634632706642151, "num_tokens": 150823094.0, "step": 65845 }, { "entropy": 5.2823981761932375, "epoch": 6.5094899169632265, "grad_norm": 1.1484375, "learning_rate": 0.00017441797234874417, "loss": 4.6445, "mean_token_accuracy": 0.262122243642807, "num_tokens": 150834544.0, "step": 65850 }, { "entropy": 5.249442863464355, "epoch": 6.509984183471728, "grad_norm": 1.125, "learning_rate": 0.00017438640604928337, "loss": 4.599, "mean_token_accuracy": 0.26385046988725663, "num_tokens": 150846977.0, "step": 65855 }, { "entropy": 5.262444353103637, "epoch": 6.510478449980229, "grad_norm": 1.2578125, "learning_rate": 0.00017435484222493264, "loss": 4.5557, "mean_token_accuracy": 0.2671888396143913, "num_tokens": 150857580.0, "step": 65860 }, { "entropy": 5.254819440841675, "epoch": 6.51097271648873, "grad_norm": 1.203125, "learning_rate": 0.00017432328087646842, "loss": 4.6021, "mean_token_accuracy": 0.2552488923072815, "num_tokens": 150869081.0, "step": 65865 }, { "entropy": 5.238460969924927, "epoch": 6.5114669829972325, "grad_norm": 1.109375, "learning_rate": 0.00017429172200466707, "loss": 4.5561, "mean_token_accuracy": 0.26239707618951796, "num_tokens": 150880921.0, "step": 65870 }, { "entropy": 5.227729797363281, "epoch": 6.511961249505734, "grad_norm": 1.125, "learning_rate": 0.000174260165610305, "loss": 4.5873, "mean_token_accuracy": 0.254018135368824, "num_tokens": 150892448.0, "step": 65875 }, { "entropy": 5.23239107131958, "epoch": 6.512455516014235, "grad_norm": 1.1640625, "learning_rate": 0.00017422861169415845, "loss": 4.5808, "mean_token_accuracy": 0.26699784845113755, "num_tokens": 150904620.0, "step": 65880 }, { "entropy": 5.186312866210938, "epoch": 6.512949782522736, "grad_norm": 1.2578125, "learning_rate": 0.00017419706025700364, "loss": 4.5401, "mean_token_accuracy": 0.26299564093351363, "num_tokens": 150916313.0, "step": 65885 }, { "entropy": 5.2251211643219, "epoch": 6.5134440490312375, "grad_norm": 1.171875, "learning_rate": 0.00017416551129961695, "loss": 4.6141, "mean_token_accuracy": 0.2603556752204895, "num_tokens": 150928242.0, "step": 65890 }, { "entropy": 5.222911310195923, "epoch": 6.513938315539739, "grad_norm": 1.3125, "learning_rate": 0.00017413396482277423, "loss": 4.5666, "mean_token_accuracy": 0.2631079748272896, "num_tokens": 150940588.0, "step": 65895 }, { "entropy": 5.2765106678009035, "epoch": 6.51443258204824, "grad_norm": 1.2109375, "learning_rate": 0.00017410242082725163, "loss": 4.68, "mean_token_accuracy": 0.25253094881772997, "num_tokens": 150951430.0, "step": 65900 }, { "entropy": 5.266442441940308, "epoch": 6.514926848556742, "grad_norm": 1.0234375, "learning_rate": 0.00017407087931382503, "loss": 4.6831, "mean_token_accuracy": 0.24838167428970337, "num_tokens": 150964789.0, "step": 65905 }, { "entropy": 5.291055536270141, "epoch": 6.5154211150652435, "grad_norm": 1.2734375, "learning_rate": 0.00017403934028327052, "loss": 4.6618, "mean_token_accuracy": 0.25458830744028094, "num_tokens": 150975722.0, "step": 65910 }, { "entropy": 5.195152711868286, "epoch": 6.515915381573745, "grad_norm": 1.03125, "learning_rate": 0.000174007803736364, "loss": 4.5448, "mean_token_accuracy": 0.2648370563983917, "num_tokens": 150987211.0, "step": 65915 }, { "entropy": 5.302981376647949, "epoch": 6.516409648082246, "grad_norm": 1.2109375, "learning_rate": 0.00017397626967388107, "loss": 4.6475, "mean_token_accuracy": 0.25947455018758775, "num_tokens": 150997927.0, "step": 65920 }, { "entropy": 5.175008487701416, "epoch": 6.516903914590747, "grad_norm": 1.203125, "learning_rate": 0.00017394473809659772, "loss": 4.4775, "mean_token_accuracy": 0.2705380663275719, "num_tokens": 151008280.0, "step": 65925 }, { "entropy": 5.266608238220215, "epoch": 6.5173981810992485, "grad_norm": 1.25, "learning_rate": 0.00017391320900528924, "loss": 4.6028, "mean_token_accuracy": 0.25599112957715986, "num_tokens": 151019572.0, "step": 65930 }, { "entropy": 5.247789001464843, "epoch": 6.51789244760775, "grad_norm": 1.1875, "learning_rate": 0.00017388168240073165, "loss": 4.5517, "mean_token_accuracy": 0.2662167578935623, "num_tokens": 151031961.0, "step": 65935 }, { "entropy": 5.205582189559936, "epoch": 6.518386714116252, "grad_norm": 1.171875, "learning_rate": 0.00017385015828370043, "loss": 4.5898, "mean_token_accuracy": 0.261877515912056, "num_tokens": 151043004.0, "step": 65940 }, { "entropy": 5.2455812931060795, "epoch": 6.518880980624753, "grad_norm": 1.203125, "learning_rate": 0.0001738186366549709, "loss": 4.5877, "mean_token_accuracy": 0.25943715423345565, "num_tokens": 151053916.0, "step": 65945 }, { "entropy": 5.285021495819092, "epoch": 6.5193752471332544, "grad_norm": 1.2265625, "learning_rate": 0.00017378711751531872, "loss": 4.5848, "mean_token_accuracy": 0.2683508425951004, "num_tokens": 151065378.0, "step": 65950 }, { "entropy": 5.255817890167236, "epoch": 6.519869513641756, "grad_norm": 1.3046875, "learning_rate": 0.00017375560086551906, "loss": 4.5868, "mean_token_accuracy": 0.2576813191175461, "num_tokens": 151076084.0, "step": 65955 }, { "entropy": 5.212046432495117, "epoch": 6.520363780150257, "grad_norm": 1.109375, "learning_rate": 0.0001737240867063472, "loss": 4.6117, "mean_token_accuracy": 0.25822009742259977, "num_tokens": 151087367.0, "step": 65960 }, { "entropy": 5.255272960662841, "epoch": 6.520858046658758, "grad_norm": 1.1015625, "learning_rate": 0.00017369257503857874, "loss": 4.6372, "mean_token_accuracy": 0.2552060827612877, "num_tokens": 151099216.0, "step": 65965 }, { "entropy": 5.274157905578614, "epoch": 6.5213523131672595, "grad_norm": 0.99609375, "learning_rate": 0.00017366106586298851, "loss": 4.6827, "mean_token_accuracy": 0.25622293502092364, "num_tokens": 151112182.0, "step": 65970 }, { "entropy": 5.236396360397339, "epoch": 6.521846579675762, "grad_norm": 1.234375, "learning_rate": 0.0001736295591803519, "loss": 4.5769, "mean_token_accuracy": 0.2664236217737198, "num_tokens": 151122569.0, "step": 65975 }, { "entropy": 5.228791666030884, "epoch": 6.522340846184263, "grad_norm": 0.9375, "learning_rate": 0.00017359805499144379, "loss": 4.6151, "mean_token_accuracy": 0.2643159568309784, "num_tokens": 151135461.0, "step": 65980 }, { "entropy": 5.279046154022216, "epoch": 6.522835112692764, "grad_norm": 1.265625, "learning_rate": 0.00017356655329703923, "loss": 4.6256, "mean_token_accuracy": 0.26298983246088026, "num_tokens": 151147427.0, "step": 65985 }, { "entropy": 5.248318529129028, "epoch": 6.523329379201265, "grad_norm": 1.171875, "learning_rate": 0.00017353505409791324, "loss": 4.6136, "mean_token_accuracy": 0.25843981802463534, "num_tokens": 151159417.0, "step": 65990 }, { "entropy": 5.2722571849822994, "epoch": 6.523823645709767, "grad_norm": 1.1171875, "learning_rate": 0.00017350355739484063, "loss": 4.6579, "mean_token_accuracy": 0.25613119304180143, "num_tokens": 151171550.0, "step": 65995 }, { "entropy": 5.235097074508667, "epoch": 6.524317912218268, "grad_norm": 1.2890625, "learning_rate": 0.00017347206318859632, "loss": 4.5749, "mean_token_accuracy": 0.26384872049093244, "num_tokens": 151182848.0, "step": 66000 }, { "epoch": 6.524317912218268, "eval_entropy": 5.006144405672324, "eval_loss": 4.793399810791016, "eval_mean_token_accuracy": 0.25417792486418656, "eval_num_tokens": 151182848.0, "eval_runtime": 26.5968, "eval_samples_per_second": 1222.442, "eval_steps_per_second": 152.838, "step": 66000 }, { "entropy": 5.268096446990967, "epoch": 6.524812178726769, "grad_norm": 1.171875, "learning_rate": 0.00017344057147995496, "loss": 4.6346, "mean_token_accuracy": 0.2629400104284286, "num_tokens": 151193799.0, "step": 66005 }, { "entropy": 5.300425815582275, "epoch": 6.5253064452352705, "grad_norm": 1.2265625, "learning_rate": 0.00017340908226969124, "loss": 4.7674, "mean_token_accuracy": 0.24604893177747728, "num_tokens": 151204519.0, "step": 66010 }, { "entropy": 5.307318019866943, "epoch": 6.525800711743772, "grad_norm": 1.171875, "learning_rate": 0.00017337759555858002, "loss": 4.6973, "mean_token_accuracy": 0.2483331799507141, "num_tokens": 151216052.0, "step": 66015 }, { "entropy": 5.330113887786865, "epoch": 6.526294978252274, "grad_norm": 1.359375, "learning_rate": 0.00017334611134739547, "loss": 4.6649, "mean_token_accuracy": 0.25910788774490356, "num_tokens": 151226169.0, "step": 66020 }, { "entropy": 5.320558881759643, "epoch": 6.526789244760775, "grad_norm": 1.34375, "learning_rate": 0.00017331462963691258, "loss": 4.6892, "mean_token_accuracy": 0.25463829934597015, "num_tokens": 151236780.0, "step": 66025 }, { "entropy": 5.28788743019104, "epoch": 6.527283511269276, "grad_norm": 1.1640625, "learning_rate": 0.00017328315042790544, "loss": 4.6257, "mean_token_accuracy": 0.25699158310890197, "num_tokens": 151248320.0, "step": 66030 }, { "entropy": 5.25539927482605, "epoch": 6.527777777777778, "grad_norm": 1.265625, "learning_rate": 0.0001732516737211486, "loss": 4.6236, "mean_token_accuracy": 0.25922687351703644, "num_tokens": 151259434.0, "step": 66035 }, { "entropy": 5.266179990768433, "epoch": 6.528272044286279, "grad_norm": 1.390625, "learning_rate": 0.00017322019951741648, "loss": 4.5914, "mean_token_accuracy": 0.2579822733998299, "num_tokens": 151271580.0, "step": 66040 }, { "entropy": 5.27247986793518, "epoch": 6.52876631079478, "grad_norm": 1.1953125, "learning_rate": 0.00017318872781748313, "loss": 4.6053, "mean_token_accuracy": 0.25434099435806273, "num_tokens": 151283522.0, "step": 66045 }, { "entropy": 5.288978910446167, "epoch": 6.5292605773032815, "grad_norm": 1.15625, "learning_rate": 0.00017315725862212289, "loss": 4.6696, "mean_token_accuracy": 0.2536571681499481, "num_tokens": 151294717.0, "step": 66050 }, { "entropy": 5.2127643585205075, "epoch": 6.529754843811784, "grad_norm": 1.234375, "learning_rate": 0.00017312579193210986, "loss": 4.6254, "mean_token_accuracy": 0.261395300924778, "num_tokens": 151306129.0, "step": 66055 }, { "entropy": 5.203549528121949, "epoch": 6.530249110320285, "grad_norm": 1.2109375, "learning_rate": 0.00017309432774821818, "loss": 4.5606, "mean_token_accuracy": 0.2681036859750748, "num_tokens": 151318424.0, "step": 66060 }, { "entropy": 5.2174359321594235, "epoch": 6.530743376828786, "grad_norm": 1.3203125, "learning_rate": 0.0001730628660712219, "loss": 4.5598, "mean_token_accuracy": 0.26640368402004244, "num_tokens": 151330010.0, "step": 66065 }, { "entropy": 5.268781137466431, "epoch": 6.531237643337287, "grad_norm": 1.0625, "learning_rate": 0.00017303140690189489, "loss": 4.5901, "mean_token_accuracy": 0.2563334912061691, "num_tokens": 151341300.0, "step": 66070 }, { "entropy": 5.206277656555176, "epoch": 6.531731909845789, "grad_norm": 1.2109375, "learning_rate": 0.00017299995024101106, "loss": 4.5084, "mean_token_accuracy": 0.2678502261638641, "num_tokens": 151351775.0, "step": 66075 }, { "entropy": 5.224961280822754, "epoch": 6.53222617635429, "grad_norm": 1.171875, "learning_rate": 0.0001729684960893443, "loss": 4.5708, "mean_token_accuracy": 0.26184219866991043, "num_tokens": 151363277.0, "step": 66080 }, { "entropy": 5.235375261306762, "epoch": 6.532720442862791, "grad_norm": 1.203125, "learning_rate": 0.0001729370444476683, "loss": 4.5923, "mean_token_accuracy": 0.2647531613707542, "num_tokens": 151374687.0, "step": 66085 }, { "entropy": 5.204689168930054, "epoch": 6.533214709371293, "grad_norm": 1.21875, "learning_rate": 0.000172905595316757, "loss": 4.5216, "mean_token_accuracy": 0.2628912806510925, "num_tokens": 151385934.0, "step": 66090 }, { "entropy": 5.285311031341553, "epoch": 6.533708975879795, "grad_norm": 1.09375, "learning_rate": 0.00017287414869738378, "loss": 4.6578, "mean_token_accuracy": 0.2587311610579491, "num_tokens": 151398207.0, "step": 66095 }, { "entropy": 5.300189018249512, "epoch": 6.534203242388296, "grad_norm": 1.2734375, "learning_rate": 0.00017284270459032232, "loss": 4.6901, "mean_token_accuracy": 0.24862079024314881, "num_tokens": 151408356.0, "step": 66100 }, { "entropy": 5.282376384735107, "epoch": 6.534697508896797, "grad_norm": 1.21875, "learning_rate": 0.0001728112629963462, "loss": 4.6347, "mean_token_accuracy": 0.2596700727939606, "num_tokens": 151419248.0, "step": 66105 }, { "entropy": 5.293060827255249, "epoch": 6.535191775405298, "grad_norm": 1.234375, "learning_rate": 0.00017277982391622888, "loss": 4.6391, "mean_token_accuracy": 0.2594098553061485, "num_tokens": 151430926.0, "step": 66110 }, { "entropy": 5.252457094192505, "epoch": 6.5356860419138, "grad_norm": 1.1953125, "learning_rate": 0.00017274838735074384, "loss": 4.6354, "mean_token_accuracy": 0.26012891680002215, "num_tokens": 151442277.0, "step": 66115 }, { "entropy": 5.258326244354248, "epoch": 6.536180308422301, "grad_norm": 1.1796875, "learning_rate": 0.0001727169533006642, "loss": 4.652, "mean_token_accuracy": 0.2515429899096489, "num_tokens": 151453285.0, "step": 66120 }, { "entropy": 5.206835317611694, "epoch": 6.536674574930803, "grad_norm": 1.21875, "learning_rate": 0.0001726855217667634, "loss": 4.5274, "mean_token_accuracy": 0.2656477302312851, "num_tokens": 151464480.0, "step": 66125 }, { "entropy": 5.2802879333496096, "epoch": 6.537168841439304, "grad_norm": 1.109375, "learning_rate": 0.00017265409274981475, "loss": 4.6389, "mean_token_accuracy": 0.25415271818637847, "num_tokens": 151476303.0, "step": 66130 }, { "entropy": 5.348595809936524, "epoch": 6.537663107947806, "grad_norm": 1.3515625, "learning_rate": 0.0001726226662505911, "loss": 4.695, "mean_token_accuracy": 0.2563451141119003, "num_tokens": 151488073.0, "step": 66135 }, { "entropy": 5.260992479324341, "epoch": 6.538157374456307, "grad_norm": 1.140625, "learning_rate": 0.00017259124226986589, "loss": 4.6007, "mean_token_accuracy": 0.2547242507338524, "num_tokens": 151499197.0, "step": 66140 }, { "entropy": 5.240768003463745, "epoch": 6.538651640964808, "grad_norm": 1.0625, "learning_rate": 0.00017255982080841196, "loss": 4.6169, "mean_token_accuracy": 0.252691762149334, "num_tokens": 151510617.0, "step": 66145 }, { "entropy": 5.327303838729859, "epoch": 6.539145907473309, "grad_norm": 1.1328125, "learning_rate": 0.00017252840186700232, "loss": 4.6522, "mean_token_accuracy": 0.2571556523442268, "num_tokens": 151522604.0, "step": 66150 }, { "entropy": 5.296514940261841, "epoch": 6.539640173981811, "grad_norm": 1.1171875, "learning_rate": 0.00017249698544640995, "loss": 4.6271, "mean_token_accuracy": 0.2582866445183754, "num_tokens": 151534518.0, "step": 66155 }, { "entropy": 5.3222259998321535, "epoch": 6.540134440490313, "grad_norm": 1.1953125, "learning_rate": 0.0001724655715474076, "loss": 4.6664, "mean_token_accuracy": 0.2566417843103409, "num_tokens": 151547008.0, "step": 66160 }, { "entropy": 5.274893951416016, "epoch": 6.540628706998814, "grad_norm": 1.25, "learning_rate": 0.00017243416017076807, "loss": 4.5986, "mean_token_accuracy": 0.25119776129722593, "num_tokens": 151557495.0, "step": 66165 }, { "entropy": 5.223124742507935, "epoch": 6.541122973507315, "grad_norm": 1.2109375, "learning_rate": 0.00017240275131726412, "loss": 4.6111, "mean_token_accuracy": 0.26168361902236936, "num_tokens": 151569371.0, "step": 66170 }, { "entropy": 5.320303726196289, "epoch": 6.541617240015817, "grad_norm": 1.2109375, "learning_rate": 0.00017237134498766842, "loss": 4.6895, "mean_token_accuracy": 0.255815951526165, "num_tokens": 151581581.0, "step": 66175 }, { "entropy": 5.210472679138183, "epoch": 6.542111506524318, "grad_norm": 1.171875, "learning_rate": 0.0001723399411827536, "loss": 4.5313, "mean_token_accuracy": 0.26743037551641463, "num_tokens": 151592726.0, "step": 66180 }, { "entropy": 5.24228253364563, "epoch": 6.542605773032819, "grad_norm": 1.140625, "learning_rate": 0.00017230853990329208, "loss": 4.6537, "mean_token_accuracy": 0.25680285692214966, "num_tokens": 151604016.0, "step": 66185 }, { "entropy": 5.342248392105103, "epoch": 6.54310003954132, "grad_norm": 1.3515625, "learning_rate": 0.00017227714115005644, "loss": 4.6234, "mean_token_accuracy": 0.25909107476472854, "num_tokens": 151613893.0, "step": 66190 }, { "entropy": 5.323124980926513, "epoch": 6.5435943060498225, "grad_norm": 1.1484375, "learning_rate": 0.00017224574492381904, "loss": 4.6898, "mean_token_accuracy": 0.258479879796505, "num_tokens": 151625841.0, "step": 66195 }, { "entropy": 5.21928858757019, "epoch": 6.544088572558324, "grad_norm": 1.0390625, "learning_rate": 0.00017221435122535226, "loss": 4.6262, "mean_token_accuracy": 0.26209871619939806, "num_tokens": 151638745.0, "step": 66200 }, { "entropy": 5.349976587295532, "epoch": 6.544582839066825, "grad_norm": 1.1796875, "learning_rate": 0.00017218296005542847, "loss": 4.7296, "mean_token_accuracy": 0.24944229573011398, "num_tokens": 151650456.0, "step": 66205 }, { "entropy": 5.243274450302124, "epoch": 6.545077105575326, "grad_norm": 1.125, "learning_rate": 0.00017215157141481973, "loss": 4.6419, "mean_token_accuracy": 0.25742626935243607, "num_tokens": 151661983.0, "step": 66210 }, { "entropy": 5.241588926315307, "epoch": 6.5455713720838276, "grad_norm": 1.1953125, "learning_rate": 0.0001721201853042983, "loss": 4.6494, "mean_token_accuracy": 0.26520688086748123, "num_tokens": 151673858.0, "step": 66215 }, { "entropy": 5.199919128417969, "epoch": 6.546065638592329, "grad_norm": 1.21875, "learning_rate": 0.00017208880172463631, "loss": 4.5534, "mean_token_accuracy": 0.2633492395281792, "num_tokens": 151685770.0, "step": 66220 }, { "entropy": 5.272194814682007, "epoch": 6.54655990510083, "grad_norm": 1.28125, "learning_rate": 0.00017205742067660562, "loss": 4.6226, "mean_token_accuracy": 0.24804249107837678, "num_tokens": 151696706.0, "step": 66225 }, { "entropy": 5.228005123138428, "epoch": 6.547054171609332, "grad_norm": 1.2109375, "learning_rate": 0.00017202604216097855, "loss": 4.5852, "mean_token_accuracy": 0.26366435885429385, "num_tokens": 151708571.0, "step": 66230 }, { "entropy": 5.270369386672973, "epoch": 6.5475484381178335, "grad_norm": 1.1171875, "learning_rate": 0.00017199466617852672, "loss": 4.5833, "mean_token_accuracy": 0.2613841861486435, "num_tokens": 151719995.0, "step": 66235 }, { "entropy": 5.234585475921631, "epoch": 6.548042704626335, "grad_norm": 1.140625, "learning_rate": 0.00017196329273002205, "loss": 4.534, "mean_token_accuracy": 0.26803753674030306, "num_tokens": 151731805.0, "step": 66240 }, { "entropy": 5.299395132064819, "epoch": 6.548536971134836, "grad_norm": 1.2265625, "learning_rate": 0.0001719319218162365, "loss": 4.7089, "mean_token_accuracy": 0.25041277408599855, "num_tokens": 151744664.0, "step": 66245 }, { "entropy": 5.2526592254638675, "epoch": 6.549031237643337, "grad_norm": 1.1171875, "learning_rate": 0.00017190055343794142, "loss": 4.6195, "mean_token_accuracy": 0.25705831348896024, "num_tokens": 151756643.0, "step": 66250 }, { "entropy": 5.283226776123047, "epoch": 6.5495255041518385, "grad_norm": 1.1796875, "learning_rate": 0.00017186918759590894, "loss": 4.5924, "mean_token_accuracy": 0.2593923881649971, "num_tokens": 151767299.0, "step": 66255 }, { "entropy": 5.224312591552734, "epoch": 6.55001977066034, "grad_norm": 1.25, "learning_rate": 0.00017183782429091036, "loss": 4.5691, "mean_token_accuracy": 0.2608498468995094, "num_tokens": 151778468.0, "step": 66260 }, { "entropy": 5.31184663772583, "epoch": 6.550514037168841, "grad_norm": 1.21875, "learning_rate": 0.0001718064635237173, "loss": 4.7473, "mean_token_accuracy": 0.24945923686027527, "num_tokens": 151790290.0, "step": 66265 }, { "entropy": 5.230441284179688, "epoch": 6.551008303677342, "grad_norm": 1.15625, "learning_rate": 0.00017177510529510137, "loss": 4.5946, "mean_token_accuracy": 0.265134696662426, "num_tokens": 151801551.0, "step": 66270 }, { "entropy": 5.22105131149292, "epoch": 6.5515025701858445, "grad_norm": 1.15625, "learning_rate": 0.00017174374960583373, "loss": 4.5846, "mean_token_accuracy": 0.25417341142892835, "num_tokens": 151812639.0, "step": 66275 }, { "entropy": 5.232866907119751, "epoch": 6.551996836694346, "grad_norm": 1.2109375, "learning_rate": 0.00017171239645668584, "loss": 4.6254, "mean_token_accuracy": 0.2564304366707802, "num_tokens": 151823841.0, "step": 66280 }, { "entropy": 5.30286054611206, "epoch": 6.552491103202847, "grad_norm": 1.171875, "learning_rate": 0.00017168104584842908, "loss": 4.6613, "mean_token_accuracy": 0.26039082556962967, "num_tokens": 151835980.0, "step": 66285 }, { "entropy": 5.225210237503052, "epoch": 6.552985369711348, "grad_norm": 1.265625, "learning_rate": 0.0001716496977818346, "loss": 4.5596, "mean_token_accuracy": 0.2657493516802788, "num_tokens": 151846067.0, "step": 66290 }, { "entropy": 5.2177934646606445, "epoch": 6.5534796362198495, "grad_norm": 1.265625, "learning_rate": 0.00017161835225767367, "loss": 4.5795, "mean_token_accuracy": 0.2652583926916122, "num_tokens": 151856982.0, "step": 66295 }, { "entropy": 5.268459177017212, "epoch": 6.553973902728351, "grad_norm": 1.1640625, "learning_rate": 0.0001715870092767172, "loss": 4.641, "mean_token_accuracy": 0.25581667125225066, "num_tokens": 151869166.0, "step": 66300 }, { "entropy": 5.235877466201782, "epoch": 6.554468169236852, "grad_norm": 1.2890625, "learning_rate": 0.0001715556688397365, "loss": 4.6547, "mean_token_accuracy": 0.26216437965631484, "num_tokens": 151881032.0, "step": 66305 }, { "entropy": 5.265100193023682, "epoch": 6.554962435745354, "grad_norm": 1.2109375, "learning_rate": 0.0001715243309475022, "loss": 4.6154, "mean_token_accuracy": 0.25229590833187104, "num_tokens": 151892851.0, "step": 66310 }, { "entropy": 5.263192367553711, "epoch": 6.5554567022538555, "grad_norm": 1.140625, "learning_rate": 0.00017149299560078547, "loss": 4.5681, "mean_token_accuracy": 0.2627761855721474, "num_tokens": 151904424.0, "step": 66315 }, { "entropy": 5.224477052688599, "epoch": 6.555950968762357, "grad_norm": 1.1484375, "learning_rate": 0.0001714616628003572, "loss": 4.5426, "mean_token_accuracy": 0.2683361113071442, "num_tokens": 151915892.0, "step": 66320 }, { "entropy": 5.357472085952759, "epoch": 6.556445235270858, "grad_norm": 1.265625, "learning_rate": 0.000171430332546988, "loss": 4.6715, "mean_token_accuracy": 0.24955081641674043, "num_tokens": 151926342.0, "step": 66325 }, { "entropy": 5.259517431259155, "epoch": 6.556939501779359, "grad_norm": 1.2578125, "learning_rate": 0.00017139900484144878, "loss": 4.6133, "mean_token_accuracy": 0.2586162567138672, "num_tokens": 151937857.0, "step": 66330 }, { "entropy": 5.253298091888428, "epoch": 6.5574337682878605, "grad_norm": 1.171875, "learning_rate": 0.00017136767968451, "loss": 4.6689, "mean_token_accuracy": 0.2537300780415535, "num_tokens": 151950191.0, "step": 66335 }, { "entropy": 5.260764265060425, "epoch": 6.557928034796362, "grad_norm": 1.3046875, "learning_rate": 0.00017133635707694233, "loss": 4.5803, "mean_token_accuracy": 0.26095953583717346, "num_tokens": 151961051.0, "step": 66340 }, { "entropy": 5.222249937057495, "epoch": 6.558422301304864, "grad_norm": 1.171875, "learning_rate": 0.0001713050370195165, "loss": 4.5998, "mean_token_accuracy": 0.2620223671197891, "num_tokens": 151971640.0, "step": 66345 }, { "entropy": 5.211243104934693, "epoch": 6.558916567813365, "grad_norm": 1.3671875, "learning_rate": 0.0001712737195130028, "loss": 4.5629, "mean_token_accuracy": 0.26334669888019563, "num_tokens": 151982177.0, "step": 66350 }, { "entropy": 5.28833041191101, "epoch": 6.5594108343218664, "grad_norm": 1.265625, "learning_rate": 0.00017124240455817174, "loss": 4.7118, "mean_token_accuracy": 0.2498194694519043, "num_tokens": 151992863.0, "step": 66355 }, { "entropy": 5.226811218261719, "epoch": 6.559905100830368, "grad_norm": 1.2265625, "learning_rate": 0.00017121109215579355, "loss": 4.5339, "mean_token_accuracy": 0.2624698981642723, "num_tokens": 152003798.0, "step": 66360 }, { "entropy": 5.220943450927734, "epoch": 6.560399367338869, "grad_norm": 1.203125, "learning_rate": 0.0001711797823066386, "loss": 4.5614, "mean_token_accuracy": 0.25904365479946134, "num_tokens": 152013854.0, "step": 66365 }, { "entropy": 5.200736665725708, "epoch": 6.56089363384737, "grad_norm": 1.25, "learning_rate": 0.00017114847501147713, "loss": 4.5298, "mean_token_accuracy": 0.26680721789598466, "num_tokens": 152025432.0, "step": 66370 }, { "entropy": 5.227036619186402, "epoch": 6.5613879003558715, "grad_norm": 1.1484375, "learning_rate": 0.00017111717027107925, "loss": 4.619, "mean_token_accuracy": 0.2547748476266861, "num_tokens": 152036189.0, "step": 66375 }, { "entropy": 5.223004627227783, "epoch": 6.561882166864374, "grad_norm": 1.21875, "learning_rate": 0.0001710858680862152, "loss": 4.5871, "mean_token_accuracy": 0.26376163214445114, "num_tokens": 152048271.0, "step": 66380 }, { "entropy": 5.223060750961304, "epoch": 6.562376433372875, "grad_norm": 1.2265625, "learning_rate": 0.00017105456845765483, "loss": 4.5028, "mean_token_accuracy": 0.25963379740715026, "num_tokens": 152058782.0, "step": 66385 }, { "entropy": 5.255770301818847, "epoch": 6.562870699881376, "grad_norm": 1.203125, "learning_rate": 0.0001710232713861682, "loss": 4.6511, "mean_token_accuracy": 0.2523648887872696, "num_tokens": 152069840.0, "step": 66390 }, { "entropy": 5.2898335456848145, "epoch": 6.563364966389877, "grad_norm": 1.2578125, "learning_rate": 0.00017099197687252528, "loss": 4.6345, "mean_token_accuracy": 0.25271064043045044, "num_tokens": 152080845.0, "step": 66395 }, { "entropy": 5.195940589904785, "epoch": 6.563859232898379, "grad_norm": 1.1171875, "learning_rate": 0.00017096068491749574, "loss": 4.5274, "mean_token_accuracy": 0.27021406292915345, "num_tokens": 152092290.0, "step": 66400 }, { "entropy": 5.218263006210327, "epoch": 6.56435349940688, "grad_norm": 1.1640625, "learning_rate": 0.00017092939552184965, "loss": 4.5721, "mean_token_accuracy": 0.26146886497735977, "num_tokens": 152102345.0, "step": 66405 }, { "entropy": 5.246283674240113, "epoch": 6.564847765915381, "grad_norm": 1.15625, "learning_rate": 0.00017089810868635647, "loss": 4.6481, "mean_token_accuracy": 0.26329871714115144, "num_tokens": 152114433.0, "step": 66410 }, { "entropy": 5.311334562301636, "epoch": 6.565342032423883, "grad_norm": 1.1640625, "learning_rate": 0.000170866824411786, "loss": 4.6909, "mean_token_accuracy": 0.25205734074115754, "num_tokens": 152126716.0, "step": 66415 }, { "entropy": 5.2672991275787355, "epoch": 6.565836298932385, "grad_norm": 1.1328125, "learning_rate": 0.00017083554269890788, "loss": 4.6384, "mean_token_accuracy": 0.2589480012655258, "num_tokens": 152137561.0, "step": 66420 }, { "entropy": 5.307732439041137, "epoch": 6.566330565440886, "grad_norm": 1.1875, "learning_rate": 0.00017080426354849137, "loss": 4.6663, "mean_token_accuracy": 0.252216611802578, "num_tokens": 152149111.0, "step": 66425 }, { "entropy": 5.31425838470459, "epoch": 6.566824831949387, "grad_norm": 1.21875, "learning_rate": 0.00017077298696130633, "loss": 4.7032, "mean_token_accuracy": 0.2551217019557953, "num_tokens": 152160297.0, "step": 66430 }, { "entropy": 5.289706563949585, "epoch": 6.567319098457888, "grad_norm": 1.09375, "learning_rate": 0.00017074171293812192, "loss": 4.6222, "mean_token_accuracy": 0.2550573170185089, "num_tokens": 152172792.0, "step": 66435 }, { "entropy": 5.234765100479126, "epoch": 6.56781336496639, "grad_norm": 1.171875, "learning_rate": 0.0001707104414797075, "loss": 4.6018, "mean_token_accuracy": 0.2667019128799438, "num_tokens": 152184946.0, "step": 66440 }, { "entropy": 5.306083154678345, "epoch": 6.568307631474891, "grad_norm": 1.15625, "learning_rate": 0.00017067917258683252, "loss": 4.6703, "mean_token_accuracy": 0.256915582716465, "num_tokens": 152196004.0, "step": 66445 }, { "entropy": 5.2136200904846195, "epoch": 6.568801897983393, "grad_norm": 1.203125, "learning_rate": 0.00017064790626026595, "loss": 4.564, "mean_token_accuracy": 0.26521447896957395, "num_tokens": 152207934.0, "step": 66450 }, { "entropy": 5.2317462921142575, "epoch": 6.569296164491894, "grad_norm": 1.1328125, "learning_rate": 0.0001706166425007771, "loss": 4.597, "mean_token_accuracy": 0.2695497334003448, "num_tokens": 152219714.0, "step": 66455 }, { "entropy": 5.297171020507813, "epoch": 6.569790431000396, "grad_norm": 1.15625, "learning_rate": 0.00017058538130913507, "loss": 4.7025, "mean_token_accuracy": 0.24962628483772278, "num_tokens": 152230121.0, "step": 66460 }, { "entropy": 5.308525085449219, "epoch": 6.570284697508897, "grad_norm": 1.2421875, "learning_rate": 0.0001705541226861088, "loss": 4.6707, "mean_token_accuracy": 0.25208470672369004, "num_tokens": 152241320.0, "step": 66465 }, { "entropy": 5.262190198898315, "epoch": 6.570778964017398, "grad_norm": 1.1875, "learning_rate": 0.00017052286663246744, "loss": 4.6436, "mean_token_accuracy": 0.25768627524375914, "num_tokens": 152253480.0, "step": 66470 }, { "entropy": 5.325365734100342, "epoch": 6.571273230525899, "grad_norm": 1.0859375, "learning_rate": 0.00017049161314897971, "loss": 4.7225, "mean_token_accuracy": 0.24743053168058396, "num_tokens": 152265233.0, "step": 66475 }, { "entropy": 5.2566437244415285, "epoch": 6.571767497034401, "grad_norm": 1.21875, "learning_rate": 0.00017046036223641447, "loss": 4.6107, "mean_token_accuracy": 0.2649873659014702, "num_tokens": 152276561.0, "step": 66480 }, { "entropy": 5.176571559906006, "epoch": 6.572261763542903, "grad_norm": 1.1484375, "learning_rate": 0.0001704291138955405, "loss": 4.5371, "mean_token_accuracy": 0.26818799823522566, "num_tokens": 152287128.0, "step": 66485 }, { "entropy": 5.274130058288574, "epoch": 6.572756030051404, "grad_norm": 1.2578125, "learning_rate": 0.00017039786812712664, "loss": 4.6588, "mean_token_accuracy": 0.25488289147615434, "num_tokens": 152298512.0, "step": 66490 }, { "entropy": 5.297350740432739, "epoch": 6.573250296559905, "grad_norm": 1.28125, "learning_rate": 0.00017036662493194148, "loss": 4.594, "mean_token_accuracy": 0.26305475980043413, "num_tokens": 152308855.0, "step": 66495 }, { "entropy": 5.289653635025024, "epoch": 6.573744563068407, "grad_norm": 1.1015625, "learning_rate": 0.00017033538431075352, "loss": 4.6752, "mean_token_accuracy": 0.25037656277418135, "num_tokens": 152320326.0, "step": 66500 }, { "entropy": 5.238531255722046, "epoch": 6.574238829576908, "grad_norm": 1.140625, "learning_rate": 0.00017030414626433127, "loss": 4.5724, "mean_token_accuracy": 0.27362546771764756, "num_tokens": 152332110.0, "step": 66505 }, { "entropy": 5.2876465797424315, "epoch": 6.574733096085409, "grad_norm": 1.1484375, "learning_rate": 0.00017027291079344342, "loss": 4.7086, "mean_token_accuracy": 0.25216131657361984, "num_tokens": 152343518.0, "step": 66510 }, { "entropy": 5.298431491851806, "epoch": 6.57522736259391, "grad_norm": 1.046875, "learning_rate": 0.00017024167789885802, "loss": 4.6321, "mean_token_accuracy": 0.2612598240375519, "num_tokens": 152356032.0, "step": 66515 }, { "entropy": 5.28528938293457, "epoch": 6.575721629102412, "grad_norm": 1.2421875, "learning_rate": 0.0001702104475813438, "loss": 4.6234, "mean_token_accuracy": 0.2604722544550896, "num_tokens": 152366298.0, "step": 66520 }, { "entropy": 5.217330980300903, "epoch": 6.576215895610913, "grad_norm": 1.1328125, "learning_rate": 0.00017017921984166867, "loss": 4.5238, "mean_token_accuracy": 0.2648026242852211, "num_tokens": 152377932.0, "step": 66525 }, { "entropy": 5.31692910194397, "epoch": 6.576710162119415, "grad_norm": 1.3125, "learning_rate": 0.00017014799468060104, "loss": 4.7206, "mean_token_accuracy": 0.2520625159144402, "num_tokens": 152388933.0, "step": 66530 }, { "entropy": 5.246670961380005, "epoch": 6.577204428627916, "grad_norm": 1.15625, "learning_rate": 0.0001701167720989091, "loss": 4.5911, "mean_token_accuracy": 0.26519047766923903, "num_tokens": 152400898.0, "step": 66535 }, { "entropy": 5.230110454559326, "epoch": 6.577698695136418, "grad_norm": 1.171875, "learning_rate": 0.00017008555209736077, "loss": 4.5891, "mean_token_accuracy": 0.2620873063802719, "num_tokens": 152411019.0, "step": 66540 }, { "entropy": 5.246429347991944, "epoch": 6.578192961644919, "grad_norm": 1.2421875, "learning_rate": 0.00017005433467672407, "loss": 4.5857, "mean_token_accuracy": 0.2633762612938881, "num_tokens": 152423304.0, "step": 66545 }, { "entropy": 5.255860471725464, "epoch": 6.57868722815342, "grad_norm": 1.1953125, "learning_rate": 0.0001700231198377671, "loss": 4.5359, "mean_token_accuracy": 0.26869205832481385, "num_tokens": 152435766.0, "step": 66550 }, { "entropy": 5.310929918289185, "epoch": 6.579181494661921, "grad_norm": 1.1875, "learning_rate": 0.00016999190758125758, "loss": 4.6776, "mean_token_accuracy": 0.2596216782927513, "num_tokens": 152447347.0, "step": 66555 }, { "entropy": 5.289405393600464, "epoch": 6.579675761170423, "grad_norm": 1.234375, "learning_rate": 0.00016996069790796355, "loss": 4.6679, "mean_token_accuracy": 0.24890235364437102, "num_tokens": 152460135.0, "step": 66560 }, { "entropy": 5.2176909923553465, "epoch": 6.580170027678925, "grad_norm": 1.2265625, "learning_rate": 0.00016992949081865257, "loss": 4.5464, "mean_token_accuracy": 0.26372926533222196, "num_tokens": 152471397.0, "step": 66565 }, { "entropy": 5.3103736400604244, "epoch": 6.580664294187426, "grad_norm": 1.25, "learning_rate": 0.0001698982863140924, "loss": 4.6772, "mean_token_accuracy": 0.2502077862620354, "num_tokens": 152483390.0, "step": 66570 }, { "entropy": 5.228565645217896, "epoch": 6.581158560695927, "grad_norm": 1.21875, "learning_rate": 0.0001698670843950507, "loss": 4.597, "mean_token_accuracy": 0.2595952317118645, "num_tokens": 152494648.0, "step": 66575 }, { "entropy": 5.227476453781128, "epoch": 6.581652827204429, "grad_norm": 1.125, "learning_rate": 0.00016983588506229506, "loss": 4.5373, "mean_token_accuracy": 0.2639029145240784, "num_tokens": 152506289.0, "step": 66580 }, { "entropy": 5.242797803878784, "epoch": 6.58214709371293, "grad_norm": 1.0390625, "learning_rate": 0.000169804688316593, "loss": 4.6374, "mean_token_accuracy": 0.2605043426156044, "num_tokens": 152520218.0, "step": 66585 }, { "entropy": 5.207115316390992, "epoch": 6.582641360221431, "grad_norm": 1.171875, "learning_rate": 0.00016977349415871185, "loss": 4.5438, "mean_token_accuracy": 0.26383784115314485, "num_tokens": 152531360.0, "step": 66590 }, { "entropy": 5.253270101547241, "epoch": 6.583135626729932, "grad_norm": 1.140625, "learning_rate": 0.0001697423025894191, "loss": 4.6422, "mean_token_accuracy": 0.2564018726348877, "num_tokens": 152543595.0, "step": 66595 }, { "entropy": 5.249292039871216, "epoch": 6.5836298932384345, "grad_norm": 1.28125, "learning_rate": 0.000169711113609482, "loss": 4.6452, "mean_token_accuracy": 0.2565823391079903, "num_tokens": 152553668.0, "step": 66600 }, { "entropy": 5.242258739471436, "epoch": 6.584124159746936, "grad_norm": 1.1328125, "learning_rate": 0.00016967992721966788, "loss": 4.6399, "mean_token_accuracy": 0.25944250375032424, "num_tokens": 152565258.0, "step": 66605 }, { "entropy": 5.296050024032593, "epoch": 6.584618426255437, "grad_norm": 1.1875, "learning_rate": 0.00016964874342074394, "loss": 4.6932, "mean_token_accuracy": 0.25343640297651293, "num_tokens": 152577214.0, "step": 66610 }, { "entropy": 5.316961050033569, "epoch": 6.585112692763938, "grad_norm": 1.234375, "learning_rate": 0.0001696175622134772, "loss": 4.6317, "mean_token_accuracy": 0.25452136248350143, "num_tokens": 152587986.0, "step": 66615 }, { "entropy": 5.263747978210449, "epoch": 6.5856069592724396, "grad_norm": 1.25, "learning_rate": 0.0001695863835986347, "loss": 4.578, "mean_token_accuracy": 0.263220289349556, "num_tokens": 152599405.0, "step": 66620 }, { "entropy": 5.2438459396362305, "epoch": 6.586101225780941, "grad_norm": 1.1171875, "learning_rate": 0.00016955520757698373, "loss": 4.6715, "mean_token_accuracy": 0.25661881268024445, "num_tokens": 152611169.0, "step": 66625 }, { "entropy": 5.2548328876495365, "epoch": 6.586595492289442, "grad_norm": 1.2265625, "learning_rate": 0.00016952403414929073, "loss": 4.5831, "mean_token_accuracy": 0.26644364297389983, "num_tokens": 152621567.0, "step": 66630 }, { "entropy": 5.336904096603393, "epoch": 6.587089758797944, "grad_norm": 1.1640625, "learning_rate": 0.0001694928633163231, "loss": 4.638, "mean_token_accuracy": 0.2631720870733261, "num_tokens": 152631960.0, "step": 66635 }, { "entropy": 5.303812026977539, "epoch": 6.5875840253064455, "grad_norm": 1.21875, "learning_rate": 0.0001694616950788473, "loss": 4.6853, "mean_token_accuracy": 0.2555012419819832, "num_tokens": 152643956.0, "step": 66640 }, { "entropy": 5.232919979095459, "epoch": 6.588078291814947, "grad_norm": 1.1640625, "learning_rate": 0.00016943052943763014, "loss": 4.5686, "mean_token_accuracy": 0.25583384931087494, "num_tokens": 152654766.0, "step": 66645 }, { "entropy": 5.2177228927612305, "epoch": 6.588572558323448, "grad_norm": 1.1015625, "learning_rate": 0.00016939936639343844, "loss": 4.5933, "mean_token_accuracy": 0.26313958019018174, "num_tokens": 152666800.0, "step": 66650 }, { "entropy": 5.213233852386475, "epoch": 6.589066824831949, "grad_norm": 1.1640625, "learning_rate": 0.00016936820594703862, "loss": 4.6185, "mean_token_accuracy": 0.26141373366117476, "num_tokens": 152678650.0, "step": 66655 }, { "entropy": 5.236192464828491, "epoch": 6.5895610913404505, "grad_norm": 1.1796875, "learning_rate": 0.00016933704809919732, "loss": 4.6178, "mean_token_accuracy": 0.25498180240392687, "num_tokens": 152690874.0, "step": 66660 }, { "entropy": 5.20761890411377, "epoch": 6.590055357848952, "grad_norm": 1.1640625, "learning_rate": 0.00016930589285068102, "loss": 4.5614, "mean_token_accuracy": 0.2643672004342079, "num_tokens": 152702877.0, "step": 66665 }, { "entropy": 5.252618932723999, "epoch": 6.590549624357454, "grad_norm": 1.1640625, "learning_rate": 0.00016927474020225614, "loss": 4.61, "mean_token_accuracy": 0.25868279933929444, "num_tokens": 152713741.0, "step": 66670 }, { "entropy": 5.170228004455566, "epoch": 6.591043890865955, "grad_norm": 1.2734375, "learning_rate": 0.00016924359015468916, "loss": 4.5213, "mean_token_accuracy": 0.2694974601268768, "num_tokens": 152725062.0, "step": 66675 }, { "entropy": 5.270363759994507, "epoch": 6.5915381573744565, "grad_norm": 1.140625, "learning_rate": 0.0001692124427087462, "loss": 4.6686, "mean_token_accuracy": 0.25526985079050063, "num_tokens": 152737333.0, "step": 66680 }, { "entropy": 5.335460662841797, "epoch": 6.592032423882958, "grad_norm": 1.2109375, "learning_rate": 0.00016918129786519355, "loss": 4.7269, "mean_token_accuracy": 0.2448129564523697, "num_tokens": 152749226.0, "step": 66685 }, { "entropy": 5.196057271957398, "epoch": 6.592526690391459, "grad_norm": 1.203125, "learning_rate": 0.00016915015562479736, "loss": 4.4863, "mean_token_accuracy": 0.2705608978867531, "num_tokens": 152760781.0, "step": 66690 }, { "entropy": 5.238398265838623, "epoch": 6.59302095689996, "grad_norm": 1.0546875, "learning_rate": 0.00016911901598832377, "loss": 4.5785, "mean_token_accuracy": 0.2608842715620995, "num_tokens": 152772094.0, "step": 66695 }, { "entropy": 5.295238351821899, "epoch": 6.5935152234084615, "grad_norm": 1.2421875, "learning_rate": 0.00016908787895653893, "loss": 4.7199, "mean_token_accuracy": 0.24946436583995818, "num_tokens": 152783177.0, "step": 66700 }, { "entropy": 5.314077138900757, "epoch": 6.594009489916964, "grad_norm": 1.2734375, "learning_rate": 0.0001690567445302086, "loss": 4.6884, "mean_token_accuracy": 0.24800411909818648, "num_tokens": 152793676.0, "step": 66705 }, { "entropy": 5.211078071594239, "epoch": 6.594503756425465, "grad_norm": 1.1328125, "learning_rate": 0.0001690256127100988, "loss": 4.6223, "mean_token_accuracy": 0.2528580859303474, "num_tokens": 152805767.0, "step": 66710 }, { "entropy": 5.260761785507202, "epoch": 6.594998022933966, "grad_norm": 1.140625, "learning_rate": 0.00016899448349697545, "loss": 4.6207, "mean_token_accuracy": 0.25735172629356384, "num_tokens": 152816759.0, "step": 66715 }, { "entropy": 5.23753981590271, "epoch": 6.5954922894424675, "grad_norm": 1.1640625, "learning_rate": 0.00016896335689160405, "loss": 4.5463, "mean_token_accuracy": 0.26860171258449556, "num_tokens": 152827837.0, "step": 66720 }, { "entropy": 5.2365528583526615, "epoch": 6.595986555950969, "grad_norm": 1.359375, "learning_rate": 0.00016893223289475071, "loss": 4.6193, "mean_token_accuracy": 0.2637398064136505, "num_tokens": 152838903.0, "step": 66725 }, { "entropy": 5.246725559234619, "epoch": 6.59648082245947, "grad_norm": 1.265625, "learning_rate": 0.00016890111150718082, "loss": 4.6763, "mean_token_accuracy": 0.26236608922481536, "num_tokens": 152849450.0, "step": 66730 }, { "entropy": 5.198153066635132, "epoch": 6.596975088967971, "grad_norm": 1.0078125, "learning_rate": 0.00016886999272966002, "loss": 4.5669, "mean_token_accuracy": 0.26536700278520586, "num_tokens": 152861848.0, "step": 66735 }, { "entropy": 5.240880680084229, "epoch": 6.597469355476473, "grad_norm": 1.1640625, "learning_rate": 0.000168838876562954, "loss": 4.592, "mean_token_accuracy": 0.26584508270025253, "num_tokens": 152873061.0, "step": 66740 }, { "entropy": 5.294796323776245, "epoch": 6.597963621984975, "grad_norm": 1.1953125, "learning_rate": 0.00016880776300782786, "loss": 4.6123, "mean_token_accuracy": 0.25803898721933366, "num_tokens": 152884941.0, "step": 66745 }, { "entropy": 5.208760023117065, "epoch": 6.598457888493476, "grad_norm": 1.2109375, "learning_rate": 0.00016877665206504742, "loss": 4.4959, "mean_token_accuracy": 0.2717499271035194, "num_tokens": 152895439.0, "step": 66750 }, { "entropy": 5.2010838985443115, "epoch": 6.598952155001977, "grad_norm": 1.1875, "learning_rate": 0.00016874554373537772, "loss": 4.5389, "mean_token_accuracy": 0.2676968455314636, "num_tokens": 152906264.0, "step": 66755 }, { "entropy": 5.241400575637817, "epoch": 6.5994464215104784, "grad_norm": 1.1328125, "learning_rate": 0.00016871443801958413, "loss": 4.5853, "mean_token_accuracy": 0.2633092701435089, "num_tokens": 152917654.0, "step": 66760 }, { "entropy": 5.3047584056854244, "epoch": 6.59994068801898, "grad_norm": 1.2421875, "learning_rate": 0.00016868333491843197, "loss": 4.7151, "mean_token_accuracy": 0.25151562988758086, "num_tokens": 152928584.0, "step": 66765 }, { "entropy": 5.15751371383667, "epoch": 6.600434954527481, "grad_norm": 1.3203125, "learning_rate": 0.00016865223443268617, "loss": 4.441, "mean_token_accuracy": 0.2748552933335304, "num_tokens": 152939570.0, "step": 66770 }, { "entropy": 5.210807991027832, "epoch": 6.600929221035982, "grad_norm": 1.2421875, "learning_rate": 0.00016862113656311185, "loss": 4.6114, "mean_token_accuracy": 0.2628576770424843, "num_tokens": 152951142.0, "step": 66775 }, { "entropy": 5.229984617233276, "epoch": 6.6014234875444835, "grad_norm": 1.265625, "learning_rate": 0.00016859004131047412, "loss": 4.6562, "mean_token_accuracy": 0.257611383497715, "num_tokens": 152963384.0, "step": 66780 }, { "entropy": 5.235338592529297, "epoch": 6.601917754052986, "grad_norm": 1.1796875, "learning_rate": 0.0001685589486755379, "loss": 4.5879, "mean_token_accuracy": 0.2621737942099571, "num_tokens": 152974660.0, "step": 66785 }, { "entropy": 5.247202396392822, "epoch": 6.602412020561487, "grad_norm": 1.1171875, "learning_rate": 0.0001685278586590681, "loss": 4.6114, "mean_token_accuracy": 0.2578990668058395, "num_tokens": 152985050.0, "step": 66790 }, { "entropy": 5.281155109405518, "epoch": 6.602906287069988, "grad_norm": 1.1953125, "learning_rate": 0.00016849677126182943, "loss": 4.6319, "mean_token_accuracy": 0.25624012351036074, "num_tokens": 152997114.0, "step": 66795 }, { "entropy": 5.262435483932495, "epoch": 6.603400553578489, "grad_norm": 1.25, "learning_rate": 0.0001684656864845868, "loss": 4.6323, "mean_token_accuracy": 0.25674405694007874, "num_tokens": 153009391.0, "step": 66800 }, { "entropy": 5.280968856811524, "epoch": 6.603894820086991, "grad_norm": 1.15625, "learning_rate": 0.00016843460432810462, "loss": 4.6453, "mean_token_accuracy": 0.25988237708806994, "num_tokens": 153020907.0, "step": 66805 }, { "entropy": 5.2467848777771, "epoch": 6.604389086595492, "grad_norm": 1.3203125, "learning_rate": 0.0001684035247931478, "loss": 4.6261, "mean_token_accuracy": 0.2582865297794342, "num_tokens": 153032982.0, "step": 66810 }, { "entropy": 5.212636852264405, "epoch": 6.604883353103993, "grad_norm": 1.28125, "learning_rate": 0.0001683724478804809, "loss": 4.5226, "mean_token_accuracy": 0.26419616043567656, "num_tokens": 153043462.0, "step": 66815 }, { "entropy": 5.26878514289856, "epoch": 6.605377619612495, "grad_norm": 1.1640625, "learning_rate": 0.0001683413735908682, "loss": 4.6565, "mean_token_accuracy": 0.2559031754732132, "num_tokens": 153054473.0, "step": 66820 }, { "entropy": 5.203996276855468, "epoch": 6.605871886120997, "grad_norm": 1.09375, "learning_rate": 0.0001683103019250744, "loss": 4.5371, "mean_token_accuracy": 0.271462020277977, "num_tokens": 153065362.0, "step": 66825 }, { "entropy": 5.226438236236572, "epoch": 6.606366152629498, "grad_norm": 1.2109375, "learning_rate": 0.0001682792328838636, "loss": 4.6317, "mean_token_accuracy": 0.2569854110479355, "num_tokens": 153077414.0, "step": 66830 }, { "entropy": 5.317917108535767, "epoch": 6.606860419137999, "grad_norm": 1.1953125, "learning_rate": 0.00016824816646800018, "loss": 4.7216, "mean_token_accuracy": 0.24770596474409104, "num_tokens": 153089360.0, "step": 66835 }, { "entropy": 5.340992546081543, "epoch": 6.6073546856465, "grad_norm": 1.203125, "learning_rate": 0.00016821710267824855, "loss": 4.7437, "mean_token_accuracy": 0.24495125263929368, "num_tokens": 153102193.0, "step": 66840 }, { "entropy": 5.229151391983033, "epoch": 6.607848952155002, "grad_norm": 1.0859375, "learning_rate": 0.00016818604151537267, "loss": 4.5729, "mean_token_accuracy": 0.264537487924099, "num_tokens": 153113194.0, "step": 66845 }, { "entropy": 5.26492977142334, "epoch": 6.608343218663503, "grad_norm": 1.25, "learning_rate": 0.00016815498298013688, "loss": 4.6639, "mean_token_accuracy": 0.2542135089635849, "num_tokens": 153124444.0, "step": 66850 }, { "entropy": 5.257724952697754, "epoch": 6.608837485172005, "grad_norm": 1.1953125, "learning_rate": 0.00016812392707330495, "loss": 4.5739, "mean_token_accuracy": 0.2633061736822128, "num_tokens": 153136374.0, "step": 66855 }, { "entropy": 5.261695528030396, "epoch": 6.609331751680506, "grad_norm": 1.171875, "learning_rate": 0.00016809287379564104, "loss": 4.597, "mean_token_accuracy": 0.25685767978429797, "num_tokens": 153147784.0, "step": 66860 }, { "entropy": 5.221101570129394, "epoch": 6.609826018189008, "grad_norm": 1.1875, "learning_rate": 0.00016806182314790897, "loss": 4.5855, "mean_token_accuracy": 0.27296270728111266, "num_tokens": 153157771.0, "step": 66865 }, { "entropy": 5.220358419418335, "epoch": 6.610320284697509, "grad_norm": 1.1953125, "learning_rate": 0.00016803077513087266, "loss": 4.6579, "mean_token_accuracy": 0.2502910926938057, "num_tokens": 153169001.0, "step": 66870 }, { "entropy": 5.293990898132324, "epoch": 6.61081455120601, "grad_norm": 1.1796875, "learning_rate": 0.00016799972974529596, "loss": 4.6733, "mean_token_accuracy": 0.2560719668865204, "num_tokens": 153179750.0, "step": 66875 }, { "entropy": 5.207250547409058, "epoch": 6.611308817714511, "grad_norm": 1.203125, "learning_rate": 0.00016796868699194245, "loss": 4.5639, "mean_token_accuracy": 0.2601840227842331, "num_tokens": 153190680.0, "step": 66880 }, { "entropy": 5.1924046039581295, "epoch": 6.611803084223013, "grad_norm": 1.15625, "learning_rate": 0.0001679376468715758, "loss": 4.5262, "mean_token_accuracy": 0.271185402572155, "num_tokens": 153201658.0, "step": 66885 }, { "entropy": 5.225381755828858, "epoch": 6.612297350731515, "grad_norm": 1.2734375, "learning_rate": 0.00016790660938495965, "loss": 4.5966, "mean_token_accuracy": 0.2616109296679497, "num_tokens": 153211808.0, "step": 66890 }, { "entropy": 5.1741101264953615, "epoch": 6.612791617240016, "grad_norm": 1.1484375, "learning_rate": 0.00016787557453285757, "loss": 4.4718, "mean_token_accuracy": 0.2712625220417976, "num_tokens": 153222902.0, "step": 66895 }, { "entropy": 5.250565481185913, "epoch": 6.613285883748517, "grad_norm": 1.171875, "learning_rate": 0.000167844542316033, "loss": 4.5746, "mean_token_accuracy": 0.2643302634358406, "num_tokens": 153232841.0, "step": 66900 }, { "entropy": 5.249734210968017, "epoch": 6.613780150257019, "grad_norm": 1.1796875, "learning_rate": 0.00016781351273524928, "loss": 4.596, "mean_token_accuracy": 0.26437547951936724, "num_tokens": 153243926.0, "step": 66905 }, { "entropy": 5.204269075393677, "epoch": 6.61427441676552, "grad_norm": 1.171875, "learning_rate": 0.00016778248579126976, "loss": 4.5573, "mean_token_accuracy": 0.2652255445718765, "num_tokens": 153255419.0, "step": 66910 }, { "entropy": 5.322042751312256, "epoch": 6.614768683274021, "grad_norm": 1.1171875, "learning_rate": 0.00016775146148485782, "loss": 4.6866, "mean_token_accuracy": 0.24815808236598969, "num_tokens": 153267480.0, "step": 66915 }, { "entropy": 5.177121973037719, "epoch": 6.615262949782522, "grad_norm": 1.1875, "learning_rate": 0.00016772043981677637, "loss": 4.5277, "mean_token_accuracy": 0.26611898094415665, "num_tokens": 153278842.0, "step": 66920 }, { "entropy": 5.201435470581055, "epoch": 6.6157572162910245, "grad_norm": 1.2734375, "learning_rate": 0.0001676894207877889, "loss": 4.5674, "mean_token_accuracy": 0.260716150701046, "num_tokens": 153290326.0, "step": 66925 }, { "entropy": 5.223973083496094, "epoch": 6.616251482799526, "grad_norm": 1.1328125, "learning_rate": 0.00016765840439865825, "loss": 4.5221, "mean_token_accuracy": 0.26709653437137604, "num_tokens": 153301810.0, "step": 66930 }, { "entropy": 5.2368792533874515, "epoch": 6.616745749308027, "grad_norm": 1.171875, "learning_rate": 0.00016762739065014754, "loss": 4.6357, "mean_token_accuracy": 0.26006568521261214, "num_tokens": 153312724.0, "step": 66935 }, { "entropy": 5.325265741348266, "epoch": 6.617240015816528, "grad_norm": 1.2265625, "learning_rate": 0.00016759637954301973, "loss": 4.6379, "mean_token_accuracy": 0.2555119782686234, "num_tokens": 153324170.0, "step": 66940 }, { "entropy": 5.3141378402709964, "epoch": 6.61773428232503, "grad_norm": 1.2265625, "learning_rate": 0.00016756537107803757, "loss": 4.6702, "mean_token_accuracy": 0.2507491931319237, "num_tokens": 153334561.0, "step": 66945 }, { "entropy": 5.251597452163696, "epoch": 6.618228548833531, "grad_norm": 1.234375, "learning_rate": 0.00016753436525596393, "loss": 4.606, "mean_token_accuracy": 0.2583008483052254, "num_tokens": 153347387.0, "step": 66950 }, { "entropy": 5.249627590179443, "epoch": 6.618722815342032, "grad_norm": 1.1796875, "learning_rate": 0.00016750336207756162, "loss": 4.6186, "mean_token_accuracy": 0.2592558145523071, "num_tokens": 153359496.0, "step": 66955 }, { "entropy": 5.270172119140625, "epoch": 6.619217081850534, "grad_norm": 1.2890625, "learning_rate": 0.00016747236154359324, "loss": 4.6984, "mean_token_accuracy": 0.2581398352980614, "num_tokens": 153370185.0, "step": 66960 }, { "entropy": 5.3045854568481445, "epoch": 6.6197113483590355, "grad_norm": 1.234375, "learning_rate": 0.00016744136365482153, "loss": 4.6811, "mean_token_accuracy": 0.2546562239527702, "num_tokens": 153381820.0, "step": 66965 }, { "entropy": 5.271922397613525, "epoch": 6.620205614867537, "grad_norm": 1.1484375, "learning_rate": 0.0001674103684120089, "loss": 4.5763, "mean_token_accuracy": 0.25488954335451125, "num_tokens": 153392962.0, "step": 66970 }, { "entropy": 5.231155681610107, "epoch": 6.620699881376038, "grad_norm": 1.1171875, "learning_rate": 0.00016737937581591788, "loss": 4.5534, "mean_token_accuracy": 0.2673546075820923, "num_tokens": 153403936.0, "step": 66975 }, { "entropy": 5.263865041732788, "epoch": 6.621194147884539, "grad_norm": 1.2109375, "learning_rate": 0.00016734838586731095, "loss": 4.6237, "mean_token_accuracy": 0.2590665429830551, "num_tokens": 153413892.0, "step": 66980 }, { "entropy": 5.200263166427613, "epoch": 6.621688414393041, "grad_norm": 1.265625, "learning_rate": 0.00016731739856695038, "loss": 4.5564, "mean_token_accuracy": 0.2707618877291679, "num_tokens": 153423574.0, "step": 66985 }, { "entropy": 5.23586483001709, "epoch": 6.622182680901542, "grad_norm": 1.15625, "learning_rate": 0.00016728641391559862, "loss": 4.6192, "mean_token_accuracy": 0.25646535158157346, "num_tokens": 153434310.0, "step": 66990 }, { "entropy": 5.167594718933105, "epoch": 6.622676947410044, "grad_norm": 1.2265625, "learning_rate": 0.0001672554319140177, "loss": 4.5439, "mean_token_accuracy": 0.26658025234937666, "num_tokens": 153445996.0, "step": 66995 }, { "entropy": 5.264065170288086, "epoch": 6.623171213918545, "grad_norm": 1.1875, "learning_rate": 0.00016722445256296987, "loss": 4.5958, "mean_token_accuracy": 0.26460622251033783, "num_tokens": 153456202.0, "step": 67000 }, { "entropy": 5.265933799743652, "epoch": 6.6236654804270465, "grad_norm": 1.203125, "learning_rate": 0.00016719347586321732, "loss": 4.564, "mean_token_accuracy": 0.2624755248427391, "num_tokens": 153467748.0, "step": 67005 }, { "entropy": 5.316260194778442, "epoch": 6.624159746935548, "grad_norm": 1.3125, "learning_rate": 0.0001671625018155218, "loss": 4.6222, "mean_token_accuracy": 0.2629639804363251, "num_tokens": 153478818.0, "step": 67010 }, { "entropy": 5.1844977855682375, "epoch": 6.624654013444049, "grad_norm": 1.265625, "learning_rate": 0.00016713153042064566, "loss": 4.5457, "mean_token_accuracy": 0.2633383795619011, "num_tokens": 153490196.0, "step": 67015 }, { "entropy": 5.165050029754639, "epoch": 6.62514827995255, "grad_norm": 1.1953125, "learning_rate": 0.00016710056167935051, "loss": 4.4858, "mean_token_accuracy": 0.26984335780143737, "num_tokens": 153500657.0, "step": 67020 }, { "entropy": 5.276038074493409, "epoch": 6.6256425464610516, "grad_norm": 1.1875, "learning_rate": 0.00016706959559239826, "loss": 4.7256, "mean_token_accuracy": 0.2543449193239212, "num_tokens": 153512098.0, "step": 67025 }, { "entropy": 5.305298471450806, "epoch": 6.626136812969553, "grad_norm": 1.234375, "learning_rate": 0.00016703863216055082, "loss": 4.7613, "mean_token_accuracy": 0.25327942818403243, "num_tokens": 153523640.0, "step": 67030 }, { "entropy": 5.362072896957398, "epoch": 6.626631079478054, "grad_norm": 1.1640625, "learning_rate": 0.00016700767138456968, "loss": 4.7044, "mean_token_accuracy": 0.24255306273698807, "num_tokens": 153536242.0, "step": 67035 }, { "entropy": 5.283941316604614, "epoch": 6.627125345986556, "grad_norm": 1.2109375, "learning_rate": 0.00016697671326521655, "loss": 4.5908, "mean_token_accuracy": 0.2591036260128021, "num_tokens": 153546831.0, "step": 67040 }, { "entropy": 5.304578876495361, "epoch": 6.6276196124950575, "grad_norm": 1.203125, "learning_rate": 0.00016694575780325306, "loss": 4.6564, "mean_token_accuracy": 0.25920530408620834, "num_tokens": 153558956.0, "step": 67045 }, { "entropy": 5.173925733566284, "epoch": 6.628113879003559, "grad_norm": 1.1328125, "learning_rate": 0.0001669148049994407, "loss": 4.5887, "mean_token_accuracy": 0.26666880697011947, "num_tokens": 153570811.0, "step": 67050 }, { "entropy": 5.272926712036133, "epoch": 6.62860814551206, "grad_norm": 1.1328125, "learning_rate": 0.000166883854854541, "loss": 4.7291, "mean_token_accuracy": 0.25241284519433976, "num_tokens": 153583765.0, "step": 67055 }, { "entropy": 5.322502994537354, "epoch": 6.629102412020561, "grad_norm": 1.1875, "learning_rate": 0.0001668529073693151, "loss": 4.6884, "mean_token_accuracy": 0.2482796713709831, "num_tokens": 153595625.0, "step": 67060 }, { "entropy": 5.254661226272583, "epoch": 6.6295966785290625, "grad_norm": 1.21875, "learning_rate": 0.0001668219625445245, "loss": 4.5613, "mean_token_accuracy": 0.26330557465553284, "num_tokens": 153606920.0, "step": 67065 }, { "entropy": 5.292379713058471, "epoch": 6.630090945037564, "grad_norm": 1.15625, "learning_rate": 0.00016679102038093038, "loss": 4.6263, "mean_token_accuracy": 0.25361894220113756, "num_tokens": 153617914.0, "step": 67070 }, { "entropy": 5.307014894485474, "epoch": 6.630585211546066, "grad_norm": 1.234375, "learning_rate": 0.00016676008087929397, "loss": 4.7117, "mean_token_accuracy": 0.25368539839982984, "num_tokens": 153630230.0, "step": 67075 }, { "entropy": 5.230663061141968, "epoch": 6.631079478054567, "grad_norm": 1.1328125, "learning_rate": 0.00016672914404037642, "loss": 4.6869, "mean_token_accuracy": 0.2547136217355728, "num_tokens": 153642730.0, "step": 67080 }, { "entropy": 5.278535175323486, "epoch": 6.6315737445630685, "grad_norm": 1.1875, "learning_rate": 0.00016669820986493867, "loss": 4.6874, "mean_token_accuracy": 0.24986326098442077, "num_tokens": 153654356.0, "step": 67085 }, { "entropy": 5.2513916015625, "epoch": 6.63206801107157, "grad_norm": 1.1875, "learning_rate": 0.00016666727835374176, "loss": 4.6187, "mean_token_accuracy": 0.26144590228796005, "num_tokens": 153667061.0, "step": 67090 }, { "entropy": 5.221053886413574, "epoch": 6.632562277580071, "grad_norm": 1.1796875, "learning_rate": 0.00016663634950754658, "loss": 4.5952, "mean_token_accuracy": 0.26662143915891645, "num_tokens": 153678274.0, "step": 67095 }, { "entropy": 5.296600008010865, "epoch": 6.633056544088572, "grad_norm": 1.1875, "learning_rate": 0.00016660542332711404, "loss": 4.6803, "mean_token_accuracy": 0.2534095898270607, "num_tokens": 153690358.0, "step": 67100 }, { "entropy": 5.315274333953857, "epoch": 6.6335508105970735, "grad_norm": 1.1484375, "learning_rate": 0.00016657449981320496, "loss": 4.6839, "mean_token_accuracy": 0.2530794307589531, "num_tokens": 153701684.0, "step": 67105 }, { "entropy": 5.254129219055176, "epoch": 6.634045077105576, "grad_norm": 1.109375, "learning_rate": 0.00016654357896657995, "loss": 4.5868, "mean_token_accuracy": 0.2643182992935181, "num_tokens": 153713308.0, "step": 67110 }, { "entropy": 5.297394132614135, "epoch": 6.634539343614077, "grad_norm": 1.1953125, "learning_rate": 0.0001665126607879997, "loss": 4.6698, "mean_token_accuracy": 0.25635807812213895, "num_tokens": 153724004.0, "step": 67115 }, { "entropy": 5.2138872146606445, "epoch": 6.635033610122578, "grad_norm": 1.234375, "learning_rate": 0.0001664817452782249, "loss": 4.6218, "mean_token_accuracy": 0.2631453350186348, "num_tokens": 153735958.0, "step": 67120 }, { "entropy": 5.271019649505615, "epoch": 6.6355278766310795, "grad_norm": 1.1953125, "learning_rate": 0.00016645083243801588, "loss": 4.633, "mean_token_accuracy": 0.25463125854730606, "num_tokens": 153747583.0, "step": 67125 }, { "entropy": 5.289411973953247, "epoch": 6.636022143139581, "grad_norm": 1.0546875, "learning_rate": 0.00016641992226813334, "loss": 4.661, "mean_token_accuracy": 0.25650125592947004, "num_tokens": 153760718.0, "step": 67130 }, { "entropy": 5.283626508712769, "epoch": 6.636516409648082, "grad_norm": 1.2421875, "learning_rate": 0.00016638901476933752, "loss": 4.6425, "mean_token_accuracy": 0.252416267991066, "num_tokens": 153772168.0, "step": 67135 }, { "entropy": 5.2673968315124515, "epoch": 6.637010676156583, "grad_norm": 1.2109375, "learning_rate": 0.00016635810994238877, "loss": 4.6114, "mean_token_accuracy": 0.2575372770428658, "num_tokens": 153783512.0, "step": 67140 }, { "entropy": 5.279419994354248, "epoch": 6.637504942665085, "grad_norm": 1.1875, "learning_rate": 0.00016632720778804742, "loss": 4.6269, "mean_token_accuracy": 0.2608764126896858, "num_tokens": 153794237.0, "step": 67145 }, { "entropy": 5.27080545425415, "epoch": 6.637999209173587, "grad_norm": 1.09375, "learning_rate": 0.00016629630830707358, "loss": 4.5965, "mean_token_accuracy": 0.2575927898287773, "num_tokens": 153805447.0, "step": 67150 }, { "entropy": 5.224691581726074, "epoch": 6.638493475682088, "grad_norm": 1.328125, "learning_rate": 0.0001662654115002274, "loss": 4.5483, "mean_token_accuracy": 0.26325780600309373, "num_tokens": 153817458.0, "step": 67155 }, { "entropy": 5.2299247741699215, "epoch": 6.638987742190589, "grad_norm": 1.2265625, "learning_rate": 0.0001662345173682689, "loss": 4.5389, "mean_token_accuracy": 0.2659530326724052, "num_tokens": 153828523.0, "step": 67160 }, { "entropy": 5.295616579055786, "epoch": 6.63948200869909, "grad_norm": 1.3359375, "learning_rate": 0.00016620362591195824, "loss": 4.6286, "mean_token_accuracy": 0.25551907867193224, "num_tokens": 153840136.0, "step": 67165 }, { "entropy": 5.195625829696655, "epoch": 6.639976275207592, "grad_norm": 1.2265625, "learning_rate": 0.00016617273713205534, "loss": 4.5426, "mean_token_accuracy": 0.26503860056400297, "num_tokens": 153850604.0, "step": 67170 }, { "entropy": 5.244452619552613, "epoch": 6.640470541716093, "grad_norm": 1.203125, "learning_rate": 0.00016614185102931984, "loss": 4.653, "mean_token_accuracy": 0.2593907654285431, "num_tokens": 153862315.0, "step": 67175 }, { "entropy": 5.305614900588989, "epoch": 6.640964808224595, "grad_norm": 1.1953125, "learning_rate": 0.00016611096760451183, "loss": 4.6206, "mean_token_accuracy": 0.25807925313711166, "num_tokens": 153873148.0, "step": 67180 }, { "entropy": 5.2168111324310305, "epoch": 6.641459074733096, "grad_norm": 1.1875, "learning_rate": 0.00016608008685839071, "loss": 4.5397, "mean_token_accuracy": 0.261376953125, "num_tokens": 153884218.0, "step": 67185 }, { "entropy": 5.320377969741822, "epoch": 6.641953341241598, "grad_norm": 1.1796875, "learning_rate": 0.00016604920879171648, "loss": 4.667, "mean_token_accuracy": 0.25619097948074343, "num_tokens": 153894611.0, "step": 67190 }, { "entropy": 5.251422119140625, "epoch": 6.642447607750099, "grad_norm": 1.25, "learning_rate": 0.00016601833340524865, "loss": 4.6625, "mean_token_accuracy": 0.2569408729672432, "num_tokens": 153906288.0, "step": 67195 }, { "entropy": 5.21707124710083, "epoch": 6.6429418742586, "grad_norm": 1.3125, "learning_rate": 0.00016598746069974667, "loss": 4.5874, "mean_token_accuracy": 0.26819446235895156, "num_tokens": 153916737.0, "step": 67200 }, { "entropy": 5.248983764648438, "epoch": 6.643436140767101, "grad_norm": 1.171875, "learning_rate": 0.00016595659067597017, "loss": 4.6115, "mean_token_accuracy": 0.2507438316941261, "num_tokens": 153928944.0, "step": 67205 }, { "entropy": 5.258445358276367, "epoch": 6.643930407275603, "grad_norm": 1.203125, "learning_rate": 0.00016592572333467827, "loss": 4.5836, "mean_token_accuracy": 0.2586585536599159, "num_tokens": 153939470.0, "step": 67210 }, { "entropy": 5.297702646255493, "epoch": 6.644424673784105, "grad_norm": 1.2421875, "learning_rate": 0.00016589485867663057, "loss": 4.6863, "mean_token_accuracy": 0.2468152165412903, "num_tokens": 153950350.0, "step": 67215 }, { "entropy": 5.334017992019653, "epoch": 6.644918940292606, "grad_norm": 1.09375, "learning_rate": 0.00016586399670258633, "loss": 4.7334, "mean_token_accuracy": 0.24829929769039155, "num_tokens": 153961983.0, "step": 67220 }, { "entropy": 5.1916022300720215, "epoch": 6.645413206801107, "grad_norm": 1.25, "learning_rate": 0.00016583313741330464, "loss": 4.5587, "mean_token_accuracy": 0.27017234116792677, "num_tokens": 153972581.0, "step": 67225 }, { "entropy": 5.218779611587524, "epoch": 6.645907473309609, "grad_norm": 1.2421875, "learning_rate": 0.00016580228080954483, "loss": 4.633, "mean_token_accuracy": 0.25724322646856307, "num_tokens": 153983860.0, "step": 67230 }, { "entropy": 5.174576616287231, "epoch": 6.64640173981811, "grad_norm": 1.21875, "learning_rate": 0.00016577142689206572, "loss": 4.4583, "mean_token_accuracy": 0.2736694812774658, "num_tokens": 153994719.0, "step": 67235 }, { "entropy": 5.234165287017822, "epoch": 6.646896006326611, "grad_norm": 1.2109375, "learning_rate": 0.0001657405756616264, "loss": 4.6166, "mean_token_accuracy": 0.25889254063367845, "num_tokens": 154006404.0, "step": 67240 }, { "entropy": 5.230730772018433, "epoch": 6.647390272835112, "grad_norm": 1.140625, "learning_rate": 0.00016570972711898603, "loss": 4.6036, "mean_token_accuracy": 0.2627850860357285, "num_tokens": 154017763.0, "step": 67245 }, { "entropy": 5.292861270904541, "epoch": 6.647884539343615, "grad_norm": 1.1015625, "learning_rate": 0.00016567888126490322, "loss": 4.6477, "mean_token_accuracy": 0.25353935807943345, "num_tokens": 154029187.0, "step": 67250 }, { "entropy": 5.264308738708496, "epoch": 6.648378805852116, "grad_norm": 1.203125, "learning_rate": 0.00016564803810013702, "loss": 4.6171, "mean_token_accuracy": 0.2587848216295242, "num_tokens": 154039939.0, "step": 67255 }, { "entropy": 5.270083332061768, "epoch": 6.648873072360617, "grad_norm": 1.1640625, "learning_rate": 0.0001656171976254459, "loss": 4.5933, "mean_token_accuracy": 0.2587528213858604, "num_tokens": 154051775.0, "step": 67260 }, { "entropy": 5.268478727340698, "epoch": 6.649367338869118, "grad_norm": 1.15625, "learning_rate": 0.00016558635984158877, "loss": 4.6334, "mean_token_accuracy": 0.2495976507663727, "num_tokens": 154063005.0, "step": 67265 }, { "entropy": 5.1327485084533695, "epoch": 6.64986160537762, "grad_norm": 1.28125, "learning_rate": 0.00016555552474932408, "loss": 4.5098, "mean_token_accuracy": 0.26915094554424285, "num_tokens": 154074824.0, "step": 67270 }, { "entropy": 5.275473976135254, "epoch": 6.650355871886121, "grad_norm": 1.1875, "learning_rate": 0.00016552469234941048, "loss": 4.6123, "mean_token_accuracy": 0.25661620795726775, "num_tokens": 154085697.0, "step": 67275 }, { "entropy": 5.189825582504272, "epoch": 6.650850138394622, "grad_norm": 1.2265625, "learning_rate": 0.00016549386264260658, "loss": 4.5579, "mean_token_accuracy": 0.26609749644994735, "num_tokens": 154097690.0, "step": 67280 }, { "entropy": 5.234873294830322, "epoch": 6.651344404903123, "grad_norm": 1.21875, "learning_rate": 0.0001654630356296705, "loss": 4.5009, "mean_token_accuracy": 0.2707811802625656, "num_tokens": 154108544.0, "step": 67285 }, { "entropy": 5.253859281539917, "epoch": 6.651838671411625, "grad_norm": 1.0703125, "learning_rate": 0.00016543221131136074, "loss": 4.666, "mean_token_accuracy": 0.25457004010677337, "num_tokens": 154121592.0, "step": 67290 }, { "entropy": 5.202156686782837, "epoch": 6.652332937920127, "grad_norm": 1.1484375, "learning_rate": 0.00016540138968843565, "loss": 4.5983, "mean_token_accuracy": 0.2586261034011841, "num_tokens": 154132862.0, "step": 67295 }, { "entropy": 5.219757556915283, "epoch": 6.652827204428628, "grad_norm": 1.1484375, "learning_rate": 0.00016537057076165327, "loss": 4.5471, "mean_token_accuracy": 0.26050908863544464, "num_tokens": 154143889.0, "step": 67300 }, { "entropy": 5.315466022491455, "epoch": 6.653321470937129, "grad_norm": 1.171875, "learning_rate": 0.00016533975453177197, "loss": 4.6675, "mean_token_accuracy": 0.2491464138031006, "num_tokens": 154155399.0, "step": 67305 }, { "entropy": 5.2681999683380125, "epoch": 6.653815737445631, "grad_norm": 1.171875, "learning_rate": 0.00016530894099954965, "loss": 4.6027, "mean_token_accuracy": 0.2620026707649231, "num_tokens": 154165600.0, "step": 67310 }, { "entropy": 5.226325416564942, "epoch": 6.654310003954132, "grad_norm": 1.2265625, "learning_rate": 0.00016527813016574438, "loss": 4.5632, "mean_token_accuracy": 0.2746943116188049, "num_tokens": 154175764.0, "step": 67315 }, { "entropy": 5.256222438812256, "epoch": 6.654804270462633, "grad_norm": 1.2109375, "learning_rate": 0.00016524732203111424, "loss": 4.6392, "mean_token_accuracy": 0.2582618936896324, "num_tokens": 154186648.0, "step": 67320 }, { "entropy": 5.272159814834595, "epoch": 6.655298536971134, "grad_norm": 1.25, "learning_rate": 0.00016521651659641694, "loss": 4.6635, "mean_token_accuracy": 0.2510208562016487, "num_tokens": 154197706.0, "step": 67325 }, { "entropy": 5.259057235717774, "epoch": 6.6557928034796365, "grad_norm": 1.171875, "learning_rate": 0.00016518571386241036, "loss": 4.6445, "mean_token_accuracy": 0.26153298318386076, "num_tokens": 154209899.0, "step": 67330 }, { "entropy": 5.321467113494873, "epoch": 6.656287069988138, "grad_norm": 1.1484375, "learning_rate": 0.00016515491382985221, "loss": 4.6906, "mean_token_accuracy": 0.24674302488565444, "num_tokens": 154222036.0, "step": 67335 }, { "entropy": 5.260276651382446, "epoch": 6.656781336496639, "grad_norm": 1.1953125, "learning_rate": 0.00016512411649950026, "loss": 4.5931, "mean_token_accuracy": 0.2703256830573082, "num_tokens": 154234754.0, "step": 67340 }, { "entropy": 5.207006120681763, "epoch": 6.65727560300514, "grad_norm": 1.125, "learning_rate": 0.0001650933218721122, "loss": 4.595, "mean_token_accuracy": 0.27154116332530975, "num_tokens": 154245652.0, "step": 67345 }, { "entropy": 5.209630060195923, "epoch": 6.657769869513642, "grad_norm": 1.125, "learning_rate": 0.00016506252994844532, "loss": 4.5708, "mean_token_accuracy": 0.2659613057971001, "num_tokens": 154256787.0, "step": 67350 }, { "entropy": 5.282996129989624, "epoch": 6.658264136022143, "grad_norm": 1.1796875, "learning_rate": 0.00016503174072925728, "loss": 4.7312, "mean_token_accuracy": 0.2491853952407837, "num_tokens": 154268042.0, "step": 67355 }, { "entropy": 5.221425008773804, "epoch": 6.658758402530644, "grad_norm": 1.1640625, "learning_rate": 0.00016500095421530548, "loss": 4.5378, "mean_token_accuracy": 0.2661911964416504, "num_tokens": 154279392.0, "step": 67360 }, { "entropy": 5.290345764160156, "epoch": 6.659252669039146, "grad_norm": 1.109375, "learning_rate": 0.0001649701704073473, "loss": 4.6232, "mean_token_accuracy": 0.2597155287861824, "num_tokens": 154291659.0, "step": 67365 }, { "entropy": 5.250437545776367, "epoch": 6.6597469355476475, "grad_norm": 1.1328125, "learning_rate": 0.00016493938930614002, "loss": 4.5925, "mean_token_accuracy": 0.26028256565332414, "num_tokens": 154303493.0, "step": 67370 }, { "entropy": 5.238242053985596, "epoch": 6.660241202056149, "grad_norm": 1.125, "learning_rate": 0.0001649086109124408, "loss": 4.5613, "mean_token_accuracy": 0.2619288682937622, "num_tokens": 154314463.0, "step": 67375 }, { "entropy": 5.241728258132935, "epoch": 6.66073546856465, "grad_norm": 1.265625, "learning_rate": 0.00016487783522700685, "loss": 4.6434, "mean_token_accuracy": 0.2513466075062752, "num_tokens": 154326382.0, "step": 67380 }, { "entropy": 5.311656665802002, "epoch": 6.661229735073151, "grad_norm": 1.25, "learning_rate": 0.00016484706225059517, "loss": 4.743, "mean_token_accuracy": 0.24738131314516068, "num_tokens": 154338667.0, "step": 67385 }, { "entropy": 5.289571285247803, "epoch": 6.661724001581653, "grad_norm": 1.140625, "learning_rate": 0.00016481629198396292, "loss": 4.6532, "mean_token_accuracy": 0.25456441640853883, "num_tokens": 154350529.0, "step": 67390 }, { "entropy": 5.306266212463379, "epoch": 6.662218268090154, "grad_norm": 1.1953125, "learning_rate": 0.00016478552442786705, "loss": 4.6558, "mean_token_accuracy": 0.25979343205690386, "num_tokens": 154361794.0, "step": 67395 }, { "entropy": 5.351549053192139, "epoch": 6.662712534598656, "grad_norm": 1.1796875, "learning_rate": 0.00016475475958306423, "loss": 4.6987, "mean_token_accuracy": 0.25254271924495697, "num_tokens": 154373675.0, "step": 67400 }, { "entropy": 5.272830200195313, "epoch": 6.663206801107157, "grad_norm": 1.171875, "learning_rate": 0.00016472399745031148, "loss": 4.5996, "mean_token_accuracy": 0.2582428306341171, "num_tokens": 154385930.0, "step": 67405 }, { "entropy": 5.201229190826416, "epoch": 6.6637010676156585, "grad_norm": 1.078125, "learning_rate": 0.00016469323803036562, "loss": 4.5424, "mean_token_accuracy": 0.26197796016931535, "num_tokens": 154397590.0, "step": 67410 }, { "entropy": 5.26943736076355, "epoch": 6.66419533412416, "grad_norm": 1.0546875, "learning_rate": 0.000164662481323983, "loss": 4.6304, "mean_token_accuracy": 0.2628330081701279, "num_tokens": 154407814.0, "step": 67415 }, { "entropy": 5.194278383255005, "epoch": 6.664689600632661, "grad_norm": 1.2421875, "learning_rate": 0.00016463172733192062, "loss": 4.549, "mean_token_accuracy": 0.2685982957482338, "num_tokens": 154418140.0, "step": 67420 }, { "entropy": 5.23756742477417, "epoch": 6.665183867141162, "grad_norm": 1.09375, "learning_rate": 0.00016460097605493478, "loss": 4.5713, "mean_token_accuracy": 0.2649116858839989, "num_tokens": 154429905.0, "step": 67425 }, { "entropy": 5.251157760620117, "epoch": 6.6656781336496636, "grad_norm": 1.2578125, "learning_rate": 0.0001645702274937821, "loss": 4.6443, "mean_token_accuracy": 0.25553643256425856, "num_tokens": 154441687.0, "step": 67430 }, { "entropy": 5.231770753860474, "epoch": 6.666172400158166, "grad_norm": 1.203125, "learning_rate": 0.000164539481649219, "loss": 4.5958, "mean_token_accuracy": 0.26329686790704726, "num_tokens": 154452645.0, "step": 67435 }, { "entropy": 5.2331398010253904, "epoch": 6.666666666666667, "grad_norm": 1.21875, "learning_rate": 0.00016450873852200172, "loss": 4.6022, "mean_token_accuracy": 0.26869464218616484, "num_tokens": 154464409.0, "step": 67440 }, { "entropy": 5.281878662109375, "epoch": 6.667160933175168, "grad_norm": 1.2265625, "learning_rate": 0.00016447799811288662, "loss": 4.639, "mean_token_accuracy": 0.25779789239168166, "num_tokens": 154475263.0, "step": 67445 }, { "entropy": 5.184699869155883, "epoch": 6.6676551996836695, "grad_norm": 1.1953125, "learning_rate": 0.00016444726042262988, "loss": 4.5132, "mean_token_accuracy": 0.2726029589772224, "num_tokens": 154486035.0, "step": 67450 }, { "entropy": 5.326839303970337, "epoch": 6.668149466192171, "grad_norm": 1.15625, "learning_rate": 0.0001644165254519877, "loss": 4.686, "mean_token_accuracy": 0.2487174913287163, "num_tokens": 154495824.0, "step": 67455 }, { "entropy": 5.292892074584961, "epoch": 6.668643732700672, "grad_norm": 1.203125, "learning_rate": 0.00016438579320171627, "loss": 4.5981, "mean_token_accuracy": 0.2620166510343552, "num_tokens": 154506517.0, "step": 67460 }, { "entropy": 5.229036569595337, "epoch": 6.669137999209173, "grad_norm": 1.171875, "learning_rate": 0.00016435506367257132, "loss": 4.5558, "mean_token_accuracy": 0.26902915686368944, "num_tokens": 154517342.0, "step": 67465 }, { "entropy": 5.268471002578735, "epoch": 6.669632265717675, "grad_norm": 1.0546875, "learning_rate": 0.00016432433686530907, "loss": 4.585, "mean_token_accuracy": 0.2641123026609421, "num_tokens": 154528493.0, "step": 67470 }, { "entropy": 5.300795269012451, "epoch": 6.670126532226177, "grad_norm": 1.1796875, "learning_rate": 0.00016429361278068522, "loss": 4.6253, "mean_token_accuracy": 0.26248021721839904, "num_tokens": 154539289.0, "step": 67475 }, { "entropy": 5.230345344543457, "epoch": 6.670620798734678, "grad_norm": 1.2890625, "learning_rate": 0.00016426289141945573, "loss": 4.5906, "mean_token_accuracy": 0.26169908940792086, "num_tokens": 154551098.0, "step": 67480 }, { "entropy": 5.184922170639038, "epoch": 6.671115065243179, "grad_norm": 1.1875, "learning_rate": 0.00016423217278237635, "loss": 4.5501, "mean_token_accuracy": 0.27304927855730055, "num_tokens": 154561539.0, "step": 67485 }, { "entropy": 5.193884468078613, "epoch": 6.6716093317516805, "grad_norm": 1.1484375, "learning_rate": 0.00016420145687020264, "loss": 4.5429, "mean_token_accuracy": 0.26636056751012804, "num_tokens": 154572634.0, "step": 67490 }, { "entropy": 5.25727276802063, "epoch": 6.672103598260182, "grad_norm": 1.171875, "learning_rate": 0.00016417074368369023, "loss": 4.6738, "mean_token_accuracy": 0.25371771603822707, "num_tokens": 154584770.0, "step": 67495 }, { "entropy": 5.208295679092407, "epoch": 6.672597864768683, "grad_norm": 1.1328125, "learning_rate": 0.00016414003322359484, "loss": 4.5902, "mean_token_accuracy": 0.2549965664744377, "num_tokens": 154596308.0, "step": 67500 }, { "entropy": 5.323481559753418, "epoch": 6.673092131277185, "grad_norm": 1.046875, "learning_rate": 0.00016410932549067164, "loss": 4.6852, "mean_token_accuracy": 0.25441917330026625, "num_tokens": 154609045.0, "step": 67505 }, { "entropy": 5.318966579437256, "epoch": 6.673586397785686, "grad_norm": 1.1953125, "learning_rate": 0.00016407862048567647, "loss": 4.667, "mean_token_accuracy": 0.25026018768548963, "num_tokens": 154620970.0, "step": 67510 }, { "entropy": 5.218383264541626, "epoch": 6.674080664294188, "grad_norm": 1.28125, "learning_rate": 0.00016404791820936427, "loss": 4.5362, "mean_token_accuracy": 0.26602957844734193, "num_tokens": 154632594.0, "step": 67515 }, { "entropy": 5.249595022201538, "epoch": 6.674574930802689, "grad_norm": 1.1796875, "learning_rate": 0.00016401721866249054, "loss": 4.6719, "mean_token_accuracy": 0.2564134255051613, "num_tokens": 154644021.0, "step": 67520 }, { "entropy": 5.2126282215118405, "epoch": 6.67506919731119, "grad_norm": 1.25, "learning_rate": 0.00016398652184581054, "loss": 4.648, "mean_token_accuracy": 0.26022311896085737, "num_tokens": 154656341.0, "step": 67525 }, { "entropy": 5.258936023712158, "epoch": 6.6755634638196915, "grad_norm": 1.21875, "learning_rate": 0.00016395582776007923, "loss": 4.5991, "mean_token_accuracy": 0.26489354819059374, "num_tokens": 154667968.0, "step": 67530 }, { "entropy": 5.290037441253662, "epoch": 6.676057730328193, "grad_norm": 1.28125, "learning_rate": 0.00016392513640605175, "loss": 4.694, "mean_token_accuracy": 0.25219226330518724, "num_tokens": 154679390.0, "step": 67535 }, { "entropy": 5.28297700881958, "epoch": 6.676551996836694, "grad_norm": 1.3046875, "learning_rate": 0.0001638944477844832, "loss": 4.6294, "mean_token_accuracy": 0.2587075009942055, "num_tokens": 154689316.0, "step": 67540 }, { "entropy": 5.254177713394165, "epoch": 6.677046263345195, "grad_norm": 1.1953125, "learning_rate": 0.00016386376189612845, "loss": 4.6298, "mean_token_accuracy": 0.2533115804195404, "num_tokens": 154700927.0, "step": 67545 }, { "entropy": 5.237484931945801, "epoch": 6.677540529853697, "grad_norm": 1.25, "learning_rate": 0.00016383307874174246, "loss": 4.5998, "mean_token_accuracy": 0.25864225924015044, "num_tokens": 154712283.0, "step": 67550 }, { "entropy": 5.247775268554688, "epoch": 6.678034796362199, "grad_norm": 1.25, "learning_rate": 0.0001638023983220799, "loss": 4.5964, "mean_token_accuracy": 0.2525664195418358, "num_tokens": 154723495.0, "step": 67555 }, { "entropy": 5.2662458419799805, "epoch": 6.6785290628707, "grad_norm": 1.1484375, "learning_rate": 0.00016377172063789563, "loss": 4.6682, "mean_token_accuracy": 0.2511605113744736, "num_tokens": 154733990.0, "step": 67560 }, { "entropy": 5.255673742294311, "epoch": 6.679023329379201, "grad_norm": 1.203125, "learning_rate": 0.00016374104568994428, "loss": 4.6019, "mean_token_accuracy": 0.26071829795837403, "num_tokens": 154745061.0, "step": 67565 }, { "entropy": 5.2748466491699215, "epoch": 6.679517595887702, "grad_norm": 1.15625, "learning_rate": 0.00016371037347898042, "loss": 4.6224, "mean_token_accuracy": 0.25931268483400344, "num_tokens": 154756460.0, "step": 67570 }, { "entropy": 5.253764486312866, "epoch": 6.680011862396204, "grad_norm": 1.171875, "learning_rate": 0.00016367970400575876, "loss": 4.6197, "mean_token_accuracy": 0.25825379192829134, "num_tokens": 154768102.0, "step": 67575 }, { "entropy": 5.25981068611145, "epoch": 6.680506128904705, "grad_norm": 1.1875, "learning_rate": 0.0001636490372710336, "loss": 4.6126, "mean_token_accuracy": 0.25912067741155625, "num_tokens": 154778798.0, "step": 67580 }, { "entropy": 5.233668088912964, "epoch": 6.681000395413207, "grad_norm": 1.1328125, "learning_rate": 0.00016361837327555942, "loss": 4.6113, "mean_token_accuracy": 0.2580838367342949, "num_tokens": 154790609.0, "step": 67585 }, { "entropy": 5.254800415039062, "epoch": 6.681494661921708, "grad_norm": 1.15625, "learning_rate": 0.00016358771202009038, "loss": 4.5425, "mean_token_accuracy": 0.2640812575817108, "num_tokens": 154801956.0, "step": 67590 }, { "entropy": 5.286484813690185, "epoch": 6.68198892843021, "grad_norm": 1.2265625, "learning_rate": 0.00016355705350538103, "loss": 4.6459, "mean_token_accuracy": 0.25332494676113126, "num_tokens": 154812723.0, "step": 67595 }, { "entropy": 5.294887685775757, "epoch": 6.682483194938711, "grad_norm": 1.1875, "learning_rate": 0.0001635263977321855, "loss": 4.6057, "mean_token_accuracy": 0.26008186489343643, "num_tokens": 154824485.0, "step": 67600 }, { "entropy": 5.29683780670166, "epoch": 6.682977461447212, "grad_norm": 1.2109375, "learning_rate": 0.00016349574470125776, "loss": 4.6782, "mean_token_accuracy": 0.25326272994279864, "num_tokens": 154835391.0, "step": 67605 }, { "entropy": 5.297053241729737, "epoch": 6.683471727955713, "grad_norm": 1.03125, "learning_rate": 0.00016346509441335217, "loss": 4.6454, "mean_token_accuracy": 0.259730426967144, "num_tokens": 154848272.0, "step": 67610 }, { "entropy": 5.3247819423675535, "epoch": 6.683965994464215, "grad_norm": 1.078125, "learning_rate": 0.00016343444686922246, "loss": 4.6438, "mean_token_accuracy": 0.2533483296632767, "num_tokens": 154859136.0, "step": 67615 }, { "entropy": 5.276664304733276, "epoch": 6.684460260972717, "grad_norm": 1.1875, "learning_rate": 0.00016340380206962256, "loss": 4.6366, "mean_token_accuracy": 0.2469252750277519, "num_tokens": 154870863.0, "step": 67620 }, { "entropy": 5.270870733261108, "epoch": 6.684954527481218, "grad_norm": 1.171875, "learning_rate": 0.00016337316001530658, "loss": 4.6642, "mean_token_accuracy": 0.25708857774734495, "num_tokens": 154882237.0, "step": 67625 }, { "entropy": 5.227889490127564, "epoch": 6.685448793989719, "grad_norm": 1.078125, "learning_rate": 0.00016334252070702814, "loss": 4.5591, "mean_token_accuracy": 0.2569562360644341, "num_tokens": 154894766.0, "step": 67630 }, { "entropy": 5.231163597106933, "epoch": 6.685943060498221, "grad_norm": 1.0, "learning_rate": 0.00016331188414554104, "loss": 4.6305, "mean_token_accuracy": 0.2608619168400764, "num_tokens": 154907339.0, "step": 67635 }, { "entropy": 5.183197355270385, "epoch": 6.686437327006722, "grad_norm": 1.3125, "learning_rate": 0.0001632812503315989, "loss": 4.5488, "mean_token_accuracy": 0.2602658286690712, "num_tokens": 154919189.0, "step": 67640 }, { "entropy": 5.232086515426635, "epoch": 6.686931593515223, "grad_norm": 1.203125, "learning_rate": 0.0001632506192659553, "loss": 4.6352, "mean_token_accuracy": 0.25669817328453065, "num_tokens": 154930731.0, "step": 67645 }, { "entropy": 5.314459371566772, "epoch": 6.687425860023724, "grad_norm": 1.171875, "learning_rate": 0.00016321999094936378, "loss": 4.6965, "mean_token_accuracy": 0.24981153309345244, "num_tokens": 154942505.0, "step": 67650 }, { "entropy": 5.2899891376495365, "epoch": 6.687920126532227, "grad_norm": 1.2265625, "learning_rate": 0.00016318936538257787, "loss": 4.6357, "mean_token_accuracy": 0.2591686353087425, "num_tokens": 154953700.0, "step": 67655 }, { "entropy": 5.294004297256469, "epoch": 6.688414393040728, "grad_norm": 1.25, "learning_rate": 0.000163158742566351, "loss": 4.6284, "mean_token_accuracy": 0.25044345259666445, "num_tokens": 154964156.0, "step": 67660 }, { "entropy": 5.218189716339111, "epoch": 6.688908659549229, "grad_norm": 1.2265625, "learning_rate": 0.00016312812250143634, "loss": 4.5714, "mean_token_accuracy": 0.26738001555204394, "num_tokens": 154974953.0, "step": 67665 }, { "entropy": 5.301998805999756, "epoch": 6.68940292605773, "grad_norm": 1.3125, "learning_rate": 0.00016309750518858718, "loss": 4.6988, "mean_token_accuracy": 0.2536516159772873, "num_tokens": 154986219.0, "step": 67670 }, { "entropy": 5.231358003616333, "epoch": 6.689897192566232, "grad_norm": 1.359375, "learning_rate": 0.00016306689062855684, "loss": 4.5868, "mean_token_accuracy": 0.26233767718076706, "num_tokens": 154995702.0, "step": 67675 }, { "entropy": 5.242871570587158, "epoch": 6.690391459074733, "grad_norm": 1.171875, "learning_rate": 0.00016303627882209817, "loss": 4.654, "mean_token_accuracy": 0.2547682076692581, "num_tokens": 155006532.0, "step": 67680 }, { "entropy": 5.231049680709839, "epoch": 6.690885725583234, "grad_norm": 1.3359375, "learning_rate": 0.00016300566976996467, "loss": 4.5647, "mean_token_accuracy": 0.26132418811321256, "num_tokens": 155018117.0, "step": 67685 }, { "entropy": 5.301739120483399, "epoch": 6.691379992091736, "grad_norm": 1.109375, "learning_rate": 0.0001629750634729089, "loss": 4.6788, "mean_token_accuracy": 0.25729681700468066, "num_tokens": 155031788.0, "step": 67690 }, { "entropy": 5.300141668319702, "epoch": 6.6918742586002375, "grad_norm": 0.98828125, "learning_rate": 0.00016294445993168393, "loss": 4.6376, "mean_token_accuracy": 0.26225050538778305, "num_tokens": 155044553.0, "step": 67695 }, { "entropy": 5.23449296951294, "epoch": 6.692368525108739, "grad_norm": 1.1484375, "learning_rate": 0.00016291385914704275, "loss": 4.575, "mean_token_accuracy": 0.26055520474910737, "num_tokens": 155055621.0, "step": 67700 }, { "entropy": 5.269044685363769, "epoch": 6.69286279161724, "grad_norm": 1.1015625, "learning_rate": 0.0001628832611197379, "loss": 4.6385, "mean_token_accuracy": 0.25730842500925066, "num_tokens": 155068182.0, "step": 67705 }, { "entropy": 5.288366746902466, "epoch": 6.693357058125741, "grad_norm": 1.2421875, "learning_rate": 0.00016285266585052232, "loss": 4.6778, "mean_token_accuracy": 0.2512664392590523, "num_tokens": 155079635.0, "step": 67710 }, { "entropy": 5.316222524642944, "epoch": 6.693851324634243, "grad_norm": 1.21875, "learning_rate": 0.00016282207334014854, "loss": 4.6891, "mean_token_accuracy": 0.25137974619865416, "num_tokens": 155091679.0, "step": 67715 }, { "entropy": 5.291642332077027, "epoch": 6.694345591142744, "grad_norm": 1.203125, "learning_rate": 0.00016279148358936912, "loss": 4.6502, "mean_token_accuracy": 0.2529309019446373, "num_tokens": 155103796.0, "step": 67720 }, { "entropy": 5.225180339813233, "epoch": 6.694839857651246, "grad_norm": 1.125, "learning_rate": 0.00016276089659893666, "loss": 4.5502, "mean_token_accuracy": 0.2687744975090027, "num_tokens": 155115386.0, "step": 67725 }, { "entropy": 5.285056638717651, "epoch": 6.695334124159747, "grad_norm": 1.21875, "learning_rate": 0.0001627303123696035, "loss": 4.6538, "mean_token_accuracy": 0.2568121403455734, "num_tokens": 155127833.0, "step": 67730 }, { "entropy": 5.261908435821534, "epoch": 6.6958283906682485, "grad_norm": 1.1171875, "learning_rate": 0.0001626997309021221, "loss": 4.6187, "mean_token_accuracy": 0.2553738787770271, "num_tokens": 155138380.0, "step": 67735 }, { "entropy": 5.198961877822876, "epoch": 6.69632265717675, "grad_norm": 1.1796875, "learning_rate": 0.0001626691521972447, "loss": 4.5978, "mean_token_accuracy": 0.2651623785495758, "num_tokens": 155150246.0, "step": 67740 }, { "entropy": 5.308858633041382, "epoch": 6.696816923685251, "grad_norm": 1.21875, "learning_rate": 0.00016263857625572364, "loss": 4.6681, "mean_token_accuracy": 0.2535191148519516, "num_tokens": 155162172.0, "step": 67745 }, { "entropy": 5.246473789215088, "epoch": 6.697311190193752, "grad_norm": 1.171875, "learning_rate": 0.00016260800307831108, "loss": 4.5706, "mean_token_accuracy": 0.2624722421169281, "num_tokens": 155173834.0, "step": 67750 }, { "entropy": 5.309801244735718, "epoch": 6.697805456702254, "grad_norm": 1.1953125, "learning_rate": 0.00016257743266575897, "loss": 4.6614, "mean_token_accuracy": 0.25146231055259705, "num_tokens": 155185206.0, "step": 67755 }, { "entropy": 5.327124834060669, "epoch": 6.698299723210756, "grad_norm": 1.125, "learning_rate": 0.0001625468650188195, "loss": 4.6775, "mean_token_accuracy": 0.253584985435009, "num_tokens": 155196959.0, "step": 67760 }, { "entropy": 5.223650550842285, "epoch": 6.698793989719257, "grad_norm": 1.1796875, "learning_rate": 0.00016251630013824458, "loss": 4.4927, "mean_token_accuracy": 0.2733603686094284, "num_tokens": 155207436.0, "step": 67765 }, { "entropy": 5.231035232543945, "epoch": 6.699288256227758, "grad_norm": 1.234375, "learning_rate": 0.00016248573802478614, "loss": 4.5824, "mean_token_accuracy": 0.2670606464147568, "num_tokens": 155218598.0, "step": 67770 }, { "entropy": 5.1894372463226315, "epoch": 6.6997825227362595, "grad_norm": 1.1015625, "learning_rate": 0.00016245517867919608, "loss": 4.5744, "mean_token_accuracy": 0.26967773884534835, "num_tokens": 155230874.0, "step": 67775 }, { "entropy": 5.250011396408081, "epoch": 6.700276789244761, "grad_norm": 1.1796875, "learning_rate": 0.000162424622102226, "loss": 4.5944, "mean_token_accuracy": 0.25887602269649507, "num_tokens": 155242316.0, "step": 67780 }, { "entropy": 5.277428340911865, "epoch": 6.700771055753262, "grad_norm": 1.0703125, "learning_rate": 0.00016239406829462766, "loss": 4.6025, "mean_token_accuracy": 0.2649770125746727, "num_tokens": 155253860.0, "step": 67785 }, { "entropy": 5.249431562423706, "epoch": 6.701265322261763, "grad_norm": 1.1484375, "learning_rate": 0.0001623635172571528, "loss": 4.6503, "mean_token_accuracy": 0.2524502381682396, "num_tokens": 155264784.0, "step": 67790 }, { "entropy": 5.198607492446899, "epoch": 6.701759588770265, "grad_norm": 1.2109375, "learning_rate": 0.00016233296899055276, "loss": 4.5695, "mean_token_accuracy": 0.2611726954579353, "num_tokens": 155276330.0, "step": 67795 }, { "entropy": 5.202889537811279, "epoch": 6.702253855278766, "grad_norm": 1.1171875, "learning_rate": 0.00016230242349557928, "loss": 4.5999, "mean_token_accuracy": 0.2624075934290886, "num_tokens": 155288331.0, "step": 67800 }, { "entropy": 5.251984453201294, "epoch": 6.702748121787268, "grad_norm": 1.078125, "learning_rate": 0.0001622718807729836, "loss": 4.6889, "mean_token_accuracy": 0.2575192332267761, "num_tokens": 155301449.0, "step": 67805 }, { "entropy": 5.33973970413208, "epoch": 6.703242388295769, "grad_norm": 1.1171875, "learning_rate": 0.00016224134082351715, "loss": 4.7429, "mean_token_accuracy": 0.24940659552812577, "num_tokens": 155314113.0, "step": 67810 }, { "entropy": 5.32165789604187, "epoch": 6.7037366548042705, "grad_norm": 1.140625, "learning_rate": 0.00016221080364793128, "loss": 4.6735, "mean_token_accuracy": 0.24405091255903244, "num_tokens": 155324945.0, "step": 67815 }, { "entropy": 5.257848119735717, "epoch": 6.704230921312772, "grad_norm": 1.2265625, "learning_rate": 0.00016218026924697706, "loss": 4.6079, "mean_token_accuracy": 0.2610185667872429, "num_tokens": 155335672.0, "step": 67820 }, { "entropy": 5.236531019210815, "epoch": 6.704725187821273, "grad_norm": 1.1953125, "learning_rate": 0.00016214973762140574, "loss": 4.587, "mean_token_accuracy": 0.26231163591146467, "num_tokens": 155346859.0, "step": 67825 }, { "entropy": 5.305474042892456, "epoch": 6.705219454329774, "grad_norm": 1.1640625, "learning_rate": 0.00016211920877196834, "loss": 4.6326, "mean_token_accuracy": 0.24952698200941087, "num_tokens": 155358021.0, "step": 67830 }, { "entropy": 5.248034572601318, "epoch": 6.7057137208382755, "grad_norm": 1.203125, "learning_rate": 0.00016208868269941592, "loss": 4.6326, "mean_token_accuracy": 0.25866802483797074, "num_tokens": 155368290.0, "step": 67835 }, { "entropy": 5.222622585296631, "epoch": 6.706207987346778, "grad_norm": 1.09375, "learning_rate": 0.00016205815940449953, "loss": 4.5634, "mean_token_accuracy": 0.2646901622414589, "num_tokens": 155380691.0, "step": 67840 }, { "entropy": 5.27852988243103, "epoch": 6.706702253855279, "grad_norm": 1.140625, "learning_rate": 0.00016202763888796984, "loss": 4.5835, "mean_token_accuracy": 0.2634594917297363, "num_tokens": 155392021.0, "step": 67845 }, { "entropy": 5.269294309616089, "epoch": 6.70719652036378, "grad_norm": 1.1640625, "learning_rate": 0.00016199712115057778, "loss": 4.757, "mean_token_accuracy": 0.24888992607593535, "num_tokens": 155404754.0, "step": 67850 }, { "entropy": 5.183342313766479, "epoch": 6.7076907868722815, "grad_norm": 1.140625, "learning_rate": 0.00016196660619307408, "loss": 4.5082, "mean_token_accuracy": 0.2651431441307068, "num_tokens": 155415953.0, "step": 67855 }, { "entropy": 5.305486392974854, "epoch": 6.708185053380783, "grad_norm": 1.0859375, "learning_rate": 0.00016193609401620934, "loss": 4.6557, "mean_token_accuracy": 0.25568693727254865, "num_tokens": 155428749.0, "step": 67860 }, { "entropy": 5.291642093658448, "epoch": 6.708679319889284, "grad_norm": 1.3125, "learning_rate": 0.00016190558462073437, "loss": 4.6596, "mean_token_accuracy": 0.2599284380674362, "num_tokens": 155440415.0, "step": 67865 }, { "entropy": 5.290931129455567, "epoch": 6.709173586397785, "grad_norm": 1.25, "learning_rate": 0.00016187507800739947, "loss": 4.613, "mean_token_accuracy": 0.26163035482168195, "num_tokens": 155451484.0, "step": 67870 }, { "entropy": 5.258326435089112, "epoch": 6.709667852906287, "grad_norm": 1.1796875, "learning_rate": 0.00016184457417695519, "loss": 4.5518, "mean_token_accuracy": 0.26161414533853533, "num_tokens": 155462224.0, "step": 67875 }, { "entropy": 5.263381481170654, "epoch": 6.710162119414789, "grad_norm": 1.375, "learning_rate": 0.00016181407313015195, "loss": 4.6347, "mean_token_accuracy": 0.25608438104391096, "num_tokens": 155473149.0, "step": 67880 }, { "entropy": 5.245105791091919, "epoch": 6.71065638592329, "grad_norm": 1.078125, "learning_rate": 0.00016178357486774003, "loss": 4.5815, "mean_token_accuracy": 0.2559571459889412, "num_tokens": 155485197.0, "step": 67885 }, { "entropy": 5.309322118759155, "epoch": 6.711150652431791, "grad_norm": 1.2421875, "learning_rate": 0.00016175307939046991, "loss": 4.6203, "mean_token_accuracy": 0.2545432478189468, "num_tokens": 155496061.0, "step": 67890 }, { "entropy": 5.225273990631104, "epoch": 6.7116449189402925, "grad_norm": 1.2578125, "learning_rate": 0.0001617225866990914, "loss": 4.6007, "mean_token_accuracy": 0.2572327196598053, "num_tokens": 155506672.0, "step": 67895 }, { "entropy": 5.264374685287476, "epoch": 6.712139185448794, "grad_norm": 1.203125, "learning_rate": 0.00016169209679435493, "loss": 4.6389, "mean_token_accuracy": 0.2566759377717972, "num_tokens": 155517839.0, "step": 67900 }, { "entropy": 5.1791462898254395, "epoch": 6.712633451957295, "grad_norm": 1.203125, "learning_rate": 0.0001616616096770105, "loss": 4.5752, "mean_token_accuracy": 0.26567136496305466, "num_tokens": 155529305.0, "step": 67905 }, { "entropy": 5.147698545455933, "epoch": 6.713127718465797, "grad_norm": 1.1640625, "learning_rate": 0.0001616311253478079, "loss": 4.5331, "mean_token_accuracy": 0.27107147574424745, "num_tokens": 155540491.0, "step": 67910 }, { "entropy": 5.266091346740723, "epoch": 6.713621984974298, "grad_norm": 1.2109375, "learning_rate": 0.00016160064380749733, "loss": 4.578, "mean_token_accuracy": 0.2676674351096153, "num_tokens": 155551445.0, "step": 67915 }, { "entropy": 5.313220119476318, "epoch": 6.7141162514828, "grad_norm": 1.2421875, "learning_rate": 0.0001615701650568285, "loss": 4.7164, "mean_token_accuracy": 0.2508682906627655, "num_tokens": 155562971.0, "step": 67920 }, { "entropy": 5.276921653747559, "epoch": 6.714610517991301, "grad_norm": 1.140625, "learning_rate": 0.00016153968909655116, "loss": 4.6473, "mean_token_accuracy": 0.2623435974121094, "num_tokens": 155574740.0, "step": 67925 }, { "entropy": 5.245447015762329, "epoch": 6.715104784499802, "grad_norm": 1.25, "learning_rate": 0.00016150921592741516, "loss": 4.5655, "mean_token_accuracy": 0.26728208363056183, "num_tokens": 155585470.0, "step": 67930 }, { "entropy": 5.205464124679565, "epoch": 6.7155990510083035, "grad_norm": 1.2421875, "learning_rate": 0.00016147874555016994, "loss": 4.5378, "mean_token_accuracy": 0.26390922367572783, "num_tokens": 155596182.0, "step": 67935 }, { "entropy": 5.229702568054199, "epoch": 6.716093317516805, "grad_norm": 1.1640625, "learning_rate": 0.00016144827796556527, "loss": 4.6193, "mean_token_accuracy": 0.2676503211259842, "num_tokens": 155609270.0, "step": 67940 }, { "entropy": 5.246639728546143, "epoch": 6.716587584025307, "grad_norm": 1.171875, "learning_rate": 0.0001614178131743505, "loss": 4.6287, "mean_token_accuracy": 0.25863000452518464, "num_tokens": 155620164.0, "step": 67945 }, { "entropy": 5.264628791809082, "epoch": 6.717081850533808, "grad_norm": 1.234375, "learning_rate": 0.0001613873511772752, "loss": 4.6645, "mean_token_accuracy": 0.2510698914527893, "num_tokens": 155631011.0, "step": 67950 }, { "entropy": 5.207536268234253, "epoch": 6.717576117042309, "grad_norm": 1.234375, "learning_rate": 0.00016135689197508874, "loss": 4.5176, "mean_token_accuracy": 0.26567833572626115, "num_tokens": 155642035.0, "step": 67955 }, { "entropy": 5.354702615737915, "epoch": 6.718070383550811, "grad_norm": 1.1015625, "learning_rate": 0.0001613264355685403, "loss": 4.7313, "mean_token_accuracy": 0.2437200665473938, "num_tokens": 155654308.0, "step": 67960 }, { "entropy": 5.231463813781739, "epoch": 6.718564650059312, "grad_norm": 1.15625, "learning_rate": 0.00016129598195837916, "loss": 4.5887, "mean_token_accuracy": 0.264904160797596, "num_tokens": 155665973.0, "step": 67965 }, { "entropy": 5.281019783020019, "epoch": 6.719058916567813, "grad_norm": 1.1328125, "learning_rate": 0.00016126553114535451, "loss": 4.6406, "mean_token_accuracy": 0.2541795685887337, "num_tokens": 155676812.0, "step": 67970 }, { "entropy": 5.208728218078614, "epoch": 6.719553183076314, "grad_norm": 1.109375, "learning_rate": 0.00016123508313021546, "loss": 4.5994, "mean_token_accuracy": 0.2619593575596809, "num_tokens": 155689299.0, "step": 67975 }, { "entropy": 5.244036293029785, "epoch": 6.720047449584817, "grad_norm": 1.0546875, "learning_rate": 0.00016120463791371105, "loss": 4.6404, "mean_token_accuracy": 0.256854210793972, "num_tokens": 155702664.0, "step": 67980 }, { "entropy": 5.354024505615234, "epoch": 6.720541716093318, "grad_norm": 1.21875, "learning_rate": 0.00016117419549659017, "loss": 4.7139, "mean_token_accuracy": 0.2484100878238678, "num_tokens": 155714440.0, "step": 67985 }, { "entropy": 5.202384901046753, "epoch": 6.721035982601819, "grad_norm": 1.1796875, "learning_rate": 0.00016114375587960173, "loss": 4.5795, "mean_token_accuracy": 0.26174779087305067, "num_tokens": 155725641.0, "step": 67990 }, { "entropy": 5.255588150024414, "epoch": 6.72153024911032, "grad_norm": 1.1953125, "learning_rate": 0.00016111331906349465, "loss": 4.6671, "mean_token_accuracy": 0.26172625720500947, "num_tokens": 155736284.0, "step": 67995 }, { "entropy": 5.204665851593018, "epoch": 6.722024515618822, "grad_norm": 1.1328125, "learning_rate": 0.0001610828850490174, "loss": 4.5216, "mean_token_accuracy": 0.27769934237003324, "num_tokens": 155747162.0, "step": 68000 }, { "entropy": 5.203735733032227, "epoch": 6.722518782127323, "grad_norm": 1.21875, "learning_rate": 0.00016105245383691902, "loss": 4.5182, "mean_token_accuracy": 0.26857649981975557, "num_tokens": 155757329.0, "step": 68005 }, { "entropy": 5.319605350494385, "epoch": 6.723013048635824, "grad_norm": 1.046875, "learning_rate": 0.00016102202542794786, "loss": 4.7287, "mean_token_accuracy": 0.25004602670669557, "num_tokens": 155768872.0, "step": 68010 }, { "entropy": 5.2238257884979244, "epoch": 6.723507315144326, "grad_norm": 1.2578125, "learning_rate": 0.00016099159982285255, "loss": 4.565, "mean_token_accuracy": 0.26009097546339033, "num_tokens": 155780136.0, "step": 68015 }, { "entropy": 5.256332206726074, "epoch": 6.724001581652828, "grad_norm": 1.2109375, "learning_rate": 0.00016096117702238166, "loss": 4.6431, "mean_token_accuracy": 0.25886921137571334, "num_tokens": 155791766.0, "step": 68020 }, { "entropy": 5.3106889724731445, "epoch": 6.724495848161329, "grad_norm": 1.2578125, "learning_rate": 0.00016093075702728338, "loss": 4.7052, "mean_token_accuracy": 0.25215196162462233, "num_tokens": 155803524.0, "step": 68025 }, { "entropy": 5.312954616546631, "epoch": 6.72499011466983, "grad_norm": 1.1015625, "learning_rate": 0.00016090033983830632, "loss": 4.6801, "mean_token_accuracy": 0.2577712908387184, "num_tokens": 155816509.0, "step": 68030 }, { "entropy": 5.292514371871948, "epoch": 6.725484381178331, "grad_norm": 1.1640625, "learning_rate": 0.0001608699254561985, "loss": 4.6693, "mean_token_accuracy": 0.2548594042658806, "num_tokens": 155827173.0, "step": 68035 }, { "entropy": 5.222311162948609, "epoch": 6.725978647686833, "grad_norm": 1.109375, "learning_rate": 0.00016083951388170823, "loss": 4.5757, "mean_token_accuracy": 0.2671512484550476, "num_tokens": 155838419.0, "step": 68040 }, { "entropy": 5.370596885681152, "epoch": 6.726472914195334, "grad_norm": 1.1640625, "learning_rate": 0.00016080910511558373, "loss": 4.8078, "mean_token_accuracy": 0.2468089669942856, "num_tokens": 155850097.0, "step": 68045 }, { "entropy": 5.336405181884766, "epoch": 6.726967180703835, "grad_norm": 1.1484375, "learning_rate": 0.00016077869915857284, "loss": 4.6797, "mean_token_accuracy": 0.24919090867042543, "num_tokens": 155861390.0, "step": 68050 }, { "entropy": 5.220504093170166, "epoch": 6.727461447212336, "grad_norm": 1.078125, "learning_rate": 0.00016074829601142365, "loss": 4.5425, "mean_token_accuracy": 0.2680021315813065, "num_tokens": 155873040.0, "step": 68055 }, { "entropy": 5.264798593521118, "epoch": 6.727955713720839, "grad_norm": 1.1953125, "learning_rate": 0.00016071789567488417, "loss": 4.6143, "mean_token_accuracy": 0.25345888286828994, "num_tokens": 155885241.0, "step": 68060 }, { "entropy": 5.211963033676147, "epoch": 6.72844998022934, "grad_norm": 1.2890625, "learning_rate": 0.00016068749814970217, "loss": 4.5966, "mean_token_accuracy": 0.2604681611061096, "num_tokens": 155895676.0, "step": 68065 }, { "entropy": 5.2451728820800785, "epoch": 6.728944246737841, "grad_norm": 1.296875, "learning_rate": 0.0001606571034366255, "loss": 4.6357, "mean_token_accuracy": 0.26441201716661455, "num_tokens": 155906414.0, "step": 68070 }, { "entropy": 5.271436023712158, "epoch": 6.729438513246342, "grad_norm": 1.1171875, "learning_rate": 0.00016062671153640177, "loss": 4.6645, "mean_token_accuracy": 0.26083804070949557, "num_tokens": 155917400.0, "step": 68075 }, { "entropy": 5.2539173603057865, "epoch": 6.729932779754844, "grad_norm": 1.21875, "learning_rate": 0.00016059632244977876, "loss": 4.6123, "mean_token_accuracy": 0.2528292417526245, "num_tokens": 155928483.0, "step": 68080 }, { "entropy": 5.312942743301392, "epoch": 6.730427046263345, "grad_norm": 1.140625, "learning_rate": 0.00016056593617750378, "loss": 4.7127, "mean_token_accuracy": 0.255108055472374, "num_tokens": 155940040.0, "step": 68085 }, { "entropy": 5.256491804122925, "epoch": 6.730921312771846, "grad_norm": 1.171875, "learning_rate": 0.0001605355527203246, "loss": 4.608, "mean_token_accuracy": 0.2620922714471817, "num_tokens": 155952008.0, "step": 68090 }, { "entropy": 5.245415544509887, "epoch": 6.731415579280348, "grad_norm": 1.1953125, "learning_rate": 0.00016050517207898872, "loss": 4.6001, "mean_token_accuracy": 0.26082693636417387, "num_tokens": 155963001.0, "step": 68095 }, { "entropy": 5.31348671913147, "epoch": 6.7319098457888495, "grad_norm": 1.1953125, "learning_rate": 0.0001604747942542432, "loss": 4.6638, "mean_token_accuracy": 0.25366387218236924, "num_tokens": 155973608.0, "step": 68100 }, { "entropy": 5.236517095565796, "epoch": 6.732404112297351, "grad_norm": 1.2421875, "learning_rate": 0.00016044441924683566, "loss": 4.6295, "mean_token_accuracy": 0.257454676926136, "num_tokens": 155984276.0, "step": 68105 }, { "entropy": 5.114264583587646, "epoch": 6.732898378805852, "grad_norm": 1.3515625, "learning_rate": 0.0001604140470575131, "loss": 4.5408, "mean_token_accuracy": 0.26698544472455976, "num_tokens": 155996108.0, "step": 68110 }, { "entropy": 5.220448684692383, "epoch": 6.733392645314353, "grad_norm": 1.1484375, "learning_rate": 0.0001603836776870226, "loss": 4.5653, "mean_token_accuracy": 0.2625539839267731, "num_tokens": 156007507.0, "step": 68115 }, { "entropy": 5.282002973556518, "epoch": 6.733886911822855, "grad_norm": 1.1484375, "learning_rate": 0.00016035331113611165, "loss": 4.6268, "mean_token_accuracy": 0.2590451091527939, "num_tokens": 156018772.0, "step": 68120 }, { "entropy": 5.207908487319946, "epoch": 6.734381178331356, "grad_norm": 1.1328125, "learning_rate": 0.00016032294740552696, "loss": 4.5964, "mean_token_accuracy": 0.2643966004252434, "num_tokens": 156030590.0, "step": 68125 }, { "entropy": 5.291704893112183, "epoch": 6.734875444839858, "grad_norm": 1.3203125, "learning_rate": 0.00016029258649601557, "loss": 4.6637, "mean_token_accuracy": 0.25644162595272063, "num_tokens": 156041585.0, "step": 68130 }, { "entropy": 5.337909078598022, "epoch": 6.735369711348359, "grad_norm": 1.1953125, "learning_rate": 0.00016026222840832434, "loss": 4.7112, "mean_token_accuracy": 0.2556662827730179, "num_tokens": 156052767.0, "step": 68135 }, { "entropy": 5.285244178771973, "epoch": 6.7358639778568605, "grad_norm": 1.1875, "learning_rate": 0.00016023187314320004, "loss": 4.6149, "mean_token_accuracy": 0.25883630067110064, "num_tokens": 156064867.0, "step": 68140 }, { "entropy": 5.345792770385742, "epoch": 6.736358244365362, "grad_norm": 1.0078125, "learning_rate": 0.00016020152070138946, "loss": 4.7023, "mean_token_accuracy": 0.24520915299654006, "num_tokens": 156078026.0, "step": 68145 }, { "entropy": 5.2106688022613525, "epoch": 6.736852510873863, "grad_norm": 1.25, "learning_rate": 0.0001601711710836393, "loss": 4.6106, "mean_token_accuracy": 0.25740104615688325, "num_tokens": 156089973.0, "step": 68150 }, { "entropy": 5.200597429275513, "epoch": 6.737346777382364, "grad_norm": 1.1953125, "learning_rate": 0.00016014082429069621, "loss": 4.5837, "mean_token_accuracy": 0.261561231315136, "num_tokens": 156101943.0, "step": 68155 }, { "entropy": 5.317104196548462, "epoch": 6.737841043890866, "grad_norm": 1.1796875, "learning_rate": 0.0001601104803233066, "loss": 4.6548, "mean_token_accuracy": 0.25735233873128893, "num_tokens": 156112895.0, "step": 68160 }, { "entropy": 5.220529270172119, "epoch": 6.738335310399368, "grad_norm": 1.1484375, "learning_rate": 0.00016008013918221697, "loss": 4.5636, "mean_token_accuracy": 0.26561442464590074, "num_tokens": 156124599.0, "step": 68165 }, { "entropy": 5.237607049942016, "epoch": 6.738829576907869, "grad_norm": 1.15625, "learning_rate": 0.00016004980086817386, "loss": 4.6019, "mean_token_accuracy": 0.2558351382613182, "num_tokens": 156135528.0, "step": 68170 }, { "entropy": 5.202810192108155, "epoch": 6.73932384341637, "grad_norm": 1.1328125, "learning_rate": 0.0001600194653819233, "loss": 4.4956, "mean_token_accuracy": 0.2645046845078468, "num_tokens": 156146960.0, "step": 68175 }, { "entropy": 5.294224739074707, "epoch": 6.7398181099248715, "grad_norm": 1.234375, "learning_rate": 0.00015998913272421189, "loss": 4.6236, "mean_token_accuracy": 0.2536061525344849, "num_tokens": 156159524.0, "step": 68180 }, { "entropy": 5.292404365539551, "epoch": 6.740312376433373, "grad_norm": 1.21875, "learning_rate": 0.0001599588028957856, "loss": 4.6755, "mean_token_accuracy": 0.2572284936904907, "num_tokens": 156171520.0, "step": 68185 }, { "entropy": 5.258934116363525, "epoch": 6.740806642941874, "grad_norm": 1.0859375, "learning_rate": 0.00015992847589739058, "loss": 4.5898, "mean_token_accuracy": 0.25914247035980226, "num_tokens": 156182508.0, "step": 68190 }, { "entropy": 5.266827011108399, "epoch": 6.741300909450375, "grad_norm": 1.171875, "learning_rate": 0.000159898151729773, "loss": 4.5434, "mean_token_accuracy": 0.2603166148066521, "num_tokens": 156193059.0, "step": 68195 }, { "entropy": 5.291902303695679, "epoch": 6.7417951759588775, "grad_norm": 1.1953125, "learning_rate": 0.00015986783039367858, "loss": 4.6804, "mean_token_accuracy": 0.25252525210380555, "num_tokens": 156203583.0, "step": 68200 }, { "entropy": 5.227346658706665, "epoch": 6.742289442467379, "grad_norm": 1.234375, "learning_rate": 0.00015983751188985352, "loss": 4.5823, "mean_token_accuracy": 0.2611536026000977, "num_tokens": 156214239.0, "step": 68205 }, { "entropy": 5.259789323806762, "epoch": 6.74278370897588, "grad_norm": 1.1953125, "learning_rate": 0.0001598071962190435, "loss": 4.5823, "mean_token_accuracy": 0.26134309023618696, "num_tokens": 156225617.0, "step": 68210 }, { "entropy": 5.2729353427886965, "epoch": 6.743277975484381, "grad_norm": 1.15625, "learning_rate": 0.0001597768833819943, "loss": 4.6799, "mean_token_accuracy": 0.2577765420079231, "num_tokens": 156237880.0, "step": 68215 }, { "entropy": 5.285265779495239, "epoch": 6.7437722419928825, "grad_norm": 1.3046875, "learning_rate": 0.00015974657337945175, "loss": 4.6512, "mean_token_accuracy": 0.2613586515188217, "num_tokens": 156249067.0, "step": 68220 }, { "entropy": 5.284427499771118, "epoch": 6.744266508501384, "grad_norm": 1.1796875, "learning_rate": 0.0001597162662121613, "loss": 4.6736, "mean_token_accuracy": 0.25594935566186905, "num_tokens": 156261876.0, "step": 68225 }, { "entropy": 5.218594217300415, "epoch": 6.744760775009885, "grad_norm": 1.1640625, "learning_rate": 0.00015968596188086853, "loss": 4.5692, "mean_token_accuracy": 0.2624515607953072, "num_tokens": 156273390.0, "step": 68230 }, { "entropy": 5.213176250457764, "epoch": 6.745255041518387, "grad_norm": 1.1796875, "learning_rate": 0.000159655660386319, "loss": 4.6101, "mean_token_accuracy": 0.26026465445756913, "num_tokens": 156286031.0, "step": 68235 }, { "entropy": 5.251900577545166, "epoch": 6.745749308026888, "grad_norm": 1.15625, "learning_rate": 0.00015962536172925816, "loss": 4.5716, "mean_token_accuracy": 0.262025748193264, "num_tokens": 156297156.0, "step": 68240 }, { "entropy": 5.296979808807373, "epoch": 6.74624357453539, "grad_norm": 1.1953125, "learning_rate": 0.0001595950659104314, "loss": 4.6401, "mean_token_accuracy": 0.25446577817201615, "num_tokens": 156307883.0, "step": 68245 }, { "entropy": 5.196175956726075, "epoch": 6.746737841043891, "grad_norm": 1.140625, "learning_rate": 0.0001595647729305838, "loss": 4.5161, "mean_token_accuracy": 0.27248013466596605, "num_tokens": 156319046.0, "step": 68250 }, { "entropy": 5.224428606033325, "epoch": 6.747232107552392, "grad_norm": 1.21875, "learning_rate": 0.00015953448279046068, "loss": 4.5456, "mean_token_accuracy": 0.264334474503994, "num_tokens": 156330808.0, "step": 68255 }, { "entropy": 5.3436203956604, "epoch": 6.7477263740608935, "grad_norm": 1.265625, "learning_rate": 0.00015950419549080725, "loss": 4.7285, "mean_token_accuracy": 0.23974718153476715, "num_tokens": 156343091.0, "step": 68260 }, { "entropy": 5.301152753829956, "epoch": 6.748220640569395, "grad_norm": 1.25, "learning_rate": 0.00015947391103236853, "loss": 4.6234, "mean_token_accuracy": 0.260059754550457, "num_tokens": 156353110.0, "step": 68265 }, { "entropy": 5.2318634510040285, "epoch": 6.748714907077897, "grad_norm": 1.2734375, "learning_rate": 0.00015944362941588958, "loss": 4.5472, "mean_token_accuracy": 0.2639590367674828, "num_tokens": 156364045.0, "step": 68270 }, { "entropy": 5.211286354064941, "epoch": 6.749209173586398, "grad_norm": 1.171875, "learning_rate": 0.0001594133506421152, "loss": 4.5764, "mean_token_accuracy": 0.2687656253576279, "num_tokens": 156375223.0, "step": 68275 }, { "entropy": 5.200586462020874, "epoch": 6.749703440094899, "grad_norm": 1.1640625, "learning_rate": 0.0001593830747117903, "loss": 4.5869, "mean_token_accuracy": 0.26453372538089753, "num_tokens": 156386459.0, "step": 68280 }, { "entropy": 5.187724256515503, "epoch": 6.750197706603401, "grad_norm": 1.25, "learning_rate": 0.0001593528016256598, "loss": 4.5435, "mean_token_accuracy": 0.2710057973861694, "num_tokens": 156397185.0, "step": 68285 }, { "entropy": 5.256117439270019, "epoch": 6.750691973111902, "grad_norm": 1.1484375, "learning_rate": 0.00015932253138446816, "loss": 4.6805, "mean_token_accuracy": 0.252156075835228, "num_tokens": 156410203.0, "step": 68290 }, { "entropy": 5.261715412139893, "epoch": 6.751186239620403, "grad_norm": 1.21875, "learning_rate": 0.00015929226398896036, "loss": 4.5921, "mean_token_accuracy": 0.26217110008001326, "num_tokens": 156421372.0, "step": 68295 }, { "entropy": 5.31875205039978, "epoch": 6.7516805061289045, "grad_norm": 1.15625, "learning_rate": 0.00015926199943988074, "loss": 4.6146, "mean_token_accuracy": 0.2595672383904457, "num_tokens": 156433104.0, "step": 68300 }, { "entropy": 5.292922115325927, "epoch": 6.752174772637406, "grad_norm": 1.0859375, "learning_rate": 0.00015923173773797387, "loss": 4.6233, "mean_token_accuracy": 0.25298784375190736, "num_tokens": 156444198.0, "step": 68305 }, { "entropy": 5.232989740371704, "epoch": 6.752669039145907, "grad_norm": 1.1171875, "learning_rate": 0.0001592014788839843, "loss": 4.6235, "mean_token_accuracy": 0.26208814382553103, "num_tokens": 156455770.0, "step": 68310 }, { "entropy": 5.299772500991821, "epoch": 6.753163305654409, "grad_norm": 1.25, "learning_rate": 0.0001591712228786562, "loss": 4.683, "mean_token_accuracy": 0.2524475663900375, "num_tokens": 156467102.0, "step": 68315 }, { "entropy": 5.270948791503907, "epoch": 6.75365757216291, "grad_norm": 1.1875, "learning_rate": 0.00015914096972273405, "loss": 4.6736, "mean_token_accuracy": 0.25899252891540525, "num_tokens": 156478619.0, "step": 68320 }, { "entropy": 5.217548847198486, "epoch": 6.754151838671412, "grad_norm": 1.140625, "learning_rate": 0.00015911071941696197, "loss": 4.6523, "mean_token_accuracy": 0.2608180075883865, "num_tokens": 156490531.0, "step": 68325 }, { "entropy": 5.278065156936646, "epoch": 6.754646105179913, "grad_norm": 1.1484375, "learning_rate": 0.0001590804719620842, "loss": 4.5597, "mean_token_accuracy": 0.27056399583816526, "num_tokens": 156501854.0, "step": 68330 }, { "entropy": 5.196343660354614, "epoch": 6.755140371688414, "grad_norm": 1.109375, "learning_rate": 0.00015905022735884488, "loss": 4.5388, "mean_token_accuracy": 0.26011030524969103, "num_tokens": 156513115.0, "step": 68335 }, { "entropy": 5.259907627105713, "epoch": 6.7556346381969155, "grad_norm": 1.2734375, "learning_rate": 0.00015901998560798787, "loss": 4.5803, "mean_token_accuracy": 0.25658576339483263, "num_tokens": 156524394.0, "step": 68340 }, { "entropy": 5.1660909175872805, "epoch": 6.756128904705417, "grad_norm": 1.234375, "learning_rate": 0.0001589897467102572, "loss": 4.5577, "mean_token_accuracy": 0.2651622712612152, "num_tokens": 156535650.0, "step": 68345 }, { "entropy": 5.203230857849121, "epoch": 6.756623171213919, "grad_norm": 1.2265625, "learning_rate": 0.00015895951066639675, "loss": 4.6189, "mean_token_accuracy": 0.2572541326284409, "num_tokens": 156546682.0, "step": 68350 }, { "entropy": 5.305204057693482, "epoch": 6.75711743772242, "grad_norm": 1.046875, "learning_rate": 0.00015892927747715037, "loss": 4.6601, "mean_token_accuracy": 0.2550047174096107, "num_tokens": 156559140.0, "step": 68355 }, { "entropy": 5.217102336883545, "epoch": 6.757611704230921, "grad_norm": 1.1875, "learning_rate": 0.0001588990471432618, "loss": 4.5197, "mean_token_accuracy": 0.26888624429702757, "num_tokens": 156570565.0, "step": 68360 }, { "entropy": 5.194795560836792, "epoch": 6.758105970739423, "grad_norm": 1.203125, "learning_rate": 0.00015886881966547468, "loss": 4.5593, "mean_token_accuracy": 0.26677230149507525, "num_tokens": 156581565.0, "step": 68365 }, { "entropy": 5.220924282073975, "epoch": 6.758600237247924, "grad_norm": 1.2109375, "learning_rate": 0.00015883859504453254, "loss": 4.6235, "mean_token_accuracy": 0.2558820903301239, "num_tokens": 156591452.0, "step": 68370 }, { "entropy": 5.1243658542633055, "epoch": 6.759094503756425, "grad_norm": 1.1328125, "learning_rate": 0.00015880837328117903, "loss": 4.549, "mean_token_accuracy": 0.27072022557258607, "num_tokens": 156603378.0, "step": 68375 }, { "entropy": 5.346090173721313, "epoch": 6.759588770264926, "grad_norm": 1.3203125, "learning_rate": 0.0001587781543761575, "loss": 4.7035, "mean_token_accuracy": 0.2493848219513893, "num_tokens": 156613526.0, "step": 68380 }, { "entropy": 5.293028926849365, "epoch": 6.760083036773429, "grad_norm": 1.15625, "learning_rate": 0.00015874793833021156, "loss": 4.6369, "mean_token_accuracy": 0.25153942704200744, "num_tokens": 156624993.0, "step": 68385 }, { "entropy": 5.237642049789429, "epoch": 6.76057730328193, "grad_norm": 1.171875, "learning_rate": 0.00015871772514408422, "loss": 4.6054, "mean_token_accuracy": 0.2656411170959473, "num_tokens": 156637708.0, "step": 68390 }, { "entropy": 5.219708251953125, "epoch": 6.761071569790431, "grad_norm": 1.3828125, "learning_rate": 0.00015868751481851894, "loss": 4.5708, "mean_token_accuracy": 0.2595029681921005, "num_tokens": 156647322.0, "step": 68395 }, { "entropy": 5.292951536178589, "epoch": 6.761565836298932, "grad_norm": 1.2734375, "learning_rate": 0.0001586573073542589, "loss": 4.6666, "mean_token_accuracy": 0.2567445546388626, "num_tokens": 156657891.0, "step": 68400 }, { "entropy": 5.239635848999024, "epoch": 6.762060102807434, "grad_norm": 1.171875, "learning_rate": 0.000158627102752047, "loss": 4.6646, "mean_token_accuracy": 0.256422820687294, "num_tokens": 156669587.0, "step": 68405 }, { "entropy": 5.247538805007935, "epoch": 6.762554369315935, "grad_norm": 1.3125, "learning_rate": 0.0001585969010126266, "loss": 4.5941, "mean_token_accuracy": 0.2639486208558083, "num_tokens": 156680207.0, "step": 68410 }, { "entropy": 5.285342645645142, "epoch": 6.763048635824436, "grad_norm": 1.1484375, "learning_rate": 0.00015856670213674034, "loss": 4.6189, "mean_token_accuracy": 0.25682735741138457, "num_tokens": 156692292.0, "step": 68415 }, { "entropy": 5.195321130752563, "epoch": 6.763542902332938, "grad_norm": 1.140625, "learning_rate": 0.0001585365061251313, "loss": 4.4709, "mean_token_accuracy": 0.27192188054323196, "num_tokens": 156702927.0, "step": 68420 }, { "entropy": 5.223160457611084, "epoch": 6.76403716884144, "grad_norm": 1.046875, "learning_rate": 0.0001585063129785424, "loss": 4.5578, "mean_token_accuracy": 0.26027776300907135, "num_tokens": 156714566.0, "step": 68425 }, { "entropy": 5.304653739929199, "epoch": 6.764531435349941, "grad_norm": 1.2109375, "learning_rate": 0.00015847612269771617, "loss": 4.6803, "mean_token_accuracy": 0.25825506299734113, "num_tokens": 156726951.0, "step": 68430 }, { "entropy": 5.242990875244141, "epoch": 6.765025701858442, "grad_norm": 1.078125, "learning_rate": 0.0001584459352833954, "loss": 4.5787, "mean_token_accuracy": 0.2572101816534996, "num_tokens": 156738952.0, "step": 68435 }, { "entropy": 5.264776515960693, "epoch": 6.765519968366943, "grad_norm": 1.1640625, "learning_rate": 0.00015841575073632268, "loss": 4.6245, "mean_token_accuracy": 0.25719093829393386, "num_tokens": 156749818.0, "step": 68440 }, { "entropy": 5.284343194961548, "epoch": 6.766014234875445, "grad_norm": 1.125, "learning_rate": 0.0001583855690572406, "loss": 4.6586, "mean_token_accuracy": 0.25871235579252244, "num_tokens": 156761942.0, "step": 68445 }, { "entropy": 5.346140813827515, "epoch": 6.766508501383946, "grad_norm": 1.171875, "learning_rate": 0.0001583553902468917, "loss": 4.7367, "mean_token_accuracy": 0.24929730743169784, "num_tokens": 156774281.0, "step": 68450 }, { "entropy": 5.2526054859161375, "epoch": 6.767002767892448, "grad_norm": 1.125, "learning_rate": 0.0001583252143060182, "loss": 4.6837, "mean_token_accuracy": 0.25602245032787324, "num_tokens": 156786465.0, "step": 68455 }, { "entropy": 5.2550149917602536, "epoch": 6.767497034400949, "grad_norm": 1.25, "learning_rate": 0.00015829504123536262, "loss": 4.5802, "mean_token_accuracy": 0.2691357836127281, "num_tokens": 156797546.0, "step": 68460 }, { "entropy": 5.241849374771118, "epoch": 6.767991300909451, "grad_norm": 1.1015625, "learning_rate": 0.00015826487103566694, "loss": 4.5672, "mean_token_accuracy": 0.2600120574235916, "num_tokens": 156808646.0, "step": 68465 }, { "entropy": 5.23576512336731, "epoch": 6.768485567417952, "grad_norm": 1.2109375, "learning_rate": 0.00015823470370767367, "loss": 4.6324, "mean_token_accuracy": 0.25955685079097746, "num_tokens": 156820328.0, "step": 68470 }, { "entropy": 5.194015550613403, "epoch": 6.768979833926453, "grad_norm": 1.2421875, "learning_rate": 0.00015820453925212487, "loss": 4.5324, "mean_token_accuracy": 0.2718468725681305, "num_tokens": 156830984.0, "step": 68475 }, { "entropy": 5.216285610198975, "epoch": 6.769474100434954, "grad_norm": 1.2734375, "learning_rate": 0.00015817437766976245, "loss": 4.6153, "mean_token_accuracy": 0.2632093831896782, "num_tokens": 156841920.0, "step": 68480 }, { "entropy": 5.174390983581543, "epoch": 6.769968366943456, "grad_norm": 1.1796875, "learning_rate": 0.0001581442189613285, "loss": 4.5055, "mean_token_accuracy": 0.2747871711850166, "num_tokens": 156853944.0, "step": 68485 }, { "entropy": 5.33330512046814, "epoch": 6.770462633451958, "grad_norm": 1.2109375, "learning_rate": 0.00015811406312756486, "loss": 4.6988, "mean_token_accuracy": 0.2574880257248878, "num_tokens": 156864884.0, "step": 68490 }, { "entropy": 5.19831109046936, "epoch": 6.770956899960459, "grad_norm": 1.296875, "learning_rate": 0.00015808391016921324, "loss": 4.5394, "mean_token_accuracy": 0.2736774280667305, "num_tokens": 156875237.0, "step": 68495 }, { "entropy": 5.232432270050049, "epoch": 6.77145116646896, "grad_norm": 0.984375, "learning_rate": 0.00015805376008701583, "loss": 4.6101, "mean_token_accuracy": 0.2636762082576752, "num_tokens": 156889585.0, "step": 68500 }, { "entropy": 5.312757539749145, "epoch": 6.7719454329774615, "grad_norm": 1.234375, "learning_rate": 0.00015802361288171394, "loss": 4.7435, "mean_token_accuracy": 0.2490392208099365, "num_tokens": 156901511.0, "step": 68505 }, { "entropy": 5.341047859191894, "epoch": 6.772439699485963, "grad_norm": 1.1171875, "learning_rate": 0.0001579934685540494, "loss": 4.6772, "mean_token_accuracy": 0.2550897687673569, "num_tokens": 156912322.0, "step": 68510 }, { "entropy": 5.299190902709961, "epoch": 6.772933965994464, "grad_norm": 1.2421875, "learning_rate": 0.00015796332710476364, "loss": 4.6124, "mean_token_accuracy": 0.26159610897302626, "num_tokens": 156923663.0, "step": 68515 }, { "entropy": 5.213870859146118, "epoch": 6.773428232502965, "grad_norm": 1.3046875, "learning_rate": 0.00015793318853459803, "loss": 4.5185, "mean_token_accuracy": 0.27062522917985915, "num_tokens": 156934253.0, "step": 68520 }, { "entropy": 5.265640640258789, "epoch": 6.7739224990114675, "grad_norm": 1.1171875, "learning_rate": 0.00015790305284429435, "loss": 4.6394, "mean_token_accuracy": 0.25559447407722474, "num_tokens": 156946074.0, "step": 68525 }, { "entropy": 5.19004454612732, "epoch": 6.774416765519969, "grad_norm": 1.1640625, "learning_rate": 0.00015787292003459369, "loss": 4.5208, "mean_token_accuracy": 0.27410599738359454, "num_tokens": 156956537.0, "step": 68530 }, { "entropy": 5.299125385284424, "epoch": 6.77491103202847, "grad_norm": 1.1484375, "learning_rate": 0.00015784279010623743, "loss": 4.6908, "mean_token_accuracy": 0.24868038892745972, "num_tokens": 156968120.0, "step": 68535 }, { "entropy": 5.271089220046997, "epoch": 6.775405298536971, "grad_norm": 1.1640625, "learning_rate": 0.0001578126630599666, "loss": 4.6422, "mean_token_accuracy": 0.25580783635377885, "num_tokens": 156978850.0, "step": 68540 }, { "entropy": 5.329318618774414, "epoch": 6.7758995650454725, "grad_norm": 1.328125, "learning_rate": 0.00015778253889652243, "loss": 4.7098, "mean_token_accuracy": 0.2522419333457947, "num_tokens": 156990957.0, "step": 68545 }, { "entropy": 5.253614711761474, "epoch": 6.776393831553974, "grad_norm": 1.28125, "learning_rate": 0.00015775241761664603, "loss": 4.6415, "mean_token_accuracy": 0.2590419888496399, "num_tokens": 157002532.0, "step": 68550 }, { "entropy": 5.252229833602906, "epoch": 6.776888098062475, "grad_norm": 1.234375, "learning_rate": 0.00015772229922107834, "loss": 4.5677, "mean_token_accuracy": 0.258952209353447, "num_tokens": 157013650.0, "step": 68555 }, { "entropy": 5.243018245697021, "epoch": 6.777382364570976, "grad_norm": 1.15625, "learning_rate": 0.00015769218371056032, "loss": 4.5866, "mean_token_accuracy": 0.261507685482502, "num_tokens": 157023971.0, "step": 68560 }, { "entropy": 5.273101043701172, "epoch": 6.777876631079478, "grad_norm": 1.2890625, "learning_rate": 0.00015766207108583276, "loss": 4.5431, "mean_token_accuracy": 0.26120477318763735, "num_tokens": 157034534.0, "step": 68565 }, { "entropy": 5.409876537322998, "epoch": 6.77837089758798, "grad_norm": 1.3046875, "learning_rate": 0.0001576319613476364, "loss": 4.8009, "mean_token_accuracy": 0.2457529976963997, "num_tokens": 157046444.0, "step": 68570 }, { "entropy": 5.2835946559906, "epoch": 6.778865164096481, "grad_norm": 1.171875, "learning_rate": 0.0001576018544967121, "loss": 4.6828, "mean_token_accuracy": 0.24991386979818345, "num_tokens": 157057877.0, "step": 68575 }, { "entropy": 5.26888952255249, "epoch": 6.779359430604982, "grad_norm": 1.25, "learning_rate": 0.00015757175053380024, "loss": 4.6114, "mean_token_accuracy": 0.26409300565719607, "num_tokens": 157068690.0, "step": 68580 }, { "entropy": 5.23961615562439, "epoch": 6.7798536971134835, "grad_norm": 1.2421875, "learning_rate": 0.00015754164945964167, "loss": 4.5893, "mean_token_accuracy": 0.2572882890701294, "num_tokens": 157079765.0, "step": 68585 }, { "entropy": 5.198662233352661, "epoch": 6.780347963621985, "grad_norm": 1.1796875, "learning_rate": 0.0001575115512749767, "loss": 4.5822, "mean_token_accuracy": 0.26209444403648374, "num_tokens": 157091625.0, "step": 68590 }, { "entropy": 5.293901968002319, "epoch": 6.780842230130486, "grad_norm": 1.140625, "learning_rate": 0.00015748145598054578, "loss": 4.6468, "mean_token_accuracy": 0.250963993370533, "num_tokens": 157103600.0, "step": 68595 }, { "entropy": 5.238861417770385, "epoch": 6.781336496638987, "grad_norm": 1.1640625, "learning_rate": 0.00015745136357708935, "loss": 4.5872, "mean_token_accuracy": 0.26000587046146395, "num_tokens": 157115133.0, "step": 68600 }, { "entropy": 5.232960891723633, "epoch": 6.7818307631474894, "grad_norm": 1.2578125, "learning_rate": 0.00015742127406534757, "loss": 4.5384, "mean_token_accuracy": 0.27239019274711607, "num_tokens": 157125921.0, "step": 68605 }, { "entropy": 5.254185390472412, "epoch": 6.782325029655991, "grad_norm": 1.109375, "learning_rate": 0.00015739118744606062, "loss": 4.5826, "mean_token_accuracy": 0.25703434348106385, "num_tokens": 157136178.0, "step": 68610 }, { "entropy": 5.2145849704742435, "epoch": 6.782819296164492, "grad_norm": 1.203125, "learning_rate": 0.00015736110371996874, "loss": 4.5777, "mean_token_accuracy": 0.26260741651058195, "num_tokens": 157146660.0, "step": 68615 }, { "entropy": 5.174506521224975, "epoch": 6.783313562672993, "grad_norm": 1.1796875, "learning_rate": 0.00015733102288781198, "loss": 4.5558, "mean_token_accuracy": 0.2653214633464813, "num_tokens": 157157699.0, "step": 68620 }, { "entropy": 5.244894886016846, "epoch": 6.7838078291814945, "grad_norm": 1.203125, "learning_rate": 0.00015730094495033033, "loss": 4.6352, "mean_token_accuracy": 0.2571484938263893, "num_tokens": 157168242.0, "step": 68625 }, { "entropy": 5.2367218971252445, "epoch": 6.784302095689996, "grad_norm": 1.25, "learning_rate": 0.00015727086990826366, "loss": 4.5204, "mean_token_accuracy": 0.269471301138401, "num_tokens": 157179216.0, "step": 68630 }, { "entropy": 5.260820960998535, "epoch": 6.784796362198497, "grad_norm": 1.078125, "learning_rate": 0.00015724079776235184, "loss": 4.6442, "mean_token_accuracy": 0.26206945478916166, "num_tokens": 157190431.0, "step": 68635 }, { "entropy": 5.285794115066528, "epoch": 6.785290628706999, "grad_norm": 1.1875, "learning_rate": 0.00015721072851333467, "loss": 4.6671, "mean_token_accuracy": 0.24652200192213058, "num_tokens": 157201193.0, "step": 68640 }, { "entropy": 5.264678192138672, "epoch": 6.7857848952155, "grad_norm": 1.1328125, "learning_rate": 0.00015718066216195188, "loss": 4.5956, "mean_token_accuracy": 0.25832577645778654, "num_tokens": 157213020.0, "step": 68645 }, { "entropy": 5.2208216190338135, "epoch": 6.786279161724002, "grad_norm": 1.125, "learning_rate": 0.00015715059870894312, "loss": 4.5775, "mean_token_accuracy": 0.26318271905183793, "num_tokens": 157225134.0, "step": 68650 }, { "entropy": 5.241557788848877, "epoch": 6.786773428232503, "grad_norm": 1.171875, "learning_rate": 0.00015712053815504785, "loss": 4.5624, "mean_token_accuracy": 0.26602173745632174, "num_tokens": 157235914.0, "step": 68655 }, { "entropy": 5.376828956604004, "epoch": 6.787267694741004, "grad_norm": 1.078125, "learning_rate": 0.0001570904805010056, "loss": 4.7367, "mean_token_accuracy": 0.2431238040328026, "num_tokens": 157248269.0, "step": 68660 }, { "entropy": 5.240768766403198, "epoch": 6.7877619612495055, "grad_norm": 1.15625, "learning_rate": 0.00015706042574755585, "loss": 4.562, "mean_token_accuracy": 0.25725577473640443, "num_tokens": 157258967.0, "step": 68665 }, { "entropy": 5.317878198623657, "epoch": 6.788256227758007, "grad_norm": 1.140625, "learning_rate": 0.00015703037389543795, "loss": 4.6799, "mean_token_accuracy": 0.24915729761123656, "num_tokens": 157270862.0, "step": 68670 }, { "entropy": 5.283496618270874, "epoch": 6.788750494266509, "grad_norm": 1.2109375, "learning_rate": 0.00015700032494539117, "loss": 4.7002, "mean_token_accuracy": 0.2506831228733063, "num_tokens": 157282159.0, "step": 68675 }, { "entropy": 5.185234928131104, "epoch": 6.78924476077501, "grad_norm": 1.2109375, "learning_rate": 0.0001569702788981547, "loss": 4.5034, "mean_token_accuracy": 0.2752101972699165, "num_tokens": 157293744.0, "step": 68680 }, { "entropy": 5.2913824081420895, "epoch": 6.789739027283511, "grad_norm": 1.1171875, "learning_rate": 0.00015694023575446765, "loss": 4.7004, "mean_token_accuracy": 0.25655399113893507, "num_tokens": 157305896.0, "step": 68685 }, { "entropy": 5.25431261062622, "epoch": 6.790233293792013, "grad_norm": 1.2421875, "learning_rate": 0.00015691019551506918, "loss": 4.5798, "mean_token_accuracy": 0.25765981823205947, "num_tokens": 157316247.0, "step": 68690 }, { "entropy": 5.242147827148438, "epoch": 6.790727560300514, "grad_norm": 1.1171875, "learning_rate": 0.000156880158180698, "loss": 4.6153, "mean_token_accuracy": 0.25327477902173995, "num_tokens": 157327245.0, "step": 68695 }, { "entropy": 5.272305631637574, "epoch": 6.791221826809015, "grad_norm": 1.1953125, "learning_rate": 0.0001568501237520935, "loss": 4.6563, "mean_token_accuracy": 0.2557983323931694, "num_tokens": 157337788.0, "step": 68700 }, { "entropy": 5.282080841064453, "epoch": 6.7917160933175165, "grad_norm": 1.140625, "learning_rate": 0.00015682009222999418, "loss": 4.5934, "mean_token_accuracy": 0.2566388100385666, "num_tokens": 157349339.0, "step": 68705 }, { "entropy": 5.218738174438476, "epoch": 6.792210359826019, "grad_norm": 1.1484375, "learning_rate": 0.00015679006361513892, "loss": 4.6052, "mean_token_accuracy": 0.260654079914093, "num_tokens": 157360760.0, "step": 68710 }, { "entropy": 5.23110785484314, "epoch": 6.79270462633452, "grad_norm": 1.203125, "learning_rate": 0.00015676003790826654, "loss": 4.5506, "mean_token_accuracy": 0.2626210227608681, "num_tokens": 157371260.0, "step": 68715 }, { "entropy": 5.270896148681641, "epoch": 6.793198892843021, "grad_norm": 1.2109375, "learning_rate": 0.00015673001511011547, "loss": 4.6081, "mean_token_accuracy": 0.26470825374126433, "num_tokens": 157382423.0, "step": 68720 }, { "entropy": 5.3623229503631595, "epoch": 6.793693159351522, "grad_norm": 1.21875, "learning_rate": 0.00015669999522142437, "loss": 4.7363, "mean_token_accuracy": 0.2528767764568329, "num_tokens": 157393325.0, "step": 68725 }, { "entropy": 5.332502222061157, "epoch": 6.794187425860024, "grad_norm": 1.265625, "learning_rate": 0.00015666997824293177, "loss": 4.6059, "mean_token_accuracy": 0.25977665185928345, "num_tokens": 157403742.0, "step": 68730 }, { "entropy": 5.298822641372681, "epoch": 6.794681692368525, "grad_norm": 1.265625, "learning_rate": 0.00015663996417537602, "loss": 4.7142, "mean_token_accuracy": 0.2495458945631981, "num_tokens": 157415067.0, "step": 68735 }, { "entropy": 5.298798274993897, "epoch": 6.795175958877026, "grad_norm": 1.140625, "learning_rate": 0.00015660995301949564, "loss": 4.6583, "mean_token_accuracy": 0.25810700207948684, "num_tokens": 157427102.0, "step": 68740 }, { "entropy": 5.306817579269409, "epoch": 6.795670225385528, "grad_norm": 1.2578125, "learning_rate": 0.00015657994477602866, "loss": 4.6952, "mean_token_accuracy": 0.258182992041111, "num_tokens": 157438531.0, "step": 68745 }, { "entropy": 5.337020301818848, "epoch": 6.79616449189403, "grad_norm": 1.125, "learning_rate": 0.0001565499394457134, "loss": 4.6643, "mean_token_accuracy": 0.2560196563601494, "num_tokens": 157449747.0, "step": 68750 }, { "entropy": 5.298873662948608, "epoch": 6.796658758402531, "grad_norm": 1.125, "learning_rate": 0.00015651993702928808, "loss": 4.6891, "mean_token_accuracy": 0.25449457466602327, "num_tokens": 157461899.0, "step": 68755 }, { "entropy": 5.318459939956665, "epoch": 6.797153024911032, "grad_norm": 1.2265625, "learning_rate": 0.00015648993752749064, "loss": 4.6619, "mean_token_accuracy": 0.25158165246248243, "num_tokens": 157473357.0, "step": 68760 }, { "entropy": 5.260864543914795, "epoch": 6.797647291419533, "grad_norm": 1.140625, "learning_rate": 0.00015645994094105916, "loss": 4.5817, "mean_token_accuracy": 0.257532162964344, "num_tokens": 157484208.0, "step": 68765 }, { "entropy": 5.271225881576538, "epoch": 6.798141557928035, "grad_norm": 1.1875, "learning_rate": 0.00015642994727073148, "loss": 4.5822, "mean_token_accuracy": 0.2642140656709671, "num_tokens": 157495806.0, "step": 68770 }, { "entropy": 5.209128093719483, "epoch": 6.798635824436536, "grad_norm": 1.3125, "learning_rate": 0.00015639995651724553, "loss": 4.5381, "mean_token_accuracy": 0.2664187505841255, "num_tokens": 157507025.0, "step": 68775 }, { "entropy": 5.275865745544434, "epoch": 6.799130090945038, "grad_norm": 1.1171875, "learning_rate": 0.00015636996868133906, "loss": 4.6376, "mean_token_accuracy": 0.24919022619724274, "num_tokens": 157519387.0, "step": 68780 }, { "entropy": 5.2471764087677, "epoch": 6.799624357453539, "grad_norm": 1.1640625, "learning_rate": 0.00015633998376374963, "loss": 4.5935, "mean_token_accuracy": 0.2589408114552498, "num_tokens": 157530201.0, "step": 68785 }, { "entropy": 5.212035512924194, "epoch": 6.800118623962041, "grad_norm": 1.2109375, "learning_rate": 0.0001563100017652152, "loss": 4.5913, "mean_token_accuracy": 0.2641231656074524, "num_tokens": 157542527.0, "step": 68790 }, { "entropy": 5.308533620834351, "epoch": 6.800612890470542, "grad_norm": 1.2109375, "learning_rate": 0.00015628002268647302, "loss": 4.6526, "mean_token_accuracy": 0.2591287598013878, "num_tokens": 157553346.0, "step": 68795 }, { "entropy": 5.266946315765381, "epoch": 6.801107156979043, "grad_norm": 1.125, "learning_rate": 0.0001562500465282607, "loss": 4.5834, "mean_token_accuracy": 0.25872534066438674, "num_tokens": 157564640.0, "step": 68800 }, { "entropy": 5.272248792648315, "epoch": 6.801601423487544, "grad_norm": 1.25, "learning_rate": 0.0001562200732913158, "loss": 4.6669, "mean_token_accuracy": 0.25253517776727674, "num_tokens": 157577165.0, "step": 68805 }, { "entropy": 5.1411230087280275, "epoch": 6.802095689996046, "grad_norm": 1.3046875, "learning_rate": 0.00015619010297637537, "loss": 4.5002, "mean_token_accuracy": 0.2730625122785568, "num_tokens": 157587127.0, "step": 68810 }, { "entropy": 5.246244478225708, "epoch": 6.802589956504547, "grad_norm": 1.2265625, "learning_rate": 0.00015616013558417688, "loss": 4.656, "mean_token_accuracy": 0.2578128084540367, "num_tokens": 157597608.0, "step": 68815 }, { "entropy": 5.238784456253052, "epoch": 6.803084223013048, "grad_norm": 1.2421875, "learning_rate": 0.00015613017111545745, "loss": 4.5753, "mean_token_accuracy": 0.2669472828507423, "num_tokens": 157608431.0, "step": 68820 }, { "entropy": 5.299338960647583, "epoch": 6.80357848952155, "grad_norm": 1.0546875, "learning_rate": 0.00015610020957095434, "loss": 4.6876, "mean_token_accuracy": 0.25809583961963656, "num_tokens": 157619560.0, "step": 68825 }, { "entropy": 5.241836833953857, "epoch": 6.804072756030052, "grad_norm": 1.2421875, "learning_rate": 0.0001560702509514045, "loss": 4.5651, "mean_token_accuracy": 0.2711267679929733, "num_tokens": 157631320.0, "step": 68830 }, { "entropy": 5.2203206539154055, "epoch": 6.804567022538553, "grad_norm": 1.140625, "learning_rate": 0.00015604029525754493, "loss": 4.5741, "mean_token_accuracy": 0.2675774276256561, "num_tokens": 157642854.0, "step": 68835 }, { "entropy": 5.278861379623413, "epoch": 6.805061289047054, "grad_norm": 1.3671875, "learning_rate": 0.00015601034249011252, "loss": 4.6232, "mean_token_accuracy": 0.25680345594882964, "num_tokens": 157654873.0, "step": 68840 }, { "entropy": 5.280572700500488, "epoch": 6.805555555555555, "grad_norm": 1.203125, "learning_rate": 0.00015598039264984412, "loss": 4.6634, "mean_token_accuracy": 0.258175827562809, "num_tokens": 157666629.0, "step": 68845 }, { "entropy": 5.390516185760498, "epoch": 6.806049822064057, "grad_norm": 1.15625, "learning_rate": 0.00015595044573747655, "loss": 4.7798, "mean_token_accuracy": 0.23734783977270127, "num_tokens": 157678083.0, "step": 68850 }, { "entropy": 5.287741756439209, "epoch": 6.806544088572558, "grad_norm": 1.28125, "learning_rate": 0.00015592050175374655, "loss": 4.5697, "mean_token_accuracy": 0.26529801785945895, "num_tokens": 157689680.0, "step": 68855 }, { "entropy": 5.220792150497436, "epoch": 6.80703835508106, "grad_norm": 1.078125, "learning_rate": 0.00015589056069939062, "loss": 4.5819, "mean_token_accuracy": 0.26526188254356386, "num_tokens": 157702653.0, "step": 68860 }, { "entropy": 5.2707178592681885, "epoch": 6.807532621589561, "grad_norm": 1.1953125, "learning_rate": 0.00015586062257514534, "loss": 4.5927, "mean_token_accuracy": 0.2648110419511795, "num_tokens": 157712621.0, "step": 68865 }, { "entropy": 5.1767254829406735, "epoch": 6.808026888098063, "grad_norm": 1.1953125, "learning_rate": 0.00015583068738174728, "loss": 4.5149, "mean_token_accuracy": 0.2690689355134964, "num_tokens": 157723683.0, "step": 68870 }, { "entropy": 5.167171955108643, "epoch": 6.808521154606564, "grad_norm": 1.078125, "learning_rate": 0.0001558007551199328, "loss": 4.4986, "mean_token_accuracy": 0.2704053983092308, "num_tokens": 157735324.0, "step": 68875 }, { "entropy": 5.271202945709229, "epoch": 6.809015421115065, "grad_norm": 1.15625, "learning_rate": 0.00015577082579043826, "loss": 4.5737, "mean_token_accuracy": 0.25715550482273103, "num_tokens": 157746150.0, "step": 68880 }, { "entropy": 5.244584655761718, "epoch": 6.809509687623566, "grad_norm": 1.3046875, "learning_rate": 0.0001557408993939999, "loss": 4.611, "mean_token_accuracy": 0.2577063232660294, "num_tokens": 157756678.0, "step": 68885 }, { "entropy": 5.272095823287964, "epoch": 6.810003954132068, "grad_norm": 1.1640625, "learning_rate": 0.00015571097593135392, "loss": 4.6546, "mean_token_accuracy": 0.2551229730248451, "num_tokens": 157768665.0, "step": 68890 }, { "entropy": 5.254415702819824, "epoch": 6.81049822064057, "grad_norm": 1.15625, "learning_rate": 0.00015568105540323638, "loss": 4.6899, "mean_token_accuracy": 0.25498087257146834, "num_tokens": 157781023.0, "step": 68895 }, { "entropy": 5.222818517684937, "epoch": 6.810992487149071, "grad_norm": 1.0, "learning_rate": 0.0001556511378103833, "loss": 4.6424, "mean_token_accuracy": 0.2551769271492958, "num_tokens": 157794395.0, "step": 68900 }, { "entropy": 5.1981062412261965, "epoch": 6.811486753657572, "grad_norm": 1.1796875, "learning_rate": 0.00015562122315353094, "loss": 4.5417, "mean_token_accuracy": 0.269090573489666, "num_tokens": 157805671.0, "step": 68905 }, { "entropy": 5.310288047790527, "epoch": 6.8119810201660735, "grad_norm": 1.203125, "learning_rate": 0.00015559131143341487, "loss": 4.6707, "mean_token_accuracy": 0.25185619443655016, "num_tokens": 157816602.0, "step": 68910 }, { "entropy": 5.273715305328369, "epoch": 6.812475286674575, "grad_norm": 1.1171875, "learning_rate": 0.00015556140265077123, "loss": 4.6271, "mean_token_accuracy": 0.25833573639392854, "num_tokens": 157827971.0, "step": 68915 }, { "entropy": 5.308866930007935, "epoch": 6.812969553183076, "grad_norm": 1.140625, "learning_rate": 0.00015553149680633548, "loss": 4.6894, "mean_token_accuracy": 0.2512971729040146, "num_tokens": 157838772.0, "step": 68920 }, { "entropy": 5.229079723358154, "epoch": 6.813463819691577, "grad_norm": 1.2109375, "learning_rate": 0.00015550159390084344, "loss": 4.5415, "mean_token_accuracy": 0.2645938560366631, "num_tokens": 157849027.0, "step": 68925 }, { "entropy": 5.283321762084961, "epoch": 6.8139580862000795, "grad_norm": 1.125, "learning_rate": 0.00015547169393503074, "loss": 4.668, "mean_token_accuracy": 0.2546967551112175, "num_tokens": 157862322.0, "step": 68930 }, { "entropy": 5.133304643630981, "epoch": 6.814452352708581, "grad_norm": 1.1875, "learning_rate": 0.0001554417969096329, "loss": 4.4407, "mean_token_accuracy": 0.27736450731754303, "num_tokens": 157874438.0, "step": 68935 }, { "entropy": 5.200825214385986, "epoch": 6.814946619217082, "grad_norm": 1.140625, "learning_rate": 0.00015541190282538552, "loss": 4.5718, "mean_token_accuracy": 0.26888459026813505, "num_tokens": 157887353.0, "step": 68940 }, { "entropy": 5.159976863861084, "epoch": 6.815440885725583, "grad_norm": 1.1328125, "learning_rate": 0.00015538201168302377, "loss": 4.5572, "mean_token_accuracy": 0.27137676179409026, "num_tokens": 157899620.0, "step": 68945 }, { "entropy": 5.287550354003907, "epoch": 6.8159351522340845, "grad_norm": 1.25, "learning_rate": 0.00015535212348328307, "loss": 4.6379, "mean_token_accuracy": 0.25835880637168884, "num_tokens": 157911385.0, "step": 68950 }, { "entropy": 5.2905937194824215, "epoch": 6.816429418742586, "grad_norm": 1.2734375, "learning_rate": 0.00015532223822689882, "loss": 4.6214, "mean_token_accuracy": 0.2572432279586792, "num_tokens": 157923440.0, "step": 68955 }, { "entropy": 5.305365753173828, "epoch": 6.816923685251087, "grad_norm": 1.2421875, "learning_rate": 0.00015529235591460588, "loss": 4.6844, "mean_token_accuracy": 0.2566821604967117, "num_tokens": 157935671.0, "step": 68960 }, { "entropy": 5.2575654029846195, "epoch": 6.817417951759589, "grad_norm": 1.1953125, "learning_rate": 0.0001552624765471397, "loss": 4.5773, "mean_token_accuracy": 0.2584059938788414, "num_tokens": 157947045.0, "step": 68965 }, { "entropy": 5.2812741756439205, "epoch": 6.8179122182680905, "grad_norm": 1.3046875, "learning_rate": 0.00015523260012523514, "loss": 4.6643, "mean_token_accuracy": 0.2568489760160446, "num_tokens": 157959063.0, "step": 68970 }, { "entropy": 5.239816379547119, "epoch": 6.818406484776592, "grad_norm": 1.1484375, "learning_rate": 0.0001552027266496272, "loss": 4.6219, "mean_token_accuracy": 0.262571807205677, "num_tokens": 157971218.0, "step": 68975 }, { "entropy": 5.250052213668823, "epoch": 6.818900751285093, "grad_norm": 1.1171875, "learning_rate": 0.00015517285612105084, "loss": 4.6099, "mean_token_accuracy": 0.2601464167237282, "num_tokens": 157982678.0, "step": 68980 }, { "entropy": 5.286582183837891, "epoch": 6.819395017793594, "grad_norm": 1.171875, "learning_rate": 0.00015514298854024062, "loss": 4.6833, "mean_token_accuracy": 0.25107135623693466, "num_tokens": 157993963.0, "step": 68985 }, { "entropy": 5.19018588066101, "epoch": 6.8198892843020955, "grad_norm": 1.1015625, "learning_rate": 0.00015511312390793168, "loss": 4.5583, "mean_token_accuracy": 0.26919945031404496, "num_tokens": 158007911.0, "step": 68990 }, { "entropy": 5.299937391281128, "epoch": 6.820383550810597, "grad_norm": 1.15625, "learning_rate": 0.0001550832622248584, "loss": 4.678, "mean_token_accuracy": 0.25652347803115844, "num_tokens": 158019361.0, "step": 68995 }, { "entropy": 5.2389894962310795, "epoch": 6.820877817319099, "grad_norm": 1.1640625, "learning_rate": 0.00015505340349175546, "loss": 4.5565, "mean_token_accuracy": 0.26198092848062515, "num_tokens": 158030513.0, "step": 69000 }, { "epoch": 6.820877817319099, "eval_entropy": 5.014753006246551, "eval_loss": 4.782212257385254, "eval_mean_token_accuracy": 0.25554120438345246, "eval_num_tokens": 158030513.0, "eval_runtime": 26.5847, "eval_samples_per_second": 1222.999, "eval_steps_per_second": 152.908, "step": 69000 }, { "entropy": 5.242800855636597, "epoch": 6.8213720838276, "grad_norm": 1.1484375, "learning_rate": 0.00015502354770935745, "loss": 4.6263, "mean_token_accuracy": 0.2569642007350922, "num_tokens": 158041858.0, "step": 69005 }, { "entropy": 5.256336450576782, "epoch": 6.8218663503361014, "grad_norm": 1.109375, "learning_rate": 0.00015499369487839874, "loss": 4.6007, "mean_token_accuracy": 0.2631559997797012, "num_tokens": 158053229.0, "step": 69010 }, { "entropy": 5.340371084213257, "epoch": 6.822360616844603, "grad_norm": 1.2890625, "learning_rate": 0.00015496384499961375, "loss": 4.6982, "mean_token_accuracy": 0.25249139666557313, "num_tokens": 158065249.0, "step": 69015 }, { "entropy": 5.229884243011474, "epoch": 6.822854883353104, "grad_norm": 1.2734375, "learning_rate": 0.00015493399807373675, "loss": 4.5588, "mean_token_accuracy": 0.26719907820224764, "num_tokens": 158076629.0, "step": 69020 }, { "entropy": 5.293745279312134, "epoch": 6.823349149861605, "grad_norm": 1.125, "learning_rate": 0.0001549041541015021, "loss": 4.6537, "mean_token_accuracy": 0.2576707243919373, "num_tokens": 158087903.0, "step": 69025 }, { "entropy": 5.303295040130616, "epoch": 6.8238434163701065, "grad_norm": 1.1171875, "learning_rate": 0.00015487431308364394, "loss": 4.6015, "mean_token_accuracy": 0.26266232281923296, "num_tokens": 158099083.0, "step": 69030 }, { "entropy": 5.183799695968628, "epoch": 6.824337682878608, "grad_norm": 1.1015625, "learning_rate": 0.00015484447502089622, "loss": 4.5297, "mean_token_accuracy": 0.2703612372279167, "num_tokens": 158110819.0, "step": 69035 }, { "entropy": 5.257328510284424, "epoch": 6.82483194938711, "grad_norm": 1.25, "learning_rate": 0.00015481463991399305, "loss": 4.6215, "mean_token_accuracy": 0.26178796142339705, "num_tokens": 158123174.0, "step": 69040 }, { "entropy": 5.19573655128479, "epoch": 6.825326215895611, "grad_norm": 1.109375, "learning_rate": 0.00015478480776366839, "loss": 4.5994, "mean_token_accuracy": 0.26258735060691835, "num_tokens": 158135261.0, "step": 69045 }, { "entropy": 5.258211088180542, "epoch": 6.825820482404112, "grad_norm": 1.34375, "learning_rate": 0.00015475497857065612, "loss": 4.6649, "mean_token_accuracy": 0.25770104974508284, "num_tokens": 158147120.0, "step": 69050 }, { "entropy": 5.2588889598846436, "epoch": 6.826314748912614, "grad_norm": 1.21875, "learning_rate": 0.00015472515233569013, "loss": 4.6736, "mean_token_accuracy": 0.2511872261762619, "num_tokens": 158158538.0, "step": 69055 }, { "entropy": 5.312131023406982, "epoch": 6.826809015421115, "grad_norm": 1.0859375, "learning_rate": 0.00015469532905950392, "loss": 4.6798, "mean_token_accuracy": 0.2537973776459694, "num_tokens": 158170389.0, "step": 69060 }, { "entropy": 5.224996709823609, "epoch": 6.827303281929616, "grad_norm": 1.2109375, "learning_rate": 0.00015466550874283132, "loss": 4.5808, "mean_token_accuracy": 0.2625138655304909, "num_tokens": 158181275.0, "step": 69065 }, { "entropy": 5.329902267456054, "epoch": 6.8277975484381175, "grad_norm": 1.1328125, "learning_rate": 0.00015463569138640592, "loss": 4.6739, "mean_token_accuracy": 0.2551666244864464, "num_tokens": 158193489.0, "step": 69070 }, { "entropy": 5.314337062835693, "epoch": 6.828291814946619, "grad_norm": 1.296875, "learning_rate": 0.00015460587699096107, "loss": 4.7073, "mean_token_accuracy": 0.2523600414395332, "num_tokens": 158204939.0, "step": 69075 }, { "entropy": 5.152891159057617, "epoch": 6.828786081455121, "grad_norm": 1.125, "learning_rate": 0.00015457606555723045, "loss": 4.4771, "mean_token_accuracy": 0.2697688415646553, "num_tokens": 158216191.0, "step": 69080 }, { "entropy": 5.27055516242981, "epoch": 6.829280347963622, "grad_norm": 1.1640625, "learning_rate": 0.00015454625708594724, "loss": 4.6117, "mean_token_accuracy": 0.25913394391536715, "num_tokens": 158227988.0, "step": 69085 }, { "entropy": 5.147813510894776, "epoch": 6.829774614472123, "grad_norm": 1.171875, "learning_rate": 0.00015451645157784478, "loss": 4.5611, "mean_token_accuracy": 0.26098612546920774, "num_tokens": 158239618.0, "step": 69090 }, { "entropy": 5.193680000305176, "epoch": 6.830268880980625, "grad_norm": 1.1875, "learning_rate": 0.0001544866490336564, "loss": 4.5061, "mean_token_accuracy": 0.2736313953995705, "num_tokens": 158251851.0, "step": 69095 }, { "entropy": 5.24459662437439, "epoch": 6.830763147489126, "grad_norm": 1.1953125, "learning_rate": 0.00015445684945411504, "loss": 4.6117, "mean_token_accuracy": 0.25561569780111315, "num_tokens": 158263529.0, "step": 69100 }, { "entropy": 5.195126581192016, "epoch": 6.831257413997627, "grad_norm": 1.3046875, "learning_rate": 0.0001544270528399539, "loss": 4.4996, "mean_token_accuracy": 0.27382366359233856, "num_tokens": 158275244.0, "step": 69105 }, { "entropy": 5.207233953475952, "epoch": 6.8317516805061285, "grad_norm": 1.21875, "learning_rate": 0.00015439725919190594, "loss": 4.5742, "mean_token_accuracy": 0.26959976106882094, "num_tokens": 158286579.0, "step": 69110 }, { "entropy": 5.2255330085754395, "epoch": 6.832245947014631, "grad_norm": 1.234375, "learning_rate": 0.00015436746851070414, "loss": 4.6163, "mean_token_accuracy": 0.2649832934141159, "num_tokens": 158297477.0, "step": 69115 }, { "entropy": 5.235470008850098, "epoch": 6.832740213523132, "grad_norm": 1.1015625, "learning_rate": 0.00015433768079708138, "loss": 4.6315, "mean_token_accuracy": 0.2576497450470924, "num_tokens": 158309279.0, "step": 69120 }, { "entropy": 5.295355176925659, "epoch": 6.833234480031633, "grad_norm": 1.125, "learning_rate": 0.00015430789605177037, "loss": 4.7003, "mean_token_accuracy": 0.25382533520460127, "num_tokens": 158321720.0, "step": 69125 }, { "entropy": 5.306175279617309, "epoch": 6.833728746540134, "grad_norm": 1.15625, "learning_rate": 0.0001542781142755038, "loss": 4.6902, "mean_token_accuracy": 0.2505245000123978, "num_tokens": 158333965.0, "step": 69130 }, { "entropy": 5.267826271057129, "epoch": 6.834223013048636, "grad_norm": 1.25, "learning_rate": 0.00015424833546901433, "loss": 4.6132, "mean_token_accuracy": 0.26472732573747637, "num_tokens": 158345657.0, "step": 69135 }, { "entropy": 5.22486138343811, "epoch": 6.834717279557137, "grad_norm": 1.125, "learning_rate": 0.00015421855963303457, "loss": 4.5863, "mean_token_accuracy": 0.26119080036878584, "num_tokens": 158356821.0, "step": 69140 }, { "entropy": 5.181285190582275, "epoch": 6.835211546065638, "grad_norm": 1.0859375, "learning_rate": 0.00015418878676829706, "loss": 4.5986, "mean_token_accuracy": 0.2660967320203781, "num_tokens": 158369929.0, "step": 69145 }, { "entropy": 5.190845346450805, "epoch": 6.83570581257414, "grad_norm": 1.1953125, "learning_rate": 0.00015415901687553408, "loss": 4.5498, "mean_token_accuracy": 0.2675956651568413, "num_tokens": 158380550.0, "step": 69150 }, { "entropy": 5.2665331840515135, "epoch": 6.836200079082642, "grad_norm": 1.1796875, "learning_rate": 0.000154129249955478, "loss": 4.5882, "mean_token_accuracy": 0.26454498916864394, "num_tokens": 158392379.0, "step": 69155 }, { "entropy": 5.2340045928955075, "epoch": 6.836694345591143, "grad_norm": 1.2265625, "learning_rate": 0.0001540994860088611, "loss": 4.5463, "mean_token_accuracy": 0.2707319036126137, "num_tokens": 158403880.0, "step": 69160 }, { "entropy": 5.2664491653442385, "epoch": 6.837188612099644, "grad_norm": 1.2734375, "learning_rate": 0.00015406972503641565, "loss": 4.6142, "mean_token_accuracy": 0.25918126106262207, "num_tokens": 158416117.0, "step": 69165 }, { "entropy": 5.302061271667481, "epoch": 6.837682878608145, "grad_norm": 1.34375, "learning_rate": 0.00015403996703887378, "loss": 4.6225, "mean_token_accuracy": 0.25543178617954254, "num_tokens": 158426387.0, "step": 69170 }, { "entropy": 5.214842319488525, "epoch": 6.838177145116647, "grad_norm": 1.21875, "learning_rate": 0.0001540102120169674, "loss": 4.5524, "mean_token_accuracy": 0.2617785379290581, "num_tokens": 158438312.0, "step": 69175 }, { "entropy": 5.244465637207031, "epoch": 6.838671411625148, "grad_norm": 1.21875, "learning_rate": 0.00015398045997142858, "loss": 4.6165, "mean_token_accuracy": 0.2534584909677505, "num_tokens": 158448889.0, "step": 69180 }, { "entropy": 5.255147695541382, "epoch": 6.83916567813365, "grad_norm": 1.2265625, "learning_rate": 0.00015395071090298928, "loss": 4.6436, "mean_token_accuracy": 0.25704772025346756, "num_tokens": 158460649.0, "step": 69185 }, { "entropy": 5.166564035415649, "epoch": 6.839659944642151, "grad_norm": 1.2578125, "learning_rate": 0.00015392096481238116, "loss": 4.5245, "mean_token_accuracy": 0.2685365706682205, "num_tokens": 158471534.0, "step": 69190 }, { "entropy": 5.284056663513184, "epoch": 6.840154211150653, "grad_norm": 1.203125, "learning_rate": 0.00015389122170033622, "loss": 4.6669, "mean_token_accuracy": 0.2575185462832451, "num_tokens": 158482494.0, "step": 69195 }, { "entropy": 5.350903940200806, "epoch": 6.840648477659154, "grad_norm": 1.1796875, "learning_rate": 0.00015386148156758592, "loss": 4.72, "mean_token_accuracy": 0.2514061272144318, "num_tokens": 158494770.0, "step": 69200 }, { "entropy": 5.23978853225708, "epoch": 6.841142744167655, "grad_norm": 1.15625, "learning_rate": 0.000153831744414862, "loss": 4.6632, "mean_token_accuracy": 0.2607916250824928, "num_tokens": 158506326.0, "step": 69205 }, { "entropy": 5.22507381439209, "epoch": 6.841637010676156, "grad_norm": 1.2265625, "learning_rate": 0.00015380201024289602, "loss": 4.487, "mean_token_accuracy": 0.26841713935136796, "num_tokens": 158517138.0, "step": 69210 }, { "entropy": 5.281412744522095, "epoch": 6.842131277184658, "grad_norm": 1.1796875, "learning_rate": 0.00015377227905241935, "loss": 4.6958, "mean_token_accuracy": 0.24696138203144075, "num_tokens": 158529560.0, "step": 69215 }, { "entropy": 5.231500291824341, "epoch": 6.84262554369316, "grad_norm": 1.140625, "learning_rate": 0.0001537425508441634, "loss": 4.611, "mean_token_accuracy": 0.2628473609685898, "num_tokens": 158541695.0, "step": 69220 }, { "entropy": 5.321531629562378, "epoch": 6.843119810201661, "grad_norm": 1.2109375, "learning_rate": 0.00015371282561885946, "loss": 4.6892, "mean_token_accuracy": 0.25092908591032026, "num_tokens": 158552927.0, "step": 69225 }, { "entropy": 5.2654729843139645, "epoch": 6.843614076710162, "grad_norm": 1.171875, "learning_rate": 0.00015368310337723887, "loss": 4.6644, "mean_token_accuracy": 0.2535091519355774, "num_tokens": 158563925.0, "step": 69230 }, { "entropy": 5.268789625167846, "epoch": 6.844108343218664, "grad_norm": 1.21875, "learning_rate": 0.00015365338412003283, "loss": 4.5789, "mean_token_accuracy": 0.2579031974077225, "num_tokens": 158574545.0, "step": 69235 }, { "entropy": 5.279537487030029, "epoch": 6.844602609727165, "grad_norm": 1.09375, "learning_rate": 0.00015362366784797232, "loss": 4.6084, "mean_token_accuracy": 0.2563935860991478, "num_tokens": 158586825.0, "step": 69240 }, { "entropy": 5.22945384979248, "epoch": 6.845096876235666, "grad_norm": 1.046875, "learning_rate": 0.00015359395456178838, "loss": 4.6155, "mean_token_accuracy": 0.2584263414144516, "num_tokens": 158599081.0, "step": 69245 }, { "entropy": 5.231535482406616, "epoch": 6.845591142744167, "grad_norm": 1.09375, "learning_rate": 0.000153564244262212, "loss": 4.6334, "mean_token_accuracy": 0.25915722995996476, "num_tokens": 158612884.0, "step": 69250 }, { "entropy": 5.331488704681396, "epoch": 6.8460854092526695, "grad_norm": 1.1640625, "learning_rate": 0.000153534536949974, "loss": 4.6557, "mean_token_accuracy": 0.25040472447872164, "num_tokens": 158623569.0, "step": 69255 }, { "entropy": 5.33066086769104, "epoch": 6.846579675761171, "grad_norm": 1.21875, "learning_rate": 0.00015350483262580538, "loss": 4.6993, "mean_token_accuracy": 0.2487444519996643, "num_tokens": 158635089.0, "step": 69260 }, { "entropy": 5.31190710067749, "epoch": 6.847073942269672, "grad_norm": 1.2734375, "learning_rate": 0.00015347513129043664, "loss": 4.6246, "mean_token_accuracy": 0.25755585432052613, "num_tokens": 158645450.0, "step": 69265 }, { "entropy": 5.167782735824585, "epoch": 6.847568208778173, "grad_norm": 1.2578125, "learning_rate": 0.0001534454329445985, "loss": 4.5125, "mean_token_accuracy": 0.26680481880903245, "num_tokens": 158656063.0, "step": 69270 }, { "entropy": 5.2557824611663815, "epoch": 6.8480624752866746, "grad_norm": 1.1953125, "learning_rate": 0.00015341573758902166, "loss": 4.6304, "mean_token_accuracy": 0.2568046867847443, "num_tokens": 158666851.0, "step": 69275 }, { "entropy": 5.293576574325561, "epoch": 6.848556741795176, "grad_norm": 1.109375, "learning_rate": 0.00015338604522443632, "loss": 4.6961, "mean_token_accuracy": 0.2570722907781601, "num_tokens": 158679246.0, "step": 69280 }, { "entropy": 5.3008044242858885, "epoch": 6.849051008303677, "grad_norm": 1.046875, "learning_rate": 0.00015335635585157336, "loss": 4.6955, "mean_token_accuracy": 0.255068464577198, "num_tokens": 158690852.0, "step": 69285 }, { "entropy": 5.225460720062256, "epoch": 6.849545274812178, "grad_norm": 1.109375, "learning_rate": 0.00015332666947116285, "loss": 4.6032, "mean_token_accuracy": 0.26327691972255707, "num_tokens": 158704295.0, "step": 69290 }, { "entropy": 5.228362512588501, "epoch": 6.8500395413206805, "grad_norm": 1.171875, "learning_rate": 0.0001532969860839351, "loss": 4.5038, "mean_token_accuracy": 0.26863460391759875, "num_tokens": 158715406.0, "step": 69295 }, { "entropy": 5.179530429840088, "epoch": 6.850533807829182, "grad_norm": 1.21875, "learning_rate": 0.00015326730569062048, "loss": 4.5741, "mean_token_accuracy": 0.2643458679318428, "num_tokens": 158725908.0, "step": 69300 }, { "entropy": 5.254811477661133, "epoch": 6.851028074337683, "grad_norm": 1.1015625, "learning_rate": 0.00015323762829194887, "loss": 4.6625, "mean_token_accuracy": 0.25556258857250214, "num_tokens": 158737313.0, "step": 69305 }, { "entropy": 5.294121122360229, "epoch": 6.851522340846184, "grad_norm": 1.2265625, "learning_rate": 0.00015320795388865067, "loss": 4.7007, "mean_token_accuracy": 0.25268777310848234, "num_tokens": 158749881.0, "step": 69310 }, { "entropy": 5.345803546905517, "epoch": 6.8520166073546855, "grad_norm": 1.125, "learning_rate": 0.00015317828248145556, "loss": 4.7208, "mean_token_accuracy": 0.250670799612999, "num_tokens": 158760410.0, "step": 69315 }, { "entropy": 5.32728066444397, "epoch": 6.852510873863187, "grad_norm": 1.1171875, "learning_rate": 0.00015314861407109365, "loss": 4.6661, "mean_token_accuracy": 0.25317103266716, "num_tokens": 158771820.0, "step": 69320 }, { "entropy": 5.245832109451294, "epoch": 6.853005140371688, "grad_norm": 1.2109375, "learning_rate": 0.0001531189486582948, "loss": 4.5611, "mean_token_accuracy": 0.26790178567171097, "num_tokens": 158782963.0, "step": 69325 }, { "entropy": 5.247638368606568, "epoch": 6.853499406880189, "grad_norm": 1.140625, "learning_rate": 0.00015308928624378862, "loss": 4.5913, "mean_token_accuracy": 0.26661255955696106, "num_tokens": 158794709.0, "step": 69330 }, { "entropy": 5.239212560653686, "epoch": 6.8539936733886915, "grad_norm": 1.0390625, "learning_rate": 0.00015305962682830493, "loss": 4.6214, "mean_token_accuracy": 0.26166616231203077, "num_tokens": 158807812.0, "step": 69335 }, { "entropy": 5.252125358581543, "epoch": 6.854487939897193, "grad_norm": 1.1796875, "learning_rate": 0.00015302997041257332, "loss": 4.6097, "mean_token_accuracy": 0.2612279444932938, "num_tokens": 158821118.0, "step": 69340 }, { "entropy": 5.219572353363037, "epoch": 6.854982206405694, "grad_norm": 1.1796875, "learning_rate": 0.0001530003169973234, "loss": 4.5601, "mean_token_accuracy": 0.26305494010448455, "num_tokens": 158833745.0, "step": 69345 }, { "entropy": 5.245860624313354, "epoch": 6.855476472914195, "grad_norm": 1.0703125, "learning_rate": 0.00015297066658328468, "loss": 4.6066, "mean_token_accuracy": 0.27004877030849456, "num_tokens": 158846287.0, "step": 69350 }, { "entropy": 5.213609409332276, "epoch": 6.8559707394226965, "grad_norm": 1.21875, "learning_rate": 0.00015294101917118637, "loss": 4.5331, "mean_token_accuracy": 0.26433124393224716, "num_tokens": 158857868.0, "step": 69355 }, { "entropy": 5.187624168395996, "epoch": 6.856465005931198, "grad_norm": 1.25, "learning_rate": 0.00015291137476175807, "loss": 4.5774, "mean_token_accuracy": 0.25975568741559985, "num_tokens": 158868551.0, "step": 69360 }, { "entropy": 5.3104160785675045, "epoch": 6.856959272439699, "grad_norm": 1.1640625, "learning_rate": 0.00015288173335572868, "loss": 4.6969, "mean_token_accuracy": 0.25079272836446764, "num_tokens": 158881756.0, "step": 69365 }, { "entropy": 5.245198202133179, "epoch": 6.857453538948201, "grad_norm": 1.15625, "learning_rate": 0.00015285209495382768, "loss": 4.6249, "mean_token_accuracy": 0.26379648596048355, "num_tokens": 158893153.0, "step": 69370 }, { "entropy": 5.3110815525054935, "epoch": 6.8579478054567025, "grad_norm": 1.1328125, "learning_rate": 0.0001528224595567842, "loss": 4.663, "mean_token_accuracy": 0.25115049481391905, "num_tokens": 158906263.0, "step": 69375 }, { "entropy": 5.223451423645019, "epoch": 6.858442071965204, "grad_norm": 1.2421875, "learning_rate": 0.00015279282716532705, "loss": 4.5833, "mean_token_accuracy": 0.2628365710377693, "num_tokens": 158917086.0, "step": 69380 }, { "entropy": 5.164639902114868, "epoch": 6.858936338473705, "grad_norm": 1.25, "learning_rate": 0.00015276319778018545, "loss": 4.5141, "mean_token_accuracy": 0.27274297177791595, "num_tokens": 158927974.0, "step": 69385 }, { "entropy": 5.239331769943237, "epoch": 6.859430604982206, "grad_norm": 1.2265625, "learning_rate": 0.00015273357140208803, "loss": 4.6596, "mean_token_accuracy": 0.2516985580325127, "num_tokens": 158940265.0, "step": 69390 }, { "entropy": 5.298618221282959, "epoch": 6.8599248714907075, "grad_norm": 1.1875, "learning_rate": 0.00015270394803176363, "loss": 4.6581, "mean_token_accuracy": 0.260476715862751, "num_tokens": 158952285.0, "step": 69395 }, { "entropy": 5.3525137424469, "epoch": 6.860419137999209, "grad_norm": 1.3828125, "learning_rate": 0.00015267432766994125, "loss": 4.6857, "mean_token_accuracy": 0.25390235185623167, "num_tokens": 158962790.0, "step": 69400 }, { "entropy": 5.325414752960205, "epoch": 6.860913404507711, "grad_norm": 1.15625, "learning_rate": 0.0001526447103173493, "loss": 4.6862, "mean_token_accuracy": 0.2528598591685295, "num_tokens": 158975370.0, "step": 69405 }, { "entropy": 5.200802278518677, "epoch": 6.861407671016212, "grad_norm": 1.15625, "learning_rate": 0.00015261509597471658, "loss": 4.5627, "mean_token_accuracy": 0.2575237795710564, "num_tokens": 158987187.0, "step": 69410 }, { "entropy": 5.287963104248047, "epoch": 6.8619019375247134, "grad_norm": 1.234375, "learning_rate": 0.00015258548464277134, "loss": 4.6809, "mean_token_accuracy": 0.2548404559493065, "num_tokens": 158998247.0, "step": 69415 }, { "entropy": 5.235487365722657, "epoch": 6.862396204033215, "grad_norm": 1.0703125, "learning_rate": 0.00015255587632224222, "loss": 4.5141, "mean_token_accuracy": 0.27224699407815933, "num_tokens": 159010337.0, "step": 69420 }, { "entropy": 5.295486116409302, "epoch": 6.862890470541716, "grad_norm": 1.1484375, "learning_rate": 0.00015252627101385748, "loss": 4.6608, "mean_token_accuracy": 0.254627950489521, "num_tokens": 159021229.0, "step": 69425 }, { "entropy": 5.237787818908691, "epoch": 6.863384737050217, "grad_norm": 1.140625, "learning_rate": 0.00015249666871834555, "loss": 4.5805, "mean_token_accuracy": 0.26654030084609986, "num_tokens": 159031987.0, "step": 69430 }, { "entropy": 5.263397884368897, "epoch": 6.8638790035587185, "grad_norm": 1.1875, "learning_rate": 0.00015246706943643462, "loss": 4.64, "mean_token_accuracy": 0.26528880149126055, "num_tokens": 159044578.0, "step": 69435 }, { "entropy": 5.259095191955566, "epoch": 6.864373270067221, "grad_norm": 1.1484375, "learning_rate": 0.0001524374731688527, "loss": 4.5711, "mean_token_accuracy": 0.2585408478975296, "num_tokens": 159055188.0, "step": 69440 }, { "entropy": 5.250415897369384, "epoch": 6.864867536575722, "grad_norm": 1.2265625, "learning_rate": 0.00015240787991632794, "loss": 4.5897, "mean_token_accuracy": 0.2606545060873032, "num_tokens": 159066736.0, "step": 69445 }, { "entropy": 5.3201189041137695, "epoch": 6.865361803084223, "grad_norm": 1.1484375, "learning_rate": 0.0001523782896795885, "loss": 4.676, "mean_token_accuracy": 0.2481400951743126, "num_tokens": 159078229.0, "step": 69450 }, { "entropy": 5.3163224220275875, "epoch": 6.865856069592724, "grad_norm": 1.1875, "learning_rate": 0.00015234870245936193, "loss": 4.6332, "mean_token_accuracy": 0.2553563922643661, "num_tokens": 159089126.0, "step": 69455 }, { "entropy": 5.290721845626831, "epoch": 6.866350336101226, "grad_norm": 1.3671875, "learning_rate": 0.00015231911825637644, "loss": 4.5638, "mean_token_accuracy": 0.2629203498363495, "num_tokens": 159098712.0, "step": 69460 }, { "entropy": 5.204863452911377, "epoch": 6.866844602609727, "grad_norm": 1.21875, "learning_rate": 0.0001522895370713597, "loss": 4.5905, "mean_token_accuracy": 0.256252221763134, "num_tokens": 159109598.0, "step": 69465 }, { "entropy": 5.22850661277771, "epoch": 6.867338869118228, "grad_norm": 1.1875, "learning_rate": 0.0001522599589050393, "loss": 4.5807, "mean_token_accuracy": 0.2664877697825432, "num_tokens": 159121159.0, "step": 69470 }, { "entropy": 5.227326059341431, "epoch": 6.86783313562673, "grad_norm": 1.1328125, "learning_rate": 0.00015223038375814307, "loss": 4.6143, "mean_token_accuracy": 0.2629511818289757, "num_tokens": 159132680.0, "step": 69475 }, { "entropy": 5.185206079483033, "epoch": 6.868327402135232, "grad_norm": 1.2734375, "learning_rate": 0.00015220081163139825, "loss": 4.5786, "mean_token_accuracy": 0.2627289593219757, "num_tokens": 159144840.0, "step": 69480 }, { "entropy": 5.36049599647522, "epoch": 6.868821668643733, "grad_norm": 1.1796875, "learning_rate": 0.00015217124252553271, "loss": 4.7005, "mean_token_accuracy": 0.24884324818849562, "num_tokens": 159157047.0, "step": 69485 }, { "entropy": 5.278883790969848, "epoch": 6.869315935152234, "grad_norm": 1.21875, "learning_rate": 0.00015214167644127358, "loss": 4.6711, "mean_token_accuracy": 0.25423538237810134, "num_tokens": 159169263.0, "step": 69490 }, { "entropy": 5.298523759841919, "epoch": 6.869810201660735, "grad_norm": 1.171875, "learning_rate": 0.00015211211337934826, "loss": 4.6742, "mean_token_accuracy": 0.25119154900312424, "num_tokens": 159181050.0, "step": 69495 }, { "entropy": 5.219470882415772, "epoch": 6.870304468169237, "grad_norm": 1.234375, "learning_rate": 0.0001520825533404841, "loss": 4.5312, "mean_token_accuracy": 0.26771074831485747, "num_tokens": 159191027.0, "step": 69500 }, { "entropy": 5.218442726135254, "epoch": 6.870798734677738, "grad_norm": 1.2578125, "learning_rate": 0.0001520529963254081, "loss": 4.5662, "mean_token_accuracy": 0.263526526093483, "num_tokens": 159202662.0, "step": 69505 }, { "entropy": 5.224765014648438, "epoch": 6.87129300118624, "grad_norm": 1.21875, "learning_rate": 0.0001520234423348475, "loss": 4.6298, "mean_token_accuracy": 0.26200668811798095, "num_tokens": 159215063.0, "step": 69510 }, { "entropy": 5.309117984771729, "epoch": 6.871787267694741, "grad_norm": 1.1875, "learning_rate": 0.00015199389136952927, "loss": 4.7214, "mean_token_accuracy": 0.252229543030262, "num_tokens": 159227325.0, "step": 69515 }, { "entropy": 5.2256848335266115, "epoch": 6.872281534203243, "grad_norm": 1.2578125, "learning_rate": 0.00015196434343018036, "loss": 4.5858, "mean_token_accuracy": 0.263794806599617, "num_tokens": 159239959.0, "step": 69520 }, { "entropy": 5.234636735916138, "epoch": 6.872775800711744, "grad_norm": 1.265625, "learning_rate": 0.00015193479851752784, "loss": 4.6016, "mean_token_accuracy": 0.25949335694313047, "num_tokens": 159250373.0, "step": 69525 }, { "entropy": 5.287972640991211, "epoch": 6.873270067220245, "grad_norm": 1.2265625, "learning_rate": 0.00015190525663229823, "loss": 4.6793, "mean_token_accuracy": 0.2580620214343071, "num_tokens": 159262477.0, "step": 69530 }, { "entropy": 5.259941911697387, "epoch": 6.873764333728746, "grad_norm": 1.234375, "learning_rate": 0.0001518757177752184, "loss": 4.6212, "mean_token_accuracy": 0.2615387886762619, "num_tokens": 159273333.0, "step": 69535 }, { "entropy": 5.262160205841065, "epoch": 6.874258600237248, "grad_norm": 1.265625, "learning_rate": 0.0001518461819470151, "loss": 4.5828, "mean_token_accuracy": 0.25923538357019427, "num_tokens": 159285976.0, "step": 69540 }, { "entropy": 5.200466585159302, "epoch": 6.874752866745749, "grad_norm": 1.203125, "learning_rate": 0.00015181664914841475, "loss": 4.5477, "mean_token_accuracy": 0.26989504396915437, "num_tokens": 159297034.0, "step": 69545 }, { "entropy": 5.265628862380981, "epoch": 6.875247133254251, "grad_norm": 1.375, "learning_rate": 0.00015178711938014405, "loss": 4.6565, "mean_token_accuracy": 0.2556192487478256, "num_tokens": 159307528.0, "step": 69550 }, { "entropy": 5.240068197250366, "epoch": 6.875741399762752, "grad_norm": 1.1640625, "learning_rate": 0.0001517575926429292, "loss": 4.686, "mean_token_accuracy": 0.2541651576757431, "num_tokens": 159319239.0, "step": 69555 }, { "entropy": 5.23622841835022, "epoch": 6.876235666271254, "grad_norm": 1.2421875, "learning_rate": 0.00015172806893749678, "loss": 4.5924, "mean_token_accuracy": 0.2584533795714378, "num_tokens": 159329437.0, "step": 69560 }, { "entropy": 5.2958708763122555, "epoch": 6.876729932779755, "grad_norm": 1.0859375, "learning_rate": 0.00015169854826457303, "loss": 4.6987, "mean_token_accuracy": 0.2539841324090958, "num_tokens": 159341418.0, "step": 69565 }, { "entropy": 5.248294639587402, "epoch": 6.877224199288256, "grad_norm": 1.21875, "learning_rate": 0.0001516690306248839, "loss": 4.5944, "mean_token_accuracy": 0.2637828603386879, "num_tokens": 159352195.0, "step": 69570 }, { "entropy": 5.28458194732666, "epoch": 6.877718465796757, "grad_norm": 1.2421875, "learning_rate": 0.000151639516019156, "loss": 4.6352, "mean_token_accuracy": 0.2590818822383881, "num_tokens": 159363549.0, "step": 69575 }, { "entropy": 5.2681581497192385, "epoch": 6.878212732305259, "grad_norm": 1.0234375, "learning_rate": 0.000151610004448115, "loss": 4.6145, "mean_token_accuracy": 0.2555913418531418, "num_tokens": 159375627.0, "step": 69580 }, { "entropy": 5.247187185287475, "epoch": 6.87870699881376, "grad_norm": 1.34375, "learning_rate": 0.00015158049591248708, "loss": 4.5531, "mean_token_accuracy": 0.2628767296671867, "num_tokens": 159386532.0, "step": 69585 }, { "entropy": 5.257290506362915, "epoch": 6.879201265322262, "grad_norm": 1.109375, "learning_rate": 0.00015155099041299814, "loss": 4.6197, "mean_token_accuracy": 0.257151760160923, "num_tokens": 159398282.0, "step": 69590 }, { "entropy": 5.249276876449585, "epoch": 6.879695531830763, "grad_norm": 1.34375, "learning_rate": 0.00015152148795037393, "loss": 4.6025, "mean_token_accuracy": 0.25512406080961225, "num_tokens": 159409509.0, "step": 69595 }, { "entropy": 5.286832523345947, "epoch": 6.880189798339265, "grad_norm": 1.1171875, "learning_rate": 0.00015149198852534027, "loss": 4.583, "mean_token_accuracy": 0.26674590557813643, "num_tokens": 159419793.0, "step": 69600 }, { "entropy": 5.211036586761475, "epoch": 6.880684064847766, "grad_norm": 1.21875, "learning_rate": 0.00015146249213862284, "loss": 4.583, "mean_token_accuracy": 0.2585312187671661, "num_tokens": 159432299.0, "step": 69605 }, { "entropy": 5.255788946151734, "epoch": 6.881178331356267, "grad_norm": 1.21875, "learning_rate": 0.00015143299879094728, "loss": 4.5761, "mean_token_accuracy": 0.26209398061037065, "num_tokens": 159443582.0, "step": 69610 }, { "entropy": 5.249085807800293, "epoch": 6.881672597864768, "grad_norm": 1.2265625, "learning_rate": 0.00015140350848303924, "loss": 4.6397, "mean_token_accuracy": 0.25875662714242936, "num_tokens": 159454277.0, "step": 69615 }, { "entropy": 5.27967677116394, "epoch": 6.88216686437327, "grad_norm": 1.2109375, "learning_rate": 0.00015137402121562395, "loss": 4.6143, "mean_token_accuracy": 0.25921821445226667, "num_tokens": 159464816.0, "step": 69620 }, { "entropy": 5.261966943740845, "epoch": 6.882661130881772, "grad_norm": 1.1484375, "learning_rate": 0.00015134453698942692, "loss": 4.677, "mean_token_accuracy": 0.25934951603412626, "num_tokens": 159477085.0, "step": 69625 }, { "entropy": 5.238783121109009, "epoch": 6.883155397390273, "grad_norm": 1.296875, "learning_rate": 0.00015131505580517343, "loss": 4.6436, "mean_token_accuracy": 0.25244001150131223, "num_tokens": 159488225.0, "step": 69630 }, { "entropy": 5.277617788314819, "epoch": 6.883649663898774, "grad_norm": 1.3125, "learning_rate": 0.0001512855776635888, "loss": 4.6221, "mean_token_accuracy": 0.26189856231212616, "num_tokens": 159497895.0, "step": 69635 }, { "entropy": 5.193601179122925, "epoch": 6.884143930407276, "grad_norm": 1.171875, "learning_rate": 0.0001512561025653982, "loss": 4.5057, "mean_token_accuracy": 0.2659598082304001, "num_tokens": 159509913.0, "step": 69640 }, { "entropy": 5.246696090698242, "epoch": 6.884638196915777, "grad_norm": 1.3046875, "learning_rate": 0.00015122663051132663, "loss": 4.6229, "mean_token_accuracy": 0.25907431840896605, "num_tokens": 159521214.0, "step": 69645 }, { "entropy": 5.267618322372437, "epoch": 6.885132463424278, "grad_norm": 1.1484375, "learning_rate": 0.00015119716150209912, "loss": 4.6319, "mean_token_accuracy": 0.2606400609016418, "num_tokens": 159532080.0, "step": 69650 }, { "entropy": 5.233549022674561, "epoch": 6.885626729932779, "grad_norm": 1.21875, "learning_rate": 0.00015116769553844066, "loss": 4.5812, "mean_token_accuracy": 0.2664418712258339, "num_tokens": 159543416.0, "step": 69655 }, { "entropy": 5.220257329940796, "epoch": 6.8861209964412815, "grad_norm": 1.1640625, "learning_rate": 0.0001511382326210761, "loss": 4.5573, "mean_token_accuracy": 0.26751634776592254, "num_tokens": 159555455.0, "step": 69660 }, { "entropy": 5.269243621826172, "epoch": 6.886615262949783, "grad_norm": 1.25, "learning_rate": 0.00015110877275073032, "loss": 4.5989, "mean_token_accuracy": 0.2646909937262535, "num_tokens": 159566276.0, "step": 69665 }, { "entropy": 5.28444471359253, "epoch": 6.887109529458284, "grad_norm": 1.125, "learning_rate": 0.00015107931592812785, "loss": 4.6459, "mean_token_accuracy": 0.25622857362031937, "num_tokens": 159577217.0, "step": 69670 }, { "entropy": 5.315313529968262, "epoch": 6.887603795966785, "grad_norm": 1.1796875, "learning_rate": 0.0001510498621539934, "loss": 4.6738, "mean_token_accuracy": 0.25311046540737153, "num_tokens": 159588822.0, "step": 69675 }, { "entropy": 5.172392511367798, "epoch": 6.8880980624752866, "grad_norm": 1.2890625, "learning_rate": 0.00015102041142905172, "loss": 4.5515, "mean_token_accuracy": 0.26900657415390017, "num_tokens": 159599689.0, "step": 69680 }, { "entropy": 5.259570074081421, "epoch": 6.888592328983788, "grad_norm": 1.1328125, "learning_rate": 0.00015099096375402693, "loss": 4.6034, "mean_token_accuracy": 0.2589418664574623, "num_tokens": 159611428.0, "step": 69685 }, { "entropy": 5.208515167236328, "epoch": 6.889086595492289, "grad_norm": 1.1953125, "learning_rate": 0.0001509615191296439, "loss": 4.5514, "mean_token_accuracy": 0.27136161029338834, "num_tokens": 159622838.0, "step": 69690 }, { "entropy": 5.25971565246582, "epoch": 6.889580862000791, "grad_norm": 1.2578125, "learning_rate": 0.00015093207755662665, "loss": 4.6188, "mean_token_accuracy": 0.25521267056465147, "num_tokens": 159633961.0, "step": 69695 }, { "entropy": 5.192410326004028, "epoch": 6.8900751285092925, "grad_norm": 1.203125, "learning_rate": 0.0001509026390356995, "loss": 4.5421, "mean_token_accuracy": 0.26447907388210296, "num_tokens": 159644766.0, "step": 69700 }, { "entropy": 5.305045461654663, "epoch": 6.890569395017794, "grad_norm": 1.1875, "learning_rate": 0.00015087320356758677, "loss": 4.6516, "mean_token_accuracy": 0.2552787184715271, "num_tokens": 159655442.0, "step": 69705 }, { "entropy": 5.306157016754151, "epoch": 6.891063661526295, "grad_norm": 1.3125, "learning_rate": 0.00015084377115301244, "loss": 4.7366, "mean_token_accuracy": 0.24943627119064332, "num_tokens": 159667335.0, "step": 69710 }, { "entropy": 5.239077520370484, "epoch": 6.891557928034796, "grad_norm": 1.09375, "learning_rate": 0.00015081434179270054, "loss": 4.5836, "mean_token_accuracy": 0.2609265074133873, "num_tokens": 159678716.0, "step": 69715 }, { "entropy": 5.303177547454834, "epoch": 6.8920521945432975, "grad_norm": 1.21875, "learning_rate": 0.00015078491548737517, "loss": 4.5737, "mean_token_accuracy": 0.2596618428826332, "num_tokens": 159690418.0, "step": 69720 }, { "entropy": 5.270044136047363, "epoch": 6.892546461051799, "grad_norm": 1.3359375, "learning_rate": 0.0001507554922377601, "loss": 4.6585, "mean_token_accuracy": 0.26521036624908445, "num_tokens": 159700558.0, "step": 69725 }, { "entropy": 5.268487787246704, "epoch": 6.893040727560301, "grad_norm": 1.265625, "learning_rate": 0.00015072607204457927, "loss": 4.6008, "mean_token_accuracy": 0.26114711463451384, "num_tokens": 159711827.0, "step": 69730 }, { "entropy": 5.23227071762085, "epoch": 6.893534994068802, "grad_norm": 1.0546875, "learning_rate": 0.0001506966549085563, "loss": 4.5652, "mean_token_accuracy": 0.26406831443309786, "num_tokens": 159723805.0, "step": 69735 }, { "entropy": 5.271826457977295, "epoch": 6.8940292605773035, "grad_norm": 1.140625, "learning_rate": 0.000150667240830415, "loss": 4.6395, "mean_token_accuracy": 0.25890014320611954, "num_tokens": 159735419.0, "step": 69740 }, { "entropy": 5.119621753692627, "epoch": 6.894523527085805, "grad_norm": 1.171875, "learning_rate": 0.00015063782981087864, "loss": 4.4893, "mean_token_accuracy": 0.2711203649640083, "num_tokens": 159747822.0, "step": 69745 }, { "entropy": 5.2745361328125, "epoch": 6.895017793594306, "grad_norm": 1.109375, "learning_rate": 0.00015060842185067109, "loss": 4.6333, "mean_token_accuracy": 0.25884007215499877, "num_tokens": 159759580.0, "step": 69750 }, { "entropy": 5.245457363128662, "epoch": 6.895512060102807, "grad_norm": 1.1796875, "learning_rate": 0.00015057901695051572, "loss": 4.6221, "mean_token_accuracy": 0.26173444390296935, "num_tokens": 159771307.0, "step": 69755 }, { "entropy": 5.2871095657348635, "epoch": 6.8960063266113085, "grad_norm": 1.171875, "learning_rate": 0.00015054961511113573, "loss": 4.6703, "mean_token_accuracy": 0.25238587260246276, "num_tokens": 159783360.0, "step": 69760 }, { "entropy": 5.252390909194946, "epoch": 6.896500593119811, "grad_norm": 1.234375, "learning_rate": 0.00015052021633325468, "loss": 4.6085, "mean_token_accuracy": 0.2598689138889313, "num_tokens": 159794489.0, "step": 69765 }, { "entropy": 5.357782649993896, "epoch": 6.896994859628312, "grad_norm": 1.21875, "learning_rate": 0.00015049082061759545, "loss": 4.7462, "mean_token_accuracy": 0.24869572073221208, "num_tokens": 159805071.0, "step": 69770 }, { "entropy": 5.229277563095093, "epoch": 6.897489126136813, "grad_norm": 1.1640625, "learning_rate": 0.00015046142796488132, "loss": 4.5416, "mean_token_accuracy": 0.26353358924388887, "num_tokens": 159815846.0, "step": 69775 }, { "entropy": 5.146388244628906, "epoch": 6.8979833926453145, "grad_norm": 1.1328125, "learning_rate": 0.00015043203837583554, "loss": 4.5067, "mean_token_accuracy": 0.26455206573009493, "num_tokens": 159828923.0, "step": 69780 }, { "entropy": 5.24497241973877, "epoch": 6.898477659153816, "grad_norm": 1.203125, "learning_rate": 0.0001504026518511808, "loss": 4.6881, "mean_token_accuracy": 0.25156345665454866, "num_tokens": 159839978.0, "step": 69785 }, { "entropy": 5.285731410980224, "epoch": 6.898971925662317, "grad_norm": 1.4609375, "learning_rate": 0.0001503732683916403, "loss": 4.6471, "mean_token_accuracy": 0.2552501425147057, "num_tokens": 159850197.0, "step": 69790 }, { "entropy": 5.345186376571656, "epoch": 6.899466192170818, "grad_norm": 1.2890625, "learning_rate": 0.00015034388799793665, "loss": 4.6842, "mean_token_accuracy": 0.2518367275595665, "num_tokens": 159860999.0, "step": 69795 }, { "entropy": 5.2019154071807865, "epoch": 6.8999604586793195, "grad_norm": 1.25, "learning_rate": 0.0001503145106707926, "loss": 4.5683, "mean_token_accuracy": 0.27078843116760254, "num_tokens": 159871957.0, "step": 69800 }, { "entropy": 5.234531545639038, "epoch": 6.900454725187822, "grad_norm": 1.2421875, "learning_rate": 0.00015028513641093106, "loss": 4.5479, "mean_token_accuracy": 0.2703912600874901, "num_tokens": 159882938.0, "step": 69805 }, { "entropy": 5.220371341705322, "epoch": 6.900948991696323, "grad_norm": 1.1796875, "learning_rate": 0.00015025576521907446, "loss": 4.5774, "mean_token_accuracy": 0.26530051827430723, "num_tokens": 159894811.0, "step": 69810 }, { "entropy": 5.260285472869873, "epoch": 6.901443258204824, "grad_norm": 1.1640625, "learning_rate": 0.00015022639709594548, "loss": 4.6506, "mean_token_accuracy": 0.256971450150013, "num_tokens": 159905051.0, "step": 69815 }, { "entropy": 5.3195716381073, "epoch": 6.9019375247133254, "grad_norm": 1.25, "learning_rate": 0.00015019703204226644, "loss": 4.6087, "mean_token_accuracy": 0.25375755280256274, "num_tokens": 159916245.0, "step": 69820 }, { "entropy": 5.173327493667602, "epoch": 6.902431791221827, "grad_norm": 1.2734375, "learning_rate": 0.00015016767005875969, "loss": 4.5481, "mean_token_accuracy": 0.271309132874012, "num_tokens": 159928225.0, "step": 69825 }, { "entropy": 5.265832996368408, "epoch": 6.902926057730328, "grad_norm": 1.2109375, "learning_rate": 0.00015013831114614766, "loss": 4.6091, "mean_token_accuracy": 0.2632950693368912, "num_tokens": 159940182.0, "step": 69830 }, { "entropy": 5.287961101531982, "epoch": 6.903420324238829, "grad_norm": 1.15625, "learning_rate": 0.00015010895530515256, "loss": 4.6558, "mean_token_accuracy": 0.2522739976644516, "num_tokens": 159952329.0, "step": 69835 }, { "entropy": 5.148992204666138, "epoch": 6.9039145907473305, "grad_norm": 1.2578125, "learning_rate": 0.00015007960253649662, "loss": 4.4916, "mean_token_accuracy": 0.2688396289944649, "num_tokens": 159964434.0, "step": 69840 }, { "entropy": 5.260866165161133, "epoch": 6.904408857255833, "grad_norm": 1.265625, "learning_rate": 0.00015005025284090174, "loss": 4.6577, "mean_token_accuracy": 0.2585072711110115, "num_tokens": 159976378.0, "step": 69845 }, { "entropy": 5.248220586776734, "epoch": 6.904903123764334, "grad_norm": 1.2109375, "learning_rate": 0.00015002090621909, "loss": 4.5734, "mean_token_accuracy": 0.256159108877182, "num_tokens": 159987939.0, "step": 69850 }, { "entropy": 5.2027575969696045, "epoch": 6.905397390272835, "grad_norm": 1.265625, "learning_rate": 0.00014999156267178347, "loss": 4.5564, "mean_token_accuracy": 0.27218184918165206, "num_tokens": 159999844.0, "step": 69855 }, { "entropy": 5.217941045761108, "epoch": 6.905891656781336, "grad_norm": 1.2578125, "learning_rate": 0.00014996222219970374, "loss": 4.6086, "mean_token_accuracy": 0.2619195833802223, "num_tokens": 160010282.0, "step": 69860 }, { "entropy": 5.223807668685913, "epoch": 6.906385923289838, "grad_norm": 1.171875, "learning_rate": 0.00014993288480357286, "loss": 4.6537, "mean_token_accuracy": 0.2576193824410439, "num_tokens": 160021799.0, "step": 69865 }, { "entropy": 5.303832912445069, "epoch": 6.906880189798339, "grad_norm": 1.15625, "learning_rate": 0.00014990355048411237, "loss": 4.6658, "mean_token_accuracy": 0.2622423231601715, "num_tokens": 160034236.0, "step": 69870 }, { "entropy": 5.238508605957032, "epoch": 6.90737445630684, "grad_norm": 1.2109375, "learning_rate": 0.0001498742192420439, "loss": 4.5823, "mean_token_accuracy": 0.26335355192422866, "num_tokens": 160046300.0, "step": 69875 }, { "entropy": 5.228346252441407, "epoch": 6.907868722815342, "grad_norm": 1.15625, "learning_rate": 0.0001498448910780892, "loss": 4.5989, "mean_token_accuracy": 0.2619463175535202, "num_tokens": 160058233.0, "step": 69880 }, { "entropy": 5.279792976379395, "epoch": 6.908362989323844, "grad_norm": 1.140625, "learning_rate": 0.00014981556599296948, "loss": 4.6704, "mean_token_accuracy": 0.25553951859474183, "num_tokens": 160068738.0, "step": 69885 }, { "entropy": 5.268518018722534, "epoch": 6.908857255832345, "grad_norm": 1.03125, "learning_rate": 0.00014978624398740627, "loss": 4.6071, "mean_token_accuracy": 0.25562872886657717, "num_tokens": 160080505.0, "step": 69890 }, { "entropy": 5.251833391189575, "epoch": 6.909351522340846, "grad_norm": 1.2890625, "learning_rate": 0.00014975692506212087, "loss": 4.5914, "mean_token_accuracy": 0.26274705231189727, "num_tokens": 160090024.0, "step": 69895 }, { "entropy": 5.254807567596435, "epoch": 6.909845788849347, "grad_norm": 1.1484375, "learning_rate": 0.00014972760921783452, "loss": 4.6122, "mean_token_accuracy": 0.25964012145996096, "num_tokens": 160101749.0, "step": 69900 }, { "entropy": 5.162021636962891, "epoch": 6.910340055357849, "grad_norm": 1.15625, "learning_rate": 0.0001496982964552685, "loss": 4.5254, "mean_token_accuracy": 0.2770140215754509, "num_tokens": 160112787.0, "step": 69905 }, { "entropy": 5.213895654678344, "epoch": 6.91083432186635, "grad_norm": 1.1953125, "learning_rate": 0.0001496689867751438, "loss": 4.5926, "mean_token_accuracy": 0.2633638188242912, "num_tokens": 160124760.0, "step": 69910 }, { "entropy": 5.36503119468689, "epoch": 6.911328588374852, "grad_norm": 1.0625, "learning_rate": 0.0001496396801781814, "loss": 4.6963, "mean_token_accuracy": 0.25416116416454315, "num_tokens": 160136745.0, "step": 69915 }, { "entropy": 5.17250657081604, "epoch": 6.911822854883353, "grad_norm": 1.234375, "learning_rate": 0.00014961037666510235, "loss": 4.5392, "mean_token_accuracy": 0.27321821451187134, "num_tokens": 160147938.0, "step": 69920 }, { "entropy": 5.159326553344727, "epoch": 6.912317121391855, "grad_norm": 1.21875, "learning_rate": 0.00014958107623662747, "loss": 4.5552, "mean_token_accuracy": 0.26993447095155715, "num_tokens": 160159322.0, "step": 69925 }, { "entropy": 5.289354753494263, "epoch": 6.912811387900356, "grad_norm": 1.1328125, "learning_rate": 0.0001495517788934777, "loss": 4.7139, "mean_token_accuracy": 0.24435086846351622, "num_tokens": 160170898.0, "step": 69930 }, { "entropy": 5.255676412582398, "epoch": 6.913305654408857, "grad_norm": 1.1328125, "learning_rate": 0.00014952248463637354, "loss": 4.573, "mean_token_accuracy": 0.26162151247262955, "num_tokens": 160184059.0, "step": 69935 }, { "entropy": 5.237660074234009, "epoch": 6.913799920917358, "grad_norm": 1.2890625, "learning_rate": 0.00014949319346603567, "loss": 4.5741, "mean_token_accuracy": 0.26131180077791216, "num_tokens": 160196375.0, "step": 69940 }, { "entropy": 5.233822059631348, "epoch": 6.91429418742586, "grad_norm": 1.2265625, "learning_rate": 0.00014946390538318483, "loss": 4.5892, "mean_token_accuracy": 0.2605955958366394, "num_tokens": 160206591.0, "step": 69945 }, { "entropy": 5.19325819015503, "epoch": 6.914788453934362, "grad_norm": 1.234375, "learning_rate": 0.00014943462038854123, "loss": 4.5945, "mean_token_accuracy": 0.2636379152536392, "num_tokens": 160218883.0, "step": 69950 }, { "entropy": 5.253756999969482, "epoch": 6.915282720442863, "grad_norm": 1.25, "learning_rate": 0.00014940533848282561, "loss": 4.6356, "mean_token_accuracy": 0.2617297276854515, "num_tokens": 160230446.0, "step": 69955 }, { "entropy": 5.253689622879028, "epoch": 6.915776986951364, "grad_norm": 1.25, "learning_rate": 0.00014937605966675808, "loss": 4.6275, "mean_token_accuracy": 0.2563471972942352, "num_tokens": 160241674.0, "step": 69960 }, { "entropy": 5.293000793457031, "epoch": 6.916271253459866, "grad_norm": 1.1640625, "learning_rate": 0.00014934678394105895, "loss": 4.6049, "mean_token_accuracy": 0.25295100212097166, "num_tokens": 160252020.0, "step": 69965 }, { "entropy": 5.301510906219482, "epoch": 6.916765519968367, "grad_norm": 1.140625, "learning_rate": 0.00014931751130644848, "loss": 4.6535, "mean_token_accuracy": 0.25262925326824187, "num_tokens": 160264589.0, "step": 69970 }, { "entropy": 5.210898303985596, "epoch": 6.917259786476868, "grad_norm": 1.453125, "learning_rate": 0.00014928824176364664, "loss": 4.5515, "mean_token_accuracy": 0.2655256301164627, "num_tokens": 160275622.0, "step": 69975 }, { "entropy": 5.278937244415284, "epoch": 6.917754052985369, "grad_norm": 1.1640625, "learning_rate": 0.00014925897531337367, "loss": 4.5957, "mean_token_accuracy": 0.25243883579969406, "num_tokens": 160286902.0, "step": 69980 }, { "entropy": 5.214626312255859, "epoch": 6.9182483194938715, "grad_norm": 1.2265625, "learning_rate": 0.00014922971195634936, "loss": 4.5789, "mean_token_accuracy": 0.2564762383699417, "num_tokens": 160298347.0, "step": 69985 }, { "entropy": 5.196565628051758, "epoch": 6.918742586002373, "grad_norm": 1.2421875, "learning_rate": 0.0001492004516932936, "loss": 4.5782, "mean_token_accuracy": 0.26560410261154177, "num_tokens": 160309138.0, "step": 69990 }, { "entropy": 5.217539548873901, "epoch": 6.919236852510874, "grad_norm": 1.1171875, "learning_rate": 0.00014917119452492636, "loss": 4.5791, "mean_token_accuracy": 0.264830182492733, "num_tokens": 160323269.0, "step": 69995 }, { "entropy": 5.258771133422852, "epoch": 6.919731119019375, "grad_norm": 1.203125, "learning_rate": 0.00014914194045196716, "loss": 4.6259, "mean_token_accuracy": 0.26381594240665435, "num_tokens": 160335182.0, "step": 70000 }, { "entropy": 5.2926270961761475, "epoch": 6.920225385527877, "grad_norm": 1.234375, "learning_rate": 0.00014911268947513575, "loss": 4.6915, "mean_token_accuracy": 0.2540503978729248, "num_tokens": 160346973.0, "step": 70005 }, { "entropy": 5.283384895324707, "epoch": 6.920719652036378, "grad_norm": 1.1953125, "learning_rate": 0.00014908344159515174, "loss": 4.658, "mean_token_accuracy": 0.2571639224886894, "num_tokens": 160357827.0, "step": 70010 }, { "entropy": 5.239474105834961, "epoch": 6.921213918544879, "grad_norm": 1.15625, "learning_rate": 0.00014905419681273457, "loss": 4.5871, "mean_token_accuracy": 0.26128328442573545, "num_tokens": 160368553.0, "step": 70015 }, { "entropy": 5.1811541557312015, "epoch": 6.921708185053381, "grad_norm": 1.2578125, "learning_rate": 0.00014902495512860377, "loss": 4.4984, "mean_token_accuracy": 0.2685528099536896, "num_tokens": 160379273.0, "step": 70020 }, { "entropy": 5.282898426055908, "epoch": 6.9222024515618825, "grad_norm": 1.0859375, "learning_rate": 0.00014899571654347857, "loss": 4.6404, "mean_token_accuracy": 0.2515360414981842, "num_tokens": 160390764.0, "step": 70025 }, { "entropy": 5.296700429916382, "epoch": 6.922696718070384, "grad_norm": 1.171875, "learning_rate": 0.00014896648105807824, "loss": 4.6846, "mean_token_accuracy": 0.2550322458148003, "num_tokens": 160402706.0, "step": 70030 }, { "entropy": 5.246652603149414, "epoch": 6.923190984578885, "grad_norm": 1.28125, "learning_rate": 0.00014893724867312208, "loss": 4.6196, "mean_token_accuracy": 0.2648183137178421, "num_tokens": 160413526.0, "step": 70035 }, { "entropy": 5.320863389968872, "epoch": 6.923685251087386, "grad_norm": 1.25, "learning_rate": 0.00014890801938932915, "loss": 4.6781, "mean_token_accuracy": 0.2521864861249924, "num_tokens": 160423930.0, "step": 70040 }, { "entropy": 5.241870546340943, "epoch": 6.924179517595888, "grad_norm": 1.1796875, "learning_rate": 0.0001488787932074186, "loss": 4.5804, "mean_token_accuracy": 0.25444420576095583, "num_tokens": 160435501.0, "step": 70045 }, { "entropy": 5.271820545196533, "epoch": 6.924673784104389, "grad_norm": 1.1875, "learning_rate": 0.0001488495701281092, "loss": 4.642, "mean_token_accuracy": 0.25124136060476304, "num_tokens": 160448119.0, "step": 70050 }, { "entropy": 5.298514556884766, "epoch": 6.92516805061289, "grad_norm": 1.21875, "learning_rate": 0.00014882035015211992, "loss": 4.6653, "mean_token_accuracy": 0.24681906402111053, "num_tokens": 160461753.0, "step": 70055 }, { "entropy": 5.244873285293579, "epoch": 6.925662317121392, "grad_norm": 1.1640625, "learning_rate": 0.00014879113328016976, "loss": 4.6082, "mean_token_accuracy": 0.25862071067094805, "num_tokens": 160473284.0, "step": 70060 }, { "entropy": 5.187801933288574, "epoch": 6.9261565836298935, "grad_norm": 1.1328125, "learning_rate": 0.00014876191951297704, "loss": 4.5509, "mean_token_accuracy": 0.26068960428237914, "num_tokens": 160484231.0, "step": 70065 }, { "entropy": 5.272899723052978, "epoch": 6.926650850138395, "grad_norm": 1.296875, "learning_rate": 0.0001487327088512609, "loss": 4.6255, "mean_token_accuracy": 0.2626387909054756, "num_tokens": 160495850.0, "step": 70070 }, { "entropy": 5.22344560623169, "epoch": 6.927145116646896, "grad_norm": 1.28125, "learning_rate": 0.00014870350129573962, "loss": 4.5963, "mean_token_accuracy": 0.2595818370580673, "num_tokens": 160506774.0, "step": 70075 }, { "entropy": 5.330297613143921, "epoch": 6.927639383155397, "grad_norm": 1.15625, "learning_rate": 0.0001486742968471318, "loss": 4.7582, "mean_token_accuracy": 0.2481205090880394, "num_tokens": 160519145.0, "step": 70080 }, { "entropy": 5.238725090026856, "epoch": 6.9281336496638986, "grad_norm": 1.2265625, "learning_rate": 0.00014864509550615595, "loss": 4.5804, "mean_token_accuracy": 0.26596683263778687, "num_tokens": 160530508.0, "step": 70085 }, { "entropy": 5.2295972347259525, "epoch": 6.9286279161724, "grad_norm": 1.140625, "learning_rate": 0.0001486158972735303, "loss": 4.6038, "mean_token_accuracy": 0.2635742202401161, "num_tokens": 160541902.0, "step": 70090 }, { "entropy": 5.338910675048828, "epoch": 6.929122182680901, "grad_norm": 1.1953125, "learning_rate": 0.00014858670214997315, "loss": 4.724, "mean_token_accuracy": 0.24932906478643418, "num_tokens": 160553545.0, "step": 70095 }, { "entropy": 5.2899603843688965, "epoch": 6.929616449189403, "grad_norm": 1.28125, "learning_rate": 0.00014855751013620277, "loss": 4.6584, "mean_token_accuracy": 0.2542150869965553, "num_tokens": 160564047.0, "step": 70100 }, { "entropy": 5.315196323394775, "epoch": 6.9301107156979045, "grad_norm": 1.203125, "learning_rate": 0.00014852832123293723, "loss": 4.6797, "mean_token_accuracy": 0.2535755932331085, "num_tokens": 160576624.0, "step": 70105 }, { "entropy": 5.264482307434082, "epoch": 6.930604982206406, "grad_norm": 1.109375, "learning_rate": 0.0001484991354408947, "loss": 4.6646, "mean_token_accuracy": 0.2540963843464851, "num_tokens": 160588729.0, "step": 70110 }, { "entropy": 5.224743318557739, "epoch": 6.931099248714907, "grad_norm": 1.109375, "learning_rate": 0.000148469952760793, "loss": 4.5873, "mean_token_accuracy": 0.26525375097990034, "num_tokens": 160600232.0, "step": 70115 }, { "entropy": 5.294877004623413, "epoch": 6.931593515223408, "grad_norm": 1.21875, "learning_rate": 0.0001484407731933501, "loss": 4.6805, "mean_token_accuracy": 0.25339677184820175, "num_tokens": 160612369.0, "step": 70120 }, { "entropy": 5.135088729858398, "epoch": 6.9320877817319095, "grad_norm": 1.2578125, "learning_rate": 0.00014841159673928373, "loss": 4.4559, "mean_token_accuracy": 0.2744264155626297, "num_tokens": 160623005.0, "step": 70125 }, { "entropy": 5.298099756240845, "epoch": 6.932582048240411, "grad_norm": 1.1953125, "learning_rate": 0.0001483824233993118, "loss": 4.6551, "mean_token_accuracy": 0.25795027017593386, "num_tokens": 160633843.0, "step": 70130 }, { "entropy": 5.276900434494019, "epoch": 6.933076314748913, "grad_norm": 1.125, "learning_rate": 0.00014835325317415194, "loss": 4.6074, "mean_token_accuracy": 0.26536197811365125, "num_tokens": 160645947.0, "step": 70135 }, { "entropy": 5.239686918258667, "epoch": 6.933570581257414, "grad_norm": 1.2109375, "learning_rate": 0.00014832408606452164, "loss": 4.5448, "mean_token_accuracy": 0.27262965589761734, "num_tokens": 160656923.0, "step": 70140 }, { "entropy": 5.354646396636963, "epoch": 6.9340648477659155, "grad_norm": 1.3515625, "learning_rate": 0.00014829492207113845, "loss": 4.72, "mean_token_accuracy": 0.2410241663455963, "num_tokens": 160667359.0, "step": 70145 }, { "entropy": 5.232032775878906, "epoch": 6.934559114274417, "grad_norm": 1.1640625, "learning_rate": 0.00014826576119471985, "loss": 4.6138, "mean_token_accuracy": 0.25893639028072357, "num_tokens": 160678362.0, "step": 70150 }, { "entropy": 5.292205476760865, "epoch": 6.935053380782918, "grad_norm": 1.171875, "learning_rate": 0.0001482366034359832, "loss": 4.7122, "mean_token_accuracy": 0.25480778366327284, "num_tokens": 160689467.0, "step": 70155 }, { "entropy": 5.2562144756317135, "epoch": 6.935547647291419, "grad_norm": 1.1640625, "learning_rate": 0.00014820744879564586, "loss": 4.5979, "mean_token_accuracy": 0.2675347521901131, "num_tokens": 160701447.0, "step": 70160 }, { "entropy": 5.260028123855591, "epoch": 6.9360419137999205, "grad_norm": 1.1875, "learning_rate": 0.00014817829727442483, "loss": 4.5582, "mean_token_accuracy": 0.2681981697678566, "num_tokens": 160712176.0, "step": 70165 }, { "entropy": 5.252259016036987, "epoch": 6.936536180308423, "grad_norm": 1.125, "learning_rate": 0.00014814914887303739, "loss": 4.6552, "mean_token_accuracy": 0.2594883367419243, "num_tokens": 160723686.0, "step": 70170 }, { "entropy": 5.21293888092041, "epoch": 6.937030446816924, "grad_norm": 1.125, "learning_rate": 0.00014812000359220063, "loss": 4.5929, "mean_token_accuracy": 0.26265533864498136, "num_tokens": 160736205.0, "step": 70175 }, { "entropy": 5.26498441696167, "epoch": 6.937524713325425, "grad_norm": 1.28125, "learning_rate": 0.0001480908614326313, "loss": 4.6706, "mean_token_accuracy": 0.2574929103255272, "num_tokens": 160748034.0, "step": 70180 }, { "entropy": 5.195171308517456, "epoch": 6.9380189798339265, "grad_norm": 1.2421875, "learning_rate": 0.00014806172239504665, "loss": 4.5341, "mean_token_accuracy": 0.2689980387687683, "num_tokens": 160760004.0, "step": 70185 }, { "entropy": 5.1799938678741455, "epoch": 6.938513246342428, "grad_norm": 1.109375, "learning_rate": 0.00014803258648016322, "loss": 4.5059, "mean_token_accuracy": 0.27047310918569567, "num_tokens": 160771025.0, "step": 70190 }, { "entropy": 5.304317951202393, "epoch": 6.939007512850929, "grad_norm": 1.25, "learning_rate": 0.00014800345368869795, "loss": 4.6233, "mean_token_accuracy": 0.25695384442806246, "num_tokens": 160783165.0, "step": 70195 }, { "entropy": 5.216336441040039, "epoch": 6.93950177935943, "grad_norm": 1.1328125, "learning_rate": 0.00014797432402136734, "loss": 4.5578, "mean_token_accuracy": 0.25992544591426847, "num_tokens": 160795434.0, "step": 70200 }, { "entropy": 5.251715850830078, "epoch": 6.939996045867932, "grad_norm": 1.125, "learning_rate": 0.00014794519747888808, "loss": 4.6125, "mean_token_accuracy": 0.26085860282182693, "num_tokens": 160807590.0, "step": 70205 }, { "entropy": 5.183611106872559, "epoch": 6.940490312376434, "grad_norm": 1.3203125, "learning_rate": 0.00014791607406197666, "loss": 4.4973, "mean_token_accuracy": 0.2743377864360809, "num_tokens": 160817546.0, "step": 70210 }, { "entropy": 5.255047035217285, "epoch": 6.940984578884935, "grad_norm": 1.1015625, "learning_rate": 0.00014788695377134954, "loss": 4.6607, "mean_token_accuracy": 0.2541686847805977, "num_tokens": 160829232.0, "step": 70215 }, { "entropy": 5.214019775390625, "epoch": 6.941478845393436, "grad_norm": 1.3203125, "learning_rate": 0.0001478578366077231, "loss": 4.5751, "mean_token_accuracy": 0.25774966776371, "num_tokens": 160841049.0, "step": 70220 }, { "entropy": 5.231198644638061, "epoch": 6.941973111901937, "grad_norm": 1.234375, "learning_rate": 0.0001478287225718136, "loss": 4.6011, "mean_token_accuracy": 0.2661135092377663, "num_tokens": 160851720.0, "step": 70225 }, { "entropy": 5.265917253494263, "epoch": 6.942467378410439, "grad_norm": 1.125, "learning_rate": 0.00014779961166433723, "loss": 4.6206, "mean_token_accuracy": 0.2573213577270508, "num_tokens": 160862105.0, "step": 70230 }, { "entropy": 5.226031970977783, "epoch": 6.94296164491894, "grad_norm": 1.21875, "learning_rate": 0.0001477705038860102, "loss": 4.5612, "mean_token_accuracy": 0.26495012640953064, "num_tokens": 160874314.0, "step": 70235 }, { "entropy": 5.290927743911743, "epoch": 6.943455911427442, "grad_norm": 1.1015625, "learning_rate": 0.00014774139923754836, "loss": 4.6709, "mean_token_accuracy": 0.2548885107040405, "num_tokens": 160886404.0, "step": 70240 }, { "entropy": 5.3131664276123045, "epoch": 6.943950177935943, "grad_norm": 1.25, "learning_rate": 0.00014771229771966805, "loss": 4.6336, "mean_token_accuracy": 0.2592426255345345, "num_tokens": 160896242.0, "step": 70245 }, { "entropy": 5.28954930305481, "epoch": 6.944444444444445, "grad_norm": 1.21875, "learning_rate": 0.00014768319933308486, "loss": 4.6383, "mean_token_accuracy": 0.25666825771331786, "num_tokens": 160906712.0, "step": 70250 }, { "entropy": 5.253551292419433, "epoch": 6.944938710952946, "grad_norm": 1.25, "learning_rate": 0.0001476541040785147, "loss": 4.5526, "mean_token_accuracy": 0.27040635943412783, "num_tokens": 160916854.0, "step": 70255 }, { "entropy": 5.13900580406189, "epoch": 6.945432977461447, "grad_norm": 1.234375, "learning_rate": 0.00014762501195667341, "loss": 4.494, "mean_token_accuracy": 0.2724431768059731, "num_tokens": 160929135.0, "step": 70260 }, { "entropy": 5.261749696731568, "epoch": 6.945927243969948, "grad_norm": 1.1484375, "learning_rate": 0.0001475959229682765, "loss": 4.588, "mean_token_accuracy": 0.25858875513076784, "num_tokens": 160938861.0, "step": 70265 }, { "entropy": 5.179913949966431, "epoch": 6.94642151047845, "grad_norm": 1.1484375, "learning_rate": 0.0001475668371140397, "loss": 4.5307, "mean_token_accuracy": 0.26871239989995954, "num_tokens": 160951322.0, "step": 70270 }, { "entropy": 5.1484674453735355, "epoch": 6.946915776986952, "grad_norm": 1.2109375, "learning_rate": 0.00014753775439467845, "loss": 4.5354, "mean_token_accuracy": 0.2696767434477806, "num_tokens": 160962430.0, "step": 70275 }, { "entropy": 5.240203094482422, "epoch": 6.947410043495453, "grad_norm": 1.2265625, "learning_rate": 0.0001475086748109082, "loss": 4.6365, "mean_token_accuracy": 0.26170159578323365, "num_tokens": 160973545.0, "step": 70280 }, { "entropy": 5.275760984420776, "epoch": 6.947904310003954, "grad_norm": 1.1953125, "learning_rate": 0.00014747959836344443, "loss": 4.6189, "mean_token_accuracy": 0.2572454631328583, "num_tokens": 160984358.0, "step": 70285 }, { "entropy": 5.295294713973999, "epoch": 6.948398576512456, "grad_norm": 1.1640625, "learning_rate": 0.00014745052505300222, "loss": 4.6323, "mean_token_accuracy": 0.25860354453325274, "num_tokens": 160996480.0, "step": 70290 }, { "entropy": 5.175234794616699, "epoch": 6.948892843020957, "grad_norm": 1.2265625, "learning_rate": 0.0001474214548802969, "loss": 4.5437, "mean_token_accuracy": 0.2698328584432602, "num_tokens": 161007961.0, "step": 70295 }, { "entropy": 5.239385366439819, "epoch": 6.949387109529458, "grad_norm": 1.1171875, "learning_rate": 0.00014739238784604357, "loss": 4.5728, "mean_token_accuracy": 0.2613943099975586, "num_tokens": 161019488.0, "step": 70300 }, { "entropy": 5.247484397888184, "epoch": 6.949881376037959, "grad_norm": 1.1953125, "learning_rate": 0.0001473633239509573, "loss": 4.6054, "mean_token_accuracy": 0.2603493332862854, "num_tokens": 161030751.0, "step": 70305 }, { "entropy": 5.248230981826782, "epoch": 6.950375642546461, "grad_norm": 1.0859375, "learning_rate": 0.00014733426319575317, "loss": 4.5637, "mean_token_accuracy": 0.2611412048339844, "num_tokens": 161042373.0, "step": 70310 }, { "entropy": 5.229113674163818, "epoch": 6.950869909054962, "grad_norm": 1.1796875, "learning_rate": 0.00014730520558114586, "loss": 4.6577, "mean_token_accuracy": 0.25387281030416486, "num_tokens": 161053697.0, "step": 70315 }, { "entropy": 5.199933338165283, "epoch": 6.951364175563464, "grad_norm": 1.2265625, "learning_rate": 0.0001472761511078503, "loss": 4.5637, "mean_token_accuracy": 0.2634558528661728, "num_tokens": 161065272.0, "step": 70320 }, { "entropy": 5.2199286937713625, "epoch": 6.951858442071965, "grad_norm": 1.140625, "learning_rate": 0.00014724709977658124, "loss": 4.5712, "mean_token_accuracy": 0.2698617324233055, "num_tokens": 161077993.0, "step": 70325 }, { "entropy": 5.267088603973389, "epoch": 6.952352708580467, "grad_norm": 1.1015625, "learning_rate": 0.00014721805158805334, "loss": 4.6242, "mean_token_accuracy": 0.2623598247766495, "num_tokens": 161090041.0, "step": 70330 }, { "entropy": 5.340493822097779, "epoch": 6.952846975088968, "grad_norm": 1.171875, "learning_rate": 0.0001471890065429813, "loss": 4.7188, "mean_token_accuracy": 0.2505315601825714, "num_tokens": 161101269.0, "step": 70335 }, { "entropy": 5.247304153442383, "epoch": 6.953341241597469, "grad_norm": 1.140625, "learning_rate": 0.00014715996464207944, "loss": 4.6165, "mean_token_accuracy": 0.26089662313461304, "num_tokens": 161113239.0, "step": 70340 }, { "entropy": 5.209795570373535, "epoch": 6.95383550810597, "grad_norm": 1.09375, "learning_rate": 0.00014713092588606225, "loss": 4.5452, "mean_token_accuracy": 0.26297413259744645, "num_tokens": 161124803.0, "step": 70345 }, { "entropy": 5.2591715335845945, "epoch": 6.954329774614472, "grad_norm": 1.1796875, "learning_rate": 0.00014710189027564423, "loss": 4.6034, "mean_token_accuracy": 0.2589398309588432, "num_tokens": 161137007.0, "step": 70350 }, { "entropy": 5.30704083442688, "epoch": 6.954824041122974, "grad_norm": 1.203125, "learning_rate": 0.0001470728578115394, "loss": 4.6368, "mean_token_accuracy": 0.26414681524038314, "num_tokens": 161148134.0, "step": 70355 }, { "entropy": 5.245843601226807, "epoch": 6.955318307631475, "grad_norm": 1.28125, "learning_rate": 0.00014704382849446224, "loss": 4.5672, "mean_token_accuracy": 0.26427102386951445, "num_tokens": 161159142.0, "step": 70360 }, { "entropy": 5.333515691757202, "epoch": 6.955812574139976, "grad_norm": 1.1875, "learning_rate": 0.00014701480232512672, "loss": 4.7269, "mean_token_accuracy": 0.25134666711091996, "num_tokens": 161171139.0, "step": 70365 }, { "entropy": 5.203031349182129, "epoch": 6.956306840648478, "grad_norm": 1.203125, "learning_rate": 0.00014698577930424687, "loss": 4.597, "mean_token_accuracy": 0.26583890467882154, "num_tokens": 161182405.0, "step": 70370 }, { "entropy": 5.246553897857666, "epoch": 6.956801107156979, "grad_norm": 1.2421875, "learning_rate": 0.0001469567594325368, "loss": 4.569, "mean_token_accuracy": 0.2593392640352249, "num_tokens": 161192882.0, "step": 70375 }, { "entropy": 5.273522186279297, "epoch": 6.95729537366548, "grad_norm": 1.0546875, "learning_rate": 0.00014692774271071025, "loss": 4.6379, "mean_token_accuracy": 0.2562625616788864, "num_tokens": 161204697.0, "step": 70380 }, { "entropy": 5.251598644256592, "epoch": 6.957789640173981, "grad_norm": 1.171875, "learning_rate": 0.0001468987291394811, "loss": 4.6021, "mean_token_accuracy": 0.2604760006070137, "num_tokens": 161215970.0, "step": 70385 }, { "entropy": 5.1841809272766115, "epoch": 6.9582839066824835, "grad_norm": 1.375, "learning_rate": 0.00014686971871956305, "loss": 4.5608, "mean_token_accuracy": 0.2604700341820717, "num_tokens": 161226470.0, "step": 70390 }, { "entropy": 5.294045686721802, "epoch": 6.958778173190985, "grad_norm": 1.0703125, "learning_rate": 0.00014684071145166982, "loss": 4.7478, "mean_token_accuracy": 0.24684858173131943, "num_tokens": 161238963.0, "step": 70395 }, { "entropy": 5.3494712829589846, "epoch": 6.959272439699486, "grad_norm": 1.1171875, "learning_rate": 0.00014681170733651504, "loss": 4.7399, "mean_token_accuracy": 0.24782457798719407, "num_tokens": 161250924.0, "step": 70400 }, { "entropy": 5.295689725875855, "epoch": 6.959766706207987, "grad_norm": 1.2421875, "learning_rate": 0.0001467827063748121, "loss": 4.6057, "mean_token_accuracy": 0.2569990649819374, "num_tokens": 161261831.0, "step": 70405 }, { "entropy": 5.264205408096314, "epoch": 6.960260972716489, "grad_norm": 1.0703125, "learning_rate": 0.00014675370856727444, "loss": 4.6419, "mean_token_accuracy": 0.2487449198961258, "num_tokens": 161274106.0, "step": 70410 }, { "entropy": 5.228039121627807, "epoch": 6.96075523922499, "grad_norm": 1.2890625, "learning_rate": 0.00014672471391461545, "loss": 4.6283, "mean_token_accuracy": 0.2559449940919876, "num_tokens": 161285744.0, "step": 70415 }, { "entropy": 5.256890916824341, "epoch": 6.961249505733491, "grad_norm": 1.2578125, "learning_rate": 0.0001466957224175484, "loss": 4.6068, "mean_token_accuracy": 0.2642814412713051, "num_tokens": 161296397.0, "step": 70420 }, { "entropy": 5.197763061523437, "epoch": 6.961743772241993, "grad_norm": 1.203125, "learning_rate": 0.00014666673407678658, "loss": 4.5429, "mean_token_accuracy": 0.26048303097486497, "num_tokens": 161307677.0, "step": 70425 }, { "entropy": 5.240668869018554, "epoch": 6.9622380387504945, "grad_norm": 1.1640625, "learning_rate": 0.0001466377488930429, "loss": 4.5763, "mean_token_accuracy": 0.26508408784866333, "num_tokens": 161318401.0, "step": 70430 }, { "entropy": 5.307713365554809, "epoch": 6.962732305258996, "grad_norm": 1.0546875, "learning_rate": 0.00014660876686703055, "loss": 4.6978, "mean_token_accuracy": 0.249921315908432, "num_tokens": 161330430.0, "step": 70435 }, { "entropy": 5.21837797164917, "epoch": 6.963226571767497, "grad_norm": 1.21875, "learning_rate": 0.00014657978799946243, "loss": 4.548, "mean_token_accuracy": 0.2694500371813774, "num_tokens": 161341033.0, "step": 70440 }, { "entropy": 5.2100622177124025, "epoch": 6.963720838275998, "grad_norm": 1.203125, "learning_rate": 0.00014655081229105144, "loss": 4.5211, "mean_token_accuracy": 0.2646103695034981, "num_tokens": 161352082.0, "step": 70445 }, { "entropy": 5.2078070640563965, "epoch": 6.9642151047845, "grad_norm": 1.21875, "learning_rate": 0.0001465218397425105, "loss": 4.5824, "mean_token_accuracy": 0.2630813390016556, "num_tokens": 161364269.0, "step": 70450 }, { "entropy": 5.287591600418091, "epoch": 6.964709371293001, "grad_norm": 1.1796875, "learning_rate": 0.00014649287035455215, "loss": 4.6816, "mean_token_accuracy": 0.24893659353256226, "num_tokens": 161375365.0, "step": 70455 }, { "entropy": 5.200045776367188, "epoch": 6.965203637801503, "grad_norm": 1.2578125, "learning_rate": 0.0001464639041278891, "loss": 4.574, "mean_token_accuracy": 0.26329741477966306, "num_tokens": 161386637.0, "step": 70460 }, { "entropy": 5.296068429946899, "epoch": 6.965697904310004, "grad_norm": 1.1796875, "learning_rate": 0.000146434941063234, "loss": 4.6465, "mean_token_accuracy": 0.2567272216081619, "num_tokens": 161399712.0, "step": 70465 }, { "entropy": 5.216018199920654, "epoch": 6.9661921708185055, "grad_norm": 1.1015625, "learning_rate": 0.0001464059811612992, "loss": 4.5273, "mean_token_accuracy": 0.26928815692663194, "num_tokens": 161411394.0, "step": 70470 }, { "entropy": 5.219346952438355, "epoch": 6.966686437327007, "grad_norm": 1.171875, "learning_rate": 0.0001463770244227974, "loss": 4.5003, "mean_token_accuracy": 0.26808240860700605, "num_tokens": 161423697.0, "step": 70475 }, { "entropy": 5.235010051727295, "epoch": 6.967180703835508, "grad_norm": 1.1796875, "learning_rate": 0.00014634807084844056, "loss": 4.5762, "mean_token_accuracy": 0.264873331785202, "num_tokens": 161435735.0, "step": 70480 }, { "entropy": 5.251515483856201, "epoch": 6.967674970344009, "grad_norm": 1.234375, "learning_rate": 0.00014631912043894122, "loss": 4.6749, "mean_token_accuracy": 0.2574774771928787, "num_tokens": 161446765.0, "step": 70485 }, { "entropy": 5.256582832336425, "epoch": 6.9681692368525106, "grad_norm": 1.1171875, "learning_rate": 0.00014629017319501154, "loss": 4.6306, "mean_token_accuracy": 0.26144480258226394, "num_tokens": 161458148.0, "step": 70490 }, { "entropy": 5.249311828613282, "epoch": 6.968663503361013, "grad_norm": 1.1640625, "learning_rate": 0.0001462612291173635, "loss": 4.598, "mean_token_accuracy": 0.26118038296699525, "num_tokens": 161471091.0, "step": 70495 }, { "entropy": 5.229283380508423, "epoch": 6.969157769869514, "grad_norm": 1.1953125, "learning_rate": 0.00014623228820670917, "loss": 4.5755, "mean_token_accuracy": 0.2602661237120628, "num_tokens": 161481790.0, "step": 70500 }, { "entropy": 5.2037688255310055, "epoch": 6.969652036378015, "grad_norm": 1.2421875, "learning_rate": 0.00014620335046376055, "loss": 4.582, "mean_token_accuracy": 0.2568455398082733, "num_tokens": 161493301.0, "step": 70505 }, { "entropy": 5.259439086914062, "epoch": 6.9701463028865165, "grad_norm": 1.2734375, "learning_rate": 0.00014617441588922947, "loss": 4.7102, "mean_token_accuracy": 0.2561416491866112, "num_tokens": 161505004.0, "step": 70510 }, { "entropy": 5.203910064697266, "epoch": 6.970640569395018, "grad_norm": 1.1171875, "learning_rate": 0.00014614548448382784, "loss": 4.563, "mean_token_accuracy": 0.2623233899474144, "num_tokens": 161517615.0, "step": 70515 }, { "entropy": 5.282710838317871, "epoch": 6.971134835903519, "grad_norm": 1.140625, "learning_rate": 0.0001461165562482672, "loss": 4.6292, "mean_token_accuracy": 0.25938198417425157, "num_tokens": 161529950.0, "step": 70520 }, { "entropy": 5.325669240951538, "epoch": 6.97162910241202, "grad_norm": 1.296875, "learning_rate": 0.00014608763118325924, "loss": 4.6679, "mean_token_accuracy": 0.25349161177873614, "num_tokens": 161541471.0, "step": 70525 }, { "entropy": 5.274233770370484, "epoch": 6.972123368920522, "grad_norm": 1.2578125, "learning_rate": 0.0001460587092895156, "loss": 4.5985, "mean_token_accuracy": 0.25611973702907564, "num_tokens": 161552877.0, "step": 70530 }, { "entropy": 5.222349786758423, "epoch": 6.972617635429024, "grad_norm": 1.171875, "learning_rate": 0.00014602979056774768, "loss": 4.5207, "mean_token_accuracy": 0.2720096826553345, "num_tokens": 161564847.0, "step": 70535 }, { "entropy": 5.177155303955078, "epoch": 6.973111901937525, "grad_norm": 1.109375, "learning_rate": 0.00014600087501866703, "loss": 4.5858, "mean_token_accuracy": 0.26613440066576005, "num_tokens": 161576061.0, "step": 70540 }, { "entropy": 5.228405618667603, "epoch": 6.973606168446026, "grad_norm": 1.1484375, "learning_rate": 0.00014597196264298475, "loss": 4.5972, "mean_token_accuracy": 0.256279693543911, "num_tokens": 161587172.0, "step": 70545 }, { "entropy": 5.279607248306275, "epoch": 6.9741004349545275, "grad_norm": 1.140625, "learning_rate": 0.00014594305344141223, "loss": 4.5748, "mean_token_accuracy": 0.2667599439620972, "num_tokens": 161599190.0, "step": 70550 }, { "entropy": 5.245780515670776, "epoch": 6.974594701463029, "grad_norm": 1.140625, "learning_rate": 0.0001459141474146607, "loss": 4.6374, "mean_token_accuracy": 0.2625420406460762, "num_tokens": 161611988.0, "step": 70555 }, { "entropy": 5.227886390686035, "epoch": 6.97508896797153, "grad_norm": 1.0703125, "learning_rate": 0.00014588524456344098, "loss": 4.5177, "mean_token_accuracy": 0.2639788419008255, "num_tokens": 161622585.0, "step": 70560 }, { "entropy": 5.183661222457886, "epoch": 6.975583234480031, "grad_norm": 1.2578125, "learning_rate": 0.00014585634488846447, "loss": 4.5419, "mean_token_accuracy": 0.270272296667099, "num_tokens": 161634482.0, "step": 70565 }, { "entropy": 5.153586053848267, "epoch": 6.9760775009885325, "grad_norm": 1.109375, "learning_rate": 0.0001458274483904418, "loss": 4.5128, "mean_token_accuracy": 0.27619907855987547, "num_tokens": 161646703.0, "step": 70570 }, { "entropy": 5.229136848449707, "epoch": 6.976571767497035, "grad_norm": 1.203125, "learning_rate": 0.000145798555070084, "loss": 4.6345, "mean_token_accuracy": 0.25783913731575014, "num_tokens": 161658810.0, "step": 70575 }, { "entropy": 5.234254217147827, "epoch": 6.977066034005536, "grad_norm": 1.296875, "learning_rate": 0.0001457696649281018, "loss": 4.5566, "mean_token_accuracy": 0.265579953789711, "num_tokens": 161670001.0, "step": 70580 }, { "entropy": 5.1726038455963135, "epoch": 6.977560300514037, "grad_norm": 1.1484375, "learning_rate": 0.00014574077796520584, "loss": 4.5261, "mean_token_accuracy": 0.2701694339513779, "num_tokens": 161681103.0, "step": 70585 }, { "entropy": 5.288589668273926, "epoch": 6.9780545670225385, "grad_norm": 1.1796875, "learning_rate": 0.00014571189418210678, "loss": 4.7507, "mean_token_accuracy": 0.24986728578805922, "num_tokens": 161692943.0, "step": 70590 }, { "entropy": 5.32357382774353, "epoch": 6.97854883353104, "grad_norm": 1.25, "learning_rate": 0.00014568301357951522, "loss": 4.6594, "mean_token_accuracy": 0.2526600033044815, "num_tokens": 161703883.0, "step": 70595 }, { "entropy": 5.22256383895874, "epoch": 6.979043100039541, "grad_norm": 1.1484375, "learning_rate": 0.00014565413615814154, "loss": 4.5519, "mean_token_accuracy": 0.26978274136781694, "num_tokens": 161715193.0, "step": 70600 }, { "entropy": 5.207099199295044, "epoch": 6.979537366548042, "grad_norm": 1.1484375, "learning_rate": 0.0001456252619186963, "loss": 4.5627, "mean_token_accuracy": 0.2619471624493599, "num_tokens": 161727624.0, "step": 70605 }, { "entropy": 5.231430530548096, "epoch": 6.980031633056544, "grad_norm": 1.203125, "learning_rate": 0.00014559639086188955, "loss": 4.6295, "mean_token_accuracy": 0.2601631298661232, "num_tokens": 161738369.0, "step": 70610 }, { "entropy": 5.215109968185425, "epoch": 6.980525899565046, "grad_norm": 1.3046875, "learning_rate": 0.0001455675229884317, "loss": 4.5723, "mean_token_accuracy": 0.26364811360836027, "num_tokens": 161749506.0, "step": 70615 }, { "entropy": 5.311530876159668, "epoch": 6.981020166073547, "grad_norm": 1.1953125, "learning_rate": 0.00014553865829903284, "loss": 4.6826, "mean_token_accuracy": 0.2600031182169914, "num_tokens": 161760825.0, "step": 70620 }, { "entropy": 5.268284177780151, "epoch": 6.981514432582048, "grad_norm": 1.2421875, "learning_rate": 0.00014550979679440313, "loss": 4.6293, "mean_token_accuracy": 0.2530366316437721, "num_tokens": 161771206.0, "step": 70625 }, { "entropy": 5.2357583999633786, "epoch": 6.982008699090549, "grad_norm": 1.1328125, "learning_rate": 0.0001454809384752525, "loss": 4.5846, "mean_token_accuracy": 0.2613649249076843, "num_tokens": 161783711.0, "step": 70630 }, { "entropy": 5.257270669937133, "epoch": 6.982502965599051, "grad_norm": 1.234375, "learning_rate": 0.00014545208334229088, "loss": 4.571, "mean_token_accuracy": 0.2603630110621452, "num_tokens": 161794689.0, "step": 70635 }, { "entropy": 5.345106983184815, "epoch": 6.982997232107552, "grad_norm": 1.2890625, "learning_rate": 0.00014542323139622815, "loss": 4.7561, "mean_token_accuracy": 0.24169441759586335, "num_tokens": 161806546.0, "step": 70640 }, { "entropy": 5.264355897903442, "epoch": 6.983491498616054, "grad_norm": 1.15625, "learning_rate": 0.0001453943826377738, "loss": 4.5946, "mean_token_accuracy": 0.26081002205610276, "num_tokens": 161818603.0, "step": 70645 }, { "entropy": 5.301310920715332, "epoch": 6.983985765124555, "grad_norm": 1.1484375, "learning_rate": 0.00014536553706763795, "loss": 4.6839, "mean_token_accuracy": 0.2511413857340813, "num_tokens": 161830417.0, "step": 70650 }, { "entropy": 5.222931432723999, "epoch": 6.984480031633057, "grad_norm": 1.125, "learning_rate": 0.00014533669468653, "loss": 4.6067, "mean_token_accuracy": 0.26332146525382993, "num_tokens": 161841428.0, "step": 70655 }, { "entropy": 5.336416625976563, "epoch": 6.984974298141558, "grad_norm": 1.2265625, "learning_rate": 0.00014530785549515945, "loss": 4.6752, "mean_token_accuracy": 0.25493425577878953, "num_tokens": 161852016.0, "step": 70660 }, { "entropy": 5.260380506515503, "epoch": 6.985468564650059, "grad_norm": 1.28125, "learning_rate": 0.0001452790194942358, "loss": 4.5928, "mean_token_accuracy": 0.26260540932416915, "num_tokens": 161862742.0, "step": 70665 }, { "entropy": 5.201051950454712, "epoch": 6.98596283115856, "grad_norm": 1.1640625, "learning_rate": 0.00014525018668446835, "loss": 4.5279, "mean_token_accuracy": 0.2643322318792343, "num_tokens": 161874144.0, "step": 70670 }, { "entropy": 5.203669261932373, "epoch": 6.986457097667062, "grad_norm": 1.1484375, "learning_rate": 0.00014522135706656632, "loss": 4.5697, "mean_token_accuracy": 0.2646250531077385, "num_tokens": 161885261.0, "step": 70675 }, { "entropy": 5.1925568103790285, "epoch": 6.986951364175564, "grad_norm": 1.15625, "learning_rate": 0.00014519253064123927, "loss": 4.5941, "mean_token_accuracy": 0.26423369646072387, "num_tokens": 161897146.0, "step": 70680 }, { "entropy": 5.224208784103394, "epoch": 6.987445630684065, "grad_norm": 1.3125, "learning_rate": 0.00014516370740919597, "loss": 4.5651, "mean_token_accuracy": 0.2665463909506798, "num_tokens": 161907861.0, "step": 70685 }, { "entropy": 5.194847679138183, "epoch": 6.987939897192566, "grad_norm": 1.25, "learning_rate": 0.0001451348873711457, "loss": 4.4876, "mean_token_accuracy": 0.27072802037000654, "num_tokens": 161918006.0, "step": 70690 }, { "entropy": 5.27692551612854, "epoch": 6.988434163701068, "grad_norm": 1.1640625, "learning_rate": 0.00014510607052779724, "loss": 4.6906, "mean_token_accuracy": 0.25914976447820665, "num_tokens": 161930735.0, "step": 70695 }, { "entropy": 5.247249364852905, "epoch": 6.988928430209569, "grad_norm": 1.125, "learning_rate": 0.0001450772568798596, "loss": 4.5719, "mean_token_accuracy": 0.2600103259086609, "num_tokens": 161941766.0, "step": 70700 }, { "entropy": 5.263786315917969, "epoch": 6.98942269671807, "grad_norm": 1.1796875, "learning_rate": 0.00014504844642804167, "loss": 4.6517, "mean_token_accuracy": 0.25555336475372314, "num_tokens": 161951883.0, "step": 70705 }, { "entropy": 5.183012533187866, "epoch": 6.989916963226571, "grad_norm": 1.078125, "learning_rate": 0.00014501963917305203, "loss": 4.4761, "mean_token_accuracy": 0.26734706610441206, "num_tokens": 161962792.0, "step": 70710 }, { "entropy": 5.155977487564087, "epoch": 6.990411229735074, "grad_norm": 1.2578125, "learning_rate": 0.00014499083511559956, "loss": 4.5202, "mean_token_accuracy": 0.2697131931781769, "num_tokens": 161974230.0, "step": 70715 }, { "entropy": 5.342519855499267, "epoch": 6.990905496243575, "grad_norm": 1.2890625, "learning_rate": 0.00014496203425639262, "loss": 4.8008, "mean_token_accuracy": 0.24127951562404631, "num_tokens": 161984512.0, "step": 70720 }, { "entropy": 5.238288545608521, "epoch": 6.991399762752076, "grad_norm": 1.265625, "learning_rate": 0.00014493323659613982, "loss": 4.6282, "mean_token_accuracy": 0.2590998888015747, "num_tokens": 161996400.0, "step": 70725 }, { "entropy": 5.334496974945068, "epoch": 6.991894029260577, "grad_norm": 1.1015625, "learning_rate": 0.00014490444213554964, "loss": 4.7213, "mean_token_accuracy": 0.2430009886622429, "num_tokens": 162008617.0, "step": 70730 }, { "entropy": 5.275436973571777, "epoch": 6.992388295769079, "grad_norm": 1.1015625, "learning_rate": 0.00014487565087533023, "loss": 4.6656, "mean_token_accuracy": 0.25705351680517197, "num_tokens": 162020585.0, "step": 70735 }, { "entropy": 5.258154296875, "epoch": 6.99288256227758, "grad_norm": 1.125, "learning_rate": 0.00014484686281619015, "loss": 4.6016, "mean_token_accuracy": 0.25833400189876554, "num_tokens": 162032579.0, "step": 70740 }, { "entropy": 5.221825027465821, "epoch": 6.993376828786081, "grad_norm": 1.1796875, "learning_rate": 0.00014481807795883734, "loss": 4.5738, "mean_token_accuracy": 0.26130768954753875, "num_tokens": 162043492.0, "step": 70745 }, { "entropy": 5.2524878025054935, "epoch": 6.993871095294583, "grad_norm": 1.15625, "learning_rate": 0.00014478929630398004, "loss": 4.5996, "mean_token_accuracy": 0.25657580196857455, "num_tokens": 162054987.0, "step": 70750 }, { "entropy": 5.2990227222442625, "epoch": 6.9943653618030845, "grad_norm": 1.21875, "learning_rate": 0.00014476051785232628, "loss": 4.6461, "mean_token_accuracy": 0.256190088391304, "num_tokens": 162064525.0, "step": 70755 }, { "entropy": 5.209431123733521, "epoch": 6.994859628311586, "grad_norm": 1.171875, "learning_rate": 0.00014473174260458386, "loss": 4.5504, "mean_token_accuracy": 0.27155277132987976, "num_tokens": 162076750.0, "step": 70760 }, { "entropy": 5.261897134780884, "epoch": 6.995353894820087, "grad_norm": 1.1171875, "learning_rate": 0.00014470297056146092, "loss": 4.6587, "mean_token_accuracy": 0.2572914108633995, "num_tokens": 162088803.0, "step": 70765 }, { "entropy": 5.240372228622436, "epoch": 6.995848161328588, "grad_norm": 1.25, "learning_rate": 0.00014467420172366505, "loss": 4.599, "mean_token_accuracy": 0.2615933805704117, "num_tokens": 162100020.0, "step": 70770 }, { "entropy": 5.232738208770752, "epoch": 6.99634242783709, "grad_norm": 1.34375, "learning_rate": 0.00014464543609190407, "loss": 4.5372, "mean_token_accuracy": 0.26440671980381014, "num_tokens": 162109373.0, "step": 70775 }, { "entropy": 5.194851064682007, "epoch": 6.996836694345591, "grad_norm": 1.125, "learning_rate": 0.0001446166736668856, "loss": 4.534, "mean_token_accuracy": 0.2695636361837387, "num_tokens": 162120330.0, "step": 70780 }, { "entropy": 5.217988634109497, "epoch": 6.997330960854093, "grad_norm": 1.2265625, "learning_rate": 0.00014458791444931716, "loss": 4.6101, "mean_token_accuracy": 0.26228032261133194, "num_tokens": 162131559.0, "step": 70785 }, { "entropy": 5.238279342651367, "epoch": 6.997825227362594, "grad_norm": 1.3046875, "learning_rate": 0.0001445591584399062, "loss": 4.6374, "mean_token_accuracy": 0.260506434738636, "num_tokens": 162142329.0, "step": 70790 }, { "entropy": 5.283656787872315, "epoch": 6.9983194938710955, "grad_norm": 1.1484375, "learning_rate": 0.00014453040563936024, "loss": 4.6064, "mean_token_accuracy": 0.2519805908203125, "num_tokens": 162154568.0, "step": 70795 }, { "entropy": 5.259200859069824, "epoch": 6.998813760379597, "grad_norm": 1.1796875, "learning_rate": 0.0001445016560483865, "loss": 4.5897, "mean_token_accuracy": 0.26148519665002823, "num_tokens": 162165040.0, "step": 70800 }, { "entropy": 5.248661804199219, "epoch": 6.999308026888098, "grad_norm": 1.125, "learning_rate": 0.0001444729096676924, "loss": 4.5773, "mean_token_accuracy": 0.2713949024677277, "num_tokens": 162176670.0, "step": 70805 }, { "entropy": 5.273296976089478, "epoch": 6.999802293396599, "grad_norm": 1.2109375, "learning_rate": 0.0001444441664979848, "loss": 4.6578, "mean_token_accuracy": 0.25775139331817626, "num_tokens": 162188410.0, "step": 70810 }, { "entropy": 5.3460935115814205, "epoch": 7.000296559905101, "grad_norm": 1.1875, "learning_rate": 0.00014441542653997105, "loss": 4.7177, "mean_token_accuracy": 0.24914634525775908, "num_tokens": 162199432.0, "step": 70815 }, { "entropy": 5.268716526031494, "epoch": 7.000790826413602, "grad_norm": 1.25, "learning_rate": 0.00014438668979435804, "loss": 4.6493, "mean_token_accuracy": 0.25401807874441146, "num_tokens": 162210764.0, "step": 70820 }, { "entropy": 5.2442765712738035, "epoch": 7.001285092922104, "grad_norm": 1.1953125, "learning_rate": 0.00014435795626185268, "loss": 4.5936, "mean_token_accuracy": 0.26191325336694715, "num_tokens": 162222193.0, "step": 70825 }, { "entropy": 5.257380104064941, "epoch": 7.001779359430605, "grad_norm": 1.25, "learning_rate": 0.00014432922594316197, "loss": 4.5907, "mean_token_accuracy": 0.2653505980968475, "num_tokens": 162232630.0, "step": 70830 }, { "entropy": 5.27403826713562, "epoch": 7.0022736259391065, "grad_norm": 1.09375, "learning_rate": 0.0001443004988389925, "loss": 4.6192, "mean_token_accuracy": 0.2596375435590744, "num_tokens": 162244981.0, "step": 70835 }, { "entropy": 5.238588619232178, "epoch": 7.002767892447608, "grad_norm": 1.203125, "learning_rate": 0.00014427177495005106, "loss": 4.5535, "mean_token_accuracy": 0.2684335246682167, "num_tokens": 162257497.0, "step": 70840 }, { "entropy": 5.327808046340943, "epoch": 7.003262158956109, "grad_norm": 1.125, "learning_rate": 0.0001442430542770443, "loss": 4.6781, "mean_token_accuracy": 0.2532863304018974, "num_tokens": 162270381.0, "step": 70845 }, { "entropy": 5.228411483764648, "epoch": 7.00375642546461, "grad_norm": 1.2109375, "learning_rate": 0.00014421433682067848, "loss": 4.5311, "mean_token_accuracy": 0.2690167620778084, "num_tokens": 162280941.0, "step": 70850 }, { "entropy": 5.178373861312866, "epoch": 7.004250691973112, "grad_norm": 1.2265625, "learning_rate": 0.00014418562258166045, "loss": 4.4729, "mean_token_accuracy": 0.27508311718702316, "num_tokens": 162292346.0, "step": 70855 }, { "entropy": 5.282608079910278, "epoch": 7.004744958481614, "grad_norm": 1.1328125, "learning_rate": 0.00014415691156069639, "loss": 4.6319, "mean_token_accuracy": 0.25956484526395796, "num_tokens": 162304135.0, "step": 70860 }, { "entropy": 5.264004516601562, "epoch": 7.005239224990115, "grad_norm": 1.1484375, "learning_rate": 0.00014412820375849254, "loss": 4.6671, "mean_token_accuracy": 0.2568568721413612, "num_tokens": 162317095.0, "step": 70865 }, { "entropy": 5.225638151168823, "epoch": 7.005733491498616, "grad_norm": 1.2109375, "learning_rate": 0.00014409949917575525, "loss": 4.5192, "mean_token_accuracy": 0.2643610656261444, "num_tokens": 162329283.0, "step": 70870 }, { "entropy": 5.3253821849823, "epoch": 7.0062277580071175, "grad_norm": 1.15625, "learning_rate": 0.00014407079781319048, "loss": 4.6334, "mean_token_accuracy": 0.26087563633918764, "num_tokens": 162342445.0, "step": 70875 }, { "entropy": 5.129627275466919, "epoch": 7.006722024515619, "grad_norm": 1.2265625, "learning_rate": 0.0001440420996715045, "loss": 4.4418, "mean_token_accuracy": 0.2877470165491104, "num_tokens": 162353768.0, "step": 70880 }, { "entropy": 5.207420539855957, "epoch": 7.00721629102412, "grad_norm": 1.203125, "learning_rate": 0.0001440134047514031, "loss": 4.5201, "mean_token_accuracy": 0.27098328322172166, "num_tokens": 162364721.0, "step": 70885 }, { "entropy": 5.299566030502319, "epoch": 7.007710557532621, "grad_norm": 1.28125, "learning_rate": 0.0001439847130535923, "loss": 4.6544, "mean_token_accuracy": 0.2603167802095413, "num_tokens": 162375967.0, "step": 70890 }, { "entropy": 5.221855735778808, "epoch": 7.0082048240411225, "grad_norm": 1.2890625, "learning_rate": 0.00014395602457877794, "loss": 4.5464, "mean_token_accuracy": 0.26300476044416427, "num_tokens": 162387233.0, "step": 70895 }, { "entropy": 5.268196964263916, "epoch": 7.008699090549625, "grad_norm": 1.2421875, "learning_rate": 0.00014392733932766565, "loss": 4.5333, "mean_token_accuracy": 0.26662425994873046, "num_tokens": 162398199.0, "step": 70900 }, { "entropy": 5.230371284484863, "epoch": 7.009193357058126, "grad_norm": 1.2109375, "learning_rate": 0.00014389865730096113, "loss": 4.5951, "mean_token_accuracy": 0.2602991446852684, "num_tokens": 162409184.0, "step": 70905 }, { "entropy": 5.190010690689087, "epoch": 7.009687623566627, "grad_norm": 1.1328125, "learning_rate": 0.00014386997849937, "loss": 4.5451, "mean_token_accuracy": 0.2652743324637413, "num_tokens": 162420502.0, "step": 70910 }, { "entropy": 5.21688289642334, "epoch": 7.0101818900751285, "grad_norm": 1.2890625, "learning_rate": 0.0001438413029235977, "loss": 4.5496, "mean_token_accuracy": 0.2643410161137581, "num_tokens": 162431084.0, "step": 70915 }, { "entropy": 5.245584630966187, "epoch": 7.01067615658363, "grad_norm": 1.1953125, "learning_rate": 0.00014381263057434981, "loss": 4.5893, "mean_token_accuracy": 0.26569944024086, "num_tokens": 162441026.0, "step": 70920 }, { "entropy": 5.313254880905151, "epoch": 7.011170423092131, "grad_norm": 1.25, "learning_rate": 0.00014378396145233146, "loss": 4.6175, "mean_token_accuracy": 0.2599229231476784, "num_tokens": 162453141.0, "step": 70925 }, { "entropy": 5.309240198135376, "epoch": 7.011664689600632, "grad_norm": 1.1015625, "learning_rate": 0.00014375529555824804, "loss": 4.6665, "mean_token_accuracy": 0.25971468538045883, "num_tokens": 162465291.0, "step": 70930 }, { "entropy": 5.247765779495239, "epoch": 7.012158956109134, "grad_norm": 1.296875, "learning_rate": 0.00014372663289280468, "loss": 4.5701, "mean_token_accuracy": 0.2691717967391014, "num_tokens": 162476937.0, "step": 70935 }, { "entropy": 5.113307952880859, "epoch": 7.012653222617636, "grad_norm": 1.3046875, "learning_rate": 0.00014369797345670655, "loss": 4.423, "mean_token_accuracy": 0.28468247056007384, "num_tokens": 162487050.0, "step": 70940 }, { "entropy": 5.193315649032593, "epoch": 7.013147489126137, "grad_norm": 1.2109375, "learning_rate": 0.00014366931725065868, "loss": 4.4785, "mean_token_accuracy": 0.26862211227416993, "num_tokens": 162499562.0, "step": 70945 }, { "entropy": 5.382539224624634, "epoch": 7.013641755634638, "grad_norm": 1.1171875, "learning_rate": 0.00014364066427536594, "loss": 4.7421, "mean_token_accuracy": 0.24609003812074662, "num_tokens": 162511601.0, "step": 70950 }, { "entropy": 5.240730094909668, "epoch": 7.0141360221431395, "grad_norm": 1.125, "learning_rate": 0.00014361201453153322, "loss": 4.6107, "mean_token_accuracy": 0.2629119873046875, "num_tokens": 162524427.0, "step": 70955 }, { "entropy": 5.247370433807373, "epoch": 7.014630288651641, "grad_norm": 1.1328125, "learning_rate": 0.00014358336801986542, "loss": 4.6051, "mean_token_accuracy": 0.2624822735786438, "num_tokens": 162535472.0, "step": 70960 }, { "entropy": 5.251552963256836, "epoch": 7.015124555160142, "grad_norm": 1.140625, "learning_rate": 0.00014355472474106697, "loss": 4.5514, "mean_token_accuracy": 0.26235756278038025, "num_tokens": 162549183.0, "step": 70965 }, { "entropy": 5.250373649597168, "epoch": 7.015618821668644, "grad_norm": 1.1171875, "learning_rate": 0.00014352608469584284, "loss": 4.6465, "mean_token_accuracy": 0.2582197651267052, "num_tokens": 162560537.0, "step": 70970 }, { "entropy": 5.333568286895752, "epoch": 7.016113088177145, "grad_norm": 1.28125, "learning_rate": 0.00014349744788489738, "loss": 4.6654, "mean_token_accuracy": 0.2565625742077827, "num_tokens": 162571083.0, "step": 70975 }, { "entropy": 5.180413484573364, "epoch": 7.016607354685647, "grad_norm": 1.203125, "learning_rate": 0.00014346881430893504, "loss": 4.5311, "mean_token_accuracy": 0.2655267804861069, "num_tokens": 162582253.0, "step": 70980 }, { "entropy": 5.251111936569214, "epoch": 7.017101621194148, "grad_norm": 1.171875, "learning_rate": 0.00014344018396866042, "loss": 4.595, "mean_token_accuracy": 0.26305157840251925, "num_tokens": 162594276.0, "step": 70985 }, { "entropy": 5.262335968017578, "epoch": 7.017595887702649, "grad_norm": 1.375, "learning_rate": 0.00014341155686477757, "loss": 4.5977, "mean_token_accuracy": 0.26399317383766174, "num_tokens": 162606036.0, "step": 70990 }, { "entropy": 5.2166468620300295, "epoch": 7.0180901542111505, "grad_norm": 1.3359375, "learning_rate": 0.00014338293299799085, "loss": 4.5576, "mean_token_accuracy": 0.26346385926008226, "num_tokens": 162617686.0, "step": 70995 }, { "entropy": 5.239351224899292, "epoch": 7.018584420719652, "grad_norm": 1.1875, "learning_rate": 0.00014335431236900438, "loss": 4.5696, "mean_token_accuracy": 0.26559744626283643, "num_tokens": 162630764.0, "step": 71000 }, { "entropy": 5.205524349212647, "epoch": 7.019078687228153, "grad_norm": 1.2890625, "learning_rate": 0.00014332569497852227, "loss": 4.5007, "mean_token_accuracy": 0.27070129960775374, "num_tokens": 162641308.0, "step": 71005 }, { "entropy": 5.198332071304321, "epoch": 7.019572953736655, "grad_norm": 1.21875, "learning_rate": 0.00014329708082724856, "loss": 4.5193, "mean_token_accuracy": 0.2689778059720993, "num_tokens": 162651900.0, "step": 71010 }, { "entropy": 5.280282020568848, "epoch": 7.020067220245156, "grad_norm": 1.234375, "learning_rate": 0.00014326846991588702, "loss": 4.6485, "mean_token_accuracy": 0.2595603585243225, "num_tokens": 162662674.0, "step": 71015 }, { "entropy": 5.227134037017822, "epoch": 7.020561486753658, "grad_norm": 1.3046875, "learning_rate": 0.00014323986224514163, "loss": 4.5153, "mean_token_accuracy": 0.271345055103302, "num_tokens": 162674271.0, "step": 71020 }, { "entropy": 5.27160005569458, "epoch": 7.021055753262159, "grad_norm": 1.3203125, "learning_rate": 0.0001432112578157159, "loss": 4.5614, "mean_token_accuracy": 0.2646605670452118, "num_tokens": 162684215.0, "step": 71025 }, { "entropy": 5.19384126663208, "epoch": 7.02155001977066, "grad_norm": 1.1796875, "learning_rate": 0.00014318265662831376, "loss": 4.4873, "mean_token_accuracy": 0.274087131023407, "num_tokens": 162695346.0, "step": 71030 }, { "entropy": 5.2095139503479, "epoch": 7.022044286279161, "grad_norm": 1.2265625, "learning_rate": 0.0001431540586836388, "loss": 4.5221, "mean_token_accuracy": 0.2660812050104141, "num_tokens": 162706513.0, "step": 71035 }, { "entropy": 5.1878753185272215, "epoch": 7.022538552787663, "grad_norm": 1.171875, "learning_rate": 0.0001431254639823944, "loss": 4.5287, "mean_token_accuracy": 0.2627322807908058, "num_tokens": 162718094.0, "step": 71040 }, { "entropy": 5.1526916980743405, "epoch": 7.023032819296165, "grad_norm": 1.1484375, "learning_rate": 0.00014309687252528407, "loss": 4.4866, "mean_token_accuracy": 0.2696051225066185, "num_tokens": 162729249.0, "step": 71045 }, { "entropy": 5.268155145645141, "epoch": 7.023527085804666, "grad_norm": 1.2734375, "learning_rate": 0.0001430682843130111, "loss": 4.615, "mean_token_accuracy": 0.26394796520471575, "num_tokens": 162740375.0, "step": 71050 }, { "entropy": 5.260245943069458, "epoch": 7.024021352313167, "grad_norm": 1.2109375, "learning_rate": 0.0001430396993462787, "loss": 4.6174, "mean_token_accuracy": 0.2639074057340622, "num_tokens": 162751869.0, "step": 71055 }, { "entropy": 5.265862894058228, "epoch": 7.024515618821669, "grad_norm": 1.3046875, "learning_rate": 0.00014301111762579034, "loss": 4.6185, "mean_token_accuracy": 0.2567559480667114, "num_tokens": 162764214.0, "step": 71060 }, { "entropy": 5.260413932800293, "epoch": 7.02500988533017, "grad_norm": 1.2109375, "learning_rate": 0.00014298253915224885, "loss": 4.5895, "mean_token_accuracy": 0.2712605640292168, "num_tokens": 162776000.0, "step": 71065 }, { "entropy": 5.2201361656188965, "epoch": 7.025504151838671, "grad_norm": 1.25, "learning_rate": 0.0001429539639263575, "loss": 4.5823, "mean_token_accuracy": 0.26534618586301806, "num_tokens": 162786994.0, "step": 71070 }, { "entropy": 5.229872465133667, "epoch": 7.025998418347172, "grad_norm": 1.0703125, "learning_rate": 0.000142925391948819, "loss": 4.5829, "mean_token_accuracy": 0.2664103865623474, "num_tokens": 162799704.0, "step": 71075 }, { "entropy": 5.206466388702393, "epoch": 7.026492684855675, "grad_norm": 1.1953125, "learning_rate": 0.00014289682322033632, "loss": 4.5103, "mean_token_accuracy": 0.2714951202273369, "num_tokens": 162810248.0, "step": 71080 }, { "entropy": 5.3052064895629885, "epoch": 7.026986951364176, "grad_norm": 1.078125, "learning_rate": 0.00014286825774161238, "loss": 4.5816, "mean_token_accuracy": 0.2591190919280052, "num_tokens": 162822424.0, "step": 71085 }, { "entropy": 5.218964862823486, "epoch": 7.027481217872677, "grad_norm": 1.1328125, "learning_rate": 0.00014283969551334979, "loss": 4.6106, "mean_token_accuracy": 0.26317005306482316, "num_tokens": 162833732.0, "step": 71090 }, { "entropy": 5.189088821411133, "epoch": 7.027975484381178, "grad_norm": 1.1875, "learning_rate": 0.00014281113653625123, "loss": 4.5129, "mean_token_accuracy": 0.27352199554443357, "num_tokens": 162844643.0, "step": 71095 }, { "entropy": 5.222206449508667, "epoch": 7.02846975088968, "grad_norm": 1.2421875, "learning_rate": 0.00014278258081101917, "loss": 4.5765, "mean_token_accuracy": 0.2626142755150795, "num_tokens": 162854979.0, "step": 71100 }, { "entropy": 5.286608695983887, "epoch": 7.028964017398181, "grad_norm": 1.203125, "learning_rate": 0.0001427540283383561, "loss": 4.6501, "mean_token_accuracy": 0.2591646060347557, "num_tokens": 162866397.0, "step": 71105 }, { "entropy": 5.252154302597046, "epoch": 7.029458283906682, "grad_norm": 1.34375, "learning_rate": 0.00014272547911896443, "loss": 4.5924, "mean_token_accuracy": 0.2640818104147911, "num_tokens": 162878419.0, "step": 71110 }, { "entropy": 5.254634428024292, "epoch": 7.029952550415184, "grad_norm": 1.1328125, "learning_rate": 0.00014269693315354653, "loss": 4.4688, "mean_token_accuracy": 0.2680004671216011, "num_tokens": 162890634.0, "step": 71115 }, { "entropy": 5.2026478290557865, "epoch": 7.030446816923686, "grad_norm": 1.25, "learning_rate": 0.0001426683904428047, "loss": 4.5368, "mean_token_accuracy": 0.27059611678123474, "num_tokens": 162901281.0, "step": 71120 }, { "entropy": 5.168717575073242, "epoch": 7.030941083432187, "grad_norm": 1.1171875, "learning_rate": 0.00014263985098744088, "loss": 4.574, "mean_token_accuracy": 0.26574851423501966, "num_tokens": 162914681.0, "step": 71125 }, { "entropy": 5.204546880722046, "epoch": 7.031435349940688, "grad_norm": 1.203125, "learning_rate": 0.00014261131478815725, "loss": 4.5428, "mean_token_accuracy": 0.2694579228758812, "num_tokens": 162926236.0, "step": 71130 }, { "entropy": 5.225072240829467, "epoch": 7.031929616449189, "grad_norm": 1.265625, "learning_rate": 0.00014258278184565594, "loss": 4.4837, "mean_token_accuracy": 0.2680325090885162, "num_tokens": 162936016.0, "step": 71135 }, { "entropy": 5.192321300506592, "epoch": 7.032423882957691, "grad_norm": 1.25, "learning_rate": 0.00014255425216063854, "loss": 4.5083, "mean_token_accuracy": 0.2633269131183624, "num_tokens": 162947144.0, "step": 71140 }, { "entropy": 5.17607479095459, "epoch": 7.032918149466192, "grad_norm": 1.1640625, "learning_rate": 0.00014252572573380723, "loss": 4.4898, "mean_token_accuracy": 0.26949298828840257, "num_tokens": 162958194.0, "step": 71145 }, { "entropy": 5.223080587387085, "epoch": 7.033412415974693, "grad_norm": 1.1171875, "learning_rate": 0.0001424972025658636, "loss": 4.5539, "mean_token_accuracy": 0.264566145837307, "num_tokens": 162969358.0, "step": 71150 }, { "entropy": 5.273003482818604, "epoch": 7.033906682483195, "grad_norm": 1.1875, "learning_rate": 0.00014246868265750928, "loss": 4.6659, "mean_token_accuracy": 0.2514640286564827, "num_tokens": 162981611.0, "step": 71155 }, { "entropy": 5.220589733123779, "epoch": 7.0344009489916965, "grad_norm": 1.125, "learning_rate": 0.00014244016600944604, "loss": 4.559, "mean_token_accuracy": 0.270061719417572, "num_tokens": 162993355.0, "step": 71160 }, { "entropy": 5.180563449859619, "epoch": 7.034895215500198, "grad_norm": 1.1796875, "learning_rate": 0.00014241165262237517, "loss": 4.5116, "mean_token_accuracy": 0.2777112782001495, "num_tokens": 163004458.0, "step": 71165 }, { "entropy": 5.267291307449341, "epoch": 7.035389482008699, "grad_norm": 1.21875, "learning_rate": 0.00014238314249699827, "loss": 4.6562, "mean_token_accuracy": 0.2585922285914421, "num_tokens": 163015536.0, "step": 71170 }, { "entropy": 5.170594215393066, "epoch": 7.0358837485172, "grad_norm": 1.1796875, "learning_rate": 0.0001423546356340166, "loss": 4.4795, "mean_token_accuracy": 0.27505672723054886, "num_tokens": 163027639.0, "step": 71175 }, { "entropy": 5.17859148979187, "epoch": 7.036378015025702, "grad_norm": 1.1484375, "learning_rate": 0.00014232613203413148, "loss": 4.538, "mean_token_accuracy": 0.27777780741453173, "num_tokens": 163040144.0, "step": 71180 }, { "entropy": 5.217699956893921, "epoch": 7.036872281534203, "grad_norm": 1.1640625, "learning_rate": 0.00014229763169804416, "loss": 4.5009, "mean_token_accuracy": 0.2673386067152023, "num_tokens": 163050228.0, "step": 71185 }, { "entropy": 5.244123029708862, "epoch": 7.037366548042705, "grad_norm": 1.0546875, "learning_rate": 0.00014226913462645564, "loss": 4.5636, "mean_token_accuracy": 0.26188877373933794, "num_tokens": 163061692.0, "step": 71190 }, { "entropy": 5.251717472076416, "epoch": 7.037860814551206, "grad_norm": 1.171875, "learning_rate": 0.00014224064082006698, "loss": 4.5771, "mean_token_accuracy": 0.255223149061203, "num_tokens": 163073716.0, "step": 71195 }, { "entropy": 5.2071491241455075, "epoch": 7.0383550810597075, "grad_norm": 1.1640625, "learning_rate": 0.00014221215027957916, "loss": 4.5306, "mean_token_accuracy": 0.26864238977432253, "num_tokens": 163084854.0, "step": 71200 }, { "entropy": 5.148516082763672, "epoch": 7.038849347568209, "grad_norm": 1.15625, "learning_rate": 0.000142183663005693, "loss": 4.484, "mean_token_accuracy": 0.27639336287975313, "num_tokens": 163095716.0, "step": 71205 }, { "entropy": 5.185742425918579, "epoch": 7.03934361407671, "grad_norm": 1.1484375, "learning_rate": 0.00014215517899910946, "loss": 4.5232, "mean_token_accuracy": 0.2760244220495224, "num_tokens": 163107002.0, "step": 71210 }, { "entropy": 5.252640962600708, "epoch": 7.039837880585211, "grad_norm": 1.21875, "learning_rate": 0.00014212669826052903, "loss": 4.5865, "mean_token_accuracy": 0.2615781590342522, "num_tokens": 163119011.0, "step": 71215 }, { "entropy": 5.188497829437256, "epoch": 7.040332147093713, "grad_norm": 1.140625, "learning_rate": 0.00014209822079065245, "loss": 4.4982, "mean_token_accuracy": 0.26797635704278944, "num_tokens": 163131381.0, "step": 71220 }, { "entropy": 5.1694494724273685, "epoch": 7.040826413602215, "grad_norm": 1.21875, "learning_rate": 0.00014206974659018034, "loss": 4.5147, "mean_token_accuracy": 0.2711660236120224, "num_tokens": 163142633.0, "step": 71225 }, { "entropy": 5.174024868011474, "epoch": 7.041320680110716, "grad_norm": 1.28125, "learning_rate": 0.00014204127565981293, "loss": 4.4728, "mean_token_accuracy": 0.27426839917898177, "num_tokens": 163153640.0, "step": 71230 }, { "entropy": 5.228451347351074, "epoch": 7.041814946619217, "grad_norm": 1.359375, "learning_rate": 0.00014201280800025092, "loss": 4.5418, "mean_token_accuracy": 0.2650019183754921, "num_tokens": 163164378.0, "step": 71235 }, { "entropy": 5.271663665771484, "epoch": 7.0423092131277185, "grad_norm": 1.234375, "learning_rate": 0.00014198434361219434, "loss": 4.655, "mean_token_accuracy": 0.25942524075508117, "num_tokens": 163175428.0, "step": 71240 }, { "entropy": 5.273941326141357, "epoch": 7.04280347963622, "grad_norm": 1.25, "learning_rate": 0.00014195588249634359, "loss": 4.6272, "mean_token_accuracy": 0.2608583584427834, "num_tokens": 163186444.0, "step": 71245 }, { "entropy": 5.306911611557007, "epoch": 7.043297746144721, "grad_norm": 1.21875, "learning_rate": 0.00014192742465339887, "loss": 4.6168, "mean_token_accuracy": 0.26076077967882155, "num_tokens": 163196626.0, "step": 71250 }, { "entropy": 5.26072325706482, "epoch": 7.043792012653222, "grad_norm": 1.3046875, "learning_rate": 0.0001418989700840599, "loss": 4.5611, "mean_token_accuracy": 0.2618995413184166, "num_tokens": 163207540.0, "step": 71255 }, { "entropy": 5.249753761291504, "epoch": 7.044286279161724, "grad_norm": 1.25, "learning_rate": 0.00014187051878902717, "loss": 4.5553, "mean_token_accuracy": 0.2671182736754417, "num_tokens": 163218400.0, "step": 71260 }, { "entropy": 5.281552982330322, "epoch": 7.044780545670226, "grad_norm": 1.171875, "learning_rate": 0.00014184207076900019, "loss": 4.5913, "mean_token_accuracy": 0.25971673280000684, "num_tokens": 163230699.0, "step": 71265 }, { "entropy": 5.219923114776611, "epoch": 7.045274812178727, "grad_norm": 1.2109375, "learning_rate": 0.00014181362602467895, "loss": 4.497, "mean_token_accuracy": 0.2710278958082199, "num_tokens": 163241350.0, "step": 71270 }, { "entropy": 5.263025379180908, "epoch": 7.045769078687228, "grad_norm": 1.2265625, "learning_rate": 0.00014178518455676325, "loss": 4.5857, "mean_token_accuracy": 0.26560188829898834, "num_tokens": 163253190.0, "step": 71275 }, { "entropy": 5.206469440460205, "epoch": 7.0462633451957295, "grad_norm": 1.15625, "learning_rate": 0.0001417567463659526, "loss": 4.5616, "mean_token_accuracy": 0.26687185764312743, "num_tokens": 163265099.0, "step": 71280 }, { "entropy": 5.249220132827759, "epoch": 7.046757611704231, "grad_norm": 1.1640625, "learning_rate": 0.00014172831145294664, "loss": 4.599, "mean_token_accuracy": 0.2618572056293488, "num_tokens": 163277595.0, "step": 71285 }, { "entropy": 5.27179970741272, "epoch": 7.047251878212732, "grad_norm": 1.2421875, "learning_rate": 0.00014169987981844492, "loss": 4.5669, "mean_token_accuracy": 0.2656000256538391, "num_tokens": 163287907.0, "step": 71290 }, { "entropy": 5.169688940048218, "epoch": 7.047746144721233, "grad_norm": 1.1328125, "learning_rate": 0.00014167145146314682, "loss": 4.4808, "mean_token_accuracy": 0.2737954407930374, "num_tokens": 163299148.0, "step": 71295 }, { "entropy": 5.165058279037476, "epoch": 7.048240411229735, "grad_norm": 1.1796875, "learning_rate": 0.0001416430263877518, "loss": 4.4791, "mean_token_accuracy": 0.26835942566394805, "num_tokens": 163310375.0, "step": 71300 }, { "entropy": 5.213146114349366, "epoch": 7.048734677738237, "grad_norm": 1.109375, "learning_rate": 0.00014161460459295893, "loss": 4.5907, "mean_token_accuracy": 0.2608377650380135, "num_tokens": 163322379.0, "step": 71305 }, { "entropy": 5.165962553024292, "epoch": 7.049228944246738, "grad_norm": 1.171875, "learning_rate": 0.00014158618607946748, "loss": 4.485, "mean_token_accuracy": 0.27373315393924713, "num_tokens": 163333357.0, "step": 71310 }, { "entropy": 5.2458357334136965, "epoch": 7.049723210755239, "grad_norm": 1.2421875, "learning_rate": 0.00014155777084797651, "loss": 4.5956, "mean_token_accuracy": 0.25946358144283294, "num_tokens": 163344627.0, "step": 71315 }, { "entropy": 5.284312772750854, "epoch": 7.0502174772637405, "grad_norm": 1.171875, "learning_rate": 0.00014152935889918513, "loss": 4.6156, "mean_token_accuracy": 0.26028954684734346, "num_tokens": 163356664.0, "step": 71320 }, { "entropy": 5.304465007781983, "epoch": 7.050711743772242, "grad_norm": 1.3125, "learning_rate": 0.00014150095023379228, "loss": 4.6398, "mean_token_accuracy": 0.256790491938591, "num_tokens": 163366589.0, "step": 71325 }, { "entropy": 5.277529048919678, "epoch": 7.051206010280743, "grad_norm": 1.1015625, "learning_rate": 0.00014147254485249671, "loss": 4.5237, "mean_token_accuracy": 0.26836987882852553, "num_tokens": 163378447.0, "step": 71330 }, { "entropy": 5.320578622817993, "epoch": 7.051700276789245, "grad_norm": 1.2109375, "learning_rate": 0.00014144414275599725, "loss": 4.6159, "mean_token_accuracy": 0.2536081776022911, "num_tokens": 163389627.0, "step": 71335 }, { "entropy": 5.165031671524048, "epoch": 7.052194543297746, "grad_norm": 1.1328125, "learning_rate": 0.00014141574394499265, "loss": 4.4562, "mean_token_accuracy": 0.27947298288345335, "num_tokens": 163402508.0, "step": 71340 }, { "entropy": 5.26002516746521, "epoch": 7.052688809806248, "grad_norm": 1.2890625, "learning_rate": 0.0001413873484201813, "loss": 4.5751, "mean_token_accuracy": 0.263471819460392, "num_tokens": 163413988.0, "step": 71345 }, { "entropy": 5.195035791397094, "epoch": 7.053183076314749, "grad_norm": 1.2578125, "learning_rate": 0.0001413589561822621, "loss": 4.5609, "mean_token_accuracy": 0.2647826910018921, "num_tokens": 163425254.0, "step": 71350 }, { "entropy": 5.281023693084717, "epoch": 7.05367734282325, "grad_norm": 1.1953125, "learning_rate": 0.00014133056723193322, "loss": 4.6752, "mean_token_accuracy": 0.2609615758061409, "num_tokens": 163436299.0, "step": 71355 }, { "entropy": 5.267426490783691, "epoch": 7.0541716093317515, "grad_norm": 1.3046875, "learning_rate": 0.00014130218156989315, "loss": 4.6231, "mean_token_accuracy": 0.26457859873771666, "num_tokens": 163447081.0, "step": 71360 }, { "entropy": 5.249394178390503, "epoch": 7.054665875840253, "grad_norm": 1.15625, "learning_rate": 0.00014127379919684022, "loss": 4.5838, "mean_token_accuracy": 0.2646635383367538, "num_tokens": 163458660.0, "step": 71365 }, { "entropy": 5.221147680282593, "epoch": 7.055160142348755, "grad_norm": 1.28125, "learning_rate": 0.00014124542011347246, "loss": 4.5264, "mean_token_accuracy": 0.26577942073345184, "num_tokens": 163469546.0, "step": 71370 }, { "entropy": 5.186821126937867, "epoch": 7.055654408857256, "grad_norm": 1.0703125, "learning_rate": 0.00014121704432048816, "loss": 4.5154, "mean_token_accuracy": 0.272012297809124, "num_tokens": 163481337.0, "step": 71375 }, { "entropy": 5.2413153648376465, "epoch": 7.056148675365757, "grad_norm": 1.2265625, "learning_rate": 0.0001411886718185853, "loss": 4.5606, "mean_token_accuracy": 0.27164207845926286, "num_tokens": 163492460.0, "step": 71380 }, { "entropy": 5.243020677566529, "epoch": 7.056642941874259, "grad_norm": 1.1953125, "learning_rate": 0.00014116030260846187, "loss": 4.6073, "mean_token_accuracy": 0.2624968528747559, "num_tokens": 163504229.0, "step": 71385 }, { "entropy": 5.193436574935913, "epoch": 7.05713720838276, "grad_norm": 1.1171875, "learning_rate": 0.00014113193669081585, "loss": 4.5708, "mean_token_accuracy": 0.2620587795972824, "num_tokens": 163515792.0, "step": 71390 }, { "entropy": 5.243376350402832, "epoch": 7.057631474891261, "grad_norm": 1.109375, "learning_rate": 0.0001411035740663449, "loss": 4.5736, "mean_token_accuracy": 0.26242717951536176, "num_tokens": 163528418.0, "step": 71395 }, { "entropy": 5.203187656402588, "epoch": 7.0581257413997625, "grad_norm": 1.203125, "learning_rate": 0.0001410752147357468, "loss": 4.5804, "mean_token_accuracy": 0.2672642022371292, "num_tokens": 163540049.0, "step": 71400 }, { "entropy": 5.157537364959717, "epoch": 7.058620007908264, "grad_norm": 1.2109375, "learning_rate": 0.0001410468586997191, "loss": 4.5069, "mean_token_accuracy": 0.2730592995882034, "num_tokens": 163550837.0, "step": 71405 }, { "entropy": 5.220319175720215, "epoch": 7.059114274416766, "grad_norm": 1.1796875, "learning_rate": 0.00014101850595895957, "loss": 4.539, "mean_token_accuracy": 0.26562169194221497, "num_tokens": 163561538.0, "step": 71410 }, { "entropy": 5.199295949935913, "epoch": 7.059608540925267, "grad_norm": 1.4375, "learning_rate": 0.0001409901565141656, "loss": 4.5116, "mean_token_accuracy": 0.2718344464898109, "num_tokens": 163571419.0, "step": 71415 }, { "entropy": 5.191926145553589, "epoch": 7.060102807433768, "grad_norm": 1.2421875, "learning_rate": 0.0001409618103660345, "loss": 4.4975, "mean_token_accuracy": 0.2778784468770027, "num_tokens": 163581990.0, "step": 71420 }, { "entropy": 5.190867471694946, "epoch": 7.06059707394227, "grad_norm": 1.2421875, "learning_rate": 0.0001409334675152637, "loss": 4.5655, "mean_token_accuracy": 0.2611182898283005, "num_tokens": 163593345.0, "step": 71425 }, { "entropy": 5.2683703899383545, "epoch": 7.061091340450771, "grad_norm": 1.2265625, "learning_rate": 0.00014090512796255034, "loss": 4.6346, "mean_token_accuracy": 0.2577028810977936, "num_tokens": 163604674.0, "step": 71430 }, { "entropy": 5.2245525360107425, "epoch": 7.061585606959272, "grad_norm": 1.078125, "learning_rate": 0.00014087679170859163, "loss": 4.5419, "mean_token_accuracy": 0.2609571874141693, "num_tokens": 163616991.0, "step": 71435 }, { "entropy": 5.288863849639893, "epoch": 7.062079873467773, "grad_norm": 1.1484375, "learning_rate": 0.00014084845875408475, "loss": 4.6129, "mean_token_accuracy": 0.26047283411026, "num_tokens": 163629912.0, "step": 71440 }, { "entropy": 5.247469282150268, "epoch": 7.062574139976276, "grad_norm": 1.234375, "learning_rate": 0.00014082012909972654, "loss": 4.5876, "mean_token_accuracy": 0.2644265368580818, "num_tokens": 163641135.0, "step": 71445 }, { "entropy": 5.234064102172852, "epoch": 7.063068406484777, "grad_norm": 1.2578125, "learning_rate": 0.00014079180274621396, "loss": 4.5778, "mean_token_accuracy": 0.26654706001281736, "num_tokens": 163652433.0, "step": 71450 }, { "entropy": 5.18265962600708, "epoch": 7.063562672993278, "grad_norm": 1.1640625, "learning_rate": 0.0001407634796942439, "loss": 4.499, "mean_token_accuracy": 0.2667521297931671, "num_tokens": 163664148.0, "step": 71455 }, { "entropy": 5.218238782882691, "epoch": 7.064056939501779, "grad_norm": 1.1796875, "learning_rate": 0.00014073515994451297, "loss": 4.5972, "mean_token_accuracy": 0.26058234870433805, "num_tokens": 163678012.0, "step": 71460 }, { "entropy": 5.202639818191528, "epoch": 7.064551206010281, "grad_norm": 1.09375, "learning_rate": 0.00014070684349771803, "loss": 4.5962, "mean_token_accuracy": 0.25901547372341155, "num_tokens": 163689023.0, "step": 71465 }, { "entropy": 5.198009824752807, "epoch": 7.065045472518782, "grad_norm": 1.234375, "learning_rate": 0.00014067853035455553, "loss": 4.4667, "mean_token_accuracy": 0.28159690648317337, "num_tokens": 163699731.0, "step": 71470 }, { "entropy": 5.215386772155762, "epoch": 7.065539739027283, "grad_norm": 1.2890625, "learning_rate": 0.000140650220515722, "loss": 4.5369, "mean_token_accuracy": 0.26975112706422805, "num_tokens": 163710562.0, "step": 71475 }, { "entropy": 5.215586614608765, "epoch": 7.066034005535785, "grad_norm": 1.0625, "learning_rate": 0.00014062191398191398, "loss": 4.5229, "mean_token_accuracy": 0.2654734686017036, "num_tokens": 163722423.0, "step": 71480 }, { "entropy": 5.23270812034607, "epoch": 7.066528272044287, "grad_norm": 1.265625, "learning_rate": 0.00014059361075382764, "loss": 4.5867, "mean_token_accuracy": 0.25993033647537234, "num_tokens": 163734193.0, "step": 71485 }, { "entropy": 5.29894495010376, "epoch": 7.067022538552788, "grad_norm": 1.4921875, "learning_rate": 0.00014056531083215935, "loss": 4.6895, "mean_token_accuracy": 0.25114882439374925, "num_tokens": 163745453.0, "step": 71490 }, { "entropy": 5.255172538757324, "epoch": 7.067516805061289, "grad_norm": 1.125, "learning_rate": 0.00014053701421760527, "loss": 4.5777, "mean_token_accuracy": 0.26270485669374466, "num_tokens": 163757540.0, "step": 71495 }, { "entropy": 5.302435111999512, "epoch": 7.06801107156979, "grad_norm": 1.2578125, "learning_rate": 0.00014050872091086146, "loss": 4.6937, "mean_token_accuracy": 0.2568920060992241, "num_tokens": 163770277.0, "step": 71500 }, { "entropy": 5.287960052490234, "epoch": 7.068505338078292, "grad_norm": 1.1953125, "learning_rate": 0.0001404804309126241, "loss": 4.5904, "mean_token_accuracy": 0.2614745289087296, "num_tokens": 163780765.0, "step": 71505 }, { "entropy": 5.233676099777222, "epoch": 7.068999604586793, "grad_norm": 1.203125, "learning_rate": 0.00014045214422358889, "loss": 4.533, "mean_token_accuracy": 0.26745411306619643, "num_tokens": 163791972.0, "step": 71510 }, { "entropy": 5.249706697463989, "epoch": 7.069493871095294, "grad_norm": 1.2109375, "learning_rate": 0.00014042386084445188, "loss": 4.5915, "mean_token_accuracy": 0.26269604116678236, "num_tokens": 163804622.0, "step": 71515 }, { "entropy": 5.232075500488281, "epoch": 7.069988137603796, "grad_norm": 1.234375, "learning_rate": 0.00014039558077590865, "loss": 4.5994, "mean_token_accuracy": 0.26112980842590333, "num_tokens": 163816187.0, "step": 71520 }, { "entropy": 5.176009750366211, "epoch": 7.070482404112298, "grad_norm": 1.1484375, "learning_rate": 0.00014036730401865516, "loss": 4.5374, "mean_token_accuracy": 0.2626690849661827, "num_tokens": 163827678.0, "step": 71525 }, { "entropy": 5.244319248199463, "epoch": 7.070976670620799, "grad_norm": 1.21875, "learning_rate": 0.0001403390305733868, "loss": 4.5257, "mean_token_accuracy": 0.27087876200675964, "num_tokens": 163837881.0, "step": 71530 }, { "entropy": 5.27446722984314, "epoch": 7.0714709371293, "grad_norm": 1.1953125, "learning_rate": 0.00014031076044079916, "loss": 4.604, "mean_token_accuracy": 0.26244829446077345, "num_tokens": 163849201.0, "step": 71535 }, { "entropy": 5.191932487487793, "epoch": 7.071965203637801, "grad_norm": 1.1953125, "learning_rate": 0.00014028249362158781, "loss": 4.5286, "mean_token_accuracy": 0.26882503777742384, "num_tokens": 163859588.0, "step": 71540 }, { "entropy": 5.2002702236175535, "epoch": 7.072459470146303, "grad_norm": 1.2265625, "learning_rate": 0.00014025423011644795, "loss": 4.5295, "mean_token_accuracy": 0.2669359564781189, "num_tokens": 163870689.0, "step": 71545 }, { "entropy": 5.196372413635254, "epoch": 7.072953736654804, "grad_norm": 1.2109375, "learning_rate": 0.0001402259699260749, "loss": 4.5643, "mean_token_accuracy": 0.262185363471508, "num_tokens": 163882157.0, "step": 71550 }, { "entropy": 5.189282751083374, "epoch": 7.073448003163306, "grad_norm": 1.1875, "learning_rate": 0.0001401977130511639, "loss": 4.5155, "mean_token_accuracy": 0.27445594072341917, "num_tokens": 163894187.0, "step": 71555 }, { "entropy": 5.143900680541992, "epoch": 7.073942269671807, "grad_norm": 1.375, "learning_rate": 0.00014016945949241007, "loss": 4.5207, "mean_token_accuracy": 0.26492461413145063, "num_tokens": 163905125.0, "step": 71560 }, { "entropy": 5.219607782363892, "epoch": 7.0744365361803085, "grad_norm": 1.3203125, "learning_rate": 0.00014014120925050856, "loss": 4.5823, "mean_token_accuracy": 0.259686316549778, "num_tokens": 163916300.0, "step": 71565 }, { "entropy": 5.277431583404541, "epoch": 7.07493080268881, "grad_norm": 1.234375, "learning_rate": 0.00014011296232615414, "loss": 4.6325, "mean_token_accuracy": 0.2536036610603333, "num_tokens": 163926625.0, "step": 71570 }, { "entropy": 5.247977542877197, "epoch": 7.075425069197311, "grad_norm": 1.2421875, "learning_rate": 0.00014008471872004174, "loss": 4.5752, "mean_token_accuracy": 0.26986241340637207, "num_tokens": 163938710.0, "step": 71575 }, { "entropy": 5.2658697128295895, "epoch": 7.075919335705812, "grad_norm": 1.3203125, "learning_rate": 0.00014005647843286624, "loss": 4.5924, "mean_token_accuracy": 0.2669550448656082, "num_tokens": 163949013.0, "step": 71580 }, { "entropy": 5.3172698497772215, "epoch": 7.076413602214314, "grad_norm": 1.1953125, "learning_rate": 0.00014002824146532226, "loss": 4.6775, "mean_token_accuracy": 0.2546441346406937, "num_tokens": 163961403.0, "step": 71585 }, { "entropy": 5.2505566596984865, "epoch": 7.076907868722816, "grad_norm": 1.1171875, "learning_rate": 0.00014000000781810458, "loss": 4.5503, "mean_token_accuracy": 0.2665455207228661, "num_tokens": 163973235.0, "step": 71590 }, { "entropy": 5.195362949371338, "epoch": 7.077402135231317, "grad_norm": 1.234375, "learning_rate": 0.00013997177749190754, "loss": 4.5494, "mean_token_accuracy": 0.2719210207462311, "num_tokens": 163984129.0, "step": 71595 }, { "entropy": 5.206395530700684, "epoch": 7.077896401739818, "grad_norm": 1.2421875, "learning_rate": 0.00013994355048742573, "loss": 4.4817, "mean_token_accuracy": 0.2710563600063324, "num_tokens": 163994704.0, "step": 71600 }, { "entropy": 5.2231346607208256, "epoch": 7.0783906682483195, "grad_norm": 1.234375, "learning_rate": 0.00013991532680535356, "loss": 4.5734, "mean_token_accuracy": 0.268265064060688, "num_tokens": 164005849.0, "step": 71605 }, { "entropy": 5.235924339294433, "epoch": 7.078884934756821, "grad_norm": 1.171875, "learning_rate": 0.00013988710644638534, "loss": 4.6, "mean_token_accuracy": 0.2654043331742287, "num_tokens": 164019046.0, "step": 71610 }, { "entropy": 5.2434288501739506, "epoch": 7.079379201265322, "grad_norm": 1.171875, "learning_rate": 0.00013985888941121528, "loss": 4.6109, "mean_token_accuracy": 0.25735656917095184, "num_tokens": 164030837.0, "step": 71615 }, { "entropy": 5.166497278213501, "epoch": 7.079873467773823, "grad_norm": 1.28125, "learning_rate": 0.00013983067570053745, "loss": 4.5247, "mean_token_accuracy": 0.27023766040802, "num_tokens": 164042689.0, "step": 71620 }, { "entropy": 5.3231113910675045, "epoch": 7.0803677342823255, "grad_norm": 1.1328125, "learning_rate": 0.00013980246531504598, "loss": 4.7073, "mean_token_accuracy": 0.2498045802116394, "num_tokens": 164054831.0, "step": 71625 }, { "entropy": 5.2966748714447025, "epoch": 7.080862000790827, "grad_norm": 1.1796875, "learning_rate": 0.0001397742582554349, "loss": 4.5916, "mean_token_accuracy": 0.26303414106369016, "num_tokens": 164066848.0, "step": 71630 }, { "entropy": 5.235888576507568, "epoch": 7.081356267299328, "grad_norm": 1.3046875, "learning_rate": 0.00013974605452239785, "loss": 4.5529, "mean_token_accuracy": 0.2681574285030365, "num_tokens": 164078461.0, "step": 71635 }, { "entropy": 5.231727552413941, "epoch": 7.081850533807829, "grad_norm": 1.2890625, "learning_rate": 0.00013971785411662907, "loss": 4.5574, "mean_token_accuracy": 0.26600454151630404, "num_tokens": 164088405.0, "step": 71640 }, { "entropy": 5.124089956283569, "epoch": 7.0823448003163305, "grad_norm": 1.1796875, "learning_rate": 0.00013968965703882192, "loss": 4.4442, "mean_token_accuracy": 0.27713863700628283, "num_tokens": 164100725.0, "step": 71645 }, { "entropy": 5.250990295410157, "epoch": 7.082839066824832, "grad_norm": 1.328125, "learning_rate": 0.00013966146328967026, "loss": 4.575, "mean_token_accuracy": 0.2584008887410164, "num_tokens": 164111909.0, "step": 71650 }, { "entropy": 5.226071834564209, "epoch": 7.083333333333333, "grad_norm": 1.234375, "learning_rate": 0.00013963327286986763, "loss": 4.59, "mean_token_accuracy": 0.2638400197029114, "num_tokens": 164123059.0, "step": 71655 }, { "entropy": 5.2231748580932615, "epoch": 7.083827599841834, "grad_norm": 1.0703125, "learning_rate": 0.00013960508578010744, "loss": 4.5547, "mean_token_accuracy": 0.25998183637857436, "num_tokens": 164136034.0, "step": 71660 }, { "entropy": 5.252067947387696, "epoch": 7.0843218663503364, "grad_norm": 1.203125, "learning_rate": 0.0001395769020210831, "loss": 4.6473, "mean_token_accuracy": 0.2587422788143158, "num_tokens": 164147892.0, "step": 71665 }, { "entropy": 5.253285217285156, "epoch": 7.084816132858838, "grad_norm": 1.296875, "learning_rate": 0.00013954872159348803, "loss": 4.5463, "mean_token_accuracy": 0.2596784129738808, "num_tokens": 164158590.0, "step": 71670 }, { "entropy": 5.21895842552185, "epoch": 7.085310399367339, "grad_norm": 1.2265625, "learning_rate": 0.00013952054449801538, "loss": 4.545, "mean_token_accuracy": 0.2694240152835846, "num_tokens": 164170694.0, "step": 71675 }, { "entropy": 5.2297979354858395, "epoch": 7.08580466587584, "grad_norm": 1.2265625, "learning_rate": 0.00013949237073535847, "loss": 4.6446, "mean_token_accuracy": 0.25971250236034393, "num_tokens": 164182347.0, "step": 71680 }, { "entropy": 5.226616096496582, "epoch": 7.0862989323843415, "grad_norm": 1.2890625, "learning_rate": 0.00013946420030621015, "loss": 4.5645, "mean_token_accuracy": 0.26382455974817276, "num_tokens": 164194083.0, "step": 71685 }, { "entropy": 5.242936420440674, "epoch": 7.086793198892843, "grad_norm": 1.1640625, "learning_rate": 0.00013943603321126357, "loss": 4.5668, "mean_token_accuracy": 0.2669172391295433, "num_tokens": 164204141.0, "step": 71690 }, { "entropy": 5.299603271484375, "epoch": 7.087287465401344, "grad_norm": 1.1953125, "learning_rate": 0.00013940786945121158, "loss": 4.6911, "mean_token_accuracy": 0.2593565285205841, "num_tokens": 164217099.0, "step": 71695 }, { "entropy": 5.239892148971558, "epoch": 7.087781731909846, "grad_norm": 1.2109375, "learning_rate": 0.00013937970902674706, "loss": 4.5724, "mean_token_accuracy": 0.2637315198779106, "num_tokens": 164227875.0, "step": 71700 }, { "entropy": 5.26652946472168, "epoch": 7.088275998418347, "grad_norm": 1.171875, "learning_rate": 0.0001393515519385628, "loss": 4.642, "mean_token_accuracy": 0.2572519361972809, "num_tokens": 164240905.0, "step": 71705 }, { "entropy": 5.210349464416504, "epoch": 7.088770264926849, "grad_norm": 1.2109375, "learning_rate": 0.0001393233981873513, "loss": 4.5194, "mean_token_accuracy": 0.2763324469327927, "num_tokens": 164253146.0, "step": 71710 }, { "entropy": 5.279690217971802, "epoch": 7.08926453143535, "grad_norm": 1.203125, "learning_rate": 0.00013929524777380527, "loss": 4.5807, "mean_token_accuracy": 0.25832831114530563, "num_tokens": 164265258.0, "step": 71715 }, { "entropy": 5.246162748336792, "epoch": 7.089758797943851, "grad_norm": 1.2578125, "learning_rate": 0.0001392671006986172, "loss": 4.6059, "mean_token_accuracy": 0.2583301171660423, "num_tokens": 164275862.0, "step": 71720 }, { "entropy": 5.267920207977295, "epoch": 7.0902530644523525, "grad_norm": 1.265625, "learning_rate": 0.00013923895696247953, "loss": 4.6161, "mean_token_accuracy": 0.2612006261944771, "num_tokens": 164287007.0, "step": 71725 }, { "entropy": 5.148457098007202, "epoch": 7.090747330960854, "grad_norm": 1.1875, "learning_rate": 0.00013921081656608465, "loss": 4.5699, "mean_token_accuracy": 0.2681055381894112, "num_tokens": 164298430.0, "step": 71730 }, { "entropy": 5.216574668884277, "epoch": 7.091241597469356, "grad_norm": 1.2734375, "learning_rate": 0.00013918267951012464, "loss": 4.5668, "mean_token_accuracy": 0.269753623008728, "num_tokens": 164309688.0, "step": 71735 }, { "entropy": 5.241463232040405, "epoch": 7.091735863977857, "grad_norm": 1.171875, "learning_rate": 0.0001391545457952918, "loss": 4.5502, "mean_token_accuracy": 0.2632643222808838, "num_tokens": 164321470.0, "step": 71740 }, { "entropy": 5.279754543304444, "epoch": 7.092230130486358, "grad_norm": 1.2109375, "learning_rate": 0.00013912641542227833, "loss": 4.5966, "mean_token_accuracy": 0.2642480432987213, "num_tokens": 164333681.0, "step": 71745 }, { "entropy": 5.183538007736206, "epoch": 7.09272439699486, "grad_norm": 1.25, "learning_rate": 0.0001390982883917759, "loss": 4.5114, "mean_token_accuracy": 0.2747937887907028, "num_tokens": 164346587.0, "step": 71750 }, { "entropy": 5.196554517745971, "epoch": 7.093218663503361, "grad_norm": 1.1015625, "learning_rate": 0.00013907016470447687, "loss": 4.5466, "mean_token_accuracy": 0.2694635629653931, "num_tokens": 164358840.0, "step": 71755 }, { "entropy": 5.234491872787475, "epoch": 7.093712930011862, "grad_norm": 1.34375, "learning_rate": 0.00013904204436107276, "loss": 4.5759, "mean_token_accuracy": 0.26351840794086456, "num_tokens": 164368868.0, "step": 71760 }, { "entropy": 5.29741530418396, "epoch": 7.0942071965203635, "grad_norm": 1.2578125, "learning_rate": 0.00013901392736225543, "loss": 4.6378, "mean_token_accuracy": 0.2617019027471542, "num_tokens": 164380718.0, "step": 71765 }, { "entropy": 5.290187835693359, "epoch": 7.094701463028865, "grad_norm": 1.2421875, "learning_rate": 0.0001389858137087167, "loss": 4.5528, "mean_token_accuracy": 0.2622307866811752, "num_tokens": 164392371.0, "step": 71770 }, { "entropy": 5.181434774398804, "epoch": 7.095195729537367, "grad_norm": 1.203125, "learning_rate": 0.00013895770340114795, "loss": 4.509, "mean_token_accuracy": 0.2696963742375374, "num_tokens": 164403960.0, "step": 71775 }, { "entropy": 5.301836633682251, "epoch": 7.095689996045868, "grad_norm": 1.1640625, "learning_rate": 0.00013892959644024082, "loss": 4.6916, "mean_token_accuracy": 0.25218850523233416, "num_tokens": 164415553.0, "step": 71780 }, { "entropy": 5.130481338500976, "epoch": 7.096184262554369, "grad_norm": 1.1640625, "learning_rate": 0.00013890149282668674, "loss": 4.4321, "mean_token_accuracy": 0.2802326291799545, "num_tokens": 164427319.0, "step": 71785 }, { "entropy": 5.197601366043091, "epoch": 7.096678529062871, "grad_norm": 1.1953125, "learning_rate": 0.000138873392561177, "loss": 4.5591, "mean_token_accuracy": 0.2641249805688858, "num_tokens": 164439836.0, "step": 71790 }, { "entropy": 5.26863579750061, "epoch": 7.097172795571372, "grad_norm": 1.2265625, "learning_rate": 0.00013884529564440307, "loss": 4.6069, "mean_token_accuracy": 0.2607013076543808, "num_tokens": 164451088.0, "step": 71795 }, { "entropy": 5.299325561523437, "epoch": 7.097667062079873, "grad_norm": 1.34375, "learning_rate": 0.00013881720207705586, "loss": 4.655, "mean_token_accuracy": 0.25145543813705445, "num_tokens": 164462000.0, "step": 71800 }, { "entropy": 5.2592284202575685, "epoch": 7.0981613285883745, "grad_norm": 1.1015625, "learning_rate": 0.00013878911185982663, "loss": 4.5628, "mean_token_accuracy": 0.2632303312420845, "num_tokens": 164474532.0, "step": 71805 }, { "entropy": 5.306239175796509, "epoch": 7.098655595096877, "grad_norm": 1.1953125, "learning_rate": 0.00013876102499340637, "loss": 4.6776, "mean_token_accuracy": 0.256613127887249, "num_tokens": 164485966.0, "step": 71810 }, { "entropy": 5.252986001968384, "epoch": 7.099149861605378, "grad_norm": 1.28125, "learning_rate": 0.00013873294147848602, "loss": 4.5689, "mean_token_accuracy": 0.26480146050453185, "num_tokens": 164497287.0, "step": 71815 }, { "entropy": 5.237698173522949, "epoch": 7.099644128113879, "grad_norm": 1.25, "learning_rate": 0.00013870486131575656, "loss": 4.558, "mean_token_accuracy": 0.2705056741833687, "num_tokens": 164509311.0, "step": 71820 }, { "entropy": 5.291660308837891, "epoch": 7.10013839462238, "grad_norm": 1.0703125, "learning_rate": 0.00013867678450590854, "loss": 4.6265, "mean_token_accuracy": 0.26030752807855606, "num_tokens": 164522372.0, "step": 71825 }, { "entropy": 5.267080354690552, "epoch": 7.100632661130882, "grad_norm": 1.109375, "learning_rate": 0.00013864871104963278, "loss": 4.6419, "mean_token_accuracy": 0.26078751385211946, "num_tokens": 164535627.0, "step": 71830 }, { "entropy": 5.3039850234985355, "epoch": 7.101126927639383, "grad_norm": 1.28125, "learning_rate": 0.00013862064094761998, "loss": 4.6689, "mean_token_accuracy": 0.2530851483345032, "num_tokens": 164548394.0, "step": 71835 }, { "entropy": 5.275109529495239, "epoch": 7.101621194147884, "grad_norm": 1.15625, "learning_rate": 0.00013859257420056038, "loss": 4.6216, "mean_token_accuracy": 0.2616111621260643, "num_tokens": 164559562.0, "step": 71840 }, { "entropy": 5.2840132236480715, "epoch": 7.102115460656386, "grad_norm": 1.15625, "learning_rate": 0.0001385645108091448, "loss": 4.7109, "mean_token_accuracy": 0.2587465733289719, "num_tokens": 164573182.0, "step": 71845 }, { "entropy": 5.160792255401612, "epoch": 7.102609727164888, "grad_norm": 1.265625, "learning_rate": 0.00013853645077406334, "loss": 4.4685, "mean_token_accuracy": 0.2780414462089539, "num_tokens": 164584344.0, "step": 71850 }, { "entropy": 5.224422597885132, "epoch": 7.103103993673389, "grad_norm": 1.4296875, "learning_rate": 0.00013850839409600634, "loss": 4.5632, "mean_token_accuracy": 0.2654529482126236, "num_tokens": 164594837.0, "step": 71855 }, { "entropy": 5.2340545654296875, "epoch": 7.10359826018189, "grad_norm": 1.3046875, "learning_rate": 0.00013848034077566413, "loss": 4.6273, "mean_token_accuracy": 0.2604191765189171, "num_tokens": 164606605.0, "step": 71860 }, { "entropy": 5.193234252929687, "epoch": 7.104092526690391, "grad_norm": 1.34375, "learning_rate": 0.00013845229081372662, "loss": 4.5247, "mean_token_accuracy": 0.26931876242160796, "num_tokens": 164617330.0, "step": 71865 }, { "entropy": 5.1750561714172365, "epoch": 7.104586793198893, "grad_norm": 1.3671875, "learning_rate": 0.00013842424421088397, "loss": 4.5007, "mean_token_accuracy": 0.2751017868518829, "num_tokens": 164627993.0, "step": 71870 }, { "entropy": 5.2011613845825195, "epoch": 7.105081059707394, "grad_norm": 1.1328125, "learning_rate": 0.00013839620096782606, "loss": 4.5376, "mean_token_accuracy": 0.2658636674284935, "num_tokens": 164640640.0, "step": 71875 }, { "entropy": 5.211956930160523, "epoch": 7.105575326215895, "grad_norm": 1.2578125, "learning_rate": 0.00013836816108524282, "loss": 4.5393, "mean_token_accuracy": 0.27629415690898895, "num_tokens": 164652711.0, "step": 71880 }, { "entropy": 5.3049780368804935, "epoch": 7.106069592724397, "grad_norm": 1.265625, "learning_rate": 0.00013834012456382405, "loss": 4.6477, "mean_token_accuracy": 0.25832949578762054, "num_tokens": 164664022.0, "step": 71885 }, { "entropy": 5.2843918800354, "epoch": 7.106563859232899, "grad_norm": 1.1875, "learning_rate": 0.00013831209140425938, "loss": 4.6159, "mean_token_accuracy": 0.26124884337186816, "num_tokens": 164675326.0, "step": 71890 }, { "entropy": 5.329248237609863, "epoch": 7.1070581257414, "grad_norm": 1.3125, "learning_rate": 0.00013828406160723845, "loss": 4.6534, "mean_token_accuracy": 0.2530888542532921, "num_tokens": 164686037.0, "step": 71895 }, { "entropy": 5.286033725738525, "epoch": 7.107552392249901, "grad_norm": 1.1796875, "learning_rate": 0.0001382560351734508, "loss": 4.6008, "mean_token_accuracy": 0.2647097706794739, "num_tokens": 164698098.0, "step": 71900 }, { "entropy": 5.207710886001587, "epoch": 7.108046658758402, "grad_norm": 1.2421875, "learning_rate": 0.00013822801210358596, "loss": 4.5287, "mean_token_accuracy": 0.2749713346362114, "num_tokens": 164709481.0, "step": 71905 }, { "entropy": 5.175037240982055, "epoch": 7.108540925266904, "grad_norm": 1.1015625, "learning_rate": 0.00013819999239833325, "loss": 4.5381, "mean_token_accuracy": 0.2658377677202225, "num_tokens": 164721909.0, "step": 71910 }, { "entropy": 5.251430082321167, "epoch": 7.109035191775405, "grad_norm": 1.21875, "learning_rate": 0.0001381719760583819, "loss": 4.6209, "mean_token_accuracy": 0.25743149518966674, "num_tokens": 164734417.0, "step": 71915 }, { "entropy": 5.188932609558106, "epoch": 7.109529458283907, "grad_norm": 1.046875, "learning_rate": 0.0001381439630844213, "loss": 4.563, "mean_token_accuracy": 0.2640943259000778, "num_tokens": 164746552.0, "step": 71920 }, { "entropy": 5.238796043395996, "epoch": 7.110023724792408, "grad_norm": 1.1484375, "learning_rate": 0.00013811595347714017, "loss": 4.5315, "mean_token_accuracy": 0.26755862683057785, "num_tokens": 164758117.0, "step": 71925 }, { "entropy": 5.179098463058471, "epoch": 7.11051799130091, "grad_norm": 1.3828125, "learning_rate": 0.00013808794723722798, "loss": 4.4566, "mean_token_accuracy": 0.26789702475070953, "num_tokens": 164768683.0, "step": 71930 }, { "entropy": 5.2118377685546875, "epoch": 7.111012257809411, "grad_norm": 1.296875, "learning_rate": 0.00013805994436537358, "loss": 4.5109, "mean_token_accuracy": 0.2674815222620964, "num_tokens": 164780346.0, "step": 71935 }, { "entropy": 5.2936680793762205, "epoch": 7.111506524317912, "grad_norm": 1.28125, "learning_rate": 0.00013803194486226573, "loss": 4.6838, "mean_token_accuracy": 0.2484266296029091, "num_tokens": 164792993.0, "step": 71940 }, { "entropy": 5.2332299709320065, "epoch": 7.112000790826413, "grad_norm": 1.296875, "learning_rate": 0.00013800394872859334, "loss": 4.5674, "mean_token_accuracy": 0.25925860106945037, "num_tokens": 164804848.0, "step": 71945 }, { "entropy": 5.259986019134521, "epoch": 7.112495057334915, "grad_norm": 1.15625, "learning_rate": 0.00013797595596504498, "loss": 4.6254, "mean_token_accuracy": 0.26052159667015073, "num_tokens": 164816397.0, "step": 71950 }, { "entropy": 5.247277498245239, "epoch": 7.112989323843417, "grad_norm": 1.1640625, "learning_rate": 0.00013794796657230933, "loss": 4.6048, "mean_token_accuracy": 0.25979972183704375, "num_tokens": 164827957.0, "step": 71955 }, { "entropy": 5.218731546401978, "epoch": 7.113483590351918, "grad_norm": 1.1484375, "learning_rate": 0.0001379199805510751, "loss": 4.5353, "mean_token_accuracy": 0.2655192822217941, "num_tokens": 164840513.0, "step": 71960 }, { "entropy": 5.2358323097229, "epoch": 7.113977856860419, "grad_norm": 1.3671875, "learning_rate": 0.0001378919979020305, "loss": 4.5879, "mean_token_accuracy": 0.2661335408687592, "num_tokens": 164851444.0, "step": 71965 }, { "entropy": 5.3024157047271725, "epoch": 7.1144721233689205, "grad_norm": 1.2890625, "learning_rate": 0.0001378640186258641, "loss": 4.668, "mean_token_accuracy": 0.25102175772190094, "num_tokens": 164863644.0, "step": 71970 }, { "entropy": 5.215740776062011, "epoch": 7.114966389877422, "grad_norm": 1.2734375, "learning_rate": 0.0001378360427232641, "loss": 4.5535, "mean_token_accuracy": 0.26661993712186816, "num_tokens": 164874300.0, "step": 71975 }, { "entropy": 5.189811897277832, "epoch": 7.115460656385923, "grad_norm": 1.15625, "learning_rate": 0.00013780807019491868, "loss": 4.5283, "mean_token_accuracy": 0.260343074798584, "num_tokens": 164884433.0, "step": 71980 }, { "entropy": 5.176437330245972, "epoch": 7.115954922894424, "grad_norm": 1.171875, "learning_rate": 0.00013778010104151603, "loss": 4.5217, "mean_token_accuracy": 0.2669517517089844, "num_tokens": 164895040.0, "step": 71985 }, { "entropy": 5.235286140441895, "epoch": 7.1164491894029265, "grad_norm": 1.0859375, "learning_rate": 0.00013775213526374418, "loss": 4.594, "mean_token_accuracy": 0.265977518260479, "num_tokens": 164907163.0, "step": 71990 }, { "entropy": 5.3476170063018795, "epoch": 7.116943455911428, "grad_norm": 1.2421875, "learning_rate": 0.00013772417286229117, "loss": 4.6833, "mean_token_accuracy": 0.25640018880367277, "num_tokens": 164919175.0, "step": 71995 }, { "entropy": 5.216291999816894, "epoch": 7.117437722419929, "grad_norm": 1.2421875, "learning_rate": 0.00013769621383784476, "loss": 4.5685, "mean_token_accuracy": 0.2696469262242317, "num_tokens": 164930226.0, "step": 72000 }, { "epoch": 7.117437722419929, "eval_entropy": 5.0071794362085775, "eval_loss": 4.775790214538574, "eval_mean_token_accuracy": 0.25674793871822976, "eval_num_tokens": 164930226.0, "eval_runtime": 26.5589, "eval_samples_per_second": 1224.185, "eval_steps_per_second": 153.056, "step": 72000 }, { "entropy": 5.284264135360718, "epoch": 7.11793198892843, "grad_norm": 1.171875, "learning_rate": 0.00013766825819109274, "loss": 4.6379, "mean_token_accuracy": 0.25131661891937257, "num_tokens": 164942042.0, "step": 72005 }, { "entropy": 5.28647747039795, "epoch": 7.1184262554369315, "grad_norm": 1.1953125, "learning_rate": 0.00013764030592272296, "loss": 4.6238, "mean_token_accuracy": 0.25878018885850906, "num_tokens": 164953039.0, "step": 72010 }, { "entropy": 5.280896329879761, "epoch": 7.118920521945433, "grad_norm": 1.265625, "learning_rate": 0.00013761235703342283, "loss": 4.614, "mean_token_accuracy": 0.26267715245485307, "num_tokens": 164963209.0, "step": 72015 }, { "entropy": 5.217678213119507, "epoch": 7.119414788453934, "grad_norm": 1.2265625, "learning_rate": 0.0001375844115238802, "loss": 4.5303, "mean_token_accuracy": 0.2641005888581276, "num_tokens": 164975836.0, "step": 72020 }, { "entropy": 5.277842807769775, "epoch": 7.119909054962435, "grad_norm": 1.1328125, "learning_rate": 0.00013755646939478223, "loss": 4.5732, "mean_token_accuracy": 0.26452844589948654, "num_tokens": 164988360.0, "step": 72025 }, { "entropy": 5.275738000869751, "epoch": 7.1204033214709375, "grad_norm": 1.1640625, "learning_rate": 0.00013752853064681646, "loss": 4.636, "mean_token_accuracy": 0.2557831287384033, "num_tokens": 165000437.0, "step": 72030 }, { "entropy": 5.229259777069092, "epoch": 7.120897587979439, "grad_norm": 1.1875, "learning_rate": 0.00013750059528067028, "loss": 4.5683, "mean_token_accuracy": 0.25985143333673477, "num_tokens": 165012674.0, "step": 72035 }, { "entropy": 5.217949056625367, "epoch": 7.12139185448794, "grad_norm": 1.3125, "learning_rate": 0.00013747266329703058, "loss": 4.6058, "mean_token_accuracy": 0.26128001511096954, "num_tokens": 165024854.0, "step": 72040 }, { "entropy": 5.250997638702392, "epoch": 7.121886120996441, "grad_norm": 1.3046875, "learning_rate": 0.00013744473469658487, "loss": 4.5735, "mean_token_accuracy": 0.2584767878055573, "num_tokens": 165035360.0, "step": 72045 }, { "entropy": 5.223712491989136, "epoch": 7.1223803875049425, "grad_norm": 1.203125, "learning_rate": 0.00013741680948001995, "loss": 4.5679, "mean_token_accuracy": 0.2693471148610115, "num_tokens": 165046755.0, "step": 72050 }, { "entropy": 5.2383464813232425, "epoch": 7.122874654013444, "grad_norm": 1.2109375, "learning_rate": 0.00013738888764802288, "loss": 4.5618, "mean_token_accuracy": 0.2687056690454483, "num_tokens": 165057998.0, "step": 72055 }, { "entropy": 5.318402862548828, "epoch": 7.123368920521945, "grad_norm": 1.21875, "learning_rate": 0.00013736096920128062, "loss": 4.6399, "mean_token_accuracy": 0.2579988554120064, "num_tokens": 165070044.0, "step": 72060 }, { "entropy": 5.1892870426177975, "epoch": 7.123863187030447, "grad_norm": 1.171875, "learning_rate": 0.00013733305414047973, "loss": 4.4791, "mean_token_accuracy": 0.27303416579961776, "num_tokens": 165082121.0, "step": 72065 }, { "entropy": 5.217589855194092, "epoch": 7.1243574535389484, "grad_norm": 1.1484375, "learning_rate": 0.0001373051424663071, "loss": 4.5077, "mean_token_accuracy": 0.27399690449237823, "num_tokens": 165092785.0, "step": 72070 }, { "entropy": 5.188831233978272, "epoch": 7.12485172004745, "grad_norm": 1.1953125, "learning_rate": 0.00013727723417944932, "loss": 4.5504, "mean_token_accuracy": 0.2671805158257484, "num_tokens": 165105091.0, "step": 72075 }, { "entropy": 5.297856998443604, "epoch": 7.125345986555951, "grad_norm": 1.296875, "learning_rate": 0.00013724932928059293, "loss": 4.7255, "mean_token_accuracy": 0.2508502811193466, "num_tokens": 165117545.0, "step": 72080 }, { "entropy": 5.25161919593811, "epoch": 7.125840253064452, "grad_norm": 1.2734375, "learning_rate": 0.0001372214277704245, "loss": 4.5557, "mean_token_accuracy": 0.2631839320063591, "num_tokens": 165127818.0, "step": 72085 }, { "entropy": 5.2533212184906, "epoch": 7.1263345195729535, "grad_norm": 1.21875, "learning_rate": 0.00013719352964963022, "loss": 4.5563, "mean_token_accuracy": 0.25898571610450744, "num_tokens": 165138012.0, "step": 72090 }, { "entropy": 5.235877847671508, "epoch": 7.126828786081455, "grad_norm": 1.1953125, "learning_rate": 0.00013716563491889656, "loss": 4.5997, "mean_token_accuracy": 0.25544311851263046, "num_tokens": 165149625.0, "step": 72095 }, { "entropy": 5.226956081390381, "epoch": 7.127323052589957, "grad_norm": 1.25, "learning_rate": 0.0001371377435789096, "loss": 4.5293, "mean_token_accuracy": 0.2655645117163658, "num_tokens": 165160150.0, "step": 72100 }, { "entropy": 5.203387594223022, "epoch": 7.127817319098458, "grad_norm": 1.25, "learning_rate": 0.00013710985563035555, "loss": 4.5436, "mean_token_accuracy": 0.26757327616214754, "num_tokens": 165171777.0, "step": 72105 }, { "entropy": 5.182540655136108, "epoch": 7.128311585606959, "grad_norm": 1.28125, "learning_rate": 0.00013708197107392052, "loss": 4.4978, "mean_token_accuracy": 0.27456005960702895, "num_tokens": 165184048.0, "step": 72110 }, { "entropy": 5.116922330856323, "epoch": 7.128805852115461, "grad_norm": 1.25, "learning_rate": 0.00013705408991029035, "loss": 4.4345, "mean_token_accuracy": 0.28415646255016325, "num_tokens": 165194200.0, "step": 72115 }, { "entropy": 5.2892896175384525, "epoch": 7.129300118623962, "grad_norm": 1.296875, "learning_rate": 0.00013702621214015093, "loss": 4.6806, "mean_token_accuracy": 0.2572543412446976, "num_tokens": 165205119.0, "step": 72120 }, { "entropy": 5.245088148117065, "epoch": 7.129794385132463, "grad_norm": 1.2734375, "learning_rate": 0.0001369983377641882, "loss": 4.5483, "mean_token_accuracy": 0.26876560747623446, "num_tokens": 165216611.0, "step": 72125 }, { "entropy": 5.176000881195068, "epoch": 7.1302886516409645, "grad_norm": 1.234375, "learning_rate": 0.00013697046678308762, "loss": 4.5262, "mean_token_accuracy": 0.2705870419740677, "num_tokens": 165227765.0, "step": 72130 }, { "entropy": 5.2210373878479, "epoch": 7.130782918149466, "grad_norm": 1.15625, "learning_rate": 0.00013694259919753507, "loss": 4.5651, "mean_token_accuracy": 0.27047145962715147, "num_tokens": 165238682.0, "step": 72135 }, { "entropy": 5.260747957229614, "epoch": 7.131277184657968, "grad_norm": 1.2734375, "learning_rate": 0.00013691473500821596, "loss": 4.5552, "mean_token_accuracy": 0.2667283400893211, "num_tokens": 165249993.0, "step": 72140 }, { "entropy": 5.186626434326172, "epoch": 7.131771451166469, "grad_norm": 1.25, "learning_rate": 0.0001368868742158158, "loss": 4.5453, "mean_token_accuracy": 0.2692899078130722, "num_tokens": 165260717.0, "step": 72145 }, { "entropy": 5.273984098434449, "epoch": 7.13226571767497, "grad_norm": 1.109375, "learning_rate": 0.00013685901682102003, "loss": 4.6726, "mean_token_accuracy": 0.2522902384400368, "num_tokens": 165273309.0, "step": 72150 }, { "entropy": 5.202618408203125, "epoch": 7.132759984183472, "grad_norm": 1.1796875, "learning_rate": 0.0001368311628245138, "loss": 4.4646, "mean_token_accuracy": 0.2728942513465881, "num_tokens": 165284205.0, "step": 72155 }, { "entropy": 5.2239092826843265, "epoch": 7.133254250691973, "grad_norm": 1.296875, "learning_rate": 0.0001368033122269824, "loss": 4.602, "mean_token_accuracy": 0.25847853571176527, "num_tokens": 165294998.0, "step": 72160 }, { "entropy": 5.1925149917602536, "epoch": 7.133748517200474, "grad_norm": 1.234375, "learning_rate": 0.00013677546502911093, "loss": 4.5857, "mean_token_accuracy": 0.2597644358873367, "num_tokens": 165307053.0, "step": 72165 }, { "entropy": 5.203592824935913, "epoch": 7.1342427837089755, "grad_norm": 1.2734375, "learning_rate": 0.0001367476212315845, "loss": 4.5714, "mean_token_accuracy": 0.2675389736890793, "num_tokens": 165318429.0, "step": 72170 }, { "entropy": 5.204722738265991, "epoch": 7.134737050217478, "grad_norm": 1.203125, "learning_rate": 0.00013671978083508812, "loss": 4.5427, "mean_token_accuracy": 0.2678633153438568, "num_tokens": 165330019.0, "step": 72175 }, { "entropy": 5.239382028579712, "epoch": 7.135231316725979, "grad_norm": 1.1796875, "learning_rate": 0.00013669194384030648, "loss": 4.5717, "mean_token_accuracy": 0.26887321323156355, "num_tokens": 165342810.0, "step": 72180 }, { "entropy": 5.243732643127442, "epoch": 7.13572558323448, "grad_norm": 1.28125, "learning_rate": 0.00013666411024792447, "loss": 4.5883, "mean_token_accuracy": 0.2637681350111961, "num_tokens": 165354576.0, "step": 72185 }, { "entropy": 5.237450313568115, "epoch": 7.136219849742981, "grad_norm": 1.2578125, "learning_rate": 0.00013663628005862683, "loss": 4.616, "mean_token_accuracy": 0.26002565324306487, "num_tokens": 165365233.0, "step": 72190 }, { "entropy": 5.225467729568481, "epoch": 7.136714116251483, "grad_norm": 1.2265625, "learning_rate": 0.00013660845327309818, "loss": 4.5464, "mean_token_accuracy": 0.2730838179588318, "num_tokens": 165375852.0, "step": 72195 }, { "entropy": 5.266853380203247, "epoch": 7.137208382759984, "grad_norm": 1.1875, "learning_rate": 0.0001365806298920231, "loss": 4.6339, "mean_token_accuracy": 0.25700085908174514, "num_tokens": 165386897.0, "step": 72200 }, { "entropy": 5.201909732818604, "epoch": 7.137702649268485, "grad_norm": 1.1640625, "learning_rate": 0.00013655280991608593, "loss": 4.4949, "mean_token_accuracy": 0.2670079007744789, "num_tokens": 165398356.0, "step": 72205 }, { "entropy": 5.200925302505493, "epoch": 7.138196915776987, "grad_norm": 1.15625, "learning_rate": 0.0001365249933459711, "loss": 4.4959, "mean_token_accuracy": 0.271708719432354, "num_tokens": 165410314.0, "step": 72210 }, { "entropy": 5.217285442352295, "epoch": 7.138691182285489, "grad_norm": 1.2109375, "learning_rate": 0.00013649718018236294, "loss": 4.4963, "mean_token_accuracy": 0.2809522122144699, "num_tokens": 165421327.0, "step": 72215 }, { "entropy": 5.230723142623901, "epoch": 7.13918544879399, "grad_norm": 1.1640625, "learning_rate": 0.00013646937042594565, "loss": 4.5417, "mean_token_accuracy": 0.2649466350674629, "num_tokens": 165432305.0, "step": 72220 }, { "entropy": 5.249471139907837, "epoch": 7.139679715302491, "grad_norm": 1.2890625, "learning_rate": 0.0001364415640774034, "loss": 4.5998, "mean_token_accuracy": 0.26292174458503725, "num_tokens": 165443049.0, "step": 72225 }, { "entropy": 5.307495832443237, "epoch": 7.140173981810992, "grad_norm": 1.2265625, "learning_rate": 0.00013641376113742004, "loss": 4.6609, "mean_token_accuracy": 0.2558453232049942, "num_tokens": 165454536.0, "step": 72230 }, { "entropy": 5.206748342514038, "epoch": 7.140668248319494, "grad_norm": 1.1328125, "learning_rate": 0.00013638596160667972, "loss": 4.5773, "mean_token_accuracy": 0.269932521879673, "num_tokens": 165466553.0, "step": 72235 }, { "entropy": 5.219894313812256, "epoch": 7.141162514827995, "grad_norm": 1.265625, "learning_rate": 0.0001363581654858663, "loss": 4.5578, "mean_token_accuracy": 0.26416256129741666, "num_tokens": 165477691.0, "step": 72240 }, { "entropy": 5.258834934234619, "epoch": 7.141656781336497, "grad_norm": 1.25, "learning_rate": 0.00013633037277566336, "loss": 4.6179, "mean_token_accuracy": 0.2620435327291489, "num_tokens": 165489083.0, "step": 72245 }, { "entropy": 5.188034296035767, "epoch": 7.142151047844998, "grad_norm": 1.4140625, "learning_rate": 0.0001363025834767549, "loss": 4.5066, "mean_token_accuracy": 0.2748950123786926, "num_tokens": 165500285.0, "step": 72250 }, { "entropy": 5.35426697731018, "epoch": 7.1426453143535, "grad_norm": 1.2890625, "learning_rate": 0.00013627479758982435, "loss": 4.6878, "mean_token_accuracy": 0.2603293567895889, "num_tokens": 165512328.0, "step": 72255 }, { "entropy": 5.269150495529175, "epoch": 7.143139580862001, "grad_norm": 1.25, "learning_rate": 0.0001362470151155553, "loss": 4.6487, "mean_token_accuracy": 0.26108930706977845, "num_tokens": 165524194.0, "step": 72260 }, { "entropy": 5.343502712249756, "epoch": 7.143633847370502, "grad_norm": 1.1953125, "learning_rate": 0.0001362192360546313, "loss": 4.6219, "mean_token_accuracy": 0.2579474985599518, "num_tokens": 165536436.0, "step": 72265 }, { "entropy": 5.178237247467041, "epoch": 7.144128113879003, "grad_norm": 1.2578125, "learning_rate": 0.00013619146040773553, "loss": 4.5288, "mean_token_accuracy": 0.27827829122543335, "num_tokens": 165546622.0, "step": 72270 }, { "entropy": 5.267192077636719, "epoch": 7.144622380387505, "grad_norm": 1.21875, "learning_rate": 0.00013616368817555137, "loss": 4.6392, "mean_token_accuracy": 0.25875010192394254, "num_tokens": 165558992.0, "step": 72275 }, { "entropy": 5.254490566253662, "epoch": 7.145116646896007, "grad_norm": 1.3203125, "learning_rate": 0.00013613591935876198, "loss": 4.6186, "mean_token_accuracy": 0.2671040430665016, "num_tokens": 165570265.0, "step": 72280 }, { "entropy": 5.200543832778931, "epoch": 7.145610913404508, "grad_norm": 1.296875, "learning_rate": 0.0001361081539580506, "loss": 4.4955, "mean_token_accuracy": 0.28255932629108427, "num_tokens": 165582057.0, "step": 72285 }, { "entropy": 5.343644094467163, "epoch": 7.146105179913009, "grad_norm": 1.2890625, "learning_rate": 0.0001360803919741002, "loss": 4.7179, "mean_token_accuracy": 0.24833784401416778, "num_tokens": 165593538.0, "step": 72290 }, { "entropy": 5.287099170684814, "epoch": 7.146599446421511, "grad_norm": 1.109375, "learning_rate": 0.00013605263340759363, "loss": 4.6914, "mean_token_accuracy": 0.2576401025056839, "num_tokens": 165606539.0, "step": 72295 }, { "entropy": 5.291143941879272, "epoch": 7.147093712930012, "grad_norm": 1.1640625, "learning_rate": 0.00013602487825921391, "loss": 4.5966, "mean_token_accuracy": 0.2575214296579361, "num_tokens": 165617103.0, "step": 72300 }, { "entropy": 5.2081469058990475, "epoch": 7.147587979438513, "grad_norm": 1.3046875, "learning_rate": 0.0001359971265296436, "loss": 4.5761, "mean_token_accuracy": 0.27347365468740464, "num_tokens": 165627897.0, "step": 72305 }, { "entropy": 5.1805500984191895, "epoch": 7.148082245947014, "grad_norm": 1.2734375, "learning_rate": 0.0001359693782195656, "loss": 4.4138, "mean_token_accuracy": 0.2858818247914314, "num_tokens": 165638646.0, "step": 72310 }, { "entropy": 5.233861494064331, "epoch": 7.148576512455516, "grad_norm": 1.2421875, "learning_rate": 0.00013594163332966258, "loss": 4.6058, "mean_token_accuracy": 0.262856562435627, "num_tokens": 165648797.0, "step": 72315 }, { "entropy": 5.256392860412598, "epoch": 7.149070778964018, "grad_norm": 1.1875, "learning_rate": 0.00013591389186061686, "loss": 4.5926, "mean_token_accuracy": 0.2684378415346146, "num_tokens": 165659376.0, "step": 72320 }, { "entropy": 5.192053174972534, "epoch": 7.149565045472519, "grad_norm": 1.28125, "learning_rate": 0.00013588615381311106, "loss": 4.4807, "mean_token_accuracy": 0.27022709250450133, "num_tokens": 165670887.0, "step": 72325 }, { "entropy": 5.180035829544067, "epoch": 7.15005931198102, "grad_norm": 1.2578125, "learning_rate": 0.00013585841918782737, "loss": 4.5059, "mean_token_accuracy": 0.27675541639328005, "num_tokens": 165682705.0, "step": 72330 }, { "entropy": 5.298252773284912, "epoch": 7.1505535784895216, "grad_norm": 1.1328125, "learning_rate": 0.00013583068798544808, "loss": 4.6318, "mean_token_accuracy": 0.2582854270935059, "num_tokens": 165693884.0, "step": 72335 }, { "entropy": 5.270016050338745, "epoch": 7.151047844998023, "grad_norm": 1.1484375, "learning_rate": 0.0001358029602066556, "loss": 4.5695, "mean_token_accuracy": 0.2614916995167732, "num_tokens": 165705472.0, "step": 72340 }, { "entropy": 5.228486204147339, "epoch": 7.151542111506524, "grad_norm": 1.2421875, "learning_rate": 0.00013577523585213183, "loss": 4.5905, "mean_token_accuracy": 0.26791792213916776, "num_tokens": 165716468.0, "step": 72345 }, { "entropy": 5.181593561172486, "epoch": 7.152036378015025, "grad_norm": 1.203125, "learning_rate": 0.00013574751492255894, "loss": 4.4374, "mean_token_accuracy": 0.2725419610738754, "num_tokens": 165727371.0, "step": 72350 }, { "entropy": 5.213720607757568, "epoch": 7.1525306445235275, "grad_norm": 1.3125, "learning_rate": 0.0001357197974186187, "loss": 4.5404, "mean_token_accuracy": 0.2686536341905594, "num_tokens": 165739025.0, "step": 72355 }, { "entropy": 5.205567979812622, "epoch": 7.153024911032029, "grad_norm": 1.1640625, "learning_rate": 0.00013569208334099304, "loss": 4.5196, "mean_token_accuracy": 0.2677148669958115, "num_tokens": 165750158.0, "step": 72360 }, { "entropy": 5.260539150238037, "epoch": 7.15351917754053, "grad_norm": 1.1953125, "learning_rate": 0.00013566437269036375, "loss": 4.5406, "mean_token_accuracy": 0.26376636028289796, "num_tokens": 165761593.0, "step": 72365 }, { "entropy": 5.178363275527954, "epoch": 7.154013444049031, "grad_norm": 1.21875, "learning_rate": 0.00013563666546741255, "loss": 4.5466, "mean_token_accuracy": 0.26756303310394286, "num_tokens": 165772756.0, "step": 72370 }, { "entropy": 5.236805820465088, "epoch": 7.1545077105575325, "grad_norm": 1.2265625, "learning_rate": 0.000135608961672821, "loss": 4.5454, "mean_token_accuracy": 0.26674467921257017, "num_tokens": 165782935.0, "step": 72375 }, { "entropy": 5.209905338287354, "epoch": 7.155001977066034, "grad_norm": 1.1796875, "learning_rate": 0.00013558126130727057, "loss": 4.5691, "mean_token_accuracy": 0.262679722905159, "num_tokens": 165794948.0, "step": 72380 }, { "entropy": 5.274826383590698, "epoch": 7.155496243574535, "grad_norm": 1.25, "learning_rate": 0.00013555356437144276, "loss": 4.6337, "mean_token_accuracy": 0.2564357116818428, "num_tokens": 165807696.0, "step": 72385 }, { "entropy": 5.189210844039917, "epoch": 7.155990510083036, "grad_norm": 1.2421875, "learning_rate": 0.0001355258708660189, "loss": 4.5392, "mean_token_accuracy": 0.2697652027010918, "num_tokens": 165819276.0, "step": 72390 }, { "entropy": 5.2458141326904295, "epoch": 7.1564847765915385, "grad_norm": 1.125, "learning_rate": 0.00013549818079168022, "loss": 4.5703, "mean_token_accuracy": 0.2691307798027992, "num_tokens": 165831353.0, "step": 72395 }, { "entropy": 5.305114126205444, "epoch": 7.15697904310004, "grad_norm": 1.171875, "learning_rate": 0.00013547049414910806, "loss": 4.679, "mean_token_accuracy": 0.25081515610218047, "num_tokens": 165842480.0, "step": 72400 }, { "entropy": 5.210163211822509, "epoch": 7.157473309608541, "grad_norm": 1.234375, "learning_rate": 0.00013544281093898325, "loss": 4.5665, "mean_token_accuracy": 0.26532870829105376, "num_tokens": 165854185.0, "step": 72405 }, { "entropy": 5.2789100170135494, "epoch": 7.157967576117042, "grad_norm": 1.15625, "learning_rate": 0.000135415131161987, "loss": 4.6734, "mean_token_accuracy": 0.2558357611298561, "num_tokens": 165864694.0, "step": 72410 }, { "entropy": 5.171991777420044, "epoch": 7.1584618426255435, "grad_norm": 1.1796875, "learning_rate": 0.0001353874548188002, "loss": 4.5162, "mean_token_accuracy": 0.26895706355571747, "num_tokens": 165875761.0, "step": 72415 }, { "entropy": 5.258867406845093, "epoch": 7.158956109134045, "grad_norm": 1.234375, "learning_rate": 0.00013535978191010358, "loss": 4.5619, "mean_token_accuracy": 0.27725060284137726, "num_tokens": 165886793.0, "step": 72420 }, { "entropy": 5.219963407516479, "epoch": 7.159450375642546, "grad_norm": 1.390625, "learning_rate": 0.0001353321124365781, "loss": 4.4954, "mean_token_accuracy": 0.27183170467615125, "num_tokens": 165897510.0, "step": 72425 }, { "entropy": 5.245527505874634, "epoch": 7.159944642151048, "grad_norm": 1.265625, "learning_rate": 0.00013530444639890427, "loss": 4.5929, "mean_token_accuracy": 0.261257691681385, "num_tokens": 165909074.0, "step": 72430 }, { "entropy": 5.297716569900513, "epoch": 7.1604389086595495, "grad_norm": 1.25, "learning_rate": 0.0001352767837977627, "loss": 4.6136, "mean_token_accuracy": 0.2591108620166779, "num_tokens": 165920756.0, "step": 72435 }, { "entropy": 5.277444553375244, "epoch": 7.160933175168051, "grad_norm": 1.21875, "learning_rate": 0.000135249124633834, "loss": 4.6489, "mean_token_accuracy": 0.25717261135578157, "num_tokens": 165933556.0, "step": 72440 }, { "entropy": 5.241970348358154, "epoch": 7.161427441676552, "grad_norm": 1.2109375, "learning_rate": 0.00013522146890779845, "loss": 4.6139, "mean_token_accuracy": 0.2574555829167366, "num_tokens": 165945862.0, "step": 72445 }, { "entropy": 5.228554534912109, "epoch": 7.161921708185053, "grad_norm": 1.3046875, "learning_rate": 0.00013519381662033646, "loss": 4.5831, "mean_token_accuracy": 0.2685488983988762, "num_tokens": 165955476.0, "step": 72450 }, { "entropy": 5.248607397079468, "epoch": 7.1624159746935545, "grad_norm": 1.1484375, "learning_rate": 0.0001351661677721283, "loss": 4.6347, "mean_token_accuracy": 0.25922604352235795, "num_tokens": 165966494.0, "step": 72455 }, { "entropy": 5.281346607208252, "epoch": 7.162910241202056, "grad_norm": 1.2734375, "learning_rate": 0.00013513852236385406, "loss": 4.6179, "mean_token_accuracy": 0.26255235224962237, "num_tokens": 165977259.0, "step": 72460 }, { "entropy": 5.190829753875732, "epoch": 7.163404507710558, "grad_norm": 1.2578125, "learning_rate": 0.00013511088039619396, "loss": 4.5016, "mean_token_accuracy": 0.2732624426484108, "num_tokens": 165987897.0, "step": 72465 }, { "entropy": 5.2546319484710695, "epoch": 7.163898774219059, "grad_norm": 1.21875, "learning_rate": 0.0001350832418698278, "loss": 4.5639, "mean_token_accuracy": 0.26150157004594804, "num_tokens": 165998390.0, "step": 72470 }, { "entropy": 5.221645736694336, "epoch": 7.1643930407275604, "grad_norm": 1.203125, "learning_rate": 0.00013505560678543565, "loss": 4.5523, "mean_token_accuracy": 0.2612583875656128, "num_tokens": 166010321.0, "step": 72475 }, { "entropy": 5.198021697998047, "epoch": 7.164887307236062, "grad_norm": 1.3046875, "learning_rate": 0.00013502797514369726, "loss": 4.4647, "mean_token_accuracy": 0.27948758006095886, "num_tokens": 166021022.0, "step": 72480 }, { "entropy": 5.324129867553711, "epoch": 7.165381573744563, "grad_norm": 1.140625, "learning_rate": 0.0001350003469452924, "loss": 4.6486, "mean_token_accuracy": 0.2563357979059219, "num_tokens": 166033398.0, "step": 72485 }, { "entropy": 5.318331480026245, "epoch": 7.165875840253064, "grad_norm": 1.234375, "learning_rate": 0.00013497272219090077, "loss": 4.6126, "mean_token_accuracy": 0.26365801095962527, "num_tokens": 166043795.0, "step": 72490 }, { "entropy": 5.234380531311035, "epoch": 7.1663701067615655, "grad_norm": 1.2734375, "learning_rate": 0.00013494510088120183, "loss": 4.5995, "mean_token_accuracy": 0.2605686172842979, "num_tokens": 166055109.0, "step": 72495 }, { "entropy": 5.232448863983154, "epoch": 7.166864373270068, "grad_norm": 1.203125, "learning_rate": 0.00013491748301687516, "loss": 4.5625, "mean_token_accuracy": 0.2609627664089203, "num_tokens": 166066806.0, "step": 72500 }, { "entropy": 5.248542404174804, "epoch": 7.167358639778569, "grad_norm": 1.1484375, "learning_rate": 0.0001348898685986002, "loss": 4.5482, "mean_token_accuracy": 0.26748569011688234, "num_tokens": 166079134.0, "step": 72505 }, { "entropy": 5.2271871089935305, "epoch": 7.16785290628707, "grad_norm": 1.1328125, "learning_rate": 0.00013486225762705602, "loss": 4.6263, "mean_token_accuracy": 0.2649024292826653, "num_tokens": 166091532.0, "step": 72510 }, { "entropy": 5.205515336990357, "epoch": 7.168347172795571, "grad_norm": 1.203125, "learning_rate": 0.00013483465010292225, "loss": 4.5615, "mean_token_accuracy": 0.2662923723459244, "num_tokens": 166102370.0, "step": 72515 }, { "entropy": 5.272062826156616, "epoch": 7.168841439304073, "grad_norm": 1.078125, "learning_rate": 0.00013480704602687776, "loss": 4.678, "mean_token_accuracy": 0.26005285382270815, "num_tokens": 166115951.0, "step": 72520 }, { "entropy": 5.201153802871704, "epoch": 7.169335705812574, "grad_norm": 1.03125, "learning_rate": 0.00013477944539960166, "loss": 4.5368, "mean_token_accuracy": 0.26894662380218504, "num_tokens": 166128620.0, "step": 72525 }, { "entropy": 5.116938543319702, "epoch": 7.169829972321075, "grad_norm": 1.2734375, "learning_rate": 0.00013475184822177305, "loss": 4.4875, "mean_token_accuracy": 0.2823182761669159, "num_tokens": 166141189.0, "step": 72530 }, { "entropy": 5.270979690551758, "epoch": 7.1703242388295765, "grad_norm": 1.1640625, "learning_rate": 0.00013472425449407056, "loss": 4.6571, "mean_token_accuracy": 0.25324312448501585, "num_tokens": 166154128.0, "step": 72535 }, { "entropy": 5.257235717773438, "epoch": 7.170818505338079, "grad_norm": 1.15625, "learning_rate": 0.00013469666421717333, "loss": 4.5978, "mean_token_accuracy": 0.2684885039925575, "num_tokens": 166166914.0, "step": 72540 }, { "entropy": 5.312307214736938, "epoch": 7.17131277184658, "grad_norm": 1.2265625, "learning_rate": 0.00013466907739175988, "loss": 4.6387, "mean_token_accuracy": 0.26222037672996523, "num_tokens": 166179339.0, "step": 72545 }, { "entropy": 5.29864239692688, "epoch": 7.171807038355081, "grad_norm": 1.09375, "learning_rate": 0.00013464149401850884, "loss": 4.6191, "mean_token_accuracy": 0.25961288511753083, "num_tokens": 166191837.0, "step": 72550 }, { "entropy": 5.256187152862549, "epoch": 7.172301304863582, "grad_norm": 1.3046875, "learning_rate": 0.00013461391409809892, "loss": 4.5126, "mean_token_accuracy": 0.27102297097444533, "num_tokens": 166202845.0, "step": 72555 }, { "entropy": 5.192804145812988, "epoch": 7.172795571372084, "grad_norm": 1.328125, "learning_rate": 0.00013458633763120843, "loss": 4.4698, "mean_token_accuracy": 0.27674455344676974, "num_tokens": 166213753.0, "step": 72560 }, { "entropy": 5.2523377418518065, "epoch": 7.173289837880585, "grad_norm": 1.1953125, "learning_rate": 0.00013455876461851578, "loss": 4.6464, "mean_token_accuracy": 0.2542277157306671, "num_tokens": 166225720.0, "step": 72565 }, { "entropy": 5.198331832885742, "epoch": 7.173784104389086, "grad_norm": 1.1796875, "learning_rate": 0.00013453119506069938, "loss": 4.5994, "mean_token_accuracy": 0.2617307618260384, "num_tokens": 166237552.0, "step": 72570 }, { "entropy": 5.246084594726563, "epoch": 7.174278370897588, "grad_norm": 1.171875, "learning_rate": 0.00013450362895843732, "loss": 4.6021, "mean_token_accuracy": 0.26395268738269806, "num_tokens": 166248235.0, "step": 72575 }, { "entropy": 5.255450868606568, "epoch": 7.17477263740609, "grad_norm": 1.234375, "learning_rate": 0.00013447606631240787, "loss": 4.5708, "mean_token_accuracy": 0.26682600677013396, "num_tokens": 166259875.0, "step": 72580 }, { "entropy": 5.281848907470703, "epoch": 7.175266903914591, "grad_norm": 1.296875, "learning_rate": 0.00013444850712328893, "loss": 4.5906, "mean_token_accuracy": 0.26625192910432816, "num_tokens": 166271197.0, "step": 72585 }, { "entropy": 5.3003771781921385, "epoch": 7.175761170423092, "grad_norm": 1.2421875, "learning_rate": 0.00013442095139175848, "loss": 4.6712, "mean_token_accuracy": 0.2572226941585541, "num_tokens": 166284967.0, "step": 72590 }, { "entropy": 5.177092027664185, "epoch": 7.176255436931593, "grad_norm": 1.09375, "learning_rate": 0.00013439339911849445, "loss": 4.4931, "mean_token_accuracy": 0.26553059220314024, "num_tokens": 166296797.0, "step": 72595 }, { "entropy": 5.254039859771728, "epoch": 7.176749703440095, "grad_norm": 1.234375, "learning_rate": 0.00013436585030417465, "loss": 4.589, "mean_token_accuracy": 0.2569948360323906, "num_tokens": 166308009.0, "step": 72600 }, { "entropy": 5.249963092803955, "epoch": 7.177243969948596, "grad_norm": 1.125, "learning_rate": 0.0001343383049494768, "loss": 4.6539, "mean_token_accuracy": 0.25672346353530884, "num_tokens": 166320770.0, "step": 72605 }, { "entropy": 5.158482408523559, "epoch": 7.177738236457098, "grad_norm": 1.3203125, "learning_rate": 0.00013431076305507839, "loss": 4.483, "mean_token_accuracy": 0.2648593202233315, "num_tokens": 166331474.0, "step": 72610 }, { "entropy": 5.185658502578735, "epoch": 7.178232502965599, "grad_norm": 1.21875, "learning_rate": 0.00013428322462165704, "loss": 4.5345, "mean_token_accuracy": 0.26982725858688356, "num_tokens": 166341906.0, "step": 72615 }, { "entropy": 5.231781816482544, "epoch": 7.178726769474101, "grad_norm": 1.21875, "learning_rate": 0.00013425568964989026, "loss": 4.545, "mean_token_accuracy": 0.26942568868398664, "num_tokens": 166353010.0, "step": 72620 }, { "entropy": 5.190604209899902, "epoch": 7.179221035982602, "grad_norm": 1.140625, "learning_rate": 0.0001342281581404552, "loss": 4.4791, "mean_token_accuracy": 0.27586512118577955, "num_tokens": 166363335.0, "step": 72625 }, { "entropy": 5.179300212860108, "epoch": 7.179715302491103, "grad_norm": 1.3125, "learning_rate": 0.00013420063009402948, "loss": 4.5125, "mean_token_accuracy": 0.27439243495464327, "num_tokens": 166373711.0, "step": 72630 }, { "entropy": 5.187936687469483, "epoch": 7.180209568999604, "grad_norm": 1.3203125, "learning_rate": 0.00013417310551128996, "loss": 4.523, "mean_token_accuracy": 0.26778263598680496, "num_tokens": 166383755.0, "step": 72635 }, { "entropy": 5.2461676597595215, "epoch": 7.180703835508106, "grad_norm": 1.2265625, "learning_rate": 0.00013414558439291393, "loss": 4.602, "mean_token_accuracy": 0.2601626142859459, "num_tokens": 166394680.0, "step": 72640 }, { "entropy": 5.275779581069946, "epoch": 7.181198102016607, "grad_norm": 1.2421875, "learning_rate": 0.00013411806673957846, "loss": 4.593, "mean_token_accuracy": 0.2570180743932724, "num_tokens": 166406823.0, "step": 72645 }, { "entropy": 5.286922264099121, "epoch": 7.181692368525109, "grad_norm": 1.265625, "learning_rate": 0.00013409055255196028, "loss": 4.6722, "mean_token_accuracy": 0.2557386294007301, "num_tokens": 166417875.0, "step": 72650 }, { "entropy": 5.265910911560058, "epoch": 7.18218663503361, "grad_norm": 1.1953125, "learning_rate": 0.00013406304183073643, "loss": 4.6253, "mean_token_accuracy": 0.265448959171772, "num_tokens": 166429814.0, "step": 72655 }, { "entropy": 5.258770847320557, "epoch": 7.182680901542112, "grad_norm": 1.3125, "learning_rate": 0.00013403553457658356, "loss": 4.619, "mean_token_accuracy": 0.26136030107736585, "num_tokens": 166441731.0, "step": 72660 }, { "entropy": 5.266407632827759, "epoch": 7.183175168050613, "grad_norm": 1.125, "learning_rate": 0.00013400803079017845, "loss": 4.5805, "mean_token_accuracy": 0.2679535448551178, "num_tokens": 166453597.0, "step": 72665 }, { "entropy": 5.261090898513794, "epoch": 7.183669434559114, "grad_norm": 1.171875, "learning_rate": 0.00013398053047219773, "loss": 4.5777, "mean_token_accuracy": 0.2632423862814903, "num_tokens": 166464124.0, "step": 72670 }, { "entropy": 5.201225852966308, "epoch": 7.184163701067615, "grad_norm": 1.2421875, "learning_rate": 0.00013395303362331772, "loss": 4.5333, "mean_token_accuracy": 0.2636557877063751, "num_tokens": 166475756.0, "step": 72675 }, { "entropy": 5.267105484008789, "epoch": 7.184657967576117, "grad_norm": 1.28125, "learning_rate": 0.00013392554024421502, "loss": 4.6211, "mean_token_accuracy": 0.2601493179798126, "num_tokens": 166487001.0, "step": 72680 }, { "entropy": 5.283317899703979, "epoch": 7.185152234084619, "grad_norm": 1.2578125, "learning_rate": 0.0001338980503355659, "loss": 4.631, "mean_token_accuracy": 0.25977807193994523, "num_tokens": 166497468.0, "step": 72685 }, { "entropy": 5.221608257293701, "epoch": 7.18564650059312, "grad_norm": 1.1328125, "learning_rate": 0.0001338705638980466, "loss": 4.5031, "mean_token_accuracy": 0.2698334664106369, "num_tokens": 166508849.0, "step": 72690 }, { "entropy": 5.210900974273682, "epoch": 7.186140767101621, "grad_norm": 1.2890625, "learning_rate": 0.00013384308093233343, "loss": 4.4815, "mean_token_accuracy": 0.2744209811091423, "num_tokens": 166519763.0, "step": 72695 }, { "entropy": 5.323252487182617, "epoch": 7.186635033610123, "grad_norm": 1.0859375, "learning_rate": 0.00013381560143910226, "loss": 4.6825, "mean_token_accuracy": 0.25064889788627626, "num_tokens": 166532095.0, "step": 72700 }, { "entropy": 5.2638591766357425, "epoch": 7.187129300118624, "grad_norm": 1.140625, "learning_rate": 0.00013378812541902925, "loss": 4.5907, "mean_token_accuracy": 0.2615368962287903, "num_tokens": 166544492.0, "step": 72705 }, { "entropy": 5.248548221588135, "epoch": 7.187623566627125, "grad_norm": 1.234375, "learning_rate": 0.00013376065287279022, "loss": 4.5788, "mean_token_accuracy": 0.2683051824569702, "num_tokens": 166557389.0, "step": 72710 }, { "entropy": 5.113793849945068, "epoch": 7.188117833135626, "grad_norm": 1.2578125, "learning_rate": 0.00013373318380106104, "loss": 4.4044, "mean_token_accuracy": 0.2884927108883858, "num_tokens": 166568829.0, "step": 72715 }, { "entropy": 5.196144151687622, "epoch": 7.1886120996441285, "grad_norm": 1.390625, "learning_rate": 0.00013370571820451755, "loss": 4.5586, "mean_token_accuracy": 0.2595695525407791, "num_tokens": 166580788.0, "step": 72720 }, { "entropy": 5.267319631576538, "epoch": 7.18910636615263, "grad_norm": 1.1015625, "learning_rate": 0.0001336782560838352, "loss": 4.6802, "mean_token_accuracy": 0.2577229723334312, "num_tokens": 166593334.0, "step": 72725 }, { "entropy": 5.261934518814087, "epoch": 7.189600632661131, "grad_norm": 1.234375, "learning_rate": 0.00013365079743968972, "loss": 4.5702, "mean_token_accuracy": 0.26627649664878844, "num_tokens": 166604489.0, "step": 72730 }, { "entropy": 5.1901885032653805, "epoch": 7.190094899169632, "grad_norm": 1.4609375, "learning_rate": 0.00013362334227275664, "loss": 4.5878, "mean_token_accuracy": 0.26942280381917955, "num_tokens": 166615303.0, "step": 72735 }, { "entropy": 5.269240808486939, "epoch": 7.1905891656781336, "grad_norm": 1.25, "learning_rate": 0.00013359589058371108, "loss": 4.6199, "mean_token_accuracy": 0.26470881551504133, "num_tokens": 166626933.0, "step": 72740 }, { "entropy": 5.2304778575897215, "epoch": 7.191083432186635, "grad_norm": 1.25, "learning_rate": 0.00013356844237322868, "loss": 4.5928, "mean_token_accuracy": 0.2638829112052917, "num_tokens": 166638772.0, "step": 72745 }, { "entropy": 5.278485488891602, "epoch": 7.191577698695136, "grad_norm": 1.125, "learning_rate": 0.0001335409976419845, "loss": 4.6348, "mean_token_accuracy": 0.2669594347476959, "num_tokens": 166650873.0, "step": 72750 }, { "entropy": 5.257099056243897, "epoch": 7.192071965203638, "grad_norm": 1.21875, "learning_rate": 0.00013351355639065372, "loss": 4.6021, "mean_token_accuracy": 0.26030790209770205, "num_tokens": 166662082.0, "step": 72755 }, { "entropy": 5.20704345703125, "epoch": 7.1925662317121395, "grad_norm": 1.2265625, "learning_rate": 0.0001334861186199115, "loss": 4.5519, "mean_token_accuracy": 0.26145263761281967, "num_tokens": 166672509.0, "step": 72760 }, { "entropy": 5.140776252746582, "epoch": 7.193060498220641, "grad_norm": 1.0546875, "learning_rate": 0.0001334586843304326, "loss": 4.5193, "mean_token_accuracy": 0.2727113112807274, "num_tokens": 166685113.0, "step": 72765 }, { "entropy": 5.143934679031372, "epoch": 7.193554764729142, "grad_norm": 1.265625, "learning_rate": 0.00013343125352289204, "loss": 4.494, "mean_token_accuracy": 0.2738099470734596, "num_tokens": 166696372.0, "step": 72770 }, { "entropy": 5.243125629425049, "epoch": 7.194049031237643, "grad_norm": 1.2890625, "learning_rate": 0.0001334038261979646, "loss": 4.5835, "mean_token_accuracy": 0.265619720518589, "num_tokens": 166706980.0, "step": 72775 }, { "entropy": 5.260910511016846, "epoch": 7.1945432977461445, "grad_norm": 1.390625, "learning_rate": 0.00013337640235632503, "loss": 4.6322, "mean_token_accuracy": 0.2585563451051712, "num_tokens": 166718417.0, "step": 72780 }, { "entropy": 5.322440958023071, "epoch": 7.195037564254646, "grad_norm": 1.265625, "learning_rate": 0.000133348981998648, "loss": 4.642, "mean_token_accuracy": 0.2537790209054947, "num_tokens": 166729837.0, "step": 72785 }, { "entropy": 5.237201261520386, "epoch": 7.195531830763147, "grad_norm": 1.25, "learning_rate": 0.00013332156512560787, "loss": 4.5709, "mean_token_accuracy": 0.26138331890106203, "num_tokens": 166740915.0, "step": 72790 }, { "entropy": 5.261670780181885, "epoch": 7.196026097271649, "grad_norm": 1.1796875, "learning_rate": 0.0001332941517378793, "loss": 4.6081, "mean_token_accuracy": 0.2650693327188492, "num_tokens": 166752415.0, "step": 72795 }, { "entropy": 5.28111777305603, "epoch": 7.1965203637801505, "grad_norm": 1.203125, "learning_rate": 0.00013326674183613646, "loss": 4.5889, "mean_token_accuracy": 0.26319972723722457, "num_tokens": 166763393.0, "step": 72800 }, { "entropy": 5.1668846130371096, "epoch": 7.197014630288652, "grad_norm": 1.2578125, "learning_rate": 0.00013323933542105384, "loss": 4.4608, "mean_token_accuracy": 0.2730237677693367, "num_tokens": 166774261.0, "step": 72805 }, { "entropy": 5.2623560428619385, "epoch": 7.197508896797153, "grad_norm": 1.3046875, "learning_rate": 0.00013321193249330563, "loss": 4.5517, "mean_token_accuracy": 0.262530529499054, "num_tokens": 166785420.0, "step": 72810 }, { "entropy": 5.169373798370361, "epoch": 7.198003163305654, "grad_norm": 1.21875, "learning_rate": 0.00013318453305356578, "loss": 4.4724, "mean_token_accuracy": 0.2719513952732086, "num_tokens": 166796151.0, "step": 72815 }, { "entropy": 5.185817384719849, "epoch": 7.1984974298141555, "grad_norm": 1.203125, "learning_rate": 0.00013315713710250848, "loss": 4.5326, "mean_token_accuracy": 0.2669800892472267, "num_tokens": 166807747.0, "step": 72820 }, { "entropy": 5.286767244338989, "epoch": 7.198991696322657, "grad_norm": 1.15625, "learning_rate": 0.00013312974464080757, "loss": 4.6593, "mean_token_accuracy": 0.2590918928384781, "num_tokens": 166820385.0, "step": 72825 }, { "entropy": 5.297396612167359, "epoch": 7.199485962831159, "grad_norm": 1.2578125, "learning_rate": 0.00013310235566913695, "loss": 4.5968, "mean_token_accuracy": 0.26032144129276275, "num_tokens": 166832207.0, "step": 72830 }, { "entropy": 5.246461200714111, "epoch": 7.19998022933966, "grad_norm": 1.4609375, "learning_rate": 0.0001330749701881704, "loss": 4.5726, "mean_token_accuracy": 0.26352973878383634, "num_tokens": 166842612.0, "step": 72835 }, { "entropy": 5.16873836517334, "epoch": 7.2004744958481615, "grad_norm": 1.2734375, "learning_rate": 0.0001330475881985816, "loss": 4.4501, "mean_token_accuracy": 0.2794951945543289, "num_tokens": 166853648.0, "step": 72840 }, { "entropy": 5.155920362472534, "epoch": 7.200968762356663, "grad_norm": 1.2109375, "learning_rate": 0.0001330202097010442, "loss": 4.4973, "mean_token_accuracy": 0.27501361072063446, "num_tokens": 166864435.0, "step": 72845 }, { "entropy": 5.297272682189941, "epoch": 7.201463028865164, "grad_norm": 1.3984375, "learning_rate": 0.00013299283469623164, "loss": 4.5835, "mean_token_accuracy": 0.26037170439958573, "num_tokens": 166873737.0, "step": 72850 }, { "entropy": 5.229653787612915, "epoch": 7.201957295373665, "grad_norm": 1.203125, "learning_rate": 0.00013296546318481732, "loss": 4.5678, "mean_token_accuracy": 0.2643310636281967, "num_tokens": 166885370.0, "step": 72855 }, { "entropy": 5.210465049743652, "epoch": 7.2024515618821665, "grad_norm": 1.1953125, "learning_rate": 0.00013293809516747468, "loss": 4.6173, "mean_token_accuracy": 0.2604697197675705, "num_tokens": 166898032.0, "step": 72860 }, { "entropy": 5.205984735488892, "epoch": 7.202945828390669, "grad_norm": 1.2265625, "learning_rate": 0.0001329107306448769, "loss": 4.58, "mean_token_accuracy": 0.26390489637851716, "num_tokens": 166909555.0, "step": 72865 }, { "entropy": 5.14014368057251, "epoch": 7.20344009489917, "grad_norm": 1.203125, "learning_rate": 0.00013288336961769732, "loss": 4.4959, "mean_token_accuracy": 0.27105377316474916, "num_tokens": 166920174.0, "step": 72870 }, { "entropy": 5.298761892318725, "epoch": 7.203934361407671, "grad_norm": 1.203125, "learning_rate": 0.00013285601208660875, "loss": 4.6034, "mean_token_accuracy": 0.2592348501086235, "num_tokens": 166931327.0, "step": 72875 }, { "entropy": 5.349287366867065, "epoch": 7.2044286279161724, "grad_norm": 1.265625, "learning_rate": 0.00013282865805228439, "loss": 4.7225, "mean_token_accuracy": 0.25213100463151933, "num_tokens": 166943305.0, "step": 72880 }, { "entropy": 5.175415182113648, "epoch": 7.204922894424674, "grad_norm": 1.1953125, "learning_rate": 0.0001328013075153971, "loss": 4.4577, "mean_token_accuracy": 0.27478580474853515, "num_tokens": 166954226.0, "step": 72885 }, { "entropy": 5.245415687561035, "epoch": 7.205417160933175, "grad_norm": 1.2265625, "learning_rate": 0.00013277396047661966, "loss": 4.5687, "mean_token_accuracy": 0.2640933871269226, "num_tokens": 166965286.0, "step": 72890 }, { "entropy": 5.178502750396729, "epoch": 7.205911427441676, "grad_norm": 1.125, "learning_rate": 0.00013274661693662496, "loss": 4.4936, "mean_token_accuracy": 0.2722720891237259, "num_tokens": 166976815.0, "step": 72895 }, { "entropy": 5.194439363479614, "epoch": 7.2064056939501775, "grad_norm": 1.15625, "learning_rate": 0.0001327192768960855, "loss": 4.5373, "mean_token_accuracy": 0.2750080436468124, "num_tokens": 166989439.0, "step": 72900 }, { "entropy": 5.213884401321411, "epoch": 7.20689996045868, "grad_norm": 1.3359375, "learning_rate": 0.00013269194035567383, "loss": 4.5066, "mean_token_accuracy": 0.2726485043764114, "num_tokens": 166999360.0, "step": 72905 }, { "entropy": 5.279223299026489, "epoch": 7.207394226967181, "grad_norm": 1.265625, "learning_rate": 0.00013266460731606268, "loss": 4.5952, "mean_token_accuracy": 0.26366153359413147, "num_tokens": 167011516.0, "step": 72910 }, { "entropy": 5.168355655670166, "epoch": 7.207888493475682, "grad_norm": 1.234375, "learning_rate": 0.00013263727777792405, "loss": 4.4659, "mean_token_accuracy": 0.27928419411182404, "num_tokens": 167022337.0, "step": 72915 }, { "entropy": 5.21114821434021, "epoch": 7.208382759984183, "grad_norm": 1.2578125, "learning_rate": 0.00013260995174193063, "loss": 4.6083, "mean_token_accuracy": 0.2581733912229538, "num_tokens": 167034362.0, "step": 72920 }, { "entropy": 5.163778591156006, "epoch": 7.208877026492685, "grad_norm": 1.359375, "learning_rate": 0.00013258262920875442, "loss": 4.5565, "mean_token_accuracy": 0.26867698729038236, "num_tokens": 167046644.0, "step": 72925 }, { "entropy": 5.334694671630859, "epoch": 7.209371293001186, "grad_norm": 1.1171875, "learning_rate": 0.00013255531017906765, "loss": 4.6605, "mean_token_accuracy": 0.2565318256616592, "num_tokens": 167058853.0, "step": 72930 }, { "entropy": 5.254194545745849, "epoch": 7.209865559509687, "grad_norm": 1.25, "learning_rate": 0.00013252799465354238, "loss": 4.6218, "mean_token_accuracy": 0.26387107372283936, "num_tokens": 167071147.0, "step": 72935 }, { "entropy": 5.187828874588012, "epoch": 7.210359826018189, "grad_norm": 1.0546875, "learning_rate": 0.00013250068263285047, "loss": 4.4893, "mean_token_accuracy": 0.2710354536771774, "num_tokens": 167083138.0, "step": 72940 }, { "entropy": 5.24162917137146, "epoch": 7.210854092526691, "grad_norm": 1.1328125, "learning_rate": 0.0001324733741176639, "loss": 4.594, "mean_token_accuracy": 0.2631880655884743, "num_tokens": 167095179.0, "step": 72945 }, { "entropy": 5.175483131408692, "epoch": 7.211348359035192, "grad_norm": 1.4453125, "learning_rate": 0.0001324460691086544, "loss": 4.5189, "mean_token_accuracy": 0.2763614356517792, "num_tokens": 167106882.0, "step": 72950 }, { "entropy": 5.261891222000122, "epoch": 7.211842625543693, "grad_norm": 1.3046875, "learning_rate": 0.0001324187676064938, "loss": 4.5426, "mean_token_accuracy": 0.26626995801925657, "num_tokens": 167117569.0, "step": 72955 }, { "entropy": 5.249162244796753, "epoch": 7.212336892052194, "grad_norm": 1.296875, "learning_rate": 0.00013239146961185368, "loss": 4.6269, "mean_token_accuracy": 0.2656628772616386, "num_tokens": 167128340.0, "step": 72960 }, { "entropy": 5.214911222457886, "epoch": 7.212831158560696, "grad_norm": 1.25, "learning_rate": 0.00013236417512540538, "loss": 4.5781, "mean_token_accuracy": 0.25947528928518293, "num_tokens": 167140194.0, "step": 72965 }, { "entropy": 5.224620342254639, "epoch": 7.213325425069197, "grad_norm": 1.1484375, "learning_rate": 0.0001323368841478206, "loss": 4.6514, "mean_token_accuracy": 0.25978906750679015, "num_tokens": 167152131.0, "step": 72970 }, { "entropy": 5.2741881847381595, "epoch": 7.213819691577699, "grad_norm": 1.203125, "learning_rate": 0.00013230959667977056, "loss": 4.6644, "mean_token_accuracy": 0.25156762450933456, "num_tokens": 167164038.0, "step": 72975 }, { "entropy": 5.220080709457397, "epoch": 7.2143139580862, "grad_norm": 1.1640625, "learning_rate": 0.00013228231272192654, "loss": 4.5177, "mean_token_accuracy": 0.26753776967525483, "num_tokens": 167175387.0, "step": 72980 }, { "entropy": 5.232532405853272, "epoch": 7.214808224594702, "grad_norm": 1.2890625, "learning_rate": 0.00013225503227495987, "loss": 4.6029, "mean_token_accuracy": 0.25825531780719757, "num_tokens": 167186692.0, "step": 72985 }, { "entropy": 5.242570972442627, "epoch": 7.215302491103203, "grad_norm": 1.1875, "learning_rate": 0.0001322277553395415, "loss": 4.5895, "mean_token_accuracy": 0.262031190097332, "num_tokens": 167198338.0, "step": 72990 }, { "entropy": 5.216925191879272, "epoch": 7.215796757611704, "grad_norm": 1.2578125, "learning_rate": 0.00013220048191634249, "loss": 4.4715, "mean_token_accuracy": 0.26605277210474015, "num_tokens": 167209019.0, "step": 72995 }, { "entropy": 5.219542360305786, "epoch": 7.216291024120205, "grad_norm": 1.2109375, "learning_rate": 0.00013217321200603382, "loss": 4.5691, "mean_token_accuracy": 0.2640779122710228, "num_tokens": 167219970.0, "step": 73000 }, { "entropy": 5.291447591781616, "epoch": 7.216785290628707, "grad_norm": 1.3359375, "learning_rate": 0.00013214594560928618, "loss": 4.628, "mean_token_accuracy": 0.26060992628335955, "num_tokens": 167231648.0, "step": 73005 }, { "entropy": 5.188216638565064, "epoch": 7.217279557137209, "grad_norm": 1.328125, "learning_rate": 0.00013211868272677057, "loss": 4.508, "mean_token_accuracy": 0.27578629106283187, "num_tokens": 167242497.0, "step": 73010 }, { "entropy": 5.230194568634033, "epoch": 7.21777382364571, "grad_norm": 1.4921875, "learning_rate": 0.00013209142335915747, "loss": 4.6142, "mean_token_accuracy": 0.2680919110774994, "num_tokens": 167252196.0, "step": 73015 }, { "entropy": 5.1986805438995365, "epoch": 7.218268090154211, "grad_norm": 1.109375, "learning_rate": 0.00013206416750711754, "loss": 4.5371, "mean_token_accuracy": 0.27202480137348173, "num_tokens": 167263699.0, "step": 73020 }, { "entropy": 5.270959949493408, "epoch": 7.218762356662713, "grad_norm": 1.1484375, "learning_rate": 0.0001320369151713213, "loss": 4.6264, "mean_token_accuracy": 0.25832637697458266, "num_tokens": 167275299.0, "step": 73025 }, { "entropy": 5.304566097259522, "epoch": 7.219256623171214, "grad_norm": 1.2109375, "learning_rate": 0.00013200966635243896, "loss": 4.5856, "mean_token_accuracy": 0.26007932871580125, "num_tokens": 167286034.0, "step": 73030 }, { "entropy": 5.212018823623657, "epoch": 7.219750889679715, "grad_norm": 1.2109375, "learning_rate": 0.00013198242105114122, "loss": 4.5589, "mean_token_accuracy": 0.2670221269130707, "num_tokens": 167297410.0, "step": 73035 }, { "entropy": 5.250488328933716, "epoch": 7.220245156188216, "grad_norm": 1.1328125, "learning_rate": 0.000131955179268098, "loss": 4.6268, "mean_token_accuracy": 0.26164575666189194, "num_tokens": 167310450.0, "step": 73040 }, { "entropy": 5.177499628067016, "epoch": 7.220739422696718, "grad_norm": 1.2421875, "learning_rate": 0.0001319279410039796, "loss": 4.4915, "mean_token_accuracy": 0.27791489064693453, "num_tokens": 167322424.0, "step": 73045 }, { "entropy": 5.268546533584595, "epoch": 7.22123368920522, "grad_norm": 1.1875, "learning_rate": 0.00013190070625945604, "loss": 4.6122, "mean_token_accuracy": 0.26797498762607574, "num_tokens": 167334786.0, "step": 73050 }, { "entropy": 5.210751247406006, "epoch": 7.221727955713721, "grad_norm": 1.34375, "learning_rate": 0.0001318734750351973, "loss": 4.5428, "mean_token_accuracy": 0.2677195638418198, "num_tokens": 167346147.0, "step": 73055 }, { "entropy": 5.204842233657837, "epoch": 7.222222222222222, "grad_norm": 1.1953125, "learning_rate": 0.00013184624733187324, "loss": 4.5249, "mean_token_accuracy": 0.26691166758537294, "num_tokens": 167356668.0, "step": 73060 }, { "entropy": 5.256630182266235, "epoch": 7.222716488730724, "grad_norm": 1.234375, "learning_rate": 0.00013181902315015376, "loss": 4.611, "mean_token_accuracy": 0.2598140984773636, "num_tokens": 167368123.0, "step": 73065 }, { "entropy": 5.204111385345459, "epoch": 7.223210755239225, "grad_norm": 1.171875, "learning_rate": 0.0001317918024907085, "loss": 4.5578, "mean_token_accuracy": 0.2671143338084221, "num_tokens": 167380120.0, "step": 73070 }, { "entropy": 5.20260009765625, "epoch": 7.223705021747726, "grad_norm": 1.1796875, "learning_rate": 0.00013176458535420714, "loss": 4.5633, "mean_token_accuracy": 0.265808017551899, "num_tokens": 167392876.0, "step": 73075 }, { "entropy": 5.202592754364014, "epoch": 7.224199288256227, "grad_norm": 1.2265625, "learning_rate": 0.00013173737174131917, "loss": 4.5116, "mean_token_accuracy": 0.2716647356748581, "num_tokens": 167403579.0, "step": 73080 }, { "entropy": 5.194224691390991, "epoch": 7.2246935547647295, "grad_norm": 1.328125, "learning_rate": 0.00013171016165271408, "loss": 4.5587, "mean_token_accuracy": 0.2590365007519722, "num_tokens": 167414229.0, "step": 73085 }, { "entropy": 5.175215244293213, "epoch": 7.225187821273231, "grad_norm": 1.2109375, "learning_rate": 0.00013168295508906124, "loss": 4.5336, "mean_token_accuracy": 0.2753954231739044, "num_tokens": 167425666.0, "step": 73090 }, { "entropy": 5.208786106109619, "epoch": 7.225682087781732, "grad_norm": 1.2265625, "learning_rate": 0.00013165575205102993, "loss": 4.5203, "mean_token_accuracy": 0.2710328921675682, "num_tokens": 167437122.0, "step": 73095 }, { "entropy": 5.246022891998291, "epoch": 7.226176354290233, "grad_norm": 1.1796875, "learning_rate": 0.00013162855253928945, "loss": 4.549, "mean_token_accuracy": 0.26321408748626707, "num_tokens": 167448776.0, "step": 73100 }, { "entropy": 5.208415937423706, "epoch": 7.226670620798735, "grad_norm": 1.1484375, "learning_rate": 0.00013160135655450873, "loss": 4.5592, "mean_token_accuracy": 0.2635173037648201, "num_tokens": 167459658.0, "step": 73105 }, { "entropy": 5.165043592453003, "epoch": 7.227164887307236, "grad_norm": 1.2578125, "learning_rate": 0.00013157416409735688, "loss": 4.4628, "mean_token_accuracy": 0.27947436422109606, "num_tokens": 167470591.0, "step": 73110 }, { "entropy": 5.264370775222778, "epoch": 7.227659153815737, "grad_norm": 1.2578125, "learning_rate": 0.00013154697516850296, "loss": 4.6016, "mean_token_accuracy": 0.2632213681936264, "num_tokens": 167481409.0, "step": 73115 }, { "entropy": 5.267775392532348, "epoch": 7.228153420324239, "grad_norm": 1.265625, "learning_rate": 0.0001315197897686155, "loss": 4.5993, "mean_token_accuracy": 0.255135115981102, "num_tokens": 167494885.0, "step": 73120 }, { "entropy": 5.27217664718628, "epoch": 7.2286476868327405, "grad_norm": 1.1640625, "learning_rate": 0.00013149260789836365, "loss": 4.6564, "mean_token_accuracy": 0.25773004591465, "num_tokens": 167506936.0, "step": 73125 }, { "entropy": 5.297780466079712, "epoch": 7.229141953341242, "grad_norm": 1.203125, "learning_rate": 0.0001314654295584158, "loss": 4.6167, "mean_token_accuracy": 0.25907817482948303, "num_tokens": 167518324.0, "step": 73130 }, { "entropy": 5.2800217628479, "epoch": 7.229636219849743, "grad_norm": 1.390625, "learning_rate": 0.00013143825474944064, "loss": 4.614, "mean_token_accuracy": 0.25161864012479784, "num_tokens": 167529811.0, "step": 73135 }, { "entropy": 5.300040006637573, "epoch": 7.230130486358244, "grad_norm": 1.2421875, "learning_rate": 0.00013141108347210684, "loss": 4.6838, "mean_token_accuracy": 0.26141724586486814, "num_tokens": 167541383.0, "step": 73140 }, { "entropy": 5.196229076385498, "epoch": 7.2306247528667456, "grad_norm": 1.09375, "learning_rate": 0.00013138391572708257, "loss": 4.5018, "mean_token_accuracy": 0.2690092965960503, "num_tokens": 167552837.0, "step": 73145 }, { "entropy": 5.236144208908081, "epoch": 7.231119019375247, "grad_norm": 1.1875, "learning_rate": 0.0001313567515150362, "loss": 4.575, "mean_token_accuracy": 0.2629320114850998, "num_tokens": 167564131.0, "step": 73150 }, { "entropy": 5.1606443405151365, "epoch": 7.231613285883748, "grad_norm": 1.2578125, "learning_rate": 0.00013132959083663603, "loss": 4.4783, "mean_token_accuracy": 0.2755182355642319, "num_tokens": 167574943.0, "step": 73155 }, { "entropy": 5.27722749710083, "epoch": 7.23210755239225, "grad_norm": 1.2890625, "learning_rate": 0.00013130243369255024, "loss": 4.6425, "mean_token_accuracy": 0.25832701921463014, "num_tokens": 167586494.0, "step": 73160 }, { "entropy": 5.181761932373047, "epoch": 7.2326018189007515, "grad_norm": 1.2265625, "learning_rate": 0.00013127528008344697, "loss": 4.4959, "mean_token_accuracy": 0.27079671174287795, "num_tokens": 167597757.0, "step": 73165 }, { "entropy": 5.273981523513794, "epoch": 7.233096085409253, "grad_norm": 1.28125, "learning_rate": 0.000131248130009994, "loss": 4.6739, "mean_token_accuracy": 0.26134682893753053, "num_tokens": 167609126.0, "step": 73170 }, { "entropy": 5.077953624725342, "epoch": 7.233590351917754, "grad_norm": 1.25, "learning_rate": 0.00013122098347285936, "loss": 4.3847, "mean_token_accuracy": 0.2860625833272934, "num_tokens": 167620200.0, "step": 73175 }, { "entropy": 5.232712697982788, "epoch": 7.234084618426255, "grad_norm": 1.109375, "learning_rate": 0.00013119384047271079, "loss": 4.6249, "mean_token_accuracy": 0.2622216925024986, "num_tokens": 167634390.0, "step": 73180 }, { "entropy": 5.22942624092102, "epoch": 7.2345788849347565, "grad_norm": 1.234375, "learning_rate": 0.0001311667010102161, "loss": 4.573, "mean_token_accuracy": 0.264463073015213, "num_tokens": 167647451.0, "step": 73185 }, { "entropy": 5.260941457748413, "epoch": 7.235073151443258, "grad_norm": 1.203125, "learning_rate": 0.0001311395650860429, "loss": 4.603, "mean_token_accuracy": 0.2643133267760277, "num_tokens": 167658635.0, "step": 73190 }, { "entropy": 5.215167903900147, "epoch": 7.23556741795176, "grad_norm": 1.1640625, "learning_rate": 0.00013111243270085872, "loss": 4.6134, "mean_token_accuracy": 0.26196899712085725, "num_tokens": 167670286.0, "step": 73195 }, { "entropy": 5.254667711257935, "epoch": 7.236061684460261, "grad_norm": 1.1875, "learning_rate": 0.00013108530385533103, "loss": 4.5784, "mean_token_accuracy": 0.2644553020596504, "num_tokens": 167680830.0, "step": 73200 }, { "entropy": 5.169866847991943, "epoch": 7.2365559509687625, "grad_norm": 1.1640625, "learning_rate": 0.00013105817855012703, "loss": 4.5382, "mean_token_accuracy": 0.2692353904247284, "num_tokens": 167693362.0, "step": 73205 }, { "entropy": 5.277737283706665, "epoch": 7.237050217477264, "grad_norm": 1.359375, "learning_rate": 0.0001310310567859143, "loss": 4.6063, "mean_token_accuracy": 0.2609365016222, "num_tokens": 167704449.0, "step": 73210 }, { "entropy": 5.260448217391968, "epoch": 7.237544483985765, "grad_norm": 1.0546875, "learning_rate": 0.00013100393856335996, "loss": 4.5874, "mean_token_accuracy": 0.2654351741075516, "num_tokens": 167716804.0, "step": 73215 }, { "entropy": 5.18913426399231, "epoch": 7.238038750494266, "grad_norm": 1.140625, "learning_rate": 0.00013097682388313098, "loss": 4.5384, "mean_token_accuracy": 0.2682091310620308, "num_tokens": 167727844.0, "step": 73220 }, { "entropy": 5.258581924438476, "epoch": 7.2385330170027675, "grad_norm": 1.2421875, "learning_rate": 0.00013094971274589455, "loss": 4.6225, "mean_token_accuracy": 0.26121012419462203, "num_tokens": 167739824.0, "step": 73225 }, { "entropy": 5.2261213779449465, "epoch": 7.23902728351127, "grad_norm": 1.140625, "learning_rate": 0.00013092260515231748, "loss": 4.5678, "mean_token_accuracy": 0.27360099405050275, "num_tokens": 167752294.0, "step": 73230 }, { "entropy": 5.156465482711792, "epoch": 7.239521550019771, "grad_norm": 1.1953125, "learning_rate": 0.00013089550110306658, "loss": 4.5408, "mean_token_accuracy": 0.26550607234239576, "num_tokens": 167763169.0, "step": 73235 }, { "entropy": 5.268190622329712, "epoch": 7.240015816528272, "grad_norm": 1.2578125, "learning_rate": 0.00013086840059880887, "loss": 4.608, "mean_token_accuracy": 0.2613899871706963, "num_tokens": 167774325.0, "step": 73240 }, { "entropy": 5.20877103805542, "epoch": 7.2405100830367735, "grad_norm": 1.34375, "learning_rate": 0.0001308413036402108, "loss": 4.5959, "mean_token_accuracy": 0.26443571746349337, "num_tokens": 167784262.0, "step": 73245 }, { "entropy": 5.2504349708557125, "epoch": 7.241004349545275, "grad_norm": 1.265625, "learning_rate": 0.0001308142102279391, "loss": 4.611, "mean_token_accuracy": 0.2590799152851105, "num_tokens": 167795465.0, "step": 73250 }, { "entropy": 5.229121828079224, "epoch": 7.241498616053776, "grad_norm": 1.21875, "learning_rate": 0.0001307871203626601, "loss": 4.5351, "mean_token_accuracy": 0.27236718535423277, "num_tokens": 167805910.0, "step": 73255 }, { "entropy": 5.248630475997925, "epoch": 7.241992882562277, "grad_norm": 1.296875, "learning_rate": 0.00013076003404504033, "loss": 4.6208, "mean_token_accuracy": 0.25727288126945497, "num_tokens": 167818219.0, "step": 73260 }, { "entropy": 5.2974025249481205, "epoch": 7.242487149070779, "grad_norm": 1.21875, "learning_rate": 0.00013073295127574608, "loss": 4.6212, "mean_token_accuracy": 0.2576227694749832, "num_tokens": 167830005.0, "step": 73265 }, { "entropy": 5.231816148757934, "epoch": 7.242981415579281, "grad_norm": 1.25, "learning_rate": 0.0001307058720554436, "loss": 4.5362, "mean_token_accuracy": 0.2724487319588661, "num_tokens": 167840752.0, "step": 73270 }, { "entropy": 5.195213174819946, "epoch": 7.243475682087782, "grad_norm": 1.265625, "learning_rate": 0.00013067879638479918, "loss": 4.4918, "mean_token_accuracy": 0.2675228238105774, "num_tokens": 167852926.0, "step": 73275 }, { "entropy": 5.29734091758728, "epoch": 7.243969948596283, "grad_norm": 1.1796875, "learning_rate": 0.00013065172426447862, "loss": 4.6574, "mean_token_accuracy": 0.2551157370209694, "num_tokens": 167865273.0, "step": 73280 }, { "entropy": 5.252661991119385, "epoch": 7.244464215104784, "grad_norm": 1.234375, "learning_rate": 0.00013062465569514808, "loss": 4.5664, "mean_token_accuracy": 0.2631321609020233, "num_tokens": 167876416.0, "step": 73285 }, { "entropy": 5.258746862411499, "epoch": 7.244958481613286, "grad_norm": 1.203125, "learning_rate": 0.00013059759067747344, "loss": 4.5757, "mean_token_accuracy": 0.2680197760462761, "num_tokens": 167888308.0, "step": 73290 }, { "entropy": 5.200023174285889, "epoch": 7.245452748121787, "grad_norm": 1.1484375, "learning_rate": 0.00013057052921212038, "loss": 4.5904, "mean_token_accuracy": 0.27418463975191115, "num_tokens": 167901997.0, "step": 73295 }, { "entropy": 5.300863933563233, "epoch": 7.245947014630288, "grad_norm": 1.25, "learning_rate": 0.00013054347129975484, "loss": 4.6773, "mean_token_accuracy": 0.25733614414930345, "num_tokens": 167913411.0, "step": 73300 }, { "entropy": 5.221164512634277, "epoch": 7.24644128113879, "grad_norm": 1.171875, "learning_rate": 0.00013051641694104222, "loss": 4.5759, "mean_token_accuracy": 0.2658595308661461, "num_tokens": 167925289.0, "step": 73305 }, { "entropy": 5.304299926757812, "epoch": 7.246935547647292, "grad_norm": 1.234375, "learning_rate": 0.0001304893661366482, "loss": 4.6824, "mean_token_accuracy": 0.25675222724676133, "num_tokens": 167935755.0, "step": 73310 }, { "entropy": 5.245715236663818, "epoch": 7.247429814155793, "grad_norm": 1.171875, "learning_rate": 0.00013046231888723823, "loss": 4.555, "mean_token_accuracy": 0.2699847355484962, "num_tokens": 167946599.0, "step": 73315 }, { "entropy": 5.248611927032471, "epoch": 7.247924080664294, "grad_norm": 1.3203125, "learning_rate": 0.00013043527519347755, "loss": 4.5858, "mean_token_accuracy": 0.2651628598570824, "num_tokens": 167958018.0, "step": 73320 }, { "entropy": 5.232763814926147, "epoch": 7.248418347172795, "grad_norm": 1.2265625, "learning_rate": 0.00013040823505603157, "loss": 4.5323, "mean_token_accuracy": 0.26997136771678926, "num_tokens": 167968351.0, "step": 73325 }, { "entropy": 5.172556781768799, "epoch": 7.248912613681297, "grad_norm": 1.3359375, "learning_rate": 0.0001303811984755654, "loss": 4.4868, "mean_token_accuracy": 0.27919630110263827, "num_tokens": 167980674.0, "step": 73330 }, { "entropy": 5.226059532165527, "epoch": 7.249406880189798, "grad_norm": 1.1875, "learning_rate": 0.0001303541654527442, "loss": 4.5547, "mean_token_accuracy": 0.2667414501309395, "num_tokens": 167992533.0, "step": 73335 }, { "entropy": 5.3515918254852295, "epoch": 7.2499011466983, "grad_norm": 1.2890625, "learning_rate": 0.00013032713598823303, "loss": 4.6871, "mean_token_accuracy": 0.2576120838522911, "num_tokens": 168005091.0, "step": 73340 }, { "entropy": 5.289550161361694, "epoch": 7.250395413206801, "grad_norm": 1.1171875, "learning_rate": 0.0001303001100826967, "loss": 4.6313, "mean_token_accuracy": 0.2600088149309158, "num_tokens": 168017713.0, "step": 73345 }, { "entropy": 5.36128044128418, "epoch": 7.250889679715303, "grad_norm": 1.2109375, "learning_rate": 0.00013027308773680014, "loss": 4.7025, "mean_token_accuracy": 0.25048920810222625, "num_tokens": 168030267.0, "step": 73350 }, { "entropy": 5.183774662017822, "epoch": 7.251383946223804, "grad_norm": 1.28125, "learning_rate": 0.00013024606895120804, "loss": 4.5295, "mean_token_accuracy": 0.2749433159828186, "num_tokens": 168041997.0, "step": 73355 }, { "entropy": 5.236428594589233, "epoch": 7.251878212732305, "grad_norm": 1.21875, "learning_rate": 0.0001302190537265851, "loss": 4.5533, "mean_token_accuracy": 0.26208485662937164, "num_tokens": 168052857.0, "step": 73360 }, { "entropy": 5.281725358963013, "epoch": 7.252372479240806, "grad_norm": 1.3125, "learning_rate": 0.00013019204206359596, "loss": 4.5824, "mean_token_accuracy": 0.265072762966156, "num_tokens": 168063915.0, "step": 73365 }, { "entropy": 5.252472162246704, "epoch": 7.252866745749308, "grad_norm": 1.265625, "learning_rate": 0.00013016503396290498, "loss": 4.5986, "mean_token_accuracy": 0.2547440558671951, "num_tokens": 168075097.0, "step": 73370 }, { "entropy": 5.2175133228302, "epoch": 7.25336101225781, "grad_norm": 1.296875, "learning_rate": 0.00013013802942517667, "loss": 4.547, "mean_token_accuracy": 0.2699660435318947, "num_tokens": 168086428.0, "step": 73375 }, { "entropy": 5.261184215545654, "epoch": 7.253855278766311, "grad_norm": 1.109375, "learning_rate": 0.00013011102845107526, "loss": 4.6272, "mean_token_accuracy": 0.25463338047266004, "num_tokens": 168098374.0, "step": 73380 }, { "entropy": 5.289461469650268, "epoch": 7.254349545274812, "grad_norm": 1.1328125, "learning_rate": 0.00013008403104126503, "loss": 4.6736, "mean_token_accuracy": 0.25404999405145645, "num_tokens": 168111147.0, "step": 73385 }, { "entropy": 5.241265726089478, "epoch": 7.254843811783314, "grad_norm": 1.3046875, "learning_rate": 0.00013005703719641028, "loss": 4.5663, "mean_token_accuracy": 0.2645410463213921, "num_tokens": 168122780.0, "step": 73390 }, { "entropy": 5.305530261993408, "epoch": 7.255338078291815, "grad_norm": 1.2578125, "learning_rate": 0.00013003004691717474, "loss": 4.6468, "mean_token_accuracy": 0.2556257724761963, "num_tokens": 168133639.0, "step": 73395 }, { "entropy": 5.238217878341675, "epoch": 7.255832344800316, "grad_norm": 1.0859375, "learning_rate": 0.00013000306020422253, "loss": 4.6013, "mean_token_accuracy": 0.26491560190916064, "num_tokens": 168145939.0, "step": 73400 }, { "entropy": 5.134826231002807, "epoch": 7.256326611308817, "grad_norm": 1.328125, "learning_rate": 0.00012997607705821765, "loss": 4.4538, "mean_token_accuracy": 0.2783882156014442, "num_tokens": 168157148.0, "step": 73405 }, { "entropy": 5.3236119747161865, "epoch": 7.256820877817319, "grad_norm": 1.1796875, "learning_rate": 0.00012994909747982364, "loss": 4.6296, "mean_token_accuracy": 0.2544124722480774, "num_tokens": 168168688.0, "step": 73410 }, { "entropy": 5.179825353622436, "epoch": 7.257315144325821, "grad_norm": 1.2265625, "learning_rate": 0.00012992212146970445, "loss": 4.5633, "mean_token_accuracy": 0.2632163822650909, "num_tokens": 168180971.0, "step": 73415 }, { "entropy": 5.18946590423584, "epoch": 7.257809410834322, "grad_norm": 1.3359375, "learning_rate": 0.00012989514902852348, "loss": 4.5496, "mean_token_accuracy": 0.26629177778959273, "num_tokens": 168192150.0, "step": 73420 }, { "entropy": 5.19836163520813, "epoch": 7.258303677342823, "grad_norm": 1.3359375, "learning_rate": 0.0001298681801569444, "loss": 4.5129, "mean_token_accuracy": 0.2676413178443909, "num_tokens": 168202022.0, "step": 73425 }, { "entropy": 5.27296404838562, "epoch": 7.258797943851325, "grad_norm": 1.1953125, "learning_rate": 0.00012984121485563066, "loss": 4.6112, "mean_token_accuracy": 0.26131424903869627, "num_tokens": 168214389.0, "step": 73430 }, { "entropy": 5.27333698272705, "epoch": 7.259292210359826, "grad_norm": 1.2421875, "learning_rate": 0.00012981425312524547, "loss": 4.5786, "mean_token_accuracy": 0.2587895020842552, "num_tokens": 168226865.0, "step": 73435 }, { "entropy": 5.205353116989135, "epoch": 7.259786476868327, "grad_norm": 1.1953125, "learning_rate": 0.0001297872949664522, "loss": 4.5546, "mean_token_accuracy": 0.26796418577432635, "num_tokens": 168238906.0, "step": 73440 }, { "entropy": 5.242695045471192, "epoch": 7.260280743376828, "grad_norm": 1.1953125, "learning_rate": 0.00012976034037991396, "loss": 4.5854, "mean_token_accuracy": 0.2573509693145752, "num_tokens": 168250109.0, "step": 73445 }, { "entropy": 5.248693323135376, "epoch": 7.2607750098853305, "grad_norm": 1.375, "learning_rate": 0.0001297333893662939, "loss": 4.5383, "mean_token_accuracy": 0.2679562747478485, "num_tokens": 168260339.0, "step": 73450 }, { "entropy": 5.20591368675232, "epoch": 7.261269276393832, "grad_norm": 1.21875, "learning_rate": 0.0001297064419262551, "loss": 4.5484, "mean_token_accuracy": 0.26420136392116544, "num_tokens": 168270798.0, "step": 73455 }, { "entropy": 5.180590105056763, "epoch": 7.261763542902333, "grad_norm": 1.1328125, "learning_rate": 0.00012967949806046025, "loss": 4.5446, "mean_token_accuracy": 0.2624565362930298, "num_tokens": 168282968.0, "step": 73460 }, { "entropy": 5.179426908493042, "epoch": 7.262257809410834, "grad_norm": 1.3046875, "learning_rate": 0.00012965255776957235, "loss": 4.5028, "mean_token_accuracy": 0.26785516887903216, "num_tokens": 168293441.0, "step": 73465 }, { "entropy": 5.143728590011596, "epoch": 7.262752075919336, "grad_norm": 1.2890625, "learning_rate": 0.00012962562105425405, "loss": 4.4559, "mean_token_accuracy": 0.2791539132595062, "num_tokens": 168304952.0, "step": 73470 }, { "entropy": 5.2110137939453125, "epoch": 7.263246342427837, "grad_norm": 1.1171875, "learning_rate": 0.000129598687915168, "loss": 4.5223, "mean_token_accuracy": 0.2677616521716118, "num_tokens": 168316300.0, "step": 73475 }, { "entropy": 5.276346015930176, "epoch": 7.263740608936338, "grad_norm": 1.3828125, "learning_rate": 0.0001295717583529769, "loss": 4.6444, "mean_token_accuracy": 0.25722761154174806, "num_tokens": 168326606.0, "step": 73480 }, { "entropy": 5.238701391220093, "epoch": 7.26423487544484, "grad_norm": 1.3828125, "learning_rate": 0.00012954483236834297, "loss": 4.5667, "mean_token_accuracy": 0.2640445053577423, "num_tokens": 168338130.0, "step": 73485 }, { "entropy": 5.1981734275817875, "epoch": 7.2647291419533415, "grad_norm": 1.2109375, "learning_rate": 0.0001295179099619288, "loss": 4.4989, "mean_token_accuracy": 0.2689916789531708, "num_tokens": 168348761.0, "step": 73490 }, { "entropy": 5.299474716186523, "epoch": 7.265223408461843, "grad_norm": 1.109375, "learning_rate": 0.00012949099113439654, "loss": 4.6466, "mean_token_accuracy": 0.26051081120967867, "num_tokens": 168361801.0, "step": 73495 }, { "entropy": 5.240541887283325, "epoch": 7.265717674970344, "grad_norm": 1.2265625, "learning_rate": 0.00012946407588640855, "loss": 4.5829, "mean_token_accuracy": 0.259216146171093, "num_tokens": 168373506.0, "step": 73500 }, { "entropy": 5.20757908821106, "epoch": 7.266211941478845, "grad_norm": 1.2265625, "learning_rate": 0.00012943716421862688, "loss": 4.5881, "mean_token_accuracy": 0.2619443580508232, "num_tokens": 168384731.0, "step": 73505 }, { "entropy": 5.21741213798523, "epoch": 7.266706207987347, "grad_norm": 1.1953125, "learning_rate": 0.00012941025613171355, "loss": 4.5165, "mean_token_accuracy": 0.26862452626228334, "num_tokens": 168395203.0, "step": 73510 }, { "entropy": 5.262877893447876, "epoch": 7.267200474495848, "grad_norm": 1.34375, "learning_rate": 0.0001293833516263304, "loss": 4.5976, "mean_token_accuracy": 0.25563723891973494, "num_tokens": 168405710.0, "step": 73515 }, { "entropy": 5.2831223487854, "epoch": 7.26769474100435, "grad_norm": 1.265625, "learning_rate": 0.00012935645070313956, "loss": 4.6781, "mean_token_accuracy": 0.2507150903344154, "num_tokens": 168418511.0, "step": 73520 }, { "entropy": 5.250109529495239, "epoch": 7.268189007512851, "grad_norm": 1.1328125, "learning_rate": 0.00012932955336280243, "loss": 4.5872, "mean_token_accuracy": 0.26488767117261885, "num_tokens": 168431393.0, "step": 73525 }, { "entropy": 5.23011326789856, "epoch": 7.2686832740213525, "grad_norm": 1.140625, "learning_rate": 0.00012930265960598108, "loss": 4.5695, "mean_token_accuracy": 0.2617536589503288, "num_tokens": 168443143.0, "step": 73530 }, { "entropy": 5.213726377487182, "epoch": 7.269177540529854, "grad_norm": 1.1484375, "learning_rate": 0.0001292757694333368, "loss": 4.5647, "mean_token_accuracy": 0.2668674200773239, "num_tokens": 168454434.0, "step": 73535 }, { "entropy": 5.248822259902954, "epoch": 7.269671807038355, "grad_norm": 1.078125, "learning_rate": 0.0001292488828455312, "loss": 4.5893, "mean_token_accuracy": 0.26303554624319075, "num_tokens": 168466043.0, "step": 73540 }, { "entropy": 5.260711288452148, "epoch": 7.270166073546856, "grad_norm": 1.140625, "learning_rate": 0.00012922199984322574, "loss": 4.6248, "mean_token_accuracy": 0.2626164570450783, "num_tokens": 168477651.0, "step": 73545 }, { "entropy": 5.266585493087769, "epoch": 7.2706603400553576, "grad_norm": 1.171875, "learning_rate": 0.00012919512042708166, "loss": 4.616, "mean_token_accuracy": 0.252880272269249, "num_tokens": 168488471.0, "step": 73550 }, { "entropy": 5.24794282913208, "epoch": 7.27115460656386, "grad_norm": 1.34375, "learning_rate": 0.0001291682445977602, "loss": 4.5605, "mean_token_accuracy": 0.2733345597982407, "num_tokens": 168498724.0, "step": 73555 }, { "entropy": 5.255005264282227, "epoch": 7.271648873072361, "grad_norm": 1.2421875, "learning_rate": 0.00012914137235592264, "loss": 4.5499, "mean_token_accuracy": 0.26515372544527055, "num_tokens": 168509714.0, "step": 73560 }, { "entropy": 5.239170217514038, "epoch": 7.272143139580862, "grad_norm": 1.125, "learning_rate": 0.00012911450370222988, "loss": 4.6536, "mean_token_accuracy": 0.2608020186424255, "num_tokens": 168521702.0, "step": 73565 }, { "entropy": 5.266303062438965, "epoch": 7.2726374060893635, "grad_norm": 1.2578125, "learning_rate": 0.00012908763863734305, "loss": 4.6316, "mean_token_accuracy": 0.25680744349956514, "num_tokens": 168532290.0, "step": 73570 }, { "entropy": 5.223224020004272, "epoch": 7.273131672597865, "grad_norm": 1.2109375, "learning_rate": 0.00012906077716192286, "loss": 4.5085, "mean_token_accuracy": 0.27227692902088163, "num_tokens": 168544602.0, "step": 73575 }, { "entropy": 5.293406200408936, "epoch": 7.273625939106366, "grad_norm": 1.390625, "learning_rate": 0.00012903391927663024, "loss": 4.5906, "mean_token_accuracy": 0.2564515396952629, "num_tokens": 168556378.0, "step": 73580 }, { "entropy": 5.296417284011841, "epoch": 7.274120205614867, "grad_norm": 1.2734375, "learning_rate": 0.00012900706498212574, "loss": 4.5672, "mean_token_accuracy": 0.2614447385072708, "num_tokens": 168567817.0, "step": 73585 }, { "entropy": 5.195129108428955, "epoch": 7.2746144721233685, "grad_norm": 1.21875, "learning_rate": 0.00012898021427907016, "loss": 4.5302, "mean_token_accuracy": 0.26275279819965364, "num_tokens": 168580715.0, "step": 73590 }, { "entropy": 5.255240774154663, "epoch": 7.275108738631871, "grad_norm": 1.1796875, "learning_rate": 0.00012895336716812407, "loss": 4.6058, "mean_token_accuracy": 0.25973131209611894, "num_tokens": 168593455.0, "step": 73595 }, { "entropy": 5.261968660354614, "epoch": 7.275603005140372, "grad_norm": 1.296875, "learning_rate": 0.00012892652364994767, "loss": 4.5864, "mean_token_accuracy": 0.2640406906604767, "num_tokens": 168603812.0, "step": 73600 }, { "entropy": 5.264580965042114, "epoch": 7.276097271648873, "grad_norm": 1.1484375, "learning_rate": 0.00012889968372520156, "loss": 4.5802, "mean_token_accuracy": 0.257397486269474, "num_tokens": 168615954.0, "step": 73605 }, { "entropy": 5.2907415390014645, "epoch": 7.2765915381573745, "grad_norm": 1.2890625, "learning_rate": 0.0001288728473945458, "loss": 4.6614, "mean_token_accuracy": 0.2579523742198944, "num_tokens": 168627033.0, "step": 73610 }, { "entropy": 5.20741982460022, "epoch": 7.277085804665876, "grad_norm": 1.234375, "learning_rate": 0.0001288460146586406, "loss": 4.5632, "mean_token_accuracy": 0.2540231585502625, "num_tokens": 168638077.0, "step": 73615 }, { "entropy": 5.186091899871826, "epoch": 7.277580071174377, "grad_norm": 1.25, "learning_rate": 0.00012881918551814624, "loss": 4.531, "mean_token_accuracy": 0.2663202345371246, "num_tokens": 168649628.0, "step": 73620 }, { "entropy": 5.225042295455933, "epoch": 7.278074337682878, "grad_norm": 1.265625, "learning_rate": 0.00012879235997372257, "loss": 4.6399, "mean_token_accuracy": 0.2618938460946083, "num_tokens": 168661219.0, "step": 73625 }, { "entropy": 5.202226734161377, "epoch": 7.2785686041913795, "grad_norm": 1.15625, "learning_rate": 0.00012876553802602955, "loss": 4.5259, "mean_token_accuracy": 0.26577485501766207, "num_tokens": 168672389.0, "step": 73630 }, { "entropy": 5.291339778900147, "epoch": 7.279062870699882, "grad_norm": 1.2265625, "learning_rate": 0.00012873871967572693, "loss": 4.6124, "mean_token_accuracy": 0.25977163314819335, "num_tokens": 168683813.0, "step": 73635 }, { "entropy": 5.239132308959961, "epoch": 7.279557137208383, "grad_norm": 1.1328125, "learning_rate": 0.00012871190492347447, "loss": 4.5771, "mean_token_accuracy": 0.26293702721595763, "num_tokens": 168695316.0, "step": 73640 }, { "entropy": 5.252868366241455, "epoch": 7.280051403716884, "grad_norm": 1.2578125, "learning_rate": 0.0001286850937699319, "loss": 4.6126, "mean_token_accuracy": 0.25725242495536804, "num_tokens": 168708336.0, "step": 73645 }, { "entropy": 5.166741180419922, "epoch": 7.2805456702253855, "grad_norm": 1.2890625, "learning_rate": 0.00012865828621575867, "loss": 4.5141, "mean_token_accuracy": 0.27296347320079806, "num_tokens": 168719356.0, "step": 73650 }, { "entropy": 5.26190185546875, "epoch": 7.281039936733887, "grad_norm": 1.296875, "learning_rate": 0.0001286314822616144, "loss": 4.5938, "mean_token_accuracy": 0.26034826785326004, "num_tokens": 168730024.0, "step": 73655 }, { "entropy": 5.243557024002075, "epoch": 7.281534203242388, "grad_norm": 1.265625, "learning_rate": 0.00012860468190815827, "loss": 4.656, "mean_token_accuracy": 0.2590094983577728, "num_tokens": 168741024.0, "step": 73660 }, { "entropy": 5.305055141448975, "epoch": 7.282028469750889, "grad_norm": 1.1640625, "learning_rate": 0.00012857788515604975, "loss": 4.6141, "mean_token_accuracy": 0.2658892944455147, "num_tokens": 168752024.0, "step": 73665 }, { "entropy": 5.1981946468353275, "epoch": 7.282522736259391, "grad_norm": 1.296875, "learning_rate": 0.0001285510920059479, "loss": 4.4803, "mean_token_accuracy": 0.27428542673587797, "num_tokens": 168761999.0, "step": 73670 }, { "entropy": 5.195496416091919, "epoch": 7.283017002767893, "grad_norm": 1.2109375, "learning_rate": 0.00012852430245851194, "loss": 4.586, "mean_token_accuracy": 0.2649151891469955, "num_tokens": 168773060.0, "step": 73675 }, { "entropy": 5.241680479049682, "epoch": 7.283511269276394, "grad_norm": 1.203125, "learning_rate": 0.00012849751651440092, "loss": 4.6348, "mean_token_accuracy": 0.25599603056907655, "num_tokens": 168785529.0, "step": 73680 }, { "entropy": 5.244138717651367, "epoch": 7.284005535784895, "grad_norm": 1.234375, "learning_rate": 0.00012847073417427362, "loss": 4.5821, "mean_token_accuracy": 0.2520081877708435, "num_tokens": 168795504.0, "step": 73685 }, { "entropy": 5.309218788146973, "epoch": 7.284499802293396, "grad_norm": 1.390625, "learning_rate": 0.00012844395543878907, "loss": 4.621, "mean_token_accuracy": 0.2623173460364342, "num_tokens": 168807300.0, "step": 73690 }, { "entropy": 5.223130369186402, "epoch": 7.284994068801898, "grad_norm": 1.21875, "learning_rate": 0.00012841718030860596, "loss": 4.5036, "mean_token_accuracy": 0.2639835447072983, "num_tokens": 168818984.0, "step": 73695 }, { "entropy": 5.234803676605225, "epoch": 7.285488335310399, "grad_norm": 1.1796875, "learning_rate": 0.0001283904087843828, "loss": 4.6011, "mean_token_accuracy": 0.26652945429086683, "num_tokens": 168831434.0, "step": 73700 }, { "entropy": 5.2330403327941895, "epoch": 7.285982601818901, "grad_norm": 1.2265625, "learning_rate": 0.00012836364086677855, "loss": 4.5721, "mean_token_accuracy": 0.2613047122955322, "num_tokens": 168844117.0, "step": 73705 }, { "entropy": 5.232670783996582, "epoch": 7.286476868327402, "grad_norm": 1.140625, "learning_rate": 0.0001283368765564513, "loss": 4.5904, "mean_token_accuracy": 0.26346192359924314, "num_tokens": 168856535.0, "step": 73710 }, { "entropy": 5.272305965423584, "epoch": 7.286971134835904, "grad_norm": 1.3125, "learning_rate": 0.00012831011585405974, "loss": 4.6239, "mean_token_accuracy": 0.259295716881752, "num_tokens": 168867055.0, "step": 73715 }, { "entropy": 5.1881489753723145, "epoch": 7.287465401344405, "grad_norm": 1.2890625, "learning_rate": 0.00012828335876026212, "loss": 4.4987, "mean_token_accuracy": 0.2747399047017097, "num_tokens": 168877984.0, "step": 73720 }, { "entropy": 5.199653577804566, "epoch": 7.287959667852906, "grad_norm": 1.0859375, "learning_rate": 0.00012825660527571655, "loss": 4.5672, "mean_token_accuracy": 0.261654768884182, "num_tokens": 168889257.0, "step": 73725 }, { "entropy": 5.288409280776977, "epoch": 7.288453934361407, "grad_norm": 1.2734375, "learning_rate": 0.0001282298554010813, "loss": 4.6184, "mean_token_accuracy": 0.260691200196743, "num_tokens": 168899544.0, "step": 73730 }, { "entropy": 5.265083074569702, "epoch": 7.288948200869909, "grad_norm": 1.1953125, "learning_rate": 0.00012820310913701433, "loss": 4.5994, "mean_token_accuracy": 0.2598386749625206, "num_tokens": 168910826.0, "step": 73735 }, { "entropy": 5.206639051437378, "epoch": 7.289442467378411, "grad_norm": 1.203125, "learning_rate": 0.00012817636648417368, "loss": 4.5202, "mean_token_accuracy": 0.26257333606481553, "num_tokens": 168920734.0, "step": 73740 }, { "entropy": 5.229691648483277, "epoch": 7.289936733886912, "grad_norm": 1.203125, "learning_rate": 0.00012814962744321724, "loss": 4.567, "mean_token_accuracy": 0.2644999071955681, "num_tokens": 168932775.0, "step": 73745 }, { "entropy": 5.188096523284912, "epoch": 7.290431000395413, "grad_norm": 1.3984375, "learning_rate": 0.00012812289201480267, "loss": 4.5855, "mean_token_accuracy": 0.265568807721138, "num_tokens": 168944713.0, "step": 73750 }, { "entropy": 5.188209199905396, "epoch": 7.290925266903915, "grad_norm": 1.46875, "learning_rate": 0.00012809616019958774, "loss": 4.5498, "mean_token_accuracy": 0.26959711611270903, "num_tokens": 168954653.0, "step": 73755 }, { "entropy": 5.27990756034851, "epoch": 7.291419533412416, "grad_norm": 1.109375, "learning_rate": 0.0001280694319982301, "loss": 4.6585, "mean_token_accuracy": 0.2602408483624458, "num_tokens": 168965945.0, "step": 73760 }, { "entropy": 5.218344688415527, "epoch": 7.291913799920917, "grad_norm": 1.1484375, "learning_rate": 0.0001280427074113872, "loss": 4.5235, "mean_token_accuracy": 0.27353126704692843, "num_tokens": 168976695.0, "step": 73765 }, { "entropy": 5.206765794754029, "epoch": 7.292408066429418, "grad_norm": 1.265625, "learning_rate": 0.0001280159864397166, "loss": 4.5737, "mean_token_accuracy": 0.26345020830631255, "num_tokens": 168988817.0, "step": 73770 }, { "entropy": 5.251666498184204, "epoch": 7.292902332937921, "grad_norm": 1.1484375, "learning_rate": 0.00012798926908387542, "loss": 4.5727, "mean_token_accuracy": 0.2658175304532051, "num_tokens": 169000527.0, "step": 73775 }, { "entropy": 5.2969084739685055, "epoch": 7.293396599446422, "grad_norm": 1.28125, "learning_rate": 0.00012796255534452104, "loss": 4.6402, "mean_token_accuracy": 0.26124243438243866, "num_tokens": 169011894.0, "step": 73780 }, { "entropy": 5.357667398452759, "epoch": 7.293890865954923, "grad_norm": 1.2578125, "learning_rate": 0.00012793584522231065, "loss": 4.6872, "mean_token_accuracy": 0.24994232207536698, "num_tokens": 169022008.0, "step": 73785 }, { "entropy": 5.21912145614624, "epoch": 7.294385132463424, "grad_norm": 1.2109375, "learning_rate": 0.00012790913871790123, "loss": 4.5227, "mean_token_accuracy": 0.270115265250206, "num_tokens": 169032952.0, "step": 73790 }, { "entropy": 5.301287364959717, "epoch": 7.294879398971926, "grad_norm": 1.34375, "learning_rate": 0.00012788243583194988, "loss": 4.6434, "mean_token_accuracy": 0.260929636657238, "num_tokens": 169044517.0, "step": 73795 }, { "entropy": 5.302574872970581, "epoch": 7.295373665480427, "grad_norm": 1.25, "learning_rate": 0.0001278557365651134, "loss": 4.5908, "mean_token_accuracy": 0.2560523822903633, "num_tokens": 169056465.0, "step": 73800 }, { "entropy": 5.188441467285156, "epoch": 7.295867931988928, "grad_norm": 1.3046875, "learning_rate": 0.00012782904091804858, "loss": 4.5146, "mean_token_accuracy": 0.267787392437458, "num_tokens": 169067186.0, "step": 73805 }, { "entropy": 5.257972478866577, "epoch": 7.29636219849743, "grad_norm": 1.171875, "learning_rate": 0.00012780234889141228, "loss": 4.5111, "mean_token_accuracy": 0.26582023948431016, "num_tokens": 169078527.0, "step": 73810 }, { "entropy": 5.280317640304565, "epoch": 7.2968564650059315, "grad_norm": 1.1875, "learning_rate": 0.0001277756604858609, "loss": 4.626, "mean_token_accuracy": 0.26334492564201356, "num_tokens": 169090254.0, "step": 73815 }, { "entropy": 5.262776231765747, "epoch": 7.297350731514433, "grad_norm": 1.3046875, "learning_rate": 0.00012774897570205126, "loss": 4.6462, "mean_token_accuracy": 0.25183863043785093, "num_tokens": 169101898.0, "step": 73820 }, { "entropy": 5.228869676589966, "epoch": 7.297844998022934, "grad_norm": 1.15625, "learning_rate": 0.0001277222945406396, "loss": 4.5713, "mean_token_accuracy": 0.268845272064209, "num_tokens": 169113218.0, "step": 73825 }, { "entropy": 5.262673377990723, "epoch": 7.298339264531435, "grad_norm": 1.2421875, "learning_rate": 0.00012769561700228232, "loss": 4.6056, "mean_token_accuracy": 0.264517217874527, "num_tokens": 169124068.0, "step": 73830 }, { "entropy": 5.207963228225708, "epoch": 7.298833531039937, "grad_norm": 1.390625, "learning_rate": 0.0001276689430876358, "loss": 4.5164, "mean_token_accuracy": 0.27207190841436385, "num_tokens": 169133929.0, "step": 73835 }, { "entropy": 5.186750364303589, "epoch": 7.299327797548438, "grad_norm": 1.234375, "learning_rate": 0.00012764227279735604, "loss": 4.5037, "mean_token_accuracy": 0.2669078141450882, "num_tokens": 169145847.0, "step": 73840 }, { "entropy": 5.199327564239502, "epoch": 7.299822064056939, "grad_norm": 1.2734375, "learning_rate": 0.00012761560613209924, "loss": 4.5435, "mean_token_accuracy": 0.2647571340203285, "num_tokens": 169157897.0, "step": 73845 }, { "entropy": 5.20393180847168, "epoch": 7.300316330565441, "grad_norm": 1.359375, "learning_rate": 0.00012758894309252138, "loss": 4.4895, "mean_token_accuracy": 0.27408182322978974, "num_tokens": 169168719.0, "step": 73850 }, { "entropy": 5.201752996444702, "epoch": 7.3008105970739425, "grad_norm": 1.28125, "learning_rate": 0.0001275622836792784, "loss": 4.5402, "mean_token_accuracy": 0.2699431210756302, "num_tokens": 169179723.0, "step": 73855 }, { "entropy": 5.2248680114746096, "epoch": 7.301304863582444, "grad_norm": 1.234375, "learning_rate": 0.00012753562789302625, "loss": 4.5672, "mean_token_accuracy": 0.26897725462913513, "num_tokens": 169192081.0, "step": 73860 }, { "entropy": 5.180659437179566, "epoch": 7.301799130090945, "grad_norm": 1.203125, "learning_rate": 0.0001275089757344204, "loss": 4.482, "mean_token_accuracy": 0.26747546792030336, "num_tokens": 169203126.0, "step": 73865 }, { "entropy": 5.351440954208374, "epoch": 7.302293396599446, "grad_norm": 1.1328125, "learning_rate": 0.0001274823272041166, "loss": 4.7337, "mean_token_accuracy": 0.24401266872882843, "num_tokens": 169214983.0, "step": 73870 }, { "entropy": 5.281110191345215, "epoch": 7.302787663107948, "grad_norm": 1.1484375, "learning_rate": 0.0001274556823027705, "loss": 4.6045, "mean_token_accuracy": 0.26392547190189364, "num_tokens": 169227119.0, "step": 73875 }, { "entropy": 5.2370038509368895, "epoch": 7.303281929616449, "grad_norm": 1.2421875, "learning_rate": 0.00012742904103103748, "loss": 4.5172, "mean_token_accuracy": 0.26680138260126113, "num_tokens": 169237768.0, "step": 73880 }, { "entropy": 5.240696001052856, "epoch": 7.30377619612495, "grad_norm": 1.2265625, "learning_rate": 0.00012740240338957298, "loss": 4.5387, "mean_token_accuracy": 0.2700616717338562, "num_tokens": 169249670.0, "step": 73885 }, { "entropy": 5.315054416656494, "epoch": 7.304270462633452, "grad_norm": 1.296875, "learning_rate": 0.00012737576937903224, "loss": 4.6336, "mean_token_accuracy": 0.25285061448812485, "num_tokens": 169260435.0, "step": 73890 }, { "entropy": 5.28782205581665, "epoch": 7.3047647291419535, "grad_norm": 1.15625, "learning_rate": 0.00012734913900007042, "loss": 4.5942, "mean_token_accuracy": 0.26599193811416627, "num_tokens": 169272274.0, "step": 73895 }, { "entropy": 5.2612958431243895, "epoch": 7.305258995650455, "grad_norm": 1.234375, "learning_rate": 0.0001273225122533428, "loss": 4.621, "mean_token_accuracy": 0.257176099717617, "num_tokens": 169284138.0, "step": 73900 }, { "entropy": 5.2002466201782225, "epoch": 7.305753262158956, "grad_norm": 1.3203125, "learning_rate": 0.00012729588913950414, "loss": 4.5227, "mean_token_accuracy": 0.2640660315752029, "num_tokens": 169294886.0, "step": 73905 }, { "entropy": 5.176656103134155, "epoch": 7.306247528667457, "grad_norm": 1.2109375, "learning_rate": 0.00012726926965920963, "loss": 4.4817, "mean_token_accuracy": 0.27358355522155764, "num_tokens": 169307066.0, "step": 73910 }, { "entropy": 5.119729375839233, "epoch": 7.306741795175959, "grad_norm": 1.1484375, "learning_rate": 0.00012724265381311396, "loss": 4.4396, "mean_token_accuracy": 0.28049376606941223, "num_tokens": 169318159.0, "step": 73915 }, { "entropy": 5.238146543502808, "epoch": 7.30723606168446, "grad_norm": 1.234375, "learning_rate": 0.00012721604160187194, "loss": 4.6096, "mean_token_accuracy": 0.26338298320770265, "num_tokens": 169330108.0, "step": 73920 }, { "entropy": 5.2513257503509525, "epoch": 7.307730328192962, "grad_norm": 1.2734375, "learning_rate": 0.00012718943302613827, "loss": 4.5923, "mean_token_accuracy": 0.25670765340328217, "num_tokens": 169340530.0, "step": 73925 }, { "entropy": 5.28209171295166, "epoch": 7.308224594701463, "grad_norm": 1.359375, "learning_rate": 0.00012716282808656742, "loss": 4.6359, "mean_token_accuracy": 0.25941611379384993, "num_tokens": 169352668.0, "step": 73930 }, { "entropy": 5.210115051269531, "epoch": 7.3087188612099645, "grad_norm": 1.2890625, "learning_rate": 0.00012713622678381392, "loss": 4.4717, "mean_token_accuracy": 0.2761309951543808, "num_tokens": 169362697.0, "step": 73935 }, { "entropy": 5.239693450927734, "epoch": 7.309213127718466, "grad_norm": 1.1171875, "learning_rate": 0.0001271096291185322, "loss": 4.5605, "mean_token_accuracy": 0.2617296874523163, "num_tokens": 169375413.0, "step": 73940 }, { "entropy": 5.194718265533448, "epoch": 7.309707394226967, "grad_norm": 1.3125, "learning_rate": 0.00012708303509137656, "loss": 4.4631, "mean_token_accuracy": 0.26489336490631105, "num_tokens": 169387258.0, "step": 73945 }, { "entropy": 5.293722867965698, "epoch": 7.310201660735468, "grad_norm": 1.25, "learning_rate": 0.00012705644470300127, "loss": 4.632, "mean_token_accuracy": 0.2555695712566376, "num_tokens": 169399216.0, "step": 73950 }, { "entropy": 5.2810361862182615, "epoch": 7.3106959272439695, "grad_norm": 1.4296875, "learning_rate": 0.00012702985795406025, "loss": 4.6831, "mean_token_accuracy": 0.25739351063966753, "num_tokens": 169410495.0, "step": 73955 }, { "entropy": 5.28129243850708, "epoch": 7.311190193752472, "grad_norm": 1.125, "learning_rate": 0.00012700327484520775, "loss": 4.6365, "mean_token_accuracy": 0.26153198778629305, "num_tokens": 169423236.0, "step": 73960 }, { "entropy": 5.216413354873657, "epoch": 7.311684460260973, "grad_norm": 1.1328125, "learning_rate": 0.00012697669537709767, "loss": 4.562, "mean_token_accuracy": 0.2632574260234833, "num_tokens": 169434873.0, "step": 73965 }, { "entropy": 5.268910264968872, "epoch": 7.312178726769474, "grad_norm": 1.2890625, "learning_rate": 0.0001269501195503838, "loss": 4.5999, "mean_token_accuracy": 0.25995567440986633, "num_tokens": 169445704.0, "step": 73970 }, { "entropy": 5.169110202789307, "epoch": 7.3126729932779755, "grad_norm": 1.2734375, "learning_rate": 0.00012692354736572003, "loss": 4.5288, "mean_token_accuracy": 0.2732748031616211, "num_tokens": 169456469.0, "step": 73975 }, { "entropy": 5.254059600830078, "epoch": 7.313167259786477, "grad_norm": 1.2734375, "learning_rate": 0.00012689697882375988, "loss": 4.5726, "mean_token_accuracy": 0.26342832297086716, "num_tokens": 169466288.0, "step": 73980 }, { "entropy": 5.281072664260864, "epoch": 7.313661526294978, "grad_norm": 1.1796875, "learning_rate": 0.00012687041392515707, "loss": 4.5985, "mean_token_accuracy": 0.2599730953574181, "num_tokens": 169478460.0, "step": 73985 }, { "entropy": 5.199324226379394, "epoch": 7.314155792803479, "grad_norm": 1.2890625, "learning_rate": 0.00012684385267056503, "loss": 4.505, "mean_token_accuracy": 0.26475115716457365, "num_tokens": 169489671.0, "step": 73990 }, { "entropy": 5.2197582721710205, "epoch": 7.314650059311981, "grad_norm": 1.3203125, "learning_rate": 0.0001268172950606372, "loss": 4.5179, "mean_token_accuracy": 0.26859537810087203, "num_tokens": 169501142.0, "step": 73995 }, { "entropy": 5.230081176757812, "epoch": 7.315144325820483, "grad_norm": 1.3046875, "learning_rate": 0.00012679074109602702, "loss": 4.6229, "mean_token_accuracy": 0.26106095761060716, "num_tokens": 169513184.0, "step": 74000 }, { "entropy": 5.200557804107666, "epoch": 7.315638592328984, "grad_norm": 1.25, "learning_rate": 0.00012676419077738748, "loss": 4.4716, "mean_token_accuracy": 0.2727104753255844, "num_tokens": 169524480.0, "step": 74005 }, { "entropy": 5.236250162124634, "epoch": 7.316132858837485, "grad_norm": 1.2578125, "learning_rate": 0.00012673764410537185, "loss": 4.6051, "mean_token_accuracy": 0.2593095749616623, "num_tokens": 169535647.0, "step": 74010 }, { "entropy": 5.172912645339966, "epoch": 7.3166271253459865, "grad_norm": 1.1796875, "learning_rate": 0.00012671110108063326, "loss": 4.5171, "mean_token_accuracy": 0.27059424817562105, "num_tokens": 169546719.0, "step": 74015 }, { "entropy": 5.133782958984375, "epoch": 7.317121391854488, "grad_norm": 1.21875, "learning_rate": 0.0001266845617038244, "loss": 4.4258, "mean_token_accuracy": 0.2755672425031662, "num_tokens": 169556802.0, "step": 74020 }, { "entropy": 5.1847587585449215, "epoch": 7.317615658362989, "grad_norm": 1.28125, "learning_rate": 0.00012665802597559852, "loss": 4.5439, "mean_token_accuracy": 0.27064342647790907, "num_tokens": 169568436.0, "step": 74025 }, { "entropy": 5.202784585952759, "epoch": 7.318109924871491, "grad_norm": 1.34375, "learning_rate": 0.00012663149389660817, "loss": 4.4973, "mean_token_accuracy": 0.2705502986907959, "num_tokens": 169578543.0, "step": 74030 }, { "entropy": 5.2473835945129395, "epoch": 7.318604191379992, "grad_norm": 1.28125, "learning_rate": 0.00012660496546750601, "loss": 4.5422, "mean_token_accuracy": 0.2622927576303482, "num_tokens": 169589256.0, "step": 74035 }, { "entropy": 5.254028177261352, "epoch": 7.319098457888494, "grad_norm": 1.1484375, "learning_rate": 0.00012657844068894486, "loss": 4.5966, "mean_token_accuracy": 0.26402526050806047, "num_tokens": 169599545.0, "step": 74040 }, { "entropy": 5.167074394226074, "epoch": 7.319592724396995, "grad_norm": 1.296875, "learning_rate": 0.000126551919561577, "loss": 4.489, "mean_token_accuracy": 0.27256246507167814, "num_tokens": 169611098.0, "step": 74045 }, { "entropy": 5.282004880905151, "epoch": 7.320086990905496, "grad_norm": 1.2890625, "learning_rate": 0.00012652540208605496, "loss": 4.6249, "mean_token_accuracy": 0.2590049460530281, "num_tokens": 169621977.0, "step": 74050 }, { "entropy": 5.2716902732849125, "epoch": 7.3205812574139975, "grad_norm": 1.21875, "learning_rate": 0.000126498888263031, "loss": 4.5827, "mean_token_accuracy": 0.26379805356264113, "num_tokens": 169633625.0, "step": 74055 }, { "entropy": 5.16005311012268, "epoch": 7.321075523922499, "grad_norm": 1.21875, "learning_rate": 0.00012647237809315748, "loss": 4.4898, "mean_token_accuracy": 0.282286661863327, "num_tokens": 169645190.0, "step": 74060 }, { "entropy": 5.225019741058349, "epoch": 7.321569790431, "grad_norm": 1.171875, "learning_rate": 0.00012644587157708659, "loss": 4.5528, "mean_token_accuracy": 0.26128862500190736, "num_tokens": 169656147.0, "step": 74065 }, { "entropy": 5.294073009490967, "epoch": 7.322064056939502, "grad_norm": 1.4375, "learning_rate": 0.00012641936871547022, "loss": 4.6622, "mean_token_accuracy": 0.2509228095412254, "num_tokens": 169667717.0, "step": 74070 }, { "entropy": 5.252312326431275, "epoch": 7.322558323448003, "grad_norm": 1.171875, "learning_rate": 0.00012639286950896048, "loss": 4.5658, "mean_token_accuracy": 0.26026868671178816, "num_tokens": 169679663.0, "step": 74075 }, { "entropy": 5.240673017501831, "epoch": 7.323052589956505, "grad_norm": 1.3046875, "learning_rate": 0.0001263663739582091, "loss": 4.5856, "mean_token_accuracy": 0.2634709969162941, "num_tokens": 169690849.0, "step": 74080 }, { "entropy": 5.297485971450806, "epoch": 7.323546856465006, "grad_norm": 1.1953125, "learning_rate": 0.000126339882063868, "loss": 4.6205, "mean_token_accuracy": 0.25828603506088255, "num_tokens": 169701976.0, "step": 74085 }, { "entropy": 5.243375253677368, "epoch": 7.324041122973507, "grad_norm": 1.28125, "learning_rate": 0.00012631339382658893, "loss": 4.6132, "mean_token_accuracy": 0.2666434466838837, "num_tokens": 169713154.0, "step": 74090 }, { "entropy": 5.2132813930511475, "epoch": 7.324535389482008, "grad_norm": 1.203125, "learning_rate": 0.0001262869092470234, "loss": 4.5707, "mean_token_accuracy": 0.2684836879372597, "num_tokens": 169724879.0, "step": 74095 }, { "entropy": 5.163504266738892, "epoch": 7.32502965599051, "grad_norm": 1.15625, "learning_rate": 0.00012626042832582308, "loss": 4.5653, "mean_token_accuracy": 0.2751558169722557, "num_tokens": 169736596.0, "step": 74100 }, { "entropy": 5.196226024627686, "epoch": 7.325523922499012, "grad_norm": 1.109375, "learning_rate": 0.00012623395106363917, "loss": 4.5075, "mean_token_accuracy": 0.2781333774328232, "num_tokens": 169748656.0, "step": 74105 }, { "entropy": 5.193662405014038, "epoch": 7.326018189007513, "grad_norm": 1.2265625, "learning_rate": 0.0001262074774611231, "loss": 4.4807, "mean_token_accuracy": 0.27576456069946287, "num_tokens": 169759916.0, "step": 74110 }, { "entropy": 5.315469455718994, "epoch": 7.326512455516014, "grad_norm": 1.265625, "learning_rate": 0.0001261810075189263, "loss": 4.6183, "mean_token_accuracy": 0.2547431647777557, "num_tokens": 169770432.0, "step": 74115 }, { "entropy": 5.257714080810547, "epoch": 7.327006722024516, "grad_norm": 1.1875, "learning_rate": 0.00012615454123769972, "loss": 4.618, "mean_token_accuracy": 0.2587749555706978, "num_tokens": 169781663.0, "step": 74120 }, { "entropy": 5.252253007888794, "epoch": 7.327500988533017, "grad_norm": 1.265625, "learning_rate": 0.0001261280786180946, "loss": 4.5516, "mean_token_accuracy": 0.2642555132508278, "num_tokens": 169792888.0, "step": 74125 }, { "entropy": 5.2068065166473385, "epoch": 7.327995255041518, "grad_norm": 1.140625, "learning_rate": 0.00012610161966076177, "loss": 4.574, "mean_token_accuracy": 0.2619255483150482, "num_tokens": 169804771.0, "step": 74130 }, { "entropy": 5.242744731903076, "epoch": 7.328489521550019, "grad_norm": 1.296875, "learning_rate": 0.00012607516436635214, "loss": 4.5724, "mean_token_accuracy": 0.2620864689350128, "num_tokens": 169816176.0, "step": 74135 }, { "entropy": 5.201464033126831, "epoch": 7.328983788058521, "grad_norm": 1.140625, "learning_rate": 0.00012604871273551665, "loss": 4.5964, "mean_token_accuracy": 0.2656967416405678, "num_tokens": 169828348.0, "step": 74140 }, { "entropy": 5.206182241439819, "epoch": 7.329478054567023, "grad_norm": 1.2109375, "learning_rate": 0.00012602226476890593, "loss": 4.5943, "mean_token_accuracy": 0.26299852728843687, "num_tokens": 169839909.0, "step": 74145 }, { "entropy": 5.228201293945313, "epoch": 7.329972321075524, "grad_norm": 1.2578125, "learning_rate": 0.0001259958204671707, "loss": 4.5735, "mean_token_accuracy": 0.2600375771522522, "num_tokens": 169851750.0, "step": 74150 }, { "entropy": 5.296418237686157, "epoch": 7.330466587584025, "grad_norm": 1.3046875, "learning_rate": 0.00012596937983096125, "loss": 4.6312, "mean_token_accuracy": 0.260135580599308, "num_tokens": 169862559.0, "step": 74155 }, { "entropy": 5.244690799713135, "epoch": 7.330960854092527, "grad_norm": 1.328125, "learning_rate": 0.00012594294286092823, "loss": 4.5893, "mean_token_accuracy": 0.2611124023795128, "num_tokens": 169873626.0, "step": 74160 }, { "entropy": 5.244243049621582, "epoch": 7.331455120601028, "grad_norm": 1.21875, "learning_rate": 0.0001259165095577219, "loss": 4.5883, "mean_token_accuracy": 0.2735406577587128, "num_tokens": 169885140.0, "step": 74165 }, { "entropy": 5.268919849395752, "epoch": 7.331949387109529, "grad_norm": 1.421875, "learning_rate": 0.00012589007992199258, "loss": 4.6163, "mean_token_accuracy": 0.26395580619573594, "num_tokens": 169896108.0, "step": 74170 }, { "entropy": 5.159120321273804, "epoch": 7.33244365361803, "grad_norm": 1.2265625, "learning_rate": 0.00012586365395439054, "loss": 4.4479, "mean_token_accuracy": 0.27420809417963027, "num_tokens": 169907439.0, "step": 74175 }, { "entropy": 5.2249962329864506, "epoch": 7.332937920126533, "grad_norm": 1.1171875, "learning_rate": 0.00012583723165556564, "loss": 4.586, "mean_token_accuracy": 0.262772361934185, "num_tokens": 169918192.0, "step": 74180 }, { "entropy": 5.212595891952515, "epoch": 7.333432186635034, "grad_norm": 1.1875, "learning_rate": 0.00012581081302616797, "loss": 4.5403, "mean_token_accuracy": 0.2648119077086449, "num_tokens": 169929631.0, "step": 74185 }, { "entropy": 5.225923156738281, "epoch": 7.333926453143535, "grad_norm": 1.203125, "learning_rate": 0.00012578439806684754, "loss": 4.5973, "mean_token_accuracy": 0.2577524855732918, "num_tokens": 169942101.0, "step": 74190 }, { "entropy": 5.28104248046875, "epoch": 7.334420719652036, "grad_norm": 1.25, "learning_rate": 0.00012575798677825388, "loss": 4.5894, "mean_token_accuracy": 0.2537999302148819, "num_tokens": 169952760.0, "step": 74195 }, { "entropy": 5.272366380691528, "epoch": 7.334914986160538, "grad_norm": 1.1015625, "learning_rate": 0.00012573157916103713, "loss": 4.6522, "mean_token_accuracy": 0.25905808955430987, "num_tokens": 169964573.0, "step": 74200 }, { "entropy": 5.173353862762451, "epoch": 7.335409252669039, "grad_norm": 1.171875, "learning_rate": 0.00012570517521584657, "loss": 4.5405, "mean_token_accuracy": 0.26734701693058016, "num_tokens": 169974815.0, "step": 74205 }, { "entropy": 5.2487081527709964, "epoch": 7.33590351917754, "grad_norm": 1.25, "learning_rate": 0.00012567877494333186, "loss": 4.5877, "mean_token_accuracy": 0.2632551580667496, "num_tokens": 169985234.0, "step": 74210 }, { "entropy": 5.211939525604248, "epoch": 7.336397785686042, "grad_norm": 1.234375, "learning_rate": 0.0001256523783441425, "loss": 4.5306, "mean_token_accuracy": 0.26577231734991075, "num_tokens": 169996262.0, "step": 74215 }, { "entropy": 5.25543851852417, "epoch": 7.3368920521945435, "grad_norm": 1.265625, "learning_rate": 0.00012562598541892775, "loss": 4.6127, "mean_token_accuracy": 0.26113244891166687, "num_tokens": 170007485.0, "step": 74220 }, { "entropy": 5.223996114730835, "epoch": 7.337386318703045, "grad_norm": 1.2734375, "learning_rate": 0.00012559959616833695, "loss": 4.5752, "mean_token_accuracy": 0.26390461176633834, "num_tokens": 170018998.0, "step": 74225 }, { "entropy": 5.257875251770019, "epoch": 7.337880585211546, "grad_norm": 1.28125, "learning_rate": 0.00012557321059301923, "loss": 4.5636, "mean_token_accuracy": 0.26687755435705185, "num_tokens": 170029621.0, "step": 74230 }, { "entropy": 5.191927766799926, "epoch": 7.338374851720047, "grad_norm": 1.3046875, "learning_rate": 0.0001255468286936237, "loss": 4.5086, "mean_token_accuracy": 0.26863858103752136, "num_tokens": 170040052.0, "step": 74235 }, { "entropy": 5.243706369400025, "epoch": 7.338869118228549, "grad_norm": 1.265625, "learning_rate": 0.0001255204504707995, "loss": 4.5531, "mean_token_accuracy": 0.263622884452343, "num_tokens": 170052172.0, "step": 74240 }, { "entropy": 5.246645259857178, "epoch": 7.33936338473705, "grad_norm": 1.1484375, "learning_rate": 0.0001254940759251953, "loss": 4.5606, "mean_token_accuracy": 0.2706174448132515, "num_tokens": 170064172.0, "step": 74245 }, { "entropy": 5.2071222305297855, "epoch": 7.339857651245552, "grad_norm": 1.28125, "learning_rate": 0.00012546770505746002, "loss": 4.5596, "mean_token_accuracy": 0.27191802859306335, "num_tokens": 170075671.0, "step": 74250 }, { "entropy": 5.330451917648316, "epoch": 7.340351917754053, "grad_norm": 1.1328125, "learning_rate": 0.00012544133786824242, "loss": 4.6712, "mean_token_accuracy": 0.25521310120821, "num_tokens": 170087808.0, "step": 74255 }, { "entropy": 5.223151969909668, "epoch": 7.3408461842625545, "grad_norm": 1.2109375, "learning_rate": 0.00012541497435819104, "loss": 4.5436, "mean_token_accuracy": 0.2713595166802406, "num_tokens": 170099277.0, "step": 74260 }, { "entropy": 5.215784645080566, "epoch": 7.341340450771056, "grad_norm": 1.25, "learning_rate": 0.00012538861452795466, "loss": 4.5387, "mean_token_accuracy": 0.26769301742315293, "num_tokens": 170111749.0, "step": 74265 }, { "entropy": 5.247968435287476, "epoch": 7.341834717279557, "grad_norm": 1.296875, "learning_rate": 0.00012536225837818146, "loss": 4.6031, "mean_token_accuracy": 0.2570097029209137, "num_tokens": 170123852.0, "step": 74270 }, { "entropy": 5.264144229888916, "epoch": 7.342328983788058, "grad_norm": 1.2890625, "learning_rate": 0.00012533590590951994, "loss": 4.6312, "mean_token_accuracy": 0.26113529205322267, "num_tokens": 170135091.0, "step": 74275 }, { "entropy": 5.2511499404907225, "epoch": 7.34282325029656, "grad_norm": 1.2265625, "learning_rate": 0.00012530955712261837, "loss": 4.6274, "mean_token_accuracy": 0.25877041816711427, "num_tokens": 170147451.0, "step": 74280 }, { "entropy": 5.255330896377563, "epoch": 7.343317516805062, "grad_norm": 1.3828125, "learning_rate": 0.0001252832120181248, "loss": 4.5973, "mean_token_accuracy": 0.2573800802230835, "num_tokens": 170158462.0, "step": 74285 }, { "entropy": 5.313303375244141, "epoch": 7.343811783313563, "grad_norm": 1.1796875, "learning_rate": 0.00012525687059668762, "loss": 4.6808, "mean_token_accuracy": 0.2517364278435707, "num_tokens": 170169777.0, "step": 74290 }, { "entropy": 5.278412818908691, "epoch": 7.344306049822064, "grad_norm": 1.21875, "learning_rate": 0.00012523053285895454, "loss": 4.6115, "mean_token_accuracy": 0.2626757755875587, "num_tokens": 170180566.0, "step": 74295 }, { "entropy": 5.2446705341339115, "epoch": 7.3448003163305655, "grad_norm": 1.203125, "learning_rate": 0.0001252041988055736, "loss": 4.5903, "mean_token_accuracy": 0.2645950511097908, "num_tokens": 170192680.0, "step": 74300 }, { "entropy": 5.202595853805542, "epoch": 7.345294582839067, "grad_norm": 1.2890625, "learning_rate": 0.0001251778684371927, "loss": 4.5623, "mean_token_accuracy": 0.27042843848466874, "num_tokens": 170203227.0, "step": 74305 }, { "entropy": 5.205570840835572, "epoch": 7.345788849347568, "grad_norm": 1.15625, "learning_rate": 0.0001251515417544593, "loss": 4.5461, "mean_token_accuracy": 0.2624956384301186, "num_tokens": 170215448.0, "step": 74310 }, { "entropy": 5.269005346298218, "epoch": 7.346283115856069, "grad_norm": 1.3359375, "learning_rate": 0.00012512521875802137, "loss": 4.5526, "mean_token_accuracy": 0.2626664400100708, "num_tokens": 170225629.0, "step": 74315 }, { "entropy": 5.203117990493775, "epoch": 7.346777382364571, "grad_norm": 1.25, "learning_rate": 0.00012509889944852627, "loss": 4.5371, "mean_token_accuracy": 0.27430999726057054, "num_tokens": 170236307.0, "step": 74320 }, { "entropy": 5.2447216510772705, "epoch": 7.347271648873073, "grad_norm": 1.2890625, "learning_rate": 0.00012507258382662146, "loss": 4.5764, "mean_token_accuracy": 0.2698583498597145, "num_tokens": 170247375.0, "step": 74325 }, { "entropy": 5.234501218795776, "epoch": 7.347765915381574, "grad_norm": 1.2421875, "learning_rate": 0.00012504627189295446, "loss": 4.5718, "mean_token_accuracy": 0.26343501955270765, "num_tokens": 170259659.0, "step": 74330 }, { "entropy": 5.25532283782959, "epoch": 7.348260181890075, "grad_norm": 1.265625, "learning_rate": 0.0001250199636481723, "loss": 4.5925, "mean_token_accuracy": 0.2638989552855492, "num_tokens": 170271802.0, "step": 74335 }, { "entropy": 5.213837957382202, "epoch": 7.3487544483985765, "grad_norm": 1.3515625, "learning_rate": 0.00012499365909292236, "loss": 4.5774, "mean_token_accuracy": 0.26322889178991316, "num_tokens": 170283130.0, "step": 74340 }, { "entropy": 5.252455139160157, "epoch": 7.349248714907078, "grad_norm": 1.296875, "learning_rate": 0.00012496735822785165, "loss": 4.5797, "mean_token_accuracy": 0.26087250411510465, "num_tokens": 170294210.0, "step": 74345 }, { "entropy": 5.2652500629425045, "epoch": 7.349742981415579, "grad_norm": 1.296875, "learning_rate": 0.00012494106105360723, "loss": 4.5949, "mean_token_accuracy": 0.2645349368453026, "num_tokens": 170305132.0, "step": 74350 }, { "entropy": 5.180490112304687, "epoch": 7.35023724792408, "grad_norm": 1.2578125, "learning_rate": 0.00012491476757083605, "loss": 4.4741, "mean_token_accuracy": 0.2753192991018295, "num_tokens": 170316445.0, "step": 74355 }, { "entropy": 5.205253982543946, "epoch": 7.350731514432582, "grad_norm": 1.2265625, "learning_rate": 0.00012488847778018477, "loss": 4.5545, "mean_token_accuracy": 0.26661075204610823, "num_tokens": 170328992.0, "step": 74360 }, { "entropy": 5.205904817581176, "epoch": 7.351225780941084, "grad_norm": 1.1953125, "learning_rate": 0.00012486219168230024, "loss": 4.5837, "mean_token_accuracy": 0.26560708284378054, "num_tokens": 170340441.0, "step": 74365 }, { "entropy": 5.229274034500122, "epoch": 7.351720047449585, "grad_norm": 1.1640625, "learning_rate": 0.0001248359092778291, "loss": 4.59, "mean_token_accuracy": 0.26217026710510255, "num_tokens": 170352125.0, "step": 74370 }, { "entropy": 5.2332998752594, "epoch": 7.352214313958086, "grad_norm": 1.1953125, "learning_rate": 0.00012480963056741786, "loss": 4.5703, "mean_token_accuracy": 0.2658066064119339, "num_tokens": 170364190.0, "step": 74375 }, { "entropy": 5.278696727752686, "epoch": 7.3527085804665875, "grad_norm": 1.3203125, "learning_rate": 0.00012478335555171313, "loss": 4.6567, "mean_token_accuracy": 0.2580010131001472, "num_tokens": 170375422.0, "step": 74380 }, { "entropy": 5.296224880218506, "epoch": 7.353202846975089, "grad_norm": 1.25, "learning_rate": 0.00012475708423136103, "loss": 4.5898, "mean_token_accuracy": 0.26630702018737795, "num_tokens": 170387482.0, "step": 74385 }, { "entropy": 5.24023404121399, "epoch": 7.35369711348359, "grad_norm": 1.21875, "learning_rate": 0.00012473081660700801, "loss": 4.5577, "mean_token_accuracy": 0.2694807782769203, "num_tokens": 170398406.0, "step": 74390 }, { "entropy": 5.26741132736206, "epoch": 7.354191379992091, "grad_norm": 1.1875, "learning_rate": 0.00012470455267930025, "loss": 4.635, "mean_token_accuracy": 0.25743494629859925, "num_tokens": 170410634.0, "step": 74395 }, { "entropy": 5.229983329772949, "epoch": 7.354685646500593, "grad_norm": 1.3203125, "learning_rate": 0.0001246782924488837, "loss": 4.5572, "mean_token_accuracy": 0.2704983353614807, "num_tokens": 170422402.0, "step": 74400 }, { "entropy": 5.25115180015564, "epoch": 7.355179913009095, "grad_norm": 1.15625, "learning_rate": 0.0001246520359164046, "loss": 4.552, "mean_token_accuracy": 0.2690530359745026, "num_tokens": 170432786.0, "step": 74405 }, { "entropy": 5.2387086868286135, "epoch": 7.355674179517596, "grad_norm": 1.3046875, "learning_rate": 0.00012462578308250868, "loss": 4.6327, "mean_token_accuracy": 0.2642141833901405, "num_tokens": 170444798.0, "step": 74410 }, { "entropy": 5.173683786392212, "epoch": 7.356168446026097, "grad_norm": 1.1796875, "learning_rate": 0.0001245995339478418, "loss": 4.5491, "mean_token_accuracy": 0.26832129061222076, "num_tokens": 170456629.0, "step": 74415 }, { "entropy": 5.260329675674439, "epoch": 7.3566627125345985, "grad_norm": 1.3203125, "learning_rate": 0.00012457328851304982, "loss": 4.6453, "mean_token_accuracy": 0.25973018556833266, "num_tokens": 170468227.0, "step": 74420 }, { "entropy": 5.226170206069947, "epoch": 7.3571569790431, "grad_norm": 1.25, "learning_rate": 0.00012454704677877817, "loss": 4.511, "mean_token_accuracy": 0.2756285846233368, "num_tokens": 170478841.0, "step": 74425 }, { "entropy": 5.192654085159302, "epoch": 7.357651245551601, "grad_norm": 1.2578125, "learning_rate": 0.00012452080874567254, "loss": 4.5264, "mean_token_accuracy": 0.26107215136289597, "num_tokens": 170490210.0, "step": 74430 }, { "entropy": 5.255162572860717, "epoch": 7.358145512060103, "grad_norm": 1.3515625, "learning_rate": 0.00012449457441437837, "loss": 4.5689, "mean_token_accuracy": 0.25967434495687486, "num_tokens": 170500946.0, "step": 74435 }, { "entropy": 5.272327899932861, "epoch": 7.358639778568604, "grad_norm": 1.2734375, "learning_rate": 0.000124468343785541, "loss": 4.6507, "mean_token_accuracy": 0.2591963917016983, "num_tokens": 170512190.0, "step": 74440 }, { "entropy": 5.1552399635314945, "epoch": 7.359134045077106, "grad_norm": 1.203125, "learning_rate": 0.0001244421168598058, "loss": 4.4346, "mean_token_accuracy": 0.2732748419046402, "num_tokens": 170523627.0, "step": 74445 }, { "entropy": 5.239118576049805, "epoch": 7.359628311585607, "grad_norm": 1.3125, "learning_rate": 0.0001244158936378178, "loss": 4.5597, "mean_token_accuracy": 0.2680023446679115, "num_tokens": 170535270.0, "step": 74450 }, { "entropy": 5.25790491104126, "epoch": 7.360122578094108, "grad_norm": 1.1640625, "learning_rate": 0.00012438967412022227, "loss": 4.5817, "mean_token_accuracy": 0.26585421711206436, "num_tokens": 170548613.0, "step": 74455 }, { "entropy": 5.255219125747681, "epoch": 7.3606168446026095, "grad_norm": 1.3203125, "learning_rate": 0.00012436345830766393, "loss": 4.6118, "mean_token_accuracy": 0.26003921031951904, "num_tokens": 170558716.0, "step": 74460 }, { "entropy": 5.1905285835266115, "epoch": 7.361111111111111, "grad_norm": 1.21875, "learning_rate": 0.000124337246200788, "loss": 4.4538, "mean_token_accuracy": 0.2822600483894348, "num_tokens": 170569916.0, "step": 74465 }, { "entropy": 5.183169746398926, "epoch": 7.361605377619613, "grad_norm": 1.171875, "learning_rate": 0.00012431103780023925, "loss": 4.5118, "mean_token_accuracy": 0.2736504033207893, "num_tokens": 170581587.0, "step": 74470 }, { "entropy": 5.157595252990722, "epoch": 7.362099644128114, "grad_norm": 1.1015625, "learning_rate": 0.00012428483310666227, "loss": 4.4558, "mean_token_accuracy": 0.2733989655971527, "num_tokens": 170592618.0, "step": 74475 }, { "entropy": 5.181404161453247, "epoch": 7.362593910636615, "grad_norm": 1.2265625, "learning_rate": 0.0001242586321207019, "loss": 4.5237, "mean_token_accuracy": 0.27210565358400346, "num_tokens": 170604877.0, "step": 74480 }, { "entropy": 5.255444526672363, "epoch": 7.363088177145117, "grad_norm": 1.359375, "learning_rate": 0.00012423243484300237, "loss": 4.5601, "mean_token_accuracy": 0.26849956512451173, "num_tokens": 170615765.0, "step": 74485 }, { "entropy": 5.226483249664307, "epoch": 7.363582443653618, "grad_norm": 1.21875, "learning_rate": 0.0001242062412742084, "loss": 4.5487, "mean_token_accuracy": 0.2693620935082436, "num_tokens": 170627368.0, "step": 74490 }, { "entropy": 5.218931007385254, "epoch": 7.364076710162119, "grad_norm": 1.203125, "learning_rate": 0.00012418005141496437, "loss": 4.606, "mean_token_accuracy": 0.26122166514396666, "num_tokens": 170638114.0, "step": 74495 }, { "entropy": 5.280763006210327, "epoch": 7.36457097667062, "grad_norm": 1.3046875, "learning_rate": 0.0001241538652659144, "loss": 4.6266, "mean_token_accuracy": 0.2625719130039215, "num_tokens": 170649226.0, "step": 74500 }, { "entropy": 5.168441247940064, "epoch": 7.365065243179123, "grad_norm": 1.234375, "learning_rate": 0.00012412768282770283, "loss": 4.5191, "mean_token_accuracy": 0.2741437956690788, "num_tokens": 170660637.0, "step": 74505 }, { "entropy": 5.22564697265625, "epoch": 7.365559509687624, "grad_norm": 1.2109375, "learning_rate": 0.00012410150410097358, "loss": 4.5897, "mean_token_accuracy": 0.260001003742218, "num_tokens": 170672232.0, "step": 74510 }, { "entropy": 5.1813677787780765, "epoch": 7.366053776196125, "grad_norm": 1.3125, "learning_rate": 0.00012407532908637067, "loss": 4.5867, "mean_token_accuracy": 0.2609397053718567, "num_tokens": 170684437.0, "step": 74515 }, { "entropy": 5.2472851276397705, "epoch": 7.366548042704626, "grad_norm": 1.328125, "learning_rate": 0.00012404915778453822, "loss": 4.5668, "mean_token_accuracy": 0.27172316908836364, "num_tokens": 170695650.0, "step": 74520 }, { "entropy": 5.186187982559204, "epoch": 7.367042309213128, "grad_norm": 1.234375, "learning_rate": 0.00012402299019611987, "loss": 4.4966, "mean_token_accuracy": 0.2755932331085205, "num_tokens": 170706495.0, "step": 74525 }, { "entropy": 5.247493314743042, "epoch": 7.367536575721629, "grad_norm": 1.1875, "learning_rate": 0.0001239968263217594, "loss": 4.5789, "mean_token_accuracy": 0.26425130367279054, "num_tokens": 170717607.0, "step": 74530 }, { "entropy": 5.234564971923828, "epoch": 7.36803084223013, "grad_norm": 1.2734375, "learning_rate": 0.0001239706661621004, "loss": 4.5995, "mean_token_accuracy": 0.2648230820894241, "num_tokens": 170728167.0, "step": 74535 }, { "entropy": 5.162325429916382, "epoch": 7.368525108738632, "grad_norm": 1.234375, "learning_rate": 0.00012394450971778642, "loss": 4.5333, "mean_token_accuracy": 0.2677912190556526, "num_tokens": 170740247.0, "step": 74540 }, { "entropy": 5.252008867263794, "epoch": 7.369019375247134, "grad_norm": 1.2890625, "learning_rate": 0.00012391835698946093, "loss": 4.5754, "mean_token_accuracy": 0.26857229620218276, "num_tokens": 170751155.0, "step": 74545 }, { "entropy": 5.231952476501465, "epoch": 7.369513641755635, "grad_norm": 1.2890625, "learning_rate": 0.00012389220797776732, "loss": 4.5713, "mean_token_accuracy": 0.2685425579547882, "num_tokens": 170762942.0, "step": 74550 }, { "entropy": 5.191277885437012, "epoch": 7.370007908264136, "grad_norm": 1.25, "learning_rate": 0.0001238660626833489, "loss": 4.4863, "mean_token_accuracy": 0.2805729806423187, "num_tokens": 170773707.0, "step": 74555 }, { "entropy": 5.1511232376098635, "epoch": 7.370502174772637, "grad_norm": 1.171875, "learning_rate": 0.00012383992110684872, "loss": 4.4491, "mean_token_accuracy": 0.2771089941263199, "num_tokens": 170785365.0, "step": 74560 }, { "entropy": 5.238719081878662, "epoch": 7.370996441281139, "grad_norm": 1.21875, "learning_rate": 0.0001238137832489099, "loss": 4.6039, "mean_token_accuracy": 0.258779288828373, "num_tokens": 170797096.0, "step": 74565 }, { "entropy": 5.252119874954223, "epoch": 7.37149070778964, "grad_norm": 1.359375, "learning_rate": 0.00012378764911017556, "loss": 4.6263, "mean_token_accuracy": 0.2591172203421593, "num_tokens": 170807973.0, "step": 74570 }, { "entropy": 5.21496729850769, "epoch": 7.371984974298141, "grad_norm": 1.234375, "learning_rate": 0.00012376151869128836, "loss": 4.5995, "mean_token_accuracy": 0.26110918670892713, "num_tokens": 170820537.0, "step": 74575 }, { "entropy": 5.235373592376709, "epoch": 7.372479240806643, "grad_norm": 1.1328125, "learning_rate": 0.0001237353919928914, "loss": 4.5695, "mean_token_accuracy": 0.2671471893787384, "num_tokens": 170832841.0, "step": 74580 }, { "entropy": 5.2483972072601315, "epoch": 7.372973507315145, "grad_norm": 1.09375, "learning_rate": 0.00012370926901562722, "loss": 4.5277, "mean_token_accuracy": 0.2662645414471626, "num_tokens": 170844041.0, "step": 74585 }, { "entropy": 5.2799030303955075, "epoch": 7.373467773823646, "grad_norm": 1.265625, "learning_rate": 0.00012368314976013848, "loss": 4.5812, "mean_token_accuracy": 0.2590077191591263, "num_tokens": 170854011.0, "step": 74590 }, { "entropy": 5.213988399505615, "epoch": 7.373962040332147, "grad_norm": 1.203125, "learning_rate": 0.0001236570342270678, "loss": 4.4844, "mean_token_accuracy": 0.26564261317253113, "num_tokens": 170865614.0, "step": 74595 }, { "entropy": 5.197944211959839, "epoch": 7.374456306840648, "grad_norm": 1.3203125, "learning_rate": 0.00012363092241705746, "loss": 4.5803, "mean_token_accuracy": 0.2672542780637741, "num_tokens": 170876205.0, "step": 74600 }, { "entropy": 5.253616189956665, "epoch": 7.37495057334915, "grad_norm": 1.28125, "learning_rate": 0.00012360481433074994, "loss": 4.569, "mean_token_accuracy": 0.26735360771417616, "num_tokens": 170886853.0, "step": 74605 }, { "entropy": 5.226565265655518, "epoch": 7.375444839857651, "grad_norm": 1.1484375, "learning_rate": 0.00012357870996878746, "loss": 4.5988, "mean_token_accuracy": 0.2594291761517525, "num_tokens": 170899020.0, "step": 74610 }, { "entropy": 5.275108003616333, "epoch": 7.375939106366153, "grad_norm": 1.25, "learning_rate": 0.0001235526093318122, "loss": 4.6344, "mean_token_accuracy": 0.261941696703434, "num_tokens": 170911089.0, "step": 74615 }, { "entropy": 5.299591493606568, "epoch": 7.376433372874654, "grad_norm": 1.2734375, "learning_rate": 0.00012352651242046632, "loss": 4.6562, "mean_token_accuracy": 0.2528620660305023, "num_tokens": 170922564.0, "step": 74620 }, { "entropy": 5.2878035545349125, "epoch": 7.3769276393831555, "grad_norm": 1.2578125, "learning_rate": 0.0001235004192353917, "loss": 4.5744, "mean_token_accuracy": 0.266646209359169, "num_tokens": 170933725.0, "step": 74625 }, { "entropy": 5.303745985031128, "epoch": 7.377421905891657, "grad_norm": 1.1328125, "learning_rate": 0.00012347432977723023, "loss": 4.6871, "mean_token_accuracy": 0.25468299388885496, "num_tokens": 170946172.0, "step": 74630 }, { "entropy": 5.241760396957398, "epoch": 7.377916172400158, "grad_norm": 1.3125, "learning_rate": 0.00012344824404662377, "loss": 4.5877, "mean_token_accuracy": 0.2581347495317459, "num_tokens": 170957136.0, "step": 74635 }, { "entropy": 5.23803858757019, "epoch": 7.378410438908659, "grad_norm": 1.1328125, "learning_rate": 0.00012342216204421402, "loss": 4.5927, "mean_token_accuracy": 0.2654098108410835, "num_tokens": 170969867.0, "step": 74640 }, { "entropy": 5.282253646850586, "epoch": 7.378904705417161, "grad_norm": 1.28125, "learning_rate": 0.00012339608377064267, "loss": 4.6582, "mean_token_accuracy": 0.2600959002971649, "num_tokens": 170982085.0, "step": 74645 }, { "entropy": 5.2814678192138675, "epoch": 7.379398971925662, "grad_norm": 1.1875, "learning_rate": 0.00012337000922655112, "loss": 4.6379, "mean_token_accuracy": 0.25884919613599777, "num_tokens": 170993750.0, "step": 74650 }, { "entropy": 5.1911403179168705, "epoch": 7.379893238434164, "grad_norm": 1.1484375, "learning_rate": 0.0001233439384125808, "loss": 4.5249, "mean_token_accuracy": 0.2609786599874496, "num_tokens": 171005380.0, "step": 74655 }, { "entropy": 5.15911455154419, "epoch": 7.380387504942665, "grad_norm": 1.1875, "learning_rate": 0.0001233178713293732, "loss": 4.4679, "mean_token_accuracy": 0.272866553068161, "num_tokens": 171016557.0, "step": 74660 }, { "entropy": 5.305637454986572, "epoch": 7.3808817714511665, "grad_norm": 1.2578125, "learning_rate": 0.00012329180797756946, "loss": 4.7024, "mean_token_accuracy": 0.24284356236457824, "num_tokens": 171028734.0, "step": 74665 }, { "entropy": 5.197470474243164, "epoch": 7.381376037959668, "grad_norm": 1.25, "learning_rate": 0.00012326574835781087, "loss": 4.5547, "mean_token_accuracy": 0.26153724938631057, "num_tokens": 171040873.0, "step": 74670 }, { "entropy": 5.355240726470948, "epoch": 7.381870304468169, "grad_norm": 1.2421875, "learning_rate": 0.00012323969247073833, "loss": 4.6985, "mean_token_accuracy": 0.25817800015211106, "num_tokens": 171051737.0, "step": 74675 }, { "entropy": 5.191502046585083, "epoch": 7.38236457097667, "grad_norm": 1.1015625, "learning_rate": 0.0001232136403169929, "loss": 4.5391, "mean_token_accuracy": 0.2716840147972107, "num_tokens": 171064658.0, "step": 74680 }, { "entropy": 5.274101591110229, "epoch": 7.382858837485172, "grad_norm": 1.2734375, "learning_rate": 0.00012318759189721554, "loss": 4.5817, "mean_token_accuracy": 0.2643309265375137, "num_tokens": 171076743.0, "step": 74685 }, { "entropy": 5.224762344360352, "epoch": 7.383353103993674, "grad_norm": 1.2109375, "learning_rate": 0.0001231615472120468, "loss": 4.5934, "mean_token_accuracy": 0.2658058777451515, "num_tokens": 171087866.0, "step": 74690 }, { "entropy": 5.292978763580322, "epoch": 7.383847370502175, "grad_norm": 1.3828125, "learning_rate": 0.00012313550626212773, "loss": 4.6055, "mean_token_accuracy": 0.2604446321725845, "num_tokens": 171099393.0, "step": 74695 }, { "entropy": 5.20666913986206, "epoch": 7.384341637010676, "grad_norm": 1.2890625, "learning_rate": 0.0001231094690480987, "loss": 4.5603, "mean_token_accuracy": 0.27197395414114, "num_tokens": 171109401.0, "step": 74700 }, { "entropy": 5.2157317161560055, "epoch": 7.3848359035191775, "grad_norm": 1.25, "learning_rate": 0.00012308343557060025, "loss": 4.5986, "mean_token_accuracy": 0.26536028236150744, "num_tokens": 171122021.0, "step": 74705 }, { "entropy": 5.23674201965332, "epoch": 7.385330170027679, "grad_norm": 1.2890625, "learning_rate": 0.00012305740583027296, "loss": 4.5978, "mean_token_accuracy": 0.25946044474840163, "num_tokens": 171134068.0, "step": 74710 }, { "entropy": 5.227276706695557, "epoch": 7.38582443653618, "grad_norm": 1.328125, "learning_rate": 0.00012303137982775698, "loss": 4.5641, "mean_token_accuracy": 0.2732822418212891, "num_tokens": 171145829.0, "step": 74715 }, { "entropy": 5.248414945602417, "epoch": 7.386318703044681, "grad_norm": 1.2578125, "learning_rate": 0.0001230053575636926, "loss": 4.5559, "mean_token_accuracy": 0.26267027109861374, "num_tokens": 171155992.0, "step": 74720 }, { "entropy": 5.210202741622925, "epoch": 7.3868129695531834, "grad_norm": 1.1953125, "learning_rate": 0.00012297933903872006, "loss": 4.5636, "mean_token_accuracy": 0.2769497573375702, "num_tokens": 171167340.0, "step": 74725 }, { "entropy": 5.198537397384643, "epoch": 7.387307236061685, "grad_norm": 1.1796875, "learning_rate": 0.00012295332425347935, "loss": 4.459, "mean_token_accuracy": 0.27677105367183685, "num_tokens": 171177217.0, "step": 74730 }, { "entropy": 5.252870845794678, "epoch": 7.387801502570186, "grad_norm": 1.171875, "learning_rate": 0.0001229273132086105, "loss": 4.5935, "mean_token_accuracy": 0.26120019555091856, "num_tokens": 171187641.0, "step": 74735 }, { "entropy": 5.202311992645264, "epoch": 7.388295769078687, "grad_norm": 1.1796875, "learning_rate": 0.00012290130590475326, "loss": 4.5485, "mean_token_accuracy": 0.26310430765151976, "num_tokens": 171199197.0, "step": 74740 }, { "entropy": 5.25360255241394, "epoch": 7.3887900355871885, "grad_norm": 1.265625, "learning_rate": 0.00012287530234254753, "loss": 4.5682, "mean_token_accuracy": 0.2628894343972206, "num_tokens": 171211582.0, "step": 74745 }, { "entropy": 5.197438287734985, "epoch": 7.38928430209569, "grad_norm": 1.1640625, "learning_rate": 0.00012284930252263294, "loss": 4.5295, "mean_token_accuracy": 0.26666954159736633, "num_tokens": 171223310.0, "step": 74750 }, { "entropy": 5.1802326202392575, "epoch": 7.389778568604191, "grad_norm": 1.234375, "learning_rate": 0.0001228233064456491, "loss": 4.5213, "mean_token_accuracy": 0.2700916975736618, "num_tokens": 171233795.0, "step": 74755 }, { "entropy": 5.231805086135864, "epoch": 7.390272835112693, "grad_norm": 1.2265625, "learning_rate": 0.0001227973141122356, "loss": 4.5773, "mean_token_accuracy": 0.27171596586704255, "num_tokens": 171245441.0, "step": 74760 }, { "entropy": 5.222051286697388, "epoch": 7.390767101621194, "grad_norm": 1.125, "learning_rate": 0.00012277132552303177, "loss": 4.5901, "mean_token_accuracy": 0.26068210154771804, "num_tokens": 171257725.0, "step": 74765 }, { "entropy": 5.226305294036865, "epoch": 7.391261368129696, "grad_norm": 1.21875, "learning_rate": 0.00012274534067867687, "loss": 4.5073, "mean_token_accuracy": 0.26596860587596893, "num_tokens": 171270418.0, "step": 74770 }, { "entropy": 5.168382406234741, "epoch": 7.391755634638197, "grad_norm": 1.2421875, "learning_rate": 0.00012271935957981035, "loss": 4.5257, "mean_token_accuracy": 0.2665985658764839, "num_tokens": 171282114.0, "step": 74775 }, { "entropy": 5.317291975021362, "epoch": 7.392249901146698, "grad_norm": 1.1328125, "learning_rate": 0.000122693382227071, "loss": 4.6665, "mean_token_accuracy": 0.26218786388635634, "num_tokens": 171294020.0, "step": 74780 }, { "entropy": 5.25276255607605, "epoch": 7.3927441676551995, "grad_norm": 1.2890625, "learning_rate": 0.00012266740862109824, "loss": 4.6206, "mean_token_accuracy": 0.2634960666298866, "num_tokens": 171304879.0, "step": 74785 }, { "entropy": 5.1931596279144285, "epoch": 7.393238434163701, "grad_norm": 1.2421875, "learning_rate": 0.0001226414387625308, "loss": 4.5765, "mean_token_accuracy": 0.2674698904156685, "num_tokens": 171315408.0, "step": 74790 }, { "entropy": 5.151736831665039, "epoch": 7.393732700672203, "grad_norm": 1.2109375, "learning_rate": 0.0001226154726520076, "loss": 4.4802, "mean_token_accuracy": 0.2771413564682007, "num_tokens": 171326054.0, "step": 74795 }, { "entropy": 5.223635244369507, "epoch": 7.394226967180704, "grad_norm": 1.296875, "learning_rate": 0.0001225895102901675, "loss": 4.6011, "mean_token_accuracy": 0.26259397715330124, "num_tokens": 171337855.0, "step": 74800 }, { "entropy": 5.188091659545899, "epoch": 7.394721233689205, "grad_norm": 1.203125, "learning_rate": 0.00012256355167764894, "loss": 4.5077, "mean_token_accuracy": 0.268871882557869, "num_tokens": 171349148.0, "step": 74805 }, { "entropy": 5.165610027313233, "epoch": 7.395215500197707, "grad_norm": 1.1875, "learning_rate": 0.0001225375968150908, "loss": 4.5137, "mean_token_accuracy": 0.2749935492873192, "num_tokens": 171360913.0, "step": 74810 }, { "entropy": 5.252191019058228, "epoch": 7.395709766706208, "grad_norm": 1.2109375, "learning_rate": 0.00012251164570313132, "loss": 4.5218, "mean_token_accuracy": 0.2680677130818367, "num_tokens": 171371607.0, "step": 74815 }, { "entropy": 5.287251091003418, "epoch": 7.396204033214709, "grad_norm": 1.1484375, "learning_rate": 0.00012248569834240908, "loss": 4.644, "mean_token_accuracy": 0.2567828357219696, "num_tokens": 171383378.0, "step": 74820 }, { "entropy": 5.3388079643249515, "epoch": 7.3966982997232105, "grad_norm": 1.28125, "learning_rate": 0.00012245975473356235, "loss": 4.7202, "mean_token_accuracy": 0.2508750751614571, "num_tokens": 171394555.0, "step": 74825 }, { "entropy": 5.220835208892822, "epoch": 7.397192566231712, "grad_norm": 1.28125, "learning_rate": 0.00012243381487722925, "loss": 4.4595, "mean_token_accuracy": 0.2641181692481041, "num_tokens": 171406492.0, "step": 74830 }, { "entropy": 5.304851007461548, "epoch": 7.397686832740214, "grad_norm": 1.1953125, "learning_rate": 0.000122407878774048, "loss": 4.6054, "mean_token_accuracy": 0.2671892762184143, "num_tokens": 171417798.0, "step": 74835 }, { "entropy": 5.182568311691284, "epoch": 7.398181099248715, "grad_norm": 1.3984375, "learning_rate": 0.00012238194642465657, "loss": 4.4817, "mean_token_accuracy": 0.27398335486650466, "num_tokens": 171428003.0, "step": 74840 }, { "entropy": 5.270332622528076, "epoch": 7.398675365757216, "grad_norm": 1.25, "learning_rate": 0.00012235601782969294, "loss": 4.553, "mean_token_accuracy": 0.2659351885318756, "num_tokens": 171438557.0, "step": 74845 }, { "entropy": 5.220889282226563, "epoch": 7.399169632265718, "grad_norm": 1.25, "learning_rate": 0.00012233009298979507, "loss": 4.5629, "mean_token_accuracy": 0.26738538444042204, "num_tokens": 171451411.0, "step": 74850 }, { "entropy": 5.210763359069825, "epoch": 7.399663898774219, "grad_norm": 1.140625, "learning_rate": 0.00012230417190560046, "loss": 4.5331, "mean_token_accuracy": 0.26517919450998306, "num_tokens": 171463212.0, "step": 74855 }, { "entropy": 5.207248640060425, "epoch": 7.40015816528272, "grad_norm": 1.2734375, "learning_rate": 0.000122278254577747, "loss": 4.5249, "mean_token_accuracy": 0.2694620996713638, "num_tokens": 171474599.0, "step": 74860 }, { "entropy": 5.19547324180603, "epoch": 7.4006524317912215, "grad_norm": 1.1171875, "learning_rate": 0.00012225234100687204, "loss": 4.5274, "mean_token_accuracy": 0.2723425507545471, "num_tokens": 171486210.0, "step": 74865 }, { "entropy": 5.206286382675171, "epoch": 7.401146698299724, "grad_norm": 1.2265625, "learning_rate": 0.00012222643119361325, "loss": 4.5532, "mean_token_accuracy": 0.2703338205814362, "num_tokens": 171498554.0, "step": 74870 }, { "entropy": 5.202288818359375, "epoch": 7.401640964808225, "grad_norm": 1.1328125, "learning_rate": 0.00012220052513860804, "loss": 4.5487, "mean_token_accuracy": 0.26135028898715973, "num_tokens": 171510122.0, "step": 74875 }, { "entropy": 5.245243310928345, "epoch": 7.402135231316726, "grad_norm": 1.2109375, "learning_rate": 0.00012217462284249352, "loss": 4.5343, "mean_token_accuracy": 0.263710530102253, "num_tokens": 171521425.0, "step": 74880 }, { "entropy": 5.231138467788696, "epoch": 7.402629497825227, "grad_norm": 1.1171875, "learning_rate": 0.00012214872430590706, "loss": 4.602, "mean_token_accuracy": 0.2612730860710144, "num_tokens": 171532696.0, "step": 74885 }, { "entropy": 5.1298661708831785, "epoch": 7.403123764333729, "grad_norm": 1.1796875, "learning_rate": 0.00012212282952948566, "loss": 4.4115, "mean_token_accuracy": 0.2765574872493744, "num_tokens": 171542704.0, "step": 74890 }, { "entropy": 5.266536855697632, "epoch": 7.40361803084223, "grad_norm": 1.2578125, "learning_rate": 0.00012209693851386626, "loss": 4.6702, "mean_token_accuracy": 0.2528069391846657, "num_tokens": 171553504.0, "step": 74895 }, { "entropy": 5.175312662124634, "epoch": 7.404112297350731, "grad_norm": 1.296875, "learning_rate": 0.00012207105125968605, "loss": 4.4979, "mean_token_accuracy": 0.27063881754875185, "num_tokens": 171564460.0, "step": 74900 }, { "entropy": 5.232900476455688, "epoch": 7.404606563859232, "grad_norm": 1.3046875, "learning_rate": 0.00012204516776758165, "loss": 4.5342, "mean_token_accuracy": 0.27457430213689804, "num_tokens": 171575535.0, "step": 74905 }, { "entropy": 5.2725067138671875, "epoch": 7.405100830367735, "grad_norm": 1.2421875, "learning_rate": 0.0001220192880381899, "loss": 4.6291, "mean_token_accuracy": 0.2528455853462219, "num_tokens": 171586587.0, "step": 74910 }, { "entropy": 5.251657104492187, "epoch": 7.405595096876236, "grad_norm": 1.4140625, "learning_rate": 0.00012199341207214733, "loss": 4.5468, "mean_token_accuracy": 0.2598506689071655, "num_tokens": 171595745.0, "step": 74915 }, { "entropy": 5.2384766101837155, "epoch": 7.406089363384737, "grad_norm": 1.171875, "learning_rate": 0.00012196753987009056, "loss": 4.601, "mean_token_accuracy": 0.26782525330781937, "num_tokens": 171607705.0, "step": 74920 }, { "entropy": 5.176247930526733, "epoch": 7.406583629893238, "grad_norm": 1.3203125, "learning_rate": 0.00012194167143265606, "loss": 4.5015, "mean_token_accuracy": 0.27369713932275774, "num_tokens": 171619540.0, "step": 74925 }, { "entropy": 5.134706687927246, "epoch": 7.40707789640174, "grad_norm": 1.1953125, "learning_rate": 0.00012191580676048019, "loss": 4.4655, "mean_token_accuracy": 0.273667985200882, "num_tokens": 171630354.0, "step": 74930 }, { "entropy": 5.207948303222656, "epoch": 7.407572162910241, "grad_norm": 1.234375, "learning_rate": 0.00012188994585419928, "loss": 4.5666, "mean_token_accuracy": 0.264286407828331, "num_tokens": 171640164.0, "step": 74935 }, { "entropy": 5.186639881134033, "epoch": 7.408066429418742, "grad_norm": 1.2421875, "learning_rate": 0.00012186408871444939, "loss": 4.504, "mean_token_accuracy": 0.2722065165638924, "num_tokens": 171650955.0, "step": 74940 }, { "entropy": 5.195226669311523, "epoch": 7.408560695927244, "grad_norm": 1.28125, "learning_rate": 0.00012183823534186665, "loss": 4.5913, "mean_token_accuracy": 0.26107683032751083, "num_tokens": 171663149.0, "step": 74945 }, { "entropy": 5.271490573883057, "epoch": 7.409054962435746, "grad_norm": 1.3046875, "learning_rate": 0.00012181238573708711, "loss": 4.5894, "mean_token_accuracy": 0.262879504263401, "num_tokens": 171674566.0, "step": 74950 }, { "entropy": 5.23148775100708, "epoch": 7.409549228944247, "grad_norm": 1.3125, "learning_rate": 0.00012178653990074666, "loss": 4.5408, "mean_token_accuracy": 0.2736702173948288, "num_tokens": 171685331.0, "step": 74955 }, { "entropy": 5.267395782470703, "epoch": 7.410043495452748, "grad_norm": 1.203125, "learning_rate": 0.00012176069783348112, "loss": 4.5635, "mean_token_accuracy": 0.26457529664039614, "num_tokens": 171696610.0, "step": 74960 }, { "entropy": 5.274857091903686, "epoch": 7.410537761961249, "grad_norm": 1.1328125, "learning_rate": 0.00012173485953592617, "loss": 4.5979, "mean_token_accuracy": 0.2581078574061394, "num_tokens": 171708038.0, "step": 74965 }, { "entropy": 5.290732955932617, "epoch": 7.411032028469751, "grad_norm": 1.375, "learning_rate": 0.00012170902500871741, "loss": 4.636, "mean_token_accuracy": 0.26019635498523713, "num_tokens": 171719280.0, "step": 74970 }, { "entropy": 5.187883901596069, "epoch": 7.411526294978252, "grad_norm": 1.203125, "learning_rate": 0.00012168319425249051, "loss": 4.5189, "mean_token_accuracy": 0.27392726987600324, "num_tokens": 171731421.0, "step": 74975 }, { "entropy": 5.201569890975952, "epoch": 7.412020561486754, "grad_norm": 1.25, "learning_rate": 0.00012165736726788065, "loss": 4.555, "mean_token_accuracy": 0.2659627810120583, "num_tokens": 171742660.0, "step": 74980 }, { "entropy": 5.2572722911834715, "epoch": 7.412514827995255, "grad_norm": 1.1171875, "learning_rate": 0.00012163154405552351, "loss": 4.6387, "mean_token_accuracy": 0.25964721441268923, "num_tokens": 171755624.0, "step": 74985 }, { "entropy": 5.24476261138916, "epoch": 7.413009094503757, "grad_norm": 1.2421875, "learning_rate": 0.00012160572461605412, "loss": 4.5814, "mean_token_accuracy": 0.26208294481039046, "num_tokens": 171766733.0, "step": 74990 }, { "entropy": 5.289907169342041, "epoch": 7.413503361012258, "grad_norm": 1.15625, "learning_rate": 0.00012157990895010767, "loss": 4.6224, "mean_token_accuracy": 0.26036072969436647, "num_tokens": 171777880.0, "step": 74995 }, { "entropy": 5.272825622558594, "epoch": 7.413997627520759, "grad_norm": 1.328125, "learning_rate": 0.00012155409705831936, "loss": 4.6858, "mean_token_accuracy": 0.2552195504307747, "num_tokens": 171788408.0, "step": 75000 }, { "epoch": 7.413997627520759, "eval_entropy": 4.994098243912794, "eval_loss": 4.771187782287598, "eval_mean_token_accuracy": 0.2575540785713243, "eval_num_tokens": 171788408.0, "eval_runtime": 26.5714, "eval_samples_per_second": 1223.611, "eval_steps_per_second": 152.984, "step": 75000 }, { "entropy": 5.256529188156128, "epoch": 7.41449189402926, "grad_norm": 1.21875, "learning_rate": 0.00012152828894132396, "loss": 4.5872, "mean_token_accuracy": 0.2629727154970169, "num_tokens": 171800555.0, "step": 75005 }, { "entropy": 5.243283128738403, "epoch": 7.414986160537762, "grad_norm": 1.2890625, "learning_rate": 0.00012150248459975647, "loss": 4.5717, "mean_token_accuracy": 0.2669977992773056, "num_tokens": 171810810.0, "step": 75010 }, { "entropy": 5.226061868667602, "epoch": 7.415480427046264, "grad_norm": 1.1796875, "learning_rate": 0.0001214766840342517, "loss": 4.6244, "mean_token_accuracy": 0.25850004851818087, "num_tokens": 171822946.0, "step": 75015 }, { "entropy": 5.180850410461426, "epoch": 7.415974693554765, "grad_norm": 1.3125, "learning_rate": 0.0001214508872454443, "loss": 4.5128, "mean_token_accuracy": 0.2680710211396217, "num_tokens": 171833675.0, "step": 75020 }, { "entropy": 5.264504861831665, "epoch": 7.416468960063266, "grad_norm": 1.25, "learning_rate": 0.00012142509423396899, "loss": 4.6421, "mean_token_accuracy": 0.2608497217297554, "num_tokens": 171844572.0, "step": 75025 }, { "entropy": 5.284695863723755, "epoch": 7.4169632265717675, "grad_norm": 1.2578125, "learning_rate": 0.00012139930500046009, "loss": 4.6413, "mean_token_accuracy": 0.2542721390724182, "num_tokens": 171855211.0, "step": 75030 }, { "entropy": 5.299073839187622, "epoch": 7.417457493080269, "grad_norm": 1.3125, "learning_rate": 0.00012137351954555212, "loss": 4.6043, "mean_token_accuracy": 0.2598477303981781, "num_tokens": 171867406.0, "step": 75035 }, { "entropy": 5.262567806243896, "epoch": 7.41795175958877, "grad_norm": 1.21875, "learning_rate": 0.00012134773786987942, "loss": 4.628, "mean_token_accuracy": 0.26423651427030564, "num_tokens": 171879342.0, "step": 75040 }, { "entropy": 5.308240795135498, "epoch": 7.418446026097271, "grad_norm": 1.09375, "learning_rate": 0.00012132195997407618, "loss": 4.6186, "mean_token_accuracy": 0.25900211930274963, "num_tokens": 171891286.0, "step": 75045 }, { "entropy": 5.273779582977295, "epoch": 7.4189402926057735, "grad_norm": 1.34375, "learning_rate": 0.00012129618585877665, "loss": 4.6, "mean_token_accuracy": 0.26321523189544677, "num_tokens": 171902034.0, "step": 75050 }, { "entropy": 5.206686544418335, "epoch": 7.419434559114275, "grad_norm": 1.2734375, "learning_rate": 0.00012127041552461471, "loss": 4.5103, "mean_token_accuracy": 0.2692201629281044, "num_tokens": 171914374.0, "step": 75055 }, { "entropy": 5.176935052871704, "epoch": 7.419928825622776, "grad_norm": 1.203125, "learning_rate": 0.0001212446489722244, "loss": 4.4464, "mean_token_accuracy": 0.2739392340183258, "num_tokens": 171926450.0, "step": 75060 }, { "entropy": 5.279509162902832, "epoch": 7.420423092131277, "grad_norm": 1.375, "learning_rate": 0.00012121888620223966, "loss": 4.6423, "mean_token_accuracy": 0.25421401113271713, "num_tokens": 171937844.0, "step": 75065 }, { "entropy": 5.230914068222046, "epoch": 7.4209173586397785, "grad_norm": 1.09375, "learning_rate": 0.00012119312721529403, "loss": 4.6183, "mean_token_accuracy": 0.25926397889852526, "num_tokens": 171951202.0, "step": 75070 }, { "entropy": 5.217959976196289, "epoch": 7.42141162514828, "grad_norm": 1.25, "learning_rate": 0.00012116737201202148, "loss": 4.5923, "mean_token_accuracy": 0.2616573229432106, "num_tokens": 171962846.0, "step": 75075 }, { "entropy": 5.214110279083252, "epoch": 7.421905891656781, "grad_norm": 1.171875, "learning_rate": 0.00012114162059305536, "loss": 4.535, "mean_token_accuracy": 0.2709119290113449, "num_tokens": 171974140.0, "step": 75080 }, { "entropy": 5.287134981155395, "epoch": 7.422400158165282, "grad_norm": 1.296875, "learning_rate": 0.00012111587295902924, "loss": 4.6646, "mean_token_accuracy": 0.254581680893898, "num_tokens": 171984695.0, "step": 75085 }, { "entropy": 5.283200740814209, "epoch": 7.4228944246737845, "grad_norm": 1.2109375, "learning_rate": 0.00012109012911057661, "loss": 4.557, "mean_token_accuracy": 0.26768269687891005, "num_tokens": 171995354.0, "step": 75090 }, { "entropy": 5.241543865203857, "epoch": 7.423388691182286, "grad_norm": 1.296875, "learning_rate": 0.00012106438904833058, "loss": 4.6373, "mean_token_accuracy": 0.26488236784935, "num_tokens": 172006288.0, "step": 75095 }, { "entropy": 5.293914031982422, "epoch": 7.423882957690787, "grad_norm": 1.21875, "learning_rate": 0.00012103865277292448, "loss": 4.6268, "mean_token_accuracy": 0.2523027628660202, "num_tokens": 172018125.0, "step": 75100 }, { "entropy": 5.1873187065124515, "epoch": 7.424377224199288, "grad_norm": 1.2265625, "learning_rate": 0.0001210129202849914, "loss": 4.5614, "mean_token_accuracy": 0.2719331756234169, "num_tokens": 172029634.0, "step": 75105 }, { "entropy": 5.260724401473999, "epoch": 7.4248714907077895, "grad_norm": 1.3203125, "learning_rate": 0.00012098719158516438, "loss": 4.5358, "mean_token_accuracy": 0.2730811223387718, "num_tokens": 172041007.0, "step": 75110 }, { "entropy": 5.27560715675354, "epoch": 7.425365757216291, "grad_norm": 1.328125, "learning_rate": 0.00012096146667407641, "loss": 4.5942, "mean_token_accuracy": 0.2653541430830956, "num_tokens": 172052076.0, "step": 75115 }, { "entropy": 5.302388858795166, "epoch": 7.425860023724792, "grad_norm": 1.2734375, "learning_rate": 0.00012093574555236018, "loss": 4.572, "mean_token_accuracy": 0.25602252781391144, "num_tokens": 172062175.0, "step": 75120 }, { "entropy": 5.258176279067993, "epoch": 7.426354290233294, "grad_norm": 1.390625, "learning_rate": 0.00012091002822064852, "loss": 4.6002, "mean_token_accuracy": 0.26658201962709427, "num_tokens": 172073360.0, "step": 75125 }, { "entropy": 5.285116147994995, "epoch": 7.4268485567417954, "grad_norm": 1.3125, "learning_rate": 0.00012088431467957405, "loss": 4.6646, "mean_token_accuracy": 0.2536815941333771, "num_tokens": 172085002.0, "step": 75130 }, { "entropy": 5.243993806838989, "epoch": 7.427342823250297, "grad_norm": 1.1640625, "learning_rate": 0.00012085860492976935, "loss": 4.585, "mean_token_accuracy": 0.26286178529262544, "num_tokens": 172097106.0, "step": 75135 }, { "entropy": 5.197301864624023, "epoch": 7.427837089758798, "grad_norm": 1.171875, "learning_rate": 0.00012083289897186696, "loss": 4.5851, "mean_token_accuracy": 0.2630989268422127, "num_tokens": 172108188.0, "step": 75140 }, { "entropy": 5.180536603927612, "epoch": 7.428331356267299, "grad_norm": 1.2421875, "learning_rate": 0.00012080719680649913, "loss": 4.4876, "mean_token_accuracy": 0.2691995590925217, "num_tokens": 172119571.0, "step": 75145 }, { "entropy": 5.21832242012024, "epoch": 7.4288256227758005, "grad_norm": 1.203125, "learning_rate": 0.00012078149843429814, "loss": 4.5626, "mean_token_accuracy": 0.2652028754353523, "num_tokens": 172129751.0, "step": 75150 }, { "entropy": 5.269549417495727, "epoch": 7.429319889284302, "grad_norm": 1.1640625, "learning_rate": 0.00012075580385589623, "loss": 4.5679, "mean_token_accuracy": 0.2654275640845299, "num_tokens": 172141934.0, "step": 75155 }, { "entropy": 5.193792915344238, "epoch": 7.429814155792803, "grad_norm": 1.171875, "learning_rate": 0.00012073011307192547, "loss": 4.5242, "mean_token_accuracy": 0.2722728490829468, "num_tokens": 172154100.0, "step": 75160 }, { "entropy": 5.218025779724121, "epoch": 7.430308422301305, "grad_norm": 1.1875, "learning_rate": 0.00012070442608301792, "loss": 4.5573, "mean_token_accuracy": 0.2661681517958641, "num_tokens": 172166534.0, "step": 75165 }, { "entropy": 5.22477388381958, "epoch": 7.430802688809806, "grad_norm": 1.203125, "learning_rate": 0.00012067874288980538, "loss": 4.5436, "mean_token_accuracy": 0.262647944688797, "num_tokens": 172178045.0, "step": 75170 }, { "entropy": 5.204665040969848, "epoch": 7.431296955318308, "grad_norm": 1.1953125, "learning_rate": 0.00012065306349291969, "loss": 4.5657, "mean_token_accuracy": 0.2680748403072357, "num_tokens": 172188886.0, "step": 75175 }, { "entropy": 5.264751958847046, "epoch": 7.431791221826809, "grad_norm": 1.21875, "learning_rate": 0.00012062738789299264, "loss": 4.564, "mean_token_accuracy": 0.26312771886587144, "num_tokens": 172200887.0, "step": 75180 }, { "entropy": 5.2239641666412355, "epoch": 7.43228548833531, "grad_norm": 1.21875, "learning_rate": 0.00012060171609065569, "loss": 4.6129, "mean_token_accuracy": 0.2600596100091934, "num_tokens": 172214113.0, "step": 75185 }, { "entropy": 5.196199417114258, "epoch": 7.4327797548438115, "grad_norm": 1.1953125, "learning_rate": 0.00012057604808654059, "loss": 4.5684, "mean_token_accuracy": 0.259472531080246, "num_tokens": 172226589.0, "step": 75190 }, { "entropy": 5.196777296066284, "epoch": 7.433274021352313, "grad_norm": 1.2109375, "learning_rate": 0.0001205503838812786, "loss": 4.5252, "mean_token_accuracy": 0.26703921109437945, "num_tokens": 172238357.0, "step": 75195 }, { "entropy": 5.250608921051025, "epoch": 7.433768287860815, "grad_norm": 1.2578125, "learning_rate": 0.00012052472347550113, "loss": 4.6285, "mean_token_accuracy": 0.2598643586039543, "num_tokens": 172250208.0, "step": 75200 }, { "entropy": 5.233974885940552, "epoch": 7.434262554369316, "grad_norm": 1.15625, "learning_rate": 0.00012049906686983953, "loss": 4.543, "mean_token_accuracy": 0.2632968097925186, "num_tokens": 172260891.0, "step": 75205 }, { "entropy": 5.263339233398438, "epoch": 7.434756820877817, "grad_norm": 1.2734375, "learning_rate": 0.00012047341406492473, "loss": 4.5841, "mean_token_accuracy": 0.2526812359690666, "num_tokens": 172272015.0, "step": 75210 }, { "entropy": 5.228964614868164, "epoch": 7.435251087386319, "grad_norm": 1.1640625, "learning_rate": 0.00012044776506138793, "loss": 4.5314, "mean_token_accuracy": 0.2700814068317413, "num_tokens": 172282937.0, "step": 75215 }, { "entropy": 5.303991222381592, "epoch": 7.43574535389482, "grad_norm": 1.1328125, "learning_rate": 0.00012042211985986011, "loss": 4.6308, "mean_token_accuracy": 0.2559472396969795, "num_tokens": 172294242.0, "step": 75220 }, { "entropy": 5.259810066223144, "epoch": 7.436239620403321, "grad_norm": 1.25, "learning_rate": 0.0001203964784609721, "loss": 4.5522, "mean_token_accuracy": 0.2675279974937439, "num_tokens": 172305461.0, "step": 75225 }, { "entropy": 5.196534061431885, "epoch": 7.4367338869118225, "grad_norm": 1.34375, "learning_rate": 0.00012037084086535478, "loss": 4.4975, "mean_token_accuracy": 0.27286178469657896, "num_tokens": 172316479.0, "step": 75230 }, { "entropy": 5.229730415344238, "epoch": 7.437228153420325, "grad_norm": 1.3046875, "learning_rate": 0.0001203452070736387, "loss": 4.6555, "mean_token_accuracy": 0.2643014147877693, "num_tokens": 172328315.0, "step": 75235 }, { "entropy": 5.2406991481781, "epoch": 7.437722419928826, "grad_norm": 1.15625, "learning_rate": 0.0001203195770864545, "loss": 4.5861, "mean_token_accuracy": 0.2627797544002533, "num_tokens": 172340538.0, "step": 75240 }, { "entropy": 5.243765163421631, "epoch": 7.438216686437327, "grad_norm": 1.2734375, "learning_rate": 0.00012029395090443272, "loss": 4.6071, "mean_token_accuracy": 0.2601391330361366, "num_tokens": 172352611.0, "step": 75245 }, { "entropy": 5.211069393157959, "epoch": 7.438710952945828, "grad_norm": 1.09375, "learning_rate": 0.00012026832852820373, "loss": 4.5448, "mean_token_accuracy": 0.26916062980890276, "num_tokens": 172364184.0, "step": 75250 }, { "entropy": 5.185953569412232, "epoch": 7.43920521945433, "grad_norm": 1.3203125, "learning_rate": 0.00012024270995839797, "loss": 4.5822, "mean_token_accuracy": 0.2609278917312622, "num_tokens": 172375678.0, "step": 75255 }, { "entropy": 5.275656080245971, "epoch": 7.439699485962831, "grad_norm": 1.2109375, "learning_rate": 0.00012021709519564544, "loss": 4.5933, "mean_token_accuracy": 0.26290581226348875, "num_tokens": 172387900.0, "step": 75260 }, { "entropy": 5.175219964981079, "epoch": 7.440193752471332, "grad_norm": 1.15625, "learning_rate": 0.00012019148424057639, "loss": 4.4844, "mean_token_accuracy": 0.2732243999838829, "num_tokens": 172400035.0, "step": 75265 }, { "entropy": 5.2434858798980715, "epoch": 7.440688018979834, "grad_norm": 1.1875, "learning_rate": 0.00012016587709382086, "loss": 4.5934, "mean_token_accuracy": 0.2666741505265236, "num_tokens": 172411121.0, "step": 75270 }, { "entropy": 5.215916633605957, "epoch": 7.441182285488336, "grad_norm": 1.390625, "learning_rate": 0.00012014027375600876, "loss": 4.587, "mean_token_accuracy": 0.2645904377102852, "num_tokens": 172421005.0, "step": 75275 }, { "entropy": 5.207753610610962, "epoch": 7.441676551996837, "grad_norm": 1.3046875, "learning_rate": 0.00012011467422777005, "loss": 4.585, "mean_token_accuracy": 0.2631411671638489, "num_tokens": 172431534.0, "step": 75280 }, { "entropy": 5.089312028884888, "epoch": 7.442170818505338, "grad_norm": 1.15625, "learning_rate": 0.00012008907850973429, "loss": 4.3792, "mean_token_accuracy": 0.2860141769051552, "num_tokens": 172444083.0, "step": 75285 }, { "entropy": 5.237030744552612, "epoch": 7.442665085013839, "grad_norm": 1.0546875, "learning_rate": 0.00012006348660253122, "loss": 4.5809, "mean_token_accuracy": 0.2626106426119804, "num_tokens": 172457086.0, "step": 75290 }, { "entropy": 5.287483072280883, "epoch": 7.443159351522341, "grad_norm": 1.1484375, "learning_rate": 0.0001200378985067905, "loss": 4.6161, "mean_token_accuracy": 0.2672881707549095, "num_tokens": 172468930.0, "step": 75295 }, { "entropy": 5.220993852615356, "epoch": 7.443653618030842, "grad_norm": 1.1484375, "learning_rate": 0.00012001231422314136, "loss": 4.553, "mean_token_accuracy": 0.2718394696712494, "num_tokens": 172479501.0, "step": 75300 }, { "entropy": 5.219163990020752, "epoch": 7.444147884539344, "grad_norm": 1.3359375, "learning_rate": 0.00011998673375221349, "loss": 4.5399, "mean_token_accuracy": 0.2674765944480896, "num_tokens": 172491531.0, "step": 75305 }, { "entropy": 5.237482404708862, "epoch": 7.444642151047845, "grad_norm": 1.21875, "learning_rate": 0.00011996115709463595, "loss": 4.5578, "mean_token_accuracy": 0.26191122382879256, "num_tokens": 172502001.0, "step": 75310 }, { "entropy": 5.186817026138305, "epoch": 7.445136417556347, "grad_norm": 1.1953125, "learning_rate": 0.00011993558425103798, "loss": 4.5345, "mean_token_accuracy": 0.2596863225102425, "num_tokens": 172513514.0, "step": 75315 }, { "entropy": 5.236869668960571, "epoch": 7.445630684064848, "grad_norm": 1.203125, "learning_rate": 0.0001199100152220488, "loss": 4.5867, "mean_token_accuracy": 0.2565124467015266, "num_tokens": 172524930.0, "step": 75320 }, { "entropy": 5.279048061370849, "epoch": 7.446124950573349, "grad_norm": 1.25, "learning_rate": 0.0001198844500082972, "loss": 4.6658, "mean_token_accuracy": 0.2598829820752144, "num_tokens": 172537071.0, "step": 75325 }, { "entropy": 5.199527359008789, "epoch": 7.44661921708185, "grad_norm": 1.2578125, "learning_rate": 0.00011985888861041221, "loss": 4.4756, "mean_token_accuracy": 0.2743192449212074, "num_tokens": 172548335.0, "step": 75330 }, { "entropy": 5.243944931030273, "epoch": 7.447113483590352, "grad_norm": 1.21875, "learning_rate": 0.00011983333102902261, "loss": 4.559, "mean_token_accuracy": 0.2648904487490654, "num_tokens": 172559133.0, "step": 75335 }, { "entropy": 5.230036354064941, "epoch": 7.447607750098853, "grad_norm": 1.25, "learning_rate": 0.00011980777726475715, "loss": 4.5459, "mean_token_accuracy": 0.26934959888458254, "num_tokens": 172570633.0, "step": 75340 }, { "entropy": 5.198421764373779, "epoch": 7.448102016607355, "grad_norm": 1.1640625, "learning_rate": 0.00011978222731824454, "loss": 4.5733, "mean_token_accuracy": 0.26446501463651656, "num_tokens": 172582025.0, "step": 75345 }, { "entropy": 5.17492184638977, "epoch": 7.448596283115856, "grad_norm": 1.171875, "learning_rate": 0.0001197566811901131, "loss": 4.4734, "mean_token_accuracy": 0.27168049812316897, "num_tokens": 172594127.0, "step": 75350 }, { "entropy": 5.19339427947998, "epoch": 7.449090549624358, "grad_norm": 1.25, "learning_rate": 0.0001197311388809915, "loss": 4.4603, "mean_token_accuracy": 0.2724278599023819, "num_tokens": 172605272.0, "step": 75355 }, { "entropy": 5.288012981414795, "epoch": 7.449584816132859, "grad_norm": 1.265625, "learning_rate": 0.00011970560039150781, "loss": 4.5871, "mean_token_accuracy": 0.26730435639619826, "num_tokens": 172616512.0, "step": 75360 }, { "entropy": 5.184696197509766, "epoch": 7.45007908264136, "grad_norm": 1.078125, "learning_rate": 0.00011968006572229052, "loss": 4.5938, "mean_token_accuracy": 0.26752116084098815, "num_tokens": 172629045.0, "step": 75365 }, { "entropy": 5.259993171691894, "epoch": 7.450573349149861, "grad_norm": 1.1484375, "learning_rate": 0.00011965453487396775, "loss": 4.6476, "mean_token_accuracy": 0.26219973266124724, "num_tokens": 172641247.0, "step": 75370 }, { "entropy": 5.221776962280273, "epoch": 7.451067615658363, "grad_norm": 1.2265625, "learning_rate": 0.00011962900784716749, "loss": 4.5758, "mean_token_accuracy": 0.2602883085608482, "num_tokens": 172652426.0, "step": 75375 }, { "entropy": 5.2083882808685305, "epoch": 7.451561882166865, "grad_norm": 1.1875, "learning_rate": 0.0001196034846425178, "loss": 4.5471, "mean_token_accuracy": 0.2638195753097534, "num_tokens": 172663498.0, "step": 75380 }, { "entropy": 5.236769676208496, "epoch": 7.452056148675366, "grad_norm": 1.296875, "learning_rate": 0.00011957796526064642, "loss": 4.5546, "mean_token_accuracy": 0.2634562700986862, "num_tokens": 172674306.0, "step": 75385 }, { "entropy": 5.240098905563355, "epoch": 7.452550415183867, "grad_norm": 1.1953125, "learning_rate": 0.00011955244970218114, "loss": 4.5921, "mean_token_accuracy": 0.2641736567020416, "num_tokens": 172685778.0, "step": 75390 }, { "entropy": 5.1975305557250975, "epoch": 7.453044681692369, "grad_norm": 1.25, "learning_rate": 0.00011952693796774984, "loss": 4.4973, "mean_token_accuracy": 0.2742690458893776, "num_tokens": 172696228.0, "step": 75395 }, { "entropy": 5.28164119720459, "epoch": 7.45353894820087, "grad_norm": 1.2109375, "learning_rate": 0.00011950143005797993, "loss": 4.6193, "mean_token_accuracy": 0.26326464116573334, "num_tokens": 172707281.0, "step": 75400 }, { "entropy": 5.11743688583374, "epoch": 7.454033214709371, "grad_norm": 1.15625, "learning_rate": 0.00011947592597349904, "loss": 4.4051, "mean_token_accuracy": 0.28346823453903197, "num_tokens": 172718885.0, "step": 75405 }, { "entropy": 5.229951047897339, "epoch": 7.454527481217872, "grad_norm": 1.3046875, "learning_rate": 0.00011945042571493443, "loss": 4.6266, "mean_token_accuracy": 0.2602427124977112, "num_tokens": 172729389.0, "step": 75410 }, { "entropy": 5.223258018493652, "epoch": 7.455021747726374, "grad_norm": 1.1484375, "learning_rate": 0.00011942492928291346, "loss": 4.5352, "mean_token_accuracy": 0.265821647644043, "num_tokens": 172740992.0, "step": 75415 }, { "entropy": 5.245292377471924, "epoch": 7.455516014234876, "grad_norm": 1.25, "learning_rate": 0.00011939943667806338, "loss": 4.6206, "mean_token_accuracy": 0.2537680149078369, "num_tokens": 172752917.0, "step": 75420 }, { "entropy": 5.290964269638062, "epoch": 7.456010280743377, "grad_norm": 1.34375, "learning_rate": 0.00011937394790101127, "loss": 4.6379, "mean_token_accuracy": 0.2605794847011566, "num_tokens": 172763935.0, "step": 75425 }, { "entropy": 5.207364940643311, "epoch": 7.456504547251878, "grad_norm": 1.296875, "learning_rate": 0.00011934846295238428, "loss": 4.5052, "mean_token_accuracy": 0.2760830119252205, "num_tokens": 172774701.0, "step": 75430 }, { "entropy": 5.286254644393921, "epoch": 7.4569988137603795, "grad_norm": 1.2421875, "learning_rate": 0.0001193229818328092, "loss": 4.6108, "mean_token_accuracy": 0.25967694967985155, "num_tokens": 172785495.0, "step": 75435 }, { "entropy": 5.23651123046875, "epoch": 7.457493080268881, "grad_norm": 1.1484375, "learning_rate": 0.00011929750454291287, "loss": 4.642, "mean_token_accuracy": 0.26253560483455657, "num_tokens": 172796586.0, "step": 75440 }, { "entropy": 5.150218534469604, "epoch": 7.457987346777382, "grad_norm": 1.0703125, "learning_rate": 0.0001192720310833221, "loss": 4.551, "mean_token_accuracy": 0.2719713106751442, "num_tokens": 172809810.0, "step": 75445 }, { "entropy": 5.237038660049438, "epoch": 7.458481613285883, "grad_norm": 1.21875, "learning_rate": 0.00011924656145466354, "loss": 4.6214, "mean_token_accuracy": 0.2576499626040459, "num_tokens": 172822953.0, "step": 75450 }, { "entropy": 5.1980860233306885, "epoch": 7.4589758797943855, "grad_norm": 1.3046875, "learning_rate": 0.0001192210956575638, "loss": 4.5308, "mean_token_accuracy": 0.27149302512407303, "num_tokens": 172834555.0, "step": 75455 }, { "entropy": 5.130001878738403, "epoch": 7.459470146302887, "grad_norm": 1.3203125, "learning_rate": 0.00011919563369264919, "loss": 4.4723, "mean_token_accuracy": 0.27999889850616455, "num_tokens": 172846288.0, "step": 75460 }, { "entropy": 5.290650939941406, "epoch": 7.459964412811388, "grad_norm": 1.1796875, "learning_rate": 0.00011917017556054618, "loss": 4.623, "mean_token_accuracy": 0.25986464619636535, "num_tokens": 172857923.0, "step": 75465 }, { "entropy": 5.253837728500367, "epoch": 7.460458679319889, "grad_norm": 1.3046875, "learning_rate": 0.00011914472126188107, "loss": 4.6012, "mean_token_accuracy": 0.259272463619709, "num_tokens": 172869662.0, "step": 75470 }, { "entropy": 5.196332216262817, "epoch": 7.4609529458283905, "grad_norm": 1.3125, "learning_rate": 0.00011911927079727986, "loss": 4.5605, "mean_token_accuracy": 0.2697481021285057, "num_tokens": 172881628.0, "step": 75475 }, { "entropy": 5.275169420242309, "epoch": 7.461447212336892, "grad_norm": 1.3515625, "learning_rate": 0.00011909382416736895, "loss": 4.6285, "mean_token_accuracy": 0.26216124594211576, "num_tokens": 172892677.0, "step": 75480 }, { "entropy": 5.281612062454224, "epoch": 7.461941478845393, "grad_norm": 1.34375, "learning_rate": 0.00011906838137277404, "loss": 4.6003, "mean_token_accuracy": 0.25848768204450606, "num_tokens": 172905254.0, "step": 75485 }, { "entropy": 5.2496498107910154, "epoch": 7.462435745353895, "grad_norm": 1.2734375, "learning_rate": 0.00011904294241412114, "loss": 4.6231, "mean_token_accuracy": 0.25844815373420715, "num_tokens": 172915667.0, "step": 75490 }, { "entropy": 5.212923049926758, "epoch": 7.4629300118623965, "grad_norm": 1.25, "learning_rate": 0.00011901750729203614, "loss": 4.5602, "mean_token_accuracy": 0.26004581302404406, "num_tokens": 172929020.0, "step": 75495 }, { "entropy": 5.192802810668946, "epoch": 7.463424278370898, "grad_norm": 1.3046875, "learning_rate": 0.00011899207600714458, "loss": 4.5405, "mean_token_accuracy": 0.2627292200922966, "num_tokens": 172940673.0, "step": 75500 }, { "entropy": 5.235572147369385, "epoch": 7.463918544879399, "grad_norm": 1.328125, "learning_rate": 0.00011896664856007216, "loss": 4.5948, "mean_token_accuracy": 0.26508439481258395, "num_tokens": 172952363.0, "step": 75505 }, { "entropy": 5.249604368209839, "epoch": 7.4644128113879, "grad_norm": 1.1796875, "learning_rate": 0.00011894122495144438, "loss": 4.5947, "mean_token_accuracy": 0.26284260004758836, "num_tokens": 172965712.0, "step": 75510 }, { "entropy": 5.210896301269531, "epoch": 7.4649070778964015, "grad_norm": 1.1875, "learning_rate": 0.00011891580518188668, "loss": 4.5108, "mean_token_accuracy": 0.26777232587337496, "num_tokens": 172977155.0, "step": 75515 }, { "entropy": 5.214351224899292, "epoch": 7.465401344404903, "grad_norm": 1.2421875, "learning_rate": 0.00011889038925202447, "loss": 4.5101, "mean_token_accuracy": 0.2716622233390808, "num_tokens": 172987683.0, "step": 75520 }, { "entropy": 5.288757181167602, "epoch": 7.465895610913405, "grad_norm": 1.25, "learning_rate": 0.00011886497716248281, "loss": 4.7065, "mean_token_accuracy": 0.2504763901233673, "num_tokens": 172999945.0, "step": 75525 }, { "entropy": 5.2200836658477785, "epoch": 7.466389877421906, "grad_norm": 1.2265625, "learning_rate": 0.00011883956891388695, "loss": 4.5572, "mean_token_accuracy": 0.2732833281159401, "num_tokens": 173012490.0, "step": 75530 }, { "entropy": 5.333041858673096, "epoch": 7.4668841439304074, "grad_norm": 1.125, "learning_rate": 0.00011881416450686191, "loss": 4.7222, "mean_token_accuracy": 0.2525062322616577, "num_tokens": 173024943.0, "step": 75535 }, { "entropy": 5.261615467071533, "epoch": 7.467378410438909, "grad_norm": 1.7109375, "learning_rate": 0.00011878876394203267, "loss": 4.5708, "mean_token_accuracy": 0.2611012741923332, "num_tokens": 173035601.0, "step": 75540 }, { "entropy": 5.229714012145996, "epoch": 7.46787267694741, "grad_norm": 1.1875, "learning_rate": 0.00011876336722002414, "loss": 4.5887, "mean_token_accuracy": 0.2633156940340996, "num_tokens": 173046757.0, "step": 75545 }, { "entropy": 5.2936145782470705, "epoch": 7.468366943455911, "grad_norm": 1.1796875, "learning_rate": 0.00011873797434146092, "loss": 4.6552, "mean_token_accuracy": 0.2577627807855606, "num_tokens": 173058509.0, "step": 75550 }, { "entropy": 5.177542591094971, "epoch": 7.4688612099644125, "grad_norm": 1.1640625, "learning_rate": 0.00011871258530696781, "loss": 4.5006, "mean_token_accuracy": 0.2716598406434059, "num_tokens": 173069330.0, "step": 75555 }, { "entropy": 5.252414894104004, "epoch": 7.469355476472915, "grad_norm": 1.296875, "learning_rate": 0.00011868720011716937, "loss": 4.5997, "mean_token_accuracy": 0.2594504341483116, "num_tokens": 173080471.0, "step": 75560 }, { "entropy": 5.23164587020874, "epoch": 7.469849742981416, "grad_norm": 1.1796875, "learning_rate": 0.00011866181877268996, "loss": 4.566, "mean_token_accuracy": 0.2691803202033043, "num_tokens": 173092320.0, "step": 75565 }, { "entropy": 5.212649583816528, "epoch": 7.470344009489917, "grad_norm": 1.2890625, "learning_rate": 0.00011863644127415419, "loss": 4.5594, "mean_token_accuracy": 0.2639959305524826, "num_tokens": 173103337.0, "step": 75570 }, { "entropy": 5.191235780715942, "epoch": 7.470838275998418, "grad_norm": 1.2734375, "learning_rate": 0.00011861106762218612, "loss": 4.521, "mean_token_accuracy": 0.2682738840579987, "num_tokens": 173114656.0, "step": 75575 }, { "entropy": 5.243931913375855, "epoch": 7.47133254250692, "grad_norm": 1.2578125, "learning_rate": 0.00011858569781741009, "loss": 4.6279, "mean_token_accuracy": 0.2598437249660492, "num_tokens": 173124749.0, "step": 75580 }, { "entropy": 5.257168912887574, "epoch": 7.471826809015421, "grad_norm": 1.234375, "learning_rate": 0.00011856033186045022, "loss": 4.5905, "mean_token_accuracy": 0.26591374427080156, "num_tokens": 173135224.0, "step": 75585 }, { "entropy": 5.251258182525635, "epoch": 7.472321075523922, "grad_norm": 1.3359375, "learning_rate": 0.0001185349697519303, "loss": 4.6033, "mean_token_accuracy": 0.2600173220038414, "num_tokens": 173145732.0, "step": 75590 }, { "entropy": 5.245268154144287, "epoch": 7.4728153420324235, "grad_norm": 1.2578125, "learning_rate": 0.00011850961149247456, "loss": 4.5756, "mean_token_accuracy": 0.2655176505446434, "num_tokens": 173156164.0, "step": 75595 }, { "entropy": 5.253644847869873, "epoch": 7.473309608540926, "grad_norm": 1.296875, "learning_rate": 0.00011848425708270656, "loss": 4.5939, "mean_token_accuracy": 0.2590750515460968, "num_tokens": 173166492.0, "step": 75600 }, { "entropy": 5.234576749801636, "epoch": 7.473803875049427, "grad_norm": 1.203125, "learning_rate": 0.00011845890652325014, "loss": 4.5653, "mean_token_accuracy": 0.26835692673921585, "num_tokens": 173177586.0, "step": 75605 }, { "entropy": 5.226417875289917, "epoch": 7.474298141557928, "grad_norm": 1.2265625, "learning_rate": 0.00011843355981472897, "loss": 4.5193, "mean_token_accuracy": 0.2721798285841942, "num_tokens": 173188528.0, "step": 75610 }, { "entropy": 5.157406568527222, "epoch": 7.474792408066429, "grad_norm": 1.2265625, "learning_rate": 0.00011840821695776644, "loss": 4.463, "mean_token_accuracy": 0.2735909134149551, "num_tokens": 173199080.0, "step": 75615 }, { "entropy": 5.2847737789154055, "epoch": 7.475286674574931, "grad_norm": 1.21875, "learning_rate": 0.00011838287795298606, "loss": 4.6415, "mean_token_accuracy": 0.24975998401641847, "num_tokens": 173210548.0, "step": 75620 }, { "entropy": 5.269863653182983, "epoch": 7.475780941083432, "grad_norm": 1.1796875, "learning_rate": 0.0001183575428010112, "loss": 4.6112, "mean_token_accuracy": 0.2666441768407822, "num_tokens": 173221699.0, "step": 75625 }, { "entropy": 5.296450805664063, "epoch": 7.476275207591933, "grad_norm": 1.1796875, "learning_rate": 0.00011833221150246507, "loss": 4.6542, "mean_token_accuracy": 0.2645576685667038, "num_tokens": 173233437.0, "step": 75630 }, { "entropy": 5.205704307556152, "epoch": 7.476769474100435, "grad_norm": 1.1875, "learning_rate": 0.00011830688405797091, "loss": 4.4902, "mean_token_accuracy": 0.27208491414785385, "num_tokens": 173245496.0, "step": 75635 }, { "entropy": 5.171924257278443, "epoch": 7.477263740608937, "grad_norm": 1.34375, "learning_rate": 0.00011828156046815165, "loss": 4.5154, "mean_token_accuracy": 0.2732407316565514, "num_tokens": 173255967.0, "step": 75640 }, { "entropy": 5.179815578460693, "epoch": 7.477758007117438, "grad_norm": 1.3828125, "learning_rate": 0.00011825624073363032, "loss": 4.4744, "mean_token_accuracy": 0.26726692765951154, "num_tokens": 173266497.0, "step": 75645 }, { "entropy": 5.119639444351196, "epoch": 7.478252273625939, "grad_norm": 1.171875, "learning_rate": 0.00011823092485502978, "loss": 4.4569, "mean_token_accuracy": 0.27123589664697645, "num_tokens": 173278640.0, "step": 75650 }, { "entropy": 5.23880820274353, "epoch": 7.47874654013444, "grad_norm": 1.2421875, "learning_rate": 0.0001182056128329728, "loss": 4.6148, "mean_token_accuracy": 0.25518244653940203, "num_tokens": 173290193.0, "step": 75655 }, { "entropy": 5.273447322845459, "epoch": 7.479240806642942, "grad_norm": 1.1640625, "learning_rate": 0.00011818030466808215, "loss": 4.6011, "mean_token_accuracy": 0.26314484030008317, "num_tokens": 173302356.0, "step": 75660 }, { "entropy": 5.2098804950714115, "epoch": 7.479735073151443, "grad_norm": 1.1328125, "learning_rate": 0.00011815500036098026, "loss": 4.534, "mean_token_accuracy": 0.27401252239942553, "num_tokens": 173314915.0, "step": 75665 }, { "entropy": 5.2781373977661135, "epoch": 7.480229339659944, "grad_norm": 1.3046875, "learning_rate": 0.0001181296999122897, "loss": 4.5733, "mean_token_accuracy": 0.2647454857826233, "num_tokens": 173325047.0, "step": 75670 }, { "entropy": 5.245816278457641, "epoch": 7.480723606168446, "grad_norm": 1.1875, "learning_rate": 0.00011810440332263292, "loss": 4.6026, "mean_token_accuracy": 0.2582166478037834, "num_tokens": 173336554.0, "step": 75675 }, { "entropy": 5.237929964065552, "epoch": 7.481217872676948, "grad_norm": 1.203125, "learning_rate": 0.00011807911059263202, "loss": 4.5677, "mean_token_accuracy": 0.26046819388866427, "num_tokens": 173348282.0, "step": 75680 }, { "entropy": 5.300865888595581, "epoch": 7.481712139185449, "grad_norm": 1.1875, "learning_rate": 0.00011805382172290949, "loss": 4.6789, "mean_token_accuracy": 0.2620020195841789, "num_tokens": 173359278.0, "step": 75685 }, { "entropy": 5.241508054733276, "epoch": 7.48220640569395, "grad_norm": 1.359375, "learning_rate": 0.0001180285367140872, "loss": 4.5287, "mean_token_accuracy": 0.26858619004487994, "num_tokens": 173370331.0, "step": 75690 }, { "entropy": 5.282876300811767, "epoch": 7.482700672202451, "grad_norm": 1.2109375, "learning_rate": 0.00011800325556678727, "loss": 4.6367, "mean_token_accuracy": 0.25962417423725126, "num_tokens": 173381992.0, "step": 75695 }, { "entropy": 5.179863023757934, "epoch": 7.483194938710953, "grad_norm": 1.15625, "learning_rate": 0.0001179779782816317, "loss": 4.5171, "mean_token_accuracy": 0.27678101509809494, "num_tokens": 173393766.0, "step": 75700 }, { "entropy": 5.2742995262146, "epoch": 7.483689205219454, "grad_norm": 1.1328125, "learning_rate": 0.00011795270485924212, "loss": 4.6463, "mean_token_accuracy": 0.25846666246652605, "num_tokens": 173405013.0, "step": 75705 }, { "entropy": 5.215886068344116, "epoch": 7.484183471727956, "grad_norm": 1.234375, "learning_rate": 0.0001179274353002404, "loss": 4.5953, "mean_token_accuracy": 0.2556051626801491, "num_tokens": 173417162.0, "step": 75710 }, { "entropy": 5.298271703720093, "epoch": 7.484677738236457, "grad_norm": 1.28125, "learning_rate": 0.00011790216960524812, "loss": 4.6149, "mean_token_accuracy": 0.25723516643047334, "num_tokens": 173427160.0, "step": 75715 }, { "entropy": 5.200889205932617, "epoch": 7.485172004744959, "grad_norm": 1.1484375, "learning_rate": 0.00011787690777488684, "loss": 4.5348, "mean_token_accuracy": 0.269185209274292, "num_tokens": 173439688.0, "step": 75720 }, { "entropy": 5.219479703903199, "epoch": 7.48566627125346, "grad_norm": 1.203125, "learning_rate": 0.00011785164980977808, "loss": 4.5807, "mean_token_accuracy": 0.26455011665821077, "num_tokens": 173451206.0, "step": 75725 }, { "entropy": 5.27303729057312, "epoch": 7.486160537761961, "grad_norm": 1.3046875, "learning_rate": 0.00011782639571054305, "loss": 4.612, "mean_token_accuracy": 0.26511019468307495, "num_tokens": 173462203.0, "step": 75730 }, { "entropy": 5.230159568786621, "epoch": 7.486654804270462, "grad_norm": 1.296875, "learning_rate": 0.00011780114547780311, "loss": 4.5891, "mean_token_accuracy": 0.2562416300177574, "num_tokens": 173473527.0, "step": 75735 }, { "entropy": 5.187343311309815, "epoch": 7.487149070778964, "grad_norm": 1.2421875, "learning_rate": 0.00011777589911217928, "loss": 4.5189, "mean_token_accuracy": 0.2702476978302002, "num_tokens": 173484605.0, "step": 75740 }, { "entropy": 5.182696342468262, "epoch": 7.487643337287466, "grad_norm": 1.1953125, "learning_rate": 0.00011775065661429277, "loss": 4.4876, "mean_token_accuracy": 0.27385963350534437, "num_tokens": 173497037.0, "step": 75745 }, { "entropy": 5.2654601573944095, "epoch": 7.488137603795967, "grad_norm": 1.1953125, "learning_rate": 0.00011772541798476456, "loss": 4.5713, "mean_token_accuracy": 0.2656921148300171, "num_tokens": 173508616.0, "step": 75750 }, { "entropy": 5.2958855628967285, "epoch": 7.488631870304468, "grad_norm": 1.328125, "learning_rate": 0.00011770018322421542, "loss": 4.67, "mean_token_accuracy": 0.25707087367773057, "num_tokens": 173519696.0, "step": 75755 }, { "entropy": 5.195558214187622, "epoch": 7.48912613681297, "grad_norm": 1.2265625, "learning_rate": 0.00011767495233326624, "loss": 4.5328, "mean_token_accuracy": 0.2724606305360794, "num_tokens": 173530921.0, "step": 75760 }, { "entropy": 5.2373518466949465, "epoch": 7.489620403321471, "grad_norm": 1.125, "learning_rate": 0.0001176497253125375, "loss": 4.5331, "mean_token_accuracy": 0.2616334542632103, "num_tokens": 173541280.0, "step": 75765 }, { "entropy": 5.249787664413452, "epoch": 7.490114669829972, "grad_norm": 1.234375, "learning_rate": 0.00011762450216265, "loss": 4.6316, "mean_token_accuracy": 0.26069196164608, "num_tokens": 173552051.0, "step": 75770 }, { "entropy": 5.206330299377441, "epoch": 7.490608936338473, "grad_norm": 1.21875, "learning_rate": 0.00011759928288422421, "loss": 4.6053, "mean_token_accuracy": 0.26558497846126555, "num_tokens": 173564308.0, "step": 75775 }, { "entropy": 5.237198686599731, "epoch": 7.4911032028469755, "grad_norm": 1.234375, "learning_rate": 0.0001175740674778804, "loss": 4.6514, "mean_token_accuracy": 0.26616097539663314, "num_tokens": 173575621.0, "step": 75780 }, { "entropy": 5.231608438491821, "epoch": 7.491597469355477, "grad_norm": 1.140625, "learning_rate": 0.00011754885594423908, "loss": 4.5381, "mean_token_accuracy": 0.265227398276329, "num_tokens": 173587031.0, "step": 75785 }, { "entropy": 5.2734006404876705, "epoch": 7.492091735863978, "grad_norm": 1.3046875, "learning_rate": 0.00011752364828392022, "loss": 4.5844, "mean_token_accuracy": 0.2685595706105232, "num_tokens": 173598014.0, "step": 75790 }, { "entropy": 5.262399339675904, "epoch": 7.492586002372479, "grad_norm": 1.359375, "learning_rate": 0.00011749844449754398, "loss": 4.5283, "mean_token_accuracy": 0.26911924332380294, "num_tokens": 173608462.0, "step": 75795 }, { "entropy": 5.231385803222656, "epoch": 7.4930802688809806, "grad_norm": 1.3125, "learning_rate": 0.00011747324458573058, "loss": 4.5114, "mean_token_accuracy": 0.2713519364595413, "num_tokens": 173619831.0, "step": 75800 }, { "entropy": 5.304453325271607, "epoch": 7.493574535389482, "grad_norm": 1.1953125, "learning_rate": 0.00011744804854909971, "loss": 4.7017, "mean_token_accuracy": 0.2547744110226631, "num_tokens": 173633744.0, "step": 75805 }, { "entropy": 5.269426536560059, "epoch": 7.494068801897983, "grad_norm": 1.203125, "learning_rate": 0.00011742285638827142, "loss": 4.5804, "mean_token_accuracy": 0.25989399403333663, "num_tokens": 173645099.0, "step": 75810 }, { "entropy": 5.273804092407227, "epoch": 7.494563068406485, "grad_norm": 1.3125, "learning_rate": 0.00011739766810386517, "loss": 4.6064, "mean_token_accuracy": 0.2634726494550705, "num_tokens": 173655361.0, "step": 75815 }, { "entropy": 5.111127328872681, "epoch": 7.4950573349149865, "grad_norm": 1.21875, "learning_rate": 0.00011737248369650077, "loss": 4.3818, "mean_token_accuracy": 0.2816156104207039, "num_tokens": 173666318.0, "step": 75820 }, { "entropy": 5.311080741882324, "epoch": 7.495551601423488, "grad_norm": 1.28125, "learning_rate": 0.00011734730316679771, "loss": 4.6382, "mean_token_accuracy": 0.2635973647236824, "num_tokens": 173677086.0, "step": 75825 }, { "entropy": 5.23926568031311, "epoch": 7.496045867931989, "grad_norm": 1.40625, "learning_rate": 0.00011732212651537545, "loss": 4.5896, "mean_token_accuracy": 0.2645447388291359, "num_tokens": 173687431.0, "step": 75830 }, { "entropy": 5.278321409225464, "epoch": 7.49654013444049, "grad_norm": 1.25, "learning_rate": 0.00011729695374285343, "loss": 4.6177, "mean_token_accuracy": 0.257218237221241, "num_tokens": 173698147.0, "step": 75835 }, { "entropy": 5.230606412887573, "epoch": 7.4970344009489915, "grad_norm": 1.1875, "learning_rate": 0.00011727178484985073, "loss": 4.532, "mean_token_accuracy": 0.26917401403188707, "num_tokens": 173709085.0, "step": 75840 }, { "entropy": 5.199252653121948, "epoch": 7.497528667457493, "grad_norm": 1.3828125, "learning_rate": 0.0001172466198369866, "loss": 4.5445, "mean_token_accuracy": 0.26913804560899734, "num_tokens": 173720520.0, "step": 75845 }, { "entropy": 5.232551431655883, "epoch": 7.498022933965994, "grad_norm": 1.2734375, "learning_rate": 0.00011722145870488015, "loss": 4.5373, "mean_token_accuracy": 0.2701601073145866, "num_tokens": 173730785.0, "step": 75850 }, { "entropy": 5.2835001945495605, "epoch": 7.498517200474496, "grad_norm": 1.3203125, "learning_rate": 0.00011719630145415014, "loss": 4.7073, "mean_token_accuracy": 0.2584838107228279, "num_tokens": 173741510.0, "step": 75855 }, { "entropy": 5.211057949066162, "epoch": 7.4990114669829975, "grad_norm": 1.28125, "learning_rate": 0.00011717114808541576, "loss": 4.5631, "mean_token_accuracy": 0.26513511389493943, "num_tokens": 173752968.0, "step": 75860 }, { "entropy": 5.302213335037232, "epoch": 7.499505733491499, "grad_norm": 1.25, "learning_rate": 0.00011714599859929554, "loss": 4.6226, "mean_token_accuracy": 0.2586247369647026, "num_tokens": 173763811.0, "step": 75865 }, { "entropy": 5.282591247558594, "epoch": 7.5, "grad_norm": 1.1328125, "learning_rate": 0.00011712085299640827, "loss": 4.6047, "mean_token_accuracy": 0.26457422524690627, "num_tokens": 173776846.0, "step": 75870 }, { "entropy": 5.225047016143799, "epoch": 7.500494266508501, "grad_norm": 1.2109375, "learning_rate": 0.00011709571127737253, "loss": 4.5289, "mean_token_accuracy": 0.2753917261958122, "num_tokens": 173787507.0, "step": 75875 }, { "entropy": 5.227719640731811, "epoch": 7.5009885330170025, "grad_norm": 1.328125, "learning_rate": 0.00011707057344280676, "loss": 4.5712, "mean_token_accuracy": 0.2635077625513077, "num_tokens": 173798645.0, "step": 75880 }, { "entropy": 5.221088981628418, "epoch": 7.501482799525504, "grad_norm": 1.1875, "learning_rate": 0.00011704543949332937, "loss": 4.5627, "mean_token_accuracy": 0.26224254369735717, "num_tokens": 173810438.0, "step": 75885 }, { "entropy": 5.163577270507813, "epoch": 7.501977066034005, "grad_norm": 1.203125, "learning_rate": 0.00011702030942955868, "loss": 4.5288, "mean_token_accuracy": 0.2721897065639496, "num_tokens": 173821809.0, "step": 75890 }, { "entropy": 5.201392030715942, "epoch": 7.502471332542507, "grad_norm": 1.1328125, "learning_rate": 0.0001169951832521129, "loss": 4.5397, "mean_token_accuracy": 0.2660737127065659, "num_tokens": 173832835.0, "step": 75895 }, { "entropy": 5.303902530670166, "epoch": 7.5029655990510085, "grad_norm": 1.1875, "learning_rate": 0.00011697006096161015, "loss": 4.6519, "mean_token_accuracy": 0.2561402842402458, "num_tokens": 173844469.0, "step": 75900 }, { "entropy": 5.18628044128418, "epoch": 7.50345986555951, "grad_norm": 1.1484375, "learning_rate": 0.00011694494255866839, "loss": 4.5037, "mean_token_accuracy": 0.27290117293596267, "num_tokens": 173854708.0, "step": 75905 }, { "entropy": 5.2350870132446286, "epoch": 7.503954132068011, "grad_norm": 1.1953125, "learning_rate": 0.00011691982804390552, "loss": 4.5891, "mean_token_accuracy": 0.26675058901309967, "num_tokens": 173865864.0, "step": 75910 }, { "entropy": 5.203651475906372, "epoch": 7.504448398576512, "grad_norm": 1.2578125, "learning_rate": 0.00011689471741793945, "loss": 4.4705, "mean_token_accuracy": 0.27962722033262255, "num_tokens": 173876993.0, "step": 75915 }, { "entropy": 5.224137926101685, "epoch": 7.5049426650850135, "grad_norm": 1.265625, "learning_rate": 0.00011686961068138783, "loss": 4.599, "mean_token_accuracy": 0.26158830523490906, "num_tokens": 173888687.0, "step": 75920 }, { "entropy": 5.215991592407226, "epoch": 7.505436931593515, "grad_norm": 1.234375, "learning_rate": 0.0001168445078348684, "loss": 4.5927, "mean_token_accuracy": 0.26073990762233734, "num_tokens": 173900249.0, "step": 75925 }, { "entropy": 5.165442752838135, "epoch": 7.505931198102017, "grad_norm": 1.1953125, "learning_rate": 0.00011681940887899854, "loss": 4.5086, "mean_token_accuracy": 0.2732178419828415, "num_tokens": 173911799.0, "step": 75930 }, { "entropy": 5.252012443542481, "epoch": 7.506425464610518, "grad_norm": 1.1875, "learning_rate": 0.00011679431381439575, "loss": 4.6276, "mean_token_accuracy": 0.2636003628373146, "num_tokens": 173922664.0, "step": 75935 }, { "entropy": 5.153907442092896, "epoch": 7.5069197311190194, "grad_norm": 1.3125, "learning_rate": 0.00011676922264167741, "loss": 4.4442, "mean_token_accuracy": 0.273952329158783, "num_tokens": 173933091.0, "step": 75940 }, { "entropy": 5.287511253356934, "epoch": 7.507413997627521, "grad_norm": 1.21875, "learning_rate": 0.00011674413536146072, "loss": 4.6392, "mean_token_accuracy": 0.25576951503753664, "num_tokens": 173944988.0, "step": 75945 }, { "entropy": 5.224812841415405, "epoch": 7.507908264136022, "grad_norm": 1.203125, "learning_rate": 0.00011671905197436293, "loss": 4.5624, "mean_token_accuracy": 0.2669031172990799, "num_tokens": 173956155.0, "step": 75950 }, { "entropy": 5.144156455993652, "epoch": 7.508402530644523, "grad_norm": 1.234375, "learning_rate": 0.00011669397248100096, "loss": 4.4617, "mean_token_accuracy": 0.2768364414572716, "num_tokens": 173966427.0, "step": 75955 }, { "entropy": 5.273756122589111, "epoch": 7.5088967971530245, "grad_norm": 1.2734375, "learning_rate": 0.00011666889688199179, "loss": 4.63, "mean_token_accuracy": 0.2572621747851372, "num_tokens": 173977548.0, "step": 75960 }, { "entropy": 5.252331924438477, "epoch": 7.509391063661527, "grad_norm": 1.375, "learning_rate": 0.00011664382517795242, "loss": 4.5715, "mean_token_accuracy": 0.26510519683361056, "num_tokens": 173988044.0, "step": 75965 }, { "entropy": 5.242480754852295, "epoch": 7.509885330170028, "grad_norm": 1.265625, "learning_rate": 0.00011661875736949938, "loss": 4.6041, "mean_token_accuracy": 0.2644272819161415, "num_tokens": 173998718.0, "step": 75970 }, { "entropy": 5.301561737060547, "epoch": 7.510379596678529, "grad_norm": 1.1640625, "learning_rate": 0.0001165936934572496, "loss": 4.6036, "mean_token_accuracy": 0.2590021342039108, "num_tokens": 174009067.0, "step": 75975 }, { "entropy": 5.184841537475586, "epoch": 7.51087386318703, "grad_norm": 1.2109375, "learning_rate": 0.00011656863344181945, "loss": 4.4969, "mean_token_accuracy": 0.2743051931262016, "num_tokens": 174020506.0, "step": 75980 }, { "entropy": 5.233009386062622, "epoch": 7.511368129695532, "grad_norm": 1.2265625, "learning_rate": 0.00011654357732382553, "loss": 4.6199, "mean_token_accuracy": 0.25884820073843, "num_tokens": 174031774.0, "step": 75985 }, { "entropy": 5.17937970161438, "epoch": 7.511862396204033, "grad_norm": 1.328125, "learning_rate": 0.00011651852510388426, "loss": 4.5744, "mean_token_accuracy": 0.27318957895040513, "num_tokens": 174043132.0, "step": 75990 }, { "entropy": 5.20828537940979, "epoch": 7.512356662712534, "grad_norm": 1.1328125, "learning_rate": 0.00011649347678261175, "loss": 4.5575, "mean_token_accuracy": 0.25629302114248276, "num_tokens": 174054906.0, "step": 75995 }, { "entropy": 5.150505828857422, "epoch": 7.512850929221036, "grad_norm": 1.09375, "learning_rate": 0.00011646843236062435, "loss": 4.5177, "mean_token_accuracy": 0.2740259051322937, "num_tokens": 174067124.0, "step": 76000 }, { "entropy": 5.26609058380127, "epoch": 7.513345195729538, "grad_norm": 1.25, "learning_rate": 0.00011644339183853808, "loss": 4.6349, "mean_token_accuracy": 0.2573671698570251, "num_tokens": 174079500.0, "step": 76005 }, { "entropy": 5.196762180328369, "epoch": 7.513839462238039, "grad_norm": 1.1796875, "learning_rate": 0.00011641835521696897, "loss": 4.5134, "mean_token_accuracy": 0.27348830103874205, "num_tokens": 174092476.0, "step": 76010 }, { "entropy": 5.249201393127441, "epoch": 7.51433372874654, "grad_norm": 1.359375, "learning_rate": 0.00011639332249653301, "loss": 4.6086, "mean_token_accuracy": 0.26392196118831635, "num_tokens": 174102790.0, "step": 76015 }, { "entropy": 5.265827417373657, "epoch": 7.514827995255041, "grad_norm": 1.2734375, "learning_rate": 0.00011636829367784583, "loss": 4.5624, "mean_token_accuracy": 0.26109030097723007, "num_tokens": 174114973.0, "step": 76020 }, { "entropy": 5.247085762023926, "epoch": 7.515322261763543, "grad_norm": 1.2109375, "learning_rate": 0.00011634326876152324, "loss": 4.6416, "mean_token_accuracy": 0.254343181848526, "num_tokens": 174126505.0, "step": 76025 }, { "entropy": 5.271112966537475, "epoch": 7.515816528272044, "grad_norm": 1.21875, "learning_rate": 0.00011631824774818086, "loss": 4.5506, "mean_token_accuracy": 0.26398447453975676, "num_tokens": 174136786.0, "step": 76030 }, { "entropy": 5.23845739364624, "epoch": 7.516310794780546, "grad_norm": 1.203125, "learning_rate": 0.0001162932306384342, "loss": 4.5675, "mean_token_accuracy": 0.26725461184978483, "num_tokens": 174148446.0, "step": 76035 }, { "entropy": 5.264354133605957, "epoch": 7.516805061289047, "grad_norm": 1.234375, "learning_rate": 0.00011626821743289876, "loss": 4.5634, "mean_token_accuracy": 0.26288934201002123, "num_tokens": 174159166.0, "step": 76040 }, { "entropy": 5.096731042861938, "epoch": 7.517299327797549, "grad_norm": 1.1640625, "learning_rate": 0.00011624320813218974, "loss": 4.4423, "mean_token_accuracy": 0.28006615936756135, "num_tokens": 174171138.0, "step": 76045 }, { "entropy": 5.259244012832641, "epoch": 7.51779359430605, "grad_norm": 1.2265625, "learning_rate": 0.00011621820273692239, "loss": 4.6696, "mean_token_accuracy": 0.25642634779214857, "num_tokens": 174183601.0, "step": 76050 }, { "entropy": 5.070305395126343, "epoch": 7.518287860814551, "grad_norm": 1.296875, "learning_rate": 0.000116193201247712, "loss": 4.4093, "mean_token_accuracy": 0.2849069252610207, "num_tokens": 174194329.0, "step": 76055 }, { "entropy": 5.258394384384156, "epoch": 7.518782127323052, "grad_norm": 1.140625, "learning_rate": 0.00011616820366517331, "loss": 4.5532, "mean_token_accuracy": 0.266052183508873, "num_tokens": 174205087.0, "step": 76060 }, { "entropy": 5.242732858657837, "epoch": 7.519276393831554, "grad_norm": 1.2109375, "learning_rate": 0.00011614320998992161, "loss": 4.5962, "mean_token_accuracy": 0.2631759628653526, "num_tokens": 174216901.0, "step": 76065 }, { "entropy": 5.179302740097046, "epoch": 7.519770660340056, "grad_norm": 1.2109375, "learning_rate": 0.00011611822022257154, "loss": 4.4961, "mean_token_accuracy": 0.2763929933309555, "num_tokens": 174227688.0, "step": 76070 }, { "entropy": 5.31563982963562, "epoch": 7.520264926848557, "grad_norm": 1.3515625, "learning_rate": 0.00011609323436373788, "loss": 4.5988, "mean_token_accuracy": 0.25887516140937805, "num_tokens": 174237368.0, "step": 76075 }, { "entropy": 5.300295639038086, "epoch": 7.520759193357058, "grad_norm": 1.2265625, "learning_rate": 0.00011606825241403538, "loss": 4.6816, "mean_token_accuracy": 0.25278954654932023, "num_tokens": 174248895.0, "step": 76080 }, { "entropy": 5.2323424339294435, "epoch": 7.52125345986556, "grad_norm": 1.2890625, "learning_rate": 0.0001160432743740784, "loss": 4.5873, "mean_token_accuracy": 0.26431750059127807, "num_tokens": 174259668.0, "step": 76085 }, { "entropy": 5.276241588592529, "epoch": 7.521747726374061, "grad_norm": 1.2109375, "learning_rate": 0.00011601830024448165, "loss": 4.6143, "mean_token_accuracy": 0.2633247449994087, "num_tokens": 174271454.0, "step": 76090 }, { "entropy": 5.288468837738037, "epoch": 7.522241992882562, "grad_norm": 1.234375, "learning_rate": 0.00011599333002585933, "loss": 4.6467, "mean_token_accuracy": 0.2559565261006355, "num_tokens": 174283116.0, "step": 76095 }, { "entropy": 5.246757507324219, "epoch": 7.522736259391063, "grad_norm": 1.0625, "learning_rate": 0.00011596836371882573, "loss": 4.6008, "mean_token_accuracy": 0.2629581347107887, "num_tokens": 174295217.0, "step": 76100 }, { "entropy": 5.263567590713501, "epoch": 7.5232305258995655, "grad_norm": 1.203125, "learning_rate": 0.00011594340132399514, "loss": 4.6237, "mean_token_accuracy": 0.2567069113254547, "num_tokens": 174307303.0, "step": 76105 }, { "entropy": 5.288248682022095, "epoch": 7.523724792408067, "grad_norm": 1.2421875, "learning_rate": 0.00011591844284198148, "loss": 4.6032, "mean_token_accuracy": 0.25720850974321363, "num_tokens": 174318785.0, "step": 76110 }, { "entropy": 5.25916600227356, "epoch": 7.524219058916568, "grad_norm": 1.1953125, "learning_rate": 0.00011589348827339883, "loss": 4.6701, "mean_token_accuracy": 0.2512531653046608, "num_tokens": 174330562.0, "step": 76115 }, { "entropy": 5.2215348243713375, "epoch": 7.524713325425069, "grad_norm": 1.359375, "learning_rate": 0.000115868537618861, "loss": 4.5562, "mean_token_accuracy": 0.26813350319862367, "num_tokens": 174341094.0, "step": 76120 }, { "entropy": 5.182903194427491, "epoch": 7.525207591933571, "grad_norm": 1.15625, "learning_rate": 0.00011584359087898187, "loss": 4.4845, "mean_token_accuracy": 0.27424292266368866, "num_tokens": 174352085.0, "step": 76125 }, { "entropy": 5.20510048866272, "epoch": 7.525701858442072, "grad_norm": 1.109375, "learning_rate": 0.00011581864805437516, "loss": 4.5569, "mean_token_accuracy": 0.2706568747758865, "num_tokens": 174363715.0, "step": 76130 }, { "entropy": 5.211567687988281, "epoch": 7.526196124950573, "grad_norm": 1.265625, "learning_rate": 0.00011579370914565432, "loss": 4.5753, "mean_token_accuracy": 0.26474589407444, "num_tokens": 174375804.0, "step": 76135 }, { "entropy": 5.1528698921203615, "epoch": 7.526690391459074, "grad_norm": 1.234375, "learning_rate": 0.00011576877415343303, "loss": 4.4428, "mean_token_accuracy": 0.2754984736442566, "num_tokens": 174386323.0, "step": 76140 }, { "entropy": 5.1732262134552, "epoch": 7.527184657967576, "grad_norm": 1.3046875, "learning_rate": 0.00011574384307832443, "loss": 4.5163, "mean_token_accuracy": 0.26809551417827604, "num_tokens": 174397527.0, "step": 76145 }, { "entropy": 5.21300196647644, "epoch": 7.527678924476078, "grad_norm": 1.1875, "learning_rate": 0.00011571891592094208, "loss": 4.5308, "mean_token_accuracy": 0.2690908446907997, "num_tokens": 174408187.0, "step": 76150 }, { "entropy": 5.31041316986084, "epoch": 7.528173190984579, "grad_norm": 1.296875, "learning_rate": 0.00011569399268189917, "loss": 4.6721, "mean_token_accuracy": 0.25398498177528384, "num_tokens": 174418760.0, "step": 76155 }, { "entropy": 5.208649587631226, "epoch": 7.52866745749308, "grad_norm": 1.2734375, "learning_rate": 0.0001156690733618087, "loss": 4.5397, "mean_token_accuracy": 0.27049697637557985, "num_tokens": 174429384.0, "step": 76160 }, { "entropy": 5.221357917785644, "epoch": 7.529161724001582, "grad_norm": 1.25, "learning_rate": 0.0001156441579612838, "loss": 4.5552, "mean_token_accuracy": 0.27248562276363375, "num_tokens": 174440233.0, "step": 76165 }, { "entropy": 5.2992674827575685, "epoch": 7.529655990510083, "grad_norm": 1.34375, "learning_rate": 0.00011561924648093727, "loss": 4.6205, "mean_token_accuracy": 0.2618909776210785, "num_tokens": 174450225.0, "step": 76170 }, { "entropy": 5.195826482772827, "epoch": 7.530150257018584, "grad_norm": 1.15625, "learning_rate": 0.00011559433892138193, "loss": 4.5363, "mean_token_accuracy": 0.27095881700515745, "num_tokens": 174461768.0, "step": 76175 }, { "entropy": 5.249384832382202, "epoch": 7.530644523527085, "grad_norm": 1.3515625, "learning_rate": 0.00011556943528323072, "loss": 4.5387, "mean_token_accuracy": 0.26345315128564833, "num_tokens": 174472899.0, "step": 76180 }, { "entropy": 5.163338375091553, "epoch": 7.5311387900355875, "grad_norm": 1.140625, "learning_rate": 0.00011554453556709607, "loss": 4.4928, "mean_token_accuracy": 0.2768790602684021, "num_tokens": 174485240.0, "step": 76185 }, { "entropy": 5.234646558761597, "epoch": 7.531633056544089, "grad_norm": 1.484375, "learning_rate": 0.00011551963977359066, "loss": 4.607, "mean_token_accuracy": 0.26411994993686677, "num_tokens": 174496133.0, "step": 76190 }, { "entropy": 5.253149938583374, "epoch": 7.53212732305259, "grad_norm": 1.3046875, "learning_rate": 0.00011549474790332676, "loss": 4.5828, "mean_token_accuracy": 0.265031161904335, "num_tokens": 174506040.0, "step": 76195 }, { "entropy": 5.215287446975708, "epoch": 7.532621589561091, "grad_norm": 1.265625, "learning_rate": 0.00011546985995691684, "loss": 4.5778, "mean_token_accuracy": 0.26493753790855407, "num_tokens": 174517645.0, "step": 76200 }, { "entropy": 5.230312013626099, "epoch": 7.5331158560695926, "grad_norm": 1.1015625, "learning_rate": 0.00011544497593497308, "loss": 4.538, "mean_token_accuracy": 0.26658299565315247, "num_tokens": 174528817.0, "step": 76205 }, { "entropy": 5.202627849578858, "epoch": 7.533610122578094, "grad_norm": 1.15625, "learning_rate": 0.00011542009583810769, "loss": 4.5318, "mean_token_accuracy": 0.26909933239221573, "num_tokens": 174541567.0, "step": 76210 }, { "entropy": 5.24569263458252, "epoch": 7.534104389086595, "grad_norm": 1.265625, "learning_rate": 0.00011539521966693276, "loss": 4.5387, "mean_token_accuracy": 0.2616998225450516, "num_tokens": 174552231.0, "step": 76215 }, { "entropy": 5.2518164157867435, "epoch": 7.534598655595097, "grad_norm": 1.1875, "learning_rate": 0.00011537034742206013, "loss": 4.6292, "mean_token_accuracy": 0.2596666067838669, "num_tokens": 174565374.0, "step": 76220 }, { "entropy": 5.257710647583008, "epoch": 7.5350929221035985, "grad_norm": 1.2734375, "learning_rate": 0.00011534547910410168, "loss": 4.6607, "mean_token_accuracy": 0.25648748129606247, "num_tokens": 174576771.0, "step": 76225 }, { "entropy": 5.237745189666748, "epoch": 7.5355871886121, "grad_norm": 1.1484375, "learning_rate": 0.00011532061471366924, "loss": 4.5644, "mean_token_accuracy": 0.2696963161230087, "num_tokens": 174586880.0, "step": 76230 }, { "entropy": 5.2671421527862545, "epoch": 7.536081455120601, "grad_norm": 1.25, "learning_rate": 0.00011529575425137444, "loss": 4.6526, "mean_token_accuracy": 0.26519218534231187, "num_tokens": 174600090.0, "step": 76235 }, { "entropy": 5.218080520629883, "epoch": 7.536575721629102, "grad_norm": 1.2265625, "learning_rate": 0.00011527089771782895, "loss": 4.496, "mean_token_accuracy": 0.2682273179292679, "num_tokens": 174610875.0, "step": 76240 }, { "entropy": 5.29914345741272, "epoch": 7.5370699881376035, "grad_norm": 1.1015625, "learning_rate": 0.00011524604511364406, "loss": 4.6184, "mean_token_accuracy": 0.2636348456144333, "num_tokens": 174624396.0, "step": 76245 }, { "entropy": 5.308733701705933, "epoch": 7.537564254646105, "grad_norm": 1.1875, "learning_rate": 0.00011522119643943126, "loss": 4.6014, "mean_token_accuracy": 0.26409884691238406, "num_tokens": 174636192.0, "step": 76250 }, { "entropy": 5.194004249572754, "epoch": 7.538058521154607, "grad_norm": 1.1875, "learning_rate": 0.00011519635169580189, "loss": 4.5101, "mean_token_accuracy": 0.26953847110271456, "num_tokens": 174646816.0, "step": 76255 }, { "entropy": 5.211432075500488, "epoch": 7.538552787663108, "grad_norm": 1.1484375, "learning_rate": 0.00011517151088336691, "loss": 4.5675, "mean_token_accuracy": 0.2674789667129517, "num_tokens": 174658982.0, "step": 76260 }, { "entropy": 5.2177191257476805, "epoch": 7.5390470541716095, "grad_norm": 1.2421875, "learning_rate": 0.00011514667400273771, "loss": 4.5533, "mean_token_accuracy": 0.2655197709798813, "num_tokens": 174671848.0, "step": 76265 }, { "entropy": 5.282089805603027, "epoch": 7.539541320680111, "grad_norm": 1.2734375, "learning_rate": 0.00011512184105452504, "loss": 4.6298, "mean_token_accuracy": 0.25824277848005295, "num_tokens": 174683133.0, "step": 76270 }, { "entropy": 5.312340116500854, "epoch": 7.540035587188612, "grad_norm": 1.1953125, "learning_rate": 0.00011509701203933989, "loss": 4.6719, "mean_token_accuracy": 0.2542914912104607, "num_tokens": 174695141.0, "step": 76275 }, { "entropy": 5.1890452861785885, "epoch": 7.540529853697113, "grad_norm": 1.2265625, "learning_rate": 0.00011507218695779312, "loss": 4.4723, "mean_token_accuracy": 0.27252610176801684, "num_tokens": 174706127.0, "step": 76280 }, { "entropy": 5.189698600769043, "epoch": 7.5410241202056145, "grad_norm": 1.3515625, "learning_rate": 0.00011504736581049531, "loss": 4.5053, "mean_token_accuracy": 0.274054117500782, "num_tokens": 174717086.0, "step": 76285 }, { "entropy": 5.286622667312622, "epoch": 7.541518386714117, "grad_norm": 1.1484375, "learning_rate": 0.00011502254859805708, "loss": 4.6238, "mean_token_accuracy": 0.2653087988495827, "num_tokens": 174730142.0, "step": 76290 }, { "entropy": 5.270411825180053, "epoch": 7.542012653222618, "grad_norm": 1.2265625, "learning_rate": 0.000114997735321089, "loss": 4.6487, "mean_token_accuracy": 0.2615336522459984, "num_tokens": 174741636.0, "step": 76295 }, { "entropy": 5.211784887313843, "epoch": 7.542506919731119, "grad_norm": 1.265625, "learning_rate": 0.00011497292598020143, "loss": 4.5191, "mean_token_accuracy": 0.2703260198235512, "num_tokens": 174752266.0, "step": 76300 }, { "entropy": 5.151440906524658, "epoch": 7.5430011862396205, "grad_norm": 1.140625, "learning_rate": 0.00011494812057600479, "loss": 4.4917, "mean_token_accuracy": 0.2765078514814377, "num_tokens": 174764340.0, "step": 76305 }, { "entropy": 5.152394723892212, "epoch": 7.543495452748122, "grad_norm": 1.296875, "learning_rate": 0.00011492331910910917, "loss": 4.4861, "mean_token_accuracy": 0.2785324066877365, "num_tokens": 174776201.0, "step": 76310 }, { "entropy": 5.217521524429321, "epoch": 7.543989719256623, "grad_norm": 1.109375, "learning_rate": 0.00011489852158012471, "loss": 4.5134, "mean_token_accuracy": 0.272571824491024, "num_tokens": 174788212.0, "step": 76315 }, { "entropy": 5.190069580078125, "epoch": 7.544483985765124, "grad_norm": 1.25, "learning_rate": 0.00011487372798966144, "loss": 4.5402, "mean_token_accuracy": 0.2637689784169197, "num_tokens": 174798668.0, "step": 76320 }, { "entropy": 5.160428094863891, "epoch": 7.544978252273626, "grad_norm": 1.2734375, "learning_rate": 0.00011484893833832933, "loss": 4.4505, "mean_token_accuracy": 0.2779161185026169, "num_tokens": 174808513.0, "step": 76325 }, { "entropy": 5.221393585205078, "epoch": 7.545472518782128, "grad_norm": 1.25, "learning_rate": 0.00011482415262673822, "loss": 4.5769, "mean_token_accuracy": 0.26050489246845243, "num_tokens": 174819859.0, "step": 76330 }, { "entropy": 5.186543273925781, "epoch": 7.545966785290629, "grad_norm": 1.2421875, "learning_rate": 0.00011479937085549777, "loss": 4.5286, "mean_token_accuracy": 0.2699814438819885, "num_tokens": 174831913.0, "step": 76335 }, { "entropy": 5.150916004180909, "epoch": 7.54646105179913, "grad_norm": 1.328125, "learning_rate": 0.00011477459302521763, "loss": 4.4254, "mean_token_accuracy": 0.2807417675852776, "num_tokens": 174842730.0, "step": 76340 }, { "entropy": 5.231483316421508, "epoch": 7.546955318307631, "grad_norm": 1.2734375, "learning_rate": 0.00011474981913650744, "loss": 4.5155, "mean_token_accuracy": 0.2611026674509048, "num_tokens": 174853060.0, "step": 76345 }, { "entropy": 5.1881389141082765, "epoch": 7.547449584816133, "grad_norm": 1.234375, "learning_rate": 0.00011472504918997642, "loss": 4.576, "mean_token_accuracy": 0.2710540607571602, "num_tokens": 174864371.0, "step": 76350 }, { "entropy": 5.249469041824341, "epoch": 7.547943851324634, "grad_norm": 1.2265625, "learning_rate": 0.00011470028318623417, "loss": 4.6643, "mean_token_accuracy": 0.2552146777510643, "num_tokens": 174876808.0, "step": 76355 }, { "entropy": 5.274334859848023, "epoch": 7.548438117833136, "grad_norm": 1.1875, "learning_rate": 0.00011467552112588979, "loss": 4.6232, "mean_token_accuracy": 0.2514274701476097, "num_tokens": 174887958.0, "step": 76360 }, { "entropy": 5.199980163574219, "epoch": 7.548932384341637, "grad_norm": 1.265625, "learning_rate": 0.00011465076300955241, "loss": 4.5327, "mean_token_accuracy": 0.26493940949440004, "num_tokens": 174899675.0, "step": 76365 }, { "entropy": 5.22464656829834, "epoch": 7.549426650850139, "grad_norm": 1.390625, "learning_rate": 0.00011462600883783126, "loss": 4.5323, "mean_token_accuracy": 0.26675013154745103, "num_tokens": 174911044.0, "step": 76370 }, { "entropy": 5.2348250389099125, "epoch": 7.54992091735864, "grad_norm": 1.234375, "learning_rate": 0.00011460125861133507, "loss": 4.5242, "mean_token_accuracy": 0.2729561388492584, "num_tokens": 174922416.0, "step": 76375 }, { "entropy": 5.178025960922241, "epoch": 7.550415183867141, "grad_norm": 1.125, "learning_rate": 0.00011457651233067281, "loss": 4.5018, "mean_token_accuracy": 0.2666833087801933, "num_tokens": 174933704.0, "step": 76380 }, { "entropy": 5.325380516052246, "epoch": 7.550909450375642, "grad_norm": 1.3203125, "learning_rate": 0.00011455176999645326, "loss": 4.6687, "mean_token_accuracy": 0.25108474045991896, "num_tokens": 174944976.0, "step": 76385 }, { "entropy": 5.243370771408081, "epoch": 7.551403716884144, "grad_norm": 1.2109375, "learning_rate": 0.00011452703160928501, "loss": 4.6151, "mean_token_accuracy": 0.26116127520799637, "num_tokens": 174956343.0, "step": 76390 }, { "entropy": 5.203297185897827, "epoch": 7.551897983392645, "grad_norm": 1.265625, "learning_rate": 0.00011450229716977679, "loss": 4.4888, "mean_token_accuracy": 0.27725554406642916, "num_tokens": 174967504.0, "step": 76395 }, { "entropy": 5.284131336212158, "epoch": 7.552392249901146, "grad_norm": 1.3125, "learning_rate": 0.00011447756667853687, "loss": 4.6612, "mean_token_accuracy": 0.2585777655243874, "num_tokens": 174980161.0, "step": 76400 }, { "entropy": 5.2491308689117435, "epoch": 7.552886516409648, "grad_norm": 1.2421875, "learning_rate": 0.00011445284013617372, "loss": 4.6085, "mean_token_accuracy": 0.26629742980003357, "num_tokens": 174991191.0, "step": 76405 }, { "entropy": 5.242522430419922, "epoch": 7.55338078291815, "grad_norm": 1.2578125, "learning_rate": 0.0001144281175432956, "loss": 4.5823, "mean_token_accuracy": 0.26373507678508756, "num_tokens": 175002458.0, "step": 76410 }, { "entropy": 5.294935989379883, "epoch": 7.553875049426651, "grad_norm": 1.3046875, "learning_rate": 0.00011440339890051071, "loss": 4.6504, "mean_token_accuracy": 0.2548016533255577, "num_tokens": 175014376.0, "step": 76415 }, { "entropy": 5.170376443862915, "epoch": 7.554369315935152, "grad_norm": 1.1328125, "learning_rate": 0.00011437868420842716, "loss": 4.4949, "mean_token_accuracy": 0.27414500117301943, "num_tokens": 175026068.0, "step": 76420 }, { "entropy": 5.357861137390136, "epoch": 7.554863582443653, "grad_norm": 1.2109375, "learning_rate": 0.00011435397346765288, "loss": 4.6442, "mean_token_accuracy": 0.24924052208662034, "num_tokens": 175037361.0, "step": 76425 }, { "entropy": 5.22778902053833, "epoch": 7.555357848952155, "grad_norm": 1.21875, "learning_rate": 0.00011432926667879573, "loss": 4.5654, "mean_token_accuracy": 0.266243077814579, "num_tokens": 175049183.0, "step": 76430 }, { "entropy": 5.150935649871826, "epoch": 7.555852115460656, "grad_norm": 1.1875, "learning_rate": 0.00011430456384246356, "loss": 4.5007, "mean_token_accuracy": 0.2673376977443695, "num_tokens": 175059996.0, "step": 76435 }, { "entropy": 5.275425052642822, "epoch": 7.556346381969158, "grad_norm": 1.296875, "learning_rate": 0.00011427986495926407, "loss": 4.6458, "mean_token_accuracy": 0.2547108978033066, "num_tokens": 175071887.0, "step": 76440 }, { "entropy": 5.259810924530029, "epoch": 7.556840648477659, "grad_norm": 1.265625, "learning_rate": 0.00011425517002980487, "loss": 4.503, "mean_token_accuracy": 0.26637176871299745, "num_tokens": 175082026.0, "step": 76445 }, { "entropy": 5.339541387557984, "epoch": 7.557334914986161, "grad_norm": 1.1015625, "learning_rate": 0.00011423047905469337, "loss": 4.7216, "mean_token_accuracy": 0.24905856102705, "num_tokens": 175096345.0, "step": 76450 }, { "entropy": 5.269323492050171, "epoch": 7.557829181494662, "grad_norm": 1.2578125, "learning_rate": 0.00011420579203453702, "loss": 4.6245, "mean_token_accuracy": 0.26311422884464264, "num_tokens": 175107485.0, "step": 76455 }, { "entropy": 5.259856271743774, "epoch": 7.558323448003163, "grad_norm": 1.3046875, "learning_rate": 0.00011418110896994323, "loss": 4.6092, "mean_token_accuracy": 0.26584079712629316, "num_tokens": 175118829.0, "step": 76460 }, { "entropy": 5.231205320358276, "epoch": 7.558817714511664, "grad_norm": 1.21875, "learning_rate": 0.00011415642986151895, "loss": 4.5247, "mean_token_accuracy": 0.2706700786948204, "num_tokens": 175129665.0, "step": 76465 }, { "entropy": 5.293283224105835, "epoch": 7.559311981020166, "grad_norm": 1.265625, "learning_rate": 0.00011413175470987158, "loss": 4.6536, "mean_token_accuracy": 0.260567432641983, "num_tokens": 175140641.0, "step": 76470 }, { "entropy": 5.215605974197388, "epoch": 7.559806247528668, "grad_norm": 1.1875, "learning_rate": 0.00011410708351560793, "loss": 4.6258, "mean_token_accuracy": 0.26501327455043794, "num_tokens": 175153073.0, "step": 76475 }, { "entropy": 5.2691103458404545, "epoch": 7.560300514037169, "grad_norm": 1.15625, "learning_rate": 0.00011408241627933497, "loss": 4.5441, "mean_token_accuracy": 0.2588046655058861, "num_tokens": 175164007.0, "step": 76480 }, { "entropy": 5.2827598571777346, "epoch": 7.56079478054567, "grad_norm": 1.140625, "learning_rate": 0.00011405775300165965, "loss": 4.6094, "mean_token_accuracy": 0.2626140251755714, "num_tokens": 175175360.0, "step": 76485 }, { "entropy": 5.2237053394317625, "epoch": 7.561289047054172, "grad_norm": 1.1796875, "learning_rate": 0.00011403309368318847, "loss": 4.6461, "mean_token_accuracy": 0.2546405136585236, "num_tokens": 175188219.0, "step": 76490 }, { "entropy": 5.221561241149902, "epoch": 7.561783313562673, "grad_norm": 1.109375, "learning_rate": 0.00011400843832452817, "loss": 4.5659, "mean_token_accuracy": 0.2629661336541176, "num_tokens": 175199872.0, "step": 76495 }, { "entropy": 5.235245275497436, "epoch": 7.562277580071174, "grad_norm": 1.2109375, "learning_rate": 0.00011398378692628527, "loss": 4.5953, "mean_token_accuracy": 0.25581279695034026, "num_tokens": 175211878.0, "step": 76500 }, { "entropy": 5.1934600353240965, "epoch": 7.562771846579675, "grad_norm": 1.140625, "learning_rate": 0.00011395913948906618, "loss": 4.5599, "mean_token_accuracy": 0.2692124083638191, "num_tokens": 175223807.0, "step": 76505 }, { "entropy": 5.198967409133911, "epoch": 7.5632661130881775, "grad_norm": 1.234375, "learning_rate": 0.0001139344960134773, "loss": 4.5252, "mean_token_accuracy": 0.27162062376737595, "num_tokens": 175234686.0, "step": 76510 }, { "entropy": 5.263796854019165, "epoch": 7.563760379596679, "grad_norm": 1.203125, "learning_rate": 0.00011390985650012475, "loss": 4.6331, "mean_token_accuracy": 0.25527150332927706, "num_tokens": 175245898.0, "step": 76515 }, { "entropy": 5.199971723556518, "epoch": 7.56425464610518, "grad_norm": 1.2421875, "learning_rate": 0.00011388522094961472, "loss": 4.5336, "mean_token_accuracy": 0.27094624042510984, "num_tokens": 175257323.0, "step": 76520 }, { "entropy": 5.25433611869812, "epoch": 7.564748912613681, "grad_norm": 1.21875, "learning_rate": 0.00011386058936255324, "loss": 4.5669, "mean_token_accuracy": 0.2590286746621132, "num_tokens": 175268384.0, "step": 76525 }, { "entropy": 5.3085289478302, "epoch": 7.565243179122183, "grad_norm": 1.3046875, "learning_rate": 0.00011383596173954626, "loss": 4.7158, "mean_token_accuracy": 0.24965376853942872, "num_tokens": 175279485.0, "step": 76530 }, { "entropy": 5.2187264919281, "epoch": 7.565737445630684, "grad_norm": 1.265625, "learning_rate": 0.00011381133808119971, "loss": 4.5766, "mean_token_accuracy": 0.2632025361061096, "num_tokens": 175290384.0, "step": 76535 }, { "entropy": 5.161533308029175, "epoch": 7.566231712139185, "grad_norm": 1.2890625, "learning_rate": 0.00011378671838811919, "loss": 4.4017, "mean_token_accuracy": 0.2786567822098732, "num_tokens": 175300346.0, "step": 76540 }, { "entropy": 5.2130293369293215, "epoch": 7.566725978647687, "grad_norm": 1.1484375, "learning_rate": 0.00011376210266091038, "loss": 4.506, "mean_token_accuracy": 0.2701762780547142, "num_tokens": 175311962.0, "step": 76545 }, { "entropy": 5.210070085525513, "epoch": 7.5672202451561885, "grad_norm": 1.2265625, "learning_rate": 0.00011373749090017885, "loss": 4.5308, "mean_token_accuracy": 0.26174109876155854, "num_tokens": 175322224.0, "step": 76550 }, { "entropy": 5.1743474960327145, "epoch": 7.56771451166469, "grad_norm": 1.265625, "learning_rate": 0.00011371288310653008, "loss": 4.5403, "mean_token_accuracy": 0.27093580812215806, "num_tokens": 175332909.0, "step": 76555 }, { "entropy": 5.2397359848022464, "epoch": 7.568208778173191, "grad_norm": 1.4140625, "learning_rate": 0.0001136882792805695, "loss": 4.6139, "mean_token_accuracy": 0.26325890570878985, "num_tokens": 175344343.0, "step": 76560 }, { "entropy": 5.199654626846313, "epoch": 7.568703044681692, "grad_norm": 1.1875, "learning_rate": 0.00011366367942290217, "loss": 4.5444, "mean_token_accuracy": 0.2667035207152367, "num_tokens": 175355650.0, "step": 76565 }, { "entropy": 5.274424409866333, "epoch": 7.569197311190194, "grad_norm": 1.2265625, "learning_rate": 0.00011363908353413336, "loss": 4.6461, "mean_token_accuracy": 0.25449079275131226, "num_tokens": 175367113.0, "step": 76570 }, { "entropy": 5.331593942642212, "epoch": 7.569691577698695, "grad_norm": 1.296875, "learning_rate": 0.0001136144916148682, "loss": 4.6773, "mean_token_accuracy": 0.2539301499724388, "num_tokens": 175378762.0, "step": 76575 }, { "entropy": 5.259437942504883, "epoch": 7.570185844207197, "grad_norm": 1.25, "learning_rate": 0.00011358990366571146, "loss": 4.5843, "mean_token_accuracy": 0.25797211229801176, "num_tokens": 175390124.0, "step": 76580 }, { "entropy": 5.161567831039429, "epoch": 7.570680110715698, "grad_norm": 1.21875, "learning_rate": 0.00011356531968726826, "loss": 4.4304, "mean_token_accuracy": 0.27440580278635024, "num_tokens": 175402004.0, "step": 76585 }, { "entropy": 5.2605016231536865, "epoch": 7.5711743772241995, "grad_norm": 1.3359375, "learning_rate": 0.00011354073968014317, "loss": 4.5617, "mean_token_accuracy": 0.2639294505119324, "num_tokens": 175412296.0, "step": 76590 }, { "entropy": 5.242091226577759, "epoch": 7.571668643732701, "grad_norm": 1.5625, "learning_rate": 0.00011351616364494093, "loss": 4.5493, "mean_token_accuracy": 0.2689051032066345, "num_tokens": 175422197.0, "step": 76595 }, { "entropy": 5.2977910995483395, "epoch": 7.572162910241202, "grad_norm": 1.3125, "learning_rate": 0.00011349159158226618, "loss": 4.6547, "mean_token_accuracy": 0.25954999923706057, "num_tokens": 175433343.0, "step": 76600 }, { "entropy": 5.2289731979370115, "epoch": 7.572657176749703, "grad_norm": 1.25, "learning_rate": 0.00011346702349272327, "loss": 4.5401, "mean_token_accuracy": 0.26097316294908524, "num_tokens": 175444933.0, "step": 76605 }, { "entropy": 5.255417156219482, "epoch": 7.5731514432582046, "grad_norm": 1.21875, "learning_rate": 0.00011344245937691665, "loss": 4.5938, "mean_token_accuracy": 0.26388405859470365, "num_tokens": 175456467.0, "step": 76610 }, { "entropy": 5.232104682922364, "epoch": 7.573645709766707, "grad_norm": 1.171875, "learning_rate": 0.00011341789923545058, "loss": 4.5893, "mean_token_accuracy": 0.2630007892847061, "num_tokens": 175468593.0, "step": 76615 }, { "entropy": 5.207513236999512, "epoch": 7.574139976275208, "grad_norm": 1.3515625, "learning_rate": 0.00011339334306892927, "loss": 4.5609, "mean_token_accuracy": 0.2603465810418129, "num_tokens": 175480100.0, "step": 76620 }, { "entropy": 5.285338020324707, "epoch": 7.574634242783709, "grad_norm": 1.2890625, "learning_rate": 0.00011336879087795684, "loss": 4.6178, "mean_token_accuracy": 0.2607367396354675, "num_tokens": 175492070.0, "step": 76625 }, { "entropy": 5.2349237442016605, "epoch": 7.5751285092922105, "grad_norm": 1.2265625, "learning_rate": 0.00011334424266313716, "loss": 4.5613, "mean_token_accuracy": 0.2637984111905098, "num_tokens": 175502951.0, "step": 76630 }, { "entropy": 5.184239149093628, "epoch": 7.575622775800712, "grad_norm": 1.1015625, "learning_rate": 0.00011331969842507428, "loss": 4.4754, "mean_token_accuracy": 0.2753379255533218, "num_tokens": 175514286.0, "step": 76635 }, { "entropy": 5.142987489700317, "epoch": 7.576117042309213, "grad_norm": 1.1640625, "learning_rate": 0.00011329515816437174, "loss": 4.5145, "mean_token_accuracy": 0.2682615384459496, "num_tokens": 175525739.0, "step": 76640 }, { "entropy": 5.246940231323242, "epoch": 7.576611308817714, "grad_norm": 1.4140625, "learning_rate": 0.00011327062188163347, "loss": 4.568, "mean_token_accuracy": 0.26424563974142073, "num_tokens": 175535975.0, "step": 76645 }, { "entropy": 5.173327684402466, "epoch": 7.5771055753262155, "grad_norm": 1.1328125, "learning_rate": 0.00011324608957746308, "loss": 4.5088, "mean_token_accuracy": 0.2735003590583801, "num_tokens": 175547448.0, "step": 76650 }, { "entropy": 5.301551771163941, "epoch": 7.577599841834717, "grad_norm": 1.1484375, "learning_rate": 0.0001132215612524639, "loss": 4.636, "mean_token_accuracy": 0.25687725096940994, "num_tokens": 175558816.0, "step": 76655 }, { "entropy": 5.248669958114624, "epoch": 7.578094108343219, "grad_norm": 1.1484375, "learning_rate": 0.00011319703690723947, "loss": 4.6051, "mean_token_accuracy": 0.2666220009326935, "num_tokens": 175571911.0, "step": 76660 }, { "entropy": 5.144255971908569, "epoch": 7.57858837485172, "grad_norm": 1.2734375, "learning_rate": 0.00011317251654239299, "loss": 4.479, "mean_token_accuracy": 0.27263198643922804, "num_tokens": 175583636.0, "step": 76665 }, { "entropy": 5.22387957572937, "epoch": 7.5790826413602215, "grad_norm": 1.3046875, "learning_rate": 0.00011314800015852759, "loss": 4.5368, "mean_token_accuracy": 0.2648057207465172, "num_tokens": 175595081.0, "step": 76670 }, { "entropy": 5.141284704208374, "epoch": 7.579576907868723, "grad_norm": 1.3828125, "learning_rate": 0.00011312348775624668, "loss": 4.406, "mean_token_accuracy": 0.28716468513011933, "num_tokens": 175605211.0, "step": 76675 }, { "entropy": 5.291609621047973, "epoch": 7.580071174377224, "grad_norm": 1.28125, "learning_rate": 0.00011309897933615299, "loss": 4.6609, "mean_token_accuracy": 0.25472174882888793, "num_tokens": 175616401.0, "step": 76680 }, { "entropy": 5.209473133087158, "epoch": 7.580565440885725, "grad_norm": 1.28125, "learning_rate": 0.00011307447489884961, "loss": 4.6377, "mean_token_accuracy": 0.25821047127246854, "num_tokens": 175628307.0, "step": 76685 }, { "entropy": 5.225331449508667, "epoch": 7.5810597073942265, "grad_norm": 1.28125, "learning_rate": 0.0001130499744449392, "loss": 4.5984, "mean_token_accuracy": 0.2590332001447678, "num_tokens": 175639931.0, "step": 76690 }, { "entropy": 5.195327520370483, "epoch": 7.581553973902729, "grad_norm": 1.1953125, "learning_rate": 0.00011302547797502453, "loss": 4.5785, "mean_token_accuracy": 0.2682204872369766, "num_tokens": 175651578.0, "step": 76695 }, { "entropy": 5.263522815704346, "epoch": 7.58204824041123, "grad_norm": 1.234375, "learning_rate": 0.00011300098548970825, "loss": 4.5749, "mean_token_accuracy": 0.2721999645233154, "num_tokens": 175663255.0, "step": 76700 }, { "entropy": 5.209135103225708, "epoch": 7.582542506919731, "grad_norm": 1.2421875, "learning_rate": 0.00011297649698959284, "loss": 4.4958, "mean_token_accuracy": 0.26518813967704774, "num_tokens": 175674126.0, "step": 76705 }, { "entropy": 5.309311056137085, "epoch": 7.5830367734282325, "grad_norm": 1.1640625, "learning_rate": 0.0001129520124752808, "loss": 4.6684, "mean_token_accuracy": 0.25361217707395556, "num_tokens": 175685780.0, "step": 76710 }, { "entropy": 5.281108379364014, "epoch": 7.583531039936734, "grad_norm": 1.2890625, "learning_rate": 0.00011292753194737436, "loss": 4.5996, "mean_token_accuracy": 0.2577616170048714, "num_tokens": 175697137.0, "step": 76715 }, { "entropy": 5.216699457168579, "epoch": 7.584025306445235, "grad_norm": 1.2109375, "learning_rate": 0.00011290305540647577, "loss": 4.5965, "mean_token_accuracy": 0.26069990545511246, "num_tokens": 175708544.0, "step": 76720 }, { "entropy": 5.22622766494751, "epoch": 7.584519572953736, "grad_norm": 1.328125, "learning_rate": 0.00011287858285318713, "loss": 4.5741, "mean_token_accuracy": 0.26157578378915786, "num_tokens": 175720122.0, "step": 76725 }, { "entropy": 5.3723390102386475, "epoch": 7.585013839462238, "grad_norm": 1.2265625, "learning_rate": 0.00011285411428811052, "loss": 4.7062, "mean_token_accuracy": 0.2526779890060425, "num_tokens": 175732472.0, "step": 76730 }, { "entropy": 5.20078411102295, "epoch": 7.58550810597074, "grad_norm": 1.34375, "learning_rate": 0.00011282964971184793, "loss": 4.5883, "mean_token_accuracy": 0.2638560965657234, "num_tokens": 175743719.0, "step": 76735 }, { "entropy": 5.27799768447876, "epoch": 7.586002372479241, "grad_norm": 1.15625, "learning_rate": 0.00011280518912500103, "loss": 4.6223, "mean_token_accuracy": 0.26302294582128527, "num_tokens": 175756635.0, "step": 76740 }, { "entropy": 5.290103435516357, "epoch": 7.586496638987742, "grad_norm": 1.15625, "learning_rate": 0.00011278073252817167, "loss": 4.6885, "mean_token_accuracy": 0.26090427190065385, "num_tokens": 175768897.0, "step": 76745 }, { "entropy": 5.1840744972229, "epoch": 7.586990905496243, "grad_norm": 1.2421875, "learning_rate": 0.0001127562799219615, "loss": 4.5534, "mean_token_accuracy": 0.2710144594311714, "num_tokens": 175779733.0, "step": 76750 }, { "entropy": 5.208144760131836, "epoch": 7.587485172004745, "grad_norm": 1.171875, "learning_rate": 0.00011273183130697188, "loss": 4.53, "mean_token_accuracy": 0.27080355435609815, "num_tokens": 175791092.0, "step": 76755 }, { "entropy": 5.258338594436646, "epoch": 7.587979438513246, "grad_norm": 1.265625, "learning_rate": 0.00011270738668380453, "loss": 4.5853, "mean_token_accuracy": 0.2639335677027702, "num_tokens": 175802495.0, "step": 76760 }, { "entropy": 5.259827470779419, "epoch": 7.588473705021748, "grad_norm": 1.390625, "learning_rate": 0.00011268294605306056, "loss": 4.5439, "mean_token_accuracy": 0.27087450921535494, "num_tokens": 175812532.0, "step": 76765 }, { "entropy": 5.212141275405884, "epoch": 7.588967971530249, "grad_norm": 1.2578125, "learning_rate": 0.00011265850941534131, "loss": 4.576, "mean_token_accuracy": 0.2616474360227585, "num_tokens": 175822817.0, "step": 76770 }, { "entropy": 5.225775051116943, "epoch": 7.589462238038751, "grad_norm": 1.1875, "learning_rate": 0.00011263407677124797, "loss": 4.5593, "mean_token_accuracy": 0.26241539865732194, "num_tokens": 175834459.0, "step": 76775 }, { "entropy": 5.2349425792694095, "epoch": 7.589956504547252, "grad_norm": 1.1640625, "learning_rate": 0.00011260964812138148, "loss": 4.5495, "mean_token_accuracy": 0.2735410213470459, "num_tokens": 175846368.0, "step": 76780 }, { "entropy": 5.187629842758179, "epoch": 7.590450771055753, "grad_norm": 1.15625, "learning_rate": 0.00011258522346634285, "loss": 4.5446, "mean_token_accuracy": 0.27125096321105957, "num_tokens": 175857984.0, "step": 76785 }, { "entropy": 5.161390399932861, "epoch": 7.590945037564254, "grad_norm": 1.09375, "learning_rate": 0.0001125608028067329, "loss": 4.4839, "mean_token_accuracy": 0.2761480540037155, "num_tokens": 175870243.0, "step": 76790 }, { "entropy": 5.171080636978149, "epoch": 7.591439304072756, "grad_norm": 1.2734375, "learning_rate": 0.0001125363861431524, "loss": 4.464, "mean_token_accuracy": 0.27787803262472155, "num_tokens": 175881066.0, "step": 76795 }, { "entropy": 5.231672906875611, "epoch": 7.591933570581258, "grad_norm": 1.2265625, "learning_rate": 0.00011251197347620205, "loss": 4.5305, "mean_token_accuracy": 0.2716727077960968, "num_tokens": 175890982.0, "step": 76800 }, { "entropy": 5.227037191390991, "epoch": 7.592427837089759, "grad_norm": 1.15625, "learning_rate": 0.00011248756480648234, "loss": 4.5834, "mean_token_accuracy": 0.26171465665102006, "num_tokens": 175902210.0, "step": 76805 }, { "entropy": 5.179953718185425, "epoch": 7.59292210359826, "grad_norm": 1.1796875, "learning_rate": 0.0001124631601345937, "loss": 4.5276, "mean_token_accuracy": 0.2697421446442604, "num_tokens": 175913215.0, "step": 76810 }, { "entropy": 5.315812015533448, "epoch": 7.593416370106762, "grad_norm": 1.234375, "learning_rate": 0.00011243875946113658, "loss": 4.6566, "mean_token_accuracy": 0.251779580116272, "num_tokens": 175924749.0, "step": 76815 }, { "entropy": 5.2453100204467775, "epoch": 7.593910636615263, "grad_norm": 1.2265625, "learning_rate": 0.00011241436278671117, "loss": 4.5676, "mean_token_accuracy": 0.2658014059066772, "num_tokens": 175938105.0, "step": 76820 }, { "entropy": 5.275079870223999, "epoch": 7.594404903123764, "grad_norm": 1.3671875, "learning_rate": 0.00011238997011191773, "loss": 4.6773, "mean_token_accuracy": 0.25533535331487656, "num_tokens": 175950273.0, "step": 76825 }, { "entropy": 5.317300701141358, "epoch": 7.594899169632265, "grad_norm": 1.15625, "learning_rate": 0.00011236558143735619, "loss": 4.6764, "mean_token_accuracy": 0.2580564945936203, "num_tokens": 175962267.0, "step": 76830 }, { "entropy": 5.205647087097168, "epoch": 7.595393436140768, "grad_norm": 1.28125, "learning_rate": 0.00011234119676362655, "loss": 4.5756, "mean_token_accuracy": 0.26706202477216723, "num_tokens": 175973622.0, "step": 76835 }, { "entropy": 5.230870866775513, "epoch": 7.595887702649269, "grad_norm": 1.21875, "learning_rate": 0.00011231681609132882, "loss": 4.6071, "mean_token_accuracy": 0.2648671165108681, "num_tokens": 175985718.0, "step": 76840 }, { "entropy": 5.148998832702636, "epoch": 7.59638196915777, "grad_norm": 1.1171875, "learning_rate": 0.00011229243942106249, "loss": 4.4684, "mean_token_accuracy": 0.2714142963290215, "num_tokens": 175998051.0, "step": 76845 }, { "entropy": 5.241297769546509, "epoch": 7.596876235666271, "grad_norm": 1.3125, "learning_rate": 0.00011226806675342752, "loss": 4.5549, "mean_token_accuracy": 0.27210141271352767, "num_tokens": 176009166.0, "step": 76850 }, { "entropy": 5.265444755554199, "epoch": 7.597370502174773, "grad_norm": 1.1953125, "learning_rate": 0.00011224369808902332, "loss": 4.5342, "mean_token_accuracy": 0.27000486850738525, "num_tokens": 176019971.0, "step": 76855 }, { "entropy": 5.215478086471558, "epoch": 7.597864768683274, "grad_norm": 1.171875, "learning_rate": 0.00011221933342844936, "loss": 4.5216, "mean_token_accuracy": 0.26460820287466047, "num_tokens": 176032735.0, "step": 76860 }, { "entropy": 5.291932725906372, "epoch": 7.598359035191775, "grad_norm": 1.1796875, "learning_rate": 0.00011219497277230515, "loss": 4.6249, "mean_token_accuracy": 0.26486436277627945, "num_tokens": 176046329.0, "step": 76865 }, { "entropy": 5.144640827178955, "epoch": 7.598853301700277, "grad_norm": 1.1171875, "learning_rate": 0.00011217061612118976, "loss": 4.4797, "mean_token_accuracy": 0.2778285413980484, "num_tokens": 176057992.0, "step": 76870 }, { "entropy": 5.186788272857666, "epoch": 7.5993475682087785, "grad_norm": 1.3359375, "learning_rate": 0.0001121462634757025, "loss": 4.5154, "mean_token_accuracy": 0.2673351302742958, "num_tokens": 176069976.0, "step": 76875 }, { "entropy": 5.211333703994751, "epoch": 7.59984183471728, "grad_norm": 1.265625, "learning_rate": 0.0001121219148364424, "loss": 4.5971, "mean_token_accuracy": 0.25628873258829116, "num_tokens": 176082400.0, "step": 76880 }, { "entropy": 5.204134130477906, "epoch": 7.600336101225781, "grad_norm": 1.21875, "learning_rate": 0.00011209757020400849, "loss": 4.5224, "mean_token_accuracy": 0.2661183923482895, "num_tokens": 176094287.0, "step": 76885 }, { "entropy": 5.206152725219726, "epoch": 7.600830367734282, "grad_norm": 1.4453125, "learning_rate": 0.00011207322957899969, "loss": 4.476, "mean_token_accuracy": 0.2753485307097435, "num_tokens": 176104839.0, "step": 76890 }, { "entropy": 5.196413516998291, "epoch": 7.601324634242784, "grad_norm": 1.1484375, "learning_rate": 0.00011204889296201462, "loss": 4.5076, "mean_token_accuracy": 0.2662909641861916, "num_tokens": 176116285.0, "step": 76895 }, { "entropy": 5.258584308624267, "epoch": 7.601818900751285, "grad_norm": 1.265625, "learning_rate": 0.0001120245603536521, "loss": 4.5923, "mean_token_accuracy": 0.2594755724072456, "num_tokens": 176127366.0, "step": 76900 }, { "entropy": 5.325820779800415, "epoch": 7.602313167259786, "grad_norm": 1.234375, "learning_rate": 0.00011200023175451065, "loss": 4.6552, "mean_token_accuracy": 0.25116337835788727, "num_tokens": 176139757.0, "step": 76905 }, { "entropy": 5.201312303543091, "epoch": 7.602807433768287, "grad_norm": 1.25, "learning_rate": 0.0001119759071651888, "loss": 4.5649, "mean_token_accuracy": 0.2607636466622353, "num_tokens": 176150474.0, "step": 76910 }, { "entropy": 5.178420543670654, "epoch": 7.6033017002767895, "grad_norm": 1.1484375, "learning_rate": 0.00011195158658628501, "loss": 4.5237, "mean_token_accuracy": 0.26872176229953765, "num_tokens": 176162442.0, "step": 76915 }, { "entropy": 5.305716466903687, "epoch": 7.603795966785291, "grad_norm": 1.140625, "learning_rate": 0.00011192727001839739, "loss": 4.6972, "mean_token_accuracy": 0.2556122228503227, "num_tokens": 176173816.0, "step": 76920 }, { "entropy": 5.261104869842529, "epoch": 7.604290233293792, "grad_norm": 1.2890625, "learning_rate": 0.00011190295746212426, "loss": 4.5298, "mean_token_accuracy": 0.2638566866517067, "num_tokens": 176186146.0, "step": 76925 }, { "entropy": 5.2742737293243405, "epoch": 7.604784499802293, "grad_norm": 1.28125, "learning_rate": 0.00011187864891806364, "loss": 4.6603, "mean_token_accuracy": 0.2582661509513855, "num_tokens": 176198256.0, "step": 76930 }, { "entropy": 5.258048009872437, "epoch": 7.605278766310795, "grad_norm": 1.2421875, "learning_rate": 0.00011185434438681359, "loss": 4.6372, "mean_token_accuracy": 0.25749130100011824, "num_tokens": 176209962.0, "step": 76935 }, { "entropy": 5.336750602722168, "epoch": 7.605773032819296, "grad_norm": 1.3125, "learning_rate": 0.00011183004386897203, "loss": 4.6684, "mean_token_accuracy": 0.2612773969769478, "num_tokens": 176220619.0, "step": 76940 }, { "entropy": 5.294786739349365, "epoch": 7.606267299327797, "grad_norm": 1.25, "learning_rate": 0.00011180574736513663, "loss": 4.6464, "mean_token_accuracy": 0.2641432359814644, "num_tokens": 176231956.0, "step": 76945 }, { "entropy": 5.239031839370727, "epoch": 7.606761565836299, "grad_norm": 1.1640625, "learning_rate": 0.00011178145487590519, "loss": 4.5439, "mean_token_accuracy": 0.26215351223945615, "num_tokens": 176244004.0, "step": 76950 }, { "entropy": 5.229747533798218, "epoch": 7.6072558323448005, "grad_norm": 1.234375, "learning_rate": 0.00011175716640187532, "loss": 4.5472, "mean_token_accuracy": 0.2622245728969574, "num_tokens": 176255816.0, "step": 76955 }, { "entropy": 5.220949268341064, "epoch": 7.607750098853302, "grad_norm": 1.3203125, "learning_rate": 0.00011173288194364437, "loss": 4.4924, "mean_token_accuracy": 0.2711647242307663, "num_tokens": 176267614.0, "step": 76960 }, { "entropy": 5.232970809936523, "epoch": 7.608244365361803, "grad_norm": 1.1875, "learning_rate": 0.00011170860150180994, "loss": 4.5969, "mean_token_accuracy": 0.2627497807145119, "num_tokens": 176278323.0, "step": 76965 }, { "entropy": 5.280453872680664, "epoch": 7.608738631870304, "grad_norm": 1.3359375, "learning_rate": 0.00011168432507696923, "loss": 4.6002, "mean_token_accuracy": 0.2595246732234955, "num_tokens": 176288826.0, "step": 76970 }, { "entropy": 5.243908882141113, "epoch": 7.609232898378806, "grad_norm": 1.171875, "learning_rate": 0.00011166005266971943, "loss": 4.5674, "mean_token_accuracy": 0.25551380813121793, "num_tokens": 176300376.0, "step": 76975 }, { "entropy": 5.220942068099975, "epoch": 7.609727164887307, "grad_norm": 1.234375, "learning_rate": 0.00011163578428065778, "loss": 4.5736, "mean_token_accuracy": 0.2617468759417534, "num_tokens": 176311191.0, "step": 76980 }, { "entropy": 5.219718742370605, "epoch": 7.610221431395809, "grad_norm": 1.2421875, "learning_rate": 0.00011161151991038108, "loss": 4.5449, "mean_token_accuracy": 0.2711398810148239, "num_tokens": 176321443.0, "step": 76985 }, { "entropy": 5.220918941497803, "epoch": 7.61071569790431, "grad_norm": 1.2265625, "learning_rate": 0.00011158725955948635, "loss": 4.6059, "mean_token_accuracy": 0.2632136449217796, "num_tokens": 176333430.0, "step": 76990 }, { "entropy": 5.162968492507934, "epoch": 7.6112099644128115, "grad_norm": 1.234375, "learning_rate": 0.00011156300322857038, "loss": 4.5056, "mean_token_accuracy": 0.26912727802991865, "num_tokens": 176344424.0, "step": 76995 }, { "entropy": 5.174987125396728, "epoch": 7.611704230921313, "grad_norm": 1.234375, "learning_rate": 0.00011153875091822987, "loss": 4.5032, "mean_token_accuracy": 0.274576435983181, "num_tokens": 176356194.0, "step": 77000 }, { "entropy": 5.27564582824707, "epoch": 7.612198497429814, "grad_norm": 1.2265625, "learning_rate": 0.00011151450262906154, "loss": 4.6498, "mean_token_accuracy": 0.25589998811483383, "num_tokens": 176368021.0, "step": 77005 }, { "entropy": 5.321015787124634, "epoch": 7.612692763938315, "grad_norm": 1.2421875, "learning_rate": 0.00011149025836166173, "loss": 4.6739, "mean_token_accuracy": 0.2556022748351097, "num_tokens": 176379240.0, "step": 77010 }, { "entropy": 5.209952402114868, "epoch": 7.6131870304468166, "grad_norm": 1.3046875, "learning_rate": 0.000111466018116627, "loss": 4.5968, "mean_token_accuracy": 0.2666525274515152, "num_tokens": 176391728.0, "step": 77015 }, { "entropy": 5.255252647399902, "epoch": 7.613681296955319, "grad_norm": 1.171875, "learning_rate": 0.00011144178189455348, "loss": 4.5896, "mean_token_accuracy": 0.2584023892879486, "num_tokens": 176403524.0, "step": 77020 }, { "entropy": 5.240255832672119, "epoch": 7.61417556346382, "grad_norm": 1.2890625, "learning_rate": 0.00011141754969603752, "loss": 4.557, "mean_token_accuracy": 0.2617364048957825, "num_tokens": 176414502.0, "step": 77025 }, { "entropy": 5.253810691833496, "epoch": 7.614669829972321, "grad_norm": 1.28125, "learning_rate": 0.0001113933215216753, "loss": 4.6319, "mean_token_accuracy": 0.262822137773037, "num_tokens": 176426516.0, "step": 77030 }, { "entropy": 5.209777927398681, "epoch": 7.6151640964808225, "grad_norm": 1.1640625, "learning_rate": 0.00011136909737206272, "loss": 4.5269, "mean_token_accuracy": 0.26448029428720476, "num_tokens": 176437676.0, "step": 77035 }, { "entropy": 5.239981746673584, "epoch": 7.615658362989324, "grad_norm": 1.2734375, "learning_rate": 0.00011134487724779576, "loss": 4.6039, "mean_token_accuracy": 0.25759932994842527, "num_tokens": 176447506.0, "step": 77040 }, { "entropy": 5.204542255401611, "epoch": 7.616152629497825, "grad_norm": 1.21875, "learning_rate": 0.00011132066114947009, "loss": 4.518, "mean_token_accuracy": 0.26759572327136993, "num_tokens": 176458275.0, "step": 77045 }, { "entropy": 5.271392869949341, "epoch": 7.616646896006326, "grad_norm": 1.2890625, "learning_rate": 0.0001112964490776816, "loss": 4.6232, "mean_token_accuracy": 0.25769722312688825, "num_tokens": 176470146.0, "step": 77050 }, { "entropy": 5.244502162933349, "epoch": 7.617141162514828, "grad_norm": 1.1953125, "learning_rate": 0.00011127224103302594, "loss": 4.6004, "mean_token_accuracy": 0.2646477848291397, "num_tokens": 176480640.0, "step": 77055 }, { "entropy": 5.243338966369629, "epoch": 7.61763542902333, "grad_norm": 1.21875, "learning_rate": 0.00011124803701609848, "loss": 4.6343, "mean_token_accuracy": 0.2561779111623764, "num_tokens": 176492827.0, "step": 77060 }, { "entropy": 5.259119749069214, "epoch": 7.618129695531831, "grad_norm": 1.203125, "learning_rate": 0.00011122383702749478, "loss": 4.6447, "mean_token_accuracy": 0.2578415259718895, "num_tokens": 176504859.0, "step": 77065 }, { "entropy": 5.2352942943573, "epoch": 7.618623962040332, "grad_norm": 1.390625, "learning_rate": 0.00011119964106781002, "loss": 4.5196, "mean_token_accuracy": 0.2725496977567673, "num_tokens": 176514297.0, "step": 77070 }, { "entropy": 5.204655885696411, "epoch": 7.6191182285488335, "grad_norm": 1.359375, "learning_rate": 0.00011117544913763945, "loss": 4.4979, "mean_token_accuracy": 0.2698110446333885, "num_tokens": 176524894.0, "step": 77075 }, { "entropy": 5.23119592666626, "epoch": 7.619612495057335, "grad_norm": 1.203125, "learning_rate": 0.00011115126123757834, "loss": 4.5501, "mean_token_accuracy": 0.2649544388055801, "num_tokens": 176536152.0, "step": 77080 }, { "entropy": 5.174024057388306, "epoch": 7.620106761565836, "grad_norm": 1.15625, "learning_rate": 0.0001111270773682216, "loss": 4.5418, "mean_token_accuracy": 0.26764816641807554, "num_tokens": 176547978.0, "step": 77085 }, { "entropy": 5.2124488830566404, "epoch": 7.620601028074338, "grad_norm": 1.1484375, "learning_rate": 0.00011110289753016425, "loss": 4.5577, "mean_token_accuracy": 0.2713569402694702, "num_tokens": 176559504.0, "step": 77090 }, { "entropy": 5.177996826171875, "epoch": 7.621095294582839, "grad_norm": 1.359375, "learning_rate": 0.00011107872172400097, "loss": 4.5046, "mean_token_accuracy": 0.2686769083142281, "num_tokens": 176570471.0, "step": 77095 }, { "entropy": 5.223644161224366, "epoch": 7.621589561091341, "grad_norm": 1.2265625, "learning_rate": 0.00011105454995032655, "loss": 4.5387, "mean_token_accuracy": 0.26664225906133654, "num_tokens": 176581685.0, "step": 77100 }, { "entropy": 5.210852336883545, "epoch": 7.622083827599842, "grad_norm": 1.1484375, "learning_rate": 0.00011103038220973566, "loss": 4.5278, "mean_token_accuracy": 0.2773353934288025, "num_tokens": 176594999.0, "step": 77105 }, { "entropy": 5.235237407684326, "epoch": 7.622578094108343, "grad_norm": 1.1953125, "learning_rate": 0.0001110062185028228, "loss": 4.5645, "mean_token_accuracy": 0.2639943525195122, "num_tokens": 176607787.0, "step": 77110 }, { "entropy": 5.238105154037475, "epoch": 7.6230723606168445, "grad_norm": 1.2265625, "learning_rate": 0.00011098205883018244, "loss": 4.5907, "mean_token_accuracy": 0.25812303721904756, "num_tokens": 176619067.0, "step": 77115 }, { "entropy": 5.235770606994629, "epoch": 7.623566627125346, "grad_norm": 1.234375, "learning_rate": 0.00011095790319240887, "loss": 4.5743, "mean_token_accuracy": 0.2613809108734131, "num_tokens": 176630600.0, "step": 77120 }, { "entropy": 5.251474475860595, "epoch": 7.624060893633848, "grad_norm": 1.234375, "learning_rate": 0.00011093375159009627, "loss": 4.6181, "mean_token_accuracy": 0.2599135860800743, "num_tokens": 176642330.0, "step": 77125 }, { "entropy": 5.1667218685150145, "epoch": 7.624555160142349, "grad_norm": 1.1484375, "learning_rate": 0.00011090960402383893, "loss": 4.4615, "mean_token_accuracy": 0.27596814930438995, "num_tokens": 176654331.0, "step": 77130 }, { "entropy": 5.204103994369507, "epoch": 7.62504942665085, "grad_norm": 1.296875, "learning_rate": 0.00011088546049423064, "loss": 4.5275, "mean_token_accuracy": 0.26364834159612655, "num_tokens": 176664726.0, "step": 77135 }, { "entropy": 5.225784683227539, "epoch": 7.625543693159352, "grad_norm": 1.421875, "learning_rate": 0.00011086132100186567, "loss": 4.5623, "mean_token_accuracy": 0.26104132980108263, "num_tokens": 176674521.0, "step": 77140 }, { "entropy": 5.159612703323364, "epoch": 7.626037959667853, "grad_norm": 1.21875, "learning_rate": 0.00011083718554733751, "loss": 4.5573, "mean_token_accuracy": 0.262437579035759, "num_tokens": 176686882.0, "step": 77145 }, { "entropy": 5.209124374389648, "epoch": 7.626532226176354, "grad_norm": 1.265625, "learning_rate": 0.00011081305413124011, "loss": 4.5904, "mean_token_accuracy": 0.2649556308984756, "num_tokens": 176698355.0, "step": 77150 }, { "entropy": 5.293014430999756, "epoch": 7.627026492684855, "grad_norm": 1.2890625, "learning_rate": 0.00011078892675416711, "loss": 4.6141, "mean_token_accuracy": 0.25750347822904585, "num_tokens": 176708784.0, "step": 77155 }, { "entropy": 5.293270921707153, "epoch": 7.627520759193357, "grad_norm": 1.1015625, "learning_rate": 0.00011076480341671191, "loss": 4.6383, "mean_token_accuracy": 0.2625043272972107, "num_tokens": 176721302.0, "step": 77160 }, { "entropy": 5.2627424716949465, "epoch": 7.628015025701858, "grad_norm": 1.3671875, "learning_rate": 0.00011074068411946805, "loss": 4.5625, "mean_token_accuracy": 0.2615425646305084, "num_tokens": 176731550.0, "step": 77165 }, { "entropy": 5.218804502487183, "epoch": 7.62850929221036, "grad_norm": 1.28125, "learning_rate": 0.00011071656886302881, "loss": 4.5482, "mean_token_accuracy": 0.27045565396547316, "num_tokens": 176743804.0, "step": 77170 }, { "entropy": 5.231105089187622, "epoch": 7.629003558718861, "grad_norm": 1.1875, "learning_rate": 0.00011069245764798749, "loss": 4.5774, "mean_token_accuracy": 0.2714498996734619, "num_tokens": 176755067.0, "step": 77175 }, { "entropy": 5.202316665649414, "epoch": 7.629497825227363, "grad_norm": 1.109375, "learning_rate": 0.00011066835047493724, "loss": 4.5535, "mean_token_accuracy": 0.2724558487534523, "num_tokens": 176766769.0, "step": 77180 }, { "entropy": 5.114406394958496, "epoch": 7.629992091735864, "grad_norm": 1.2265625, "learning_rate": 0.00011064424734447102, "loss": 4.4306, "mean_token_accuracy": 0.28612866401672366, "num_tokens": 176778025.0, "step": 77185 }, { "entropy": 5.150511789321899, "epoch": 7.630486358244365, "grad_norm": 1.2734375, "learning_rate": 0.00011062014825718178, "loss": 4.4526, "mean_token_accuracy": 0.2804741621017456, "num_tokens": 176789076.0, "step": 77190 }, { "entropy": 5.249826049804687, "epoch": 7.630980624752866, "grad_norm": 1.1875, "learning_rate": 0.00011059605321366242, "loss": 4.6313, "mean_token_accuracy": 0.261984159052372, "num_tokens": 176801723.0, "step": 77195 }, { "entropy": 5.3229883193969725, "epoch": 7.631474891261368, "grad_norm": 1.171875, "learning_rate": 0.00011057196221450566, "loss": 4.7375, "mean_token_accuracy": 0.25652962177991867, "num_tokens": 176813951.0, "step": 77200 }, { "entropy": 5.15691647529602, "epoch": 7.63196915776987, "grad_norm": 1.2109375, "learning_rate": 0.00011054787526030421, "loss": 4.4742, "mean_token_accuracy": 0.2729791015386581, "num_tokens": 176825978.0, "step": 77205 }, { "entropy": 5.197746753692627, "epoch": 7.632463424278371, "grad_norm": 1.2578125, "learning_rate": 0.00011052379235165048, "loss": 4.5665, "mean_token_accuracy": 0.2712759181857109, "num_tokens": 176837426.0, "step": 77210 }, { "entropy": 5.278519105911255, "epoch": 7.632957690786872, "grad_norm": 1.1328125, "learning_rate": 0.00011049971348913693, "loss": 4.5855, "mean_token_accuracy": 0.2687221258878708, "num_tokens": 176849487.0, "step": 77215 }, { "entropy": 5.240193223953247, "epoch": 7.633451957295374, "grad_norm": 1.296875, "learning_rate": 0.00011047563867335598, "loss": 4.574, "mean_token_accuracy": 0.2639251187443733, "num_tokens": 176860767.0, "step": 77220 }, { "entropy": 5.148558759689331, "epoch": 7.633946223803875, "grad_norm": 1.3515625, "learning_rate": 0.00011045156790489983, "loss": 4.477, "mean_token_accuracy": 0.2769103139638901, "num_tokens": 176871205.0, "step": 77225 }, { "entropy": 5.27974042892456, "epoch": 7.634440490312376, "grad_norm": 1.234375, "learning_rate": 0.00011042750118436073, "loss": 4.7033, "mean_token_accuracy": 0.25182417333126067, "num_tokens": 176883130.0, "step": 77230 }, { "entropy": 5.286776924133301, "epoch": 7.634934756820877, "grad_norm": 1.1953125, "learning_rate": 0.00011040343851233054, "loss": 4.6804, "mean_token_accuracy": 0.25656718462705613, "num_tokens": 176894478.0, "step": 77235 }, { "entropy": 5.246716165542603, "epoch": 7.63542902332938, "grad_norm": 1.2734375, "learning_rate": 0.0001103793798894013, "loss": 4.5801, "mean_token_accuracy": 0.2666486456990242, "num_tokens": 176907359.0, "step": 77240 }, { "entropy": 5.27427978515625, "epoch": 7.635923289837881, "grad_norm": 1.3515625, "learning_rate": 0.00011035532531616494, "loss": 4.6287, "mean_token_accuracy": 0.2587056547403336, "num_tokens": 176918118.0, "step": 77245 }, { "entropy": 5.2673131942749025, "epoch": 7.636417556346382, "grad_norm": 1.1640625, "learning_rate": 0.00011033127479321295, "loss": 4.5785, "mean_token_accuracy": 0.2638771876692772, "num_tokens": 176929542.0, "step": 77250 }, { "entropy": 5.277129745483398, "epoch": 7.636911822854883, "grad_norm": 1.2578125, "learning_rate": 0.00011030722832113729, "loss": 4.5935, "mean_token_accuracy": 0.26345018297433853, "num_tokens": 176941189.0, "step": 77255 }, { "entropy": 5.2248039722442625, "epoch": 7.637406089363385, "grad_norm": 1.3203125, "learning_rate": 0.00011028318590052932, "loss": 4.5189, "mean_token_accuracy": 0.27252636700868604, "num_tokens": 176953036.0, "step": 77260 }, { "entropy": 5.130375385284424, "epoch": 7.637900355871886, "grad_norm": 1.171875, "learning_rate": 0.00011025914753198052, "loss": 4.4004, "mean_token_accuracy": 0.2796235144138336, "num_tokens": 176963813.0, "step": 77265 }, { "entropy": 5.279528427124023, "epoch": 7.638394622380387, "grad_norm": 1.203125, "learning_rate": 0.00011023511321608232, "loss": 4.6535, "mean_token_accuracy": 0.25597139447927475, "num_tokens": 176974764.0, "step": 77270 }, { "entropy": 5.216170930862427, "epoch": 7.638888888888889, "grad_norm": 1.0390625, "learning_rate": 0.00011021108295342583, "loss": 4.5798, "mean_token_accuracy": 0.27136180698871615, "num_tokens": 176987971.0, "step": 77275 }, { "entropy": 5.19557375907898, "epoch": 7.6393831553973905, "grad_norm": 1.2578125, "learning_rate": 0.00011018705674460223, "loss": 4.5593, "mean_token_accuracy": 0.26836471259593964, "num_tokens": 176999407.0, "step": 77280 }, { "entropy": 5.184440803527832, "epoch": 7.639877421905892, "grad_norm": 1.1953125, "learning_rate": 0.00011016303459020263, "loss": 4.537, "mean_token_accuracy": 0.25924180895090104, "num_tokens": 177010990.0, "step": 77285 }, { "entropy": 5.294437646865845, "epoch": 7.640371688414393, "grad_norm": 1.3125, "learning_rate": 0.00011013901649081796, "loss": 4.6682, "mean_token_accuracy": 0.2613518685102463, "num_tokens": 177022754.0, "step": 77290 }, { "entropy": 5.271064043045044, "epoch": 7.640865954922894, "grad_norm": 1.203125, "learning_rate": 0.00011011500244703912, "loss": 4.6056, "mean_token_accuracy": 0.25912043899297715, "num_tokens": 177034559.0, "step": 77295 }, { "entropy": 5.18649320602417, "epoch": 7.641360221431396, "grad_norm": 1.1484375, "learning_rate": 0.00011009099245945672, "loss": 4.5057, "mean_token_accuracy": 0.26944937705993655, "num_tokens": 177045676.0, "step": 77300 }, { "entropy": 5.217529058456421, "epoch": 7.641854487939897, "grad_norm": 1.1953125, "learning_rate": 0.00011006698652866151, "loss": 4.5297, "mean_token_accuracy": 0.27126910984516145, "num_tokens": 177056642.0, "step": 77305 }, { "entropy": 5.221189498901367, "epoch": 7.642348754448399, "grad_norm": 1.1796875, "learning_rate": 0.000110042984655244, "loss": 4.5729, "mean_token_accuracy": 0.26412798911333085, "num_tokens": 177068884.0, "step": 77310 }, { "entropy": 5.172499179840088, "epoch": 7.6428430209569, "grad_norm": 1.1328125, "learning_rate": 0.00011001898683979467, "loss": 4.4974, "mean_token_accuracy": 0.27140507847070694, "num_tokens": 177081113.0, "step": 77315 }, { "entropy": 5.204000473022461, "epoch": 7.6433372874654015, "grad_norm": 1.203125, "learning_rate": 0.00010999499308290392, "loss": 4.4634, "mean_token_accuracy": 0.2698187053203583, "num_tokens": 177092888.0, "step": 77320 }, { "entropy": 5.26593770980835, "epoch": 7.643831553973903, "grad_norm": 1.2578125, "learning_rate": 0.00010997100338516186, "loss": 4.6547, "mean_token_accuracy": 0.2568772926926613, "num_tokens": 177104188.0, "step": 77325 }, { "entropy": 5.253178691864013, "epoch": 7.644325820482404, "grad_norm": 1.2109375, "learning_rate": 0.00010994701774715873, "loss": 4.5527, "mean_token_accuracy": 0.26996776908636094, "num_tokens": 177115016.0, "step": 77330 }, { "entropy": 5.082647514343262, "epoch": 7.644820086990905, "grad_norm": 1.296875, "learning_rate": 0.00010992303616948465, "loss": 4.4554, "mean_token_accuracy": 0.2751746892929077, "num_tokens": 177126911.0, "step": 77335 }, { "entropy": 5.270724821090698, "epoch": 7.645314353499407, "grad_norm": 1.328125, "learning_rate": 0.00010989905865272933, "loss": 4.5541, "mean_token_accuracy": 0.2673922091722488, "num_tokens": 177138195.0, "step": 77340 }, { "entropy": 5.195954370498657, "epoch": 7.645808620007909, "grad_norm": 1.21875, "learning_rate": 0.00010987508519748291, "loss": 4.541, "mean_token_accuracy": 0.26957030445337293, "num_tokens": 177150092.0, "step": 77345 }, { "entropy": 5.168101787567139, "epoch": 7.64630288651641, "grad_norm": 1.2890625, "learning_rate": 0.00010985111580433498, "loss": 4.4944, "mean_token_accuracy": 0.27351580262184144, "num_tokens": 177162590.0, "step": 77350 }, { "entropy": 5.146410322189331, "epoch": 7.646797153024911, "grad_norm": 1.2109375, "learning_rate": 0.0001098271504738752, "loss": 4.4733, "mean_token_accuracy": 0.27340108901262283, "num_tokens": 177173937.0, "step": 77355 }, { "entropy": 5.2954607009887695, "epoch": 7.6472914195334125, "grad_norm": 1.3203125, "learning_rate": 0.00010980318920669322, "loss": 4.6744, "mean_token_accuracy": 0.257287310063839, "num_tokens": 177185086.0, "step": 77360 }, { "entropy": 5.168136167526245, "epoch": 7.647785686041914, "grad_norm": 1.2734375, "learning_rate": 0.00010977923200337825, "loss": 4.5034, "mean_token_accuracy": 0.27338518649339677, "num_tokens": 177196205.0, "step": 77365 }, { "entropy": 5.279221391677856, "epoch": 7.648279952550415, "grad_norm": 1.2890625, "learning_rate": 0.00010975527886451997, "loss": 4.5725, "mean_token_accuracy": 0.2668275773525238, "num_tokens": 177208125.0, "step": 77370 }, { "entropy": 5.19342679977417, "epoch": 7.648774219058916, "grad_norm": 1.390625, "learning_rate": 0.00010973132979070741, "loss": 4.4901, "mean_token_accuracy": 0.2765068978071213, "num_tokens": 177218714.0, "step": 77375 }, { "entropy": 5.240733289718628, "epoch": 7.649268485567418, "grad_norm": 1.3046875, "learning_rate": 0.00010970738478252973, "loss": 4.5114, "mean_token_accuracy": 0.26320036202669145, "num_tokens": 177229943.0, "step": 77380 }, { "entropy": 5.262103748321533, "epoch": 7.64976275207592, "grad_norm": 1.2578125, "learning_rate": 0.00010968344384057614, "loss": 4.5586, "mean_token_accuracy": 0.26339573264122007, "num_tokens": 177241127.0, "step": 77385 }, { "entropy": 5.255955457687378, "epoch": 7.650257018584421, "grad_norm": 1.296875, "learning_rate": 0.00010965950696543536, "loss": 4.6378, "mean_token_accuracy": 0.26354982852935793, "num_tokens": 177252130.0, "step": 77390 }, { "entropy": 5.198475074768067, "epoch": 7.650751285092922, "grad_norm": 1.2578125, "learning_rate": 0.00010963557415769642, "loss": 4.5375, "mean_token_accuracy": 0.26642837673425673, "num_tokens": 177263218.0, "step": 77395 }, { "entropy": 5.20513391494751, "epoch": 7.6512455516014235, "grad_norm": 1.2109375, "learning_rate": 0.00010961164541794796, "loss": 4.5247, "mean_token_accuracy": 0.27598806470632553, "num_tokens": 177274863.0, "step": 77400 }, { "entropy": 5.214762878417969, "epoch": 7.651739818109925, "grad_norm": 1.265625, "learning_rate": 0.0001095877207467787, "loss": 4.4933, "mean_token_accuracy": 0.2664457842707634, "num_tokens": 177285898.0, "step": 77405 }, { "entropy": 5.098429775238037, "epoch": 7.652234084618426, "grad_norm": 1.1640625, "learning_rate": 0.00010956380014477724, "loss": 4.4394, "mean_token_accuracy": 0.28152807205915453, "num_tokens": 177297613.0, "step": 77410 }, { "entropy": 5.1249888896942135, "epoch": 7.652728351126927, "grad_norm": 1.2421875, "learning_rate": 0.0001095398836125319, "loss": 4.4921, "mean_token_accuracy": 0.27657092213630674, "num_tokens": 177309415.0, "step": 77415 }, { "entropy": 5.188134050369262, "epoch": 7.6532226176354285, "grad_norm": 1.3046875, "learning_rate": 0.00010951597115063109, "loss": 4.5559, "mean_token_accuracy": 0.26100778132677077, "num_tokens": 177320527.0, "step": 77420 }, { "entropy": 5.252001857757568, "epoch": 7.653716884143931, "grad_norm": 1.234375, "learning_rate": 0.00010949206275966303, "loss": 4.6435, "mean_token_accuracy": 0.25384423285722735, "num_tokens": 177332477.0, "step": 77425 }, { "entropy": 5.196608638763427, "epoch": 7.654211150652432, "grad_norm": 1.328125, "learning_rate": 0.00010946815844021593, "loss": 4.544, "mean_token_accuracy": 0.2672835186123848, "num_tokens": 177343588.0, "step": 77430 }, { "entropy": 5.258226156234741, "epoch": 7.654705417160933, "grad_norm": 1.3515625, "learning_rate": 0.00010944425819287788, "loss": 4.5982, "mean_token_accuracy": 0.27179607897996905, "num_tokens": 177353951.0, "step": 77435 }, { "entropy": 5.211174154281617, "epoch": 7.6551996836694345, "grad_norm": 1.2109375, "learning_rate": 0.00010942036201823671, "loss": 4.5572, "mean_token_accuracy": 0.26797090470790863, "num_tokens": 177366569.0, "step": 77440 }, { "entropy": 5.20999813079834, "epoch": 7.655693950177936, "grad_norm": 1.28125, "learning_rate": 0.00010939646991688037, "loss": 4.548, "mean_token_accuracy": 0.2733610957860947, "num_tokens": 177378240.0, "step": 77445 }, { "entropy": 5.184657907485962, "epoch": 7.656188216686437, "grad_norm": 1.28125, "learning_rate": 0.0001093725818893965, "loss": 4.5384, "mean_token_accuracy": 0.2659303456544876, "num_tokens": 177389631.0, "step": 77450 }, { "entropy": 5.221699523925781, "epoch": 7.656682483194938, "grad_norm": 1.1796875, "learning_rate": 0.00010934869793637271, "loss": 4.5723, "mean_token_accuracy": 0.2644703403115273, "num_tokens": 177401294.0, "step": 77455 }, { "entropy": 5.170920991897583, "epoch": 7.65717674970344, "grad_norm": 1.3828125, "learning_rate": 0.00010932481805839683, "loss": 4.5289, "mean_token_accuracy": 0.2748986318707466, "num_tokens": 177412279.0, "step": 77460 }, { "entropy": 5.185735082626342, "epoch": 7.657671016211942, "grad_norm": 1.25, "learning_rate": 0.00010930094225605602, "loss": 4.4569, "mean_token_accuracy": 0.27311764657497406, "num_tokens": 177423576.0, "step": 77465 }, { "entropy": 5.301742696762085, "epoch": 7.658165282720443, "grad_norm": 1.2109375, "learning_rate": 0.00010927707052993785, "loss": 4.6536, "mean_token_accuracy": 0.25919941514730455, "num_tokens": 177434428.0, "step": 77470 }, { "entropy": 5.282404375076294, "epoch": 7.658659549228944, "grad_norm": 1.3671875, "learning_rate": 0.00010925320288062938, "loss": 4.6558, "mean_token_accuracy": 0.26567893773317336, "num_tokens": 177445663.0, "step": 77475 }, { "entropy": 5.1905073642730715, "epoch": 7.6591538157374455, "grad_norm": 1.2265625, "learning_rate": 0.00010922933930871778, "loss": 4.4984, "mean_token_accuracy": 0.2676548808813095, "num_tokens": 177456141.0, "step": 77480 }, { "entropy": 5.269605255126953, "epoch": 7.659648082245947, "grad_norm": 1.3203125, "learning_rate": 0.0001092054798147902, "loss": 4.6594, "mean_token_accuracy": 0.26439315378665923, "num_tokens": 177467269.0, "step": 77485 }, { "entropy": 5.232807159423828, "epoch": 7.660142348754448, "grad_norm": 1.140625, "learning_rate": 0.00010918162439943352, "loss": 4.6054, "mean_token_accuracy": 0.262875035405159, "num_tokens": 177479839.0, "step": 77490 }, { "entropy": 5.239114761352539, "epoch": 7.66063661526295, "grad_norm": 1.09375, "learning_rate": 0.00010915777306323468, "loss": 4.5767, "mean_token_accuracy": 0.2679342284798622, "num_tokens": 177491750.0, "step": 77495 }, { "entropy": 5.286356449127197, "epoch": 7.661130881771451, "grad_norm": 1.2734375, "learning_rate": 0.00010913392580678028, "loss": 4.6278, "mean_token_accuracy": 0.25721236020326615, "num_tokens": 177503248.0, "step": 77500 }, { "entropy": 5.208694219589233, "epoch": 7.661625148279953, "grad_norm": 1.1328125, "learning_rate": 0.00010911008263065705, "loss": 4.5803, "mean_token_accuracy": 0.2705239236354828, "num_tokens": 177513892.0, "step": 77505 }, { "entropy": 5.226234292984008, "epoch": 7.662119414788454, "grad_norm": 1.203125, "learning_rate": 0.00010908624353545155, "loss": 4.5955, "mean_token_accuracy": 0.2637443467974663, "num_tokens": 177525357.0, "step": 77510 }, { "entropy": 5.2658144474029545, "epoch": 7.662613681296955, "grad_norm": 1.3203125, "learning_rate": 0.00010906240852175009, "loss": 4.5859, "mean_token_accuracy": 0.2627149522304535, "num_tokens": 177536277.0, "step": 77515 }, { "entropy": 5.208868074417114, "epoch": 7.6631079478054565, "grad_norm": 1.3125, "learning_rate": 0.00010903857759013927, "loss": 4.5639, "mean_token_accuracy": 0.26244099736213683, "num_tokens": 177547868.0, "step": 77520 }, { "entropy": 5.2520835399627686, "epoch": 7.663602214313958, "grad_norm": 1.2734375, "learning_rate": 0.0001090147507412051, "loss": 4.5946, "mean_token_accuracy": 0.26151216626167295, "num_tokens": 177558395.0, "step": 77525 }, { "entropy": 5.268736839294434, "epoch": 7.66409648082246, "grad_norm": 1.2890625, "learning_rate": 0.00010899092797553384, "loss": 4.592, "mean_token_accuracy": 0.2594314649701118, "num_tokens": 177570047.0, "step": 77530 }, { "entropy": 5.232212066650391, "epoch": 7.664590747330961, "grad_norm": 1.203125, "learning_rate": 0.00010896710929371155, "loss": 4.5698, "mean_token_accuracy": 0.271281298995018, "num_tokens": 177581226.0, "step": 77535 }, { "entropy": 5.245507764816284, "epoch": 7.665085013839462, "grad_norm": 1.25, "learning_rate": 0.000108943294696324, "loss": 4.6042, "mean_token_accuracy": 0.2637112408876419, "num_tokens": 177592279.0, "step": 77540 }, { "entropy": 5.298585557937622, "epoch": 7.665579280347964, "grad_norm": 1.140625, "learning_rate": 0.00010891948418395728, "loss": 4.6353, "mean_token_accuracy": 0.2651658743619919, "num_tokens": 177604891.0, "step": 77545 }, { "entropy": 5.2948455810546875, "epoch": 7.666073546856465, "grad_norm": 1.28125, "learning_rate": 0.00010889567775719697, "loss": 4.5979, "mean_token_accuracy": 0.2693818688392639, "num_tokens": 177616579.0, "step": 77550 }, { "entropy": 5.215199995040893, "epoch": 7.666567813364966, "grad_norm": 1.21875, "learning_rate": 0.00010887187541662875, "loss": 4.5417, "mean_token_accuracy": 0.2658415392041206, "num_tokens": 177626284.0, "step": 77555 }, { "entropy": 5.181019926071167, "epoch": 7.667062079873467, "grad_norm": 1.1484375, "learning_rate": 0.00010884807716283824, "loss": 4.4787, "mean_token_accuracy": 0.2705470860004425, "num_tokens": 177638245.0, "step": 77560 }, { "entropy": 5.26731276512146, "epoch": 7.66755634638197, "grad_norm": 1.2421875, "learning_rate": 0.00010882428299641073, "loss": 4.6068, "mean_token_accuracy": 0.2592989683151245, "num_tokens": 177649755.0, "step": 77565 }, { "entropy": 5.190661811828614, "epoch": 7.668050612890471, "grad_norm": 1.2421875, "learning_rate": 0.00010880049291793165, "loss": 4.548, "mean_token_accuracy": 0.26325784921646117, "num_tokens": 177660893.0, "step": 77570 }, { "entropy": 5.225872755050659, "epoch": 7.668544879398972, "grad_norm": 1.234375, "learning_rate": 0.00010877670692798622, "loss": 4.5334, "mean_token_accuracy": 0.2675695300102234, "num_tokens": 177672099.0, "step": 77575 }, { "entropy": 5.20096526145935, "epoch": 7.669039145907473, "grad_norm": 1.265625, "learning_rate": 0.00010875292502715958, "loss": 4.5196, "mean_token_accuracy": 0.2662310034036636, "num_tokens": 177684895.0, "step": 77580 }, { "entropy": 5.2285784721374515, "epoch": 7.669533412415975, "grad_norm": 1.203125, "learning_rate": 0.00010872914721603686, "loss": 4.5289, "mean_token_accuracy": 0.2674312576651573, "num_tokens": 177696311.0, "step": 77585 }, { "entropy": 5.262063121795654, "epoch": 7.670027678924476, "grad_norm": 1.2421875, "learning_rate": 0.00010870537349520282, "loss": 4.6371, "mean_token_accuracy": 0.2593944907188416, "num_tokens": 177708004.0, "step": 77590 }, { "entropy": 5.229569435119629, "epoch": 7.670521945432977, "grad_norm": 1.2734375, "learning_rate": 0.0001086816038652424, "loss": 4.5322, "mean_token_accuracy": 0.26351849883794787, "num_tokens": 177718666.0, "step": 77595 }, { "entropy": 5.234311532974243, "epoch": 7.671016211941479, "grad_norm": 1.1875, "learning_rate": 0.00010865783832674034, "loss": 4.6291, "mean_token_accuracy": 0.26417389661073687, "num_tokens": 177730173.0, "step": 77600 }, { "entropy": 5.229786968231201, "epoch": 7.671510478449981, "grad_norm": 1.203125, "learning_rate": 0.00010863407688028127, "loss": 4.6224, "mean_token_accuracy": 0.2693536922335625, "num_tokens": 177742001.0, "step": 77605 }, { "entropy": 5.243021631240845, "epoch": 7.672004744958482, "grad_norm": 1.3046875, "learning_rate": 0.00010861031952644975, "loss": 4.5403, "mean_token_accuracy": 0.26349989622831343, "num_tokens": 177752973.0, "step": 77610 }, { "entropy": 5.180683135986328, "epoch": 7.672499011466983, "grad_norm": 1.359375, "learning_rate": 0.00010858656626583015, "loss": 4.4788, "mean_token_accuracy": 0.26968011558055877, "num_tokens": 177764384.0, "step": 77615 }, { "entropy": 5.246927261352539, "epoch": 7.672993277975484, "grad_norm": 1.2890625, "learning_rate": 0.0001085628170990068, "loss": 4.5213, "mean_token_accuracy": 0.2752415344119072, "num_tokens": 177775714.0, "step": 77620 }, { "entropy": 5.220209360122681, "epoch": 7.673487544483986, "grad_norm": 1.1875, "learning_rate": 0.00010853907202656407, "loss": 4.4983, "mean_token_accuracy": 0.2714877903461456, "num_tokens": 177787045.0, "step": 77625 }, { "entropy": 5.185029363632202, "epoch": 7.673981810992487, "grad_norm": 1.1328125, "learning_rate": 0.00010851533104908584, "loss": 4.451, "mean_token_accuracy": 0.27732923030853274, "num_tokens": 177798964.0, "step": 77630 }, { "entropy": 5.227512979507447, "epoch": 7.674476077500988, "grad_norm": 1.2421875, "learning_rate": 0.00010849159416715645, "loss": 4.642, "mean_token_accuracy": 0.2629071906208992, "num_tokens": 177810196.0, "step": 77635 }, { "entropy": 5.163756227493286, "epoch": 7.67497034400949, "grad_norm": 1.203125, "learning_rate": 0.00010846786138135958, "loss": 4.478, "mean_token_accuracy": 0.2753016397356987, "num_tokens": 177820825.0, "step": 77640 }, { "entropy": 5.243959522247314, "epoch": 7.675464610517992, "grad_norm": 1.2421875, "learning_rate": 0.00010844413269227918, "loss": 4.6561, "mean_token_accuracy": 0.258480042219162, "num_tokens": 177832133.0, "step": 77645 }, { "entropy": 5.2103509426116945, "epoch": 7.675958877026493, "grad_norm": 1.2578125, "learning_rate": 0.000108420408100499, "loss": 4.5703, "mean_token_accuracy": 0.27317529618740083, "num_tokens": 177844353.0, "step": 77650 }, { "entropy": 5.23042402267456, "epoch": 7.676453143534994, "grad_norm": 1.15625, "learning_rate": 0.00010839668760660257, "loss": 4.6069, "mean_token_accuracy": 0.2622502237558365, "num_tokens": 177856856.0, "step": 77655 }, { "entropy": 5.268296527862549, "epoch": 7.676947410043495, "grad_norm": 1.3671875, "learning_rate": 0.00010837297121117348, "loss": 4.529, "mean_token_accuracy": 0.2637150451540947, "num_tokens": 177867663.0, "step": 77660 }, { "entropy": 5.1766143321990965, "epoch": 7.677441676551997, "grad_norm": 1.25, "learning_rate": 0.00010834925891479512, "loss": 4.5421, "mean_token_accuracy": 0.27112366408109667, "num_tokens": 177877807.0, "step": 77665 }, { "entropy": 5.164008712768554, "epoch": 7.677935943060498, "grad_norm": 1.3515625, "learning_rate": 0.00010832555071805086, "loss": 4.4547, "mean_token_accuracy": 0.2773975595831871, "num_tokens": 177887564.0, "step": 77670 }, { "entropy": 5.195974969863892, "epoch": 7.678430209568999, "grad_norm": 1.1875, "learning_rate": 0.00010830184662152398, "loss": 4.5205, "mean_token_accuracy": 0.2771719262003899, "num_tokens": 177899377.0, "step": 77675 }, { "entropy": 5.25336651802063, "epoch": 7.678924476077501, "grad_norm": 1.203125, "learning_rate": 0.00010827814662579746, "loss": 4.6532, "mean_token_accuracy": 0.2544530123472214, "num_tokens": 177911676.0, "step": 77680 }, { "entropy": 5.275730466842651, "epoch": 7.6794187425860025, "grad_norm": 1.0625, "learning_rate": 0.0001082544507314544, "loss": 4.6551, "mean_token_accuracy": 0.2595617726445198, "num_tokens": 177923649.0, "step": 77685 }, { "entropy": 5.180960178375244, "epoch": 7.679913009094504, "grad_norm": 1.140625, "learning_rate": 0.00010823075893907772, "loss": 4.4415, "mean_token_accuracy": 0.2819333106279373, "num_tokens": 177934372.0, "step": 77690 }, { "entropy": 5.195311403274536, "epoch": 7.680407275603005, "grad_norm": 1.2578125, "learning_rate": 0.00010820707124925026, "loss": 4.522, "mean_token_accuracy": 0.2660194620490074, "num_tokens": 177945705.0, "step": 77695 }, { "entropy": 5.196455287933349, "epoch": 7.680901542111506, "grad_norm": 1.1484375, "learning_rate": 0.00010818338766255476, "loss": 4.4901, "mean_token_accuracy": 0.2674632340669632, "num_tokens": 177958407.0, "step": 77700 }, { "entropy": 5.2538550853729244, "epoch": 7.681395808620008, "grad_norm": 1.09375, "learning_rate": 0.00010815970817957376, "loss": 4.5616, "mean_token_accuracy": 0.2599499821662903, "num_tokens": 177971272.0, "step": 77705 }, { "entropy": 5.258096027374267, "epoch": 7.681890075128509, "grad_norm": 1.15625, "learning_rate": 0.0001081360328008898, "loss": 4.6082, "mean_token_accuracy": 0.2564007505774498, "num_tokens": 177983926.0, "step": 77710 }, { "entropy": 5.3384706497192385, "epoch": 7.682384341637011, "grad_norm": 1.3125, "learning_rate": 0.00010811236152708534, "loss": 4.6279, "mean_token_accuracy": 0.26464264541864396, "num_tokens": 177995070.0, "step": 77715 }, { "entropy": 5.234672594070434, "epoch": 7.682878608145512, "grad_norm": 1.1875, "learning_rate": 0.00010808869435874266, "loss": 4.5554, "mean_token_accuracy": 0.2633115530014038, "num_tokens": 178007250.0, "step": 77720 }, { "entropy": 5.166056776046753, "epoch": 7.6833728746540135, "grad_norm": 1.1484375, "learning_rate": 0.00010806503129644408, "loss": 4.5118, "mean_token_accuracy": 0.26919380128383635, "num_tokens": 178019378.0, "step": 77725 }, { "entropy": 5.241847229003906, "epoch": 7.683867141162515, "grad_norm": 1.2890625, "learning_rate": 0.00010804137234077156, "loss": 4.602, "mean_token_accuracy": 0.2571187362074852, "num_tokens": 178031351.0, "step": 77730 }, { "entropy": 5.26933536529541, "epoch": 7.684361407671016, "grad_norm": 1.3046875, "learning_rate": 0.00010801771749230715, "loss": 4.6233, "mean_token_accuracy": 0.26393250823020936, "num_tokens": 178042654.0, "step": 77735 }, { "entropy": 5.154258680343628, "epoch": 7.684855674179517, "grad_norm": 1.3828125, "learning_rate": 0.00010799406675163289, "loss": 4.5105, "mean_token_accuracy": 0.2735194191336632, "num_tokens": 178052830.0, "step": 77740 }, { "entropy": 5.2433891773223875, "epoch": 7.685349940688019, "grad_norm": 1.265625, "learning_rate": 0.00010797042011933037, "loss": 4.6342, "mean_token_accuracy": 0.26035797894001006, "num_tokens": 178064047.0, "step": 77745 }, { "entropy": 5.232645797729492, "epoch": 7.685844207196521, "grad_norm": 1.125, "learning_rate": 0.00010794677759598154, "loss": 4.537, "mean_token_accuracy": 0.26732325702905657, "num_tokens": 178076235.0, "step": 77750 }, { "entropy": 5.233748197555542, "epoch": 7.686338473705022, "grad_norm": 1.296875, "learning_rate": 0.00010792313918216782, "loss": 4.5772, "mean_token_accuracy": 0.2669047176837921, "num_tokens": 178087667.0, "step": 77755 }, { "entropy": 5.248703813552856, "epoch": 7.686832740213523, "grad_norm": 1.171875, "learning_rate": 0.00010789950487847084, "loss": 4.6044, "mean_token_accuracy": 0.25929503738880155, "num_tokens": 178099103.0, "step": 77760 }, { "entropy": 5.255178642272949, "epoch": 7.6873270067220245, "grad_norm": 1.234375, "learning_rate": 0.000107875874685472, "loss": 4.623, "mean_token_accuracy": 0.25855808407068254, "num_tokens": 178110252.0, "step": 77765 }, { "entropy": 5.216187334060669, "epoch": 7.687821273230526, "grad_norm": 1.21875, "learning_rate": 0.00010785224860375248, "loss": 4.539, "mean_token_accuracy": 0.25982207506895066, "num_tokens": 178121384.0, "step": 77770 }, { "entropy": 5.208838748931885, "epoch": 7.688315539739027, "grad_norm": 1.359375, "learning_rate": 0.0001078286266338936, "loss": 4.5935, "mean_token_accuracy": 0.27122786194086074, "num_tokens": 178131248.0, "step": 77775 }, { "entropy": 5.245691347122192, "epoch": 7.688809806247528, "grad_norm": 1.171875, "learning_rate": 0.00010780500877647646, "loss": 4.5995, "mean_token_accuracy": 0.2626564398407936, "num_tokens": 178144339.0, "step": 77780 }, { "entropy": 5.259196805953979, "epoch": 7.6893040727560305, "grad_norm": 1.1875, "learning_rate": 0.00010778139503208199, "loss": 4.593, "mean_token_accuracy": 0.26832968592643736, "num_tokens": 178155968.0, "step": 77785 }, { "entropy": 5.253410720825196, "epoch": 7.689798339264532, "grad_norm": 1.2734375, "learning_rate": 0.00010775778540129128, "loss": 4.6194, "mean_token_accuracy": 0.2580642536282539, "num_tokens": 178166491.0, "step": 77790 }, { "entropy": 5.2814293384552, "epoch": 7.690292605773033, "grad_norm": 1.2265625, "learning_rate": 0.00010773417988468487, "loss": 4.6415, "mean_token_accuracy": 0.2578544899821281, "num_tokens": 178177278.0, "step": 77795 }, { "entropy": 5.247317457199097, "epoch": 7.690786872281534, "grad_norm": 1.296875, "learning_rate": 0.0001077105784828436, "loss": 4.5257, "mean_token_accuracy": 0.27332246899604795, "num_tokens": 178187238.0, "step": 77800 }, { "entropy": 5.2205689430236815, "epoch": 7.6912811387900355, "grad_norm": 1.1796875, "learning_rate": 0.00010768698119634803, "loss": 4.605, "mean_token_accuracy": 0.2734043225646019, "num_tokens": 178199273.0, "step": 77805 }, { "entropy": 5.095870733261108, "epoch": 7.691775405298537, "grad_norm": 1.359375, "learning_rate": 0.00010766338802577873, "loss": 4.4443, "mean_token_accuracy": 0.27334595322608946, "num_tokens": 178211369.0, "step": 77810 }, { "entropy": 5.234305477142334, "epoch": 7.692269671807038, "grad_norm": 1.1640625, "learning_rate": 0.00010763979897171608, "loss": 4.56, "mean_token_accuracy": 0.27132716178894045, "num_tokens": 178222603.0, "step": 77815 }, { "entropy": 5.249696683883667, "epoch": 7.69276393831554, "grad_norm": 1.1875, "learning_rate": 0.00010761621403474028, "loss": 4.5679, "mean_token_accuracy": 0.26958713829517367, "num_tokens": 178234569.0, "step": 77820 }, { "entropy": 5.284013891220093, "epoch": 7.693258204824041, "grad_norm": 1.1875, "learning_rate": 0.00010759263321543158, "loss": 4.61, "mean_token_accuracy": 0.2541270017623901, "num_tokens": 178247082.0, "step": 77825 }, { "entropy": 5.175506353378296, "epoch": 7.693752471332543, "grad_norm": 1.21875, "learning_rate": 0.00010756905651437013, "loss": 4.5906, "mean_token_accuracy": 0.26523557305336, "num_tokens": 178257896.0, "step": 77830 }, { "entropy": 5.207569169998169, "epoch": 7.694246737841044, "grad_norm": 1.296875, "learning_rate": 0.00010754548393213575, "loss": 4.6065, "mean_token_accuracy": 0.2610721230506897, "num_tokens": 178269002.0, "step": 77835 }, { "entropy": 5.168311834335327, "epoch": 7.694741004349545, "grad_norm": 1.2578125, "learning_rate": 0.00010752191546930857, "loss": 4.4263, "mean_token_accuracy": 0.28030731379985807, "num_tokens": 178280855.0, "step": 77840 }, { "entropy": 5.189460945129395, "epoch": 7.6952352708580465, "grad_norm": 1.1875, "learning_rate": 0.00010749835112646819, "loss": 4.5818, "mean_token_accuracy": 0.2686815172433853, "num_tokens": 178292105.0, "step": 77845 }, { "entropy": 5.231805467605591, "epoch": 7.695729537366548, "grad_norm": 1.25, "learning_rate": 0.00010747479090419434, "loss": 4.5466, "mean_token_accuracy": 0.26092426776885985, "num_tokens": 178303742.0, "step": 77850 }, { "entropy": 5.251688814163208, "epoch": 7.69622380387505, "grad_norm": 1.2109375, "learning_rate": 0.00010745123480306672, "loss": 4.6231, "mean_token_accuracy": 0.259140333533287, "num_tokens": 178316697.0, "step": 77855 }, { "entropy": 5.230995464324951, "epoch": 7.696718070383551, "grad_norm": 1.3046875, "learning_rate": 0.00010742768282366455, "loss": 4.5936, "mean_token_accuracy": 0.2637197658419609, "num_tokens": 178329431.0, "step": 77860 }, { "entropy": 5.270678853988647, "epoch": 7.697212336892052, "grad_norm": 1.21875, "learning_rate": 0.00010740413496656753, "loss": 4.5799, "mean_token_accuracy": 0.2567784607410431, "num_tokens": 178339783.0, "step": 77865 }, { "entropy": 5.178315496444702, "epoch": 7.697706603400554, "grad_norm": 1.1796875, "learning_rate": 0.00010738059123235472, "loss": 4.4954, "mean_token_accuracy": 0.27196296155452726, "num_tokens": 178351724.0, "step": 77870 }, { "entropy": 5.1852294921875, "epoch": 7.698200869909055, "grad_norm": 1.265625, "learning_rate": 0.0001073570516216054, "loss": 4.5416, "mean_token_accuracy": 0.2679210424423218, "num_tokens": 178362982.0, "step": 77875 }, { "entropy": 5.214537191390991, "epoch": 7.698695136417556, "grad_norm": 1.3359375, "learning_rate": 0.00010733351613489863, "loss": 4.5643, "mean_token_accuracy": 0.2671951770782471, "num_tokens": 178373778.0, "step": 77880 }, { "entropy": 5.180228328704834, "epoch": 7.6991894029260575, "grad_norm": 1.1796875, "learning_rate": 0.00010730998477281332, "loss": 4.5307, "mean_token_accuracy": 0.2668832063674927, "num_tokens": 178385265.0, "step": 77885 }, { "entropy": 5.225977754592895, "epoch": 7.699683669434559, "grad_norm": 1.0859375, "learning_rate": 0.00010728645753592842, "loss": 4.5595, "mean_token_accuracy": 0.25685209780931473, "num_tokens": 178398470.0, "step": 77890 }, { "entropy": 5.318707895278931, "epoch": 7.700177935943061, "grad_norm": 1.2578125, "learning_rate": 0.00010726293442482268, "loss": 4.6312, "mean_token_accuracy": 0.26015059649944305, "num_tokens": 178410527.0, "step": 77895 }, { "entropy": 5.240834045410156, "epoch": 7.700672202451562, "grad_norm": 1.3671875, "learning_rate": 0.00010723941544007476, "loss": 4.5228, "mean_token_accuracy": 0.27282046228647233, "num_tokens": 178420947.0, "step": 77900 }, { "entropy": 5.234860944747925, "epoch": 7.701166468960063, "grad_norm": 1.3125, "learning_rate": 0.00010721590058226333, "loss": 4.5548, "mean_token_accuracy": 0.2625510528683662, "num_tokens": 178432250.0, "step": 77905 }, { "entropy": 5.285070514678955, "epoch": 7.701660735468565, "grad_norm": 1.3515625, "learning_rate": 0.0001071923898519667, "loss": 4.6301, "mean_token_accuracy": 0.2629955381155014, "num_tokens": 178442749.0, "step": 77910 }, { "entropy": 5.227599334716797, "epoch": 7.702155001977066, "grad_norm": 1.2109375, "learning_rate": 0.00010716888324976337, "loss": 4.5971, "mean_token_accuracy": 0.2659957230091095, "num_tokens": 178454915.0, "step": 77915 }, { "entropy": 5.186506986618042, "epoch": 7.702649268485567, "grad_norm": 1.28125, "learning_rate": 0.00010714538077623143, "loss": 4.5377, "mean_token_accuracy": 0.2654831945896149, "num_tokens": 178468217.0, "step": 77920 }, { "entropy": 5.217375898361206, "epoch": 7.7031435349940685, "grad_norm": 1.265625, "learning_rate": 0.00010712188243194923, "loss": 4.5501, "mean_token_accuracy": 0.2626536712050438, "num_tokens": 178479447.0, "step": 77925 }, { "entropy": 5.224917936325073, "epoch": 7.70363780150257, "grad_norm": 1.3203125, "learning_rate": 0.00010709838821749482, "loss": 4.5602, "mean_token_accuracy": 0.2631619110703468, "num_tokens": 178491013.0, "step": 77930 }, { "entropy": 5.210653018951416, "epoch": 7.704132068011072, "grad_norm": 1.296875, "learning_rate": 0.00010707489813344604, "loss": 4.5227, "mean_token_accuracy": 0.2712952509522438, "num_tokens": 178501456.0, "step": 77935 }, { "entropy": 5.267673015594482, "epoch": 7.704626334519573, "grad_norm": 1.25, "learning_rate": 0.00010705141218038092, "loss": 4.6904, "mean_token_accuracy": 0.2590473785996437, "num_tokens": 178513933.0, "step": 77940 }, { "entropy": 5.271753883361816, "epoch": 7.705120601028074, "grad_norm": 1.265625, "learning_rate": 0.000107027930358877, "loss": 4.6515, "mean_token_accuracy": 0.2602319702506065, "num_tokens": 178526153.0, "step": 77945 }, { "entropy": 5.187484312057495, "epoch": 7.705614867536576, "grad_norm": 1.2734375, "learning_rate": 0.00010700445266951203, "loss": 4.5472, "mean_token_accuracy": 0.26555832028388976, "num_tokens": 178538354.0, "step": 77950 }, { "entropy": 5.196612691879272, "epoch": 7.706109134045077, "grad_norm": 1.2109375, "learning_rate": 0.00010698097911286367, "loss": 4.5202, "mean_token_accuracy": 0.26738727539777757, "num_tokens": 178550130.0, "step": 77955 }, { "entropy": 5.166895818710327, "epoch": 7.706603400553578, "grad_norm": 1.2265625, "learning_rate": 0.00010695750968950927, "loss": 4.4976, "mean_token_accuracy": 0.2757097214460373, "num_tokens": 178560410.0, "step": 77960 }, { "entropy": 5.247533988952637, "epoch": 7.707097667062079, "grad_norm": 1.21875, "learning_rate": 0.00010693404440002625, "loss": 4.547, "mean_token_accuracy": 0.26512204110622406, "num_tokens": 178571480.0, "step": 77965 }, { "entropy": 5.277994108200073, "epoch": 7.707591933570582, "grad_norm": 1.4609375, "learning_rate": 0.00010691058324499172, "loss": 4.6454, "mean_token_accuracy": 0.25729382038116455, "num_tokens": 178580617.0, "step": 77970 }, { "entropy": 5.2983180522918705, "epoch": 7.708086200079083, "grad_norm": 1.25, "learning_rate": 0.00010688712622498295, "loss": 4.6316, "mean_token_accuracy": 0.2623754322528839, "num_tokens": 178592983.0, "step": 77975 }, { "entropy": 5.214382028579712, "epoch": 7.708580466587584, "grad_norm": 1.2890625, "learning_rate": 0.00010686367334057695, "loss": 4.5285, "mean_token_accuracy": 0.2640562027692795, "num_tokens": 178603104.0, "step": 77980 }, { "entropy": 5.176042127609253, "epoch": 7.709074733096085, "grad_norm": 1.28125, "learning_rate": 0.00010684022459235067, "loss": 4.5025, "mean_token_accuracy": 0.2711227938532829, "num_tokens": 178614945.0, "step": 77985 }, { "entropy": 5.223860025405884, "epoch": 7.709568999604587, "grad_norm": 1.265625, "learning_rate": 0.00010681677998088099, "loss": 4.6465, "mean_token_accuracy": 0.2578026607632637, "num_tokens": 178627048.0, "step": 77990 }, { "entropy": 5.227599668502807, "epoch": 7.710063266113088, "grad_norm": 1.1875, "learning_rate": 0.00010679333950674458, "loss": 4.4593, "mean_token_accuracy": 0.27304751724004744, "num_tokens": 178639029.0, "step": 77995 }, { "entropy": 5.303150081634522, "epoch": 7.710557532621589, "grad_norm": 1.234375, "learning_rate": 0.0001067699031705181, "loss": 4.6489, "mean_token_accuracy": 0.25223459452390673, "num_tokens": 178650347.0, "step": 78000 }, { "epoch": 7.710557532621589, "eval_entropy": 4.993250786510341, "eval_loss": 4.766153335571289, "eval_mean_token_accuracy": 0.25804931568886813, "eval_num_tokens": 178650347.0, "eval_runtime": 26.5953, "eval_samples_per_second": 1222.509, "eval_steps_per_second": 152.847, "step": 78000 } ], "logging_steps": 5, "max_steps": 101150, "num_input_tokens_seen": 0, "num_train_epochs": 10, "save_steps": 3000, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 2.79803648248704e+17, "train_batch_size": 16, "trial_name": null, "trial_params": null }