{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.25718510898218994, "eval_steps": 500, "global_step": 4000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742344284057618, "epoch": 0.00032148138622773744, "grad_norm": 5.1875, "learning_rate": 2e-06, "loss": 10.7889, "mean_token_accuracy": 0.0001923076924867928, "num_tokens": 10787.0, "step": 5 }, { "entropy": 10.742341995239258, "epoch": 0.0006429627724554749, "grad_norm": 4.6875, "learning_rate": 4.5e-06, "loss": 10.7754, "mean_token_accuracy": 9.199631749652326e-05, "num_tokens": 21408.0, "step": 10 }, { "entropy": 10.74231481552124, "epoch": 0.0009644441586832123, "grad_norm": 4.84375, "learning_rate": 7e-06, "loss": 10.7745, "mean_token_accuracy": 0.0, "num_tokens": 33838.0, "step": 15 }, { "entropy": 10.742263031005859, "epoch": 0.0012859255449109497, "grad_norm": 4.875, "learning_rate": 9.5e-06, "loss": 10.7415, "mean_token_accuracy": 0.0, "num_tokens": 46592.0, "step": 20 }, { "entropy": 10.742058944702148, "epoch": 0.001607406931138687, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 10.6278, "mean_token_accuracy": 0.00028761792345903813, "num_tokens": 57409.0, "step": 25 }, { "entropy": 10.741728782653809, "epoch": 0.0019288883173664245, "grad_norm": 3.71875, "learning_rate": 1.4500000000000002e-05, "loss": 10.5262, "mean_token_accuracy": 0.005182119726669043, "num_tokens": 68705.0, "step": 30 }, { "entropy": 10.74124059677124, "epoch": 0.002250369703594162, "grad_norm": 3.09375, "learning_rate": 1.7000000000000003e-05, "loss": 10.4297, "mean_token_accuracy": 0.019557270966470242, "num_tokens": 81460.0, "step": 35 }, { "entropy": 10.740433311462402, "epoch": 0.0025718510898218995, "grad_norm": 2.5, "learning_rate": 1.95e-05, "loss": 10.2725, "mean_token_accuracy": 0.02960890345275402, "num_tokens": 93576.0, "step": 40 }, { "entropy": 10.739229869842529, "epoch": 0.0028933324760496365, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1857, "mean_token_accuracy": 0.02886150423437357, "num_tokens": 105556.0, "step": 45 }, { "entropy": 10.738618659973145, "epoch": 0.003214813862277374, "grad_norm": 2.03125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0792, "mean_token_accuracy": 0.031074166856706144, "num_tokens": 117850.0, "step": 50 }, { "entropy": 10.738714694976807, "epoch": 0.0035362952485051115, "grad_norm": 1.9296875, "learning_rate": 2.7e-05, "loss": 10.0244, "mean_token_accuracy": 0.031163782812654972, "num_tokens": 130955.0, "step": 55 }, { "entropy": 10.738016033172608, "epoch": 0.003857776634732849, "grad_norm": 1.9140625, "learning_rate": 2.95e-05, "loss": 9.9307, "mean_token_accuracy": 0.03660368006676436, "num_tokens": 141959.0, "step": 60 }, { "entropy": 10.736786365509033, "epoch": 0.0041792580209605865, "grad_norm": 1.84375, "learning_rate": 3.2e-05, "loss": 9.8915, "mean_token_accuracy": 0.03608605414628983, "num_tokens": 153856.0, "step": 65 }, { "entropy": 10.73516550064087, "epoch": 0.004500739407188324, "grad_norm": 1.9140625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8384, "mean_token_accuracy": 0.043716078624129295, "num_tokens": 166748.0, "step": 70 }, { "entropy": 10.732550621032715, "epoch": 0.0048222207934160615, "grad_norm": 1.9375, "learning_rate": 3.7e-05, "loss": 9.728, "mean_token_accuracy": 0.04251385778188706, "num_tokens": 177172.0, "step": 75 }, { "entropy": 10.728882122039796, "epoch": 0.005143702179643799, "grad_norm": 1.8046875, "learning_rate": 3.95e-05, "loss": 9.6737, "mean_token_accuracy": 0.04158058017492294, "num_tokens": 189418.0, "step": 80 }, { "entropy": 10.723980331420899, "epoch": 0.0054651835658715365, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 9.5846, "mean_token_accuracy": 0.039340490289032456, "num_tokens": 201349.0, "step": 85 }, { "entropy": 10.718004131317139, "epoch": 0.005786664952099273, "grad_norm": 1.8046875, "learning_rate": 4.45e-05, "loss": 9.5176, "mean_token_accuracy": 0.04345524609088898, "num_tokens": 212298.0, "step": 90 }, { "entropy": 10.710467433929443, "epoch": 0.0061081463383270106, "grad_norm": 1.796875, "learning_rate": 4.7000000000000004e-05, "loss": 9.467, "mean_token_accuracy": 0.04573878571391106, "num_tokens": 223831.0, "step": 95 }, { "entropy": 10.699566841125488, "epoch": 0.006429627724554748, "grad_norm": 1.78125, "learning_rate": 4.9500000000000004e-05, "loss": 9.3601, "mean_token_accuracy": 0.04835316389799118, "num_tokens": 236675.0, "step": 100 }, { "entropy": 10.683355236053467, "epoch": 0.0067511091107824855, "grad_norm": 1.7421875, "learning_rate": 5.2e-05, "loss": 9.242, "mean_token_accuracy": 0.04662417732179165, "num_tokens": 247634.0, "step": 105 }, { "entropy": 10.66143503189087, "epoch": 0.007072590497010223, "grad_norm": 1.8046875, "learning_rate": 5.45e-05, "loss": 9.1162, "mean_token_accuracy": 0.05328451320528984, "num_tokens": 259101.0, "step": 110 }, { "entropy": 10.631138801574707, "epoch": 0.0073940718832379605, "grad_norm": 1.6328125, "learning_rate": 5.7e-05, "loss": 9.0393, "mean_token_accuracy": 0.05271790884435177, "num_tokens": 272151.0, "step": 115 }, { "entropy": 10.594438171386718, "epoch": 0.007715553269465698, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.8606, "mean_token_accuracy": 0.057512912154197696, "num_tokens": 283619.0, "step": 120 }, { "entropy": 10.537901401519775, "epoch": 0.008037034655693436, "grad_norm": 1.734375, "learning_rate": 6.2e-05, "loss": 8.7551, "mean_token_accuracy": 0.05864038914442062, "num_tokens": 296233.0, "step": 125 }, { "entropy": 10.46686897277832, "epoch": 0.008358516041921173, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.6685, "mean_token_accuracy": 0.05632430389523506, "num_tokens": 309222.0, "step": 130 }, { "entropy": 10.386721515655518, "epoch": 0.00867999742814891, "grad_norm": 1.515625, "learning_rate": 6.7e-05, "loss": 8.4983, "mean_token_accuracy": 0.05754401199519634, "num_tokens": 322291.0, "step": 135 }, { "entropy": 10.285922241210937, "epoch": 0.009001478814376648, "grad_norm": 1.484375, "learning_rate": 6.950000000000001e-05, "loss": 8.3328, "mean_token_accuracy": 0.06465739980340005, "num_tokens": 333520.0, "step": 140 }, { "entropy": 10.168986701965332, "epoch": 0.009322960200604385, "grad_norm": 1.453125, "learning_rate": 7.2e-05, "loss": 8.1641, "mean_token_accuracy": 0.0657901257276535, "num_tokens": 344883.0, "step": 145 }, { "entropy": 10.042533111572265, "epoch": 0.009644441586832123, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 8.0727, "mean_token_accuracy": 0.07245785929262638, "num_tokens": 356600.0, "step": 150 }, { "entropy": 9.882461643218994, "epoch": 0.00996592297305986, "grad_norm": 1.4609375, "learning_rate": 7.7e-05, "loss": 7.9127, "mean_token_accuracy": 0.0721237450838089, "num_tokens": 368527.0, "step": 155 }, { "entropy": 9.694390869140625, "epoch": 0.010287404359287598, "grad_norm": 1.5, "learning_rate": 7.950000000000001e-05, "loss": 7.8511, "mean_token_accuracy": 0.06826285421848297, "num_tokens": 379836.0, "step": 160 }, { "entropy": 9.510071659088135, "epoch": 0.010608885745515335, "grad_norm": 1.0625, "learning_rate": 8.2e-05, "loss": 7.8393, "mean_token_accuracy": 0.0674971140921116, "num_tokens": 392535.0, "step": 165 }, { "entropy": 9.299476528167725, "epoch": 0.010930367131743073, "grad_norm": 0.91015625, "learning_rate": 8.450000000000001e-05, "loss": 7.7515, "mean_token_accuracy": 0.06860553249716758, "num_tokens": 405259.0, "step": 170 }, { "entropy": 9.040483093261718, "epoch": 0.011251848517970809, "grad_norm": 0.96875, "learning_rate": 8.7e-05, "loss": 7.599, "mean_token_accuracy": 0.07114262394607067, "num_tokens": 417922.0, "step": 175 }, { "entropy": 8.870688247680665, "epoch": 0.011573329904198546, "grad_norm": 1.078125, "learning_rate": 8.95e-05, "loss": 7.6169, "mean_token_accuracy": 0.07012484185397624, "num_tokens": 429411.0, "step": 180 }, { "entropy": 8.67488489151001, "epoch": 0.011894811290426284, "grad_norm": 1.171875, "learning_rate": 9.2e-05, "loss": 7.386, "mean_token_accuracy": 0.0772802360355854, "num_tokens": 439950.0, "step": 185 }, { "entropy": 8.489033699035645, "epoch": 0.012216292676654021, "grad_norm": 1.328125, "learning_rate": 9.45e-05, "loss": 7.3822, "mean_token_accuracy": 0.07805034667253494, "num_tokens": 451245.0, "step": 190 }, { "entropy": 8.393837928771973, "epoch": 0.012537774062881759, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 7.4539, "mean_token_accuracy": 0.07150709182024002, "num_tokens": 465146.0, "step": 195 }, { "entropy": 8.359711456298829, "epoch": 0.012859255449109496, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.4708, "mean_token_accuracy": 0.07765417769551278, "num_tokens": 477079.0, "step": 200 }, { "entropy": 8.254557895660401, "epoch": 0.013180736835337234, "grad_norm": 1.0546875, "learning_rate": 0.000102, "loss": 7.2964, "mean_token_accuracy": 0.08167731463909149, "num_tokens": 488216.0, "step": 205 }, { "entropy": 8.201800632476807, "epoch": 0.013502218221564971, "grad_norm": 1.3984375, "learning_rate": 0.00010449999999999999, "loss": 7.2996, "mean_token_accuracy": 0.08416381254792213, "num_tokens": 501040.0, "step": 210 }, { "entropy": 8.122812938690185, "epoch": 0.013823699607792709, "grad_norm": 1.015625, "learning_rate": 0.000107, "loss": 7.2535, "mean_token_accuracy": 0.08663205504417419, "num_tokens": 512636.0, "step": 215 }, { "entropy": 8.088646793365479, "epoch": 0.014145180994020446, "grad_norm": 0.9765625, "learning_rate": 0.0001095, "loss": 7.301, "mean_token_accuracy": 0.08183000981807709, "num_tokens": 525249.0, "step": 220 }, { "entropy": 8.097221660614014, "epoch": 0.014466662380248184, "grad_norm": 1.34375, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.08002460822463035, "num_tokens": 536963.0, "step": 225 }, { "entropy": 8.05938491821289, "epoch": 0.014788143766475921, "grad_norm": 1.171875, "learning_rate": 0.0001145, "loss": 7.2099, "mean_token_accuracy": 0.08030182272195815, "num_tokens": 549008.0, "step": 230 }, { "entropy": 8.041013956069946, "epoch": 0.015109625152703659, "grad_norm": 1.0390625, "learning_rate": 0.00011700000000000001, "loss": 7.2319, "mean_token_accuracy": 0.09074903577566147, "num_tokens": 560958.0, "step": 235 }, { "entropy": 7.961578607559204, "epoch": 0.015431106538931396, "grad_norm": 0.9921875, "learning_rate": 0.00011949999999999999, "loss": 7.1147, "mean_token_accuracy": 0.09378238469362259, "num_tokens": 572472.0, "step": 240 }, { "entropy": 7.922268009185791, "epoch": 0.015752587925159132, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 7.1808, "mean_token_accuracy": 0.08942435756325721, "num_tokens": 585125.0, "step": 245 }, { "entropy": 7.913467741012573, "epoch": 0.01607406931138687, "grad_norm": 1.0390625, "learning_rate": 0.0001245, "loss": 7.1259, "mean_token_accuracy": 0.09376866966485978, "num_tokens": 597774.0, "step": 250 }, { "entropy": 7.856596946716309, "epoch": 0.016395550697614607, "grad_norm": 0.98828125, "learning_rate": 0.000127, "loss": 7.1233, "mean_token_accuracy": 0.09992039278149605, "num_tokens": 610130.0, "step": 255 }, { "entropy": 7.8915050506591795, "epoch": 0.016717032083842346, "grad_norm": 1.03125, "learning_rate": 0.0001295, "loss": 7.1488, "mean_token_accuracy": 0.09605236500501632, "num_tokens": 621659.0, "step": 260 }, { "entropy": 7.833514070510864, "epoch": 0.017038513470070082, "grad_norm": 1.0078125, "learning_rate": 0.000132, "loss": 7.0552, "mean_token_accuracy": 0.09916835874319077, "num_tokens": 633172.0, "step": 265 }, { "entropy": 7.854182243347168, "epoch": 0.01735999485629782, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.0595, "mean_token_accuracy": 0.09681920260190964, "num_tokens": 643928.0, "step": 270 }, { "entropy": 7.712904834747315, "epoch": 0.017681476242525557, "grad_norm": 1.2265625, "learning_rate": 0.00013700000000000002, "loss": 6.9556, "mean_token_accuracy": 0.09763396382331849, "num_tokens": 654693.0, "step": 275 }, { "entropy": 7.817079973220825, "epoch": 0.018002957628753296, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 7.1338, "mean_token_accuracy": 0.09172611869871616, "num_tokens": 667216.0, "step": 280 }, { "entropy": 7.727632856369018, "epoch": 0.01832443901498103, "grad_norm": 1.5078125, "learning_rate": 0.00014199999999999998, "loss": 6.9273, "mean_token_accuracy": 0.10492636933922768, "num_tokens": 679605.0, "step": 285 }, { "entropy": 7.6807286739349365, "epoch": 0.01864592040120877, "grad_norm": 1.0703125, "learning_rate": 0.0001445, "loss": 7.0243, "mean_token_accuracy": 0.09721777960658073, "num_tokens": 691581.0, "step": 290 }, { "entropy": 7.730735111236572, "epoch": 0.018967401787436507, "grad_norm": 1.203125, "learning_rate": 0.000147, "loss": 7.064, "mean_token_accuracy": 0.10062759071588516, "num_tokens": 703162.0, "step": 295 }, { "entropy": 7.675752592086792, "epoch": 0.019288883173664246, "grad_norm": 1.0390625, "learning_rate": 0.0001495, "loss": 6.947, "mean_token_accuracy": 0.10126433670520782, "num_tokens": 715024.0, "step": 300 }, { "entropy": 7.604991054534912, "epoch": 0.01961036455989198, "grad_norm": 1.390625, "learning_rate": 0.000152, "loss": 6.9484, "mean_token_accuracy": 0.10657469853758812, "num_tokens": 728434.0, "step": 305 }, { "entropy": 7.582369089126587, "epoch": 0.01993184594611972, "grad_norm": 1.109375, "learning_rate": 0.00015450000000000001, "loss": 6.9856, "mean_token_accuracy": 0.10384280532598496, "num_tokens": 741049.0, "step": 310 }, { "entropy": 7.556066989898682, "epoch": 0.020253327332347457, "grad_norm": 1.0234375, "learning_rate": 0.000157, "loss": 6.8995, "mean_token_accuracy": 0.10891256630420684, "num_tokens": 753316.0, "step": 315 }, { "entropy": 7.487519884109497, "epoch": 0.020574808718575196, "grad_norm": 1.078125, "learning_rate": 0.0001595, "loss": 6.8976, "mean_token_accuracy": 0.10375816151499748, "num_tokens": 766605.0, "step": 320 }, { "entropy": 7.575658369064331, "epoch": 0.02089629010480293, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 6.8776, "mean_token_accuracy": 0.10548696890473366, "num_tokens": 778857.0, "step": 325 }, { "entropy": 7.49542875289917, "epoch": 0.02121777149103067, "grad_norm": 1.1015625, "learning_rate": 0.00016450000000000001, "loss": 6.8801, "mean_token_accuracy": 0.0980547919869423, "num_tokens": 790497.0, "step": 330 }, { "entropy": 7.548171281814575, "epoch": 0.021539252877258407, "grad_norm": 1.2421875, "learning_rate": 0.00016700000000000002, "loss": 6.9457, "mean_token_accuracy": 0.10034449025988579, "num_tokens": 803021.0, "step": 335 }, { "entropy": 7.514672136306762, "epoch": 0.021860734263486146, "grad_norm": 1.234375, "learning_rate": 0.00016950000000000003, "loss": 6.8973, "mean_token_accuracy": 0.10233017727732659, "num_tokens": 815056.0, "step": 340 }, { "entropy": 7.548324632644653, "epoch": 0.02218221564971388, "grad_norm": 0.984375, "learning_rate": 0.00017199999999999998, "loss": 6.8436, "mean_token_accuracy": 0.11048155352473259, "num_tokens": 827149.0, "step": 345 }, { "entropy": 7.47729377746582, "epoch": 0.022503697035941617, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.8877, "mean_token_accuracy": 0.10872978940606118, "num_tokens": 839172.0, "step": 350 }, { "entropy": 7.497987508773804, "epoch": 0.022825178422169357, "grad_norm": 1.75, "learning_rate": 0.000177, "loss": 6.9329, "mean_token_accuracy": 0.10738308876752853, "num_tokens": 851148.0, "step": 355 }, { "entropy": 7.548883295059204, "epoch": 0.023146659808397092, "grad_norm": 1.140625, "learning_rate": 0.0001795, "loss": 6.8783, "mean_token_accuracy": 0.10820900201797486, "num_tokens": 862904.0, "step": 360 }, { "entropy": 7.436304187774658, "epoch": 0.02346814119462483, "grad_norm": 1.359375, "learning_rate": 0.000182, "loss": 6.7668, "mean_token_accuracy": 0.11688080206513404, "num_tokens": 874720.0, "step": 365 }, { "entropy": 7.409350728988647, "epoch": 0.023789622580852567, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.8078, "mean_token_accuracy": 0.11283540055155754, "num_tokens": 887261.0, "step": 370 }, { "entropy": 7.4675617694854735, "epoch": 0.024111103967080307, "grad_norm": 1.0859375, "learning_rate": 0.000187, "loss": 6.7767, "mean_token_accuracy": 0.1088891163468361, "num_tokens": 898048.0, "step": 375 }, { "entropy": 7.336610507965088, "epoch": 0.024432585353308042, "grad_norm": 1.03125, "learning_rate": 0.0001895, "loss": 6.8343, "mean_token_accuracy": 0.11030351296067238, "num_tokens": 910297.0, "step": 380 }, { "entropy": 7.432262849807739, "epoch": 0.02475406673953578, "grad_norm": 1.0546875, "learning_rate": 0.000192, "loss": 6.8693, "mean_token_accuracy": 0.10626164525747299, "num_tokens": 923463.0, "step": 385 }, { "entropy": 7.399855327606201, "epoch": 0.025075548125763517, "grad_norm": 0.99609375, "learning_rate": 0.0001945, "loss": 6.8379, "mean_token_accuracy": 0.11091364100575447, "num_tokens": 935306.0, "step": 390 }, { "entropy": 7.355379390716553, "epoch": 0.025397029511991256, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 6.7379, "mean_token_accuracy": 0.115155877918005, "num_tokens": 947827.0, "step": 395 }, { "entropy": 7.281255531311035, "epoch": 0.025718510898218992, "grad_norm": 1.375, "learning_rate": 0.00019950000000000002, "loss": 6.6838, "mean_token_accuracy": 0.12000245451927186, "num_tokens": 961664.0, "step": 400 }, { "entropy": 7.312869071960449, "epoch": 0.02603999228444673, "grad_norm": 1.21875, "learning_rate": 0.000202, "loss": 6.7829, "mean_token_accuracy": 0.09842887446284294, "num_tokens": 973981.0, "step": 405 }, { "entropy": 7.335048866271973, "epoch": 0.026361473670674467, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 6.8181, "mean_token_accuracy": 0.11232979372143745, "num_tokens": 986702.0, "step": 410 }, { "entropy": 7.318604183197022, "epoch": 0.026682955056902206, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.7181, "mean_token_accuracy": 0.11695454865694047, "num_tokens": 998513.0, "step": 415 }, { "entropy": 7.294521141052246, "epoch": 0.027004436443129942, "grad_norm": 1.3515625, "learning_rate": 0.0002095, "loss": 6.7037, "mean_token_accuracy": 0.11898418515920639, "num_tokens": 1011111.0, "step": 420 }, { "entropy": 7.186019515991211, "epoch": 0.02732591782935768, "grad_norm": 1.2578125, "learning_rate": 0.000212, "loss": 6.6799, "mean_token_accuracy": 0.11566238775849343, "num_tokens": 1021779.0, "step": 425 }, { "entropy": 7.370555067062378, "epoch": 0.027647399215585417, "grad_norm": 1.0703125, "learning_rate": 0.0002145, "loss": 6.7381, "mean_token_accuracy": 0.11263754442334176, "num_tokens": 1033228.0, "step": 430 }, { "entropy": 7.226527881622315, "epoch": 0.027968880601813156, "grad_norm": 1.0703125, "learning_rate": 0.00021700000000000002, "loss": 6.6415, "mean_token_accuracy": 0.11632440984249115, "num_tokens": 1044964.0, "step": 435 }, { "entropy": 7.18967342376709, "epoch": 0.028290361988040892, "grad_norm": 1.2265625, "learning_rate": 0.0002195, "loss": 6.6058, "mean_token_accuracy": 0.12256524711847305, "num_tokens": 1056450.0, "step": 440 }, { "entropy": 7.242304182052612, "epoch": 0.02861184337426863, "grad_norm": 1.0703125, "learning_rate": 0.000222, "loss": 6.7402, "mean_token_accuracy": 0.1159943200647831, "num_tokens": 1067031.0, "step": 445 }, { "entropy": 7.1245410442352295, "epoch": 0.028933324760496367, "grad_norm": 1.3046875, "learning_rate": 0.0002245, "loss": 6.6051, "mean_token_accuracy": 0.1228414848446846, "num_tokens": 1078718.0, "step": 450 }, { "entropy": 7.182725429534912, "epoch": 0.029254806146724106, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 6.6217, "mean_token_accuracy": 0.11590910404920578, "num_tokens": 1091630.0, "step": 455 }, { "entropy": 7.229373598098755, "epoch": 0.029576287532951842, "grad_norm": 1.2109375, "learning_rate": 0.00022950000000000002, "loss": 6.6761, "mean_token_accuracy": 0.11919770017266273, "num_tokens": 1102339.0, "step": 460 }, { "entropy": 7.166626882553101, "epoch": 0.029897768919179578, "grad_norm": 1.2109375, "learning_rate": 0.00023200000000000003, "loss": 6.6491, "mean_token_accuracy": 0.11653751060366631, "num_tokens": 1114385.0, "step": 465 }, { "entropy": 7.213460397720337, "epoch": 0.030219250305407317, "grad_norm": 1.0625, "learning_rate": 0.00023449999999999998, "loss": 6.6627, "mean_token_accuracy": 0.12240460664033889, "num_tokens": 1126364.0, "step": 470 }, { "entropy": 7.160998678207397, "epoch": 0.030540731691635053, "grad_norm": 1.265625, "learning_rate": 0.000237, "loss": 6.6469, "mean_token_accuracy": 0.12170583978295327, "num_tokens": 1137492.0, "step": 475 }, { "entropy": 7.108113145828247, "epoch": 0.030862213077862792, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.5317, "mean_token_accuracy": 0.12732059210538865, "num_tokens": 1148734.0, "step": 480 }, { "entropy": 7.14542589187622, "epoch": 0.031183694464090528, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 6.6757, "mean_token_accuracy": 0.12211950346827508, "num_tokens": 1163229.0, "step": 485 }, { "entropy": 7.165257167816162, "epoch": 0.031505175850318264, "grad_norm": 1.015625, "learning_rate": 0.0002445, "loss": 6.6959, "mean_token_accuracy": 0.1155033528804779, "num_tokens": 1175452.0, "step": 490 }, { "entropy": 7.1013343334198, "epoch": 0.031826657236546006, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 6.5479, "mean_token_accuracy": 0.12406643405556679, "num_tokens": 1187836.0, "step": 495 }, { "entropy": 7.197257661819458, "epoch": 0.03214813862277374, "grad_norm": 1.09375, "learning_rate": 0.0002495, "loss": 6.6297, "mean_token_accuracy": 0.12298163026571274, "num_tokens": 1198867.0, "step": 500 }, { "entropy": 7.00099925994873, "epoch": 0.03246962000900148, "grad_norm": 1.1015625, "learning_rate": 0.000252, "loss": 6.5666, "mean_token_accuracy": 0.11886920258402825, "num_tokens": 1212534.0, "step": 505 }, { "entropy": 7.123233509063721, "epoch": 0.032791101395229214, "grad_norm": 1.4375, "learning_rate": 0.0002545, "loss": 6.4812, "mean_token_accuracy": 0.1376668132841587, "num_tokens": 1223028.0, "step": 510 }, { "entropy": 7.040684223175049, "epoch": 0.033112582781456956, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 6.5438, "mean_token_accuracy": 0.12737778946757317, "num_tokens": 1235460.0, "step": 515 }, { "entropy": 6.9980145454406735, "epoch": 0.03343406416768469, "grad_norm": 1.1953125, "learning_rate": 0.0002595, "loss": 6.5329, "mean_token_accuracy": 0.1297763057053089, "num_tokens": 1247180.0, "step": 520 }, { "entropy": 7.0526275634765625, "epoch": 0.03375554555391243, "grad_norm": 1.0859375, "learning_rate": 0.000262, "loss": 6.5934, "mean_token_accuracy": 0.12331821173429489, "num_tokens": 1260000.0, "step": 525 }, { "entropy": 6.997141313552857, "epoch": 0.034077026940140163, "grad_norm": 1.203125, "learning_rate": 0.00026450000000000003, "loss": 6.4284, "mean_token_accuracy": 0.12857622653245926, "num_tokens": 1271346.0, "step": 530 }, { "entropy": 7.008873414993286, "epoch": 0.034398508326367906, "grad_norm": 1.0703125, "learning_rate": 0.00026700000000000004, "loss": 6.5163, "mean_token_accuracy": 0.12632984891533852, "num_tokens": 1283017.0, "step": 535 }, { "entropy": 7.0776612758636475, "epoch": 0.03471998971259564, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.5481, "mean_token_accuracy": 0.12498711422085762, "num_tokens": 1293243.0, "step": 540 }, { "entropy": 6.8785299301147464, "epoch": 0.03504147109882338, "grad_norm": 1.171875, "learning_rate": 0.00027200000000000005, "loss": 6.439, "mean_token_accuracy": 0.134949841350317, "num_tokens": 1304801.0, "step": 545 }, { "entropy": 7.143336582183838, "epoch": 0.03536295248505111, "grad_norm": 1.046875, "learning_rate": 0.0002745, "loss": 6.6164, "mean_token_accuracy": 0.12681611329317094, "num_tokens": 1315985.0, "step": 550 }, { "entropy": 6.930103540420532, "epoch": 0.035684433871278856, "grad_norm": 1.125, "learning_rate": 0.000277, "loss": 6.4575, "mean_token_accuracy": 0.13166105449199678, "num_tokens": 1327771.0, "step": 555 }, { "entropy": 6.966667604446411, "epoch": 0.03600591525750659, "grad_norm": 1.3359375, "learning_rate": 0.0002795, "loss": 6.412, "mean_token_accuracy": 0.13625267744064332, "num_tokens": 1338524.0, "step": 560 }, { "entropy": 6.932982063293457, "epoch": 0.03632739664373433, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.4579, "mean_token_accuracy": 0.12851827815175057, "num_tokens": 1350619.0, "step": 565 }, { "entropy": 6.9319816589355465, "epoch": 0.03664887802996206, "grad_norm": 1.1484375, "learning_rate": 0.0002845, "loss": 6.4918, "mean_token_accuracy": 0.12711360901594163, "num_tokens": 1362781.0, "step": 570 }, { "entropy": 6.932379579544067, "epoch": 0.0369703594161898, "grad_norm": 1.171875, "learning_rate": 0.000287, "loss": 6.4437, "mean_token_accuracy": 0.1318575732409954, "num_tokens": 1373784.0, "step": 575 }, { "entropy": 7.074356174468994, "epoch": 0.03729184080241754, "grad_norm": 1.1171875, "learning_rate": 0.0002895, "loss": 6.705, "mean_token_accuracy": 0.11901014372706413, "num_tokens": 1386426.0, "step": 580 }, { "entropy": 6.872195100784301, "epoch": 0.03761332218864528, "grad_norm": 1.0703125, "learning_rate": 0.000292, "loss": 6.3845, "mean_token_accuracy": 0.13377587869763374, "num_tokens": 1397703.0, "step": 585 }, { "entropy": 6.900994157791137, "epoch": 0.03793480357487301, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 6.4395, "mean_token_accuracy": 0.12795801013708114, "num_tokens": 1410071.0, "step": 590 }, { "entropy": 6.954240083694458, "epoch": 0.03825628496110075, "grad_norm": 1.3828125, "learning_rate": 0.000297, "loss": 6.4338, "mean_token_accuracy": 0.1245950624346733, "num_tokens": 1421387.0, "step": 595 }, { "entropy": 6.907541370391845, "epoch": 0.03857776634732849, "grad_norm": 1.2109375, "learning_rate": 0.0002995, "loss": 6.4593, "mean_token_accuracy": 0.12624357938766478, "num_tokens": 1433253.0, "step": 600 }, { "entropy": 6.899614143371582, "epoch": 0.03889924773355623, "grad_norm": 1.4296875, "learning_rate": 0.000302, "loss": 6.4459, "mean_token_accuracy": 0.12114612162113189, "num_tokens": 1444189.0, "step": 605 }, { "entropy": 6.889805459976197, "epoch": 0.03922072911978396, "grad_norm": 1.1484375, "learning_rate": 0.0003045, "loss": 6.4478, "mean_token_accuracy": 0.12658536732196807, "num_tokens": 1455830.0, "step": 610 }, { "entropy": 6.883515930175781, "epoch": 0.0395422105060117, "grad_norm": 1.2421875, "learning_rate": 0.000307, "loss": 6.474, "mean_token_accuracy": 0.13375141024589537, "num_tokens": 1467442.0, "step": 615 }, { "entropy": 6.902092170715332, "epoch": 0.03986369189223944, "grad_norm": 1.2421875, "learning_rate": 0.0003095, "loss": 6.378, "mean_token_accuracy": 0.1375095695257187, "num_tokens": 1478113.0, "step": 620 }, { "entropy": 6.887974262237549, "epoch": 0.04018517327846718, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 6.4173, "mean_token_accuracy": 0.1352170430123806, "num_tokens": 1490097.0, "step": 625 }, { "entropy": 6.751322174072266, "epoch": 0.04050665466469491, "grad_norm": 1.15625, "learning_rate": 0.0003145, "loss": 6.3863, "mean_token_accuracy": 0.13129702284932138, "num_tokens": 1501565.0, "step": 630 }, { "entropy": 6.841671752929687, "epoch": 0.04082813605092265, "grad_norm": 1.1640625, "learning_rate": 0.000317, "loss": 6.385, "mean_token_accuracy": 0.13331395909190177, "num_tokens": 1512434.0, "step": 635 }, { "entropy": 6.838632202148437, "epoch": 0.04114961743715039, "grad_norm": 1.0859375, "learning_rate": 0.0003195, "loss": 6.3326, "mean_token_accuracy": 0.13992721661925317, "num_tokens": 1524212.0, "step": 640 }, { "entropy": 6.717573928833008, "epoch": 0.04147109882337813, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.2641, "mean_token_accuracy": 0.13435597494244575, "num_tokens": 1536588.0, "step": 645 }, { "entropy": 6.813121795654297, "epoch": 0.04179258020960586, "grad_norm": 1.140625, "learning_rate": 0.00032450000000000003, "loss": 6.4067, "mean_token_accuracy": 0.1357954926788807, "num_tokens": 1548334.0, "step": 650 }, { "entropy": 6.733175325393677, "epoch": 0.0421140615958336, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.3691, "mean_token_accuracy": 0.13718299865722655, "num_tokens": 1560381.0, "step": 655 }, { "entropy": 6.773969268798828, "epoch": 0.04243554298206134, "grad_norm": 1.1015625, "learning_rate": 0.00032950000000000004, "loss": 6.3926, "mean_token_accuracy": 0.1230570524930954, "num_tokens": 1573484.0, "step": 660 }, { "entropy": 6.820370149612427, "epoch": 0.04275702436828908, "grad_norm": 1.171875, "learning_rate": 0.00033200000000000005, "loss": 6.3808, "mean_token_accuracy": 0.13517048284411431, "num_tokens": 1585471.0, "step": 665 }, { "entropy": 6.72473177909851, "epoch": 0.04307850575451681, "grad_norm": 1.0234375, "learning_rate": 0.00033450000000000005, "loss": 6.2612, "mean_token_accuracy": 0.14530360400676728, "num_tokens": 1596321.0, "step": 670 }, { "entropy": 6.86566572189331, "epoch": 0.04339998714074455, "grad_norm": 1.2265625, "learning_rate": 0.000337, "loss": 6.4255, "mean_token_accuracy": 0.1406514436006546, "num_tokens": 1608219.0, "step": 675 }, { "entropy": 6.6760951519012455, "epoch": 0.04372146852697229, "grad_norm": 1.0859375, "learning_rate": 0.0003395, "loss": 6.2714, "mean_token_accuracy": 0.13934220522642135, "num_tokens": 1619420.0, "step": 680 }, { "entropy": 6.79856915473938, "epoch": 0.04404294991320003, "grad_norm": 1.1015625, "learning_rate": 0.000342, "loss": 6.3423, "mean_token_accuracy": 0.13619581386446952, "num_tokens": 1631022.0, "step": 685 }, { "entropy": 6.7899799823760985, "epoch": 0.04436443129942776, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 6.3661, "mean_token_accuracy": 0.13836024552583695, "num_tokens": 1642930.0, "step": 690 }, { "entropy": 6.691325092315674, "epoch": 0.0446859126856555, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 6.3574, "mean_token_accuracy": 0.1367586337029934, "num_tokens": 1655776.0, "step": 695 }, { "entropy": 6.817952728271484, "epoch": 0.045007394071883235, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 6.361, "mean_token_accuracy": 0.1369588740170002, "num_tokens": 1669330.0, "step": 700 }, { "entropy": 6.626900386810303, "epoch": 0.04532887545811098, "grad_norm": 1.078125, "learning_rate": 0.000352, "loss": 6.3733, "mean_token_accuracy": 0.1379777029156685, "num_tokens": 1682126.0, "step": 705 }, { "entropy": 6.74940242767334, "epoch": 0.04565035684433871, "grad_norm": 1.1328125, "learning_rate": 0.0003545, "loss": 6.2913, "mean_token_accuracy": 0.14252828136086465, "num_tokens": 1693070.0, "step": 710 }, { "entropy": 6.821109485626221, "epoch": 0.04597183823056645, "grad_norm": 1.2109375, "learning_rate": 0.000357, "loss": 6.3673, "mean_token_accuracy": 0.13518087714910507, "num_tokens": 1705254.0, "step": 715 }, { "entropy": 6.716013097763062, "epoch": 0.046293319616794185, "grad_norm": 1.1015625, "learning_rate": 0.0003595, "loss": 6.3296, "mean_token_accuracy": 0.1330641709268093, "num_tokens": 1718214.0, "step": 720 }, { "entropy": 6.745158529281616, "epoch": 0.04661480100302193, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 6.36, "mean_token_accuracy": 0.13509849980473518, "num_tokens": 1731046.0, "step": 725 }, { "entropy": 6.691292095184326, "epoch": 0.04693628238924966, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 6.3051, "mean_token_accuracy": 0.13931626304984093, "num_tokens": 1744332.0, "step": 730 }, { "entropy": 6.6679082870483395, "epoch": 0.0472577637754774, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.3141, "mean_token_accuracy": 0.1361882694065571, "num_tokens": 1757744.0, "step": 735 }, { "entropy": 6.755461311340332, "epoch": 0.047579245161705135, "grad_norm": 1.0625, "learning_rate": 0.0003695, "loss": 6.3255, "mean_token_accuracy": 0.13589167818427086, "num_tokens": 1769710.0, "step": 740 }, { "entropy": 6.661909294128418, "epoch": 0.04790072654793288, "grad_norm": 1.0390625, "learning_rate": 0.000372, "loss": 6.3197, "mean_token_accuracy": 0.134683046489954, "num_tokens": 1782299.0, "step": 745 }, { "entropy": 6.686239433288574, "epoch": 0.04822220793416061, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.2854, "mean_token_accuracy": 0.1418588526546955, "num_tokens": 1794407.0, "step": 750 }, { "entropy": 6.681186580657959, "epoch": 0.04854368932038835, "grad_norm": 1.1796875, "learning_rate": 0.000377, "loss": 6.2539, "mean_token_accuracy": 0.13846987187862397, "num_tokens": 1806512.0, "step": 755 }, { "entropy": 6.679962110519409, "epoch": 0.048865170706616085, "grad_norm": 0.9921875, "learning_rate": 0.0003795, "loss": 6.2985, "mean_token_accuracy": 0.14243988171219826, "num_tokens": 1819456.0, "step": 760 }, { "entropy": 6.526072311401367, "epoch": 0.04918665209284383, "grad_norm": 1.1953125, "learning_rate": 0.000382, "loss": 6.1211, "mean_token_accuracy": 0.14557768478989602, "num_tokens": 1831866.0, "step": 765 }, { "entropy": 6.57554988861084, "epoch": 0.04950813347907156, "grad_norm": 1.1015625, "learning_rate": 0.0003845, "loss": 6.141, "mean_token_accuracy": 0.14539860635995866, "num_tokens": 1842662.0, "step": 770 }, { "entropy": 6.579600238800049, "epoch": 0.0498296148652993, "grad_norm": 1.0078125, "learning_rate": 0.00038700000000000003, "loss": 6.1807, "mean_token_accuracy": 0.14677832573652266, "num_tokens": 1855599.0, "step": 775 }, { "entropy": 6.664310932159424, "epoch": 0.050151096251527034, "grad_norm": 1.265625, "learning_rate": 0.00038950000000000003, "loss": 6.2611, "mean_token_accuracy": 0.13455238118767737, "num_tokens": 1866656.0, "step": 780 }, { "entropy": 6.580622625350952, "epoch": 0.05047257763775478, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.2491, "mean_token_accuracy": 0.13729645386338235, "num_tokens": 1877473.0, "step": 785 }, { "entropy": 6.699300527572632, "epoch": 0.05079405902398251, "grad_norm": 1.046875, "learning_rate": 0.00039450000000000005, "loss": 6.2869, "mean_token_accuracy": 0.13934579417109488, "num_tokens": 1889113.0, "step": 790 }, { "entropy": 6.575865650177002, "epoch": 0.05111554041021025, "grad_norm": 1.0, "learning_rate": 0.00039700000000000005, "loss": 6.1885, "mean_token_accuracy": 0.1417413368821144, "num_tokens": 1901528.0, "step": 795 }, { "entropy": 6.590616846084595, "epoch": 0.051437021796437984, "grad_norm": 1.0703125, "learning_rate": 0.0003995, "loss": 6.2219, "mean_token_accuracy": 0.13816025704145432, "num_tokens": 1912036.0, "step": 800 }, { "entropy": 6.601884841918945, "epoch": 0.05175850318266572, "grad_norm": 1.03125, "learning_rate": 0.000402, "loss": 6.1707, "mean_token_accuracy": 0.14483692795038222, "num_tokens": 1923939.0, "step": 805 }, { "entropy": 6.482674884796142, "epoch": 0.05207998456889346, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.1383, "mean_token_accuracy": 0.15191132128238677, "num_tokens": 1935248.0, "step": 810 }, { "entropy": 6.679584169387818, "epoch": 0.0524014659551212, "grad_norm": 1.1640625, "learning_rate": 0.00040699999999999997, "loss": 6.2512, "mean_token_accuracy": 0.1460711881518364, "num_tokens": 1946732.0, "step": 815 }, { "entropy": 6.574809503555298, "epoch": 0.052722947341348934, "grad_norm": 1.1796875, "learning_rate": 0.0004095, "loss": 6.226, "mean_token_accuracy": 0.1427159160375595, "num_tokens": 1958316.0, "step": 820 }, { "entropy": 6.472147607803345, "epoch": 0.05304442872757667, "grad_norm": 1.0390625, "learning_rate": 0.000412, "loss": 6.0917, "mean_token_accuracy": 0.15051717907190323, "num_tokens": 1969543.0, "step": 825 }, { "entropy": 6.623300170898437, "epoch": 0.05336591011380441, "grad_norm": 1.234375, "learning_rate": 0.0004145, "loss": 6.313, "mean_token_accuracy": 0.1366821512579918, "num_tokens": 1981085.0, "step": 830 }, { "entropy": 6.603462076187133, "epoch": 0.05368739150003215, "grad_norm": 1.171875, "learning_rate": 0.000417, "loss": 6.1986, "mean_token_accuracy": 0.14714324995875358, "num_tokens": 1992610.0, "step": 835 }, { "entropy": 6.533374309539795, "epoch": 0.054008872886259884, "grad_norm": 1.1171875, "learning_rate": 0.0004195, "loss": 6.1716, "mean_token_accuracy": 0.14295029491186143, "num_tokens": 2004154.0, "step": 840 }, { "entropy": 6.516127395629883, "epoch": 0.05433035427248762, "grad_norm": 1.0703125, "learning_rate": 0.000422, "loss": 6.0815, "mean_token_accuracy": 0.14348058253526688, "num_tokens": 2015141.0, "step": 845 }, { "entropy": 6.5279299259185795, "epoch": 0.05465183565871536, "grad_norm": 0.9921875, "learning_rate": 0.0004245, "loss": 6.1455, "mean_token_accuracy": 0.15023983269929886, "num_tokens": 2028173.0, "step": 850 }, { "entropy": 6.429127645492554, "epoch": 0.0549733170449431, "grad_norm": 1.1328125, "learning_rate": 0.000427, "loss": 6.1486, "mean_token_accuracy": 0.14123030006885529, "num_tokens": 2039979.0, "step": 855 }, { "entropy": 6.57825779914856, "epoch": 0.055294798431170834, "grad_norm": 1.046875, "learning_rate": 0.0004295, "loss": 6.0981, "mean_token_accuracy": 0.14770488440990448, "num_tokens": 2051052.0, "step": 860 }, { "entropy": 6.48339581489563, "epoch": 0.05561627981739857, "grad_norm": 1.0078125, "learning_rate": 0.000432, "loss": 6.2736, "mean_token_accuracy": 0.13757081255316733, "num_tokens": 2064252.0, "step": 865 }, { "entropy": 6.527880430221558, "epoch": 0.05593776120362631, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.1659, "mean_token_accuracy": 0.14587004482746124, "num_tokens": 2075697.0, "step": 870 }, { "entropy": 6.587885761260987, "epoch": 0.05625924258985405, "grad_norm": 1.21875, "learning_rate": 0.000437, "loss": 6.2902, "mean_token_accuracy": 0.1394598327577114, "num_tokens": 2088354.0, "step": 875 }, { "entropy": 6.597920179367065, "epoch": 0.056580723976081784, "grad_norm": 1.21875, "learning_rate": 0.0004395, "loss": 6.2794, "mean_token_accuracy": 0.14314963445067405, "num_tokens": 2101291.0, "step": 880 }, { "entropy": 6.531395626068115, "epoch": 0.05690220536230952, "grad_norm": 1.40625, "learning_rate": 0.000442, "loss": 6.1794, "mean_token_accuracy": 0.15109536275267602, "num_tokens": 2114151.0, "step": 885 }, { "entropy": 6.5403975486755375, "epoch": 0.05722368674853726, "grad_norm": 1.1484375, "learning_rate": 0.0004445, "loss": 6.2204, "mean_token_accuracy": 0.140879013389349, "num_tokens": 2127638.0, "step": 890 }, { "entropy": 6.454720592498779, "epoch": 0.057545168134765, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.1054, "mean_token_accuracy": 0.15080050081014634, "num_tokens": 2139773.0, "step": 895 }, { "entropy": 6.582310771942138, "epoch": 0.057866649520992734, "grad_norm": 1.1328125, "learning_rate": 0.00044950000000000003, "loss": 6.2261, "mean_token_accuracy": 0.13719287440180777, "num_tokens": 2151167.0, "step": 900 }, { "entropy": 6.373457574844361, "epoch": 0.05818813090722047, "grad_norm": 0.98828125, "learning_rate": 0.00045200000000000004, "loss": 6.1103, "mean_token_accuracy": 0.14882433116436006, "num_tokens": 2163150.0, "step": 905 }, { "entropy": 6.511533308029175, "epoch": 0.05850961229344821, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.138, "mean_token_accuracy": 0.1470898576080799, "num_tokens": 2175116.0, "step": 910 }, { "entropy": 6.402334594726563, "epoch": 0.05883109367967595, "grad_norm": 1.0703125, "learning_rate": 0.00045700000000000005, "loss": 6.0541, "mean_token_accuracy": 0.1523958332836628, "num_tokens": 2188074.0, "step": 915 }, { "entropy": 6.463513612747192, "epoch": 0.059152575065903684, "grad_norm": 1.125, "learning_rate": 0.00045950000000000006, "loss": 6.1002, "mean_token_accuracy": 0.1470402017235756, "num_tokens": 2200706.0, "step": 920 }, { "entropy": 6.349210262298584, "epoch": 0.05947405645213142, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 6.1154, "mean_token_accuracy": 0.15224614143371581, "num_tokens": 2212493.0, "step": 925 }, { "entropy": 6.507826137542724, "epoch": 0.059795537838359156, "grad_norm": 1.0859375, "learning_rate": 0.0004645, "loss": 6.1258, "mean_token_accuracy": 0.14575668349862098, "num_tokens": 2224668.0, "step": 930 }, { "entropy": 6.432238912582397, "epoch": 0.0601170192245869, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 6.1242, "mean_token_accuracy": 0.14432022348046303, "num_tokens": 2236280.0, "step": 935 }, { "entropy": 6.493103885650635, "epoch": 0.060438500610814634, "grad_norm": 1.0234375, "learning_rate": 0.0004695, "loss": 6.1341, "mean_token_accuracy": 0.14489658921957016, "num_tokens": 2246947.0, "step": 940 }, { "entropy": 6.486361408233643, "epoch": 0.06075998199704237, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.1497, "mean_token_accuracy": 0.1474609225988388, "num_tokens": 2258591.0, "step": 945 }, { "entropy": 6.394432783126831, "epoch": 0.061081463383270106, "grad_norm": 1.09375, "learning_rate": 0.0004745, "loss": 6.1055, "mean_token_accuracy": 0.1405967153608799, "num_tokens": 2269725.0, "step": 950 }, { "entropy": 6.481177186965942, "epoch": 0.06140294476949785, "grad_norm": 1.0546875, "learning_rate": 0.000477, "loss": 6.0784, "mean_token_accuracy": 0.1547504723072052, "num_tokens": 2282172.0, "step": 955 }, { "entropy": 6.446505546569824, "epoch": 0.061724426155725584, "grad_norm": 1.25, "learning_rate": 0.0004795, "loss": 6.2106, "mean_token_accuracy": 0.14404927641153337, "num_tokens": 2293991.0, "step": 960 }, { "entropy": 6.479608154296875, "epoch": 0.06204590754195332, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.1149, "mean_token_accuracy": 0.1508398488163948, "num_tokens": 2306715.0, "step": 965 }, { "entropy": 6.330813074111939, "epoch": 0.062367388928181056, "grad_norm": 1.1640625, "learning_rate": 0.0004845, "loss": 6.1465, "mean_token_accuracy": 0.14545181691646575, "num_tokens": 2319096.0, "step": 970 }, { "entropy": 6.360287046432495, "epoch": 0.0626888703144088, "grad_norm": 1.140625, "learning_rate": 0.000487, "loss": 6.0329, "mean_token_accuracy": 0.14853936582803726, "num_tokens": 2332239.0, "step": 975 }, { "entropy": 6.3763471126556395, "epoch": 0.06301035170063653, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 6.1228, "mean_token_accuracy": 0.14723728373646736, "num_tokens": 2343897.0, "step": 980 }, { "entropy": 6.353127479553223, "epoch": 0.06333183308686427, "grad_norm": 0.99609375, "learning_rate": 0.000492, "loss": 6.0663, "mean_token_accuracy": 0.14970697611570358, "num_tokens": 2356811.0, "step": 985 }, { "entropy": 6.3828963279724125, "epoch": 0.06365331447309201, "grad_norm": 1.09375, "learning_rate": 0.0004945, "loss": 6.0559, "mean_token_accuracy": 0.15341916903853417, "num_tokens": 2369146.0, "step": 990 }, { "entropy": 6.346980619430542, "epoch": 0.06397479585931974, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.0164, "mean_token_accuracy": 0.1514612004160881, "num_tokens": 2381154.0, "step": 995 }, { "entropy": 6.36736650466919, "epoch": 0.06429627724554748, "grad_norm": 1.15625, "learning_rate": 0.0004995, "loss": 6.1074, "mean_token_accuracy": 0.14672497659921646, "num_tokens": 2392095.0, "step": 1000 }, { "entropy": 6.426885080337525, "epoch": 0.06461775863177523, "grad_norm": 0.92578125, "learning_rate": 0.000499998026082006, "loss": 6.2126, "mean_token_accuracy": 0.14347948506474495, "num_tokens": 2405446.0, "step": 1005 }, { "entropy": 6.350338315963745, "epoch": 0.06493924001800296, "grad_norm": 1.0234375, "learning_rate": 0.0004999900070995136, "loss": 6.0627, "mean_token_accuracy": 0.1458252727985382, "num_tokens": 2418506.0, "step": 1010 }, { "entropy": 6.34899787902832, "epoch": 0.0652607214042307, "grad_norm": 1.078125, "learning_rate": 0.0004999758199023239, "loss": 6.0568, "mean_token_accuracy": 0.15567989647388458, "num_tokens": 2430125.0, "step": 1015 }, { "entropy": 6.37267050743103, "epoch": 0.06558220279045843, "grad_norm": 1.0234375, "learning_rate": 0.0004999554648793858, "loss": 6.0766, "mean_token_accuracy": 0.14890180379152299, "num_tokens": 2442000.0, "step": 1020 }, { "entropy": 6.391686868667603, "epoch": 0.06590368417668617, "grad_norm": 1.0703125, "learning_rate": 0.0004999289425887425, "loss": 6.095, "mean_token_accuracy": 0.1505647674202919, "num_tokens": 2453389.0, "step": 1025 }, { "entropy": 6.414132595062256, "epoch": 0.06622516556291391, "grad_norm": 1.046875, "learning_rate": 0.0004998962537575161, "loss": 6.1065, "mean_token_accuracy": 0.1472689539194107, "num_tokens": 2464988.0, "step": 1030 }, { "entropy": 6.3225417137146, "epoch": 0.06654664694914164, "grad_norm": 1.140625, "learning_rate": 0.0004998573992818874, "loss": 6.0009, "mean_token_accuracy": 0.15887372940778732, "num_tokens": 2476820.0, "step": 1035 }, { "entropy": 6.353922176361084, "epoch": 0.06686812833536938, "grad_norm": 1.078125, "learning_rate": 0.0004998123802270715, "loss": 6.0069, "mean_token_accuracy": 0.14979753121733666, "num_tokens": 2489427.0, "step": 1040 }, { "entropy": 6.2835996627807615, "epoch": 0.06718960972159711, "grad_norm": 1.0859375, "learning_rate": 0.0004997611978272886, "loss": 6.0293, "mean_token_accuracy": 0.15290547013282776, "num_tokens": 2501084.0, "step": 1045 }, { "entropy": 6.393969631195068, "epoch": 0.06751109110782486, "grad_norm": 1.15625, "learning_rate": 0.0004997038534857298, "loss": 6.1253, "mean_token_accuracy": 0.1501571610569954, "num_tokens": 2513005.0, "step": 1050 }, { "entropy": 6.297085285186768, "epoch": 0.0678325724940526, "grad_norm": 1.0, "learning_rate": 0.0004996403487745194, "loss": 5.9784, "mean_token_accuracy": 0.15144816786050797, "num_tokens": 2526217.0, "step": 1055 }, { "entropy": 6.364409065246582, "epoch": 0.06815405388028033, "grad_norm": 1.1484375, "learning_rate": 0.000499570685434671, "loss": 6.0721, "mean_token_accuracy": 0.15043441355228424, "num_tokens": 2538892.0, "step": 1060 }, { "entropy": 6.305640745162964, "epoch": 0.06847553526650807, "grad_norm": 1.1796875, "learning_rate": 0.0004994948653760405, "loss": 6.0322, "mean_token_accuracy": 0.15073884129524232, "num_tokens": 2549929.0, "step": 1065 }, { "entropy": 6.316273498535156, "epoch": 0.06879701665273581, "grad_norm": 1.078125, "learning_rate": 0.0004994128906772729, "loss": 5.967, "mean_token_accuracy": 0.16290880739688873, "num_tokens": 2561322.0, "step": 1070 }, { "entropy": 6.35417103767395, "epoch": 0.06911849803896354, "grad_norm": 0.98828125, "learning_rate": 0.000499324763585746, "loss": 5.9635, "mean_token_accuracy": 0.16284787505865098, "num_tokens": 2572908.0, "step": 1075 }, { "entropy": 6.189544916152954, "epoch": 0.06943997942519128, "grad_norm": 1.0703125, "learning_rate": 0.0004992304865175085, "loss": 6.0468, "mean_token_accuracy": 0.14753600358963012, "num_tokens": 2584880.0, "step": 1080 }, { "entropy": 6.304679203033447, "epoch": 0.06976146081141901, "grad_norm": 1.0390625, "learning_rate": 0.0004991300620572138, "loss": 5.9537, "mean_token_accuracy": 0.15288592427968978, "num_tokens": 2596663.0, "step": 1085 }, { "entropy": 6.306663751602173, "epoch": 0.07008294219764676, "grad_norm": 1.0625, "learning_rate": 0.0004990234929580494, "loss": 6.0103, "mean_token_accuracy": 0.150350858271122, "num_tokens": 2608609.0, "step": 1090 }, { "entropy": 6.189498329162598, "epoch": 0.0704044235838745, "grad_norm": 0.98046875, "learning_rate": 0.0004989107821416609, "loss": 5.9271, "mean_token_accuracy": 0.15373560041189194, "num_tokens": 2620535.0, "step": 1095 }, { "entropy": 6.272855806350708, "epoch": 0.07072590497010223, "grad_norm": 1.1875, "learning_rate": 0.0004987919326980723, "loss": 6.0391, "mean_token_accuracy": 0.14719461053609847, "num_tokens": 2631718.0, "step": 1100 }, { "entropy": 6.330906057357788, "epoch": 0.07104738635632997, "grad_norm": 1.0703125, "learning_rate": 0.0004986669478856011, "loss": 5.9971, "mean_token_accuracy": 0.1513780727982521, "num_tokens": 2644641.0, "step": 1105 }, { "entropy": 6.242729377746582, "epoch": 0.07136886774255771, "grad_norm": 1.71875, "learning_rate": 0.0004985358311307688, "loss": 6.0712, "mean_token_accuracy": 0.1472596064209938, "num_tokens": 2656445.0, "step": 1110 }, { "entropy": 6.2387518882751465, "epoch": 0.07169034912878544, "grad_norm": 0.99609375, "learning_rate": 0.0004983985860282081, "loss": 5.9288, "mean_token_accuracy": 0.16197773665189744, "num_tokens": 2667782.0, "step": 1115 }, { "entropy": 6.297261524200439, "epoch": 0.07201183051501318, "grad_norm": 0.96484375, "learning_rate": 0.0004982552163405623, "loss": 5.8888, "mean_token_accuracy": 0.16516102403402327, "num_tokens": 2679421.0, "step": 1120 }, { "entropy": 6.153607034683228, "epoch": 0.07233331190124091, "grad_norm": 1.0703125, "learning_rate": 0.0004981057259983839, "loss": 5.8252, "mean_token_accuracy": 0.16737353205680847, "num_tokens": 2690045.0, "step": 1125 }, { "entropy": 6.256674098968506, "epoch": 0.07265479328746866, "grad_norm": 1.1015625, "learning_rate": 0.0004979501191000262, "loss": 5.9358, "mean_token_accuracy": 0.1594891406595707, "num_tokens": 2702725.0, "step": 1130 }, { "entropy": 6.189019870758057, "epoch": 0.0729762746736964, "grad_norm": 1.046875, "learning_rate": 0.0004977883999115311, "loss": 5.9325, "mean_token_accuracy": 0.1560269773006439, "num_tokens": 2714874.0, "step": 1135 }, { "entropy": 6.31310076713562, "epoch": 0.07329775605992413, "grad_norm": 1.1640625, "learning_rate": 0.0004976205728665113, "loss": 6.0494, "mean_token_accuracy": 0.14427177235484123, "num_tokens": 2727237.0, "step": 1140 }, { "entropy": 6.140863609313965, "epoch": 0.07361923744615187, "grad_norm": 1.1015625, "learning_rate": 0.0004974466425660307, "loss": 5.9221, "mean_token_accuracy": 0.15012870132923126, "num_tokens": 2738201.0, "step": 1145 }, { "entropy": 6.239338064193726, "epoch": 0.0739407188323796, "grad_norm": 0.9921875, "learning_rate": 0.0004972666137784759, "loss": 5.967, "mean_token_accuracy": 0.161196768283844, "num_tokens": 2749926.0, "step": 1150 }, { "entropy": 6.244922113418579, "epoch": 0.07426220021860734, "grad_norm": 0.96875, "learning_rate": 0.0004970804914394271, "loss": 5.9984, "mean_token_accuracy": 0.146126826107502, "num_tokens": 2762454.0, "step": 1155 }, { "entropy": 6.172313117980957, "epoch": 0.07458368160483508, "grad_norm": 1.078125, "learning_rate": 0.0004968882806515225, "loss": 5.928, "mean_token_accuracy": 0.1524214893579483, "num_tokens": 2775340.0, "step": 1160 }, { "entropy": 6.191201305389404, "epoch": 0.07490516299106281, "grad_norm": 1.21875, "learning_rate": 0.0004966899866843177, "loss": 5.8407, "mean_token_accuracy": 0.1651138797402382, "num_tokens": 2787350.0, "step": 1165 }, { "entropy": 6.163157844543457, "epoch": 0.07522664437729056, "grad_norm": 1.1015625, "learning_rate": 0.000496485614974142, "loss": 5.8869, "mean_token_accuracy": 0.16123317033052445, "num_tokens": 2797891.0, "step": 1170 }, { "entropy": 6.166656732559204, "epoch": 0.0755481257635183, "grad_norm": 1.0625, "learning_rate": 0.0004962751711239492, "loss": 5.8488, "mean_token_accuracy": 0.15674188137054443, "num_tokens": 2809199.0, "step": 1175 }, { "entropy": 6.317021608352661, "epoch": 0.07586960714974603, "grad_norm": 1.21875, "learning_rate": 0.0004960586609031636, "loss": 6.1259, "mean_token_accuracy": 0.14605942070484162, "num_tokens": 2820881.0, "step": 1180 }, { "entropy": 6.217242765426636, "epoch": 0.07619108853597377, "grad_norm": 1.0703125, "learning_rate": 0.0004958360902475224, "loss": 5.9131, "mean_token_accuracy": 0.158234640955925, "num_tokens": 2833203.0, "step": 1185 }, { "entropy": 6.085934734344482, "epoch": 0.0765125699222015, "grad_norm": 1.0, "learning_rate": 0.0004956074652589125, "loss": 5.8158, "mean_token_accuracy": 0.1622716337442398, "num_tokens": 2844695.0, "step": 1190 }, { "entropy": 6.18882040977478, "epoch": 0.07683405130842924, "grad_norm": 1.0703125, "learning_rate": 0.0004953727922052035, "loss": 5.9218, "mean_token_accuracy": 0.15580735355615616, "num_tokens": 2855757.0, "step": 1195 }, { "entropy": 6.096655941009521, "epoch": 0.07715553269465698, "grad_norm": 0.96484375, "learning_rate": 0.0004951320775200756, "loss": 5.8256, "mean_token_accuracy": 0.1585150107741356, "num_tokens": 2867534.0, "step": 1200 }, { "entropy": 6.212085294723511, "epoch": 0.07747701408088471, "grad_norm": 0.9375, "learning_rate": 0.0004948853278028436, "loss": 5.9379, "mean_token_accuracy": 0.15673388540744781, "num_tokens": 2879984.0, "step": 1205 }, { "entropy": 6.263598108291626, "epoch": 0.07779849546711246, "grad_norm": 1.109375, "learning_rate": 0.0004946325498182755, "loss": 5.9533, "mean_token_accuracy": 0.1572867900133133, "num_tokens": 2892920.0, "step": 1210 }, { "entropy": 6.116982269287109, "epoch": 0.0781199768533402, "grad_norm": 1.0546875, "learning_rate": 0.0004943737504964076, "loss": 5.9162, "mean_token_accuracy": 0.1617930367588997, "num_tokens": 2903821.0, "step": 1215 }, { "entropy": 6.2275710105896, "epoch": 0.07844145823956793, "grad_norm": 1.0859375, "learning_rate": 0.000494108936932354, "loss": 5.9182, "mean_token_accuracy": 0.15855470597743987, "num_tokens": 2916280.0, "step": 1220 }, { "entropy": 6.233517837524414, "epoch": 0.07876293962579567, "grad_norm": 0.921875, "learning_rate": 0.0004938381163861124, "loss": 5.9979, "mean_token_accuracy": 0.15871625244617463, "num_tokens": 2928737.0, "step": 1225 }, { "entropy": 6.193160438537598, "epoch": 0.0790844210120234, "grad_norm": 1.0859375, "learning_rate": 0.0004935612962823645, "loss": 5.891, "mean_token_accuracy": 0.16073769181966782, "num_tokens": 2940833.0, "step": 1230 }, { "entropy": 6.115055561065674, "epoch": 0.07940590239825114, "grad_norm": 1.1171875, "learning_rate": 0.0004932784842102739, "loss": 5.8428, "mean_token_accuracy": 0.15946858525276184, "num_tokens": 2952662.0, "step": 1235 }, { "entropy": 6.204311752319336, "epoch": 0.07972738378447888, "grad_norm": 0.99609375, "learning_rate": 0.0004929896879232758, "loss": 5.9119, "mean_token_accuracy": 0.1619669482111931, "num_tokens": 2965504.0, "step": 1240 }, { "entropy": 6.2926552295684814, "epoch": 0.08004886517070661, "grad_norm": 1.203125, "learning_rate": 0.0004926949153388668, "loss": 5.9785, "mean_token_accuracy": 0.15522371083498002, "num_tokens": 2977610.0, "step": 1245 }, { "entropy": 6.112452220916748, "epoch": 0.08037034655693436, "grad_norm": 1.109375, "learning_rate": 0.0004923941745383859, "loss": 5.8564, "mean_token_accuracy": 0.15934567600488664, "num_tokens": 2989677.0, "step": 1250 }, { "entropy": 6.151176643371582, "epoch": 0.0806918279431621, "grad_norm": 1.0234375, "learning_rate": 0.000492087473766794, "loss": 5.9276, "mean_token_accuracy": 0.1602254882454872, "num_tokens": 3002164.0, "step": 1255 }, { "entropy": 6.151615953445434, "epoch": 0.08101330932938983, "grad_norm": 1.015625, "learning_rate": 0.000491774821432448, "loss": 5.839, "mean_token_accuracy": 0.1672609567642212, "num_tokens": 3013487.0, "step": 1260 }, { "entropy": 6.091053056716919, "epoch": 0.08133479071561757, "grad_norm": 1.0859375, "learning_rate": 0.0004914562261068693, "loss": 5.7592, "mean_token_accuracy": 0.1637980043888092, "num_tokens": 3025240.0, "step": 1265 }, { "entropy": 6.198080825805664, "epoch": 0.0816562721018453, "grad_norm": 1.109375, "learning_rate": 0.0004911316965245098, "loss": 5.9558, "mean_token_accuracy": 0.15986837595701217, "num_tokens": 3037931.0, "step": 1270 }, { "entropy": 6.180276155471802, "epoch": 0.08197775348807304, "grad_norm": 1.0390625, "learning_rate": 0.000490801241582512, "loss": 5.8599, "mean_token_accuracy": 0.16204103082418442, "num_tokens": 3050977.0, "step": 1275 }, { "entropy": 6.0987457752227785, "epoch": 0.08229923487430078, "grad_norm": 1.0625, "learning_rate": 0.000490464870340465, "loss": 5.7864, "mean_token_accuracy": 0.15847471207380295, "num_tokens": 3064797.0, "step": 1280 }, { "entropy": 6.059926891326905, "epoch": 0.08262071626052851, "grad_norm": 0.9765625, "learning_rate": 0.0004901225920201563, "loss": 5.8721, "mean_token_accuracy": 0.16135916709899903, "num_tokens": 3077595.0, "step": 1285 }, { "entropy": 6.165657234191895, "epoch": 0.08294219764675625, "grad_norm": 1.0859375, "learning_rate": 0.000489774416005319, "loss": 5.9139, "mean_token_accuracy": 0.15417862236499785, "num_tokens": 3089913.0, "step": 1290 }, { "entropy": 6.133871126174927, "epoch": 0.08326367903298398, "grad_norm": 0.9765625, "learning_rate": 0.0004894203518413742, "loss": 5.9087, "mean_token_accuracy": 0.1627100259065628, "num_tokens": 3102554.0, "step": 1295 }, { "entropy": 6.111787605285644, "epoch": 0.08358516041921173, "grad_norm": 1.0546875, "learning_rate": 0.0004890604092351701, "loss": 5.8258, "mean_token_accuracy": 0.16240279525518417, "num_tokens": 3113511.0, "step": 1300 }, { "entropy": 6.131465053558349, "epoch": 0.08390664180543947, "grad_norm": 1.0, "learning_rate": 0.000488694598054715, "loss": 5.9213, "mean_token_accuracy": 0.15791668891906738, "num_tokens": 3126829.0, "step": 1305 }, { "entropy": 6.069682979583741, "epoch": 0.0842281231916672, "grad_norm": 1.0390625, "learning_rate": 0.0004883229283289071, "loss": 5.7673, "mean_token_accuracy": 0.16573094874620437, "num_tokens": 3139836.0, "step": 1310 }, { "entropy": 6.073161935806274, "epoch": 0.08454960457789494, "grad_norm": 1.0078125, "learning_rate": 0.00048794541024725993, "loss": 5.8286, "mean_token_accuracy": 0.16145224422216414, "num_tokens": 3152047.0, "step": 1315 }, { "entropy": 6.066088485717773, "epoch": 0.08487108596412268, "grad_norm": 1.0625, "learning_rate": 0.0004875620541596221, "loss": 5.7994, "mean_token_accuracy": 0.16172150075435637, "num_tokens": 3163501.0, "step": 1320 }, { "entropy": 6.123111963272095, "epoch": 0.08519256735035041, "grad_norm": 1.0234375, "learning_rate": 0.00048717287057589454, "loss": 5.8752, "mean_token_accuracy": 0.16654538810253144, "num_tokens": 3175918.0, "step": 1325 }, { "entropy": 6.194814872741699, "epoch": 0.08551404873657815, "grad_norm": 1.078125, "learning_rate": 0.0004867778701657417, "loss": 5.9495, "mean_token_accuracy": 0.14875137954950332, "num_tokens": 3187911.0, "step": 1330 }, { "entropy": 6.065830373764038, "epoch": 0.08583553012280588, "grad_norm": 1.09375, "learning_rate": 0.00048637706375829955, "loss": 5.7759, "mean_token_accuracy": 0.16410106271505356, "num_tokens": 3200143.0, "step": 1335 }, { "entropy": 6.027771663665772, "epoch": 0.08615701150903363, "grad_norm": 1.015625, "learning_rate": 0.000485970462341878, "loss": 5.7746, "mean_token_accuracy": 0.1614765614271164, "num_tokens": 3211570.0, "step": 1340 }, { "entropy": 6.113853216171265, "epoch": 0.08647849289526137, "grad_norm": 1.09375, "learning_rate": 0.00048555807706366044, "loss": 5.8393, "mean_token_accuracy": 0.15796211659908294, "num_tokens": 3222014.0, "step": 1345 }, { "entropy": 6.093673276901245, "epoch": 0.0867999742814891, "grad_norm": 1.1953125, "learning_rate": 0.00048513991922939756, "loss": 5.8008, "mean_token_accuracy": 0.16573861241340637, "num_tokens": 3233115.0, "step": 1350 }, { "entropy": 6.114884376525879, "epoch": 0.08712145566771684, "grad_norm": 1.078125, "learning_rate": 0.00048471600030309744, "loss": 5.9123, "mean_token_accuracy": 0.16168183982372283, "num_tokens": 3244084.0, "step": 1355 }, { "entropy": 6.098208856582642, "epoch": 0.08744293705394458, "grad_norm": 1.0, "learning_rate": 0.00048428633190671186, "loss": 5.846, "mean_token_accuracy": 0.1593250960111618, "num_tokens": 3257476.0, "step": 1360 }, { "entropy": 6.054478931427002, "epoch": 0.08776441844017231, "grad_norm": 1.046875, "learning_rate": 0.0004838509258198167, "loss": 5.7764, "mean_token_accuracy": 0.17061060965061187, "num_tokens": 3268067.0, "step": 1365 }, { "entropy": 6.125921297073364, "epoch": 0.08808589982640005, "grad_norm": 1.0, "learning_rate": 0.00048340979397929, "loss": 5.8603, "mean_token_accuracy": 0.16385477036237717, "num_tokens": 3279097.0, "step": 1370 }, { "entropy": 6.049725770950317, "epoch": 0.08840738121262778, "grad_norm": 1.0, "learning_rate": 0.00048296294847898386, "loss": 5.9084, "mean_token_accuracy": 0.16008279025554656, "num_tokens": 3291198.0, "step": 1375 }, { "entropy": 6.082431793212891, "epoch": 0.08872886259885553, "grad_norm": 1.1328125, "learning_rate": 0.0004825104015693934, "loss": 5.7406, "mean_token_accuracy": 0.16886814534664155, "num_tokens": 3303316.0, "step": 1380 }, { "entropy": 6.06479926109314, "epoch": 0.08905034398508327, "grad_norm": 1.03125, "learning_rate": 0.0004820521656573208, "loss": 5.8514, "mean_token_accuracy": 0.16055994108319283, "num_tokens": 3316069.0, "step": 1385 }, { "entropy": 6.008887243270874, "epoch": 0.089371825371311, "grad_norm": 0.99609375, "learning_rate": 0.00048158825330553505, "loss": 5.7445, "mean_token_accuracy": 0.17007820010185243, "num_tokens": 3328657.0, "step": 1390 }, { "entropy": 6.10736780166626, "epoch": 0.08969330675753874, "grad_norm": 1.0859375, "learning_rate": 0.00048111867723242763, "loss": 5.8555, "mean_token_accuracy": 0.16169255524873732, "num_tokens": 3340486.0, "step": 1395 }, { "entropy": 6.1321416854858395, "epoch": 0.09001478814376647, "grad_norm": 1.125, "learning_rate": 0.0004806434503116637, "loss": 5.8723, "mean_token_accuracy": 0.16864815205335618, "num_tokens": 3350936.0, "step": 1400 }, { "entropy": 6.087703371047974, "epoch": 0.09033626952999421, "grad_norm": 1.1484375, "learning_rate": 0.0004801625855718296, "loss": 5.8601, "mean_token_accuracy": 0.16583744436502457, "num_tokens": 3362238.0, "step": 1405 }, { "entropy": 6.051072263717652, "epoch": 0.09065775091622195, "grad_norm": 1.078125, "learning_rate": 0.00047967609619607477, "loss": 5.794, "mean_token_accuracy": 0.16016314327716827, "num_tokens": 3373818.0, "step": 1410 }, { "entropy": 6.093393230438233, "epoch": 0.09097923230244968, "grad_norm": 1.2109375, "learning_rate": 0.0004791839955217513, "loss": 5.8118, "mean_token_accuracy": 0.16103656888008117, "num_tokens": 3385241.0, "step": 1415 }, { "entropy": 5.9892784595489506, "epoch": 0.09130071368867743, "grad_norm": 1.09375, "learning_rate": 0.00047868629704004786, "loss": 5.8093, "mean_token_accuracy": 0.15792890265583992, "num_tokens": 3398274.0, "step": 1420 }, { "entropy": 6.129896736145019, "epoch": 0.09162219507490517, "grad_norm": 1.109375, "learning_rate": 0.00047818301439561965, "loss": 5.8595, "mean_token_accuracy": 0.16091282665729523, "num_tokens": 3411798.0, "step": 1425 }, { "entropy": 6.027444553375244, "epoch": 0.0919436764611329, "grad_norm": 1.1171875, "learning_rate": 0.00047767416138621454, "loss": 5.8085, "mean_token_accuracy": 0.1594970703125, "num_tokens": 3423646.0, "step": 1430 }, { "entropy": 6.086286878585815, "epoch": 0.09226515784736064, "grad_norm": 0.95703125, "learning_rate": 0.000477159751962295, "loss": 5.8268, "mean_token_accuracy": 0.16200227588415145, "num_tokens": 3436255.0, "step": 1435 }, { "entropy": 6.025093269348145, "epoch": 0.09258663923358837, "grad_norm": 1.171875, "learning_rate": 0.00047663980022665507, "loss": 5.8122, "mean_token_accuracy": 0.16047175079584122, "num_tokens": 3447724.0, "step": 1440 }, { "entropy": 6.141870403289795, "epoch": 0.09290812061981611, "grad_norm": 1.0234375, "learning_rate": 0.00047611432043403437, "loss": 5.8945, "mean_token_accuracy": 0.15279303789138793, "num_tokens": 3460959.0, "step": 1445 }, { "entropy": 6.038381910324096, "epoch": 0.09322960200604385, "grad_norm": 1.3125, "learning_rate": 0.0004755833269907267, "loss": 5.7696, "mean_token_accuracy": 0.16729041934013367, "num_tokens": 3472283.0, "step": 1450 }, { "entropy": 6.012684297561646, "epoch": 0.09355108339227158, "grad_norm": 1.0625, "learning_rate": 0.0004750468344541857, "loss": 5.7736, "mean_token_accuracy": 0.1646544575691223, "num_tokens": 3484296.0, "step": 1455 }, { "entropy": 6.002734279632568, "epoch": 0.09387256477849933, "grad_norm": 0.98046875, "learning_rate": 0.00047450485753262525, "loss": 5.7357, "mean_token_accuracy": 0.16739338636398315, "num_tokens": 3496553.0, "step": 1460 }, { "entropy": 6.06849160194397, "epoch": 0.09419404616472707, "grad_norm": 1.0703125, "learning_rate": 0.00047395741108461633, "loss": 5.8064, "mean_token_accuracy": 0.16018352508544922, "num_tokens": 3508515.0, "step": 1465 }, { "entropy": 6.06675968170166, "epoch": 0.0945155275509548, "grad_norm": 1.015625, "learning_rate": 0.00047340451011867985, "loss": 5.8216, "mean_token_accuracy": 0.16168036088347434, "num_tokens": 3520883.0, "step": 1470 }, { "entropy": 5.9559320449829105, "epoch": 0.09483700893718254, "grad_norm": 0.984375, "learning_rate": 0.00047284616979287515, "loss": 5.7903, "mean_token_accuracy": 0.16948920488357544, "num_tokens": 3533786.0, "step": 1475 }, { "entropy": 6.1463991641998295, "epoch": 0.09515849032341027, "grad_norm": 1.0546875, "learning_rate": 0.00047228240541438433, "loss": 5.7776, "mean_token_accuracy": 0.16706227362155915, "num_tokens": 3544573.0, "step": 1480 }, { "entropy": 6.094358777999878, "epoch": 0.09547997170963801, "grad_norm": 0.94921875, "learning_rate": 0.00047171323243909257, "loss": 5.8846, "mean_token_accuracy": 0.15878364443778992, "num_tokens": 3556148.0, "step": 1485 }, { "entropy": 5.980588340759278, "epoch": 0.09580145309586575, "grad_norm": 1.1171875, "learning_rate": 0.00047113866647116457, "loss": 5.7641, "mean_token_accuracy": 0.16096356213092805, "num_tokens": 3568047.0, "step": 1490 }, { "entropy": 6.014238119125366, "epoch": 0.09612293448209348, "grad_norm": 1.046875, "learning_rate": 0.0004705587232626164, "loss": 5.7819, "mean_token_accuracy": 0.1614854723215103, "num_tokens": 3579864.0, "step": 1495 }, { "entropy": 6.090922594070435, "epoch": 0.09644441586832123, "grad_norm": 1.015625, "learning_rate": 0.00046997341871288424, "loss": 5.8161, "mean_token_accuracy": 0.15966751128435136, "num_tokens": 3591602.0, "step": 1500 }, { "entropy": 5.911532735824585, "epoch": 0.09676589725454895, "grad_norm": 0.9609375, "learning_rate": 0.0004693827688683879, "loss": 5.7131, "mean_token_accuracy": 0.16157886236906052, "num_tokens": 3603802.0, "step": 1505 }, { "entropy": 6.096415281295776, "epoch": 0.0970873786407767, "grad_norm": 1.1640625, "learning_rate": 0.0004687867899220914, "loss": 5.8251, "mean_token_accuracy": 0.16491867303848268, "num_tokens": 3614958.0, "step": 1510 }, { "entropy": 5.926008939743042, "epoch": 0.09740886002700444, "grad_norm": 1.0390625, "learning_rate": 0.00046818549821305846, "loss": 5.7093, "mean_token_accuracy": 0.16871902197599412, "num_tokens": 3626175.0, "step": 1515 }, { "entropy": 5.9772974967956545, "epoch": 0.09773034141323217, "grad_norm": 1.0625, "learning_rate": 0.00046757891022600494, "loss": 5.6843, "mean_token_accuracy": 0.16257247924804688, "num_tokens": 3638818.0, "step": 1520 }, { "entropy": 6.0240332126617435, "epoch": 0.09805182279945991, "grad_norm": 1.0234375, "learning_rate": 0.0004669670425908471, "loss": 5.7146, "mean_token_accuracy": 0.16350910812616348, "num_tokens": 3650838.0, "step": 1525 }, { "entropy": 6.000803804397583, "epoch": 0.09837330418568765, "grad_norm": 1.046875, "learning_rate": 0.0004663499120822451, "loss": 5.7236, "mean_token_accuracy": 0.16991809606552125, "num_tokens": 3661879.0, "step": 1530 }, { "entropy": 6.000612354278564, "epoch": 0.09869478557191538, "grad_norm": 0.93359375, "learning_rate": 0.0004657275356191437, "loss": 5.7162, "mean_token_accuracy": 0.17283950746059418, "num_tokens": 3674464.0, "step": 1535 }, { "entropy": 5.956651830673218, "epoch": 0.09901626695814313, "grad_norm": 1.015625, "learning_rate": 0.00046509993026430804, "loss": 5.6744, "mean_token_accuracy": 0.17085929065942765, "num_tokens": 3686065.0, "step": 1540 }, { "entropy": 5.961250972747803, "epoch": 0.09933774834437085, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.7411, "mean_token_accuracy": 0.17531964033842087, "num_tokens": 3697946.0, "step": 1545 }, { "entropy": 5.9872818946838375, "epoch": 0.0996592297305986, "grad_norm": 0.9921875, "learning_rate": 0.00046382910184678585, "loss": 5.7024, "mean_token_accuracy": 0.16942446082830429, "num_tokens": 3710695.0, "step": 1550 }, { "entropy": 5.950470924377441, "epoch": 0.09998071111682634, "grad_norm": 1.21875, "learning_rate": 0.0004631859136245025, "loss": 5.6825, "mean_token_accuracy": 0.17383817434310914, "num_tokens": 3721288.0, "step": 1555 }, { "entropy": 5.928533840179443, "epoch": 0.10030219250305407, "grad_norm": 1.0078125, "learning_rate": 0.0004625375661903357, "loss": 5.6365, "mean_token_accuracy": 0.16649701148271562, "num_tokens": 3733611.0, "step": 1560 }, { "entropy": 5.955244255065918, "epoch": 0.10062367388928181, "grad_norm": 1.03125, "learning_rate": 0.00046188407731905787, "loss": 5.8012, "mean_token_accuracy": 0.16040457487106324, "num_tokens": 3745018.0, "step": 1565 }, { "entropy": 6.074891996383667, "epoch": 0.10094515527550955, "grad_norm": 1.046875, "learning_rate": 0.00046122546492639643, "loss": 5.7903, "mean_token_accuracy": 0.16442708522081376, "num_tokens": 3755414.0, "step": 1570 }, { "entropy": 5.872460556030274, "epoch": 0.10126663666173728, "grad_norm": 0.99609375, "learning_rate": 0.000460561747068543, "loss": 5.5877, "mean_token_accuracy": 0.17960427105426788, "num_tokens": 3767398.0, "step": 1575 }, { "entropy": 6.056284761428833, "epoch": 0.10158811804796503, "grad_norm": 0.97265625, "learning_rate": 0.0004598929419416578, "loss": 5.7858, "mean_token_accuracy": 0.16207575798034668, "num_tokens": 3779344.0, "step": 1580 }, { "entropy": 5.901925182342529, "epoch": 0.10190959943419275, "grad_norm": 0.93359375, "learning_rate": 0.00045921906788137123, "loss": 5.6982, "mean_token_accuracy": 0.16722951531410218, "num_tokens": 3791642.0, "step": 1585 }, { "entropy": 5.919206190109253, "epoch": 0.1022310808204205, "grad_norm": 1.0625, "learning_rate": 0.00045854014336228115, "loss": 5.6483, "mean_token_accuracy": 0.16981685012578965, "num_tokens": 3803604.0, "step": 1590 }, { "entropy": 6.09901065826416, "epoch": 0.10255256220664824, "grad_norm": 0.94140625, "learning_rate": 0.00045785618699744615, "loss": 5.7711, "mean_token_accuracy": 0.16022978574037552, "num_tokens": 3815472.0, "step": 1595 }, { "entropy": 6.008738374710083, "epoch": 0.10287404359287597, "grad_norm": 1.0859375, "learning_rate": 0.00045716721753787543, "loss": 5.8329, "mean_token_accuracy": 0.1592625081539154, "num_tokens": 3827468.0, "step": 1600 }, { "entropy": 6.05591311454773, "epoch": 0.10319552497910371, "grad_norm": 1.0859375, "learning_rate": 0.0004564732538720148, "loss": 5.814, "mean_token_accuracy": 0.16187592148780822, "num_tokens": 3839532.0, "step": 1605 }, { "entropy": 5.920851564407348, "epoch": 0.10351700636533144, "grad_norm": 0.90234375, "learning_rate": 0.00045577431502522877, "loss": 5.6763, "mean_token_accuracy": 0.1719309151172638, "num_tokens": 3851907.0, "step": 1610 }, { "entropy": 6.0737604141235355, "epoch": 0.10383848775155918, "grad_norm": 1.0703125, "learning_rate": 0.0004550704201592787, "loss": 5.8084, "mean_token_accuracy": 0.1594211921095848, "num_tokens": 3864624.0, "step": 1615 }, { "entropy": 5.935598373413086, "epoch": 0.10415996913778693, "grad_norm": 0.9609375, "learning_rate": 0.0004543615885717981, "loss": 5.6913, "mean_token_accuracy": 0.1719366803765297, "num_tokens": 3876832.0, "step": 1620 }, { "entropy": 5.900327444076538, "epoch": 0.10448145052401465, "grad_norm": 1.015625, "learning_rate": 0.00045364783969576296, "loss": 5.6533, "mean_token_accuracy": 0.1725366458296776, "num_tokens": 3888969.0, "step": 1625 }, { "entropy": 5.919269466400147, "epoch": 0.1048029319102424, "grad_norm": 1.078125, "learning_rate": 0.0004529291930989592, "loss": 5.692, "mean_token_accuracy": 0.16689868569374083, "num_tokens": 3900634.0, "step": 1630 }, { "entropy": 5.978420782089233, "epoch": 0.10512441329647014, "grad_norm": 1.109375, "learning_rate": 0.0004522056684834464, "loss": 5.6596, "mean_token_accuracy": 0.17244009226560592, "num_tokens": 3911993.0, "step": 1635 }, { "entropy": 5.944800853729248, "epoch": 0.10544589468269787, "grad_norm": 1.078125, "learning_rate": 0.0004514772856850173, "loss": 5.7075, "mean_token_accuracy": 0.16923267394304276, "num_tokens": 3923959.0, "step": 1640 }, { "entropy": 5.934698915481567, "epoch": 0.10576737606892561, "grad_norm": 1.0, "learning_rate": 0.0004507440646726542, "loss": 5.6799, "mean_token_accuracy": 0.17092464715242386, "num_tokens": 3936868.0, "step": 1645 }, { "entropy": 5.951383352279663, "epoch": 0.10608885745515334, "grad_norm": 0.98828125, "learning_rate": 0.0004500060255479818, "loss": 5.6691, "mean_token_accuracy": 0.17145125269889833, "num_tokens": 3949777.0, "step": 1650 }, { "entropy": 6.009766578674316, "epoch": 0.10641033884138108, "grad_norm": 1.0078125, "learning_rate": 0.0004492631885447151, "loss": 5.7863, "mean_token_accuracy": 0.16202808246016503, "num_tokens": 3963913.0, "step": 1655 }, { "entropy": 5.909622049331665, "epoch": 0.10673182022760883, "grad_norm": 1.0, "learning_rate": 0.00044851557402810616, "loss": 5.6703, "mean_token_accuracy": 0.1712466612458229, "num_tokens": 3976187.0, "step": 1660 }, { "entropy": 5.883133316040039, "epoch": 0.10705330161383655, "grad_norm": 1.0546875, "learning_rate": 0.00044776320249438444, "loss": 5.6042, "mean_token_accuracy": 0.17793208807706834, "num_tokens": 3986324.0, "step": 1665 }, { "entropy": 5.935062217712402, "epoch": 0.1073747830000643, "grad_norm": 1.046875, "learning_rate": 0.00044700609457019565, "loss": 5.7279, "mean_token_accuracy": 0.17077707052230834, "num_tokens": 3998347.0, "step": 1670 }, { "entropy": 5.9468677043914795, "epoch": 0.10769626438629204, "grad_norm": 1.109375, "learning_rate": 0.0004462442710120359, "loss": 5.7379, "mean_token_accuracy": 0.1692286878824234, "num_tokens": 4010640.0, "step": 1675 }, { "entropy": 5.965192079544067, "epoch": 0.10801774577251977, "grad_norm": 1.0, "learning_rate": 0.000445477752705683, "loss": 5.7021, "mean_token_accuracy": 0.16421150118112565, "num_tokens": 4023544.0, "step": 1680 }, { "entropy": 5.997580337524414, "epoch": 0.10833922715874751, "grad_norm": 1.015625, "learning_rate": 0.00044470656066562336, "loss": 5.7932, "mean_token_accuracy": 0.16685343831777572, "num_tokens": 4035359.0, "step": 1685 }, { "entropy": 6.005310583114624, "epoch": 0.10866070854497524, "grad_norm": 1.0234375, "learning_rate": 0.0004439307160344765, "loss": 5.7503, "mean_token_accuracy": 0.16817554086446762, "num_tokens": 4047055.0, "step": 1690 }, { "entropy": 6.008270597457885, "epoch": 0.10898218993120298, "grad_norm": 1.078125, "learning_rate": 0.00044315024008241473, "loss": 5.7602, "mean_token_accuracy": 0.16708459556102753, "num_tokens": 4058231.0, "step": 1695 }, { "entropy": 5.912751865386963, "epoch": 0.10930367131743073, "grad_norm": 1.046875, "learning_rate": 0.0004423651542065806, "loss": 5.6617, "mean_token_accuracy": 0.17167637795209884, "num_tokens": 4071138.0, "step": 1700 }, { "entropy": 5.909320926666259, "epoch": 0.10962515270365845, "grad_norm": 1.078125, "learning_rate": 0.00044157547993050006, "loss": 5.6095, "mean_token_accuracy": 0.1787335529923439, "num_tokens": 4084144.0, "step": 1705 }, { "entropy": 5.895288896560669, "epoch": 0.1099466340898862, "grad_norm": 1.0390625, "learning_rate": 0.00044078123890349227, "loss": 5.6396, "mean_token_accuracy": 0.1743350476026535, "num_tokens": 4095828.0, "step": 1710 }, { "entropy": 5.958630466461182, "epoch": 0.11026811547611394, "grad_norm": 0.9921875, "learning_rate": 0.00043998245290007606, "loss": 5.7617, "mean_token_accuracy": 0.1587551474571228, "num_tokens": 4108463.0, "step": 1715 }, { "entropy": 5.90827522277832, "epoch": 0.11058959686234167, "grad_norm": 0.9453125, "learning_rate": 0.00043917914381937323, "loss": 5.6133, "mean_token_accuracy": 0.17577288746833802, "num_tokens": 4120153.0, "step": 1720 }, { "entropy": 5.952684164047241, "epoch": 0.11091107824856941, "grad_norm": 1.0546875, "learning_rate": 0.00043837133368450815, "loss": 5.6548, "mean_token_accuracy": 0.17637971192598342, "num_tokens": 4131684.0, "step": 1725 }, { "entropy": 5.95789852142334, "epoch": 0.11123255963479714, "grad_norm": 1.0859375, "learning_rate": 0.0004375590446420037, "loss": 5.7584, "mean_token_accuracy": 0.16837924271821975, "num_tokens": 4142757.0, "step": 1730 }, { "entropy": 5.962955284118652, "epoch": 0.11155404102102488, "grad_norm": 1.1328125, "learning_rate": 0.0004367422989611743, "loss": 5.7158, "mean_token_accuracy": 0.16554963290691377, "num_tokens": 4153892.0, "step": 1735 }, { "entropy": 5.933376312255859, "epoch": 0.11187552240725263, "grad_norm": 0.96484375, "learning_rate": 0.0004359211190335153, "loss": 5.7288, "mean_token_accuracy": 0.16116232872009278, "num_tokens": 4166534.0, "step": 1740 }, { "entropy": 5.9422413349151615, "epoch": 0.11219700379348035, "grad_norm": 1.0703125, "learning_rate": 0.00043509552737208923, "loss": 5.6579, "mean_token_accuracy": 0.1683451145887375, "num_tokens": 4178648.0, "step": 1745 }, { "entropy": 5.848151159286499, "epoch": 0.1125184851797081, "grad_norm": 0.97265625, "learning_rate": 0.00043426554661090853, "loss": 5.6261, "mean_token_accuracy": 0.17486759424209594, "num_tokens": 4191522.0, "step": 1750 }, { "entropy": 5.953406143188476, "epoch": 0.11283996656593583, "grad_norm": 0.96875, "learning_rate": 0.00043343119950431516, "loss": 5.6226, "mean_token_accuracy": 0.17257331013679506, "num_tokens": 4203900.0, "step": 1755 }, { "entropy": 5.861113119125366, "epoch": 0.11316144795216357, "grad_norm": 1.109375, "learning_rate": 0.00043259250892635644, "loss": 5.5864, "mean_token_accuracy": 0.17675792276859284, "num_tokens": 4214861.0, "step": 1760 }, { "entropy": 5.804804039001465, "epoch": 0.11348292933839131, "grad_norm": 0.9765625, "learning_rate": 0.0004317494978701582, "loss": 5.5351, "mean_token_accuracy": 0.1776354894042015, "num_tokens": 4227137.0, "step": 1765 }, { "entropy": 5.933787488937378, "epoch": 0.11380441072461904, "grad_norm": 0.8984375, "learning_rate": 0.0004309021894472943, "loss": 5.7155, "mean_token_accuracy": 0.1676717832684517, "num_tokens": 4239997.0, "step": 1770 }, { "entropy": 5.958622455596924, "epoch": 0.11412589211084678, "grad_norm": 0.9140625, "learning_rate": 0.0004300506068871534, "loss": 5.661, "mean_token_accuracy": 0.16713007688522338, "num_tokens": 4252556.0, "step": 1775 }, { "entropy": 5.792713975906372, "epoch": 0.11444737349707453, "grad_norm": 0.90625, "learning_rate": 0.00042919477353630135, "loss": 5.639, "mean_token_accuracy": 0.1729072615504265, "num_tokens": 4265702.0, "step": 1780 }, { "entropy": 5.8895658493042, "epoch": 0.11476885488330225, "grad_norm": 1.0078125, "learning_rate": 0.000428334712857842, "loss": 5.6602, "mean_token_accuracy": 0.17446050494909288, "num_tokens": 4278244.0, "step": 1785 }, { "entropy": 5.912885761260986, "epoch": 0.11509033626953, "grad_norm": 1.0390625, "learning_rate": 0.00042747044843077304, "loss": 5.6157, "mean_token_accuracy": 0.17406022995710374, "num_tokens": 4290242.0, "step": 1790 }, { "entropy": 5.925296115875244, "epoch": 0.11541181765575773, "grad_norm": 1.03125, "learning_rate": 0.00042660200394934047, "loss": 5.8008, "mean_token_accuracy": 0.16324599087238312, "num_tokens": 4303198.0, "step": 1795 }, { "entropy": 5.972964572906494, "epoch": 0.11573329904198547, "grad_norm": 1.1015625, "learning_rate": 0.00042572940322238844, "loss": 5.7539, "mean_token_accuracy": 0.16906532049179077, "num_tokens": 4316389.0, "step": 1800 }, { "entropy": 5.867070102691651, "epoch": 0.11605478042821321, "grad_norm": 0.9765625, "learning_rate": 0.00042485267017270664, "loss": 5.6284, "mean_token_accuracy": 0.17795921117067337, "num_tokens": 4329829.0, "step": 1805 }, { "entropy": 5.836501359939575, "epoch": 0.11637626181444094, "grad_norm": 1.0234375, "learning_rate": 0.0004239718288363745, "loss": 5.5708, "mean_token_accuracy": 0.1804552987217903, "num_tokens": 4342024.0, "step": 1810 }, { "entropy": 5.882567024230957, "epoch": 0.11669774320066868, "grad_norm": 1.015625, "learning_rate": 0.0004230869033621023, "loss": 5.6703, "mean_token_accuracy": 0.16930529624223709, "num_tokens": 4355575.0, "step": 1815 }, { "entropy": 5.800036668777466, "epoch": 0.11701922458689643, "grad_norm": 0.9921875, "learning_rate": 0.0004221979180105688, "loss": 5.5661, "mean_token_accuracy": 0.17972640544176102, "num_tokens": 4368461.0, "step": 1820 }, { "entropy": 5.918715858459473, "epoch": 0.11734070597312415, "grad_norm": 0.94140625, "learning_rate": 0.00042130489715375645, "loss": 5.6427, "mean_token_accuracy": 0.17834917455911636, "num_tokens": 4380483.0, "step": 1825 }, { "entropy": 5.868259286880493, "epoch": 0.1176621873593519, "grad_norm": 0.953125, "learning_rate": 0.00042040786527428335, "loss": 5.6284, "mean_token_accuracy": 0.16914028078317642, "num_tokens": 4393823.0, "step": 1830 }, { "entropy": 5.887679815292358, "epoch": 0.11798366874557963, "grad_norm": 0.9765625, "learning_rate": 0.0004195068469647315, "loss": 5.6887, "mean_token_accuracy": 0.1705163061618805, "num_tokens": 4405230.0, "step": 1835 }, { "entropy": 5.95110125541687, "epoch": 0.11830515013180737, "grad_norm": 1.015625, "learning_rate": 0.00041860186692697297, "loss": 5.626, "mean_token_accuracy": 0.17905376702547074, "num_tokens": 4416638.0, "step": 1840 }, { "entropy": 5.80819149017334, "epoch": 0.11862663151803511, "grad_norm": 1.0078125, "learning_rate": 0.00041769294997149264, "loss": 5.5459, "mean_token_accuracy": 0.1780714675784111, "num_tokens": 4428778.0, "step": 1845 }, { "entropy": 5.8609541893005375, "epoch": 0.11894811290426284, "grad_norm": 1.0625, "learning_rate": 0.0004167801210167081, "loss": 5.5975, "mean_token_accuracy": 0.17223136574029924, "num_tokens": 4440698.0, "step": 1850 }, { "entropy": 5.850246858596802, "epoch": 0.11926959429049058, "grad_norm": 1.1328125, "learning_rate": 0.0004158634050882861, "loss": 5.6452, "mean_token_accuracy": 0.17951953709125518, "num_tokens": 4451867.0, "step": 1855 }, { "entropy": 5.898460865020752, "epoch": 0.11959107567671831, "grad_norm": 1.0234375, "learning_rate": 0.0004149428273184569, "loss": 5.6622, "mean_token_accuracy": 0.16997012495994568, "num_tokens": 4464111.0, "step": 1860 }, { "entropy": 6.0535829067230225, "epoch": 0.11991255706294605, "grad_norm": 1.078125, "learning_rate": 0.0004140184129453253, "loss": 5.8647, "mean_token_accuracy": 0.1605095535516739, "num_tokens": 4476378.0, "step": 1865 }, { "entropy": 5.918209362030029, "epoch": 0.1202340384491738, "grad_norm": 0.94921875, "learning_rate": 0.000413090187312178, "loss": 5.6126, "mean_token_accuracy": 0.17721273005008698, "num_tokens": 4488714.0, "step": 1870 }, { "entropy": 5.869247961044311, "epoch": 0.12055551983540153, "grad_norm": 1.0859375, "learning_rate": 0.0004121581758667898, "loss": 5.6413, "mean_token_accuracy": 0.17850209176540374, "num_tokens": 4500168.0, "step": 1875 }, { "entropy": 5.9244630336761475, "epoch": 0.12087700122162927, "grad_norm": 1.015625, "learning_rate": 0.00041122240416072533, "loss": 5.6474, "mean_token_accuracy": 0.17328109741210937, "num_tokens": 4511792.0, "step": 1880 }, { "entropy": 5.839860105514527, "epoch": 0.12119848260785701, "grad_norm": 1.09375, "learning_rate": 0.0004102828978486385, "loss": 5.5932, "mean_token_accuracy": 0.18388805836439132, "num_tokens": 4522314.0, "step": 1885 }, { "entropy": 5.965823554992676, "epoch": 0.12151996399408474, "grad_norm": 0.921875, "learning_rate": 0.0004093396826875695, "loss": 5.5762, "mean_token_accuracy": 0.16557498574256896, "num_tokens": 4534827.0, "step": 1890 }, { "entropy": 5.761017513275147, "epoch": 0.12184144538031248, "grad_norm": 1.0390625, "learning_rate": 0.00040839278453623837, "loss": 5.4789, "mean_token_accuracy": 0.17830830216407775, "num_tokens": 4546730.0, "step": 1895 }, { "entropy": 5.70470962524414, "epoch": 0.12216292676654021, "grad_norm": 1.15625, "learning_rate": 0.0004074422293543363, "loss": 5.5623, "mean_token_accuracy": 0.1807377517223358, "num_tokens": 4557573.0, "step": 1900 }, { "entropy": 5.9006062030792235, "epoch": 0.12248440815276795, "grad_norm": 0.921875, "learning_rate": 0.0004064880432018137, "loss": 5.6343, "mean_token_accuracy": 0.174290831387043, "num_tokens": 4570238.0, "step": 1905 }, { "entropy": 5.864686441421509, "epoch": 0.1228058895389957, "grad_norm": 1.125, "learning_rate": 0.00040553025223816615, "loss": 5.6814, "mean_token_accuracy": 0.1700124755501747, "num_tokens": 4583007.0, "step": 1910 }, { "entropy": 5.936568975448608, "epoch": 0.12312737092522343, "grad_norm": 1.046875, "learning_rate": 0.00040456888272171653, "loss": 5.6154, "mean_token_accuracy": 0.16709319800138472, "num_tokens": 4594224.0, "step": 1915 }, { "entropy": 5.852287435531617, "epoch": 0.12344885231145117, "grad_norm": 1.0, "learning_rate": 0.00040360396100889577, "loss": 5.6582, "mean_token_accuracy": 0.17214078456163406, "num_tokens": 4606092.0, "step": 1920 }, { "entropy": 5.904173707962036, "epoch": 0.12377033369767891, "grad_norm": 1.1171875, "learning_rate": 0.0004026355135535202, "loss": 5.6247, "mean_token_accuracy": 0.17527548372745513, "num_tokens": 4616751.0, "step": 1925 }, { "entropy": 5.864779424667359, "epoch": 0.12409181508390664, "grad_norm": 0.9140625, "learning_rate": 0.000401663566906066, "loss": 5.647, "mean_token_accuracy": 0.17503723949193956, "num_tokens": 4629497.0, "step": 1930 }, { "entropy": 5.880205869674683, "epoch": 0.12441329647013438, "grad_norm": 1.0390625, "learning_rate": 0.00040068814771294134, "loss": 5.625, "mean_token_accuracy": 0.17394295632839202, "num_tokens": 4641070.0, "step": 1935 }, { "entropy": 5.814072561264038, "epoch": 0.12473477785636211, "grad_norm": 1.1015625, "learning_rate": 0.0003997092827157562, "loss": 5.602, "mean_token_accuracy": 0.1692856341600418, "num_tokens": 4653813.0, "step": 1940 }, { "entropy": 5.759505414962769, "epoch": 0.12505625924258987, "grad_norm": 1.0625, "learning_rate": 0.000398726998750589, "loss": 5.56, "mean_token_accuracy": 0.1789846494793892, "num_tokens": 4665865.0, "step": 1945 }, { "entropy": 5.860892677307129, "epoch": 0.1253777406288176, "grad_norm": 1.0703125, "learning_rate": 0.00039774132274725076, "loss": 5.6134, "mean_token_accuracy": 0.17644744664430617, "num_tokens": 4678841.0, "step": 1950 }, { "entropy": 5.835351991653442, "epoch": 0.12569922201504533, "grad_norm": 1.0234375, "learning_rate": 0.00039675228172854707, "loss": 5.569, "mean_token_accuracy": 0.17764328867197038, "num_tokens": 4691204.0, "step": 1955 }, { "entropy": 5.906078720092774, "epoch": 0.12602070340127305, "grad_norm": 0.9765625, "learning_rate": 0.0003957599028095371, "loss": 5.5548, "mean_token_accuracy": 0.18006090223789215, "num_tokens": 4702379.0, "step": 1960 }, { "entropy": 5.812206029891968, "epoch": 0.1263421847875008, "grad_norm": 0.93359375, "learning_rate": 0.00039476421319679017, "loss": 5.5982, "mean_token_accuracy": 0.1708923801779747, "num_tokens": 4714737.0, "step": 1965 }, { "entropy": 5.948781299591064, "epoch": 0.12666366617372854, "grad_norm": 1.0390625, "learning_rate": 0.00039376524018764, "loss": 5.6617, "mean_token_accuracy": 0.16960146874189377, "num_tokens": 4726653.0, "step": 1970 }, { "entropy": 5.826849174499512, "epoch": 0.12698514755995627, "grad_norm": 1.0859375, "learning_rate": 0.00039276301116943616, "loss": 5.5537, "mean_token_accuracy": 0.1792762890458107, "num_tokens": 4738989.0, "step": 1975 }, { "entropy": 5.8345729351043705, "epoch": 0.12730662894618403, "grad_norm": 0.953125, "learning_rate": 0.0003917575536187936, "loss": 5.4978, "mean_token_accuracy": 0.18163758963346482, "num_tokens": 4750493.0, "step": 1980 }, { "entropy": 5.797660684585571, "epoch": 0.12762811033241175, "grad_norm": 1.015625, "learning_rate": 0.00039074889510083894, "loss": 5.5225, "mean_token_accuracy": 0.17844658195972443, "num_tokens": 4763240.0, "step": 1985 }, { "entropy": 5.834128379821777, "epoch": 0.12794959171863948, "grad_norm": 1.1484375, "learning_rate": 0.00038973706326845495, "loss": 5.5719, "mean_token_accuracy": 0.18070205599069594, "num_tokens": 4774804.0, "step": 1990 }, { "entropy": 5.8326366424560545, "epoch": 0.12827107310486724, "grad_norm": 0.99609375, "learning_rate": 0.0003887220858615225, "loss": 5.6495, "mean_token_accuracy": 0.17115117609500885, "num_tokens": 4788684.0, "step": 1995 }, { "entropy": 5.905576086044311, "epoch": 0.12859255449109497, "grad_norm": 1.2109375, "learning_rate": 0.0003877039907061597, "loss": 5.6195, "mean_token_accuracy": 0.17407953292131423, "num_tokens": 4799819.0, "step": 2000 }, { "entropy": 5.870160961151123, "epoch": 0.1289140358773227, "grad_norm": 0.953125, "learning_rate": 0.0003866828057139598, "loss": 5.6052, "mean_token_accuracy": 0.17627264708280563, "num_tokens": 4811466.0, "step": 2005 }, { "entropy": 5.760121917724609, "epoch": 0.12923551726355045, "grad_norm": 1.0625, "learning_rate": 0.00038565855888122503, "loss": 5.5037, "mean_token_accuracy": 0.18457890152931214, "num_tokens": 4824457.0, "step": 2010 }, { "entropy": 5.774965858459472, "epoch": 0.12955699864977818, "grad_norm": 0.98828125, "learning_rate": 0.00038463127828819975, "loss": 5.5049, "mean_token_accuracy": 0.18251402527093888, "num_tokens": 4836717.0, "step": 2015 }, { "entropy": 5.847173833847046, "epoch": 0.1298784800360059, "grad_norm": 1.09375, "learning_rate": 0.00038360099209830043, "loss": 5.5599, "mean_token_accuracy": 0.17191230058670043, "num_tokens": 4849651.0, "step": 2020 }, { "entropy": 5.793238019943237, "epoch": 0.13019996142223364, "grad_norm": 1.0078125, "learning_rate": 0.0003825677285573433, "loss": 5.5407, "mean_token_accuracy": 0.17504116892814636, "num_tokens": 4861794.0, "step": 2025 }, { "entropy": 5.844627237319946, "epoch": 0.1305214428084614, "grad_norm": 0.9765625, "learning_rate": 0.00038153151599277027, "loss": 5.6574, "mean_token_accuracy": 0.17710692882537843, "num_tokens": 4874212.0, "step": 2030 }, { "entropy": 5.84494047164917, "epoch": 0.13084292419468913, "grad_norm": 1.2109375, "learning_rate": 0.0003804923828128723, "loss": 5.4783, "mean_token_accuracy": 0.1834234356880188, "num_tokens": 4884997.0, "step": 2035 }, { "entropy": 5.762919187545776, "epoch": 0.13116440558091685, "grad_norm": 1.0, "learning_rate": 0.0003794503575060104, "loss": 5.5529, "mean_token_accuracy": 0.18413533866405488, "num_tokens": 4896918.0, "step": 2040 }, { "entropy": 5.892176866531372, "epoch": 0.1314858869671446, "grad_norm": 1.1015625, "learning_rate": 0.00037840546863983484, "loss": 5.6243, "mean_token_accuracy": 0.17191017419099808, "num_tokens": 4909620.0, "step": 2045 }, { "entropy": 5.945382499694825, "epoch": 0.13180736835337234, "grad_norm": 1.21875, "learning_rate": 0.0003773577448605015, "loss": 5.6835, "mean_token_accuracy": 0.17257035672664642, "num_tokens": 4921607.0, "step": 2050 }, { "entropy": 5.779804420471192, "epoch": 0.13212884973960007, "grad_norm": 0.9140625, "learning_rate": 0.0003763072148918872, "loss": 5.5078, "mean_token_accuracy": 0.18294907361268997, "num_tokens": 4933940.0, "step": 2055 }, { "entropy": 5.8237223625183105, "epoch": 0.13245033112582782, "grad_norm": 1.0546875, "learning_rate": 0.0003752539075348017, "loss": 5.4828, "mean_token_accuracy": 0.1808870628476143, "num_tokens": 4945773.0, "step": 2060 }, { "entropy": 5.779390478134156, "epoch": 0.13277181251205555, "grad_norm": 1.0625, "learning_rate": 0.00037419785166619817, "loss": 5.5947, "mean_token_accuracy": 0.17565583139657975, "num_tokens": 4957376.0, "step": 2065 }, { "entropy": 5.813959360122681, "epoch": 0.13309329389828328, "grad_norm": 1.203125, "learning_rate": 0.0003731390762383818, "loss": 5.576, "mean_token_accuracy": 0.18291270285844802, "num_tokens": 4970421.0, "step": 2070 }, { "entropy": 5.725229263305664, "epoch": 0.13341477528451104, "grad_norm": 1.109375, "learning_rate": 0.0003720776102782158, "loss": 5.3501, "mean_token_accuracy": 0.19152092486619948, "num_tokens": 4981342.0, "step": 2075 }, { "entropy": 5.7584638595581055, "epoch": 0.13373625667073877, "grad_norm": 1.09375, "learning_rate": 0.00037101348288632555, "loss": 5.6146, "mean_token_accuracy": 0.17571116387844085, "num_tokens": 4992622.0, "step": 2080 }, { "entropy": 5.923141145706177, "epoch": 0.1340577380569665, "grad_norm": 1.0546875, "learning_rate": 0.0003699467232363012, "loss": 5.6139, "mean_token_accuracy": 0.17595019936561584, "num_tokens": 5004362.0, "step": 2085 }, { "entropy": 5.818864965438843, "epoch": 0.13437921944319423, "grad_norm": 1.03125, "learning_rate": 0.0003688773605738973, "loss": 5.6126, "mean_token_accuracy": 0.17965741753578185, "num_tokens": 5016389.0, "step": 2090 }, { "entropy": 5.793763065338135, "epoch": 0.13470070082942198, "grad_norm": 0.9296875, "learning_rate": 0.00036780542421623134, "loss": 5.4654, "mean_token_accuracy": 0.18796980381011963, "num_tokens": 5027988.0, "step": 2095 }, { "entropy": 5.777286338806152, "epoch": 0.1350221822156497, "grad_norm": 1.078125, "learning_rate": 0.0003667309435509802, "loss": 5.5386, "mean_token_accuracy": 0.1804940417408943, "num_tokens": 5039236.0, "step": 2100 }, { "entropy": 5.817455434799195, "epoch": 0.13534366360187744, "grad_norm": 1.15625, "learning_rate": 0.0003656539480355741, "loss": 5.4384, "mean_token_accuracy": 0.18993795216083526, "num_tokens": 5050198.0, "step": 2105 }, { "entropy": 5.810271120071411, "epoch": 0.1356651449881052, "grad_norm": 0.96484375, "learning_rate": 0.0003645744671963891, "loss": 5.5312, "mean_token_accuracy": 0.18325352519750596, "num_tokens": 5063493.0, "step": 2110 }, { "entropy": 5.786569452285766, "epoch": 0.13598662637433293, "grad_norm": 1.203125, "learning_rate": 0.0003634925306279376, "loss": 5.4097, "mean_token_accuracy": 0.19001378118991852, "num_tokens": 5075451.0, "step": 2115 }, { "entropy": 5.784157466888428, "epoch": 0.13630810776056065, "grad_norm": 1.078125, "learning_rate": 0.0003624081679920574, "loss": 5.5803, "mean_token_accuracy": 0.18124087005853654, "num_tokens": 5088354.0, "step": 2120 }, { "entropy": 5.815143823623657, "epoch": 0.1366295891467884, "grad_norm": 1.03125, "learning_rate": 0.0003613214090170977, "loss": 5.51, "mean_token_accuracy": 0.180302757024765, "num_tokens": 5099525.0, "step": 2125 }, { "entropy": 5.878709602355957, "epoch": 0.13695107053301614, "grad_norm": 0.98828125, "learning_rate": 0.0003602322834971048, "loss": 5.6666, "mean_token_accuracy": 0.17189718186855316, "num_tokens": 5112304.0, "step": 2130 }, { "entropy": 5.723003339767456, "epoch": 0.13727255191924387, "grad_norm": 1.109375, "learning_rate": 0.0003591408212910051, "loss": 5.4404, "mean_token_accuracy": 0.1870084896683693, "num_tokens": 5124662.0, "step": 2135 }, { "entropy": 5.788280439376831, "epoch": 0.13759403330547162, "grad_norm": 1.078125, "learning_rate": 0.0003580470523217863, "loss": 5.5564, "mean_token_accuracy": 0.17349497675895692, "num_tokens": 5136012.0, "step": 2140 }, { "entropy": 5.790732574462891, "epoch": 0.13791551469169935, "grad_norm": 0.9921875, "learning_rate": 0.0003569510065756771, "loss": 5.5504, "mean_token_accuracy": 0.17855857610702514, "num_tokens": 5147777.0, "step": 2145 }, { "entropy": 5.7518140316009525, "epoch": 0.13823699607792708, "grad_norm": 0.9296875, "learning_rate": 0.0003558527141013254, "loss": 5.5611, "mean_token_accuracy": 0.17851039618253708, "num_tokens": 5160246.0, "step": 2150 }, { "entropy": 5.826988935470581, "epoch": 0.13855847746415484, "grad_norm": 1.03125, "learning_rate": 0.0003547522050089742, "loss": 5.5531, "mean_token_accuracy": 0.18062776178121567, "num_tokens": 5172077.0, "step": 2155 }, { "entropy": 5.7975584983825685, "epoch": 0.13887995885038257, "grad_norm": 1.015625, "learning_rate": 0.00035364950946963606, "loss": 5.4927, "mean_token_accuracy": 0.18591260462999343, "num_tokens": 5182961.0, "step": 2160 }, { "entropy": 5.7447662353515625, "epoch": 0.1392014402366103, "grad_norm": 1.03125, "learning_rate": 0.0003525446577142663, "loss": 5.5275, "mean_token_accuracy": 0.18384548872709275, "num_tokens": 5195675.0, "step": 2165 }, { "entropy": 5.823494243621826, "epoch": 0.13952292162283803, "grad_norm": 1.0078125, "learning_rate": 0.00035143768003293395, "loss": 5.5203, "mean_token_accuracy": 0.1787479281425476, "num_tokens": 5207385.0, "step": 2170 }, { "entropy": 5.829427433013916, "epoch": 0.13984440300906578, "grad_norm": 1.0859375, "learning_rate": 0.0003503286067739913, "loss": 5.5229, "mean_token_accuracy": 0.17892941683530808, "num_tokens": 5219546.0, "step": 2175 }, { "entropy": 5.745072078704834, "epoch": 0.1401658843952935, "grad_norm": 1.1328125, "learning_rate": 0.00034921746834324193, "loss": 5.4045, "mean_token_accuracy": 0.19110034853219987, "num_tokens": 5231175.0, "step": 2180 }, { "entropy": 5.70222487449646, "epoch": 0.14048736578152124, "grad_norm": 1.1640625, "learning_rate": 0.0003481042952031072, "loss": 5.5087, "mean_token_accuracy": 0.18616049289703368, "num_tokens": 5242164.0, "step": 2185 }, { "entropy": 5.73668909072876, "epoch": 0.140808847167749, "grad_norm": 1.0234375, "learning_rate": 0.0003469891178717911, "loss": 5.4051, "mean_token_accuracy": 0.18240442574024202, "num_tokens": 5254798.0, "step": 2190 }, { "entropy": 5.7363566875457765, "epoch": 0.14113032855397672, "grad_norm": 1.1953125, "learning_rate": 0.0003458719669224436, "loss": 5.498, "mean_token_accuracy": 0.18667046278715133, "num_tokens": 5267540.0, "step": 2195 }, { "entropy": 5.820670938491821, "epoch": 0.14145180994020445, "grad_norm": 1.0, "learning_rate": 0.0003447528729823221, "loss": 5.5249, "mean_token_accuracy": 0.17592255622148514, "num_tokens": 5280283.0, "step": 2200 }, { "entropy": 5.783896446228027, "epoch": 0.1417732913264322, "grad_norm": 1.0234375, "learning_rate": 0.0003436318667319525, "loss": 5.6086, "mean_token_accuracy": 0.1798434942960739, "num_tokens": 5294247.0, "step": 2205 }, { "entropy": 5.8498693943023685, "epoch": 0.14209477271265994, "grad_norm": 1.015625, "learning_rate": 0.00034250897890428716, "loss": 5.6342, "mean_token_accuracy": 0.17710212022066116, "num_tokens": 5307155.0, "step": 2210 }, { "entropy": 5.781178283691406, "epoch": 0.14241625409888767, "grad_norm": 1.03125, "learning_rate": 0.0003413842402838633, "loss": 5.5309, "mean_token_accuracy": 0.18046447187662124, "num_tokens": 5320103.0, "step": 2215 }, { "entropy": 5.801876544952393, "epoch": 0.14273773548511542, "grad_norm": 1.0390625, "learning_rate": 0.00034025768170595834, "loss": 5.4789, "mean_token_accuracy": 0.18139876872301103, "num_tokens": 5332919.0, "step": 2220 }, { "entropy": 5.8165970802307125, "epoch": 0.14305921687134315, "grad_norm": 1.03125, "learning_rate": 0.0003391293340557446, "loss": 5.5771, "mean_token_accuracy": 0.1808025971055031, "num_tokens": 5345028.0, "step": 2225 }, { "entropy": 5.770275068283081, "epoch": 0.14338069825757088, "grad_norm": 0.91796875, "learning_rate": 0.0003379992282674431, "loss": 5.4752, "mean_token_accuracy": 0.18268953412771224, "num_tokens": 5358345.0, "step": 2230 }, { "entropy": 5.736183929443359, "epoch": 0.1437021796437986, "grad_norm": 1.015625, "learning_rate": 0.0003368673953234749, "loss": 5.5918, "mean_token_accuracy": 0.17822258472442626, "num_tokens": 5371968.0, "step": 2235 }, { "entropy": 5.785114908218384, "epoch": 0.14402366103002637, "grad_norm": 1.0234375, "learning_rate": 0.00033573386625361176, "loss": 5.396, "mean_token_accuracy": 0.19062534272670745, "num_tokens": 5383598.0, "step": 2240 }, { "entropy": 5.721212577819824, "epoch": 0.1443451424162541, "grad_norm": 1.1015625, "learning_rate": 0.00033459867213412567, "loss": 5.468, "mean_token_accuracy": 0.18324747383594514, "num_tokens": 5394895.0, "step": 2245 }, { "entropy": 5.811119604110718, "epoch": 0.14466662380248183, "grad_norm": 1.2578125, "learning_rate": 0.000333461844086937, "loss": 5.6338, "mean_token_accuracy": 0.1801897630095482, "num_tokens": 5406048.0, "step": 2250 }, { "entropy": 5.779982805252075, "epoch": 0.14498810518870958, "grad_norm": 1.0390625, "learning_rate": 0.00033232341327876097, "loss": 5.4517, "mean_token_accuracy": 0.1839503049850464, "num_tokens": 5417497.0, "step": 2255 }, { "entropy": 5.738992214202881, "epoch": 0.1453095865749373, "grad_norm": 1.0234375, "learning_rate": 0.0003311834109202531, "loss": 5.4578, "mean_token_accuracy": 0.18271873742341996, "num_tokens": 5429372.0, "step": 2260 }, { "entropy": 5.702697610855102, "epoch": 0.14563106796116504, "grad_norm": 0.94921875, "learning_rate": 0.00033004186826515416, "loss": 5.4782, "mean_token_accuracy": 0.18308925479650498, "num_tokens": 5442687.0, "step": 2265 }, { "entropy": 5.73618860244751, "epoch": 0.1459525493473928, "grad_norm": 0.97265625, "learning_rate": 0.0003288988166094324, "loss": 5.3735, "mean_token_accuracy": 0.1941055417060852, "num_tokens": 5455750.0, "step": 2270 }, { "entropy": 5.719181156158447, "epoch": 0.14627403073362052, "grad_norm": 1.203125, "learning_rate": 0.00032775428729042656, "loss": 5.5103, "mean_token_accuracy": 0.18479931950569153, "num_tokens": 5468591.0, "step": 2275 }, { "entropy": 5.760000133514405, "epoch": 0.14659551211984825, "grad_norm": 1.0390625, "learning_rate": 0.000326608311685986, "loss": 5.4651, "mean_token_accuracy": 0.18513359725475312, "num_tokens": 5481351.0, "step": 2280 }, { "entropy": 5.824754238128662, "epoch": 0.146916993506076, "grad_norm": 1.0234375, "learning_rate": 0.0003254609212136108, "loss": 5.4828, "mean_token_accuracy": 0.18338652700185776, "num_tokens": 5493139.0, "step": 2285 }, { "entropy": 5.785252857208252, "epoch": 0.14723847489230374, "grad_norm": 1.078125, "learning_rate": 0.00032431214732959036, "loss": 5.5359, "mean_token_accuracy": 0.18975124210119249, "num_tokens": 5504614.0, "step": 2290 }, { "entropy": 5.731715106964112, "epoch": 0.14755995627853147, "grad_norm": 0.96875, "learning_rate": 0.000323162021528141, "loss": 5.4441, "mean_token_accuracy": 0.18522145450115204, "num_tokens": 5516963.0, "step": 2295 }, { "entropy": 5.819196319580078, "epoch": 0.1478814376647592, "grad_norm": 1.0859375, "learning_rate": 0.00032201057534054264, "loss": 5.5477, "mean_token_accuracy": 0.17677218914031984, "num_tokens": 5529419.0, "step": 2300 }, { "entropy": 5.776256513595581, "epoch": 0.14820291905098695, "grad_norm": 1.046875, "learning_rate": 0.00032085784033427414, "loss": 5.4768, "mean_token_accuracy": 0.18908895701169967, "num_tokens": 5540341.0, "step": 2305 }, { "entropy": 5.751850175857544, "epoch": 0.14852440043721468, "grad_norm": 1.03125, "learning_rate": 0.0003197038481121478, "loss": 5.5298, "mean_token_accuracy": 0.17606374025344848, "num_tokens": 5552402.0, "step": 2310 }, { "entropy": 5.883427524566651, "epoch": 0.1488458818234424, "grad_norm": 1.1484375, "learning_rate": 0.0003185486303114436, "loss": 5.6783, "mean_token_accuracy": 0.17739115804433822, "num_tokens": 5564309.0, "step": 2315 }, { "entropy": 5.754642295837402, "epoch": 0.14916736320967017, "grad_norm": 0.9921875, "learning_rate": 0.0003173922186030409, "loss": 5.4743, "mean_token_accuracy": 0.18725920021533965, "num_tokens": 5576305.0, "step": 2320 }, { "entropy": 5.681988668441773, "epoch": 0.1494888445958979, "grad_norm": 0.96875, "learning_rate": 0.000316234644690551, "loss": 5.3909, "mean_token_accuracy": 0.18984435945749284, "num_tokens": 5587629.0, "step": 2325 }, { "entropy": 5.764342403411865, "epoch": 0.14981032598212563, "grad_norm": 1.0703125, "learning_rate": 0.0003150759403094473, "loss": 5.4833, "mean_token_accuracy": 0.18134974241256713, "num_tokens": 5599459.0, "step": 2330 }, { "entropy": 5.769356298446655, "epoch": 0.15013180736835338, "grad_norm": 1.0703125, "learning_rate": 0.00031391613722619587, "loss": 5.3992, "mean_token_accuracy": 0.1888190746307373, "num_tokens": 5610324.0, "step": 2335 }, { "entropy": 5.657149076461792, "epoch": 0.1504532887545811, "grad_norm": 0.91796875, "learning_rate": 0.000312755267237384, "loss": 5.3883, "mean_token_accuracy": 0.19171329736709594, "num_tokens": 5622655.0, "step": 2340 }, { "entropy": 5.757540702819824, "epoch": 0.15077477014080884, "grad_norm": 1.1171875, "learning_rate": 0.0003115933621688488, "loss": 5.4886, "mean_token_accuracy": 0.1828450933098793, "num_tokens": 5634645.0, "step": 2345 }, { "entropy": 5.745415258407593, "epoch": 0.1510962515270366, "grad_norm": 1.015625, "learning_rate": 0.00031043045387480487, "loss": 5.443, "mean_token_accuracy": 0.18682096749544144, "num_tokens": 5646868.0, "step": 2350 }, { "entropy": 5.6784426212310795, "epoch": 0.15141773291326432, "grad_norm": 0.953125, "learning_rate": 0.0003092665742369703, "loss": 5.4126, "mean_token_accuracy": 0.18253785818815232, "num_tokens": 5659555.0, "step": 2355 }, { "entropy": 5.772103643417358, "epoch": 0.15173921429949205, "grad_norm": 1.0390625, "learning_rate": 0.00030810175516369343, "loss": 5.4386, "mean_token_accuracy": 0.19016828536987304, "num_tokens": 5671718.0, "step": 2360 }, { "entropy": 5.7293273448944095, "epoch": 0.1520606956857198, "grad_norm": 1.0546875, "learning_rate": 0.0003069360285890775, "loss": 5.4382, "mean_token_accuracy": 0.1862625375390053, "num_tokens": 5685121.0, "step": 2365 }, { "entropy": 5.710463333129883, "epoch": 0.15238217707194754, "grad_norm": 1.1328125, "learning_rate": 0.00030576942647210547, "loss": 5.4894, "mean_token_accuracy": 0.18526532351970673, "num_tokens": 5696646.0, "step": 2370 }, { "entropy": 5.8341999530792235, "epoch": 0.15270365845817527, "grad_norm": 1.109375, "learning_rate": 0.00030460198079576355, "loss": 5.5394, "mean_token_accuracy": 0.17606807351112366, "num_tokens": 5708529.0, "step": 2375 }, { "entropy": 5.805117750167847, "epoch": 0.153025139844403, "grad_norm": 0.9921875, "learning_rate": 0.0003034337235661648, "loss": 5.5085, "mean_token_accuracy": 0.18223248422145844, "num_tokens": 5720655.0, "step": 2380 }, { "entropy": 5.740260791778565, "epoch": 0.15334662123063075, "grad_norm": 1.0, "learning_rate": 0.0003022646868116714, "loss": 5.5217, "mean_token_accuracy": 0.18677257746458054, "num_tokens": 5734026.0, "step": 2385 }, { "entropy": 5.762510967254639, "epoch": 0.15366810261685848, "grad_norm": 1.0234375, "learning_rate": 0.0003010949025820163, "loss": 5.3718, "mean_token_accuracy": 0.1946680411696434, "num_tokens": 5745780.0, "step": 2390 }, { "entropy": 5.653225946426391, "epoch": 0.1539895840030862, "grad_norm": 1.0546875, "learning_rate": 0.0002999244029474252, "loss": 5.4089, "mean_token_accuracy": 0.1960905224084854, "num_tokens": 5757366.0, "step": 2395 }, { "entropy": 5.693793201446534, "epoch": 0.15431106538931397, "grad_norm": 0.97265625, "learning_rate": 0.00029875321999773684, "loss": 5.4323, "mean_token_accuracy": 0.18601686954498292, "num_tokens": 5770233.0, "step": 2400 }, { "entropy": 5.744156837463379, "epoch": 0.1546325467755417, "grad_norm": 0.99609375, "learning_rate": 0.00029758138584152333, "loss": 5.488, "mean_token_accuracy": 0.18518585562705994, "num_tokens": 5782594.0, "step": 2405 }, { "entropy": 5.776286935806274, "epoch": 0.15495402816176942, "grad_norm": 0.90625, "learning_rate": 0.0002964089326052102, "loss": 5.4478, "mean_token_accuracy": 0.19138861447572708, "num_tokens": 5796483.0, "step": 2410 }, { "entropy": 5.827335071563721, "epoch": 0.15527550954799718, "grad_norm": 1.09375, "learning_rate": 0.0002952358924321949, "loss": 5.5183, "mean_token_accuracy": 0.18744486421346665, "num_tokens": 5808462.0, "step": 2415 }, { "entropy": 5.747323989868164, "epoch": 0.1555969909342249, "grad_norm": 1.03125, "learning_rate": 0.00029406229748196657, "loss": 5.4604, "mean_token_accuracy": 0.18579795807600022, "num_tokens": 5819337.0, "step": 2420 }, { "entropy": 5.727008581161499, "epoch": 0.15591847232045264, "grad_norm": 1.0234375, "learning_rate": 0.0002928881799292235, "loss": 5.3936, "mean_token_accuracy": 0.19244006425142288, "num_tokens": 5830546.0, "step": 2425 }, { "entropy": 5.7133873462677, "epoch": 0.1562399537066804, "grad_norm": 1.046875, "learning_rate": 0.00029171357196299154, "loss": 5.3786, "mean_token_accuracy": 0.1822706028819084, "num_tokens": 5842737.0, "step": 2430 }, { "entropy": 5.68302960395813, "epoch": 0.15656143509290812, "grad_norm": 1.0390625, "learning_rate": 0.0002905385057857414, "loss": 5.4229, "mean_token_accuracy": 0.18687608242034912, "num_tokens": 5854411.0, "step": 2435 }, { "entropy": 5.785665130615234, "epoch": 0.15688291647913585, "grad_norm": 0.97265625, "learning_rate": 0.0002893630136125058, "loss": 5.443, "mean_token_accuracy": 0.1872907817363739, "num_tokens": 5866981.0, "step": 2440 }, { "entropy": 5.7371235370635985, "epoch": 0.15720439786536358, "grad_norm": 0.96875, "learning_rate": 0.0002881871276699967, "loss": 5.4436, "mean_token_accuracy": 0.1881553366780281, "num_tokens": 5879892.0, "step": 2445 }, { "entropy": 5.744434881210327, "epoch": 0.15752587925159134, "grad_norm": 1.03125, "learning_rate": 0.00028701088019572114, "loss": 5.443, "mean_token_accuracy": 0.19242127984762192, "num_tokens": 5892721.0, "step": 2450 }, { "entropy": 5.79182014465332, "epoch": 0.15784736063781907, "grad_norm": 1.3125, "learning_rate": 0.0002858343034370977, "loss": 5.4938, "mean_token_accuracy": 0.1780470922589302, "num_tokens": 5903582.0, "step": 2455 }, { "entropy": 5.704325819015503, "epoch": 0.1581688420240468, "grad_norm": 1.0546875, "learning_rate": 0.00028465742965057267, "loss": 5.4225, "mean_token_accuracy": 0.18842038363218308, "num_tokens": 5915520.0, "step": 2460 }, { "entropy": 5.7458555698394775, "epoch": 0.15849032341027455, "grad_norm": 0.99609375, "learning_rate": 0.00028348029110073533, "loss": 5.3892, "mean_token_accuracy": 0.19154608100652695, "num_tokens": 5926795.0, "step": 2465 }, { "entropy": 5.652383852005005, "epoch": 0.15881180479650228, "grad_norm": 1.109375, "learning_rate": 0.00028230292005943365, "loss": 5.3814, "mean_token_accuracy": 0.19180724918842315, "num_tokens": 5938985.0, "step": 2470 }, { "entropy": 5.769040584564209, "epoch": 0.15913328618273, "grad_norm": 1.046875, "learning_rate": 0.00028112534880488945, "loss": 5.4256, "mean_token_accuracy": 0.18810439109802246, "num_tokens": 5950047.0, "step": 2475 }, { "entropy": 5.7024431228637695, "epoch": 0.15945476756895777, "grad_norm": 1.046875, "learning_rate": 0.0002799476096208137, "loss": 5.396, "mean_token_accuracy": 0.18664792329072952, "num_tokens": 5962202.0, "step": 2480 }, { "entropy": 5.6790430545806885, "epoch": 0.1597762489551855, "grad_norm": 1.0546875, "learning_rate": 0.00027876973479552087, "loss": 5.4157, "mean_token_accuracy": 0.1834772288799286, "num_tokens": 5974519.0, "step": 2485 }, { "entropy": 5.787295770645142, "epoch": 0.16009773034141322, "grad_norm": 1.1015625, "learning_rate": 0.00027759175662104424, "loss": 5.4769, "mean_token_accuracy": 0.1819728434085846, "num_tokens": 5986863.0, "step": 2490 }, { "entropy": 5.736282396316528, "epoch": 0.16041921172764098, "grad_norm": 0.9609375, "learning_rate": 0.0002764137073922508, "loss": 5.4371, "mean_token_accuracy": 0.19367015659809111, "num_tokens": 5999187.0, "step": 2495 }, { "entropy": 5.623657894134522, "epoch": 0.1607406931138687, "grad_norm": 1.0546875, "learning_rate": 0.00027523561940595505, "loss": 5.4013, "mean_token_accuracy": 0.19085921943187714, "num_tokens": 6011304.0, "step": 2500 }, { "entropy": 5.757048940658569, "epoch": 0.16106217450009644, "grad_norm": 0.984375, "learning_rate": 0.0002740575249600342, "loss": 5.4342, "mean_token_accuracy": 0.18263567388057708, "num_tokens": 6023371.0, "step": 2505 }, { "entropy": 5.774210119247437, "epoch": 0.1613836558863242, "grad_norm": 0.98046875, "learning_rate": 0.00027287945635254263, "loss": 5.5002, "mean_token_accuracy": 0.18891827315092086, "num_tokens": 6035169.0, "step": 2510 }, { "entropy": 5.745975303649902, "epoch": 0.16170513727255192, "grad_norm": 0.99609375, "learning_rate": 0.00027170144588082635, "loss": 5.4882, "mean_token_accuracy": 0.18472196459770202, "num_tokens": 6047484.0, "step": 2515 }, { "entropy": 5.826107740402222, "epoch": 0.16202661865877965, "grad_norm": 1.1015625, "learning_rate": 0.00027052352584063763, "loss": 5.5828, "mean_token_accuracy": 0.1836489662528038, "num_tokens": 6060321.0, "step": 2520 }, { "entropy": 5.700526762008667, "epoch": 0.16234810004500738, "grad_norm": 1.1171875, "learning_rate": 0.00026934572852524907, "loss": 5.3282, "mean_token_accuracy": 0.19790842682123183, "num_tokens": 6071283.0, "step": 2525 }, { "entropy": 5.678812551498413, "epoch": 0.16266958143123514, "grad_norm": 0.98046875, "learning_rate": 0.00026816808622456937, "loss": 5.3668, "mean_token_accuracy": 0.19255405217409133, "num_tokens": 6083181.0, "step": 2530 }, { "entropy": 5.733684349060058, "epoch": 0.16299106281746287, "grad_norm": 1.1484375, "learning_rate": 0.0002669906312242569, "loss": 5.4731, "mean_token_accuracy": 0.18607353866100312, "num_tokens": 6095453.0, "step": 2535 }, { "entropy": 5.633643722534179, "epoch": 0.1633125442036906, "grad_norm": 1.046875, "learning_rate": 0.00026581339580483525, "loss": 5.2663, "mean_token_accuracy": 0.19765492528676987, "num_tokens": 6106626.0, "step": 2540 }, { "entropy": 5.704886960983276, "epoch": 0.16363402558991835, "grad_norm": 1.0546875, "learning_rate": 0.0002646364122408082, "loss": 5.3787, "mean_token_accuracy": 0.19035560488700867, "num_tokens": 6118303.0, "step": 2545 }, { "entropy": 5.72221360206604, "epoch": 0.16395550697614608, "grad_norm": 1.0703125, "learning_rate": 0.0002634597127997749, "loss": 5.3749, "mean_token_accuracy": 0.19013865888118744, "num_tokens": 6129816.0, "step": 2550 }, { "entropy": 5.608705329895019, "epoch": 0.1642769883623738, "grad_norm": 1.078125, "learning_rate": 0.0002622833297415445, "loss": 5.3172, "mean_token_accuracy": 0.1911654755473137, "num_tokens": 6140365.0, "step": 2555 }, { "entropy": 5.760907173156738, "epoch": 0.16459846974860157, "grad_norm": 1.0703125, "learning_rate": 0.0002611072953172531, "loss": 5.4881, "mean_token_accuracy": 0.17768636643886565, "num_tokens": 6152983.0, "step": 2560 }, { "entropy": 5.789962673187256, "epoch": 0.1649199511348293, "grad_norm": 1.0390625, "learning_rate": 0.00025993164176847845, "loss": 5.3655, "mean_token_accuracy": 0.19078085273504258, "num_tokens": 6164881.0, "step": 2565 }, { "entropy": 5.589530611038208, "epoch": 0.16524143252105702, "grad_norm": 1.0390625, "learning_rate": 0.0002587564013263564, "loss": 5.3354, "mean_token_accuracy": 0.1928408369421959, "num_tokens": 6176486.0, "step": 2570 }, { "entropy": 5.650345945358277, "epoch": 0.16556291390728478, "grad_norm": 1.0546875, "learning_rate": 0.0002575816062106974, "loss": 5.3535, "mean_token_accuracy": 0.18694678395986558, "num_tokens": 6189147.0, "step": 2575 }, { "entropy": 5.760590648651123, "epoch": 0.1658843952935125, "grad_norm": 0.99609375, "learning_rate": 0.00025640728862910293, "loss": 5.3917, "mean_token_accuracy": 0.188855442404747, "num_tokens": 6201009.0, "step": 2580 }, { "entropy": 5.788675117492676, "epoch": 0.16620587667974024, "grad_norm": 0.98828125, "learning_rate": 0.00025523348077608285, "loss": 5.5928, "mean_token_accuracy": 0.1768835663795471, "num_tokens": 6212960.0, "step": 2585 }, { "entropy": 5.6765465259552, "epoch": 0.16652735806596797, "grad_norm": 1.0625, "learning_rate": 0.00025406021483217225, "loss": 5.421, "mean_token_accuracy": 0.18803070932626725, "num_tokens": 6224528.0, "step": 2590 }, { "entropy": 5.736158561706543, "epoch": 0.16684883945219572, "grad_norm": 1.0625, "learning_rate": 0.00025288752296304963, "loss": 5.4378, "mean_token_accuracy": 0.1856225997209549, "num_tokens": 6235177.0, "step": 2595 }, { "entropy": 5.696233892440796, "epoch": 0.16717032083842345, "grad_norm": 1.0234375, "learning_rate": 0.000251715437318655, "loss": 5.35, "mean_token_accuracy": 0.19037462770938873, "num_tokens": 6247358.0, "step": 2600 }, { "entropy": 5.712907552719116, "epoch": 0.16749180222465118, "grad_norm": 1.0703125, "learning_rate": 0.0002505439900323084, "loss": 5.4432, "mean_token_accuracy": 0.19202869087457658, "num_tokens": 6258710.0, "step": 2605 }, { "entropy": 5.673813343048096, "epoch": 0.16781328361087894, "grad_norm": 1.0625, "learning_rate": 0.00024937321321982894, "loss": 5.3658, "mean_token_accuracy": 0.19849955141544343, "num_tokens": 6270877.0, "step": 2610 }, { "entropy": 5.670746183395385, "epoch": 0.16813476499710667, "grad_norm": 1.0234375, "learning_rate": 0.00024820313897865433, "loss": 5.3693, "mean_token_accuracy": 0.1975083351135254, "num_tokens": 6282938.0, "step": 2615 }, { "entropy": 5.691606140136718, "epoch": 0.1684562463833344, "grad_norm": 1.0234375, "learning_rate": 0.00024703379938696105, "loss": 5.4931, "mean_token_accuracy": 0.186161832511425, "num_tokens": 6295644.0, "step": 2620 }, { "entropy": 5.752467966079712, "epoch": 0.16877772776956215, "grad_norm": 0.921875, "learning_rate": 0.00024586522650278447, "loss": 5.5008, "mean_token_accuracy": 0.18383887112140657, "num_tokens": 6307713.0, "step": 2625 }, { "entropy": 5.719897651672364, "epoch": 0.16909920915578988, "grad_norm": 0.9609375, "learning_rate": 0.00024469745236314064, "loss": 5.4252, "mean_token_accuracy": 0.1854029953479767, "num_tokens": 6320979.0, "step": 2630 }, { "entropy": 5.738539171218872, "epoch": 0.1694206905420176, "grad_norm": 1.0234375, "learning_rate": 0.00024353050898314767, "loss": 5.3588, "mean_token_accuracy": 0.19410390853881837, "num_tokens": 6333073.0, "step": 2635 }, { "entropy": 5.770835208892822, "epoch": 0.16974217192824537, "grad_norm": 1.0625, "learning_rate": 0.00024236442835514743, "loss": 5.4642, "mean_token_accuracy": 0.18527479469776154, "num_tokens": 6345820.0, "step": 2640 }, { "entropy": 5.635788154602051, "epoch": 0.1700636533144731, "grad_norm": 0.98046875, "learning_rate": 0.00024119924244782965, "loss": 5.2619, "mean_token_accuracy": 0.200632905960083, "num_tokens": 6357077.0, "step": 2645 }, { "entropy": 5.64978060722351, "epoch": 0.17038513470070082, "grad_norm": 1.0078125, "learning_rate": 0.00024003498320535462, "loss": 5.3396, "mean_token_accuracy": 0.18788397163152695, "num_tokens": 6368646.0, "step": 2650 }, { "entropy": 5.6555901050567625, "epoch": 0.17070661608692855, "grad_norm": 1.015625, "learning_rate": 0.00023887168254647727, "loss": 5.3509, "mean_token_accuracy": 0.18772217631340027, "num_tokens": 6381404.0, "step": 2655 }, { "entropy": 5.755281400680542, "epoch": 0.1710280974731563, "grad_norm": 0.9609375, "learning_rate": 0.00023770937236367308, "loss": 5.4743, "mean_token_accuracy": 0.18462026566267015, "num_tokens": 6393837.0, "step": 2660 }, { "entropy": 5.718565797805786, "epoch": 0.17134957885938404, "grad_norm": 1.0390625, "learning_rate": 0.00023654808452226278, "loss": 5.4047, "mean_token_accuracy": 0.19541409462690354, "num_tokens": 6406047.0, "step": 2665 }, { "entropy": 5.725548124313354, "epoch": 0.17167106024561177, "grad_norm": 1.1171875, "learning_rate": 0.00023538785085953912, "loss": 5.3649, "mean_token_accuracy": 0.1895756259560585, "num_tokens": 6417473.0, "step": 2670 }, { "entropy": 5.680177164077759, "epoch": 0.17199254163183952, "grad_norm": 1.109375, "learning_rate": 0.00023422870318389404, "loss": 5.4406, "mean_token_accuracy": 0.19270267188549042, "num_tokens": 6428790.0, "step": 2675 }, { "entropy": 5.728271961212158, "epoch": 0.17231402301806725, "grad_norm": 1.0, "learning_rate": 0.0002330706732739468, "loss": 5.3948, "mean_token_accuracy": 0.19255558401346207, "num_tokens": 6440836.0, "step": 2680 }, { "entropy": 5.74830174446106, "epoch": 0.17263550440429498, "grad_norm": 1.140625, "learning_rate": 0.00023191379287767211, "loss": 5.3293, "mean_token_accuracy": 0.19255857914686203, "num_tokens": 6452115.0, "step": 2685 }, { "entropy": 5.634627437591552, "epoch": 0.17295698579052274, "grad_norm": 1.046875, "learning_rate": 0.0002307580937115305, "loss": 5.3894, "mean_token_accuracy": 0.19944595396518708, "num_tokens": 6464574.0, "step": 2690 }, { "entropy": 5.7174866676330565, "epoch": 0.17327846717675047, "grad_norm": 1.0390625, "learning_rate": 0.00022960360745959846, "loss": 5.3937, "mean_token_accuracy": 0.18737066835165023, "num_tokens": 6477092.0, "step": 2695 }, { "entropy": 5.757074880599975, "epoch": 0.1735999485629782, "grad_norm": 1.03125, "learning_rate": 0.00022845036577269972, "loss": 5.417, "mean_token_accuracy": 0.18753257244825364, "num_tokens": 6488899.0, "step": 2700 }, { "entropy": 5.700710439682007, "epoch": 0.17392142994920595, "grad_norm": 1.078125, "learning_rate": 0.00022729840026753777, "loss": 5.4369, "mean_token_accuracy": 0.19061683267354965, "num_tokens": 6502030.0, "step": 2705 }, { "entropy": 5.805812931060791, "epoch": 0.17424291133543368, "grad_norm": 1.0078125, "learning_rate": 0.0002261477425258287, "loss": 5.5247, "mean_token_accuracy": 0.1854427859187126, "num_tokens": 6516042.0, "step": 2710 }, { "entropy": 5.729813528060913, "epoch": 0.1745643927216614, "grad_norm": 1.1328125, "learning_rate": 0.0002249984240934358, "loss": 5.355, "mean_token_accuracy": 0.19945041835308075, "num_tokens": 6527869.0, "step": 2715 }, { "entropy": 5.656886625289917, "epoch": 0.17488587410788917, "grad_norm": 1.1328125, "learning_rate": 0.00022385047647950464, "loss": 5.3595, "mean_token_accuracy": 0.19776754975318908, "num_tokens": 6539108.0, "step": 2720 }, { "entropy": 5.665387916564941, "epoch": 0.1752073554941169, "grad_norm": 1.15625, "learning_rate": 0.0002227039311555986, "loss": 5.2585, "mean_token_accuracy": 0.20100895464420318, "num_tokens": 6551035.0, "step": 2725 }, { "entropy": 5.698460817337036, "epoch": 0.17552883688034462, "grad_norm": 1.015625, "learning_rate": 0.0002215588195548372, "loss": 5.4061, "mean_token_accuracy": 0.18864956349134446, "num_tokens": 6563070.0, "step": 2730 }, { "entropy": 5.652213525772095, "epoch": 0.17585031826657235, "grad_norm": 1.0234375, "learning_rate": 0.00022041517307103337, "loss": 5.3538, "mean_token_accuracy": 0.19336917847394944, "num_tokens": 6575718.0, "step": 2735 }, { "entropy": 5.651966857910156, "epoch": 0.1761717996528001, "grad_norm": 1.0, "learning_rate": 0.0002192730230578331, "loss": 5.2989, "mean_token_accuracy": 0.20069129168987274, "num_tokens": 6587798.0, "step": 2740 }, { "entropy": 5.6531054973602295, "epoch": 0.17649328103902784, "grad_norm": 1.078125, "learning_rate": 0.0002181324008278559, "loss": 5.3384, "mean_token_accuracy": 0.19774024188518524, "num_tokens": 6599490.0, "step": 2745 }, { "entropy": 5.735021018981934, "epoch": 0.17681476242525557, "grad_norm": 1.03125, "learning_rate": 0.00021699333765183655, "loss": 5.4151, "mean_token_accuracy": 0.19034498184919357, "num_tokens": 6610257.0, "step": 2750 }, { "entropy": 5.766584253311157, "epoch": 0.17713624381148332, "grad_norm": 1.09375, "learning_rate": 0.0002158558647577673, "loss": 5.4415, "mean_token_accuracy": 0.18987052738666535, "num_tokens": 6623106.0, "step": 2755 }, { "entropy": 5.70956335067749, "epoch": 0.17745772519771105, "grad_norm": 1.125, "learning_rate": 0.00021472001333004215, "loss": 5.4621, "mean_token_accuracy": 0.18878680169582368, "num_tokens": 6634355.0, "step": 2760 }, { "entropy": 5.773206949234009, "epoch": 0.17777920658393878, "grad_norm": 1.0859375, "learning_rate": 0.00021358581450860186, "loss": 5.4231, "mean_token_accuracy": 0.18522380888462067, "num_tokens": 6645389.0, "step": 2765 }, { "entropy": 5.630489778518677, "epoch": 0.17810068797016654, "grad_norm": 1.0859375, "learning_rate": 0.0002124532993880799, "loss": 5.3076, "mean_token_accuracy": 0.1954178676009178, "num_tokens": 6656422.0, "step": 2770 }, { "entropy": 5.683885908126831, "epoch": 0.17842216935639427, "grad_norm": 1.03125, "learning_rate": 0.00021132249901695044, "loss": 5.3621, "mean_token_accuracy": 0.1880607470870018, "num_tokens": 6668074.0, "step": 2775 }, { "entropy": 5.697801876068115, "epoch": 0.178743650742622, "grad_norm": 1.03125, "learning_rate": 0.00021019344439667705, "loss": 5.4073, "mean_token_accuracy": 0.18855472803115844, "num_tokens": 6680903.0, "step": 2780 }, { "entropy": 5.6559816837310795, "epoch": 0.17906513212884975, "grad_norm": 1.140625, "learning_rate": 0.00020906616648086213, "loss": 5.3039, "mean_token_accuracy": 0.20630253553390504, "num_tokens": 6691621.0, "step": 2785 }, { "entropy": 5.671924591064453, "epoch": 0.17938661351507748, "grad_norm": 1.1484375, "learning_rate": 0.00020794069617439942, "loss": 5.3438, "mean_token_accuracy": 0.1956033930182457, "num_tokens": 6702941.0, "step": 2790 }, { "entropy": 5.782442951202393, "epoch": 0.1797080949013052, "grad_norm": 1.0625, "learning_rate": 0.00020681706433262593, "loss": 5.4145, "mean_token_accuracy": 0.1867195799946785, "num_tokens": 6715336.0, "step": 2795 }, { "entropy": 5.71237964630127, "epoch": 0.18002957628753294, "grad_norm": 1.0234375, "learning_rate": 0.00020569530176047602, "loss": 5.3303, "mean_token_accuracy": 0.1883831426501274, "num_tokens": 6727199.0, "step": 2800 }, { "entropy": 5.6498565673828125, "epoch": 0.1803510576737607, "grad_norm": 1.1015625, "learning_rate": 0.0002045754392116374, "loss": 5.3285, "mean_token_accuracy": 0.19204856902360917, "num_tokens": 6739419.0, "step": 2805 }, { "entropy": 5.72914137840271, "epoch": 0.18067253905998842, "grad_norm": 1.3203125, "learning_rate": 0.00020345750738770757, "loss": 5.3964, "mean_token_accuracy": 0.18919821232557296, "num_tokens": 6751751.0, "step": 2810 }, { "entropy": 5.729403638839722, "epoch": 0.18099402044621615, "grad_norm": 1.0078125, "learning_rate": 0.00020234153693735214, "loss": 5.4011, "mean_token_accuracy": 0.1921023279428482, "num_tokens": 6764313.0, "step": 2815 }, { "entropy": 5.698525762557983, "epoch": 0.1813155018324439, "grad_norm": 1.140625, "learning_rate": 0.0002012275584554647, "loss": 5.3628, "mean_token_accuracy": 0.18777787685394287, "num_tokens": 6777119.0, "step": 2820 }, { "entropy": 5.714127874374389, "epoch": 0.18163698321867164, "grad_norm": 1.0859375, "learning_rate": 0.00020011560248232803, "loss": 5.4535, "mean_token_accuracy": 0.18426025062799453, "num_tokens": 6789050.0, "step": 2825 }, { "entropy": 5.654620218276977, "epoch": 0.18195846460489937, "grad_norm": 1.046875, "learning_rate": 0.00019900569950277692, "loss": 5.2821, "mean_token_accuracy": 0.19899048358201982, "num_tokens": 6802729.0, "step": 2830 }, { "entropy": 5.658134317398071, "epoch": 0.18227994599112712, "grad_norm": 1.0, "learning_rate": 0.00019789787994536228, "loss": 5.391, "mean_token_accuracy": 0.19206143766641617, "num_tokens": 6816830.0, "step": 2835 }, { "entropy": 5.663815641403199, "epoch": 0.18260142737735485, "grad_norm": 1.1015625, "learning_rate": 0.00019679217418151667, "loss": 5.3093, "mean_token_accuracy": 0.19375376999378205, "num_tokens": 6829310.0, "step": 2840 }, { "entropy": 5.71293830871582, "epoch": 0.18292290876358258, "grad_norm": 1.03125, "learning_rate": 0.00019568861252472236, "loss": 5.3716, "mean_token_accuracy": 0.18789880722761154, "num_tokens": 6840777.0, "step": 2845 }, { "entropy": 5.698060512542725, "epoch": 0.18324439014981034, "grad_norm": 1.15625, "learning_rate": 0.00019458722522967952, "loss": 5.2837, "mean_token_accuracy": 0.20378447473049163, "num_tokens": 6852153.0, "step": 2850 }, { "entropy": 5.650346040725708, "epoch": 0.18356587153603807, "grad_norm": 1.046875, "learning_rate": 0.00019348804249147723, "loss": 5.3548, "mean_token_accuracy": 0.1958395019173622, "num_tokens": 6864939.0, "step": 2855 }, { "entropy": 5.655475997924805, "epoch": 0.1838873529222658, "grad_norm": 1.03125, "learning_rate": 0.0001923910944447655, "loss": 5.3524, "mean_token_accuracy": 0.1980673685669899, "num_tokens": 6878226.0, "step": 2860 }, { "entropy": 5.650178623199463, "epoch": 0.18420883430849355, "grad_norm": 1.0078125, "learning_rate": 0.00019129641116292928, "loss": 5.3498, "mean_token_accuracy": 0.19102472960948944, "num_tokens": 6892218.0, "step": 2865 }, { "entropy": 5.786796283721924, "epoch": 0.18453031569472128, "grad_norm": 1.078125, "learning_rate": 0.00019020402265726343, "loss": 5.418, "mean_token_accuracy": 0.19311929494142532, "num_tokens": 6903956.0, "step": 2870 }, { "entropy": 5.820598363876343, "epoch": 0.184851797080949, "grad_norm": 1.0390625, "learning_rate": 0.0001891139588761509, "loss": 5.5329, "mean_token_accuracy": 0.18871719986200333, "num_tokens": 6917213.0, "step": 2875 }, { "entropy": 5.765894889831543, "epoch": 0.18517327846717674, "grad_norm": 1.0390625, "learning_rate": 0.00018802624970424076, "loss": 5.3568, "mean_token_accuracy": 0.1947931945323944, "num_tokens": 6929834.0, "step": 2880 }, { "entropy": 5.634900665283203, "epoch": 0.1854947598534045, "grad_norm": 1.0703125, "learning_rate": 0.00018694092496162945, "loss": 5.3401, "mean_token_accuracy": 0.19182991236448288, "num_tokens": 6941910.0, "step": 2885 }, { "entropy": 5.64922981262207, "epoch": 0.18581624123963222, "grad_norm": 1.015625, "learning_rate": 0.00018585801440304306, "loss": 5.3106, "mean_token_accuracy": 0.19692609459161758, "num_tokens": 6954878.0, "step": 2890 }, { "entropy": 5.703550624847412, "epoch": 0.18613772262585995, "grad_norm": 0.93359375, "learning_rate": 0.00018477754771702165, "loss": 5.3421, "mean_token_accuracy": 0.19770172238349915, "num_tokens": 6967127.0, "step": 2895 }, { "entropy": 5.713476133346558, "epoch": 0.1864592040120877, "grad_norm": 1.078125, "learning_rate": 0.00018369955452510506, "loss": 5.3583, "mean_token_accuracy": 0.18674176931381226, "num_tokens": 6978781.0, "step": 2900 }, { "entropy": 5.767842483520508, "epoch": 0.18678068539831544, "grad_norm": 1.0234375, "learning_rate": 0.0001826240643810212, "loss": 5.4879, "mean_token_accuracy": 0.17964973002672197, "num_tokens": 6991969.0, "step": 2905 }, { "entropy": 5.681934356689453, "epoch": 0.18710216678454317, "grad_norm": 0.98046875, "learning_rate": 0.0001815511067698758, "loss": 5.3598, "mean_token_accuracy": 0.1911593720316887, "num_tokens": 7004705.0, "step": 2910 }, { "entropy": 5.745440101623535, "epoch": 0.18742364817077092, "grad_norm": 1.1484375, "learning_rate": 0.0001804807111073436, "loss": 5.3456, "mean_token_accuracy": 0.19167290329933168, "num_tokens": 7015951.0, "step": 2915 }, { "entropy": 5.674161338806153, "epoch": 0.18774512955699865, "grad_norm": 0.96875, "learning_rate": 0.0001794129067388625, "loss": 5.2976, "mean_token_accuracy": 0.20162287950515748, "num_tokens": 7027585.0, "step": 2920 }, { "entropy": 5.61113977432251, "epoch": 0.18806661094322638, "grad_norm": 0.99609375, "learning_rate": 0.00017834772293882868, "loss": 5.256, "mean_token_accuracy": 0.20131248235702515, "num_tokens": 7040313.0, "step": 2925 }, { "entropy": 5.6370405673980715, "epoch": 0.18838809232945414, "grad_norm": 0.98046875, "learning_rate": 0.000177285188909794, "loss": 5.3169, "mean_token_accuracy": 0.19531358480453492, "num_tokens": 7052435.0, "step": 2930 }, { "entropy": 5.634557580947876, "epoch": 0.18870957371568187, "grad_norm": 0.90625, "learning_rate": 0.0001762253337816656, "loss": 5.2732, "mean_token_accuracy": 0.19889160394668579, "num_tokens": 7066002.0, "step": 2935 }, { "entropy": 5.686793994903565, "epoch": 0.1890310551019096, "grad_norm": 1.0234375, "learning_rate": 0.00017516818661090738, "loss": 5.3494, "mean_token_accuracy": 0.1903778240084648, "num_tokens": 7078137.0, "step": 2940 }, { "entropy": 5.713859176635742, "epoch": 0.18935253648813732, "grad_norm": 1.0546875, "learning_rate": 0.0001741137763797428, "loss": 5.3215, "mean_token_accuracy": 0.1975012868642807, "num_tokens": 7089664.0, "step": 2945 }, { "entropy": 5.741861629486084, "epoch": 0.18967401787436508, "grad_norm": 1.125, "learning_rate": 0.00017306213199536115, "loss": 5.4394, "mean_token_accuracy": 0.18675171881914138, "num_tokens": 7102497.0, "step": 2950 }, { "entropy": 5.641637468338013, "epoch": 0.1899954992605928, "grad_norm": 1.046875, "learning_rate": 0.0001720132822891243, "loss": 5.341, "mean_token_accuracy": 0.19709572196006775, "num_tokens": 7114508.0, "step": 2955 }, { "entropy": 5.6888528823852536, "epoch": 0.19031698064682054, "grad_norm": 0.9765625, "learning_rate": 0.0001709672560157769, "loss": 5.4426, "mean_token_accuracy": 0.18821884840726852, "num_tokens": 7128009.0, "step": 2960 }, { "entropy": 5.6601934909820555, "epoch": 0.1906384620330483, "grad_norm": 1.0859375, "learning_rate": 0.00016992408185265758, "loss": 5.2646, "mean_token_accuracy": 0.20210227966308594, "num_tokens": 7140331.0, "step": 2965 }, { "entropy": 5.7810698509216305, "epoch": 0.19095994341927602, "grad_norm": 1.1484375, "learning_rate": 0.00016888378839891298, "loss": 5.497, "mean_token_accuracy": 0.18689459413290024, "num_tokens": 7151371.0, "step": 2970 }, { "entropy": 5.642335271835327, "epoch": 0.19128142480550375, "grad_norm": 1.078125, "learning_rate": 0.0001678464041747137, "loss": 5.2909, "mean_token_accuracy": 0.20328755527734757, "num_tokens": 7163298.0, "step": 2975 }, { "entropy": 5.702846956253052, "epoch": 0.1916029061917315, "grad_norm": 0.984375, "learning_rate": 0.00016681195762047223, "loss": 5.3708, "mean_token_accuracy": 0.1930597633123398, "num_tokens": 7175076.0, "step": 2980 }, { "entropy": 5.635656023025513, "epoch": 0.19192438757795924, "grad_norm": 1.203125, "learning_rate": 0.00016578047709606337, "loss": 5.2793, "mean_token_accuracy": 0.1982986733317375, "num_tokens": 7186086.0, "step": 2985 }, { "entropy": 5.638657474517823, "epoch": 0.19224586896418697, "grad_norm": 1.1171875, "learning_rate": 0.00016475199088004678, "loss": 5.3208, "mean_token_accuracy": 0.19765783697366715, "num_tokens": 7197877.0, "step": 2990 }, { "entropy": 5.741225624084473, "epoch": 0.19256735035041472, "grad_norm": 1.0390625, "learning_rate": 0.00016372652716889163, "loss": 5.3174, "mean_token_accuracy": 0.1919741615653038, "num_tokens": 7209694.0, "step": 2995 }, { "entropy": 5.681012868881226, "epoch": 0.19288883173664245, "grad_norm": 1.0234375, "learning_rate": 0.0001627041140762035, "loss": 5.3563, "mean_token_accuracy": 0.1928807780146599, "num_tokens": 7222238.0, "step": 3000 }, { "entropy": 5.672075700759888, "epoch": 0.19321031312287018, "grad_norm": 0.9921875, "learning_rate": 0.00016168477963195382, "loss": 5.3286, "mean_token_accuracy": 0.19123267829418183, "num_tokens": 7234645.0, "step": 3005 }, { "entropy": 5.554755353927613, "epoch": 0.1935317945090979, "grad_norm": 1.1015625, "learning_rate": 0.0001606685517817114, "loss": 5.2674, "mean_token_accuracy": 0.20121576339006425, "num_tokens": 7246847.0, "step": 3010 }, { "entropy": 5.72060718536377, "epoch": 0.19385327589532567, "grad_norm": 1.1796875, "learning_rate": 0.00015965545838587592, "loss": 5.418, "mean_token_accuracy": 0.18845782727003096, "num_tokens": 7259014.0, "step": 3015 }, { "entropy": 5.735719633102417, "epoch": 0.1941747572815534, "grad_norm": 1.015625, "learning_rate": 0.00015864552721891467, "loss": 5.3366, "mean_token_accuracy": 0.19298373609781266, "num_tokens": 7270797.0, "step": 3020 }, { "entropy": 5.699824428558349, "epoch": 0.19449623866778112, "grad_norm": 0.99609375, "learning_rate": 0.00015763878596860076, "loss": 5.3539, "mean_token_accuracy": 0.19396004527807237, "num_tokens": 7283464.0, "step": 3025 }, { "entropy": 5.7045598983764645, "epoch": 0.19481772005400888, "grad_norm": 1.0546875, "learning_rate": 0.00015663526223525412, "loss": 5.3358, "mean_token_accuracy": 0.19428735822439194, "num_tokens": 7295472.0, "step": 3030 }, { "entropy": 5.7908977508544925, "epoch": 0.1951392014402366, "grad_norm": 1.09375, "learning_rate": 0.0001556349835309848, "loss": 5.4155, "mean_token_accuracy": 0.1899193584918976, "num_tokens": 7307284.0, "step": 3035 }, { "entropy": 5.668297529220581, "epoch": 0.19546068282646434, "grad_norm": 1.046875, "learning_rate": 0.0001546379772789389, "loss": 5.2233, "mean_token_accuracy": 0.20834969729185104, "num_tokens": 7317922.0, "step": 3040 }, { "entropy": 5.677731895446778, "epoch": 0.1957821642126921, "grad_norm": 1.0546875, "learning_rate": 0.00015364427081254622, "loss": 5.2993, "mean_token_accuracy": 0.19774854481220244, "num_tokens": 7328096.0, "step": 3045 }, { "entropy": 5.662015008926391, "epoch": 0.19610364559891982, "grad_norm": 1.046875, "learning_rate": 0.00015265389137477165, "loss": 5.268, "mean_token_accuracy": 0.1995667800307274, "num_tokens": 7339326.0, "step": 3050 }, { "entropy": 5.68407244682312, "epoch": 0.19642512698514755, "grad_norm": 1.0390625, "learning_rate": 0.00015166686611736786, "loss": 5.2963, "mean_token_accuracy": 0.19593835026025772, "num_tokens": 7351609.0, "step": 3055 }, { "entropy": 5.697849941253662, "epoch": 0.1967466083713753, "grad_norm": 1.0546875, "learning_rate": 0.00015068322210013064, "loss": 5.419, "mean_token_accuracy": 0.19606532007455826, "num_tokens": 7364141.0, "step": 3060 }, { "entropy": 5.654123401641845, "epoch": 0.19706808975760304, "grad_norm": 1.0390625, "learning_rate": 0.0001497029862901578, "loss": 5.3209, "mean_token_accuracy": 0.19135044813156127, "num_tokens": 7376237.0, "step": 3065 }, { "entropy": 5.627373838424683, "epoch": 0.19738957114383077, "grad_norm": 1.1015625, "learning_rate": 0.00014872618556110905, "loss": 5.3049, "mean_token_accuracy": 0.20300978869199754, "num_tokens": 7387889.0, "step": 3070 }, { "entropy": 5.688027000427246, "epoch": 0.19771105253005852, "grad_norm": 1.0859375, "learning_rate": 0.00014775284669246992, "loss": 5.331, "mean_token_accuracy": 0.18905219733715056, "num_tokens": 7400112.0, "step": 3075 }, { "entropy": 5.670854139328003, "epoch": 0.19803253391628625, "grad_norm": 1.1875, "learning_rate": 0.00014678299636881716, "loss": 5.3309, "mean_token_accuracy": 0.19328058809041976, "num_tokens": 7411680.0, "step": 3080 }, { "entropy": 5.685283565521241, "epoch": 0.19835401530251398, "grad_norm": 1.0703125, "learning_rate": 0.0001458166611790873, "loss": 5.3046, "mean_token_accuracy": 0.20481374114751816, "num_tokens": 7424347.0, "step": 3085 }, { "entropy": 5.684451770782471, "epoch": 0.1986754966887417, "grad_norm": 1.0234375, "learning_rate": 0.00014485386761584773, "loss": 5.3678, "mean_token_accuracy": 0.1958083614706993, "num_tokens": 7436970.0, "step": 3090 }, { "entropy": 5.679118394851685, "epoch": 0.19899697807496947, "grad_norm": 1.0390625, "learning_rate": 0.00014389464207457042, "loss": 5.3415, "mean_token_accuracy": 0.1933901235461235, "num_tokens": 7449175.0, "step": 3095 }, { "entropy": 5.581226062774658, "epoch": 0.1993184594611972, "grad_norm": 1.0390625, "learning_rate": 0.00014293901085290795, "loss": 5.184, "mean_token_accuracy": 0.20435071289539336, "num_tokens": 7460265.0, "step": 3100 }, { "entropy": 5.73956184387207, "epoch": 0.19963994084742492, "grad_norm": 1.109375, "learning_rate": 0.00014198700014997307, "loss": 5.3586, "mean_token_accuracy": 0.18684755712747575, "num_tokens": 7472386.0, "step": 3105 }, { "entropy": 5.664403581619263, "epoch": 0.19996142223365268, "grad_norm": 1.1171875, "learning_rate": 0.00014103863606562016, "loss": 5.2671, "mean_token_accuracy": 0.19611046761274337, "num_tokens": 7484744.0, "step": 3110 }, { "entropy": 5.575774908065796, "epoch": 0.2002829036198804, "grad_norm": 1.03125, "learning_rate": 0.00014009394459972964, "loss": 5.207, "mean_token_accuracy": 0.20065230876207352, "num_tokens": 7497192.0, "step": 3115 }, { "entropy": 5.672440433502198, "epoch": 0.20060438500610814, "grad_norm": 1.09375, "learning_rate": 0.00013915295165149513, "loss": 5.3602, "mean_token_accuracy": 0.19334883540868758, "num_tokens": 7508452.0, "step": 3120 }, { "entropy": 5.681038522720337, "epoch": 0.2009258663923359, "grad_norm": 0.94140625, "learning_rate": 0.00013821568301871384, "loss": 5.3319, "mean_token_accuracy": 0.1971898540854454, "num_tokens": 7520008.0, "step": 3125 }, { "entropy": 5.689389419555664, "epoch": 0.20124734777856362, "grad_norm": 1.1015625, "learning_rate": 0.00013728216439707862, "loss": 5.3724, "mean_token_accuracy": 0.18985050767660142, "num_tokens": 7532848.0, "step": 3130 }, { "entropy": 5.6600761890411375, "epoch": 0.20156882916479135, "grad_norm": 1.1484375, "learning_rate": 0.00013635242137947419, "loss": 5.2898, "mean_token_accuracy": 0.19827569723129274, "num_tokens": 7543961.0, "step": 3135 }, { "entropy": 5.658891868591309, "epoch": 0.2018903105510191, "grad_norm": 1.078125, "learning_rate": 0.00013542647945527498, "loss": 5.2408, "mean_token_accuracy": 0.20192974507808686, "num_tokens": 7554441.0, "step": 3140 }, { "entropy": 5.659081697463989, "epoch": 0.20221179193724684, "grad_norm": 1.0390625, "learning_rate": 0.0001345043640096465, "loss": 5.2913, "mean_token_accuracy": 0.20584864318370819, "num_tokens": 7565956.0, "step": 3145 }, { "entropy": 5.717943859100342, "epoch": 0.20253327332347457, "grad_norm": 1.0390625, "learning_rate": 0.00013358610032284957, "loss": 5.3432, "mean_token_accuracy": 0.2040042608976364, "num_tokens": 7577782.0, "step": 3150 }, { "entropy": 5.623188591003418, "epoch": 0.2028547547097023, "grad_norm": 1.046875, "learning_rate": 0.000132671713569547, "loss": 5.3276, "mean_token_accuracy": 0.19923162013292312, "num_tokens": 7589655.0, "step": 3155 }, { "entropy": 5.583046531677246, "epoch": 0.20317623609593005, "grad_norm": 1.0625, "learning_rate": 0.0001317612288181136, "loss": 5.2463, "mean_token_accuracy": 0.20462400913238527, "num_tokens": 7600490.0, "step": 3160 }, { "entropy": 5.692988920211792, "epoch": 0.20349771748215778, "grad_norm": 1.09375, "learning_rate": 0.00013085467102994864, "loss": 5.3433, "mean_token_accuracy": 0.19690002948045732, "num_tokens": 7611956.0, "step": 3165 }, { "entropy": 5.632165908813477, "epoch": 0.2038191988683855, "grad_norm": 1.09375, "learning_rate": 0.00012995206505879198, "loss": 5.2644, "mean_token_accuracy": 0.20063740164041519, "num_tokens": 7623525.0, "step": 3170 }, { "entropy": 5.647959756851196, "epoch": 0.20414068025461327, "grad_norm": 1.046875, "learning_rate": 0.0001290534356500421, "loss": 5.325, "mean_token_accuracy": 0.19781199842691422, "num_tokens": 7634902.0, "step": 3175 }, { "entropy": 5.669277858734131, "epoch": 0.204462161640841, "grad_norm": 1.140625, "learning_rate": 0.00012815880744007827, "loss": 5.3885, "mean_token_accuracy": 0.19175426363945008, "num_tokens": 7646891.0, "step": 3180 }, { "entropy": 5.613622045516967, "epoch": 0.20478364302706872, "grad_norm": 1.109375, "learning_rate": 0.00012726820495558483, "loss": 5.2312, "mean_token_accuracy": 0.20127549767494202, "num_tokens": 7659625.0, "step": 3185 }, { "entropy": 5.688162469863892, "epoch": 0.20510512441329648, "grad_norm": 1.0859375, "learning_rate": 0.00012638165261287868, "loss": 5.3102, "mean_token_accuracy": 0.19467726051807405, "num_tokens": 7670963.0, "step": 3190 }, { "entropy": 5.710018157958984, "epoch": 0.2054266057995242, "grad_norm": 0.9375, "learning_rate": 0.0001254991747172402, "loss": 5.3201, "mean_token_accuracy": 0.19359399229288102, "num_tokens": 7683556.0, "step": 3195 }, { "entropy": 5.727203845977783, "epoch": 0.20574808718575194, "grad_norm": 1.046875, "learning_rate": 0.00012462079546224662, "loss": 5.3106, "mean_token_accuracy": 0.1922787219285965, "num_tokens": 7695290.0, "step": 3200 }, { "entropy": 5.688492345809936, "epoch": 0.2060695685719797, "grad_norm": 0.984375, "learning_rate": 0.00012374653892910896, "loss": 5.3365, "mean_token_accuracy": 0.19461656212806702, "num_tokens": 7707925.0, "step": 3205 }, { "entropy": 5.638540601730346, "epoch": 0.20639104995820742, "grad_norm": 1.09375, "learning_rate": 0.00012287642908601166, "loss": 5.2965, "mean_token_accuracy": 0.1947594776749611, "num_tokens": 7719105.0, "step": 3210 }, { "entropy": 5.700093841552734, "epoch": 0.20671253134443515, "grad_norm": 1.1640625, "learning_rate": 0.00012201048978745569, "loss": 5.3787, "mean_token_accuracy": 0.19443995952606202, "num_tokens": 7731453.0, "step": 3215 }, { "entropy": 5.695550537109375, "epoch": 0.20703401273066288, "grad_norm": 1.09375, "learning_rate": 0.00012114874477360427, "loss": 5.2958, "mean_token_accuracy": 0.19526378214359283, "num_tokens": 7743063.0, "step": 3220 }, { "entropy": 5.717733478546142, "epoch": 0.20735549411689064, "grad_norm": 1.171875, "learning_rate": 0.00012029121766963236, "loss": 5.3553, "mean_token_accuracy": 0.1992946445941925, "num_tokens": 7755356.0, "step": 3225 }, { "entropy": 5.795975112915039, "epoch": 0.20767697550311837, "grad_norm": 1.1640625, "learning_rate": 0.00011943793198507858, "loss": 5.3953, "mean_token_accuracy": 0.19271425604820253, "num_tokens": 7768025.0, "step": 3230 }, { "entropy": 5.725104808807373, "epoch": 0.2079984568893461, "grad_norm": 1.0859375, "learning_rate": 0.00011858891111320104, "loss": 5.2853, "mean_token_accuracy": 0.19714273661375045, "num_tokens": 7779116.0, "step": 3235 }, { "entropy": 5.64580020904541, "epoch": 0.20831993827557385, "grad_norm": 1.0546875, "learning_rate": 0.0001177441783303359, "loss": 5.3008, "mean_token_accuracy": 0.1985606610774994, "num_tokens": 7790716.0, "step": 3240 }, { "entropy": 5.586145257949829, "epoch": 0.20864141966180158, "grad_norm": 1.046875, "learning_rate": 0.00011690375679525896, "loss": 5.2532, "mean_token_accuracy": 0.20313566774129868, "num_tokens": 7802144.0, "step": 3245 }, { "entropy": 5.678852701187134, "epoch": 0.2089629010480293, "grad_norm": 1.125, "learning_rate": 0.00011606766954855124, "loss": 5.3082, "mean_token_accuracy": 0.19698686450719832, "num_tokens": 7813642.0, "step": 3250 }, { "entropy": 5.66460862159729, "epoch": 0.20928438243425707, "grad_norm": 1.0625, "learning_rate": 0.00011523593951196702, "loss": 5.39, "mean_token_accuracy": 0.19884335845708848, "num_tokens": 7826907.0, "step": 3255 }, { "entropy": 5.729547786712646, "epoch": 0.2096058638204848, "grad_norm": 1.0, "learning_rate": 0.00011440858948780523, "loss": 5.3696, "mean_token_accuracy": 0.19547089338302612, "num_tokens": 7838759.0, "step": 3260 }, { "entropy": 5.720437288284302, "epoch": 0.20992734520671252, "grad_norm": 1.03125, "learning_rate": 0.00011358564215828484, "loss": 5.3419, "mean_token_accuracy": 0.2006166860461235, "num_tokens": 7851068.0, "step": 3265 }, { "entropy": 5.6538135528564455, "epoch": 0.21024882659294028, "grad_norm": 1.1953125, "learning_rate": 0.00011276712008492254, "loss": 5.2546, "mean_token_accuracy": 0.2034711644053459, "num_tokens": 7862350.0, "step": 3270 }, { "entropy": 5.773383378982544, "epoch": 0.210570307979168, "grad_norm": 1.109375, "learning_rate": 0.00011195304570791451, "loss": 5.4083, "mean_token_accuracy": 0.1907842993736267, "num_tokens": 7873570.0, "step": 3275 }, { "entropy": 5.785184001922607, "epoch": 0.21089178936539574, "grad_norm": 1.0859375, "learning_rate": 0.00011114344134552094, "loss": 5.4345, "mean_token_accuracy": 0.18734802007675172, "num_tokens": 7885614.0, "step": 3280 }, { "entropy": 5.783140087127686, "epoch": 0.2112132707516235, "grad_norm": 0.94140625, "learning_rate": 0.0001103383291934545, "loss": 5.3579, "mean_token_accuracy": 0.19588245898485185, "num_tokens": 7898806.0, "step": 3285 }, { "entropy": 5.677266359329224, "epoch": 0.21153475213785122, "grad_norm": 1.1328125, "learning_rate": 0.00010953773132427141, "loss": 5.333, "mean_token_accuracy": 0.1972532168030739, "num_tokens": 7910284.0, "step": 3290 }, { "entropy": 5.685740852355957, "epoch": 0.21185623352407895, "grad_norm": 1.0859375, "learning_rate": 0.00010874166968676677, "loss": 5.2676, "mean_token_accuracy": 0.19928796738386154, "num_tokens": 7922883.0, "step": 3295 }, { "entropy": 5.74858341217041, "epoch": 0.21217771491030668, "grad_norm": 1.1015625, "learning_rate": 0.00010795016610537251, "loss": 5.358, "mean_token_accuracy": 0.18693713545799256, "num_tokens": 7934613.0, "step": 3300 }, { "entropy": 5.638466262817383, "epoch": 0.21249919629653444, "grad_norm": 1.125, "learning_rate": 0.00010716324227955904, "loss": 5.2766, "mean_token_accuracy": 0.2001914605498314, "num_tokens": 7947134.0, "step": 3305 }, { "entropy": 5.676190614700317, "epoch": 0.21282067768276217, "grad_norm": 1.0625, "learning_rate": 0.0001063809197832406, "loss": 5.2851, "mean_token_accuracy": 0.19636294841766358, "num_tokens": 7959563.0, "step": 3310 }, { "entropy": 5.715634822845459, "epoch": 0.2131421590689899, "grad_norm": 1.03125, "learning_rate": 0.00010560322006418368, "loss": 5.3292, "mean_token_accuracy": 0.19672561585903167, "num_tokens": 7972550.0, "step": 3315 }, { "entropy": 5.786555004119873, "epoch": 0.21346364045521765, "grad_norm": 1.1171875, "learning_rate": 0.00010483016444341887, "loss": 5.4613, "mean_token_accuracy": 0.18897956758737564, "num_tokens": 7984571.0, "step": 3320 }, { "entropy": 5.723170375823974, "epoch": 0.21378512184144538, "grad_norm": 1.109375, "learning_rate": 0.00010406177411465654, "loss": 5.3174, "mean_token_accuracy": 0.19568678438663484, "num_tokens": 7996838.0, "step": 3325 }, { "entropy": 5.6796191215515135, "epoch": 0.2141066032276731, "grad_norm": 1.2109375, "learning_rate": 0.00010329807014370562, "loss": 5.3067, "mean_token_accuracy": 0.19560860246419906, "num_tokens": 8008890.0, "step": 3330 }, { "entropy": 5.673989295959473, "epoch": 0.21442808461390087, "grad_norm": 1.0703125, "learning_rate": 0.00010253907346789632, "loss": 5.3263, "mean_token_accuracy": 0.20047852993011475, "num_tokens": 8020205.0, "step": 3335 }, { "entropy": 5.657972002029419, "epoch": 0.2147495660001286, "grad_norm": 1.171875, "learning_rate": 0.00010178480489550596, "loss": 5.2956, "mean_token_accuracy": 0.1933861941099167, "num_tokens": 8032281.0, "step": 3340 }, { "entropy": 5.693986272811889, "epoch": 0.21507104738635632, "grad_norm": 1.0859375, "learning_rate": 0.00010103528510518836, "loss": 5.3529, "mean_token_accuracy": 0.20255055129528046, "num_tokens": 8045418.0, "step": 3345 }, { "entropy": 5.753715753555298, "epoch": 0.21539252877258408, "grad_norm": 1.0546875, "learning_rate": 0.0001002905346454073, "loss": 5.4235, "mean_token_accuracy": 0.19115626215934753, "num_tokens": 8058037.0, "step": 3350 }, { "entropy": 5.640271711349487, "epoch": 0.2157140101588118, "grad_norm": 1.0078125, "learning_rate": 9.955057393387285e-05, "loss": 5.1694, "mean_token_accuracy": 0.20374646037817, "num_tokens": 8071108.0, "step": 3355 }, { "entropy": 5.6541835308074955, "epoch": 0.21603549154503954, "grad_norm": 0.9765625, "learning_rate": 9.88154232569816e-05, "loss": 5.2434, "mean_token_accuracy": 0.1991315320134163, "num_tokens": 8082613.0, "step": 3360 }, { "entropy": 5.688753509521485, "epoch": 0.21635697293126727, "grad_norm": 1.0859375, "learning_rate": 9.808510276926075e-05, "loss": 5.3123, "mean_token_accuracy": 0.20148408263921738, "num_tokens": 8094636.0, "step": 3365 }, { "entropy": 5.68622522354126, "epoch": 0.21667845431749502, "grad_norm": 1.0625, "learning_rate": 9.735963249281549e-05, "loss": 5.3377, "mean_token_accuracy": 0.1978584349155426, "num_tokens": 8106512.0, "step": 3370 }, { "entropy": 5.6991785049438475, "epoch": 0.21699993570372275, "grad_norm": 0.98046875, "learning_rate": 9.663903231677974e-05, "loss": 5.3617, "mean_token_accuracy": 0.19115650206804274, "num_tokens": 8118904.0, "step": 3375 }, { "entropy": 5.630835056304932, "epoch": 0.21732141708995048, "grad_norm": 1.125, "learning_rate": 9.592332199677145e-05, "loss": 5.2108, "mean_token_accuracy": 0.2114175707101822, "num_tokens": 8131611.0, "step": 3380 }, { "entropy": 5.720883512496949, "epoch": 0.21764289847617824, "grad_norm": 1.0234375, "learning_rate": 9.521252115435061e-05, "loss": 5.355, "mean_token_accuracy": 0.19938598126173018, "num_tokens": 8143623.0, "step": 3385 }, { "entropy": 5.703151082992553, "epoch": 0.21796437986240597, "grad_norm": 1.125, "learning_rate": 9.450664927648126e-05, "loss": 5.3145, "mean_token_accuracy": 0.20495122224092482, "num_tokens": 8154674.0, "step": 3390 }, { "entropy": 5.639169692993164, "epoch": 0.2182858612486337, "grad_norm": 1.03125, "learning_rate": 9.380572571499758e-05, "loss": 5.2716, "mean_token_accuracy": 0.2012424498796463, "num_tokens": 8168228.0, "step": 3395 }, { "entropy": 5.694692230224609, "epoch": 0.21860734263486145, "grad_norm": 0.90625, "learning_rate": 9.310976968607307e-05, "loss": 5.3201, "mean_token_accuracy": 0.2025172919034958, "num_tokens": 8181542.0, "step": 3400 }, { "entropy": 5.607951927185058, "epoch": 0.21892882402108918, "grad_norm": 1.0859375, "learning_rate": 9.241880026969381e-05, "loss": 5.2212, "mean_token_accuracy": 0.20623093843460083, "num_tokens": 8193864.0, "step": 3405 }, { "entropy": 5.776024293899536, "epoch": 0.2192503054073169, "grad_norm": 1.078125, "learning_rate": 9.173283640913537e-05, "loss": 5.3334, "mean_token_accuracy": 0.19746736735105513, "num_tokens": 8205643.0, "step": 3410 }, { "entropy": 5.710318279266358, "epoch": 0.21957178679354467, "grad_norm": 1.15625, "learning_rate": 9.10518969104436e-05, "loss": 5.3613, "mean_token_accuracy": 0.1931696817278862, "num_tokens": 8218422.0, "step": 3415 }, { "entropy": 5.750222301483154, "epoch": 0.2198932681797724, "grad_norm": 1.0859375, "learning_rate": 9.037600044191868e-05, "loss": 5.374, "mean_token_accuracy": 0.1952086344361305, "num_tokens": 8230715.0, "step": 3420 }, { "entropy": 5.650337791442871, "epoch": 0.22021474956600012, "grad_norm": 1.0390625, "learning_rate": 8.970516553360383e-05, "loss": 5.2949, "mean_token_accuracy": 0.1994039684534073, "num_tokens": 8244217.0, "step": 3425 }, { "entropy": 5.720923995971679, "epoch": 0.22053623095222788, "grad_norm": 1.2109375, "learning_rate": 8.903941057677692e-05, "loss": 5.3614, "mean_token_accuracy": 0.19820163398981094, "num_tokens": 8254864.0, "step": 3430 }, { "entropy": 5.671401023864746, "epoch": 0.2208577123384556, "grad_norm": 1.0390625, "learning_rate": 8.837875382344635e-05, "loss": 5.3039, "mean_token_accuracy": 0.20052341669797896, "num_tokens": 8266485.0, "step": 3435 }, { "entropy": 5.707466506958008, "epoch": 0.22117919372468334, "grad_norm": 1.09375, "learning_rate": 8.772321338585076e-05, "loss": 5.3375, "mean_token_accuracy": 0.19078421592712402, "num_tokens": 8278165.0, "step": 3440 }, { "entropy": 5.644604349136353, "epoch": 0.22150067511091107, "grad_norm": 0.90234375, "learning_rate": 8.707280723596242e-05, "loss": 5.3229, "mean_token_accuracy": 0.198736971616745, "num_tokens": 8290550.0, "step": 3445 }, { "entropy": 5.713360023498535, "epoch": 0.22182215649713882, "grad_norm": 1.2265625, "learning_rate": 8.64275532049944e-05, "loss": 5.3825, "mean_token_accuracy": 0.19561683386564255, "num_tokens": 8302598.0, "step": 3450 }, { "entropy": 5.674613380432129, "epoch": 0.22214363788336655, "grad_norm": 0.98046875, "learning_rate": 8.578746898291198e-05, "loss": 5.2341, "mean_token_accuracy": 0.20924482494592667, "num_tokens": 8313815.0, "step": 3455 }, { "entropy": 5.679621362686158, "epoch": 0.22246511926959428, "grad_norm": 1.046875, "learning_rate": 8.515257211794742e-05, "loss": 5.3707, "mean_token_accuracy": 0.1968051165342331, "num_tokens": 8326085.0, "step": 3460 }, { "entropy": 5.658367347717285, "epoch": 0.22278660065582204, "grad_norm": 0.98046875, "learning_rate": 8.452288001611896e-05, "loss": 5.2588, "mean_token_accuracy": 0.20085911750793456, "num_tokens": 8338944.0, "step": 3465 }, { "entropy": 5.625350522994995, "epoch": 0.22310808204204977, "grad_norm": 1.0625, "learning_rate": 8.389840994075379e-05, "loss": 5.2766, "mean_token_accuracy": 0.2059040352702141, "num_tokens": 8352715.0, "step": 3470 }, { "entropy": 5.687177991867065, "epoch": 0.2234295634282775, "grad_norm": 1.0234375, "learning_rate": 8.327917901201435e-05, "loss": 5.3275, "mean_token_accuracy": 0.20172294080257416, "num_tokens": 8364484.0, "step": 3475 }, { "entropy": 5.715560483932495, "epoch": 0.22375104481450525, "grad_norm": 1.109375, "learning_rate": 8.266520420642931e-05, "loss": 5.2983, "mean_token_accuracy": 0.19617073237895966, "num_tokens": 8375733.0, "step": 3480 }, { "entropy": 5.67339015007019, "epoch": 0.22407252620073298, "grad_norm": 1.078125, "learning_rate": 8.205650235642828e-05, "loss": 5.2799, "mean_token_accuracy": 0.20136843770742416, "num_tokens": 8387418.0, "step": 3485 }, { "entropy": 5.650016260147095, "epoch": 0.2243940075869607, "grad_norm": 1.046875, "learning_rate": 8.145309014987978e-05, "loss": 5.3297, "mean_token_accuracy": 0.19268136769533156, "num_tokens": 8399463.0, "step": 3490 }, { "entropy": 5.655723714828492, "epoch": 0.22471548897318847, "grad_norm": 1.0625, "learning_rate": 8.085498412963437e-05, "loss": 5.2701, "mean_token_accuracy": 0.20115672051906586, "num_tokens": 8411769.0, "step": 3495 }, { "entropy": 5.651788568496704, "epoch": 0.2250369703594162, "grad_norm": 1.0, "learning_rate": 8.026220069307078e-05, "loss": 5.2304, "mean_token_accuracy": 0.20759440511465072, "num_tokens": 8423379.0, "step": 3500 }, { "entropy": 5.692746257781982, "epoch": 0.22535845174564392, "grad_norm": 1.0703125, "learning_rate": 7.967475609164621e-05, "loss": 5.2221, "mean_token_accuracy": 0.19854397624731063, "num_tokens": 8435911.0, "step": 3505 }, { "entropy": 5.635363006591797, "epoch": 0.22567993313187165, "grad_norm": 1.0, "learning_rate": 7.909266643045124e-05, "loss": 5.2434, "mean_token_accuracy": 0.20194872766733168, "num_tokens": 8448194.0, "step": 3510 }, { "entropy": 5.632513570785522, "epoch": 0.2260014145180994, "grad_norm": 1.1171875, "learning_rate": 7.851594766776802e-05, "loss": 5.2197, "mean_token_accuracy": 0.20390249639749528, "num_tokens": 8459509.0, "step": 3515 }, { "entropy": 5.700380039215088, "epoch": 0.22632289590432714, "grad_norm": 0.96875, "learning_rate": 7.794461561463265e-05, "loss": 5.3813, "mean_token_accuracy": 0.19409235417842866, "num_tokens": 8471948.0, "step": 3520 }, { "entropy": 5.689787912368774, "epoch": 0.22664437729055487, "grad_norm": 1.0859375, "learning_rate": 7.7378685934402e-05, "loss": 5.3463, "mean_token_accuracy": 0.197079536318779, "num_tokens": 8484178.0, "step": 3525 }, { "entropy": 5.685953426361084, "epoch": 0.22696585867678262, "grad_norm": 1.0703125, "learning_rate": 7.68181741423242e-05, "loss": 5.3317, "mean_token_accuracy": 0.2003867119550705, "num_tokens": 8495589.0, "step": 3530 }, { "entropy": 5.718843460083008, "epoch": 0.22728734006301035, "grad_norm": 1.109375, "learning_rate": 7.626309560511313e-05, "loss": 5.293, "mean_token_accuracy": 0.19790822863578797, "num_tokens": 8506552.0, "step": 3535 }, { "entropy": 5.5831794261932375, "epoch": 0.22760882144923808, "grad_norm": 1.03125, "learning_rate": 7.571346554052724e-05, "loss": 5.1693, "mean_token_accuracy": 0.20346883237361907, "num_tokens": 8518337.0, "step": 3540 }, { "entropy": 5.739927577972412, "epoch": 0.22793030283546584, "grad_norm": 1.1328125, "learning_rate": 7.516929901695249e-05, "loss": 5.3797, "mean_token_accuracy": 0.19248567372560502, "num_tokens": 8529780.0, "step": 3545 }, { "entropy": 5.627037811279297, "epoch": 0.22825178422169357, "grad_norm": 1.015625, "learning_rate": 7.463061095298893e-05, "loss": 5.2956, "mean_token_accuracy": 0.20026460736989976, "num_tokens": 8541793.0, "step": 3550 }, { "entropy": 5.684912252426147, "epoch": 0.2285732656079213, "grad_norm": 1.0390625, "learning_rate": 7.409741611704198e-05, "loss": 5.318, "mean_token_accuracy": 0.19583726525306702, "num_tokens": 8553219.0, "step": 3555 }, { "entropy": 5.694780778884888, "epoch": 0.22889474699414905, "grad_norm": 1.09375, "learning_rate": 7.35697291269174e-05, "loss": 5.2646, "mean_token_accuracy": 0.2018799751996994, "num_tokens": 8564441.0, "step": 3560 }, { "entropy": 5.583677959442139, "epoch": 0.22921622838037678, "grad_norm": 1.140625, "learning_rate": 7.304756444942056e-05, "loss": 5.182, "mean_token_accuracy": 0.20556325018405913, "num_tokens": 8575816.0, "step": 3565 }, { "entropy": 5.682976007461548, "epoch": 0.2295377097666045, "grad_norm": 1.03125, "learning_rate": 7.253093639995994e-05, "loss": 5.265, "mean_token_accuracy": 0.19374409765005113, "num_tokens": 8587153.0, "step": 3570 }, { "entropy": 5.583881807327271, "epoch": 0.22985919115283224, "grad_norm": 0.97265625, "learning_rate": 7.20198591421544e-05, "loss": 5.1364, "mean_token_accuracy": 0.213246089220047, "num_tokens": 8600344.0, "step": 3575 }, { "entropy": 5.698566675186157, "epoch": 0.23018067253906, "grad_norm": 0.97265625, "learning_rate": 7.151434668744517e-05, "loss": 5.3039, "mean_token_accuracy": 0.19849002808332444, "num_tokens": 8613887.0, "step": 3580 }, { "entropy": 5.683745002746582, "epoch": 0.23050215392528772, "grad_norm": 1.0234375, "learning_rate": 7.101441289471153e-05, "loss": 5.3247, "mean_token_accuracy": 0.2001488283276558, "num_tokens": 8625226.0, "step": 3585 }, { "entropy": 5.680375480651856, "epoch": 0.23082363531151545, "grad_norm": 0.93359375, "learning_rate": 7.052007146989098e-05, "loss": 5.2654, "mean_token_accuracy": 0.20082223266363144, "num_tokens": 8636783.0, "step": 3590 }, { "entropy": 5.680129861831665, "epoch": 0.2311451166977432, "grad_norm": 1.1484375, "learning_rate": 7.003133596560341e-05, "loss": 5.2862, "mean_token_accuracy": 0.20510793328285218, "num_tokens": 8649075.0, "step": 3595 }, { "entropy": 5.619606256484985, "epoch": 0.23146659808397094, "grad_norm": 1.2109375, "learning_rate": 6.954821978077952e-05, "loss": 5.2247, "mean_token_accuracy": 0.20059150755405425, "num_tokens": 8660676.0, "step": 3600 }, { "entropy": 5.6817272186279295, "epoch": 0.23178807947019867, "grad_norm": 0.98046875, "learning_rate": 6.907073616029356e-05, "loss": 5.3146, "mean_token_accuracy": 0.19552652388811112, "num_tokens": 8672764.0, "step": 3605 }, { "entropy": 5.704168701171875, "epoch": 0.23210956085642642, "grad_norm": 1.1796875, "learning_rate": 6.85988981946002e-05, "loss": 5.4034, "mean_token_accuracy": 0.19097378402948378, "num_tokens": 8685089.0, "step": 3610 }, { "entropy": 5.75290002822876, "epoch": 0.23243104224265415, "grad_norm": 0.98828125, "learning_rate": 6.813271881937564e-05, "loss": 5.4234, "mean_token_accuracy": 0.19511285573244094, "num_tokens": 8697874.0, "step": 3615 }, { "entropy": 5.693648958206177, "epoch": 0.23275252362888188, "grad_norm": 1.1015625, "learning_rate": 6.767221081516286e-05, "loss": 5.3382, "mean_token_accuracy": 0.19941326677799226, "num_tokens": 8709011.0, "step": 3620 }, { "entropy": 5.621293735504151, "epoch": 0.23307400501510964, "grad_norm": 1.03125, "learning_rate": 6.72173868070215e-05, "loss": 5.2009, "mean_token_accuracy": 0.21116897761821746, "num_tokens": 8720757.0, "step": 3625 }, { "entropy": 5.719403266906738, "epoch": 0.23339548640133737, "grad_norm": 1.234375, "learning_rate": 6.676825926418149e-05, "loss": 5.2516, "mean_token_accuracy": 0.20473720282316207, "num_tokens": 8731472.0, "step": 3630 }, { "entropy": 5.67295389175415, "epoch": 0.2337169677875651, "grad_norm": 1.1796875, "learning_rate": 6.632484049970122e-05, "loss": 5.2406, "mean_token_accuracy": 0.19585577249526978, "num_tokens": 8742727.0, "step": 3635 }, { "entropy": 5.664002132415772, "epoch": 0.23403844917379285, "grad_norm": 1.109375, "learning_rate": 6.588714267013019e-05, "loss": 5.2942, "mean_token_accuracy": 0.19861387759447097, "num_tokens": 8753967.0, "step": 3640 }, { "entropy": 5.591110801696777, "epoch": 0.23435993056002058, "grad_norm": 1.046875, "learning_rate": 6.545517777517544e-05, "loss": 5.1874, "mean_token_accuracy": 0.2069718584418297, "num_tokens": 8765515.0, "step": 3645 }, { "entropy": 5.655759000778199, "epoch": 0.2346814119462483, "grad_norm": 1.1015625, "learning_rate": 6.502895765737281e-05, "loss": 5.2666, "mean_token_accuracy": 0.20165703296661378, "num_tokens": 8777003.0, "step": 3650 }, { "entropy": 5.700712966918945, "epoch": 0.23500289333247604, "grad_norm": 1.1796875, "learning_rate": 6.460849400176212e-05, "loss": 5.3855, "mean_token_accuracy": 0.19385648071765899, "num_tokens": 8788381.0, "step": 3655 }, { "entropy": 5.643852949142456, "epoch": 0.2353243747187038, "grad_norm": 1.0546875, "learning_rate": 6.419379833556694e-05, "loss": 5.285, "mean_token_accuracy": 0.19561086297035218, "num_tokens": 8801029.0, "step": 3660 }, { "entropy": 5.667983055114746, "epoch": 0.23564585610493152, "grad_norm": 1.09375, "learning_rate": 6.378488202787835e-05, "loss": 5.2523, "mean_token_accuracy": 0.20091474503278733, "num_tokens": 8813000.0, "step": 3665 }, { "entropy": 5.6991781234741214, "epoch": 0.23596733749115925, "grad_norm": 1.078125, "learning_rate": 6.33817562893435e-05, "loss": 5.2347, "mean_token_accuracy": 0.20347409397363664, "num_tokens": 8824464.0, "step": 3670 }, { "entropy": 5.635638046264648, "epoch": 0.236288818877387, "grad_norm": 1.03125, "learning_rate": 6.29844321718582e-05, "loss": 5.2346, "mean_token_accuracy": 0.20303197354078292, "num_tokens": 8837721.0, "step": 3675 }, { "entropy": 5.687632703781128, "epoch": 0.23661030026361474, "grad_norm": 1.1484375, "learning_rate": 6.259292056826383e-05, "loss": 5.2805, "mean_token_accuracy": 0.2010258376598358, "num_tokens": 8849762.0, "step": 3680 }, { "entropy": 5.691197443008423, "epoch": 0.23693178164984247, "grad_norm": 1.0703125, "learning_rate": 6.220723221204873e-05, "loss": 5.384, "mean_token_accuracy": 0.19270389080047606, "num_tokens": 8862841.0, "step": 3685 }, { "entropy": 5.699932479858399, "epoch": 0.23725326303607022, "grad_norm": 1.1328125, "learning_rate": 6.182737767705406e-05, "loss": 5.3573, "mean_token_accuracy": 0.19755517244338988, "num_tokens": 8874752.0, "step": 3690 }, { "entropy": 5.715799617767334, "epoch": 0.23757474442229795, "grad_norm": 0.9765625, "learning_rate": 6.145336737718375e-05, "loss": 5.3173, "mean_token_accuracy": 0.20065080672502517, "num_tokens": 8887024.0, "step": 3695 }, { "entropy": 5.673880481719971, "epoch": 0.23789622580852568, "grad_norm": 1.0625, "learning_rate": 6.10852115661191e-05, "loss": 5.2812, "mean_token_accuracy": 0.200140118598938, "num_tokens": 8898659.0, "step": 3700 }, { "entropy": 5.759790563583374, "epoch": 0.23821770719475344, "grad_norm": 1.0703125, "learning_rate": 6.072292033703766e-05, "loss": 5.2984, "mean_token_accuracy": 0.2028074860572815, "num_tokens": 8911397.0, "step": 3705 }, { "entropy": 5.632653379440308, "epoch": 0.23853918858098117, "grad_norm": 0.99609375, "learning_rate": 6.036650362233648e-05, "loss": 5.2006, "mean_token_accuracy": 0.20838613212108612, "num_tokens": 8923602.0, "step": 3710 }, { "entropy": 5.6599424362182615, "epoch": 0.2388606699672089, "grad_norm": 1.046875, "learning_rate": 6.0015971193359824e-05, "loss": 5.2539, "mean_token_accuracy": 0.1988781735301018, "num_tokens": 8937296.0, "step": 3715 }, { "entropy": 5.723764896392822, "epoch": 0.23918215135343662, "grad_norm": 1.03125, "learning_rate": 5.9671332660131306e-05, "loss": 5.3608, "mean_token_accuracy": 0.20242195427417756, "num_tokens": 8947984.0, "step": 3720 }, { "entropy": 5.623197221755982, "epoch": 0.23950363273966438, "grad_norm": 1.0234375, "learning_rate": 5.933259747109042e-05, "loss": 5.2446, "mean_token_accuracy": 0.2054684117436409, "num_tokens": 8959678.0, "step": 3725 }, { "entropy": 5.706287479400634, "epoch": 0.2398251141258921, "grad_norm": 1.1484375, "learning_rate": 5.899977491283351e-05, "loss": 5.3031, "mean_token_accuracy": 0.19668049812316896, "num_tokens": 8971579.0, "step": 3730 }, { "entropy": 5.623121833801269, "epoch": 0.24014659551211984, "grad_norm": 1.109375, "learning_rate": 5.867287410985908e-05, "loss": 5.268, "mean_token_accuracy": 0.20412003844976426, "num_tokens": 8984230.0, "step": 3735 }, { "entropy": 5.65015869140625, "epoch": 0.2404680768983476, "grad_norm": 1.0390625, "learning_rate": 5.835190402431779e-05, "loss": 5.2788, "mean_token_accuracy": 0.2000853642821312, "num_tokens": 8997603.0, "step": 3740 }, { "entropy": 5.680951404571533, "epoch": 0.24078955828457532, "grad_norm": 1.1328125, "learning_rate": 5.803687345576673e-05, "loss": 5.2832, "mean_token_accuracy": 0.20196807980537415, "num_tokens": 9009408.0, "step": 3745 }, { "entropy": 5.687997198104858, "epoch": 0.24111103967080305, "grad_norm": 0.95703125, "learning_rate": 5.7727791040927977e-05, "loss": 5.2836, "mean_token_accuracy": 0.20055275410413742, "num_tokens": 9022716.0, "step": 3750 }, { "entropy": 5.688543176651001, "epoch": 0.2414325210570308, "grad_norm": 1.0546875, "learning_rate": 5.742466525345213e-05, "loss": 5.2728, "mean_token_accuracy": 0.20332681983709336, "num_tokens": 9033438.0, "step": 3755 }, { "entropy": 5.683680677413941, "epoch": 0.24175400244325854, "grad_norm": 1.0078125, "learning_rate": 5.7127504403685775e-05, "loss": 5.3497, "mean_token_accuracy": 0.19564610719680786, "num_tokens": 9045319.0, "step": 3760 }, { "entropy": 5.624217939376831, "epoch": 0.24207548382948627, "grad_norm": 1.0546875, "learning_rate": 5.6836316638443664e-05, "loss": 5.2564, "mean_token_accuracy": 0.20246215164661407, "num_tokens": 9056485.0, "step": 3765 }, { "entropy": 5.543730163574219, "epoch": 0.24239696521571402, "grad_norm": 0.95703125, "learning_rate": 5.655110994078553e-05, "loss": 5.1659, "mean_token_accuracy": 0.21224381923675537, "num_tokens": 9068299.0, "step": 3770 }, { "entropy": 5.698646593093872, "epoch": 0.24271844660194175, "grad_norm": 0.94921875, "learning_rate": 5.6271892129797056e-05, "loss": 5.2863, "mean_token_accuracy": 0.20125415027141572, "num_tokens": 9081454.0, "step": 3775 }, { "entropy": 5.769183778762818, "epoch": 0.24303992798816948, "grad_norm": 1.15625, "learning_rate": 5.599867086037556e-05, "loss": 5.3737, "mean_token_accuracy": 0.19297700524330139, "num_tokens": 9093268.0, "step": 3780 }, { "entropy": 5.65725154876709, "epoch": 0.24336140937439724, "grad_norm": 1.046875, "learning_rate": 5.573145362302012e-05, "loss": 5.2895, "mean_token_accuracy": 0.20559481680393218, "num_tokens": 9104989.0, "step": 3785 }, { "entropy": 5.667236614227295, "epoch": 0.24368289076062497, "grad_norm": 1.0625, "learning_rate": 5.5470247743626404e-05, "loss": 5.2726, "mean_token_accuracy": 0.20151380747556685, "num_tokens": 9116792.0, "step": 3790 }, { "entropy": 5.675897598266602, "epoch": 0.2440043721468527, "grad_norm": 1.1171875, "learning_rate": 5.5215060383285414e-05, "loss": 5.255, "mean_token_accuracy": 0.20210395157337188, "num_tokens": 9128587.0, "step": 3795 }, { "entropy": 5.628965091705322, "epoch": 0.24432585353308042, "grad_norm": 1.046875, "learning_rate": 5.496589853808759e-05, "loss": 5.2583, "mean_token_accuracy": 0.2030947908759117, "num_tokens": 9141051.0, "step": 3800 }, { "entropy": 5.692878484725952, "epoch": 0.24464733491930818, "grad_norm": 1.09375, "learning_rate": 5.47227690389308e-05, "loss": 5.2782, "mean_token_accuracy": 0.20783305466175078, "num_tokens": 9152859.0, "step": 3805 }, { "entropy": 5.681114959716797, "epoch": 0.2449688163055359, "grad_norm": 1.0859375, "learning_rate": 5.448567855133306e-05, "loss": 5.3327, "mean_token_accuracy": 0.20324327945709228, "num_tokens": 9165439.0, "step": 3810 }, { "entropy": 5.663989448547364, "epoch": 0.24529029769176364, "grad_norm": 1.15625, "learning_rate": 5.425463357524986e-05, "loss": 5.264, "mean_token_accuracy": 0.20210357159376144, "num_tokens": 9176494.0, "step": 3815 }, { "entropy": 5.6782022476196286, "epoch": 0.2456117790779914, "grad_norm": 1.03125, "learning_rate": 5.402964044489591e-05, "loss": 5.2401, "mean_token_accuracy": 0.20158211141824722, "num_tokens": 9187764.0, "step": 3820 }, { "entropy": 5.7141107559204105, "epoch": 0.24593326046421912, "grad_norm": 1.2578125, "learning_rate": 5.381070532857153e-05, "loss": 5.3831, "mean_token_accuracy": 0.19272553771734238, "num_tokens": 9198738.0, "step": 3825 }, { "entropy": 5.5827168941497805, "epoch": 0.24625474185044685, "grad_norm": 1.1328125, "learning_rate": 5.359783422849357e-05, "loss": 5.1938, "mean_token_accuracy": 0.20737040787935257, "num_tokens": 9210296.0, "step": 3830 }, { "entropy": 5.740968513488769, "epoch": 0.2465762232366746, "grad_norm": 1.0390625, "learning_rate": 5.3391032980630736e-05, "loss": 5.4101, "mean_token_accuracy": 0.19421288669109343, "num_tokens": 9222763.0, "step": 3835 }, { "entropy": 5.664235353469849, "epoch": 0.24689770462290234, "grad_norm": 1.2578125, "learning_rate": 5.31903072545437e-05, "loss": 5.2729, "mean_token_accuracy": 0.2001529663801193, "num_tokens": 9234051.0, "step": 3840 }, { "entropy": 5.644949102401734, "epoch": 0.24721918600913007, "grad_norm": 1.15625, "learning_rate": 5.29956625532297e-05, "loss": 5.2492, "mean_token_accuracy": 0.20865264683961868, "num_tokens": 9247110.0, "step": 3845 }, { "entropy": 5.7144701957702635, "epoch": 0.24754066739535782, "grad_norm": 1.0859375, "learning_rate": 5.280710421297146e-05, "loss": 5.2917, "mean_token_accuracy": 0.20194337517023087, "num_tokens": 9258218.0, "step": 3850 }, { "entropy": 5.730938959121704, "epoch": 0.24786214878158555, "grad_norm": 1.046875, "learning_rate": 5.2624637403191165e-05, "loss": 5.4253, "mean_token_accuracy": 0.1920547902584076, "num_tokens": 9269276.0, "step": 3855 }, { "entropy": 5.731932544708252, "epoch": 0.24818363016781328, "grad_norm": 1.0546875, "learning_rate": 5.2448267126308605e-05, "loss": 5.3631, "mean_token_accuracy": 0.19870235323905944, "num_tokens": 9281527.0, "step": 3860 }, { "entropy": 5.740797901153565, "epoch": 0.248505111554041, "grad_norm": 1.1015625, "learning_rate": 5.2277998217603954e-05, "loss": 5.2604, "mean_token_accuracy": 0.20217375010251998, "num_tokens": 9293896.0, "step": 3865 }, { "entropy": 5.679200124740601, "epoch": 0.24882659294026876, "grad_norm": 1.234375, "learning_rate": 5.211383534508541e-05, "loss": 5.2885, "mean_token_accuracy": 0.19908830225467683, "num_tokens": 9305391.0, "step": 3870 }, { "entropy": 5.684812307357788, "epoch": 0.2491480743264965, "grad_norm": 1.0234375, "learning_rate": 5.1955783009361044e-05, "loss": 5.3085, "mean_token_accuracy": 0.20086860805749893, "num_tokens": 9317548.0, "step": 3875 }, { "entropy": 5.627917671203614, "epoch": 0.24946955571272422, "grad_norm": 1.1328125, "learning_rate": 5.180384554351543e-05, "loss": 5.2654, "mean_token_accuracy": 0.20540436059236528, "num_tokens": 9329388.0, "step": 3880 }, { "entropy": 5.655716133117676, "epoch": 0.24979103709895198, "grad_norm": 1.0078125, "learning_rate": 5.1658027112990976e-05, "loss": 5.2691, "mean_token_accuracy": 0.2007491946220398, "num_tokens": 9341272.0, "step": 3885 }, { "entropy": 5.680225849151611, "epoch": 0.25011251848517974, "grad_norm": 1.109375, "learning_rate": 5.151833171547365e-05, "loss": 5.2652, "mean_token_accuracy": 0.20512863993644714, "num_tokens": 9351014.0, "step": 3890 }, { "entropy": 5.656824970245362, "epoch": 0.25043399987140746, "grad_norm": 1.015625, "learning_rate": 5.1384763180783274e-05, "loss": 5.2334, "mean_token_accuracy": 0.21047524362802505, "num_tokens": 9363222.0, "step": 3895 }, { "entropy": 5.649700403213501, "epoch": 0.2507554812576352, "grad_norm": 1.125, "learning_rate": 5.125732517076876e-05, "loss": 5.3042, "mean_token_accuracy": 0.19423505216836928, "num_tokens": 9375310.0, "step": 3900 }, { "entropy": 5.725096321105957, "epoch": 0.2510769626438629, "grad_norm": 0.9921875, "learning_rate": 5.113602117920747e-05, "loss": 5.3269, "mean_token_accuracy": 0.1984973058104515, "num_tokens": 9388609.0, "step": 3905 }, { "entropy": 5.680875587463379, "epoch": 0.25139844403009065, "grad_norm": 1.140625, "learning_rate": 5.102085453170966e-05, "loss": 5.2746, "mean_token_accuracy": 0.20440600961446762, "num_tokens": 9399346.0, "step": 3910 }, { "entropy": 5.7092067241668705, "epoch": 0.2517199254163184, "grad_norm": 1.125, "learning_rate": 5.091182838562709e-05, "loss": 5.3309, "mean_token_accuracy": 0.1959042191505432, "num_tokens": 9411422.0, "step": 3915 }, { "entropy": 5.729714488983154, "epoch": 0.2520414068025461, "grad_norm": 1.140625, "learning_rate": 5.0808945729966716e-05, "loss": 5.3504, "mean_token_accuracy": 0.19500927329063417, "num_tokens": 9423984.0, "step": 3920 }, { "entropy": 5.645140647888184, "epoch": 0.2523628881887739, "grad_norm": 1.0390625, "learning_rate": 5.071220938530844e-05, "loss": 5.2598, "mean_token_accuracy": 0.20775411278009415, "num_tokens": 9435767.0, "step": 3925 }, { "entropy": 5.7723101615905765, "epoch": 0.2526843695750016, "grad_norm": 1.09375, "learning_rate": 5.0621622003728026e-05, "loss": 5.3035, "mean_token_accuracy": 0.19413377940654755, "num_tokens": 9447717.0, "step": 3930 }, { "entropy": 5.670654726028443, "epoch": 0.25300585096122935, "grad_norm": 1.109375, "learning_rate": 5.053718606872433e-05, "loss": 5.2274, "mean_token_accuracy": 0.20076863169670106, "num_tokens": 9459375.0, "step": 3935 }, { "entropy": 5.71533432006836, "epoch": 0.2533273323474571, "grad_norm": 1.078125, "learning_rate": 5.0458903895151134e-05, "loss": 5.2925, "mean_token_accuracy": 0.20246988236904145, "num_tokens": 9471481.0, "step": 3940 }, { "entropy": 5.707280588150025, "epoch": 0.2536488137336848, "grad_norm": 1.0625, "learning_rate": 5.038677762915381e-05, "loss": 5.2357, "mean_token_accuracy": 0.2076707273721695, "num_tokens": 9482888.0, "step": 3945 }, { "entropy": 5.753081798553467, "epoch": 0.25397029511991254, "grad_norm": 1.015625, "learning_rate": 5.032080924811033e-05, "loss": 5.3518, "mean_token_accuracy": 0.19424958527088165, "num_tokens": 9494758.0, "step": 3950 }, { "entropy": 5.668101358413696, "epoch": 0.2542917765061403, "grad_norm": 1.109375, "learning_rate": 5.026100056057718e-05, "loss": 5.3051, "mean_token_accuracy": 0.2045139789581299, "num_tokens": 9507581.0, "step": 3955 }, { "entropy": 5.719815969467163, "epoch": 0.25461325789236805, "grad_norm": 1.1328125, "learning_rate": 5.0207353206239764e-05, "loss": 5.308, "mean_token_accuracy": 0.19098892360925673, "num_tokens": 9518867.0, "step": 3960 }, { "entropy": 5.618879127502441, "epoch": 0.2549347392785958, "grad_norm": 0.92578125, "learning_rate": 5.0159868655867436e-05, "loss": 5.231, "mean_token_accuracy": 0.20844484567642213, "num_tokens": 9531796.0, "step": 3965 }, { "entropy": 5.642787981033325, "epoch": 0.2552562206648235, "grad_norm": 0.99609375, "learning_rate": 5.011854821127305e-05, "loss": 5.3075, "mean_token_accuracy": 0.20064570456743241, "num_tokens": 9544876.0, "step": 3970 }, { "entropy": 5.590437412261963, "epoch": 0.25557770205105124, "grad_norm": 1.21875, "learning_rate": 5.008339300527755e-05, "loss": 5.1458, "mean_token_accuracy": 0.20853096544742583, "num_tokens": 9555586.0, "step": 3975 }, { "entropy": 5.761137533187866, "epoch": 0.25589918343727897, "grad_norm": 1.2109375, "learning_rate": 5.005440400167859e-05, "loss": 5.344, "mean_token_accuracy": 0.1932593524456024, "num_tokens": 9566207.0, "step": 3980 }, { "entropy": 5.676320552825928, "epoch": 0.2562206648235067, "grad_norm": 1.0546875, "learning_rate": 5.003158199522442e-05, "loss": 5.3363, "mean_token_accuracy": 0.19170307219028473, "num_tokens": 9578214.0, "step": 3985 }, { "entropy": 5.613068008422852, "epoch": 0.2565421462097345, "grad_norm": 1.2265625, "learning_rate": 5.0014927611591806e-05, "loss": 5.1969, "mean_token_accuracy": 0.21006548702716826, "num_tokens": 9589153.0, "step": 3990 }, { "entropy": 5.674917936325073, "epoch": 0.2568636275959622, "grad_norm": 1.0078125, "learning_rate": 5.000444130736916e-05, "loss": 5.2624, "mean_token_accuracy": 0.20349576324224472, "num_tokens": 9601933.0, "step": 3995 }, { "entropy": 5.676444005966187, "epoch": 0.25718510898218994, "grad_norm": 1.078125, "learning_rate": 5.0000123370043736e-05, "loss": 5.298, "mean_token_accuracy": 0.1987135112285614, "num_tokens": 9612995.0, "step": 4000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": true }, "attributes": {} } }, "total_flos": 2162414036090880.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }