{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.12859255449109497, "eval_steps": 500, "global_step": 2000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742344284057618, "epoch": 0.00032148138622773744, "grad_norm": 5.1875, "learning_rate": 2e-06, "loss": 10.7889, "mean_token_accuracy": 0.0001923076924867928, "num_tokens": 10787.0, "step": 5 }, { "entropy": 10.742341995239258, "epoch": 0.0006429627724554749, "grad_norm": 4.6875, "learning_rate": 4.5e-06, "loss": 10.7754, "mean_token_accuracy": 9.199631749652326e-05, "num_tokens": 21408.0, "step": 10 }, { "entropy": 10.74231481552124, "epoch": 0.0009644441586832123, "grad_norm": 4.84375, "learning_rate": 7e-06, "loss": 10.7745, "mean_token_accuracy": 0.0, "num_tokens": 33838.0, "step": 15 }, { "entropy": 10.742263031005859, "epoch": 0.0012859255449109497, "grad_norm": 4.875, "learning_rate": 9.5e-06, "loss": 10.7415, "mean_token_accuracy": 0.0, "num_tokens": 46592.0, "step": 20 }, { "entropy": 10.742058944702148, "epoch": 0.001607406931138687, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 10.6278, "mean_token_accuracy": 0.00028761792345903813, "num_tokens": 57409.0, "step": 25 }, { "entropy": 10.741728782653809, "epoch": 0.0019288883173664245, "grad_norm": 3.71875, "learning_rate": 1.4500000000000002e-05, "loss": 10.5262, "mean_token_accuracy": 0.005182119726669043, "num_tokens": 68705.0, "step": 30 }, { "entropy": 10.74124059677124, "epoch": 0.002250369703594162, "grad_norm": 3.09375, "learning_rate": 1.7000000000000003e-05, "loss": 10.4297, "mean_token_accuracy": 0.019557270966470242, "num_tokens": 81460.0, "step": 35 }, { "entropy": 10.740433311462402, "epoch": 0.0025718510898218995, "grad_norm": 2.5, "learning_rate": 1.95e-05, "loss": 10.2725, "mean_token_accuracy": 0.02960890345275402, "num_tokens": 93576.0, "step": 40 }, { "entropy": 10.739229869842529, "epoch": 0.0028933324760496365, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1857, "mean_token_accuracy": 0.02886150423437357, "num_tokens": 105556.0, "step": 45 }, { "entropy": 10.738618659973145, "epoch": 0.003214813862277374, "grad_norm": 2.03125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0792, "mean_token_accuracy": 0.031074166856706144, "num_tokens": 117850.0, "step": 50 }, { "entropy": 10.738714694976807, "epoch": 0.0035362952485051115, "grad_norm": 1.9296875, "learning_rate": 2.7e-05, "loss": 10.0244, "mean_token_accuracy": 0.031163782812654972, "num_tokens": 130955.0, "step": 55 }, { "entropy": 10.738016033172608, "epoch": 0.003857776634732849, "grad_norm": 1.9140625, "learning_rate": 2.95e-05, "loss": 9.9307, "mean_token_accuracy": 0.03660368006676436, "num_tokens": 141959.0, "step": 60 }, { "entropy": 10.736786365509033, "epoch": 0.0041792580209605865, "grad_norm": 1.84375, "learning_rate": 3.2e-05, "loss": 9.8915, "mean_token_accuracy": 0.03608605414628983, "num_tokens": 153856.0, "step": 65 }, { "entropy": 10.73516550064087, "epoch": 0.004500739407188324, "grad_norm": 1.9140625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8384, "mean_token_accuracy": 0.043716078624129295, "num_tokens": 166748.0, "step": 70 }, { "entropy": 10.732550621032715, "epoch": 0.0048222207934160615, "grad_norm": 1.9375, "learning_rate": 3.7e-05, "loss": 9.728, "mean_token_accuracy": 0.04251385778188706, "num_tokens": 177172.0, "step": 75 }, { "entropy": 10.728882122039796, "epoch": 0.005143702179643799, "grad_norm": 1.8046875, "learning_rate": 3.95e-05, "loss": 9.6737, "mean_token_accuracy": 0.04158058017492294, "num_tokens": 189418.0, "step": 80 }, { "entropy": 10.723980331420899, "epoch": 0.0054651835658715365, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 9.5846, "mean_token_accuracy": 0.039340490289032456, "num_tokens": 201349.0, "step": 85 }, { "entropy": 10.718004131317139, "epoch": 0.005786664952099273, "grad_norm": 1.8046875, "learning_rate": 4.45e-05, "loss": 9.5176, "mean_token_accuracy": 0.04345524609088898, "num_tokens": 212298.0, "step": 90 }, { "entropy": 10.710467433929443, "epoch": 0.0061081463383270106, "grad_norm": 1.796875, "learning_rate": 4.7000000000000004e-05, "loss": 9.467, "mean_token_accuracy": 0.04573878571391106, "num_tokens": 223831.0, "step": 95 }, { "entropy": 10.699566841125488, "epoch": 0.006429627724554748, "grad_norm": 1.78125, "learning_rate": 4.9500000000000004e-05, "loss": 9.3601, "mean_token_accuracy": 0.04835316389799118, "num_tokens": 236675.0, "step": 100 }, { "entropy": 10.683355236053467, "epoch": 0.0067511091107824855, "grad_norm": 1.7421875, "learning_rate": 5.2e-05, "loss": 9.242, "mean_token_accuracy": 0.04662417732179165, "num_tokens": 247634.0, "step": 105 }, { "entropy": 10.66143503189087, "epoch": 0.007072590497010223, "grad_norm": 1.8046875, "learning_rate": 5.45e-05, "loss": 9.1162, "mean_token_accuracy": 0.05328451320528984, "num_tokens": 259101.0, "step": 110 }, { "entropy": 10.631138801574707, "epoch": 0.0073940718832379605, "grad_norm": 1.6328125, "learning_rate": 5.7e-05, "loss": 9.0393, "mean_token_accuracy": 0.05271790884435177, "num_tokens": 272151.0, "step": 115 }, { "entropy": 10.594438171386718, "epoch": 0.007715553269465698, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.8606, "mean_token_accuracy": 0.057512912154197696, "num_tokens": 283619.0, "step": 120 }, { "entropy": 10.537901401519775, "epoch": 0.008037034655693436, "grad_norm": 1.734375, "learning_rate": 6.2e-05, "loss": 8.7551, "mean_token_accuracy": 0.05864038914442062, "num_tokens": 296233.0, "step": 125 }, { "entropy": 10.46686897277832, "epoch": 0.008358516041921173, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.6685, "mean_token_accuracy": 0.05632430389523506, "num_tokens": 309222.0, "step": 130 }, { "entropy": 10.386721515655518, "epoch": 0.00867999742814891, "grad_norm": 1.515625, "learning_rate": 6.7e-05, "loss": 8.4983, "mean_token_accuracy": 0.05754401199519634, "num_tokens": 322291.0, "step": 135 }, { "entropy": 10.285922241210937, "epoch": 0.009001478814376648, "grad_norm": 1.484375, "learning_rate": 6.950000000000001e-05, "loss": 8.3328, "mean_token_accuracy": 0.06465739980340005, "num_tokens": 333520.0, "step": 140 }, { "entropy": 10.168986701965332, "epoch": 0.009322960200604385, "grad_norm": 1.453125, "learning_rate": 7.2e-05, "loss": 8.1641, "mean_token_accuracy": 0.0657901257276535, "num_tokens": 344883.0, "step": 145 }, { "entropy": 10.042533111572265, "epoch": 0.009644441586832123, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 8.0727, "mean_token_accuracy": 0.07245785929262638, "num_tokens": 356600.0, "step": 150 }, { "entropy": 9.882461643218994, "epoch": 0.00996592297305986, "grad_norm": 1.4609375, "learning_rate": 7.7e-05, "loss": 7.9127, "mean_token_accuracy": 0.0721237450838089, "num_tokens": 368527.0, "step": 155 }, { "entropy": 9.694390869140625, "epoch": 0.010287404359287598, "grad_norm": 1.5, "learning_rate": 7.950000000000001e-05, "loss": 7.8511, "mean_token_accuracy": 0.06826285421848297, "num_tokens": 379836.0, "step": 160 }, { "entropy": 9.510071659088135, "epoch": 0.010608885745515335, "grad_norm": 1.0625, "learning_rate": 8.2e-05, "loss": 7.8393, "mean_token_accuracy": 0.0674971140921116, "num_tokens": 392535.0, "step": 165 }, { "entropy": 9.299476528167725, "epoch": 0.010930367131743073, "grad_norm": 0.91015625, "learning_rate": 8.450000000000001e-05, "loss": 7.7515, "mean_token_accuracy": 0.06860553249716758, "num_tokens": 405259.0, "step": 170 }, { "entropy": 9.040483093261718, "epoch": 0.011251848517970809, "grad_norm": 0.96875, "learning_rate": 8.7e-05, "loss": 7.599, "mean_token_accuracy": 0.07114262394607067, "num_tokens": 417922.0, "step": 175 }, { "entropy": 8.870688247680665, "epoch": 0.011573329904198546, "grad_norm": 1.078125, "learning_rate": 8.95e-05, "loss": 7.6169, "mean_token_accuracy": 0.07012484185397624, "num_tokens": 429411.0, "step": 180 }, { "entropy": 8.67488489151001, "epoch": 0.011894811290426284, "grad_norm": 1.171875, "learning_rate": 9.2e-05, "loss": 7.386, "mean_token_accuracy": 0.0772802360355854, "num_tokens": 439950.0, "step": 185 }, { "entropy": 8.489033699035645, "epoch": 0.012216292676654021, "grad_norm": 1.328125, "learning_rate": 9.45e-05, "loss": 7.3822, "mean_token_accuracy": 0.07805034667253494, "num_tokens": 451245.0, "step": 190 }, { "entropy": 8.393837928771973, "epoch": 0.012537774062881759, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 7.4539, "mean_token_accuracy": 0.07150709182024002, "num_tokens": 465146.0, "step": 195 }, { "entropy": 8.359711456298829, "epoch": 0.012859255449109496, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.4708, "mean_token_accuracy": 0.07765417769551278, "num_tokens": 477079.0, "step": 200 }, { "entropy": 8.254557895660401, "epoch": 0.013180736835337234, "grad_norm": 1.0546875, "learning_rate": 0.000102, "loss": 7.2964, "mean_token_accuracy": 0.08167731463909149, "num_tokens": 488216.0, "step": 205 }, { "entropy": 8.201800632476807, "epoch": 0.013502218221564971, "grad_norm": 1.3984375, "learning_rate": 0.00010449999999999999, "loss": 7.2996, "mean_token_accuracy": 0.08416381254792213, "num_tokens": 501040.0, "step": 210 }, { "entropy": 8.122812938690185, "epoch": 0.013823699607792709, "grad_norm": 1.015625, "learning_rate": 0.000107, "loss": 7.2535, "mean_token_accuracy": 0.08663205504417419, "num_tokens": 512636.0, "step": 215 }, { "entropy": 8.088646793365479, "epoch": 0.014145180994020446, "grad_norm": 0.9765625, "learning_rate": 0.0001095, "loss": 7.301, "mean_token_accuracy": 0.08183000981807709, "num_tokens": 525249.0, "step": 220 }, { "entropy": 8.097221660614014, "epoch": 0.014466662380248184, "grad_norm": 1.34375, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.08002460822463035, "num_tokens": 536963.0, "step": 225 }, { "entropy": 8.05938491821289, "epoch": 0.014788143766475921, "grad_norm": 1.171875, "learning_rate": 0.0001145, "loss": 7.2099, "mean_token_accuracy": 0.08030182272195815, "num_tokens": 549008.0, "step": 230 }, { "entropy": 8.041013956069946, "epoch": 0.015109625152703659, "grad_norm": 1.0390625, "learning_rate": 0.00011700000000000001, "loss": 7.2319, "mean_token_accuracy": 0.09074903577566147, "num_tokens": 560958.0, "step": 235 }, { "entropy": 7.961578607559204, "epoch": 0.015431106538931396, "grad_norm": 0.9921875, "learning_rate": 0.00011949999999999999, "loss": 7.1147, "mean_token_accuracy": 0.09378238469362259, "num_tokens": 572472.0, "step": 240 }, { "entropy": 7.922268009185791, "epoch": 0.015752587925159132, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 7.1808, "mean_token_accuracy": 0.08942435756325721, "num_tokens": 585125.0, "step": 245 }, { "entropy": 7.913467741012573, "epoch": 0.01607406931138687, "grad_norm": 1.0390625, "learning_rate": 0.0001245, "loss": 7.1259, "mean_token_accuracy": 0.09376866966485978, "num_tokens": 597774.0, "step": 250 }, { "entropy": 7.856596946716309, "epoch": 0.016395550697614607, "grad_norm": 0.98828125, "learning_rate": 0.000127, "loss": 7.1233, "mean_token_accuracy": 0.09992039278149605, "num_tokens": 610130.0, "step": 255 }, { "entropy": 7.8915050506591795, "epoch": 0.016717032083842346, "grad_norm": 1.03125, "learning_rate": 0.0001295, "loss": 7.1488, "mean_token_accuracy": 0.09605236500501632, "num_tokens": 621659.0, "step": 260 }, { "entropy": 7.833514070510864, "epoch": 0.017038513470070082, "grad_norm": 1.0078125, "learning_rate": 0.000132, "loss": 7.0552, "mean_token_accuracy": 0.09916835874319077, "num_tokens": 633172.0, "step": 265 }, { "entropy": 7.854182243347168, "epoch": 0.01735999485629782, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.0595, "mean_token_accuracy": 0.09681920260190964, "num_tokens": 643928.0, "step": 270 }, { "entropy": 7.712904834747315, "epoch": 0.017681476242525557, "grad_norm": 1.2265625, "learning_rate": 0.00013700000000000002, "loss": 6.9556, "mean_token_accuracy": 0.09763396382331849, "num_tokens": 654693.0, "step": 275 }, { "entropy": 7.817079973220825, "epoch": 0.018002957628753296, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 7.1338, "mean_token_accuracy": 0.09172611869871616, "num_tokens": 667216.0, "step": 280 }, { "entropy": 7.727632856369018, "epoch": 0.01832443901498103, "grad_norm": 1.5078125, "learning_rate": 0.00014199999999999998, "loss": 6.9273, "mean_token_accuracy": 0.10492636933922768, "num_tokens": 679605.0, "step": 285 }, { "entropy": 7.6807286739349365, "epoch": 0.01864592040120877, "grad_norm": 1.0703125, "learning_rate": 0.0001445, "loss": 7.0243, "mean_token_accuracy": 0.09721777960658073, "num_tokens": 691581.0, "step": 290 }, { "entropy": 7.730735111236572, "epoch": 0.018967401787436507, "grad_norm": 1.203125, "learning_rate": 0.000147, "loss": 7.064, "mean_token_accuracy": 0.10062759071588516, "num_tokens": 703162.0, "step": 295 }, { "entropy": 7.675752592086792, "epoch": 0.019288883173664246, "grad_norm": 1.0390625, "learning_rate": 0.0001495, "loss": 6.947, "mean_token_accuracy": 0.10126433670520782, "num_tokens": 715024.0, "step": 300 }, { "entropy": 7.604991054534912, "epoch": 0.01961036455989198, "grad_norm": 1.390625, "learning_rate": 0.000152, "loss": 6.9484, "mean_token_accuracy": 0.10657469853758812, "num_tokens": 728434.0, "step": 305 }, { "entropy": 7.582369089126587, "epoch": 0.01993184594611972, "grad_norm": 1.109375, "learning_rate": 0.00015450000000000001, "loss": 6.9856, "mean_token_accuracy": 0.10384280532598496, "num_tokens": 741049.0, "step": 310 }, { "entropy": 7.556066989898682, "epoch": 0.020253327332347457, "grad_norm": 1.0234375, "learning_rate": 0.000157, "loss": 6.8995, "mean_token_accuracy": 0.10891256630420684, "num_tokens": 753316.0, "step": 315 }, { "entropy": 7.487519884109497, "epoch": 0.020574808718575196, "grad_norm": 1.078125, "learning_rate": 0.0001595, "loss": 6.8976, "mean_token_accuracy": 0.10375816151499748, "num_tokens": 766605.0, "step": 320 }, { "entropy": 7.575658369064331, "epoch": 0.02089629010480293, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 6.8776, "mean_token_accuracy": 0.10548696890473366, "num_tokens": 778857.0, "step": 325 }, { "entropy": 7.49542875289917, "epoch": 0.02121777149103067, "grad_norm": 1.1015625, "learning_rate": 0.00016450000000000001, "loss": 6.8801, "mean_token_accuracy": 0.0980547919869423, "num_tokens": 790497.0, "step": 330 }, { "entropy": 7.548171281814575, "epoch": 0.021539252877258407, "grad_norm": 1.2421875, "learning_rate": 0.00016700000000000002, "loss": 6.9457, "mean_token_accuracy": 0.10034449025988579, "num_tokens": 803021.0, "step": 335 }, { "entropy": 7.514672136306762, "epoch": 0.021860734263486146, "grad_norm": 1.234375, "learning_rate": 0.00016950000000000003, "loss": 6.8973, "mean_token_accuracy": 0.10233017727732659, "num_tokens": 815056.0, "step": 340 }, { "entropy": 7.548324632644653, "epoch": 0.02218221564971388, "grad_norm": 0.984375, "learning_rate": 0.00017199999999999998, "loss": 6.8436, "mean_token_accuracy": 0.11048155352473259, "num_tokens": 827149.0, "step": 345 }, { "entropy": 7.47729377746582, "epoch": 0.022503697035941617, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.8877, "mean_token_accuracy": 0.10872978940606118, "num_tokens": 839172.0, "step": 350 }, { "entropy": 7.497987508773804, "epoch": 0.022825178422169357, "grad_norm": 1.75, "learning_rate": 0.000177, "loss": 6.9329, "mean_token_accuracy": 0.10738308876752853, "num_tokens": 851148.0, "step": 355 }, { "entropy": 7.548883295059204, "epoch": 0.023146659808397092, "grad_norm": 1.140625, "learning_rate": 0.0001795, "loss": 6.8783, "mean_token_accuracy": 0.10820900201797486, "num_tokens": 862904.0, "step": 360 }, { "entropy": 7.436304187774658, "epoch": 0.02346814119462483, "grad_norm": 1.359375, "learning_rate": 0.000182, "loss": 6.7668, "mean_token_accuracy": 0.11688080206513404, "num_tokens": 874720.0, "step": 365 }, { "entropy": 7.409350728988647, "epoch": 0.023789622580852567, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.8078, "mean_token_accuracy": 0.11283540055155754, "num_tokens": 887261.0, "step": 370 }, { "entropy": 7.4675617694854735, "epoch": 0.024111103967080307, "grad_norm": 1.0859375, "learning_rate": 0.000187, "loss": 6.7767, "mean_token_accuracy": 0.1088891163468361, "num_tokens": 898048.0, "step": 375 }, { "entropy": 7.336610507965088, "epoch": 0.024432585353308042, "grad_norm": 1.03125, "learning_rate": 0.0001895, "loss": 6.8343, "mean_token_accuracy": 0.11030351296067238, "num_tokens": 910297.0, "step": 380 }, { "entropy": 7.432262849807739, "epoch": 0.02475406673953578, "grad_norm": 1.0546875, "learning_rate": 0.000192, "loss": 6.8693, "mean_token_accuracy": 0.10626164525747299, "num_tokens": 923463.0, "step": 385 }, { "entropy": 7.399855327606201, "epoch": 0.025075548125763517, "grad_norm": 0.99609375, "learning_rate": 0.0001945, "loss": 6.8379, "mean_token_accuracy": 0.11091364100575447, "num_tokens": 935306.0, "step": 390 }, { "entropy": 7.355379390716553, "epoch": 0.025397029511991256, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 6.7379, "mean_token_accuracy": 0.115155877918005, "num_tokens": 947827.0, "step": 395 }, { "entropy": 7.281255531311035, "epoch": 0.025718510898218992, "grad_norm": 1.375, "learning_rate": 0.00019950000000000002, "loss": 6.6838, "mean_token_accuracy": 0.12000245451927186, "num_tokens": 961664.0, "step": 400 }, { "entropy": 7.312869071960449, "epoch": 0.02603999228444673, "grad_norm": 1.21875, "learning_rate": 0.000202, "loss": 6.7829, "mean_token_accuracy": 0.09842887446284294, "num_tokens": 973981.0, "step": 405 }, { "entropy": 7.335048866271973, "epoch": 0.026361473670674467, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 6.8181, "mean_token_accuracy": 0.11232979372143745, "num_tokens": 986702.0, "step": 410 }, { "entropy": 7.318604183197022, "epoch": 0.026682955056902206, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.7181, "mean_token_accuracy": 0.11695454865694047, "num_tokens": 998513.0, "step": 415 }, { "entropy": 7.294521141052246, "epoch": 0.027004436443129942, "grad_norm": 1.3515625, "learning_rate": 0.0002095, "loss": 6.7037, "mean_token_accuracy": 0.11898418515920639, "num_tokens": 1011111.0, "step": 420 }, { "entropy": 7.186019515991211, "epoch": 0.02732591782935768, "grad_norm": 1.2578125, "learning_rate": 0.000212, "loss": 6.6799, "mean_token_accuracy": 0.11566238775849343, "num_tokens": 1021779.0, "step": 425 }, { "entropy": 7.370555067062378, "epoch": 0.027647399215585417, "grad_norm": 1.0703125, "learning_rate": 0.0002145, "loss": 6.7381, "mean_token_accuracy": 0.11263754442334176, "num_tokens": 1033228.0, "step": 430 }, { "entropy": 7.226527881622315, "epoch": 0.027968880601813156, "grad_norm": 1.0703125, "learning_rate": 0.00021700000000000002, "loss": 6.6415, "mean_token_accuracy": 0.11632440984249115, "num_tokens": 1044964.0, "step": 435 }, { "entropy": 7.18967342376709, "epoch": 0.028290361988040892, "grad_norm": 1.2265625, "learning_rate": 0.0002195, "loss": 6.6058, "mean_token_accuracy": 0.12256524711847305, "num_tokens": 1056450.0, "step": 440 }, { "entropy": 7.242304182052612, "epoch": 0.02861184337426863, "grad_norm": 1.0703125, "learning_rate": 0.000222, "loss": 6.7402, "mean_token_accuracy": 0.1159943200647831, "num_tokens": 1067031.0, "step": 445 }, { "entropy": 7.1245410442352295, "epoch": 0.028933324760496367, "grad_norm": 1.3046875, "learning_rate": 0.0002245, "loss": 6.6051, "mean_token_accuracy": 0.1228414848446846, "num_tokens": 1078718.0, "step": 450 }, { "entropy": 7.182725429534912, "epoch": 0.029254806146724106, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 6.6217, "mean_token_accuracy": 0.11590910404920578, "num_tokens": 1091630.0, "step": 455 }, { "entropy": 7.229373598098755, "epoch": 0.029576287532951842, "grad_norm": 1.2109375, "learning_rate": 0.00022950000000000002, "loss": 6.6761, "mean_token_accuracy": 0.11919770017266273, "num_tokens": 1102339.0, "step": 460 }, { "entropy": 7.166626882553101, "epoch": 0.029897768919179578, "grad_norm": 1.2109375, "learning_rate": 0.00023200000000000003, "loss": 6.6491, "mean_token_accuracy": 0.11653751060366631, "num_tokens": 1114385.0, "step": 465 }, { "entropy": 7.213460397720337, "epoch": 0.030219250305407317, "grad_norm": 1.0625, "learning_rate": 0.00023449999999999998, "loss": 6.6627, "mean_token_accuracy": 0.12240460664033889, "num_tokens": 1126364.0, "step": 470 }, { "entropy": 7.160998678207397, "epoch": 0.030540731691635053, "grad_norm": 1.265625, "learning_rate": 0.000237, "loss": 6.6469, "mean_token_accuracy": 0.12170583978295327, "num_tokens": 1137492.0, "step": 475 }, { "entropy": 7.108113145828247, "epoch": 0.030862213077862792, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.5317, "mean_token_accuracy": 0.12732059210538865, "num_tokens": 1148734.0, "step": 480 }, { "entropy": 7.14542589187622, "epoch": 0.031183694464090528, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 6.6757, "mean_token_accuracy": 0.12211950346827508, "num_tokens": 1163229.0, "step": 485 }, { "entropy": 7.165257167816162, "epoch": 0.031505175850318264, "grad_norm": 1.015625, "learning_rate": 0.0002445, "loss": 6.6959, "mean_token_accuracy": 0.1155033528804779, "num_tokens": 1175452.0, "step": 490 }, { "entropy": 7.1013343334198, "epoch": 0.031826657236546006, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 6.5479, "mean_token_accuracy": 0.12406643405556679, "num_tokens": 1187836.0, "step": 495 }, { "entropy": 7.197257661819458, "epoch": 0.03214813862277374, "grad_norm": 1.09375, "learning_rate": 0.0002495, "loss": 6.6297, "mean_token_accuracy": 0.12298163026571274, "num_tokens": 1198867.0, "step": 500 }, { "entropy": 7.00099925994873, "epoch": 0.03246962000900148, "grad_norm": 1.1015625, "learning_rate": 0.000252, "loss": 6.5666, "mean_token_accuracy": 0.11886920258402825, "num_tokens": 1212534.0, "step": 505 }, { "entropy": 7.123233509063721, "epoch": 0.032791101395229214, "grad_norm": 1.4375, "learning_rate": 0.0002545, "loss": 6.4812, "mean_token_accuracy": 0.1376668132841587, "num_tokens": 1223028.0, "step": 510 }, { "entropy": 7.040684223175049, "epoch": 0.033112582781456956, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 6.5438, "mean_token_accuracy": 0.12737778946757317, "num_tokens": 1235460.0, "step": 515 }, { "entropy": 6.9980145454406735, "epoch": 0.03343406416768469, "grad_norm": 1.1953125, "learning_rate": 0.0002595, "loss": 6.5329, "mean_token_accuracy": 0.1297763057053089, "num_tokens": 1247180.0, "step": 520 }, { "entropy": 7.0526275634765625, "epoch": 0.03375554555391243, "grad_norm": 1.0859375, "learning_rate": 0.000262, "loss": 6.5934, "mean_token_accuracy": 0.12331821173429489, "num_tokens": 1260000.0, "step": 525 }, { "entropy": 6.997141313552857, "epoch": 0.034077026940140163, "grad_norm": 1.203125, "learning_rate": 0.00026450000000000003, "loss": 6.4284, "mean_token_accuracy": 0.12857622653245926, "num_tokens": 1271346.0, "step": 530 }, { "entropy": 7.008873414993286, "epoch": 0.034398508326367906, "grad_norm": 1.0703125, "learning_rate": 0.00026700000000000004, "loss": 6.5163, "mean_token_accuracy": 0.12632984891533852, "num_tokens": 1283017.0, "step": 535 }, { "entropy": 7.0776612758636475, "epoch": 0.03471998971259564, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.5481, "mean_token_accuracy": 0.12498711422085762, "num_tokens": 1293243.0, "step": 540 }, { "entropy": 6.8785299301147464, "epoch": 0.03504147109882338, "grad_norm": 1.171875, "learning_rate": 0.00027200000000000005, "loss": 6.439, "mean_token_accuracy": 0.134949841350317, "num_tokens": 1304801.0, "step": 545 }, { "entropy": 7.143336582183838, "epoch": 0.03536295248505111, "grad_norm": 1.046875, "learning_rate": 0.0002745, "loss": 6.6164, "mean_token_accuracy": 0.12681611329317094, "num_tokens": 1315985.0, "step": 550 }, { "entropy": 6.930103540420532, "epoch": 0.035684433871278856, "grad_norm": 1.125, "learning_rate": 0.000277, "loss": 6.4575, "mean_token_accuracy": 0.13166105449199678, "num_tokens": 1327771.0, "step": 555 }, { "entropy": 6.966667604446411, "epoch": 0.03600591525750659, "grad_norm": 1.3359375, "learning_rate": 0.0002795, "loss": 6.412, "mean_token_accuracy": 0.13625267744064332, "num_tokens": 1338524.0, "step": 560 }, { "entropy": 6.932982063293457, "epoch": 0.03632739664373433, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.4579, "mean_token_accuracy": 0.12851827815175057, "num_tokens": 1350619.0, "step": 565 }, { "entropy": 6.9319816589355465, "epoch": 0.03664887802996206, "grad_norm": 1.1484375, "learning_rate": 0.0002845, "loss": 6.4918, "mean_token_accuracy": 0.12711360901594163, "num_tokens": 1362781.0, "step": 570 }, { "entropy": 6.932379579544067, "epoch": 0.0369703594161898, "grad_norm": 1.171875, "learning_rate": 0.000287, "loss": 6.4437, "mean_token_accuracy": 0.1318575732409954, "num_tokens": 1373784.0, "step": 575 }, { "entropy": 7.074356174468994, "epoch": 0.03729184080241754, "grad_norm": 1.1171875, "learning_rate": 0.0002895, "loss": 6.705, "mean_token_accuracy": 0.11901014372706413, "num_tokens": 1386426.0, "step": 580 }, { "entropy": 6.872195100784301, "epoch": 0.03761332218864528, "grad_norm": 1.0703125, "learning_rate": 0.000292, "loss": 6.3845, "mean_token_accuracy": 0.13377587869763374, "num_tokens": 1397703.0, "step": 585 }, { "entropy": 6.900994157791137, "epoch": 0.03793480357487301, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 6.4395, "mean_token_accuracy": 0.12795801013708114, "num_tokens": 1410071.0, "step": 590 }, { "entropy": 6.954240083694458, "epoch": 0.03825628496110075, "grad_norm": 1.3828125, "learning_rate": 0.000297, "loss": 6.4338, "mean_token_accuracy": 0.1245950624346733, "num_tokens": 1421387.0, "step": 595 }, { "entropy": 6.907541370391845, "epoch": 0.03857776634732849, "grad_norm": 1.2109375, "learning_rate": 0.0002995, "loss": 6.4593, "mean_token_accuracy": 0.12624357938766478, "num_tokens": 1433253.0, "step": 600 }, { "entropy": 6.899614143371582, "epoch": 0.03889924773355623, "grad_norm": 1.4296875, "learning_rate": 0.000302, "loss": 6.4459, "mean_token_accuracy": 0.12114612162113189, "num_tokens": 1444189.0, "step": 605 }, { "entropy": 6.889805459976197, "epoch": 0.03922072911978396, "grad_norm": 1.1484375, "learning_rate": 0.0003045, "loss": 6.4478, "mean_token_accuracy": 0.12658536732196807, "num_tokens": 1455830.0, "step": 610 }, { "entropy": 6.883515930175781, "epoch": 0.0395422105060117, "grad_norm": 1.2421875, "learning_rate": 0.000307, "loss": 6.474, "mean_token_accuracy": 0.13375141024589537, "num_tokens": 1467442.0, "step": 615 }, { "entropy": 6.902092170715332, "epoch": 0.03986369189223944, "grad_norm": 1.2421875, "learning_rate": 0.0003095, "loss": 6.378, "mean_token_accuracy": 0.1375095695257187, "num_tokens": 1478113.0, "step": 620 }, { "entropy": 6.887974262237549, "epoch": 0.04018517327846718, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 6.4173, "mean_token_accuracy": 0.1352170430123806, "num_tokens": 1490097.0, "step": 625 }, { "entropy": 6.751322174072266, "epoch": 0.04050665466469491, "grad_norm": 1.15625, "learning_rate": 0.0003145, "loss": 6.3863, "mean_token_accuracy": 0.13129702284932138, "num_tokens": 1501565.0, "step": 630 }, { "entropy": 6.841671752929687, "epoch": 0.04082813605092265, "grad_norm": 1.1640625, "learning_rate": 0.000317, "loss": 6.385, "mean_token_accuracy": 0.13331395909190177, "num_tokens": 1512434.0, "step": 635 }, { "entropy": 6.838632202148437, "epoch": 0.04114961743715039, "grad_norm": 1.0859375, "learning_rate": 0.0003195, "loss": 6.3326, "mean_token_accuracy": 0.13992721661925317, "num_tokens": 1524212.0, "step": 640 }, { "entropy": 6.717573928833008, "epoch": 0.04147109882337813, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.2641, "mean_token_accuracy": 0.13435597494244575, "num_tokens": 1536588.0, "step": 645 }, { "entropy": 6.813121795654297, "epoch": 0.04179258020960586, "grad_norm": 1.140625, "learning_rate": 0.00032450000000000003, "loss": 6.4067, "mean_token_accuracy": 0.1357954926788807, "num_tokens": 1548334.0, "step": 650 }, { "entropy": 6.733175325393677, "epoch": 0.0421140615958336, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.3691, "mean_token_accuracy": 0.13718299865722655, "num_tokens": 1560381.0, "step": 655 }, { "entropy": 6.773969268798828, "epoch": 0.04243554298206134, "grad_norm": 1.1015625, "learning_rate": 0.00032950000000000004, "loss": 6.3926, "mean_token_accuracy": 0.1230570524930954, "num_tokens": 1573484.0, "step": 660 }, { "entropy": 6.820370149612427, "epoch": 0.04275702436828908, "grad_norm": 1.171875, "learning_rate": 0.00033200000000000005, "loss": 6.3808, "mean_token_accuracy": 0.13517048284411431, "num_tokens": 1585471.0, "step": 665 }, { "entropy": 6.72473177909851, "epoch": 0.04307850575451681, "grad_norm": 1.0234375, "learning_rate": 0.00033450000000000005, "loss": 6.2612, "mean_token_accuracy": 0.14530360400676728, "num_tokens": 1596321.0, "step": 670 }, { "entropy": 6.86566572189331, "epoch": 0.04339998714074455, "grad_norm": 1.2265625, "learning_rate": 0.000337, "loss": 6.4255, "mean_token_accuracy": 0.1406514436006546, "num_tokens": 1608219.0, "step": 675 }, { "entropy": 6.6760951519012455, "epoch": 0.04372146852697229, "grad_norm": 1.0859375, "learning_rate": 0.0003395, "loss": 6.2714, "mean_token_accuracy": 0.13934220522642135, "num_tokens": 1619420.0, "step": 680 }, { "entropy": 6.79856915473938, "epoch": 0.04404294991320003, "grad_norm": 1.1015625, "learning_rate": 0.000342, "loss": 6.3423, "mean_token_accuracy": 0.13619581386446952, "num_tokens": 1631022.0, "step": 685 }, { "entropy": 6.7899799823760985, "epoch": 0.04436443129942776, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 6.3661, "mean_token_accuracy": 0.13836024552583695, "num_tokens": 1642930.0, "step": 690 }, { "entropy": 6.691325092315674, "epoch": 0.0446859126856555, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 6.3574, "mean_token_accuracy": 0.1367586337029934, "num_tokens": 1655776.0, "step": 695 }, { "entropy": 6.817952728271484, "epoch": 0.045007394071883235, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 6.361, "mean_token_accuracy": 0.1369588740170002, "num_tokens": 1669330.0, "step": 700 }, { "entropy": 6.626900386810303, "epoch": 0.04532887545811098, "grad_norm": 1.078125, "learning_rate": 0.000352, "loss": 6.3733, "mean_token_accuracy": 0.1379777029156685, "num_tokens": 1682126.0, "step": 705 }, { "entropy": 6.74940242767334, "epoch": 0.04565035684433871, "grad_norm": 1.1328125, "learning_rate": 0.0003545, "loss": 6.2913, "mean_token_accuracy": 0.14252828136086465, "num_tokens": 1693070.0, "step": 710 }, { "entropy": 6.821109485626221, "epoch": 0.04597183823056645, "grad_norm": 1.2109375, "learning_rate": 0.000357, "loss": 6.3673, "mean_token_accuracy": 0.13518087714910507, "num_tokens": 1705254.0, "step": 715 }, { "entropy": 6.716013097763062, "epoch": 0.046293319616794185, "grad_norm": 1.1015625, "learning_rate": 0.0003595, "loss": 6.3296, "mean_token_accuracy": 0.1330641709268093, "num_tokens": 1718214.0, "step": 720 }, { "entropy": 6.745158529281616, "epoch": 0.04661480100302193, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 6.36, "mean_token_accuracy": 0.13509849980473518, "num_tokens": 1731046.0, "step": 725 }, { "entropy": 6.691292095184326, "epoch": 0.04693628238924966, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 6.3051, "mean_token_accuracy": 0.13931626304984093, "num_tokens": 1744332.0, "step": 730 }, { "entropy": 6.6679082870483395, "epoch": 0.0472577637754774, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.3141, "mean_token_accuracy": 0.1361882694065571, "num_tokens": 1757744.0, "step": 735 }, { "entropy": 6.755461311340332, "epoch": 0.047579245161705135, "grad_norm": 1.0625, "learning_rate": 0.0003695, "loss": 6.3255, "mean_token_accuracy": 0.13589167818427086, "num_tokens": 1769710.0, "step": 740 }, { "entropy": 6.661909294128418, "epoch": 0.04790072654793288, "grad_norm": 1.0390625, "learning_rate": 0.000372, "loss": 6.3197, "mean_token_accuracy": 0.134683046489954, "num_tokens": 1782299.0, "step": 745 }, { "entropy": 6.686239433288574, "epoch": 0.04822220793416061, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.2854, "mean_token_accuracy": 0.1418588526546955, "num_tokens": 1794407.0, "step": 750 }, { "entropy": 6.681186580657959, "epoch": 0.04854368932038835, "grad_norm": 1.1796875, "learning_rate": 0.000377, "loss": 6.2539, "mean_token_accuracy": 0.13846987187862397, "num_tokens": 1806512.0, "step": 755 }, { "entropy": 6.679962110519409, "epoch": 0.048865170706616085, "grad_norm": 0.9921875, "learning_rate": 0.0003795, "loss": 6.2985, "mean_token_accuracy": 0.14243988171219826, "num_tokens": 1819456.0, "step": 760 }, { "entropy": 6.526072311401367, "epoch": 0.04918665209284383, "grad_norm": 1.1953125, "learning_rate": 0.000382, "loss": 6.1211, "mean_token_accuracy": 0.14557768478989602, "num_tokens": 1831866.0, "step": 765 }, { "entropy": 6.57554988861084, "epoch": 0.04950813347907156, "grad_norm": 1.1015625, "learning_rate": 0.0003845, "loss": 6.141, "mean_token_accuracy": 0.14539860635995866, "num_tokens": 1842662.0, "step": 770 }, { "entropy": 6.579600238800049, "epoch": 0.0498296148652993, "grad_norm": 1.0078125, "learning_rate": 0.00038700000000000003, "loss": 6.1807, "mean_token_accuracy": 0.14677832573652266, "num_tokens": 1855599.0, "step": 775 }, { "entropy": 6.664310932159424, "epoch": 0.050151096251527034, "grad_norm": 1.265625, "learning_rate": 0.00038950000000000003, "loss": 6.2611, "mean_token_accuracy": 0.13455238118767737, "num_tokens": 1866656.0, "step": 780 }, { "entropy": 6.580622625350952, "epoch": 0.05047257763775478, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.2491, "mean_token_accuracy": 0.13729645386338235, "num_tokens": 1877473.0, "step": 785 }, { "entropy": 6.699300527572632, "epoch": 0.05079405902398251, "grad_norm": 1.046875, "learning_rate": 0.00039450000000000005, "loss": 6.2869, "mean_token_accuracy": 0.13934579417109488, "num_tokens": 1889113.0, "step": 790 }, { "entropy": 6.575865650177002, "epoch": 0.05111554041021025, "grad_norm": 1.0, "learning_rate": 0.00039700000000000005, "loss": 6.1885, "mean_token_accuracy": 0.1417413368821144, "num_tokens": 1901528.0, "step": 795 }, { "entropy": 6.590616846084595, "epoch": 0.051437021796437984, "grad_norm": 1.0703125, "learning_rate": 0.0003995, "loss": 6.2219, "mean_token_accuracy": 0.13816025704145432, "num_tokens": 1912036.0, "step": 800 }, { "entropy": 6.601884841918945, "epoch": 0.05175850318266572, "grad_norm": 1.03125, "learning_rate": 0.000402, "loss": 6.1707, "mean_token_accuracy": 0.14483692795038222, "num_tokens": 1923939.0, "step": 805 }, { "entropy": 6.482674884796142, "epoch": 0.05207998456889346, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.1383, "mean_token_accuracy": 0.15191132128238677, "num_tokens": 1935248.0, "step": 810 }, { "entropy": 6.679584169387818, "epoch": 0.0524014659551212, "grad_norm": 1.1640625, "learning_rate": 0.00040699999999999997, "loss": 6.2512, "mean_token_accuracy": 0.1460711881518364, "num_tokens": 1946732.0, "step": 815 }, { "entropy": 6.574809503555298, "epoch": 0.052722947341348934, "grad_norm": 1.1796875, "learning_rate": 0.0004095, "loss": 6.226, "mean_token_accuracy": 0.1427159160375595, "num_tokens": 1958316.0, "step": 820 }, { "entropy": 6.472147607803345, "epoch": 0.05304442872757667, "grad_norm": 1.0390625, "learning_rate": 0.000412, "loss": 6.0917, "mean_token_accuracy": 0.15051717907190323, "num_tokens": 1969543.0, "step": 825 }, { "entropy": 6.623300170898437, "epoch": 0.05336591011380441, "grad_norm": 1.234375, "learning_rate": 0.0004145, "loss": 6.313, "mean_token_accuracy": 0.1366821512579918, "num_tokens": 1981085.0, "step": 830 }, { "entropy": 6.603462076187133, "epoch": 0.05368739150003215, "grad_norm": 1.171875, "learning_rate": 0.000417, "loss": 6.1986, "mean_token_accuracy": 0.14714324995875358, "num_tokens": 1992610.0, "step": 835 }, { "entropy": 6.533374309539795, "epoch": 0.054008872886259884, "grad_norm": 1.1171875, "learning_rate": 0.0004195, "loss": 6.1716, "mean_token_accuracy": 0.14295029491186143, "num_tokens": 2004154.0, "step": 840 }, { "entropy": 6.516127395629883, "epoch": 0.05433035427248762, "grad_norm": 1.0703125, "learning_rate": 0.000422, "loss": 6.0815, "mean_token_accuracy": 0.14348058253526688, "num_tokens": 2015141.0, "step": 845 }, { "entropy": 6.5279299259185795, "epoch": 0.05465183565871536, "grad_norm": 0.9921875, "learning_rate": 0.0004245, "loss": 6.1455, "mean_token_accuracy": 0.15023983269929886, "num_tokens": 2028173.0, "step": 850 }, { "entropy": 6.429127645492554, "epoch": 0.0549733170449431, "grad_norm": 1.1328125, "learning_rate": 0.000427, "loss": 6.1486, "mean_token_accuracy": 0.14123030006885529, "num_tokens": 2039979.0, "step": 855 }, { "entropy": 6.57825779914856, "epoch": 0.055294798431170834, "grad_norm": 1.046875, "learning_rate": 0.0004295, "loss": 6.0981, "mean_token_accuracy": 0.14770488440990448, "num_tokens": 2051052.0, "step": 860 }, { "entropy": 6.48339581489563, "epoch": 0.05561627981739857, "grad_norm": 1.0078125, "learning_rate": 0.000432, "loss": 6.2736, "mean_token_accuracy": 0.13757081255316733, "num_tokens": 2064252.0, "step": 865 }, { "entropy": 6.527880430221558, "epoch": 0.05593776120362631, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.1659, "mean_token_accuracy": 0.14587004482746124, "num_tokens": 2075697.0, "step": 870 }, { "entropy": 6.587885761260987, "epoch": 0.05625924258985405, "grad_norm": 1.21875, "learning_rate": 0.000437, "loss": 6.2902, "mean_token_accuracy": 0.1394598327577114, "num_tokens": 2088354.0, "step": 875 }, { "entropy": 6.597920179367065, "epoch": 0.056580723976081784, "grad_norm": 1.21875, "learning_rate": 0.0004395, "loss": 6.2794, "mean_token_accuracy": 0.14314963445067405, "num_tokens": 2101291.0, "step": 880 }, { "entropy": 6.531395626068115, "epoch": 0.05690220536230952, "grad_norm": 1.40625, "learning_rate": 0.000442, "loss": 6.1794, "mean_token_accuracy": 0.15109536275267602, "num_tokens": 2114151.0, "step": 885 }, { "entropy": 6.5403975486755375, "epoch": 0.05722368674853726, "grad_norm": 1.1484375, "learning_rate": 0.0004445, "loss": 6.2204, "mean_token_accuracy": 0.140879013389349, "num_tokens": 2127638.0, "step": 890 }, { "entropy": 6.454720592498779, "epoch": 0.057545168134765, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.1054, "mean_token_accuracy": 0.15080050081014634, "num_tokens": 2139773.0, "step": 895 }, { "entropy": 6.582310771942138, "epoch": 0.057866649520992734, "grad_norm": 1.1328125, "learning_rate": 0.00044950000000000003, "loss": 6.2261, "mean_token_accuracy": 0.13719287440180777, "num_tokens": 2151167.0, "step": 900 }, { "entropy": 6.373457574844361, "epoch": 0.05818813090722047, "grad_norm": 0.98828125, "learning_rate": 0.00045200000000000004, "loss": 6.1103, "mean_token_accuracy": 0.14882433116436006, "num_tokens": 2163150.0, "step": 905 }, { "entropy": 6.511533308029175, "epoch": 0.05850961229344821, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.138, "mean_token_accuracy": 0.1470898576080799, "num_tokens": 2175116.0, "step": 910 }, { "entropy": 6.402334594726563, "epoch": 0.05883109367967595, "grad_norm": 1.0703125, "learning_rate": 0.00045700000000000005, "loss": 6.0541, "mean_token_accuracy": 0.1523958332836628, "num_tokens": 2188074.0, "step": 915 }, { "entropy": 6.463513612747192, "epoch": 0.059152575065903684, "grad_norm": 1.125, "learning_rate": 0.00045950000000000006, "loss": 6.1002, "mean_token_accuracy": 0.1470402017235756, "num_tokens": 2200706.0, "step": 920 }, { "entropy": 6.349210262298584, "epoch": 0.05947405645213142, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 6.1154, "mean_token_accuracy": 0.15224614143371581, "num_tokens": 2212493.0, "step": 925 }, { "entropy": 6.507826137542724, "epoch": 0.059795537838359156, "grad_norm": 1.0859375, "learning_rate": 0.0004645, "loss": 6.1258, "mean_token_accuracy": 0.14575668349862098, "num_tokens": 2224668.0, "step": 930 }, { "entropy": 6.432238912582397, "epoch": 0.0601170192245869, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 6.1242, "mean_token_accuracy": 0.14432022348046303, "num_tokens": 2236280.0, "step": 935 }, { "entropy": 6.493103885650635, "epoch": 0.060438500610814634, "grad_norm": 1.0234375, "learning_rate": 0.0004695, "loss": 6.1341, "mean_token_accuracy": 0.14489658921957016, "num_tokens": 2246947.0, "step": 940 }, { "entropy": 6.486361408233643, "epoch": 0.06075998199704237, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.1497, "mean_token_accuracy": 0.1474609225988388, "num_tokens": 2258591.0, "step": 945 }, { "entropy": 6.394432783126831, "epoch": 0.061081463383270106, "grad_norm": 1.09375, "learning_rate": 0.0004745, "loss": 6.1055, "mean_token_accuracy": 0.1405967153608799, "num_tokens": 2269725.0, "step": 950 }, { "entropy": 6.481177186965942, "epoch": 0.06140294476949785, "grad_norm": 1.0546875, "learning_rate": 0.000477, "loss": 6.0784, "mean_token_accuracy": 0.1547504723072052, "num_tokens": 2282172.0, "step": 955 }, { "entropy": 6.446505546569824, "epoch": 0.061724426155725584, "grad_norm": 1.25, "learning_rate": 0.0004795, "loss": 6.2106, "mean_token_accuracy": 0.14404927641153337, "num_tokens": 2293991.0, "step": 960 }, { "entropy": 6.479608154296875, "epoch": 0.06204590754195332, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.1149, "mean_token_accuracy": 0.1508398488163948, "num_tokens": 2306715.0, "step": 965 }, { "entropy": 6.330813074111939, "epoch": 0.062367388928181056, "grad_norm": 1.1640625, "learning_rate": 0.0004845, "loss": 6.1465, "mean_token_accuracy": 0.14545181691646575, "num_tokens": 2319096.0, "step": 970 }, { "entropy": 6.360287046432495, "epoch": 0.0626888703144088, "grad_norm": 1.140625, "learning_rate": 0.000487, "loss": 6.0329, "mean_token_accuracy": 0.14853936582803726, "num_tokens": 2332239.0, "step": 975 }, { "entropy": 6.3763471126556395, "epoch": 0.06301035170063653, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 6.1228, "mean_token_accuracy": 0.14723728373646736, "num_tokens": 2343897.0, "step": 980 }, { "entropy": 6.353127479553223, "epoch": 0.06333183308686427, "grad_norm": 0.99609375, "learning_rate": 0.000492, "loss": 6.0663, "mean_token_accuracy": 0.14970697611570358, "num_tokens": 2356811.0, "step": 985 }, { "entropy": 6.3828963279724125, "epoch": 0.06365331447309201, "grad_norm": 1.09375, "learning_rate": 0.0004945, "loss": 6.0559, "mean_token_accuracy": 0.15341916903853417, "num_tokens": 2369146.0, "step": 990 }, { "entropy": 6.346980619430542, "epoch": 0.06397479585931974, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.0164, "mean_token_accuracy": 0.1514612004160881, "num_tokens": 2381154.0, "step": 995 }, { "entropy": 6.36736650466919, "epoch": 0.06429627724554748, "grad_norm": 1.15625, "learning_rate": 0.0004995, "loss": 6.1074, "mean_token_accuracy": 0.14672497659921646, "num_tokens": 2392095.0, "step": 1000 }, { "entropy": 6.426885080337525, "epoch": 0.06461775863177523, "grad_norm": 0.92578125, "learning_rate": 0.000499998026082006, "loss": 6.2126, "mean_token_accuracy": 0.14347948506474495, "num_tokens": 2405446.0, "step": 1005 }, { "entropy": 6.350338315963745, "epoch": 0.06493924001800296, "grad_norm": 1.0234375, "learning_rate": 0.0004999900070995136, "loss": 6.0627, "mean_token_accuracy": 0.1458252727985382, "num_tokens": 2418506.0, "step": 1010 }, { "entropy": 6.34899787902832, "epoch": 0.0652607214042307, "grad_norm": 1.078125, "learning_rate": 0.0004999758199023239, "loss": 6.0568, "mean_token_accuracy": 0.15567989647388458, "num_tokens": 2430125.0, "step": 1015 }, { "entropy": 6.37267050743103, "epoch": 0.06558220279045843, "grad_norm": 1.0234375, "learning_rate": 0.0004999554648793858, "loss": 6.0766, "mean_token_accuracy": 0.14890180379152299, "num_tokens": 2442000.0, "step": 1020 }, { "entropy": 6.391686868667603, "epoch": 0.06590368417668617, "grad_norm": 1.0703125, "learning_rate": 0.0004999289425887425, "loss": 6.095, "mean_token_accuracy": 0.1505647674202919, "num_tokens": 2453389.0, "step": 1025 }, { "entropy": 6.414132595062256, "epoch": 0.06622516556291391, "grad_norm": 1.046875, "learning_rate": 0.0004998962537575161, "loss": 6.1065, "mean_token_accuracy": 0.1472689539194107, "num_tokens": 2464988.0, "step": 1030 }, { "entropy": 6.3225417137146, "epoch": 0.06654664694914164, "grad_norm": 1.140625, "learning_rate": 0.0004998573992818874, "loss": 6.0009, "mean_token_accuracy": 0.15887372940778732, "num_tokens": 2476820.0, "step": 1035 }, { "entropy": 6.353922176361084, "epoch": 0.06686812833536938, "grad_norm": 1.078125, "learning_rate": 0.0004998123802270715, "loss": 6.0069, "mean_token_accuracy": 0.14979753121733666, "num_tokens": 2489427.0, "step": 1040 }, { "entropy": 6.2835996627807615, "epoch": 0.06718960972159711, "grad_norm": 1.0859375, "learning_rate": 0.0004997611978272886, "loss": 6.0293, "mean_token_accuracy": 0.15290547013282776, "num_tokens": 2501084.0, "step": 1045 }, { "entropy": 6.393969631195068, "epoch": 0.06751109110782486, "grad_norm": 1.15625, "learning_rate": 0.0004997038534857298, "loss": 6.1253, "mean_token_accuracy": 0.1501571610569954, "num_tokens": 2513005.0, "step": 1050 }, { "entropy": 6.297085285186768, "epoch": 0.0678325724940526, "grad_norm": 1.0, "learning_rate": 0.0004996403487745194, "loss": 5.9784, "mean_token_accuracy": 0.15144816786050797, "num_tokens": 2526217.0, "step": 1055 }, { "entropy": 6.364409065246582, "epoch": 0.06815405388028033, "grad_norm": 1.1484375, "learning_rate": 0.000499570685434671, "loss": 6.0721, "mean_token_accuracy": 0.15043441355228424, "num_tokens": 2538892.0, "step": 1060 }, { "entropy": 6.305640745162964, "epoch": 0.06847553526650807, "grad_norm": 1.1796875, "learning_rate": 0.0004994948653760405, "loss": 6.0322, "mean_token_accuracy": 0.15073884129524232, "num_tokens": 2549929.0, "step": 1065 }, { "entropy": 6.316273498535156, "epoch": 0.06879701665273581, "grad_norm": 1.078125, "learning_rate": 0.0004994128906772729, "loss": 5.967, "mean_token_accuracy": 0.16290880739688873, "num_tokens": 2561322.0, "step": 1070 }, { "entropy": 6.35417103767395, "epoch": 0.06911849803896354, "grad_norm": 0.98828125, "learning_rate": 0.000499324763585746, "loss": 5.9635, "mean_token_accuracy": 0.16284787505865098, "num_tokens": 2572908.0, "step": 1075 }, { "entropy": 6.189544916152954, "epoch": 0.06943997942519128, "grad_norm": 1.0703125, "learning_rate": 0.0004992304865175085, "loss": 6.0468, "mean_token_accuracy": 0.14753600358963012, "num_tokens": 2584880.0, "step": 1080 }, { "entropy": 6.304679203033447, "epoch": 0.06976146081141901, "grad_norm": 1.0390625, "learning_rate": 0.0004991300620572138, "loss": 5.9537, "mean_token_accuracy": 0.15288592427968978, "num_tokens": 2596663.0, "step": 1085 }, { "entropy": 6.306663751602173, "epoch": 0.07008294219764676, "grad_norm": 1.0625, "learning_rate": 0.0004990234929580494, "loss": 6.0103, "mean_token_accuracy": 0.150350858271122, "num_tokens": 2608609.0, "step": 1090 }, { "entropy": 6.189498329162598, "epoch": 0.0704044235838745, "grad_norm": 0.98046875, "learning_rate": 0.0004989107821416609, "loss": 5.9271, "mean_token_accuracy": 0.15373560041189194, "num_tokens": 2620535.0, "step": 1095 }, { "entropy": 6.272855806350708, "epoch": 0.07072590497010223, "grad_norm": 1.1875, "learning_rate": 0.0004987919326980723, "loss": 6.0391, "mean_token_accuracy": 0.14719461053609847, "num_tokens": 2631718.0, "step": 1100 }, { "entropy": 6.330906057357788, "epoch": 0.07104738635632997, "grad_norm": 1.0703125, "learning_rate": 0.0004986669478856011, "loss": 5.9971, "mean_token_accuracy": 0.1513780727982521, "num_tokens": 2644641.0, "step": 1105 }, { "entropy": 6.242729377746582, "epoch": 0.07136886774255771, "grad_norm": 1.71875, "learning_rate": 0.0004985358311307688, "loss": 6.0712, "mean_token_accuracy": 0.1472596064209938, "num_tokens": 2656445.0, "step": 1110 }, { "entropy": 6.2387518882751465, "epoch": 0.07169034912878544, "grad_norm": 0.99609375, "learning_rate": 0.0004983985860282081, "loss": 5.9288, "mean_token_accuracy": 0.16197773665189744, "num_tokens": 2667782.0, "step": 1115 }, { "entropy": 6.297261524200439, "epoch": 0.07201183051501318, "grad_norm": 0.96484375, "learning_rate": 0.0004982552163405623, "loss": 5.8888, "mean_token_accuracy": 0.16516102403402327, "num_tokens": 2679421.0, "step": 1120 }, { "entropy": 6.153607034683228, "epoch": 0.07233331190124091, "grad_norm": 1.0703125, "learning_rate": 0.0004981057259983839, "loss": 5.8252, "mean_token_accuracy": 0.16737353205680847, "num_tokens": 2690045.0, "step": 1125 }, { "entropy": 6.256674098968506, "epoch": 0.07265479328746866, "grad_norm": 1.1015625, "learning_rate": 0.0004979501191000262, "loss": 5.9358, "mean_token_accuracy": 0.1594891406595707, "num_tokens": 2702725.0, "step": 1130 }, { "entropy": 6.189019870758057, "epoch": 0.0729762746736964, "grad_norm": 1.046875, "learning_rate": 0.0004977883999115311, "loss": 5.9325, "mean_token_accuracy": 0.1560269773006439, "num_tokens": 2714874.0, "step": 1135 }, { "entropy": 6.31310076713562, "epoch": 0.07329775605992413, "grad_norm": 1.1640625, "learning_rate": 0.0004976205728665113, "loss": 6.0494, "mean_token_accuracy": 0.14427177235484123, "num_tokens": 2727237.0, "step": 1140 }, { "entropy": 6.140863609313965, "epoch": 0.07361923744615187, "grad_norm": 1.1015625, "learning_rate": 0.0004974466425660307, "loss": 5.9221, "mean_token_accuracy": 0.15012870132923126, "num_tokens": 2738201.0, "step": 1145 }, { "entropy": 6.239338064193726, "epoch": 0.0739407188323796, "grad_norm": 0.9921875, "learning_rate": 0.0004972666137784759, "loss": 5.967, "mean_token_accuracy": 0.161196768283844, "num_tokens": 2749926.0, "step": 1150 }, { "entropy": 6.244922113418579, "epoch": 0.07426220021860734, "grad_norm": 0.96875, "learning_rate": 0.0004970804914394271, "loss": 5.9984, "mean_token_accuracy": 0.146126826107502, "num_tokens": 2762454.0, "step": 1155 }, { "entropy": 6.172313117980957, "epoch": 0.07458368160483508, "grad_norm": 1.078125, "learning_rate": 0.0004968882806515225, "loss": 5.928, "mean_token_accuracy": 0.1524214893579483, "num_tokens": 2775340.0, "step": 1160 }, { "entropy": 6.191201305389404, "epoch": 0.07490516299106281, "grad_norm": 1.21875, "learning_rate": 0.0004966899866843177, "loss": 5.8407, "mean_token_accuracy": 0.1651138797402382, "num_tokens": 2787350.0, "step": 1165 }, { "entropy": 6.163157844543457, "epoch": 0.07522664437729056, "grad_norm": 1.1015625, "learning_rate": 0.000496485614974142, "loss": 5.8869, "mean_token_accuracy": 0.16123317033052445, "num_tokens": 2797891.0, "step": 1170 }, { "entropy": 6.166656732559204, "epoch": 0.0755481257635183, "grad_norm": 1.0625, "learning_rate": 0.0004962751711239492, "loss": 5.8488, "mean_token_accuracy": 0.15674188137054443, "num_tokens": 2809199.0, "step": 1175 }, { "entropy": 6.317021608352661, "epoch": 0.07586960714974603, "grad_norm": 1.21875, "learning_rate": 0.0004960586609031636, "loss": 6.1259, "mean_token_accuracy": 0.14605942070484162, "num_tokens": 2820881.0, "step": 1180 }, { "entropy": 6.217242765426636, "epoch": 0.07619108853597377, "grad_norm": 1.0703125, "learning_rate": 0.0004958360902475224, "loss": 5.9131, "mean_token_accuracy": 0.158234640955925, "num_tokens": 2833203.0, "step": 1185 }, { "entropy": 6.085934734344482, "epoch": 0.0765125699222015, "grad_norm": 1.0, "learning_rate": 0.0004956074652589125, "loss": 5.8158, "mean_token_accuracy": 0.1622716337442398, "num_tokens": 2844695.0, "step": 1190 }, { "entropy": 6.18882040977478, "epoch": 0.07683405130842924, "grad_norm": 1.0703125, "learning_rate": 0.0004953727922052035, "loss": 5.9218, "mean_token_accuracy": 0.15580735355615616, "num_tokens": 2855757.0, "step": 1195 }, { "entropy": 6.096655941009521, "epoch": 0.07715553269465698, "grad_norm": 0.96484375, "learning_rate": 0.0004951320775200756, "loss": 5.8256, "mean_token_accuracy": 0.1585150107741356, "num_tokens": 2867534.0, "step": 1200 }, { "entropy": 6.212085294723511, "epoch": 0.07747701408088471, "grad_norm": 0.9375, "learning_rate": 0.0004948853278028436, "loss": 5.9379, "mean_token_accuracy": 0.15673388540744781, "num_tokens": 2879984.0, "step": 1205 }, { "entropy": 6.263598108291626, "epoch": 0.07779849546711246, "grad_norm": 1.109375, "learning_rate": 0.0004946325498182755, "loss": 5.9533, "mean_token_accuracy": 0.1572867900133133, "num_tokens": 2892920.0, "step": 1210 }, { "entropy": 6.116982269287109, "epoch": 0.0781199768533402, "grad_norm": 1.0546875, "learning_rate": 0.0004943737504964076, "loss": 5.9162, "mean_token_accuracy": 0.1617930367588997, "num_tokens": 2903821.0, "step": 1215 }, { "entropy": 6.2275710105896, "epoch": 0.07844145823956793, "grad_norm": 1.0859375, "learning_rate": 0.000494108936932354, "loss": 5.9182, "mean_token_accuracy": 0.15855470597743987, "num_tokens": 2916280.0, "step": 1220 }, { "entropy": 6.233517837524414, "epoch": 0.07876293962579567, "grad_norm": 0.921875, "learning_rate": 0.0004938381163861124, "loss": 5.9979, "mean_token_accuracy": 0.15871625244617463, "num_tokens": 2928737.0, "step": 1225 }, { "entropy": 6.193160438537598, "epoch": 0.0790844210120234, "grad_norm": 1.0859375, "learning_rate": 0.0004935612962823645, "loss": 5.891, "mean_token_accuracy": 0.16073769181966782, "num_tokens": 2940833.0, "step": 1230 }, { "entropy": 6.115055561065674, "epoch": 0.07940590239825114, "grad_norm": 1.1171875, "learning_rate": 0.0004932784842102739, "loss": 5.8428, "mean_token_accuracy": 0.15946858525276184, "num_tokens": 2952662.0, "step": 1235 }, { "entropy": 6.204311752319336, "epoch": 0.07972738378447888, "grad_norm": 0.99609375, "learning_rate": 0.0004929896879232758, "loss": 5.9119, "mean_token_accuracy": 0.1619669482111931, "num_tokens": 2965504.0, "step": 1240 }, { "entropy": 6.2926552295684814, "epoch": 0.08004886517070661, "grad_norm": 1.203125, "learning_rate": 0.0004926949153388668, "loss": 5.9785, "mean_token_accuracy": 0.15522371083498002, "num_tokens": 2977610.0, "step": 1245 }, { "entropy": 6.112452220916748, "epoch": 0.08037034655693436, "grad_norm": 1.109375, "learning_rate": 0.0004923941745383859, "loss": 5.8564, "mean_token_accuracy": 0.15934567600488664, "num_tokens": 2989677.0, "step": 1250 }, { "entropy": 6.151176643371582, "epoch": 0.0806918279431621, "grad_norm": 1.0234375, "learning_rate": 0.000492087473766794, "loss": 5.9276, "mean_token_accuracy": 0.1602254882454872, "num_tokens": 3002164.0, "step": 1255 }, { "entropy": 6.151615953445434, "epoch": 0.08101330932938983, "grad_norm": 1.015625, "learning_rate": 0.000491774821432448, "loss": 5.839, "mean_token_accuracy": 0.1672609567642212, "num_tokens": 3013487.0, "step": 1260 }, { "entropy": 6.091053056716919, "epoch": 0.08133479071561757, "grad_norm": 1.0859375, "learning_rate": 0.0004914562261068693, "loss": 5.7592, "mean_token_accuracy": 0.1637980043888092, "num_tokens": 3025240.0, "step": 1265 }, { "entropy": 6.198080825805664, "epoch": 0.0816562721018453, "grad_norm": 1.109375, "learning_rate": 0.0004911316965245098, "loss": 5.9558, "mean_token_accuracy": 0.15986837595701217, "num_tokens": 3037931.0, "step": 1270 }, { "entropy": 6.180276155471802, "epoch": 0.08197775348807304, "grad_norm": 1.0390625, "learning_rate": 0.000490801241582512, "loss": 5.8599, "mean_token_accuracy": 0.16204103082418442, "num_tokens": 3050977.0, "step": 1275 }, { "entropy": 6.0987457752227785, "epoch": 0.08229923487430078, "grad_norm": 1.0625, "learning_rate": 0.000490464870340465, "loss": 5.7864, "mean_token_accuracy": 0.15847471207380295, "num_tokens": 3064797.0, "step": 1280 }, { "entropy": 6.059926891326905, "epoch": 0.08262071626052851, "grad_norm": 0.9765625, "learning_rate": 0.0004901225920201563, "loss": 5.8721, "mean_token_accuracy": 0.16135916709899903, "num_tokens": 3077595.0, "step": 1285 }, { "entropy": 6.165657234191895, "epoch": 0.08294219764675625, "grad_norm": 1.0859375, "learning_rate": 0.000489774416005319, "loss": 5.9139, "mean_token_accuracy": 0.15417862236499785, "num_tokens": 3089913.0, "step": 1290 }, { "entropy": 6.133871126174927, "epoch": 0.08326367903298398, "grad_norm": 0.9765625, "learning_rate": 0.0004894203518413742, "loss": 5.9087, "mean_token_accuracy": 0.1627100259065628, "num_tokens": 3102554.0, "step": 1295 }, { "entropy": 6.111787605285644, "epoch": 0.08358516041921173, "grad_norm": 1.0546875, "learning_rate": 0.0004890604092351701, "loss": 5.8258, "mean_token_accuracy": 0.16240279525518417, "num_tokens": 3113511.0, "step": 1300 }, { "entropy": 6.131465053558349, "epoch": 0.08390664180543947, "grad_norm": 1.0, "learning_rate": 0.000488694598054715, "loss": 5.9213, "mean_token_accuracy": 0.15791668891906738, "num_tokens": 3126829.0, "step": 1305 }, { "entropy": 6.069682979583741, "epoch": 0.0842281231916672, "grad_norm": 1.0390625, "learning_rate": 0.0004883229283289071, "loss": 5.7673, "mean_token_accuracy": 0.16573094874620437, "num_tokens": 3139836.0, "step": 1310 }, { "entropy": 6.073161935806274, "epoch": 0.08454960457789494, "grad_norm": 1.0078125, "learning_rate": 0.00048794541024725993, "loss": 5.8286, "mean_token_accuracy": 0.16145224422216414, "num_tokens": 3152047.0, "step": 1315 }, { "entropy": 6.066088485717773, "epoch": 0.08487108596412268, "grad_norm": 1.0625, "learning_rate": 0.0004875620541596221, "loss": 5.7994, "mean_token_accuracy": 0.16172150075435637, "num_tokens": 3163501.0, "step": 1320 }, { "entropy": 6.123111963272095, "epoch": 0.08519256735035041, "grad_norm": 1.0234375, "learning_rate": 0.00048717287057589454, "loss": 5.8752, "mean_token_accuracy": 0.16654538810253144, "num_tokens": 3175918.0, "step": 1325 }, { "entropy": 6.194814872741699, "epoch": 0.08551404873657815, "grad_norm": 1.078125, "learning_rate": 0.0004867778701657417, "loss": 5.9495, "mean_token_accuracy": 0.14875137954950332, "num_tokens": 3187911.0, "step": 1330 }, { "entropy": 6.065830373764038, "epoch": 0.08583553012280588, "grad_norm": 1.09375, "learning_rate": 0.00048637706375829955, "loss": 5.7759, "mean_token_accuracy": 0.16410106271505356, "num_tokens": 3200143.0, "step": 1335 }, { "entropy": 6.027771663665772, "epoch": 0.08615701150903363, "grad_norm": 1.015625, "learning_rate": 0.000485970462341878, "loss": 5.7746, "mean_token_accuracy": 0.1614765614271164, "num_tokens": 3211570.0, "step": 1340 }, { "entropy": 6.113853216171265, "epoch": 0.08647849289526137, "grad_norm": 1.09375, "learning_rate": 0.00048555807706366044, "loss": 5.8393, "mean_token_accuracy": 0.15796211659908294, "num_tokens": 3222014.0, "step": 1345 }, { "entropy": 6.093673276901245, "epoch": 0.0867999742814891, "grad_norm": 1.1953125, "learning_rate": 0.00048513991922939756, "loss": 5.8008, "mean_token_accuracy": 0.16573861241340637, "num_tokens": 3233115.0, "step": 1350 }, { "entropy": 6.114884376525879, "epoch": 0.08712145566771684, "grad_norm": 1.078125, "learning_rate": 0.00048471600030309744, "loss": 5.9123, "mean_token_accuracy": 0.16168183982372283, "num_tokens": 3244084.0, "step": 1355 }, { "entropy": 6.098208856582642, "epoch": 0.08744293705394458, "grad_norm": 1.0, "learning_rate": 0.00048428633190671186, "loss": 5.846, "mean_token_accuracy": 0.1593250960111618, "num_tokens": 3257476.0, "step": 1360 }, { "entropy": 6.054478931427002, "epoch": 0.08776441844017231, "grad_norm": 1.046875, "learning_rate": 0.0004838509258198167, "loss": 5.7764, "mean_token_accuracy": 0.17061060965061187, "num_tokens": 3268067.0, "step": 1365 }, { "entropy": 6.125921297073364, "epoch": 0.08808589982640005, "grad_norm": 1.0, "learning_rate": 0.00048340979397929, "loss": 5.8603, "mean_token_accuracy": 0.16385477036237717, "num_tokens": 3279097.0, "step": 1370 }, { "entropy": 6.049725770950317, "epoch": 0.08840738121262778, "grad_norm": 1.0, "learning_rate": 0.00048296294847898386, "loss": 5.9084, "mean_token_accuracy": 0.16008279025554656, "num_tokens": 3291198.0, "step": 1375 }, { "entropy": 6.082431793212891, "epoch": 0.08872886259885553, "grad_norm": 1.1328125, "learning_rate": 0.0004825104015693934, "loss": 5.7406, "mean_token_accuracy": 0.16886814534664155, "num_tokens": 3303316.0, "step": 1380 }, { "entropy": 6.06479926109314, "epoch": 0.08905034398508327, "grad_norm": 1.03125, "learning_rate": 0.0004820521656573208, "loss": 5.8514, "mean_token_accuracy": 0.16055994108319283, "num_tokens": 3316069.0, "step": 1385 }, { "entropy": 6.008887243270874, "epoch": 0.089371825371311, "grad_norm": 0.99609375, "learning_rate": 0.00048158825330553505, "loss": 5.7445, "mean_token_accuracy": 0.17007820010185243, "num_tokens": 3328657.0, "step": 1390 }, { "entropy": 6.10736780166626, "epoch": 0.08969330675753874, "grad_norm": 1.0859375, "learning_rate": 0.00048111867723242763, "loss": 5.8555, "mean_token_accuracy": 0.16169255524873732, "num_tokens": 3340486.0, "step": 1395 }, { "entropy": 6.1321416854858395, "epoch": 0.09001478814376647, "grad_norm": 1.125, "learning_rate": 0.0004806434503116637, "loss": 5.8723, "mean_token_accuracy": 0.16864815205335618, "num_tokens": 3350936.0, "step": 1400 }, { "entropy": 6.087703371047974, "epoch": 0.09033626952999421, "grad_norm": 1.1484375, "learning_rate": 0.0004801625855718296, "loss": 5.8601, "mean_token_accuracy": 0.16583744436502457, "num_tokens": 3362238.0, "step": 1405 }, { "entropy": 6.051072263717652, "epoch": 0.09065775091622195, "grad_norm": 1.078125, "learning_rate": 0.00047967609619607477, "loss": 5.794, "mean_token_accuracy": 0.16016314327716827, "num_tokens": 3373818.0, "step": 1410 }, { "entropy": 6.093393230438233, "epoch": 0.09097923230244968, "grad_norm": 1.2109375, "learning_rate": 0.0004791839955217513, "loss": 5.8118, "mean_token_accuracy": 0.16103656888008117, "num_tokens": 3385241.0, "step": 1415 }, { "entropy": 5.9892784595489506, "epoch": 0.09130071368867743, "grad_norm": 1.09375, "learning_rate": 0.00047868629704004786, "loss": 5.8093, "mean_token_accuracy": 0.15792890265583992, "num_tokens": 3398274.0, "step": 1420 }, { "entropy": 6.129896736145019, "epoch": 0.09162219507490517, "grad_norm": 1.109375, "learning_rate": 0.00047818301439561965, "loss": 5.8595, "mean_token_accuracy": 0.16091282665729523, "num_tokens": 3411798.0, "step": 1425 }, { "entropy": 6.027444553375244, "epoch": 0.0919436764611329, "grad_norm": 1.1171875, "learning_rate": 0.00047767416138621454, "loss": 5.8085, "mean_token_accuracy": 0.1594970703125, "num_tokens": 3423646.0, "step": 1430 }, { "entropy": 6.086286878585815, "epoch": 0.09226515784736064, "grad_norm": 0.95703125, "learning_rate": 0.000477159751962295, "loss": 5.8268, "mean_token_accuracy": 0.16200227588415145, "num_tokens": 3436255.0, "step": 1435 }, { "entropy": 6.025093269348145, "epoch": 0.09258663923358837, "grad_norm": 1.171875, "learning_rate": 0.00047663980022665507, "loss": 5.8122, "mean_token_accuracy": 0.16047175079584122, "num_tokens": 3447724.0, "step": 1440 }, { "entropy": 6.141870403289795, "epoch": 0.09290812061981611, "grad_norm": 1.0234375, "learning_rate": 0.00047611432043403437, "loss": 5.8945, "mean_token_accuracy": 0.15279303789138793, "num_tokens": 3460959.0, "step": 1445 }, { "entropy": 6.038381910324096, "epoch": 0.09322960200604385, "grad_norm": 1.3125, "learning_rate": 0.0004755833269907267, "loss": 5.7696, "mean_token_accuracy": 0.16729041934013367, "num_tokens": 3472283.0, "step": 1450 }, { "entropy": 6.012684297561646, "epoch": 0.09355108339227158, "grad_norm": 1.0625, "learning_rate": 0.0004750468344541857, "loss": 5.7736, "mean_token_accuracy": 0.1646544575691223, "num_tokens": 3484296.0, "step": 1455 }, { "entropy": 6.002734279632568, "epoch": 0.09387256477849933, "grad_norm": 0.98046875, "learning_rate": 0.00047450485753262525, "loss": 5.7357, "mean_token_accuracy": 0.16739338636398315, "num_tokens": 3496553.0, "step": 1460 }, { "entropy": 6.06849160194397, "epoch": 0.09419404616472707, "grad_norm": 1.0703125, "learning_rate": 0.00047395741108461633, "loss": 5.8064, "mean_token_accuracy": 0.16018352508544922, "num_tokens": 3508515.0, "step": 1465 }, { "entropy": 6.06675968170166, "epoch": 0.0945155275509548, "grad_norm": 1.015625, "learning_rate": 0.00047340451011867985, "loss": 5.8216, "mean_token_accuracy": 0.16168036088347434, "num_tokens": 3520883.0, "step": 1470 }, { "entropy": 5.9559320449829105, "epoch": 0.09483700893718254, "grad_norm": 0.984375, "learning_rate": 0.00047284616979287515, "loss": 5.7903, "mean_token_accuracy": 0.16948920488357544, "num_tokens": 3533786.0, "step": 1475 }, { "entropy": 6.1463991641998295, "epoch": 0.09515849032341027, "grad_norm": 1.0546875, "learning_rate": 0.00047228240541438433, "loss": 5.7776, "mean_token_accuracy": 0.16706227362155915, "num_tokens": 3544573.0, "step": 1480 }, { "entropy": 6.094358777999878, "epoch": 0.09547997170963801, "grad_norm": 0.94921875, "learning_rate": 0.00047171323243909257, "loss": 5.8846, "mean_token_accuracy": 0.15878364443778992, "num_tokens": 3556148.0, "step": 1485 }, { "entropy": 5.980588340759278, "epoch": 0.09580145309586575, "grad_norm": 1.1171875, "learning_rate": 0.00047113866647116457, "loss": 5.7641, "mean_token_accuracy": 0.16096356213092805, "num_tokens": 3568047.0, "step": 1490 }, { "entropy": 6.014238119125366, "epoch": 0.09612293448209348, "grad_norm": 1.046875, "learning_rate": 0.0004705587232626164, "loss": 5.7819, "mean_token_accuracy": 0.1614854723215103, "num_tokens": 3579864.0, "step": 1495 }, { "entropy": 6.090922594070435, "epoch": 0.09644441586832123, "grad_norm": 1.015625, "learning_rate": 0.00046997341871288424, "loss": 5.8161, "mean_token_accuracy": 0.15966751128435136, "num_tokens": 3591602.0, "step": 1500 }, { "entropy": 5.911532735824585, "epoch": 0.09676589725454895, "grad_norm": 0.9609375, "learning_rate": 0.0004693827688683879, "loss": 5.7131, "mean_token_accuracy": 0.16157886236906052, "num_tokens": 3603802.0, "step": 1505 }, { "entropy": 6.096415281295776, "epoch": 0.0970873786407767, "grad_norm": 1.1640625, "learning_rate": 0.0004687867899220914, "loss": 5.8251, "mean_token_accuracy": 0.16491867303848268, "num_tokens": 3614958.0, "step": 1510 }, { "entropy": 5.926008939743042, "epoch": 0.09740886002700444, "grad_norm": 1.0390625, "learning_rate": 0.00046818549821305846, "loss": 5.7093, "mean_token_accuracy": 0.16871902197599412, "num_tokens": 3626175.0, "step": 1515 }, { "entropy": 5.9772974967956545, "epoch": 0.09773034141323217, "grad_norm": 1.0625, "learning_rate": 0.00046757891022600494, "loss": 5.6843, "mean_token_accuracy": 0.16257247924804688, "num_tokens": 3638818.0, "step": 1520 }, { "entropy": 6.0240332126617435, "epoch": 0.09805182279945991, "grad_norm": 1.0234375, "learning_rate": 0.0004669670425908471, "loss": 5.7146, "mean_token_accuracy": 0.16350910812616348, "num_tokens": 3650838.0, "step": 1525 }, { "entropy": 6.000803804397583, "epoch": 0.09837330418568765, "grad_norm": 1.046875, "learning_rate": 0.0004663499120822451, "loss": 5.7236, "mean_token_accuracy": 0.16991809606552125, "num_tokens": 3661879.0, "step": 1530 }, { "entropy": 6.000612354278564, "epoch": 0.09869478557191538, "grad_norm": 0.93359375, "learning_rate": 0.0004657275356191437, "loss": 5.7162, "mean_token_accuracy": 0.17283950746059418, "num_tokens": 3674464.0, "step": 1535 }, { "entropy": 5.956651830673218, "epoch": 0.09901626695814313, "grad_norm": 1.015625, "learning_rate": 0.00046509993026430804, "loss": 5.6744, "mean_token_accuracy": 0.17085929065942765, "num_tokens": 3686065.0, "step": 1540 }, { "entropy": 5.961250972747803, "epoch": 0.09933774834437085, "grad_norm": 1.0078125, "learning_rate": 0.0004644671132238558, "loss": 5.7411, "mean_token_accuracy": 0.17531964033842087, "num_tokens": 3697946.0, "step": 1545 }, { "entropy": 5.9872818946838375, "epoch": 0.0996592297305986, "grad_norm": 0.9921875, "learning_rate": 0.00046382910184678585, "loss": 5.7024, "mean_token_accuracy": 0.16942446082830429, "num_tokens": 3710695.0, "step": 1550 }, { "entropy": 5.950470924377441, "epoch": 0.09998071111682634, "grad_norm": 1.21875, "learning_rate": 0.0004631859136245025, "loss": 5.6825, "mean_token_accuracy": 0.17383817434310914, "num_tokens": 3721288.0, "step": 1555 }, { "entropy": 5.928533840179443, "epoch": 0.10030219250305407, "grad_norm": 1.0078125, "learning_rate": 0.0004625375661903357, "loss": 5.6365, "mean_token_accuracy": 0.16649701148271562, "num_tokens": 3733611.0, "step": 1560 }, { "entropy": 5.955244255065918, "epoch": 0.10062367388928181, "grad_norm": 1.03125, "learning_rate": 0.00046188407731905787, "loss": 5.8012, "mean_token_accuracy": 0.16040457487106324, "num_tokens": 3745018.0, "step": 1565 }, { "entropy": 6.074891996383667, "epoch": 0.10094515527550955, "grad_norm": 1.046875, "learning_rate": 0.00046122546492639643, "loss": 5.7903, "mean_token_accuracy": 0.16442708522081376, "num_tokens": 3755414.0, "step": 1570 }, { "entropy": 5.872460556030274, "epoch": 0.10126663666173728, "grad_norm": 0.99609375, "learning_rate": 0.000460561747068543, "loss": 5.5877, "mean_token_accuracy": 0.17960427105426788, "num_tokens": 3767398.0, "step": 1575 }, { "entropy": 6.056284761428833, "epoch": 0.10158811804796503, "grad_norm": 0.97265625, "learning_rate": 0.0004598929419416578, "loss": 5.7858, "mean_token_accuracy": 0.16207575798034668, "num_tokens": 3779344.0, "step": 1580 }, { "entropy": 5.901925182342529, "epoch": 0.10190959943419275, "grad_norm": 0.93359375, "learning_rate": 0.00045921906788137123, "loss": 5.6982, "mean_token_accuracy": 0.16722951531410218, "num_tokens": 3791642.0, "step": 1585 }, { "entropy": 5.919206190109253, "epoch": 0.1022310808204205, "grad_norm": 1.0625, "learning_rate": 0.00045854014336228115, "loss": 5.6483, "mean_token_accuracy": 0.16981685012578965, "num_tokens": 3803604.0, "step": 1590 }, { "entropy": 6.09901065826416, "epoch": 0.10255256220664824, "grad_norm": 0.94140625, "learning_rate": 0.00045785618699744615, "loss": 5.7711, "mean_token_accuracy": 0.16022978574037552, "num_tokens": 3815472.0, "step": 1595 }, { "entropy": 6.008738374710083, "epoch": 0.10287404359287597, "grad_norm": 1.0859375, "learning_rate": 0.00045716721753787543, "loss": 5.8329, "mean_token_accuracy": 0.1592625081539154, "num_tokens": 3827468.0, "step": 1600 }, { "entropy": 6.05591311454773, "epoch": 0.10319552497910371, "grad_norm": 1.0859375, "learning_rate": 0.0004564732538720148, "loss": 5.814, "mean_token_accuracy": 0.16187592148780822, "num_tokens": 3839532.0, "step": 1605 }, { "entropy": 5.920851564407348, "epoch": 0.10351700636533144, "grad_norm": 0.90234375, "learning_rate": 0.00045577431502522877, "loss": 5.6763, "mean_token_accuracy": 0.1719309151172638, "num_tokens": 3851907.0, "step": 1610 }, { "entropy": 6.0737604141235355, "epoch": 0.10383848775155918, "grad_norm": 1.0703125, "learning_rate": 0.0004550704201592787, "loss": 5.8084, "mean_token_accuracy": 0.1594211921095848, "num_tokens": 3864624.0, "step": 1615 }, { "entropy": 5.935598373413086, "epoch": 0.10415996913778693, "grad_norm": 0.9609375, "learning_rate": 0.0004543615885717981, "loss": 5.6913, "mean_token_accuracy": 0.1719366803765297, "num_tokens": 3876832.0, "step": 1620 }, { "entropy": 5.900327444076538, "epoch": 0.10448145052401465, "grad_norm": 1.015625, "learning_rate": 0.00045364783969576296, "loss": 5.6533, "mean_token_accuracy": 0.1725366458296776, "num_tokens": 3888969.0, "step": 1625 }, { "entropy": 5.919269466400147, "epoch": 0.1048029319102424, "grad_norm": 1.078125, "learning_rate": 0.0004529291930989592, "loss": 5.692, "mean_token_accuracy": 0.16689868569374083, "num_tokens": 3900634.0, "step": 1630 }, { "entropy": 5.978420782089233, "epoch": 0.10512441329647014, "grad_norm": 1.109375, "learning_rate": 0.0004522056684834464, "loss": 5.6596, "mean_token_accuracy": 0.17244009226560592, "num_tokens": 3911993.0, "step": 1635 }, { "entropy": 5.944800853729248, "epoch": 0.10544589468269787, "grad_norm": 1.078125, "learning_rate": 0.0004514772856850173, "loss": 5.7075, "mean_token_accuracy": 0.16923267394304276, "num_tokens": 3923959.0, "step": 1640 }, { "entropy": 5.934698915481567, "epoch": 0.10576737606892561, "grad_norm": 1.0, "learning_rate": 0.0004507440646726542, "loss": 5.6799, "mean_token_accuracy": 0.17092464715242386, "num_tokens": 3936868.0, "step": 1645 }, { "entropy": 5.951383352279663, "epoch": 0.10608885745515334, "grad_norm": 0.98828125, "learning_rate": 0.0004500060255479818, "loss": 5.6691, "mean_token_accuracy": 0.17145125269889833, "num_tokens": 3949777.0, "step": 1650 }, { "entropy": 6.009766578674316, "epoch": 0.10641033884138108, "grad_norm": 1.0078125, "learning_rate": 0.0004492631885447151, "loss": 5.7863, "mean_token_accuracy": 0.16202808246016503, "num_tokens": 3963913.0, "step": 1655 }, { "entropy": 5.909622049331665, "epoch": 0.10673182022760883, "grad_norm": 1.0, "learning_rate": 0.00044851557402810616, "loss": 5.6703, "mean_token_accuracy": 0.1712466612458229, "num_tokens": 3976187.0, "step": 1660 }, { "entropy": 5.883133316040039, "epoch": 0.10705330161383655, "grad_norm": 1.0546875, "learning_rate": 0.00044776320249438444, "loss": 5.6042, "mean_token_accuracy": 0.17793208807706834, "num_tokens": 3986324.0, "step": 1665 }, { "entropy": 5.935062217712402, "epoch": 0.1073747830000643, "grad_norm": 1.046875, "learning_rate": 0.00044700609457019565, "loss": 5.7279, "mean_token_accuracy": 0.17077707052230834, "num_tokens": 3998347.0, "step": 1670 }, { "entropy": 5.9468677043914795, "epoch": 0.10769626438629204, "grad_norm": 1.109375, "learning_rate": 0.0004462442710120359, "loss": 5.7379, "mean_token_accuracy": 0.1692286878824234, "num_tokens": 4010640.0, "step": 1675 }, { "entropy": 5.965192079544067, "epoch": 0.10801774577251977, "grad_norm": 1.0, "learning_rate": 0.000445477752705683, "loss": 5.7021, "mean_token_accuracy": 0.16421150118112565, "num_tokens": 4023544.0, "step": 1680 }, { "entropy": 5.997580337524414, "epoch": 0.10833922715874751, "grad_norm": 1.015625, "learning_rate": 0.00044470656066562336, "loss": 5.7932, "mean_token_accuracy": 0.16685343831777572, "num_tokens": 4035359.0, "step": 1685 }, { "entropy": 6.005310583114624, "epoch": 0.10866070854497524, "grad_norm": 1.0234375, "learning_rate": 0.0004439307160344765, "loss": 5.7503, "mean_token_accuracy": 0.16817554086446762, "num_tokens": 4047055.0, "step": 1690 }, { "entropy": 6.008270597457885, "epoch": 0.10898218993120298, "grad_norm": 1.078125, "learning_rate": 0.00044315024008241473, "loss": 5.7602, "mean_token_accuracy": 0.16708459556102753, "num_tokens": 4058231.0, "step": 1695 }, { "entropy": 5.912751865386963, "epoch": 0.10930367131743073, "grad_norm": 1.046875, "learning_rate": 0.0004423651542065806, "loss": 5.6617, "mean_token_accuracy": 0.17167637795209884, "num_tokens": 4071138.0, "step": 1700 }, { "entropy": 5.909320926666259, "epoch": 0.10962515270365845, "grad_norm": 1.078125, "learning_rate": 0.00044157547993050006, "loss": 5.6095, "mean_token_accuracy": 0.1787335529923439, "num_tokens": 4084144.0, "step": 1705 }, { "entropy": 5.895288896560669, "epoch": 0.1099466340898862, "grad_norm": 1.0390625, "learning_rate": 0.00044078123890349227, "loss": 5.6396, "mean_token_accuracy": 0.1743350476026535, "num_tokens": 4095828.0, "step": 1710 }, { "entropy": 5.958630466461182, "epoch": 0.11026811547611394, "grad_norm": 0.9921875, "learning_rate": 0.00043998245290007606, "loss": 5.7617, "mean_token_accuracy": 0.1587551474571228, "num_tokens": 4108463.0, "step": 1715 }, { "entropy": 5.90827522277832, "epoch": 0.11058959686234167, "grad_norm": 0.9453125, "learning_rate": 0.00043917914381937323, "loss": 5.6133, "mean_token_accuracy": 0.17577288746833802, "num_tokens": 4120153.0, "step": 1720 }, { "entropy": 5.952684164047241, "epoch": 0.11091107824856941, "grad_norm": 1.0546875, "learning_rate": 0.00043837133368450815, "loss": 5.6548, "mean_token_accuracy": 0.17637971192598342, "num_tokens": 4131684.0, "step": 1725 }, { "entropy": 5.95789852142334, "epoch": 0.11123255963479714, "grad_norm": 1.0859375, "learning_rate": 0.0004375590446420037, "loss": 5.7584, "mean_token_accuracy": 0.16837924271821975, "num_tokens": 4142757.0, "step": 1730 }, { "entropy": 5.962955284118652, "epoch": 0.11155404102102488, "grad_norm": 1.1328125, "learning_rate": 0.0004367422989611743, "loss": 5.7158, "mean_token_accuracy": 0.16554963290691377, "num_tokens": 4153892.0, "step": 1735 }, { "entropy": 5.933376312255859, "epoch": 0.11187552240725263, "grad_norm": 0.96484375, "learning_rate": 0.0004359211190335153, "loss": 5.7288, "mean_token_accuracy": 0.16116232872009278, "num_tokens": 4166534.0, "step": 1740 }, { "entropy": 5.9422413349151615, "epoch": 0.11219700379348035, "grad_norm": 1.0703125, "learning_rate": 0.00043509552737208923, "loss": 5.6579, "mean_token_accuracy": 0.1683451145887375, "num_tokens": 4178648.0, "step": 1745 }, { "entropy": 5.848151159286499, "epoch": 0.1125184851797081, "grad_norm": 0.97265625, "learning_rate": 0.00043426554661090853, "loss": 5.6261, "mean_token_accuracy": 0.17486759424209594, "num_tokens": 4191522.0, "step": 1750 }, { "entropy": 5.953406143188476, "epoch": 0.11283996656593583, "grad_norm": 0.96875, "learning_rate": 0.00043343119950431516, "loss": 5.6226, "mean_token_accuracy": 0.17257331013679506, "num_tokens": 4203900.0, "step": 1755 }, { "entropy": 5.861113119125366, "epoch": 0.11316144795216357, "grad_norm": 1.109375, "learning_rate": 0.00043259250892635644, "loss": 5.5864, "mean_token_accuracy": 0.17675792276859284, "num_tokens": 4214861.0, "step": 1760 }, { "entropy": 5.804804039001465, "epoch": 0.11348292933839131, "grad_norm": 0.9765625, "learning_rate": 0.0004317494978701582, "loss": 5.5351, "mean_token_accuracy": 0.1776354894042015, "num_tokens": 4227137.0, "step": 1765 }, { "entropy": 5.933787488937378, "epoch": 0.11380441072461904, "grad_norm": 0.8984375, "learning_rate": 0.0004309021894472943, "loss": 5.7155, "mean_token_accuracy": 0.1676717832684517, "num_tokens": 4239997.0, "step": 1770 }, { "entropy": 5.958622455596924, "epoch": 0.11412589211084678, "grad_norm": 0.9140625, "learning_rate": 0.0004300506068871534, "loss": 5.661, "mean_token_accuracy": 0.16713007688522338, "num_tokens": 4252556.0, "step": 1775 }, { "entropy": 5.792713975906372, "epoch": 0.11444737349707453, "grad_norm": 0.90625, "learning_rate": 0.00042919477353630135, "loss": 5.639, "mean_token_accuracy": 0.1729072615504265, "num_tokens": 4265702.0, "step": 1780 }, { "entropy": 5.8895658493042, "epoch": 0.11476885488330225, "grad_norm": 1.0078125, "learning_rate": 0.000428334712857842, "loss": 5.6602, "mean_token_accuracy": 0.17446050494909288, "num_tokens": 4278244.0, "step": 1785 }, { "entropy": 5.912885761260986, "epoch": 0.11509033626953, "grad_norm": 1.0390625, "learning_rate": 0.00042747044843077304, "loss": 5.6157, "mean_token_accuracy": 0.17406022995710374, "num_tokens": 4290242.0, "step": 1790 }, { "entropy": 5.925296115875244, "epoch": 0.11541181765575773, "grad_norm": 1.03125, "learning_rate": 0.00042660200394934047, "loss": 5.8008, "mean_token_accuracy": 0.16324599087238312, "num_tokens": 4303198.0, "step": 1795 }, { "entropy": 5.972964572906494, "epoch": 0.11573329904198547, "grad_norm": 1.1015625, "learning_rate": 0.00042572940322238844, "loss": 5.7539, "mean_token_accuracy": 0.16906532049179077, "num_tokens": 4316389.0, "step": 1800 }, { "entropy": 5.867070102691651, "epoch": 0.11605478042821321, "grad_norm": 0.9765625, "learning_rate": 0.00042485267017270664, "loss": 5.6284, "mean_token_accuracy": 0.17795921117067337, "num_tokens": 4329829.0, "step": 1805 }, { "entropy": 5.836501359939575, "epoch": 0.11637626181444094, "grad_norm": 1.0234375, "learning_rate": 0.0004239718288363745, "loss": 5.5708, "mean_token_accuracy": 0.1804552987217903, "num_tokens": 4342024.0, "step": 1810 }, { "entropy": 5.882567024230957, "epoch": 0.11669774320066868, "grad_norm": 1.015625, "learning_rate": 0.0004230869033621023, "loss": 5.6703, "mean_token_accuracy": 0.16930529624223709, "num_tokens": 4355575.0, "step": 1815 }, { "entropy": 5.800036668777466, "epoch": 0.11701922458689643, "grad_norm": 0.9921875, "learning_rate": 0.0004221979180105688, "loss": 5.5661, "mean_token_accuracy": 0.17972640544176102, "num_tokens": 4368461.0, "step": 1820 }, { "entropy": 5.918715858459473, "epoch": 0.11734070597312415, "grad_norm": 0.94140625, "learning_rate": 0.00042130489715375645, "loss": 5.6427, "mean_token_accuracy": 0.17834917455911636, "num_tokens": 4380483.0, "step": 1825 }, { "entropy": 5.868259286880493, "epoch": 0.1176621873593519, "grad_norm": 0.953125, "learning_rate": 0.00042040786527428335, "loss": 5.6284, "mean_token_accuracy": 0.16914028078317642, "num_tokens": 4393823.0, "step": 1830 }, { "entropy": 5.887679815292358, "epoch": 0.11798366874557963, "grad_norm": 0.9765625, "learning_rate": 0.0004195068469647315, "loss": 5.6887, "mean_token_accuracy": 0.1705163061618805, "num_tokens": 4405230.0, "step": 1835 }, { "entropy": 5.95110125541687, "epoch": 0.11830515013180737, "grad_norm": 1.015625, "learning_rate": 0.00041860186692697297, "loss": 5.626, "mean_token_accuracy": 0.17905376702547074, "num_tokens": 4416638.0, "step": 1840 }, { "entropy": 5.80819149017334, "epoch": 0.11862663151803511, "grad_norm": 1.0078125, "learning_rate": 0.00041769294997149264, "loss": 5.5459, "mean_token_accuracy": 0.1780714675784111, "num_tokens": 4428778.0, "step": 1845 }, { "entropy": 5.8609541893005375, "epoch": 0.11894811290426284, "grad_norm": 1.0625, "learning_rate": 0.0004167801210167081, "loss": 5.5975, "mean_token_accuracy": 0.17223136574029924, "num_tokens": 4440698.0, "step": 1850 }, { "entropy": 5.850246858596802, "epoch": 0.11926959429049058, "grad_norm": 1.1328125, "learning_rate": 0.0004158634050882861, "loss": 5.6452, "mean_token_accuracy": 0.17951953709125518, "num_tokens": 4451867.0, "step": 1855 }, { "entropy": 5.898460865020752, "epoch": 0.11959107567671831, "grad_norm": 1.0234375, "learning_rate": 0.0004149428273184569, "loss": 5.6622, "mean_token_accuracy": 0.16997012495994568, "num_tokens": 4464111.0, "step": 1860 }, { "entropy": 6.0535829067230225, "epoch": 0.11991255706294605, "grad_norm": 1.078125, "learning_rate": 0.0004140184129453253, "loss": 5.8647, "mean_token_accuracy": 0.1605095535516739, "num_tokens": 4476378.0, "step": 1865 }, { "entropy": 5.918209362030029, "epoch": 0.1202340384491738, "grad_norm": 0.94921875, "learning_rate": 0.000413090187312178, "loss": 5.6126, "mean_token_accuracy": 0.17721273005008698, "num_tokens": 4488714.0, "step": 1870 }, { "entropy": 5.869247961044311, "epoch": 0.12055551983540153, "grad_norm": 1.0859375, "learning_rate": 0.0004121581758667898, "loss": 5.6413, "mean_token_accuracy": 0.17850209176540374, "num_tokens": 4500168.0, "step": 1875 }, { "entropy": 5.9244630336761475, "epoch": 0.12087700122162927, "grad_norm": 1.015625, "learning_rate": 0.00041122240416072533, "loss": 5.6474, "mean_token_accuracy": 0.17328109741210937, "num_tokens": 4511792.0, "step": 1880 }, { "entropy": 5.839860105514527, "epoch": 0.12119848260785701, "grad_norm": 1.09375, "learning_rate": 0.0004102828978486385, "loss": 5.5932, "mean_token_accuracy": 0.18388805836439132, "num_tokens": 4522314.0, "step": 1885 }, { "entropy": 5.965823554992676, "epoch": 0.12151996399408474, "grad_norm": 0.921875, "learning_rate": 0.0004093396826875695, "loss": 5.5762, "mean_token_accuracy": 0.16557498574256896, "num_tokens": 4534827.0, "step": 1890 }, { "entropy": 5.761017513275147, "epoch": 0.12184144538031248, "grad_norm": 1.0390625, "learning_rate": 0.00040839278453623837, "loss": 5.4789, "mean_token_accuracy": 0.17830830216407775, "num_tokens": 4546730.0, "step": 1895 }, { "entropy": 5.70470962524414, "epoch": 0.12216292676654021, "grad_norm": 1.15625, "learning_rate": 0.0004074422293543363, "loss": 5.5623, "mean_token_accuracy": 0.1807377517223358, "num_tokens": 4557573.0, "step": 1900 }, { "entropy": 5.9006062030792235, "epoch": 0.12248440815276795, "grad_norm": 0.921875, "learning_rate": 0.0004064880432018137, "loss": 5.6343, "mean_token_accuracy": 0.174290831387043, "num_tokens": 4570238.0, "step": 1905 }, { "entropy": 5.864686441421509, "epoch": 0.1228058895389957, "grad_norm": 1.125, "learning_rate": 0.00040553025223816615, "loss": 5.6814, "mean_token_accuracy": 0.1700124755501747, "num_tokens": 4583007.0, "step": 1910 }, { "entropy": 5.936568975448608, "epoch": 0.12312737092522343, "grad_norm": 1.046875, "learning_rate": 0.00040456888272171653, "loss": 5.6154, "mean_token_accuracy": 0.16709319800138472, "num_tokens": 4594224.0, "step": 1915 }, { "entropy": 5.852287435531617, "epoch": 0.12344885231145117, "grad_norm": 1.0, "learning_rate": 0.00040360396100889577, "loss": 5.6582, "mean_token_accuracy": 0.17214078456163406, "num_tokens": 4606092.0, "step": 1920 }, { "entropy": 5.904173707962036, "epoch": 0.12377033369767891, "grad_norm": 1.1171875, "learning_rate": 0.0004026355135535202, "loss": 5.6247, "mean_token_accuracy": 0.17527548372745513, "num_tokens": 4616751.0, "step": 1925 }, { "entropy": 5.864779424667359, "epoch": 0.12409181508390664, "grad_norm": 0.9140625, "learning_rate": 0.000401663566906066, "loss": 5.647, "mean_token_accuracy": 0.17503723949193956, "num_tokens": 4629497.0, "step": 1930 }, { "entropy": 5.880205869674683, "epoch": 0.12441329647013438, "grad_norm": 1.0390625, "learning_rate": 0.00040068814771294134, "loss": 5.625, "mean_token_accuracy": 0.17394295632839202, "num_tokens": 4641070.0, "step": 1935 }, { "entropy": 5.814072561264038, "epoch": 0.12473477785636211, "grad_norm": 1.1015625, "learning_rate": 0.0003997092827157562, "loss": 5.602, "mean_token_accuracy": 0.1692856341600418, "num_tokens": 4653813.0, "step": 1940 }, { "entropy": 5.759505414962769, "epoch": 0.12505625924258987, "grad_norm": 1.0625, "learning_rate": 0.000398726998750589, "loss": 5.56, "mean_token_accuracy": 0.1789846494793892, "num_tokens": 4665865.0, "step": 1945 }, { "entropy": 5.860892677307129, "epoch": 0.1253777406288176, "grad_norm": 1.0703125, "learning_rate": 0.00039774132274725076, "loss": 5.6134, "mean_token_accuracy": 0.17644744664430617, "num_tokens": 4678841.0, "step": 1950 }, { "entropy": 5.835351991653442, "epoch": 0.12569922201504533, "grad_norm": 1.0234375, "learning_rate": 0.00039675228172854707, "loss": 5.569, "mean_token_accuracy": 0.17764328867197038, "num_tokens": 4691204.0, "step": 1955 }, { "entropy": 5.906078720092774, "epoch": 0.12602070340127305, "grad_norm": 0.9765625, "learning_rate": 0.0003957599028095371, "loss": 5.5548, "mean_token_accuracy": 0.18006090223789215, "num_tokens": 4702379.0, "step": 1960 }, { "entropy": 5.812206029891968, "epoch": 0.1263421847875008, "grad_norm": 0.93359375, "learning_rate": 0.00039476421319679017, "loss": 5.5982, "mean_token_accuracy": 0.1708923801779747, "num_tokens": 4714737.0, "step": 1965 }, { "entropy": 5.948781299591064, "epoch": 0.12666366617372854, "grad_norm": 1.0390625, "learning_rate": 0.00039376524018764, "loss": 5.6617, "mean_token_accuracy": 0.16960146874189377, "num_tokens": 4726653.0, "step": 1970 }, { "entropy": 5.826849174499512, "epoch": 0.12698514755995627, "grad_norm": 1.0859375, "learning_rate": 0.00039276301116943616, "loss": 5.5537, "mean_token_accuracy": 0.1792762890458107, "num_tokens": 4738989.0, "step": 1975 }, { "entropy": 5.8345729351043705, "epoch": 0.12730662894618403, "grad_norm": 0.953125, "learning_rate": 0.0003917575536187936, "loss": 5.4978, "mean_token_accuracy": 0.18163758963346482, "num_tokens": 4750493.0, "step": 1980 }, { "entropy": 5.797660684585571, "epoch": 0.12762811033241175, "grad_norm": 1.015625, "learning_rate": 0.00039074889510083894, "loss": 5.5225, "mean_token_accuracy": 0.17844658195972443, "num_tokens": 4763240.0, "step": 1985 }, { "entropy": 5.834128379821777, "epoch": 0.12794959171863948, "grad_norm": 1.1484375, "learning_rate": 0.00038973706326845495, "loss": 5.5719, "mean_token_accuracy": 0.18070205599069594, "num_tokens": 4774804.0, "step": 1990 }, { "entropy": 5.8326366424560545, "epoch": 0.12827107310486724, "grad_norm": 0.99609375, "learning_rate": 0.0003887220858615225, "loss": 5.6495, "mean_token_accuracy": 0.17115117609500885, "num_tokens": 4788684.0, "step": 1995 }, { "entropy": 5.905576086044311, "epoch": 0.12859255449109497, "grad_norm": 1.2109375, "learning_rate": 0.0003877039907061597, "loss": 5.6195, "mean_token_accuracy": 0.17407953292131423, "num_tokens": 4799819.0, "step": 2000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1078644754022400.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }