{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.06429627724554748, "eval_steps": 500, "global_step": 1000, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742344284057618, "epoch": 0.00032148138622773744, "grad_norm": 5.1875, "learning_rate": 2e-06, "loss": 10.7889, "mean_token_accuracy": 0.0001923076924867928, "num_tokens": 10787.0, "step": 5 }, { "entropy": 10.742341995239258, "epoch": 0.0006429627724554749, "grad_norm": 4.6875, "learning_rate": 4.5e-06, "loss": 10.7754, "mean_token_accuracy": 9.199631749652326e-05, "num_tokens": 21408.0, "step": 10 }, { "entropy": 10.74231481552124, "epoch": 0.0009644441586832123, "grad_norm": 4.84375, "learning_rate": 7e-06, "loss": 10.7745, "mean_token_accuracy": 0.0, "num_tokens": 33838.0, "step": 15 }, { "entropy": 10.742263031005859, "epoch": 0.0012859255449109497, "grad_norm": 4.875, "learning_rate": 9.5e-06, "loss": 10.7415, "mean_token_accuracy": 0.0, "num_tokens": 46592.0, "step": 20 }, { "entropy": 10.742058944702148, "epoch": 0.001607406931138687, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 10.6278, "mean_token_accuracy": 0.00028761792345903813, "num_tokens": 57409.0, "step": 25 }, { "entropy": 10.741728782653809, "epoch": 0.0019288883173664245, "grad_norm": 3.71875, "learning_rate": 1.4500000000000002e-05, "loss": 10.5262, "mean_token_accuracy": 0.005182119726669043, "num_tokens": 68705.0, "step": 30 }, { "entropy": 10.74124059677124, "epoch": 0.002250369703594162, "grad_norm": 3.09375, "learning_rate": 1.7000000000000003e-05, "loss": 10.4297, "mean_token_accuracy": 0.019557270966470242, "num_tokens": 81460.0, "step": 35 }, { "entropy": 10.740433311462402, "epoch": 0.0025718510898218995, "grad_norm": 2.5, "learning_rate": 1.95e-05, "loss": 10.2725, "mean_token_accuracy": 0.02960890345275402, "num_tokens": 93576.0, "step": 40 }, { "entropy": 10.739229869842529, "epoch": 0.0028933324760496365, "grad_norm": 2.125, "learning_rate": 2.2e-05, "loss": 10.1857, "mean_token_accuracy": 0.02886150423437357, "num_tokens": 105556.0, "step": 45 }, { "entropy": 10.738618659973145, "epoch": 0.003214813862277374, "grad_norm": 2.03125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0792, "mean_token_accuracy": 0.031074166856706144, "num_tokens": 117850.0, "step": 50 }, { "entropy": 10.738714694976807, "epoch": 0.0035362952485051115, "grad_norm": 1.9296875, "learning_rate": 2.7e-05, "loss": 10.0244, "mean_token_accuracy": 0.031163782812654972, "num_tokens": 130955.0, "step": 55 }, { "entropy": 10.738016033172608, "epoch": 0.003857776634732849, "grad_norm": 1.9140625, "learning_rate": 2.95e-05, "loss": 9.9307, "mean_token_accuracy": 0.03660368006676436, "num_tokens": 141959.0, "step": 60 }, { "entropy": 10.736786365509033, "epoch": 0.0041792580209605865, "grad_norm": 1.84375, "learning_rate": 3.2e-05, "loss": 9.8915, "mean_token_accuracy": 0.03608605414628983, "num_tokens": 153856.0, "step": 65 }, { "entropy": 10.73516550064087, "epoch": 0.004500739407188324, "grad_norm": 1.9140625, "learning_rate": 3.4500000000000005e-05, "loss": 9.8384, "mean_token_accuracy": 0.043716078624129295, "num_tokens": 166748.0, "step": 70 }, { "entropy": 10.732550621032715, "epoch": 0.0048222207934160615, "grad_norm": 1.9375, "learning_rate": 3.7e-05, "loss": 9.728, "mean_token_accuracy": 0.04251385778188706, "num_tokens": 177172.0, "step": 75 }, { "entropy": 10.728882122039796, "epoch": 0.005143702179643799, "grad_norm": 1.8046875, "learning_rate": 3.95e-05, "loss": 9.6737, "mean_token_accuracy": 0.04158058017492294, "num_tokens": 189418.0, "step": 80 }, { "entropy": 10.723980331420899, "epoch": 0.0054651835658715365, "grad_norm": 2.0625, "learning_rate": 4.2000000000000004e-05, "loss": 9.5846, "mean_token_accuracy": 0.039340490289032456, "num_tokens": 201349.0, "step": 85 }, { "entropy": 10.718004131317139, "epoch": 0.005786664952099273, "grad_norm": 1.8046875, "learning_rate": 4.45e-05, "loss": 9.5176, "mean_token_accuracy": 0.04345524609088898, "num_tokens": 212298.0, "step": 90 }, { "entropy": 10.710467433929443, "epoch": 0.0061081463383270106, "grad_norm": 1.796875, "learning_rate": 4.7000000000000004e-05, "loss": 9.467, "mean_token_accuracy": 0.04573878571391106, "num_tokens": 223831.0, "step": 95 }, { "entropy": 10.699566841125488, "epoch": 0.006429627724554748, "grad_norm": 1.78125, "learning_rate": 4.9500000000000004e-05, "loss": 9.3601, "mean_token_accuracy": 0.04835316389799118, "num_tokens": 236675.0, "step": 100 }, { "entropy": 10.683355236053467, "epoch": 0.0067511091107824855, "grad_norm": 1.7421875, "learning_rate": 5.2e-05, "loss": 9.242, "mean_token_accuracy": 0.04662417732179165, "num_tokens": 247634.0, "step": 105 }, { "entropy": 10.66143503189087, "epoch": 0.007072590497010223, "grad_norm": 1.8046875, "learning_rate": 5.45e-05, "loss": 9.1162, "mean_token_accuracy": 0.05328451320528984, "num_tokens": 259101.0, "step": 110 }, { "entropy": 10.631138801574707, "epoch": 0.0073940718832379605, "grad_norm": 1.6328125, "learning_rate": 5.7e-05, "loss": 9.0393, "mean_token_accuracy": 0.05271790884435177, "num_tokens": 272151.0, "step": 115 }, { "entropy": 10.594438171386718, "epoch": 0.007715553269465698, "grad_norm": 1.75, "learning_rate": 5.9499999999999996e-05, "loss": 8.8606, "mean_token_accuracy": 0.057512912154197696, "num_tokens": 283619.0, "step": 120 }, { "entropy": 10.537901401519775, "epoch": 0.008037034655693436, "grad_norm": 1.734375, "learning_rate": 6.2e-05, "loss": 8.7551, "mean_token_accuracy": 0.05864038914442062, "num_tokens": 296233.0, "step": 125 }, { "entropy": 10.46686897277832, "epoch": 0.008358516041921173, "grad_norm": 1.6015625, "learning_rate": 6.450000000000001e-05, "loss": 8.6685, "mean_token_accuracy": 0.05632430389523506, "num_tokens": 309222.0, "step": 130 }, { "entropy": 10.386721515655518, "epoch": 0.00867999742814891, "grad_norm": 1.515625, "learning_rate": 6.7e-05, "loss": 8.4983, "mean_token_accuracy": 0.05754401199519634, "num_tokens": 322291.0, "step": 135 }, { "entropy": 10.285922241210937, "epoch": 0.009001478814376648, "grad_norm": 1.484375, "learning_rate": 6.950000000000001e-05, "loss": 8.3328, "mean_token_accuracy": 0.06465739980340005, "num_tokens": 333520.0, "step": 140 }, { "entropy": 10.168986701965332, "epoch": 0.009322960200604385, "grad_norm": 1.453125, "learning_rate": 7.2e-05, "loss": 8.1641, "mean_token_accuracy": 0.0657901257276535, "num_tokens": 344883.0, "step": 145 }, { "entropy": 10.042533111572265, "epoch": 0.009644441586832123, "grad_norm": 1.3515625, "learning_rate": 7.45e-05, "loss": 8.0727, "mean_token_accuracy": 0.07245785929262638, "num_tokens": 356600.0, "step": 150 }, { "entropy": 9.882461643218994, "epoch": 0.00996592297305986, "grad_norm": 1.4609375, "learning_rate": 7.7e-05, "loss": 7.9127, "mean_token_accuracy": 0.0721237450838089, "num_tokens": 368527.0, "step": 155 }, { "entropy": 9.694390869140625, "epoch": 0.010287404359287598, "grad_norm": 1.5, "learning_rate": 7.950000000000001e-05, "loss": 7.8511, "mean_token_accuracy": 0.06826285421848297, "num_tokens": 379836.0, "step": 160 }, { "entropy": 9.510071659088135, "epoch": 0.010608885745515335, "grad_norm": 1.0625, "learning_rate": 8.2e-05, "loss": 7.8393, "mean_token_accuracy": 0.0674971140921116, "num_tokens": 392535.0, "step": 165 }, { "entropy": 9.299476528167725, "epoch": 0.010930367131743073, "grad_norm": 0.91015625, "learning_rate": 8.450000000000001e-05, "loss": 7.7515, "mean_token_accuracy": 0.06860553249716758, "num_tokens": 405259.0, "step": 170 }, { "entropy": 9.040483093261718, "epoch": 0.011251848517970809, "grad_norm": 0.96875, "learning_rate": 8.7e-05, "loss": 7.599, "mean_token_accuracy": 0.07114262394607067, "num_tokens": 417922.0, "step": 175 }, { "entropy": 8.870688247680665, "epoch": 0.011573329904198546, "grad_norm": 1.078125, "learning_rate": 8.95e-05, "loss": 7.6169, "mean_token_accuracy": 0.07012484185397624, "num_tokens": 429411.0, "step": 180 }, { "entropy": 8.67488489151001, "epoch": 0.011894811290426284, "grad_norm": 1.171875, "learning_rate": 9.2e-05, "loss": 7.386, "mean_token_accuracy": 0.0772802360355854, "num_tokens": 439950.0, "step": 185 }, { "entropy": 8.489033699035645, "epoch": 0.012216292676654021, "grad_norm": 1.328125, "learning_rate": 9.45e-05, "loss": 7.3822, "mean_token_accuracy": 0.07805034667253494, "num_tokens": 451245.0, "step": 190 }, { "entropy": 8.393837928771973, "epoch": 0.012537774062881759, "grad_norm": 0.8671875, "learning_rate": 9.7e-05, "loss": 7.4539, "mean_token_accuracy": 0.07150709182024002, "num_tokens": 465146.0, "step": 195 }, { "entropy": 8.359711456298829, "epoch": 0.012859255449109496, "grad_norm": 1.28125, "learning_rate": 9.95e-05, "loss": 7.4708, "mean_token_accuracy": 0.07765417769551278, "num_tokens": 477079.0, "step": 200 }, { "entropy": 8.254557895660401, "epoch": 0.013180736835337234, "grad_norm": 1.0546875, "learning_rate": 0.000102, "loss": 7.2964, "mean_token_accuracy": 0.08167731463909149, "num_tokens": 488216.0, "step": 205 }, { "entropy": 8.201800632476807, "epoch": 0.013502218221564971, "grad_norm": 1.3984375, "learning_rate": 0.00010449999999999999, "loss": 7.2996, "mean_token_accuracy": 0.08416381254792213, "num_tokens": 501040.0, "step": 210 }, { "entropy": 8.122812938690185, "epoch": 0.013823699607792709, "grad_norm": 1.015625, "learning_rate": 0.000107, "loss": 7.2535, "mean_token_accuracy": 0.08663205504417419, "num_tokens": 512636.0, "step": 215 }, { "entropy": 8.088646793365479, "epoch": 0.014145180994020446, "grad_norm": 0.9765625, "learning_rate": 0.0001095, "loss": 7.301, "mean_token_accuracy": 0.08183000981807709, "num_tokens": 525249.0, "step": 220 }, { "entropy": 8.097221660614014, "epoch": 0.014466662380248184, "grad_norm": 1.34375, "learning_rate": 0.000112, "loss": 7.3486, "mean_token_accuracy": 0.08002460822463035, "num_tokens": 536963.0, "step": 225 }, { "entropy": 8.05938491821289, "epoch": 0.014788143766475921, "grad_norm": 1.171875, "learning_rate": 0.0001145, "loss": 7.2099, "mean_token_accuracy": 0.08030182272195815, "num_tokens": 549008.0, "step": 230 }, { "entropy": 8.041013956069946, "epoch": 0.015109625152703659, "grad_norm": 1.0390625, "learning_rate": 0.00011700000000000001, "loss": 7.2319, "mean_token_accuracy": 0.09074903577566147, "num_tokens": 560958.0, "step": 235 }, { "entropy": 7.961578607559204, "epoch": 0.015431106538931396, "grad_norm": 0.9921875, "learning_rate": 0.00011949999999999999, "loss": 7.1147, "mean_token_accuracy": 0.09378238469362259, "num_tokens": 572472.0, "step": 240 }, { "entropy": 7.922268009185791, "epoch": 0.015752587925159132, "grad_norm": 1.015625, "learning_rate": 0.000122, "loss": 7.1808, "mean_token_accuracy": 0.08942435756325721, "num_tokens": 585125.0, "step": 245 }, { "entropy": 7.913467741012573, "epoch": 0.01607406931138687, "grad_norm": 1.0390625, "learning_rate": 0.0001245, "loss": 7.1259, "mean_token_accuracy": 0.09376866966485978, "num_tokens": 597774.0, "step": 250 }, { "entropy": 7.856596946716309, "epoch": 0.016395550697614607, "grad_norm": 0.98828125, "learning_rate": 0.000127, "loss": 7.1233, "mean_token_accuracy": 0.09992039278149605, "num_tokens": 610130.0, "step": 255 }, { "entropy": 7.8915050506591795, "epoch": 0.016717032083842346, "grad_norm": 1.03125, "learning_rate": 0.0001295, "loss": 7.1488, "mean_token_accuracy": 0.09605236500501632, "num_tokens": 621659.0, "step": 260 }, { "entropy": 7.833514070510864, "epoch": 0.017038513470070082, "grad_norm": 1.0078125, "learning_rate": 0.000132, "loss": 7.0552, "mean_token_accuracy": 0.09916835874319077, "num_tokens": 633172.0, "step": 265 }, { "entropy": 7.854182243347168, "epoch": 0.01735999485629782, "grad_norm": 1.125, "learning_rate": 0.00013450000000000002, "loss": 7.0595, "mean_token_accuracy": 0.09681920260190964, "num_tokens": 643928.0, "step": 270 }, { "entropy": 7.712904834747315, "epoch": 0.017681476242525557, "grad_norm": 1.2265625, "learning_rate": 0.00013700000000000002, "loss": 6.9556, "mean_token_accuracy": 0.09763396382331849, "num_tokens": 654693.0, "step": 275 }, { "entropy": 7.817079973220825, "epoch": 0.018002957628753296, "grad_norm": 1.1484375, "learning_rate": 0.0001395, "loss": 7.1338, "mean_token_accuracy": 0.09172611869871616, "num_tokens": 667216.0, "step": 280 }, { "entropy": 7.727632856369018, "epoch": 0.01832443901498103, "grad_norm": 1.5078125, "learning_rate": 0.00014199999999999998, "loss": 6.9273, "mean_token_accuracy": 0.10492636933922768, "num_tokens": 679605.0, "step": 285 }, { "entropy": 7.6807286739349365, "epoch": 0.01864592040120877, "grad_norm": 1.0703125, "learning_rate": 0.0001445, "loss": 7.0243, "mean_token_accuracy": 0.09721777960658073, "num_tokens": 691581.0, "step": 290 }, { "entropy": 7.730735111236572, "epoch": 0.018967401787436507, "grad_norm": 1.203125, "learning_rate": 0.000147, "loss": 7.064, "mean_token_accuracy": 0.10062759071588516, "num_tokens": 703162.0, "step": 295 }, { "entropy": 7.675752592086792, "epoch": 0.019288883173664246, "grad_norm": 1.0390625, "learning_rate": 0.0001495, "loss": 6.947, "mean_token_accuracy": 0.10126433670520782, "num_tokens": 715024.0, "step": 300 }, { "entropy": 7.604991054534912, "epoch": 0.01961036455989198, "grad_norm": 1.390625, "learning_rate": 0.000152, "loss": 6.9484, "mean_token_accuracy": 0.10657469853758812, "num_tokens": 728434.0, "step": 305 }, { "entropy": 7.582369089126587, "epoch": 0.01993184594611972, "grad_norm": 1.109375, "learning_rate": 0.00015450000000000001, "loss": 6.9856, "mean_token_accuracy": 0.10384280532598496, "num_tokens": 741049.0, "step": 310 }, { "entropy": 7.556066989898682, "epoch": 0.020253327332347457, "grad_norm": 1.0234375, "learning_rate": 0.000157, "loss": 6.8995, "mean_token_accuracy": 0.10891256630420684, "num_tokens": 753316.0, "step": 315 }, { "entropy": 7.487519884109497, "epoch": 0.020574808718575196, "grad_norm": 1.078125, "learning_rate": 0.0001595, "loss": 6.8976, "mean_token_accuracy": 0.10375816151499748, "num_tokens": 766605.0, "step": 320 }, { "entropy": 7.575658369064331, "epoch": 0.02089629010480293, "grad_norm": 1.125, "learning_rate": 0.000162, "loss": 6.8776, "mean_token_accuracy": 0.10548696890473366, "num_tokens": 778857.0, "step": 325 }, { "entropy": 7.49542875289917, "epoch": 0.02121777149103067, "grad_norm": 1.1015625, "learning_rate": 0.00016450000000000001, "loss": 6.8801, "mean_token_accuracy": 0.0980547919869423, "num_tokens": 790497.0, "step": 330 }, { "entropy": 7.548171281814575, "epoch": 0.021539252877258407, "grad_norm": 1.2421875, "learning_rate": 0.00016700000000000002, "loss": 6.9457, "mean_token_accuracy": 0.10034449025988579, "num_tokens": 803021.0, "step": 335 }, { "entropy": 7.514672136306762, "epoch": 0.021860734263486146, "grad_norm": 1.234375, "learning_rate": 0.00016950000000000003, "loss": 6.8973, "mean_token_accuracy": 0.10233017727732659, "num_tokens": 815056.0, "step": 340 }, { "entropy": 7.548324632644653, "epoch": 0.02218221564971388, "grad_norm": 0.984375, "learning_rate": 0.00017199999999999998, "loss": 6.8436, "mean_token_accuracy": 0.11048155352473259, "num_tokens": 827149.0, "step": 345 }, { "entropy": 7.47729377746582, "epoch": 0.022503697035941617, "grad_norm": 1.1484375, "learning_rate": 0.00017449999999999999, "loss": 6.8877, "mean_token_accuracy": 0.10872978940606118, "num_tokens": 839172.0, "step": 350 }, { "entropy": 7.497987508773804, "epoch": 0.022825178422169357, "grad_norm": 1.75, "learning_rate": 0.000177, "loss": 6.9329, "mean_token_accuracy": 0.10738308876752853, "num_tokens": 851148.0, "step": 355 }, { "entropy": 7.548883295059204, "epoch": 0.023146659808397092, "grad_norm": 1.140625, "learning_rate": 0.0001795, "loss": 6.8783, "mean_token_accuracy": 0.10820900201797486, "num_tokens": 862904.0, "step": 360 }, { "entropy": 7.436304187774658, "epoch": 0.02346814119462483, "grad_norm": 1.359375, "learning_rate": 0.000182, "loss": 6.7668, "mean_token_accuracy": 0.11688080206513404, "num_tokens": 874720.0, "step": 365 }, { "entropy": 7.409350728988647, "epoch": 0.023789622580852567, "grad_norm": 1.0625, "learning_rate": 0.0001845, "loss": 6.8078, "mean_token_accuracy": 0.11283540055155754, "num_tokens": 887261.0, "step": 370 }, { "entropy": 7.4675617694854735, "epoch": 0.024111103967080307, "grad_norm": 1.0859375, "learning_rate": 0.000187, "loss": 6.7767, "mean_token_accuracy": 0.1088891163468361, "num_tokens": 898048.0, "step": 375 }, { "entropy": 7.336610507965088, "epoch": 0.024432585353308042, "grad_norm": 1.03125, "learning_rate": 0.0001895, "loss": 6.8343, "mean_token_accuracy": 0.11030351296067238, "num_tokens": 910297.0, "step": 380 }, { "entropy": 7.432262849807739, "epoch": 0.02475406673953578, "grad_norm": 1.0546875, "learning_rate": 0.000192, "loss": 6.8693, "mean_token_accuracy": 0.10626164525747299, "num_tokens": 923463.0, "step": 385 }, { "entropy": 7.399855327606201, "epoch": 0.025075548125763517, "grad_norm": 0.99609375, "learning_rate": 0.0001945, "loss": 6.8379, "mean_token_accuracy": 0.11091364100575447, "num_tokens": 935306.0, "step": 390 }, { "entropy": 7.355379390716553, "epoch": 0.025397029511991256, "grad_norm": 1.0859375, "learning_rate": 0.00019700000000000002, "loss": 6.7379, "mean_token_accuracy": 0.115155877918005, "num_tokens": 947827.0, "step": 395 }, { "entropy": 7.281255531311035, "epoch": 0.025718510898218992, "grad_norm": 1.375, "learning_rate": 0.00019950000000000002, "loss": 6.6838, "mean_token_accuracy": 0.12000245451927186, "num_tokens": 961664.0, "step": 400 }, { "entropy": 7.312869071960449, "epoch": 0.02603999228444673, "grad_norm": 1.21875, "learning_rate": 0.000202, "loss": 6.7829, "mean_token_accuracy": 0.09842887446284294, "num_tokens": 973981.0, "step": 405 }, { "entropy": 7.335048866271973, "epoch": 0.026361473670674467, "grad_norm": 1.3515625, "learning_rate": 0.00020449999999999998, "loss": 6.8181, "mean_token_accuracy": 0.11232979372143745, "num_tokens": 986702.0, "step": 410 }, { "entropy": 7.318604183197022, "epoch": 0.026682955056902206, "grad_norm": 1.1640625, "learning_rate": 0.000207, "loss": 6.7181, "mean_token_accuracy": 0.11695454865694047, "num_tokens": 998513.0, "step": 415 }, { "entropy": 7.294521141052246, "epoch": 0.027004436443129942, "grad_norm": 1.3515625, "learning_rate": 0.0002095, "loss": 6.7037, "mean_token_accuracy": 0.11898418515920639, "num_tokens": 1011111.0, "step": 420 }, { "entropy": 7.186019515991211, "epoch": 0.02732591782935768, "grad_norm": 1.2578125, "learning_rate": 0.000212, "loss": 6.6799, "mean_token_accuracy": 0.11566238775849343, "num_tokens": 1021779.0, "step": 425 }, { "entropy": 7.370555067062378, "epoch": 0.027647399215585417, "grad_norm": 1.0703125, "learning_rate": 0.0002145, "loss": 6.7381, "mean_token_accuracy": 0.11263754442334176, "num_tokens": 1033228.0, "step": 430 }, { "entropy": 7.226527881622315, "epoch": 0.027968880601813156, "grad_norm": 1.0703125, "learning_rate": 0.00021700000000000002, "loss": 6.6415, "mean_token_accuracy": 0.11632440984249115, "num_tokens": 1044964.0, "step": 435 }, { "entropy": 7.18967342376709, "epoch": 0.028290361988040892, "grad_norm": 1.2265625, "learning_rate": 0.0002195, "loss": 6.6058, "mean_token_accuracy": 0.12256524711847305, "num_tokens": 1056450.0, "step": 440 }, { "entropy": 7.242304182052612, "epoch": 0.02861184337426863, "grad_norm": 1.0703125, "learning_rate": 0.000222, "loss": 6.7402, "mean_token_accuracy": 0.1159943200647831, "num_tokens": 1067031.0, "step": 445 }, { "entropy": 7.1245410442352295, "epoch": 0.028933324760496367, "grad_norm": 1.3046875, "learning_rate": 0.0002245, "loss": 6.6051, "mean_token_accuracy": 0.1228414848446846, "num_tokens": 1078718.0, "step": 450 }, { "entropy": 7.182725429534912, "epoch": 0.029254806146724106, "grad_norm": 1.0703125, "learning_rate": 0.00022700000000000002, "loss": 6.6217, "mean_token_accuracy": 0.11590910404920578, "num_tokens": 1091630.0, "step": 455 }, { "entropy": 7.229373598098755, "epoch": 0.029576287532951842, "grad_norm": 1.2109375, "learning_rate": 0.00022950000000000002, "loss": 6.6761, "mean_token_accuracy": 0.11919770017266273, "num_tokens": 1102339.0, "step": 460 }, { "entropy": 7.166626882553101, "epoch": 0.029897768919179578, "grad_norm": 1.2109375, "learning_rate": 0.00023200000000000003, "loss": 6.6491, "mean_token_accuracy": 0.11653751060366631, "num_tokens": 1114385.0, "step": 465 }, { "entropy": 7.213460397720337, "epoch": 0.030219250305407317, "grad_norm": 1.0625, "learning_rate": 0.00023449999999999998, "loss": 6.6627, "mean_token_accuracy": 0.12240460664033889, "num_tokens": 1126364.0, "step": 470 }, { "entropy": 7.160998678207397, "epoch": 0.030540731691635053, "grad_norm": 1.265625, "learning_rate": 0.000237, "loss": 6.6469, "mean_token_accuracy": 0.12170583978295327, "num_tokens": 1137492.0, "step": 475 }, { "entropy": 7.108113145828247, "epoch": 0.030862213077862792, "grad_norm": 1.078125, "learning_rate": 0.0002395, "loss": 6.5317, "mean_token_accuracy": 0.12732059210538865, "num_tokens": 1148734.0, "step": 480 }, { "entropy": 7.14542589187622, "epoch": 0.031183694464090528, "grad_norm": 0.96875, "learning_rate": 0.000242, "loss": 6.6757, "mean_token_accuracy": 0.12211950346827508, "num_tokens": 1163229.0, "step": 485 }, { "entropy": 7.165257167816162, "epoch": 0.031505175850318264, "grad_norm": 1.015625, "learning_rate": 0.0002445, "loss": 6.6959, "mean_token_accuracy": 0.1155033528804779, "num_tokens": 1175452.0, "step": 490 }, { "entropy": 7.1013343334198, "epoch": 0.031826657236546006, "grad_norm": 1.0078125, "learning_rate": 0.000247, "loss": 6.5479, "mean_token_accuracy": 0.12406643405556679, "num_tokens": 1187836.0, "step": 495 }, { "entropy": 7.197257661819458, "epoch": 0.03214813862277374, "grad_norm": 1.09375, "learning_rate": 0.0002495, "loss": 6.6297, "mean_token_accuracy": 0.12298163026571274, "num_tokens": 1198867.0, "step": 500 }, { "entropy": 7.00099925994873, "epoch": 0.03246962000900148, "grad_norm": 1.1015625, "learning_rate": 0.000252, "loss": 6.5666, "mean_token_accuracy": 0.11886920258402825, "num_tokens": 1212534.0, "step": 505 }, { "entropy": 7.123233509063721, "epoch": 0.032791101395229214, "grad_norm": 1.4375, "learning_rate": 0.0002545, "loss": 6.4812, "mean_token_accuracy": 0.1376668132841587, "num_tokens": 1223028.0, "step": 510 }, { "entropy": 7.040684223175049, "epoch": 0.033112582781456956, "grad_norm": 1.1875, "learning_rate": 0.000257, "loss": 6.5438, "mean_token_accuracy": 0.12737778946757317, "num_tokens": 1235460.0, "step": 515 }, { "entropy": 6.9980145454406735, "epoch": 0.03343406416768469, "grad_norm": 1.1953125, "learning_rate": 0.0002595, "loss": 6.5329, "mean_token_accuracy": 0.1297763057053089, "num_tokens": 1247180.0, "step": 520 }, { "entropy": 7.0526275634765625, "epoch": 0.03375554555391243, "grad_norm": 1.0859375, "learning_rate": 0.000262, "loss": 6.5934, "mean_token_accuracy": 0.12331821173429489, "num_tokens": 1260000.0, "step": 525 }, { "entropy": 6.997141313552857, "epoch": 0.034077026940140163, "grad_norm": 1.203125, "learning_rate": 0.00026450000000000003, "loss": 6.4284, "mean_token_accuracy": 0.12857622653245926, "num_tokens": 1271346.0, "step": 530 }, { "entropy": 7.008873414993286, "epoch": 0.034398508326367906, "grad_norm": 1.0703125, "learning_rate": 0.00026700000000000004, "loss": 6.5163, "mean_token_accuracy": 0.12632984891533852, "num_tokens": 1283017.0, "step": 535 }, { "entropy": 7.0776612758636475, "epoch": 0.03471998971259564, "grad_norm": 1.15625, "learning_rate": 0.00026950000000000005, "loss": 6.5481, "mean_token_accuracy": 0.12498711422085762, "num_tokens": 1293243.0, "step": 540 }, { "entropy": 6.8785299301147464, "epoch": 0.03504147109882338, "grad_norm": 1.171875, "learning_rate": 0.00027200000000000005, "loss": 6.439, "mean_token_accuracy": 0.134949841350317, "num_tokens": 1304801.0, "step": 545 }, { "entropy": 7.143336582183838, "epoch": 0.03536295248505111, "grad_norm": 1.046875, "learning_rate": 0.0002745, "loss": 6.6164, "mean_token_accuracy": 0.12681611329317094, "num_tokens": 1315985.0, "step": 550 }, { "entropy": 6.930103540420532, "epoch": 0.035684433871278856, "grad_norm": 1.125, "learning_rate": 0.000277, "loss": 6.4575, "mean_token_accuracy": 0.13166105449199678, "num_tokens": 1327771.0, "step": 555 }, { "entropy": 6.966667604446411, "epoch": 0.03600591525750659, "grad_norm": 1.3359375, "learning_rate": 0.0002795, "loss": 6.412, "mean_token_accuracy": 0.13625267744064332, "num_tokens": 1338524.0, "step": 560 }, { "entropy": 6.932982063293457, "epoch": 0.03632739664373433, "grad_norm": 1.2734375, "learning_rate": 0.00028199999999999997, "loss": 6.4579, "mean_token_accuracy": 0.12851827815175057, "num_tokens": 1350619.0, "step": 565 }, { "entropy": 6.9319816589355465, "epoch": 0.03664887802996206, "grad_norm": 1.1484375, "learning_rate": 0.0002845, "loss": 6.4918, "mean_token_accuracy": 0.12711360901594163, "num_tokens": 1362781.0, "step": 570 }, { "entropy": 6.932379579544067, "epoch": 0.0369703594161898, "grad_norm": 1.171875, "learning_rate": 0.000287, "loss": 6.4437, "mean_token_accuracy": 0.1318575732409954, "num_tokens": 1373784.0, "step": 575 }, { "entropy": 7.074356174468994, "epoch": 0.03729184080241754, "grad_norm": 1.1171875, "learning_rate": 0.0002895, "loss": 6.705, "mean_token_accuracy": 0.11901014372706413, "num_tokens": 1386426.0, "step": 580 }, { "entropy": 6.872195100784301, "epoch": 0.03761332218864528, "grad_norm": 1.0703125, "learning_rate": 0.000292, "loss": 6.3845, "mean_token_accuracy": 0.13377587869763374, "num_tokens": 1397703.0, "step": 585 }, { "entropy": 6.900994157791137, "epoch": 0.03793480357487301, "grad_norm": 1.046875, "learning_rate": 0.0002945, "loss": 6.4395, "mean_token_accuracy": 0.12795801013708114, "num_tokens": 1410071.0, "step": 590 }, { "entropy": 6.954240083694458, "epoch": 0.03825628496110075, "grad_norm": 1.3828125, "learning_rate": 0.000297, "loss": 6.4338, "mean_token_accuracy": 0.1245950624346733, "num_tokens": 1421387.0, "step": 595 }, { "entropy": 6.907541370391845, "epoch": 0.03857776634732849, "grad_norm": 1.2109375, "learning_rate": 0.0002995, "loss": 6.4593, "mean_token_accuracy": 0.12624357938766478, "num_tokens": 1433253.0, "step": 600 }, { "entropy": 6.899614143371582, "epoch": 0.03889924773355623, "grad_norm": 1.4296875, "learning_rate": 0.000302, "loss": 6.4459, "mean_token_accuracy": 0.12114612162113189, "num_tokens": 1444189.0, "step": 605 }, { "entropy": 6.889805459976197, "epoch": 0.03922072911978396, "grad_norm": 1.1484375, "learning_rate": 0.0003045, "loss": 6.4478, "mean_token_accuracy": 0.12658536732196807, "num_tokens": 1455830.0, "step": 610 }, { "entropy": 6.883515930175781, "epoch": 0.0395422105060117, "grad_norm": 1.2421875, "learning_rate": 0.000307, "loss": 6.474, "mean_token_accuracy": 0.13375141024589537, "num_tokens": 1467442.0, "step": 615 }, { "entropy": 6.902092170715332, "epoch": 0.03986369189223944, "grad_norm": 1.2421875, "learning_rate": 0.0003095, "loss": 6.378, "mean_token_accuracy": 0.1375095695257187, "num_tokens": 1478113.0, "step": 620 }, { "entropy": 6.887974262237549, "epoch": 0.04018517327846718, "grad_norm": 1.2265625, "learning_rate": 0.000312, "loss": 6.4173, "mean_token_accuracy": 0.1352170430123806, "num_tokens": 1490097.0, "step": 625 }, { "entropy": 6.751322174072266, "epoch": 0.04050665466469491, "grad_norm": 1.15625, "learning_rate": 0.0003145, "loss": 6.3863, "mean_token_accuracy": 0.13129702284932138, "num_tokens": 1501565.0, "step": 630 }, { "entropy": 6.841671752929687, "epoch": 0.04082813605092265, "grad_norm": 1.1640625, "learning_rate": 0.000317, "loss": 6.385, "mean_token_accuracy": 0.13331395909190177, "num_tokens": 1512434.0, "step": 635 }, { "entropy": 6.838632202148437, "epoch": 0.04114961743715039, "grad_norm": 1.0859375, "learning_rate": 0.0003195, "loss": 6.3326, "mean_token_accuracy": 0.13992721661925317, "num_tokens": 1524212.0, "step": 640 }, { "entropy": 6.717573928833008, "epoch": 0.04147109882337813, "grad_norm": 1.046875, "learning_rate": 0.000322, "loss": 6.2641, "mean_token_accuracy": 0.13435597494244575, "num_tokens": 1536588.0, "step": 645 }, { "entropy": 6.813121795654297, "epoch": 0.04179258020960586, "grad_norm": 1.140625, "learning_rate": 0.00032450000000000003, "loss": 6.4067, "mean_token_accuracy": 0.1357954926788807, "num_tokens": 1548334.0, "step": 650 }, { "entropy": 6.733175325393677, "epoch": 0.0421140615958336, "grad_norm": 1.1796875, "learning_rate": 0.00032700000000000003, "loss": 6.3691, "mean_token_accuracy": 0.13718299865722655, "num_tokens": 1560381.0, "step": 655 }, { "entropy": 6.773969268798828, "epoch": 0.04243554298206134, "grad_norm": 1.1015625, "learning_rate": 0.00032950000000000004, "loss": 6.3926, "mean_token_accuracy": 0.1230570524930954, "num_tokens": 1573484.0, "step": 660 }, { "entropy": 6.820370149612427, "epoch": 0.04275702436828908, "grad_norm": 1.171875, "learning_rate": 0.00033200000000000005, "loss": 6.3808, "mean_token_accuracy": 0.13517048284411431, "num_tokens": 1585471.0, "step": 665 }, { "entropy": 6.72473177909851, "epoch": 0.04307850575451681, "grad_norm": 1.0234375, "learning_rate": 0.00033450000000000005, "loss": 6.2612, "mean_token_accuracy": 0.14530360400676728, "num_tokens": 1596321.0, "step": 670 }, { "entropy": 6.86566572189331, "epoch": 0.04339998714074455, "grad_norm": 1.2265625, "learning_rate": 0.000337, "loss": 6.4255, "mean_token_accuracy": 0.1406514436006546, "num_tokens": 1608219.0, "step": 675 }, { "entropy": 6.6760951519012455, "epoch": 0.04372146852697229, "grad_norm": 1.0859375, "learning_rate": 0.0003395, "loss": 6.2714, "mean_token_accuracy": 0.13934220522642135, "num_tokens": 1619420.0, "step": 680 }, { "entropy": 6.79856915473938, "epoch": 0.04404294991320003, "grad_norm": 1.1015625, "learning_rate": 0.000342, "loss": 6.3423, "mean_token_accuracy": 0.13619581386446952, "num_tokens": 1631022.0, "step": 685 }, { "entropy": 6.7899799823760985, "epoch": 0.04436443129942776, "grad_norm": 1.0859375, "learning_rate": 0.00034449999999999997, "loss": 6.3661, "mean_token_accuracy": 0.13836024552583695, "num_tokens": 1642930.0, "step": 690 }, { "entropy": 6.691325092315674, "epoch": 0.0446859126856555, "grad_norm": 1.0703125, "learning_rate": 0.000347, "loss": 6.3574, "mean_token_accuracy": 0.1367586337029934, "num_tokens": 1655776.0, "step": 695 }, { "entropy": 6.817952728271484, "epoch": 0.045007394071883235, "grad_norm": 1.0390625, "learning_rate": 0.0003495, "loss": 6.361, "mean_token_accuracy": 0.1369588740170002, "num_tokens": 1669330.0, "step": 700 }, { "entropy": 6.626900386810303, "epoch": 0.04532887545811098, "grad_norm": 1.078125, "learning_rate": 0.000352, "loss": 6.3733, "mean_token_accuracy": 0.1379777029156685, "num_tokens": 1682126.0, "step": 705 }, { "entropy": 6.74940242767334, "epoch": 0.04565035684433871, "grad_norm": 1.1328125, "learning_rate": 0.0003545, "loss": 6.2913, "mean_token_accuracy": 0.14252828136086465, "num_tokens": 1693070.0, "step": 710 }, { "entropy": 6.821109485626221, "epoch": 0.04597183823056645, "grad_norm": 1.2109375, "learning_rate": 0.000357, "loss": 6.3673, "mean_token_accuracy": 0.13518087714910507, "num_tokens": 1705254.0, "step": 715 }, { "entropy": 6.716013097763062, "epoch": 0.046293319616794185, "grad_norm": 1.1015625, "learning_rate": 0.0003595, "loss": 6.3296, "mean_token_accuracy": 0.1330641709268093, "num_tokens": 1718214.0, "step": 720 }, { "entropy": 6.745158529281616, "epoch": 0.04661480100302193, "grad_norm": 1.109375, "learning_rate": 0.000362, "loss": 6.36, "mean_token_accuracy": 0.13509849980473518, "num_tokens": 1731046.0, "step": 725 }, { "entropy": 6.691292095184326, "epoch": 0.04693628238924966, "grad_norm": 1.171875, "learning_rate": 0.0003645, "loss": 6.3051, "mean_token_accuracy": 0.13931626304984093, "num_tokens": 1744332.0, "step": 730 }, { "entropy": 6.6679082870483395, "epoch": 0.0472577637754774, "grad_norm": 1.109375, "learning_rate": 0.000367, "loss": 6.3141, "mean_token_accuracy": 0.1361882694065571, "num_tokens": 1757744.0, "step": 735 }, { "entropy": 6.755461311340332, "epoch": 0.047579245161705135, "grad_norm": 1.0625, "learning_rate": 0.0003695, "loss": 6.3255, "mean_token_accuracy": 0.13589167818427086, "num_tokens": 1769710.0, "step": 740 }, { "entropy": 6.661909294128418, "epoch": 0.04790072654793288, "grad_norm": 1.0390625, "learning_rate": 0.000372, "loss": 6.3197, "mean_token_accuracy": 0.134683046489954, "num_tokens": 1782299.0, "step": 745 }, { "entropy": 6.686239433288574, "epoch": 0.04822220793416061, "grad_norm": 1.171875, "learning_rate": 0.0003745, "loss": 6.2854, "mean_token_accuracy": 0.1418588526546955, "num_tokens": 1794407.0, "step": 750 }, { "entropy": 6.681186580657959, "epoch": 0.04854368932038835, "grad_norm": 1.1796875, "learning_rate": 0.000377, "loss": 6.2539, "mean_token_accuracy": 0.13846987187862397, "num_tokens": 1806512.0, "step": 755 }, { "entropy": 6.679962110519409, "epoch": 0.048865170706616085, "grad_norm": 0.9921875, "learning_rate": 0.0003795, "loss": 6.2985, "mean_token_accuracy": 0.14243988171219826, "num_tokens": 1819456.0, "step": 760 }, { "entropy": 6.526072311401367, "epoch": 0.04918665209284383, "grad_norm": 1.1953125, "learning_rate": 0.000382, "loss": 6.1211, "mean_token_accuracy": 0.14557768478989602, "num_tokens": 1831866.0, "step": 765 }, { "entropy": 6.57554988861084, "epoch": 0.04950813347907156, "grad_norm": 1.1015625, "learning_rate": 0.0003845, "loss": 6.141, "mean_token_accuracy": 0.14539860635995866, "num_tokens": 1842662.0, "step": 770 }, { "entropy": 6.579600238800049, "epoch": 0.0498296148652993, "grad_norm": 1.0078125, "learning_rate": 0.00038700000000000003, "loss": 6.1807, "mean_token_accuracy": 0.14677832573652266, "num_tokens": 1855599.0, "step": 775 }, { "entropy": 6.664310932159424, "epoch": 0.050151096251527034, "grad_norm": 1.265625, "learning_rate": 0.00038950000000000003, "loss": 6.2611, "mean_token_accuracy": 0.13455238118767737, "num_tokens": 1866656.0, "step": 780 }, { "entropy": 6.580622625350952, "epoch": 0.05047257763775478, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.2491, "mean_token_accuracy": 0.13729645386338235, "num_tokens": 1877473.0, "step": 785 }, { "entropy": 6.699300527572632, "epoch": 0.05079405902398251, "grad_norm": 1.046875, "learning_rate": 0.00039450000000000005, "loss": 6.2869, "mean_token_accuracy": 0.13934579417109488, "num_tokens": 1889113.0, "step": 790 }, { "entropy": 6.575865650177002, "epoch": 0.05111554041021025, "grad_norm": 1.0, "learning_rate": 0.00039700000000000005, "loss": 6.1885, "mean_token_accuracy": 0.1417413368821144, "num_tokens": 1901528.0, "step": 795 }, { "entropy": 6.590616846084595, "epoch": 0.051437021796437984, "grad_norm": 1.0703125, "learning_rate": 0.0003995, "loss": 6.2219, "mean_token_accuracy": 0.13816025704145432, "num_tokens": 1912036.0, "step": 800 }, { "entropy": 6.601884841918945, "epoch": 0.05175850318266572, "grad_norm": 1.03125, "learning_rate": 0.000402, "loss": 6.1707, "mean_token_accuracy": 0.14483692795038222, "num_tokens": 1923939.0, "step": 805 }, { "entropy": 6.482674884796142, "epoch": 0.05207998456889346, "grad_norm": 1.078125, "learning_rate": 0.0004045, "loss": 6.1383, "mean_token_accuracy": 0.15191132128238677, "num_tokens": 1935248.0, "step": 810 }, { "entropy": 6.679584169387818, "epoch": 0.0524014659551212, "grad_norm": 1.1640625, "learning_rate": 0.00040699999999999997, "loss": 6.2512, "mean_token_accuracy": 0.1460711881518364, "num_tokens": 1946732.0, "step": 815 }, { "entropy": 6.574809503555298, "epoch": 0.052722947341348934, "grad_norm": 1.1796875, "learning_rate": 0.0004095, "loss": 6.226, "mean_token_accuracy": 0.1427159160375595, "num_tokens": 1958316.0, "step": 820 }, { "entropy": 6.472147607803345, "epoch": 0.05304442872757667, "grad_norm": 1.0390625, "learning_rate": 0.000412, "loss": 6.0917, "mean_token_accuracy": 0.15051717907190323, "num_tokens": 1969543.0, "step": 825 }, { "entropy": 6.623300170898437, "epoch": 0.05336591011380441, "grad_norm": 1.234375, "learning_rate": 0.0004145, "loss": 6.313, "mean_token_accuracy": 0.1366821512579918, "num_tokens": 1981085.0, "step": 830 }, { "entropy": 6.603462076187133, "epoch": 0.05368739150003215, "grad_norm": 1.171875, "learning_rate": 0.000417, "loss": 6.1986, "mean_token_accuracy": 0.14714324995875358, "num_tokens": 1992610.0, "step": 835 }, { "entropy": 6.533374309539795, "epoch": 0.054008872886259884, "grad_norm": 1.1171875, "learning_rate": 0.0004195, "loss": 6.1716, "mean_token_accuracy": 0.14295029491186143, "num_tokens": 2004154.0, "step": 840 }, { "entropy": 6.516127395629883, "epoch": 0.05433035427248762, "grad_norm": 1.0703125, "learning_rate": 0.000422, "loss": 6.0815, "mean_token_accuracy": 0.14348058253526688, "num_tokens": 2015141.0, "step": 845 }, { "entropy": 6.5279299259185795, "epoch": 0.05465183565871536, "grad_norm": 0.9921875, "learning_rate": 0.0004245, "loss": 6.1455, "mean_token_accuracy": 0.15023983269929886, "num_tokens": 2028173.0, "step": 850 }, { "entropy": 6.429127645492554, "epoch": 0.0549733170449431, "grad_norm": 1.1328125, "learning_rate": 0.000427, "loss": 6.1486, "mean_token_accuracy": 0.14123030006885529, "num_tokens": 2039979.0, "step": 855 }, { "entropy": 6.57825779914856, "epoch": 0.055294798431170834, "grad_norm": 1.046875, "learning_rate": 0.0004295, "loss": 6.0981, "mean_token_accuracy": 0.14770488440990448, "num_tokens": 2051052.0, "step": 860 }, { "entropy": 6.48339581489563, "epoch": 0.05561627981739857, "grad_norm": 1.0078125, "learning_rate": 0.000432, "loss": 6.2736, "mean_token_accuracy": 0.13757081255316733, "num_tokens": 2064252.0, "step": 865 }, { "entropy": 6.527880430221558, "epoch": 0.05593776120362631, "grad_norm": 1.1640625, "learning_rate": 0.0004345, "loss": 6.1659, "mean_token_accuracy": 0.14587004482746124, "num_tokens": 2075697.0, "step": 870 }, { "entropy": 6.587885761260987, "epoch": 0.05625924258985405, "grad_norm": 1.21875, "learning_rate": 0.000437, "loss": 6.2902, "mean_token_accuracy": 0.1394598327577114, "num_tokens": 2088354.0, "step": 875 }, { "entropy": 6.597920179367065, "epoch": 0.056580723976081784, "grad_norm": 1.21875, "learning_rate": 0.0004395, "loss": 6.2794, "mean_token_accuracy": 0.14314963445067405, "num_tokens": 2101291.0, "step": 880 }, { "entropy": 6.531395626068115, "epoch": 0.05690220536230952, "grad_norm": 1.40625, "learning_rate": 0.000442, "loss": 6.1794, "mean_token_accuracy": 0.15109536275267602, "num_tokens": 2114151.0, "step": 885 }, { "entropy": 6.5403975486755375, "epoch": 0.05722368674853726, "grad_norm": 1.1484375, "learning_rate": 0.0004445, "loss": 6.2204, "mean_token_accuracy": 0.140879013389349, "num_tokens": 2127638.0, "step": 890 }, { "entropy": 6.454720592498779, "epoch": 0.057545168134765, "grad_norm": 1.1015625, "learning_rate": 0.000447, "loss": 6.1054, "mean_token_accuracy": 0.15080050081014634, "num_tokens": 2139773.0, "step": 895 }, { "entropy": 6.582310771942138, "epoch": 0.057866649520992734, "grad_norm": 1.1328125, "learning_rate": 0.00044950000000000003, "loss": 6.2261, "mean_token_accuracy": 0.13719287440180777, "num_tokens": 2151167.0, "step": 900 }, { "entropy": 6.373457574844361, "epoch": 0.05818813090722047, "grad_norm": 0.98828125, "learning_rate": 0.00045200000000000004, "loss": 6.1103, "mean_token_accuracy": 0.14882433116436006, "num_tokens": 2163150.0, "step": 905 }, { "entropy": 6.511533308029175, "epoch": 0.05850961229344821, "grad_norm": 1.1328125, "learning_rate": 0.00045450000000000004, "loss": 6.138, "mean_token_accuracy": 0.1470898576080799, "num_tokens": 2175116.0, "step": 910 }, { "entropy": 6.402334594726563, "epoch": 0.05883109367967595, "grad_norm": 1.0703125, "learning_rate": 0.00045700000000000005, "loss": 6.0541, "mean_token_accuracy": 0.1523958332836628, "num_tokens": 2188074.0, "step": 915 }, { "entropy": 6.463513612747192, "epoch": 0.059152575065903684, "grad_norm": 1.125, "learning_rate": 0.00045950000000000006, "loss": 6.1002, "mean_token_accuracy": 0.1470402017235756, "num_tokens": 2200706.0, "step": 920 }, { "entropy": 6.349210262298584, "epoch": 0.05947405645213142, "grad_norm": 1.109375, "learning_rate": 0.000462, "loss": 6.1154, "mean_token_accuracy": 0.15224614143371581, "num_tokens": 2212493.0, "step": 925 }, { "entropy": 6.507826137542724, "epoch": 0.059795537838359156, "grad_norm": 1.0859375, "learning_rate": 0.0004645, "loss": 6.1258, "mean_token_accuracy": 0.14575668349862098, "num_tokens": 2224668.0, "step": 930 }, { "entropy": 6.432238912582397, "epoch": 0.0601170192245869, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 6.1242, "mean_token_accuracy": 0.14432022348046303, "num_tokens": 2236280.0, "step": 935 }, { "entropy": 6.493103885650635, "epoch": 0.060438500610814634, "grad_norm": 1.0234375, "learning_rate": 0.0004695, "loss": 6.1341, "mean_token_accuracy": 0.14489658921957016, "num_tokens": 2246947.0, "step": 940 }, { "entropy": 6.486361408233643, "epoch": 0.06075998199704237, "grad_norm": 1.078125, "learning_rate": 0.000472, "loss": 6.1497, "mean_token_accuracy": 0.1474609225988388, "num_tokens": 2258591.0, "step": 945 }, { "entropy": 6.394432783126831, "epoch": 0.061081463383270106, "grad_norm": 1.09375, "learning_rate": 0.0004745, "loss": 6.1055, "mean_token_accuracy": 0.1405967153608799, "num_tokens": 2269725.0, "step": 950 }, { "entropy": 6.481177186965942, "epoch": 0.06140294476949785, "grad_norm": 1.0546875, "learning_rate": 0.000477, "loss": 6.0784, "mean_token_accuracy": 0.1547504723072052, "num_tokens": 2282172.0, "step": 955 }, { "entropy": 6.446505546569824, "epoch": 0.061724426155725584, "grad_norm": 1.25, "learning_rate": 0.0004795, "loss": 6.2106, "mean_token_accuracy": 0.14404927641153337, "num_tokens": 2293991.0, "step": 960 }, { "entropy": 6.479608154296875, "epoch": 0.06204590754195332, "grad_norm": 1.0859375, "learning_rate": 0.000482, "loss": 6.1149, "mean_token_accuracy": 0.1508398488163948, "num_tokens": 2306715.0, "step": 965 }, { "entropy": 6.330813074111939, "epoch": 0.062367388928181056, "grad_norm": 1.1640625, "learning_rate": 0.0004845, "loss": 6.1465, "mean_token_accuracy": 0.14545181691646575, "num_tokens": 2319096.0, "step": 970 }, { "entropy": 6.360287046432495, "epoch": 0.0626888703144088, "grad_norm": 1.140625, "learning_rate": 0.000487, "loss": 6.0329, "mean_token_accuracy": 0.14853936582803726, "num_tokens": 2332239.0, "step": 975 }, { "entropy": 6.3763471126556395, "epoch": 0.06301035170063653, "grad_norm": 1.0390625, "learning_rate": 0.0004895, "loss": 6.1228, "mean_token_accuracy": 0.14723728373646736, "num_tokens": 2343897.0, "step": 980 }, { "entropy": 6.353127479553223, "epoch": 0.06333183308686427, "grad_norm": 0.99609375, "learning_rate": 0.000492, "loss": 6.0663, "mean_token_accuracy": 0.14970697611570358, "num_tokens": 2356811.0, "step": 985 }, { "entropy": 6.3828963279724125, "epoch": 0.06365331447309201, "grad_norm": 1.09375, "learning_rate": 0.0004945, "loss": 6.0559, "mean_token_accuracy": 0.15341916903853417, "num_tokens": 2369146.0, "step": 990 }, { "entropy": 6.346980619430542, "epoch": 0.06397479585931974, "grad_norm": 1.0234375, "learning_rate": 0.000497, "loss": 6.0164, "mean_token_accuracy": 0.1514612004160881, "num_tokens": 2381154.0, "step": 995 }, { "entropy": 6.36736650466919, "epoch": 0.06429627724554748, "grad_norm": 1.15625, "learning_rate": 0.0004995, "loss": 6.1074, "mean_token_accuracy": 0.14672497659921646, "num_tokens": 2392095.0, "step": 1000 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 535645743022080.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }