{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.1607406931138687, "eval_steps": 500, "global_step": 2500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742568206787109, "epoch": 0.00032148138622773744, "grad_norm": 4.65625, "learning_rate": 2e-06, "loss": 10.8036, "mean_token_accuracy": 0.0, "num_tokens": 12742.0, "step": 5 }, { "entropy": 10.742579936981201, "epoch": 0.0006429627724554749, "grad_norm": 4.53125, "learning_rate": 4.5e-06, "loss": 10.7869, "mean_token_accuracy": 0.0002144496247638017, "num_tokens": 24140.0, "step": 10 }, { "entropy": 10.742603588104249, "epoch": 0.0009644441586832123, "grad_norm": 4.90625, "learning_rate": 7e-06, "loss": 10.7587, "mean_token_accuracy": 0.00010395010467618704, "num_tokens": 35301.0, "step": 15 }, { "entropy": 10.742618370056153, "epoch": 0.0012859255449109497, "grad_norm": 4.84375, "learning_rate": 9.5e-06, "loss": 10.7259, "mean_token_accuracy": 8.291873964481056e-05, "num_tokens": 47594.0, "step": 20 }, { "entropy": 10.742617893218995, "epoch": 0.001607406931138687, "grad_norm": 4.5, "learning_rate": 1.2e-05, "loss": 10.6444, "mean_token_accuracy": 0.0009544001193717122, "num_tokens": 60157.0, "step": 25 }, { "entropy": 10.742464923858643, "epoch": 0.0019288883173664245, "grad_norm": 3.90625, "learning_rate": 1.4500000000000002e-05, "loss": 10.5219, "mean_token_accuracy": 0.008633292093873025, "num_tokens": 71681.0, "step": 30 }, { "entropy": 10.741884708404541, "epoch": 0.002250369703594162, "grad_norm": 3.015625, "learning_rate": 1.7000000000000003e-05, "loss": 10.4068, "mean_token_accuracy": 0.022283684648573398, "num_tokens": 84059.0, "step": 35 }, { "entropy": 10.740736961364746, "epoch": 0.0025718510898218995, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2636, "mean_token_accuracy": 0.029509490355849266, "num_tokens": 95765.0, "step": 40 }, { "entropy": 10.739063930511474, "epoch": 0.0028933324760496365, "grad_norm": 2.140625, "learning_rate": 2.2e-05, "loss": 10.1737, "mean_token_accuracy": 0.033080863580107686, "num_tokens": 108095.0, "step": 45 }, { "entropy": 10.738058280944824, "epoch": 0.003214813862277374, "grad_norm": 2.078125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0966, "mean_token_accuracy": 0.03380006831139326, "num_tokens": 120722.0, "step": 50 }, { "entropy": 10.73799819946289, "epoch": 0.0035362952485051115, "grad_norm": 1.9921875, "learning_rate": 2.7e-05, "loss": 10.006, "mean_token_accuracy": 0.03798699378967285, "num_tokens": 132684.0, "step": 55 }, { "entropy": 10.73742036819458, "epoch": 0.003857776634732849, "grad_norm": 1.90625, "learning_rate": 2.95e-05, "loss": 9.9558, "mean_token_accuracy": 0.03450928349047899, "num_tokens": 143940.0, "step": 60 }, { "entropy": 10.736388874053954, "epoch": 0.0041792580209605865, "grad_norm": 1.796875, "learning_rate": 3.2e-05, "loss": 9.9101, "mean_token_accuracy": 0.04125991053879261, "num_tokens": 156206.0, "step": 65 }, { "entropy": 10.73477258682251, "epoch": 0.004500739407188324, "grad_norm": 1.8359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7902, "mean_token_accuracy": 0.03981789126992226, "num_tokens": 167417.0, "step": 70 }, { "entropy": 10.732693958282471, "epoch": 0.0048222207934160615, "grad_norm": 1.8125, "learning_rate": 3.7e-05, "loss": 9.7708, "mean_token_accuracy": 0.04258622564375401, "num_tokens": 180372.0, "step": 75 }, { "entropy": 10.729571533203124, "epoch": 0.005143702179643799, "grad_norm": 1.90625, "learning_rate": 3.95e-05, "loss": 9.6547, "mean_token_accuracy": 0.045089634135365486, "num_tokens": 191614.0, "step": 80 }, { "entropy": 10.72476511001587, "epoch": 0.0054651835658715365, "grad_norm": 1.796875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6147, "mean_token_accuracy": 0.040345224365592, "num_tokens": 202885.0, "step": 85 }, { "entropy": 10.71826524734497, "epoch": 0.005786664952099273, "grad_norm": 1.7421875, "learning_rate": 4.45e-05, "loss": 9.5588, "mean_token_accuracy": 0.0393321730196476, "num_tokens": 215099.0, "step": 90 }, { "entropy": 10.710640907287598, "epoch": 0.0061081463383270106, "grad_norm": 1.7734375, "learning_rate": 4.7000000000000004e-05, "loss": 9.4198, "mean_token_accuracy": 0.042821163311600685, "num_tokens": 227257.0, "step": 95 }, { "entropy": 10.7003662109375, "epoch": 0.006429627724554748, "grad_norm": 1.796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.3598, "mean_token_accuracy": 0.046982531622052195, "num_tokens": 240338.0, "step": 100 }, { "entropy": 10.68521671295166, "epoch": 0.0067511091107824855, "grad_norm": 1.8203125, "learning_rate": 5.2e-05, "loss": 9.2122, "mean_token_accuracy": 0.0441419318318367, "num_tokens": 251438.0, "step": 105 }, { "entropy": 10.664322471618652, "epoch": 0.007072590497010223, "grad_norm": 1.78125, "learning_rate": 5.45e-05, "loss": 9.1438, "mean_token_accuracy": 0.050481327995657924, "num_tokens": 264614.0, "step": 110 }, { "entropy": 10.634937763214111, "epoch": 0.0073940718832379605, "grad_norm": 1.75, "learning_rate": 5.7e-05, "loss": 9.0251, "mean_token_accuracy": 0.049148940667510035, "num_tokens": 278360.0, "step": 115 }, { "entropy": 10.593732261657715, "epoch": 0.007715553269465698, "grad_norm": 1.6171875, "learning_rate": 5.9499999999999996e-05, "loss": 8.9153, "mean_token_accuracy": 0.05156457796692848, "num_tokens": 290884.0, "step": 120 }, { "entropy": 10.54275369644165, "epoch": 0.008037034655693436, "grad_norm": 1.6484375, "learning_rate": 6.2e-05, "loss": 8.8351, "mean_token_accuracy": 0.052396486327052114, "num_tokens": 304431.0, "step": 125 }, { "entropy": 10.474855613708495, "epoch": 0.008358516041921173, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6397, "mean_token_accuracy": 0.05697291418910026, "num_tokens": 317555.0, "step": 130 }, { "entropy": 10.39169454574585, "epoch": 0.00867999742814891, "grad_norm": 1.59375, "learning_rate": 6.7e-05, "loss": 8.4698, "mean_token_accuracy": 0.058742289617657664, "num_tokens": 329754.0, "step": 135 }, { "entropy": 10.3007230758667, "epoch": 0.009001478814376648, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 8.3392, "mean_token_accuracy": 0.07013382948935032, "num_tokens": 341808.0, "step": 140 }, { "entropy": 10.171103858947754, "epoch": 0.009322960200604385, "grad_norm": 1.4609375, "learning_rate": 7.2e-05, "loss": 8.1587, "mean_token_accuracy": 0.06642449870705605, "num_tokens": 353209.0, "step": 145 }, { "entropy": 10.069665241241456, "epoch": 0.009644441586832123, "grad_norm": 1.2734375, "learning_rate": 7.45e-05, "loss": 8.1634, "mean_token_accuracy": 0.06020556911826134, "num_tokens": 365744.0, "step": 150 }, { "entropy": 9.936939144134522, "epoch": 0.00996592297305986, "grad_norm": 1.3828125, "learning_rate": 7.7e-05, "loss": 8.0462, "mean_token_accuracy": 0.06147486455738545, "num_tokens": 379133.0, "step": 155 }, { "entropy": 9.757997035980225, "epoch": 0.010287404359287598, "grad_norm": 1.203125, "learning_rate": 7.950000000000001e-05, "loss": 7.9266, "mean_token_accuracy": 0.06376843340694904, "num_tokens": 390921.0, "step": 160 }, { "entropy": 9.523485374450683, "epoch": 0.010608885745515335, "grad_norm": 1.3125, "learning_rate": 8.2e-05, "loss": 7.8396, "mean_token_accuracy": 0.07127328738570213, "num_tokens": 404468.0, "step": 165 }, { "entropy": 9.345615196228028, "epoch": 0.010930367131743073, "grad_norm": 1.21875, "learning_rate": 8.450000000000001e-05, "loss": 7.6793, "mean_token_accuracy": 0.07266218103468418, "num_tokens": 414790.0, "step": 170 }, { "entropy": 9.119754123687745, "epoch": 0.011251848517970809, "grad_norm": 1.1953125, "learning_rate": 8.7e-05, "loss": 7.6479, "mean_token_accuracy": 0.06817427426576614, "num_tokens": 427720.0, "step": 175 }, { "entropy": 8.906557750701904, "epoch": 0.011573329904198546, "grad_norm": 0.91015625, "learning_rate": 8.95e-05, "loss": 7.5546, "mean_token_accuracy": 0.07729550525546074, "num_tokens": 438501.0, "step": 180 }, { "entropy": 8.68680248260498, "epoch": 0.011894811290426284, "grad_norm": 0.96484375, "learning_rate": 9.2e-05, "loss": 7.5063, "mean_token_accuracy": 0.07282244712114334, "num_tokens": 450035.0, "step": 185 }, { "entropy": 8.589659690856934, "epoch": 0.012216292676654021, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.4857, "mean_token_accuracy": 0.0773538451641798, "num_tokens": 461665.0, "step": 190 }, { "entropy": 8.466110229492188, "epoch": 0.012537774062881759, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.407, "mean_token_accuracy": 0.07190582565963269, "num_tokens": 472514.0, "step": 195 }, { "entropy": 8.35852632522583, "epoch": 0.012859255449109496, "grad_norm": 0.9453125, "learning_rate": 9.95e-05, "loss": 7.469, "mean_token_accuracy": 0.07612953037023544, "num_tokens": 484057.0, "step": 200 }, { "entropy": 8.286659240722656, "epoch": 0.013180736835337234, "grad_norm": 1.1640625, "learning_rate": 0.000102, "loss": 7.2817, "mean_token_accuracy": 0.07883379608392715, "num_tokens": 496374.0, "step": 205 }, { "entropy": 8.222426700592042, "epoch": 0.013502218221564971, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.4006, "mean_token_accuracy": 0.08155124634504318, "num_tokens": 508816.0, "step": 210 }, { "entropy": 8.164955520629883, "epoch": 0.013823699607792709, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.2353, "mean_token_accuracy": 0.08206439130008221, "num_tokens": 520738.0, "step": 215 }, { "entropy": 8.113754081726075, "epoch": 0.014145180994020446, "grad_norm": 0.98828125, "learning_rate": 0.0001095, "loss": 7.1869, "mean_token_accuracy": 0.08583443649113179, "num_tokens": 531924.0, "step": 220 }, { "entropy": 8.066366481781007, "epoch": 0.014466662380248184, "grad_norm": 0.96875, "learning_rate": 0.000112, "loss": 7.2385, "mean_token_accuracy": 0.09169937074184417, "num_tokens": 543924.0, "step": 225 }, { "entropy": 8.05418610572815, "epoch": 0.014788143766475921, "grad_norm": 1.40625, "learning_rate": 0.0001145, "loss": 7.3141, "mean_token_accuracy": 0.0864493004977703, "num_tokens": 555669.0, "step": 230 }, { "entropy": 8.044883394241333, "epoch": 0.015109625152703659, "grad_norm": 1.3828125, "learning_rate": 0.00011700000000000001, "loss": 7.2002, "mean_token_accuracy": 0.09331929311156273, "num_tokens": 567187.0, "step": 235 }, { "entropy": 7.921926689147949, "epoch": 0.015431106538931396, "grad_norm": 1.171875, "learning_rate": 0.00011949999999999999, "loss": 7.1648, "mean_token_accuracy": 0.08909451588988304, "num_tokens": 579812.0, "step": 240 }, { "entropy": 7.9616796493530275, "epoch": 0.015752587925159132, "grad_norm": 1.171875, "learning_rate": 0.000122, "loss": 7.2286, "mean_token_accuracy": 0.0948996253311634, "num_tokens": 592539.0, "step": 245 }, { "entropy": 7.915118932723999, "epoch": 0.01607406931138687, "grad_norm": 0.984375, "learning_rate": 0.0001245, "loss": 7.1744, "mean_token_accuracy": 0.09123623445630073, "num_tokens": 603561.0, "step": 250 }, { "entropy": 7.95502872467041, "epoch": 0.016395550697614607, "grad_norm": 1.0390625, "learning_rate": 0.000127, "loss": 7.1403, "mean_token_accuracy": 0.09563293382525444, "num_tokens": 615309.0, "step": 255 }, { "entropy": 7.883571195602417, "epoch": 0.016717032083842346, "grad_norm": 1.0546875, "learning_rate": 0.0001295, "loss": 7.2078, "mean_token_accuracy": 0.09283049032092094, "num_tokens": 628213.0, "step": 260 }, { "entropy": 7.916977882385254, "epoch": 0.017038513470070082, "grad_norm": 0.96875, "learning_rate": 0.000132, "loss": 7.1712, "mean_token_accuracy": 0.09053821936249733, "num_tokens": 640786.0, "step": 265 }, { "entropy": 7.736500692367554, "epoch": 0.01735999485629782, "grad_norm": 1.15625, "learning_rate": 0.00013450000000000002, "loss": 6.9442, "mean_token_accuracy": 0.09789396971464157, "num_tokens": 653298.0, "step": 270 }, { "entropy": 7.796767520904541, "epoch": 0.017681476242525557, "grad_norm": 1.03125, "learning_rate": 0.00013700000000000002, "loss": 7.1179, "mean_token_accuracy": 0.09451311975717544, "num_tokens": 667729.0, "step": 275 }, { "entropy": 7.758620405197144, "epoch": 0.018002957628753296, "grad_norm": 1.1953125, "learning_rate": 0.0001395, "loss": 6.9965, "mean_token_accuracy": 0.10174397602677346, "num_tokens": 678289.0, "step": 280 }, { "entropy": 7.761229801177978, "epoch": 0.01832443901498103, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1014, "mean_token_accuracy": 0.09417134001851082, "num_tokens": 689595.0, "step": 285 }, { "entropy": 7.707542467117309, "epoch": 0.01864592040120877, "grad_norm": 1.3125, "learning_rate": 0.0001445, "loss": 6.9575, "mean_token_accuracy": 0.10247044488787652, "num_tokens": 701044.0, "step": 290 }, { "entropy": 7.664159297943115, "epoch": 0.018967401787436507, "grad_norm": 1.265625, "learning_rate": 0.000147, "loss": 7.0154, "mean_token_accuracy": 0.09950036033988, "num_tokens": 713616.0, "step": 295 }, { "entropy": 7.647959280014038, "epoch": 0.019288883173664246, "grad_norm": 1.21875, "learning_rate": 0.0001495, "loss": 6.9233, "mean_token_accuracy": 0.1026333898305893, "num_tokens": 725328.0, "step": 300 }, { "entropy": 7.647801685333252, "epoch": 0.01961036455989198, "grad_norm": 1.1953125, "learning_rate": 0.000152, "loss": 6.9827, "mean_token_accuracy": 0.10479021072387695, "num_tokens": 738135.0, "step": 305 }, { "entropy": 7.666160726547242, "epoch": 0.01993184594611972, "grad_norm": 1.21875, "learning_rate": 0.00015450000000000001, "loss": 7.0659, "mean_token_accuracy": 0.09956069737672806, "num_tokens": 750746.0, "step": 310 }, { "entropy": 7.654135274887085, "epoch": 0.020253327332347457, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 6.8949, "mean_token_accuracy": 0.10135210454463958, "num_tokens": 763983.0, "step": 315 }, { "entropy": 7.494717454910278, "epoch": 0.020574808718575196, "grad_norm": 1.0703125, "learning_rate": 0.0001595, "loss": 6.8483, "mean_token_accuracy": 0.1055855043232441, "num_tokens": 776047.0, "step": 320 }, { "entropy": 7.538181352615356, "epoch": 0.02089629010480293, "grad_norm": 0.93359375, "learning_rate": 0.000162, "loss": 6.8979, "mean_token_accuracy": 0.10393242165446281, "num_tokens": 789551.0, "step": 325 }, { "entropy": 7.569456100463867, "epoch": 0.02121777149103067, "grad_norm": 0.95703125, "learning_rate": 0.00016450000000000001, "loss": 6.8266, "mean_token_accuracy": 0.1120136708021164, "num_tokens": 801870.0, "step": 330 }, { "entropy": 7.441139793395996, "epoch": 0.021539252877258407, "grad_norm": 1.0546875, "learning_rate": 0.00016700000000000002, "loss": 6.8251, "mean_token_accuracy": 0.10700582489371299, "num_tokens": 813782.0, "step": 335 }, { "entropy": 7.5361223220825195, "epoch": 0.021860734263486146, "grad_norm": 1.140625, "learning_rate": 0.00016950000000000003, "loss": 6.886, "mean_token_accuracy": 0.11066097766160965, "num_tokens": 826179.0, "step": 340 }, { "entropy": 7.415356826782227, "epoch": 0.02218221564971388, "grad_norm": 1.0703125, "learning_rate": 0.00017199999999999998, "loss": 6.8989, "mean_token_accuracy": 0.10546407401561737, "num_tokens": 838827.0, "step": 345 }, { "entropy": 7.442149639129639, "epoch": 0.022503697035941617, "grad_norm": 1.0625, "learning_rate": 0.00017449999999999999, "loss": 6.8217, "mean_token_accuracy": 0.11060597971081734, "num_tokens": 851543.0, "step": 350 }, { "entropy": 7.508502197265625, "epoch": 0.022825178422169357, "grad_norm": 1.1953125, "learning_rate": 0.000177, "loss": 6.8139, "mean_token_accuracy": 0.112100800126791, "num_tokens": 863557.0, "step": 355 }, { "entropy": 7.371269845962525, "epoch": 0.023146659808397092, "grad_norm": 1.1171875, "learning_rate": 0.0001795, "loss": 6.8226, "mean_token_accuracy": 0.11001520678400993, "num_tokens": 877640.0, "step": 360 }, { "entropy": 7.435138940811157, "epoch": 0.02346814119462483, "grad_norm": 0.96484375, "learning_rate": 0.000182, "loss": 6.9016, "mean_token_accuracy": 0.11292736753821372, "num_tokens": 889521.0, "step": 365 }, { "entropy": 7.44185962677002, "epoch": 0.023789622580852567, "grad_norm": 1.359375, "learning_rate": 0.0001845, "loss": 6.7138, "mean_token_accuracy": 0.11192596107721328, "num_tokens": 899886.0, "step": 370 }, { "entropy": 7.424141836166382, "epoch": 0.024111103967080307, "grad_norm": 1.2109375, "learning_rate": 0.000187, "loss": 6.835, "mean_token_accuracy": 0.10648501366376877, "num_tokens": 911448.0, "step": 375 }, { "entropy": 7.346240711212158, "epoch": 0.024432585353308042, "grad_norm": 1.171875, "learning_rate": 0.0001895, "loss": 6.8403, "mean_token_accuracy": 0.10451060682535171, "num_tokens": 922938.0, "step": 380 }, { "entropy": 7.440135097503662, "epoch": 0.02475406673953578, "grad_norm": 1.125, "learning_rate": 0.000192, "loss": 6.816, "mean_token_accuracy": 0.10817886143922806, "num_tokens": 935037.0, "step": 385 }, { "entropy": 7.338301467895508, "epoch": 0.025075548125763517, "grad_norm": 1.171875, "learning_rate": 0.0001945, "loss": 6.7998, "mean_token_accuracy": 0.10885120332241058, "num_tokens": 946395.0, "step": 390 }, { "entropy": 7.387865447998047, "epoch": 0.025397029511991256, "grad_norm": 1.03125, "learning_rate": 0.00019700000000000002, "loss": 6.7903, "mean_token_accuracy": 0.11720103770494461, "num_tokens": 957963.0, "step": 395 }, { "entropy": 7.322666645050049, "epoch": 0.025718510898218992, "grad_norm": 1.1875, "learning_rate": 0.00019950000000000002, "loss": 6.7715, "mean_token_accuracy": 0.10996255949139595, "num_tokens": 970474.0, "step": 400 }, { "entropy": 7.304989814758301, "epoch": 0.02603999228444673, "grad_norm": 1.171875, "learning_rate": 0.000202, "loss": 6.7076, "mean_token_accuracy": 0.1160525843501091, "num_tokens": 984090.0, "step": 405 }, { "entropy": 7.233718299865723, "epoch": 0.026361473670674467, "grad_norm": 1.0859375, "learning_rate": 0.00020449999999999998, "loss": 6.6529, "mean_token_accuracy": 0.1177474744617939, "num_tokens": 997159.0, "step": 410 }, { "entropy": 7.222785997390747, "epoch": 0.026682955056902206, "grad_norm": 1.265625, "learning_rate": 0.000207, "loss": 6.654, "mean_token_accuracy": 0.11934740170836448, "num_tokens": 1009350.0, "step": 415 }, { "entropy": 7.325893259048462, "epoch": 0.027004436443129942, "grad_norm": 1.1328125, "learning_rate": 0.0002095, "loss": 6.7141, "mean_token_accuracy": 0.11572676599025726, "num_tokens": 1021170.0, "step": 420 }, { "entropy": 7.200784921646118, "epoch": 0.02732591782935768, "grad_norm": 1.1484375, "learning_rate": 0.000212, "loss": 6.7053, "mean_token_accuracy": 0.11510597914457321, "num_tokens": 1033173.0, "step": 425 }, { "entropy": 7.3387078762054445, "epoch": 0.027647399215585417, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.6451, "mean_token_accuracy": 0.11399412080645561, "num_tokens": 1045811.0, "step": 430 }, { "entropy": 7.223242235183716, "epoch": 0.027968880601813156, "grad_norm": 1.15625, "learning_rate": 0.00021700000000000002, "loss": 6.6814, "mean_token_accuracy": 0.11766811162233352, "num_tokens": 1058519.0, "step": 435 }, { "entropy": 7.186439037322998, "epoch": 0.028290361988040892, "grad_norm": 1.234375, "learning_rate": 0.0002195, "loss": 6.661, "mean_token_accuracy": 0.11952715441584587, "num_tokens": 1069977.0, "step": 440 }, { "entropy": 7.247150611877442, "epoch": 0.02861184337426863, "grad_norm": 1.328125, "learning_rate": 0.000222, "loss": 6.7042, "mean_token_accuracy": 0.12207212299108505, "num_tokens": 1081368.0, "step": 445 }, { "entropy": 7.224388504028321, "epoch": 0.028933324760496367, "grad_norm": 1.046875, "learning_rate": 0.0002245, "loss": 6.7154, "mean_token_accuracy": 0.11299246326088905, "num_tokens": 1093936.0, "step": 450 }, { "entropy": 7.168924283981323, "epoch": 0.029254806146724106, "grad_norm": 0.953125, "learning_rate": 0.00022700000000000002, "loss": 6.6693, "mean_token_accuracy": 0.1225433073937893, "num_tokens": 1106217.0, "step": 455 }, { "entropy": 7.140732955932617, "epoch": 0.029576287532951842, "grad_norm": 1.1328125, "learning_rate": 0.00022950000000000002, "loss": 6.6131, "mean_token_accuracy": 0.1190965436398983, "num_tokens": 1120108.0, "step": 460 }, { "entropy": 7.190146207809448, "epoch": 0.029897768919179578, "grad_norm": 1.1796875, "learning_rate": 0.00023200000000000003, "loss": 6.691, "mean_token_accuracy": 0.1148249328136444, "num_tokens": 1132390.0, "step": 465 }, { "entropy": 7.1808641910552975, "epoch": 0.030219250305407317, "grad_norm": 1.046875, "learning_rate": 0.00023449999999999998, "loss": 6.6407, "mean_token_accuracy": 0.1223123162984848, "num_tokens": 1144612.0, "step": 470 }, { "entropy": 7.130864477157592, "epoch": 0.030540731691635053, "grad_norm": 1.2109375, "learning_rate": 0.000237, "loss": 6.5913, "mean_token_accuracy": 0.1303763821721077, "num_tokens": 1156151.0, "step": 475 }, { "entropy": 7.050965404510498, "epoch": 0.030862213077862792, "grad_norm": 1.1953125, "learning_rate": 0.0002395, "loss": 6.5653, "mean_token_accuracy": 0.1250072978436947, "num_tokens": 1168777.0, "step": 480 }, { "entropy": 7.13370532989502, "epoch": 0.031183694464090528, "grad_norm": 1.1484375, "learning_rate": 0.000242, "loss": 6.6091, "mean_token_accuracy": 0.1207241289317608, "num_tokens": 1181233.0, "step": 485 }, { "entropy": 7.062533330917359, "epoch": 0.031505175850318264, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 6.4888, "mean_token_accuracy": 0.12689791172742843, "num_tokens": 1192315.0, "step": 490 }, { "entropy": 7.057355880737305, "epoch": 0.031826657236546006, "grad_norm": 1.2890625, "learning_rate": 0.000247, "loss": 6.5874, "mean_token_accuracy": 0.12290141731500626, "num_tokens": 1203452.0, "step": 495 }, { "entropy": 7.104999351501465, "epoch": 0.03214813862277374, "grad_norm": 1.03125, "learning_rate": 0.0002495, "loss": 6.4607, "mean_token_accuracy": 0.12253987565636634, "num_tokens": 1215024.0, "step": 500 }, { "entropy": 6.960715389251709, "epoch": 0.03246962000900148, "grad_norm": 1.1484375, "learning_rate": 0.000252, "loss": 6.5357, "mean_token_accuracy": 0.12099924460053443, "num_tokens": 1227389.0, "step": 505 }, { "entropy": 7.088908338546753, "epoch": 0.032791101395229214, "grad_norm": 1.125, "learning_rate": 0.0002545, "loss": 6.5929, "mean_token_accuracy": 0.12899895682930945, "num_tokens": 1239580.0, "step": 510 }, { "entropy": 6.991267108917237, "epoch": 0.033112582781456956, "grad_norm": 1.2890625, "learning_rate": 0.000257, "loss": 6.4972, "mean_token_accuracy": 0.12959347441792488, "num_tokens": 1251057.0, "step": 515 }, { "entropy": 7.053374528884888, "epoch": 0.03343406416768469, "grad_norm": 1.2265625, "learning_rate": 0.0002595, "loss": 6.5123, "mean_token_accuracy": 0.12708231583237647, "num_tokens": 1261979.0, "step": 520 }, { "entropy": 7.0755468845367435, "epoch": 0.03375554555391243, "grad_norm": 1.234375, "learning_rate": 0.000262, "loss": 6.5544, "mean_token_accuracy": 0.1266493871808052, "num_tokens": 1274862.0, "step": 525 }, { "entropy": 6.957923030853271, "epoch": 0.034077026940140163, "grad_norm": 1.1953125, "learning_rate": 0.00026450000000000003, "loss": 6.5144, "mean_token_accuracy": 0.12210054397583008, "num_tokens": 1286798.0, "step": 530 }, { "entropy": 6.912027025222779, "epoch": 0.034398508326367906, "grad_norm": 1.0234375, "learning_rate": 0.00026700000000000004, "loss": 6.4476, "mean_token_accuracy": 0.13111426010727883, "num_tokens": 1298709.0, "step": 535 }, { "entropy": 7.059010982513428, "epoch": 0.03471998971259564, "grad_norm": 1.1015625, "learning_rate": 0.00026950000000000005, "loss": 6.5366, "mean_token_accuracy": 0.12991197258234025, "num_tokens": 1310597.0, "step": 540 }, { "entropy": 7.001475191116333, "epoch": 0.03504147109882338, "grad_norm": 1.203125, "learning_rate": 0.00027200000000000005, "loss": 6.5354, "mean_token_accuracy": 0.1257152423262596, "num_tokens": 1321986.0, "step": 545 }, { "entropy": 6.898067474365234, "epoch": 0.03536295248505111, "grad_norm": 1.1640625, "learning_rate": 0.0002745, "loss": 6.4693, "mean_token_accuracy": 0.12922092527151108, "num_tokens": 1334042.0, "step": 550 }, { "entropy": 7.061205530166626, "epoch": 0.035684433871278856, "grad_norm": 1.171875, "learning_rate": 0.000277, "loss": 6.4141, "mean_token_accuracy": 0.13716451823711395, "num_tokens": 1345544.0, "step": 555 }, { "entropy": 6.891375637054443, "epoch": 0.03600591525750659, "grad_norm": 1.0546875, "learning_rate": 0.0002795, "loss": 6.4736, "mean_token_accuracy": 0.13048869818449021, "num_tokens": 1356390.0, "step": 560 }, { "entropy": 6.955321550369263, "epoch": 0.03632739664373433, "grad_norm": 1.1484375, "learning_rate": 0.00028199999999999997, "loss": 6.4478, "mean_token_accuracy": 0.12905914708971977, "num_tokens": 1367673.0, "step": 565 }, { "entropy": 6.978991460800171, "epoch": 0.03664887802996206, "grad_norm": 1.0703125, "learning_rate": 0.0002845, "loss": 6.5471, "mean_token_accuracy": 0.12287317663431167, "num_tokens": 1378831.0, "step": 570 }, { "entropy": 6.9239545345306395, "epoch": 0.0369703594161898, "grad_norm": 1.15625, "learning_rate": 0.000287, "loss": 6.4504, "mean_token_accuracy": 0.12795896902680398, "num_tokens": 1390664.0, "step": 575 }, { "entropy": 6.862272691726685, "epoch": 0.03729184080241754, "grad_norm": 1.265625, "learning_rate": 0.0002895, "loss": 6.4401, "mean_token_accuracy": 0.12892675697803496, "num_tokens": 1402452.0, "step": 580 }, { "entropy": 6.953590202331543, "epoch": 0.03761332218864528, "grad_norm": 1.203125, "learning_rate": 0.000292, "loss": 6.4336, "mean_token_accuracy": 0.1350032038986683, "num_tokens": 1414961.0, "step": 585 }, { "entropy": 6.967419624328613, "epoch": 0.03793480357487301, "grad_norm": 1.25, "learning_rate": 0.0002945, "loss": 6.5459, "mean_token_accuracy": 0.12986136153340339, "num_tokens": 1427130.0, "step": 590 }, { "entropy": 6.999366188049317, "epoch": 0.03825628496110075, "grad_norm": 1.09375, "learning_rate": 0.000297, "loss": 6.5246, "mean_token_accuracy": 0.12499598488211631, "num_tokens": 1439670.0, "step": 595 }, { "entropy": 6.75904483795166, "epoch": 0.03857776634732849, "grad_norm": 1.0703125, "learning_rate": 0.0002995, "loss": 6.3962, "mean_token_accuracy": 0.13737771436572074, "num_tokens": 1451083.0, "step": 600 }, { "entropy": 6.9564125537872314, "epoch": 0.03889924773355623, "grad_norm": 1.125, "learning_rate": 0.000302, "loss": 6.5001, "mean_token_accuracy": 0.12657159492373465, "num_tokens": 1461668.0, "step": 605 }, { "entropy": 6.856050968170166, "epoch": 0.03922072911978396, "grad_norm": 1.0703125, "learning_rate": 0.0003045, "loss": 6.4294, "mean_token_accuracy": 0.12893444746732713, "num_tokens": 1474610.0, "step": 610 }, { "entropy": 6.858731031417847, "epoch": 0.0395422105060117, "grad_norm": 1.046875, "learning_rate": 0.000307, "loss": 6.4416, "mean_token_accuracy": 0.13238393440842627, "num_tokens": 1486322.0, "step": 615 }, { "entropy": 6.896153497695923, "epoch": 0.03986369189223944, "grad_norm": 1.2734375, "learning_rate": 0.0003095, "loss": 6.3976, "mean_token_accuracy": 0.13269342258572578, "num_tokens": 1498463.0, "step": 620 }, { "entropy": 6.833624172210693, "epoch": 0.04018517327846718, "grad_norm": 1.0625, "learning_rate": 0.000312, "loss": 6.4049, "mean_token_accuracy": 0.1366283804178238, "num_tokens": 1509636.0, "step": 625 }, { "entropy": 6.8152320861816404, "epoch": 0.04050665466469491, "grad_norm": 1.28125, "learning_rate": 0.0003145, "loss": 6.3352, "mean_token_accuracy": 0.1357703410089016, "num_tokens": 1523039.0, "step": 630 }, { "entropy": 6.893960666656494, "epoch": 0.04082813605092265, "grad_norm": 1.1875, "learning_rate": 0.000317, "loss": 6.5259, "mean_token_accuracy": 0.12882191091775894, "num_tokens": 1535491.0, "step": 635 }, { "entropy": 6.884737253189087, "epoch": 0.04114961743715039, "grad_norm": 1.046875, "learning_rate": 0.0003195, "loss": 6.4357, "mean_token_accuracy": 0.13706220015883447, "num_tokens": 1547246.0, "step": 640 }, { "entropy": 6.814633703231811, "epoch": 0.04147109882337813, "grad_norm": 1.2421875, "learning_rate": 0.000322, "loss": 6.4277, "mean_token_accuracy": 0.1322600543498993, "num_tokens": 1558948.0, "step": 645 }, { "entropy": 6.686750745773315, "epoch": 0.04179258020960586, "grad_norm": 1.1640625, "learning_rate": 0.00032450000000000003, "loss": 6.2122, "mean_token_accuracy": 0.1456362023949623, "num_tokens": 1571590.0, "step": 650 }, { "entropy": 6.888936519622803, "epoch": 0.0421140615958336, "grad_norm": 1.09375, "learning_rate": 0.00032700000000000003, "loss": 6.4346, "mean_token_accuracy": 0.1308947794139385, "num_tokens": 1582646.0, "step": 655 }, { "entropy": 6.749909734725952, "epoch": 0.04243554298206134, "grad_norm": 1.234375, "learning_rate": 0.00032950000000000004, "loss": 6.413, "mean_token_accuracy": 0.13245051279664039, "num_tokens": 1595393.0, "step": 660 }, { "entropy": 6.742237949371338, "epoch": 0.04275702436828908, "grad_norm": 1.296875, "learning_rate": 0.00033200000000000005, "loss": 6.3141, "mean_token_accuracy": 0.13743347227573394, "num_tokens": 1607048.0, "step": 665 }, { "entropy": 6.773509550094604, "epoch": 0.04307850575451681, "grad_norm": 1.125, "learning_rate": 0.00033450000000000005, "loss": 6.41, "mean_token_accuracy": 0.12926661148667334, "num_tokens": 1619572.0, "step": 670 }, { "entropy": 6.804459476470948, "epoch": 0.04339998714074455, "grad_norm": 1.2109375, "learning_rate": 0.000337, "loss": 6.3502, "mean_token_accuracy": 0.1368434838950634, "num_tokens": 1631342.0, "step": 675 }, { "entropy": 6.70438814163208, "epoch": 0.04372146852697229, "grad_norm": 1.078125, "learning_rate": 0.0003395, "loss": 6.2264, "mean_token_accuracy": 0.14183585047721864, "num_tokens": 1644192.0, "step": 680 }, { "entropy": 6.752353096008301, "epoch": 0.04404294991320003, "grad_norm": 1.2265625, "learning_rate": 0.000342, "loss": 6.3503, "mean_token_accuracy": 0.13174555450677872, "num_tokens": 1656080.0, "step": 685 }, { "entropy": 6.761217737197876, "epoch": 0.04436443129942776, "grad_norm": 1.0546875, "learning_rate": 0.00034449999999999997, "loss": 6.4007, "mean_token_accuracy": 0.12576238363981246, "num_tokens": 1669649.0, "step": 690 }, { "entropy": 6.725815725326538, "epoch": 0.0446859126856555, "grad_norm": 1.1640625, "learning_rate": 0.000347, "loss": 6.2721, "mean_token_accuracy": 0.13926005065441133, "num_tokens": 1680722.0, "step": 695 }, { "entropy": 6.70696120262146, "epoch": 0.045007394071883235, "grad_norm": 1.046875, "learning_rate": 0.0003495, "loss": 6.3386, "mean_token_accuracy": 0.1366697758436203, "num_tokens": 1693477.0, "step": 700 }, { "entropy": 6.703974771499634, "epoch": 0.04532887545811098, "grad_norm": 1.03125, "learning_rate": 0.000352, "loss": 6.2352, "mean_token_accuracy": 0.1410387024283409, "num_tokens": 1705823.0, "step": 705 }, { "entropy": 6.785667657852173, "epoch": 0.04565035684433871, "grad_norm": 1.03125, "learning_rate": 0.0003545, "loss": 6.3254, "mean_token_accuracy": 0.14233048632740974, "num_tokens": 1717339.0, "step": 710 }, { "entropy": 6.76090669631958, "epoch": 0.04597183823056645, "grad_norm": 1.125, "learning_rate": 0.000357, "loss": 6.3435, "mean_token_accuracy": 0.13566424325108528, "num_tokens": 1729407.0, "step": 715 }, { "entropy": 6.704364395141601, "epoch": 0.046293319616794185, "grad_norm": 1.109375, "learning_rate": 0.0003595, "loss": 6.29, "mean_token_accuracy": 0.13379911631345748, "num_tokens": 1741876.0, "step": 720 }, { "entropy": 6.77631402015686, "epoch": 0.04661480100302193, "grad_norm": 1.1328125, "learning_rate": 0.000362, "loss": 6.4265, "mean_token_accuracy": 0.13033137172460557, "num_tokens": 1755751.0, "step": 725 }, { "entropy": 6.657670211791992, "epoch": 0.04693628238924966, "grad_norm": 1.0, "learning_rate": 0.0003645, "loss": 6.1913, "mean_token_accuracy": 0.1418625645339489, "num_tokens": 1766711.0, "step": 730 }, { "entropy": 6.637538290023803, "epoch": 0.0472577637754774, "grad_norm": 0.9609375, "learning_rate": 0.000367, "loss": 6.342, "mean_token_accuracy": 0.13235798180103303, "num_tokens": 1781099.0, "step": 735 }, { "entropy": 6.792068195343018, "epoch": 0.047579245161705135, "grad_norm": 1.1328125, "learning_rate": 0.0003695, "loss": 6.3176, "mean_token_accuracy": 0.1338970459997654, "num_tokens": 1793964.0, "step": 740 }, { "entropy": 6.59170298576355, "epoch": 0.04790072654793288, "grad_norm": 1.0078125, "learning_rate": 0.000372, "loss": 6.3336, "mean_token_accuracy": 0.136866308003664, "num_tokens": 1806013.0, "step": 745 }, { "entropy": 6.797374200820923, "epoch": 0.04822220793416061, "grad_norm": 1.296875, "learning_rate": 0.0003745, "loss": 6.3025, "mean_token_accuracy": 0.1357277400791645, "num_tokens": 1819486.0, "step": 750 }, { "entropy": 6.608404302597046, "epoch": 0.04854368932038835, "grad_norm": 1.1328125, "learning_rate": 0.000377, "loss": 6.209, "mean_token_accuracy": 0.139783376455307, "num_tokens": 1830707.0, "step": 755 }, { "entropy": 6.744276094436645, "epoch": 0.048865170706616085, "grad_norm": 1.1640625, "learning_rate": 0.0003795, "loss": 6.4339, "mean_token_accuracy": 0.13964696526527404, "num_tokens": 1842601.0, "step": 760 }, { "entropy": 6.641026306152344, "epoch": 0.04918665209284383, "grad_norm": 0.98828125, "learning_rate": 0.000382, "loss": 6.2247, "mean_token_accuracy": 0.14221392944455147, "num_tokens": 1854989.0, "step": 765 }, { "entropy": 6.668173885345459, "epoch": 0.04950813347907156, "grad_norm": 1.046875, "learning_rate": 0.0003845, "loss": 6.3488, "mean_token_accuracy": 0.13909211456775666, "num_tokens": 1867613.0, "step": 770 }, { "entropy": 6.559179830551147, "epoch": 0.0498296148652993, "grad_norm": 1.0546875, "learning_rate": 0.00038700000000000003, "loss": 6.1666, "mean_token_accuracy": 0.1398898646235466, "num_tokens": 1879203.0, "step": 775 }, { "entropy": 6.739627838134766, "epoch": 0.050151096251527034, "grad_norm": 1.1015625, "learning_rate": 0.00038950000000000003, "loss": 6.3404, "mean_token_accuracy": 0.13396444767713547, "num_tokens": 1892402.0, "step": 780 }, { "entropy": 6.695523881912232, "epoch": 0.05047257763775478, "grad_norm": 1.171875, "learning_rate": 0.00039200000000000004, "loss": 6.3368, "mean_token_accuracy": 0.13424392864108087, "num_tokens": 1904777.0, "step": 785 }, { "entropy": 6.697699403762817, "epoch": 0.05079405902398251, "grad_norm": 1.171875, "learning_rate": 0.00039450000000000005, "loss": 6.3303, "mean_token_accuracy": 0.14127687290310859, "num_tokens": 1915303.0, "step": 790 }, { "entropy": 6.605134391784668, "epoch": 0.05111554041021025, "grad_norm": 1.171875, "learning_rate": 0.00039700000000000005, "loss": 6.1703, "mean_token_accuracy": 0.14601608961820603, "num_tokens": 1927440.0, "step": 795 }, { "entropy": 6.599157094955444, "epoch": 0.051437021796437984, "grad_norm": 1.03125, "learning_rate": 0.0003995, "loss": 6.2865, "mean_token_accuracy": 0.14217782020568848, "num_tokens": 1939028.0, "step": 800 }, { "entropy": 6.546269845962525, "epoch": 0.05175850318266572, "grad_norm": 1.1953125, "learning_rate": 0.000402, "loss": 6.0901, "mean_token_accuracy": 0.14469429180026055, "num_tokens": 1949002.0, "step": 805 }, { "entropy": 6.540508651733399, "epoch": 0.05207998456889346, "grad_norm": 1.0390625, "learning_rate": 0.0004045, "loss": 6.1717, "mean_token_accuracy": 0.14316056221723555, "num_tokens": 1960724.0, "step": 810 }, { "entropy": 6.635583829879761, "epoch": 0.0524014659551212, "grad_norm": 1.1953125, "learning_rate": 0.00040699999999999997, "loss": 6.2174, "mean_token_accuracy": 0.15010152757167816, "num_tokens": 1972874.0, "step": 815 }, { "entropy": 6.5239417552948, "epoch": 0.052722947341348934, "grad_norm": 1.140625, "learning_rate": 0.0004095, "loss": 6.2177, "mean_token_accuracy": 0.14256786555051804, "num_tokens": 1985303.0, "step": 820 }, { "entropy": 6.585869884490966, "epoch": 0.05304442872757667, "grad_norm": 1.1796875, "learning_rate": 0.000412, "loss": 6.2209, "mean_token_accuracy": 0.1398877792060375, "num_tokens": 1996460.0, "step": 825 }, { "entropy": 6.571089553833008, "epoch": 0.05336591011380441, "grad_norm": 1.09375, "learning_rate": 0.0004145, "loss": 6.2383, "mean_token_accuracy": 0.14395796954631807, "num_tokens": 2008237.0, "step": 830 }, { "entropy": 6.622538232803345, "epoch": 0.05368739150003215, "grad_norm": 0.9765625, "learning_rate": 0.000417, "loss": 6.2403, "mean_token_accuracy": 0.14386678040027617, "num_tokens": 2020207.0, "step": 835 }, { "entropy": 6.661964750289917, "epoch": 0.054008872886259884, "grad_norm": 1.21875, "learning_rate": 0.0004195, "loss": 6.2427, "mean_token_accuracy": 0.13739722222089767, "num_tokens": 2031521.0, "step": 840 }, { "entropy": 6.462450408935547, "epoch": 0.05433035427248762, "grad_norm": 1.09375, "learning_rate": 0.000422, "loss": 6.2228, "mean_token_accuracy": 0.14301058202981948, "num_tokens": 2043455.0, "step": 845 }, { "entropy": 6.503607940673828, "epoch": 0.05465183565871536, "grad_norm": 1.15625, "learning_rate": 0.0004245, "loss": 6.1393, "mean_token_accuracy": 0.14353580325841903, "num_tokens": 2055173.0, "step": 850 }, { "entropy": 6.541472578048706, "epoch": 0.0549733170449431, "grad_norm": 0.96875, "learning_rate": 0.000427, "loss": 6.1403, "mean_token_accuracy": 0.15179161876440048, "num_tokens": 2066734.0, "step": 855 }, { "entropy": 6.639166307449341, "epoch": 0.055294798431170834, "grad_norm": 1.09375, "learning_rate": 0.0004295, "loss": 6.2761, "mean_token_accuracy": 0.1436140313744545, "num_tokens": 2078000.0, "step": 860 }, { "entropy": 6.475754165649414, "epoch": 0.05561627981739857, "grad_norm": 1.0625, "learning_rate": 0.000432, "loss": 6.2339, "mean_token_accuracy": 0.13742900639772415, "num_tokens": 2090853.0, "step": 865 }, { "entropy": 6.5641477584838865, "epoch": 0.05593776120362631, "grad_norm": 1.2265625, "learning_rate": 0.0004345, "loss": 6.2037, "mean_token_accuracy": 0.14319348186254502, "num_tokens": 2102077.0, "step": 870 }, { "entropy": 6.494472360610962, "epoch": 0.05625924258985405, "grad_norm": 1.125, "learning_rate": 0.000437, "loss": 6.2086, "mean_token_accuracy": 0.1428264133632183, "num_tokens": 2114102.0, "step": 875 }, { "entropy": 6.49079270362854, "epoch": 0.056580723976081784, "grad_norm": 1.0703125, "learning_rate": 0.0004395, "loss": 6.0957, "mean_token_accuracy": 0.14935592859983443, "num_tokens": 2125155.0, "step": 880 }, { "entropy": 6.433831787109375, "epoch": 0.05690220536230952, "grad_norm": 1.109375, "learning_rate": 0.000442, "loss": 6.0576, "mean_token_accuracy": 0.14371880292892455, "num_tokens": 2136501.0, "step": 885 }, { "entropy": 6.521292591094971, "epoch": 0.05722368674853726, "grad_norm": 1.109375, "learning_rate": 0.0004445, "loss": 6.1641, "mean_token_accuracy": 0.14184854477643966, "num_tokens": 2149142.0, "step": 890 }, { "entropy": 6.478517198562622, "epoch": 0.057545168134765, "grad_norm": 1.03125, "learning_rate": 0.000447, "loss": 6.079, "mean_token_accuracy": 0.15349558889865875, "num_tokens": 2161548.0, "step": 895 }, { "entropy": 6.435318660736084, "epoch": 0.057866649520992734, "grad_norm": 1.0625, "learning_rate": 0.00044950000000000003, "loss": 6.1254, "mean_token_accuracy": 0.14672751501202583, "num_tokens": 2174109.0, "step": 900 }, { "entropy": 6.477844858169556, "epoch": 0.05818813090722047, "grad_norm": 1.0390625, "learning_rate": 0.00045200000000000004, "loss": 6.089, "mean_token_accuracy": 0.15101353526115419, "num_tokens": 2186559.0, "step": 905 }, { "entropy": 6.43283166885376, "epoch": 0.05850961229344821, "grad_norm": 1.0625, "learning_rate": 0.00045450000000000004, "loss": 6.1185, "mean_token_accuracy": 0.15171128660440444, "num_tokens": 2199397.0, "step": 910 }, { "entropy": 6.388595533370972, "epoch": 0.05883109367967595, "grad_norm": 1.1484375, "learning_rate": 0.00045700000000000005, "loss": 6.1171, "mean_token_accuracy": 0.1468488872051239, "num_tokens": 2211176.0, "step": 915 }, { "entropy": 6.3985847473144535, "epoch": 0.059152575065903684, "grad_norm": 1.078125, "learning_rate": 0.00045950000000000006, "loss": 6.078, "mean_token_accuracy": 0.15174092650413512, "num_tokens": 2223661.0, "step": 920 }, { "entropy": 6.408503246307373, "epoch": 0.05947405645213142, "grad_norm": 1.1796875, "learning_rate": 0.000462, "loss": 6.0222, "mean_token_accuracy": 0.14833907932043075, "num_tokens": 2233609.0, "step": 925 }, { "entropy": 6.424277496337891, "epoch": 0.059795537838359156, "grad_norm": 1.1953125, "learning_rate": 0.0004645, "loss": 6.1108, "mean_token_accuracy": 0.14718108102679253, "num_tokens": 2245791.0, "step": 930 }, { "entropy": 6.391247034072876, "epoch": 0.0601170192245869, "grad_norm": 1.09375, "learning_rate": 0.000467, "loss": 6.0183, "mean_token_accuracy": 0.14811496585607528, "num_tokens": 2258640.0, "step": 935 }, { "entropy": 6.4228808879852295, "epoch": 0.060438500610814634, "grad_norm": 1.171875, "learning_rate": 0.0004695, "loss": 6.118, "mean_token_accuracy": 0.13841042444109916, "num_tokens": 2270487.0, "step": 940 }, { "entropy": 6.4019317626953125, "epoch": 0.06075998199704237, "grad_norm": 1.375, "learning_rate": 0.000472, "loss": 6.1586, "mean_token_accuracy": 0.14111901223659515, "num_tokens": 2283852.0, "step": 945 }, { "entropy": 6.472497415542603, "epoch": 0.061081463383270106, "grad_norm": 1.1015625, "learning_rate": 0.0004745, "loss": 6.1262, "mean_token_accuracy": 0.14592221304774283, "num_tokens": 2295351.0, "step": 950 }, { "entropy": 6.520536708831787, "epoch": 0.06140294476949785, "grad_norm": 1.21875, "learning_rate": 0.000477, "loss": 6.1374, "mean_token_accuracy": 0.14523889273405075, "num_tokens": 2307723.0, "step": 955 }, { "entropy": 6.310831737518311, "epoch": 0.061724426155725584, "grad_norm": 1.203125, "learning_rate": 0.0004795, "loss": 6.0438, "mean_token_accuracy": 0.15202855616807937, "num_tokens": 2320273.0, "step": 960 }, { "entropy": 6.316798114776612, "epoch": 0.06204590754195332, "grad_norm": 1.046875, "learning_rate": 0.000482, "loss": 6.055, "mean_token_accuracy": 0.15343189984560013, "num_tokens": 2332142.0, "step": 965 }, { "entropy": 6.3915996074676515, "epoch": 0.062367388928181056, "grad_norm": 0.984375, "learning_rate": 0.0004845, "loss": 6.1411, "mean_token_accuracy": 0.1484244257211685, "num_tokens": 2346027.0, "step": 970 }, { "entropy": 6.468223333358765, "epoch": 0.0626888703144088, "grad_norm": 1.078125, "learning_rate": 0.000487, "loss": 6.1227, "mean_token_accuracy": 0.1468320369720459, "num_tokens": 2357606.0, "step": 975 }, { "entropy": 6.406705331802368, "epoch": 0.06301035170063653, "grad_norm": 1.0546875, "learning_rate": 0.0004895, "loss": 6.0776, "mean_token_accuracy": 0.15517954528331757, "num_tokens": 2369122.0, "step": 980 }, { "entropy": 6.341184473037719, "epoch": 0.06333183308686427, "grad_norm": 1.15625, "learning_rate": 0.000492, "loss": 5.9906, "mean_token_accuracy": 0.15497024059295655, "num_tokens": 2380313.0, "step": 985 }, { "entropy": 6.496398115158081, "epoch": 0.06365331447309201, "grad_norm": 1.203125, "learning_rate": 0.0004945, "loss": 6.187, "mean_token_accuracy": 0.1426093466579914, "num_tokens": 2392535.0, "step": 990 }, { "entropy": 6.377195549011231, "epoch": 0.06397479585931974, "grad_norm": 1.1875, "learning_rate": 0.000497, "loss": 6.1267, "mean_token_accuracy": 0.14542814046144487, "num_tokens": 2404878.0, "step": 995 }, { "entropy": 6.302570390701294, "epoch": 0.06429627724554748, "grad_norm": 1.1328125, "learning_rate": 0.0004995, "loss": 5.99, "mean_token_accuracy": 0.15718609392642974, "num_tokens": 2416656.0, "step": 1000 }, { "entropy": 6.394310522079468, "epoch": 0.06461775863177523, "grad_norm": 1.0546875, "learning_rate": 0.000499998026082006, "loss": 6.0817, "mean_token_accuracy": 0.14592474773526193, "num_tokens": 2428666.0, "step": 1005 }, { "entropy": 6.298369979858398, "epoch": 0.06493924001800296, "grad_norm": 1.125, "learning_rate": 0.0004999900070995136, "loss": 6.0213, "mean_token_accuracy": 0.14751595705747605, "num_tokens": 2440183.0, "step": 1010 }, { "entropy": 6.303510761260986, "epoch": 0.0652607214042307, "grad_norm": 1.1015625, "learning_rate": 0.0004999758199023239, "loss": 6.0006, "mean_token_accuracy": 0.1451709449291229, "num_tokens": 2452380.0, "step": 1015 }, { "entropy": 6.476188898086548, "epoch": 0.06558220279045843, "grad_norm": 0.8984375, "learning_rate": 0.0004999554648793858, "loss": 6.1831, "mean_token_accuracy": 0.13650565296411515, "num_tokens": 2466418.0, "step": 1020 }, { "entropy": 6.272005653381347, "epoch": 0.06590368417668617, "grad_norm": 1.0703125, "learning_rate": 0.0004999289425887425, "loss": 5.9469, "mean_token_accuracy": 0.15635564625263215, "num_tokens": 2478900.0, "step": 1025 }, { "entropy": 6.3220130443573, "epoch": 0.06622516556291391, "grad_norm": 1.046875, "learning_rate": 0.0004998962537575161, "loss": 6.056, "mean_token_accuracy": 0.1513557553291321, "num_tokens": 2491059.0, "step": 1030 }, { "entropy": 6.254553413391113, "epoch": 0.06654664694914164, "grad_norm": 1.0, "learning_rate": 0.0004998573992818874, "loss": 5.9955, "mean_token_accuracy": 0.1543598785996437, "num_tokens": 2503090.0, "step": 1035 }, { "entropy": 6.381179428100586, "epoch": 0.06686812833536938, "grad_norm": 1.1171875, "learning_rate": 0.0004998123802270715, "loss": 6.0787, "mean_token_accuracy": 0.15112028270959854, "num_tokens": 2513716.0, "step": 1040 }, { "entropy": 6.2655613899230955, "epoch": 0.06718960972159711, "grad_norm": 1.046875, "learning_rate": 0.0004997611978272886, "loss": 6.0051, "mean_token_accuracy": 0.15200867950916291, "num_tokens": 2526295.0, "step": 1045 }, { "entropy": 6.446440315246582, "epoch": 0.06751109110782486, "grad_norm": 1.1640625, "learning_rate": 0.0004997038534857298, "loss": 6.0981, "mean_token_accuracy": 0.1533021330833435, "num_tokens": 2538026.0, "step": 1050 }, { "entropy": 6.268654203414917, "epoch": 0.0678325724940526, "grad_norm": 1.0859375, "learning_rate": 0.0004996403487745194, "loss": 6.0517, "mean_token_accuracy": 0.15148577690124512, "num_tokens": 2549041.0, "step": 1055 }, { "entropy": 6.328129005432129, "epoch": 0.06815405388028033, "grad_norm": 1.078125, "learning_rate": 0.000499570685434671, "loss": 5.9757, "mean_token_accuracy": 0.15270224064588547, "num_tokens": 2561843.0, "step": 1060 }, { "entropy": 6.40714201927185, "epoch": 0.06847553526650807, "grad_norm": 1.0859375, "learning_rate": 0.0004994948653760405, "loss": 6.0571, "mean_token_accuracy": 0.15040460601449013, "num_tokens": 2573834.0, "step": 1065 }, { "entropy": 6.334405422210693, "epoch": 0.06879701665273581, "grad_norm": 1.2265625, "learning_rate": 0.0004994128906772729, "loss": 6.0512, "mean_token_accuracy": 0.14916755259037018, "num_tokens": 2584577.0, "step": 1070 }, { "entropy": 6.18700156211853, "epoch": 0.06911849803896354, "grad_norm": 1.0546875, "learning_rate": 0.000499324763585746, "loss": 5.8854, "mean_token_accuracy": 0.15264845192432402, "num_tokens": 2596511.0, "step": 1075 }, { "entropy": 6.373612308502198, "epoch": 0.06943997942519128, "grad_norm": 1.0625, "learning_rate": 0.0004992304865175085, "loss": 6.106, "mean_token_accuracy": 0.14183942899107932, "num_tokens": 2608338.0, "step": 1080 }, { "entropy": 6.362950563430786, "epoch": 0.06976146081141901, "grad_norm": 1.09375, "learning_rate": 0.0004991300620572138, "loss": 6.0426, "mean_token_accuracy": 0.14951156824827194, "num_tokens": 2620081.0, "step": 1085 }, { "entropy": 6.342620515823365, "epoch": 0.07008294219764676, "grad_norm": 1.1171875, "learning_rate": 0.0004990234929580494, "loss": 6.067, "mean_token_accuracy": 0.1514773279428482, "num_tokens": 2633153.0, "step": 1090 }, { "entropy": 6.23214864730835, "epoch": 0.0704044235838745, "grad_norm": 1.1171875, "learning_rate": 0.0004989107821416609, "loss": 5.9612, "mean_token_accuracy": 0.15713730603456497, "num_tokens": 2645055.0, "step": 1095 }, { "entropy": 6.279799699783325, "epoch": 0.07072590497010223, "grad_norm": 0.984375, "learning_rate": 0.0004987919326980723, "loss": 5.9652, "mean_token_accuracy": 0.1615489676594734, "num_tokens": 2657798.0, "step": 1100 }, { "entropy": 6.290076160430909, "epoch": 0.07104738635632997, "grad_norm": 1.0546875, "learning_rate": 0.0004986669478856011, "loss": 6.0442, "mean_token_accuracy": 0.14735963940620422, "num_tokens": 2669095.0, "step": 1105 }, { "entropy": 6.239100980758667, "epoch": 0.07136886774255771, "grad_norm": 1.0859375, "learning_rate": 0.0004985358311307688, "loss": 5.9351, "mean_token_accuracy": 0.15722962766885756, "num_tokens": 2680533.0, "step": 1110 }, { "entropy": 6.191725826263427, "epoch": 0.07169034912878544, "grad_norm": 1.03125, "learning_rate": 0.0004983985860282081, "loss": 5.9617, "mean_token_accuracy": 0.15354472547769546, "num_tokens": 2694164.0, "step": 1115 }, { "entropy": 6.282885503768921, "epoch": 0.07201183051501318, "grad_norm": 0.97265625, "learning_rate": 0.0004982552163405623, "loss": 5.9871, "mean_token_accuracy": 0.15190175026655198, "num_tokens": 2705709.0, "step": 1120 }, { "entropy": 6.209733486175537, "epoch": 0.07233331190124091, "grad_norm": 1.203125, "learning_rate": 0.0004981057259983839, "loss": 5.9358, "mean_token_accuracy": 0.15684126019477845, "num_tokens": 2716682.0, "step": 1125 }, { "entropy": 6.260201930999756, "epoch": 0.07265479328746866, "grad_norm": 1.09375, "learning_rate": 0.0004979501191000262, "loss": 5.9749, "mean_token_accuracy": 0.14660124331712723, "num_tokens": 2728336.0, "step": 1130 }, { "entropy": 6.213229560852051, "epoch": 0.0729762746736964, "grad_norm": 1.1875, "learning_rate": 0.0004977883999115311, "loss": 5.8836, "mean_token_accuracy": 0.15912517607212068, "num_tokens": 2740588.0, "step": 1135 }, { "entropy": 6.234706211090088, "epoch": 0.07329775605992413, "grad_norm": 1.046875, "learning_rate": 0.0004976205728665113, "loss": 5.9084, "mean_token_accuracy": 0.15942537635564805, "num_tokens": 2751202.0, "step": 1140 }, { "entropy": 6.186249780654907, "epoch": 0.07361923744615187, "grad_norm": 1.0234375, "learning_rate": 0.0004974466425660307, "loss": 5.9218, "mean_token_accuracy": 0.15814530849456787, "num_tokens": 2763200.0, "step": 1145 }, { "entropy": 6.275615692138672, "epoch": 0.0739407188323796, "grad_norm": 1.0625, "learning_rate": 0.0004972666137784759, "loss": 5.977, "mean_token_accuracy": 0.15757482796907424, "num_tokens": 2774775.0, "step": 1150 }, { "entropy": 6.196810531616211, "epoch": 0.07426220021860734, "grad_norm": 1.0078125, "learning_rate": 0.0004970804914394271, "loss": 6.0315, "mean_token_accuracy": 0.14435624480247497, "num_tokens": 2787502.0, "step": 1155 }, { "entropy": 6.270943975448608, "epoch": 0.07458368160483508, "grad_norm": 1.03125, "learning_rate": 0.0004968882806515225, "loss": 5.9405, "mean_token_accuracy": 0.15502338707447053, "num_tokens": 2799054.0, "step": 1160 }, { "entropy": 6.246717548370361, "epoch": 0.07490516299106281, "grad_norm": 1.0546875, "learning_rate": 0.0004966899866843177, "loss": 6.068, "mean_token_accuracy": 0.1496472030878067, "num_tokens": 2813068.0, "step": 1165 }, { "entropy": 6.332323694229126, "epoch": 0.07522664437729056, "grad_norm": 1.1875, "learning_rate": 0.000496485614974142, "loss": 5.9714, "mean_token_accuracy": 0.1508554771542549, "num_tokens": 2826341.0, "step": 1170 }, { "entropy": 6.190732860565186, "epoch": 0.0755481257635183, "grad_norm": 1.171875, "learning_rate": 0.0004962751711239492, "loss": 5.9695, "mean_token_accuracy": 0.15956569463014603, "num_tokens": 2838963.0, "step": 1175 }, { "entropy": 6.236918926239014, "epoch": 0.07586960714974603, "grad_norm": 1.140625, "learning_rate": 0.0004960586609031636, "loss": 5.8992, "mean_token_accuracy": 0.15990909934043884, "num_tokens": 2851092.0, "step": 1180 }, { "entropy": 6.212152576446533, "epoch": 0.07619108853597377, "grad_norm": 1.0078125, "learning_rate": 0.0004958360902475224, "loss": 5.9219, "mean_token_accuracy": 0.1583631619811058, "num_tokens": 2863779.0, "step": 1185 }, { "entropy": 6.197848796844482, "epoch": 0.0765125699222015, "grad_norm": 1.046875, "learning_rate": 0.0004956074652589125, "loss": 5.9935, "mean_token_accuracy": 0.15426847636699675, "num_tokens": 2875827.0, "step": 1190 }, { "entropy": 6.268373584747314, "epoch": 0.07683405130842924, "grad_norm": 1.1171875, "learning_rate": 0.0004953727922052035, "loss": 5.9528, "mean_token_accuracy": 0.1541168585419655, "num_tokens": 2887881.0, "step": 1195 }, { "entropy": 6.1501389503479, "epoch": 0.07715553269465698, "grad_norm": 0.96484375, "learning_rate": 0.0004951320775200756, "loss": 5.8044, "mean_token_accuracy": 0.16239132285118102, "num_tokens": 2899607.0, "step": 1200 }, { "entropy": 6.136989784240723, "epoch": 0.07747701408088471, "grad_norm": 1.2265625, "learning_rate": 0.0004948853278028436, "loss": 5.8496, "mean_token_accuracy": 0.16230373978614807, "num_tokens": 2911423.0, "step": 1205 }, { "entropy": 6.205084800720215, "epoch": 0.07779849546711246, "grad_norm": 1.078125, "learning_rate": 0.0004946325498182755, "loss": 5.9853, "mean_token_accuracy": 0.1523156225681305, "num_tokens": 2925360.0, "step": 1210 }, { "entropy": 6.194045448303223, "epoch": 0.0781199768533402, "grad_norm": 1.0546875, "learning_rate": 0.0004943737504964076, "loss": 5.9173, "mean_token_accuracy": 0.1579758957028389, "num_tokens": 2937760.0, "step": 1215 }, { "entropy": 6.1570957660675045, "epoch": 0.07844145823956793, "grad_norm": 1.078125, "learning_rate": 0.000494108936932354, "loss": 5.8932, "mean_token_accuracy": 0.16087926626205445, "num_tokens": 2950439.0, "step": 1220 }, { "entropy": 6.266901922225952, "epoch": 0.07876293962579567, "grad_norm": 1.09375, "learning_rate": 0.0004938381163861124, "loss": 6.014, "mean_token_accuracy": 0.14868946373462677, "num_tokens": 2962664.0, "step": 1225 }, { "entropy": 6.095866441726685, "epoch": 0.0790844210120234, "grad_norm": 0.99609375, "learning_rate": 0.0004935612962823645, "loss": 5.9046, "mean_token_accuracy": 0.15208775401115418, "num_tokens": 2974490.0, "step": 1230 }, { "entropy": 6.195926570892334, "epoch": 0.07940590239825114, "grad_norm": 1.0390625, "learning_rate": 0.0004932784842102739, "loss": 5.8682, "mean_token_accuracy": 0.1580081731081009, "num_tokens": 2987204.0, "step": 1235 }, { "entropy": 6.1595056533813475, "epoch": 0.07972738378447888, "grad_norm": 1.046875, "learning_rate": 0.0004929896879232758, "loss": 5.9712, "mean_token_accuracy": 0.15987634658813477, "num_tokens": 2998803.0, "step": 1240 }, { "entropy": 6.277051019668579, "epoch": 0.08004886517070661, "grad_norm": 1.171875, "learning_rate": 0.0004926949153388668, "loss": 5.9109, "mean_token_accuracy": 0.16382880806922911, "num_tokens": 3009699.0, "step": 1245 }, { "entropy": 6.08549280166626, "epoch": 0.08037034655693436, "grad_norm": 1.234375, "learning_rate": 0.0004923941745383859, "loss": 5.8865, "mean_token_accuracy": 0.15905096381902695, "num_tokens": 3020917.0, "step": 1250 }, { "entropy": 6.149177408218383, "epoch": 0.0806918279431621, "grad_norm": 1.109375, "learning_rate": 0.000492087473766794, "loss": 5.8303, "mean_token_accuracy": 0.1584074839949608, "num_tokens": 3033456.0, "step": 1255 }, { "entropy": 6.166597366333008, "epoch": 0.08101330932938983, "grad_norm": 1.0859375, "learning_rate": 0.000491774821432448, "loss": 6.0052, "mean_token_accuracy": 0.14997194707393646, "num_tokens": 3046176.0, "step": 1260 }, { "entropy": 6.307433652877807, "epoch": 0.08133479071561757, "grad_norm": 1.015625, "learning_rate": 0.0004914562261068693, "loss": 6.0066, "mean_token_accuracy": 0.15461492016911507, "num_tokens": 3057842.0, "step": 1265 }, { "entropy": 6.054072427749634, "epoch": 0.0816562721018453, "grad_norm": 1.1875, "learning_rate": 0.0004911316965245098, "loss": 5.8168, "mean_token_accuracy": 0.15909599289298057, "num_tokens": 3068571.0, "step": 1270 }, { "entropy": 6.198695945739746, "epoch": 0.08197775348807304, "grad_norm": 1.0390625, "learning_rate": 0.000490801241582512, "loss": 5.8535, "mean_token_accuracy": 0.15899356454610825, "num_tokens": 3081008.0, "step": 1275 }, { "entropy": 6.10587100982666, "epoch": 0.08229923487430078, "grad_norm": 1.1875, "learning_rate": 0.000490464870340465, "loss": 5.8437, "mean_token_accuracy": 0.15855197459459305, "num_tokens": 3092520.0, "step": 1280 }, { "entropy": 6.330335187911987, "epoch": 0.08262071626052851, "grad_norm": 1.0703125, "learning_rate": 0.0004901225920201563, "loss": 6.0411, "mean_token_accuracy": 0.14842546507716178, "num_tokens": 3104994.0, "step": 1285 }, { "entropy": 6.09021487236023, "epoch": 0.08294219764675625, "grad_norm": 1.25, "learning_rate": 0.000489774416005319, "loss": 5.8597, "mean_token_accuracy": 0.16196220368146896, "num_tokens": 3116630.0, "step": 1290 }, { "entropy": 6.14417290687561, "epoch": 0.08326367903298398, "grad_norm": 0.96875, "learning_rate": 0.0004894203518413742, "loss": 5.9314, "mean_token_accuracy": 0.15356178283691407, "num_tokens": 3130901.0, "step": 1295 }, { "entropy": 5.983477401733398, "epoch": 0.08358516041921173, "grad_norm": 0.984375, "learning_rate": 0.0004890604092351701, "loss": 5.8086, "mean_token_accuracy": 0.1642161339521408, "num_tokens": 3142889.0, "step": 1300 }, { "entropy": 6.177248144149781, "epoch": 0.08390664180543947, "grad_norm": 1.09375, "learning_rate": 0.000488694598054715, "loss": 5.877, "mean_token_accuracy": 0.15873171985149384, "num_tokens": 3155480.0, "step": 1305 }, { "entropy": 6.148008251190186, "epoch": 0.0842281231916672, "grad_norm": 1.0859375, "learning_rate": 0.0004883229283289071, "loss": 5.8713, "mean_token_accuracy": 0.16119552850723268, "num_tokens": 3166741.0, "step": 1310 }, { "entropy": 6.148603343963623, "epoch": 0.08454960457789494, "grad_norm": 1.0546875, "learning_rate": 0.00048794541024725993, "loss": 5.8541, "mean_token_accuracy": 0.15728282779455185, "num_tokens": 3179642.0, "step": 1315 }, { "entropy": 6.1732546329498295, "epoch": 0.08487108596412268, "grad_norm": 1.0390625, "learning_rate": 0.0004875620541596221, "loss": 5.9588, "mean_token_accuracy": 0.15470116436481476, "num_tokens": 3191737.0, "step": 1320 }, { "entropy": 6.115213203430176, "epoch": 0.08519256735035041, "grad_norm": 1.03125, "learning_rate": 0.00048717287057589454, "loss": 5.7712, "mean_token_accuracy": 0.16634340584278107, "num_tokens": 3204712.0, "step": 1325 }, { "entropy": 6.015933704376221, "epoch": 0.08551404873657815, "grad_norm": 0.9765625, "learning_rate": 0.0004867778701657417, "loss": 5.759, "mean_token_accuracy": 0.16800687313079835, "num_tokens": 3217394.0, "step": 1330 }, { "entropy": 6.0952574729919435, "epoch": 0.08583553012280588, "grad_norm": 1.109375, "learning_rate": 0.00048637706375829955, "loss": 5.7798, "mean_token_accuracy": 0.16281396746635438, "num_tokens": 3228550.0, "step": 1335 }, { "entropy": 6.004730653762818, "epoch": 0.08615701150903363, "grad_norm": 0.9921875, "learning_rate": 0.000485970462341878, "loss": 5.7723, "mean_token_accuracy": 0.17149952352046965, "num_tokens": 3240535.0, "step": 1340 }, { "entropy": 6.06542935371399, "epoch": 0.08647849289526137, "grad_norm": 1.0234375, "learning_rate": 0.00048555807706366044, "loss": 5.7642, "mean_token_accuracy": 0.16032337993383408, "num_tokens": 3251876.0, "step": 1345 }, { "entropy": 6.217990589141846, "epoch": 0.0867999742814891, "grad_norm": 1.1328125, "learning_rate": 0.00048513991922939756, "loss": 5.9447, "mean_token_accuracy": 0.16245564594864845, "num_tokens": 3264834.0, "step": 1350 }, { "entropy": 6.037310266494751, "epoch": 0.08712145566771684, "grad_norm": 1.125, "learning_rate": 0.00048471600030309744, "loss": 5.8879, "mean_token_accuracy": 0.15801134556531907, "num_tokens": 3276556.0, "step": 1355 }, { "entropy": 6.192209720611572, "epoch": 0.08744293705394458, "grad_norm": 1.1015625, "learning_rate": 0.00048428633190671186, "loss": 5.8204, "mean_token_accuracy": 0.1574784353375435, "num_tokens": 3288321.0, "step": 1360 }, { "entropy": 6.083817100524902, "epoch": 0.08776441844017231, "grad_norm": 1.0390625, "learning_rate": 0.0004838509258198167, "loss": 5.8902, "mean_token_accuracy": 0.15389755517244338, "num_tokens": 3301141.0, "step": 1365 }, { "entropy": 6.1486015796661375, "epoch": 0.08808589982640005, "grad_norm": 1.0, "learning_rate": 0.00048340979397929, "loss": 5.8995, "mean_token_accuracy": 0.1567264527082443, "num_tokens": 3313508.0, "step": 1370 }, { "entropy": 6.13810887336731, "epoch": 0.08840738121262778, "grad_norm": 0.953125, "learning_rate": 0.00048296294847898386, "loss": 5.8768, "mean_token_accuracy": 0.1589060604572296, "num_tokens": 3325548.0, "step": 1375 }, { "entropy": 5.974321031570435, "epoch": 0.08872886259885553, "grad_norm": 1.0390625, "learning_rate": 0.0004825104015693934, "loss": 5.7542, "mean_token_accuracy": 0.1705598786473274, "num_tokens": 3337409.0, "step": 1380 }, { "entropy": 6.113429403305053, "epoch": 0.08905034398508327, "grad_norm": 1.015625, "learning_rate": 0.0004820521656573208, "loss": 5.8314, "mean_token_accuracy": 0.16559924334287643, "num_tokens": 3349083.0, "step": 1385 }, { "entropy": 6.080103778839112, "epoch": 0.089371825371311, "grad_norm": 0.8828125, "learning_rate": 0.00048158825330553505, "loss": 5.8608, "mean_token_accuracy": 0.15842643529176711, "num_tokens": 3362145.0, "step": 1390 }, { "entropy": 6.0918474197387695, "epoch": 0.08969330675753874, "grad_norm": 1.078125, "learning_rate": 0.00048111867723242763, "loss": 5.7481, "mean_token_accuracy": 0.16890449076890945, "num_tokens": 3374472.0, "step": 1395 }, { "entropy": 6.049900007247925, "epoch": 0.09001478814376647, "grad_norm": 1.046875, "learning_rate": 0.0004806434503116637, "loss": 5.793, "mean_token_accuracy": 0.1702058121562004, "num_tokens": 3386431.0, "step": 1400 }, { "entropy": 6.105265045166016, "epoch": 0.09033626952999421, "grad_norm": 1.1484375, "learning_rate": 0.0004801625855718296, "loss": 5.8445, "mean_token_accuracy": 0.1575576588511467, "num_tokens": 3398456.0, "step": 1405 }, { "entropy": 6.04578046798706, "epoch": 0.09065775091622195, "grad_norm": 1.078125, "learning_rate": 0.00047967609619607477, "loss": 5.7742, "mean_token_accuracy": 0.16186919063329697, "num_tokens": 3409982.0, "step": 1410 }, { "entropy": 6.018639183044433, "epoch": 0.09097923230244968, "grad_norm": 0.92578125, "learning_rate": 0.0004791839955217513, "loss": 5.843, "mean_token_accuracy": 0.1640510618686676, "num_tokens": 3423098.0, "step": 1415 }, { "entropy": 6.030447006225586, "epoch": 0.09130071368867743, "grad_norm": 0.98046875, "learning_rate": 0.00047868629704004786, "loss": 5.7711, "mean_token_accuracy": 0.1604703187942505, "num_tokens": 3435572.0, "step": 1420 }, { "entropy": 6.01783299446106, "epoch": 0.09162219507490517, "grad_norm": 1.140625, "learning_rate": 0.00047818301439561965, "loss": 5.8236, "mean_token_accuracy": 0.1562732681632042, "num_tokens": 3448468.0, "step": 1425 }, { "entropy": 6.0785534381866455, "epoch": 0.0919436764611329, "grad_norm": 0.9921875, "learning_rate": 0.00047767416138621454, "loss": 5.8157, "mean_token_accuracy": 0.16070456504821778, "num_tokens": 3460450.0, "step": 1430 }, { "entropy": 6.0592879295349125, "epoch": 0.09226515784736064, "grad_norm": 1.0078125, "learning_rate": 0.000477159751962295, "loss": 5.8261, "mean_token_accuracy": 0.15531291663646699, "num_tokens": 3473091.0, "step": 1435 }, { "entropy": 6.079493522644043, "epoch": 0.09258663923358837, "grad_norm": 1.0234375, "learning_rate": 0.00047663980022665507, "loss": 5.8345, "mean_token_accuracy": 0.1659800574183464, "num_tokens": 3484727.0, "step": 1440 }, { "entropy": 5.929708814620971, "epoch": 0.09290812061981611, "grad_norm": 0.99609375, "learning_rate": 0.00047611432043403437, "loss": 5.6772, "mean_token_accuracy": 0.16626399755477905, "num_tokens": 3497349.0, "step": 1445 }, { "entropy": 6.129834794998169, "epoch": 0.09322960200604385, "grad_norm": 1.1875, "learning_rate": 0.0004755833269907267, "loss": 5.9135, "mean_token_accuracy": 0.15423834919929505, "num_tokens": 3508879.0, "step": 1450 }, { "entropy": 5.948153877258301, "epoch": 0.09355108339227158, "grad_norm": 1.046875, "learning_rate": 0.0004750468344541857, "loss": 5.6625, "mean_token_accuracy": 0.17003892362117767, "num_tokens": 3520524.0, "step": 1455 }, { "entropy": 6.036735153198242, "epoch": 0.09387256477849933, "grad_norm": 0.9921875, "learning_rate": 0.00047450485753262525, "loss": 5.7696, "mean_token_accuracy": 0.16654942631721498, "num_tokens": 3533929.0, "step": 1460 }, { "entropy": 6.083649492263794, "epoch": 0.09419404616472707, "grad_norm": 1.09375, "learning_rate": 0.00047395741108461633, "loss": 5.7687, "mean_token_accuracy": 0.1623277947306633, "num_tokens": 3545203.0, "step": 1465 }, { "entropy": 6.000326490402221, "epoch": 0.0945155275509548, "grad_norm": 0.96484375, "learning_rate": 0.00047340451011867985, "loss": 5.7797, "mean_token_accuracy": 0.15959457457065582, "num_tokens": 3557203.0, "step": 1470 }, { "entropy": 6.104987621307373, "epoch": 0.09483700893718254, "grad_norm": 1.0, "learning_rate": 0.00047284616979287515, "loss": 5.7919, "mean_token_accuracy": 0.17074221521615982, "num_tokens": 3568844.0, "step": 1475 }, { "entropy": 6.020106410980224, "epoch": 0.09515849032341027, "grad_norm": 1.0, "learning_rate": 0.00047228240541438433, "loss": 5.7881, "mean_token_accuracy": 0.1655557185411453, "num_tokens": 3581186.0, "step": 1480 }, { "entropy": 5.944919109344482, "epoch": 0.09547997170963801, "grad_norm": 1.078125, "learning_rate": 0.00047171323243909257, "loss": 5.7272, "mean_token_accuracy": 0.16357500553131105, "num_tokens": 3592679.0, "step": 1485 }, { "entropy": 6.149051380157471, "epoch": 0.09580145309586575, "grad_norm": 0.953125, "learning_rate": 0.00047113866647116457, "loss": 5.8955, "mean_token_accuracy": 0.1526908665895462, "num_tokens": 3605414.0, "step": 1490 }, { "entropy": 5.936412954330445, "epoch": 0.09612293448209348, "grad_norm": 1.0234375, "learning_rate": 0.0004705587232626164, "loss": 5.7614, "mean_token_accuracy": 0.1623243123292923, "num_tokens": 3618662.0, "step": 1495 }, { "entropy": 5.98573784828186, "epoch": 0.09644441586832123, "grad_norm": 1.0546875, "learning_rate": 0.00046997341871288424, "loss": 5.6834, "mean_token_accuracy": 0.17313943356275557, "num_tokens": 3629721.0, "step": 1500 }, { "entropy": 5.988020706176758, "epoch": 0.09676589725454895, "grad_norm": 1.03125, "learning_rate": 0.0004693827688683879, "loss": 5.6817, "mean_token_accuracy": 0.1712356060743332, "num_tokens": 3643031.0, "step": 1505 }, { "entropy": 5.948742055892945, "epoch": 0.0970873786407767, "grad_norm": 1.125, "learning_rate": 0.0004687867899220914, "loss": 5.7325, "mean_token_accuracy": 0.15706687420606613, "num_tokens": 3654260.0, "step": 1510 }, { "entropy": 6.096729373931884, "epoch": 0.09740886002700444, "grad_norm": 1.109375, "learning_rate": 0.00046818549821305846, "loss": 5.8357, "mean_token_accuracy": 0.16078440248966216, "num_tokens": 3665672.0, "step": 1515 }, { "entropy": 6.047589254379273, "epoch": 0.09773034141323217, "grad_norm": 1.0078125, "learning_rate": 0.00046757891022600494, "loss": 5.7997, "mean_token_accuracy": 0.1640141412615776, "num_tokens": 3678633.0, "step": 1520 }, { "entropy": 5.985074663162232, "epoch": 0.09805182279945991, "grad_norm": 1.125, "learning_rate": 0.0004669670425908471, "loss": 5.7481, "mean_token_accuracy": 0.17160257697105408, "num_tokens": 3691500.0, "step": 1525 }, { "entropy": 5.960325527191162, "epoch": 0.09837330418568765, "grad_norm": 0.91796875, "learning_rate": 0.0004663499120822451, "loss": 5.6994, "mean_token_accuracy": 0.16570399701595306, "num_tokens": 3704601.0, "step": 1530 }, { "entropy": 5.992954969406128, "epoch": 0.09869478557191538, "grad_norm": 1.046875, "learning_rate": 0.0004657275356191437, "loss": 5.7037, "mean_token_accuracy": 0.1652768522500992, "num_tokens": 3715838.0, "step": 1535 }, { "entropy": 5.938394212722779, "epoch": 0.09901626695814313, "grad_norm": 1.078125, "learning_rate": 0.00046509993026430804, "loss": 5.6596, "mean_token_accuracy": 0.17287949323654175, "num_tokens": 3727605.0, "step": 1540 }, { "entropy": 6.024389791488647, "epoch": 0.09933774834437085, "grad_norm": 1.140625, "learning_rate": 0.0004644671132238558, "loss": 5.7384, "mean_token_accuracy": 0.1638980522751808, "num_tokens": 3739991.0, "step": 1545 }, { "entropy": 6.037438774108887, "epoch": 0.0996592297305986, "grad_norm": 1.1484375, "learning_rate": 0.00046382910184678585, "loss": 5.8098, "mean_token_accuracy": 0.1669749930500984, "num_tokens": 3752175.0, "step": 1550 }, { "entropy": 5.935793876647949, "epoch": 0.09998071111682634, "grad_norm": 1.125, "learning_rate": 0.0004631859136245025, "loss": 5.6979, "mean_token_accuracy": 0.16765902042388917, "num_tokens": 3763505.0, "step": 1555 }, { "entropy": 5.962877321243286, "epoch": 0.10030219250305407, "grad_norm": 1.0390625, "learning_rate": 0.0004625375661903357, "loss": 5.7065, "mean_token_accuracy": 0.17439793795347214, "num_tokens": 3775278.0, "step": 1560 }, { "entropy": 5.958874225616455, "epoch": 0.10062367388928181, "grad_norm": 0.9921875, "learning_rate": 0.00046188407731905787, "loss": 5.696, "mean_token_accuracy": 0.16563132107257844, "num_tokens": 3787100.0, "step": 1565 }, { "entropy": 5.881431341171265, "epoch": 0.10094515527550955, "grad_norm": 1.0625, "learning_rate": 0.00046122546492639643, "loss": 5.6794, "mean_token_accuracy": 0.17307680398225783, "num_tokens": 3798020.0, "step": 1570 }, { "entropy": 5.964326190948486, "epoch": 0.10126663666173728, "grad_norm": 1.0078125, "learning_rate": 0.000460561747068543, "loss": 5.6378, "mean_token_accuracy": 0.17502547353506087, "num_tokens": 3809114.0, "step": 1575 }, { "entropy": 5.958069276809693, "epoch": 0.10158811804796503, "grad_norm": 1.0390625, "learning_rate": 0.0004598929419416578, "loss": 5.726, "mean_token_accuracy": 0.16351143270730972, "num_tokens": 3821065.0, "step": 1580 }, { "entropy": 5.973008537292481, "epoch": 0.10190959943419275, "grad_norm": 1.1328125, "learning_rate": 0.00045921906788137123, "loss": 5.6973, "mean_token_accuracy": 0.16471869349479676, "num_tokens": 3832784.0, "step": 1585 }, { "entropy": 5.910749292373657, "epoch": 0.1022310808204205, "grad_norm": 1.140625, "learning_rate": 0.00045854014336228115, "loss": 5.6468, "mean_token_accuracy": 0.1710452049970627, "num_tokens": 3843746.0, "step": 1590 }, { "entropy": 5.872445678710937, "epoch": 0.10255256220664824, "grad_norm": 1.1015625, "learning_rate": 0.00045785618699744615, "loss": 5.6636, "mean_token_accuracy": 0.1720869243144989, "num_tokens": 3855570.0, "step": 1595 }, { "entropy": 5.9480163097381595, "epoch": 0.10287404359287597, "grad_norm": 1.0859375, "learning_rate": 0.00045716721753787543, "loss": 5.6376, "mean_token_accuracy": 0.16848402619361877, "num_tokens": 3866744.0, "step": 1600 }, { "entropy": 5.955452537536621, "epoch": 0.10319552497910371, "grad_norm": 0.9453125, "learning_rate": 0.0004564732538720148, "loss": 5.7248, "mean_token_accuracy": 0.16833148002624512, "num_tokens": 3879019.0, "step": 1605 }, { "entropy": 5.9315619468688965, "epoch": 0.10351700636533144, "grad_norm": 0.98828125, "learning_rate": 0.00045577431502522877, "loss": 5.7581, "mean_token_accuracy": 0.16690098345279694, "num_tokens": 3892836.0, "step": 1610 }, { "entropy": 6.027340459823608, "epoch": 0.10383848775155918, "grad_norm": 1.015625, "learning_rate": 0.0004550704201592787, "loss": 5.6782, "mean_token_accuracy": 0.168406842648983, "num_tokens": 3905099.0, "step": 1615 }, { "entropy": 5.89118800163269, "epoch": 0.10415996913778693, "grad_norm": 1.0390625, "learning_rate": 0.0004543615885717981, "loss": 5.6785, "mean_token_accuracy": 0.16635265797376633, "num_tokens": 3917044.0, "step": 1620 }, { "entropy": 5.919010496139526, "epoch": 0.10448145052401465, "grad_norm": 1.0625, "learning_rate": 0.00045364783969576296, "loss": 5.6282, "mean_token_accuracy": 0.1762469157576561, "num_tokens": 3928066.0, "step": 1625 }, { "entropy": 5.96668643951416, "epoch": 0.1048029319102424, "grad_norm": 1.0859375, "learning_rate": 0.0004529291930989592, "loss": 5.8176, "mean_token_accuracy": 0.1627002775669098, "num_tokens": 3939969.0, "step": 1630 }, { "entropy": 6.01760630607605, "epoch": 0.10512441329647014, "grad_norm": 1.1171875, "learning_rate": 0.0004522056684834464, "loss": 5.7026, "mean_token_accuracy": 0.17166565954685212, "num_tokens": 3951193.0, "step": 1635 }, { "entropy": 5.8352165699005125, "epoch": 0.10544589468269787, "grad_norm": 1.0078125, "learning_rate": 0.0004514772856850173, "loss": 5.7228, "mean_token_accuracy": 0.17300599217414855, "num_tokens": 3963628.0, "step": 1640 }, { "entropy": 6.032732105255127, "epoch": 0.10576737606892561, "grad_norm": 1.09375, "learning_rate": 0.0004507440646726542, "loss": 5.7151, "mean_token_accuracy": 0.1679761916399002, "num_tokens": 3975692.0, "step": 1645 }, { "entropy": 5.910207986831665, "epoch": 0.10608885745515334, "grad_norm": 0.9375, "learning_rate": 0.0004500060255479818, "loss": 5.6858, "mean_token_accuracy": 0.17569718807935714, "num_tokens": 3987551.0, "step": 1650 }, { "entropy": 5.992750072479248, "epoch": 0.10641033884138108, "grad_norm": 1.046875, "learning_rate": 0.0004492631885447151, "loss": 5.7327, "mean_token_accuracy": 0.16714347451925277, "num_tokens": 3998810.0, "step": 1655 }, { "entropy": 6.0109038829803465, "epoch": 0.10673182022760883, "grad_norm": 1.109375, "learning_rate": 0.00044851557402810616, "loss": 5.7052, "mean_token_accuracy": 0.17118439078330994, "num_tokens": 4009208.0, "step": 1660 }, { "entropy": 5.853578186035156, "epoch": 0.10705330161383655, "grad_norm": 1.15625, "learning_rate": 0.00044776320249438444, "loss": 5.7413, "mean_token_accuracy": 0.1665416806936264, "num_tokens": 4020156.0, "step": 1665 }, { "entropy": 6.052140712738037, "epoch": 0.1073747830000643, "grad_norm": 0.9609375, "learning_rate": 0.00044700609457019565, "loss": 5.69, "mean_token_accuracy": 0.17266564667224885, "num_tokens": 4032530.0, "step": 1670 }, { "entropy": 5.909550714492798, "epoch": 0.10769626438629204, "grad_norm": 1.015625, "learning_rate": 0.0004462442710120359, "loss": 5.6881, "mean_token_accuracy": 0.1665107548236847, "num_tokens": 4045009.0, "step": 1675 }, { "entropy": 5.874087619781494, "epoch": 0.10801774577251977, "grad_norm": 0.87109375, "learning_rate": 0.000445477752705683, "loss": 5.6803, "mean_token_accuracy": 0.18234034329652787, "num_tokens": 4058719.0, "step": 1680 }, { "entropy": 5.9365478515625, "epoch": 0.10833922715874751, "grad_norm": 0.99609375, "learning_rate": 0.00044470656066562336, "loss": 5.6093, "mean_token_accuracy": 0.17888884395360946, "num_tokens": 4070163.0, "step": 1685 }, { "entropy": 5.911435508728028, "epoch": 0.10866070854497524, "grad_norm": 0.984375, "learning_rate": 0.0004439307160344765, "loss": 5.6714, "mean_token_accuracy": 0.17036347985267639, "num_tokens": 4083975.0, "step": 1690 }, { "entropy": 5.889103841781616, "epoch": 0.10898218993120298, "grad_norm": 0.94921875, "learning_rate": 0.00044315024008241473, "loss": 5.6843, "mean_token_accuracy": 0.16422206908464432, "num_tokens": 4096969.0, "step": 1695 }, { "entropy": 5.898795938491821, "epoch": 0.10930367131743073, "grad_norm": 1.09375, "learning_rate": 0.0004423651542065806, "loss": 5.6318, "mean_token_accuracy": 0.17020974308252335, "num_tokens": 4108540.0, "step": 1700 }, { "entropy": 5.957143688201905, "epoch": 0.10962515270365845, "grad_norm": 1.0390625, "learning_rate": 0.00044157547993050006, "loss": 5.7208, "mean_token_accuracy": 0.1688693046569824, "num_tokens": 4121037.0, "step": 1705 }, { "entropy": 5.8640303134918215, "epoch": 0.1099466340898862, "grad_norm": 0.890625, "learning_rate": 0.00044078123890349227, "loss": 5.6641, "mean_token_accuracy": 0.16424248963594437, "num_tokens": 4133950.0, "step": 1710 }, { "entropy": 5.858451509475708, "epoch": 0.11026811547611394, "grad_norm": 1.015625, "learning_rate": 0.00043998245290007606, "loss": 5.5772, "mean_token_accuracy": 0.17258207947015763, "num_tokens": 4147371.0, "step": 1715 }, { "entropy": 6.020438194274902, "epoch": 0.11058959686234167, "grad_norm": 1.1171875, "learning_rate": 0.00043917914381937323, "loss": 5.7849, "mean_token_accuracy": 0.16778419762849808, "num_tokens": 4159431.0, "step": 1720 }, { "entropy": 5.89661283493042, "epoch": 0.11091107824856941, "grad_norm": 1.0234375, "learning_rate": 0.00043837133368450815, "loss": 5.6101, "mean_token_accuracy": 0.17763638794422149, "num_tokens": 4170225.0, "step": 1725 }, { "entropy": 5.895733213424682, "epoch": 0.11123255963479714, "grad_norm": 1.0703125, "learning_rate": 0.0004375590446420037, "loss": 5.6476, "mean_token_accuracy": 0.17097645103931428, "num_tokens": 4182230.0, "step": 1730 }, { "entropy": 5.9664935111999515, "epoch": 0.11155404102102488, "grad_norm": 1.0234375, "learning_rate": 0.0004367422989611743, "loss": 5.7167, "mean_token_accuracy": 0.16534337699413298, "num_tokens": 4193268.0, "step": 1735 }, { "entropy": 5.910691118240356, "epoch": 0.11187552240725263, "grad_norm": 0.9921875, "learning_rate": 0.0004359211190335153, "loss": 5.7288, "mean_token_accuracy": 0.16493058055639268, "num_tokens": 4205916.0, "step": 1740 }, { "entropy": 5.9636599063873295, "epoch": 0.11219700379348035, "grad_norm": 0.95703125, "learning_rate": 0.00043509552737208923, "loss": 5.6866, "mean_token_accuracy": 0.16581161320209503, "num_tokens": 4217447.0, "step": 1745 }, { "entropy": 5.918504953384399, "epoch": 0.1125184851797081, "grad_norm": 1.0078125, "learning_rate": 0.00043426554661090853, "loss": 5.6645, "mean_token_accuracy": 0.17159862965345382, "num_tokens": 4230561.0, "step": 1750 }, { "entropy": 5.978391313552857, "epoch": 0.11283996656593583, "grad_norm": 1.03125, "learning_rate": 0.00043343119950431516, "loss": 5.8399, "mean_token_accuracy": 0.1623585380613804, "num_tokens": 4244640.0, "step": 1755 }, { "entropy": 5.959365892410278, "epoch": 0.11316144795216357, "grad_norm": 1.0390625, "learning_rate": 0.00043259250892635644, "loss": 5.6403, "mean_token_accuracy": 0.176731576025486, "num_tokens": 4256940.0, "step": 1760 }, { "entropy": 5.887542104721069, "epoch": 0.11348292933839131, "grad_norm": 0.95703125, "learning_rate": 0.0004317494978701582, "loss": 5.7198, "mean_token_accuracy": 0.1675652876496315, "num_tokens": 4269972.0, "step": 1765 }, { "entropy": 5.94051947593689, "epoch": 0.11380441072461904, "grad_norm": 1.15625, "learning_rate": 0.0004309021894472943, "loss": 5.6572, "mean_token_accuracy": 0.1695004880428314, "num_tokens": 4281938.0, "step": 1770 }, { "entropy": 5.94478669166565, "epoch": 0.11412589211084678, "grad_norm": 1.0234375, "learning_rate": 0.0004300506068871534, "loss": 5.7405, "mean_token_accuracy": 0.16731222346425056, "num_tokens": 4294164.0, "step": 1775 }, { "entropy": 5.858164119720459, "epoch": 0.11444737349707453, "grad_norm": 1.046875, "learning_rate": 0.00042919477353630135, "loss": 5.569, "mean_token_accuracy": 0.1731950283050537, "num_tokens": 4305542.0, "step": 1780 }, { "entropy": 5.876661157608032, "epoch": 0.11476885488330225, "grad_norm": 1.0546875, "learning_rate": 0.000428334712857842, "loss": 5.5484, "mean_token_accuracy": 0.1760912388563156, "num_tokens": 4315814.0, "step": 1785 }, { "entropy": 5.958914470672608, "epoch": 0.11509033626953, "grad_norm": 1.046875, "learning_rate": 0.00042747044843077304, "loss": 5.7469, "mean_token_accuracy": 0.16798093765974045, "num_tokens": 4327308.0, "step": 1790 }, { "entropy": 6.085859775543213, "epoch": 0.11541181765575773, "grad_norm": 1.015625, "learning_rate": 0.00042660200394934047, "loss": 5.8251, "mean_token_accuracy": 0.1617446556687355, "num_tokens": 4340719.0, "step": 1795 }, { "entropy": 5.871499538421631, "epoch": 0.11573329904198547, "grad_norm": 0.99609375, "learning_rate": 0.00042572940322238844, "loss": 5.622, "mean_token_accuracy": 0.17820285856723786, "num_tokens": 4352529.0, "step": 1800 }, { "entropy": 5.838696050643921, "epoch": 0.11605478042821321, "grad_norm": 1.140625, "learning_rate": 0.00042485267017270664, "loss": 5.627, "mean_token_accuracy": 0.17486343681812286, "num_tokens": 4363859.0, "step": 1805 }, { "entropy": 5.8888983726501465, "epoch": 0.11637626181444094, "grad_norm": 1.1328125, "learning_rate": 0.0004239718288363745, "loss": 5.6055, "mean_token_accuracy": 0.17151245027780532, "num_tokens": 4375297.0, "step": 1810 }, { "entropy": 5.759175539016724, "epoch": 0.11669774320066868, "grad_norm": 1.0390625, "learning_rate": 0.0004230869033621023, "loss": 5.5683, "mean_token_accuracy": 0.17936437129974364, "num_tokens": 4387204.0, "step": 1815 }, { "entropy": 5.944360208511353, "epoch": 0.11701922458689643, "grad_norm": 1.0, "learning_rate": 0.0004221979180105688, "loss": 5.6965, "mean_token_accuracy": 0.16732241064310074, "num_tokens": 4400461.0, "step": 1820 }, { "entropy": 5.893303918838501, "epoch": 0.11734070597312415, "grad_norm": 1.0234375, "learning_rate": 0.00042130489715375645, "loss": 5.6169, "mean_token_accuracy": 0.17313757240772248, "num_tokens": 4413150.0, "step": 1825 }, { "entropy": 5.8112153053283695, "epoch": 0.1176621873593519, "grad_norm": 1.0390625, "learning_rate": 0.00042040786527428335, "loss": 5.6318, "mean_token_accuracy": 0.17437280267477034, "num_tokens": 4424919.0, "step": 1830 }, { "entropy": 5.856292104721069, "epoch": 0.11798366874557963, "grad_norm": 1.125, "learning_rate": 0.0004195068469647315, "loss": 5.5968, "mean_token_accuracy": 0.17334085702896118, "num_tokens": 4437305.0, "step": 1835 }, { "entropy": 5.937565803527832, "epoch": 0.11830515013180737, "grad_norm": 1.0859375, "learning_rate": 0.00041860186692697297, "loss": 5.7008, "mean_token_accuracy": 0.16629609167575837, "num_tokens": 4449121.0, "step": 1840 }, { "entropy": 5.924497175216675, "epoch": 0.11862663151803511, "grad_norm": 1.0703125, "learning_rate": 0.00041769294997149264, "loss": 5.6028, "mean_token_accuracy": 0.17515215873718262, "num_tokens": 4460526.0, "step": 1845 }, { "entropy": 5.912448835372925, "epoch": 0.11894811290426284, "grad_norm": 1.03125, "learning_rate": 0.0004167801210167081, "loss": 5.7183, "mean_token_accuracy": 0.16868967115879058, "num_tokens": 4472852.0, "step": 1850 }, { "entropy": 5.9101356029510494, "epoch": 0.11926959429049058, "grad_norm": 1.140625, "learning_rate": 0.0004158634050882861, "loss": 5.5948, "mean_token_accuracy": 0.17210926860570908, "num_tokens": 4485226.0, "step": 1855 }, { "entropy": 5.802251291275025, "epoch": 0.11959107567671831, "grad_norm": 0.984375, "learning_rate": 0.0004149428273184569, "loss": 5.6473, "mean_token_accuracy": 0.17440788447856903, "num_tokens": 4497441.0, "step": 1860 }, { "entropy": 5.891997289657593, "epoch": 0.11991255706294605, "grad_norm": 1.0390625, "learning_rate": 0.0004140184129453253, "loss": 5.6062, "mean_token_accuracy": 0.17910100221633912, "num_tokens": 4509699.0, "step": 1865 }, { "entropy": 5.926146841049194, "epoch": 0.1202340384491738, "grad_norm": 1.015625, "learning_rate": 0.000413090187312178, "loss": 5.627, "mean_token_accuracy": 0.17063527107238768, "num_tokens": 4521556.0, "step": 1870 }, { "entropy": 5.808397722244263, "epoch": 0.12055551983540153, "grad_norm": 0.98828125, "learning_rate": 0.0004121581758667898, "loss": 5.5079, "mean_token_accuracy": 0.18462960422039032, "num_tokens": 4532734.0, "step": 1875 }, { "entropy": 5.86313910484314, "epoch": 0.12087700122162927, "grad_norm": 1.015625, "learning_rate": 0.00041122240416072533, "loss": 5.625, "mean_token_accuracy": 0.17456342428922653, "num_tokens": 4544614.0, "step": 1880 }, { "entropy": 5.813703775405884, "epoch": 0.12119848260785701, "grad_norm": 1.0625, "learning_rate": 0.0004102828978486385, "loss": 5.4986, "mean_token_accuracy": 0.18180812150239944, "num_tokens": 4555152.0, "step": 1885 }, { "entropy": 5.8646917819976805, "epoch": 0.12151996399408474, "grad_norm": 1.0078125, "learning_rate": 0.0004093396826875695, "loss": 5.6198, "mean_token_accuracy": 0.17630153447389602, "num_tokens": 4568535.0, "step": 1890 }, { "entropy": 5.934072732925415, "epoch": 0.12184144538031248, "grad_norm": 1.0546875, "learning_rate": 0.00040839278453623837, "loss": 5.6782, "mean_token_accuracy": 0.17143154591321946, "num_tokens": 4580741.0, "step": 1895 }, { "entropy": 5.871197080612182, "epoch": 0.12216292676654021, "grad_norm": 1.03125, "learning_rate": 0.0004074422293543363, "loss": 5.6403, "mean_token_accuracy": 0.17499494403600693, "num_tokens": 4592765.0, "step": 1900 }, { "entropy": 5.911958885192871, "epoch": 0.12248440815276795, "grad_norm": 0.9453125, "learning_rate": 0.0004064880432018137, "loss": 5.6881, "mean_token_accuracy": 0.16715567409992219, "num_tokens": 4606140.0, "step": 1905 }, { "entropy": 5.830193710327149, "epoch": 0.1228058895389957, "grad_norm": 1.015625, "learning_rate": 0.00040553025223816615, "loss": 5.5333, "mean_token_accuracy": 0.17858823239803315, "num_tokens": 4618330.0, "step": 1910 }, { "entropy": 5.8352135181427, "epoch": 0.12312737092522343, "grad_norm": 1.03125, "learning_rate": 0.00040456888272171653, "loss": 5.6288, "mean_token_accuracy": 0.1699838399887085, "num_tokens": 4632054.0, "step": 1915 }, { "entropy": 5.927229547500611, "epoch": 0.12344885231145117, "grad_norm": 1.0390625, "learning_rate": 0.00040360396100889577, "loss": 5.5545, "mean_token_accuracy": 0.17679750621318818, "num_tokens": 4643455.0, "step": 1920 }, { "entropy": 5.791709327697754, "epoch": 0.12377033369767891, "grad_norm": 0.9921875, "learning_rate": 0.0004026355135535202, "loss": 5.5401, "mean_token_accuracy": 0.18370288759469985, "num_tokens": 4654847.0, "step": 1925 }, { "entropy": 5.728792953491211, "epoch": 0.12409181508390664, "grad_norm": 1.09375, "learning_rate": 0.000401663566906066, "loss": 5.5198, "mean_token_accuracy": 0.17564617097377777, "num_tokens": 4666470.0, "step": 1930 }, { "entropy": 5.888561820983886, "epoch": 0.12441329647013438, "grad_norm": 1.0, "learning_rate": 0.00040068814771294134, "loss": 5.6093, "mean_token_accuracy": 0.16564541310071945, "num_tokens": 4678170.0, "step": 1935 }, { "entropy": 5.820088195800781, "epoch": 0.12473477785636211, "grad_norm": 1.046875, "learning_rate": 0.0003997092827157562, "loss": 5.5675, "mean_token_accuracy": 0.1804538369178772, "num_tokens": 4689566.0, "step": 1940 }, { "entropy": 5.852392339706421, "epoch": 0.12505625924258987, "grad_norm": 1.015625, "learning_rate": 0.000398726998750589, "loss": 5.6228, "mean_token_accuracy": 0.17476158291101457, "num_tokens": 4701435.0, "step": 1945 }, { "entropy": 5.866113948822021, "epoch": 0.1253777406288176, "grad_norm": 1.0390625, "learning_rate": 0.00039774132274725076, "loss": 5.6331, "mean_token_accuracy": 0.16894355714321135, "num_tokens": 4712967.0, "step": 1950 }, { "entropy": 5.777560710906982, "epoch": 0.12569922201504533, "grad_norm": 0.94921875, "learning_rate": 0.00039675228172854707, "loss": 5.5104, "mean_token_accuracy": 0.1788500264286995, "num_tokens": 4726069.0, "step": 1955 }, { "entropy": 5.858283996582031, "epoch": 0.12602070340127305, "grad_norm": 1.0625, "learning_rate": 0.0003957599028095371, "loss": 5.6574, "mean_token_accuracy": 0.1739150106906891, "num_tokens": 4738152.0, "step": 1960 }, { "entropy": 5.825857877731323, "epoch": 0.1263421847875008, "grad_norm": 1.1171875, "learning_rate": 0.00039476421319679017, "loss": 5.5468, "mean_token_accuracy": 0.18615946024656296, "num_tokens": 4749534.0, "step": 1965 }, { "entropy": 5.84704909324646, "epoch": 0.12666366617372854, "grad_norm": 1.015625, "learning_rate": 0.00039376524018764, "loss": 5.6463, "mean_token_accuracy": 0.17194101214408875, "num_tokens": 4762366.0, "step": 1970 }, { "entropy": 5.774642133712769, "epoch": 0.12698514755995627, "grad_norm": 1.0625, "learning_rate": 0.00039276301116943616, "loss": 5.4578, "mean_token_accuracy": 0.18943510353565216, "num_tokens": 4773179.0, "step": 1975 }, { "entropy": 5.831448745727539, "epoch": 0.12730662894618403, "grad_norm": 0.9765625, "learning_rate": 0.0003917575536187936, "loss": 5.5963, "mean_token_accuracy": 0.1808122232556343, "num_tokens": 4785558.0, "step": 1980 }, { "entropy": 5.8009332656860355, "epoch": 0.12762811033241175, "grad_norm": 1.1328125, "learning_rate": 0.00039074889510083894, "loss": 5.4533, "mean_token_accuracy": 0.18390973210334777, "num_tokens": 4797091.0, "step": 1985 }, { "entropy": 5.769080257415771, "epoch": 0.12794959171863948, "grad_norm": 1.234375, "learning_rate": 0.00038973706326845495, "loss": 5.5238, "mean_token_accuracy": 0.1799728289246559, "num_tokens": 4808797.0, "step": 1990 }, { "entropy": 5.878709316253662, "epoch": 0.12827107310486724, "grad_norm": 1.0859375, "learning_rate": 0.0003887220858615225, "loss": 5.6114, "mean_token_accuracy": 0.1800337553024292, "num_tokens": 4820478.0, "step": 1995 }, { "entropy": 5.8096688747406, "epoch": 0.12859255449109497, "grad_norm": 1.125, "learning_rate": 0.0003877039907061597, "loss": 5.6022, "mean_token_accuracy": 0.17257340848445893, "num_tokens": 4831844.0, "step": 2000 }, { "entropy": 5.919677352905273, "epoch": 0.1289140358773227, "grad_norm": 1.1953125, "learning_rate": 0.0003866828057139598, "loss": 5.5825, "mean_token_accuracy": 0.17797942608594894, "num_tokens": 4842288.0, "step": 2005 }, { "entropy": 5.872733688354492, "epoch": 0.12923551726355045, "grad_norm": 0.984375, "learning_rate": 0.00038565855888122503, "loss": 5.7411, "mean_token_accuracy": 0.17056984454393387, "num_tokens": 4853948.0, "step": 2010 }, { "entropy": 5.858399724960327, "epoch": 0.12955699864977818, "grad_norm": 1.078125, "learning_rate": 0.00038463127828819975, "loss": 5.6022, "mean_token_accuracy": 0.16876842379570006, "num_tokens": 4866362.0, "step": 2015 }, { "entropy": 5.878206729888916, "epoch": 0.1298784800360059, "grad_norm": 1.140625, "learning_rate": 0.00038360099209830043, "loss": 5.5798, "mean_token_accuracy": 0.1781992644071579, "num_tokens": 4879210.0, "step": 2020 }, { "entropy": 5.840360450744629, "epoch": 0.13019996142223364, "grad_norm": 1.1328125, "learning_rate": 0.0003825677285573433, "loss": 5.5631, "mean_token_accuracy": 0.17579235881567, "num_tokens": 4889902.0, "step": 2025 }, { "entropy": 5.75586519241333, "epoch": 0.1305214428084614, "grad_norm": 1.0546875, "learning_rate": 0.00038153151599277027, "loss": 5.4272, "mean_token_accuracy": 0.18684688210487366, "num_tokens": 4901397.0, "step": 2030 }, { "entropy": 5.7365635395050045, "epoch": 0.13084292419468913, "grad_norm": 1.21875, "learning_rate": 0.0003804923828128723, "loss": 5.4988, "mean_token_accuracy": 0.18069776743650437, "num_tokens": 4913696.0, "step": 2035 }, { "entropy": 5.874265050888061, "epoch": 0.13116440558091685, "grad_norm": 0.9765625, "learning_rate": 0.0003794503575060104, "loss": 5.6402, "mean_token_accuracy": 0.17227176576852798, "num_tokens": 4926791.0, "step": 2040 }, { "entropy": 5.704010343551635, "epoch": 0.1314858869671446, "grad_norm": 1.0, "learning_rate": 0.00037840546863983484, "loss": 5.4826, "mean_token_accuracy": 0.1833141714334488, "num_tokens": 4939351.0, "step": 2045 }, { "entropy": 5.826752424240112, "epoch": 0.13180736835337234, "grad_norm": 1.03125, "learning_rate": 0.0003773577448605015, "loss": 5.5714, "mean_token_accuracy": 0.17286380082368852, "num_tokens": 4950917.0, "step": 2050 }, { "entropy": 5.838059997558593, "epoch": 0.13212884973960007, "grad_norm": 1.0390625, "learning_rate": 0.0003763072148918872, "loss": 5.4334, "mean_token_accuracy": 0.18617289364337922, "num_tokens": 4961893.0, "step": 2055 }, { "entropy": 5.793173170089721, "epoch": 0.13245033112582782, "grad_norm": 1.078125, "learning_rate": 0.0003752539075348017, "loss": 5.6416, "mean_token_accuracy": 0.17536002174019813, "num_tokens": 4973444.0, "step": 2060 }, { "entropy": 5.7246537685394285, "epoch": 0.13277181251205555, "grad_norm": 1.03125, "learning_rate": 0.00037419785166619817, "loss": 5.4548, "mean_token_accuracy": 0.1816334158182144, "num_tokens": 4985747.0, "step": 2065 }, { "entropy": 5.820780515670776, "epoch": 0.13309329389828328, "grad_norm": 1.09375, "learning_rate": 0.0003731390762383818, "loss": 5.5141, "mean_token_accuracy": 0.18240729123353958, "num_tokens": 4996913.0, "step": 2070 }, { "entropy": 5.843408203125, "epoch": 0.13341477528451104, "grad_norm": 0.96484375, "learning_rate": 0.0003720776102782158, "loss": 5.6422, "mean_token_accuracy": 0.17854170948266984, "num_tokens": 5009047.0, "step": 2075 }, { "entropy": 5.83007435798645, "epoch": 0.13373625667073877, "grad_norm": 0.9921875, "learning_rate": 0.00037101348288632555, "loss": 5.6189, "mean_token_accuracy": 0.17441239804029465, "num_tokens": 5022510.0, "step": 2080 }, { "entropy": 5.867375993728638, "epoch": 0.1340577380569665, "grad_norm": 1.09375, "learning_rate": 0.0003699467232363012, "loss": 5.5291, "mean_token_accuracy": 0.17958373576402664, "num_tokens": 5032764.0, "step": 2085 }, { "entropy": 5.757033014297486, "epoch": 0.13437921944319423, "grad_norm": 1.0078125, "learning_rate": 0.0003688773605738973, "loss": 5.544, "mean_token_accuracy": 0.1788751170039177, "num_tokens": 5045527.0, "step": 2090 }, { "entropy": 5.856579065322876, "epoch": 0.13470070082942198, "grad_norm": 0.98828125, "learning_rate": 0.00036780542421623134, "loss": 5.6033, "mean_token_accuracy": 0.1763172432780266, "num_tokens": 5058521.0, "step": 2095 }, { "entropy": 5.742293071746826, "epoch": 0.1350221822156497, "grad_norm": 1.1015625, "learning_rate": 0.0003667309435509802, "loss": 5.4872, "mean_token_accuracy": 0.1765799954533577, "num_tokens": 5071261.0, "step": 2100 }, { "entropy": 5.828065490722656, "epoch": 0.13534366360187744, "grad_norm": 0.9921875, "learning_rate": 0.0003656539480355741, "loss": 5.5371, "mean_token_accuracy": 0.17912457138299942, "num_tokens": 5084214.0, "step": 2105 }, { "entropy": 5.722700548171997, "epoch": 0.1356651449881052, "grad_norm": 1.015625, "learning_rate": 0.0003645744671963891, "loss": 5.4465, "mean_token_accuracy": 0.1847703978419304, "num_tokens": 5095124.0, "step": 2110 }, { "entropy": 5.777438449859619, "epoch": 0.13598662637433293, "grad_norm": 1.0546875, "learning_rate": 0.0003634925306279376, "loss": 5.4986, "mean_token_accuracy": 0.18323094844818116, "num_tokens": 5107563.0, "step": 2115 }, { "entropy": 5.89500994682312, "epoch": 0.13630810776056065, "grad_norm": 0.99609375, "learning_rate": 0.0003624081679920574, "loss": 5.6492, "mean_token_accuracy": 0.17285479754209518, "num_tokens": 5120170.0, "step": 2120 }, { "entropy": 5.830893707275391, "epoch": 0.1366295891467884, "grad_norm": 1.078125, "learning_rate": 0.0003613214090170977, "loss": 5.5751, "mean_token_accuracy": 0.17507488578557967, "num_tokens": 5133273.0, "step": 2125 }, { "entropy": 5.836175107955933, "epoch": 0.13695107053301614, "grad_norm": 1.015625, "learning_rate": 0.0003602322834971048, "loss": 5.517, "mean_token_accuracy": 0.1816059961915016, "num_tokens": 5143975.0, "step": 2130 }, { "entropy": 5.773233890533447, "epoch": 0.13727255191924387, "grad_norm": 1.03125, "learning_rate": 0.0003591408212910051, "loss": 5.5724, "mean_token_accuracy": 0.1769774705171585, "num_tokens": 5156924.0, "step": 2135 }, { "entropy": 5.878602504730225, "epoch": 0.13759403330547162, "grad_norm": 1.1640625, "learning_rate": 0.0003580470523217863, "loss": 5.5706, "mean_token_accuracy": 0.18045302480459213, "num_tokens": 5168639.0, "step": 2140 }, { "entropy": 5.906446743011474, "epoch": 0.13791551469169935, "grad_norm": 1.03125, "learning_rate": 0.0003569510065756771, "loss": 5.5815, "mean_token_accuracy": 0.17343540787696837, "num_tokens": 5180657.0, "step": 2145 }, { "entropy": 5.691700077056884, "epoch": 0.13823699607792708, "grad_norm": 0.98828125, "learning_rate": 0.0003558527141013254, "loss": 5.4185, "mean_token_accuracy": 0.19074572175741195, "num_tokens": 5193228.0, "step": 2150 }, { "entropy": 5.75026216506958, "epoch": 0.13855847746415484, "grad_norm": 1.125, "learning_rate": 0.0003547522050089742, "loss": 5.4512, "mean_token_accuracy": 0.18468687683343887, "num_tokens": 5204033.0, "step": 2155 }, { "entropy": 5.78372540473938, "epoch": 0.13887995885038257, "grad_norm": 0.98046875, "learning_rate": 0.00035364950946963606, "loss": 5.4935, "mean_token_accuracy": 0.18386655300855637, "num_tokens": 5215648.0, "step": 2160 }, { "entropy": 5.642017412185669, "epoch": 0.1392014402366103, "grad_norm": 1.015625, "learning_rate": 0.0003525446577142663, "loss": 5.4377, "mean_token_accuracy": 0.18879669159650803, "num_tokens": 5227222.0, "step": 2165 }, { "entropy": 5.773434734344482, "epoch": 0.13952292162283803, "grad_norm": 1.15625, "learning_rate": 0.00035143768003293395, "loss": 5.5372, "mean_token_accuracy": 0.1755597859621048, "num_tokens": 5239471.0, "step": 2170 }, { "entropy": 5.804629898071289, "epoch": 0.13984440300906578, "grad_norm": 0.96875, "learning_rate": 0.0003503286067739913, "loss": 5.5917, "mean_token_accuracy": 0.18128340542316437, "num_tokens": 5251824.0, "step": 2175 }, { "entropy": 5.975850200653076, "epoch": 0.1401658843952935, "grad_norm": 1.0234375, "learning_rate": 0.00034921746834324193, "loss": 5.6202, "mean_token_accuracy": 0.17198764234781266, "num_tokens": 5263868.0, "step": 2180 }, { "entropy": 5.762776851654053, "epoch": 0.14048736578152124, "grad_norm": 1.046875, "learning_rate": 0.0003481042952031072, "loss": 5.4968, "mean_token_accuracy": 0.18749105483293532, "num_tokens": 5275850.0, "step": 2185 }, { "entropy": 5.784327030181885, "epoch": 0.140808847167749, "grad_norm": 1.0390625, "learning_rate": 0.0003469891178717911, "loss": 5.5442, "mean_token_accuracy": 0.18206566125154494, "num_tokens": 5287802.0, "step": 2190 }, { "entropy": 5.898681354522705, "epoch": 0.14113032855397672, "grad_norm": 1.0859375, "learning_rate": 0.0003458719669224436, "loss": 5.6004, "mean_token_accuracy": 0.17990543842315673, "num_tokens": 5299175.0, "step": 2195 }, { "entropy": 5.780115461349487, "epoch": 0.14145180994020445, "grad_norm": 1.1015625, "learning_rate": 0.0003447528729823221, "loss": 5.5065, "mean_token_accuracy": 0.18278697282075881, "num_tokens": 5312817.0, "step": 2200 }, { "entropy": 5.799724388122558, "epoch": 0.1417732913264322, "grad_norm": 0.98046875, "learning_rate": 0.0003436318667319525, "loss": 5.5411, "mean_token_accuracy": 0.17945564091205596, "num_tokens": 5324342.0, "step": 2205 }, { "entropy": 5.73377366065979, "epoch": 0.14209477271265994, "grad_norm": 0.921875, "learning_rate": 0.00034250897890428716, "loss": 5.5726, "mean_token_accuracy": 0.18047667294740677, "num_tokens": 5338285.0, "step": 2210 }, { "entropy": 5.805589962005615, "epoch": 0.14241625409888767, "grad_norm": 1.1171875, "learning_rate": 0.0003413842402838633, "loss": 5.4702, "mean_token_accuracy": 0.18539964705705642, "num_tokens": 5349366.0, "step": 2215 }, { "entropy": 5.857856798171997, "epoch": 0.14273773548511542, "grad_norm": 0.98046875, "learning_rate": 0.00034025768170595834, "loss": 5.5252, "mean_token_accuracy": 0.17573347240686416, "num_tokens": 5361625.0, "step": 2220 }, { "entropy": 5.753371334075927, "epoch": 0.14305921687134315, "grad_norm": 0.96875, "learning_rate": 0.0003391293340557446, "loss": 5.4823, "mean_token_accuracy": 0.19018028378486634, "num_tokens": 5373546.0, "step": 2225 }, { "entropy": 5.79620246887207, "epoch": 0.14338069825757088, "grad_norm": 1.171875, "learning_rate": 0.0003379992282674431, "loss": 5.4999, "mean_token_accuracy": 0.17952882945537568, "num_tokens": 5384949.0, "step": 2230 }, { "entropy": 5.787704944610596, "epoch": 0.1437021796437986, "grad_norm": 1.0, "learning_rate": 0.0003368673953234749, "loss": 5.5081, "mean_token_accuracy": 0.17685756981372833, "num_tokens": 5398436.0, "step": 2235 }, { "entropy": 5.752358722686767, "epoch": 0.14402366103002637, "grad_norm": 1.0546875, "learning_rate": 0.00033573386625361176, "loss": 5.5063, "mean_token_accuracy": 0.18653873801231385, "num_tokens": 5410382.0, "step": 2240 }, { "entropy": 5.776981163024902, "epoch": 0.1443451424162541, "grad_norm": 0.98828125, "learning_rate": 0.00033459867213412567, "loss": 5.4852, "mean_token_accuracy": 0.18849310427904128, "num_tokens": 5422964.0, "step": 2245 }, { "entropy": 5.776259326934815, "epoch": 0.14466662380248183, "grad_norm": 1.03125, "learning_rate": 0.000333461844086937, "loss": 5.5186, "mean_token_accuracy": 0.18011581003665925, "num_tokens": 5434071.0, "step": 2250 }, { "entropy": 5.799129438400269, "epoch": 0.14498810518870958, "grad_norm": 0.96875, "learning_rate": 0.00033232341327876097, "loss": 5.4723, "mean_token_accuracy": 0.1915254294872284, "num_tokens": 5444868.0, "step": 2255 }, { "entropy": 5.70671238899231, "epoch": 0.1453095865749373, "grad_norm": 1.0546875, "learning_rate": 0.0003311834109202531, "loss": 5.464, "mean_token_accuracy": 0.17862757444381713, "num_tokens": 5457110.0, "step": 2260 }, { "entropy": 5.701373052597046, "epoch": 0.14563106796116504, "grad_norm": 1.0234375, "learning_rate": 0.00033004186826515416, "loss": 5.3783, "mean_token_accuracy": 0.18717634528875352, "num_tokens": 5467699.0, "step": 2265 }, { "entropy": 5.828847599029541, "epoch": 0.1459525493473928, "grad_norm": 0.9921875, "learning_rate": 0.0003288988166094324, "loss": 5.5679, "mean_token_accuracy": 0.18301764577627183, "num_tokens": 5479224.0, "step": 2270 }, { "entropy": 5.806013059616089, "epoch": 0.14627403073362052, "grad_norm": 1.109375, "learning_rate": 0.00032775428729042656, "loss": 5.4358, "mean_token_accuracy": 0.1843643754720688, "num_tokens": 5491108.0, "step": 2275 }, { "entropy": 5.745375919342041, "epoch": 0.14659551211984825, "grad_norm": 1.0078125, "learning_rate": 0.000326608311685986, "loss": 5.4586, "mean_token_accuracy": 0.18050407618284225, "num_tokens": 5503794.0, "step": 2280 }, { "entropy": 5.763010025024414, "epoch": 0.146916993506076, "grad_norm": 1.1328125, "learning_rate": 0.0003254609212136108, "loss": 5.5078, "mean_token_accuracy": 0.1771639108657837, "num_tokens": 5515307.0, "step": 2285 }, { "entropy": 5.75267653465271, "epoch": 0.14723847489230374, "grad_norm": 1.1171875, "learning_rate": 0.00032431214732959036, "loss": 5.4366, "mean_token_accuracy": 0.18485282659530639, "num_tokens": 5527279.0, "step": 2290 }, { "entropy": 5.822976732254029, "epoch": 0.14755995627853147, "grad_norm": 1.0859375, "learning_rate": 0.000323162021528141, "loss": 5.4664, "mean_token_accuracy": 0.18673109114170075, "num_tokens": 5537732.0, "step": 2295 }, { "entropy": 5.692873430252075, "epoch": 0.1478814376647592, "grad_norm": 0.984375, "learning_rate": 0.00032201057534054264, "loss": 5.5275, "mean_token_accuracy": 0.18040425479412078, "num_tokens": 5549770.0, "step": 2300 }, { "entropy": 5.742526388168335, "epoch": 0.14820291905098695, "grad_norm": 1.0546875, "learning_rate": 0.00032085784033427414, "loss": 5.4671, "mean_token_accuracy": 0.1811862215399742, "num_tokens": 5561295.0, "step": 2305 }, { "entropy": 5.7422816276550295, "epoch": 0.14852440043721468, "grad_norm": 1.1015625, "learning_rate": 0.0003197038481121478, "loss": 5.4238, "mean_token_accuracy": 0.18678140938282012, "num_tokens": 5573560.0, "step": 2310 }, { "entropy": 5.710636758804322, "epoch": 0.1488458818234424, "grad_norm": 0.93359375, "learning_rate": 0.0003185486303114436, "loss": 5.5006, "mean_token_accuracy": 0.1786792904138565, "num_tokens": 5585599.0, "step": 2315 }, { "entropy": 5.813146781921387, "epoch": 0.14916736320967017, "grad_norm": 1.0625, "learning_rate": 0.0003173922186030409, "loss": 5.5171, "mean_token_accuracy": 0.18085834383964539, "num_tokens": 5597229.0, "step": 2320 }, { "entropy": 5.760472679138184, "epoch": 0.1494888445958979, "grad_norm": 1.0546875, "learning_rate": 0.000316234644690551, "loss": 5.5202, "mean_token_accuracy": 0.1810265526175499, "num_tokens": 5609233.0, "step": 2325 }, { "entropy": 5.704453706741333, "epoch": 0.14981032598212563, "grad_norm": 1.0, "learning_rate": 0.0003150759403094473, "loss": 5.4332, "mean_token_accuracy": 0.1881174549460411, "num_tokens": 5621557.0, "step": 2330 }, { "entropy": 5.765605020523071, "epoch": 0.15013180736835338, "grad_norm": 1.0703125, "learning_rate": 0.00031391613722619587, "loss": 5.5073, "mean_token_accuracy": 0.1858796000480652, "num_tokens": 5632661.0, "step": 2335 }, { "entropy": 5.725235271453857, "epoch": 0.1504532887545811, "grad_norm": 1.03125, "learning_rate": 0.000312755267237384, "loss": 5.4224, "mean_token_accuracy": 0.18897470086812973, "num_tokens": 5643904.0, "step": 2340 }, { "entropy": 5.719667053222656, "epoch": 0.15077477014080884, "grad_norm": 1.0390625, "learning_rate": 0.0003115933621688488, "loss": 5.3622, "mean_token_accuracy": 0.19180522561073304, "num_tokens": 5655099.0, "step": 2345 }, { "entropy": 5.694875764846802, "epoch": 0.1510962515270366, "grad_norm": 0.953125, "learning_rate": 0.00031043045387480487, "loss": 5.4741, "mean_token_accuracy": 0.18500417172908784, "num_tokens": 5669107.0, "step": 2350 }, { "entropy": 5.850914573669433, "epoch": 0.15141773291326432, "grad_norm": 1.171875, "learning_rate": 0.0003092665742369703, "loss": 5.527, "mean_token_accuracy": 0.1840333580970764, "num_tokens": 5679889.0, "step": 2355 }, { "entropy": 5.680944347381592, "epoch": 0.15173921429949205, "grad_norm": 1.046875, "learning_rate": 0.00030810175516369343, "loss": 5.4678, "mean_token_accuracy": 0.18365078866481782, "num_tokens": 5692779.0, "step": 2360 }, { "entropy": 5.853222942352295, "epoch": 0.1520606956857198, "grad_norm": 1.0625, "learning_rate": 0.0003069360285890775, "loss": 5.5623, "mean_token_accuracy": 0.18162844628095626, "num_tokens": 5704012.0, "step": 2365 }, { "entropy": 5.825670146942139, "epoch": 0.15238217707194754, "grad_norm": 1.078125, "learning_rate": 0.00030576942647210547, "loss": 5.5856, "mean_token_accuracy": 0.18198317289352417, "num_tokens": 5716863.0, "step": 2370 }, { "entropy": 5.768058156967163, "epoch": 0.15270365845817527, "grad_norm": 1.0625, "learning_rate": 0.00030460198079576355, "loss": 5.4689, "mean_token_accuracy": 0.18682965785264968, "num_tokens": 5729237.0, "step": 2375 }, { "entropy": 5.820621395111084, "epoch": 0.153025139844403, "grad_norm": 1.171875, "learning_rate": 0.0003034337235661648, "loss": 5.4814, "mean_token_accuracy": 0.18316928297281265, "num_tokens": 5741117.0, "step": 2380 }, { "entropy": 5.730013799667359, "epoch": 0.15334662123063075, "grad_norm": 1.09375, "learning_rate": 0.0003022646868116714, "loss": 5.5308, "mean_token_accuracy": 0.18377971053123474, "num_tokens": 5752290.0, "step": 2385 }, { "entropy": 5.798203802108764, "epoch": 0.15366810261685848, "grad_norm": 1.0859375, "learning_rate": 0.0003010949025820163, "loss": 5.4525, "mean_token_accuracy": 0.19051013588905336, "num_tokens": 5764936.0, "step": 2390 }, { "entropy": 5.646590757369995, "epoch": 0.1539895840030862, "grad_norm": 1.0, "learning_rate": 0.0002999244029474252, "loss": 5.3973, "mean_token_accuracy": 0.19195785075426103, "num_tokens": 5777179.0, "step": 2395 }, { "entropy": 5.7870406150817875, "epoch": 0.15431106538931397, "grad_norm": 1.078125, "learning_rate": 0.00029875321999773684, "loss": 5.5314, "mean_token_accuracy": 0.1770056590437889, "num_tokens": 5788840.0, "step": 2400 }, { "entropy": 5.711698436737061, "epoch": 0.1546325467755417, "grad_norm": 1.0546875, "learning_rate": 0.00029758138584152333, "loss": 5.4395, "mean_token_accuracy": 0.18638285249471664, "num_tokens": 5800614.0, "step": 2405 }, { "entropy": 5.702682018280029, "epoch": 0.15495402816176942, "grad_norm": 0.953125, "learning_rate": 0.0002964089326052102, "loss": 5.3987, "mean_token_accuracy": 0.1937675043940544, "num_tokens": 5812293.0, "step": 2410 }, { "entropy": 5.730542373657227, "epoch": 0.15527550954799718, "grad_norm": 1.0625, "learning_rate": 0.0002952358924321949, "loss": 5.4695, "mean_token_accuracy": 0.18649707436561586, "num_tokens": 5823308.0, "step": 2415 }, { "entropy": 5.675483322143554, "epoch": 0.1555969909342249, "grad_norm": 1.0546875, "learning_rate": 0.00029406229748196657, "loss": 5.3871, "mean_token_accuracy": 0.18851224035024644, "num_tokens": 5836259.0, "step": 2420 }, { "entropy": 5.658445405960083, "epoch": 0.15591847232045264, "grad_norm": 1.0859375, "learning_rate": 0.0002928881799292235, "loss": 5.3248, "mean_token_accuracy": 0.19337240010499954, "num_tokens": 5848261.0, "step": 2425 }, { "entropy": 5.733229446411133, "epoch": 0.1562399537066804, "grad_norm": 1.0546875, "learning_rate": 0.00029171357196299154, "loss": 5.3978, "mean_token_accuracy": 0.20093960613012313, "num_tokens": 5859534.0, "step": 2430 }, { "entropy": 5.70960545539856, "epoch": 0.15656143509290812, "grad_norm": 1.0546875, "learning_rate": 0.0002905385057857414, "loss": 5.5448, "mean_token_accuracy": 0.1782195284962654, "num_tokens": 5873765.0, "step": 2435 }, { "entropy": 5.8176521301269535, "epoch": 0.15688291647913585, "grad_norm": 1.171875, "learning_rate": 0.0002893630136125058, "loss": 5.5264, "mean_token_accuracy": 0.17921065986156465, "num_tokens": 5884865.0, "step": 2440 }, { "entropy": 5.692349100112915, "epoch": 0.15720439786536358, "grad_norm": 1.078125, "learning_rate": 0.0002881871276699967, "loss": 5.4017, "mean_token_accuracy": 0.19409674108028413, "num_tokens": 5896364.0, "step": 2445 }, { "entropy": 5.628628826141357, "epoch": 0.15752587925159134, "grad_norm": 1.0078125, "learning_rate": 0.00028701088019572114, "loss": 5.3224, "mean_token_accuracy": 0.1953787237405777, "num_tokens": 5907605.0, "step": 2450 }, { "entropy": 5.750797414779663, "epoch": 0.15784736063781907, "grad_norm": 1.0234375, "learning_rate": 0.0002858343034370977, "loss": 5.4426, "mean_token_accuracy": 0.19289697110652923, "num_tokens": 5919018.0, "step": 2455 }, { "entropy": 5.688705921173096, "epoch": 0.1581688420240468, "grad_norm": 1.0703125, "learning_rate": 0.00028465742965057267, "loss": 5.4072, "mean_token_accuracy": 0.1973178803920746, "num_tokens": 5930821.0, "step": 2460 }, { "entropy": 5.699823617935181, "epoch": 0.15849032341027455, "grad_norm": 0.96875, "learning_rate": 0.00028348029110073533, "loss": 5.4522, "mean_token_accuracy": 0.18845292925834656, "num_tokens": 5944101.0, "step": 2465 }, { "entropy": 5.876083564758301, "epoch": 0.15881180479650228, "grad_norm": 0.8984375, "learning_rate": 0.00028230292005943365, "loss": 5.5191, "mean_token_accuracy": 0.17925772368907927, "num_tokens": 5955728.0, "step": 2470 }, { "entropy": 5.74138240814209, "epoch": 0.15913328618273, "grad_norm": 1.1015625, "learning_rate": 0.00028112534880488945, "loss": 5.3934, "mean_token_accuracy": 0.19208399653434755, "num_tokens": 5968479.0, "step": 2475 }, { "entropy": 5.646874475479126, "epoch": 0.15945476756895777, "grad_norm": 0.98046875, "learning_rate": 0.0002799476096208137, "loss": 5.372, "mean_token_accuracy": 0.19051045328378677, "num_tokens": 5981093.0, "step": 2480 }, { "entropy": 5.7319427013397215, "epoch": 0.1597762489551855, "grad_norm": 1.015625, "learning_rate": 0.00027876973479552087, "loss": 5.4665, "mean_token_accuracy": 0.1835111767053604, "num_tokens": 5993199.0, "step": 2485 }, { "entropy": 5.79546012878418, "epoch": 0.16009773034141322, "grad_norm": 1.09375, "learning_rate": 0.00027759175662104424, "loss": 5.5146, "mean_token_accuracy": 0.18165112733840943, "num_tokens": 6006612.0, "step": 2490 }, { "entropy": 5.73551115989685, "epoch": 0.16041921172764098, "grad_norm": 1.0078125, "learning_rate": 0.0002764137073922508, "loss": 5.4227, "mean_token_accuracy": 0.19056462049484252, "num_tokens": 6019080.0, "step": 2495 }, { "entropy": 5.7126837253570555, "epoch": 0.1607406931138687, "grad_norm": 1.0703125, "learning_rate": 0.00027523561940595505, "loss": 5.4349, "mean_token_accuracy": 0.1902421310544014, "num_tokens": 6030566.0, "step": 2500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1364197064048640.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }