{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03214813862277374, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.742568206787109, "epoch": 0.00032148138622773744, "grad_norm": 4.65625, "learning_rate": 2e-06, "loss": 10.8036, "mean_token_accuracy": 0.0, "num_tokens": 12742.0, "step": 5 }, { "entropy": 10.742579936981201, "epoch": 0.0006429627724554749, "grad_norm": 4.53125, "learning_rate": 4.5e-06, "loss": 10.7869, "mean_token_accuracy": 0.0002144496247638017, "num_tokens": 24140.0, "step": 10 }, { "entropy": 10.742603588104249, "epoch": 0.0009644441586832123, "grad_norm": 4.90625, "learning_rate": 7e-06, "loss": 10.7587, "mean_token_accuracy": 0.00010395010467618704, "num_tokens": 35301.0, "step": 15 }, { "entropy": 10.742618370056153, "epoch": 0.0012859255449109497, "grad_norm": 4.84375, "learning_rate": 9.5e-06, "loss": 10.7259, "mean_token_accuracy": 8.291873964481056e-05, "num_tokens": 47594.0, "step": 20 }, { "entropy": 10.742617893218995, "epoch": 0.001607406931138687, "grad_norm": 4.5, "learning_rate": 1.2e-05, "loss": 10.6444, "mean_token_accuracy": 0.0009544001193717122, "num_tokens": 60157.0, "step": 25 }, { "entropy": 10.742464923858643, "epoch": 0.0019288883173664245, "grad_norm": 3.90625, "learning_rate": 1.4500000000000002e-05, "loss": 10.5219, "mean_token_accuracy": 0.008633292093873025, "num_tokens": 71681.0, "step": 30 }, { "entropy": 10.741884708404541, "epoch": 0.002250369703594162, "grad_norm": 3.015625, "learning_rate": 1.7000000000000003e-05, "loss": 10.4068, "mean_token_accuracy": 0.022283684648573398, "num_tokens": 84059.0, "step": 35 }, { "entropy": 10.740736961364746, "epoch": 0.0025718510898218995, "grad_norm": 2.53125, "learning_rate": 1.95e-05, "loss": 10.2636, "mean_token_accuracy": 0.029509490355849266, "num_tokens": 95765.0, "step": 40 }, { "entropy": 10.739063930511474, "epoch": 0.0028933324760496365, "grad_norm": 2.140625, "learning_rate": 2.2e-05, "loss": 10.1737, "mean_token_accuracy": 0.033080863580107686, "num_tokens": 108095.0, "step": 45 }, { "entropy": 10.738058280944824, "epoch": 0.003214813862277374, "grad_norm": 2.078125, "learning_rate": 2.4500000000000003e-05, "loss": 10.0966, "mean_token_accuracy": 0.03380006831139326, "num_tokens": 120722.0, "step": 50 }, { "entropy": 10.73799819946289, "epoch": 0.0035362952485051115, "grad_norm": 1.9921875, "learning_rate": 2.7e-05, "loss": 10.006, "mean_token_accuracy": 0.03798699378967285, "num_tokens": 132684.0, "step": 55 }, { "entropy": 10.73742036819458, "epoch": 0.003857776634732849, "grad_norm": 1.90625, "learning_rate": 2.95e-05, "loss": 9.9558, "mean_token_accuracy": 0.03450928349047899, "num_tokens": 143940.0, "step": 60 }, { "entropy": 10.736388874053954, "epoch": 0.0041792580209605865, "grad_norm": 1.796875, "learning_rate": 3.2e-05, "loss": 9.9101, "mean_token_accuracy": 0.04125991053879261, "num_tokens": 156206.0, "step": 65 }, { "entropy": 10.73477258682251, "epoch": 0.004500739407188324, "grad_norm": 1.8359375, "learning_rate": 3.4500000000000005e-05, "loss": 9.7902, "mean_token_accuracy": 0.03981789126992226, "num_tokens": 167417.0, "step": 70 }, { "entropy": 10.732693958282471, "epoch": 0.0048222207934160615, "grad_norm": 1.8125, "learning_rate": 3.7e-05, "loss": 9.7708, "mean_token_accuracy": 0.04258622564375401, "num_tokens": 180372.0, "step": 75 }, { "entropy": 10.729571533203124, "epoch": 0.005143702179643799, "grad_norm": 1.90625, "learning_rate": 3.95e-05, "loss": 9.6547, "mean_token_accuracy": 0.045089634135365486, "num_tokens": 191614.0, "step": 80 }, { "entropy": 10.72476511001587, "epoch": 0.0054651835658715365, "grad_norm": 1.796875, "learning_rate": 4.2000000000000004e-05, "loss": 9.6147, "mean_token_accuracy": 0.040345224365592, "num_tokens": 202885.0, "step": 85 }, { "entropy": 10.71826524734497, "epoch": 0.005786664952099273, "grad_norm": 1.7421875, "learning_rate": 4.45e-05, "loss": 9.5588, "mean_token_accuracy": 0.0393321730196476, "num_tokens": 215099.0, "step": 90 }, { "entropy": 10.710640907287598, "epoch": 0.0061081463383270106, "grad_norm": 1.7734375, "learning_rate": 4.7000000000000004e-05, "loss": 9.4198, "mean_token_accuracy": 0.042821163311600685, "num_tokens": 227257.0, "step": 95 }, { "entropy": 10.7003662109375, "epoch": 0.006429627724554748, "grad_norm": 1.796875, "learning_rate": 4.9500000000000004e-05, "loss": 9.3598, "mean_token_accuracy": 0.046982531622052195, "num_tokens": 240338.0, "step": 100 }, { "entropy": 10.68521671295166, "epoch": 0.0067511091107824855, "grad_norm": 1.8203125, "learning_rate": 5.2e-05, "loss": 9.2122, "mean_token_accuracy": 0.0441419318318367, "num_tokens": 251438.0, "step": 105 }, { "entropy": 10.664322471618652, "epoch": 0.007072590497010223, "grad_norm": 1.78125, "learning_rate": 5.45e-05, "loss": 9.1438, "mean_token_accuracy": 0.050481327995657924, "num_tokens": 264614.0, "step": 110 }, { "entropy": 10.634937763214111, "epoch": 0.0073940718832379605, "grad_norm": 1.75, "learning_rate": 5.7e-05, "loss": 9.0251, "mean_token_accuracy": 0.049148940667510035, "num_tokens": 278360.0, "step": 115 }, { "entropy": 10.593732261657715, "epoch": 0.007715553269465698, "grad_norm": 1.6171875, "learning_rate": 5.9499999999999996e-05, "loss": 8.9153, "mean_token_accuracy": 0.05156457796692848, "num_tokens": 290884.0, "step": 120 }, { "entropy": 10.54275369644165, "epoch": 0.008037034655693436, "grad_norm": 1.6484375, "learning_rate": 6.2e-05, "loss": 8.8351, "mean_token_accuracy": 0.052396486327052114, "num_tokens": 304431.0, "step": 125 }, { "entropy": 10.474855613708495, "epoch": 0.008358516041921173, "grad_norm": 1.6796875, "learning_rate": 6.450000000000001e-05, "loss": 8.6397, "mean_token_accuracy": 0.05697291418910026, "num_tokens": 317555.0, "step": 130 }, { "entropy": 10.39169454574585, "epoch": 0.00867999742814891, "grad_norm": 1.59375, "learning_rate": 6.7e-05, "loss": 8.4698, "mean_token_accuracy": 0.058742289617657664, "num_tokens": 329754.0, "step": 135 }, { "entropy": 10.3007230758667, "epoch": 0.009001478814376648, "grad_norm": 1.4296875, "learning_rate": 6.950000000000001e-05, "loss": 8.3392, "mean_token_accuracy": 0.07013382948935032, "num_tokens": 341808.0, "step": 140 }, { "entropy": 10.171103858947754, "epoch": 0.009322960200604385, "grad_norm": 1.4609375, "learning_rate": 7.2e-05, "loss": 8.1587, "mean_token_accuracy": 0.06642449870705605, "num_tokens": 353209.0, "step": 145 }, { "entropy": 10.069665241241456, "epoch": 0.009644441586832123, "grad_norm": 1.2734375, "learning_rate": 7.45e-05, "loss": 8.1634, "mean_token_accuracy": 0.06020556911826134, "num_tokens": 365744.0, "step": 150 }, { "entropy": 9.936939144134522, "epoch": 0.00996592297305986, "grad_norm": 1.3828125, "learning_rate": 7.7e-05, "loss": 8.0462, "mean_token_accuracy": 0.06147486455738545, "num_tokens": 379133.0, "step": 155 }, { "entropy": 9.757997035980225, "epoch": 0.010287404359287598, "grad_norm": 1.203125, "learning_rate": 7.950000000000001e-05, "loss": 7.9266, "mean_token_accuracy": 0.06376843340694904, "num_tokens": 390921.0, "step": 160 }, { "entropy": 9.523485374450683, "epoch": 0.010608885745515335, "grad_norm": 1.3125, "learning_rate": 8.2e-05, "loss": 7.8396, "mean_token_accuracy": 0.07127328738570213, "num_tokens": 404468.0, "step": 165 }, { "entropy": 9.345615196228028, "epoch": 0.010930367131743073, "grad_norm": 1.21875, "learning_rate": 8.450000000000001e-05, "loss": 7.6793, "mean_token_accuracy": 0.07266218103468418, "num_tokens": 414790.0, "step": 170 }, { "entropy": 9.119754123687745, "epoch": 0.011251848517970809, "grad_norm": 1.1953125, "learning_rate": 8.7e-05, "loss": 7.6479, "mean_token_accuracy": 0.06817427426576614, "num_tokens": 427720.0, "step": 175 }, { "entropy": 8.906557750701904, "epoch": 0.011573329904198546, "grad_norm": 0.91015625, "learning_rate": 8.95e-05, "loss": 7.5546, "mean_token_accuracy": 0.07729550525546074, "num_tokens": 438501.0, "step": 180 }, { "entropy": 8.68680248260498, "epoch": 0.011894811290426284, "grad_norm": 0.96484375, "learning_rate": 9.2e-05, "loss": 7.5063, "mean_token_accuracy": 0.07282244712114334, "num_tokens": 450035.0, "step": 185 }, { "entropy": 8.589659690856934, "epoch": 0.012216292676654021, "grad_norm": 1.1796875, "learning_rate": 9.45e-05, "loss": 7.4857, "mean_token_accuracy": 0.0773538451641798, "num_tokens": 461665.0, "step": 190 }, { "entropy": 8.466110229492188, "epoch": 0.012537774062881759, "grad_norm": 1.34375, "learning_rate": 9.7e-05, "loss": 7.407, "mean_token_accuracy": 0.07190582565963269, "num_tokens": 472514.0, "step": 195 }, { "entropy": 8.35852632522583, "epoch": 0.012859255449109496, "grad_norm": 0.9453125, "learning_rate": 9.95e-05, "loss": 7.469, "mean_token_accuracy": 0.07612953037023544, "num_tokens": 484057.0, "step": 200 }, { "entropy": 8.286659240722656, "epoch": 0.013180736835337234, "grad_norm": 1.1640625, "learning_rate": 0.000102, "loss": 7.2817, "mean_token_accuracy": 0.07883379608392715, "num_tokens": 496374.0, "step": 205 }, { "entropy": 8.222426700592042, "epoch": 0.013502218221564971, "grad_norm": 1.1875, "learning_rate": 0.00010449999999999999, "loss": 7.4006, "mean_token_accuracy": 0.08155124634504318, "num_tokens": 508816.0, "step": 210 }, { "entropy": 8.164955520629883, "epoch": 0.013823699607792709, "grad_norm": 1.1875, "learning_rate": 0.000107, "loss": 7.2353, "mean_token_accuracy": 0.08206439130008221, "num_tokens": 520738.0, "step": 215 }, { "entropy": 8.113754081726075, "epoch": 0.014145180994020446, "grad_norm": 0.98828125, "learning_rate": 0.0001095, "loss": 7.1869, "mean_token_accuracy": 0.08583443649113179, "num_tokens": 531924.0, "step": 220 }, { "entropy": 8.066366481781007, "epoch": 0.014466662380248184, "grad_norm": 0.96875, "learning_rate": 0.000112, "loss": 7.2385, "mean_token_accuracy": 0.09169937074184417, "num_tokens": 543924.0, "step": 225 }, { "entropy": 8.05418610572815, "epoch": 0.014788143766475921, "grad_norm": 1.40625, "learning_rate": 0.0001145, "loss": 7.3141, "mean_token_accuracy": 0.0864493004977703, "num_tokens": 555669.0, "step": 230 }, { "entropy": 8.044883394241333, "epoch": 0.015109625152703659, "grad_norm": 1.3828125, "learning_rate": 0.00011700000000000001, "loss": 7.2002, "mean_token_accuracy": 0.09331929311156273, "num_tokens": 567187.0, "step": 235 }, { "entropy": 7.921926689147949, "epoch": 0.015431106538931396, "grad_norm": 1.171875, "learning_rate": 0.00011949999999999999, "loss": 7.1648, "mean_token_accuracy": 0.08909451588988304, "num_tokens": 579812.0, "step": 240 }, { "entropy": 7.9616796493530275, "epoch": 0.015752587925159132, "grad_norm": 1.171875, "learning_rate": 0.000122, "loss": 7.2286, "mean_token_accuracy": 0.0948996253311634, "num_tokens": 592539.0, "step": 245 }, { "entropy": 7.915118932723999, "epoch": 0.01607406931138687, "grad_norm": 0.984375, "learning_rate": 0.0001245, "loss": 7.1744, "mean_token_accuracy": 0.09123623445630073, "num_tokens": 603561.0, "step": 250 }, { "entropy": 7.95502872467041, "epoch": 0.016395550697614607, "grad_norm": 1.0390625, "learning_rate": 0.000127, "loss": 7.1403, "mean_token_accuracy": 0.09563293382525444, "num_tokens": 615309.0, "step": 255 }, { "entropy": 7.883571195602417, "epoch": 0.016717032083842346, "grad_norm": 1.0546875, "learning_rate": 0.0001295, "loss": 7.2078, "mean_token_accuracy": 0.09283049032092094, "num_tokens": 628213.0, "step": 260 }, { "entropy": 7.916977882385254, "epoch": 0.017038513470070082, "grad_norm": 0.96875, "learning_rate": 0.000132, "loss": 7.1712, "mean_token_accuracy": 0.09053821936249733, "num_tokens": 640786.0, "step": 265 }, { "entropy": 7.736500692367554, "epoch": 0.01735999485629782, "grad_norm": 1.15625, "learning_rate": 0.00013450000000000002, "loss": 6.9442, "mean_token_accuracy": 0.09789396971464157, "num_tokens": 653298.0, "step": 270 }, { "entropy": 7.796767520904541, "epoch": 0.017681476242525557, "grad_norm": 1.03125, "learning_rate": 0.00013700000000000002, "loss": 7.1179, "mean_token_accuracy": 0.09451311975717544, "num_tokens": 667729.0, "step": 275 }, { "entropy": 7.758620405197144, "epoch": 0.018002957628753296, "grad_norm": 1.1953125, "learning_rate": 0.0001395, "loss": 6.9965, "mean_token_accuracy": 0.10174397602677346, "num_tokens": 678289.0, "step": 280 }, { "entropy": 7.761229801177978, "epoch": 0.01832443901498103, "grad_norm": 1.125, "learning_rate": 0.00014199999999999998, "loss": 7.1014, "mean_token_accuracy": 0.09417134001851082, "num_tokens": 689595.0, "step": 285 }, { "entropy": 7.707542467117309, "epoch": 0.01864592040120877, "grad_norm": 1.3125, "learning_rate": 0.0001445, "loss": 6.9575, "mean_token_accuracy": 0.10247044488787652, "num_tokens": 701044.0, "step": 290 }, { "entropy": 7.664159297943115, "epoch": 0.018967401787436507, "grad_norm": 1.265625, "learning_rate": 0.000147, "loss": 7.0154, "mean_token_accuracy": 0.09950036033988, "num_tokens": 713616.0, "step": 295 }, { "entropy": 7.647959280014038, "epoch": 0.019288883173664246, "grad_norm": 1.21875, "learning_rate": 0.0001495, "loss": 6.9233, "mean_token_accuracy": 0.1026333898305893, "num_tokens": 725328.0, "step": 300 }, { "entropy": 7.647801685333252, "epoch": 0.01961036455989198, "grad_norm": 1.1953125, "learning_rate": 0.000152, "loss": 6.9827, "mean_token_accuracy": 0.10479021072387695, "num_tokens": 738135.0, "step": 305 }, { "entropy": 7.666160726547242, "epoch": 0.01993184594611972, "grad_norm": 1.21875, "learning_rate": 0.00015450000000000001, "loss": 7.0659, "mean_token_accuracy": 0.09956069737672806, "num_tokens": 750746.0, "step": 310 }, { "entropy": 7.654135274887085, "epoch": 0.020253327332347457, "grad_norm": 1.0703125, "learning_rate": 0.000157, "loss": 6.8949, "mean_token_accuracy": 0.10135210454463958, "num_tokens": 763983.0, "step": 315 }, { "entropy": 7.494717454910278, "epoch": 0.020574808718575196, "grad_norm": 1.0703125, "learning_rate": 0.0001595, "loss": 6.8483, "mean_token_accuracy": 0.1055855043232441, "num_tokens": 776047.0, "step": 320 }, { "entropy": 7.538181352615356, "epoch": 0.02089629010480293, "grad_norm": 0.93359375, "learning_rate": 0.000162, "loss": 6.8979, "mean_token_accuracy": 0.10393242165446281, "num_tokens": 789551.0, "step": 325 }, { "entropy": 7.569456100463867, "epoch": 0.02121777149103067, "grad_norm": 0.95703125, "learning_rate": 0.00016450000000000001, "loss": 6.8266, "mean_token_accuracy": 0.1120136708021164, "num_tokens": 801870.0, "step": 330 }, { "entropy": 7.441139793395996, "epoch": 0.021539252877258407, "grad_norm": 1.0546875, "learning_rate": 0.00016700000000000002, "loss": 6.8251, "mean_token_accuracy": 0.10700582489371299, "num_tokens": 813782.0, "step": 335 }, { "entropy": 7.5361223220825195, "epoch": 0.021860734263486146, "grad_norm": 1.140625, "learning_rate": 0.00016950000000000003, "loss": 6.886, "mean_token_accuracy": 0.11066097766160965, "num_tokens": 826179.0, "step": 340 }, { "entropy": 7.415356826782227, "epoch": 0.02218221564971388, "grad_norm": 1.0703125, "learning_rate": 0.00017199999999999998, "loss": 6.8989, "mean_token_accuracy": 0.10546407401561737, "num_tokens": 838827.0, "step": 345 }, { "entropy": 7.442149639129639, "epoch": 0.022503697035941617, "grad_norm": 1.0625, "learning_rate": 0.00017449999999999999, "loss": 6.8217, "mean_token_accuracy": 0.11060597971081734, "num_tokens": 851543.0, "step": 350 }, { "entropy": 7.508502197265625, "epoch": 0.022825178422169357, "grad_norm": 1.1953125, "learning_rate": 0.000177, "loss": 6.8139, "mean_token_accuracy": 0.112100800126791, "num_tokens": 863557.0, "step": 355 }, { "entropy": 7.371269845962525, "epoch": 0.023146659808397092, "grad_norm": 1.1171875, "learning_rate": 0.0001795, "loss": 6.8226, "mean_token_accuracy": 0.11001520678400993, "num_tokens": 877640.0, "step": 360 }, { "entropy": 7.435138940811157, "epoch": 0.02346814119462483, "grad_norm": 0.96484375, "learning_rate": 0.000182, "loss": 6.9016, "mean_token_accuracy": 0.11292736753821372, "num_tokens": 889521.0, "step": 365 }, { "entropy": 7.44185962677002, "epoch": 0.023789622580852567, "grad_norm": 1.359375, "learning_rate": 0.0001845, "loss": 6.7138, "mean_token_accuracy": 0.11192596107721328, "num_tokens": 899886.0, "step": 370 }, { "entropy": 7.424141836166382, "epoch": 0.024111103967080307, "grad_norm": 1.2109375, "learning_rate": 0.000187, "loss": 6.835, "mean_token_accuracy": 0.10648501366376877, "num_tokens": 911448.0, "step": 375 }, { "entropy": 7.346240711212158, "epoch": 0.024432585353308042, "grad_norm": 1.171875, "learning_rate": 0.0001895, "loss": 6.8403, "mean_token_accuracy": 0.10451060682535171, "num_tokens": 922938.0, "step": 380 }, { "entropy": 7.440135097503662, "epoch": 0.02475406673953578, "grad_norm": 1.125, "learning_rate": 0.000192, "loss": 6.816, "mean_token_accuracy": 0.10817886143922806, "num_tokens": 935037.0, "step": 385 }, { "entropy": 7.338301467895508, "epoch": 0.025075548125763517, "grad_norm": 1.171875, "learning_rate": 0.0001945, "loss": 6.7998, "mean_token_accuracy": 0.10885120332241058, "num_tokens": 946395.0, "step": 390 }, { "entropy": 7.387865447998047, "epoch": 0.025397029511991256, "grad_norm": 1.03125, "learning_rate": 0.00019700000000000002, "loss": 6.7903, "mean_token_accuracy": 0.11720103770494461, "num_tokens": 957963.0, "step": 395 }, { "entropy": 7.322666645050049, "epoch": 0.025718510898218992, "grad_norm": 1.1875, "learning_rate": 0.00019950000000000002, "loss": 6.7715, "mean_token_accuracy": 0.10996255949139595, "num_tokens": 970474.0, "step": 400 }, { "entropy": 7.304989814758301, "epoch": 0.02603999228444673, "grad_norm": 1.171875, "learning_rate": 0.000202, "loss": 6.7076, "mean_token_accuracy": 0.1160525843501091, "num_tokens": 984090.0, "step": 405 }, { "entropy": 7.233718299865723, "epoch": 0.026361473670674467, "grad_norm": 1.0859375, "learning_rate": 0.00020449999999999998, "loss": 6.6529, "mean_token_accuracy": 0.1177474744617939, "num_tokens": 997159.0, "step": 410 }, { "entropy": 7.222785997390747, "epoch": 0.026682955056902206, "grad_norm": 1.265625, "learning_rate": 0.000207, "loss": 6.654, "mean_token_accuracy": 0.11934740170836448, "num_tokens": 1009350.0, "step": 415 }, { "entropy": 7.325893259048462, "epoch": 0.027004436443129942, "grad_norm": 1.1328125, "learning_rate": 0.0002095, "loss": 6.7141, "mean_token_accuracy": 0.11572676599025726, "num_tokens": 1021170.0, "step": 420 }, { "entropy": 7.200784921646118, "epoch": 0.02732591782935768, "grad_norm": 1.1484375, "learning_rate": 0.000212, "loss": 6.7053, "mean_token_accuracy": 0.11510597914457321, "num_tokens": 1033173.0, "step": 425 }, { "entropy": 7.3387078762054445, "epoch": 0.027647399215585417, "grad_norm": 1.1875, "learning_rate": 0.0002145, "loss": 6.6451, "mean_token_accuracy": 0.11399412080645561, "num_tokens": 1045811.0, "step": 430 }, { "entropy": 7.223242235183716, "epoch": 0.027968880601813156, "grad_norm": 1.15625, "learning_rate": 0.00021700000000000002, "loss": 6.6814, "mean_token_accuracy": 0.11766811162233352, "num_tokens": 1058519.0, "step": 435 }, { "entropy": 7.186439037322998, "epoch": 0.028290361988040892, "grad_norm": 1.234375, "learning_rate": 0.0002195, "loss": 6.661, "mean_token_accuracy": 0.11952715441584587, "num_tokens": 1069977.0, "step": 440 }, { "entropy": 7.247150611877442, "epoch": 0.02861184337426863, "grad_norm": 1.328125, "learning_rate": 0.000222, "loss": 6.7042, "mean_token_accuracy": 0.12207212299108505, "num_tokens": 1081368.0, "step": 445 }, { "entropy": 7.224388504028321, "epoch": 0.028933324760496367, "grad_norm": 1.046875, "learning_rate": 0.0002245, "loss": 6.7154, "mean_token_accuracy": 0.11299246326088905, "num_tokens": 1093936.0, "step": 450 }, { "entropy": 7.168924283981323, "epoch": 0.029254806146724106, "grad_norm": 0.953125, "learning_rate": 0.00022700000000000002, "loss": 6.6693, "mean_token_accuracy": 0.1225433073937893, "num_tokens": 1106217.0, "step": 455 }, { "entropy": 7.140732955932617, "epoch": 0.029576287532951842, "grad_norm": 1.1328125, "learning_rate": 0.00022950000000000002, "loss": 6.6131, "mean_token_accuracy": 0.1190965436398983, "num_tokens": 1120108.0, "step": 460 }, { "entropy": 7.190146207809448, "epoch": 0.029897768919179578, "grad_norm": 1.1796875, "learning_rate": 0.00023200000000000003, "loss": 6.691, "mean_token_accuracy": 0.1148249328136444, "num_tokens": 1132390.0, "step": 465 }, { "entropy": 7.1808641910552975, "epoch": 0.030219250305407317, "grad_norm": 1.046875, "learning_rate": 0.00023449999999999998, "loss": 6.6407, "mean_token_accuracy": 0.1223123162984848, "num_tokens": 1144612.0, "step": 470 }, { "entropy": 7.130864477157592, "epoch": 0.030540731691635053, "grad_norm": 1.2109375, "learning_rate": 0.000237, "loss": 6.5913, "mean_token_accuracy": 0.1303763821721077, "num_tokens": 1156151.0, "step": 475 }, { "entropy": 7.050965404510498, "epoch": 0.030862213077862792, "grad_norm": 1.1953125, "learning_rate": 0.0002395, "loss": 6.5653, "mean_token_accuracy": 0.1250072978436947, "num_tokens": 1168777.0, "step": 480 }, { "entropy": 7.13370532989502, "epoch": 0.031183694464090528, "grad_norm": 1.1484375, "learning_rate": 0.000242, "loss": 6.6091, "mean_token_accuracy": 0.1207241289317608, "num_tokens": 1181233.0, "step": 485 }, { "entropy": 7.062533330917359, "epoch": 0.031505175850318264, "grad_norm": 1.1328125, "learning_rate": 0.0002445, "loss": 6.4888, "mean_token_accuracy": 0.12689791172742843, "num_tokens": 1192315.0, "step": 490 }, { "entropy": 7.057355880737305, "epoch": 0.031826657236546006, "grad_norm": 1.2890625, "learning_rate": 0.000247, "loss": 6.5874, "mean_token_accuracy": 0.12290141731500626, "num_tokens": 1203452.0, "step": 495 }, { "entropy": 7.104999351501465, "epoch": 0.03214813862277374, "grad_norm": 1.03125, "learning_rate": 0.0002495, "loss": 6.4607, "mean_token_accuracy": 0.12253987565636634, "num_tokens": 1215024.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 273515177410560.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }