{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.03214813862277374, "eval_steps": 500, "global_step": 500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691962623596192, "epoch": 0.00032148138622773744, "grad_norm": 11.75, "learning_rate": 2e-06, "loss": 10.8513, "mean_token_accuracy": 0.0002252335427328944, "num_tokens": 12742.0, "step": 5 }, { "entropy": 10.691972923278808, "epoch": 0.0006429627724554749, "grad_norm": 11.3125, "learning_rate": 4.5e-06, "loss": 10.7797, "mean_token_accuracy": 0.00016763927997089922, "num_tokens": 24140.0, "step": 10 }, { "entropy": 10.6913818359375, "epoch": 0.0009644441586832123, "grad_norm": 9.375, "learning_rate": 7e-06, "loss": 10.5596, "mean_token_accuracy": 0.009554457850754261, "num_tokens": 35301.0, "step": 15 }, { "entropy": 10.68741807937622, "epoch": 0.0012859255449109497, "grad_norm": 7.1875, "learning_rate": 9.5e-06, "loss": 10.279, "mean_token_accuracy": 0.031060078553855418, "num_tokens": 47594.0, "step": 20 }, { "entropy": 10.6698899269104, "epoch": 0.001607406931138687, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 10.018, "mean_token_accuracy": 0.02761343717575073, "num_tokens": 60157.0, "step": 25 }, { "entropy": 10.65185718536377, "epoch": 0.0019288883173664245, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.8686, "mean_token_accuracy": 0.030902387760579585, "num_tokens": 71681.0, "step": 30 }, { "entropy": 10.64528455734253, "epoch": 0.002250369703594162, "grad_norm": 2.734375, "learning_rate": 1.7000000000000003e-05, "loss": 9.7976, "mean_token_accuracy": 0.028960460610687733, "num_tokens": 84059.0, "step": 35 }, { "entropy": 10.643793773651122, "epoch": 0.0025718510898218995, "grad_norm": 2.578125, "learning_rate": 1.95e-05, "loss": 9.7566, "mean_token_accuracy": 0.03402260970324278, "num_tokens": 95765.0, "step": 40 }, { "entropy": 10.633929347991943, "epoch": 0.0028933324760496365, "grad_norm": 2.5, "learning_rate": 2.2e-05, "loss": 9.7195, "mean_token_accuracy": 0.037856101803481576, "num_tokens": 108095.0, "step": 45 }, { "entropy": 10.626009464263916, "epoch": 0.003214813862277374, "grad_norm": 2.421875, "learning_rate": 2.4500000000000003e-05, "loss": 9.6663, "mean_token_accuracy": 0.04004088416695595, "num_tokens": 120722.0, "step": 50 }, { "entropy": 10.62456464767456, "epoch": 0.0035362952485051115, "grad_norm": 2.453125, "learning_rate": 2.7e-05, "loss": 9.579, "mean_token_accuracy": 0.04333267491310835, "num_tokens": 132684.0, "step": 55 }, { "entropy": 10.60206480026245, "epoch": 0.003857776634732849, "grad_norm": 2.4375, "learning_rate": 2.95e-05, "loss": 9.5155, "mean_token_accuracy": 0.041969917714595795, "num_tokens": 143940.0, "step": 60 }, { "entropy": 10.526144027709961, "epoch": 0.0041792580209605865, "grad_norm": 2.65625, "learning_rate": 3.2e-05, "loss": 9.4139, "mean_token_accuracy": 0.0514595627784729, "num_tokens": 156206.0, "step": 65 }, { "entropy": 10.384619331359863, "epoch": 0.004500739407188324, "grad_norm": 2.515625, "learning_rate": 3.4500000000000005e-05, "loss": 9.2565, "mean_token_accuracy": 0.053492728248238565, "num_tokens": 167417.0, "step": 70 }, { "entropy": 10.46249942779541, "epoch": 0.0048222207934160615, "grad_norm": 2.640625, "learning_rate": 3.7e-05, "loss": 9.1818, "mean_token_accuracy": 0.05699222944676876, "num_tokens": 180372.0, "step": 75 }, { "entropy": 10.435306167602539, "epoch": 0.005143702179643799, "grad_norm": 2.578125, "learning_rate": 3.95e-05, "loss": 9.0202, "mean_token_accuracy": 0.06815617680549621, "num_tokens": 191614.0, "step": 80 }, { "entropy": 10.381722354888916, "epoch": 0.0054651835658715365, "grad_norm": 2.21875, "learning_rate": 4.2000000000000004e-05, "loss": 8.9883, "mean_token_accuracy": 0.0625459872186184, "num_tokens": 202885.0, "step": 85 }, { "entropy": 10.344064044952393, "epoch": 0.005786664952099273, "grad_norm": 2.0625, "learning_rate": 4.45e-05, "loss": 8.8777, "mean_token_accuracy": 0.06927761398255824, "num_tokens": 215099.0, "step": 90 }, { "entropy": 10.285068035125732, "epoch": 0.0061081463383270106, "grad_norm": 2.328125, "learning_rate": 4.7000000000000004e-05, "loss": 8.7178, "mean_token_accuracy": 0.07229750752449035, "num_tokens": 227257.0, "step": 95 }, { "entropy": 10.250009727478027, "epoch": 0.006429627724554748, "grad_norm": 2.46875, "learning_rate": 4.9500000000000004e-05, "loss": 8.6465, "mean_token_accuracy": 0.07430845759809017, "num_tokens": 240338.0, "step": 100 }, { "entropy": 10.134335803985596, "epoch": 0.0067511091107824855, "grad_norm": 2.484375, "learning_rate": 5.2e-05, "loss": 8.49, "mean_token_accuracy": 0.07340316958725453, "num_tokens": 251438.0, "step": 105 }, { "entropy": 10.063454627990723, "epoch": 0.007072590497010223, "grad_norm": 2.28125, "learning_rate": 5.45e-05, "loss": 8.4147, "mean_token_accuracy": 0.07746305204927921, "num_tokens": 264614.0, "step": 110 }, { "entropy": 10.039491367340087, "epoch": 0.0073940718832379605, "grad_norm": 2.28125, "learning_rate": 5.7e-05, "loss": 8.3115, "mean_token_accuracy": 0.07388029359281063, "num_tokens": 278360.0, "step": 115 }, { "entropy": 9.967554664611816, "epoch": 0.007715553269465698, "grad_norm": 2.0, "learning_rate": 5.9499999999999996e-05, "loss": 8.2266, "mean_token_accuracy": 0.07311215251684189, "num_tokens": 290884.0, "step": 120 }, { "entropy": 9.837087726593017, "epoch": 0.008037034655693436, "grad_norm": 2.0625, "learning_rate": 6.2e-05, "loss": 8.1761, "mean_token_accuracy": 0.07603085115551948, "num_tokens": 304431.0, "step": 125 }, { "entropy": 9.656188583374023, "epoch": 0.008358516041921173, "grad_norm": 2.03125, "learning_rate": 6.450000000000001e-05, "loss": 7.9808, "mean_token_accuracy": 0.07899082973599433, "num_tokens": 317555.0, "step": 130 }, { "entropy": 9.52431879043579, "epoch": 0.00867999742814891, "grad_norm": 1.921875, "learning_rate": 6.7e-05, "loss": 7.7967, "mean_token_accuracy": 0.08144079595804214, "num_tokens": 329754.0, "step": 135 }, { "entropy": 9.300153827667236, "epoch": 0.009001478814376648, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 7.6916, "mean_token_accuracy": 0.0898093469440937, "num_tokens": 341808.0, "step": 140 }, { "entropy": 9.123427486419677, "epoch": 0.009322960200604385, "grad_norm": 1.5625, "learning_rate": 7.2e-05, "loss": 7.5127, "mean_token_accuracy": 0.09076863974332809, "num_tokens": 353209.0, "step": 145 }, { "entropy": 8.99952049255371, "epoch": 0.009644441586832123, "grad_norm": 1.4609375, "learning_rate": 7.45e-05, "loss": 7.5718, "mean_token_accuracy": 0.0799163393676281, "num_tokens": 365744.0, "step": 150 }, { "entropy": 8.78609037399292, "epoch": 0.00996592297305986, "grad_norm": 1.71875, "learning_rate": 7.7e-05, "loss": 7.4871, "mean_token_accuracy": 0.08622552379965782, "num_tokens": 379133.0, "step": 155 }, { "entropy": 8.53131160736084, "epoch": 0.010287404359287598, "grad_norm": 1.515625, "learning_rate": 7.950000000000001e-05, "loss": 7.4339, "mean_token_accuracy": 0.0928072139620781, "num_tokens": 390921.0, "step": 160 }, { "entropy": 8.407974147796631, "epoch": 0.010608885745515335, "grad_norm": 1.6953125, "learning_rate": 8.2e-05, "loss": 7.4005, "mean_token_accuracy": 0.09085078835487366, "num_tokens": 404468.0, "step": 165 }, { "entropy": 8.33922872543335, "epoch": 0.010930367131743073, "grad_norm": 1.671875, "learning_rate": 8.450000000000001e-05, "loss": 7.2555, "mean_token_accuracy": 0.08985946327447891, "num_tokens": 414790.0, "step": 170 }, { "entropy": 8.20672607421875, "epoch": 0.011251848517970809, "grad_norm": 1.671875, "learning_rate": 8.7e-05, "loss": 7.2876, "mean_token_accuracy": 0.0886640053242445, "num_tokens": 427720.0, "step": 175 }, { "entropy": 8.09479341506958, "epoch": 0.011573329904198546, "grad_norm": 1.390625, "learning_rate": 8.95e-05, "loss": 7.2213, "mean_token_accuracy": 0.09638915956020355, "num_tokens": 438501.0, "step": 180 }, { "entropy": 8.054841995239258, "epoch": 0.011894811290426284, "grad_norm": 1.4921875, "learning_rate": 9.2e-05, "loss": 7.1887, "mean_token_accuracy": 0.09422452822327614, "num_tokens": 450035.0, "step": 185 }, { "entropy": 7.978442239761352, "epoch": 0.012216292676654021, "grad_norm": 1.5546875, "learning_rate": 9.45e-05, "loss": 7.1804, "mean_token_accuracy": 0.09522246792912484, "num_tokens": 461665.0, "step": 190 }, { "entropy": 7.953486919403076, "epoch": 0.012537774062881759, "grad_norm": 1.4375, "learning_rate": 9.7e-05, "loss": 7.1284, "mean_token_accuracy": 0.09261216446757317, "num_tokens": 472514.0, "step": 195 }, { "entropy": 7.86272406578064, "epoch": 0.012859255449109496, "grad_norm": 1.625, "learning_rate": 9.95e-05, "loss": 7.2167, "mean_token_accuracy": 0.09284883812069893, "num_tokens": 484057.0, "step": 200 }, { "entropy": 7.859376621246338, "epoch": 0.013180736835337234, "grad_norm": 1.6171875, "learning_rate": 0.000102, "loss": 7.0232, "mean_token_accuracy": 0.10182850286364556, "num_tokens": 496374.0, "step": 205 }, { "entropy": 7.836434459686279, "epoch": 0.013502218221564971, "grad_norm": 1.6328125, "learning_rate": 0.00010449999999999999, "loss": 7.1543, "mean_token_accuracy": 0.09297729805111885, "num_tokens": 508816.0, "step": 210 }, { "entropy": 7.725788021087647, "epoch": 0.013823699607792709, "grad_norm": 1.6328125, "learning_rate": 0.000107, "loss": 6.9889, "mean_token_accuracy": 0.09677340798079967, "num_tokens": 520738.0, "step": 215 }, { "entropy": 7.688320064544678, "epoch": 0.014145180994020446, "grad_norm": 1.4453125, "learning_rate": 0.0001095, "loss": 6.9658, "mean_token_accuracy": 0.09948733299970627, "num_tokens": 531924.0, "step": 220 }, { "entropy": 7.670648431777954, "epoch": 0.014466662380248184, "grad_norm": 1.609375, "learning_rate": 0.000112, "loss": 7.0118, "mean_token_accuracy": 0.10900615230202675, "num_tokens": 543924.0, "step": 225 }, { "entropy": 7.686954212188721, "epoch": 0.014788143766475921, "grad_norm": 1.8515625, "learning_rate": 0.0001145, "loss": 7.1106, "mean_token_accuracy": 0.09593017026782036, "num_tokens": 555669.0, "step": 230 }, { "entropy": 7.638793182373047, "epoch": 0.015109625152703659, "grad_norm": 1.8359375, "learning_rate": 0.00011700000000000001, "loss": 6.985, "mean_token_accuracy": 0.10193387344479561, "num_tokens": 567187.0, "step": 235 }, { "entropy": 7.547295236587525, "epoch": 0.015431106538931396, "grad_norm": 1.5859375, "learning_rate": 0.00011949999999999999, "loss": 6.9604, "mean_token_accuracy": 0.10019129663705825, "num_tokens": 579812.0, "step": 240 }, { "entropy": 7.638609123229981, "epoch": 0.015752587925159132, "grad_norm": 1.375, "learning_rate": 0.000122, "loss": 7.0269, "mean_token_accuracy": 0.10339270010590554, "num_tokens": 592539.0, "step": 245 }, { "entropy": 7.532276964187622, "epoch": 0.01607406931138687, "grad_norm": 1.390625, "learning_rate": 0.0001245, "loss": 6.9864, "mean_token_accuracy": 0.09921617358922959, "num_tokens": 603561.0, "step": 250 }, { "entropy": 7.575937652587891, "epoch": 0.016395550697614607, "grad_norm": 1.40625, "learning_rate": 0.000127, "loss": 6.9515, "mean_token_accuracy": 0.10559275299310684, "num_tokens": 615309.0, "step": 255 }, { "entropy": 7.502751398086548, "epoch": 0.016717032083842346, "grad_norm": 1.46875, "learning_rate": 0.0001295, "loss": 7.0296, "mean_token_accuracy": 0.10198334977030754, "num_tokens": 628213.0, "step": 260 }, { "entropy": 7.497059392929077, "epoch": 0.017038513470070082, "grad_norm": 1.265625, "learning_rate": 0.000132, "loss": 6.9923, "mean_token_accuracy": 0.10004970207810401, "num_tokens": 640786.0, "step": 265 }, { "entropy": 7.384635734558105, "epoch": 0.01735999485629782, "grad_norm": 1.5703125, "learning_rate": 0.00013450000000000002, "loss": 6.7652, "mean_token_accuracy": 0.10689441561698913, "num_tokens": 653298.0, "step": 270 }, { "entropy": 7.442841482162476, "epoch": 0.017681476242525557, "grad_norm": 1.328125, "learning_rate": 0.00013700000000000002, "loss": 6.9593, "mean_token_accuracy": 0.10141257345676422, "num_tokens": 667729.0, "step": 275 }, { "entropy": 7.377757835388183, "epoch": 0.018002957628753296, "grad_norm": 1.4765625, "learning_rate": 0.0001395, "loss": 6.8218, "mean_token_accuracy": 0.109464630484581, "num_tokens": 678289.0, "step": 280 }, { "entropy": 7.392750930786133, "epoch": 0.01832443901498103, "grad_norm": 1.46875, "learning_rate": 0.00014199999999999998, "loss": 6.9482, "mean_token_accuracy": 0.10103233233094215, "num_tokens": 689595.0, "step": 285 }, { "entropy": 7.349066972732544, "epoch": 0.01864592040120877, "grad_norm": 1.6015625, "learning_rate": 0.0001445, "loss": 6.7929, "mean_token_accuracy": 0.10910078138113022, "num_tokens": 701044.0, "step": 290 }, { "entropy": 7.2998779773712155, "epoch": 0.018967401787436507, "grad_norm": 1.4375, "learning_rate": 0.000147, "loss": 6.8552, "mean_token_accuracy": 0.10353608876466751, "num_tokens": 713616.0, "step": 295 }, { "entropy": 7.3296403884887695, "epoch": 0.019288883173664246, "grad_norm": 1.421875, "learning_rate": 0.0001495, "loss": 6.7575, "mean_token_accuracy": 0.10954333394765854, "num_tokens": 725328.0, "step": 300 }, { "entropy": 7.328500699996948, "epoch": 0.01961036455989198, "grad_norm": 1.3671875, "learning_rate": 0.000152, "loss": 6.8157, "mean_token_accuracy": 0.11377528384327888, "num_tokens": 738135.0, "step": 305 }, { "entropy": 7.282759141921997, "epoch": 0.01993184594611972, "grad_norm": 1.7890625, "learning_rate": 0.00015450000000000001, "loss": 6.9205, "mean_token_accuracy": 0.10520246997475624, "num_tokens": 750746.0, "step": 310 }, { "entropy": 7.259783411026001, "epoch": 0.020253327332347457, "grad_norm": 1.390625, "learning_rate": 0.000157, "loss": 6.7411, "mean_token_accuracy": 0.10833622887730598, "num_tokens": 763983.0, "step": 315 }, { "entropy": 7.18600115776062, "epoch": 0.020574808718575196, "grad_norm": 1.234375, "learning_rate": 0.0001595, "loss": 6.6981, "mean_token_accuracy": 0.11062882989645004, "num_tokens": 776047.0, "step": 320 }, { "entropy": 7.202081680297852, "epoch": 0.02089629010480293, "grad_norm": 1.2734375, "learning_rate": 0.000162, "loss": 6.7449, "mean_token_accuracy": 0.11173393949866295, "num_tokens": 789551.0, "step": 325 }, { "entropy": 7.191899156570434, "epoch": 0.02121777149103067, "grad_norm": 1.203125, "learning_rate": 0.00016450000000000001, "loss": 6.6717, "mean_token_accuracy": 0.116755510866642, "num_tokens": 801870.0, "step": 330 }, { "entropy": 7.0472588539123535, "epoch": 0.021539252877258407, "grad_norm": 1.296875, "learning_rate": 0.00016700000000000002, "loss": 6.6745, "mean_token_accuracy": 0.11330420076847077, "num_tokens": 813782.0, "step": 335 }, { "entropy": 7.256284284591675, "epoch": 0.021860734263486146, "grad_norm": 1.2734375, "learning_rate": 0.00016950000000000003, "loss": 6.7471, "mean_token_accuracy": 0.11353514790534973, "num_tokens": 826179.0, "step": 340 }, { "entropy": 7.08664984703064, "epoch": 0.02218221564971388, "grad_norm": 1.3984375, "learning_rate": 0.00017199999999999998, "loss": 6.7564, "mean_token_accuracy": 0.11025232151150703, "num_tokens": 838827.0, "step": 345 }, { "entropy": 7.074565649032593, "epoch": 0.022503697035941617, "grad_norm": 1.3203125, "learning_rate": 0.00017449999999999999, "loss": 6.6814, "mean_token_accuracy": 0.11574955135583878, "num_tokens": 851543.0, "step": 350 }, { "entropy": 7.184527492523193, "epoch": 0.022825178422169357, "grad_norm": 1.46875, "learning_rate": 0.000177, "loss": 6.6767, "mean_token_accuracy": 0.11738619655370712, "num_tokens": 863557.0, "step": 355 }, { "entropy": 7.040078735351562, "epoch": 0.023146659808397092, "grad_norm": 1.4296875, "learning_rate": 0.0001795, "loss": 6.6815, "mean_token_accuracy": 0.11558268815279008, "num_tokens": 877640.0, "step": 360 }, { "entropy": 7.095375967025757, "epoch": 0.02346814119462483, "grad_norm": 1.234375, "learning_rate": 0.000182, "loss": 6.7741, "mean_token_accuracy": 0.11316436678171157, "num_tokens": 889521.0, "step": 365 }, { "entropy": 7.112909460067749, "epoch": 0.023789622580852567, "grad_norm": 1.8203125, "learning_rate": 0.0001845, "loss": 6.5878, "mean_token_accuracy": 0.11447165459394455, "num_tokens": 899886.0, "step": 370 }, { "entropy": 7.061623859405517, "epoch": 0.024111103967080307, "grad_norm": 1.328125, "learning_rate": 0.000187, "loss": 6.7105, "mean_token_accuracy": 0.11387978419661522, "num_tokens": 911448.0, "step": 375 }, { "entropy": 7.076057815551758, "epoch": 0.024432585353308042, "grad_norm": 1.34375, "learning_rate": 0.0001895, "loss": 6.7226, "mean_token_accuracy": 0.10502426400780678, "num_tokens": 922938.0, "step": 380 }, { "entropy": 7.091100549697876, "epoch": 0.02475406673953578, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.684, "mean_token_accuracy": 0.11112537905573845, "num_tokens": 935037.0, "step": 385 }, { "entropy": 7.033271551132202, "epoch": 0.025075548125763517, "grad_norm": 1.375, "learning_rate": 0.0001945, "loss": 6.6903, "mean_token_accuracy": 0.11486706212162971, "num_tokens": 946395.0, "step": 390 }, { "entropy": 7.067003679275513, "epoch": 0.025397029511991256, "grad_norm": 1.375, "learning_rate": 0.00019700000000000002, "loss": 6.6824, "mean_token_accuracy": 0.11959373131394387, "num_tokens": 957963.0, "step": 395 }, { "entropy": 6.964381456375122, "epoch": 0.025718510898218992, "grad_norm": 1.3984375, "learning_rate": 0.00019950000000000002, "loss": 6.6614, "mean_token_accuracy": 0.11519286185503005, "num_tokens": 970474.0, "step": 400 }, { "entropy": 6.985042428970337, "epoch": 0.02603999228444673, "grad_norm": 1.2578125, "learning_rate": 0.000202, "loss": 6.5889, "mean_token_accuracy": 0.11821843534708024, "num_tokens": 984090.0, "step": 405 }, { "entropy": 6.921429443359375, "epoch": 0.026361473670674467, "grad_norm": 1.28125, "learning_rate": 0.00020449999999999998, "loss": 6.5338, "mean_token_accuracy": 0.11909934431314469, "num_tokens": 997159.0, "step": 410 }, { "entropy": 6.919507074356079, "epoch": 0.026682955056902206, "grad_norm": 1.4140625, "learning_rate": 0.000207, "loss": 6.5426, "mean_token_accuracy": 0.1263238213956356, "num_tokens": 1009350.0, "step": 415 }, { "entropy": 7.0176619529724125, "epoch": 0.027004436443129942, "grad_norm": 1.375, "learning_rate": 0.0002095, "loss": 6.6044, "mean_token_accuracy": 0.11384878158569336, "num_tokens": 1021170.0, "step": 420 }, { "entropy": 6.921230745315552, "epoch": 0.02732591782935768, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.5882, "mean_token_accuracy": 0.12209255397319793, "num_tokens": 1033173.0, "step": 425 }, { "entropy": 6.975595331192016, "epoch": 0.027647399215585417, "grad_norm": 1.3203125, "learning_rate": 0.0002145, "loss": 6.5325, "mean_token_accuracy": 0.11612072736024856, "num_tokens": 1045811.0, "step": 430 }, { "entropy": 6.848187065124511, "epoch": 0.027968880601813156, "grad_norm": 1.2734375, "learning_rate": 0.00021700000000000002, "loss": 6.5805, "mean_token_accuracy": 0.12089723646640778, "num_tokens": 1058519.0, "step": 435 }, { "entropy": 6.8529754161834715, "epoch": 0.028290361988040892, "grad_norm": 1.421875, "learning_rate": 0.0002195, "loss": 6.5754, "mean_token_accuracy": 0.12128934264183044, "num_tokens": 1069977.0, "step": 440 }, { "entropy": 6.9785984516143795, "epoch": 0.02861184337426863, "grad_norm": 1.3984375, "learning_rate": 0.000222, "loss": 6.5915, "mean_token_accuracy": 0.12578077092766762, "num_tokens": 1081368.0, "step": 445 }, { "entropy": 6.93993067741394, "epoch": 0.028933324760496367, "grad_norm": 1.2265625, "learning_rate": 0.0002245, "loss": 6.6061, "mean_token_accuracy": 0.11534389182925224, "num_tokens": 1093936.0, "step": 450 }, { "entropy": 6.885406398773194, "epoch": 0.029254806146724106, "grad_norm": 1.1328125, "learning_rate": 0.00022700000000000002, "loss": 6.5679, "mean_token_accuracy": 0.1253852665424347, "num_tokens": 1106217.0, "step": 455 }, { "entropy": 6.779489421844483, "epoch": 0.029576287532951842, "grad_norm": 1.3125, "learning_rate": 0.00022950000000000002, "loss": 6.5047, "mean_token_accuracy": 0.12335176095366478, "num_tokens": 1120108.0, "step": 460 }, { "entropy": 6.876409864425659, "epoch": 0.029897768919179578, "grad_norm": 1.2734375, "learning_rate": 0.00023200000000000003, "loss": 6.5903, "mean_token_accuracy": 0.11788614392280579, "num_tokens": 1132390.0, "step": 465 }, { "entropy": 6.85081033706665, "epoch": 0.030219250305407317, "grad_norm": 1.15625, "learning_rate": 0.00023449999999999998, "loss": 6.5371, "mean_token_accuracy": 0.11927784159779549, "num_tokens": 1144612.0, "step": 470 }, { "entropy": 6.844128942489624, "epoch": 0.030540731691635053, "grad_norm": 1.390625, "learning_rate": 0.000237, "loss": 6.5156, "mean_token_accuracy": 0.13191793039441108, "num_tokens": 1156151.0, "step": 475 }, { "entropy": 6.760525751113891, "epoch": 0.030862213077862792, "grad_norm": 1.296875, "learning_rate": 0.0002395, "loss": 6.4768, "mean_token_accuracy": 0.12189689576625824, "num_tokens": 1168777.0, "step": 480 }, { "entropy": 6.826892137527466, "epoch": 0.031183694464090528, "grad_norm": 1.375, "learning_rate": 0.000242, "loss": 6.5164, "mean_token_accuracy": 0.12134948447346687, "num_tokens": 1181233.0, "step": 485 }, { "entropy": 6.723635196685791, "epoch": 0.031505175850318264, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.3929, "mean_token_accuracy": 0.12829372882843018, "num_tokens": 1192315.0, "step": 490 }, { "entropy": 6.789328145980835, "epoch": 0.031826657236546006, "grad_norm": 1.4609375, "learning_rate": 0.000247, "loss": 6.502, "mean_token_accuracy": 0.12471335381269455, "num_tokens": 1203452.0, "step": 495 }, { "entropy": 6.792221593856811, "epoch": 0.03214813862277374, "grad_norm": 1.25, "learning_rate": 0.0002495, "loss": 6.3686, "mean_token_accuracy": 0.12460671365261078, "num_tokens": 1215024.0, "step": 500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 1844811565056000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }