{ "best_global_step": null, "best_metric": null, "best_model_checkpoint": null, "epoch": 0.09644441586832123, "eval_steps": 500, "global_step": 1500, "is_hyper_param_search": false, "is_local_process_zero": true, "is_world_process_zero": true, "log_history": [ { "entropy": 10.691962623596192, "epoch": 0.00032148138622773744, "grad_norm": 11.75, "learning_rate": 2e-06, "loss": 10.8513, "mean_token_accuracy": 0.0002252335427328944, "num_tokens": 12742.0, "step": 5 }, { "entropy": 10.691972923278808, "epoch": 0.0006429627724554749, "grad_norm": 11.3125, "learning_rate": 4.5e-06, "loss": 10.7797, "mean_token_accuracy": 0.00016763927997089922, "num_tokens": 24140.0, "step": 10 }, { "entropy": 10.6913818359375, "epoch": 0.0009644441586832123, "grad_norm": 9.375, "learning_rate": 7e-06, "loss": 10.5596, "mean_token_accuracy": 0.009554457850754261, "num_tokens": 35301.0, "step": 15 }, { "entropy": 10.68741807937622, "epoch": 0.0012859255449109497, "grad_norm": 7.1875, "learning_rate": 9.5e-06, "loss": 10.279, "mean_token_accuracy": 0.031060078553855418, "num_tokens": 47594.0, "step": 20 }, { "entropy": 10.6698899269104, "epoch": 0.001607406931138687, "grad_norm": 4.21875, "learning_rate": 1.2e-05, "loss": 10.018, "mean_token_accuracy": 0.02761343717575073, "num_tokens": 60157.0, "step": 25 }, { "entropy": 10.65185718536377, "epoch": 0.0019288883173664245, "grad_norm": 3.21875, "learning_rate": 1.4500000000000002e-05, "loss": 9.8686, "mean_token_accuracy": 0.030902387760579585, "num_tokens": 71681.0, "step": 30 }, { "entropy": 10.64528455734253, "epoch": 0.002250369703594162, "grad_norm": 2.734375, "learning_rate": 1.7000000000000003e-05, "loss": 9.7976, "mean_token_accuracy": 0.028960460610687733, "num_tokens": 84059.0, "step": 35 }, { "entropy": 10.643793773651122, "epoch": 0.0025718510898218995, "grad_norm": 2.578125, "learning_rate": 1.95e-05, "loss": 9.7566, "mean_token_accuracy": 0.03402260970324278, "num_tokens": 95765.0, "step": 40 }, { "entropy": 10.633929347991943, "epoch": 0.0028933324760496365, "grad_norm": 2.5, "learning_rate": 2.2e-05, "loss": 9.7195, "mean_token_accuracy": 0.037856101803481576, "num_tokens": 108095.0, "step": 45 }, { "entropy": 10.626009464263916, "epoch": 0.003214813862277374, "grad_norm": 2.421875, "learning_rate": 2.4500000000000003e-05, "loss": 9.6663, "mean_token_accuracy": 0.04004088416695595, "num_tokens": 120722.0, "step": 50 }, { "entropy": 10.62456464767456, "epoch": 0.0035362952485051115, "grad_norm": 2.453125, "learning_rate": 2.7e-05, "loss": 9.579, "mean_token_accuracy": 0.04333267491310835, "num_tokens": 132684.0, "step": 55 }, { "entropy": 10.60206480026245, "epoch": 0.003857776634732849, "grad_norm": 2.4375, "learning_rate": 2.95e-05, "loss": 9.5155, "mean_token_accuracy": 0.041969917714595795, "num_tokens": 143940.0, "step": 60 }, { "entropy": 10.526144027709961, "epoch": 0.0041792580209605865, "grad_norm": 2.65625, "learning_rate": 3.2e-05, "loss": 9.4139, "mean_token_accuracy": 0.0514595627784729, "num_tokens": 156206.0, "step": 65 }, { "entropy": 10.384619331359863, "epoch": 0.004500739407188324, "grad_norm": 2.515625, "learning_rate": 3.4500000000000005e-05, "loss": 9.2565, "mean_token_accuracy": 0.053492728248238565, "num_tokens": 167417.0, "step": 70 }, { "entropy": 10.46249942779541, "epoch": 0.0048222207934160615, "grad_norm": 2.640625, "learning_rate": 3.7e-05, "loss": 9.1818, "mean_token_accuracy": 0.05699222944676876, "num_tokens": 180372.0, "step": 75 }, { "entropy": 10.435306167602539, "epoch": 0.005143702179643799, "grad_norm": 2.578125, "learning_rate": 3.95e-05, "loss": 9.0202, "mean_token_accuracy": 0.06815617680549621, "num_tokens": 191614.0, "step": 80 }, { "entropy": 10.381722354888916, "epoch": 0.0054651835658715365, "grad_norm": 2.21875, "learning_rate": 4.2000000000000004e-05, "loss": 8.9883, "mean_token_accuracy": 0.0625459872186184, "num_tokens": 202885.0, "step": 85 }, { "entropy": 10.344064044952393, "epoch": 0.005786664952099273, "grad_norm": 2.0625, "learning_rate": 4.45e-05, "loss": 8.8777, "mean_token_accuracy": 0.06927761398255824, "num_tokens": 215099.0, "step": 90 }, { "entropy": 10.285068035125732, "epoch": 0.0061081463383270106, "grad_norm": 2.328125, "learning_rate": 4.7000000000000004e-05, "loss": 8.7178, "mean_token_accuracy": 0.07229750752449035, "num_tokens": 227257.0, "step": 95 }, { "entropy": 10.250009727478027, "epoch": 0.006429627724554748, "grad_norm": 2.46875, "learning_rate": 4.9500000000000004e-05, "loss": 8.6465, "mean_token_accuracy": 0.07430845759809017, "num_tokens": 240338.0, "step": 100 }, { "entropy": 10.134335803985596, "epoch": 0.0067511091107824855, "grad_norm": 2.484375, "learning_rate": 5.2e-05, "loss": 8.49, "mean_token_accuracy": 0.07340316958725453, "num_tokens": 251438.0, "step": 105 }, { "entropy": 10.063454627990723, "epoch": 0.007072590497010223, "grad_norm": 2.28125, "learning_rate": 5.45e-05, "loss": 8.4147, "mean_token_accuracy": 0.07746305204927921, "num_tokens": 264614.0, "step": 110 }, { "entropy": 10.039491367340087, "epoch": 0.0073940718832379605, "grad_norm": 2.28125, "learning_rate": 5.7e-05, "loss": 8.3115, "mean_token_accuracy": 0.07388029359281063, "num_tokens": 278360.0, "step": 115 }, { "entropy": 9.967554664611816, "epoch": 0.007715553269465698, "grad_norm": 2.0, "learning_rate": 5.9499999999999996e-05, "loss": 8.2266, "mean_token_accuracy": 0.07311215251684189, "num_tokens": 290884.0, "step": 120 }, { "entropy": 9.837087726593017, "epoch": 0.008037034655693436, "grad_norm": 2.0625, "learning_rate": 6.2e-05, "loss": 8.1761, "mean_token_accuracy": 0.07603085115551948, "num_tokens": 304431.0, "step": 125 }, { "entropy": 9.656188583374023, "epoch": 0.008358516041921173, "grad_norm": 2.03125, "learning_rate": 6.450000000000001e-05, "loss": 7.9808, "mean_token_accuracy": 0.07899082973599433, "num_tokens": 317555.0, "step": 130 }, { "entropy": 9.52431879043579, "epoch": 0.00867999742814891, "grad_norm": 1.921875, "learning_rate": 6.7e-05, "loss": 7.7967, "mean_token_accuracy": 0.08144079595804214, "num_tokens": 329754.0, "step": 135 }, { "entropy": 9.300153827667236, "epoch": 0.009001478814376648, "grad_norm": 1.640625, "learning_rate": 6.950000000000001e-05, "loss": 7.6916, "mean_token_accuracy": 0.0898093469440937, "num_tokens": 341808.0, "step": 140 }, { "entropy": 9.123427486419677, "epoch": 0.009322960200604385, "grad_norm": 1.5625, "learning_rate": 7.2e-05, "loss": 7.5127, "mean_token_accuracy": 0.09076863974332809, "num_tokens": 353209.0, "step": 145 }, { "entropy": 8.99952049255371, "epoch": 0.009644441586832123, "grad_norm": 1.4609375, "learning_rate": 7.45e-05, "loss": 7.5718, "mean_token_accuracy": 0.0799163393676281, "num_tokens": 365744.0, "step": 150 }, { "entropy": 8.78609037399292, "epoch": 0.00996592297305986, "grad_norm": 1.71875, "learning_rate": 7.7e-05, "loss": 7.4871, "mean_token_accuracy": 0.08622552379965782, "num_tokens": 379133.0, "step": 155 }, { "entropy": 8.53131160736084, "epoch": 0.010287404359287598, "grad_norm": 1.515625, "learning_rate": 7.950000000000001e-05, "loss": 7.4339, "mean_token_accuracy": 0.0928072139620781, "num_tokens": 390921.0, "step": 160 }, { "entropy": 8.407974147796631, "epoch": 0.010608885745515335, "grad_norm": 1.6953125, "learning_rate": 8.2e-05, "loss": 7.4005, "mean_token_accuracy": 0.09085078835487366, "num_tokens": 404468.0, "step": 165 }, { "entropy": 8.33922872543335, "epoch": 0.010930367131743073, "grad_norm": 1.671875, "learning_rate": 8.450000000000001e-05, "loss": 7.2555, "mean_token_accuracy": 0.08985946327447891, "num_tokens": 414790.0, "step": 170 }, { "entropy": 8.20672607421875, "epoch": 0.011251848517970809, "grad_norm": 1.671875, "learning_rate": 8.7e-05, "loss": 7.2876, "mean_token_accuracy": 0.0886640053242445, "num_tokens": 427720.0, "step": 175 }, { "entropy": 8.09479341506958, "epoch": 0.011573329904198546, "grad_norm": 1.390625, "learning_rate": 8.95e-05, "loss": 7.2213, "mean_token_accuracy": 0.09638915956020355, "num_tokens": 438501.0, "step": 180 }, { "entropy": 8.054841995239258, "epoch": 0.011894811290426284, "grad_norm": 1.4921875, "learning_rate": 9.2e-05, "loss": 7.1887, "mean_token_accuracy": 0.09422452822327614, "num_tokens": 450035.0, "step": 185 }, { "entropy": 7.978442239761352, "epoch": 0.012216292676654021, "grad_norm": 1.5546875, "learning_rate": 9.45e-05, "loss": 7.1804, "mean_token_accuracy": 0.09522246792912484, "num_tokens": 461665.0, "step": 190 }, { "entropy": 7.953486919403076, "epoch": 0.012537774062881759, "grad_norm": 1.4375, "learning_rate": 9.7e-05, "loss": 7.1284, "mean_token_accuracy": 0.09261216446757317, "num_tokens": 472514.0, "step": 195 }, { "entropy": 7.86272406578064, "epoch": 0.012859255449109496, "grad_norm": 1.625, "learning_rate": 9.95e-05, "loss": 7.2167, "mean_token_accuracy": 0.09284883812069893, "num_tokens": 484057.0, "step": 200 }, { "entropy": 7.859376621246338, "epoch": 0.013180736835337234, "grad_norm": 1.6171875, "learning_rate": 0.000102, "loss": 7.0232, "mean_token_accuracy": 0.10182850286364556, "num_tokens": 496374.0, "step": 205 }, { "entropy": 7.836434459686279, "epoch": 0.013502218221564971, "grad_norm": 1.6328125, "learning_rate": 0.00010449999999999999, "loss": 7.1543, "mean_token_accuracy": 0.09297729805111885, "num_tokens": 508816.0, "step": 210 }, { "entropy": 7.725788021087647, "epoch": 0.013823699607792709, "grad_norm": 1.6328125, "learning_rate": 0.000107, "loss": 6.9889, "mean_token_accuracy": 0.09677340798079967, "num_tokens": 520738.0, "step": 215 }, { "entropy": 7.688320064544678, "epoch": 0.014145180994020446, "grad_norm": 1.4453125, "learning_rate": 0.0001095, "loss": 6.9658, "mean_token_accuracy": 0.09948733299970627, "num_tokens": 531924.0, "step": 220 }, { "entropy": 7.670648431777954, "epoch": 0.014466662380248184, "grad_norm": 1.609375, "learning_rate": 0.000112, "loss": 7.0118, "mean_token_accuracy": 0.10900615230202675, "num_tokens": 543924.0, "step": 225 }, { "entropy": 7.686954212188721, "epoch": 0.014788143766475921, "grad_norm": 1.8515625, "learning_rate": 0.0001145, "loss": 7.1106, "mean_token_accuracy": 0.09593017026782036, "num_tokens": 555669.0, "step": 230 }, { "entropy": 7.638793182373047, "epoch": 0.015109625152703659, "grad_norm": 1.8359375, "learning_rate": 0.00011700000000000001, "loss": 6.985, "mean_token_accuracy": 0.10193387344479561, "num_tokens": 567187.0, "step": 235 }, { "entropy": 7.547295236587525, "epoch": 0.015431106538931396, "grad_norm": 1.5859375, "learning_rate": 0.00011949999999999999, "loss": 6.9604, "mean_token_accuracy": 0.10019129663705825, "num_tokens": 579812.0, "step": 240 }, { "entropy": 7.638609123229981, "epoch": 0.015752587925159132, "grad_norm": 1.375, "learning_rate": 0.000122, "loss": 7.0269, "mean_token_accuracy": 0.10339270010590554, "num_tokens": 592539.0, "step": 245 }, { "entropy": 7.532276964187622, "epoch": 0.01607406931138687, "grad_norm": 1.390625, "learning_rate": 0.0001245, "loss": 6.9864, "mean_token_accuracy": 0.09921617358922959, "num_tokens": 603561.0, "step": 250 }, { "entropy": 7.575937652587891, "epoch": 0.016395550697614607, "grad_norm": 1.40625, "learning_rate": 0.000127, "loss": 6.9515, "mean_token_accuracy": 0.10559275299310684, "num_tokens": 615309.0, "step": 255 }, { "entropy": 7.502751398086548, "epoch": 0.016717032083842346, "grad_norm": 1.46875, "learning_rate": 0.0001295, "loss": 7.0296, "mean_token_accuracy": 0.10198334977030754, "num_tokens": 628213.0, "step": 260 }, { "entropy": 7.497059392929077, "epoch": 0.017038513470070082, "grad_norm": 1.265625, "learning_rate": 0.000132, "loss": 6.9923, "mean_token_accuracy": 0.10004970207810401, "num_tokens": 640786.0, "step": 265 }, { "entropy": 7.384635734558105, "epoch": 0.01735999485629782, "grad_norm": 1.5703125, "learning_rate": 0.00013450000000000002, "loss": 6.7652, "mean_token_accuracy": 0.10689441561698913, "num_tokens": 653298.0, "step": 270 }, { "entropy": 7.442841482162476, "epoch": 0.017681476242525557, "grad_norm": 1.328125, "learning_rate": 0.00013700000000000002, "loss": 6.9593, "mean_token_accuracy": 0.10141257345676422, "num_tokens": 667729.0, "step": 275 }, { "entropy": 7.377757835388183, "epoch": 0.018002957628753296, "grad_norm": 1.4765625, "learning_rate": 0.0001395, "loss": 6.8218, "mean_token_accuracy": 0.109464630484581, "num_tokens": 678289.0, "step": 280 }, { "entropy": 7.392750930786133, "epoch": 0.01832443901498103, "grad_norm": 1.46875, "learning_rate": 0.00014199999999999998, "loss": 6.9482, "mean_token_accuracy": 0.10103233233094215, "num_tokens": 689595.0, "step": 285 }, { "entropy": 7.349066972732544, "epoch": 0.01864592040120877, "grad_norm": 1.6015625, "learning_rate": 0.0001445, "loss": 6.7929, "mean_token_accuracy": 0.10910078138113022, "num_tokens": 701044.0, "step": 290 }, { "entropy": 7.2998779773712155, "epoch": 0.018967401787436507, "grad_norm": 1.4375, "learning_rate": 0.000147, "loss": 6.8552, "mean_token_accuracy": 0.10353608876466751, "num_tokens": 713616.0, "step": 295 }, { "entropy": 7.3296403884887695, "epoch": 0.019288883173664246, "grad_norm": 1.421875, "learning_rate": 0.0001495, "loss": 6.7575, "mean_token_accuracy": 0.10954333394765854, "num_tokens": 725328.0, "step": 300 }, { "entropy": 7.328500699996948, "epoch": 0.01961036455989198, "grad_norm": 1.3671875, "learning_rate": 0.000152, "loss": 6.8157, "mean_token_accuracy": 0.11377528384327888, "num_tokens": 738135.0, "step": 305 }, { "entropy": 7.282759141921997, "epoch": 0.01993184594611972, "grad_norm": 1.7890625, "learning_rate": 0.00015450000000000001, "loss": 6.9205, "mean_token_accuracy": 0.10520246997475624, "num_tokens": 750746.0, "step": 310 }, { "entropy": 7.259783411026001, "epoch": 0.020253327332347457, "grad_norm": 1.390625, "learning_rate": 0.000157, "loss": 6.7411, "mean_token_accuracy": 0.10833622887730598, "num_tokens": 763983.0, "step": 315 }, { "entropy": 7.18600115776062, "epoch": 0.020574808718575196, "grad_norm": 1.234375, "learning_rate": 0.0001595, "loss": 6.6981, "mean_token_accuracy": 0.11062882989645004, "num_tokens": 776047.0, "step": 320 }, { "entropy": 7.202081680297852, "epoch": 0.02089629010480293, "grad_norm": 1.2734375, "learning_rate": 0.000162, "loss": 6.7449, "mean_token_accuracy": 0.11173393949866295, "num_tokens": 789551.0, "step": 325 }, { "entropy": 7.191899156570434, "epoch": 0.02121777149103067, "grad_norm": 1.203125, "learning_rate": 0.00016450000000000001, "loss": 6.6717, "mean_token_accuracy": 0.116755510866642, "num_tokens": 801870.0, "step": 330 }, { "entropy": 7.0472588539123535, "epoch": 0.021539252877258407, "grad_norm": 1.296875, "learning_rate": 0.00016700000000000002, "loss": 6.6745, "mean_token_accuracy": 0.11330420076847077, "num_tokens": 813782.0, "step": 335 }, { "entropy": 7.256284284591675, "epoch": 0.021860734263486146, "grad_norm": 1.2734375, "learning_rate": 0.00016950000000000003, "loss": 6.7471, "mean_token_accuracy": 0.11353514790534973, "num_tokens": 826179.0, "step": 340 }, { "entropy": 7.08664984703064, "epoch": 0.02218221564971388, "grad_norm": 1.3984375, "learning_rate": 0.00017199999999999998, "loss": 6.7564, "mean_token_accuracy": 0.11025232151150703, "num_tokens": 838827.0, "step": 345 }, { "entropy": 7.074565649032593, "epoch": 0.022503697035941617, "grad_norm": 1.3203125, "learning_rate": 0.00017449999999999999, "loss": 6.6814, "mean_token_accuracy": 0.11574955135583878, "num_tokens": 851543.0, "step": 350 }, { "entropy": 7.184527492523193, "epoch": 0.022825178422169357, "grad_norm": 1.46875, "learning_rate": 0.000177, "loss": 6.6767, "mean_token_accuracy": 0.11738619655370712, "num_tokens": 863557.0, "step": 355 }, { "entropy": 7.040078735351562, "epoch": 0.023146659808397092, "grad_norm": 1.4296875, "learning_rate": 0.0001795, "loss": 6.6815, "mean_token_accuracy": 0.11558268815279008, "num_tokens": 877640.0, "step": 360 }, { "entropy": 7.095375967025757, "epoch": 0.02346814119462483, "grad_norm": 1.234375, "learning_rate": 0.000182, "loss": 6.7741, "mean_token_accuracy": 0.11316436678171157, "num_tokens": 889521.0, "step": 365 }, { "entropy": 7.112909460067749, "epoch": 0.023789622580852567, "grad_norm": 1.8203125, "learning_rate": 0.0001845, "loss": 6.5878, "mean_token_accuracy": 0.11447165459394455, "num_tokens": 899886.0, "step": 370 }, { "entropy": 7.061623859405517, "epoch": 0.024111103967080307, "grad_norm": 1.328125, "learning_rate": 0.000187, "loss": 6.7105, "mean_token_accuracy": 0.11387978419661522, "num_tokens": 911448.0, "step": 375 }, { "entropy": 7.076057815551758, "epoch": 0.024432585353308042, "grad_norm": 1.34375, "learning_rate": 0.0001895, "loss": 6.7226, "mean_token_accuracy": 0.10502426400780678, "num_tokens": 922938.0, "step": 380 }, { "entropy": 7.091100549697876, "epoch": 0.02475406673953578, "grad_norm": 1.3671875, "learning_rate": 0.000192, "loss": 6.684, "mean_token_accuracy": 0.11112537905573845, "num_tokens": 935037.0, "step": 385 }, { "entropy": 7.033271551132202, "epoch": 0.025075548125763517, "grad_norm": 1.375, "learning_rate": 0.0001945, "loss": 6.6903, "mean_token_accuracy": 0.11486706212162971, "num_tokens": 946395.0, "step": 390 }, { "entropy": 7.067003679275513, "epoch": 0.025397029511991256, "grad_norm": 1.375, "learning_rate": 0.00019700000000000002, "loss": 6.6824, "mean_token_accuracy": 0.11959373131394387, "num_tokens": 957963.0, "step": 395 }, { "entropy": 6.964381456375122, "epoch": 0.025718510898218992, "grad_norm": 1.3984375, "learning_rate": 0.00019950000000000002, "loss": 6.6614, "mean_token_accuracy": 0.11519286185503005, "num_tokens": 970474.0, "step": 400 }, { "entropy": 6.985042428970337, "epoch": 0.02603999228444673, "grad_norm": 1.2578125, "learning_rate": 0.000202, "loss": 6.5889, "mean_token_accuracy": 0.11821843534708024, "num_tokens": 984090.0, "step": 405 }, { "entropy": 6.921429443359375, "epoch": 0.026361473670674467, "grad_norm": 1.28125, "learning_rate": 0.00020449999999999998, "loss": 6.5338, "mean_token_accuracy": 0.11909934431314469, "num_tokens": 997159.0, "step": 410 }, { "entropy": 6.919507074356079, "epoch": 0.026682955056902206, "grad_norm": 1.4140625, "learning_rate": 0.000207, "loss": 6.5426, "mean_token_accuracy": 0.1263238213956356, "num_tokens": 1009350.0, "step": 415 }, { "entropy": 7.0176619529724125, "epoch": 0.027004436443129942, "grad_norm": 1.375, "learning_rate": 0.0002095, "loss": 6.6044, "mean_token_accuracy": 0.11384878158569336, "num_tokens": 1021170.0, "step": 420 }, { "entropy": 6.921230745315552, "epoch": 0.02732591782935768, "grad_norm": 1.46875, "learning_rate": 0.000212, "loss": 6.5882, "mean_token_accuracy": 0.12209255397319793, "num_tokens": 1033173.0, "step": 425 }, { "entropy": 6.975595331192016, "epoch": 0.027647399215585417, "grad_norm": 1.3203125, "learning_rate": 0.0002145, "loss": 6.5325, "mean_token_accuracy": 0.11612072736024856, "num_tokens": 1045811.0, "step": 430 }, { "entropy": 6.848187065124511, "epoch": 0.027968880601813156, "grad_norm": 1.2734375, "learning_rate": 0.00021700000000000002, "loss": 6.5805, "mean_token_accuracy": 0.12089723646640778, "num_tokens": 1058519.0, "step": 435 }, { "entropy": 6.8529754161834715, "epoch": 0.028290361988040892, "grad_norm": 1.421875, "learning_rate": 0.0002195, "loss": 6.5754, "mean_token_accuracy": 0.12128934264183044, "num_tokens": 1069977.0, "step": 440 }, { "entropy": 6.9785984516143795, "epoch": 0.02861184337426863, "grad_norm": 1.3984375, "learning_rate": 0.000222, "loss": 6.5915, "mean_token_accuracy": 0.12578077092766762, "num_tokens": 1081368.0, "step": 445 }, { "entropy": 6.93993067741394, "epoch": 0.028933324760496367, "grad_norm": 1.2265625, "learning_rate": 0.0002245, "loss": 6.6061, "mean_token_accuracy": 0.11534389182925224, "num_tokens": 1093936.0, "step": 450 }, { "entropy": 6.885406398773194, "epoch": 0.029254806146724106, "grad_norm": 1.1328125, "learning_rate": 0.00022700000000000002, "loss": 6.5679, "mean_token_accuracy": 0.1253852665424347, "num_tokens": 1106217.0, "step": 455 }, { "entropy": 6.779489421844483, "epoch": 0.029576287532951842, "grad_norm": 1.3125, "learning_rate": 0.00022950000000000002, "loss": 6.5047, "mean_token_accuracy": 0.12335176095366478, "num_tokens": 1120108.0, "step": 460 }, { "entropy": 6.876409864425659, "epoch": 0.029897768919179578, "grad_norm": 1.2734375, "learning_rate": 0.00023200000000000003, "loss": 6.5903, "mean_token_accuracy": 0.11788614392280579, "num_tokens": 1132390.0, "step": 465 }, { "entropy": 6.85081033706665, "epoch": 0.030219250305407317, "grad_norm": 1.15625, "learning_rate": 0.00023449999999999998, "loss": 6.5371, "mean_token_accuracy": 0.11927784159779549, "num_tokens": 1144612.0, "step": 470 }, { "entropy": 6.844128942489624, "epoch": 0.030540731691635053, "grad_norm": 1.390625, "learning_rate": 0.000237, "loss": 6.5156, "mean_token_accuracy": 0.13191793039441108, "num_tokens": 1156151.0, "step": 475 }, { "entropy": 6.760525751113891, "epoch": 0.030862213077862792, "grad_norm": 1.296875, "learning_rate": 0.0002395, "loss": 6.4768, "mean_token_accuracy": 0.12189689576625824, "num_tokens": 1168777.0, "step": 480 }, { "entropy": 6.826892137527466, "epoch": 0.031183694464090528, "grad_norm": 1.375, "learning_rate": 0.000242, "loss": 6.5164, "mean_token_accuracy": 0.12134948447346687, "num_tokens": 1181233.0, "step": 485 }, { "entropy": 6.723635196685791, "epoch": 0.031505175850318264, "grad_norm": 1.203125, "learning_rate": 0.0002445, "loss": 6.3929, "mean_token_accuracy": 0.12829372882843018, "num_tokens": 1192315.0, "step": 490 }, { "entropy": 6.789328145980835, "epoch": 0.031826657236546006, "grad_norm": 1.4609375, "learning_rate": 0.000247, "loss": 6.502, "mean_token_accuracy": 0.12471335381269455, "num_tokens": 1203452.0, "step": 495 }, { "entropy": 6.792221593856811, "epoch": 0.03214813862277374, "grad_norm": 1.25, "learning_rate": 0.0002495, "loss": 6.3686, "mean_token_accuracy": 0.12460671365261078, "num_tokens": 1215024.0, "step": 500 }, { "entropy": 6.623924732208252, "epoch": 0.03246962000900148, "grad_norm": 1.2109375, "learning_rate": 0.000252, "loss": 6.4445, "mean_token_accuracy": 0.12416145205497742, "num_tokens": 1227389.0, "step": 505 }, { "entropy": 6.81721773147583, "epoch": 0.032791101395229214, "grad_norm": 1.265625, "learning_rate": 0.0002545, "loss": 6.5061, "mean_token_accuracy": 0.1271965205669403, "num_tokens": 1239580.0, "step": 510 }, { "entropy": 6.701832008361817, "epoch": 0.033112582781456956, "grad_norm": 1.4375, "learning_rate": 0.000257, "loss": 6.4046, "mean_token_accuracy": 0.13063657358288766, "num_tokens": 1251057.0, "step": 515 }, { "entropy": 6.754337787628174, "epoch": 0.03343406416768469, "grad_norm": 1.28125, "learning_rate": 0.0002595, "loss": 6.4282, "mean_token_accuracy": 0.12938353642821313, "num_tokens": 1261979.0, "step": 520 }, { "entropy": 6.789865493774414, "epoch": 0.03375554555391243, "grad_norm": 1.1953125, "learning_rate": 0.000262, "loss": 6.4547, "mean_token_accuracy": 0.12837205678224564, "num_tokens": 1274862.0, "step": 525 }, { "entropy": 6.647943687438965, "epoch": 0.034077026940140163, "grad_norm": 1.2421875, "learning_rate": 0.00026450000000000003, "loss": 6.4247, "mean_token_accuracy": 0.12305119037628173, "num_tokens": 1286798.0, "step": 530 }, { "entropy": 6.70164942741394, "epoch": 0.034398508326367906, "grad_norm": 1.171875, "learning_rate": 0.00026700000000000004, "loss": 6.359, "mean_token_accuracy": 0.134645427018404, "num_tokens": 1298709.0, "step": 535 }, { "entropy": 6.6900327682495115, "epoch": 0.03471998971259564, "grad_norm": 1.25, "learning_rate": 0.00026950000000000005, "loss": 6.4432, "mean_token_accuracy": 0.12945917919278144, "num_tokens": 1310597.0, "step": 540 }, { "entropy": 6.656204462051392, "epoch": 0.03504147109882338, "grad_norm": 1.25, "learning_rate": 0.00027200000000000005, "loss": 6.4467, "mean_token_accuracy": 0.12529431134462357, "num_tokens": 1321986.0, "step": 545 }, { "entropy": 6.700818395614624, "epoch": 0.03536295248505111, "grad_norm": 1.4140625, "learning_rate": 0.0002745, "loss": 6.3911, "mean_token_accuracy": 0.12837553173303604, "num_tokens": 1334042.0, "step": 550 }, { "entropy": 6.671852493286133, "epoch": 0.035684433871278856, "grad_norm": 1.3046875, "learning_rate": 0.000277, "loss": 6.3353, "mean_token_accuracy": 0.13774956315755843, "num_tokens": 1345544.0, "step": 555 }, { "entropy": 6.626994228363037, "epoch": 0.03600591525750659, "grad_norm": 1.21875, "learning_rate": 0.0002795, "loss": 6.375, "mean_token_accuracy": 0.1317882977426052, "num_tokens": 1356390.0, "step": 560 }, { "entropy": 6.696563816070556, "epoch": 0.03632739664373433, "grad_norm": 1.421875, "learning_rate": 0.00028199999999999997, "loss": 6.3611, "mean_token_accuracy": 0.12848201990127564, "num_tokens": 1367673.0, "step": 565 }, { "entropy": 6.669189405441284, "epoch": 0.03664887802996206, "grad_norm": 1.1640625, "learning_rate": 0.0002845, "loss": 6.482, "mean_token_accuracy": 0.1228255197405815, "num_tokens": 1378831.0, "step": 570 }, { "entropy": 6.6176934242248535, "epoch": 0.0369703594161898, "grad_norm": 1.2421875, "learning_rate": 0.000287, "loss": 6.3744, "mean_token_accuracy": 0.1277584746479988, "num_tokens": 1390664.0, "step": 575 }, { "entropy": 6.654650640487671, "epoch": 0.03729184080241754, "grad_norm": 1.359375, "learning_rate": 0.0002895, "loss": 6.3602, "mean_token_accuracy": 0.12970560193061828, "num_tokens": 1402452.0, "step": 580 }, { "entropy": 6.5951752185821535, "epoch": 0.03761332218864528, "grad_norm": 1.2890625, "learning_rate": 0.000292, "loss": 6.3472, "mean_token_accuracy": 0.13487544283270836, "num_tokens": 1414961.0, "step": 585 }, { "entropy": 6.669209098815918, "epoch": 0.03793480357487301, "grad_norm": 1.3046875, "learning_rate": 0.0002945, "loss": 6.4936, "mean_token_accuracy": 0.12541896998882293, "num_tokens": 1427130.0, "step": 590 }, { "entropy": 6.672261810302734, "epoch": 0.03825628496110075, "grad_norm": 1.140625, "learning_rate": 0.000297, "loss": 6.451, "mean_token_accuracy": 0.1286468543112278, "num_tokens": 1439670.0, "step": 595 }, { "entropy": 6.482851505279541, "epoch": 0.03857776634732849, "grad_norm": 1.234375, "learning_rate": 0.0002995, "loss": 6.3289, "mean_token_accuracy": 0.1370462618768215, "num_tokens": 1451083.0, "step": 600 }, { "entropy": 6.703476619720459, "epoch": 0.03889924773355623, "grad_norm": 1.25, "learning_rate": 0.000302, "loss": 6.4183, "mean_token_accuracy": 0.12950239554047585, "num_tokens": 1461668.0, "step": 605 }, { "entropy": 6.574382019042969, "epoch": 0.03922072911978396, "grad_norm": 1.171875, "learning_rate": 0.0003045, "loss": 6.3479, "mean_token_accuracy": 0.1261135794222355, "num_tokens": 1474610.0, "step": 610 }, { "entropy": 6.642938756942749, "epoch": 0.0395422105060117, "grad_norm": 1.1328125, "learning_rate": 0.000307, "loss": 6.361, "mean_token_accuracy": 0.13150764107704163, "num_tokens": 1486322.0, "step": 615 }, { "entropy": 6.51555118560791, "epoch": 0.03986369189223944, "grad_norm": 1.421875, "learning_rate": 0.0003095, "loss": 6.3021, "mean_token_accuracy": 0.1357271581888199, "num_tokens": 1498463.0, "step": 620 }, { "entropy": 6.575559139251709, "epoch": 0.04018517327846718, "grad_norm": 1.28125, "learning_rate": 0.000312, "loss": 6.3484, "mean_token_accuracy": 0.13323022946715354, "num_tokens": 1509636.0, "step": 625 }, { "entropy": 6.5351167678833, "epoch": 0.04050665466469491, "grad_norm": 1.328125, "learning_rate": 0.0003145, "loss": 6.275, "mean_token_accuracy": 0.1357012614607811, "num_tokens": 1523039.0, "step": 630 }, { "entropy": 6.681251955032349, "epoch": 0.04082813605092265, "grad_norm": 1.5390625, "learning_rate": 0.000317, "loss": 6.462, "mean_token_accuracy": 0.1307701699435711, "num_tokens": 1535491.0, "step": 635 }, { "entropy": 6.573398780822754, "epoch": 0.04114961743715039, "grad_norm": 1.1484375, "learning_rate": 0.0003195, "loss": 6.3801, "mean_token_accuracy": 0.1338098555803299, "num_tokens": 1547246.0, "step": 640 }, { "entropy": 6.517386150360108, "epoch": 0.04147109882337813, "grad_norm": 1.1796875, "learning_rate": 0.000322, "loss": 6.3681, "mean_token_accuracy": 0.13089857250452042, "num_tokens": 1558948.0, "step": 645 }, { "entropy": 6.385404205322265, "epoch": 0.04179258020960586, "grad_norm": 1.234375, "learning_rate": 0.00032450000000000003, "loss": 6.1454, "mean_token_accuracy": 0.14710128009319307, "num_tokens": 1571590.0, "step": 650 }, { "entropy": 6.57061071395874, "epoch": 0.0421140615958336, "grad_norm": 1.359375, "learning_rate": 0.00032700000000000003, "loss": 6.3653, "mean_token_accuracy": 0.13029702976346016, "num_tokens": 1582646.0, "step": 655 }, { "entropy": 6.511111783981323, "epoch": 0.04243554298206134, "grad_norm": 1.2734375, "learning_rate": 0.00032950000000000004, "loss": 6.3366, "mean_token_accuracy": 0.1331264428794384, "num_tokens": 1595393.0, "step": 660 }, { "entropy": 6.534172296524048, "epoch": 0.04275702436828908, "grad_norm": 1.265625, "learning_rate": 0.00033200000000000005, "loss": 6.2452, "mean_token_accuracy": 0.1425113245844841, "num_tokens": 1607048.0, "step": 665 }, { "entropy": 6.477965927124023, "epoch": 0.04307850575451681, "grad_norm": 1.171875, "learning_rate": 0.00033450000000000005, "loss": 6.3561, "mean_token_accuracy": 0.1270718276500702, "num_tokens": 1619572.0, "step": 670 }, { "entropy": 6.498306322097778, "epoch": 0.04339998714074455, "grad_norm": 1.2421875, "learning_rate": 0.000337, "loss": 6.2793, "mean_token_accuracy": 0.13934960663318635, "num_tokens": 1631342.0, "step": 675 }, { "entropy": 6.433896446228028, "epoch": 0.04372146852697229, "grad_norm": 1.046875, "learning_rate": 0.0003395, "loss": 6.1508, "mean_token_accuracy": 0.13693220615386964, "num_tokens": 1644192.0, "step": 680 }, { "entropy": 6.489602184295654, "epoch": 0.04404294991320003, "grad_norm": 1.3125, "learning_rate": 0.000342, "loss": 6.2703, "mean_token_accuracy": 0.13389810174703598, "num_tokens": 1656080.0, "step": 685 }, { "entropy": 6.489486837387085, "epoch": 0.04436443129942776, "grad_norm": 1.25, "learning_rate": 0.00034449999999999997, "loss": 6.3579, "mean_token_accuracy": 0.12244990542531013, "num_tokens": 1669649.0, "step": 690 }, { "entropy": 6.511112546920776, "epoch": 0.0446859126856555, "grad_norm": 1.375, "learning_rate": 0.000347, "loss": 6.2022, "mean_token_accuracy": 0.14107420817017555, "num_tokens": 1680722.0, "step": 695 }, { "entropy": 6.397607707977295, "epoch": 0.045007394071883235, "grad_norm": 1.125, "learning_rate": 0.0003495, "loss": 6.2983, "mean_token_accuracy": 0.13322234600782396, "num_tokens": 1693477.0, "step": 700 }, { "entropy": 6.38734073638916, "epoch": 0.04532887545811098, "grad_norm": 1.1328125, "learning_rate": 0.000352, "loss": 6.171, "mean_token_accuracy": 0.1422523781657219, "num_tokens": 1705823.0, "step": 705 }, { "entropy": 6.481168746948242, "epoch": 0.04565035684433871, "grad_norm": 1.171875, "learning_rate": 0.0003545, "loss": 6.2632, "mean_token_accuracy": 0.1387391321361065, "num_tokens": 1717339.0, "step": 710 }, { "entropy": 6.444924449920654, "epoch": 0.04597183823056645, "grad_norm": 1.234375, "learning_rate": 0.000357, "loss": 6.2882, "mean_token_accuracy": 0.13487135022878646, "num_tokens": 1729407.0, "step": 715 }, { "entropy": 6.4324631690979, "epoch": 0.046293319616794185, "grad_norm": 1.2109375, "learning_rate": 0.0003595, "loss": 6.23, "mean_token_accuracy": 0.13380146771669388, "num_tokens": 1741876.0, "step": 720 }, { "entropy": 6.5164624691009525, "epoch": 0.04661480100302193, "grad_norm": 1.28125, "learning_rate": 0.000362, "loss": 6.3743, "mean_token_accuracy": 0.13089932277798652, "num_tokens": 1755751.0, "step": 725 }, { "entropy": 6.316082906723023, "epoch": 0.04693628238924966, "grad_norm": 1.1328125, "learning_rate": 0.0003645, "loss": 6.1251, "mean_token_accuracy": 0.1419507682323456, "num_tokens": 1766711.0, "step": 730 }, { "entropy": 6.389323043823242, "epoch": 0.0472577637754774, "grad_norm": 1.1015625, "learning_rate": 0.000367, "loss": 6.2938, "mean_token_accuracy": 0.1291450999677181, "num_tokens": 1781099.0, "step": 735 }, { "entropy": 6.442297554016113, "epoch": 0.047579245161705135, "grad_norm": 1.1328125, "learning_rate": 0.0003695, "loss": 6.2682, "mean_token_accuracy": 0.13379616662859917, "num_tokens": 1793964.0, "step": 740 }, { "entropy": 6.397593879699707, "epoch": 0.04790072654793288, "grad_norm": 1.1796875, "learning_rate": 0.000372, "loss": 6.2867, "mean_token_accuracy": 0.1336559273302555, "num_tokens": 1806013.0, "step": 745 }, { "entropy": 6.446059608459473, "epoch": 0.04822220793416061, "grad_norm": 1.234375, "learning_rate": 0.0003745, "loss": 6.2542, "mean_token_accuracy": 0.13310810253024102, "num_tokens": 1819486.0, "step": 750 }, { "entropy": 6.396366977691651, "epoch": 0.04854368932038835, "grad_norm": 1.078125, "learning_rate": 0.000377, "loss": 6.157, "mean_token_accuracy": 0.14047788679599763, "num_tokens": 1830707.0, "step": 755 }, { "entropy": 6.503454113006592, "epoch": 0.048865170706616085, "grad_norm": 1.25, "learning_rate": 0.0003795, "loss": 6.3697, "mean_token_accuracy": 0.13691184893250466, "num_tokens": 1842601.0, "step": 760 }, { "entropy": 6.312630748748779, "epoch": 0.04918665209284383, "grad_norm": 1.125, "learning_rate": 0.000382, "loss": 6.1828, "mean_token_accuracy": 0.14070570841431618, "num_tokens": 1854989.0, "step": 765 }, { "entropy": 6.414206504821777, "epoch": 0.04950813347907156, "grad_norm": 1.1640625, "learning_rate": 0.0003845, "loss": 6.3074, "mean_token_accuracy": 0.13653882518410682, "num_tokens": 1867613.0, "step": 770 }, { "entropy": 6.276795244216919, "epoch": 0.0498296148652993, "grad_norm": 1.1640625, "learning_rate": 0.00038700000000000003, "loss": 6.1191, "mean_token_accuracy": 0.13717029318213464, "num_tokens": 1879203.0, "step": 775 }, { "entropy": 6.476358842849732, "epoch": 0.050151096251527034, "grad_norm": 1.1484375, "learning_rate": 0.00038950000000000003, "loss": 6.2908, "mean_token_accuracy": 0.13173450976610185, "num_tokens": 1892402.0, "step": 780 }, { "entropy": 6.431379938125611, "epoch": 0.05047257763775478, "grad_norm": 1.1484375, "learning_rate": 0.00039200000000000004, "loss": 6.2817, "mean_token_accuracy": 0.1349482476711273, "num_tokens": 1904777.0, "step": 785 }, { "entropy": 6.474689769744873, "epoch": 0.05079405902398251, "grad_norm": 1.234375, "learning_rate": 0.00039450000000000005, "loss": 6.298, "mean_token_accuracy": 0.1384157918393612, "num_tokens": 1915303.0, "step": 790 }, { "entropy": 6.269231557846069, "epoch": 0.05111554041021025, "grad_norm": 1.21875, "learning_rate": 0.00039700000000000005, "loss": 6.1327, "mean_token_accuracy": 0.14020086377859114, "num_tokens": 1927440.0, "step": 795 }, { "entropy": 6.362684345245361, "epoch": 0.051437021796437984, "grad_norm": 1.1015625, "learning_rate": 0.0003995, "loss": 6.2415, "mean_token_accuracy": 0.1398440882563591, "num_tokens": 1939028.0, "step": 800 }, { "entropy": 6.280197715759277, "epoch": 0.05175850318266572, "grad_norm": 1.234375, "learning_rate": 0.000402, "loss": 6.0433, "mean_token_accuracy": 0.14686343744397162, "num_tokens": 1949002.0, "step": 805 }, { "entropy": 6.271064138412475, "epoch": 0.05207998456889346, "grad_norm": 1.1640625, "learning_rate": 0.0004045, "loss": 6.1302, "mean_token_accuracy": 0.14056000709533692, "num_tokens": 1960724.0, "step": 810 }, { "entropy": 6.333314228057861, "epoch": 0.0524014659551212, "grad_norm": 1.2890625, "learning_rate": 0.00040699999999999997, "loss": 6.1935, "mean_token_accuracy": 0.14521595910191537, "num_tokens": 1972874.0, "step": 815 }, { "entropy": 6.234599685668945, "epoch": 0.052722947341348934, "grad_norm": 1.1796875, "learning_rate": 0.0004095, "loss": 6.1707, "mean_token_accuracy": 0.14037029147148133, "num_tokens": 1985303.0, "step": 820 }, { "entropy": 6.37439193725586, "epoch": 0.05304442872757667, "grad_norm": 1.25, "learning_rate": 0.000412, "loss": 6.1889, "mean_token_accuracy": 0.13971048817038537, "num_tokens": 1996460.0, "step": 825 }, { "entropy": 6.274216079711914, "epoch": 0.05336591011380441, "grad_norm": 1.1796875, "learning_rate": 0.0004145, "loss": 6.1947, "mean_token_accuracy": 0.1401621311903, "num_tokens": 2008237.0, "step": 830 }, { "entropy": 6.357626676559448, "epoch": 0.05368739150003215, "grad_norm": 1.078125, "learning_rate": 0.000417, "loss": 6.2056, "mean_token_accuracy": 0.14124378859996795, "num_tokens": 2020207.0, "step": 835 }, { "entropy": 6.399210500717163, "epoch": 0.054008872886259884, "grad_norm": 1.2890625, "learning_rate": 0.0004195, "loss": 6.2052, "mean_token_accuracy": 0.13477759659290314, "num_tokens": 2031521.0, "step": 840 }, { "entropy": 6.193907642364502, "epoch": 0.05433035427248762, "grad_norm": 1.2421875, "learning_rate": 0.000422, "loss": 6.1833, "mean_token_accuracy": 0.14332185834646224, "num_tokens": 2043455.0, "step": 845 }, { "entropy": 6.290856456756591, "epoch": 0.05465183565871536, "grad_norm": 1.171875, "learning_rate": 0.0004245, "loss": 6.0968, "mean_token_accuracy": 0.1420198529958725, "num_tokens": 2055173.0, "step": 850 }, { "entropy": 6.214458036422729, "epoch": 0.0549733170449431, "grad_norm": 1.078125, "learning_rate": 0.000427, "loss": 6.0947, "mean_token_accuracy": 0.14887833148241042, "num_tokens": 2066734.0, "step": 855 }, { "entropy": 6.393264627456665, "epoch": 0.055294798431170834, "grad_norm": 1.1796875, "learning_rate": 0.0004295, "loss": 6.2541, "mean_token_accuracy": 0.14005839601159095, "num_tokens": 2078000.0, "step": 860 }, { "entropy": 6.217451190948486, "epoch": 0.05561627981739857, "grad_norm": 1.140625, "learning_rate": 0.000432, "loss": 6.2153, "mean_token_accuracy": 0.13525466695427896, "num_tokens": 2090853.0, "step": 865 }, { "entropy": 6.310794544219971, "epoch": 0.05593776120362631, "grad_norm": 1.25, "learning_rate": 0.0004345, "loss": 6.1726, "mean_token_accuracy": 0.14037225544452667, "num_tokens": 2102077.0, "step": 870 }, { "entropy": 6.211489582061768, "epoch": 0.05625924258985405, "grad_norm": 1.1875, "learning_rate": 0.000437, "loss": 6.1747, "mean_token_accuracy": 0.1440899945795536, "num_tokens": 2114102.0, "step": 875 }, { "entropy": 6.246618223190308, "epoch": 0.056580723976081784, "grad_norm": 1.1328125, "learning_rate": 0.0004395, "loss": 6.0766, "mean_token_accuracy": 0.14916536808013917, "num_tokens": 2125155.0, "step": 880 }, { "entropy": 6.187794494628906, "epoch": 0.05690220536230952, "grad_norm": 1.078125, "learning_rate": 0.000442, "loss": 6.0123, "mean_token_accuracy": 0.14380064085125924, "num_tokens": 2136501.0, "step": 885 }, { "entropy": 6.287271547317505, "epoch": 0.05722368674853726, "grad_norm": 1.15625, "learning_rate": 0.0004445, "loss": 6.123, "mean_token_accuracy": 0.14168170243501663, "num_tokens": 2149142.0, "step": 890 }, { "entropy": 6.151324510574341, "epoch": 0.057545168134765, "grad_norm": 1.0703125, "learning_rate": 0.000447, "loss": 6.0491, "mean_token_accuracy": 0.1520587220788002, "num_tokens": 2161548.0, "step": 895 }, { "entropy": 6.17026720046997, "epoch": 0.057866649520992734, "grad_norm": 1.2109375, "learning_rate": 0.00044950000000000003, "loss": 6.0992, "mean_token_accuracy": 0.14536573886871337, "num_tokens": 2174109.0, "step": 900 }, { "entropy": 6.23137092590332, "epoch": 0.05818813090722047, "grad_norm": 1.0625, "learning_rate": 0.00045200000000000004, "loss": 6.0609, "mean_token_accuracy": 0.148177433013916, "num_tokens": 2186559.0, "step": 905 }, { "entropy": 6.133806419372559, "epoch": 0.05850961229344821, "grad_norm": 1.0390625, "learning_rate": 0.00045450000000000004, "loss": 6.0904, "mean_token_accuracy": 0.1488359734416008, "num_tokens": 2199397.0, "step": 910 }, { "entropy": 6.120911741256714, "epoch": 0.05883109367967595, "grad_norm": 1.1015625, "learning_rate": 0.00045700000000000005, "loss": 6.0926, "mean_token_accuracy": 0.14603182077407836, "num_tokens": 2211176.0, "step": 915 }, { "entropy": 6.178542375564575, "epoch": 0.059152575065903684, "grad_norm": 1.125, "learning_rate": 0.00045950000000000006, "loss": 6.0374, "mean_token_accuracy": 0.14843914732337, "num_tokens": 2223661.0, "step": 920 }, { "entropy": 6.141402244567871, "epoch": 0.05947405645213142, "grad_norm": 1.1953125, "learning_rate": 0.000462, "loss": 5.9833, "mean_token_accuracy": 0.1485615387558937, "num_tokens": 2233609.0, "step": 925 }, { "entropy": 6.1305849075317385, "epoch": 0.059795537838359156, "grad_norm": 1.296875, "learning_rate": 0.0004645, "loss": 6.0887, "mean_token_accuracy": 0.14092008024454117, "num_tokens": 2245791.0, "step": 930 }, { "entropy": 6.160067701339722, "epoch": 0.0601170192245869, "grad_norm": 1.125, "learning_rate": 0.000467, "loss": 5.985, "mean_token_accuracy": 0.14546338021755217, "num_tokens": 2258640.0, "step": 935 }, { "entropy": 6.0953703880310055, "epoch": 0.060438500610814634, "grad_norm": 1.1875, "learning_rate": 0.0004695, "loss": 6.1128, "mean_token_accuracy": 0.1390805184841156, "num_tokens": 2270487.0, "step": 940 }, { "entropy": 6.220357513427734, "epoch": 0.06075998199704237, "grad_norm": 1.3671875, "learning_rate": 0.000472, "loss": 6.1361, "mean_token_accuracy": 0.14055786430835723, "num_tokens": 2283852.0, "step": 945 }, { "entropy": 6.184080171585083, "epoch": 0.061081463383270106, "grad_norm": 1.0859375, "learning_rate": 0.0004745, "loss": 6.1019, "mean_token_accuracy": 0.14241984188556672, "num_tokens": 2295351.0, "step": 950 }, { "entropy": 6.220605707168579, "epoch": 0.06140294476949785, "grad_norm": 1.2890625, "learning_rate": 0.000477, "loss": 6.1138, "mean_token_accuracy": 0.14031047970056534, "num_tokens": 2307723.0, "step": 955 }, { "entropy": 6.107544422149658, "epoch": 0.061724426155725584, "grad_norm": 1.109375, "learning_rate": 0.0004795, "loss": 6.0061, "mean_token_accuracy": 0.15316852182149887, "num_tokens": 2320273.0, "step": 960 }, { "entropy": 6.061391162872314, "epoch": 0.06204590754195332, "grad_norm": 1.1328125, "learning_rate": 0.000482, "loss": 6.0488, "mean_token_accuracy": 0.1479623332619667, "num_tokens": 2332142.0, "step": 965 }, { "entropy": 6.121192121505738, "epoch": 0.062367388928181056, "grad_norm": 1.109375, "learning_rate": 0.0004845, "loss": 6.1216, "mean_token_accuracy": 0.14394108653068544, "num_tokens": 2346027.0, "step": 970 }, { "entropy": 6.268273067474365, "epoch": 0.0626888703144088, "grad_norm": 1.1328125, "learning_rate": 0.000487, "loss": 6.1047, "mean_token_accuracy": 0.14543917924165725, "num_tokens": 2357606.0, "step": 975 }, { "entropy": 6.144370889663696, "epoch": 0.06301035170063653, "grad_norm": 1.171875, "learning_rate": 0.0004895, "loss": 6.0691, "mean_token_accuracy": 0.15553061664104462, "num_tokens": 2369122.0, "step": 980 }, { "entropy": 6.0663927555084225, "epoch": 0.06333183308686427, "grad_norm": 1.203125, "learning_rate": 0.000492, "loss": 5.9741, "mean_token_accuracy": 0.14964642524719238, "num_tokens": 2380313.0, "step": 985 }, { "entropy": 6.227567052841186, "epoch": 0.06365331447309201, "grad_norm": 1.21875, "learning_rate": 0.0004945, "loss": 6.1716, "mean_token_accuracy": 0.14222114831209182, "num_tokens": 2392535.0, "step": 990 }, { "entropy": 6.186703300476074, "epoch": 0.06397479585931974, "grad_norm": 1.1796875, "learning_rate": 0.000497, "loss": 6.1004, "mean_token_accuracy": 0.14114162400364877, "num_tokens": 2404878.0, "step": 995 }, { "entropy": 5.979404878616333, "epoch": 0.06429627724554748, "grad_norm": 1.203125, "learning_rate": 0.0004995, "loss": 5.9674, "mean_token_accuracy": 0.15570546686649323, "num_tokens": 2416656.0, "step": 1000 }, { "entropy": 6.131570148468017, "epoch": 0.06461775863177523, "grad_norm": 1.0546875, "learning_rate": 0.000499998026082006, "loss": 6.0697, "mean_token_accuracy": 0.14331030026078223, "num_tokens": 2428666.0, "step": 1005 }, { "entropy": 6.082760858535766, "epoch": 0.06493924001800296, "grad_norm": 1.1796875, "learning_rate": 0.0004999900070995136, "loss": 5.9821, "mean_token_accuracy": 0.14666880816221237, "num_tokens": 2440183.0, "step": 1010 }, { "entropy": 6.047522735595703, "epoch": 0.0652607214042307, "grad_norm": 1.1875, "learning_rate": 0.0004999758199023239, "loss": 5.9758, "mean_token_accuracy": 0.1448635384440422, "num_tokens": 2452380.0, "step": 1015 }, { "entropy": 6.1754053115844725, "epoch": 0.06558220279045843, "grad_norm": 1.0234375, "learning_rate": 0.0004999554648793858, "loss": 6.1724, "mean_token_accuracy": 0.13734461218118668, "num_tokens": 2466418.0, "step": 1020 }, { "entropy": 6.04567289352417, "epoch": 0.06590368417668617, "grad_norm": 1.109375, "learning_rate": 0.0004999289425887425, "loss": 5.9287, "mean_token_accuracy": 0.15203241556882857, "num_tokens": 2478900.0, "step": 1025 }, { "entropy": 6.053248310089112, "epoch": 0.06622516556291391, "grad_norm": 1.125, "learning_rate": 0.0004998962537575161, "loss": 6.045, "mean_token_accuracy": 0.148047599196434, "num_tokens": 2491059.0, "step": 1030 }, { "entropy": 6.017193412780761, "epoch": 0.06654664694914164, "grad_norm": 1.0, "learning_rate": 0.0004998573992818874, "loss": 5.9798, "mean_token_accuracy": 0.14830705970525743, "num_tokens": 2503090.0, "step": 1035 }, { "entropy": 6.13506236076355, "epoch": 0.06686812833536938, "grad_norm": 1.125, "learning_rate": 0.0004998123802270715, "loss": 6.0624, "mean_token_accuracy": 0.14565887302160263, "num_tokens": 2513716.0, "step": 1040 }, { "entropy": 6.0360674381256105, "epoch": 0.06718960972159711, "grad_norm": 1.078125, "learning_rate": 0.0004997611978272886, "loss": 5.993, "mean_token_accuracy": 0.14915986061096193, "num_tokens": 2526295.0, "step": 1045 }, { "entropy": 6.198660039901734, "epoch": 0.06751109110782486, "grad_norm": 1.1640625, "learning_rate": 0.0004997038534857298, "loss": 6.0814, "mean_token_accuracy": 0.15200572162866594, "num_tokens": 2538026.0, "step": 1050 }, { "entropy": 5.9910167217254635, "epoch": 0.0678325724940526, "grad_norm": 1.1953125, "learning_rate": 0.0004996403487745194, "loss": 6.0296, "mean_token_accuracy": 0.15086221992969512, "num_tokens": 2549041.0, "step": 1055 }, { "entropy": 6.046800327301026, "epoch": 0.06815405388028033, "grad_norm": 1.1328125, "learning_rate": 0.000499570685434671, "loss": 5.9684, "mean_token_accuracy": 0.1474734902381897, "num_tokens": 2561843.0, "step": 1060 }, { "entropy": 6.205523538589477, "epoch": 0.06847553526650807, "grad_norm": 1.1484375, "learning_rate": 0.0004994948653760405, "loss": 6.0398, "mean_token_accuracy": 0.14417608752846717, "num_tokens": 2573834.0, "step": 1065 }, { "entropy": 5.971171236038208, "epoch": 0.06879701665273581, "grad_norm": 1.2265625, "learning_rate": 0.0004994128906772729, "loss": 6.0599, "mean_token_accuracy": 0.14551517516374587, "num_tokens": 2584577.0, "step": 1070 }, { "entropy": 6.047037506103516, "epoch": 0.06911849803896354, "grad_norm": 1.03125, "learning_rate": 0.000499324763585746, "loss": 5.8624, "mean_token_accuracy": 0.15329598784446716, "num_tokens": 2596511.0, "step": 1075 }, { "entropy": 6.0283167362213135, "epoch": 0.06943997942519128, "grad_norm": 1.015625, "learning_rate": 0.0004992304865175085, "loss": 6.1011, "mean_token_accuracy": 0.13929441571235657, "num_tokens": 2608338.0, "step": 1080 }, { "entropy": 6.150647974014282, "epoch": 0.06976146081141901, "grad_norm": 1.1171875, "learning_rate": 0.0004991300620572138, "loss": 6.0309, "mean_token_accuracy": 0.14640165865421295, "num_tokens": 2620081.0, "step": 1085 }, { "entropy": 6.081988954544068, "epoch": 0.07008294219764676, "grad_norm": 1.140625, "learning_rate": 0.0004990234929580494, "loss": 6.0573, "mean_token_accuracy": 0.1486335054039955, "num_tokens": 2633153.0, "step": 1090 }, { "entropy": 6.000927066802978, "epoch": 0.0704044235838745, "grad_norm": 1.1875, "learning_rate": 0.0004989107821416609, "loss": 5.9712, "mean_token_accuracy": 0.15533942133188247, "num_tokens": 2645055.0, "step": 1095 }, { "entropy": 6.027195119857788, "epoch": 0.07072590497010223, "grad_norm": 0.98828125, "learning_rate": 0.0004987919326980723, "loss": 5.9591, "mean_token_accuracy": 0.15612911731004714, "num_tokens": 2657798.0, "step": 1100 }, { "entropy": 6.064033794403076, "epoch": 0.07104738635632997, "grad_norm": 1.0703125, "learning_rate": 0.0004986669478856011, "loss": 6.0374, "mean_token_accuracy": 0.1481868341565132, "num_tokens": 2669095.0, "step": 1105 }, { "entropy": 6.00915265083313, "epoch": 0.07136886774255771, "grad_norm": 1.078125, "learning_rate": 0.0004985358311307688, "loss": 5.9295, "mean_token_accuracy": 0.15585425943136216, "num_tokens": 2680533.0, "step": 1110 }, { "entropy": 5.918936729431152, "epoch": 0.07169034912878544, "grad_norm": 1.0390625, "learning_rate": 0.0004983985860282081, "loss": 5.9625, "mean_token_accuracy": 0.15213698893785477, "num_tokens": 2694164.0, "step": 1115 }, { "entropy": 6.044512939453125, "epoch": 0.07201183051501318, "grad_norm": 0.99609375, "learning_rate": 0.0004982552163405623, "loss": 5.9524, "mean_token_accuracy": 0.15045837461948394, "num_tokens": 2705709.0, "step": 1120 }, { "entropy": 5.989704370498657, "epoch": 0.07233331190124091, "grad_norm": 1.15625, "learning_rate": 0.0004981057259983839, "loss": 5.9315, "mean_token_accuracy": 0.15283386409282684, "num_tokens": 2716682.0, "step": 1125 }, { "entropy": 6.015498065948487, "epoch": 0.07265479328746866, "grad_norm": 1.1171875, "learning_rate": 0.0004979501191000262, "loss": 5.9614, "mean_token_accuracy": 0.14785169959068298, "num_tokens": 2728336.0, "step": 1130 }, { "entropy": 6.004105854034424, "epoch": 0.0729762746736964, "grad_norm": 1.15625, "learning_rate": 0.0004977883999115311, "loss": 5.87, "mean_token_accuracy": 0.15776137113571168, "num_tokens": 2740588.0, "step": 1135 }, { "entropy": 5.9899965763092045, "epoch": 0.07329775605992413, "grad_norm": 1.0390625, "learning_rate": 0.0004976205728665113, "loss": 5.8805, "mean_token_accuracy": 0.15943353474140168, "num_tokens": 2751202.0, "step": 1140 }, { "entropy": 5.944920206069947, "epoch": 0.07361923744615187, "grad_norm": 1.046875, "learning_rate": 0.0004974466425660307, "loss": 5.9115, "mean_token_accuracy": 0.1539611354470253, "num_tokens": 2763200.0, "step": 1145 }, { "entropy": 6.040285301208496, "epoch": 0.0739407188323796, "grad_norm": 1.0703125, "learning_rate": 0.0004972666137784759, "loss": 5.974, "mean_token_accuracy": 0.15454887896776198, "num_tokens": 2774775.0, "step": 1150 }, { "entropy": 5.945583248138428, "epoch": 0.07426220021860734, "grad_norm": 1.078125, "learning_rate": 0.0004970804914394271, "loss": 6.0287, "mean_token_accuracy": 0.14280334562063218, "num_tokens": 2787502.0, "step": 1155 }, { "entropy": 6.00298547744751, "epoch": 0.07458368160483508, "grad_norm": 1.09375, "learning_rate": 0.0004968882806515225, "loss": 5.9359, "mean_token_accuracy": 0.15349582582712173, "num_tokens": 2799054.0, "step": 1160 }, { "entropy": 6.0210652351379395, "epoch": 0.07490516299106281, "grad_norm": 1.015625, "learning_rate": 0.0004966899866843177, "loss": 6.058, "mean_token_accuracy": 0.1467377468943596, "num_tokens": 2813068.0, "step": 1165 }, { "entropy": 6.088579320907593, "epoch": 0.07522664437729056, "grad_norm": 1.1640625, "learning_rate": 0.000496485614974142, "loss": 5.9565, "mean_token_accuracy": 0.15020860433578492, "num_tokens": 2826341.0, "step": 1170 }, { "entropy": 5.9464997291564945, "epoch": 0.0755481257635183, "grad_norm": 1.2109375, "learning_rate": 0.0004962751711239492, "loss": 5.9512, "mean_token_accuracy": 0.15311693847179414, "num_tokens": 2838963.0, "step": 1175 }, { "entropy": 5.974170589447022, "epoch": 0.07586960714974603, "grad_norm": 1.1484375, "learning_rate": 0.0004960586609031636, "loss": 5.889, "mean_token_accuracy": 0.15449528396129608, "num_tokens": 2851092.0, "step": 1180 }, { "entropy": 5.957883977890015, "epoch": 0.07619108853597377, "grad_norm": 1.0234375, "learning_rate": 0.0004958360902475224, "loss": 5.9172, "mean_token_accuracy": 0.15734134763479232, "num_tokens": 2863779.0, "step": 1185 }, { "entropy": 5.981568813323975, "epoch": 0.0765125699222015, "grad_norm": 1.0390625, "learning_rate": 0.0004956074652589125, "loss": 5.9832, "mean_token_accuracy": 0.14990866780281067, "num_tokens": 2875827.0, "step": 1190 }, { "entropy": 6.0756574153900145, "epoch": 0.07683405130842924, "grad_norm": 1.1328125, "learning_rate": 0.0004953727922052035, "loss": 5.9535, "mean_token_accuracy": 0.15205546617507934, "num_tokens": 2887881.0, "step": 1195 }, { "entropy": 5.79099817276001, "epoch": 0.07715553269465698, "grad_norm": 0.96875, "learning_rate": 0.0004951320775200756, "loss": 5.7883, "mean_token_accuracy": 0.16018587499856948, "num_tokens": 2899607.0, "step": 1200 }, { "entropy": 5.921677541732788, "epoch": 0.07747701408088471, "grad_norm": 1.1796875, "learning_rate": 0.0004948853278028436, "loss": 5.8504, "mean_token_accuracy": 0.16271332800388336, "num_tokens": 2911423.0, "step": 1205 }, { "entropy": 5.973179960250855, "epoch": 0.07779849546711246, "grad_norm": 1.046875, "learning_rate": 0.0004946325498182755, "loss": 5.9826, "mean_token_accuracy": 0.1474372811615467, "num_tokens": 2925360.0, "step": 1210 }, { "entropy": 5.986533498764038, "epoch": 0.0781199768533402, "grad_norm": 1.0234375, "learning_rate": 0.0004943737504964076, "loss": 5.9135, "mean_token_accuracy": 0.15541508048772812, "num_tokens": 2937760.0, "step": 1215 }, { "entropy": 5.93227252960205, "epoch": 0.07844145823956793, "grad_norm": 1.0859375, "learning_rate": 0.000494108936932354, "loss": 5.8858, "mean_token_accuracy": 0.1571711130440235, "num_tokens": 2950439.0, "step": 1220 }, { "entropy": 5.980891752243042, "epoch": 0.07876293962579567, "grad_norm": 1.078125, "learning_rate": 0.0004938381163861124, "loss": 6.0019, "mean_token_accuracy": 0.14415771514177322, "num_tokens": 2962664.0, "step": 1225 }, { "entropy": 5.912642574310302, "epoch": 0.0790844210120234, "grad_norm": 0.9921875, "learning_rate": 0.0004935612962823645, "loss": 5.8901, "mean_token_accuracy": 0.14896751940250397, "num_tokens": 2974490.0, "step": 1230 }, { "entropy": 5.9863615989685055, "epoch": 0.07940590239825114, "grad_norm": 0.99609375, "learning_rate": 0.0004932784842102739, "loss": 5.8578, "mean_token_accuracy": 0.15844571143388747, "num_tokens": 2987204.0, "step": 1235 }, { "entropy": 5.931177091598511, "epoch": 0.07972738378447888, "grad_norm": 1.0546875, "learning_rate": 0.0004929896879232758, "loss": 5.9587, "mean_token_accuracy": 0.15941362082958221, "num_tokens": 2998803.0, "step": 1240 }, { "entropy": 6.034020185470581, "epoch": 0.08004886517070661, "grad_norm": 1.1328125, "learning_rate": 0.0004926949153388668, "loss": 5.9113, "mean_token_accuracy": 0.16112966537475587, "num_tokens": 3009699.0, "step": 1245 }, { "entropy": 5.827797842025757, "epoch": 0.08037034655693436, "grad_norm": 1.1875, "learning_rate": 0.0004923941745383859, "loss": 5.8776, "mean_token_accuracy": 0.15954455733299255, "num_tokens": 3020917.0, "step": 1250 }, { "entropy": 5.888133430480957, "epoch": 0.0806918279431621, "grad_norm": 1.171875, "learning_rate": 0.000492087473766794, "loss": 5.822, "mean_token_accuracy": 0.1551064595580101, "num_tokens": 3033456.0, "step": 1255 }, { "entropy": 5.953010511398316, "epoch": 0.08101330932938983, "grad_norm": 1.09375, "learning_rate": 0.000491774821432448, "loss": 6.0025, "mean_token_accuracy": 0.1459315836429596, "num_tokens": 3046176.0, "step": 1260 }, { "entropy": 6.070719385147095, "epoch": 0.08133479071561757, "grad_norm": 1.0390625, "learning_rate": 0.0004914562261068693, "loss": 6.0235, "mean_token_accuracy": 0.14801203310489655, "num_tokens": 3057842.0, "step": 1265 }, { "entropy": 5.827595949172974, "epoch": 0.0816562721018453, "grad_norm": 1.0859375, "learning_rate": 0.0004911316965245098, "loss": 5.8042, "mean_token_accuracy": 0.15811493024230003, "num_tokens": 3068571.0, "step": 1270 }, { "entropy": 5.937068367004395, "epoch": 0.08197775348807304, "grad_norm": 1.0234375, "learning_rate": 0.000490801241582512, "loss": 5.8381, "mean_token_accuracy": 0.15550213009119035, "num_tokens": 3081008.0, "step": 1275 }, { "entropy": 5.899820041656494, "epoch": 0.08229923487430078, "grad_norm": 1.140625, "learning_rate": 0.000490464870340465, "loss": 5.8374, "mean_token_accuracy": 0.15941650569438934, "num_tokens": 3092520.0, "step": 1280 }, { "entropy": 6.013044977188111, "epoch": 0.08262071626052851, "grad_norm": 1.0234375, "learning_rate": 0.0004901225920201563, "loss": 6.0298, "mean_token_accuracy": 0.14632659628987313, "num_tokens": 3104994.0, "step": 1285 }, { "entropy": 5.8788024425506595, "epoch": 0.08294219764675625, "grad_norm": 1.109375, "learning_rate": 0.000489774416005319, "loss": 5.8462, "mean_token_accuracy": 0.16421037614345552, "num_tokens": 3116630.0, "step": 1290 }, { "entropy": 5.873007440567017, "epoch": 0.08326367903298398, "grad_norm": 0.97265625, "learning_rate": 0.0004894203518413742, "loss": 5.9303, "mean_token_accuracy": 0.151447893679142, "num_tokens": 3130901.0, "step": 1295 }, { "entropy": 5.82794222831726, "epoch": 0.08358516041921173, "grad_norm": 0.9453125, "learning_rate": 0.0004890604092351701, "loss": 5.8033, "mean_token_accuracy": 0.16235794723033906, "num_tokens": 3142889.0, "step": 1300 }, { "entropy": 5.9552830219268795, "epoch": 0.08390664180543947, "grad_norm": 1.1328125, "learning_rate": 0.000488694598054715, "loss": 5.8747, "mean_token_accuracy": 0.15637295246124266, "num_tokens": 3155480.0, "step": 1305 }, { "entropy": 5.897818994522095, "epoch": 0.0842281231916672, "grad_norm": 1.03125, "learning_rate": 0.0004883229283289071, "loss": 5.8615, "mean_token_accuracy": 0.15762287378311157, "num_tokens": 3166741.0, "step": 1310 }, { "entropy": 5.923405933380127, "epoch": 0.08454960457789494, "grad_norm": 1.0078125, "learning_rate": 0.00048794541024725993, "loss": 5.8306, "mean_token_accuracy": 0.15558245852589608, "num_tokens": 3179642.0, "step": 1315 }, { "entropy": 5.980076599121094, "epoch": 0.08487108596412268, "grad_norm": 1.0, "learning_rate": 0.0004875620541596221, "loss": 5.9576, "mean_token_accuracy": 0.1603875309228897, "num_tokens": 3191737.0, "step": 1320 }, { "entropy": 5.860922861099243, "epoch": 0.08519256735035041, "grad_norm": 0.97265625, "learning_rate": 0.00048717287057589454, "loss": 5.7578, "mean_token_accuracy": 0.16732925772666932, "num_tokens": 3204712.0, "step": 1325 }, { "entropy": 5.753567361831665, "epoch": 0.08551404873657815, "grad_norm": 0.9765625, "learning_rate": 0.0004867778701657417, "loss": 5.75, "mean_token_accuracy": 0.16282168924808502, "num_tokens": 3217394.0, "step": 1330 }, { "entropy": 5.947368383407593, "epoch": 0.08583553012280588, "grad_norm": 1.0703125, "learning_rate": 0.00048637706375829955, "loss": 5.7708, "mean_token_accuracy": 0.16397789418697356, "num_tokens": 3228550.0, "step": 1335 }, { "entropy": 5.695276260375977, "epoch": 0.08615701150903363, "grad_norm": 0.96875, "learning_rate": 0.000485970462341878, "loss": 5.7533, "mean_token_accuracy": 0.1722976952791214, "num_tokens": 3240535.0, "step": 1340 }, { "entropy": 5.889514780044555, "epoch": 0.08647849289526137, "grad_norm": 0.99609375, "learning_rate": 0.00048555807706366044, "loss": 5.7479, "mean_token_accuracy": 0.16328693181276321, "num_tokens": 3251876.0, "step": 1345 }, { "entropy": 5.94691743850708, "epoch": 0.0867999742814891, "grad_norm": 1.125, "learning_rate": 0.00048513991922939756, "loss": 5.9076, "mean_token_accuracy": 0.15992892757058144, "num_tokens": 3264834.0, "step": 1350 }, { "entropy": 5.818387079238891, "epoch": 0.08712145566771684, "grad_norm": 1.0703125, "learning_rate": 0.00048471600030309744, "loss": 5.8792, "mean_token_accuracy": 0.15660524219274521, "num_tokens": 3276556.0, "step": 1355 }, { "entropy": 5.969724893569946, "epoch": 0.08744293705394458, "grad_norm": 1.0390625, "learning_rate": 0.00048428633190671186, "loss": 5.8032, "mean_token_accuracy": 0.15722499340772628, "num_tokens": 3288321.0, "step": 1360 }, { "entropy": 5.850950717926025, "epoch": 0.08776441844017231, "grad_norm": 1.1015625, "learning_rate": 0.0004838509258198167, "loss": 5.8833, "mean_token_accuracy": 0.15696700513362885, "num_tokens": 3301141.0, "step": 1365 }, { "entropy": 5.88807635307312, "epoch": 0.08808589982640005, "grad_norm": 1.0, "learning_rate": 0.00048340979397929, "loss": 5.8803, "mean_token_accuracy": 0.1575479254126549, "num_tokens": 3313508.0, "step": 1370 }, { "entropy": 5.93755407333374, "epoch": 0.08840738121262778, "grad_norm": 0.9609375, "learning_rate": 0.00048296294847898386, "loss": 5.8802, "mean_token_accuracy": 0.15642834603786468, "num_tokens": 3325548.0, "step": 1375 }, { "entropy": 5.744391632080078, "epoch": 0.08872886259885553, "grad_norm": 0.9921875, "learning_rate": 0.0004825104015693934, "loss": 5.7361, "mean_token_accuracy": 0.16557512432336807, "num_tokens": 3337409.0, "step": 1380 }, { "entropy": 5.877873468399048, "epoch": 0.08905034398508327, "grad_norm": 1.03125, "learning_rate": 0.0004820521656573208, "loss": 5.821, "mean_token_accuracy": 0.1637149229645729, "num_tokens": 3349083.0, "step": 1385 }, { "entropy": 5.855838871002197, "epoch": 0.089371825371311, "grad_norm": 0.8984375, "learning_rate": 0.00048158825330553505, "loss": 5.8303, "mean_token_accuracy": 0.15407798439264297, "num_tokens": 3362145.0, "step": 1390 }, { "entropy": 5.855030107498169, "epoch": 0.08969330675753874, "grad_norm": 1.046875, "learning_rate": 0.00048111867723242763, "loss": 5.7394, "mean_token_accuracy": 0.16374233812093736, "num_tokens": 3374472.0, "step": 1395 }, { "entropy": 5.829806470870972, "epoch": 0.09001478814376647, "grad_norm": 1.0546875, "learning_rate": 0.0004806434503116637, "loss": 5.7859, "mean_token_accuracy": 0.16609720289707183, "num_tokens": 3386431.0, "step": 1400 }, { "entropy": 5.832973909378052, "epoch": 0.09033626952999421, "grad_norm": 1.109375, "learning_rate": 0.0004801625855718296, "loss": 5.8267, "mean_token_accuracy": 0.15961860567331315, "num_tokens": 3398456.0, "step": 1405 }, { "entropy": 5.853139019012451, "epoch": 0.09065775091622195, "grad_norm": 1.0703125, "learning_rate": 0.00047967609619607477, "loss": 5.7703, "mean_token_accuracy": 0.1606106087565422, "num_tokens": 3409982.0, "step": 1410 }, { "entropy": 5.769105768203735, "epoch": 0.09097923230244968, "grad_norm": 0.91015625, "learning_rate": 0.0004791839955217513, "loss": 5.8455, "mean_token_accuracy": 0.16647536754608155, "num_tokens": 3423098.0, "step": 1415 }, { "entropy": 5.803284931182861, "epoch": 0.09130071368867743, "grad_norm": 0.96484375, "learning_rate": 0.00047868629704004786, "loss": 5.7682, "mean_token_accuracy": 0.16257543712854386, "num_tokens": 3435572.0, "step": 1420 }, { "entropy": 5.834441041946411, "epoch": 0.09162219507490517, "grad_norm": 1.0390625, "learning_rate": 0.00047818301439561965, "loss": 5.8178, "mean_token_accuracy": 0.15468621701002122, "num_tokens": 3448468.0, "step": 1425 }, { "entropy": 5.865490579605103, "epoch": 0.0919436764611329, "grad_norm": 0.9453125, "learning_rate": 0.00047767416138621454, "loss": 5.8036, "mean_token_accuracy": 0.15958377569913865, "num_tokens": 3460450.0, "step": 1430 }, { "entropy": 5.843794155120849, "epoch": 0.09226515784736064, "grad_norm": 0.984375, "learning_rate": 0.000477159751962295, "loss": 5.8152, "mean_token_accuracy": 0.15784975588321687, "num_tokens": 3473091.0, "step": 1435 }, { "entropy": 5.822282075881958, "epoch": 0.09258663923358837, "grad_norm": 1.0, "learning_rate": 0.00047663980022665507, "loss": 5.8186, "mean_token_accuracy": 0.16628101468086243, "num_tokens": 3484727.0, "step": 1440 }, { "entropy": 5.733294820785522, "epoch": 0.09290812061981611, "grad_norm": 0.97265625, "learning_rate": 0.00047611432043403437, "loss": 5.6566, "mean_token_accuracy": 0.16515012532472612, "num_tokens": 3497349.0, "step": 1445 }, { "entropy": 5.864885044097901, "epoch": 0.09322960200604385, "grad_norm": 1.15625, "learning_rate": 0.0004755833269907267, "loss": 5.9018, "mean_token_accuracy": 0.15037262290716172, "num_tokens": 3508879.0, "step": 1450 }, { "entropy": 5.790483570098877, "epoch": 0.09355108339227158, "grad_norm": 1.0078125, "learning_rate": 0.0004750468344541857, "loss": 5.6399, "mean_token_accuracy": 0.17022294253110887, "num_tokens": 3520524.0, "step": 1455 }, { "entropy": 5.758346796035767, "epoch": 0.09387256477849933, "grad_norm": 0.984375, "learning_rate": 0.00047450485753262525, "loss": 5.7605, "mean_token_accuracy": 0.16318226158618926, "num_tokens": 3533929.0, "step": 1460 }, { "entropy": 5.881605577468872, "epoch": 0.09419404616472707, "grad_norm": 1.1171875, "learning_rate": 0.00047395741108461633, "loss": 5.7621, "mean_token_accuracy": 0.15927200317382811, "num_tokens": 3545203.0, "step": 1465 }, { "entropy": 5.767260646820068, "epoch": 0.0945155275509548, "grad_norm": 0.8828125, "learning_rate": 0.00047340451011867985, "loss": 5.766, "mean_token_accuracy": 0.1577385514974594, "num_tokens": 3557203.0, "step": 1470 }, { "entropy": 5.910404062271118, "epoch": 0.09483700893718254, "grad_norm": 0.98046875, "learning_rate": 0.00047284616979287515, "loss": 5.7883, "mean_token_accuracy": 0.16305567175149918, "num_tokens": 3568844.0, "step": 1475 }, { "entropy": 5.790946578979492, "epoch": 0.09515849032341027, "grad_norm": 0.9609375, "learning_rate": 0.00047228240541438433, "loss": 5.7821, "mean_token_accuracy": 0.16187248080968858, "num_tokens": 3581186.0, "step": 1480 }, { "entropy": 5.703059148788452, "epoch": 0.09547997170963801, "grad_norm": 1.0234375, "learning_rate": 0.00047171323243909257, "loss": 5.7117, "mean_token_accuracy": 0.1652946338057518, "num_tokens": 3592679.0, "step": 1485 }, { "entropy": 5.940963315963745, "epoch": 0.09580145309586575, "grad_norm": 0.91015625, "learning_rate": 0.00047113866647116457, "loss": 5.8795, "mean_token_accuracy": 0.1530936285853386, "num_tokens": 3605414.0, "step": 1490 }, { "entropy": 5.716215991973877, "epoch": 0.09612293448209348, "grad_norm": 0.9921875, "learning_rate": 0.0004705587232626164, "loss": 5.7608, "mean_token_accuracy": 0.16268940567970275, "num_tokens": 3618662.0, "step": 1495 }, { "entropy": 5.727747964859009, "epoch": 0.09644441586832123, "grad_norm": 1.03125, "learning_rate": 0.00046997341871288424, "loss": 5.6715, "mean_token_accuracy": 0.17156911194324492, "num_tokens": 3629721.0, "step": 1500 } ], "logging_steps": 5, "max_steps": 4000, "num_input_tokens_seen": 0, "num_train_epochs": 1, "save_steps": 500, "stateful_callbacks": { "TrainerControl": { "args": { "should_epoch_stop": false, "should_evaluate": false, "should_log": false, "should_save": true, "should_training_stop": false }, "attributes": {} } }, "total_flos": 5564164829184000.0, "train_batch_size": 16, "trial_name": null, "trial_params": null }